{ "best_metric": 0.21195410192012787, "best_model_checkpoint": "models/qwen2.5-3b-dpo-finegrained/checkpoint-10000", "epoch": 1.0, "eval_steps": 5000, "global_step": 13853, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 7.218652999350322e-05, "grad_norm": 1.852354340577762, "learning_rate": 3.6075036075036073e-10, "logits/chosen": -2.59375, "logits/rejected": -1.6015625, "logps/chosen": -146.0, "logps/rejected": -166.0, "loss": 0.6914, "rewards/accuracies": 0.0, "rewards/chosen": 0.0, "rewards/margins": 0.0, "rewards/rejected": 0.0, "step": 1 }, { "epoch": 0.0007218652999350321, "grad_norm": 1.998199384338708, "learning_rate": 3.6075036075036073e-09, "logits/chosen": -2.265625, "logits/rejected": -1.953125, "logps/chosen": -157.0, "logps/rejected": -143.0, "loss": 0.6922, "rewards/accuracies": 0.2638888955116272, "rewards/chosen": 0.000766754150390625, "rewards/margins": 0.000606536865234375, "rewards/rejected": 0.000156402587890625, "step": 10 }, { "epoch": 0.0014437305998700643, "grad_norm": 1.859902408963682, "learning_rate": 7.215007215007215e-09, "logits/chosen": -2.34375, "logits/rejected": -1.984375, "logps/chosen": -157.0, "logps/rejected": -139.0, "loss": 0.6927, "rewards/accuracies": 0.36250001192092896, "rewards/chosen": 0.001129150390625, "rewards/margins": 0.00061798095703125, "rewards/rejected": 0.000507354736328125, "step": 20 }, { "epoch": 0.0021655958998050965, "grad_norm": 1.800945636929482, "learning_rate": 1.0822510822510822e-08, "logits/chosen": -2.390625, "logits/rejected": -2.015625, "logps/chosen": -146.0, "logps/rejected": -148.0, "loss": 0.6923, "rewards/accuracies": 0.3375000059604645, "rewards/chosen": 0.000640869140625, "rewards/margins": -0.0003757476806640625, "rewards/rejected": 0.00101470947265625, "step": 30 }, { "epoch": 0.0028874611997401285, "grad_norm": 1.9512697515276394, "learning_rate": 1.443001443001443e-08, "logits/chosen": -2.421875, "logits/rejected": -2.0, "logps/chosen": -165.0, "logps/rejected": -161.0, "loss": 0.6927, "rewards/accuracies": 0.2874999940395355, "rewards/chosen": 0.00010967254638671875, "rewards/margins": 0.0003910064697265625, "rewards/rejected": -0.00028228759765625, "step": 40 }, { "epoch": 0.0036093264996751606, "grad_norm": 1.9685077450218404, "learning_rate": 1.8037518037518035e-08, "logits/chosen": -2.21875, "logits/rejected": -2.015625, "logps/chosen": -165.0, "logps/rejected": -143.0, "loss": 0.6929, "rewards/accuracies": 0.3187499940395355, "rewards/chosen": 9.441375732421875e-05, "rewards/margins": 0.0001239776611328125, "rewards/rejected": -3.0159950256347656e-05, "step": 50 }, { "epoch": 0.004331191799610193, "grad_norm": 1.9944209672205195, "learning_rate": 2.1645021645021644e-08, "logits/chosen": -2.34375, "logits/rejected": -1.984375, "logps/chosen": -160.0, "logps/rejected": -136.0, "loss": 0.6926, "rewards/accuracies": 0.3812499940395355, "rewards/chosen": -0.000232696533203125, "rewards/margins": 0.00102996826171875, "rewards/rejected": -0.0012664794921875, "step": 60 }, { "epoch": 0.005053057099545225, "grad_norm": 1.8602055997261977, "learning_rate": 2.525252525252525e-08, "logits/chosen": -2.40625, "logits/rejected": -1.8984375, "logps/chosen": -150.0, "logps/rejected": -154.0, "loss": 0.6926, "rewards/accuracies": 0.3375000059604645, "rewards/chosen": 0.000438690185546875, "rewards/margins": 0.00054931640625, "rewards/rejected": -0.00010919570922851562, "step": 70 }, { "epoch": 0.005774922399480257, "grad_norm": 1.7129972696287459, "learning_rate": 2.886002886002886e-08, "logits/chosen": -2.359375, "logits/rejected": -2.046875, "logps/chosen": -170.0, "logps/rejected": -145.0, "loss": 0.6928, "rewards/accuracies": 0.39375001192092896, "rewards/chosen": 0.000579833984375, "rewards/margins": 0.0004520416259765625, "rewards/rejected": 0.0001239776611328125, "step": 80 }, { "epoch": 0.006496787699415289, "grad_norm": 1.8246478253492482, "learning_rate": 3.246753246753246e-08, "logits/chosen": -2.484375, "logits/rejected": -2.0625, "logps/chosen": -178.0, "logps/rejected": -158.0, "loss": 0.6925, "rewards/accuracies": 0.3499999940395355, "rewards/chosen": 0.000469207763671875, "rewards/margins": 0.0001888275146484375, "rewards/rejected": 0.0002803802490234375, "step": 90 }, { "epoch": 0.007218652999350321, "grad_norm": 1.7657315202986226, "learning_rate": 3.607503607503607e-08, "logits/chosen": -2.390625, "logits/rejected": -1.984375, "logps/chosen": -172.0, "logps/rejected": -163.0, "loss": 0.6927, "rewards/accuracies": 0.3062500059604645, "rewards/chosen": 0.000797271728515625, "rewards/margins": -0.0003910064697265625, "rewards/rejected": 0.001190185546875, "step": 100 }, { "epoch": 0.007940518299285354, "grad_norm": 2.0123631368082844, "learning_rate": 3.968253968253968e-08, "logits/chosen": -2.453125, "logits/rejected": -1.9296875, "logps/chosen": -153.0, "logps/rejected": -140.0, "loss": 0.6926, "rewards/accuracies": 0.35624998807907104, "rewards/chosen": 0.000186920166015625, "rewards/margins": 0.00018787384033203125, "rewards/rejected": 1.1473894119262695e-06, "step": 110 }, { "epoch": 0.008662383599220386, "grad_norm": 1.9667654175700489, "learning_rate": 4.329004329004329e-08, "logits/chosen": -2.40625, "logits/rejected": -2.0, "logps/chosen": -146.0, "logps/rejected": -137.0, "loss": 0.6926, "rewards/accuracies": 0.33125001192092896, "rewards/chosen": 0.00154876708984375, "rewards/margins": -0.00103759765625, "rewards/rejected": 0.0025787353515625, "step": 120 }, { "epoch": 0.009384248899155418, "grad_norm": 1.7516436962452608, "learning_rate": 4.68975468975469e-08, "logits/chosen": -2.5625, "logits/rejected": -2.1875, "logps/chosen": -152.0, "logps/rejected": -151.0, "loss": 0.6925, "rewards/accuracies": 0.4312500059604645, "rewards/chosen": 0.0027313232421875, "rewards/margins": 0.00164031982421875, "rewards/rejected": 0.0010986328125, "step": 130 }, { "epoch": 0.01010611419909045, "grad_norm": 2.0629971445302435, "learning_rate": 5.05050505050505e-08, "logits/chosen": -2.34375, "logits/rejected": -2.046875, "logps/chosen": -167.0, "logps/rejected": -152.0, "loss": 0.6921, "rewards/accuracies": 0.39375001192092896, "rewards/chosen": 0.0018768310546875, "rewards/margins": 0.000438690185546875, "rewards/rejected": 0.00144195556640625, "step": 140 }, { "epoch": 0.010827979499025482, "grad_norm": 2.0455409873804205, "learning_rate": 5.411255411255411e-08, "logits/chosen": -2.375, "logits/rejected": -2.09375, "logps/chosen": -165.0, "logps/rejected": -147.0, "loss": 0.6923, "rewards/accuracies": 0.40625, "rewards/chosen": 0.001739501953125, "rewards/margins": 5.435943603515625e-05, "rewards/rejected": 0.001678466796875, "step": 150 }, { "epoch": 0.011549844798960514, "grad_norm": 2.003008491192784, "learning_rate": 5.772005772005772e-08, "logits/chosen": -2.359375, "logits/rejected": -1.8359375, "logps/chosen": -166.0, "logps/rejected": -161.0, "loss": 0.6919, "rewards/accuracies": 0.4375, "rewards/chosen": 0.0026702880859375, "rewards/margins": 0.00093841552734375, "rewards/rejected": 0.00173187255859375, "step": 160 }, { "epoch": 0.012271710098895546, "grad_norm": 1.8970983946398985, "learning_rate": 6.132756132756133e-08, "logits/chosen": -2.34375, "logits/rejected": -1.9921875, "logps/chosen": -163.0, "logps/rejected": -142.0, "loss": 0.6915, "rewards/accuracies": 0.53125, "rewards/chosen": 0.00445556640625, "rewards/margins": 0.00396728515625, "rewards/rejected": 0.0004787445068359375, "step": 170 }, { "epoch": 0.012993575398830578, "grad_norm": 1.9000812663628288, "learning_rate": 6.493506493506492e-08, "logits/chosen": -2.390625, "logits/rejected": -1.9140625, "logps/chosen": -184.0, "logps/rejected": -166.0, "loss": 0.6913, "rewards/accuracies": 0.4375, "rewards/chosen": 0.004791259765625, "rewards/margins": 0.00274658203125, "rewards/rejected": 0.0020294189453125, "step": 180 }, { "epoch": 0.01371544069876561, "grad_norm": 1.7694192875136483, "learning_rate": 6.854256854256854e-08, "logits/chosen": -2.375, "logits/rejected": -2.015625, "logps/chosen": -168.0, "logps/rejected": -147.0, "loss": 0.691, "rewards/accuracies": 0.5249999761581421, "rewards/chosen": 0.007598876953125, "rewards/margins": 0.003387451171875, "rewards/rejected": 0.00421142578125, "step": 190 }, { "epoch": 0.014437305998700642, "grad_norm": 1.8022914272788901, "learning_rate": 7.215007215007214e-08, "logits/chosen": -2.296875, "logits/rejected": -1.890625, "logps/chosen": -150.0, "logps/rejected": -137.0, "loss": 0.6907, "rewards/accuracies": 0.5562499761581421, "rewards/chosen": 0.007354736328125, "rewards/margins": 0.005584716796875, "rewards/rejected": 0.0017547607421875, "step": 200 }, { "epoch": 0.015159171298635674, "grad_norm": 1.7754509638333658, "learning_rate": 7.575757575757576e-08, "logits/chosen": -2.328125, "logits/rejected": -2.0, "logps/chosen": -155.0, "logps/rejected": -151.0, "loss": 0.6908, "rewards/accuracies": 0.53125, "rewards/chosen": 0.007537841796875, "rewards/margins": 0.0034942626953125, "rewards/rejected": 0.0040283203125, "step": 210 }, { "epoch": 0.015881036598570708, "grad_norm": 1.8713087698233093, "learning_rate": 7.936507936507936e-08, "logits/chosen": -2.546875, "logits/rejected": -1.8984375, "logps/chosen": -156.0, "logps/rejected": -168.0, "loss": 0.6903, "rewards/accuracies": 0.574999988079071, "rewards/chosen": 0.00860595703125, "rewards/margins": 0.00469970703125, "rewards/rejected": 0.00390625, "step": 220 }, { "epoch": 0.01660290189850574, "grad_norm": 1.7352700913418746, "learning_rate": 8.297258297258297e-08, "logits/chosen": -2.359375, "logits/rejected": -2.0, "logps/chosen": -171.0, "logps/rejected": -150.0, "loss": 0.6897, "rewards/accuracies": 0.606249988079071, "rewards/chosen": 0.01153564453125, "rewards/margins": 0.00640869140625, "rewards/rejected": 0.005157470703125, "step": 230 }, { "epoch": 0.017324767198440772, "grad_norm": 1.923679325098434, "learning_rate": 8.658008658008658e-08, "logits/chosen": -2.40625, "logits/rejected": -2.171875, "logps/chosen": -168.0, "logps/rejected": -153.0, "loss": 0.6889, "rewards/accuracies": 0.6499999761581421, "rewards/chosen": 0.01507568359375, "rewards/margins": 0.00933837890625, "rewards/rejected": 0.005706787109375, "step": 240 }, { "epoch": 0.018046632498375802, "grad_norm": 1.9336109183415302, "learning_rate": 9.018759018759018e-08, "logits/chosen": -2.46875, "logits/rejected": -2.140625, "logps/chosen": -198.0, "logps/rejected": -190.0, "loss": 0.6883, "rewards/accuracies": 0.6312500238418579, "rewards/chosen": 0.015625, "rewards/margins": 0.01055908203125, "rewards/rejected": 0.005035400390625, "step": 250 }, { "epoch": 0.018768497798310836, "grad_norm": 1.7118991587292718, "learning_rate": 9.37950937950938e-08, "logits/chosen": -2.484375, "logits/rejected": -1.9921875, "logps/chosen": -148.0, "logps/rejected": -164.0, "loss": 0.6873, "rewards/accuracies": 0.6812499761581421, "rewards/chosen": 0.0172119140625, "rewards/margins": 0.012451171875, "rewards/rejected": 0.00469970703125, "step": 260 }, { "epoch": 0.019490363098245866, "grad_norm": 2.0498889647791634, "learning_rate": 9.74025974025974e-08, "logits/chosen": -2.578125, "logits/rejected": -2.125, "logps/chosen": -168.0, "logps/rejected": -150.0, "loss": 0.6875, "rewards/accuracies": 0.6187499761581421, "rewards/chosen": 0.0159912109375, "rewards/margins": 0.00982666015625, "rewards/rejected": 0.006195068359375, "step": 270 }, { "epoch": 0.0202122283981809, "grad_norm": 1.7948780770940682, "learning_rate": 1.01010101010101e-07, "logits/chosen": -2.5, "logits/rejected": -1.9140625, "logps/chosen": -162.0, "logps/rejected": -170.0, "loss": 0.6865, "rewards/accuracies": 0.643750011920929, "rewards/chosen": 0.018310546875, "rewards/margins": 0.01513671875, "rewards/rejected": 0.0032196044921875, "step": 280 }, { "epoch": 0.02093409369811593, "grad_norm": 1.7485728753360685, "learning_rate": 1.0461760461760462e-07, "logits/chosen": -2.390625, "logits/rejected": -2.09375, "logps/chosen": -173.0, "logps/rejected": -152.0, "loss": 0.6865, "rewards/accuracies": 0.5874999761581421, "rewards/chosen": 0.0172119140625, "rewards/margins": 0.0089111328125, "rewards/rejected": 0.0084228515625, "step": 290 }, { "epoch": 0.021655958998050964, "grad_norm": 1.7752446010354384, "learning_rate": 1.0822510822510822e-07, "logits/chosen": -2.453125, "logits/rejected": -2.15625, "logps/chosen": -162.0, "logps/rejected": -165.0, "loss": 0.6857, "rewards/accuracies": 0.6937500238418579, "rewards/chosen": 0.0238037109375, "rewards/margins": 0.015625, "rewards/rejected": 0.00823974609375, "step": 300 }, { "epoch": 0.022377824297985995, "grad_norm": 1.9527079542055057, "learning_rate": 1.1183261183261184e-07, "logits/chosen": -2.546875, "logits/rejected": -2.078125, "logps/chosen": -148.0, "logps/rejected": -153.0, "loss": 0.6845, "rewards/accuracies": 0.737500011920929, "rewards/chosen": 0.0203857421875, "rewards/margins": 0.0184326171875, "rewards/rejected": 0.00201416015625, "step": 310 }, { "epoch": 0.02309968959792103, "grad_norm": 1.798683396295616, "learning_rate": 1.1544011544011543e-07, "logits/chosen": -2.453125, "logits/rejected": -2.09375, "logps/chosen": -163.0, "logps/rejected": -141.0, "loss": 0.6844, "rewards/accuracies": 0.637499988079071, "rewards/chosen": 0.02197265625, "rewards/margins": 0.0184326171875, "rewards/rejected": 0.003570556640625, "step": 320 }, { "epoch": 0.02382155489785606, "grad_norm": 1.822086025310402, "learning_rate": 1.1904761904761903e-07, "logits/chosen": -2.453125, "logits/rejected": -1.9765625, "logps/chosen": -159.0, "logps/rejected": -147.0, "loss": 0.6816, "rewards/accuracies": 0.65625, "rewards/chosen": 0.02490234375, "rewards/margins": 0.0225830078125, "rewards/rejected": 0.002349853515625, "step": 330 }, { "epoch": 0.024543420197791092, "grad_norm": 1.8205804931965275, "learning_rate": 1.2265512265512265e-07, "logits/chosen": -2.453125, "logits/rejected": -2.125, "logps/chosen": -163.0, "logps/rejected": -168.0, "loss": 0.6809, "rewards/accuracies": 0.6937500238418579, "rewards/chosen": 0.0240478515625, "rewards/margins": 0.02392578125, "rewards/rejected": 4.839897155761719e-05, "step": 340 }, { "epoch": 0.025265285497726123, "grad_norm": 2.015225469187424, "learning_rate": 1.2626262626262626e-07, "logits/chosen": -2.4375, "logits/rejected": -2.1875, "logps/chosen": -168.0, "logps/rejected": -138.0, "loss": 0.6787, "rewards/accuracies": 0.706250011920929, "rewards/chosen": 0.023193359375, "rewards/margins": 0.02880859375, "rewards/rejected": -0.005706787109375, "step": 350 }, { "epoch": 0.025987150797661156, "grad_norm": 1.8960338628946363, "learning_rate": 1.2987012987012984e-07, "logits/chosen": -2.34375, "logits/rejected": -2.0625, "logps/chosen": -171.0, "logps/rejected": -155.0, "loss": 0.679, "rewards/accuracies": 0.7437499761581421, "rewards/chosen": 0.024169921875, "rewards/margins": 0.029052734375, "rewards/rejected": -0.004791259765625, "step": 360 }, { "epoch": 0.02670901609759619, "grad_norm": 1.9289106441512014, "learning_rate": 1.3347763347763348e-07, "logits/chosen": -2.484375, "logits/rejected": -2.125, "logps/chosen": -143.0, "logps/rejected": -147.0, "loss": 0.6755, "rewards/accuracies": 0.7250000238418579, "rewards/chosen": 0.0277099609375, "rewards/margins": 0.036376953125, "rewards/rejected": -0.00848388671875, "step": 370 }, { "epoch": 0.02743088139753122, "grad_norm": 2.4318763159683168, "learning_rate": 1.370851370851371e-07, "logits/chosen": -2.59375, "logits/rejected": -2.078125, "logps/chosen": -161.0, "logps/rejected": -154.0, "loss": 0.6738, "rewards/accuracies": 0.768750011920929, "rewards/chosen": 0.016845703125, "rewards/margins": 0.0390625, "rewards/rejected": -0.022216796875, "step": 380 }, { "epoch": 0.028152746697466254, "grad_norm": 1.727518768188907, "learning_rate": 1.406926406926407e-07, "logits/chosen": -2.46875, "logits/rejected": -2.125, "logps/chosen": -151.0, "logps/rejected": -145.0, "loss": 0.6737, "rewards/accuracies": 0.731249988079071, "rewards/chosen": 0.0238037109375, "rewards/margins": 0.04541015625, "rewards/rejected": -0.0216064453125, "step": 390 }, { "epoch": 0.028874611997401285, "grad_norm": 1.8565593414895172, "learning_rate": 1.4430014430014428e-07, "logits/chosen": -2.453125, "logits/rejected": -2.046875, "logps/chosen": -169.0, "logps/rejected": -162.0, "loss": 0.6703, "rewards/accuracies": 0.762499988079071, "rewards/chosen": 0.01324462890625, "rewards/margins": 0.0458984375, "rewards/rejected": -0.03271484375, "step": 400 }, { "epoch": 0.02959647729733632, "grad_norm": 1.9588571879597823, "learning_rate": 1.479076479076479e-07, "logits/chosen": -2.46875, "logits/rejected": -2.296875, "logps/chosen": -152.0, "logps/rejected": -137.0, "loss": 0.6681, "rewards/accuracies": 0.7749999761581421, "rewards/chosen": 0.006378173828125, "rewards/margins": 0.052734375, "rewards/rejected": -0.04638671875, "step": 410 }, { "epoch": 0.03031834259727135, "grad_norm": 1.93069247030128, "learning_rate": 1.5151515151515152e-07, "logits/chosen": -2.515625, "logits/rejected": -2.203125, "logps/chosen": -172.0, "logps/rejected": -144.0, "loss": 0.6667, "rewards/accuracies": 0.6875, "rewards/chosen": -0.0025787353515625, "rewards/margins": 0.044189453125, "rewards/rejected": -0.046875, "step": 420 }, { "epoch": 0.031040207897206382, "grad_norm": 1.819742407006859, "learning_rate": 1.5512265512265513e-07, "logits/chosen": -2.546875, "logits/rejected": -2.125, "logps/chosen": -172.0, "logps/rejected": -152.0, "loss": 0.6625, "rewards/accuracies": 0.675000011920929, "rewards/chosen": -0.002685546875, "rewards/margins": 0.06396484375, "rewards/rejected": -0.06640625, "step": 430 }, { "epoch": 0.031762073197141416, "grad_norm": 2.3055219231256108, "learning_rate": 1.5873015873015872e-07, "logits/chosen": -2.4375, "logits/rejected": -2.1875, "logps/chosen": -155.0, "logps/rejected": -158.0, "loss": 0.6555, "rewards/accuracies": 0.768750011920929, "rewards/chosen": -0.01123046875, "rewards/margins": 0.078125, "rewards/rejected": -0.08935546875, "step": 440 }, { "epoch": 0.032483938497076446, "grad_norm": 1.9129712763765747, "learning_rate": 1.6233766233766232e-07, "logits/chosen": -2.515625, "logits/rejected": -2.140625, "logps/chosen": -166.0, "logps/rejected": -154.0, "loss": 0.6547, "rewards/accuracies": 0.737500011920929, "rewards/chosen": -0.031494140625, "rewards/margins": 0.07666015625, "rewards/rejected": -0.10791015625, "step": 450 }, { "epoch": 0.03320580379701148, "grad_norm": 1.936887902580248, "learning_rate": 1.6594516594516593e-07, "logits/chosen": -2.609375, "logits/rejected": -2.25, "logps/chosen": -166.0, "logps/rejected": -163.0, "loss": 0.65, "rewards/accuracies": 0.737500011920929, "rewards/chosen": -0.0478515625, "rewards/margins": 0.08740234375, "rewards/rejected": -0.1357421875, "step": 460 }, { "epoch": 0.03392766909694651, "grad_norm": 2.1168551608123725, "learning_rate": 1.6955266955266957e-07, "logits/chosen": -2.65625, "logits/rejected": -2.234375, "logps/chosen": -187.0, "logps/rejected": -190.0, "loss": 0.6399, "rewards/accuracies": 0.731249988079071, "rewards/chosen": -0.06298828125, "rewards/margins": 0.11279296875, "rewards/rejected": -0.17578125, "step": 470 }, { "epoch": 0.034649534396881544, "grad_norm": 2.4110075564522533, "learning_rate": 1.7316017316017315e-07, "logits/chosen": -2.59375, "logits/rejected": -2.296875, "logps/chosen": -171.0, "logps/rejected": -167.0, "loss": 0.6345, "rewards/accuracies": 0.762499988079071, "rewards/chosen": -0.09375, "rewards/margins": 0.1376953125, "rewards/rejected": -0.2314453125, "step": 480 }, { "epoch": 0.035371399696816574, "grad_norm": 2.561479324237141, "learning_rate": 1.7676767676767676e-07, "logits/chosen": -2.5625, "logits/rejected": -2.34375, "logps/chosen": -165.0, "logps/rejected": -169.0, "loss": 0.6272, "rewards/accuracies": 0.7437499761581421, "rewards/chosen": -0.1552734375, "rewards/margins": 0.1328125, "rewards/rejected": -0.287109375, "step": 490 }, { "epoch": 0.036093264996751605, "grad_norm": 2.2009284942320004, "learning_rate": 1.8037518037518037e-07, "logits/chosen": -2.59375, "logits/rejected": -2.1875, "logps/chosen": -180.0, "logps/rejected": -198.0, "loss": 0.6213, "rewards/accuracies": 0.762499988079071, "rewards/chosen": -0.1826171875, "rewards/margins": 0.1806640625, "rewards/rejected": -0.36328125, "step": 500 }, { "epoch": 0.036815130296686635, "grad_norm": 2.433624086599741, "learning_rate": 1.8398268398268395e-07, "logits/chosen": -2.625, "logits/rejected": -2.203125, "logps/chosen": -182.0, "logps/rejected": -181.0, "loss": 0.6137, "rewards/accuracies": 0.7250000238418579, "rewards/chosen": -0.2294921875, "rewards/margins": 0.1787109375, "rewards/rejected": -0.408203125, "step": 510 }, { "epoch": 0.03753699559662167, "grad_norm": 2.3303081056576396, "learning_rate": 1.875901875901876e-07, "logits/chosen": -2.6875, "logits/rejected": -2.3125, "logps/chosen": -183.0, "logps/rejected": -198.0, "loss": 0.6089, "rewards/accuracies": 0.75, "rewards/chosen": -0.28125, "rewards/margins": 0.1953125, "rewards/rejected": -0.4765625, "step": 520 }, { "epoch": 0.0382588608965567, "grad_norm": 7.529255626517495, "learning_rate": 1.911976911976912e-07, "logits/chosen": -2.59375, "logits/rejected": -2.203125, "logps/chosen": -188.0, "logps/rejected": -206.0, "loss": 0.6063, "rewards/accuracies": 0.768750011920929, "rewards/chosen": -0.3046875, "rewards/margins": 0.236328125, "rewards/rejected": -0.5390625, "step": 530 }, { "epoch": 0.03898072619649173, "grad_norm": 2.2072494405878578, "learning_rate": 1.948051948051948e-07, "logits/chosen": -2.71875, "logits/rejected": -2.3125, "logps/chosen": -203.0, "logps/rejected": -224.0, "loss": 0.5956, "rewards/accuracies": 0.78125, "rewards/chosen": -0.3515625, "rewards/margins": 0.283203125, "rewards/rejected": -0.6328125, "step": 540 }, { "epoch": 0.03970259149642677, "grad_norm": 2.310476086986689, "learning_rate": 1.984126984126984e-07, "logits/chosen": -2.703125, "logits/rejected": -2.484375, "logps/chosen": -220.0, "logps/rejected": -209.0, "loss": 0.5867, "rewards/accuracies": 0.737500011920929, "rewards/chosen": -0.416015625, "rewards/margins": 0.236328125, "rewards/rejected": -0.65234375, "step": 550 }, { "epoch": 0.0404244567963618, "grad_norm": 2.6001658124806286, "learning_rate": 2.02020202020202e-07, "logits/chosen": -2.765625, "logits/rejected": -2.359375, "logps/chosen": -208.0, "logps/rejected": -239.0, "loss": 0.5754, "rewards/accuracies": 0.7875000238418579, "rewards/chosen": -0.447265625, "rewards/margins": 0.31640625, "rewards/rejected": -0.76171875, "step": 560 }, { "epoch": 0.04114632209629683, "grad_norm": 2.635075269431316, "learning_rate": 2.0562770562770563e-07, "logits/chosen": -2.609375, "logits/rejected": -2.390625, "logps/chosen": -217.0, "logps/rejected": -227.0, "loss": 0.5719, "rewards/accuracies": 0.7875000238418579, "rewards/chosen": -0.494140625, "rewards/margins": 0.33984375, "rewards/rejected": -0.83203125, "step": 570 }, { "epoch": 0.04186818739623186, "grad_norm": 2.5380650062224066, "learning_rate": 2.0923520923520924e-07, "logits/chosen": -2.71875, "logits/rejected": -2.453125, "logps/chosen": -216.0, "logps/rejected": -237.0, "loss": 0.5794, "rewards/accuracies": 0.762499988079071, "rewards/chosen": -0.50390625, "rewards/margins": 0.349609375, "rewards/rejected": -0.8515625, "step": 580 }, { "epoch": 0.0425900526961669, "grad_norm": 2.808866971835476, "learning_rate": 2.1284271284271282e-07, "logits/chosen": -2.875, "logits/rejected": -2.546875, "logps/chosen": -216.0, "logps/rejected": -264.0, "loss": 0.5557, "rewards/accuracies": 0.768750011920929, "rewards/chosen": -0.5390625, "rewards/margins": 0.50390625, "rewards/rejected": -1.046875, "step": 590 }, { "epoch": 0.04331191799610193, "grad_norm": 3.660790591856929, "learning_rate": 2.1645021645021643e-07, "logits/chosen": -3.0625, "logits/rejected": -2.734375, "logps/chosen": -215.0, "logps/rejected": -226.0, "loss": 0.5374, "rewards/accuracies": 0.7250000238418579, "rewards/chosen": -0.60546875, "rewards/margins": 0.3203125, "rewards/rejected": -0.92578125, "step": 600 }, { "epoch": 0.04403378329603696, "grad_norm": 3.4012692341173842, "learning_rate": 2.2005772005772004e-07, "logits/chosen": -2.984375, "logits/rejected": -2.671875, "logps/chosen": -243.0, "logps/rejected": -288.0, "loss": 0.5302, "rewards/accuracies": 0.737500011920929, "rewards/chosen": -0.75, "rewards/margins": 0.51953125, "rewards/rejected": -1.2734375, "step": 610 }, { "epoch": 0.04475564859597199, "grad_norm": 3.1213723367337276, "learning_rate": 2.2366522366522368e-07, "logits/chosen": -3.265625, "logits/rejected": -2.796875, "logps/chosen": -252.0, "logps/rejected": -290.0, "loss": 0.5349, "rewards/accuracies": 0.768750011920929, "rewards/chosen": -0.82421875, "rewards/margins": 0.6171875, "rewards/rejected": -1.4375, "step": 620 }, { "epoch": 0.045477513895907026, "grad_norm": 3.4139219834989825, "learning_rate": 2.2727272727272726e-07, "logits/chosen": -3.078125, "logits/rejected": -2.8125, "logps/chosen": -241.0, "logps/rejected": -290.0, "loss": 0.5313, "rewards/accuracies": 0.793749988079071, "rewards/chosen": -0.76953125, "rewards/margins": 0.625, "rewards/rejected": -1.390625, "step": 630 }, { "epoch": 0.04619937919584206, "grad_norm": 3.545601457816913, "learning_rate": 2.3088023088023087e-07, "logits/chosen": -3.0625, "logits/rejected": -2.796875, "logps/chosen": -254.0, "logps/rejected": -306.0, "loss": 0.5163, "rewards/accuracies": 0.8125, "rewards/chosen": -0.796875, "rewards/margins": 0.671875, "rewards/rejected": -1.46875, "step": 640 }, { "epoch": 0.04692124449577709, "grad_norm": 6.320535114176617, "learning_rate": 2.3448773448773448e-07, "logits/chosen": -3.15625, "logits/rejected": -2.9375, "logps/chosen": -258.0, "logps/rejected": -312.0, "loss": 0.5168, "rewards/accuracies": 0.7749999761581421, "rewards/chosen": -0.92578125, "rewards/margins": 0.625, "rewards/rejected": -1.5546875, "step": 650 }, { "epoch": 0.04764310979571212, "grad_norm": 4.40606882426551, "learning_rate": 2.3809523809523806e-07, "logits/chosen": -3.234375, "logits/rejected": -2.984375, "logps/chosen": -258.0, "logps/rejected": -300.0, "loss": 0.506, "rewards/accuracies": 0.7250000238418579, "rewards/chosen": -0.9375, "rewards/margins": 0.6171875, "rewards/rejected": -1.5546875, "step": 660 }, { "epoch": 0.048364975095647154, "grad_norm": 7.228420353041346, "learning_rate": 2.4170274170274167e-07, "logits/chosen": -3.046875, "logits/rejected": -2.8125, "logps/chosen": -230.0, "logps/rejected": -308.0, "loss": 0.5231, "rewards/accuracies": 0.78125, "rewards/chosen": -0.8359375, "rewards/margins": 0.7421875, "rewards/rejected": -1.578125, "step": 670 }, { "epoch": 0.049086840395582185, "grad_norm": 4.810449590822843, "learning_rate": 2.453102453102453e-07, "logits/chosen": -3.046875, "logits/rejected": -2.75, "logps/chosen": -246.0, "logps/rejected": -280.0, "loss": 0.5107, "rewards/accuracies": 0.75, "rewards/chosen": -0.88671875, "rewards/margins": 0.498046875, "rewards/rejected": -1.3828125, "step": 680 }, { "epoch": 0.049808705695517215, "grad_norm": 6.916956622472092, "learning_rate": 2.4891774891774894e-07, "logits/chosen": -3.046875, "logits/rejected": -2.9375, "logps/chosen": -270.0, "logps/rejected": -322.0, "loss": 0.5105, "rewards/accuracies": 0.762499988079071, "rewards/chosen": -0.9765625, "rewards/margins": 0.6484375, "rewards/rejected": -1.625, "step": 690 }, { "epoch": 0.050530570995452245, "grad_norm": 5.072218871042774, "learning_rate": 2.525252525252525e-07, "logits/chosen": -3.109375, "logits/rejected": -2.84375, "logps/chosen": -256.0, "logps/rejected": -326.0, "loss": 0.5065, "rewards/accuracies": 0.78125, "rewards/chosen": -0.92578125, "rewards/margins": 0.76953125, "rewards/rejected": -1.6953125, "step": 700 }, { "epoch": 0.05125243629538728, "grad_norm": 8.875662849487487, "learning_rate": 2.5613275613275616e-07, "logits/chosen": -3.09375, "logits/rejected": -2.84375, "logps/chosen": -254.0, "logps/rejected": -306.0, "loss": 0.5112, "rewards/accuracies": 0.762499988079071, "rewards/chosen": -0.94921875, "rewards/margins": 0.61328125, "rewards/rejected": -1.5625, "step": 710 }, { "epoch": 0.05197430159532231, "grad_norm": 5.595849818392523, "learning_rate": 2.597402597402597e-07, "logits/chosen": -3.15625, "logits/rejected": -2.96875, "logps/chosen": -264.0, "logps/rejected": -340.0, "loss": 0.5107, "rewards/accuracies": 0.793749988079071, "rewards/chosen": -1.0078125, "rewards/margins": 0.8125, "rewards/rejected": -1.8203125, "step": 720 }, { "epoch": 0.05269616689525734, "grad_norm": 5.404147285645744, "learning_rate": 2.633477633477633e-07, "logits/chosen": -3.03125, "logits/rejected": -2.65625, "logps/chosen": -268.0, "logps/rejected": -368.0, "loss": 0.5035, "rewards/accuracies": 0.78125, "rewards/chosen": -0.984375, "rewards/margins": 0.94140625, "rewards/rejected": -1.9296875, "step": 730 }, { "epoch": 0.05341803219519238, "grad_norm": 8.76041109611346, "learning_rate": 2.6695526695526696e-07, "logits/chosen": -2.984375, "logits/rejected": -2.828125, "logps/chosen": -286.0, "logps/rejected": -342.0, "loss": 0.4887, "rewards/accuracies": 0.7875000238418579, "rewards/chosen": -1.125, "rewards/margins": 0.75390625, "rewards/rejected": -1.8828125, "step": 740 }, { "epoch": 0.05413989749512741, "grad_norm": 7.025589443972428, "learning_rate": 2.7056277056277054e-07, "logits/chosen": -2.96875, "logits/rejected": -2.78125, "logps/chosen": -262.0, "logps/rejected": -348.0, "loss": 0.4823, "rewards/accuracies": 0.8125, "rewards/chosen": -1.0, "rewards/margins": 0.94921875, "rewards/rejected": -1.953125, "step": 750 }, { "epoch": 0.05486176279506244, "grad_norm": 11.975302977639574, "learning_rate": 2.741702741702742e-07, "logits/chosen": -2.953125, "logits/rejected": -2.75, "logps/chosen": -276.0, "logps/rejected": -322.0, "loss": 0.4766, "rewards/accuracies": 0.7124999761581421, "rewards/chosen": -1.140625, "rewards/margins": 0.6953125, "rewards/rejected": -1.8359375, "step": 760 }, { "epoch": 0.05558362809499747, "grad_norm": 6.5118457359444, "learning_rate": 2.7777777777777776e-07, "logits/chosen": -2.953125, "logits/rejected": -2.734375, "logps/chosen": -280.0, "logps/rejected": -346.0, "loss": 0.4846, "rewards/accuracies": 0.800000011920929, "rewards/chosen": -1.1875, "rewards/margins": 0.80859375, "rewards/rejected": -1.9921875, "step": 770 }, { "epoch": 0.05630549339493251, "grad_norm": 6.106781577833728, "learning_rate": 2.813852813852814e-07, "logits/chosen": -3.015625, "logits/rejected": -2.6875, "logps/chosen": -260.0, "logps/rejected": -356.0, "loss": 0.4665, "rewards/accuracies": 0.831250011920929, "rewards/chosen": -1.046875, "rewards/margins": 0.83203125, "rewards/rejected": -1.875, "step": 780 }, { "epoch": 0.05702735869486754, "grad_norm": 10.75495308386994, "learning_rate": 2.8499278499278503e-07, "logits/chosen": -2.875, "logits/rejected": -2.625, "logps/chosen": -284.0, "logps/rejected": -408.0, "loss": 0.4695, "rewards/accuracies": 0.831250011920929, "rewards/chosen": -1.2109375, "rewards/margins": 1.171875, "rewards/rejected": -2.390625, "step": 790 }, { "epoch": 0.05774922399480257, "grad_norm": 5.788421207967755, "learning_rate": 2.8860028860028856e-07, "logits/chosen": -2.875, "logits/rejected": -2.65625, "logps/chosen": -274.0, "logps/rejected": -334.0, "loss": 0.4767, "rewards/accuracies": 0.8125, "rewards/chosen": -1.125, "rewards/margins": 0.84765625, "rewards/rejected": -1.9765625, "step": 800 }, { "epoch": 0.0584710892947376, "grad_norm": 8.78614857490401, "learning_rate": 2.922077922077922e-07, "logits/chosen": -3.015625, "logits/rejected": -2.71875, "logps/chosen": -262.0, "logps/rejected": -362.0, "loss": 0.4722, "rewards/accuracies": 0.8125, "rewards/chosen": -1.234375, "rewards/margins": 0.8984375, "rewards/rejected": -2.125, "step": 810 }, { "epoch": 0.05919295459467264, "grad_norm": 7.3161771388355294, "learning_rate": 2.958152958152958e-07, "logits/chosen": -2.84375, "logits/rejected": -2.578125, "logps/chosen": -272.0, "logps/rejected": -376.0, "loss": 0.4996, "rewards/accuracies": 0.793749988079071, "rewards/chosen": -1.1796875, "rewards/margins": 0.93359375, "rewards/rejected": -2.109375, "step": 820 }, { "epoch": 0.05991481989460767, "grad_norm": 8.266553993044619, "learning_rate": 2.994227994227994e-07, "logits/chosen": -2.90625, "logits/rejected": -2.546875, "logps/chosen": -282.0, "logps/rejected": -376.0, "loss": 0.4545, "rewards/accuracies": 0.831250011920929, "rewards/chosen": -1.15625, "rewards/margins": 1.015625, "rewards/rejected": -2.171875, "step": 830 }, { "epoch": 0.0606366851945427, "grad_norm": 8.218438777679667, "learning_rate": 3.0303030303030305e-07, "logits/chosen": -2.890625, "logits/rejected": -2.640625, "logps/chosen": -272.0, "logps/rejected": -382.0, "loss": 0.4639, "rewards/accuracies": 0.8062499761581421, "rewards/chosen": -1.25, "rewards/margins": 1.0234375, "rewards/rejected": -2.28125, "step": 840 }, { "epoch": 0.06135855049447773, "grad_norm": 8.61378341353772, "learning_rate": 3.0663780663780663e-07, "logits/chosen": -3.078125, "logits/rejected": -2.640625, "logps/chosen": -284.0, "logps/rejected": -408.0, "loss": 0.4536, "rewards/accuracies": 0.793749988079071, "rewards/chosen": -1.2578125, "rewards/margins": 1.109375, "rewards/rejected": -2.359375, "step": 850 }, { "epoch": 0.062080415794412765, "grad_norm": 12.398406848670698, "learning_rate": 3.1024531024531027e-07, "logits/chosen": -2.875, "logits/rejected": -2.65625, "logps/chosen": -286.0, "logps/rejected": -372.0, "loss": 0.476, "rewards/accuracies": 0.7749999761581421, "rewards/chosen": -1.2578125, "rewards/margins": 1.0078125, "rewards/rejected": -2.265625, "step": 860 }, { "epoch": 0.0628022810943478, "grad_norm": 12.244121744087602, "learning_rate": 3.138528138528138e-07, "logits/chosen": -2.765625, "logits/rejected": -2.671875, "logps/chosen": -294.0, "logps/rejected": -388.0, "loss": 0.4623, "rewards/accuracies": 0.78125, "rewards/chosen": -1.3671875, "rewards/margins": 0.984375, "rewards/rejected": -2.359375, "step": 870 }, { "epoch": 0.06352414639428283, "grad_norm": 10.812869810884447, "learning_rate": 3.1746031746031743e-07, "logits/chosen": -3.03125, "logits/rejected": -2.796875, "logps/chosen": -268.0, "logps/rejected": -366.0, "loss": 0.4498, "rewards/accuracies": 0.831250011920929, "rewards/chosen": -1.234375, "rewards/margins": 0.99609375, "rewards/rejected": -2.234375, "step": 880 }, { "epoch": 0.06424601169421786, "grad_norm": 11.229212598361977, "learning_rate": 3.2106782106782107e-07, "logits/chosen": -2.84375, "logits/rejected": -2.75, "logps/chosen": -298.0, "logps/rejected": -394.0, "loss": 0.4373, "rewards/accuracies": 0.8125, "rewards/chosen": -1.3828125, "rewards/margins": 1.0859375, "rewards/rejected": -2.46875, "step": 890 }, { "epoch": 0.06496787699415289, "grad_norm": 7.414765021326351, "learning_rate": 3.2467532467532465e-07, "logits/chosen": -2.984375, "logits/rejected": -2.75, "logps/chosen": -294.0, "logps/rejected": -394.0, "loss": 0.4253, "rewards/accuracies": 0.8062499761581421, "rewards/chosen": -1.34375, "rewards/margins": 1.140625, "rewards/rejected": -2.484375, "step": 900 }, { "epoch": 0.06568974229408793, "grad_norm": 6.656174306105041, "learning_rate": 3.282828282828283e-07, "logits/chosen": -2.96875, "logits/rejected": -2.65625, "logps/chosen": -322.0, "logps/rejected": -440.0, "loss": 0.4366, "rewards/accuracies": 0.8062499761581421, "rewards/chosen": -1.6328125, "rewards/margins": 1.1484375, "rewards/rejected": -2.78125, "step": 910 }, { "epoch": 0.06641160759402295, "grad_norm": 6.986955189515223, "learning_rate": 3.3189033189033187e-07, "logits/chosen": -2.921875, "logits/rejected": -2.71875, "logps/chosen": -328.0, "logps/rejected": -422.0, "loss": 0.4335, "rewards/accuracies": 0.824999988079071, "rewards/chosen": -1.515625, "rewards/margins": 1.234375, "rewards/rejected": -2.75, "step": 920 }, { "epoch": 0.06713347289395799, "grad_norm": 8.704691417598838, "learning_rate": 3.354978354978355e-07, "logits/chosen": -2.734375, "logits/rejected": -2.6875, "logps/chosen": -322.0, "logps/rejected": -406.0, "loss": 0.4048, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": -1.5703125, "rewards/margins": 1.0703125, "rewards/rejected": -2.640625, "step": 930 }, { "epoch": 0.06785533819389301, "grad_norm": 19.52535270358171, "learning_rate": 3.3910533910533914e-07, "logits/chosen": -2.8125, "logits/rejected": -2.65625, "logps/chosen": -316.0, "logps/rejected": -476.0, "loss": 0.434, "rewards/accuracies": 0.862500011920929, "rewards/chosen": -1.6015625, "rewards/margins": 1.609375, "rewards/rejected": -3.21875, "step": 940 }, { "epoch": 0.06857720349382805, "grad_norm": 11.339737953685198, "learning_rate": 3.4271284271284267e-07, "logits/chosen": -2.5625, "logits/rejected": -2.375, "logps/chosen": -316.0, "logps/rejected": -398.0, "loss": 0.4334, "rewards/accuracies": 0.8187500238418579, "rewards/chosen": -1.5625, "rewards/margins": 1.03125, "rewards/rejected": -2.59375, "step": 950 }, { "epoch": 0.06929906879376309, "grad_norm": 10.31037341226185, "learning_rate": 3.463203463203463e-07, "logits/chosen": -2.828125, "logits/rejected": -2.4375, "logps/chosen": -322.0, "logps/rejected": -456.0, "loss": 0.4161, "rewards/accuracies": 0.8062499761581421, "rewards/chosen": -1.6328125, "rewards/margins": 1.40625, "rewards/rejected": -3.046875, "step": 960 }, { "epoch": 0.07002093409369811, "grad_norm": 11.130584733664083, "learning_rate": 3.499278499278499e-07, "logits/chosen": -2.78125, "logits/rejected": -2.59375, "logps/chosen": -298.0, "logps/rejected": -424.0, "loss": 0.4078, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": -1.4296875, "rewards/margins": 1.3671875, "rewards/rejected": -2.796875, "step": 970 }, { "epoch": 0.07074279939363315, "grad_norm": 9.06083640139615, "learning_rate": 3.535353535353535e-07, "logits/chosen": -2.796875, "logits/rejected": -2.609375, "logps/chosen": -308.0, "logps/rejected": -442.0, "loss": 0.4178, "rewards/accuracies": 0.887499988079071, "rewards/chosen": -1.53125, "rewards/margins": 1.3515625, "rewards/rejected": -2.890625, "step": 980 }, { "epoch": 0.07146466469356819, "grad_norm": 9.541422651232944, "learning_rate": 3.5714285714285716e-07, "logits/chosen": -2.75, "logits/rejected": -2.46875, "logps/chosen": -338.0, "logps/rejected": -450.0, "loss": 0.3953, "rewards/accuracies": 0.78125, "rewards/chosen": -1.7109375, "rewards/margins": 1.375, "rewards/rejected": -3.078125, "step": 990 }, { "epoch": 0.07218652999350321, "grad_norm": 9.110551563711448, "learning_rate": 3.6075036075036074e-07, "logits/chosen": -2.640625, "logits/rejected": -2.5, "logps/chosen": -326.0, "logps/rejected": -464.0, "loss": 0.4021, "rewards/accuracies": 0.824999988079071, "rewards/chosen": -1.53125, "rewards/margins": 1.453125, "rewards/rejected": -2.984375, "step": 1000 }, { "epoch": 0.07290839529343825, "grad_norm": 15.071837561832831, "learning_rate": 3.643578643578644e-07, "logits/chosen": -2.6875, "logits/rejected": -2.5625, "logps/chosen": -314.0, "logps/rejected": -452.0, "loss": 0.4045, "rewards/accuracies": 0.831250011920929, "rewards/chosen": -1.5625, "rewards/margins": 1.3671875, "rewards/rejected": -2.921875, "step": 1010 }, { "epoch": 0.07363026059337327, "grad_norm": 13.920977378141336, "learning_rate": 3.679653679653679e-07, "logits/chosen": -2.78125, "logits/rejected": -2.59375, "logps/chosen": -334.0, "logps/rejected": -492.0, "loss": 0.431, "rewards/accuracies": 0.8187500238418579, "rewards/chosen": -1.8125, "rewards/margins": 1.46875, "rewards/rejected": -3.28125, "step": 1020 }, { "epoch": 0.07435212589330831, "grad_norm": 11.085289038392293, "learning_rate": 3.7157287157287154e-07, "logits/chosen": -2.75, "logits/rejected": -2.5, "logps/chosen": -298.0, "logps/rejected": -456.0, "loss": 0.3934, "rewards/accuracies": 0.8125, "rewards/chosen": -1.5703125, "rewards/margins": 1.390625, "rewards/rejected": -2.96875, "step": 1030 }, { "epoch": 0.07507399119324334, "grad_norm": 10.088971897286424, "learning_rate": 3.751803751803752e-07, "logits/chosen": -2.78125, "logits/rejected": -2.625, "logps/chosen": -322.0, "logps/rejected": -456.0, "loss": 0.4073, "rewards/accuracies": 0.8687499761581421, "rewards/chosen": -1.7109375, "rewards/margins": 1.3515625, "rewards/rejected": -3.0625, "step": 1040 }, { "epoch": 0.07579585649317837, "grad_norm": 43.24163673888106, "learning_rate": 3.7878787878787876e-07, "logits/chosen": -2.59375, "logits/rejected": -2.375, "logps/chosen": -348.0, "logps/rejected": -496.0, "loss": 0.4152, "rewards/accuracies": 0.8062499761581421, "rewards/chosen": -1.890625, "rewards/margins": 1.25, "rewards/rejected": -3.140625, "step": 1050 }, { "epoch": 0.0765177217931134, "grad_norm": 8.537892452168746, "learning_rate": 3.823953823953824e-07, "logits/chosen": -2.59375, "logits/rejected": -2.40625, "logps/chosen": -338.0, "logps/rejected": -480.0, "loss": 0.3947, "rewards/accuracies": 0.824999988079071, "rewards/chosen": -1.765625, "rewards/margins": 1.5234375, "rewards/rejected": -3.296875, "step": 1060 }, { "epoch": 0.07723958709304844, "grad_norm": 9.485771716655114, "learning_rate": 3.86002886002886e-07, "logits/chosen": -2.625, "logits/rejected": -2.375, "logps/chosen": -326.0, "logps/rejected": -462.0, "loss": 0.3837, "rewards/accuracies": 0.78125, "rewards/chosen": -1.640625, "rewards/margins": 1.453125, "rewards/rejected": -3.09375, "step": 1070 }, { "epoch": 0.07796145239298347, "grad_norm": 9.46365785011617, "learning_rate": 3.896103896103896e-07, "logits/chosen": -2.625, "logits/rejected": -2.328125, "logps/chosen": -386.0, "logps/rejected": -536.0, "loss": 0.3848, "rewards/accuracies": 0.8187500238418579, "rewards/chosen": -2.15625, "rewards/margins": 1.7890625, "rewards/rejected": -3.9375, "step": 1080 }, { "epoch": 0.0786833176929185, "grad_norm": 13.461346342787172, "learning_rate": 3.9321789321789325e-07, "logits/chosen": -2.625, "logits/rejected": -2.453125, "logps/chosen": -360.0, "logps/rejected": -520.0, "loss": 0.3922, "rewards/accuracies": 0.800000011920929, "rewards/chosen": -1.875, "rewards/margins": 1.8984375, "rewards/rejected": -3.765625, "step": 1090 }, { "epoch": 0.07940518299285354, "grad_norm": 12.44634151581957, "learning_rate": 3.968253968253968e-07, "logits/chosen": -2.640625, "logits/rejected": -2.40625, "logps/chosen": -356.0, "logps/rejected": -508.0, "loss": 0.3727, "rewards/accuracies": 0.8125, "rewards/chosen": -2.015625, "rewards/margins": 1.5, "rewards/rejected": -3.515625, "step": 1100 }, { "epoch": 0.08012704829278856, "grad_norm": 11.687822831294243, "learning_rate": 4.004329004329004e-07, "logits/chosen": -2.75, "logits/rejected": -2.4375, "logps/chosen": -346.0, "logps/rejected": -568.0, "loss": 0.3765, "rewards/accuracies": 0.875, "rewards/chosen": -1.875, "rewards/margins": 2.171875, "rewards/rejected": -4.0625, "step": 1110 }, { "epoch": 0.0808489135927236, "grad_norm": 16.193115895860167, "learning_rate": 4.04040404040404e-07, "logits/chosen": -2.640625, "logits/rejected": -2.4375, "logps/chosen": -356.0, "logps/rejected": -532.0, "loss": 0.3726, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": -1.9921875, "rewards/margins": 1.6484375, "rewards/rejected": -3.65625, "step": 1120 }, { "epoch": 0.08157077889265862, "grad_norm": 10.454280347519187, "learning_rate": 4.0764790764790763e-07, "logits/chosen": -2.625, "logits/rejected": -2.421875, "logps/chosen": -350.0, "logps/rejected": -496.0, "loss": 0.4066, "rewards/accuracies": 0.831250011920929, "rewards/chosen": -1.78125, "rewards/margins": 1.515625, "rewards/rejected": -3.296875, "step": 1130 }, { "epoch": 0.08229264419259366, "grad_norm": 10.033847939954763, "learning_rate": 4.1125541125541127e-07, "logits/chosen": -2.765625, "logits/rejected": -2.5625, "logps/chosen": -334.0, "logps/rejected": -462.0, "loss": 0.355, "rewards/accuracies": 0.862500011920929, "rewards/chosen": -1.7890625, "rewards/margins": 1.3984375, "rewards/rejected": -3.1875, "step": 1140 }, { "epoch": 0.0830145094925287, "grad_norm": 13.538065077526934, "learning_rate": 4.1486291486291485e-07, "logits/chosen": -2.875, "logits/rejected": -2.6875, "logps/chosen": -398.0, "logps/rejected": -588.0, "loss": 0.3843, "rewards/accuracies": 0.831250011920929, "rewards/chosen": -2.1875, "rewards/margins": 2.078125, "rewards/rejected": -4.28125, "step": 1150 }, { "epoch": 0.08373637479246372, "grad_norm": 12.06165274825125, "learning_rate": 4.184704184704185e-07, "logits/chosen": -2.75, "logits/rejected": -2.484375, "logps/chosen": -314.0, "logps/rejected": -500.0, "loss": 0.3816, "rewards/accuracies": 0.7749999761581421, "rewards/chosen": -1.6796875, "rewards/margins": 1.7578125, "rewards/rejected": -3.4375, "step": 1160 }, { "epoch": 0.08445824009239876, "grad_norm": 14.245004620424362, "learning_rate": 4.22077922077922e-07, "logits/chosen": -2.703125, "logits/rejected": -2.640625, "logps/chosen": -376.0, "logps/rejected": -612.0, "loss": 0.3599, "rewards/accuracies": 0.84375, "rewards/chosen": -2.21875, "rewards/margins": 2.375, "rewards/rejected": -4.59375, "step": 1170 }, { "epoch": 0.0851801053923338, "grad_norm": 12.93467746542696, "learning_rate": 4.2568542568542565e-07, "logits/chosen": -2.765625, "logits/rejected": -2.578125, "logps/chosen": -330.0, "logps/rejected": -476.0, "loss": 0.3635, "rewards/accuracies": 0.831250011920929, "rewards/chosen": -1.75, "rewards/margins": 1.5859375, "rewards/rejected": -3.34375, "step": 1180 }, { "epoch": 0.08590197069226882, "grad_norm": 11.202101570401776, "learning_rate": 4.292929292929293e-07, "logits/chosen": -2.78125, "logits/rejected": -2.546875, "logps/chosen": -364.0, "logps/rejected": -536.0, "loss": 0.3583, "rewards/accuracies": 0.856249988079071, "rewards/chosen": -2.125, "rewards/margins": 1.8359375, "rewards/rejected": -3.953125, "step": 1190 }, { "epoch": 0.08662383599220386, "grad_norm": 10.771994466129188, "learning_rate": 4.3290043290043287e-07, "logits/chosen": -2.59375, "logits/rejected": -2.5, "logps/chosen": -358.0, "logps/rejected": -510.0, "loss": 0.3465, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": -1.8828125, "rewards/margins": 1.578125, "rewards/rejected": -3.46875, "step": 1200 }, { "epoch": 0.08734570129213888, "grad_norm": 14.841268368598595, "learning_rate": 4.365079365079365e-07, "logits/chosen": -2.703125, "logits/rejected": -2.578125, "logps/chosen": -364.0, "logps/rejected": -584.0, "loss": 0.3477, "rewards/accuracies": 0.84375, "rewards/chosen": -2.234375, "rewards/margins": 2.171875, "rewards/rejected": -4.40625, "step": 1210 }, { "epoch": 0.08806756659207392, "grad_norm": 9.504108427187644, "learning_rate": 4.401154401154401e-07, "logits/chosen": -2.875, "logits/rejected": -2.546875, "logps/chosen": -394.0, "logps/rejected": -648.0, "loss": 0.3755, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": -2.25, "rewards/margins": 2.703125, "rewards/rejected": -4.9375, "step": 1220 }, { "epoch": 0.08878943189200895, "grad_norm": 12.115514229718103, "learning_rate": 4.437229437229437e-07, "logits/chosen": -2.765625, "logits/rejected": -2.578125, "logps/chosen": -304.0, "logps/rejected": -520.0, "loss": 0.3704, "rewards/accuracies": 0.90625, "rewards/chosen": -1.5390625, "rewards/margins": 2.1875, "rewards/rejected": -3.71875, "step": 1230 }, { "epoch": 0.08951129719194398, "grad_norm": 10.317228267259349, "learning_rate": 4.4733044733044736e-07, "logits/chosen": -2.796875, "logits/rejected": -2.625, "logps/chosen": -420.0, "logps/rejected": -612.0, "loss": 0.3559, "rewards/accuracies": 0.8812500238418579, "rewards/chosen": -2.5, "rewards/margins": 1.9453125, "rewards/rejected": -4.46875, "step": 1240 }, { "epoch": 0.09023316249187902, "grad_norm": 11.197522859178363, "learning_rate": 4.509379509379509e-07, "logits/chosen": -2.671875, "logits/rejected": -2.546875, "logps/chosen": -428.0, "logps/rejected": -604.0, "loss": 0.3219, "rewards/accuracies": 0.8062499761581421, "rewards/chosen": -2.71875, "rewards/margins": 1.859375, "rewards/rejected": -4.59375, "step": 1250 }, { "epoch": 0.09095502779181405, "grad_norm": 13.497331724381818, "learning_rate": 4.545454545454545e-07, "logits/chosen": -2.703125, "logits/rejected": -2.453125, "logps/chosen": -412.0, "logps/rejected": -604.0, "loss": 0.3388, "rewards/accuracies": 0.824999988079071, "rewards/chosen": -2.546875, "rewards/margins": 1.9765625, "rewards/rejected": -4.53125, "step": 1260 }, { "epoch": 0.09167689309174908, "grad_norm": 11.433124284340494, "learning_rate": 4.581529581529581e-07, "logits/chosen": -2.671875, "logits/rejected": -2.5625, "logps/chosen": -390.0, "logps/rejected": -560.0, "loss": 0.3458, "rewards/accuracies": 0.875, "rewards/chosen": -2.234375, "rewards/margins": 1.7734375, "rewards/rejected": -4.0, "step": 1270 }, { "epoch": 0.09239875839168411, "grad_norm": 12.324384516756012, "learning_rate": 4.6176046176046174e-07, "logits/chosen": -2.71875, "logits/rejected": -2.5, "logps/chosen": -410.0, "logps/rejected": -580.0, "loss": 0.3426, "rewards/accuracies": 0.90625, "rewards/chosen": -2.328125, "rewards/margins": 1.890625, "rewards/rejected": -4.21875, "step": 1280 }, { "epoch": 0.09312062369161915, "grad_norm": 10.730987022263216, "learning_rate": 4.6536796536796537e-07, "logits/chosen": -2.671875, "logits/rejected": -2.390625, "logps/chosen": -442.0, "logps/rejected": -612.0, "loss": 0.3593, "rewards/accuracies": 0.831250011920929, "rewards/chosen": -2.828125, "rewards/margins": 1.7890625, "rewards/rejected": -4.625, "step": 1290 }, { "epoch": 0.09384248899155417, "grad_norm": 10.132938191746307, "learning_rate": 4.6897546897546896e-07, "logits/chosen": -2.734375, "logits/rejected": -2.578125, "logps/chosen": -408.0, "logps/rejected": -564.0, "loss": 0.3632, "rewards/accuracies": 0.84375, "rewards/chosen": -2.359375, "rewards/margins": 1.75, "rewards/rejected": -4.09375, "step": 1300 }, { "epoch": 0.09456435429148921, "grad_norm": 11.988621181927288, "learning_rate": 4.725829725829726e-07, "logits/chosen": -2.578125, "logits/rejected": -2.4375, "logps/chosen": -452.0, "logps/rejected": -624.0, "loss": 0.3609, "rewards/accuracies": 0.831250011920929, "rewards/chosen": -2.921875, "rewards/margins": 1.78125, "rewards/rejected": -4.71875, "step": 1310 }, { "epoch": 0.09528621959142423, "grad_norm": 8.802084815882347, "learning_rate": 4.761904761904761e-07, "logits/chosen": -2.671875, "logits/rejected": -2.515625, "logps/chosen": -458.0, "logps/rejected": -604.0, "loss": 0.3197, "rewards/accuracies": 0.800000011920929, "rewards/chosen": -2.9375, "rewards/margins": 1.5859375, "rewards/rejected": -4.53125, "step": 1320 }, { "epoch": 0.09600808489135927, "grad_norm": 13.978035740824382, "learning_rate": 4.797979797979798e-07, "logits/chosen": -2.6875, "logits/rejected": -2.4375, "logps/chosen": -420.0, "logps/rejected": -660.0, "loss": 0.355, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": -2.703125, "rewards/margins": 2.46875, "rewards/rejected": -5.15625, "step": 1330 }, { "epoch": 0.09672995019129431, "grad_norm": 9.329953252240916, "learning_rate": 4.834054834054833e-07, "logits/chosen": -2.71875, "logits/rejected": -2.53125, "logps/chosen": -426.0, "logps/rejected": -612.0, "loss": 0.3382, "rewards/accuracies": 0.875, "rewards/chosen": -2.703125, "rewards/margins": 1.8203125, "rewards/rejected": -4.53125, "step": 1340 }, { "epoch": 0.09745181549122933, "grad_norm": 14.354032725201476, "learning_rate": 4.87012987012987e-07, "logits/chosen": -2.625, "logits/rejected": -2.390625, "logps/chosen": -438.0, "logps/rejected": -628.0, "loss": 0.3375, "rewards/accuracies": 0.856249988079071, "rewards/chosen": -2.53125, "rewards/margins": 2.15625, "rewards/rejected": -4.6875, "step": 1350 }, { "epoch": 0.09817368079116437, "grad_norm": 11.184165035806638, "learning_rate": 4.906204906204906e-07, "logits/chosen": -2.765625, "logits/rejected": -2.5, "logps/chosen": -444.0, "logps/rejected": -640.0, "loss": 0.3528, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -2.6875, "rewards/margins": 2.015625, "rewards/rejected": -4.6875, "step": 1360 }, { "epoch": 0.0988955460910994, "grad_norm": 9.32730305340813, "learning_rate": 4.942279942279942e-07, "logits/chosen": -2.6875, "logits/rejected": -2.515625, "logps/chosen": -420.0, "logps/rejected": -592.0, "loss": 0.3343, "rewards/accuracies": 0.862500011920929, "rewards/chosen": -2.609375, "rewards/margins": 1.9375, "rewards/rejected": -4.53125, "step": 1370 }, { "epoch": 0.09961741139103443, "grad_norm": 17.291834755334516, "learning_rate": 4.978354978354979e-07, "logits/chosen": -2.765625, "logits/rejected": -2.671875, "logps/chosen": -450.0, "logps/rejected": -636.0, "loss": 0.3246, "rewards/accuracies": 0.856249988079071, "rewards/chosen": -2.71875, "rewards/margins": 1.9765625, "rewards/rejected": -4.6875, "step": 1380 }, { "epoch": 0.10033927669096947, "grad_norm": 10.743034154219572, "learning_rate": 4.999998729993963e-07, "logits/chosen": -2.828125, "logits/rejected": -2.53125, "logps/chosen": -430.0, "logps/rejected": -604.0, "loss": 0.3335, "rewards/accuracies": 0.84375, "rewards/chosen": -2.6875, "rewards/margins": 1.8984375, "rewards/rejected": -4.59375, "step": 1390 }, { "epoch": 0.10106114199090449, "grad_norm": 17.190340388139088, "learning_rate": 4.999984442440868e-07, "logits/chosen": -2.96875, "logits/rejected": -2.703125, "logps/chosen": -438.0, "logps/rejected": -680.0, "loss": 0.3204, "rewards/accuracies": 0.84375, "rewards/chosen": -2.984375, "rewards/margins": 2.453125, "rewards/rejected": -5.4375, "step": 1400 }, { "epoch": 0.10178300729083953, "grad_norm": 9.641498367561857, "learning_rate": 4.99995427991816e-07, "logits/chosen": -2.703125, "logits/rejected": -2.53125, "logps/chosen": -442.0, "logps/rejected": -648.0, "loss": 0.3379, "rewards/accuracies": 0.862500011920929, "rewards/chosen": -2.71875, "rewards/margins": 2.171875, "rewards/rejected": -4.875, "step": 1410 }, { "epoch": 0.10250487259077457, "grad_norm": 9.768069678095703, "learning_rate": 4.999908242617371e-07, "logits/chosen": -2.84375, "logits/rejected": -2.609375, "logps/chosen": -452.0, "logps/rejected": -648.0, "loss": 0.34, "rewards/accuracies": 0.887499988079071, "rewards/chosen": -2.765625, "rewards/margins": 1.84375, "rewards/rejected": -4.59375, "step": 1420 }, { "epoch": 0.10322673789070959, "grad_norm": 13.37422488078675, "learning_rate": 4.99984633083084e-07, "logits/chosen": -2.765625, "logits/rejected": -2.578125, "logps/chosen": -416.0, "logps/rejected": -616.0, "loss": 0.331, "rewards/accuracies": 0.862500011920929, "rewards/chosen": -2.6875, "rewards/margins": 1.8984375, "rewards/rejected": -4.5625, "step": 1430 }, { "epoch": 0.10394860319064463, "grad_norm": 11.253293027609532, "learning_rate": 4.99976854495171e-07, "logits/chosen": -2.765625, "logits/rejected": -2.625, "logps/chosen": -488.0, "logps/rejected": -696.0, "loss": 0.3218, "rewards/accuracies": 0.8687499761581421, "rewards/chosen": -3.453125, "rewards/margins": 2.09375, "rewards/rejected": -5.53125, "step": 1440 }, { "epoch": 0.10467046849057966, "grad_norm": 10.82613372416563, "learning_rate": 4.999674885473922e-07, "logits/chosen": -2.90625, "logits/rejected": -2.484375, "logps/chosen": -458.0, "logps/rejected": -656.0, "loss": 0.3213, "rewards/accuracies": 0.887499988079071, "rewards/chosen": -2.921875, "rewards/margins": 1.734375, "rewards/rejected": -4.65625, "step": 1450 }, { "epoch": 0.10539233379051469, "grad_norm": 15.794446739298891, "learning_rate": 4.999565352992216e-07, "logits/chosen": -2.8125, "logits/rejected": -2.6875, "logps/chosen": -502.0, "logps/rejected": -712.0, "loss": 0.3289, "rewards/accuracies": 0.90625, "rewards/chosen": -3.21875, "rewards/margins": 2.296875, "rewards/rejected": -5.5, "step": 1460 }, { "epoch": 0.10611419909044972, "grad_norm": 10.361664841175285, "learning_rate": 4.999439948202127e-07, "logits/chosen": -2.859375, "logits/rejected": -2.609375, "logps/chosen": -450.0, "logps/rejected": -596.0, "loss": 0.3261, "rewards/accuracies": 0.84375, "rewards/chosen": -2.859375, "rewards/margins": 1.8515625, "rewards/rejected": -4.71875, "step": 1470 }, { "epoch": 0.10683606439038476, "grad_norm": 10.555951221100015, "learning_rate": 4.999298671899977e-07, "logits/chosen": -2.71875, "logits/rejected": -2.5625, "logps/chosen": -452.0, "logps/rejected": -644.0, "loss": 0.3399, "rewards/accuracies": 0.875, "rewards/chosen": -2.75, "rewards/margins": 2.171875, "rewards/rejected": -4.9375, "step": 1480 }, { "epoch": 0.10755792969031978, "grad_norm": 9.802204192641314, "learning_rate": 4.999141524982877e-07, "logits/chosen": -2.734375, "logits/rejected": -2.515625, "logps/chosen": -444.0, "logps/rejected": -700.0, "loss": 0.309, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -2.84375, "rewards/margins": 2.6875, "rewards/rejected": -5.53125, "step": 1490 }, { "epoch": 0.10827979499025482, "grad_norm": 12.72303480502336, "learning_rate": 4.998968508448714e-07, "logits/chosen": -2.640625, "logits/rejected": -2.453125, "logps/chosen": -432.0, "logps/rejected": -632.0, "loss": 0.3276, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -2.625, "rewards/margins": 2.15625, "rewards/rejected": -4.78125, "step": 1500 }, { "epoch": 0.10900166029018984, "grad_norm": 14.570251314538908, "learning_rate": 4.998779623396146e-07, "logits/chosen": -2.671875, "logits/rejected": -2.46875, "logps/chosen": -502.0, "logps/rejected": -720.0, "loss": 0.2995, "rewards/accuracies": 0.856249988079071, "rewards/chosen": -3.140625, "rewards/margins": 2.5, "rewards/rejected": -5.65625, "step": 1510 }, { "epoch": 0.10972352559012488, "grad_norm": 11.169758259343533, "learning_rate": 4.9985748710246e-07, "logits/chosen": -2.59375, "logits/rejected": -2.421875, "logps/chosen": -476.0, "logps/rejected": -656.0, "loss": 0.3344, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -3.21875, "rewards/margins": 1.84375, "rewards/rejected": -5.0625, "step": 1520 }, { "epoch": 0.11044539089005992, "grad_norm": 10.504554948014457, "learning_rate": 4.998354252634257e-07, "logits/chosen": -2.609375, "logits/rejected": -2.46875, "logps/chosen": -486.0, "logps/rejected": -668.0, "loss": 0.2853, "rewards/accuracies": 0.862500011920929, "rewards/chosen": -3.21875, "rewards/margins": 2.078125, "rewards/rejected": -5.28125, "step": 1530 }, { "epoch": 0.11116725618999494, "grad_norm": 15.073212833972551, "learning_rate": 4.998117769626051e-07, "logits/chosen": -2.796875, "logits/rejected": -2.703125, "logps/chosen": -456.0, "logps/rejected": -676.0, "loss": 0.309, "rewards/accuracies": 0.8187500238418579, "rewards/chosen": -2.984375, "rewards/margins": 2.25, "rewards/rejected": -5.21875, "step": 1540 }, { "epoch": 0.11188912148992998, "grad_norm": 10.298569511142073, "learning_rate": 4.997865423501657e-07, "logits/chosen": -2.734375, "logits/rejected": -2.53125, "logps/chosen": -380.0, "logps/rejected": -564.0, "loss": 0.3261, "rewards/accuracies": 0.84375, "rewards/chosen": -2.328125, "rewards/margins": 1.8828125, "rewards/rejected": -4.21875, "step": 1550 }, { "epoch": 0.11261098678986502, "grad_norm": 11.022262328486809, "learning_rate": 4.997597215863477e-07, "logits/chosen": -2.6875, "logits/rejected": -2.546875, "logps/chosen": -480.0, "logps/rejected": -716.0, "loss": 0.2878, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -3.09375, "rewards/margins": 2.59375, "rewards/rejected": -5.6875, "step": 1560 }, { "epoch": 0.11333285208980004, "grad_norm": 12.425423187064853, "learning_rate": 4.99731314841464e-07, "logits/chosen": -2.640625, "logits/rejected": -2.53125, "logps/chosen": -500.0, "logps/rejected": -704.0, "loss": 0.3008, "rewards/accuracies": 0.862500011920929, "rewards/chosen": -3.390625, "rewards/margins": 2.1875, "rewards/rejected": -5.5625, "step": 1570 }, { "epoch": 0.11405471738973508, "grad_norm": 10.996930809431353, "learning_rate": 4.997013222958978e-07, "logits/chosen": -2.625, "logits/rejected": -2.546875, "logps/chosen": -496.0, "logps/rejected": -732.0, "loss": 0.3105, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -3.234375, "rewards/margins": 2.578125, "rewards/rejected": -5.8125, "step": 1580 }, { "epoch": 0.1147765826896701, "grad_norm": 11.11449736666811, "learning_rate": 4.99669744140103e-07, "logits/chosen": -2.640625, "logits/rejected": -2.53125, "logps/chosen": -512.0, "logps/rejected": -716.0, "loss": 0.3043, "rewards/accuracies": 0.862500011920929, "rewards/chosen": -3.75, "rewards/margins": 2.09375, "rewards/rejected": -5.84375, "step": 1590 }, { "epoch": 0.11549844798960514, "grad_norm": 10.155961204890554, "learning_rate": 4.996365805746015e-07, "logits/chosen": -2.671875, "logits/rejected": -2.5625, "logps/chosen": -474.0, "logps/rejected": -752.0, "loss": 0.2908, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -3.234375, "rewards/margins": 2.796875, "rewards/rejected": -6.03125, "step": 1600 }, { "epoch": 0.11622031328954018, "grad_norm": 9.079844890608808, "learning_rate": 4.996018318099829e-07, "logits/chosen": -2.421875, "logits/rejected": -2.28125, "logps/chosen": -506.0, "logps/rejected": -712.0, "loss": 0.2977, "rewards/accuracies": 0.84375, "rewards/chosen": -3.46875, "rewards/margins": 2.171875, "rewards/rejected": -5.65625, "step": 1610 }, { "epoch": 0.1169421785894752, "grad_norm": 13.337729397169802, "learning_rate": 4.995654980669028e-07, "logits/chosen": -2.859375, "logits/rejected": -2.5, "logps/chosen": -476.0, "logps/rejected": -748.0, "loss": 0.2937, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -3.03125, "rewards/margins": 2.875, "rewards/rejected": -5.90625, "step": 1620 }, { "epoch": 0.11766404388941024, "grad_norm": 9.987891055540013, "learning_rate": 4.995275795760816e-07, "logits/chosen": -2.84375, "logits/rejected": -2.734375, "logps/chosen": -454.0, "logps/rejected": -660.0, "loss": 0.2991, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": -2.953125, "rewards/margins": 2.109375, "rewards/rejected": -5.0625, "step": 1630 }, { "epoch": 0.11838590918934527, "grad_norm": 12.804317711855225, "learning_rate": 4.994880765783026e-07, "logits/chosen": -2.75, "logits/rejected": -2.671875, "logps/chosen": -484.0, "logps/rejected": -672.0, "loss": 0.2883, "rewards/accuracies": 0.862500011920929, "rewards/chosen": -3.109375, "rewards/margins": 2.015625, "rewards/rejected": -5.125, "step": 1640 }, { "epoch": 0.1191077744892803, "grad_norm": 11.589955875632223, "learning_rate": 4.99446989324411e-07, "logits/chosen": -2.765625, "logits/rejected": -2.5625, "logps/chosen": -470.0, "logps/rejected": -756.0, "loss": 0.2847, "rewards/accuracies": 0.875, "rewards/chosen": -2.953125, "rewards/margins": 3.046875, "rewards/rejected": -6.0, "step": 1650 }, { "epoch": 0.11982963978921533, "grad_norm": 14.992092750756044, "learning_rate": 4.99404318075312e-07, "logits/chosen": -2.640625, "logits/rejected": -2.546875, "logps/chosen": -488.0, "logps/rejected": -672.0, "loss": 0.2926, "rewards/accuracies": 0.84375, "rewards/chosen": -3.21875, "rewards/margins": 2.125, "rewards/rejected": -5.34375, "step": 1660 }, { "epoch": 0.12055150508915037, "grad_norm": 14.63652475825442, "learning_rate": 4.993600631019689e-07, "logits/chosen": -2.671875, "logits/rejected": -2.578125, "logps/chosen": -484.0, "logps/rejected": -680.0, "loss": 0.3115, "rewards/accuracies": 0.875, "rewards/chosen": -3.328125, "rewards/margins": 1.984375, "rewards/rejected": -5.3125, "step": 1670 }, { "epoch": 0.1212733703890854, "grad_norm": 10.01896442134856, "learning_rate": 4.993142246854024e-07, "logits/chosen": -2.78125, "logits/rejected": -2.59375, "logps/chosen": -434.0, "logps/rejected": -656.0, "loss": 0.2917, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -2.84375, "rewards/margins": 2.15625, "rewards/rejected": -5.0, "step": 1680 }, { "epoch": 0.12199523568902043, "grad_norm": 10.480137264657502, "learning_rate": 4.992668031166876e-07, "logits/chosen": -2.828125, "logits/rejected": -2.703125, "logps/chosen": -444.0, "logps/rejected": -672.0, "loss": 0.3114, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -2.90625, "rewards/margins": 2.421875, "rewards/rejected": -5.34375, "step": 1690 }, { "epoch": 0.12271710098895545, "grad_norm": 9.543166172183264, "learning_rate": 4.992177986969526e-07, "logits/chosen": -2.75, "logits/rejected": -2.484375, "logps/chosen": -430.0, "logps/rejected": -624.0, "loss": 0.3235, "rewards/accuracies": 0.875, "rewards/chosen": -2.71875, "rewards/margins": 1.890625, "rewards/rejected": -4.59375, "step": 1700 }, { "epoch": 0.12343896628889049, "grad_norm": 9.39264085167921, "learning_rate": 4.991672117373769e-07, "logits/chosen": -2.765625, "logits/rejected": -2.5625, "logps/chosen": -452.0, "logps/rejected": -712.0, "loss": 0.2971, "rewards/accuracies": 0.856249988079071, "rewards/chosen": -2.796875, "rewards/margins": 2.625, "rewards/rejected": -5.4375, "step": 1710 }, { "epoch": 0.12416083158882553, "grad_norm": 9.35509206624716, "learning_rate": 4.991150425591891e-07, "logits/chosen": -2.765625, "logits/rejected": -2.46875, "logps/chosen": -448.0, "logps/rejected": -700.0, "loss": 0.2908, "rewards/accuracies": 0.8687499761581421, "rewards/chosen": -2.96875, "rewards/margins": 2.5625, "rewards/rejected": -5.53125, "step": 1720 }, { "epoch": 0.12488269688876055, "grad_norm": 9.262201280713281, "learning_rate": 4.99061291493665e-07, "logits/chosen": -2.890625, "logits/rejected": -2.625, "logps/chosen": -444.0, "logps/rejected": -676.0, "loss": 0.2925, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -2.859375, "rewards/margins": 2.453125, "rewards/rejected": -5.3125, "step": 1730 }, { "epoch": 0.1256045621886956, "grad_norm": 10.008148122591312, "learning_rate": 4.99005958882125e-07, "logits/chosen": -2.78125, "logits/rejected": -2.609375, "logps/chosen": -450.0, "logps/rejected": -684.0, "loss": 0.3133, "rewards/accuracies": 0.824999988079071, "rewards/chosen": -2.953125, "rewards/margins": 2.359375, "rewards/rejected": -5.3125, "step": 1740 }, { "epoch": 0.12632642748863063, "grad_norm": 8.554136981806407, "learning_rate": 4.989490450759331e-07, "logits/chosen": -2.890625, "logits/rejected": -2.625, "logps/chosen": -482.0, "logps/rejected": -696.0, "loss": 0.2649, "rewards/accuracies": 0.84375, "rewards/chosen": -3.125, "rewards/margins": 2.3125, "rewards/rejected": -5.4375, "step": 1750 }, { "epoch": 0.12704829278856566, "grad_norm": 8.929491173417231, "learning_rate": 4.988905504364933e-07, "logits/chosen": -2.78125, "logits/rejected": -2.578125, "logps/chosen": -516.0, "logps/rejected": -768.0, "loss": 0.2715, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -3.40625, "rewards/margins": 2.703125, "rewards/rejected": -6.09375, "step": 1760 }, { "epoch": 0.12777015808850067, "grad_norm": 19.85583075822656, "learning_rate": 4.988304753352482e-07, "logits/chosen": -2.796875, "logits/rejected": -2.609375, "logps/chosen": -454.0, "logps/rejected": -744.0, "loss": 0.2838, "rewards/accuracies": 0.875, "rewards/chosen": -3.046875, "rewards/margins": 2.84375, "rewards/rejected": -5.875, "step": 1770 }, { "epoch": 0.1284920233884357, "grad_norm": 11.573857511888404, "learning_rate": 4.987688201536764e-07, "logits/chosen": -2.671875, "logits/rejected": -2.453125, "logps/chosen": -404.0, "logps/rejected": -636.0, "loss": 0.3207, "rewards/accuracies": 0.875, "rewards/chosen": -2.375, "rewards/margins": 2.453125, "rewards/rejected": -4.84375, "step": 1780 }, { "epoch": 0.12921388868837075, "grad_norm": 10.767926076980798, "learning_rate": 4.987055852832899e-07, "logits/chosen": -2.734375, "logits/rejected": -2.625, "logps/chosen": -504.0, "logps/rejected": -784.0, "loss": 0.2768, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -3.296875, "rewards/margins": 2.859375, "rewards/rejected": -6.15625, "step": 1790 }, { "epoch": 0.12993575398830579, "grad_norm": 9.480524665881354, "learning_rate": 4.986407711256319e-07, "logits/chosen": -2.71875, "logits/rejected": -2.46875, "logps/chosen": -434.0, "logps/rejected": -656.0, "loss": 0.2996, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": -2.8125, "rewards/margins": 2.203125, "rewards/rejected": -5.0, "step": 1800 }, { "epoch": 0.13065761928824082, "grad_norm": 11.059595953397832, "learning_rate": 4.98574378092274e-07, "logits/chosen": -2.890625, "logits/rejected": -2.6875, "logps/chosen": -506.0, "logps/rejected": -760.0, "loss": 0.2706, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -3.40625, "rewards/margins": 2.828125, "rewards/rejected": -6.21875, "step": 1810 }, { "epoch": 0.13137948458817586, "grad_norm": 12.559652259820835, "learning_rate": 4.985064066048139e-07, "logits/chosen": -2.6875, "logits/rejected": -2.40625, "logps/chosen": -424.0, "logps/rejected": -660.0, "loss": 0.3016, "rewards/accuracies": 0.875, "rewards/chosen": -2.625, "rewards/margins": 2.375, "rewards/rejected": -5.0, "step": 1820 }, { "epoch": 0.13210134988811087, "grad_norm": 16.780300866871737, "learning_rate": 4.984368570948724e-07, "logits/chosen": -2.734375, "logits/rejected": -2.484375, "logps/chosen": -444.0, "logps/rejected": -704.0, "loss": 0.2943, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -2.828125, "rewards/margins": 2.515625, "rewards/rejected": -5.34375, "step": 1830 }, { "epoch": 0.1328232151880459, "grad_norm": 10.65248837076819, "learning_rate": 4.983657300040907e-07, "logits/chosen": -2.78125, "logits/rejected": -2.65625, "logps/chosen": -472.0, "logps/rejected": -704.0, "loss": 0.2699, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": -3.25, "rewards/margins": 2.484375, "rewards/rejected": -5.75, "step": 1840 }, { "epoch": 0.13354508048798094, "grad_norm": 10.948003648298677, "learning_rate": 4.982930257841278e-07, "logits/chosen": -2.828125, "logits/rejected": -2.453125, "logps/chosen": -456.0, "logps/rejected": -728.0, "loss": 0.2941, "rewards/accuracies": 0.8812500238418579, "rewards/chosen": -2.96875, "rewards/margins": 2.78125, "rewards/rejected": -5.75, "step": 1850 }, { "epoch": 0.13426694578791598, "grad_norm": 12.047287233162004, "learning_rate": 4.982187448966575e-07, "logits/chosen": -2.65625, "logits/rejected": -2.46875, "logps/chosen": -536.0, "logps/rejected": -768.0, "loss": 0.2898, "rewards/accuracies": 0.875, "rewards/chosen": -3.640625, "rewards/margins": 2.390625, "rewards/rejected": -6.03125, "step": 1860 }, { "epoch": 0.13498881108785102, "grad_norm": 14.9941388186048, "learning_rate": 4.981428878133656e-07, "logits/chosen": -2.8125, "logits/rejected": -2.4375, "logps/chosen": -468.0, "logps/rejected": -772.0, "loss": 0.2811, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -3.109375, "rewards/margins": 3.09375, "rewards/rejected": -6.1875, "step": 1870 }, { "epoch": 0.13571067638778603, "grad_norm": 9.951835424657778, "learning_rate": 4.980654550159463e-07, "logits/chosen": -2.84375, "logits/rejected": -2.609375, "logps/chosen": -492.0, "logps/rejected": -708.0, "loss": 0.2732, "rewards/accuracies": 0.875, "rewards/chosen": -3.1875, "rewards/margins": 2.5, "rewards/rejected": -5.6875, "step": 1880 }, { "epoch": 0.13643254168772107, "grad_norm": 8.861361984310934, "learning_rate": 4.979864469961004e-07, "logits/chosen": -2.796875, "logits/rejected": -2.578125, "logps/chosen": -464.0, "logps/rejected": -716.0, "loss": 0.2762, "rewards/accuracies": 0.8812500238418579, "rewards/chosen": -3.078125, "rewards/margins": 2.671875, "rewards/rejected": -5.75, "step": 1890 }, { "epoch": 0.1371544069876561, "grad_norm": 9.692735634395657, "learning_rate": 4.979058642555307e-07, "logits/chosen": -2.859375, "logits/rejected": -2.578125, "logps/chosen": -452.0, "logps/rejected": -676.0, "loss": 0.2931, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -2.84375, "rewards/margins": 2.46875, "rewards/rejected": -5.3125, "step": 1900 }, { "epoch": 0.13787627228759114, "grad_norm": 9.565594633496087, "learning_rate": 4.978237073059399e-07, "logits/chosen": -2.703125, "logits/rejected": -2.515625, "logps/chosen": -464.0, "logps/rejected": -676.0, "loss": 0.2898, "rewards/accuracies": 0.8812500238418579, "rewards/chosen": -3.078125, "rewards/margins": 2.171875, "rewards/rejected": -5.25, "step": 1910 }, { "epoch": 0.13859813758752618, "grad_norm": 11.007909649107406, "learning_rate": 4.977399766690269e-07, "logits/chosen": -2.59375, "logits/rejected": -2.40625, "logps/chosen": -498.0, "logps/rejected": -796.0, "loss": 0.2902, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -3.1875, "rewards/margins": 3.109375, "rewards/rejected": -6.3125, "step": 1920 }, { "epoch": 0.1393200028874612, "grad_norm": 9.107456714393756, "learning_rate": 4.976546728764836e-07, "logits/chosen": -2.59375, "logits/rejected": -2.421875, "logps/chosen": -498.0, "logps/rejected": -724.0, "loss": 0.284, "rewards/accuracies": 0.887499988079071, "rewards/chosen": -3.3125, "rewards/margins": 2.4375, "rewards/rejected": -5.75, "step": 1930 }, { "epoch": 0.14004186818739622, "grad_norm": 8.927298343498093, "learning_rate": 4.975677964699912e-07, "logits/chosen": -2.59375, "logits/rejected": -2.40625, "logps/chosen": -502.0, "logps/rejected": -776.0, "loss": 0.2524, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -3.5625, "rewards/margins": 2.796875, "rewards/rejected": -6.34375, "step": 1940 }, { "epoch": 0.14076373348733126, "grad_norm": 10.144209347121677, "learning_rate": 4.974793480012174e-07, "logits/chosen": -2.734375, "logits/rejected": -2.515625, "logps/chosen": -464.0, "logps/rejected": -716.0, "loss": 0.2621, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -2.859375, "rewards/margins": 2.6875, "rewards/rejected": -5.5625, "step": 1950 }, { "epoch": 0.1414855987872663, "grad_norm": 7.533895015502329, "learning_rate": 4.973893280318125e-07, "logits/chosen": -2.890625, "logits/rejected": -2.734375, "logps/chosen": -492.0, "logps/rejected": -764.0, "loss": 0.2844, "rewards/accuracies": 0.887499988079071, "rewards/chosen": -3.34375, "rewards/margins": 2.796875, "rewards/rejected": -6.125, "step": 1960 }, { "epoch": 0.14220746408720134, "grad_norm": 13.017212573238576, "learning_rate": 4.972977371334056e-07, "logits/chosen": -2.65625, "logits/rejected": -2.5, "logps/chosen": -424.0, "logps/rejected": -672.0, "loss": 0.2873, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -2.5, "rewards/margins": 2.46875, "rewards/rejected": -4.96875, "step": 1970 }, { "epoch": 0.14292932938713637, "grad_norm": 8.958119059657708, "learning_rate": 4.972045758876014e-07, "logits/chosen": -2.8125, "logits/rejected": -2.59375, "logps/chosen": -488.0, "logps/rejected": -724.0, "loss": 0.2477, "rewards/accuracies": 0.831250011920929, "rewards/chosen": -3.265625, "rewards/margins": 2.359375, "rewards/rejected": -5.625, "step": 1980 }, { "epoch": 0.14365119468707138, "grad_norm": 10.493203877125167, "learning_rate": 4.971098448859766e-07, "logits/chosen": -2.75, "logits/rejected": -2.6875, "logps/chosen": -488.0, "logps/rejected": -692.0, "loss": 0.2933, "rewards/accuracies": 0.875, "rewards/chosen": -3.265625, "rewards/margins": 2.234375, "rewards/rejected": -5.5, "step": 1990 }, { "epoch": 0.14437305998700642, "grad_norm": 9.973862051012356, "learning_rate": 4.970135447300752e-07, "logits/chosen": -2.59375, "logits/rejected": -2.3125, "logps/chosen": -516.0, "logps/rejected": -788.0, "loss": 0.2595, "rewards/accuracies": 0.8687499761581421, "rewards/chosen": -3.5, "rewards/margins": 2.5625, "rewards/rejected": -6.0625, "step": 2000 }, { "epoch": 0.14509492528694146, "grad_norm": 13.28264552294119, "learning_rate": 4.969156760314064e-07, "logits/chosen": -2.65625, "logits/rejected": -2.453125, "logps/chosen": -524.0, "logps/rejected": -796.0, "loss": 0.2904, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -3.640625, "rewards/margins": 2.703125, "rewards/rejected": -6.34375, "step": 2010 }, { "epoch": 0.1458167905868765, "grad_norm": 8.872169286182675, "learning_rate": 4.968162394114387e-07, "logits/chosen": -2.5625, "logits/rejected": -2.46875, "logps/chosen": -488.0, "logps/rejected": -744.0, "loss": 0.2523, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -3.265625, "rewards/margins": 2.703125, "rewards/rejected": -5.96875, "step": 2020 }, { "epoch": 0.14653865588681153, "grad_norm": 12.757195149734072, "learning_rate": 4.967152355015974e-07, "logits/chosen": -2.609375, "logits/rejected": -2.546875, "logps/chosen": -478.0, "logps/rejected": -724.0, "loss": 0.2783, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -3.375, "rewards/margins": 2.5625, "rewards/rejected": -5.9375, "step": 2030 }, { "epoch": 0.14726052118674654, "grad_norm": 12.796953074989913, "learning_rate": 4.966126649432603e-07, "logits/chosen": -2.796875, "logits/rejected": -2.625, "logps/chosen": -496.0, "logps/rejected": -780.0, "loss": 0.2723, "rewards/accuracies": 0.8812500238418579, "rewards/chosen": -3.53125, "rewards/margins": 2.578125, "rewards/rejected": -6.125, "step": 2040 }, { "epoch": 0.14798238648668158, "grad_norm": 19.108616982264344, "learning_rate": 4.96508528387753e-07, "logits/chosen": -3.0625, "logits/rejected": -2.828125, "logps/chosen": -540.0, "logps/rejected": -812.0, "loss": 0.2763, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -3.96875, "rewards/margins": 2.734375, "rewards/rejected": -6.6875, "step": 2050 }, { "epoch": 0.14870425178661661, "grad_norm": 9.380783201026548, "learning_rate": 4.964028264963456e-07, "logits/chosen": -2.890625, "logits/rejected": -2.625, "logps/chosen": -516.0, "logps/rejected": -800.0, "loss": 0.2822, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -3.46875, "rewards/margins": 2.71875, "rewards/rejected": -6.1875, "step": 2060 }, { "epoch": 0.14942611708655165, "grad_norm": 10.81595001993398, "learning_rate": 4.962955599402481e-07, "logits/chosen": -2.703125, "logits/rejected": -2.53125, "logps/chosen": -560.0, "logps/rejected": -784.0, "loss": 0.266, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": -4.0, "rewards/margins": 2.25, "rewards/rejected": -6.25, "step": 2070 }, { "epoch": 0.1501479823864867, "grad_norm": 11.456291625001526, "learning_rate": 4.961867294006059e-07, "logits/chosen": -2.921875, "logits/rejected": -2.796875, "logps/chosen": -608.0, "logps/rejected": -836.0, "loss": 0.3064, "rewards/accuracies": 0.800000011920929, "rewards/chosen": -4.46875, "rewards/margins": 2.40625, "rewards/rejected": -6.875, "step": 2080 }, { "epoch": 0.15086984768642173, "grad_norm": 7.960182686516041, "learning_rate": 4.96076335568496e-07, "logits/chosen": -2.765625, "logits/rejected": -2.5625, "logps/chosen": -516.0, "logps/rejected": -776.0, "loss": 0.2467, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -3.4375, "rewards/margins": 2.765625, "rewards/rejected": -6.21875, "step": 2090 }, { "epoch": 0.15159171298635674, "grad_norm": 10.25400623338689, "learning_rate": 4.959643791449222e-07, "logits/chosen": -2.75, "logits/rejected": -2.625, "logps/chosen": -564.0, "logps/rejected": -788.0, "loss": 0.2977, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -3.796875, "rewards/margins": 2.5625, "rewards/rejected": -6.375, "step": 2100 }, { "epoch": 0.15231357828629177, "grad_norm": 10.09340211565806, "learning_rate": 4.958508608408109e-07, "logits/chosen": -2.625, "logits/rejected": -2.4375, "logps/chosen": -544.0, "logps/rejected": -736.0, "loss": 0.2829, "rewards/accuracies": 0.824999988079071, "rewards/chosen": -3.921875, "rewards/margins": 2.03125, "rewards/rejected": -5.9375, "step": 2110 }, { "epoch": 0.1530354435862268, "grad_norm": 8.537784621679538, "learning_rate": 4.957357813770064e-07, "logits/chosen": -2.828125, "logits/rejected": -2.46875, "logps/chosen": -596.0, "logps/rejected": -860.0, "loss": 0.2479, "rewards/accuracies": 0.90625, "rewards/chosen": -4.28125, "rewards/margins": 2.765625, "rewards/rejected": -7.03125, "step": 2120 }, { "epoch": 0.15375730888616185, "grad_norm": 8.985222338453365, "learning_rate": 4.956191414842665e-07, "logits/chosen": -2.96875, "logits/rejected": -2.71875, "logps/chosen": -572.0, "logps/rejected": -860.0, "loss": 0.2629, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -4.1875, "rewards/margins": 2.84375, "rewards/rejected": -7.03125, "step": 2130 }, { "epoch": 0.15447917418609688, "grad_norm": 10.993021927824719, "learning_rate": 4.955009419032575e-07, "logits/chosen": -2.75, "logits/rejected": -2.515625, "logps/chosen": -572.0, "logps/rejected": -840.0, "loss": 0.2681, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -4.0, "rewards/margins": 2.8125, "rewards/rejected": -6.8125, "step": 2140 }, { "epoch": 0.1552010394860319, "grad_norm": 11.792550816411442, "learning_rate": 4.953811833845503e-07, "logits/chosen": -2.71875, "logits/rejected": -2.484375, "logps/chosen": -528.0, "logps/rejected": -756.0, "loss": 0.265, "rewards/accuracies": 0.862500011920929, "rewards/chosen": -3.75, "rewards/margins": 2.328125, "rewards/rejected": -6.0625, "step": 2150 }, { "epoch": 0.15592290478596693, "grad_norm": 13.163433586155344, "learning_rate": 4.952598666886145e-07, "logits/chosen": -2.734375, "logits/rejected": -2.515625, "logps/chosen": -600.0, "logps/rejected": -856.0, "loss": 0.2516, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -4.3125, "rewards/margins": 2.6875, "rewards/rejected": -7.0, "step": 2160 }, { "epoch": 0.15664477008590197, "grad_norm": 15.36607001210862, "learning_rate": 4.951369925858147e-07, "logits/chosen": -2.78125, "logits/rejected": -2.609375, "logps/chosen": -544.0, "logps/rejected": -792.0, "loss": 0.2598, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -3.796875, "rewards/margins": 2.703125, "rewards/rejected": -6.5, "step": 2170 }, { "epoch": 0.157366635385837, "grad_norm": 8.701540096554936, "learning_rate": 4.950125618564046e-07, "logits/chosen": -2.875, "logits/rejected": -2.765625, "logps/chosen": -528.0, "logps/rejected": -784.0, "loss": 0.251, "rewards/accuracies": 0.90625, "rewards/chosen": -3.625, "rewards/margins": 2.5625, "rewards/rejected": -6.1875, "step": 2180 }, { "epoch": 0.15808850068577204, "grad_norm": 10.616304811087307, "learning_rate": 4.948865752905228e-07, "logits/chosen": -2.859375, "logits/rejected": -2.703125, "logps/chosen": -576.0, "logps/rejected": -828.0, "loss": 0.2533, "rewards/accuracies": 0.8812500238418579, "rewards/chosen": -4.0625, "rewards/margins": 2.65625, "rewards/rejected": -6.75, "step": 2190 }, { "epoch": 0.15881036598570708, "grad_norm": 10.818629515177625, "learning_rate": 4.947590336881874e-07, "logits/chosen": -2.859375, "logits/rejected": -2.53125, "logps/chosen": -584.0, "logps/rejected": -816.0, "loss": 0.2593, "rewards/accuracies": 0.8812500238418579, "rewards/chosen": -4.0625, "rewards/margins": 2.625, "rewards/rejected": -6.6875, "step": 2200 }, { "epoch": 0.1595322312856421, "grad_norm": 10.595421594796772, "learning_rate": 4.946299378592912e-07, "logits/chosen": -2.8125, "logits/rejected": -2.625, "logps/chosen": -532.0, "logps/rejected": -784.0, "loss": 0.2795, "rewards/accuracies": 0.887499988079071, "rewards/chosen": -3.578125, "rewards/margins": 2.546875, "rewards/rejected": -6.125, "step": 2210 }, { "epoch": 0.16025409658557713, "grad_norm": 13.24386115549115, "learning_rate": 4.944992886235961e-07, "logits/chosen": -2.796875, "logits/rejected": -2.53125, "logps/chosen": -572.0, "logps/rejected": -828.0, "loss": 0.2521, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -3.96875, "rewards/margins": 2.765625, "rewards/rejected": -6.71875, "step": 2220 }, { "epoch": 0.16097596188551216, "grad_norm": 8.619302388111215, "learning_rate": 4.943670868107284e-07, "logits/chosen": -2.75, "logits/rejected": -2.609375, "logps/chosen": -532.0, "logps/rejected": -832.0, "loss": 0.27, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -3.65625, "rewards/margins": 3.078125, "rewards/rejected": -6.71875, "step": 2230 }, { "epoch": 0.1616978271854472, "grad_norm": 8.272453046055942, "learning_rate": 4.942333332601731e-07, "logits/chosen": -2.5625, "logits/rejected": -2.46875, "logps/chosen": -564.0, "logps/rejected": -864.0, "loss": 0.2661, "rewards/accuracies": 0.887499988079071, "rewards/chosen": -3.984375, "rewards/margins": 3.1875, "rewards/rejected": -7.15625, "step": 2240 }, { "epoch": 0.16241969248538224, "grad_norm": 6.171166558818759, "learning_rate": 4.940980288212691e-07, "logits/chosen": -2.5, "logits/rejected": -2.375, "logps/chosen": -576.0, "logps/rejected": -800.0, "loss": 0.2574, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -4.03125, "rewards/margins": 2.453125, "rewards/rejected": -6.46875, "step": 2250 }, { "epoch": 0.16314155778531725, "grad_norm": 9.42178572046336, "learning_rate": 4.939611743532031e-07, "logits/chosen": -2.796875, "logits/rejected": -2.59375, "logps/chosen": -560.0, "logps/rejected": -828.0, "loss": 0.2385, "rewards/accuracies": 0.887499988079071, "rewards/chosen": -3.9375, "rewards/margins": 2.828125, "rewards/rejected": -6.78125, "step": 2260 }, { "epoch": 0.16386342308525229, "grad_norm": 8.438515261081413, "learning_rate": 4.93822770725005e-07, "logits/chosen": -2.796875, "logits/rejected": -2.625, "logps/chosen": -544.0, "logps/rejected": -776.0, "loss": 0.2737, "rewards/accuracies": 0.887499988079071, "rewards/chosen": -3.734375, "rewards/margins": 2.609375, "rewards/rejected": -6.34375, "step": 2270 }, { "epoch": 0.16458528838518732, "grad_norm": 11.043392051990788, "learning_rate": 4.936828188155413e-07, "logits/chosen": -2.78125, "logits/rejected": -2.65625, "logps/chosen": -520.0, "logps/rejected": -776.0, "loss": 0.2496, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -3.625, "rewards/margins": 2.640625, "rewards/rejected": -6.28125, "step": 2280 }, { "epoch": 0.16530715368512236, "grad_norm": 10.831257780639715, "learning_rate": 4.935413195135106e-07, "logits/chosen": -2.78125, "logits/rejected": -2.6875, "logps/chosen": -572.0, "logps/rejected": -872.0, "loss": 0.2479, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -4.03125, "rewards/margins": 3.140625, "rewards/rejected": -7.15625, "step": 2290 }, { "epoch": 0.1660290189850574, "grad_norm": 9.747157511340994, "learning_rate": 4.933982737174374e-07, "logits/chosen": -2.875, "logits/rejected": -2.640625, "logps/chosen": -560.0, "logps/rejected": -852.0, "loss": 0.2701, "rewards/accuracies": 0.84375, "rewards/chosen": -4.09375, "rewards/margins": 2.796875, "rewards/rejected": -6.875, "step": 2300 }, { "epoch": 0.1667508842849924, "grad_norm": 9.870871070277088, "learning_rate": 4.932536823356664e-07, "logits/chosen": -2.71875, "logits/rejected": -2.5625, "logps/chosen": -620.0, "logps/rejected": -880.0, "loss": 0.2543, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -4.6875, "rewards/margins": 2.578125, "rewards/rejected": -7.28125, "step": 2310 }, { "epoch": 0.16747274958492744, "grad_norm": 8.8575895636107, "learning_rate": 4.931075462863567e-07, "logits/chosen": -2.96875, "logits/rejected": -2.609375, "logps/chosen": -604.0, "logps/rejected": -912.0, "loss": 0.2594, "rewards/accuracies": 0.8812500238418579, "rewards/chosen": -4.375, "rewards/margins": 3.0625, "rewards/rejected": -7.4375, "step": 2320 }, { "epoch": 0.16819461488486248, "grad_norm": 7.816395810688846, "learning_rate": 4.929598664974762e-07, "logits/chosen": -2.75, "logits/rejected": -2.609375, "logps/chosen": -652.0, "logps/rejected": -940.0, "loss": 0.2511, "rewards/accuracies": 0.9375, "rewards/chosen": -4.65625, "rewards/margins": 3.25, "rewards/rejected": -7.90625, "step": 2330 }, { "epoch": 0.16891648018479752, "grad_norm": 8.344064880799563, "learning_rate": 4.928106439067958e-07, "logits/chosen": -2.671875, "logits/rejected": -2.46875, "logps/chosen": -560.0, "logps/rejected": -816.0, "loss": 0.2669, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": -4.09375, "rewards/margins": 2.53125, "rewards/rejected": -6.625, "step": 2340 }, { "epoch": 0.16963834548473256, "grad_norm": 10.994252200422187, "learning_rate": 4.926598794618829e-07, "logits/chosen": -2.6875, "logits/rejected": -2.5, "logps/chosen": -552.0, "logps/rejected": -784.0, "loss": 0.278, "rewards/accuracies": 0.90625, "rewards/chosen": -3.921875, "rewards/margins": 2.5625, "rewards/rejected": -6.46875, "step": 2350 }, { "epoch": 0.1703602107846676, "grad_norm": 15.14815293816792, "learning_rate": 4.92507574120096e-07, "logits/chosen": -2.78125, "logits/rejected": -2.5, "logps/chosen": -604.0, "logps/rejected": -852.0, "loss": 0.2777, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": -4.375, "rewards/margins": 2.609375, "rewards/rejected": -7.0, "step": 2360 }, { "epoch": 0.1710820760846026, "grad_norm": 7.821370479620557, "learning_rate": 4.923537288485779e-07, "logits/chosen": -2.71875, "logits/rejected": -2.5, "logps/chosen": -556.0, "logps/rejected": -812.0, "loss": 0.2638, "rewards/accuracies": 0.8687499761581421, "rewards/chosen": -4.09375, "rewards/margins": 2.59375, "rewards/rejected": -6.6875, "step": 2370 }, { "epoch": 0.17180394138453764, "grad_norm": 9.211826498394792, "learning_rate": 4.921983446242506e-07, "logits/chosen": -2.765625, "logits/rejected": -2.609375, "logps/chosen": -644.0, "logps/rejected": -944.0, "loss": 0.2493, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -4.59375, "rewards/margins": 3.265625, "rewards/rejected": -7.875, "step": 2380 }, { "epoch": 0.17252580668447268, "grad_norm": 8.298256232187494, "learning_rate": 4.92041422433808e-07, "logits/chosen": -2.875, "logits/rejected": -2.609375, "logps/chosen": -548.0, "logps/rejected": -924.0, "loss": 0.2348, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -3.921875, "rewards/margins": 3.71875, "rewards/rejected": -7.65625, "step": 2390 }, { "epoch": 0.17324767198440771, "grad_norm": 10.983625039262604, "learning_rate": 4.918829632737103e-07, "logits/chosen": -2.765625, "logits/rejected": -2.625, "logps/chosen": -560.0, "logps/rejected": -896.0, "loss": 0.2633, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -4.125, "rewards/margins": 3.375, "rewards/rejected": -7.5, "step": 2400 }, { "epoch": 0.17396953728434275, "grad_norm": 12.61039915689691, "learning_rate": 4.917229681501774e-07, "logits/chosen": -2.65625, "logits/rejected": -2.53125, "logps/chosen": -580.0, "logps/rejected": -824.0, "loss": 0.264, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -4.0625, "rewards/margins": 2.609375, "rewards/rejected": -6.6875, "step": 2410 }, { "epoch": 0.17469140258427776, "grad_norm": 11.643682996836732, "learning_rate": 4.91561438079183e-07, "logits/chosen": -2.578125, "logits/rejected": -2.34375, "logps/chosen": -628.0, "logps/rejected": -900.0, "loss": 0.2668, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -4.625, "rewards/margins": 2.6875, "rewards/rejected": -7.3125, "step": 2420 }, { "epoch": 0.1754132678842128, "grad_norm": 13.088952482660957, "learning_rate": 4.913983740864473e-07, "logits/chosen": -2.59375, "logits/rejected": -2.390625, "logps/chosen": -632.0, "logps/rejected": -920.0, "loss": 0.2359, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -4.5625, "rewards/margins": 2.859375, "rewards/rejected": -7.4375, "step": 2430 }, { "epoch": 0.17613513318414784, "grad_norm": 10.188119267424455, "learning_rate": 4.91233777207431e-07, "logits/chosen": -2.625, "logits/rejected": -2.453125, "logps/chosen": -592.0, "logps/rejected": -916.0, "loss": 0.2748, "rewards/accuracies": 0.856249988079071, "rewards/chosen": -4.46875, "rewards/margins": 3.203125, "rewards/rejected": -7.6875, "step": 2440 }, { "epoch": 0.17685699848408287, "grad_norm": 8.609826083562075, "learning_rate": 4.910676484873292e-07, "logits/chosen": -2.5, "logits/rejected": -2.390625, "logps/chosen": -612.0, "logps/rejected": -864.0, "loss": 0.2658, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -4.4375, "rewards/margins": 2.671875, "rewards/rejected": -7.09375, "step": 2450 }, { "epoch": 0.1775788637840179, "grad_norm": 10.48253643988837, "learning_rate": 4.908999889810633e-07, "logits/chosen": -2.578125, "logits/rejected": -2.375, "logps/chosen": -572.0, "logps/rejected": -876.0, "loss": 0.2331, "rewards/accuracies": 0.887499988079071, "rewards/chosen": -4.03125, "rewards/margins": 3.140625, "rewards/rejected": -7.15625, "step": 2460 }, { "epoch": 0.17830072908395295, "grad_norm": 17.344352556263694, "learning_rate": 4.907307997532761e-07, "logits/chosen": -2.734375, "logits/rejected": -2.59375, "logps/chosen": -632.0, "logps/rejected": -984.0, "loss": 0.2354, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -4.6875, "rewards/margins": 3.484375, "rewards/rejected": -8.125, "step": 2470 }, { "epoch": 0.17902259438388796, "grad_norm": 9.982854645114383, "learning_rate": 4.905600818783237e-07, "logits/chosen": -2.640625, "logits/rejected": -2.53125, "logps/chosen": -664.0, "logps/rejected": -980.0, "loss": 0.3273, "rewards/accuracies": 0.90625, "rewards/chosen": -4.75, "rewards/margins": 3.515625, "rewards/rejected": -8.25, "step": 2480 }, { "epoch": 0.179744459683823, "grad_norm": 10.68094022282627, "learning_rate": 4.903878364402691e-07, "logits/chosen": -2.828125, "logits/rejected": -2.59375, "logps/chosen": -568.0, "logps/rejected": -836.0, "loss": 0.2468, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -3.953125, "rewards/margins": 2.953125, "rewards/rejected": -6.90625, "step": 2490 }, { "epoch": 0.18046632498375803, "grad_norm": 8.296383042780498, "learning_rate": 4.902140645328759e-07, "logits/chosen": -2.796875, "logits/rejected": -2.546875, "logps/chosen": -564.0, "logps/rejected": -848.0, "loss": 0.2599, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -4.1875, "rewards/margins": 2.9375, "rewards/rejected": -7.125, "step": 2500 }, { "epoch": 0.18118819028369307, "grad_norm": 9.103787824302069, "learning_rate": 4.900387672596003e-07, "logits/chosen": -2.703125, "logits/rejected": -2.4375, "logps/chosen": -528.0, "logps/rejected": -816.0, "loss": 0.2318, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -3.671875, "rewards/margins": 3.015625, "rewards/rejected": -6.6875, "step": 2510 }, { "epoch": 0.1819100555836281, "grad_norm": 16.67988360600736, "learning_rate": 4.898619457335848e-07, "logits/chosen": -2.578125, "logits/rejected": -2.4375, "logps/chosen": -568.0, "logps/rejected": -844.0, "loss": 0.248, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -4.0, "rewards/margins": 2.921875, "rewards/rejected": -6.9375, "step": 2520 }, { "epoch": 0.18263192088356311, "grad_norm": 10.469848545031832, "learning_rate": 4.896836010776509e-07, "logits/chosen": -2.640625, "logits/rejected": -2.53125, "logps/chosen": -644.0, "logps/rejected": -1012.0, "loss": 0.2595, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -4.78125, "rewards/margins": 3.59375, "rewards/rejected": -8.375, "step": 2530 }, { "epoch": 0.18335378618349815, "grad_norm": 9.661637065408652, "learning_rate": 4.895037344242921e-07, "logits/chosen": -2.484375, "logits/rejected": -2.296875, "logps/chosen": -580.0, "logps/rejected": -856.0, "loss": 0.2585, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -4.125, "rewards/margins": 2.953125, "rewards/rejected": -7.09375, "step": 2540 }, { "epoch": 0.1840756514834332, "grad_norm": 8.853616581850865, "learning_rate": 4.893223469156664e-07, "logits/chosen": -2.609375, "logits/rejected": -2.390625, "logps/chosen": -584.0, "logps/rejected": -856.0, "loss": 0.249, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": -4.1875, "rewards/margins": 2.78125, "rewards/rejected": -6.9375, "step": 2550 }, { "epoch": 0.18479751678336823, "grad_norm": 14.23122096213618, "learning_rate": 4.891394397035896e-07, "logits/chosen": -2.703125, "logits/rejected": -2.53125, "logps/chosen": -588.0, "logps/rejected": -848.0, "loss": 0.2458, "rewards/accuracies": 0.862500011920929, "rewards/chosen": -4.25, "rewards/margins": 2.75, "rewards/rejected": -7.0, "step": 2560 }, { "epoch": 0.18551938208330326, "grad_norm": 7.165047283079565, "learning_rate": 4.889550139495275e-07, "logits/chosen": -2.8125, "logits/rejected": -2.59375, "logps/chosen": -556.0, "logps/rejected": -872.0, "loss": 0.2193, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -3.90625, "rewards/margins": 3.25, "rewards/rejected": -7.15625, "step": 2570 }, { "epoch": 0.1862412473832383, "grad_norm": 9.892022723104382, "learning_rate": 4.887690708245887e-07, "logits/chosen": -2.6875, "logits/rejected": -2.53125, "logps/chosen": -540.0, "logps/rejected": -860.0, "loss": 0.2276, "rewards/accuracies": 0.887499988079071, "rewards/chosen": -3.765625, "rewards/margins": 3.125, "rewards/rejected": -6.875, "step": 2580 }, { "epoch": 0.1869631126831733, "grad_norm": 9.543867068973059, "learning_rate": 4.885816115095171e-07, "logits/chosen": -2.828125, "logits/rejected": -2.515625, "logps/chosen": -600.0, "logps/rejected": -928.0, "loss": 0.2391, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -4.375, "rewards/margins": 3.203125, "rewards/rejected": -7.5625, "step": 2590 }, { "epoch": 0.18768497798310835, "grad_norm": 10.889738728754864, "learning_rate": 4.883926371946843e-07, "logits/chosen": -2.6875, "logits/rejected": -2.375, "logps/chosen": -608.0, "logps/rejected": -872.0, "loss": 0.2702, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -4.375, "rewards/margins": 2.671875, "rewards/rejected": -7.03125, "step": 2600 }, { "epoch": 0.18840684328304338, "grad_norm": 6.728294158129367, "learning_rate": 4.882021490800826e-07, "logits/chosen": -2.671875, "logits/rejected": -2.453125, "logps/chosen": -580.0, "logps/rejected": -816.0, "loss": 0.2438, "rewards/accuracies": 0.887499988079071, "rewards/chosen": -4.09375, "rewards/margins": 2.453125, "rewards/rejected": -6.53125, "step": 2610 }, { "epoch": 0.18912870858297842, "grad_norm": 9.374612134195704, "learning_rate": 4.880101483753167e-07, "logits/chosen": -2.71875, "logits/rejected": -2.4375, "logps/chosen": -560.0, "logps/rejected": -896.0, "loss": 0.2198, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -4.1875, "rewards/margins": 3.15625, "rewards/rejected": -7.34375, "step": 2620 }, { "epoch": 0.18985057388291346, "grad_norm": 8.403906697614635, "learning_rate": 4.878166362995963e-07, "logits/chosen": -2.75, "logits/rejected": -2.578125, "logps/chosen": -588.0, "logps/rejected": -900.0, "loss": 0.2728, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -4.21875, "rewards/margins": 3.015625, "rewards/rejected": -7.25, "step": 2630 }, { "epoch": 0.19057243918284847, "grad_norm": 9.739452944604345, "learning_rate": 4.876216140817285e-07, "logits/chosen": -2.546875, "logits/rejected": -2.296875, "logps/chosen": -568.0, "logps/rejected": -856.0, "loss": 0.2399, "rewards/accuracies": 0.9375, "rewards/chosen": -4.09375, "rewards/margins": 2.890625, "rewards/rejected": -7.0, "step": 2640 }, { "epoch": 0.1912943044827835, "grad_norm": 9.412524327526398, "learning_rate": 4.874250829601094e-07, "logits/chosen": -2.671875, "logits/rejected": -2.515625, "logps/chosen": -672.0, "logps/rejected": -928.0, "loss": 0.2287, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": -4.8125, "rewards/margins": 2.796875, "rewards/rejected": -7.59375, "step": 2650 }, { "epoch": 0.19201616978271854, "grad_norm": 9.67143825795057, "learning_rate": 4.872270441827174e-07, "logits/chosen": -2.640625, "logits/rejected": -2.453125, "logps/chosen": -668.0, "logps/rejected": -960.0, "loss": 0.2358, "rewards/accuracies": 0.8687499761581421, "rewards/chosen": -4.96875, "rewards/margins": 3.0, "rewards/rejected": -8.0, "step": 2660 }, { "epoch": 0.19273803508265358, "grad_norm": 10.225198499138108, "learning_rate": 4.870274990071038e-07, "logits/chosen": -2.671875, "logits/rejected": -2.453125, "logps/chosen": -568.0, "logps/rejected": -868.0, "loss": 0.2511, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -4.28125, "rewards/margins": 3.0625, "rewards/rejected": -7.3125, "step": 2670 }, { "epoch": 0.19345990038258862, "grad_norm": 8.93422692887298, "learning_rate": 4.868264487003862e-07, "logits/chosen": -2.578125, "logits/rejected": -2.40625, "logps/chosen": -588.0, "logps/rejected": -908.0, "loss": 0.2518, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -4.28125, "rewards/margins": 3.125, "rewards/rejected": -7.40625, "step": 2680 }, { "epoch": 0.19418176568252365, "grad_norm": 8.108160852039612, "learning_rate": 4.866238945392393e-07, "logits/chosen": -2.5625, "logits/rejected": -2.46875, "logps/chosen": -588.0, "logps/rejected": -840.0, "loss": 0.2465, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -4.1875, "rewards/margins": 2.78125, "rewards/rejected": -6.96875, "step": 2690 }, { "epoch": 0.19490363098245866, "grad_norm": 8.305890952481619, "learning_rate": 4.864198378098877e-07, "logits/chosen": -2.671875, "logits/rejected": -2.46875, "logps/chosen": -510.0, "logps/rejected": -804.0, "loss": 0.237, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -3.5, "rewards/margins": 3.015625, "rewards/rejected": -6.53125, "step": 2700 }, { "epoch": 0.1956254962823937, "grad_norm": 12.954558843929119, "learning_rate": 4.862142798080973e-07, "logits/chosen": -2.734375, "logits/rejected": -2.578125, "logps/chosen": -576.0, "logps/rejected": -848.0, "loss": 0.2245, "rewards/accuracies": 0.875, "rewards/chosen": -4.15625, "rewards/margins": 2.96875, "rewards/rejected": -7.125, "step": 2710 }, { "epoch": 0.19634736158232874, "grad_norm": 6.775612276163364, "learning_rate": 4.860072218391669e-07, "logits/chosen": -2.8125, "logits/rejected": -2.625, "logps/chosen": -556.0, "logps/rejected": -872.0, "loss": 0.2153, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -3.90625, "rewards/margins": 3.296875, "rewards/rejected": -7.21875, "step": 2720 }, { "epoch": 0.19706922688226378, "grad_norm": 8.770593576643066, "learning_rate": 4.857986652179203e-07, "logits/chosen": -2.71875, "logits/rejected": -2.4375, "logps/chosen": -596.0, "logps/rejected": -872.0, "loss": 0.2534, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -4.15625, "rewards/margins": 2.765625, "rewards/rejected": -6.9375, "step": 2730 }, { "epoch": 0.1977910921821988, "grad_norm": 8.729235176349604, "learning_rate": 4.855886112686977e-07, "logits/chosen": -2.78125, "logits/rejected": -2.59375, "logps/chosen": -596.0, "logps/rejected": -920.0, "loss": 0.2018, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -4.3125, "rewards/margins": 3.25, "rewards/rejected": -7.5625, "step": 2740 }, { "epoch": 0.19851295748213382, "grad_norm": 10.466383153721448, "learning_rate": 4.853770613253476e-07, "logits/chosen": -2.796875, "logits/rejected": -2.59375, "logps/chosen": -564.0, "logps/rejected": -884.0, "loss": 0.2365, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -4.15625, "rewards/margins": 3.390625, "rewards/rejected": -7.53125, "step": 2750 }, { "epoch": 0.19923482278206886, "grad_norm": 10.738593768361735, "learning_rate": 4.851640167312178e-07, "logits/chosen": -2.6875, "logits/rejected": -2.4375, "logps/chosen": -568.0, "logps/rejected": -868.0, "loss": 0.224, "rewards/accuracies": 0.90625, "rewards/chosen": -4.0, "rewards/margins": 2.96875, "rewards/rejected": -7.0, "step": 2760 }, { "epoch": 0.1999566880820039, "grad_norm": 9.416300695572696, "learning_rate": 4.849494788391473e-07, "logits/chosen": -2.765625, "logits/rejected": -2.4375, "logps/chosen": -664.0, "logps/rejected": -1032.0, "loss": 0.2284, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.03125, "rewards/margins": 3.75, "rewards/rejected": -8.8125, "step": 2770 }, { "epoch": 0.20067855338193893, "grad_norm": 9.528669823636646, "learning_rate": 4.847334490114576e-07, "logits/chosen": -2.75, "logits/rejected": -2.5625, "logps/chosen": -628.0, "logps/rejected": -916.0, "loss": 0.2293, "rewards/accuracies": 0.875, "rewards/chosen": -4.75, "rewards/margins": 3.0625, "rewards/rejected": -7.8125, "step": 2780 }, { "epoch": 0.20140041868187397, "grad_norm": 9.797059355953671, "learning_rate": 4.84515928619944e-07, "logits/chosen": -2.875, "logits/rejected": -2.59375, "logps/chosen": -632.0, "logps/rejected": -988.0, "loss": 0.2094, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -4.625, "rewards/margins": 3.515625, "rewards/rejected": -8.1875, "step": 2790 }, { "epoch": 0.20212228398180898, "grad_norm": 9.406533092835442, "learning_rate": 4.84296919045867e-07, "logits/chosen": -2.765625, "logits/rejected": -2.4375, "logps/chosen": -624.0, "logps/rejected": -968.0, "loss": 0.2334, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -4.625, "rewards/margins": 3.171875, "rewards/rejected": -7.78125, "step": 2800 }, { "epoch": 0.20284414928174402, "grad_norm": 9.254549987899654, "learning_rate": 4.840764216799433e-07, "logits/chosen": -2.640625, "logits/rejected": -2.375, "logps/chosen": -608.0, "logps/rejected": -904.0, "loss": 0.2337, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -4.46875, "rewards/margins": 3.0, "rewards/rejected": -7.46875, "step": 2810 }, { "epoch": 0.20356601458167906, "grad_norm": 9.14538857003236, "learning_rate": 4.838544379223373e-07, "logits/chosen": -2.953125, "logits/rejected": -2.671875, "logps/chosen": -592.0, "logps/rejected": -904.0, "loss": 0.2619, "rewards/accuracies": 0.875, "rewards/chosen": -4.28125, "rewards/margins": 3.21875, "rewards/rejected": -7.5, "step": 2820 }, { "epoch": 0.2042878798816141, "grad_norm": 9.535277544276601, "learning_rate": 4.836309691826518e-07, "logits/chosen": -2.828125, "logits/rejected": -2.671875, "logps/chosen": -556.0, "logps/rejected": -840.0, "loss": 0.238, "rewards/accuracies": 0.90625, "rewards/chosen": -4.03125, "rewards/margins": 2.875, "rewards/rejected": -6.90625, "step": 2830 }, { "epoch": 0.20500974518154913, "grad_norm": 8.327834581371992, "learning_rate": 4.834060168799195e-07, "logits/chosen": -2.84375, "logits/rejected": -2.46875, "logps/chosen": -592.0, "logps/rejected": -856.0, "loss": 0.2305, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -4.15625, "rewards/margins": 2.875, "rewards/rejected": -7.03125, "step": 2840 }, { "epoch": 0.20573161048148417, "grad_norm": 7.7347670431429405, "learning_rate": 4.831795824425938e-07, "logits/chosen": -2.765625, "logits/rejected": -2.546875, "logps/chosen": -620.0, "logps/rejected": -916.0, "loss": 0.2542, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -4.46875, "rewards/margins": 3.171875, "rewards/rejected": -7.625, "step": 2850 }, { "epoch": 0.20645347578141918, "grad_norm": 8.15521635648461, "learning_rate": 4.829516673085394e-07, "logits/chosen": -2.59375, "logits/rejected": -2.421875, "logps/chosen": -604.0, "logps/rejected": -904.0, "loss": 0.2113, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -4.375, "rewards/margins": 3.078125, "rewards/rejected": -7.4375, "step": 2860 }, { "epoch": 0.20717534108135421, "grad_norm": 8.022215432273788, "learning_rate": 4.827222729250236e-07, "logits/chosen": -2.640625, "logits/rejected": -2.46875, "logps/chosen": -596.0, "logps/rejected": -916.0, "loss": 0.2461, "rewards/accuracies": 0.90625, "rewards/chosen": -4.21875, "rewards/margins": 3.421875, "rewards/rejected": -7.65625, "step": 2870 }, { "epoch": 0.20789720638128925, "grad_norm": 7.199943747449723, "learning_rate": 4.824914007487072e-07, "logits/chosen": -2.765625, "logits/rejected": -2.609375, "logps/chosen": -588.0, "logps/rejected": -932.0, "loss": 0.2155, "rewards/accuracies": 0.90625, "rewards/chosen": -4.34375, "rewards/margins": 3.40625, "rewards/rejected": -7.75, "step": 2880 }, { "epoch": 0.2086190716812243, "grad_norm": 12.583865202253415, "learning_rate": 4.822590522456347e-07, "logits/chosen": -2.828125, "logits/rejected": -2.65625, "logps/chosen": -560.0, "logps/rejected": -844.0, "loss": 0.2309, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -4.0, "rewards/margins": 3.0, "rewards/rejected": -7.0, "step": 2890 }, { "epoch": 0.20934093698115933, "grad_norm": 10.061884816438084, "learning_rate": 4.820252288912254e-07, "logits/chosen": -2.84375, "logits/rejected": -2.671875, "logps/chosen": -600.0, "logps/rejected": -876.0, "loss": 0.2257, "rewards/accuracies": 0.887499988079071, "rewards/chosen": -4.3125, "rewards/margins": 2.875, "rewards/rejected": -7.1875, "step": 2900 }, { "epoch": 0.21006280228109434, "grad_norm": 8.24310045419468, "learning_rate": 4.817899321702642e-07, "logits/chosen": -2.75, "logits/rejected": -2.625, "logps/chosen": -620.0, "logps/rejected": -952.0, "loss": 0.2341, "rewards/accuracies": 0.9375, "rewards/chosen": -4.34375, "rewards/margins": 3.484375, "rewards/rejected": -7.84375, "step": 2910 }, { "epoch": 0.21078466758102937, "grad_norm": 9.993736684687924, "learning_rate": 4.815531635768916e-07, "logits/chosen": -2.75, "logits/rejected": -2.390625, "logps/chosen": -628.0, "logps/rejected": -952.0, "loss": 0.2298, "rewards/accuracies": 0.887499988079071, "rewards/chosen": -4.65625, "rewards/margins": 3.109375, "rewards/rejected": -7.78125, "step": 2920 }, { "epoch": 0.2115065328809644, "grad_norm": 8.215550634524817, "learning_rate": 4.813149246145946e-07, "logits/chosen": -2.78125, "logits/rejected": -2.625, "logps/chosen": -648.0, "logps/rejected": -968.0, "loss": 0.2413, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": -4.875, "rewards/margins": 3.203125, "rewards/rejected": -8.0625, "step": 2930 }, { "epoch": 0.21222839818089945, "grad_norm": 6.880787558392017, "learning_rate": 4.810752167961971e-07, "logits/chosen": -2.625, "logits/rejected": -2.390625, "logps/chosen": -624.0, "logps/rejected": -904.0, "loss": 0.2364, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -4.6875, "rewards/margins": 2.71875, "rewards/rejected": -7.40625, "step": 2940 }, { "epoch": 0.21295026348083448, "grad_norm": 8.022287212940531, "learning_rate": 4.808340416438505e-07, "logits/chosen": -2.671875, "logits/rejected": -2.453125, "logps/chosen": -632.0, "logps/rejected": -880.0, "loss": 0.2212, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -4.75, "rewards/margins": 2.734375, "rewards/rejected": -7.46875, "step": 2950 }, { "epoch": 0.21367212878076952, "grad_norm": 10.935811215207599, "learning_rate": 4.805914006890234e-07, "logits/chosen": -2.703125, "logits/rejected": -2.5625, "logps/chosen": -692.0, "logps/rejected": -972.0, "loss": 0.2454, "rewards/accuracies": 0.90625, "rewards/chosen": -5.1875, "rewards/margins": 2.875, "rewards/rejected": -8.0625, "step": 2960 }, { "epoch": 0.21439399408070453, "grad_norm": 7.928137164090748, "learning_rate": 4.803472954724928e-07, "logits/chosen": -2.71875, "logits/rejected": -2.515625, "logps/chosen": -676.0, "logps/rejected": -944.0, "loss": 0.2296, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.125, "rewards/margins": 2.828125, "rewards/rejected": -7.96875, "step": 2970 }, { "epoch": 0.21511585938063957, "grad_norm": 10.309732813070605, "learning_rate": 4.801017275443331e-07, "logits/chosen": -2.734375, "logits/rejected": -2.5625, "logps/chosen": -676.0, "logps/rejected": -980.0, "loss": 0.2371, "rewards/accuracies": 0.875, "rewards/chosen": -5.125, "rewards/margins": 3.234375, "rewards/rejected": -8.375, "step": 2980 }, { "epoch": 0.2158377246805746, "grad_norm": 9.479637952138695, "learning_rate": 4.798546984639076e-07, "logits/chosen": -2.6875, "logits/rejected": -2.4375, "logps/chosen": -712.0, "logps/rejected": -1040.0, "loss": 0.216, "rewards/accuracies": 0.90625, "rewards/chosen": -5.5625, "rewards/margins": 3.3125, "rewards/rejected": -8.875, "step": 2990 }, { "epoch": 0.21655958998050964, "grad_norm": 11.653196066334537, "learning_rate": 4.796062097998578e-07, "logits/chosen": -2.78125, "logits/rejected": -2.375, "logps/chosen": -700.0, "logps/rejected": -988.0, "loss": 0.2311, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -5.28125, "rewards/margins": 3.125, "rewards/rejected": -8.375, "step": 3000 }, { "epoch": 0.21728145528044468, "grad_norm": 12.258514957096317, "learning_rate": 4.793562631300932e-07, "logits/chosen": -2.6875, "logits/rejected": -2.625, "logps/chosen": -712.0, "logps/rejected": -996.0, "loss": 0.2292, "rewards/accuracies": 0.875, "rewards/chosen": -5.5, "rewards/margins": 2.875, "rewards/rejected": -8.375, "step": 3010 }, { "epoch": 0.2180033205803797, "grad_norm": 7.907531921224019, "learning_rate": 4.791048600417824e-07, "logits/chosen": -2.84375, "logits/rejected": -2.640625, "logps/chosen": -660.0, "logps/rejected": -984.0, "loss": 0.2244, "rewards/accuracies": 0.90625, "rewards/chosen": -5.03125, "rewards/margins": 3.34375, "rewards/rejected": -8.375, "step": 3020 }, { "epoch": 0.21872518588031473, "grad_norm": 8.125306615010935, "learning_rate": 4.788520021313416e-07, "logits/chosen": -2.875, "logits/rejected": -2.8125, "logps/chosen": -636.0, "logps/rejected": -952.0, "loss": 0.2078, "rewards/accuracies": 0.90625, "rewards/chosen": -4.75, "rewards/margins": 3.140625, "rewards/rejected": -7.875, "step": 3030 }, { "epoch": 0.21944705118024976, "grad_norm": 9.119966563903791, "learning_rate": 4.785976910044255e-07, "logits/chosen": -2.9375, "logits/rejected": -2.703125, "logps/chosen": -576.0, "logps/rejected": -924.0, "loss": 0.2032, "rewards/accuracies": 0.9375, "rewards/chosen": -4.1875, "rewards/margins": 3.625, "rewards/rejected": -7.8125, "step": 3040 }, { "epoch": 0.2201689164801848, "grad_norm": 12.1919687251649, "learning_rate": 4.783419282759168e-07, "logits/chosen": -2.8125, "logits/rejected": -2.578125, "logps/chosen": -624.0, "logps/rejected": -928.0, "loss": 0.2312, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -4.65625, "rewards/margins": 3.21875, "rewards/rejected": -7.84375, "step": 3050 }, { "epoch": 0.22089078178011984, "grad_norm": 10.966337886877598, "learning_rate": 4.780847155699157e-07, "logits/chosen": -2.765625, "logits/rejected": -2.484375, "logps/chosen": -656.0, "logps/rejected": -960.0, "loss": 0.2282, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -4.90625, "rewards/margins": 3.140625, "rewards/rejected": -8.0625, "step": 3060 }, { "epoch": 0.22161264708005488, "grad_norm": 10.89546424385192, "learning_rate": 4.778260545197301e-07, "logits/chosen": -2.765625, "logits/rejected": -2.609375, "logps/chosen": -628.0, "logps/rejected": -916.0, "loss": 0.2326, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -4.78125, "rewards/margins": 2.9375, "rewards/rejected": -7.71875, "step": 3070 }, { "epoch": 0.22233451237998988, "grad_norm": 8.635404642662332, "learning_rate": 4.775659467678645e-07, "logits/chosen": -2.890625, "logits/rejected": -2.71875, "logps/chosen": -688.0, "logps/rejected": -1004.0, "loss": 0.213, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -5.25, "rewards/margins": 3.390625, "rewards/rejected": -8.625, "step": 3080 }, { "epoch": 0.22305637767992492, "grad_norm": 13.172555524642066, "learning_rate": 4.773043939660105e-07, "logits/chosen": -2.828125, "logits/rejected": -2.671875, "logps/chosen": -656.0, "logps/rejected": -956.0, "loss": 0.2527, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -4.875, "rewards/margins": 3.171875, "rewards/rejected": -8.0625, "step": 3090 }, { "epoch": 0.22377824297985996, "grad_norm": 10.053263971609315, "learning_rate": 4.770413977750353e-07, "logits/chosen": -2.84375, "logits/rejected": -2.515625, "logps/chosen": -680.0, "logps/rejected": -984.0, "loss": 0.2074, "rewards/accuracies": 0.8812500238418579, "rewards/chosen": -5.0625, "rewards/margins": 3.234375, "rewards/rejected": -8.3125, "step": 3100 }, { "epoch": 0.224500108279795, "grad_norm": 7.080435865876819, "learning_rate": 4.7677695986497225e-07, "logits/chosen": -2.796875, "logits/rejected": -2.515625, "logps/chosen": -676.0, "logps/rejected": -956.0, "loss": 0.2285, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.0, "rewards/margins": 2.90625, "rewards/rejected": -7.90625, "step": 3110 }, { "epoch": 0.22522197357973003, "grad_norm": 8.489071949818994, "learning_rate": 4.7651108191500896e-07, "logits/chosen": -2.71875, "logits/rejected": -2.578125, "logps/chosen": -624.0, "logps/rejected": -948.0, "loss": 0.2217, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -4.46875, "rewards/margins": 3.3125, "rewards/rejected": -7.75, "step": 3120 }, { "epoch": 0.22594383887966504, "grad_norm": 7.48950614324499, "learning_rate": 4.762437656134778e-07, "logits/chosen": -2.8125, "logits/rejected": -2.6875, "logps/chosen": -648.0, "logps/rejected": -956.0, "loss": 0.2206, "rewards/accuracies": 0.875, "rewards/chosen": -4.8125, "rewards/margins": 3.28125, "rewards/rejected": -8.0625, "step": 3130 }, { "epoch": 0.22666570417960008, "grad_norm": 11.147541103318718, "learning_rate": 4.7597501265784466e-07, "logits/chosen": -2.65625, "logits/rejected": -2.484375, "logps/chosen": -660.0, "logps/rejected": -924.0, "loss": 0.2274, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -5.0, "rewards/margins": 2.75, "rewards/rejected": -7.75, "step": 3140 }, { "epoch": 0.22738756947953512, "grad_norm": 9.2136696723812, "learning_rate": 4.757048247546982e-07, "logits/chosen": -2.703125, "logits/rejected": -2.453125, "logps/chosen": -612.0, "logps/rejected": -940.0, "loss": 0.2588, "rewards/accuracies": 0.8687499761581421, "rewards/chosen": -4.625, "rewards/margins": 3.34375, "rewards/rejected": -7.96875, "step": 3150 }, { "epoch": 0.22810943477947015, "grad_norm": 12.83236893491969, "learning_rate": 4.7543320361973884e-07, "logits/chosen": -2.703125, "logits/rejected": -2.46875, "logps/chosen": -604.0, "logps/rejected": -904.0, "loss": 0.2172, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -4.5, "rewards/margins": 3.109375, "rewards/rejected": -7.625, "step": 3160 }, { "epoch": 0.2288313000794052, "grad_norm": 9.608775546642143, "learning_rate": 4.751601509777683e-07, "logits/chosen": -2.921875, "logits/rejected": -2.625, "logps/chosen": -620.0, "logps/rejected": -968.0, "loss": 0.219, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -4.6875, "rewards/margins": 3.421875, "rewards/rejected": -8.125, "step": 3170 }, { "epoch": 0.2295531653793402, "grad_norm": 8.893320591024583, "learning_rate": 4.748856685626784e-07, "logits/chosen": -2.84375, "logits/rejected": -2.6875, "logps/chosen": -620.0, "logps/rejected": -932.0, "loss": 0.2299, "rewards/accuracies": 0.8812500238418579, "rewards/chosen": -4.46875, "rewards/margins": 3.21875, "rewards/rejected": -7.6875, "step": 3180 }, { "epoch": 0.23027503067927524, "grad_norm": 6.813416083172801, "learning_rate": 4.7460975811743986e-07, "logits/chosen": -2.890625, "logits/rejected": -2.734375, "logps/chosen": -672.0, "logps/rejected": -992.0, "loss": 0.2321, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -4.9375, "rewards/margins": 3.3125, "rewards/rejected": -8.25, "step": 3190 }, { "epoch": 0.23099689597921028, "grad_norm": 11.910753128704322, "learning_rate": 4.743324213940917e-07, "logits/chosen": -2.703125, "logits/rejected": -2.59375, "logps/chosen": -580.0, "logps/rejected": -864.0, "loss": 0.2362, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -4.1875, "rewards/margins": 2.953125, "rewards/rejected": -7.15625, "step": 3200 }, { "epoch": 0.2317187612791453, "grad_norm": 10.880683342821822, "learning_rate": 4.740536601537295e-07, "logits/chosen": -2.84375, "logits/rejected": -2.71875, "logps/chosen": -632.0, "logps/rejected": -924.0, "loss": 0.226, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -4.53125, "rewards/margins": 3.125, "rewards/rejected": -7.6875, "step": 3210 }, { "epoch": 0.23244062657908035, "grad_norm": 9.387075119803855, "learning_rate": 4.73773476166495e-07, "logits/chosen": -2.75, "logits/rejected": -2.546875, "logps/chosen": -620.0, "logps/rejected": -916.0, "loss": 0.2052, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -4.53125, "rewards/margins": 3.0625, "rewards/rejected": -7.59375, "step": 3220 }, { "epoch": 0.2331624918790154, "grad_norm": 9.319384117903645, "learning_rate": 4.73491871211564e-07, "logits/chosen": -2.6875, "logits/rejected": -2.5, "logps/chosen": -568.0, "logps/rejected": -880.0, "loss": 0.2334, "rewards/accuracies": 0.9375, "rewards/chosen": -4.0, "rewards/margins": 3.15625, "rewards/rejected": -7.15625, "step": 3230 }, { "epoch": 0.2338843571789504, "grad_norm": 7.92062494143796, "learning_rate": 4.7320884707713573e-07, "logits/chosen": -2.6875, "logits/rejected": -2.375, "logps/chosen": -572.0, "logps/rejected": -872.0, "loss": 0.226, "rewards/accuracies": 0.90625, "rewards/chosen": -4.09375, "rewards/margins": 3.0625, "rewards/rejected": -7.15625, "step": 3240 }, { "epoch": 0.23460622247888543, "grad_norm": 7.5905378566734445, "learning_rate": 4.7292440556042116e-07, "logits/chosen": -2.8125, "logits/rejected": -2.421875, "logps/chosen": -636.0, "logps/rejected": -956.0, "loss": 0.2381, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -4.875, "rewards/margins": 3.28125, "rewards/rejected": -8.125, "step": 3250 }, { "epoch": 0.23532808777882047, "grad_norm": 7.104939281324458, "learning_rate": 4.726385484676318e-07, "logits/chosen": -2.5625, "logits/rejected": -2.421875, "logps/chosen": -600.0, "logps/rejected": -876.0, "loss": 0.2311, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -4.4375, "rewards/margins": 2.84375, "rewards/rejected": -7.28125, "step": 3260 }, { "epoch": 0.2360499530787555, "grad_norm": 7.112864388089024, "learning_rate": 4.723512776139679e-07, "logits/chosen": -2.640625, "logits/rejected": -2.453125, "logps/chosen": -592.0, "logps/rejected": -872.0, "loss": 0.218, "rewards/accuracies": 0.875, "rewards/chosen": -4.5625, "rewards/margins": 2.65625, "rewards/rejected": -7.21875, "step": 3270 }, { "epoch": 0.23677181837869055, "grad_norm": 9.110259152947808, "learning_rate": 4.7206259482360734e-07, "logits/chosen": -2.71875, "logits/rejected": -2.515625, "logps/chosen": -624.0, "logps/rejected": -916.0, "loss": 0.2342, "rewards/accuracies": 0.875, "rewards/chosen": -4.59375, "rewards/margins": 3.0625, "rewards/rejected": -7.65625, "step": 3280 }, { "epoch": 0.23749368367862556, "grad_norm": 8.883129926158574, "learning_rate": 4.7177250192969364e-07, "logits/chosen": -2.6875, "logits/rejected": -2.53125, "logps/chosen": -648.0, "logps/rejected": -976.0, "loss": 0.2037, "rewards/accuracies": 0.90625, "rewards/chosen": -4.75, "rewards/margins": 3.46875, "rewards/rejected": -8.25, "step": 3290 }, { "epoch": 0.2382155489785606, "grad_norm": 10.573842474018138, "learning_rate": 4.714810007743247e-07, "logits/chosen": -2.765625, "logits/rejected": -2.5, "logps/chosen": -744.0, "logps/rejected": -1080.0, "loss": 0.2226, "rewards/accuracies": 0.8687499761581421, "rewards/chosen": -5.65625, "rewards/margins": 3.609375, "rewards/rejected": -9.25, "step": 3300 }, { "epoch": 0.23893741427849563, "grad_norm": 9.209497924010089, "learning_rate": 4.7118809320854077e-07, "logits/chosen": -2.78125, "logits/rejected": -2.46875, "logps/chosen": -672.0, "logps/rejected": -1000.0, "loss": 0.2122, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.25, "rewards/margins": 3.421875, "rewards/rejected": -8.6875, "step": 3310 }, { "epoch": 0.23965927957843067, "grad_norm": 9.372117356581454, "learning_rate": 4.7089378109231294e-07, "logits/chosen": -2.625, "logits/rejected": -2.40625, "logps/chosen": -688.0, "logps/rejected": -984.0, "loss": 0.2315, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -5.34375, "rewards/margins": 2.96875, "rewards/rejected": -8.3125, "step": 3320 }, { "epoch": 0.2403811448783657, "grad_norm": 8.352914263375952, "learning_rate": 4.7059806629453116e-07, "logits/chosen": -2.609375, "logits/rejected": -2.4375, "logps/chosen": -648.0, "logps/rejected": -920.0, "loss": 0.2278, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -4.6875, "rewards/margins": 2.96875, "rewards/rejected": -7.65625, "step": 3330 }, { "epoch": 0.24110301017830074, "grad_norm": 10.512336386108508, "learning_rate": 4.7030095069299257e-07, "logits/chosen": -2.8125, "logits/rejected": -2.546875, "logps/chosen": -656.0, "logps/rejected": -976.0, "loss": 0.2011, "rewards/accuracies": 0.8687499761581421, "rewards/chosen": -4.8125, "rewards/margins": 3.34375, "rewards/rejected": -8.125, "step": 3340 }, { "epoch": 0.24182487547823575, "grad_norm": 9.166170654186674, "learning_rate": 4.700024361743893e-07, "logits/chosen": -2.84375, "logits/rejected": -2.59375, "logps/chosen": -620.0, "logps/rejected": -960.0, "loss": 0.1937, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -4.5625, "rewards/margins": 3.5625, "rewards/rejected": -8.125, "step": 3350 }, { "epoch": 0.2425467407781708, "grad_norm": 10.052841673647455, "learning_rate": 4.697025246342967e-07, "logits/chosen": -2.703125, "logits/rejected": -2.5625, "logps/chosen": -608.0, "logps/rejected": -916.0, "loss": 0.2115, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -4.5, "rewards/margins": 3.40625, "rewards/rejected": -7.90625, "step": 3360 }, { "epoch": 0.24326860607810583, "grad_norm": 12.87931292960993, "learning_rate": 4.6940121797716127e-07, "logits/chosen": -2.734375, "logits/rejected": -2.5625, "logps/chosen": -588.0, "logps/rejected": -912.0, "loss": 0.227, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -4.28125, "rewards/margins": 3.34375, "rewards/rejected": -7.625, "step": 3370 }, { "epoch": 0.24399047137804086, "grad_norm": 11.246155735848257, "learning_rate": 4.6909851811628853e-07, "logits/chosen": -2.84375, "logits/rejected": -2.578125, "logps/chosen": -644.0, "logps/rejected": -948.0, "loss": 0.1985, "rewards/accuracies": 0.875, "rewards/chosen": -4.8125, "rewards/margins": 3.15625, "rewards/rejected": -7.96875, "step": 3380 }, { "epoch": 0.2447123366779759, "grad_norm": 8.247097831323758, "learning_rate": 4.68794426973831e-07, "logits/chosen": -2.75, "logits/rejected": -2.5, "logps/chosen": -584.0, "logps/rejected": -892.0, "loss": 0.2203, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -4.25, "rewards/margins": 3.140625, "rewards/rejected": -7.375, "step": 3390 }, { "epoch": 0.2454342019779109, "grad_norm": 7.982031142460416, "learning_rate": 4.684889464807755e-07, "logits/chosen": -2.671875, "logits/rejected": -2.453125, "logps/chosen": -588.0, "logps/rejected": -912.0, "loss": 0.2141, "rewards/accuracies": 0.90625, "rewards/chosen": -4.3125, "rewards/margins": 3.15625, "rewards/rejected": -7.46875, "step": 3400 }, { "epoch": 0.24615606727784595, "grad_norm": 8.859057538137234, "learning_rate": 4.681820785769317e-07, "logits/chosen": -2.671875, "logits/rejected": -2.5, "logps/chosen": -624.0, "logps/rejected": -932.0, "loss": 0.2002, "rewards/accuracies": 0.90625, "rewards/chosen": -4.53125, "rewards/margins": 3.328125, "rewards/rejected": -7.875, "step": 3410 }, { "epoch": 0.24687793257778098, "grad_norm": 10.507595703830146, "learning_rate": 4.678738252109192e-07, "logits/chosen": -2.625, "logits/rejected": -2.515625, "logps/chosen": -604.0, "logps/rejected": -916.0, "loss": 0.2272, "rewards/accuracies": 0.875, "rewards/chosen": -4.4375, "rewards/margins": 3.28125, "rewards/rejected": -7.71875, "step": 3420 }, { "epoch": 0.24759979787771602, "grad_norm": 9.701082860121796, "learning_rate": 4.675641883401553e-07, "logits/chosen": -2.578125, "logits/rejected": -2.375, "logps/chosen": -624.0, "logps/rejected": -936.0, "loss": 0.2157, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -4.625, "rewards/margins": 3.15625, "rewards/rejected": -7.78125, "step": 3430 }, { "epoch": 0.24832166317765106, "grad_norm": 9.249938002509944, "learning_rate": 4.672531699308425e-07, "logits/chosen": -2.65625, "logits/rejected": -2.4375, "logps/chosen": -628.0, "logps/rejected": -964.0, "loss": 0.2167, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -4.8125, "rewards/margins": 3.375, "rewards/rejected": -8.1875, "step": 3440 }, { "epoch": 0.2490435284775861, "grad_norm": 10.341717167410792, "learning_rate": 4.669407719579562e-07, "logits/chosen": -2.734375, "logits/rejected": -2.546875, "logps/chosen": -604.0, "logps/rejected": -920.0, "loss": 0.2035, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -4.25, "rewards/margins": 3.453125, "rewards/rejected": -7.71875, "step": 3450 }, { "epoch": 0.2497653937775211, "grad_norm": 8.681196124713722, "learning_rate": 4.666269964052322e-07, "logits/chosen": -2.859375, "logits/rejected": -2.53125, "logps/chosen": -596.0, "logps/rejected": -952.0, "loss": 0.2126, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -4.25, "rewards/margins": 3.828125, "rewards/rejected": -8.0625, "step": 3460 }, { "epoch": 0.25048725907745617, "grad_norm": 9.212928240257371, "learning_rate": 4.6631184526515384e-07, "logits/chosen": -2.828125, "logits/rejected": -2.65625, "logps/chosen": -624.0, "logps/rejected": -924.0, "loss": 0.2196, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -4.53125, "rewards/margins": 3.140625, "rewards/rejected": -7.6875, "step": 3470 }, { "epoch": 0.2512091243773912, "grad_norm": 9.229554206053074, "learning_rate": 4.6599532053893936e-07, "logits/chosen": -2.734375, "logits/rejected": -2.53125, "logps/chosen": -660.0, "logps/rejected": -944.0, "loss": 0.2172, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -4.90625, "rewards/margins": 2.96875, "rewards/rejected": -7.875, "step": 3480 }, { "epoch": 0.2519309896773262, "grad_norm": 7.2543396832627876, "learning_rate": 4.6567742423652955e-07, "logits/chosen": -2.6875, "logits/rejected": -2.53125, "logps/chosen": -672.0, "logps/rejected": -972.0, "loss": 0.2158, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -5.03125, "rewards/margins": 3.15625, "rewards/rejected": -8.1875, "step": 3490 }, { "epoch": 0.25265285497726125, "grad_norm": 8.156746365270518, "learning_rate": 4.6535815837657456e-07, "logits/chosen": -2.609375, "logits/rejected": -2.359375, "logps/chosen": -688.0, "logps/rejected": -1024.0, "loss": 0.2254, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -5.1875, "rewards/margins": 3.453125, "rewards/rejected": -8.625, "step": 3500 }, { "epoch": 0.25337472027719626, "grad_norm": 9.476042547482471, "learning_rate": 4.6503752498642133e-07, "logits/chosen": -2.6875, "logits/rejected": -2.421875, "logps/chosen": -696.0, "logps/rejected": -972.0, "loss": 0.2247, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.375, "rewards/margins": 2.953125, "rewards/rejected": -8.3125, "step": 3510 }, { "epoch": 0.25409658557713133, "grad_norm": 11.068802868497535, "learning_rate": 4.6471552610210073e-07, "logits/chosen": -2.8125, "logits/rejected": -2.640625, "logps/chosen": -648.0, "logps/rejected": -968.0, "loss": 0.2236, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -4.84375, "rewards/margins": 3.265625, "rewards/rejected": -8.125, "step": 3520 }, { "epoch": 0.25481845087706634, "grad_norm": 9.184379291366328, "learning_rate": 4.6439216376831447e-07, "logits/chosen": -2.90625, "logits/rejected": -2.546875, "logps/chosen": -628.0, "logps/rejected": -972.0, "loss": 0.2076, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -4.65625, "rewards/margins": 3.421875, "rewards/rejected": -8.0625, "step": 3530 }, { "epoch": 0.25554031617700135, "grad_norm": 12.322007532110128, "learning_rate": 4.6406744003842213e-07, "logits/chosen": -2.828125, "logits/rejected": -2.59375, "logps/chosen": -612.0, "logps/rejected": -920.0, "loss": 0.2124, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -4.5, "rewards/margins": 3.25, "rewards/rejected": -7.75, "step": 3540 }, { "epoch": 0.2562621814769364, "grad_norm": 7.159317606243659, "learning_rate": 4.6374135697442833e-07, "logits/chosen": -2.796875, "logits/rejected": -2.546875, "logps/chosen": -596.0, "logps/rejected": -940.0, "loss": 0.2098, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -4.40625, "rewards/margins": 3.453125, "rewards/rejected": -7.875, "step": 3550 }, { "epoch": 0.2569840467768714, "grad_norm": 29.4711769624419, "learning_rate": 4.634139166469695e-07, "logits/chosen": -2.671875, "logits/rejected": -2.390625, "logps/chosen": -620.0, "logps/rejected": -944.0, "loss": 0.2267, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -4.5, "rewards/margins": 3.078125, "rewards/rejected": -7.59375, "step": 3560 }, { "epoch": 0.2577059120768065, "grad_norm": 7.80532559868148, "learning_rate": 4.6308512113530063e-07, "logits/chosen": -2.59375, "logits/rejected": -2.46875, "logps/chosen": -560.0, "logps/rejected": -852.0, "loss": 0.2187, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -4.0, "rewards/margins": 2.984375, "rewards/rejected": -7.0, "step": 3570 }, { "epoch": 0.2584277773767415, "grad_norm": 7.185706232473536, "learning_rate": 4.627549725272822e-07, "logits/chosen": -2.75, "logits/rejected": -2.59375, "logps/chosen": -604.0, "logps/rejected": -916.0, "loss": 0.2362, "rewards/accuracies": 0.90625, "rewards/chosen": -4.34375, "rewards/margins": 3.265625, "rewards/rejected": -7.59375, "step": 3580 }, { "epoch": 0.2591496426766765, "grad_norm": 7.836489814314065, "learning_rate": 4.62423472919367e-07, "logits/chosen": -2.734375, "logits/rejected": -2.421875, "logps/chosen": -604.0, "logps/rejected": -896.0, "loss": 0.2143, "rewards/accuracies": 0.8812500238418579, "rewards/chosen": -4.40625, "rewards/margins": 3.0, "rewards/rejected": -7.40625, "step": 3590 }, { "epoch": 0.25987150797661157, "grad_norm": 10.312658330041376, "learning_rate": 4.6209062441658654e-07, "logits/chosen": -2.578125, "logits/rejected": -2.359375, "logps/chosen": -604.0, "logps/rejected": -904.0, "loss": 0.2176, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -4.46875, "rewards/margins": 3.109375, "rewards/rejected": -7.5625, "step": 3600 }, { "epoch": 0.2605933732765466, "grad_norm": 7.660185299883346, "learning_rate": 4.6175642913253783e-07, "logits/chosen": -2.640625, "logits/rejected": -2.4375, "logps/chosen": -604.0, "logps/rejected": -912.0, "loss": 0.1951, "rewards/accuracies": 0.9375, "rewards/chosen": -4.34375, "rewards/margins": 3.296875, "rewards/rejected": -7.65625, "step": 3610 }, { "epoch": 0.26131523857648165, "grad_norm": 9.630986662907384, "learning_rate": 4.6142088918937016e-07, "logits/chosen": -2.671875, "logits/rejected": -2.515625, "logps/chosen": -608.0, "logps/rejected": -952.0, "loss": 0.2009, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -4.4375, "rewards/margins": 3.609375, "rewards/rejected": -8.0625, "step": 3620 }, { "epoch": 0.26203710387641665, "grad_norm": 7.9637824352647195, "learning_rate": 4.6108400671777135e-07, "logits/chosen": -2.796875, "logits/rejected": -2.40625, "logps/chosen": -620.0, "logps/rejected": -928.0, "loss": 0.2137, "rewards/accuracies": 0.90625, "rewards/chosen": -4.46875, "rewards/margins": 3.28125, "rewards/rejected": -7.75, "step": 3630 }, { "epoch": 0.2627589691763517, "grad_norm": 10.302801071286787, "learning_rate": 4.607457838569544e-07, "logits/chosen": -2.65625, "logits/rejected": -2.296875, "logps/chosen": -600.0, "logps/rejected": -964.0, "loss": 0.208, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -4.375, "rewards/margins": 3.484375, "rewards/rejected": -7.84375, "step": 3640 }, { "epoch": 0.26348083447628673, "grad_norm": 9.200762753858287, "learning_rate": 4.6040622275464355e-07, "logits/chosen": -2.796875, "logits/rejected": -2.609375, "logps/chosen": -580.0, "logps/rejected": -960.0, "loss": 0.2058, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -4.34375, "rewards/margins": 3.703125, "rewards/rejected": -8.0625, "step": 3650 }, { "epoch": 0.26420269977622174, "grad_norm": 8.72614280680941, "learning_rate": 4.6006532556706124e-07, "logits/chosen": -2.71875, "logits/rejected": -2.515625, "logps/chosen": -532.0, "logps/rejected": -856.0, "loss": 0.2263, "rewards/accuracies": 0.8812500238418579, "rewards/chosen": -3.875, "rewards/margins": 3.296875, "rewards/rejected": -7.15625, "step": 3660 }, { "epoch": 0.2649245650761568, "grad_norm": 9.95080301383368, "learning_rate": 4.5972309445891386e-07, "logits/chosen": -2.671875, "logits/rejected": -2.515625, "logps/chosen": -544.0, "logps/rejected": -884.0, "loss": 0.2212, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -3.859375, "rewards/margins": 3.609375, "rewards/rejected": -7.46875, "step": 3670 }, { "epoch": 0.2656464303760918, "grad_norm": 7.898181548134635, "learning_rate": 4.593795316033783e-07, "logits/chosen": -2.578125, "logits/rejected": -2.375, "logps/chosen": -588.0, "logps/rejected": -872.0, "loss": 0.2504, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -4.28125, "rewards/margins": 2.96875, "rewards/rejected": -7.28125, "step": 3680 }, { "epoch": 0.2663682956760269, "grad_norm": 9.27071552978421, "learning_rate": 4.5903463918208815e-07, "logits/chosen": -2.515625, "logits/rejected": -2.296875, "logps/chosen": -560.0, "logps/rejected": -904.0, "loss": 0.2182, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -4.03125, "rewards/margins": 3.46875, "rewards/rejected": -7.5, "step": 3690 }, { "epoch": 0.2670901609759619, "grad_norm": 7.471297940396982, "learning_rate": 4.586884193851197e-07, "logits/chosen": -2.703125, "logits/rejected": -2.421875, "logps/chosen": -568.0, "logps/rejected": -864.0, "loss": 0.2165, "rewards/accuracies": 0.90625, "rewards/chosen": -4.125, "rewards/margins": 2.921875, "rewards/rejected": -7.03125, "step": 3700 }, { "epoch": 0.2678120262758969, "grad_norm": 9.198139304204727, "learning_rate": 4.5834087441097806e-07, "logits/chosen": -2.9375, "logits/rejected": -2.5625, "logps/chosen": -568.0, "logps/rejected": -960.0, "loss": 0.1971, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -4.125, "rewards/margins": 3.90625, "rewards/rejected": -8.0625, "step": 3710 }, { "epoch": 0.26853389157583196, "grad_norm": 7.074538199167009, "learning_rate": 4.5799200646658345e-07, "logits/chosen": -2.859375, "logits/rejected": -2.5, "logps/chosen": -568.0, "logps/rejected": -900.0, "loss": 0.1914, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -4.25, "rewards/margins": 3.28125, "rewards/rejected": -7.53125, "step": 3720 }, { "epoch": 0.26925575687576697, "grad_norm": 7.9353245918675, "learning_rate": 4.576418177672568e-07, "logits/chosen": -2.90625, "logits/rejected": -2.6875, "logps/chosen": -680.0, "logps/rejected": -1020.0, "loss": 0.2194, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -5.0, "rewards/margins": 3.59375, "rewards/rejected": -8.5625, "step": 3730 }, { "epoch": 0.26997762217570204, "grad_norm": 7.362232757163594, "learning_rate": 4.5729031053670596e-07, "logits/chosen": -2.828125, "logits/rejected": -2.5625, "logps/chosen": -576.0, "logps/rejected": -888.0, "loss": 0.2025, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -4.0625, "rewards/margins": 3.421875, "rewards/rejected": -7.46875, "step": 3740 }, { "epoch": 0.27069948747563705, "grad_norm": 9.803377167019393, "learning_rate": 4.569374870070114e-07, "logits/chosen": -2.953125, "logits/rejected": -2.65625, "logps/chosen": -620.0, "logps/rejected": -960.0, "loss": 0.2077, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -4.59375, "rewards/margins": 3.515625, "rewards/rejected": -8.125, "step": 3750 }, { "epoch": 0.27142135277557206, "grad_norm": 6.923819353668018, "learning_rate": 4.565833494186122e-07, "logits/chosen": -2.953125, "logits/rejected": -2.734375, "logps/chosen": -644.0, "logps/rejected": -968.0, "loss": 0.1945, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -4.84375, "rewards/margins": 3.328125, "rewards/rejected": -8.1875, "step": 3760 }, { "epoch": 0.2721432180755071, "grad_norm": 7.409462373704994, "learning_rate": 4.562279000202919e-07, "logits/chosen": -2.90625, "logits/rejected": -2.59375, "logps/chosen": -624.0, "logps/rejected": -952.0, "loss": 0.1891, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -4.46875, "rewards/margins": 3.640625, "rewards/rejected": -8.125, "step": 3770 }, { "epoch": 0.27286508337544213, "grad_norm": 8.55425171800717, "learning_rate": 4.5587114106916366e-07, "logits/chosen": -2.890625, "logits/rejected": -2.609375, "logps/chosen": -664.0, "logps/rejected": -1040.0, "loss": 0.2089, "rewards/accuracies": 0.90625, "rewards/chosen": -4.96875, "rewards/margins": 3.71875, "rewards/rejected": -8.6875, "step": 3780 }, { "epoch": 0.2735869486753772, "grad_norm": 8.283760196639793, "learning_rate": 4.5551307483065664e-07, "logits/chosen": -2.8125, "logits/rejected": -2.65625, "logps/chosen": -716.0, "logps/rejected": -1064.0, "loss": 0.2264, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -5.46875, "rewards/margins": 3.671875, "rewards/rejected": -9.125, "step": 3790 }, { "epoch": 0.2743088139753122, "grad_norm": 9.334259623082545, "learning_rate": 4.5515370357850136e-07, "logits/chosen": -2.734375, "logits/rejected": -2.640625, "logps/chosen": -664.0, "logps/rejected": -1056.0, "loss": 0.1902, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.0, "rewards/margins": 3.890625, "rewards/rejected": -8.875, "step": 3800 }, { "epoch": 0.2750306792752472, "grad_norm": 8.790752805238721, "learning_rate": 4.547930295947151e-07, "logits/chosen": -2.859375, "logits/rejected": -2.578125, "logps/chosen": -640.0, "logps/rejected": -960.0, "loss": 0.1949, "rewards/accuracies": 0.9375, "rewards/chosen": -4.71875, "rewards/margins": 3.5625, "rewards/rejected": -8.25, "step": 3810 }, { "epoch": 0.2757525445751823, "grad_norm": 11.07615206391536, "learning_rate": 4.5443105516958737e-07, "logits/chosen": -2.859375, "logits/rejected": -2.640625, "logps/chosen": -700.0, "logps/rejected": -1072.0, "loss": 0.2074, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.34375, "rewards/margins": 3.90625, "rewards/rejected": -9.25, "step": 3820 }, { "epoch": 0.2764744098751173, "grad_norm": 12.156443108793454, "learning_rate": 4.5406778260166586e-07, "logits/chosen": -2.5625, "logits/rejected": -2.421875, "logps/chosen": -648.0, "logps/rejected": -984.0, "loss": 0.2064, "rewards/accuracies": 0.90625, "rewards/chosen": -4.90625, "rewards/margins": 3.59375, "rewards/rejected": -8.5, "step": 3830 }, { "epoch": 0.27719627517505235, "grad_norm": 9.054451472292419, "learning_rate": 4.5370321419774117e-07, "logits/chosen": -2.6875, "logits/rejected": -2.390625, "logps/chosen": -616.0, "logps/rejected": -936.0, "loss": 0.2138, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -4.59375, "rewards/margins": 3.171875, "rewards/rejected": -7.78125, "step": 3840 }, { "epoch": 0.27791814047498736, "grad_norm": 6.698493216999741, "learning_rate": 4.5333735227283274e-07, "logits/chosen": -2.640625, "logits/rejected": -2.5, "logps/chosen": -676.0, "logps/rejected": -992.0, "loss": 0.2083, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.25, "rewards/margins": 3.15625, "rewards/rejected": -8.4375, "step": 3850 }, { "epoch": 0.2786400057749224, "grad_norm": 9.735985205726063, "learning_rate": 4.5297019915017375e-07, "logits/chosen": -2.75, "logits/rejected": -2.53125, "logps/chosen": -672.0, "logps/rejected": -1032.0, "loss": 0.1875, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.28125, "rewards/margins": 3.59375, "rewards/rejected": -8.875, "step": 3860 }, { "epoch": 0.27936187107485744, "grad_norm": 8.810687694126111, "learning_rate": 4.5260175716119655e-07, "logits/chosen": -2.609375, "logits/rejected": -2.53125, "logps/chosen": -660.0, "logps/rejected": -968.0, "loss": 0.212, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -4.71875, "rewards/margins": 3.375, "rewards/rejected": -8.0625, "step": 3870 }, { "epoch": 0.28008373637479245, "grad_norm": 10.6784883112821, "learning_rate": 4.522320286455179e-07, "logits/chosen": -2.828125, "logits/rejected": -2.546875, "logps/chosen": -632.0, "logps/rejected": -944.0, "loss": 0.2101, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -4.8125, "rewards/margins": 3.359375, "rewards/rejected": -8.1875, "step": 3880 }, { "epoch": 0.2808056016747275, "grad_norm": 9.94830452756906, "learning_rate": 4.5186101595092403e-07, "logits/chosen": -2.734375, "logits/rejected": -2.59375, "logps/chosen": -664.0, "logps/rejected": -980.0, "loss": 0.2116, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -5.0625, "rewards/margins": 3.234375, "rewards/rejected": -8.3125, "step": 3890 }, { "epoch": 0.2815274669746625, "grad_norm": 9.418299320110647, "learning_rate": 4.5148872143335566e-07, "logits/chosen": -2.875, "logits/rejected": -2.578125, "logps/chosen": -656.0, "logps/rejected": -1016.0, "loss": 0.2042, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -4.90625, "rewards/margins": 3.71875, "rewards/rejected": -8.625, "step": 3900 }, { "epoch": 0.2822493322745976, "grad_norm": 11.904953591713511, "learning_rate": 4.5111514745689307e-07, "logits/chosen": -2.78125, "logits/rejected": -2.4375, "logps/chosen": -640.0, "logps/rejected": -1024.0, "loss": 0.2084, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -4.96875, "rewards/margins": 3.890625, "rewards/rejected": -8.875, "step": 3910 }, { "epoch": 0.2829711975745326, "grad_norm": 11.15522188195295, "learning_rate": 4.507402963937414e-07, "logits/chosen": -2.796875, "logits/rejected": -2.53125, "logps/chosen": -704.0, "logps/rejected": -1064.0, "loss": 0.1865, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.3125, "rewards/margins": 3.703125, "rewards/rejected": -9.0, "step": 3920 }, { "epoch": 0.2836930628744676, "grad_norm": 11.36508327799745, "learning_rate": 4.5036417062421506e-07, "logits/chosen": -2.734375, "logits/rejected": -2.453125, "logps/chosen": -748.0, "logps/rejected": -1088.0, "loss": 0.2226, "rewards/accuracies": 0.887499988079071, "rewards/chosen": -5.8125, "rewards/margins": 3.546875, "rewards/rejected": -9.375, "step": 3930 }, { "epoch": 0.28441492817440267, "grad_norm": 9.897929517208977, "learning_rate": 4.4998677253672297e-07, "logits/chosen": -2.5625, "logits/rejected": -2.390625, "logps/chosen": -732.0, "logps/rejected": -1032.0, "loss": 0.2208, "rewards/accuracies": 0.862500011920929, "rewards/chosen": -5.625, "rewards/margins": 3.046875, "rewards/rejected": -8.6875, "step": 3940 }, { "epoch": 0.2851367934743377, "grad_norm": 9.778813209573705, "learning_rate": 4.496081045277533e-07, "logits/chosen": -2.59375, "logits/rejected": -2.359375, "logps/chosen": -736.0, "logps/rejected": -1080.0, "loss": 0.2031, "rewards/accuracies": 0.8812500238418579, "rewards/chosen": -5.75, "rewards/margins": 3.125, "rewards/rejected": -8.875, "step": 3950 }, { "epoch": 0.28585865877427274, "grad_norm": 7.8313055942532275, "learning_rate": 4.492281690018583e-07, "logits/chosen": -2.8125, "logits/rejected": -2.625, "logps/chosen": -696.0, "logps/rejected": -1048.0, "loss": 0.1818, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.375, "rewards/margins": 3.75, "rewards/rejected": -9.125, "step": 3960 }, { "epoch": 0.28658052407420775, "grad_norm": 8.317207474938273, "learning_rate": 4.4884696837163905e-07, "logits/chosen": -2.828125, "logits/rejected": -2.59375, "logps/chosen": -748.0, "logps/rejected": -1056.0, "loss": 0.2117, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.6875, "rewards/margins": 3.265625, "rewards/rejected": -8.9375, "step": 3970 }, { "epoch": 0.28730238937414276, "grad_norm": 10.26976433894447, "learning_rate": 4.484645050577299e-07, "logits/chosen": -2.875, "logits/rejected": -2.375, "logps/chosen": -724.0, "logps/rejected": -1056.0, "loss": 0.2079, "rewards/accuracies": 0.887499988079071, "rewards/chosen": -5.6875, "rewards/margins": 3.265625, "rewards/rejected": -8.9375, "step": 3980 }, { "epoch": 0.28802425467407783, "grad_norm": 11.840261029137109, "learning_rate": 4.480807814887833e-07, "logits/chosen": -2.546875, "logits/rejected": -2.40625, "logps/chosen": -660.0, "logps/rejected": -960.0, "loss": 0.214, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.03125, "rewards/margins": 3.21875, "rewards/rejected": -8.25, "step": 3990 }, { "epoch": 0.28874611997401284, "grad_norm": 8.811651662253073, "learning_rate": 4.476958001014544e-07, "logits/chosen": -2.8125, "logits/rejected": -2.4375, "logps/chosen": -728.0, "logps/rejected": -1064.0, "loss": 0.2135, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.6875, "rewards/margins": 3.46875, "rewards/rejected": -9.125, "step": 4000 }, { "epoch": 0.2894679852739479, "grad_norm": 8.267204182411973, "learning_rate": 4.4730956334038565e-07, "logits/chosen": -2.90625, "logits/rejected": -2.546875, "logps/chosen": -736.0, "logps/rejected": -1088.0, "loss": 0.2013, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.65625, "rewards/margins": 3.78125, "rewards/rejected": -9.4375, "step": 4010 }, { "epoch": 0.2901898505738829, "grad_norm": 7.77369954894956, "learning_rate": 4.46922073658191e-07, "logits/chosen": -2.671875, "logits/rejected": -2.5, "logps/chosen": -708.0, "logps/rejected": -1056.0, "loss": 0.2009, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.46875, "rewards/margins": 3.703125, "rewards/rejected": -9.1875, "step": 4020 }, { "epoch": 0.2909117158738179, "grad_norm": 8.886847365802758, "learning_rate": 4.465333335154406e-07, "logits/chosen": -2.703125, "logits/rejected": -2.40625, "logps/chosen": -684.0, "logps/rejected": -1020.0, "loss": 0.2115, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.3125, "rewards/margins": 3.359375, "rewards/rejected": -8.6875, "step": 4030 }, { "epoch": 0.291633581173753, "grad_norm": 11.540304268095925, "learning_rate": 4.461433453806449e-07, "logits/chosen": -2.703125, "logits/rejected": -2.34375, "logps/chosen": -712.0, "logps/rejected": -1032.0, "loss": 0.2096, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -5.4375, "rewards/margins": 3.25, "rewards/rejected": -8.6875, "step": 4040 }, { "epoch": 0.292355446473688, "grad_norm": 11.614291076457404, "learning_rate": 4.457521117302392e-07, "logits/chosen": -2.734375, "logits/rejected": -2.40625, "logps/chosen": -636.0, "logps/rejected": -956.0, "loss": 0.2274, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -4.875, "rewards/margins": 3.25, "rewards/rejected": -8.125, "step": 4050 }, { "epoch": 0.29307731177362306, "grad_norm": 11.959955939062517, "learning_rate": 4.45359635048568e-07, "logits/chosen": -2.734375, "logits/rejected": -2.59375, "logps/chosen": -672.0, "logps/rejected": -992.0, "loss": 0.1962, "rewards/accuracies": 0.90625, "rewards/chosen": -5.15625, "rewards/margins": 3.1875, "rewards/rejected": -8.375, "step": 4060 }, { "epoch": 0.29379917707355807, "grad_norm": 10.625522954210599, "learning_rate": 4.4496591782786883e-07, "logits/chosen": -2.953125, "logits/rejected": -2.609375, "logps/chosen": -780.0, "logps/rejected": -1168.0, "loss": 0.2562, "rewards/accuracies": 0.9375, "rewards/chosen": -6.25, "rewards/margins": 3.890625, "rewards/rejected": -10.125, "step": 4070 }, { "epoch": 0.2945210423734931, "grad_norm": 8.706370989411305, "learning_rate": 4.44570962568257e-07, "logits/chosen": -2.96875, "logits/rejected": -2.6875, "logps/chosen": -736.0, "logps/rejected": -1136.0, "loss": 0.2059, "rewards/accuracies": 0.9375, "rewards/chosen": -5.75, "rewards/margins": 4.1875, "rewards/rejected": -9.9375, "step": 4080 }, { "epoch": 0.29524290767342815, "grad_norm": 10.084781546011934, "learning_rate": 4.4417477177770905e-07, "logits/chosen": -2.875, "logits/rejected": -2.671875, "logps/chosen": -704.0, "logps/rejected": -1056.0, "loss": 0.2059, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.5, "rewards/margins": 3.609375, "rewards/rejected": -9.125, "step": 4090 }, { "epoch": 0.29596477297336315, "grad_norm": 10.211730254994997, "learning_rate": 4.4377734797204747e-07, "logits/chosen": -2.875, "logits/rejected": -2.671875, "logps/chosen": -700.0, "logps/rejected": -1056.0, "loss": 0.1966, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.5, "rewards/margins": 3.640625, "rewards/rejected": -9.125, "step": 4100 }, { "epoch": 0.2966866382732982, "grad_norm": 8.821514902632222, "learning_rate": 4.433786936749241e-07, "logits/chosen": -2.703125, "logits/rejected": -2.46875, "logps/chosen": -744.0, "logps/rejected": -1080.0, "loss": 0.2048, "rewards/accuracies": 0.90625, "rewards/chosen": -5.59375, "rewards/margins": 3.734375, "rewards/rejected": -9.3125, "step": 4110 }, { "epoch": 0.29740850357323323, "grad_norm": 9.210606252468882, "learning_rate": 4.429788114178049e-07, "logits/chosen": -2.65625, "logits/rejected": -2.421875, "logps/chosen": -744.0, "logps/rejected": -1072.0, "loss": 0.2042, "rewards/accuracies": 0.90625, "rewards/chosen": -5.84375, "rewards/margins": 3.40625, "rewards/rejected": -9.25, "step": 4120 }, { "epoch": 0.2981303688731683, "grad_norm": 8.00555161785549, "learning_rate": 4.425777037399529e-07, "logits/chosen": -2.640625, "logits/rejected": -2.40625, "logps/chosen": -744.0, "logps/rejected": -1064.0, "loss": 0.1886, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.75, "rewards/margins": 3.40625, "rewards/rejected": -9.1875, "step": 4130 }, { "epoch": 0.2988522341731033, "grad_norm": 11.207346805964308, "learning_rate": 4.42175373188413e-07, "logits/chosen": -2.578125, "logits/rejected": -2.375, "logps/chosen": -780.0, "logps/rejected": -1080.0, "loss": 0.2083, "rewards/accuracies": 0.90625, "rewards/chosen": -6.1875, "rewards/margins": 3.25, "rewards/rejected": -9.4375, "step": 4140 }, { "epoch": 0.2995740994730383, "grad_norm": 8.172701676742552, "learning_rate": 4.4177182231799513e-07, "logits/chosen": -2.703125, "logits/rejected": -2.34375, "logps/chosen": -716.0, "logps/rejected": -1080.0, "loss": 0.2072, "rewards/accuracies": 0.9375, "rewards/chosen": -5.59375, "rewards/margins": 3.515625, "rewards/rejected": -9.125, "step": 4150 }, { "epoch": 0.3002959647729734, "grad_norm": 5.801373290887345, "learning_rate": 4.413670536912584e-07, "logits/chosen": -2.765625, "logits/rejected": -2.46875, "logps/chosen": -728.0, "logps/rejected": -1048.0, "loss": 0.2031, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.40625, "rewards/margins": 3.46875, "rewards/rejected": -8.875, "step": 4160 }, { "epoch": 0.3010178300729084, "grad_norm": 6.307391224443462, "learning_rate": 4.4096106987849457e-07, "logits/chosen": -2.890625, "logits/rejected": -2.515625, "logps/chosen": -732.0, "logps/rejected": -1120.0, "loss": 0.2027, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.625, "rewards/margins": 3.96875, "rewards/rejected": -9.625, "step": 4170 }, { "epoch": 0.30173969537284345, "grad_norm": 11.867957943680011, "learning_rate": 4.405538734577121e-07, "logits/chosen": -2.75, "logits/rejected": -2.5, "logps/chosen": -744.0, "logps/rejected": -1136.0, "loss": 0.1975, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.84375, "rewards/margins": 3.90625, "rewards/rejected": -9.75, "step": 4180 }, { "epoch": 0.30246156067277846, "grad_norm": 9.987667285927838, "learning_rate": 4.401454670146193e-07, "logits/chosen": -2.921875, "logits/rejected": -2.71875, "logps/chosen": -712.0, "logps/rejected": -1080.0, "loss": 0.2163, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.375, "rewards/margins": 3.890625, "rewards/rejected": -9.25, "step": 4190 }, { "epoch": 0.30318342597271347, "grad_norm": 8.977809465407699, "learning_rate": 4.3973585314260836e-07, "logits/chosen": -2.796875, "logits/rejected": -2.53125, "logps/chosen": -668.0, "logps/rejected": -1048.0, "loss": 0.1906, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.15625, "rewards/margins": 3.703125, "rewards/rejected": -8.8125, "step": 4200 }, { "epoch": 0.30390529127264854, "grad_norm": 10.825945402642533, "learning_rate": 4.393250344427385e-07, "logits/chosen": -2.765625, "logits/rejected": -2.515625, "logps/chosen": -736.0, "logps/rejected": -1056.0, "loss": 0.2047, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -5.8125, "rewards/margins": 3.34375, "rewards/rejected": -9.125, "step": 4210 }, { "epoch": 0.30462715657258355, "grad_norm": 8.126172608631684, "learning_rate": 4.389130135237196e-07, "logits/chosen": -2.890625, "logits/rejected": -2.5625, "logps/chosen": -692.0, "logps/rejected": -1088.0, "loss": 0.2207, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.5625, "rewards/margins": 3.859375, "rewards/rejected": -9.4375, "step": 4220 }, { "epoch": 0.3053490218725186, "grad_norm": 7.626491220106016, "learning_rate": 4.38499793001896e-07, "logits/chosen": -2.71875, "logits/rejected": -2.484375, "logps/chosen": -672.0, "logps/rejected": -992.0, "loss": 0.2096, "rewards/accuracies": 0.90625, "rewards/chosen": -5.09375, "rewards/margins": 3.375, "rewards/rejected": -8.4375, "step": 4230 }, { "epoch": 0.3060708871724536, "grad_norm": 9.904614258788264, "learning_rate": 4.3808537550122913e-07, "logits/chosen": -2.609375, "logits/rejected": -2.296875, "logps/chosen": -656.0, "logps/rejected": -948.0, "loss": 0.211, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -4.9375, "rewards/margins": 3.109375, "rewards/rejected": -8.0625, "step": 4240 }, { "epoch": 0.30679275247238863, "grad_norm": 9.163789602486757, "learning_rate": 4.376697636532816e-07, "logits/chosen": -2.625, "logits/rejected": -2.421875, "logps/chosen": -668.0, "logps/rejected": -1040.0, "loss": 0.1866, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.1875, "rewards/margins": 3.6875, "rewards/rejected": -8.875, "step": 4250 }, { "epoch": 0.3075146177723237, "grad_norm": 9.658094123529755, "learning_rate": 4.3725296009719985e-07, "logits/chosen": -2.953125, "logits/rejected": -2.5625, "logps/chosen": -672.0, "logps/rejected": -1064.0, "loss": 0.1865, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -5.125, "rewards/margins": 3.984375, "rewards/rejected": -9.125, "step": 4260 }, { "epoch": 0.3082364830722587, "grad_norm": 6.663743741837934, "learning_rate": 4.3683496747969804e-07, "logits/chosen": -2.828125, "logits/rejected": -2.5625, "logps/chosen": -668.0, "logps/rejected": -1040.0, "loss": 0.1913, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -5.125, "rewards/margins": 3.84375, "rewards/rejected": -8.9375, "step": 4270 }, { "epoch": 0.30895834837219377, "grad_norm": 9.431783701004399, "learning_rate": 4.364157884550406e-07, "logits/chosen": -2.875, "logits/rejected": -2.609375, "logps/chosen": -744.0, "logps/rejected": -1120.0, "loss": 0.2088, "rewards/accuracies": 0.90625, "rewards/chosen": -5.71875, "rewards/margins": 3.875, "rewards/rejected": -9.625, "step": 4280 }, { "epoch": 0.3096802136721288, "grad_norm": 10.281531783875531, "learning_rate": 4.359954256850259e-07, "logits/chosen": -2.8125, "logits/rejected": -2.53125, "logps/chosen": -692.0, "logps/rejected": -1064.0, "loss": 0.2274, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.46875, "rewards/margins": 3.703125, "rewards/rejected": -9.1875, "step": 4290 }, { "epoch": 0.3104020789720638, "grad_norm": 9.63227220127926, "learning_rate": 4.35573881838969e-07, "logits/chosen": -2.6875, "logits/rejected": -2.5625, "logps/chosen": -732.0, "logps/rejected": -1032.0, "loss": 0.2038, "rewards/accuracies": 0.887499988079071, "rewards/chosen": -5.71875, "rewards/margins": 3.203125, "rewards/rejected": -8.9375, "step": 4300 }, { "epoch": 0.31112394427199885, "grad_norm": 10.289092693608229, "learning_rate": 4.3515115959368476e-07, "logits/chosen": -2.8125, "logits/rejected": -2.53125, "logps/chosen": -716.0, "logps/rejected": -1016.0, "loss": 0.2013, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.4375, "rewards/margins": 3.25, "rewards/rejected": -8.6875, "step": 4310 }, { "epoch": 0.31184580957193386, "grad_norm": 10.974607276803276, "learning_rate": 4.3472726163347116e-07, "logits/chosen": -2.71875, "logits/rejected": -2.5625, "logps/chosen": -728.0, "logps/rejected": -1048.0, "loss": 0.2179, "rewards/accuracies": 0.875, "rewards/chosen": -5.65625, "rewards/margins": 3.46875, "rewards/rejected": -9.125, "step": 4320 }, { "epoch": 0.31256767487186893, "grad_norm": 6.412992045987879, "learning_rate": 4.3430219065009177e-07, "logits/chosen": -2.75, "logits/rejected": -2.40625, "logps/chosen": -700.0, "logps/rejected": -1040.0, "loss": 0.1975, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.375, "rewards/margins": 3.4375, "rewards/rejected": -8.8125, "step": 4330 }, { "epoch": 0.31328954017180394, "grad_norm": 10.403220300532743, "learning_rate": 4.3387594934275896e-07, "logits/chosen": -2.90625, "logits/rejected": -2.59375, "logps/chosen": -764.0, "logps/rejected": -1112.0, "loss": 0.2001, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -6.0, "rewards/margins": 3.515625, "rewards/rejected": -9.5, "step": 4340 }, { "epoch": 0.31401140547173895, "grad_norm": 6.73518127809711, "learning_rate": 4.334485404181167e-07, "logits/chosen": -2.875, "logits/rejected": -2.5625, "logps/chosen": -736.0, "logps/rejected": -1104.0, "loss": 0.186, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.78125, "rewards/margins": 3.765625, "rewards/rejected": -9.5, "step": 4350 }, { "epoch": 0.314733270771674, "grad_norm": 10.054893296825982, "learning_rate": 4.3301996659022334e-07, "logits/chosen": -2.625, "logits/rejected": -2.28125, "logps/chosen": -664.0, "logps/rejected": -1020.0, "loss": 0.2176, "rewards/accuracies": 0.8812500238418579, "rewards/chosen": -5.0, "rewards/margins": 3.578125, "rewards/rejected": -8.5625, "step": 4360 }, { "epoch": 0.315455136071609, "grad_norm": 7.828814625819192, "learning_rate": 4.3259023058053444e-07, "logits/chosen": -2.640625, "logits/rejected": -2.328125, "logps/chosen": -724.0, "logps/rejected": -1040.0, "loss": 0.2147, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.625, "rewards/margins": 3.234375, "rewards/rejected": -8.875, "step": 4370 }, { "epoch": 0.3161770013715441, "grad_norm": 7.009502435156667, "learning_rate": 4.3215933511788544e-07, "logits/chosen": -2.578125, "logits/rejected": -2.28125, "logps/chosen": -716.0, "logps/rejected": -1020.0, "loss": 0.2081, "rewards/accuracies": 0.9375, "rewards/chosen": -5.6875, "rewards/margins": 3.15625, "rewards/rejected": -8.875, "step": 4380 }, { "epoch": 0.3168988666714791, "grad_norm": 9.3284353021479, "learning_rate": 4.317272829384743e-07, "logits/chosen": -2.640625, "logits/rejected": -2.4375, "logps/chosen": -704.0, "logps/rejected": -1016.0, "loss": 0.1829, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -5.4375, "rewards/margins": 3.21875, "rewards/rejected": -8.625, "step": 4390 }, { "epoch": 0.31762073197141416, "grad_norm": 8.811880524775491, "learning_rate": 4.3129407678584414e-07, "logits/chosen": -2.703125, "logits/rejected": -2.390625, "logps/chosen": -672.0, "logps/rejected": -1016.0, "loss": 0.2084, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.125, "rewards/margins": 3.609375, "rewards/rejected": -8.75, "step": 4400 }, { "epoch": 0.31834259727134917, "grad_norm": 8.125525464636453, "learning_rate": 4.3085971941086585e-07, "logits/chosen": -2.578125, "logits/rejected": -2.390625, "logps/chosen": -728.0, "logps/rejected": -1032.0, "loss": 0.1915, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -5.6875, "rewards/margins": 3.125, "rewards/rejected": -8.8125, "step": 4410 }, { "epoch": 0.3190644625712842, "grad_norm": 8.751734979718838, "learning_rate": 4.3042421357172076e-07, "logits/chosen": -2.640625, "logits/rejected": -2.3125, "logps/chosen": -708.0, "logps/rejected": -1072.0, "loss": 0.1923, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.4375, "rewards/margins": 3.515625, "rewards/rejected": -8.9375, "step": 4420 }, { "epoch": 0.31978632787121924, "grad_norm": 7.608014094617588, "learning_rate": 4.2998756203388285e-07, "logits/chosen": -2.703125, "logits/rejected": -2.4375, "logps/chosen": -684.0, "logps/rejected": -1032.0, "loss": 0.2152, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.0, "rewards/margins": 3.8125, "rewards/rejected": -8.8125, "step": 4430 }, { "epoch": 0.32050819317115425, "grad_norm": 7.639743064757877, "learning_rate": 4.2954976757010133e-07, "logits/chosen": -2.59375, "logits/rejected": -2.421875, "logps/chosen": -672.0, "logps/rejected": -1032.0, "loss": 0.1902, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.0625, "rewards/margins": 3.78125, "rewards/rejected": -8.875, "step": 4440 }, { "epoch": 0.3212300584710893, "grad_norm": 11.460888477745158, "learning_rate": 4.2911083296038285e-07, "logits/chosen": -2.765625, "logits/rejected": -2.546875, "logps/chosen": -688.0, "logps/rejected": -1056.0, "loss": 0.1824, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.21875, "rewards/margins": 3.859375, "rewards/rejected": -9.0625, "step": 4450 }, { "epoch": 0.32195192377102433, "grad_norm": 9.224352773153688, "learning_rate": 4.2867076099197446e-07, "logits/chosen": -2.703125, "logits/rejected": -2.5, "logps/chosen": -668.0, "logps/rejected": -980.0, "loss": 0.1895, "rewards/accuracies": 0.90625, "rewards/chosen": -4.90625, "rewards/margins": 3.5, "rewards/rejected": -8.4375, "step": 4460 }, { "epoch": 0.32267378907095934, "grad_norm": 9.244876887068662, "learning_rate": 4.2822955445934505e-07, "logits/chosen": -2.828125, "logits/rejected": -2.5625, "logps/chosen": -732.0, "logps/rejected": -1080.0, "loss": 0.1772, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.5625, "rewards/margins": 3.765625, "rewards/rejected": -9.3125, "step": 4470 }, { "epoch": 0.3233956543708944, "grad_norm": 8.906087322512382, "learning_rate": 4.277872161641681e-07, "logits/chosen": -2.8125, "logits/rejected": -2.453125, "logps/chosen": -760.0, "logps/rejected": -1120.0, "loss": 0.1962, "rewards/accuracies": 0.90625, "rewards/chosen": -5.875, "rewards/margins": 3.6875, "rewards/rejected": -9.5625, "step": 4480 }, { "epoch": 0.3241175196708294, "grad_norm": 9.689414725700667, "learning_rate": 4.273437489153041e-07, "logits/chosen": -2.609375, "logits/rejected": -2.390625, "logps/chosen": -716.0, "logps/rejected": -1048.0, "loss": 0.2001, "rewards/accuracies": 0.9375, "rewards/chosen": -5.4375, "rewards/margins": 3.59375, "rewards/rejected": -9.0, "step": 4490 }, { "epoch": 0.3248393849707645, "grad_norm": 8.996613366246144, "learning_rate": 4.2689915552878207e-07, "logits/chosen": -2.609375, "logits/rejected": -2.4375, "logps/chosen": -688.0, "logps/rejected": -1008.0, "loss": 0.1829, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.125, "rewards/margins": 3.390625, "rewards/rejected": -8.5, "step": 4500 }, { "epoch": 0.3255612502706995, "grad_norm": 9.607472232534843, "learning_rate": 4.2645343882778215e-07, "logits/chosen": -2.734375, "logits/rejected": -2.453125, "logps/chosen": -720.0, "logps/rejected": -1088.0, "loss": 0.2257, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.625, "rewards/margins": 3.828125, "rewards/rejected": -9.4375, "step": 4510 }, { "epoch": 0.3262831155706345, "grad_norm": 8.846494209878479, "learning_rate": 4.260066016426177e-07, "logits/chosen": -2.75, "logits/rejected": -2.46875, "logps/chosen": -680.0, "logps/rejected": -1032.0, "loss": 0.1767, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -5.21875, "rewards/margins": 3.59375, "rewards/rejected": -8.8125, "step": 4520 }, { "epoch": 0.32700498087056956, "grad_norm": 11.245824423136213, "learning_rate": 4.25558646810717e-07, "logits/chosen": -2.703125, "logits/rejected": -2.59375, "logps/chosen": -688.0, "logps/rejected": -1020.0, "loss": 0.1856, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -5.25, "rewards/margins": 3.453125, "rewards/rejected": -8.6875, "step": 4530 }, { "epoch": 0.32772684617050457, "grad_norm": 8.60581993865266, "learning_rate": 4.251095771766055e-07, "logits/chosen": -2.78125, "logits/rejected": -2.5, "logps/chosen": -672.0, "logps/rejected": -1048.0, "loss": 0.177, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.09375, "rewards/margins": 3.640625, "rewards/rejected": -8.75, "step": 4540 }, { "epoch": 0.32844871147043964, "grad_norm": 7.6110846227784625, "learning_rate": 4.246593955918877e-07, "logits/chosen": -2.8125, "logits/rejected": -2.5625, "logps/chosen": -716.0, "logps/rejected": -1048.0, "loss": 0.2188, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.59375, "rewards/margins": 3.453125, "rewards/rejected": -9.0625, "step": 4550 }, { "epoch": 0.32917057677037465, "grad_norm": 7.571006600020749, "learning_rate": 4.2420810491522896e-07, "logits/chosen": -2.5625, "logits/rejected": -2.34375, "logps/chosen": -672.0, "logps/rejected": -988.0, "loss": 0.2004, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -5.28125, "rewards/margins": 3.171875, "rewards/rejected": -8.4375, "step": 4560 }, { "epoch": 0.32989244207030965, "grad_norm": 9.619717180276336, "learning_rate": 4.237557080123373e-07, "logits/chosen": -2.53125, "logits/rejected": -2.4375, "logps/chosen": -672.0, "logps/rejected": -956.0, "loss": 0.2037, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.09375, "rewards/margins": 3.140625, "rewards/rejected": -8.25, "step": 4570 }, { "epoch": 0.3306143073702447, "grad_norm": 9.813397994219041, "learning_rate": 4.2330220775594567e-07, "logits/chosen": -2.78125, "logits/rejected": -2.515625, "logps/chosen": -660.0, "logps/rejected": -972.0, "loss": 0.1992, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -4.9375, "rewards/margins": 3.328125, "rewards/rejected": -8.25, "step": 4580 }, { "epoch": 0.33133617267017973, "grad_norm": 8.765749359430536, "learning_rate": 4.228476070257929e-07, "logits/chosen": -2.75, "logits/rejected": -2.46875, "logps/chosen": -680.0, "logps/rejected": -992.0, "loss": 0.1884, "rewards/accuracies": 0.8687499761581421, "rewards/chosen": -5.21875, "rewards/margins": 3.203125, "rewards/rejected": -8.4375, "step": 4590 }, { "epoch": 0.3320580379701148, "grad_norm": 10.82246666876482, "learning_rate": 4.223919087086062e-07, "logits/chosen": -2.796875, "logits/rejected": -2.609375, "logps/chosen": -640.0, "logps/rejected": -1012.0, "loss": 0.1802, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -4.875, "rewards/margins": 3.859375, "rewards/rejected": -8.75, "step": 4600 }, { "epoch": 0.3327799032700498, "grad_norm": 7.941514770204173, "learning_rate": 4.2193511569808225e-07, "logits/chosen": -2.859375, "logits/rejected": -2.609375, "logps/chosen": -616.0, "logps/rejected": -988.0, "loss": 0.1991, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -4.5625, "rewards/margins": 3.75, "rewards/rejected": -8.3125, "step": 4610 }, { "epoch": 0.3335017685699848, "grad_norm": 7.912745662185516, "learning_rate": 4.214772308948693e-07, "logits/chosen": -2.90625, "logits/rejected": -2.453125, "logps/chosen": -600.0, "logps/rejected": -1024.0, "loss": 0.2012, "rewards/accuracies": 0.90625, "rewards/chosen": -4.40625, "rewards/margins": 4.4375, "rewards/rejected": -8.8125, "step": 4620 }, { "epoch": 0.3342236338699199, "grad_norm": 10.9521651772932, "learning_rate": 4.2101825720654827e-07, "logits/chosen": -2.765625, "logits/rejected": -2.484375, "logps/chosen": -644.0, "logps/rejected": -936.0, "loss": 0.2081, "rewards/accuracies": 0.862500011920929, "rewards/chosen": -4.875, "rewards/margins": 3.046875, "rewards/rejected": -7.90625, "step": 4630 }, { "epoch": 0.3349454991698549, "grad_norm": 6.99023599526195, "learning_rate": 4.205581975476146e-07, "logits/chosen": -2.765625, "logits/rejected": -2.421875, "logps/chosen": -652.0, "logps/rejected": -988.0, "loss": 0.2041, "rewards/accuracies": 0.9375, "rewards/chosen": -4.9375, "rewards/margins": 3.453125, "rewards/rejected": -8.4375, "step": 4640 }, { "epoch": 0.33566736446978995, "grad_norm": 8.603344530140768, "learning_rate": 4.200970548394598e-07, "logits/chosen": -2.765625, "logits/rejected": -2.578125, "logps/chosen": -724.0, "logps/rejected": -1040.0, "loss": 0.1965, "rewards/accuracies": 0.90625, "rewards/chosen": -5.375, "rewards/margins": 3.515625, "rewards/rejected": -8.875, "step": 4650 }, { "epoch": 0.33638922976972496, "grad_norm": 9.717823679934542, "learning_rate": 4.196348320103527e-07, "logits/chosen": -2.78125, "logits/rejected": -2.609375, "logps/chosen": -656.0, "logps/rejected": -1024.0, "loss": 0.213, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.125, "rewards/margins": 3.515625, "rewards/rejected": -8.625, "step": 4660 }, { "epoch": 0.33711109506966, "grad_norm": 7.935814772911749, "learning_rate": 4.191715319954209e-07, "logits/chosen": -2.90625, "logits/rejected": -2.53125, "logps/chosen": -644.0, "logps/rejected": -1008.0, "loss": 0.1937, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -4.96875, "rewards/margins": 3.625, "rewards/rejected": -8.5625, "step": 4670 }, { "epoch": 0.33783296036959504, "grad_norm": 8.769171773282734, "learning_rate": 4.187071577366321e-07, "logits/chosen": -2.875, "logits/rejected": -2.6875, "logps/chosen": -684.0, "logps/rejected": -1008.0, "loss": 0.176, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -5.3125, "rewards/margins": 3.421875, "rewards/rejected": -8.75, "step": 4680 }, { "epoch": 0.33855482566953005, "grad_norm": 7.096843320580391, "learning_rate": 4.182417121827755e-07, "logits/chosen": -2.90625, "logits/rejected": -2.546875, "logps/chosen": -676.0, "logps/rejected": -1040.0, "loss": 0.1906, "rewards/accuracies": 0.96875, "rewards/chosen": -5.3125, "rewards/margins": 3.546875, "rewards/rejected": -8.875, "step": 4690 }, { "epoch": 0.3392766909694651, "grad_norm": 10.058671513695627, "learning_rate": 4.177751982894433e-07, "logits/chosen": -2.828125, "logits/rejected": -2.515625, "logps/chosen": -600.0, "logps/rejected": -916.0, "loss": 0.1903, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -4.34375, "rewards/margins": 3.5625, "rewards/rejected": -7.90625, "step": 4700 }, { "epoch": 0.3399985562694001, "grad_norm": 10.565296750226013, "learning_rate": 4.1730761901901135e-07, "logits/chosen": -2.828125, "logits/rejected": -2.46875, "logps/chosen": -684.0, "logps/rejected": -1064.0, "loss": 0.1993, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.125, "rewards/margins": 3.890625, "rewards/rejected": -9.0, "step": 4710 }, { "epoch": 0.3407204215693352, "grad_norm": 9.850412180420557, "learning_rate": 4.168389773406209e-07, "logits/chosen": -2.875, "logits/rejected": -2.5625, "logps/chosen": -696.0, "logps/rejected": -1032.0, "loss": 0.2055, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -5.3125, "rewards/margins": 3.546875, "rewards/rejected": -8.875, "step": 4720 }, { "epoch": 0.3414422868692702, "grad_norm": 11.906676776121467, "learning_rate": 4.1636927623015927e-07, "logits/chosen": -2.96875, "logits/rejected": -2.578125, "logps/chosen": -656.0, "logps/rejected": -1016.0, "loss": 0.1838, "rewards/accuracies": 0.9375, "rewards/chosen": -4.875, "rewards/margins": 3.796875, "rewards/rejected": -8.6875, "step": 4730 }, { "epoch": 0.3421641521692052, "grad_norm": 10.205674489245993, "learning_rate": 4.158985186702415e-07, "logits/chosen": -2.84375, "logits/rejected": -2.4375, "logps/chosen": -628.0, "logps/rejected": -1056.0, "loss": 0.2092, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -4.75, "rewards/margins": 4.125, "rewards/rejected": -8.875, "step": 4740 }, { "epoch": 0.34288601746914027, "grad_norm": 9.260984330253814, "learning_rate": 4.1542670765019104e-07, "logits/chosen": -2.765625, "logits/rejected": -2.5, "logps/chosen": -672.0, "logps/rejected": -1040.0, "loss": 0.1958, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.125, "rewards/margins": 3.828125, "rewards/rejected": -8.9375, "step": 4750 }, { "epoch": 0.3436078827690753, "grad_norm": 8.949027397431555, "learning_rate": 4.149538461660206e-07, "logits/chosen": -2.75, "logits/rejected": -2.40625, "logps/chosen": -672.0, "logps/rejected": -1004.0, "loss": 0.2089, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.28125, "rewards/margins": 3.296875, "rewards/rejected": -8.5625, "step": 4760 }, { "epoch": 0.34432974806901034, "grad_norm": 6.720014771416349, "learning_rate": 4.144799372204136e-07, "logits/chosen": -2.921875, "logits/rejected": -2.6875, "logps/chosen": -644.0, "logps/rejected": -956.0, "loss": 0.1826, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -4.875, "rewards/margins": 3.21875, "rewards/rejected": -8.125, "step": 4770 }, { "epoch": 0.34505161336894535, "grad_norm": 8.959024936705582, "learning_rate": 4.140049838227049e-07, "logits/chosen": -2.8125, "logits/rejected": -2.625, "logps/chosen": -664.0, "logps/rejected": -1012.0, "loss": 0.1987, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -4.90625, "rewards/margins": 3.703125, "rewards/rejected": -8.5625, "step": 4780 }, { "epoch": 0.34577347866888036, "grad_norm": 10.372748362230645, "learning_rate": 4.135289889888615e-07, "logits/chosen": -2.875, "logits/rejected": -2.65625, "logps/chosen": -728.0, "logps/rejected": -1088.0, "loss": 0.1637, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.5, "rewards/margins": 3.78125, "rewards/rejected": -9.3125, "step": 4790 }, { "epoch": 0.34649534396881543, "grad_norm": 8.270570715124181, "learning_rate": 4.130519557414636e-07, "logits/chosen": -2.875, "logits/rejected": -2.671875, "logps/chosen": -660.0, "logps/rejected": -1040.0, "loss": 0.2018, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -4.96875, "rewards/margins": 3.90625, "rewards/rejected": -8.875, "step": 4800 }, { "epoch": 0.34721720926875044, "grad_norm": 9.893879868420212, "learning_rate": 4.1257388710968533e-07, "logits/chosen": -2.71875, "logits/rejected": -2.5, "logps/chosen": -648.0, "logps/rejected": -1008.0, "loss": 0.1925, "rewards/accuracies": 0.9375, "rewards/chosen": -4.8125, "rewards/margins": 3.8125, "rewards/rejected": -8.625, "step": 4810 }, { "epoch": 0.3479390745686855, "grad_norm": 12.331591426723168, "learning_rate": 4.120947861292757e-07, "logits/chosen": -2.8125, "logits/rejected": -2.5625, "logps/chosen": -716.0, "logps/rejected": -1072.0, "loss": 0.1966, "rewards/accuracies": 0.9375, "rewards/chosen": -5.5, "rewards/margins": 3.671875, "rewards/rejected": -9.1875, "step": 4820 }, { "epoch": 0.3486609398686205, "grad_norm": 10.172376095851071, "learning_rate": 4.11614655842539e-07, "logits/chosen": -2.796875, "logits/rejected": -2.65625, "logps/chosen": -724.0, "logps/rejected": -1056.0, "loss": 0.2024, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.375, "rewards/margins": 3.546875, "rewards/rejected": -8.9375, "step": 4830 }, { "epoch": 0.3493828051685555, "grad_norm": 11.310294528639917, "learning_rate": 4.111334992983156e-07, "logits/chosen": -2.703125, "logits/rejected": -2.4375, "logps/chosen": -640.0, "logps/rejected": -992.0, "loss": 0.1973, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -4.8125, "rewards/margins": 3.5625, "rewards/rejected": -8.375, "step": 4840 }, { "epoch": 0.3501046704684906, "grad_norm": 9.138376308040302, "learning_rate": 4.1065131955196294e-07, "logits/chosen": -2.75, "logits/rejected": -2.40625, "logps/chosen": -656.0, "logps/rejected": -1020.0, "loss": 0.1957, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.03125, "rewards/margins": 3.65625, "rewards/rejected": -8.6875, "step": 4850 }, { "epoch": 0.3508265357684256, "grad_norm": 10.948111955434124, "learning_rate": 4.1016811966533536e-07, "logits/chosen": -2.84375, "logits/rejected": -2.53125, "logps/chosen": -708.0, "logps/rejected": -1104.0, "loss": 0.1823, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.59375, "rewards/margins": 3.953125, "rewards/rejected": -9.5625, "step": 4860 }, { "epoch": 0.35154840106836066, "grad_norm": 6.8483776654650965, "learning_rate": 4.096839027067656e-07, "logits/chosen": -2.953125, "logits/rejected": -2.625, "logps/chosen": -644.0, "logps/rejected": -1016.0, "loss": 0.2069, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -4.84375, "rewards/margins": 3.796875, "rewards/rejected": -8.625, "step": 4870 }, { "epoch": 0.35227026636829567, "grad_norm": 7.262308675444548, "learning_rate": 4.0919867175104435e-07, "logits/chosen": -2.8125, "logits/rejected": -2.6875, "logps/chosen": -656.0, "logps/rejected": -972.0, "loss": 0.1921, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -4.875, "rewards/margins": 3.40625, "rewards/rejected": -8.25, "step": 4880 }, { "epoch": 0.35299213166823074, "grad_norm": 17.175486759838638, "learning_rate": 4.0871242987940155e-07, "logits/chosen": -2.875, "logits/rejected": -2.71875, "logps/chosen": -688.0, "logps/rejected": -1048.0, "loss": 0.1981, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.3125, "rewards/margins": 3.734375, "rewards/rejected": -9.0625, "step": 4890 }, { "epoch": 0.35371399696816574, "grad_norm": 6.418913714694265, "learning_rate": 4.082251801794865e-07, "logits/chosen": -3.0, "logits/rejected": -2.71875, "logps/chosen": -684.0, "logps/rejected": -1048.0, "loss": 0.1888, "rewards/accuracies": 0.887499988079071, "rewards/chosen": -5.125, "rewards/margins": 3.640625, "rewards/rejected": -8.75, "step": 4900 }, { "epoch": 0.35443586226810075, "grad_norm": 6.8125539564399515, "learning_rate": 4.0773692574534795e-07, "logits/chosen": -2.90625, "logits/rejected": -2.5625, "logps/chosen": -684.0, "logps/rejected": -1000.0, "loss": 0.1871, "rewards/accuracies": 0.887499988079071, "rewards/chosen": -5.1875, "rewards/margins": 3.359375, "rewards/rejected": -8.5625, "step": 4910 }, { "epoch": 0.3551577275680358, "grad_norm": 7.814190613362822, "learning_rate": 4.072476696774151e-07, "logits/chosen": -2.8125, "logits/rejected": -2.546875, "logps/chosen": -720.0, "logps/rejected": -1112.0, "loss": 0.1852, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.40625, "rewards/margins": 4.03125, "rewards/rejected": -9.4375, "step": 4920 }, { "epoch": 0.35587959286797083, "grad_norm": 10.826610307359978, "learning_rate": 4.0675741508247715e-07, "logits/chosen": -2.953125, "logits/rejected": -2.59375, "logps/chosen": -680.0, "logps/rejected": -1144.0, "loss": 0.1675, "rewards/accuracies": 0.96875, "rewards/chosen": -5.3125, "rewards/margins": 4.78125, "rewards/rejected": -10.0625, "step": 4930 }, { "epoch": 0.3566014581679059, "grad_norm": 8.596687269801581, "learning_rate": 4.062661650736643e-07, "logits/chosen": -3.046875, "logits/rejected": -2.765625, "logps/chosen": -728.0, "logps/rejected": -1112.0, "loss": 0.1869, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -5.59375, "rewards/margins": 4.0, "rewards/rejected": -9.625, "step": 4940 }, { "epoch": 0.3573233234678409, "grad_norm": 6.416195679478135, "learning_rate": 4.0577392277042766e-07, "logits/chosen": -2.90625, "logits/rejected": -2.671875, "logps/chosen": -700.0, "logps/rejected": -1056.0, "loss": 0.1855, "rewards/accuracies": 0.90625, "rewards/chosen": -5.375, "rewards/margins": 3.6875, "rewards/rejected": -9.0625, "step": 4950 }, { "epoch": 0.3580451887677759, "grad_norm": 8.918928643083534, "learning_rate": 4.0528069129851914e-07, "logits/chosen": -2.828125, "logits/rejected": -2.46875, "logps/chosen": -712.0, "logps/rejected": -1088.0, "loss": 0.1846, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.28125, "rewards/margins": 3.953125, "rewards/rejected": -9.25, "step": 4960 }, { "epoch": 0.358767054067711, "grad_norm": 8.47545192360217, "learning_rate": 4.0478647378997223e-07, "logits/chosen": -2.703125, "logits/rejected": -2.515625, "logps/chosen": -724.0, "logps/rejected": -1048.0, "loss": 0.2025, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.5625, "rewards/margins": 3.46875, "rewards/rejected": -9.0625, "step": 4970 }, { "epoch": 0.359488919367646, "grad_norm": 8.09646150016637, "learning_rate": 4.0429127338308154e-07, "logits/chosen": -2.828125, "logits/rejected": -2.53125, "logps/chosen": -700.0, "logps/rejected": -1024.0, "loss": 0.206, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.375, "rewards/margins": 3.421875, "rewards/rejected": -8.8125, "step": 4980 }, { "epoch": 0.36021078466758105, "grad_norm": 7.912242395511905, "learning_rate": 4.037950932223832e-07, "logits/chosen": -2.71875, "logits/rejected": -2.5, "logps/chosen": -676.0, "logps/rejected": -1072.0, "loss": 0.186, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.21875, "rewards/margins": 3.796875, "rewards/rejected": -9.0, "step": 4990 }, { "epoch": 0.36093264996751606, "grad_norm": 8.510565195808283, "learning_rate": 4.032979364586349e-07, "logits/chosen": -2.953125, "logits/rejected": -2.703125, "logps/chosen": -688.0, "logps/rejected": -1064.0, "loss": 0.2007, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -5.28125, "rewards/margins": 3.734375, "rewards/rejected": -9.0, "step": 5000 }, { "epoch": 0.36093264996751606, "eval_logits/chosen": -2.90625, "eval_logits/rejected": -2.65625, "eval_logps/chosen": -700.0, "eval_logps/rejected": -1040.0, "eval_loss": 0.22352416813373566, "eval_rewards/accuracies": 0.9081980586051941, "eval_rewards/chosen": -5.3125, "eval_rewards/margins": 3.546875, "eval_rewards/rejected": -8.875, "eval_runtime": 3594.5422, "eval_samples_per_second": 27.403, "eval_steps_per_second": 0.428, "step": 5000 }, { "epoch": 0.36165451526745107, "grad_norm": 9.508216962196549, "learning_rate": 4.027998062487955e-07, "logits/chosen": -2.90625, "logits/rejected": -2.703125, "logps/chosen": -664.0, "logps/rejected": -1012.0, "loss": 0.1912, "rewards/accuracies": 0.887499988079071, "rewards/chosen": -5.15625, "rewards/margins": 3.625, "rewards/rejected": -8.8125, "step": 5010 }, { "epoch": 0.36237638056738614, "grad_norm": 11.433083041803624, "learning_rate": 4.023007057560057e-07, "logits/chosen": -3.015625, "logits/rejected": -2.84375, "logps/chosen": -728.0, "logps/rejected": -1080.0, "loss": 0.1908, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.3125, "rewards/margins": 3.796875, "rewards/rejected": -9.125, "step": 5020 }, { "epoch": 0.36309824586732115, "grad_norm": 9.561775751013597, "learning_rate": 4.018006381495671e-07, "logits/chosen": -3.09375, "logits/rejected": -2.8125, "logps/chosen": -764.0, "logps/rejected": -1152.0, "loss": 0.1764, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -6.03125, "rewards/margins": 3.90625, "rewards/rejected": -9.9375, "step": 5030 }, { "epoch": 0.3638201111672562, "grad_norm": 8.343880295640096, "learning_rate": 4.012996066049229e-07, "logits/chosen": -2.984375, "logits/rejected": -2.640625, "logps/chosen": -740.0, "logps/rejected": -1112.0, "loss": 0.1988, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -5.75, "rewards/margins": 3.71875, "rewards/rejected": -9.4375, "step": 5040 }, { "epoch": 0.3645419764671912, "grad_norm": 7.788342844437915, "learning_rate": 4.0079761430363676e-07, "logits/chosen": -2.671875, "logits/rejected": -2.421875, "logps/chosen": -644.0, "logps/rejected": -1020.0, "loss": 0.1751, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -4.875, "rewards/margins": 3.65625, "rewards/rejected": -8.5, "step": 5050 }, { "epoch": 0.36526384176712623, "grad_norm": 9.014324627097576, "learning_rate": 4.002946644333739e-07, "logits/chosen": -2.6875, "logits/rejected": -2.40625, "logps/chosen": -748.0, "logps/rejected": -1104.0, "loss": 0.1926, "rewards/accuracies": 0.9375, "rewards/chosen": -5.875, "rewards/margins": 3.578125, "rewards/rejected": -9.4375, "step": 5060 }, { "epoch": 0.3659857070670613, "grad_norm": 10.445201108593542, "learning_rate": 3.997907601878796e-07, "logits/chosen": -2.71875, "logits/rejected": -2.53125, "logps/chosen": -772.0, "logps/rejected": -1128.0, "loss": 0.1911, "rewards/accuracies": 0.856249988079071, "rewards/chosen": -6.09375, "rewards/margins": 3.3125, "rewards/rejected": -9.375, "step": 5070 }, { "epoch": 0.3667075723669963, "grad_norm": 8.250001844997403, "learning_rate": 3.992859047669596e-07, "logits/chosen": -2.71875, "logits/rejected": -2.5, "logps/chosen": -764.0, "logps/rejected": -1088.0, "loss": 0.1844, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -5.90625, "rewards/margins": 3.296875, "rewards/rejected": -9.1875, "step": 5080 }, { "epoch": 0.36742943766693137, "grad_norm": 11.753669122881204, "learning_rate": 3.987801013764596e-07, "logits/chosen": -2.578125, "logits/rejected": -2.34375, "logps/chosen": -784.0, "logps/rejected": -1152.0, "loss": 0.1879, "rewards/accuracies": 0.875, "rewards/chosen": -6.28125, "rewards/margins": 3.625, "rewards/rejected": -9.875, "step": 5090 }, { "epoch": 0.3681513029668664, "grad_norm": 12.658837897492882, "learning_rate": 3.9827335322824496e-07, "logits/chosen": -2.59375, "logits/rejected": -2.421875, "logps/chosen": -748.0, "logps/rejected": -1088.0, "loss": 0.207, "rewards/accuracies": 0.887499988079071, "rewards/chosen": -5.75, "rewards/margins": 3.734375, "rewards/rejected": -9.5, "step": 5100 }, { "epoch": 0.3688731682668014, "grad_norm": 7.844631820767091, "learning_rate": 3.977656635401805e-07, "logits/chosen": -2.671875, "logits/rejected": -2.5, "logps/chosen": -752.0, "logps/rejected": -1120.0, "loss": 0.1954, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -6.0625, "rewards/margins": 3.515625, "rewards/rejected": -9.5625, "step": 5110 }, { "epoch": 0.36959503356673645, "grad_norm": 7.842154920577124, "learning_rate": 3.972570355361093e-07, "logits/chosen": -2.765625, "logits/rejected": -2.40625, "logps/chosen": -760.0, "logps/rejected": -1088.0, "loss": 0.1904, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.875, "rewards/margins": 3.484375, "rewards/rejected": -9.375, "step": 5120 }, { "epoch": 0.37031689886667146, "grad_norm": 12.429197801825422, "learning_rate": 3.967474724458334e-07, "logits/chosen": -2.828125, "logits/rejected": -2.46875, "logps/chosen": -704.0, "logps/rejected": -1056.0, "loss": 0.1919, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.3125, "rewards/margins": 3.6875, "rewards/rejected": -9.0, "step": 5130 }, { "epoch": 0.3710387641666065, "grad_norm": 9.022738866247183, "learning_rate": 3.962369775050922e-07, "logits/chosen": -2.78125, "logits/rejected": -2.515625, "logps/chosen": -688.0, "logps/rejected": -1056.0, "loss": 0.1653, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.28125, "rewards/margins": 3.640625, "rewards/rejected": -8.9375, "step": 5140 }, { "epoch": 0.37176062946654154, "grad_norm": 7.735894816170176, "learning_rate": 3.957255539555426e-07, "logits/chosen": -2.828125, "logits/rejected": -2.53125, "logps/chosen": -704.0, "logps/rejected": -1104.0, "loss": 0.1752, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -5.375, "rewards/margins": 4.03125, "rewards/rejected": -9.4375, "step": 5150 }, { "epoch": 0.3724824947664766, "grad_norm": 7.904648881093523, "learning_rate": 3.9521320504473804e-07, "logits/chosen": -2.875, "logits/rejected": -2.625, "logps/chosen": -656.0, "logps/rejected": -1048.0, "loss": 0.1898, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -4.9375, "rewards/margins": 4.03125, "rewards/rejected": -9.0, "step": 5160 }, { "epoch": 0.3732043600664116, "grad_norm": 8.068500078950347, "learning_rate": 3.9469993402610823e-07, "logits/chosen": -2.640625, "logits/rejected": -2.4375, "logps/chosen": -668.0, "logps/rejected": -1000.0, "loss": 0.1822, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -5.0, "rewards/margins": 3.4375, "rewards/rejected": -8.4375, "step": 5170 }, { "epoch": 0.3739262253663466, "grad_norm": 9.258484145773922, "learning_rate": 3.941857441589382e-07, "logits/chosen": -2.734375, "logits/rejected": -2.453125, "logps/chosen": -664.0, "logps/rejected": -984.0, "loss": 0.1924, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -4.96875, "rewards/margins": 3.46875, "rewards/rejected": -8.4375, "step": 5180 }, { "epoch": 0.3746480906662817, "grad_norm": 9.720892187785136, "learning_rate": 3.936706387083476e-07, "logits/chosen": -2.828125, "logits/rejected": -2.5, "logps/chosen": -696.0, "logps/rejected": -1064.0, "loss": 0.1939, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.34375, "rewards/margins": 3.796875, "rewards/rejected": -9.125, "step": 5190 }, { "epoch": 0.3753699559662167, "grad_norm": 5.5288559635381365, "learning_rate": 3.9315462094527006e-07, "logits/chosen": -2.828125, "logits/rejected": -2.53125, "logps/chosen": -676.0, "logps/rejected": -1064.0, "loss": 0.1796, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.25, "rewards/margins": 3.921875, "rewards/rejected": -9.1875, "step": 5200 }, { "epoch": 0.37609182126615176, "grad_norm": 7.613626077988378, "learning_rate": 3.9263769414643273e-07, "logits/chosen": -2.90625, "logits/rejected": -2.640625, "logps/chosen": -728.0, "logps/rejected": -1064.0, "loss": 0.1846, "rewards/accuracies": 0.90625, "rewards/chosen": -5.5, "rewards/margins": 3.578125, "rewards/rejected": -9.0625, "step": 5210 }, { "epoch": 0.37681368656608677, "grad_norm": 6.807486326402407, "learning_rate": 3.9211986159433477e-07, "logits/chosen": -2.828125, "logits/rejected": -2.546875, "logps/chosen": -664.0, "logps/rejected": -1020.0, "loss": 0.1722, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.125, "rewards/margins": 3.796875, "rewards/rejected": -8.875, "step": 5220 }, { "epoch": 0.3775355518660218, "grad_norm": 9.160049813590764, "learning_rate": 3.91601126577227e-07, "logits/chosen": -2.734375, "logits/rejected": -2.34375, "logps/chosen": -624.0, "logps/rejected": -1040.0, "loss": 0.1827, "rewards/accuracies": 0.9375, "rewards/chosen": -4.6875, "rewards/margins": 4.09375, "rewards/rejected": -8.75, "step": 5230 }, { "epoch": 0.37825741716595684, "grad_norm": 10.144956306040507, "learning_rate": 3.910814923890911e-07, "logits/chosen": -2.921875, "logits/rejected": -2.625, "logps/chosen": -636.0, "logps/rejected": -1020.0, "loss": 0.1734, "rewards/accuracies": 0.9375, "rewards/chosen": -4.84375, "rewards/margins": 3.796875, "rewards/rejected": -8.625, "step": 5240 }, { "epoch": 0.37897928246589185, "grad_norm": 10.789604509188436, "learning_rate": 3.9056096232961834e-07, "logits/chosen": -2.9375, "logits/rejected": -2.75, "logps/chosen": -684.0, "logps/rejected": -1056.0, "loss": 0.1953, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -5.25, "rewards/margins": 3.78125, "rewards/rejected": -9.0625, "step": 5250 }, { "epoch": 0.3797011477658269, "grad_norm": 8.03159337115462, "learning_rate": 3.9003953970418877e-07, "logits/chosen": -2.9375, "logits/rejected": -2.625, "logps/chosen": -640.0, "logps/rejected": -1012.0, "loss": 0.1836, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -4.84375, "rewards/margins": 3.6875, "rewards/rejected": -8.5625, "step": 5260 }, { "epoch": 0.38042301306576193, "grad_norm": 9.599822536896923, "learning_rate": 3.8951722782385046e-07, "logits/chosen": -3.015625, "logits/rejected": -2.65625, "logps/chosen": -644.0, "logps/rejected": -1048.0, "loss": 0.1911, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -4.90625, "rewards/margins": 4.15625, "rewards/rejected": -9.0625, "step": 5270 }, { "epoch": 0.38114487836569694, "grad_norm": 10.071856627849183, "learning_rate": 3.8899403000529803e-07, "logits/chosen": -2.84375, "logits/rejected": -2.65625, "logps/chosen": -668.0, "logps/rejected": -1016.0, "loss": 0.1888, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -4.96875, "rewards/margins": 3.828125, "rewards/rejected": -8.8125, "step": 5280 }, { "epoch": 0.381866743665632, "grad_norm": 10.524225607275767, "learning_rate": 3.8846994957085194e-07, "logits/chosen": -2.84375, "logits/rejected": -2.65625, "logps/chosen": -680.0, "logps/rejected": -1056.0, "loss": 0.1952, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.09375, "rewards/margins": 3.8125, "rewards/rejected": -8.875, "step": 5290 }, { "epoch": 0.382588608965567, "grad_norm": 8.616712400688618, "learning_rate": 3.879449898484374e-07, "logits/chosen": -2.84375, "logits/rejected": -2.53125, "logps/chosen": -644.0, "logps/rejected": -1012.0, "loss": 0.1873, "rewards/accuracies": 0.887499988079071, "rewards/chosen": -4.90625, "rewards/margins": 3.484375, "rewards/rejected": -8.375, "step": 5300 }, { "epoch": 0.3833104742655021, "grad_norm": 8.45520493106579, "learning_rate": 3.874191541715629e-07, "logits/chosen": -2.890625, "logits/rejected": -2.578125, "logps/chosen": -684.0, "logps/rejected": -1056.0, "loss": 0.1777, "rewards/accuracies": 0.9375, "rewards/chosen": -4.78125, "rewards/margins": 3.96875, "rewards/rejected": -8.75, "step": 5310 }, { "epoch": 0.3840323395654371, "grad_norm": 6.786490880185805, "learning_rate": 3.868924458792994e-07, "logits/chosen": -2.75, "logits/rejected": -2.640625, "logps/chosen": -720.0, "logps/rejected": -1000.0, "loss": 0.1936, "rewards/accuracies": 0.90625, "rewards/chosen": -5.40625, "rewards/margins": 3.203125, "rewards/rejected": -8.625, "step": 5320 }, { "epoch": 0.3847542048653721, "grad_norm": 9.306230356711307, "learning_rate": 3.86364868316259e-07, "logits/chosen": -2.84375, "logits/rejected": -2.5625, "logps/chosen": -680.0, "logps/rejected": -1056.0, "loss": 0.1961, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.03125, "rewards/margins": 3.75, "rewards/rejected": -8.75, "step": 5330 }, { "epoch": 0.38547607016530716, "grad_norm": 6.874539829983695, "learning_rate": 3.8583642483257374e-07, "logits/chosen": -2.703125, "logits/rejected": -2.5, "logps/chosen": -708.0, "logps/rejected": -1088.0, "loss": 0.1819, "rewards/accuracies": 0.90625, "rewards/chosen": -5.34375, "rewards/margins": 3.859375, "rewards/rejected": -9.1875, "step": 5340 }, { "epoch": 0.38619793546524217, "grad_norm": 9.535981769729352, "learning_rate": 3.85307118783874e-07, "logits/chosen": -2.890625, "logits/rejected": -2.765625, "logps/chosen": -724.0, "logps/rejected": -1104.0, "loss": 0.1932, "rewards/accuracies": 0.9375, "rewards/chosen": -5.625, "rewards/margins": 3.921875, "rewards/rejected": -9.5625, "step": 5350 }, { "epoch": 0.38691980076517724, "grad_norm": 7.916792530196583, "learning_rate": 3.8477695353126785e-07, "logits/chosen": -2.875, "logits/rejected": -2.578125, "logps/chosen": -736.0, "logps/rejected": -1080.0, "loss": 0.1841, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.6875, "rewards/margins": 3.5625, "rewards/rejected": -9.25, "step": 5360 }, { "epoch": 0.38764166606511224, "grad_norm": 11.021130141780702, "learning_rate": 3.8424593244131897e-07, "logits/chosen": -2.828125, "logits/rejected": -2.59375, "logps/chosen": -700.0, "logps/rejected": -1080.0, "loss": 0.1947, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.3125, "rewards/margins": 3.875, "rewards/rejected": -9.1875, "step": 5370 }, { "epoch": 0.3883635313650473, "grad_norm": 8.203256258991978, "learning_rate": 3.83714058886026e-07, "logits/chosen": -2.921875, "logits/rejected": -2.59375, "logps/chosen": -740.0, "logps/rejected": -1080.0, "loss": 0.1599, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.84375, "rewards/margins": 3.546875, "rewards/rejected": -9.375, "step": 5380 }, { "epoch": 0.3890853966649823, "grad_norm": 7.923518332280399, "learning_rate": 3.8318133624280046e-07, "logits/chosen": -2.90625, "logits/rejected": -2.625, "logps/chosen": -744.0, "logps/rejected": -1112.0, "loss": 0.1796, "rewards/accuracies": 0.90625, "rewards/chosen": -5.9375, "rewards/margins": 3.859375, "rewards/rejected": -9.8125, "step": 5390 }, { "epoch": 0.38980726196491733, "grad_norm": 13.720539493582635, "learning_rate": 3.826477678944457e-07, "logits/chosen": -2.8125, "logits/rejected": -2.609375, "logps/chosen": -680.0, "logps/rejected": -1048.0, "loss": 0.1945, "rewards/accuracies": 0.90625, "rewards/chosen": -5.28125, "rewards/margins": 3.890625, "rewards/rejected": -9.1875, "step": 5400 }, { "epoch": 0.3905291272648524, "grad_norm": 7.1393388118343495, "learning_rate": 3.821133572291354e-07, "logits/chosen": -2.859375, "logits/rejected": -2.5625, "logps/chosen": -688.0, "logps/rejected": -996.0, "loss": 0.1814, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -5.375, "rewards/margins": 3.171875, "rewards/rejected": -8.5625, "step": 5410 }, { "epoch": 0.3912509925647874, "grad_norm": 9.329246298724282, "learning_rate": 3.8157810764039187e-07, "logits/chosen": -2.953125, "logits/rejected": -2.59375, "logps/chosen": -720.0, "logps/rejected": -1080.0, "loss": 0.1938, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.59375, "rewards/margins": 3.71875, "rewards/rejected": -9.3125, "step": 5420 }, { "epoch": 0.39197285786472247, "grad_norm": 6.811570201519407, "learning_rate": 3.810420225270647e-07, "logits/chosen": -2.8125, "logits/rejected": -2.578125, "logps/chosen": -732.0, "logps/rejected": -1080.0, "loss": 0.207, "rewards/accuracies": 0.90625, "rewards/chosen": -5.75, "rewards/margins": 3.46875, "rewards/rejected": -9.25, "step": 5430 }, { "epoch": 0.3926947231646575, "grad_norm": 6.663922484272897, "learning_rate": 3.80505105293309e-07, "logits/chosen": -2.84375, "logits/rejected": -2.515625, "logps/chosen": -704.0, "logps/rejected": -1056.0, "loss": 0.1847, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -5.40625, "rewards/margins": 3.625, "rewards/rejected": -9.0625, "step": 5440 }, { "epoch": 0.3934165884645925, "grad_norm": 9.592577634918783, "learning_rate": 3.799673593485638e-07, "logits/chosen": -2.6875, "logits/rejected": -2.359375, "logps/chosen": -748.0, "logps/rejected": -1120.0, "loss": 0.1773, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.84375, "rewards/margins": 3.6875, "rewards/rejected": -9.5, "step": 5450 }, { "epoch": 0.39413845376452755, "grad_norm": 9.134235793523999, "learning_rate": 3.794287881075307e-07, "logits/chosen": -2.90625, "logits/rejected": -2.625, "logps/chosen": -744.0, "logps/rejected": -1136.0, "loss": 0.1741, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -5.65625, "rewards/margins": 4.09375, "rewards/rejected": -9.75, "step": 5460 }, { "epoch": 0.39486031906446256, "grad_norm": 8.925533209727694, "learning_rate": 3.788893949901517e-07, "logits/chosen": -2.90625, "logits/rejected": -2.546875, "logps/chosen": -764.0, "logps/rejected": -1152.0, "loss": 0.183, "rewards/accuracies": 0.90625, "rewards/chosen": -5.875, "rewards/margins": 3.84375, "rewards/rejected": -9.6875, "step": 5470 }, { "epoch": 0.3955821843643976, "grad_norm": 7.220703628171884, "learning_rate": 3.783491834215879e-07, "logits/chosen": -2.6875, "logits/rejected": -2.53125, "logps/chosen": -708.0, "logps/rejected": -1072.0, "loss": 0.1819, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.34375, "rewards/margins": 3.78125, "rewards/rejected": -9.125, "step": 5480 }, { "epoch": 0.39630404966433264, "grad_norm": 10.56460893328502, "learning_rate": 3.778081568321976e-07, "logits/chosen": -2.875, "logits/rejected": -2.546875, "logps/chosen": -716.0, "logps/rejected": -1112.0, "loss": 0.194, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.59375, "rewards/margins": 4.03125, "rewards/rejected": -9.625, "step": 5490 }, { "epoch": 0.39702591496426765, "grad_norm": 10.362564107960075, "learning_rate": 3.772663186575143e-07, "logits/chosen": -2.90625, "logits/rejected": -2.53125, "logps/chosen": -672.0, "logps/rejected": -1048.0, "loss": 0.1888, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -5.15625, "rewards/margins": 3.765625, "rewards/rejected": -8.9375, "step": 5500 }, { "epoch": 0.3977477802642027, "grad_norm": 9.293115038985665, "learning_rate": 3.7672367233822537e-07, "logits/chosen": -2.765625, "logits/rejected": -2.34375, "logps/chosen": -712.0, "logps/rejected": -1096.0, "loss": 0.1552, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.5, "rewards/margins": 4.03125, "rewards/rejected": -9.5, "step": 5510 }, { "epoch": 0.3984696455641377, "grad_norm": 8.820973054087007, "learning_rate": 3.761802213201498e-07, "logits/chosen": -2.875, "logits/rejected": -2.59375, "logps/chosen": -696.0, "logps/rejected": -1168.0, "loss": 0.164, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.28125, "rewards/margins": 4.65625, "rewards/rejected": -9.9375, "step": 5520 }, { "epoch": 0.3991915108640728, "grad_norm": 8.927273915289893, "learning_rate": 3.756359690542163e-07, "logits/chosen": -2.765625, "logits/rejected": -2.59375, "logps/chosen": -720.0, "logps/rejected": -1096.0, "loss": 0.1821, "rewards/accuracies": 0.9375, "rewards/chosen": -5.5, "rewards/margins": 4.0625, "rewards/rejected": -9.5625, "step": 5530 }, { "epoch": 0.3999133761640078, "grad_norm": 9.274501424450483, "learning_rate": 3.750909189964417e-07, "logits/chosen": -2.90625, "logits/rejected": -2.484375, "logps/chosen": -660.0, "logps/rejected": -1024.0, "loss": 0.1828, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.0625, "rewards/margins": 3.59375, "rewards/rejected": -8.6875, "step": 5540 }, { "epoch": 0.4006352414639428, "grad_norm": 14.27324930632179, "learning_rate": 3.7454507460790893e-07, "logits/chosen": -2.890625, "logits/rejected": -2.53125, "logps/chosen": -656.0, "logps/rejected": -1020.0, "loss": 0.2001, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.0, "rewards/margins": 3.640625, "rewards/rejected": -8.625, "step": 5550 }, { "epoch": 0.40135710676387787, "grad_norm": 5.934956865301077, "learning_rate": 3.739984393547446e-07, "logits/chosen": -2.96875, "logits/rejected": -2.578125, "logps/chosen": -712.0, "logps/rejected": -1088.0, "loss": 0.1771, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.59375, "rewards/margins": 3.78125, "rewards/rejected": -9.375, "step": 5560 }, { "epoch": 0.4020789720638129, "grad_norm": 8.744047306639088, "learning_rate": 3.7345101670809755e-07, "logits/chosen": -2.921875, "logits/rejected": -2.640625, "logps/chosen": -720.0, "logps/rejected": -1080.0, "loss": 0.1916, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.46875, "rewards/margins": 3.890625, "rewards/rejected": -9.375, "step": 5570 }, { "epoch": 0.40280083736374794, "grad_norm": 10.141402293967214, "learning_rate": 3.7290281014411655e-07, "logits/chosen": -2.875, "logits/rejected": -2.546875, "logps/chosen": -656.0, "logps/rejected": -1032.0, "loss": 0.1761, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.0, "rewards/margins": 3.828125, "rewards/rejected": -8.8125, "step": 5580 }, { "epoch": 0.40352270266368295, "grad_norm": 8.951801438600679, "learning_rate": 3.723538231439284e-07, "logits/chosen": -2.828125, "logits/rejected": -2.65625, "logps/chosen": -728.0, "logps/rejected": -1072.0, "loss": 0.1937, "rewards/accuracies": 0.90625, "rewards/chosen": -5.53125, "rewards/margins": 3.65625, "rewards/rejected": -9.1875, "step": 5590 }, { "epoch": 0.40424456796361796, "grad_norm": 9.18772270207208, "learning_rate": 3.7180405919361547e-07, "logits/chosen": -2.75, "logits/rejected": -2.453125, "logps/chosen": -692.0, "logps/rejected": -1096.0, "loss": 0.1996, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.5, "rewards/margins": 3.984375, "rewards/rejected": -9.5, "step": 5600 }, { "epoch": 0.404966433263553, "grad_norm": 11.802072092894162, "learning_rate": 3.7125352178419396e-07, "logits/chosen": -2.84375, "logits/rejected": -2.59375, "logps/chosen": -724.0, "logps/rejected": -1088.0, "loss": 0.1828, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.625, "rewards/margins": 3.8125, "rewards/rejected": -9.4375, "step": 5610 }, { "epoch": 0.40568829856348804, "grad_norm": 7.441092805572635, "learning_rate": 3.707022144115914e-07, "logits/chosen": -2.828125, "logits/rejected": -2.53125, "logps/chosen": -744.0, "logps/rejected": -1104.0, "loss": 0.1979, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.6875, "rewards/margins": 3.953125, "rewards/rejected": -9.625, "step": 5620 }, { "epoch": 0.4064101638634231, "grad_norm": 8.542112860478404, "learning_rate": 3.701501405766248e-07, "logits/chosen": -2.71875, "logits/rejected": -2.578125, "logps/chosen": -740.0, "logps/rejected": -1104.0, "loss": 0.1833, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.90625, "rewards/margins": 3.8125, "rewards/rejected": -9.75, "step": 5630 }, { "epoch": 0.4071320291633581, "grad_norm": 8.690977859423688, "learning_rate": 3.69597303784978e-07, "logits/chosen": -2.953125, "logits/rejected": -2.765625, "logps/chosen": -732.0, "logps/rejected": -1128.0, "loss": 0.1565, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.65625, "rewards/margins": 4.03125, "rewards/rejected": -9.6875, "step": 5640 }, { "epoch": 0.4078538944632932, "grad_norm": 7.133375992414793, "learning_rate": 3.690437075471797e-07, "logits/chosen": -2.953125, "logits/rejected": -2.59375, "logps/chosen": -768.0, "logps/rejected": -1160.0, "loss": 0.1834, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -5.96875, "rewards/margins": 4.0, "rewards/rejected": -10.0, "step": 5650 }, { "epoch": 0.4085757597632282, "grad_norm": 9.060343279065481, "learning_rate": 3.684893553785815e-07, "logits/chosen": -2.875, "logits/rejected": -2.53125, "logps/chosen": -752.0, "logps/rejected": -1152.0, "loss": 0.1829, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.9375, "rewards/margins": 4.125, "rewards/rejected": -10.0625, "step": 5660 }, { "epoch": 0.4092976250631632, "grad_norm": 9.150169701262556, "learning_rate": 3.6793425079933446e-07, "logits/chosen": -2.796875, "logits/rejected": -2.515625, "logps/chosen": -704.0, "logps/rejected": -1056.0, "loss": 0.1984, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -5.4375, "rewards/margins": 3.4375, "rewards/rejected": -8.875, "step": 5670 }, { "epoch": 0.41001949036309826, "grad_norm": 11.459154584979037, "learning_rate": 3.67378397334368e-07, "logits/chosen": -2.6875, "logits/rejected": -2.40625, "logps/chosen": -696.0, "logps/rejected": -1032.0, "loss": 0.191, "rewards/accuracies": 0.9375, "rewards/chosen": -5.25, "rewards/margins": 3.515625, "rewards/rejected": -8.75, "step": 5680 }, { "epoch": 0.41074135566303327, "grad_norm": 10.628103177908564, "learning_rate": 3.668217985133668e-07, "logits/chosen": -2.859375, "logits/rejected": -2.59375, "logps/chosen": -704.0, "logps/rejected": -1064.0, "loss": 0.1765, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.53125, "rewards/margins": 3.625, "rewards/rejected": -9.125, "step": 5690 }, { "epoch": 0.41146322096296833, "grad_norm": 10.663063859010725, "learning_rate": 3.662644578707486e-07, "logits/chosen": -2.859375, "logits/rejected": -2.578125, "logps/chosen": -680.0, "logps/rejected": -1056.0, "loss": 0.1715, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.09375, "rewards/margins": 3.90625, "rewards/rejected": -9.0, "step": 5700 }, { "epoch": 0.41218508626290334, "grad_norm": 9.68068326501746, "learning_rate": 3.657063789456418e-07, "logits/chosen": -3.0, "logits/rejected": -2.609375, "logps/chosen": -704.0, "logps/rejected": -1096.0, "loss": 0.1893, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.53125, "rewards/margins": 3.921875, "rewards/rejected": -9.4375, "step": 5710 }, { "epoch": 0.41290695156283835, "grad_norm": 9.038765481874343, "learning_rate": 3.6514756528186283e-07, "logits/chosen": -2.890625, "logits/rejected": -2.625, "logps/chosen": -672.0, "logps/rejected": -1104.0, "loss": 0.1737, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -5.125, "rewards/margins": 4.375, "rewards/rejected": -9.5, "step": 5720 }, { "epoch": 0.4136288168627734, "grad_norm": 7.8137408122782315, "learning_rate": 3.645880204278936e-07, "logits/chosen": -3.0, "logits/rejected": -2.6875, "logps/chosen": -700.0, "logps/rejected": -1040.0, "loss": 0.1936, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -5.25, "rewards/margins": 3.5625, "rewards/rejected": -8.8125, "step": 5730 }, { "epoch": 0.41435068216270843, "grad_norm": 10.519994806474793, "learning_rate": 3.640277479368594e-07, "logits/chosen": -2.765625, "logits/rejected": -2.609375, "logps/chosen": -720.0, "logps/rejected": -1048.0, "loss": 0.1949, "rewards/accuracies": 0.90625, "rewards/chosen": -5.59375, "rewards/margins": 3.390625, "rewards/rejected": -9.0, "step": 5740 }, { "epoch": 0.4150725474626435, "grad_norm": 6.618841094002535, "learning_rate": 3.6346675136650595e-07, "logits/chosen": -2.859375, "logits/rejected": -2.515625, "logps/chosen": -680.0, "logps/rejected": -1032.0, "loss": 0.1686, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.09375, "rewards/margins": 3.6875, "rewards/rejected": -8.75, "step": 5750 }, { "epoch": 0.4157944127625785, "grad_norm": 9.449161368315643, "learning_rate": 3.629050342791766e-07, "logits/chosen": -2.84375, "logits/rejected": -2.65625, "logps/chosen": -692.0, "logps/rejected": -1040.0, "loss": 0.1883, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -5.3125, "rewards/margins": 3.6875, "rewards/rejected": -9.0, "step": 5760 }, { "epoch": 0.4165162780625135, "grad_norm": 8.645062230868888, "learning_rate": 3.6234260024179033e-07, "logits/chosen": -2.953125, "logits/rejected": -2.671875, "logps/chosen": -700.0, "logps/rejected": -1080.0, "loss": 0.1711, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.4375, "rewards/margins": 3.84375, "rewards/rejected": -9.25, "step": 5770 }, { "epoch": 0.4172381433624486, "grad_norm": 8.61829308724476, "learning_rate": 3.6177945282581866e-07, "logits/chosen": -2.96875, "logits/rejected": -2.78125, "logps/chosen": -664.0, "logps/rejected": -1048.0, "loss": 0.1835, "rewards/accuracies": 0.9375, "rewards/chosen": -5.1875, "rewards/margins": 3.828125, "rewards/rejected": -9.0625, "step": 5780 }, { "epoch": 0.4179600086623836, "grad_norm": 8.790765287429858, "learning_rate": 3.6121559560726313e-07, "logits/chosen": -2.9375, "logits/rejected": -2.578125, "logps/chosen": -676.0, "logps/rejected": -1064.0, "loss": 0.1752, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -5.0625, "rewards/margins": 3.796875, "rewards/rejected": -8.875, "step": 5790 }, { "epoch": 0.41868187396231865, "grad_norm": 10.485975334565037, "learning_rate": 3.6065103216663237e-07, "logits/chosen": -2.953125, "logits/rejected": -2.625, "logps/chosen": -684.0, "logps/rejected": -1056.0, "loss": 0.187, "rewards/accuracies": 0.875, "rewards/chosen": -5.25, "rewards/margins": 3.6875, "rewards/rejected": -8.9375, "step": 5800 }, { "epoch": 0.41940373926225366, "grad_norm": 7.596154187472179, "learning_rate": 3.600857660889199e-07, "logits/chosen": -3.0, "logits/rejected": -2.625, "logps/chosen": -632.0, "logps/rejected": -1012.0, "loss": 0.1578, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -4.8125, "rewards/margins": 3.703125, "rewards/rejected": -8.5, "step": 5810 }, { "epoch": 0.42012560456218867, "grad_norm": 7.510040671882969, "learning_rate": 3.5951980096358055e-07, "logits/chosen": -3.015625, "logits/rejected": -2.765625, "logps/chosen": -632.0, "logps/rejected": -996.0, "loss": 0.1923, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -4.78125, "rewards/margins": 3.671875, "rewards/rejected": -8.4375, "step": 5820 }, { "epoch": 0.42084746986212374, "grad_norm": 6.151781029516534, "learning_rate": 3.589531403845085e-07, "logits/chosen": -2.984375, "logits/rejected": -2.75, "logps/chosen": -648.0, "logps/rejected": -1032.0, "loss": 0.1812, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -4.96875, "rewards/margins": 3.859375, "rewards/rejected": -8.8125, "step": 5830 }, { "epoch": 0.42156933516205874, "grad_norm": 10.349825384153817, "learning_rate": 3.5838578795001393e-07, "logits/chosen": -3.015625, "logits/rejected": -2.59375, "logps/chosen": -724.0, "logps/rejected": -1152.0, "loss": 0.1728, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.5, "rewards/margins": 4.125, "rewards/rejected": -9.625, "step": 5840 }, { "epoch": 0.4222912004619938, "grad_norm": 8.687369080835087, "learning_rate": 3.578177472628002e-07, "logits/chosen": -3.03125, "logits/rejected": -2.671875, "logps/chosen": -776.0, "logps/rejected": -1160.0, "loss": 0.1821, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -6.1875, "rewards/margins": 3.765625, "rewards/rejected": -9.9375, "step": 5850 }, { "epoch": 0.4230130657619288, "grad_norm": 9.245880790108894, "learning_rate": 3.572490219299414e-07, "logits/chosen": -2.875, "logits/rejected": -2.515625, "logps/chosen": -740.0, "logps/rejected": -1104.0, "loss": 0.1933, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -5.84375, "rewards/margins": 3.796875, "rewards/rejected": -9.625, "step": 5860 }, { "epoch": 0.42373493106186383, "grad_norm": 10.513199703384252, "learning_rate": 3.5667961556285876e-07, "logits/chosen": -2.890625, "logits/rejected": -2.59375, "logps/chosen": -748.0, "logps/rejected": -1112.0, "loss": 0.172, "rewards/accuracies": 0.9375, "rewards/chosen": -5.8125, "rewards/margins": 3.75, "rewards/rejected": -9.5625, "step": 5870 }, { "epoch": 0.4244567963617989, "grad_norm": 8.067276310939405, "learning_rate": 3.561095317772984e-07, "logits/chosen": -2.984375, "logits/rejected": -2.734375, "logps/chosen": -772.0, "logps/rejected": -1168.0, "loss": 0.1881, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -5.9375, "rewards/margins": 4.0625, "rewards/rejected": -10.0, "step": 5880 }, { "epoch": 0.4251786616617339, "grad_norm": 9.335763045264015, "learning_rate": 3.5553877419330797e-07, "logits/chosen": -2.859375, "logits/rejected": -2.625, "logps/chosen": -748.0, "logps/rejected": -1152.0, "loss": 0.1635, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.625, "rewards/margins": 4.21875, "rewards/rejected": -9.8125, "step": 5890 }, { "epoch": 0.42590052696166897, "grad_norm": 8.536819036424028, "learning_rate": 3.5496734643521364e-07, "logits/chosen": -2.9375, "logits/rejected": -2.53125, "logps/chosen": -716.0, "logps/rejected": -1128.0, "loss": 0.198, "rewards/accuracies": 0.90625, "rewards/chosen": -5.5, "rewards/margins": 4.15625, "rewards/rejected": -9.625, "step": 5900 }, { "epoch": 0.426622392261604, "grad_norm": 10.712349432459751, "learning_rate": 3.543952521315975e-07, "logits/chosen": -2.96875, "logits/rejected": -2.65625, "logps/chosen": -664.0, "logps/rejected": -1048.0, "loss": 0.1793, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.125, "rewards/margins": 3.828125, "rewards/rejected": -8.9375, "step": 5910 }, { "epoch": 0.42734425756153904, "grad_norm": 9.762289940914592, "learning_rate": 3.538224949152738e-07, "logits/chosen": -2.8125, "logits/rejected": -2.546875, "logps/chosen": -688.0, "logps/rejected": -1088.0, "loss": 0.179, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -5.28125, "rewards/margins": 4.125, "rewards/rejected": -9.4375, "step": 5920 }, { "epoch": 0.42806612286147405, "grad_norm": 8.279157154276295, "learning_rate": 3.5324907842326676e-07, "logits/chosen": -2.96875, "logits/rejected": -2.765625, "logps/chosen": -692.0, "logps/rejected": -1024.0, "loss": 0.1785, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -5.25, "rewards/margins": 3.65625, "rewards/rejected": -8.9375, "step": 5930 }, { "epoch": 0.42878798816140906, "grad_norm": 7.703443487862446, "learning_rate": 3.526750062967866e-07, "logits/chosen": -3.0, "logits/rejected": -2.671875, "logps/chosen": -660.0, "logps/rejected": -1012.0, "loss": 0.1927, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -4.9375, "rewards/margins": 3.6875, "rewards/rejected": -8.625, "step": 5940 }, { "epoch": 0.4295098534613441, "grad_norm": 8.915401918749712, "learning_rate": 3.5210028218120714e-07, "logits/chosen": -2.796875, "logits/rejected": -2.421875, "logps/chosen": -692.0, "logps/rejected": -1080.0, "loss": 0.1693, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.21875, "rewards/margins": 3.90625, "rewards/rejected": -9.125, "step": 5950 }, { "epoch": 0.43023171876127914, "grad_norm": 7.356754892003317, "learning_rate": 3.515249097260422e-07, "logits/chosen": -2.859375, "logits/rejected": -2.53125, "logps/chosen": -700.0, "logps/rejected": -1072.0, "loss": 0.1744, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.40625, "rewards/margins": 3.90625, "rewards/rejected": -9.3125, "step": 5960 }, { "epoch": 0.4309535840612142, "grad_norm": 8.27577072471933, "learning_rate": 3.509488925849227e-07, "logits/chosen": -2.9375, "logits/rejected": -2.515625, "logps/chosen": -704.0, "logps/rejected": -1112.0, "loss": 0.1813, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.5, "rewards/margins": 3.9375, "rewards/rejected": -9.4375, "step": 5970 }, { "epoch": 0.4316754493611492, "grad_norm": 8.91909433201475, "learning_rate": 3.503722344155731e-07, "logits/chosen": -2.75, "logits/rejected": -2.5, "logps/chosen": -720.0, "logps/rejected": -1064.0, "loss": 0.1581, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.4375, "rewards/margins": 3.578125, "rewards/rejected": -9.0, "step": 5980 }, { "epoch": 0.4323973146610842, "grad_norm": 10.528827951999629, "learning_rate": 3.4979493887978864e-07, "logits/chosen": -2.828125, "logits/rejected": -2.5625, "logps/chosen": -736.0, "logps/rejected": -1120.0, "loss": 0.1912, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.84375, "rewards/margins": 3.96875, "rewards/rejected": -9.8125, "step": 5990 }, { "epoch": 0.4331191799610193, "grad_norm": 6.577916440055691, "learning_rate": 3.4921700964341173e-07, "logits/chosen": -2.953125, "logits/rejected": -2.6875, "logps/chosen": -764.0, "logps/rejected": -1120.0, "loss": 0.1949, "rewards/accuracies": 0.90625, "rewards/chosen": -5.875, "rewards/margins": 3.78125, "rewards/rejected": -9.6875, "step": 6000 }, { "epoch": 0.4338410452609543, "grad_norm": 9.810703167678307, "learning_rate": 3.486384503763089e-07, "logits/chosen": -2.890625, "logits/rejected": -2.640625, "logps/chosen": -744.0, "logps/rejected": -1080.0, "loss": 0.1617, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.875, "rewards/margins": 3.671875, "rewards/rejected": -9.5625, "step": 6010 }, { "epoch": 0.43456291056088936, "grad_norm": 7.569455182394066, "learning_rate": 3.480592647523472e-07, "logits/chosen": -2.84375, "logits/rejected": -2.59375, "logps/chosen": -752.0, "logps/rejected": -1088.0, "loss": 0.1617, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.875, "rewards/margins": 3.515625, "rewards/rejected": -9.375, "step": 6020 }, { "epoch": 0.43528477586082437, "grad_norm": 6.998884892266847, "learning_rate": 3.4747945644937133e-07, "logits/chosen": -2.828125, "logits/rejected": -2.4375, "logps/chosen": -700.0, "logps/rejected": -1136.0, "loss": 0.1807, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.53125, "rewards/margins": 4.375, "rewards/rejected": -9.9375, "step": 6030 }, { "epoch": 0.4360066411607594, "grad_norm": 7.151254090045432, "learning_rate": 3.468990291491799e-07, "logits/chosen": -2.984375, "logits/rejected": -2.515625, "logps/chosen": -680.0, "logps/rejected": -1048.0, "loss": 0.1727, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.3125, "rewards/margins": 3.703125, "rewards/rejected": -9.0, "step": 6040 }, { "epoch": 0.43672850646069444, "grad_norm": 6.561607683446632, "learning_rate": 3.46317986537502e-07, "logits/chosen": -2.96875, "logits/rejected": -2.625, "logps/chosen": -720.0, "logps/rejected": -1176.0, "loss": 0.1876, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.5625, "rewards/margins": 4.5, "rewards/rejected": -10.0625, "step": 6050 }, { "epoch": 0.43745037176062945, "grad_norm": 6.7139191061366805, "learning_rate": 3.4573633230397414e-07, "logits/chosen": -2.90625, "logits/rejected": -2.75, "logps/chosen": -724.0, "logps/rejected": -1128.0, "loss": 0.1948, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -5.375, "rewards/margins": 4.3125, "rewards/rejected": -9.6875, "step": 6060 }, { "epoch": 0.4381722370605645, "grad_norm": 8.411313986797488, "learning_rate": 3.451540701421167e-07, "logits/chosen": -3.03125, "logits/rejected": -2.671875, "logps/chosen": -656.0, "logps/rejected": -1032.0, "loss": 0.1803, "rewards/accuracies": 0.9375, "rewards/chosen": -4.84375, "rewards/margins": 3.921875, "rewards/rejected": -8.75, "step": 6070 }, { "epoch": 0.4388941023604995, "grad_norm": 8.23452700502391, "learning_rate": 3.445712037493104e-07, "logits/chosen": -3.09375, "logits/rejected": -2.703125, "logps/chosen": -700.0, "logps/rejected": -1080.0, "loss": 0.1937, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.34375, "rewards/margins": 3.78125, "rewards/rejected": -9.125, "step": 6080 }, { "epoch": 0.43961596766043454, "grad_norm": 7.143620144559741, "learning_rate": 3.439877368267725e-07, "logits/chosen": -2.90625, "logits/rejected": -2.484375, "logps/chosen": -700.0, "logps/rejected": -1096.0, "loss": 0.1989, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -5.5, "rewards/margins": 3.953125, "rewards/rejected": -9.4375, "step": 6090 }, { "epoch": 0.4403378329603696, "grad_norm": 5.802482964711945, "learning_rate": 3.434036730795342e-07, "logits/chosen": -2.859375, "logits/rejected": -2.5625, "logps/chosen": -676.0, "logps/rejected": -1072.0, "loss": 0.1589, "rewards/accuracies": 0.96875, "rewards/chosen": -5.15625, "rewards/margins": 4.15625, "rewards/rejected": -9.3125, "step": 6100 }, { "epoch": 0.4410596982603046, "grad_norm": 8.719522994114646, "learning_rate": 3.428190162164162e-07, "logits/chosen": -2.984375, "logits/rejected": -2.78125, "logps/chosen": -684.0, "logps/rejected": -1120.0, "loss": 0.1428, "rewards/accuracies": 0.9375, "rewards/chosen": -5.34375, "rewards/margins": 4.4375, "rewards/rejected": -9.8125, "step": 6110 }, { "epoch": 0.4417815635602397, "grad_norm": 8.401165390196324, "learning_rate": 3.422337699500056e-07, "logits/chosen": -2.90625, "logits/rejected": -2.65625, "logps/chosen": -756.0, "logps/rejected": -1144.0, "loss": 0.1904, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.875, "rewards/margins": 4.0625, "rewards/rejected": -9.9375, "step": 6120 }, { "epoch": 0.4425034288601747, "grad_norm": 7.273765835778647, "learning_rate": 3.4164793799663207e-07, "logits/chosen": -2.890625, "logits/rejected": -2.5625, "logps/chosen": -708.0, "logps/rejected": -1128.0, "loss": 0.1881, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.46875, "rewards/margins": 4.25, "rewards/rejected": -9.75, "step": 6130 }, { "epoch": 0.44322529416010975, "grad_norm": 11.508967977205781, "learning_rate": 3.410615240763446e-07, "logits/chosen": -2.90625, "logits/rejected": -2.546875, "logps/chosen": -676.0, "logps/rejected": -1056.0, "loss": 0.2057, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.21875, "rewards/margins": 3.796875, "rewards/rejected": -9.0, "step": 6140 }, { "epoch": 0.44394715946004476, "grad_norm": 9.492547090583608, "learning_rate": 3.4047453191288775e-07, "logits/chosen": -2.84375, "logits/rejected": -2.59375, "logps/chosen": -688.0, "logps/rejected": -1104.0, "loss": 0.1783, "rewards/accuracies": 0.9750000238418579, "rewards/chosen": -5.25, "rewards/margins": 4.15625, "rewards/rejected": -9.4375, "step": 6150 }, { "epoch": 0.44466902475997977, "grad_norm": 6.826894009448305, "learning_rate": 3.3988696523367777e-07, "logits/chosen": -3.171875, "logits/rejected": -2.671875, "logps/chosen": -688.0, "logps/rejected": -1104.0, "loss": 0.1822, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.28125, "rewards/margins": 4.09375, "rewards/rejected": -9.375, "step": 6160 }, { "epoch": 0.44539089005991483, "grad_norm": 7.908259059531054, "learning_rate": 3.3929882776977905e-07, "logits/chosen": -2.984375, "logits/rejected": -2.75, "logps/chosen": -724.0, "logps/rejected": -1080.0, "loss": 0.1855, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.625, "rewards/margins": 3.703125, "rewards/rejected": -9.3125, "step": 6170 }, { "epoch": 0.44611275535984984, "grad_norm": 9.323313899318885, "learning_rate": 3.387101232558807e-07, "logits/chosen": -2.90625, "logits/rejected": -2.59375, "logps/chosen": -684.0, "logps/rejected": -1080.0, "loss": 0.1896, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.1875, "rewards/margins": 4.0, "rewards/rejected": -9.1875, "step": 6180 }, { "epoch": 0.4468346206597849, "grad_norm": 10.574159066231, "learning_rate": 3.381208554302723e-07, "logits/chosen": -2.984375, "logits/rejected": -2.609375, "logps/chosen": -688.0, "logps/rejected": -1072.0, "loss": 0.1926, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.21875, "rewards/margins": 3.953125, "rewards/rejected": -9.1875, "step": 6190 }, { "epoch": 0.4475564859597199, "grad_norm": 9.45659923763495, "learning_rate": 3.3753102803482094e-07, "logits/chosen": -2.921875, "logits/rejected": -2.546875, "logps/chosen": -684.0, "logps/rejected": -1040.0, "loss": 0.1689, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.125, "rewards/margins": 3.75, "rewards/rejected": -8.875, "step": 6200 }, { "epoch": 0.44827835125965493, "grad_norm": 7.8086390499161045, "learning_rate": 3.3694064481494655e-07, "logits/chosen": -2.9375, "logits/rejected": -2.578125, "logps/chosen": -684.0, "logps/rejected": -1056.0, "loss": 0.19, "rewards/accuracies": 0.90625, "rewards/chosen": -5.125, "rewards/margins": 3.875, "rewards/rejected": -9.0, "step": 6210 }, { "epoch": 0.44900021655959, "grad_norm": 6.5084303039612985, "learning_rate": 3.3634970951959867e-07, "logits/chosen": -2.84375, "logits/rejected": -2.53125, "logps/chosen": -708.0, "logps/rejected": -1072.0, "loss": 0.1641, "rewards/accuracies": 0.90625, "rewards/chosen": -5.34375, "rewards/margins": 3.875, "rewards/rejected": -9.1875, "step": 6220 }, { "epoch": 0.449722081859525, "grad_norm": 8.137911391940417, "learning_rate": 3.357582259012327e-07, "logits/chosen": -3.03125, "logits/rejected": -2.71875, "logps/chosen": -700.0, "logps/rejected": -1048.0, "loss": 0.1842, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -5.40625, "rewards/margins": 3.578125, "rewards/rejected": -9.0, "step": 6230 }, { "epoch": 0.45044394715946007, "grad_norm": 8.376896629675258, "learning_rate": 3.351661977157859e-07, "logits/chosen": -3.0625, "logits/rejected": -2.5625, "logps/chosen": -664.0, "logps/rejected": -1144.0, "loss": 0.1785, "rewards/accuracies": 0.9375, "rewards/chosen": -5.125, "rewards/margins": 4.59375, "rewards/rejected": -9.75, "step": 6240 }, { "epoch": 0.4511658124593951, "grad_norm": 10.56542182965613, "learning_rate": 3.3457362872265324e-07, "logits/chosen": -2.90625, "logits/rejected": -2.640625, "logps/chosen": -704.0, "logps/rejected": -1080.0, "loss": 0.1604, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.46875, "rewards/margins": 3.90625, "rewards/rejected": -9.375, "step": 6250 }, { "epoch": 0.4518876777593301, "grad_norm": 7.833165560372883, "learning_rate": 3.339805226846642e-07, "logits/chosen": -2.96875, "logits/rejected": -2.59375, "logps/chosen": -680.0, "logps/rejected": -1088.0, "loss": 0.1914, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -5.1875, "rewards/margins": 4.25, "rewards/rejected": -9.4375, "step": 6260 }, { "epoch": 0.45260954305926515, "grad_norm": 7.8349709497727025, "learning_rate": 3.3338688336805823e-07, "logits/chosen": -2.8125, "logits/rejected": -2.59375, "logps/chosen": -688.0, "logps/rejected": -1056.0, "loss": 0.1553, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.15625, "rewards/margins": 3.96875, "rewards/rejected": -9.125, "step": 6270 }, { "epoch": 0.45333140835920016, "grad_norm": 9.092744073048326, "learning_rate": 3.327927145424613e-07, "logits/chosen": -2.734375, "logits/rejected": -2.484375, "logps/chosen": -760.0, "logps/rejected": -1136.0, "loss": 0.2058, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.8125, "rewards/margins": 4.0625, "rewards/rejected": -9.875, "step": 6280 }, { "epoch": 0.4540532736591352, "grad_norm": 10.949550588632437, "learning_rate": 3.321980199808616e-07, "logits/chosen": -2.75, "logits/rejected": -2.4375, "logps/chosen": -712.0, "logps/rejected": -1104.0, "loss": 0.2021, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.53125, "rewards/margins": 4.125, "rewards/rejected": -9.625, "step": 6290 }, { "epoch": 0.45477513895907024, "grad_norm": 10.844258468917948, "learning_rate": 3.316028034595861e-07, "logits/chosen": -2.8125, "logits/rejected": -2.53125, "logps/chosen": -668.0, "logps/rejected": -1024.0, "loss": 0.166, "rewards/accuracies": 0.9375, "rewards/chosen": -5.09375, "rewards/margins": 3.640625, "rewards/rejected": -8.75, "step": 6300 }, { "epoch": 0.45549700425900524, "grad_norm": 13.438072021230731, "learning_rate": 3.3100706875827576e-07, "logits/chosen": -2.890625, "logits/rejected": -2.59375, "logps/chosen": -700.0, "logps/rejected": -1072.0, "loss": 0.1739, "rewards/accuracies": 0.9375, "rewards/chosen": -5.1875, "rewards/margins": 3.828125, "rewards/rejected": -9.0, "step": 6310 }, { "epoch": 0.4562188695589403, "grad_norm": 10.43903315431466, "learning_rate": 3.304108196598624e-07, "logits/chosen": -2.90625, "logits/rejected": -2.71875, "logps/chosen": -668.0, "logps/rejected": -1024.0, "loss": 0.1685, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.15625, "rewards/margins": 3.71875, "rewards/rejected": -8.875, "step": 6320 }, { "epoch": 0.4569407348588753, "grad_norm": 9.193341851899063, "learning_rate": 3.29814059950544e-07, "logits/chosen": -2.953125, "logits/rejected": -2.640625, "logps/chosen": -688.0, "logps/rejected": -1112.0, "loss": 0.1699, "rewards/accuracies": 0.9750000238418579, "rewards/chosen": -5.25, "rewards/margins": 4.28125, "rewards/rejected": -9.5, "step": 6330 }, { "epoch": 0.4576626001588104, "grad_norm": 9.553793370343385, "learning_rate": 3.2921679341976104e-07, "logits/chosen": -2.90625, "logits/rejected": -2.734375, "logps/chosen": -700.0, "logps/rejected": -1072.0, "loss": 0.1803, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.46875, "rewards/margins": 3.796875, "rewards/rejected": -9.3125, "step": 6340 }, { "epoch": 0.4583844654587454, "grad_norm": 9.073658565124525, "learning_rate": 3.286190238601725e-07, "logits/chosen": -3.03125, "logits/rejected": -2.625, "logps/chosen": -656.0, "logps/rejected": -1056.0, "loss": 0.1755, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -4.96875, "rewards/margins": 4.125, "rewards/rejected": -9.0625, "step": 6350 }, { "epoch": 0.4591063307586804, "grad_norm": 10.747256513722208, "learning_rate": 3.280207550676312e-07, "logits/chosen": -2.796875, "logits/rejected": -2.609375, "logps/chosen": -648.0, "logps/rejected": -1024.0, "loss": 0.1773, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -4.75, "rewards/margins": 3.859375, "rewards/rejected": -8.625, "step": 6360 }, { "epoch": 0.45982819605861547, "grad_norm": 10.072254030204776, "learning_rate": 3.274219908411605e-07, "logits/chosen": -2.765625, "logits/rejected": -2.453125, "logps/chosen": -688.0, "logps/rejected": -1112.0, "loss": 0.1759, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.1875, "rewards/margins": 4.3125, "rewards/rejected": -9.5, "step": 6370 }, { "epoch": 0.4605500613585505, "grad_norm": 9.55913362196861, "learning_rate": 3.2682273498292957e-07, "logits/chosen": -2.765625, "logits/rejected": -2.34375, "logps/chosen": -692.0, "logps/rejected": -1088.0, "loss": 0.19, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.15625, "rewards/margins": 4.0625, "rewards/rejected": -9.25, "step": 6380 }, { "epoch": 0.46127192665848554, "grad_norm": 7.6694528016919055, "learning_rate": 3.262229912982295e-07, "logits/chosen": -2.84375, "logits/rejected": -2.5625, "logps/chosen": -684.0, "logps/rejected": -1080.0, "loss": 0.1689, "rewards/accuracies": 0.9750000238418579, "rewards/chosen": -5.21875, "rewards/margins": 4.0, "rewards/rejected": -9.1875, "step": 6390 }, { "epoch": 0.46199379195842055, "grad_norm": 10.685410106690007, "learning_rate": 3.2562276359544917e-07, "logits/chosen": -2.84375, "logits/rejected": -2.59375, "logps/chosen": -712.0, "logps/rejected": -1080.0, "loss": 0.175, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.21875, "rewards/margins": 4.0625, "rewards/rejected": -9.25, "step": 6400 }, { "epoch": 0.4627156572583556, "grad_norm": 6.117106649506752, "learning_rate": 3.2502205568605087e-07, "logits/chosen": -2.84375, "logits/rejected": -2.578125, "logps/chosen": -696.0, "logps/rejected": -1008.0, "loss": 0.167, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.3125, "rewards/margins": 3.40625, "rewards/rejected": -8.75, "step": 6410 }, { "epoch": 0.4634375225582906, "grad_norm": 10.7792422427223, "learning_rate": 3.244208713845461e-07, "logits/chosen": -2.859375, "logits/rejected": -2.578125, "logps/chosen": -672.0, "logps/rejected": -1096.0, "loss": 0.1907, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -4.875, "rewards/margins": 4.5625, "rewards/rejected": -9.4375, "step": 6420 }, { "epoch": 0.46415938785822564, "grad_norm": 7.813563275474187, "learning_rate": 3.2381921450847187e-07, "logits/chosen": -2.828125, "logits/rejected": -2.578125, "logps/chosen": -640.0, "logps/rejected": -1020.0, "loss": 0.19, "rewards/accuracies": 0.9375, "rewards/chosen": -4.875, "rewards/margins": 3.875, "rewards/rejected": -8.75, "step": 6430 }, { "epoch": 0.4648812531581607, "grad_norm": 10.042020947007074, "learning_rate": 3.2321708887836573e-07, "logits/chosen": -2.734375, "logits/rejected": -2.578125, "logps/chosen": -660.0, "logps/rejected": -988.0, "loss": 0.1877, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -4.8125, "rewards/margins": 3.546875, "rewards/rejected": -8.375, "step": 6440 }, { "epoch": 0.4656031184580957, "grad_norm": 10.113981129252544, "learning_rate": 3.226144983177419e-07, "logits/chosen": -2.703125, "logits/rejected": -2.53125, "logps/chosen": -648.0, "logps/rejected": -968.0, "loss": 0.1802, "rewards/accuracies": 0.887499988079071, "rewards/chosen": -4.84375, "rewards/margins": 3.40625, "rewards/rejected": -8.25, "step": 6450 }, { "epoch": 0.4663249837580308, "grad_norm": 10.153352236033115, "learning_rate": 3.220114466530668e-07, "logits/chosen": -2.90625, "logits/rejected": -2.625, "logps/chosen": -692.0, "logps/rejected": -1072.0, "loss": 0.1811, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.34375, "rewards/margins": 3.875, "rewards/rejected": -9.25, "step": 6460 }, { "epoch": 0.4670468490579658, "grad_norm": 10.905089224037248, "learning_rate": 3.214079377137352e-07, "logits/chosen": -2.953125, "logits/rejected": -2.640625, "logps/chosen": -696.0, "logps/rejected": -1080.0, "loss": 0.1801, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.09375, "rewards/margins": 4.21875, "rewards/rejected": -9.3125, "step": 6470 }, { "epoch": 0.4677687143579008, "grad_norm": 8.04177832973184, "learning_rate": 3.2080397533204526e-07, "logits/chosen": -2.765625, "logits/rejected": -2.5625, "logps/chosen": -672.0, "logps/rejected": -1024.0, "loss": 0.1705, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.15625, "rewards/margins": 3.65625, "rewards/rejected": -8.8125, "step": 6480 }, { "epoch": 0.46849057965783586, "grad_norm": 13.034607545233241, "learning_rate": 3.201995633431747e-07, "logits/chosen": -2.75, "logits/rejected": -2.390625, "logps/chosen": -692.0, "logps/rejected": -1048.0, "loss": 0.183, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.3125, "rewards/margins": 3.796875, "rewards/rejected": -9.125, "step": 6490 }, { "epoch": 0.46921244495777087, "grad_norm": 6.884563442702245, "learning_rate": 3.1959470558515613e-07, "logits/chosen": -2.546875, "logits/rejected": -2.3125, "logps/chosen": -744.0, "logps/rejected": -1064.0, "loss": 0.1807, "rewards/accuracies": 0.887499988079071, "rewards/chosen": -5.75, "rewards/margins": 3.453125, "rewards/rejected": -9.1875, "step": 6500 }, { "epoch": 0.46993431025770593, "grad_norm": 9.142548647265967, "learning_rate": 3.189894058988528e-07, "logits/chosen": -2.6875, "logits/rejected": -2.375, "logps/chosen": -652.0, "logps/rejected": -1048.0, "loss": 0.1747, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.0, "rewards/margins": 3.984375, "rewards/rejected": -9.0, "step": 6510 }, { "epoch": 0.47065617555764094, "grad_norm": 10.80278074451447, "learning_rate": 3.183836681279344e-07, "logits/chosen": -2.75, "logits/rejected": -2.453125, "logps/chosen": -676.0, "logps/rejected": -1032.0, "loss": 0.1948, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.1875, "rewards/margins": 3.6875, "rewards/rejected": -8.875, "step": 6520 }, { "epoch": 0.47137804085757595, "grad_norm": 10.130379027496794, "learning_rate": 3.177774961188524e-07, "logits/chosen": -2.671875, "logits/rejected": -2.453125, "logps/chosen": -680.0, "logps/rejected": -1112.0, "loss": 0.1888, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.1875, "rewards/margins": 4.21875, "rewards/rejected": -9.375, "step": 6530 }, { "epoch": 0.472099906157511, "grad_norm": 7.542971934363328, "learning_rate": 3.171708937208154e-07, "logits/chosen": -2.734375, "logits/rejected": -2.328125, "logps/chosen": -644.0, "logps/rejected": -1048.0, "loss": 0.2047, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -4.9375, "rewards/margins": 3.90625, "rewards/rejected": -8.8125, "step": 6540 }, { "epoch": 0.472821771457446, "grad_norm": 10.844193020610753, "learning_rate": 3.1656386478576553e-07, "logits/chosen": -2.765625, "logits/rejected": -2.5625, "logps/chosen": -692.0, "logps/rejected": -1104.0, "loss": 0.1511, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.21875, "rewards/margins": 4.25, "rewards/rejected": -9.5, "step": 6550 }, { "epoch": 0.4735436367573811, "grad_norm": 8.465995887258453, "learning_rate": 3.159564131683529e-07, "logits/chosen": -2.9375, "logits/rejected": -2.609375, "logps/chosen": -700.0, "logps/rejected": -1112.0, "loss": 0.1607, "rewards/accuracies": 0.9375, "rewards/chosen": -5.4375, "rewards/margins": 4.09375, "rewards/rejected": -9.5, "step": 6560 }, { "epoch": 0.4742655020573161, "grad_norm": 10.357924748793268, "learning_rate": 3.15348542725912e-07, "logits/chosen": -2.875, "logits/rejected": -2.515625, "logps/chosen": -680.0, "logps/rejected": -1072.0, "loss": 0.1754, "rewards/accuracies": 0.9375, "rewards/chosen": -5.125, "rewards/margins": 4.09375, "rewards/rejected": -9.25, "step": 6570 }, { "epoch": 0.4749873673572511, "grad_norm": 8.386237735602531, "learning_rate": 3.1474025731843675e-07, "logits/chosen": -2.890625, "logits/rejected": -2.625, "logps/chosen": -704.0, "logps/rejected": -1088.0, "loss": 0.1686, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.3125, "rewards/margins": 3.984375, "rewards/rejected": -9.3125, "step": 6580 }, { "epoch": 0.4757092326571862, "grad_norm": 7.538386472518327, "learning_rate": 3.141315608085561e-07, "logits/chosen": -2.75, "logits/rejected": -2.515625, "logps/chosen": -724.0, "logps/rejected": -1112.0, "loss": 0.1647, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -5.5625, "rewards/margins": 4.03125, "rewards/rejected": -9.5625, "step": 6590 }, { "epoch": 0.4764310979571212, "grad_norm": 11.830534544208183, "learning_rate": 3.1352245706150966e-07, "logits/chosen": -2.734375, "logits/rejected": -2.5, "logps/chosen": -736.0, "logps/rejected": -1112.0, "loss": 0.1679, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.625, "rewards/margins": 4.0, "rewards/rejected": -9.625, "step": 6600 }, { "epoch": 0.47715296325705625, "grad_norm": 8.216481532924343, "learning_rate": 3.129129499451229e-07, "logits/chosen": -2.78125, "logits/rejected": -2.515625, "logps/chosen": -728.0, "logps/rejected": -1104.0, "loss": 0.1877, "rewards/accuracies": 0.8812500238418579, "rewards/chosen": -5.53125, "rewards/margins": 3.875, "rewards/rejected": -9.375, "step": 6610 }, { "epoch": 0.47787482855699126, "grad_norm": 8.346007528728483, "learning_rate": 3.123030433297823e-07, "logits/chosen": -2.71875, "logits/rejected": -2.484375, "logps/chosen": -672.0, "logps/rejected": -1048.0, "loss": 0.1709, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.28125, "rewards/margins": 3.71875, "rewards/rejected": -9.0, "step": 6620 }, { "epoch": 0.4785966938569263, "grad_norm": 11.851428689841443, "learning_rate": 3.11692741088412e-07, "logits/chosen": -2.734375, "logits/rejected": -2.390625, "logps/chosen": -712.0, "logps/rejected": -1136.0, "loss": 0.2184, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.59375, "rewards/margins": 4.21875, "rewards/rejected": -9.8125, "step": 6630 }, { "epoch": 0.47931855915686133, "grad_norm": 11.616947258566963, "learning_rate": 3.110820470964479e-07, "logits/chosen": -2.75, "logits/rejected": -2.5, "logps/chosen": -684.0, "logps/rejected": -1080.0, "loss": 0.1676, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.28125, "rewards/margins": 3.921875, "rewards/rejected": -9.1875, "step": 6640 }, { "epoch": 0.48004042445679634, "grad_norm": 8.689762439600946, "learning_rate": 3.1047096523181334e-07, "logits/chosen": -2.78125, "logits/rejected": -2.484375, "logps/chosen": -784.0, "logps/rejected": -1144.0, "loss": 0.1712, "rewards/accuracies": 0.90625, "rewards/chosen": -6.09375, "rewards/margins": 3.875, "rewards/rejected": -10.0, "step": 6650 }, { "epoch": 0.4807622897567314, "grad_norm": 11.54632495710895, "learning_rate": 3.098594993748949e-07, "logits/chosen": -2.734375, "logits/rejected": -2.5, "logps/chosen": -752.0, "logps/rejected": -1152.0, "loss": 0.1905, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -6.0, "rewards/margins": 4.09375, "rewards/rejected": -10.0625, "step": 6660 }, { "epoch": 0.4814841550566664, "grad_norm": 8.85697591328895, "learning_rate": 3.092476534085177e-07, "logits/chosen": -2.703125, "logits/rejected": -2.328125, "logps/chosen": -716.0, "logps/rejected": -1096.0, "loss": 0.1831, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.46875, "rewards/margins": 4.03125, "rewards/rejected": -9.5, "step": 6670 }, { "epoch": 0.4822060203566015, "grad_norm": 6.837080063986226, "learning_rate": 3.0863543121792023e-07, "logits/chosen": -2.875, "logits/rejected": -2.6875, "logps/chosen": -732.0, "logps/rejected": -1112.0, "loss": 0.1595, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.75, "rewards/margins": 3.765625, "rewards/rejected": -9.5, "step": 6680 }, { "epoch": 0.4829278856565365, "grad_norm": 8.376719148936688, "learning_rate": 3.080228366907302e-07, "logits/chosen": -2.9375, "logits/rejected": -2.8125, "logps/chosen": -752.0, "logps/rejected": -1152.0, "loss": 0.1505, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.8125, "rewards/margins": 4.1875, "rewards/rejected": -10.0, "step": 6690 }, { "epoch": 0.4836497509564715, "grad_norm": 11.991657008786461, "learning_rate": 3.074098737169395e-07, "logits/chosen": -3.0, "logits/rejected": -2.78125, "logps/chosen": -756.0, "logps/rejected": -1176.0, "loss": 0.183, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.9375, "rewards/margins": 4.4375, "rewards/rejected": -10.375, "step": 6700 }, { "epoch": 0.48437161625640657, "grad_norm": 6.801458005281131, "learning_rate": 3.0679654618887997e-07, "logits/chosen": -2.828125, "logits/rejected": -2.6875, "logps/chosen": -708.0, "logps/rejected": -1080.0, "loss": 0.1767, "rewards/accuracies": 0.96875, "rewards/chosen": -5.46875, "rewards/margins": 3.875, "rewards/rejected": -9.3125, "step": 6710 }, { "epoch": 0.4850934815563416, "grad_norm": 9.454920867053952, "learning_rate": 3.0618285800119807e-07, "logits/chosen": -2.796875, "logits/rejected": -2.515625, "logps/chosen": -736.0, "logps/rejected": -1120.0, "loss": 0.1882, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.75, "rewards/margins": 3.8125, "rewards/rejected": -9.5625, "step": 6720 }, { "epoch": 0.48581534685627664, "grad_norm": 8.405586504954512, "learning_rate": 3.0556881305083064e-07, "logits/chosen": -2.84375, "logits/rejected": -2.515625, "logps/chosen": -712.0, "logps/rejected": -1096.0, "loss": 0.1845, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.46875, "rewards/margins": 4.03125, "rewards/rejected": -9.5, "step": 6730 }, { "epoch": 0.48653721215621165, "grad_norm": 9.286913760440065, "learning_rate": 3.049544152369798e-07, "logits/chosen": -2.8125, "logits/rejected": -2.625, "logps/chosen": -764.0, "logps/rejected": -1104.0, "loss": 0.1808, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.875, "rewards/margins": 3.59375, "rewards/rejected": -9.5, "step": 6740 }, { "epoch": 0.48725907745614666, "grad_norm": 9.84775376184747, "learning_rate": 3.043396684610887e-07, "logits/chosen": -2.875, "logits/rejected": -2.609375, "logps/chosen": -732.0, "logps/rejected": -1128.0, "loss": 0.1715, "rewards/accuracies": 0.9375, "rewards/chosen": -5.5625, "rewards/margins": 3.953125, "rewards/rejected": -9.5, "step": 6750 }, { "epoch": 0.4879809427560817, "grad_norm": 9.876467151373804, "learning_rate": 3.0372457662681597e-07, "logits/chosen": -2.90625, "logits/rejected": -2.640625, "logps/chosen": -680.0, "logps/rejected": -1096.0, "loss": 0.1635, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.28125, "rewards/margins": 4.125, "rewards/rejected": -9.4375, "step": 6760 }, { "epoch": 0.48870280805601674, "grad_norm": 8.982483288644246, "learning_rate": 3.031091436400117e-07, "logits/chosen": -2.921875, "logits/rejected": -2.625, "logps/chosen": -684.0, "logps/rejected": -1096.0, "loss": 0.1926, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.21875, "rewards/margins": 4.375, "rewards/rejected": -9.5625, "step": 6770 }, { "epoch": 0.4894246733559518, "grad_norm": 8.183235398587287, "learning_rate": 3.024933734086922e-07, "logits/chosen": -2.828125, "logits/rejected": -2.53125, "logps/chosen": -652.0, "logps/rejected": -1072.0, "loss": 0.1747, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.09375, "rewards/margins": 4.1875, "rewards/rejected": -9.25, "step": 6780 }, { "epoch": 0.4901465386558868, "grad_norm": 7.608116127645515, "learning_rate": 3.018772698430152e-07, "logits/chosen": -2.75, "logits/rejected": -2.515625, "logps/chosen": -692.0, "logps/rejected": -1056.0, "loss": 0.1829, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.09375, "rewards/margins": 3.828125, "rewards/rejected": -8.9375, "step": 6790 }, { "epoch": 0.4908684039558218, "grad_norm": 11.231827143842242, "learning_rate": 3.0126083685525526e-07, "logits/chosen": -2.75, "logits/rejected": -2.625, "logps/chosen": -680.0, "logps/rejected": -1056.0, "loss": 0.1669, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.28125, "rewards/margins": 3.921875, "rewards/rejected": -9.1875, "step": 6800 }, { "epoch": 0.4915902692557569, "grad_norm": 16.428828202202983, "learning_rate": 3.006440783597787e-07, "logits/chosen": -2.828125, "logits/rejected": -2.578125, "logps/chosen": -716.0, "logps/rejected": -1104.0, "loss": 0.1696, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.53125, "rewards/margins": 4.0, "rewards/rejected": -9.5625, "step": 6810 }, { "epoch": 0.4923121345556919, "grad_norm": 11.61196417270313, "learning_rate": 3.000269982730189e-07, "logits/chosen": -2.734375, "logits/rejected": -2.484375, "logps/chosen": -724.0, "logps/rejected": -1112.0, "loss": 0.1766, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.78125, "rewards/margins": 3.8125, "rewards/rejected": -9.625, "step": 6820 }, { "epoch": 0.49303399985562696, "grad_norm": 8.17788758978238, "learning_rate": 2.9940960051345135e-07, "logits/chosen": -2.78125, "logits/rejected": -2.5, "logps/chosen": -724.0, "logps/rejected": -1104.0, "loss": 0.1803, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.5625, "rewards/margins": 3.96875, "rewards/rejected": -9.5, "step": 6830 }, { "epoch": 0.49375586515556197, "grad_norm": 9.07977507120006, "learning_rate": 2.987918890015685e-07, "logits/chosen": -2.6875, "logits/rejected": -2.484375, "logps/chosen": -716.0, "logps/rejected": -1088.0, "loss": 0.1612, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.53125, "rewards/margins": 3.875, "rewards/rejected": -9.375, "step": 6840 }, { "epoch": 0.494477730455497, "grad_norm": 13.691630630266364, "learning_rate": 2.981738676598555e-07, "logits/chosen": -2.765625, "logits/rejected": -2.515625, "logps/chosen": -724.0, "logps/rejected": -1136.0, "loss": 0.164, "rewards/accuracies": 0.9375, "rewards/chosen": -5.6875, "rewards/margins": 4.0, "rewards/rejected": -9.6875, "step": 6850 }, { "epoch": 0.49519959575543204, "grad_norm": 10.993076123812866, "learning_rate": 2.9755554041276465e-07, "logits/chosen": -2.796875, "logits/rejected": -2.578125, "logps/chosen": -688.0, "logps/rejected": -1072.0, "loss": 0.1889, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -5.53125, "rewards/margins": 3.734375, "rewards/rejected": -9.25, "step": 6860 }, { "epoch": 0.49592146105536705, "grad_norm": 11.646557564452921, "learning_rate": 2.9693691118669117e-07, "logits/chosen": -2.8125, "logits/rejected": -2.59375, "logps/chosen": -724.0, "logps/rejected": -1080.0, "loss": 0.1677, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -5.6875, "rewards/margins": 3.65625, "rewards/rejected": -9.3125, "step": 6870 }, { "epoch": 0.4966433263553021, "grad_norm": 8.874925129899568, "learning_rate": 2.9631798390994726e-07, "logits/chosen": -2.90625, "logits/rejected": -2.65625, "logps/chosen": -708.0, "logps/rejected": -1080.0, "loss": 0.1841, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.5, "rewards/margins": 3.84375, "rewards/rejected": -9.3125, "step": 6880 }, { "epoch": 0.4973651916552371, "grad_norm": 8.267348409663557, "learning_rate": 2.9569876251273826e-07, "logits/chosen": -2.859375, "logits/rejected": -2.75, "logps/chosen": -720.0, "logps/rejected": -1112.0, "loss": 0.1684, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.53125, "rewards/margins": 4.09375, "rewards/rejected": -9.625, "step": 6890 }, { "epoch": 0.4980870569551722, "grad_norm": 11.307205545557014, "learning_rate": 2.9507925092713685e-07, "logits/chosen": -2.953125, "logits/rejected": -2.71875, "logps/chosen": -712.0, "logps/rejected": -1128.0, "loss": 0.1592, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.40625, "rewards/margins": 4.28125, "rewards/rejected": -9.6875, "step": 6900 }, { "epoch": 0.4988089222551072, "grad_norm": 9.259383366590928, "learning_rate": 2.9445945308705866e-07, "logits/chosen": -2.765625, "logits/rejected": -2.578125, "logps/chosen": -700.0, "logps/rejected": -1072.0, "loss": 0.1956, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.34375, "rewards/margins": 3.796875, "rewards/rejected": -9.1875, "step": 6910 }, { "epoch": 0.4995307875550422, "grad_norm": 7.91332378148377, "learning_rate": 2.938393729282369e-07, "logits/chosen": -2.640625, "logits/rejected": -2.359375, "logps/chosen": -700.0, "logps/rejected": -1064.0, "loss": 0.1659, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.4375, "rewards/margins": 3.65625, "rewards/rejected": -9.0625, "step": 6920 }, { "epoch": 0.5002526528549772, "grad_norm": 9.581050058932107, "learning_rate": 2.932190143881976e-07, "logits/chosen": -2.734375, "logits/rejected": -2.453125, "logps/chosen": -696.0, "logps/rejected": -1112.0, "loss": 0.165, "rewards/accuracies": 0.9375, "rewards/chosen": -5.25, "rewards/margins": 4.25, "rewards/rejected": -9.5, "step": 6930 }, { "epoch": 0.5009745181549123, "grad_norm": 11.548026800858397, "learning_rate": 2.925983814062342e-07, "logits/chosen": -2.890625, "logits/rejected": -2.5625, "logps/chosen": -732.0, "logps/rejected": -1144.0, "loss": 0.1582, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -5.6875, "rewards/margins": 4.28125, "rewards/rejected": -10.0, "step": 6940 }, { "epoch": 0.5016963834548473, "grad_norm": 9.32142861680438, "learning_rate": 2.9197747792338344e-07, "logits/chosen": -2.859375, "logits/rejected": -2.6875, "logps/chosen": -724.0, "logps/rejected": -1112.0, "loss": 0.1701, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.6875, "rewards/margins": 3.96875, "rewards/rejected": -9.6875, "step": 6950 }, { "epoch": 0.5024182487547824, "grad_norm": 8.751197433738259, "learning_rate": 2.9135630788239936e-07, "logits/chosen": -2.75, "logits/rejected": -2.453125, "logps/chosen": -684.0, "logps/rejected": -1040.0, "loss": 0.1916, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.25, "rewards/margins": 3.671875, "rewards/rejected": -8.9375, "step": 6960 }, { "epoch": 0.5031401140547174, "grad_norm": 9.093507158463877, "learning_rate": 2.907348752277286e-07, "logits/chosen": -2.75, "logits/rejected": -2.421875, "logps/chosen": -716.0, "logps/rejected": -1088.0, "loss": 0.1908, "rewards/accuracies": 0.9375, "rewards/chosen": -5.375, "rewards/margins": 3.78125, "rewards/rejected": -9.125, "step": 6970 }, { "epoch": 0.5038619793546524, "grad_norm": 10.072538127620183, "learning_rate": 2.901131839054856e-07, "logits/chosen": -2.8125, "logits/rejected": -2.453125, "logps/chosen": -728.0, "logps/rejected": -1112.0, "loss": 0.1771, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.625, "rewards/margins": 3.9375, "rewards/rejected": -9.5625, "step": 6980 }, { "epoch": 0.5045838446545875, "grad_norm": 7.9225853596575515, "learning_rate": 2.894912378634272e-07, "logits/chosen": -2.875, "logits/rejected": -2.609375, "logps/chosen": -708.0, "logps/rejected": -1096.0, "loss": 0.168, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.40625, "rewards/margins": 3.90625, "rewards/rejected": -9.3125, "step": 6990 }, { "epoch": 0.5053057099545225, "grad_norm": 8.508668273373068, "learning_rate": 2.888690410509278e-07, "logits/chosen": -2.875, "logits/rejected": -2.546875, "logps/chosen": -660.0, "logps/rejected": -1056.0, "loss": 0.1732, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.09375, "rewards/margins": 3.875, "rewards/rejected": -8.9375, "step": 7000 }, { "epoch": 0.5060275752544575, "grad_norm": 9.683917887834271, "learning_rate": 2.8824659741895424e-07, "logits/chosen": -2.75, "logits/rejected": -2.578125, "logps/chosen": -716.0, "logps/rejected": -1040.0, "loss": 0.1784, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.375, "rewards/margins": 3.46875, "rewards/rejected": -8.8125, "step": 7010 }, { "epoch": 0.5067494405543925, "grad_norm": 11.888118286993855, "learning_rate": 2.8762391092004054e-07, "logits/chosen": -2.921875, "logits/rejected": -2.53125, "logps/chosen": -700.0, "logps/rejected": -1112.0, "loss": 0.1856, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.5, "rewards/margins": 4.21875, "rewards/rejected": -9.6875, "step": 7020 }, { "epoch": 0.5074713058543275, "grad_norm": 10.520962949102882, "learning_rate": 2.8700098550826317e-07, "logits/chosen": -2.6875, "logits/rejected": -2.5, "logps/chosen": -684.0, "logps/rejected": -1040.0, "loss": 0.1766, "rewards/accuracies": 0.90625, "rewards/chosen": -5.21875, "rewards/margins": 3.703125, "rewards/rejected": -8.9375, "step": 7030 }, { "epoch": 0.5081931711542627, "grad_norm": 6.050995114285996, "learning_rate": 2.8637782513921537e-07, "logits/chosen": -2.78125, "logits/rejected": -2.421875, "logps/chosen": -688.0, "logps/rejected": -1088.0, "loss": 0.1728, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.1875, "rewards/margins": 4.15625, "rewards/rejected": -9.3125, "step": 7040 }, { "epoch": 0.5089150364541977, "grad_norm": 11.386068773907736, "learning_rate": 2.857544337699826e-07, "logits/chosen": -2.71875, "logits/rejected": -2.53125, "logps/chosen": -672.0, "logps/rejected": -1032.0, "loss": 0.1785, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.09375, "rewards/margins": 3.765625, "rewards/rejected": -8.875, "step": 7050 }, { "epoch": 0.5096369017541327, "grad_norm": 9.512039437649568, "learning_rate": 2.85130815359117e-07, "logits/chosen": -2.953125, "logits/rejected": -2.640625, "logps/chosen": -720.0, "logps/rejected": -1096.0, "loss": 0.17, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.625, "rewards/margins": 3.78125, "rewards/rejected": -9.4375, "step": 7060 }, { "epoch": 0.5103587670540677, "grad_norm": 11.114854171347922, "learning_rate": 2.845069738666128e-07, "logits/chosen": -2.90625, "logits/rejected": -2.671875, "logps/chosen": -716.0, "logps/rejected": -1080.0, "loss": 0.1952, "rewards/accuracies": 0.90625, "rewards/chosen": -5.53125, "rewards/margins": 3.796875, "rewards/rejected": -9.3125, "step": 7070 }, { "epoch": 0.5110806323540027, "grad_norm": 6.776138063327284, "learning_rate": 2.8388291325388024e-07, "logits/chosen": -2.96875, "logits/rejected": -2.5625, "logps/chosen": -680.0, "logps/rejected": -1032.0, "loss": 0.1688, "rewards/accuracies": 0.9375, "rewards/chosen": -5.21875, "rewards/margins": 3.609375, "rewards/rejected": -8.8125, "step": 7080 }, { "epoch": 0.5118024976539378, "grad_norm": 9.638830345053352, "learning_rate": 2.832586374837215e-07, "logits/chosen": -2.734375, "logits/rejected": -2.609375, "logps/chosen": -700.0, "logps/rejected": -1032.0, "loss": 0.1917, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.34375, "rewards/margins": 3.5, "rewards/rejected": -8.875, "step": 7090 }, { "epoch": 0.5125243629538728, "grad_norm": 10.274548246717263, "learning_rate": 2.826341505203047e-07, "logits/chosen": -2.671875, "logits/rejected": -2.4375, "logps/chosen": -680.0, "logps/rejected": -1032.0, "loss": 0.1662, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.15625, "rewards/margins": 3.71875, "rewards/rejected": -8.875, "step": 7100 }, { "epoch": 0.5132462282538078, "grad_norm": 10.65030499452255, "learning_rate": 2.8200945632913917e-07, "logits/chosen": -2.84375, "logits/rejected": -2.65625, "logps/chosen": -676.0, "logps/rejected": -1040.0, "loss": 0.1692, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -4.96875, "rewards/margins": 3.875, "rewards/rejected": -8.875, "step": 7110 }, { "epoch": 0.5139680935537428, "grad_norm": 8.65595924084498, "learning_rate": 2.8138455887705017e-07, "logits/chosen": -2.8125, "logits/rejected": -2.5625, "logps/chosen": -724.0, "logps/rejected": -1168.0, "loss": 0.1748, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.59375, "rewards/margins": 4.28125, "rewards/rejected": -9.875, "step": 7120 }, { "epoch": 0.5146899588536779, "grad_norm": 7.416014752541617, "learning_rate": 2.807594621321536e-07, "logits/chosen": -2.84375, "logits/rejected": -2.578125, "logps/chosen": -664.0, "logps/rejected": -1040.0, "loss": 0.1723, "rewards/accuracies": 0.9375, "rewards/chosen": -5.0625, "rewards/margins": 4.0, "rewards/rejected": -9.0625, "step": 7130 }, { "epoch": 0.515411824153613, "grad_norm": 9.986965415691905, "learning_rate": 2.801341700638307e-07, "logits/chosen": -2.890625, "logits/rejected": -2.578125, "logps/chosen": -688.0, "logps/rejected": -1104.0, "loss": 0.1896, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.1875, "rewards/margins": 4.09375, "rewards/rejected": -9.3125, "step": 7140 }, { "epoch": 0.516133689453548, "grad_norm": 8.63015173531394, "learning_rate": 2.7950868664270355e-07, "logits/chosen": -2.859375, "logits/rejected": -2.5625, "logps/chosen": -680.0, "logps/rejected": -1080.0, "loss": 0.1624, "rewards/accuracies": 0.9375, "rewards/chosen": -5.1875, "rewards/margins": 4.125, "rewards/rejected": -9.3125, "step": 7150 }, { "epoch": 0.516855554753483, "grad_norm": 8.92932402159572, "learning_rate": 2.788830158406088e-07, "logits/chosen": -2.90625, "logits/rejected": -2.609375, "logps/chosen": -780.0, "logps/rejected": -1160.0, "loss": 0.1784, "rewards/accuracies": 0.887499988079071, "rewards/chosen": -6.15625, "rewards/margins": 4.03125, "rewards/rejected": -10.1875, "step": 7160 }, { "epoch": 0.517577420053418, "grad_norm": 9.18548337260447, "learning_rate": 2.782571616305731e-07, "logits/chosen": -2.875, "logits/rejected": -2.53125, "logps/chosen": -712.0, "logps/rejected": -1120.0, "loss": 0.1761, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.5, "rewards/margins": 4.125, "rewards/rejected": -9.625, "step": 7170 }, { "epoch": 0.518299285353353, "grad_norm": 7.559246854549426, "learning_rate": 2.7763112798678787e-07, "logits/chosen": -2.828125, "logits/rejected": -2.546875, "logps/chosen": -648.0, "logps/rejected": -1032.0, "loss": 0.168, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.03125, "rewards/margins": 3.859375, "rewards/rejected": -8.9375, "step": 7180 }, { "epoch": 0.5190211506532881, "grad_norm": 8.366664721309567, "learning_rate": 2.77004918884584e-07, "logits/chosen": -2.828125, "logits/rejected": -2.625, "logps/chosen": -716.0, "logps/rejected": -1104.0, "loss": 0.1928, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -5.71875, "rewards/margins": 3.734375, "rewards/rejected": -9.4375, "step": 7190 }, { "epoch": 0.5197430159532231, "grad_norm": 11.737242043765724, "learning_rate": 2.763785383004063e-07, "logits/chosen": -2.8125, "logits/rejected": -2.5625, "logps/chosen": -760.0, "logps/rejected": -1120.0, "loss": 0.1635, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -5.71875, "rewards/margins": 3.96875, "rewards/rejected": -9.6875, "step": 7200 }, { "epoch": 0.5204648812531582, "grad_norm": 7.926610565257705, "learning_rate": 2.7575199021178855e-07, "logits/chosen": -2.90625, "logits/rejected": -2.625, "logps/chosen": -768.0, "logps/rejected": -1152.0, "loss": 0.1644, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -6.09375, "rewards/margins": 3.90625, "rewards/rejected": -10.0, "step": 7210 }, { "epoch": 0.5211867465530932, "grad_norm": 11.714571880510713, "learning_rate": 2.751252785973284e-07, "logits/chosen": -2.90625, "logits/rejected": -2.65625, "logps/chosen": -744.0, "logps/rejected": -1136.0, "loss": 0.1531, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -5.84375, "rewards/margins": 4.0625, "rewards/rejected": -9.9375, "step": 7220 }, { "epoch": 0.5219086118530282, "grad_norm": 8.471661619696453, "learning_rate": 2.744984074366617e-07, "logits/chosen": -2.90625, "logits/rejected": -2.640625, "logps/chosen": -760.0, "logps/rejected": -1128.0, "loss": 0.1723, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.96875, "rewards/margins": 3.890625, "rewards/rejected": -9.875, "step": 7230 }, { "epoch": 0.5226304771529633, "grad_norm": 9.494843803969578, "learning_rate": 2.738713807104375e-07, "logits/chosen": -2.953125, "logits/rejected": -2.5625, "logps/chosen": -740.0, "logps/rejected": -1120.0, "loss": 0.1728, "rewards/accuracies": 0.9375, "rewards/chosen": -5.5625, "rewards/margins": 3.84375, "rewards/rejected": -9.4375, "step": 7240 }, { "epoch": 0.5233523424528983, "grad_norm": 7.787106376583822, "learning_rate": 2.732442024002926e-07, "logits/chosen": -2.96875, "logits/rejected": -2.59375, "logps/chosen": -704.0, "logps/rejected": -1128.0, "loss": 0.1461, "rewards/accuracies": 0.9750000238418579, "rewards/chosen": -5.4375, "rewards/margins": 4.375, "rewards/rejected": -9.8125, "step": 7250 }, { "epoch": 0.5240742077528333, "grad_norm": 6.681800096835566, "learning_rate": 2.726168764888264e-07, "logits/chosen": -2.921875, "logits/rejected": -2.6875, "logps/chosen": -752.0, "logps/rejected": -1160.0, "loss": 0.1681, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.9375, "rewards/margins": 3.984375, "rewards/rejected": -9.9375, "step": 7260 }, { "epoch": 0.5247960730527683, "grad_norm": 9.923678846098278, "learning_rate": 2.7198940695957573e-07, "logits/chosen": -3.03125, "logits/rejected": -2.6875, "logps/chosen": -728.0, "logps/rejected": -1144.0, "loss": 0.1693, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.71875, "rewards/margins": 4.3125, "rewards/rejected": -10.0, "step": 7270 }, { "epoch": 0.5255179383527034, "grad_norm": 9.08851776389925, "learning_rate": 2.713617977969892e-07, "logits/chosen": -2.859375, "logits/rejected": -2.734375, "logps/chosen": -768.0, "logps/rejected": -1136.0, "loss": 0.2118, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -6.0, "rewards/margins": 3.90625, "rewards/rejected": -9.875, "step": 7280 }, { "epoch": 0.5262398036526384, "grad_norm": 9.6683925726083, "learning_rate": 2.707340529864022e-07, "logits/chosen": -2.625, "logits/rejected": -2.53125, "logps/chosen": -760.0, "logps/rejected": -1112.0, "loss": 0.1804, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.96875, "rewards/margins": 3.421875, "rewards/rejected": -9.4375, "step": 7290 }, { "epoch": 0.5269616689525735, "grad_norm": 10.896898496114463, "learning_rate": 2.7010617651401133e-07, "logits/chosen": -2.859375, "logits/rejected": -2.625, "logps/chosen": -760.0, "logps/rejected": -1104.0, "loss": 0.1554, "rewards/accuracies": 0.981249988079071, "rewards/chosen": -6.09375, "rewards/margins": 3.625, "rewards/rejected": -9.75, "step": 7300 }, { "epoch": 0.5276835342525085, "grad_norm": 10.726650561848246, "learning_rate": 2.694781723668495e-07, "logits/chosen": -2.984375, "logits/rejected": -2.671875, "logps/chosen": -752.0, "logps/rejected": -1152.0, "loss": 0.1673, "rewards/accuracies": 0.90625, "rewards/chosen": -6.03125, "rewards/margins": 3.796875, "rewards/rejected": -9.8125, "step": 7310 }, { "epoch": 0.5284053995524435, "grad_norm": 10.009720787997963, "learning_rate": 2.6885004453276014e-07, "logits/chosen": -3.078125, "logits/rejected": -2.71875, "logps/chosen": -768.0, "logps/rejected": -1208.0, "loss": 0.1562, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -6.0, "rewards/margins": 4.46875, "rewards/rejected": -10.4375, "step": 7320 }, { "epoch": 0.5291272648523786, "grad_norm": 10.393937281174756, "learning_rate": 2.682217970003724e-07, "logits/chosen": -3.0, "logits/rejected": -2.6875, "logps/chosen": -704.0, "logps/rejected": -1152.0, "loss": 0.1809, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.5, "rewards/margins": 4.4375, "rewards/rejected": -9.875, "step": 7330 }, { "epoch": 0.5298491301523136, "grad_norm": 6.564234569234908, "learning_rate": 2.6759343375907497e-07, "logits/chosen": -3.0625, "logits/rejected": -2.765625, "logps/chosen": -672.0, "logps/rejected": -1096.0, "loss": 0.1776, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.1875, "rewards/margins": 4.375, "rewards/rejected": -9.5625, "step": 7340 }, { "epoch": 0.5305709954522486, "grad_norm": 8.875705075362786, "learning_rate": 2.669649587989918e-07, "logits/chosen": -3.03125, "logits/rejected": -2.765625, "logps/chosen": -724.0, "logps/rejected": -1136.0, "loss": 0.1694, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.46875, "rewards/margins": 4.375, "rewards/rejected": -9.8125, "step": 7350 }, { "epoch": 0.5312928607521836, "grad_norm": 8.149716947695198, "learning_rate": 2.6633637611095615e-07, "logits/chosen": -3.0, "logits/rejected": -2.65625, "logps/chosen": -704.0, "logps/rejected": -1104.0, "loss": 0.1685, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -5.34375, "rewards/margins": 4.0625, "rewards/rejected": -9.4375, "step": 7360 }, { "epoch": 0.5320147260521186, "grad_norm": 9.117623642609074, "learning_rate": 2.6570768968648515e-07, "logits/chosen": -3.0, "logits/rejected": -2.734375, "logps/chosen": -708.0, "logps/rejected": -1104.0, "loss": 0.1688, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.46875, "rewards/margins": 4.09375, "rewards/rejected": -9.5625, "step": 7370 }, { "epoch": 0.5327365913520538, "grad_norm": 7.7833308392028115, "learning_rate": 2.6507890351775485e-07, "logits/chosen": -2.890625, "logits/rejected": -2.703125, "logps/chosen": -672.0, "logps/rejected": -1080.0, "loss": 0.1529, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.28125, "rewards/margins": 3.84375, "rewards/rejected": -9.125, "step": 7380 }, { "epoch": 0.5334584566519888, "grad_norm": 11.143661735085152, "learning_rate": 2.644500215975747e-07, "logits/chosen": -2.9375, "logits/rejected": -2.515625, "logps/chosen": -724.0, "logps/rejected": -1088.0, "loss": 0.177, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -5.5, "rewards/margins": 3.859375, "rewards/rejected": -9.375, "step": 7390 }, { "epoch": 0.5341803219519238, "grad_norm": 6.014943903391089, "learning_rate": 2.63821047919362e-07, "logits/chosen": -2.90625, "logits/rejected": -2.71875, "logps/chosen": -732.0, "logps/rejected": -1128.0, "loss": 0.1905, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.625, "rewards/margins": 4.1875, "rewards/rejected": -9.8125, "step": 7400 }, { "epoch": 0.5349021872518588, "grad_norm": 9.506926726417404, "learning_rate": 2.631919864771168e-07, "logits/chosen": -2.875, "logits/rejected": -2.640625, "logps/chosen": -712.0, "logps/rejected": -1120.0, "loss": 0.153, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -5.59375, "rewards/margins": 4.0625, "rewards/rejected": -9.625, "step": 7410 }, { "epoch": 0.5356240525517938, "grad_norm": 8.989178126574519, "learning_rate": 2.6256284126539657e-07, "logits/chosen": -2.9375, "logits/rejected": -2.5625, "logps/chosen": -748.0, "logps/rejected": -1152.0, "loss": 0.1589, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.9375, "rewards/margins": 4.03125, "rewards/rejected": -10.0, "step": 7420 }, { "epoch": 0.5363459178517289, "grad_norm": 8.096664424589033, "learning_rate": 2.619336162792905e-07, "logits/chosen": -2.90625, "logits/rejected": -2.65625, "logps/chosen": -736.0, "logps/rejected": -1192.0, "loss": 0.1436, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.6875, "rewards/margins": 4.8125, "rewards/rejected": -10.5, "step": 7430 }, { "epoch": 0.5370677831516639, "grad_norm": 16.841361704172662, "learning_rate": 2.6130431551439456e-07, "logits/chosen": -3.015625, "logits/rejected": -2.75, "logps/chosen": -732.0, "logps/rejected": -1176.0, "loss": 0.1629, "rewards/accuracies": 0.9375, "rewards/chosen": -5.71875, "rewards/margins": 4.46875, "rewards/rejected": -10.1875, "step": 7440 }, { "epoch": 0.5377896484515989, "grad_norm": 10.149973787308852, "learning_rate": 2.606749429667859e-07, "logits/chosen": -3.0, "logits/rejected": -2.796875, "logps/chosen": -788.0, "logps/rejected": -1216.0, "loss": 0.1571, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -6.25, "rewards/margins": 4.3125, "rewards/rejected": -10.5625, "step": 7450 }, { "epoch": 0.5385115137515339, "grad_norm": 11.046710856292618, "learning_rate": 2.6004550263299724e-07, "logits/chosen": -2.8125, "logits/rejected": -2.609375, "logps/chosen": -768.0, "logps/rejected": -1200.0, "loss": 0.1731, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -6.09375, "rewards/margins": 4.34375, "rewards/rejected": -10.4375, "step": 7460 }, { "epoch": 0.539233379051469, "grad_norm": 9.061807143540431, "learning_rate": 2.5941599850999194e-07, "logits/chosen": -2.84375, "logits/rejected": -2.4375, "logps/chosen": -792.0, "logps/rejected": -1160.0, "loss": 0.1776, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -6.34375, "rewards/margins": 3.796875, "rewards/rejected": -10.125, "step": 7470 }, { "epoch": 0.5399552443514041, "grad_norm": 10.136512372235272, "learning_rate": 2.5878643459513857e-07, "logits/chosen": -2.875, "logits/rejected": -2.625, "logps/chosen": -768.0, "logps/rejected": -1200.0, "loss": 0.1714, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -6.09375, "rewards/margins": 4.34375, "rewards/rejected": -10.4375, "step": 7480 }, { "epoch": 0.5406771096513391, "grad_norm": 9.091121034585713, "learning_rate": 2.58156814886185e-07, "logits/chosen": -2.8125, "logits/rejected": -2.65625, "logps/chosen": -740.0, "logps/rejected": -1072.0, "loss": 0.1804, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -5.84375, "rewards/margins": 3.546875, "rewards/rejected": -9.375, "step": 7490 }, { "epoch": 0.5413989749512741, "grad_norm": 11.023486939102211, "learning_rate": 2.575271433812338e-07, "logits/chosen": -2.8125, "logits/rejected": -2.609375, "logps/chosen": -720.0, "logps/rejected": -1112.0, "loss": 0.1629, "rewards/accuracies": 0.96875, "rewards/chosen": -5.59375, "rewards/margins": 3.96875, "rewards/rejected": -9.5625, "step": 7500 }, { "epoch": 0.5421208402512091, "grad_norm": 12.378483126658342, "learning_rate": 2.5689742407871615e-07, "logits/chosen": -2.890625, "logits/rejected": -2.65625, "logps/chosen": -712.0, "logps/rejected": -1088.0, "loss": 0.1563, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.5625, "rewards/margins": 3.875, "rewards/rejected": -9.4375, "step": 7510 }, { "epoch": 0.5428427055511441, "grad_norm": 9.630319451714357, "learning_rate": 2.562676609773669e-07, "logits/chosen": -2.921875, "logits/rejected": -2.625, "logps/chosen": -736.0, "logps/rejected": -1160.0, "loss": 0.1608, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.6875, "rewards/margins": 4.375, "rewards/rejected": -10.0625, "step": 7520 }, { "epoch": 0.5435645708510792, "grad_norm": 8.457889597977909, "learning_rate": 2.556378580761989e-07, "logits/chosen": -2.9375, "logits/rejected": -2.5625, "logps/chosen": -720.0, "logps/rejected": -1136.0, "loss": 0.1797, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -5.65625, "rewards/margins": 4.28125, "rewards/rejected": -9.9375, "step": 7530 }, { "epoch": 0.5442864361510142, "grad_norm": 8.046649935179103, "learning_rate": 2.5500801937447794e-07, "logits/chosen": -2.84375, "logits/rejected": -2.5625, "logps/chosen": -736.0, "logps/rejected": -1104.0, "loss": 0.1379, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.75, "rewards/margins": 3.875, "rewards/rejected": -9.625, "step": 7540 }, { "epoch": 0.5450083014509493, "grad_norm": 9.046127207562416, "learning_rate": 2.5437814887169684e-07, "logits/chosen": -2.921875, "logits/rejected": -2.625, "logps/chosen": -688.0, "logps/rejected": -1120.0, "loss": 0.1581, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.28125, "rewards/margins": 4.28125, "rewards/rejected": -9.5625, "step": 7550 }, { "epoch": 0.5457301667508843, "grad_norm": 9.329772174624635, "learning_rate": 2.5374825056755073e-07, "logits/chosen": -2.8125, "logits/rejected": -2.625, "logps/chosen": -728.0, "logps/rejected": -1128.0, "loss": 0.1942, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -5.6875, "rewards/margins": 4.15625, "rewards/rejected": -9.875, "step": 7560 }, { "epoch": 0.5464520320508193, "grad_norm": 9.9179656907273, "learning_rate": 2.531183284619109e-07, "logits/chosen": -3.0, "logits/rejected": -2.625, "logps/chosen": -704.0, "logps/rejected": -1120.0, "loss": 0.1747, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -5.46875, "rewards/margins": 4.09375, "rewards/rejected": -9.5625, "step": 7570 }, { "epoch": 0.5471738973507544, "grad_norm": 9.557689966293122, "learning_rate": 2.524883865548e-07, "logits/chosen": -2.953125, "logits/rejected": -2.609375, "logps/chosen": -700.0, "logps/rejected": -1072.0, "loss": 0.1632, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -5.4375, "rewards/margins": 3.859375, "rewards/rejected": -9.3125, "step": 7580 }, { "epoch": 0.5478957626506894, "grad_norm": 9.086340027521503, "learning_rate": 2.5185842884636633e-07, "logits/chosen": -2.796875, "logits/rejected": -2.609375, "logps/chosen": -720.0, "logps/rejected": -1080.0, "loss": 0.1667, "rewards/accuracies": 0.887499988079071, "rewards/chosen": -5.5, "rewards/margins": 3.671875, "rewards/rejected": -9.1875, "step": 7590 }, { "epoch": 0.5486176279506244, "grad_norm": 8.606477368401597, "learning_rate": 2.5122845933685873e-07, "logits/chosen": -2.90625, "logits/rejected": -2.609375, "logps/chosen": -672.0, "logps/rejected": -1096.0, "loss": 0.1394, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.21875, "rewards/margins": 4.375, "rewards/rejected": -9.625, "step": 7600 }, { "epoch": 0.5493394932505594, "grad_norm": 9.684120993406607, "learning_rate": 2.505984820266007e-07, "logits/chosen": -2.875, "logits/rejected": -2.703125, "logps/chosen": -716.0, "logps/rejected": -1128.0, "loss": 0.1659, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -5.5625, "rewards/margins": 4.1875, "rewards/rejected": -9.75, "step": 7610 }, { "epoch": 0.5500613585504944, "grad_norm": 11.673738089201613, "learning_rate": 2.4996850091596535e-07, "logits/chosen": -2.90625, "logits/rejected": -2.546875, "logps/chosen": -704.0, "logps/rejected": -1136.0, "loss": 0.1675, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.5625, "rewards/margins": 4.3125, "rewards/rejected": -9.875, "step": 7620 }, { "epoch": 0.5507832238504295, "grad_norm": 9.43384042742059, "learning_rate": 2.493385200053502e-07, "logits/chosen": -3.0625, "logits/rejected": -2.6875, "logps/chosen": -752.0, "logps/rejected": -1136.0, "loss": 0.1923, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.84375, "rewards/margins": 4.0, "rewards/rejected": -9.875, "step": 7630 }, { "epoch": 0.5515050891503646, "grad_norm": 7.477187732924252, "learning_rate": 2.48708543295151e-07, "logits/chosen": -2.96875, "logits/rejected": -2.671875, "logps/chosen": -712.0, "logps/rejected": -1168.0, "loss": 0.1651, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.59375, "rewards/margins": 4.5, "rewards/rejected": -10.0625, "step": 7640 }, { "epoch": 0.5522269544502996, "grad_norm": 7.419622643126169, "learning_rate": 2.480785747857372e-07, "logits/chosen": -2.921875, "logits/rejected": -2.625, "logps/chosen": -748.0, "logps/rejected": -1112.0, "loss": 0.1622, "rewards/accuracies": 0.875, "rewards/chosen": -5.84375, "rewards/margins": 3.78125, "rewards/rejected": -9.625, "step": 7650 }, { "epoch": 0.5529488197502346, "grad_norm": 7.6418997353667955, "learning_rate": 2.474486184774262e-07, "logits/chosen": -2.84375, "logits/rejected": -2.640625, "logps/chosen": -756.0, "logps/rejected": -1184.0, "loss": 0.1553, "rewards/accuracies": 0.96875, "rewards/chosen": -5.9375, "rewards/margins": 4.34375, "rewards/rejected": -10.25, "step": 7660 }, { "epoch": 0.5536706850501696, "grad_norm": 11.143956805660984, "learning_rate": 2.468186783704575e-07, "logits/chosen": -3.046875, "logits/rejected": -2.734375, "logps/chosen": -740.0, "logps/rejected": -1160.0, "loss": 0.1838, "rewards/accuracies": 0.9375, "rewards/chosen": -5.6875, "rewards/margins": 4.40625, "rewards/rejected": -10.0625, "step": 7670 }, { "epoch": 0.5543925503501047, "grad_norm": 12.296442116097905, "learning_rate": 2.461887584649684e-07, "logits/chosen": -2.859375, "logits/rejected": -2.65625, "logps/chosen": -736.0, "logps/rejected": -1128.0, "loss": 0.1699, "rewards/accuracies": 0.9375, "rewards/chosen": -5.71875, "rewards/margins": 4.0, "rewards/rejected": -9.75, "step": 7680 }, { "epoch": 0.5551144156500397, "grad_norm": 13.050278426508344, "learning_rate": 2.4555886276096713e-07, "logits/chosen": -2.828125, "logits/rejected": -2.6875, "logps/chosen": -724.0, "logps/rejected": -1112.0, "loss": 0.1799, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -5.5625, "rewards/margins": 4.0625, "rewards/rejected": -9.625, "step": 7690 }, { "epoch": 0.5558362809499747, "grad_norm": 7.331592070155222, "learning_rate": 2.4492899525830896e-07, "logits/chosen": -2.890625, "logits/rejected": -2.65625, "logps/chosen": -684.0, "logps/rejected": -1080.0, "loss": 0.1688, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -5.28125, "rewards/margins": 4.0625, "rewards/rejected": -9.375, "step": 7700 }, { "epoch": 0.5565581462499097, "grad_norm": 10.969811602721066, "learning_rate": 2.4429915995666967e-07, "logits/chosen": -2.859375, "logits/rejected": -2.59375, "logps/chosen": -692.0, "logps/rejected": -1080.0, "loss": 0.1692, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -5.28125, "rewards/margins": 3.796875, "rewards/rejected": -9.0625, "step": 7710 }, { "epoch": 0.5572800115498447, "grad_norm": 6.714447148185967, "learning_rate": 2.4366936085552055e-07, "logits/chosen": -2.78125, "logits/rejected": -2.5, "logps/chosen": -684.0, "logps/rejected": -1072.0, "loss": 0.1493, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.25, "rewards/margins": 4.0625, "rewards/rejected": -9.3125, "step": 7720 }, { "epoch": 0.5580018768497799, "grad_norm": 6.283567486920552, "learning_rate": 2.430396019541032e-07, "logits/chosen": -3.046875, "logits/rejected": -2.671875, "logps/chosen": -716.0, "logps/rejected": -1184.0, "loss": 0.1521, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -5.59375, "rewards/margins": 4.5, "rewards/rejected": -10.0625, "step": 7730 }, { "epoch": 0.5587237421497149, "grad_norm": 9.641423565186832, "learning_rate": 2.42409887251404e-07, "logits/chosen": -2.984375, "logits/rejected": -2.65625, "logps/chosen": -688.0, "logps/rejected": -1112.0, "loss": 0.1574, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.4375, "rewards/margins": 4.15625, "rewards/rejected": -9.5625, "step": 7740 }, { "epoch": 0.5594456074496499, "grad_norm": 9.82613619768625, "learning_rate": 2.4178022074612834e-07, "logits/chosen": -3.03125, "logits/rejected": -2.78125, "logps/chosen": -720.0, "logps/rejected": -1104.0, "loss": 0.1583, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.5625, "rewards/margins": 3.890625, "rewards/rejected": -9.4375, "step": 7750 }, { "epoch": 0.5601674727495849, "grad_norm": 8.116478311651692, "learning_rate": 2.4115060643667596e-07, "logits/chosen": -2.953125, "logits/rejected": -2.671875, "logps/chosen": -728.0, "logps/rejected": -1152.0, "loss": 0.1711, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.6875, "rewards/margins": 4.25, "rewards/rejected": -9.9375, "step": 7760 }, { "epoch": 0.56088933804952, "grad_norm": 9.994907736669813, "learning_rate": 2.4052104832111477e-07, "logits/chosen": -2.890625, "logits/rejected": -2.625, "logps/chosen": -732.0, "logps/rejected": -1128.0, "loss": 0.1654, "rewards/accuracies": 0.9375, "rewards/chosen": -5.625, "rewards/margins": 4.25, "rewards/rejected": -9.875, "step": 7770 }, { "epoch": 0.561611203349455, "grad_norm": 8.76711793301904, "learning_rate": 2.39891550397156e-07, "logits/chosen": -2.953125, "logits/rejected": -2.546875, "logps/chosen": -704.0, "logps/rejected": -1088.0, "loss": 0.1595, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.625, "rewards/margins": 3.796875, "rewards/rejected": -9.4375, "step": 7780 }, { "epoch": 0.56233306864939, "grad_norm": 8.295373017899776, "learning_rate": 2.392621166621289e-07, "logits/chosen": -2.859375, "logits/rejected": -2.515625, "logps/chosen": -712.0, "logps/rejected": -1144.0, "loss": 0.1816, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.46875, "rewards/margins": 4.4375, "rewards/rejected": -9.9375, "step": 7790 }, { "epoch": 0.563054933949325, "grad_norm": 7.740744626757316, "learning_rate": 2.386327511129548e-07, "logits/chosen": -2.984375, "logits/rejected": -2.46875, "logps/chosen": -728.0, "logps/rejected": -1104.0, "loss": 0.1984, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -5.5, "rewards/margins": 3.953125, "rewards/rejected": -9.4375, "step": 7800 }, { "epoch": 0.56377679924926, "grad_norm": 10.604529688792997, "learning_rate": 2.380034577461221e-07, "logits/chosen": -2.8125, "logits/rejected": -2.53125, "logps/chosen": -676.0, "logps/rejected": -1112.0, "loss": 0.1593, "rewards/accuracies": 0.9750000238418579, "rewards/chosen": -5.15625, "rewards/margins": 4.34375, "rewards/rejected": -9.5, "step": 7810 }, { "epoch": 0.5644986645491952, "grad_norm": 6.778093404198004, "learning_rate": 2.373742405576611e-07, "logits/chosen": -2.8125, "logits/rejected": -2.65625, "logps/chosen": -720.0, "logps/rejected": -1072.0, "loss": 0.1712, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.5, "rewards/margins": 3.765625, "rewards/rejected": -9.25, "step": 7820 }, { "epoch": 0.5652205298491302, "grad_norm": 10.12858521011711, "learning_rate": 2.3674510354311787e-07, "logits/chosen": -2.84375, "logits/rejected": -2.421875, "logps/chosen": -728.0, "logps/rejected": -1136.0, "loss": 0.1778, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.625, "rewards/margins": 4.09375, "rewards/rejected": -9.75, "step": 7830 }, { "epoch": 0.5659423951490652, "grad_norm": 8.064195843692932, "learning_rate": 2.3611605069752988e-07, "logits/chosen": -2.75, "logits/rejected": -2.453125, "logps/chosen": -756.0, "logps/rejected": -1136.0, "loss": 0.1689, "rewards/accuracies": 0.96875, "rewards/chosen": -5.96875, "rewards/margins": 4.03125, "rewards/rejected": -10.0, "step": 7840 }, { "epoch": 0.5666642604490002, "grad_norm": 9.775841021106938, "learning_rate": 2.3548708601539982e-07, "logits/chosen": -2.765625, "logits/rejected": -2.53125, "logps/chosen": -752.0, "logps/rejected": -1136.0, "loss": 0.1495, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.9375, "rewards/margins": 3.9375, "rewards/rejected": -9.875, "step": 7850 }, { "epoch": 0.5673861257489352, "grad_norm": 10.098938805871972, "learning_rate": 2.3485821349067062e-07, "logits/chosen": -2.9375, "logits/rejected": -2.625, "logps/chosen": -720.0, "logps/rejected": -1136.0, "loss": 0.1695, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.6875, "rewards/margins": 4.34375, "rewards/rejected": -10.0, "step": 7860 }, { "epoch": 0.5681079910488703, "grad_norm": 8.30412143652236, "learning_rate": 2.3422943711670015e-07, "logits/chosen": -2.875, "logits/rejected": -2.59375, "logps/chosen": -688.0, "logps/rejected": -1088.0, "loss": 0.1625, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -5.1875, "rewards/margins": 4.1875, "rewards/rejected": -9.375, "step": 7870 }, { "epoch": 0.5688298563488053, "grad_norm": 6.817526291974242, "learning_rate": 2.3360076088623544e-07, "logits/chosen": -2.875, "logits/rejected": -2.703125, "logps/chosen": -708.0, "logps/rejected": -1072.0, "loss": 0.1805, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.46875, "rewards/margins": 3.890625, "rewards/rejected": -9.375, "step": 7880 }, { "epoch": 0.5695517216487404, "grad_norm": 10.06504278640758, "learning_rate": 2.3297218879138775e-07, "logits/chosen": -2.890625, "logits/rejected": -2.640625, "logps/chosen": -704.0, "logps/rejected": -1080.0, "loss": 0.1685, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.5625, "rewards/margins": 3.71875, "rewards/rejected": -9.25, "step": 7890 }, { "epoch": 0.5702735869486754, "grad_norm": 7.820665146752294, "learning_rate": 2.3234372482360726e-07, "logits/chosen": -2.859375, "logits/rejected": -2.578125, "logps/chosen": -712.0, "logps/rejected": -1104.0, "loss": 0.1642, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.59375, "rewards/margins": 3.96875, "rewards/rejected": -9.5625, "step": 7900 }, { "epoch": 0.5709954522486104, "grad_norm": 11.261516761461985, "learning_rate": 2.3171537297365718e-07, "logits/chosen": -3.015625, "logits/rejected": -2.765625, "logps/chosen": -688.0, "logps/rejected": -1112.0, "loss": 0.1524, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.1875, "rewards/margins": 4.40625, "rewards/rejected": -9.625, "step": 7910 }, { "epoch": 0.5717173175485455, "grad_norm": 12.326978372880708, "learning_rate": 2.3108713723158908e-07, "logits/chosen": -3.046875, "logits/rejected": -2.625, "logps/chosen": -664.0, "logps/rejected": -1136.0, "loss": 0.1601, "rewards/accuracies": 0.9375, "rewards/chosen": -5.1875, "rewards/margins": 4.59375, "rewards/rejected": -9.8125, "step": 7920 }, { "epoch": 0.5724391828484805, "grad_norm": 12.561004648741765, "learning_rate": 2.304590215867169e-07, "logits/chosen": -3.078125, "logits/rejected": -2.75, "logps/chosen": -716.0, "logps/rejected": -1112.0, "loss": 0.1912, "rewards/accuracies": 0.90625, "rewards/chosen": -5.46875, "rewards/margins": 4.09375, "rewards/rejected": -9.5625, "step": 7930 }, { "epoch": 0.5731610481484155, "grad_norm": 7.388599673863509, "learning_rate": 2.298310300275924e-07, "logits/chosen": -2.890625, "logits/rejected": -2.59375, "logps/chosen": -688.0, "logps/rejected": -1104.0, "loss": 0.1454, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.3125, "rewards/margins": 4.1875, "rewards/rejected": -9.5, "step": 7940 }, { "epoch": 0.5738829134483505, "grad_norm": 6.502079922036917, "learning_rate": 2.2920316654197912e-07, "logits/chosen": -2.953125, "logits/rejected": -2.625, "logps/chosen": -736.0, "logps/rejected": -1120.0, "loss": 0.156, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -5.625, "rewards/margins": 4.15625, "rewards/rejected": -9.75, "step": 7950 }, { "epoch": 0.5746047787482855, "grad_norm": 8.707306377676787, "learning_rate": 2.2857543511682721e-07, "logits/chosen": -2.875, "logits/rejected": -2.65625, "logps/chosen": -732.0, "logps/rejected": -1088.0, "loss": 0.1508, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.65625, "rewards/margins": 3.71875, "rewards/rejected": -9.375, "step": 7960 }, { "epoch": 0.5753266440482206, "grad_norm": 9.94916607775227, "learning_rate": 2.279478397382486e-07, "logits/chosen": -2.921875, "logits/rejected": -2.640625, "logps/chosen": -752.0, "logps/rejected": -1160.0, "loss": 0.186, "rewards/accuracies": 0.90625, "rewards/chosen": -5.90625, "rewards/margins": 4.15625, "rewards/rejected": -10.0625, "step": 7970 }, { "epoch": 0.5760485093481557, "grad_norm": 6.43085308116789, "learning_rate": 2.273203843914911e-07, "logits/chosen": -2.921875, "logits/rejected": -2.609375, "logps/chosen": -708.0, "logps/rejected": -1080.0, "loss": 0.1612, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.3125, "rewards/margins": 4.0625, "rewards/rejected": -9.375, "step": 7980 }, { "epoch": 0.5767703746480907, "grad_norm": 9.384961354414472, "learning_rate": 2.266930730609132e-07, "logits/chosen": -2.828125, "logits/rejected": -2.640625, "logps/chosen": -736.0, "logps/rejected": -1104.0, "loss": 0.1473, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -5.65625, "rewards/margins": 3.890625, "rewards/rejected": -9.5625, "step": 7990 }, { "epoch": 0.5774922399480257, "grad_norm": 7.869464671685872, "learning_rate": 2.260659097299591e-07, "logits/chosen": -3.0, "logits/rejected": -2.65625, "logps/chosen": -732.0, "logps/rejected": -1144.0, "loss": 0.1637, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.8125, "rewards/margins": 4.21875, "rewards/rejected": -10.0, "step": 8000 }, { "epoch": 0.5782141052479607, "grad_norm": 6.036220985959268, "learning_rate": 2.2543889838113297e-07, "logits/chosen": -3.015625, "logits/rejected": -2.65625, "logps/chosen": -740.0, "logps/rejected": -1200.0, "loss": 0.1523, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.78125, "rewards/margins": 4.6875, "rewards/rejected": -10.5, "step": 8010 }, { "epoch": 0.5789359705478958, "grad_norm": 9.091611380745027, "learning_rate": 2.2481204299597422e-07, "logits/chosen": -2.921875, "logits/rejected": -2.640625, "logps/chosen": -728.0, "logps/rejected": -1136.0, "loss": 0.1708, "rewards/accuracies": 0.96875, "rewards/chosen": -5.625, "rewards/margins": 4.28125, "rewards/rejected": -9.9375, "step": 8020 }, { "epoch": 0.5796578358478308, "grad_norm": 8.969271615418297, "learning_rate": 2.2418534755503169e-07, "logits/chosen": -2.875, "logits/rejected": -2.671875, "logps/chosen": -720.0, "logps/rejected": -1144.0, "loss": 0.154, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.5625, "rewards/margins": 4.21875, "rewards/rejected": -9.75, "step": 8030 }, { "epoch": 0.5803797011477658, "grad_norm": 8.869611211845172, "learning_rate": 2.235588160378384e-07, "logits/chosen": -2.859375, "logits/rejected": -2.625, "logps/chosen": -724.0, "logps/rejected": -1096.0, "loss": 0.1892, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.59375, "rewards/margins": 3.734375, "rewards/rejected": -9.3125, "step": 8040 }, { "epoch": 0.5811015664477008, "grad_norm": 8.585563297437242, "learning_rate": 2.229324524228868e-07, "logits/chosen": -2.953125, "logits/rejected": -2.71875, "logps/chosen": -704.0, "logps/rejected": -1048.0, "loss": 0.1972, "rewards/accuracies": 0.887499988079071, "rewards/chosen": -5.4375, "rewards/margins": 3.546875, "rewards/rejected": -9.0, "step": 8050 }, { "epoch": 0.5818234317476358, "grad_norm": 6.361935798258764, "learning_rate": 2.2230626068760297e-07, "logits/chosen": -2.9375, "logits/rejected": -2.640625, "logps/chosen": -680.0, "logps/rejected": -1088.0, "loss": 0.1637, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.1875, "rewards/margins": 4.0625, "rewards/rejected": -9.25, "step": 8060 }, { "epoch": 0.582545297047571, "grad_norm": 7.123503913889777, "learning_rate": 2.216802448083214e-07, "logits/chosen": -2.921875, "logits/rejected": -2.671875, "logps/chosen": -672.0, "logps/rejected": -1048.0, "loss": 0.1524, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.28125, "rewards/margins": 3.71875, "rewards/rejected": -9.0, "step": 8070 }, { "epoch": 0.583267162347506, "grad_norm": 5.3274420243546645, "learning_rate": 2.2105440876026026e-07, "logits/chosen": -3.0, "logits/rejected": -2.671875, "logps/chosen": -712.0, "logps/rejected": -1144.0, "loss": 0.1481, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -5.25, "rewards/margins": 4.5, "rewards/rejected": -9.75, "step": 8080 }, { "epoch": 0.583989027647441, "grad_norm": 8.126969483825905, "learning_rate": 2.2042875651749548e-07, "logits/chosen": -2.875, "logits/rejected": -2.65625, "logps/chosen": -736.0, "logps/rejected": -1136.0, "loss": 0.1605, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.59375, "rewards/margins": 4.21875, "rewards/rejected": -9.8125, "step": 8090 }, { "epoch": 0.584710892947376, "grad_norm": 6.82538345344394, "learning_rate": 2.1980329205293585e-07, "logits/chosen": -3.0, "logits/rejected": -2.625, "logps/chosen": -720.0, "logps/rejected": -1104.0, "loss": 0.1633, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.65625, "rewards/margins": 4.0625, "rewards/rejected": -9.75, "step": 8100 }, { "epoch": 0.585432758247311, "grad_norm": 12.200961629937073, "learning_rate": 2.1917801933829807e-07, "logits/chosen": -2.953125, "logits/rejected": -2.65625, "logps/chosen": -716.0, "logps/rejected": -1120.0, "loss": 0.1516, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.5, "rewards/margins": 4.1875, "rewards/rejected": -9.6875, "step": 8110 }, { "epoch": 0.5861546235472461, "grad_norm": 7.906908172237448, "learning_rate": 2.1855294234408068e-07, "logits/chosen": -3.03125, "logits/rejected": -2.59375, "logps/chosen": -724.0, "logps/rejected": -1104.0, "loss": 0.15, "rewards/accuracies": 0.9375, "rewards/chosen": -5.59375, "rewards/margins": 4.0, "rewards/rejected": -9.5625, "step": 8120 }, { "epoch": 0.5868764888471811, "grad_norm": 10.313898842262107, "learning_rate": 2.1792806503953986e-07, "logits/chosen": -3.125, "logits/rejected": -2.875, "logps/chosen": -704.0, "logps/rejected": -1160.0, "loss": 0.1483, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.53125, "rewards/margins": 4.59375, "rewards/rejected": -10.125, "step": 8130 }, { "epoch": 0.5875983541471161, "grad_norm": 9.428346584688365, "learning_rate": 2.1730339139266368e-07, "logits/chosen": -3.109375, "logits/rejected": -2.75, "logps/chosen": -740.0, "logps/rejected": -1176.0, "loss": 0.1715, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.78125, "rewards/margins": 4.46875, "rewards/rejected": -10.25, "step": 8140 }, { "epoch": 0.5883202194470512, "grad_norm": 9.348567817555846, "learning_rate": 2.1667892537014664e-07, "logits/chosen": -2.96875, "logits/rejected": -2.625, "logps/chosen": -736.0, "logps/rejected": -1128.0, "loss": 0.1673, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -5.65625, "rewards/margins": 4.03125, "rewards/rejected": -9.6875, "step": 8150 }, { "epoch": 0.5890420847469862, "grad_norm": 9.578462386462538, "learning_rate": 2.1605467093736534e-07, "logits/chosen": -3.03125, "logits/rejected": -2.65625, "logps/chosen": -704.0, "logps/rejected": -1144.0, "loss": 0.1611, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -5.46875, "rewards/margins": 4.375, "rewards/rejected": -9.875, "step": 8160 }, { "epoch": 0.5897639500469213, "grad_norm": 7.084598817360508, "learning_rate": 2.1543063205835232e-07, "logits/chosen": -2.984375, "logits/rejected": -2.734375, "logps/chosen": -704.0, "logps/rejected": -1160.0, "loss": 0.1716, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.46875, "rewards/margins": 4.6875, "rewards/rejected": -10.125, "step": 8170 }, { "epoch": 0.5904858153468563, "grad_norm": 10.096964364918204, "learning_rate": 2.1480681269577156e-07, "logits/chosen": -2.8125, "logits/rejected": -2.59375, "logps/chosen": -756.0, "logps/rejected": -1128.0, "loss": 0.1439, "rewards/accuracies": 0.9375, "rewards/chosen": -5.71875, "rewards/margins": 3.984375, "rewards/rejected": -9.6875, "step": 8180 }, { "epoch": 0.5912076806467913, "grad_norm": 13.036565026698682, "learning_rate": 2.141832168108932e-07, "logits/chosen": -3.078125, "logits/rejected": -2.765625, "logps/chosen": -724.0, "logps/rejected": -1128.0, "loss": 0.1695, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.5625, "rewards/margins": 4.1875, "rewards/rejected": -9.75, "step": 8190 }, { "epoch": 0.5919295459467263, "grad_norm": 10.503733261465367, "learning_rate": 2.1355984836356805e-07, "logits/chosen": -2.96875, "logits/rejected": -2.5625, "logps/chosen": -712.0, "logps/rejected": -1128.0, "loss": 0.1803, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.625, "rewards/margins": 4.15625, "rewards/rejected": -9.8125, "step": 8200 }, { "epoch": 0.5926514112466613, "grad_norm": 8.837085032744609, "learning_rate": 2.1293671131220277e-07, "logits/chosen": -2.890625, "logits/rejected": -2.53125, "logps/chosen": -720.0, "logps/rejected": -1184.0, "loss": 0.1517, "rewards/accuracies": 0.9375, "rewards/chosen": -5.71875, "rewards/margins": 4.375, "rewards/rejected": -10.125, "step": 8210 }, { "epoch": 0.5933732765465964, "grad_norm": 13.492509568178333, "learning_rate": 2.123138096137349e-07, "logits/chosen": -2.90625, "logits/rejected": -2.5625, "logps/chosen": -748.0, "logps/rejected": -1168.0, "loss": 0.1718, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.90625, "rewards/margins": 4.0625, "rewards/rejected": -9.9375, "step": 8220 }, { "epoch": 0.5940951418465314, "grad_norm": 4.422649076334775, "learning_rate": 2.1169114722360708e-07, "logits/chosen": -2.796875, "logits/rejected": -2.46875, "logps/chosen": -716.0, "logps/rejected": -1208.0, "loss": 0.1322, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -5.5, "rewards/margins": 5.0, "rewards/rejected": -10.5, "step": 8230 }, { "epoch": 0.5948170071464665, "grad_norm": 8.207509821314797, "learning_rate": 2.1106872809574266e-07, "logits/chosen": -2.875, "logits/rejected": -2.671875, "logps/chosen": -708.0, "logps/rejected": -1120.0, "loss": 0.1659, "rewards/accuracies": 0.9375, "rewards/chosen": -5.46875, "rewards/margins": 4.375, "rewards/rejected": -9.875, "step": 8240 }, { "epoch": 0.5955388724464015, "grad_norm": 11.51646939268645, "learning_rate": 2.1044655618251994e-07, "logits/chosen": -2.953125, "logits/rejected": -2.640625, "logps/chosen": -768.0, "logps/rejected": -1168.0, "loss": 0.1643, "rewards/accuracies": 0.9375, "rewards/chosen": -5.65625, "rewards/margins": 4.46875, "rewards/rejected": -10.125, "step": 8250 }, { "epoch": 0.5962607377463366, "grad_norm": 8.81738149975298, "learning_rate": 2.098246354347477e-07, "logits/chosen": -2.8125, "logits/rejected": -2.65625, "logps/chosen": -704.0, "logps/rejected": -1088.0, "loss": 0.1499, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.375, "rewards/margins": 4.09375, "rewards/rejected": -9.5, "step": 8260 }, { "epoch": 0.5969826030462716, "grad_norm": 9.880728738377933, "learning_rate": 2.0920296980163975e-07, "logits/chosen": -2.828125, "logits/rejected": -2.5, "logps/chosen": -672.0, "logps/rejected": -1112.0, "loss": 0.1828, "rewards/accuracies": 0.9375, "rewards/chosen": -5.09375, "rewards/margins": 4.3125, "rewards/rejected": -9.375, "step": 8270 }, { "epoch": 0.5977044683462066, "grad_norm": 12.130445254705615, "learning_rate": 2.0858156323078986e-07, "logits/chosen": -2.875, "logits/rejected": -2.546875, "logps/chosen": -696.0, "logps/rejected": -1104.0, "loss": 0.1695, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.4375, "rewards/margins": 4.03125, "rewards/rejected": -9.5, "step": 8280 }, { "epoch": 0.5984263336461416, "grad_norm": 9.18646238410699, "learning_rate": 2.0796041966814658e-07, "logits/chosen": -2.9375, "logits/rejected": -2.671875, "logps/chosen": -740.0, "logps/rejected": -1120.0, "loss": 0.1595, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.5625, "rewards/margins": 3.90625, "rewards/rejected": -9.5, "step": 8290 }, { "epoch": 0.5991481989460766, "grad_norm": 7.4415035510148595, "learning_rate": 2.0733954305798884e-07, "logits/chosen": -2.890625, "logits/rejected": -2.5, "logps/chosen": -688.0, "logps/rejected": -1088.0, "loss": 0.1668, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -5.3125, "rewards/margins": 4.0625, "rewards/rejected": -9.375, "step": 8300 }, { "epoch": 0.5998700642460117, "grad_norm": 9.921182858419193, "learning_rate": 2.0671893734289984e-07, "logits/chosen": -2.828125, "logits/rejected": -2.609375, "logps/chosen": -680.0, "logps/rejected": -1080.0, "loss": 0.1608, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.25, "rewards/margins": 4.15625, "rewards/rejected": -9.4375, "step": 8310 }, { "epoch": 0.6005919295459468, "grad_norm": 6.738345944941375, "learning_rate": 2.0609860646374305e-07, "logits/chosen": -2.921875, "logits/rejected": -2.625, "logps/chosen": -732.0, "logps/rejected": -1096.0, "loss": 0.1682, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -5.5, "rewards/margins": 3.859375, "rewards/rejected": -9.375, "step": 8320 }, { "epoch": 0.6013137948458818, "grad_norm": 9.581111671762294, "learning_rate": 2.054785543596363e-07, "logits/chosen": -2.828125, "logits/rejected": -2.59375, "logps/chosen": -660.0, "logps/rejected": -1104.0, "loss": 0.174, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.1875, "rewards/margins": 4.25, "rewards/rejected": -9.4375, "step": 8330 }, { "epoch": 0.6020356601458168, "grad_norm": 9.266451111611559, "learning_rate": 2.0485878496792758e-07, "logits/chosen": -3.0, "logits/rejected": -2.671875, "logps/chosen": -684.0, "logps/rejected": -1088.0, "loss": 0.1594, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.28125, "rewards/margins": 3.96875, "rewards/rejected": -9.25, "step": 8340 }, { "epoch": 0.6027575254457518, "grad_norm": 6.924514229924403, "learning_rate": 2.042393022241695e-07, "logits/chosen": -2.71875, "logits/rejected": -2.46875, "logps/chosen": -692.0, "logps/rejected": -1080.0, "loss": 0.1331, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.375, "rewards/margins": 3.8125, "rewards/rejected": -9.1875, "step": 8350 }, { "epoch": 0.6034793907456869, "grad_norm": 11.878033012527993, "learning_rate": 2.0362011006209429e-07, "logits/chosen": -2.90625, "logits/rejected": -2.515625, "logps/chosen": -692.0, "logps/rejected": -1136.0, "loss": 0.168, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.375, "rewards/margins": 4.4375, "rewards/rejected": -9.8125, "step": 8360 }, { "epoch": 0.6042012560456219, "grad_norm": 6.456356558581018, "learning_rate": 2.0300121241358925e-07, "logits/chosen": -2.859375, "logits/rejected": -2.546875, "logps/chosen": -720.0, "logps/rejected": -1128.0, "loss": 0.1412, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.59375, "rewards/margins": 4.25, "rewards/rejected": -9.8125, "step": 8370 }, { "epoch": 0.6049231213455569, "grad_norm": 6.2766000485447595, "learning_rate": 2.023826132086714e-07, "logits/chosen": -2.828125, "logits/rejected": -2.5, "logps/chosen": -732.0, "logps/rejected": -1120.0, "loss": 0.1705, "rewards/accuracies": 0.9375, "rewards/chosen": -5.65625, "rewards/margins": 4.0, "rewards/rejected": -9.625, "step": 8380 }, { "epoch": 0.6056449866454919, "grad_norm": 10.010107774455438, "learning_rate": 2.0176431637546243e-07, "logits/chosen": -2.921875, "logits/rejected": -2.78125, "logps/chosen": -712.0, "logps/rejected": -1112.0, "loss": 0.1654, "rewards/accuracies": 0.96875, "rewards/chosen": -5.34375, "rewards/margins": 4.375, "rewards/rejected": -9.75, "step": 8390 }, { "epoch": 0.6063668519454269, "grad_norm": 6.93155516769275, "learning_rate": 2.0114632584016444e-07, "logits/chosen": -2.921875, "logits/rejected": -2.6875, "logps/chosen": -756.0, "logps/rejected": -1160.0, "loss": 0.1442, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.96875, "rewards/margins": 4.09375, "rewards/rejected": -10.0625, "step": 8400 }, { "epoch": 0.6070887172453621, "grad_norm": 9.44671796286649, "learning_rate": 2.0052864552703392e-07, "logits/chosen": -2.953125, "logits/rejected": -2.609375, "logps/chosen": -720.0, "logps/rejected": -1184.0, "loss": 0.1738, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.625, "rewards/margins": 4.375, "rewards/rejected": -10.0, "step": 8410 }, { "epoch": 0.6078105825452971, "grad_norm": 10.256129872630872, "learning_rate": 1.9991127935835796e-07, "logits/chosen": -2.875, "logits/rejected": -2.609375, "logps/chosen": -652.0, "logps/rejected": -1096.0, "loss": 0.1439, "rewards/accuracies": 0.981249988079071, "rewards/chosen": -5.03125, "rewards/margins": 4.46875, "rewards/rejected": -9.5, "step": 8420 }, { "epoch": 0.6085324478452321, "grad_norm": 10.112281066079031, "learning_rate": 1.9929423125442866e-07, "logits/chosen": -2.84375, "logits/rejected": -2.59375, "logps/chosen": -708.0, "logps/rejected": -1112.0, "loss": 0.1722, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.5, "rewards/margins": 4.03125, "rewards/rejected": -9.5625, "step": 8430 }, { "epoch": 0.6092543131451671, "grad_norm": 5.989996318215951, "learning_rate": 1.9867750513351813e-07, "logits/chosen": -2.84375, "logits/rejected": -2.53125, "logps/chosen": -764.0, "logps/rejected": -1136.0, "loss": 0.1405, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.9375, "rewards/margins": 3.859375, "rewards/rejected": -9.8125, "step": 8440 }, { "epoch": 0.6099761784451021, "grad_norm": 7.127345044430176, "learning_rate": 1.9806110491185434e-07, "logits/chosen": -2.765625, "logits/rejected": -2.53125, "logps/chosen": -760.0, "logps/rejected": -1168.0, "loss": 0.1401, "rewards/accuracies": 0.9375, "rewards/chosen": -5.875, "rewards/margins": 4.0625, "rewards/rejected": -9.9375, "step": 8450 }, { "epoch": 0.6106980437450372, "grad_norm": 8.882033575289205, "learning_rate": 1.9744503450359555e-07, "logits/chosen": -2.828125, "logits/rejected": -2.515625, "logps/chosen": -736.0, "logps/rejected": -1136.0, "loss": 0.1643, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.625, "rewards/margins": 4.125, "rewards/rejected": -9.75, "step": 8460 }, { "epoch": 0.6114199090449722, "grad_norm": 11.636675089992194, "learning_rate": 1.968292978208055e-07, "logits/chosen": -2.875, "logits/rejected": -2.625, "logps/chosen": -736.0, "logps/rejected": -1144.0, "loss": 0.1555, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.6875, "rewards/margins": 4.3125, "rewards/rejected": -10.0, "step": 8470 }, { "epoch": 0.6121417743449072, "grad_norm": 4.708987187458577, "learning_rate": 1.9621389877342926e-07, "logits/chosen": -2.875, "logits/rejected": -2.625, "logps/chosen": -692.0, "logps/rejected": -1152.0, "loss": 0.1635, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -5.40625, "rewards/margins": 4.59375, "rewards/rejected": -10.0, "step": 8480 }, { "epoch": 0.6128636396448423, "grad_norm": 8.691036530455966, "learning_rate": 1.9559884126926742e-07, "logits/chosen": -2.84375, "logits/rejected": -2.609375, "logps/chosen": -748.0, "logps/rejected": -1120.0, "loss": 0.1662, "rewards/accuracies": 0.8812500238418579, "rewards/chosen": -5.84375, "rewards/margins": 3.890625, "rewards/rejected": -9.75, "step": 8490 }, { "epoch": 0.6135855049447773, "grad_norm": 7.033771928824113, "learning_rate": 1.9498412921395196e-07, "logits/chosen": -2.859375, "logits/rejected": -2.515625, "logps/chosen": -704.0, "logps/rejected": -1120.0, "loss": 0.1484, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -5.4375, "rewards/margins": 4.1875, "rewards/rejected": -9.625, "step": 8500 }, { "epoch": 0.6143073702447124, "grad_norm": 6.420805831736498, "learning_rate": 1.9436976651092142e-07, "logits/chosen": -2.90625, "logits/rejected": -2.5, "logps/chosen": -644.0, "logps/rejected": -1112.0, "loss": 0.1517, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -4.90625, "rewards/margins": 4.5625, "rewards/rejected": -9.5, "step": 8510 }, { "epoch": 0.6150292355446474, "grad_norm": 9.804155572476585, "learning_rate": 1.9375575706139557e-07, "logits/chosen": -2.84375, "logits/rejected": -2.65625, "logps/chosen": -684.0, "logps/rejected": -1080.0, "loss": 0.168, "rewards/accuracies": 0.90625, "rewards/chosen": -5.15625, "rewards/margins": 4.25, "rewards/rejected": -9.375, "step": 8520 }, { "epoch": 0.6157511008445824, "grad_norm": 8.402725478167426, "learning_rate": 1.931421047643513e-07, "logits/chosen": -3.03125, "logits/rejected": -2.875, "logps/chosen": -704.0, "logps/rejected": -1096.0, "loss": 0.1659, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.3125, "rewards/margins": 4.15625, "rewards/rejected": -9.4375, "step": 8530 }, { "epoch": 0.6164729661445174, "grad_norm": 7.928649293353565, "learning_rate": 1.9252881351649764e-07, "logits/chosen": -2.96875, "logits/rejected": -2.6875, "logps/chosen": -656.0, "logps/rejected": -1120.0, "loss": 0.1643, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -4.9375, "rewards/margins": 4.71875, "rewards/rejected": -9.6875, "step": 8540 }, { "epoch": 0.6171948314444524, "grad_norm": 10.584642277815288, "learning_rate": 1.919158872122505e-07, "logits/chosen": -3.015625, "logits/rejected": -2.609375, "logps/chosen": -656.0, "logps/rejected": -1088.0, "loss": 0.1709, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.0, "rewards/margins": 4.34375, "rewards/rejected": -9.375, "step": 8550 }, { "epoch": 0.6179166967443875, "grad_norm": 5.528300128432007, "learning_rate": 1.9130332974370888e-07, "logits/chosen": -2.953125, "logits/rejected": -2.59375, "logps/chosen": -688.0, "logps/rejected": -1112.0, "loss": 0.1619, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.4375, "rewards/margins": 4.25, "rewards/rejected": -9.6875, "step": 8560 }, { "epoch": 0.6186385620443225, "grad_norm": 8.381790511594774, "learning_rate": 1.9069114500062944e-07, "logits/chosen": -2.859375, "logits/rejected": -2.625, "logps/chosen": -700.0, "logps/rejected": -1112.0, "loss": 0.1561, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -5.34375, "rewards/margins": 4.1875, "rewards/rejected": -9.5625, "step": 8570 }, { "epoch": 0.6193604273442576, "grad_norm": 7.672005385585843, "learning_rate": 1.9007933687040192e-07, "logits/chosen": -2.828125, "logits/rejected": -2.546875, "logps/chosen": -704.0, "logps/rejected": -1104.0, "loss": 0.1556, "rewards/accuracies": 0.9375, "rewards/chosen": -5.5625, "rewards/margins": 4.09375, "rewards/rejected": -9.6875, "step": 8580 }, { "epoch": 0.6200822926441926, "grad_norm": 7.6497315518223505, "learning_rate": 1.8946790923802491e-07, "logits/chosen": -2.984375, "logits/rejected": -2.6875, "logps/chosen": -728.0, "logps/rejected": -1160.0, "loss": 0.1619, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.75, "rewards/margins": 4.375, "rewards/rejected": -10.125, "step": 8590 }, { "epoch": 0.6208041579441276, "grad_norm": 8.83669969757212, "learning_rate": 1.8885686598608044e-07, "logits/chosen": -2.875, "logits/rejected": -2.5625, "logps/chosen": -732.0, "logps/rejected": -1160.0, "loss": 0.1639, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.75, "rewards/margins": 4.3125, "rewards/rejected": -10.0625, "step": 8600 }, { "epoch": 0.6215260232440627, "grad_norm": 11.726451803340803, "learning_rate": 1.8824621099470986e-07, "logits/chosen": -2.90625, "logits/rejected": -2.65625, "logps/chosen": -744.0, "logps/rejected": -1152.0, "loss": 0.1516, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.78125, "rewards/margins": 4.1875, "rewards/rejected": -9.9375, "step": 8610 }, { "epoch": 0.6222478885439977, "grad_norm": 6.926635938541544, "learning_rate": 1.8763594814158926e-07, "logits/chosen": -2.96875, "logits/rejected": -2.609375, "logps/chosen": -724.0, "logps/rejected": -1128.0, "loss": 0.1712, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -5.5625, "rewards/margins": 4.1875, "rewards/rejected": -9.75, "step": 8620 }, { "epoch": 0.6229697538439327, "grad_norm": 29.047689387473163, "learning_rate": 1.8702608130190427e-07, "logits/chosen": -2.828125, "logits/rejected": -2.578125, "logps/chosen": -728.0, "logps/rejected": -1072.0, "loss": 0.1711, "rewards/accuracies": 0.8812500238418579, "rewards/chosen": -5.71875, "rewards/margins": 3.609375, "rewards/rejected": -9.3125, "step": 8630 }, { "epoch": 0.6236916191438677, "grad_norm": 12.046850711595459, "learning_rate": 1.8641661434832615e-07, "logits/chosen": -2.921875, "logits/rejected": -2.5, "logps/chosen": -752.0, "logps/rejected": -1144.0, "loss": 0.1552, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.8125, "rewards/margins": 4.09375, "rewards/rejected": -9.9375, "step": 8640 }, { "epoch": 0.6244134844438027, "grad_norm": 13.389050315360532, "learning_rate": 1.858075511509865e-07, "logits/chosen": -2.828125, "logits/rejected": -2.6875, "logps/chosen": -732.0, "logps/rejected": -1112.0, "loss": 0.1718, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.71875, "rewards/margins": 3.96875, "rewards/rejected": -9.6875, "step": 8650 }, { "epoch": 0.6251353497437379, "grad_norm": 8.48405716596924, "learning_rate": 1.8519889557745355e-07, "logits/chosen": -2.890625, "logits/rejected": -2.578125, "logps/chosen": -732.0, "logps/rejected": -1136.0, "loss": 0.1627, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.75, "rewards/margins": 4.0625, "rewards/rejected": -9.8125, "step": 8660 }, { "epoch": 0.6258572150436729, "grad_norm": 7.718084904787592, "learning_rate": 1.8459065149270675e-07, "logits/chosen": -2.90625, "logits/rejected": -2.59375, "logps/chosen": -720.0, "logps/rejected": -1088.0, "loss": 0.204, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -5.5625, "rewards/margins": 3.875, "rewards/rejected": -9.4375, "step": 8670 }, { "epoch": 0.6265790803436079, "grad_norm": 8.645603679282008, "learning_rate": 1.8398282275911265e-07, "logits/chosen": -3.0, "logits/rejected": -2.625, "logps/chosen": -724.0, "logps/rejected": -1128.0, "loss": 0.1508, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.5, "rewards/margins": 4.21875, "rewards/rejected": -9.6875, "step": 8680 }, { "epoch": 0.6273009456435429, "grad_norm": 9.649146909089938, "learning_rate": 1.833754132364003e-07, "logits/chosen": -2.9375, "logits/rejected": -2.671875, "logps/chosen": -696.0, "logps/rejected": -1088.0, "loss": 0.1621, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.53125, "rewards/margins": 3.984375, "rewards/rejected": -9.5, "step": 8690 }, { "epoch": 0.6280228109434779, "grad_norm": 10.143836034702232, "learning_rate": 1.8276842678163694e-07, "logits/chosen": -2.84375, "logits/rejected": -2.59375, "logps/chosen": -716.0, "logps/rejected": -1144.0, "loss": 0.1694, "rewards/accuracies": 0.90625, "rewards/chosen": -5.625, "rewards/margins": 4.1875, "rewards/rejected": -9.8125, "step": 8700 }, { "epoch": 0.628744676243413, "grad_norm": 6.224441882099418, "learning_rate": 1.82161867249203e-07, "logits/chosen": -2.84375, "logits/rejected": -2.59375, "logps/chosen": -752.0, "logps/rejected": -1184.0, "loss": 0.1653, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.875, "rewards/margins": 4.28125, "rewards/rejected": -10.1875, "step": 8710 }, { "epoch": 0.629466541543348, "grad_norm": 10.818946600627243, "learning_rate": 1.8155573849076829e-07, "logits/chosen": -2.90625, "logits/rejected": -2.5625, "logps/chosen": -732.0, "logps/rejected": -1128.0, "loss": 0.1673, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.8125, "rewards/margins": 4.0625, "rewards/rejected": -9.875, "step": 8720 }, { "epoch": 0.630188406843283, "grad_norm": 8.600830363109214, "learning_rate": 1.8095004435526673e-07, "logits/chosen": -2.765625, "logits/rejected": -2.53125, "logps/chosen": -752.0, "logps/rejected": -1160.0, "loss": 0.1629, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.8125, "rewards/margins": 4.09375, "rewards/rejected": -9.9375, "step": 8730 }, { "epoch": 0.630910272143218, "grad_norm": 7.278694825397051, "learning_rate": 1.8034478868887293e-07, "logits/chosen": -2.828125, "logits/rejected": -2.59375, "logps/chosen": -752.0, "logps/rejected": -1136.0, "loss": 0.1698, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.875, "rewards/margins": 4.0625, "rewards/rejected": -9.9375, "step": 8740 }, { "epoch": 0.631632137443153, "grad_norm": 10.061499794489972, "learning_rate": 1.7973997533497684e-07, "logits/chosen": -2.890625, "logits/rejected": -2.5625, "logps/chosen": -728.0, "logps/rejected": -1128.0, "loss": 0.1721, "rewards/accuracies": 0.90625, "rewards/chosen": -5.65625, "rewards/margins": 4.15625, "rewards/rejected": -9.8125, "step": 8750 }, { "epoch": 0.6323540027430882, "grad_norm": 12.377386224781029, "learning_rate": 1.791356081341597e-07, "logits/chosen": -2.828125, "logits/rejected": -2.59375, "logps/chosen": -748.0, "logps/rejected": -1136.0, "loss": 0.152, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.75, "rewards/margins": 4.0, "rewards/rejected": -9.75, "step": 8760 }, { "epoch": 0.6330758680430232, "grad_norm": 7.666515466883803, "learning_rate": 1.7853169092416992e-07, "logits/chosen": -2.875, "logits/rejected": -2.671875, "logps/chosen": -724.0, "logps/rejected": -1128.0, "loss": 0.1426, "rewards/accuracies": 0.9375, "rewards/chosen": -5.71875, "rewards/margins": 4.15625, "rewards/rejected": -9.875, "step": 8770 }, { "epoch": 0.6337977333429582, "grad_norm": 9.2022093037141, "learning_rate": 1.779282275398983e-07, "logits/chosen": -2.90625, "logits/rejected": -2.640625, "logps/chosen": -780.0, "logps/rejected": -1168.0, "loss": 0.1693, "rewards/accuracies": 0.893750011920929, "rewards/chosen": -6.0625, "rewards/margins": 3.921875, "rewards/rejected": -9.9375, "step": 8780 }, { "epoch": 0.6345195986428932, "grad_norm": 11.875630627682433, "learning_rate": 1.773252218133537e-07, "logits/chosen": -2.8125, "logits/rejected": -2.53125, "logps/chosen": -760.0, "logps/rejected": -1184.0, "loss": 0.1505, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -5.875, "rewards/margins": 4.3125, "rewards/rejected": -10.1875, "step": 8790 }, { "epoch": 0.6352414639428283, "grad_norm": 12.286853044802243, "learning_rate": 1.7672267757363917e-07, "logits/chosen": -2.9375, "logits/rejected": -2.75, "logps/chosen": -772.0, "logps/rejected": -1128.0, "loss": 0.1767, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -6.21875, "rewards/margins": 3.640625, "rewards/rejected": -9.875, "step": 8800 }, { "epoch": 0.6359633292427633, "grad_norm": 7.782715805579312, "learning_rate": 1.7612059864692696e-07, "logits/chosen": -2.890625, "logits/rejected": -2.671875, "logps/chosen": -736.0, "logps/rejected": -1136.0, "loss": 0.1434, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.75, "rewards/margins": 4.09375, "rewards/rejected": -9.875, "step": 8810 }, { "epoch": 0.6366851945426983, "grad_norm": 10.338787396379217, "learning_rate": 1.7551898885643478e-07, "logits/chosen": -2.890625, "logits/rejected": -2.546875, "logps/chosen": -712.0, "logps/rejected": -1160.0, "loss": 0.1478, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.59375, "rewards/margins": 4.5, "rewards/rejected": -10.0625, "step": 8820 }, { "epoch": 0.6374070598426334, "grad_norm": 8.641921016163051, "learning_rate": 1.749178520224014e-07, "logits/chosen": -2.984375, "logits/rejected": -2.625, "logps/chosen": -728.0, "logps/rejected": -1152.0, "loss": 0.1519, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.75, "rewards/margins": 4.34375, "rewards/rejected": -10.0625, "step": 8830 }, { "epoch": 0.6381289251425684, "grad_norm": 9.128585650717545, "learning_rate": 1.7431719196206186e-07, "logits/chosen": -2.90625, "logits/rejected": -2.6875, "logps/chosen": -728.0, "logps/rejected": -1136.0, "loss": 0.1636, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.8125, "rewards/margins": 4.1875, "rewards/rejected": -10.0, "step": 8840 }, { "epoch": 0.6388507904425035, "grad_norm": 11.694392580125832, "learning_rate": 1.7371701248962426e-07, "logits/chosen": -2.828125, "logits/rejected": -2.5625, "logps/chosen": -736.0, "logps/rejected": -1096.0, "loss": 0.1925, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -5.90625, "rewards/margins": 3.640625, "rewards/rejected": -9.5625, "step": 8850 }, { "epoch": 0.6395726557424385, "grad_norm": 8.29325313521127, "learning_rate": 1.7311731741624458e-07, "logits/chosen": -2.8125, "logits/rejected": -2.46875, "logps/chosen": -764.0, "logps/rejected": -1184.0, "loss": 0.15, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.875, "rewards/margins": 4.375, "rewards/rejected": -10.25, "step": 8860 }, { "epoch": 0.6402945210423735, "grad_norm": 8.814547322060793, "learning_rate": 1.7251811055000283e-07, "logits/chosen": -2.96875, "logits/rejected": -2.671875, "logps/chosen": -720.0, "logps/rejected": -1168.0, "loss": 0.1451, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -5.53125, "rewards/margins": 4.625, "rewards/rejected": -10.125, "step": 8870 }, { "epoch": 0.6410163863423085, "grad_norm": 9.320265993143382, "learning_rate": 1.7191939569587923e-07, "logits/chosen": -2.765625, "logits/rejected": -2.65625, "logps/chosen": -724.0, "logps/rejected": -1152.0, "loss": 0.13, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -5.625, "rewards/margins": 4.15625, "rewards/rejected": -9.75, "step": 8880 }, { "epoch": 0.6417382516422435, "grad_norm": 10.838220312842498, "learning_rate": 1.7132117665572932e-07, "logits/chosen": -3.0625, "logits/rejected": -2.671875, "logps/chosen": -736.0, "logps/rejected": -1144.0, "loss": 0.1639, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -5.46875, "rewards/margins": 4.21875, "rewards/rejected": -9.6875, "step": 8890 }, { "epoch": 0.6424601169421786, "grad_norm": 6.55136471958019, "learning_rate": 1.7072345722826035e-07, "logits/chosen": -3.0, "logits/rejected": -2.59375, "logps/chosen": -696.0, "logps/rejected": -1104.0, "loss": 0.1315, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.21875, "rewards/margins": 4.21875, "rewards/rejected": -9.4375, "step": 8900 }, { "epoch": 0.6431819822421136, "grad_norm": 8.66688500340224, "learning_rate": 1.701262412090072e-07, "logits/chosen": -3.03125, "logits/rejected": -2.796875, "logps/chosen": -696.0, "logps/rejected": -1112.0, "loss": 0.1654, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.4375, "rewards/margins": 4.1875, "rewards/rejected": -9.625, "step": 8910 }, { "epoch": 0.6439038475420487, "grad_norm": 9.629379415169119, "learning_rate": 1.6952953239030779e-07, "logits/chosen": -3.0, "logits/rejected": -2.734375, "logps/chosen": -720.0, "logps/rejected": -1160.0, "loss": 0.1416, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.46875, "rewards/margins": 4.65625, "rewards/rejected": -10.125, "step": 8920 }, { "epoch": 0.6446257128419837, "grad_norm": 12.098110662139495, "learning_rate": 1.6893333456127946e-07, "logits/chosen": -2.953125, "logits/rejected": -2.796875, "logps/chosen": -752.0, "logps/rejected": -1176.0, "loss": 0.1484, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.75, "rewards/margins": 4.375, "rewards/rejected": -10.125, "step": 8930 }, { "epoch": 0.6453475781419187, "grad_norm": 8.256462573405791, "learning_rate": 1.6833765150779484e-07, "logits/chosen": -3.0, "logits/rejected": -2.8125, "logps/chosen": -724.0, "logps/rejected": -1104.0, "loss": 0.1609, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.71875, "rewards/margins": 3.96875, "rewards/rejected": -9.6875, "step": 8940 }, { "epoch": 0.6460694434418538, "grad_norm": 11.239144635721424, "learning_rate": 1.677424870124575e-07, "logits/chosen": -3.0, "logits/rejected": -2.75, "logps/chosen": -688.0, "logps/rejected": -1096.0, "loss": 0.1665, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.3125, "rewards/margins": 4.0625, "rewards/rejected": -9.375, "step": 8950 }, { "epoch": 0.6467913087417888, "grad_norm": 8.418303487457777, "learning_rate": 1.671478448545784e-07, "logits/chosen": -2.96875, "logits/rejected": -2.765625, "logps/chosen": -708.0, "logps/rejected": -1128.0, "loss": 0.149, "rewards/accuracies": 0.9750000238418579, "rewards/chosen": -5.5, "rewards/margins": 4.15625, "rewards/rejected": -9.625, "step": 8960 }, { "epoch": 0.6475131740417238, "grad_norm": 9.492259339751383, "learning_rate": 1.665537288101514e-07, "logits/chosen": -2.9375, "logits/rejected": -2.625, "logps/chosen": -724.0, "logps/rejected": -1104.0, "loss": 0.1689, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.5625, "rewards/margins": 4.03125, "rewards/rejected": -9.625, "step": 8970 }, { "epoch": 0.6482350393416588, "grad_norm": 7.953989568068451, "learning_rate": 1.6596014265182957e-07, "logits/chosen": -2.9375, "logits/rejected": -2.65625, "logps/chosen": -732.0, "logps/rejected": -1128.0, "loss": 0.1683, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.78125, "rewards/margins": 4.09375, "rewards/rejected": -9.875, "step": 8980 }, { "epoch": 0.6489569046415938, "grad_norm": 7.299757937508117, "learning_rate": 1.6536709014890147e-07, "logits/chosen": -2.828125, "logits/rejected": -2.53125, "logps/chosen": -712.0, "logps/rejected": -1096.0, "loss": 0.1577, "rewards/accuracies": 0.9375, "rewards/chosen": -5.4375, "rewards/margins": 4.0625, "rewards/rejected": -9.5, "step": 8990 }, { "epoch": 0.649678769941529, "grad_norm": 9.426751785884438, "learning_rate": 1.6477457506726655e-07, "logits/chosen": -2.765625, "logits/rejected": -2.46875, "logps/chosen": -716.0, "logps/rejected": -1104.0, "loss": 0.1404, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -5.5, "rewards/margins": 3.90625, "rewards/rejected": -9.375, "step": 9000 }, { "epoch": 0.650400635241464, "grad_norm": 10.774886673375532, "learning_rate": 1.641826011694119e-07, "logits/chosen": -2.828125, "logits/rejected": -2.75, "logps/chosen": -736.0, "logps/rejected": -1120.0, "loss": 0.1533, "rewards/accuracies": 0.887499988079071, "rewards/chosen": -5.5625, "rewards/margins": 3.921875, "rewards/rejected": -9.5, "step": 9010 }, { "epoch": 0.651122500541399, "grad_norm": 9.624000604333325, "learning_rate": 1.6359117221438784e-07, "logits/chosen": -2.890625, "logits/rejected": -2.5625, "logps/chosen": -728.0, "logps/rejected": -1144.0, "loss": 0.1508, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -5.59375, "rewards/margins": 4.34375, "rewards/rejected": -9.9375, "step": 9020 }, { "epoch": 0.651844365841334, "grad_norm": 9.17261641216877, "learning_rate": 1.6300029195778453e-07, "logits/chosen": -2.921875, "logits/rejected": -2.546875, "logps/chosen": -672.0, "logps/rejected": -1112.0, "loss": 0.1655, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.25, "rewards/margins": 4.40625, "rewards/rejected": -9.625, "step": 9030 }, { "epoch": 0.652566231141269, "grad_norm": 10.974103824549372, "learning_rate": 1.624099641517078e-07, "logits/chosen": -2.9375, "logits/rejected": -2.6875, "logps/chosen": -692.0, "logps/rejected": -1120.0, "loss": 0.1616, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.25, "rewards/margins": 4.3125, "rewards/rejected": -9.5625, "step": 9040 }, { "epoch": 0.6532880964412041, "grad_norm": 6.917901057511971, "learning_rate": 1.6182019254475514e-07, "logits/chosen": -3.03125, "logits/rejected": -2.5625, "logps/chosen": -684.0, "logps/rejected": -1136.0, "loss": 0.1515, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -5.34375, "rewards/margins": 4.40625, "rewards/rejected": -9.75, "step": 9050 }, { "epoch": 0.6540099617411391, "grad_norm": 10.04014608485764, "learning_rate": 1.6123098088199267e-07, "logits/chosen": -3.03125, "logits/rejected": -2.640625, "logps/chosen": -728.0, "logps/rejected": -1144.0, "loss": 0.1476, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.75, "rewards/margins": 4.28125, "rewards/rejected": -10.0, "step": 9060 }, { "epoch": 0.6547318270410741, "grad_norm": 11.307618522526226, "learning_rate": 1.6064233290493048e-07, "logits/chosen": -3.09375, "logits/rejected": -2.640625, "logps/chosen": -744.0, "logps/rejected": -1160.0, "loss": 0.1568, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.84375, "rewards/margins": 4.375, "rewards/rejected": -10.1875, "step": 9070 }, { "epoch": 0.6554536923410091, "grad_norm": 11.567312788735324, "learning_rate": 1.600542523514992e-07, "logits/chosen": -2.953125, "logits/rejected": -2.65625, "logps/chosen": -736.0, "logps/rejected": -1168.0, "loss": 0.1481, "rewards/accuracies": 0.9375, "rewards/chosen": -5.65625, "rewards/margins": 4.34375, "rewards/rejected": -10.0, "step": 9080 }, { "epoch": 0.6561755576409442, "grad_norm": 6.469353343465349, "learning_rate": 1.5946674295602668e-07, "logits/chosen": -2.9375, "logits/rejected": -2.640625, "logps/chosen": -688.0, "logps/rejected": -1096.0, "loss": 0.1644, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.40625, "rewards/margins": 4.21875, "rewards/rejected": -9.625, "step": 9090 }, { "epoch": 0.6568974229408793, "grad_norm": 9.939174768893757, "learning_rate": 1.5887980844921338e-07, "logits/chosen": -2.90625, "logits/rejected": -2.59375, "logps/chosen": -708.0, "logps/rejected": -1104.0, "loss": 0.1646, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.5, "rewards/margins": 4.125, "rewards/rejected": -9.625, "step": 9100 }, { "epoch": 0.6576192882408143, "grad_norm": 10.710746815227962, "learning_rate": 1.5829345255810966e-07, "logits/chosen": -2.921875, "logits/rejected": -2.59375, "logps/chosen": -704.0, "logps/rejected": -1096.0, "loss": 0.1553, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -5.375, "rewards/margins": 4.15625, "rewards/rejected": -9.5, "step": 9110 }, { "epoch": 0.6583411535407493, "grad_norm": 9.589016893008033, "learning_rate": 1.5770767900609144e-07, "logits/chosen": -2.953125, "logits/rejected": -2.640625, "logps/chosen": -696.0, "logps/rejected": -1120.0, "loss": 0.1403, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -5.25, "rewards/margins": 4.53125, "rewards/rejected": -9.75, "step": 9120 }, { "epoch": 0.6590630188406843, "grad_norm": 10.535090311502815, "learning_rate": 1.5712249151283674e-07, "logits/chosen": -3.0, "logits/rejected": -2.65625, "logps/chosen": -672.0, "logps/rejected": -1120.0, "loss": 0.1554, "rewards/accuracies": 0.96875, "rewards/chosen": -5.21875, "rewards/margins": 4.46875, "rewards/rejected": -9.6875, "step": 9130 }, { "epoch": 0.6597848841406193, "grad_norm": 11.07484592479438, "learning_rate": 1.565378937943022e-07, "logits/chosen": -3.109375, "logits/rejected": -2.875, "logps/chosen": -720.0, "logps/rejected": -1104.0, "loss": 0.1606, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.5, "rewards/margins": 4.125, "rewards/rejected": -9.625, "step": 9140 }, { "epoch": 0.6605067494405544, "grad_norm": 8.804459530019093, "learning_rate": 1.559538895626994e-07, "logits/chosen": -3.0, "logits/rejected": -2.640625, "logps/chosen": -720.0, "logps/rejected": -1128.0, "loss": 0.163, "rewards/accuracies": 0.9375, "rewards/chosen": -5.625, "rewards/margins": 4.21875, "rewards/rejected": -9.8125, "step": 9150 }, { "epoch": 0.6612286147404894, "grad_norm": 9.869851207701721, "learning_rate": 1.5537048252647102e-07, "logits/chosen": -2.96875, "logits/rejected": -2.703125, "logps/chosen": -728.0, "logps/rejected": -1136.0, "loss": 0.1629, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.6875, "rewards/margins": 4.28125, "rewards/rejected": -9.9375, "step": 9160 }, { "epoch": 0.6619504800404244, "grad_norm": 7.227577491074705, "learning_rate": 1.547876763902679e-07, "logits/chosen": -2.984375, "logits/rejected": -2.703125, "logps/chosen": -732.0, "logps/rejected": -1152.0, "loss": 0.1604, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.5625, "rewards/margins": 4.4375, "rewards/rejected": -10.0, "step": 9170 }, { "epoch": 0.6626723453403595, "grad_norm": 8.512681174359171, "learning_rate": 1.5420547485492483e-07, "logits/chosen": -2.875, "logits/rejected": -2.546875, "logps/chosen": -732.0, "logps/rejected": -1176.0, "loss": 0.1477, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.625, "rewards/margins": 4.4375, "rewards/rejected": -10.0625, "step": 9180 }, { "epoch": 0.6633942106402945, "grad_norm": 6.940912396524942, "learning_rate": 1.5362388161743743e-07, "logits/chosen": -3.078125, "logits/rejected": -2.65625, "logps/chosen": -728.0, "logps/rejected": -1152.0, "loss": 0.1549, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -5.625, "rewards/margins": 4.34375, "rewards/rejected": -10.0, "step": 9190 }, { "epoch": 0.6641160759402296, "grad_norm": 7.482638973278819, "learning_rate": 1.5304290037093887e-07, "logits/chosen": -2.96875, "logits/rejected": -2.75, "logps/chosen": -732.0, "logps/rejected": -1128.0, "loss": 0.1642, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.625, "rewards/margins": 4.0625, "rewards/rejected": -9.6875, "step": 9200 }, { "epoch": 0.6648379412401646, "grad_norm": 9.239067837458254, "learning_rate": 1.524625348046758e-07, "logits/chosen": -3.078125, "logits/rejected": -2.75, "logps/chosen": -708.0, "logps/rejected": -1136.0, "loss": 0.1324, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.53125, "rewards/margins": 4.3125, "rewards/rejected": -9.875, "step": 9210 }, { "epoch": 0.6655598065400996, "grad_norm": 10.312943276531238, "learning_rate": 1.5188278860398543e-07, "logits/chosen": -3.109375, "logits/rejected": -2.75, "logps/chosen": -736.0, "logps/rejected": -1200.0, "loss": 0.1548, "rewards/accuracies": 0.9375, "rewards/chosen": -5.5625, "rewards/margins": 4.8125, "rewards/rejected": -10.375, "step": 9220 }, { "epoch": 0.6662816718400346, "grad_norm": 12.377500015344213, "learning_rate": 1.5130366545027215e-07, "logits/chosen": -3.0625, "logits/rejected": -2.609375, "logps/chosen": -736.0, "logps/rejected": -1184.0, "loss": 0.1485, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -5.53125, "rewards/margins": 4.46875, "rewards/rejected": -10.0, "step": 9230 }, { "epoch": 0.6670035371399696, "grad_norm": 11.437994745400522, "learning_rate": 1.507251690209837e-07, "logits/chosen": -3.15625, "logits/rejected": -2.703125, "logps/chosen": -708.0, "logps/rejected": -1120.0, "loss": 0.1722, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.375, "rewards/margins": 4.1875, "rewards/rejected": -9.5625, "step": 9240 }, { "epoch": 0.6677254024399047, "grad_norm": 9.227052828667116, "learning_rate": 1.5014730298958834e-07, "logits/chosen": -2.96875, "logits/rejected": -2.6875, "logps/chosen": -688.0, "logps/rejected": -1088.0, "loss": 0.1733, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.1875, "rewards/margins": 4.28125, "rewards/rejected": -9.4375, "step": 9250 }, { "epoch": 0.6684472677398398, "grad_norm": 11.34701390652657, "learning_rate": 1.4957007102555101e-07, "logits/chosen": -2.953125, "logits/rejected": -2.703125, "logps/chosen": -712.0, "logps/rejected": -1128.0, "loss": 0.1509, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.40625, "rewards/margins": 4.28125, "rewards/rejected": -9.625, "step": 9260 }, { "epoch": 0.6691691330397748, "grad_norm": 10.840533844995983, "learning_rate": 1.489934767943106e-07, "logits/chosen": -3.046875, "logits/rejected": -2.6875, "logps/chosen": -700.0, "logps/rejected": -1136.0, "loss": 0.1507, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.5, "rewards/margins": 4.40625, "rewards/rejected": -9.9375, "step": 9270 }, { "epoch": 0.6698909983397098, "grad_norm": 5.005020117833695, "learning_rate": 1.484175239572563e-07, "logits/chosen": -3.03125, "logits/rejected": -2.734375, "logps/chosen": -732.0, "logps/rejected": -1184.0, "loss": 0.1538, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.65625, "rewards/margins": 4.53125, "rewards/rejected": -10.1875, "step": 9280 }, { "epoch": 0.6706128636396449, "grad_norm": 9.438942465976393, "learning_rate": 1.4784221617170427e-07, "logits/chosen": -3.078125, "logits/rejected": -2.6875, "logps/chosen": -672.0, "logps/rejected": -1112.0, "loss": 0.1544, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -5.21875, "rewards/margins": 4.46875, "rewards/rejected": -9.6875, "step": 9290 }, { "epoch": 0.6713347289395799, "grad_norm": 8.775509056317704, "learning_rate": 1.4726755709087467e-07, "logits/chosen": -3.046875, "logits/rejected": -2.5625, "logps/chosen": -708.0, "logps/rejected": -1128.0, "loss": 0.1568, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.5, "rewards/margins": 4.1875, "rewards/rejected": -9.6875, "step": 9300 }, { "epoch": 0.6720565942395149, "grad_norm": 12.815148122117906, "learning_rate": 1.466935503638686e-07, "logits/chosen": -2.984375, "logits/rejected": -2.59375, "logps/chosen": -708.0, "logps/rejected": -1168.0, "loss": 0.1535, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -5.375, "rewards/margins": 4.6875, "rewards/rejected": -10.0625, "step": 9310 }, { "epoch": 0.6727784595394499, "grad_norm": 6.322537492099079, "learning_rate": 1.4612019963564425e-07, "logits/chosen": -2.9375, "logits/rejected": -2.703125, "logps/chosen": -716.0, "logps/rejected": -1112.0, "loss": 0.1567, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -5.4375, "rewards/margins": 4.21875, "rewards/rejected": -9.625, "step": 9320 }, { "epoch": 0.6735003248393849, "grad_norm": 8.684754690608713, "learning_rate": 1.4554750854699454e-07, "logits/chosen": -2.921875, "logits/rejected": -2.734375, "logps/chosen": -684.0, "logps/rejected": -1064.0, "loss": 0.1582, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.25, "rewards/margins": 3.921875, "rewards/rejected": -9.1875, "step": 9330 }, { "epoch": 0.67422219013932, "grad_norm": 7.495450070953094, "learning_rate": 1.4497548073452353e-07, "logits/chosen": -3.0, "logits/rejected": -2.78125, "logps/chosen": -688.0, "logps/rejected": -1112.0, "loss": 0.1404, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -5.1875, "rewards/margins": 4.4375, "rewards/rejected": -9.625, "step": 9340 }, { "epoch": 0.6749440554392551, "grad_norm": 9.818417235804333, "learning_rate": 1.444041198306235e-07, "logits/chosen": -2.953125, "logits/rejected": -2.609375, "logps/chosen": -680.0, "logps/rejected": -1088.0, "loss": 0.1531, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.21875, "rewards/margins": 4.25, "rewards/rejected": -9.4375, "step": 9350 }, { "epoch": 0.6756659207391901, "grad_norm": 10.0125757389507, "learning_rate": 1.4383342946345178e-07, "logits/chosen": -2.96875, "logits/rejected": -2.65625, "logps/chosen": -724.0, "logps/rejected": -1184.0, "loss": 0.1533, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -5.4375, "rewards/margins": 4.78125, "rewards/rejected": -10.25, "step": 9360 }, { "epoch": 0.6763877860391251, "grad_norm": 10.056618279215506, "learning_rate": 1.432634132569079e-07, "logits/chosen": -3.0625, "logits/rejected": -2.71875, "logps/chosen": -744.0, "logps/rejected": -1176.0, "loss": 0.1534, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.84375, "rewards/margins": 4.3125, "rewards/rejected": -10.1875, "step": 9370 }, { "epoch": 0.6771096513390601, "grad_norm": 12.261509335918284, "learning_rate": 1.4269407483061025e-07, "logits/chosen": -2.921875, "logits/rejected": -2.625, "logps/chosen": -736.0, "logps/rejected": -1192.0, "loss": 0.1616, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.6875, "rewards/margins": 4.59375, "rewards/rejected": -10.25, "step": 9380 }, { "epoch": 0.6778315166389952, "grad_norm": 9.583901573024836, "learning_rate": 1.4212541779987358e-07, "logits/chosen": -2.921875, "logits/rejected": -2.6875, "logps/chosen": -736.0, "logps/rejected": -1136.0, "loss": 0.1808, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.625, "rewards/margins": 4.25, "rewards/rejected": -9.875, "step": 9390 }, { "epoch": 0.6785533819389302, "grad_norm": 7.602147425073978, "learning_rate": 1.415574457756853e-07, "logits/chosen": -2.984375, "logits/rejected": -2.625, "logps/chosen": -720.0, "logps/rejected": -1112.0, "loss": 0.1429, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.5625, "rewards/margins": 4.0625, "rewards/rejected": -9.625, "step": 9400 }, { "epoch": 0.6792752472388652, "grad_norm": 5.715088913700748, "learning_rate": 1.409901623646837e-07, "logits/chosen": -2.921875, "logits/rejected": -2.71875, "logps/chosen": -708.0, "logps/rejected": -1120.0, "loss": 0.1562, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -5.4375, "rewards/margins": 4.1875, "rewards/rejected": -9.625, "step": 9410 }, { "epoch": 0.6799971125388002, "grad_norm": 7.623897333532847, "learning_rate": 1.4042357116913365e-07, "logits/chosen": -2.828125, "logits/rejected": -2.53125, "logps/chosen": -676.0, "logps/rejected": -1112.0, "loss": 0.1444, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -5.25, "rewards/margins": 4.34375, "rewards/rejected": -9.625, "step": 9420 }, { "epoch": 0.6807189778387353, "grad_norm": 12.781776965070957, "learning_rate": 1.3985767578690474e-07, "logits/chosen": -3.0625, "logits/rejected": -2.640625, "logps/chosen": -716.0, "logps/rejected": -1088.0, "loss": 0.1763, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.59375, "rewards/margins": 3.828125, "rewards/rejected": -9.4375, "step": 9430 }, { "epoch": 0.6814408431386704, "grad_norm": 10.237854404923459, "learning_rate": 1.3929247981144845e-07, "logits/chosen": -3.046875, "logits/rejected": -2.625, "logps/chosen": -728.0, "logps/rejected": -1160.0, "loss": 0.1627, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.75, "rewards/margins": 4.40625, "rewards/rejected": -10.1875, "step": 9440 }, { "epoch": 0.6821627084386054, "grad_norm": 9.894822207763886, "learning_rate": 1.387279868317744e-07, "logits/chosen": -3.0, "logits/rejected": -2.609375, "logps/chosen": -744.0, "logps/rejected": -1224.0, "loss": 0.1477, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.78125, "rewards/margins": 4.6875, "rewards/rejected": -10.4375, "step": 9450 }, { "epoch": 0.6828845737385404, "grad_norm": 9.241271465537533, "learning_rate": 1.3816420043242843e-07, "logits/chosen": -3.078125, "logits/rejected": -2.703125, "logps/chosen": -708.0, "logps/rejected": -1136.0, "loss": 0.1488, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.625, "rewards/margins": 4.1875, "rewards/rejected": -9.8125, "step": 9460 }, { "epoch": 0.6836064390384754, "grad_norm": 10.237589705127691, "learning_rate": 1.3760112419346986e-07, "logits/chosen": -2.953125, "logits/rejected": -2.6875, "logps/chosen": -748.0, "logps/rejected": -1176.0, "loss": 0.156, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -5.8125, "rewards/margins": 4.4375, "rewards/rejected": -10.25, "step": 9470 }, { "epoch": 0.6843283043384104, "grad_norm": 10.725962046372151, "learning_rate": 1.3703876169044802e-07, "logits/chosen": -3.0625, "logits/rejected": -2.71875, "logps/chosen": -756.0, "logps/rejected": -1136.0, "loss": 0.1511, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -5.84375, "rewards/margins": 4.0625, "rewards/rejected": -9.875, "step": 9480 }, { "epoch": 0.6850501696383455, "grad_norm": 7.6917366331039325, "learning_rate": 1.364771164943802e-07, "logits/chosen": -2.921875, "logits/rejected": -2.6875, "logps/chosen": -720.0, "logps/rejected": -1120.0, "loss": 0.1659, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.71875, "rewards/margins": 4.03125, "rewards/rejected": -9.75, "step": 9490 }, { "epoch": 0.6857720349382805, "grad_norm": 8.728014646166761, "learning_rate": 1.3591619217172883e-07, "logits/chosen": -3.015625, "logits/rejected": -2.578125, "logps/chosen": -716.0, "logps/rejected": -1144.0, "loss": 0.1455, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -5.375, "rewards/margins": 4.5, "rewards/rejected": -9.875, "step": 9500 }, { "epoch": 0.6864939002382155, "grad_norm": 10.677477412212683, "learning_rate": 1.3535599228437867e-07, "logits/chosen": -3.0, "logits/rejected": -2.640625, "logps/chosen": -716.0, "logps/rejected": -1144.0, "loss": 0.1626, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.625, "rewards/margins": 4.34375, "rewards/rejected": -9.9375, "step": 9510 }, { "epoch": 0.6872157655381506, "grad_norm": 9.38419202809167, "learning_rate": 1.3479652038961432e-07, "logits/chosen": -2.984375, "logits/rejected": -2.609375, "logps/chosen": -748.0, "logps/rejected": -1128.0, "loss": 0.1679, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -5.71875, "rewards/margins": 4.0, "rewards/rejected": -9.75, "step": 9520 }, { "epoch": 0.6879376308380856, "grad_norm": 8.766505031785163, "learning_rate": 1.3423778004009762e-07, "logits/chosen": -3.0, "logits/rejected": -2.6875, "logps/chosen": -712.0, "logps/rejected": -1136.0, "loss": 0.1426, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.5, "rewards/margins": 4.40625, "rewards/rejected": -9.875, "step": 9530 }, { "epoch": 0.6886594961380207, "grad_norm": 7.070381554572682, "learning_rate": 1.3367977478384513e-07, "logits/chosen": -2.953125, "logits/rejected": -2.671875, "logps/chosen": -712.0, "logps/rejected": -1128.0, "loss": 0.1621, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.5, "rewards/margins": 4.28125, "rewards/rejected": -9.8125, "step": 9540 }, { "epoch": 0.6893813614379557, "grad_norm": 13.363793450146552, "learning_rate": 1.3312250816420542e-07, "logits/chosen": -3.015625, "logits/rejected": -2.671875, "logps/chosen": -700.0, "logps/rejected": -1128.0, "loss": 0.1678, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.375, "rewards/margins": 4.46875, "rewards/rejected": -9.875, "step": 9550 }, { "epoch": 0.6901032267378907, "grad_norm": 6.54534750827785, "learning_rate": 1.3256598371983686e-07, "logits/chosen": -2.96875, "logits/rejected": -2.5625, "logps/chosen": -716.0, "logps/rejected": -1176.0, "loss": 0.1394, "rewards/accuracies": 0.9375, "rewards/chosen": -5.59375, "rewards/margins": 4.5625, "rewards/rejected": -10.125, "step": 9560 }, { "epoch": 0.6908250920378257, "grad_norm": 8.065890871247143, "learning_rate": 1.320102049846849e-07, "logits/chosen": -2.984375, "logits/rejected": -2.703125, "logps/chosen": -712.0, "logps/rejected": -1144.0, "loss": 0.1447, "rewards/accuracies": 0.96875, "rewards/chosen": -5.4375, "rewards/margins": 4.5, "rewards/rejected": -9.9375, "step": 9570 }, { "epoch": 0.6915469573377607, "grad_norm": 8.464118508817007, "learning_rate": 1.314551754879595e-07, "logits/chosen": -3.140625, "logits/rejected": -2.796875, "logps/chosen": -752.0, "logps/rejected": -1168.0, "loss": 0.1415, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.90625, "rewards/margins": 4.0625, "rewards/rejected": -10.0, "step": 9580 }, { "epoch": 0.6922688226376958, "grad_norm": 9.854707772376594, "learning_rate": 1.3090089875411337e-07, "logits/chosen": -3.03125, "logits/rejected": -2.6875, "logps/chosen": -764.0, "logps/rejected": -1256.0, "loss": 0.129, "rewards/accuracies": 0.9375, "rewards/chosen": -5.9375, "rewards/margins": 4.84375, "rewards/rejected": -10.8125, "step": 9590 }, { "epoch": 0.6929906879376309, "grad_norm": 8.672649571433473, "learning_rate": 1.30347378302819e-07, "logits/chosen": -3.015625, "logits/rejected": -2.75, "logps/chosen": -756.0, "logps/rejected": -1192.0, "loss": 0.1698, "rewards/accuracies": 0.9375, "rewards/chosen": -6.03125, "rewards/margins": 4.4375, "rewards/rejected": -10.5, "step": 9600 }, { "epoch": 0.6937125532375659, "grad_norm": 9.034737955151657, "learning_rate": 1.2979461764894608e-07, "logits/chosen": -3.046875, "logits/rejected": -2.78125, "logps/chosen": -768.0, "logps/rejected": -1176.0, "loss": 0.163, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.96875, "rewards/margins": 4.25, "rewards/rejected": -10.1875, "step": 9610 }, { "epoch": 0.6944344185375009, "grad_norm": 8.90041609096791, "learning_rate": 1.2924262030254022e-07, "logits/chosen": -3.0, "logits/rejected": -2.6875, "logps/chosen": -728.0, "logps/rejected": -1168.0, "loss": 0.1499, "rewards/accuracies": 0.9750000238418579, "rewards/chosen": -5.65625, "rewards/margins": 4.53125, "rewards/rejected": -10.1875, "step": 9620 }, { "epoch": 0.6951562838374359, "grad_norm": 8.665967459471112, "learning_rate": 1.2869138976879961e-07, "logits/chosen": -2.953125, "logits/rejected": -2.703125, "logps/chosen": -768.0, "logps/rejected": -1176.0, "loss": 0.1636, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -6.125, "rewards/margins": 4.15625, "rewards/rejected": -10.25, "step": 9630 }, { "epoch": 0.695878149137371, "grad_norm": 7.497535290815869, "learning_rate": 1.2814092954805294e-07, "logits/chosen": -2.96875, "logits/rejected": -2.59375, "logps/chosen": -740.0, "logps/rejected": -1176.0, "loss": 0.171, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -6.0, "rewards/margins": 4.375, "rewards/rejected": -10.375, "step": 9640 }, { "epoch": 0.696600014437306, "grad_norm": 9.990492914302166, "learning_rate": 1.275912431357381e-07, "logits/chosen": -3.046875, "logits/rejected": -2.703125, "logps/chosen": -760.0, "logps/rejected": -1136.0, "loss": 0.1567, "rewards/accuracies": 0.9375, "rewards/chosen": -5.84375, "rewards/margins": 4.125, "rewards/rejected": -10.0, "step": 9650 }, { "epoch": 0.697321879737241, "grad_norm": 7.823463866960965, "learning_rate": 1.2704233402237858e-07, "logits/chosen": -2.96875, "logits/rejected": -2.609375, "logps/chosen": -728.0, "logps/rejected": -1112.0, "loss": 0.1707, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.5625, "rewards/margins": 4.03125, "rewards/rejected": -9.5625, "step": 9660 }, { "epoch": 0.698043745037176, "grad_norm": 7.579915303042644, "learning_rate": 1.2649420569356217e-07, "logits/chosen": -3.0625, "logits/rejected": -2.71875, "logps/chosen": -696.0, "logps/rejected": -1160.0, "loss": 0.1607, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -5.21875, "rewards/margins": 4.84375, "rewards/rejected": -10.0625, "step": 9670 }, { "epoch": 0.698765610337111, "grad_norm": 8.800622349499235, "learning_rate": 1.2594686162991914e-07, "logits/chosen": -2.953125, "logits/rejected": -2.78125, "logps/chosen": -700.0, "logps/rejected": -1120.0, "loss": 0.1402, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -5.46875, "rewards/margins": 4.34375, "rewards/rejected": -9.8125, "step": 9680 }, { "epoch": 0.6994874756370462, "grad_norm": 9.327395207500006, "learning_rate": 1.2540030530709888e-07, "logits/chosen": -2.984375, "logits/rejected": -2.78125, "logps/chosen": -712.0, "logps/rejected": -1128.0, "loss": 0.1495, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.5, "rewards/margins": 4.28125, "rewards/rejected": -9.75, "step": 9690 }, { "epoch": 0.7002093409369812, "grad_norm": 8.376068930149511, "learning_rate": 1.248545401957492e-07, "logits/chosen": -3.0, "logits/rejected": -2.59375, "logps/chosen": -712.0, "logps/rejected": -1144.0, "loss": 0.1543, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.5, "rewards/margins": 4.375, "rewards/rejected": -9.875, "step": 9700 }, { "epoch": 0.7009312062369162, "grad_norm": 7.936678196185944, "learning_rate": 1.2430956976149345e-07, "logits/chosen": -3.09375, "logits/rejected": -2.6875, "logps/chosen": -680.0, "logps/rejected": -1136.0, "loss": 0.1465, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.28125, "rewards/margins": 4.5625, "rewards/rejected": -9.875, "step": 9710 }, { "epoch": 0.7016530715368512, "grad_norm": 12.345046600610592, "learning_rate": 1.2376539746490878e-07, "logits/chosen": -3.09375, "logits/rejected": -2.78125, "logps/chosen": -740.0, "logps/rejected": -1184.0, "loss": 0.1713, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.71875, "rewards/margins": 4.625, "rewards/rejected": -10.3125, "step": 9720 }, { "epoch": 0.7023749368367862, "grad_norm": 9.162811933963393, "learning_rate": 1.2322202676150417e-07, "logits/chosen": -2.96875, "logits/rejected": -2.765625, "logps/chosen": -720.0, "logps/rejected": -1168.0, "loss": 0.1654, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.53125, "rewards/margins": 4.625, "rewards/rejected": -10.125, "step": 9730 }, { "epoch": 0.7030968021367213, "grad_norm": 10.256111775264358, "learning_rate": 1.2267946110169847e-07, "logits/chosen": -3.0, "logits/rejected": -2.78125, "logps/chosen": -724.0, "logps/rejected": -1128.0, "loss": 0.1444, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.625, "rewards/margins": 4.15625, "rewards/rejected": -9.8125, "step": 9740 }, { "epoch": 0.7038186674366563, "grad_norm": 8.584246074026865, "learning_rate": 1.2213770393079846e-07, "logits/chosen": -2.96875, "logits/rejected": -2.703125, "logps/chosen": -732.0, "logps/rejected": -1152.0, "loss": 0.1413, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.59375, "rewards/margins": 4.34375, "rewards/rejected": -9.9375, "step": 9750 }, { "epoch": 0.7045405327365913, "grad_norm": 7.583949089234293, "learning_rate": 1.21596758688977e-07, "logits/chosen": -2.859375, "logits/rejected": -2.4375, "logps/chosen": -712.0, "logps/rejected": -1152.0, "loss": 0.1512, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.5625, "rewards/margins": 4.375, "rewards/rejected": -9.9375, "step": 9760 }, { "epoch": 0.7052623980365264, "grad_norm": 9.44743736005493, "learning_rate": 1.2105662881125112e-07, "logits/chosen": -2.9375, "logits/rejected": -2.53125, "logps/chosen": -720.0, "logps/rejected": -1176.0, "loss": 0.1652, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.65625, "rewards/margins": 4.4375, "rewards/rejected": -10.125, "step": 9770 }, { "epoch": 0.7059842633364615, "grad_norm": 6.4078324266348705, "learning_rate": 1.205173177274604e-07, "logits/chosen": -2.75, "logits/rejected": -2.484375, "logps/chosen": -708.0, "logps/rejected": -1136.0, "loss": 0.1521, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.53125, "rewards/margins": 4.25, "rewards/rejected": -9.75, "step": 9780 }, { "epoch": 0.7067061286363965, "grad_norm": 7.907790182080389, "learning_rate": 1.1997882886224497e-07, "logits/chosen": -2.90625, "logits/rejected": -2.53125, "logps/chosen": -728.0, "logps/rejected": -1144.0, "loss": 0.1424, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -5.5625, "rewards/margins": 4.40625, "rewards/rejected": -10.0, "step": 9790 }, { "epoch": 0.7074279939363315, "grad_norm": 12.95788224606365, "learning_rate": 1.194411656350238e-07, "logits/chosen": -2.875, "logits/rejected": -2.578125, "logps/chosen": -736.0, "logps/rejected": -1144.0, "loss": 0.1558, "rewards/accuracies": 0.9375, "rewards/chosen": -5.75, "rewards/margins": 4.28125, "rewards/rejected": -10.0, "step": 9800 }, { "epoch": 0.7081498592362665, "grad_norm": 9.166806155356193, "learning_rate": 1.1890433145997327e-07, "logits/chosen": -2.859375, "logits/rejected": -2.609375, "logps/chosen": -716.0, "logps/rejected": -1120.0, "loss": 0.1731, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.625, "rewards/margins": 4.1875, "rewards/rejected": -9.8125, "step": 9810 }, { "epoch": 0.7088717245362015, "grad_norm": 9.72249270328465, "learning_rate": 1.1836832974600483e-07, "logits/chosen": -2.8125, "logits/rejected": -2.515625, "logps/chosen": -720.0, "logps/rejected": -1136.0, "loss": 0.1635, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.6875, "rewards/margins": 4.25, "rewards/rejected": -9.9375, "step": 9820 }, { "epoch": 0.7095935898361366, "grad_norm": 7.965526025357869, "learning_rate": 1.1783316389674406e-07, "logits/chosen": -2.859375, "logits/rejected": -2.6875, "logps/chosen": -728.0, "logps/rejected": -1120.0, "loss": 0.1514, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.6875, "rewards/margins": 3.84375, "rewards/rejected": -9.5625, "step": 9830 }, { "epoch": 0.7103154551360716, "grad_norm": 7.929357398986534, "learning_rate": 1.1729883731050899e-07, "logits/chosen": -2.828125, "logits/rejected": -2.5, "logps/chosen": -720.0, "logps/rejected": -1128.0, "loss": 0.1315, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.5625, "rewards/margins": 4.3125, "rewards/rejected": -9.875, "step": 9840 }, { "epoch": 0.7110373204360066, "grad_norm": 8.634524210955284, "learning_rate": 1.1676535338028781e-07, "logits/chosen": -2.90625, "logits/rejected": -2.625, "logps/chosen": -776.0, "logps/rejected": -1176.0, "loss": 0.1497, "rewards/accuracies": 0.90625, "rewards/chosen": -6.0, "rewards/margins": 4.1875, "rewards/rejected": -10.1875, "step": 9850 }, { "epoch": 0.7117591857359417, "grad_norm": 9.065771203848671, "learning_rate": 1.1623271549371808e-07, "logits/chosen": -2.984375, "logits/rejected": -2.625, "logps/chosen": -756.0, "logps/rejected": -1184.0, "loss": 0.1781, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -6.0, "rewards/margins": 4.46875, "rewards/rejected": -10.5, "step": 9860 }, { "epoch": 0.7124810510358767, "grad_norm": 7.949345789146648, "learning_rate": 1.1570092703306523e-07, "logits/chosen": -2.90625, "logits/rejected": -2.546875, "logps/chosen": -752.0, "logps/rejected": -1200.0, "loss": 0.1667, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.96875, "rewards/margins": 4.34375, "rewards/rejected": -10.3125, "step": 9870 }, { "epoch": 0.7132029163358118, "grad_norm": 8.559039194521684, "learning_rate": 1.1516999137520023e-07, "logits/chosen": -2.921875, "logits/rejected": -2.5625, "logps/chosen": -752.0, "logps/rejected": -1152.0, "loss": 0.1439, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.78125, "rewards/margins": 4.25, "rewards/rejected": -10.0625, "step": 9880 }, { "epoch": 0.7139247816357468, "grad_norm": 8.830447748470409, "learning_rate": 1.1463991189157917e-07, "logits/chosen": -2.9375, "logits/rejected": -2.609375, "logps/chosen": -744.0, "logps/rejected": -1152.0, "loss": 0.1701, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.71875, "rewards/margins": 4.28125, "rewards/rejected": -10.0, "step": 9890 }, { "epoch": 0.7146466469356818, "grad_norm": 7.4835869108530275, "learning_rate": 1.1411069194822124e-07, "logits/chosen": -2.953125, "logits/rejected": -2.71875, "logps/chosen": -736.0, "logps/rejected": -1168.0, "loss": 0.1413, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.78125, "rewards/margins": 4.28125, "rewards/rejected": -10.0625, "step": 9900 }, { "epoch": 0.7153685122356168, "grad_norm": 12.056792194890452, "learning_rate": 1.1358233490568758e-07, "logits/chosen": -2.96875, "logits/rejected": -2.640625, "logps/chosen": -752.0, "logps/rejected": -1168.0, "loss": 0.1486, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.9375, "rewards/margins": 4.0625, "rewards/rejected": -10.0, "step": 9910 }, { "epoch": 0.7160903775355518, "grad_norm": 7.752875524749948, "learning_rate": 1.1305484411905986e-07, "logits/chosen": -2.921875, "logits/rejected": -2.609375, "logps/chosen": -780.0, "logps/rejected": -1224.0, "loss": 0.1407, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -6.125, "rewards/margins": 4.59375, "rewards/rejected": -10.6875, "step": 9920 }, { "epoch": 0.716812242835487, "grad_norm": 7.773726914737785, "learning_rate": 1.12528222937919e-07, "logits/chosen": -2.890625, "logits/rejected": -2.640625, "logps/chosen": -748.0, "logps/rejected": -1184.0, "loss": 0.1499, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.90625, "rewards/margins": 4.5, "rewards/rejected": -10.4375, "step": 9930 }, { "epoch": 0.717534108135422, "grad_norm": 10.91086916613174, "learning_rate": 1.1200247470632392e-07, "logits/chosen": -2.875, "logits/rejected": -2.484375, "logps/chosen": -784.0, "logps/rejected": -1200.0, "loss": 0.1779, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -6.25, "rewards/margins": 4.1875, "rewards/rejected": -10.4375, "step": 9940 }, { "epoch": 0.718255973435357, "grad_norm": 8.136219531246716, "learning_rate": 1.1147760276279028e-07, "logits/chosen": -2.90625, "logits/rejected": -2.484375, "logps/chosen": -772.0, "logps/rejected": -1168.0, "loss": 0.153, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -6.125, "rewards/margins": 4.0, "rewards/rejected": -10.125, "step": 9950 }, { "epoch": 0.718977838735292, "grad_norm": 12.213084226027048, "learning_rate": 1.1095361044026927e-07, "logits/chosen": -2.875, "logits/rejected": -2.625, "logps/chosen": -760.0, "logps/rejected": -1144.0, "loss": 0.1488, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.8125, "rewards/margins": 4.0625, "rewards/rejected": -9.875, "step": 9960 }, { "epoch": 0.719699704035227, "grad_norm": 7.447846242333707, "learning_rate": 1.1043050106612656e-07, "logits/chosen": -2.9375, "logits/rejected": -2.671875, "logps/chosen": -764.0, "logps/rejected": -1136.0, "loss": 0.1581, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.9375, "rewards/margins": 3.984375, "rewards/rejected": -9.9375, "step": 9970 }, { "epoch": 0.7204215693351621, "grad_norm": 11.497519578105333, "learning_rate": 1.0990827796212074e-07, "logits/chosen": -2.890625, "logits/rejected": -2.46875, "logps/chosen": -748.0, "logps/rejected": -1168.0, "loss": 0.163, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.9375, "rewards/margins": 4.28125, "rewards/rejected": -10.25, "step": 9980 }, { "epoch": 0.7211434346350971, "grad_norm": 9.931460815710798, "learning_rate": 1.0938694444438307e-07, "logits/chosen": -2.953125, "logits/rejected": -2.546875, "logps/chosen": -720.0, "logps/rejected": -1152.0, "loss": 0.1411, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.65625, "rewards/margins": 4.34375, "rewards/rejected": -10.0, "step": 9990 }, { "epoch": 0.7218652999350321, "grad_norm": 9.875757410099292, "learning_rate": 1.0886650382339566e-07, "logits/chosen": -2.84375, "logits/rejected": -2.625, "logps/chosen": -740.0, "logps/rejected": -1152.0, "loss": 0.1394, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.78125, "rewards/margins": 4.25, "rewards/rejected": -10.0625, "step": 10000 }, { "epoch": 0.7218652999350321, "eval_logits/chosen": -2.9375, "eval_logits/rejected": -2.625, "eval_logps/chosen": -772.0, "eval_logps/rejected": -1168.0, "eval_loss": 0.21195410192012787, "eval_rewards/accuracies": 0.9136363863945007, "eval_rewards/chosen": -6.0, "eval_rewards/margins": 4.1875, "eval_rewards/rejected": -10.1875, "eval_runtime": 3594.9603, "eval_samples_per_second": 27.4, "eval_steps_per_second": 0.428, "step": 10000 }, { "epoch": 0.7225871652349671, "grad_norm": 9.241595039747112, "learning_rate": 1.083469594039704e-07, "logits/chosen": -2.96875, "logits/rejected": -2.640625, "logps/chosen": -736.0, "logps/rejected": -1184.0, "loss": 0.1528, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.71875, "rewards/margins": 4.5, "rewards/rejected": -10.25, "step": 10010 }, { "epoch": 0.7233090305349021, "grad_norm": 10.979124343100237, "learning_rate": 1.0782831448522886e-07, "logits/chosen": -2.921875, "logits/rejected": -2.640625, "logps/chosen": -760.0, "logps/rejected": -1184.0, "loss": 0.1574, "rewards/accuracies": 0.887499988079071, "rewards/chosen": -6.0, "rewards/margins": 4.3125, "rewards/rejected": -10.3125, "step": 10020 }, { "epoch": 0.7240308958348373, "grad_norm": 9.941856346590853, "learning_rate": 1.0731057236058047e-07, "logits/chosen": -2.8125, "logits/rejected": -2.5, "logps/chosen": -756.0, "logps/rejected": -1152.0, "loss": 0.1618, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -6.0, "rewards/margins": 4.0, "rewards/rejected": -10.0, "step": 10030 }, { "epoch": 0.7247527611347723, "grad_norm": 10.561997010522104, "learning_rate": 1.0679373631770162e-07, "logits/chosen": -3.015625, "logits/rejected": -2.59375, "logps/chosen": -736.0, "logps/rejected": -1184.0, "loss": 0.1482, "rewards/accuracies": 0.9375, "rewards/chosen": -5.71875, "rewards/margins": 4.53125, "rewards/rejected": -10.25, "step": 10040 }, { "epoch": 0.7254746264347073, "grad_norm": 8.458140492638268, "learning_rate": 1.0627780963851562e-07, "logits/chosen": -2.921875, "logits/rejected": -2.5625, "logps/chosen": -740.0, "logps/rejected": -1152.0, "loss": 0.1639, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.9375, "rewards/margins": 4.15625, "rewards/rejected": -10.125, "step": 10050 }, { "epoch": 0.7261964917346423, "grad_norm": 7.155521990324457, "learning_rate": 1.0576279559917081e-07, "logits/chosen": -2.9375, "logits/rejected": -2.65625, "logps/chosen": -748.0, "logps/rejected": -1152.0, "loss": 0.1383, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.84375, "rewards/margins": 4.0625, "rewards/rejected": -9.875, "step": 10060 }, { "epoch": 0.7269183570345773, "grad_norm": 9.028193158327456, "learning_rate": 1.0524869747002041e-07, "logits/chosen": -2.984375, "logits/rejected": -2.5625, "logps/chosen": -688.0, "logps/rejected": -1152.0, "loss": 0.1405, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -5.40625, "rewards/margins": 4.6875, "rewards/rejected": -10.0625, "step": 10070 }, { "epoch": 0.7276402223345124, "grad_norm": 7.250067406009502, "learning_rate": 1.0473551851560184e-07, "logits/chosen": -3.03125, "logits/rejected": -2.640625, "logps/chosen": -756.0, "logps/rejected": -1160.0, "loss": 0.1434, "rewards/accuracies": 0.9375, "rewards/chosen": -5.84375, "rewards/margins": 4.25, "rewards/rejected": -10.0625, "step": 10080 }, { "epoch": 0.7283620876344474, "grad_norm": 13.036104853884511, "learning_rate": 1.0422326199461526e-07, "logits/chosen": -2.875, "logits/rejected": -2.609375, "logps/chosen": -744.0, "logps/rejected": -1176.0, "loss": 0.1419, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.84375, "rewards/margins": 4.34375, "rewards/rejected": -10.1875, "step": 10090 }, { "epoch": 0.7290839529343824, "grad_norm": 11.132862883187533, "learning_rate": 1.0371193115990362e-07, "logits/chosen": -2.921875, "logits/rejected": -2.59375, "logps/chosen": -764.0, "logps/rejected": -1232.0, "loss": 0.1509, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.78125, "rewards/margins": 5.0, "rewards/rejected": -10.8125, "step": 10100 }, { "epoch": 0.7298058182343174, "grad_norm": 11.150633604056837, "learning_rate": 1.0320152925843192e-07, "logits/chosen": -2.90625, "logits/rejected": -2.671875, "logps/chosen": -736.0, "logps/rejected": -1176.0, "loss": 0.1702, "rewards/accuracies": 0.9375, "rewards/chosen": -5.8125, "rewards/margins": 4.40625, "rewards/rejected": -10.25, "step": 10110 }, { "epoch": 0.7305276835342525, "grad_norm": 9.295923421645263, "learning_rate": 1.02692059531266e-07, "logits/chosen": -2.90625, "logits/rejected": -2.484375, "logps/chosen": -724.0, "logps/rejected": -1136.0, "loss": 0.1433, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.65625, "rewards/margins": 4.09375, "rewards/rejected": -9.75, "step": 10120 }, { "epoch": 0.7312495488341876, "grad_norm": 10.553464062235404, "learning_rate": 1.0218352521355262e-07, "logits/chosen": -2.96875, "logits/rejected": -2.59375, "logps/chosen": -784.0, "logps/rejected": -1200.0, "loss": 0.1472, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -6.0625, "rewards/margins": 4.40625, "rewards/rejected": -10.4375, "step": 10130 }, { "epoch": 0.7319714141341226, "grad_norm": 7.390985068640905, "learning_rate": 1.0167592953449858e-07, "logits/chosen": -2.96875, "logits/rejected": -2.65625, "logps/chosen": -768.0, "logps/rejected": -1184.0, "loss": 0.1468, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -6.03125, "rewards/margins": 4.25, "rewards/rejected": -10.25, "step": 10140 }, { "epoch": 0.7326932794340576, "grad_norm": 9.445556995082786, "learning_rate": 1.011692757173504e-07, "logits/chosen": -2.890625, "logits/rejected": -2.578125, "logps/chosen": -768.0, "logps/rejected": -1232.0, "loss": 0.1839, "rewards/accuracies": 0.887499988079071, "rewards/chosen": -5.96875, "rewards/margins": 4.59375, "rewards/rejected": -10.5625, "step": 10150 }, { "epoch": 0.7334151447339926, "grad_norm": 12.596474294167802, "learning_rate": 1.0066356697937362e-07, "logits/chosen": -2.78125, "logits/rejected": -2.5, "logps/chosen": -776.0, "logps/rejected": -1232.0, "loss": 0.1564, "rewards/accuracies": 0.9375, "rewards/chosen": -6.1875, "rewards/margins": 4.6875, "rewards/rejected": -10.875, "step": 10160 }, { "epoch": 0.7341370100339276, "grad_norm": 11.44354948885957, "learning_rate": 1.0015880653183259e-07, "logits/chosen": -2.84375, "logits/rejected": -2.609375, "logps/chosen": -776.0, "logps/rejected": -1216.0, "loss": 0.1622, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -6.125, "rewards/margins": 4.21875, "rewards/rejected": -10.3125, "step": 10170 }, { "epoch": 0.7348588753338627, "grad_norm": 7.4670272071034836, "learning_rate": 9.965499757996997e-08, "logits/chosen": -2.859375, "logits/rejected": -2.5625, "logps/chosen": -736.0, "logps/rejected": -1144.0, "loss": 0.1356, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.6875, "rewards/margins": 4.25, "rewards/rejected": -9.9375, "step": 10180 }, { "epoch": 0.7355807406337977, "grad_norm": 9.061126614577189, "learning_rate": 9.915214332298638e-08, "logits/chosen": -2.921875, "logits/rejected": -2.53125, "logps/chosen": -740.0, "logps/rejected": -1192.0, "loss": 0.1509, "rewards/accuracies": 0.9750000238418579, "rewards/chosen": -5.78125, "rewards/margins": 4.65625, "rewards/rejected": -10.4375, "step": 10190 }, { "epoch": 0.7363026059337328, "grad_norm": 10.142460768085758, "learning_rate": 9.865024695402014e-08, "logits/chosen": -2.90625, "logits/rejected": -2.53125, "logps/chosen": -740.0, "logps/rejected": -1176.0, "loss": 0.1474, "rewards/accuracies": 0.9375, "rewards/chosen": -5.8125, "rewards/margins": 4.28125, "rewards/rejected": -10.0625, "step": 10200 }, { "epoch": 0.7370244712336678, "grad_norm": 9.026651543187556, "learning_rate": 9.814931166012694e-08, "logits/chosen": -2.875, "logits/rejected": -2.546875, "logps/chosen": -752.0, "logps/rejected": -1168.0, "loss": 0.1423, "rewards/accuracies": 0.9375, "rewards/chosen": -5.65625, "rewards/margins": 4.59375, "rewards/rejected": -10.25, "step": 10210 }, { "epoch": 0.7377463365336028, "grad_norm": 11.416603725375351, "learning_rate": 9.76493406222594e-08, "logits/chosen": -2.9375, "logits/rejected": -2.625, "logps/chosen": -772.0, "logps/rejected": -1200.0, "loss": 0.1527, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -6.0, "rewards/margins": 4.46875, "rewards/rejected": -10.4375, "step": 10220 }, { "epoch": 0.7384682018335379, "grad_norm": 9.385956313764396, "learning_rate": 9.715033701524756e-08, "logits/chosen": -2.96875, "logits/rejected": -2.53125, "logps/chosen": -756.0, "logps/rejected": -1168.0, "loss": 0.1609, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -5.9375, "rewards/margins": 4.03125, "rewards/rejected": -10.0, "step": 10230 }, { "epoch": 0.7391900671334729, "grad_norm": 12.293936918560657, "learning_rate": 9.665230400777793e-08, "logits/chosen": -2.875, "logits/rejected": -2.546875, "logps/chosen": -752.0, "logps/rejected": -1168.0, "loss": 0.1662, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.875, "rewards/margins": 4.375, "rewards/rejected": -10.25, "step": 10240 }, { "epoch": 0.7399119324334079, "grad_norm": 9.17603345329017, "learning_rate": 9.615524476237358e-08, "logits/chosen": -2.875, "logits/rejected": -2.640625, "logps/chosen": -756.0, "logps/rejected": -1144.0, "loss": 0.1684, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.96875, "rewards/margins": 4.03125, "rewards/rejected": -10.0, "step": 10250 }, { "epoch": 0.7406337977333429, "grad_norm": 8.175509864643324, "learning_rate": 9.565916243537434e-08, "logits/chosen": -2.984375, "logits/rejected": -2.546875, "logps/chosen": -744.0, "logps/rejected": -1120.0, "loss": 0.159, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.75, "rewards/margins": 3.875, "rewards/rejected": -9.625, "step": 10260 }, { "epoch": 0.741355663033278, "grad_norm": 9.728008239435237, "learning_rate": 9.51640601769168e-08, "logits/chosen": -2.9375, "logits/rejected": -2.5, "logps/chosen": -712.0, "logps/rejected": -1128.0, "loss": 0.1583, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.59375, "rewards/margins": 4.28125, "rewards/rejected": -9.875, "step": 10270 }, { "epoch": 0.742077528333213, "grad_norm": 9.336449460312915, "learning_rate": 9.466994113091359e-08, "logits/chosen": -3.0, "logits/rejected": -2.65625, "logps/chosen": -732.0, "logps/rejected": -1168.0, "loss": 0.1763, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -5.8125, "rewards/margins": 4.53125, "rewards/rejected": -10.3125, "step": 10280 }, { "epoch": 0.7427993936331481, "grad_norm": 6.970907874552232, "learning_rate": 9.417680843503426e-08, "logits/chosen": -2.828125, "logits/rejected": -2.609375, "logps/chosen": -748.0, "logps/rejected": -1144.0, "loss": 0.1527, "rewards/accuracies": 0.9750000238418579, "rewards/chosen": -5.6875, "rewards/margins": 4.25, "rewards/rejected": -9.9375, "step": 10290 }, { "epoch": 0.7435212589330831, "grad_norm": 8.517413689223407, "learning_rate": 9.368466522068494e-08, "logits/chosen": -2.953125, "logits/rejected": -2.6875, "logps/chosen": -716.0, "logps/rejected": -1168.0, "loss": 0.1418, "rewards/accuracies": 0.981249988079071, "rewards/chosen": -5.625, "rewards/margins": 4.46875, "rewards/rejected": -10.0625, "step": 10300 }, { "epoch": 0.7442431242330181, "grad_norm": 8.13932194474774, "learning_rate": 9.319351461298847e-08, "logits/chosen": -2.984375, "logits/rejected": -2.578125, "logps/chosen": -712.0, "logps/rejected": -1144.0, "loss": 0.1489, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.65625, "rewards/margins": 4.21875, "rewards/rejected": -9.875, "step": 10310 }, { "epoch": 0.7449649895329532, "grad_norm": 9.845130667757584, "learning_rate": 9.270335973076468e-08, "logits/chosen": -2.9375, "logits/rejected": -2.578125, "logps/chosen": -728.0, "logps/rejected": -1168.0, "loss": 0.1562, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.75, "rewards/margins": 4.3125, "rewards/rejected": -10.0625, "step": 10320 }, { "epoch": 0.7456868548328882, "grad_norm": 8.005007818856038, "learning_rate": 9.221420368651045e-08, "logits/chosen": -3.03125, "logits/rejected": -2.78125, "logps/chosen": -728.0, "logps/rejected": -1160.0, "loss": 0.1518, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -5.5625, "rewards/margins": 4.625, "rewards/rejected": -10.1875, "step": 10330 }, { "epoch": 0.7464087201328232, "grad_norm": 8.120452643885544, "learning_rate": 9.172604958638008e-08, "logits/chosen": -2.984375, "logits/rejected": -2.609375, "logps/chosen": -736.0, "logps/rejected": -1160.0, "loss": 0.1574, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.78125, "rewards/margins": 4.21875, "rewards/rejected": -10.0, "step": 10340 }, { "epoch": 0.7471305854327582, "grad_norm": 10.68134693575453, "learning_rate": 9.123890053016545e-08, "logits/chosen": -2.953125, "logits/rejected": -2.625, "logps/chosen": -724.0, "logps/rejected": -1144.0, "loss": 0.143, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.71875, "rewards/margins": 4.1875, "rewards/rejected": -9.9375, "step": 10350 }, { "epoch": 0.7478524507326932, "grad_norm": 11.395758028840984, "learning_rate": 9.07527596112764e-08, "logits/chosen": -3.15625, "logits/rejected": -2.78125, "logps/chosen": -736.0, "logps/rejected": -1152.0, "loss": 0.1511, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -5.6875, "rewards/margins": 4.25, "rewards/rejected": -9.9375, "step": 10360 }, { "epoch": 0.7485743160326284, "grad_norm": 8.515447114819407, "learning_rate": 9.026762991672105e-08, "logits/chosen": -2.984375, "logits/rejected": -2.6875, "logps/chosen": -752.0, "logps/rejected": -1200.0, "loss": 0.1518, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.84375, "rewards/margins": 4.5, "rewards/rejected": -10.375, "step": 10370 }, { "epoch": 0.7492961813325634, "grad_norm": 11.086441240036681, "learning_rate": 8.978351452708626e-08, "logits/chosen": -3.03125, "logits/rejected": -2.59375, "logps/chosen": -748.0, "logps/rejected": -1160.0, "loss": 0.1514, "rewards/accuracies": 0.96875, "rewards/chosen": -5.90625, "rewards/margins": 4.15625, "rewards/rejected": -10.0625, "step": 10380 }, { "epoch": 0.7500180466324984, "grad_norm": 7.288262141466547, "learning_rate": 8.930041651651795e-08, "logits/chosen": -2.890625, "logits/rejected": -2.625, "logps/chosen": -776.0, "logps/rejected": -1232.0, "loss": 0.1421, "rewards/accuracies": 0.9375, "rewards/chosen": -6.03125, "rewards/margins": 4.59375, "rewards/rejected": -10.625, "step": 10390 }, { "epoch": 0.7507399119324334, "grad_norm": 11.30869446863447, "learning_rate": 8.881833895270186e-08, "logits/chosen": -2.90625, "logits/rejected": -2.71875, "logps/chosen": -764.0, "logps/rejected": -1152.0, "loss": 0.1281, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -6.0625, "rewards/margins": 3.953125, "rewards/rejected": -10.0, "step": 10400 }, { "epoch": 0.7514617772323684, "grad_norm": 10.142597794950875, "learning_rate": 8.833728489684341e-08, "logits/chosen": -2.984375, "logits/rejected": -2.625, "logps/chosen": -760.0, "logps/rejected": -1216.0, "loss": 0.138, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -5.96875, "rewards/margins": 4.46875, "rewards/rejected": -10.4375, "step": 10410 }, { "epoch": 0.7521836425323035, "grad_norm": 8.825883542812928, "learning_rate": 8.78572574036493e-08, "logits/chosen": -2.90625, "logits/rejected": -2.671875, "logps/chosen": -760.0, "logps/rejected": -1152.0, "loss": 0.1413, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.9375, "rewards/margins": 4.28125, "rewards/rejected": -10.1875, "step": 10420 }, { "epoch": 0.7529055078322385, "grad_norm": 9.685940029071732, "learning_rate": 8.73782595213072e-08, "logits/chosen": -3.0625, "logits/rejected": -2.8125, "logps/chosen": -744.0, "logps/rejected": -1216.0, "loss": 0.1498, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -5.75, "rewards/margins": 4.84375, "rewards/rejected": -10.625, "step": 10430 }, { "epoch": 0.7536273731321735, "grad_norm": 8.534843301812261, "learning_rate": 8.690029429146656e-08, "logits/chosen": -3.03125, "logits/rejected": -2.828125, "logps/chosen": -736.0, "logps/rejected": -1152.0, "loss": 0.1608, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.6875, "rewards/margins": 4.40625, "rewards/rejected": -10.125, "step": 10440 }, { "epoch": 0.7543492384321085, "grad_norm": 8.26450848095713, "learning_rate": 8.642336474922e-08, "logits/chosen": -3.015625, "logits/rejected": -2.625, "logps/chosen": -704.0, "logps/rejected": -1192.0, "loss": 0.1501, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -5.53125, "rewards/margins": 5.0625, "rewards/rejected": -10.5625, "step": 10450 }, { "epoch": 0.7550711037320436, "grad_norm": 7.979518457621037, "learning_rate": 8.594747392308288e-08, "logits/chosen": -2.984375, "logits/rejected": -2.625, "logps/chosen": -752.0, "logps/rejected": -1176.0, "loss": 0.1438, "rewards/accuracies": 0.9375, "rewards/chosen": -5.875, "rewards/margins": 4.1875, "rewards/rejected": -10.0625, "step": 10460 }, { "epoch": 0.7557929690319787, "grad_norm": 6.740894768789697, "learning_rate": 8.5472624834975e-08, "logits/chosen": -2.984375, "logits/rejected": -2.59375, "logps/chosen": -724.0, "logps/rejected": -1168.0, "loss": 0.1188, "rewards/accuracies": 0.96875, "rewards/chosen": -5.5, "rewards/margins": 4.6875, "rewards/rejected": -10.1875, "step": 10470 }, { "epoch": 0.7565148343319137, "grad_norm": 13.525079704406558, "learning_rate": 8.499882050020129e-08, "logits/chosen": -3.015625, "logits/rejected": -2.640625, "logps/chosen": -756.0, "logps/rejected": -1232.0, "loss": 0.1591, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.8125, "rewards/margins": 4.84375, "rewards/rejected": -10.625, "step": 10480 }, { "epoch": 0.7572366996318487, "grad_norm": 8.368669950131547, "learning_rate": 8.4526063927432e-08, "logits/chosen": -2.890625, "logits/rejected": -2.640625, "logps/chosen": -780.0, "logps/rejected": -1136.0, "loss": 0.1726, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -6.21875, "rewards/margins": 3.75, "rewards/rejected": -10.0, "step": 10490 }, { "epoch": 0.7579585649317837, "grad_norm": 6.8452078042054, "learning_rate": 8.40543581186843e-08, "logits/chosen": -2.84375, "logits/rejected": -2.671875, "logps/chosen": -768.0, "logps/rejected": -1160.0, "loss": 0.1398, "rewards/accuracies": 0.887499988079071, "rewards/chosen": -6.125, "rewards/margins": 3.84375, "rewards/rejected": -9.9375, "step": 10500 }, { "epoch": 0.7586804302317187, "grad_norm": 9.842039787756281, "learning_rate": 8.358370606930324e-08, "logits/chosen": -2.984375, "logits/rejected": -2.71875, "logps/chosen": -740.0, "logps/rejected": -1152.0, "loss": 0.1481, "rewards/accuracies": 0.96875, "rewards/chosen": -5.8125, "rewards/margins": 4.3125, "rewards/rejected": -10.125, "step": 10510 }, { "epoch": 0.7594022955316538, "grad_norm": 9.548360738442916, "learning_rate": 8.311411076794195e-08, "logits/chosen": -3.046875, "logits/rejected": -2.6875, "logps/chosen": -740.0, "logps/rejected": -1144.0, "loss": 0.1493, "rewards/accuracies": 0.9375, "rewards/chosen": -5.625, "rewards/margins": 4.34375, "rewards/rejected": -9.9375, "step": 10520 }, { "epoch": 0.7601241608315888, "grad_norm": 10.51031541236341, "learning_rate": 8.264557519654353e-08, "logits/chosen": -2.859375, "logits/rejected": -2.671875, "logps/chosen": -744.0, "logps/rejected": -1168.0, "loss": 0.1554, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.8125, "rewards/margins": 4.34375, "rewards/rejected": -10.1875, "step": 10530 }, { "epoch": 0.7608460261315239, "grad_norm": 8.514510120912588, "learning_rate": 8.217810233032168e-08, "logits/chosen": -2.859375, "logits/rejected": -2.5625, "logps/chosen": -744.0, "logps/rejected": -1176.0, "loss": 0.1358, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -5.8125, "rewards/margins": 4.375, "rewards/rejected": -10.1875, "step": 10540 }, { "epoch": 0.7615678914314589, "grad_norm": 11.439380123835884, "learning_rate": 8.171169513774189e-08, "logits/chosen": -2.953125, "logits/rejected": -2.59375, "logps/chosen": -760.0, "logps/rejected": -1224.0, "loss": 0.1591, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -6.0625, "rewards/margins": 4.5, "rewards/rejected": -10.5625, "step": 10550 }, { "epoch": 0.7622897567313939, "grad_norm": 10.853410558035229, "learning_rate": 8.12463565805026e-08, "logits/chosen": -3.0625, "logits/rejected": -2.609375, "logps/chosen": -752.0, "logps/rejected": -1192.0, "loss": 0.1561, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.78125, "rewards/margins": 4.5625, "rewards/rejected": -10.375, "step": 10560 }, { "epoch": 0.763011622031329, "grad_norm": 10.758545302896312, "learning_rate": 8.078208961351637e-08, "logits/chosen": -2.9375, "logits/rejected": -2.625, "logps/chosen": -796.0, "logps/rejected": -1224.0, "loss": 0.1629, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -6.21875, "rewards/margins": 4.40625, "rewards/rejected": -10.625, "step": 10570 }, { "epoch": 0.763733487331264, "grad_norm": 9.106309959022951, "learning_rate": 8.031889718489124e-08, "logits/chosen": -2.96875, "logits/rejected": -2.609375, "logps/chosen": -764.0, "logps/rejected": -1232.0, "loss": 0.1498, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -6.09375, "rewards/margins": 4.6875, "rewards/rejected": -10.75, "step": 10580 }, { "epoch": 0.764455352631199, "grad_norm": 9.985703943059816, "learning_rate": 7.985678223591155e-08, "logits/chosen": -2.875, "logits/rejected": -2.578125, "logps/chosen": -752.0, "logps/rejected": -1216.0, "loss": 0.1599, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -5.84375, "rewards/margins": 4.5625, "rewards/rejected": -10.375, "step": 10590 }, { "epoch": 0.765177217931134, "grad_norm": 10.95962922741963, "learning_rate": 7.939574770102011e-08, "logits/chosen": -2.875, "logits/rejected": -2.5625, "logps/chosen": -748.0, "logps/rejected": -1200.0, "loss": 0.1483, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.84375, "rewards/margins": 4.71875, "rewards/rejected": -10.5625, "step": 10600 }, { "epoch": 0.765899083231069, "grad_norm": 5.8529547106778015, "learning_rate": 7.893579650779883e-08, "logits/chosen": -2.84375, "logits/rejected": -2.5625, "logps/chosen": -740.0, "logps/rejected": -1168.0, "loss": 0.1209, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -5.78125, "rewards/margins": 4.40625, "rewards/rejected": -10.1875, "step": 10610 }, { "epoch": 0.7666209485310042, "grad_norm": 12.078898463041797, "learning_rate": 7.847693157695015e-08, "logits/chosen": -2.84375, "logits/rejected": -2.5625, "logps/chosen": -756.0, "logps/rejected": -1184.0, "loss": 0.1653, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.90625, "rewards/margins": 4.40625, "rewards/rejected": -10.3125, "step": 10620 }, { "epoch": 0.7673428138309392, "grad_norm": 17.665428832633168, "learning_rate": 7.801915582227916e-08, "logits/chosen": -2.984375, "logits/rejected": -2.71875, "logps/chosen": -756.0, "logps/rejected": -1160.0, "loss": 0.1655, "rewards/accuracies": 0.90625, "rewards/chosen": -5.90625, "rewards/margins": 4.15625, "rewards/rejected": -10.0625, "step": 10630 }, { "epoch": 0.7680646791308742, "grad_norm": 10.799427239930818, "learning_rate": 7.756247215067444e-08, "logits/chosen": -2.890625, "logits/rejected": -2.5625, "logps/chosen": -740.0, "logps/rejected": -1176.0, "loss": 0.1675, "rewards/accuracies": 0.9375, "rewards/chosen": -5.78125, "rewards/margins": 4.3125, "rewards/rejected": -10.125, "step": 10640 }, { "epoch": 0.7687865444308092, "grad_norm": 7.898970963786076, "learning_rate": 7.710688346208952e-08, "logits/chosen": -2.921875, "logits/rejected": -2.5, "logps/chosen": -720.0, "logps/rejected": -1136.0, "loss": 0.1518, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.53125, "rewards/margins": 4.21875, "rewards/rejected": -9.75, "step": 10650 }, { "epoch": 0.7695084097307442, "grad_norm": 12.877547551422065, "learning_rate": 7.665239264952541e-08, "logits/chosen": -2.921875, "logits/rejected": -2.609375, "logps/chosen": -692.0, "logps/rejected": -1136.0, "loss": 0.1689, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.34375, "rewards/margins": 4.6875, "rewards/rejected": -10.0, "step": 10660 }, { "epoch": 0.7702302750306793, "grad_norm": 9.13069580760062, "learning_rate": 7.619900259901097e-08, "logits/chosen": -2.78125, "logits/rejected": -2.578125, "logps/chosen": -752.0, "logps/rejected": -1168.0, "loss": 0.1383, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.84375, "rewards/margins": 4.375, "rewards/rejected": -10.25, "step": 10670 }, { "epoch": 0.7709521403306143, "grad_norm": 7.025486658921553, "learning_rate": 7.574671618958544e-08, "logits/chosen": -2.8125, "logits/rejected": -2.609375, "logps/chosen": -768.0, "logps/rejected": -1200.0, "loss": 0.1311, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -6.0, "rewards/margins": 4.53125, "rewards/rejected": -10.5625, "step": 10680 }, { "epoch": 0.7716740056305493, "grad_norm": 8.042577057148172, "learning_rate": 7.529553629327994e-08, "logits/chosen": -3.015625, "logits/rejected": -2.71875, "logps/chosen": -792.0, "logps/rejected": -1256.0, "loss": 0.1337, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -6.34375, "rewards/margins": 4.53125, "rewards/rejected": -10.875, "step": 10690 }, { "epoch": 0.7723958709304843, "grad_norm": 9.406345265786733, "learning_rate": 7.484546577509918e-08, "logits/chosen": -2.90625, "logits/rejected": -2.5625, "logps/chosen": -788.0, "logps/rejected": -1216.0, "loss": 0.1457, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -6.1875, "rewards/margins": 4.4375, "rewards/rejected": -10.625, "step": 10700 }, { "epoch": 0.7731177362304194, "grad_norm": 11.471896873198808, "learning_rate": 7.439650749300322e-08, "logits/chosen": -2.890625, "logits/rejected": -2.546875, "logps/chosen": -800.0, "logps/rejected": -1216.0, "loss": 0.1757, "rewards/accuracies": 0.90625, "rewards/chosen": -6.0625, "rewards/margins": 4.34375, "rewards/rejected": -10.4375, "step": 10710 }, { "epoch": 0.7738396015303545, "grad_norm": 8.152571305874515, "learning_rate": 7.394866429788945e-08, "logits/chosen": -2.921875, "logits/rejected": -2.546875, "logps/chosen": -728.0, "logps/rejected": -1208.0, "loss": 0.139, "rewards/accuracies": 0.96875, "rewards/chosen": -5.71875, "rewards/margins": 4.84375, "rewards/rejected": -10.5625, "step": 10720 }, { "epoch": 0.7745614668302895, "grad_norm": 8.210195423512335, "learning_rate": 7.350193903357444e-08, "logits/chosen": -2.859375, "logits/rejected": -2.65625, "logps/chosen": -728.0, "logps/rejected": -1152.0, "loss": 0.163, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.71875, "rewards/margins": 4.40625, "rewards/rejected": -10.125, "step": 10730 }, { "epoch": 0.7752833321302245, "grad_norm": 6.389795872006602, "learning_rate": 7.305633453677579e-08, "logits/chosen": -2.953125, "logits/rejected": -2.59375, "logps/chosen": -784.0, "logps/rejected": -1232.0, "loss": 0.1468, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -6.0625, "rewards/margins": 4.78125, "rewards/rejected": -10.875, "step": 10740 }, { "epoch": 0.7760051974301595, "grad_norm": 9.502303401754403, "learning_rate": 7.26118536370943e-08, "logits/chosen": -3.0, "logits/rejected": -2.609375, "logps/chosen": -808.0, "logps/rejected": -1248.0, "loss": 0.1385, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -6.3125, "rewards/margins": 4.65625, "rewards/rejected": -11.0, "step": 10750 }, { "epoch": 0.7767270627300946, "grad_norm": 7.527767780807479, "learning_rate": 7.21684991569958e-08, "logits/chosen": -2.90625, "logits/rejected": -2.4375, "logps/chosen": -780.0, "logps/rejected": -1192.0, "loss": 0.1411, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -6.125, "rewards/margins": 4.3125, "rewards/rejected": -10.4375, "step": 10760 }, { "epoch": 0.7774489280300296, "grad_norm": 13.895751954232171, "learning_rate": 7.17262739117934e-08, "logits/chosen": -2.9375, "logits/rejected": -2.5, "logps/chosen": -752.0, "logps/rejected": -1184.0, "loss": 0.1497, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -6.09375, "rewards/margins": 4.34375, "rewards/rejected": -10.4375, "step": 10770 }, { "epoch": 0.7781707933299646, "grad_norm": 5.314719639389733, "learning_rate": 7.128518070962947e-08, "logits/chosen": -2.859375, "logits/rejected": -2.4375, "logps/chosen": -776.0, "logps/rejected": -1200.0, "loss": 0.1362, "rewards/accuracies": 0.96875, "rewards/chosen": -6.03125, "rewards/margins": 4.4375, "rewards/rejected": -10.4375, "step": 10780 }, { "epoch": 0.7788926586298996, "grad_norm": 7.382521391430954, "learning_rate": 7.084522235145796e-08, "logits/chosen": -2.90625, "logits/rejected": -2.53125, "logps/chosen": -800.0, "logps/rejected": -1168.0, "loss": 0.1633, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -6.1875, "rewards/margins": 4.09375, "rewards/rejected": -10.3125, "step": 10790 }, { "epoch": 0.7796145239298347, "grad_norm": 8.89077829343609, "learning_rate": 7.040640163102646e-08, "logits/chosen": -2.96875, "logits/rejected": -2.6875, "logps/chosen": -760.0, "logps/rejected": -1240.0, "loss": 0.1535, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -6.0625, "rewards/margins": 4.875, "rewards/rejected": -10.9375, "step": 10800 }, { "epoch": 0.7803363892297698, "grad_norm": 9.921923991247489, "learning_rate": 6.996872133485854e-08, "logits/chosen": -2.828125, "logits/rejected": -2.421875, "logps/chosen": -780.0, "logps/rejected": -1176.0, "loss": 0.161, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -6.1875, "rewards/margins": 4.1875, "rewards/rejected": -10.375, "step": 10810 }, { "epoch": 0.7810582545297048, "grad_norm": 10.225109832732958, "learning_rate": 6.953218424223617e-08, "logits/chosen": -2.8125, "logits/rejected": -2.515625, "logps/chosen": -768.0, "logps/rejected": -1168.0, "loss": 0.1486, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -6.09375, "rewards/margins": 4.21875, "rewards/rejected": -10.3125, "step": 10820 }, { "epoch": 0.7817801198296398, "grad_norm": 8.45743164183002, "learning_rate": 6.909679312518163e-08, "logits/chosen": -2.921875, "logits/rejected": -2.5625, "logps/chosen": -756.0, "logps/rejected": -1216.0, "loss": 0.1594, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -5.96875, "rewards/margins": 4.5625, "rewards/rejected": -10.5, "step": 10830 }, { "epoch": 0.7825019851295748, "grad_norm": 8.068263202065939, "learning_rate": 6.866255074844046e-08, "logits/chosen": -2.890625, "logits/rejected": -2.484375, "logps/chosen": -752.0, "logps/rejected": -1176.0, "loss": 0.1357, "rewards/accuracies": 0.9375, "rewards/chosen": -5.9375, "rewards/margins": 4.3125, "rewards/rejected": -10.25, "step": 10840 }, { "epoch": 0.7832238504295098, "grad_norm": 7.516647068103794, "learning_rate": 6.822945986946385e-08, "logits/chosen": -2.890625, "logits/rejected": -2.578125, "logps/chosen": -784.0, "logps/rejected": -1192.0, "loss": 0.1497, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -6.09375, "rewards/margins": 4.46875, "rewards/rejected": -10.5625, "step": 10850 }, { "epoch": 0.7839457157294449, "grad_norm": 6.275783146543779, "learning_rate": 6.77975232383905e-08, "logits/chosen": -2.953125, "logits/rejected": -2.515625, "logps/chosen": -760.0, "logps/rejected": -1288.0, "loss": 0.147, "rewards/accuracies": 0.9750000238418579, "rewards/chosen": -6.0, "rewards/margins": 5.1875, "rewards/rejected": -11.1875, "step": 10860 }, { "epoch": 0.78466758102938, "grad_norm": 6.33801021737826, "learning_rate": 6.736674359802986e-08, "logits/chosen": -2.90625, "logits/rejected": -2.609375, "logps/chosen": -776.0, "logps/rejected": -1208.0, "loss": 0.1485, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -6.03125, "rewards/margins": 4.5, "rewards/rejected": -10.5625, "step": 10870 }, { "epoch": 0.785389446329315, "grad_norm": 5.535919923586679, "learning_rate": 6.693712368384463e-08, "logits/chosen": -2.890625, "logits/rejected": -2.703125, "logps/chosen": -772.0, "logps/rejected": -1184.0, "loss": 0.1509, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -6.0, "rewards/margins": 4.375, "rewards/rejected": -10.375, "step": 10880 }, { "epoch": 0.78611131162925, "grad_norm": 8.838224158602769, "learning_rate": 6.650866622393281e-08, "logits/chosen": -2.9375, "logits/rejected": -2.5625, "logps/chosen": -772.0, "logps/rejected": -1208.0, "loss": 0.1724, "rewards/accuracies": 0.90625, "rewards/chosen": -6.28125, "rewards/margins": 4.21875, "rewards/rejected": -10.5, "step": 10890 }, { "epoch": 0.786833176929185, "grad_norm": 11.077227000211735, "learning_rate": 6.608137393901106e-08, "logits/chosen": -2.859375, "logits/rejected": -2.59375, "logps/chosen": -796.0, "logps/rejected": -1216.0, "loss": 0.1658, "rewards/accuracies": 0.9375, "rewards/chosen": -6.1875, "rewards/margins": 4.375, "rewards/rejected": -10.5625, "step": 10900 }, { "epoch": 0.7875550422291201, "grad_norm": 8.408163966199039, "learning_rate": 6.565524954239709e-08, "logits/chosen": -2.84375, "logits/rejected": -2.640625, "logps/chosen": -796.0, "logps/rejected": -1200.0, "loss": 0.1563, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -6.34375, "rewards/margins": 4.1875, "rewards/rejected": -10.5, "step": 10910 }, { "epoch": 0.7882769075290551, "grad_norm": 6.975124530660155, "learning_rate": 6.523029573999247e-08, "logits/chosen": -2.8125, "logits/rejected": -2.421875, "logps/chosen": -764.0, "logps/rejected": -1224.0, "loss": 0.1341, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -6.0625, "rewards/margins": 4.5625, "rewards/rejected": -10.625, "step": 10920 }, { "epoch": 0.7889987728289901, "grad_norm": 9.65061642352629, "learning_rate": 6.480651523026548e-08, "logits/chosen": -2.984375, "logits/rejected": -2.5, "logps/chosen": -752.0, "logps/rejected": -1184.0, "loss": 0.1458, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -5.875, "rewards/margins": 4.5, "rewards/rejected": -10.375, "step": 10930 }, { "epoch": 0.7897206381289251, "grad_norm": 7.84205002288234, "learning_rate": 6.438391070423396e-08, "logits/chosen": -2.875, "logits/rejected": -2.609375, "logps/chosen": -784.0, "logps/rejected": -1216.0, "loss": 0.1422, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -6.3125, "rewards/margins": 4.28125, "rewards/rejected": -10.5625, "step": 10940 }, { "epoch": 0.7904425034288601, "grad_norm": 9.668441648479394, "learning_rate": 6.396248484544817e-08, "logits/chosen": -2.90625, "logits/rejected": -2.59375, "logps/chosen": -752.0, "logps/rejected": -1176.0, "loss": 0.1481, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -6.0625, "rewards/margins": 4.28125, "rewards/rejected": -10.375, "step": 10950 }, { "epoch": 0.7911643687287953, "grad_norm": 14.668012539452555, "learning_rate": 6.354224032997391e-08, "logits/chosen": -2.9375, "logits/rejected": -2.65625, "logps/chosen": -824.0, "logps/rejected": -1192.0, "loss": 0.1396, "rewards/accuracies": 0.90625, "rewards/chosen": -6.5, "rewards/margins": 3.890625, "rewards/rejected": -10.375, "step": 10960 }, { "epoch": 0.7918862340287303, "grad_norm": 12.790645204648316, "learning_rate": 6.31231798263753e-08, "logits/chosen": -3.0, "logits/rejected": -2.703125, "logps/chosen": -764.0, "logps/rejected": -1216.0, "loss": 0.1606, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -6.0, "rewards/margins": 4.59375, "rewards/rejected": -10.625, "step": 10970 }, { "epoch": 0.7926080993286653, "grad_norm": 8.256443608309835, "learning_rate": 6.27053059956981e-08, "logits/chosen": -2.984375, "logits/rejected": -2.671875, "logps/chosen": -772.0, "logps/rejected": -1192.0, "loss": 0.1357, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.96875, "rewards/margins": 4.375, "rewards/rejected": -10.375, "step": 10980 }, { "epoch": 0.7933299646286003, "grad_norm": 7.4278417405838635, "learning_rate": 6.228862149145234e-08, "logits/chosen": -2.921875, "logits/rejected": -2.71875, "logps/chosen": -784.0, "logps/rejected": -1176.0, "loss": 0.137, "rewards/accuracies": 0.9375, "rewards/chosen": -6.21875, "rewards/margins": 4.0625, "rewards/rejected": -10.25, "step": 10990 }, { "epoch": 0.7940518299285353, "grad_norm": 11.30809033177476, "learning_rate": 6.187312895959623e-08, "logits/chosen": -2.921875, "logits/rejected": -2.65625, "logps/chosen": -764.0, "logps/rejected": -1232.0, "loss": 0.1531, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -6.15625, "rewards/margins": 4.75, "rewards/rejected": -10.875, "step": 11000 }, { "epoch": 0.7947736952284704, "grad_norm": 8.324969415531836, "learning_rate": 6.145883103851876e-08, "logits/chosen": -3.015625, "logits/rejected": -2.578125, "logps/chosen": -792.0, "logps/rejected": -1200.0, "loss": 0.1482, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -6.34375, "rewards/margins": 4.21875, "rewards/rejected": -10.5625, "step": 11010 }, { "epoch": 0.7954955605284054, "grad_norm": 7.879621497542356, "learning_rate": 6.10457303590228e-08, "logits/chosen": -2.984375, "logits/rejected": -2.59375, "logps/chosen": -776.0, "logps/rejected": -1224.0, "loss": 0.1544, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -6.21875, "rewards/margins": 4.375, "rewards/rejected": -10.625, "step": 11020 }, { "epoch": 0.7962174258283404, "grad_norm": 13.824352620024788, "learning_rate": 6.063382954430921e-08, "logits/chosen": -3.0, "logits/rejected": -2.53125, "logps/chosen": -776.0, "logps/rejected": -1208.0, "loss": 0.159, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -6.25, "rewards/margins": 4.46875, "rewards/rejected": -10.6875, "step": 11030 }, { "epoch": 0.7969392911282754, "grad_norm": 9.7321719620388, "learning_rate": 6.022313120995942e-08, "logits/chosen": -2.953125, "logits/rejected": -2.53125, "logps/chosen": -768.0, "logps/rejected": -1208.0, "loss": 0.1591, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -6.1875, "rewards/margins": 4.4375, "rewards/rejected": -10.625, "step": 11040 }, { "epoch": 0.7976611564282104, "grad_norm": 7.721151928722837, "learning_rate": 5.981363796391889e-08, "logits/chosen": -2.953125, "logits/rejected": -2.625, "logps/chosen": -788.0, "logps/rejected": -1192.0, "loss": 0.1234, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -6.28125, "rewards/margins": 4.125, "rewards/rejected": -10.375, "step": 11050 }, { "epoch": 0.7983830217281456, "grad_norm": 9.328263463248103, "learning_rate": 5.9405352406481226e-08, "logits/chosen": -2.859375, "logits/rejected": -2.59375, "logps/chosen": -776.0, "logps/rejected": -1200.0, "loss": 0.1495, "rewards/accuracies": 0.9375, "rewards/chosen": -6.03125, "rewards/margins": 4.4375, "rewards/rejected": -10.5, "step": 11060 }, { "epoch": 0.7991048870280806, "grad_norm": 8.988279736482538, "learning_rate": 5.899827713027064e-08, "logits/chosen": -2.828125, "logits/rejected": -2.578125, "logps/chosen": -784.0, "logps/rejected": -1160.0, "loss": 0.1617, "rewards/accuracies": 0.90625, "rewards/chosen": -6.09375, "rewards/margins": 4.0, "rewards/rejected": -10.0625, "step": 11070 }, { "epoch": 0.7998267523280156, "grad_norm": 11.860283883793564, "learning_rate": 5.859241472022633e-08, "logits/chosen": -2.921875, "logits/rejected": -2.59375, "logps/chosen": -776.0, "logps/rejected": -1184.0, "loss": 0.1316, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -6.1875, "rewards/margins": 4.09375, "rewards/rejected": -10.25, "step": 11080 }, { "epoch": 0.8005486176279506, "grad_norm": 8.339756060333015, "learning_rate": 5.818776775358586e-08, "logits/chosen": -2.875, "logits/rejected": -2.734375, "logps/chosen": -796.0, "logps/rejected": -1176.0, "loss": 0.1495, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -6.28125, "rewards/margins": 4.0625, "rewards/rejected": -10.375, "step": 11090 }, { "epoch": 0.8012704829278856, "grad_norm": 11.113384556129915, "learning_rate": 5.778433879986835e-08, "logits/chosen": -2.9375, "logits/rejected": -2.53125, "logps/chosen": -760.0, "logps/rejected": -1176.0, "loss": 0.1515, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -6.0625, "rewards/margins": 4.15625, "rewards/rejected": -10.25, "step": 11100 }, { "epoch": 0.8019923482278207, "grad_norm": 10.599463504430258, "learning_rate": 5.7382130420858794e-08, "logits/chosen": -2.96875, "logits/rejected": -2.6875, "logps/chosen": -780.0, "logps/rejected": -1192.0, "loss": 0.1681, "rewards/accuracies": 0.9375, "rewards/chosen": -6.1875, "rewards/margins": 4.28125, "rewards/rejected": -10.5, "step": 11110 }, { "epoch": 0.8027142135277557, "grad_norm": 10.696808930709432, "learning_rate": 5.698114517059135e-08, "logits/chosen": -2.890625, "logits/rejected": -2.5625, "logps/chosen": -768.0, "logps/rejected": -1160.0, "loss": 0.1372, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.9375, "rewards/margins": 4.125, "rewards/rejected": -10.0625, "step": 11120 }, { "epoch": 0.8034360788276907, "grad_norm": 8.944453033412174, "learning_rate": 5.658138559533338e-08, "logits/chosen": -2.96875, "logits/rejected": -2.578125, "logps/chosen": -756.0, "logps/rejected": -1208.0, "loss": 0.1787, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.96875, "rewards/margins": 4.65625, "rewards/rejected": -10.625, "step": 11130 }, { "epoch": 0.8041579441276258, "grad_norm": 8.977764582899535, "learning_rate": 5.6182854233569084e-08, "logits/chosen": -2.96875, "logits/rejected": -2.703125, "logps/chosen": -776.0, "logps/rejected": -1192.0, "loss": 0.1529, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -6.03125, "rewards/margins": 4.28125, "rewards/rejected": -10.3125, "step": 11140 }, { "epoch": 0.8048798094275608, "grad_norm": 10.126224395800762, "learning_rate": 5.578555361598353e-08, "logits/chosen": -2.84375, "logits/rejected": -2.453125, "logps/chosen": -724.0, "logps/rejected": -1176.0, "loss": 0.1324, "rewards/accuracies": 0.9375, "rewards/chosen": -5.8125, "rewards/margins": 4.46875, "rewards/rejected": -10.25, "step": 11150 }, { "epoch": 0.8056016747274959, "grad_norm": 7.398653029233116, "learning_rate": 5.538948626544651e-08, "logits/chosen": -2.890625, "logits/rejected": -2.625, "logps/chosen": -764.0, "logps/rejected": -1168.0, "loss": 0.1445, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -6.15625, "rewards/margins": 4.0625, "rewards/rejected": -10.25, "step": 11160 }, { "epoch": 0.8063235400274309, "grad_norm": 8.672148610321091, "learning_rate": 5.4994654696996545e-08, "logits/chosen": -2.921875, "logits/rejected": -2.5625, "logps/chosen": -752.0, "logps/rejected": -1200.0, "loss": 0.1573, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -5.875, "rewards/margins": 4.5, "rewards/rejected": -10.375, "step": 11170 }, { "epoch": 0.8070454053273659, "grad_norm": 7.7083477926519, "learning_rate": 5.460106141782492e-08, "logits/chosen": -2.9375, "logits/rejected": -2.65625, "logps/chosen": -752.0, "logps/rejected": -1176.0, "loss": 0.1685, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.96875, "rewards/margins": 4.1875, "rewards/rejected": -10.125, "step": 11180 }, { "epoch": 0.8077672706273009, "grad_norm": 11.545406044029406, "learning_rate": 5.420870892725965e-08, "logits/chosen": -2.828125, "logits/rejected": -2.515625, "logps/chosen": -748.0, "logps/rejected": -1160.0, "loss": 0.158, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -5.8125, "rewards/margins": 4.3125, "rewards/rejected": -10.125, "step": 11190 }, { "epoch": 0.8084891359272359, "grad_norm": 10.670951866955587, "learning_rate": 5.381759971674987e-08, "logits/chosen": -2.84375, "logits/rejected": -2.46875, "logps/chosen": -776.0, "logps/rejected": -1192.0, "loss": 0.1504, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -6.0625, "rewards/margins": 4.34375, "rewards/rejected": -10.4375, "step": 11200 }, { "epoch": 0.809211001227171, "grad_norm": 11.225540948573572, "learning_rate": 5.3427736269849724e-08, "logits/chosen": -2.875, "logits/rejected": -2.609375, "logps/chosen": -752.0, "logps/rejected": -1144.0, "loss": 0.1561, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -6.03125, "rewards/margins": 4.09375, "rewards/rejected": -10.125, "step": 11210 }, { "epoch": 0.809932866527106, "grad_norm": 7.266681042559748, "learning_rate": 5.303912106220285e-08, "logits/chosen": -2.859375, "logits/rejected": -2.59375, "logps/chosen": -764.0, "logps/rejected": -1184.0, "loss": 0.1394, "rewards/accuracies": 0.96875, "rewards/chosen": -6.03125, "rewards/margins": 4.4375, "rewards/rejected": -10.4375, "step": 11220 }, { "epoch": 0.8106547318270411, "grad_norm": 9.542579667649324, "learning_rate": 5.265175656152621e-08, "logits/chosen": -2.953125, "logits/rejected": -2.703125, "logps/chosen": -796.0, "logps/rejected": -1168.0, "loss": 0.1671, "rewards/accuracies": 0.887499988079071, "rewards/chosen": -6.4375, "rewards/margins": 3.9375, "rewards/rejected": -10.375, "step": 11230 }, { "epoch": 0.8113765971269761, "grad_norm": 9.545895584965017, "learning_rate": 5.226564522759525e-08, "logits/chosen": -2.84375, "logits/rejected": -2.484375, "logps/chosen": -800.0, "logps/rejected": -1200.0, "loss": 0.1574, "rewards/accuracies": 0.9375, "rewards/chosen": -6.40625, "rewards/margins": 4.03125, "rewards/rejected": -10.4375, "step": 11240 }, { "epoch": 0.8120984624269111, "grad_norm": 8.761578973065786, "learning_rate": 5.1880789512227434e-08, "logits/chosen": -2.859375, "logits/rejected": -2.53125, "logps/chosen": -772.0, "logps/rejected": -1184.0, "loss": 0.1577, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -6.15625, "rewards/margins": 3.921875, "rewards/rejected": -10.0625, "step": 11250 }, { "epoch": 0.8128203277268462, "grad_norm": 10.935949386772302, "learning_rate": 5.1497191859267014e-08, "logits/chosen": -2.890625, "logits/rejected": -2.546875, "logps/chosen": -744.0, "logps/rejected": -1176.0, "loss": 0.1503, "rewards/accuracies": 0.9375, "rewards/chosen": -5.9375, "rewards/margins": 4.4375, "rewards/rejected": -10.375, "step": 11260 }, { "epoch": 0.8135421930267812, "grad_norm": 11.542728432624855, "learning_rate": 5.111485470456953e-08, "logits/chosen": -2.8125, "logits/rejected": -2.609375, "logps/chosen": -748.0, "logps/rejected": -1200.0, "loss": 0.158, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.875, "rewards/margins": 4.625, "rewards/rejected": -10.5, "step": 11270 }, { "epoch": 0.8142640583267162, "grad_norm": 9.765483774608478, "learning_rate": 5.0733780475986617e-08, "logits/chosen": -2.765625, "logits/rejected": -2.375, "logps/chosen": -768.0, "logps/rejected": -1200.0, "loss": 0.1546, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -6.125, "rewards/margins": 4.28125, "rewards/rejected": -10.375, "step": 11280 }, { "epoch": 0.8149859236266512, "grad_norm": 9.322831257835603, "learning_rate": 5.035397159334984e-08, "logits/chosen": -2.921875, "logits/rejected": -2.609375, "logps/chosen": -800.0, "logps/rejected": -1168.0, "loss": 0.1422, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -6.21875, "rewards/margins": 3.96875, "rewards/rejected": -10.1875, "step": 11290 }, { "epoch": 0.8157077889265864, "grad_norm": 8.623282731830352, "learning_rate": 4.997543046845604e-08, "logits/chosen": -2.875, "logits/rejected": -2.5, "logps/chosen": -740.0, "logps/rejected": -1224.0, "loss": 0.1369, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -5.90625, "rewards/margins": 4.6875, "rewards/rejected": -10.5625, "step": 11300 }, { "epoch": 0.8164296542265214, "grad_norm": 6.745112334659091, "learning_rate": 4.959815950505175e-08, "logits/chosen": -2.90625, "logits/rejected": -2.53125, "logps/chosen": -756.0, "logps/rejected": -1200.0, "loss": 0.1443, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -6.09375, "rewards/margins": 4.53125, "rewards/rejected": -10.625, "step": 11310 }, { "epoch": 0.8171515195264564, "grad_norm": 10.676187874451763, "learning_rate": 4.922216109881791e-08, "logits/chosen": -2.78125, "logits/rejected": -2.625, "logps/chosen": -764.0, "logps/rejected": -1176.0, "loss": 0.1458, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -6.09375, "rewards/margins": 4.1875, "rewards/rejected": -10.3125, "step": 11320 }, { "epoch": 0.8178733848263914, "grad_norm": 7.184364110256313, "learning_rate": 4.8847437637354664e-08, "logits/chosen": -2.953125, "logits/rejected": -2.4375, "logps/chosen": -740.0, "logps/rejected": -1208.0, "loss": 0.1548, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.84375, "rewards/margins": 4.8125, "rewards/rejected": -10.6875, "step": 11330 }, { "epoch": 0.8185952501263264, "grad_norm": 10.120238987000853, "learning_rate": 4.8473991500166234e-08, "logits/chosen": -2.9375, "logits/rejected": -2.625, "logps/chosen": -756.0, "logps/rejected": -1192.0, "loss": 0.1453, "rewards/accuracies": 0.9375, "rewards/chosen": -6.0, "rewards/margins": 4.34375, "rewards/rejected": -10.375, "step": 11340 }, { "epoch": 0.8193171154262615, "grad_norm": 11.946412125314207, "learning_rate": 4.810182505864585e-08, "logits/chosen": -2.90625, "logits/rejected": -2.578125, "logps/chosen": -772.0, "logps/rejected": -1208.0, "loss": 0.1469, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -5.84375, "rewards/margins": 4.65625, "rewards/rejected": -10.5, "step": 11350 }, { "epoch": 0.8200389807261965, "grad_norm": 12.472625629846199, "learning_rate": 4.7730940676060564e-08, "logits/chosen": -2.84375, "logits/rejected": -2.59375, "logps/chosen": -784.0, "logps/rejected": -1200.0, "loss": 0.1556, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -6.21875, "rewards/margins": 4.3125, "rewards/rejected": -10.5, "step": 11360 }, { "epoch": 0.8207608460261315, "grad_norm": 6.685150027611601, "learning_rate": 4.736134070753639e-08, "logits/chosen": -2.90625, "logits/rejected": -2.40625, "logps/chosen": -744.0, "logps/rejected": -1168.0, "loss": 0.1477, "rewards/accuracies": 0.9375, "rewards/chosen": -5.96875, "rewards/margins": 4.25, "rewards/rejected": -10.1875, "step": 11370 }, { "epoch": 0.8214827113260665, "grad_norm": 10.618261196059562, "learning_rate": 4.6993027500043275e-08, "logits/chosen": -2.828125, "logits/rejected": -2.5625, "logps/chosen": -784.0, "logps/rejected": -1256.0, "loss": 0.1579, "rewards/accuracies": 0.96875, "rewards/chosen": -6.125, "rewards/margins": 4.8125, "rewards/rejected": -10.9375, "step": 11380 }, { "epoch": 0.8222045766260015, "grad_norm": 9.968980323412524, "learning_rate": 4.662600339237999e-08, "logits/chosen": -2.78125, "logits/rejected": -2.46875, "logps/chosen": -812.0, "logps/rejected": -1168.0, "loss": 0.1483, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -6.25, "rewards/margins": 3.875, "rewards/rejected": -10.125, "step": 11390 }, { "epoch": 0.8229264419259367, "grad_norm": 9.132558632733545, "learning_rate": 4.6260270715159836e-08, "logits/chosen": -2.90625, "logits/rejected": -2.546875, "logps/chosen": -748.0, "logps/rejected": -1192.0, "loss": 0.161, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -6.0625, "rewards/margins": 4.34375, "rewards/rejected": -10.375, "step": 11400 }, { "epoch": 0.8236483072258717, "grad_norm": 9.046561088489032, "learning_rate": 4.589583179079531e-08, "logits/chosen": -2.859375, "logits/rejected": -2.4375, "logps/chosen": -740.0, "logps/rejected": -1200.0, "loss": 0.15, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -5.90625, "rewards/margins": 4.6875, "rewards/rejected": -10.625, "step": 11410 }, { "epoch": 0.8243701725258067, "grad_norm": 9.600138399413229, "learning_rate": 4.553268893348339e-08, "logits/chosen": -2.984375, "logits/rejected": -2.515625, "logps/chosen": -764.0, "logps/rejected": -1280.0, "loss": 0.1497, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.875, "rewards/margins": 5.21875, "rewards/rejected": -11.0625, "step": 11420 }, { "epoch": 0.8250920378257417, "grad_norm": 11.534256892624052, "learning_rate": 4.5170844449191364e-08, "logits/chosen": -2.921875, "logits/rejected": -2.5625, "logps/chosen": -760.0, "logps/rejected": -1192.0, "loss": 0.1586, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -6.0, "rewards/margins": 4.4375, "rewards/rejected": -10.4375, "step": 11430 }, { "epoch": 0.8258139031256767, "grad_norm": 8.265111331997474, "learning_rate": 4.481030063564156e-08, "logits/chosen": -2.84375, "logits/rejected": -2.53125, "logps/chosen": -784.0, "logps/rejected": -1184.0, "loss": 0.1372, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -6.25, "rewards/margins": 4.15625, "rewards/rejected": -10.4375, "step": 11440 }, { "epoch": 0.8265357684256118, "grad_norm": 9.696675663745067, "learning_rate": 4.445105978229688e-08, "logits/chosen": -2.984375, "logits/rejected": -2.515625, "logps/chosen": -760.0, "logps/rejected": -1224.0, "loss": 0.1529, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.84375, "rewards/margins": 4.90625, "rewards/rejected": -10.75, "step": 11450 }, { "epoch": 0.8272576337255468, "grad_norm": 11.965530383018477, "learning_rate": 4.409312417034683e-08, "logits/chosen": -2.90625, "logits/rejected": -2.578125, "logps/chosen": -728.0, "logps/rejected": -1200.0, "loss": 0.1372, "rewards/accuracies": 0.9375, "rewards/chosen": -5.71875, "rewards/margins": 4.8125, "rewards/rejected": -10.5, "step": 11460 }, { "epoch": 0.8279794990254818, "grad_norm": 10.288831340165839, "learning_rate": 4.373649607269217e-08, "logits/chosen": -2.875, "logits/rejected": -2.625, "logps/chosen": -792.0, "logps/rejected": -1184.0, "loss": 0.1517, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -6.15625, "rewards/margins": 4.15625, "rewards/rejected": -10.3125, "step": 11470 }, { "epoch": 0.8287013643254169, "grad_norm": 10.58525488188931, "learning_rate": 4.338117775393107e-08, "logits/chosen": -2.859375, "logits/rejected": -2.703125, "logps/chosen": -792.0, "logps/rejected": -1176.0, "loss": 0.1647, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -6.1875, "rewards/margins": 4.15625, "rewards/rejected": -10.375, "step": 11480 }, { "epoch": 0.8294232296253519, "grad_norm": 11.407495223286647, "learning_rate": 4.3027171470344767e-08, "logits/chosen": -2.921875, "logits/rejected": -2.5625, "logps/chosen": -772.0, "logps/rejected": -1208.0, "loss": 0.1333, "rewards/accuracies": 0.981249988079071, "rewards/chosen": -5.96875, "rewards/margins": 4.5, "rewards/rejected": -10.5, "step": 11490 }, { "epoch": 0.830145094925287, "grad_norm": 7.549142594426182, "learning_rate": 4.267447946988262e-08, "logits/chosen": -2.90625, "logits/rejected": -2.609375, "logps/chosen": -784.0, "logps/rejected": -1176.0, "loss": 0.1621, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -6.15625, "rewards/margins": 4.09375, "rewards/rejected": -10.25, "step": 11500 }, { "epoch": 0.830866960225222, "grad_norm": 10.39718086616228, "learning_rate": 4.232310399214853e-08, "logits/chosen": -2.875, "logits/rejected": -2.515625, "logps/chosen": -716.0, "logps/rejected": -1216.0, "loss": 0.15, "rewards/accuracies": 0.9375, "rewards/chosen": -5.6875, "rewards/margins": 4.875, "rewards/rejected": -10.5625, "step": 11510 }, { "epoch": 0.831588825525157, "grad_norm": 7.71946842083615, "learning_rate": 4.1973047268386545e-08, "logits/chosen": -2.828125, "logits/rejected": -2.5, "logps/chosen": -748.0, "logps/rejected": -1192.0, "loss": 0.1261, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -5.9375, "rewards/margins": 4.46875, "rewards/rejected": -10.375, "step": 11520 }, { "epoch": 0.832310690825092, "grad_norm": 11.394005391721311, "learning_rate": 4.162431152146631e-08, "logits/chosen": -2.921875, "logits/rejected": -2.59375, "logps/chosen": -788.0, "logps/rejected": -1184.0, "loss": 0.1835, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -6.15625, "rewards/margins": 3.984375, "rewards/rejected": -10.125, "step": 11530 }, { "epoch": 0.833032556125027, "grad_norm": 9.621474950872127, "learning_rate": 4.127689896586936e-08, "logits/chosen": -2.90625, "logits/rejected": -2.640625, "logps/chosen": -760.0, "logps/rejected": -1216.0, "loss": 0.141, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.90625, "rewards/margins": 4.59375, "rewards/rejected": -10.5, "step": 11540 }, { "epoch": 0.8337544214249621, "grad_norm": 7.232695813686058, "learning_rate": 4.093081180767494e-08, "logits/chosen": -2.9375, "logits/rejected": -2.640625, "logps/chosen": -736.0, "logps/rejected": -1200.0, "loss": 0.1313, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -5.875, "rewards/margins": 4.65625, "rewards/rejected": -10.5, "step": 11550 }, { "epoch": 0.8344762867248972, "grad_norm": 7.421382018126838, "learning_rate": 4.0586052244546e-08, "logits/chosen": -3.0, "logits/rejected": -2.734375, "logps/chosen": -780.0, "logps/rejected": -1144.0, "loss": 0.1549, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -6.0625, "rewards/margins": 3.984375, "rewards/rejected": -10.0625, "step": 11560 }, { "epoch": 0.8351981520248322, "grad_norm": 9.602867969798325, "learning_rate": 4.0242622465715196e-08, "logits/chosen": -2.9375, "logits/rejected": -2.59375, "logps/chosen": -768.0, "logps/rejected": -1200.0, "loss": 0.1465, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -6.0625, "rewards/margins": 4.40625, "rewards/rejected": -10.5, "step": 11570 }, { "epoch": 0.8359200173247672, "grad_norm": 9.389336268350176, "learning_rate": 3.9900524651970995e-08, "logits/chosen": -2.9375, "logits/rejected": -2.65625, "logps/chosen": -764.0, "logps/rejected": -1200.0, "loss": 0.1488, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.90625, "rewards/margins": 4.65625, "rewards/rejected": -10.5625, "step": 11580 }, { "epoch": 0.8366418826247022, "grad_norm": 9.480201806828463, "learning_rate": 3.9559760975643897e-08, "logits/chosen": -2.984375, "logits/rejected": -2.65625, "logps/chosen": -748.0, "logps/rejected": -1200.0, "loss": 0.1461, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.875, "rewards/margins": 4.5, "rewards/rejected": -10.375, "step": 11590 }, { "epoch": 0.8373637479246373, "grad_norm": 7.3419299237458695, "learning_rate": 3.922033360059254e-08, "logits/chosen": -2.96875, "logits/rejected": -2.609375, "logps/chosen": -788.0, "logps/rejected": -1192.0, "loss": 0.1649, "rewards/accuracies": 0.9375, "rewards/chosen": -6.28125, "rewards/margins": 4.21875, "rewards/rejected": -10.5, "step": 11600 }, { "epoch": 0.8380856132245723, "grad_norm": 9.887973431940114, "learning_rate": 3.8882244682190094e-08, "logits/chosen": -2.90625, "logits/rejected": -2.515625, "logps/chosen": -764.0, "logps/rejected": -1176.0, "loss": 0.146, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -6.21875, "rewards/margins": 4.25, "rewards/rejected": -10.5, "step": 11610 }, { "epoch": 0.8388074785245073, "grad_norm": 6.937760256383144, "learning_rate": 3.854549636731047e-08, "logits/chosen": -3.0, "logits/rejected": -2.6875, "logps/chosen": -760.0, "logps/rejected": -1216.0, "loss": 0.1391, "rewards/accuracies": 0.9375, "rewards/chosen": -6.15625, "rewards/margins": 4.59375, "rewards/rejected": -10.75, "step": 11620 }, { "epoch": 0.8395293438244423, "grad_norm": 8.161082030414025, "learning_rate": 3.82100907943145e-08, "logits/chosen": -2.984375, "logits/rejected": -2.65625, "logps/chosen": -780.0, "logps/rejected": -1208.0, "loss": 0.1746, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -6.1875, "rewards/margins": 4.46875, "rewards/rejected": -10.6875, "step": 11630 }, { "epoch": 0.8402512091243773, "grad_norm": 8.796986939445052, "learning_rate": 3.7876030093036945e-08, "logits/chosen": -2.875, "logits/rejected": -2.5625, "logps/chosen": -780.0, "logps/rejected": -1208.0, "loss": 0.1518, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -6.25, "rewards/margins": 4.5, "rewards/rejected": -10.75, "step": 11640 }, { "epoch": 0.8409730744243125, "grad_norm": 9.161196064107799, "learning_rate": 3.7543316384772375e-08, "logits/chosen": -2.921875, "logits/rejected": -2.5625, "logps/chosen": -772.0, "logps/rejected": -1216.0, "loss": 0.1537, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -6.03125, "rewards/margins": 4.5, "rewards/rejected": -10.5625, "step": 11650 }, { "epoch": 0.8416949397242475, "grad_norm": 8.326472553423818, "learning_rate": 3.721195178226178e-08, "logits/chosen": -3.0, "logits/rejected": -2.609375, "logps/chosen": -748.0, "logps/rejected": -1200.0, "loss": 0.1482, "rewards/accuracies": 0.9375, "rewards/chosen": -6.0, "rewards/margins": 4.4375, "rewards/rejected": -10.4375, "step": 11660 }, { "epoch": 0.8424168050241825, "grad_norm": 8.11503963287216, "learning_rate": 3.68819383896796e-08, "logits/chosen": -2.96875, "logits/rejected": -2.546875, "logps/chosen": -780.0, "logps/rejected": -1216.0, "loss": 0.1451, "rewards/accuracies": 0.9375, "rewards/chosen": -6.15625, "rewards/margins": 4.375, "rewards/rejected": -10.5625, "step": 11670 }, { "epoch": 0.8431386703241175, "grad_norm": 8.18334342762608, "learning_rate": 3.655327830261995e-08, "logits/chosen": -2.8125, "logits/rejected": -2.625, "logps/chosen": -812.0, "logps/rejected": -1176.0, "loss": 0.1527, "rewards/accuracies": 0.887499988079071, "rewards/chosen": -6.34375, "rewards/margins": 3.828125, "rewards/rejected": -10.1875, "step": 11680 }, { "epoch": 0.8438605356240525, "grad_norm": 9.646827096360845, "learning_rate": 3.622597360808324e-08, "logits/chosen": -2.890625, "logits/rejected": -2.625, "logps/chosen": -792.0, "logps/rejected": -1208.0, "loss": 0.1656, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -6.1875, "rewards/margins": 4.15625, "rewards/rejected": -10.375, "step": 11690 }, { "epoch": 0.8445824009239876, "grad_norm": 8.41592945035557, "learning_rate": 3.5900026384463324e-08, "logits/chosen": -3.0, "logits/rejected": -2.546875, "logps/chosen": -776.0, "logps/rejected": -1192.0, "loss": 0.144, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -6.21875, "rewards/margins": 4.21875, "rewards/rejected": -10.4375, "step": 11700 }, { "epoch": 0.8453042662239226, "grad_norm": 11.091054652826791, "learning_rate": 3.557543870153393e-08, "logits/chosen": -2.921875, "logits/rejected": -2.609375, "logps/chosen": -764.0, "logps/rejected": -1224.0, "loss": 0.1529, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -6.1875, "rewards/margins": 4.53125, "rewards/rejected": -10.6875, "step": 11710 }, { "epoch": 0.8460261315238576, "grad_norm": 10.649551216885522, "learning_rate": 3.5252212620435764e-08, "logits/chosen": -2.875, "logits/rejected": -2.578125, "logps/chosen": -776.0, "logps/rejected": -1192.0, "loss": 0.1466, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -6.25, "rewards/margins": 4.125, "rewards/rejected": -10.375, "step": 11720 }, { "epoch": 0.8467479968237926, "grad_norm": 10.591948146106109, "learning_rate": 3.493035019366328e-08, "logits/chosen": -2.96875, "logits/rejected": -2.59375, "logps/chosen": -732.0, "logps/rejected": -1200.0, "loss": 0.1522, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.8125, "rewards/margins": 4.625, "rewards/rejected": -10.4375, "step": 11730 }, { "epoch": 0.8474698621237277, "grad_norm": 10.912246863703778, "learning_rate": 3.460985346505169e-08, "logits/chosen": -2.796875, "logits/rejected": -2.546875, "logps/chosen": -788.0, "logps/rejected": -1192.0, "loss": 0.163, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -6.09375, "rewards/margins": 4.1875, "rewards/rejected": -10.25, "step": 11740 }, { "epoch": 0.8481917274236628, "grad_norm": 6.539575387536508, "learning_rate": 3.4290724469764e-08, "logits/chosen": -2.9375, "logits/rejected": -2.625, "logps/chosen": -772.0, "logps/rejected": -1200.0, "loss": 0.1443, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -6.21875, "rewards/margins": 4.21875, "rewards/rejected": -10.4375, "step": 11750 }, { "epoch": 0.8489135927235978, "grad_norm": 12.080456229188744, "learning_rate": 3.397296523427806e-08, "logits/chosen": -2.9375, "logits/rejected": -2.65625, "logps/chosen": -760.0, "logps/rejected": -1176.0, "loss": 0.1408, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -6.09375, "rewards/margins": 4.21875, "rewards/rejected": -10.3125, "step": 11760 }, { "epoch": 0.8496354580235328, "grad_norm": 10.737805994163432, "learning_rate": 3.3656577776373706e-08, "logits/chosen": -2.828125, "logits/rejected": -2.53125, "logps/chosen": -772.0, "logps/rejected": -1208.0, "loss": 0.1402, "rewards/accuracies": 0.90625, "rewards/chosen": -6.09375, "rewards/margins": 4.125, "rewards/rejected": -10.1875, "step": 11770 }, { "epoch": 0.8503573233234678, "grad_norm": 8.746433818443641, "learning_rate": 3.334156410511993e-08, "logits/chosen": -2.953125, "logits/rejected": -2.71875, "logps/chosen": -752.0, "logps/rejected": -1224.0, "loss": 0.1619, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -5.8125, "rewards/margins": 4.71875, "rewards/rejected": -10.5, "step": 11780 }, { "epoch": 0.8510791886234029, "grad_norm": 8.942255435734593, "learning_rate": 3.30279262208622e-08, "logits/chosen": -2.9375, "logits/rejected": -2.640625, "logps/chosen": -796.0, "logps/rejected": -1184.0, "loss": 0.1355, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -6.25, "rewards/margins": 4.03125, "rewards/rejected": -10.25, "step": 11790 }, { "epoch": 0.8518010539233379, "grad_norm": 13.240281042934914, "learning_rate": 3.271566611520965e-08, "logits/chosen": -3.0, "logits/rejected": -2.78125, "logps/chosen": -764.0, "logps/rejected": -1144.0, "loss": 0.1533, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -6.03125, "rewards/margins": 3.984375, "rewards/rejected": -10.0625, "step": 11800 }, { "epoch": 0.852522919223273, "grad_norm": 7.445169779102206, "learning_rate": 3.240478577102254e-08, "logits/chosen": -2.96875, "logits/rejected": -2.578125, "logps/chosen": -812.0, "logps/rejected": -1208.0, "loss": 0.1539, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -6.3125, "rewards/margins": 3.921875, "rewards/rejected": -10.25, "step": 11810 }, { "epoch": 0.853244784523208, "grad_norm": 10.391094523428233, "learning_rate": 3.2095287162399396e-08, "logits/chosen": -2.984375, "logits/rejected": -2.5625, "logps/chosen": -780.0, "logps/rejected": -1200.0, "loss": 0.1504, "rewards/accuracies": 0.9375, "rewards/chosen": -6.1875, "rewards/margins": 4.46875, "rewards/rejected": -10.6875, "step": 11820 }, { "epoch": 0.853966649823143, "grad_norm": 10.97007525410186, "learning_rate": 3.178717225466504e-08, "logits/chosen": -2.90625, "logits/rejected": -2.515625, "logps/chosen": -784.0, "logps/rejected": -1224.0, "loss": 0.1483, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -6.25, "rewards/margins": 4.5, "rewards/rejected": -10.75, "step": 11830 }, { "epoch": 0.8546885151230781, "grad_norm": 10.949419924686783, "learning_rate": 3.1480443004357535e-08, "logits/chosen": -2.96875, "logits/rejected": -2.46875, "logps/chosen": -748.0, "logps/rejected": -1216.0, "loss": 0.1419, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -5.90625, "rewards/margins": 4.78125, "rewards/rejected": -10.6875, "step": 11840 }, { "epoch": 0.8554103804230131, "grad_norm": 7.949017711437389, "learning_rate": 3.117510135921589e-08, "logits/chosen": -2.90625, "logits/rejected": -2.578125, "logps/chosen": -756.0, "logps/rejected": -1184.0, "loss": 0.127, "rewards/accuracies": 0.96875, "rewards/chosen": -5.9375, "rewards/margins": 4.5625, "rewards/rejected": -10.5, "step": 11850 }, { "epoch": 0.8561322457229481, "grad_norm": 8.211089267034843, "learning_rate": 3.087114925816808e-08, "logits/chosen": -2.90625, "logits/rejected": -2.609375, "logps/chosen": -784.0, "logps/rejected": -1224.0, "loss": 0.1521, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -6.0625, "rewards/margins": 4.5625, "rewards/rejected": -10.625, "step": 11860 }, { "epoch": 0.8568541110228831, "grad_norm": 7.931702604806061, "learning_rate": 3.0568588631318115e-08, "logits/chosen": -2.921875, "logits/rejected": -2.53125, "logps/chosen": -728.0, "logps/rejected": -1216.0, "loss": 0.1334, "rewards/accuracies": 0.96875, "rewards/chosen": -5.71875, "rewards/margins": 4.90625, "rewards/rejected": -10.625, "step": 11870 }, { "epoch": 0.8575759763228181, "grad_norm": 13.782675522555701, "learning_rate": 3.026742139993427e-08, "logits/chosen": -2.875, "logits/rejected": -2.609375, "logps/chosen": -784.0, "logps/rejected": -1224.0, "loss": 0.1561, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -6.1875, "rewards/margins": 4.375, "rewards/rejected": -10.5625, "step": 11880 }, { "epoch": 0.8582978416227532, "grad_norm": 8.568533344202447, "learning_rate": 2.996764947643685e-08, "logits/chosen": -2.828125, "logits/rejected": -2.5, "logps/chosen": -784.0, "logps/rejected": -1256.0, "loss": 0.1394, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -6.21875, "rewards/margins": 4.71875, "rewards/rejected": -10.9375, "step": 11890 }, { "epoch": 0.8590197069226883, "grad_norm": 12.27253477325102, "learning_rate": 2.9669274764385604e-08, "logits/chosen": -2.78125, "logits/rejected": -2.5625, "logps/chosen": -784.0, "logps/rejected": -1176.0, "loss": 0.1662, "rewards/accuracies": 0.90625, "rewards/chosen": -6.1875, "rewards/margins": 4.0625, "rewards/rejected": -10.25, "step": 11900 }, { "epoch": 0.8597415722226233, "grad_norm": 8.289657053798905, "learning_rate": 2.9372299158468144e-08, "logits/chosen": -2.953125, "logits/rejected": -2.53125, "logps/chosen": -764.0, "logps/rejected": -1224.0, "loss": 0.1465, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.9375, "rewards/margins": 4.75, "rewards/rejected": -10.6875, "step": 11910 }, { "epoch": 0.8604634375225583, "grad_norm": 10.205485648725467, "learning_rate": 2.907672454448784e-08, "logits/chosen": -2.921875, "logits/rejected": -2.546875, "logps/chosen": -768.0, "logps/rejected": -1232.0, "loss": 0.1457, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -6.03125, "rewards/margins": 4.65625, "rewards/rejected": -10.6875, "step": 11920 }, { "epoch": 0.8611853028224933, "grad_norm": 9.498983941338254, "learning_rate": 2.8782552799351404e-08, "logits/chosen": -2.890625, "logits/rejected": -2.515625, "logps/chosen": -768.0, "logps/rejected": -1200.0, "loss": 0.1494, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -6.0625, "rewards/margins": 4.375, "rewards/rejected": -10.4375, "step": 11930 }, { "epoch": 0.8619071681224284, "grad_norm": 6.074944238826367, "learning_rate": 2.8489785791057543e-08, "logits/chosen": -2.859375, "logits/rejected": -2.65625, "logps/chosen": -760.0, "logps/rejected": -1208.0, "loss": 0.1479, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -5.96875, "rewards/margins": 4.5625, "rewards/rejected": -10.5, "step": 11940 }, { "epoch": 0.8626290334223634, "grad_norm": 8.302877488046027, "learning_rate": 2.819842537868475e-08, "logits/chosen": -2.828125, "logits/rejected": -2.578125, "logps/chosen": -796.0, "logps/rejected": -1216.0, "loss": 0.1538, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -6.21875, "rewards/margins": 4.34375, "rewards/rejected": -10.5625, "step": 11950 }, { "epoch": 0.8633508987222984, "grad_norm": 11.61178207342639, "learning_rate": 2.7908473412379618e-08, "logits/chosen": -2.90625, "logits/rejected": -2.59375, "logps/chosen": -792.0, "logps/rejected": -1192.0, "loss": 0.1614, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -6.4375, "rewards/margins": 4.15625, "rewards/rejected": -10.625, "step": 11960 }, { "epoch": 0.8640727640222334, "grad_norm": 9.45795876040694, "learning_rate": 2.761993173334509e-08, "logits/chosen": -2.953125, "logits/rejected": -2.5625, "logps/chosen": -804.0, "logps/rejected": -1192.0, "loss": 0.1542, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -6.15625, "rewards/margins": 4.15625, "rewards/rejected": -10.3125, "step": 11970 }, { "epoch": 0.8647946293221684, "grad_norm": 11.362932343916869, "learning_rate": 2.733280217382869e-08, "logits/chosen": -2.859375, "logits/rejected": -2.578125, "logps/chosen": -764.0, "logps/rejected": -1200.0, "loss": 0.1466, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -6.0, "rewards/margins": 4.40625, "rewards/rejected": -10.375, "step": 11980 }, { "epoch": 0.8655164946221036, "grad_norm": 10.568145168122776, "learning_rate": 2.704708655711102e-08, "logits/chosen": -2.890625, "logits/rejected": -2.609375, "logps/chosen": -752.0, "logps/rejected": -1192.0, "loss": 0.1357, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -6.0, "rewards/margins": 4.3125, "rewards/rejected": -10.3125, "step": 11990 }, { "epoch": 0.8662383599220386, "grad_norm": 6.986633654793124, "learning_rate": 2.6762786697494016e-08, "logits/chosen": -2.953125, "logits/rejected": -2.65625, "logps/chosen": -780.0, "logps/rejected": -1224.0, "loss": 0.1625, "rewards/accuracies": 0.9750000238418579, "rewards/chosen": -6.1875, "rewards/margins": 4.6875, "rewards/rejected": -10.875, "step": 12000 }, { "epoch": 0.8669602252219736, "grad_norm": 7.778882127033462, "learning_rate": 2.6479904400289578e-08, "logits/chosen": -2.890625, "logits/rejected": -2.59375, "logps/chosen": -772.0, "logps/rejected": -1200.0, "loss": 0.158, "rewards/accuracies": 0.96875, "rewards/chosen": -6.15625, "rewards/margins": 4.15625, "rewards/rejected": -10.3125, "step": 12010 }, { "epoch": 0.8676820905219086, "grad_norm": 8.539754631291549, "learning_rate": 2.6198441461808106e-08, "logits/chosen": -2.84375, "logits/rejected": -2.421875, "logps/chosen": -780.0, "logps/rejected": -1264.0, "loss": 0.1475, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -6.1875, "rewards/margins": 4.84375, "rewards/rejected": -11.0, "step": 12020 }, { "epoch": 0.8684039558218436, "grad_norm": 7.963728288501986, "learning_rate": 2.5918399669346808e-08, "logits/chosen": -2.9375, "logits/rejected": -2.640625, "logps/chosen": -736.0, "logps/rejected": -1200.0, "loss": 0.1253, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.75, "rewards/margins": 4.71875, "rewards/rejected": -10.5, "step": 12030 }, { "epoch": 0.8691258211217787, "grad_norm": 10.257823465025604, "learning_rate": 2.5639780801178844e-08, "logits/chosen": -2.953125, "logits/rejected": -2.609375, "logps/chosen": -776.0, "logps/rejected": -1216.0, "loss": 0.1705, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -6.15625, "rewards/margins": 4.5, "rewards/rejected": -10.625, "step": 12040 }, { "epoch": 0.8698476864217137, "grad_norm": 8.314704744595538, "learning_rate": 2.53625866265417e-08, "logits/chosen": -2.84375, "logits/rejected": -2.59375, "logps/chosen": -808.0, "logps/rejected": -1208.0, "loss": 0.1427, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -6.125, "rewards/margins": 4.53125, "rewards/rejected": -10.6875, "step": 12050 }, { "epoch": 0.8705695517216487, "grad_norm": 8.499655093782934, "learning_rate": 2.508681890562575e-08, "logits/chosen": -2.96875, "logits/rejected": -2.484375, "logps/chosen": -776.0, "logps/rejected": -1192.0, "loss": 0.1355, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -6.0, "rewards/margins": 4.34375, "rewards/rejected": -10.375, "step": 12060 }, { "epoch": 0.8712914170215837, "grad_norm": 7.835075004860599, "learning_rate": 2.4812479389563794e-08, "logits/chosen": -2.875, "logits/rejected": -2.484375, "logps/chosen": -768.0, "logps/rejected": -1232.0, "loss": 0.1513, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -6.0625, "rewards/margins": 4.34375, "rewards/rejected": -10.4375, "step": 12070 }, { "epoch": 0.8720132823215188, "grad_norm": 9.592674313284755, "learning_rate": 2.4539569820419213e-08, "logits/chosen": -2.921875, "logits/rejected": -2.578125, "logps/chosen": -772.0, "logps/rejected": -1248.0, "loss": 0.1653, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -6.125, "rewards/margins": 4.78125, "rewards/rejected": -10.875, "step": 12080 }, { "epoch": 0.8727351476214539, "grad_norm": 7.77863378103726, "learning_rate": 2.4268091931175128e-08, "logits/chosen": -2.9375, "logits/rejected": -2.640625, "logps/chosen": -764.0, "logps/rejected": -1160.0, "loss": 0.1351, "rewards/accuracies": 0.9375, "rewards/chosen": -6.0, "rewards/margins": 4.03125, "rewards/rejected": -10.0625, "step": 12090 }, { "epoch": 0.8734570129213889, "grad_norm": 5.640158653910894, "learning_rate": 2.3998047445723728e-08, "logits/chosen": -2.984375, "logits/rejected": -2.65625, "logps/chosen": -732.0, "logps/rejected": -1184.0, "loss": 0.1468, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.84375, "rewards/margins": 4.5625, "rewards/rejected": -10.4375, "step": 12100 }, { "epoch": 0.8741788782213239, "grad_norm": 9.254054430708486, "learning_rate": 2.3729438078854748e-08, "logits/chosen": -3.0, "logits/rejected": -2.59375, "logps/chosen": -784.0, "logps/rejected": -1208.0, "loss": 0.1658, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -6.28125, "rewards/margins": 4.34375, "rewards/rejected": -10.625, "step": 12110 }, { "epoch": 0.8749007435212589, "grad_norm": 12.122038328529602, "learning_rate": 2.3462265536245085e-08, "logits/chosen": -2.84375, "logits/rejected": -2.53125, "logps/chosen": -804.0, "logps/rejected": -1232.0, "loss": 0.1587, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -6.4375, "rewards/margins": 4.375, "rewards/rejected": -10.8125, "step": 12120 }, { "epoch": 0.8756226088211939, "grad_norm": 5.974867571191328, "learning_rate": 2.3196531514447643e-08, "logits/chosen": -2.890625, "logits/rejected": -2.59375, "logps/chosen": -752.0, "logps/rejected": -1184.0, "loss": 0.1273, "rewards/accuracies": 0.9750000238418579, "rewards/chosen": -6.03125, "rewards/margins": 4.5625, "rewards/rejected": -10.5625, "step": 12130 }, { "epoch": 0.876344474121129, "grad_norm": 9.921544747499848, "learning_rate": 2.293223770088079e-08, "logits/chosen": -2.875, "logits/rejected": -2.53125, "logps/chosen": -792.0, "logps/rejected": -1208.0, "loss": 0.1421, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -6.21875, "rewards/margins": 4.28125, "rewards/rejected": -10.5, "step": 12140 }, { "epoch": 0.877066339421064, "grad_norm": 12.38062445080125, "learning_rate": 2.2669385773817467e-08, "logits/chosen": -2.96875, "logits/rejected": -2.5, "logps/chosen": -736.0, "logps/rejected": -1216.0, "loss": 0.1354, "rewards/accuracies": 0.9750000238418579, "rewards/chosen": -5.8125, "rewards/margins": 4.78125, "rewards/rejected": -10.625, "step": 12150 }, { "epoch": 0.877788204720999, "grad_norm": 12.239735356816436, "learning_rate": 2.2407977402374545e-08, "logits/chosen": -2.890625, "logits/rejected": -2.515625, "logps/chosen": -788.0, "logps/rejected": -1232.0, "loss": 0.148, "rewards/accuracies": 0.9375, "rewards/chosen": -6.25, "rewards/margins": 4.46875, "rewards/rejected": -10.6875, "step": 12160 }, { "epoch": 0.8785100700209341, "grad_norm": 9.840653330548708, "learning_rate": 2.2148014246502395e-08, "logits/chosen": -2.8125, "logits/rejected": -2.53125, "logps/chosen": -764.0, "logps/rejected": -1168.0, "loss": 0.1715, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.9375, "rewards/margins": 4.1875, "rewards/rejected": -10.125, "step": 12170 }, { "epoch": 0.8792319353208691, "grad_norm": 9.716661953638562, "learning_rate": 2.1889497956974146e-08, "logits/chosen": -2.84375, "logits/rejected": -2.609375, "logps/chosen": -780.0, "logps/rejected": -1168.0, "loss": 0.1656, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -6.0625, "rewards/margins": 4.15625, "rewards/rejected": -10.25, "step": 12180 }, { "epoch": 0.8799538006208042, "grad_norm": 8.417846830214762, "learning_rate": 2.1632430175375332e-08, "logits/chosen": -2.953125, "logits/rejected": -2.609375, "logps/chosen": -776.0, "logps/rejected": -1216.0, "loss": 0.1612, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -6.15625, "rewards/margins": 4.46875, "rewards/rejected": -10.625, "step": 12190 }, { "epoch": 0.8806756659207392, "grad_norm": 9.941969312589332, "learning_rate": 2.1376812534093375e-08, "logits/chosen": -2.859375, "logits/rejected": -2.5625, "logps/chosen": -756.0, "logps/rejected": -1176.0, "loss": 0.1339, "rewards/accuracies": 0.9750000238418579, "rewards/chosen": -5.90625, "rewards/margins": 4.3125, "rewards/rejected": -10.1875, "step": 12200 }, { "epoch": 0.8813975312206742, "grad_norm": 10.465626887089373, "learning_rate": 2.112264665630728e-08, "logits/chosen": -2.796875, "logits/rejected": -2.546875, "logps/chosen": -744.0, "logps/rejected": -1152.0, "loss": 0.1481, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.75, "rewards/margins": 4.25, "rewards/rejected": -10.0, "step": 12210 }, { "epoch": 0.8821193965206092, "grad_norm": 10.02996418403007, "learning_rate": 2.0869934155977348e-08, "logits/chosen": -2.84375, "logits/rejected": -2.453125, "logps/chosen": -752.0, "logps/rejected": -1240.0, "loss": 0.1435, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.96875, "rewards/margins": 4.84375, "rewards/rejected": -10.8125, "step": 12220 }, { "epoch": 0.8828412618205442, "grad_norm": 10.447715723395184, "learning_rate": 2.0618676637834924e-08, "logits/chosen": -2.90625, "logits/rejected": -2.578125, "logps/chosen": -740.0, "logps/rejected": -1192.0, "loss": 0.1388, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -5.8125, "rewards/margins": 4.65625, "rewards/rejected": -10.4375, "step": 12230 }, { "epoch": 0.8835631271204794, "grad_norm": 9.973159448416428, "learning_rate": 2.0368875697372028e-08, "logits/chosen": -2.828125, "logits/rejected": -2.5, "logps/chosen": -752.0, "logps/rejected": -1192.0, "loss": 0.1588, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -5.90625, "rewards/margins": 4.34375, "rewards/rejected": -10.25, "step": 12240 }, { "epoch": 0.8842849924204144, "grad_norm": 7.405712078749057, "learning_rate": 2.0120532920831436e-08, "logits/chosen": -2.84375, "logits/rejected": -2.59375, "logps/chosen": -784.0, "logps/rejected": -1232.0, "loss": 0.1497, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -6.1875, "rewards/margins": 4.4375, "rewards/rejected": -10.625, "step": 12250 }, { "epoch": 0.8850068577203494, "grad_norm": 8.608940672524163, "learning_rate": 1.9873649885196742e-08, "logits/chosen": -2.984375, "logits/rejected": -2.421875, "logps/chosen": -772.0, "logps/rejected": -1192.0, "loss": 0.149, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -6.25, "rewards/margins": 4.125, "rewards/rejected": -10.375, "step": 12260 }, { "epoch": 0.8857287230202844, "grad_norm": 8.76111445121565, "learning_rate": 1.9628228158181853e-08, "logits/chosen": -2.84375, "logits/rejected": -2.421875, "logps/chosen": -776.0, "logps/rejected": -1192.0, "loss": 0.158, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -6.0625, "rewards/margins": 4.34375, "rewards/rejected": -10.375, "step": 12270 }, { "epoch": 0.8864505883202195, "grad_norm": 9.726249616502288, "learning_rate": 1.93842692982214e-08, "logits/chosen": -2.84375, "logits/rejected": -2.46875, "logps/chosen": -780.0, "logps/rejected": -1168.0, "loss": 0.1367, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -6.1875, "rewards/margins": 4.0625, "rewards/rejected": -10.25, "step": 12280 }, { "epoch": 0.8871724536201545, "grad_norm": 9.856991665137961, "learning_rate": 1.9141774854461e-08, "logits/chosen": -2.875, "logits/rejected": -2.53125, "logps/chosen": -780.0, "logps/rejected": -1216.0, "loss": 0.1549, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -6.1875, "rewards/margins": 4.40625, "rewards/rejected": -10.625, "step": 12290 }, { "epoch": 0.8878943189200895, "grad_norm": 8.90097517455146, "learning_rate": 1.890074636674685e-08, "logits/chosen": -2.921875, "logits/rejected": -2.625, "logps/chosen": -784.0, "logps/rejected": -1152.0, "loss": 0.1622, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -6.03125, "rewards/margins": 4.09375, "rewards/rejected": -10.125, "step": 12300 }, { "epoch": 0.8886161842200245, "grad_norm": 11.01818428730531, "learning_rate": 1.8661185365616478e-08, "logits/chosen": -2.875, "logits/rejected": -2.65625, "logps/chosen": -752.0, "logps/rejected": -1192.0, "loss": 0.1413, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.96875, "rewards/margins": 4.375, "rewards/rejected": -10.3125, "step": 12310 }, { "epoch": 0.8893380495199595, "grad_norm": 11.263744199520602, "learning_rate": 1.842309337228884e-08, "logits/chosen": -2.875, "logits/rejected": -2.640625, "logps/chosen": -800.0, "logps/rejected": -1192.0, "loss": 0.1501, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -6.25, "rewards/margins": 4.1875, "rewards/rejected": -10.4375, "step": 12320 }, { "epoch": 0.8900599148198947, "grad_norm": 7.792414941928654, "learning_rate": 1.818647189865455e-08, "logits/chosen": -3.046875, "logits/rejected": -2.75, "logps/chosen": -748.0, "logps/rejected": -1200.0, "loss": 0.1541, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -5.875, "rewards/margins": 4.59375, "rewards/rejected": -10.5, "step": 12330 }, { "epoch": 0.8907817801198297, "grad_norm": 8.762492783110734, "learning_rate": 1.7951322447266493e-08, "logits/chosen": -2.859375, "logits/rejected": -2.5, "logps/chosen": -752.0, "logps/rejected": -1224.0, "loss": 0.1599, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.9375, "rewards/margins": 4.59375, "rewards/rejected": -10.5625, "step": 12340 }, { "epoch": 0.8915036454197647, "grad_norm": 12.278119822877175, "learning_rate": 1.7717646511330063e-08, "logits/chosen": -2.953125, "logits/rejected": -2.484375, "logps/chosen": -768.0, "logps/rejected": -1216.0, "loss": 0.1689, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.96875, "rewards/margins": 4.625, "rewards/rejected": -10.5625, "step": 12350 }, { "epoch": 0.8922255107196997, "grad_norm": 8.026983202327546, "learning_rate": 1.748544557469392e-08, "logits/chosen": -2.859375, "logits/rejected": -2.46875, "logps/chosen": -776.0, "logps/rejected": -1208.0, "loss": 0.1485, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -6.1875, "rewards/margins": 4.1875, "rewards/rejected": -10.375, "step": 12360 }, { "epoch": 0.8929473760196347, "grad_norm": 8.425357221302765, "learning_rate": 1.7254721111840287e-08, "logits/chosen": -2.875, "logits/rejected": -2.640625, "logps/chosen": -752.0, "logps/rejected": -1216.0, "loss": 0.1532, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -5.96875, "rewards/margins": 4.71875, "rewards/rejected": -10.6875, "step": 12370 }, { "epoch": 0.8936692413195698, "grad_norm": 9.644004550576527, "learning_rate": 1.7025474587875872e-08, "logits/chosen": -2.90625, "logits/rejected": -2.75, "logps/chosen": -760.0, "logps/rejected": -1160.0, "loss": 0.136, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.84375, "rewards/margins": 4.28125, "rewards/rejected": -10.125, "step": 12380 }, { "epoch": 0.8943911066195048, "grad_norm": 7.131646950070454, "learning_rate": 1.6797707458522382e-08, "logits/chosen": -2.84375, "logits/rejected": -2.59375, "logps/chosen": -776.0, "logps/rejected": -1208.0, "loss": 0.1411, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -6.125, "rewards/margins": 4.5, "rewards/rejected": -10.625, "step": 12390 }, { "epoch": 0.8951129719194398, "grad_norm": 8.868708466246948, "learning_rate": 1.6571421170107236e-08, "logits/chosen": -2.953125, "logits/rejected": -2.546875, "logps/chosen": -768.0, "logps/rejected": -1224.0, "loss": 0.1545, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -6.03125, "rewards/margins": 4.625, "rewards/rejected": -10.6875, "step": 12400 }, { "epoch": 0.8958348372193748, "grad_norm": 7.487849791891332, "learning_rate": 1.6346617159554628e-08, "logits/chosen": -2.84375, "logits/rejected": -2.59375, "logps/chosen": -780.0, "logps/rejected": -1160.0, "loss": 0.1536, "rewards/accuracies": 0.9375, "rewards/chosen": -6.09375, "rewards/margins": 4.03125, "rewards/rejected": -10.125, "step": 12410 }, { "epoch": 0.8965567025193099, "grad_norm": 8.438213927485114, "learning_rate": 1.6123296854376217e-08, "logits/chosen": -2.90625, "logits/rejected": -2.6875, "logps/chosen": -756.0, "logps/rejected": -1192.0, "loss": 0.1648, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.90625, "rewards/margins": 4.46875, "rewards/rejected": -10.375, "step": 12420 }, { "epoch": 0.897278567819245, "grad_norm": 10.754318102307618, "learning_rate": 1.5901461672661904e-08, "logits/chosen": -2.9375, "logits/rejected": -2.546875, "logps/chosen": -792.0, "logps/rejected": -1184.0, "loss": 0.1789, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -6.34375, "rewards/margins": 3.984375, "rewards/rejected": -10.3125, "step": 12430 }, { "epoch": 0.89800043311918, "grad_norm": 8.21147210255012, "learning_rate": 1.5681113023071318e-08, "logits/chosen": -2.890625, "logits/rejected": -2.46875, "logps/chosen": -788.0, "logps/rejected": -1232.0, "loss": 0.1399, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -6.3125, "rewards/margins": 4.34375, "rewards/rejected": -10.625, "step": 12440 }, { "epoch": 0.898722298419115, "grad_norm": 8.618776368547858, "learning_rate": 1.5462252304824368e-08, "logits/chosen": -2.8125, "logits/rejected": -2.5625, "logps/chosen": -796.0, "logps/rejected": -1232.0, "loss": 0.1313, "rewards/accuracies": 0.9375, "rewards/chosen": -6.09375, "rewards/margins": 4.5, "rewards/rejected": -10.5625, "step": 12450 }, { "epoch": 0.89944416371905, "grad_norm": 8.41385421629852, "learning_rate": 1.524488090769252e-08, "logits/chosen": -2.921875, "logits/rejected": -2.671875, "logps/chosen": -756.0, "logps/rejected": -1184.0, "loss": 0.1507, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.96875, "rewards/margins": 4.375, "rewards/rejected": -10.375, "step": 12460 }, { "epoch": 0.900166029018985, "grad_norm": 7.873140216517367, "learning_rate": 1.5029000211990216e-08, "logits/chosen": -2.828125, "logits/rejected": -2.578125, "logps/chosen": -796.0, "logps/rejected": -1216.0, "loss": 0.1449, "rewards/accuracies": 0.9375, "rewards/chosen": -6.25, "rewards/margins": 4.34375, "rewards/rejected": -10.5625, "step": 12470 }, { "epoch": 0.9008878943189201, "grad_norm": 9.814168221530482, "learning_rate": 1.4814611588565701e-08, "logits/chosen": -2.84375, "logits/rejected": -2.65625, "logps/chosen": -772.0, "logps/rejected": -1192.0, "loss": 0.1406, "rewards/accuracies": 0.9375, "rewards/chosen": -6.1875, "rewards/margins": 4.25, "rewards/rejected": -10.5, "step": 12480 }, { "epoch": 0.9016097596188551, "grad_norm": 10.539841397759815, "learning_rate": 1.4601716398792595e-08, "logits/chosen": -2.875, "logits/rejected": -2.609375, "logps/chosen": -804.0, "logps/rejected": -1200.0, "loss": 0.171, "rewards/accuracies": 0.9375, "rewards/chosen": -6.34375, "rewards/margins": 4.0625, "rewards/rejected": -10.4375, "step": 12490 }, { "epoch": 0.9023316249187902, "grad_norm": 9.225273086300604, "learning_rate": 1.4390315994561253e-08, "logits/chosen": -2.78125, "logits/rejected": -2.53125, "logps/chosen": -772.0, "logps/rejected": -1160.0, "loss": 0.149, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -6.125, "rewards/margins": 3.953125, "rewards/rejected": -10.0625, "step": 12500 }, { "epoch": 0.9030534902187252, "grad_norm": 8.885167039781129, "learning_rate": 1.4180411718269974e-08, "logits/chosen": -2.859375, "logits/rejected": -2.578125, "logps/chosen": -768.0, "logps/rejected": -1184.0, "loss": 0.1346, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -6.15625, "rewards/margins": 4.15625, "rewards/rejected": -10.3125, "step": 12510 }, { "epoch": 0.9037753555186602, "grad_norm": 9.145979733096528, "learning_rate": 1.3972004902816609e-08, "logits/chosen": -2.84375, "logits/rejected": -2.59375, "logps/chosen": -756.0, "logps/rejected": -1176.0, "loss": 0.1515, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -6.03125, "rewards/margins": 4.21875, "rewards/rejected": -10.25, "step": 12520 }, { "epoch": 0.9044972208185953, "grad_norm": 7.295474662843511, "learning_rate": 1.3765096871590248e-08, "logits/chosen": -2.734375, "logits/rejected": -2.5, "logps/chosen": -752.0, "logps/rejected": -1160.0, "loss": 0.1301, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -5.8125, "rewards/margins": 4.1875, "rewards/rejected": -10.0, "step": 12530 }, { "epoch": 0.9052190861185303, "grad_norm": 11.370111074734503, "learning_rate": 1.355968893846246e-08, "logits/chosen": -2.859375, "logits/rejected": -2.609375, "logps/chosen": -780.0, "logps/rejected": -1168.0, "loss": 0.1519, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -6.09375, "rewards/margins": 4.15625, "rewards/rejected": -10.25, "step": 12540 }, { "epoch": 0.9059409514184653, "grad_norm": 11.025095677328915, "learning_rate": 1.3355782407779292e-08, "logits/chosen": -2.84375, "logits/rejected": -2.5625, "logps/chosen": -764.0, "logps/rejected": -1232.0, "loss": 0.1532, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -6.0625, "rewards/margins": 4.6875, "rewards/rejected": -10.75, "step": 12550 }, { "epoch": 0.9066628167184003, "grad_norm": 6.549589867605967, "learning_rate": 1.3153378574352753e-08, "logits/chosen": -2.953125, "logits/rejected": -2.625, "logps/chosen": -784.0, "logps/rejected": -1176.0, "loss": 0.1384, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -6.21875, "rewards/margins": 4.03125, "rewards/rejected": -10.25, "step": 12560 }, { "epoch": 0.9073846820183353, "grad_norm": 10.439039283166451, "learning_rate": 1.2952478723452759e-08, "logits/chosen": -2.90625, "logits/rejected": -2.5, "logps/chosen": -772.0, "logps/rejected": -1192.0, "loss": 0.15, "rewards/accuracies": 0.9375, "rewards/chosen": -6.0625, "rewards/margins": 4.125, "rewards/rejected": -10.1875, "step": 12570 }, { "epoch": 0.9081065473182705, "grad_norm": 8.066549462633791, "learning_rate": 1.2753084130798841e-08, "logits/chosen": -2.9375, "logits/rejected": -2.484375, "logps/chosen": -752.0, "logps/rejected": -1168.0, "loss": 0.1514, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -6.0, "rewards/margins": 4.25, "rewards/rejected": -10.25, "step": 12580 }, { "epoch": 0.9088284126182055, "grad_norm": 9.16202650125988, "learning_rate": 1.2555196062552121e-08, "logits/chosen": -2.875, "logits/rejected": -2.484375, "logps/chosen": -768.0, "logps/rejected": -1200.0, "loss": 0.1475, "rewards/accuracies": 0.9375, "rewards/chosen": -5.9375, "rewards/margins": 4.5, "rewards/rejected": -10.4375, "step": 12590 }, { "epoch": 0.9095502779181405, "grad_norm": 9.653491629671723, "learning_rate": 1.2358815775307257e-08, "logits/chosen": -2.828125, "logits/rejected": -2.546875, "logps/chosen": -800.0, "logps/rejected": -1240.0, "loss": 0.1395, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -6.125, "rewards/margins": 4.4375, "rewards/rejected": -10.5625, "step": 12600 }, { "epoch": 0.9102721432180755, "grad_norm": 11.463300528930278, "learning_rate": 1.2163944516084434e-08, "logits/chosen": -2.9375, "logits/rejected": -2.515625, "logps/chosen": -760.0, "logps/rejected": -1248.0, "loss": 0.1523, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -6.0, "rewards/margins": 4.96875, "rewards/rejected": -10.9375, "step": 12610 }, { "epoch": 0.9109940085180105, "grad_norm": 7.787381760295542, "learning_rate": 1.197058352232147e-08, "logits/chosen": -3.0, "logits/rejected": -2.578125, "logps/chosen": -724.0, "logps/rejected": -1232.0, "loss": 0.1429, "rewards/accuracies": 0.96875, "rewards/chosen": -5.78125, "rewards/margins": 4.8125, "rewards/rejected": -10.5625, "step": 12620 }, { "epoch": 0.9117158738179456, "grad_norm": 10.056484595488875, "learning_rate": 1.1778734021866022e-08, "logits/chosen": -2.828125, "logits/rejected": -2.625, "logps/chosen": -760.0, "logps/rejected": -1160.0, "loss": 0.1529, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -6.03125, "rewards/margins": 4.28125, "rewards/rejected": -10.3125, "step": 12630 }, { "epoch": 0.9124377391178806, "grad_norm": 8.755038077817517, "learning_rate": 1.1588397232967561e-08, "logits/chosen": -2.8125, "logits/rejected": -2.515625, "logps/chosen": -720.0, "logps/rejected": -1200.0, "loss": 0.1524, "rewards/accuracies": 0.96875, "rewards/chosen": -5.625, "rewards/margins": 4.65625, "rewards/rejected": -10.25, "step": 12640 }, { "epoch": 0.9131596044178156, "grad_norm": 7.008042272492635, "learning_rate": 1.1399574364269997e-08, "logits/chosen": -3.0, "logits/rejected": -2.5625, "logps/chosen": -760.0, "logps/rejected": -1208.0, "loss": 0.145, "rewards/accuracies": 0.9375, "rewards/chosen": -5.90625, "rewards/margins": 4.5625, "rewards/rejected": -10.4375, "step": 12650 }, { "epoch": 0.9138814697177506, "grad_norm": 8.324802964335403, "learning_rate": 1.1212266614803706e-08, "logits/chosen": -3.015625, "logits/rejected": -2.625, "logps/chosen": -768.0, "logps/rejected": -1224.0, "loss": 0.1378, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -6.0, "rewards/margins": 4.53125, "rewards/rejected": -10.5625, "step": 12660 }, { "epoch": 0.9146033350176856, "grad_norm": 10.151515852087343, "learning_rate": 1.1026475173977978e-08, "logits/chosen": -2.828125, "logits/rejected": -2.59375, "logps/chosen": -764.0, "logps/rejected": -1216.0, "loss": 0.1576, "rewards/accuracies": 0.9375, "rewards/chosen": -5.9375, "rewards/margins": 4.625, "rewards/rejected": -10.5625, "step": 12670 }, { "epoch": 0.9153252003176208, "grad_norm": 10.157754434801875, "learning_rate": 1.0842201221573532e-08, "logits/chosen": -2.953125, "logits/rejected": -2.640625, "logps/chosen": -764.0, "logps/rejected": -1176.0, "loss": 0.1472, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -6.03125, "rewards/margins": 4.1875, "rewards/rejected": -10.1875, "step": 12680 }, { "epoch": 0.9160470656175558, "grad_norm": 7.591920449981847, "learning_rate": 1.0659445927735127e-08, "logits/chosen": -2.84375, "logits/rejected": -2.640625, "logps/chosen": -768.0, "logps/rejected": -1216.0, "loss": 0.1555, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -6.0625, "rewards/margins": 4.5, "rewards/rejected": -10.5625, "step": 12690 }, { "epoch": 0.9167689309174908, "grad_norm": 9.794363619142695, "learning_rate": 1.0478210452963737e-08, "logits/chosen": -2.765625, "logits/rejected": -2.515625, "logps/chosen": -776.0, "logps/rejected": -1216.0, "loss": 0.143, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -6.09375, "rewards/margins": 4.5, "rewards/rejected": -10.625, "step": 12700 }, { "epoch": 0.9174907962174258, "grad_norm": 9.309110081694072, "learning_rate": 1.0298495948109665e-08, "logits/chosen": -2.921875, "logits/rejected": -2.65625, "logps/chosen": -760.0, "logps/rejected": -1184.0, "loss": 0.1477, "rewards/accuracies": 0.9375, "rewards/chosen": -5.96875, "rewards/margins": 4.28125, "rewards/rejected": -10.25, "step": 12710 }, { "epoch": 0.9182126615173608, "grad_norm": 7.066887867505908, "learning_rate": 1.0120303554364912e-08, "logits/chosen": -2.953125, "logits/rejected": -2.59375, "logps/chosen": -756.0, "logps/rejected": -1184.0, "loss": 0.1435, "rewards/accuracies": 0.9375, "rewards/chosen": -6.0, "rewards/margins": 4.4375, "rewards/rejected": -10.4375, "step": 12720 }, { "epoch": 0.9189345268172959, "grad_norm": 11.301604093462545, "learning_rate": 9.943634403256046e-09, "logits/chosen": -2.84375, "logits/rejected": -2.578125, "logps/chosen": -748.0, "logps/rejected": -1232.0, "loss": 0.1421, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.96875, "rewards/margins": 4.6875, "rewards/rejected": -10.6875, "step": 12730 }, { "epoch": 0.9196563921172309, "grad_norm": 9.577802355257152, "learning_rate": 9.768489616637038e-09, "logits/chosen": -3.03125, "logits/rejected": -2.625, "logps/chosen": -776.0, "logps/rejected": -1168.0, "loss": 0.1649, "rewards/accuracies": 0.8687499761581421, "rewards/chosen": -6.25, "rewards/margins": 3.953125, "rewards/rejected": -10.1875, "step": 12740 }, { "epoch": 0.920378257417166, "grad_norm": 8.572385841169005, "learning_rate": 9.594870306682045e-09, "logits/chosen": -2.84375, "logits/rejected": -2.65625, "logps/chosen": -740.0, "logps/rejected": -1168.0, "loss": 0.1459, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.78125, "rewards/margins": 4.4375, "rewards/rejected": -10.1875, "step": 12750 }, { "epoch": 0.921100122717101, "grad_norm": 10.447641927889913, "learning_rate": 9.42277757587842e-09, "logits/chosen": -2.953125, "logits/rejected": -2.59375, "logps/chosen": -764.0, "logps/rejected": -1200.0, "loss": 0.1494, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -6.125, "rewards/margins": 4.34375, "rewards/rejected": -10.4375, "step": 12760 }, { "epoch": 0.9218219880170361, "grad_norm": 9.167052590543541, "learning_rate": 9.25221251701977e-09, "logits/chosen": -2.90625, "logits/rejected": -2.59375, "logps/chosen": -752.0, "logps/rejected": -1168.0, "loss": 0.1569, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -6.0, "rewards/margins": 4.0625, "rewards/rejected": -10.0625, "step": 12770 }, { "epoch": 0.9225438533169711, "grad_norm": 9.609226867480382, "learning_rate": 9.083176213198874e-09, "logits/chosen": -2.75, "logits/rejected": -2.4375, "logps/chosen": -760.0, "logps/rejected": -1192.0, "loss": 0.1546, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -6.0, "rewards/margins": 4.40625, "rewards/rejected": -10.375, "step": 12780 }, { "epoch": 0.9232657186169061, "grad_norm": 12.308594013486106, "learning_rate": 8.915669737800835e-09, "logits/chosen": -2.828125, "logits/rejected": -2.609375, "logps/chosen": -768.0, "logps/rejected": -1200.0, "loss": 0.1484, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -6.0625, "rewards/margins": 4.375, "rewards/rejected": -10.4375, "step": 12790 }, { "epoch": 0.9239875839168411, "grad_norm": 7.740941902213041, "learning_rate": 8.74969415449639e-09, "logits/chosen": -2.859375, "logits/rejected": -2.53125, "logps/chosen": -776.0, "logps/rejected": -1200.0, "loss": 0.1305, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -6.25, "rewards/margins": 4.21875, "rewards/rejected": -10.4375, "step": 12800 }, { "epoch": 0.9247094492167761, "grad_norm": 9.587184945397313, "learning_rate": 8.585250517235048e-09, "logits/chosen": -2.953125, "logits/rejected": -2.671875, "logps/chosen": -796.0, "logps/rejected": -1216.0, "loss": 0.1525, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -6.25, "rewards/margins": 4.34375, "rewards/rejected": -10.5625, "step": 12810 }, { "epoch": 0.9254313145167112, "grad_norm": 12.236899096306711, "learning_rate": 8.422339870238409e-09, "logits/chosen": -2.859375, "logits/rejected": -2.5, "logps/chosen": -764.0, "logps/rejected": -1192.0, "loss": 0.1401, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.9375, "rewards/margins": 4.375, "rewards/rejected": -10.3125, "step": 12820 }, { "epoch": 0.9261531798166462, "grad_norm": 9.335127467437971, "learning_rate": 8.26096324799347e-09, "logits/chosen": -2.921875, "logits/rejected": -2.59375, "logps/chosen": -756.0, "logps/rejected": -1192.0, "loss": 0.1642, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.96875, "rewards/margins": 4.4375, "rewards/rejected": -10.4375, "step": 12830 }, { "epoch": 0.9268750451165813, "grad_norm": 10.11030845129818, "learning_rate": 8.101121675246293e-09, "logits/chosen": -2.859375, "logits/rejected": -2.609375, "logps/chosen": -744.0, "logps/rejected": -1192.0, "loss": 0.1364, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.78125, "rewards/margins": 4.6875, "rewards/rejected": -10.4375, "step": 12840 }, { "epoch": 0.9275969104165163, "grad_norm": 9.949772616020681, "learning_rate": 7.942816166995187e-09, "logits/chosen": -2.90625, "logits/rejected": -2.5625, "logps/chosen": -772.0, "logps/rejected": -1176.0, "loss": 0.1612, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -6.03125, "rewards/margins": 4.3125, "rewards/rejected": -10.3125, "step": 12850 }, { "epoch": 0.9283187757164513, "grad_norm": 11.04520640854637, "learning_rate": 7.786047728484429e-09, "logits/chosen": -2.890625, "logits/rejected": -2.59375, "logps/chosen": -772.0, "logps/rejected": -1216.0, "loss": 0.1363, "rewards/accuracies": 0.96875, "rewards/chosen": -5.9375, "rewards/margins": 4.375, "rewards/rejected": -10.3125, "step": 12860 }, { "epoch": 0.9290406410163864, "grad_norm": 10.967381676803216, "learning_rate": 7.630817355197994e-09, "logits/chosen": -2.765625, "logits/rejected": -2.5, "logps/chosen": -748.0, "logps/rejected": -1128.0, "loss": 0.1426, "rewards/accuracies": 0.9375, "rewards/chosen": -5.9375, "rewards/margins": 4.0, "rewards/rejected": -9.9375, "step": 12870 }, { "epoch": 0.9297625063163214, "grad_norm": 9.36940835074148, "learning_rate": 7.477126032852888e-09, "logits/chosen": -2.96875, "logits/rejected": -2.6875, "logps/chosen": -776.0, "logps/rejected": -1192.0, "loss": 0.1423, "rewards/accuracies": 0.9375, "rewards/chosen": -6.1875, "rewards/margins": 4.15625, "rewards/rejected": -10.375, "step": 12880 }, { "epoch": 0.9304843716162564, "grad_norm": 6.9344949791967885, "learning_rate": 7.324974737393241e-09, "logits/chosen": -2.875, "logits/rejected": -2.578125, "logps/chosen": -792.0, "logps/rejected": -1200.0, "loss": 0.1347, "rewards/accuracies": 0.96875, "rewards/chosen": -6.09375, "rewards/margins": 4.5, "rewards/rejected": -10.625, "step": 12890 }, { "epoch": 0.9312062369161914, "grad_norm": 8.914498439457502, "learning_rate": 7.174364434984009e-09, "logits/chosen": -2.84375, "logits/rejected": -2.578125, "logps/chosen": -788.0, "logps/rejected": -1192.0, "loss": 0.1546, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -6.15625, "rewards/margins": 4.1875, "rewards/rejected": -10.375, "step": 12900 }, { "epoch": 0.9319281022161264, "grad_norm": 11.255791378742503, "learning_rate": 7.025296082004667e-09, "logits/chosen": -2.875, "logits/rejected": -2.609375, "logps/chosen": -764.0, "logps/rejected": -1184.0, "loss": 0.1693, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -6.125, "rewards/margins": 4.3125, "rewards/rejected": -10.4375, "step": 12910 }, { "epoch": 0.9326499675160616, "grad_norm": 10.43918973974646, "learning_rate": 6.8777706250433274e-09, "logits/chosen": -3.0, "logits/rejected": -2.59375, "logps/chosen": -784.0, "logps/rejected": -1208.0, "loss": 0.1538, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -6.0625, "rewards/margins": 4.15625, "rewards/rejected": -10.25, "step": 12920 }, { "epoch": 0.9333718328159966, "grad_norm": 9.338539505172553, "learning_rate": 6.731789000890775e-09, "logits/chosen": -2.90625, "logits/rejected": -2.546875, "logps/chosen": -760.0, "logps/rejected": -1192.0, "loss": 0.15, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -6.09375, "rewards/margins": 4.40625, "rewards/rejected": -10.5, "step": 12930 }, { "epoch": 0.9340936981159316, "grad_norm": 8.36112263605316, "learning_rate": 6.587352136534219e-09, "logits/chosen": -2.953125, "logits/rejected": -2.5625, "logps/chosen": -768.0, "logps/rejected": -1192.0, "loss": 0.1377, "rewards/accuracies": 0.9750000238418579, "rewards/chosen": -5.96875, "rewards/margins": 4.4375, "rewards/rejected": -10.4375, "step": 12940 }, { "epoch": 0.9348155634158666, "grad_norm": 8.797834148383416, "learning_rate": 6.444460949151714e-09, "logits/chosen": -2.984375, "logits/rejected": -2.546875, "logps/chosen": -748.0, "logps/rejected": -1176.0, "loss": 0.1499, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.84375, "rewards/margins": 4.4375, "rewards/rejected": -10.3125, "step": 12950 }, { "epoch": 0.9355374287158016, "grad_norm": 11.053337065925593, "learning_rate": 6.303116346106224e-09, "logits/chosen": -2.921875, "logits/rejected": -2.65625, "logps/chosen": -792.0, "logps/rejected": -1216.0, "loss": 0.1535, "rewards/accuracies": 0.90625, "rewards/chosen": -6.3125, "rewards/margins": 4.28125, "rewards/rejected": -10.5625, "step": 12960 }, { "epoch": 0.9362592940157367, "grad_norm": 11.276613104833107, "learning_rate": 6.163319224939872e-09, "logits/chosen": -2.734375, "logits/rejected": -2.65625, "logps/chosen": -756.0, "logps/rejected": -1184.0, "loss": 0.1325, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -5.96875, "rewards/margins": 4.3125, "rewards/rejected": -10.3125, "step": 12970 }, { "epoch": 0.9369811593156717, "grad_norm": 8.755018080988055, "learning_rate": 6.025070473368144e-09, "logits/chosen": -2.96875, "logits/rejected": -2.59375, "logps/chosen": -760.0, "logps/rejected": -1184.0, "loss": 0.1502, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -6.03125, "rewards/margins": 4.34375, "rewards/rejected": -10.375, "step": 12980 }, { "epoch": 0.9377030246156067, "grad_norm": 9.43774867419776, "learning_rate": 5.888370969274442e-09, "logits/chosen": -2.828125, "logits/rejected": -2.5, "logps/chosen": -772.0, "logps/rejected": -1152.0, "loss": 0.1572, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -6.09375, "rewards/margins": 4.09375, "rewards/rejected": -10.1875, "step": 12990 }, { "epoch": 0.9384248899155417, "grad_norm": 9.85434140441404, "learning_rate": 5.7532215807043486e-09, "logits/chosen": -2.90625, "logits/rejected": -2.546875, "logps/chosen": -768.0, "logps/rejected": -1184.0, "loss": 0.1319, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -6.15625, "rewards/margins": 4.34375, "rewards/rejected": -10.5, "step": 13000 }, { "epoch": 0.9391467552154767, "grad_norm": 7.193797068429037, "learning_rate": 5.6196231658601764e-09, "logits/chosen": -2.984375, "logits/rejected": -2.671875, "logps/chosen": -812.0, "logps/rejected": -1232.0, "loss": 0.1416, "rewards/accuracies": 0.96875, "rewards/chosen": -6.46875, "rewards/margins": 4.1875, "rewards/rejected": -10.6875, "step": 13010 }, { "epoch": 0.9398686205154119, "grad_norm": 12.631151758721385, "learning_rate": 5.48757657309551e-09, "logits/chosen": -2.890625, "logits/rejected": -2.5625, "logps/chosen": -740.0, "logps/rejected": -1176.0, "loss": 0.1462, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -5.75, "rewards/margins": 4.5625, "rewards/rejected": -10.3125, "step": 13020 }, { "epoch": 0.9405904858153469, "grad_norm": 5.307134460751131, "learning_rate": 5.357082640909866e-09, "logits/chosen": -2.9375, "logits/rejected": -2.5625, "logps/chosen": -744.0, "logps/rejected": -1184.0, "loss": 0.1358, "rewards/accuracies": 0.96875, "rewards/chosen": -5.9375, "rewards/margins": 4.3125, "rewards/rejected": -10.25, "step": 13030 }, { "epoch": 0.9413123511152819, "grad_norm": 10.087417447571848, "learning_rate": 5.22814219794318e-09, "logits/chosen": -2.890625, "logits/rejected": -2.625, "logps/chosen": -784.0, "logps/rejected": -1256.0, "loss": 0.1444, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -6.15625, "rewards/margins": 4.65625, "rewards/rejected": -10.8125, "step": 13040 }, { "epoch": 0.9420342164152169, "grad_norm": 7.00443265106439, "learning_rate": 5.10075606297089e-09, "logits/chosen": -2.90625, "logits/rejected": -2.5, "logps/chosen": -756.0, "logps/rejected": -1192.0, "loss": 0.1438, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -5.90625, "rewards/margins": 4.65625, "rewards/rejected": -10.5625, "step": 13050 }, { "epoch": 0.9427560817151519, "grad_norm": 7.793436936582348, "learning_rate": 4.974925044898437e-09, "logits/chosen": -2.796875, "logits/rejected": -2.515625, "logps/chosen": -788.0, "logps/rejected": -1208.0, "loss": 0.1479, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -6.21875, "rewards/margins": 4.21875, "rewards/rejected": -10.4375, "step": 13060 }, { "epoch": 0.943477947015087, "grad_norm": 6.458652354786663, "learning_rate": 4.850649942756135e-09, "logits/chosen": -2.84375, "logits/rejected": -2.65625, "logps/chosen": -780.0, "logps/rejected": -1160.0, "loss": 0.1339, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.96875, "rewards/margins": 4.125, "rewards/rejected": -10.0625, "step": 13070 }, { "epoch": 0.944199812315022, "grad_norm": 7.868041435801801, "learning_rate": 4.727931545694397e-09, "logits/chosen": -2.875, "logits/rejected": -2.53125, "logps/chosen": -760.0, "logps/rejected": -1192.0, "loss": 0.1424, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -6.0, "rewards/margins": 4.4375, "rewards/rejected": -10.4375, "step": 13080 }, { "epoch": 0.944921677614957, "grad_norm": 8.264459996035683, "learning_rate": 4.606770632978374e-09, "logits/chosen": -2.875, "logits/rejected": -2.4375, "logps/chosen": -772.0, "logps/rejected": -1184.0, "loss": 0.1518, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -6.15625, "rewards/margins": 4.1875, "rewards/rejected": -10.375, "step": 13090 }, { "epoch": 0.945643542914892, "grad_norm": 8.88295658076357, "learning_rate": 4.4871679739831304e-09, "logits/chosen": -2.953125, "logits/rejected": -2.59375, "logps/chosen": -784.0, "logps/rejected": -1216.0, "loss": 0.1439, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -6.09375, "rewards/margins": 4.28125, "rewards/rejected": -10.375, "step": 13100 }, { "epoch": 0.9463654082148271, "grad_norm": 20.8259081865564, "learning_rate": 4.369124328188839e-09, "logits/chosen": -2.921875, "logits/rejected": -2.671875, "logps/chosen": -772.0, "logps/rejected": -1184.0, "loss": 0.1665, "rewards/accuracies": 0.9375, "rewards/chosen": -6.15625, "rewards/margins": 4.28125, "rewards/rejected": -10.4375, "step": 13110 }, { "epoch": 0.9470872735147622, "grad_norm": 7.245245477976355, "learning_rate": 4.252640445175898e-09, "logits/chosen": -2.921875, "logits/rejected": -2.625, "logps/chosen": -784.0, "logps/rejected": -1216.0, "loss": 0.1335, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -6.03125, "rewards/margins": 4.5, "rewards/rejected": -10.5, "step": 13120 }, { "epoch": 0.9478091388146972, "grad_norm": 9.917996431238413, "learning_rate": 4.1377170646201555e-09, "logits/chosen": -2.796875, "logits/rejected": -2.5, "logps/chosen": -776.0, "logps/rejected": -1216.0, "loss": 0.1394, "rewards/accuracies": 0.9375, "rewards/chosen": -6.0625, "rewards/margins": 4.65625, "rewards/rejected": -10.6875, "step": 13130 }, { "epoch": 0.9485310041146322, "grad_norm": 11.746041159172476, "learning_rate": 4.024354916288192e-09, "logits/chosen": -2.921875, "logits/rejected": -2.609375, "logps/chosen": -768.0, "logps/rejected": -1184.0, "loss": 0.17, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -6.09375, "rewards/margins": 4.21875, "rewards/rejected": -10.3125, "step": 13140 }, { "epoch": 0.9492528694145672, "grad_norm": 7.791108577213938, "learning_rate": 3.912554720032796e-09, "logits/chosen": -2.796875, "logits/rejected": -2.578125, "logps/chosen": -784.0, "logps/rejected": -1192.0, "loss": 0.1555, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -6.1875, "rewards/margins": 4.28125, "rewards/rejected": -10.5, "step": 13150 }, { "epoch": 0.9499747347145022, "grad_norm": 7.770825664424211, "learning_rate": 3.8023171857882456e-09, "logits/chosen": -2.953125, "logits/rejected": -2.59375, "logps/chosen": -764.0, "logps/rejected": -1192.0, "loss": 0.1343, "rewards/accuracies": 0.9375, "rewards/chosen": -6.03125, "rewards/margins": 4.4375, "rewards/rejected": -10.5, "step": 13160 }, { "epoch": 0.9506966000144373, "grad_norm": 7.654311704309095, "learning_rate": 3.693643013565867e-09, "logits/chosen": -2.9375, "logits/rejected": -2.546875, "logps/chosen": -748.0, "logps/rejected": -1192.0, "loss": 0.1394, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.78125, "rewards/margins": 4.71875, "rewards/rejected": -10.5, "step": 13170 }, { "epoch": 0.9514184653143724, "grad_norm": 10.335438911558372, "learning_rate": 3.586532893449706e-09, "logits/chosen": -2.890625, "logits/rejected": -2.546875, "logps/chosen": -720.0, "logps/rejected": -1176.0, "loss": 0.1659, "rewards/accuracies": 0.96875, "rewards/chosen": -5.65625, "rewards/margins": 4.59375, "rewards/rejected": -10.25, "step": 13180 }, { "epoch": 0.9521403306143074, "grad_norm": 9.99678225643105, "learning_rate": 3.4809875055918923e-09, "logits/chosen": -2.921875, "logits/rejected": -2.703125, "logps/chosen": -764.0, "logps/rejected": -1208.0, "loss": 0.1307, "rewards/accuracies": 0.96875, "rewards/chosen": -6.0625, "rewards/margins": 4.5625, "rewards/rejected": -10.625, "step": 13190 }, { "epoch": 0.9528621959142424, "grad_norm": 6.490173084222523, "learning_rate": 3.3770075202085304e-09, "logits/chosen": -2.9375, "logits/rejected": -2.765625, "logps/chosen": -768.0, "logps/rejected": -1208.0, "loss": 0.1413, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -6.0, "rewards/margins": 4.46875, "rewards/rejected": -10.5, "step": 13200 }, { "epoch": 0.9535840612141774, "grad_norm": 8.060395264263372, "learning_rate": 3.274593597575398e-09, "logits/chosen": -2.953125, "logits/rejected": -2.625, "logps/chosen": -768.0, "logps/rejected": -1184.0, "loss": 0.1627, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -6.09375, "rewards/margins": 4.15625, "rewards/rejected": -10.25, "step": 13210 }, { "epoch": 0.9543059265141125, "grad_norm": 7.41254192877576, "learning_rate": 3.173746388023729e-09, "logits/chosen": -2.875, "logits/rejected": -2.453125, "logps/chosen": -784.0, "logps/rejected": -1248.0, "loss": 0.1404, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -6.09375, "rewards/margins": 4.75, "rewards/rejected": -10.8125, "step": 13220 }, { "epoch": 0.9550277918140475, "grad_norm": 11.024215888855808, "learning_rate": 3.074466531935993e-09, "logits/chosen": -2.9375, "logits/rejected": -2.65625, "logps/chosen": -752.0, "logps/rejected": -1192.0, "loss": 0.1485, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -5.9375, "rewards/margins": 4.5625, "rewards/rejected": -10.5, "step": 13230 }, { "epoch": 0.9557496571139825, "grad_norm": 11.151738805917098, "learning_rate": 2.976754659742037e-09, "logits/chosen": -2.875, "logits/rejected": -2.5, "logps/chosen": -784.0, "logps/rejected": -1192.0, "loss": 0.1603, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -6.03125, "rewards/margins": 4.28125, "rewards/rejected": -10.3125, "step": 13240 }, { "epoch": 0.9564715224139175, "grad_norm": 6.773241527202388, "learning_rate": 2.88061139191495e-09, "logits/chosen": -2.921875, "logits/rejected": -2.65625, "logps/chosen": -760.0, "logps/rejected": -1200.0, "loss": 0.1285, "rewards/accuracies": 0.9375, "rewards/chosen": -5.90625, "rewards/margins": 4.53125, "rewards/rejected": -10.4375, "step": 13250 }, { "epoch": 0.9571933877138527, "grad_norm": 15.814195118042852, "learning_rate": 2.7860373389670398e-09, "logits/chosen": -3.015625, "logits/rejected": -2.640625, "logps/chosen": -744.0, "logps/rejected": -1176.0, "loss": 0.1483, "rewards/accuracies": 0.981249988079071, "rewards/chosen": -5.875, "rewards/margins": 4.40625, "rewards/rejected": -10.25, "step": 13260 }, { "epoch": 0.9579152530137877, "grad_norm": 10.16676403861108, "learning_rate": 2.693033101446196e-09, "logits/chosen": -2.90625, "logits/rejected": -2.53125, "logps/chosen": -752.0, "logps/rejected": -1208.0, "loss": 0.1496, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.90625, "rewards/margins": 4.5, "rewards/rejected": -10.375, "step": 13270 }, { "epoch": 0.9586371183137227, "grad_norm": 8.485290989034366, "learning_rate": 2.6015992699318366e-09, "logits/chosen": -2.921875, "logits/rejected": -2.484375, "logps/chosen": -752.0, "logps/rejected": -1160.0, "loss": 0.1261, "rewards/accuracies": 0.956250011920929, "rewards/chosen": -5.9375, "rewards/margins": 4.3125, "rewards/rejected": -10.25, "step": 13280 }, { "epoch": 0.9593589836136577, "grad_norm": 9.904715194680257, "learning_rate": 2.5117364250312744e-09, "logits/chosen": -2.953125, "logits/rejected": -2.5, "logps/chosen": -760.0, "logps/rejected": -1208.0, "loss": 0.1563, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.96875, "rewards/margins": 4.65625, "rewards/rejected": -10.625, "step": 13290 }, { "epoch": 0.9600808489135927, "grad_norm": 12.293208072952874, "learning_rate": 2.4234451373761068e-09, "logits/chosen": -2.9375, "logits/rejected": -2.734375, "logps/chosen": -792.0, "logps/rejected": -1248.0, "loss": 0.1576, "rewards/accuracies": 0.96875, "rewards/chosen": -6.3125, "rewards/margins": 4.625, "rewards/rejected": -10.9375, "step": 13300 }, { "epoch": 0.9608027142135278, "grad_norm": 9.583806839385215, "learning_rate": 2.336725967618358e-09, "logits/chosen": -2.796875, "logits/rejected": -2.609375, "logps/chosen": -768.0, "logps/rejected": -1184.0, "loss": 0.154, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -6.09375, "rewards/margins": 4.1875, "rewards/rejected": -10.25, "step": 13310 }, { "epoch": 0.9615245795134628, "grad_norm": 9.704485535689619, "learning_rate": 2.2515794664271502e-09, "logits/chosen": -2.9375, "logits/rejected": -2.53125, "logps/chosen": -760.0, "logps/rejected": -1216.0, "loss": 0.1403, "rewards/accuracies": 0.9375, "rewards/chosen": -6.0, "rewards/margins": 4.625, "rewards/rejected": -10.625, "step": 13320 }, { "epoch": 0.9622464448133978, "grad_norm": 10.451439623478995, "learning_rate": 2.168006174485121e-09, "logits/chosen": -3.0, "logits/rejected": -2.65625, "logps/chosen": -768.0, "logps/rejected": -1216.0, "loss": 0.1545, "rewards/accuracies": 0.90625, "rewards/chosen": -6.125, "rewards/margins": 4.5625, "rewards/rejected": -10.75, "step": 13330 }, { "epoch": 0.9629683101133328, "grad_norm": 8.838700241798461, "learning_rate": 2.0860066224848983e-09, "logits/chosen": -2.828125, "logits/rejected": -2.53125, "logps/chosen": -784.0, "logps/rejected": -1208.0, "loss": 0.1344, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -6.15625, "rewards/margins": 4.1875, "rewards/rejected": -10.3125, "step": 13340 }, { "epoch": 0.9636901754132678, "grad_norm": 10.958902722065448, "learning_rate": 2.0055813311259383e-09, "logits/chosen": -2.96875, "logits/rejected": -2.59375, "logps/chosen": -764.0, "logps/rejected": -1216.0, "loss": 0.1581, "rewards/accuracies": 0.96875, "rewards/chosen": -6.09375, "rewards/margins": 4.53125, "rewards/rejected": -10.625, "step": 13350 }, { "epoch": 0.964412040713203, "grad_norm": 6.09181790905039, "learning_rate": 1.926730811111027e-09, "logits/chosen": -2.875, "logits/rejected": -2.5625, "logps/chosen": -772.0, "logps/rejected": -1184.0, "loss": 0.1414, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -6.15625, "rewards/margins": 4.0625, "rewards/rejected": -10.1875, "step": 13360 }, { "epoch": 0.965133906013138, "grad_norm": 9.88628572992933, "learning_rate": 1.849455563143143e-09, "logits/chosen": -2.921875, "logits/rejected": -2.65625, "logps/chosen": -784.0, "logps/rejected": -1216.0, "loss": 0.1567, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -6.1875, "rewards/margins": 4.4375, "rewards/rejected": -10.625, "step": 13370 }, { "epoch": 0.965855771313073, "grad_norm": 13.53292753569823, "learning_rate": 1.773756077922156e-09, "logits/chosen": -2.890625, "logits/rejected": -2.609375, "logps/chosen": -796.0, "logps/rejected": -1184.0, "loss": 0.1583, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -6.125, "rewards/margins": 4.09375, "rewards/rejected": -10.25, "step": 13380 }, { "epoch": 0.966577636613008, "grad_norm": 8.793000871412223, "learning_rate": 1.69963283614194e-09, "logits/chosen": -2.828125, "logits/rejected": -2.578125, "logps/chosen": -772.0, "logps/rejected": -1168.0, "loss": 0.155, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -6.03125, "rewards/margins": 4.15625, "rewards/rejected": -10.1875, "step": 13390 }, { "epoch": 0.967299501912943, "grad_norm": 8.92187666322989, "learning_rate": 1.6270863084870967e-09, "logits/chosen": -2.765625, "logits/rejected": -2.578125, "logps/chosen": -768.0, "logps/rejected": -1160.0, "loss": 0.1348, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.90625, "rewards/margins": 4.15625, "rewards/rejected": -10.0625, "step": 13400 }, { "epoch": 0.9680213672128781, "grad_norm": 7.727103982802486, "learning_rate": 1.5561169556300157e-09, "logits/chosen": -2.8125, "logits/rejected": -2.5, "logps/chosen": -756.0, "logps/rejected": -1192.0, "loss": 0.1426, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -6.03125, "rewards/margins": 4.3125, "rewards/rejected": -10.375, "step": 13410 }, { "epoch": 0.9687432325128131, "grad_norm": 10.615949449025017, "learning_rate": 1.4867252282280974e-09, "logits/chosen": -2.875, "logits/rejected": -2.46875, "logps/chosen": -772.0, "logps/rejected": -1224.0, "loss": 0.1412, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.90625, "rewards/margins": 4.71875, "rewards/rejected": -10.625, "step": 13420 }, { "epoch": 0.9694650978127481, "grad_norm": 8.424515914002487, "learning_rate": 1.4189115669206719e-09, "logits/chosen": -2.890625, "logits/rejected": -2.703125, "logps/chosen": -768.0, "logps/rejected": -1176.0, "loss": 0.1342, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -6.15625, "rewards/margins": 4.1875, "rewards/rejected": -10.375, "step": 13430 }, { "epoch": 0.9701869631126832, "grad_norm": 9.868921088219077, "learning_rate": 1.3526764023263082e-09, "logits/chosen": -2.9375, "logits/rejected": -2.6875, "logps/chosen": -768.0, "logps/rejected": -1168.0, "loss": 0.1618, "rewards/accuracies": 0.9375, "rewards/chosen": -5.9375, "rewards/margins": 4.1875, "rewards/rejected": -10.125, "step": 13440 }, { "epoch": 0.9709088284126182, "grad_norm": 12.402501755945687, "learning_rate": 1.288020155040176e-09, "logits/chosen": -3.0, "logits/rejected": -2.5625, "logps/chosen": -756.0, "logps/rejected": -1224.0, "loss": 0.1346, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -5.90625, "rewards/margins": 4.46875, "rewards/rejected": -10.375, "step": 13450 }, { "epoch": 0.9716306937125533, "grad_norm": 5.426424943097187, "learning_rate": 1.2249432356311874e-09, "logits/chosen": -2.90625, "logits/rejected": -2.734375, "logps/chosen": -752.0, "logps/rejected": -1168.0, "loss": 0.1481, "rewards/accuracies": 0.9375, "rewards/chosen": -6.0625, "rewards/margins": 4.3125, "rewards/rejected": -10.375, "step": 13460 }, { "epoch": 0.9723525590124883, "grad_norm": 9.000433341065145, "learning_rate": 1.163446044639499e-09, "logits/chosen": -2.9375, "logits/rejected": -2.515625, "logps/chosen": -768.0, "logps/rejected": -1232.0, "loss": 0.1623, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -6.15625, "rewards/margins": 4.6875, "rewards/rejected": -10.8125, "step": 13470 }, { "epoch": 0.9730744243124233, "grad_norm": 8.594542564403534, "learning_rate": 1.103528972573986e-09, "logits/chosen": -2.765625, "logits/rejected": -2.453125, "logps/chosen": -752.0, "logps/rejected": -1192.0, "loss": 0.1483, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -5.875, "rewards/margins": 4.5, "rewards/rejected": -10.375, "step": 13480 }, { "epoch": 0.9737962896123583, "grad_norm": 11.926460876248191, "learning_rate": 1.045192399909689e-09, "logits/chosen": -2.890625, "logits/rejected": -2.46875, "logps/chosen": -776.0, "logps/rejected": -1232.0, "loss": 0.1516, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -6.1875, "rewards/margins": 4.34375, "rewards/rejected": -10.5625, "step": 13490 }, { "epoch": 0.9745181549122933, "grad_norm": 8.469305025697546, "learning_rate": 9.884366970853986e-10, "logits/chosen": -2.96875, "logits/rejected": -2.59375, "logps/chosen": -760.0, "logps/rejected": -1216.0, "loss": 0.1545, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.9375, "rewards/margins": 4.78125, "rewards/rejected": -10.75, "step": 13500 }, { "epoch": 0.9752400202122284, "grad_norm": 9.638473562645952, "learning_rate": 9.332622245014355e-10, "logits/chosen": -2.859375, "logits/rejected": -2.578125, "logps/chosen": -764.0, "logps/rejected": -1216.0, "loss": 0.1504, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.90625, "rewards/margins": 4.6875, "rewards/rejected": -10.625, "step": 13510 }, { "epoch": 0.9759618855121635, "grad_norm": 10.982840589873115, "learning_rate": 8.796693325171522e-10, "logits/chosen": -2.921875, "logits/rejected": -2.65625, "logps/chosen": -768.0, "logps/rejected": -1200.0, "loss": 0.1414, "rewards/accuracies": 0.9375, "rewards/chosen": -6.09375, "rewards/margins": 4.40625, "rewards/rejected": -10.5, "step": 13520 }, { "epoch": 0.9766837508120985, "grad_norm": 9.160859372694532, "learning_rate": 8.276583614489352e-10, "logits/chosen": -2.875, "logits/rejected": -2.671875, "logps/chosen": -780.0, "logps/rejected": -1184.0, "loss": 0.1397, "rewards/accuracies": 0.9375, "rewards/chosen": -6.03125, "rewards/margins": 4.3125, "rewards/rejected": -10.375, "step": 13530 }, { "epoch": 0.9774056161120335, "grad_norm": 11.936529679612834, "learning_rate": 7.772296415678447e-10, "logits/chosen": -2.890625, "logits/rejected": -2.546875, "logps/chosen": -796.0, "logps/rejected": -1224.0, "loss": 0.1344, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -6.3125, "rewards/margins": 4.46875, "rewards/rejected": -10.8125, "step": 13540 }, { "epoch": 0.9781274814119685, "grad_norm": 7.009572464668358, "learning_rate": 7.283834930976451e-10, "logits/chosen": -3.0, "logits/rejected": -2.625, "logps/chosen": -752.0, "logps/rejected": -1192.0, "loss": 0.1445, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.9375, "rewards/margins": 4.5625, "rewards/rejected": -10.5, "step": 13550 }, { "epoch": 0.9788493467119036, "grad_norm": 7.948146385621628, "learning_rate": 6.811202262126947e-10, "logits/chosen": -2.890625, "logits/rejected": -2.59375, "logps/chosen": -780.0, "logps/rejected": -1240.0, "loss": 0.1409, "rewards/accuracies": 0.96875, "rewards/chosen": -6.125, "rewards/margins": 4.625, "rewards/rejected": -10.75, "step": 13560 }, { "epoch": 0.9795712120118386, "grad_norm": 8.433006482064645, "learning_rate": 6.354401410360588e-10, "logits/chosen": -2.953125, "logits/rejected": -2.65625, "logps/chosen": -760.0, "logps/rejected": -1176.0, "loss": 0.1257, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -6.09375, "rewards/margins": 4.34375, "rewards/rejected": -10.4375, "step": 13570 }, { "epoch": 0.9802930773117736, "grad_norm": 12.067512536747236, "learning_rate": 5.913435276374834e-10, "logits/chosen": -3.078125, "logits/rejected": -2.65625, "logps/chosen": -768.0, "logps/rejected": -1184.0, "loss": 0.163, "rewards/accuracies": 0.90625, "rewards/chosen": -6.15625, "rewards/margins": 4.15625, "rewards/rejected": -10.3125, "step": 13580 }, { "epoch": 0.9810149426117086, "grad_norm": 8.546742612397637, "learning_rate": 5.488306660317299e-10, "logits/chosen": -2.859375, "logits/rejected": -2.609375, "logps/chosen": -756.0, "logps/rejected": -1112.0, "loss": 0.1459, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": -6.0, "rewards/margins": 3.796875, "rewards/rejected": -9.8125, "step": 13590 }, { "epoch": 0.9817368079116436, "grad_norm": 10.59407530013682, "learning_rate": 5.079018261766044e-10, "logits/chosen": -2.953125, "logits/rejected": -2.5, "logps/chosen": -752.0, "logps/rejected": -1216.0, "loss": 0.15, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -5.78125, "rewards/margins": 4.6875, "rewards/rejected": -10.4375, "step": 13600 }, { "epoch": 0.9824586732115788, "grad_norm": 11.513879858085009, "learning_rate": 4.685572679713478e-10, "logits/chosen": -2.890625, "logits/rejected": -2.5625, "logps/chosen": -756.0, "logps/rejected": -1168.0, "loss": 0.153, "rewards/accuracies": 0.90625, "rewards/chosen": -5.84375, "rewards/margins": 4.28125, "rewards/rejected": -10.125, "step": 13610 }, { "epoch": 0.9831805385115138, "grad_norm": 11.717526217203766, "learning_rate": 4.3079724125499875e-10, "logits/chosen": -2.859375, "logits/rejected": -2.53125, "logps/chosen": -800.0, "logps/rejected": -1168.0, "loss": 0.1565, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -6.28125, "rewards/margins": 3.90625, "rewards/rejected": -10.1875, "step": 13620 }, { "epoch": 0.9839024038114488, "grad_norm": 8.065660623179564, "learning_rate": 3.9462198580475505e-10, "logits/chosen": -2.921875, "logits/rejected": -2.78125, "logps/chosen": -784.0, "logps/rejected": -1208.0, "loss": 0.1549, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -6.15625, "rewards/margins": 4.4375, "rewards/rejected": -10.5625, "step": 13630 }, { "epoch": 0.9846242691113838, "grad_norm": 11.648253958259497, "learning_rate": 3.6003173133447585e-10, "logits/chosen": -2.90625, "logits/rejected": -2.46875, "logps/chosen": -764.0, "logps/rejected": -1192.0, "loss": 0.1504, "rewards/accuracies": 0.918749988079071, "rewards/chosen": -6.03125, "rewards/margins": 4.40625, "rewards/rejected": -10.4375, "step": 13640 }, { "epoch": 0.9853461344113188, "grad_norm": 12.43000507016397, "learning_rate": 3.270266974932101e-10, "logits/chosen": -2.921875, "logits/rejected": -2.546875, "logps/chosen": -792.0, "logps/rejected": -1256.0, "loss": 0.1476, "rewards/accuracies": 0.9375, "rewards/chosen": -6.21875, "rewards/margins": 4.5, "rewards/rejected": -10.75, "step": 13650 }, { "epoch": 0.9860679997112539, "grad_norm": 10.176611290026623, "learning_rate": 2.956070938638644e-10, "logits/chosen": -3.03125, "logits/rejected": -2.59375, "logps/chosen": -736.0, "logps/rejected": -1232.0, "loss": 0.1565, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": -5.90625, "rewards/margins": 5.0, "rewards/rejected": -10.875, "step": 13660 }, { "epoch": 0.9867898650111889, "grad_norm": 8.384903385562643, "learning_rate": 2.6577311996175964e-10, "logits/chosen": -3.03125, "logits/rejected": -2.625, "logps/chosen": -760.0, "logps/rejected": -1224.0, "loss": 0.1404, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -6.125, "rewards/margins": 4.625, "rewards/rejected": -10.75, "step": 13670 }, { "epoch": 0.9875117303111239, "grad_norm": 7.9305338057329005, "learning_rate": 2.3752496523343767e-10, "logits/chosen": -3.03125, "logits/rejected": -2.640625, "logps/chosen": -756.0, "logps/rejected": -1184.0, "loss": 0.1398, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -6.0, "rewards/margins": 4.28125, "rewards/rejected": -10.3125, "step": 13680 }, { "epoch": 0.988233595611059, "grad_norm": 12.291251192914357, "learning_rate": 2.1086280905543984e-10, "logits/chosen": -2.875, "logits/rejected": -2.484375, "logps/chosen": -768.0, "logps/rejected": -1216.0, "loss": 0.1289, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.9375, "rewards/margins": 4.84375, "rewards/rejected": -10.75, "step": 13690 }, { "epoch": 0.988955460910994, "grad_norm": 6.115365197215902, "learning_rate": 1.8578682073322472e-10, "logits/chosen": -2.953125, "logits/rejected": -2.640625, "logps/chosen": -764.0, "logps/rejected": -1184.0, "loss": 0.128, "rewards/accuracies": 0.9750000238418579, "rewards/chosen": -5.96875, "rewards/margins": 4.4375, "rewards/rejected": -10.375, "step": 13700 }, { "epoch": 0.9896773262109291, "grad_norm": 11.676458111445147, "learning_rate": 1.6229715950000221e-10, "logits/chosen": -3.078125, "logits/rejected": -2.53125, "logps/chosen": -776.0, "logps/rejected": -1232.0, "loss": 0.1443, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -6.03125, "rewards/margins": 4.71875, "rewards/rejected": -10.75, "step": 13710 }, { "epoch": 0.9903991915108641, "grad_norm": 8.892462780201626, "learning_rate": 1.4039397451573455e-10, "logits/chosen": -2.828125, "logits/rejected": -2.5625, "logps/chosen": -756.0, "logps/rejected": -1152.0, "loss": 0.1338, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.84375, "rewards/margins": 4.40625, "rewards/rejected": -10.25, "step": 13720 }, { "epoch": 0.9911210568107991, "grad_norm": 8.896892206063134, "learning_rate": 1.2007740486624785e-10, "logits/chosen": -2.90625, "logits/rejected": -2.59375, "logps/chosen": -776.0, "logps/rejected": -1216.0, "loss": 0.1626, "rewards/accuracies": 0.9375, "rewards/chosen": -6.25, "rewards/margins": 4.34375, "rewards/rejected": -10.625, "step": 13730 }, { "epoch": 0.9918429221107341, "grad_norm": 8.41403414937158, "learning_rate": 1.0134757956234418e-10, "logits/chosen": -2.921875, "logits/rejected": -2.59375, "logps/chosen": -784.0, "logps/rejected": -1200.0, "loss": 0.1526, "rewards/accuracies": 0.9375, "rewards/chosen": -6.1875, "rewards/margins": 4.1875, "rewards/rejected": -10.375, "step": 13740 }, { "epoch": 0.9925647874106691, "grad_norm": 8.437786909628086, "learning_rate": 8.420461753891327e-11, "logits/chosen": -2.890625, "logits/rejected": -2.625, "logps/chosen": -752.0, "logps/rejected": -1168.0, "loss": 0.1509, "rewards/accuracies": 0.925000011920929, "rewards/chosen": -5.84375, "rewards/margins": 4.375, "rewards/rejected": -10.25, "step": 13750 }, { "epoch": 0.9932866527106042, "grad_norm": 9.160480007480118, "learning_rate": 6.864862765421087e-11, "logits/chosen": -2.921875, "logits/rejected": -2.703125, "logps/chosen": -752.0, "logps/rejected": -1184.0, "loss": 0.15, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.9375, "rewards/margins": 4.5, "rewards/rejected": -10.4375, "step": 13760 }, { "epoch": 0.9940085180105392, "grad_norm": 11.808273487978743, "learning_rate": 5.4679708689248095e-11, "logits/chosen": -2.96875, "logits/rejected": -2.71875, "logps/chosen": -756.0, "logps/rejected": -1176.0, "loss": 0.1254, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.9375, "rewards/margins": 4.40625, "rewards/rejected": -10.3125, "step": 13770 }, { "epoch": 0.9947303833104743, "grad_norm": 11.167829268938808, "learning_rate": 4.2297949346986606e-11, "logits/chosen": -2.90625, "logits/rejected": -2.484375, "logps/chosen": -760.0, "logps/rejected": -1192.0, "loss": 0.1435, "rewards/accuracies": 0.9375, "rewards/chosen": -5.90625, "rewards/margins": 4.375, "rewards/rejected": -10.25, "step": 13780 }, { "epoch": 0.9954522486104093, "grad_norm": 8.328945950486863, "learning_rate": 3.150342825197771e-11, "logits/chosen": -2.953125, "logits/rejected": -2.65625, "logps/chosen": -788.0, "logps/rejected": -1232.0, "loss": 0.1432, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": -6.21875, "rewards/margins": 4.4375, "rewards/rejected": -10.625, "step": 13790 }, { "epoch": 0.9961741139103444, "grad_norm": 8.527974081958734, "learning_rate": 2.2296213949696273e-11, "logits/chosen": -2.90625, "logits/rejected": -2.625, "logps/chosen": -788.0, "logps/rejected": -1184.0, "loss": 0.1509, "rewards/accuracies": 0.9312499761581421, "rewards/chosen": -6.1875, "rewards/margins": 3.984375, "rewards/rejected": -10.1875, "step": 13800 }, { "epoch": 0.9968959792102794, "grad_norm": 5.882710049110608, "learning_rate": 1.4676364906235362e-11, "logits/chosen": -2.875, "logits/rejected": -2.640625, "logps/chosen": -772.0, "logps/rejected": -1184.0, "loss": 0.1555, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -5.9375, "rewards/margins": 4.46875, "rewards/rejected": -10.375, "step": 13810 }, { "epoch": 0.9976178445102144, "grad_norm": 8.19009325593564, "learning_rate": 8.643929507834435e-12, "logits/chosen": -2.96875, "logits/rejected": -2.53125, "logps/chosen": -760.0, "logps/rejected": -1216.0, "loss": 0.1495, "rewards/accuracies": 0.981249988079071, "rewards/chosen": -6.0625, "rewards/margins": 4.59375, "rewards/rejected": -10.625, "step": 13820 }, { "epoch": 0.9983397098101494, "grad_norm": 8.07778039690577, "learning_rate": 4.198946060601782e-12, "logits/chosen": -2.984375, "logits/rejected": -2.71875, "logps/chosen": -776.0, "logps/rejected": -1200.0, "loss": 0.1558, "rewards/accuracies": 0.9437500238418579, "rewards/chosen": -6.0, "rewards/margins": 4.46875, "rewards/rejected": -10.5, "step": 13830 }, { "epoch": 0.9990615751100844, "grad_norm": 9.049466464418751, "learning_rate": 1.3414427903202242e-12, "logits/chosen": -2.796875, "logits/rejected": -2.53125, "logps/chosen": -776.0, "logps/rejected": -1240.0, "loss": 0.139, "rewards/accuracies": 0.9375, "rewards/chosen": -6.09375, "rewards/margins": 4.5, "rewards/rejected": -10.5625, "step": 13840 }, { "epoch": 0.9997834404100195, "grad_norm": 7.329571223136626, "learning_rate": 7.143784222507499e-14, "logits/chosen": -2.953125, "logits/rejected": -2.625, "logps/chosen": -772.0, "logps/rejected": -1192.0, "loss": 0.1357, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -6.0, "rewards/margins": 4.25, "rewards/rejected": -10.25, "step": 13850 }, { "epoch": 1.0, "step": 13853, "total_flos": 0.0, "train_loss": 0.0, "train_runtime": 39.4392, "train_samples_per_second": 44959.109, "train_steps_per_second": 351.249 } ], "logging_steps": 10, "max_steps": 13853, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 5000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 8, "trial_name": null, "trial_params": null }