{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.8599068434252956, "eval_steps": 500, "global_step": 900, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.004777260241251642, "grad_norm": 0.396484375, "learning_rate": 2.222222222222222e-08, "logits/chosen": -1.7133970260620117, "logits/rejected": -1.6876779794692993, "logps/chosen": -0.2796992361545563, "logps/rejected": -0.28187569975852966, "loss": 0.6895627379417419, "loss/core": 0.6895627379417419, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 2.4170753955841064, "rewards/margins": 1.4557363986968994, "rewards/rejected": 0.9613393545150757, "step": 5 }, { "epoch": 0.009554520482503284, "grad_norm": 2.28125, "learning_rate": 5e-08, "logits/chosen": -1.9638487100601196, "logits/rejected": -2.050144910812378, "logps/chosen": -0.28905805945396423, "logps/rejected": -0.2884846329689026, "loss": 0.6929782032966614, "loss/core": 0.6929782032966614, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 1.6930923461914062, "rewards/margins": 0.08007440716028214, "rewards/rejected": 1.6130180358886719, "step": 10 }, { "epoch": 0.014331780723754926, "grad_norm": 0.44140625, "learning_rate": 7.777777777777778e-08, "logits/chosen": -1.8020557165145874, "logits/rejected": -1.7314844131469727, "logps/chosen": -0.27712005376815796, "logps/rejected": -0.2847710847854614, "loss": 0.6906865239143372, "loss/core": 0.6906865239143372, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 2.1371042728424072, "rewards/margins": 1.0041325092315674, "rewards/rejected": 1.1329715251922607, "step": 15 }, { "epoch": 0.01910904096500657, "grad_norm": 0.3046875, "learning_rate": 1.0555555555555555e-07, "logits/chosen": -1.9990392923355103, "logits/rejected": -1.998739242553711, "logps/chosen": -0.3013564348220825, "logps/rejected": -0.28647691011428833, "loss": 0.6906139254570007, "loss/core": 0.6906139254570007, "rewards/accuracies": 0.875, "rewards/chosen": 1.9157869815826416, "rewards/margins": 1.0352976322174072, "rewards/rejected": 0.8804894685745239, "step": 20 }, { "epoch": 0.02388630120625821, "grad_norm": 0.2392578125, "learning_rate": 1.3333333333333334e-07, "logits/chosen": -1.9096256494522095, "logits/rejected": -1.9282000064849854, "logps/chosen": -0.2734399437904358, "logps/rejected": -0.2599286735057831, "loss": 0.6880686283111572, "loss/core": 0.6880686283111572, "rewards/accuracies": 0.824999988079071, "rewards/chosen": 3.8207664489746094, "rewards/margins": 2.1955325603485107, "rewards/rejected": 1.6252334117889404, "step": 25 }, { "epoch": 0.028663561447509853, "grad_norm": 0.59765625, "learning_rate": 1.611111111111111e-07, "logits/chosen": -2.0870721340179443, "logits/rejected": -2.0627994537353516, "logps/chosen": -0.30142563581466675, "logps/rejected": -0.32440415024757385, "loss": 0.6901697516441345, "loss/core": 0.6901697516441345, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": 2.26503849029541, "rewards/margins": 1.239709496498108, "rewards/rejected": 1.0253286361694336, "step": 30 }, { "epoch": 0.033440821688761495, "grad_norm": 0.12890625, "learning_rate": 1.8888888888888888e-07, "logits/chosen": -1.8673341274261475, "logits/rejected": -1.8807346820831299, "logps/chosen": -0.2671809196472168, "logps/rejected": -0.26550590991973877, "loss": 0.6895102262496948, "loss/core": 0.6895102262496948, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 2.6639485359191895, "rewards/margins": 1.506712555885315, "rewards/rejected": 1.157235860824585, "step": 35 }, { "epoch": 0.03821808193001314, "grad_norm": 0.421875, "learning_rate": 2.1666666666666667e-07, "logits/chosen": -1.6795200109481812, "logits/rejected": -1.7307487726211548, "logps/chosen": -0.2936388850212097, "logps/rejected": -0.2830830514431, "loss": 0.6864294409751892, "loss/core": 0.6864294409751892, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 4.467957019805908, "rewards/margins": 2.8773446083068848, "rewards/rejected": 1.5906131267547607, "step": 40 }, { "epoch": 0.04299534217126478, "grad_norm": 0.1943359375, "learning_rate": 2.4444444444444445e-07, "logits/chosen": -1.867241621017456, "logits/rejected": -1.9943357706069946, "logps/chosen": -0.28906434774398804, "logps/rejected": -0.28838273882865906, "loss": 0.690056562423706, "loss/core": 0.690056562423706, "rewards/accuracies": 0.949999988079071, "rewards/chosen": 2.092913866043091, "rewards/margins": 1.250601053237915, "rewards/rejected": 0.8423126935958862, "step": 45 }, { "epoch": 0.04777260241251642, "grad_norm": 0.94140625, "learning_rate": 2.7222222222222216e-07, "logits/chosen": -1.9381431341171265, "logits/rejected": -1.944374442100525, "logps/chosen": -0.2815219759941101, "logps/rejected": -0.28127673268318176, "loss": 0.6898090839385986, "loss/core": 0.6898090839385986, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 2.8812808990478516, "rewards/margins": 1.3943486213684082, "rewards/rejected": 1.4869322776794434, "step": 50 }, { "epoch": 0.05254986265376806, "grad_norm": 0.07958984375, "learning_rate": 3e-07, "logits/chosen": -1.9054334163665771, "logits/rejected": -1.8701159954071045, "logps/chosen": -0.28710708022117615, "logps/rejected": -0.28994759917259216, "loss": 0.6927647590637207, "loss/core": 0.6927647590637207, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 2.277327060699463, "rewards/margins": 0.2503672242164612, "rewards/rejected": 2.0269598960876465, "step": 55 }, { "epoch": 0.057327122895019705, "grad_norm": 3.265625, "learning_rate": 3.2777777777777776e-07, "logits/chosen": -1.8265936374664307, "logits/rejected": -1.817793846130371, "logps/chosen": -0.27443718910217285, "logps/rejected": -0.2840142548084259, "loss": 0.6916871666908264, "loss/core": 0.6916871666908264, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 2.1564693450927734, "rewards/margins": 0.6028232574462891, "rewards/rejected": 1.553646206855774, "step": 60 }, { "epoch": 0.06210438313627135, "grad_norm": 0.1669921875, "learning_rate": 3.5555555555555553e-07, "logits/chosen": -1.6590009927749634, "logits/rejected": -1.720873236656189, "logps/chosen": -0.3111419975757599, "logps/rejected": -0.304778516292572, "loss": 0.688835859298706, "loss/core": 0.688835859298706, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 2.9504354000091553, "rewards/margins": 1.7633116245269775, "rewards/rejected": 1.1871236562728882, "step": 65 }, { "epoch": 0.06688164337752299, "grad_norm": 0.462890625, "learning_rate": 3.8333333333333335e-07, "logits/chosen": -1.652000069618225, "logits/rejected": -1.681039571762085, "logps/chosen": -0.37990865111351013, "logps/rejected": -0.29802781343460083, "loss": 0.6898948550224304, "loss/core": 0.6898948550224304, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": 3.6380057334899902, "rewards/margins": 1.4650633335113525, "rewards/rejected": 2.1729423999786377, "step": 70 }, { "epoch": 0.07165890361877464, "grad_norm": 0.12890625, "learning_rate": 4.1111111111111107e-07, "logits/chosen": -1.710818886756897, "logits/rejected": -1.736729383468628, "logps/chosen": -0.31785252690315247, "logps/rejected": -0.2882820963859558, "loss": 0.6908040642738342, "loss/core": 0.6908040642738342, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": 2.5783510208129883, "rewards/margins": 0.9765921831130981, "rewards/rejected": 1.6017587184906006, "step": 75 }, { "epoch": 0.07643616386002627, "grad_norm": 0.1689453125, "learning_rate": 4.3888888888888884e-07, "logits/chosen": -1.7501447200775146, "logits/rejected": -1.8643512725830078, "logps/chosen": -0.2600446045398712, "logps/rejected": -0.27591589093208313, "loss": 0.6883189082145691, "loss/core": 0.6883189082145691, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 3.2465500831604004, "rewards/margins": 2.013552188873291, "rewards/rejected": 1.2329976558685303, "step": 80 }, { "epoch": 0.08121342410127792, "grad_norm": 0.2001953125, "learning_rate": 4.6666666666666666e-07, "logits/chosen": -1.8498824834823608, "logits/rejected": -1.8502506017684937, "logps/chosen": -0.30674856901168823, "logps/rejected": -0.27847328782081604, "loss": 0.6879407167434692, "loss/core": 0.6879407167434692, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 3.505821943283081, "rewards/margins": 2.1826915740966797, "rewards/rejected": 1.323130488395691, "step": 85 }, { "epoch": 0.08599068434252956, "grad_norm": 0.0810546875, "learning_rate": 4.944444444444445e-07, "logits/chosen": -2.03493595123291, "logits/rejected": -2.0456414222717285, "logps/chosen": -0.28171059489250183, "logps/rejected": -0.29523080587387085, "loss": 0.6909321546554565, "loss/core": 0.6909321546554565, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 1.7502819299697876, "rewards/margins": 0.8973544836044312, "rewards/rejected": 0.8529273867607117, "step": 90 }, { "epoch": 0.09076794458378121, "grad_norm": 0.37890625, "learning_rate": 4.999699149323369e-07, "logits/chosen": -1.6194324493408203, "logits/rejected": -1.6468042135238647, "logps/chosen": -0.2668497860431671, "logps/rejected": -0.27971798181533813, "loss": 0.6904693841934204, "loss/core": 0.6904693841934204, "rewards/accuracies": 0.875, "rewards/chosen": 3.2152295112609863, "rewards/margins": 1.1187059879302979, "rewards/rejected": 2.0965230464935303, "step": 95 }, { "epoch": 0.09554520482503284, "grad_norm": 0.19921875, "learning_rate": 4.998477067547739e-07, "logits/chosen": -1.8947890996932983, "logits/rejected": -1.9110848903656006, "logps/chosen": -0.2584729790687561, "logps/rejected": -0.24682433903217316, "loss": 0.6902803182601929, "loss/core": 0.6902803182601929, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 2.4498555660247803, "rewards/margins": 1.1651194095611572, "rewards/rejected": 1.2847360372543335, "step": 100 }, { "epoch": 0.10032246506628449, "grad_norm": 0.67578125, "learning_rate": 4.996315410727229e-07, "logits/chosen": -1.93181574344635, "logits/rejected": -1.9506447315216064, "logps/chosen": -0.283364474773407, "logps/rejected": -0.27992352843284607, "loss": 0.6902110576629639, "loss/core": 0.6902110576629639, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 2.005598306655884, "rewards/margins": 1.2088587284088135, "rewards/rejected": 0.7967394590377808, "step": 105 }, { "epoch": 0.10509972530753613, "grad_norm": 0.1845703125, "learning_rate": 4.993214991772562e-07, "logits/chosen": -1.7346656322479248, "logits/rejected": -1.6285288333892822, "logps/chosen": -0.33683377504348755, "logps/rejected": -0.29718539118766785, "loss": 0.6869697570800781, "loss/core": 0.6869697570800781, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 4.486939907073975, "rewards/margins": 2.5928866863250732, "rewards/rejected": 1.8940532207489014, "step": 110 }, { "epoch": 0.10987698554878778, "grad_norm": 0.859375, "learning_rate": 4.989176976624511e-07, "logits/chosen": -1.63823664188385, "logits/rejected": -1.5655968189239502, "logps/chosen": -0.30025607347488403, "logps/rejected": -0.3001025915145874, "loss": 0.6923608183860779, "loss/core": 0.6923608183860779, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 1.7768100500106812, "rewards/margins": 0.34278303384780884, "rewards/rejected": 1.434027075767517, "step": 115 }, { "epoch": 0.11465424579003941, "grad_norm": 1.65625, "learning_rate": 4.984202883815428e-07, "logits/chosen": -1.682744026184082, "logits/rejected": -1.6865253448486328, "logps/chosen": -0.30211514234542847, "logps/rejected": -0.29606205224990845, "loss": 0.6914452910423279, "loss/core": 0.6914452910423279, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 1.8103902339935303, "rewards/margins": 0.6875762343406677, "rewards/rejected": 1.1228139400482178, "step": 120 }, { "epoch": 0.11943150603129106, "grad_norm": 0.130859375, "learning_rate": 4.978294583898195e-07, "logits/chosen": -1.8059618473052979, "logits/rejected": -1.8209705352783203, "logps/chosen": -0.2989288568496704, "logps/rejected": -0.3068915009498596, "loss": 0.6905549168586731, "loss/core": 0.6905549168586731, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 2.0661938190460205, "rewards/margins": 1.0517460107803345, "rewards/rejected": 1.0144474506378174, "step": 125 }, { "epoch": 0.1242087662725427, "grad_norm": 0.27734375, "learning_rate": 4.971454298742779e-07, "logits/chosen": -1.6160223484039307, "logits/rejected": -1.7299797534942627, "logps/chosen": -0.27980923652648926, "logps/rejected": -0.2786286771297455, "loss": 0.6908574104309082, "loss/core": 0.6908574104309082, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 1.8091075420379639, "rewards/margins": 0.9205910563468933, "rewards/rejected": 0.8885166049003601, "step": 130 }, { "epoch": 0.12898602651379434, "grad_norm": 0.408203125, "learning_rate": 4.963684600700678e-07, "logits/chosen": -1.771058440208435, "logits/rejected": -1.842339277267456, "logps/chosen": -0.3017735481262207, "logps/rejected": -0.29897257685661316, "loss": 0.6880813837051392, "loss/core": 0.6880813837051392, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 3.3773961067199707, "rewards/margins": 2.0708842277526855, "rewards/rejected": 1.3065119981765747, "step": 135 }, { "epoch": 0.13376328675504598, "grad_norm": 0.1669921875, "learning_rate": 4.954988411637571e-07, "logits/chosen": -2.0918688774108887, "logits/rejected": -2.117227077484131, "logps/chosen": -0.28260543942451477, "logps/rejected": -0.28928446769714355, "loss": 0.6908842325210571, "loss/core": 0.6908842325210571, "rewards/accuracies": 0.875, "rewards/chosen": 1.6272077560424805, "rewards/margins": 0.9105762243270874, "rewards/rejected": 0.7166314721107483, "step": 140 }, { "epoch": 0.13854054699629761, "grad_norm": 0.1630859375, "learning_rate": 4.945369001834514e-07, "logits/chosen": -1.5617491006851196, "logits/rejected": -1.5613640546798706, "logps/chosen": -0.3025224804878235, "logps/rejected": -0.3009711802005768, "loss": 0.6887967586517334, "loss/core": 0.6887967586517334, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 3.592343807220459, "rewards/margins": 1.7993513345718384, "rewards/rejected": 1.7929922342300415, "step": 145 }, { "epoch": 0.14331780723754928, "grad_norm": 0.404296875, "learning_rate": 4.93482998875813e-07, "logits/chosen": -1.913665771484375, "logits/rejected": -1.9741178750991821, "logps/chosen": -0.3164519667625427, "logps/rejected": -0.30851152539253235, "loss": 0.6878332495689392, "loss/core": 0.6878332495689392, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 3.6481528282165527, "rewards/margins": 2.1936802864074707, "rewards/rejected": 1.4544728994369507, "step": 150 }, { "epoch": 0.1480950674788009, "grad_norm": 0.2041015625, "learning_rate": 4.923375335700223e-07, "logits/chosen": -1.8092594146728516, "logits/rejected": -1.8692359924316406, "logps/chosen": -0.284790575504303, "logps/rejected": -0.2954999506473541, "loss": 0.6881645917892456, "loss/core": 0.6881645917892456, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 2.8475961685180664, "rewards/margins": 2.052863597869873, "rewards/rejected": 0.7947325110435486, "step": 155 }, { "epoch": 0.15287232772005255, "grad_norm": 0.91015625, "learning_rate": 4.911009350287347e-07, "logits/chosen": -1.7557824850082397, "logits/rejected": -1.7192802429199219, "logps/chosen": -0.3111857771873474, "logps/rejected": -0.3161669075489044, "loss": 0.6890115737915039, "loss/core": 0.6890115737915039, "rewards/accuracies": 0.949999988079071, "rewards/chosen": 3.1435818672180176, "rewards/margins": 1.7508246898651123, "rewards/rejected": 1.3927572965621948, "step": 160 }, { "epoch": 0.15764958796130418, "grad_norm": 0.2294921875, "learning_rate": 4.897736682860885e-07, "logits/chosen": -1.7782700061798096, "logits/rejected": -1.7287534475326538, "logps/chosen": -0.31163567304611206, "logps/rejected": -0.3064088225364685, "loss": 0.69112628698349, "loss/core": 0.69112628698349, "rewards/accuracies": 0.875, "rewards/chosen": 1.5969486236572266, "rewards/margins": 0.8150261044502258, "rewards/rejected": 0.7819225788116455, "step": 165 }, { "epoch": 0.16242684820255585, "grad_norm": 0.8828125, "learning_rate": 4.883562324728241e-07, "logits/chosen": -1.8792940378189087, "logits/rejected": -1.8148422241210938, "logps/chosen": -0.27398645877838135, "logps/rejected": -0.2596638798713684, "loss": 0.6938985586166382, "loss/core": 0.6938985586166382, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 2.6043877601623535, "rewards/margins": -0.16653324663639069, "rewards/rejected": 2.770921230316162, "step": 170 }, { "epoch": 0.16720410844380748, "grad_norm": 1.359375, "learning_rate": 4.868491606285823e-07, "logits/chosen": -1.7575905323028564, "logits/rejected": -1.772924780845642, "logps/chosen": -0.28738316893577576, "logps/rejected": -0.3002680242061615, "loss": 0.6899343729019165, "loss/core": 0.6899343729019165, "rewards/accuracies": 0.987500011920929, "rewards/chosen": 2.5785281658172607, "rewards/margins": 1.3044723272323608, "rewards/rejected": 1.274056077003479, "step": 175 }, { "epoch": 0.17198136868505912, "grad_norm": 1.453125, "learning_rate": 4.852530195014489e-07, "logits/chosen": -1.8603105545043945, "logits/rejected": -1.8089433908462524, "logps/chosen": -0.2715868353843689, "logps/rejected": -0.26199498772621155, "loss": 0.6889883279800415, "loss/core": 0.6889883279800415, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 3.23846697807312, "rewards/margins": 1.7489553689956665, "rewards/rejected": 1.4895117282867432, "step": 180 }, { "epoch": 0.17675862892631075, "grad_norm": 0.16015625, "learning_rate": 4.835684093348244e-07, "logits/chosen": -1.9552524089813232, "logits/rejected": -1.9065921306610107, "logps/chosen": -0.2885257303714752, "logps/rejected": -0.2921094298362732, "loss": 0.6921087503433228, "loss/core": 0.6921087503433228, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 1.0444104671478271, "rewards/margins": 0.41770505905151367, "rewards/rejected": 0.6267052888870239, "step": 185 }, { "epoch": 0.18153588916756241, "grad_norm": 0.341796875, "learning_rate": 4.817959636416969e-07, "logits/chosen": -1.9302583932876587, "logits/rejected": -1.9251024723052979, "logps/chosen": -0.2820015251636505, "logps/rejected": -0.2878292202949524, "loss": 0.6891991496086121, "loss/core": 0.6891991496086121, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 2.8541626930236816, "rewards/margins": 1.6507861614227295, "rewards/rejected": 1.2033761739730835, "step": 190 }, { "epoch": 0.18631314940881405, "grad_norm": 0.2275390625, "learning_rate": 4.799363489664039e-07, "logits/chosen": -1.654236078262329, "logits/rejected": -1.6461032629013062, "logps/chosen": -0.2908519208431244, "logps/rejected": -0.2898189425468445, "loss": 0.6891365051269531, "loss/core": 0.6891365051269531, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 2.66994047164917, "rewards/margins": 1.7045999765396118, "rewards/rejected": 0.9653403162956238, "step": 195 }, { "epoch": 0.19109040965006568, "grad_norm": 0.205078125, "learning_rate": 4.779902646339721e-07, "logits/chosen": -1.722882628440857, "logits/rejected": -1.7433340549468994, "logps/chosen": -0.3230392038822174, "logps/rejected": -0.31719517707824707, "loss": 0.689689040184021, "loss/core": 0.689689040184021, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": 2.6197898387908936, "rewards/margins": 1.4049842357635498, "rewards/rejected": 1.2148058414459229, "step": 200 }, { "epoch": 0.19586766989131732, "grad_norm": 0.138671875, "learning_rate": 4.759584424871301e-07, "logits/chosen": -1.8010181188583374, "logits/rejected": -1.880504846572876, "logps/chosen": -0.25066837668418884, "logps/rejected": -0.2679479718208313, "loss": 0.6904597282409668, "loss/core": 0.6904597282409668, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 3.283839702606201, "rewards/margins": 1.1656420230865479, "rewards/rejected": 2.1181979179382324, "step": 205 }, { "epoch": 0.20064493013256898, "grad_norm": 0.353515625, "learning_rate": 4.738416466110917e-07, "logits/chosen": -1.8253402709960938, "logits/rejected": -1.8085130453109741, "logps/chosen": -0.3120880722999573, "logps/rejected": -0.3225416839122772, "loss": 0.6898230314254761, "loss/core": 0.6898230314254761, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 2.835217237472534, "rewards/margins": 1.358270525932312, "rewards/rejected": 1.4769468307495117, "step": 210 }, { "epoch": 0.20542219037382062, "grad_norm": 0.345703125, "learning_rate": 4.716406730462153e-07, "logits/chosen": -1.854882836341858, "logits/rejected": -1.812995195388794, "logps/chosen": -0.2745797038078308, "logps/rejected": -0.2867583930492401, "loss": 0.689670205116272, "loss/core": 0.689670205116272, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 3.2003917694091797, "rewards/margins": 1.5229412317276, "rewards/rejected": 1.6774505376815796, "step": 215 }, { "epoch": 0.21019945061507225, "grad_norm": 0.353515625, "learning_rate": 4.693563494886454e-07, "logits/chosen": -1.7740695476531982, "logits/rejected": -1.7250359058380127, "logps/chosen": -0.30255165696144104, "logps/rejected": -0.30088987946510315, "loss": 0.6911439895629883, "loss/core": 0.6911439895629883, "rewards/accuracies": 0.875, "rewards/chosen": 1.885136365890503, "rewards/margins": 0.8066938519477844, "rewards/rejected": 1.0784424543380737, "step": 220 }, { "epoch": 0.2149767108563239, "grad_norm": 0.193359375, "learning_rate": 4.6698953497905016e-07, "logits/chosen": -1.8212635517120361, "logits/rejected": -1.884863257408142, "logps/chosen": -0.2905574440956116, "logps/rejected": -0.2746399939060211, "loss": 0.6877695918083191, "loss/core": 0.6877695918083191, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 3.6224703788757324, "rewards/margins": 2.204864501953125, "rewards/rejected": 1.417605996131897, "step": 225 }, { "epoch": 0.21975397109757555, "grad_norm": 1.875, "learning_rate": 4.645411195795709e-07, "logits/chosen": -1.955877661705017, "logits/rejected": -1.9922053813934326, "logps/chosen": -0.28303641080856323, "logps/rejected": -0.305550754070282, "loss": 0.6905184984207153, "loss/core": 0.6905184984207153, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 1.8412774801254272, "rewards/margins": 1.0649278163909912, "rewards/rejected": 0.776349663734436, "step": 230 }, { "epoch": 0.2245312313388272, "grad_norm": 0.2451171875, "learning_rate": 4.6201202403910643e-07, "logits/chosen": -1.695408821105957, "logits/rejected": -1.7123172283172607, "logps/chosen": -0.2921196520328522, "logps/rejected": -0.2863583266735077, "loss": 0.691733717918396, "loss/core": 0.691733717918396, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 1.9099562168121338, "rewards/margins": 0.5792465806007385, "rewards/rejected": 1.33070969581604, "step": 235 }, { "epoch": 0.22930849158007882, "grad_norm": 0.2353515625, "learning_rate": 4.594031994470573e-07, "logits/chosen": -1.7617086172103882, "logits/rejected": -1.7821518182754517, "logps/chosen": -0.2942032217979431, "logps/rejected": -0.2943900525569916, "loss": 0.6913124918937683, "loss/core": 0.6913124918937683, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 1.7612661123275757, "rewards/margins": 0.7373276948928833, "rewards/rejected": 1.023938536643982, "step": 240 }, { "epoch": 0.23408575182133046, "grad_norm": 1.8515625, "learning_rate": 4.567156268756593e-07, "logits/chosen": -1.919356346130371, "logits/rejected": -1.896200180053711, "logps/chosen": -0.2767832577228546, "logps/rejected": -0.29151099920272827, "loss": 0.6873155832290649, "loss/core": 0.6873155832290649, "rewards/accuracies": 0.875, "rewards/chosen": 3.6117758750915527, "rewards/margins": 2.4639251232147217, "rewards/rejected": 1.1478503942489624, "step": 245 }, { "epoch": 0.23886301206258212, "grad_norm": 0.29296875, "learning_rate": 4.5395031701104303e-07, "logits/chosen": -1.6390726566314697, "logits/rejected": -1.6990959644317627, "logps/chosen": -0.3004065454006195, "logps/rejected": -0.2949826121330261, "loss": 0.6900212168693542, "loss/core": 0.6900212168693542, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": 2.3332924842834473, "rewards/margins": 1.2689025402069092, "rewards/rejected": 1.0643898248672485, "step": 250 }, { "epoch": 0.24364027230383375, "grad_norm": 0.1708984375, "learning_rate": 4.511083097731555e-07, "logits/chosen": -1.8358352184295654, "logits/rejected": -1.8455946445465088, "logps/chosen": -0.28558123111724854, "logps/rejected": -0.28805023431777954, "loss": 0.6910611391067505, "loss/core": 0.6910611391067505, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 2.444948673248291, "rewards/margins": 0.8477497100830078, "rewards/rejected": 1.597198724746704, "step": 255 }, { "epoch": 0.2484175325450854, "grad_norm": 0.08935546875, "learning_rate": 4.481906739246894e-07, "logits/chosen": -1.9092012643814087, "logits/rejected": -1.9937626123428345, "logps/chosen": -0.28719645738601685, "logps/rejected": -0.2705669701099396, "loss": 0.691189169883728, "loss/core": 0.691189169883728, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 2.4050984382629395, "rewards/margins": 0.8234094381332397, "rewards/rejected": 1.5816890001296997, "step": 260 }, { "epoch": 0.25319479278633705, "grad_norm": 0.08447265625, "learning_rate": 4.451985066691648e-07, "logits/chosen": -1.7978445291519165, "logits/rejected": -1.8153514862060547, "logps/chosen": -0.29918935894966125, "logps/rejected": -0.30210354924201965, "loss": 0.6931018233299255, "loss/core": 0.6931018233299255, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 1.2333295345306396, "rewards/margins": 0.06469568610191345, "rewards/rejected": 1.1686336994171143, "step": 265 }, { "epoch": 0.2579720530275887, "grad_norm": 0.16015625, "learning_rate": 4.421329332383158e-07, "logits/chosen": -1.6397037506103516, "logits/rejected": -1.7484862804412842, "logps/chosen": -0.2880600392818451, "logps/rejected": -0.2899312376976013, "loss": 0.6904688477516174, "loss/core": 0.6904688477516174, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 3.2856483459472656, "rewards/margins": 1.1514227390289307, "rewards/rejected": 2.134225606918335, "step": 270 }, { "epoch": 0.2627493132688403, "grad_norm": 1.3125, "learning_rate": 4.3899510646893696e-07, "logits/chosen": -1.868186593055725, "logits/rejected": -1.8120629787445068, "logps/chosen": -0.29679086804389954, "logps/rejected": -0.29938483238220215, "loss": 0.6903032064437866, "loss/core": 0.6903032064437866, "rewards/accuracies": 0.9375, "rewards/chosen": 2.321898937225342, "rewards/margins": 1.151911735534668, "rewards/rejected": 1.1699872016906738, "step": 275 }, { "epoch": 0.26752657351009196, "grad_norm": 0.1435546875, "learning_rate": 4.357862063693485e-07, "logits/chosen": -1.7666244506835938, "logits/rejected": -1.7176767587661743, "logps/chosen": -0.28811368346214294, "logps/rejected": -0.3051670491695404, "loss": 0.6900285482406616, "loss/core": 0.6900285482406616, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 2.0461502075195312, "rewards/margins": 1.2626762390136719, "rewards/rejected": 0.7834742069244385, "step": 280 }, { "epoch": 0.2723038337513436, "grad_norm": 0.8359375, "learning_rate": 4.3250743967564364e-07, "logits/chosen": -1.8882230520248413, "logits/rejected": -1.8435192108154297, "logps/chosen": -0.2955285310745239, "logps/rejected": -0.2927626669406891, "loss": 0.6907385587692261, "loss/core": 0.6907385587692261, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": 2.62160325050354, "rewards/margins": 0.9927070736885071, "rewards/rejected": 1.6288961172103882, "step": 285 }, { "epoch": 0.27708109399259523, "grad_norm": 1.984375, "learning_rate": 4.29160039397884e-07, "logits/chosen": -1.8738224506378174, "logits/rejected": -1.9035943746566772, "logps/chosen": -0.2865127623081207, "logps/rejected": -0.28757035732269287, "loss": 0.6931725740432739, "loss/core": 0.6931725740432739, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 1.4819949865341187, "rewards/margins": 0.02711881324648857, "rewards/rejected": 1.454876184463501, "step": 290 }, { "epoch": 0.28185835423384686, "grad_norm": 0.171875, "learning_rate": 4.2574526435641546e-07, "logits/chosen": -2.1733994483947754, "logits/rejected": -2.1729981899261475, "logps/chosen": -0.24496681988239288, "logps/rejected": -0.25612831115722656, "loss": 0.6915844082832336, "loss/core": 0.6915844082832336, "rewards/accuracies": 0.949999988079071, "rewards/chosen": 1.3056122064590454, "rewards/margins": 0.6268185973167419, "rewards/rejected": 0.6787935495376587, "step": 295 }, { "epoch": 0.28663561447509855, "grad_norm": 2.359375, "learning_rate": 4.22264398708477e-07, "logits/chosen": -1.5950920581817627, "logits/rejected": -1.6194194555282593, "logps/chosen": -0.31406429409980774, "logps/rejected": -0.3146823048591614, "loss": 0.6867777109146118, "loss/core": 0.6867777109146118, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 3.7072041034698486, "rewards/margins": 2.6247377395629883, "rewards/rejected": 1.08246648311615, "step": 300 }, { "epoch": 0.2914128747163502, "grad_norm": 0.2119140625, "learning_rate": 4.187187514652819e-07, "logits/chosen": -1.7839601039886475, "logits/rejected": -1.8283946514129639, "logps/chosen": -0.27006229758262634, "logps/rejected": -0.25947099924087524, "loss": 0.6900721788406372, "loss/core": 0.6900721788406372, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 2.1529765129089355, "rewards/margins": 1.242806077003479, "rewards/rejected": 0.9101703763008118, "step": 305 }, { "epoch": 0.2961901349576018, "grad_norm": 2.5, "learning_rate": 4.151096559997519e-07, "logits/chosen": -1.8296064138412476, "logits/rejected": -1.7307389974594116, "logps/chosen": -0.2725442945957184, "logps/rejected": -0.27926790714263916, "loss": 0.6918596625328064, "loss/core": 0.6918596625328064, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 2.6172053813934326, "rewards/margins": 0.5880039930343628, "rewards/rejected": 2.029201030731201, "step": 310 }, { "epoch": 0.30096739519885346, "grad_norm": 0.158203125, "learning_rate": 4.114384695450905e-07, "logits/chosen": -1.722001314163208, "logits/rejected": -1.8182132244110107, "logps/chosen": -0.26871687173843384, "logps/rejected": -0.2755733132362366, "loss": 0.6892502903938293, "loss/core": 0.6892502903938293, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 2.917477607727051, "rewards/margins": 1.570624828338623, "rewards/rejected": 1.3468530178070068, "step": 315 }, { "epoch": 0.3057446554401051, "grad_norm": 0.134765625, "learning_rate": 4.077065726843828e-07, "logits/chosen": -1.7197027206420898, "logits/rejected": -1.6908174753189087, "logps/chosen": -0.2902878522872925, "logps/rejected": -0.29251793026924133, "loss": 0.6922987103462219, "loss/core": 0.6922987103462219, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": 1.5793731212615967, "rewards/margins": 0.34973055124282837, "rewards/rejected": 1.229642629623413, "step": 320 }, { "epoch": 0.31052191568135673, "grad_norm": 1.2578125, "learning_rate": 4.039153688314145e-07, "logits/chosen": -1.9648669958114624, "logits/rejected": -1.9164518117904663, "logps/chosen": -0.2875637114048004, "logps/rejected": -0.28430742025375366, "loss": 0.688163697719574, "loss/core": 0.688163697719574, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": 3.6862456798553467, "rewards/margins": 2.1581714153289795, "rewards/rejected": 1.5280741453170776, "step": 325 }, { "epoch": 0.31529917592260837, "grad_norm": 0.103515625, "learning_rate": 4.0006628370290613e-07, "logits/chosen": -1.8999824523925781, "logits/rejected": -1.8628829717636108, "logps/chosen": -0.2762024998664856, "logps/rejected": -0.2705720365047455, "loss": 0.6908760070800781, "loss/core": 0.6908760070800781, "rewards/accuracies": 0.949999988079071, "rewards/chosen": 2.054731845855713, "rewards/margins": 0.9240147471427917, "rewards/rejected": 1.130717158317566, "step": 330 }, { "epoch": 0.32007643616386, "grad_norm": 3.0, "learning_rate": 3.9616076478235826e-07, "logits/chosen": -1.8090893030166626, "logits/rejected": -1.8052091598510742, "logps/chosen": -0.30249348282814026, "logps/rejected": -0.31619948148727417, "loss": 0.6897532343864441, "loss/core": 0.6897532343864441, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 2.117969036102295, "rewards/margins": 1.4059538841247559, "rewards/rejected": 0.7120150327682495, "step": 335 }, { "epoch": 0.3248536964051117, "grad_norm": 1.0390625, "learning_rate": 3.922002807757129e-07, "logits/chosen": -1.8413950204849243, "logits/rejected": -1.9030017852783203, "logps/chosen": -0.2811221480369568, "logps/rejected": -0.28223514556884766, "loss": 0.6902806162834167, "loss/core": 0.6902806162834167, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 2.029637575149536, "rewards/margins": 1.1650125980377197, "rewards/rejected": 0.8646249771118164, "step": 340 }, { "epoch": 0.3296309566463633, "grad_norm": 0.259765625, "learning_rate": 3.8818632105903315e-07, "logits/chosen": -1.8142598867416382, "logits/rejected": -1.8903926610946655, "logps/chosen": -0.28178513050079346, "logps/rejected": -0.29352661967277527, "loss": 0.6911460757255554, "loss/core": 0.6911460757255554, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 1.6476151943206787, "rewards/margins": 0.8132193684577942, "rewards/rejected": 0.8343957662582397, "step": 345 }, { "epoch": 0.33440821688761496, "grad_norm": 0.2060546875, "learning_rate": 3.841203951184094e-07, "logits/chosen": -1.8314239978790283, "logits/rejected": -1.8243396282196045, "logps/chosen": -0.2603296935558319, "logps/rejected": -0.2569552958011627, "loss": 0.6905307769775391, "loss/core": 0.6905307769775391, "rewards/accuracies": 0.875, "rewards/chosen": 1.9986594915390015, "rewards/margins": 1.056462287902832, "rewards/rejected": 0.9421975016593933, "step": 350 }, { "epoch": 0.3391854771288666, "grad_norm": 0.201171875, "learning_rate": 3.800040319823038e-07, "logits/chosen": -1.7914011478424072, "logits/rejected": -1.8717437982559204, "logps/chosen": -0.2806769907474518, "logps/rejected": -0.2930828928947449, "loss": 0.691979169845581, "loss/core": 0.691979169845581, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 1.851120948791504, "rewards/margins": 0.5048354864120483, "rewards/rejected": 1.346285343170166, "step": 355 }, { "epoch": 0.34396273737011823, "grad_norm": 1.40625, "learning_rate": 3.75838779646545e-07, "logits/chosen": -1.856149673461914, "logits/rejected": -1.932403326034546, "logps/chosen": -0.2797439694404602, "logps/rejected": -0.2799036204814911, "loss": 0.6898868680000305, "loss/core": 0.6898868680000305, "rewards/accuracies": 0.875, "rewards/chosen": 2.6374688148498535, "rewards/margins": 1.3426095247268677, "rewards/rejected": 1.2948594093322754, "step": 360 }, { "epoch": 0.34873999761136987, "grad_norm": 1.0390625, "learning_rate": 3.7162620449218993e-07, "logits/chosen": -1.8249025344848633, "logits/rejected": -1.8712995052337646, "logps/chosen": -0.28412720561027527, "logps/rejected": -0.28386378288269043, "loss": 0.6882467865943909, "loss/core": 0.6882467865943909, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 2.882859945297241, "rewards/margins": 2.0732054710388184, "rewards/rejected": 0.8096548318862915, "step": 365 }, { "epoch": 0.3535172578526215, "grad_norm": 0.384765625, "learning_rate": 3.673678906964727e-07, "logits/chosen": -1.9151166677474976, "logits/rejected": -2.025606155395508, "logps/chosen": -0.28493157029151917, "logps/rejected": -0.28482019901275635, "loss": 0.6917159557342529, "loss/core": 0.6917159557342529, "rewards/accuracies": 0.875, "rewards/chosen": 1.6433870792388916, "rewards/margins": 0.576850175857544, "rewards/rejected": 1.0665369033813477, "step": 370 }, { "epoch": 0.35829451809387314, "grad_norm": 0.1875, "learning_rate": 3.6306543963705936e-07, "logits/chosen": -1.7109639644622803, "logits/rejected": -1.7306935787200928, "logps/chosen": -0.25769031047821045, "logps/rejected": -0.25766560435295105, "loss": 0.6912951469421387, "loss/core": 0.6912951469421387, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 3.024385929107666, "rewards/margins": 0.7996337413787842, "rewards/rejected": 2.22475266456604, "step": 375 }, { "epoch": 0.36307177833512483, "grad_norm": 0.26171875, "learning_rate": 3.5872046928983623e-07, "logits/chosen": -1.8375533819198608, "logits/rejected": -1.8777393102645874, "logps/chosen": -0.2792344093322754, "logps/rejected": -0.2905234694480896, "loss": 0.6921393871307373, "loss/core": 0.6921393871307373, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 2.058870315551758, "rewards/margins": 0.4689110219478607, "rewards/rejected": 1.5899592638015747, "step": 380 }, { "epoch": 0.36784903857637646, "grad_norm": 0.361328125, "learning_rate": 3.5433461362045447e-07, "logits/chosen": -1.8220224380493164, "logits/rejected": -1.8235307931900024, "logps/chosen": -0.2701142430305481, "logps/rejected": -0.27504315972328186, "loss": 0.6915521621704102, "loss/core": 0.6915521621704102, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": 2.1791160106658936, "rewards/margins": 0.6585676670074463, "rewards/rejected": 1.5205484628677368, "step": 385 }, { "epoch": 0.3726262988176281, "grad_norm": 0.1103515625, "learning_rate": 3.4990952196986305e-07, "logits/chosen": -1.6957165002822876, "logits/rejected": -1.7675812244415283, "logps/chosen": -0.30696994066238403, "logps/rejected": -0.3029830753803253, "loss": 0.6909955739974976, "loss/core": 0.6909955739974976, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 1.7640354633331299, "rewards/margins": 0.8730796575546265, "rewards/rejected": 0.8909558057785034, "step": 390 }, { "epoch": 0.37740355905887973, "grad_norm": 0.3359375, "learning_rate": 3.4544685843405875e-07, "logits/chosen": -1.924168348312378, "logits/rejected": -1.979353666305542, "logps/chosen": -0.2945513129234314, "logps/rejected": -0.2900546193122864, "loss": 0.6909527778625488, "loss/core": 0.6909527778625488, "rewards/accuracies": 0.9750000238418579, "rewards/chosen": 1.686589241027832, "rewards/margins": 0.8840621113777161, "rewards/rejected": 0.8025272488594055, "step": 395 }, { "epoch": 0.38218081930013137, "grad_norm": 0.2373046875, "learning_rate": 3.4094830123828786e-07, "logits/chosen": -1.6329810619354248, "logits/rejected": -1.6912469863891602, "logps/chosen": -0.28971177339553833, "logps/rejected": -0.2938389778137207, "loss": 0.6880810260772705, "loss/core": 0.6880810260772705, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 2.956228256225586, "rewards/margins": 2.1219091415405273, "rewards/rejected": 0.8343192934989929, "step": 400 }, { "epoch": 0.386958079541383, "grad_norm": 0.1748046875, "learning_rate": 3.3641554210593414e-07, "logits/chosen": -1.8328759670257568, "logits/rejected": -1.867147445678711, "logps/chosen": -0.31374454498291016, "logps/rejected": -0.3037855923175812, "loss": 0.6904991269111633, "loss/core": 0.6904991269111633, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 2.327601432800293, "rewards/margins": 1.0923205614089966, "rewards/rejected": 1.2352811098098755, "step": 405 }, { "epoch": 0.39173533978263464, "grad_norm": 0.2216796875, "learning_rate": 3.3185028562233107e-07, "logits/chosen": -2.08441424369812, "logits/rejected": -2.0821681022644043, "logps/chosen": -0.27686241269111633, "logps/rejected": -0.288194864988327, "loss": 0.6909042596817017, "loss/core": 0.6909042596817017, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 2.0894763469696045, "rewards/margins": 0.9023572206497192, "rewards/rejected": 1.1871192455291748, "step": 410 }, { "epoch": 0.3965126000238863, "grad_norm": 0.22265625, "learning_rate": 3.272542485937368e-07, "logits/chosen": -1.667150855064392, "logits/rejected": -1.7496572732925415, "logps/chosen": -0.32961294054985046, "logps/rejected": -0.32087013125419617, "loss": 0.6915945410728455, "loss/core": 0.6915945410728455, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 1.0019575357437134, "rewards/margins": 0.6251779794692993, "rewards/rejected": 0.37677961587905884, "step": 415 }, { "epoch": 0.40128986026513797, "grad_norm": 0.609375, "learning_rate": 3.226291594017137e-07, "logits/chosen": -2.015800952911377, "logits/rejected": -2.012826919555664, "logps/chosen": -0.28343337774276733, "logps/rejected": -0.29794415831565857, "loss": 0.6899334192276001, "loss/core": 0.6899334192276001, "rewards/accuracies": 0.9375, "rewards/chosen": 2.0445852279663086, "rewards/margins": 1.314929723739624, "rewards/rejected": 0.7296555638313293, "step": 420 }, { "epoch": 0.4060671205063896, "grad_norm": 0.8984375, "learning_rate": 3.1797675735315454e-07, "logits/chosen": -1.7338758707046509, "logits/rejected": -1.8056646585464478, "logps/chosen": -0.291433185338974, "logps/rejected": -0.2666085660457611, "loss": 0.691834032535553, "loss/core": 0.691834032535553, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 2.2369046211242676, "rewards/margins": 0.6058995127677917, "rewards/rejected": 1.6310052871704102, "step": 425 }, { "epoch": 0.41084438074764124, "grad_norm": 1.0, "learning_rate": 3.1329879202620047e-07, "logits/chosen": -1.8133704662322998, "logits/rejected": -1.8503717184066772, "logps/chosen": -0.2787948548793793, "logps/rejected": -0.2662429213523865, "loss": 0.6860483884811401, "loss/core": 0.6860483884811401, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 4.410374641418457, "rewards/margins": 2.9887146949768066, "rewards/rejected": 1.4216595888137817, "step": 430 }, { "epoch": 0.41562164098889287, "grad_norm": 0.2431640625, "learning_rate": 3.0859702261229613e-07, "logits/chosen": -2.042301893234253, "logits/rejected": -1.9976842403411865, "logps/chosen": -0.27745509147644043, "logps/rejected": -0.29362621903419495, "loss": 0.6915836334228516, "loss/core": 0.6915836334228516, "rewards/accuracies": 0.824999988079071, "rewards/chosen": 1.6335694789886475, "rewards/margins": 0.6322575807571411, "rewards/rejected": 1.0013117790222168, "step": 435 }, { "epoch": 0.4203989012301445, "grad_norm": 0.97265625, "learning_rate": 3.0387321725463e-07, "logits/chosen": -1.752429723739624, "logits/rejected": -1.7554237842559814, "logps/chosen": -0.2960103452205658, "logps/rejected": -0.3004111647605896, "loss": 0.6891411542892456, "loss/core": 0.6891411542892456, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": 3.0792078971862793, "rewards/margins": 1.6967817544937134, "rewards/rejected": 1.3824257850646973, "step": 440 }, { "epoch": 0.42517616147139614, "grad_norm": 0.369140625, "learning_rate": 2.991291523832075e-07, "logits/chosen": -1.6757290363311768, "logits/rejected": -1.6205558776855469, "logps/chosen": -0.2944514751434326, "logps/rejected": -0.29790419340133667, "loss": 0.689667284488678, "loss/core": 0.689667284488678, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": 2.9721293449401855, "rewards/margins": 1.4168652296066284, "rewards/rejected": 1.5552639961242676, "step": 445 }, { "epoch": 0.4299534217126478, "grad_norm": 1.6953125, "learning_rate": 2.943666120468088e-07, "logits/chosen": -1.6464523077011108, "logits/rejected": -1.6663997173309326, "logps/chosen": -0.29781681299209595, "logps/rejected": -0.29050326347351074, "loss": 0.6886329054832458, "loss/core": 0.6886329054832458, "rewards/accuracies": 0.949999988079071, "rewards/chosen": 3.4628093242645264, "rewards/margins": 1.8670060634613037, "rewards/rejected": 1.5958033800125122, "step": 450 }, { "epoch": 0.4347306819538994, "grad_norm": 0.58203125, "learning_rate": 2.8958738724208073e-07, "logits/chosen": -1.641239881515503, "logits/rejected": -1.832718849182129, "logps/chosen": -0.324314147233963, "logps/rejected": -0.31268811225891113, "loss": 0.688445508480072, "loss/core": 0.688445508480072, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 3.4496636390686035, "rewards/margins": 1.958392858505249, "rewards/rejected": 1.4912705421447754, "step": 455 }, { "epoch": 0.4395079421951511, "grad_norm": 0.419921875, "learning_rate": 2.8479327524001633e-07, "logits/chosen": -1.6839364767074585, "logits/rejected": -1.7105252742767334, "logps/chosen": -0.2922411262989044, "logps/rejected": -0.3082396388053894, "loss": 0.688636839389801, "loss/core": 0.688636839389801, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 3.7023568153381348, "rewards/margins": 1.8497339487075806, "rewards/rejected": 1.852622389793396, "step": 460 }, { "epoch": 0.44428520243640274, "grad_norm": 0.166015625, "learning_rate": 2.7998607891007493e-07, "logits/chosen": -1.5535634756088257, "logits/rejected": -1.6348403692245483, "logps/chosen": -0.29626718163490295, "logps/rejected": -0.29167088866233826, "loss": 0.6897278428077698, "loss/core": 0.6897278428077698, "rewards/accuracies": 0.949999988079071, "rewards/chosen": 2.309946298599243, "rewards/margins": 1.3803914785385132, "rewards/rejected": 0.9295549392700195, "step": 465 }, { "epoch": 0.4490624626776544, "grad_norm": 1.859375, "learning_rate": 2.7516760604219616e-07, "logits/chosen": -1.8788540363311768, "logits/rejected": -1.9592180252075195, "logps/chosen": -0.27540072798728943, "logps/rejected": -0.2596161961555481, "loss": 0.6886305809020996, "loss/core": 0.6886305809020996, "rewards/accuracies": 0.949999988079071, "rewards/chosen": 3.0465798377990723, "rewards/margins": 1.8731689453125, "rewards/rejected": 1.1734110116958618, "step": 470 }, { "epoch": 0.453839722918906, "grad_norm": 0.6640625, "learning_rate": 2.703396686669646e-07, "logits/chosen": -1.8047220706939697, "logits/rejected": -1.782589316368103, "logps/chosen": -0.2949548363685608, "logps/rejected": -0.31417742371559143, "loss": 0.6925175786018372, "loss/core": 0.6925175786018372, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 1.8359830379486084, "rewards/margins": 0.3028287887573242, "rewards/rejected": 1.5331543684005737, "step": 475 }, { "epoch": 0.45861698316015764, "grad_norm": 0.19140625, "learning_rate": 2.6550408237417884e-07, "logits/chosen": -1.9774296283721924, "logits/rejected": -2.0623116493225098, "logps/chosen": -0.27460455894470215, "logps/rejected": -0.27350351214408875, "loss": 0.6898782849311829, "loss/core": 0.6898782849311829, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 2.366447687149048, "rewards/margins": 1.3521076440811157, "rewards/rejected": 1.0143399238586426, "step": 480 }, { "epoch": 0.4633942434014093, "grad_norm": 0.173828125, "learning_rate": 2.6066266563008265e-07, "logits/chosen": -2.0387158393859863, "logits/rejected": -2.014871120452881, "logps/chosen": -0.2912241816520691, "logps/rejected": -0.2957185208797455, "loss": 0.6910130381584167, "loss/core": 0.6910130381584167, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 1.7464618682861328, "rewards/margins": 0.8589704632759094, "rewards/rejected": 0.8874912261962891, "step": 485 }, { "epoch": 0.4681715036426609, "grad_norm": 0.33203125, "learning_rate": 2.5581723909351404e-07, "logits/chosen": -1.8752286434173584, "logits/rejected": -1.8981329202651978, "logps/chosen": -0.3062916398048401, "logps/rejected": -0.2947053015232086, "loss": 0.6905814409255981, "loss/core": 0.6905814409255981, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 2.0861191749572754, "rewards/margins": 1.0360615253448486, "rewards/rejected": 1.0500577688217163, "step": 490 }, { "epoch": 0.47294876388391255, "grad_norm": 0.353515625, "learning_rate": 2.509696249312301e-07, "logits/chosen": -1.8822190761566162, "logits/rejected": -1.9906330108642578, "logps/chosen": -0.29457131028175354, "logps/rejected": -0.2900959551334381, "loss": 0.6889396905899048, "loss/core": 0.6889396905899048, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 2.6438632011413574, "rewards/margins": 1.7446101903915405, "rewards/rejected": 0.8992528915405273, "step": 495 }, { "epoch": 0.47772602412516424, "grad_norm": 0.447265625, "learning_rate": 2.461216461326642e-07, "logits/chosen": -1.7823041677474976, "logits/rejected": -1.7042522430419922, "logps/chosen": -0.276335746049881, "logps/rejected": -0.30160245299339294, "loss": 0.6881250143051147, "loss/core": 0.6881250143051147, "rewards/accuracies": 0.875, "rewards/chosen": 4.211169242858887, "rewards/margins": 2.174818277359009, "rewards/rejected": 2.036350727081299, "step": 500 }, { "epoch": 0.4825032843664159, "grad_norm": 1.28125, "learning_rate": 2.412751258243748e-07, "logits/chosen": -1.5979036092758179, "logits/rejected": -1.695265531539917, "logps/chosen": -0.28008055686950684, "logps/rejected": -0.27932852506637573, "loss": 0.6890323162078857, "loss/core": 0.6890323162078857, "rewards/accuracies": 0.8125, "rewards/chosen": 3.665738344192505, "rewards/margins": 1.8280740976333618, "rewards/rejected": 1.8376646041870117, "step": 505 }, { "epoch": 0.4872805446076675, "grad_norm": 0.060302734375, "learning_rate": 2.3643188658444158e-07, "logits/chosen": -1.8131134510040283, "logits/rejected": -1.9090598821640015, "logps/chosen": -0.31393712759017944, "logps/rejected": -0.29055261611938477, "loss": 0.6901880502700806, "loss/core": 0.6901880502700806, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 2.030540704727173, "rewards/margins": 1.2225555181503296, "rewards/rejected": 0.8079849481582642, "step": 510 }, { "epoch": 0.49205780484891914, "grad_norm": 0.369140625, "learning_rate": 2.315937497570688e-07, "logits/chosen": -1.6081165075302124, "logits/rejected": -1.6191253662109375, "logps/chosen": -0.28171616792678833, "logps/rejected": -0.30241820216178894, "loss": 0.6910374164581299, "loss/core": 0.6910374164581299, "rewards/accuracies": 0.824999988079071, "rewards/chosen": 2.5543110370635986, "rewards/margins": 0.8602564930915833, "rewards/rejected": 1.6940546035766602, "step": 515 }, { "epoch": 0.4968350650901708, "grad_norm": 0.50390625, "learning_rate": 2.2676253476765194e-07, "logits/chosen": -1.8473793268203735, "logits/rejected": -1.940637230873108, "logps/chosen": -0.3185504972934723, "logps/rejected": -0.3340589106082916, "loss": 0.6879608035087585, "loss/core": 0.6879608035087585, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 3.108973503112793, "rewards/margins": 2.145254373550415, "rewards/rejected": 0.9637192487716675, "step": 520 }, { "epoch": 0.5016123253314224, "grad_norm": 1.5703125, "learning_rate": 2.2194005843856633e-07, "logits/chosen": -1.9106519222259521, "logits/rejected": -1.854853630065918, "logps/chosen": -0.2881598472595215, "logps/rejected": -0.29906392097473145, "loss": 0.6862886548042297, "loss/core": 0.6862886548042297, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 4.429782390594482, "rewards/margins": 2.9549190998077393, "rewards/rejected": 1.4748632907867432, "step": 525 }, { "epoch": 0.5063895855726741, "grad_norm": 0.068359375, "learning_rate": 2.1712813430593434e-07, "logits/chosen": -1.698067307472229, "logits/rejected": -1.693956732749939, "logps/chosen": -0.28551727533340454, "logps/rejected": -0.2868136763572693, "loss": 0.6893957853317261, "loss/core": 0.6893957853317261, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 3.0555648803710938, "rewards/margins": 1.5484126806259155, "rewards/rejected": 1.5071521997451782, "step": 530 }, { "epoch": 0.5111668458139257, "grad_norm": 0.62890625, "learning_rate": 2.123285719376292e-07, "logits/chosen": -1.7900841236114502, "logits/rejected": -1.7464206218719482, "logps/chosen": -0.28272828459739685, "logps/rejected": -0.27548089623451233, "loss": 0.6883460283279419, "loss/core": 0.6883460283279419, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": 3.122218370437622, "rewards/margins": 2.007307529449463, "rewards/rejected": 1.1149110794067383, "step": 535 }, { "epoch": 0.5159441060551774, "grad_norm": 0.10400390625, "learning_rate": 2.0754317625276982e-07, "logits/chosen": -1.7317934036254883, "logits/rejected": -1.6521661281585693, "logps/chosen": -0.27843254804611206, "logps/rejected": -0.2827979624271393, "loss": 0.693123996257782, "loss/core": 0.693123996257782, "rewards/accuracies": 0.875, "rewards/chosen": 1.5914747714996338, "rewards/margins": 0.03556249290704727, "rewards/rejected": 1.5559122562408447, "step": 540 }, { "epoch": 0.520721366296429, "grad_norm": 1.578125, "learning_rate": 2.0277374684296498e-07, "logits/chosen": -1.9993709325790405, "logits/rejected": -1.906482458114624, "logps/chosen": -0.2804117798805237, "logps/rejected": -0.29083675146102905, "loss": 0.6889429092407227, "loss/core": 0.6889429092407227, "rewards/accuracies": 0.875, "rewards/chosen": 2.6694138050079346, "rewards/margins": 1.7691431045532227, "rewards/rejected": 0.9002708196640015, "step": 545 }, { "epoch": 0.5254986265376806, "grad_norm": 0.265625, "learning_rate": 1.980220772955602e-07, "logits/chosen": -1.5809681415557861, "logits/rejected": -1.5856965780258179, "logps/chosen": -0.2750489413738251, "logps/rejected": -0.2972986698150635, "loss": 0.6903039216995239, "loss/core": 0.6903039216995239, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 2.7791810035705566, "rewards/margins": 1.1509668827056885, "rewards/rejected": 1.628213882446289, "step": 550 }, { "epoch": 0.5302758867789323, "grad_norm": 0.1396484375, "learning_rate": 1.932899545191433e-07, "logits/chosen": -1.8478825092315674, "logits/rejected": -1.8661056756973267, "logps/chosen": -0.31153231859207153, "logps/rejected": -0.2762632966041565, "loss": 0.6875492334365845, "loss/core": 0.6875492334365845, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 3.2964320182800293, "rewards/margins": 2.3140857219696045, "rewards/rejected": 0.9823463559150696, "step": 555 }, { "epoch": 0.5350531470201839, "grad_norm": 0.408203125, "learning_rate": 1.885791580715609e-07, "logits/chosen": -1.7739731073379517, "logits/rejected": -1.8065807819366455, "logps/chosen": -0.2748362421989441, "logps/rejected": -0.2793380916118622, "loss": 0.6899937987327576, "loss/core": 0.6899937987327576, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 2.8241641521453857, "rewards/margins": 1.279166340827942, "rewards/rejected": 1.544998049736023, "step": 560 }, { "epoch": 0.5398304072614356, "grad_norm": 0.376953125, "learning_rate": 1.8389145949069951e-07, "logits/chosen": -1.8410762548446655, "logits/rejected": -1.8144041299819946, "logps/chosen": -0.2863827347755432, "logps/rejected": -0.30311352014541626, "loss": 0.6904335618019104, "loss/core": 0.6904335618019104, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 2.7921481132507324, "rewards/margins": 1.1107183694839478, "rewards/rejected": 1.6814296245574951, "step": 565 }, { "epoch": 0.5446076675026872, "grad_norm": 1.046875, "learning_rate": 1.792286216282824e-07, "logits/chosen": -1.79177725315094, "logits/rejected": -1.8119325637817383, "logps/chosen": -0.2888721525669098, "logps/rejected": -0.2847359776496887, "loss": 0.689185619354248, "loss/core": 0.689185619354248, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 3.3419628143310547, "rewards/margins": 1.616077184677124, "rewards/rejected": 1.7258857488632202, "step": 570 }, { "epoch": 0.5493849277439389, "grad_norm": 0.111328125, "learning_rate": 1.745923979869336e-07, "logits/chosen": -1.88888418674469, "logits/rejected": -1.9161269664764404, "logps/chosen": -0.29976314306259155, "logps/rejected": -0.3220902383327484, "loss": 0.6900423169136047, "loss/core": 0.6900423169136047, "rewards/accuracies": 0.875, "rewards/chosen": 1.8517236709594727, "rewards/margins": 1.2799955606460571, "rewards/rejected": 0.5717281103134155, "step": 575 }, { "epoch": 0.5541621879851905, "grad_norm": 0.07568359375, "learning_rate": 1.6998453206075708e-07, "logits/chosen": -1.9753665924072266, "logits/rejected": -2.079908847808838, "logps/chosen": -0.26681944727897644, "logps/rejected": -0.2805357575416565, "loss": 0.6920329332351685, "loss/core": 0.6920329332351685, "rewards/accuracies": 0.875, "rewards/chosen": 1.4170547723770142, "rewards/margins": 0.45395904779434204, "rewards/rejected": 0.9630956649780273, "step": 580 }, { "epoch": 0.5589394482264421, "grad_norm": 0.2265625, "learning_rate": 1.6540675667967973e-07, "logits/chosen": -1.9732328653335571, "logits/rejected": -1.867099404335022, "logps/chosen": -0.2693113684654236, "logps/rejected": -0.28243768215179443, "loss": 0.6910297274589539, "loss/core": 0.6910297274589539, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 2.231765031814575, "rewards/margins": 0.8599586486816406, "rewards/rejected": 1.3718063831329346, "step": 585 }, { "epoch": 0.5637167084676937, "grad_norm": 0.1318359375, "learning_rate": 1.60860793357805e-07, "logits/chosen": -1.827453851699829, "logits/rejected": -1.8766067028045654, "logps/chosen": -0.2868167757987976, "logps/rejected": -0.2861761450767517, "loss": 0.6869019269943237, "loss/core": 0.6869019269943237, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 3.6281845569610596, "rewards/margins": 2.5879273414611816, "rewards/rejected": 1.0402569770812988, "step": 590 }, { "epoch": 0.5684939687089454, "grad_norm": 0.1767578125, "learning_rate": 1.5634835164602196e-07, "logits/chosen": -1.771225929260254, "logits/rejected": -1.781171202659607, "logps/chosen": -0.27533966302871704, "logps/rejected": -0.2719757854938507, "loss": 0.6911031603813171, "loss/core": 0.6911031603813171, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 1.7094968557357788, "rewards/margins": 0.8211535215377808, "rewards/rejected": 0.8883434534072876, "step": 595 }, { "epoch": 0.5732712289501971, "grad_norm": 0.314453125, "learning_rate": 1.518711284891132e-07, "logits/chosen": -1.8096263408660889, "logits/rejected": -1.7713695764541626, "logps/chosen": -0.26596006751060486, "logps/rejected": -0.28354257345199585, "loss": 0.691169023513794, "loss/core": 0.691169023513794, "rewards/accuracies": 0.875, "rewards/chosen": 1.876749038696289, "rewards/margins": 0.8061097860336304, "rewards/rejected": 1.0706393718719482, "step": 600 }, { "epoch": 0.5780484891914487, "grad_norm": 0.6953125, "learning_rate": 1.47430807587603e-07, "logits/chosen": -1.9364635944366455, "logits/rejected": -2.0032143592834473, "logps/chosen": -0.2760660648345947, "logps/rejected": -0.2748982906341553, "loss": 0.6860328316688538, "loss/core": 0.6860328316688538, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 4.224491596221924, "rewards/margins": 3.010608196258545, "rewards/rejected": 1.2138831615447998, "step": 605 }, { "epoch": 0.5828257494327004, "grad_norm": 0.5078125, "learning_rate": 1.430290587645865e-07, "logits/chosen": -1.6363016366958618, "logits/rejected": -1.6160857677459717, "logps/chosen": -0.27192258834838867, "logps/rejected": -0.2753311097621918, "loss": 0.6874152421951294, "loss/core": 0.6874152421951294, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": 4.3153300285339355, "rewards/margins": 2.379615068435669, "rewards/rejected": 1.9357149600982666, "step": 610 }, { "epoch": 0.587603009673952, "grad_norm": 0.19921875, "learning_rate": 1.3866753733777765e-07, "logits/chosen": -1.4840619564056396, "logits/rejected": -1.5672607421875, "logps/chosen": -0.3140578866004944, "logps/rejected": -0.30204764008522034, "loss": 0.6901291012763977, "loss/core": 0.6901291012763977, "rewards/accuracies": 0.875, "rewards/chosen": 2.7394516468048096, "rewards/margins": 1.2340558767318726, "rewards/rejected": 1.505395770072937, "step": 615 }, { "epoch": 0.5923802699152036, "grad_norm": 0.1572265625, "learning_rate": 1.343478834970121e-07, "logits/chosen": -1.865546464920044, "logits/rejected": -1.8963212966918945, "logps/chosen": -0.28501859307289124, "logps/rejected": -0.2918963134288788, "loss": 0.692618191242218, "loss/core": 0.692618191242218, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 1.7005846500396729, "rewards/margins": 0.2428729087114334, "rewards/rejected": 1.4577115774154663, "step": 620 }, { "epoch": 0.5971575301564552, "grad_norm": 3.3125, "learning_rate": 1.3007172168743852e-07, "logits/chosen": -1.7032978534698486, "logits/rejected": -1.6907075643539429, "logps/chosen": -0.30372241139411926, "logps/rejected": -0.33234214782714844, "loss": 0.6876958012580872, "loss/core": 0.6876958012580872, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": 3.8974437713623047, "rewards/margins": 2.3479323387145996, "rewards/rejected": 1.5495115518569946, "step": 625 }, { "epoch": 0.6019347903977069, "grad_norm": 0.2255859375, "learning_rate": 1.25840659998631e-07, "logits/chosen": -1.7279109954833984, "logits/rejected": -1.8030815124511719, "logps/chosen": -0.2717967629432678, "logps/rejected": -0.2828608751296997, "loss": 0.6890043020248413, "loss/core": 0.6890043020248413, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 2.9497199058532715, "rewards/margins": 1.700548529624939, "rewards/rejected": 1.249171257019043, "step": 630 }, { "epoch": 0.6067120506389586, "grad_norm": 1.0, "learning_rate": 1.2165628955985313e-07, "logits/chosen": -1.7578712701797485, "logits/rejected": -1.8161617517471313, "logps/chosen": -0.303678959608078, "logps/rejected": -0.2981964647769928, "loss": 0.6900124549865723, "loss/core": 0.6900124549865723, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 2.3181376457214355, "rewards/margins": 1.2847710847854614, "rewards/rejected": 1.0333666801452637, "step": 635 }, { "epoch": 0.6114893108802102, "grad_norm": 0.125, "learning_rate": 1.175201839416988e-07, "logits/chosen": -1.9067970514297485, "logits/rejected": -1.9922056198120117, "logps/chosen": -0.29978805780410767, "logps/rejected": -0.2979918420314789, "loss": 0.6902927160263062, "loss/core": 0.6902927160263062, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 1.974582314491272, "rewards/margins": 1.1694762706756592, "rewards/rejected": 0.8051063418388367, "step": 640 }, { "epoch": 0.6162665711214619, "grad_norm": 0.28515625, "learning_rate": 1.1343389856433658e-07, "logits/chosen": -1.998485803604126, "logits/rejected": -2.0181636810302734, "logps/chosen": -0.28951841592788696, "logps/rejected": -0.2937147319316864, "loss": 0.6920903921127319, "loss/core": 0.6920903921127319, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 1.685060739517212, "rewards/margins": 0.43871307373046875, "rewards/rejected": 1.2463476657867432, "step": 645 }, { "epoch": 0.6210438313627135, "grad_norm": 0.1767578125, "learning_rate": 1.0939897011258e-07, "logits/chosen": -1.9956214427947998, "logits/rejected": -1.9716342687606812, "logps/chosen": -0.2891247570514679, "logps/rejected": -0.2986387312412262, "loss": 0.691946804523468, "loss/core": 0.691946804523468, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 1.3371341228485107, "rewards/margins": 0.49254298210144043, "rewards/rejected": 0.8445911407470703, "step": 650 }, { "epoch": 0.6258210916039652, "grad_norm": 0.8359375, "learning_rate": 1.0541691595800336e-07, "logits/chosen": -1.7673661708831787, "logits/rejected": -1.8068790435791016, "logps/chosen": -0.282105028629303, "logps/rejected": -0.2889975309371948, "loss": 0.690642774105072, "loss/core": 0.690642774105072, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 2.0060832500457764, "rewards/margins": 1.010461688041687, "rewards/rejected": 0.9956215023994446, "step": 655 }, { "epoch": 0.6305983518452167, "grad_norm": 0.11474609375, "learning_rate": 1.0148923358832021e-07, "logits/chosen": -1.9046757221221924, "logits/rejected": -1.9204623699188232, "logps/chosen": -0.29088854789733887, "logps/rejected": -0.30732461810112, "loss": 0.6896063685417175, "loss/core": 0.6896063685417175, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 2.8072502613067627, "rewards/margins": 1.5126233100891113, "rewards/rejected": 1.2946269512176514, "step": 660 }, { "epoch": 0.6353756120864684, "grad_norm": 0.5390625, "learning_rate": 9.761740004423926e-08, "logits/chosen": -1.9125967025756836, "logits/rejected": -1.8837387561798096, "logps/chosen": -0.2830875813961029, "logps/rejected": -0.27817443013191223, "loss": 0.6911165118217468, "loss/core": 0.6911165118217468, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 2.3600566387176514, "rewards/margins": 0.8475581407546997, "rewards/rejected": 1.5124986171722412, "step": 665 }, { "epoch": 0.64015287232772, "grad_norm": 0.11083984375, "learning_rate": 9.380287136400999e-08, "logits/chosen": -1.7506167888641357, "logits/rejected": -1.8097076416015625, "logps/chosen": -0.2727493345737457, "logps/rejected": -0.3100685477256775, "loss": 0.6875694394111633, "loss/core": 0.6875694394111633, "rewards/accuracies": 0.9375, "rewards/chosen": 3.660663604736328, "rewards/margins": 2.3024368286132812, "rewards/rejected": 1.3582265377044678, "step": 670 }, { "epoch": 0.6449301325689717, "grad_norm": 0.19921875, "learning_rate": 9.004708203586628e-08, "logits/chosen": -1.661525011062622, "logits/rejected": -1.6602637767791748, "logps/chosen": -0.2878963053226471, "logps/rejected": -0.28721392154693604, "loss": 0.6913235187530518, "loss/core": 0.6913235187530518, "rewards/accuracies": 0.875, "rewards/chosen": 1.6275174617767334, "rewards/margins": 0.7366446256637573, "rewards/rejected": 0.8908728361129761, "step": 675 }, { "epoch": 0.6497073928102234, "grad_norm": 0.10791015625, "learning_rate": 8.635144445857407e-08, "logits/chosen": -1.8359218835830688, "logits/rejected": -1.7717132568359375, "logps/chosen": -0.2822825312614441, "logps/rejected": -0.2898341715335846, "loss": 0.6913445591926575, "loss/core": 0.6913445591926575, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 2.1436684131622314, "rewards/margins": 0.7406994700431824, "rewards/rejected": 1.4029688835144043, "step": 680 }, { "epoch": 0.654484653051475, "grad_norm": 0.1455078125, "learning_rate": 8.271734841028552e-08, "logits/chosen": -1.6390689611434937, "logits/rejected": -1.651624321937561, "logps/chosen": -0.2526906132698059, "logps/rejected": -0.27529576420783997, "loss": 0.6899958848953247, "loss/core": 0.6899958848953247, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 2.895305633544922, "rewards/margins": 1.3431675434112549, "rewards/rejected": 1.552138090133667, "step": 685 }, { "epoch": 0.6592619132927267, "grad_norm": 0.1337890625, "learning_rate": 7.91461605259007e-08, "logits/chosen": -1.5240414142608643, "logits/rejected": -1.5546308755874634, "logps/chosen": -0.3081050515174866, "logps/rejected": -0.32126057147979736, "loss": 0.6916640996932983, "loss/core": 0.6916640996932983, "rewards/accuracies": 0.875, "rewards/chosen": 1.7689863443374634, "rewards/margins": 0.6094117164611816, "rewards/rejected": 1.1595746278762817, "step": 690 }, { "epoch": 0.6640391735339782, "grad_norm": 0.1640625, "learning_rate": 7.563922378313217e-08, "logits/chosen": -1.8862450122833252, "logits/rejected": -1.9309171438217163, "logps/chosen": -0.30440554022789, "logps/rejected": -0.2918163239955902, "loss": 0.6900017857551575, "loss/core": 0.6900017857551575, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 1.9893100261688232, "rewards/margins": 1.2960065603256226, "rewards/rejected": 0.6933035850524902, "step": 695 }, { "epoch": 0.6688164337752299, "grad_norm": 2.703125, "learning_rate": 7.219785699746572e-08, "logits/chosen": -1.7974674701690674, "logits/rejected": -1.8728835582733154, "logps/chosen": -0.2968365252017975, "logps/rejected": -0.3178980350494385, "loss": 0.6916329264640808, "loss/core": 0.6916329264640808, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 2.230217933654785, "rewards/margins": 0.6277396082878113, "rewards/rejected": 1.60247802734375, "step": 700 }, { "epoch": 0.6735936940164815, "grad_norm": 0.52734375, "learning_rate": 6.882335432620779e-08, "logits/chosen": -1.846928596496582, "logits/rejected": -1.8282711505889893, "logps/chosen": -0.28012657165527344, "logps/rejected": -0.26722002029418945, "loss": 0.6885994672775269, "loss/core": 0.6885994672775269, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 3.4068984985351562, "rewards/margins": 1.8730993270874023, "rewards/rejected": 1.533799171447754, "step": 705 }, { "epoch": 0.6783709542577332, "grad_norm": 1.6953125, "learning_rate": 6.551698478180589e-08, "logits/chosen": -1.6279361248016357, "logits/rejected": -1.647020936012268, "logps/chosen": -0.2771731913089752, "logps/rejected": -0.29674896597862244, "loss": 0.6890315413475037, "loss/core": 0.6890315413475037, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 3.5971343517303467, "rewards/margins": 1.6893699169158936, "rewards/rejected": 1.9077644348144531, "step": 710 }, { "epoch": 0.6831482144989849, "grad_norm": 0.1572265625, "learning_rate": 6.22799917546252e-08, "logits/chosen": -1.8586616516113281, "logits/rejected": -1.8125330209732056, "logps/chosen": -0.2845900058746338, "logps/rejected": -0.32791072130203247, "loss": 0.6905220746994019, "loss/core": 0.6905220746994019, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 1.8608309030532837, "rewards/margins": 1.073857307434082, "rewards/rejected": 0.7869734168052673, "step": 715 }, { "epoch": 0.6879254747402365, "grad_norm": 0.423828125, "learning_rate": 5.9113592545359944e-08, "logits/chosen": -1.7632392644882202, "logits/rejected": -1.7893062829971313, "logps/chosen": -0.2961721122264862, "logps/rejected": -0.300367534160614, "loss": 0.6917133331298828, "loss/core": 0.6917133331298828, "rewards/accuracies": 0.800000011920929, "rewards/chosen": 2.103755474090576, "rewards/margins": 0.6050199866294861, "rewards/rejected": 1.4987354278564453, "step": 720 }, { "epoch": 0.6927027349814882, "grad_norm": 0.1708984375, "learning_rate": 5.601897790725643e-08, "logits/chosen": -1.9446632862091064, "logits/rejected": -1.969635248184204, "logps/chosen": -0.2848110795021057, "logps/rejected": -0.27734309434890747, "loss": 0.6910138130187988, "loss/core": 0.6910138130187988, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 1.5936205387115479, "rewards/margins": 0.8628653287887573, "rewards/rejected": 0.7307552099227905, "step": 725 }, { "epoch": 0.6974799952227397, "grad_norm": 1.4375, "learning_rate": 5.299731159831952e-08, "logits/chosen": -1.901888132095337, "logits/rejected": -1.9483245611190796, "logps/chosen": -0.2863468527793884, "logps/rejected": -0.2913190722465515, "loss": 0.6928960680961609, "loss/core": 0.6928960680961609, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 1.0203444957733154, "rewards/margins": 0.1184670701622963, "rewards/rejected": 0.9018775224685669, "step": 730 }, { "epoch": 0.7022572554639914, "grad_norm": 0.408203125, "learning_rate": 5.0049729943671013e-08, "logits/chosen": -1.8452632427215576, "logits/rejected": -1.8946354389190674, "logps/chosen": -0.319896399974823, "logps/rejected": -0.3175990581512451, "loss": 0.6912761926651001, "loss/core": 0.6912761926651001, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 1.4188251495361328, "rewards/margins": 0.7536794543266296, "rewards/rejected": 0.6651455760002136, "step": 735 }, { "epoch": 0.707034515705243, "grad_norm": 0.1826171875, "learning_rate": 4.7177341408223994e-08, "logits/chosen": -1.7158161401748657, "logits/rejected": -1.7437493801116943, "logps/chosen": -0.31194645166397095, "logps/rejected": -0.3125692307949066, "loss": 0.6917774081230164, "loss/core": 0.6917774081230164, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 2.575186252593994, "rewards/margins": 0.7101010084152222, "rewards/rejected": 1.865085244178772, "step": 740 }, { "epoch": 0.7118117759464947, "grad_norm": 1.0546875, "learning_rate": 4.438122617983442e-08, "logits/chosen": -1.7589060068130493, "logits/rejected": -1.833776831626892, "logps/chosen": -0.28943413496017456, "logps/rejected": -0.28058308362960815, "loss": 0.6892428994178772, "loss/core": 0.6892428994178772, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 3.131422758102417, "rewards/margins": 1.6019914150238037, "rewards/rejected": 1.5294312238693237, "step": 745 }, { "epoch": 0.7165890361877463, "grad_norm": 0.451171875, "learning_rate": 4.1662435763087114e-08, "logits/chosen": -1.912740707397461, "logits/rejected": -1.9157087802886963, "logps/chosen": -0.31203845143318176, "logps/rejected": -0.3028412461280823, "loss": 0.6934337615966797, "loss/core": 0.6934337615966797, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 1.2026363611221313, "rewards/margins": -0.061604440212249756, "rewards/rejected": 1.2642407417297363, "step": 750 }, { "epoch": 0.721366296428998, "grad_norm": 0.373046875, "learning_rate": 3.902199258386732e-08, "logits/chosen": -1.7527711391448975, "logits/rejected": -1.647605299949646, "logps/chosen": -0.3076718747615814, "logps/rejected": -0.2929893732070923, "loss": 0.6915236115455627, "loss/core": 0.6915236115455627, "rewards/accuracies": 0.824999988079071, "rewards/chosen": 2.39526629447937, "rewards/margins": 0.6723926663398743, "rewards/rejected": 1.7228736877441406, "step": 755 }, { "epoch": 0.7261435566702497, "grad_norm": 0.201171875, "learning_rate": 3.646088960486862e-08, "logits/chosen": -1.7982404232025146, "logits/rejected": -1.840656042098999, "logps/chosen": -0.3029170632362366, "logps/rejected": -0.29293784499168396, "loss": 0.6903898119926453, "loss/core": 0.6903898119926453, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 1.9886500835418701, "rewards/margins": 1.1183176040649414, "rewards/rejected": 0.8703324198722839, "step": 760 }, { "epoch": 0.7309208169115012, "grad_norm": 0.328125, "learning_rate": 3.398008995217988e-08, "logits/chosen": -1.7162113189697266, "logits/rejected": -1.7504310607910156, "logps/chosen": -0.2765401601791382, "logps/rejected": -0.2717045247554779, "loss": 0.691356360912323, "loss/core": 0.691356360912323, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 1.7894961833953857, "rewards/margins": 0.7241676449775696, "rewards/rejected": 1.0653284788131714, "step": 765 }, { "epoch": 0.7356980771527529, "grad_norm": 0.53125, "learning_rate": 3.1580526553093315e-08, "logits/chosen": -1.6956571340560913, "logits/rejected": -1.7221298217773438, "logps/chosen": -0.3087131679058075, "logps/rejected": -0.28246551752090454, "loss": 0.6899880170822144, "loss/core": 0.6899880170822144, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": 3.7439963817596436, "rewards/margins": 1.3693008422851562, "rewards/rejected": 2.3746957778930664, "step": 770 }, { "epoch": 0.7404753373940045, "grad_norm": 0.07861328125, "learning_rate": 2.9263101785268252e-08, "logits/chosen": -1.8691062927246094, "logits/rejected": -1.896593451499939, "logps/chosen": -0.306645005941391, "logps/rejected": -0.3000980317592621, "loss": 0.6917179822921753, "loss/core": 0.6917179822921753, "rewards/accuracies": 0.875, "rewards/chosen": 1.5224562883377075, "rewards/margins": 0.5784978866577148, "rewards/rejected": 0.9439584016799927, "step": 775 }, { "epoch": 0.7452525976352562, "grad_norm": 0.287109375, "learning_rate": 2.7028687137384264e-08, "logits/chosen": -1.7383358478546143, "logits/rejected": -1.7722053527832031, "logps/chosen": -0.301580548286438, "logps/rejected": -0.3000149130821228, "loss": 0.6916896104812622, "loss/core": 0.6916896104812622, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 1.896596908569336, "rewards/margins": 0.5912862420082092, "rewards/rejected": 1.305310606956482, "step": 780 }, { "epoch": 0.7500298578765078, "grad_norm": 0.107421875, "learning_rate": 2.4878122881409447e-08, "logits/chosen": -1.5884864330291748, "logits/rejected": -1.562572717666626, "logps/chosen": -0.30816543102264404, "logps/rejected": -0.2903262674808502, "loss": 0.6882777810096741, "loss/core": 0.6882777810096741, "rewards/accuracies": 0.8125, "rewards/chosen": 3.4592926502227783, "rewards/margins": 2.0797040462493896, "rewards/rejected": 1.3795884847640991, "step": 785 }, { "epoch": 0.7548071181177595, "grad_norm": 3.609375, "learning_rate": 2.2812217756608937e-08, "logits/chosen": -1.8189325332641602, "logits/rejected": -1.710569143295288, "logps/chosen": -0.28520792722702026, "logps/rejected": -0.317575603723526, "loss": 0.69153892993927, "loss/core": 0.69153892993927, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": 2.6281354427337646, "rewards/margins": 0.6913524866104126, "rewards/rejected": 1.9367828369140625, "step": 790 }, { "epoch": 0.7595843783590112, "grad_norm": 0.400390625, "learning_rate": 2.0831748665410763e-08, "logits/chosen": -1.7783273458480835, "logits/rejected": -1.7968485355377197, "logps/chosen": -0.30635857582092285, "logps/rejected": -0.29732808470726013, "loss": 0.6901718378067017, "loss/core": 0.6901718378067017, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 2.3910913467407227, "rewards/margins": 1.2171629667282104, "rewards/rejected": 1.173928141593933, "step": 795 }, { "epoch": 0.7643616386002627, "grad_norm": 0.154296875, "learning_rate": 1.8937460381244967e-08, "logits/chosen": -1.8456178903579712, "logits/rejected": -1.8204724788665771, "logps/chosen": -0.2890564501285553, "logps/rejected": -0.28678005933761597, "loss": 0.6904189586639404, "loss/core": 0.6904189586639404, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": 2.2987735271453857, "rewards/margins": 1.1124370098114014, "rewards/rejected": 1.186336636543274, "step": 800 }, { "epoch": 0.7691388988415144, "grad_norm": 0.25, "learning_rate": 1.713006526846439e-08, "logits/chosen": -1.7271690368652344, "logits/rejected": -1.7207380533218384, "logps/chosen": -0.2747926414012909, "logps/rejected": -0.26928240060806274, "loss": 0.69256192445755, "loss/core": 0.69256192445755, "rewards/accuracies": 0.800000011920929, "rewards/chosen": 2.2577762603759766, "rewards/margins": 0.2586982250213623, "rewards/rejected": 1.9990781545639038, "step": 805 }, { "epoch": 0.773916159082766, "grad_norm": 0.15234375, "learning_rate": 1.541024301445404e-08, "logits/chosen": -1.8081337213516235, "logits/rejected": -1.7127681970596313, "logps/chosen": -0.3074837327003479, "logps/rejected": -0.316093385219574, "loss": 0.6930532455444336, "loss/core": 0.6930532455444336, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 1.5384314060211182, "rewards/margins": 0.054566673934459686, "rewards/rejected": 1.4838647842407227, "step": 810 }, { "epoch": 0.7786934193240177, "grad_norm": 0.353515625, "learning_rate": 1.3778640374027983e-08, "logits/chosen": -1.8720842599868774, "logits/rejected": -1.9219611883163452, "logps/chosen": -0.28327468037605286, "logps/rejected": -0.28367432951927185, "loss": 0.6905892491340637, "loss/core": 0.6905892491340637, "rewards/accuracies": 0.875, "rewards/chosen": 2.1285481452941895, "rewards/margins": 1.0284489393234253, "rewards/rejected": 1.1000992059707642, "step": 815 }, { "epoch": 0.7834706795652693, "grad_norm": 0.115234375, "learning_rate": 1.2235870926211616e-08, "logits/chosen": -1.7334009408950806, "logits/rejected": -1.737236738204956, "logps/chosen": -0.28783631324768066, "logps/rejected": -0.3172575533390045, "loss": 0.6899994611740112, "loss/core": 0.6899994611740112, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": 1.9646492004394531, "rewards/margins": 1.2791537046432495, "rewards/rejected": 0.6854956150054932, "step": 820 }, { "epoch": 0.788247939806521, "grad_norm": 0.546875, "learning_rate": 1.0782514843499652e-08, "logits/chosen": -1.7240092754364014, "logits/rejected": -1.8827893733978271, "logps/chosen": -0.2997475564479828, "logps/rejected": -0.283795028924942, "loss": 0.690019965171814, "loss/core": 0.690019965171814, "rewards/accuracies": 0.9375, "rewards/chosen": 2.4867701530456543, "rewards/margins": 1.2625161409378052, "rewards/rejected": 1.22425377368927, "step": 825 }, { "epoch": 0.7930252000477725, "grad_norm": 0.2412109375, "learning_rate": 9.419118673676924e-09, "logits/chosen": -1.9089800119400024, "logits/rejected": -1.8700017929077148, "logps/chosen": -0.27884355187416077, "logps/rejected": -0.30505234003067017, "loss": 0.6930972933769226, "loss/core": 0.6930972933769226, "rewards/accuracies": 0.875, "rewards/chosen": 1.7232449054718018, "rewards/margins": 0.04113560914993286, "rewards/rejected": 1.6821091175079346, "step": 830 }, { "epoch": 0.7978024602890242, "grad_norm": 1.296875, "learning_rate": 8.14619513428405e-09, "logits/chosen": -1.7318191528320312, "logits/rejected": -1.74942946434021, "logps/chosen": -0.25466471910476685, "logps/rejected": -0.30034616589546204, "loss": 0.6893445253372192, "loss/core": 0.6893445253372192, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 2.404738426208496, "rewards/margins": 1.5665807723999023, "rewards/rejected": 0.8381577730178833, "step": 835 }, { "epoch": 0.8025797205302759, "grad_norm": 4.0, "learning_rate": 6.96422291980539e-09, "logits/chosen": -1.8222589492797852, "logits/rejected": -1.8721163272857666, "logps/chosen": -0.32260316610336304, "logps/rejected": -0.30097338557243347, "loss": 0.6889389157295227, "loss/core": 0.6889389157295227, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 2.8018436431884766, "rewards/margins": 1.7603601217269897, "rewards/rejected": 1.0414836406707764, "step": 840 }, { "epoch": 0.8073569807715275, "grad_norm": 0.1318359375, "learning_rate": 5.8736465216517594e-09, "logits/chosen": -1.7940136194229126, "logits/rejected": -1.8399118185043335, "logps/chosen": -0.2931648790836334, "logps/rejected": -0.3112708628177643, "loss": 0.6907740235328674, "loss/core": 0.6907740235328674, "rewards/accuracies": 0.9375, "rewards/chosen": 1.4224978685379028, "rewards/margins": 0.967786431312561, "rewards/rejected": 0.45471152663230896, "step": 845 }, { "epoch": 0.8121342410127792, "grad_norm": 0.703125, "learning_rate": 4.874876061005173e-09, "logits/chosen": -1.9608793258666992, "logits/rejected": -2.056640625, "logps/chosen": -0.25170543789863586, "logps/rejected": -0.24661597609519958, "loss": 0.6915278434753418, "loss/core": 0.6915278434753418, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 1.5610125064849854, "rewards/margins": 0.6514654755592346, "rewards/rejected": 0.9095470309257507, "step": 850 }, { "epoch": 0.8169115012540308, "grad_norm": 0.44140625, "learning_rate": 3.968287134589188e-09, "logits/chosen": -1.767511010169983, "logits/rejected": -1.7454007863998413, "logps/chosen": -0.30029794573783875, "logps/rejected": -0.29418742656707764, "loss": 0.6896105408668518, "loss/core": 0.6896105408668518, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 2.694100856781006, "rewards/margins": 1.4545179605484009, "rewards/rejected": 1.2395830154418945, "step": 855 }, { "epoch": 0.8216887614952825, "grad_norm": 0.095703125, "learning_rate": 3.154220673422192e-09, "logits/chosen": -1.6382343769073486, "logits/rejected": -1.68215811252594, "logps/chosen": -0.29962679743766785, "logps/rejected": -0.2946147322654724, "loss": 0.6880518198013306, "loss/core": 0.6880518198013306, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 4.085516452789307, "rewards/margins": 2.11319637298584, "rewards/rejected": 1.9723198413848877, "step": 860 }, { "epoch": 0.826466021736534, "grad_norm": 0.275390625, "learning_rate": 2.4329828146074096e-09, "logits/chosen": -1.656494379043579, "logits/rejected": -1.6885122060775757, "logps/chosen": -0.2906996011734009, "logps/rejected": -0.2946203649044037, "loss": 0.6910411715507507, "loss/core": 0.6910411715507507, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": 2.4540257453918457, "rewards/margins": 0.8756850957870483, "rewards/rejected": 1.5783402919769287, "step": 865 }, { "epoch": 0.8312432819777857, "grad_norm": 0.236328125, "learning_rate": 1.8048447862070714e-09, "logits/chosen": -1.8312631845474243, "logits/rejected": -1.8569021224975586, "logps/chosen": -0.3106675148010254, "logps/rejected": -0.29439225792884827, "loss": 0.6878628134727478, "loss/core": 0.6878628134727478, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 3.189491033554077, "rewards/margins": 2.2258591651916504, "rewards/rejected": 0.9636317491531372, "step": 870 }, { "epoch": 0.8360205422190374, "grad_norm": 0.1787109375, "learning_rate": 1.2700428052447033e-09, "logits/chosen": -1.7763378620147705, "logits/rejected": -1.8419290781021118, "logps/chosen": -0.3076077103614807, "logps/rejected": -0.3310580551624298, "loss": 0.6911420822143555, "loss/core": 0.6911420822143555, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 1.865380883216858, "rewards/margins": 0.844092071056366, "rewards/rejected": 1.0212888717651367, "step": 875 }, { "epoch": 0.840797802460289, "grad_norm": 1.4375, "learning_rate": 8.287779888734858e-10, "logits/chosen": -1.8257224559783936, "logits/rejected": -1.7873103618621826, "logps/chosen": -0.29086047410964966, "logps/rejected": -0.327653706073761, "loss": 0.6917628049850464, "loss/core": 0.6917628049850464, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 2.455867290496826, "rewards/margins": 0.6519712209701538, "rewards/rejected": 1.8038959503173828, "step": 880 }, { "epoch": 0.8455750627015407, "grad_norm": 0.291015625, "learning_rate": 4.812162787445062e-10, "logits/chosen": -1.7672336101531982, "logits/rejected": -1.8428665399551392, "logps/chosen": -0.28123897314071655, "logps/rejected": -0.27698567509651184, "loss": 0.689162015914917, "loss/core": 0.689162015914917, "rewards/accuracies": 0.9375, "rewards/chosen": 2.7381834983825684, "rewards/margins": 1.6145788431167603, "rewards/rejected": 1.123604655265808, "step": 885 }, { "epoch": 0.8503523229427923, "grad_norm": 0.97265625, "learning_rate": 2.2748837860270265e-10, "logits/chosen": -1.7094967365264893, "logits/rejected": -1.819848656654358, "logps/chosen": -0.29713571071624756, "logps/rejected": -0.2740597426891327, "loss": 0.6906223297119141, "loss/core": 0.6906223297119141, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 2.4846818447113037, "rewards/margins": 1.043480396270752, "rewards/rejected": 1.4412018060684204, "step": 890 }, { "epoch": 0.855129583184044, "grad_norm": 0.451171875, "learning_rate": 6.768970513457151e-11, "logits/chosen": -1.7548071146011353, "logits/rejected": -1.7341846227645874, "logps/chosen": -0.2722460627555847, "logps/rejected": -0.2857206165790558, "loss": 0.6913274526596069, "loss/core": 0.6913274526596069, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": 2.302839517593384, "rewards/margins": 0.7413143515586853, "rewards/rejected": 1.5615251064300537, "step": 895 }, { "epoch": 0.8599068434252956, "grad_norm": 0.40625, "learning_rate": 1.8803520859811406e-12, "logits/chosen": -1.736576795578003, "logits/rejected": -1.8592958450317383, "logps/chosen": -0.26908183097839355, "logps/rejected": -0.2669498324394226, "loss": 0.6877947449684143, "loss/core": 0.6877947449684143, "rewards/accuracies": 0.9750000238418579, "rewards/chosen": 3.115830659866333, "rewards/margins": 2.253107786178589, "rewards/rejected": 0.8627226948738098, "step": 900 }, { "epoch": 0.8599068434252956, "step": 900, "total_flos": 0.0, "train_loss": 0.690198503865136, "train_runtime": 8363.1914, "train_samples_per_second": 1.722, "train_steps_per_second": 0.108 } ], "logging_steps": 5, "max_steps": 900, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 900, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 2, "trial_name": null, "trial_params": null }