{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.8599068434252956, "eval_steps": 500, "global_step": 900, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.004777260241251642, "grad_norm": 2.296875, "learning_rate": 2.222222222222222e-08, "logits/chosen": -2.3184335231781006, "logits/rejected": -2.304084300994873, "logps/chosen": -0.31140023469924927, "logps/rejected": -0.29028692841529846, "loss": 0.3946344256401062, "loss/core": 0.3946344256401062, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 2.209475040435791, "rewards/margins": 1.5164874792099, "rewards/rejected": 0.6929876208305359, "step": 5 }, { "epoch": 0.009554520482503284, "grad_norm": 183.0, "learning_rate": 5e-08, "logits/chosen": -2.064580202102661, "logits/rejected": -2.0450222492218018, "logps/chosen": -0.28674912452697754, "logps/rejected": -0.3005256652832031, "loss": 1.1264296770095825, "loss/core": 1.1264296770095825, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 2.9985833168029785, "rewards/margins": 0.33723002672195435, "rewards/rejected": 2.66135311126709, "step": 10 }, { "epoch": 0.014331780723754926, "grad_norm": 12.625, "learning_rate": 7.777777777777778e-08, "logits/chosen": -2.228989601135254, "logits/rejected": -2.2271804809570312, "logps/chosen": -0.2594456374645233, "logps/rejected": -0.2722489833831787, "loss": 0.26212042570114136, "loss/core": 0.26212042570114136, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 1.754608154296875, "rewards/margins": 0.7076910734176636, "rewards/rejected": 1.046917200088501, "step": 15 }, { "epoch": 0.01910904096500657, "grad_norm": 4.59375, "learning_rate": 1.0555555555555555e-07, "logits/chosen": -2.1681175231933594, "logits/rejected": -2.185380458831787, "logps/chosen": -0.2745749354362488, "logps/rejected": -0.26860952377319336, "loss": 1.016000747680664, "loss/core": 1.016000747680664, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 3.6250548362731934, "rewards/margins": 2.429143190383911, "rewards/rejected": 1.1959115266799927, "step": 20 }, { "epoch": 0.02388630120625821, "grad_norm": 4.40625, "learning_rate": 1.3333333333333334e-07, "logits/chosen": -2.010061740875244, "logits/rejected": -2.1256415843963623, "logps/chosen": -0.27929872274398804, "logps/rejected": -0.2702064514160156, "loss": 0.17983713746070862, "loss/core": 0.17983713746070862, "rewards/accuracies": 0.9750000238418579, "rewards/chosen": 2.1464362144470215, "rewards/margins": 1.1600453853607178, "rewards/rejected": 0.9863905906677246, "step": 25 }, { "epoch": 0.028663561447509853, "grad_norm": 5.78125, "learning_rate": 1.611111111111111e-07, "logits/chosen": -2.1331052780151367, "logits/rejected": -2.1351206302642822, "logps/chosen": -0.27982744574546814, "logps/rejected": -0.26132339239120483, "loss": 0.5742586851119995, "loss/core": 0.5742586851119995, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 2.813447952270508, "rewards/margins": 1.750083327293396, "rewards/rejected": 1.0633647441864014, "step": 30 }, { "epoch": 0.033440821688761495, "grad_norm": 1.53125, "learning_rate": 1.8888888888888888e-07, "logits/chosen": -2.273294687271118, "logits/rejected": -2.2828454971313477, "logps/chosen": -0.2884656488895416, "logps/rejected": -0.2767728865146637, "loss": 0.8869408369064331, "loss/core": 0.8869408369064331, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 2.5600028038024902, "rewards/margins": 1.78105890750885, "rewards/rejected": 0.7789438366889954, "step": 35 }, { "epoch": 0.03821808193001314, "grad_norm": 27.75, "learning_rate": 2.1666666666666667e-07, "logits/chosen": -2.2540197372436523, "logits/rejected": -2.351133108139038, "logps/chosen": -0.2658698558807373, "logps/rejected": -0.2907714247703552, "loss": 0.6574953198432922, "loss/core": 0.6574953198432922, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 2.926403522491455, "rewards/margins": 2.233344554901123, "rewards/rejected": 0.6930587887763977, "step": 40 }, { "epoch": 0.04299534217126478, "grad_norm": 4.46875, "learning_rate": 2.4444444444444445e-07, "logits/chosen": -2.090873956680298, "logits/rejected": -2.14512300491333, "logps/chosen": -0.27041956782341003, "logps/rejected": -0.27646249532699585, "loss": 0.8163895606994629, "loss/core": 0.8163895606994629, "rewards/accuracies": 0.9375, "rewards/chosen": 3.0477185249328613, "rewards/margins": 1.7669315338134766, "rewards/rejected": 1.2807869911193848, "step": 45 }, { "epoch": 0.04777260241251642, "grad_norm": 66.0, "learning_rate": 2.7222222222222216e-07, "logits/chosen": -2.188749074935913, "logits/rejected": -2.2616398334503174, "logps/chosen": -0.2877681851387024, "logps/rejected": -0.26972633600234985, "loss": 0.21321019530296326, "loss/core": 0.21321019530296326, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": 1.6582177877426147, "rewards/margins": 0.44566529989242554, "rewards/rejected": 1.2125524282455444, "step": 50 }, { "epoch": 0.05254986265376806, "grad_norm": 236.0, "learning_rate": 3e-07, "logits/chosen": -2.0755667686462402, "logits/rejected": -2.1377971172332764, "logps/chosen": -0.28878724575042725, "logps/rejected": -0.28834742307662964, "loss": 0.5084811449050903, "loss/core": 0.5084811449050903, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 2.339972496032715, "rewards/margins": 1.6370515823364258, "rewards/rejected": 0.7029210329055786, "step": 55 }, { "epoch": 0.057327122895019705, "grad_norm": 121.0, "learning_rate": 3.2777777777777776e-07, "logits/chosen": -2.1755266189575195, "logits/rejected": -2.122792959213257, "logps/chosen": -0.2767593562602997, "logps/rejected": -0.2760574519634247, "loss": 1.5027045011520386, "loss/core": 1.5027045011520386, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 3.761892318725586, "rewards/margins": 2.0544276237487793, "rewards/rejected": 1.707464575767517, "step": 60 }, { "epoch": 0.06210438313627135, "grad_norm": 264.0, "learning_rate": 3.5555555555555553e-07, "logits/chosen": -2.1052839756011963, "logits/rejected": -2.1663551330566406, "logps/chosen": -0.2984526455402374, "logps/rejected": -0.28494197130203247, "loss": 1.0875555276870728, "loss/core": 1.0875555276870728, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 3.2381019592285156, "rewards/margins": 2.0958991050720215, "rewards/rejected": 1.1422029733657837, "step": 65 }, { "epoch": 0.06688164337752299, "grad_norm": 16.0, "learning_rate": 3.8333333333333335e-07, "logits/chosen": -2.134707450866699, "logits/rejected": -2.046159267425537, "logps/chosen": -0.2798652648925781, "logps/rejected": -0.27488410472869873, "loss": 0.4238152503967285, "loss/core": 0.4238152503967285, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 2.4914584159851074, "rewards/margins": 1.004212498664856, "rewards/rejected": 1.4872459173202515, "step": 70 }, { "epoch": 0.07165890361877464, "grad_norm": 1.65625, "learning_rate": 4.1111111111111107e-07, "logits/chosen": -2.0351903438568115, "logits/rejected": -2.068025588989258, "logps/chosen": -0.29988136887550354, "logps/rejected": -0.3065613806247711, "loss": 0.5185372829437256, "loss/core": 0.5185372829437256, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 2.2677860260009766, "rewards/margins": 1.2009799480438232, "rewards/rejected": 1.0668058395385742, "step": 75 }, { "epoch": 0.07643616386002627, "grad_norm": 0.8359375, "learning_rate": 4.3888888888888884e-07, "logits/chosen": -2.2651379108428955, "logits/rejected": -2.265864849090576, "logps/chosen": -0.2954421639442444, "logps/rejected": -0.2877275347709656, "loss": 0.18425166606903076, "loss/core": 0.18425166606903076, "rewards/accuracies": 0.875, "rewards/chosen": 1.3546873331069946, "rewards/margins": 0.4060265123844147, "rewards/rejected": 0.9486608505249023, "step": 80 }, { "epoch": 0.08121342410127792, "grad_norm": 744.0, "learning_rate": 4.6666666666666666e-07, "logits/chosen": -2.2166881561279297, "logits/rejected": -2.2303507328033447, "logps/chosen": -0.27470141649246216, "logps/rejected": -0.2800918519496918, "loss": 0.5587457418441772, "loss/core": 0.5587457418441772, "rewards/accuracies": 0.9375, "rewards/chosen": 1.6758487224578857, "rewards/margins": 0.03965097665786743, "rewards/rejected": 1.6361976861953735, "step": 85 }, { "epoch": 0.08599068434252956, "grad_norm": 15.6875, "learning_rate": 4.944444444444445e-07, "logits/chosen": -2.1294827461242676, "logits/rejected": -2.2263193130493164, "logps/chosen": -0.27022016048431396, "logps/rejected": -0.31300783157348633, "loss": 0.8455947041511536, "loss/core": 0.8455947041511536, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 2.5631749629974365, "rewards/margins": 1.0474013090133667, "rewards/rejected": 1.515773892402649, "step": 90 }, { "epoch": 0.09076794458378121, "grad_norm": 22.0, "learning_rate": 4.999699149323369e-07, "logits/chosen": -2.137500524520874, "logits/rejected": -2.064415454864502, "logps/chosen": -0.28990474343299866, "logps/rejected": -0.2970162034034729, "loss": 0.4857604503631592, "loss/core": 0.4857604503631592, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 2.2846360206604004, "rewards/margins": 1.2684682607650757, "rewards/rejected": 1.0161678791046143, "step": 95 }, { "epoch": 0.09554520482503284, "grad_norm": 4.4375, "learning_rate": 4.998477067547739e-07, "logits/chosen": -2.11228346824646, "logits/rejected": -2.1553733348846436, "logps/chosen": -0.26913318037986755, "logps/rejected": -0.2833011746406555, "loss": 1.1113026142120361, "loss/core": 1.1113026142120361, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 3.711238145828247, "rewards/margins": 2.09954833984375, "rewards/rejected": 1.611689567565918, "step": 100 }, { "epoch": 0.10032246506628449, "grad_norm": 24.25, "learning_rate": 4.996315410727229e-07, "logits/chosen": -2.0640909671783447, "logits/rejected": -2.0353593826293945, "logps/chosen": -0.317560613155365, "logps/rejected": -0.304330050945282, "loss": 0.93501216173172, "loss/core": 0.93501216173172, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 3.3537240028381348, "rewards/margins": 2.5598361492156982, "rewards/rejected": 0.7938874959945679, "step": 105 }, { "epoch": 0.10509972530753613, "grad_norm": 1.7890625, "learning_rate": 4.993214991772562e-07, "logits/chosen": -2.1243863105773926, "logits/rejected": -2.126587390899658, "logps/chosen": -0.2978929877281189, "logps/rejected": -0.3149787485599518, "loss": 0.20066983997821808, "loss/core": 0.20066983997821808, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 1.6585355997085571, "rewards/margins": 0.7344213724136353, "rewards/rejected": 0.9241144061088562, "step": 110 }, { "epoch": 0.10987698554878778, "grad_norm": 10.8125, "learning_rate": 4.989176976624511e-07, "logits/chosen": -2.0023255348205566, "logits/rejected": -2.1182520389556885, "logps/chosen": -0.30129915475845337, "logps/rejected": -0.29388052225112915, "loss": 1.1868757009506226, "loss/core": 1.1868757009506226, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 2.8971168994903564, "rewards/margins": 1.7273696660995483, "rewards/rejected": 1.1697468757629395, "step": 115 }, { "epoch": 0.11465424579003941, "grad_norm": 51.0, "learning_rate": 4.984202883815428e-07, "logits/chosen": -2.2406866550445557, "logits/rejected": -2.252915620803833, "logps/chosen": -0.30535244941711426, "logps/rejected": -0.30678510665893555, "loss": 0.48086509108543396, "loss/core": 0.48086509108543396, "rewards/accuracies": 0.875, "rewards/chosen": 2.3497025966644287, "rewards/margins": 1.1640708446502686, "rewards/rejected": 1.1856318712234497, "step": 120 }, { "epoch": 0.11943150603129106, "grad_norm": 87.0, "learning_rate": 4.978294583898195e-07, "logits/chosen": -2.0294809341430664, "logits/rejected": -1.9394248723983765, "logps/chosen": -0.29434821009635925, "logps/rejected": -0.3001564145088196, "loss": 0.9685723185539246, "loss/core": 0.9685723185539246, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": 1.8707126379013062, "rewards/margins": -0.364132821559906, "rewards/rejected": 2.2348453998565674, "step": 125 }, { "epoch": 0.1242087662725427, "grad_norm": 58.5, "learning_rate": 4.971454298742779e-07, "logits/chosen": -2.348689079284668, "logits/rejected": -2.265820026397705, "logps/chosen": -0.27629876136779785, "logps/rejected": -0.302666574716568, "loss": 0.6233381032943726, "loss/core": 0.6233381032943726, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": 2.2184367179870605, "rewards/margins": 0.2606551945209503, "rewards/rejected": 1.9577815532684326, "step": 130 }, { "epoch": 0.12898602651379434, "grad_norm": 11.0625, "learning_rate": 4.963684600700678e-07, "logits/chosen": -2.0810961723327637, "logits/rejected": -2.177532434463501, "logps/chosen": -0.34504374861717224, "logps/rejected": -0.3136570155620575, "loss": 0.6652131676673889, "loss/core": 0.6652131676673889, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 2.7010741233825684, "rewards/margins": 1.2287189960479736, "rewards/rejected": 1.4723551273345947, "step": 135 }, { "epoch": 0.13376328675504598, "grad_norm": 57.75, "learning_rate": 4.954988411637571e-07, "logits/chosen": -1.9434146881103516, "logits/rejected": -1.9310106039047241, "logps/chosen": -0.3319775462150574, "logps/rejected": -0.34657081961631775, "loss": 1.2185124158859253, "loss/core": 1.2185124158859253, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 3.100647449493408, "rewards/margins": 0.7573388814926147, "rewards/rejected": 2.343308925628662, "step": 140 }, { "epoch": 0.13854054699629761, "grad_norm": 6.4375, "learning_rate": 4.945369001834514e-07, "logits/chosen": -2.0375614166259766, "logits/rejected": -2.0471043586730957, "logps/chosen": -0.3008027672767639, "logps/rejected": -0.28672724962234497, "loss": 0.20575180649757385, "loss/core": 0.20575180649757385, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 1.7885154485702515, "rewards/margins": 0.952106773853302, "rewards/rejected": 0.8364084362983704, "step": 145 }, { "epoch": 0.14331780723754928, "grad_norm": 211.0, "learning_rate": 4.93482998875813e-07, "logits/chosen": -2.004568576812744, "logits/rejected": -2.028262138366699, "logps/chosen": -0.2854091227054596, "logps/rejected": -0.27151355147361755, "loss": 0.6710211038589478, "loss/core": 0.6710211038589478, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 2.637166738510132, "rewards/margins": 1.3770954608917236, "rewards/rejected": 1.2600712776184082, "step": 150 }, { "epoch": 0.1480950674788009, "grad_norm": 5.90625, "learning_rate": 4.923375335700223e-07, "logits/chosen": -1.968898057937622, "logits/rejected": -2.025012731552124, "logps/chosen": -0.2497386932373047, "logps/rejected": -0.2664481997489929, "loss": 0.38974815607070923, "loss/core": 0.38974815607070923, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": 2.618589401245117, "rewards/margins": 1.195473551750183, "rewards/rejected": 1.423115849494934, "step": 155 }, { "epoch": 0.15287232772005255, "grad_norm": 58.5, "learning_rate": 4.911009350287347e-07, "logits/chosen": -2.1655495166778564, "logits/rejected": -2.139359951019287, "logps/chosen": -0.27988573908805847, "logps/rejected": -0.2946188449859619, "loss": 0.5953173041343689, "loss/core": 0.5953173041343689, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 2.644726276397705, "rewards/margins": 1.5004968643188477, "rewards/rejected": 1.144229531288147, "step": 160 }, { "epoch": 0.15764958796130418, "grad_norm": 5.3125, "learning_rate": 4.897736682860885e-07, "logits/chosen": -2.109489917755127, "logits/rejected": -2.0843923091888428, "logps/chosen": -0.3071993589401245, "logps/rejected": -0.30547797679901123, "loss": 0.1960802972316742, "loss/core": 0.1960802972316742, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": 1.7830066680908203, "rewards/margins": 0.7959617376327515, "rewards/rejected": 0.9870448112487793, "step": 165 }, { "epoch": 0.16242684820255585, "grad_norm": 1.2578125, "learning_rate": 4.883562324728241e-07, "logits/chosen": -2.0669140815734863, "logits/rejected": -1.9952644109725952, "logps/chosen": -0.3106909692287445, "logps/rejected": -0.3281523883342743, "loss": 0.20468628406524658, "loss/core": 0.20468628406524658, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 1.8208732604980469, "rewards/margins": 1.240056037902832, "rewards/rejected": 0.5808171033859253, "step": 170 }, { "epoch": 0.16720410844380748, "grad_norm": 70.5, "learning_rate": 4.868491606285823e-07, "logits/chosen": -2.2352006435394287, "logits/rejected": -2.256232261657715, "logps/chosen": -0.27431878447532654, "logps/rejected": -0.28181517124176025, "loss": 0.1919003427028656, "loss/core": 0.1919003427028656, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 1.784128189086914, "rewards/margins": 1.083038568496704, "rewards/rejected": 0.7010896801948547, "step": 175 }, { "epoch": 0.17198136868505912, "grad_norm": 14.6875, "learning_rate": 4.852530195014489e-07, "logits/chosen": -2.1959755420684814, "logits/rejected": -2.148374080657959, "logps/chosen": -0.2624792456626892, "logps/rejected": -0.2835710942745209, "loss": 0.6657207608222961, "loss/core": 0.6657207608222961, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 2.457181692123413, "rewards/margins": 1.1070095300674438, "rewards/rejected": 1.3501724004745483, "step": 180 }, { "epoch": 0.17675862892631075, "grad_norm": 632.0, "learning_rate": 4.835684093348244e-07, "logits/chosen": -2.2028822898864746, "logits/rejected": -2.2440648078918457, "logps/chosen": -0.3046368956565857, "logps/rejected": -0.3071895241737366, "loss": 0.6476051807403564, "loss/core": 0.6476051807403564, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": 1.8896329402923584, "rewards/margins": 0.37541091442108154, "rewards/rejected": 1.5142220258712769, "step": 185 }, { "epoch": 0.18153588916756241, "grad_norm": 436.0, "learning_rate": 4.817959636416969e-07, "logits/chosen": -2.134538412094116, "logits/rejected": -2.1165084838867188, "logps/chosen": -0.2866383194923401, "logps/rejected": -0.27144110202789307, "loss": 0.6611530780792236, "loss/core": 0.6611530780792236, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 2.6436305046081543, "rewards/margins": 1.4646612405776978, "rewards/rejected": 1.178969144821167, "step": 190 }, { "epoch": 0.18631314940881405, "grad_norm": 6.3125, "learning_rate": 4.799363489664039e-07, "logits/chosen": -1.9559043645858765, "logits/rejected": -1.9407514333724976, "logps/chosen": -0.28489893674850464, "logps/rejected": -0.2946854531764984, "loss": 0.2528533637523651, "loss/core": 0.2528533637523651, "rewards/accuracies": 0.875, "rewards/chosen": 1.681348204612732, "rewards/margins": 0.3501024842262268, "rewards/rejected": 1.33124577999115, "step": 195 }, { "epoch": 0.19109040965006568, "grad_norm": 8.6875, "learning_rate": 4.779902646339721e-07, "logits/chosen": -2.1071603298187256, "logits/rejected": -2.1380481719970703, "logps/chosen": -0.2741830050945282, "logps/rejected": -0.27496692538261414, "loss": 0.46219339966773987, "loss/core": 0.46219339966773987, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 2.5044608116149902, "rewards/margins": 1.1724002361297607, "rewards/rejected": 1.33206045627594, "step": 200 }, { "epoch": 0.19586766989131732, "grad_norm": 3.203125, "learning_rate": 4.759584424871301e-07, "logits/chosen": -2.0774598121643066, "logits/rejected": -2.142284631729126, "logps/chosen": -0.2829883396625519, "logps/rejected": -0.29093074798583984, "loss": 0.08258922398090363, "loss/core": 0.08258922398090363, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 1.3614203929901123, "rewards/margins": 0.7309275269508362, "rewards/rejected": 0.6304928660392761, "step": 205 }, { "epoch": 0.20064493013256898, "grad_norm": 10.9375, "learning_rate": 4.738416466110917e-07, "logits/chosen": -2.0302059650421143, "logits/rejected": -2.0086560249328613, "logps/chosen": -0.288141131401062, "logps/rejected": -0.2887657582759857, "loss": 0.8564616441726685, "loss/core": 0.8564616441726685, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 2.526529550552368, "rewards/margins": 1.0289502143859863, "rewards/rejected": 1.4975792169570923, "step": 210 }, { "epoch": 0.20542219037382062, "grad_norm": 10.8125, "learning_rate": 4.716406730462153e-07, "logits/chosen": -1.9449901580810547, "logits/rejected": -1.9634069204330444, "logps/chosen": -0.29736560583114624, "logps/rejected": -0.2745818793773651, "loss": 0.24143390357494354, "loss/core": 0.24143390357494354, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 2.0462050437927246, "rewards/margins": 1.0101492404937744, "rewards/rejected": 1.0360558032989502, "step": 215 }, { "epoch": 0.21019945061507225, "grad_norm": 3.0, "learning_rate": 4.693563494886454e-07, "logits/chosen": -2.025031089782715, "logits/rejected": -2.0499961376190186, "logps/chosen": -0.28308767080307007, "logps/rejected": -0.27393776178359985, "loss": 0.16485320031642914, "loss/core": 0.16485320031642914, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 1.761115312576294, "rewards/margins": 0.9114633798599243, "rewards/rejected": 0.849652111530304, "step": 220 }, { "epoch": 0.2149767108563239, "grad_norm": 15.3125, "learning_rate": 4.6698953497905016e-07, "logits/chosen": -2.0364017486572266, "logits/rejected": -2.0577664375305176, "logps/chosen": -0.31471285223960876, "logps/rejected": -0.30929452180862427, "loss": 1.460294485092163, "loss/core": 1.460294485092163, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 3.0360703468322754, "rewards/margins": 1.0577287673950195, "rewards/rejected": 1.9783413410186768, "step": 225 }, { "epoch": 0.21975397109757555, "grad_norm": 54.5, "learning_rate": 4.645411195795709e-07, "logits/chosen": -2.118978500366211, "logits/rejected": -2.1093850135803223, "logps/chosen": -0.27341052889823914, "logps/rejected": -0.26687008142471313, "loss": 0.740382194519043, "loss/core": 0.740382194519043, "rewards/accuracies": 0.9375, "rewards/chosen": 3.039541006088257, "rewards/margins": 1.364072561264038, "rewards/rejected": 1.6754686832427979, "step": 230 }, { "epoch": 0.2245312313388272, "grad_norm": 2.84375, "learning_rate": 4.6201202403910643e-07, "logits/chosen": -2.160707950592041, "logits/rejected": -2.255814790725708, "logps/chosen": -0.28612154722213745, "logps/rejected": -0.28075844049453735, "loss": 0.19919511675834656, "loss/core": 0.19919511675834656, "rewards/accuracies": 0.949999988079071, "rewards/chosen": 1.6981313228607178, "rewards/margins": 1.023926854133606, "rewards/rejected": 0.6742045879364014, "step": 235 }, { "epoch": 0.22930849158007882, "grad_norm": 7.90625, "learning_rate": 4.594031994470573e-07, "logits/chosen": -2.0647361278533936, "logits/rejected": -2.1183581352233887, "logps/chosen": -0.2742571234703064, "logps/rejected": -0.2913045287132263, "loss": 1.243248701095581, "loss/core": 1.243248701095581, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": 2.7567174434661865, "rewards/margins": 0.8206822276115417, "rewards/rejected": 1.936035394668579, "step": 240 }, { "epoch": 0.23408575182133046, "grad_norm": 1112.0, "learning_rate": 4.567156268756593e-07, "logits/chosen": -2.120326519012451, "logits/rejected": -2.2658631801605225, "logps/chosen": -0.30770888924598694, "logps/rejected": -0.292914479970932, "loss": 0.6964072585105896, "loss/core": 0.6964072585105896, "rewards/accuracies": 0.9750000238418579, "rewards/chosen": 2.1233694553375244, "rewards/margins": 1.4673677682876587, "rewards/rejected": 0.6560018062591553, "step": 245 }, { "epoch": 0.23886301206258212, "grad_norm": 10.625, "learning_rate": 4.5395031701104303e-07, "logits/chosen": -1.9557708501815796, "logits/rejected": -1.9600833654403687, "logps/chosen": -0.30549654364585876, "logps/rejected": -0.3048430383205414, "loss": 1.1260910034179688, "loss/core": 1.1260910034179688, "rewards/accuracies": 0.875, "rewards/chosen": 3.3460769653320312, "rewards/margins": 1.7832248210906982, "rewards/rejected": 1.562852144241333, "step": 250 }, { "epoch": 0.24364027230383375, "grad_norm": 4.09375, "learning_rate": 4.511083097731555e-07, "logits/chosen": -2.1089088916778564, "logits/rejected": -2.0778651237487793, "logps/chosen": -0.287789523601532, "logps/rejected": -0.2891516089439392, "loss": 1.2482858896255493, "loss/core": 1.2482858896255493, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 2.746084213256836, "rewards/margins": 1.564002275466919, "rewards/rejected": 1.1820822954177856, "step": 255 }, { "epoch": 0.2484175325450854, "grad_norm": 108.0, "learning_rate": 4.481906739246894e-07, "logits/chosen": -2.062340259552002, "logits/rejected": -2.0389857292175293, "logps/chosen": -0.3061924874782562, "logps/rejected": -0.30993199348449707, "loss": 0.4140895903110504, "loss/core": 0.4140895903110504, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 1.9362844228744507, "rewards/margins": 0.6997807025909424, "rewards/rejected": 1.2365038394927979, "step": 260 }, { "epoch": 0.25319479278633705, "grad_norm": 2.8125, "learning_rate": 4.451985066691648e-07, "logits/chosen": -2.0385899543762207, "logits/rejected": -2.0162370204925537, "logps/chosen": -0.27738499641418457, "logps/rejected": -0.28945407271385193, "loss": 0.23780469596385956, "loss/core": 0.23780469596385956, "rewards/accuracies": 0.875, "rewards/chosen": 2.11801815032959, "rewards/margins": 1.098084568977356, "rewards/rejected": 1.0199334621429443, "step": 265 }, { "epoch": 0.2579720530275887, "grad_norm": 1.4375, "learning_rate": 4.421329332383158e-07, "logits/chosen": -2.0890111923217773, "logits/rejected": -2.0384275913238525, "logps/chosen": -0.30751222372055054, "logps/rejected": -0.30553263425827026, "loss": 0.3220127820968628, "loss/core": 0.3220127820968628, "rewards/accuracies": 0.875, "rewards/chosen": 1.6447738409042358, "rewards/margins": 0.24662013351917267, "rewards/rejected": 1.3981537818908691, "step": 270 }, { "epoch": 0.2627493132688403, "grad_norm": 3.703125, "learning_rate": 4.3899510646893696e-07, "logits/chosen": -2.207843780517578, "logits/rejected": -2.2784366607666016, "logps/chosen": -0.2971876561641693, "logps/rejected": -0.2956683933734894, "loss": 0.05450323969125748, "loss/core": 0.05450323969125748, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 1.0277817249298096, "rewards/margins": 0.44771966338157654, "rewards/rejected": 0.5800620317459106, "step": 275 }, { "epoch": 0.26752657351009196, "grad_norm": 23.0, "learning_rate": 4.357862063693485e-07, "logits/chosen": -2.0210609436035156, "logits/rejected": -1.9996906518936157, "logps/chosen": -0.3016383945941925, "logps/rejected": -0.3017963767051697, "loss": 0.21795885264873505, "loss/core": 0.21795885264873505, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 1.8103902339935303, "rewards/margins": 0.9846366047859192, "rewards/rejected": 0.825753390789032, "step": 280 }, { "epoch": 0.2723038337513436, "grad_norm": 8.5625, "learning_rate": 4.3250743967564364e-07, "logits/chosen": -2.2049059867858887, "logits/rejected": -2.1598610877990723, "logps/chosen": -0.2876811623573303, "logps/rejected": -0.2909473478794098, "loss": 1.0883954763412476, "loss/core": 1.0883954763412476, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": 2.9615416526794434, "rewards/margins": 1.0239375829696655, "rewards/rejected": 1.9376041889190674, "step": 285 }, { "epoch": 0.27708109399259523, "grad_norm": 1056.0, "learning_rate": 4.29160039397884e-07, "logits/chosen": -2.1312131881713867, "logits/rejected": -2.1842284202575684, "logps/chosen": -0.2860090136528015, "logps/rejected": -0.2702611982822418, "loss": 2.010714292526245, "loss/core": 2.010714292526245, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 4.503174781799316, "rewards/margins": 3.201117992401123, "rewards/rejected": 1.3020570278167725, "step": 290 }, { "epoch": 0.28185835423384686, "grad_norm": 10.0625, "learning_rate": 4.2574526435641546e-07, "logits/chosen": -1.899706244468689, "logits/rejected": -1.976220726966858, "logps/chosen": -0.3136875629425049, "logps/rejected": -0.302241712808609, "loss": 1.1247197389602661, "loss/core": 1.1247197389602661, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 2.7293989658355713, "rewards/margins": 1.6034202575683594, "rewards/rejected": 1.125978708267212, "step": 295 }, { "epoch": 0.28663561447509855, "grad_norm": 5.375, "learning_rate": 4.22264398708477e-07, "logits/chosen": -2.0837273597717285, "logits/rejected": -2.1485800743103027, "logps/chosen": -0.28113582730293274, "logps/rejected": -0.3067568838596344, "loss": 2.029283046722412, "loss/core": 2.029283046722412, "rewards/accuracies": 0.875, "rewards/chosen": 3.4929652214050293, "rewards/margins": 1.580517053604126, "rewards/rejected": 1.9124481678009033, "step": 300 }, { "epoch": 0.2914128747163502, "grad_norm": 45.25, "learning_rate": 4.187187514652819e-07, "logits/chosen": -1.9658424854278564, "logits/rejected": -2.029053211212158, "logps/chosen": -0.3088286519050598, "logps/rejected": -0.30893000960350037, "loss": 2.0511975288391113, "loss/core": 2.0511975288391113, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 3.7278835773468018, "rewards/margins": 1.2690778970718384, "rewards/rejected": 2.458805561065674, "step": 305 }, { "epoch": 0.2961901349576018, "grad_norm": 32.0, "learning_rate": 4.151096559997519e-07, "logits/chosen": -1.9535623788833618, "logits/rejected": -1.9904283285140991, "logps/chosen": -0.2780826687812805, "logps/rejected": -0.2801373302936554, "loss": 0.36180371046066284, "loss/core": 0.36180371046066284, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 2.327801465988159, "rewards/margins": 0.9045225977897644, "rewards/rejected": 1.423278570175171, "step": 310 }, { "epoch": 0.30096739519885346, "grad_norm": 29.375, "learning_rate": 4.114384695450905e-07, "logits/chosen": -2.104870080947876, "logits/rejected": -2.0882060527801514, "logps/chosen": -0.3096676766872406, "logps/rejected": -0.303961843252182, "loss": 0.32151490449905396, "loss/core": 0.32151490449905396, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 1.1817171573638916, "rewards/margins": -0.025614654645323753, "rewards/rejected": 1.207331895828247, "step": 315 }, { "epoch": 0.3057446554401051, "grad_norm": 812.0, "learning_rate": 4.077065726843828e-07, "logits/chosen": -1.9013550281524658, "logits/rejected": -1.8669452667236328, "logps/chosen": -0.3241393268108368, "logps/rejected": -0.3211979269981384, "loss": 1.0354502201080322, "loss/core": 1.0354502201080322, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 3.091705799102783, "rewards/margins": 1.3894522190093994, "rewards/rejected": 1.7022536993026733, "step": 320 }, { "epoch": 0.31052191568135673, "grad_norm": 1.5234375, "learning_rate": 4.039153688314145e-07, "logits/chosen": -1.993546485900879, "logits/rejected": -2.022549867630005, "logps/chosen": -0.28880229592323303, "logps/rejected": -0.2948676645755768, "loss": 0.12079276889562607, "loss/core": 0.12079276889562607, "rewards/accuracies": 0.9375, "rewards/chosen": 1.4271008968353271, "rewards/margins": 0.6435669660568237, "rewards/rejected": 0.7835339903831482, "step": 325 }, { "epoch": 0.31529917592260837, "grad_norm": 836.0, "learning_rate": 4.0006628370290613e-07, "logits/chosen": -2.167954444885254, "logits/rejected": -2.0930395126342773, "logps/chosen": -0.3180980980396271, "logps/rejected": -0.3477565050125122, "loss": 0.3206109404563904, "loss/core": 0.3206109404563904, "rewards/accuracies": 0.875, "rewards/chosen": 1.3264482021331787, "rewards/margins": 0.24738340079784393, "rewards/rejected": 1.0790647268295288, "step": 330 }, { "epoch": 0.32007643616386, "grad_norm": 3.53125, "learning_rate": 3.9616076478235826e-07, "logits/chosen": -2.2583556175231934, "logits/rejected": -2.293337106704712, "logps/chosen": -0.30557915568351746, "logps/rejected": -0.30756452679634094, "loss": 0.0511607900261879, "loss/core": 0.0511607900261879, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 1.0766465663909912, "rewards/margins": 0.5183663964271545, "rewards/rejected": 0.5582801699638367, "step": 335 }, { "epoch": 0.3248536964051117, "grad_norm": 5.65625, "learning_rate": 3.922002807757129e-07, "logits/chosen": -2.2513046264648438, "logits/rejected": -2.259812593460083, "logps/chosen": -0.28524649143218994, "logps/rejected": -0.283276230096817, "loss": 0.631820797920227, "loss/core": 0.631820797920227, "rewards/accuracies": 0.875, "rewards/chosen": 2.1910934448242188, "rewards/margins": 1.2970854043960571, "rewards/rejected": 0.8940078616142273, "step": 340 }, { "epoch": 0.3296309566463633, "grad_norm": 79.0, "learning_rate": 3.8818632105903315e-07, "logits/chosen": -2.1031250953674316, "logits/rejected": -2.102226734161377, "logps/chosen": -0.26754727959632874, "logps/rejected": -0.28109580278396606, "loss": 0.7250244617462158, "loss/core": 0.7250244617462158, "rewards/accuracies": 0.875, "rewards/chosen": 2.1810359954833984, "rewards/margins": 0.5469441413879395, "rewards/rejected": 1.6340919733047485, "step": 345 }, { "epoch": 0.33440821688761496, "grad_norm": 11.6875, "learning_rate": 3.841203951184094e-07, "logits/chosen": -2.2044973373413086, "logits/rejected": -2.2186226844787598, "logps/chosen": -0.3000710904598236, "logps/rejected": -0.30985429883003235, "loss": 0.6811296939849854, "loss/core": 0.6811296939849854, "rewards/accuracies": 0.875, "rewards/chosen": 2.313596487045288, "rewards/margins": 0.9291432499885559, "rewards/rejected": 1.3844534158706665, "step": 350 }, { "epoch": 0.3391854771288666, "grad_norm": 31.25, "learning_rate": 3.800040319823038e-07, "logits/chosen": -2.172675848007202, "logits/rejected": -2.1876015663146973, "logps/chosen": -0.291890025138855, "logps/rejected": -0.2729564905166626, "loss": 0.8517450094223022, "loss/core": 0.8517450094223022, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 3.446463108062744, "rewards/margins": 1.6567842960357666, "rewards/rejected": 1.7896785736083984, "step": 355 }, { "epoch": 0.34396273737011823, "grad_norm": 89.0, "learning_rate": 3.75838779646545e-07, "logits/chosen": -1.9489272832870483, "logits/rejected": -1.9853594303131104, "logps/chosen": -0.2767919600009918, "logps/rejected": -0.279407799243927, "loss": 0.7631909251213074, "loss/core": 0.7631909251213074, "rewards/accuracies": 0.9375, "rewards/chosen": 3.232623338699341, "rewards/margins": 1.9174954891204834, "rewards/rejected": 1.3151280879974365, "step": 360 }, { "epoch": 0.34873999761136987, "grad_norm": 40.5, "learning_rate": 3.7162620449218993e-07, "logits/chosen": -2.235380172729492, "logits/rejected": -2.306373119354248, "logps/chosen": -0.3116162121295929, "logps/rejected": -0.306151807308197, "loss": 0.5377756357192993, "loss/core": 0.5377756357192993, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 2.417541265487671, "rewards/margins": 1.4117828607559204, "rewards/rejected": 1.0057584047317505, "step": 365 }, { "epoch": 0.3535172578526215, "grad_norm": 22.0, "learning_rate": 3.673678906964727e-07, "logits/chosen": -2.117574691772461, "logits/rejected": -2.0456650257110596, "logps/chosen": -0.2936505675315857, "logps/rejected": -0.30493101477622986, "loss": 0.7472105622291565, "loss/core": 0.7472105622291565, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 2.3911571502685547, "rewards/margins": 0.7618893384933472, "rewards/rejected": 1.629267692565918, "step": 370 }, { "epoch": 0.35829451809387314, "grad_norm": 7.15625, "learning_rate": 3.6306543963705936e-07, "logits/chosen": -1.9923632144927979, "logits/rejected": -1.9175786972045898, "logps/chosen": -0.2919101119041443, "logps/rejected": -0.28915977478027344, "loss": 1.7186968326568604, "loss/core": 1.7186968326568604, "rewards/accuracies": 0.824999988079071, "rewards/chosen": 3.748534679412842, "rewards/margins": 2.381950855255127, "rewards/rejected": 1.3665834665298462, "step": 375 }, { "epoch": 0.36307177833512483, "grad_norm": 47.0, "learning_rate": 3.5872046928983623e-07, "logits/chosen": -1.9712073802947998, "logits/rejected": -2.0564160346984863, "logps/chosen": -0.28708744049072266, "logps/rejected": -0.308341920375824, "loss": 1.9703826904296875, "loss/core": 1.9703826904296875, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": 3.5351765155792236, "rewards/margins": 1.9188482761383057, "rewards/rejected": 1.616328239440918, "step": 380 }, { "epoch": 0.36784903857637646, "grad_norm": 286.0, "learning_rate": 3.5433461362045447e-07, "logits/chosen": -2.1837782859802246, "logits/rejected": -2.109261989593506, "logps/chosen": -0.3028949201107025, "logps/rejected": -0.3316383957862854, "loss": 1.2228304147720337, "loss/core": 1.2228304147720337, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 3.1072325706481934, "rewards/margins": 1.2266871929168701, "rewards/rejected": 1.8805453777313232, "step": 385 }, { "epoch": 0.3726262988176281, "grad_norm": 2.671875, "learning_rate": 3.4990952196986305e-07, "logits/chosen": -2.0442094802856445, "logits/rejected": -2.072903633117676, "logps/chosen": -0.2997892498970032, "logps/rejected": -0.30010247230529785, "loss": 0.475435346364975, "loss/core": 0.475435346364975, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": 2.0823211669921875, "rewards/margins": 1.195578694343567, "rewards/rejected": 0.8867424726486206, "step": 390 }, { "epoch": 0.37740355905887973, "grad_norm": 7.5625, "learning_rate": 3.4544685843405875e-07, "logits/chosen": -2.156062364578247, "logits/rejected": -2.2315170764923096, "logps/chosen": -0.2756079435348511, "logps/rejected": -0.2708030045032501, "loss": 0.1924670934677124, "loss/core": 0.1924670934677124, "rewards/accuracies": 0.949999988079071, "rewards/chosen": 2.018162965774536, "rewards/margins": 1.0384140014648438, "rewards/rejected": 0.9797487258911133, "step": 395 }, { "epoch": 0.38218081930013137, "grad_norm": 25.25, "learning_rate": 3.4094830123828786e-07, "logits/chosen": -2.1258950233459473, "logits/rejected": -2.064730405807495, "logps/chosen": -0.27466386556625366, "logps/rejected": -0.28442296385765076, "loss": 0.35562631487846375, "loss/core": 0.35562631487846375, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": 2.0544662475585938, "rewards/margins": 0.5271926522254944, "rewards/rejected": 1.5272737741470337, "step": 400 }, { "epoch": 0.386958079541383, "grad_norm": 1208.0, "learning_rate": 3.3641554210593414e-07, "logits/chosen": -2.2992489337921143, "logits/rejected": -2.3570144176483154, "logps/chosen": -0.266804575920105, "logps/rejected": -0.265764981508255, "loss": 1.0862951278686523, "loss/core": 1.0862951278686523, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 2.5454628467559814, "rewards/margins": 1.311475157737732, "rewards/rejected": 1.2339876890182495, "step": 405 }, { "epoch": 0.39173533978263464, "grad_norm": 11.25, "learning_rate": 3.3185028562233107e-07, "logits/chosen": -2.073944568634033, "logits/rejected": -2.1331162452697754, "logps/chosen": -0.3112749457359314, "logps/rejected": -0.3046428859233856, "loss": 0.09161730855703354, "loss/core": 0.09161730855703354, "rewards/accuracies": 0.800000011920929, "rewards/chosen": 1.2061810493469238, "rewards/margins": 0.551508903503418, "rewards/rejected": 0.6546720266342163, "step": 410 }, { "epoch": 0.3965126000238863, "grad_norm": 4.96875, "learning_rate": 3.272542485937368e-07, "logits/chosen": -2.2970967292785645, "logits/rejected": -2.295583724975586, "logps/chosen": -0.29680368304252625, "logps/rejected": -0.28816667199134827, "loss": 0.5273622274398804, "loss/core": 0.5273622274398804, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 2.4427194595336914, "rewards/margins": 1.134141206741333, "rewards/rejected": 1.3085782527923584, "step": 415 }, { "epoch": 0.40128986026513797, "grad_norm": 508.0, "learning_rate": 3.226291594017137e-07, "logits/chosen": -2.098283290863037, "logits/rejected": -2.067476749420166, "logps/chosen": -0.3195353150367737, "logps/rejected": -0.3052719235420227, "loss": 1.6536753177642822, "loss/core": 1.6536753177642822, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 3.3768184185028076, "rewards/margins": 2.38930344581604, "rewards/rejected": 0.9875147938728333, "step": 420 }, { "epoch": 0.4060671205063896, "grad_norm": 23.625, "learning_rate": 3.1797675735315454e-07, "logits/chosen": -2.124053478240967, "logits/rejected": -2.2029757499694824, "logps/chosen": -0.31783485412597656, "logps/rejected": -0.31542786955833435, "loss": 1.095782995223999, "loss/core": 1.095782995223999, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 3.0307421684265137, "rewards/margins": 1.9506139755249023, "rewards/rejected": 1.0801277160644531, "step": 425 }, { "epoch": 0.41084438074764124, "grad_norm": 66.5, "learning_rate": 3.1329879202620047e-07, "logits/chosen": -2.1495888233184814, "logits/rejected": -2.263394832611084, "logps/chosen": -0.26696711778640747, "logps/rejected": -0.2735012173652649, "loss": 0.14888674020767212, "loss/core": 0.14888674020767212, "rewards/accuracies": 0.875, "rewards/chosen": 1.4852890968322754, "rewards/margins": 0.5966399908065796, "rewards/rejected": 0.8886489868164062, "step": 430 }, { "epoch": 0.41562164098889287, "grad_norm": 1328.0, "learning_rate": 3.0859702261229613e-07, "logits/chosen": -1.9643999338150024, "logits/rejected": -1.975927710533142, "logps/chosen": -0.2912464141845703, "logps/rejected": -0.2692493498325348, "loss": 1.1893305778503418, "loss/core": 1.1893305778503418, "rewards/accuracies": 0.875, "rewards/chosen": 3.8585808277130127, "rewards/margins": 2.5125555992126465, "rewards/rejected": 1.3460257053375244, "step": 435 }, { "epoch": 0.4203989012301445, "grad_norm": 42.5, "learning_rate": 3.0387321725463e-07, "logits/chosen": -2.1609604358673096, "logits/rejected": -2.1351842880249023, "logps/chosen": -0.29672715067863464, "logps/rejected": -0.2880227565765381, "loss": 0.2775880694389343, "loss/core": 0.2775880694389343, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 2.147207736968994, "rewards/margins": 0.9227482080459595, "rewards/rejected": 1.2244592905044556, "step": 440 }, { "epoch": 0.42517616147139614, "grad_norm": 97.0, "learning_rate": 2.991291523832075e-07, "logits/chosen": -2.0940496921539307, "logits/rejected": -2.1732332706451416, "logps/chosen": -0.285409152507782, "logps/rejected": -0.27999910712242126, "loss": 0.576115071773529, "loss/core": 0.576115071773529, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 2.9870572090148926, "rewards/margins": 1.8674147129058838, "rewards/rejected": 1.1196422576904297, "step": 445 }, { "epoch": 0.4299534217126478, "grad_norm": 1600.0, "learning_rate": 2.943666120468088e-07, "logits/chosen": -2.1286191940307617, "logits/rejected": -2.199714422225952, "logps/chosen": -0.2662820518016815, "logps/rejected": -0.30065736174583435, "loss": 0.9491519927978516, "loss/core": 0.9491519927978516, "rewards/accuracies": 0.875, "rewards/chosen": 2.870041608810425, "rewards/margins": 1.6734178066253662, "rewards/rejected": 1.1966238021850586, "step": 450 }, { "epoch": 0.4347306819538994, "grad_norm": 1.9921875, "learning_rate": 2.8958738724208073e-07, "logits/chosen": -1.8988832235336304, "logits/rejected": -1.9345617294311523, "logps/chosen": -0.30704838037490845, "logps/rejected": -0.3010723292827606, "loss": 0.18666288256645203, "loss/core": 0.18666288256645203, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 1.7061916589736938, "rewards/margins": 0.875575065612793, "rewards/rejected": 0.8306165933609009, "step": 455 }, { "epoch": 0.4395079421951511, "grad_norm": 10.3125, "learning_rate": 2.8479327524001633e-07, "logits/chosen": -2.0395889282226562, "logits/rejected": -2.1937108039855957, "logps/chosen": -0.2862888276576996, "logps/rejected": -0.28865212202072144, "loss": 0.35019630193710327, "loss/core": 0.35019630193710327, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 2.244964838027954, "rewards/margins": 0.8104959726333618, "rewards/rejected": 1.4344688653945923, "step": 460 }, { "epoch": 0.44428520243640274, "grad_norm": 32.5, "learning_rate": 2.7998607891007493e-07, "logits/chosen": -2.112020254135132, "logits/rejected": -2.0445303916931152, "logps/chosen": -0.2725178003311157, "logps/rejected": -0.30414050817489624, "loss": 1.0059139728546143, "loss/core": 1.0059139728546143, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 2.83925199508667, "rewards/margins": 0.9617875814437866, "rewards/rejected": 1.8774642944335938, "step": 465 }, { "epoch": 0.4490624626776544, "grad_norm": 102.5, "learning_rate": 2.7516760604219616e-07, "logits/chosen": -2.1016361713409424, "logits/rejected": -2.077967643737793, "logps/chosen": -0.2712469696998596, "logps/rejected": -0.29456794261932373, "loss": 0.46677565574645996, "loss/core": 0.46677565574645996, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 2.2126553058624268, "rewards/margins": 0.6549152135848999, "rewards/rejected": 1.557740330696106, "step": 470 }, { "epoch": 0.453839722918906, "grad_norm": 11.6875, "learning_rate": 2.703396686669646e-07, "logits/chosen": -2.209343433380127, "logits/rejected": -2.228372097015381, "logps/chosen": -0.27892497181892395, "logps/rejected": -0.2862241864204407, "loss": 0.31267350912094116, "loss/core": 0.31267350912094116, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 2.3414828777313232, "rewards/margins": 0.8732233047485352, "rewards/rejected": 1.468259572982788, "step": 475 }, { "epoch": 0.45861698316015764, "grad_norm": 1168.0, "learning_rate": 2.6550408237417884e-07, "logits/chosen": -1.982518196105957, "logits/rejected": -1.9973068237304688, "logps/chosen": -0.28591465950012207, "logps/rejected": -0.2720577120780945, "loss": 2.5910723209381104, "loss/core": 2.5910723209381104, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 5.177981376647949, "rewards/margins": 3.9536633491516113, "rewards/rejected": 1.2243181467056274, "step": 480 }, { "epoch": 0.4633942434014093, "grad_norm": 11.4375, "learning_rate": 2.6066266563008265e-07, "logits/chosen": -2.1890599727630615, "logits/rejected": -2.172191858291626, "logps/chosen": -0.2838982939720154, "logps/rejected": -0.30362966656684875, "loss": 0.41411668062210083, "loss/core": 0.41411668062210083, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 2.087114095687866, "rewards/margins": 1.0661743879318237, "rewards/rejected": 1.020939588546753, "step": 485 }, { "epoch": 0.4681715036426609, "grad_norm": 44.0, "learning_rate": 2.5581723909351404e-07, "logits/chosen": -2.1797804832458496, "logits/rejected": -2.127960681915283, "logps/chosen": -0.2894228994846344, "logps/rejected": -0.3229179084300995, "loss": 0.21129579842090607, "loss/core": 0.21129579842090607, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 1.6542030572891235, "rewards/margins": 0.47612959146499634, "rewards/rejected": 1.1780736446380615, "step": 490 }, { "epoch": 0.47294876388391255, "grad_norm": 1896.0, "learning_rate": 2.509696249312301e-07, "logits/chosen": -2.0821642875671387, "logits/rejected": -2.087721347808838, "logps/chosen": -0.3256458342075348, "logps/rejected": -0.3126862943172455, "loss": 1.8491243124008179, "loss/core": 1.8491243124008179, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": 3.5472946166992188, "rewards/margins": 1.9033483266830444, "rewards/rejected": 1.6439464092254639, "step": 495 }, { "epoch": 0.47772602412516424, "grad_norm": 400.0, "learning_rate": 2.461216461326642e-07, "logits/chosen": -2.1551461219787598, "logits/rejected": -2.116971015930176, "logps/chosen": -0.279205858707428, "logps/rejected": -0.27398478984832764, "loss": 1.2034151554107666, "loss/core": 1.2034151554107666, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 3.4934756755828857, "rewards/margins": 2.316671371459961, "rewards/rejected": 1.176804542541504, "step": 500 }, { "epoch": 0.4825032843664159, "grad_norm": 7.875, "learning_rate": 2.412751258243748e-07, "logits/chosen": -1.734514832496643, "logits/rejected": -1.755017638206482, "logps/chosen": -0.3091053366661072, "logps/rejected": -0.31018969416618347, "loss": 0.7064386606216431, "loss/core": 0.7064386606216431, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 3.180860996246338, "rewards/margins": 1.8545881509780884, "rewards/rejected": 1.32627272605896, "step": 505 }, { "epoch": 0.4872805446076675, "grad_norm": 502.0, "learning_rate": 2.3643188658444158e-07, "logits/chosen": -2.0605289936065674, "logits/rejected": -2.1547398567199707, "logps/chosen": -0.2701338529586792, "logps/rejected": -0.2844063639640808, "loss": 0.5944812297821045, "loss/core": 0.5944812297821045, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": 3.014646053314209, "rewards/margins": 1.663463830947876, "rewards/rejected": 1.351182222366333, "step": 510 }, { "epoch": 0.49205780484891914, "grad_norm": 14.5, "learning_rate": 2.315937497570688e-07, "logits/chosen": -1.9274842739105225, "logits/rejected": -2.0313713550567627, "logps/chosen": -0.2993752360343933, "logps/rejected": -0.3588908612728119, "loss": 0.5572088956832886, "loss/core": 0.5572088956832886, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": 2.2762691974639893, "rewards/margins": 1.200260043144226, "rewards/rejected": 1.0760090351104736, "step": 515 }, { "epoch": 0.4968350650901708, "grad_norm": 2.265625, "learning_rate": 2.2676253476765194e-07, "logits/chosen": -1.9769691228866577, "logits/rejected": -2.1776771545410156, "logps/chosen": -0.32004016637802124, "logps/rejected": -0.2949730157852173, "loss": 0.6923333406448364, "loss/core": 0.6923333406448364, "rewards/accuracies": 0.824999988079071, "rewards/chosen": 2.3702404499053955, "rewards/margins": 1.4442033767700195, "rewards/rejected": 0.9260371923446655, "step": 520 }, { "epoch": 0.5016123253314224, "grad_norm": 0.89453125, "learning_rate": 2.2194005843856633e-07, "logits/chosen": -2.003140687942505, "logits/rejected": -2.0340893268585205, "logps/chosen": -0.28318530321121216, "logps/rejected": -0.281009316444397, "loss": 0.7909449338912964, "loss/core": 0.7909449338912964, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 3.3549766540527344, "rewards/margins": 2.027585744857788, "rewards/rejected": 1.3273913860321045, "step": 525 }, { "epoch": 0.5063895855726741, "grad_norm": 7.53125, "learning_rate": 2.1712813430593434e-07, "logits/chosen": -2.0626168251037598, "logits/rejected": -2.1819634437561035, "logps/chosen": -0.2981792986392975, "logps/rejected": -0.297743558883667, "loss": 0.17196998000144958, "loss/core": 0.17196998000144958, "rewards/accuracies": 0.875, "rewards/chosen": 1.795514464378357, "rewards/margins": 0.9798916578292847, "rewards/rejected": 0.8156226873397827, "step": 530 }, { "epoch": 0.5111668458139257, "grad_norm": 39.5, "learning_rate": 2.123285719376292e-07, "logits/chosen": -2.0366547107696533, "logits/rejected": -2.0415263175964355, "logps/chosen": -0.28957507014274597, "logps/rejected": -0.28460192680358887, "loss": 1.1312463283538818, "loss/core": 1.1312463283538818, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": 3.3058319091796875, "rewards/margins": 1.5662612915039062, "rewards/rejected": 1.7395708560943604, "step": 535 }, { "epoch": 0.5159441060551774, "grad_norm": 43.5, "learning_rate": 2.0754317625276982e-07, "logits/chosen": -2.0326008796691895, "logits/rejected": -2.0860085487365723, "logps/chosen": -0.2913965582847595, "logps/rejected": -0.2849191427230835, "loss": 0.28950196504592896, "loss/core": 0.28950196504592896, "rewards/accuracies": 0.875, "rewards/chosen": 1.971967101097107, "rewards/margins": 1.0436313152313232, "rewards/rejected": 0.9283358454704285, "step": 540 }, { "epoch": 0.520721366296429, "grad_norm": 208.0, "learning_rate": 2.0277374684296498e-07, "logits/chosen": -2.021231174468994, "logits/rejected": -2.0813746452331543, "logps/chosen": -0.2889094650745392, "logps/rejected": -0.27322858572006226, "loss": 0.8897081613540649, "loss/core": 0.8897081613540649, "rewards/accuracies": 0.949999988079071, "rewards/chosen": 3.6772232055664062, "rewards/margins": 2.866091012954712, "rewards/rejected": 0.8111323118209839, "step": 545 }, { "epoch": 0.5254986265376806, "grad_norm": 6.90625, "learning_rate": 1.980220772955602e-07, "logits/chosen": -1.9826974868774414, "logits/rejected": -2.0089569091796875, "logps/chosen": -0.2836936116218567, "logps/rejected": -0.28125476837158203, "loss": 0.17911246418952942, "loss/core": 0.17911246418952942, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 2.2390589714050293, "rewards/margins": 1.1507548093795776, "rewards/rejected": 1.0883041620254517, "step": 550 }, { "epoch": 0.5302758867789323, "grad_norm": 15.25, "learning_rate": 1.932899545191433e-07, "logits/chosen": -2.034287452697754, "logits/rejected": -2.1081697940826416, "logps/chosen": -0.3206217288970947, "logps/rejected": -0.30311864614486694, "loss": 1.040518045425415, "loss/core": 1.040518045425415, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 3.1932551860809326, "rewards/margins": 1.7633758783340454, "rewards/rejected": 1.429879069328308, "step": 555 }, { "epoch": 0.5350531470201839, "grad_norm": 14.6875, "learning_rate": 1.885791580715609e-07, "logits/chosen": -1.850868582725525, "logits/rejected": -1.8559157848358154, "logps/chosen": -0.3106183409690857, "logps/rejected": -0.29663991928100586, "loss": 0.6726303100585938, "loss/core": 0.6726303100585938, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 2.4848763942718506, "rewards/margins": 1.1928892135620117, "rewards/rejected": 1.291987419128418, "step": 560 }, { "epoch": 0.5398304072614356, "grad_norm": 45.25, "learning_rate": 1.8389145949069951e-07, "logits/chosen": -1.9359796047210693, "logits/rejected": -2.0416994094848633, "logps/chosen": -0.28728121519088745, "logps/rejected": -0.2942139506340027, "loss": 2.735677719116211, "loss/core": 2.735677719116211, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 5.07828950881958, "rewards/margins": 3.2359542846679688, "rewards/rejected": 1.8423347473144531, "step": 565 }, { "epoch": 0.5446076675026872, "grad_norm": 91.5, "learning_rate": 1.792286216282824e-07, "logits/chosen": -2.077359437942505, "logits/rejected": -2.0332412719726562, "logps/chosen": -0.3251068890094757, "logps/rejected": -0.31182152032852173, "loss": 0.7743596434593201, "loss/core": 0.7743596434593201, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": 2.263739585876465, "rewards/margins": 0.2986152172088623, "rewards/rejected": 1.965124487876892, "step": 570 }, { "epoch": 0.5493849277439389, "grad_norm": 20.625, "learning_rate": 1.745923979869336e-07, "logits/chosen": -2.3297030925750732, "logits/rejected": -2.3048276901245117, "logps/chosen": -0.28046730160713196, "logps/rejected": -0.2963675260543823, "loss": 0.5231956839561462, "loss/core": 0.5231956839561462, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 2.400116443634033, "rewards/margins": 1.4617714881896973, "rewards/rejected": 0.9383450746536255, "step": 575 }, { "epoch": 0.5541621879851905, "grad_norm": 8.8125, "learning_rate": 1.6998453206075708e-07, "logits/chosen": -2.00852632522583, "logits/rejected": -2.128060817718506, "logps/chosen": -0.30730748176574707, "logps/rejected": -0.3067978024482727, "loss": 0.4244763255119324, "loss/core": 0.4244763255119324, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 2.4532878398895264, "rewards/margins": 1.449927568435669, "rewards/rejected": 1.0033600330352783, "step": 580 }, { "epoch": 0.5589394482264421, "grad_norm": 234.0, "learning_rate": 1.6540675667967973e-07, "logits/chosen": -2.2257282733917236, "logits/rejected": -2.239046096801758, "logps/chosen": -0.2853415906429291, "logps/rejected": -0.28488466143608093, "loss": 0.8494731187820435, "loss/core": 0.8494731187820435, "rewards/accuracies": 0.949999988079071, "rewards/chosen": 2.5698318481445312, "rewards/margins": 0.717768669128418, "rewards/rejected": 1.8520629405975342, "step": 585 }, { "epoch": 0.5637167084676937, "grad_norm": 185.0, "learning_rate": 1.60860793357805e-07, "logits/chosen": -1.9403209686279297, "logits/rejected": -1.9107745885849, "logps/chosen": -0.30443838238716125, "logps/rejected": -0.3014160990715027, "loss": 0.7370032668113708, "loss/core": 0.7370032668113708, "rewards/accuracies": 0.824999988079071, "rewards/chosen": 2.7498955726623535, "rewards/margins": 1.003064513206482, "rewards/rejected": 1.746830940246582, "step": 590 }, { "epoch": 0.5684939687089454, "grad_norm": 2.40625, "learning_rate": 1.5634835164602196e-07, "logits/chosen": -2.0419182777404785, "logits/rejected": -1.969354271888733, "logps/chosen": -0.2744390368461609, "logps/rejected": -0.2946432828903198, "loss": 0.6912421584129333, "loss/core": 0.6912421584129333, "rewards/accuracies": 0.875, "rewards/chosen": 1.8153032064437866, "rewards/margins": -0.3735305368900299, "rewards/rejected": 2.188833713531494, "step": 595 }, { "epoch": 0.5732712289501971, "grad_norm": 40.25, "learning_rate": 1.518711284891132e-07, "logits/chosen": -2.1388328075408936, "logits/rejected": -2.0539865493774414, "logps/chosen": -0.2972756028175354, "logps/rejected": -0.31171417236328125, "loss": 0.36328691244125366, "loss/core": 0.36328691244125366, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 1.7741825580596924, "rewards/margins": 0.6642401814460754, "rewards/rejected": 1.1099423170089722, "step": 600 }, { "epoch": 0.5780484891914487, "grad_norm": 28.5, "learning_rate": 1.47430807587603e-07, "logits/chosen": -2.2820992469787598, "logits/rejected": -2.370114803314209, "logps/chosen": -0.29316216707229614, "logps/rejected": -0.3045360743999481, "loss": 0.418804794549942, "loss/core": 0.418804794549942, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 1.924261450767517, "rewards/margins": 1.342273473739624, "rewards/rejected": 0.5819882154464722, "step": 605 }, { "epoch": 0.5828257494327004, "grad_norm": 5.03125, "learning_rate": 1.430290587645865e-07, "logits/chosen": -2.0365357398986816, "logits/rejected": -2.1053943634033203, "logps/chosen": -0.30090898275375366, "logps/rejected": -0.30962470173835754, "loss": 0.7318702936172485, "loss/core": 0.7318702936172485, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 2.31716251373291, "rewards/margins": 0.7470144033432007, "rewards/rejected": 1.5701478719711304, "step": 610 }, { "epoch": 0.587603009673952, "grad_norm": 1.0390625, "learning_rate": 1.3866753733777765e-07, "logits/chosen": -2.0896778106689453, "logits/rejected": -2.0692594051361084, "logps/chosen": -0.3204464912414551, "logps/rejected": -0.31083038449287415, "loss": 0.15200874209403992, "loss/core": 0.15200874209403992, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 1.405200481414795, "rewards/margins": 0.6567575335502625, "rewards/rejected": 0.7484430074691772, "step": 615 }, { "epoch": 0.5923802699152036, "grad_norm": 10.25, "learning_rate": 1.343478834970121e-07, "logits/chosen": -2.2016444206237793, "logits/rejected": -2.162689447402954, "logps/chosen": -0.2618758976459503, "logps/rejected": -0.28418415784835815, "loss": 0.2642122209072113, "loss/core": 0.2642122209072113, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 1.8917810916900635, "rewards/margins": 0.6098601818084717, "rewards/rejected": 1.2819210290908813, "step": 620 }, { "epoch": 0.5971575301564552, "grad_norm": 13.5, "learning_rate": 1.3007172168743852e-07, "logits/chosen": -2.0167224407196045, "logits/rejected": -1.9906463623046875, "logps/chosen": -0.2946910262107849, "logps/rejected": -0.29906517267227173, "loss": 0.1281525194644928, "loss/core": 0.1281525194644928, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 1.5117716789245605, "rewards/margins": 0.6090092658996582, "rewards/rejected": 0.9027624130249023, "step": 625 }, { "epoch": 0.6019347903977069, "grad_norm": 48.0, "learning_rate": 1.25840659998631e-07, "logits/chosen": -2.24929141998291, "logits/rejected": -2.1729183197021484, "logps/chosen": -0.2794455885887146, "logps/rejected": -0.2963079810142517, "loss": 0.09536317735910416, "loss/core": 0.09536317735910416, "rewards/accuracies": 0.875, "rewards/chosen": 1.2493692636489868, "rewards/margins": 0.36890143156051636, "rewards/rejected": 0.8804677724838257, "step": 630 }, { "epoch": 0.6067120506389586, "grad_norm": 0.60546875, "learning_rate": 1.2165628955985313e-07, "logits/chosen": -2.070937395095825, "logits/rejected": -2.0991628170013428, "logps/chosen": -0.30978572368621826, "logps/rejected": -0.2937181890010834, "loss": 1.2708914279937744, "loss/core": 1.2708914279937744, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 3.1841537952423096, "rewards/margins": 2.332937240600586, "rewards/rejected": 0.851216197013855, "step": 635 }, { "epoch": 0.6114893108802102, "grad_norm": 255.0, "learning_rate": 1.175201839416988e-07, "logits/chosen": -1.9998000860214233, "logits/rejected": -2.1376776695251465, "logps/chosen": -0.2979816794395447, "logps/rejected": -0.2850627899169922, "loss": 0.48012876510620117, "loss/core": 0.48012876510620117, "rewards/accuracies": 0.9375, "rewards/chosen": 2.3821167945861816, "rewards/margins": 1.731583833694458, "rewards/rejected": 0.6505327820777893, "step": 640 }, { "epoch": 0.6162665711214619, "grad_norm": 13.0, "learning_rate": 1.1343389856433658e-07, "logits/chosen": -2.054605484008789, "logits/rejected": -2.1557681560516357, "logps/chosen": -0.2970808148384094, "logps/rejected": -0.26274365186691284, "loss": 2.3463776111602783, "loss/core": 2.3463776111602783, "rewards/accuracies": 0.9375, "rewards/chosen": 4.414872169494629, "rewards/margins": 2.85589337348938, "rewards/rejected": 1.5589792728424072, "step": 645 }, { "epoch": 0.6210438313627135, "grad_norm": 7.71875, "learning_rate": 1.0939897011258e-07, "logits/chosen": -2.2726993560791016, "logits/rejected": -2.288119077682495, "logps/chosen": -0.3080156445503235, "logps/rejected": -0.2879447340965271, "loss": 1.3906691074371338, "loss/core": 1.3906691074371338, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 3.284862995147705, "rewards/margins": 2.400153875350952, "rewards/rejected": 0.8847091794013977, "step": 650 }, { "epoch": 0.6258210916039652, "grad_norm": 17.75, "learning_rate": 1.0541691595800336e-07, "logits/chosen": -1.922623872756958, "logits/rejected": -1.9154341220855713, "logps/chosen": -0.28070202469825745, "logps/rejected": -0.3093103766441345, "loss": 0.5413604974746704, "loss/core": 0.5413604974746704, "rewards/accuracies": 0.9750000238418579, "rewards/chosen": 2.844754457473755, "rewards/margins": 1.1954736709594727, "rewards/rejected": 1.6492809057235718, "step": 655 }, { "epoch": 0.6305983518452167, "grad_norm": 16.75, "learning_rate": 1.0148923358832021e-07, "logits/chosen": -2.2555432319641113, "logits/rejected": -2.311061382293701, "logps/chosen": -0.27462202310562134, "logps/rejected": -0.2811489999294281, "loss": 0.3550433814525604, "loss/core": 0.3550433814525604, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 2.0413260459899902, "rewards/margins": 0.9709696769714355, "rewards/rejected": 1.0703566074371338, "step": 660 }, { "epoch": 0.6353756120864684, "grad_norm": 26.875, "learning_rate": 9.761740004423926e-08, "logits/chosen": -2.12736439704895, "logits/rejected": -2.2038140296936035, "logps/chosen": -0.3001564145088196, "logps/rejected": -0.32446950674057007, "loss": 0.2872669994831085, "loss/core": 0.2872669994831085, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 1.7709327936172485, "rewards/margins": 0.7759586572647095, "rewards/rejected": 0.9949741363525391, "step": 665 }, { "epoch": 0.64015287232772, "grad_norm": 14.125, "learning_rate": 9.380287136400999e-08, "logits/chosen": -2.269469738006592, "logits/rejected": -2.301842212677002, "logps/chosen": -0.285754531621933, "logps/rejected": -0.2945065200328827, "loss": 0.39818090200424194, "loss/core": 0.39818090200424194, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 1.9868361949920654, "rewards/margins": 0.8125089406967163, "rewards/rejected": 1.1743274927139282, "step": 670 }, { "epoch": 0.6449301325689717, "grad_norm": 23.375, "learning_rate": 9.004708203586628e-08, "logits/chosen": -2.080825090408325, "logits/rejected": -2.2083404064178467, "logps/chosen": -0.2972838282585144, "logps/rejected": -0.28944870829582214, "loss": 0.3145357370376587, "loss/core": 0.3145357370376587, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 1.903146505355835, "rewards/margins": 0.8571847677230835, "rewards/rejected": 1.0459617376327515, "step": 675 }, { "epoch": 0.6497073928102234, "grad_norm": 704.0, "learning_rate": 8.635144445857407e-08, "logits/chosen": -2.1277308464050293, "logits/rejected": -2.093435525894165, "logps/chosen": -0.28518134355545044, "logps/rejected": -0.2920211851596832, "loss": 0.24321074783802032, "loss/core": 0.24321074783802032, "rewards/accuracies": 0.875, "rewards/chosen": 1.2132742404937744, "rewards/margins": -0.060915298759937286, "rewards/rejected": 1.2741894721984863, "step": 680 }, { "epoch": 0.654484653051475, "grad_norm": 392.0, "learning_rate": 8.271734841028552e-08, "logits/chosen": -2.1869044303894043, "logits/rejected": -2.1886041164398193, "logps/chosen": -0.2989751398563385, "logps/rejected": -0.30234605073928833, "loss": 0.5350499153137207, "loss/core": 0.5350499153137207, "rewards/accuracies": 0.824999988079071, "rewards/chosen": 1.4281145334243774, "rewards/margins": -0.04558032751083374, "rewards/rejected": 1.4736945629119873, "step": 685 }, { "epoch": 0.6592619132927267, "grad_norm": 21.625, "learning_rate": 7.91461605259007e-08, "logits/chosen": -1.9535391330718994, "logits/rejected": -1.9515883922576904, "logps/chosen": -0.26703256368637085, "logps/rejected": -0.28917747735977173, "loss": 0.5689412355422974, "loss/core": 0.5689412355422974, "rewards/accuracies": 0.875, "rewards/chosen": 3.011037826538086, "rewards/margins": 1.4389708042144775, "rewards/rejected": 1.5720670223236084, "step": 690 }, { "epoch": 0.6640391735339782, "grad_norm": 6.96875, "learning_rate": 7.563922378313217e-08, "logits/chosen": -2.2548301219940186, "logits/rejected": -2.1238934993743896, "logps/chosen": -0.2951969504356384, "logps/rejected": -0.3159661591053009, "loss": 0.14107027649879456, "loss/core": 0.14107027649879456, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 1.4432185888290405, "rewards/margins": 0.7674707174301147, "rewards/rejected": 0.6757478713989258, "step": 695 }, { "epoch": 0.6688164337752299, "grad_norm": 183.0, "learning_rate": 7.219785699746572e-08, "logits/chosen": -2.0966005325317383, "logits/rejected": -2.1340537071228027, "logps/chosen": -0.2893856465816498, "logps/rejected": -0.2702532708644867, "loss": 0.855477511882782, "loss/core": 0.855477511882782, "rewards/accuracies": 0.9375, "rewards/chosen": 3.0240743160247803, "rewards/margins": 1.6322101354599, "rewards/rejected": 1.3918644189834595, "step": 700 }, { "epoch": 0.6735936940164815, "grad_norm": 148.0, "learning_rate": 6.882335432620779e-08, "logits/chosen": -2.008580446243286, "logits/rejected": -2.0907862186431885, "logps/chosen": -0.2771678864955902, "logps/rejected": -0.2853749692440033, "loss": 0.19750399887561798, "loss/core": 0.19750399887561798, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 1.4055383205413818, "rewards/margins": 0.3061255216598511, "rewards/rejected": 1.0994129180908203, "step": 705 }, { "epoch": 0.6783709542577332, "grad_norm": 5.15625, "learning_rate": 6.551698478180589e-08, "logits/chosen": -2.002742052078247, "logits/rejected": -2.040894031524658, "logps/chosen": -0.28560441732406616, "logps/rejected": -0.2906520962715149, "loss": 0.36187195777893066, "loss/core": 0.36187195777893066, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 2.5490121841430664, "rewards/margins": 1.2243046760559082, "rewards/rejected": 1.3247077465057373, "step": 710 }, { "epoch": 0.6831482144989849, "grad_norm": 2.125, "learning_rate": 6.22799917546252e-08, "logits/chosen": -2.0940136909484863, "logits/rejected": -2.1399710178375244, "logps/chosen": -0.28695395588874817, "logps/rejected": -0.2956109941005707, "loss": 0.47707152366638184, "loss/core": 0.47707152366638184, "rewards/accuracies": 0.875, "rewards/chosen": 2.8282418251037598, "rewards/margins": 1.4551374912261963, "rewards/rejected": 1.3731043338775635, "step": 715 }, { "epoch": 0.6879254747402365, "grad_norm": 1.9140625, "learning_rate": 5.9113592545359944e-08, "logits/chosen": -2.2517735958099365, "logits/rejected": -2.2257275581359863, "logps/chosen": -0.3003559112548828, "logps/rejected": -0.2943252921104431, "loss": 0.47043830156326294, "loss/core": 0.47043830156326294, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": 2.214423418045044, "rewards/margins": 1.1652237176895142, "rewards/rejected": 1.0491998195648193, "step": 720 }, { "epoch": 0.6927027349814882, "grad_norm": 3.765625, "learning_rate": 5.601897790725643e-08, "logits/chosen": -2.103532314300537, "logits/rejected": -2.1393818855285645, "logps/chosen": -0.31979304552078247, "logps/rejected": -0.31625136733055115, "loss": 0.08710397779941559, "loss/core": 0.08710397779941559, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": 1.1311936378479004, "rewards/margins": 0.3907800316810608, "rewards/rejected": 0.7404135465621948, "step": 725 }, { "epoch": 0.6974799952227397, "grad_norm": 19.875, "learning_rate": 5.299731159831952e-08, "logits/chosen": -2.185694456100464, "logits/rejected": -2.1851601600646973, "logps/chosen": -0.29845187067985535, "logps/rejected": -0.30084067583084106, "loss": 0.5585907697677612, "loss/core": 0.5585907697677612, "rewards/accuracies": 0.949999988079071, "rewards/chosen": 2.5317673683166504, "rewards/margins": 1.6783374547958374, "rewards/rejected": 0.8534297943115234, "step": 730 }, { "epoch": 0.7022572554639914, "grad_norm": 7.65625, "learning_rate": 5.0049729943671013e-08, "logits/chosen": -2.2042665481567383, "logits/rejected": -2.212019681930542, "logps/chosen": -0.270427942276001, "logps/rejected": -0.29099661111831665, "loss": 0.2325257807970047, "loss/core": 0.2325257807970047, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 2.025036573410034, "rewards/margins": 0.7466187477111816, "rewards/rejected": 1.2784178256988525, "step": 735 }, { "epoch": 0.707034515705243, "grad_norm": 5.625, "learning_rate": 4.7177341408223994e-08, "logits/chosen": -2.023667812347412, "logits/rejected": -2.055938243865967, "logps/chosen": -0.267364501953125, "logps/rejected": -0.284996896982193, "loss": 0.3424833416938782, "loss/core": 0.3424833416938782, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": 2.194387912750244, "rewards/margins": 1.0326035022735596, "rewards/rejected": 1.1617845296859741, "step": 740 }, { "epoch": 0.7118117759464947, "grad_norm": 62.25, "learning_rate": 4.438122617983442e-08, "logits/chosen": -1.9847673177719116, "logits/rejected": -2.012366771697998, "logps/chosen": -0.2840479910373688, "logps/rejected": -0.27548593282699585, "loss": 1.2490966320037842, "loss/core": 1.2490966320037842, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": 3.142892360687256, "rewards/margins": 1.1425834894180298, "rewards/rejected": 2.0003087520599365, "step": 745 }, { "epoch": 0.7165890361877463, "grad_norm": 10.9375, "learning_rate": 4.1662435763087114e-08, "logits/chosen": -2.047241687774658, "logits/rejected": -2.079470634460449, "logps/chosen": -0.2526155114173889, "logps/rejected": -0.2926296293735504, "loss": 0.3922721743583679, "loss/core": 0.3922721743583679, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 2.4976963996887207, "rewards/margins": 1.1639492511749268, "rewards/rejected": 1.333747148513794, "step": 750 }, { "epoch": 0.721366296428998, "grad_norm": 1.0078125, "learning_rate": 3.902199258386732e-08, "logits/chosen": -2.1882448196411133, "logits/rejected": -2.1855483055114746, "logps/chosen": -0.36757299304008484, "logps/rejected": -0.29461368918418884, "loss": 1.8846288919448853, "loss/core": 1.8846288919448853, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 3.939770221710205, "rewards/margins": 1.8737109899520874, "rewards/rejected": 2.06605863571167, "step": 755 }, { "epoch": 0.7261435566702497, "grad_norm": 6.875, "learning_rate": 3.646088960486862e-08, "logits/chosen": -2.087844133377075, "logits/rejected": -2.1318325996398926, "logps/chosen": -0.2983017563819885, "logps/rejected": -0.30041682720184326, "loss": 0.2357165366411209, "loss/core": 0.2357165366411209, "rewards/accuracies": 0.875, "rewards/chosen": 1.57404363155365, "rewards/margins": 0.8634489178657532, "rewards/rejected": 0.7105947136878967, "step": 760 }, { "epoch": 0.7309208169115012, "grad_norm": 4.3125, "learning_rate": 3.398008995217988e-08, "logits/chosen": -2.253822088241577, "logits/rejected": -2.278644323348999, "logps/chosen": -0.2737087607383728, "logps/rejected": -0.2841106057167053, "loss": 0.0988527461886406, "loss/core": 0.0988527461886406, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 1.4775121212005615, "rewards/margins": 0.5869768261909485, "rewards/rejected": 0.8905353546142578, "step": 765 }, { "epoch": 0.7356980771527529, "grad_norm": 69.0, "learning_rate": 3.1580526553093315e-08, "logits/chosen": -2.1181020736694336, "logits/rejected": -2.1448464393615723, "logps/chosen": -0.30012568831443787, "logps/rejected": -0.2899145185947418, "loss": 0.3107560873031616, "loss/core": 0.3107560873031616, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 2.013152599334717, "rewards/margins": 0.9449566006660461, "rewards/rejected": 1.0681959390640259, "step": 770 }, { "epoch": 0.7404753373940045, "grad_norm": 251.0, "learning_rate": 2.9263101785268252e-08, "logits/chosen": -2.248095750808716, "logits/rejected": -2.2297964096069336, "logps/chosen": -0.27153995633125305, "logps/rejected": -0.27207639813423157, "loss": 0.322858989238739, "loss/core": 0.322858989238739, "rewards/accuracies": 0.9750000238418579, "rewards/chosen": 2.0420784950256348, "rewards/margins": 1.176545262336731, "rewards/rejected": 0.8655333518981934, "step": 775 }, { "epoch": 0.7452525976352562, "grad_norm": 20.625, "learning_rate": 2.7028687137384264e-08, "logits/chosen": -2.028242826461792, "logits/rejected": -2.135806083679199, "logps/chosen": -0.2820461392402649, "logps/rejected": -0.2808576226234436, "loss": 0.5030468702316284, "loss/core": 0.5030468702316284, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 2.855433940887451, "rewards/margins": 1.1535121202468872, "rewards/rejected": 1.701921820640564, "step": 780 }, { "epoch": 0.7500298578765078, "grad_norm": 14.875, "learning_rate": 2.4878122881409447e-08, "logits/chosen": -1.9230458736419678, "logits/rejected": -1.8952453136444092, "logps/chosen": -0.28769412636756897, "logps/rejected": -0.2964576482772827, "loss": 0.5485445261001587, "loss/core": 0.5485445261001587, "rewards/accuracies": 0.875, "rewards/chosen": 2.40129017829895, "rewards/margins": 0.9055936932563782, "rewards/rejected": 1.4956964254379272, "step": 785 }, { "epoch": 0.7548071181177595, "grad_norm": 3.84375, "learning_rate": 2.2812217756608937e-08, "logits/chosen": -2.113828420639038, "logits/rejected": -2.184523344039917, "logps/chosen": -0.30777841806411743, "logps/rejected": -0.34668484330177307, "loss": 0.178707093000412, "loss/core": 0.178707093000412, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 1.7738380432128906, "rewards/margins": 1.0590564012527466, "rewards/rejected": 0.7147814631462097, "step": 790 }, { "epoch": 0.7595843783590112, "grad_norm": 57.25, "learning_rate": 2.0831748665410763e-08, "logits/chosen": -2.0712850093841553, "logits/rejected": -2.047006368637085, "logps/chosen": -0.2615426182746887, "logps/rejected": -0.2844923138618469, "loss": 0.5626412630081177, "loss/core": 0.5626412630081177, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 2.4369277954101562, "rewards/margins": 0.5682427883148193, "rewards/rejected": 1.8686845302581787, "step": 795 }, { "epoch": 0.7643616386002627, "grad_norm": 9.0, "learning_rate": 1.8937460381244967e-08, "logits/chosen": -1.9848846197128296, "logits/rejected": -2.050729751586914, "logps/chosen": -0.3180027902126312, "logps/rejected": -0.2833881378173828, "loss": 1.3084042072296143, "loss/core": 1.3084042072296143, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 3.4368815422058105, "rewards/margins": 2.4918322563171387, "rewards/rejected": 0.9450491666793823, "step": 800 }, { "epoch": 0.7691388988415144, "grad_norm": 49.0, "learning_rate": 1.713006526846439e-08, "logits/chosen": -2.084895610809326, "logits/rejected": -2.2298989295959473, "logps/chosen": -0.2837081849575043, "logps/rejected": -0.28118696808815, "loss": 0.3433898687362671, "loss/core": 0.3433898687362671, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 2.079929828643799, "rewards/margins": 1.1563465595245361, "rewards/rejected": 0.9235833287239075, "step": 805 }, { "epoch": 0.773916159082766, "grad_norm": 10.9375, "learning_rate": 1.541024301445404e-08, "logits/chosen": -2.3721537590026855, "logits/rejected": -2.3594298362731934, "logps/chosen": -0.27915048599243164, "logps/rejected": -0.2653045058250427, "loss": 0.35306280851364136, "loss/core": 0.35306280851364136, "rewards/accuracies": 0.875, "rewards/chosen": 1.984630823135376, "rewards/margins": 1.1519166231155396, "rewards/rejected": 0.8327140808105469, "step": 810 }, { "epoch": 0.7786934193240177, "grad_norm": 45.5, "learning_rate": 1.3778640374027983e-08, "logits/chosen": -2.0560569763183594, "logits/rejected": -2.0075690746307373, "logps/chosen": -0.29053401947021484, "logps/rejected": -0.3152034282684326, "loss": 0.1969846785068512, "loss/core": 0.1969846785068512, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 1.955904245376587, "rewards/margins": 0.8895227313041687, "rewards/rejected": 1.0663814544677734, "step": 815 }, { "epoch": 0.7834706795652693, "grad_norm": 30.75, "learning_rate": 1.2235870926211616e-08, "logits/chosen": -2.0074410438537598, "logits/rejected": -1.998299241065979, "logps/chosen": -0.2895830273628235, "logps/rejected": -0.2900421619415283, "loss": 0.6202723979949951, "loss/core": 0.6202723979949951, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": 2.5479187965393066, "rewards/margins": 1.322956919670105, "rewards/rejected": 1.2249616384506226, "step": 820 }, { "epoch": 0.788247939806521, "grad_norm": 1.15625, "learning_rate": 1.0782514843499652e-08, "logits/chosen": -2.06480073928833, "logits/rejected": -2.2259457111358643, "logps/chosen": -0.301548570394516, "logps/rejected": -0.3503800928592682, "loss": 0.5075355768203735, "loss/core": 0.5075355768203735, "rewards/accuracies": 0.9375, "rewards/chosen": 2.2786221504211426, "rewards/margins": 1.6066519021987915, "rewards/rejected": 0.6719702482223511, "step": 825 }, { "epoch": 0.7930252000477725, "grad_norm": 55.0, "learning_rate": 9.419118673676924e-09, "logits/chosen": -2.1703529357910156, "logits/rejected": -2.184058666229248, "logps/chosen": -0.300544798374176, "logps/rejected": -0.2891280949115753, "loss": 0.2319040298461914, "loss/core": 0.2319040298461914, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 1.8630399703979492, "rewards/margins": 1.0912376642227173, "rewards/rejected": 0.7718024849891663, "step": 830 }, { "epoch": 0.7978024602890242, "grad_norm": 7.75, "learning_rate": 8.14619513428405e-09, "logits/chosen": -2.2036571502685547, "logits/rejected": -2.212895631790161, "logps/chosen": -0.2536885142326355, "logps/rejected": -0.2815439701080322, "loss": 0.3949839472770691, "loss/core": 0.3949839472770691, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 2.112321138381958, "rewards/margins": 1.3582528829574585, "rewards/rejected": 0.7540683150291443, "step": 835 }, { "epoch": 0.8025797205302759, "grad_norm": 1256.0, "learning_rate": 6.96422291980539e-09, "logits/chosen": -2.035339832305908, "logits/rejected": -2.0912997722625732, "logps/chosen": -0.29334017634391785, "logps/rejected": -0.29095450043678284, "loss": 1.3885018825531006, "loss/core": 1.3885018825531006, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 3.5305423736572266, "rewards/margins": 2.387678861618042, "rewards/rejected": 1.1428637504577637, "step": 840 }, { "epoch": 0.8073569807715275, "grad_norm": 58.25, "learning_rate": 5.8736465216517594e-09, "logits/chosen": -1.8922698497772217, "logits/rejected": -1.9340620040893555, "logps/chosen": -0.30387482047080994, "logps/rejected": -0.31475311517715454, "loss": 1.267748236656189, "loss/core": 1.267748236656189, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 2.673053503036499, "rewards/margins": 0.4096958041191101, "rewards/rejected": 2.263357639312744, "step": 845 }, { "epoch": 0.8121342410127792, "grad_norm": 19.0, "learning_rate": 4.874876061005173e-09, "logits/chosen": -1.9448999166488647, "logits/rejected": -2.031862735748291, "logps/chosen": -0.2876799702644348, "logps/rejected": -0.29397642612457275, "loss": 0.3203374445438385, "loss/core": 0.3203374445438385, "rewards/accuracies": 0.9375, "rewards/chosen": 2.3861019611358643, "rewards/margins": 1.2526428699493408, "rewards/rejected": 1.1334589719772339, "step": 850 }, { "epoch": 0.8169115012540308, "grad_norm": 16.5, "learning_rate": 3.968287134589188e-09, "logits/chosen": -1.8941272497177124, "logits/rejected": -1.8450911045074463, "logps/chosen": -0.285461962223053, "logps/rejected": -0.28394120931625366, "loss": 0.4327033460140228, "loss/core": 0.4327033460140228, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 2.151184558868408, "rewards/margins": 0.9308632016181946, "rewards/rejected": 1.220321536064148, "step": 855 }, { "epoch": 0.8216887614952825, "grad_norm": 5.65625, "learning_rate": 3.154220673422192e-09, "logits/chosen": -1.9777624607086182, "logits/rejected": -2.0467350482940674, "logps/chosen": -0.28861913084983826, "logps/rejected": -0.3350909352302551, "loss": 0.501311182975769, "loss/core": 0.501311182975769, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 1.9023014307022095, "rewards/margins": 0.7318955659866333, "rewards/rejected": 1.1704059839248657, "step": 860 }, { "epoch": 0.826466021736534, "grad_norm": 105.5, "learning_rate": 2.4329828146074096e-09, "logits/chosen": -1.8944776058197021, "logits/rejected": -1.953665018081665, "logps/chosen": -0.2609250247478485, "logps/rejected": -0.29491904377937317, "loss": 0.4003438353538513, "loss/core": 0.4003438353538513, "rewards/accuracies": 0.875, "rewards/chosen": 2.2690205574035645, "rewards/margins": 1.027840256690979, "rewards/rejected": 1.241180181503296, "step": 865 }, { "epoch": 0.8312432819777857, "grad_norm": 924.0, "learning_rate": 1.8048447862070714e-09, "logits/chosen": -2.322716236114502, "logits/rejected": -2.29233980178833, "logps/chosen": -0.3064175248146057, "logps/rejected": -0.29991593956947327, "loss": 1.024073839187622, "loss/core": 1.024073839187622, "rewards/accuracies": 0.824999988079071, "rewards/chosen": 2.370023012161255, "rewards/margins": 1.0268133878707886, "rewards/rejected": 1.343209981918335, "step": 870 }, { "epoch": 0.8360205422190374, "grad_norm": 35.5, "learning_rate": 1.2700428052447033e-09, "logits/chosen": -2.17930006980896, "logits/rejected": -2.034334897994995, "logps/chosen": -0.27654317021369934, "logps/rejected": -0.310249388217926, "loss": 0.34868985414505005, "loss/core": 0.34868985414505005, "rewards/accuracies": 0.8125, "rewards/chosen": 1.6901212930679321, "rewards/margins": -0.11936825513839722, "rewards/rejected": 1.8094894886016846, "step": 875 }, { "epoch": 0.840797802460289, "grad_norm": 12.25, "learning_rate": 8.287779888734858e-10, "logits/chosen": -2.0425121784210205, "logits/rejected": -2.0631158351898193, "logps/chosen": -0.31236395239830017, "logps/rejected": -0.32643812894821167, "loss": 0.7430340647697449, "loss/core": 0.7430340647697449, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 2.8382582664489746, "rewards/margins": 1.6181519031524658, "rewards/rejected": 1.2201061248779297, "step": 880 }, { "epoch": 0.8455750627015407, "grad_norm": 9.375, "learning_rate": 4.812162787445062e-10, "logits/chosen": -2.1633739471435547, "logits/rejected": -2.2033333778381348, "logps/chosen": -0.309976726770401, "logps/rejected": -0.3008884787559509, "loss": 0.05537397414445877, "loss/core": 0.05537397414445877, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 1.1624144315719604, "rewards/margins": 0.6319789290428162, "rewards/rejected": 0.5304354429244995, "step": 885 }, { "epoch": 0.8503523229427923, "grad_norm": 201.0, "learning_rate": 2.2748837860270265e-10, "logits/chosen": -2.046548366546631, "logits/rejected": -2.1142578125, "logps/chosen": -0.33651334047317505, "logps/rejected": -0.32960960268974304, "loss": 0.38854843378067017, "loss/core": 0.38854843378067017, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 2.0308008193969727, "rewards/margins": 1.3045727014541626, "rewards/rejected": 0.7262283563613892, "step": 890 }, { "epoch": 0.855129583184044, "grad_norm": 6.53125, "learning_rate": 6.768970513457151e-11, "logits/chosen": -2.0591623783111572, "logits/rejected": -2.0446290969848633, "logps/chosen": -0.2869151532649994, "logps/rejected": -0.2770235538482666, "loss": 0.31208789348602295, "loss/core": 0.31208789348602295, "rewards/accuracies": 0.875, "rewards/chosen": 2.1741526126861572, "rewards/margins": 1.1323846578598022, "rewards/rejected": 1.0417680740356445, "step": 895 }, { "epoch": 0.8599068434252956, "grad_norm": 117.5, "learning_rate": 1.8803520859811406e-12, "logits/chosen": -2.1362462043762207, "logits/rejected": -2.0990567207336426, "logps/chosen": -0.3250855803489685, "logps/rejected": -0.332465261220932, "loss": 1.7968904972076416, "loss/core": 1.7968904972076416, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 4.322796821594238, "rewards/margins": 2.9066953659057617, "rewards/rejected": 1.4161012172698975, "step": 900 }, { "epoch": 0.8599068434252956, "step": 900, "total_flos": 0.0, "train_loss": 0.6663506550259061, "train_runtime": 7058.8291, "train_samples_per_second": 2.04, "train_steps_per_second": 0.127 } ], "logging_steps": 5, "max_steps": 900, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 900, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 1, "trial_name": null, "trial_params": null }