Files
SmolLM-135M-neuraltxt-dpo-v1/checkpoints/checkpoint-2500/trainer_state.json

3874 lines
137 KiB
JSON
Raw Normal View History

{
"best_global_step": 2500,
"best_metric": 0.45733407139778137,
"best_model_checkpoint": "models/dpo_default/checkpoint-2500",
"epoch": 2.720544217687075,
"eval_steps": 500,
"global_step": 2500,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.010884353741496598,
"grad_norm": 0.7077187895774841,
"learning_rate": 2.168674698795181e-05,
"logits/chosen": -2.2123303413391113,
"logits/rejected": -2.1015005111694336,
"logps/chosen": -76.98332214355469,
"logps/rejected": -83.68041229248047,
"loss": 0.6929964542388916,
"rewards/accuracies": 0.3492187559604645,
"rewards/chosen": 0.0012271858286112547,
"rewards/margins": 0.003317171009257436,
"rewards/rejected": -0.0020899856463074684,
"step": 10
},
{
"epoch": 0.021768707482993196,
"grad_norm": 0.9575150012969971,
"learning_rate": 4.578313253012048e-05,
"logits/chosen": -2.3612475395202637,
"logits/rejected": -2.317596435546875,
"logps/chosen": -79.90132904052734,
"logps/rejected": -86.09098815917969,
"loss": 0.6921308994293213,
"rewards/accuracies": 0.4671874940395355,
"rewards/chosen": 0.0005894556525163352,
"rewards/margins": 0.00607589865103364,
"rewards/rejected": -0.005486442707479,
"step": 20
},
{
"epoch": 0.0326530612244898,
"grad_norm": 0.6923499703407288,
"learning_rate": 6.987951807228917e-05,
"logits/chosen": -2.2964720726013184,
"logits/rejected": -2.2370924949645996,
"logps/chosen": -80.2668228149414,
"logps/rejected": -87.2217788696289,
"loss": 0.6918315887451172,
"rewards/accuracies": 0.4765625,
"rewards/chosen": -0.019290009513497353,
"rewards/margins": 0.00765924621373415,
"rewards/rejected": -0.026949256658554077,
"step": 30
},
{
"epoch": 0.04353741496598639,
"grad_norm": 0.6989305019378662,
"learning_rate": 9.397590361445784e-05,
"logits/chosen": -2.3046586513519287,
"logits/rejected": -2.2639377117156982,
"logps/chosen": -84.65824890136719,
"logps/rejected": -91.65088653564453,
"loss": 0.6887531280517578,
"rewards/accuracies": 0.48750001192092896,
"rewards/chosen": -0.08198987692594528,
"rewards/margins": 0.017511751502752304,
"rewards/rejected": -0.09950163215398788,
"step": 40
},
{
"epoch": 0.05442176870748299,
"grad_norm": 0.7514657378196716,
"learning_rate": 0.00011807228915662652,
"logits/chosen": -2.576209545135498,
"logits/rejected": -2.5158941745758057,
"logps/chosen": -86.98737335205078,
"logps/rejected": -93.26823425292969,
"loss": 0.6795042991638184,
"rewards/accuracies": 0.5015624761581421,
"rewards/chosen": -0.16211052238941193,
"rewards/margins": 0.05032004788517952,
"rewards/rejected": -0.21243056654930115,
"step": 50
},
{
"epoch": 0.0653061224489796,
"grad_norm": 0.8640028834342957,
"learning_rate": 0.00014216867469879518,
"logits/chosen": -2.4957079887390137,
"logits/rejected": -2.3503634929656982,
"logps/chosen": -83.06327819824219,
"logps/rejected": -88.82142639160156,
"loss": 0.6818838596343995,
"rewards/accuracies": 0.51171875,
"rewards/chosen": -0.2020430564880371,
"rewards/margins": 0.05818678066134453,
"rewards/rejected": -0.26022982597351074,
"step": 60
},
{
"epoch": 0.0761904761904762,
"grad_norm": 0.8207036256790161,
"learning_rate": 0.00016626506024096388,
"logits/chosen": -2.699256420135498,
"logits/rejected": -2.621330499649048,
"logps/chosen": -81.74055480957031,
"logps/rejected": -87.18543243408203,
"loss": 0.6767777442932129,
"rewards/accuracies": 0.520312488079071,
"rewards/chosen": -0.19228772819042206,
"rewards/margins": 0.07377694547176361,
"rewards/rejected": -0.26606467366218567,
"step": 70
},
{
"epoch": 0.08707482993197278,
"grad_norm": 0.8356528878211975,
"learning_rate": 0.00019036144578313252,
"logits/chosen": -2.595083236694336,
"logits/rejected": -2.484344005584717,
"logps/chosen": -82.08795166015625,
"logps/rejected": -89.19499206542969,
"loss": 0.6667680740356445,
"rewards/accuracies": 0.5289062261581421,
"rewards/chosen": -0.2063063681125641,
"rewards/margins": 0.11366782337427139,
"rewards/rejected": -0.3199741840362549,
"step": 80
},
{
"epoch": 0.09795918367346938,
"grad_norm": 0.7759003639221191,
"learning_rate": 0.00019955123410620793,
"logits/chosen": -2.369516611099243,
"logits/rejected": -2.255380392074585,
"logps/chosen": -80.26573944091797,
"logps/rejected": -88.53955841064453,
"loss": 0.6667191505432128,
"rewards/accuracies": 0.546875,
"rewards/chosen": -0.1989096850156784,
"rewards/margins": 0.11919046938419342,
"rewards/rejected": -0.31810012459754944,
"step": 90
},
{
"epoch": 0.10884353741496598,
"grad_norm": 0.7274847626686096,
"learning_rate": 0.0001988032909498878,
"logits/chosen": -2.4584925174713135,
"logits/rejected": -2.306166172027588,
"logps/chosen": -85.4821548461914,
"logps/rejected": -92.23262786865234,
"loss": 0.6666709899902343,
"rewards/accuracies": 0.5492187738418579,
"rewards/chosen": -0.2420760691165924,
"rewards/margins": 0.1285211443901062,
"rewards/rejected": -0.370597243309021,
"step": 100
},
{
"epoch": 0.11972789115646258,
"grad_norm": 0.8684931397438049,
"learning_rate": 0.0001980553477935677,
"logits/chosen": -2.1937153339385986,
"logits/rejected": -2.128317356109619,
"logps/chosen": -81.6711654663086,
"logps/rejected": -89.73558807373047,
"loss": 0.6597628593444824,
"rewards/accuracies": 0.5523437261581421,
"rewards/chosen": -0.1942557394504547,
"rewards/margins": 0.15067201852798462,
"rewards/rejected": -0.34492772817611694,
"step": 110
},
{
"epoch": 0.1306122448979592,
"grad_norm": 0.7956843972206116,
"learning_rate": 0.00019730740463724756,
"logits/chosen": -2.446894884109497,
"logits/rejected": -2.3522589206695557,
"logps/chosen": -84.79292297363281,
"logps/rejected": -90.49881744384766,
"loss": 0.6632381439208984,
"rewards/accuracies": 0.542187511920929,
"rewards/chosen": -0.19174879789352417,
"rewards/margins": 0.14180642366409302,
"rewards/rejected": -0.3335552215576172,
"step": 120
},
{
"epoch": 0.1414965986394558,
"grad_norm": 0.6242148876190186,
"learning_rate": 0.00019655946148092746,
"logits/chosen": -2.457613945007324,
"logits/rejected": -2.388310670852661,
"logps/chosen": -79.19390869140625,
"logps/rejected": -85.8818130493164,
"loss": 0.6509382724761963,
"rewards/accuracies": 0.55078125,
"rewards/chosen": -0.1272696703672409,
"rewards/margins": 0.17109361290931702,
"rewards/rejected": -0.29836326837539673,
"step": 130
},
{
"epoch": 0.1523809523809524,
"grad_norm": 0.6959019899368286,
"learning_rate": 0.00019581151832460733,
"logits/chosen": -2.645115375518799,
"logits/rejected": -2.5745694637298584,
"logps/chosen": -82.52925109863281,
"logps/rejected": -89.37605285644531,
"loss": 0.6571790695190429,
"rewards/accuracies": 0.5640624761581421,
"rewards/chosen": -0.11609281599521637,
"rewards/margins": 0.16595318913459778,
"rewards/rejected": -0.28204596042633057,
"step": 140
},
{
"epoch": 0.16326530612244897,
"grad_norm": 0.7039981484413147,
"learning_rate": 0.00019506357516828722,
"logits/chosen": -2.6011252403259277,
"logits/rejected": -2.5297441482543945,
"logps/chosen": -84.36079406738281,
"logps/rejected": -91.32760620117188,
"loss": 0.659122371673584,
"rewards/accuracies": 0.5640624761581421,
"rewards/chosen": -0.04060233011841774,
"rewards/margins": 0.16302046179771423,
"rewards/rejected": -0.20362277328968048,
"step": 150
},
{
"epoch": 0.17414965986394557,
"grad_norm": 0.6617714166641235,
"learning_rate": 0.0001943156320119671,
"logits/chosen": -2.715470790863037,
"logits/rejected": -2.5970466136932373,
"logps/chosen": -83.14956665039062,
"logps/rejected": -89.39061737060547,
"loss": 0.6440523147583008,
"rewards/accuracies": 0.5882812738418579,
"rewards/chosen": -0.012846514582633972,
"rewards/margins": 0.18811455368995667,
"rewards/rejected": -0.20096108317375183,
"step": 160
},
{
"epoch": 0.18503401360544217,
"grad_norm": 0.6483933925628662,
"learning_rate": 0.000193567688855647,
"logits/chosen": -2.807894468307495,
"logits/rejected": -2.7104663848876953,
"logps/chosen": -79.6620864868164,
"logps/rejected": -85.63630676269531,
"loss": 0.6529532909393311,
"rewards/accuracies": 0.5640624761581421,
"rewards/chosen": -0.05956472083926201,
"rewards/margins": 0.190535768866539,
"rewards/rejected": -0.2501004636287689,
"step": 170
},
{
"epoch": 0.19591836734693877,
"grad_norm": 0.6357870697975159,
"learning_rate": 0.00019281974569932686,
"logits/chosen": -2.7263660430908203,
"logits/rejected": -2.632416248321533,
"logps/chosen": -86.24573516845703,
"logps/rejected": -91.7590560913086,
"loss": 0.6710307121276855,
"rewards/accuracies": 0.5570312738418579,
"rewards/chosen": -0.18387791514396667,
"rewards/margins": 0.14046183228492737,
"rewards/rejected": -0.32433977723121643,
"step": 180
},
{
"epoch": 0.20680272108843537,
"grad_norm": 0.7087427973747253,
"learning_rate": 0.00019207180254300675,
"logits/chosen": -2.575040817260742,
"logits/rejected": -2.4759504795074463,
"logps/chosen": -83.10100555419922,
"logps/rejected": -90.81092071533203,
"loss": 0.6495565414428711,
"rewards/accuracies": 0.571093738079071,
"rewards/chosen": -0.2590435743331909,
"rewards/margins": 0.18424804508686066,
"rewards/rejected": -0.44329166412353516,
"step": 190
},
{
"epoch": 0.21768707482993196,
"grad_norm": 0.7276835441589355,
"learning_rate": 0.00019132385938668662,
"logits/chosen": -2.6646244525909424,
"logits/rejected": -2.642310857772827,
"logps/chosen": -84.37451934814453,
"logps/rejected": -92.43025970458984,
"loss": 0.652790880203247,
"rewards/accuracies": 0.5523437261581421,
"rewards/chosen": -0.28780898451805115,
"rewards/margins": 0.2015586793422699,
"rewards/rejected": -0.48936766386032104,
"step": 200
},
{
"epoch": 0.22857142857142856,
"grad_norm": 0.704118549823761,
"learning_rate": 0.0001905759162303665,
"logits/chosen": -2.7964985370635986,
"logits/rejected": -2.7038846015930176,
"logps/chosen": -83.10550689697266,
"logps/rejected": -90.61512756347656,
"loss": 0.6555557250976562,
"rewards/accuracies": 0.5703125,
"rewards/chosen": -0.17501111328601837,
"rewards/margins": 0.1853359341621399,
"rewards/rejected": -0.36034709215164185,
"step": 210
},
{
"epoch": 0.23945578231292516,
"grad_norm": 0.6894403100013733,
"learning_rate": 0.00018982797307404639,
"logits/chosen": -2.694242000579834,
"logits/rejected": -2.6799864768981934,
"logps/chosen": -78.91683959960938,
"logps/rejected": -84.78871154785156,
"loss": 0.6462616920471191,
"rewards/accuracies": 0.5804687738418579,
"rewards/chosen": 0.06024743244051933,
"rewards/margins": 0.19001427292823792,
"rewards/rejected": -0.12976683676242828,
"step": 220
},
{
"epoch": 0.2503401360544218,
"grad_norm": 0.6098469495773315,
"learning_rate": 0.00018908002991772625,
"logits/chosen": -2.9486870765686035,
"logits/rejected": -2.8814079761505127,
"logps/chosen": -80.17509460449219,
"logps/rejected": -86.77090454101562,
"loss": 0.631169319152832,
"rewards/accuracies": 0.5921875238418579,
"rewards/chosen": 0.039627805352211,
"rewards/margins": 0.2388683557510376,
"rewards/rejected": -0.1992405354976654,
"step": 230
},
{
"epoch": 0.2612244897959184,
"grad_norm": 0.6648709774017334,
"learning_rate": 0.00018833208676140615,
"logits/chosen": -3.144280195236206,
"logits/rejected": -3.156015396118164,
"logps/chosen": -82.75923156738281,
"logps/rejected": -92.11023712158203,
"loss": 0.6405491828918457,
"rewards/accuracies": 0.592968761920929,
"rewards/chosen": -0.15283265709877014,
"rewards/margins": 0.2397342175245285,
"rewards/rejected": -0.39256685972213745,
"step": 240
},
{
"epoch": 0.272108843537415,
"grad_norm": 0.7529364824295044,
"learning_rate": 0.00018758414360508602,
"logits/chosen": -3.0414438247680664,
"logits/rejected": -3.0043177604675293,
"logps/chosen": -88.2968521118164,
"logps/rejected": -97.04661560058594,
"loss": 0.6290472984313965,
"rewards/accuracies": 0.5914062261581421,
"rewards/chosen": -0.38561299443244934,
"rewards/margins": 0.28672346472740173,
"rewards/rejected": -0.6723364591598511,
"step": 250
},
{
"epoch": 0.2829931972789116,
"grad_norm": 0.627895176410675,
"learning_rate": 0.00018683620044876591,
"logits/chosen": -3.091475009918213,
"logits/rejected": -2.9503979682922363,
"logps/chosen": -87.58129119873047,
"logps/rejected": -93.70463562011719,
"loss": 0.6199825286865235,
"rewards/accuracies": 0.5859375,
"rewards/chosen": -0.43795761466026306,
"rewards/margins": 0.28398531675338745,
"rewards/rejected": -0.7219429612159729,
"step": 260
},
{
"epoch": 0.2938775510204082,
"grad_norm": 0.562925398349762,
"learning_rate": 0.00018608825729244578,
"logits/chosen": -3.0558292865753174,
"logits/rejected": -2.9512274265289307,
"logps/chosen": -80.02171325683594,
"logps/rejected": -88.43952941894531,
"loss": 0.6295814514160156,
"rewards/accuracies": 0.5960937738418579,
"rewards/chosen": -0.35493478178977966,
"rewards/margins": 0.2739941477775574,
"rewards/rejected": -0.6289288997650146,
"step": 270
},
{
"epoch": 0.3047619047619048,
"grad_norm": 0.62668776512146,
"learning_rate": 0.00018534031413612568,
"logits/chosen": -3.073023557662964,
"logits/rejected": -2.9786252975463867,
"logps/chosen": -79.61070251464844,
"logps/rejected": -87.7259750366211,
"loss": 0.6259790420532226,
"rewards/accuracies": 0.5914062261581421,
"rewards/chosen": -0.3159467875957489,
"rewards/margins": 0.2681388556957245,
"rewards/rejected": -0.5840856432914734,
"step": 280
},
{
"epoch": 0.31564625850340133,
"grad_norm": 0.6235923767089844,
"learning_rate": 0.00018459237097980555,
"logits/chosen": -3.129662036895752,
"logits/rejected": -3.073840379714966,
"logps/chosen": -81.99674987792969,
"logps/rejected": -90.57108306884766,
"loss": 0.6291594982147217,
"rewards/accuracies": 0.585156261920929,
"rewards/chosen": -0.2529909014701843,
"rewards/margins": 0.28501176834106445,
"rewards/rejected": -0.5380026698112488,
"step": 290
},
{
"epoch": 0.32653061224489793,
"grad_norm": 0.6637018322944641,
"learning_rate": 0.00018384442782348544,
"logits/chosen": -3.1975247859954834,
"logits/rejected": -3.1137585639953613,
"logps/chosen": -80.12820434570312,
"logps/rejected": -88.26316833496094,
"loss": 0.6194732189178467,
"rewards/accuracies": 0.600781261920929,
"rewards/chosen": -0.0812927708029747,
"rewards/margins": 0.3114483058452606,
"rewards/rejected": -0.3927411139011383,
"step": 300
},
{
"epoch": 0.33741496598639453,
"grad_norm": 0.6672607660293579,
"learning_rate": 0.0001830964846671653,
"logits/chosen": -2.985579252243042,
"logits/rejected": -2.9056222438812256,
"logps/chosen": -86.5948257446289,
"logps/rejected": -95.234619140625,
"loss": 0.6183744430541992,
"rewards/accuracies": 0.598437488079071,
"rewards/chosen": -0.3788287043571472,
"rewards/margins": 0.31600421667099,
"rewards/rejected": -0.694832980632782,
"step": 310
},
{
"epoch": 0.34829931972789113,
"grad_norm": 0.6171224117279053,
"learning_rate": 0.0001823485415108452,
"logits/chosen": -3.0042669773101807,
"logits/rejected": -2.951925754547119,
"logps/chosen": -88.96502685546875,
"logps/rejected": -97.89619445800781,
"loss": 0.6247763633728027,
"rewards/accuracies": 0.5843750238418579,
"rewards/chosen": -0.5990578532218933,
"rewards/margins": 0.300613671541214,
"rewards/rejected": -0.8996715545654297,
"step": 320
},
{
"epoch": 0.35918367346938773,
"grad_norm": 0.7893000245094299,
"learning_rate": 0.00018160059835452508,
"logits/chosen": -3.1310553550720215,
"logits/rejected": -3.1132781505584717,
"logps/chosen": -84.33443450927734,
"logps/rejected": -94.07998657226562,
"loss": 0.6248671531677246,
"rewards/accuracies": 0.5859375,
"rewards/chosen": -0.6389909982681274,
"rewards/margins": 0.29910796880722046,
"rewards/rejected": -0.9380990266799927,
"step": 330
},
{
"epoch": 0.37006802721088433,
"grad_norm": 0.5814021825790405,
"learning_rate": 0.00018085265519820494,
"logits/chosen": -3.1776278018951416,
"logits/rejected": -3.08312726020813,
"logps/chosen": -86.03544616699219,
"logps/rejected": -93.88951110839844,
"loss": 0.6233505249023438,
"rewards/accuracies": 0.5921875238418579,
"rewards/chosen": -0.6253015398979187,
"rewards/margins": 0.3192492425441742,
"rewards/rejected": -0.9445506930351257,
"step": 340
},
{
"epoch": 0.38095238095238093,
"grad_norm": 0.63541179895401,
"learning_rate": 0.0001801047120418848,
"logits/chosen": -2.9307355880737305,
"logits/rejected": -2.9118292331695557,
"logps/chosen": -89.96821594238281,
"logps/rejected": -98.78160095214844,
"loss": 0.6067781925201416,
"rewards/accuracies": 0.61328125,
"rewards/chosen": -0.5151289701461792,
"rewards/margins": 0.34935957193374634,
"rewards/rejected": -0.8644886016845703,
"step": 350
},
{
"epoch": 0.39183673469387753,
"grad_norm": 0.695551872253418,
"learning_rate": 0.0001793567688855647,
"logits/chosen": -2.7680797576904297,
"logits/rejected": -2.694873332977295,
"logps/chosen": -84.47620391845703,
"logps/rejected": -91.43312072753906,
"loss": 0.6245352268218994,
"rewards/accuracies": 0.6015625,
"rewards/chosen": -0.5855204463005066,
"rewards/margins": 0.2961046099662781,
"rewards/rejected": -0.8816250562667847,
"step": 360
},
{
"epoch": 0.40272108843537413,
"grad_norm": 0.5492284297943115,
"learning_rate": 0.00017860882572924458,
"logits/chosen": -2.8768391609191895,
"logits/rejected": -2.7919318675994873,
"logps/chosen": -88.09062194824219,
"logps/rejected": -94.99168395996094,
"loss": 0.6229678630828858,
"rewards/accuracies": 0.602343738079071,
"rewards/chosen": -0.6255002021789551,
"rewards/margins": 0.2889278531074524,
"rewards/rejected": -0.9144280552864075,
"step": 370
},
{
"epoch": 0.41360544217687073,
"grad_norm": 0.627325713634491,
"learning_rate": 0.00017786088257292445,
"logits/chosen": -2.6934731006622314,
"logits/rejected": -2.595776319503784,
"logps/chosen": -89.07003021240234,
"logps/rejected": -97.8858871459961,
"loss": 0.6102587699890136,
"rewards/accuracies": 0.6078125238418579,
"rewards/chosen": -0.5627188682556152,
"rewards/margins": 0.3145248293876648,
"rewards/rejected": -0.87724369764328,
"step": 380
},
{
"epoch": 0.42448979591836733,
"grad_norm": 0.6781789064407349,
"learning_rate": 0.00017711293941660434,
"logits/chosen": -2.902066946029663,
"logits/rejected": -2.792140245437622,
"logps/chosen": -85.96211242675781,
"logps/rejected": -94.57718658447266,
"loss": 0.6128390789031982,
"rewards/accuracies": 0.621874988079071,
"rewards/chosen": -0.5092566013336182,
"rewards/margins": 0.33838534355163574,
"rewards/rejected": -0.8476420640945435,
"step": 390
},
{
"epoch": 0.43537414965986393,
"grad_norm": 0.6318673491477966,
"learning_rate": 0.0001763649962602842,
"logits/chosen": -2.978280544281006,
"logits/rejected": -2.9661154747009277,
"logps/chosen": -82.64006805419922,
"logps/rejected": -93.13764953613281,
"loss": 0.6212802410125733,
"rewards/accuracies": 0.610156238079071,
"rewards/chosen": -0.354736864566803,
"rewards/margins": 0.31057295203208923,
"rewards/rejected": -0.6653097867965698,
"step": 400
},
{
"epoch": 0.44625850340136053,
"grad_norm": 0.6015628576278687,
"learning_rate": 0.0001756170531039641,
"logits/chosen": -3.077155590057373,
"logits/rejected": -3.0079360008239746,
"logps/chosen": -84.97288513183594,
"logps/rejected": -93.01554870605469,
"loss": 0.6140561580657959,
"rewards/accuracies": 0.594531238079071,
"rewards/chosen": -0.3532416820526123,
"rewards/margins": 0.34475868940353394,
"rewards/rejected": -0.6980003714561462,
"step": 410
},
{
"epoch": 0.45714285714285713,
"grad_norm": 0.6051854491233826,
"learning_rate": 0.00017486910994764398,
"logits/chosen": -3.0866477489471436,
"logits/rejected": -2.9812045097351074,
"logps/chosen": -79.9186019897461,
"logps/rejected": -88.40470886230469,
"loss": 0.6004165649414063,
"rewards/accuracies": 0.625781238079071,
"rewards/chosen": -0.21888461709022522,
"rewards/margins": 0.36811959743499756,
"rewards/rejected": -0.5870041847229004,
"step": 420
},
{
"epoch": 0.46802721088435373,
"grad_norm": 0.7300223708152771,
"learning_rate": 0.00017412116679132387,
"logits/chosen": -3.060652017593384,
"logits/rejected": -3.027360439300537,
"logps/chosen": -84.05428314208984,
"logps/rejected": -91.3875503540039,
"loss": 0.6200145244598388,
"rewards/accuracies": 0.604687511920929,
"rewards/chosen": -0.22208240628242493,
"rewards/margins": 0.3296840786933899,
"rewards/rejected": -0.5517665147781372,
"step": 430
},
{
"epoch": 0.47891156462585033,
"grad_norm": 0.5995689630508423,
"learning_rate": 0.00017337322363500374,
"logits/chosen": -2.9303958415985107,
"logits/rejected": -2.8347811698913574,
"logps/chosen": -88.16230773925781,
"logps/rejected": -94.56944274902344,
"loss": 0.6032320499420166,
"rewards/accuracies": 0.6304687261581421,
"rewards/chosen": -0.506262481212616,
"rewards/margins": 0.3537197411060333,
"rewards/rejected": -0.8599823117256165,
"step": 440
},
{
"epoch": 0.4897959183673469,
"grad_norm": 0.6093873381614685,
"learning_rate": 0.00017262528047868364,
"logits/chosen": -3.054971218109131,
"logits/rejected": -2.9332528114318848,
"logps/chosen": -85.0113525390625,
"logps/rejected": -94.11463928222656,
"loss": 0.5989380359649659,
"rewards/accuracies": 0.6117187738418579,
"rewards/chosen": -0.5802456140518188,
"rewards/margins": 0.3973398804664612,
"rewards/rejected": -0.97758549451828,
"step": 450
},
{
"epoch": 0.5006802721088436,
"grad_norm": 0.6394651532173157,
"learning_rate": 0.0001718773373223635,
"logits/chosen": -2.9823951721191406,
"logits/rejected": -2.9353485107421875,
"logps/chosen": -86.30118560791016,
"logps/rejected": -94.50347900390625,
"loss": 0.6100581169128418,
"rewards/accuracies": 0.6171875,
"rewards/chosen": -0.5156108140945435,
"rewards/margins": 0.34870487451553345,
"rewards/rejected": -0.8643158078193665,
"step": 460
},
{
"epoch": 0.5115646258503401,
"grad_norm": 0.5491212010383606,
"learning_rate": 0.0001711293941660434,
"logits/chosen": -2.926840305328369,
"logits/rejected": -2.8748295307159424,
"logps/chosen": -81.23180389404297,
"logps/rejected": -88.91163635253906,
"loss": 0.601882791519165,
"rewards/accuracies": 0.606249988079071,
"rewards/chosen": -0.35410138964653015,
"rewards/margins": 0.377445787191391,
"rewards/rejected": -0.7315471768379211,
"step": 470
},
{
"epoch": 0.5224489795918368,
"grad_norm": 0.6345949172973633,
"learning_rate": 0.00017038145100972327,
"logits/chosen": -2.8460724353790283,
"logits/rejected": -2.8185269832611084,
"logps/chosen": -82.52976989746094,
"logps/rejected": -91.4373779296875,
"loss": 0.5966329097747802,
"rewards/accuracies": 0.60546875,
"rewards/chosen": -0.2420049011707306,
"rewards/margins": 0.3614209294319153,
"rewards/rejected": -0.6034258604049683,
"step": 480
},
{
"epoch": 0.5333333333333333,
"grad_norm": 0.6204262971878052,
"learning_rate": 0.00016963350785340316,
"logits/chosen": -3.037978410720825,
"logits/rejected": -2.9520788192749023,
"logps/chosen": -83.21837615966797,
"logps/rejected": -91.0192642211914,
"loss": 0.5877750396728516,
"rewards/accuracies": 0.6429687738418579,
"rewards/chosen": -0.35447391867637634,
"rewards/margins": 0.4061393737792969,
"rewards/rejected": -0.7606132626533508,
"step": 490
},
{
"epoch": 0.54421768707483,
"grad_norm": 0.6997068524360657,
"learning_rate": 0.00016888556469708303,
"logits/chosen": -3.0016021728515625,
"logits/rejected": -2.9584157466888428,
"logps/chosen": -88.25440979003906,
"logps/rejected": -98.35990142822266,
"loss": 0.5975300312042237,
"rewards/accuracies": 0.6109374761581421,
"rewards/chosen": -0.6453801393508911,
"rewards/margins": 0.40526071190834045,
"rewards/rejected": -1.0506408214569092,
"step": 500
},
{
"epoch": 0.54421768707483,
"eval_logits/chosen": -3.0864946842193604,
"eval_logits/rejected": -3.039473056793213,
"eval_logps/chosen": -85.64629364013672,
"eval_logps/rejected": -96.53662872314453,
"eval_loss": 0.5770927667617798,
"eval_rewards/accuracies": 0.625,
"eval_rewards/chosen": -0.604114294052124,
"eval_rewards/margins": 0.4646129906177521,
"eval_rewards/rejected": -1.0687271356582642,
"eval_runtime": 104.8956,
"eval_samples_per_second": 22.88,
"eval_steps_per_second": 2.86,
"step": 500
},
{
"epoch": 0.5551020408163265,
"grad_norm": 0.5718573331832886,
"learning_rate": 0.0001681376215407629,
"logits/chosen": -2.98121976852417,
"logits/rejected": -3.0054566860198975,
"logps/chosen": -84.3095932006836,
"logps/rejected": -96.11637115478516,
"loss": 0.5776225090026855,
"rewards/accuracies": 0.628125011920929,
"rewards/chosen": -0.6291953921318054,
"rewards/margins": 0.4740595817565918,
"rewards/rejected": -1.103255033493042,
"step": 510
},
{
"epoch": 0.5659863945578232,
"grad_norm": 0.6719241738319397,
"learning_rate": 0.0001673896783844428,
"logits/chosen": -3.1065757274627686,
"logits/rejected": -3.057704448699951,
"logps/chosen": -84.51625061035156,
"logps/rejected": -95.70087432861328,
"loss": 0.5797244071960449,
"rewards/accuracies": 0.6539062261581421,
"rewards/chosen": -0.6672269105911255,
"rewards/margins": 0.4843328595161438,
"rewards/rejected": -1.1515597105026245,
"step": 520
},
{
"epoch": 0.5768707482993197,
"grad_norm": 0.6521556377410889,
"learning_rate": 0.00016664173522812267,
"logits/chosen": -3.0161333084106445,
"logits/rejected": -3.000890016555786,
"logps/chosen": -85.24427795410156,
"logps/rejected": -94.50189208984375,
"loss": 0.5926599979400635,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.6613038778305054,
"rewards/margins": 0.4472618103027344,
"rewards/rejected": -1.1085655689239502,
"step": 530
},
{
"epoch": 0.5877551020408164,
"grad_norm": 0.9451216459274292,
"learning_rate": 0.00016589379207180256,
"logits/chosen": -2.8275389671325684,
"logits/rejected": -2.8195090293884277,
"logps/chosen": -87.73820495605469,
"logps/rejected": -98.05986785888672,
"loss": 0.6018657684326172,
"rewards/accuracies": 0.6265624761581421,
"rewards/chosen": -0.6853042840957642,
"rewards/margins": 0.4554131031036377,
"rewards/rejected": -1.1407173871994019,
"step": 540
},
{
"epoch": 0.5986394557823129,
"grad_norm": 0.610352098941803,
"learning_rate": 0.00016514584891548243,
"logits/chosen": -2.712162733078003,
"logits/rejected": -2.6361680030822754,
"logps/chosen": -86.30110168457031,
"logps/rejected": -96.72479248046875,
"loss": 0.5942647457122803,
"rewards/accuracies": 0.6312500238418579,
"rewards/chosen": -0.7625668048858643,
"rewards/margins": 0.41246652603149414,
"rewards/rejected": -1.1750333309173584,
"step": 550
},
{
"epoch": 0.6095238095238096,
"grad_norm": 0.5952523946762085,
"learning_rate": 0.00016439790575916233,
"logits/chosen": -2.773089647293091,
"logits/rejected": -2.675023078918457,
"logps/chosen": -85.59429168701172,
"logps/rejected": -94.7846908569336,
"loss": 0.5996862411499023,
"rewards/accuracies": 0.632031261920929,
"rewards/chosen": -0.7641364336013794,
"rewards/margins": 0.39174142479896545,
"rewards/rejected": -1.1558778285980225,
"step": 560
},
{
"epoch": 0.6204081632653061,
"grad_norm": 0.6582514047622681,
"learning_rate": 0.0001636499626028422,
"logits/chosen": -2.78428316116333,
"logits/rejected": -2.6511282920837402,
"logps/chosen": -90.34364318847656,
"logps/rejected": -99.95307159423828,
"loss": 0.5831423759460449,
"rewards/accuracies": 0.625781238079071,
"rewards/chosen": -0.7876542210578918,
"rewards/margins": 0.46621885895729065,
"rewards/rejected": -1.2538731098175049,
"step": 570
},
{
"epoch": 0.6312925170068027,
"grad_norm": 0.5589143633842468,
"learning_rate": 0.0001629020194465221,
"logits/chosen": -2.9068286418914795,
"logits/rejected": -2.8854146003723145,
"logps/chosen": -83.24221801757812,
"logps/rejected": -91.76869201660156,
"loss": 0.5974715709686279,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.520553469657898,
"rewards/margins": 0.39965444803237915,
"rewards/rejected": -0.9202079772949219,
"step": 580
},
{
"epoch": 0.6421768707482993,
"grad_norm": 0.6037158370018005,
"learning_rate": 0.00016215407629020196,
"logits/chosen": -2.9200706481933594,
"logits/rejected": -2.8421108722686768,
"logps/chosen": -83.75981140136719,
"logps/rejected": -94.21287536621094,
"loss": 0.5780706405639648,
"rewards/accuracies": 0.641406238079071,
"rewards/chosen": -0.40980464220046997,
"rewards/margins": 0.4663706421852112,
"rewards/rejected": -0.8761752843856812,
"step": 590
},
{
"epoch": 0.6530612244897959,
"grad_norm": 0.6423654556274414,
"learning_rate": 0.00016140613313388185,
"logits/chosen": -2.929079532623291,
"logits/rejected": -2.9537947177886963,
"logps/chosen": -86.27957916259766,
"logps/rejected": -96.39942932128906,
"loss": 0.5839208602905274,
"rewards/accuracies": 0.6585937738418579,
"rewards/chosen": -0.5493398904800415,
"rewards/margins": 0.4438067376613617,
"rewards/rejected": -0.9931465983390808,
"step": 600
},
{
"epoch": 0.6639455782312925,
"grad_norm": 0.5478850603103638,
"learning_rate": 0.00016065818997756172,
"logits/chosen": -2.835813283920288,
"logits/rejected": -2.7998528480529785,
"logps/chosen": -87.89683532714844,
"logps/rejected": -96.35087585449219,
"loss": 0.5724361896514892,
"rewards/accuracies": 0.643750011920929,
"rewards/chosen": -0.5621733665466309,
"rewards/margins": 0.4720228612422943,
"rewards/rejected": -1.034196138381958,
"step": 610
},
{
"epoch": 0.6748299319727891,
"grad_norm": 0.671947717666626,
"learning_rate": 0.0001599102468212416,
"logits/chosen": -2.9626426696777344,
"logits/rejected": -2.8480992317199707,
"logps/chosen": -88.1216812133789,
"logps/rejected": -98.25172424316406,
"loss": 0.5745330333709717,
"rewards/accuracies": 0.653124988079071,
"rewards/chosen": -0.7491940259933472,
"rewards/margins": 0.4780084490776062,
"rewards/rejected": -1.2272025346755981,
"step": 620
},
{
"epoch": 0.6857142857142857,
"grad_norm": 0.6402953267097473,
"learning_rate": 0.00015916230366492146,
"logits/chosen": -2.9432570934295654,
"logits/rejected": -2.97039794921875,
"logps/chosen": -90.78302001953125,
"logps/rejected": -103.5708236694336,
"loss": 0.5667342185974121,
"rewards/accuracies": 0.66015625,
"rewards/chosen": -0.9368416666984558,
"rewards/margins": 0.5184968709945679,
"rewards/rejected": -1.455338478088379,
"step": 630
},
{
"epoch": 0.6965986394557823,
"grad_norm": 0.6474503874778748,
"learning_rate": 0.00015841436050860136,
"logits/chosen": -2.978628635406494,
"logits/rejected": -2.9383959770202637,
"logps/chosen": -89.43360900878906,
"logps/rejected": -100.71207427978516,
"loss": 0.5545726776123047,
"rewards/accuracies": 0.6460937261581421,
"rewards/chosen": -0.9920727610588074,
"rewards/margins": 0.5569532513618469,
"rewards/rejected": -1.5490261316299438,
"step": 640
},
{
"epoch": 0.7074829931972789,
"grad_norm": 0.7136415243148804,
"learning_rate": 0.00015766641735228122,
"logits/chosen": -3.020536184310913,
"logits/rejected": -2.9737136363983154,
"logps/chosen": -91.73661041259766,
"logps/rejected": -102.14755249023438,
"loss": 0.5740270614624023,
"rewards/accuracies": 0.637499988079071,
"rewards/chosen": -1.027769923210144,
"rewards/margins": 0.5058225393295288,
"rewards/rejected": -1.5335925817489624,
"step": 650
},
{
"epoch": 0.7183673469387755,
"grad_norm": 0.601219892501831,
"learning_rate": 0.0001569184741959611,
"logits/chosen": -3.1565613746643066,
"logits/rejected": -3.1246376037597656,
"logps/chosen": -90.3838119506836,
"logps/rejected": -101.56874084472656,
"loss": 0.5599509239196777,
"rewards/accuracies": 0.655468761920929,
"rewards/chosen": -1.081892490386963,
"rewards/margins": 0.559756875038147,
"rewards/rejected": -1.6416492462158203,
"step": 660
},
{
"epoch": 0.7292517006802721,
"grad_norm": 0.6408318877220154,
"learning_rate": 0.000156170531039641,
"logits/chosen": -3.2291476726531982,
"logits/rejected": -3.2356181144714355,
"logps/chosen": -89.50052642822266,
"logps/rejected": -100.52101135253906,
"loss": 0.5731996536254883,
"rewards/accuracies": 0.647656261920929,
"rewards/chosen": -1.1054667234420776,
"rewards/margins": 0.5072154998779297,
"rewards/rejected": -1.6126823425292969,
"step": 670
},
{
"epoch": 0.7401360544217687,
"grad_norm": 0.6599347591400146,
"learning_rate": 0.00015542258788332086,
"logits/chosen": -3.2114415168762207,
"logits/rejected": -3.172548532485962,
"logps/chosen": -91.56523132324219,
"logps/rejected": -102.18913269042969,
"loss": 0.5616633892059326,
"rewards/accuracies": 0.6640625,
"rewards/chosen": -0.8735089302062988,
"rewards/margins": 0.5582183599472046,
"rewards/rejected": -1.4317272901535034,
"step": 680
},
{
"epoch": 0.7510204081632653,
"grad_norm": 0.668644905090332,
"learning_rate": 0.00015467464472700075,
"logits/chosen": -3.2348804473876953,
"logits/rejected": -3.097151041030884,
"logps/chosen": -90.90170288085938,
"logps/rejected": -102.48905944824219,
"loss": 0.549819803237915,
"rewards/accuracies": 0.6695312261581421,
"rewards/chosen": -0.6966196894645691,
"rewards/margins": 0.6086488366127014,
"rewards/rejected": -1.3052685260772705,
"step": 690
},
{
"epoch": 0.7619047619047619,
"grad_norm": 0.776343822479248,
"learning_rate": 0.00015392670157068062,
"logits/chosen": -3.261051893234253,
"logits/rejected": -3.150120258331299,
"logps/chosen": -85.77153015136719,
"logps/rejected": -96.22288513183594,
"loss": 0.5865112781524658,
"rewards/accuracies": 0.6539062261581421,
"rewards/chosen": -0.6080220937728882,
"rewards/margins": 0.5111768841743469,
"rewards/rejected": -1.1191989183425903,
"step": 700
},
{
"epoch": 0.7727891156462585,
"grad_norm": 0.6534438729286194,
"learning_rate": 0.00015317875841436052,
"logits/chosen": -2.9951682090759277,
"logits/rejected": -2.9624991416931152,
"logps/chosen": -88.7505874633789,
"logps/rejected": -99.82380676269531,
"loss": 0.5636815071105957,
"rewards/accuracies": 0.6507812738418579,
"rewards/chosen": -0.7708442807197571,
"rewards/margins": 0.5377318263053894,
"rewards/rejected": -1.308576226234436,
"step": 710
},
{
"epoch": 0.7836734693877551,
"grad_norm": 0.5064298510551453,
"learning_rate": 0.0001524308152580404,
"logits/chosen": -3.1614372730255127,
"logits/rejected": -3.1034646034240723,
"logps/chosen": -84.72537994384766,
"logps/rejected": -96.15172576904297,
"loss": 0.5600537300109864,
"rewards/accuracies": 0.637499988079071,
"rewards/chosen": -0.8120764493942261,
"rewards/margins": 0.5258986353874207,
"rewards/rejected": -1.337975263595581,
"step": 720
},
{
"epoch": 0.7945578231292517,
"grad_norm": 0.6030212640762329,
"learning_rate": 0.00015168287210172028,
"logits/chosen": -3.1010847091674805,
"logits/rejected": -3.0516085624694824,
"logps/chosen": -85.84700775146484,
"logps/rejected": -96.8555908203125,
"loss": 0.5588539123535157,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": -0.7111436128616333,
"rewards/margins": 0.5404245853424072,
"rewards/rejected": -1.251568078994751,
"step": 730
},
{
"epoch": 0.8054421768707483,
"grad_norm": 0.6080058217048645,
"learning_rate": 0.00015093492894540015,
"logits/chosen": -3.1770665645599365,
"logits/rejected": -3.198453187942505,
"logps/chosen": -91.16377258300781,
"logps/rejected": -101.21217346191406,
"loss": 0.5411731719970703,
"rewards/accuracies": 0.667187511920929,
"rewards/chosen": -0.7363663911819458,
"rewards/margins": 0.5946365594863892,
"rewards/rejected": -1.331002950668335,
"step": 740
},
{
"epoch": 0.8163265306122449,
"grad_norm": 0.6249299645423889,
"learning_rate": 0.00015018698578908005,
"logits/chosen": -3.2993998527526855,
"logits/rejected": -3.160282611846924,
"logps/chosen": -85.68218231201172,
"logps/rejected": -97.8273696899414,
"loss": 0.5476407051086426,
"rewards/accuracies": 0.66796875,
"rewards/chosen": -0.6863436102867126,
"rewards/margins": 0.6311149597167969,
"rewards/rejected": -1.3174583911895752,
"step": 750
},
{
"epoch": 0.8272108843537415,
"grad_norm": 0.7027069926261902,
"learning_rate": 0.00014943904263275992,
"logits/chosen": -3.371492862701416,
"logits/rejected": -3.292865037918091,
"logps/chosen": -87.8956298828125,
"logps/rejected": -101.7688980102539,
"loss": 0.5395628929138183,
"rewards/accuracies": 0.6695312261581421,
"rewards/chosen": -0.8498029708862305,
"rewards/margins": 0.6512821912765503,
"rewards/rejected": -1.5010850429534912,
"step": 760
},
{
"epoch": 0.8380952380952381,
"grad_norm": 0.6294671893119812,
"learning_rate": 0.0001486910994764398,
"logits/chosen": -3.389573574066162,
"logits/rejected": -3.3465969562530518,
"logps/chosen": -89.55952453613281,
"logps/rejected": -102.7020263671875,
"loss": 0.5348502635955811,
"rewards/accuracies": 0.659375011920929,
"rewards/chosen": -1.0625698566436768,
"rewards/margins": 0.6796306371688843,
"rewards/rejected": -1.742200493812561,
"step": 770
},
{
"epoch": 0.8489795918367347,
"grad_norm": 0.637783944606781,
"learning_rate": 0.00014794315632011968,
"logits/chosen": -3.226806163787842,
"logits/rejected": -3.1543614864349365,
"logps/chosen": -92.14598846435547,
"logps/rejected": -104.5304946899414,
"loss": 0.5414380073547364,
"rewards/accuracies": 0.667187511920929,
"rewards/chosen": -1.2139638662338257,
"rewards/margins": 0.6445013284683228,
"rewards/rejected": -1.8584649562835693,
"step": 780
},
{
"epoch": 0.8598639455782313,
"grad_norm": 0.7089376449584961,
"learning_rate": 0.00014719521316379955,
"logits/chosen": -3.0788469314575195,
"logits/rejected": -3.0586276054382324,
"logps/chosen": -92.21556854248047,
"logps/rejected": -102.19468688964844,
"loss": 0.5625462532043457,
"rewards/accuracies": 0.6351562738418579,
"rewards/chosen": -1.1437532901763916,
"rewards/margins": 0.5667166709899902,
"rewards/rejected": -1.7104698419570923,
"step": 790
},
{
"epoch": 0.8707482993197279,
"grad_norm": 0.6719876527786255,
"learning_rate": 0.00014644727000747944,
"logits/chosen": -3.21879506111145,
"logits/rejected": -3.1802637577056885,
"logps/chosen": -87.95653533935547,
"logps/rejected": -99.78177642822266,
"loss": 0.5563519954681396,
"rewards/accuracies": 0.6585937738418579,
"rewards/chosen": -1.027986764907837,
"rewards/margins": 0.5857411623001099,
"rewards/rejected": -1.6137279272079468,
"step": 800
},
{
"epoch": 0.8816326530612245,
"grad_norm": 0.7437763810157776,
"learning_rate": 0.0001456993268511593,
"logits/chosen": -3.17462158203125,
"logits/rejected": -3.1289212703704834,
"logps/chosen": -90.2762680053711,
"logps/rejected": -101.78657531738281,
"loss": 0.5628280162811279,
"rewards/accuracies": 0.659375011920929,
"rewards/chosen": -1.0404772758483887,
"rewards/margins": 0.5995458364486694,
"rewards/rejected": -1.6400229930877686,
"step": 810
},
{
"epoch": 0.8925170068027211,
"grad_norm": 0.7401530146598816,
"learning_rate": 0.0001449513836948392,
"logits/chosen": -3.1435704231262207,
"logits/rejected": -3.0372138023376465,
"logps/chosen": -92.34797668457031,
"logps/rejected": -103.2850341796875,
"loss": 0.5592099189758301,
"rewards/accuracies": 0.65625,
"rewards/chosen": -1.03983473777771,
"rewards/margins": 0.5651776194572449,
"rewards/rejected": -1.60501229763031,
"step": 820
},
{
"epoch": 0.9034013605442177,
"grad_norm": 0.6176671385765076,
"learning_rate": 0.00014420344053851908,
"logits/chosen": -3.2093448638916016,
"logits/rejected": -3.1419150829315186,
"logps/chosen": -92.94093322753906,
"logps/rejected": -102.44952392578125,
"loss": 0.5435313224792481,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": -0.9639943838119507,
"rewards/margins": 0.598076343536377,
"rewards/rejected": -1.562070608139038,
"step": 830
},
{
"epoch": 0.9142857142857143,
"grad_norm": 0.6202688217163086,
"learning_rate": 0.00014345549738219897,
"logits/chosen": -3.3524563312530518,
"logits/rejected": -3.2346653938293457,
"logps/chosen": -91.24100494384766,
"logps/rejected": -101.37155151367188,
"loss": 0.5487663269042968,
"rewards/accuracies": 0.678906261920929,
"rewards/chosen": -0.9898284673690796,
"rewards/margins": 0.5904334783554077,
"rewards/rejected": -1.5802619457244873,
"step": 840
},
{
"epoch": 0.9251700680272109,
"grad_norm": 0.6689825057983398,
"learning_rate": 0.00014270755422587884,
"logits/chosen": -3.454129695892334,
"logits/rejected": -3.3540592193603516,
"logps/chosen": -89.66830444335938,
"logps/rejected": -102.6904525756836,
"loss": 0.5206645011901856,
"rewards/accuracies": 0.68359375,
"rewards/chosen": -0.9211218953132629,
"rewards/margins": 0.658340573310852,
"rewards/rejected": -1.5794624090194702,
"step": 850
},
{
"epoch": 0.9360544217687075,
"grad_norm": 0.738223671913147,
"learning_rate": 0.00014195961106955874,
"logits/chosen": -3.5349831581115723,
"logits/rejected": -3.452519655227661,
"logps/chosen": -92.4320297241211,
"logps/rejected": -103.63383483886719,
"loss": 0.5230117797851562,
"rewards/accuracies": 0.6976562738418579,
"rewards/chosen": -0.9207289814949036,
"rewards/margins": 0.6930528879165649,
"rewards/rejected": -1.6137816905975342,
"step": 860
},
{
"epoch": 0.9469387755102041,
"grad_norm": 0.702201247215271,
"learning_rate": 0.0001412116679132386,
"logits/chosen": -3.439744234085083,
"logits/rejected": -3.3527960777282715,
"logps/chosen": -91.38029479980469,
"logps/rejected": -104.20161437988281,
"loss": 0.5320132732391357,
"rewards/accuracies": 0.6953125,
"rewards/chosen": -1.1446105241775513,
"rewards/margins": 0.6743196845054626,
"rewards/rejected": -1.8189302682876587,
"step": 870
},
{
"epoch": 0.9578231292517007,
"grad_norm": 0.6528463363647461,
"learning_rate": 0.0001404637247569185,
"logits/chosen": -3.513301134109497,
"logits/rejected": -3.5274531841278076,
"logps/chosen": -90.98865509033203,
"logps/rejected": -103.4592056274414,
"loss": 0.5318188667297363,
"rewards/accuracies": 0.6773437261581421,
"rewards/chosen": -1.1643035411834717,
"rewards/margins": 0.6567374467849731,
"rewards/rejected": -1.8210411071777344,
"step": 880
},
{
"epoch": 0.9687074829931973,
"grad_norm": 0.6700842976570129,
"learning_rate": 0.00013971578160059837,
"logits/chosen": -3.6123263835906982,
"logits/rejected": -3.54679536819458,
"logps/chosen": -89.24981689453125,
"logps/rejected": -101.41873931884766,
"loss": 0.5319746017456055,
"rewards/accuracies": 0.678906261920929,
"rewards/chosen": -1.0091780424118042,
"rewards/margins": 0.707198977470398,
"rewards/rejected": -1.7163772583007812,
"step": 890
},
{
"epoch": 0.9795918367346939,
"grad_norm": 0.6881840229034424,
"learning_rate": 0.00013896783844427824,
"logits/chosen": -3.528007984161377,
"logits/rejected": -3.411106824874878,
"logps/chosen": -88.0205078125,
"logps/rejected": -99.57227325439453,
"loss": 0.5377126693725586,
"rewards/accuracies": 0.680468738079071,
"rewards/chosen": -0.9363842010498047,
"rewards/margins": 0.6687086820602417,
"rewards/rejected": -1.605093002319336,
"step": 900
},
{
"epoch": 0.9904761904761905,
"grad_norm": 0.6982113718986511,
"learning_rate": 0.0001382198952879581,
"logits/chosen": -3.544215440750122,
"logits/rejected": -3.499542236328125,
"logps/chosen": -87.49764251708984,
"logps/rejected": -98.82611083984375,
"loss": 0.5362007141113281,
"rewards/accuracies": 0.65234375,
"rewards/chosen": -0.8832570314407349,
"rewards/margins": 0.6539750695228577,
"rewards/rejected": -1.5372319221496582,
"step": 910
},
{
"epoch": 1.0010884353741496,
"grad_norm": 0.49051275849342346,
"learning_rate": 0.000137471952131638,
"logits/chosen": -3.4829673767089844,
"logits/rejected": -3.455536365509033,
"logps/chosen": -86.75341796875,
"logps/rejected": -98.81475067138672,
"loss": 0.5034448623657226,
"rewards/accuracies": 0.7075320482254028,
"rewards/chosen": -0.9121702909469604,
"rewards/margins": 0.770575225353241,
"rewards/rejected": -1.6827455759048462,
"step": 920
},
{
"epoch": 1.0119727891156463,
"grad_norm": 0.5276588201522827,
"learning_rate": 0.00013672400897531787,
"logits/chosen": -3.5929553508758545,
"logits/rejected": -3.5475852489471436,
"logps/chosen": -92.64207458496094,
"logps/rejected": -107.84423828125,
"loss": 0.4122049808502197,
"rewards/accuracies": 0.7789062261581421,
"rewards/chosen": -1.0530273914337158,
"rewards/margins": 1.0623085498809814,
"rewards/rejected": -2.1153359413146973,
"step": 930
},
{
"epoch": 1.022857142857143,
"grad_norm": 0.5503054261207581,
"learning_rate": 0.00013597606581899777,
"logits/chosen": -3.6768276691436768,
"logits/rejected": -3.5878639221191406,
"logps/chosen": -94.07461547851562,
"logps/rejected": -112.07344055175781,
"loss": 0.40670342445373536,
"rewards/accuracies": 0.784375011920929,
"rewards/chosen": -1.2350085973739624,
"rewards/margins": 1.135968804359436,
"rewards/rejected": -2.3709776401519775,
"step": 940
},
{
"epoch": 1.0337414965986396,
"grad_norm": 0.5421497225761414,
"learning_rate": 0.00013522812266267764,
"logits/chosen": -3.7791919708251953,
"logits/rejected": -3.726738452911377,
"logps/chosen": -90.40796661376953,
"logps/rejected": -106.10577392578125,
"loss": 0.4037026882171631,
"rewards/accuracies": 0.784375011920929,
"rewards/chosen": -1.1298649311065674,
"rewards/margins": 1.157552719116211,
"rewards/rejected": -2.2874176502227783,
"step": 950
},
{
"epoch": 1.044625850340136,
"grad_norm": 0.5323552489280701,
"learning_rate": 0.0001344801795063575,
"logits/chosen": -3.955470323562622,
"logits/rejected": -3.9261558055877686,
"logps/chosen": -92.28099060058594,
"logps/rejected": -108.50651550292969,
"loss": 0.4047850608825684,
"rewards/accuracies": 0.793749988079071,
"rewards/chosen": -0.9677878618240356,
"rewards/margins": 1.1882990598678589,
"rewards/rejected": -2.1560869216918945,
"step": 960
},
{
"epoch": 1.0555102040816327,
"grad_norm": 0.4538813829421997,
"learning_rate": 0.0001337322363500374,
"logits/chosen": -3.7241110801696777,
"logits/rejected": -3.7324581146240234,
"logps/chosen": -90.46250915527344,
"logps/rejected": -109.62055969238281,
"loss": 0.39860632419586184,
"rewards/accuracies": 0.780468761920929,
"rewards/chosen": -0.9383746981620789,
"rewards/margins": 1.2237045764923096,
"rewards/rejected": -2.162079334259033,
"step": 970
},
{
"epoch": 1.0663945578231293,
"grad_norm": 0.5154798030853271,
"learning_rate": 0.00013298429319371727,
"logits/chosen": -3.8078360557556152,
"logits/rejected": -3.7505202293395996,
"logps/chosen": -88.5647201538086,
"logps/rejected": -105.87337493896484,
"loss": 0.4086859703063965,
"rewards/accuracies": 0.7718750238418579,
"rewards/chosen": -1.0960875749588013,
"rewards/margins": 1.1370435953140259,
"rewards/rejected": -2.2331314086914062,
"step": 980
},
{
"epoch": 1.0772789115646257,
"grad_norm": 0.5626422166824341,
"learning_rate": 0.00013223635003739717,
"logits/chosen": -3.832609176635742,
"logits/rejected": -3.7331223487854004,
"logps/chosen": -93.8613052368164,
"logps/rejected": -112.10726165771484,
"loss": 0.38766965866088865,
"rewards/accuracies": 0.7945312261581421,
"rewards/chosen": -1.118674397468567,
"rewards/margins": 1.2444055080413818,
"rewards/rejected": -2.36307954788208,
"step": 990
},
{
"epoch": 1.0881632653061224,
"grad_norm": 0.4980772137641907,
"learning_rate": 0.00013148840688107703,
"logits/chosen": -3.9342827796936035,
"logits/rejected": -3.891047239303589,
"logps/chosen": -90.54890441894531,
"logps/rejected": -110.37210845947266,
"loss": 0.38568527698516847,
"rewards/accuracies": 0.784375011920929,
"rewards/chosen": -1.2535765171051025,
"rewards/margins": 1.2768959999084473,
"rewards/rejected": -2.5304722785949707,
"step": 1000
},
{
"epoch": 1.0881632653061224,
"eval_logits/chosen": -4.035802364349365,
"eval_logits/rejected": -3.9840340614318848,
"eval_logps/chosen": -94.60836791992188,
"eval_logps/rejected": -109.67314910888672,
"eval_loss": 0.5218217968940735,
"eval_rewards/accuracies": 0.6712499856948853,
"eval_rewards/chosen": -1.5003221035003662,
"eval_rewards/margins": 0.8820583820343018,
"eval_rewards/rejected": -2.382380723953247,
"eval_runtime": 104.4812,
"eval_samples_per_second": 22.971,
"eval_steps_per_second": 2.871,
"step": 1000
},
{
"epoch": 1.099047619047619,
"grad_norm": 0.5595287084579468,
"learning_rate": 0.00013074046372475693,
"logits/chosen": -3.9862780570983887,
"logits/rejected": -3.910135269165039,
"logps/chosen": -99.29423522949219,
"logps/rejected": -118.37043762207031,
"loss": 0.382628059387207,
"rewards/accuracies": 0.7914062738418579,
"rewards/chosen": -1.4844170808792114,
"rewards/margins": 1.2958667278289795,
"rewards/rejected": -2.7802836894989014,
"step": 1010
},
{
"epoch": 1.1099319727891157,
"grad_norm": 0.5150955319404602,
"learning_rate": 0.0001299925205684368,
"logits/chosen": -3.9361672401428223,
"logits/rejected": -3.924912929534912,
"logps/chosen": -95.98111724853516,
"logps/rejected": -114.6279525756836,
"loss": 0.37689783573150637,
"rewards/accuracies": 0.785937488079071,
"rewards/chosen": -1.5440380573272705,
"rewards/margins": 1.3521003723144531,
"rewards/rejected": -2.8961384296417236,
"step": 1020
},
{
"epoch": 1.1208163265306124,
"grad_norm": 0.5913591384887695,
"learning_rate": 0.0001292445774121167,
"logits/chosen": -3.943892002105713,
"logits/rejected": -3.976665496826172,
"logps/chosen": -95.18277740478516,
"logps/rejected": -113.27921295166016,
"loss": 0.39126296043395997,
"rewards/accuracies": 0.776562511920929,
"rewards/chosen": -1.530815839767456,
"rewards/margins": 1.3069045543670654,
"rewards/rejected": -2.8377201557159424,
"step": 1030
},
{
"epoch": 1.1317006802721088,
"grad_norm": 0.6089534163475037,
"learning_rate": 0.00012849663425579656,
"logits/chosen": -3.9231574535369873,
"logits/rejected": -3.8793838024139404,
"logps/chosen": -91.93929290771484,
"logps/rejected": -109.3221664428711,
"loss": 0.4064298629760742,
"rewards/accuracies": 0.7562500238418579,
"rewards/chosen": -1.3621362447738647,
"rewards/margins": 1.2190048694610596,
"rewards/rejected": -2.5811409950256348,
"step": 1040
},
{
"epoch": 1.1425850340136054,
"grad_norm": 0.5580401420593262,
"learning_rate": 0.00012774869109947646,
"logits/chosen": -4.0801682472229,
"logits/rejected": -4.014742851257324,
"logps/chosen": -93.5271987915039,
"logps/rejected": -110.57737731933594,
"loss": 0.39088118076324463,
"rewards/accuracies": 0.778124988079071,
"rewards/chosen": -1.1289399862289429,
"rewards/margins": 1.294062852859497,
"rewards/rejected": -2.4230027198791504,
"step": 1050
},
{
"epoch": 1.153469387755102,
"grad_norm": 0.6687185764312744,
"learning_rate": 0.00012700074794315633,
"logits/chosen": -3.948697566986084,
"logits/rejected": -3.8599441051483154,
"logps/chosen": -92.7010269165039,
"logps/rejected": -109.04603576660156,
"loss": 0.4010897159576416,
"rewards/accuracies": 0.76953125,
"rewards/chosen": -1.2695072889328003,
"rewards/margins": 1.2557579278945923,
"rewards/rejected": -2.5252652168273926,
"step": 1060
},
{
"epoch": 1.1643537414965985,
"grad_norm": 0.5772605538368225,
"learning_rate": 0.00012625280478683622,
"logits/chosen": -4.051478385925293,
"logits/rejected": -3.9212899208068848,
"logps/chosen": -93.09245300292969,
"logps/rejected": -112.09034729003906,
"loss": 0.3885282754898071,
"rewards/accuracies": 0.776562511920929,
"rewards/chosen": -1.3699064254760742,
"rewards/margins": 1.302438497543335,
"rewards/rejected": -2.67234468460083,
"step": 1070
},
{
"epoch": 1.1752380952380952,
"grad_norm": 0.55010986328125,
"learning_rate": 0.0001255048616305161,
"logits/chosen": -3.901043653488159,
"logits/rejected": -3.7977395057678223,
"logps/chosen": -93.72676086425781,
"logps/rejected": -112.05916595458984,
"loss": 0.39031736850738524,
"rewards/accuracies": 0.7796875238418579,
"rewards/chosen": -1.4006497859954834,
"rewards/margins": 1.2986645698547363,
"rewards/rejected": -2.6993141174316406,
"step": 1080
},
{
"epoch": 1.1861224489795918,
"grad_norm": 0.6019951105117798,
"learning_rate": 0.00012475691847419596,
"logits/chosen": -3.874293804168701,
"logits/rejected": -3.8425419330596924,
"logps/chosen": -97.39969635009766,
"logps/rejected": -116.4852523803711,
"loss": 0.38108861446380615,
"rewards/accuracies": 0.785937488079071,
"rewards/chosen": -1.5423808097839355,
"rewards/margins": 1.3624523878097534,
"rewards/rejected": -2.9048333168029785,
"step": 1090
},
{
"epoch": 1.1970068027210885,
"grad_norm": 0.5465772151947021,
"learning_rate": 0.00012400897531787586,
"logits/chosen": -3.8221359252929688,
"logits/rejected": -3.7892353534698486,
"logps/chosen": -97.63330841064453,
"logps/rejected": -116.29536437988281,
"loss": 0.3859058141708374,
"rewards/accuracies": 0.7867187261581421,
"rewards/chosen": -1.561934232711792,
"rewards/margins": 1.3092113733291626,
"rewards/rejected": -2.871145248413086,
"step": 1100
},
{
"epoch": 1.2078911564625852,
"grad_norm": 0.6201313138008118,
"learning_rate": 0.00012326103216155572,
"logits/chosen": -3.8689208030700684,
"logits/rejected": -3.814204454421997,
"logps/chosen": -94.79856872558594,
"logps/rejected": -114.0688705444336,
"loss": 0.38736424446105955,
"rewards/accuracies": 0.780468761920929,
"rewards/chosen": -1.537530541419983,
"rewards/margins": 1.3583099842071533,
"rewards/rejected": -2.895840644836426,
"step": 1110
},
{
"epoch": 1.2187755102040816,
"grad_norm": 0.6293015480041504,
"learning_rate": 0.00012251308900523562,
"logits/chosen": -3.8243889808654785,
"logits/rejected": -3.680662155151367,
"logps/chosen": -98.95996856689453,
"logps/rejected": -118.1916732788086,
"loss": 0.3828889846801758,
"rewards/accuracies": 0.782031238079071,
"rewards/chosen": -1.7024767398834229,
"rewards/margins": 1.3618117570877075,
"rewards/rejected": -3.06428861618042,
"step": 1120
},
{
"epoch": 1.2296598639455782,
"grad_norm": 0.6542093753814697,
"learning_rate": 0.0001217651458489155,
"logits/chosen": -3.806445360183716,
"logits/rejected": -3.8042194843292236,
"logps/chosen": -95.04216003417969,
"logps/rejected": -113.69169616699219,
"loss": 0.38822317123413086,
"rewards/accuracies": 0.7710937261581421,
"rewards/chosen": -1.6071590185165405,
"rewards/margins": 1.3052054643630981,
"rewards/rejected": -2.9123644828796387,
"step": 1130
},
{
"epoch": 1.240544217687075,
"grad_norm": 0.6824989914894104,
"learning_rate": 0.00012101720269259537,
"logits/chosen": -3.831465482711792,
"logits/rejected": -3.731153964996338,
"logps/chosen": -97.02737426757812,
"logps/rejected": -115.9981918334961,
"loss": 0.39344158172607424,
"rewards/accuracies": 0.7796875238418579,
"rewards/chosen": -1.642228364944458,
"rewards/margins": 1.3141920566558838,
"rewards/rejected": -2.956420421600342,
"step": 1140
},
{
"epoch": 1.2514285714285713,
"grad_norm": 0.5602055788040161,
"learning_rate": 0.00012026925953627525,
"logits/chosen": -3.8642430305480957,
"logits/rejected": -3.8064823150634766,
"logps/chosen": -96.62242126464844,
"logps/rejected": -116.4171142578125,
"loss": 0.38083562850952146,
"rewards/accuracies": 0.789843738079071,
"rewards/chosen": -1.6083332300186157,
"rewards/margins": 1.389948844909668,
"rewards/rejected": -2.998281717300415,
"step": 1150
},
{
"epoch": 1.262312925170068,
"grad_norm": 0.5861300826072693,
"learning_rate": 0.00011952131637995514,
"logits/chosen": -3.833646297454834,
"logits/rejected": -3.7338168621063232,
"logps/chosen": -95.55216979980469,
"logps/rejected": -114.51301574707031,
"loss": 0.3848297595977783,
"rewards/accuracies": 0.7749999761581421,
"rewards/chosen": -1.6490459442138672,
"rewards/margins": 1.3717120885849,
"rewards/rejected": -3.0207581520080566,
"step": 1160
},
{
"epoch": 1.2731972789115646,
"grad_norm": 0.5589214563369751,
"learning_rate": 0.00011877337322363502,
"logits/chosen": -3.80780291557312,
"logits/rejected": -3.658127546310425,
"logps/chosen": -98.92552185058594,
"logps/rejected": -120.0743408203125,
"loss": 0.3743234872817993,
"rewards/accuracies": 0.788281261920929,
"rewards/chosen": -1.8888273239135742,
"rewards/margins": 1.4256237745285034,
"rewards/rejected": -3.314451217651367,
"step": 1170
},
{
"epoch": 1.2840816326530613,
"grad_norm": 0.773446798324585,
"learning_rate": 0.00011802543006731489,
"logits/chosen": -3.791332244873047,
"logits/rejected": -3.7509467601776123,
"logps/chosen": -100.43743133544922,
"logps/rejected": -119.4636001586914,
"loss": 0.3916522979736328,
"rewards/accuracies": 0.772656261920929,
"rewards/chosen": -2.132657766342163,
"rewards/margins": 1.3497222661972046,
"rewards/rejected": -3.482379913330078,
"step": 1180
},
{
"epoch": 1.294965986394558,
"grad_norm": 0.6507579684257507,
"learning_rate": 0.00011727748691099475,
"logits/chosen": -3.631664752960205,
"logits/rejected": -3.559692859649658,
"logps/chosen": -102.70137786865234,
"logps/rejected": -119.88555908203125,
"loss": 0.38732936382293703,
"rewards/accuracies": 0.780468761920929,
"rewards/chosen": -1.9864223003387451,
"rewards/margins": 1.3899860382080078,
"rewards/rejected": -3.376408338546753,
"step": 1190
},
{
"epoch": 1.3058503401360544,
"grad_norm": 0.5761600136756897,
"learning_rate": 0.00011652954375467464,
"logits/chosen": -3.7357120513916016,
"logits/rejected": -3.7192249298095703,
"logps/chosen": -96.95130157470703,
"logps/rejected": -118.63916015625,
"loss": 0.386475658416748,
"rewards/accuracies": 0.7789062261581421,
"rewards/chosen": -1.7698255777359009,
"rewards/margins": 1.3770931959152222,
"rewards/rejected": -3.146918773651123,
"step": 1200
},
{
"epoch": 1.316734693877551,
"grad_norm": 0.751353919506073,
"learning_rate": 0.00011578160059835452,
"logits/chosen": -3.761479139328003,
"logits/rejected": -3.714494228363037,
"logps/chosen": -99.30330657958984,
"logps/rejected": -118.73576354980469,
"loss": 0.3787353515625,
"rewards/accuracies": 0.789843738079071,
"rewards/chosen": -1.8722871541976929,
"rewards/margins": 1.4351270198822021,
"rewards/rejected": -3.3074138164520264,
"step": 1210
},
{
"epoch": 1.3276190476190477,
"grad_norm": 0.6535031795501709,
"learning_rate": 0.0001150336574420344,
"logits/chosen": -3.6952037811279297,
"logits/rejected": -3.615670680999756,
"logps/chosen": -100.49695587158203,
"logps/rejected": -121.04229736328125,
"loss": 0.3696281433105469,
"rewards/accuracies": 0.7945312261581421,
"rewards/chosen": -1.8464534282684326,
"rewards/margins": 1.4216703176498413,
"rewards/rejected": -3.2681241035461426,
"step": 1220
},
{
"epoch": 1.3385034013605441,
"grad_norm": 0.660273551940918,
"learning_rate": 0.00011428571428571428,
"logits/chosen": -3.7871832847595215,
"logits/rejected": -3.731839418411255,
"logps/chosen": -98.5318374633789,
"logps/rejected": -115.12672424316406,
"loss": 0.3887288808822632,
"rewards/accuracies": 0.7828124761581421,
"rewards/chosen": -1.8460729122161865,
"rewards/margins": 1.3180320262908936,
"rewards/rejected": -3.164105176925659,
"step": 1230
},
{
"epoch": 1.3493877551020408,
"grad_norm": 0.7036870121955872,
"learning_rate": 0.00011353777112939417,
"logits/chosen": -3.7227275371551514,
"logits/rejected": -3.703014373779297,
"logps/chosen": -96.31185913085938,
"logps/rejected": -115.09098815917969,
"loss": 0.3810297966003418,
"rewards/accuracies": 0.7875000238418579,
"rewards/chosen": -1.6640751361846924,
"rewards/margins": 1.3640429973602295,
"rewards/rejected": -3.028118133544922,
"step": 1240
},
{
"epoch": 1.3602721088435374,
"grad_norm": 0.6380351185798645,
"learning_rate": 0.00011278982797307405,
"logits/chosen": -3.743776798248291,
"logits/rejected": -3.590733051300049,
"logps/chosen": -95.80562591552734,
"logps/rejected": -114.26639556884766,
"loss": 0.38879597187042236,
"rewards/accuracies": 0.776562511920929,
"rewards/chosen": -1.5717710256576538,
"rewards/margins": 1.3705636262893677,
"rewards/rejected": -2.9423346519470215,
"step": 1250
},
{
"epoch": 1.3711564625850339,
"grad_norm": 0.695436418056488,
"learning_rate": 0.00011204188481675393,
"logits/chosen": -3.7618496417999268,
"logits/rejected": -3.742903470993042,
"logps/chosen": -94.9074478149414,
"logps/rejected": -116.57875061035156,
"loss": 0.3822426080703735,
"rewards/accuracies": 0.776562511920929,
"rewards/chosen": -1.6461149454116821,
"rewards/margins": 1.4086042642593384,
"rewards/rejected": -3.0547192096710205,
"step": 1260
},
{
"epoch": 1.3820408163265305,
"grad_norm": 0.5786954760551453,
"learning_rate": 0.00011129394166043381,
"logits/chosen": -3.881277561187744,
"logits/rejected": -3.810837984085083,
"logps/chosen": -98.8532485961914,
"logps/rejected": -118.10380554199219,
"loss": 0.3603384256362915,
"rewards/accuracies": 0.8046875,
"rewards/chosen": -1.8184385299682617,
"rewards/margins": 1.4062011241912842,
"rewards/rejected": -3.224639415740967,
"step": 1270
},
{
"epoch": 1.3929251700680272,
"grad_norm": 0.6679598093032837,
"learning_rate": 0.0001105459985041137,
"logits/chosen": -3.8195717334747314,
"logits/rejected": -3.790808916091919,
"logps/chosen": -100.193603515625,
"logps/rejected": -120.28971862792969,
"loss": 0.366161584854126,
"rewards/accuracies": 0.803906261920929,
"rewards/chosen": -1.7882047891616821,
"rewards/margins": 1.4713773727416992,
"rewards/rejected": -3.259582042694092,
"step": 1280
},
{
"epoch": 1.4038095238095238,
"grad_norm": 0.6280708909034729,
"learning_rate": 0.00010979805534779358,
"logits/chosen": -3.7300808429718018,
"logits/rejected": -3.7090256214141846,
"logps/chosen": -95.59440612792969,
"logps/rejected": -115.55784606933594,
"loss": 0.38781962394714353,
"rewards/accuracies": 0.770312488079071,
"rewards/chosen": -1.5936332941055298,
"rewards/margins": 1.418022871017456,
"rewards/rejected": -3.0116562843322754,
"step": 1290
},
{
"epoch": 1.4146938775510205,
"grad_norm": 0.6393949389457703,
"learning_rate": 0.00010905011219147346,
"logits/chosen": -3.6777634620666504,
"logits/rejected": -3.60345721244812,
"logps/chosen": -97.09107971191406,
"logps/rejected": -115.95845031738281,
"loss": 0.37133514881134033,
"rewards/accuracies": 0.776562511920929,
"rewards/chosen": -1.5525085926055908,
"rewards/margins": 1.4391489028930664,
"rewards/rejected": -2.9916577339172363,
"step": 1300
},
{
"epoch": 1.425578231292517,
"grad_norm": 0.5887162685394287,
"learning_rate": 0.00010830216903515333,
"logits/chosen": -3.858353853225708,
"logits/rejected": -3.729213237762451,
"logps/chosen": -97.08758544921875,
"logps/rejected": -115.01194763183594,
"loss": 0.3837103366851807,
"rewards/accuracies": 0.77734375,
"rewards/chosen": -1.7705045938491821,
"rewards/margins": 1.3879071474075317,
"rewards/rejected": -3.158411741256714,
"step": 1310
},
{
"epoch": 1.4364625850340136,
"grad_norm": 0.6474682092666626,
"learning_rate": 0.00010755422587883321,
"logits/chosen": -3.9399871826171875,
"logits/rejected": -3.7817294597625732,
"logps/chosen": -97.05113220214844,
"logps/rejected": -119.55680847167969,
"loss": 0.36365351676940916,
"rewards/accuracies": 0.788281261920929,
"rewards/chosen": -1.7540229558944702,
"rewards/margins": 1.5094449520111084,
"rewards/rejected": -3.263467788696289,
"step": 1320
},
{
"epoch": 1.4473469387755102,
"grad_norm": 0.6645624041557312,
"learning_rate": 0.00010680628272251309,
"logits/chosen": -3.977292537689209,
"logits/rejected": -3.8931617736816406,
"logps/chosen": -96.40562438964844,
"logps/rejected": -117.29931640625,
"loss": 0.37579851150512694,
"rewards/accuracies": 0.7718750238418579,
"rewards/chosen": -1.6829277276992798,
"rewards/margins": 1.5337533950805664,
"rewards/rejected": -3.2166812419891357,
"step": 1330
},
{
"epoch": 1.4582312925170067,
"grad_norm": 0.795894980430603,
"learning_rate": 0.00010605833956619297,
"logits/chosen": -4.0191144943237305,
"logits/rejected": -3.899752140045166,
"logps/chosen": -92.3825454711914,
"logps/rejected": -112.3360595703125,
"loss": 0.3910695552825928,
"rewards/accuracies": 0.7671874761581421,
"rewards/chosen": -1.5036238431930542,
"rewards/margins": 1.455990195274353,
"rewards/rejected": -2.9596142768859863,
"step": 1340
},
{
"epoch": 1.4691156462585033,
"grad_norm": 0.6805703639984131,
"learning_rate": 0.00010531039640987286,
"logits/chosen": -3.859619140625,
"logits/rejected": -3.820143938064575,
"logps/chosen": -101.65718841552734,
"logps/rejected": -121.03543853759766,
"loss": 0.38420472145080564,
"rewards/accuracies": 0.7757812738418579,
"rewards/chosen": -1.6729732751846313,
"rewards/margins": 1.4384580850601196,
"rewards/rejected": -3.111431121826172,
"step": 1350
},
{
"epoch": 1.48,
"grad_norm": 0.6531292200088501,
"learning_rate": 0.00010456245325355274,
"logits/chosen": -3.826378583908081,
"logits/rejected": -3.772704601287842,
"logps/chosen": -100.1290283203125,
"logps/rejected": -119.37181091308594,
"loss": 0.3683862447738647,
"rewards/accuracies": 0.78515625,
"rewards/chosen": -1.9099397659301758,
"rewards/margins": 1.4697914123535156,
"rewards/rejected": -3.3797316551208496,
"step": 1360
},
{
"epoch": 1.4908843537414966,
"grad_norm": 0.6555562019348145,
"learning_rate": 0.00010381451009723262,
"logits/chosen": -3.857220411300659,
"logits/rejected": -3.754575252532959,
"logps/chosen": -101.08953857421875,
"logps/rejected": -120.2709732055664,
"loss": 0.3801293849945068,
"rewards/accuracies": 0.764843761920929,
"rewards/chosen": -1.9699108600616455,
"rewards/margins": 1.38763427734375,
"rewards/rejected": -3.3575451374053955,
"step": 1370
},
{
"epoch": 1.5017687074829933,
"grad_norm": 0.5829383134841919,
"learning_rate": 0.0001030665669409125,
"logits/chosen": -3.9333407878875732,
"logits/rejected": -3.8222217559814453,
"logps/chosen": -99.89224243164062,
"logps/rejected": -118.7002182006836,
"loss": 0.3699865102767944,
"rewards/accuracies": 0.8031250238418579,
"rewards/chosen": -1.854455590248108,
"rewards/margins": 1.431877851486206,
"rewards/rejected": -3.2863335609436035,
"step": 1380
},
{
"epoch": 1.5126530612244897,
"grad_norm": 0.7183417677879333,
"learning_rate": 0.00010231862378459238,
"logits/chosen": -4.135873317718506,
"logits/rejected": -3.9824626445770264,
"logps/chosen": -97.94303131103516,
"logps/rejected": -117.84385681152344,
"loss": 0.373444128036499,
"rewards/accuracies": 0.7828124761581421,
"rewards/chosen": -1.8929665088653564,
"rewards/margins": 1.4810130596160889,
"rewards/rejected": -3.373979091644287,
"step": 1390
},
{
"epoch": 1.5235374149659864,
"grad_norm": 0.62285315990448,
"learning_rate": 0.00010157068062827227,
"logits/chosen": -3.943370819091797,
"logits/rejected": -3.885420322418213,
"logps/chosen": -101.32877349853516,
"logps/rejected": -122.38797760009766,
"loss": 0.36237530708312987,
"rewards/accuracies": 0.7875000238418579,
"rewards/chosen": -1.6976028680801392,
"rewards/margins": 1.5130655765533447,
"rewards/rejected": -3.2106685638427734,
"step": 1400
},
{
"epoch": 1.534421768707483,
"grad_norm": 0.7117959856987,
"learning_rate": 0.00010082273747195215,
"logits/chosen": -4.146048545837402,
"logits/rejected": -4.0635809898376465,
"logps/chosen": -96.91676330566406,
"logps/rejected": -115.88706970214844,
"loss": 0.3611806631088257,
"rewards/accuracies": 0.796093761920929,
"rewards/chosen": -1.7968066930770874,
"rewards/margins": 1.4590308666229248,
"rewards/rejected": -3.2558376789093018,
"step": 1410
},
{
"epoch": 1.5453061224489795,
"grad_norm": 0.4945203363895416,
"learning_rate": 0.00010007479431563203,
"logits/chosen": -4.0039167404174805,
"logits/rejected": -3.9553489685058594,
"logps/chosen": -100.09791564941406,
"logps/rejected": -120.74732971191406,
"loss": 0.37725100517272947,
"rewards/accuracies": 0.780468761920929,
"rewards/chosen": -1.9454562664031982,
"rewards/margins": 1.4613468647003174,
"rewards/rejected": -3.406803607940674,
"step": 1420
},
{
"epoch": 1.5561904761904763,
"grad_norm": 0.5278945565223694,
"learning_rate": 9.93268511593119e-05,
"logits/chosen": -3.986499309539795,
"logits/rejected": -3.932950496673584,
"logps/chosen": -102.49642181396484,
"logps/rejected": -122.0504150390625,
"loss": 0.37192845344543457,
"rewards/accuracies": 0.7796875238418579,
"rewards/chosen": -1.9946882724761963,
"rewards/margins": 1.5072121620178223,
"rewards/rejected": -3.5019004344940186,
"step": 1430
},
{
"epoch": 1.5670748299319728,
"grad_norm": 0.5255491733551025,
"learning_rate": 9.857890800299178e-05,
"logits/chosen": -3.868673801422119,
"logits/rejected": -3.8117432594299316,
"logps/chosen": -100.22129821777344,
"logps/rejected": -119.8470687866211,
"loss": 0.374340295791626,
"rewards/accuracies": 0.7890625,
"rewards/chosen": -1.920660376548767,
"rewards/margins": 1.4606765508651733,
"rewards/rejected": -3.3813369274139404,
"step": 1440
},
{
"epoch": 1.5779591836734694,
"grad_norm": 0.6175586581230164,
"learning_rate": 9.783096484667166e-05,
"logits/chosen": -3.869438886642456,
"logits/rejected": -3.7423954010009766,
"logps/chosen": -101.46055603027344,
"logps/rejected": -121.7767562866211,
"loss": 0.3565861940383911,
"rewards/accuracies": 0.800000011920929,
"rewards/chosen": -1.973406195640564,
"rewards/margins": 1.5132112503051758,
"rewards/rejected": -3.48661732673645,
"step": 1450
},
{
"epoch": 1.588843537414966,
"grad_norm": 0.6701238751411438,
"learning_rate": 9.708302169035153e-05,
"logits/chosen": -3.9192538261413574,
"logits/rejected": -3.899573564529419,
"logps/chosen": -97.5078353881836,
"logps/rejected": -118.8314437866211,
"loss": 0.3684267997741699,
"rewards/accuracies": 0.778124988079071,
"rewards/chosen": -2.0173895359039307,
"rewards/margins": 1.507660150527954,
"rewards/rejected": -3.525049924850464,
"step": 1460
},
{
"epoch": 1.5997278911564625,
"grad_norm": 0.8422195315361023,
"learning_rate": 9.633507853403142e-05,
"logits/chosen": -3.8154900074005127,
"logits/rejected": -3.763354539871216,
"logps/chosen": -103.52520751953125,
"logps/rejected": -125.2503890991211,
"loss": 0.36898369789123536,
"rewards/accuracies": 0.7835937738418579,
"rewards/chosen": -1.952511191368103,
"rewards/margins": 1.5541565418243408,
"rewards/rejected": -3.5066676139831543,
"step": 1470
},
{
"epoch": 1.6106122448979592,
"grad_norm": 0.6260126233100891,
"learning_rate": 9.55871353777113e-05,
"logits/chosen": -3.938748836517334,
"logits/rejected": -3.8893561363220215,
"logps/chosen": -98.54754638671875,
"logps/rejected": -118.55876159667969,
"loss": 0.378691291809082,
"rewards/accuracies": 0.788281261920929,
"rewards/chosen": -1.7820552587509155,
"rewards/margins": 1.4857076406478882,
"rewards/rejected": -3.2677626609802246,
"step": 1480
},
{
"epoch": 1.6214965986394558,
"grad_norm": 0.6023070216178894,
"learning_rate": 9.483919222139118e-05,
"logits/chosen": -4.026276111602783,
"logits/rejected": -3.953202724456787,
"logps/chosen": -96.39505004882812,
"logps/rejected": -115.8733901977539,
"loss": 0.36678736209869384,
"rewards/accuracies": 0.78125,
"rewards/chosen": -1.5815566778182983,
"rewards/margins": 1.527267336845398,
"rewards/rejected": -3.1088242530822754,
"step": 1490
},
{
"epoch": 1.6323809523809523,
"grad_norm": 0.5291011929512024,
"learning_rate": 9.409124906507106e-05,
"logits/chosen": -3.9902701377868652,
"logits/rejected": -3.968461513519287,
"logps/chosen": -96.85718536376953,
"logps/rejected": -118.74107360839844,
"loss": 0.3673092365264893,
"rewards/accuracies": 0.789843738079071,
"rewards/chosen": -1.714505910873413,
"rewards/margins": 1.5418702363967896,
"rewards/rejected": -3.256376266479492,
"step": 1500
},
{
"epoch": 1.6323809523809523,
"eval_logits/chosen": -4.040825366973877,
"eval_logits/rejected": -3.988185167312622,
"eval_logps/chosen": -98.07389068603516,
"eval_logps/rejected": -115.78838348388672,
"eval_loss": 0.47849762439727783,
"eval_rewards/accuracies": 0.7079166769981384,
"eval_rewards/chosen": -1.8468737602233887,
"eval_rewards/margins": 1.1470292806625366,
"eval_rewards/rejected": -2.993903160095215,
"eval_runtime": 106.0205,
"eval_samples_per_second": 22.637,
"eval_steps_per_second": 2.83,
"step": 1500
},
{
"epoch": 1.6432653061224491,
"grad_norm": 0.6328744292259216,
"learning_rate": 9.334330590875094e-05,
"logits/chosen": -4.012321949005127,
"logits/rejected": -3.944819927215576,
"logps/chosen": -97.4483642578125,
"logps/rejected": -118.50297546386719,
"loss": 0.3724888801574707,
"rewards/accuracies": 0.7749999761581421,
"rewards/chosen": -1.79526686668396,
"rewards/margins": 1.4999581575393677,
"rewards/rejected": -3.2952256202697754,
"step": 1510
},
{
"epoch": 1.6541496598639456,
"grad_norm": 0.8266810178756714,
"learning_rate": 9.259536275243081e-05,
"logits/chosen": -4.003256797790527,
"logits/rejected": -3.9533722400665283,
"logps/chosen": -99.8465347290039,
"logps/rejected": -118.92730712890625,
"loss": 0.3884738922119141,
"rewards/accuracies": 0.776562511920929,
"rewards/chosen": -2.056798219680786,
"rewards/margins": 1.452993392944336,
"rewards/rejected": -3.509791612625122,
"step": 1520
},
{
"epoch": 1.6650340136054422,
"grad_norm": 0.6178652048110962,
"learning_rate": 9.18474195961107e-05,
"logits/chosen": -3.8090343475341797,
"logits/rejected": -3.734511613845825,
"logps/chosen": -100.30364990234375,
"logps/rejected": -121.00141906738281,
"loss": 0.36191649436950685,
"rewards/accuracies": 0.796875,
"rewards/chosen": -1.9928449392318726,
"rewards/margins": 1.523863673210144,
"rewards/rejected": -3.5167088508605957,
"step": 1530
},
{
"epoch": 1.6759183673469389,
"grad_norm": 0.6442583799362183,
"learning_rate": 9.109947643979058e-05,
"logits/chosen": -3.819338321685791,
"logits/rejected": -3.7492592334747314,
"logps/chosen": -103.84706115722656,
"logps/rejected": -123.3454360961914,
"loss": 0.3575705289840698,
"rewards/accuracies": 0.793749988079071,
"rewards/chosen": -2.11049222946167,
"rewards/margins": 1.5337401628494263,
"rewards/rejected": -3.6442322731018066,
"step": 1540
},
{
"epoch": 1.6868027210884353,
"grad_norm": 0.7383544445037842,
"learning_rate": 9.035153328347046e-05,
"logits/chosen": -3.8853554725646973,
"logits/rejected": -3.7873711585998535,
"logps/chosen": -103.81562805175781,
"logps/rejected": -122.89927673339844,
"loss": 0.37395687103271485,
"rewards/accuracies": 0.7679687738418579,
"rewards/chosen": -2.210036516189575,
"rewards/margins": 1.5190045833587646,
"rewards/rejected": -3.729041337966919,
"step": 1550
},
{
"epoch": 1.697687074829932,
"grad_norm": 0.5653782486915588,
"learning_rate": 8.960359012715034e-05,
"logits/chosen": -3.935488224029541,
"logits/rejected": -3.8435440063476562,
"logps/chosen": -100.53340148925781,
"logps/rejected": -120.791259765625,
"loss": 0.3584398031234741,
"rewards/accuracies": 0.78515625,
"rewards/chosen": -2.0043153762817383,
"rewards/margins": 1.5743240118026733,
"rewards/rejected": -3.578639268875122,
"step": 1560
},
{
"epoch": 1.7085714285714286,
"grad_norm": 0.8251403570175171,
"learning_rate": 8.885564697083022e-05,
"logits/chosen": -4.113719940185547,
"logits/rejected": -4.015976905822754,
"logps/chosen": -102.41825866699219,
"logps/rejected": -124.1919937133789,
"loss": 0.35360021591186525,
"rewards/accuracies": 0.8062499761581421,
"rewards/chosen": -2.1747488975524902,
"rewards/margins": 1.5947285890579224,
"rewards/rejected": -3.7694778442382812,
"step": 1570
},
{
"epoch": 1.719455782312925,
"grad_norm": 0.7069426774978638,
"learning_rate": 8.81077038145101e-05,
"logits/chosen": -4.1289448738098145,
"logits/rejected": -4.012777805328369,
"logps/chosen": -100.58708953857422,
"logps/rejected": -121.4145736694336,
"loss": 0.3635096549987793,
"rewards/accuracies": 0.7835937738418579,
"rewards/chosen": -2.133143424987793,
"rewards/margins": 1.5998557806015015,
"rewards/rejected": -3.732999324798584,
"step": 1580
},
{
"epoch": 1.7303401360544217,
"grad_norm": 0.8968989253044128,
"learning_rate": 8.735976065818999e-05,
"logits/chosen": -4.026947021484375,
"logits/rejected": -4.019469738006592,
"logps/chosen": -101.74604797363281,
"logps/rejected": -124.91915130615234,
"loss": 0.37527787685394287,
"rewards/accuracies": 0.778124988079071,
"rewards/chosen": -2.15088152885437,
"rewards/margins": 1.591313123703003,
"rewards/rejected": -3.742194652557373,
"step": 1590
},
{
"epoch": 1.7412244897959184,
"grad_norm": 0.7351986169815063,
"learning_rate": 8.661181750186986e-05,
"logits/chosen": -3.981262683868408,
"logits/rejected": -3.917276382446289,
"logps/chosen": -103.64302825927734,
"logps/rejected": -124.09883880615234,
"loss": 0.37657463550567627,
"rewards/accuracies": 0.774218738079071,
"rewards/chosen": -2.378594160079956,
"rewards/margins": 1.506073236465454,
"rewards/rejected": -3.8846676349639893,
"step": 1600
},
{
"epoch": 1.7521088435374148,
"grad_norm": 0.5647110342979431,
"learning_rate": 8.586387434554974e-05,
"logits/chosen": -4.083320140838623,
"logits/rejected": -4.027539253234863,
"logps/chosen": -103.57328796386719,
"logps/rejected": -125.90059661865234,
"loss": 0.36530237197875975,
"rewards/accuracies": 0.784375011920929,
"rewards/chosen": -2.352818250656128,
"rewards/margins": 1.5950738191604614,
"rewards/rejected": -3.9478919506073,
"step": 1610
},
{
"epoch": 1.7629931972789117,
"grad_norm": 0.7188398838043213,
"learning_rate": 8.511593118922962e-05,
"logits/chosen": -3.8719964027404785,
"logits/rejected": -3.833092212677002,
"logps/chosen": -104.86869812011719,
"logps/rejected": -124.95475006103516,
"loss": 0.36907384395599363,
"rewards/accuracies": 0.780468761920929,
"rewards/chosen": -2.335792064666748,
"rewards/margins": 1.5145189762115479,
"rewards/rejected": -3.850311279296875,
"step": 1620
},
{
"epoch": 1.7738775510204081,
"grad_norm": 0.6679319739341736,
"learning_rate": 8.43679880329095e-05,
"logits/chosen": -4.030211448669434,
"logits/rejected": -3.9728660583496094,
"logps/chosen": -103.6771011352539,
"logps/rejected": -124.9799575805664,
"loss": 0.3572399377822876,
"rewards/accuracies": 0.7945312261581421,
"rewards/chosen": -2.2580087184906006,
"rewards/margins": 1.571171522140503,
"rewards/rejected": -3.829180955886841,
"step": 1630
},
{
"epoch": 1.7847619047619048,
"grad_norm": 0.6013081073760986,
"learning_rate": 8.362004487658939e-05,
"logits/chosen": -3.995105028152466,
"logits/rejected": -3.910709857940674,
"logps/chosen": -100.53841400146484,
"logps/rejected": -123.62651062011719,
"loss": 0.3458747625350952,
"rewards/accuracies": 0.8023437261581421,
"rewards/chosen": -2.2358031272888184,
"rewards/margins": 1.6609306335449219,
"rewards/rejected": -3.8967342376708984,
"step": 1640
},
{
"epoch": 1.7956462585034014,
"grad_norm": 0.6696369051933289,
"learning_rate": 8.287210172026927e-05,
"logits/chosen": -3.9745001792907715,
"logits/rejected": -3.900158405303955,
"logps/chosen": -100.8124771118164,
"logps/rejected": -123.26814270019531,
"loss": 0.3555989027023315,
"rewards/accuracies": 0.79296875,
"rewards/chosen": -2.186405658721924,
"rewards/margins": 1.6339943408966064,
"rewards/rejected": -3.8204002380371094,
"step": 1650
},
{
"epoch": 1.8065306122448979,
"grad_norm": 0.5695591568946838,
"learning_rate": 8.212415856394914e-05,
"logits/chosen": -4.0766448974609375,
"logits/rejected": -3.9804439544677734,
"logps/chosen": -99.67530822753906,
"logps/rejected": -120.61580657958984,
"loss": 0.3668109893798828,
"rewards/accuracies": 0.7890625,
"rewards/chosen": -2.070260524749756,
"rewards/margins": 1.568867802619934,
"rewards/rejected": -3.6391282081604004,
"step": 1660
},
{
"epoch": 1.8174149659863945,
"grad_norm": 0.6718661189079285,
"learning_rate": 8.137621540762902e-05,
"logits/chosen": -4.0458664894104,
"logits/rejected": -3.9342434406280518,
"logps/chosen": -103.21232604980469,
"logps/rejected": -124.14998626708984,
"loss": 0.3770064115524292,
"rewards/accuracies": 0.789843738079071,
"rewards/chosen": -2.1097495555877686,
"rewards/margins": 1.5439164638519287,
"rewards/rejected": -3.6536660194396973,
"step": 1670
},
{
"epoch": 1.8282993197278912,
"grad_norm": 0.6736993193626404,
"learning_rate": 8.06282722513089e-05,
"logits/chosen": -4.07711124420166,
"logits/rejected": -4.0070013999938965,
"logps/chosen": -99.71659088134766,
"logps/rejected": -121.86555480957031,
"loss": 0.3560856580734253,
"rewards/accuracies": 0.7890625,
"rewards/chosen": -2.129600763320923,
"rewards/margins": 1.6453748941421509,
"rewards/rejected": -3.774975538253784,
"step": 1680
},
{
"epoch": 1.8391836734693876,
"grad_norm": 0.7004987597465515,
"learning_rate": 7.988032909498878e-05,
"logits/chosen": -3.9158096313476562,
"logits/rejected": -3.911224365234375,
"logps/chosen": -105.80472564697266,
"logps/rejected": -128.0396728515625,
"loss": 0.35362706184387205,
"rewards/accuracies": 0.8031250238418579,
"rewards/chosen": -2.293348789215088,
"rewards/margins": 1.6550325155258179,
"rewards/rejected": -3.9483814239501953,
"step": 1690
},
{
"epoch": 1.8500680272108845,
"grad_norm": 0.5832870006561279,
"learning_rate": 7.913238593866867e-05,
"logits/chosen": -4.208107948303223,
"logits/rejected": -4.131274223327637,
"logps/chosen": -98.68458557128906,
"logps/rejected": -118.3831558227539,
"loss": 0.3670835256576538,
"rewards/accuracies": 0.760937511920929,
"rewards/chosen": -2.237819194793701,
"rewards/margins": 1.6039073467254639,
"rewards/rejected": -3.841726779937744,
"step": 1700
},
{
"epoch": 1.860952380952381,
"grad_norm": 0.5559285879135132,
"learning_rate": 7.838444278234855e-05,
"logits/chosen": -4.1811747550964355,
"logits/rejected": -4.1075592041015625,
"logps/chosen": -99.44391632080078,
"logps/rejected": -122.75013732910156,
"loss": 0.3504934787750244,
"rewards/accuracies": 0.809374988079071,
"rewards/chosen": -2.2351126670837402,
"rewards/margins": 1.6141564846038818,
"rewards/rejected": -3.849269151687622,
"step": 1710
},
{
"epoch": 1.8718367346938776,
"grad_norm": 0.5495217442512512,
"learning_rate": 7.763649962602843e-05,
"logits/chosen": -4.15755558013916,
"logits/rejected": -4.096221923828125,
"logps/chosen": -104.17137145996094,
"logps/rejected": -125.32877349853516,
"loss": 0.3607916355133057,
"rewards/accuracies": 0.7828124761581421,
"rewards/chosen": -2.3636012077331543,
"rewards/margins": 1.6084495782852173,
"rewards/rejected": -3.972050428390503,
"step": 1720
},
{
"epoch": 1.8827210884353742,
"grad_norm": 0.7562318444252014,
"learning_rate": 7.688855646970831e-05,
"logits/chosen": -4.053821563720703,
"logits/rejected": -3.9341418743133545,
"logps/chosen": -102.71726989746094,
"logps/rejected": -123.45503234863281,
"loss": 0.3550391674041748,
"rewards/accuracies": 0.7906249761581421,
"rewards/chosen": -2.264005422592163,
"rewards/margins": 1.6550270318984985,
"rewards/rejected": -3.919032573699951,
"step": 1730
},
{
"epoch": 1.8936054421768707,
"grad_norm": 0.6610931158065796,
"learning_rate": 7.61406133133882e-05,
"logits/chosen": -3.961141586303711,
"logits/rejected": -3.830481767654419,
"logps/chosen": -104.4319839477539,
"logps/rejected": -125.9029541015625,
"loss": 0.3494965314865112,
"rewards/accuracies": 0.7953125238418579,
"rewards/chosen": -2.1706981658935547,
"rewards/margins": 1.6067132949829102,
"rewards/rejected": -3.777411699295044,
"step": 1740
},
{
"epoch": 1.9044897959183673,
"grad_norm": 0.6473342776298523,
"learning_rate": 7.539267015706806e-05,
"logits/chosen": -3.913191556930542,
"logits/rejected": -3.8687243461608887,
"logps/chosen": -105.96980285644531,
"logps/rejected": -125.6346206665039,
"loss": 0.3611732482910156,
"rewards/accuracies": 0.7835937738418579,
"rewards/chosen": -2.0681533813476562,
"rewards/margins": 1.6147505044937134,
"rewards/rejected": -3.68290376663208,
"step": 1750
},
{
"epoch": 1.915374149659864,
"grad_norm": 0.7833436727523804,
"learning_rate": 7.464472700074794e-05,
"logits/chosen": -3.938861846923828,
"logits/rejected": -3.9061336517333984,
"logps/chosen": -97.59529876708984,
"logps/rejected": -119.07645416259766,
"loss": 0.36034407615661623,
"rewards/accuracies": 0.780468761920929,
"rewards/chosen": -1.8530477285385132,
"rewards/margins": 1.5701138973236084,
"rewards/rejected": -3.423161745071411,
"step": 1760
},
{
"epoch": 1.9262585034013604,
"grad_norm": 0.7200015783309937,
"learning_rate": 7.389678384442783e-05,
"logits/chosen": -3.8537850379943848,
"logits/rejected": -3.8197879791259766,
"logps/chosen": -104.39387512207031,
"logps/rejected": -122.6333236694336,
"loss": 0.3665923118591309,
"rewards/accuracies": 0.78125,
"rewards/chosen": -2.3217196464538574,
"rewards/margins": 1.548337697982788,
"rewards/rejected": -3.8700573444366455,
"step": 1770
},
{
"epoch": 1.9371428571428573,
"grad_norm": 0.6586691737174988,
"learning_rate": 7.314884068810771e-05,
"logits/chosen": -3.951854705810547,
"logits/rejected": -4.002626419067383,
"logps/chosen": -106.01944732666016,
"logps/rejected": -127.8281021118164,
"loss": 0.36367824077606203,
"rewards/accuracies": 0.780468761920929,
"rewards/chosen": -2.4460396766662598,
"rewards/margins": 1.604691743850708,
"rewards/rejected": -4.050731658935547,
"step": 1780
},
{
"epoch": 1.9480272108843537,
"grad_norm": 0.5734717845916748,
"learning_rate": 7.240089753178759e-05,
"logits/chosen": -3.999734878540039,
"logits/rejected": -3.9233245849609375,
"logps/chosen": -100.71134948730469,
"logps/rejected": -121.8692626953125,
"loss": 0.3612796783447266,
"rewards/accuracies": 0.78125,
"rewards/chosen": -2.5755791664123535,
"rewards/margins": 1.5662591457366943,
"rewards/rejected": -4.141838550567627,
"step": 1790
},
{
"epoch": 1.9589115646258504,
"grad_norm": 0.6537356376647949,
"learning_rate": 7.165295437546746e-05,
"logits/chosen": -3.9834160804748535,
"logits/rejected": -3.872994899749756,
"logps/chosen": -103.37413024902344,
"logps/rejected": -125.7213134765625,
"loss": 0.3468764781951904,
"rewards/accuracies": 0.819531261920929,
"rewards/chosen": -2.4130101203918457,
"rewards/margins": 1.6939111948013306,
"rewards/rejected": -4.106921195983887,
"step": 1800
},
{
"epoch": 1.969795918367347,
"grad_norm": 0.6989219784736633,
"learning_rate": 7.090501121914734e-05,
"logits/chosen": -3.91550874710083,
"logits/rejected": -3.8702545166015625,
"logps/chosen": -106.2231674194336,
"logps/rejected": -126.7488784790039,
"loss": 0.36261188983917236,
"rewards/accuracies": 0.7945312261581421,
"rewards/chosen": -2.3560307025909424,
"rewards/margins": 1.6367266178131104,
"rewards/rejected": -3.9927573204040527,
"step": 1810
},
{
"epoch": 1.9806802721088435,
"grad_norm": 0.7157489657402039,
"learning_rate": 7.015706806282722e-05,
"logits/chosen": -3.9314968585968018,
"logits/rejected": -3.872746229171753,
"logps/chosen": -100.2810287475586,
"logps/rejected": -121.5164794921875,
"loss": 0.35974826812744143,
"rewards/accuracies": 0.778124988079071,
"rewards/chosen": -2.0922586917877197,
"rewards/margins": 1.629852533340454,
"rewards/rejected": -3.722111225128174,
"step": 1820
},
{
"epoch": 1.99156462585034,
"grad_norm": 0.6526369452476501,
"learning_rate": 6.94091249065071e-05,
"logits/chosen": -3.94775652885437,
"logits/rejected": -3.8687806129455566,
"logps/chosen": -99.9976577758789,
"logps/rejected": -121.957763671875,
"loss": 0.3599375247955322,
"rewards/accuracies": 0.7945312261581421,
"rewards/chosen": -1.9912713766098022,
"rewards/margins": 1.6352510452270508,
"rewards/rejected": -3.6265225410461426,
"step": 1830
},
{
"epoch": 2.002176870748299,
"grad_norm": 0.49071577191352844,
"learning_rate": 6.866118175018699e-05,
"logits/chosen": -3.9457576274871826,
"logits/rejected": -3.855695962905884,
"logps/chosen": -103.30020904541016,
"logps/rejected": -127.69253540039062,
"loss": 0.32846436500549314,
"rewards/accuracies": 0.8221153616905212,
"rewards/chosen": -2.0800564289093018,
"rewards/margins": 1.746621012687683,
"rewards/rejected": -3.8266773223876953,
"step": 1840
},
{
"epoch": 2.013061224489796,
"grad_norm": 0.5088359713554382,
"learning_rate": 6.791323859386687e-05,
"logits/chosen": -3.9414725303649902,
"logits/rejected": -3.9251086711883545,
"logps/chosen": -101.10342407226562,
"logps/rejected": -126.2572250366211,
"loss": 0.279949951171875,
"rewards/accuracies": 0.839062511920929,
"rewards/chosen": -2.04860258102417,
"rewards/margins": 1.9327900409698486,
"rewards/rejected": -3.9813923835754395,
"step": 1850
},
{
"epoch": 2.0239455782312925,
"grad_norm": 0.5052030682563782,
"learning_rate": 6.716529543754675e-05,
"logits/chosen": -4.173396110534668,
"logits/rejected": -4.081063270568848,
"logps/chosen": -104.18453216552734,
"logps/rejected": -128.5143280029297,
"loss": 0.26949272155761717,
"rewards/accuracies": 0.858593761920929,
"rewards/chosen": -2.204545259475708,
"rewards/margins": 1.9530636072158813,
"rewards/rejected": -4.157608985900879,
"step": 1860
},
{
"epoch": 2.034829931972789,
"grad_norm": 0.4783055782318115,
"learning_rate": 6.641735228122664e-05,
"logits/chosen": -4.18683385848999,
"logits/rejected": -4.042752265930176,
"logps/chosen": -104.73225402832031,
"logps/rejected": -129.3142852783203,
"loss": 0.2710374116897583,
"rewards/accuracies": 0.85546875,
"rewards/chosen": -2.1699516773223877,
"rewards/margins": 2.064490795135498,
"rewards/rejected": -4.234442234039307,
"step": 1870
},
{
"epoch": 2.045714285714286,
"grad_norm": 0.5429951548576355,
"learning_rate": 6.566940912490652e-05,
"logits/chosen": -4.225846290588379,
"logits/rejected": -4.173259735107422,
"logps/chosen": -102.9245834350586,
"logps/rejected": -129.71678161621094,
"loss": 0.2762880563735962,
"rewards/accuracies": 0.844531238079071,
"rewards/chosen": -2.279546022415161,
"rewards/margins": 2.050327777862549,
"rewards/rejected": -4.329874038696289,
"step": 1880
},
{
"epoch": 2.0565986394557823,
"grad_norm": 0.5694318413734436,
"learning_rate": 6.492146596858639e-05,
"logits/chosen": -4.403803825378418,
"logits/rejected": -4.27715539932251,
"logps/chosen": -103.4933853149414,
"logps/rejected": -131.231201171875,
"loss": 0.2582036733627319,
"rewards/accuracies": 0.8687499761581421,
"rewards/chosen": -2.3441028594970703,
"rewards/margins": 2.2010316848754883,
"rewards/rejected": -4.545134544372559,
"step": 1890
},
{
"epoch": 2.067482993197279,
"grad_norm": 0.488471657037735,
"learning_rate": 6.417352281226627e-05,
"logits/chosen": -4.374741554260254,
"logits/rejected": -4.235744476318359,
"logps/chosen": -108.23167419433594,
"logps/rejected": -136.00350952148438,
"loss": 0.2654814004898071,
"rewards/accuracies": 0.844531238079071,
"rewards/chosen": -2.7162108421325684,
"rewards/margins": 2.194584846496582,
"rewards/rejected": -4.910796165466309,
"step": 1900
},
{
"epoch": 2.0783673469387756,
"grad_norm": 0.5405411720275879,
"learning_rate": 6.342557965594615e-05,
"logits/chosen": -4.263213157653809,
"logits/rejected": -4.2035136222839355,
"logps/chosen": -108.0687255859375,
"logps/rejected": -135.1525115966797,
"loss": 0.269286060333252,
"rewards/accuracies": 0.8460937738418579,
"rewards/chosen": -2.618056297302246,
"rewards/margins": 2.1149375438690186,
"rewards/rejected": -4.732994079589844,
"step": 1910
},
{
"epoch": 2.089251700680272,
"grad_norm": 0.5153743624687195,
"learning_rate": 6.267763649962603e-05,
"logits/chosen": -4.374856472015381,
"logits/rejected": -4.3279643058776855,
"logps/chosen": -102.6282958984375,
"logps/rejected": -129.84768676757812,
"loss": 0.27457327842712403,
"rewards/accuracies": 0.83984375,
"rewards/chosen": -2.5648117065429688,
"rewards/margins": 2.1569466590881348,
"rewards/rejected": -4.7217583656311035,
"step": 1920
},
{
"epoch": 2.100136054421769,
"grad_norm": 0.5591779947280884,
"learning_rate": 6.192969334330591e-05,
"logits/chosen": -4.222095489501953,
"logits/rejected": -4.156058311462402,
"logps/chosen": -107.1645736694336,
"logps/rejected": -131.6280059814453,
"loss": 0.2775254726409912,
"rewards/accuracies": 0.8218749761581421,
"rewards/chosen": -2.541388988494873,
"rewards/margins": 2.1209020614624023,
"rewards/rejected": -4.662291526794434,
"step": 1930
},
{
"epoch": 2.1110204081632653,
"grad_norm": 0.47012007236480713,
"learning_rate": 6.118175018698578e-05,
"logits/chosen": -4.261131763458252,
"logits/rejected": -4.192044258117676,
"logps/chosen": -109.32353210449219,
"logps/rejected": -134.66297912597656,
"loss": 0.26659140586853025,
"rewards/accuracies": 0.8531249761581421,
"rewards/chosen": -2.73209810256958,
"rewards/margins": 2.093428134918213,
"rewards/rejected": -4.825526237487793,
"step": 1940
},
{
"epoch": 2.1219047619047617,
"grad_norm": 0.5636943578720093,
"learning_rate": 6.0433807030665666e-05,
"logits/chosen": -4.38666296005249,
"logits/rejected": -4.33133602142334,
"logps/chosen": -107.5749282836914,
"logps/rejected": -132.30654907226562,
"loss": 0.27169456481933596,
"rewards/accuracies": 0.839062511920929,
"rewards/chosen": -2.6706109046936035,
"rewards/margins": 2.161822557449341,
"rewards/rejected": -4.832433223724365,
"step": 1950
},
{
"epoch": 2.1327891156462586,
"grad_norm": 0.5739550590515137,
"learning_rate": 5.968586387434555e-05,
"logits/chosen": -4.306714057922363,
"logits/rejected": -4.2323102951049805,
"logps/chosen": -110.61419677734375,
"logps/rejected": -136.73745727539062,
"loss": 0.2676869869232178,
"rewards/accuracies": 0.85546875,
"rewards/chosen": -2.7505619525909424,
"rewards/margins": 2.1400463581085205,
"rewards/rejected": -4.890608310699463,
"step": 1960
},
{
"epoch": 2.143673469387755,
"grad_norm": 0.5009965896606445,
"learning_rate": 5.893792071802543e-05,
"logits/chosen": -4.33192253112793,
"logits/rejected": -4.311135768890381,
"logps/chosen": -108.64591979980469,
"logps/rejected": -132.796142578125,
"loss": 0.2648327112197876,
"rewards/accuracies": 0.8492187261581421,
"rewards/chosen": -2.6455886363983154,
"rewards/margins": 2.131373882293701,
"rewards/rejected": -4.776961803436279,
"step": 1970
},
{
"epoch": 2.1545578231292515,
"grad_norm": 0.6320508718490601,
"learning_rate": 5.818997756170531e-05,
"logits/chosen": -4.376672267913818,
"logits/rejected": -4.221155643463135,
"logps/chosen": -107.09896087646484,
"logps/rejected": -135.03883361816406,
"loss": 0.2541360855102539,
"rewards/accuracies": 0.8570312261581421,
"rewards/chosen": -2.8258004188537598,
"rewards/margins": 2.2211556434631348,
"rewards/rejected": -5.046955585479736,
"step": 1980
},
{
"epoch": 2.1654421768707484,
"grad_norm": 0.5602008700370789,
"learning_rate": 5.7442034405385194e-05,
"logits/chosen": -4.365457057952881,
"logits/rejected": -4.279487609863281,
"logps/chosen": -110.8012924194336,
"logps/rejected": -138.8103790283203,
"loss": 0.26124260425567625,
"rewards/accuracies": 0.8609374761581421,
"rewards/chosen": -3.039825439453125,
"rewards/margins": 2.225407838821411,
"rewards/rejected": -5.265233039855957,
"step": 1990
},
{
"epoch": 2.176326530612245,
"grad_norm": 0.5244850516319275,
"learning_rate": 5.6694091249065076e-05,
"logits/chosen": -4.355788707733154,
"logits/rejected": -4.297573566436768,
"logps/chosen": -113.49159240722656,
"logps/rejected": -140.8461456298828,
"loss": 0.2652238130569458,
"rewards/accuracies": 0.8359375,
"rewards/chosen": -3.1340157985687256,
"rewards/margins": 2.230769634246826,
"rewards/rejected": -5.364785194396973,
"step": 2000
},
{
"epoch": 2.176326530612245,
"eval_logits/chosen": -4.392631530761719,
"eval_logits/rejected": -4.344852924346924,
"eval_logps/chosen": -113.7379150390625,
"eval_logps/rejected": -135.5451202392578,
"eval_loss": 0.46534663438796997,
"eval_rewards/accuracies": 0.7124999761581421,
"eval_rewards/chosen": -3.413275957107544,
"eval_rewards/margins": 1.556301474571228,
"eval_rewards/rejected": -4.969577789306641,
"eval_runtime": 104.78,
"eval_samples_per_second": 22.905,
"eval_steps_per_second": 2.863,
"step": 2000
},
{
"epoch": 2.1872108843537417,
"grad_norm": 0.6399655342102051,
"learning_rate": 5.594614809274495e-05,
"logits/chosen": -4.25847053527832,
"logits/rejected": -4.194684028625488,
"logps/chosen": -115.2059555053711,
"logps/rejected": -140.93521118164062,
"loss": 0.2672285079956055,
"rewards/accuracies": 0.84375,
"rewards/chosen": -3.0837132930755615,
"rewards/margins": 2.1926894187927246,
"rewards/rejected": -5.276402950286865,
"step": 2010
},
{
"epoch": 2.198095238095238,
"grad_norm": 0.5022415518760681,
"learning_rate": 5.5198204936424834e-05,
"logits/chosen": -4.377929210662842,
"logits/rejected": -4.255377769470215,
"logps/chosen": -108.50428771972656,
"logps/rejected": -137.51651000976562,
"loss": 0.2487508773803711,
"rewards/accuracies": 0.8687499761581421,
"rewards/chosen": -2.958159923553467,
"rewards/margins": 2.2823288440704346,
"rewards/rejected": -5.240488529205322,
"step": 2020
},
{
"epoch": 2.2089795918367345,
"grad_norm": 0.4892471134662628,
"learning_rate": 5.4450261780104716e-05,
"logits/chosen": -4.4286956787109375,
"logits/rejected": -4.3171610832214355,
"logps/chosen": -108.22352600097656,
"logps/rejected": -137.69073486328125,
"loss": 0.25264739990234375,
"rewards/accuracies": 0.850781261920929,
"rewards/chosen": -2.9794039726257324,
"rewards/margins": 2.2621421813964844,
"rewards/rejected": -5.241546154022217,
"step": 2030
},
{
"epoch": 2.2198639455782314,
"grad_norm": 0.5124601125717163,
"learning_rate": 5.37023186237846e-05,
"logits/chosen": -4.357671737670898,
"logits/rejected": -4.335933685302734,
"logps/chosen": -110.78375244140625,
"logps/rejected": -140.46006774902344,
"loss": 0.24789047241210938,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -2.977566957473755,
"rewards/margins": 2.320561170578003,
"rewards/rejected": -5.2981276512146,
"step": 2040
},
{
"epoch": 2.230748299319728,
"grad_norm": 0.590368926525116,
"learning_rate": 5.295437546746448e-05,
"logits/chosen": -4.396256446838379,
"logits/rejected": -4.374178409576416,
"logps/chosen": -108.7447280883789,
"logps/rejected": -136.3175506591797,
"loss": 0.27484884262084963,
"rewards/accuracies": 0.8359375,
"rewards/chosen": -2.8392646312713623,
"rewards/margins": 2.158670663833618,
"rewards/rejected": -4.9979352951049805,
"step": 2050
},
{
"epoch": 2.2416326530612247,
"grad_norm": 0.5153351426124573,
"learning_rate": 5.220643231114436e-05,
"logits/chosen": -4.382789134979248,
"logits/rejected": -4.334689140319824,
"logps/chosen": -108.401611328125,
"logps/rejected": -137.27871704101562,
"loss": 0.2631440877914429,
"rewards/accuracies": 0.840624988079071,
"rewards/chosen": -2.8784780502319336,
"rewards/margins": 2.264145612716675,
"rewards/rejected": -5.1426239013671875,
"step": 2060
},
{
"epoch": 2.252517006802721,
"grad_norm": 0.5086898803710938,
"learning_rate": 5.145848915482424e-05,
"logits/chosen": -4.282557487487793,
"logits/rejected": -4.198935508728027,
"logps/chosen": -107.8048095703125,
"logps/rejected": -135.6783905029297,
"loss": 0.26320858001708985,
"rewards/accuracies": 0.8515625,
"rewards/chosen": -2.7925009727478027,
"rewards/margins": 2.1981430053710938,
"rewards/rejected": -4.990644454956055,
"step": 2070
},
{
"epoch": 2.2634013605442176,
"grad_norm": 0.5398783683776855,
"learning_rate": 5.0710545998504114e-05,
"logits/chosen": -4.345008850097656,
"logits/rejected": -4.317435264587402,
"logps/chosen": -106.77925872802734,
"logps/rejected": -136.1848907470703,
"loss": 0.2555952787399292,
"rewards/accuracies": 0.8570312261581421,
"rewards/chosen": -2.866353988647461,
"rewards/margins": 2.281134843826294,
"rewards/rejected": -5.147488594055176,
"step": 2080
},
{
"epoch": 2.2742857142857145,
"grad_norm": 0.4644974172115326,
"learning_rate": 4.9962602842183996e-05,
"logits/chosen": -4.256831169128418,
"logits/rejected": -4.2593584060668945,
"logps/chosen": -106.45500183105469,
"logps/rejected": -136.2468719482422,
"loss": 0.26251227855682374,
"rewards/accuracies": 0.84765625,
"rewards/chosen": -2.910574436187744,
"rewards/margins": 2.2922780513763428,
"rewards/rejected": -5.202852725982666,
"step": 2090
},
{
"epoch": 2.285170068027211,
"grad_norm": 0.38658151030540466,
"learning_rate": 4.921465968586388e-05,
"logits/chosen": -4.299098491668701,
"logits/rejected": -4.222846984863281,
"logps/chosen": -111.60084533691406,
"logps/rejected": -139.23606872558594,
"loss": 0.26093616485595705,
"rewards/accuracies": 0.8460937738418579,
"rewards/chosen": -2.9908206462860107,
"rewards/margins": 2.2845864295959473,
"rewards/rejected": -5.275406837463379,
"step": 2100
},
{
"epoch": 2.2960544217687073,
"grad_norm": 0.5244455933570862,
"learning_rate": 4.846671652954376e-05,
"logits/chosen": -4.305111408233643,
"logits/rejected": -4.2441325187683105,
"logps/chosen": -105.7240982055664,
"logps/rejected": -132.33541870117188,
"loss": 0.26281836032867434,
"rewards/accuracies": 0.8578125238418579,
"rewards/chosen": -2.8944408893585205,
"rewards/margins": 2.207293748855591,
"rewards/rejected": -5.1017351150512695,
"step": 2110
},
{
"epoch": 2.306938775510204,
"grad_norm": 0.5264010429382324,
"learning_rate": 4.7718773373223636e-05,
"logits/chosen": -4.359262943267822,
"logits/rejected": -4.287570476531982,
"logps/chosen": -107.4122085571289,
"logps/rejected": -135.27484130859375,
"loss": 0.279754638671875,
"rewards/accuracies": 0.821093738079071,
"rewards/chosen": -2.8419368267059326,
"rewards/margins": 2.1469409465789795,
"rewards/rejected": -4.98887825012207,
"step": 2120
},
{
"epoch": 2.3178231292517006,
"grad_norm": 0.6190440058708191,
"learning_rate": 4.697083021690352e-05,
"logits/chosen": -4.3371100425720215,
"logits/rejected": -4.2610368728637695,
"logps/chosen": -109.62430572509766,
"logps/rejected": -136.06649780273438,
"loss": 0.27123911380767823,
"rewards/accuracies": 0.8414062261581421,
"rewards/chosen": -2.924973487854004,
"rewards/margins": 2.1363399028778076,
"rewards/rejected": -5.061313152313232,
"step": 2130
},
{
"epoch": 2.328707482993197,
"grad_norm": 0.4766679108142853,
"learning_rate": 4.62228870605834e-05,
"logits/chosen": -4.276871681213379,
"logits/rejected": -4.208295822143555,
"logps/chosen": -110.64579010009766,
"logps/rejected": -139.74888610839844,
"loss": 0.24541153907775878,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": -2.862879991531372,
"rewards/margins": 2.3135013580322266,
"rewards/rejected": -5.176381587982178,
"step": 2140
},
{
"epoch": 2.339591836734694,
"grad_norm": 0.4791225492954254,
"learning_rate": 4.5474943904263275e-05,
"logits/chosen": -4.355441093444824,
"logits/rejected": -4.288341522216797,
"logps/chosen": -105.79945373535156,
"logps/rejected": -131.28944396972656,
"loss": 0.27122857570648196,
"rewards/accuracies": 0.8414062261581421,
"rewards/chosen": -2.718742609024048,
"rewards/margins": 2.105710744857788,
"rewards/rejected": -4.824452877044678,
"step": 2150
},
{
"epoch": 2.3504761904761904,
"grad_norm": 0.6803158521652222,
"learning_rate": 4.472700074794316e-05,
"logits/chosen": -4.416818141937256,
"logits/rejected": -4.399478435516357,
"logps/chosen": -105.3951187133789,
"logps/rejected": -134.6707763671875,
"loss": 0.25935161113739014,
"rewards/accuracies": 0.846875011920929,
"rewards/chosen": -2.693054676055908,
"rewards/margins": 2.30621337890625,
"rewards/rejected": -4.999267578125,
"step": 2160
},
{
"epoch": 2.3613605442176873,
"grad_norm": 0.5753185749053955,
"learning_rate": 4.397905759162304e-05,
"logits/chosen": -4.324499607086182,
"logits/rejected": -4.302281856536865,
"logps/chosen": -108.54312896728516,
"logps/rejected": -138.02798461914062,
"loss": 0.24565551280975342,
"rewards/accuracies": 0.85546875,
"rewards/chosen": -2.722982883453369,
"rewards/margins": 2.3493704795837402,
"rewards/rejected": -5.072353363037109,
"step": 2170
},
{
"epoch": 2.3722448979591837,
"grad_norm": 0.5277524590492249,
"learning_rate": 4.323111443530292e-05,
"logits/chosen": -4.220860481262207,
"logits/rejected": -4.199186325073242,
"logps/chosen": -109.83711242675781,
"logps/rejected": -138.1239013671875,
"loss": 0.2549403429031372,
"rewards/accuracies": 0.854687511920929,
"rewards/chosen": -2.7489871978759766,
"rewards/margins": 2.2629806995391846,
"rewards/rejected": -5.011967658996582,
"step": 2180
},
{
"epoch": 2.38312925170068,
"grad_norm": 0.6214152574539185,
"learning_rate": 4.24831712789828e-05,
"logits/chosen": -4.419411659240723,
"logits/rejected": -4.302346706390381,
"logps/chosen": -109.27337646484375,
"logps/rejected": -137.83436584472656,
"loss": 0.25436248779296877,
"rewards/accuracies": 0.852343738079071,
"rewards/chosen": -2.788382053375244,
"rewards/margins": 2.3577487468719482,
"rewards/rejected": -5.1461310386657715,
"step": 2190
},
{
"epoch": 2.394013605442177,
"grad_norm": 0.6792303323745728,
"learning_rate": 4.173522812266268e-05,
"logits/chosen": -4.336219787597656,
"logits/rejected": -4.238919258117676,
"logps/chosen": -107.77840423583984,
"logps/rejected": -135.3695831298828,
"loss": 0.26418342590332033,
"rewards/accuracies": 0.84375,
"rewards/chosen": -2.842252492904663,
"rewards/margins": 2.2352678775787354,
"rewards/rejected": -5.077520847320557,
"step": 2200
},
{
"epoch": 2.4048979591836734,
"grad_norm": 0.5071048736572266,
"learning_rate": 4.098728496634256e-05,
"logits/chosen": -4.275275230407715,
"logits/rejected": -4.160519599914551,
"logps/chosen": -108.19576263427734,
"logps/rejected": -135.44322204589844,
"loss": 0.25397777557373047,
"rewards/accuracies": 0.8500000238418579,
"rewards/chosen": -2.940242052078247,
"rewards/margins": 2.3158531188964844,
"rewards/rejected": -5.256094932556152,
"step": 2210
},
{
"epoch": 2.4157823129251703,
"grad_norm": 0.5598253607749939,
"learning_rate": 4.0239341810022444e-05,
"logits/chosen": -4.34271240234375,
"logits/rejected": -4.281783103942871,
"logps/chosen": -111.84043884277344,
"logps/rejected": -139.2178497314453,
"loss": 0.25306150913238523,
"rewards/accuracies": 0.8453124761581421,
"rewards/chosen": -2.9429874420166016,
"rewards/margins": 2.3303146362304688,
"rewards/rejected": -5.27330207824707,
"step": 2220
},
{
"epoch": 2.4266666666666667,
"grad_norm": 0.4812939763069153,
"learning_rate": 3.949139865370232e-05,
"logits/chosen": -4.2378034591674805,
"logits/rejected": -4.214576244354248,
"logps/chosen": -108.81040954589844,
"logps/rejected": -136.83827209472656,
"loss": 0.26318118572235105,
"rewards/accuracies": 0.8421875238418579,
"rewards/chosen": -2.9642369747161865,
"rewards/margins": 2.3236169815063477,
"rewards/rejected": -5.287853717803955,
"step": 2230
},
{
"epoch": 2.437551020408163,
"grad_norm": 0.5383220314979553,
"learning_rate": 3.87434554973822e-05,
"logits/chosen": -4.168697357177734,
"logits/rejected": -4.0632429122924805,
"logps/chosen": -113.34503173828125,
"logps/rejected": -140.87977600097656,
"loss": 0.2669438362121582,
"rewards/accuracies": 0.8453124761581421,
"rewards/chosen": -3.066909074783325,
"rewards/margins": 2.23907470703125,
"rewards/rejected": -5.305983066558838,
"step": 2240
},
{
"epoch": 2.4484353741496596,
"grad_norm": 0.4986330270767212,
"learning_rate": 3.799551234106208e-05,
"logits/chosen": -4.118273735046387,
"logits/rejected": -4.0370354652404785,
"logps/chosen": -110.60295104980469,
"logps/rejected": -138.21926879882812,
"loss": 0.26406409740448,
"rewards/accuracies": 0.850781261920929,
"rewards/chosen": -2.9518330097198486,
"rewards/margins": 2.2067174911499023,
"rewards/rejected": -5.158550262451172,
"step": 2250
},
{
"epoch": 2.4593197278911565,
"grad_norm": 0.5483224391937256,
"learning_rate": 3.724756918474196e-05,
"logits/chosen": -4.164062023162842,
"logits/rejected": -4.178997993469238,
"logps/chosen": -112.80091857910156,
"logps/rejected": -140.44825744628906,
"loss": 0.25186111927032473,
"rewards/accuracies": 0.8570312261581421,
"rewards/chosen": -3.0120620727539062,
"rewards/margins": 2.2925403118133545,
"rewards/rejected": -5.30460262298584,
"step": 2260
},
{
"epoch": 2.470204081632653,
"grad_norm": 0.49677279591560364,
"learning_rate": 3.649962602842184e-05,
"logits/chosen": -4.339353561401367,
"logits/rejected": -4.249403953552246,
"logps/chosen": -110.08421325683594,
"logps/rejected": -137.5714569091797,
"loss": 0.25184576511383056,
"rewards/accuracies": 0.848437488079071,
"rewards/chosen": -3.0821781158447266,
"rewards/margins": 2.328827381134033,
"rewards/rejected": -5.411005020141602,
"step": 2270
},
{
"epoch": 2.48108843537415,
"grad_norm": 0.5725961923599243,
"learning_rate": 3.5751682872101724e-05,
"logits/chosen": -4.2684502601623535,
"logits/rejected": -4.1795573234558105,
"logps/chosen": -113.55293273925781,
"logps/rejected": -142.6102752685547,
"loss": 0.24979727268218993,
"rewards/accuracies": 0.8492187261581421,
"rewards/chosen": -3.1018178462982178,
"rewards/margins": 2.409865617752075,
"rewards/rejected": -5.511682987213135,
"step": 2280
},
{
"epoch": 2.4919727891156462,
"grad_norm": 0.5567153096199036,
"learning_rate": 3.5003739715781606e-05,
"logits/chosen": -4.302936553955078,
"logits/rejected": -4.220743656158447,
"logps/chosen": -107.4947738647461,
"logps/rejected": -135.80044555664062,
"loss": 0.2599829435348511,
"rewards/accuracies": 0.8359375,
"rewards/chosen": -2.999293804168701,
"rewards/margins": 2.2999939918518066,
"rewards/rejected": -5.299286842346191,
"step": 2290
},
{
"epoch": 2.5028571428571427,
"grad_norm": 0.46114829182624817,
"learning_rate": 3.425579655946148e-05,
"logits/chosen": -4.257116794586182,
"logits/rejected": -4.284517765045166,
"logps/chosen": -109.46214294433594,
"logps/rejected": -138.5498809814453,
"loss": 0.262731671333313,
"rewards/accuracies": 0.8414062261581421,
"rewards/chosen": -3.0271120071411133,
"rewards/margins": 2.3265421390533447,
"rewards/rejected": -5.353653907775879,
"step": 2300
},
{
"epoch": 2.5137414965986395,
"grad_norm": 0.5548444390296936,
"learning_rate": 3.350785340314136e-05,
"logits/chosen": -4.13088321685791,
"logits/rejected": -4.090167045593262,
"logps/chosen": -112.9273681640625,
"logps/rejected": -140.58865356445312,
"loss": 0.26635379791259767,
"rewards/accuracies": 0.840624988079071,
"rewards/chosen": -3.1592650413513184,
"rewards/margins": 2.2824602127075195,
"rewards/rejected": -5.441725730895996,
"step": 2310
},
{
"epoch": 2.524625850340136,
"grad_norm": 0.6786127686500549,
"learning_rate": 3.275991024682124e-05,
"logits/chosen": -4.259942531585693,
"logits/rejected": -4.2501912117004395,
"logps/chosen": -113.3272476196289,
"logps/rejected": -140.26583862304688,
"loss": 0.26966152191162107,
"rewards/accuracies": 0.8382812738418579,
"rewards/chosen": -3.1748275756835938,
"rewards/margins": 2.2647013664245605,
"rewards/rejected": -5.439528942108154,
"step": 2320
},
{
"epoch": 2.535510204081633,
"grad_norm": 0.5421922206878662,
"learning_rate": 3.201196709050112e-05,
"logits/chosen": -4.2332868576049805,
"logits/rejected": -4.159974098205566,
"logps/chosen": -112.0591049194336,
"logps/rejected": -142.06764221191406,
"loss": 0.26064703464508054,
"rewards/accuracies": 0.842968761920929,
"rewards/chosen": -3.2271761894226074,
"rewards/margins": 2.313660144805908,
"rewards/rejected": -5.540836334228516,
"step": 2330
},
{
"epoch": 2.5463945578231293,
"grad_norm": 0.6206730008125305,
"learning_rate": 3.1264023934181e-05,
"logits/chosen": -4.249005317687988,
"logits/rejected": -4.177195072174072,
"logps/chosen": -110.71000671386719,
"logps/rejected": -138.38018798828125,
"loss": 0.264833927154541,
"rewards/accuracies": 0.8359375,
"rewards/chosen": -3.2622718811035156,
"rewards/margins": 2.270108699798584,
"rewards/rejected": -5.532380104064941,
"step": 2340
},
{
"epoch": 2.5572789115646257,
"grad_norm": 0.6249208450317383,
"learning_rate": 3.0516080777860885e-05,
"logits/chosen": -4.308166980743408,
"logits/rejected": -4.222630977630615,
"logps/chosen": -115.17570495605469,
"logps/rejected": -144.38851928710938,
"loss": 0.2524010896682739,
"rewards/accuracies": 0.856249988079071,
"rewards/chosen": -3.351501941680908,
"rewards/margins": 2.3318376541137695,
"rewards/rejected": -5.683339595794678,
"step": 2350
},
{
"epoch": 2.5681632653061226,
"grad_norm": 0.6504024863243103,
"learning_rate": 2.9768137621540764e-05,
"logits/chosen": -4.296634674072266,
"logits/rejected": -4.280292987823486,
"logps/chosen": -111.20161437988281,
"logps/rejected": -141.90963745117188,
"loss": 0.26886260509490967,
"rewards/accuracies": 0.83984375,
"rewards/chosen": -3.2387752532958984,
"rewards/margins": 2.3250107765197754,
"rewards/rejected": -5.563786506652832,
"step": 2360
},
{
"epoch": 2.579047619047619,
"grad_norm": 0.6845365762710571,
"learning_rate": 2.9020194465220646e-05,
"logits/chosen": -4.261755466461182,
"logits/rejected": -4.167389392852783,
"logps/chosen": -111.0313949584961,
"logps/rejected": -138.18850708007812,
"loss": 0.2643138885498047,
"rewards/accuracies": 0.8335937261581421,
"rewards/chosen": -3.0966439247131348,
"rewards/margins": 2.2732677459716797,
"rewards/rejected": -5.369911193847656,
"step": 2370
},
{
"epoch": 2.589931972789116,
"grad_norm": 0.4879046380519867,
"learning_rate": 2.827225130890053e-05,
"logits/chosen": -4.409466743469238,
"logits/rejected": -4.352431297302246,
"logps/chosen": -106.5313949584961,
"logps/rejected": -137.22837829589844,
"loss": 0.25514419078826905,
"rewards/accuracies": 0.848437488079071,
"rewards/chosen": -2.9418864250183105,
"rewards/margins": 2.351497173309326,
"rewards/rejected": -5.293383598327637,
"step": 2380
},
{
"epoch": 2.6008163265306123,
"grad_norm": 0.5651640892028809,
"learning_rate": 2.7524308152580404e-05,
"logits/chosen": -4.4179205894470215,
"logits/rejected": -4.379713535308838,
"logps/chosen": -108.92497253417969,
"logps/rejected": -137.62344360351562,
"loss": 0.24242501258850097,
"rewards/accuracies": 0.8578125238418579,
"rewards/chosen": -3.073535203933716,
"rewards/margins": 2.418722152709961,
"rewards/rejected": -5.492257118225098,
"step": 2390
},
{
"epoch": 2.6117006802721088,
"grad_norm": 0.523777425289154,
"learning_rate": 2.6776364996260283e-05,
"logits/chosen": -4.350298881530762,
"logits/rejected": -4.247467517852783,
"logps/chosen": -112.7027359008789,
"logps/rejected": -142.613037109375,
"loss": 0.2534715890884399,
"rewards/accuracies": 0.856249988079071,
"rewards/chosen": -3.111325979232788,
"rewards/margins": 2.404831886291504,
"rewards/rejected": -5.516158103942871,
"step": 2400
},
{
"epoch": 2.622585034013605,
"grad_norm": 0.5190083384513855,
"learning_rate": 2.6028421839940165e-05,
"logits/chosen": -4.415008544921875,
"logits/rejected": -4.2630157470703125,
"logps/chosen": -109.89335632324219,
"logps/rejected": -137.45790100097656,
"loss": 0.26002261638641355,
"rewards/accuracies": 0.8382812738418579,
"rewards/chosen": -3.0627522468566895,
"rewards/margins": 2.3217196464538574,
"rewards/rejected": -5.384472370147705,
"step": 2410
},
{
"epoch": 2.633469387755102,
"grad_norm": 0.5784986615180969,
"learning_rate": 2.5280478683620047e-05,
"logits/chosen": -4.250868797302246,
"logits/rejected": -4.1973700523376465,
"logps/chosen": -111.86470794677734,
"logps/rejected": -139.78781127929688,
"loss": 0.25365798473358153,
"rewards/accuracies": 0.852343738079071,
"rewards/chosen": -3.048133611679077,
"rewards/margins": 2.3121330738067627,
"rewards/rejected": -5.36026668548584,
"step": 2420
},
{
"epoch": 2.6443537414965985,
"grad_norm": 0.5177122354507446,
"learning_rate": 2.4532535527299926e-05,
"logits/chosen": -4.4071784019470215,
"logits/rejected": -4.31978702545166,
"logps/chosen": -114.18182373046875,
"logps/rejected": -142.67727661132812,
"loss": 0.24829225540161132,
"rewards/accuracies": 0.8421875238418579,
"rewards/chosen": -3.116865873336792,
"rewards/margins": 2.388279438018799,
"rewards/rejected": -5.50514554977417,
"step": 2430
},
{
"epoch": 2.6552380952380954,
"grad_norm": 0.6798398494720459,
"learning_rate": 2.3784592370979808e-05,
"logits/chosen": -4.312591075897217,
"logits/rejected": -4.273346424102783,
"logps/chosen": -109.682861328125,
"logps/rejected": -138.36782836914062,
"loss": 0.2676241397857666,
"rewards/accuracies": 0.839062511920929,
"rewards/chosen": -2.952719211578369,
"rewards/margins": 2.2746853828430176,
"rewards/rejected": -5.227404594421387,
"step": 2440
},
{
"epoch": 2.666122448979592,
"grad_norm": 0.6012817025184631,
"learning_rate": 2.3036649214659687e-05,
"logits/chosen": -4.368619918823242,
"logits/rejected": -4.296780586242676,
"logps/chosen": -110.58982849121094,
"logps/rejected": -139.80557250976562,
"loss": 0.25081255435943606,
"rewards/accuracies": 0.86328125,
"rewards/chosen": -2.887507915496826,
"rewards/margins": 2.3469045162200928,
"rewards/rejected": -5.23441219329834,
"step": 2450
},
{
"epoch": 2.6770068027210883,
"grad_norm": 0.5708255171775818,
"learning_rate": 2.228870605833957e-05,
"logits/chosen": -4.390729904174805,
"logits/rejected": -4.355556964874268,
"logps/chosen": -107.79595947265625,
"logps/rejected": -134.82522583007812,
"loss": 0.27308039665222167,
"rewards/accuracies": 0.828125,
"rewards/chosen": -2.8849995136260986,
"rewards/margins": 2.2530252933502197,
"rewards/rejected": -5.13802433013916,
"step": 2460
},
{
"epoch": 2.687891156462585,
"grad_norm": 0.47491082549095154,
"learning_rate": 2.1540762902019448e-05,
"logits/chosen": -4.335263729095459,
"logits/rejected": -4.283821105957031,
"logps/chosen": -108.29530334472656,
"logps/rejected": -135.4779815673828,
"loss": 0.2607786417007446,
"rewards/accuracies": 0.856249988079071,
"rewards/chosen": -2.8725428581237793,
"rewards/margins": 2.3250625133514404,
"rewards/rejected": -5.197605133056641,
"step": 2470
},
{
"epoch": 2.6987755102040816,
"grad_norm": 0.5339019298553467,
"learning_rate": 2.0792819745699327e-05,
"logits/chosen": -4.364335060119629,
"logits/rejected": -4.271590709686279,
"logps/chosen": -109.25032043457031,
"logps/rejected": -137.19566345214844,
"loss": 0.25407183170318604,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": -2.983041286468506,
"rewards/margins": 2.2924866676330566,
"rewards/rejected": -5.275527477264404,
"step": 2480
},
{
"epoch": 2.7096598639455785,
"grad_norm": 0.5330259799957275,
"learning_rate": 2.004487658937921e-05,
"logits/chosen": -4.272704601287842,
"logits/rejected": -4.25288724899292,
"logps/chosen": -109.9069595336914,
"logps/rejected": -138.80812072753906,
"loss": 0.25796828269958494,
"rewards/accuracies": 0.858593761920929,
"rewards/chosen": -3.022810697555542,
"rewards/margins": 2.3227627277374268,
"rewards/rejected": -5.3455729484558105,
"step": 2490
},
{
"epoch": 2.720544217687075,
"grad_norm": 0.48291197419166565,
"learning_rate": 1.9296933433059088e-05,
"logits/chosen": -4.345968723297119,
"logits/rejected": -4.260931015014648,
"logps/chosen": -114.93940734863281,
"logps/rejected": -143.88821411132812,
"loss": 0.24913032054901124,
"rewards/accuracies": 0.844531238079071,
"rewards/chosen": -3.0745816230773926,
"rewards/margins": 2.3651044368743896,
"rewards/rejected": -5.439685821533203,
"step": 2500
},
{
"epoch": 2.720544217687075,
"eval_logits/chosen": -4.365705490112305,
"eval_logits/rejected": -4.315591335296631,
"eval_logps/chosen": -113.0962142944336,
"eval_logps/rejected": -135.48565673828125,
"eval_loss": 0.45733407139778137,
"eval_rewards/accuracies": 0.721666693687439,
"eval_rewards/chosen": -3.3491051197052,
"eval_rewards/margins": 1.6145259141921997,
"eval_rewards/rejected": -4.9636311531066895,
"eval_runtime": 104.6509,
"eval_samples_per_second": 22.933,
"eval_steps_per_second": 2.867,
"step": 2500
}
],
"logging_steps": 10,
"max_steps": 2757,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 500,
"stateful_callbacks": {
"EarlyStoppingCallback": {
"args": {
"early_stopping_patience": 3,
"early_stopping_threshold": 0.0
},
"attributes": {
"early_stopping_patience_counter": 0
}
},
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}