Files
aup-fullft-kto_kl-klam0.033…/trainer_state.json

2344 lines
86 KiB
JSON
Raw Normal View History

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 3.0,
"eval_steps": 500,
"global_step": 2316,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.025906735751295335,
"grad_norm": 16.537830352783203,
"kl": 20.99601173400879,
"learning_rate": 1.8999999999999998e-07,
"logits/chosen": -36331023.31968504,
"logits/rejected": -37604871.14418605,
"logps/chosen": -479.68499015748034,
"logps/rejected": -353.2168362403101,
"loss": 0.5789,
"loss/base_kto": 3.9304776191711426,
"loss/total_with_kl": 4.631022930145264,
"metrics/advantage_var": 420.7478942871094,
"regularization/advantage_var": 420.7478942871094,
"regularization/kl": 0.7005452513694763,
"rewards/chosen": 0.28216278797059546,
"rewards/margins": 0.06821970869491717,
"rewards/rejected": 0.2139430792756783,
"step": 20
},
{
"epoch": 0.05181347150259067,
"grad_norm": 15.986422538757324,
"kl": 5.433504581451416,
"learning_rate": 3.8999999999999997e-07,
"logits/chosen": -36267776.0,
"logits/rejected": -36990547.2,
"logps/chosen": -476.61943359375,
"logps/rejected": -412.352294921875,
"loss": 0.5335,
"loss/base_kto": 3.932533025741577,
"loss/total_with_kl": 4.268146991729736,
"metrics/advantage_var": 201.5700225830078,
"regularization/advantage_var": 201.5700225830078,
"regularization/kl": 0.33561408519744873,
"rewards/chosen": -0.014302882552146911,
"rewards/margins": 0.057395032048225395,
"rewards/rejected": -0.07169791460037231,
"step": 40
},
{
"epoch": 0.07772020725388601,
"grad_norm": 15.14694595336914,
"kl": 4.5898332595825195,
"learning_rate": 5.9e-07,
"logits/chosen": -36111591.8490566,
"logits/rejected": -38411314.88198758,
"logps/chosen": -487.9725825471698,
"logps/rejected": -374.0280958850932,
"loss": 0.5208,
"loss/base_kto": 3.8561952114105225,
"loss/total_with_kl": 4.166226387023926,
"metrics/advantage_var": 186.20510864257812,
"regularization/advantage_var": 186.20510864257812,
"regularization/kl": 0.3100314736366272,
"rewards/chosen": 0.0318767859500909,
"rewards/margins": 0.15225735341782187,
"rewards/rejected": -0.12038056746773097,
"step": 60
},
{
"epoch": 0.10362694300518134,
"grad_norm": 16.574857711791992,
"kl": 10.953143119812012,
"learning_rate": 7.9e-07,
"logits/chosen": -37778135.748427674,
"logits/rejected": -37664049.29192547,
"logps/chosen": -503.7589426100629,
"logps/rejected": -382.98825698757764,
"loss": 0.5201,
"loss/base_kto": 3.8481743335723877,
"loss/total_with_kl": 4.160851001739502,
"metrics/advantage_var": 187.7936553955078,
"regularization/advantage_var": 187.7936553955078,
"regularization/kl": 0.31267642974853516,
"rewards/chosen": 0.19398306600702633,
"rewards/margins": 0.13317571944978823,
"rewards/rejected": 0.06080734655723809,
"step": 80
},
{
"epoch": 0.12953367875647667,
"grad_norm": 29.886825561523438,
"kl": 14.196418762207031,
"learning_rate": 9.9e-07,
"logits/chosen": -36849322.666666664,
"logits/rejected": -37452472.57680251,
"logps/chosen": -506.85835280373834,
"logps/rejected": -378.2287911442006,
"loss": 0.5202,
"loss/base_kto": 3.798060178756714,
"loss/total_with_kl": 4.1617608070373535,
"metrics/advantage_var": 218.4387664794922,
"regularization/advantage_var": 218.4387664794922,
"regularization/kl": 0.36370059847831726,
"rewards/chosen": 0.2566196049485251,
"rewards/margins": 0.1754785187408632,
"rewards/rejected": 0.08114108620766189,
"step": 100
},
{
"epoch": 0.15544041450777202,
"grad_norm": 14.523025512695312,
"kl": 8.677205085754395,
"learning_rate": 9.998186234298189e-07,
"logits/chosen": -36201331.14064915,
"logits/rejected": -37661542.319115326,
"logps/chosen": -468.98000386398763,
"logps/rejected": -370.2740422590837,
"loss": 0.5248,
"loss/base_kto": 3.798210859298706,
"loss/total_with_kl": 4.1985764503479,
"metrics/advantage_var": 240.4597930908203,
"regularization/advantage_var": 240.4597930908203,
"regularization/kl": 0.40036556124687195,
"rewards/chosen": 0.13418971773645794,
"rewards/margins": 0.18964537603291948,
"rewards/rejected": -0.05545565829646154,
"step": 120
},
{
"epoch": 0.18134715025906736,
"grad_norm": 17.636444091796875,
"kl": 9.173022270202637,
"learning_rate": 9.992359552107714e-07,
"logits/chosen": -36726727.633027524,
"logits/rejected": -38022880.10223642,
"logps/chosen": -479.09250764525996,
"logps/rejected": -384.2581619408946,
"loss": 0.5267,
"loss/base_kto": 3.7889816761016846,
"loss/total_with_kl": 4.213504314422607,
"metrics/advantage_var": 254.96865844726562,
"regularization/advantage_var": 254.96865844726562,
"regularization/kl": 0.4245227873325348,
"rewards/chosen": 0.1997123974908018,
"rewards/margins": 0.19239941792973037,
"rewards/rejected": 0.007312979561071426,
"step": 140
},
{
"epoch": 0.20725388601036268,
"grad_norm": 15.215126991271973,
"kl": 12.488289833068848,
"learning_rate": 9.982519612796161e-07,
"logits/chosen": -36265196.307692304,
"logits/rejected": -37743466.463492066,
"logps/chosen": -493.04855769230767,
"logps/rejected": -360.37276785714283,
"loss": 0.5221,
"loss/base_kto": 3.7549118995666504,
"loss/total_with_kl": 4.176564693450928,
"metrics/advantage_var": 253.24485778808594,
"regularization/advantage_var": 253.24485778808594,
"regularization/kl": 0.421652615070343,
"rewards/chosen": 0.23179610032301684,
"rewards/margins": 0.23726204985081786,
"rewards/rejected": -0.005465949527801029,
"step": 160
},
{
"epoch": 0.23316062176165803,
"grad_norm": 17.90062141418457,
"kl": 11.389983177185059,
"learning_rate": 9.968674326492213e-07,
"logits/chosen": -36015610.40873635,
"logits/rejected": -36947951.97496088,
"logps/chosen": -525.790025351014,
"logps/rejected": -366.84952073552427,
"loss": 0.5205,
"loss/base_kto": 3.7394680976867676,
"loss/total_with_kl": 4.1636176109313965,
"metrics/advantage_var": 254.74453735351562,
"regularization/advantage_var": 254.74453735351562,
"regularization/kl": 0.42414966225624084,
"rewards/chosen": 0.2547431743461145,
"rewards/margins": 0.23224709267897406,
"rewards/rejected": 0.02249608166714043,
"step": 180
},
{
"epoch": 0.25906735751295334,
"grad_norm": 14.606820106506348,
"kl": 13.57861328125,
"learning_rate": 9.950834823142198e-07,
"logits/chosen": -36329533.27874016,
"logits/rejected": -37751955.64651163,
"logps/chosen": -460.625,
"logps/rejected": -373.60237403100774,
"loss": 0.5201,
"loss/base_kto": 3.7257869243621826,
"loss/total_with_kl": 4.161072254180908,
"metrics/advantage_var": 261.4327392578125,
"regularization/advantage_var": 261.4327392578125,
"regularization/kl": 0.4352855384349823,
"rewards/chosen": 0.25165583092396654,
"rewards/margins": 0.2519974947281317,
"rewards/rejected": -0.0003416638041651526,
"step": 200
},
{
"epoch": 0.2849740932642487,
"grad_norm": 15.993019104003906,
"kl": 10.934139251708984,
"learning_rate": 9.929015443562942e-07,
"logits/chosen": -37423401.18611988,
"logits/rejected": -38687883.49226006,
"logps/chosen": -475.56269716088326,
"logps/rejected": -378.687935371517,
"loss": 0.5129,
"loss/base_kto": 3.7245919704437256,
"loss/total_with_kl": 4.102898597717285,
"metrics/advantage_var": 227.2112274169922,
"regularization/advantage_var": 227.2112274169922,
"regularization/kl": 0.37830671668052673,
"rewards/chosen": 0.23485413560355875,
"rewards/margins": 0.2576988723936991,
"rewards/rejected": -0.022844736790140346,
"step": 220
},
{
"epoch": 0.31088082901554404,
"grad_norm": 14.208782196044922,
"kl": 3.9187302589416504,
"learning_rate": 9.90323372791347e-07,
"logits/chosen": -35056635.0531401,
"logits/rejected": -37595947.119878605,
"logps/chosen": -482.7842190016103,
"logps/rejected": -351.66445371775416,
"loss": 0.5095,
"loss/base_kto": 3.697678327560425,
"loss/total_with_kl": 4.075837135314941,
"metrics/advantage_var": 227.122314453125,
"regularization/advantage_var": 227.122314453125,
"regularization/kl": 0.3781586289405823,
"rewards/chosen": 0.04967179352150639,
"rewards/margins": 0.2854993654077687,
"rewards/rejected": -0.23582757188626233,
"step": 240
},
{
"epoch": 0.33678756476683935,
"grad_norm": 16.923664093017578,
"kl": 5.567387580871582,
"learning_rate": 9.87351040159484e-07,
"logits/chosen": -37492409.741324924,
"logits/rejected": -37807310.06811146,
"logps/chosen": -484.5050276025237,
"logps/rejected": -390.71084075077397,
"loss": 0.5169,
"loss/base_kto": 3.747518539428711,
"loss/total_with_kl": 4.134842872619629,
"metrics/advantage_var": 232.62698364257812,
"regularization/advantage_var": 232.62698364257812,
"regularization/kl": 0.38732391595840454,
"rewards/chosen": 0.03686676867752797,
"rewards/margins": 0.24184379829488478,
"rewards/rejected": -0.2049770296173568,
"step": 260
},
{
"epoch": 0.3626943005181347,
"grad_norm": 13.19844913482666,
"kl": 10.004745483398438,
"learning_rate": 9.839869358589396e-07,
"logits/chosen": -37259758.77675841,
"logits/rejected": -38464577.4313099,
"logps/chosen": -492.9337729357798,
"logps/rejected": -376.2843949680511,
"loss": 0.5165,
"loss/base_kto": 3.7302138805389404,
"loss/total_with_kl": 4.13217306137085,
"metrics/advantage_var": 241.4169921875,
"regularization/advantage_var": 241.4169921875,
"regularization/kl": 0.40195927023887634,
"rewards/chosen": 0.22754428875191132,
"rewards/margins": 0.26821775490723465,
"rewards/rejected": -0.04067346615532336,
"step": 280
},
{
"epoch": 0.38860103626943004,
"grad_norm": 10.370858192443848,
"kl": 8.129781723022461,
"learning_rate": 9.80233764225289e-07,
"logits/chosen": -35331912.4992,
"logits/rejected": -36473516.751145035,
"logps/chosen": -496.1955,
"logps/rejected": -397.9780057251908,
"loss": 0.5201,
"loss/base_kto": 3.7339470386505127,
"loss/total_with_kl": 4.160952091217041,
"metrics/advantage_var": 256.45947265625,
"regularization/advantage_var": 256.45947265625,
"regularization/kl": 0.4270050525665283,
"rewards/chosen": 0.1226624755859375,
"rewards/margins": 0.256651463166448,
"rewards/rejected": -0.1339889875805105,
"step": 300
},
{
"epoch": 0.41450777202072536,
"grad_norm": 18.85415267944336,
"kl": 6.334065914154053,
"learning_rate": 9.760945423574868e-07,
"logits/chosen": -35705573.51724138,
"logits/rejected": -36782858.367601246,
"logps/chosen": -471.8168593260188,
"logps/rejected": -366.6216413551402,
"loss": 0.5193,
"loss/base_kto": 3.683685302734375,
"loss/total_with_kl": 4.1541266441345215,
"metrics/advantage_var": 282.54736328125,
"regularization/advantage_var": 282.54736328125,
"regularization/kl": 0.47044140100479126,
"rewards/chosen": 0.08399816291832998,
"rewards/margins": 0.31805401179756476,
"rewards/rejected": -0.2340558488792348,
"step": 320
},
{
"epoch": 0.44041450777202074,
"grad_norm": 15.948773384094238,
"kl": 14.533068656921387,
"learning_rate": 9.71572597692482e-07,
"logits/chosen": -36502211.156950675,
"logits/rejected": -37504350.271685764,
"logps/chosen": -455.46337817638266,
"logps/rejected": -359.12193126022913,
"loss": 0.5115,
"loss/base_kto": 3.6408157348632812,
"loss/total_with_kl": 4.092252254486084,
"metrics/advantage_var": 271.1326904296875,
"regularization/advantage_var": 271.1326904296875,
"regularization/kl": 0.45143595337867737,
"rewards/chosen": 0.28905634174432454,
"rewards/margins": 0.3318007051326608,
"rewards/rejected": -0.04274436338833623,
"step": 340
},
{
"epoch": 0.46632124352331605,
"grad_norm": 16.080219268798828,
"kl": 13.947799682617188,
"learning_rate": 9.666715653303588e-07,
"logits/chosen": -35981587.692307696,
"logits/rejected": -36368252.87804878,
"logps/chosen": -483.78074919871796,
"logps/rejected": -374.1924066310976,
"loss": 0.5124,
"loss/base_kto": 3.667691946029663,
"loss/total_with_kl": 4.099027633666992,
"metrics/advantage_var": 259.0605163574219,
"regularization/advantage_var": 259.0605163574219,
"regularization/kl": 0.43133577704429626,
"rewards/chosen": 0.25421406672551083,
"rewards/margins": 0.29900450039983467,
"rewards/rejected": -0.04479043367432385,
"step": 360
},
{
"epoch": 0.49222797927461137,
"grad_norm": 21.614364624023438,
"kl": 12.22073745727539,
"learning_rate": 9.613953851121528e-07,
"logits/chosen": -37742965.21898928,
"logits/rejected": -37564559.71929824,
"logps/chosen": -482.3780627871363,
"logps/rejected": -372.8219946172249,
"loss": 0.5222,
"loss/base_kto": 3.696674346923828,
"loss/total_with_kl": 4.177842140197754,
"metrics/advantage_var": 288.9895935058594,
"regularization/advantage_var": 288.9895935058594,
"regularization/kl": 0.4811677038669586,
"rewards/chosen": 0.20185038871823555,
"rewards/margins": 0.28784650850795535,
"rewards/rejected": -0.08599611978971977,
"step": 380
},
{
"epoch": 0.5181347150259067,
"grad_norm": 25.629762649536133,
"kl": 5.442298412322998,
"learning_rate": 9.557482984526924e-07,
"logits/chosen": -36602081.3136289,
"logits/rejected": -38403513.03725783,
"logps/chosen": -492.5006670771757,
"logps/rejected": -376.49224571535024,
"loss": 0.5199,
"loss/base_kto": 3.730147123336792,
"loss/total_with_kl": 4.159346580505371,
"metrics/advantage_var": 257.77734375,
"regularization/advantage_var": 257.77734375,
"regularization/kl": 0.4291992783546448,
"rewards/chosen": 0.03159951459010834,
"rewards/margins": 0.25040941272779926,
"rewards/rejected": -0.21880989813769094,
"step": 400
},
{
"epoch": 0.5440414507772021,
"grad_norm": 15.508956909179688,
"kl": 6.528402805328369,
"learning_rate": 9.497348449310107e-07,
"logits/chosen": -36286199.741935484,
"logits/rejected": -36577885.60890302,
"logps/chosen": -490.13608870967744,
"logps/rejected": -368.38235294117646,
"loss": 0.5175,
"loss/base_kto": 3.636345624923706,
"loss/total_with_kl": 4.1403422355651855,
"metrics/advantage_var": 302.70098876953125,
"regularization/advantage_var": 302.70098876953125,
"regularization/kl": 0.5039971470832825,
"rewards/chosen": 0.15539588283650155,
"rewards/margins": 0.3653011706352148,
"rewards/rejected": -0.20990528779871323,
"step": 420
},
{
"epoch": 0.5699481865284974,
"grad_norm": 15.6985502243042,
"kl": 8.336493492126465,
"learning_rate": 9.433598586410701e-07,
"logits/chosen": -35088697.65765766,
"logits/rejected": -38028051.17915309,
"logps/chosen": -507.7996433933934,
"logps/rejected": -362.4643729641694,
"loss": 0.5211,
"loss/base_kto": 3.701464891433716,
"loss/total_with_kl": 4.16871976852417,
"metrics/advantage_var": 280.633544921875,
"regularization/advantage_var": 280.633544921875,
"regularization/kl": 0.4672548472881317,
"rewards/chosen": 0.14615589863545186,
"rewards/margins": 0.3055379266249419,
"rewards/rejected": -0.15938202798949003,
"step": 440
},
{
"epoch": 0.5958549222797928,
"grad_norm": 16.868915557861328,
"kl": 15.688308715820312,
"learning_rate": 9.366284643057313e-07,
"logits/chosen": -35149326.01610306,
"logits/rejected": -36754408.69195751,
"logps/chosen": -472.32352053140096,
"logps/rejected": -353.294812215478,
"loss": 0.5178,
"loss/base_kto": 3.7071945667266846,
"loss/total_with_kl": 4.142777919769287,
"metrics/advantage_var": 261.61181640625,
"regularization/advantage_var": 261.61181640625,
"regularization/kl": 0.4355836510658264,
"rewards/chosen": 0.2514052828728865,
"rewards/margins": 0.2728425848559456,
"rewards/rejected": -0.021437301983059084,
"step": 460
},
{
"epoch": 0.6217616580310881,
"grad_norm": 11.048973083496094,
"kl": 5.838799476623535,
"learning_rate": 9.295460731570917e-07,
"logits/chosen": -36868629.40192926,
"logits/rejected": -37682253.811550155,
"logps/chosen": -484.14328778135047,
"logps/rejected": -388.22701367781156,
"loss": 0.5122,
"loss/base_kto": 3.668853759765625,
"loss/total_with_kl": 4.09730863571167,
"metrics/advantage_var": 257.3302307128906,
"regularization/advantage_var": 257.3302307128906,
"regularization/kl": 0.42845478653907776,
"rewards/chosen": 0.09705469309325387,
"rewards/margins": 0.313090947605032,
"rewards/rejected": -0.2160362545117781,
"step": 480
},
{
"epoch": 0.6476683937823834,
"grad_norm": 26.0384464263916,
"kl": 7.713786602020264,
"learning_rate": 9.221183785865056e-07,
"logits/chosen": -36236119.9752322,
"logits/rejected": -37724476.56782334,
"logps/chosen": -498.0817530959752,
"logps/rejected": -356.036597988959,
"loss": 0.5166,
"loss/base_kto": 3.686602830886841,
"loss/total_with_kl": 4.132496356964111,
"metrics/advantage_var": 267.8038024902344,
"regularization/advantage_var": 267.8038024902344,
"regularization/kl": 0.4458933472633362,
"rewards/chosen": 0.1319815573677559,
"rewards/margins": 0.2882677789411614,
"rewards/rejected": -0.15628622157340546,
"step": 500
},
{
"epoch": 0.6735751295336787,
"grad_norm": 11.767626762390137,
"kl": 10.853642463684082,
"learning_rate": 9.143513515677817e-07,
"logits/chosen": -36151056.17257319,
"logits/rejected": -36493139.980982564,
"logps/chosen": -485.22404661016947,
"logps/rejected": -367.3628169572108,
"loss": 0.514,
"loss/base_kto": 3.650493621826172,
"loss/total_with_kl": 4.112260341644287,
"metrics/advantage_var": 277.3372497558594,
"regularization/advantage_var": 277.3372497558594,
"regularization/kl": 0.4617665410041809,
"rewards/chosen": 0.22506149597638192,
"rewards/margins": 0.32605570885694724,
"rewards/rejected": -0.10099421288056533,
"step": 520
},
{
"epoch": 0.6994818652849741,
"grad_norm": 17.659984588623047,
"kl": 20.0924072265625,
"learning_rate": 9.062512358572373e-07,
"logits/chosen": -37527906.69879518,
"logits/rejected": -37452075.22077922,
"logps/chosen": -479.65342620481925,
"logps/rejected": -357.5139255275974,
"loss": 0.5092,
"loss/base_kto": 3.613422155380249,
"loss/total_with_kl": 4.073502540588379,
"metrics/advantage_var": 276.324462890625,
"regularization/advantage_var": 276.324462890625,
"regularization/kl": 0.46008023619651794,
"rewards/chosen": 0.37712696948683405,
"rewards/margins": 0.3512136504564687,
"rewards/rejected": 0.025913319030365388,
"step": 540
},
{
"epoch": 0.7253886010362695,
"grad_norm": 17.75587272644043,
"kl": 19.05929183959961,
"learning_rate": 8.978245429744691e-07,
"logits/chosen": -36423829.853658535,
"logits/rejected": -38204685.12820513,
"logps/chosen": -465.6052305640244,
"logps/rejected": -347.2238581730769,
"loss": 0.5168,
"loss/base_kto": 3.6852288246154785,
"loss/total_with_kl": 4.134213447570801,
"metrics/advantage_var": 269.6606140136719,
"regularization/advantage_var": 269.6606140136719,
"regularization/kl": 0.44898486137390137,
"rewards/chosen": 0.3508343347689001,
"rewards/margins": 0.277042836975947,
"rewards/rejected": 0.0737914977929531,
"step": 560
},
{
"epoch": 0.7512953367875648,
"grad_norm": 16.573986053466797,
"kl": 24.6936092376709,
"learning_rate": 8.890780469678738e-07,
"logits/chosen": -38083644.23529412,
"logits/rejected": -39725339.306666665,
"logps/chosen": -472.7370404411765,
"logps/rejected": -384.35723958333335,
"loss": 0.5203,
"loss/base_kto": 3.684603214263916,
"loss/total_with_kl": 4.162057399749756,
"metrics/advantage_var": 286.75927734375,
"regularization/advantage_var": 286.75927734375,
"regularization/kl": 0.47745418548583984,
"rewards/chosen": 0.43507479499368107,
"rewards/margins": 0.24651265611835554,
"rewards/rejected": 0.18856213887532552,
"step": 580
},
{
"epoch": 0.7772020725388601,
"grad_norm": 17.07406997680664,
"kl": 24.37955665588379,
"learning_rate": 8.800187789691269e-07,
"logits/chosen": -37937413.51384615,
"logits/rejected": -37525526.755555555,
"logps/chosen": -448.4246153846154,
"logps/rejected": -393.0105406746032,
"loss": 0.5137,
"loss/base_kto": 3.678205966949463,
"loss/total_with_kl": 4.109408855438232,
"metrics/advantage_var": 258.98077392578125,
"regularization/advantage_var": 258.98077392578125,
"regularization/kl": 0.4312029778957367,
"rewards/chosen": 0.434171142578125,
"rewards/margins": 0.2800571792844742,
"rewards/rejected": 0.1541139632936508,
"step": 600
},
{
"epoch": 0.8031088082901554,
"grad_norm": 27.32758140563965,
"kl": 25.332792282104492,
"learning_rate": 8.706540215409981e-07,
"logits/chosen": -36482125.283018865,
"logits/rejected": -37889904.89440994,
"logps/chosen": -484.06348270440253,
"logps/rejected": -386.7630046583851,
"loss": 0.516,
"loss/base_kto": 3.6858062744140625,
"loss/total_with_kl": 4.127625942230225,
"metrics/advantage_var": 265.3571472167969,
"regularization/advantage_var": 265.3571472167969,
"regularization/kl": 0.4418196380138397,
"rewards/chosen": 0.4418405976685338,
"rewards/margins": 0.2693183549032848,
"rewards/rejected": 0.17252224276524894,
"step": 620
},
{
"epoch": 0.8290155440414507,
"grad_norm": 11.3949556350708,
"kl": 28.55071449279785,
"learning_rate": 8.609913028230462e-07,
"logits/chosen": -36017894.77221325,
"logits/rejected": -37295334.82602118,
"logps/chosen": -490.53130048465266,
"logps/rejected": -365.21683528744325,
"loss": 0.5115,
"loss/base_kto": 3.6491081714630127,
"loss/total_with_kl": 4.091750621795654,
"metrics/advantage_var": 265.85137939453125,
"regularization/advantage_var": 265.85137939453125,
"regularization/kl": 0.4426425099372864,
"rewards/chosen": 0.4128284361905543,
"rewards/margins": 0.28994236712793614,
"rewards/rejected": 0.12288606906261819,
"step": 640
},
{
"epoch": 0.8549222797927462,
"grad_norm": 15.193487167358398,
"kl": 19.492938995361328,
"learning_rate": 8.510383904798994e-07,
"logits/chosen": -37432749.01529052,
"logits/rejected": -38655659.7571885,
"logps/chosen": -493.74522171253824,
"logps/rejected": -369.65869608626195,
"loss": 0.5145,
"loss/base_kto": 3.6358978748321533,
"loss/total_with_kl": 4.1160454750061035,
"metrics/advantage_var": 288.37677001953125,
"regularization/advantage_var": 288.37677001953125,
"regularization/kl": 0.48014727234840393,
"rewards/chosen": 0.37165909513421014,
"rewards/margins": 0.32228481639230655,
"rewards/rejected": 0.04937427874190358,
"step": 660
},
{
"epoch": 0.8808290155440415,
"grad_norm": 26.08849334716797,
"kl": 22.695865631103516,
"learning_rate": 8.408032854569865e-07,
"logits/chosen": -35710002.7904,
"logits/rejected": -37808418.784732826,
"logps/chosen": -471.93155,
"logps/rejected": -374.5293893129771,
"loss": 0.5082,
"loss/base_kto": 3.6345341205596924,
"loss/total_with_kl": 4.0658087730407715,
"metrics/advantage_var": 259.023681640625,
"regularization/advantage_var": 259.023681640625,
"regularization/kl": 0.4312744140625,
"rewards/chosen": 0.334289599609375,
"rewards/margins": 0.29120993510238996,
"rewards/rejected": 0.043079664506985034,
"step": 680
},
{
"epoch": 0.9067357512953368,
"grad_norm": 11.127323150634766,
"kl": 14.99573802947998,
"learning_rate": 8.302942155487377e-07,
"logits/chosen": -35764466.095846646,
"logits/rejected": -38377709.99388379,
"logps/chosen": -483.01747204472844,
"logps/rejected": -362.012996941896,
"loss": 0.5077,
"loss/base_kto": 3.615683078765869,
"loss/total_with_kl": 4.061391353607178,
"metrics/advantage_var": 267.6928405761719,
"regularization/advantage_var": 267.6928405761719,
"regularization/kl": 0.44570857286453247,
"rewards/chosen": 0.30560897485897565,
"rewards/margins": 0.3548047515154735,
"rewards/rejected": -0.049195776656497874,
"step": 700
},
{
"epoch": 0.9326424870466321,
"grad_norm": 12.544903755187988,
"kl": 5.25020170211792,
"learning_rate": 8.195196287844278e-07,
"logits/chosen": -37378966.51664025,
"logits/rejected": -38261032.62865948,
"logps/chosen": -484.17670364500793,
"logps/rejected": -372.1931818181818,
"loss": 0.5267,
"loss/base_kto": 3.656712770462036,
"loss/total_with_kl": 4.213390827178955,
"metrics/advantage_var": 334.3412170410156,
"regularization/advantage_var": 334.3412170410156,
"regularization/kl": 0.5566781163215637,
"rewards/chosen": 0.03584157759338476,
"rewards/margins": 0.32360517611334333,
"rewards/rejected": -0.2877635985199586,
"step": 720
},
{
"epoch": 0.9585492227979274,
"grad_norm": 14.217246055603027,
"kl": 18.524065017700195,
"learning_rate": 8.08488186636975e-07,
"logits/chosen": -38396444.981132075,
"logits/rejected": -39524243.875776395,
"logps/chosen": -514.2330483490566,
"logps/rejected": -352.86781832298135,
"loss": 0.5154,
"loss/base_kto": 3.6119332313537598,
"loss/total_with_kl": 4.1233439445495605,
"metrics/advantage_var": 307.15313720703125,
"regularization/advantage_var": 307.15313720703125,
"regularization/kl": 0.5114099383354187,
"rewards/chosen": 0.311815729681051,
"rewards/margins": 0.3291521204547531,
"rewards/rejected": -0.017336390773702113,
"step": 740
},
{
"epoch": 0.9844559585492227,
"grad_norm": 16.856353759765625,
"kl": 9.3283109664917,
"learning_rate": 7.972087570601576e-07,
"logits/chosen": -38511310.596491225,
"logits/rejected": -37825042.03369066,
"logps/chosen": -489.4402412280702,
"logps/rejected": -397.62035796324653,
"loss": 0.5151,
"loss/base_kto": 3.7072436809539795,
"loss/total_with_kl": 4.120835781097412,
"metrics/advantage_var": 248.4034881591797,
"regularization/advantage_var": 248.4034881591797,
"regularization/kl": 0.41359183192253113,
"rewards/chosen": 0.10794661185768042,
"rewards/margins": 0.2651011799792707,
"rewards/rejected": -0.15715456812159026,
"step": 760
},
{
"epoch": 1.0103626943005182,
"grad_norm": 17.514570236206055,
"kl": 9.719375610351562,
"learning_rate": 7.856904073598458e-07,
"logits/chosen": -38009808.73846154,
"logits/rejected": -38305022.36942675,
"logps/chosen": -479.805,
"logps/rejected": -400.1239798964968,
"loss": 0.5051,
"loss/base_kto": 3.418736696243286,
"loss/total_with_kl": 4.0411505699157715,
"metrics/advantage_var": 373.8221740722656,
"regularization/advantage_var": 373.8221740722656,
"regularization/kl": 0.6224138736724854,
"rewards/chosen": 0.2725811063326322,
"rewards/margins": 0.5847772183154273,
"rewards/rejected": -0.31219611198279507,
"step": 780
},
{
"epoch": 1.0362694300518134,
"grad_norm": 12.080039978027344,
"kl": 15.027986526489258,
"learning_rate": 7.739423969049761e-07,
"logits/chosen": -38061731.26934984,
"logits/rejected": -37633844.49211357,
"logps/chosen": -465.4192143962848,
"logps/rejected": -385.28916108044166,
"loss": 0.5599,
"loss/base_kto": 3.164376735687256,
"loss/total_with_kl": 4.479323863983154,
"metrics/advantage_var": 789.7579956054688,
"regularization/advantage_var": 789.7579956054688,
"regularization/kl": 1.3149470090866089,
"rewards/chosen": 0.5711726610874613,
"rewards/margins": 0.9308842690114805,
"rewards/rejected": -0.35971160792401913,
"step": 800
},
{
"epoch": 1.0621761658031088,
"grad_norm": 26.646738052368164,
"kl": 12.82618236541748,
"learning_rate": 7.619741696841322e-07,
"logits/chosen": -36088989.79672131,
"logits/rejected": -37796316.84776119,
"logps/chosen": -490.16296106557377,
"logps/rejected": -369.60452425373137,
"loss": 0.5234,
"loss/base_kto": 3.207984209060669,
"loss/total_with_kl": 4.187113285064697,
"metrics/advantage_var": 588.0658569335938,
"regularization/advantage_var": 588.0658569335938,
"regularization/kl": 0.9791294932365417,
"rewards/chosen": 0.44803656906378075,
"rewards/margins": 0.8352686065083936,
"rewards/rejected": -0.3872320374446129,
"step": 820
},
{
"epoch": 1.0880829015544042,
"grad_norm": 24.08795738220215,
"kl": 11.3661470413208,
"learning_rate": 7.497953467137135e-07,
"logits/chosen": -36696518.02232855,
"logits/rejected": -37635173.92955589,
"logps/chosen": -468.5043361244019,
"logps/rejected": -355.8814127105666,
"loss": 0.5215,
"loss/base_kto": 3.134793519973755,
"loss/total_with_kl": 4.172141075134277,
"metrics/advantage_var": 623.0315551757812,
"regularization/advantage_var": 623.0315551757812,
"regularization/kl": 1.037347435951233,
"rewards/chosen": 0.4973068602347488,
"rewards/margins": 0.9334474493427121,
"rewards/rejected": -0.4361405891079633,
"step": 840
},
{
"epoch": 1.1139896373056994,
"grad_norm": 9.80352783203125,
"kl": 7.617015838623047,
"learning_rate": 7.37415718303793e-07,
"logits/chosen": -34527132.90322581,
"logits/rejected": -35678018.71515152,
"logps/chosen": -494.403377016129,
"logps/rejected": -370.2385890151515,
"loss": 0.5081,
"loss/base_kto": 3.1501028537750244,
"loss/total_with_kl": 4.064969539642334,
"metrics/advantage_var": 549.4691772460938,
"regularization/advantage_var": 549.4691772460938,
"regularization/kl": 0.9148662686347961,
"rewards/chosen": 0.4089845718876008,
"rewards/margins": 0.9288768540845704,
"rewards/rejected": -0.5198922821969697,
"step": 860
},
{
"epoch": 1.1398963730569949,
"grad_norm": 29.720600128173828,
"kl": 8.63927936553955,
"learning_rate": 7.248452361878855e-07,
"logits/chosen": -35373025.06344411,
"logits/rejected": -36494829.77346278,
"logps/chosen": -491.7433912386707,
"logps/rejected": -386.94993932038835,
"loss": 0.5123,
"loss/base_kto": 3.148014783859253,
"loss/total_with_kl": 4.098679065704346,
"metrics/advantage_var": 570.9694213867188,
"regularization/advantage_var": 570.9694213867188,
"regularization/kl": 0.9506641626358032,
"rewards/chosen": 0.5039736007275538,
"rewards/margins": 0.9435728446817154,
"rewards/rejected": -0.4395992439541616,
"step": 880
},
{
"epoch": 1.16580310880829,
"grad_norm": 29.414081573486328,
"kl": 20.815481185913086,
"learning_rate": 7.120940055229497e-07,
"logits/chosen": -35595772.83950617,
"logits/rejected": -36601716.658227846,
"logps/chosen": -471.42158564814815,
"logps/rejected": -394.53926028481015,
"loss": 0.5574,
"loss/base_kto": 3.1448068618774414,
"loss/total_with_kl": 4.458906650543213,
"metrics/advantage_var": 789.2491455078125,
"regularization/advantage_var": 789.2491455078125,
"regularization/kl": 1.314099669456482,
"rewards/chosen": 0.6382946909209828,
"rewards/margins": 0.9447758712327411,
"rewards/rejected": -0.3064811803117583,
"step": 900
},
{
"epoch": 1.1917098445595855,
"grad_norm": 26.01615333557129,
"kl": 15.914934158325195,
"learning_rate": 6.991722767660556e-07,
"logits/chosen": -34975544.97805642,
"logits/rejected": -36403914.566978194,
"logps/chosen": -472.46581112852664,
"logps/rejected": -408.1698062694704,
"loss": 0.5317,
"loss/base_kto": 3.1391713619232178,
"loss/total_with_kl": 4.253345012664795,
"metrics/advantage_var": 669.1731567382812,
"regularization/advantage_var": 669.1731567382812,
"regularization/kl": 1.1141732931137085,
"rewards/chosen": 0.5612045814251078,
"rewards/margins": 0.9698403715280575,
"rewards/rejected": -0.40863579010294976,
"step": 920
},
{
"epoch": 1.2176165803108807,
"grad_norm": 17.740093231201172,
"kl": 21.399534225463867,
"learning_rate": 6.860904374342499e-07,
"logits/chosen": -35322617.6,
"logits/rejected": -37008326.4,
"logps/chosen": -469.24599609375,
"logps/rejected": -384.849755859375,
"loss": 0.5626,
"loss/base_kto": 3.1882617473602295,
"loss/total_with_kl": 4.500464916229248,
"metrics/advantage_var": 788.1102294921875,
"regularization/advantage_var": 788.1102294921875,
"regularization/kl": 1.3122034072875977,
"rewards/chosen": 0.6511719703674317,
"rewards/margins": 0.9023769855499268,
"rewards/rejected": -0.2512050151824951,
"step": 940
},
{
"epoch": 1.2435233160621761,
"grad_norm": 22.442768096923828,
"kl": 12.02442455291748,
"learning_rate": 6.7285900375424e-07,
"logits/chosen": -36062712.0743034,
"logits/rejected": -36736658.977917984,
"logps/chosen": -479.61977554179566,
"logps/rejected": -369.4289974369085,
"loss": 0.5109,
"loss/base_kto": 3.197706937789917,
"loss/total_with_kl": 4.087076663970947,
"metrics/advantage_var": 534.15576171875,
"regularization/advantage_var": 534.15576171875,
"regularization/kl": 0.8893694281578064,
"rewards/chosen": 0.47495215448432665,
"rewards/margins": 0.8866932006076508,
"rewards/rejected": -0.41174104612332413,
"step": 960
},
{
"epoch": 1.2694300518134716,
"grad_norm": 12.254045486450195,
"kl": 25.559003829956055,
"learning_rate": 6.594886122086123e-07,
"logits/chosen": -37180858.98432602,
"logits/rejected": -36697757.906542055,
"logps/chosen": -469.63665752351096,
"logps/rejected": -371.635343652648,
"loss": 0.5212,
"loss/base_kto": 3.090243101119995,
"loss/total_with_kl": 4.169286727905273,
"metrics/advantage_var": 648.07421875,
"regularization/advantage_var": 648.07421875,
"regularization/kl": 1.0790436267852783,
"rewards/chosen": 0.8071287149172218,
"rewards/margins": 0.9585992438733647,
"rewards/rejected": -0.1514705289561429,
"step": 980
},
{
"epoch": 1.2953367875647668,
"grad_norm": 19.815689086914062,
"kl": 14.280487060546875,
"learning_rate": 6.459900109853766e-07,
"logits/chosen": -34838058.27522936,
"logits/rejected": -34883070.36421725,
"logps/chosen": -481.26739296636083,
"logps/rejected": -363.7084165335463,
"loss": 0.5205,
"loss/base_kto": 3.2393035888671875,
"loss/total_with_kl": 4.163845062255859,
"metrics/advantage_var": 555.2802124023438,
"regularization/advantage_var": 555.2802124023438,
"regularization/kl": 0.9245415925979614,
"rewards/chosen": 0.544169901343296,
"rewards/margins": 0.8161835076981283,
"rewards/rejected": -0.2720136063548323,
"step": 1000
},
{
"epoch": 1.3212435233160622,
"grad_norm": 19.823097229003906,
"kl": 21.81817054748535,
"learning_rate": 6.323740513377171e-07,
"logits/chosen": -36044031.17152104,
"logits/rejected": -38181488.918429,
"logps/chosen": -485.4643001618123,
"logps/rejected": -362.6658327039275,
"loss": 0.5133,
"loss/base_kto": 3.191328763961792,
"loss/total_with_kl": 4.106320858001709,
"metrics/advantage_var": 549.5450439453125,
"regularization/advantage_var": 549.5450439453125,
"regularization/kl": 0.9149925112724304,
"rewards/chosen": 0.6180900894708232,
"rewards/margins": 0.8244822220945015,
"rewards/rejected": -0.20639213262367825,
"step": 1020
},
{
"epoch": 1.3471502590673574,
"grad_norm": 8.847859382629395,
"kl": 13.577710151672363,
"learning_rate": 6.186516788608865e-07,
"logits/chosen": -35605410.90909091,
"logits/rejected": -37161368.323987536,
"logps/chosen": -480.18221003134795,
"logps/rejected": -396.22765771028037,
"loss": 0.5425,
"loss/base_kto": 3.2130470275878906,
"loss/total_with_kl": 4.340249538421631,
"metrics/advantage_var": 676.9984130859375,
"regularization/advantage_var": 676.9984130859375,
"regularization/kl": 1.1272023916244507,
"rewards/chosen": 0.47794239199647337,
"rewards/margins": 0.831569843480179,
"rewards/rejected": -0.3536274514837057,
"step": 1040
},
{
"epoch": 1.3730569948186528,
"grad_norm": 10.016629219055176,
"kl": 14.0739164352417,
"learning_rate": 6.048339246932652e-07,
"logits/chosen": -36337693.3036566,
"logits/rejected": -37938152.40552995,
"logps/chosen": -474.0241454689984,
"logps/rejected": -374.08172523041475,
"loss": 0.524,
"loss/base_kto": 3.190122365951538,
"loss/total_with_kl": 4.191695690155029,
"metrics/advantage_var": 601.5457763671875,
"regularization/advantage_var": 601.5457763671875,
"regularization/kl": 1.0015738010406494,
"rewards/chosen": 0.5609835820281449,
"rewards/margins": 0.8730009261381679,
"rewards/rejected": -0.312017344110023,
"step": 1060
},
{
"epoch": 1.3989637305699483,
"grad_norm": 26.99571418762207,
"kl": 14.935075759887695,
"learning_rate": 5.909318966486494e-07,
"logits/chosen": -35748702.81481481,
"logits/rejected": -36598557.164556965,
"logps/chosen": -491.79050925925924,
"logps/rejected": -366.63815268987344,
"loss": 0.5187,
"loss/base_kto": 3.191035032272339,
"loss/total_with_kl": 4.149347305297852,
"metrics/advantage_var": 575.5628051757812,
"regularization/advantage_var": 575.5628051757812,
"regularization/kl": 0.9583120346069336,
"rewards/chosen": 0.5541232073748553,
"rewards/margins": 0.8421052788771546,
"rewards/rejected": -0.28798207150229926,
"step": 1080
},
{
"epoch": 1.4248704663212435,
"grad_norm": 25.332813262939453,
"kl": 19.600326538085938,
"learning_rate": 5.769567702869052e-07,
"logits/chosen": -35614053.78313253,
"logits/rejected": -37066319.79220779,
"logps/chosen": -474.968938253012,
"logps/rejected": -362.3044592126623,
"loss": 0.5097,
"loss/base_kto": 3.144695997238159,
"loss/total_with_kl": 4.077559947967529,
"metrics/advantage_var": 560.2787475585938,
"regularization/advantage_var": 560.2787475585938,
"regularization/kl": 0.9328641891479492,
"rewards/chosen": 0.6686081484139684,
"rewards/margins": 0.910741945403112,
"rewards/rejected": -0.24213379698914367,
"step": 1100
},
{
"epoch": 1.450777202072539,
"grad_norm": 15.155717849731445,
"kl": 20.27742576599121,
"learning_rate": 5.629197799301614e-07,
"logits/chosen": -34903524.07272727,
"logits/rejected": -36508767.79354839,
"logps/chosen": -472.25364583333334,
"logps/rejected": -385.275,
"loss": 0.4985,
"loss/base_kto": 3.2158966064453125,
"loss/total_with_kl": 3.988041400909424,
"metrics/advantage_var": 463.75030517578125,
"regularization/advantage_var": 463.75030517578125,
"regularization/kl": 0.7721441984176636,
"rewards/chosen": 0.6540827433268229,
"rewards/margins": 0.8281449676841818,
"rewards/rejected": -0.17406222435735888,
"step": 1120
},
{
"epoch": 1.4766839378238341,
"grad_norm": 21.98465919494629,
"kl": 21.62624168395996,
"learning_rate": 5.488322096317633e-07,
"logits/chosen": -35109864.95176849,
"logits/rejected": -36197684.1337386,
"logps/chosen": -491.34405144694534,
"logps/rejected": -357.59213525835867,
"loss": 0.4973,
"loss/base_kto": 3.1464684009552,
"loss/total_with_kl": 3.97809100151062,
"metrics/advantage_var": 499.4730529785156,
"regularization/advantage_var": 499.4730529785156,
"regularization/kl": 0.8316227197647095,
"rewards/chosen": 0.6417734323973824,
"rewards/margins": 0.8699830004094692,
"rewards/rejected": -0.2282095680120868,
"step": 1140
},
{
"epoch": 1.5025906735751295,
"grad_norm": 16.958070755004883,
"kl": 9.069159507751465,
"learning_rate": 5.347053841052518e-07,
"logits/chosen": -34802558.979266346,
"logits/rejected": -37141838.01531394,
"logps/chosen": -492.8044258373206,
"logps/rejected": -385.7053024502297,
"loss": 0.5338,
"loss/base_kto": 3.22055983543396,
"loss/total_with_kl": 4.270147323608398,
"metrics/advantage_var": 630.3829345703125,
"regularization/advantage_var": 630.3829345703125,
"regularization/kl": 1.0495874881744385,
"rewards/chosen": 0.3879310814767743,
"rewards/margins": 0.8503653915720079,
"rewards/rejected": -0.46243431009523356,
"step": 1160
},
{
"epoch": 1.528497409326425,
"grad_norm": 16.89603614807129,
"kl": 12.140111923217773,
"learning_rate": 5.205506596206531e-07,
"logits/chosen": -34872773.04242424,
"logits/rejected": -37482796.59354839,
"logps/chosen": -496.0032196969697,
"logps/rejected": -378.95584677419356,
"loss": 0.533,
"loss/base_kto": 3.2100415229797363,
"loss/total_with_kl": 4.264197826385498,
"metrics/advantage_var": 633.1267700195312,
"regularization/advantage_var": 633.1267700195312,
"regularization/kl": 1.0541560649871826,
"rewards/chosen": 0.536898202607126,
"rewards/margins": 0.8187301039113094,
"rewards/rejected": -0.28183190130418345,
"step": 1180
},
{
"epoch": 1.5544041450777202,
"grad_norm": 16.812923431396484,
"kl": 12.90421199798584,
"learning_rate": 5.063794148754032e-07,
"logits/chosen": -34195034.546623796,
"logits/rejected": -37324971.185410336,
"logps/chosen": -483.4717142282958,
"logps/rejected": -359.94849449088144,
"loss": 0.5093,
"loss/base_kto": 3.219403028488159,
"loss/total_with_kl": 4.074177265167236,
"metrics/advantage_var": 513.3780517578125,
"regularization/advantage_var": 513.3780517578125,
"regularization/kl": 0.8547744750976562,
"rewards/chosen": 0.5112144249428506,
"rewards/margins": 0.8330791472904,
"rewards/rejected": -0.32186472234754937,
"step": 1200
},
{
"epoch": 1.5803108808290154,
"grad_norm": 14.058871269226074,
"kl": 14.516571044921875,
"learning_rate": 4.922030418472422e-07,
"logits/chosen": -34791809.80847724,
"logits/rejected": -35851013.972006224,
"logps/chosen": -458.04017857142856,
"logps/rejected": -373.04199066874025,
"loss": 0.5007,
"loss/base_kto": 3.2256600856781006,
"loss/total_with_kl": 4.005448818206787,
"metrics/advantage_var": 468.3414001464844,
"regularization/advantage_var": 468.3414001464844,
"regularization/kl": 0.7797884941101074,
"rewards/chosen": 0.474783377894427,
"rewards/margins": 0.8102318372645669,
"rewards/rejected": -0.33544845937013995,
"step": 1220
},
{
"epoch": 1.6062176165803108,
"grad_norm": 11.235255241394043,
"kl": 17.65205955505371,
"learning_rate": 4.780329366364336e-07,
"logits/chosen": -34895403.256528415,
"logits/rejected": -35339379.58664547,
"logps/chosen": -483.04881912442397,
"logps/rejected": -374.9543918918919,
"loss": 0.5281,
"loss/base_kto": 3.202352285385132,
"loss/total_with_kl": 4.224853038787842,
"metrics/advantage_var": 614.1143798828125,
"regularization/advantage_var": 614.1143798828125,
"regularization/kl": 1.0225003957748413,
"rewards/chosen": 0.6097218503234207,
"rewards/margins": 0.8648844638934476,
"rewards/rejected": -0.25516261357002684,
"step": 1240
},
{
"epoch": 1.6321243523316062,
"grad_norm": 16.98574447631836,
"kl": 9.064486503601074,
"learning_rate": 4.638804903046684e-07,
"logits/chosen": -36055082.1933439,
"logits/rejected": -36566803.328197226,
"logps/chosen": -484.90664619651346,
"logps/rejected": -381.66838405238826,
"loss": 0.5263,
"loss/base_kto": 3.227729558944702,
"loss/total_with_kl": 4.210367202758789,
"metrics/advantage_var": 590.1730346679688,
"regularization/advantage_var": 590.1730346679688,
"regularization/kl": 0.9826381802558899,
"rewards/chosen": 0.41754561483198793,
"rewards/margins": 0.8201956691523365,
"rewards/rejected": -0.4026500543203486,
"step": 1260
},
{
"epoch": 1.6580310880829017,
"grad_norm": 20.735435485839844,
"kl": 13.433310508728027,
"learning_rate": 4.497570797180217e-07,
"logits/chosen": -34812483.2,
"logits/rejected": -35821484.8,
"logps/chosen": -489.5673828125,
"logps/rejected": -380.184228515625,
"loss": 0.5075,
"loss/base_kto": 3.173840045928955,
"loss/total_with_kl": 4.0600409507751465,
"metrics/advantage_var": 532.2528076171875,
"regularization/advantage_var": 532.2528076171875,
"regularization/kl": 0.8862008452415466,
"rewards/chosen": 0.5355085372924805,
"rewards/margins": 0.8867841720581056,
"rewards/rejected": -0.351275634765625,
"step": 1280
},
{
"epoch": 1.6839378238341969,
"grad_norm": 10.443603515625,
"kl": 15.014068603515625,
"learning_rate": 4.3567405840131853e-07,
"logits/chosen": -35359488.76876877,
"logits/rejected": -36065006.488599345,
"logps/chosen": -468.1949605855856,
"logps/rejected": -372.7525447882736,
"loss": 0.5377,
"loss/base_kto": 3.2357544898986816,
"loss/total_with_kl": 4.301290512084961,
"metrics/advantage_var": 639.9616088867188,
"regularization/advantage_var": 639.9616088867188,
"regularization/kl": 1.0655361413955688,
"rewards/chosen": 0.5401951328770176,
"rewards/margins": 0.8020933600343618,
"rewards/rejected": -0.26189822715734423,
"step": 1300
},
{
"epoch": 1.709844559585492,
"grad_norm": 10.77260684967041,
"kl": 20.780960083007812,
"learning_rate": 4.2164274741126506e-07,
"logits/chosen": -35667223.27272727,
"logits/rejected": -38056867.489096574,
"logps/chosen": -479.54545454545456,
"logps/rejected": -379.64751265576325,
"loss": 0.5154,
"loss/base_kto": 3.1758131980895996,
"loss/total_with_kl": 4.122966766357422,
"metrics/advantage_var": 568.861083984375,
"regularization/advantage_var": 568.861083984375,
"regularization/kl": 0.9471536874771118,
"rewards/chosen": 0.6971722067710374,
"rewards/margins": 0.8432453312614604,
"rewards/rejected": -0.146073124490423,
"step": 1320
},
{
"epoch": 1.7357512953367875,
"grad_norm": 21.820354461669922,
"kl": 18.302148818969727,
"learning_rate": 4.0767442623567856e-07,
"logits/chosen": -34120516.2403698,
"logits/rejected": -36425189.22345483,
"logps/chosen": -480.7200500770416,
"logps/rejected": -358.38076961172743,
"loss": 0.4989,
"loss/base_kto": 3.1738641262054443,
"loss/total_with_kl": 3.991513967514038,
"metrics/advantage_var": 491.0809020996094,
"regularization/advantage_var": 491.0809020996094,
"regularization/kl": 0.8176496624946594,
"rewards/chosen": 0.5981124619306144,
"rewards/margins": 0.8380587577640509,
"rewards/rejected": -0.23994629583343652,
"step": 1340
},
{
"epoch": 1.761658031088083,
"grad_norm": 19.11968231201172,
"kl": 15.336816787719727,
"learning_rate": 3.937803237261357e-07,
"logits/chosen": -35227818.131661445,
"logits/rejected": -35232662.728971966,
"logps/chosen": -469.18172021943576,
"logps/rejected": -366.48568925233644,
"loss": 0.5098,
"loss/base_kto": 3.1704258918762207,
"loss/total_with_kl": 4.078118801116943,
"metrics/advantage_var": 545.1610107421875,
"regularization/advantage_var": 545.1610107421875,
"regularization/kl": 0.9076930284500122,
"rewards/chosen": 0.601460567462407,
"rewards/margins": 0.8971618528513892,
"rewards/rejected": -0.29570128538898216,
"step": 1360
},
{
"epoch": 1.7875647668393784,
"grad_norm": 15.077584266662598,
"kl": 14.563433647155762,
"learning_rate": 3.7997160907132456e-07,
"logits/chosen": -35686443.150729336,
"logits/rejected": -36516939.680241324,
"logps/chosen": -496.18096636953,
"logps/rejected": -382.3719362745098,
"loss": 0.5261,
"loss/base_kto": 3.1742496490478516,
"loss/total_with_kl": 4.2089457511901855,
"metrics/advantage_var": 621.4389038085938,
"regularization/advantage_var": 621.4389038085938,
"regularization/kl": 1.0346958637237549,
"rewards/chosen": 0.5384568967154578,
"rewards/margins": 0.863727513525884,
"rewards/rejected": -0.32527061681042607,
"step": 1380
},
{
"epoch": 1.8134715025906736,
"grad_norm": 17.804264068603516,
"kl": 12.497262954711914,
"learning_rate": 3.662593828183601e-07,
"logits/chosen": -36677968.4338118,
"logits/rejected": -36208094.284839205,
"logps/chosen": -500.66487240829343,
"logps/rejected": -386.2694056278714,
"loss": 0.51,
"loss/base_kto": 3.1934421062469482,
"loss/total_with_kl": 4.079799652099609,
"metrics/advantage_var": 532.346923828125,
"regularization/advantage_var": 532.346923828125,
"regularization/kl": 0.8863576054573059,
"rewards/chosen": 0.502348295999676,
"rewards/margins": 0.8429343288378986,
"rewards/rejected": -0.34058603283822264,
"step": 1400
},
{
"epoch": 1.8393782383419688,
"grad_norm": 16.499343872070312,
"kl": 12.454108238220215,
"learning_rate": 3.5265466794927725e-07,
"logits/chosen": -34069816.756589144,
"logits/rejected": -35322900.963779524,
"logps/chosen": -476.69578488372093,
"logps/rejected": -396.577312992126,
"loss": 0.5123,
"loss/base_kto": 3.1449525356292725,
"loss/total_with_kl": 4.098038673400879,
"metrics/advantage_var": 572.4239501953125,
"regularization/advantage_var": 572.4239501953125,
"regularization/kl": 0.953085720539093,
"rewards/chosen": 0.44505615234375,
"rewards/margins": 0.9144545667753445,
"rewards/rejected": -0.46939841443159447,
"step": 1420
},
{
"epoch": 1.8652849740932642,
"grad_norm": 68.79667663574219,
"kl": 19.708200454711914,
"learning_rate": 3.3916840101987887e-07,
"logits/chosen": -34935476.28169014,
"logits/rejected": -34988153.41029641,
"logps/chosen": -475.5610817683881,
"logps/rejected": -365.95154056162244,
"loss": 0.497,
"loss/base_kto": 3.1570169925689697,
"loss/total_with_kl": 3.9757080078125,
"metrics/advantage_var": 491.70635986328125,
"regularization/advantage_var": 491.70635986328125,
"regularization/kl": 0.818691074848175,
"rewards/chosen": 0.6771548753239925,
"rewards/margins": 0.8825103246493875,
"rewards/rejected": -0.2053554493253949,
"step": 1440
},
{
"epoch": 1.8911917098445596,
"grad_norm": 11.845552444458008,
"kl": 17.667652130126953,
"learning_rate": 3.258114233680583e-07,
"logits/chosen": -35823884.8,
"logits/rejected": -35276588.8,
"logps/chosen": -486.55625,
"logps/rejected": -366.40927734375,
"loss": 0.5097,
"loss/base_kto": 3.158928394317627,
"loss/total_with_kl": 4.077810287475586,
"metrics/advantage_var": 551.8809814453125,
"regularization/advantage_var": 551.8809814453125,
"regularization/kl": 0.9188818335533142,
"rewards/chosen": 0.6351908683776856,
"rewards/margins": 0.8914699792861939,
"rewards/rejected": -0.2562791109085083,
"step": 1460
},
{
"epoch": 1.917098445595855,
"grad_norm": 18.535634994506836,
"kl": 16.133092880249023,
"learning_rate": 3.1259447239866796e-07,
"logits/chosen": -35617760.19875777,
"logits/rejected": -35217517.48427673,
"logps/chosen": -473.39091614906835,
"logps/rejected": -381.6313138757862,
"loss": 0.5112,
"loss/base_kto": 3.206963300704956,
"loss/total_with_kl": 4.089570045471191,
"metrics/advantage_var": 530.0939331054688,
"regularization/advantage_var": 530.0939331054688,
"regularization/kl": 0.8826065063476562,
"rewards/chosen": 0.613495015209506,
"rewards/margins": 0.8020739387528003,
"rewards/rejected": -0.18857892354329428,
"step": 1480
},
{
"epoch": 1.9430051813471503,
"grad_norm": 11.974020957946777,
"kl": 16.73115348815918,
"learning_rate": 2.9952817295193435e-07,
"logits/chosen": -33763296.49230769,
"logits/rejected": -34868994.43809524,
"logps/chosen": -494.2183173076923,
"logps/rejected": -364.3859623015873,
"loss": 0.5122,
"loss/base_kto": 3.1801657676696777,
"loss/total_with_kl": 4.097968578338623,
"metrics/advantage_var": 551.2330322265625,
"regularization/advantage_var": 551.2330322265625,
"regularization/kl": 0.9178029894828796,
"rewards/chosen": 0.6548098520132212,
"rewards/margins": 0.8398223787524325,
"rewards/rejected": -0.1850125267392113,
"step": 1500
},
{
"epoch": 1.9689119170984455,
"grad_norm": 9.843354225158691,
"kl": 14.801050186157227,
"learning_rate": 2.866230287623651e-07,
"logits/chosen": -36169348.49840256,
"logits/rejected": -36987512.56269113,
"logps/chosen": -480.01472643769966,
"logps/rejected": -367.8846999235474,
"loss": 0.5033,
"loss/base_kto": 3.2000465393066406,
"loss/total_with_kl": 4.026675224304199,
"metrics/advantage_var": 496.4736022949219,
"regularization/advantage_var": 496.4736022949219,
"regularization/kl": 0.8266285061836243,
"rewards/chosen": 0.4919905982459315,
"rewards/margins": 0.8278221966502821,
"rewards/rejected": -0.3358315984043506,
"step": 1520
},
{
"epoch": 1.994818652849741,
"grad_norm": 13.826387405395508,
"kl": 13.46362590789795,
"learning_rate": 2.738894140150075e-07,
"logits/chosen": -34888960.39813375,
"logits/rejected": -35481497.1177394,
"logps/chosen": -495.83466174183513,
"logps/rejected": -372.1906887755102,
"loss": 0.5309,
"loss/base_kto": 3.240717649459839,
"loss/total_with_kl": 4.24738883972168,
"metrics/advantage_var": 604.6072998046875,
"regularization/advantage_var": 604.6072998046875,
"regularization/kl": 1.0066711902618408,
"rewards/chosen": 0.5279172716392885,
"rewards/margins": 0.7773599545492914,
"rewards/rejected": -0.24944268291000293,
"step": 1540
},
{
"epoch": 2.0207253886010363,
"grad_norm": 10.795230865478516,
"kl": 17.875226974487305,
"learning_rate": 2.6133756500585156e-07,
"logits/chosen": -34820278.46390169,
"logits/rejected": -36204207.5661882,
"logps/chosen": -492.9363959293395,
"logps/rejected": -363.6246012759171,
"loss": 0.4693,
"loss/base_kto": 3.107238292694092,
"loss/total_with_kl": 3.754481554031372,
"metrics/advantage_var": 388.7345886230469,
"regularization/advantage_var": 388.7345886230469,
"regularization/kl": 0.6472430229187012,
"rewards/chosen": 0.6626991002424155,
"rewards/margins": 0.9209322025571958,
"rewards/rejected": -0.2582331023147802,
"step": 1560
},
{
"epoch": 2.0466321243523318,
"grad_norm": 19.27705955505371,
"kl": 18.832422256469727,
"learning_rate": 2.489775719130767e-07,
"logits/chosen": -34594490.97072419,
"logits/rejected": -34871091.524564184,
"logps/chosen": -475.6154661016949,
"logps/rejected": -404.0041848256735,
"loss": 0.4666,
"loss/base_kto": 3.088207721710205,
"loss/total_with_kl": 3.73294997215271,
"metrics/advantage_var": 387.2326354980469,
"regularization/advantage_var": 387.2326354980469,
"regularization/kl": 0.6447422504425049,
"rewards/chosen": 0.660996071179218,
"rewards/margins": 0.9134467149211702,
"rewards/rejected": -0.25245064374195225,
"step": 1580
},
{
"epoch": 2.0725388601036268,
"grad_norm": 16.828039169311523,
"kl": 18.012939453125,
"learning_rate": 2.3681937068576303e-07,
"logits/chosen": -33559192.89433385,
"logits/rejected": -35118578.11802233,
"logps/chosen": -491.3185777182236,
"logps/rejected": -388.03668261562996,
"loss": 0.4702,
"loss/base_kto": 3.0965676307678223,
"loss/total_with_kl": 3.761559247970581,
"metrics/advantage_var": 399.39447021484375,
"regularization/advantage_var": 399.39447021484375,
"regularization/kl": 0.6649917960166931,
"rewards/chosen": 0.6639900616445731,
"rewards/margins": 0.9009370072000455,
"rewards/rejected": -0.2369469455554725,
"step": 1600
},
{
"epoch": 2.098445595854922,
"grad_norm": 13.841697692871094,
"kl": 18.363540649414062,
"learning_rate": 2.2487273505658e-07,
"logits/chosen": -36010543.16917923,
"logits/rejected": -36651898.56515373,
"logps/chosen": -480.6165201005025,
"logps/rejected": -403.83848828696927,
"loss": 0.4719,
"loss/base_kto": 3.1108250617980957,
"loss/total_with_kl": 3.7754433155059814,
"metrics/advantage_var": 399.1703796386719,
"regularization/advantage_var": 399.1703796386719,
"regularization/kl": 0.6646186709403992,
"rewards/chosen": 0.6045121236063128,
"rewards/margins": 0.9177538169270829,
"rewards/rejected": -0.31324169332077006,
"step": 1620
},
{
"epoch": 2.1243523316062176,
"grad_norm": 13.886054039001465,
"kl": 10.77209758758545,
"learning_rate": 2.131472686848817e-07,
"logits/chosen": -33384008.681388013,
"logits/rejected": -35382937.758513935,
"logps/chosen": -479.59261632492115,
"logps/rejected": -364.9218024380805,
"loss": 0.4606,
"loss/base_kto": 3.1307339668273926,
"loss/total_with_kl": 3.6846272945404053,
"metrics/advantage_var": 332.6686706542969,
"regularization/advantage_var": 332.6686706542969,
"regularization/kl": 0.5538933277130127,
"rewards/chosen": 0.4953169476722693,
"rewards/margins": 0.8828692149299124,
"rewards/rejected": -0.3875522672576432,
"step": 1640
},
{
"epoch": 2.150259067357513,
"grad_norm": 12.666690826416016,
"kl": 13.711188316345215,
"learning_rate": 2.016523974365188e-07,
"logits/chosen": -35280860.52283464,
"logits/rejected": -34790204.72558139,
"logps/chosen": -479.02677165354334,
"logps/rejected": -378.6731346899225,
"loss": 0.4647,
"loss/base_kto": 3.136176824569702,
"loss/total_with_kl": 3.7178847789764404,
"metrics/advantage_var": 349.37420654296875,
"regularization/advantage_var": 349.37420654296875,
"regularization/kl": 0.5817080736160278,
"rewards/chosen": 0.5767086960199311,
"rewards/margins": 0.8669471636873851,
"rewards/rejected": -0.290238467667454,
"step": 1660
},
{
"epoch": 2.1761658031088085,
"grad_norm": 8.175899505615234,
"kl": 13.4633207321167,
"learning_rate": 1.9039736180657372e-07,
"logits/chosen": -35221138.61469265,
"logits/rejected": -36860077.729200654,
"logps/chosen": -483.1257496251874,
"logps/rejected": -372.60741231647637,
"loss": 0.4736,
"loss/base_kto": 3.147956132888794,
"loss/total_with_kl": 3.7891335487365723,
"metrics/advantage_var": 385.0915222167969,
"regularization/advantage_var": 385.0915222167969,
"regularization/kl": 0.6411773562431335,
"rewards/chosen": 0.5833238318584848,
"rewards/margins": 0.8691109942036367,
"rewards/rejected": -0.2857871623451519,
"step": 1680
},
{
"epoch": 2.2020725388601035,
"grad_norm": 16.640430450439453,
"kl": 21.772733688354492,
"learning_rate": 1.7939120949111498e-07,
"logits/chosen": -35476442.675118856,
"logits/rejected": -35618418.39137134,
"logps/chosen": -477.05744849445324,
"logps/rejected": -355.0386893297381,
"loss": 0.4617,
"loss/base_kto": 3.1115479469299316,
"loss/total_with_kl": 3.6933600902557373,
"metrics/advantage_var": 349.43682861328125,
"regularization/advantage_var": 349.43682861328125,
"regularization/kl": 0.58181232213974,
"rewards/chosen": 0.6841963633493463,
"rewards/margins": 0.8865140111804446,
"rewards/rejected": -0.20231764783109832,
"step": 1700
},
{
"epoch": 2.227979274611399,
"grad_norm": 13.235726356506348,
"kl": 15.409103393554688,
"learning_rate": 1.6864278811393523e-07,
"logits/chosen": -33728573.08634223,
"logits/rejected": -34643827.85692068,
"logps/chosen": -453.91768053375193,
"logps/rejected": -356.26489599533437,
"loss": 0.4593,
"loss/base_kto": 3.140038251876831,
"loss/total_with_kl": 3.6741511821746826,
"metrics/advantage_var": 320.7887268066406,
"regularization/advantage_var": 320.7887268066406,
"regularization/kl": 0.5341132283210754,
"rewards/chosen": 0.5848530001318436,
"rewards/margins": 0.8610822415341448,
"rewards/rejected": -0.2762292414023012,
"step": 1720
},
{
"epoch": 2.2538860103626943,
"grad_norm": 20.878890991210938,
"kl": 15.422149658203125,
"learning_rate": 1.5816073811412584e-07,
"logits/chosen": -33578972.57861635,
"logits/rejected": -36763638.45962733,
"logps/chosen": -471.4190251572327,
"logps/rejected": -374.738887810559,
"loss": 0.4662,
"loss/base_kto": 3.098297119140625,
"loss/total_with_kl": 3.729501485824585,
"metrics/advantage_var": 379.1016540527344,
"regularization/advantage_var": 379.1016540527344,
"regularization/kl": 0.6312043070793152,
"rewards/chosen": 0.5744507987544222,
"rewards/margins": 0.9202158118864583,
"rewards/rejected": -0.3457650131320361,
"step": 1740
},
{
"epoch": 2.2797927461139897,
"grad_norm": 9.892145156860352,
"kl": 13.838292121887207,
"learning_rate": 1.4795348580020207e-07,
"logits/chosen": -34713857.22098569,
"logits/rejected": -36125738.47004608,
"logps/chosen": -491.6842209856916,
"logps/rejected": -372.671634984639,
"loss": 0.4732,
"loss/base_kto": 3.0913591384887695,
"loss/total_with_kl": 3.7855026721954346,
"metrics/advantage_var": 416.90313720703125,
"regularization/advantage_var": 416.90313720703125,
"regularization/kl": 0.6941437125205994,
"rewards/chosen": 0.6123622293881658,
"rewards/margins": 0.9411510218708847,
"rewards/rejected": -0.3287887924827189,
"step": 1760
},
{
"epoch": 2.305699481865285,
"grad_norm": 16.5397891998291,
"kl": 16.939855575561523,
"learning_rate": 1.3802923657636355e-07,
"logits/chosen": -36120921.56037152,
"logits/rejected": -34855603.2807571,
"logps/chosen": -469.1806308049536,
"logps/rejected": -391.3821963722398,
"loss": 0.4673,
"loss/base_kto": 3.0890920162200928,
"loss/total_with_kl": 3.738292694091797,
"metrics/advantage_var": 389.9102478027344,
"regularization/advantage_var": 389.9102478027344,
"regularization/kl": 0.6492005586624146,
"rewards/chosen": 0.5950904113958495,
"rewards/margins": 0.9190824456340692,
"rewards/rejected": -0.32399203423821965,
"step": 1780
},
{
"epoch": 2.33160621761658,
"grad_norm": 10.007122039794922,
"kl": 18.840436935424805,
"learning_rate": 1.28395968346336e-07,
"logits/chosen": -34272680.585365854,
"logits/rejected": -36623041.64102564,
"logps/chosen": -455.6271913109756,
"logps/rejected": -372.45587940705127,
"loss": 0.4669,
"loss/base_kto": 3.1442363262176514,
"loss/total_with_kl": 3.7351715564727783,
"metrics/advantage_var": 354.916015625,
"regularization/advantage_var": 354.916015625,
"regularization/kl": 0.590935230255127,
"rewards/chosen": 0.6542033683962938,
"rewards/margins": 0.8423987681452672,
"rewards/rejected": -0.18819539974897337,
"step": 1800
},
{
"epoch": 2.3575129533678756,
"grad_norm": 12.622456550598145,
"kl": 22.887765884399414,
"learning_rate": 1.1906142510009415e-07,
"logits/chosen": -36191325.09090909,
"logits/rejected": -37970868.02580645,
"logps/chosen": -500.6345170454546,
"logps/rejected": -361.6321068548387,
"loss": 0.4576,
"loss/base_kto": 3.096804618835449,
"loss/total_with_kl": 3.6607301235198975,
"metrics/advantage_var": 338.69384765625,
"regularization/advantage_var": 338.69384765625,
"regularization/kl": 0.5639252066612244,
"rewards/chosen": 0.7195481271454782,
"rewards/margins": 0.874699199001577,
"rewards/rejected": -0.15515107185609878,
"step": 1820
},
{
"epoch": 2.383419689119171,
"grad_norm": 15.0021333694458,
"kl": 23.994291305541992,
"learning_rate": 1.1003311068862547e-07,
"logits/chosen": -35000614.36085627,
"logits/rejected": -36952773.92971246,
"logps/chosen": -498.0998184250765,
"logps/rejected": -393.1023861821086,
"loss": 0.4579,
"loss/base_kto": 3.073777675628662,
"loss/total_with_kl": 3.663127899169922,
"metrics/advantage_var": 353.964111328125,
"regularization/advantage_var": 353.964111328125,
"regularization/kl": 0.5893502235412598,
"rewards/chosen": 0.763191246476013,
"rewards/margins": 0.9050856022255638,
"rewards/rejected": -0.14189435574955073,
"step": 1840
},
{
"epoch": 2.4093264248704664,
"grad_norm": 13.450627326965332,
"kl": 18.962284088134766,
"learning_rate": 1.0131828279173588e-07,
"logits/chosen": -35935625.36585366,
"logits/rejected": -37088347.897435896,
"logps/chosen": -487.7211318597561,
"logps/rejected": -347.68359375,
"loss": 0.4654,
"loss/base_kto": 3.119527578353882,
"loss/total_with_kl": 3.7229549884796143,
"metrics/advantage_var": 362.41876220703125,
"regularization/advantage_var": 362.41876220703125,
"regularization/kl": 0.6034272909164429,
"rewards/chosen": 0.6604757076356469,
"rewards/margins": 0.8571033245179711,
"rewards/rejected": -0.19662761688232422,
"step": 1860
},
{
"epoch": 2.4352331606217614,
"grad_norm": 12.219781875610352,
"kl": 21.565269470214844,
"learning_rate": 9.292394708374596e-08,
"logits/chosen": -34777532.37735849,
"logits/rejected": -36161440.596273296,
"logps/chosen": -469.9175019654088,
"logps/rejected": -363.8256259704969,
"loss": 0.4677,
"loss/base_kto": 3.0906436443328857,
"loss/total_with_kl": 3.7416934967041016,
"metrics/advantage_var": 391.020751953125,
"regularization/advantage_var": 391.020751953125,
"regularization/kl": 0.6510495543479919,
"rewards/chosen": 0.7124719199894359,
"rewards/margins": 0.9116966408199386,
"rewards/rejected": -0.19922472083050272,
"step": 1880
},
{
"epoch": 2.461139896373057,
"grad_norm": 13.32406234741211,
"kl": 18.75167465209961,
"learning_rate": 8.48568516017727e-08,
"logits/chosen": -35298579.2688172,
"logits/rejected": -36003703.24960254,
"logps/chosen": -479.2941628264209,
"logps/rejected": -384.1168521462639,
"loss": 0.467,
"loss/base_kto": 3.1590993404388428,
"loss/total_with_kl": 3.7356860637664795,
"metrics/advantage_var": 346.2985534667969,
"regularization/advantage_var": 346.2985534667969,
"regularization/kl": 0.5765871405601501,
"rewards/chosen": 0.6431738506264401,
"rewards/margins": 0.8293609155204931,
"rewards/rejected": -0.18618706489405307,
"step": 1900
},
{
"epoch": 2.4870466321243523,
"grad_norm": 6.914154529571533,
"kl": 18.390832901000977,
"learning_rate": 7.71234813211169e-08,
"logits/chosen": -33529994.37837838,
"logits/rejected": -36759185.094462544,
"logps/chosen": -497.8991647897898,
"logps/rejected": -378.38110749185665,
"loss": 0.4656,
"loss/base_kto": 3.1070802211761475,
"loss/total_with_kl": 3.7246978282928467,
"metrics/advantage_var": 370.9416198730469,
"regularization/advantage_var": 370.9416198730469,
"regularization/kl": 0.6176177859306335,
"rewards/chosen": 0.6875801430092202,
"rewards/margins": 0.9103769279475727,
"rewards/rejected": -0.2227967849383525,
"step": 1920
},
{
"epoch": 2.5129533678756477,
"grad_norm": 11.438712120056152,
"kl": 22.58893394470215,
"learning_rate": 6.973005294212353e-08,
"logits/chosen": -34451230.591194965,
"logits/rejected": -36731490.583850935,
"logps/chosen": -459.84974449685535,
"logps/rejected": -372.14358501552795,
"loss": 0.4625,
"loss/base_kto": 3.102107286453247,
"loss/total_with_kl": 3.7000434398651123,
"metrics/advantage_var": 359.1208801269531,
"regularization/advantage_var": 359.1208801269531,
"regularization/kl": 0.5979362726211548,
"rewards/chosen": 0.7382436308470912,
"rewards/margins": 0.9092386915486391,
"rewards/rejected": -0.17099506070154794,
"step": 1940
},
{
"epoch": 2.538860103626943,
"grad_norm": 11.214678764343262,
"kl": 18.963571548461914,
"learning_rate": 6.268250989270102e-08,
"logits/chosen": -33975406.87898089,
"logits/rejected": -34658417.0797546,
"logps/chosen": -459.12291003184714,
"logps/rejected": -355.2796922929448,
"loss": 0.4605,
"loss/base_kto": 3.1519150733947754,
"loss/total_with_kl": 3.6843254566192627,
"metrics/advantage_var": 319.7659912109375,
"regularization/advantage_var": 319.7659912109375,
"regularization/kl": 0.5324103832244873,
"rewards/chosen": 0.6899675016949891,
"rewards/margins": 0.853054457227695,
"rewards/rejected": -0.16308695553270586,
"step": 1960
},
{
"epoch": 2.5647668393782386,
"grad_norm": 9.632356643676758,
"kl": 17.70616912841797,
"learning_rate": 5.598651755051975e-08,
"logits/chosen": -36399908.45696401,
"logits/rejected": -37554153.6349454,
"logps/chosen": -495.7028071205008,
"logps/rejected": -352.6200760530421,
"loss": 0.4641,
"loss/base_kto": 3.113957166671753,
"loss/total_with_kl": 3.7127532958984375,
"metrics/advantage_var": 359.63726806640625,
"regularization/advantage_var": 359.63726806640625,
"regularization/kl": 0.5987960696220398,
"rewards/chosen": 0.6335635953852455,
"rewards/margins": 0.8784684452901792,
"rewards/rejected": -0.2449048499049337,
"step": 1980
},
{
"epoch": 2.5906735751295336,
"grad_norm": 9.035210609436035,
"kl": 19.576251983642578,
"learning_rate": 4.964745868872933e-08,
"logits/chosen": -36141401.94594595,
"logits/rejected": -36757673.674418606,
"logps/chosen": -471.6283255912162,
"logps/rejected": -411.13349382267444,
"loss": 0.4655,
"loss/base_kto": 3.1428756713867188,
"loss/total_with_kl": 3.724013566970825,
"metrics/advantage_var": 349.03204345703125,
"regularization/advantage_var": 349.03204345703125,
"regularization/kl": 0.5811383128166199,
"rewards/chosen": 0.5696450826284047,
"rewards/margins": 0.8397197052040315,
"rewards/rejected": -0.2700746225756268,
"step": 2000
},
{
"epoch": 2.616580310880829,
"grad_norm": 9.367024421691895,
"kl": 15.989706993103027,
"learning_rate": 4.3670429148855493e-08,
"logits/chosen": -35538447.900621116,
"logits/rejected": -36447689.25786164,
"logps/chosen": -485.09297360248445,
"logps/rejected": -375.897258254717,
"loss": 0.4632,
"loss/base_kto": 3.1421048641204834,
"loss/total_with_kl": 3.7057876586914062,
"metrics/advantage_var": 338.54840087890625,
"regularization/advantage_var": 338.54840087890625,
"regularization/kl": 0.563683032989502,
"rewards/chosen": 0.567249179626844,
"rewards/margins": 0.8488750592624449,
"rewards/rejected": -0.28162587963560093,
"step": 2020
},
{
"epoch": 2.6424870466321244,
"grad_norm": 12.35507583618164,
"kl": 16.977344512939453,
"learning_rate": 3.806023374435663e-08,
"logits/chosen": -35135086.9470305,
"logits/rejected": -36150566.57534247,
"logps/chosen": -487.79429173354737,
"logps/rejected": -385.1545376712329,
"loss": 0.4572,
"loss/base_kto": 3.122990608215332,
"loss/total_with_kl": 3.657369375228882,
"metrics/advantage_var": 320.9480895996094,
"regularization/advantage_var": 320.9480895996094,
"regularization/kl": 0.5343785285949707,
"rewards/chosen": 0.5660365121513844,
"rewards/margins": 0.8591012508503117,
"rewards/rejected": -0.2930647386989274,
"step": 2040
},
{
"epoch": 2.66839378238342,
"grad_norm": 24.943979263305664,
"kl": 14.890515327453613,
"learning_rate": 3.282138239813037e-08,
"logits/chosen": -36561734.82534776,
"logits/rejected": -36859793.99684044,
"logps/chosen": -512.2392774343122,
"logps/rejected": -367.7308204976303,
"loss": 0.4735,
"loss/base_kto": 3.0660271644592285,
"loss/total_with_kl": 3.7877564430236816,
"metrics/advantage_var": 433.4712829589844,
"regularization/advantage_var": 433.4712829589844,
"regularization/kl": 0.7217296957969666,
"rewards/chosen": 0.6244497402373937,
"rewards/margins": 0.9588832009249678,
"rewards/rejected": -0.33443346068757407,
"step": 2060
},
{
"epoch": 2.694300518134715,
"grad_norm": 12.352337837219238,
"kl": 17.1584529876709,
"learning_rate": 2.795808651707793e-08,
"logits/chosen": -37212582.4,
"logits/rejected": -36345235.2,
"logps/chosen": -485.367578125,
"logps/rejected": -377.096240234375,
"loss": 0.4536,
"loss/base_kto": 3.046826124191284,
"loss/total_with_kl": 3.628899335861206,
"metrics/advantage_var": 349.5934753417969,
"regularization/advantage_var": 349.5934753417969,
"regularization/kl": 0.5820731520652771,
"rewards/chosen": 0.6046004295349121,
"rewards/margins": 0.9382753372192383,
"rewards/rejected": -0.33367490768432617,
"step": 2080
},
{
"epoch": 2.7202072538860103,
"grad_norm": 7.924802303314209,
"kl": 16.00665855407715,
"learning_rate": 2.3474255606639293e-08,
"logits/chosen": -35062070.303030305,
"logits/rejected": -36446565.53751914,
"logps/chosen": -488.86034688995215,
"logps/rejected": -363.7005168453293,
"loss": 0.4561,
"loss/base_kto": 3.123929738998413,
"loss/total_with_kl": 3.648754835128784,
"metrics/advantage_var": 315.210205078125,
"regularization/advantage_var": 315.210205078125,
"regularization/kl": 0.5248250365257263,
"rewards/chosen": 0.6202993195212819,
"rewards/margins": 0.8590380995210427,
"rewards/rejected": -0.23873877999976073,
"step": 2100
},
{
"epoch": 2.7461139896373057,
"grad_norm": 13.827885627746582,
"kl": 15.445418357849121,
"learning_rate": 1.9373494128020195e-08,
"logits/chosen": -33636513.514195584,
"logits/rejected": -36219774.018575855,
"logps/chosen": -457.5471214511041,
"logps/rejected": -382.59904702012386,
"loss": 0.4622,
"loss/base_kto": 3.138892889022827,
"loss/total_with_kl": 3.6973092555999756,
"metrics/advantage_var": 335.38525390625,
"regularization/advantage_var": 335.38525390625,
"regularization/kl": 0.558416485786438,
"rewards/chosen": 0.5851179538089019,
"rewards/margins": 0.8563093884034017,
"rewards/rejected": -0.2711914345944998,
"step": 2120
},
{
"epoch": 2.772020725388601,
"grad_norm": 11.497026443481445,
"kl": 15.475537300109863,
"learning_rate": 1.5659098600638798e-08,
"logits/chosen": -36151808.0,
"logits/rejected": -36169260.8,
"logps/chosen": -468.385791015625,
"logps/rejected": -400.343603515625,
"loss": 0.4573,
"loss/base_kto": 3.059650421142578,
"loss/total_with_kl": 3.6584396362304688,
"metrics/advantage_var": 359.6334228515625,
"regularization/advantage_var": 359.6334228515625,
"regularization/kl": 0.598789632320404,
"rewards/chosen": 0.6046765804290771,
"rewards/margins": 0.9387316703796387,
"rewards/rejected": -0.33405508995056155,
"step": 2140
},
{
"epoch": 2.7979274611398965,
"grad_norm": 8.553000450134277,
"kl": 16.97987937927246,
"learning_rate": 1.2334054952120143e-08,
"logits/chosen": -34956386.461538464,
"logits/rejected": -36204500.29268292,
"logps/chosen": -490.9650440705128,
"logps/rejected": -376.5561880716463,
"loss": 0.4666,
"loss/base_kto": 3.1323304176330566,
"loss/total_with_kl": 3.73240327835083,
"metrics/advantage_var": 360.404052734375,
"regularization/advantage_var": 360.404052734375,
"regularization/kl": 0.6000728011131287,
"rewards/chosen": 0.5717535752516526,
"rewards/margins": 0.864862864281402,
"rewards/rejected": -0.2931092890297494,
"step": 2160
},
{
"epoch": 2.823834196891192,
"grad_norm": 19.277727127075195,
"kl": 15.771048545837402,
"learning_rate": 9.401036117969108e-09,
"logits/chosen": -34332610.81761006,
"logits/rejected": -36033930.335403726,
"logps/chosen": -470.49744496855345,
"logps/rejected": -371.26353843167703,
"loss": 0.4706,
"loss/base_kto": 3.1594808101654053,
"loss/total_with_kl": 3.7644569873809814,
"metrics/advantage_var": 363.3489685058594,
"regularization/advantage_var": 363.3489685058594,
"regularization/kl": 0.6049759984016418,
"rewards/chosen": 0.5511305707055818,
"rewards/margins": 0.851343809913353,
"rewards/rejected": -0.30021323920777127,
"step": 2180
},
{
"epoch": 2.849740932642487,
"grad_norm": 11.23862361907959,
"kl": 15.174311637878418,
"learning_rate": 6.8623998928517555e-09,
"logits/chosen": -35027817.55450237,
"logits/rejected": -35086766.49149923,
"logps/chosen": -480.51639020537124,
"logps/rejected": -380.3885722565688,
"loss": 0.4619,
"loss/base_kto": 3.0904994010925293,
"loss/total_with_kl": 3.695472002029419,
"metrics/advantage_var": 363.34686279296875,
"regularization/advantage_var": 363.34686279296875,
"regularization/kl": 0.6049725413322449,
"rewards/chosen": 0.5956331225933057,
"rewards/margins": 0.9028084183921248,
"rewards/rejected": -0.3071752957988191,
"step": 2200
},
{
"epoch": 2.8756476683937824,
"grad_norm": 7.307109832763672,
"kl": 13.383758544921875,
"learning_rate": 4.72018703521132e-09,
"logits/chosen": -35780903.68389058,
"logits/rejected": -34818821.76205788,
"logps/chosen": -477.3777545592705,
"logps/rejected": -376.16941318327974,
"loss": 0.4591,
"loss/base_kto": 3.1255557537078857,
"loss/total_with_kl": 3.6724822521209717,
"metrics/advantage_var": 328.4842224121094,
"regularization/advantage_var": 328.4842224121094,
"regularization/kl": 0.5469262003898621,
"rewards/chosen": 0.6030227985787899,
"rewards/margins": 0.8759559244580102,
"rewards/rejected": -0.27293312587922025,
"step": 2220
},
{
"epoch": 2.901554404145078,
"grad_norm": 11.22283935546875,
"kl": 15.68100643157959,
"learning_rate": 2.976119626744267e-09,
"logits/chosen": -36057814.605965465,
"logits/rejected": -37328243.06065319,
"logps/chosen": -493.3335949764521,
"logps/rejected": -364.83558514774495,
"loss": 0.4692,
"loss/base_kto": 3.1190693378448486,
"loss/total_with_kl": 3.7533156871795654,
"metrics/advantage_var": 380.9286804199219,
"regularization/advantage_var": 380.9286804199219,
"regularization/kl": 0.634246289730072,
"rewards/chosen": 0.573127111797243,
"rewards/margins": 0.8706419842518016,
"rewards/rejected": -0.2975148724545587,
"step": 2240
},
{
"epoch": 2.927461139896373,
"grad_norm": 9.224340438842773,
"kl": 15.672713279724121,
"learning_rate": 1.631599688052765e-09,
"logits/chosen": -36120357.85055644,
"logits/rejected": -36371668.35023042,
"logps/chosen": -479.6764705882353,
"logps/rejected": -388.6004704301075,
"loss": 0.4564,
"loss/base_kto": 3.077691078186035,
"loss/total_with_kl": 3.650958299636841,
"metrics/advantage_var": 344.30462646484375,
"regularization/advantage_var": 344.30462646484375,
"regularization/kl": 0.5732671618461609,
"rewards/chosen": 0.6376804175930296,
"rewards/margins": 0.9425419287297423,
"rewards/rejected": -0.3048615111367127,
"step": 2260
},
{
"epoch": 2.9533678756476682,
"grad_norm": 9.535575866699219,
"kl": 20.456087112426758,
"learning_rate": 6.877080515894085e-10,
"logits/chosen": -35746735.686274506,
"logits/rejected": -36416695.95209581,
"logps/chosen": -460.29268790849676,
"logps/rejected": -370.57218375748505,
"loss": 0.4566,
"loss/base_kto": 3.088155508041382,
"loss/total_with_kl": 3.652820587158203,
"metrics/advantage_var": 339.1382751464844,
"regularization/advantage_var": 339.1382751464844,
"regularization/kl": 0.5646652579307556,
"rewards/chosen": 0.6121223798764297,
"rewards/margins": 0.8912944434640981,
"rewards/rejected": -0.27917206358766844,
"step": 2280
},
{
"epoch": 2.9792746113989637,
"grad_norm": 11.117263793945312,
"kl": 13.020883560180664,
"learning_rate": 1.4520349279739663e-10,
"logits/chosen": -35574272.0,
"logits/rejected": -36800747.78947368,
"logps/chosen": -501.8949032738095,
"logps/rejected": -358.2474814967105,
"loss": 0.4607,
"loss/base_kto": 3.154110908508301,
"loss/total_with_kl": 3.6857082843780518,
"metrics/advantage_var": 319.2776794433594,
"regularization/advantage_var": 319.2776794433594,
"regularization/kl": 0.5315973162651062,
"rewards/chosen": 0.5785947527204242,
"rewards/margins": 0.8441579897600906,
"rewards/rejected": -0.26556323703966644,
"step": 2300
},
{
"epoch": 3.0,
"step": 2316,
"total_flos": 9.969850461966828e+17,
"train_loss": 0.5006774948050938,
"train_runtime": 11026.3717,
"train_samples_per_second": 13.442,
"train_steps_per_second": 0.21
}
],
"logging_steps": 20,
"max_steps": 2316,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": false,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 9.969850461966828e+17,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}