Files
aup-fullft-kto_mmd-mmdrho5.…/trainer_state.json

2229 lines
81 KiB
JSON
Raw Permalink Normal View History

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 3.0,
"eval_steps": 500,
"global_step": 2316,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.025906735751295335,
"grad_norm": 18.355131149291992,
"kl": 8.59229564666748,
"learning_rate": 1.8999999999999998e-07,
"logits/chosen": -35677106.2278481,
"logits/rejected": -37380674.37037037,
"logps/chosen": -501.69076344936707,
"logps/rejected": -375.19931520061726,
"loss": 0.5987,
"loss/base_kto": 3.899252414703369,
"metrics/advantage_var": 239.6805419921875,
"regularization/mmd": 0.8906540870666504,
"regularization/rkhs_norm": 171.60964965820312,
"rewards/chosen": 0.050869072539896906,
"rewards/margins": 0.09678698972084128,
"rewards/rejected": -0.04591791718094437,
"step": 20
},
{
"epoch": 0.05181347150259067,
"grad_norm": 14.383731842041016,
"kl": 18.936019897460938,
"learning_rate": 3.8999999999999997e-07,
"logits/chosen": -35806462.02773498,
"logits/rejected": -37790854.69413629,
"logps/chosen": -491.8996533127889,
"logps/rejected": -360.08897087955626,
"loss": 0.589,
"loss/base_kto": 3.903554916381836,
"metrics/advantage_var": 188.86729431152344,
"regularization/mmd": 0.8083402514457703,
"regularization/rkhs_norm": 155.7495574951172,
"rewards/chosen": 0.26754955885406634,
"rewards/margins": 0.07950186263619541,
"rewards/rejected": 0.18804769621787093,
"step": 40
},
{
"epoch": 0.07772020725388601,
"grad_norm": 20.89337921142578,
"kl": 3.5445687770843506,
"learning_rate": 5.9e-07,
"logits/chosen": -34724693.333333336,
"logits/rejected": -35590390.63414634,
"logps/chosen": -470.2059294871795,
"logps/rejected": -364.9865186737805,
"loss": 0.576,
"loss/base_kto": 3.835980176925659,
"metrics/advantage_var": 184.19546508789062,
"regularization/mmd": 0.7723119258880615,
"regularization/rkhs_norm": 148.80770874023438,
"rewards/chosen": 0.042210071514814325,
"rewards/margins": 0.16762212860054937,
"rewards/rejected": -0.12541205708573505,
"step": 60
},
{
"epoch": 0.10362694300518134,
"grad_norm": 16.099123001098633,
"kl": 7.2627739906311035,
"learning_rate": 7.9e-07,
"logits/chosen": -37767945.27244095,
"logits/rejected": -37982627.1255814,
"logps/chosen": -505.8322342519685,
"logps/rejected": -385.1265988372093,
"loss": 0.5774,
"loss/base_kto": 3.831442356109619,
"metrics/advantage_var": 175.14170837402344,
"regularization/mmd": 0.7881031036376953,
"regularization/rkhs_norm": 151.85031127929688,
"rewards/chosen": 0.11390412097840798,
"rewards/margins": 0.16512695915102488,
"rewards/rejected": -0.051222838172616886,
"step": 80
},
{
"epoch": 0.12953367875647667,
"grad_norm": 15.046182632446289,
"kl": 9.304082870483398,
"learning_rate": 9.9e-07,
"logits/chosen": -36750334.43185299,
"logits/rejected": -38120995.11323764,
"logps/chosen": -490.5138782542113,
"logps/rejected": -373.44328149920256,
"loss": 0.5912,
"loss/base_kto": 3.834928274154663,
"metrics/advantage_var": 241.1676025390625,
"regularization/mmd": 0.8943428993225098,
"regularization/rkhs_norm": 172.32041931152344,
"rewards/chosen": 0.07395970109410892,
"rewards/margins": 0.18977724413606217,
"rewards/rejected": -0.11581754304195326,
"step": 100
},
{
"epoch": 0.15544041450777202,
"grad_norm": 14.61628246307373,
"kl": 12.464029312133789,
"learning_rate": 9.998186234298189e-07,
"logits/chosen": -37586362.43053435,
"logits/rejected": -37443043.328,
"logps/chosen": -491.85190839694656,
"logps/rejected": -361.0565,
"loss": 0.5865,
"loss/base_kto": 3.87249755859375,
"metrics/advantage_var": 199.67323303222656,
"regularization/mmd": 0.8192858099937439,
"regularization/rkhs_norm": 157.85855102539062,
"rewards/chosen": 0.2136779086280415,
"rewards/margins": 0.11438920013194775,
"rewards/rejected": 0.09928870849609375,
"step": 120
},
{
"epoch": 0.18134715025906736,
"grad_norm": 14.474100112915039,
"kl": 12.758808135986328,
"learning_rate": 9.992359552107714e-07,
"logits/chosen": -35743580.66257669,
"logits/rejected": -38627249.73248408,
"logps/chosen": -485.7898773006135,
"logps/rejected": -384.0504329219745,
"loss": 0.5778,
"loss/base_kto": 3.8082337379455566,
"metrics/advantage_var": 186.1129150390625,
"regularization/mmd": 0.8143102526664734,
"regularization/rkhs_norm": 156.8998565673828,
"rewards/chosen": 0.16835581305568204,
"rewards/margins": 0.155821749722523,
"rewards/rejected": 0.01253406333315904,
"step": 140
},
{
"epoch": 0.20725388601036268,
"grad_norm": 18.011737823486328,
"kl": 13.618170738220215,
"learning_rate": 9.982519612796161e-07,
"logits/chosen": -37305216.575712144,
"logits/rejected": -36834078.48613377,
"logps/chosen": -495.27886056971516,
"logps/rejected": -373.70554649265904,
"loss": 0.5813,
"loss/base_kto": 3.7884018421173096,
"metrics/advantage_var": 216.3523712158203,
"regularization/mmd": 0.8617948889732361,
"regularization/rkhs_norm": 166.049072265625,
"rewards/chosen": 0.30625135430331707,
"rewards/margins": 0.18292163163591546,
"rewards/rejected": 0.12332972266740161,
"step": 160
},
{
"epoch": 0.23316062176165803,
"grad_norm": 17.904626846313477,
"kl": 17.634511947631836,
"learning_rate": 9.968674326492213e-07,
"logits/chosen": -35702719.90461997,
"logits/rejected": -36885959.67159277,
"logps/chosen": -466.5516952309985,
"logps/rejected": -359.201867816092,
"loss": 0.5749,
"loss/base_kto": 3.762676239013672,
"metrics/advantage_var": 196.781494140625,
"regularization/mmd": 0.8366878628730774,
"regularization/rkhs_norm": 161.21153259277344,
"rewards/chosen": 0.31675417767907044,
"rewards/margins": 0.21232553088360656,
"rewards/rejected": 0.10442864679546388,
"step": 180
},
{
"epoch": 0.25906735751295334,
"grad_norm": 13.703529357910156,
"kl": 15.65002727508545,
"learning_rate": 9.950834823142198e-07,
"logits/chosen": -37641179.537091985,
"logits/rejected": -39380167.39273927,
"logps/chosen": -488.34597551928783,
"logps/rejected": -382.0031456270627,
"loss": 0.5825,
"loss/base_kto": 3.7953789234161377,
"metrics/advantage_var": 218.0191650390625,
"regularization/mmd": 0.8642555475234985,
"regularization/rkhs_norm": 166.52322387695312,
"rewards/chosen": 0.28980716965672526,
"rewards/margins": 0.1635241472199601,
"rewards/rejected": 0.12628302243676517,
"step": 200
},
{
"epoch": 0.2849740932642487,
"grad_norm": 24.622936248779297,
"kl": 11.670283317565918,
"learning_rate": 9.929015443562942e-07,
"logits/chosen": -37326730.5767285,
"logits/rejected": -38053563.06259097,
"logps/chosen": -479.42780354131537,
"logps/rejected": -380.7495906113537,
"loss": 0.5852,
"loss/base_kto": 3.7580573558807373,
"metrics/advantage_var": 249.5292205810547,
"regularization/mmd": 0.9234267473220825,
"regularization/rkhs_norm": 177.92422485351562,
"rewards/chosen": 0.13914695598222754,
"rewards/margins": 0.2099495529614937,
"rewards/rejected": -0.07080259697926618,
"step": 220
},
{
"epoch": 0.31088082901554404,
"grad_norm": 15.743287086486816,
"kl": 8.136269569396973,
"learning_rate": 9.90323372791347e-07,
"logits/chosen": -35933149.9207607,
"logits/rejected": -36145742.10169491,
"logps/chosen": -466.4460677496038,
"logps/rejected": -377.88212634822804,
"loss": 0.5811,
"loss/base_kto": 3.7892513275146484,
"metrics/advantage_var": 212.422607421875,
"regularization/mmd": 0.8593311309814453,
"regularization/rkhs_norm": 165.5743865966797,
"rewards/chosen": 0.029862895064799798,
"rewards/margins": 0.2177220761441647,
"rewards/rejected": -0.1878591810793649,
"step": 240
},
{
"epoch": 0.33678756476683935,
"grad_norm": 16.04319953918457,
"kl": 6.755073547363281,
"learning_rate": 9.87351040159484e-07,
"logits/chosen": -35730253.35825545,
"logits/rejected": -35731314.75862069,
"logps/chosen": -479.7824182242991,
"logps/rejected": -379.6119710031348,
"loss": 0.5825,
"loss/base_kto": 3.7791366577148438,
"metrics/advantage_var": 230.1333465576172,
"regularization/mmd": 0.880833625793457,
"regularization/rkhs_norm": 169.7174835205078,
"rewards/chosen": 0.06319318753536617,
"rewards/margins": 0.20973908798186036,
"rewards/rejected": -0.14654590044649418,
"step": 260
},
{
"epoch": 0.3626943005181347,
"grad_norm": 14.483595848083496,
"kl": 8.073613166809082,
"learning_rate": 9.839869358589396e-07,
"logits/chosen": -35130597.945072696,
"logits/rejected": -37963147.03782148,
"logps/chosen": -505.0274131663974,
"logps/rejected": -364.7469270045386,
"loss": 0.5763,
"loss/base_kto": 3.7302238941192627,
"metrics/advantage_var": 218.50735473632812,
"regularization/mmd": 0.880548894405365,
"regularization/rkhs_norm": 169.66261291503906,
"rewards/chosen": 0.14740888752729325,
"rewards/margins": 0.2510804938248656,
"rewards/rejected": -0.10367160629757233,
"step": 280
},
{
"epoch": 0.38860103626943004,
"grad_norm": 12.326614379882812,
"kl": 6.938302516937256,
"learning_rate": 9.80233764225289e-07,
"logits/chosen": -35278198.035928145,
"logits/rejected": -37310162.823529415,
"logps/chosen": -463.1574663173653,
"logps/rejected": -374.53079044117646,
"loss": 0.5839,
"loss/base_kto": 3.781132459640503,
"metrics/advantage_var": 229.2920379638672,
"regularization/mmd": 0.8904251456260681,
"regularization/rkhs_norm": 171.56553649902344,
"rewards/chosen": 0.06592190337038326,
"rewards/margins": 0.21471668841493494,
"rewards/rejected": -0.14879478504455168,
"step": 300
},
{
"epoch": 0.41450777202072536,
"grad_norm": 14.155945777893066,
"kl": 13.264572143554688,
"learning_rate": 9.760945423574868e-07,
"logits/chosen": -36832059.14054927,
"logits/rejected": -37249687.04387292,
"logps/chosen": -522.9134693053312,
"logps/rejected": -394.5444875189107,
"loss": 0.5837,
"loss/base_kto": 3.7714180946350098,
"metrics/advantage_var": 222.8312225341797,
"regularization/mmd": 0.8983078002929688,
"regularization/rkhs_norm": 173.0843505859375,
"rewards/chosen": 0.2278742874958981,
"rewards/margins": 0.1922227962989959,
"rewards/rejected": 0.03565149119690218,
"step": 320
},
{
"epoch": 0.44041450777202074,
"grad_norm": 14.930360794067383,
"kl": 5.002163887023926,
"learning_rate": 9.71572597692482e-07,
"logits/chosen": -34289873.38019169,
"logits/rejected": -35831310.09174312,
"logps/chosen": -471.3543330670926,
"logps/rejected": -364.5137136850153,
"loss": 0.5842,
"loss/base_kto": 3.77946400642395,
"metrics/advantage_var": 251.5850067138672,
"regularization/mmd": 0.8943830728530884,
"regularization/rkhs_norm": 172.32815551757812,
"rewards/chosen": 0.019760937736438104,
"rewards/margins": 0.21380272358031355,
"rewards/rejected": -0.19404178584387544,
"step": 340
},
{
"epoch": 0.46632124352331605,
"grad_norm": 17.12563133239746,
"kl": 5.303887367248535,
"learning_rate": 9.666715653303588e-07,
"logits/chosen": -34518550.33279483,
"logits/rejected": -35829217.79122542,
"logps/chosen": -496.31078352180936,
"logps/rejected": -365.0048458774584,
"loss": 0.5784,
"loss/base_kto": 3.7350640296936035,
"metrics/advantage_var": 225.28868103027344,
"regularization/mmd": 0.8921697735786438,
"regularization/rkhs_norm": 171.90170288085938,
"rewards/chosen": 0.03668622400533402,
"rewards/margins": 0.2573953971183966,
"rewards/rejected": -0.2207091731130626,
"step": 360
},
{
"epoch": 0.49222797927461137,
"grad_norm": 16.593212127685547,
"kl": 5.176967620849609,
"learning_rate": 9.613953851121528e-07,
"logits/chosen": -35902288.77864992,
"logits/rejected": -36061680.87091757,
"logps/chosen": -482.09399529042383,
"logps/rejected": -355.24023133748057,
"loss": 0.5873,
"loss/base_kto": 3.784255266189575,
"metrics/advantage_var": 238.3084716796875,
"regularization/mmd": 0.9138066172599792,
"regularization/rkhs_norm": 176.0706329345703,
"rewards/chosen": 0.01627715303909086,
"rewards/margins": 0.2028148763727077,
"rewards/rejected": -0.18653772333361684,
"step": 380
},
{
"epoch": 0.5181347150259067,
"grad_norm": 15.823249816894531,
"kl": 4.430182933807373,
"learning_rate": 9.557482984526924e-07,
"logits/chosen": -36196202.463492066,
"logits/rejected": -36116335.064615384,
"logps/chosen": -482.8965277777778,
"logps/rejected": -389.58752403846154,
"loss": 0.5814,
"loss/base_kto": 3.7527215480804443,
"metrics/advantage_var": 236.9881134033203,
"regularization/mmd": 0.8983505368232727,
"regularization/rkhs_norm": 173.0925750732422,
"rewards/chosen": -0.05178233555385044,
"rewards/margins": 0.2334475322346111,
"rewards/rejected": -0.28522986778846154,
"step": 400
},
{
"epoch": 0.5440414507772021,
"grad_norm": 13.52650260925293,
"kl": 8.73814582824707,
"learning_rate": 9.497348449310107e-07,
"logits/chosen": -37322299.760252364,
"logits/rejected": -38061487.15789474,
"logps/chosen": -478.4477523659306,
"logps/rejected": -358.9422407120743,
"loss": 0.5795,
"loss/base_kto": 3.7514564990997314,
"metrics/advantage_var": 219.9439697265625,
"regularization/mmd": 0.8847070932388306,
"regularization/rkhs_norm": 170.4637908935547,
"rewards/chosen": 0.07475940210962145,
"rewards/margins": 0.2192280343854656,
"rewards/rejected": -0.14446863227584414,
"step": 420
},
{
"epoch": 0.5699481865284974,
"grad_norm": 14.851932525634766,
"kl": 10.129216194152832,
"learning_rate": 9.433598586410701e-07,
"logits/chosen": -35613759.209876545,
"logits/rejected": -36460612.05063291,
"logps/chosen": -454.60947145061726,
"logps/rejected": -376.8286194620253,
"loss": 0.5739,
"loss/base_kto": 3.726673126220703,
"metrics/advantage_var": 211.911865234375,
"regularization/mmd": 0.8641713261604309,
"regularization/rkhs_norm": 166.5070037841797,
"rewards/chosen": 0.17373162728768807,
"rewards/margins": 0.23917970017988915,
"rewards/rejected": -0.0654480728922011,
"step": 440
},
{
"epoch": 0.5958549222797928,
"grad_norm": 16.98316764831543,
"kl": 11.698954582214355,
"learning_rate": 9.366284643057313e-07,
"logits/chosen": -35815370.845801525,
"logits/rejected": -36148592.64,
"logps/chosen": -465.42123091603054,
"logps/rejected": -356.472725,
"loss": 0.578,
"loss/base_kto": 3.681044816970825,
"metrics/advantage_var": 263.0597839355469,
"regularization/mmd": 0.9432243704795837,
"regularization/rkhs_norm": 181.73878479003906,
"rewards/chosen": 0.2568790348431536,
"rewards/margins": 0.3083677311322161,
"rewards/rejected": -0.0514886962890625,
"step": 460
},
{
"epoch": 0.6217616580310881,
"grad_norm": 18.69508934020996,
"kl": 14.229891777038574,
"learning_rate": 9.295460731570917e-07,
"logits/chosen": -37249244.21505377,
"logits/rejected": -37633168.89030207,
"logps/chosen": -494.7801459293395,
"logps/rejected": -388.1153616852146,
"loss": 0.5859,
"loss/base_kto": 3.6975953578948975,
"metrics/advantage_var": 285.19891357421875,
"regularization/mmd": 0.9894009828567505,
"regularization/rkhs_norm": 190.6360321044922,
"rewards/chosen": 0.29050962386592744,
"rewards/margins": 0.29268515360062536,
"rewards/rejected": -0.0021755297346979334,
"step": 480
},
{
"epoch": 0.6476683937823834,
"grad_norm": 13.925016403198242,
"kl": 16.193500518798828,
"learning_rate": 9.221183785865056e-07,
"logits/chosen": -35656988.706605226,
"logits/rejected": -37467951.61844197,
"logps/chosen": -465.0112807219662,
"logps/rejected": -384.5026331478537,
"loss": 0.5786,
"loss/base_kto": 3.7520835399627686,
"metrics/advantage_var": 226.3187255859375,
"regularization/mmd": 0.876621425151825,
"regularization/rkhs_norm": 168.90586853027344,
"rewards/chosen": 0.2240577381327405,
"rewards/margins": 0.21612428372532297,
"rewards/rejected": 0.007933454407417528,
"step": 500
},
{
"epoch": 0.6735751295336787,
"grad_norm": 15.746620178222656,
"kl": 9.902660369873047,
"learning_rate": 9.143513515677817e-07,
"logits/chosen": -36418136.83280757,
"logits/rejected": -37338102.489164084,
"logps/chosen": -465.4365634858044,
"logps/rejected": -379.03957043343655,
"loss": 0.5871,
"loss/base_kto": 3.785489797592163,
"metrics/advantage_var": 242.4727783203125,
"regularization/mmd": 0.9116144180297852,
"regularization/rkhs_norm": 175.6482391357422,
"rewards/chosen": 0.1177103060653157,
"rewards/margins": 0.18170398443876468,
"rewards/rejected": -0.06399367837344899,
"step": 520
},
{
"epoch": 0.6994818652849741,
"grad_norm": 15.057689666748047,
"kl": 15.38354206085205,
"learning_rate": 9.062512358572373e-07,
"logits/chosen": -36851674.59360731,
"logits/rejected": -36642947.492776886,
"logps/chosen": -500.0726788432268,
"logps/rejected": -359.93649678972713,
"loss": 0.5677,
"loss/base_kto": 3.6362855434417725,
"metrics/advantage_var": 236.0905303955078,
"regularization/mmd": 0.9051849246025085,
"regularization/rkhs_norm": 174.40945434570312,
"rewards/chosen": 0.3106789784888699,
"rewards/margins": 0.3464053420367936,
"rewards/rejected": -0.03572636354792367,
"step": 540
},
{
"epoch": 0.7253886010362695,
"grad_norm": 14.786884307861328,
"kl": 16.252817153930664,
"learning_rate": 8.978245429744691e-07,
"logits/chosen": -36130636.29652043,
"logits/rejected": -36427646.96607431,
"logps/chosen": -496.38705559757943,
"logps/rejected": -385.2689317447496,
"loss": 0.5856,
"loss/base_kto": 3.7102839946746826,
"metrics/advantage_var": 268.5868225097656,
"regularization/mmd": 0.9748560190200806,
"regularization/rkhs_norm": 187.8335418701172,
"rewards/chosen": 0.3056913020931827,
"rewards/margins": 0.2599889825551094,
"rewards/rejected": 0.04570231953807331,
"step": 560
},
{
"epoch": 0.7512953367875648,
"grad_norm": 14.099896430969238,
"kl": 19.939496994018555,
"learning_rate": 8.890780469678738e-07,
"logits/chosen": -36829003.85185185,
"logits/rejected": -37800435.037974685,
"logps/chosen": -504.62191358024694,
"logps/rejected": -367.6693285205696,
"loss": 0.5723,
"loss/base_kto": 3.695143938064575,
"metrics/advantage_var": 217.6491241455078,
"regularization/mmd": 0.8835013508796692,
"regularization/rkhs_norm": 170.23147583007812,
"rewards/chosen": 0.3421223251907914,
"rewards/margins": 0.23950373349589918,
"rewards/rejected": 0.10261859169489221,
"step": 580
},
{
"epoch": 0.7772020725388601,
"grad_norm": 16.136192321777344,
"kl": 9.32910442352295,
"learning_rate": 8.800187789691269e-07,
"logits/chosen": -36956643.55555555,
"logits/rejected": -37741010.63291139,
"logps/chosen": -524.8196855709876,
"logps/rejected": -366.2413963607595,
"loss": 0.5775,
"loss/base_kto": 3.747807264328003,
"metrics/advantage_var": 220.1378173828125,
"regularization/mmd": 0.8723760843276978,
"regularization/rkhs_norm": 168.087890625,
"rewards/chosen": 0.1329013447702667,
"rewards/margins": 0.23484869460833036,
"rewards/rejected": -0.10194734983806368,
"step": 600
},
{
"epoch": 0.8031088082901554,
"grad_norm": 21.093189239501953,
"kl": 10.337899208068848,
"learning_rate": 8.706540215409981e-07,
"logits/chosen": -34430201.952755906,
"logits/rejected": -36404139.85736434,
"logps/chosen": -476.6104330708661,
"logps/rejected": -383.88822674418606,
"loss": 0.5831,
"loss/base_kto": 3.7550950050354004,
"metrics/advantage_var": 256.0594787597656,
"regularization/mmd": 0.9093719720840454,
"regularization/rkhs_norm": 175.21617126464844,
"rewards/chosen": 0.10829953171136811,
"rewards/margins": 0.18434801160477896,
"rewards/rejected": -0.07604847989341085,
"step": 620
},
{
"epoch": 0.8290155440414507,
"grad_norm": 16.082395553588867,
"kl": 8.053885459899902,
"learning_rate": 8.609913028230462e-07,
"logits/chosen": -35425285.04433498,
"logits/rejected": -37677919.76154993,
"logps/chosen": -481.14706486042695,
"logps/rejected": -369.09719634873323,
"loss": 0.5824,
"loss/base_kto": 3.744581937789917,
"metrics/advantage_var": 239.15542602539062,
"regularization/mmd": 0.9146170020103455,
"regularization/rkhs_norm": 176.22679138183594,
"rewards/chosen": 0.05715729411208179,
"rewards/margins": 0.23221122745041195,
"rewards/rejected": -0.17505393333833016,
"step": 640
},
{
"epoch": 0.8549222797927462,
"grad_norm": 14.41285228729248,
"kl": 9.332486152648926,
"learning_rate": 8.510383904798994e-07,
"logits/chosen": -34698492.01246106,
"logits/rejected": -35375726.7460815,
"logps/chosen": -454.7192367601246,
"logps/rejected": -385.7163989028213,
"loss": 0.5881,
"loss/base_kto": 3.765181064605713,
"metrics/advantage_var": 250.76968383789062,
"regularization/mmd": 0.9399226307868958,
"regularization/rkhs_norm": 181.10263061523438,
"rewards/chosen": 0.11088201932817976,
"rewards/margins": 0.2165571336877813,
"rewards/rejected": -0.10567511435960154,
"step": 660
},
{
"epoch": 0.8808290155440415,
"grad_norm": 14.423428535461426,
"kl": 14.862100601196289,
"learning_rate": 8.408032854569865e-07,
"logits/chosen": -35039565.84326019,
"logits/rejected": -36648494.25545172,
"logps/chosen": -494.4254506269593,
"logps/rejected": -377.2711253894081,
"loss": 0.5786,
"loss/base_kto": 3.728292942047119,
"metrics/advantage_var": 232.7931671142578,
"regularization/mmd": 0.9003773927688599,
"regularization/rkhs_norm": 173.4831085205078,
"rewards/chosen": 0.25897384213055935,
"rewards/margins": 0.22975997244746302,
"rewards/rejected": 0.029213869683096343,
"step": 680
},
{
"epoch": 0.9067357512953368,
"grad_norm": 14.714305877685547,
"kl": 10.654457092285156,
"learning_rate": 8.302942155487377e-07,
"logits/chosen": -35113917.88346457,
"logits/rejected": -36209268.68837209,
"logps/chosen": -488.20344488188977,
"logps/rejected": -345.6830910852713,
"loss": 0.5819,
"loss/base_kto": 3.7753243446350098,
"metrics/advantage_var": 226.36376953125,
"regularization/mmd": 0.8800527453422546,
"regularization/rkhs_norm": 169.56700134277344,
"rewards/chosen": 0.08953093280942422,
"rewards/margins": 0.18774708573986876,
"rewards/rejected": -0.09821615293044453,
"step": 700
},
{
"epoch": 0.9326424870466321,
"grad_norm": 16.04747772216797,
"kl": 10.848597526550293,
"learning_rate": 8.195196287844278e-07,
"logits/chosen": -36346454.25656878,
"logits/rejected": -37313227.02053712,
"logps/chosen": -500.8554385625966,
"logps/rejected": -379.5542061611374,
"loss": 0.5857,
"loss/base_kto": 3.7539193630218506,
"metrics/advantage_var": 289.1528015136719,
"regularization/mmd": 0.9315635561943054,
"regularization/rkhs_norm": 179.4920196533203,
"rewards/chosen": 0.12201917079353627,
"rewards/margins": 0.21513198979623918,
"rewards/rejected": -0.0931128190027029,
"step": 720
},
{
"epoch": 0.9585492227979274,
"grad_norm": 17.332683563232422,
"kl": 12.433494567871094,
"learning_rate": 8.08488186636975e-07,
"logits/chosen": -36929741.46278317,
"logits/rejected": -37516421.027190335,
"logps/chosen": -492.72314927184465,
"logps/rejected": -386.1748017371601,
"loss": 0.5809,
"loss/base_kto": 3.727473020553589,
"metrics/advantage_var": 243.08250427246094,
"regularization/mmd": 0.9198707938194275,
"regularization/rkhs_norm": 177.2390594482422,
"rewards/chosen": 0.15290815236113217,
"rewards/margins": 0.2302717687513028,
"rewards/rejected": -0.07736361639017064,
"step": 740
},
{
"epoch": 0.9844559585492227,
"grad_norm": 14.800250053405762,
"kl": 8.272868156433105,
"learning_rate": 7.972087570601576e-07,
"logits/chosen": -35740746.76825397,
"logits/rejected": -37316790.74461538,
"logps/chosen": -477.70992063492065,
"logps/rejected": -360.88326923076926,
"loss": 0.5816,
"loss/base_kto": 3.7273449897766113,
"metrics/advantage_var": 246.2641143798828,
"regularization/mmd": 0.9251508712768555,
"regularization/rkhs_norm": 178.2564239501953,
"rewards/chosen": 0.00815635635739281,
"rewards/margins": 0.2315292529920082,
"rewards/rejected": -0.22337289663461538,
"step": 760
},
{
"epoch": 1.0103626943005182,
"grad_norm": 8.796030044555664,
"kl": 6.298320293426514,
"learning_rate": 7.856904073598458e-07,
"logits/chosen": -34560059.65048543,
"logits/rejected": -35027130.18181818,
"logps/chosen": -467.2739178802589,
"logps/rejected": -387.8612215909091,
"loss": 0.5722,
"loss/base_kto": 3.5254478454589844,
"metrics/advantage_var": 362.2047424316406,
"regularization/mmd": 1.0523730516433716,
"regularization/rkhs_norm": 202.76939392089844,
"rewards/chosen": 0.14243385784062754,
"rewards/margins": 0.4932251647697824,
"rewards/rejected": -0.35079130692915483,
"step": 780
},
{
"epoch": 1.0362694300518134,
"grad_norm": 16.780546188354492,
"kl": 10.918546676635742,
"learning_rate": 7.739423969049761e-07,
"logits/chosen": -35739378.27871363,
"logits/rejected": -36621637.00159489,
"logps/chosen": -463.666586906585,
"logps/rejected": -387.4616726475279,
"loss": 0.5696,
"loss/base_kto": 3.2663350105285645,
"metrics/advantage_var": 559.0786743164062,
"regularization/mmd": 1.2902926206588745,
"regularization/rkhs_norm": 248.61131286621094,
"rewards/chosen": 0.449957340818817,
"rewards/margins": 0.8422214073294205,
"rewards/rejected": -0.3922640665106036,
"step": 800
},
{
"epoch": 1.0621761658031088,
"grad_norm": 13.12932014465332,
"kl": 18.999629974365234,
"learning_rate": 7.619741696841322e-07,
"logits/chosen": -34947555.018867925,
"logits/rejected": -36489925.16770186,
"logps/chosen": -442.7131977201258,
"logps/rejected": -391.82603843167703,
"loss": 0.5645,
"loss/base_kto": 3.246511220932007,
"metrics/advantage_var": 518.4884643554688,
"regularization/mmd": 1.2694826126098633,
"regularization/rkhs_norm": 244.60166931152344,
"rewards/chosen": 0.5303995384360259,
"rewards/margins": 0.7891794314463254,
"rewards/rejected": -0.2587798930102994,
"step": 820
},
{
"epoch": 1.0880829015544042,
"grad_norm": 9.967662811279297,
"kl": 6.526576519012451,
"learning_rate": 7.497953467137135e-07,
"logits/chosen": -35417250.03588907,
"logits/rejected": -35428815.64017991,
"logps/chosen": -511.6195962479608,
"logps/rejected": -366.17344452773614,
"loss": 0.5673,
"loss/base_kto": 3.1759274005889893,
"metrics/advantage_var": 602.5060424804688,
"regularization/mmd": 1.3626421689987183,
"regularization/rkhs_norm": 262.5514831542969,
"rewards/chosen": 0.3481656894403803,
"rewards/margins": 0.9205143112720425,
"rewards/rejected": -0.5723486218316622,
"step": 840
},
{
"epoch": 1.1139896373056994,
"grad_norm": 11.86622142791748,
"kl": 8.370628356933594,
"learning_rate": 7.37415718303793e-07,
"logits/chosen": -36123243.83151326,
"logits/rejected": -36291444.58215962,
"logps/chosen": -461.5860471918877,
"logps/rejected": -374.5848982785603,
"loss": 0.5643,
"loss/base_kto": 3.240628957748413,
"metrics/advantage_var": 543.981689453125,
"regularization/mmd": 1.2740906476974487,
"regularization/rkhs_norm": 245.48953247070312,
"rewards/chosen": 0.3063705849015211,
"rewards/margins": 0.820691638992997,
"rewards/rejected": -0.514321054091476,
"step": 860
},
{
"epoch": 1.1398963730569949,
"grad_norm": 10.228275299072266,
"kl": 20.769678115844727,
"learning_rate": 7.248452361878855e-07,
"logits/chosen": -35856915.54198473,
"logits/rejected": -36818753.9456,
"logps/chosen": -459.0350190839695,
"logps/rejected": -369.253525,
"loss": 0.5539,
"loss/base_kto": 3.094128370285034,
"metrics/advantage_var": 562.14501953125,
"regularization/mmd": 1.3369877338409424,
"regularization/rkhs_norm": 257.6084289550781,
"rewards/chosen": 0.6964062872733778,
"rewards/margins": 0.9727445929374403,
"rewards/rejected": -0.2763383056640625,
"step": 880
},
{
"epoch": 1.16580310880829,
"grad_norm": 12.683265686035156,
"kl": 13.78448486328125,
"learning_rate": 7.120940055229497e-07,
"logits/chosen": -37744494.59818731,
"logits/rejected": -37460488.284789644,
"logps/chosen": -507.40563632930514,
"logps/rejected": -383.04634405339806,
"loss": 0.5758,
"loss/base_kto": 3.207179307937622,
"metrics/advantage_var": 653.6361694335938,
"regularization/mmd": 1.3994256258010864,
"regularization/rkhs_norm": 269.63885498046875,
"rewards/chosen": 0.5503196140070337,
"rewards/margins": 0.8896718235982048,
"rewards/rejected": -0.33935220959117113,
"step": 900
},
{
"epoch": 1.1917098445595855,
"grad_norm": 11.519844055175781,
"kl": 10.403990745544434,
"learning_rate": 6.991722767660556e-07,
"logits/chosen": -35192848.84210526,
"logits/rejected": -35591631.23809524,
"logps/chosen": -488.888671875,
"logps/rejected": -376.9961867559524,
"loss": 0.5679,
"loss/base_kto": 3.162940263748169,
"metrics/advantage_var": 678.7843627929688,
"regularization/mmd": 1.3800307512283325,
"regularization/rkhs_norm": 265.9018859863281,
"rewards/chosen": 0.44200319992868525,
"rewards/margins": 0.9566270689617722,
"rewards/rejected": -0.5146238690330869,
"step": 920
},
{
"epoch": 1.2176165803108807,
"grad_norm": 14.86784839630127,
"kl": 12.996451377868652,
"learning_rate": 6.860904374342499e-07,
"logits/chosen": -36329521.23076923,
"logits/rejected": -37399982.82926829,
"logps/chosen": -488.44190705128204,
"logps/rejected": -372.8462271341463,
"loss": 0.5731,
"loss/base_kto": 3.1849658489227295,
"metrics/advantage_var": 616.439453125,
"regularization/mmd": 1.400101900100708,
"regularization/rkhs_norm": 269.7691345214844,
"rewards/chosen": 0.5117607116699219,
"rewards/margins": 0.909477513010909,
"rewards/rejected": -0.397716801340987,
"step": 940
},
{
"epoch": 1.2435233160621761,
"grad_norm": 12.045408248901367,
"kl": 11.645041465759277,
"learning_rate": 6.7285900375424e-07,
"logits/chosen": -36871137.835658915,
"logits/rejected": -38185995.28818898,
"logps/chosen": -492.06763565891475,
"logps/rejected": -380.04018208661415,
"loss": 0.5669,
"loss/base_kto": 3.208451986312866,
"metrics/advantage_var": 539.9119873046875,
"regularization/mmd": 1.3271362781524658,
"regularization/rkhs_norm": 255.7102508544922,
"rewards/chosen": 0.45313749091569766,
"rewards/margins": 0.8564526610836356,
"rewards/rejected": -0.403315170167938,
"step": 960
},
{
"epoch": 1.2694300518134716,
"grad_norm": 13.22069263458252,
"kl": 12.721824645996094,
"learning_rate": 6.594886122086123e-07,
"logits/chosen": -35281307.51401869,
"logits/rejected": -36470151.623824455,
"logps/chosen": -474.9979556074766,
"logps/rejected": -394.079006661442,
"loss": 0.5703,
"loss/base_kto": 3.217174530029297,
"metrics/advantage_var": 539.5971069335938,
"regularization/mmd": 1.3451206684112549,
"regularization/rkhs_norm": 259.17547607421875,
"rewards/chosen": 0.49599230995059385,
"rewards/margins": 0.8761570273826937,
"rewards/rejected": -0.38016471743209984,
"step": 980
},
{
"epoch": 1.2953367875647668,
"grad_norm": 13.768370628356934,
"kl": 14.06915283203125,
"learning_rate": 6.459900109853766e-07,
"logits/chosen": -34588707.5892575,
"logits/rejected": -34524313.52086553,
"logps/chosen": -470.2716725908373,
"logps/rejected": -405.7633307573416,
"loss": 0.5818,
"loss/base_kto": 3.2592437267303467,
"metrics/advantage_var": 650.3941040039062,
"regularization/mmd": 1.3952311277389526,
"regularization/rkhs_norm": 268.8306579589844,
"rewards/chosen": 0.43066994424491506,
"rewards/margins": 0.8314947018400658,
"rewards/rejected": -0.4008247575951507,
"step": 1000
},
{
"epoch": 1.3212435233160622,
"grad_norm": 15.858077049255371,
"kl": 17.79615592956543,
"learning_rate": 6.323740513377171e-07,
"logits/chosen": -35441875.54491018,
"logits/rejected": -35059216.732026145,
"logps/chosen": -476.67215568862275,
"logps/rejected": -385.0362796160131,
"loss": 0.5624,
"loss/base_kto": 3.196995496749878,
"metrics/advantage_var": 541.07373046875,
"regularization/mmd": 1.3020113706588745,
"regularization/rkhs_norm": 250.86924743652344,
"rewards/chosen": 0.5837789295676226,
"rewards/margins": 0.8488349412911596,
"rewards/rejected": -0.26505601172353704,
"step": 1020
},
{
"epoch": 1.3471502590673574,
"grad_norm": 14.126097679138184,
"kl": 20.838333129882812,
"learning_rate": 6.186516788608865e-07,
"logits/chosen": -34667620.09022556,
"logits/rejected": -36130579.56422764,
"logps/chosen": -509.91494360902254,
"logps/rejected": -364.2094004065041,
"loss": 0.5678,
"loss/base_kto": 3.2881786823272705,
"metrics/advantage_var": 461.0966796875,
"regularization/mmd": 1.2540638446807861,
"regularization/rkhs_norm": 241.6307830810547,
"rewards/chosen": 0.5731052943638393,
"rewards/margins": 0.7670012204904589,
"rewards/rejected": -0.19389592612661966,
"step": 1040
},
{
"epoch": 1.3730569948186528,
"grad_norm": 13.985225677490234,
"kl": 16.84873390197754,
"learning_rate": 6.048339246932652e-07,
"logits/chosen": -35178023.133757964,
"logits/rejected": -35479306.99386503,
"logps/chosen": -491.51462977707007,
"logps/rejected": -377.34854294478527,
"loss": 0.5766,
"loss/base_kto": 3.1906678676605225,
"metrics/advantage_var": 649.16259765625,
"regularization/mmd": 1.4221806526184082,
"regularization/rkhs_norm": 274.0232849121094,
"rewards/chosen": 0.6344547636190038,
"rewards/margins": 0.9031659941251986,
"rewards/rejected": -0.2687112305061949,
"step": 1060
},
{
"epoch": 1.3989637305699483,
"grad_norm": 13.469324111938477,
"kl": 10.265970230102539,
"learning_rate": 5.909318966486494e-07,
"logits/chosen": -36038125.278219394,
"logits/rejected": -37385028.817204304,
"logps/chosen": -503.97322138314786,
"logps/rejected": -367.8606950844854,
"loss": 0.5608,
"loss/base_kto": 3.1485276222229004,
"metrics/advantage_var": 526.8321533203125,
"regularization/mmd": 1.3380202054977417,
"regularization/rkhs_norm": 257.8074035644531,
"rewards/chosen": 0.47844770034280604,
"rewards/margins": 0.9144246341165676,
"rewards/rejected": -0.4359769337737615,
"step": 1080
},
{
"epoch": 1.4248704663212435,
"grad_norm": 9.046934127807617,
"kl": 16.51395034790039,
"learning_rate": 5.769567702869052e-07,
"logits/chosen": -34729330.04361371,
"logits/rejected": -36002616.97805642,
"logps/chosen": -469.17416277258565,
"logps/rejected": -377.32381465517244,
"loss": 0.5561,
"loss/base_kto": 3.212134599685669,
"metrics/advantage_var": 491.69171142578125,
"regularization/mmd": 1.2363241910934448,
"regularization/rkhs_norm": 238.21275329589844,
"rewards/chosen": 0.4971886750693633,
"rewards/margins": 0.8227839687422179,
"rewards/rejected": -0.3255952936728546,
"step": 1100
},
{
"epoch": 1.450777202072539,
"grad_norm": 13.699871063232422,
"kl": 12.540992736816406,
"learning_rate": 5.629197799301614e-07,
"logits/chosen": -35314302.55250404,
"logits/rejected": -36094472.5204236,
"logps/chosen": -469.674071082391,
"logps/rejected": -378.0487660741301,
"loss": 0.56,
"loss/base_kto": 3.1778485774993896,
"metrics/advantage_var": 510.32958984375,
"regularization/mmd": 1.3021544218063354,
"regularization/rkhs_norm": 250.8968048095703,
"rewards/chosen": 0.4937756958993841,
"rewards/margins": 0.8691603512732848,
"rewards/rejected": -0.3753846553739008,
"step": 1120
},
{
"epoch": 1.4766839378238341,
"grad_norm": 13.748052597045898,
"kl": 7.949827671051025,
"learning_rate": 5.488322096317633e-07,
"logits/chosen": -34263613.04928458,
"logits/rejected": -35533221.55453149,
"logps/chosen": -486.01952503974564,
"logps/rejected": -376.6563220046083,
"loss": 0.5637,
"loss/base_kto": 3.226621389389038,
"metrics/advantage_var": 541.7657470703125,
"regularization/mmd": 1.2831403017044067,
"regularization/rkhs_norm": 247.2332000732422,
"rewards/chosen": 0.3904226330391743,
"rewards/margins": 0.8421150882313067,
"rewards/rejected": -0.4516924551921323,
"step": 1140
},
{
"epoch": 1.5025906735751295,
"grad_norm": 16.558958053588867,
"kl": 7.912838935852051,
"learning_rate": 5.347053841052518e-07,
"logits/chosen": -34892940.613893375,
"logits/rejected": -36078274.42057489,
"logps/chosen": -483.1467588852989,
"logps/rejected": -374.8048411497731,
"loss": 0.5645,
"loss/base_kto": 3.155876636505127,
"metrics/advantage_var": 615.82958984375,
"regularization/mmd": 1.3601619005203247,
"regularization/rkhs_norm": 262.0735778808594,
"rewards/chosen": 0.43474848782688813,
"rewards/margins": 0.9497797570331098,
"rewards/rejected": -0.5150312692062217,
"step": 1160
},
{
"epoch": 1.528497409326425,
"grad_norm": 13.430770874023438,
"kl": 13.892699241638184,
"learning_rate": 5.205506596206531e-07,
"logits/chosen": -34218263.87138264,
"logits/rejected": -35506754.91793313,
"logps/chosen": -497.61223874598073,
"logps/rejected": -345.22314304711244,
"loss": 0.5528,
"loss/base_kto": 3.1559383869171143,
"metrics/advantage_var": 486.2275390625,
"regularization/mmd": 1.2661854028701782,
"regularization/rkhs_norm": 243.9663543701172,
"rewards/chosen": 0.552090512977919,
"rewards/margins": 0.8996528912786409,
"rewards/rejected": -0.3475623783007219,
"step": 1180
},
{
"epoch": 1.5544041450777202,
"grad_norm": 15.6405668258667,
"kl": 14.188281059265137,
"learning_rate": 5.063794148754032e-07,
"logits/chosen": -34322806.30014859,
"logits/rejected": -37109854.47116969,
"logps/chosen": -503.85944465081724,
"logps/rejected": -364.56785420098845,
"loss": 0.5777,
"loss/base_kto": 3.1833126544952393,
"metrics/advantage_var": 741.0894165039062,
"regularization/mmd": 1.4379055500030518,
"regularization/rkhs_norm": 277.0531005859375,
"rewards/chosen": 0.5156612311217265,
"rewards/margins": 0.8787353688266919,
"rewards/rejected": -0.3630741377049655,
"step": 1200
},
{
"epoch": 1.5803108808290154,
"grad_norm": 28.624948501586914,
"kl": 12.644123077392578,
"learning_rate": 4.922030418472422e-07,
"logits/chosen": -34743139.68847352,
"logits/rejected": -36302250.93416928,
"logps/chosen": -463.32496105919006,
"logps/rejected": -376.3301332288401,
"loss": 0.5646,
"loss/base_kto": 3.245013475418091,
"metrics/advantage_var": 545.5440673828125,
"regularization/mmd": 1.271781325340271,
"regularization/rkhs_norm": 245.04458618164062,
"rewards/chosen": 0.5009703829281056,
"rewards/margins": 0.8233771158520378,
"rewards/rejected": -0.32240673292393224,
"step": 1220
},
{
"epoch": 1.6062176165803108,
"grad_norm": 11.098860740661621,
"kl": 13.221571922302246,
"learning_rate": 4.780329366364336e-07,
"logits/chosen": -34350759.41587301,
"logits/rejected": -36409989.907692306,
"logps/chosen": -507.50555555555553,
"logps/rejected": -376.8789903846154,
"loss": 0.5695,
"loss/base_kto": 3.155639171600342,
"metrics/advantage_var": 640.3905029296875,
"regularization/mmd": 1.4001741409301758,
"regularization/rkhs_norm": 269.7830810546875,
"rewards/chosen": 0.5849505227709574,
"rewards/margins": 0.9541778881180127,
"rewards/rejected": -0.3692273653470553,
"step": 1240
},
{
"epoch": 1.6321243523316062,
"grad_norm": 13.457465171813965,
"kl": 13.062397956848145,
"learning_rate": 4.638804903046684e-07,
"logits/chosen": -34188224.50874404,
"logits/rejected": -35642448.22119816,
"logps/chosen": -482.57839825119237,
"logps/rejected": -355.75254416282644,
"loss": 0.5626,
"loss/base_kto": 3.2334468364715576,
"metrics/advantage_var": 501.9878845214844,
"regularization/mmd": 1.2672839164733887,
"regularization/rkhs_norm": 244.1780242919922,
"rewards/chosen": 0.4810851662640352,
"rewards/margins": 0.8089145067168242,
"rewards/rejected": -0.327829340452789,
"step": 1260
},
{
"epoch": 1.6580310880829017,
"grad_norm": 9.959589958190918,
"kl": 10.90673828125,
"learning_rate": 4.497570797180217e-07,
"logits/chosen": -35522215.98744113,
"logits/rejected": -36263321.281493,
"logps/chosen": -472.88196624803766,
"logps/rejected": -369.7211314152411,
"loss": 0.5723,
"loss/base_kto": 3.2004776000976562,
"metrics/advantage_var": 601.2073364257812,
"regularization/mmd": 1.3777668476104736,
"regularization/rkhs_norm": 265.4656677246094,
"rewards/chosen": 0.44117609859448587,
"rewards/margins": 0.8610656999504345,
"rewards/rejected": -0.41988960135594866,
"step": 1280
},
{
"epoch": 1.6839378238341969,
"grad_norm": 10.555566787719727,
"kl": 14.242239952087402,
"learning_rate": 4.3567405840131853e-07,
"logits/chosen": -33768006.42967542,
"logits/rejected": -35118029.85150079,
"logps/chosen": -469.5661707882535,
"logps/rejected": -368.74012638230647,
"loss": 0.5527,
"loss/base_kto": 3.1599979400634766,
"metrics/advantage_var": 506.82470703125,
"regularization/mmd": 1.2614637613296509,
"regularization/rkhs_norm": 243.0565948486328,
"rewards/chosen": 0.531270942511109,
"rewards/margins": 0.8937158758796171,
"rewards/rejected": -0.3624449333685081,
"step": 1300
},
{
"epoch": 1.709844559585492,
"grad_norm": 11.619686126708984,
"kl": 9.854671478271484,
"learning_rate": 4.2164274741126506e-07,
"logits/chosen": -35102347.63636363,
"logits/rejected": -35890413.4939759,
"logps/chosen": -484.1734983766234,
"logps/rejected": -387.3549510542169,
"loss": 0.5709,
"loss/base_kto": 3.2288010120391846,
"metrics/advantage_var": 594.1427612304688,
"regularization/mmd": 1.3385165929794312,
"regularization/rkhs_norm": 257.90301513671875,
"rewards/chosen": 0.46015707238928066,
"rewards/margins": 0.8614431401221261,
"rewards/rejected": -0.4012860677328454,
"step": 1320
},
{
"epoch": 1.7357512953367875,
"grad_norm": 15.014073371887207,
"kl": 9.039198875427246,
"learning_rate": 4.0767442623567856e-07,
"logits/chosen": -35080624.8085758,
"logits/rejected": -36249443.215311006,
"logps/chosen": -483.1822358346095,
"logps/rejected": -375.1662679425837,
"loss": 0.5656,
"loss/base_kto": 3.224367618560791,
"metrics/advantage_var": 550.4187622070312,
"regularization/mmd": 1.300495982170105,
"regularization/rkhs_norm": 250.57725524902344,
"rewards/chosen": 0.4142883674656633,
"rewards/margins": 0.865131606600432,
"rewards/rejected": -0.45084323913476876,
"step": 1340
},
{
"epoch": 1.761658031088083,
"grad_norm": 11.960787773132324,
"kl": 13.760507583618164,
"learning_rate": 3.937803237261357e-07,
"logits/chosen": -34482436.711656444,
"logits/rejected": -35953145.477707006,
"logps/chosen": -483.8002300613497,
"logps/rejected": -383.39570063694265,
"loss": 0.5548,
"loss/base_kto": 3.189375638961792,
"metrics/advantage_var": 481.8376159667969,
"regularization/mmd": 1.249145269393921,
"regularization/rkhs_norm": 240.68309020996094,
"rewards/chosen": 0.49734628127396474,
"rewards/margins": 0.8299500031355914,
"rewards/rejected": -0.3326037218616267,
"step": 1360
},
{
"epoch": 1.7875647668393784,
"grad_norm": 15.612455368041992,
"kl": 18.639978408813477,
"learning_rate": 3.7997160907132456e-07,
"logits/chosen": -35105800.03767661,
"logits/rejected": -35919365.57387247,
"logps/chosen": -473.2154140502355,
"logps/rejected": -392.6224241835148,
"loss": 0.5577,
"loss/base_kto": 3.197514057159424,
"metrics/advantage_var": 516.6060791015625,
"regularization/mmd": 1.2640329599380493,
"regularization/rkhs_norm": 243.5516357421875,
"rewards/chosen": 0.5329540019132653,
"rewards/margins": 0.8422518394272378,
"rewards/rejected": -0.3092978375139726,
"step": 1380
},
{
"epoch": 1.8134715025906736,
"grad_norm": 13.539543151855469,
"kl": 12.182269096374512,
"learning_rate": 3.662593828183601e-07,
"logits/chosen": -35346172.52488688,
"logits/rejected": -35774855.67585089,
"logps/chosen": -473.17444381598796,
"logps/rejected": -350.419545178282,
"loss": 0.5706,
"loss/base_kto": 3.2329118251800537,
"metrics/advantage_var": 542.537109375,
"regularization/mmd": 1.3316736221313477,
"regularization/rkhs_norm": 256.58453369140625,
"rewards/chosen": 0.5181275334653092,
"rewards/margins": 0.8476684600600974,
"rewards/rejected": -0.3295409265947883,
"step": 1400
},
{
"epoch": 1.8393782383419688,
"grad_norm": 10.709891319274902,
"kl": 9.94327449798584,
"learning_rate": 3.5265466794927725e-07,
"logits/chosen": -35305236.82296651,
"logits/rejected": -35859495.203675345,
"logps/chosen": -484.4208034290271,
"logps/rejected": -359.55044027565083,
"loss": 0.5594,
"loss/base_kto": 3.2328438758850098,
"metrics/advantage_var": 489.0275573730469,
"regularization/mmd": 1.242189645767212,
"regularization/rkhs_norm": 239.3428955078125,
"rewards/chosen": 0.4519747257993172,
"rewards/margins": 0.8191801250832711,
"rewards/rejected": -0.36720539928395385,
"step": 1420
},
{
"epoch": 1.8652849740932642,
"grad_norm": 13.026509284973145,
"kl": 14.385235786437988,
"learning_rate": 3.3916840101987887e-07,
"logits/chosen": -33401099.403993856,
"logits/rejected": -34391699.33227345,
"logps/chosen": -475.46548579109066,
"logps/rejected": -352.3910472972973,
"loss": 0.5597,
"loss/base_kto": 3.1858298778533936,
"metrics/advantage_var": 524.2139892578125,
"regularization/mmd": 1.2919800281524658,
"regularization/rkhs_norm": 248.93643188476562,
"rewards/chosen": 0.5690245738227246,
"rewards/margins": 0.8721156503082175,
"rewards/rejected": -0.3030910764854928,
"step": 1440
},
{
"epoch": 1.8911917098445596,
"grad_norm": 9.928730010986328,
"kl": 13.804104804992676,
"learning_rate": 3.258114233680583e-07,
"logits/chosen": -34858126.6625387,
"logits/rejected": -35866927.646687694,
"logps/chosen": -468.6269349845201,
"logps/rejected": -394.26695583596216,
"loss": 0.5585,
"loss/base_kto": 3.2086141109466553,
"metrics/advantage_var": 477.46563720703125,
"regularization/mmd": 1.2596110105514526,
"regularization/rkhs_norm": 242.69961547851562,
"rewards/chosen": 0.5428633084607198,
"rewards/margins": 0.849956281947202,
"rewards/rejected": -0.3070929734864822,
"step": 1460
},
{
"epoch": 1.917098445595855,
"grad_norm": 15.070842742919922,
"kl": 11.10472297668457,
"learning_rate": 3.1259447239866796e-07,
"logits/chosen": -34750306.461538464,
"logits/rejected": -35542640.15238095,
"logps/chosen": -494.4030769230769,
"logps/rejected": -391.96760912698414,
"loss": 0.5614,
"loss/base_kto": 3.1633832454681396,
"metrics/advantage_var": 531.6734619140625,
"regularization/mmd": 1.3275425434112549,
"regularization/rkhs_norm": 255.78855895996094,
"rewards/chosen": 0.5454000150240385,
"rewards/margins": 0.928437255188659,
"rewards/rejected": -0.38303724016462054,
"step": 1480
},
{
"epoch": 1.9430051813471503,
"grad_norm": 14.644248008728027,
"kl": 13.015934944152832,
"learning_rate": 2.9952817295193435e-07,
"logits/chosen": -35368389.299363054,
"logits/rejected": -37573644.564417176,
"logps/chosen": -474.7845342356688,
"logps/rejected": -372.0687787576687,
"loss": 0.5603,
"loss/base_kto": 3.153552293777466,
"metrics/advantage_var": 546.5127563476562,
"regularization/mmd": 1.3292239904403687,
"regularization/rkhs_norm": 256.1125183105469,
"rewards/chosen": 0.5453437270632215,
"rewards/margins": 0.9080075577794073,
"rewards/rejected": -0.3626638307161858,
"step": 1500
},
{
"epoch": 1.9689119170984455,
"grad_norm": 13.781595230102539,
"kl": 9.892565727233887,
"learning_rate": 2.866230287623651e-07,
"logits/chosen": -34171076.46511628,
"logits/rejected": -35169127.783783786,
"logps/chosen": -478.1899527616279,
"logps/rejected": -376.4047719594595,
"loss": 0.565,
"loss/base_kto": 3.2333877086639404,
"metrics/advantage_var": 520.9701538085938,
"regularization/mmd": 1.2864378690719604,
"regularization/rkhs_norm": 247.8685760498047,
"rewards/chosen": 0.49371550803960756,
"rewards/margins": 0.8383285575209737,
"rewards/rejected": -0.3446130494813661,
"step": 1520
},
{
"epoch": 1.994818652849741,
"grad_norm": 14.64671802520752,
"kl": 12.811894416809082,
"learning_rate": 2.738894140150075e-07,
"logits/chosen": -36281189.3418124,
"logits/rejected": -36737571.391705066,
"logps/chosen": -486.2001689189189,
"logps/rejected": -389.9088421658986,
"loss": 0.5675,
"loss/base_kto": 3.20735239982605,
"metrics/advantage_var": 596.3021240234375,
"regularization/mmd": 1.3325361013412476,
"regularization/rkhs_norm": 256.7507019042969,
"rewards/chosen": 0.5178320176650686,
"rewards/margins": 0.8580788950277198,
"rewards/rejected": -0.3402468773626512,
"step": 1540
},
{
"epoch": 2.0207253886010363,
"grad_norm": 10.71275520324707,
"kl": 11.482906341552734,
"learning_rate": 2.6133756500585156e-07,
"logits/chosen": -34089391.686274506,
"logits/rejected": -35108587.24324324,
"logps/chosen": -487.71920955882354,
"logps/rejected": -377.3284769144144,
"loss": 0.5351,
"loss/base_kto": 3.1168744564056396,
"metrics/advantage_var": 399.5955505371094,
"regularization/mmd": 1.1641170978546143,
"regularization/rkhs_norm": 224.3000030517578,
"rewards/chosen": 0.5034692303027982,
"rewards/margins": 0.9092341566060547,
"rewards/rejected": -0.4057649263032564,
"step": 1560
},
{
"epoch": 2.0466321243523318,
"grad_norm": 11.445816040039062,
"kl": 10.277003288269043,
"learning_rate": 2.489775719130767e-07,
"logits/chosen": -34275630.51107828,
"logits/rejected": -34560315.86069652,
"logps/chosen": -459.00415435745936,
"logps/rejected": -382.97128938640134,
"loss": 0.5324,
"loss/base_kto": 3.1620447635650635,
"metrics/advantage_var": 355.1131286621094,
"regularization/mmd": 1.0971364974975586,
"regularization/rkhs_norm": 211.3943328857422,
"rewards/chosen": 0.47600524992499077,
"rewards/margins": 0.8982038982037791,
"rewards/rejected": -0.42219864827878834,
"step": 1580
},
{
"epoch": 2.0725388601036268,
"grad_norm": 10.892109870910645,
"kl": 17.682931900024414,
"learning_rate": 2.3681937068576303e-07,
"logits/chosen": -33588075.87421384,
"logits/rejected": -36002466.18633541,
"logps/chosen": -497.57596305031444,
"logps/rejected": -361.7705017468944,
"loss": 0.5269,
"loss/base_kto": 3.0482025146484375,
"metrics/advantage_var": 400.92138671875,
"regularization/mmd": 1.1668514013290405,
"regularization/rkhs_norm": 224.8268585205078,
"rewards/chosen": 0.7147384739521915,
"rewards/margins": 0.9691219639045159,
"rewards/rejected": -0.25438348995232435,
"step": 1600
},
{
"epoch": 2.098445595854922,
"grad_norm": 11.56076717376709,
"kl": 13.388104438781738,
"learning_rate": 2.2487273505658e-07,
"logits/chosen": -34235619.381317,
"logits/rejected": -36256815.362041466,
"logps/chosen": -482.87964203675347,
"logps/rejected": -386.31733452950556,
"loss": 0.5271,
"loss/base_kto": 3.081200361251831,
"metrics/advantage_var": 383.1581115722656,
"regularization/mmd": 1.135278344154358,
"regularization/rkhs_norm": 218.743408203125,
"rewards/chosen": 0.6020886361325134,
"rewards/margins": 0.9377138785209329,
"rewards/rejected": -0.33562524238841956,
"step": 1620
},
{
"epoch": 2.1243523316062176,
"grad_norm": 9.227808952331543,
"kl": 13.091130256652832,
"learning_rate": 2.131472686848817e-07,
"logits/chosen": -34775515.83045526,
"logits/rejected": -34548301.23794712,
"logps/chosen": -482.2095270800628,
"logps/rejected": -374.9788102643857,
"loss": 0.5275,
"loss/base_kto": 3.0965659618377686,
"metrics/advantage_var": 363.8895568847656,
"regularization/mmd": 1.1230347156524658,
"regularization/rkhs_norm": 216.3843231201172,
"rewards/chosen": 0.5647210281348116,
"rewards/margins": 0.929788576871811,
"rewards/rejected": -0.3650675487369994,
"step": 1640
},
{
"epoch": 2.150259067357513,
"grad_norm": 11.359593391418457,
"kl": 12.2516508102417,
"learning_rate": 2.016523974365188e-07,
"logits/chosen": -34294916.98701299,
"logits/rejected": -34889456.578313254,
"logps/chosen": -472.3590198863636,
"logps/rejected": -371.5574642319277,
"loss": 0.5298,
"loss/base_kto": 3.090224504470825,
"metrics/advantage_var": 379.31390380859375,
"regularization/mmd": 1.148317575454712,
"regularization/rkhs_norm": 221.2557830810547,
"rewards/chosen": 0.5197414051402699,
"rewards/margins": 0.9446700932815066,
"rewards/rejected": -0.4249286881412368,
"step": 1660
},
{
"epoch": 2.1761658031088085,
"grad_norm": 8.25497817993164,
"kl": 9.440899848937988,
"learning_rate": 1.9039736180657372e-07,
"logits/chosen": -34211684.17391305,
"logits/rejected": -36721248.60377359,
"logps/chosen": -489.473262810559,
"logps/rejected": -362.4254373034591,
"loss": 0.5322,
"loss/base_kto": 3.1154391765594482,
"metrics/advantage_var": 390.202880859375,
"regularization/mmd": 1.14195716381073,
"regularization/rkhs_norm": 220.0302734375,
"rewards/chosen": 0.4888434084305852,
"rewards/margins": 0.9296738070861228,
"rewards/rejected": -0.4408303986555375,
"step": 1680
},
{
"epoch": 2.2020725388601035,
"grad_norm": 10.409468650817871,
"kl": 13.0885009765625,
"learning_rate": 1.7939120949111498e-07,
"logits/chosen": -34505938.58712716,
"logits/rejected": -36608060.516329706,
"logps/chosen": -523.9324960753532,
"logps/rejected": -372.30574455676515,
"loss": 0.5298,
"loss/base_kto": 3.0309512615203857,
"metrics/advantage_var": 430.7159729003906,
"regularization/mmd": 1.2071322202682495,
"regularization/rkhs_norm": 232.5880889892578,
"rewards/chosen": 0.6278587832368524,
"rewards/margins": 1.007938370043083,
"rewards/rejected": -0.38007958680623055,
"step": 1700
},
{
"epoch": 2.227979274611399,
"grad_norm": 9.557205200195312,
"kl": 9.520075798034668,
"learning_rate": 1.6864278811393523e-07,
"logits/chosen": -33973349.618320614,
"logits/rejected": -35741296.2304,
"logps/chosen": -473.8358778625954,
"logps/rejected": -392.514525,
"loss": 0.5327,
"loss/base_kto": 3.0503900051116943,
"metrics/advantage_var": 438.140625,
"regularization/mmd": 1.211198091506958,
"regularization/rkhs_norm": 233.37149047851562,
"rewards/chosen": 0.5725689371123569,
"rewards/margins": 1.0125099527373569,
"rewards/rejected": -0.439941015625,
"step": 1720
},
{
"epoch": 2.2538860103626943,
"grad_norm": 12.640892028808594,
"kl": 8.175743103027344,
"learning_rate": 1.5816073811412584e-07,
"logits/chosen": -33956896.830534354,
"logits/rejected": -35551094.3744,
"logps/chosen": -492.9168893129771,
"logps/rejected": -365.5969,
"loss": 0.5307,
"loss/base_kto": 3.129976987838745,
"metrics/advantage_var": 352.7520446777344,
"regularization/mmd": 1.1156553030014038,
"regularization/rkhs_norm": 214.9624786376953,
"rewards/chosen": 0.5004034843153626,
"rewards/margins": 0.9101089530653627,
"rewards/rejected": -0.40970546875,
"step": 1740
},
{
"epoch": 2.2797927461139897,
"grad_norm": 8.18465518951416,
"kl": 9.268996238708496,
"learning_rate": 1.4795348580020207e-07,
"logits/chosen": -34128800.34303216,
"logits/rejected": -34571063.119617224,
"logps/chosen": -443.77038667687594,
"logps/rejected": -373.73514752791067,
"loss": 0.5254,
"loss/base_kto": 3.1064136028289795,
"metrics/advantage_var": 385.292236328125,
"regularization/mmd": 1.0964959859848022,
"regularization/rkhs_norm": 211.27090454101562,
"rewards/chosen": 0.5316680861468702,
"rewards/margins": 0.9256872054339017,
"rewards/rejected": -0.3940191192870315,
"step": 1760
},
{
"epoch": 2.305699481865285,
"grad_norm": 10.294926643371582,
"kl": 12.416064262390137,
"learning_rate": 1.3802923657636355e-07,
"logits/chosen": -35230866.741433024,
"logits/rejected": -35737593.5799373,
"logps/chosen": -487.93126947040497,
"logps/rejected": -393.0354868730407,
"loss": 0.5285,
"loss/base_kto": 3.10258150100708,
"metrics/advantage_var": 355.3718566894531,
"regularization/mmd": 1.125684142112732,
"regularization/rkhs_norm": 216.8948516845703,
"rewards/chosen": 0.548384431737977,
"rewards/margins": 0.9079973301310877,
"rewards/rejected": -0.3596128983931108,
"step": 1780
},
{
"epoch": 2.33160621761658,
"grad_norm": 11.296473503112793,
"kl": 13.17083740234375,
"learning_rate": 1.28395968346336e-07,
"logits/chosen": -36390026.55054432,
"logits/rejected": -34921644.00627943,
"logps/chosen": -488.79840590979785,
"logps/rejected": -368.5661057692308,
"loss": 0.5294,
"loss/base_kto": 3.0887959003448486,
"metrics/advantage_var": 367.3639221191406,
"regularization/mmd": 1.1464333534240723,
"regularization/rkhs_norm": 220.8927459716797,
"rewards/chosen": 0.5507928305428654,
"rewards/margins": 0.9450203899184786,
"rewards/rejected": -0.3942275593756132,
"step": 1800
},
{
"epoch": 2.3575129533678756,
"grad_norm": 12.347671508789062,
"kl": 13.250162124633789,
"learning_rate": 1.1906142510009415e-07,
"logits/chosen": -34845197.79397781,
"logits/rejected": -36435696.61633282,
"logps/chosen": -464.3315174326466,
"logps/rejected": -356.19414483821265,
"loss": 0.522,
"loss/base_kto": 3.090343952178955,
"metrics/advantage_var": 332.7373962402344,
"regularization/mmd": 1.0859272480010986,
"regularization/rkhs_norm": 209.23452758789062,
"rewards/chosen": 0.5313877401941363,
"rewards/margins": 0.9191312507181395,
"rewards/rejected": -0.3877435105240033,
"step": 1820
},
{
"epoch": 2.383419689119171,
"grad_norm": 12.698050498962402,
"kl": 9.831679344177246,
"learning_rate": 1.1003311068862547e-07,
"logits/chosen": -35244203.47551343,
"logits/rejected": -36054669.65069552,
"logps/chosen": -455.4088665086888,
"logps/rejected": -397.23357805255023,
"loss": 0.5281,
"loss/base_kto": 3.0877957344055176,
"metrics/advantage_var": 389.5352783203125,
"regularization/mmd": 1.136988639831543,
"regularization/rkhs_norm": 219.0729522705078,
"rewards/chosen": 0.4912326324607524,
"rewards/margins": 0.9503001171557388,
"rewards/rejected": -0.4590674846949865,
"step": 1840
},
{
"epoch": 2.4093264248704664,
"grad_norm": 11.359013557434082,
"kl": 8.866395950317383,
"learning_rate": 1.0131828279173588e-07,
"logits/chosen": -35714928.671850696,
"logits/rejected": -35437547.10204082,
"logps/chosen": -471.7073289269051,
"logps/rejected": -394.2383241758242,
"loss": 0.5306,
"loss/base_kto": 3.0911548137664795,
"metrics/advantage_var": 391.9338073730469,
"regularization/mmd": 1.15353524684906,
"regularization/rkhs_norm": 222.2611083984375,
"rewards/chosen": 0.46505623397708495,
"rewards/margins": 0.9473504333951335,
"rewards/rejected": -0.48229419941804846,
"step": 1860
},
{
"epoch": 2.4352331606217614,
"grad_norm": 11.26817798614502,
"kl": 9.509455680847168,
"learning_rate": 9.292394708374596e-08,
"logits/chosen": -32140284.809968848,
"logits/rejected": -35454834.75862069,
"logps/chosen": -467.07028816199374,
"logps/rejected": -387.3153653996865,
"loss": 0.5266,
"loss/base_kto": 3.1238632202148438,
"metrics/advantage_var": 345.85382080078125,
"regularization/mmd": 1.08919358253479,
"regularization/rkhs_norm": 209.86387634277344,
"rewards/chosen": 0.48274901202905957,
"rewards/margins": 0.9038101780569299,
"rewards/rejected": -0.4210611660278703,
"step": 1880
},
{
"epoch": 2.461139896373057,
"grad_norm": 11.294798851013184,
"kl": 14.53909969329834,
"learning_rate": 8.48568516017727e-08,
"logits/chosen": -34184551.96147673,
"logits/rejected": -35793104.852359205,
"logps/chosen": -474.4423154093098,
"logps/rejected": -384.1917332572298,
"loss": 0.5304,
"loss/base_kto": 3.1386189460754395,
"metrics/advantage_var": 370.9787902832031,
"regularization/mmd": 1.1045948266983032,
"regularization/rkhs_norm": 212.8313446044922,
"rewards/chosen": 0.5339062539187901,
"rewards/margins": 0.857013690286156,
"rewards/rejected": -0.3231074363673659,
"step": 1900
},
{
"epoch": 2.4870466321243523,
"grad_norm": 7.645028114318848,
"kl": 11.492669105529785,
"learning_rate": 7.71234813211169e-08,
"logits/chosen": -35577545.430615164,
"logits/rejected": -36086408.59208262,
"logps/chosen": -481.560443490701,
"logps/rejected": -389.5584391135973,
"loss": 0.5324,
"loss/base_kto": 3.1076765060424805,
"metrics/advantage_var": 388.7484436035156,
"regularization/mmd": 1.1512047052383423,
"regularization/rkhs_norm": 221.8120880126953,
"rewards/chosen": 0.5397454563299132,
"rewards/margins": 0.9362181180426122,
"rewards/rejected": -0.396472661712699,
"step": 1920
},
{
"epoch": 2.5129533678756477,
"grad_norm": 12.249076843261719,
"kl": 15.316606521606445,
"learning_rate": 6.973005294212353e-08,
"logits/chosen": -35357905.45454545,
"logits/rejected": -36790333.686746985,
"logps/chosen": -529.6217532467532,
"logps/rejected": -362.1625094126506,
"loss": 0.5283,
"loss/base_kto": 3.0658607482910156,
"metrics/advantage_var": 402.5772399902344,
"regularization/mmd": 1.1603775024414062,
"regularization/rkhs_norm": 223.57949829101562,
"rewards/chosen": 0.6278794523957488,
"rewards/margins": 0.9634614272066133,
"rewards/rejected": -0.33558197481086455,
"step": 1940
},
{
"epoch": 2.538860103626943,
"grad_norm": 9.163156509399414,
"kl": 10.477073669433594,
"learning_rate": 6.268250989270102e-08,
"logits/chosen": -33207286.309148263,
"logits/rejected": -35143521.486068115,
"logps/chosen": -472.6181979495268,
"logps/rejected": -357.89870356037153,
"loss": 0.5287,
"loss/base_kto": 3.095052480697632,
"metrics/advantage_var": 384.4367980957031,
"regularization/mmd": 1.134222388267517,
"regularization/rkhs_norm": 218.5399932861328,
"rewards/chosen": 0.5564845713907236,
"rewards/margins": 0.927981380177972,
"rewards/rejected": -0.37149680878724844,
"step": 1960
},
{
"epoch": 2.5647668393782386,
"grad_norm": 10.682226181030273,
"kl": 11.542448997497559,
"learning_rate": 5.598651755051975e-08,
"logits/chosen": -35190588.49452269,
"logits/rejected": -34718846.20280811,
"logps/chosen": -460.3348493740219,
"logps/rejected": -384.1492297191888,
"loss": 0.5279,
"loss/base_kto": 3.1000070571899414,
"metrics/advantage_var": 357.6339416503906,
"regularization/mmd": 1.1230379343032837,
"regularization/rkhs_norm": 216.38499450683594,
"rewards/chosen": 0.5276913351855927,
"rewards/margins": 0.9278597198506668,
"rewards/rejected": -0.4001683846650741,
"step": 1980
},
{
"epoch": 2.5906735751295336,
"grad_norm": 14.015803337097168,
"kl": 12.815312385559082,
"learning_rate": 4.964745868872933e-08,
"logits/chosen": -35221306.30467571,
"logits/rejected": -36127556.460291736,
"logps/chosen": -473.0073058069382,
"logps/rejected": -369.95715153970826,
"loss": 0.5245,
"loss/base_kto": 3.0746517181396484,
"metrics/advantage_var": 359.9502868652344,
"regularization/mmd": 1.121084213256836,
"regularization/rkhs_norm": 216.00852966308594,
"rewards/chosen": 0.562893506448553,
"rewards/margins": 0.9334219640654239,
"rewards/rejected": -0.3705284576168709,
"step": 2000
},
{
"epoch": 2.616580310880829,
"grad_norm": 11.130681991577148,
"kl": 12.841374397277832,
"learning_rate": 4.3670429148855493e-08,
"logits/chosen": -34324413.424148604,
"logits/rejected": -35546018.32176656,
"logps/chosen": -491.4020897832817,
"logps/rejected": -352.90883773659306,
"loss": 0.5267,
"loss/base_kto": 3.0797278881073,
"metrics/advantage_var": 376.87994384765625,
"regularization/mmd": 1.1341991424560547,
"regularization/rkhs_norm": 218.5354766845703,
"rewards/chosen": 0.6077518049777477,
"rewards/margins": 0.95141431964929,
"rewards/rejected": -0.3436625146715423,
"step": 2020
},
{
"epoch": 2.6424870466321244,
"grad_norm": 11.328431129455566,
"kl": 11.874162673950195,
"learning_rate": 3.806023374435663e-08,
"logits/chosen": -35556658.89614243,
"logits/rejected": -35123673.13531353,
"logps/chosen": -468.75018545994067,
"logps/rejected": -391.64253300330034,
"loss": 0.5277,
"loss/base_kto": 3.1278867721557617,
"metrics/advantage_var": 333.9039001464844,
"regularization/mmd": 1.0934902429580688,
"regularization/rkhs_norm": 210.69175720214844,
"rewards/chosen": 0.5320587610986183,
"rewards/margins": 0.8782715699405377,
"rewards/rejected": -0.34621280884191935,
"step": 2040
},
{
"epoch": 2.66839378238342,
"grad_norm": 8.911983489990234,
"kl": 15.25463581085205,
"learning_rate": 3.282138239813037e-08,
"logits/chosen": -35222911.174193546,
"logits/rejected": -36076807.75757576,
"logps/chosen": -480.13860887096774,
"logps/rejected": -394.96796875,
"loss": 0.5294,
"loss/base_kto": 3.02984619140625,
"metrics/advantage_var": 424.6706237792969,
"regularization/mmd": 1.2054380178451538,
"regularization/rkhs_norm": 232.2616729736328,
"rewards/chosen": 0.6062917893932712,
"rewards/margins": 1.0025537097442418,
"rewards/rejected": -0.39626192035097063,
"step": 2060
},
{
"epoch": 2.694300518134715,
"grad_norm": 11.520490646362305,
"kl": 13.6519193649292,
"learning_rate": 2.795808651707793e-08,
"logits/chosen": -35128602.15479876,
"logits/rejected": -36351912.78233439,
"logps/chosen": -468.5253482972136,
"logps/rejected": -383.8808162460568,
"loss": 0.5307,
"loss/base_kto": 3.1344125270843506,
"metrics/advantage_var": 350.7089538574219,
"regularization/mmd": 1.1107876300811768,
"regularization/rkhs_norm": 214.02456665039062,
"rewards/chosen": 0.527235096084075,
"rewards/margins": 0.8736736754628951,
"rewards/rejected": -0.34643857937882,
"step": 2080
},
{
"epoch": 2.7202072538860103,
"grad_norm": 10.270307540893555,
"kl": 13.290621757507324,
"learning_rate": 2.3474255606639293e-08,
"logits/chosen": -33216139.925465837,
"logits/rejected": -35478682.56603774,
"logps/chosen": -503.1929347826087,
"logps/rejected": -354.3146373820755,
"loss": 0.5281,
"loss/base_kto": 3.0898449420928955,
"metrics/advantage_var": 369.3459167480469,
"regularization/mmd": 1.1351157426834106,
"regularization/rkhs_norm": 218.7120819091797,
"rewards/chosen": 0.5763542222680512,
"rewards/margins": 0.9304242739291287,
"rewards/rejected": -0.3540700516610775,
"step": 2100
},
{
"epoch": 2.7461139896373057,
"grad_norm": 7.135807037353516,
"kl": 12.883994102478027,
"learning_rate": 1.9373494128020195e-08,
"logits/chosen": -34329645.801916935,
"logits/rejected": -36721967.755351685,
"logps/chosen": -490.8725039936102,
"logps/rejected": -378.97720756880733,
"loss": 0.5265,
"loss/base_kto": 3.095879554748535,
"metrics/advantage_var": 361.8744812011719,
"regularization/mmd": 1.1162868738174438,
"regularization/rkhs_norm": 215.0841827392578,
"rewards/chosen": 0.5800625249600639,
"rewards/margins": 0.9294950473284221,
"rewards/rejected": -0.3494325223683582,
"step": 2120
},
{
"epoch": 2.772020725388601,
"grad_norm": 10.335249900817871,
"kl": 12.950479507446289,
"learning_rate": 1.5659098600638798e-08,
"logits/chosen": -34357906.977917984,
"logits/rejected": -35518349.86996904,
"logps/chosen": -489.25621056782336,
"logps/rejected": -372.02549342105266,
"loss": 0.5207,
"loss/base_kto": 3.0475614070892334,
"metrics/advantage_var": 361.4256286621094,
"regularization/mmd": 1.1180591583251953,
"regularization/rkhs_norm": 215.42568969726562,
"rewards/chosen": 0.5793135008225305,
"rewards/margins": 0.9720364189757087,
"rewards/rejected": -0.3927229181531782,
"step": 2140
},
{
"epoch": 2.7979274611398965,
"grad_norm": 12.101631164550781,
"kl": 14.51342487335205,
"learning_rate": 1.2334054952120143e-08,
"logits/chosen": -34178817.240710825,
"logits/rejected": -35369808.944024205,
"logps/chosen": -498.0520496768982,
"logps/rejected": -371.3050302571861,
"loss": 0.5303,
"loss/base_kto": 3.0979537963867188,
"metrics/advantage_var": 576.8146362304688,
"regularization/mmd": 1.1443445682525635,
"regularization/rkhs_norm": 220.4902801513672,
"rewards/chosen": 0.5742010014892972,
"rewards/margins": 0.8867016940213273,
"rewards/rejected": -0.31250069253203006,
"step": 2160
},
{
"epoch": 2.823834196891192,
"grad_norm": 12.365646362304688,
"kl": 13.501253128051758,
"learning_rate": 9.401036117969108e-09,
"logits/chosen": -35068562.04590164,
"logits/rejected": -37147907.82089552,
"logps/chosen": -491.85056352459014,
"logps/rejected": -379.8675839552239,
"loss": 0.5213,
"loss/base_kto": 3.0109212398529053,
"metrics/advantage_var": 396.2356872558594,
"regularization/mmd": 1.1596250534057617,
"regularization/rkhs_norm": 223.43447875976562,
"rewards/chosen": 0.5979486184042008,
"rewards/margins": 0.9946309477243966,
"rewards/rejected": -0.39668232932019587,
"step": 2180
},
{
"epoch": 2.849740932642487,
"grad_norm": 7.931318759918213,
"kl": 12.034379959106445,
"learning_rate": 6.8623998928517555e-09,
"logits/chosen": -34815871.38164251,
"logits/rejected": -36582507.21699545,
"logps/chosen": -469.4171698872786,
"logps/rejected": -372.40629742033383,
"loss": 0.5308,
"loss/base_kto": 3.097630023956299,
"metrics/advantage_var": 385.7208557128906,
"regularization/mmd": 1.1488761901855469,
"regularization/rkhs_norm": 221.36343383789062,
"rewards/chosen": 0.5448376445186695,
"rewards/margins": 0.933819696663254,
"rewards/rejected": -0.3889820521445846,
"step": 2200
},
{
"epoch": 2.8756476683937824,
"grad_norm": 13.937902450561523,
"kl": 12.061327934265137,
"learning_rate": 4.72018703521132e-09,
"logits/chosen": -35316257.267828844,
"logits/rejected": -35816481.13405239,
"logps/chosen": -467.92115689381933,
"logps/rejected": -386.2687548151002,
"loss": 0.5311,
"loss/base_kto": 3.126477003097534,
"metrics/advantage_var": 370.1043395996094,
"regularization/mmd": 1.1222646236419678,
"regularization/rkhs_norm": 216.23594665527344,
"rewards/chosen": 0.518689138953546,
"rewards/margins": 0.8781875258949943,
"rewards/rejected": -0.35949838694144837,
"step": 2220
},
{
"epoch": 2.901554404145078,
"grad_norm": 9.281513214111328,
"kl": 12.302824974060059,
"learning_rate": 2.976119626744267e-09,
"logits/chosen": -35342033.45454545,
"logits/rejected": -36803324.915662654,
"logps/chosen": -493.375101461039,
"logps/rejected": -401.9391942771084,
"loss": 0.5236,
"loss/base_kto": 3.0720460414886475,
"metrics/advantage_var": 353.0370178222656,
"regularization/mmd": 1.1166185140609741,
"regularization/rkhs_norm": 215.14805603027344,
"rewards/chosen": 0.5612790987089082,
"rewards/margins": 0.9515410130655535,
"rewards/rejected": -0.3902619143566453,
"step": 2240
},
{
"epoch": 2.927461139896373,
"grad_norm": 11.074307441711426,
"kl": 10.97407054901123,
"learning_rate": 1.631599688052765e-09,
"logits/chosen": -34191000.47648903,
"logits/rejected": -35948942.75389408,
"logps/chosen": -464.1570336990596,
"logps/rejected": -365.73203855140184,
"loss": 0.5278,
"loss/base_kto": 3.1273510456085205,
"metrics/advantage_var": 343.7378845214844,
"regularization/mmd": 1.0950945615768433,
"regularization/rkhs_norm": 211.0008544921875,
"rewards/chosen": 0.5045455406452047,
"rewards/margins": 0.8785536242858054,
"rewards/rejected": -0.3740080836406007,
"step": 2260
},
{
"epoch": 2.9533678756476682,
"grad_norm": 10.354769706726074,
"kl": 11.708769798278809,
"learning_rate": 6.877080515894085e-10,
"logits/chosen": -35112156.67596899,
"logits/rejected": -36165696.503937006,
"logps/chosen": -493.58856589147285,
"logps/rejected": -394.29537401574805,
"loss": 0.5327,
"loss/base_kto": 3.140596389770508,
"metrics/advantage_var": 366.3534240722656,
"regularization/mmd": 1.1208542585372925,
"regularization/rkhs_norm": 215.96421813964844,
"rewards/chosen": 0.5278361948885659,
"rewards/margins": 0.8934785923110561,
"rewards/rejected": -0.36564239742249016,
"step": 2280
},
{
"epoch": 2.9792746113989637,
"grad_norm": 7.407812595367432,
"kl": 9.797353744506836,
"learning_rate": 1.4520349279739663e-10,
"logits/chosen": -34317422.32473445,
"logits/rejected": -33990174.50563607,
"logps/chosen": -469.95428679817906,
"logps/rejected": -343.463768115942,
"loss": 0.5238,
"loss/base_kto": 3.1010022163391113,
"metrics/advantage_var": 348.421142578125,
"regularization/mmd": 1.0893239974975586,
"regularization/rkhs_norm": 209.88902282714844,
"rewards/chosen": 0.5466918019134105,
"rewards/margins": 0.9251473647813906,
"rewards/rejected": -0.3784555628679801,
"step": 2300
},
{
"epoch": 3.0,
"step": 2316,
"total_flos": 9.975174191323546e+17,
"train_loss": 0.5582944930938035,
"train_runtime": 11062.9397,
"train_samples_per_second": 13.398,
"train_steps_per_second": 0.209
}
],
"logging_steps": 20,
"max_steps": 2316,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": false,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 9.975174191323546e+17,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}