Files
aup-fullft-kto_mmd-mmdrho5.…/trainer_state.json

2229 lines
81 KiB
JSON
Raw Normal View History

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 3.0,
"eval_steps": 500,
"global_step": 2316,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.025906735751295335,
"grad_norm": 17.17824363708496,
"kl": 11.705644607543945,
"learning_rate": 1.8999999999999998e-07,
"logits/chosen": -37374555.09202454,
"logits/rejected": -38249413.299363054,
"logps/chosen": -458.82045628834356,
"logps/rejected": -380.9230195063694,
"loss": 0.5882,
"loss/base_kto": 3.8691139221191406,
"metrics/advantage_var": 205.1183624267578,
"regularization/mmd": 0.8363999724388123,
"regularization/rkhs_norm": 161.1560516357422,
"rewards/chosen": 0.19569607600112635,
"rewards/margins": 0.12410098730965789,
"rewards/rejected": 0.07159508869146845,
"step": 20
},
{
"epoch": 0.05181347150259067,
"grad_norm": 24.634510040283203,
"kl": 8.969709396362305,
"learning_rate": 3.8999999999999997e-07,
"logits/chosen": -36240658.574132495,
"logits/rejected": -37311243.888544895,
"logps/chosen": -479.26355481072557,
"logps/rejected": -362.78703076625385,
"loss": 0.5952,
"loss/base_kto": 3.939504623413086,
"metrics/advantage_var": 254.3942413330078,
"regularization/mmd": 0.8221014142036438,
"regularization/rkhs_norm": 158.4010467529297,
"rewards/chosen": 0.10391850275948221,
"rewards/margins": 0.052487514152459426,
"rewards/rejected": 0.05143098860702278,
"step": 40
},
{
"epoch": 0.07772020725388601,
"grad_norm": 17.818912506103516,
"kl": 9.702555656433105,
"learning_rate": 5.9e-07,
"logits/chosen": -35006144.75294118,
"logits/rejected": -36564841.81333333,
"logps/chosen": -463.72058823529414,
"logps/rejected": -382.8108854166667,
"loss": 0.5793,
"loss/base_kto": 3.8532512187957764,
"metrics/advantage_var": 174.97061157226562,
"regularization/mmd": 0.7807949185371399,
"regularization/rkhs_norm": 150.4421844482422,
"rewards/chosen": 0.1713244494269876,
"rewards/margins": 0.13787493630951528,
"rewards/rejected": 0.03344951311747233,
"step": 60
},
{
"epoch": 0.10362694300518134,
"grad_norm": 16.61756706237793,
"kl": 8.655376434326172,
"learning_rate": 7.9e-07,
"logits/chosen": -35403210.92185008,
"logits/rejected": -36740844.00612558,
"logps/chosen": -486.4532496012759,
"logps/rejected": -385.1654622894334,
"loss": 0.5817,
"loss/base_kto": 3.8474583625793457,
"metrics/advantage_var": 182.4675750732422,
"regularization/mmd": 0.8062886595726013,
"regularization/rkhs_norm": 155.35426330566406,
"rewards/chosen": 0.1467522190708483,
"rewards/margins": 0.14803078999961175,
"rewards/rejected": -0.001278570928763467,
"step": 80
},
{
"epoch": 0.12953367875647667,
"grad_norm": 17.816631317138672,
"kl": 15.2816801071167,
"learning_rate": 9.9e-07,
"logits/chosen": -37329131.11782477,
"logits/rejected": -37500411.02912621,
"logps/chosen": -480.798291163142,
"logps/rejected": -369.70224008899675,
"loss": 0.5842,
"loss/base_kto": 3.855912923812866,
"metrics/advantage_var": 193.5823211669922,
"regularization/mmd": 0.8175219893455505,
"regularization/rkhs_norm": 157.51869201660156,
"rewards/chosen": 0.2912412799016947,
"rewards/margins": 0.09936524190898888,
"rewards/rejected": 0.1918760379927058,
"step": 100
},
{
"epoch": 0.15544041450777202,
"grad_norm": 12.4163236618042,
"kl": 7.135940074920654,
"learning_rate": 9.998186234298189e-07,
"logits/chosen": -36614575.15789474,
"logits/rejected": -36309686.51104101,
"logps/chosen": -471.00386996904024,
"logps/rejected": -345.0620317429022,
"loss": 0.5811,
"loss/base_kto": 3.8355655670166016,
"metrics/advantage_var": 193.8709259033203,
"regularization/mmd": 0.8132469058036804,
"regularization/rkhs_norm": 156.6949920654297,
"rewards/chosen": 0.10218977559092614,
"rewards/margins": 0.16098254568785844,
"rewards/rejected": -0.0587927700969323,
"step": 120
},
{
"epoch": 0.18134715025906736,
"grad_norm": 16.862951278686523,
"kl": 5.876062870025635,
"learning_rate": 9.992359552107714e-07,
"logits/chosen": -36519189.50237718,
"logits/rejected": -37452378.72419106,
"logps/chosen": -473.80551703645006,
"logps/rejected": -379.79405816640985,
"loss": 0.5814,
"loss/base_kto": 3.797930955886841,
"metrics/advantage_var": 212.62060546875,
"regularization/mmd": 0.8534538149833679,
"regularization/rkhs_norm": 164.4419708251953,
"rewards/chosen": 0.12022552248415214,
"rewards/margins": 0.19937941510704252,
"rewards/rejected": -0.07915389262289038,
"step": 140
},
{
"epoch": 0.20725388601036268,
"grad_norm": 19.250629425048828,
"kl": 8.92680549621582,
"learning_rate": 9.982519612796161e-07,
"logits/chosen": -36560302.98734177,
"logits/rejected": -37849321.87654321,
"logps/chosen": -489.98397943037975,
"logps/rejected": -368.4852912808642,
"loss": 0.5791,
"loss/base_kto": 3.8046348094940186,
"metrics/advantage_var": 191.76449584960938,
"regularization/mmd": 0.8277899026870728,
"regularization/rkhs_norm": 159.4970703125,
"rewards/chosen": 0.16618209549143345,
"rewards/margins": 0.18717863370075993,
"rewards/rejected": -0.020996538209326475,
"step": 160
},
{
"epoch": 0.23316062176165803,
"grad_norm": 16.78864288330078,
"kl": 5.223937034606934,
"learning_rate": 9.968674326492213e-07,
"logits/chosen": -36406336.81012658,
"logits/rejected": -38580559.01234568,
"logps/chosen": -521.1448773734177,
"logps/rejected": -396.00096450617286,
"loss": 0.5891,
"loss/base_kto": 3.8187339305877686,
"metrics/advantage_var": 221.2644805908203,
"regularization/mmd": 0.8941717147827148,
"regularization/rkhs_norm": 172.2874298095703,
"rewards/chosen": 0.01757409904576555,
"rewards/margins": 0.17354409555696587,
"rewards/rejected": -0.15596999651120033,
"step": 180
},
{
"epoch": 0.25906735751295334,
"grad_norm": 15.423490524291992,
"kl": 5.971735000610352,
"learning_rate": 9.950834823142198e-07,
"logits/chosen": -36901480.356687896,
"logits/rejected": -38046851.926380366,
"logps/chosen": -520.1484375,
"logps/rejected": -362.76945935582825,
"loss": 0.5846,
"loss/base_kto": 3.8046326637268066,
"metrics/advantage_var": 212.846435546875,
"regularization/mmd": 0.8723503947257996,
"regularization/rkhs_norm": 168.0829315185547,
"rewards/chosen": 0.028980646923089482,
"rewards/margins": 0.19316205782374374,
"rewards/rejected": -0.16418141090065425,
"step": 200
},
{
"epoch": 0.2849740932642487,
"grad_norm": 17.27155876159668,
"kl": 4.341996192932129,
"learning_rate": 9.929015443562942e-07,
"logits/chosen": -37302842.32911392,
"logits/rejected": -37378389.333333336,
"logps/chosen": -472.3408821202532,
"logps/rejected": -413.896412037037,
"loss": 0.5907,
"loss/base_kto": 3.857016086578369,
"metrics/advantage_var": 219.51280212402344,
"regularization/mmd": 0.8689824342727661,
"regularization/rkhs_norm": 167.4340057373047,
"rewards/chosen": -0.002050889443747605,
"rewards/margins": 0.12590938627691936,
"rewards/rejected": -0.12796027572066695,
"step": 220
},
{
"epoch": 0.31088082901554404,
"grad_norm": 18.765356063842773,
"kl": 13.129290580749512,
"learning_rate": 9.90323372791347e-07,
"logits/chosen": -34992805.24006359,
"logits/rejected": -34460318.08294931,
"logps/chosen": -492.0058624801272,
"logps/rejected": -388.18260368663596,
"loss": 0.5794,
"loss/base_kto": 3.7357583045959473,
"metrics/advantage_var": 235.9385223388672,
"regularization/mmd": 0.8995633125305176,
"regularization/rkhs_norm": 173.32627868652344,
"rewards/chosen": 0.2608127321082572,
"rewards/margins": 0.2611001880054346,
"rewards/rejected": -0.00028745589717741937,
"step": 240
},
{
"epoch": 0.33678756476683935,
"grad_norm": 16.559024810791016,
"kl": 11.939021110534668,
"learning_rate": 9.87351040159484e-07,
"logits/chosen": -36214281.19760479,
"logits/rejected": -37119226.98039216,
"logps/chosen": -477.4055950598802,
"logps/rejected": -352.95889501633985,
"loss": 0.588,
"loss/base_kto": 3.7914161682128906,
"metrics/advantage_var": 246.98789978027344,
"regularization/mmd": 0.9122908711433411,
"regularization/rkhs_norm": 175.77857971191406,
"rewards/chosen": 0.17018705356620742,
"rewards/margins": 0.1747992625372185,
"rewards/rejected": -0.004612208971011093,
"step": 260
},
{
"epoch": 0.3626943005181347,
"grad_norm": 18.102062225341797,
"kl": 13.486361503601074,
"learning_rate": 9.839869358589396e-07,
"logits/chosen": -36812213.52727272,
"logits/rejected": -37218687.174193546,
"logps/chosen": -485.94038825757576,
"logps/rejected": -360.3397933467742,
"loss": 0.5759,
"loss/base_kto": 3.7146339416503906,
"metrics/advantage_var": 225.8873748779297,
"regularization/mmd": 0.8924358487129211,
"regularization/rkhs_norm": 171.9529571533203,
"rewards/chosen": 0.24707082112630208,
"rewards/margins": 0.2612232787634737,
"rewards/rejected": -0.014152457637171592,
"step": 280
},
{
"epoch": 0.38860103626943004,
"grad_norm": 13.515963554382324,
"kl": 7.019232273101807,
"learning_rate": 9.80233764225289e-07,
"logits/chosen": -36571723.51377634,
"logits/rejected": -36863922.77526395,
"logps/chosen": -495.53256685575366,
"logps/rejected": -370.2117269984917,
"loss": 0.5839,
"loss/base_kto": 3.7327675819396973,
"metrics/advantage_var": 254.8397216796875,
"regularization/mmd": 0.9381042718887329,
"regularization/rkhs_norm": 180.75228881835938,
"rewards/chosen": 0.08138375305472549,
"rewards/margins": 0.24736013788074124,
"rewards/rejected": -0.16597638482601573,
"step": 300
},
{
"epoch": 0.41450777202072536,
"grad_norm": 19.815963745117188,
"kl": 8.59502124786377,
"learning_rate": 9.760945423574868e-07,
"logits/chosen": -36340511.5392,
"logits/rejected": -36791547.70076336,
"logps/chosen": -467.8384,
"logps/rejected": -396.0668893129771,
"loss": 0.5894,
"loss/base_kto": 3.778308868408203,
"metrics/advantage_var": 256.86029052734375,
"regularization/mmd": 0.9368079304695129,
"regularization/rkhs_norm": 180.5024871826172,
"rewards/chosen": 0.115751025390625,
"rewards/margins": 0.21329030687171996,
"rewards/rejected": -0.09753928148109495,
"step": 320
},
{
"epoch": 0.44041450777202074,
"grad_norm": 16.615589141845703,
"kl": 13.181256294250488,
"learning_rate": 9.71572597692482e-07,
"logits/chosen": -36934127.53445636,
"logits/rejected": -37403290.33492823,
"logps/chosen": -466.4159647779479,
"logps/rejected": -362.79231459330146,
"loss": 0.5853,
"loss/base_kto": 3.7623989582061768,
"metrics/advantage_var": 241.0950164794922,
"regularization/mmd": 0.9203804135322571,
"regularization/rkhs_norm": 177.33726501464844,
"rewards/chosen": 0.19883580813911753,
"rewards/margins": 0.21246085727387848,
"rewards/rejected": -0.013625049134760953,
"step": 340
},
{
"epoch": 0.46632124352331605,
"grad_norm": 16.18718147277832,
"kl": 9.250204086303711,
"learning_rate": 9.666715653303588e-07,
"logits/chosen": -35960675.53140917,
"logits/rejected": -36549434.90593343,
"logps/chosen": -507.18999363327674,
"logps/rejected": -368.66552098408107,
"loss": 0.571,
"loss/base_kto": 3.7126853466033936,
"metrics/advantage_var": 210.2465362548828,
"regularization/mmd": 0.855193555355072,
"regularization/rkhs_norm": 164.7771759033203,
"rewards/chosen": 0.07143040707236842,
"rewards/margins": 0.23136470904216988,
"rewards/rejected": -0.15993430196980146,
"step": 360
},
{
"epoch": 0.49222797927461137,
"grad_norm": 13.501649856567383,
"kl": 7.775170803070068,
"learning_rate": 9.613953851121528e-07,
"logits/chosen": -35368973.385620914,
"logits/rejected": -35673964.838323355,
"logps/chosen": -452.59007352941177,
"logps/rejected": -357.5925336826347,
"loss": 0.579,
"loss/base_kto": 3.742609739303589,
"metrics/advantage_var": 225.8137664794922,
"regularization/mmd": 0.8894966244697571,
"regularization/rkhs_norm": 171.38662719726562,
"rewards/chosen": 0.015907189425300148,
"rewards/margins": 0.2281374377908737,
"rewards/rejected": -0.21223024836557355,
"step": 380
},
{
"epoch": 0.5181347150259067,
"grad_norm": 13.40770149230957,
"kl": 1.3833078145980835,
"learning_rate": 9.557482984526924e-07,
"logits/chosen": -34698966.28753994,
"logits/rejected": -35921036.91743119,
"logps/chosen": -480.37569888178916,
"logps/rejected": -377.8273126911315,
"loss": 0.5851,
"loss/base_kto": 3.804372549057007,
"metrics/advantage_var": 220.71592712402344,
"regularization/mmd": 0.8766388297080994,
"regularization/rkhs_norm": 168.90921020507812,
"rewards/chosen": -0.1644923298503644,
"rewards/margins": 0.18859133609657272,
"rewards/rejected": -0.35308366594693713,
"step": 400
},
{
"epoch": 0.5440414507772021,
"grad_norm": 17.20208740234375,
"kl": 8.89284896850586,
"learning_rate": 9.497348449310107e-07,
"logits/chosen": -36301593.17397882,
"logits/rejected": -36846570.49434572,
"logps/chosen": -484.2128403933434,
"logps/rejected": -374.28175484652667,
"loss": 0.5773,
"loss/base_kto": 3.7007312774658203,
"metrics/advantage_var": 252.4306640625,
"regularization/mmd": 0.9172918200492859,
"regularization/rkhs_norm": 176.74215698242188,
"rewards/chosen": 0.2045105488325572,
"rewards/margins": 0.2857103797089708,
"rewards/rejected": -0.08119983087641357,
"step": 420
},
{
"epoch": 0.5699481865284974,
"grad_norm": 14.008798599243164,
"kl": 4.971663951873779,
"learning_rate": 9.433598586410701e-07,
"logits/chosen": -35577293.803921565,
"logits/rejected": -36158359.76047904,
"logps/chosen": -487.22109885620915,
"logps/rejected": -380.4648203592814,
"loss": 0.5811,
"loss/base_kto": 3.7872238159179688,
"metrics/advantage_var": 210.58189392089844,
"regularization/mmd": 0.8616555333137512,
"regularization/rkhs_norm": 166.0222625732422,
"rewards/chosen": -0.04419072469075521,
"rewards/margins": 0.17861619442998766,
"rewards/rejected": -0.22280691912074288,
"step": 440
},
{
"epoch": 0.5958549222797928,
"grad_norm": 29.045827865600586,
"kl": 11.158292770385742,
"learning_rate": 9.366284643057313e-07,
"logits/chosen": -36004905.99369085,
"logits/rejected": -37309325.86996904,
"logps/chosen": -495.0600847791798,
"logps/rejected": -358.18067917956654,
"loss": 0.5785,
"loss/base_kto": 3.6740760803222656,
"metrics/advantage_var": 253.67251586914062,
"regularization/mmd": 0.9537431597709656,
"regularization/rkhs_norm": 183.7655487060547,
"rewards/chosen": 0.19204202886635574,
"rewards/margins": 0.2977901139119488,
"rewards/rejected": -0.10574808504559308,
"step": 460
},
{
"epoch": 0.6217616580310881,
"grad_norm": 16.597339630126953,
"kl": 6.580680847167969,
"learning_rate": 9.295460731570917e-07,
"logits/chosen": -36466796.29237947,
"logits/rejected": -36819972.82260597,
"logps/chosen": -467.4334175738725,
"logps/rejected": -378.80862441130296,
"loss": 0.5859,
"loss/base_kto": 3.7626149654388428,
"metrics/advantage_var": 250.4164276123047,
"regularization/mmd": 0.9247032999992371,
"regularization/rkhs_norm": 178.1702117919922,
"rewards/chosen": 0.05540208238094443,
"rewards/margins": 0.21949680070321925,
"rewards/rejected": -0.16409471832227482,
"step": 480
},
{
"epoch": 0.6476683937823834,
"grad_norm": 20.037803649902344,
"kl": 13.012826919555664,
"learning_rate": 9.221183785865056e-07,
"logits/chosen": -36411238.23642173,
"logits/rejected": -38203529.78593272,
"logps/chosen": -506.47623801916933,
"logps/rejected": -361.5666093272171,
"loss": 0.5786,
"loss/base_kto": 3.7578201293945312,
"metrics/advantage_var": 226.1883087158203,
"regularization/mmd": 0.8712299466133118,
"regularization/rkhs_norm": 167.86703491210938,
"rewards/chosen": 0.128050173433444,
"rewards/margins": 0.19012437972443275,
"rewards/rejected": -0.06207420629098875,
"step": 500
},
{
"epoch": 0.6735751295336787,
"grad_norm": 13.235008239746094,
"kl": 7.026106357574463,
"learning_rate": 9.143513515677817e-07,
"logits/chosen": -35088660.75675676,
"logits/rejected": -35795585.76958525,
"logps/chosen": -493.02742448330685,
"logps/rejected": -365.5026161674347,
"loss": 0.5817,
"loss/base_kto": 3.6863715648651123,
"metrics/advantage_var": 266.0599060058594,
"regularization/mmd": 0.9668650031089783,
"regularization/rkhs_norm": 186.29383850097656,
"rewards/chosen": 0.05598118574327429,
"rewards/margins": 0.31304818490622077,
"rewards/rejected": -0.25706699916294645,
"step": 520
},
{
"epoch": 0.6994818652849741,
"grad_norm": 14.098347663879395,
"kl": 10.816325187683105,
"learning_rate": 9.062512358572373e-07,
"logits/chosen": -38242644.79239303,
"logits/rejected": -38755597.80585516,
"logps/chosen": -504.069235340729,
"logps/rejected": -370.5738877118644,
"loss": 0.576,
"loss/base_kto": 3.670135498046875,
"metrics/advantage_var": 260.2480163574219,
"regularization/mmd": 0.9379448890686035,
"regularization/rkhs_norm": 180.7215576171875,
"rewards/chosen": 0.15481238508753467,
"rewards/margins": 0.30491048334868165,
"rewards/rejected": -0.15009809826114695,
"step": 540
},
{
"epoch": 0.7253886010362695,
"grad_norm": 17.216079711914062,
"kl": 10.34858226776123,
"learning_rate": 8.978245429744691e-07,
"logits/chosen": -35892446.889589906,
"logits/rejected": -37417698.6749226,
"logps/chosen": -471.4547515772871,
"logps/rejected": -362.39599458204333,
"loss": 0.5736,
"loss/base_kto": 3.6679515838623047,
"metrics/advantage_var": 245.65000915527344,
"regularization/mmd": 0.9210807681083679,
"regularization/rkhs_norm": 177.4722137451172,
"rewards/chosen": 0.16871237529189054,
"rewards/margins": 0.3043762965417999,
"rewards/rejected": -0.1356639212499093,
"step": 560
},
{
"epoch": 0.7512953367875648,
"grad_norm": 17.89346694946289,
"kl": 9.997203826904297,
"learning_rate": 8.890780469678738e-07,
"logits/chosen": -36724665.26844584,
"logits/rejected": -37811551.95023328,
"logps/chosen": -470.81063579277867,
"logps/rejected": -384.22827566096424,
"loss": 0.5802,
"loss/base_kto": 3.761526584625244,
"metrics/advantage_var": 220.28726196289062,
"regularization/mmd": 0.8799467086791992,
"regularization/rkhs_norm": 169.54656982421875,
"rewards/chosen": 0.19516678694840317,
"rewards/margins": 0.22247145854888736,
"rewards/rejected": -0.027304671600484182,
"step": 580
},
{
"epoch": 0.7772020725388601,
"grad_norm": 12.943658828735352,
"kl": 9.310834884643555,
"learning_rate": 8.800187789691269e-07,
"logits/chosen": -36783370.432601884,
"logits/rejected": -38423248.9470405,
"logps/chosen": -502.1896551724138,
"logps/rejected": -381.56746495327104,
"loss": 0.5845,
"loss/base_kto": 3.736865997314453,
"metrics/advantage_var": 248.659912109375,
"regularization/mmd": 0.939008891582489,
"regularization/rkhs_norm": 180.9265594482422,
"rewards/chosen": 0.13101956836855896,
"rewards/margins": 0.24130708911290646,
"rewards/rejected": -0.1102875207443475,
"step": 600
},
{
"epoch": 0.8031088082901554,
"grad_norm": 25.93958854675293,
"kl": 9.676671028137207,
"learning_rate": 8.706540215409981e-07,
"logits/chosen": -36023722.666666664,
"logits/rejected": -37273651.848101266,
"logps/chosen": -511.7439236111111,
"logps/rejected": -354.8786095727848,
"loss": 0.5797,
"loss/base_kto": 3.6770730018615723,
"metrics/advantage_var": 268.8786315917969,
"regularization/mmd": 0.9602136015892029,
"regularization/rkhs_norm": 185.0122528076172,
"rewards/chosen": 0.15822723765432098,
"rewards/margins": 0.28441497262035764,
"rewards/rejected": -0.12618773496603664,
"step": 620
},
{
"epoch": 0.8290155440414507,
"grad_norm": 18.380504608154297,
"kl": 17.58591651916504,
"learning_rate": 8.609913028230462e-07,
"logits/chosen": -35677755.96396396,
"logits/rejected": -36941306.99674267,
"logps/chosen": -476.466966966967,
"logps/rejected": -369.57168668566777,
"loss": 0.5804,
"loss/base_kto": 3.703371524810791,
"metrics/advantage_var": 253.0450439453125,
"regularization/mmd": 0.940221905708313,
"regularization/rkhs_norm": 181.16029357910156,
"rewards/chosen": 0.3106857620560013,
"rewards/margins": 0.24153146378932022,
"rewards/rejected": 0.06915429826668108,
"step": 640
},
{
"epoch": 0.8549222797927462,
"grad_norm": 12.880158424377441,
"kl": 11.941235542297363,
"learning_rate": 8.510383904798994e-07,
"logits/chosen": -36219840.18991098,
"logits/rejected": -36503883.19471947,
"logps/chosen": -472.118462537092,
"logps/rejected": -382.3772174092409,
"loss": 0.5795,
"loss/base_kto": 3.7101731300354004,
"metrics/advantage_var": 242.2503662109375,
"regularization/mmd": 0.9256561398506165,
"regularization/rkhs_norm": 178.35379028320312,
"rewards/chosen": 0.24291000592602466,
"rewards/margins": 0.2575938961900511,
"rewards/rejected": -0.014683890264026403,
"step": 660
},
{
"epoch": 0.8808290155440415,
"grad_norm": 17.78050422668457,
"kl": 17.598390579223633,
"learning_rate": 8.408032854569865e-07,
"logits/chosen": -36216828.94328358,
"logits/rejected": -36368175.84262295,
"logps/chosen": -487.8546641791045,
"logps/rejected": -374.89918032786886,
"loss": 0.5805,
"loss/base_kto": 3.708536148071289,
"metrics/advantage_var": 246.02774047851562,
"regularization/mmd": 0.9358450174331665,
"regularization/rkhs_norm": 180.3169708251953,
"rewards/chosen": 0.33828120445137594,
"rewards/margins": 0.23322944463772327,
"rewards/rejected": 0.10505175981365267,
"step": 680
},
{
"epoch": 0.9067357512953368,
"grad_norm": 17.22652816772461,
"kl": 15.75074291229248,
"learning_rate": 8.302942155487377e-07,
"logits/chosen": -36608895.59874608,
"logits/rejected": -37650680.8224299,
"logps/chosen": -504.24794278996865,
"logps/rejected": -397.5719431464174,
"loss": 0.579,
"loss/base_kto": 3.734424591064453,
"metrics/advantage_var": 258.8893737792969,
"regularization/mmd": 0.8979118466377258,
"regularization/rkhs_norm": 173.00808715820312,
"rewards/chosen": 0.2579734586996718,
"rewards/margins": 0.22677540275496166,
"rewards/rejected": 0.031198055944710135,
"step": 700
},
{
"epoch": 0.9326424870466321,
"grad_norm": 19.103612899780273,
"kl": 16.009614944458008,
"learning_rate": 8.195196287844278e-07,
"logits/chosen": -35493088.39506173,
"logits/rejected": -37134031.39240506,
"logps/chosen": -489.5078125,
"logps/rejected": -360.2166485363924,
"loss": 0.5729,
"loss/base_kto": 3.6622560024261475,
"metrics/advantage_var": 238.2059326171875,
"regularization/mmd": 0.9208865165710449,
"regularization/rkhs_norm": 177.4347686767578,
"rewards/chosen": 0.2761618767255618,
"rewards/margins": 0.2882395832496502,
"rewards/rejected": -0.012077706524088412,
"step": 720
},
{
"epoch": 0.9585492227979274,
"grad_norm": 14.776968002319336,
"kl": 9.46393871307373,
"learning_rate": 8.08488186636975e-07,
"logits/chosen": -36609194.666666664,
"logits/rejected": -36110916.682926826,
"logps/chosen": -485.6818409455128,
"logps/rejected": -383.7903248856707,
"loss": 0.5848,
"loss/base_kto": 3.771756410598755,
"metrics/advantage_var": 239.65869140625,
"regularization/mmd": 0.906679630279541,
"regularization/rkhs_norm": 174.6974334716797,
"rewards/chosen": 0.08732181940323268,
"rewards/margins": 0.18117325778600946,
"rewards/rejected": -0.09385143838277678,
"step": 740
},
{
"epoch": 0.9844559585492227,
"grad_norm": 22.42934799194336,
"kl": 20.882888793945312,
"learning_rate": 7.972087570601576e-07,
"logits/chosen": -35708801.69162995,
"logits/rejected": -36525840.66777963,
"logps/chosen": -487.431718061674,
"logps/rejected": -368.09416736227047,
"loss": 0.5788,
"loss/base_kto": 3.6808204650878906,
"metrics/advantage_var": 252.8956298828125,
"regularization/mmd": 0.9492565989494324,
"regularization/rkhs_norm": 182.90109252929688,
"rewards/chosen": 0.37040340742875827,
"rewards/margins": 0.30396737859000356,
"rewards/rejected": 0.0664360288387547,
"step": 760
},
{
"epoch": 1.0103626943005182,
"grad_norm": 18.60274887084961,
"kl": 18.21516227722168,
"learning_rate": 7.856904073598458e-07,
"logits/chosen": -36211937.57210776,
"logits/rejected": -36369403.251931995,
"logps/chosen": -469.4092709984152,
"logps/rejected": -361.03458268933537,
"loss": 0.5747,
"loss/base_kto": 3.5325393676757812,
"metrics/advantage_var": 381.392822265625,
"regularization/mmd": 1.0648847818374634,
"regularization/rkhs_norm": 205.18008422851562,
"rewards/chosen": 0.42569472710417494,
"rewards/margins": 0.4627660081953137,
"rewards/rejected": -0.03707128109113879,
"step": 780
},
{
"epoch": 1.0362694300518134,
"grad_norm": 14.687518119812012,
"kl": 14.834124565124512,
"learning_rate": 7.739423969049761e-07,
"logits/chosen": -36750019.08553655,
"logits/rejected": -38123317.45054945,
"logps/chosen": -482.89434292379474,
"logps/rejected": -380.6186715070644,
"loss": 0.5745,
"loss/base_kto": 3.207934617996216,
"metrics/advantage_var": 620.0404663085938,
"regularization/mmd": 1.3884562253952026,
"regularization/rkhs_norm": 267.5252990722656,
"rewards/chosen": 0.4830367828416602,
"rewards/margins": 0.8749562886811053,
"rewards/rejected": -0.3919195058394451,
"step": 800
},
{
"epoch": 1.0621761658031088,
"grad_norm": 16.64634132385254,
"kl": 19.01596450805664,
"learning_rate": 7.619741696841322e-07,
"logits/chosen": -36565908.54320987,
"logits/rejected": -38423234.43037975,
"logps/chosen": -491.9679783950617,
"logps/rejected": -356.3671380537975,
"loss": 0.5666,
"loss/base_kto": 3.2073490619659424,
"metrics/advantage_var": 536.5540161132812,
"regularization/mmd": 1.325656533241272,
"regularization/rkhs_norm": 255.42515563964844,
"rewards/chosen": 0.6128322930983555,
"rewards/margins": 0.8244463948462788,
"rewards/rejected": -0.21161410174792325,
"step": 820
},
{
"epoch": 1.0880829015544042,
"grad_norm": 15.253790855407715,
"kl": 14.648599624633789,
"learning_rate": 7.497953467137135e-07,
"logits/chosen": -36932947.2,
"logits/rejected": -37453164.8,
"logps/chosen": -471.4841796875,
"logps/rejected": -396.698095703125,
"loss": 0.5787,
"loss/base_kto": 3.218859910964966,
"metrics/advantage_var": 649.7261962890625,
"regularization/mmd": 1.4109556674957275,
"regularization/rkhs_norm": 271.8604431152344,
"rewards/chosen": 0.5692643165588379,
"rewards/margins": 0.8850962162017822,
"rewards/rejected": -0.31583189964294434,
"step": 840
},
{
"epoch": 1.1139896373056994,
"grad_norm": 15.689753532409668,
"kl": 16.705398559570312,
"learning_rate": 7.37415718303793e-07,
"logits/chosen": -35548578.6163522,
"logits/rejected": -37207968.596273296,
"logps/chosen": -497.97297562893084,
"logps/rejected": -377.9689926242236,
"loss": 0.5644,
"loss/base_kto": 3.212815046310425,
"metrics/advantage_var": 559.6679077148438,
"regularization/mmd": 1.3021559715270996,
"regularization/rkhs_norm": 250.8970947265625,
"rewards/chosen": 0.5622371457657724,
"rewards/margins": 0.861396983571479,
"rewards/rejected": -0.29915983780570654,
"step": 860
},
{
"epoch": 1.1398963730569949,
"grad_norm": 12.39108943939209,
"kl": 12.886560440063477,
"learning_rate": 7.248452361878855e-07,
"logits/chosen": -35173405.79479326,
"logits/rejected": -36652200.2169059,
"logps/chosen": -445.79383614088823,
"logps/rejected": -382.7857605661882,
"loss": 0.5668,
"loss/base_kto": 3.203948974609375,
"metrics/advantage_var": 564.2401733398438,
"regularization/mmd": 1.3306390047073364,
"regularization/rkhs_norm": 256.38519287109375,
"rewards/chosen": 0.49435803353512636,
"rewards/margins": 0.8814675496850093,
"rewards/rejected": -0.38710951614988287,
"step": 880
},
{
"epoch": 1.16580310880829,
"grad_norm": 17.558612823486328,
"kl": 14.927868843078613,
"learning_rate": 7.120940055229497e-07,
"logits/chosen": -35741001.544740975,
"logits/rejected": -36535453.66096423,
"logps/chosen": -470.7338598901099,
"logps/rejected": -370.9288005443235,
"loss": 0.5646,
"loss/base_kto": 3.196678876876831,
"metrics/advantage_var": 581.9120483398438,
"regularization/mmd": 1.3197563886642456,
"regularization/rkhs_norm": 254.288330078125,
"rewards/chosen": 0.5868753526049842,
"rewards/margins": 0.8817949020041629,
"rewards/rejected": -0.29491954939917864,
"step": 900
},
{
"epoch": 1.1917098445595855,
"grad_norm": 12.255751609802246,
"kl": 10.112584114074707,
"learning_rate": 6.991722767660556e-07,
"logits/chosen": -33169847.511177346,
"logits/rejected": -35017289.14285714,
"logps/chosen": -476.17688152011925,
"logps/rejected": -369.58138341543514,
"loss": 0.5696,
"loss/base_kto": 3.2321934700012207,
"metrics/advantage_var": 565.8189697265625,
"regularization/mmd": 1.3248211145401,
"regularization/rkhs_norm": 255.2642059326172,
"rewards/chosen": 0.5160929058774217,
"rewards/margins": 0.850682170344658,
"rewards/rejected": -0.33458926446723625,
"step": 920
},
{
"epoch": 1.2176165803108807,
"grad_norm": 12.581541061401367,
"kl": 21.432767868041992,
"learning_rate": 6.860904374342499e-07,
"logits/chosen": -35019660.53412463,
"logits/rejected": -35742821.38613861,
"logps/chosen": -492.2127225519288,
"logps/rejected": -366.06311881188117,
"loss": 0.5741,
"loss/base_kto": 3.2351837158203125,
"metrics/advantage_var": 610.61083984375,
"regularization/mmd": 1.3577238321304321,
"regularization/rkhs_norm": 261.6038513183594,
"rewards/chosen": 0.6210258325412649,
"rewards/margins": 0.8083742518314361,
"rewards/rejected": -0.1873484192901712,
"step": 940
},
{
"epoch": 1.2435233160621761,
"grad_norm": 11.823034286499023,
"kl": 16.603158950805664,
"learning_rate": 6.7285900375424e-07,
"logits/chosen": -34504306.14012739,
"logits/rejected": -34836454.87116564,
"logps/chosen": -494.34280453821657,
"logps/rejected": -389.03575536809814,
"loss": 0.5565,
"loss/base_kto": 3.244631290435791,
"metrics/advantage_var": 445.3918151855469,
"regularization/mmd": 1.2072175741195679,
"regularization/rkhs_norm": 232.6045379638672,
"rewards/chosen": 0.5095137577907295,
"rewards/margins": 0.8027251038143827,
"rewards/rejected": -0.2932113460236532,
"step": 960
},
{
"epoch": 1.2694300518134716,
"grad_norm": 12.478619575500488,
"kl": 16.44584083557129,
"learning_rate": 6.594886122086123e-07,
"logits/chosen": -34616902.51497006,
"logits/rejected": -37056214.16993464,
"logps/chosen": -486.3734094311377,
"logps/rejected": -356.7321793300654,
"loss": 0.5713,
"loss/base_kto": 3.161914348602295,
"metrics/advantage_var": 634.0953979492188,
"regularization/mmd": 1.4081577062606812,
"regularization/rkhs_norm": 271.32135009765625,
"rewards/chosen": 0.6529807816008608,
"rewards/margins": 0.9607664640297569,
"rewards/rejected": -0.30778568242889603,
"step": 980
},
{
"epoch": 1.2953367875647668,
"grad_norm": 12.8961763381958,
"kl": 22.179479598999023,
"learning_rate": 6.459900109853766e-07,
"logits/chosen": -34196191.65905631,
"logits/rejected": -35577073.61797753,
"logps/chosen": -489.5189307458143,
"logps/rejected": -364.6163723916533,
"loss": 0.5606,
"loss/base_kto": 3.1646974086761475,
"metrics/advantage_var": 525.2611694335938,
"regularization/mmd": 1.31988525390625,
"regularization/rkhs_norm": 254.31314086914062,
"rewards/chosen": 0.7416043680733924,
"rewards/margins": 0.875811663449847,
"rewards/rejected": -0.13420729537645465,
"step": 1000
},
{
"epoch": 1.3212435233160622,
"grad_norm": 16.533170700073242,
"kl": 14.972345352172852,
"learning_rate": 6.323740513377171e-07,
"logits/chosen": -34331405.2621664,
"logits/rejected": -34009075.259720065,
"logps/chosen": -473.5820251177394,
"logps/rejected": -356.50770314930014,
"loss": 0.5626,
"loss/base_kto": 3.216235876083374,
"metrics/advantage_var": 530.1517333984375,
"regularization/mmd": 1.2849127054214478,
"regularization/rkhs_norm": 247.57470703125,
"rewards/chosen": 0.5380662951027767,
"rewards/margins": 0.8503745991493601,
"rewards/rejected": -0.3123083040465834,
"step": 1020
},
{
"epoch": 1.3471502590673574,
"grad_norm": 8.892478942871094,
"kl": 11.803365707397461,
"learning_rate": 6.186516788608865e-07,
"logits/chosen": -34360079.441269845,
"logits/rejected": -34933177.10769231,
"logps/chosen": -480.28035714285716,
"logps/rejected": -374.7328365384615,
"loss": 0.5574,
"loss/base_kto": 3.1655123233795166,
"metrics/advantage_var": 536.4296875,
"regularization/mmd": 1.2939534187316895,
"regularization/rkhs_norm": 249.316650390625,
"rewards/chosen": 0.5368955581907242,
"rewards/margins": 0.9317764926859164,
"rewards/rejected": -0.3948809344951923,
"step": 1040
},
{
"epoch": 1.3730569948186528,
"grad_norm": 11.752116203308105,
"kl": 9.889144897460938,
"learning_rate": 6.048339246932652e-07,
"logits/chosen": -36479127.7037037,
"logits/rejected": -36003818.24582701,
"logps/chosen": -520.2193035426731,
"logps/rejected": -378.63972401365703,
"loss": 0.5772,
"loss/base_kto": 3.2081775665283203,
"metrics/advantage_var": 663.02197265625,
"regularization/mmd": 1.4091278314590454,
"regularization/rkhs_norm": 271.5082702636719,
"rewards/chosen": 0.4727240668402778,
"rewards/margins": 0.8728357269076147,
"rewards/rejected": -0.4001116600673369,
"step": 1060
},
{
"epoch": 1.3989637305699483,
"grad_norm": 16.082019805908203,
"kl": 6.320364475250244,
"learning_rate": 5.909318966486494e-07,
"logits/chosen": -34601571.39314845,
"logits/rejected": -35609131.754122935,
"logps/chosen": -462.0130505709625,
"logps/rejected": -380.0276424287856,
"loss": 0.5659,
"loss/base_kto": 3.2715508937835693,
"metrics/advantage_var": 455.0561218261719,
"regularization/mmd": 1.255906105041504,
"regularization/rkhs_norm": 241.98574829101562,
"rewards/chosen": 0.30424208275451164,
"rewards/margins": 0.7885519297841219,
"rewards/rejected": -0.4843098470296102,
"step": 1080
},
{
"epoch": 1.4248704663212435,
"grad_norm": 17.883174896240234,
"kl": 8.331497192382812,
"learning_rate": 5.769567702869052e-07,
"logits/chosen": -34640315.94936709,
"logits/rejected": -36164487.90123457,
"logps/chosen": -491.1646558544304,
"logps/rejected": -387.675106095679,
"loss": 0.5795,
"loss/base_kto": 3.169969320297241,
"metrics/advantage_var": 712.0158081054688,
"regularization/mmd": 1.466303825378418,
"regularization/rkhs_norm": 282.5248107910156,
"rewards/chosen": 0.41718383982211726,
"rewards/margins": 0.9380789618321481,
"rewards/rejected": -0.5208951220100309,
"step": 1100
},
{
"epoch": 1.450777202072539,
"grad_norm": 13.120745658874512,
"kl": 11.672740936279297,
"learning_rate": 5.629197799301614e-07,
"logits/chosen": -34248807.206299216,
"logits/rejected": -35292952.21085271,
"logps/chosen": -453.683907480315,
"logps/rejected": -369.9968265503876,
"loss": 0.5667,
"loss/base_kto": 3.268097400665283,
"metrics/advantage_var": 539.9569091796875,
"regularization/mmd": 1.2653586864471436,
"regularization/rkhs_norm": 243.8070831298828,
"rewards/chosen": 0.37055841881459156,
"rewards/margins": 0.7732348340731914,
"rewards/rejected": -0.4026764152585998,
"step": 1120
},
{
"epoch": 1.4766839378238341,
"grad_norm": 14.594772338867188,
"kl": 12.012019157409668,
"learning_rate": 5.488322096317633e-07,
"logits/chosen": -34129042.73651772,
"logits/rejected": -34942648.19017433,
"logps/chosen": -471.9741910631741,
"logps/rejected": -360.9488411251981,
"loss": 0.5646,
"loss/base_kto": 3.235393524169922,
"metrics/advantage_var": 526.1349487304688,
"regularization/mmd": 1.2810367345809937,
"regularization/rkhs_norm": 246.82791137695312,
"rewards/chosen": 0.5198080242139349,
"rewards/margins": 0.8130445405709699,
"rewards/rejected": -0.29323651635703496,
"step": 1140
},
{
"epoch": 1.5025906735751295,
"grad_norm": 10.872600555419922,
"kl": 16.5655460357666,
"learning_rate": 5.347053841052518e-07,
"logits/chosen": -35674686.23662885,
"logits/rejected": -36162842.642533936,
"logps/chosen": -480.79092382495946,
"logps/rejected": -369.57614536199094,
"loss": 0.5589,
"loss/base_kto": 3.2694852352142334,
"metrics/advantage_var": 443.4609069824219,
"regularization/mmd": 1.2020606994628906,
"regularization/rkhs_norm": 231.61094665527344,
"rewards/chosen": 0.4575632549761953,
"rewards/margins": 0.7811450023160568,
"rewards/rejected": -0.32358174733986145,
"step": 1160
},
{
"epoch": 1.528497409326425,
"grad_norm": 25.44319725036621,
"kl": 11.072982788085938,
"learning_rate": 5.205506596206531e-07,
"logits/chosen": -34653834.48531685,
"logits/rejected": -35809241.17535545,
"logps/chosen": -484.25661707882534,
"logps/rejected": -367.08656694312793,
"loss": 0.5779,
"loss/base_kto": 3.2494781017303467,
"metrics/advantage_var": 722.969970703125,
"regularization/mmd": 1.3739899396896362,
"regularization/rkhs_norm": 264.7379455566406,
"rewards/chosen": 0.4823256054838437,
"rewards/margins": 0.8268611318016631,
"rewards/rejected": -0.3445355263178194,
"step": 1180
},
{
"epoch": 1.5544041450777202,
"grad_norm": 11.706360816955566,
"kl": 6.393588542938232,
"learning_rate": 5.063794148754032e-07,
"logits/chosen": -34604419.97515528,
"logits/rejected": -36769808.10062893,
"logps/chosen": -475.4421583850932,
"logps/rejected": -392.9174282625786,
"loss": 0.5581,
"loss/base_kto": 3.1633262634277344,
"metrics/advantage_var": 502.78985595703125,
"regularization/mmd": 1.3012621402740479,
"regularization/rkhs_norm": 250.7248992919922,
"rewards/chosen": 0.39339698175465837,
"rewards/margins": 0.9010490245514351,
"rewards/rejected": -0.5076520427967768,
"step": 1200
},
{
"epoch": 1.5803108808290154,
"grad_norm": 15.006986618041992,
"kl": 13.777557373046875,
"learning_rate": 4.922030418472422e-07,
"logits/chosen": -35110965.36807817,
"logits/rejected": -35664573.117117114,
"logps/chosen": -485.68800895765474,
"logps/rejected": -372.91446133633633,
"loss": 0.5656,
"loss/base_kto": 3.1921632289886475,
"metrics/advantage_var": 620.4743041992188,
"regularization/mmd": 1.3327293395996094,
"regularization/rkhs_norm": 256.7879333496094,
"rewards/chosen": 0.5097670166810871,
"rewards/margins": 0.9058117735962055,
"rewards/rejected": -0.39604475691511826,
"step": 1220
},
{
"epoch": 1.6062176165803108,
"grad_norm": 13.3948335647583,
"kl": 12.922057151794434,
"learning_rate": 4.780329366364336e-07,
"logits/chosen": -34602487.37519143,
"logits/rejected": -36220268.197767146,
"logps/chosen": -473.24832503828486,
"logps/rejected": -379.8467653508772,
"loss": 0.5714,
"loss/base_kto": 3.195450782775879,
"metrics/advantage_var": 598.126953125,
"regularization/mmd": 1.3760026693344116,
"regularization/rkhs_norm": 265.1257629394531,
"rewards/chosen": 0.4908813196155963,
"rewards/margins": 0.8503444166114595,
"rewards/rejected": -0.35946309699586326,
"step": 1240
},
{
"epoch": 1.6321243523316062,
"grad_norm": 10.40219783782959,
"kl": 13.461359024047852,
"learning_rate": 4.638804903046684e-07,
"logits/chosen": -35307949.627760254,
"logits/rejected": -37240178.92260062,
"logps/chosen": -503.9521884858044,
"logps/rejected": -370.43815305727554,
"loss": 0.5666,
"loss/base_kto": 3.1887176036834717,
"metrics/advantage_var": 568.2356567382812,
"regularization/mmd": 1.3442790508270264,
"regularization/rkhs_norm": 259.0133361816406,
"rewards/chosen": 0.554238496894716,
"rewards/margins": 0.8942932716957754,
"rewards/rejected": -0.3400547748010594,
"step": 1260
},
{
"epoch": 1.6580310880829017,
"grad_norm": 13.56784439086914,
"kl": 12.849693298339844,
"learning_rate": 4.497570797180217e-07,
"logits/chosen": -35670589.44,
"logits/rejected": -35388243.70793651,
"logps/chosen": -471.4319711538462,
"logps/rejected": -390.88993055555557,
"loss": 0.5605,
"loss/base_kto": 3.197096347808838,
"metrics/advantage_var": 507.1678771972656,
"regularization/mmd": 1.2867193222045898,
"regularization/rkhs_norm": 247.9228057861328,
"rewards/chosen": 0.46277982271634616,
"rewards/margins": 0.8514659392528046,
"rewards/rejected": -0.38868611653645835,
"step": 1280
},
{
"epoch": 1.6839378238341969,
"grad_norm": 11.178312301635742,
"kl": 13.838495254516602,
"learning_rate": 4.3567405840131853e-07,
"logits/chosen": -35516440.23668639,
"logits/rejected": -35471732.98013245,
"logps/chosen": -480.5735022189349,
"logps/rejected": -377.0640004139073,
"loss": 0.5584,
"loss/base_kto": 3.1743791103363037,
"metrics/advantage_var": 519.8939208984375,
"regularization/mmd": 1.2927216291427612,
"regularization/rkhs_norm": 249.0792999267578,
"rewards/chosen": 0.6114454100117881,
"rewards/margins": 0.8495071001844003,
"rewards/rejected": -0.23806169017261228,
"step": 1300
},
{
"epoch": 1.709844559585492,
"grad_norm": 13.94364070892334,
"kl": 13.35486888885498,
"learning_rate": 4.2164274741126506e-07,
"logits/chosen": -35970627.654159866,
"logits/rejected": -35843678.4167916,
"logps/chosen": -480.89228181076675,
"logps/rejected": -384.869049850075,
"loss": 0.5568,
"loss/base_kto": 3.111708879470825,
"metrics/advantage_var": 580.8645629882812,
"regularization/mmd": 1.3426902294158936,
"regularization/rkhs_norm": 258.7071838378906,
"rewards/chosen": 0.5695681797544097,
"rewards/margins": 0.9661051712684183,
"rewards/rejected": -0.3965369915140086,
"step": 1320
},
{
"epoch": 1.7357512953367875,
"grad_norm": 14.192017555236816,
"kl": 9.430925369262695,
"learning_rate": 4.0767442623567856e-07,
"logits/chosen": -34147431.69620253,
"logits/rejected": -35879531.45679013,
"logps/chosen": -483.69882318037975,
"logps/rejected": -362.12548225308643,
"loss": 0.5626,
"loss/base_kto": 3.2272446155548096,
"metrics/advantage_var": 537.1535034179688,
"regularization/mmd": 1.2738579511642456,
"regularization/rkhs_norm": 245.44468688964844,
"rewards/chosen": 0.40774927260000493,
"rewards/margins": 0.8499849131375965,
"rewards/rejected": -0.4422356405375916,
"step": 1340
},
{
"epoch": 1.761658031088083,
"grad_norm": 13.242347717285156,
"kl": 12.410801887512207,
"learning_rate": 3.937803237261357e-07,
"logits/chosen": -35401925.16770186,
"logits/rejected": -36353403.974842764,
"logps/chosen": -472.5767663043478,
"logps/rejected": -383.88600628930817,
"loss": 0.5685,
"loss/base_kto": 3.1965625286102295,
"metrics/advantage_var": 632.8568115234375,
"regularization/mmd": 1.351798176765442,
"regularization/rkhs_norm": 260.4620666503906,
"rewards/chosen": 0.5138472089115877,
"rewards/margins": 0.9225423098998199,
"rewards/rejected": -0.40869510098823214,
"step": 1360
},
{
"epoch": 1.7875647668393784,
"grad_norm": 7.022293567657471,
"kl": 15.356457710266113,
"learning_rate": 3.7997160907132456e-07,
"logits/chosen": -34751122.39876352,
"logits/rejected": -36463200.25276461,
"logps/chosen": -499.6193972179289,
"logps/rejected": -386.7578248420221,
"loss": 0.5667,
"loss/base_kto": 3.2281863689422607,
"metrics/advantage_var": 516.4188842773438,
"regularization/mmd": 1.3055304288864136,
"regularization/rkhs_norm": 251.54727172851562,
"rewards/chosen": 0.5532462401589064,
"rewards/margins": 0.8311311830076302,
"rewards/rejected": -0.27788494284872384,
"step": 1380
},
{
"epoch": 1.8134715025906736,
"grad_norm": 9.221452713012695,
"kl": 15.334212303161621,
"learning_rate": 3.662593828183601e-07,
"logits/chosen": -34571923.10754414,
"logits/rejected": -35196793.96042618,
"logps/chosen": -491.7119783306581,
"logps/rejected": -353.80498477929984,
"loss": 0.5508,
"loss/base_kto": 3.180082082748413,
"metrics/advantage_var": 453.50323486328125,
"regularization/mmd": 1.2262661457061768,
"regularization/rkhs_norm": 236.27481079101562,
"rewards/chosen": 0.5832736044404595,
"rewards/margins": 0.8477262092016848,
"rewards/rejected": -0.2644526047612253,
"step": 1400
},
{
"epoch": 1.8393782383419688,
"grad_norm": 13.601996421813965,
"kl": 9.088701248168945,
"learning_rate": 3.5265466794927725e-07,
"logits/chosen": -34697375.03645008,
"logits/rejected": -36160870.1633282,
"logps/chosen": -482.32611925515056,
"logps/rejected": -385.1588020030817,
"loss": 0.5606,
"loss/base_kto": 3.2661895751953125,
"metrics/advantage_var": 430.220947265625,
"regularization/mmd": 1.2183843851089478,
"regularization/rkhs_norm": 234.7561492919922,
"rewards/chosen": 0.4164625068096276,
"rewards/margins": 0.7796778078060524,
"rewards/rejected": -0.3632153009964248,
"step": 1420
},
{
"epoch": 1.8652849740932642,
"grad_norm": 10.456588745117188,
"kl": 9.765243530273438,
"learning_rate": 3.3916840101987887e-07,
"logits/chosen": -33571011.98086125,
"logits/rejected": -34984230.81163859,
"logps/chosen": -480.03369218500796,
"logps/rejected": -383.59741098774884,
"loss": 0.5617,
"loss/base_kto": 3.257220506668091,
"metrics/advantage_var": 498.43560791015625,
"regularization/mmd": 1.236567497253418,
"regularization/rkhs_norm": 238.2596435546875,
"rewards/chosen": 0.4319639555765301,
"rewards/margins": 0.7968944166246972,
"rewards/rejected": -0.3649304610481671,
"step": 1440
},
{
"epoch": 1.8911917098445596,
"grad_norm": 13.861790657043457,
"kl": 9.847267150878906,
"learning_rate": 3.258114233680583e-07,
"logits/chosen": -34855167.59557662,
"logits/rejected": -35080321.780525506,
"logps/chosen": -456.07523696682466,
"logps/rejected": -403.0278931607419,
"loss": 0.5655,
"loss/base_kto": 3.247133731842041,
"metrics/advantage_var": 668.1593627929688,
"regularization/mmd": 1.276819109916687,
"regularization/rkhs_norm": 246.0152587890625,
"rewards/chosen": 0.36525370762058157,
"rewards/margins": 0.7917951141724556,
"rewards/rejected": -0.42654140655187406,
"step": 1460
},
{
"epoch": 1.917098445595855,
"grad_norm": 11.58325481414795,
"kl": 8.980515480041504,
"learning_rate": 3.1259447239866796e-07,
"logits/chosen": -34816525.97110754,
"logits/rejected": -35051142.818873666,
"logps/chosen": -497.8179173354735,
"logps/rejected": -374.10816210045664,
"loss": 0.5605,
"loss/base_kto": 3.2262959480285645,
"metrics/advantage_var": 480.5451354980469,
"regularization/mmd": 1.2574070692062378,
"regularization/rkhs_norm": 242.2749481201172,
"rewards/chosen": 0.4310284609970656,
"rewards/margins": 0.8517019881267744,
"rewards/rejected": -0.4206735271297089,
"step": 1480
},
{
"epoch": 1.9430051813471503,
"grad_norm": 9.798060417175293,
"kl": 10.43753719329834,
"learning_rate": 2.9952817295193435e-07,
"logits/chosen": -35005108.28169014,
"logits/rejected": -35699582.60218409,
"logps/chosen": -480.3617957746479,
"logps/rejected": -391.8496246099844,
"loss": 0.5508,
"loss/base_kto": 3.20361328125,
"metrics/advantage_var": 450.1048889160156,
"regularization/mmd": 1.2024950981140137,
"regularization/rkhs_norm": 231.6946258544922,
"rewards/chosen": 0.4042446751363214,
"rewards/margins": 0.8451452188729146,
"rewards/rejected": -0.4409005437365932,
"step": 1500
},
{
"epoch": 1.9689119170984455,
"grad_norm": 12.717971801757812,
"kl": 14.745546340942383,
"learning_rate": 2.866230287623651e-07,
"logits/chosen": -35810253.43209877,
"logits/rejected": -37534616.30379747,
"logps/chosen": -490.432918595679,
"logps/rejected": -366.3148734177215,
"loss": 0.5669,
"loss/base_kto": 3.1946423053741455,
"metrics/advantage_var": 550.33056640625,
"regularization/mmd": 1.34068763256073,
"regularization/rkhs_norm": 258.32135009765625,
"rewards/chosen": 0.5913930822301794,
"rewards/margins": 0.8842159562752496,
"rewards/rejected": -0.29282287404507024,
"step": 1520
},
{
"epoch": 1.994818652849741,
"grad_norm": 13.095698356628418,
"kl": 8.906962394714355,
"learning_rate": 2.738894140150075e-07,
"logits/chosen": -33991900.23233909,
"logits/rejected": -35287810.78693624,
"logps/chosen": -498.6856848508634,
"logps/rejected": -382.642301710731,
"loss": 0.564,
"loss/base_kto": 3.180330753326416,
"metrics/advantage_var": 606.4514770507812,
"regularization/mmd": 1.3320293426513672,
"regularization/rkhs_norm": 256.6530456542969,
"rewards/chosen": 0.49957534095368916,
"rewards/margins": 0.9116029876962533,
"rewards/rejected": -0.41202764674256415,
"step": 1540
},
{
"epoch": 2.0207253886010363,
"grad_norm": 9.971153259277344,
"kl": 11.401013374328613,
"learning_rate": 2.6133756500585156e-07,
"logits/chosen": -34561693.17933131,
"logits/rejected": -36233870.03870968,
"logps/chosen": -488.33130699088144,
"logps/rejected": -350.17011088709677,
"loss": 0.5301,
"loss/base_kto": 3.1072757244110107,
"metrics/advantage_var": 364.1158752441406,
"regularization/mmd": 1.1331380605697632,
"regularization/rkhs_norm": 218.33103942871094,
"rewards/chosen": 0.5380707714695336,
"rewards/margins": 0.9163498360171647,
"rewards/rejected": -0.37827906454763105,
"step": 1560
},
{
"epoch": 2.0466321243523318,
"grad_norm": 10.389137268066406,
"kl": 14.117828369140625,
"learning_rate": 2.489775719130767e-07,
"logits/chosen": -33827361.267828844,
"logits/rejected": -34959454.66872111,
"logps/chosen": -464.130645800317,
"logps/rejected": -392.2838020030817,
"loss": 0.5229,
"loss/base_kto": 3.09826397895813,
"metrics/advantage_var": 331.5031433105469,
"regularization/mmd": 1.084905982017517,
"regularization/rkhs_norm": 209.0377655029297,
"rewards/chosen": 0.5963450097811014,
"rewards/margins": 0.9037712625723547,
"rewards/rejected": -0.30742625279125335,
"step": 1580
},
{
"epoch": 2.0725388601036268,
"grad_norm": 8.604015350341797,
"kl": 8.978219032287598,
"learning_rate": 2.3681937068576303e-07,
"logits/chosen": -34979393.602356404,
"logits/rejected": -36312972.13976706,
"logps/chosen": -488.62638070692196,
"logps/rejected": -365.0787229617305,
"loss": 0.5302,
"loss/base_kto": 3.0801150798797607,
"metrics/advantage_var": 380.2249755859375,
"regularization/mmd": 1.16116464138031,
"regularization/rkhs_norm": 223.7311553955078,
"rewards/chosen": 0.5334298719538153,
"rewards/margins": 0.9683087115830791,
"rewards/rejected": -0.4348788396292637,
"step": 1600
},
{
"epoch": 2.098445595854922,
"grad_norm": 10.985217094421387,
"kl": 14.511804580688477,
"learning_rate": 2.2487273505658e-07,
"logits/chosen": -36486346.383480825,
"logits/rejected": -36747512.34551495,
"logps/chosen": -495.9096607669617,
"logps/rejected": -396.19160091362124,
"loss": 0.5287,
"loss/base_kto": 3.0640370845794678,
"metrics/advantage_var": 381.7714538574219,
"regularization/mmd": 1.1654428243637085,
"regularization/rkhs_norm": 224.55545043945312,
"rewards/chosen": 0.6548410151208748,
"rewards/margins": 0.9437970584529969,
"rewards/rejected": -0.2889560433321221,
"step": 1620
},
{
"epoch": 2.1243523316062176,
"grad_norm": 10.690685272216797,
"kl": 16.309289932250977,
"learning_rate": 2.131472686848817e-07,
"logits/chosen": -35286133.915151514,
"logits/rejected": -36748786.787096776,
"logps/chosen": -483.8376893939394,
"logps/rejected": -386.22842741935483,
"loss": 0.5286,
"loss/base_kto": 3.0449044704437256,
"metrics/advantage_var": 424.19482421875,
"regularization/mmd": 1.1837689876556396,
"regularization/rkhs_norm": 228.0865020751953,
"rewards/chosen": 0.6678506562204072,
"rewards/margins": 0.9900833025472722,
"rewards/rejected": -0.32223264632686494,
"step": 1640
},
{
"epoch": 2.150259067357513,
"grad_norm": 9.810893058776855,
"kl": 14.84647274017334,
"learning_rate": 2.016523974365188e-07,
"logits/chosen": -35376230.702064894,
"logits/rejected": -36343113.99335548,
"logps/chosen": -495.2001290560472,
"logps/rejected": -388.9727990033223,
"loss": 0.5315,
"loss/base_kto": 3.0942509174346924,
"metrics/advantage_var": 382.7725524902344,
"regularization/mmd": 1.1580281257629395,
"regularization/rkhs_norm": 223.12681579589844,
"rewards/chosen": 0.649119419334209,
"rewards/margins": 0.920761857139182,
"rewards/rejected": -0.271642437804973,
"step": 1660
},
{
"epoch": 2.1761658031088085,
"grad_norm": 10.877507209777832,
"kl": 17.48152732849121,
"learning_rate": 1.9039736180657372e-07,
"logits/chosen": -35132161.23274478,
"logits/rejected": -35961845.08980213,
"logps/chosen": -474.65048154093097,
"logps/rejected": -376.8831811263318,
"loss": 0.5274,
"loss/base_kto": 3.0635948181152344,
"metrics/advantage_var": 374.0828552246094,
"regularization/mmd": 1.1555202007293701,
"regularization/rkhs_norm": 222.64358520507812,
"rewards/chosen": 0.6907168368466593,
"rewards/margins": 0.954688615565326,
"rewards/rejected": -0.2639717787186668,
"step": 1680
},
{
"epoch": 2.2020725388601035,
"grad_norm": 9.450188636779785,
"kl": 10.73950481414795,
"learning_rate": 1.7939120949111498e-07,
"logits/chosen": -34716625.816485226,
"logits/rejected": -35182775.25902669,
"logps/chosen": -488.67282270606535,
"logps/rejected": -349.94608516483515,
"loss": 0.5252,
"loss/base_kto": 3.1477468013763428,
"metrics/advantage_var": 330.1083068847656,
"regularization/mmd": 1.0534805059432983,
"regularization/rkhs_norm": 202.98275756835938,
"rewards/chosen": 0.4984940548150758,
"rewards/margins": 0.8629275949077956,
"rewards/rejected": -0.3644335400927198,
"step": 1700
},
{
"epoch": 2.227979274611399,
"grad_norm": 9.99582290649414,
"kl": 15.615806579589844,
"learning_rate": 1.6864278811393523e-07,
"logits/chosen": -34721485.4522293,
"logits/rejected": -35511142.08588957,
"logps/chosen": -442.3390724522293,
"logps/rejected": -392.20252588190186,
"loss": 0.524,
"loss/base_kto": 3.085685968399048,
"metrics/advantage_var": 377.5616149902344,
"regularization/mmd": 1.1066991090774536,
"regularization/rkhs_norm": 213.23684692382812,
"rewards/chosen": 0.554456479989799,
"rewards/margins": 0.928293910042761,
"rewards/rejected": -0.37383743005296205,
"step": 1720
},
{
"epoch": 2.2538860103626943,
"grad_norm": 8.671745300292969,
"kl": 11.820478439331055,
"learning_rate": 1.5816073811412584e-07,
"logits/chosen": -34835478.61198738,
"logits/rejected": -35504559.15789474,
"logps/chosen": -467.85484029968455,
"logps/rejected": -375.56946594427245,
"loss": 0.5259,
"loss/base_kto": 3.0810964107513428,
"metrics/advantage_var": 367.2216491699219,
"regularization/mmd": 1.1258373260498047,
"regularization/rkhs_norm": 216.92431640625,
"rewards/chosen": 0.5543758259962785,
"rewards/margins": 0.9589037086697015,
"rewards/rejected": -0.404527882673423,
"step": 1740
},
{
"epoch": 2.2797927461139897,
"grad_norm": 9.208166122436523,
"kl": 12.190825462341309,
"learning_rate": 1.4795348580020207e-07,
"logits/chosen": -35194234.649517685,
"logits/rejected": -36754758.80851064,
"logps/chosen": -494.23728898713824,
"logps/rejected": -358.1865738981763,
"loss": 0.5276,
"loss/base_kto": 3.098057985305786,
"metrics/advantage_var": 362.88330078125,
"regularization/mmd": 1.1229840517044067,
"regularization/rkhs_norm": 216.3745574951172,
"rewards/chosen": 0.5411652690727994,
"rewards/margins": 0.9349086275573169,
"rewards/rejected": -0.39374335848451747,
"step": 1760
},
{
"epoch": 2.305699481865285,
"grad_norm": 11.298110961914062,
"kl": 11.307663917541504,
"learning_rate": 1.3802923657636355e-07,
"logits/chosen": -35621310.72196621,
"logits/rejected": -36497704.292527825,
"logps/chosen": -459.1538498463902,
"logps/rejected": -371.0775288155803,
"loss": 0.5246,
"loss/base_kto": 3.0882489681243896,
"metrics/advantage_var": 366.67852783203125,
"regularization/mmd": 1.108572006225586,
"regularization/rkhs_norm": 213.5977020263672,
"rewards/chosen": 0.5571527202740976,
"rewards/margins": 0.9439781605035044,
"rewards/rejected": -0.3868254402294068,
"step": 1780
},
{
"epoch": 2.33160621761658,
"grad_norm": 8.899885177612305,
"kl": 14.008285522460938,
"learning_rate": 1.28395968346336e-07,
"logits/chosen": -34340141.74294671,
"logits/rejected": -34434909.30841122,
"logps/chosen": -480.7867358934169,
"logps/rejected": -356.93443341121497,
"loss": 0.5305,
"loss/base_kto": 3.1063425540924072,
"metrics/advantage_var": 375.7760314941406,
"regularization/mmd": 1.1377207040786743,
"regularization/rkhs_norm": 219.21401977539062,
"rewards/chosen": 0.586709432093701,
"rewards/margins": 0.9054192601228701,
"rewards/rejected": -0.3187098280291691,
"step": 1800
},
{
"epoch": 2.3575129533678756,
"grad_norm": 11.797314643859863,
"kl": 12.688746452331543,
"learning_rate": 1.1906142510009415e-07,
"logits/chosen": -33929174.97688752,
"logits/rejected": -37030371.60063391,
"logps/chosen": -512.4694722650231,
"logps/rejected": -380.10239203645006,
"loss": 0.5319,
"loss/base_kto": 3.0777459144592285,
"metrics/advantage_var": 405.9903869628906,
"regularization/mmd": 1.1776024103164673,
"regularization/rkhs_norm": 226.89834594726562,
"rewards/chosen": 0.5939235128864118,
"rewards/margins": 0.9247837777809245,
"rewards/rejected": -0.3308602648945127,
"step": 1820
},
{
"epoch": 2.383419689119171,
"grad_norm": 9.855902671813965,
"kl": 14.851201057434082,
"learning_rate": 1.1003311068862547e-07,
"logits/chosen": -34853804.408163264,
"logits/rejected": -36198015.26011561,
"logps/chosen": -487.37744472789115,
"logps/rejected": -391.79588150289015,
"loss": 0.5265,
"loss/base_kto": 3.0706169605255127,
"metrics/advantage_var": 392.9869689941406,
"regularization/mmd": 1.1414614915847778,
"regularization/rkhs_norm": 219.93479919433594,
"rewards/chosen": 0.5632651192801339,
"rewards/margins": 0.9373461079932164,
"rewards/rejected": -0.37408098871308254,
"step": 1840
},
{
"epoch": 2.4093264248704664,
"grad_norm": 9.871848106384277,
"kl": 8.795090675354004,
"learning_rate": 1.0131828279173588e-07,
"logits/chosen": -34945181.2864,
"logits/rejected": -35831795.49312977,
"logps/chosen": -500.3369,
"logps/rejected": -381.2418893129771,
"loss": 0.5279,
"loss/base_kto": 3.097670316696167,
"metrics/advantage_var": 380.62872314453125,
"regularization/mmd": 1.1255066394805908,
"regularization/rkhs_norm": 216.86062622070312,
"rewards/chosen": 0.47675625,
"rewards/margins": 0.9335280772900763,
"rewards/rejected": -0.4567718272900763,
"step": 1860
},
{
"epoch": 2.4352331606217614,
"grad_norm": 8.385743141174316,
"kl": 8.921009063720703,
"learning_rate": 9.292394708374596e-08,
"logits/chosen": -34484803.434146345,
"logits/rejected": -36060999.218045115,
"logps/chosen": -492.82560975609755,
"logps/rejected": -349.38188439849625,
"loss": 0.5237,
"loss/base_kto": 3.0965182781219482,
"metrics/advantage_var": 345.7809753417969,
"regularization/mmd": 1.0931130647659302,
"regularization/rkhs_norm": 210.6190948486328,
"rewards/chosen": 0.4762144507431402,
"rewards/margins": 0.9288405227591177,
"rewards/rejected": -0.45262607201597743,
"step": 1880
},
{
"epoch": 2.461139896373057,
"grad_norm": 9.640080451965332,
"kl": 9.840849876403809,
"learning_rate": 8.48568516017727e-08,
"logits/chosen": -34486997.793528505,
"logits/rejected": -36593251.803486526,
"logps/chosen": -475.4094761171032,
"logps/rejected": -364.7089936608558,
"loss": 0.5308,
"loss/base_kto": 3.096221685409546,
"metrics/advantage_var": 378.3948669433594,
"regularization/mmd": 1.1503757238388062,
"regularization/rkhs_norm": 221.65237426757812,
"rewards/chosen": 0.5039539307769164,
"rewards/margins": 0.9324591285346917,
"rewards/rejected": -0.42850519775777535,
"step": 1900
},
{
"epoch": 2.4870466321243523,
"grad_norm": 11.856900215148926,
"kl": 11.206775665283203,
"learning_rate": 7.71234813211169e-08,
"logits/chosen": -34000229.34897361,
"logits/rejected": -35028485.13712375,
"logps/chosen": -479.1497434017595,
"logps/rejected": -356.11266722408027,
"loss": 0.5258,
"loss/base_kto": 3.1185264587402344,
"metrics/advantage_var": 332.6591796875,
"regularization/mmd": 1.0881156921386719,
"regularization/rkhs_norm": 209.65623474121094,
"rewards/chosen": 0.5253451171159045,
"rewards/margins": 0.9024306720744903,
"rewards/rejected": -0.3770855549585859,
"step": 1920
},
{
"epoch": 2.5129533678756477,
"grad_norm": 11.317198753356934,
"kl": 14.708724975585938,
"learning_rate": 6.973005294212353e-08,
"logits/chosen": -33627358.072289154,
"logits/rejected": -34988776.72727273,
"logps/chosen": -487.5407567771084,
"logps/rejected": -379.77227069805195,
"loss": 0.5208,
"loss/base_kto": 3.035454273223877,
"metrics/advantage_var": 356.38140869140625,
"regularization/mmd": 1.1312255859375,
"regularization/rkhs_norm": 217.96255493164062,
"rewards/chosen": 0.6100821437605892,
"rewards/margins": 0.985807951842278,
"rewards/rejected": -0.3757258080816888,
"step": 1940
},
{
"epoch": 2.538860103626943,
"grad_norm": 9.777588844299316,
"kl": 15.399670600891113,
"learning_rate": 6.268250989270102e-08,
"logits/chosen": -35688000.0,
"logits/rejected": -36090995.809523806,
"logps/chosen": -473.5448704769737,
"logps/rejected": -372.62806919642856,
"loss": 0.5246,
"loss/base_kto": 3.0967891216278076,
"metrics/advantage_var": 350.7513427734375,
"regularization/mmd": 1.100196361541748,
"regularization/rkhs_norm": 211.98388671875,
"rewards/chosen": 0.5481959895083779,
"rewards/margins": 0.898092942727837,
"rewards/rejected": -0.3498969532194592,
"step": 1960
},
{
"epoch": 2.5647668393782386,
"grad_norm": 11.24364948272705,
"kl": 13.601666450500488,
"learning_rate": 5.598651755051975e-08,
"logits/chosen": -34805155.41267388,
"logits/rejected": -35978830.45813586,
"logps/chosen": -472.4669629057187,
"logps/rejected": -390.4728475513428,
"loss": 0.519,
"loss/base_kto": 3.0523951053619385,
"metrics/advantage_var": 336.05792236328125,
"regularization/mmd": 1.0994646549224854,
"regularization/rkhs_norm": 211.84292602539062,
"rewards/chosen": 0.5824890608396928,
"rewards/margins": 0.9463016204285183,
"rewards/rejected": -0.3638125595888255,
"step": 1980
},
{
"epoch": 2.5906735751295336,
"grad_norm": 11.328319549560547,
"kl": 13.101523399353027,
"learning_rate": 4.964745868872933e-08,
"logits/chosen": -35008784.852664575,
"logits/rejected": -35833434.91588785,
"logps/chosen": -484.2189459247649,
"logps/rejected": -367.42481989875387,
"loss": 0.5277,
"loss/base_kto": 3.097578287124634,
"metrics/advantage_var": 360.671875,
"regularization/mmd": 1.1240640878677368,
"regularization/rkhs_norm": 216.58267211914062,
"rewards/chosen": 0.5724129034060296,
"rewards/margins": 0.9307274413337701,
"rewards/rejected": -0.3583145379277405,
"step": 2000
},
{
"epoch": 2.616580310880829,
"grad_norm": 11.297466278076172,
"kl": 13.6049165725708,
"learning_rate": 4.3670429148855493e-08,
"logits/chosen": -34877835.341772154,
"logits/rejected": -36181497.67901234,
"logps/chosen": -489.19274129746833,
"logps/rejected": -374.00308641975306,
"loss": 0.5267,
"loss/base_kto": 3.060823917388916,
"metrics/advantage_var": 387.2250671386719,
"regularization/mmd": 1.1527303457260132,
"regularization/rkhs_norm": 222.1060333251953,
"rewards/chosen": 0.5754118327853046,
"rewards/margins": 0.9552387434871035,
"rewards/rejected": -0.3798269107017988,
"step": 2020
},
{
"epoch": 2.6424870466321244,
"grad_norm": 8.630786895751953,
"kl": 10.696185111999512,
"learning_rate": 3.806023374435663e-08,
"logits/chosen": -35819656.53333333,
"logits/rejected": -35830756.58582677,
"logps/chosen": -489.590019379845,
"logps/rejected": -369.027312992126,
"loss": 0.5269,
"loss/base_kto": 3.0811078548431396,
"metrics/advantage_var": 372.056640625,
"regularization/mmd": 1.133884072303772,
"regularization/rkhs_norm": 218.47476196289062,
"rewards/chosen": 0.5522438226744186,
"rewards/margins": 0.9497557990216134,
"rewards/rejected": -0.3975119763471949,
"step": 2040
},
{
"epoch": 2.66839378238342,
"grad_norm": 8.296945571899414,
"kl": 12.443785667419434,
"learning_rate": 3.282138239813037e-08,
"logits/chosen": -32976371.712,
"logits/rejected": -35256835.908396944,
"logps/chosen": -450.6808,
"logps/rejected": -388.9175095419847,
"loss": 0.5257,
"loss/base_kto": 3.0977537631988525,
"metrics/advantage_var": 346.5660095214844,
"regularization/mmd": 1.108106255531311,
"regularization/rkhs_norm": 213.5079345703125,
"rewards/chosen": 0.540194091796875,
"rewards/margins": 0.9232885649004056,
"rewards/rejected": -0.3830944731035305,
"step": 2060
},
{
"epoch": 2.694300518134715,
"grad_norm": 13.444147109985352,
"kl": 11.908686637878418,
"learning_rate": 2.795808651707793e-08,
"logits/chosen": -34839270.07594936,
"logits/rejected": -36160881.777777776,
"logps/chosen": -458.37722507911394,
"logps/rejected": -365.0754484953704,
"loss": 0.5305,
"loss/base_kto": 3.1089224815368652,
"metrics/advantage_var": 379.64141845703125,
"regularization/mmd": 1.1348615884780884,
"regularization/rkhs_norm": 218.6631317138672,
"rewards/chosen": 0.5366746926609474,
"rewards/margins": 0.9034156847007573,
"rewards/rejected": -0.36674099203981,
"step": 2080
},
{
"epoch": 2.7202072538860103,
"grad_norm": 12.177067756652832,
"kl": 11.225503921508789,
"learning_rate": 2.3474255606639293e-08,
"logits/chosen": -34948154.426426426,
"logits/rejected": -36317157.315960914,
"logps/chosen": -502.1341966966967,
"logps/rejected": -374.78242060260584,
"loss": 0.5313,
"loss/base_kto": 3.0800302028656006,
"metrics/advantage_var": 410.7743225097656,
"regularization/mmd": 1.1706825494766235,
"regularization/rkhs_norm": 225.56504821777344,
"rewards/chosen": 0.5339437032247091,
"rewards/margins": 0.9532965794716552,
"rewards/rejected": -0.4193528762469462,
"step": 2100
},
{
"epoch": 2.7461139896373057,
"grad_norm": 10.157988548278809,
"kl": 11.286453247070312,
"learning_rate": 1.9373494128020195e-08,
"logits/chosen": -33943850.93167702,
"logits/rejected": -34867805.3836478,
"logps/chosen": -474.1967682453416,
"logps/rejected": -384.49513561320754,
"loss": 0.5288,
"loss/base_kto": 3.069972515106201,
"metrics/advantage_var": 385.8019714355469,
"regularization/mmd": 1.160033106803894,
"regularization/rkhs_norm": 223.51309204101562,
"rewards/chosen": 0.5911637774165373,
"rewards/margins": 0.9623554379796884,
"rewards/rejected": -0.37119166056315106,
"step": 2120
},
{
"epoch": 2.772020725388601,
"grad_norm": 13.148500442504883,
"kl": 13.676080703735352,
"learning_rate": 1.5659098600638798e-08,
"logits/chosen": -34414068.69400631,
"logits/rejected": -34114027.39318886,
"logps/chosen": -477.7570977917981,
"logps/rejected": -375.2875386996904,
"loss": 0.5235,
"loss/base_kto": 3.0857295989990234,
"metrics/advantage_var": 341.5010986328125,
"regularization/mmd": 1.101922869682312,
"regularization/rkhs_norm": 212.3165283203125,
"rewards/chosen": 0.5339198067361248,
"rewards/margins": 0.9309395148558036,
"rewards/rejected": -0.3970197081196788,
"step": 2140
},
{
"epoch": 2.7979274611398965,
"grad_norm": 11.413169860839844,
"kl": 12.233805656433105,
"learning_rate": 1.2334054952120143e-08,
"logits/chosen": -34812983.088607594,
"logits/rejected": -36667815.506172836,
"logps/chosen": -478.06759295886076,
"logps/rejected": -386.8450520833333,
"loss": 0.5241,
"loss/base_kto": 3.1054160594940186,
"metrics/advantage_var": 347.2292175292969,
"regularization/mmd": 1.0871450901031494,
"regularization/rkhs_norm": 209.4691619873047,
"rewards/chosen": 0.5347468219225919,
"rewards/margins": 0.8970902686306118,
"rewards/rejected": -0.3623434467080199,
"step": 2160
},
{
"epoch": 2.823834196891192,
"grad_norm": 11.140260696411133,
"kl": 11.593470573425293,
"learning_rate": 9.401036117969108e-09,
"logits/chosen": -34999963.968102075,
"logits/rejected": -36366627.675344564,
"logps/chosen": -476.30193381180226,
"logps/rejected": -378.9831307427259,
"loss": 0.5313,
"loss/base_kto": 3.123239040374756,
"metrics/advantage_var": 376.97369384765625,
"regularization/mmd": 1.127297282218933,
"regularization/rkhs_norm": 217.2056121826172,
"rewards/chosen": 0.5285895193973036,
"rewards/margins": 0.9173786276970379,
"rewards/rejected": -0.3887891082997344,
"step": 2180
},
{
"epoch": 2.849740932642487,
"grad_norm": 13.17670726776123,
"kl": 10.057597160339355,
"learning_rate": 6.8623998928517555e-09,
"logits/chosen": -36366156.68202765,
"logits/rejected": -36326483.027027026,
"logps/chosen": -481.9315476190476,
"logps/rejected": -392.48842408585057,
"loss": 0.5218,
"loss/base_kto": 3.0502097606658936,
"metrics/advantage_var": 358.9496765136719,
"regularization/mmd": 1.12405526638031,
"regularization/rkhs_norm": 216.5809783935547,
"rewards/chosen": 0.5587905907228062,
"rewards/margins": 0.9702582717827725,
"rewards/rejected": -0.41146768105996623,
"step": 2200
},
{
"epoch": 2.8756476683937824,
"grad_norm": 12.34128189086914,
"kl": 10.098648071289062,
"learning_rate": 4.72018703521132e-09,
"logits/chosen": -36351302.80851064,
"logits/rejected": -35416436.06430868,
"logps/chosen": -502.5996390577508,
"logps/rejected": -383.8128265675241,
"loss": 0.5316,
"loss/base_kto": 3.0268125534057617,
"metrics/advantage_var": 463.24932861328125,
"regularization/mmd": 1.226233959197998,
"regularization/rkhs_norm": 236.2686004638672,
"rewards/chosen": 0.5856340866320764,
"rewards/margins": 1.003644246336156,
"rewards/rejected": -0.41801015970407956,
"step": 2220
},
{
"epoch": 2.901554404145078,
"grad_norm": 8.02364730834961,
"kl": 11.608260154724121,
"learning_rate": 2.976119626744267e-09,
"logits/chosen": -35031314.14173228,
"logits/rejected": -35180702.75968992,
"logps/chosen": -462.6746062992126,
"logps/rejected": -389.1953003875969,
"loss": 0.5217,
"loss/base_kto": 3.049663782119751,
"metrics/advantage_var": 362.2906494140625,
"regularization/mmd": 1.1242762804031372,
"regularization/rkhs_norm": 216.62356567382812,
"rewards/chosen": 0.5438826913908711,
"rewards/margins": 0.9636309710511182,
"rewards/rejected": -0.4197482796602471,
"step": 2240
},
{
"epoch": 2.927461139896373,
"grad_norm": 10.093438148498535,
"kl": 11.339247703552246,
"learning_rate": 1.631599688052765e-09,
"logits/chosen": -35537365.54146341,
"logits/rejected": -37229547.98195489,
"logps/chosen": -489.6883130081301,
"logps/rejected": -376.6608082706767,
"loss": 0.5223,
"loss/base_kto": 3.079643487930298,
"metrics/advantage_var": 330.7992858886719,
"regularization/mmd": 1.0988330841064453,
"regularization/rkhs_norm": 211.72119140625,
"rewards/chosen": 0.543333770007622,
"rewards/margins": 0.9218065327249622,
"rewards/rejected": -0.3784727627173402,
"step": 2260
},
{
"epoch": 2.9533678756476682,
"grad_norm": 9.906542778015137,
"kl": 11.895674705505371,
"learning_rate": 6.877080515894085e-10,
"logits/chosen": -33608088.96099844,
"logits/rejected": -35572397.87167449,
"logps/chosen": -480.40980889235567,
"logps/rejected": -365.56895539906105,
"loss": 0.5209,
"loss/base_kto": 3.057544469833374,
"metrics/advantage_var": 352.38409423828125,
"regularization/mmd": 1.1100084781646729,
"regularization/rkhs_norm": 213.8744659423828,
"rewards/chosen": 0.5721382700522865,
"rewards/margins": 0.9589256965426523,
"rewards/rejected": -0.3867874264903658,
"step": 2280
},
{
"epoch": 2.9792746113989637,
"grad_norm": 8.99142837524414,
"kl": 12.557846069335938,
"learning_rate": 1.4520349279739663e-10,
"logits/chosen": -34284889.660855785,
"logits/rejected": -35557476.97996918,
"logps/chosen": -480.24014461172743,
"logps/rejected": -370.47154275808936,
"loss": 0.5307,
"loss/base_kto": 3.073073148727417,
"metrics/advantage_var": 423.8663024902344,
"regularization/mmd": 1.1724817752838135,
"regularization/rkhs_norm": 225.91172790527344,
"rewards/chosen": 0.5563522314685272,
"rewards/margins": 0.9417645093720326,
"rewards/rejected": -0.3854122779035054,
"step": 2300
},
{
"epoch": 3.0,
"step": 2316,
"total_flos": 9.978042558275912e+17,
"train_loss": 0.5577822983367867,
"train_runtime": 11092.8639,
"train_samples_per_second": 13.362,
"train_steps_per_second": 0.209
}
],
"logging_steps": 20,
"max_steps": 2316,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": false,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 9.978042558275912e+17,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}