Files
aup-fullft-kto-nolam-seed42/trainer_state.json
ModelHub XC b289e09391 初始化项目,由ModelHub XC社区提供模型
Model: Gueule-d-ange/aup-fullft-kto-nolam-seed42
Source: Original Platform
2026-08-21 08:03:17 +08:00

1999 lines
69 KiB
JSON

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 3.0,
"eval_steps": 500,
"global_step": 2316,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.025906735751295335,
"grad_norm": 11.605793952941895,
"kl": 38.56059265136719,
"learning_rate": 1.8999999999999998e-07,
"logits/chosen": -37154164.36363637,
"logits/rejected": -37756561.341935486,
"logps/chosen": -471.05530303030304,
"logps/rejected": -359.22752016129033,
"loss": 0.4618,
"loss/base_kto": 3.694525957107544,
"metrics/advantage_var": 740.17822265625,
"rewards/chosen": 0.8659122351444128,
"rewards/margins": 0.3264073287054008,
"rewards/rejected": 0.539504906439012,
"step": 20
},
{
"epoch": 0.05181347150259067,
"grad_norm": 10.088749885559082,
"kl": 30.996259689331055,
"learning_rate": 3.8999999999999997e-07,
"logits/chosen": -38410347.78947368,
"logits/rejected": -39412351.375609756,
"logps/chosen": -490.34473684210525,
"logps/rejected": -391.3777947154472,
"loss": 0.4519,
"loss/base_kto": 3.6148488521575928,
"metrics/advantage_var": 912.3471069335938,
"rewards/chosen": 0.8235496578359962,
"rewards/margins": 0.35158057437563034,
"rewards/rejected": 0.47196908346036587,
"step": 40
},
{
"epoch": 0.07772020725388601,
"grad_norm": 10.01998233795166,
"kl": 30.216571807861328,
"learning_rate": 5.9e-07,
"logits/chosen": -35869769.86229508,
"logits/rejected": -37921590.256716415,
"logps/chosen": -471.6993852459016,
"logps/rejected": -353.15212220149255,
"loss": 0.4291,
"loss/base_kto": 3.4325599670410156,
"metrics/advantage_var": 872.025390625,
"rewards/chosen": 0.8260520059554304,
"rewards/margins": 0.6611124444247051,
"rewards/rejected": 0.16493956153072528,
"step": 60
},
{
"epoch": 0.10362694300518134,
"grad_norm": 8.345759391784668,
"kl": 5.388225078582764,
"learning_rate": 7.9e-07,
"logits/chosen": -36489209.467304625,
"logits/rejected": -38324117.36600307,
"logps/chosen": -461.50956937799043,
"logps/rejected": -364.3822741194487,
"loss": 0.4193,
"loss/base_kto": 3.354257345199585,
"metrics/advantage_var": 1499.1781005859375,
"rewards/chosen": 0.2019310910165595,
"rewards/margins": 0.8813837972761307,
"rewards/rejected": -0.6794527062595712,
"step": 80
},
{
"epoch": 0.12953367875647667,
"grad_norm": 8.309015274047852,
"kl": 13.195367813110352,
"learning_rate": 9.9e-07,
"logits/chosen": -38952421.558685444,
"logits/rejected": -39376905.5850234,
"logps/chosen": -480.94776995305165,
"logps/rejected": -377.9949297971919,
"loss": 0.4222,
"loss/base_kto": 3.3775384426116943,
"metrics/advantage_var": 2635.339599609375,
"rewards/chosen": 0.5415884862669943,
"rewards/margins": 0.8321847921260646,
"rewards/rejected": -0.2905963058590703,
"step": 100
},
{
"epoch": 0.15544041450777202,
"grad_norm": 10.182024002075195,
"kl": 18.867149353027344,
"learning_rate": 9.998186234298189e-07,
"logits/chosen": -39828811.294117644,
"logits/rejected": -40465155.413333334,
"logps/chosen": -488.21875,
"logps/rejected": -362.84151041666667,
"loss": 0.3905,
"loss/base_kto": 3.1243832111358643,
"metrics/advantage_var": 2918.470458984375,
"rewards/chosen": 1.039443790211397,
"rewards/margins": 1.222436903411267,
"rewards/rejected": -0.1829931131998698,
"step": 120
},
{
"epoch": 0.18134715025906736,
"grad_norm": 8.444199562072754,
"kl": 30.96662712097168,
"learning_rate": 9.992359552107714e-07,
"logits/chosen": -39468761.98019802,
"logits/rejected": -39347196.961424336,
"logps/chosen": -481.0873556105611,
"logps/rejected": -369.1377271884273,
"loss": 0.4128,
"loss/base_kto": 3.3024284839630127,
"metrics/advantage_var": 3886.193115234375,
"rewards/chosen": 0.9114466500360974,
"rewards/margins": 1.037914289721482,
"rewards/rejected": -0.1264676396853846,
"step": 140
},
{
"epoch": 0.20725388601036268,
"grad_norm": 7.57260799407959,
"kl": 19.63751983642578,
"learning_rate": 9.982519612796161e-07,
"logits/chosen": -39679900.75770925,
"logits/rejected": -40483971.6327212,
"logps/chosen": -465.3614629221733,
"logps/rejected": -387.42336185308847,
"loss": 0.3935,
"loss/base_kto": 3.1482582092285156,
"metrics/advantage_var": 4115.23583984375,
"rewards/chosen": 1.1309302689920613,
"rewards/margins": 1.4825149821207133,
"rewards/rejected": -0.3515847131286519,
"step": 160
},
{
"epoch": 0.23316062176165803,
"grad_norm": 7.263091564178467,
"kl": 27.852466583251953,
"learning_rate": 9.968674326492213e-07,
"logits/chosen": -38640721.2192846,
"logits/rejected": -39732961.85871272,
"logps/chosen": -457.130783437014,
"logps/rejected": -364.8397272370487,
"loss": 0.3727,
"loss/base_kto": 2.9812400341033936,
"metrics/advantage_var": 4626.76513671875,
"rewards/chosen": 1.418452664815805,
"rewards/margins": 1.6763056952256852,
"rewards/rejected": -0.2578530304098803,
"step": 180
},
{
"epoch": 0.25906735751295334,
"grad_norm": 9.630581855773926,
"kl": 23.25460433959961,
"learning_rate": 9.950834823142198e-07,
"logits/chosen": -39927047.7824,
"logits/rejected": -40623030.5221374,
"logps/chosen": -479.1677,
"logps/rejected": -378.52118320610685,
"loss": 0.3835,
"loss/base_kto": 3.0679073333740234,
"metrics/advantage_var": 4547.76513671875,
"rewards/chosen": 1.1745533203125,
"rewards/margins": 1.6070852449606394,
"rewards/rejected": -0.43253192464813933,
"step": 200
},
{
"epoch": 0.2849740932642487,
"grad_norm": 9.11620044708252,
"kl": 10.112515449523926,
"learning_rate": 9.929015443562942e-07,
"logits/chosen": -41367302.24390244,
"logits/rejected": -39530563.75338346,
"logps/chosen": -471.4418699186992,
"logps/rejected": -374.84586466165416,
"loss": 0.3788,
"loss/base_kto": 3.0303921699523926,
"metrics/advantage_var": 4945.99169921875,
"rewards/chosen": 0.36794150747903964,
"rewards/margins": 1.698686062959538,
"rewards/rejected": -1.3307445554804982,
"step": 220
},
{
"epoch": 0.31088082901554404,
"grad_norm": 7.173008918762207,
"kl": 11.464367866516113,
"learning_rate": 9.90323372791347e-07,
"logits/chosen": -40763076.18691589,
"logits/rejected": -41477347.91222571,
"logps/chosen": -462.00783683800626,
"logps/rejected": -361.60555446708463,
"loss": 0.3659,
"loss/base_kto": 2.9271907806396484,
"metrics/advantage_var": 5027.3837890625,
"rewards/chosen": 0.8695794696748442,
"rewards/margins": 1.992290364316302,
"rewards/rejected": -1.1227108946414577,
"step": 240
},
{
"epoch": 0.33678756476683935,
"grad_norm": 8.966463088989258,
"kl": 21.945667266845703,
"learning_rate": 9.87351040159484e-07,
"logits/chosen": -42089467.266563945,
"logits/rejected": -42016605.717908084,
"logps/chosen": -477.8919491525424,
"logps/rejected": -397.86717511885894,
"loss": 0.3576,
"loss/base_kto": 2.860548257827759,
"metrics/advantage_var": 5913.638671875,
"rewards/chosen": 1.2006039376986228,
"rewards/margins": 2.0745871364902233,
"rewards/rejected": -0.8739831987916006,
"step": 260
},
{
"epoch": 0.3626943005181347,
"grad_norm": 7.794249534606934,
"kl": 19.930723190307617,
"learning_rate": 9.839869358589396e-07,
"logits/chosen": -41426398.53594771,
"logits/rejected": -41161758.65868264,
"logps/chosen": -449.8214358660131,
"logps/rejected": -375.6300056137725,
"loss": 0.3565,
"loss/base_kto": 2.852098226547241,
"metrics/advantage_var": 6078.57275390625,
"rewards/chosen": 0.9442857729843239,
"rewards/margins": 2.0589253293208696,
"rewards/rejected": -1.1146395563365457,
"step": 280
},
{
"epoch": 0.38860103626943004,
"grad_norm": 7.703754901885986,
"kl": 38.4437370300293,
"learning_rate": 9.80233764225289e-07,
"logits/chosen": -41185273.68875193,
"logits/rejected": -40902857.22979398,
"logps/chosen": -444.9513193374422,
"logps/rejected": -354.3673236925515,
"loss": 0.3444,
"loss/base_kto": 2.75480318069458,
"metrics/advantage_var": 5763.5478515625,
"rewards/chosen": 1.9258929753707628,
"rewards/margins": 2.2856331464858703,
"rewards/rejected": -0.3597401711151075,
"step": 300
},
{
"epoch": 0.41450777202072536,
"grad_norm": 9.472077369689941,
"kl": 20.64752197265625,
"learning_rate": 9.760945423574868e-07,
"logits/chosen": -40008365.798165135,
"logits/rejected": -42599021.59744409,
"logps/chosen": -482.6004873853211,
"logps/rejected": -369.16458666134184,
"loss": 0.3551,
"loss/base_kto": 2.8407864570617676,
"metrics/advantage_var": 6040.44482421875,
"rewards/chosen": 1.5773067182721712,
"rewards/margins": 2.260341206840462,
"rewards/rejected": -0.6830344885682907,
"step": 320
},
{
"epoch": 0.44041450777202074,
"grad_norm": 10.506298065185547,
"kl": 13.261344909667969,
"learning_rate": 9.71572597692482e-07,
"logits/chosen": -42238106.0815047,
"logits/rejected": -42170939.015576325,
"logps/chosen": -505.4585619122257,
"logps/rejected": -399.87091121495325,
"loss": 0.3522,
"loss/base_kto": 2.8176186084747314,
"metrics/advantage_var": 6590.22998046875,
"rewards/chosen": 1.1125284511841202,
"rewards/margins": 2.436326514943612,
"rewards/rejected": -1.3237980637594917,
"step": 340
},
{
"epoch": 0.46632124352331605,
"grad_norm": 10.129120826721191,
"kl": 21.043310165405273,
"learning_rate": 9.666715653303588e-07,
"logits/chosen": -42286177.60258482,
"logits/rejected": -43014422.85022693,
"logps/chosen": -467.0582592891761,
"logps/rejected": -390.2524111195159,
"loss": 0.3483,
"loss/base_kto": 2.7863080501556396,
"metrics/advantage_var": 7763.60009765625,
"rewards/chosen": 1.3456361736735158,
"rewards/margins": 2.490973715631723,
"rewards/rejected": -1.1453375419582073,
"step": 360
},
{
"epoch": 0.49222797927461137,
"grad_norm": 8.79063606262207,
"kl": 13.356651306152344,
"learning_rate": 9.613953851121528e-07,
"logits/chosen": -44623424.59076923,
"logits/rejected": -43544953.092063494,
"logps/chosen": -497.1355288461538,
"logps/rejected": -378.4875248015873,
"loss": 0.3515,
"loss/base_kto": 2.812063217163086,
"metrics/advantage_var": 8117.02294921875,
"rewards/chosen": 1.206925330528846,
"rewards/margins": 2.5688414275340543,
"rewards/rejected": -1.3619160970052084,
"step": 380
},
{
"epoch": 0.5181347150259067,
"grad_norm": 6.636849403381348,
"kl": 31.743444442749023,
"learning_rate": 9.557482984526924e-07,
"logits/chosen": -42751870.06646526,
"logits/rejected": -43807303.24919094,
"logps/chosen": -484.7029833836858,
"logps/rejected": -392.5766332928803,
"loss": 0.3452,
"loss/base_kto": 2.7615013122558594,
"metrics/advantage_var": 7189.68896484375,
"rewards/chosen": 2.0912890477483006,
"rewards/margins": 2.4713890881223652,
"rewards/rejected": -0.38010004037406453,
"step": 400
},
{
"epoch": 0.5440414507772021,
"grad_norm": 8.101085662841797,
"kl": 31.998029708862305,
"learning_rate": 9.497348449310107e-07,
"logits/chosen": -44528687.362041466,
"logits/rejected": -43389398.444104135,
"logps/chosen": -480.5172448165869,
"logps/rejected": -392.3862940275651,
"loss": 0.3334,
"loss/base_kto": 2.666898488998413,
"metrics/advantage_var": 7660.3828125,
"rewards/chosen": 1.7667409601774322,
"rewards/margins": 2.757692241224044,
"rewards/rejected": -0.9909512810466118,
"step": 420
},
{
"epoch": 0.5699481865284974,
"grad_norm": 11.130863189697266,
"kl": 12.283018112182617,
"learning_rate": 9.433598586410701e-07,
"logits/chosen": -44233614.58227848,
"logits/rejected": -44120013.43209877,
"logps/chosen": -465.97962816455697,
"logps/rejected": -396.02430555555554,
"loss": 0.3415,
"loss/base_kto": 2.7321603298187256,
"metrics/advantage_var": 8213.9638671875,
"rewards/chosen": 1.2179762441900712,
"rewards/margins": 2.7348437994080497,
"rewards/rejected": -1.5168675552179784,
"step": 440
},
{
"epoch": 0.5958549222797928,
"grad_norm": 10.0189208984375,
"kl": 22.358829498291016,
"learning_rate": 9.366284643057313e-07,
"logits/chosen": -45440364.307692304,
"logits/rejected": -45431271.02439024,
"logps/chosen": -463.77383814102564,
"logps/rejected": -389.2611471036585,
"loss": 0.329,
"loss/base_kto": 2.632397174835205,
"metrics/advantage_var": 8176.68212890625,
"rewards/chosen": 1.6049115107609675,
"rewards/margins": 2.86886492902745,
"rewards/rejected": -1.2639534182664824,
"step": 460
},
{
"epoch": 0.6217616580310881,
"grad_norm": 9.430086135864258,
"kl": 11.885652542114258,
"learning_rate": 9.295460731570917e-07,
"logits/chosen": -45028388.218649514,
"logits/rejected": -45278267.136778116,
"logps/chosen": -477.4973874598071,
"logps/rejected": -379.5108045212766,
"loss": 0.3388,
"loss/base_kto": 2.7101292610168457,
"metrics/advantage_var": 9187.2099609375,
"rewards/chosen": 1.0469594875715937,
"rewards/margins": 2.83426569631257,
"rewards/rejected": -1.7873062087409763,
"step": 480
},
{
"epoch": 0.6476683937823834,
"grad_norm": 9.097721099853516,
"kl": 13.10331916809082,
"learning_rate": 9.221183785865056e-07,
"logits/chosen": -45285132.962025315,
"logits/rejected": -45354138.86419753,
"logps/chosen": -491.37193433544303,
"logps/rejected": -402.21766493055554,
"loss": 0.324,
"loss/base_kto": 2.592097043991089,
"metrics/advantage_var": 9418.1435546875,
"rewards/chosen": 1.265615921986254,
"rewards/margins": 3.227010432137681,
"rewards/rejected": -1.9613945101514274,
"step": 500
},
{
"epoch": 0.6735751295336787,
"grad_norm": 8.278778076171875,
"kl": 24.34718894958496,
"learning_rate": 9.143513515677817e-07,
"logits/chosen": -45963127.23287671,
"logits/rejected": -46308840.45977011,
"logps/chosen": -502.2434717465753,
"logps/rejected": -399.21125179597703,
"loss": 0.327,
"loss/base_kto": 2.616192579269409,
"metrics/advantage_var": 9953.5107421875,
"rewards/chosen": 1.5700516374143836,
"rewards/margins": 3.2479978815774584,
"rewards/rejected": -1.6779462441630748,
"step": 520
},
{
"epoch": 0.6994818652849741,
"grad_norm": 7.010895252227783,
"kl": 13.371597290039062,
"learning_rate": 9.062512358572373e-07,
"logits/chosen": -43210697.06110283,
"logits/rejected": -44957669.09688013,
"logps/chosen": -475.28055141579733,
"logps/rejected": -381.8127052545156,
"loss": 0.3057,
"loss/base_kto": 2.4459750652313232,
"metrics/advantage_var": 10097.4755859375,
"rewards/chosen": 1.9163489078800298,
"rewards/margins": 3.5759380019699822,
"rewards/rejected": -1.6595890940899527,
"step": 540
},
{
"epoch": 0.7253886010362695,
"grad_norm": 7.648643970489502,
"kl": 42.0706787109375,
"learning_rate": 8.978245429744691e-07,
"logits/chosen": -45007123.15114504,
"logits/rejected": -44185783.5008,
"logps/chosen": -448.98234732824426,
"logps/rejected": -368.3568,
"loss": 0.3176,
"loss/base_kto": 2.5408151149749756,
"metrics/advantage_var": 9049.8310546875,
"rewards/chosen": 2.615083045085878,
"rewards/margins": 3.058985632976503,
"rewards/rejected": -0.443902587890625,
"step": 560
},
{
"epoch": 0.7512953367875648,
"grad_norm": 7.628378391265869,
"kl": 39.29732894897461,
"learning_rate": 8.890780469678738e-07,
"logits/chosen": -45669481.82370821,
"logits/rejected": -44295375.4340836,
"logps/chosen": -457.95146276595744,
"logps/rejected": -362.8493770096463,
"loss": 0.3251,
"loss/base_kto": 2.600756883621216,
"metrics/advantage_var": 9290.9599609375,
"rewards/chosen": 2.090501222929331,
"rewards/margins": 2.8993852333669317,
"rewards/rejected": -0.8088840104376005,
"step": 580
},
{
"epoch": 0.7772020725388601,
"grad_norm": 7.913888454437256,
"kl": 23.4282283782959,
"learning_rate": 8.800187789691269e-07,
"logits/chosen": -44830290.13493253,
"logits/rejected": -43444036.90701468,
"logps/chosen": -460.875,
"logps/rejected": -383.3435715742251,
"loss": 0.3012,
"loss/base_kto": 2.409473180770874,
"metrics/advantage_var": 11249.1708984375,
"rewards/chosen": 2.4155743783381745,
"rewards/margins": 3.6628631429308536,
"rewards/rejected": -1.2472887645926793,
"step": 600
},
{
"epoch": 0.8031088082901554,
"grad_norm": 6.445258140563965,
"kl": 29.516122817993164,
"learning_rate": 8.706540215409981e-07,
"logits/chosen": -46369467.09172932,
"logits/rejected": -47186552.71544716,
"logps/chosen": -422.66809210526316,
"logps/rejected": -364.4777693089431,
"loss": 0.3262,
"loss/base_kto": 2.609204053878784,
"metrics/advantage_var": 10683.3701171875,
"rewards/chosen": 1.9281864940671993,
"rewards/margins": 3.128518763503175,
"rewards/rejected": -1.2003322694359757,
"step": 620
},
{
"epoch": 0.8290155440414507,
"grad_norm": 9.627001762390137,
"kl": 23.947446823120117,
"learning_rate": 8.609913028230462e-07,
"logits/chosen": -46729614.133748055,
"logits/rejected": -47353798.12872841,
"logps/chosen": -487.88039463452566,
"logps/rejected": -393.484693877551,
"loss": 0.3246,
"loss/base_kto": 2.596665382385254,
"metrics/advantage_var": 11245.66796875,
"rewards/chosen": 2.035088475347492,
"rewards/margins": 3.350969458900769,
"rewards/rejected": -1.315880983553277,
"step": 640
},
{
"epoch": 0.8549222797927462,
"grad_norm": 5.452735900878906,
"kl": 20.10293197631836,
"learning_rate": 8.510383904798994e-07,
"logits/chosen": -45706389.36541353,
"logits/rejected": -44925420.85203252,
"logps/chosen": -478.0436090225564,
"logps/rejected": -420.4835619918699,
"loss": 0.3199,
"loss/base_kto": 2.5589563846588135,
"metrics/advantage_var": 12959.5068359375,
"rewards/chosen": 2.0530989338580827,
"rewards/margins": 3.7097156410163654,
"rewards/rejected": -1.6566167071582825,
"step": 660
},
{
"epoch": 0.8808290155440415,
"grad_norm": 11.135366439819336,
"kl": 31.90445327758789,
"learning_rate": 8.408032854569865e-07,
"logits/chosen": -45910517.47945205,
"logits/rejected": -46397469.42528736,
"logps/chosen": -491.58063998287673,
"logps/rejected": -392.5621408045977,
"loss": 0.3016,
"loss/base_kto": 2.4128031730651855,
"metrics/advantage_var": 11997.140625,
"rewards/chosen": 2.2658833542915238,
"rewards/margins": 3.9077030999362794,
"rewards/rejected": -1.6418197456447559,
"step": 680
},
{
"epoch": 0.9067357512953368,
"grad_norm": 6.5614848136901855,
"kl": 30.111474990844727,
"learning_rate": 8.302942155487377e-07,
"logits/chosen": -45139300.37004405,
"logits/rejected": -45934034.697829716,
"logps/chosen": -459.43658223201174,
"logps/rejected": -384.7371139398998,
"loss": 0.3333,
"loss/base_kto": 2.6663873195648193,
"metrics/advantage_var": 11191.8955078125,
"rewards/chosen": 2.1196790966868577,
"rewards/margins": 3.0193248686114194,
"rewards/rejected": -0.8996457719245617,
"step": 700
},
{
"epoch": 0.9326424870466321,
"grad_norm": 9.026055335998535,
"kl": 38.45805740356445,
"learning_rate": 8.195196287844278e-07,
"logits/chosen": -45909858.461538464,
"logits/rejected": -46176119.46666667,
"logps/chosen": -476.51875,
"logps/rejected": -382.14977678571427,
"loss": 0.3181,
"loss/base_kto": 2.544774055480957,
"metrics/advantage_var": 11464.9521484375,
"rewards/chosen": 2.5570633638822113,
"rewards/margins": 3.5192292206220426,
"rewards/rejected": -0.9621658567398313,
"step": 720
},
{
"epoch": 0.9585492227979274,
"grad_norm": 9.854619979858398,
"kl": 32.282257080078125,
"learning_rate": 8.08488186636975e-07,
"logits/chosen": -48232252.631578945,
"logits/rejected": -47521709.71428572,
"logps/chosen": -477.9053248355263,
"logps/rejected": -400.0725911458333,
"loss": 0.3232,
"loss/base_kto": 2.585928440093994,
"metrics/advantage_var": 12165.7529296875,
"rewards/chosen": 1.7689299332468134,
"rewards/margins": 3.367724052945474,
"rewards/rejected": -1.5987941196986608,
"step": 740
},
{
"epoch": 0.9844559585492227,
"grad_norm": 9.233141899108887,
"kl": 37.69820785522461,
"learning_rate": 7.972087570601576e-07,
"logits/chosen": -46655029.39877301,
"logits/rejected": -47521289.78343949,
"logps/chosen": -435.96841449386505,
"logps/rejected": -400.7941132563694,
"loss": 0.3245,
"loss/base_kto": 2.595954418182373,
"metrics/advantage_var": 10885.6875,
"rewards/chosen": 2.3360288655099692,
"rewards/margins": 3.291977616194185,
"rewards/rejected": -0.9559487506842158,
"step": 760
},
{
"epoch": 1.0103626943005182,
"grad_norm": 6.974427700042725,
"kl": 27.17978858947754,
"learning_rate": 7.856904073598458e-07,
"logits/chosen": -47464819.11409396,
"logits/rejected": -48631063.27272727,
"logps/chosen": -476.66013003355704,
"logps/rejected": -390.7624175219941,
"loss": 0.2932,
"loss/base_kto": 2.345959424972534,
"metrics/advantage_var": 13561.8515625,
"rewards/chosen": 2.032148322803062,
"rewards/margins": 4.105728262032809,
"rewards/rejected": -2.073579939229747,
"step": 780
},
{
"epoch": 1.0362694300518134,
"grad_norm": 8.006534576416016,
"kl": 12.020552635192871,
"learning_rate": 7.739423969049761e-07,
"logits/chosen": -47671432.53333333,
"logits/rejected": -47465428.45984252,
"logps/chosen": -442.7193798449612,
"logps/rejected": -396.0220964566929,
"loss": 0.2713,
"loss/base_kto": 2.1700031757354736,
"metrics/advantage_var": 14014.9755859375,
"rewards/chosen": 2.201185879966085,
"rewards/margins": 4.629551175856833,
"rewards/rejected": -2.4283652958907482,
"step": 800
},
{
"epoch": 1.0621761658031088,
"grad_norm": 7.6743483543396,
"kl": 24.583898544311523,
"learning_rate": 7.619741696841322e-07,
"logits/chosen": -49097158.05271318,
"logits/rejected": -47500434.74645669,
"logps/chosen": -466.3345930232558,
"logps/rejected": -376.74753937007875,
"loss": 0.2633,
"loss/base_kto": 2.1062209606170654,
"metrics/advantage_var": 13870.4033203125,
"rewards/chosen": 2.9003382010053294,
"rewards/margins": 4.841445715153951,
"rewards/rejected": -1.941107514148622,
"step": 820
},
{
"epoch": 1.0880829015544042,
"grad_norm": 8.210561752319336,
"kl": 15.757326126098633,
"learning_rate": 7.497953467137135e-07,
"logits/chosen": -46189912.631239936,
"logits/rejected": -45744180.83156297,
"logps/chosen": -455.30495169082127,
"logps/rejected": -347.65063069044004,
"loss": 0.2604,
"loss/base_kto": 2.0829906463623047,
"metrics/advantage_var": 13050.2421875,
"rewards/chosen": 2.3093481877767714,
"rewards/margins": 4.568288032119526,
"rewards/rejected": -2.258939844342754,
"step": 840
},
{
"epoch": 1.1139896373056994,
"grad_norm": 8.713674545288086,
"kl": 13.271387100219727,
"learning_rate": 7.37415718303793e-07,
"logits/chosen": -45598088.13643411,
"logits/rejected": -45550296.894488186,
"logps/chosen": -445.2339631782946,
"logps/rejected": -374.74773622047246,
"loss": 0.2738,
"loss/base_kto": 2.1901986598968506,
"metrics/advantage_var": 13676.1171875,
"rewards/chosen": 2.0202163578003876,
"rewards/margins": 4.501684930942612,
"rewards/rejected": -2.4814685731422244,
"step": 860
},
{
"epoch": 1.1398963730569949,
"grad_norm": 7.964659690856934,
"kl": 18.402326583862305,
"learning_rate": 7.248452361878855e-07,
"logits/chosen": -45798747.37463127,
"logits/rejected": -47414003.242524914,
"logps/chosen": -449.796552359882,
"logps/rejected": -371.562032807309,
"loss": 0.2526,
"loss/base_kto": 2.020669937133789,
"metrics/advantage_var": 14040.15625,
"rewards/chosen": 2.557764464071718,
"rewards/margins": 4.88743947315602,
"rewards/rejected": -2.329675009084302,
"step": 880
},
{
"epoch": 1.16580310880829,
"grad_norm": 7.827051162719727,
"kl": 17.168731689453125,
"learning_rate": 7.120940055229497e-07,
"logits/chosen": -47639918.85358255,
"logits/rejected": -47987541.868338555,
"logps/chosen": -488.3009151090343,
"logps/rejected": -416.904927507837,
"loss": 0.2435,
"loss/base_kto": 1.9479866027832031,
"metrics/advantage_var": 14400.1591796875,
"rewards/chosen": 2.3399764681902258,
"rewards/margins": 5.139182284094419,
"rewards/rejected": -2.799205815904193,
"step": 900
},
{
"epoch": 1.1917098445595855,
"grad_norm": 7.2465667724609375,
"kl": 25.497581481933594,
"learning_rate": 6.991722767660556e-07,
"logits/chosen": -48523415.194630876,
"logits/rejected": -48706350.40935673,
"logps/chosen": -467.25388003355704,
"logps/rejected": -402.67114400584796,
"loss": 0.2546,
"loss/base_kto": 2.0367116928100586,
"metrics/advantage_var": 14426.1474609375,
"rewards/chosen": 2.1353075680316693,
"rewards/margins": 4.538409260454458,
"rewards/rejected": -2.403101692422789,
"step": 920
},
{
"epoch": 1.2176165803108807,
"grad_norm": 6.00705099105835,
"kl": 21.413923263549805,
"learning_rate": 6.860904374342499e-07,
"logits/chosen": -47991043.65134707,
"logits/rejected": -48706687.8027735,
"logps/chosen": -492.87371236133123,
"logps/rejected": -417.9573382126348,
"loss": 0.2415,
"loss/base_kto": 1.9320722818374634,
"metrics/advantage_var": 14509.7939453125,
"rewards/chosen": 2.263974826044968,
"rewards/margins": 5.147939564464652,
"rewards/rejected": -2.8839647384196843,
"step": 940
},
{
"epoch": 1.2435233160621761,
"grad_norm": 6.559169769287109,
"kl": 21.99832534790039,
"learning_rate": 6.7285900375424e-07,
"logits/chosen": -47288352.05007825,
"logits/rejected": -48029686.4149766,
"logps/chosen": -456.8280516431925,
"logps/rejected": -395.6653666146646,
"loss": 0.2501,
"loss/base_kto": 2.000561475753784,
"metrics/advantage_var": 12681.5341796875,
"rewards/chosen": 2.232018603592038,
"rewards/margins": 4.566518682813957,
"rewards/rejected": -2.334500079221919,
"step": 960
},
{
"epoch": 1.2694300518134716,
"grad_norm": 7.573378562927246,
"kl": 24.434301376342773,
"learning_rate": 6.594886122086123e-07,
"logits/chosen": -48100737.87928222,
"logits/rejected": -46305408.95952024,
"logps/chosen": -460.87418433931487,
"logps/rejected": -382.82650862068965,
"loss": 0.2611,
"loss/base_kto": 2.0884008407592773,
"metrics/advantage_var": 12721.8154296875,
"rewards/chosen": 2.5049300077105423,
"rewards/margins": 4.615244235362342,
"rewards/rejected": -2.110314227651799,
"step": 980
},
{
"epoch": 1.2953367875647668,
"grad_norm": 9.15713882446289,
"kl": 9.266432762145996,
"learning_rate": 6.459900109853766e-07,
"logits/chosen": -50749891.62633997,
"logits/rejected": -49394278.073365234,
"logps/chosen": -472.1126052833078,
"logps/rejected": -413.897826953748,
"loss": 0.2668,
"loss/base_kto": 2.1340107917785645,
"metrics/advantage_var": 12453.4423828125,
"rewards/chosen": 1.885936976574464,
"rewards/margins": 4.484020959391948,
"rewards/rejected": -2.598083982817484,
"step": 1000
},
{
"epoch": 1.3212435233160622,
"grad_norm": 6.648115634918213,
"kl": 19.018064498901367,
"learning_rate": 6.323740513377171e-07,
"logits/chosen": -48953454.3518225,
"logits/rejected": -49181296.81355932,
"logps/chosen": -481.27902139461173,
"logps/rejected": -391.85891756548534,
"loss": 0.2595,
"loss/base_kto": 2.075740098953247,
"metrics/advantage_var": 12773.25390625,
"rewards/chosen": 2.3078029046156896,
"rewards/margins": 4.5615917865494335,
"rewards/rejected": -2.2537888819337444,
"step": 1020
},
{
"epoch": 1.3471502590673574,
"grad_norm": 8.432963371276855,
"kl": 15.786555290222168,
"learning_rate": 6.186516788608865e-07,
"logits/chosen": -50043944.09638554,
"logits/rejected": -49340396.051948056,
"logps/chosen": -471.32958396084337,
"logps/rejected": -410.0531655844156,
"loss": 0.2574,
"loss/base_kto": 2.0592541694641113,
"metrics/advantage_var": 12785.0068359375,
"rewards/chosen": 2.132786578442677,
"rewards/margins": 4.651474433556313,
"rewards/rejected": -2.5186878551136362,
"step": 1040
},
{
"epoch": 1.3730569948186528,
"grad_norm": 7.463342666625977,
"kl": 18.011547088623047,
"learning_rate": 6.048339246932652e-07,
"logits/chosen": -50799278.9068323,
"logits/rejected": -50387240.251572326,
"logps/chosen": -484.422748447205,
"logps/rejected": -387.8544123427673,
"loss": 0.2459,
"loss/base_kto": 1.9671169519424438,
"metrics/advantage_var": 13662.9599609375,
"rewards/chosen": 2.752448230056289,
"rewards/margins": 4.902260748481996,
"rewards/rejected": -2.1498125184257075,
"step": 1060
},
{
"epoch": 1.3989637305699483,
"grad_norm": 7.461705207824707,
"kl": 19.686004638671875,
"learning_rate": 5.909318966486494e-07,
"logits/chosen": -48579801.8031746,
"logits/rejected": -48981808.04923077,
"logps/chosen": -444.07172619047617,
"logps/rejected": -402.4366105769231,
"loss": 0.2576,
"loss/base_kto": 2.0607800483703613,
"metrics/advantage_var": 15960.1123046875,
"rewards/chosen": 2.096119326636905,
"rewards/margins": 4.8182899245936355,
"rewards/rejected": -2.7221705979567306,
"step": 1080
},
{
"epoch": 1.4248704663212435,
"grad_norm": 5.755481719970703,
"kl": 23.16046714782715,
"learning_rate": 5.769567702869052e-07,
"logits/chosen": -50075429.79604262,
"logits/rejected": -49548141.71428572,
"logps/chosen": -451.0539383561644,
"logps/rejected": -415.2268007624398,
"loss": 0.2499,
"loss/base_kto": 1.999585747718811,
"metrics/advantage_var": 14338.078125,
"rewards/chosen": 2.7706828356877855,
"rewards/margins": 4.9420303665365015,
"rewards/rejected": -2.171347530848716,
"step": 1100
},
{
"epoch": 1.450777202072539,
"grad_norm": 7.263795375823975,
"kl": 20.749311447143555,
"learning_rate": 5.629197799301614e-07,
"logits/chosen": -51008243.731629394,
"logits/rejected": -50280040.905198775,
"logps/chosen": -457.93106030351436,
"logps/rejected": -404.38876146788994,
"loss": 0.2574,
"loss/base_kto": 2.0591797828674316,
"metrics/advantage_var": 14394.5234375,
"rewards/chosen": 2.1054878600489215,
"rewards/margins": 4.947445068991486,
"rewards/rejected": -2.841957208942565,
"step": 1120
},
{
"epoch": 1.4766839378238341,
"grad_norm": 8.185635566711426,
"kl": 20.86648941040039,
"learning_rate": 5.488322096317633e-07,
"logits/chosen": -50875951.299837925,
"logits/rejected": -50029618.968325794,
"logps/chosen": -462.942868719611,
"logps/rejected": -397.45456259426845,
"loss": 0.2628,
"loss/base_kto": 2.102466344833374,
"metrics/advantage_var": 14819.9130859375,
"rewards/chosen": 2.3890321505900527,
"rewards/margins": 4.7555759736481225,
"rewards/rejected": -2.3665438230580693,
"step": 1140
},
{
"epoch": 1.5025906735751295,
"grad_norm": 7.5429463386535645,
"kl": 18.411264419555664,
"learning_rate": 5.347053841052518e-07,
"logits/chosen": -51579456.402515724,
"logits/rejected": -49579478.65838509,
"logps/chosen": -472.2454304245283,
"logps/rejected": -389.61934685559004,
"loss": 0.2593,
"loss/base_kto": 2.0742015838623047,
"metrics/advantage_var": 13896.4990234375,
"rewards/chosen": 2.2443824624115565,
"rewards/margins": 4.678256367569747,
"rewards/rejected": -2.433873905158191,
"step": 1160
},
{
"epoch": 1.528497409326425,
"grad_norm": 7.785284042358398,
"kl": 21.28897476196289,
"learning_rate": 5.205506596206531e-07,
"logits/chosen": -49997334.6835443,
"logits/rejected": -50460479.209876545,
"logps/chosen": -468.59083267405066,
"logps/rejected": -376.14158950617286,
"loss": 0.2469,
"loss/base_kto": 1.9749466180801392,
"metrics/advantage_var": 13357.8466796875,
"rewards/chosen": 2.6586543215981013,
"rewards/margins": 4.838992298124433,
"rewards/rejected": -2.180337976526331,
"step": 1180
},
{
"epoch": 1.5544041450777202,
"grad_norm": 12.808547973632812,
"kl": 12.648378372192383,
"learning_rate": 5.063794148754032e-07,
"logits/chosen": -50732009.80804954,
"logits/rejected": -51210214.15772871,
"logps/chosen": -462.1233552631579,
"logps/rejected": -389.2183063880126,
"loss": 0.2536,
"loss/base_kto": 2.0289154052734375,
"metrics/advantage_var": 14579.5732421875,
"rewards/chosen": 2.117305791045859,
"rewards/margins": 4.87371756309091,
"rewards/rejected": -2.7564117720450514,
"step": 1200
},
{
"epoch": 1.5803108808290154,
"grad_norm": 9.873778343200684,
"kl": 26.791122436523438,
"learning_rate": 4.922030418472422e-07,
"logits/chosen": -49176047.06771654,
"logits/rejected": -49040658.65426356,
"logps/chosen": -465.3425688976378,
"logps/rejected": -400.659253875969,
"loss": 0.2663,
"loss/base_kto": 2.130403518676758,
"metrics/advantage_var": 14569.2568359375,
"rewards/chosen": 2.50025817390502,
"rewards/margins": 4.679842339966067,
"rewards/rejected": -2.1795841660610464,
"step": 1220
},
{
"epoch": 1.6062176165803108,
"grad_norm": 11.098130226135254,
"kl": 17.67889404296875,
"learning_rate": 4.780329366364336e-07,
"logits/chosen": -50631510.12713178,
"logits/rejected": -49922744.64251968,
"logps/chosen": -460.33478682170545,
"logps/rejected": -392.7937992125984,
"loss": 0.2534,
"loss/base_kto": 2.027090072631836,
"metrics/advantage_var": 12999.9736328125,
"rewards/chosen": 2.4095879133357556,
"rewards/margins": 4.742966358217645,
"rewards/rejected": -2.3333784448818897,
"step": 1240
},
{
"epoch": 1.6321243523316062,
"grad_norm": 10.580224990844727,
"kl": 17.041147232055664,
"learning_rate": 4.638804903046684e-07,
"logits/chosen": -50606938.11838006,
"logits/rejected": -50023391.89968652,
"logps/chosen": -484.9173481308411,
"logps/rejected": -402.11265673981194,
"loss": 0.2528,
"loss/base_kto": 2.0220911502838135,
"metrics/advantage_var": 13346.0146484375,
"rewards/chosen": 2.3297069704049846,
"rewards/margins": 4.816585751140682,
"rewards/rejected": -2.4868787807356973,
"step": 1260
},
{
"epoch": 1.6580310880829017,
"grad_norm": 9.04914379119873,
"kl": 25.278024673461914,
"learning_rate": 4.497570797180217e-07,
"logits/chosen": -50172554.938530736,
"logits/rejected": -50815196.50244698,
"logps/chosen": -453.6979947526237,
"logps/rejected": -378.65576570146817,
"loss": 0.2627,
"loss/base_kto": 2.1016016006469727,
"metrics/advantage_var": 13008.0537109375,
"rewards/chosen": 2.8642087647582457,
"rewards/margins": 4.541724488529657,
"rewards/rejected": -1.6775157237714111,
"step": 1280
},
{
"epoch": 1.6839378238341969,
"grad_norm": 8.332275390625,
"kl": 34.81646728515625,
"learning_rate": 4.3567405840131853e-07,
"logits/chosen": -49631567.01234568,
"logits/rejected": -49031887.39240506,
"logps/chosen": -466.037037037037,
"logps/rejected": -399.32730913765823,
"loss": 0.2689,
"loss/base_kto": 2.1509957313537598,
"metrics/advantage_var": 13046.8349609375,
"rewards/chosen": 2.996243323808835,
"rewards/margins": 4.272110447955888,
"rewards/rejected": -1.275867124147053,
"step": 1300
},
{
"epoch": 1.709844559585492,
"grad_norm": 9.706599235534668,
"kl": 21.504140853881836,
"learning_rate": 4.2164274741126506e-07,
"logits/chosen": -50742327.97427653,
"logits/rejected": -52272604.20668693,
"logps/chosen": -450.47432676848877,
"logps/rejected": -411.2093939969605,
"loss": 0.2669,
"loss/base_kto": 2.1349241733551025,
"metrics/advantage_var": 13198.6015625,
"rewards/chosen": 2.2765420502788385,
"rewards/margins": 4.696065805384272,
"rewards/rejected": -2.419523755105433,
"step": 1320
},
{
"epoch": 1.7357512953367875,
"grad_norm": 9.024945259094238,
"kl": 20.595943450927734,
"learning_rate": 4.0767442623567856e-07,
"logits/chosen": -50928485.52410576,
"logits/rejected": -51772176.477237046,
"logps/chosen": -463.4435264385692,
"logps/rejected": -410.42481848508635,
"loss": 0.2558,
"loss/base_kto": 2.0465526580810547,
"metrics/advantage_var": 15188.572265625,
"rewards/chosen": 2.496919955287714,
"rewards/margins": 4.9222173316000175,
"rewards/rejected": -2.4252973763123036,
"step": 1340
},
{
"epoch": 1.761658031088083,
"grad_norm": 8.380735397338867,
"kl": 22.653018951416016,
"learning_rate": 3.937803237261357e-07,
"logits/chosen": -50397374.511627905,
"logits/rejected": -50354895.21889764,
"logps/chosen": -444.8803294573643,
"logps/rejected": -395.8338336614173,
"loss": 0.2498,
"loss/base_kto": 1.998310923576355,
"metrics/advantage_var": 13499.3720703125,
"rewards/chosen": 2.6756109193313953,
"rewards/margins": 4.87968326185108,
"rewards/rejected": -2.204072342519685,
"step": 1360
},
{
"epoch": 1.7875647668393784,
"grad_norm": 12.051867485046387,
"kl": 19.444766998291016,
"learning_rate": 3.7997160907132456e-07,
"logits/chosen": -52307059.86544342,
"logits/rejected": -52765738.53035144,
"logps/chosen": -442.72348050458714,
"logps/rejected": -422.0098841853035,
"loss": 0.2538,
"loss/base_kto": 2.0302066802978516,
"metrics/advantage_var": 14113.2998046875,
"rewards/chosen": 2.5834022078674503,
"rewards/margins": 4.8570046782897744,
"rewards/rejected": -2.273602470422324,
"step": 1380
},
{
"epoch": 1.8134715025906736,
"grad_norm": 6.080167293548584,
"kl": 7.740408420562744,
"learning_rate": 3.662593828183601e-07,
"logits/chosen": -52097834.53776435,
"logits/rejected": -52385685.95469256,
"logps/chosen": -476.92942787009065,
"logps/rejected": -413.64504955501616,
"loss": 0.2637,
"loss/base_kto": 2.1094841957092285,
"metrics/advantage_var": 14161.9091796875,
"rewards/chosen": 1.8997557487372545,
"rewards/margins": 4.792029290530337,
"rewards/rejected": -2.8922735417930827,
"step": 1400
},
{
"epoch": 1.8393782383419688,
"grad_norm": 7.666107654571533,
"kl": 29.72540283203125,
"learning_rate": 3.5265466794927725e-07,
"logits/chosen": -50770696.827586204,
"logits/rejected": -52469633.04404568,
"logps/chosen": -465.53841829085457,
"logps/rejected": -401.9165477161501,
"loss": 0.246,
"loss/base_kto": 1.9683994054794312,
"metrics/advantage_var": 13659.8037109375,
"rewards/chosen": 2.673970509862256,
"rewards/margins": 4.902071932170576,
"rewards/rejected": -2.2281014223083195,
"step": 1420
},
{
"epoch": 1.8652849740932642,
"grad_norm": 8.589899063110352,
"kl": 30.167007446289062,
"learning_rate": 3.3916840101987887e-07,
"logits/chosen": -51137649.777777776,
"logits/rejected": -51158989.587692305,
"logps/chosen": -476.984375,
"logps/rejected": -403.0909375,
"loss": 0.2636,
"loss/base_kto": 2.1090667247772217,
"metrics/advantage_var": 12947.015625,
"rewards/chosen": 2.508792937748016,
"rewards/margins": 4.470145289010035,
"rewards/rejected": -1.9613523512620192,
"step": 1440
},
{
"epoch": 1.8911917098445596,
"grad_norm": 9.947898864746094,
"kl": 24.149383544921875,
"learning_rate": 3.258114233680583e-07,
"logits/chosen": -50633531.65781711,
"logits/rejected": -50599163.7475083,
"logps/chosen": -453.01069321533924,
"logps/rejected": -398.06753529900334,
"loss": 0.2631,
"loss/base_kto": 2.1051042079925537,
"metrics/advantage_var": 14002.7099609375,
"rewards/chosen": 2.5346550055309733,
"rewards/margins": 4.710280727408569,
"rewards/rejected": -2.1756257218775956,
"step": 1460
},
{
"epoch": 1.917098445595855,
"grad_norm": 7.734704494476318,
"kl": 35.1544303894043,
"learning_rate": 3.1259447239866796e-07,
"logits/chosen": -51763093.56850394,
"logits/rejected": -51378245.85426357,
"logps/chosen": -463.19566929133856,
"logps/rejected": -394.7056201550388,
"loss": 0.24,
"loss/base_kto": 1.9199455976486206,
"metrics/advantage_var": 13500.6142578125,
"rewards/chosen": 2.862628414124016,
"rewards/margins": 4.883309963905992,
"rewards/rejected": -2.0206815497819766,
"step": 1480
},
{
"epoch": 1.9430051813471503,
"grad_norm": 6.12605619430542,
"kl": 18.320152282714844,
"learning_rate": 2.9952817295193435e-07,
"logits/chosen": -49078500.644338116,
"logits/rejected": -50882374.95865238,
"logps/chosen": -414.313446969697,
"logps/rejected": -398.36633805513014,
"loss": 0.2708,
"loss/base_kto": 2.166231155395508,
"metrics/advantage_var": 12967.21875,
"rewards/chosen": 1.996106015438098,
"rewards/margins": 4.480647016108083,
"rewards/rejected": -2.4845410006699846,
"step": 1500
},
{
"epoch": 1.9689119170984455,
"grad_norm": 5.955198287963867,
"kl": 15.756006240844727,
"learning_rate": 2.866230287623651e-07,
"logits/chosen": -50458820.608,
"logits/rejected": -51340717.92366412,
"logps/chosen": -462.9027,
"logps/rejected": -390.4223282442748,
"loss": 0.2493,
"loss/base_kto": 1.9940131902694702,
"metrics/advantage_var": 14228.1376953125,
"rewards/chosen": 2.121536328125,
"rewards/margins": 5.070816392831584,
"rewards/rejected": -2.949280064706584,
"step": 1520
},
{
"epoch": 1.994818652849741,
"grad_norm": 7.135191440582275,
"kl": 24.769649505615234,
"learning_rate": 2.738894140150075e-07,
"logits/chosen": -51178060.88178914,
"logits/rejected": -52667457.76146789,
"logps/chosen": -469.5570087859425,
"logps/rejected": -387.4057482798165,
"loss": 0.2443,
"loss/base_kto": 1.9541826248168945,
"metrics/advantage_var": 13435.5263671875,
"rewards/chosen": 2.4769127208965656,
"rewards/margins": 4.854215258167208,
"rewards/rejected": -2.377302537270642,
"step": 1540
},
{
"epoch": 2.0207253886010363,
"grad_norm": 7.013718605041504,
"kl": 30.34478187561035,
"learning_rate": 2.6133756500585156e-07,
"logits/chosen": -51477564.23529412,
"logits/rejected": -52709886.46246246,
"logps/chosen": -484.40109272875816,
"logps/rejected": -392.9382272897898,
"loss": 0.2,
"loss/base_kto": 1.5998648405075073,
"metrics/advantage_var": 14826.869140625,
"rewards/chosen": 3.1217575571895426,
"rewards/margins": 5.812387762590256,
"rewards/rejected": -2.6906302054007134,
"step": 1560
},
{
"epoch": 2.0466321243523318,
"grad_norm": 5.8692803382873535,
"kl": 12.55923080444336,
"learning_rate": 2.489775719130767e-07,
"logits/chosen": -51684074.43797856,
"logits/rejected": -52261406.21371611,
"logps/chosen": -428.73631316998467,
"logps/rejected": -383.90814393939394,
"loss": 0.2111,
"loss/base_kto": 1.6889790296554565,
"metrics/advantage_var": 14125.8115234375,
"rewards/chosen": 2.474229143735643,
"rewards/margins": 5.531732632571369,
"rewards/rejected": -3.0575034888357258,
"step": 1580
},
{
"epoch": 2.0725388601036268,
"grad_norm": 5.495901584625244,
"kl": 18.747608184814453,
"learning_rate": 2.3681937068576303e-07,
"logits/chosen": -51583710.500807755,
"logits/rejected": -52984393.58547655,
"logps/chosen": -455.1819466882068,
"logps/rejected": -395.01366301059,
"loss": 0.2167,
"loss/base_kto": 1.7334028482437134,
"metrics/advantage_var": 14336.228515625,
"rewards/chosen": 2.454308036841175,
"rewards/margins": 5.4658964061443145,
"rewards/rejected": -3.0115883693031393,
"step": 1600
},
{
"epoch": 2.098445595854922,
"grad_norm": 9.811450958251953,
"kl": 15.564459800720215,
"learning_rate": 2.2487273505658e-07,
"logits/chosen": -51759881.68229955,
"logits/rejected": -52201898.80452342,
"logps/chosen": -459.4629349470499,
"logps/rejected": -398.67245557350566,
"loss": 0.2064,
"loss/base_kto": 1.6514919996261597,
"metrics/advantage_var": 14630.4482421875,
"rewards/chosen": 3.066073649950359,
"rewards/margins": 5.556259906765787,
"rewards/rejected": -2.490186256815428,
"step": 1620
},
{
"epoch": 2.1243523316062176,
"grad_norm": 5.7088398933410645,
"kl": 17.640766143798828,
"learning_rate": 2.131472686848817e-07,
"logits/chosen": -50637759.902290076,
"logits/rejected": -52251328.512,
"logps/chosen": -458.0880248091603,
"logps/rejected": -429.6307,
"loss": 0.2117,
"loss/base_kto": 1.6933727264404297,
"metrics/advantage_var": 15645.4248046875,
"rewards/chosen": 2.766318098461355,
"rewards/margins": 5.662018098461355,
"rewards/rejected": -2.8957,
"step": 1640
},
{
"epoch": 2.150259067357513,
"grad_norm": 9.062532424926758,
"kl": 18.433141708374023,
"learning_rate": 2.016523974365188e-07,
"logits/chosen": -51133872.56528418,
"logits/rejected": -49807802.81081081,
"logps/chosen": -442.15101766513055,
"logps/rejected": -396.4219495230525,
"loss": 0.2287,
"loss/base_kto": 1.8292301893234253,
"metrics/advantage_var": 13636.6064453125,
"rewards/chosen": 2.8211182390673004,
"rewards/margins": 5.241429419388247,
"rewards/rejected": -2.420311180320946,
"step": 1660
},
{
"epoch": 2.1761658031088085,
"grad_norm": 8.166321754455566,
"kl": 22.650665283203125,
"learning_rate": 1.9039736180657372e-07,
"logits/chosen": -52599490.43037975,
"logits/rejected": -51828483.16049383,
"logps/chosen": -466.92306170886076,
"logps/rejected": -387.64144483024694,
"loss": 0.2115,
"loss/base_kto": 1.6923620700836182,
"metrics/advantage_var": 14835.9453125,
"rewards/chosen": 2.4578896051720727,
"rewards/margins": 5.504484295565591,
"rewards/rejected": -3.0465946903935186,
"step": 1680
},
{
"epoch": 2.2020725388601035,
"grad_norm": 8.062451362609863,
"kl": 12.976425170898438,
"learning_rate": 1.7939120949111498e-07,
"logits/chosen": -52049936.07535322,
"logits/rejected": -53151976.510108866,
"logps/chosen": -446.8129905808477,
"logps/rejected": -401.06497861586314,
"loss": 0.2076,
"loss/base_kto": 1.660894751548767,
"metrics/advantage_var": 13747.203125,
"rewards/chosen": 2.508091517857143,
"rewards/margins": 5.53510038133887,
"rewards/rejected": -3.0270088634817265,
"step": 1700
},
{
"epoch": 2.227979274611399,
"grad_norm": 7.792516231536865,
"kl": 20.18115234375,
"learning_rate": 1.6864278811393523e-07,
"logits/chosen": -53751346.09618574,
"logits/rejected": -53658386.52880354,
"logps/chosen": -464.70885157545604,
"logps/rejected": -407.9797359675037,
"loss": 0.2025,
"loss/base_kto": 1.6203575134277344,
"metrics/advantage_var": 15640.3388671875,
"rewards/chosen": 2.468496547211857,
"rewards/margins": 5.659715995374707,
"rewards/rejected": -3.1912194481628506,
"step": 1720
},
{
"epoch": 2.2538860103626943,
"grad_norm": 6.621832847595215,
"kl": 16.571104049682617,
"learning_rate": 1.5816073811412584e-07,
"logits/chosen": -54200557.00890208,
"logits/rejected": -53209642.24422442,
"logps/chosen": -462.1706695103858,
"logps/rejected": -402.0129950495049,
"loss": 0.2237,
"loss/base_kto": 1.7895901203155518,
"metrics/advantage_var": 14439.8701171875,
"rewards/chosen": 2.625101061178598,
"rewards/margins": 5.253301478876618,
"rewards/rejected": -2.62820041769802,
"step": 1740
},
{
"epoch": 2.2797927461139897,
"grad_norm": 8.105810165405273,
"kl": 21.278722763061523,
"learning_rate": 1.4795348580020207e-07,
"logits/chosen": -50443359.44391785,
"logits/rejected": -49563052.90880989,
"logps/chosen": -468.43725315955766,
"logps/rejected": -405.7663736476043,
"loss": 0.2185,
"loss/base_kto": 1.7482216358184814,
"metrics/advantage_var": 15048.6787109375,
"rewards/chosen": 2.739806068263724,
"rewards/margins": 5.470672537303523,
"rewards/rejected": -2.7308664690397992,
"step": 1760
},
{
"epoch": 2.305699481865285,
"grad_norm": 7.075442314147949,
"kl": 19.994430541992188,
"learning_rate": 1.3802923657636355e-07,
"logits/chosen": -52378354.526315786,
"logits/rejected": -51290253.13323124,
"logps/chosen": -460.5764553429027,
"logps/rejected": -422.2306661562021,
"loss": 0.214,
"loss/base_kto": 1.7116119861602783,
"metrics/advantage_var": 16243.4814453125,
"rewards/chosen": 2.764156651839115,
"rewards/margins": 5.658843060122997,
"rewards/rejected": -2.894686408283882,
"step": 1780
},
{
"epoch": 2.33160621761658,
"grad_norm": 7.0332512855529785,
"kl": 19.325130462646484,
"learning_rate": 1.28395968346336e-07,
"logits/chosen": -51644251.14551084,
"logits/rejected": -52120175.44479495,
"logps/chosen": -464.09950657894734,
"logps/rejected": -402.872535488959,
"loss": 0.2107,
"loss/base_kto": 1.6855430603027344,
"metrics/advantage_var": 13973.416015625,
"rewards/chosen": 2.7761113311484134,
"rewards/margins": 5.570257077710421,
"rewards/rejected": -2.794145746562007,
"step": 1800
},
{
"epoch": 2.3575129533678756,
"grad_norm": 7.986169815063477,
"kl": 16.947446823120117,
"learning_rate": 1.1906142510009415e-07,
"logits/chosen": -54452428.475435816,
"logits/rejected": -54813858.5146379,
"logps/chosen": -476.34974247226626,
"logps/rejected": -396.2220242681048,
"loss": 0.1982,
"loss/base_kto": 1.5859140157699585,
"metrics/advantage_var": 14368.3193359375,
"rewards/chosen": 2.7504950521865097,
"rewards/margins": 5.752678587252476,
"rewards/rejected": -3.0021835350659667,
"step": 1820
},
{
"epoch": 2.383419689119171,
"grad_norm": 7.128055572509766,
"kl": 20.3778133392334,
"learning_rate": 1.1003311068862547e-07,
"logits/chosen": -50613619.450980395,
"logits/rejected": -53207653.17365269,
"logps/chosen": -435.92953431372547,
"logps/rejected": -404.85291916167665,
"loss": 0.2143,
"loss/base_kto": 1.7144848108291626,
"metrics/advantage_var": 14200.7333984375,
"rewards/chosen": 2.464855717677696,
"rewards/margins": 5.405907452099477,
"rewards/rejected": -2.9410517344217815,
"step": 1840
},
{
"epoch": 2.4093264248704664,
"grad_norm": 8.116265296936035,
"kl": 16.64581298828125,
"learning_rate": 1.0131828279173588e-07,
"logits/chosen": -52379571.53246753,
"logits/rejected": -51955798.361445785,
"logps/chosen": -464.8143262987013,
"logps/rejected": -407.6978539156627,
"loss": 0.2168,
"loss/base_kto": 1.734110713005066,
"metrics/advantage_var": 14600.6748046875,
"rewards/chosen": 2.50759253563819,
"rewards/margins": 5.451606935522885,
"rewards/rejected": -2.944014399884695,
"step": 1860
},
{
"epoch": 2.4352331606217614,
"grad_norm": 9.05835247039795,
"kl": 18.716712951660156,
"learning_rate": 9.292394708374596e-08,
"logits/chosen": -52313060.8424337,
"logits/rejected": -52677460.53208138,
"logps/chosen": -454.5990639625585,
"logps/rejected": -390.97911776212834,
"loss": 0.2116,
"loss/base_kto": 1.6926889419555664,
"metrics/advantage_var": 14277.234375,
"rewards/chosen": 2.606424554833756,
"rewards/margins": 5.508694756992892,
"rewards/rejected": -2.9022702021591353,
"step": 1880
},
{
"epoch": 2.461139896373057,
"grad_norm": 5.412971019744873,
"kl": 21.103687286376953,
"learning_rate": 8.48568516017727e-08,
"logits/chosen": -52296739.194762684,
"logits/rejected": -52193589.18983558,
"logps/chosen": -446.3010433715221,
"logps/rejected": -400.5539985052317,
"loss": 0.2085,
"loss/base_kto": 1.6677101850509644,
"metrics/advantage_var": 15533.890625,
"rewards/chosen": 2.562060866535393,
"rewards/margins": 5.68401731973046,
"rewards/rejected": -3.121956453195067,
"step": 1900
},
{
"epoch": 2.4870466321243523,
"grad_norm": 7.837034702301025,
"kl": 12.999594688415527,
"learning_rate": 7.71234813211169e-08,
"logits/chosen": -52166433.04510109,
"logits/rejected": -52585486.467817895,
"logps/chosen": -468.9892107309487,
"logps/rejected": -407.98569956828885,
"loss": 0.2153,
"loss/base_kto": 1.7224851846694946,
"metrics/advantage_var": 14251.125,
"rewards/chosen": 2.384062439249611,
"rewards/margins": 5.407675475209187,
"rewards/rejected": -3.0236130359595763,
"step": 1920
},
{
"epoch": 2.5129533678756477,
"grad_norm": 7.596892356872559,
"kl": 17.91208839416504,
"learning_rate": 6.973005294212353e-08,
"logits/chosen": -52285226.17944535,
"logits/rejected": -52072183.940029986,
"logps/chosen": -451.25785073409463,
"logps/rejected": -392.07093328335833,
"loss": 0.2083,
"loss/base_kto": 1.6665111780166626,
"metrics/advantage_var": 14959.923828125,
"rewards/chosen": 2.6295397013279977,
"rewards/margins": 5.66366997505832,
"rewards/rejected": -3.034130273730322,
"step": 1940
},
{
"epoch": 2.538860103626943,
"grad_norm": 8.364079475402832,
"kl": 9.80460262298584,
"learning_rate": 6.268250989270102e-08,
"logits/chosen": -52477008.22119816,
"logits/rejected": -53476327.58028617,
"logps/chosen": -435.32574884792626,
"logps/rejected": -392.80703497615264,
"loss": 0.226,
"loss/base_kto": 1.8082932233810425,
"metrics/advantage_var": 14568.2607421875,
"rewards/chosen": 2.3125780049923197,
"rewards/margins": 5.337056110740531,
"rewards/rejected": -3.0244781057482113,
"step": 1960
},
{
"epoch": 2.5647668393782386,
"grad_norm": 11.61428165435791,
"kl": 17.37249755859375,
"learning_rate": 5.598651755051975e-08,
"logits/chosen": -53554920.149068326,
"logits/rejected": -52665005.88679245,
"logps/chosen": -458.90052406832297,
"logps/rejected": -417.7639544025157,
"loss": 0.2136,
"loss/base_kto": 1.7086185216903687,
"metrics/advantage_var": 13907.859375,
"rewards/chosen": 2.4842216539086763,
"rewards/margins": 5.431352540922237,
"rewards/rejected": -2.9471308870135613,
"step": 1980
},
{
"epoch": 2.5906735751295336,
"grad_norm": 9.054996490478516,
"kl": 9.886092185974121,
"learning_rate": 4.964745868872933e-08,
"logits/chosen": -52787035.56204379,
"logits/rejected": -52475398.02352941,
"logps/chosen": -484.2533759124088,
"logps/rejected": -387.08613445378154,
"loss": 0.2097,
"loss/base_kto": 1.6778475046157837,
"metrics/advantage_var": 13511.6064453125,
"rewards/chosen": 2.6910379006044707,
"rewards/margins": 5.576327709887559,
"rewards/rejected": -2.8852898092830883,
"step": 2000
},
{
"epoch": 2.616580310880829,
"grad_norm": 7.358473777770996,
"kl": 18.090463638305664,
"learning_rate": 4.3670429148855493e-08,
"logits/chosen": -50325776.0,
"logits/rejected": -50889488.0,
"logps/chosen": -437.87919921875,
"logps/rejected": -388.3118896484375,
"loss": 0.208,
"loss/base_kto": 1.6639856100082397,
"metrics/advantage_var": 13564.1123046875,
"rewards/chosen": 2.6645410537719725,
"rewards/margins": 5.443995475769043,
"rewards/rejected": -2.7794544219970705,
"step": 2020
},
{
"epoch": 2.6424870466321244,
"grad_norm": 9.689790725708008,
"kl": 18.853412628173828,
"learning_rate": 3.806023374435663e-08,
"logits/chosen": -53538429.46727549,
"logits/rejected": -54475780.93097913,
"logps/chosen": -470.3403729071537,
"logps/rejected": -404.3622592295345,
"loss": 0.2138,
"loss/base_kto": 1.7103630304336548,
"metrics/advantage_var": 14769.6220703125,
"rewards/chosen": 2.7466041413979263,
"rewards/margins": 5.500908540474972,
"rewards/rejected": -2.7543043990770464,
"step": 2040
},
{
"epoch": 2.66839378238342,
"grad_norm": 7.575942516326904,
"kl": 18.5459041595459,
"learning_rate": 3.282138239813037e-08,
"logits/chosen": -52107129.6,
"logits/rejected": -52743897.6,
"logps/chosen": -443.063037109375,
"logps/rejected": -400.88740234375,
"loss": 0.2097,
"loss/base_kto": 1.677259087562561,
"metrics/advantage_var": 13134.6123046875,
"rewards/chosen": 2.7101999282836915,
"rewards/margins": 5.353364753723145,
"rewards/rejected": -2.6431648254394533,
"step": 2060
},
{
"epoch": 2.694300518134715,
"grad_norm": 7.75359582901001,
"kl": 19.799182891845703,
"learning_rate": 2.795808651707793e-08,
"logits/chosen": -49708657.50558214,
"logits/rejected": -51144722.81776416,
"logps/chosen": -456.9265350877193,
"logps/rejected": -399.776440467075,
"loss": 0.2149,
"loss/base_kto": 1.7193249464035034,
"metrics/advantage_var": 13961.0068359375,
"rewards/chosen": 2.6514213111792264,
"rewards/margins": 5.558279980302504,
"rewards/rejected": -2.9068586691232774,
"step": 2080
},
{
"epoch": 2.7202072538860103,
"grad_norm": 5.188368320465088,
"kl": 15.995924949645996,
"learning_rate": 2.3474255606639293e-08,
"logits/chosen": -52745606.757164404,
"logits/rejected": -52081904.64829822,
"logps/chosen": -503.8714177978884,
"logps/rejected": -408.71950972447326,
"loss": 0.2177,
"loss/base_kto": 1.7417219877243042,
"metrics/advantage_var": 14489.0693359375,
"rewards/chosen": 2.7078634638951735,
"rewards/margins": 5.375946963945822,
"rewards/rejected": -2.668083500050648,
"step": 2100
},
{
"epoch": 2.7461139896373057,
"grad_norm": 6.56077241897583,
"kl": 16.229629516601562,
"learning_rate": 1.9373494128020195e-08,
"logits/chosen": -51885137.2192846,
"logits/rejected": -52316156.78492936,
"logps/chosen": -480.2950038880249,
"logps/rejected": -415.40894819466246,
"loss": 0.2057,
"loss/base_kto": 1.6456931829452515,
"metrics/advantage_var": 14930.6376953125,
"rewards/chosen": 2.668261490936042,
"rewards/margins": 5.4684896876834905,
"rewards/rejected": -2.800228196747449,
"step": 2120
},
{
"epoch": 2.772020725388601,
"grad_norm": 7.278511047363281,
"kl": 17.13551139831543,
"learning_rate": 1.5659098600638798e-08,
"logits/chosen": -53035779.32467532,
"logits/rejected": -52839140.240963854,
"logps/chosen": -471.993455762987,
"logps/rejected": -399.45218373493975,
"loss": 0.2193,
"loss/base_kto": 1.7541418075561523,
"metrics/advantage_var": 14101.2490234375,
"rewards/chosen": 2.4638329047661323,
"rewards/margins": 5.324497915884826,
"rewards/rejected": -2.8606650111186935,
"step": 2140
},
{
"epoch": 2.7979274611398965,
"grad_norm": 7.59853458404541,
"kl": 16.550039291381836,
"learning_rate": 1.2334054952120143e-08,
"logits/chosen": -51503687.3114241,
"logits/rejected": -50366601.385335416,
"logps/chosen": -455.4739827856025,
"logps/rejected": -414.71514235569424,
"loss": 0.2146,
"loss/base_kto": 1.7168140411376953,
"metrics/advantage_var": 15569.7490234375,
"rewards/chosen": 2.7565891224080596,
"rewards/margins": 5.4543376964135195,
"rewards/rejected": -2.6977485740054603,
"step": 2160
},
{
"epoch": 2.823834196891192,
"grad_norm": 6.622338771820068,
"kl": 15.1036376953125,
"learning_rate": 9.401036117969108e-09,
"logits/chosen": -52360348.09756097,
"logits/rejected": -53833321.025641024,
"logps/chosen": -446.0986566310976,
"logps/rejected": -419.4545272435897,
"loss": 0.2128,
"loss/base_kto": 1.7021082639694214,
"metrics/advantage_var": 13941.78125,
"rewards/chosen": 2.581070504537443,
"rewards/margins": 5.448736504512403,
"rewards/rejected": -2.86766599997496,
"step": 2180
},
{
"epoch": 2.849740932642487,
"grad_norm": 7.87120246887207,
"kl": 16.005062103271484,
"learning_rate": 6.8623998928517555e-09,
"logits/chosen": -54459303.96380091,
"logits/rejected": -53815627.92868719,
"logps/chosen": -476.5891308446455,
"logps/rejected": -403.3553737844408,
"loss": 0.2189,
"loss/base_kto": 1.7509472370147705,
"metrics/advantage_var": 14989.7529296875,
"rewards/chosen": 2.553857863758484,
"rewards/margins": 5.529682006536037,
"rewards/rejected": -2.9758241427775527,
"step": 2200
},
{
"epoch": 2.8756476683937824,
"grad_norm": 8.618688583374023,
"kl": 20.370731353759766,
"learning_rate": 4.72018703521132e-09,
"logits/chosen": -51821293.021416806,
"logits/rejected": -51338192.832095094,
"logps/chosen": -461.3043657331137,
"logps/rejected": -396.511794205052,
"loss": 0.2111,
"loss/base_kto": 1.6885474920272827,
"metrics/advantage_var": 15565.265625,
"rewards/chosen": 2.3771085786269563,
"rewards/margins": 5.516415291804891,
"rewards/rejected": -3.1393067131779344,
"step": 2220
},
{
"epoch": 2.901554404145078,
"grad_norm": 10.641010284423828,
"kl": 15.09222412109375,
"learning_rate": 2.976119626744267e-09,
"logits/chosen": -51623777.486068115,
"logits/rejected": -51611396.03785489,
"logps/chosen": -458.0194465944272,
"logps/rejected": -377.268089511041,
"loss": 0.227,
"loss/base_kto": 1.8159443140029907,
"metrics/advantage_var": 14810.2236328125,
"rewards/chosen": 2.501199917158475,
"rewards/margins": 5.438771927090455,
"rewards/rejected": -2.9375720099319795,
"step": 2240
},
{
"epoch": 2.927461139896373,
"grad_norm": 7.686944484710693,
"kl": 10.616701126098633,
"learning_rate": 1.631599688052765e-09,
"logits/chosen": -52331420.31858407,
"logits/rejected": -52707416.45182724,
"logps/chosen": -463.57586651917404,
"logps/rejected": -415.9006955980066,
"loss": 0.21,
"loss/base_kto": 1.6796455383300781,
"metrics/advantage_var": 14238.4287109375,
"rewards/chosen": 2.7552421817385695,
"rewards/margins": 5.631798071286431,
"rewards/rejected": -2.8765558895478613,
"step": 2260
},
{
"epoch": 2.9533678756476682,
"grad_norm": 8.286816596984863,
"kl": 21.288183212280273,
"learning_rate": 6.877080515894085e-10,
"logits/chosen": -50794508.94154818,
"logits/rejected": -50980807.02318393,
"logps/chosen": -460.2579976303318,
"logps/rejected": -390.54897604327664,
"loss": 0.2197,
"loss/base_kto": 1.7577959299087524,
"metrics/advantage_var": 13955.8486328125,
"rewards/chosen": 2.697458854783768,
"rewards/margins": 5.36005537900614,
"rewards/rejected": -2.6625965242223724,
"step": 2280
},
{
"epoch": 2.9792746113989637,
"grad_norm": 8.0601806640625,
"kl": 20.204782485961914,
"learning_rate": 1.4520349279739663e-10,
"logits/chosen": -53413062.298412696,
"logits/rejected": -53059010.56,
"logps/chosen": -463.35287698412696,
"logps/rejected": -399.71653846153845,
"loss": 0.2183,
"loss/base_kto": 1.746720314025879,
"metrics/advantage_var": 15232.736328125,
"rewards/chosen": 2.51821773468502,
"rewards/margins": 5.441813362689828,
"rewards/rejected": -2.923595628004808,
"step": 2300
},
{
"epoch": 3.0,
"step": 2316,
"total_flos": 9.989338484496138e+17,
"train_loss": 0.27494916788242846,
"train_runtime": 11062.9074,
"train_samples_per_second": 13.398,
"train_steps_per_second": 0.209
}
],
"logging_steps": 20,
"max_steps": 2316,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": false,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 9.989338484496138e+17,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}