Files
aup-fullft-kto_w1_mmd-w1lam…/trainer_state.json
ModelHub XC 76f5016a0e 初始化项目,由ModelHub XC社区提供模型
Model: Gueule-d-ange/aup-fullft-kto_w1_mmd-w1lam8.4e-4_mmdrho8.4e-4_kr0.1-seed0
Source: Original Platform
2026-07-25 08:52:11 +08:00

2459 lines
92 KiB
JSON

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 3.0,
"eval_steps": 500,
"global_step": 2316,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.025906735751295335,
"grad_norm": 19.311729431152344,
"kl": 7.840065002441406,
"learning_rate": 1.8999999999999998e-07,
"logits/chosen": -36431578.50708661,
"logits/rejected": -37226997.680620156,
"logps/chosen": -466.71574803149605,
"logps/rejected": -375.28842054263566,
"loss": 0.5974,
"loss/base_kto": 3.9136810302734375,
"metrics/advantage_var": 209.6494598388672,
"regularization/lipschitz_norm": 879.8392944335938,
"regularization/mmd": 0.1262146532535553,
"regularization/rkhs_norm": 150.2555389404297,
"regularization/w1": 0.7390649914741516,
"rewards/chosen": 0.08830630084661048,
"rewards/margins": 0.07595446117484714,
"rewards/rejected": 0.01235183967176334,
"step": 20
},
{
"epoch": 0.05181347150259067,
"grad_norm": 18.068716049194336,
"kl": 12.981042861938477,
"learning_rate": 3.8999999999999997e-07,
"logits/chosen": -36214288.56702619,
"logits/rejected": -37964902.23771791,
"logps/chosen": -483.87788906009246,
"logps/rejected": -375.7964045166403,
"loss": 0.5937,
"loss/base_kto": 3.8673017024993896,
"metrics/advantage_var": 193.134033203125,
"regularization/lipschitz_norm": 896.8826293945312,
"regularization/mmd": 0.1289929896593094,
"regularization/rkhs_norm": 153.56309509277344,
"regularization/w1": 0.7533814311027527,
"rewards/chosen": 0.19668764840289146,
"rewards/margins": 0.10986243026266265,
"rewards/rejected": 0.08682521814022881,
"step": 40
},
{
"epoch": 0.07772020725388601,
"grad_norm": 25.2999210357666,
"kl": 7.072659492492676,
"learning_rate": 5.9e-07,
"logits/chosen": -35756625.76124031,
"logits/rejected": -36375034.35590551,
"logps/chosen": -474.3420058139535,
"logps/rejected": -358.6579232283465,
"loss": 0.5898,
"loss/base_kto": 3.890444278717041,
"metrics/advantage_var": 160.73265075683594,
"regularization/lipschitz_norm": 842.654296875,
"regularization/mmd": 0.12045440822839737,
"regularization/rkhs_norm": 143.3981170654297,
"regularization/w1": 0.7078295946121216,
"rewards/chosen": 0.10429767933926841,
"rewards/margins": 0.11426339272009703,
"rewards/rejected": -0.009965713380828618,
"step": 60
},
{
"epoch": 0.10362694300518134,
"grad_norm": 22.47340965270996,
"kl": 17.255449295043945,
"learning_rate": 7.9e-07,
"logits/chosen": -38147992.50229709,
"logits/rejected": -39060184.39553429,
"logps/chosen": -490.06527565084224,
"logps/rejected": -375.5648425039872,
"loss": 0.5992,
"loss/base_kto": 3.882554292678833,
"metrics/advantage_var": 186.92015075683594,
"regularization/lipschitz_norm": 928.38232421875,
"regularization/mmd": 0.1312989443540573,
"regularization/rkhs_norm": 156.3082733154297,
"regularization/w1": 0.7798411250114441,
"rewards/chosen": 0.25746741302163095,
"rewards/margins": 0.09680484865728436,
"rewards/rejected": 0.1606625643643466,
"step": 80
},
{
"epoch": 0.12953367875647667,
"grad_norm": 21.319414138793945,
"kl": 6.023135185241699,
"learning_rate": 9.9e-07,
"logits/chosen": -36376466.408026755,
"logits/rejected": -37470520.30498534,
"logps/chosen": -508.5541387959866,
"logps/rejected": -383.38899835043986,
"loss": 0.592,
"loss/base_kto": 3.8355255126953125,
"metrics/advantage_var": 183.87266540527344,
"regularization/lipschitz_norm": 915.0607299804688,
"regularization/mmd": 0.13171826303005219,
"regularization/rkhs_norm": 156.80743408203125,
"regularization/w1": 0.7686509490013123,
"rewards/chosen": -0.0059871546002136025,
"rewards/margins": 0.15239483607304177,
"rewards/rejected": -0.15838199067325537,
"step": 100
},
{
"epoch": 0.15544041450777202,
"grad_norm": 17.00433349609375,
"kl": 10.309918403625488,
"learning_rate": 9.998186234298189e-07,
"logits/chosen": -35338938.69170579,
"logits/rejected": -37091644.30577223,
"logps/chosen": -455.42556729264476,
"logps/rejected": -358.82958755850234,
"loss": 0.5998,
"loss/base_kto": 3.870764970779419,
"metrics/advantage_var": 211.3104705810547,
"regularization/lipschitz_norm": 941.3049926757812,
"regularization/mmd": 0.1367132067680359,
"regularization/rkhs_norm": 162.7538299560547,
"regularization/w1": 0.7906962633132935,
"rewards/chosen": 0.07709573617377005,
"rewards/margins": 0.11271761728680754,
"rewards/rejected": -0.03562188111303749,
"step": 120
},
{
"epoch": 0.18134715025906736,
"grad_norm": 16.512834548950195,
"kl": 8.221867561340332,
"learning_rate": 9.992359552107714e-07,
"logits/chosen": -36854272.0,
"logits/rejected": -37458937.559748426,
"logps/chosen": -499.73282220496895,
"logps/rejected": -380.55640723270443,
"loss": 0.6038,
"loss/base_kto": 3.8781769275665283,
"metrics/advantage_var": 206.3916015625,
"regularization/lipschitz_norm": 970.337890625,
"regularization/mmd": 0.13737133145332336,
"regularization/rkhs_norm": 163.53729248046875,
"regularization/w1": 0.8150838017463684,
"rewards/chosen": 0.08422803582612032,
"rewards/margins": 0.11420032516942043,
"rewards/rejected": -0.029972289343300106,
"step": 140
},
{
"epoch": 0.20725388601036268,
"grad_norm": 18.08220672607422,
"kl": 10.539210319519043,
"learning_rate": 9.982519612796161e-07,
"logits/chosen": -35482458.03058104,
"logits/rejected": -36236935.76996805,
"logps/chosen": -473.017249617737,
"logps/rejected": -363.83384085463257,
"loss": 0.5904,
"loss/base_kto": 3.817993640899658,
"metrics/advantage_var": 181.1797332763672,
"regularization/lipschitz_norm": 921.32861328125,
"regularization/mmd": 0.13110749423503876,
"regularization/rkhs_norm": 156.0803680419922,
"regularization/w1": 0.7739160656929016,
"rewards/chosen": 0.16040916326213686,
"rewards/margins": 0.14777508777437237,
"rewards/rejected": 0.012634075487764499,
"step": 160
},
{
"epoch": 0.23316062176165803,
"grad_norm": 20.726795196533203,
"kl": 16.892858505249023,
"learning_rate": 9.968674326492213e-07,
"logits/chosen": -36463163.6809816,
"logits/rejected": -36880351.38853503,
"logps/chosen": -460.85649923312883,
"logps/rejected": -363.66182324840764,
"loss": 0.5967,
"loss/base_kto": 3.7915825843811035,
"metrics/advantage_var": 213.2284698486328,
"regularization/lipschitz_norm": 998.6449584960938,
"regularization/mmd": 0.1433025598526001,
"regularization/rkhs_norm": 170.5983123779297,
"regularization/w1": 0.8388616442680359,
"rewards/chosen": 0.3729892098830521,
"rewards/margins": 0.18400788032353158,
"rewards/rejected": 0.18898132955952054,
"step": 180
},
{
"epoch": 0.25906735751295334,
"grad_norm": 24.64959716796875,
"kl": 4.646457672119141,
"learning_rate": 9.950834823142198e-07,
"logits/chosen": -38184963.15076923,
"logits/rejected": -37582861.0031746,
"logps/chosen": -493.7851923076923,
"logps/rejected": -403.224181547619,
"loss": 0.6094,
"loss/base_kto": 3.879265546798706,
"metrics/advantage_var": 216.05857849121094,
"regularization/lipschitz_norm": 1018.1420288085938,
"regularization/mmd": 0.14044605195522308,
"regularization/rkhs_norm": 167.19769287109375,
"regularization/w1": 0.85523921251297,
"rewards/chosen": -0.010728354087242714,
"rewards/margins": 0.12415415808103605,
"rewards/rejected": -0.13488251216827876,
"step": 200
},
{
"epoch": 0.2849740932642487,
"grad_norm": 18.703136444091797,
"kl": 17.4063663482666,
"learning_rate": 9.929015443562942e-07,
"logits/chosen": -37278605.86499215,
"logits/rejected": -37374381.984447904,
"logps/chosen": -491.4295035321821,
"logps/rejected": -377.1530909797823,
"loss": 0.5926,
"loss/base_kto": 3.804840087890625,
"metrics/advantage_var": 200.4795379638672,
"regularization/lipschitz_norm": 951.6018676757812,
"regularization/mmd": 0.1365826427936554,
"regularization/rkhs_norm": 162.59837341308594,
"regularization/w1": 0.7993456125259399,
"rewards/chosen": 0.30602907573035226,
"rewards/margins": 0.1744748681584238,
"rewards/rejected": 0.13155420757192846,
"step": 220
},
{
"epoch": 0.31088082901554404,
"grad_norm": 18.86064338684082,
"kl": 8.311650276184082,
"learning_rate": 9.90323372791347e-07,
"logits/chosen": -38200714.35598706,
"logits/rejected": -38060530.07854985,
"logps/chosen": -480.3775283171521,
"logps/rejected": -380.73022092145015,
"loss": 0.6065,
"loss/base_kto": 3.8396377563476562,
"metrics/advantage_var": 243.49658203125,
"regularization/lipschitz_norm": 1030.6707763671875,
"regularization/mmd": 0.1466662734746933,
"regularization/rkhs_norm": 174.60272216796875,
"regularization/w1": 0.8657633066177368,
"rewards/chosen": 0.037998779691924556,
"rewards/margins": 0.13388583994376557,
"rewards/rejected": -0.09588706025184102,
"step": 240
},
{
"epoch": 0.33678756476683935,
"grad_norm": 22.847320556640625,
"kl": 5.043769359588623,
"learning_rate": 9.87351040159484e-07,
"logits/chosen": -36546416.5732899,
"logits/rejected": -38108802.69069069,
"logps/chosen": -517.4850875407166,
"logps/rejected": -372.63079485735733,
"loss": 0.5992,
"loss/base_kto": 3.7869293689727783,
"metrics/advantage_var": 246.16172790527344,
"regularization/lipschitz_norm": 1021.5092163085938,
"regularization/mmd": 0.14847134053707123,
"regularization/rkhs_norm": 176.75160217285156,
"regularization/w1": 0.8580676913261414,
"rewards/chosen": 0.005644556753798494,
"rewards/margins": 0.19668232761792434,
"rewards/rejected": -0.19103777086412585,
"step": 260
},
{
"epoch": 0.3626943005181347,
"grad_norm": 18.246173858642578,
"kl": 1.4904935359954834,
"learning_rate": 9.839869358589396e-07,
"logits/chosen": -37131983.2576,
"logits/rejected": -38426283.18778626,
"logps/chosen": -517.8604,
"logps/rejected": -392.2879770992366,
"loss": 0.5948,
"loss/base_kto": 3.756671905517578,
"metrics/advantage_var": 236.1463623046875,
"regularization/lipschitz_norm": 1015.0855712890625,
"regularization/mmd": 0.14928221702575684,
"regularization/rkhs_norm": 177.7169189453125,
"regularization/w1": 0.8526718020439148,
"rewards/chosen": -0.12592723388671875,
"rewards/margins": 0.23520362176094348,
"rewards/rejected": -0.36113085564766223,
"step": 280
},
{
"epoch": 0.38860103626943004,
"grad_norm": 22.975313186645508,
"kl": 9.60496997833252,
"learning_rate": 9.80233764225289e-07,
"logits/chosen": -36020672.0,
"logits/rejected": -36922768.0,
"logps/chosen": -497.00810546875,
"logps/rejected": -351.035595703125,
"loss": 0.5945,
"loss/base_kto": 3.7739624977111816,
"metrics/advantage_var": 226.35171508789062,
"regularization/lipschitz_norm": 996.1676635742188,
"regularization/mmd": 0.1456291526556015,
"regularization/rkhs_norm": 173.36805725097656,
"regularization/w1": 0.836780846118927,
"rewards/chosen": 0.0830356776714325,
"rewards/margins": 0.209895521402359,
"rewards/rejected": -0.1268598437309265,
"step": 300
},
{
"epoch": 0.41450777202072536,
"grad_norm": 20.777921676635742,
"kl": 11.073346138000488,
"learning_rate": 9.760945423574868e-07,
"logits/chosen": -35355735.681957185,
"logits/rejected": -38105650.70926517,
"logps/chosen": -488.3495317278287,
"logps/rejected": -383.5483226837061,
"loss": 0.5937,
"loss/base_kto": 3.771421432495117,
"metrics/advantage_var": 217.07473754882812,
"regularization/lipschitz_norm": 996.0587768554688,
"regularization/mmd": 0.14185383915901184,
"regularization/rkhs_norm": 168.8736114501953,
"regularization/w1": 0.8366894125938416,
"rewards/chosen": 0.199867271866638,
"rewards/margins": 0.20280633005468945,
"rewards/rejected": -0.0029390581880514616,
"step": 320
},
{
"epoch": 0.44041450777202074,
"grad_norm": 22.98124885559082,
"kl": 14.724398612976074,
"learning_rate": 9.71572597692482e-07,
"logits/chosen": -38076933.48851455,
"logits/rejected": -38290397.703349285,
"logps/chosen": -491.70348392036755,
"logps/rejected": -378.34968102073367,
"loss": 0.6078,
"loss/base_kto": 3.835813522338867,
"metrics/advantage_var": 249.15823364257812,
"regularization/lipschitz_norm": 1045.0399169921875,
"regularization/mmd": 0.148451566696167,
"regularization/rkhs_norm": 176.7280731201172,
"regularization/w1": 0.8778334856033325,
"rewards/chosen": 0.21668377769668837,
"rewards/margins": 0.13880619153879986,
"rewards/rejected": 0.0778775861578885,
"step": 340
},
{
"epoch": 0.46632124352331605,
"grad_norm": 18.941415786743164,
"kl": 5.043925762176514,
"learning_rate": 9.666715653303588e-07,
"logits/chosen": -36666190.76923077,
"logits/rejected": -37651927.414634146,
"logps/chosen": -497.1409254807692,
"logps/rejected": -385.7756526295732,
"loss": 0.5933,
"loss/base_kto": 3.791677236557007,
"metrics/advantage_var": 206.26358032226562,
"regularization/lipschitz_norm": 972.7359619140625,
"regularization/mmd": 0.13735435903072357,
"regularization/rkhs_norm": 163.51708984375,
"regularization/w1": 0.8170982599258423,
"rewards/chosen": -0.049271247325799405,
"rewards/margins": 0.19350429756183635,
"rewards/rejected": -0.24277554488763575,
"step": 360
},
{
"epoch": 0.49222797927461137,
"grad_norm": 21.00739860534668,
"kl": 8.852449417114258,
"learning_rate": 9.613953851121528e-07,
"logits/chosen": -36170224.87091757,
"logits/rejected": -37332088.565149136,
"logps/chosen": -483.83048211508554,
"logps/rejected": -353.101942700157,
"loss": 0.5875,
"loss/base_kto": 3.735443115234375,
"metrics/advantage_var": 218.0341339111328,
"regularization/lipschitz_norm": 980.8146362304688,
"regularization/mmd": 0.14092817902565002,
"regularization/rkhs_norm": 167.77163696289062,
"regularization/w1": 0.8238841891288757,
"rewards/chosen": 0.18129745649512782,
"rewards/margins": 0.2546149438435077,
"rewards/rejected": -0.07331748734837985,
"step": 380
},
{
"epoch": 0.5181347150259067,
"grad_norm": 20.023303985595703,
"kl": 8.194683074951172,
"learning_rate": 9.557482984526924e-07,
"logits/chosen": -36072057.304615386,
"logits/rejected": -38544361.244444445,
"logps/chosen": -508.0848076923077,
"logps/rejected": -365.3905257936508,
"loss": 0.5986,
"loss/base_kto": 3.7646138668060303,
"metrics/advantage_var": 239.51992797851562,
"regularization/lipschitz_norm": 1040.847900390625,
"regularization/mmd": 0.1498996913433075,
"regularization/rkhs_norm": 178.45201110839844,
"regularization/w1": 0.8743122220039368,
"rewards/chosen": 0.14487689678485577,
"rewards/margins": 0.22515206603631288,
"rewards/rejected": -0.0802751692514571,
"step": 400
},
{
"epoch": 0.5440414507772021,
"grad_norm": 23.46453094482422,
"kl": 9.771958351135254,
"learning_rate": 9.497348449310107e-07,
"logits/chosen": -37220949.333333336,
"logits/rejected": -37654748.35443038,
"logps/chosen": -511.12789351851853,
"logps/rejected": -389.73838014240505,
"loss": 0.5989,
"loss/base_kto": 3.769212484359741,
"metrics/advantage_var": 246.97378540039062,
"regularization/lipschitz_norm": 1036.302978515625,
"regularization/mmd": 0.15128260850906372,
"regularization/rkhs_norm": 180.0983428955078,
"regularization/w1": 0.8704944849014282,
"rewards/chosen": 0.1615737279256185,
"rewards/margins": 0.18870579844285668,
"rewards/rejected": -0.027132070517238184,
"step": 420
},
{
"epoch": 0.5699481865284974,
"grad_norm": 25.6339168548584,
"kl": 11.140782356262207,
"learning_rate": 9.433598586410701e-07,
"logits/chosen": -37574342.929936305,
"logits/rejected": -38438701.54601227,
"logps/chosen": -488.5663813694268,
"logps/rejected": -377.37749233128835,
"loss": 0.5931,
"loss/base_kto": 3.769780397415161,
"metrics/advantage_var": 224.9917449951172,
"regularization/lipschitz_norm": 992.4802856445312,
"regularization/mmd": 0.1417173594236374,
"regularization/rkhs_norm": 168.7111358642578,
"regularization/w1": 0.833683431148529,
"rewards/chosen": 0.10946545934980842,
"rewards/margins": 0.2039143446531419,
"rewards/rejected": -0.0944488853033335,
"step": 440
},
{
"epoch": 0.5958549222797928,
"grad_norm": 19.508899688720703,
"kl": 9.35730266571045,
"learning_rate": 9.366284643057313e-07,
"logits/chosen": -36216771.3894081,
"logits/rejected": -37098280.92789969,
"logps/chosen": -476.0102219626168,
"logps/rejected": -365.8579055642633,
"loss": 0.5869,
"loss/base_kto": 3.680236577987671,
"metrics/advantage_var": 237.09336853027344,
"regularization/lipschitz_norm": 1030.716796875,
"regularization/mmd": 0.148957759141922,
"regularization/rkhs_norm": 177.33067321777344,
"regularization/w1": 0.865801990032196,
"rewards/chosen": 0.15998747638452834,
"rewards/margins": 0.3211469080572973,
"rewards/rejected": -0.16115943167276892,
"step": 460
},
{
"epoch": 0.6217616580310881,
"grad_norm": 21.36751365661621,
"kl": 8.980067253112793,
"learning_rate": 9.295460731570917e-07,
"logits/chosen": -35576658.11320755,
"logits/rejected": -36327990.0621118,
"logps/chosen": -473.73309748427675,
"logps/rejected": -381.9711277173913,
"loss": 0.6033,
"loss/base_kto": 3.8249454498291016,
"metrics/advantage_var": 228.97879028320312,
"regularization/lipschitz_norm": 1020.0426025390625,
"regularization/mmd": 0.14489972591400146,
"regularization/rkhs_norm": 172.49966430664062,
"regularization/w1": 0.8568357825279236,
"rewards/chosen": 0.011161331860524303,
"rewards/margins": 0.16597854578381865,
"rewards/rejected": -0.15481721392329434,
"step": 480
},
{
"epoch": 0.6476683937823834,
"grad_norm": 20.054691314697266,
"kl": 16.56330108642578,
"learning_rate": 9.221183785865056e-07,
"logits/chosen": -34627515.10703364,
"logits/rejected": -34938219.143769965,
"logps/chosen": -470.923881880734,
"logps/rejected": -370.4764376996805,
"loss": 0.59,
"loss/base_kto": 3.7410390377044678,
"metrics/advantage_var": 230.6334991455078,
"regularization/lipschitz_norm": 991.7376098632812,
"regularization/mmd": 0.145973339676857,
"regularization/rkhs_norm": 173.7777862548828,
"regularization/w1": 0.8330594897270203,
"rewards/chosen": 0.3361468067227518,
"rewards/margins": 0.2523917340285157,
"rewards/rejected": 0.0837550726942361,
"step": 500
},
{
"epoch": 0.6735751295336787,
"grad_norm": 20.063520431518555,
"kl": 6.0723557472229,
"learning_rate": 9.143513515677817e-07,
"logits/chosen": -35328408.94041868,
"logits/rejected": -35994976.72837633,
"logps/chosen": -462.0980273752013,
"logps/rejected": -368.64501138088013,
"loss": 0.6028,
"loss/base_kto": 3.8176231384277344,
"metrics/advantage_var": 240.4467315673828,
"regularization/lipschitz_norm": 1020.6088256835938,
"regularization/mmd": 0.1475488394498825,
"regularization/rkhs_norm": 175.6533660888672,
"regularization/w1": 0.8573114275932312,
"rewards/chosen": -0.008806174887935128,
"rewards/margins": 0.16633828115637916,
"rewards/rejected": -0.1751444560443143,
"step": 520
},
{
"epoch": 0.6994818652849741,
"grad_norm": 17.4051513671875,
"kl": 11.1605806350708,
"learning_rate": 9.062512358572373e-07,
"logits/chosen": -35956836.42199109,
"logits/rejected": -37862189.12685338,
"logps/chosen": -502.7159175334324,
"logps/rejected": -379.42202944810543,
"loss": 0.5965,
"loss/base_kto": 3.736018419265747,
"metrics/advantage_var": 275.1711120605469,
"regularization/lipschitz_norm": 1049.8695068359375,
"regularization/mmd": 0.15403233468532562,
"regularization/rkhs_norm": 183.371826171875,
"regularization/w1": 0.8818902969360352,
"rewards/chosen": 0.19694249236743128,
"rewards/margins": 0.2647455563021094,
"rewards/rejected": -0.06780306393467811,
"step": 540
},
{
"epoch": 0.7253886010362695,
"grad_norm": 26.96074867248535,
"kl": 16.029020309448242,
"learning_rate": 8.978245429744691e-07,
"logits/chosen": -36083062.4,
"logits/rejected": -37897600.0,
"logps/chosen": -485.854736328125,
"logps/rejected": -382.617138671875,
"loss": 0.5908,
"loss/base_kto": 3.724695920944214,
"metrics/advantage_var": 252.48672485351562,
"regularization/lipschitz_norm": 1010.6306762695312,
"regularization/mmd": 0.1526278257369995,
"regularization/rkhs_norm": 181.6997833251953,
"regularization/w1": 0.8489298224449158,
"rewards/chosen": 0.2972104072570801,
"rewards/margins": 0.23930780887603761,
"rewards/rejected": 0.05790259838104248,
"step": 560
},
{
"epoch": 0.7512953367875648,
"grad_norm": 16.330476760864258,
"kl": 11.252641677856445,
"learning_rate": 8.890780469678738e-07,
"logits/chosen": -35600269.158878505,
"logits/rejected": -37431767.87460815,
"logps/chosen": -473.065031152648,
"logps/rejected": -355.59037029780563,
"loss": 0.5937,
"loss/base_kto": 3.721024751663208,
"metrics/advantage_var": 290.3227233886719,
"regularization/lipschitz_norm": 1040.0142822265625,
"regularization/mmd": 0.15475240349769592,
"regularization/rkhs_norm": 184.2290496826172,
"regularization/w1": 0.8736120462417603,
"rewards/chosen": 0.15429973899389723,
"rewards/margins": 0.2587788680317842,
"rewards/rejected": -0.10447912903788695,
"step": 580
},
{
"epoch": 0.7772020725388601,
"grad_norm": 20.427078247070312,
"kl": 15.229260444641113,
"learning_rate": 8.800187789691269e-07,
"logits/chosen": -36289563.1575663,
"logits/rejected": -38472965.20813771,
"logps/chosen": -490.4938085023401,
"logps/rejected": -356.04279147104853,
"loss": 0.6032,
"loss/base_kto": 3.7195394039154053,
"metrics/advantage_var": 282.6444396972656,
"regularization/lipschitz_norm": 1126.998046875,
"regularization/mmd": 0.15921609103679657,
"regularization/rkhs_norm": 189.54296875,
"regularization/w1": 0.9466783404350281,
"rewards/chosen": 0.28862956459176337,
"rewards/margins": 0.24849377056258723,
"rewards/rejected": 0.04013579402917614,
"step": 600
},
{
"epoch": 0.8031088082901554,
"grad_norm": 20.34117317199707,
"kl": 19.274032592773438,
"learning_rate": 8.706540215409981e-07,
"logits/chosen": -37381039.282843895,
"logits/rejected": -37879128.56872038,
"logps/chosen": -492.3865919629057,
"logps/rejected": -362.41985090837284,
"loss": 0.5929,
"loss/base_kto": 3.7460694313049316,
"metrics/advantage_var": 224.95555114746094,
"regularization/lipschitz_norm": 1014.6459350585938,
"regularization/mmd": 0.14508013427257538,
"regularization/rkhs_norm": 172.7144317626953,
"regularization/w1": 0.8523025512695312,
"rewards/chosen": 0.26577787089753185,
"rewards/margins": 0.20545618356376347,
"rewards/rejected": 0.06032168733376839,
"step": 620
},
{
"epoch": 0.8290155440414507,
"grad_norm": 17.052738189697266,
"kl": 14.50988483428955,
"learning_rate": 8.609913028230462e-07,
"logits/chosen": -35958289.11854103,
"logits/rejected": -37832407.66559485,
"logps/chosen": -465.93669262917933,
"logps/rejected": -376.50015072347264,
"loss": 0.5994,
"loss/base_kto": 3.715284824371338,
"metrics/advantage_var": 262.3467712402344,
"regularization/lipschitz_norm": 1101.0782470703125,
"regularization/mmd": 0.15501636266708374,
"regularization/rkhs_norm": 184.5432891845703,
"regularization/w1": 0.9249057769775391,
"rewards/chosen": 0.2888654807418313,
"rewards/margins": 0.25439598970928917,
"rewards/rejected": 0.03446949103254214,
"step": 640
},
{
"epoch": 0.8549222797927462,
"grad_norm": 23.290475845336914,
"kl": 6.941014289855957,
"learning_rate": 8.510383904798994e-07,
"logits/chosen": -36664129.084745765,
"logits/rejected": -37686718.275752775,
"logps/chosen": -483.48237673343607,
"logps/rejected": -385.3207706022187,
"loss": 0.5941,
"loss/base_kto": 3.712000608444214,
"metrics/advantage_var": 261.04132080078125,
"regularization/lipschitz_norm": 1058.1522216796875,
"regularization/mmd": 0.15186677873134613,
"regularization/rkhs_norm": 180.79376220703125,
"regularization/w1": 0.8888479471206665,
"rewards/chosen": 0.11919425411841535,
"rewards/margins": 0.28848420728674934,
"rewards/rejected": -0.169289953168334,
"step": 660
},
{
"epoch": 0.8808290155440415,
"grad_norm": 19.351591110229492,
"kl": 17.657398223876953,
"learning_rate": 8.408032854569865e-07,
"logits/chosen": -35070033.01265823,
"logits/rejected": -36018748.04938272,
"logps/chosen": -471.8562598892405,
"logps/rejected": -369.0094521604938,
"loss": 0.5909,
"loss/base_kto": 3.7355103492736816,
"metrics/advantage_var": 231.151611328125,
"regularization/lipschitz_norm": 1005.7997436523438,
"regularization/mmd": 0.14701783657073975,
"regularization/rkhs_norm": 175.02122497558594,
"regularization/w1": 0.8448716998100281,
"rewards/chosen": 0.2693678940398784,
"rewards/margins": 0.21084230231910894,
"rewards/rejected": 0.05852559172076943,
"step": 680
},
{
"epoch": 0.9067357512953368,
"grad_norm": 25.170379638671875,
"kl": 19.11185073852539,
"learning_rate": 8.302942155487377e-07,
"logits/chosen": -35493323.03448276,
"logits/rejected": -36408256.19937695,
"logps/chosen": -465.24794278996865,
"logps/rejected": -353.55736468068534,
"loss": 0.5912,
"loss/base_kto": 3.796590566635132,
"metrics/advantage_var": 209.95127868652344,
"regularization/lipschitz_norm": 945.8595581054688,
"regularization/mmd": 0.13836148381233215,
"regularization/rkhs_norm": 164.71604919433594,
"regularization/w1": 0.7945219874382019,
"rewards/chosen": 0.22805635458249657,
"rewards/margins": 0.18373780782386268,
"rewards/rejected": 0.044318546758633906,
"step": 700
},
{
"epoch": 0.9326424870466321,
"grad_norm": 18.53089141845703,
"kl": 7.533125400543213,
"learning_rate": 8.195196287844278e-07,
"logits/chosen": -37032651.99370079,
"logits/rejected": -37255634.75348837,
"logps/chosen": -494.34498031496065,
"logps/rejected": -368.0325096899225,
"loss": 0.603,
"loss/base_kto": 3.770843505859375,
"metrics/advantage_var": 255.7259063720703,
"regularization/lipschitz_norm": 1073.8582763671875,
"regularization/mmd": 0.15092627704143524,
"regularization/rkhs_norm": 179.67413330078125,
"regularization/w1": 0.902040958404541,
"rewards/chosen": 0.064196374848133,
"rewards/margins": 0.20598035676280113,
"rewards/rejected": -0.14178398191466812,
"step": 720
},
{
"epoch": 0.9585492227979274,
"grad_norm": 22.40465545654297,
"kl": 15.472909927368164,
"learning_rate": 8.08488186636975e-07,
"logits/chosen": -35584420.42923795,
"logits/rejected": -37623296.80376766,
"logps/chosen": -475.797433903577,
"logps/rejected": -387.8880003924647,
"loss": 0.5945,
"loss/base_kto": 3.7116806507110596,
"metrics/advantage_var": 265.4413757324219,
"regularization/lipschitz_norm": 1059.0657958984375,
"regularization/mmd": 0.15491236746311188,
"regularization/rkhs_norm": 184.4194793701172,
"regularization/w1": 0.8896151781082153,
"rewards/chosen": 0.22139997467468167,
"rewards/margins": 0.2652009784347156,
"rewards/rejected": -0.04380100376003391,
"step": 740
},
{
"epoch": 0.9844559585492227,
"grad_norm": 15.138018608093262,
"kl": 12.29021167755127,
"learning_rate": 7.972087570601576e-07,
"logits/chosen": -34901480.01292407,
"logits/rejected": -35505169.040847205,
"logps/chosen": -476.82456583198706,
"logps/rejected": -361.4870461422088,
"loss": 0.589,
"loss/base_kto": 3.707359790802002,
"metrics/advantage_var": 245.03794860839844,
"regularization/lipschitz_norm": 1021.0166015625,
"regularization/mmd": 0.14694668352603912,
"regularization/rkhs_norm": 174.9365234375,
"regularization/w1": 0.8576539158821106,
"rewards/chosen": 0.176424510259428,
"rewards/margins": 0.27775879787111957,
"rewards/rejected": -0.10133428761169157,
"step": 760
},
{
"epoch": 1.0103626943005182,
"grad_norm": 21.16314697265625,
"kl": 8.471266746520996,
"learning_rate": 7.856904073598458e-07,
"logits/chosen": -36768361.2488408,
"logits/rejected": -37576100.310618065,
"logps/chosen": -505.9378863987635,
"logps/rejected": -376.27067650554676,
"loss": 0.6012,
"loss/base_kto": 3.5507023334503174,
"metrics/advantage_var": 387.4823913574219,
"regularization/lipschitz_norm": 1284.433349609375,
"regularization/mmd": 0.17976389825344086,
"regularization/rkhs_norm": 214.004638671875,
"regularization/w1": 1.0789238214492798,
"rewards/chosen": 0.18631688962579696,
"rewards/margins": 0.47616607572053743,
"rewards/rejected": -0.2898491860947405,
"step": 780
},
{
"epoch": 1.0362694300518134,
"grad_norm": 22.055309295654297,
"kl": 15.419751167297363,
"learning_rate": 7.739423969049761e-07,
"logits/chosen": -35734688.0,
"logits/rejected": -37085798.4,
"logps/chosen": -477.52314453125,
"logps/rejected": -373.0943359375,
"loss": 0.5918,
"loss/base_kto": 3.3308322429656982,
"metrics/advantage_var": 497.14727783203125,
"regularization/lipschitz_norm": 1427.1160888671875,
"regularization/mmd": 0.2049953043460846,
"regularization/rkhs_norm": 244.0420379638672,
"regularization/w1": 1.1987775564193726,
"rewards/chosen": 0.41237993240356446,
"rewards/margins": 0.717909860610962,
"rewards/rejected": -0.30552992820739744,
"step": 800
},
{
"epoch": 1.0621761658031088,
"grad_norm": 21.182348251342773,
"kl": 19.323965072631836,
"learning_rate": 7.619741696841322e-07,
"logits/chosen": -35165066.8410104,
"logits/rejected": -36809098.754530475,
"logps/chosen": -483.50204309063895,
"logps/rejected": -372.2024557248764,
"loss": 0.6083,
"loss/base_kto": 3.288318634033203,
"metrics/advantage_var": 644.7529296875,
"regularization/lipschitz_norm": 1602.8765869140625,
"regularization/mmd": 0.23192663490772247,
"regularization/rkhs_norm": 276.1031188964844,
"regularization/w1": 1.3464163541793823,
"rewards/chosen": 0.6143584796967868,
"rewards/margins": 0.7772543484915124,
"rewards/rejected": -0.1628958687947256,
"step": 820
},
{
"epoch": 1.0880829015544042,
"grad_norm": 23.51076316833496,
"kl": 17.561798095703125,
"learning_rate": 7.497953467137135e-07,
"logits/chosen": -36646173.164556965,
"logits/rejected": -36900064.39506173,
"logps/chosen": -472.94229628164555,
"logps/rejected": -363.1675829475309,
"loss": 0.6015,
"loss/base_kto": 3.3055858612060547,
"metrics/advantage_var": 532.6900024414062,
"regularization/lipschitz_norm": 1535.5950927734375,
"regularization/mmd": 0.21687713265419006,
"regularization/rkhs_norm": 258.18707275390625,
"regularization/w1": 1.2898999452590942,
"rewards/chosen": 0.6176550659952285,
"rewards/margins": 0.7515917007653745,
"rewards/rejected": -0.1339366347701461,
"step": 840
},
{
"epoch": 1.1139896373056994,
"grad_norm": 16.954561233520508,
"kl": 9.474974632263184,
"learning_rate": 7.37415718303793e-07,
"logits/chosen": -35014985.920972645,
"logits/rejected": -37162784.10289389,
"logps/chosen": -489.72193199088144,
"logps/rejected": -373.8094855305466,
"loss": 0.6223,
"loss/base_kto": 3.3072383403778076,
"metrics/advantage_var": 706.9900512695312,
"regularization/lipschitz_norm": 1706.0087890625,
"regularization/mmd": 0.2378632128238678,
"regularization/rkhs_norm": 283.1705017089844,
"regularization/w1": 1.4330474138259888,
"rewards/chosen": 0.46047593322568386,
"rewards/margins": 0.7952240572287108,
"rewards/rejected": -0.334748124003027,
"step": 860
},
{
"epoch": 1.1398963730569949,
"grad_norm": 19.60972023010254,
"kl": 12.555362701416016,
"learning_rate": 7.248452361878855e-07,
"logits/chosen": -34420921.89538462,
"logits/rejected": -36889746.28571428,
"logps/chosen": -491.0981730769231,
"logps/rejected": -360.1377976190476,
"loss": 0.6029,
"loss/base_kto": 3.2510335445404053,
"metrics/advantage_var": 604.8927612304688,
"regularization/lipschitz_norm": 1595.8828125,
"regularization/mmd": 0.23130464553833008,
"regularization/rkhs_norm": 275.3626708984375,
"regularization/w1": 1.3405417203903198,
"rewards/chosen": 0.5105926044170673,
"rewards/margins": 0.8058155135270004,
"rewards/rejected": -0.29522290910993304,
"step": 880
},
{
"epoch": 1.16580310880829,
"grad_norm": 18.558839797973633,
"kl": 26.411273956298828,
"learning_rate": 7.120940055229497e-07,
"logits/chosen": -35239372.01230769,
"logits/rejected": -37002067.70793651,
"logps/chosen": -487.0657692307692,
"logps/rejected": -355.89489087301587,
"loss": 0.5909,
"loss/base_kto": 3.225663900375366,
"metrics/advantage_var": 574.6051635742188,
"regularization/lipschitz_norm": 1523.2562255859375,
"regularization/mmd": 0.22221890091896057,
"regularization/rkhs_norm": 264.5462951660156,
"regularization/w1": 1.2795352935791016,
"rewards/chosen": 0.6853428297776443,
"rewards/margins": 0.7736441341861264,
"rewards/rejected": -0.08830130440848215,
"step": 900
},
{
"epoch": 1.1917098445595855,
"grad_norm": 20.727832794189453,
"kl": 20.686328887939453,
"learning_rate": 6.991722767660556e-07,
"logits/chosen": -35798360.663414635,
"logits/rejected": -38131006.74887218,
"logps/chosen": -473.8318089430894,
"logps/rejected": -394.09807330827067,
"loss": 0.6001,
"loss/base_kto": 3.263370990753174,
"metrics/advantage_var": 560.9389038085938,
"regularization/lipschitz_norm": 1569.9447021484375,
"regularization/mmd": 0.21853144466876984,
"regularization/rkhs_norm": 260.156494140625,
"regularization/w1": 1.3187536001205444,
"rewards/chosen": 0.47452739932672766,
"rewards/margins": 0.7901420738303695,
"rewards/rejected": -0.3156146745036419,
"step": 920
},
{
"epoch": 1.2176165803108807,
"grad_norm": 15.329206466674805,
"kl": 8.2859468460083,
"learning_rate": 6.860904374342499e-07,
"logits/chosen": -35388444.96505824,
"logits/rejected": -36061470.53902798,
"logps/chosen": -492.9282445923461,
"logps/rejected": -387.2229381443299,
"loss": 0.6058,
"loss/base_kto": 3.2901668548583984,
"metrics/advantage_var": 576.5140991210938,
"regularization/lipschitz_norm": 1589.8365478515625,
"regularization/mmd": 0.22090554237365723,
"regularization/rkhs_norm": 262.9828186035156,
"regularization/w1": 1.3354628086090088,
"rewards/chosen": 0.3080719044918625,
"rewards/margins": 0.7662068660765688,
"rewards/rejected": -0.45813496158470635,
"step": 940
},
{
"epoch": 1.2435233160621761,
"grad_norm": 18.086589813232422,
"kl": 4.244732856750488,
"learning_rate": 6.7285900375424e-07,
"logits/chosen": -35996707.42138365,
"logits/rejected": -37513546.73291925,
"logps/chosen": -498.3534787735849,
"logps/rejected": -371.3962296195652,
"loss": 0.6034,
"loss/base_kto": 3.308680295944214,
"metrics/advantage_var": 571.4664916992188,
"regularization/lipschitz_norm": 1542.1009521484375,
"regularization/mmd": 0.22286613285541534,
"regularization/rkhs_norm": 265.31683349609375,
"regularization/w1": 1.2953647375106812,
"rewards/chosen": 0.11151643669080434,
"rewards/margins": 0.7771609224487624,
"rewards/rejected": -0.6656444857579581,
"step": 960
},
{
"epoch": 1.2694300518134716,
"grad_norm": 16.93316078186035,
"kl": 6.464847087860107,
"learning_rate": 6.594886122086123e-07,
"logits/chosen": -35316583.064935066,
"logits/rejected": -37417431.90361446,
"logps/chosen": -503.64960430194805,
"logps/rejected": -404.2452936746988,
"loss": 0.6098,
"loss/base_kto": 3.281092882156372,
"metrics/advantage_var": 610.0521850585938,
"regularization/lipschitz_norm": 1625.29296875,
"regularization/mmd": 0.23171770572662354,
"regularization/rkhs_norm": 275.8544006347656,
"regularization/w1": 1.3652461767196655,
"rewards/chosen": 0.2481203946200284,
"rewards/margins": 0.7917356209060318,
"rewards/rejected": -0.5436152262860033,
"step": 980
},
{
"epoch": 1.2953367875647668,
"grad_norm": 22.382692337036133,
"kl": 7.046362400054932,
"learning_rate": 6.459900109853766e-07,
"logits/chosen": -35062903.36196319,
"logits/rejected": -35767406.87898089,
"logps/chosen": -481.2234470858896,
"logps/rejected": -384.96775477707007,
"loss": 0.6062,
"loss/base_kto": 3.2337722778320312,
"metrics/advantage_var": 634.6586303710938,
"regularization/lipschitz_norm": 1645.6080322265625,
"regularization/mmd": 0.233300119638443,
"regularization/rkhs_norm": 277.7382507324219,
"regularization/w1": 1.3823107481002808,
"rewards/chosen": 0.42465172516056365,
"rewards/margins": 0.8859964501680277,
"rewards/rejected": -0.46134472500746415,
"step": 1000
},
{
"epoch": 1.3212435233160622,
"grad_norm": 17.184362411499023,
"kl": 13.68155574798584,
"learning_rate": 6.323740513377171e-07,
"logits/chosen": -35164749.57575758,
"logits/rejected": -37453421.006451614,
"logps/chosen": -491.7760416666667,
"logps/rejected": -361.9875252016129,
"loss": 0.6174,
"loss/base_kto": 3.2585244178771973,
"metrics/advantage_var": 661.8715209960938,
"regularization/lipschitz_norm": 1715.8726806640625,
"regularization/mmd": 0.23919086158275604,
"regularization/rkhs_norm": 284.7510681152344,
"regularization/w1": 1.4413330554962158,
"rewards/chosen": 0.5577228892933238,
"rewards/margins": 0.7887860921820586,
"rewards/rejected": -0.2310632028887349,
"step": 1020
},
{
"epoch": 1.3471502590673574,
"grad_norm": 18.59825897216797,
"kl": 16.316736221313477,
"learning_rate": 6.186516788608865e-07,
"logits/chosen": -35512621.643410854,
"logits/rejected": -37523468.9007874,
"logps/chosen": -490.4732558139535,
"logps/rejected": -368.9190452755906,
"loss": 0.6067,
"loss/base_kto": 3.2406487464904785,
"metrics/advantage_var": 648.6552124023438,
"regularization/lipschitz_norm": 1643.1043701171875,
"regularization/mmd": 0.2323632687330246,
"regularization/rkhs_norm": 276.6229553222656,
"regularization/w1": 1.3802077770233154,
"rewards/chosen": 0.5867794539577277,
"rewards/margins": 0.8252295839097454,
"rewards/rejected": -0.23845012995201773,
"step": 1040
},
{
"epoch": 1.3730569948186528,
"grad_norm": 18.296396255493164,
"kl": 10.483955383300781,
"learning_rate": 6.048339246932652e-07,
"logits/chosen": -35389220.340694,
"logits/rejected": -37441843.51702786,
"logps/chosen": -491.8681979495268,
"logps/rejected": -354.929445626935,
"loss": 0.6143,
"loss/base_kto": 3.3042850494384766,
"metrics/advantage_var": 997.9747924804688,
"regularization/lipschitz_norm": 1640.1961669921875,
"regularization/mmd": 0.2319926768541336,
"regularization/rkhs_norm": 276.1817626953125,
"regularization/w1": 1.3777645826339722,
"rewards/chosen": 0.3760328804280856,
"rewards/margins": 0.79358496628093,
"rewards/rejected": -0.4175520858528444,
"step": 1060
},
{
"epoch": 1.3989637305699483,
"grad_norm": 16.5646915435791,
"kl": 11.669934272766113,
"learning_rate": 5.909318966486494e-07,
"logits/chosen": -34477041.532182105,
"logits/rejected": -35190468.678071536,
"logps/chosen": -471.4804258241758,
"logps/rejected": -392.06118779160187,
"loss": 0.6037,
"loss/base_kto": 3.3053252696990967,
"metrics/advantage_var": 582.5371704101562,
"regularization/lipschitz_norm": 1547.6551513671875,
"regularization/mmd": 0.22402773797512054,
"regularization/rkhs_norm": 266.6996765136719,
"regularization/w1": 1.30003023147583,
"rewards/chosen": 0.42099458942982243,
"rewards/margins": 0.7436737679554712,
"rewards/rejected": -0.3226791785256488,
"step": 1080
},
{
"epoch": 1.4248704663212435,
"grad_norm": 16.393640518188477,
"kl": 11.862051963806152,
"learning_rate": 5.769567702869052e-07,
"logits/chosen": -36113415.74583964,
"logits/rejected": -36087123.127625205,
"logps/chosen": -470.0517681543117,
"logps/rejected": -365.0215569466882,
"loss": 0.5972,
"loss/base_kto": 3.2723305225372314,
"metrics/advantage_var": 585.9185791015625,
"regularization/lipschitz_norm": 1528.84375,
"regularization/mmd": 0.22064733505249023,
"regularization/rkhs_norm": 262.6754150390625,
"regularization/w1": 1.2842286825180054,
"rewards/chosen": 0.4480481400251749,
"rewards/margins": 0.7883315107749982,
"rewards/rejected": -0.3402833707498233,
"step": 1100
},
{
"epoch": 1.450777202072539,
"grad_norm": 24.36058235168457,
"kl": 15.893205642700195,
"learning_rate": 5.629197799301614e-07,
"logits/chosen": -36033401.30586371,
"logits/rejected": -37735154.19414484,
"logps/chosen": -477.97414817749603,
"logps/rejected": -400.28016660246533,
"loss": 0.6088,
"loss/base_kto": 3.276933431625366,
"metrics/advantage_var": 584.4525146484375,
"regularization/lipschitz_norm": 1632.7537841796875,
"regularization/mmd": 0.2217748612165451,
"regularization/rkhs_norm": 264.0176696777344,
"regularization/w1": 1.3715132474899292,
"rewards/chosen": 0.47072846764807846,
"rewards/margins": 0.7900672500070562,
"rewards/rejected": -0.3193387823589778,
"step": 1120
},
{
"epoch": 1.4766839378238341,
"grad_norm": 17.702255249023438,
"kl": 12.50069522857666,
"learning_rate": 5.488322096317633e-07,
"logits/chosen": -36280888.529968455,
"logits/rejected": -36241547.49226006,
"logps/chosen": -474.06259858044166,
"logps/rejected": -380.24934694272446,
"loss": 0.5988,
"loss/base_kto": 3.3043906688690186,
"metrics/advantage_var": 585.9420166015625,
"regularization/lipschitz_norm": 1509.2894287109375,
"regularization/mmd": 0.21785235404968262,
"regularization/rkhs_norm": 259.3480224609375,
"regularization/w1": 1.2678030729293823,
"rewards/chosen": 0.41566688706070093,
"rewards/margins": 0.7549185913209926,
"rewards/rejected": -0.3392517042602917,
"step": 1140
},
{
"epoch": 1.5025906735751295,
"grad_norm": 16.96848487854004,
"kl": 13.61374568939209,
"learning_rate": 5.347053841052518e-07,
"logits/chosen": -34639646.91021672,
"logits/rejected": -36730149.95583596,
"logps/chosen": -505.5739164086687,
"logps/rejected": -360.9603213722398,
"loss": 0.6069,
"loss/base_kto": 3.2965340614318848,
"metrics/advantage_var": 588.7193603515625,
"regularization/lipschitz_norm": 1588.00439453125,
"regularization/mmd": 0.22466149926185608,
"regularization/rkhs_norm": 267.4541931152344,
"regularization/w1": 1.3339236974716187,
"rewards/chosen": 0.5111178466041022,
"rewards/margins": 0.7775391435992471,
"rewards/rejected": -0.26642129699514494,
"step": 1160
},
{
"epoch": 1.528497409326425,
"grad_norm": 19.33449363708496,
"kl": 9.589579582214355,
"learning_rate": 5.205506596206531e-07,
"logits/chosen": -36402548.36363637,
"logits/rejected": -36827897.8313253,
"logps/chosen": -492.31929788961037,
"logps/rejected": -393.4038968373494,
"loss": 0.6016,
"loss/base_kto": 3.3590850830078125,
"metrics/advantage_var": 501.6669006347656,
"regularization/lipschitz_norm": 1483.150634765625,
"regularization/mmd": 0.2078084498643875,
"regularization/rkhs_norm": 247.3909912109375,
"regularization/w1": 1.2458465099334717,
"rewards/chosen": 0.30930903050806613,
"rewards/margins": 0.6699329991609981,
"rewards/rejected": -0.36062396865293206,
"step": 1180
},
{
"epoch": 1.5544041450777202,
"grad_norm": 22.132320404052734,
"kl": 6.338320255279541,
"learning_rate": 5.063794148754032e-07,
"logits/chosen": -34132691.80456026,
"logits/rejected": -35852700.06006006,
"logps/chosen": -499.4040105863192,
"logps/rejected": -364.59030123873873,
"loss": 0.6197,
"loss/base_kto": 3.3146088123321533,
"metrics/advantage_var": 652.7297973632812,
"regularization/lipschitz_norm": 1676.2603759765625,
"regularization/mmd": 0.2351187914609909,
"regularization/rkhs_norm": 279.9033203125,
"regularization/w1": 1.408058762550354,
"rewards/chosen": 0.26928715907789597,
"rewards/margins": 0.7494250270484055,
"rewards/rejected": -0.48013786797050956,
"step": 1200
},
{
"epoch": 1.5803108808290154,
"grad_norm": 16.299654006958008,
"kl": 12.651652336120605,
"learning_rate": 4.922030418472422e-07,
"logits/chosen": -36233286.73155416,
"logits/rejected": -37188049.02021773,
"logps/chosen": -471.9628630298273,
"logps/rejected": -384.18895800933126,
"loss": 0.6139,
"loss/base_kto": 3.2932794094085693,
"metrics/advantage_var": 688.4408569335938,
"regularization/lipschitz_norm": 1650.3853759765625,
"regularization/mmd": 0.23184834420681,
"regularization/rkhs_norm": 276.00994873046875,
"regularization/w1": 1.3863238096237183,
"rewards/chosen": 0.39228669889680634,
"rewards/margins": 0.7795268580932002,
"rewards/rejected": -0.3872401591963939,
"step": 1220
},
{
"epoch": 1.6062176165803108,
"grad_norm": 44.51784133911133,
"kl": 13.391955375671387,
"learning_rate": 4.780329366364336e-07,
"logits/chosen": -35239157.08852459,
"logits/rejected": -35575279.1880597,
"logps/chosen": -452.127612704918,
"logps/rejected": -357.58348880597015,
"loss": 0.6004,
"loss/base_kto": 3.3176803588867188,
"metrics/advantage_var": 589.2693481445312,
"regularization/lipschitz_norm": 1512.4068603515625,
"regularization/mmd": 0.21480341255664825,
"regularization/rkhs_norm": 255.7183380126953,
"regularization/w1": 1.2704216241836548,
"rewards/chosen": 0.40861958988377306,
"rewards/margins": 0.7385907667144633,
"rewards/rejected": -0.32997117683069027,
"step": 1240
},
{
"epoch": 1.6321243523316062,
"grad_norm": 20.914186477661133,
"kl": 11.465471267700195,
"learning_rate": 4.638804903046684e-07,
"logits/chosen": -34505523.2,
"logits/rejected": -35888621.53442623,
"logps/chosen": -479.03083022388057,
"logps/rejected": -385.7593237704918,
"loss": 0.6158,
"loss/base_kto": 3.3036301136016846,
"metrics/advantage_var": 703.3262329101562,
"regularization/lipschitz_norm": 1652.409423828125,
"regularization/mmd": 0.23511762917041779,
"regularization/rkhs_norm": 279.90191650390625,
"regularization/w1": 1.3880237340927124,
"rewards/chosen": 0.40965526068388525,
"rewards/margins": 0.7906724015570281,
"rewards/rejected": -0.3810171408731429,
"step": 1260
},
{
"epoch": 1.6580310880829017,
"grad_norm": 13.190994262695312,
"kl": 15.52795696258545,
"learning_rate": 4.497570797180217e-07,
"logits/chosen": -34810823.380726695,
"logits/rejected": -34491035.89489954,
"logps/chosen": -447.5599328593997,
"logps/rejected": -352.66219088098916,
"loss": 0.5864,
"loss/base_kto": 3.3103187084198,
"metrics/advantage_var": 468.60986328125,
"regularization/lipschitz_norm": 1403.2650146484375,
"regularization/mmd": 0.20243404805660248,
"regularization/rkhs_norm": 240.992919921875,
"regularization/w1": 1.1787426471710205,
"rewards/chosen": 0.4755921567220823,
"rewards/margins": 0.7135132096813535,
"rewards/rejected": -0.23792105295927116,
"step": 1280
},
{
"epoch": 1.6839378238341969,
"grad_norm": 18.810701370239258,
"kl": 8.278688430786133,
"learning_rate": 4.3567405840131853e-07,
"logits/chosen": -33646653.37539432,
"logits/rejected": -34206368.099071205,
"logps/chosen": -463.76744873817034,
"logps/rejected": -351.63332043343655,
"loss": 0.5884,
"loss/base_kto": 3.3078229427337646,
"metrics/advantage_var": 510.38311767578125,
"regularization/lipschitz_norm": 1417.2998046875,
"regularization/mmd": 0.2088085263967514,
"regularization/rkhs_norm": 248.58154296875,
"regularization/w1": 1.1905317306518555,
"rewards/chosen": 0.3218991252526124,
"rewards/margins": 0.7713713695625486,
"rewards/rejected": -0.44947224430993615,
"step": 1300
},
{
"epoch": 1.709844559585492,
"grad_norm": 22.24349594116211,
"kl": 10.411376953125,
"learning_rate": 4.2164274741126506e-07,
"logits/chosen": -34501101.89067524,
"logits/rejected": -35971193.38601824,
"logps/chosen": -484.10515474276525,
"logps/rejected": -387.59002184650456,
"loss": 0.6128,
"loss/base_kto": 3.345282793045044,
"metrics/advantage_var": 638.2291870117188,
"regularization/lipschitz_norm": 1584.5711669921875,
"regularization/mmd": 0.22631387412548065,
"regularization/rkhs_norm": 269.4212341308594,
"regularization/w1": 1.3310397863388062,
"rewards/chosen": 0.28280440940734275,
"rewards/margins": 0.7016143871155969,
"rewards/rejected": -0.4188099777082542,
"step": 1320
},
{
"epoch": 1.7357512953367875,
"grad_norm": 21.045574188232422,
"kl": 7.60487699508667,
"learning_rate": 4.0767442623567856e-07,
"logits/chosen": -35705996.12631579,
"logits/rejected": -36351933.398373984,
"logps/chosen": -497.48336466165415,
"logps/rejected": -380.29024390243904,
"loss": 0.6088,
"loss/base_kto": 3.3214504718780518,
"metrics/advantage_var": 566.5302124023438,
"regularization/lipschitz_norm": 1581.8089599609375,
"regularization/mmd": 0.22012145817279816,
"regularization/rkhs_norm": 262.0493469238281,
"regularization/w1": 1.3287194967269897,
"rewards/chosen": 0.3303822223405193,
"rewards/margins": 0.7355862385530447,
"rewards/rejected": -0.4052040162125254,
"step": 1340
},
{
"epoch": 1.761658031088083,
"grad_norm": 18.777828216552734,
"kl": 11.791571617126465,
"learning_rate": 3.937803237261357e-07,
"logits/chosen": -36184366.36834095,
"logits/rejected": -36301026.82504013,
"logps/chosen": -507.67489535768647,
"logps/rejected": -377.63678772070625,
"loss": 0.6161,
"loss/base_kto": 3.284566640853882,
"metrics/advantage_var": 640.5042114257812,
"regularization/lipschitz_norm": 1674.8494873046875,
"regularization/mmd": 0.2372153103351593,
"regularization/rkhs_norm": 282.399169921875,
"regularization/w1": 1.4068735837936401,
"rewards/chosen": 0.508470602050038,
"rewards/margins": 0.8046677003426995,
"rewards/rejected": -0.2961970982926615,
"step": 1360
},
{
"epoch": 1.7875647668393784,
"grad_norm": 19.283151626586914,
"kl": 18.055999755859375,
"learning_rate": 3.7997160907132456e-07,
"logits/chosen": -34655321.6,
"logits/rejected": -35655072.0,
"logps/chosen": -469.5294921875,
"logps/rejected": -372.74853515625,
"loss": 0.6006,
"loss/base_kto": 3.224091053009033,
"metrics/advantage_var": 673.1791381835938,
"regularization/lipschitz_norm": 1609.304931640625,
"regularization/mmd": 0.2292405217885971,
"regularization/rkhs_norm": 272.9053649902344,
"regularization/w1": 1.351816177368164,
"rewards/chosen": 0.5865845680236816,
"rewards/margins": 0.8517509937286377,
"rewards/rejected": -0.2651664257049561,
"step": 1380
},
{
"epoch": 1.8134715025906736,
"grad_norm": 22.157848358154297,
"kl": 11.102137565612793,
"learning_rate": 3.662593828183601e-07,
"logits/chosen": -34884863.59300477,
"logits/rejected": -37201325.41935484,
"logps/chosen": -467.00720389507154,
"logps/rejected": -380.5667242703533,
"loss": 0.6033,
"loss/base_kto": 3.2924256324768066,
"metrics/advantage_var": 559.1273803710938,
"regularization/lipschitz_norm": 1563.8865966796875,
"regularization/mmd": 0.22006188333034515,
"regularization/rkhs_norm": 261.9784240722656,
"regularization/w1": 1.3136646747589111,
"rewards/chosen": 0.4102853553662808,
"rewards/margins": 0.7663093752785552,
"rewards/rejected": -0.3560240199122744,
"step": 1400
},
{
"epoch": 1.8393782383419688,
"grad_norm": 14.351923942565918,
"kl": 11.672685623168945,
"learning_rate": 3.5265466794927725e-07,
"logits/chosen": -36341127.668202765,
"logits/rejected": -36579481.03020668,
"logps/chosen": -475.1455453149002,
"logps/rejected": -389.1591563990461,
"loss": 0.5964,
"loss/base_kto": 3.276104688644409,
"metrics/advantage_var": 569.2327270507812,
"regularization/lipschitz_norm": 1519.04541015625,
"regularization/mmd": 0.21897660195827484,
"regularization/rkhs_norm": 260.6864318847656,
"regularization/w1": 1.2759981155395508,
"rewards/chosen": 0.3892057216661866,
"rewards/margins": 0.7845919490298094,
"rewards/rejected": -0.39538622736362283,
"step": 1420
},
{
"epoch": 1.8652849740932642,
"grad_norm": 19.687963485717773,
"kl": 12.144535064697266,
"learning_rate": 3.3916840101987887e-07,
"logits/chosen": -36057032.2944,
"logits/rejected": -36286920.50076336,
"logps/chosen": -458.18145,
"logps/rejected": -379.506822519084,
"loss": 0.6089,
"loss/base_kto": 3.319847822189331,
"metrics/advantage_var": 591.9601440429688,
"regularization/lipschitz_norm": 1581.4017333984375,
"regularization/mmd": 0.22268171608448029,
"regularization/rkhs_norm": 265.0972900390625,
"regularization/w1": 1.328377604484558,
"rewards/chosen": 0.475669580078125,
"rewards/margins": 0.7342384268025406,
"rewards/rejected": -0.25856884672441555,
"step": 1440
},
{
"epoch": 1.8911917098445596,
"grad_norm": 18.162639617919922,
"kl": 11.866816520690918,
"learning_rate": 3.258114233680583e-07,
"logits/chosen": -34904569.51898734,
"logits/rejected": -36339098.86419753,
"logps/chosen": -484.76839398734177,
"logps/rejected": -379.5061246141975,
"loss": 0.6085,
"loss/base_kto": 3.325211763381958,
"metrics/advantage_var": 568.21826171875,
"regularization/lipschitz_norm": 1576.9481201171875,
"regularization/mmd": 0.21834976971149445,
"regularization/rkhs_norm": 259.940185546875,
"regularization/w1": 1.3246363401412964,
"rewards/chosen": 0.3653219681751879,
"rewards/margins": 0.7204056221314716,
"rewards/rejected": -0.3550836539562838,
"step": 1460
},
{
"epoch": 1.917098445595855,
"grad_norm": 20.01506805419922,
"kl": 10.111944198608398,
"learning_rate": 3.1259447239866796e-07,
"logits/chosen": -36305180.35569423,
"logits/rejected": -36879473.777777776,
"logps/chosen": -502.6751170046802,
"logps/rejected": -381.50376564945225,
"loss": 0.6001,
"loss/base_kto": 3.3790245056152344,
"metrics/advantage_var": 536.5336303710938,
"regularization/lipschitz_norm": 1439.1107177734375,
"regularization/mmd": 0.2128646820783615,
"regularization/rkhs_norm": 253.4103546142578,
"regularization/w1": 1.208853006362915,
"rewards/chosen": 0.3070826299848869,
"rewards/margins": 0.6483717860912298,
"rewards/rejected": -0.3412891561063429,
"step": 1480
},
{
"epoch": 1.9430051813471503,
"grad_norm": 20.250463485717773,
"kl": 15.722281455993652,
"learning_rate": 2.9952817295193435e-07,
"logits/chosen": -35885568.791344665,
"logits/rejected": -37519541.18167456,
"logps/chosen": -484.65880989180835,
"logps/rejected": -369.67797195892575,
"loss": 0.5997,
"loss/base_kto": 3.26762318611145,
"metrics/advantage_var": 602.1591186523438,
"regularization/lipschitz_norm": 1554.7772216796875,
"regularization/mmd": 0.2241850346326828,
"regularization/rkhs_norm": 266.886962890625,
"regularization/w1": 1.3060129880905151,
"rewards/chosen": 0.509227157191847,
"rewards/margins": 0.7842198484006246,
"rewards/rejected": -0.2749926912087777,
"step": 1500
},
{
"epoch": 1.9689119170984455,
"grad_norm": 23.537412643432617,
"kl": 11.714210510253906,
"learning_rate": 2.866230287623651e-07,
"logits/chosen": -34093458.625387,
"logits/rejected": -35905865.48895899,
"logps/chosen": -478.8110487616099,
"logps/rejected": -390.30574723974763,
"loss": 0.604,
"loss/base_kto": 3.288358688354492,
"metrics/advantage_var": 583.552490234375,
"regularization/lipschitz_norm": 1569.8572998046875,
"regularization/mmd": 0.22495689988136292,
"regularization/rkhs_norm": 267.80584716796875,
"regularization/w1": 1.3186801671981812,
"rewards/chosen": 0.42627883769410313,
"rewards/margins": 0.7726709186810166,
"rewards/rejected": -0.34639208098691343,
"step": 1520
},
{
"epoch": 1.994818652849741,
"grad_norm": 16.75432586669922,
"kl": 16.132680892944336,
"learning_rate": 2.738894140150075e-07,
"logits/chosen": -34810250.79518072,
"logits/rejected": -35387857.45454545,
"logps/chosen": -460.7179028614458,
"logps/rejected": -382.6583806818182,
"loss": 0.6052,
"loss/base_kto": 3.27227783203125,
"metrics/advantage_var": 629.4932861328125,
"regularization/lipschitz_norm": 1595.4559326171875,
"regularization/mmd": 0.22874267399311066,
"regularization/rkhs_norm": 272.3127136230469,
"regularization/w1": 1.340182900428772,
"rewards/chosen": 0.558391800845962,
"rewards/margins": 0.7949300562154704,
"rewards/rejected": -0.23653825536950843,
"step": 1540
},
{
"epoch": 2.0207253886010363,
"grad_norm": 15.81540298461914,
"kl": 18.353281021118164,
"learning_rate": 2.6133756500585156e-07,
"logits/chosen": -34858116.592823714,
"logits/rejected": -36104593.88383046,
"logps/chosen": -486.6072542901716,
"logps/rejected": -363.5568337912088,
"loss": 0.5642,
"loss/base_kto": 3.2032318115234375,
"metrics/advantage_var": 473.7855529785156,
"regularization/lipschitz_norm": 1320.1123046875,
"regularization/mmd": 0.2014244794845581,
"regularization/rkhs_norm": 239.7910614013672,
"regularization/w1": 1.1088943481445312,
"rewards/chosen": 0.5943025538404348,
"rewards/margins": 0.8520283158887938,
"rewards/rejected": -0.257725762048359,
"step": 1560
},
{
"epoch": 2.0466321243523318,
"grad_norm": 23.31838035583496,
"kl": 17.869924545288086,
"learning_rate": 2.489775719130767e-07,
"logits/chosen": -35392044.8,
"logits/rejected": -35940294.4,
"logps/chosen": -467.74482421875,
"logps/rejected": -394.97333984375,
"loss": 0.5584,
"loss/base_kto": 3.1466071605682373,
"metrics/advantage_var": 457.1605529785156,
"regularization/lipschitz_norm": 1330.1446533203125,
"regularization/mmd": 0.20303292572498322,
"regularization/rkhs_norm": 241.7058563232422,
"regularization/w1": 1.117321491241455,
"rewards/chosen": 0.6299750804901123,
"rewards/margins": 0.9154489040374756,
"rewards/rejected": -0.2854738235473633,
"step": 1580
},
{
"epoch": 2.0725388601036268,
"grad_norm": 15.353105545043945,
"kl": 16.537668228149414,
"learning_rate": 2.3681937068576303e-07,
"logits/chosen": -34650498.044728436,
"logits/rejected": -36549118.434250765,
"logps/chosen": -480.5283546325879,
"logps/rejected": -389.059250764526,
"loss": 0.5647,
"loss/base_kto": 3.1026206016540527,
"metrics/advantage_var": 481.5225524902344,
"regularization/lipschitz_norm": 1437.871826171875,
"regularization/mmd": 0.2070702612400055,
"regularization/rkhs_norm": 246.51220703125,
"regularization/w1": 1.2078123092651367,
"rewards/chosen": 0.6099318239254693,
"rewards/margins": 0.9424979714759997,
"rewards/rejected": -0.3325661475505304,
"step": 1600
},
{
"epoch": 2.098445595854922,
"grad_norm": 15.787094116210938,
"kl": 11.99986457824707,
"learning_rate": 2.2487273505658e-07,
"logits/chosen": -35630467.854199685,
"logits/rejected": -36641616.86286595,
"logps/chosen": -498.2772385103011,
"logps/rejected": -386.6381452234206,
"loss": 0.5518,
"loss/base_kto": 3.1225905418395996,
"metrics/advantage_var": 429.5301818847656,
"regularization/lipschitz_norm": 1302.1112060546875,
"regularization/mmd": 0.19768790900707245,
"regularization/rkhs_norm": 235.3427734375,
"regularization/w1": 1.0937732458114624,
"rewards/chosen": 0.5404235549660756,
"rewards/margins": 0.9109540228884803,
"rewards/rejected": -0.3705304679224047,
"step": 1620
},
{
"epoch": 2.1243523316062176,
"grad_norm": 17.42823028564453,
"kl": 12.829408645629883,
"learning_rate": 2.131472686848817e-07,
"logits/chosen": -35645303.87915408,
"logits/rejected": -35891849.52750809,
"logps/chosen": -506.03148602719034,
"logps/rejected": -363.08902204692555,
"loss": 0.5657,
"loss/base_kto": 3.1499183177948,
"metrics/advantage_var": 435.5330505371094,
"regularization/lipschitz_norm": 1397.0950927734375,
"regularization/mmd": 0.20213496685028076,
"regularization/rkhs_norm": 240.63687133789062,
"regularization/w1": 1.1735600233078003,
"rewards/chosen": 0.5417508128186367,
"rewards/margins": 0.8809311264721813,
"rewards/rejected": -0.3391803136535447,
"step": 1640
},
{
"epoch": 2.150259067357513,
"grad_norm": 17.52867317199707,
"kl": 12.546600341796875,
"learning_rate": 2.016523974365188e-07,
"logits/chosen": -34529618.69551777,
"logits/rejected": -36097685.63665087,
"logps/chosen": -459.1051970633694,
"logps/rejected": -394.8283224723539,
"loss": 0.5578,
"loss/base_kto": 3.1983869075775146,
"metrics/advantage_var": 428.510986328125,
"regularization/lipschitz_norm": 1275.103515625,
"regularization/mmd": 0.19291190803050995,
"regularization/rkhs_norm": 229.6570281982422,
"regularization/w1": 1.0710868835449219,
"rewards/chosen": 0.4623830992803323,
"rewards/margins": 0.8338102767215843,
"rewards/rejected": -0.371427177441252,
"step": 1660
},
{
"epoch": 2.1761658031088085,
"grad_norm": 17.517013549804688,
"kl": 10.600077629089355,
"learning_rate": 1.9039736180657372e-07,
"logits/chosen": -35959843.73899848,
"logits/rejected": -37364665.09500805,
"logps/chosen": -481.2719081942337,
"logps/rejected": -378.451690821256,
"loss": 0.5554,
"loss/base_kto": 3.168569326400757,
"metrics/advantage_var": 399.3152770996094,
"regularization/lipschitz_norm": 1290.1065673828125,
"regularization/mmd": 0.1907900720834732,
"regularization/rkhs_norm": 227.1310272216797,
"regularization/w1": 1.083689570426941,
"rewards/chosen": 0.5179774005062121,
"rewards/margins": 0.8654425102161682,
"rewards/rejected": -0.3474651097099562,
"step": 1680
},
{
"epoch": 2.2020725388601035,
"grad_norm": 13.103388786315918,
"kl": 14.62479305267334,
"learning_rate": 1.7939120949111498e-07,
"logits/chosen": -34354505.37579618,
"logits/rejected": -36316967.26380368,
"logps/chosen": -488.8059315286624,
"logps/rejected": -359.2887030291411,
"loss": 0.5556,
"loss/base_kto": 3.127932071685791,
"metrics/advantage_var": 474.88775634765625,
"regularization/lipschitz_norm": 1326.002197265625,
"regularization/mmd": 0.20276470482349396,
"regularization/rkhs_norm": 241.3865509033203,
"regularization/w1": 1.1138417720794678,
"rewards/chosen": 0.6052237346673467,
"rewards/margins": 0.9245219230465525,
"rewards/rejected": -0.3192981883792058,
"step": 1700
},
{
"epoch": 2.227979274611399,
"grad_norm": 15.394598007202148,
"kl": 15.183280944824219,
"learning_rate": 1.6864278811393523e-07,
"logits/chosen": -35081658.469135806,
"logits/rejected": -35936631.898734175,
"logps/chosen": -516.3537808641976,
"logps/rejected": -385.87109375,
"loss": 0.566,
"loss/base_kto": 3.2061848640441895,
"metrics/advantage_var": 435.765625,
"regularization/lipschitz_norm": 1339.9744873046875,
"regularization/mmd": 0.1965966820716858,
"regularization/rkhs_norm": 234.04368591308594,
"regularization/w1": 1.12557852268219,
"rewards/chosen": 0.5497140766661844,
"rewards/margins": 0.8262719024548514,
"rewards/rejected": -0.27655782578866694,
"step": 1720
},
{
"epoch": 2.2538860103626943,
"grad_norm": 12.620918273925781,
"kl": 15.69377613067627,
"learning_rate": 1.5816073811412584e-07,
"logits/chosen": -34665299.48686244,
"logits/rejected": -35775589.91469194,
"logps/chosen": -472.3660162287481,
"logps/rejected": -372.7952705371248,
"loss": 0.5546,
"loss/base_kto": 3.1846084594726562,
"metrics/advantage_var": 419.4860534667969,
"regularization/lipschitz_norm": 1267.2525634765625,
"regularization/mmd": 0.18780146539211273,
"regularization/rkhs_norm": 223.5731658935547,
"regularization/w1": 1.064492106437683,
"rewards/chosen": 0.5874555490484931,
"rewards/margins": 0.8701356326502654,
"rewards/rejected": -0.2826800836017723,
"step": 1740
},
{
"epoch": 2.2797927461139897,
"grad_norm": 19.633522033691406,
"kl": 15.535196304321289,
"learning_rate": 1.4795348580020207e-07,
"logits/chosen": -35362592.05071315,
"logits/rejected": -37352572.64714946,
"logps/chosen": -475.3940174326466,
"logps/rejected": -369.34220916795067,
"loss": 0.5589,
"loss/base_kto": 3.159749984741211,
"metrics/advantage_var": 427.1222229003906,
"regularization/lipschitz_norm": 1331.1728515625,
"regularization/mmd": 0.19346921145915985,
"regularization/rkhs_norm": 230.3205108642578,
"regularization/w1": 1.11818528175354,
"rewards/chosen": 0.5518771744378962,
"rewards/margins": 0.8688022467772525,
"rewards/rejected": -0.31692507233935624,
"step": 1760
},
{
"epoch": 2.305699481865285,
"grad_norm": 14.753633499145508,
"kl": 14.17564868927002,
"learning_rate": 1.3802923657636355e-07,
"logits/chosen": -34159447.2822186,
"logits/rejected": -36124054.83658171,
"logps/chosen": -472.7627956769984,
"logps/rejected": -363.40498500749624,
"loss": 0.5536,
"loss/base_kto": 3.173689603805542,
"metrics/advantage_var": 383.81085205078125,
"regularization/lipschitz_norm": 1270.6494140625,
"regularization/mmd": 0.18757760524749756,
"regularization/rkhs_norm": 223.3066864013672,
"regularization/w1": 1.0673454999923706,
"rewards/chosen": 0.502840175908697,
"rewards/margins": 0.8254180684809655,
"rewards/rejected": -0.32257789257226854,
"step": 1780
},
{
"epoch": 2.33160621761658,
"grad_norm": 18.07467269897461,
"kl": 13.253885269165039,
"learning_rate": 1.28395968346336e-07,
"logits/chosen": -34877716.06269593,
"logits/rejected": -35838491.115264796,
"logps/chosen": -481.9712970219436,
"logps/rejected": -382.05561234423675,
"loss": 0.5533,
"loss/base_kto": 3.142148971557617,
"metrics/advantage_var": 422.1423034667969,
"regularization/lipschitz_norm": 1298.2183837890625,
"regularization/mmd": 0.19337554275989532,
"regularization/rkhs_norm": 230.20896911621094,
"regularization/w1": 1.0905033349990845,
"rewards/chosen": 0.5188090644286344,
"rewards/margins": 0.8925310814256895,
"rewards/rejected": -0.3737220169970551,
"step": 1800
},
{
"epoch": 2.3575129533678756,
"grad_norm": 21.723722457885742,
"kl": 12.508740425109863,
"learning_rate": 1.1906142510009415e-07,
"logits/chosen": -36401694.76733436,
"logits/rejected": -36952784.532488115,
"logps/chosen": -493.67421032357475,
"logps/rejected": -395.0083201267829,
"loss": 0.5598,
"loss/base_kto": 3.1529204845428467,
"metrics/advantage_var": 457.195068359375,
"regularization/lipschitz_norm": 1336.2327880859375,
"regularization/mmd": 0.20305581390857697,
"regularization/rkhs_norm": 241.7331085205078,
"regularization/w1": 1.122435450553894,
"rewards/chosen": 0.5538677103897823,
"rewards/margins": 0.880019538581331,
"rewards/rejected": -0.32615182819154864,
"step": 1820
},
{
"epoch": 2.383419689119171,
"grad_norm": 18.0310001373291,
"kl": 17.11049461364746,
"learning_rate": 1.1003311068862547e-07,
"logits/chosen": -33666531.86813187,
"logits/rejected": -35667910.66874028,
"logps/chosen": -486.9624215070644,
"logps/rejected": -389.0480171073095,
"loss": 0.5586,
"loss/base_kto": 3.180561065673828,
"metrics/advantage_var": 428.9582214355469,
"regularization/lipschitz_norm": 1298.237060546875,
"regularization/mmd": 0.19746464490890503,
"regularization/rkhs_norm": 235.0769500732422,
"regularization/w1": 1.0905191898345947,
"rewards/chosen": 0.5803600173542975,
"rewards/margins": 0.8641187236443928,
"rewards/rejected": -0.28375870629009525,
"step": 1840
},
{
"epoch": 2.4093264248704664,
"grad_norm": 14.83030891418457,
"kl": 15.62182903289795,
"learning_rate": 1.0131828279173588e-07,
"logits/chosen": -33895261.61812298,
"logits/rejected": -34788599.49244713,
"logps/chosen": -461.1163531553398,
"logps/rejected": -375.5492116691843,
"loss": 0.5571,
"loss/base_kto": 3.197308301925659,
"metrics/advantage_var": 401.8186950683594,
"regularization/lipschitz_norm": 1272.59765625,
"regularization/mmd": 0.19013570249080658,
"regularization/rkhs_norm": 226.35203552246094,
"regularization/w1": 1.0689821243286133,
"rewards/chosen": 0.5586881668436489,
"rewards/margins": 0.842465340395917,
"rewards/rejected": -0.2837771735522682,
"step": 1860
},
{
"epoch": 2.4352331606217614,
"grad_norm": 17.9812068939209,
"kl": 11.873516082763672,
"learning_rate": 9.292394708374596e-08,
"logits/chosen": -34445551.53216374,
"logits/rejected": -36125878.12080537,
"logps/chosen": -456.01667580409355,
"logps/rejected": -363.6667627936242,
"loss": 0.5593,
"loss/base_kto": 3.160029172897339,
"metrics/advantage_var": 426.356689453125,
"regularization/lipschitz_norm": 1331.6898193359375,
"regularization/mmd": 0.19539673626422882,
"regularization/rkhs_norm": 232.6151580810547,
"regularization/w1": 1.1186193227767944,
"rewards/chosen": 0.5473325852065059,
"rewards/margins": 0.8867866216375304,
"rewards/rejected": -0.33945403643102456,
"step": 1880
},
{
"epoch": 2.461139896373057,
"grad_norm": 15.903279304504395,
"kl": 15.79315185546875,
"learning_rate": 8.48568516017727e-08,
"logits/chosen": -35280485.73828756,
"logits/rejected": -35382403.67927383,
"logps/chosen": -476.8421344911147,
"logps/rejected": -373.09093702723146,
"loss": 0.5538,
"loss/base_kto": 3.1853463649749756,
"metrics/advantage_var": 387.84149169921875,
"regularization/lipschitz_norm": 1260.2186279296875,
"regularization/mmd": 0.18613950908184052,
"regularization/rkhs_norm": 221.5946502685547,
"regularization/w1": 1.0585834980010986,
"rewards/chosen": 0.49597148248182554,
"rewards/margins": 0.8129807432048068,
"rewards/rejected": -0.3170092607229813,
"step": 1900
},
{
"epoch": 2.4870466321243523,
"grad_norm": 18.10071563720703,
"kl": 13.327929496765137,
"learning_rate": 7.71234813211169e-08,
"logits/chosen": -35143539.7260274,
"logits/rejected": -36358923.09470305,
"logps/chosen": -481.94411149162863,
"logps/rejected": -378.6756370385233,
"loss": 0.5643,
"loss/base_kto": 3.1585705280303955,
"metrics/advantage_var": 449.4476623535156,
"regularization/lipschitz_norm": 1374.4207763671875,
"regularization/mmd": 0.20149266719818115,
"regularization/rkhs_norm": 239.8722381591797,
"regularization/w1": 1.1545134782791138,
"rewards/chosen": 0.5620129264471556,
"rewards/margins": 0.8867209373946877,
"rewards/rejected": -0.3247080109475321,
"step": 1920
},
{
"epoch": 2.5129533678756477,
"grad_norm": 18.524930953979492,
"kl": 15.759302139282227,
"learning_rate": 6.973005294212353e-08,
"logits/chosen": -36137202.12807882,
"logits/rejected": -36938408.631892696,
"logps/chosen": -478.5948788998358,
"logps/rejected": -379.47571255588673,
"loss": 0.5565,
"loss/base_kto": 3.1908624172210693,
"metrics/advantage_var": 423.966064453125,
"regularization/lipschitz_norm": 1271.6673583984375,
"regularization/mmd": 0.1926002949476242,
"regularization/rkhs_norm": 229.2860870361328,
"regularization/w1": 1.0682004690170288,
"rewards/chosen": 0.5441734176159688,
"rewards/margins": 0.8334453564345465,
"rewards/rejected": -0.28927193881857766,
"step": 1940
},
{
"epoch": 2.538860103626943,
"grad_norm": 17.577173233032227,
"kl": 10.820630073547363,
"learning_rate": 6.268250989270102e-08,
"logits/chosen": -35068814.222222224,
"logits/rejected": -36099434.93670886,
"logps/chosen": -503.60108024691357,
"logps/rejected": -366.8716376582278,
"loss": 0.5561,
"loss/base_kto": 3.1237423419952393,
"metrics/advantage_var": 437.7642517089844,
"regularization/lipschitz_norm": 1340.9012451171875,
"regularization/mmd": 0.1989518254995346,
"regularization/rkhs_norm": 236.847412109375,
"regularization/w1": 1.126357078552246,
"rewards/chosen": 0.5330301449622636,
"rewards/margins": 0.9208744720921589,
"rewards/rejected": -0.3878443271298952,
"step": 1960
},
{
"epoch": 2.5647668393782386,
"grad_norm": 12.616131782531738,
"kl": 14.004104614257812,
"learning_rate": 5.598651755051975e-08,
"logits/chosen": -34379226.691472866,
"logits/rejected": -37020938.07874016,
"logps/chosen": -482.3362403100775,
"logps/rejected": -365.29397145669293,
"loss": 0.5512,
"loss/base_kto": 3.1323635578155518,
"metrics/advantage_var": 427.05615234375,
"regularization/lipschitz_norm": 1289.6724853515625,
"regularization/mmd": 0.19414694607257843,
"regularization/rkhs_norm": 231.1273193359375,
"regularization/w1": 1.083324909210205,
"rewards/chosen": 0.5665439339571221,
"rewards/margins": 0.9168358454052028,
"rewards/rejected": -0.3502919114480807,
"step": 1980
},
{
"epoch": 2.5906735751295336,
"grad_norm": 13.249449729919434,
"kl": 14.09144115447998,
"learning_rate": 4.964745868872933e-08,
"logits/chosen": -34104844.641975306,
"logits/rejected": -35981149.974683546,
"logps/chosen": -474.2334587191358,
"logps/rejected": -359.50118670886076,
"loss": 0.5558,
"loss/base_kto": 3.192821979522705,
"metrics/advantage_var": 428.54833984375,
"regularization/lipschitz_norm": 1260.3631591796875,
"regularization/mmd": 0.19503657519817352,
"regularization/rkhs_norm": 232.18638610839844,
"regularization/w1": 1.0587049722671509,
"rewards/chosen": 0.5502282601815683,
"rewards/margins": 0.8538953286630137,
"rewards/rejected": -0.3036670684814453,
"step": 2000
},
{
"epoch": 2.616580310880829,
"grad_norm": 17.073501586914062,
"kl": 12.076838493347168,
"learning_rate": 4.3670429148855493e-08,
"logits/chosen": -35473696.820512824,
"logits/rejected": -36427654.24390244,
"logps/chosen": -478.97075320512823,
"logps/rejected": -382.3941739710366,
"loss": 0.5597,
"loss/base_kto": 3.156153440475464,
"metrics/advantage_var": 425.79400634765625,
"regularization/lipschitz_norm": 1337.58935546875,
"regularization/mmd": 0.19765332341194153,
"regularization/rkhs_norm": 235.3015594482422,
"regularization/w1": 1.1235750913619995,
"rewards/chosen": 0.5304658351800381,
"rewards/margins": 0.9001460537603305,
"rewards/rejected": -0.3696802185802925,
"step": 2020
},
{
"epoch": 2.6424870466321244,
"grad_norm": 15.593650817871094,
"kl": 10.039626121520996,
"learning_rate": 3.806023374435663e-08,
"logits/chosen": -35000255.597484276,
"logits/rejected": -36944151.850931674,
"logps/chosen": -499.43828616352204,
"logps/rejected": -360.04386645962734,
"loss": 0.5531,
"loss/base_kto": 3.1356537342071533,
"metrics/advantage_var": 429.6227722167969,
"regularization/lipschitz_norm": 1302.9326171875,
"regularization/mmd": 0.1944286823272705,
"regularization/rkhs_norm": 231.46275329589844,
"regularization/w1": 1.0944633483886719,
"rewards/chosen": 0.5186354439213591,
"rewards/margins": 0.9125994176360572,
"rewards/rejected": -0.39396397371469816,
"step": 2040
},
{
"epoch": 2.66839378238342,
"grad_norm": 14.626014709472656,
"kl": 10.720664978027344,
"learning_rate": 3.282138239813037e-08,
"logits/chosen": -34507064.67175572,
"logits/rejected": -34558089.6256,
"logps/chosen": -492.1023854961832,
"logps/rejected": -365.07745,
"loss": 0.5549,
"loss/base_kto": 3.1620523929595947,
"metrics/advantage_var": 409.95391845703125,
"regularization/lipschitz_norm": 1290.7791748046875,
"regularization/mmd": 0.19280944764614105,
"regularization/rkhs_norm": 229.53506469726562,
"regularization/w1": 1.0842543840408325,
"rewards/chosen": 0.5193258736879771,
"rewards/margins": 0.8730520699770397,
"rewards/rejected": -0.3537261962890625,
"step": 2060
},
{
"epoch": 2.694300518134715,
"grad_norm": 17.921890258789062,
"kl": 10.978423118591309,
"learning_rate": 2.795808651707793e-08,
"logits/chosen": -34726710.326717556,
"logits/rejected": -35583764.0704,
"logps/chosen": -481.82471374045804,
"logps/rejected": -361.47715,
"loss": 0.5564,
"loss/base_kto": 3.2089245319366455,
"metrics/advantage_var": 391.92059326171875,
"regularization/lipschitz_norm": 1256.5316162109375,
"regularization/mmd": 0.18653170764446259,
"regularization/rkhs_norm": 222.0615692138672,
"regularization/w1": 1.0554865598678589,
"rewards/chosen": 0.4799011696385973,
"rewards/margins": 0.8107483864354723,
"rewards/rejected": -0.330847216796875,
"step": 2080
},
{
"epoch": 2.7202072538860103,
"grad_norm": 13.252175331115723,
"kl": 11.777840614318848,
"learning_rate": 2.3474255606639293e-08,
"logits/chosen": -35449815.53799392,
"logits/rejected": -36389180.09003215,
"logps/chosen": -448.4937310030395,
"logps/rejected": -357.3993167202572,
"loss": 0.559,
"loss/base_kto": 3.210728406906128,
"metrics/advantage_var": 405.4601745605469,
"regularization/lipschitz_norm": 1274.8612060546875,
"regularization/mmd": 0.19031064212322235,
"regularization/rkhs_norm": 226.5602569580078,
"regularization/w1": 1.0708832740783691,
"rewards/chosen": 0.5015448016598594,
"rewards/margins": 0.8342519277007934,
"rewards/rejected": -0.332707126040934,
"step": 2100
},
{
"epoch": 2.7461139896373057,
"grad_norm": 20.83140754699707,
"kl": 12.857622146606445,
"learning_rate": 1.9373494128020195e-08,
"logits/chosen": -35669300.58170915,
"logits/rejected": -38086579.15823817,
"logps/chosen": -478.5110569715142,
"logps/rejected": -384.370845228385,
"loss": 0.5611,
"loss/base_kto": 3.1982758045196533,
"metrics/advantage_var": 423.3090515136719,
"regularization/lipschitz_norm": 1306.4466552734375,
"regularization/mmd": 0.19334715604782104,
"regularization/rkhs_norm": 230.17520141601562,
"regularization/w1": 1.0974153280258179,
"rewards/chosen": 0.522906896771341,
"rewards/margins": 0.8397517436119303,
"rewards/rejected": -0.31684484684058933,
"step": 2120
},
{
"epoch": 2.772020725388601,
"grad_norm": 17.806838989257812,
"kl": 12.624212265014648,
"learning_rate": 1.5659098600638798e-08,
"logits/chosen": -35652015.15789474,
"logits/rejected": -35866480.80650406,
"logps/chosen": -449.30112781954887,
"logps/rejected": -393.7626524390244,
"loss": 0.564,
"loss/base_kto": 3.2325809001922607,
"metrics/advantage_var": 437.7423400878906,
"regularization/lipschitz_norm": 1292.982666015625,
"regularization/mmd": 0.19358959794044495,
"regularization/rkhs_norm": 230.4638214111328,
"regularization/w1": 1.086105465888977,
"rewards/chosen": 0.5171561563821664,
"rewards/margins": 0.8115294096850119,
"rewards/rejected": -0.29437325330284553,
"step": 2140
},
{
"epoch": 2.7979274611398965,
"grad_norm": 16.46271324157715,
"kl": 15.088406562805176,
"learning_rate": 1.2334054952120143e-08,
"logits/chosen": -34679534.289308175,
"logits/rejected": -35387996.22360248,
"logps/chosen": -488.41568396226415,
"logps/rejected": -389.755119371118,
"loss": 0.5622,
"loss/base_kto": 3.1939010620117188,
"metrics/advantage_var": 425.0210876464844,
"regularization/lipschitz_norm": 1319.3656005859375,
"regularization/mmd": 0.1957203596830368,
"regularization/rkhs_norm": 233.0004425048828,
"regularization/w1": 1.108267068862915,
"rewards/chosen": 0.5672503297433913,
"rewards/margins": 0.8323033147037222,
"rewards/rejected": -0.2650529849603309,
"step": 2160
},
{
"epoch": 2.823834196891192,
"grad_norm": 18.391647338867188,
"kl": 16.242544174194336,
"learning_rate": 9.401036117969108e-09,
"logits/chosen": -33360569.812995244,
"logits/rejected": -34305943.86440678,
"logps/chosen": -485.9695919175911,
"logps/rejected": -370.52768682588595,
"loss": 0.5551,
"loss/base_kto": 3.15459942817688,
"metrics/advantage_var": 418.97021484375,
"regularization/lipschitz_norm": 1302.6507568359375,
"regularization/mmd": 0.1921084225177765,
"regularization/rkhs_norm": 228.7004852294922,
"regularization/w1": 1.094226598739624,
"rewards/chosen": 0.5278950976872029,
"rewards/margins": 0.8850346028002374,
"rewards/rejected": -0.3571395051130345,
"step": 2180
},
{
"epoch": 2.849740932642487,
"grad_norm": 18.19830322265625,
"kl": 15.978507995605469,
"learning_rate": 6.8623998928517555e-09,
"logits/chosen": -34110690.119873814,
"logits/rejected": -36318566.241486065,
"logps/chosen": -487.15048304416405,
"logps/rejected": -373.83995259287923,
"loss": 0.551,
"loss/base_kto": 3.2148778438568115,
"metrics/advantage_var": 366.65606689453125,
"regularization/lipschitz_norm": 1204.7899169921875,
"regularization/mmd": 0.1810026317834854,
"regularization/rkhs_norm": 215.4793243408203,
"regularization/w1": 1.0120233297348022,
"rewards/chosen": 0.49806439613318215,
"rewards/margins": 0.7901091626803232,
"rewards/rejected": -0.29204476654714107,
"step": 2200
},
{
"epoch": 2.8756476683937824,
"grad_norm": 15.575223922729492,
"kl": 13.734251976013184,
"learning_rate": 4.72018703521132e-09,
"logits/chosen": -34421687.53230769,
"logits/rejected": -36010344.83809524,
"logps/chosen": -473.1840384615385,
"logps/rejected": -378.83397817460315,
"loss": 0.5558,
"loss/base_kto": 3.1955902576446533,
"metrics/advantage_var": 399.99322509765625,
"regularization/lipschitz_norm": 1263.6273193359375,
"regularization/mmd": 0.18925951421260834,
"regularization/rkhs_norm": 225.30894470214844,
"regularization/w1": 1.061447024345398,
"rewards/chosen": 0.5103482759915865,
"rewards/margins": 0.8328501457987542,
"rewards/rejected": -0.32250186980716766,
"step": 2220
},
{
"epoch": 2.901554404145078,
"grad_norm": 22.56538963317871,
"kl": 16.62363624572754,
"learning_rate": 2.976119626744267e-09,
"logits/chosen": -33329488.338211384,
"logits/rejected": -35892006.88120301,
"logps/chosen": -486.17525406504063,
"logps/rejected": -366.10726033834584,
"loss": 0.5533,
"loss/base_kto": 3.182363986968994,
"metrics/advantage_var": 396.3825988769531,
"regularization/lipschitz_norm": 1256.23046875,
"regularization/mmd": 0.18909044563770294,
"regularization/rkhs_norm": 225.107666015625,
"regularization/w1": 1.0552337169647217,
"rewards/chosen": 0.543873062754065,
"rewards/margins": 0.8428124048226153,
"rewards/rejected": -0.2989393420685503,
"step": 2240
},
{
"epoch": 2.927461139896373,
"grad_norm": 18.93718719482422,
"kl": 14.416910171508789,
"learning_rate": 1.631599688052765e-09,
"logits/chosen": -35279206.15580286,
"logits/rejected": -37080021.52995392,
"logps/chosen": -464.6409479332273,
"logps/rejected": -378.84190188172045,
"loss": 0.5623,
"loss/base_kto": 3.1653780937194824,
"metrics/advantage_var": 439.2682800292969,
"regularization/lipschitz_norm": 1352.9263916015625,
"regularization/mmd": 0.19671465456485748,
"regularization/rkhs_norm": 234.1841278076172,
"regularization/w1": 1.1364582777023315,
"rewards/chosen": 0.5402929551650686,
"rewards/margins": 0.8828776852752956,
"rewards/rejected": -0.34258473011022705,
"step": 2260
},
{
"epoch": 2.9533678756476682,
"grad_norm": 19.302715301513672,
"kl": 14.864020347595215,
"learning_rate": 6.877080515894085e-10,
"logits/chosen": -36242167.48019017,
"logits/rejected": -36907796.90600924,
"logps/chosen": -508.99569136291603,
"logps/rejected": -352.2167276579353,
"loss": 0.5634,
"loss/base_kto": 3.1400930881500244,
"metrics/advantage_var": 449.7011413574219,
"regularization/lipschitz_norm": 1387.0028076171875,
"regularization/mmd": 0.20231874287128448,
"regularization/rkhs_norm": 240.8556671142578,
"regularization/w1": 1.1650822162628174,
"rewards/chosen": 0.5618764934751387,
"rewards/margins": 0.9130513873172275,
"rewards/rejected": -0.3511748938420888,
"step": 2280
},
{
"epoch": 2.9792746113989637,
"grad_norm": 16.154787063598633,
"kl": 15.28672981262207,
"learning_rate": 1.4520349279739663e-10,
"logits/chosen": -36164415.494470775,
"logits/rejected": -36540536.28438949,
"logps/chosen": -488.46978672985784,
"logps/rejected": -391.0024874420402,
"loss": 0.5586,
"loss/base_kto": 3.1421260833740234,
"metrics/advantage_var": 457.24761962890625,
"regularization/lipschitz_norm": 1342.6614990234375,
"regularization/mmd": 0.19898290932178497,
"regularization/rkhs_norm": 236.8843994140625,
"regularization/w1": 1.1278356313705444,
"rewards/chosen": 0.5228059355869866,
"rewards/margins": 0.8927053492721441,
"rewards/rejected": -0.36989941368515744,
"step": 2300
},
{
"epoch": 3.0,
"step": 2316,
"total_flos": 9.978126922009805e+17,
"train_loss": 0.5863481292658725,
"train_runtime": 11098.6525,
"train_samples_per_second": 13.355,
"train_steps_per_second": 0.209
}
],
"logging_steps": 20,
"max_steps": 2316,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": false,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 9.978126922009805e+17,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}