Files
aup-fullft-kto_w1_mmd-w1lam…/trainer_state.json
ModelHub XC b6b024673c 初始化项目,由ModelHub XC社区提供模型
Model: Gueule-d-ange/aup-fullft-kto_w1_mmd-w1lam8.4e-4_mmdrho8.4e-4_kr0.1-seed42
Source: Original Platform
2026-08-21 08:23:17 +08:00

2459 lines
92 KiB
JSON

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 3.0,
"eval_steps": 500,
"global_step": 2316,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.025906735751295335,
"grad_norm": 24.061288833618164,
"kl": 15.30693244934082,
"learning_rate": 1.8999999999999998e-07,
"logits/chosen": -36756318.64242424,
"logits/rejected": -37470459.04516129,
"logps/chosen": -477.7164772727273,
"logps/rejected": -362.99314516129033,
"loss": 0.6014,
"loss/base_kto": 3.946857452392578,
"metrics/advantage_var": 178.61863708496094,
"regularization/lipschitz_norm": 876.2899780273438,
"regularization/mmd": 0.1283591240644455,
"regularization/rkhs_norm": 152.80850219726562,
"regularization/w1": 0.7360835671424866,
"rewards/chosen": 0.19979370579575048,
"rewards/margins": 0.03685436342002593,
"rewards/rejected": 0.16293934237572455,
"step": 20
},
{
"epoch": 0.05181347150259067,
"grad_norm": 19.52281951904297,
"kl": 9.385969161987305,
"learning_rate": 3.8999999999999997e-07,
"logits/chosen": -37766296.44511278,
"logits/rejected": -39036331.91544715,
"logps/chosen": -497.0341635338346,
"logps/rejected": -395.4654471544715,
"loss": 0.5932,
"loss/base_kto": 3.8942172527313232,
"metrics/advantage_var": 163.17442321777344,
"regularization/lipschitz_norm": 867.9848022460938,
"regularization/mmd": 0.12266204506158829,
"regularization/rkhs_norm": 146.0262451171875,
"regularization/w1": 0.7291072010993958,
"rewards/chosen": 0.15460649074468397,
"rewards/margins": 0.09140411503806557,
"rewards/rejected": 0.0632023757066184,
"step": 40
},
{
"epoch": 0.07772020725388601,
"grad_norm": 20.192529678344727,
"kl": 18.184659957885742,
"learning_rate": 5.9e-07,
"logits/chosen": -34588705.57377049,
"logits/rejected": -37115717.54029851,
"logps/chosen": -476.8985655737705,
"logps/rejected": -353.28507462686565,
"loss": 0.5883,
"loss/base_kto": 3.8471505641937256,
"metrics/advantage_var": 173.1672821044922,
"regularization/lipschitz_norm": 871.5046997070312,
"regularization/mmd": 0.12723729014396667,
"regularization/rkhs_norm": 151.4729461669922,
"regularization/w1": 0.732063889503479,
"rewards/chosen": 0.3061334328573258,
"rewards/margins": 0.15448646293399323,
"rewards/rejected": 0.15164696992333257,
"step": 60
},
{
"epoch": 0.10362694300518134,
"grad_norm": 20.085376739501953,
"kl": 3.370481252670288,
"learning_rate": 7.9e-07,
"logits/chosen": -35262568.523126,
"logits/rejected": -37553119.06891271,
"logps/chosen": -464.0496909888357,
"logps/rejected": -359.31939127105665,
"loss": 0.5964,
"loss/base_kto": 3.866413116455078,
"metrics/advantage_var": 184.6261444091797,
"regularization/lipschitz_norm": 920.6685791015625,
"regularization/mmd": 0.13150206208229065,
"regularization/rkhs_norm": 156.55007934570312,
"regularization/w1": 0.7733615636825562,
"rewards/chosen": -0.05208843176444752,
"rewards/margins": 0.12107681218176228,
"rewards/rejected": -0.1731652439462098,
"step": 80
},
{
"epoch": 0.12953367875647667,
"grad_norm": 22.23554229736328,
"kl": 8.579002380371094,
"learning_rate": 9.9e-07,
"logits/chosen": -36692160.30046948,
"logits/rejected": -37635862.764430575,
"logps/chosen": -484.7162558685446,
"logps/rejected": -375.3727574102964,
"loss": 0.5959,
"loss/base_kto": 3.812727451324463,
"metrics/advantage_var": 216.3206329345703,
"regularization/lipschitz_norm": 972.4998168945312,
"regularization/mmd": 0.13731805980205536,
"regularization/rkhs_norm": 163.47389221191406,
"regularization/w1": 0.8168997764587402,
"rewards/chosen": 0.164737946177499,
"rewards/margins": 0.19311716331639942,
"rewards/rejected": -0.0283792171389004,
"step": 100
},
{
"epoch": 0.15544041450777202,
"grad_norm": 23.748491287231445,
"kl": 7.484068393707275,
"learning_rate": 9.998186234298189e-07,
"logits/chosen": -36535573.08235294,
"logits/rejected": -38160766.29333334,
"logps/chosen": -497.53161764705885,
"logps/rejected": -361.0922395833333,
"loss": 0.5947,
"loss/base_kto": 3.8688125610351562,
"metrics/advantage_var": 203.99609375,
"regularization/lipschitz_norm": 898.7174072265625,
"regularization/mmd": 0.13416998088359833,
"regularization/rkhs_norm": 159.72618103027344,
"regularization/w1": 0.7549225687980652,
"rewards/chosen": 0.10815998526180491,
"rewards/margins": 0.11622950446371938,
"rewards/rejected": -0.00806951920191447,
"step": 120
},
{
"epoch": 0.18134715025906736,
"grad_norm": 26.647647857666016,
"kl": 10.49285888671875,
"learning_rate": 9.992359552107714e-07,
"logits/chosen": -36091924.27722772,
"logits/rejected": -36790928.33234421,
"logps/chosen": -490.02516501650166,
"logps/rejected": -368.49135293026706,
"loss": 0.5976,
"loss/base_kto": 3.876896619796753,
"metrics/advantage_var": 182.90757751464844,
"regularization/lipschitz_norm": 920.4991455078125,
"regularization/mmd": 0.13089106976985931,
"regularization/rkhs_norm": 155.8227081298828,
"regularization/w1": 0.7732192873954773,
"rewards/chosen": 0.017669704487614898,
"rewards/margins": 0.07950088165293215,
"rewards/rejected": -0.061831177165317254,
"step": 140
},
{
"epoch": 0.20725388601036268,
"grad_norm": 16.89284896850586,
"kl": 8.803842544555664,
"learning_rate": 9.982519612796161e-07,
"logits/chosen": -36478452.72246696,
"logits/rejected": -37851956.567612685,
"logps/chosen": -475.30263399412627,
"logps/rejected": -384.0806552587646,
"loss": 0.5949,
"loss/base_kto": 3.848097324371338,
"metrics/advantage_var": 187.6973876953125,
"regularization/lipschitz_norm": 927.83984375,
"regularization/mmd": 0.13174079358577728,
"regularization/rkhs_norm": 156.83425903320312,
"regularization/w1": 0.779385507106781,
"rewards/chosen": 0.13681265541110268,
"rewards/margins": 0.15413100207469077,
"rewards/rejected": -0.017318346663588075,
"step": 160
},
{
"epoch": 0.23316062176165803,
"grad_norm": 14.733221054077148,
"kl": 11.558862686157227,
"learning_rate": 9.968674326492213e-07,
"logits/chosen": -35508045.63608087,
"logits/rejected": -37472522.85086342,
"logps/chosen": -468.68234836702953,
"logps/rejected": -361.3554258241758,
"loss": 0.5926,
"loss/base_kto": 3.805783987045288,
"metrics/advantage_var": 211.26126098632812,
"regularization/lipschitz_norm": 948.3896484375,
"regularization/mmd": 0.13838918507099152,
"regularization/rkhs_norm": 164.7490234375,
"regularization/w1": 0.796647310256958,
"rewards/chosen": 0.2632976193821078,
"rewards/margins": 0.17271871074627515,
"rewards/rejected": 0.09057890863583264,
"step": 180
},
{
"epoch": 0.25906735751295334,
"grad_norm": 19.31886863708496,
"kl": 11.500679969787598,
"learning_rate": 9.950834823142198e-07,
"logits/chosen": -37083814.2976,
"logits/rejected": -38503438.07022901,
"logps/chosen": -489.0307,
"logps/rejected": -374.10314885496183,
"loss": 0.5975,
"loss/base_kto": 3.807547092437744,
"metrics/advantage_var": 231.0459442138672,
"regularization/lipschitz_norm": 986.7574462890625,
"regularization/mmd": 0.14365534484386444,
"regularization/rkhs_norm": 171.01828002929688,
"regularization/w1": 0.8288761973381042,
"rewards/chosen": 0.1882507080078125,
"rewards/margins": 0.1789826418345211,
"rewards/rejected": 0.009268066173291388,
"step": 200
},
{
"epoch": 0.2849740932642487,
"grad_norm": 22.354700088500977,
"kl": 5.295507907867432,
"learning_rate": 9.929015443562942e-07,
"logits/chosen": -38015022.621138215,
"logits/rejected": -36863935.32631579,
"logps/chosen": -475.3343495934959,
"logps/rejected": -363.2661654135338,
"loss": 0.6002,
"loss/base_kto": 3.8267617225646973,
"metrics/advantage_var": 226.3080596923828,
"regularization/lipschitz_norm": 992.7683715820312,
"regularization/mmd": 0.14091962575912476,
"regularization/rkhs_norm": 167.76145935058594,
"regularization/w1": 0.8339253664016724,
"rewards/chosen": -0.02130757153518801,
"rewards/margins": 0.15146371596701477,
"rewards/rejected": -0.17277128750220277,
"step": 220
},
{
"epoch": 0.31088082901554404,
"grad_norm": 26.735187530517578,
"kl": 6.700460910797119,
"learning_rate": 9.90323372791347e-07,
"logits/chosen": -35961399.82554517,
"logits/rejected": -37781587.46081505,
"logps/chosen": -470.1547897196262,
"logps/rejected": -351.7079496473354,
"loss": 0.5858,
"loss/base_kto": 3.805454969406128,
"metrics/advantage_var": 189.4175262451172,
"regularization/lipschitz_norm": 892.3472900390625,
"regularization/mmd": 0.13148470222949982,
"regularization/rkhs_norm": 156.52940368652344,
"regularization/w1": 0.7495717406272888,
"rewards/chosen": 0.05488284577461789,
"rewards/margins": 0.18783451645417068,
"rewards/rejected": -0.1329516706795528,
"step": 240
},
{
"epoch": 0.33678756476683935,
"grad_norm": 27.31540870666504,
"kl": 10.56055736541748,
"learning_rate": 9.87351040159484e-07,
"logits/chosen": -36674574.20030817,
"logits/rejected": -37436748.67828843,
"logps/chosen": -487.87851502311247,
"logps/rejected": -389.64545364500793,
"loss": 0.5999,
"loss/base_kto": 3.727017641067505,
"metrics/advantage_var": 269.7157897949219,
"regularization/lipschitz_norm": 1094.1197509765625,
"regularization/mmd": 0.15351979434490204,
"regularization/rkhs_norm": 182.7616424560547,
"regularization/w1": 0.9190606474876404,
"rewards/chosen": 0.20194508886116863,
"rewards/margins": 0.25375466879807124,
"rewards/rejected": -0.05180957993690261,
"step": 260
},
{
"epoch": 0.3626943005181347,
"grad_norm": 14.908998489379883,
"kl": 6.149159908294678,
"learning_rate": 9.839869358589396e-07,
"logits/chosen": -36140252.8627451,
"logits/rejected": -36793448.23952096,
"logps/chosen": -458.9479166666667,
"logps/rejected": -366.1334440494012,
"loss": 0.599,
"loss/base_kto": 3.7684807777404785,
"metrics/advantage_var": 327.1993713378906,
"regularization/lipschitz_norm": 1041.7467041015625,
"regularization/mmd": 0.14881670475006104,
"regularization/rkhs_norm": 177.16275024414062,
"regularization/w1": 0.8750673532485962,
"rewards/chosen": 0.031634118821885854,
"rewards/margins": 0.1966205522051194,
"rewards/rejected": -0.16498643338323354,
"step": 280
},
{
"epoch": 0.38860103626943004,
"grad_norm": 16.479248046875,
"kl": 5.856367588043213,
"learning_rate": 9.80233764225289e-07,
"logits/chosen": -36476318.96456087,
"logits/rejected": -37083178.1933439,
"logps/chosen": -463.2150423728813,
"logps/rejected": -352.0474940570523,
"loss": 0.5844,
"loss/base_kto": 3.7703139781951904,
"metrics/advantage_var": 208.1964111328125,
"regularization/lipschitz_norm": 914.4244384765625,
"regularization/mmd": 0.13676691055297852,
"regularization/rkhs_norm": 162.81777954101562,
"regularization/w1": 0.7681164741516113,
"rewards/chosen": 0.09952076116952764,
"rewards/margins": 0.22728015961631348,
"rewards/rejected": -0.12775939844678585,
"step": 300
},
{
"epoch": 0.41450777202072536,
"grad_norm": 32.82734680175781,
"kl": 10.232722282409668,
"learning_rate": 9.760945423574868e-07,
"logits/chosen": -35282652.7706422,
"logits/rejected": -38788190.87539936,
"logps/chosen": -496.43797782874617,
"logps/rejected": -362.930660942492,
"loss": 0.595,
"loss/base_kto": 3.744258165359497,
"metrics/advantage_var": 260.8705749511719,
"regularization/lipschitz_norm": 1030.0390625,
"regularization/mmd": 0.15038061141967773,
"regularization/rkhs_norm": 179.0245361328125,
"regularization/w1": 0.8652328848838806,
"rewards/chosen": 0.1935581358930022,
"rewards/margins": 0.2532027374894323,
"rewards/rejected": -0.059644601596430084,
"step": 320
},
{
"epoch": 0.44041450777202074,
"grad_norm": 16.718948364257812,
"kl": 9.728739738464355,
"learning_rate": 9.71572597692482e-07,
"logits/chosen": -36039599.7492163,
"logits/rejected": -37158433.4953271,
"logps/chosen": -514.2290360501568,
"logps/rejected": -386.7114972741433,
"loss": 0.5934,
"loss/base_kto": 3.7328908443450928,
"metrics/advantage_var": 246.26589965820312,
"regularization/lipschitz_norm": 1029.8287353515625,
"regularization/mmd": 0.14938068389892578,
"regularization/rkhs_norm": 177.83416748046875,
"regularization/w1": 0.8650561571121216,
"rewards/chosen": 0.2354756896398658,
"rewards/margins": 0.2433312446186613,
"rewards/rejected": -0.007855554978795512,
"step": 340
},
{
"epoch": 0.46632124352331605,
"grad_norm": 27.747406005859375,
"kl": 5.277867794036865,
"learning_rate": 9.666715653303588e-07,
"logits/chosen": -35738149.22132472,
"logits/rejected": -37592443.546142206,
"logps/chosen": -481.5026252019386,
"logps/rejected": -381.6180503025719,
"loss": 0.6063,
"loss/base_kto": 3.7919318675994873,
"metrics/advantage_var": 255.345458984375,
"regularization/lipschitz_norm": 1078.8089599609375,
"regularization/mmd": 0.15255644917488098,
"regularization/rkhs_norm": 181.61483764648438,
"regularization/w1": 0.9061994552612305,
"rewards/chosen": -0.09880242170540313,
"rewards/margins": 0.18309703483239473,
"rewards/rejected": -0.28189945653779785,
"step": 360
},
{
"epoch": 0.49222797927461137,
"grad_norm": 25.721073150634766,
"kl": 7.260842800140381,
"learning_rate": 9.613953851121528e-07,
"logits/chosen": -38003003.07692308,
"logits/rejected": -38057083.53015873,
"logps/chosen": -507.90793269230767,
"logps/rejected": -365.96031746031747,
"loss": 0.5978,
"loss/base_kto": 3.756612777709961,
"metrics/advantage_var": 262.91455078125,
"regularization/lipschitz_norm": 1039.7421875,
"regularization/mmd": 0.15234795212745667,
"regularization/rkhs_norm": 181.36659240722656,
"regularization/w1": 0.8733833432197571,
"rewards/chosen": 0.12968339186448316,
"rewards/margins": 0.2388784955854963,
"rewards/rejected": -0.10919510372101314,
"step": 380
},
{
"epoch": 0.5181347150259067,
"grad_norm": 18.518983840942383,
"kl": 18.72420310974121,
"learning_rate": 9.557482984526924e-07,
"logits/chosen": -35877628.13293052,
"logits/rejected": -37894892.94498382,
"logps/chosen": -502.0282760574018,
"logps/rejected": -387.2093699433657,
"loss": 0.5952,
"loss/base_kto": 3.7739078998565674,
"metrics/advantage_var": 228.4562530517578,
"regularization/lipschitz_norm": 1001.5964965820312,
"regularization/mmd": 0.14673535525798798,
"regularization/rkhs_norm": 174.68495178222656,
"regularization/w1": 0.8413410186767578,
"rewards/chosen": 0.3587621129891663,
"rewards/margins": 0.20213743317683067,
"rewards/rejected": 0.15662467981233566,
"step": 400
},
{
"epoch": 0.5440414507772021,
"grad_norm": 24.276382446289062,
"kl": 18.344409942626953,
"learning_rate": 9.497348449310107e-07,
"logits/chosen": -37246139.814992025,
"logits/rejected": -37119363.332312405,
"logps/chosen": -495.2026515151515,
"logps/rejected": -381.86983154670753,
"loss": 0.5956,
"loss/base_kto": 3.727501630783081,
"metrics/advantage_var": 252.412841796875,
"regularization/lipschitz_norm": 1057.0489501953125,
"regularization/mmd": 0.1496998369693756,
"regularization/rkhs_norm": 178.21409606933594,
"regularization/w1": 0.887921154499054,
"rewards/chosen": 0.29819538414573366,
"rewards/margins": 0.2374983748123086,
"rewards/rejected": 0.060697009333425055,
"step": 420
},
{
"epoch": 0.5699481865284974,
"grad_norm": 21.506296157836914,
"kl": 9.530158042907715,
"learning_rate": 9.433598586410701e-07,
"logits/chosen": -36917623.898734175,
"logits/rejected": -37859802.074074075,
"logps/chosen": -476.8665941455696,
"logps/rejected": -381.9916087962963,
"loss": 0.5979,
"loss/base_kto": 3.7536842823028564,
"metrics/advantage_var": 252.3427734375,
"regularization/lipschitz_norm": 1045.080322265625,
"regularization/mmd": 0.1518622636795044,
"regularization/rkhs_norm": 180.78843688964844,
"regularization/w1": 0.8778674006462097,
"rewards/chosen": 0.12927826748618595,
"rewards/margins": 0.24287676136835346,
"rewards/rejected": -0.11359849388216749,
"step": 440
},
{
"epoch": 0.5958549222797928,
"grad_norm": 39.9332160949707,
"kl": 11.19768238067627,
"learning_rate": 9.366284643057313e-07,
"logits/chosen": -37606511.58974359,
"logits/rejected": -38668893.65853658,
"logps/chosen": -478.27088341346155,
"logps/rejected": -378.0344178734756,
"loss": 0.5846,
"loss/base_kto": 3.6778664588928223,
"metrics/advantage_var": 231.51548767089844,
"regularization/lipschitz_norm": 1014.6818237304688,
"regularization/mmd": 0.14632557332515717,
"regularization/rkhs_norm": 174.1970977783203,
"regularization/w1": 0.8523327112197876,
"rewards/chosen": 0.15520979807927057,
"rewards/margins": 0.296487378805708,
"rewards/rejected": -0.14127758072643745,
"step": 460
},
{
"epoch": 0.6217616580310881,
"grad_norm": 22.971567153930664,
"kl": 5.234420299530029,
"learning_rate": 9.295460731570917e-07,
"logits/chosen": -36832377.82636656,
"logits/rejected": -38046231.343465045,
"logps/chosen": -488.1368066720257,
"logps/rejected": -363.7127184650456,
"loss": 0.6,
"loss/base_kto": 3.7873291969299316,
"metrics/advantage_var": 238.6794891357422,
"regularization/lipschitz_norm": 1027.65478515625,
"regularization/mmd": 0.14908884465694427,
"regularization/rkhs_norm": 177.48672485351562,
"regularization/w1": 0.8632300496101379,
"rewards/chosen": -0.01698706617692659,
"rewards/margins": 0.19051233645771437,
"rewards/rejected": -0.20749940263464095,
"step": 480
},
{
"epoch": 0.6476683937823834,
"grad_norm": 19.600114822387695,
"kl": 7.043764591217041,
"learning_rate": 9.221183785865056e-07,
"logits/chosen": -35966055.69620253,
"logits/rejected": -37380348.83950617,
"logps/chosen": -503.74179193037975,
"logps/rejected": -384.6912133487654,
"loss": 0.5943,
"loss/base_kto": 3.7388176918029785,
"metrics/advantage_var": 232.54234313964844,
"regularization/lipschitz_norm": 1030.90283203125,
"regularization/mmd": 0.14990782737731934,
"regularization/rkhs_norm": 178.4617156982422,
"regularization/w1": 0.8659583926200867,
"rewards/chosen": 0.0286272930193551,
"rewards/margins": 0.2373800782193093,
"rewards/rejected": -0.2087527851999542,
"step": 500
},
{
"epoch": 0.6735751295336787,
"grad_norm": 18.632308959960938,
"kl": 6.660374641418457,
"learning_rate": 9.143513515677817e-07,
"logits/chosen": -35586125.15068493,
"logits/rejected": -37397286.25287356,
"logps/chosen": -519.4366438356165,
"logps/rejected": -385.8475664511494,
"loss": 0.596,
"loss/base_kto": 3.7556488513946533,
"metrics/advantage_var": 248.62608337402344,
"regularization/lipschitz_norm": 1026.5970458984375,
"regularization/mmd": 0.15007810294628143,
"regularization/rkhs_norm": 178.66441345214844,
"regularization/w1": 0.8623417019844055,
"rewards/chosen": -0.14926731423155903,
"rewards/margins": 0.19231150916497025,
"rewards/rejected": -0.3415788233965293,
"step": 520
},
{
"epoch": 0.6994818652849741,
"grad_norm": 18.439491271972656,
"kl": 4.2372260093688965,
"learning_rate": 9.062512358572373e-07,
"logits/chosen": -33854764.63785395,
"logits/rejected": -36803111.51395731,
"logps/chosen": -493.7649031296572,
"logps/rejected": -367.70994971264366,
"loss": 0.5991,
"loss/base_kto": 3.7052762508392334,
"metrics/advantage_var": 284.0878601074219,
"regularization/lipschitz_norm": 1102.3619384765625,
"regularization/mmd": 0.1613570600748062,
"regularization/rkhs_norm": 192.0917510986328,
"regularization/w1": 0.9259840846061707,
"rewards/chosen": 0.06791314069631381,
"rewards/margins": 0.3172260692452927,
"rewards/rejected": -0.24931292854897885,
"step": 540
},
{
"epoch": 0.7253886010362695,
"grad_norm": 23.114517211914062,
"kl": 15.232810974121094,
"learning_rate": 8.978245429744691e-07,
"logits/chosen": -35812822.570992365,
"logits/rejected": -35970410.0864,
"logps/chosen": -472.31583969465646,
"logps/rejected": -363.541475,
"loss": 0.5944,
"loss/base_kto": 3.728731632232666,
"metrics/advantage_var": 248.55015563964844,
"regularization/lipschitz_norm": 1041.8992919921875,
"regularization/mmd": 0.1515728086233139,
"regularization/rkhs_norm": 180.44383239746094,
"regularization/w1": 0.875195324420929,
"rewards/chosen": 0.2817352760839098,
"rewards/margins": 0.2441054482030504,
"rewards/rejected": 0.037629827880859376,
"step": 560
},
{
"epoch": 0.7512953367875648,
"grad_norm": 18.718399047851562,
"kl": 14.43424129486084,
"learning_rate": 8.890780469678738e-07,
"logits/chosen": -36347857.31306991,
"logits/rejected": -36027777.23472669,
"logps/chosen": -476.92648176291794,
"logps/rejected": -354.9749296623794,
"loss": 0.5937,
"loss/base_kto": 3.7438225746154785,
"metrics/advantage_var": 246.60643005371094,
"regularization/lipschitz_norm": 1021.2345581054688,
"regularization/mmd": 0.1479819118976593,
"regularization/rkhs_norm": 176.1689453125,
"regularization/w1": 0.8578371405601501,
"rewards/chosen": 0.19300052677606738,
"rewards/margins": 0.2144404087294632,
"rewards/rejected": -0.021439881953395832,
"step": 580
},
{
"epoch": 0.7772020725388601,
"grad_norm": 16.897863388061523,
"kl": 16.039783477783203,
"learning_rate": 8.800187789691269e-07,
"logits/chosen": -35212516.74962519,
"logits/rejected": -34703456.887438826,
"logps/chosen": -481.88582271364317,
"logps/rejected": -370.56555872756934,
"loss": 0.5963,
"loss/base_kto": 3.699596405029297,
"metrics/advantage_var": 266.072265625,
"regularization/lipschitz_norm": 1092.605712890625,
"regularization/mmd": 0.15338386595249176,
"regularization/rkhs_norm": 182.59983825683594,
"regularization/w1": 0.9177886843681335,
"rewards/chosen": 0.3144906886156531,
"rewards/margins": 0.2839805220802834,
"rewards/rejected": 0.030510166535369723,
"step": 600
},
{
"epoch": 0.8031088082901554,
"grad_norm": 20.67934799194336,
"kl": 16.794050216674805,
"learning_rate": 8.706540215409981e-07,
"logits/chosen": -37088251.38045113,
"logits/rejected": -38666849.40487805,
"logps/chosen": -439.3359962406015,
"logps/rejected": -352.00767276422766,
"loss": 0.5902,
"loss/base_kto": 3.7348594665527344,
"metrics/advantage_var": 235.28746032714844,
"regularization/lipschitz_norm": 1001.4083862304688,
"regularization/mmd": 0.1457410603761673,
"regularization/rkhs_norm": 173.5012664794922,
"regularization/w1": 0.8411831259727478,
"rewards/chosen": 0.26139269377055924,
"rewards/margins": 0.214713381537526,
"rewards/rejected": 0.04667931223303322,
"step": 620
},
{
"epoch": 0.8290155440414507,
"grad_norm": 16.07982063293457,
"kl": 26.757160186767578,
"learning_rate": 8.609913028230462e-07,
"logits/chosen": -37365537.04510109,
"logits/rejected": -38823096.86656201,
"logps/chosen": -504.1108087091757,
"logps/rejected": -378.87264521193094,
"loss": 0.5861,
"loss/base_kto": 3.6837024688720703,
"metrics/advantage_var": 251.2823486328125,
"regularization/lipschitz_norm": 1016.2388916015625,
"regularization/mmd": 0.1514957994222641,
"regularization/rkhs_norm": 180.35214233398438,
"regularization/w1": 0.8536405563354492,
"rewards/chosen": 0.41204810253754376,
"rewards/margins": 0.2667204491467102,
"rewards/rejected": 0.1453276533908335,
"step": 640
},
{
"epoch": 0.8549222797927462,
"grad_norm": 23.681554794311523,
"kl": 23.82567596435547,
"learning_rate": 8.510383904798994e-07,
"logits/chosen": -36746155.30827068,
"logits/rejected": -36888169.7300813,
"logps/chosen": -494.35859962406016,
"logps/rejected": -402.3973577235772,
"loss": 0.5963,
"loss/base_kto": 3.706923246383667,
"metrics/advantage_var": 281.416259765625,
"regularization/lipschitz_norm": 1078.4508056640625,
"regularization/mmd": 0.15745438635349274,
"regularization/rkhs_norm": 187.44569396972656,
"regularization/w1": 0.9058987498283386,
"rewards/chosen": 0.4215988273907425,
"rewards/margins": 0.2695969611043795,
"rewards/rejected": 0.15200186628636306,
"step": 660
},
{
"epoch": 0.8808290155440415,
"grad_norm": 15.920571327209473,
"kl": 14.30078125,
"learning_rate": 8.408032854569865e-07,
"logits/chosen": -36816419.06849315,
"logits/rejected": -38410781.42528736,
"logps/chosen": -512.2769691780821,
"logps/rejected": -377.38115122126436,
"loss": 0.5893,
"loss/base_kto": 3.6138551235198975,
"metrics/advantage_var": 280.6195983886719,
"regularization/lipschitz_norm": 1120.3621826171875,
"regularization/mmd": 0.15948601067066193,
"regularization/rkhs_norm": 189.8643035888672,
"regularization/w1": 0.9411041140556335,
"rewards/chosen": 0.19624930865144077,
"rewards/margins": 0.31996609053073427,
"rewards/rejected": -0.12371678187929351,
"step": 680
},
{
"epoch": 0.9067357512953368,
"grad_norm": 16.7027530670166,
"kl": 9.499100685119629,
"learning_rate": 8.302942155487377e-07,
"logits/chosen": -35804868.22907489,
"logits/rejected": -37357171.392320536,
"logps/chosen": -478.90560756240825,
"logps/rejected": -376.377165066778,
"loss": 0.5989,
"loss/base_kto": 3.7567107677459717,
"metrics/advantage_var": 251.39244079589844,
"regularization/lipschitz_norm": 1050.978271484375,
"regularization/mmd": 0.15127399563789368,
"regularization/rkhs_norm": 180.0880889892578,
"regularization/w1": 0.8828216791152954,
"rewards/chosen": 0.1727736328842006,
"rewards/margins": 0.2364261172494187,
"rewards/rejected": -0.06365248436521807,
"step": 700
},
{
"epoch": 0.9326424870466321,
"grad_norm": 18.112823486328125,
"kl": 29.511234283447266,
"learning_rate": 8.195196287844278e-07,
"logits/chosen": -36545384.763076924,
"logits/rejected": -37644834.13333333,
"logps/chosen": -497.7279807692308,
"logps/rejected": -370.676810515873,
"loss": 0.5904,
"loss/base_kto": 3.6782212257385254,
"metrics/advantage_var": 245.07275390625,
"regularization/lipschitz_norm": 1061.2689208984375,
"regularization/mmd": 0.15339969098567963,
"regularization/rkhs_norm": 182.61866760253906,
"regularization/w1": 0.891465961933136,
"rewards/chosen": 0.4361485877403846,
"rewards/margins": 0.25101808391939007,
"rewards/rejected": 0.18513050382099455,
"step": 720
},
{
"epoch": 0.9585492227979274,
"grad_norm": 23.36772918701172,
"kl": 18.090423583984375,
"learning_rate": 8.08488186636975e-07,
"logits/chosen": -38020506.94736842,
"logits/rejected": -38234812.952380955,
"logps/chosen": -493.9114925986842,
"logps/rejected": -384.3053385416667,
"loss": 0.5929,
"loss/base_kto": 3.748584747314453,
"metrics/advantage_var": 225.692626953125,
"regularization/lipschitz_norm": 1012.1201171875,
"regularization/mmd": 0.14427240192890167,
"regularization/rkhs_norm": 171.7528533935547,
"regularization/w1": 0.8501809239387512,
"rewards/chosen": 0.16830943760118985,
"rewards/margins": 0.1903797489658633,
"rewards/rejected": -0.022070311364673433,
"step": 740
},
{
"epoch": 0.9844559585492227,
"grad_norm": 25.477867126464844,
"kl": 19.837697982788086,
"learning_rate": 7.972087570601576e-07,
"logits/chosen": -36650772.417177916,
"logits/rejected": -37934050.64968153,
"logps/chosen": -456.47042753067484,
"logps/rejected": -390.1367436305732,
"loss": 0.5981,
"loss/base_kto": 3.779940128326416,
"metrics/advantage_var": 241.1506805419922,
"regularization/lipschitz_norm": 1019.7799072265625,
"regularization/mmd": 0.1484539955854416,
"regularization/rkhs_norm": 176.73095703125,
"regularization/w1": 0.8566150665283203,
"rewards/chosen": 0.2858230029147095,
"rewards/margins": 0.17603883411246032,
"rewards/rejected": 0.1097841688022492,
"step": 760
},
{
"epoch": 1.0103626943005182,
"grad_norm": 19.113643646240234,
"kl": 11.566720962524414,
"learning_rate": 7.856904073598458e-07,
"logits/chosen": -36213732.51006711,
"logits/rejected": -38418347.91788856,
"logps/chosen": -495.9947042785235,
"logps/rejected": -372.6663535557185,
"loss": 0.6087,
"loss/base_kto": 3.6384010314941406,
"metrics/advantage_var": 372.6042175292969,
"regularization/lipschitz_norm": 1254.179931640625,
"regularization/mmd": 0.1777164489030838,
"regularization/rkhs_norm": 211.5671844482422,
"regularization/w1": 1.0535110235214233,
"rewards/chosen": 0.0986863462716941,
"rewards/margins": 0.36265874334601594,
"rewards/rejected": -0.26397239707432185,
"step": 780
},
{
"epoch": 1.0362694300518134,
"grad_norm": 15.978631973266602,
"kl": 6.711389064788818,
"learning_rate": 7.739423969049761e-07,
"logits/chosen": -36266758.74728682,
"logits/rejected": -37055218.69606299,
"logps/chosen": -462.6787790697674,
"logps/rejected": -376.902657480315,
"loss": 0.6125,
"loss/base_kto": 3.3662197589874268,
"metrics/advantage_var": 578.36328125,
"regularization/lipschitz_norm": 1560.3765869140625,
"regularization/mmd": 0.2226952612400055,
"regularization/rkhs_norm": 265.1134338378906,
"regularization/w1": 1.3107163906097412,
"rewards/chosen": 0.20524493077004602,
"rewards/margins": 0.7216619460259516,
"rewards/rejected": -0.5164170152559056,
"step": 800
},
{
"epoch": 1.0621761658031088,
"grad_norm": 20.392240524291992,
"kl": 8.189127922058105,
"learning_rate": 7.619741696841322e-07,
"logits/chosen": -36700344.16124031,
"logits/rejected": -36608435.401574805,
"logps/chosen": -491.9096414728682,
"logps/rejected": -361.09478346456694,
"loss": 0.6026,
"loss/base_kto": 3.355142593383789,
"metrics/advantage_var": 551.27001953125,
"regularization/lipschitz_norm": 1489.5924072265625,
"regularization/mmd": 0.21410833299160004,
"regularization/rkhs_norm": 254.890869140625,
"regularization/w1": 1.2512577772140503,
"rewards/chosen": 0.3428360340207122,
"rewards/margins": 0.718668274808729,
"rewards/rejected": -0.37583224078801675,
"step": 820
},
{
"epoch": 1.0880829015544042,
"grad_norm": 19.120193481445312,
"kl": 15.248980522155762,
"learning_rate": 7.497953467137135e-07,
"logits/chosen": -34560517.771336555,
"logits/rejected": -35581588.39453718,
"logps/chosen": -473.2853260869565,
"logps/rejected": -327.47003034901365,
"loss": 0.5955,
"loss/base_kto": 3.3272531032562256,
"metrics/advantage_var": 622.5850830078125,
"regularization/lipschitz_norm": 1453.4874267578125,
"regularization/mmd": 0.21606115996837616,
"regularization/rkhs_norm": 257.2156677246094,
"regularization/w1": 1.220929503440857,
"rewards/chosen": 0.5113076226914754,
"rewards/margins": 0.752188655447071,
"rewards/rejected": -0.2408810327555956,
"step": 840
},
{
"epoch": 1.1139896373056994,
"grad_norm": 21.287208557128906,
"kl": 8.600638389587402,
"learning_rate": 7.37415718303793e-07,
"logits/chosen": -34085927.68992248,
"logits/rejected": -35332999.055118114,
"logps/chosen": -462.63381782945737,
"logps/rejected": -354.75088582677165,
"loss": 0.6023,
"loss/base_kto": 3.3238277435302734,
"metrics/advantage_var": 575.845458984375,
"regularization/lipschitz_norm": 1520.3084716796875,
"regularization/mmd": 0.21747727692127228,
"regularization/rkhs_norm": 258.90155029296875,
"regularization/w1": 1.2770589590072632,
"rewards/chosen": 0.28023128065952035,
"rewards/margins": 0.7620155064838314,
"rewards/rejected": -0.481784225824311,
"step": 860
},
{
"epoch": 1.1398963730569949,
"grad_norm": 20.242515563964844,
"kl": 12.774662017822266,
"learning_rate": 7.248452361878855e-07,
"logits/chosen": -34400400.99115044,
"logits/rejected": -36918908.17275748,
"logps/chosen": -470.13477138643066,
"logps/rejected": -350.66144102990035,
"loss": 0.6013,
"loss/base_kto": 3.3126914501190186,
"metrics/advantage_var": 598.7587890625,
"regularization/lipschitz_norm": 1519.0128173828125,
"regularization/mmd": 0.22179608047008514,
"regularization/rkhs_norm": 264.04296875,
"regularization/w1": 1.2759708166122437,
"rewards/chosen": 0.5239427954749724,
"rewards/margins": 0.7635600766568401,
"rewards/rejected": -0.23961728118186773,
"step": 880
},
{
"epoch": 1.16580310880829,
"grad_norm": 18.645580291748047,
"kl": 16.47385597229004,
"learning_rate": 7.120940055229497e-07,
"logits/chosen": -36021200.14953271,
"logits/rejected": -37191464.92789969,
"logps/chosen": -505.87091121495325,
"logps/rejected": -391.00183679467085,
"loss": 0.6182,
"loss/base_kto": 3.2659356594085693,
"metrics/advantage_var": 643.62548828125,
"regularization/lipschitz_norm": 1715.5570068359375,
"regularization/mmd": 0.23826880753040314,
"regularization/rkhs_norm": 283.6533508300781,
"regularization/w1": 1.4410679340362549,
"rewards/chosen": 0.5829729692215488,
"rewards/margins": 0.7918738035472616,
"rewards/rejected": -0.2089008343257127,
"step": 900
},
{
"epoch": 1.1917098445595855,
"grad_norm": 18.20612335205078,
"kl": 21.56020736694336,
"learning_rate": 6.991722767660556e-07,
"logits/chosen": -36491428.939597316,
"logits/rejected": -37566961.02923977,
"logps/chosen": -482.3400272651007,
"logps/rejected": -381.28154696637426,
"loss": 0.6103,
"loss/base_kto": 3.2038655281066895,
"metrics/advantage_var": 720.5587768554688,
"regularization/lipschitz_norm": 1710.1494140625,
"regularization/mmd": 0.2420027256011963,
"regularization/rkhs_norm": 288.0984802246094,
"regularization/w1": 1.436525583267212,
"rewards/chosen": 0.6266877859230809,
"rewards/margins": 0.8908269278758633,
"rewards/rejected": -0.2641391419527823,
"step": 920
},
{
"epoch": 1.2176165803108807,
"grad_norm": 15.17077350616455,
"kl": 6.395068645477295,
"learning_rate": 6.860904374342499e-07,
"logits/chosen": -35463518.52931854,
"logits/rejected": -37316008.43143298,
"logps/chosen": -512.3883716323296,
"logps/rejected": -394.9394260400616,
"loss": 0.6309,
"loss/base_kto": 3.2341620922088623,
"metrics/advantage_var": 831.8263549804688,
"regularization/lipschitz_norm": 1859.4007568359375,
"regularization/mmd": 0.2513946294784546,
"regularization/rkhs_norm": 299.2793273925781,
"regularization/w1": 1.561896562576294,
"rewards/chosen": 0.31251184913889163,
"rewards/margins": 0.8946853891102418,
"rewards/rejected": -0.5821735399713501,
"step": 940
},
{
"epoch": 1.2435233160621761,
"grad_norm": 18.710487365722656,
"kl": 7.018948554992676,
"learning_rate": 6.7285900375424e-07,
"logits/chosen": -34978295.186228484,
"logits/rejected": -36578097.92199688,
"logps/chosen": -477.0570226917058,
"logps/rejected": -377.05650351014043,
"loss": 0.6165,
"loss/base_kto": 3.3800530433654785,
"metrics/advantage_var": 659.56591796875,
"regularization/lipschitz_norm": 1573.2835693359375,
"regularization/mmd": 0.23047176003456116,
"regularization/rkhs_norm": 274.3711242675781,
"regularization/w1": 1.3215583562850952,
"rewards/chosen": 0.20912072505562893,
"rewards/margins": 0.6827324942334273,
"rewards/rejected": -0.47361176917779835,
"step": 960
},
{
"epoch": 1.2694300518134716,
"grad_norm": 16.47252082824707,
"kl": 7.658973693847656,
"learning_rate": 6.594886122086123e-07,
"logits/chosen": -34910622.27732463,
"logits/rejected": -34550730.266866565,
"logps/chosen": -482.3106647634584,
"logps/rejected": -365.6373688155922,
"loss": 0.6087,
"loss/base_kto": 3.310258626937866,
"metrics/advantage_var": 619.5570678710938,
"regularization/lipschitz_norm": 1589.989013671875,
"regularization/mmd": 0.22408504784107208,
"regularization/rkhs_norm": 266.76788330078125,
"regularization/w1": 1.3355907201766968,
"rewards/chosen": 0.3612807306535481,
"rewards/margins": 0.7526821216328632,
"rewards/rejected": -0.39140139097931503,
"step": 980
},
{
"epoch": 1.2953367875647668,
"grad_norm": 20.559755325317383,
"kl": 5.918070316314697,
"learning_rate": 6.459900109853766e-07,
"logits/chosen": -36216524.643185295,
"logits/rejected": -36081745.65869219,
"logps/chosen": -488.09963629402756,
"logps/rejected": -392.21351674641147,
"loss": 0.6388,
"loss/base_kto": 3.3580710887908936,
"metrics/advantage_var": 1062.1617431640625,
"regularization/lipschitz_norm": 1786.8533935546875,
"regularization/mmd": 0.2510024607181549,
"regularization/rkhs_norm": 298.8124694824219,
"regularization/w1": 1.5009568929672241,
"rewards/chosen": 0.28723359509595137,
"rewards/margins": 0.7168854669186189,
"rewards/rejected": -0.42965187182266745,
"step": 1000
},
{
"epoch": 1.3212435233160622,
"grad_norm": 15.331923484802246,
"kl": 14.689013481140137,
"learning_rate": 6.323740513377171e-07,
"logits/chosen": -34294788.86846276,
"logits/rejected": -36086365.8798151,
"logps/chosen": -499.610984548336,
"logps/rejected": -372.22106124807397,
"loss": 0.607,
"loss/base_kto": 3.281017780303955,
"metrics/advantage_var": 624.8582153320312,
"regularization/lipschitz_norm": 1605.1187744140625,
"regularization/mmd": 0.22659635543823242,
"regularization/rkhs_norm": 269.757568359375,
"regularization/w1": 1.3482998609542847,
"rewards/chosen": 0.47460995536598655,
"rewards/margins": 0.7646141036876233,
"rewards/rejected": -0.2900041483216367,
"step": 1020
},
{
"epoch": 1.3471502590673574,
"grad_norm": 23.260644912719727,
"kl": 20.15492057800293,
"learning_rate": 6.186516788608865e-07,
"logits/chosen": -35090765.10843374,
"logits/rejected": -35754555.84415584,
"logps/chosen": -486.6987481174699,
"logps/rejected": -386.2094155844156,
"loss": 0.6105,
"loss/base_kto": 3.334191083908081,
"metrics/advantage_var": 583.4151611328125,
"regularization/lipschitz_norm": 1580.743408203125,
"regularization/mmd": 0.2221425622701645,
"regularization/rkhs_norm": 264.4554138183594,
"regularization/w1": 1.3278244733810425,
"rewards/chosen": 0.595872166645096,
"rewards/margins": 0.7301816999996199,
"rewards/rejected": -0.1343095333545239,
"step": 1040
},
{
"epoch": 1.3730569948186528,
"grad_norm": 21.935510635375977,
"kl": 14.327792167663574,
"learning_rate": 6.048339246932652e-07,
"logits/chosen": -34934612.27329192,
"logits/rejected": -36156428.88050315,
"logps/chosen": -506.90639557453414,
"logps/rejected": -369.01203812893084,
"loss": 0.6202,
"loss/base_kto": 3.3050034046173096,
"metrics/advantage_var": 706.4963989257812,
"regularization/lipschitz_norm": 1689.296142578125,
"regularization/mmd": 0.2373594045639038,
"regularization/rkhs_norm": 282.57073974609375,
"regularization/w1": 1.4190086126327515,
"rewards/chosen": 0.5040845219392954,
"rewards/margins": 0.7696624740063527,
"rewards/rejected": -0.2655779520670573,
"step": 1060
},
{
"epoch": 1.3989637305699483,
"grad_norm": 21.3602352142334,
"kl": 11.154303550720215,
"learning_rate": 5.909318966486494e-07,
"logits/chosen": -33303106.64126984,
"logits/rejected": -34261099.12615385,
"logps/chosen": -461.4106150793651,
"logps/rejected": -378.8542788461538,
"loss": 0.6011,
"loss/base_kto": 3.326136827468872,
"metrics/advantage_var": 575.6968994140625,
"regularization/lipschitz_norm": 1508.380126953125,
"regularization/mmd": 0.21530114114284515,
"regularization/rkhs_norm": 256.3108825683594,
"regularization/w1": 1.267039179801941,
"rewards/chosen": 0.36222725520058285,
"rewards/margins": 0.7261650556813521,
"rewards/rejected": -0.36393780048076924,
"step": 1080
},
{
"epoch": 1.4248704663212435,
"grad_norm": 17.760662078857422,
"kl": 16.07636833190918,
"learning_rate": 5.769567702869052e-07,
"logits/chosen": -34713917.9543379,
"logits/rejected": -34955770.24719101,
"logps/chosen": -473.66828386605783,
"logps/rejected": -396.5648073836276,
"loss": 0.6117,
"loss/base_kto": 3.2765488624572754,
"metrics/advantage_var": 644.37841796875,
"regularization/lipschitz_norm": 1652.5120849609375,
"regularization/mmd": 0.2290533035993576,
"regularization/rkhs_norm": 272.6824951171875,
"regularization/w1": 1.3881102800369263,
"rewards/chosen": 0.5092502170138888,
"rewards/margins": 0.8143973421110748,
"rewards/rejected": -0.305147125097186,
"step": 1100
},
{
"epoch": 1.450777202072539,
"grad_norm": 24.83754539489746,
"kl": 11.345195770263672,
"learning_rate": 5.629197799301614e-07,
"logits/chosen": -34959804.93290735,
"logits/rejected": -35160903.24159022,
"logps/chosen": -475.51267971246006,
"logps/rejected": -380.2685397553517,
"loss": 0.5952,
"loss/base_kto": 3.2789361476898193,
"metrics/advantage_var": 535.5349731445312,
"regularization/lipschitz_norm": 1511.8060302734375,
"regularization/mmd": 0.21293817460536957,
"regularization/rkhs_norm": 253.49783325195312,
"regularization/w1": 1.2699168920516968,
"rewards/chosen": 0.3473303554157099,
"rewards/margins": 0.7772668489889132,
"rewards/rejected": -0.42993649357320335,
"step": 1120
},
{
"epoch": 1.4766839378238341,
"grad_norm": 17.399791717529297,
"kl": 13.0494384765625,
"learning_rate": 5.488322096317633e-07,
"logits/chosen": -34631248.49270664,
"logits/rejected": -35461796.48868778,
"logps/chosen": -482.8523095623987,
"logps/rejected": -377.24962292609354,
"loss": 0.6063,
"loss/base_kto": 3.2969672679901123,
"metrics/advantage_var": 612.6229858398438,
"regularization/lipschitz_norm": 1580.170166015625,
"regularization/mmd": 0.22611801326274872,
"regularization/rkhs_norm": 269.1881408691406,
"regularization/w1": 1.3273428678512573,
"rewards/chosen": 0.3980836543696819,
"rewards/margins": 0.7441342562886346,
"rewards/rejected": -0.3460506019189527,
"step": 1140
},
{
"epoch": 1.5025906735751295,
"grad_norm": 17.592403411865234,
"kl": 9.673773765563965,
"learning_rate": 5.347053841052518e-07,
"logits/chosen": -35337389.88679245,
"logits/rejected": -34742093.91304348,
"logps/chosen": -491.1036753144654,
"logps/rejected": -369.2687791149068,
"loss": 0.5971,
"loss/base_kto": 3.311192750930786,
"metrics/advantage_var": 524.9568481445312,
"regularization/lipschitz_norm": 1491.1959228515625,
"regularization/mmd": 0.21303632855415344,
"regularization/rkhs_norm": 253.6147003173828,
"regularization/w1": 1.2526044845581055,
"rewards/chosen": 0.3585570233423005,
"rewards/margins": 0.7573716808023888,
"rewards/rejected": -0.3988146574600883,
"step": 1160
},
{
"epoch": 1.528497409326425,
"grad_norm": 19.176700592041016,
"kl": 9.840781211853027,
"learning_rate": 5.205506596206531e-07,
"logits/chosen": -34236701.164556965,
"logits/rejected": -36144216.493827164,
"logps/chosen": -491.6054193037975,
"logps/rejected": -357.8932773919753,
"loss": 0.6105,
"loss/base_kto": 3.3385682106018066,
"metrics/advantage_var": 618.5313110351562,
"regularization/lipschitz_norm": 1575.9930419921875,
"regularization/mmd": 0.22152887284755707,
"regularization/rkhs_norm": 263.724853515625,
"regularization/w1": 1.3238340616226196,
"rewards/chosen": 0.35719485222538816,
"rewards/margins": 0.7126980993333767,
"rewards/rejected": -0.35550324710798853,
"step": 1180
},
{
"epoch": 1.5544041450777202,
"grad_norm": 24.93023681640625,
"kl": 7.672036647796631,
"learning_rate": 5.063794148754032e-07,
"logits/chosen": -35017728.0,
"logits/rejected": -36650911.09148265,
"logps/chosen": -480.35816563467495,
"logps/rejected": -366.33970820189273,
"loss": 0.6083,
"loss/base_kto": 3.3215484619140625,
"metrics/advantage_var": 570.0585327148438,
"regularization/lipschitz_norm": 1577.996337890625,
"regularization/mmd": 0.2196642905473709,
"regularization/rkhs_norm": 261.5050964355469,
"regularization/w1": 1.325516939163208,
"rewards/chosen": 0.29382458855124083,
"rewards/margins": 0.7623782940976229,
"rewards/rejected": -0.4685537055463821,
"step": 1200
},
{
"epoch": 1.5803108808290154,
"grad_norm": 16.007081985473633,
"kl": 12.481958389282227,
"learning_rate": 4.922030418472422e-07,
"logits/chosen": -33327152.377952754,
"logits/rejected": -34454297.79844961,
"logps/chosen": -487.2919291338583,
"logps/rejected": -382.8316860465116,
"loss": 0.6202,
"loss/base_kto": 3.3565120697021484,
"metrics/advantage_var": 605.4854736328125,
"regularization/lipschitz_norm": 1639.3326416015625,
"regularization/mmd": 0.2278117686510086,
"regularization/rkhs_norm": 271.2044982910156,
"regularization/w1": 1.3770393133163452,
"rewards/chosen": 0.30532793660802166,
"rewards/margins": 0.702149495360747,
"rewards/rejected": -0.3968215587527253,
"step": 1220
},
{
"epoch": 1.6062176165803108,
"grad_norm": 25.13614845275879,
"kl": 10.310724258422852,
"learning_rate": 4.780329366364336e-07,
"logits/chosen": -34472043.95658915,
"logits/rejected": -35279454.33700787,
"logps/chosen": -480.9155523255814,
"logps/rejected": -373.62741141732283,
"loss": 0.6068,
"loss/base_kto": 3.2843806743621826,
"metrics/advantage_var": 593.7132568359375,
"regularization/lipschitz_norm": 1596.0906982421875,
"regularization/mmd": 0.22891679406166077,
"regularization/rkhs_norm": 272.5199890136719,
"regularization/w1": 1.3407163619995117,
"rewards/chosen": 0.35151769357134205,
"rewards/margins": 0.7682584835104415,
"rewards/rejected": -0.4167407899390994,
"step": 1240
},
{
"epoch": 1.6321243523316062,
"grad_norm": 21.02848243713379,
"kl": 17.374481201171875,
"learning_rate": 4.638804903046684e-07,
"logits/chosen": -35234391.7258567,
"logits/rejected": -35805655.87460815,
"logps/chosen": -502.4301499221184,
"logps/rejected": -379.43676528213166,
"loss": 0.5973,
"loss/base_kto": 3.2676665782928467,
"metrics/advantage_var": 601.3102416992188,
"regularization/lipschitz_norm": 1531.6011962890625,
"regularization/mmd": 0.22396306693553925,
"regularization/rkhs_norm": 266.6227111816406,
"regularization/w1": 1.2865450382232666,
"rewards/chosen": 0.5784205736772293,
"rewards/margins": 0.7977082666172028,
"rewards/rejected": -0.21928769293997355,
"step": 1260
},
{
"epoch": 1.6580310880829017,
"grad_norm": 19.544641494750977,
"kl": 18.450199127197266,
"learning_rate": 4.497570797180217e-07,
"logits/chosen": -35068594.85457271,
"logits/rejected": -36597743.29526917,
"logps/chosen": -476.35410419790105,
"logps/rejected": -363.16782218597064,
"loss": 0.5971,
"loss/base_kto": 3.3154518604278564,
"metrics/advantage_var": 540.6677856445312,
"regularization/lipschitz_norm": 1485.3631591796875,
"regularization/mmd": 0.21378619968891144,
"regularization/rkhs_norm": 254.5073699951172,
"regularization/w1": 1.247705101966858,
"rewards/chosen": 0.5985982228612257,
"rewards/margins": 0.7273191768974716,
"rewards/rejected": -0.12872095403624592,
"step": 1280
},
{
"epoch": 1.6839378238341969,
"grad_norm": 14.101898193359375,
"kl": 25.5389461517334,
"learning_rate": 4.3567405840131853e-07,
"logits/chosen": -34941161.87654321,
"logits/rejected": -35391935.18987342,
"logps/chosen": -489.872444058642,
"logps/rejected": -387.87388746044303,
"loss": 0.6069,
"loss/base_kto": 3.283374071121216,
"metrics/advantage_var": 646.7308959960938,
"regularization/lipschitz_norm": 1602.1788330078125,
"regularization/mmd": 0.22629740834236145,
"regularization/rkhs_norm": 269.40167236328125,
"regularization/w1": 1.3458302021026611,
"rewards/chosen": 0.6127055132830584,
"rewards/margins": 0.7432310539850091,
"rewards/rejected": -0.13052554070195066,
"step": 1300
},
{
"epoch": 1.709844559585492,
"grad_norm": 16.41450309753418,
"kl": 12.917071342468262,
"learning_rate": 4.2164274741126506e-07,
"logits/chosen": -35105986.263665594,
"logits/rejected": -37402636.449848026,
"logps/chosen": -469.0955084405145,
"logps/rejected": -390.0357380319149,
"loss": 0.6167,
"loss/base_kto": 3.3446907997131348,
"metrics/advantage_var": 618.182861328125,
"regularization/lipschitz_norm": 1629.4581298828125,
"regularization/mmd": 0.22048059105873108,
"regularization/rkhs_norm": 262.4768981933594,
"regularization/w1": 1.3687448501586914,
"rewards/chosen": 0.4144259143105657,
"rewards/margins": 0.716582936618637,
"rewards/rejected": -0.30215702230807134,
"step": 1320
},
{
"epoch": 1.7357512953367875,
"grad_norm": 18.902488708496094,
"kl": 8.275690078735352,
"learning_rate": 4.0767442623567856e-07,
"logits/chosen": -34980228.578538105,
"logits/rejected": -36466507.95604396,
"logps/chosen": -485.106483281493,
"logps/rejected": -390.8136773940345,
"loss": 0.6196,
"loss/base_kto": 3.3147170543670654,
"metrics/advantage_var": 657.3211059570312,
"regularization/lipschitz_norm": 1677.2119140625,
"regularization/mmd": 0.23319987952709198,
"regularization/rkhs_norm": 277.618896484375,
"regularization/w1": 1.4088581800460815,
"rewards/chosen": 0.3306239767356386,
"rewards/margins": 0.7948075026475057,
"rewards/rejected": -0.4641835259118671,
"step": 1340
},
{
"epoch": 1.761658031088083,
"grad_norm": 21.706884384155273,
"kl": 17.019357681274414,
"learning_rate": 3.937803237261357e-07,
"logits/chosen": -34272686.23875969,
"logits/rejected": -35265779.50236221,
"logps/chosen": -466.8390988372093,
"logps/rejected": -375.6023622047244,
"loss": 0.5995,
"loss/base_kto": 3.3403007984161377,
"metrics/advantage_var": 513.0325317382812,
"regularization/lipschitz_norm": 1489.460205078125,
"regularization/mmd": 0.2047690600156784,
"regularization/rkhs_norm": 243.77268981933594,
"regularization/w1": 1.2511465549468994,
"rewards/chosen": 0.4797371324642684,
"rewards/margins": 0.6606616396654557,
"rewards/rejected": -0.18092450720118725,
"step": 1360
},
{
"epoch": 1.7875647668393784,
"grad_norm": 20.606470108032227,
"kl": 9.906996726989746,
"learning_rate": 3.7997160907132456e-07,
"logits/chosen": -35509742.77675841,
"logits/rejected": -36660744.178913735,
"logps/chosen": -464.4618214831804,
"logps/rejected": -402.57413138977637,
"loss": 0.6111,
"loss/base_kto": 3.347426652908325,
"metrics/advantage_var": 557.73095703125,
"regularization/lipschitz_norm": 1575.1258544921875,
"regularization/mmd": 0.2184298038482666,
"regularization/rkhs_norm": 260.03546142578125,
"regularization/w1": 1.3231056928634644,
"rewards/chosen": 0.4095702565044438,
"rewards/margins": 0.7395967063721555,
"rewards/rejected": -0.3300264498677117,
"step": 1380
},
{
"epoch": 1.8134715025906736,
"grad_norm": 20.929731369018555,
"kl": 13.325279235839844,
"learning_rate": 3.662593828183601e-07,
"logits/chosen": -35300819.141993955,
"logits/rejected": -36888403.676375404,
"logps/chosen": -491.6428436555891,
"logps/rejected": -387.5301881067961,
"loss": 0.6156,
"loss/base_kto": 3.371952772140503,
"metrics/advantage_var": 591.1611328125,
"regularization/lipschitz_norm": 1585.736572265625,
"regularization/mmd": 0.22106890380382538,
"regularization/rkhs_norm": 263.17724609375,
"regularization/w1": 1.3320187330245972,
"rewards/chosen": 0.4284123077853569,
"rewards/margins": 0.7092018281477912,
"rewards/rejected": -0.28078952036243426,
"step": 1400
},
{
"epoch": 1.8393782383419688,
"grad_norm": 19.168020248413086,
"kl": 24.79313850402832,
"learning_rate": 3.5265466794927725e-07,
"logits/chosen": -34675983.73613194,
"logits/rejected": -37046298.727569334,
"logps/chosen": -485.2072713643178,
"logps/rejected": -380.17368474714516,
"loss": 0.5965,
"loss/base_kto": 3.2433724403381348,
"metrics/advantage_var": 628.1931762695312,
"regularization/lipschitz_norm": 1547.307373046875,
"regularization/mmd": 0.22901098430156708,
"regularization/rkhs_norm": 272.6321716308594,
"regularization/w1": 1.2997381687164307,
"rewards/chosen": 0.7070827226767475,
"rewards/margins": 0.7608968934768119,
"rewards/rejected": -0.05381417080006436,
"step": 1420
},
{
"epoch": 1.8652849740932642,
"grad_norm": 19.294036865234375,
"kl": 18.57269859313965,
"learning_rate": 3.3916840101987887e-07,
"logits/chosen": -34551352.88888889,
"logits/rejected": -35493497.304615386,
"logps/chosen": -496.13164682539684,
"logps/rejected": -384.56822115384614,
"loss": 0.6031,
"loss/base_kto": 3.3235702514648438,
"metrics/advantage_var": 544.8534545898438,
"regularization/lipschitz_norm": 1527.4329833984375,
"regularization/mmd": 0.21786895394325256,
"regularization/rkhs_norm": 259.3677673339844,
"regularization/w1": 1.2830437421798706,
"rewards/chosen": 0.5940665108816964,
"rewards/margins": 0.703149668934581,
"rewards/rejected": -0.10908315805288461,
"step": 1440
},
{
"epoch": 1.8911917098445596,
"grad_norm": 17.769622802734375,
"kl": 18.305875778198242,
"learning_rate": 3.258114233680583e-07,
"logits/chosen": -34146110.678466074,
"logits/rejected": -35203609.51495016,
"logps/chosen": -472.86771755162243,
"logps/rejected": -377.8817483388704,
"loss": 0.6051,
"loss/base_kto": 3.3327114582061768,
"metrics/advantage_var": 558.6193237304688,
"regularization/lipschitz_norm": 1534.943115234375,
"regularization/mmd": 0.21883177757263184,
"regularization/rkhs_norm": 260.5140686035156,
"regularization/w1": 1.289352297782898,
"rewards/chosen": 0.5489520857819413,
"rewards/margins": 0.7060017020918328,
"rewards/rejected": -0.1570496163098915,
"step": 1460
},
{
"epoch": 1.917098445595855,
"grad_norm": 17.7718563079834,
"kl": 23.075780868530273,
"learning_rate": 3.1259447239866796e-07,
"logits/chosen": -35102958.66456693,
"logits/rejected": -35600577.68682171,
"logps/chosen": -484.91643700787404,
"logps/rejected": -375.53309108527134,
"loss": 0.6,
"loss/base_kto": 3.2393798828125,
"metrics/advantage_var": 574.3668823242188,
"regularization/lipschitz_norm": 1593.2049560546875,
"regularization/mmd": 0.2220333069562912,
"regularization/rkhs_norm": 264.3254089355469,
"regularization/w1": 1.338292121887207,
"rewards/chosen": 0.6905491626168799,
"rewards/margins": 0.7939753167017879,
"rewards/rejected": -0.10342615408490795,
"step": 1480
},
{
"epoch": 1.9430051813471503,
"grad_norm": 15.457829475402832,
"kl": 12.52320384979248,
"learning_rate": 2.9952817295193435e-07,
"logits/chosen": -33102049.377990432,
"logits/rejected": -34965566.72588055,
"logps/chosen": -429.6735446570973,
"logps/rejected": -376.3966309341501,
"loss": 0.5887,
"loss/base_kto": 3.3145387172698975,
"metrics/advantage_var": 505.8414611816406,
"regularization/lipschitz_norm": 1414.2044677734375,
"regularization/mmd": 0.20702052116394043,
"regularization/rkhs_norm": 246.45298767089844,
"regularization/w1": 1.1879316568374634,
"rewards/chosen": 0.46009780421401514,
"rewards/margins": 0.7476684479676043,
"rewards/rejected": -0.2875706437535892,
"step": 1500
},
{
"epoch": 1.9689119170984455,
"grad_norm": 17.53460121154785,
"kl": 11.304563522338867,
"learning_rate": 2.866230287623651e-07,
"logits/chosen": -33528204.4928,
"logits/rejected": -35500178.95572519,
"logps/chosen": -480.1816,
"logps/rejected": -364.10090648854964,
"loss": 0.5787,
"loss/base_kto": 3.3365864753723145,
"metrics/advantage_var": 435.8765563964844,
"regularization/lipschitz_norm": 1309.818359375,
"regularization/mmd": 0.19297796487808228,
"regularization/rkhs_norm": 229.73570251464844,
"regularization/w1": 1.1002473831176758,
"rewards/chosen": 0.3936514892578125,
"rewards/margins": 0.7107887400852815,
"rewards/rejected": -0.31713725082746896,
"step": 1520
},
{
"epoch": 1.994818652849741,
"grad_norm": 20.982736587524414,
"kl": 16.45754051208496,
"learning_rate": 2.738894140150075e-07,
"logits/chosen": -34330087.46325879,
"logits/rejected": -36283514.128440365,
"logps/chosen": -488.2354233226837,
"logps/rejected": -365.8191179281346,
"loss": 0.5874,
"loss/base_kto": 3.2102324962615967,
"metrics/advantage_var": 571.2377319335938,
"regularization/lipschitz_norm": 1511.39208984375,
"regularization/mmd": 0.21960020065307617,
"regularization/rkhs_norm": 261.4288024902344,
"regularization/w1": 1.2695693969726562,
"rewards/chosen": 0.6090651442067692,
"rewards/margins": 0.8277040396906903,
"rewards/rejected": -0.21863889548392107,
"step": 1540
},
{
"epoch": 2.0207253886010363,
"grad_norm": 24.38959312438965,
"kl": 10.066145896911621,
"learning_rate": 2.6133756500585156e-07,
"logits/chosen": -33685604.39215686,
"logits/rejected": -36349195.531531535,
"logps/chosen": -511.3855187908497,
"logps/rejected": -370.44906625375376,
"loss": 0.5724,
"loss/base_kto": 3.1862754821777344,
"metrics/advantage_var": 471.1880798339844,
"regularization/lipschitz_norm": 1413.9962158203125,
"regularization/mmd": 0.20521269738674164,
"regularization/rkhs_norm": 244.3008270263672,
"regularization/w1": 1.187756896018982,
"rewards/chosen": 0.42331710516237747,
"rewards/margins": 0.8650323800075351,
"rewards/rejected": -0.44171527484515766,
"step": 1560
},
{
"epoch": 2.0466321243523318,
"grad_norm": 16.744922637939453,
"kl": 6.093294143676758,
"learning_rate": 2.489775719130767e-07,
"logits/chosen": -34285671.49770291,
"logits/rejected": -35901518.3923445,
"logps/chosen": -450.2323411179173,
"logps/rejected": -358.33816786283893,
"loss": 0.5655,
"loss/base_kto": 3.2421271800994873,
"metrics/advantage_var": 398.6988220214844,
"regularization/lipschitz_norm": 1302.47216796875,
"regularization/mmd": 0.18811742961406708,
"regularization/rkhs_norm": 223.9492950439453,
"regularization/w1": 1.0940767526626587,
"rewards/chosen": 0.32462368040683626,
"rewards/margins": 0.8251295810560089,
"rewards/rejected": -0.5005059006491727,
"step": 1580
},
{
"epoch": 2.0725388601036268,
"grad_norm": 15.231117248535156,
"kl": 14.46772289276123,
"learning_rate": 2.3681937068576303e-07,
"logits/chosen": -33527996.588045236,
"logits/rejected": -36213519.87897126,
"logps/chosen": -473.9477483844911,
"logps/rejected": -368.1678328290469,
"loss": 0.5643,
"loss/base_kto": 3.1471424102783203,
"metrics/advantage_var": 468.8351135253906,
"regularization/lipschitz_norm": 1388.1361083984375,
"regularization/mmd": 0.20132914185523987,
"regularization/rkhs_norm": 239.6775665283203,
"regularization/w1": 1.16603422164917,
"rewards/chosen": 0.5777252640978393,
"rewards/margins": 0.9047327020765175,
"rewards/rejected": -0.32700743797867815,
"step": 1600
},
{
"epoch": 2.098445595854922,
"grad_norm": 16.150474548339844,
"kl": 13.114829063415527,
"learning_rate": 2.2487273505658e-07,
"logits/chosen": -33886970.19062027,
"logits/rejected": -35522364.794830374,
"logps/chosen": -484.9406202723147,
"logps/rejected": -377.06906300484656,
"loss": 0.5533,
"loss/base_kto": 3.1854093074798584,
"metrics/advantage_var": 406.8522644042969,
"regularization/lipschitz_norm": 1252.0865478515625,
"regularization/mmd": 0.18890316784381866,
"regularization/rkhs_norm": 224.8847198486328,
"regularization/w1": 1.0517528057098389,
"rewards/chosen": 0.5183056068131855,
"rewards/margins": 0.848153888599585,
"rewards/rejected": -0.3298482817863994,
"step": 1620
},
{
"epoch": 2.1243523316062176,
"grad_norm": 15.473814010620117,
"kl": 17.653127670288086,
"learning_rate": 2.131472686848817e-07,
"logits/chosen": -33017974.815267175,
"logits/rejected": -35228214.8864,
"logps/chosen": -479.8187977099237,
"logps/rejected": -402.57725,
"loss": 0.5667,
"loss/base_kto": 3.2326602935791016,
"metrics/advantage_var": 400.2431640625,
"regularization/lipschitz_norm": 1319.3643798828125,
"regularization/mmd": 0.19271209836006165,
"regularization/rkhs_norm": 229.41917419433594,
"regularization/w1": 1.1082661151885986,
"rewards/chosen": 0.5932373512792223,
"rewards/margins": 0.7835901833104723,
"rewards/rejected": -0.19035283203125,
"step": 1640
},
{
"epoch": 2.150259067357513,
"grad_norm": 16.87969398498535,
"kl": 18.03767967224121,
"learning_rate": 2.016523974365188e-07,
"logits/chosen": -33777692.31336406,
"logits/rejected": -33452657.144674085,
"logps/chosen": -464.07757296466974,
"logps/rejected": -374.0326659379968,
"loss": 0.5503,
"loss/base_kto": 3.2006988525390625,
"metrics/advantage_var": 371.6629943847656,
"regularization/lipschitz_norm": 1215.2666015625,
"regularization/mmd": 0.18069247901439667,
"regularization/rkhs_norm": 215.11009216308594,
"regularization/w1": 1.0208238363265991,
"rewards/chosen": 0.6284561743201564,
"rewards/margins": 0.8098387583992378,
"rewards/rejected": -0.18138258407908137,
"step": 1660
},
{
"epoch": 2.1761658031088085,
"grad_norm": 18.629518508911133,
"kl": 18.80061912536621,
"learning_rate": 1.9039736180657372e-07,
"logits/chosen": -34484123.5443038,
"logits/rejected": -35300807.11111111,
"logps/chosen": -485.61931368670884,
"logps/rejected": -359.957706404321,
"loss": 0.5564,
"loss/base_kto": 3.1661229133605957,
"metrics/advantage_var": 428.8267517089844,
"regularization/lipschitz_norm": 1296.47216796875,
"regularization/mmd": 0.19565041363239288,
"regularization/rkhs_norm": 232.91714477539062,
"regularization/w1": 1.0890367031097412,
"rewards/chosen": 0.5882649482051029,
"rewards/margins": 0.8664850895806093,
"rewards/rejected": -0.2782201413755064,
"step": 1680
},
{
"epoch": 2.2020725388601035,
"grad_norm": 15.930831909179688,
"kl": 12.853654861450195,
"learning_rate": 1.7939120949111498e-07,
"logits/chosen": -34078057.69544741,
"logits/rejected": -36082511.228615865,
"logps/chosen": -466.06490384615387,
"logps/rejected": -374.1058028771384,
"loss": 0.5508,
"loss/base_kto": 3.140216588973999,
"metrics/advantage_var": 435.0933532714844,
"regularization/lipschitz_norm": 1276.956298828125,
"regularization/mmd": 0.19340650737285614,
"regularization/rkhs_norm": 230.245849609375,
"regularization/w1": 1.0726432800292969,
"rewards/chosen": 0.5829016477384223,
"rewards/margins": 0.9139953483787314,
"rewards/rejected": -0.3310937006403091,
"step": 1700
},
{
"epoch": 2.227979274611399,
"grad_norm": 16.821569442749023,
"kl": 7.62105655670166,
"learning_rate": 1.6864278811393523e-07,
"logits/chosen": -35488667.80762853,
"logits/rejected": -36658534.47562777,
"logps/chosen": -485.698175787728,
"logps/rejected": -380.7929283604136,
"loss": 0.5658,
"loss/base_kto": 3.2048003673553467,
"metrics/advantage_var": 434.58203125,
"regularization/lipschitz_norm": 1341.75390625,
"regularization/mmd": 0.19418182969093323,
"regularization/rkhs_norm": 231.16885375976562,
"regularization/w1": 1.1270732879638672,
"rewards/chosen": 0.36956827597040837,
"rewards/margins": 0.8421052955507029,
"rewards/rejected": -0.4725370195802945,
"step": 1720
},
{
"epoch": 2.2538860103626943,
"grad_norm": 15.676944732666016,
"kl": 11.570111274719238,
"learning_rate": 1.5816073811412584e-07,
"logits/chosen": -35635880.640949555,
"logits/rejected": -35923116.35643564,
"logps/chosen": -483.6896327893175,
"logps/rejected": -379.38484942244224,
"loss": 0.5672,
"loss/base_kto": 3.2221601009368896,
"metrics/advantage_var": 428.28082275390625,
"regularization/lipschitz_norm": 1334.6649169921875,
"regularization/mmd": 0.1941031962633133,
"regularization/rkhs_norm": 231.0752410888672,
"regularization/w1": 1.121118426322937,
"rewards/chosen": 0.4732017630285608,
"rewards/margins": 0.8385917978206142,
"rewards/rejected": -0.3653900347920534,
"step": 1740
},
{
"epoch": 2.2797927461139897,
"grad_norm": 16.814882278442383,
"kl": 16.061059951782227,
"learning_rate": 1.4795348580020207e-07,
"logits/chosen": -32831983.01421801,
"logits/rejected": -33324321.632148378,
"logps/chosen": -489.8043542654028,
"logps/rejected": -380.7750676197836,
"loss": 0.5513,
"loss/base_kto": 3.1702046394348145,
"metrics/advantage_var": 415.2689514160156,
"regularization/lipschitz_norm": 1248.6136474609375,
"regularization/mmd": 0.19127409160137177,
"regularization/rkhs_norm": 227.707275390625,
"regularization/w1": 1.0488356351852417,
"rewards/chosen": 0.6030927661094244,
"rewards/margins": 0.8348279012659763,
"rewards/rejected": -0.23173513515655186,
"step": 1760
},
{
"epoch": 2.305699481865285,
"grad_norm": 12.883003234863281,
"kl": 17.076210021972656,
"learning_rate": 1.3802923657636355e-07,
"logits/chosen": -34445181.34609251,
"logits/rejected": -34563732.189892806,
"logps/chosen": -483.13631379585325,
"logps/rejected": -396.7334178790199,
"loss": 0.5518,
"loss/base_kto": 3.1647095680236816,
"metrics/advantage_var": 399.47119140625,
"regularization/lipschitz_norm": 1262.6822509765625,
"regularization/mmd": 0.18878653645515442,
"regularization/rkhs_norm": 224.74588012695312,
"regularization/w1": 1.0606530904769897,
"rewards/chosen": 0.5081650340005731,
"rewards/margins": 0.8531283530867619,
"rewards/rejected": -0.34496331908618877,
"step": 1780
},
{
"epoch": 2.33160621761658,
"grad_norm": 12.072251319885254,
"kl": 12.94206428527832,
"learning_rate": 1.28395968346336e-07,
"logits/chosen": -33732443.14551084,
"logits/rejected": -35300174.33438486,
"logps/chosen": -486.4296633126935,
"logps/rejected": -377.6941541798107,
"loss": 0.5583,
"loss/base_kto": 3.222911834716797,
"metrics/advantage_var": 407.7722473144531,
"regularization/lipschitz_norm": 1255.7818603515625,
"regularization/mmd": 0.18879146873950958,
"regularization/rkhs_norm": 224.7517547607422,
"regularization/w1": 1.0548566579818726,
"rewards/chosen": 0.543099370903275,
"rewards/margins": 0.8194063896766879,
"rewards/rejected": -0.27630701877341285,
"step": 1800
},
{
"epoch": 2.3575129533678756,
"grad_norm": 15.54910659790039,
"kl": 13.353614807128906,
"learning_rate": 1.1906142510009415e-07,
"logits/chosen": -35772769.774960384,
"logits/rejected": -37077389.60862866,
"logps/chosen": -498.39064976228207,
"logps/rejected": -369.52077715716484,
"loss": 0.5632,
"loss/base_kto": 3.182352066040039,
"metrics/advantage_var": 432.904052734375,
"regularization/lipschitz_norm": 1338.9703369140625,
"regularization/mmd": 0.19866575300693512,
"regularization/rkhs_norm": 236.5068817138672,
"regularization/w1": 1.1247349977493286,
"rewards/chosen": 0.5464045166402536,
"rewards/margins": 0.8784624048652271,
"rewards/rejected": -0.3320578882249735,
"step": 1820
},
{
"epoch": 2.383419689119171,
"grad_norm": 20.564775466918945,
"kl": 11.661320686340332,
"learning_rate": 1.1003311068862547e-07,
"logits/chosen": -32944747.08496732,
"logits/rejected": -35643655.66467066,
"logps/chosen": -455.8532475490196,
"logps/rejected": -378.85076721556885,
"loss": 0.5619,
"loss/base_kto": 3.2213783264160156,
"metrics/advantage_var": 388.0046081542969,
"regularization/lipschitz_norm": 1295.4930419921875,
"regularization/mmd": 0.18541449308395386,
"regularization/rkhs_norm": 220.73155212402344,
"regularization/w1": 1.0882141590118408,
"rewards/chosen": 0.47248920116549226,
"rewards/margins": 0.8133289069468007,
"rewards/rejected": -0.34083970578130846,
"step": 1840
},
{
"epoch": 2.4093264248704664,
"grad_norm": 17.54700469970703,
"kl": 11.190667152404785,
"learning_rate": 1.0131828279173588e-07,
"logits/chosen": -34326311.896103896,
"logits/rejected": -34741180.144578315,
"logps/chosen": -484.99746347402595,
"logps/rejected": -382.47084431475906,
"loss": 0.5557,
"loss/base_kto": 3.1432552337646484,
"metrics/advantage_var": 424.0445861816406,
"regularization/lipschitz_norm": 1316.8843994140625,
"regularization/mmd": 0.19596289098262787,
"regularization/rkhs_norm": 233.28916931152344,
"regularization/w1": 1.1061829328536987,
"rewards/chosen": 0.48927921443790584,
"rewards/margins": 0.9105940514225632,
"rewards/rejected": -0.4213148369846574,
"step": 1860
},
{
"epoch": 2.4352331606217614,
"grad_norm": 19.427793502807617,
"kl": 9.268104553222656,
"learning_rate": 9.292394708374596e-08,
"logits/chosen": -33830608.47425897,
"logits/rejected": -35580778.96713615,
"logps/chosen": -476.53251755070204,
"logps/rejected": -366.06729264475746,
"loss": 0.5555,
"loss/base_kto": 3.2102913856506348,
"metrics/advantage_var": 397.2903747558594,
"regularization/lipschitz_norm": 1246.5311279296875,
"regularization/mmd": 0.1869805008172989,
"regularization/rkhs_norm": 222.5958251953125,
"regularization/w1": 1.0470861196517944,
"rewards/chosen": 0.413074035168438,
"rewards/margins": 0.8241628144805957,
"rewards/rejected": -0.41108877931215765,
"step": 1880
},
{
"epoch": 2.461139896373057,
"grad_norm": 16.621356964111328,
"kl": 9.321684837341309,
"learning_rate": 8.48568516017727e-08,
"logits/chosen": -34411588.71358429,
"logits/rejected": -35057155.82660688,
"logps/chosen": -467.51825900163664,
"logps/rejected": -373.80061192077727,
"loss": 0.5517,
"loss/base_kto": 3.147170305252075,
"metrics/advantage_var": 410.929443359375,
"regularization/lipschitz_norm": 1280.960693359375,
"regularization/mmd": 0.1903020590543747,
"regularization/rkhs_norm": 226.550048828125,
"regularization/w1": 1.0760070085525513,
"rewards/chosen": 0.4403392835451616,
"rewards/margins": 0.886958063615696,
"rewards/rejected": -0.4466187800705344,
"step": 1900
},
{
"epoch": 2.4870466321243523,
"grad_norm": 13.901752471923828,
"kl": 10.043939590454102,
"learning_rate": 7.71234813211169e-08,
"logits/chosen": -33997121.69206843,
"logits/rejected": -35513554.58712716,
"logps/chosen": -488.57494167962676,
"logps/rejected": -381.6866169544741,
"loss": 0.5611,
"loss/base_kto": 3.221677541732788,
"metrics/advantage_var": 412.7735290527344,
"regularization/lipschitz_norm": 1280.602294921875,
"regularization/mmd": 0.19151243567466736,
"regularization/rkhs_norm": 227.990966796875,
"regularization/w1": 1.075705885887146,
"rewards/chosen": 0.4254934450330482,
"rewards/margins": 0.8191984926883784,
"rewards/rejected": -0.39370504765533015,
"step": 1920
},
{
"epoch": 2.5129533678756477,
"grad_norm": 17.917987823486328,
"kl": 12.19534683227539,
"learning_rate": 6.973005294212353e-08,
"logits/chosen": -34556649.03099511,
"logits/rejected": -35139872.623688154,
"logps/chosen": -472.51203099510604,
"logps/rejected": -365.3452258245877,
"loss": 0.5633,
"loss/base_kto": 3.1732165813446045,
"metrics/advantage_var": 440.358642578125,
"regularization/lipschitz_norm": 1348.8330078125,
"regularization/mmd": 0.1998414844274521,
"regularization/rkhs_norm": 237.9065399169922,
"regularization/w1": 1.1330196857452393,
"rewards/chosen": 0.5041173838480068,
"rewards/margins": 0.8656737272583328,
"rewards/rejected": -0.3615563434103261,
"step": 1940
},
{
"epoch": 2.538860103626943,
"grad_norm": 16.038705825805664,
"kl": 8.044748306274414,
"learning_rate": 6.268250989270102e-08,
"logits/chosen": -34879443.95698924,
"logits/rejected": -36427339.70111288,
"logps/chosen": -454.03168202764977,
"logps/rejected": -366.30882352941177,
"loss": 0.5639,
"loss/base_kto": 3.2381465435028076,
"metrics/advantage_var": 407.84893798828125,
"regularization/lipschitz_norm": 1291.3255615234375,
"regularization/mmd": 0.18864312767982483,
"regularization/rkhs_norm": 224.5751495361328,
"regularization/w1": 1.0847134590148926,
"rewards/chosen": 0.4419856620823733,
"rewards/margins": 0.8166408474118894,
"rewards/rejected": -0.3746551853295161,
"step": 1960
},
{
"epoch": 2.5647668393782386,
"grad_norm": 14.634725570678711,
"kl": 9.459915161132812,
"learning_rate": 5.598651755051975e-08,
"logits/chosen": -35243809.39130435,
"logits/rejected": -35290681.96226415,
"logps/chosen": -479.1896350931677,
"logps/rejected": -391.6245332154088,
"loss": 0.569,
"loss/base_kto": 3.2139854431152344,
"metrics/advantage_var": 756.03515625,
"regularization/lipschitz_norm": 1348.5595703125,
"regularization/mmd": 0.20550327003002167,
"regularization/rkhs_norm": 244.64675903320312,
"regularization/w1": 1.132789969444275,
"rewards/chosen": 0.4553101344138199,
"rewards/margins": 0.7884958701523223,
"rewards/rejected": -0.33318573573850235,
"step": 1980
},
{
"epoch": 2.5906735751295336,
"grad_norm": 16.276470184326172,
"kl": 9.328352928161621,
"learning_rate": 4.964745868872933e-08,
"logits/chosen": -34422215.941605836,
"logits/rejected": -35732554.003361344,
"logps/chosen": -505.9730383211679,
"logps/rejected": -361.4629726890756,
"loss": 0.5628,
"loss/base_kto": 3.202509641647339,
"metrics/advantage_var": 419.1310729980469,
"regularization/lipschitz_norm": 1316.6361083984375,
"regularization/mmd": 0.19425955414772034,
"regularization/rkhs_norm": 231.26138305664062,
"regularization/w1": 1.1059744358062744,
"rewards/chosen": 0.5190720606894389,
"rewards/margins": 0.8420494120303659,
"rewards/rejected": -0.322977351340927,
"step": 2000
},
{
"epoch": 2.616580310880829,
"grad_norm": 13.80461597442627,
"kl": 12.417572021484375,
"learning_rate": 4.3670429148855493e-08,
"logits/chosen": -32793040.0,
"logits/rejected": -34299273.6,
"logps/chosen": -460.17451171875,
"logps/rejected": -364.22275390625,
"loss": 0.5533,
"loss/base_kto": 3.2077388763427734,
"metrics/advantage_var": 371.815185546875,
"regularization/lipschitz_norm": 1230.1234130859375,
"regularization/mmd": 0.185292050242424,
"regularization/rkhs_norm": 220.58580017089844,
"regularization/w1": 1.0333036184310913,
"rewards/chosen": 0.4350123405456543,
"rewards/margins": 0.8055490016937256,
"rewards/rejected": -0.37053666114807127,
"step": 2020
},
{
"epoch": 2.6424870466321244,
"grad_norm": 17.276737213134766,
"kl": 11.258346557617188,
"learning_rate": 3.806023374435663e-08,
"logits/chosen": -35090397.7108067,
"logits/rejected": -36635156.545746386,
"logps/chosen": -492.5710616438356,
"logps/rejected": -380.5577849117175,
"loss": 0.5613,
"loss/base_kto": 3.14424467086792,
"metrics/advantage_var": 449.4054870605469,
"regularization/lipschitz_norm": 1363.7271728515625,
"regularization/mmd": 0.20050835609436035,
"regularization/rkhs_norm": 238.700439453125,
"regularization/w1": 1.1455309391021729,
"rewards/chosen": 0.5235326293759512,
"rewards/margins": 0.8973924084032134,
"rewards/rejected": -0.37385977902726225,
"step": 2040
},
{
"epoch": 2.66839378238342,
"grad_norm": 12.550277709960938,
"kl": 10.444754600524902,
"learning_rate": 3.282138239813037e-08,
"logits/chosen": -34444704.0,
"logits/rejected": -35671232.0,
"logps/chosen": -465.1693359375,
"logps/rejected": -378.2304931640625,
"loss": 0.5527,
"loss/base_kto": 3.1610734462738037,
"metrics/advantage_var": 407.6515808105469,
"regularization/lipschitz_norm": 1273.321533203125,
"regularization/mmd": 0.1907428801059723,
"regularization/rkhs_norm": 227.07485961914062,
"regularization/w1": 1.0695899724960327,
"rewards/chosen": 0.4995744705200195,
"rewards/margins": 0.8770462989807128,
"rewards/rejected": -0.3774718284606934,
"step": 2060
},
{
"epoch": 2.694300518134715,
"grad_norm": 16.51201629638672,
"kl": 13.741698265075684,
"learning_rate": 2.795808651707793e-08,
"logits/chosen": -32024102.379585326,
"logits/rejected": -34391518.284839205,
"logps/chosen": -478.58542663476874,
"logps/rejected": -373.9956690275651,
"loss": 0.5667,
"loss/base_kto": 3.210426092147827,
"metrics/advantage_var": 413.5577087402344,
"regularization/lipschitz_norm": 1346.5155029296875,
"regularization/mmd": 0.19190925359725952,
"regularization/rkhs_norm": 228.46337890625,
"regularization/w1": 1.131072998046875,
"rewards/chosen": 0.4855345706240032,
"rewards/margins": 0.8143200682222278,
"rewards/rejected": -0.32878549759822456,
"step": 2080
},
{
"epoch": 2.7202072538860103,
"grad_norm": 18.484439849853516,
"kl": 11.56452751159668,
"learning_rate": 2.3474255606639293e-08,
"logits/chosen": -34112359.095022626,
"logits/rejected": -34866048.20745543,
"logps/chosen": -525.6364064856712,
"logps/rejected": -385.23429902755265,
"loss": 0.5565,
"loss/base_kto": 3.181814670562744,
"metrics/advantage_var": 416.8466491699219,
"regularization/lipschitz_norm": 1283.6746826171875,
"regularization/mmd": 0.19223769009113312,
"regularization/rkhs_norm": 228.85440063476562,
"regularization/w1": 1.0782866477966309,
"rewards/chosen": 0.5313625421998728,
"rewards/margins": 0.8509247648213021,
"rewards/rejected": -0.3195622226214293,
"step": 2100
},
{
"epoch": 2.7461139896373057,
"grad_norm": 15.074495315551758,
"kl": 13.301358222961426,
"learning_rate": 1.9373494128020195e-08,
"logits/chosen": -33762499.88180404,
"logits/rejected": -35133546.09733124,
"logps/chosen": -501.5098658631415,
"logps/rejected": -390.72932201726843,
"loss": 0.5571,
"loss/base_kto": 3.155550718307495,
"metrics/advantage_var": 442.30792236328125,
"regularization/lipschitz_norm": 1313.21875,
"regularization/mmd": 0.19832029938697815,
"regularization/rkhs_norm": 236.09561157226562,
"regularization/w1": 1.1031038761138916,
"rewards/chosen": 0.5467796978275661,
"rewards/margins": 0.8790458421533853,
"rewards/rejected": -0.33226614432581925,
"step": 2120
},
{
"epoch": 2.772020725388601,
"grad_norm": 17.058185577392578,
"kl": 12.665131568908691,
"learning_rate": 1.5659098600638798e-08,
"logits/chosen": -34718008.51948052,
"logits/rejected": -35636825.44578313,
"logps/chosen": -491.0309456168831,
"logps/rejected": -374.4232398343373,
"loss": 0.5629,
"loss/base_kto": 3.1329848766326904,
"metrics/advantage_var": 457.51763916015625,
"regularization/lipschitz_norm": 1389.5159912109375,
"regularization/mmd": 0.20291300117969513,
"regularization/rkhs_norm": 241.56309509277344,
"regularization/w1": 1.1671934127807617,
"rewards/chosen": 0.5600868324180702,
"rewards/margins": 0.9178547877844576,
"rewards/rejected": -0.35776795536638745,
"step": 2140
},
{
"epoch": 2.7979274611398965,
"grad_norm": 17.0068302154541,
"kl": 13.439288139343262,
"learning_rate": 1.2334054952120143e-08,
"logits/chosen": -33648611.15492958,
"logits/rejected": -33730553.6099844,
"logps/chosen": -477.58954420970264,
"logps/rejected": -391.1602476599064,
"loss": 0.5589,
"loss/base_kto": 3.1639182567596436,
"metrics/advantage_var": 429.63092041015625,
"regularization/lipschitz_norm": 1322.3231201171875,
"regularization/mmd": 0.19627168774604797,
"regularization/rkhs_norm": 233.65676879882812,
"regularization/w1": 1.1107515096664429,
"rewards/chosen": 0.5450326743446792,
"rewards/margins": 0.8872925024331152,
"rewards/rejected": -0.342259828088436,
"step": 2160
},
{
"epoch": 2.823834196891192,
"grad_norm": 24.721040725708008,
"kl": 13.245546340942383,
"learning_rate": 9.401036117969108e-09,
"logits/chosen": -34619685.46341463,
"logits/rejected": -36175067.897435896,
"logps/chosen": -466.7677210365854,
"logps/rejected": -393.8449268830128,
"loss": 0.5627,
"loss/base_kto": 3.2227227687835693,
"metrics/advantage_var": 411.6934509277344,
"regularization/lipschitz_norm": 1293.9947509765625,
"regularization/mmd": 0.19191764295101166,
"regularization/rkhs_norm": 228.473388671875,
"regularization/w1": 1.0869555473327637,
"rewards/chosen": 0.5141576906529869,
"rewards/margins": 0.8208652929338237,
"rewards/rejected": -0.3067076022808368,
"step": 2180
},
{
"epoch": 2.849740932642487,
"grad_norm": 14.489055633544922,
"kl": 13.369745254516602,
"learning_rate": 6.8623998928517555e-09,
"logits/chosen": -35949103.10708899,
"logits/rejected": -36102602.06158833,
"logps/chosen": -496.85454374057315,
"logps/rejected": -376.66541734197733,
"loss": 0.5664,
"loss/base_kto": 3.215487241744995,
"metrics/advantage_var": 448.605712890625,
"regularization/lipschitz_norm": 1330.0577392578125,
"regularization/mmd": 0.19885368645191193,
"regularization/rkhs_norm": 236.73057556152344,
"regularization/w1": 1.11724853515625,
"rewards/chosen": 0.5273163164003583,
"rewards/margins": 0.8341436575388054,
"rewards/rejected": -0.3068273411384471,
"step": 2200
},
{
"epoch": 2.8756476683937824,
"grad_norm": 13.536358833312988,
"kl": 12.86722469329834,
"learning_rate": 4.72018703521132e-09,
"logits/chosen": -34022955.01812191,
"logits/rejected": -34775989.44427934,
"logps/chosen": -480.06558896210873,
"logps/rejected": -368.3996099554235,
"loss": 0.551,
"loss/base_kto": 3.181318998336792,
"metrics/advantage_var": 385.2022399902344,
"regularization/lipschitz_norm": 1239.7713623046875,
"regularization/mmd": 0.18530936539173126,
"regularization/rkhs_norm": 220.6063690185547,
"regularization/w1": 1.0414079427719116,
"rewards/chosen": 0.5009799812731672,
"rewards/margins": 0.8290710627762319,
"rewards/rejected": -0.32809108150306465,
"step": 2220
},
{
"epoch": 2.901554404145078,
"grad_norm": 14.650564193725586,
"kl": 14.825749397277832,
"learning_rate": 2.976119626744267e-09,
"logits/chosen": -33724834.47678018,
"logits/rejected": -34945159.67192429,
"logps/chosen": -478.2694465944272,
"logps/rejected": -351.54847693217664,
"loss": 0.5605,
"loss/base_kto": 3.2014389038085938,
"metrics/advantage_var": 422.40191650390625,
"regularization/lipschitz_norm": 1298.9710693359375,
"regularization/mmd": 0.19174747169017792,
"regularization/rkhs_norm": 228.2707977294922,
"regularization/w1": 1.0911357402801514,
"rewards/chosen": 0.47620068245997,
"rewards/margins": 0.8418120987682557,
"rewards/rejected": -0.3656114163082857,
"step": 2240
},
{
"epoch": 2.927461139896373,
"grad_norm": 15.799490928649902,
"kl": 10.568368911743164,
"learning_rate": 1.631599688052765e-09,
"logits/chosen": -34498614.371681415,
"logits/rejected": -35521988.46511628,
"logps/chosen": -485.20856379056045,
"logps/rejected": -390.46776370431894,
"loss": 0.5611,
"loss/base_kto": 3.154115676879883,
"metrics/advantage_var": 479.8663024902344,
"regularization/lipschitz_norm": 1348.2919921875,
"regularization/mmd": 0.20181012153625488,
"regularization/rkhs_norm": 240.25015258789062,
"regularization/w1": 1.1325653791427612,
"rewards/chosen": 0.591974849194552,
"rewards/margins": 0.9252405149522478,
"rewards/rejected": -0.33326566575769573,
"step": 2260
},
{
"epoch": 2.9533678756476682,
"grad_norm": 17.943862915039062,
"kl": 15.242505073547363,
"learning_rate": 6.877080515894085e-10,
"logits/chosen": -32926362.48973144,
"logits/rejected": -34461483.91962906,
"logps/chosen": -481.78554502369667,
"logps/rejected": -367.1816557187017,
"loss": 0.5593,
"loss/base_kto": 3.1754376888275146,
"metrics/advantage_var": 450.428466796875,
"regularization/lipschitz_norm": 1311.7330322265625,
"regularization/mmd": 0.19746826589107513,
"regularization/rkhs_norm": 235.08128356933594,
"regularization/w1": 1.1018556356430054,
"rewards/chosen": 0.5447033826397117,
"rewards/margins": 0.870565742419223,
"rewards/rejected": -0.3258623597795112,
"step": 2280
},
{
"epoch": 2.9792746113989637,
"grad_norm": 15.731083869934082,
"kl": 13.339346885681152,
"learning_rate": 1.4520349279739663e-10,
"logits/chosen": -34977229.61269841,
"logits/rejected": -35997368.32,
"logps/chosen": -483.57232142857146,
"logps/rejected": -373.6041826923077,
"loss": 0.5542,
"loss/base_kto": 3.2174980640411377,
"metrics/advantage_var": 407.316162109375,
"regularization/lipschitz_norm": 1221.539306640625,
"regularization/mmd": 0.19036178290843964,
"regularization/rkhs_norm": 226.6211395263672,
"regularization/w1": 1.0260928869247437,
"rewards/chosen": 0.49627549913194446,
"rewards/margins": 0.8086349304720887,
"rewards/rejected": -0.3123594313401442,
"step": 2300
},
{
"epoch": 3.0,
"step": 2316,
"total_flos": 9.989338484496138e+17,
"train_loss": 0.587049578961519,
"train_runtime": 11087.4794,
"train_samples_per_second": 13.368,
"train_steps_per_second": 0.209
}
],
"logging_steps": 20,
"max_steps": 2316,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": false,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 9.989338484496138e+17,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}