Files
aup-fullft-kto_w1-w1lam9.68…/trainer_state.json
ModelHub XC 5b29822751 初始化项目,由ModelHub XC社区提供模型
Model: Gueule-d-ange/aup-fullft-kto_w1-w1lam9.68e-4-seed2024
Source: Original Platform
2026-07-24 04:58:11 +08:00

2229 lines
81 KiB
JSON

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 3.0,
"eval_steps": 500,
"global_step": 2316,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.025906735751295335,
"grad_norm": 28.284679412841797,
"kl": 6.050708770751953,
"learning_rate": 1.8999999999999998e-07,
"logits/chosen": -35905811.44303797,
"logits/rejected": -37529982.41975309,
"logps/chosen": -502.37598892405066,
"logps/rejected": -375.49351369598764,
"loss": 0.6245,
"loss/base_kto": 3.9251296520233154,
"metrics/advantage_var": 268.6701354980469,
"regularization/lipschitz_norm": 1106.2261962890625,
"regularization/w1": 1.0708268880844116,
"rewards/chosen": -0.017651963837539093,
"rewards/margins": 0.05768750654307916,
"rewards/rejected": -0.07533947038061825,
"step": 20
},
{
"epoch": 0.05181347150259067,
"grad_norm": 19.63833236694336,
"kl": 15.056320190429688,
"learning_rate": 3.8999999999999997e-07,
"logits/chosen": -35845774.79198767,
"logits/rejected": -37855309.89540412,
"logps/chosen": -491.9004718798151,
"logps/rejected": -360.1343601426307,
"loss": 0.5916,
"loss/base_kto": 3.885058641433716,
"metrics/advantage_var": 169.64816284179688,
"regularization/lipschitz_norm": 875.93212890625,
"regularization/w1": 0.8479022979736328,
"rewards/chosen": 0.2674639544611903,
"rewards/margins": 0.08395554244312622,
"rewards/rejected": 0.1835084120180641,
"step": 40
},
{
"epoch": 0.07772020725388601,
"grad_norm": 27.621639251708984,
"kl": 6.546723365783691,
"learning_rate": 5.9e-07,
"logits/chosen": -34515715.28205128,
"logits/rejected": -35476376.97560976,
"logps/chosen": -469.22045272435895,
"logps/rejected": -363.3183117378049,
"loss": 0.5881,
"loss/base_kto": 3.901015043258667,
"metrics/advantage_var": 152.6851043701172,
"regularization/lipschitz_norm": 830.13037109375,
"regularization/w1": 0.8035661578178406,
"rewards/chosen": 0.1407624880472819,
"rewards/margins": 0.09935606010561066,
"rewards/rejected": 0.04140642794167123,
"step": 60
},
{
"epoch": 0.10362694300518134,
"grad_norm": 21.418718338012695,
"kl": 8.766357421875,
"learning_rate": 7.9e-07,
"logits/chosen": -37755302.5007874,
"logits/rejected": -37971259.931782946,
"logps/chosen": -505.62780511811025,
"logps/rejected": -384.92449127906974,
"loss": 0.5918,
"loss/base_kto": 3.8352959156036377,
"metrics/advantage_var": 188.04177856445312,
"regularization/lipschitz_norm": 929.0358276367188,
"regularization/w1": 0.8993067145347595,
"rewards/chosen": 0.1343505258635273,
"rewards/margins": 0.16536262182498715,
"rewards/rejected": -0.031012095961459846,
"step": 80
},
{
"epoch": 0.12953367875647667,
"grad_norm": 18.957792282104492,
"kl": 7.623079776763916,
"learning_rate": 9.9e-07,
"logits/chosen": -36767270.419601835,
"logits/rejected": -38095099.508771926,
"logps/chosen": -491.09331929555896,
"logps/rejected": -373.7985446570973,
"loss": 0.6075,
"loss/base_kto": 3.8539459705352783,
"metrics/advantage_var": 254.1329803466797,
"regularization/lipschitz_norm": 1039.2696533203125,
"regularization/w1": 1.006013035774231,
"rewards/chosen": 0.016018993091437207,
"rewards/margins": 0.16736023821641227,
"rewards/rejected": -0.15134124512497507,
"step": 100
},
{
"epoch": 0.15544041450777202,
"grad_norm": 22.41180992126465,
"kl": 18.145795822143555,
"learning_rate": 9.998186234298189e-07,
"logits/chosen": -37671477.93587786,
"logits/rejected": -37557675.6224,
"logps/chosen": -491.1575381679389,
"logps/rejected": -360.1194,
"loss": 0.6012,
"loss/base_kto": 3.8942604064941406,
"metrics/advantage_var": 198.2205352783203,
"regularization/lipschitz_norm": 945.71484375,
"regularization/w1": 0.9154520034790039,
"rewards/chosen": 0.28311299331315604,
"rewards/margins": 0.09011754653581228,
"rewards/rejected": 0.19299544677734376,
"step": 120
},
{
"epoch": 0.18134715025906736,
"grad_norm": 25.42111587524414,
"kl": 16.510923385620117,
"learning_rate": 9.992359552107714e-07,
"logits/chosen": -35904493.15337423,
"logits/rejected": -38749242.700636946,
"logps/chosen": -485.18131710122697,
"logps/rejected": -383.5733976910828,
"loss": 0.595,
"loss/base_kto": 3.810206174850464,
"metrics/advantage_var": 206.51370239257812,
"regularization/lipschitz_norm": 980.82373046875,
"regularization/w1": 0.9494373202323914,
"rewards/chosen": 0.229209314826076,
"rewards/margins": 0.1689713452635698,
"rewards/rejected": 0.06023796956250622,
"step": 140
},
{
"epoch": 0.20725388601036268,
"grad_norm": 19.564281463623047,
"kl": 26.949377059936523,
"learning_rate": 9.982519612796161e-07,
"logits/chosen": -37505361.751124434,
"logits/rejected": -37022360.84828711,
"logps/chosen": -493.44958770614693,
"logps/rejected": -371.7893046492659,
"loss": 0.5864,
"loss/base_kto": 3.7792816162109375,
"metrics/advantage_var": 213.29966735839844,
"regularization/lipschitz_norm": 941.6534423828125,
"regularization/w1": 0.9115204215049744,
"rewards/chosen": 0.4891805806081334,
"rewards/margins": 0.17422503570856163,
"rewards/rejected": 0.3149555448995718,
"step": 160
},
{
"epoch": 0.23316062176165803,
"grad_norm": 23.918167114257812,
"kl": 36.33083724975586,
"learning_rate": 9.968674326492213e-07,
"logits/chosen": -35656098.14605067,
"logits/rejected": -36877939.17898194,
"logps/chosen": -463.679163561848,
"logps/rejected": -356.2293719211823,
"loss": 0.5872,
"loss/base_kto": 3.770932912826538,
"metrics/advantage_var": 219.7865753173828,
"regularization/lipschitz_norm": 957.6724853515625,
"regularization/w1": 0.9270269274711609,
"rewards/chosen": 0.6040142758592586,
"rewards/margins": 0.20233625003888195,
"rewards/rejected": 0.40167802582037665,
"step": 180
},
{
"epoch": 0.25906735751295334,
"grad_norm": 17.953758239746094,
"kl": 32.3237190246582,
"learning_rate": 9.950834823142198e-07,
"logits/chosen": -37548226.46884273,
"logits/rejected": -39389116.409240924,
"logps/chosen": -486.1354784866469,
"logps/rejected": -379.991852310231,
"loss": 0.5895,
"loss/base_kto": 3.783107042312622,
"metrics/advantage_var": 210.78970336914062,
"regularization/lipschitz_norm": 963.498046875,
"regularization/w1": 0.9326661229133606,
"rewards/chosen": 0.510858099962908,
"rewards/margins": 0.18344411924598863,
"rewards/rejected": 0.32741398071691935,
"step": 200
},
{
"epoch": 0.2849740932642487,
"grad_norm": 22.509536743164062,
"kl": 27.011798858642578,
"learning_rate": 9.929015443562942e-07,
"logits/chosen": -37872997.45025295,
"logits/rejected": -38662275.16739447,
"logps/chosen": -476.6013912310287,
"logps/rejected": -377.95146470160114,
"loss": 0.5996,
"loss/base_kto": 3.771259069442749,
"metrics/advantage_var": 262.2279052734375,
"regularization/lipschitz_norm": 1059.064697265625,
"regularization/w1": 1.0251744985580444,
"rewards/chosen": 0.42178815613307596,
"rewards/margins": 0.2127755734735281,
"rewards/rejected": 0.20901258265954786,
"step": 220
},
{
"epoch": 0.31088082901554404,
"grad_norm": 18.072338104248047,
"kl": 10.750651359558105,
"learning_rate": 9.90323372791347e-07,
"logits/chosen": -36808512.50713154,
"logits/rejected": -37048054.92758089,
"logps/chosen": -466.24187797147385,
"logps/rejected": -377.1495088597843,
"loss": 0.6019,
"loss/base_kto": 3.8303468227386475,
"metrics/advantage_var": 255.5202178955078,
"regularization/lipschitz_norm": 1017.7144775390625,
"regularization/w1": 0.9851474761962891,
"rewards/chosen": 0.050281687886136836,
"rewards/margins": 0.164875370079746,
"rewards/rejected": -0.11459368219360916,
"step": 240
},
{
"epoch": 0.33678756476683935,
"grad_norm": 18.03236961364746,
"kl": 10.545516014099121,
"learning_rate": 9.87351040159484e-07,
"logits/chosen": -37081604.78504673,
"logits/rejected": -37055478.369905956,
"logps/chosen": -478.5852316978193,
"logps/rejected": -377.98168103448273,
"loss": 0.5968,
"loss/base_kto": 3.806899309158325,
"metrics/advantage_var": 245.1384735107422,
"regularization/lipschitz_norm": 999.7939453125,
"regularization/w1": 0.9678005576133728,
"rewards/chosen": 0.1829061062536507,
"rewards/margins": 0.16642271267121994,
"rewards/rejected": 0.016483393582430752,
"step": 260
},
{
"epoch": 0.3626943005181347,
"grad_norm": 17.374134063720703,
"kl": 17.86372947692871,
"learning_rate": 9.839869358589396e-07,
"logits/chosen": -36710992.23263328,
"logits/rejected": -39415541.54311649,
"logps/chosen": -503.2741316639742,
"logps/rejected": -362.8714069591528,
"loss": 0.5849,
"loss/base_kto": 3.7193336486816406,
"metrics/advantage_var": 220.69456481933594,
"regularization/lipschitz_norm": 991.4678955078125,
"regularization/w1": 0.9597408175468445,
"rewards/chosen": 0.3227413343882522,
"rewards/margins": 0.23886214346141904,
"rewards/rejected": 0.08387919092683316,
"step": 280
},
{
"epoch": 0.38860103626943004,
"grad_norm": 20.176193237304688,
"kl": 10.863235473632812,
"learning_rate": 9.80233764225289e-07,
"logits/chosen": -36624831.61676647,
"logits/rejected": -38581535.79084967,
"logps/chosen": -461.8146519461078,
"logps/rejected": -373.11703431372547,
"loss": 0.5901,
"loss/base_kto": 3.756937026977539,
"metrics/advantage_var": 231.7496337890625,
"regularization/lipschitz_norm": 995.99560546875,
"regularization/w1": 0.9641237258911133,
"rewards/chosen": 0.20020303326452563,
"rewards/margins": 0.20762406086568042,
"rewards/rejected": -0.0074210276011548015,
"step": 300
},
{
"epoch": 0.41450777202072536,
"grad_norm": 22.79453468322754,
"kl": 25.50826072692871,
"learning_rate": 9.760945423574868e-07,
"logits/chosen": -37865885.570274636,
"logits/rejected": -38300373.01059002,
"logps/chosen": -520.7598445072698,
"logps/rejected": -392.857791225416,
"loss": 0.5893,
"loss/base_kto": 3.7324700355529785,
"metrics/advantage_var": 230.5997314453125,
"regularization/lipschitz_norm": 1014.0424194335938,
"regularization/w1": 0.9815930724143982,
"rewards/chosen": 0.4432368116733138,
"rewards/margins": 0.23891707849944135,
"rewards/rejected": 0.20431973317387245,
"step": 320
},
{
"epoch": 0.44041450777202074,
"grad_norm": 19.35013771057129,
"kl": 19.88536262512207,
"learning_rate": 9.71572597692482e-07,
"logits/chosen": -35062254.006389774,
"logits/rejected": -36604996.89296636,
"logps/chosen": -468.4251198083067,
"logps/rejected": -361.8530198776758,
"loss": 0.5986,
"loss/base_kto": 3.7496471405029297,
"metrics/advantage_var": 272.22955322265625,
"regularization/lipschitz_norm": 1073.6064453125,
"regularization/w1": 1.0392509698867798,
"rewards/chosen": 0.3126804973370732,
"rewards/margins": 0.24065260263746324,
"rewards/rejected": 0.07202789469960998,
"step": 340
},
{
"epoch": 0.46632124352331605,
"grad_norm": 24.394580841064453,
"kl": 10.459001541137695,
"learning_rate": 9.666715653303588e-07,
"logits/chosen": -35003234.84329564,
"logits/rejected": -36466824.32677761,
"logps/chosen": -494.7103190630049,
"logps/rejected": -363.49877080181545,
"loss": 0.585,
"loss/base_kto": 3.7073044776916504,
"metrics/advantage_var": 236.2416534423828,
"regularization/lipschitz_norm": 1005.060546875,
"regularization/w1": 0.9728986024856567,
"rewards/chosen": 0.19673321898033622,
"rewards/margins": 0.2668356047624136,
"rewards/rejected": -0.07010238578207735,
"step": 360
},
{
"epoch": 0.49222797927461137,
"grad_norm": 19.257516860961914,
"kl": 8.215998649597168,
"learning_rate": 9.613953851121528e-07,
"logits/chosen": -36699825.63265306,
"logits/rejected": -36798804.802488334,
"logps/chosen": -481.2975863422292,
"logps/rejected": -354.0599241835148,
"loss": 0.5989,
"loss/base_kto": 3.8107993602752686,
"metrics/advantage_var": 223.18716430664062,
"regularization/lipschitz_norm": 1012.6260986328125,
"regularization/w1": 0.9802221655845642,
"rewards/chosen": 0.09591743073994922,
"rewards/margins": 0.1644226304036958,
"rewards/rejected": -0.0685051996637466,
"step": 380
},
{
"epoch": 0.5181347150259067,
"grad_norm": 19.96467399597168,
"kl": 9.938606262207031,
"learning_rate": 9.557482984526924e-07,
"logits/chosen": -37001703.61904762,
"logits/rejected": -36842392.024615385,
"logps/chosen": -480.93184523809526,
"logps/rejected": -387.9960817307692,
"loss": 0.5969,
"loss/base_kto": 3.7171807289123535,
"metrics/advantage_var": 260.2160949707031,
"regularization/lipschitz_norm": 1093.2796630859375,
"regularization/w1": 1.058294653892517,
"rewards/chosen": 0.14468497624472967,
"rewards/margins": 0.2707716485141107,
"rewards/rejected": -0.126086672269381,
"step": 400
},
{
"epoch": 0.5440414507772021,
"grad_norm": 22.027286529541016,
"kl": 5.233973026275635,
"learning_rate": 9.497348449310107e-07,
"logits/chosen": -37696667.05362776,
"logits/rejected": -38398868.21052632,
"logps/chosen": -478.69030954258676,
"logps/rejected": -359.3108552631579,
"loss": 0.5915,
"loss/base_kto": 3.75394606590271,
"metrics/advantage_var": 253.8077850341797,
"regularization/lipschitz_norm": 1010.2439575195312,
"regularization/w1": 0.9779161810874939,
"rewards/chosen": 0.05049951595462835,
"rewards/margins": 0.23183028833091027,
"rewards/rejected": -0.18133077237628192,
"step": 420
},
{
"epoch": 0.5699481865284974,
"grad_norm": 21.019990921020508,
"kl": 5.614864349365234,
"learning_rate": 9.433598586410701e-07,
"logits/chosen": -35586863.40740741,
"logits/rejected": -36523150.58227848,
"logps/chosen": -455.9927662037037,
"logps/rejected": -377.98484473892404,
"loss": 0.5953,
"loss/base_kto": 3.7866158485412598,
"metrics/advantage_var": 232.8219757080078,
"regularization/lipschitz_norm": 1007.7808837890625,
"regularization/w1": 0.9755318760871887,
"rewards/chosen": 0.03540201246002574,
"rewards/margins": 0.21647021557729978,
"rewards/rejected": -0.18106820311727403,
"step": 440
},
{
"epoch": 0.5958549222797928,
"grad_norm": 24.934526443481445,
"kl": 8.18780517578125,
"learning_rate": 9.366284643057313e-07,
"logits/chosen": -35661933.4351145,
"logits/rejected": -36096022.9376,
"logps/chosen": -466.3452290076336,
"logps/rejected": -357.3127,
"loss": 0.591,
"loss/base_kto": 3.6937973499298096,
"metrics/advantage_var": 254.6726837158203,
"regularization/lipschitz_norm": 1068.1162109375,
"regularization/w1": 1.0339365005493164,
"rewards/chosen": 0.16447889022244752,
"rewards/margins": 0.29996607283963506,
"rewards/rejected": -0.1354871826171875,
"step": 460
},
{
"epoch": 0.6217616580310881,
"grad_norm": 23.624765396118164,
"kl": 17.251171112060547,
"learning_rate": 9.295460731570917e-07,
"logits/chosen": -37303200.049155146,
"logits/rejected": -37838073.08108108,
"logps/chosen": -494.00633640552996,
"logps/rejected": -387.3216911764706,
"loss": 0.5963,
"loss/base_kto": 3.705303192138672,
"metrics/advantage_var": 290.14044189453125,
"regularization/lipschitz_norm": 1100.1011962890625,
"regularization/w1": 1.064897894859314,
"rewards/chosen": 0.3678935061218918,
"rewards/margins": 0.29070364064570503,
"rewards/rejected": 0.07718986547618678,
"step": 480
},
{
"epoch": 0.6476683937823834,
"grad_norm": 19.30698585510254,
"kl": 18.461057662963867,
"learning_rate": 9.221183785865056e-07,
"logits/chosen": -35688822.3655914,
"logits/rejected": -37567724.057233706,
"logps/chosen": -464.96370967741933,
"logps/rejected": -384.53885135135135,
"loss": 0.5954,
"loss/base_kto": 3.74275279045105,
"metrics/advantage_var": 268.9945983886719,
"regularization/lipschitz_norm": 1054.3267822265625,
"regularization/w1": 1.0205882787704468,
"rewards/chosen": 0.2288125971312164,
"rewards/margins": 0.2245003290090149,
"rewards/rejected": 0.004312268122201504,
"step": 500
},
{
"epoch": 0.6735751295336787,
"grad_norm": 19.382633209228516,
"kl": 14.04481029510498,
"learning_rate": 9.143513515677817e-07,
"logits/chosen": -36496845.93059937,
"logits/rejected": -37464602.94736842,
"logps/chosen": -464.81895701892745,
"logps/rejected": -378.781491873065,
"loss": 0.5976,
"loss/base_kto": 3.7514591217041016,
"metrics/advantage_var": 268.2990417480469,
"regularization/lipschitz_norm": 1063.7738037109375,
"regularization/w1": 1.0297330617904663,
"rewards/chosen": 0.17946819702533517,
"rewards/margins": 0.21765296234799383,
"rewards/rejected": -0.038184765322658666,
"step": 520
},
{
"epoch": 0.6994818652849741,
"grad_norm": 29.22517204284668,
"kl": 19.706571578979492,
"learning_rate": 9.062512358572373e-07,
"logits/chosen": -37008987.17808219,
"logits/rejected": -36886892.89245586,
"logps/chosen": -499.05493721461187,
"logps/rejected": -359.170044141252,
"loss": 0.5879,
"loss/base_kto": 3.6204020977020264,
"metrics/advantage_var": 321.3903503417969,
"regularization/lipschitz_norm": 1118.2493896484375,
"regularization/w1": 1.082465410232544,
"rewards/chosen": 0.4124527325913242,
"rewards/margins": 0.3715337486297566,
"rewards/rejected": 0.040918983961567644,
"step": 540
},
{
"epoch": 0.7253886010362695,
"grad_norm": 19.34919548034668,
"kl": 17.98653221130371,
"learning_rate": 8.978245429744691e-07,
"logits/chosen": -36831250.59001513,
"logits/rejected": -37122491.34733441,
"logps/chosen": -495.9337178517398,
"logps/rejected": -384.9459561793215,
"loss": 0.5925,
"loss/base_kto": 3.6959121227264404,
"metrics/advantage_var": 270.3876037597656,
"regularization/lipschitz_norm": 1078.271728515625,
"regularization/w1": 1.0437668561935425,
"rewards/chosen": 0.3510269649811484,
"rewards/margins": 0.2730278561535913,
"rewards/rejected": 0.07799910882755705,
"step": 560
},
{
"epoch": 0.7512953367875648,
"grad_norm": 13.792253494262695,
"kl": 24.808151245117188,
"learning_rate": 8.890780469678738e-07,
"logits/chosen": -37472919.7037037,
"logits/rejected": -38602560.81012658,
"logps/chosen": -503.2482638888889,
"logps/rejected": -366.41628757911394,
"loss": 0.5872,
"loss/base_kto": 3.6792945861816406,
"metrics/advantage_var": 238.5391082763672,
"regularization/lipschitz_norm": 1051.7332763671875,
"regularization/w1": 1.0180777311325073,
"rewards/chosen": 0.47948625352647567,
"rewards/margins": 0.25156523842684153,
"rewards/rejected": 0.2279210150996341,
"step": 580
},
{
"epoch": 0.7772020725388601,
"grad_norm": 21.188846588134766,
"kl": 21.32284927368164,
"learning_rate": 8.800187789691269e-07,
"logits/chosen": -37458432.0,
"logits/rejected": -38351492.8607595,
"logps/chosen": -522.0483217592592,
"logps/rejected": -363.99344837816454,
"loss": 0.6028,
"loss/base_kto": 3.698185682296753,
"metrics/advantage_var": 297.4457092285156,
"regularization/lipschitz_norm": 1161.6429443359375,
"regularization/w1": 1.1244704723358154,
"rewards/chosen": 0.41004020785108025,
"rewards/margins": 0.2871923972748466,
"rewards/rejected": 0.12284781057623369,
"step": 600
},
{
"epoch": 0.8031088082901554,
"grad_norm": 23.26582145690918,
"kl": 11.471311569213867,
"learning_rate": 8.706540215409981e-07,
"logits/chosen": -34779942.2992126,
"logits/rejected": -36795117.34573644,
"logps/chosen": -476.6228346456693,
"logps/rejected": -383.8438468992248,
"loss": 0.5933,
"loss/base_kto": 3.767052412033081,
"metrics/advantage_var": 248.32920837402344,
"regularization/lipschitz_norm": 1012.0929565429688,
"regularization/w1": 0.9797059893608093,
"rewards/chosen": 0.10706037386195866,
"rewards/margins": 0.178669433277081,
"rewards/rejected": -0.07160905941512234,
"step": 620
},
{
"epoch": 0.8290155440414507,
"grad_norm": 17.883386611938477,
"kl": 8.116411209106445,
"learning_rate": 8.609913028230462e-07,
"logits/chosen": -35767321.221674874,
"logits/rejected": -38034070.318926975,
"logps/chosen": -481.5717877668309,
"logps/rejected": -369.3592585692995,
"loss": 0.592,
"loss/base_kto": 3.750972032546997,
"metrics/advantage_var": 238.2175750732422,
"regularization/lipschitz_norm": 1017.2276611328125,
"regularization/w1": 0.9846763014793396,
"rewards/chosen": 0.014683341353593397,
"rewards/margins": 0.21594342625340476,
"rewards/rejected": -0.20126008489981137,
"step": 640
},
{
"epoch": 0.8549222797927462,
"grad_norm": 18.580745697021484,
"kl": 8.209991455078125,
"learning_rate": 8.510383904798994e-07,
"logits/chosen": -35252204.85981309,
"logits/rejected": -35914681.37931035,
"logps/chosen": -455.03207749221184,
"logps/rejected": -386.3462970219436,
"loss": 0.5921,
"loss/base_kto": 3.736785888671875,
"metrics/advantage_var": 237.25537109375,
"regularization/lipschitz_norm": 1032.8397216796875,
"regularization/w1": 0.999788761138916,
"rewards/chosen": 0.07960102639837056,
"rewards/margins": 0.24826608421148283,
"rewards/rejected": -0.16866505781311225,
"step": 660
},
{
"epoch": 0.8808290155440415,
"grad_norm": 26.838045120239258,
"kl": 20.73633575439453,
"learning_rate": 8.408032854569865e-07,
"logits/chosen": -35850670.14420063,
"logits/rejected": -37429790.30529595,
"logps/chosen": -493.4886363636364,
"logps/rejected": -376.3583284657321,
"loss": 0.5871,
"loss/base_kto": 3.7232539653778076,
"metrics/advantage_var": 230.28018188476562,
"regularization/lipschitz_norm": 1005.8460083007812,
"regularization/w1": 0.9736589789390564,
"rewards/chosen": 0.352656636492212,
"rewards/margins": 0.232163707253444,
"rewards/rejected": 0.120492929238768,
"step": 680
},
{
"epoch": 0.9067357512953368,
"grad_norm": 19.68084144592285,
"kl": 16.948158264160156,
"learning_rate": 8.302942155487377e-07,
"logits/chosen": -35622512.07559055,
"logits/rejected": -36749321.5255814,
"logps/chosen": -486.8330216535433,
"logps/rejected": -344.28110465116276,
"loss": 0.5891,
"loss/base_kto": 3.764652729034424,
"metrics/advantage_var": 220.8280487060547,
"regularization/lipschitz_norm": 979.4452514648438,
"regularization/w1": 0.9481029510498047,
"rewards/chosen": 0.2265674500953494,
"rewards/margins": 0.18458749032650704,
"rewards/rejected": 0.041979959768842355,
"step": 700
},
{
"epoch": 0.9326424870466321,
"grad_norm": 22.520645141601562,
"kl": 12.885197639465332,
"learning_rate": 8.195196287844278e-07,
"logits/chosen": -36491045.58887172,
"logits/rejected": -37552917.434439175,
"logps/chosen": -500.4296271251932,
"logps/rejected": -379.19833629541864,
"loss": 0.5992,
"loss/base_kto": 3.756240129470825,
"metrics/advantage_var": 270.6735534667969,
"regularization/lipschitz_norm": 1071.513671875,
"regularization/w1": 1.0372251272201538,
"rewards/chosen": 0.1645966873286865,
"rewards/margins": 0.22212261738683284,
"rewards/rejected": -0.05752593005814635,
"step": 720
},
{
"epoch": 0.9585492227979274,
"grad_norm": 18.744251251220703,
"kl": 11.187604904174805,
"learning_rate": 8.08488186636975e-07,
"logits/chosen": -36985653.85113268,
"logits/rejected": -37628398.98489426,
"logps/chosen": -492.90564320388347,
"logps/rejected": -386.2225264350453,
"loss": 0.5986,
"loss/base_kto": 3.7459607124328613,
"metrics/advantage_var": 268.0847473144531,
"regularization/lipschitz_norm": 1077.4200439453125,
"regularization/w1": 1.0429426431655884,
"rewards/chosen": 0.13466049243717132,
"rewards/margins": 0.21679595512606684,
"rewards/rejected": -0.08213546268889552,
"step": 740
},
{
"epoch": 0.9844559585492227,
"grad_norm": 17.9041748046875,
"kl": 6.419439792633057,
"learning_rate": 7.972087570601576e-07,
"logits/chosen": -36052829.46031746,
"logits/rejected": -37627598.375384614,
"logps/chosen": -477.3235615079365,
"logps/rejected": -361.3248557692308,
"loss": 0.5911,
"loss/base_kto": 3.6789605617523193,
"metrics/advantage_var": 283.197998046875,
"regularization/lipschitz_norm": 1084.3193359375,
"regularization/w1": 1.0496209859848022,
"rewards/chosen": 0.046795109340122765,
"rewards/margins": 0.31432874910124053,
"rewards/rejected": -0.26753363976111777,
"step": 760
},
{
"epoch": 1.0103626943005182,
"grad_norm": 18.287485122680664,
"kl": 5.721174716949463,
"learning_rate": 7.856904073598458e-07,
"logits/chosen": -34892882.84789644,
"logits/rejected": -35376807.56363636,
"logps/chosen": -468.4087783171521,
"logps/rejected": -388.48470643939396,
"loss": 0.605,
"loss/base_kto": 3.5825035572052,
"metrics/advantage_var": 404.2457580566406,
"regularization/lipschitz_norm": 1299.2603759765625,
"regularization/w1": 1.2576841115951538,
"rewards/chosen": 0.028945311759282083,
"rewards/margins": 0.44208738310753015,
"rewards/rejected": -0.4131420713482481,
"step": 780
},
{
"epoch": 1.0362694300518134,
"grad_norm": 19.377307891845703,
"kl": 6.955938816070557,
"learning_rate": 7.739423969049761e-07,
"logits/chosen": -36354910.48085758,
"logits/rejected": -37222311.80861244,
"logps/chosen": -465.1176301684533,
"logps/rejected": -387.9055023923445,
"loss": 0.6241,
"loss/base_kto": 3.3624539375305176,
"metrics/advantage_var": 646.35107421875,
"regularization/lipschitz_norm": 1684.5302734375,
"regularization/w1": 1.6306253671646118,
"rewards/chosen": 0.30485761329919603,
"rewards/margins": 0.7415017096128673,
"rewards/rejected": -0.43664409631367124,
"step": 800
},
{
"epoch": 1.0621761658031088,
"grad_norm": 17.815826416015625,
"kl": 16.78569793701172,
"learning_rate": 7.619741696841322e-07,
"logits/chosen": -35207618.81761006,
"logits/rejected": -36888296.149068326,
"logps/chosen": -443.0866745283019,
"logps/rejected": -391.5106997282609,
"loss": 0.5974,
"loss/base_kto": 3.3261260986328125,
"metrics/advantage_var": 559.1588134765625,
"regularization/lipschitz_norm": 1501.2880859375,
"regularization/w1": 1.4532469511032104,
"rewards/chosen": 0.4930549477631191,
"rewards/margins": 0.7203011078556802,
"rewards/rejected": -0.22724616009256113,
"step": 820
},
{
"epoch": 1.0880829015544042,
"grad_norm": 18.48281478881836,
"kl": 5.493379592895508,
"learning_rate": 7.497953467137135e-07,
"logits/chosen": -35686700.685154974,
"logits/rejected": -35851425.1994003,
"logps/chosen": -513.1646615008157,
"logps/rejected": -365.4383433283358,
"loss": 0.621,
"loss/base_kto": 3.372427463531494,
"metrics/advantage_var": 636.4617919921875,
"regularization/lipschitz_norm": 1647.95703125,
"regularization/w1": 1.5952223539352417,
"rewards/chosen": 0.19366044360311735,
"rewards/margins": 0.6924974813830556,
"rewards/rejected": -0.49883703777993815,
"step": 840
},
{
"epoch": 1.1139896373056994,
"grad_norm": 21.839702606201172,
"kl": 7.518786907196045,
"learning_rate": 7.37415718303793e-07,
"logits/chosen": -36309710.87675507,
"logits/rejected": -36580738.20344288,
"logps/chosen": -462.4204855694228,
"logps/rejected": -375.07868740219095,
"loss": 0.6256,
"loss/base_kto": 3.3311004638671875,
"metrics/advantage_var": 764.1552734375,
"regularization/lipschitz_norm": 1729.2777099609375,
"regularization/w1": 1.673940658569336,
"rewards/chosen": 0.2229258616145427,
"rewards/margins": 0.7866244048706068,
"rewards/rejected": -0.5636985432560642,
"step": 860
},
{
"epoch": 1.1398963730569949,
"grad_norm": 16.18538475036621,
"kl": 11.524519920349121,
"learning_rate": 7.248452361878855e-07,
"logits/chosen": -35388076.751145035,
"logits/rejected": -36500288.3072,
"logps/chosen": -462.506679389313,
"logps/rejected": -370.4149,
"loss": 0.606,
"loss/base_kto": 3.340698719024658,
"metrics/advantage_var": 555.2950439453125,
"regularization/lipschitz_norm": 1557.3011474609375,
"regularization/w1": 1.5074676275253296,
"rewards/chosen": 0.3492403685591603,
"rewards/margins": 0.7417162962935353,
"rewards/rejected": -0.392475927734375,
"step": 880
},
{
"epoch": 1.16580310880829,
"grad_norm": 18.383241653442383,
"kl": 19.993188858032227,
"learning_rate": 7.120940055229497e-07,
"logits/chosen": -37304425.18429003,
"logits/rejected": -37189847.40453074,
"logps/chosen": -506.0303530966767,
"logps/rejected": -380.5348654935275,
"loss": 0.6178,
"loss/base_kto": 3.298877477645874,
"metrics/advantage_var": 695.72412109375,
"regularization/lipschitz_norm": 1697.6685791015625,
"regularization/w1": 1.6433429718017578,
"rewards/chosen": 0.687850168464407,
"rewards/margins": 0.7760547282350096,
"rewards/rejected": -0.08820455977060263,
"step": 900
},
{
"epoch": 1.1917098445595855,
"grad_norm": 14.956389427185059,
"kl": 17.819286346435547,
"learning_rate": 6.991722767660556e-07,
"logits/chosen": -34978176.0,
"logits/rejected": -35433167.23809524,
"logps/chosen": -487.08470394736844,
"logps/rejected": -374.43817429315476,
"loss": 0.5989,
"loss/base_kto": 3.218280792236328,
"metrics/advantage_var": 770.0177612304688,
"regularization/lipschitz_norm": 1625.3094482421875,
"regularization/w1": 1.5732994079589844,
"rewards/chosen": 0.6223972722103721,
"rewards/margins": 0.8812175334844374,
"rewards/rejected": -0.25882026127406527,
"step": 920
},
{
"epoch": 1.2176165803108807,
"grad_norm": 20.838085174560547,
"kl": 7.458081245422363,
"learning_rate": 6.860904374342499e-07,
"logits/chosen": -36180128.820512824,
"logits/rejected": -37325202.73170732,
"logps/chosen": -491.38296274038464,
"logps/rejected": -374.7822503810976,
"loss": 0.6124,
"loss/base_kto": 3.2906410694122314,
"metrics/advantage_var": 675.3164672851562,
"regularization/lipschitz_norm": 1661.6646728515625,
"regularization/w1": 1.60849130153656,
"rewards/chosen": 0.217655157431578,
"rewards/margins": 0.8089749161491847,
"rewards/rejected": -0.5913197587176067,
"step": 940
},
{
"epoch": 1.2435233160621761,
"grad_norm": 22.3237247467041,
"kl": 6.157003879547119,
"learning_rate": 6.7285900375424e-07,
"logits/chosen": -36840332.105426356,
"logits/rejected": -38231676.97637795,
"logps/chosen": -494.1512112403101,
"logps/rejected": -381.05629921259845,
"loss": 0.6208,
"loss/base_kto": 3.332334280014038,
"metrics/advantage_var": 616.45263671875,
"regularization/lipschitz_norm": 1687.9783935546875,
"regularization/w1": 1.6339629888534546,
"rewards/chosen": 0.24477676273316376,
"rewards/margins": 0.7497021556650043,
"rewards/rejected": -0.5049253929318406,
"step": 960
},
{
"epoch": 1.2694300518134716,
"grad_norm": 19.581022262573242,
"kl": 10.315558433532715,
"learning_rate": 6.594886122086123e-07,
"logits/chosen": -35564502.52959502,
"logits/rejected": -36717654.670846395,
"logps/chosen": -476.301207165109,
"logps/rejected": -394.32102272727275,
"loss": 0.6127,
"loss/base_kto": 3.317326068878174,
"metrics/advantage_var": 617.7179565429688,
"regularization/lipschitz_norm": 1636.5614013671875,
"regularization/w1": 1.5841913223266602,
"rewards/chosen": 0.3656697971427181,
"rewards/margins": 0.7700343082798164,
"rewards/rejected": -0.40436451113709837,
"step": 980
},
{
"epoch": 1.2953367875647668,
"grad_norm": 17.49793243408203,
"kl": 11.52022933959961,
"learning_rate": 6.459900109853766e-07,
"logits/chosen": -34800088.36650869,
"logits/rejected": -34793354.88098918,
"logps/chosen": -471.1293937598736,
"logps/rejected": -405.65880989180835,
"loss": 0.6135,
"loss/base_kto": 3.3541908264160156,
"metrics/advantage_var": 601.1190795898438,
"regularization/lipschitz_norm": 1604.8447265625,
"regularization/w1": 1.5534896850585938,
"rewards/chosen": 0.3448968679419061,
"rewards/margins": 0.7352703691373272,
"rewards/rejected": -0.3903735011954212,
"step": 1000
},
{
"epoch": 1.3212435233160622,
"grad_norm": 17.19472885131836,
"kl": 7.987427711486816,
"learning_rate": 6.323740513377171e-07,
"logits/chosen": -35549558.035928145,
"logits/rejected": -35133915.18954249,
"logps/chosen": -478.60235778443115,
"logps/rejected": -386.7259242238562,
"loss": 0.6233,
"loss/base_kto": 3.2980823516845703,
"metrics/advantage_var": 690.859375,
"regularization/lipschitz_norm": 1743.8031005859375,
"regularization/w1": 1.688001275062561,
"rewards/chosen": 0.3907644306114334,
"rewards/margins": 0.8247831329002917,
"rewards/rejected": -0.43401870228885825,
"step": 1020
},
{
"epoch": 1.3471502590673574,
"grad_norm": 29.313949584960938,
"kl": 23.783124923706055,
"learning_rate": 6.186516788608865e-07,
"logits/chosen": -35311622.159398496,
"logits/rejected": -36611146.92682927,
"logps/chosen": -508.9872180451128,
"logps/rejected": -363.42146849593496,
"loss": 0.6024,
"loss/base_kto": 3.290377378463745,
"metrics/advantage_var": 632.463134765625,
"regularization/lipschitz_norm": 1579.3900146484375,
"regularization/w1": 1.528849482536316,
"rewards/chosen": 0.6658825408247181,
"rewards/margins": 0.7809848962855286,
"rewards/rejected": -0.11510235546081046,
"step": 1040
},
{
"epoch": 1.3730569948186528,
"grad_norm": 13.693548202514648,
"kl": 19.825727462768555,
"learning_rate": 6.048339246932652e-07,
"logits/chosen": -35142020.07643312,
"logits/rejected": -35473009.0797546,
"logps/chosen": -492.3061305732484,
"logps/rejected": -376.4980828220859,
"loss": 0.615,
"loss/base_kto": 3.3185622692108154,
"metrics/advantage_var": 678.3754272460938,
"regularization/lipschitz_norm": 1654.5648193359375,
"regularization/w1": 1.601618766784668,
"rewards/chosen": 0.5552992122188495,
"rewards/margins": 0.7389632883862312,
"rewards/rejected": -0.18366407616738162,
"step": 1060
},
{
"epoch": 1.3989637305699483,
"grad_norm": 15.427619934082031,
"kl": 16.087003707885742,
"learning_rate": 5.909318966486494e-07,
"logits/chosen": -36531260.23529412,
"logits/rejected": -37808316.75576037,
"logps/chosen": -503.62808028616854,
"logps/rejected": -366.0517953149002,
"loss": 0.5987,
"loss/base_kto": 3.2703118324279785,
"metrics/advantage_var": 591.8820190429688,
"regularization/lipschitz_norm": 1569.50537109375,
"regularization/w1": 1.519281268119812,
"rewards/chosen": 0.5129609464272407,
"rewards/margins": 0.7680506315420881,
"rewards/rejected": -0.25508968511484736,
"step": 1080
},
{
"epoch": 1.4248704663212435,
"grad_norm": 16.78620719909668,
"kl": 12.485320091247559,
"learning_rate": 5.769567702869052e-07,
"logits/chosen": -35135143.476635516,
"logits/rejected": -36348424.02507837,
"logps/chosen": -470.5177180685358,
"logps/rejected": -377.9007641065831,
"loss": 0.5899,
"loss/base_kto": 3.29404616355896,
"metrics/advantage_var": 570.2704467773438,
"regularization/lipschitz_norm": 1472.1197509765625,
"regularization/w1": 1.4250118732452393,
"rewards/chosen": 0.36283491853612976,
"rewards/margins": 0.7461272333106939,
"rewards/rejected": -0.38329231477456405,
"step": 1100
},
{
"epoch": 1.450777202072539,
"grad_norm": 22.557743072509766,
"kl": 15.737161636352539,
"learning_rate": 5.629197799301614e-07,
"logits/chosen": -35592294.56542811,
"logits/rejected": -36344102.341906205,
"logps/chosen": -470.34248788368336,
"logps/rejected": -377.56174357034797,
"loss": 0.5927,
"loss/base_kto": 3.2818260192871094,
"metrics/advantage_var": 525.9891967773438,
"regularization/lipschitz_norm": 1508.1322021484375,
"regularization/w1": 1.4598718881607056,
"rewards/chosen": 0.42693155069921246,
"rewards/margins": 0.7536140064805806,
"rewards/rejected": -0.3266824557813682,
"step": 1120
},
{
"epoch": 1.4766839378238341,
"grad_norm": 18.61176300048828,
"kl": 12.41404914855957,
"learning_rate": 5.488322096317633e-07,
"logits/chosen": -34455428.27344992,
"logits/rejected": -35685320.94623656,
"logps/chosen": -485.0764109697933,
"logps/rejected": -376.02923387096774,
"loss": 0.5928,
"loss/base_kto": 3.223315954208374,
"metrics/advantage_var": 625.140625,
"regularization/lipschitz_norm": 1569.231689453125,
"regularization/w1": 1.5190162658691406,
"rewards/chosen": 0.4847335451547595,
"rewards/margins": 0.8737152368580285,
"rewards/rejected": -0.388981691703269,
"step": 1140
},
{
"epoch": 1.5025906735751295,
"grad_norm": 23.027080535888672,
"kl": 10.483132362365723,
"learning_rate": 5.347053841052518e-07,
"logits/chosen": -34756435.95476575,
"logits/rejected": -35960261.906202726,
"logps/chosen": -483.3604604200323,
"logps/rejected": -373.5404926248109,
"loss": 0.6147,
"loss/base_kto": 3.2806389331817627,
"metrics/advantage_var": 656.40478515625,
"regularization/lipschitz_norm": 1691.227783203125,
"regularization/w1": 1.6371086835861206,
"rewards/chosen": 0.4133771116783623,
"rewards/margins": 0.8019734545182828,
"rewards/rejected": -0.38859634283992056,
"step": 1160
},
{
"epoch": 1.528497409326425,
"grad_norm": 22.251970291137695,
"kl": 8.82465648651123,
"learning_rate": 5.205506596206531e-07,
"logits/chosen": -33834448.25723473,
"logits/rejected": -35144374.079027355,
"logps/chosen": -500.05114549839226,
"logps/rejected": -345.7993446048632,
"loss": 0.5984,
"loss/base_kto": 3.331987142562866,
"metrics/advantage_var": 516.9144897460938,
"regularization/lipschitz_norm": 1503.2855224609375,
"regularization/w1": 1.4551804065704346,
"rewards/chosen": 0.30820006342946143,
"rewards/margins": 0.7133809278505291,
"rewards/rejected": -0.40518086442106765,
"step": 1180
},
{
"epoch": 1.5544041450777202,
"grad_norm": 16.40721893310547,
"kl": 16.810983657836914,
"learning_rate": 5.063794148754032e-07,
"logits/chosen": -34277114.294205055,
"logits/rejected": -37061586.45140033,
"logps/chosen": -503.2705237741456,
"logps/rejected": -363.0568883855025,
"loss": 0.6031,
"loss/base_kto": 3.2754509449005127,
"metrics/advantage_var": 777.3826293945312,
"regularization/lipschitz_norm": 1600.4676513671875,
"regularization/w1": 1.5492527484893799,
"rewards/chosen": 0.5745537631756129,
"rewards/margins": 0.7865318271203462,
"rewards/rejected": -0.2119780639447333,
"step": 1200
},
{
"epoch": 1.5803108808290154,
"grad_norm": 24.41370964050293,
"kl": 17.03086280822754,
"learning_rate": 4.922030418472422e-07,
"logits/chosen": -34515247.0529595,
"logits/rejected": -36114839.67398119,
"logps/chosen": -462.88770443925233,
"logps/rejected": -375.2968994905956,
"loss": 0.6105,
"loss/base_kto": 3.323561906814575,
"metrics/advantage_var": 842.5131225585938,
"regularization/lipschitz_norm": 1611.8299560546875,
"regularization/w1": 1.5602514743804932,
"rewards/chosen": 0.5446985072435991,
"rewards/margins": 0.7637839136038068,
"rewards/rejected": -0.21908540636020768,
"step": 1220
},
{
"epoch": 1.6062176165803108,
"grad_norm": 15.436993598937988,
"kl": 16.175033569335938,
"learning_rate": 4.780329366364336e-07,
"logits/chosen": -33907572.21587302,
"logits/rejected": -36099686.4,
"logps/chosen": -507.61944444444447,
"logps/rejected": -375.84088942307693,
"loss": 0.6094,
"loss/base_kto": 3.248197317123413,
"metrics/advantage_var": 731.9693603515625,
"regularization/lipschitz_norm": 1680.673095703125,
"regularization/w1": 1.6268917322158813,
"rewards/chosen": 0.5735631549169147,
"rewards/margins": 0.8389820908393906,
"rewards/rejected": -0.26541893592247595,
"step": 1240
},
{
"epoch": 1.6321243523316062,
"grad_norm": 21.70559310913086,
"kl": 15.646124839782715,
"learning_rate": 4.638804903046684e-07,
"logits/chosen": -33920421.64705882,
"logits/rejected": -35410454.80798771,
"logps/chosen": -482.28080286168523,
"logps/rejected": -355.8786242319508,
"loss": 0.6094,
"loss/base_kto": 3.2357337474823,
"metrics/advantage_var": 679.2140502929688,
"regularization/lipschitz_norm": 1693.5283203125,
"regularization/w1": 1.63933527469635,
"rewards/chosen": 0.5108369909143978,
"rewards/margins": 0.8512766306138386,
"rewards/rejected": -0.34043963969944074,
"step": 1260
},
{
"epoch": 1.6580310880829017,
"grad_norm": 17.28391456604004,
"kl": 12.305365562438965,
"learning_rate": 4.497570797180217e-07,
"logits/chosen": -34946248.94191523,
"logits/rejected": -35778247.86314152,
"logps/chosen": -473.3879513343799,
"logps/rejected": -369.0113724727838,
"loss": 0.6143,
"loss/base_kto": 3.30818247795105,
"metrics/advantage_var": 636.6775512695312,
"regularization/lipschitz_norm": 1659.657470703125,
"regularization/w1": 1.606548547744751,
"rewards/chosen": 0.39057000128777475,
"rewards/margins": 0.7394870117003913,
"rewards/rejected": -0.34891701041261663,
"step": 1280
},
{
"epoch": 1.6839378238341969,
"grad_norm": 17.96364402770996,
"kl": 12.297408103942871,
"learning_rate": 4.3567405840131853e-07,
"logits/chosen": -33265059.41267388,
"logits/rejected": -34707653.358609796,
"logps/chosen": -470.75062789799074,
"logps/rejected": -368.9062746840442,
"loss": 0.6021,
"loss/base_kto": 3.266735792160034,
"metrics/advantage_var": 570.1412963867188,
"regularization/lipschitz_norm": 1601.023681640625,
"regularization/w1": 1.5497907400131226,
"rewards/chosen": 0.41282887289291925,
"rewards/margins": 0.7918910132386809,
"rewards/rejected": -0.37906214034576174,
"step": 1300
},
{
"epoch": 1.709844559585492,
"grad_norm": 14.205744743347168,
"kl": 12.191987991333008,
"learning_rate": 4.2164274741126506e-07,
"logits/chosen": -34773849.766233765,
"logits/rejected": -35572643.469879515,
"logps/chosen": -484.36434659090907,
"logps/rejected": -386.9334760918675,
"loss": 0.6069,
"loss/base_kto": 3.2693467140197754,
"metrics/advantage_var": 635.6256103515625,
"regularization/lipschitz_norm": 1638.4261474609375,
"regularization/w1": 1.5859966278076172,
"rewards/chosen": 0.4410676336907721,
"rewards/margins": 0.8002055709378071,
"rewards/rejected": -0.359137937247035,
"step": 1320
},
{
"epoch": 1.7357512953367875,
"grad_norm": 24.168249130249023,
"kl": 6.707913398742676,
"learning_rate": 4.0767442623567856e-07,
"logits/chosen": -34532083.84686064,
"logits/rejected": -35766373.25677831,
"logps/chosen": -484.91089203675347,
"logps/rejected": -375.4888855661882,
"loss": 0.6015,
"loss/base_kto": 3.3565971851348877,
"metrics/advantage_var": 582.0673828125,
"regularization/lipschitz_norm": 1503.3599853515625,
"regularization/w1": 1.4552525281906128,
"rewards/chosen": 0.24142561207138927,
"rewards/margins": 0.7245304578150097,
"rewards/rejected": -0.4831048457436204,
"step": 1340
},
{
"epoch": 1.761658031088083,
"grad_norm": 21.05829620361328,
"kl": 14.777182579040527,
"learning_rate": 3.937803237261357e-07,
"logits/chosen": -34122390.773006134,
"logits/rejected": -35606338.85350318,
"logps/chosen": -483.98557323619633,
"logps/rejected": -382.7797074044586,
"loss": 0.5881,
"loss/base_kto": 3.2743585109710693,
"metrics/advantage_var": 496.87646484375,
"regularization/lipschitz_norm": 1477.9449462890625,
"regularization/w1": 1.4306507110595703,
"rewards/chosen": 0.47881073746944497,
"rewards/margins": 0.7498130999576267,
"rewards/rejected": -0.2710023624881817,
"step": 1360
},
{
"epoch": 1.7875647668393784,
"grad_norm": 23.042417526245117,
"kl": 16.886045455932617,
"learning_rate": 3.7997160907132456e-07,
"logits/chosen": -34682008.715855576,
"logits/rejected": -35531987.80715396,
"logps/chosen": -473.9014423076923,
"logps/rejected": -392.2607163685848,
"loss": 0.5944,
"loss/base_kto": 3.3150672912597656,
"metrics/advantage_var": 544.8585205078125,
"regularization/lipschitz_norm": 1487.87109375,
"regularization/w1": 1.4402592182159424,
"rewards/chosen": 0.4643519235368426,
"rewards/margins": 0.7374791219415374,
"rewards/rejected": -0.2731271984046948,
"step": 1380
},
{
"epoch": 1.8134715025906736,
"grad_norm": 19.28875160217285,
"kl": 11.619124412536621,
"learning_rate": 3.662593828183601e-07,
"logits/chosen": -34951866.11161388,
"logits/rejected": -35454730.37277147,
"logps/chosen": -473.4477281297134,
"logps/rejected": -349.80080024311184,
"loss": 0.6135,
"loss/base_kto": 3.3116226196289062,
"metrics/advantage_var": 611.7669067382812,
"regularization/lipschitz_norm": 1648.8114013671875,
"regularization/w1": 1.5960493087768555,
"rewards/chosen": 0.49080168895232373,
"rewards/margins": 0.758468399012975,
"rewards/rejected": -0.26766671006065135,
"step": 1400
},
{
"epoch": 1.8393782383419688,
"grad_norm": 19.19460105895996,
"kl": 9.19257640838623,
"learning_rate": 3.5265466794927725e-07,
"logits/chosen": -34895287.32376395,
"logits/rejected": -35518238.186830014,
"logps/chosen": -485.94836523125997,
"logps/rejected": -359.33489663093417,
"loss": 0.6081,
"loss/base_kto": 3.403186082839966,
"metrics/advantage_var": 565.5280151367188,
"regularization/lipschitz_norm": 1509.8929443359375,
"regularization/w1": 1.4615763425827026,
"rewards/chosen": 0.2992124420604067,
"rewards/margins": 0.6448627571625793,
"rewards/rejected": -0.34565031510217264,
"step": 1420
},
{
"epoch": 1.8652849740932642,
"grad_norm": 16.687786102294922,
"kl": 13.650378227233887,
"learning_rate": 3.3916840101987887e-07,
"logits/chosen": -33104306.13824885,
"logits/rejected": -34119373.93958665,
"logps/chosen": -476.690428187404,
"logps/rejected": -352.6248012718601,
"loss": 0.5888,
"loss/base_kto": 3.275512456893921,
"metrics/advantage_var": 519.4085693359375,
"regularization/lipschitz_norm": 1482.2254638671875,
"regularization/w1": 1.434794306755066,
"rewards/chosen": 0.44653048420098884,
"rewards/margins": 0.7729975888717211,
"rewards/rejected": -0.3264671046707323,
"step": 1440
},
{
"epoch": 1.8911917098445596,
"grad_norm": 18.426610946655273,
"kl": 12.734430313110352,
"learning_rate": 3.258114233680583e-07,
"logits/chosen": -34698978.6749226,
"logits/rejected": -35704993.514195584,
"logps/chosen": -469.3546826625387,
"logps/rejected": -393.7551754731861,
"loss": 0.6159,
"loss/base_kto": 3.3413281440734863,
"metrics/advantage_var": 599.4804077148438,
"regularization/lipschitz_norm": 1638.5653076171875,
"regularization/w1": 1.58613121509552,
"rewards/chosen": 0.47008908865252513,
"rewards/margins": 0.7260038188809853,
"rewards/rejected": -0.2559147302284602,
"step": 1460
},
{
"epoch": 1.917098445595855,
"grad_norm": 20.585351943969727,
"kl": 12.331831932067871,
"learning_rate": 3.1259447239866796e-07,
"logits/chosen": -34554958.76923077,
"logits/rejected": -35367734.450793654,
"logps/chosen": -495.54475961538463,
"logps/rejected": -391.78018353174605,
"loss": 0.6025,
"loss/base_kto": 3.263157606124878,
"metrics/advantage_var": 576.9074096679688,
"regularization/lipschitz_norm": 1608.2530517578125,
"regularization/w1": 1.5567890405654907,
"rewards/chosen": 0.4312304217998798,
"rewards/margins": 0.7955246131906288,
"rewards/rejected": -0.36429419139074903,
"step": 1480
},
{
"epoch": 1.9430051813471503,
"grad_norm": 22.021099090576172,
"kl": 13.9457426071167,
"learning_rate": 2.9952817295193435e-07,
"logits/chosen": -35271970.24203822,
"logits/rejected": -37426568.63803681,
"logps/chosen": -474.9701433121019,
"logps/rejected": -371.26303680981596,
"loss": 0.5912,
"loss/base_kto": 3.254892110824585,
"metrics/advantage_var": 550.8092041015625,
"regularization/lipschitz_norm": 1523.3638916015625,
"regularization/w1": 1.474616289138794,
"rewards/chosen": 0.5267801467020801,
"rewards/margins": 0.8088675780656129,
"rewards/rejected": -0.28208743136353287,
"step": 1500
},
{
"epoch": 1.9689119170984455,
"grad_norm": 20.054548263549805,
"kl": 13.417973518371582,
"learning_rate": 2.866230287623651e-07,
"logits/chosen": -34051679.255813956,
"logits/rejected": -34958796.10810811,
"logps/chosen": -478.068359375,
"logps/rejected": -375.1455078125,
"loss": 0.6026,
"loss/base_kto": 3.3483033180236816,
"metrics/advantage_var": 570.8318481445312,
"regularization/lipschitz_norm": 1520.9615478515625,
"regularization/w1": 1.4722908735275269,
"rewards/chosen": 0.5058717505876408,
"rewards/margins": 0.7245585503329427,
"rewards/rejected": -0.21868679974530195,
"step": 1520
},
{
"epoch": 1.994818652849741,
"grad_norm": 18.050657272338867,
"kl": 18.97049331665039,
"learning_rate": 2.738894140150075e-07,
"logits/chosen": -36081286.308426075,
"logits/rejected": -36586494.42703533,
"logps/chosen": -485.46244038155805,
"logps/rejected": -387.92660330261134,
"loss": 0.5945,
"loss/base_kto": 3.316699981689453,
"metrics/advantage_var": 575.1785888671875,
"regularization/lipschitz_norm": 1487.2132568359375,
"regularization/w1": 1.439622402191162,
"rewards/chosen": 0.591605327466713,
"rewards/margins": 0.7336290732364423,
"rewards/rejected": -0.14202374576972926,
"step": 1540
},
{
"epoch": 2.0207253886010363,
"grad_norm": 16.62051010131836,
"kl": 13.945266723632812,
"learning_rate": 2.6133756500585156e-07,
"logits/chosen": -33998118.48366013,
"logits/rejected": -35030258.93093093,
"logps/chosen": -488.01485906862746,
"logps/rejected": -376.11674174174175,
"loss": 0.569,
"loss/base_kto": 3.2626521587371826,
"metrics/advantage_var": 449.40869140625,
"regularization/lipschitz_norm": 1331.864501953125,
"regularization/w1": 1.2892446517944336,
"rewards/chosen": 0.4739050771675858,
"rewards/margins": 0.7584942317518575,
"rewards/rejected": -0.28458915458427175,
"step": 1560
},
{
"epoch": 2.0466321243523318,
"grad_norm": 20.428098678588867,
"kl": 10.758501052856445,
"learning_rate": 2.489775719130767e-07,
"logits/chosen": -34294731.0605613,
"logits/rejected": -34568945.99004975,
"logps/chosen": -459.1706979320532,
"logps/rejected": -383.0700404228856,
"loss": 0.5571,
"loss/base_kto": 3.2008590698242188,
"metrics/advantage_var": 456.99053955078125,
"regularization/lipschitz_norm": 1297.861572265625,
"regularization/w1": 1.256330132484436,
"rewards/chosen": 0.45935392168459194,
"rewards/margins": 0.8914253860586849,
"rewards/rejected": -0.43207146437409305,
"step": 1580
},
{
"epoch": 2.0725388601036268,
"grad_norm": 14.740876197814941,
"kl": 14.42285442352295,
"learning_rate": 2.3681937068576303e-07,
"logits/chosen": -33524542.79245283,
"logits/rejected": -35885968.69565217,
"logps/chosen": -498.733981918239,
"logps/rejected": -361.85978746118013,
"loss": 0.5587,
"loss/base_kto": 3.1709067821502686,
"metrics/advantage_var": 468.06396484375,
"regularization/lipschitz_norm": 1341.8985595703125,
"regularization/w1": 1.2989577054977417,
"rewards/chosen": 0.5989355891005798,
"rewards/margins": 0.8622489299451547,
"rewards/rejected": -0.2633133408445749,
"step": 1600
},
{
"epoch": 2.098445595854922,
"grad_norm": 14.413639068603516,
"kl": 14.247815132141113,
"learning_rate": 2.2487273505658e-07,
"logits/chosen": -34089283.03828484,
"logits/rejected": -36174500.13397129,
"logps/chosen": -483.3604517611026,
"logps/rejected": -385.9978568580542,
"loss": 0.5572,
"loss/base_kto": 3.187278985977173,
"metrics/advantage_var": 452.8713073730469,
"regularization/lipschitz_norm": 1312.0400390625,
"regularization/w1": 1.2700546979904175,
"rewards/chosen": 0.5540032145805417,
"rewards/margins": 0.8576783292137156,
"rewards/rejected": -0.30367511463317387,
"step": 1620
},
{
"epoch": 2.1243523316062176,
"grad_norm": 16.39202117919922,
"kl": 14.53508472442627,
"learning_rate": 2.131472686848817e-07,
"logits/chosen": -34614318.618524335,
"logits/rejected": -34455934.20839813,
"logps/chosen": -482.4339678178964,
"logps/rejected": -374.2196734059098,
"loss": 0.5606,
"loss/base_kto": 3.2024028301239014,
"metrics/advantage_var": 450.5284118652344,
"regularization/lipschitz_norm": 1324.870361328125,
"regularization/w1": 1.2824745178222656,
"rewards/chosen": 0.5422733133217229,
"rewards/margins": 0.8314268439824442,
"rewards/rejected": -0.28915353066072125,
"step": 1640
},
{
"epoch": 2.150259067357513,
"grad_norm": 16.80988121032715,
"kl": 12.371950149536133,
"learning_rate": 2.016523974365188e-07,
"logits/chosen": -33979697.87012987,
"logits/rejected": -34665212.915662654,
"logps/chosen": -472.13012378246754,
"logps/rejected": -371.0192724021084,
"loss": 0.5616,
"loss/base_kto": 3.1427133083343506,
"metrics/advantage_var": 495.1771545410156,
"regularization/lipschitz_norm": 1394.9569091796875,
"regularization/w1": 1.350318193435669,
"rewards/chosen": 0.5426324621423498,
"rewards/margins": 0.913743010598381,
"rewards/rejected": -0.37111054845603114,
"step": 1660
},
{
"epoch": 2.1761658031088085,
"grad_norm": 13.9981107711792,
"kl": 8.827503204345703,
"learning_rate": 1.9039736180657372e-07,
"logits/chosen": -33974710.85714286,
"logits/rejected": -36571425.81132075,
"logps/chosen": -490.1635287267081,
"logps/rejected": -362.41951650943395,
"loss": 0.5635,
"loss/base_kto": 3.199734926223755,
"metrics/advantage_var": 461.0420837402344,
"regularization/lipschitz_norm": 1351.3529052734375,
"regularization/w1": 1.3081096410751343,
"rewards/chosen": 0.4198208447568905,
"rewards/margins": 0.8600601332789031,
"rewards/rejected": -0.4402392885220126,
"step": 1680
},
{
"epoch": 2.2020725388601035,
"grad_norm": 19.348628997802734,
"kl": 12.69625473022461,
"learning_rate": 1.7939120949111498e-07,
"logits/chosen": -34444501.8021978,
"logits/rejected": -36621077.897356145,
"logps/chosen": -524.8705357142857,
"logps/rejected": -371.7057737169518,
"loss": 0.559,
"loss/base_kto": 3.1831517219543457,
"metrics/advantage_var": 447.22412109375,
"regularization/lipschitz_norm": 1331.1708984375,
"regularization/w1": 1.2885735034942627,
"rewards/chosen": 0.534057042288069,
"rewards/margins": 0.8541402570315809,
"rewards/rejected": -0.32008321474351187,
"step": 1700
},
{
"epoch": 2.227979274611399,
"grad_norm": 12.006818771362305,
"kl": 13.238250732421875,
"learning_rate": 1.6864278811393523e-07,
"logits/chosen": -33977827.0778626,
"logits/rejected": -35741846.7328,
"logps/chosen": -473.8763835877863,
"logps/rejected": -391.372475,
"loss": 0.561,
"loss/base_kto": 3.1720783710479736,
"metrics/advantage_var": 465.51226806640625,
"regularization/lipschitz_norm": 1359.76171875,
"regularization/w1": 1.3162492513656616,
"rewards/chosen": 0.5685190914241413,
"rewards/margins": 0.8942543453303913,
"rewards/rejected": -0.32573525390625,
"step": 1720
},
{
"epoch": 2.2538860103626943,
"grad_norm": 23.530920028686523,
"kl": 8.311408042907715,
"learning_rate": 1.5816073811412584e-07,
"logits/chosen": -33926570.79694656,
"logits/rejected": -35590327.5008,
"logps/chosen": -493.20209923664123,
"logps/rejected": -365.7894,
"loss": 0.5575,
"loss/base_kto": 3.1930572986602783,
"metrics/advantage_var": 473.5223693847656,
"regularization/lipschitz_norm": 1309.0533447265625,
"regularization/w1": 1.267163634300232,
"rewards/chosen": 0.47187770231989506,
"rewards/margins": 0.900834831226145,
"rewards/rejected": -0.42895712890625,
"step": 1740
},
{
"epoch": 2.2797927461139897,
"grad_norm": 13.836443901062012,
"kl": 11.999221801757812,
"learning_rate": 1.4795348580020207e-07,
"logits/chosen": -33998593.96018377,
"logits/rejected": -34455081.64593302,
"logps/chosen": -444.62433001531394,
"logps/rejected": -373.3021331738437,
"loss": 0.5521,
"loss/base_kto": 3.234546661376953,
"metrics/advantage_var": 380.58978271484375,
"regularization/lipschitz_norm": 1221.0994873046875,
"regularization/w1": 1.182024359703064,
"rewards/chosen": 0.4462666299770291,
"rewards/margins": 0.7969859784525325,
"rewards/rejected": -0.3507193484755034,
"step": 1760
},
{
"epoch": 2.305699481865285,
"grad_norm": 18.7479305267334,
"kl": 14.273015022277832,
"learning_rate": 1.3802923657636355e-07,
"logits/chosen": -35007398.67912772,
"logits/rejected": -35545569.504702196,
"logps/chosen": -487.9390576323988,
"logps/rejected": -392.7202684169279,
"loss": 0.5461,
"loss/base_kto": 3.14363169670105,
"metrics/advantage_var": 409.0979309082031,
"regularization/lipschitz_norm": 1265.660888671875,
"regularization/w1": 1.2251596450805664,
"rewards/chosen": 0.5476035239911896,
"rewards/margins": 0.8756958539193097,
"rewards/rejected": -0.3280923299281201,
"step": 1780
},
{
"epoch": 2.33160621761658,
"grad_norm": 17.080482482910156,
"kl": 16.26753044128418,
"learning_rate": 1.28395968346336e-07,
"logits/chosen": -35982050.93623639,
"logits/rejected": -34576348.63422292,
"logps/chosen": -488.40629860031106,
"logps/rejected": -367.37259615384613,
"loss": 0.5539,
"loss/base_kto": 3.173492193222046,
"metrics/advantage_var": 420.8414001464844,
"regularization/lipschitz_norm": 1298.9735107421875,
"regularization/w1": 1.2574061155319214,
"rewards/chosen": 0.5900054504489454,
"rewards/margins": 0.8648827621195572,
"rewards/rejected": -0.27487731167061175,
"step": 1800
},
{
"epoch": 2.3575129533678756,
"grad_norm": 17.228593826293945,
"kl": 16.6585693359375,
"learning_rate": 1.1906142510009415e-07,
"logits/chosen": -34466087.35340729,
"logits/rejected": -36132488.4807396,
"logps/chosen": -464.84429477020603,
"logps/rejected": -355.222626155624,
"loss": 0.5592,
"loss/base_kto": 3.240309953689575,
"metrics/advantage_var": 381.2550048828125,
"regularization/lipschitz_norm": 1273.9112548828125,
"regularization/w1": 1.233146071434021,
"rewards/chosen": 0.4801065048967413,
"rewards/margins": 0.7706964590554831,
"rewards/rejected": -0.29058995415874184,
"step": 1820
},
{
"epoch": 2.383419689119171,
"grad_norm": 17.9788818359375,
"kl": 13.090388298034668,
"learning_rate": 1.1003311068862547e-07,
"logits/chosen": -34962850.98262243,
"logits/rejected": -35811388.14219475,
"logps/chosen": -455.1439079778831,
"logps/rejected": -396.12533809891806,
"loss": 0.5543,
"loss/base_kto": 3.1894686222076416,
"metrics/advantage_var": 433.10406494140625,
"regularization/lipschitz_norm": 1286.2496337890625,
"regularization/w1": 1.2450895309448242,
"rewards/chosen": 0.5177260846323312,
"rewards/margins": 0.8659712248377263,
"rewards/rejected": -0.3482451402053951,
"step": 1840
},
{
"epoch": 2.4093264248704664,
"grad_norm": 18.649703979492188,
"kl": 11.21081256866455,
"learning_rate": 1.0131828279173588e-07,
"logits/chosen": -35445656.485225506,
"logits/rejected": -35233978.474097334,
"logps/chosen": -472.22851866251943,
"logps/rejected": -393.0775363029827,
"loss": 0.5594,
"loss/base_kto": 3.2486932277679443,
"metrics/advantage_var": 397.58642578125,
"regularization/lipschitz_norm": 1267.3721923828125,
"regularization/w1": 1.226816177368164,
"rewards/chosen": 0.4129372414311577,
"rewards/margins": 0.77915225113546,
"rewards/rejected": -0.3662150097043024,
"step": 1860
},
{
"epoch": 2.4352331606217614,
"grad_norm": 15.14542293548584,
"kl": 12.136643409729004,
"learning_rate": 9.292394708374596e-08,
"logits/chosen": -31783607.426791277,
"logits/rejected": -35130640.852664575,
"logps/chosen": -467.41111760124613,
"logps/rejected": -386.44278996865205,
"loss": 0.5635,
"loss/base_kto": 3.24726939201355,
"metrics/advantage_var": 387.1895751953125,
"regularization/lipschitz_norm": 1302.4925537109375,
"regularization/w1": 1.260812759399414,
"rewards/chosen": 0.4486684353552132,
"rewards/margins": 0.7824724792117473,
"rewards/rejected": -0.3338040438565341,
"step": 1880
},
{
"epoch": 2.461139896373057,
"grad_norm": 19.20258903503418,
"kl": 12.994461059570312,
"learning_rate": 8.48568516017727e-08,
"logits/chosen": -33757476.571428575,
"logits/rejected": -35397613.29680365,
"logps/chosen": -474.8577447833066,
"logps/rejected": -384.66799847793,
"loss": 0.5644,
"loss/base_kto": 3.19708514213562,
"metrics/advantage_var": 454.6419982910156,
"regularization/lipschitz_norm": 1361.6043701171875,
"regularization/w1": 1.3180330991744995,
"rewards/chosen": 0.49236041661441615,
"rewards/margins": 0.8630950160602875,
"rewards/rejected": -0.3707345994458714,
"step": 1900
},
{
"epoch": 2.4870466321243523,
"grad_norm": 15.626067161560059,
"kl": 13.845202445983887,
"learning_rate": 7.71234813211169e-08,
"logits/chosen": -35151315.31902718,
"logits/rejected": -35724917.20481928,
"logps/chosen": -481.55767167381975,
"logps/rejected": -388.76947074010326,
"loss": 0.5637,
"loss/base_kto": 3.205005407333374,
"metrics/advantage_var": 493.1046447753906,
"regularization/lipschitz_norm": 1347.6864013671875,
"regularization/w1": 1.3045603036880493,
"rewards/chosen": 0.5400235635869323,
"rewards/margins": 0.8575986473343102,
"rewards/rejected": -0.3175750837473779,
"step": 1920
},
{
"epoch": 2.5129533678756477,
"grad_norm": 18.5164737701416,
"kl": 17.44912338256836,
"learning_rate": 6.973005294212353e-08,
"logits/chosen": -35019616.415584415,
"logits/rejected": -36521962.409638554,
"logps/chosen": -530.0438311688312,
"logps/rejected": -361.7835560993976,
"loss": 0.5599,
"loss/base_kto": 3.148027181625366,
"metrics/advantage_var": 465.3861389160156,
"regularization/lipschitz_norm": 1375.33935546875,
"regularization/w1": 1.3313285112380981,
"rewards/chosen": 0.585678397835075,
"rewards/margins": 0.8833667096761895,
"rewards/rejected": -0.29768831184111444,
"step": 1940
},
{
"epoch": 2.538860103626943,
"grad_norm": 18.81517791748047,
"kl": 16.840726852416992,
"learning_rate": 6.268250989270102e-08,
"logits/chosen": -32924400.65615142,
"logits/rejected": -34926947.071207434,
"logps/chosen": -472.1737480283912,
"logps/rejected": -356.75503095975233,
"loss": 0.5562,
"loss/base_kto": 3.1783366203308105,
"metrics/advantage_var": 459.222900390625,
"regularization/lipschitz_norm": 1313.1341552734375,
"regularization/w1": 1.2711137533187866,
"rewards/chosen": 0.6009337127396737,
"rewards/margins": 0.8580611734201835,
"rewards/rejected": -0.25712746068050985,
"step": 1960
},
{
"epoch": 2.5647668393782386,
"grad_norm": 16.062894821166992,
"kl": 17.200666427612305,
"learning_rate": 5.598651755051975e-08,
"logits/chosen": -34852742.20970266,
"logits/rejected": -34403831.21372855,
"logps/chosen": -460.07453051643193,
"logps/rejected": -383.13472601404055,
"loss": 0.5532,
"loss/base_kto": 3.1713249683380127,
"metrics/advantage_var": 438.6906433105469,
"regularization/lipschitz_norm": 1295.8245849609375,
"regularization/w1": 1.254358172416687,
"rewards/chosen": 0.5537259336182022,
"rewards/margins": 0.8524414149522993,
"rewards/rejected": -0.2987154813340971,
"step": 1980
},
{
"epoch": 2.5906735751295336,
"grad_norm": 21.8310489654541,
"kl": 16.158554077148438,
"learning_rate": 4.964745868872933e-08,
"logits/chosen": -34827287.16742081,
"logits/rejected": -35782742.30145867,
"logps/chosen": -472.59483408748116,
"logps/rejected": -368.5598662884927,
"loss": 0.5546,
"loss/base_kto": 3.186894178390503,
"metrics/advantage_var": 418.841552734375,
"regularization/lipschitz_norm": 1291.564697265625,
"regularization/w1": 1.250234603881836,
"rewards/chosen": 0.6041385426240808,
"rewards/margins": 0.83494204622011,
"rewards/rejected": -0.23080350359602916,
"step": 2000
},
{
"epoch": 2.616580310880829,
"grad_norm": 16.86695671081543,
"kl": 15.236518859863281,
"learning_rate": 4.3670429148855493e-08,
"logits/chosen": -33886632.81733746,
"logits/rejected": -35228839.97476341,
"logps/chosen": -491.03521671826627,
"logps/rejected": -351.9504879731861,
"loss": 0.5594,
"loss/base_kto": 3.1471123695373535,
"metrics/advantage_var": 472.02471923828125,
"regularization/lipschitz_norm": 1371.6966552734375,
"regularization/w1": 1.327802300453186,
"rewards/chosen": 0.6444367683339783,
"rewards/margins": 0.892264244089351,
"rewards/rejected": -0.24782747575537264,
"step": 2020
},
{
"epoch": 2.6424870466321244,
"grad_norm": 17.506450653076172,
"kl": 14.43799114227295,
"learning_rate": 3.806023374435663e-08,
"logits/chosen": -35159176.735905044,
"logits/rejected": -34792326.33663366,
"logps/chosen": -468.8777355341246,
"logps/rejected": -390.7791357260726,
"loss": 0.5632,
"loss/base_kto": 3.252534866333008,
"metrics/advantage_var": 408.421142578125,
"regularization/lipschitz_norm": 1294.4359130859375,
"regularization/w1": 1.2530139684677124,
"rewards/chosen": 0.5193015984328635,
"rewards/margins": 0.7791759485998138,
"rewards/rejected": -0.25987435016695026,
"step": 2040
},
{
"epoch": 2.66839378238342,
"grad_norm": 13.688880920410156,
"kl": 18.5648193359375,
"learning_rate": 3.282138239813037e-08,
"logits/chosen": -34833847.32903226,
"logits/rejected": -35717064.14545455,
"logps/chosen": -480.2965221774194,
"logps/rejected": -393.7698390151515,
"loss": 0.5591,
"loss/base_kto": 3.169818639755249,
"metrics/advantage_var": 437.3623046875,
"regularization/lipschitz_norm": 1345.8072509765625,
"regularization/w1": 1.3027414083480835,
"rewards/chosen": 0.5905017483618952,
"rewards/margins": 0.8669500848764549,
"rewards/rejected": -0.27644833651455963,
"step": 2060
},
{
"epoch": 2.694300518134715,
"grad_norm": 15.005108833312988,
"kl": 16.943044662475586,
"learning_rate": 2.795808651707793e-08,
"logits/chosen": -34711051.095975235,
"logits/rejected": -35973746.67507886,
"logps/chosen": -468.4868421052632,
"logps/rejected": -383.1545248422713,
"loss": 0.5551,
"loss/base_kto": 3.2320587635040283,
"metrics/advantage_var": 435.31915283203125,
"regularization/lipschitz_norm": 1248.82568359375,
"regularization/w1": 1.2088632583618164,
"rewards/chosen": 0.5310895228902622,
"rewards/margins": 0.8049011038971998,
"rewards/rejected": -0.2738115810069376,
"step": 2080
},
{
"epoch": 2.7202072538860103,
"grad_norm": 14.439000129699707,
"kl": 14.053105354309082,
"learning_rate": 2.3474255606639293e-08,
"logits/chosen": -32798904.44720497,
"logits/rejected": -35138939.974842764,
"logps/chosen": -503.3350155279503,
"logps/rejected": -353.41548742138366,
"loss": 0.5643,
"loss/base_kto": 3.2001991271972656,
"metrics/advantage_var": 444.739501953125,
"regularization/lipschitz_norm": 1357.4036865234375,
"regularization/w1": 1.3139667510986328,
"rewards/chosen": 0.5621507064155911,
"rewards/margins": 0.8263029453693793,
"rewards/rejected": -0.2641522389537883,
"step": 2100
},
{
"epoch": 2.7461139896373057,
"grad_norm": 13.330938339233398,
"kl": 16.989704132080078,
"learning_rate": 1.9373494128020195e-08,
"logits/chosen": -33937784.23003195,
"logits/rejected": -36362856.905198775,
"logps/chosen": -491.1370307507987,
"logps/rejected": -378.1333142201835,
"loss": 0.5489,
"loss/base_kto": 3.195096254348755,
"metrics/advantage_var": 410.2955017089844,
"regularization/lipschitz_norm": 1235.5635986328125,
"regularization/w1": 1.1960254907608032,
"rewards/chosen": 0.5536118772464057,
"rewards/margins": 0.8186561100027608,
"rewards/rejected": -0.26504423275635514,
"step": 2120
},
{
"epoch": 2.772020725388601,
"grad_norm": 17.127193450927734,
"kl": 16.70460319519043,
"learning_rate": 1.5659098600638798e-08,
"logits/chosen": -33892532.89589905,
"logits/rejected": -35187651.76470588,
"logps/chosen": -489.6055796529968,
"logps/rejected": -370.78700657894734,
"loss": 0.5568,
"loss/base_kto": 3.193934202194214,
"metrics/advantage_var": 392.8123474121094,
"regularization/lipschitz_norm": 1302.4627685546875,
"regularization/w1": 1.2607840299606323,
"rewards/chosen": 0.544373810103263,
"rewards/margins": 0.8132462866869269,
"rewards/rejected": -0.26887247658366387,
"step": 2140
},
{
"epoch": 2.7979274611398965,
"grad_norm": 21.913311004638672,
"kl": 18.2757511138916,
"learning_rate": 1.2334054952120143e-08,
"logits/chosen": -33734282.132471725,
"logits/rejected": -35014287.29803328,
"logps/chosen": -497.5305432148627,
"logps/rejected": -370.5315336611195,
"loss": 0.5566,
"loss/base_kto": 3.165632724761963,
"metrics/advantage_var": 480.1612243652344,
"regularization/lipschitz_norm": 1329.922119140625,
"regularization/w1": 1.2873646020889282,
"rewards/chosen": 0.6263517462956886,
"rewards/margins": 0.8615022436629588,
"rewards/rejected": -0.23515049736727023,
"step": 2160
},
{
"epoch": 2.823834196891192,
"grad_norm": 14.240015029907227,
"kl": 16.6707763671875,
"learning_rate": 9.401036117969108e-09,
"logits/chosen": -34648265.44262295,
"logits/rejected": -36758738.91343284,
"logps/chosen": -491.2049692622951,
"logps/rejected": -378.88027052238806,
"loss": 0.5525,
"loss/base_kto": 3.080538511276245,
"metrics/advantage_var": 493.7511901855469,
"regularization/lipschitz_norm": 1384.0885009765625,
"regularization/w1": 1.3397976160049438,
"rewards/chosen": 0.6625063036308914,
"rewards/margins": 0.9604570482597976,
"rewards/rejected": -0.29795074462890625,
"step": 2180
},
{
"epoch": 2.849740932642487,
"grad_norm": 15.475432395935059,
"kl": 15.486937522888184,
"learning_rate": 6.8623998928517555e-09,
"logits/chosen": -34422012.28985507,
"logits/rejected": -36248782.6646434,
"logps/chosen": -468.6735104669887,
"logps/rejected": -371.3877560698027,
"loss": 0.5559,
"loss/base_kto": 3.142998456954956,
"metrics/advantage_var": 464.4955139160156,
"regularization/lipschitz_norm": 1346.9864501953125,
"regularization/w1": 1.3038829565048218,
"rewards/chosen": 0.6192004807329409,
"rewards/margins": 0.9063298611862793,
"rewards/rejected": -0.2871293804533384,
"step": 2200
},
{
"epoch": 2.8756476683937824,
"grad_norm": 19.727224349975586,
"kl": 17.00147819519043,
"learning_rate": 4.72018703521132e-09,
"logits/chosen": -34866807.27733756,
"logits/rejected": -35465831.34668721,
"logps/chosen": -467.4975237717908,
"logps/rejected": -385.7292469183359,
"loss": 0.5548,
"loss/base_kto": 3.1698315143585205,
"metrics/advantage_var": 459.7564392089844,
"regularization/lipschitz_norm": 1310.61181640625,
"regularization/w1": 1.268672227859497,
"rewards/chosen": 0.5610522770466027,
"rewards/margins": 0.8665984777444913,
"rewards/rejected": -0.30554620069788857,
"step": 2220
},
{
"epoch": 2.901554404145078,
"grad_norm": 16.78679656982422,
"kl": 15.156946182250977,
"learning_rate": 2.976119626744267e-09,
"logits/chosen": -34897055.584415585,
"logits/rejected": -36429401.44578313,
"logps/chosen": -493.0818790584416,
"logps/rejected": -400.7662838855422,
"loss": 0.5643,
"loss/base_kto": 3.1686346530914307,
"metrics/advantage_var": 461.27764892578125,
"regularization/lipschitz_norm": 1390.584228515625,
"regularization/w1": 1.346085548400879,
"rewards/chosen": 0.5905988123509791,
"rewards/margins": 0.8635635656512897,
"rewards/rejected": -0.2729647533003106,
"step": 2240
},
{
"epoch": 2.927461139896373,
"grad_norm": 17.594505310058594,
"kl": 14.354560852050781,
"learning_rate": 1.631599688052765e-09,
"logits/chosen": -33768229.717868336,
"logits/rejected": -35560929.69470405,
"logps/chosen": -464.0438871473354,
"logps/rejected": -364.80821651090343,
"loss": 0.5604,
"loss/base_kto": 3.218501329421997,
"metrics/advantage_var": 408.1050720214844,
"regularization/lipschitz_norm": 1306.2288818359375,
"regularization/w1": 1.2644294500350952,
"rewards/chosen": 0.5158534513371865,
"rewards/margins": 0.7974783136753387,
"rewards/rejected": -0.28162486233815226,
"step": 2260
},
{
"epoch": 2.9533678756476682,
"grad_norm": 20.96672248840332,
"kl": 16.356908798217773,
"learning_rate": 6.877080515894085e-10,
"logits/chosen": -34671509.63100775,
"logits/rejected": -35817662.28661417,
"logps/chosen": -493.24646317829456,
"logps/rejected": -393.57445866141734,
"loss": 0.5647,
"loss/base_kto": 3.20023512840271,
"metrics/advantage_var": 475.9938659667969,
"regularization/lipschitz_norm": 1360.5635986328125,
"regularization/w1": 1.3170255422592163,
"rewards/chosen": 0.5620458321977956,
"rewards/margins": 0.8555970113777907,
"rewards/rejected": -0.29355117917999507,
"step": 2280
},
{
"epoch": 2.9792746113989637,
"grad_norm": 12.60053825378418,
"kl": 14.49432373046875,
"learning_rate": 1.4520349279739663e-10,
"logits/chosen": -33889937.28679818,
"logits/rejected": -33668282.33172303,
"logps/chosen": -469.68114567526555,
"logps/rejected": -342.706672705314,
"loss": 0.5459,
"loss/base_kto": 3.164848804473877,
"metrics/advantage_var": 418.7054748535156,
"regularization/lipschitz_norm": 1241.8707275390625,
"regularization/w1": 1.2021307945251465,
"rewards/chosen": 0.5740103598610584,
"rewards/margins": 0.8767580525159245,
"rewards/rejected": -0.3027476926548661,
"step": 2300
},
{
"epoch": 3.0,
"step": 2316,
"total_flos": 9.975174191323546e+17,
"train_loss": 0.5861780454045956,
"train_runtime": 11125.761,
"train_samples_per_second": 13.322,
"train_steps_per_second": 0.208
}
],
"logging_steps": 20,
"max_steps": 2316,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": false,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 9.975174191323546e+17,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}