Files
aup-fullft-kto_w1-w1lam9.68…/trainer_state.json
ModelHub XC 1e85411d8f 初始化项目,由ModelHub XC社区提供模型
Model: Gueule-d-ange/aup-fullft-kto_w1-w1lam9.68e-4-seed4
Source: Original Platform
2026-07-25 19:42:30 +08:00

2229 lines
81 KiB
JSON

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 3.0,
"eval_steps": 500,
"global_step": 2316,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.025906735751295335,
"grad_norm": 24.171916961669922,
"kl": 17.971378326416016,
"learning_rate": 1.8999999999999998e-07,
"logits/chosen": -35316779.70731708,
"logits/rejected": -36768866.461538464,
"logps/chosen": -497.724228277439,
"logps/rejected": -363.51056690705127,
"loss": 0.6047,
"loss/base_kto": 3.8854215145111084,
"metrics/advantage_var": 204.70074462890625,
"regularization/lipschitz_norm": 983.5292358398438,
"regularization/w1": 0.952056348323822,
"rewards/chosen": 0.28100246336401963,
"rewards/margins": 0.11808828505372315,
"rewards/rejected": 0.16291417831029648,
"step": 20
},
{
"epoch": 0.05181347150259067,
"grad_norm": 22.6082820892334,
"kl": 14.165916442871094,
"learning_rate": 3.8999999999999997e-07,
"logits/chosen": -37087235.13629403,
"logits/rejected": -37193473.22488038,
"logps/chosen": -483.79216117917304,
"logps/rejected": -404.0459778708134,
"loss": 0.6051,
"loss/base_kto": 3.9289321899414062,
"metrics/advantage_var": 192.48802185058594,
"regularization/lipschitz_norm": 941.6502075195312,
"regularization/w1": 0.911517322063446,
"rewards/chosen": 0.13989972849169696,
"rewards/margins": 0.07407873944570663,
"rewards/rejected": 0.06582098904599033,
"step": 40
},
{
"epoch": 0.07772020725388601,
"grad_norm": 26.396751403808594,
"kl": 10.408247947692871,
"learning_rate": 5.9e-07,
"logits/chosen": -35812877.32924962,
"logits/rejected": -37073189.97129186,
"logps/chosen": -493.8341787901991,
"logps/rejected": -388.9180123604466,
"loss": 0.5946,
"loss/base_kto": 3.8426125049591064,
"metrics/advantage_var": 201.38356018066406,
"regularization/lipschitz_norm": 944.7931518554688,
"regularization/w1": 0.9145596623420715,
"rewards/chosen": 0.19716486558432236,
"rewards/margins": 0.1451017434540455,
"rewards/rejected": 0.05206312213027686,
"step": 60
},
{
"epoch": 0.10362694300518134,
"grad_norm": 21.040809631347656,
"kl": 3.604231357574463,
"learning_rate": 7.9e-07,
"logits/chosen": -37383490.82033898,
"logits/rejected": -37841154.22608696,
"logps/chosen": -490.29480932203387,
"logps/rejected": -394.2195652173913,
"loss": 0.5971,
"loss/base_kto": 3.840106248855591,
"metrics/advantage_var": 192.21023559570312,
"regularization/lipschitz_norm": 967.9828491210938,
"regularization/w1": 0.9370073676109314,
"rewards/chosen": -0.0987275980286679,
"rewards/margins": 0.12818333310244623,
"rewards/rejected": -0.22691093113111413,
"step": 80
},
{
"epoch": 0.12953367875647667,
"grad_norm": 22.586702346801758,
"kl": 7.076615333557129,
"learning_rate": 9.9e-07,
"logits/chosen": -35031971.77639752,
"logits/rejected": -36753507.82389937,
"logps/chosen": -482.4668575310559,
"logps/rejected": -354.69388757861634,
"loss": 0.6005,
"loss/base_kto": 3.8660409450531006,
"metrics/advantage_var": 210.2734832763672,
"regularization/lipschitz_norm": 969.1918334960938,
"regularization/w1": 0.9381775856018066,
"rewards/chosen": 0.018050518095123102,
"rewards/margins": 0.13388869489439345,
"rewards/rejected": -0.11583817679927035,
"step": 100
},
{
"epoch": 0.15544041450777202,
"grad_norm": 24.313669204711914,
"kl": 13.761123657226562,
"learning_rate": 9.998186234298189e-07,
"logits/chosen": -36796998.33865815,
"logits/rejected": -36799199.90214067,
"logps/chosen": -469.5819688498403,
"logps/rejected": -374.8200974770642,
"loss": 0.6077,
"loss/base_kto": 3.8909480571746826,
"metrics/advantage_var": 223.26220703125,
"regularization/lipschitz_norm": 1002.9113159179688,
"regularization/w1": 0.9708181619644165,
"rewards/chosen": 0.21156050221988568,
"rewards/margins": 0.09433169383145272,
"rewards/rejected": 0.11722880838843296,
"step": 120
},
{
"epoch": 0.18134715025906736,
"grad_norm": 21.588844299316406,
"kl": 9.700366020202637,
"learning_rate": 9.992359552107714e-07,
"logits/chosen": -36744837.53204173,
"logits/rejected": -38196094.52873563,
"logps/chosen": -496.6974664679583,
"logps/rejected": -368.6950687602627,
"loss": 0.5943,
"loss/base_kto": 3.799974203109741,
"metrics/advantage_var": 212.4312744140625,
"regularization/lipschitz_norm": 985.76953125,
"regularization/w1": 0.9542250037193298,
"rewards/chosen": 0.17170122945361982,
"rewards/margins": 0.2000509132434039,
"rewards/rejected": -0.028349683789784096,
"step": 140
},
{
"epoch": 0.20725388601036268,
"grad_norm": 17.44001007080078,
"kl": 4.787113666534424,
"learning_rate": 9.982519612796161e-07,
"logits/chosen": -36035446.15384615,
"logits/rejected": -36212767.219512194,
"logps/chosen": -477.42322716346155,
"logps/rejected": -349.8604706554878,
"loss": 0.5934,
"loss/base_kto": 3.8393142223358154,
"metrics/advantage_var": 205.9862060546875,
"regularization/lipschitz_norm": 938.0133056640625,
"regularization/w1": 0.9079969525337219,
"rewards/chosen": 0.06676110854515663,
"rewards/margins": 0.1606005620330181,
"rewards/rejected": -0.09383945348786145,
"step": 160
},
{
"epoch": 0.23316062176165803,
"grad_norm": 18.280359268188477,
"kl": 1.6990368366241455,
"learning_rate": 9.968674326492213e-07,
"logits/chosen": -35199759.52721617,
"logits/rejected": -36141772.96075353,
"logps/chosen": -456.05355754276826,
"logps/rejected": -362.4076236263736,
"loss": 0.5899,
"loss/base_kto": 3.8271141052246094,
"metrics/advantage_var": 199.59747314453125,
"regularization/lipschitz_norm": 921.5966796875,
"regularization/w1": 0.8921055197715759,
"rewards/chosen": -0.10501613587280084,
"rewards/margins": 0.1806835857225681,
"rewards/rejected": -0.28569972159536894,
"step": 180
},
{
"epoch": 0.25906735751295334,
"grad_norm": 19.40365219116211,
"kl": 9.957293510437012,
"learning_rate": 9.950834823142198e-07,
"logits/chosen": -34833159.70839936,
"logits/rejected": -37904980.41294299,
"logps/chosen": -497.16536251980983,
"logps/rejected": -373.4144356702619,
"loss": 0.5977,
"loss/base_kto": 3.7903313636779785,
"metrics/advantage_var": 230.1645050048828,
"regularization/lipschitz_norm": 1023.9474487304688,
"regularization/w1": 0.9911810159683228,
"rewards/chosen": 0.16381330535453398,
"rewards/margins": 0.2036897788739283,
"rewards/rejected": -0.03987647351939432,
"step": 200
},
{
"epoch": 0.2849740932642487,
"grad_norm": 24.024091720581055,
"kl": 6.649497985839844,
"learning_rate": 9.929015443562942e-07,
"logits/chosen": -36357843.109004736,
"logits/rejected": -36603995.79598145,
"logps/chosen": -480.86868088467617,
"logps/rejected": -375.7693199381762,
"loss": 0.6005,
"loss/base_kto": 3.7809770107269287,
"metrics/advantage_var": 276.2771911621094,
"regularization/lipschitz_norm": 1056.7017822265625,
"regularization/w1": 1.0228872299194336,
"rewards/chosen": 0.07966904240950212,
"rewards/margins": 0.2167478833226409,
"rewards/rejected": -0.13707884091313877,
"step": 220
},
{
"epoch": 0.31088082901554404,
"grad_norm": 24.00461196899414,
"kl": 8.452391624450684,
"learning_rate": 9.90323372791347e-07,
"logits/chosen": -36556822.22635659,
"logits/rejected": -36657490.64566929,
"logps/chosen": -473.9613856589147,
"logps/rejected": -386.12573818897636,
"loss": 0.5986,
"loss/base_kto": 3.76371169090271,
"metrics/advantage_var": 254.5139923095703,
"regularization/lipschitz_norm": 1058.958740234375,
"regularization/w1": 1.0250719785690308,
"rewards/chosen": 0.09946464124576065,
"rewards/margins": 0.22167490207253232,
"rewards/rejected": -0.12221026082677165,
"step": 240
},
{
"epoch": 0.33678756476683935,
"grad_norm": 30.11318588256836,
"kl": 13.7765531539917,
"learning_rate": 9.87351040159484e-07,
"logits/chosen": -35608964.93768546,
"logits/rejected": -37566044.93729373,
"logps/chosen": -479.20850333827894,
"logps/rejected": -371.1122112211221,
"loss": 0.5963,
"loss/base_kto": 3.685382843017578,
"metrics/advantage_var": 293.2428894042969,
"regularization/lipschitz_norm": 1121.0953369140625,
"regularization/w1": 1.0852203369140625,
"rewards/chosen": 0.3413410582952754,
"rewards/margins": 0.2959683660234542,
"rewards/rejected": 0.045372692271821176,
"step": 260
},
{
"epoch": 0.3626943005181347,
"grad_norm": 27.58708381652832,
"kl": 22.29041862487793,
"learning_rate": 9.839869358589396e-07,
"logits/chosen": -37715201.9306184,
"logits/rejected": -39577872.1815235,
"logps/chosen": -489.99769042232276,
"logps/rejected": -354.0433549432739,
"loss": 0.6002,
"loss/base_kto": 3.7528398036956787,
"metrics/advantage_var": 287.2712097167969,
"regularization/lipschitz_norm": 1083.8204345703125,
"regularization/w1": 1.0491383075714111,
"rewards/chosen": 0.3891103062694429,
"rewards/margins": 0.2284970345159988,
"rewards/rejected": 0.1606132717534441,
"step": 280
},
{
"epoch": 0.38860103626943004,
"grad_norm": 18.10953712463379,
"kl": 22.626684188842773,
"learning_rate": 9.80233764225289e-07,
"logits/chosen": -36378617.52922591,
"logits/rejected": -37791354.65842349,
"logps/chosen": -491.140304107425,
"logps/rejected": -381.2754781684699,
"loss": 0.5995,
"loss/base_kto": 3.845449924468994,
"metrics/advantage_var": 213.772216796875,
"regularization/lipschitz_norm": 982.02880859375,
"regularization/w1": 0.9506039023399353,
"rewards/chosen": 0.3383839443019969,
"rewards/margins": 0.13321049314219688,
"rewards/rejected": 0.20517345115980004,
"step": 300
},
{
"epoch": 0.41450777202072536,
"grad_norm": 25.496047973632812,
"kl": 14.383989334106445,
"learning_rate": 9.760945423574868e-07,
"logits/chosen": -37659781.835866265,
"logits/rejected": -38620067.80707396,
"logps/chosen": -494.45825417933133,
"logps/rejected": -358.76914188102893,
"loss": 0.584,
"loss/base_kto": 3.7954728603363037,
"metrics/advantage_var": 201.11444091796875,
"regularization/lipschitz_norm": 905.8062744140625,
"regularization/w1": 0.8768205046653748,
"rewards/chosen": 0.24768414250985468,
"rewards/margins": 0.17627670173554424,
"rewards/rejected": 0.07140744077431044,
"step": 320
},
{
"epoch": 0.44041450777202074,
"grad_norm": 22.850505828857422,
"kl": 9.190020561218262,
"learning_rate": 9.71572597692482e-07,
"logits/chosen": -36118437.97802198,
"logits/rejected": -37721006.7807154,
"logps/chosen": -476.0750588697017,
"logps/rejected": -363.1827614696734,
"loss": 0.5889,
"loss/base_kto": 3.759268283843994,
"metrics/advantage_var": 211.2550048828125,
"regularization/lipschitz_norm": 983.0006103515625,
"regularization/w1": 0.951544463634491,
"rewards/chosen": 0.12163652692522321,
"rewards/margins": 0.23103632542377733,
"rewards/rejected": -0.10939979849855413,
"step": 340
},
{
"epoch": 0.46632124352331605,
"grad_norm": 21.94005012512207,
"kl": 14.6563081741333,
"learning_rate": 9.666715653303588e-07,
"logits/chosen": -36833775.43297381,
"logits/rejected": -37856299.81616482,
"logps/chosen": -486.2754718798151,
"logps/rejected": -386.76116778922346,
"loss": 0.5988,
"loss/base_kto": 3.7516915798187256,
"metrics/advantage_var": 250.81607055664062,
"regularization/lipschitz_norm": 1073.2459716796875,
"regularization/w1": 1.038901925086975,
"rewards/chosen": 0.2067007761339561,
"rewards/margins": 0.20732436276141453,
"rewards/rejected": -0.0006235866274584303,
"step": 360
},
{
"epoch": 0.49222797927461137,
"grad_norm": 25.312530517578125,
"kl": 15.028098106384277,
"learning_rate": 9.613953851121528e-07,
"logits/chosen": -35418189.45839637,
"logits/rejected": -38815198.08723748,
"logps/chosen": -501.94752269288955,
"logps/rejected": -371.9616316639742,
"loss": 0.5972,
"loss/base_kto": 3.7215523719787598,
"metrics/advantage_var": 279.48394775390625,
"regularization/lipschitz_norm": 1090.6280517578125,
"regularization/w1": 1.0557279586791992,
"rewards/chosen": 0.30185509016582357,
"rewards/margins": 0.23913481142743503,
"rewards/rejected": 0.06272027873838854,
"step": 380
},
{
"epoch": 0.5181347150259067,
"grad_norm": 21.098722457885742,
"kl": 15.414970397949219,
"learning_rate": 9.557482984526924e-07,
"logits/chosen": -36133701.67340591,
"logits/rejected": -37539753.19309262,
"logps/chosen": -461.15697900466563,
"logps/rejected": -361.7773253532182,
"loss": 0.5973,
"loss/base_kto": 3.795140504837036,
"metrics/advantage_var": 254.8007049560547,
"regularization/lipschitz_norm": 1016.0383911132812,
"regularization/w1": 0.9835252165794373,
"rewards/chosen": 0.2212227543998469,
"rewards/margins": 0.17877199477564715,
"rewards/rejected": 0.04245075962419974,
"step": 400
},
{
"epoch": 0.5440414507772021,
"grad_norm": 26.532087326049805,
"kl": 10.874388694763184,
"learning_rate": 9.497348449310107e-07,
"logits/chosen": -35524204.45320197,
"logits/rejected": -37241613.353204176,
"logps/chosen": -472.52324507389164,
"logps/rejected": -351.55993852459017,
"loss": 0.5838,
"loss/base_kto": 3.7438149452209473,
"metrics/advantage_var": 227.2717742919922,
"regularization/lipschitz_norm": 956.939453125,
"regularization/w1": 0.9263173937797546,
"rewards/chosen": 0.21551162895114942,
"rewards/margins": 0.22224590135796485,
"rewards/rejected": -0.006734272406815417,
"step": 420
},
{
"epoch": 0.5699481865284974,
"grad_norm": 27.539342880249023,
"kl": 6.9973602294921875,
"learning_rate": 9.433598586410701e-07,
"logits/chosen": -37273823.41818182,
"logits/rejected": -37989006.03870968,
"logps/chosen": -509.3034564393939,
"logps/rejected": -372.19339717741934,
"loss": 0.5934,
"loss/base_kto": 3.7677838802337646,
"metrics/advantage_var": 236.2348175048828,
"regularization/lipschitz_norm": 1011.4757690429688,
"regularization/w1": 0.979108452796936,
"rewards/chosen": 0.08697488958185369,
"rewards/margins": 0.22105295846888745,
"rewards/rejected": -0.13407806888703377,
"step": 440
},
{
"epoch": 0.5958549222797928,
"grad_norm": 22.417484283447266,
"kl": 10.195749282836914,
"learning_rate": 9.366284643057313e-07,
"logits/chosen": -37403931.01507538,
"logits/rejected": -38144776.62079063,
"logps/chosen": -471.87646566164153,
"logps/rejected": -401.33437042459735,
"loss": 0.5911,
"loss/base_kto": 3.7370898723602295,
"metrics/advantage_var": 287.5673828125,
"regularization/lipschitz_norm": 1024.3519287109375,
"regularization/w1": 0.9915726780891418,
"rewards/chosen": 0.08149675148815366,
"rewards/margins": 0.22253619628449106,
"rewards/rejected": -0.1410394447963374,
"step": 460
},
{
"epoch": 0.6217616580310881,
"grad_norm": 20.285343170166016,
"kl": 8.333754539489746,
"learning_rate": 9.295460731570917e-07,
"logits/chosen": -36534663.29738059,
"logits/rejected": -37380453.02060222,
"logps/chosen": -496.8182781201849,
"logps/rejected": -372.7764461172742,
"loss": 0.5937,
"loss/base_kto": 3.729773759841919,
"metrics/advantage_var": 263.1363220214844,
"regularization/lipschitz_norm": 1053.1697998046875,
"regularization/w1": 1.0194681882858276,
"rewards/chosen": 0.08392554989948478,
"rewards/margins": 0.25394270164894,
"rewards/rejected": -0.17001715174945523,
"step": 480
},
{
"epoch": 0.6476683937823834,
"grad_norm": 22.549976348876953,
"kl": 7.499153137207031,
"learning_rate": 9.221183785865056e-07,
"logits/chosen": -34990649.642384104,
"logits/rejected": -36608830.10650887,
"logps/chosen": -490.3294701986755,
"logps/rejected": -375.35470599112426,
"loss": 0.5903,
"loss/base_kto": 3.681213855743408,
"metrics/advantage_var": 266.59619140625,
"regularization/lipschitz_norm": 1075.8951416015625,
"regularization/w1": 1.0414663553237915,
"rewards/chosen": 0.022774854243196398,
"rewards/margins": 0.27699002700519254,
"rewards/rejected": -0.2542151727619961,
"step": 500
},
{
"epoch": 0.6735751295336787,
"grad_norm": 16.535247802734375,
"kl": 14.017804145812988,
"learning_rate": 9.143513515677817e-07,
"logits/chosen": -36697649.34939759,
"logits/rejected": -36691559.064935066,
"logps/chosen": -508.0226374246988,
"logps/rejected": -376.5061891233766,
"loss": 0.5973,
"loss/base_kto": 3.684291124343872,
"metrics/advantage_var": 312.0481872558594,
"regularization/lipschitz_norm": 1130.4091796875,
"regularization/w1": 1.0942360162734985,
"rewards/chosen": 0.28289523756647683,
"rewards/margins": 0.29742380625540205,
"rewards/rejected": -0.01452856868892521,
"step": 520
},
{
"epoch": 0.6994818652849741,
"grad_norm": 18.890146255493164,
"kl": 14.805468559265137,
"learning_rate": 9.062512358572373e-07,
"logits/chosen": -37082898.314785376,
"logits/rejected": -37032077.56682028,
"logps/chosen": -495.70160969793324,
"logps/rejected": -368.2362471198157,
"loss": 0.5962,
"loss/base_kto": 3.6946403980255127,
"metrics/advantage_var": 306.1405334472656,
"regularization/lipschitz_norm": 1110.30419921875,
"regularization/w1": 1.0747743844985962,
"rewards/chosen": 0.2752458241861462,
"rewards/margins": 0.26083179426635633,
"rewards/rejected": 0.014414029919789866,
"step": 540
},
{
"epoch": 0.7253886010362695,
"grad_norm": 20.330968856811523,
"kl": 5.8462653160095215,
"learning_rate": 8.978245429744691e-07,
"logits/chosen": -35395339.02392344,
"logits/rejected": -36207197.30474732,
"logps/chosen": -481.1236044657097,
"logps/rejected": -363.46815179938744,
"loss": 0.5917,
"loss/base_kto": 3.6927356719970703,
"metrics/advantage_var": 263.9264831542969,
"regularization/lipschitz_norm": 1075.0716552734375,
"regularization/w1": 1.040669322013855,
"rewards/chosen": -0.015467316720284154,
"rewards/margins": 0.2952021894052901,
"rewards/rejected": -0.31066950612557426,
"step": 560
},
{
"epoch": 0.7512953367875648,
"grad_norm": 24.9837589263916,
"kl": 11.190443992614746,
"learning_rate": 8.890780469678738e-07,
"logits/chosen": -34349700.20657277,
"logits/rejected": -36814432.64898596,
"logps/chosen": -472.0523767605634,
"logps/rejected": -392.29621684867396,
"loss": 0.5954,
"loss/base_kto": 3.7195801734924316,
"metrics/advantage_var": 276.13665771484375,
"regularization/lipschitz_norm": 1077.98046875,
"regularization/w1": 1.0434850454330444,
"rewards/chosen": 0.1479542333755135,
"rewards/margins": 0.2727873864916772,
"rewards/rejected": -0.1248331531161637,
"step": 580
},
{
"epoch": 0.7772020725388601,
"grad_norm": 21.31780242919922,
"kl": 8.398650169372559,
"learning_rate": 8.800187789691269e-07,
"logits/chosen": -37238059.8272,
"logits/rejected": -37278921.673282444,
"logps/chosen": -469.3322,
"logps/rejected": -398.4593034351145,
"loss": 0.5922,
"loss/base_kto": 3.74658203125,
"metrics/advantage_var": 238.9662628173828,
"regularization/lipschitz_norm": 1023.7175903320312,
"regularization/w1": 0.9909586310386658,
"rewards/chosen": 0.008236831665039062,
"rewards/margins": 0.21772090288700946,
"rewards/rejected": -0.2094840712219704,
"step": 600
},
{
"epoch": 0.8031088082901554,
"grad_norm": 15.567916870117188,
"kl": 7.363170146942139,
"learning_rate": 8.706540215409981e-07,
"logits/chosen": -35003254.249594815,
"logits/rejected": -36386337.2066365,
"logps/chosen": -494.2009724473258,
"logps/rejected": -365.56570512820514,
"loss": 0.5885,
"loss/base_kto": 3.7361361980438232,
"metrics/advantage_var": 224.89883422851562,
"regularization/lipschitz_norm": 1004.3369140625,
"regularization/w1": 0.9721981287002563,
"rewards/chosen": 0.06719711649939539,
"rewards/margins": 0.237335077126104,
"rewards/rejected": -0.1701379606267086,
"step": 620
},
{
"epoch": 0.8290155440414507,
"grad_norm": 24.032546997070312,
"kl": 9.157782554626465,
"learning_rate": 8.609913028230462e-07,
"logits/chosen": -34908598.409785934,
"logits/rejected": -36706009.55910543,
"logps/chosen": -486.85865825688074,
"logps/rejected": -368.68033646166134,
"loss": 0.592,
"loss/base_kto": 3.7558517456054688,
"metrics/advantage_var": 231.52017211914062,
"regularization/lipschitz_norm": 1012.8148803710938,
"regularization/w1": 0.9804048538208008,
"rewards/chosen": 0.08251190185546875,
"rewards/margins": 0.23528511607989716,
"rewards/rejected": -0.1527732142244284,
"step": 640
},
{
"epoch": 0.8549222797927462,
"grad_norm": 22.605880737304688,
"kl": 7.248265266418457,
"learning_rate": 8.510383904798994e-07,
"logits/chosen": -36638179.018867925,
"logits/rejected": -35327058.68322981,
"logps/chosen": -476.2138364779874,
"logps/rejected": -384.40333850931677,
"loss": 0.5959,
"loss/base_kto": 3.7408242225646973,
"metrics/advantage_var": 263.2743835449219,
"regularization/lipschitz_norm": 1060.4591064453125,
"regularization/w1": 1.0265244245529175,
"rewards/chosen": 0.10654787747365124,
"rewards/margins": 0.25763921023504854,
"rewards/rejected": -0.15109133276139727,
"step": 660
},
{
"epoch": 0.8808290155440415,
"grad_norm": 27.252864837646484,
"kl": 11.121315002441406,
"learning_rate": 8.408032854569865e-07,
"logits/chosen": -35950467.97515528,
"logits/rejected": -36643794.91823899,
"logps/chosen": -488.9490489130435,
"logps/rejected": -365.5615664308176,
"loss": 0.5998,
"loss/base_kto": 3.7466704845428467,
"metrics/advantage_var": 265.4429626464844,
"regularization/lipschitz_norm": 1086.5301513671875,
"regularization/w1": 1.0517610311508179,
"rewards/chosen": 0.152827979615016,
"rewards/margins": 0.2504669795059972,
"rewards/rejected": -0.09763899989098122,
"step": 680
},
{
"epoch": 0.9067357512953368,
"grad_norm": 24.75717544555664,
"kl": 8.752140998840332,
"learning_rate": 8.302942155487377e-07,
"logits/chosen": -36627251.2,
"logits/rejected": -36925485.15275591,
"logps/chosen": -490.5701550387597,
"logps/rejected": -367.12942913385825,
"loss": 0.596,
"loss/base_kto": 3.7421226501464844,
"metrics/advantage_var": 273.6818542480469,
"regularization/lipschitz_norm": 1060.021240234375,
"regularization/w1": 1.026100516319275,
"rewards/chosen": 0.15237606551296026,
"rewards/margins": 0.27113368289269696,
"rewards/rejected": -0.11875761737973671,
"step": 700
},
{
"epoch": 0.9326424870466321,
"grad_norm": 20.251605987548828,
"kl": 10.91238784790039,
"learning_rate": 8.195196287844278e-07,
"logits/chosen": -36909988.71961102,
"logits/rejected": -37753480.68778281,
"logps/chosen": -480.24483387358185,
"logps/rejected": -384.8237415158371,
"loss": 0.5909,
"loss/base_kto": 3.7201783657073975,
"metrics/advantage_var": 244.40771484375,
"regularization/lipschitz_norm": 1040.3936767578125,
"regularization/w1": 1.007101058959961,
"rewards/chosen": 0.1605994473400147,
"rewards/margins": 0.25788314583481226,
"rewards/rejected": -0.09728369849479755,
"step": 720
},
{
"epoch": 0.9585492227979274,
"grad_norm": 19.03770637512207,
"kl": 5.372455596923828,
"learning_rate": 8.08488186636975e-07,
"logits/chosen": -36305011.9245283,
"logits/rejected": -36325131.13043478,
"logps/chosen": -472.3481230345912,
"logps/rejected": -367.3989955357143,
"loss": 0.5912,
"loss/base_kto": 3.7491490840911865,
"metrics/advantage_var": 242.1458282470703,
"regularization/lipschitz_norm": 1012.4777221679688,
"regularization/w1": 0.9800785183906555,
"rewards/chosen": -0.09079524705994804,
"rewards/margins": 0.2295552577500772,
"rewards/rejected": -0.32035050481002525,
"step": 740
},
{
"epoch": 0.9844559585492227,
"grad_norm": 18.146291732788086,
"kl": 6.706477642059326,
"learning_rate": 7.972087570601576e-07,
"logits/chosen": -35684746.20150376,
"logits/rejected": -37200791.10243902,
"logps/chosen": -505.90216165413534,
"logps/rejected": -362.4806910569106,
"loss": 0.5916,
"loss/base_kto": 3.750601291656494,
"metrics/advantage_var": 253.0991973876953,
"regularization/lipschitz_norm": 1014.5658569335938,
"regularization/w1": 0.9820996522903442,
"rewards/chosen": 0.04141369583015155,
"rewards/margins": 0.26068507500634563,
"rewards/rejected": -0.2192713791761941,
"step": 760
},
{
"epoch": 1.0103626943005182,
"grad_norm": 23.190210342407227,
"kl": 12.415057182312012,
"learning_rate": 7.856904073598458e-07,
"logits/chosen": -36821188.55727554,
"logits/rejected": -37918976.0,
"logps/chosen": -470.85255417956654,
"logps/rejected": -362.6338261471519,
"loss": 0.599,
"loss/base_kto": 3.511014938354492,
"metrics/advantage_var": 425.7567443847656,
"regularization/lipschitz_norm": 1323.0213623046875,
"regularization/w1": 1.2806845903396606,
"rewards/chosen": 0.3479822353681913,
"rewards/margins": 0.5165544801330746,
"rewards/rejected": -0.1685722447648833,
"step": 780
},
{
"epoch": 1.0362694300518134,
"grad_norm": 15.094964027404785,
"kl": 9.411001205444336,
"learning_rate": 7.739423969049761e-07,
"logits/chosen": -35588362.98349835,
"logits/rejected": -37161579.869436204,
"logps/chosen": -472.8260107260726,
"logps/rejected": -365.7991237017804,
"loss": 0.6122,
"loss/base_kto": 3.365062713623047,
"metrics/advantage_var": 596.436279296875,
"regularization/lipschitz_norm": 1583.323486328125,
"regularization/w1": 1.5326570272445679,
"rewards/chosen": 0.22851139484065594,
"rewards/margins": 0.6968778875903314,
"rewards/rejected": -0.46836649274967546,
"step": 800
},
{
"epoch": 1.0621761658031088,
"grad_norm": 23.973220825195312,
"kl": 10.743574142456055,
"learning_rate": 7.619741696841322e-07,
"logits/chosen": -33417089.819905214,
"logits/rejected": -35526944.04945904,
"logps/chosen": -465.03297788309635,
"logps/rejected": -381.89637268160743,
"loss": 0.6033,
"loss/base_kto": 3.2513177394866943,
"metrics/advantage_var": 620.6433715820312,
"regularization/lipschitz_norm": 1627.0052490234375,
"regularization/w1": 1.5749410390853882,
"rewards/chosen": 0.3973120618582148,
"rewards/margins": 0.856496381237924,
"rewards/rejected": -0.4591843193797092,
"step": 820
},
{
"epoch": 1.0880829015544042,
"grad_norm": 21.905805587768555,
"kl": 9.628497123718262,
"learning_rate": 7.497953467137135e-07,
"logits/chosen": -35349444.92307692,
"logits/rejected": -37393514.146341465,
"logps/chosen": -487.56049679487177,
"logps/rejected": -378.9127286585366,
"loss": 0.5981,
"loss/base_kto": 3.323640823364258,
"metrics/advantage_var": 539.4470825195312,
"regularization/lipschitz_norm": 1509.3988037109375,
"regularization/w1": 1.461098074913025,
"rewards/chosen": 0.36176212017352766,
"rewards/margins": 0.7473041756291774,
"rewards/rejected": -0.3855420554556498,
"step": 840
},
{
"epoch": 1.1139896373056994,
"grad_norm": 20.7901668548584,
"kl": 13.369658470153809,
"learning_rate": 7.37415718303793e-07,
"logits/chosen": -35224843.76545166,
"logits/rejected": -36602054.80431433,
"logps/chosen": -473.06418383518223,
"logps/rejected": -375.352031972265,
"loss": 0.6177,
"loss/base_kto": 3.2955589294433594,
"metrics/advantage_var": 680.991455078125,
"regularization/lipschitz_norm": 1700.3582763671875,
"regularization/w1": 1.6459465026855469,
"rewards/chosen": 0.3789882266955973,
"rewards/margins": 0.7962333009986116,
"rewards/rejected": -0.4172450743030143,
"step": 860
},
{
"epoch": 1.1398963730569949,
"grad_norm": 20.343870162963867,
"kl": 12.414015769958496,
"learning_rate": 7.248452361878855e-07,
"logits/chosen": -34090330.73417722,
"logits/rejected": -35467203.95061728,
"logps/chosen": -458.1440862341772,
"logps/rejected": -369.397159529321,
"loss": 0.6119,
"loss/base_kto": 3.319322347640991,
"metrics/advantage_var": 599.7037963867188,
"regularization/lipschitz_norm": 1628.3851318359375,
"regularization/w1": 1.5762766599655151,
"rewards/chosen": 0.3447738840610166,
"rewards/margins": 0.746129203613968,
"rewards/rejected": -0.4013553195529514,
"step": 880
},
{
"epoch": 1.16580310880829,
"grad_norm": 17.768192291259766,
"kl": 17.229093551635742,
"learning_rate": 7.120940055229497e-07,
"logits/chosen": -34604595.34670487,
"logits/rejected": -34350199.64261168,
"logps/chosen": -463.49086676217763,
"logps/rejected": -373.56588273195877,
"loss": 0.5964,
"loss/base_kto": 3.3150627613067627,
"metrics/advantage_var": 555.2005004882812,
"regularization/lipschitz_norm": 1504.4609375,
"regularization/w1": 1.4563181400299072,
"rewards/chosen": 0.5407342774137043,
"rewards/margins": 0.7110109061504821,
"rewards/rejected": -0.17027662873677782,
"step": 900
},
{
"epoch": 1.1917098445595855,
"grad_norm": 18.17601203918457,
"kl": 29.794462203979492,
"learning_rate": 6.991722767660556e-07,
"logits/chosen": -34898743.119617224,
"logits/rejected": -36604440.30627871,
"logps/chosen": -466.8919457735247,
"logps/rejected": -349.51746745788665,
"loss": 0.5957,
"loss/base_kto": 3.277207136154175,
"metrics/advantage_var": 542.3825073242188,
"regularization/lipschitz_norm": 1537.3563232421875,
"regularization/w1": 1.4881608486175537,
"rewards/chosen": 0.7279997951866527,
"rewards/margins": 0.7635038544451531,
"rewards/rejected": -0.035504059258500434,
"step": 920
},
{
"epoch": 1.2176165803108807,
"grad_norm": 25.832965850830078,
"kl": 25.964340209960938,
"learning_rate": 6.860904374342499e-07,
"logits/chosen": -35796727.94968554,
"logits/rejected": -37028294.757763974,
"logps/chosen": -472.3318592767296,
"logps/rejected": -367.61379076086956,
"loss": 0.5976,
"loss/base_kto": 3.2431321144104004,
"metrics/advantage_var": 626.7291259765625,
"regularization/lipschitz_norm": 1588.559814453125,
"regularization/w1": 1.537725806236267,
"rewards/chosen": 0.6725802151661999,
"rewards/margins": 0.8015443727445676,
"rewards/rejected": -0.12896415757836763,
"step": 940
},
{
"epoch": 1.2435233160621761,
"grad_norm": 17.008806228637695,
"kl": 18.336414337158203,
"learning_rate": 6.7285900375424e-07,
"logits/chosen": -35578185.19938176,
"logits/rejected": -36221461.83886256,
"logps/chosen": -487.70580564142193,
"logps/rejected": -349.38008491311217,
"loss": 0.6093,
"loss/base_kto": 3.2575058937072754,
"metrics/advantage_var": 690.2684936523438,
"regularization/lipschitz_norm": 1670.5321044921875,
"regularization/w1": 1.617074966430664,
"rewards/chosen": 0.562875550165427,
"rewards/margins": 0.8442507059834563,
"rewards/rejected": -0.28137515581802924,
"step": 960
},
{
"epoch": 1.2694300518134716,
"grad_norm": 21.019044876098633,
"kl": 18.322830200195312,
"learning_rate": 6.594886122086123e-07,
"logits/chosen": -35494652.545727134,
"logits/rejected": -35744509.07667211,
"logps/chosen": -497.87378185907045,
"logps/rejected": -372.2220126427406,
"loss": 0.6037,
"loss/base_kto": 3.2976510524749756,
"metrics/advantage_var": 664.135498046875,
"regularization/lipschitz_norm": 1582.7314453125,
"regularization/w1": 1.5320841073989868,
"rewards/chosen": 0.602982551082857,
"rewards/margins": 0.7670870563137591,
"rewards/rejected": -0.16410450523090206,
"step": 980
},
{
"epoch": 1.2953367875647668,
"grad_norm": 21.914852142333984,
"kl": 18.818378448486328,
"learning_rate": 6.459900109853766e-07,
"logits/chosen": -35118670.23298033,
"logits/rejected": -37378600.52988692,
"logps/chosen": -499.37414901664147,
"logps/rejected": -374.53675282714056,
"loss": 0.6026,
"loss/base_kto": 3.281919240951538,
"metrics/advantage_var": 598.3539428710938,
"regularization/lipschitz_norm": 1589.9345703125,
"regularization/w1": 1.539056658744812,
"rewards/chosen": 0.6129649013686649,
"rewards/margins": 0.7700925528975611,
"rewards/rejected": -0.15712765152889616,
"step": 1000
},
{
"epoch": 1.3212435233160622,
"grad_norm": 19.1385498046875,
"kl": 18.0656681060791,
"learning_rate": 6.323740513377171e-07,
"logits/chosen": -34849660.29581994,
"logits/rejected": -36409113.67781155,
"logps/chosen": -456.8292805466238,
"logps/rejected": -376.95618825987845,
"loss": 0.6008,
"loss/base_kto": 3.266716480255127,
"metrics/advantage_var": 567.34765625,
"regularization/lipschitz_norm": 1590.2733154296875,
"regularization/w1": 1.5393844842910767,
"rewards/chosen": 0.5471190424977391,
"rewards/margins": 0.810753674921395,
"rewards/rejected": -0.263634632423656,
"step": 1020
},
{
"epoch": 1.3471502590673574,
"grad_norm": 20.76739501953125,
"kl": 12.531976699829102,
"learning_rate": 6.186516788608865e-07,
"logits/chosen": -35243240.80127186,
"logits/rejected": -36533523.2688172,
"logps/chosen": -490.87112480127183,
"logps/rejected": -383.5096966205837,
"loss": 0.6112,
"loss/base_kto": 3.3029744625091553,
"metrics/advantage_var": 716.6351928710938,
"regularization/lipschitz_norm": 1639.134033203125,
"regularization/w1": 1.5866817235946655,
"rewards/chosen": 0.4233794341216216,
"rewards/margins": 0.7739105946783973,
"rewards/rejected": -0.35053116055677563,
"step": 1040
},
{
"epoch": 1.3730569948186528,
"grad_norm": 18.617046356201172,
"kl": 8.331124305725098,
"learning_rate": 6.048339246932652e-07,
"logits/chosen": -33056453.670886077,
"logits/rejected": -35443857.38271605,
"logps/chosen": -478.7087618670886,
"logps/rejected": -396.5805362654321,
"loss": 0.6065,
"loss/base_kto": 3.3282151222229004,
"metrics/advantage_var": 571.9895629882812,
"regularization/lipschitz_norm": 1573.963134765625,
"regularization/w1": 1.5235962867736816,
"rewards/chosen": 0.3222663493096074,
"rewards/margins": 0.7304141847467698,
"rewards/rejected": -0.40814783543716243,
"step": 1060
},
{
"epoch": 1.3989637305699483,
"grad_norm": 15.352473258972168,
"kl": 11.78324031829834,
"learning_rate": 5.909318966486494e-07,
"logits/chosen": -35287961.139430285,
"logits/rejected": -35840016.70473083,
"logps/chosen": -483.6323088455772,
"logps/rejected": -375.938927406199,
"loss": 0.6006,
"loss/base_kto": 3.31672739982605,
"metrics/advantage_var": 587.284423828125,
"regularization/lipschitz_norm": 1537.381103515625,
"regularization/w1": 1.4881848096847534,
"rewards/chosen": 0.42149972987139245,
"rewards/margins": 0.7596054714375884,
"rewards/rejected": -0.33810574156619594,
"step": 1080
},
{
"epoch": 1.4248704663212435,
"grad_norm": 15.512990951538086,
"kl": 24.919565200805664,
"learning_rate": 5.769567702869052e-07,
"logits/chosen": -36600577.15837104,
"logits/rejected": -36697033.23176661,
"logps/chosen": -462.94994343891403,
"logps/rejected": -381.0310727309562,
"loss": 0.6,
"loss/base_kto": 3.2668755054473877,
"metrics/advantage_var": 563.43408203125,
"regularization/lipschitz_norm": 1583.4862060546875,
"regularization/w1": 1.5328145027160645,
"rewards/chosen": 0.6703406056307739,
"rewards/margins": 0.7802145086796431,
"rewards/rejected": -0.10987390304886928,
"step": 1100
},
{
"epoch": 1.450777202072539,
"grad_norm": 21.205745697021484,
"kl": 10.23928165435791,
"learning_rate": 5.629197799301614e-07,
"logits/chosen": -34873062.839313574,
"logits/rejected": -35856525.02034429,
"logps/chosen": -506.283736349454,
"logps/rejected": -391.4015062597809,
"loss": 0.6237,
"loss/base_kto": 3.296105146408081,
"metrics/advantage_var": 908.1524658203125,
"regularization/lipschitz_norm": 1749.1607666015625,
"regularization/w1": 1.6931877136230469,
"rewards/chosen": 0.37295617923349744,
"rewards/margins": 0.7983148634568934,
"rewards/rejected": -0.42535868422339596,
"step": 1120
},
{
"epoch": 1.4766839378238341,
"grad_norm": 17.41119956970215,
"kl": 13.737591743469238,
"learning_rate": 5.488322096317633e-07,
"logits/chosen": -33868203.05631659,
"logits/rejected": -35198427.0176565,
"logps/chosen": -511.1039764079148,
"logps/rejected": -366.57907804975923,
"loss": 0.6094,
"loss/base_kto": 3.268270254135132,
"metrics/advantage_var": 602.8837280273438,
"regularization/lipschitz_norm": 1659.706298828125,
"regularization/w1": 1.6065956354141235,
"rewards/chosen": 0.5461068581591276,
"rewards/margins": 0.804103467817848,
"rewards/rejected": -0.2579966096587204,
"step": 1140
},
{
"epoch": 1.5025906735751295,
"grad_norm": 19.09857749938965,
"kl": 13.377432823181152,
"learning_rate": 5.347053841052518e-07,
"logits/chosen": -33628585.23358779,
"logits/rejected": -36098510.0288,
"logps/chosen": -457.9335400763359,
"logps/rejected": -372.3904,
"loss": 0.6032,
"loss/base_kto": 3.329882860183716,
"metrics/advantage_var": 557.4445190429688,
"regularization/lipschitz_norm": 1544.8406982421875,
"regularization/w1": 1.4954057931900024,
"rewards/chosen": 0.47822475287750477,
"rewards/margins": 0.7075744354946922,
"rewards/rejected": -0.2293496826171875,
"step": 1160
},
{
"epoch": 1.528497409326425,
"grad_norm": 24.2120361328125,
"kl": 17.392555236816406,
"learning_rate": 5.205506596206531e-07,
"logits/chosen": -34461819.74622356,
"logits/rejected": -35917532.37540453,
"logps/chosen": -482.06353851963746,
"logps/rejected": -389.41254550970876,
"loss": 0.5985,
"loss/base_kto": 3.3604018688201904,
"metrics/advantage_var": 578.8988037109375,
"regularization/lipschitz_norm": 1474.77392578125,
"regularization/w1": 1.4275811910629272,
"rewards/chosen": 0.48124007948215636,
"rewards/margins": 0.6917910728737674,
"rewards/rejected": -0.21055099339161104,
"step": 1180
},
{
"epoch": 1.5544041450777202,
"grad_norm": 20.3862247467041,
"kl": 22.15376091003418,
"learning_rate": 5.063794148754032e-07,
"logits/chosen": -35213855.9488,
"logits/rejected": -35874200.03664122,
"logps/chosen": -465.654,
"logps/rejected": -385.3359971374046,
"loss": 0.617,
"loss/base_kto": 3.281867742538452,
"metrics/advantage_var": 818.151123046875,
"regularization/lipschitz_norm": 1709.1787109375,
"regularization/w1": 1.6544849872589111,
"rewards/chosen": 0.568648828125,
"rewards/margins": 0.7257217777164837,
"rewards/rejected": -0.15707294959148377,
"step": 1200
},
{
"epoch": 1.5803108808290154,
"grad_norm": 15.866477012634277,
"kl": 16.126449584960938,
"learning_rate": 4.922030418472422e-07,
"logits/chosen": -33328958.855284553,
"logits/rejected": -36385211.47669173,
"logps/chosen": -500.58958333333334,
"logps/rejected": -400.2533364661654,
"loss": 0.5986,
"loss/base_kto": 3.2381935119628906,
"metrics/advantage_var": 614.0758666992188,
"regularization/lipschitz_norm": 1601.5994873046875,
"regularization/w1": 1.550348162651062,
"rewards/chosen": 0.5206572741996951,
"rewards/margins": 0.8061251017886871,
"rewards/rejected": -0.28546782758899203,
"step": 1220
},
{
"epoch": 1.6062176165803108,
"grad_norm": 21.90863037109375,
"kl": 11.127936363220215,
"learning_rate": 4.780329366364336e-07,
"logits/chosen": -34104755.77744361,
"logits/rejected": -34606497.92520325,
"logps/chosen": -492.30249060150373,
"logps/rejected": -373.6853150406504,
"loss": 0.616,
"loss/base_kto": 3.3320329189300537,
"metrics/advantage_var": 577.935302734375,
"regularization/lipschitz_norm": 1649.1051025390625,
"regularization/w1": 1.5963337421417236,
"rewards/chosen": 0.4293969175869361,
"rewards/margins": 0.742410183553336,
"rewards/rejected": -0.3130132659663999,
"step": 1240
},
{
"epoch": 1.6321243523316062,
"grad_norm": 18.541954040527344,
"kl": 27.366214752197266,
"learning_rate": 4.638804903046684e-07,
"logits/chosen": -35602554.55748031,
"logits/rejected": -37120523.906976745,
"logps/chosen": -492.4576771653543,
"logps/rejected": -383.4197189922481,
"loss": 0.6149,
"loss/base_kto": 3.2778451442718506,
"metrics/advantage_var": 654.3119506835938,
"regularization/lipschitz_norm": 1695.574462890625,
"regularization/w1": 1.6413160562515259,
"rewards/chosen": 0.6180968277097687,
"rewards/margins": 0.7462049602421694,
"rewards/rejected": -0.12810813253240066,
"step": 1260
},
{
"epoch": 1.6580310880829017,
"grad_norm": 21.975324630737305,
"kl": 14.015891075134277,
"learning_rate": 4.497570797180217e-07,
"logits/chosen": -35352369.00459418,
"logits/rejected": -37997004.55502392,
"logps/chosen": -517.374569295559,
"logps/rejected": -353.6818181818182,
"loss": 0.6062,
"loss/base_kto": 3.2623748779296875,
"metrics/advantage_var": 588.2733764648438,
"regularization/lipschitz_norm": 1639.5390625,
"regularization/w1": 1.5870739221572876,
"rewards/chosen": 0.5089719342966357,
"rewards/margins": 0.7935869961767443,
"rewards/rejected": -0.28461506188010866,
"step": 1280
},
{
"epoch": 1.6839378238341969,
"grad_norm": 23.730363845825195,
"kl": 16.976552963256836,
"learning_rate": 4.3567405840131853e-07,
"logits/chosen": -35217262.8921095,
"logits/rejected": -37190623.368740514,
"logps/chosen": -473.2291666666667,
"logps/rejected": -365.88569328528075,
"loss": 0.6008,
"loss/base_kto": 3.291616201400757,
"metrics/advantage_var": 571.4057006835938,
"regularization/lipschitz_norm": 1564.6864013671875,
"regularization/w1": 1.5146163702011108,
"rewards/chosen": 0.515448135646261,
"rewards/margins": 0.7447856050453269,
"rewards/rejected": -0.22933746939906582,
"step": 1300
},
{
"epoch": 1.709844559585492,
"grad_norm": 16.515743255615234,
"kl": 15.26294994354248,
"learning_rate": 4.2164274741126506e-07,
"logits/chosen": -34693212.510903426,
"logits/rejected": -35159454.09404389,
"logps/chosen": -482.8357671339564,
"logps/rejected": -382.845954153605,
"loss": 0.597,
"loss/base_kto": 3.288755178451538,
"metrics/advantage_var": 622.9114379882812,
"regularization/lipschitz_norm": 1536.192626953125,
"regularization/w1": 1.4870343208312988,
"rewards/chosen": 0.5087190431969189,
"rewards/margins": 0.7804539206367944,
"rewards/rejected": -0.27173487743987557,
"step": 1320
},
{
"epoch": 1.7357512953367875,
"grad_norm": 14.575602531433105,
"kl": 15.25003719329834,
"learning_rate": 4.0767442623567856e-07,
"logits/chosen": -34340322.76672105,
"logits/rejected": -36499314.75862069,
"logps/chosen": -470.53125,
"logps/rejected": -367.58302098950526,
"loss": 0.6105,
"loss/base_kto": 3.238189458847046,
"metrics/advantage_var": 650.7476196289062,
"regularization/lipschitz_norm": 1700.1590576171875,
"regularization/w1": 1.6457538604736328,
"rewards/chosen": 0.508925022542185,
"rewards/margins": 0.8279714777081566,
"rewards/rejected": -0.3190464551659717,
"step": 1340
},
{
"epoch": 1.761658031088083,
"grad_norm": 18.860393524169922,
"kl": 8.02838134765625,
"learning_rate": 3.937803237261357e-07,
"logits/chosen": -33357676.819571864,
"logits/rejected": -35763837.955271564,
"logps/chosen": -473.2672974006116,
"logps/rejected": -363.9890425319489,
"loss": 0.6002,
"loss/base_kto": 3.262939453125,
"metrics/advantage_var": 584.277099609375,
"regularization/lipschitz_norm": 1589.353271484375,
"regularization/w1": 1.5384939908981323,
"rewards/chosen": 0.45235655431718275,
"rewards/margins": 0.8391085519022965,
"rewards/rejected": -0.3867519975851138,
"step": 1360
},
{
"epoch": 1.7875647668393784,
"grad_norm": 22.32830047607422,
"kl": 14.150607109069824,
"learning_rate": 3.7997160907132456e-07,
"logits/chosen": -35828974.33065811,
"logits/rejected": -35446322.654490106,
"logps/chosen": -500.97602327447834,
"logps/rejected": -395.9500095129376,
"loss": 0.6073,
"loss/base_kto": 3.2730233669281006,
"metrics/advantage_var": 650.7073364257812,
"regularization/lipschitz_norm": 1637.4290771484375,
"regularization/w1": 1.5850313901901245,
"rewards/chosen": 0.4652767273243128,
"rewards/margins": 0.8003541147000501,
"rewards/rejected": -0.3350773873757373,
"step": 1380
},
{
"epoch": 1.8134715025906736,
"grad_norm": 16.482961654663086,
"kl": 9.742484092712402,
"learning_rate": 3.662593828183601e-07,
"logits/chosen": -34040332.8,
"logits/rejected": -36287939.2,
"logps/chosen": -471.75498046875,
"logps/rejected": -378.1865234375,
"loss": 0.5993,
"loss/base_kto": 3.34765887260437,
"metrics/advantage_var": 576.4119262695312,
"regularization/lipschitz_norm": 1494.62353515625,
"regularization/w1": 1.4467957019805908,
"rewards/chosen": 0.39304141998291015,
"rewards/margins": 0.7137337684631347,
"rewards/rejected": -0.3206923484802246,
"step": 1400
},
{
"epoch": 1.8393782383419688,
"grad_norm": 28.27539825439453,
"kl": 13.098017692565918,
"learning_rate": 3.5265466794927725e-07,
"logits/chosen": -35510078.56071964,
"logits/rejected": -35925708.63295269,
"logps/chosen": -470.10625937031483,
"logps/rejected": -359.27008564437193,
"loss": 0.6102,
"loss/base_kto": 3.3460328578948975,
"metrics/advantage_var": 1050.8026123046875,
"regularization/lipschitz_norm": 1585.9912109375,
"regularization/w1": 1.5352394580841064,
"rewards/chosen": 0.5042811541006841,
"rewards/margins": 0.7036321303445666,
"rewards/rejected": -0.19935097624388254,
"step": 1420
},
{
"epoch": 1.8652849740932642,
"grad_norm": 20.633995056152344,
"kl": 14.561180114746094,
"learning_rate": 3.3916840101987887e-07,
"logits/chosen": -34451084.82034976,
"logits/rejected": -35866457.26574501,
"logps/chosen": -497.5389507154213,
"logps/rejected": -386.1611703149002,
"loss": 0.5935,
"loss/base_kto": 3.2682251930236816,
"metrics/advantage_var": 545.0556640625,
"regularization/lipschitz_norm": 1528.5404052734375,
"regularization/w1": 1.479627251625061,
"rewards/chosen": 0.4862970737281399,
"rewards/margins": 0.7785655601612717,
"rewards/rejected": -0.29226848643313175,
"step": 1440
},
{
"epoch": 1.8911917098445596,
"grad_norm": 18.701581954956055,
"kl": 11.452432632446289,
"learning_rate": 3.258114233680583e-07,
"logits/chosen": -35697291.78159127,
"logits/rejected": -36275829.78403756,
"logps/chosen": -480.68125975039004,
"logps/rejected": -363.0715473395931,
"loss": 0.6179,
"loss/base_kto": 3.37455677986145,
"metrics/advantage_var": 622.552001953125,
"regularization/lipschitz_norm": 1620.2760009765625,
"regularization/w1": 1.568427324295044,
"rewards/chosen": 0.3718554992199688,
"rewards/margins": 0.6929975137965778,
"rewards/rejected": -0.32114201457660896,
"step": 1460
},
{
"epoch": 1.917098445595855,
"grad_norm": 14.728906631469727,
"kl": 16.546998977661133,
"learning_rate": 3.1259447239866796e-07,
"logits/chosen": -34478846.36942675,
"logits/rejected": -36221625.32515337,
"logps/chosen": -465.9889032643312,
"logps/rejected": -390.706384202454,
"loss": 0.5952,
"loss/base_kto": 3.328676700592041,
"metrics/advantage_var": 550.82666015625,
"regularization/lipschitz_norm": 1480.2578125,
"regularization/w1": 1.4328895807266235,
"rewards/chosen": 0.3935989817236639,
"rewards/margins": 0.689255525291532,
"rewards/rejected": -0.2956565435678681,
"step": 1480
},
{
"epoch": 1.9430051813471503,
"grad_norm": 19.20351219177246,
"kl": 14.74124813079834,
"learning_rate": 2.9952817295193435e-07,
"logits/chosen": -34962900.06864274,
"logits/rejected": -37755264.60093897,
"logps/chosen": -488.10871684867396,
"logps/rejected": -390.09467918622846,
"loss": 0.6004,
"loss/base_kto": 3.341092348098755,
"metrics/advantage_var": 549.0675659179688,
"regularization/lipschitz_norm": 1510.6282958984375,
"regularization/w1": 1.4622882604599,
"rewards/chosen": 0.4436404604621685,
"rewards/margins": 0.684837834594113,
"rewards/rejected": -0.24119737413194445,
"step": 1500
},
{
"epoch": 1.9689119170984455,
"grad_norm": 18.116750717163086,
"kl": 12.19059944152832,
"learning_rate": 2.866230287623651e-07,
"logits/chosen": -33270414.08992248,
"logits/rejected": -35000416.75590551,
"logps/chosen": -506.17713178294576,
"logps/rejected": -365.162155511811,
"loss": 0.6061,
"loss/base_kto": 3.3585686683654785,
"metrics/advantage_var": 559.7994995117188,
"regularization/lipschitz_norm": 1539.2572021484375,
"regularization/w1": 1.4900009632110596,
"rewards/chosen": 0.38096188094264777,
"rewards/margins": 0.7030596592629603,
"rewards/rejected": -0.3220977783203125,
"step": 1520
},
{
"epoch": 1.994818652849741,
"grad_norm": 14.686551094055176,
"kl": 16.379161834716797,
"learning_rate": 2.738894140150075e-07,
"logits/chosen": -33170007.57894737,
"logits/rejected": -34907986.28571428,
"logps/chosen": -490.8579358552632,
"logps/rejected": -368.4364769345238,
"loss": 0.5992,
"loss/base_kto": 3.2888245582580566,
"metrics/advantage_var": 568.0514526367188,
"regularization/lipschitz_norm": 1554.4371337890625,
"regularization/w1": 1.504694938659668,
"rewards/chosen": 0.49511999832956416,
"rewards/margins": 0.7493636219722586,
"rewards/rejected": -0.25424362364269437,
"step": 1540
},
{
"epoch": 2.0207253886010363,
"grad_norm": 19.832347869873047,
"kl": 8.920297622680664,
"learning_rate": 2.6133756500585156e-07,
"logits/chosen": -35746486.567353405,
"logits/rejected": -35967476.12982999,
"logps/chosen": -500.636043977813,
"logps/rejected": -373.3530235703246,
"loss": 0.5697,
"loss/base_kto": 3.216679096221924,
"metrics/advantage_var": 485.2485046386719,
"regularization/lipschitz_norm": 1385.5474853515625,
"regularization/w1": 1.3412100076675415,
"rewards/chosen": 0.3797266456857914,
"rewards/margins": 0.856157830481,
"rewards/rejected": -0.47643118479520863,
"step": 1560
},
{
"epoch": 2.0466321243523318,
"grad_norm": 21.89859962463379,
"kl": 7.963223934173584,
"learning_rate": 2.489775719130767e-07,
"logits/chosen": -34025620.35905512,
"logits/rejected": -35273955.02635659,
"logps/chosen": -483.9924212598425,
"logps/rejected": -391.209980620155,
"loss": 0.5612,
"loss/base_kto": 3.1962673664093018,
"metrics/advantage_var": 484.2899475097656,
"regularization/lipschitz_norm": 1335.9390869140625,
"regularization/w1": 1.2931890487670898,
"rewards/chosen": 0.40625403697096457,
"rewards/margins": 0.9007795146538619,
"rewards/rejected": -0.4945254776828973,
"step": 1580
},
{
"epoch": 2.0725388601036268,
"grad_norm": 19.94541358947754,
"kl": 10.798842430114746,
"learning_rate": 2.3681937068576303e-07,
"logits/chosen": -33959290.56969697,
"logits/rejected": -34563745.85806452,
"logps/chosen": -480.3489583333333,
"logps/rejected": -382.5594758064516,
"loss": 0.5601,
"loss/base_kto": 3.2194650173187256,
"metrics/advantage_var": 437.97882080078125,
"regularization/lipschitz_norm": 1303.2080078125,
"regularization/w1": 1.261505365371704,
"rewards/chosen": 0.40321266867897726,
"rewards/margins": 0.8180123158563966,
"rewards/rejected": -0.41479964717741935,
"step": 1600
},
{
"epoch": 2.098445595854922,
"grad_norm": 15.935685157775879,
"kl": 13.427490234375,
"learning_rate": 2.2487273505658e-07,
"logits/chosen": -34735607.76848874,
"logits/rejected": -36867442.38297872,
"logps/chosen": -480.03054662379424,
"logps/rejected": -407.0298252279635,
"loss": 0.5543,
"loss/base_kto": 3.1622695922851562,
"metrics/advantage_var": 454.5888671875,
"regularization/lipschitz_norm": 1314.315673828125,
"regularization/w1": 1.272257685661316,
"rewards/chosen": 0.48861944560452675,
"rewards/margins": 0.8846590431361092,
"rewards/rejected": -0.39603959753158247,
"step": 1620
},
{
"epoch": 2.1243523316062176,
"grad_norm": 17.077974319458008,
"kl": 11.499598503112793,
"learning_rate": 2.131472686848817e-07,
"logits/chosen": -34062842.391236305,
"logits/rejected": -35439119.176287055,
"logps/chosen": -455.6285211267606,
"logps/rejected": -377.0400741029641,
"loss": 0.5543,
"loss/base_kto": 3.197096347808838,
"metrics/advantage_var": 422.5838928222656,
"regularization/lipschitz_norm": 1278.277587890625,
"regularization/w1": 1.237372636795044,
"rewards/chosen": 0.49088799561693075,
"rewards/margins": 0.8599527075462282,
"rewards/rejected": -0.36906471192929746,
"step": 1640
},
{
"epoch": 2.150259067357513,
"grad_norm": 15.541845321655273,
"kl": 7.3202714920043945,
"learning_rate": 2.016523974365188e-07,
"logits/chosen": -35913826.69879518,
"logits/rejected": -36105568.415584415,
"logps/chosen": -477.18844126506025,
"logps/rejected": -377.83081371753246,
"loss": 0.5543,
"loss/base_kto": 3.2012290954589844,
"metrics/advantage_var": 410.8737487792969,
"regularization/lipschitz_norm": 1274.033203125,
"regularization/w1": 1.2332642078399658,
"rewards/chosen": 0.4088220711213997,
"rewards/margins": 0.8678787767448778,
"rewards/rejected": -0.4590567056234781,
"step": 1660
},
{
"epoch": 2.1761658031088085,
"grad_norm": 19.03652572631836,
"kl": 16.03883171081543,
"learning_rate": 1.9039736180657372e-07,
"logits/chosen": -34887383.78849144,
"logits/rejected": -36789831.535321824,
"logps/chosen": -498.41757387247276,
"logps/rejected": -364.00431711145995,
"loss": 0.5556,
"loss/base_kto": 3.133333206176758,
"metrics/advantage_var": 471.56182861328125,
"regularization/lipschitz_norm": 1355.15771484375,
"regularization/w1": 1.3117927312850952,
"rewards/chosen": 0.5923158162118488,
"rewards/margins": 0.9083339132794017,
"rewards/rejected": -0.31601809706755296,
"step": 1680
},
{
"epoch": 2.2020725388601035,
"grad_norm": 16.680809020996094,
"kl": 14.453997611999512,
"learning_rate": 1.7939120949111498e-07,
"logits/chosen": -35109820.37735849,
"logits/rejected": -36396330.93167702,
"logps/chosen": -477.95735062893084,
"logps/rejected": -370.841056871118,
"loss": 0.5515,
"loss/base_kto": 3.102193593978882,
"metrics/advantage_var": 468.564453125,
"regularization/lipschitz_norm": 1352.7255859375,
"regularization/w1": 1.3094384670257568,
"rewards/chosen": 0.6048946740492335,
"rewards/margins": 0.9435668855007935,
"rewards/rejected": -0.33867221145156007,
"step": 1700
},
{
"epoch": 2.227979274611399,
"grad_norm": 24.052738189697266,
"kl": 12.60477352142334,
"learning_rate": 1.6864278811393523e-07,
"logits/chosen": -34349540.36825397,
"logits/rejected": -34623465.94461539,
"logps/chosen": -466.6015873015873,
"logps/rejected": -383.36846153846153,
"loss": 0.564,
"loss/base_kto": 3.164311170578003,
"metrics/advantage_var": 476.12921142578125,
"regularization/lipschitz_norm": 1392.194580078125,
"regularization/w1": 1.3476442098617554,
"rewards/chosen": 0.5004607669890873,
"rewards/margins": 0.896481697352669,
"rewards/rejected": -0.3960209303635817,
"step": 1720
},
{
"epoch": 2.2538860103626943,
"grad_norm": 15.353602409362793,
"kl": 9.640913963317871,
"learning_rate": 1.5816073811412584e-07,
"logits/chosen": -35780358.56410257,
"logits/rejected": -37144394.92682927,
"logps/chosen": -477.7608173076923,
"logps/rejected": -368.784775152439,
"loss": 0.5489,
"loss/base_kto": 3.1865601539611816,
"metrics/advantage_var": 413.68359375,
"regularization/lipschitz_norm": 1244.8675537109375,
"regularization/w1": 1.2050317525863647,
"rewards/chosen": 0.45113671131623095,
"rewards/margins": 0.8710790089028115,
"rewards/rejected": -0.4199422975865806,
"step": 1740
},
{
"epoch": 2.2797927461139897,
"grad_norm": 19.645570755004883,
"kl": 11.93309211730957,
"learning_rate": 1.4795348580020207e-07,
"logits/chosen": -34557834.44108761,
"logits/rejected": -35913317.074433655,
"logps/chosen": -487.8172205438066,
"logps/rejected": -369.0038683252427,
"loss": 0.557,
"loss/base_kto": 3.16609787940979,
"metrics/advantage_var": 439.7220153808594,
"regularization/lipschitz_norm": 1332.4222412109375,
"regularization/w1": 1.2897846698760986,
"rewards/chosen": 0.48893438149074775,
"rewards/margins": 0.8944033191392864,
"rewards/rejected": -0.40546893764853864,
"step": 1760
},
{
"epoch": 2.305699481865285,
"grad_norm": 13.989500999450684,
"kl": 14.450139045715332,
"learning_rate": 1.3802923657636355e-07,
"logits/chosen": -34658866.06940063,
"logits/rejected": -35601557.00309598,
"logps/chosen": -485.98077681388014,
"logps/rejected": -389.7189193111455,
"loss": 0.5648,
"loss/base_kto": 3.164170980453491,
"metrics/advantage_var": 473.74200439453125,
"regularization/lipschitz_norm": 1398.80517578125,
"regularization/w1": 1.3540433645248413,
"rewards/chosen": 0.5909651987936219,
"rewards/margins": 0.8866910182898002,
"rewards/rejected": -0.29572581949617843,
"step": 1780
},
{
"epoch": 2.33160621761658,
"grad_norm": 16.189327239990234,
"kl": 11.753397941589355,
"learning_rate": 1.28395968346336e-07,
"logits/chosen": -34559513.12883436,
"logits/rejected": -36000852.789808914,
"logps/chosen": -465.643884202454,
"logps/rejected": -370.72123805732485,
"loss": 0.5641,
"loss/base_kto": 3.1884517669677734,
"metrics/advantage_var": 502.8970642089844,
"regularization/lipschitz_norm": 1368.1595458984375,
"regularization/w1": 1.3243783712387085,
"rewards/chosen": 0.5534203652223927,
"rewards/margins": 0.8631156637270703,
"rewards/rejected": -0.30969529850467753,
"step": 1800
},
{
"epoch": 2.3575129533678756,
"grad_norm": 20.154483795166016,
"kl": 11.416178703308105,
"learning_rate": 1.1906142510009415e-07,
"logits/chosen": -35384447.424287856,
"logits/rejected": -36804126.90375204,
"logps/chosen": -525.9418103448276,
"logps/rejected": -358.78206566068513,
"loss": 0.5615,
"loss/base_kto": 3.1734509468078613,
"metrics/advantage_var": 462.114013671875,
"regularization/lipschitz_norm": 1361.947265625,
"regularization/w1": 1.3183649778366089,
"rewards/chosen": 0.5241920665643741,
"rewards/margins": 0.8779498408302795,
"rewards/rejected": -0.3537577742659054,
"step": 1820
},
{
"epoch": 2.383419689119171,
"grad_norm": 16.525434494018555,
"kl": 12.25172233581543,
"learning_rate": 1.1003311068862547e-07,
"logits/chosen": -34165764.777604975,
"logits/rejected": -36022619.22762951,
"logps/chosen": -491.60604587869364,
"logps/rejected": -367.30298273155415,
"loss": 0.5709,
"loss/base_kto": 3.1733152866363525,
"metrics/advantage_var": 476.2198791503906,
"regularization/lipschitz_norm": 1439.91650390625,
"regularization/w1": 1.3938392400741577,
"rewards/chosen": 0.5377036846629568,
"rewards/margins": 0.8708096133325016,
"rewards/rejected": -0.33310592866954475,
"step": 1840
},
{
"epoch": 2.4093264248704664,
"grad_norm": 15.079082489013672,
"kl": 12.411714553833008,
"learning_rate": 1.0131828279173588e-07,
"logits/chosen": -34833135.2599681,
"logits/rejected": -35935838.87289433,
"logps/chosen": -451.6981658692185,
"logps/rejected": -386.6646248085758,
"loss": 0.561,
"loss/base_kto": 3.231250047683716,
"metrics/advantage_var": 405.32867431640625,
"regularization/lipschitz_norm": 1298.2681884765625,
"regularization/w1": 1.2567236423492432,
"rewards/chosen": 0.43814432487913674,
"rewards/margins": 0.7966030965190438,
"rewards/rejected": -0.35845877163990714,
"step": 1860
},
{
"epoch": 2.4352331606217614,
"grad_norm": 14.774227142333984,
"kl": 12.383523941040039,
"learning_rate": 9.292394708374596e-08,
"logits/chosen": -33579212.8,
"logits/rejected": -36042826.76825397,
"logps/chosen": -476.85942307692306,
"logps/rejected": -371.9820188492063,
"loss": 0.5626,
"loss/base_kto": 3.1879355907440186,
"metrics/advantage_var": 465.83770751953125,
"regularization/lipschitz_norm": 1356.3656005859375,
"regularization/w1": 1.3129619359970093,
"rewards/chosen": 0.46731121356670674,
"rewards/margins": 0.8773125505272722,
"rewards/rejected": -0.41000133696056545,
"step": 1880
},
{
"epoch": 2.461139896373057,
"grad_norm": 17.516733169555664,
"kl": 11.263381004333496,
"learning_rate": 8.48568516017727e-08,
"logits/chosen": -34234809.2631579,
"logits/rejected": -36706703.23809524,
"logps/chosen": -476.1243832236842,
"logps/rejected": -377.2783435639881,
"loss": 0.5597,
"loss/base_kto": 3.1911723613739014,
"metrics/advantage_var": 454.2433166503906,
"regularization/lipschitz_norm": 1328.9354248046875,
"regularization/w1": 1.2864094972610474,
"rewards/chosen": 0.46600713227924545,
"rewards/margins": 0.8416058580976978,
"rewards/rejected": -0.3755987258184524,
"step": 1900
},
{
"epoch": 2.4870466321243523,
"grad_norm": 16.33338165283203,
"kl": 10.109529495239258,
"learning_rate": 7.71234813211169e-08,
"logits/chosen": -34452697.403076924,
"logits/rejected": -36515004.54603174,
"logps/chosen": -478.72778846153847,
"logps/rejected": -361.4546130952381,
"loss": 0.5563,
"loss/base_kto": 3.1940488815307617,
"metrics/advantage_var": 450.54400634765625,
"regularization/lipschitz_norm": 1298.1900634765625,
"regularization/w1": 1.256648063659668,
"rewards/chosen": 0.5028693096454326,
"rewards/margins": 0.8506774451473548,
"rewards/rejected": -0.34780813550192213,
"step": 1920
},
{
"epoch": 2.5129533678756477,
"grad_norm": 17.103260040283203,
"kl": 11.305916786193848,
"learning_rate": 6.973005294212353e-08,
"logits/chosen": -34056343.58425197,
"logits/rejected": -35604441.89767442,
"logps/chosen": -510.2220964566929,
"logps/rejected": -384.35329457364344,
"loss": 0.5573,
"loss/base_kto": 3.210218906402588,
"metrics/advantage_var": 398.03277587890625,
"regularization/lipschitz_norm": 1289.62451171875,
"regularization/w1": 1.2483564615249634,
"rewards/chosen": 0.4129806878998524,
"rewards/margins": 0.8291276567709764,
"rewards/rejected": -0.416146968871124,
"step": 1940
},
{
"epoch": 2.538860103626943,
"grad_norm": 13.693824768066406,
"kl": 11.231901168823242,
"learning_rate": 6.268250989270102e-08,
"logits/chosen": -34975075.5328,
"logits/rejected": -36562037.2519084,
"logps/chosen": -461.2134,
"logps/rejected": -379.83284828244274,
"loss": 0.5532,
"loss/base_kto": 3.1471829414367676,
"metrics/advantage_var": 453.8047790527344,
"regularization/lipschitz_norm": 1320.3148193359375,
"regularization/w1": 1.2780648469924927,
"rewards/chosen": 0.476273095703125,
"rewards/margins": 0.8842373915344703,
"rewards/rejected": -0.4079642958313454,
"step": 1960
},
{
"epoch": 2.5647668393782386,
"grad_norm": 21.8228702545166,
"kl": 10.097284317016602,
"learning_rate": 5.598651755051975e-08,
"logits/chosen": -35680366.276923075,
"logits/rejected": -36090766.222222224,
"logps/chosen": -485.4498076923077,
"logps/rejected": -395.991691468254,
"loss": 0.5596,
"loss/base_kto": 3.2041866779327393,
"metrics/advantage_var": 447.53546142578125,
"regularization/lipschitz_norm": 1314.6365966796875,
"regularization/w1": 1.2725682258605957,
"rewards/chosen": 0.42717961237980767,
"rewards/margins": 0.8594246791890834,
"rewards/rejected": -0.43224506680927577,
"step": 1980
},
{
"epoch": 2.5906735751295336,
"grad_norm": 19.715198516845703,
"kl": 12.224166870117188,
"learning_rate": 4.964745868872933e-08,
"logits/chosen": -34828281.2852459,
"logits/rejected": -36145191.737313434,
"logps/chosen": -475.6319159836066,
"logps/rejected": -402.1400186567164,
"loss": 0.5627,
"loss/base_kto": 3.2128219604492188,
"metrics/advantage_var": 442.60357666015625,
"regularization/lipschitz_norm": 1331.3394775390625,
"regularization/w1": 1.2887365818023682,
"rewards/chosen": 0.46946871397925205,
"rewards/margins": 0.8268080548724424,
"rewards/rejected": -0.3573393408931903,
"step": 2000
},
{
"epoch": 2.616580310880829,
"grad_norm": 17.652387619018555,
"kl": 11.485856056213379,
"learning_rate": 4.3670429148855493e-08,
"logits/chosen": -35123821.88871224,
"logits/rejected": -35522978.40860215,
"logps/chosen": -507.59807233704294,
"logps/rejected": -361.008784562212,
"loss": 0.5576,
"loss/base_kto": 3.13618803024292,
"metrics/advantage_var": 487.19732666015625,
"regularization/lipschitz_norm": 1368.5726318359375,
"regularization/w1": 1.324778437614441,
"rewards/chosen": 0.49694688369435613,
"rewards/margins": 0.9343460491159431,
"rewards/rejected": -0.43739916542158697,
"step": 2020
},
{
"epoch": 2.6424870466321244,
"grad_norm": 20.829431533813477,
"kl": 9.707969665527344,
"learning_rate": 3.806023374435663e-08,
"logits/chosen": -35104294.4,
"logits/rejected": -35396448.0,
"logps/chosen": -499.63681640625,
"logps/rejected": -408.16787109375,
"loss": 0.5597,
"loss/base_kto": 3.158587694168091,
"metrics/advantage_var": 461.05224609375,
"regularization/lipschitz_norm": 1362.4744873046875,
"regularization/w1": 1.3188751935958862,
"rewards/chosen": 0.4626021385192871,
"rewards/margins": 0.8942239284515381,
"rewards/rejected": -0.431621789932251,
"step": 2040
},
{
"epoch": 2.66839378238342,
"grad_norm": 25.18584442138672,
"kl": 10.333015441894531,
"learning_rate": 3.282138239813037e-08,
"logits/chosen": -34953715.2,
"logits/rejected": -36164294.4,
"logps/chosen": -499.62099609375,
"logps/rejected": -378.3279296875,
"loss": 0.5629,
"loss/base_kto": 3.1900126934051514,
"metrics/advantage_var": 433.4665222167969,
"regularization/lipschitz_norm": 1356.5330810546875,
"regularization/w1": 1.3131239414215088,
"rewards/chosen": 0.4079261779785156,
"rewards/margins": 0.8461101531982422,
"rewards/rejected": -0.4381839752197266,
"step": 2060
},
{
"epoch": 2.694300518134715,
"grad_norm": 16.694236755371094,
"kl": 9.096259117126465,
"learning_rate": 2.795808651707793e-08,
"logits/chosen": -33919099.3010279,
"logits/rejected": -36184412.74123539,
"logps/chosen": -504.5181718061674,
"logps/rejected": -352.5863418196995,
"loss": 0.5737,
"loss/base_kto": 3.1659293174743652,
"metrics/advantage_var": 824.1036987304688,
"regularization/lipschitz_norm": 1470.7811279296875,
"regularization/w1": 1.4237160682678223,
"rewards/chosen": 0.4760711714734765,
"rewards/margins": 0.8588093135347896,
"rewards/rejected": -0.3827381420613131,
"step": 2080
},
{
"epoch": 2.7202072538860103,
"grad_norm": 17.056594848632812,
"kl": 9.983824729919434,
"learning_rate": 2.3474255606639293e-08,
"logits/chosen": -32986793.589905363,
"logits/rejected": -36054085.746130034,
"logps/chosen": -475.39910291798105,
"logps/rejected": -352.9758126934984,
"loss": 0.564,
"loss/base_kto": 3.222651720046997,
"metrics/advantage_var": 444.0147399902344,
"regularization/lipschitz_norm": 1331.890625,
"regularization/w1": 1.2892701625823975,
"rewards/chosen": 0.4675080212132788,
"rewards/margins": 0.823879874217947,
"rewards/rejected": -0.35637185300466817,
"step": 2100
},
{
"epoch": 2.7461139896373057,
"grad_norm": 12.820006370544434,
"kl": 11.673685073852539,
"learning_rate": 1.9373494128020195e-08,
"logits/chosen": -34266621.588697016,
"logits/rejected": -36960013.934681185,
"logps/chosen": -493.0527864992151,
"logps/rejected": -376.27007192846037,
"loss": 0.5469,
"loss/base_kto": 3.1460659503936768,
"metrics/advantage_var": 466.6276550292969,
"regularization/lipschitz_norm": 1269.818603515625,
"regularization/w1": 1.2291842699050903,
"rewards/chosen": 0.515916761461195,
"rewards/margins": 0.9079495567992102,
"rewards/rejected": -0.39203279533801516,
"step": 2120
},
{
"epoch": 2.772020725388601,
"grad_norm": 13.636578559875488,
"kl": 11.184309959411621,
"learning_rate": 1.5659098600638798e-08,
"logits/chosen": -35773777.13230769,
"logits/rejected": -37253471.08571429,
"logps/chosen": -485.21740384615384,
"logps/rejected": -381.7684027777778,
"loss": 0.5575,
"loss/base_kto": 3.125328540802002,
"metrics/advantage_var": 481.3175964355469,
"regularization/lipschitz_norm": 1379.0472412109375,
"regularization/w1": 1.3349177837371826,
"rewards/chosen": 0.5428059269831731,
"rewards/margins": 0.9327230644924737,
"rewards/rejected": -0.38991713750930057,
"step": 2140
},
{
"epoch": 2.7979274611398965,
"grad_norm": 18.770830154418945,
"kl": 11.703639030456543,
"learning_rate": 1.2334054952120143e-08,
"logits/chosen": -34847018.12658228,
"logits/rejected": -35032209.38271605,
"logps/chosen": -483.4439280063291,
"logps/rejected": -353.645881558642,
"loss": 0.5565,
"loss/base_kto": 3.1920933723449707,
"metrics/advantage_var": 452.3001403808594,
"regularization/lipschitz_norm": 1301.8756103515625,
"regularization/w1": 1.2602156400680542,
"rewards/chosen": 0.5000883174847953,
"rewards/margins": 0.867645866667075,
"rewards/rejected": -0.3675575491822796,
"step": 2160
},
{
"epoch": 2.823834196891192,
"grad_norm": 15.435226440429688,
"kl": 13.41156005859375,
"learning_rate": 9.401036117969108e-09,
"logits/chosen": -35750206.35897436,
"logits/rejected": -35239427.12195122,
"logps/chosen": -460.6829427083333,
"logps/rejected": -404.6037538109756,
"loss": 0.5564,
"loss/base_kto": 3.1568715572357178,
"metrics/advantage_var": 443.94873046875,
"regularization/lipschitz_norm": 1336.811767578125,
"regularization/w1": 1.2940337657928467,
"rewards/chosen": 0.4726253900772486,
"rewards/margins": 0.8782601538414206,
"rewards/rejected": -0.40563476376417207,
"step": 2180
},
{
"epoch": 2.849740932642487,
"grad_norm": 20.130613327026367,
"kl": 9.79339599609375,
"learning_rate": 6.8623998928517555e-09,
"logits/chosen": -34129891.15492958,
"logits/rejected": -35186700.780031204,
"logps/chosen": -465.1637323943662,
"logps/rejected": -375.63772425897037,
"loss": 0.5465,
"loss/base_kto": 3.1563546657562256,
"metrics/advantage_var": 434.60137939453125,
"regularization/lipschitz_norm": 1255.7060546875,
"regularization/w1": 1.2155234813690186,
"rewards/chosen": 0.5008374902190923,
"rewards/margins": 0.8796890371032333,
"rewards/rejected": -0.37885154688414097,
"step": 2200
},
{
"epoch": 2.8756476683937824,
"grad_norm": 17.81679916381836,
"kl": 10.139800071716309,
"learning_rate": 4.72018703521132e-09,
"logits/chosen": -35804687.900621116,
"logits/rejected": -36437314.012578614,
"logps/chosen": -496.7468944099379,
"logps/rejected": -370.1814809355346,
"loss": 0.5637,
"loss/base_kto": 3.197054624557495,
"metrics/advantage_var": 472.7958984375,
"regularization/lipschitz_norm": 1356.276611328125,
"regularization/w1": 1.312875747680664,
"rewards/chosen": 0.5197515073029891,
"rewards/margins": 0.87249687534882,
"rewards/rejected": -0.3527453680458309,
"step": 2220
},
{
"epoch": 2.901554404145078,
"grad_norm": 12.215582847595215,
"kl": 12.430460929870605,
"learning_rate": 2.976119626744267e-09,
"logits/chosen": -35006370.6163522,
"logits/rejected": -36758954.136645965,
"logps/chosen": -470.7425314465409,
"logps/rejected": -372.70060170807454,
"loss": 0.5562,
"loss/base_kto": 3.1164519786834717,
"metrics/advantage_var": 489.5458679199219,
"regularization/lipschitz_norm": 1377.111083984375,
"regularization/w1": 1.3330434560775757,
"rewards/chosen": 0.5485211258414406,
"rewards/margins": 0.9483621501099286,
"rewards/rejected": -0.39984102426848794,
"step": 2240
},
{
"epoch": 2.927461139896373,
"grad_norm": 16.069026947021484,
"kl": 10.979535102844238,
"learning_rate": 1.631599688052765e-09,
"logits/chosen": -35466033.951219514,
"logits/rejected": -35640411.897435896,
"logps/chosen": -470.0374428353659,
"logps/rejected": -390.1776091746795,
"loss": 0.5643,
"loss/base_kto": 3.1961257457733154,
"metrics/advantage_var": 467.57598876953125,
"regularization/lipschitz_norm": 1361.852294921875,
"regularization/w1": 1.3182729482650757,
"rewards/chosen": 0.4945542870498285,
"rewards/margins": 0.8762905533571703,
"rewards/rejected": -0.38173626630734175,
"step": 2260
},
{
"epoch": 2.9533678756476682,
"grad_norm": 14.50257396697998,
"kl": 10.80820369720459,
"learning_rate": 6.877080515894085e-10,
"logits/chosen": -34907956.17061611,
"logits/rejected": -36849914.064914994,
"logps/chosen": -478.53929699842024,
"logps/rejected": -363.3722952086553,
"loss": 0.5602,
"loss/base_kto": 3.1777961254119873,
"metrics/advantage_var": 454.50732421875,
"regularization/lipschitz_norm": 1346.4949951171875,
"regularization/w1": 1.303407073020935,
"rewards/chosen": 0.4962760840923677,
"rewards/margins": 0.8795880912830072,
"rewards/rejected": -0.3833120071906395,
"step": 2280
},
{
"epoch": 2.9792746113989637,
"grad_norm": 16.197853088378906,
"kl": 12.25694751739502,
"learning_rate": 1.4520349279739663e-10,
"logits/chosen": -33690625.60250391,
"logits/rejected": -35501629.503900155,
"logps/chosen": -475.36551251956183,
"logps/rejected": -351.76489372074883,
"loss": 0.5538,
"loss/base_kto": 3.1732850074768066,
"metrics/advantage_var": 491.0556640625,
"regularization/lipschitz_norm": 1298.767578125,
"regularization/w1": 1.2572071552276611,
"rewards/chosen": 0.5119681918005429,
"rewards/margins": 0.8778844751803937,
"rewards/rejected": -0.3659162833798508,
"step": 2300
},
{
"epoch": 3.0,
"step": 2316,
"total_flos": 9.972016217523487e+17,
"train_loss": 0.5863274930878213,
"train_runtime": 11040.2984,
"train_samples_per_second": 13.425,
"train_steps_per_second": 0.21
}
],
"logging_steps": 20,
"max_steps": 2316,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": false,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 9.972016217523487e+17,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}