Files
aup-fullft-kto_mmd-mmdrho5.…/trainer_state.json

2229 lines
81 KiB
JSON
Raw Normal View History

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 3.0,
"eval_steps": 500,
"global_step": 2316,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.025906735751295335,
"grad_norm": 15.130857467651367,
"kl": 4.761574745178223,
"learning_rate": 1.8999999999999998e-07,
"logits/chosen": -36942093.653333336,
"logits/rejected": -38905217.50588235,
"logps/chosen": -484.46708333333333,
"logps/rejected": -355.75847886029413,
"loss": 0.5879,
"loss/base_kto": 3.8887081146240234,
"metrics/advantage_var": 190.82591247558594,
"regularization/mmd": 0.8144394159317017,
"regularization/rkhs_norm": 156.92474365234375,
"rewards/chosen": -0.08358226140340169,
"rewards/margins": 0.07920884487675686,
"rewards/rejected": -0.16279110628015855,
"step": 20
},
{
"epoch": 0.05181347150259067,
"grad_norm": 15.646539688110352,
"kl": 3.6444268226623535,
"learning_rate": 3.8999999999999997e-07,
"logits/chosen": -35316123.529042386,
"logits/rejected": -36554541.78538103,
"logps/chosen": -464.786204866562,
"logps/rejected": -379.72438763608085,
"loss": 0.5807,
"loss/base_kto": 3.8761627674102783,
"metrics/advantage_var": 168.8544921875,
"regularization/mmd": 0.7692461013793945,
"regularization/rkhs_norm": 148.21697998046875,
"rewards/chosen": 0.044457020901810244,
"rewards/margins": 0.1253069962029803,
"rewards/rejected": -0.08084997530117005,
"step": 40
},
{
"epoch": 0.07772020725388601,
"grad_norm": 18.42901611328125,
"kl": 5.139020919799805,
"learning_rate": 5.9e-07,
"logits/chosen": -34244575.38853503,
"logits/rejected": -37065247.41104294,
"logps/chosen": -481.8531548566879,
"logps/rejected": -378.44581575920245,
"loss": 0.576,
"loss/base_kto": 3.8305325508117676,
"metrics/advantage_var": 168.36598205566406,
"regularization/mmd": 0.7773937582969666,
"regularization/rkhs_norm": 149.78684997558594,
"rewards/chosen": 0.030986403204073573,
"rewards/margins": 0.15914004619783673,
"rewards/rejected": -0.12815364299376317,
"step": 60
},
{
"epoch": 0.10362694300518134,
"grad_norm": 15.9312162399292,
"kl": 6.56032133102417,
"learning_rate": 7.9e-07,
"logits/chosen": -35905693.2864,
"logits/rejected": -37326103.84122138,
"logps/chosen": -478.7005,
"logps/rejected": -371.0121898854962,
"loss": 0.5894,
"loss/base_kto": 3.8666043281555176,
"metrics/advantage_var": 211.9551544189453,
"regularization/mmd": 0.8487977981567383,
"regularization/rkhs_norm": 163.5448455810547,
"rewards/chosen": 0.10424482421875,
"rewards/margins": 0.12079478056230618,
"rewards/rejected": -0.016549956343556178,
"step": 80
},
{
"epoch": 0.12953367875647667,
"grad_norm": 20.496784210205078,
"kl": 4.3715033531188965,
"learning_rate": 9.9e-07,
"logits/chosen": -34802072.27228525,
"logits/rejected": -36334751.08295626,
"logps/chosen": -447.65169165316047,
"logps/rejected": -361.70769702111613,
"loss": 0.574,
"loss/base_kto": 3.859165906906128,
"metrics/advantage_var": 153.92991638183594,
"regularization/mmd": 0.7332141995429993,
"regularization/rkhs_norm": 141.2744140625,
"rewards/chosen": 0.028494527312886195,
"rewards/margins": 0.1332735938561201,
"rewards/rejected": -0.10477906654323388,
"step": 100
},
{
"epoch": 0.15544041450777202,
"grad_norm": 17.79025650024414,
"kl": 15.81823444366455,
"learning_rate": 9.998186234298189e-07,
"logits/chosen": -35241291.294117644,
"logits/rejected": -36149821.44,
"logps/chosen": -481.5256893382353,
"logps/rejected": -367.18734375,
"loss": 0.586,
"loss/base_kto": 3.828622579574585,
"metrics/advantage_var": 208.0641632080078,
"regularization/mmd": 0.8597148060798645,
"regularization/rkhs_norm": 165.64834594726562,
"rewards/chosen": 0.24961013793945314,
"rewards/margins": 0.17664976755777995,
"rewards/rejected": 0.07296037038167318,
"step": 120
},
{
"epoch": 0.18134715025906736,
"grad_norm": 21.106868743896484,
"kl": 16.922224044799805,
"learning_rate": 9.992359552107714e-07,
"logits/chosen": -34983266.579104476,
"logits/rejected": -36376092.537704915,
"logps/chosen": -474.43222947761194,
"logps/rejected": -355.95435450819673,
"loss": 0.5752,
"loss/base_kto": 3.780517578125,
"metrics/advantage_var": 188.562744140625,
"regularization/mmd": 0.8209512829780579,
"regularization/rkhs_norm": 158.179443359375,
"rewards/chosen": 0.3078866531599813,
"rewards/margins": 0.21121301914678972,
"rewards/rejected": 0.0966736340131916,
"step": 140
},
{
"epoch": 0.20725388601036268,
"grad_norm": 15.32691478729248,
"kl": 12.154338836669922,
"learning_rate": 9.982519612796161e-07,
"logits/chosen": -36591796.327044025,
"logits/rejected": -36384440.44720497,
"logps/chosen": -473.89087067610063,
"logps/rejected": -364.2359035326087,
"loss": 0.5765,
"loss/base_kto": 3.747577667236328,
"metrics/advantage_var": 216.19285583496094,
"regularization/mmd": 0.8640968203544617,
"regularization/rkhs_norm": 166.49266052246094,
"rewards/chosen": 0.2337539960753243,
"rewards/margins": 0.236531285234874,
"rewards/rejected": -0.0027772891595496895,
"step": 160
},
{
"epoch": 0.23316062176165803,
"grad_norm": 14.877063751220703,
"kl": 7.616835117340088,
"learning_rate": 9.968674326492213e-07,
"logits/chosen": -35663145.394034535,
"logits/rejected": -36818721.04510109,
"logps/chosen": -472.18789246467816,
"logps/rejected": -349.0640066096423,
"loss": 0.5783,
"loss/base_kto": 3.768833875656128,
"metrics/advantage_var": 209.60205078125,
"regularization/mmd": 0.8572441339492798,
"regularization/rkhs_norm": 165.17227172851562,
"rewards/chosen": 0.11851194851813923,
"rewards/margins": 0.21512558183562686,
"rewards/rejected": -0.09661363331748761,
"step": 180
},
{
"epoch": 0.25906735751295334,
"grad_norm": 13.783124923706055,
"kl": 11.596030235290527,
"learning_rate": 9.950834823142198e-07,
"logits/chosen": -37818205.16207951,
"logits/rejected": -37808514.044728436,
"logps/chosen": -509.60311544342505,
"logps/rejected": -362.6952875399361,
"loss": 0.5794,
"loss/base_kto": 3.737436056137085,
"metrics/advantage_var": 217.01065063476562,
"regularization/mmd": 0.8980569839477539,
"regularization/rkhs_norm": 173.03604125976562,
"rewards/chosen": 0.25883346230976445,
"rewards/margins": 0.2537100382367676,
"rewards/rejected": 0.0051234240729968765,
"step": 200
},
{
"epoch": 0.2849740932642487,
"grad_norm": 15.125517845153809,
"kl": 9.459787368774414,
"learning_rate": 9.929015443562942e-07,
"logits/chosen": -36797581.40212443,
"logits/rejected": -38671823.355877616,
"logps/chosen": -498.74411987860395,
"logps/rejected": -376.55427234299515,
"loss": 0.5865,
"loss/base_kto": 3.8149335384368896,
"metrics/advantage_var": 254.8901824951172,
"regularization/mmd": 0.8767148852348328,
"regularization/rkhs_norm": 168.92385864257812,
"rewards/chosen": 0.20460924718738144,
"rewards/margins": 0.16430174302794856,
"rewards/rejected": 0.04030750415943287,
"step": 220
},
{
"epoch": 0.31088082901554404,
"grad_norm": 14.51710319519043,
"kl": 11.137063980102539,
"learning_rate": 9.90323372791347e-07,
"logits/chosen": -35898331.371695176,
"logits/rejected": -36782517.24960753,
"logps/chosen": -475.05214813374806,
"logps/rejected": -366.24526589481945,
"loss": 0.5812,
"loss/base_kto": 3.800611972808838,
"metrics/advantage_var": 206.521240234375,
"regularization/mmd": 0.8491171002388,
"regularization/rkhs_norm": 163.6063995361328,
"rewards/chosen": 0.16592986253705774,
"rewards/margins": 0.17666043527199232,
"rewards/rejected": -0.010730572734934569,
"step": 240
},
{
"epoch": 0.33678756476683935,
"grad_norm": 13.338346481323242,
"kl": 6.600700378417969,
"learning_rate": 9.87351040159484e-07,
"logits/chosen": -36512637.37952756,
"logits/rejected": -37593764.31627907,
"logps/chosen": -487.8697834645669,
"logps/rejected": -380.8578246124031,
"loss": 0.585,
"loss/base_kto": 3.7840969562530518,
"metrics/advantage_var": 230.69541931152344,
"regularization/mmd": 0.8959032297134399,
"regularization/rkhs_norm": 172.6210479736328,
"rewards/chosen": 0.06875443946658157,
"rewards/margins": 0.20920915611205154,
"rewards/rejected": -0.14045471664546996,
"step": 260
},
{
"epoch": 0.3626943005181347,
"grad_norm": 16.90336036682129,
"kl": 9.412796020507812,
"learning_rate": 9.839869358589396e-07,
"logits/chosen": -34535846.7072,
"logits/rejected": -36815961.11145038,
"logps/chosen": -478.9129,
"logps/rejected": -384.14408396946567,
"loss": 0.5829,
"loss/base_kto": 3.7607433795928955,
"metrics/advantage_var": 231.4911651611328,
"regularization/mmd": 0.9025770425796509,
"regularization/rkhs_norm": 173.9069366455078,
"rewards/chosen": 0.1127895263671875,
"rewards/margins": 0.19504585515378997,
"rewards/rejected": -0.08225632878660245,
"step": 280
},
{
"epoch": 0.38860103626943004,
"grad_norm": 16.822004318237305,
"kl": 10.808634757995605,
"learning_rate": 9.80233764225289e-07,
"logits/chosen": -35965313.58024691,
"logits/rejected": -37074036.658227846,
"logps/chosen": -481.5387249228395,
"logps/rejected": -390.07004054588606,
"loss": 0.5872,
"loss/base_kto": 3.78863525390625,
"metrics/advantage_var": 229.93997192382812,
"regularization/mmd": 0.9090096354484558,
"regularization/rkhs_norm": 175.14639282226562,
"rewards/chosen": 0.20611553427613813,
"rewards/margins": 0.18817446376778482,
"rewards/rejected": 0.017941070508353318,
"step": 300
},
{
"epoch": 0.41450777202072536,
"grad_norm": 14.761191368103027,
"kl": 13.942374229431152,
"learning_rate": 9.760945423574868e-07,
"logits/chosen": -37473318.4962406,
"logits/rejected": -37717673.001626015,
"logps/chosen": -469.2546052631579,
"logps/rejected": -388.0675304878049,
"loss": 0.5779,
"loss/base_kto": 3.696047306060791,
"metrics/advantage_var": 240.49853515625,
"regularization/mmd": 0.9273321032524109,
"regularization/rkhs_norm": 178.67672729492188,
"rewards/chosen": 0.3169454244742716,
"rewards/margins": 0.27461627825190116,
"rewards/rejected": 0.042329146222370426,
"step": 320
},
{
"epoch": 0.44041450777202074,
"grad_norm": 16.781259536743164,
"kl": 10.861861228942871,
"learning_rate": 9.71572597692482e-07,
"logits/chosen": -37333167.72542902,
"logits/rejected": -37195577.28951487,
"logps/chosen": -509.5145280811232,
"logps/rejected": -366.51457355242565,
"loss": 0.5783,
"loss/base_kto": 3.7383134365081787,
"metrics/advantage_var": 223.09609985351562,
"regularization/mmd": 0.8883072137832642,
"regularization/rkhs_norm": 171.157470703125,
"rewards/chosen": 0.17960316007855157,
"rewards/margins": 0.25466792516101683,
"rewards/rejected": -0.07506476508246528,
"step": 340
},
{
"epoch": 0.46632124352331605,
"grad_norm": 16.52114486694336,
"kl": 10.722800254821777,
"learning_rate": 9.666715653303588e-07,
"logits/chosen": -34513129.7057057,
"logits/rejected": -35481946.89250814,
"logps/chosen": -490.37509384384384,
"logps/rejected": -388.6891286644951,
"loss": 0.5835,
"loss/base_kto": 3.733602285385132,
"metrics/advantage_var": 251.0590057373047,
"regularization/mmd": 0.9347845315933228,
"regularization/rkhs_norm": 180.1126251220703,
"rewards/chosen": 0.2069030395141235,
"rewards/margins": 0.2647182557773882,
"rewards/rejected": -0.05781521626326471,
"step": 360
},
{
"epoch": 0.49222797927461137,
"grad_norm": 15.33375072479248,
"kl": 9.749954223632812,
"learning_rate": 9.613953851121528e-07,
"logits/chosen": -33689994.335403726,
"logits/rejected": -36951816.05031446,
"logps/chosen": -496.167701863354,
"logps/rejected": -357.282822327044,
"loss": 0.5827,
"loss/base_kto": 3.7767181396484375,
"metrics/advantage_var": 226.6070556640625,
"regularization/mmd": 0.8848592042922974,
"regularization/rkhs_norm": 170.4930877685547,
"rewards/chosen": 0.15638849009638248,
"rewards/margins": 0.21226255288044546,
"rewards/rejected": -0.05587406278406299,
"step": 380
},
{
"epoch": 0.5181347150259067,
"grad_norm": 14.226479530334473,
"kl": 13.073600769042969,
"learning_rate": 9.557482984526924e-07,
"logits/chosen": -35692129.29595016,
"logits/rejected": -37533185.60501567,
"logps/chosen": -478.4701129283489,
"logps/rejected": -379.8528115203762,
"loss": 0.5828,
"loss/base_kto": 3.7585251331329346,
"metrics/advantage_var": 226.40322875976562,
"regularization/mmd": 0.9036926627159119,
"regularization/rkhs_norm": 174.1219024658203,
"rewards/chosen": 0.20966519744968118,
"rewards/margins": 0.23187254278439492,
"rewards/rejected": -0.022207345334713736,
"step": 400
},
{
"epoch": 0.5440414507772021,
"grad_norm": 17.16434669494629,
"kl": 20.28582763671875,
"learning_rate": 9.497348449310107e-07,
"logits/chosen": -36566540.641975306,
"logits/rejected": -36928382.37974683,
"logps/chosen": -483.3317901234568,
"logps/rejected": -381.178945806962,
"loss": 0.5811,
"loss/base_kto": 3.742854356765747,
"metrics/advantage_var": 239.9812469482422,
"regularization/mmd": 0.9056269526481628,
"regularization/rkhs_norm": 174.49461364746094,
"rewards/chosen": 0.32063430032612367,
"rewards/margins": 0.19578205948603267,
"rewards/rejected": 0.12485224084009099,
"step": 420
},
{
"epoch": 0.5699481865284974,
"grad_norm": 15.937045097351074,
"kl": 4.6071085929870605,
"learning_rate": 9.433598586410701e-07,
"logits/chosen": -37060291.43217666,
"logits/rejected": -38281992.718266256,
"logps/chosen": -487.60636829653,
"logps/rejected": -415.375386996904,
"loss": 0.5897,
"loss/base_kto": 3.7728347778320312,
"metrics/advantage_var": 303.0648498535156,
"regularization/mmd": 0.9448938369750977,
"regularization/rkhs_norm": 182.06048583984375,
"rewards/chosen": -0.03856106285793172,
"rewards/margins": 0.20288829912627399,
"rewards/rejected": -0.2414493619842057,
"step": 440
},
{
"epoch": 0.5958549222797928,
"grad_norm": 14.645048141479492,
"kl": 11.784172058105469,
"learning_rate": 9.366284643057313e-07,
"logits/chosen": -34455175.50554675,
"logits/rejected": -36888973.60862866,
"logps/chosen": -501.4950475435816,
"logps/rejected": -367.9532935285054,
"loss": 0.586,
"loss/base_kto": 3.7162437438964844,
"metrics/advantage_var": 269.9901428222656,
"regularization/mmd": 0.9714435935020447,
"regularization/rkhs_norm": 187.17601013183594,
"rewards/chosen": 0.20885306719554775,
"rewards/margins": 0.2564124497473552,
"rewards/rejected": -0.047559382551807465,
"step": 460
},
{
"epoch": 0.6217616580310881,
"grad_norm": 14.725089073181152,
"kl": 21.3284969329834,
"learning_rate": 9.295460731570917e-07,
"logits/chosen": -37677663.61445783,
"logits/rejected": -38149319.48051948,
"logps/chosen": -484.6805346385542,
"logps/rejected": -376.2382305194805,
"loss": 0.5839,
"loss/base_kto": 3.740070343017578,
"metrics/advantage_var": 249.39854431152344,
"regularization/mmd": 0.9308084845542908,
"regularization/rkhs_norm": 179.34652709960938,
"rewards/chosen": 0.28971419276961363,
"rewards/margins": 0.22355909971279864,
"rewards/rejected": 0.06615509305681501,
"step": 480
},
{
"epoch": 0.6476683937823834,
"grad_norm": 15.315522193908691,
"kl": 15.955157279968262,
"learning_rate": 9.221183785865056e-07,
"logits/chosen": -36865574.65639445,
"logits/rejected": -38866720.05071315,
"logps/chosen": -507.76213405238826,
"logps/rejected": -371.5848851030111,
"loss": 0.5823,
"loss/base_kto": 3.7561357021331787,
"metrics/advantage_var": 229.5916748046875,
"regularization/mmd": 0.9023582339286804,
"regularization/rkhs_norm": 173.8647918701172,
"rewards/chosen": 0.2609805913845821,
"rewards/margins": 0.19861362819603587,
"rewards/rejected": 0.062366963188546204,
"step": 500
},
{
"epoch": 0.6735751295336787,
"grad_norm": 17.44818115234375,
"kl": 13.880945205688477,
"learning_rate": 9.143513515677817e-07,
"logits/chosen": -36378504.11707317,
"logits/rejected": -39158961.082706764,
"logps/chosen": -504.4064024390244,
"logps/rejected": -345.63677161654135,
"loss": 0.575,
"loss/base_kto": 3.706279754638672,
"metrics/advantage_var": 242.1262664794922,
"regularization/mmd": 0.8934823870658875,
"regularization/rkhs_norm": 172.1546173095703,
"rewards/chosen": 0.18307581955824442,
"rewards/margins": 0.22600504872093385,
"rewards/rejected": -0.04292922916268944,
"step": 520
},
{
"epoch": 0.6994818652849741,
"grad_norm": 15.78923511505127,
"kl": 10.004231452941895,
"learning_rate": 9.062512358572373e-07,
"logits/chosen": -36161229.58167939,
"logits/rejected": -36614009.6512,
"logps/chosen": -469.91140267175575,
"logps/rejected": -394.6747,
"loss": 0.5811,
"loss/base_kto": 3.7478103637695312,
"metrics/advantage_var": 233.16355895996094,
"regularization/mmd": 0.901284396648407,
"regularization/rkhs_norm": 173.6578826904297,
"rewards/chosen": 0.12188799909052958,
"rewards/margins": 0.2359503770202171,
"rewards/rejected": -0.1140623779296875,
"step": 540
},
{
"epoch": 0.7253886010362695,
"grad_norm": 13.183453559875488,
"kl": 9.830798149108887,
"learning_rate": 8.978245429744691e-07,
"logits/chosen": -35139613.77705977,
"logits/rejected": -37245392.750378214,
"logps/chosen": -483.6814923263328,
"logps/rejected": -362.81415468986387,
"loss": 0.5809,
"loss/base_kto": 3.744293689727783,
"metrics/advantage_var": 230.5392303466797,
"regularization/mmd": 0.903019905090332,
"regularization/rkhs_norm": 173.9922637939453,
"rewards/chosen": 0.14337463871920436,
"rewards/margins": 0.2262163070140908,
"rewards/rejected": -0.08284166829488641,
"step": 560
},
{
"epoch": 0.7512953367875648,
"grad_norm": 18.788639068603516,
"kl": 11.212885856628418,
"learning_rate": 8.890780469678738e-07,
"logits/chosen": -35674151.76699029,
"logits/rejected": -36726842.77945619,
"logps/chosen": -481.4205097087379,
"logps/rejected": -357.83846299093653,
"loss": 0.5732,
"loss/base_kto": 3.6835312843322754,
"metrics/advantage_var": 223.0271453857422,
"regularization/mmd": 0.9017006754875183,
"regularization/rkhs_norm": 173.7380828857422,
"rewards/chosen": 0.14063882673442557,
"rewards/margins": 0.2636975261434725,
"rewards/rejected": -0.12305869940904693,
"step": 580
},
{
"epoch": 0.7772020725388601,
"grad_norm": 14.359786987304688,
"kl": 14.062952041625977,
"learning_rate": 8.800187789691269e-07,
"logits/chosen": -35991686.65443425,
"logits/rejected": -37016252.115015976,
"logps/chosen": -487.0045871559633,
"logps/rejected": -382.6799121405751,
"loss": 0.5835,
"loss/base_kto": 3.7117087841033936,
"metrics/advantage_var": 255.1334991455078,
"regularization/mmd": 0.9565412402153015,
"regularization/rkhs_norm": 184.3046875,
"rewards/chosen": 0.20807981345267107,
"rewards/margins": 0.2725569417953696,
"rewards/rejected": -0.06447712834269856,
"step": 600
},
{
"epoch": 0.8031088082901554,
"grad_norm": 19.544111251831055,
"kl": 11.21495532989502,
"learning_rate": 8.706540215409981e-07,
"logits/chosen": -35774285.04854369,
"logits/rejected": -37030008.652567975,
"logps/chosen": -495.9582322006473,
"logps/rejected": -385.1773508308157,
"loss": 0.5783,
"loss/base_kto": 3.706045627593994,
"metrics/advantage_var": 244.302734375,
"regularization/mmd": 0.9202253222465515,
"regularization/rkhs_norm": 177.30740356445312,
"rewards/chosen": 0.1879773186248483,
"rewards/margins": 0.26639470767916107,
"rewards/rejected": -0.07841738905431281,
"step": 620
},
{
"epoch": 0.8290155440414507,
"grad_norm": 16.922754287719727,
"kl": 10.054945945739746,
"learning_rate": 8.609913028230462e-07,
"logits/chosen": -36098540.517503805,
"logits/rejected": -37637108.494382024,
"logps/chosen": -464.3390410958904,
"logps/rejected": -373.63859349919744,
"loss": 0.5812,
"loss/base_kto": 3.7624480724334717,
"metrics/advantage_var": 218.2515106201172,
"regularization/mmd": 0.887394905090332,
"regularization/rkhs_norm": 170.98167419433594,
"rewards/chosen": 0.10013762638086235,
"rewards/margins": 0.22314770149231272,
"rewards/rejected": -0.12301007511145039,
"step": 640
},
{
"epoch": 0.8549222797927462,
"grad_norm": 19.089248657226562,
"kl": 12.878872871398926,
"learning_rate": 8.510383904798994e-07,
"logits/chosen": -36169354.78101072,
"logits/rejected": -36968578.65390749,
"logps/chosen": -496.31919984686067,
"logps/rejected": -365.0413177830941,
"loss": 0.5829,
"loss/base_kto": 3.7469775676727295,
"metrics/advantage_var": 235.8196258544922,
"regularization/mmd": 0.91584312915802,
"regularization/rkhs_norm": 176.4630126953125,
"rewards/chosen": 0.20673404243784696,
"rewards/margins": 0.21996827066630495,
"rewards/rejected": -0.013234228228457996,
"step": 660
},
{
"epoch": 0.8808290155440415,
"grad_norm": 19.181142807006836,
"kl": 11.222612380981445,
"learning_rate": 8.408032854569865e-07,
"logits/chosen": -36186652.981132075,
"logits/rejected": -36443841.98757764,
"logps/chosen": -485.46098663522014,
"logps/rejected": -365.9584384704969,
"loss": 0.5754,
"loss/base_kto": 3.7289528846740723,
"metrics/advantage_var": 215.1337890625,
"regularization/mmd": 0.8744221925735474,
"regularization/rkhs_norm": 168.4821014404297,
"rewards/chosen": 0.1499655381688532,
"rewards/margins": 0.24829562719298826,
"rewards/rejected": -0.09833008902413505,
"step": 680
},
{
"epoch": 0.9067357512953368,
"grad_norm": 13.612163543701172,
"kl": 8.981104850769043,
"learning_rate": 8.302942155487377e-07,
"logits/chosen": -37335498.06158833,
"logits/rejected": -38093476.48868778,
"logps/chosen": -490.0928383306321,
"logps/rejected": -389.31033182503774,
"loss": 0.5832,
"loss/base_kto": 3.7175660133361816,
"metrics/advantage_var": 278.3384704589844,
"regularization/mmd": 0.9483335614204407,
"regularization/rkhs_norm": 182.72325134277344,
"rewards/chosen": 0.11168753501854994,
"rewards/margins": 0.2646296343812067,
"rewards/rejected": -0.1529420993626567,
"step": 700
},
{
"epoch": 0.9326424870466321,
"grad_norm": 13.148715019226074,
"kl": 11.871718406677246,
"learning_rate": 8.195196287844278e-07,
"logits/chosen": -34459446.35076923,
"logits/rejected": -37675073.015873015,
"logps/chosen": -461.98649038461537,
"logps/rejected": -380.78224206349205,
"loss": 0.5842,
"loss/base_kto": 3.7333762645721436,
"metrics/advantage_var": 250.69200134277344,
"regularization/mmd": 0.939959704875946,
"regularization/rkhs_norm": 181.1097869873047,
"rewards/chosen": 0.21714160625751203,
"rewards/margins": 0.20143503380054667,
"rewards/rejected": 0.01570657245696537,
"step": 720
},
{
"epoch": 0.9585492227979274,
"grad_norm": 14.055625915527344,
"kl": 11.139016151428223,
"learning_rate": 8.08488186636975e-07,
"logits/chosen": -35397003.779141106,
"logits/rejected": -37095710.98089172,
"logps/chosen": -496.9721050613497,
"logps/rejected": -362.6318421576433,
"loss": 0.5852,
"loss/base_kto": 3.7339775562286377,
"metrics/advantage_var": 297.9362487792969,
"regularization/mmd": 0.9475700259208679,
"regularization/rkhs_norm": 182.5761260986328,
"rewards/chosen": 0.17294377051979487,
"rewards/margins": 0.21707383463975344,
"rewards/rejected": -0.044130064119958574,
"step": 740
},
{
"epoch": 0.9844559585492227,
"grad_norm": 14.052969932556152,
"kl": 11.488138198852539,
"learning_rate": 7.972087570601576e-07,
"logits/chosen": -34332419.73419773,
"logits/rejected": -35945729.9306184,
"logps/chosen": -500.45613857374394,
"logps/rejected": -374.53893288084464,
"loss": 0.5881,
"loss/base_kto": 3.779372453689575,
"metrics/advantage_var": 240.10044860839844,
"regularization/mmd": 0.9253013730049133,
"regularization/rkhs_norm": 178.28543090820312,
"rewards/chosen": 0.10344443792655364,
"rewards/margins": 0.178723691027471,
"rewards/rejected": -0.07527925310091735,
"step": 760
},
{
"epoch": 1.0103626943005182,
"grad_norm": 14.608016014099121,
"kl": 8.775541305541992,
"learning_rate": 7.856904073598458e-07,
"logits/chosen": -35473447.63870968,
"logits/rejected": -36471443.84194529,
"logps/chosen": -517.9454637096774,
"logps/rejected": -377.43075607902733,
"loss": 0.5784,
"loss/base_kto": 3.49992299079895,
"metrics/advantage_var": 381.3582458496094,
"regularization/mmd": 1.1271765232086182,
"regularization/rkhs_norm": 217.18235778808594,
"rewards/chosen": 0.1366151625110257,
"rewards/margins": 0.5295594984485257,
"rewards/rejected": -0.3929443359375,
"step": 780
},
{
"epoch": 1.0362694300518134,
"grad_norm": 14.597328186035156,
"kl": 7.6913065910339355,
"learning_rate": 7.739423969049761e-07,
"logits/chosen": -36081680.12598425,
"logits/rejected": -36631226.54263566,
"logps/chosen": -481.8291338582677,
"logps/rejected": -379.1112403100775,
"loss": 0.5746,
"loss/base_kto": 3.2306125164031982,
"metrics/advantage_var": 599.6570434570312,
"regularization/mmd": 1.3662827014923096,
"regularization/rkhs_norm": 263.2529296875,
"rewards/chosen": 0.32224049004982774,
"rewards/margins": 0.8935758257147988,
"rewards/rejected": -0.571335335664971,
"step": 800
},
{
"epoch": 1.0621761658031088,
"grad_norm": 13.44502067565918,
"kl": 6.010591506958008,
"learning_rate": 7.619741696841322e-07,
"logits/chosen": -34946848.58181818,
"logits/rejected": -36547967.174193546,
"logps/chosen": -480.3958806818182,
"logps/rejected": -369.7039314516129,
"loss": 0.5776,
"loss/base_kto": 3.225162982940674,
"metrics/advantage_var": 677.2144165039062,
"regularization/mmd": 1.395242691040039,
"regularization/rkhs_norm": 268.8329162597656,
"rewards/chosen": 0.5056861646247632,
"rewards/margins": 0.895577438369408,
"rewards/rejected": -0.38989127374464466,
"step": 820
},
{
"epoch": 1.0880829015544042,
"grad_norm": 13.183380126953125,
"kl": 14.039239883422852,
"learning_rate": 7.497953467137135e-07,
"logits/chosen": -35152786.57735247,
"logits/rejected": -36525863.595712095,
"logps/chosen": -478.68052232854865,
"logps/rejected": -420.7020960949464,
"loss": 0.5678,
"loss/base_kto": 3.1883442401885986,
"metrics/advantage_var": 562.2630004882812,
"regularization/mmd": 1.3538860082626343,
"regularization/rkhs_norm": 260.8643493652344,
"rewards/chosen": 0.4896285499682267,
"rewards/margins": 0.8697491238445069,
"rewards/rejected": -0.3801205738762802,
"step": 840
},
{
"epoch": 1.1139896373056994,
"grad_norm": 12.155740737915039,
"kl": 9.601874351501465,
"learning_rate": 7.37415718303793e-07,
"logits/chosen": -36049119.5377207,
"logits/rejected": -36852672.09741248,
"logps/chosen": -459.9356942215088,
"logps/rejected": -382.8304794520548,
"loss": 0.5667,
"loss/base_kto": 3.194615364074707,
"metrics/advantage_var": 583.6920166015625,
"regularization/mmd": 1.3391153812408447,
"regularization/rkhs_norm": 258.01837158203125,
"rewards/chosen": 0.46039249426289125,
"rewards/margins": 0.9328118962707157,
"rewards/rejected": -0.4724194020078244,
"step": 860
},
{
"epoch": 1.1398963730569949,
"grad_norm": 15.561748504638672,
"kl": 11.203712463378906,
"learning_rate": 7.248452361878855e-07,
"logits/chosen": -36341135.081571,
"logits/rejected": -37225206.88673139,
"logps/chosen": -475.67909743202415,
"logps/rejected": -379.53094660194176,
"loss": 0.569,
"loss/base_kto": 3.2016074657440186,
"metrics/advantage_var": 608.2510375976562,
"regularization/mmd": 1.3505550622940063,
"regularization/rkhs_norm": 260.2225341796875,
"rewards/chosen": 0.4458746319451001,
"rewards/margins": 0.9215175059622167,
"rewards/rejected": -0.4756428740171167,
"step": 880
},
{
"epoch": 1.16580310880829,
"grad_norm": 16.223711013793945,
"kl": 10.957860946655273,
"learning_rate": 7.120940055229497e-07,
"logits/chosen": -35770295.42064715,
"logits/rejected": -37127124.18383518,
"logps/chosen": -480.1949634052388,
"logps/rejected": -367.9017432646593,
"loss": 0.5646,
"loss/base_kto": 3.2067558765411377,
"metrics/advantage_var": 560.8873291015625,
"regularization/mmd": 1.3101739883422852,
"regularization/rkhs_norm": 252.44200134277344,
"rewards/chosen": 0.5309256390540735,
"rewards/margins": 0.8729425936725487,
"rewards/rejected": -0.34201695461847514,
"step": 900
},
{
"epoch": 1.1917098445595855,
"grad_norm": 14.827778816223145,
"kl": 14.446756362915039,
"learning_rate": 6.991722767660556e-07,
"logits/chosen": -36632868.571428575,
"logits/rejected": -38392632.93312597,
"logps/chosen": -484.8189266091052,
"logps/rejected": -372.49951399688956,
"loss": 0.5655,
"loss/base_kto": 3.1839141845703125,
"metrics/advantage_var": 580.0728759765625,
"regularization/mmd": 1.340128779411316,
"regularization/rkhs_norm": 258.2136535644531,
"rewards/chosen": 0.534545323538069,
"rewards/margins": 0.8950570677272944,
"rewards/rejected": -0.3605117441892253,
"step": 920
},
{
"epoch": 1.2176165803108807,
"grad_norm": 16.71170997619629,
"kl": 13.128976821899414,
"learning_rate": 6.860904374342499e-07,
"logits/chosen": -35226307.43217666,
"logits/rejected": -35626532.45820434,
"logps/chosen": -490.3660291798107,
"logps/rejected": -375.5688370743034,
"loss": 0.5745,
"loss/base_kto": 3.200298309326172,
"metrics/advantage_var": 622.9153442382812,
"regularization/mmd": 1.3953193426132202,
"regularization/rkhs_norm": 268.8476867675781,
"rewards/chosen": 0.5524515819850404,
"rewards/margins": 0.9107014943060543,
"rewards/rejected": -0.35824991232101394,
"step": 940
},
{
"epoch": 1.2435233160621761,
"grad_norm": 12.138189315795898,
"kl": 11.546676635742188,
"learning_rate": 6.7285900375424e-07,
"logits/chosen": -35727222.184663534,
"logits/rejected": -36486733.47893916,
"logps/chosen": -447.2831572769953,
"logps/rejected": -371.9009360374415,
"loss": 0.5629,
"loss/base_kto": 3.164229393005371,
"metrics/advantage_var": 560.22900390625,
"regularization/mmd": 1.338631510734558,
"regularization/rkhs_norm": 257.9251403808594,
"rewards/chosen": 0.4996206555194885,
"rewards/margins": 0.9092353494334169,
"rewards/rejected": -0.4096146939139284,
"step": 960
},
{
"epoch": 1.2694300518134716,
"grad_norm": 15.995272636413574,
"kl": 8.912761688232422,
"learning_rate": 6.594886122086123e-07,
"logits/chosen": -34464722.05128205,
"logits/rejected": -35713276.87804878,
"logps/chosen": -498.4085036057692,
"logps/rejected": -369.6967654344512,
"loss": 0.5657,
"loss/base_kto": 3.212599277496338,
"metrics/advantage_var": 523.2824096679688,
"regularization/mmd": 1.3127588033676147,
"regularization/rkhs_norm": 252.94004821777344,
"rewards/chosen": 0.4278733669183193,
"rewards/margins": 0.8709167733350495,
"rewards/rejected": -0.4430434064167302,
"step": 980
},
{
"epoch": 1.2953367875647668,
"grad_norm": 14.5647611618042,
"kl": 15.449335098266602,
"learning_rate": 6.459900109853766e-07,
"logits/chosen": -35486392.93134329,
"logits/rejected": -36879403.64590164,
"logps/chosen": -495.8786380597015,
"logps/rejected": -389.3173155737705,
"loss": 0.5711,
"loss/base_kto": 3.253002882003784,
"metrics/advantage_var": 533.5360717773438,
"regularization/mmd": 1.31588876247406,
"regularization/rkhs_norm": 253.5431365966797,
"rewards/chosen": 0.5541762622434702,
"rewards/margins": 0.7733676414779092,
"rewards/rejected": -0.21919137923443904,
"step": 1000
},
{
"epoch": 1.3212435233160622,
"grad_norm": 11.143204689025879,
"kl": 6.068701267242432,
"learning_rate": 6.323740513377171e-07,
"logits/chosen": -34305420.28482972,
"logits/rejected": -36479954.776025236,
"logps/chosen": -470.2604972910217,
"logps/rejected": -367.3026666009464,
"loss": 0.5654,
"loss/base_kto": 3.286928653717041,
"metrics/advantage_var": 501.8526306152344,
"regularization/mmd": 1.2363615036010742,
"regularization/rkhs_norm": 238.219970703125,
"rewards/chosen": 0.3501069154532701,
"rewards/margins": 0.8025213468597665,
"rewards/rejected": -0.45241443140649645,
"step": 1020
},
{
"epoch": 1.3471502590673574,
"grad_norm": 15.586249351501465,
"kl": 15.317721366882324,
"learning_rate": 6.186516788608865e-07,
"logits/chosen": -35702237.86666667,
"logits/rejected": -35553676.38709678,
"logps/chosen": -501.6375946969697,
"logps/rejected": -366.27615927419356,
"loss": 0.5631,
"loss/base_kto": 3.1214816570281982,
"metrics/advantage_var": 617.6486206054688,
"regularization/mmd": 1.3834471702575684,
"regularization/rkhs_norm": 266.5601501464844,
"rewards/chosen": 0.6193990071614583,
"rewards/margins": 0.9554227439306116,
"rewards/rejected": -0.3360237367691532,
"step": 1040
},
{
"epoch": 1.3730569948186528,
"grad_norm": 13.858671188354492,
"kl": 16.675804138183594,
"learning_rate": 6.048339246932652e-07,
"logits/chosen": -35363947.70486656,
"logits/rejected": -37440886.24572317,
"logps/chosen": -506.073489010989,
"logps/rejected": -372.9756026438569,
"loss": 0.5719,
"loss/base_kto": 3.223862409591675,
"metrics/advantage_var": 569.9444580078125,
"regularization/mmd": 1.3512192964553833,
"regularization/rkhs_norm": 260.35052490234375,
"rewards/chosen": 0.5281324641109448,
"rewards/margins": 0.8282414730898523,
"rewards/rejected": -0.30010900897890747,
"step": 1060
},
{
"epoch": 1.3989637305699483,
"grad_norm": 13.420823097229004,
"kl": 15.193489074707031,
"learning_rate": 5.909318966486494e-07,
"logits/chosen": -34836834.52241113,
"logits/rejected": -36498155.37440758,
"logps/chosen": -470.3858191653787,
"logps/rejected": -374.23514020537124,
"loss": 0.5633,
"loss/base_kto": 3.220278263092041,
"metrics/advantage_var": 524.41015625,
"regularization/mmd": 1.2857328653335571,
"regularization/rkhs_norm": 247.7327423095703,
"rewards/chosen": 0.5431538836849159,
"rewards/margins": 0.8286780802192761,
"rewards/rejected": -0.2855241965343602,
"step": 1080
},
{
"epoch": 1.4248704663212435,
"grad_norm": 11.169465065002441,
"kl": 8.387614250183105,
"learning_rate": 5.769567702869052e-07,
"logits/chosen": -34593283.22012579,
"logits/rejected": -35831591.7515528,
"logps/chosen": -466.9943003144654,
"logps/rejected": -374.63994565217394,
"loss": 0.5679,
"loss/base_kto": 3.2649879455566406,
"metrics/advantage_var": 483.4437561035156,
"regularization/mmd": 1.2778500318527222,
"regularization/rkhs_norm": 246.2138671875,
"rewards/chosen": 0.4452309278572131,
"rewards/margins": 0.8021823393236338,
"rewards/rejected": -0.3569514114664208,
"step": 1100
},
{
"epoch": 1.450777202072539,
"grad_norm": 12.55168342590332,
"kl": 11.815613746643066,
"learning_rate": 5.629197799301614e-07,
"logits/chosen": -34086599.155905515,
"logits/rejected": -35980746.81550387,
"logps/chosen": -475.75600393700785,
"logps/rejected": -380.1451065891473,
"loss": 0.569,
"loss/base_kto": 3.2363297939300537,
"metrics/advantage_var": 604.4345092773438,
"regularization/mmd": 1.3159685134887695,
"regularization/rkhs_norm": 253.5584716796875,
"rewards/chosen": 0.44834589920644685,
"rewards/margins": 0.8243316879509963,
"rewards/rejected": -0.3759857887445494,
"step": 1120
},
{
"epoch": 1.4766839378238341,
"grad_norm": 15.806407928466797,
"kl": 8.803001403808594,
"learning_rate": 5.488322096317633e-07,
"logits/chosen": -34337923.11183144,
"logits/rejected": -37926173.73152338,
"logps/chosen": -480.3818881685575,
"logps/rejected": -365.2533700980392,
"loss": 0.5594,
"loss/base_kto": 3.1876957416534424,
"metrics/advantage_var": 515.0336303710938,
"regularization/mmd": 1.2876020669937134,
"regularization/rkhs_norm": 248.0928955078125,
"rewards/chosen": 0.4363956296849676,
"rewards/margins": 0.8824412420029115,
"rewards/rejected": -0.446045612317944,
"step": 1140
},
{
"epoch": 1.5025906735751295,
"grad_norm": 13.409736633300781,
"kl": 11.580401420593262,
"learning_rate": 5.347053841052518e-07,
"logits/chosen": -34767339.25445705,
"logits/rejected": -35640914.63046757,
"logps/chosen": -489.12662074554294,
"logps/rejected": -372.7496700603318,
"loss": 0.5609,
"loss/base_kto": 3.2315571308135986,
"metrics/advantage_var": 491.1260681152344,
"regularization/mmd": 1.2559025287628174,
"regularization/rkhs_norm": 241.9850616455078,
"rewards/chosen": 0.48537050615060273,
"rewards/margins": 0.8391282234615356,
"rewards/rejected": -0.3537577173109328,
"step": 1160
},
{
"epoch": 1.528497409326425,
"grad_norm": 14.48072624206543,
"kl": 10.842148780822754,
"learning_rate": 5.205506596206531e-07,
"logits/chosen": -34132429.74233129,
"logits/rejected": -36569577.171974525,
"logps/chosen": -489.0885736196319,
"logps/rejected": -384.1238057324841,
"loss": 0.5747,
"loss/base_kto": 3.2510056495666504,
"metrics/advantage_var": 608.0940551757812,
"regularization/mmd": 1.3465982675552368,
"regularization/rkhs_norm": 259.4601745605469,
"rewards/chosen": 0.4769764999670485,
"rewards/margins": 0.817667404329235,
"rewards/rejected": -0.3406909043621865,
"step": 1180
},
{
"epoch": 1.5544041450777202,
"grad_norm": 13.27139663696289,
"kl": 9.682214736938477,
"learning_rate": 5.063794148754032e-07,
"logits/chosen": -34232928.9514867,
"logits/rejected": -35218769.07332293,
"logps/chosen": -471.99897300469485,
"logps/rejected": -385.6353110374415,
"loss": 0.5618,
"loss/base_kto": 3.20005202293396,
"metrics/advantage_var": 541.8212890625,
"regularization/mmd": 1.2941473722457886,
"regularization/rkhs_norm": 249.35403442382812,
"rewards/chosen": 0.4603751933257531,
"rewards/margins": 0.8822661900593725,
"rewards/rejected": -0.42189099673361935,
"step": 1200
},
{
"epoch": 1.5803108808290154,
"grad_norm": 10.266549110412598,
"kl": 8.075851440429688,
"learning_rate": 4.922030418472422e-07,
"logits/chosen": -34897622.81388012,
"logits/rejected": -35043112.421052635,
"logps/chosen": -473.31254929022083,
"logps/rejected": -412.2219427244582,
"loss": 0.571,
"loss/base_kto": 3.2248382568359375,
"metrics/advantage_var": 638.4703369140625,
"regularization/mmd": 1.3433607816696167,
"regularization/rkhs_norm": 258.8363952636719,
"rewards/chosen": 0.40739460171961256,
"rewards/margins": 0.8605293333312127,
"rewards/rejected": -0.4531347316116002,
"step": 1220
},
{
"epoch": 1.6062176165803108,
"grad_norm": 9.42730712890625,
"kl": 9.281641960144043,
"learning_rate": 4.780329366364336e-07,
"logits/chosen": -35156001.96351575,
"logits/rejected": -36589816.05908419,
"logps/chosen": -495.7744092039801,
"logps/rejected": -352.54712887740027,
"loss": 0.568,
"loss/base_kto": 3.2109742164611816,
"metrics/advantage_var": 651.4511108398438,
"regularization/mmd": 1.3327293395996094,
"regularization/rkhs_norm": 256.7879333496094,
"rewards/chosen": 0.383702798466975,
"rewards/margins": 0.861857216150113,
"rewards/rejected": -0.47815441768313793,
"step": 1240
},
{
"epoch": 1.6321243523316062,
"grad_norm": 15.535483360290527,
"kl": 9.601252555847168,
"learning_rate": 4.638804903046684e-07,
"logits/chosen": -34077212.746585734,
"logits/rejected": -33392696.06441224,
"logps/chosen": -507.0222875569044,
"logps/rejected": -412.6364985909823,
"loss": 0.5663,
"loss/base_kto": 3.186985492706299,
"metrics/advantage_var": 593.4682006835938,
"regularization/mmd": 1.3430308103561401,
"regularization/rkhs_norm": 258.7727966308594,
"rewards/chosen": 0.4009834717908289,
"rewards/margins": 0.904778855999766,
"rewards/rejected": -0.5037953842089372,
"step": 1260
},
{
"epoch": 1.6580310880829017,
"grad_norm": 12.554241180419922,
"kl": 11.170215606689453,
"learning_rate": 4.497570797180217e-07,
"logits/chosen": -34870943.34281201,
"logits/rejected": -35789442.57187017,
"logps/chosen": -494.6497334123223,
"logps/rejected": -384.8082496136012,
"loss": 0.5706,
"loss/base_kto": 3.247715473175049,
"metrics/advantage_var": 565.27490234375,
"regularization/mmd": 1.3169947862625122,
"regularization/rkhs_norm": 253.75621032714844,
"rewards/chosen": 0.446243069183205,
"rewards/margins": 0.8005949324252113,
"rewards/rejected": -0.35435186324200635,
"step": 1280
},
{
"epoch": 1.6839378238341969,
"grad_norm": 10.809260368347168,
"kl": 11.35492992401123,
"learning_rate": 4.3567405840131853e-07,
"logits/chosen": -34217530.95757576,
"logits/rejected": -36857063.22580645,
"logps/chosen": -499.0260890151515,
"logps/rejected": -359.84964717741934,
"loss": 0.5584,
"loss/base_kto": 3.232714891433716,
"metrics/advantage_var": 445.6983337402344,
"regularization/mmd": 1.234392523765564,
"regularization/rkhs_norm": 237.840576171875,
"rewards/chosen": 0.4778497869318182,
"rewards/margins": 0.8051091705948726,
"rewards/rejected": -0.32725938366305446,
"step": 1300
},
{
"epoch": 1.709844559585492,
"grad_norm": 13.519683837890625,
"kl": 18.970869064331055,
"learning_rate": 4.2164274741126506e-07,
"logits/chosen": -32272567.87616099,
"logits/rejected": -35914635.70977918,
"logps/chosen": -501.64014125386996,
"logps/rejected": -358.21978509463725,
"loss": 0.5773,
"loss/base_kto": 3.1998229026794434,
"metrics/advantage_var": 968.603515625,
"regularization/mmd": 1.4182510375976562,
"regularization/rkhs_norm": 273.26611328125,
"rewards/chosen": 0.6546994613789183,
"rewards/margins": 0.8154330062430313,
"rewards/rejected": -0.160733544864113,
"step": 1320
},
{
"epoch": 1.7357512953367875,
"grad_norm": 11.478642463684082,
"kl": 11.4176025390625,
"learning_rate": 4.0767442623567856e-07,
"logits/chosen": -33646541.587692305,
"logits/rejected": -36106067.70793651,
"logps/chosen": -487.5895192307692,
"logps/rejected": -366.80401785714287,
"loss": 0.5602,
"loss/base_kto": 3.179579496383667,
"metrics/advantage_var": 534.3556518554688,
"regularization/mmd": 1.302286982536316,
"regularization/rkhs_norm": 250.92234802246094,
"rewards/chosen": 0.5370872614933895,
"rewards/margins": 0.8848675194298974,
"rewards/rejected": -0.34778025793650796,
"step": 1340
},
{
"epoch": 1.761658031088083,
"grad_norm": 14.537354469299316,
"kl": 11.186471939086914,
"learning_rate": 3.937803237261357e-07,
"logits/chosen": -35295880.26456693,
"logits/rejected": -36673574.10232558,
"logps/chosen": -475.64936023622045,
"logps/rejected": -375.23214631782946,
"loss": 0.565,
"loss/base_kto": 3.2556397914886475,
"metrics/advantage_var": 500.22979736328125,
"regularization/mmd": 1.2640533447265625,
"regularization/rkhs_norm": 243.55557250976562,
"rewards/chosen": 0.43695981483759844,
"rewards/margins": 0.8345817621335044,
"rewards/rejected": -0.397621947295906,
"step": 1360
},
{
"epoch": 1.7875647668393784,
"grad_norm": 14.746607780456543,
"kl": 16.326108932495117,
"learning_rate": 3.7997160907132456e-07,
"logits/chosen": -35028851.63862928,
"logits/rejected": -35513321.52978057,
"logps/chosen": -484.29994158878503,
"logps/rejected": -359.69080623040753,
"loss": 0.5635,
"loss/base_kto": 3.145965576171875,
"metrics/advantage_var": 570.2919311523438,
"regularization/mmd": 1.3619108200073242,
"regularization/rkhs_norm": 262.41058349609375,
"rewards/chosen": 0.6024724181938765,
"rewards/margins": 0.941774935597506,
"rewards/rejected": -0.3393025174036295,
"step": 1380
},
{
"epoch": 1.8134715025906736,
"grad_norm": 10.006362915039062,
"kl": 11.556924819946289,
"learning_rate": 3.662593828183601e-07,
"logits/chosen": -34959923.36569579,
"logits/rejected": -35546882.32024169,
"logps/chosen": -483.86792071197414,
"logps/rejected": -388.843773602719,
"loss": 0.5568,
"loss/base_kto": 3.178264617919922,
"metrics/advantage_var": 510.99249267578125,
"regularization/mmd": 1.2762376070022583,
"regularization/rkhs_norm": 245.90322875976562,
"rewards/chosen": 0.48347492897009003,
"rewards/margins": 0.8942438354856206,
"rewards/rejected": -0.4107689065155306,
"step": 1400
},
{
"epoch": 1.8393782383419688,
"grad_norm": 14.284242630004883,
"kl": 13.512750625610352,
"learning_rate": 3.5265466794927725e-07,
"logits/chosen": -33485100.710973725,
"logits/rejected": -33434664.44233807,
"logps/chosen": -455.9562403400309,
"logps/rejected": -382.1572126777251,
"loss": 0.5555,
"loss/base_kto": 3.187201738357544,
"metrics/advantage_var": 497.49542236328125,
"regularization/mmd": 1.256669282913208,
"regularization/rkhs_norm": 242.1328125,
"rewards/chosen": 0.4644394746335249,
"rewards/margins": 0.8592076818159646,
"rewards/rejected": -0.39476820718243977,
"step": 1420
},
{
"epoch": 1.8652849740932642,
"grad_norm": 21.990886688232422,
"kl": 13.477426528930664,
"learning_rate": 3.3916840101987887e-07,
"logits/chosen": -35016842.24803767,
"logits/rejected": -36510769.36858476,
"logps/chosen": -492.2745290423862,
"logps/rejected": -378.68818040435457,
"loss": 0.5612,
"loss/base_kto": 3.203294515609741,
"metrics/advantage_var": 535.4396362304688,
"regularization/mmd": 1.2866798639297485,
"regularization/rkhs_norm": 247.9152069091797,
"rewards/chosen": 0.5291542999411303,
"rewards/margins": 0.8422502232862896,
"rewards/rejected": -0.3130959233451594,
"step": 1440
},
{
"epoch": 1.8911917098445596,
"grad_norm": 14.122488975524902,
"kl": 14.161651611328125,
"learning_rate": 3.258114233680583e-07,
"logits/chosen": -34305510.4,
"logits/rejected": -35749548.8,
"logps/chosen": -478.6404296875,
"logps/rejected": -374.73798828125,
"loss": 0.5718,
"loss/base_kto": 3.222114324569702,
"metrics/advantage_var": 584.7927856445312,
"regularization/mmd": 1.3520044088363647,
"regularization/rkhs_norm": 260.5018005371094,
"rewards/chosen": 0.48429231643676757,
"rewards/margins": 0.8469077110290527,
"rewards/rejected": -0.36261539459228515,
"step": 1460
},
{
"epoch": 1.917098445595855,
"grad_norm": 11.841097831726074,
"kl": 16.10405921936035,
"learning_rate": 3.1259447239866796e-07,
"logits/chosen": -35767966.02469136,
"logits/rejected": -35548892.35443038,
"logps/chosen": -462.54591049382714,
"logps/rejected": -370.9122577136076,
"loss": 0.5642,
"loss/base_kto": 3.18354868888855,
"metrics/advantage_var": 535.4041748046875,
"regularization/mmd": 1.3298248052597046,
"regularization/rkhs_norm": 256.228271484375,
"rewards/chosen": 0.5445183177053192,
"rewards/margins": 0.877083842615389,
"rewards/rejected": -0.33256552491006974,
"step": 1480
},
{
"epoch": 1.9430051813471503,
"grad_norm": 11.20692253112793,
"kl": 14.479681968688965,
"learning_rate": 2.9952817295193435e-07,
"logits/chosen": -33587540.29268292,
"logits/rejected": -34997740.307692304,
"logps/chosen": -472.9408346036585,
"logps/rejected": -375.51016626602564,
"loss": 0.5548,
"loss/base_kto": 3.1923911571502686,
"metrics/advantage_var": 489.254638671875,
"regularization/mmd": 1.2462199926376343,
"regularization/rkhs_norm": 240.1194305419922,
"rewards/chosen": 0.6118030082888719,
"rewards/margins": 0.8673452498988854,
"rewards/rejected": -0.25554224161001354,
"step": 1500
},
{
"epoch": 1.9689119170984455,
"grad_norm": 11.861700057983398,
"kl": 12.703452110290527,
"learning_rate": 2.866230287623651e-07,
"logits/chosen": -34238559.639291465,
"logits/rejected": -36946728.0121396,
"logps/chosen": -497.42340982286635,
"logps/rejected": -356.5920428679818,
"loss": 0.5542,
"loss/base_kto": 3.2080001831054688,
"metrics/advantage_var": 460.76611328125,
"regularization/mmd": 1.2256393432617188,
"regularization/rkhs_norm": 236.154052734375,
"rewards/chosen": 0.526352149852808,
"rewards/margins": 0.8376644186786806,
"rewards/rejected": -0.31131226882587254,
"step": 1520
},
{
"epoch": 1.994818652849741,
"grad_norm": 10.996031761169434,
"kl": 11.139498710632324,
"learning_rate": 2.738894140150075e-07,
"logits/chosen": -33521878.913580246,
"logits/rejected": -34998809.92405064,
"logps/chosen": -442.2758487654321,
"logps/rejected": -375.3325257120253,
"loss": 0.5695,
"loss/base_kto": 3.2456352710723877,
"metrics/advantage_var": 592.4486083984375,
"regularization/mmd": 1.3107349872589111,
"regularization/rkhs_norm": 252.5500946044922,
"rewards/chosen": 0.4672075907389323,
"rewards/margins": 0.8383880164552842,
"rewards/rejected": -0.37118042571635185,
"step": 1540
},
{
"epoch": 2.0207253886010363,
"grad_norm": 12.017375946044922,
"kl": 14.11705493927002,
"learning_rate": 2.6133756500585156e-07,
"logits/chosen": -34685571.75244299,
"logits/rejected": -34988796.915662654,
"logps/chosen": -450.93622760586317,
"logps/rejected": -354.99595256024094,
"loss": 0.5464,
"loss/base_kto": 3.1940011978149414,
"metrics/advantage_var": 723.1547241210938,
"regularization/mmd": 1.1770918369293213,
"regularization/rkhs_norm": 226.79995727539062,
"rewards/chosen": 0.4711724197437398,
"rewards/margins": 0.7959710496883228,
"rewards/rejected": -0.32479862994458303,
"step": 1560
},
{
"epoch": 2.0466321243523318,
"grad_norm": 10.234877586364746,
"kl": 8.539804458618164,
"learning_rate": 2.489775719130767e-07,
"logits/chosen": -34224039.09457365,
"logits/rejected": -35279921.99055118,
"logps/chosen": -482.2390503875969,
"logps/rejected": -387.03179133858265,
"loss": 0.5327,
"loss/base_kto": 3.124056577682495,
"metrics/advantage_var": 364.8231201171875,
"regularization/mmd": 1.1374704837799072,
"regularization/rkhs_norm": 219.16580200195312,
"rewards/chosen": 0.47338261567344964,
"rewards/margins": 0.930632102401427,
"rewards/rejected": -0.4572494867279774,
"step": 1580
},
{
"epoch": 2.0725388601036268,
"grad_norm": 9.447223663330078,
"kl": 7.858912944793701,
"learning_rate": 2.3681937068576303e-07,
"logits/chosen": -34184481.320634924,
"logits/rejected": -36332840.17230769,
"logps/chosen": -487.9683531746032,
"logps/rejected": -358.2747355769231,
"loss": 0.5312,
"loss/base_kto": 3.1154003143310547,
"metrics/advantage_var": 365.167724609375,
"regularization/mmd": 1.1340020895004272,
"regularization/rkhs_norm": 218.4975128173828,
"rewards/chosen": 0.4642588781932044,
"rewards/margins": 0.921900385855464,
"rewards/rejected": -0.45764150766225964,
"step": 1600
},
{
"epoch": 2.098445595854922,
"grad_norm": 11.296177864074707,
"kl": 8.442159652709961,
"learning_rate": 2.2487273505658e-07,
"logits/chosen": -34541226.139103554,
"logits/rejected": -35661176.92259084,
"logps/chosen": -465.1571193972179,
"logps/rejected": -385.75661532385465,
"loss": 0.5339,
"loss/base_kto": 3.1327946186065674,
"metrics/advantage_var": 385.8008728027344,
"regularization/mmd": 1.1381915807724,
"regularization/rkhs_norm": 219.3047332763672,
"rewards/chosen": 0.4784832678769803,
"rewards/margins": 0.914495331046535,
"rewards/rejected": -0.4360120631695547,
"step": 1620
},
{
"epoch": 2.1243523316062176,
"grad_norm": 9.192686080932617,
"kl": 9.473230361938477,
"learning_rate": 2.131472686848817e-07,
"logits/chosen": -34542063.1880597,
"logits/rejected": -35455271.44918033,
"logps/chosen": -486.3051305970149,
"logps/rejected": -387.897925204918,
"loss": 0.5317,
"loss/base_kto": 3.0982487201690674,
"metrics/advantage_var": 408.5754089355469,
"regularization/mmd": 1.1551413536071777,
"regularization/rkhs_norm": 222.5706024169922,
"rewards/chosen": 0.4941988816901819,
"rewards/margins": 0.9388071260389268,
"rewards/rejected": -0.44460824434874485,
"step": 1640
},
{
"epoch": 2.150259067357513,
"grad_norm": 8.646968841552734,
"kl": 15.39623737335205,
"learning_rate": 2.016523974365188e-07,
"logits/chosen": -32979905.840255592,
"logits/rejected": -36205458.39755352,
"logps/chosen": -466.7436102236422,
"logps/rejected": -366.65125668960246,
"loss": 0.5299,
"loss/base_kto": 3.0637404918670654,
"metrics/advantage_var": 391.736572265625,
"regularization/mmd": 1.1757006645202637,
"regularization/rkhs_norm": 226.5319061279297,
"rewards/chosen": 0.6177439339244708,
"rewards/margins": 0.9501236629358432,
"rewards/rejected": -0.3323797290113723,
"step": 1660
},
{
"epoch": 2.1761658031088085,
"grad_norm": 11.392359733581543,
"kl": 12.8080472946167,
"learning_rate": 1.9039736180657372e-07,
"logits/chosen": -34391432.91259259,
"logits/rejected": -34560064.31735537,
"logps/chosen": -487.67699074074073,
"logps/rejected": -379.25206611570246,
"loss": 0.5266,
"loss/base_kto": 3.076906204223633,
"metrics/advantage_var": 373.26593017578125,
"regularization/mmd": 1.1360769271850586,
"regularization/rkhs_norm": 218.8972625732422,
"rewards/chosen": 0.5498810944733796,
"rewards/margins": 0.9218989470043714,
"rewards/rejected": -0.37201785253099173,
"step": 1680
},
{
"epoch": 2.2020725388601035,
"grad_norm": 12.47360897064209,
"kl": 16.97549819946289,
"learning_rate": 1.7939120949111498e-07,
"logits/chosen": -34634272.405063294,
"logits/rejected": -35292596.14814815,
"logps/chosen": -485.03060719936707,
"logps/rejected": -370.6174527391975,
"loss": 0.5237,
"loss/base_kto": 3.0509536266326904,
"metrics/advantage_var": 388.0455322265625,
"regularization/mmd": 1.138675332069397,
"regularization/rkhs_norm": 219.39794921875,
"rewards/chosen": 0.6157732130605963,
"rewards/margins": 0.9683371417353648,
"rewards/rejected": -0.35256392867476855,
"step": 1700
},
{
"epoch": 2.227979274611399,
"grad_norm": 9.188547134399414,
"kl": 11.431300163269043,
"learning_rate": 1.6864278811393523e-07,
"logits/chosen": -33846622.01589825,
"logits/rejected": -36931958.3655914,
"logps/chosen": -496.81508346581876,
"logps/rejected": -351.578125,
"loss": 0.5248,
"loss/base_kto": 3.1210286617279053,
"metrics/advantage_var": 336.357666015625,
"regularization/mmd": 1.077267050743103,
"regularization/rkhs_norm": 207.56591796875,
"rewards/chosen": 0.49792203918359995,
"rewards/margins": 0.8834565805817494,
"rewards/rejected": -0.38553454139814947,
"step": 1720
},
{
"epoch": 2.2538860103626943,
"grad_norm": 9.713398933410645,
"kl": 11.883028984069824,
"learning_rate": 1.5816073811412584e-07,
"logits/chosen": -33889109.0719755,
"logits/rejected": -34294579.85326954,
"logps/chosen": -480.3625574272588,
"logps/rejected": -387.71730462519935,
"loss": 0.5246,
"loss/base_kto": 3.0617434978485107,
"metrics/advantage_var": 368.1744689941406,
"regularization/mmd": 1.1350570917129517,
"regularization/rkhs_norm": 218.70079040527344,
"rewards/chosen": 0.5901486453747129,
"rewards/margins": 0.9540277868096212,
"rewards/rejected": -0.3638791414349083,
"step": 1740
},
{
"epoch": 2.2797927461139897,
"grad_norm": 11.076713562011719,
"kl": 12.0452880859375,
"learning_rate": 1.4795348580020207e-07,
"logits/chosen": -33272275.2,
"logits/rejected": -35163008.0,
"logps/chosen": -503.425390625,
"logps/rejected": -401.28505859375,
"loss": 0.5246,
"loss/base_kto": 3.06697940826416,
"metrics/advantage_var": 361.0828857421875,
"regularization/mmd": 1.1299915313720703,
"regularization/rkhs_norm": 217.72476196289062,
"rewards/chosen": 0.5445161819458008,
"rewards/margins": 0.9467146396636963,
"rewards/rejected": -0.40219845771789553,
"step": 1760
},
{
"epoch": 2.305699481865285,
"grad_norm": 9.097661972045898,
"kl": 14.0631742477417,
"learning_rate": 1.3802923657636355e-07,
"logits/chosen": -35050913.42675159,
"logits/rejected": -35578766.9202454,
"logps/chosen": -496.2229796974522,
"logps/rejected": -370.4764426763804,
"loss": 0.5253,
"loss/base_kto": 3.037888288497925,
"metrics/advantage_var": 412.54736328125,
"regularization/mmd": 1.1644972562789917,
"regularization/rkhs_norm": 224.37327575683594,
"rewards/chosen": 0.5647124272243232,
"rewards/margins": 0.9833096895541737,
"rewards/rejected": -0.41859726232985045,
"step": 1780
},
{
"epoch": 2.33160621761658,
"grad_norm": 10.079657554626465,
"kl": 13.203523635864258,
"learning_rate": 1.28395968346336e-07,
"logits/chosen": -33831678.38993711,
"logits/rejected": -36057851.229813665,
"logps/chosen": -480.44192216981133,
"logps/rejected": -372.98456909937886,
"loss": 0.5271,
"loss/base_kto": 3.1184487342834473,
"metrics/advantage_var": 335.4075012207031,
"regularization/mmd": 1.0987217426300049,
"regularization/rkhs_norm": 211.69973754882812,
"rewards/chosen": 0.5416550546322229,
"rewards/margins": 0.8963459381028411,
"rewards/rejected": -0.3546908834706182,
"step": 1800
},
{
"epoch": 2.3575129533678756,
"grad_norm": 8.813055992126465,
"kl": 14.720227241516113,
"learning_rate": 1.1906142510009415e-07,
"logits/chosen": -33851448.79608483,
"logits/rejected": -36096592.59970015,
"logps/chosen": -462.68943719412727,
"logps/rejected": -380.2259651424288,
"loss": 0.5219,
"loss/base_kto": 3.045072317123413,
"metrics/advantage_var": 368.2608947753906,
"regularization/mmd": 1.1300747394561768,
"regularization/rkhs_norm": 217.7407684326172,
"rewards/chosen": 0.5551960433287877,
"rewards/margins": 0.9650930540519418,
"rewards/rejected": -0.40989701072315404,
"step": 1820
},
{
"epoch": 2.383419689119171,
"grad_norm": 7.799367904663086,
"kl": 13.704968452453613,
"learning_rate": 1.1003311068862547e-07,
"logits/chosen": -33670361.403076924,
"logits/rejected": -35210587.83492064,
"logps/chosen": -476.4866826923077,
"logps/rejected": -369.2220238095238,
"loss": 0.5257,
"loss/base_kto": 3.0902602672576904,
"metrics/advantage_var": 345.37432861328125,
"regularization/mmd": 1.1155065298080444,
"regularization/rkhs_norm": 214.933837890625,
"rewards/chosen": 0.5661159104567308,
"rewards/margins": 0.9428646645644937,
"rewards/rejected": -0.3767487541077629,
"step": 1840
},
{
"epoch": 2.4093264248704664,
"grad_norm": 10.140314102172852,
"kl": 13.442036628723145,
"learning_rate": 1.0131828279173588e-07,
"logits/chosen": -33691455.426865675,
"logits/rejected": -36494064.05245902,
"logps/chosen": -480.81194029850747,
"logps/rejected": -392.9032786885246,
"loss": 0.5286,
"loss/base_kto": 3.090826988220215,
"metrics/advantage_var": 369.5147399902344,
"regularization/mmd": 1.1379073858261108,
"regularization/rkhs_norm": 219.2499542236328,
"rewards/chosen": 0.5957055846256997,
"rewards/margins": 0.9382153702622262,
"rewards/rejected": -0.3425097856365266,
"step": 1860
},
{
"epoch": 2.4352331606217614,
"grad_norm": 10.38778305053711,
"kl": 17.994678497314453,
"learning_rate": 9.292394708374596e-08,
"logits/chosen": -33399107.53870458,
"logits/rejected": -34088193.978361666,
"logps/chosen": -497.71800947867297,
"logps/rejected": -372.41344667697064,
"loss": 0.5246,
"loss/base_kto": 3.0352418422698975,
"metrics/advantage_var": 384.9737548828125,
"regularization/mmd": 1.1616432666778564,
"regularization/rkhs_norm": 223.82334899902344,
"rewards/chosen": 0.641728646758985,
"rewards/margins": 0.9633187106883585,
"rewards/rejected": -0.32159006392937356,
"step": 1880
},
{
"epoch": 2.461139896373057,
"grad_norm": 10.558876037597656,
"kl": 10.543036460876465,
"learning_rate": 8.48568516017727e-08,
"logits/chosen": -34688667.82608695,
"logits/rejected": -34654745.89233279,
"logps/chosen": -485.84623313343326,
"logps/rejected": -389.13116843393146,
"loss": 0.5343,
"loss/base_kto": 3.105327844619751,
"metrics/advantage_var": 405.47283935546875,
"regularization/mmd": 1.168981909751892,
"regularization/rkhs_norm": 225.2373809814453,
"rewards/chosen": 0.576544399919181,
"rewards/margins": 0.94182358049881,
"rewards/rejected": -0.3652791805796289,
"step": 1900
},
{
"epoch": 2.4870466321243523,
"grad_norm": 10.592312812805176,
"kl": 11.316069602966309,
"learning_rate": 7.71234813211169e-08,
"logits/chosen": -33639102.45410628,
"logits/rejected": -35165608.20637329,
"logps/chosen": -465.92391304347825,
"logps/rejected": -374.7020106221548,
"loss": 0.5247,
"loss/base_kto": 3.09100341796875,
"metrics/advantage_var": 351.59423828125,
"regularization/mmd": 1.106646180152893,
"regularization/rkhs_norm": 213.2266387939453,
"rewards/chosen": 0.5346256077961453,
"rewards/margins": 0.9385559013872873,
"rewards/rejected": -0.4039302935911419,
"step": 1920
},
{
"epoch": 2.5129533678756477,
"grad_norm": 10.205567359924316,
"kl": 11.071531295776367,
"learning_rate": 6.973005294212353e-08,
"logits/chosen": -35240677.3006135,
"logits/rejected": -35846088.560509555,
"logps/chosen": -466.9605061349693,
"logps/rejected": -395.4638236464968,
"loss": 0.5236,
"loss/base_kto": 3.1130788326263428,
"metrics/advantage_var": 335.3868713378906,
"regularization/mmd": 1.075851321220398,
"regularization/rkhs_norm": 207.29312133789062,
"rewards/chosen": 0.48531617708732744,
"rewards/margins": 0.9047721244773552,
"rewards/rejected": -0.41945594739002784,
"step": 1940
},
{
"epoch": 2.538860103626943,
"grad_norm": 10.455536842346191,
"kl": 12.735307693481445,
"learning_rate": 6.268250989270102e-08,
"logits/chosen": -35146073.681528665,
"logits/rejected": -36103990.969325155,
"logps/chosen": -486.9891520700637,
"logps/rejected": -376.17575728527606,
"loss": 0.5325,
"loss/base_kto": 3.1449241638183594,
"metrics/advantage_var": 377.4090270996094,
"regularization/mmd": 1.1152721643447876,
"regularization/rkhs_norm": 214.888671875,
"rewards/chosen": 0.5238154708959495,
"rewards/margins": 0.8699280088650589,
"rewards/rejected": -0.34611253796910946,
"step": 1960
},
{
"epoch": 2.5647668393782386,
"grad_norm": 8.617021560668945,
"kl": 11.457000732421875,
"learning_rate": 5.598651755051975e-08,
"logits/chosen": -34510007.63525836,
"logits/rejected": -36185081.414790995,
"logps/chosen": -488.3011968085106,
"logps/rejected": -383.1957897909968,
"loss": 0.5276,
"loss/base_kto": 3.0414016246795654,
"metrics/advantage_var": 402.95172119140625,
"regularization/mmd": 1.1797621250152588,
"regularization/rkhs_norm": 227.314453125,
"rewards/chosen": 0.55588737882017,
"rewards/margins": 0.9902694341702253,
"rewards/rejected": -0.43438205535005525,
"step": 1980
},
{
"epoch": 2.5906735751295336,
"grad_norm": 16.12910270690918,
"kl": 10.265693664550781,
"learning_rate": 4.964745868872933e-08,
"logits/chosen": -33452939.14714715,
"logits/rejected": -35558836.95114007,
"logps/chosen": -485.3864958708709,
"logps/rejected": -371.22546824104234,
"loss": 0.5336,
"loss/base_kto": 3.081040382385254,
"metrics/advantage_var": 421.461181640625,
"regularization/mmd": 1.1879180669784546,
"regularization/rkhs_norm": 228.8859405517578,
"rewards/chosen": 0.5901449850729635,
"rewards/margins": 0.9668989257173675,
"rewards/rejected": -0.376753940644404,
"step": 2000
},
{
"epoch": 2.616580310880829,
"grad_norm": 9.409523010253906,
"kl": 12.09470272064209,
"learning_rate": 4.3670429148855493e-08,
"logits/chosen": -34416567.86523736,
"logits/rejected": -35170372.59330144,
"logps/chosen": -488.333221669219,
"logps/rejected": -369.500274122807,
"loss": 0.531,
"loss/base_kto": 3.099996328353882,
"metrics/advantage_var": 377.51416015625,
"regularization/mmd": 1.1477069854736328,
"regularization/rkhs_norm": 221.13816833496094,
"rewards/chosen": 0.6344299783750479,
"rewards/margins": 0.9355695057156829,
"rewards/rejected": -0.301139527340635,
"step": 2020
},
{
"epoch": 2.6424870466321244,
"grad_norm": 9.471223831176758,
"kl": 13.312454223632812,
"learning_rate": 3.806023374435663e-08,
"logits/chosen": -33918623.34281201,
"logits/rejected": -35609706.040185474,
"logps/chosen": -454.03495260663504,
"logps/rejected": -376.96215707109735,
"loss": 0.5267,
"loss/base_kto": 3.1084702014923096,
"metrics/advantage_var": 353.3669738769531,
"regularization/mmd": 1.1049410104751587,
"regularization/rkhs_norm": 212.89810180664062,
"rewards/chosen": 0.5582775821053021,
"rewards/margins": 0.9037094449850596,
"rewards/rejected": -0.3454318628797575,
"step": 2040
},
{
"epoch": 2.66839378238342,
"grad_norm": 7.567631244659424,
"kl": 13.232315063476562,
"learning_rate": 3.282138239813037e-08,
"logits/chosen": -34503498.34850863,
"logits/rejected": -36607984.07465008,
"logps/chosen": -482.61651295133436,
"logps/rejected": -384.65163297045103,
"loss": 0.5249,
"loss/base_kto": 3.0587663650512695,
"metrics/advantage_var": 373.1220397949219,
"regularization/mmd": 1.1407493352890015,
"regularization/rkhs_norm": 219.7975616455078,
"rewards/chosen": 0.5657442533052884,
"rewards/margins": 0.9622465923851022,
"rewards/rejected": -0.39650233907981386,
"step": 2060
},
{
"epoch": 2.694300518134715,
"grad_norm": 9.058245658874512,
"kl": 12.501319885253906,
"learning_rate": 2.795808651707793e-08,
"logits/chosen": -32961729.115689382,
"logits/rejected": -36043304.23420647,
"logps/chosen": -492.27496038034866,
"logps/rejected": -365.89519934514635,
"loss": 0.5275,
"loss/base_kto": 3.0900230407714844,
"metrics/advantage_var": 369.5855407714844,
"regularization/mmd": 1.1300495862960815,
"regularization/rkhs_norm": 217.73594665527344,
"rewards/chosen": 0.5546478900214193,
"rewards/margins": 0.9458008112072581,
"rewards/rejected": -0.3911529211858388,
"step": 2080
},
{
"epoch": 2.7202072538860103,
"grad_norm": 9.40098762512207,
"kl": 14.867446899414062,
"learning_rate": 2.3474255606639293e-08,
"logits/chosen": -34542913.19254658,
"logits/rejected": -35755442.716981135,
"logps/chosen": -482.073612189441,
"logps/rejected": -384.23368710691824,
"loss": 0.5284,
"loss/base_kto": 3.0799896717071533,
"metrics/advantage_var": 391.1192626953125,
"regularization/mmd": 1.1469415426254272,
"regularization/rkhs_norm": 220.9906768798828,
"rewards/chosen": 0.5572285148667993,
"rewards/margins": 0.9512824718642687,
"rewards/rejected": -0.39405395699746953,
"step": 2100
},
{
"epoch": 2.7461139896373057,
"grad_norm": 9.91256332397461,
"kl": 12.974084854125977,
"learning_rate": 1.9373494128020195e-08,
"logits/chosen": -34190179.17117117,
"logits/rejected": -36306333.602605864,
"logps/chosen": -487.9260041291291,
"logps/rejected": -366.8720480456026,
"loss": 0.5278,
"loss/base_kto": 3.0544116497039795,
"metrics/advantage_var": 399.2501525878906,
"regularization/mmd": 1.1683543920516968,
"regularization/rkhs_norm": 225.116455078125,
"rewards/chosen": 0.6304746977201812,
"rewards/margins": 0.9665527326585337,
"rewards/rejected": -0.3360780349383525,
"step": 2120
},
{
"epoch": 2.772020725388601,
"grad_norm": 13.506525993347168,
"kl": 13.567715644836426,
"learning_rate": 1.5659098600638798e-08,
"logits/chosen": -33345278.348387096,
"logits/rejected": -35806884.46060606,
"logps/chosen": -486.77671370967744,
"logps/rejected": -382.6580965909091,
"loss": 0.5283,
"loss/base_kto": 3.064450263977051,
"metrics/advantage_var": 396.38427734375,
"regularization/mmd": 1.1618027687072754,
"regularization/rkhs_norm": 223.85411071777344,
"rewards/chosen": 0.5827009631741431,
"rewards/margins": 0.959142017084832,
"rewards/rejected": -0.37644105391068894,
"step": 2140
},
{
"epoch": 2.7979274611398965,
"grad_norm": 9.991613388061523,
"kl": 12.376852989196777,
"learning_rate": 1.2334054952120143e-08,
"logits/chosen": -34209263.78280543,
"logits/rejected": -36075496.764991894,
"logps/chosen": -491.5558069381599,
"logps/rejected": -388.61960595623987,
"loss": 0.5296,
"loss/base_kto": 3.091087818145752,
"metrics/advantage_var": 365.6158447265625,
"regularization/mmd": 1.1457853317260742,
"regularization/rkhs_norm": 220.7678680419922,
"rewards/chosen": 0.5611746257246889,
"rewards/margins": 0.922801001933917,
"rewards/rejected": -0.3616263762092281,
"step": 2160
},
{
"epoch": 2.823834196891192,
"grad_norm": 15.1278076171875,
"kl": 15.186076164245605,
"learning_rate": 9.401036117969108e-09,
"logits/chosen": -35485506.85350318,
"logits/rejected": -36513471.607361965,
"logps/chosen": -491.0250298566879,
"logps/rejected": -370.42800996932516,
"loss": 0.5273,
"loss/base_kto": 3.1048686504364014,
"metrics/advantage_var": 359.6988220214844,
"regularization/mmd": 1.113534688949585,
"regularization/rkhs_norm": 214.5538787841797,
"rewards/chosen": 0.572250949349373,
"rewards/margins": 0.9058157544562557,
"rewards/rejected": -0.3335648051068827,
"step": 2180
},
{
"epoch": 2.849740932642487,
"grad_norm": 10.609084129333496,
"kl": 11.621691703796387,
"learning_rate": 6.8623998928517555e-09,
"logits/chosen": -35603950.344827585,
"logits/rejected": -36339788.56074766,
"logps/chosen": -483.99715909090907,
"logps/rejected": -366.5739875389408,
"loss": 0.5252,
"loss/base_kto": 3.114879608154297,
"metrics/advantage_var": 351.2439880371094,
"regularization/mmd": 1.086438536643982,
"regularization/rkhs_norm": 209.3330535888672,
"rewards/chosen": 0.5589293476929859,
"rewards/margins": 0.9029869953029936,
"rewards/rejected": -0.3440576476100078,
"step": 2200
},
{
"epoch": 2.8756476683937824,
"grad_norm": 10.167004585266113,
"kl": 15.326950073242188,
"learning_rate": 4.72018703521132e-09,
"logits/chosen": -33601136.953301124,
"logits/rejected": -34893876.83156297,
"logps/chosen": -489.0647141706924,
"logps/rejected": -383.3451726100152,
"loss": 0.5281,
"loss/base_kto": 3.048800230026245,
"metrics/advantage_var": 396.35748291015625,
"regularization/mmd": 1.1763771772384644,
"regularization/rkhs_norm": 226.6622772216797,
"rewards/chosen": 0.604445747707201,
"rewards/margins": 0.9652159659963346,
"rewards/rejected": -0.36077021828913364,
"step": 2220
},
{
"epoch": 2.901554404145078,
"grad_norm": 16.41950035095215,
"kl": 15.674674034118652,
"learning_rate": 2.976119626744267e-09,
"logits/chosen": -34605490.122977346,
"logits/rejected": -34796435.72205438,
"logps/chosen": -454.2214805825243,
"logps/rejected": -389.7560422960725,
"loss": 0.5324,
"loss/base_kto": 3.0943081378936768,
"metrics/advantage_var": 403.62054443359375,
"regularization/mmd": 1.1649839878082275,
"regularization/rkhs_norm": 224.467041015625,
"rewards/chosen": 0.5575224743691849,
"rewards/margins": 0.9312573317497551,
"rewards/rejected": -0.3737348573805702,
"step": 2240
},
{
"epoch": 2.927461139896373,
"grad_norm": 12.384098052978516,
"kl": 16.30813980102539,
"learning_rate": 1.631599688052765e-09,
"logits/chosen": -34040730.10114192,
"logits/rejected": -35910092.56971514,
"logps/chosen": -469.271207177814,
"logps/rejected": -351.0214580209895,
"loss": 0.5226,
"loss/base_kto": 3.0762746334075928,
"metrics/advantage_var": 347.0081481933594,
"regularization/mmd": 1.104848861694336,
"regularization/rkhs_norm": 212.8803253173828,
"rewards/chosen": 0.5972424455801386,
"rewards/margins": 0.9287062150381831,
"rewards/rejected": -0.3314637694580444,
"step": 2260
},
{
"epoch": 2.9533678756476682,
"grad_norm": 8.210082054138184,
"kl": 13.462668418884277,
"learning_rate": 6.877080515894085e-10,
"logits/chosen": -35319547.288343556,
"logits/rejected": -33990199.439490445,
"logps/chosen": -443.042321702454,
"logps/rejected": -357.6137042197452,
"loss": 0.5229,
"loss/base_kto": 3.1298470497131348,
"metrics/advantage_var": 311.5273132324219,
"regularization/mmd": 1.0533379316329956,
"regularization/rkhs_norm": 202.95530700683594,
"rewards/chosen": 0.5258189008279812,
"rewards/margins": 0.8736475897228484,
"rewards/rejected": -0.3478286888948671,
"step": 2280
},
{
"epoch": 2.9792746113989637,
"grad_norm": 9.271958351135254,
"kl": 14.206778526306152,
"learning_rate": 1.4520349279739663e-10,
"logits/chosen": -34512060.674015746,
"logits/rejected": -36050931.29922481,
"logps/chosen": -468.143405511811,
"logps/rejected": -376.12604166666665,
"loss": 0.5234,
"loss/base_kto": 3.1001479625701904,
"metrics/advantage_var": 337.7193908691406,
"regularization/mmd": 1.0868895053863525,
"regularization/rkhs_norm": 209.41995239257812,
"rewards/chosen": 0.5491407980130414,
"rewards/margins": 0.9166954552320337,
"rewards/rejected": -0.3675546572189923,
"step": 2300
},
{
"epoch": 3.0,
"step": 2316,
"total_flos": 9.97585917447635e+17,
"train_loss": 0.5585705229243673,
"train_runtime": 11048.9523,
"train_samples_per_second": 13.415,
"train_steps_per_second": 0.21
}
],
"logging_steps": 20,
"max_steps": 2316,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": false,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 9.97585917447635e+17,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}