{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 3.0, "eval_steps": 500, "global_step": 2316, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.025906735751295335, "grad_norm": 21.002891540527344, "kl": 9.29682445526123, "learning_rate": 1.8999999999999998e-07, "logits/chosen": -36806738.55503876, "logits/rejected": -37180559.521259844, "logps/chosen": -499.56027131782946, "logps/rejected": -361.4782972440945, "loss": 0.6118, "loss/base_kto": 3.9507997035980225, "metrics/advantage_var": 208.28306579589844, "regularization/lipschitz_norm": 959.6640625, "regularization/mmd": 0.13723795115947723, "regularization/rkhs_norm": 163.37852478027344, "regularization/w1": 0.806117832660675, "rewards/chosen": 0.10371240423631299, "rewards/margins": 0.04959450762313939, "rewards/rejected": 0.0541178966131736, "step": 20 }, { "epoch": 0.05181347150259067, "grad_norm": 23.644874572753906, "kl": 6.305409908294678, "learning_rate": 3.8999999999999997e-07, "logits/chosen": -35816444.86850153, "logits/rejected": -37655712.30670927, "logps/chosen": -485.7736525229358, "logps/rejected": -375.6683805910543, "loss": 0.6001, "loss/base_kto": 3.9509849548339844, "metrics/advantage_var": 168.64268493652344, "regularization/lipschitz_norm": 863.5946655273438, "regularization/mmd": 0.12421522289514542, "regularization/rkhs_norm": 147.87527465820312, "regularization/w1": 0.7254195213317871, "rewards/chosen": 0.07522921314297831, "rewards/margins": 0.039415747476131205, "rewards/rejected": 0.03581346566684711, "step": 40 }, { "epoch": 0.07772020725388601, "grad_norm": 26.063945770263672, "kl": 14.707015037536621, "learning_rate": 5.9e-07, "logits/chosen": -36950103.681957185, "logits/rejected": -37692000.51118211, "logps/chosen": -468.01920871559633, "logps/rejected": -352.55633486421726, "loss": 0.5923, "loss/base_kto": 3.8738510608673096, "metrics/advantage_var": 167.3021697998047, "regularization/lipschitz_norm": 879.8822631835938, "regularization/mmd": 0.12527818977832794, "regularization/rkhs_norm": 149.14068603515625, "regularization/w1": 0.7391010522842407, "rewards/chosen": 0.25857277966420583, "rewards/margins": 0.12181232393243915, "rewards/rejected": 0.13676045573176668, "step": 60 }, { "epoch": 0.10362694300518134, "grad_norm": 31.767148971557617, "kl": 5.509912014007568, "learning_rate": 7.9e-07, "logits/chosen": -36536549.276853256, "logits/rejected": -37785245.98384491, "logps/chosen": -503.0107791225416, "logps/rejected": -383.53049273021, "loss": 0.5975, "loss/base_kto": 3.858879566192627, "metrics/advantage_var": 186.58255004882812, "regularization/lipschitz_norm": 941.4556884765625, "regularization/mmd": 0.13063393533229828, "regularization/rkhs_norm": 155.5166015625, "regularization/w1": 0.7908228039741516, "rewards/chosen": 0.0899936774134095, "rewards/margins": 0.13652343498551578, "rewards/rejected": -0.046529757572106284, "step": 80 }, { "epoch": 0.12953367875647667, "grad_norm": 27.916942596435547, "kl": 18.066015243530273, "learning_rate": 9.9e-07, "logits/chosen": -35552688.35555556, "logits/rejected": -38070876.947692305, "logps/chosen": -494.04117063492066, "logps/rejected": -359.19771634615387, "loss": 0.602, "loss/base_kto": 3.890141248703003, "metrics/advantage_var": 213.2407684326172, "regularization/lipschitz_norm": 938.4644775390625, "regularization/mmd": 0.13715031743049622, "regularization/rkhs_norm": 163.274169921875, "regularization/w1": 0.7883100509643555, "rewards/chosen": 0.27566438705202134, "rewards/margins": 0.1004450126154228, "rewards/rejected": 0.17521937443659855, "step": 100 }, { "epoch": 0.15544041450777202, "grad_norm": 22.59275245666504, "kl": 24.412830352783203, "learning_rate": 9.998186234298189e-07, "logits/chosen": -35760988.84370258, "logits/rejected": -37916408.16747182, "logps/chosen": -480.1171282245827, "logps/rejected": -350.6891354669887, "loss": 0.5849, "loss/base_kto": 3.785731554031372, "metrics/advantage_var": 185.63209533691406, "regularization/lipschitz_norm": 905.6769409179688, "regularization/mmd": 0.13287097215652466, "regularization/rkhs_norm": 158.1797332763672, "regularization/w1": 0.7607686519622803, "rewards/chosen": 0.4051793840839577, "rewards/margins": 0.16112382499013223, "rewards/rejected": 0.24405555909382548, "step": 120 }, { "epoch": 0.18134715025906736, "grad_norm": 48.02346420288086, "kl": 19.847946166992188, "learning_rate": 9.992359552107714e-07, "logits/chosen": -35990689.514195584, "logits/rejected": -38065316.85448916, "logps/chosen": -488.46746845425866, "logps/rejected": -385.6934017027864, "loss": 0.5967, "loss/base_kto": 3.826545476913452, "metrics/advantage_var": 218.2530975341797, "regularization/lipschitz_norm": 961.408203125, "regularization/mmd": 0.13978762924671173, "regularization/rkhs_norm": 166.41384887695312, "regularization/w1": 0.8075828552246094, "rewards/chosen": 0.3045312057158172, "rewards/margins": 0.15000710230903508, "rewards/rejected": 0.15452410340678213, "step": 140 }, { "epoch": 0.20725388601036268, "grad_norm": 17.178922653198242, "kl": 4.906111240386963, "learning_rate": 9.982519612796161e-07, "logits/chosen": -34970382.76112027, "logits/rejected": -37107091.209509656, "logps/chosen": -492.3693369028007, "logps/rejected": -384.2996842496285, "loss": 0.5932, "loss/base_kto": 3.837249755859375, "metrics/advantage_var": 183.5966796875, "regularization/lipschitz_norm": 924.1876831054688, "regularization/mmd": 0.13173113763332367, "regularization/rkhs_norm": 156.82278442382812, "regularization/w1": 0.7763177156448364, "rewards/chosen": -0.018455899724064785, "rewards/margins": 0.13749395785452456, "rewards/rejected": -0.15594985757858934, "step": 160 }, { "epoch": 0.23316062176165803, "grad_norm": 18.382226943969727, "kl": 2.1383161544799805, "learning_rate": 9.968674326492213e-07, "logits/chosen": -36835695.33968254, "logits/rejected": -38161975.13846154, "logps/chosen": -507.96517857142857, "logps/rejected": -377.80182692307693, "loss": 0.5988, "loss/base_kto": 3.8357181549072266, "metrics/advantage_var": 201.1750946044922, "regularization/lipschitz_norm": 973.322265625, "regularization/mmd": 0.1369176059961319, "regularization/rkhs_norm": 162.9971466064453, "regularization/w1": 0.8175907135009766, "rewards/chosen": -0.07040049235026041, "rewards/margins": 0.16253670716897037, "rewards/rejected": -0.23293719951923078, "step": 180 }, { "epoch": 0.25906735751295334, "grad_norm": 24.55632209777832, "kl": 2.7123076915740967, "learning_rate": 9.950834823142198e-07, "logits/chosen": -36629456.84210526, "logits/rejected": -37932028.952380955, "logps/chosen": -488.33475534539474, "logps/rejected": -393.32059151785717, "loss": 0.5988, "loss/base_kto": 3.817567825317383, "metrics/advantage_var": 223.64614868164062, "regularization/lipschitz_norm": 989.0489501953125, "regularization/mmd": 0.1424151062965393, "regularization/rkhs_norm": 169.5417938232422, "regularization/w1": 0.8308011293411255, "rewards/chosen": -0.13143524370695414, "rewards/margins": 0.15556473122503528, "rewards/rejected": -0.2869999749319894, "step": 200 }, { "epoch": 0.2849740932642487, "grad_norm": 19.38735008239746, "kl": 2.8487627506256104, "learning_rate": 9.929015443562942e-07, "logits/chosen": -34710388.658227846, "logits/rejected": -36250478.61728395, "logps/chosen": -497.3544303797468, "logps/rejected": -390.01916956018516, "loss": 0.5942, "loss/base_kto": 3.7558200359344482, "metrics/advantage_var": 226.3386688232422, "regularization/lipschitz_norm": 1014.6015625, "regularization/mmd": 0.14520350098609924, "regularization/rkhs_norm": 172.86131286621094, "regularization/w1": 0.8522653579711914, "rewards/chosen": -0.060055056704750545, "rewards/margins": 0.2504924540781271, "rewards/rejected": -0.3105475107828776, "step": 220 }, { "epoch": 0.31088082901554404, "grad_norm": 23.47049331665039, "kl": 12.093279838562012, "learning_rate": 9.90323372791347e-07, "logits/chosen": -36153691.32163743, "logits/rejected": -37871588.51006711, "logps/chosen": -504.3876096491228, "logps/rejected": -354.44347734899327, "loss": 0.59, "loss/base_kto": 3.7200844287872314, "metrics/advantage_var": 235.37034606933594, "regularization/lipschitz_norm": 1013.8336181640625, "regularization/mmd": 0.14831320941448212, "regularization/rkhs_norm": 176.56333923339844, "regularization/w1": 0.8516203165054321, "rewards/chosen": 0.22248893871641995, "rewards/margins": 0.2526094522996096, "rewards/rejected": -0.03012051358318969, "step": 240 }, { "epoch": 0.33678756476683935, "grad_norm": 23.581783294677734, "kl": 14.000227928161621, "learning_rate": 9.87351040159484e-07, "logits/chosen": -35468692.54320987, "logits/rejected": -36875348.25316456, "logps/chosen": -485.75327932098764, "logps/rejected": -350.51725672468353, "loss": 0.6031, "loss/base_kto": 3.8040168285369873, "metrics/advantage_var": 248.74560546875, "regularization/lipschitz_norm": 1037.2283935546875, "regularization/mmd": 0.14947238564491272, "regularization/rkhs_norm": 177.9433135986328, "regularization/w1": 0.8712717294692993, "rewards/chosen": 0.21057086520724827, "rewards/margins": 0.17433021809649032, "rewards/rejected": 0.036240647110757945, "step": 260 }, { "epoch": 0.3626943005181347, "grad_norm": 20.44241714477539, "kl": 8.439579963684082, "learning_rate": 9.839869358589396e-07, "logits/chosen": -35922895.55628059, "logits/rejected": -38429209.33133433, "logps/chosen": -489.45692292006527, "logps/rejected": -366.0670446026987, "loss": 0.5917, "loss/base_kto": 3.7464218139648438, "metrics/advantage_var": 222.99551391601562, "regularization/lipschitz_norm": 1004.2482299804688, "regularization/mmd": 0.14356186985969543, "regularization/rkhs_norm": 170.906982421875, "regularization/w1": 0.8435684442520142, "rewards/chosen": 0.07846951756936302, "rewards/margins": 0.21822585323819851, "rewards/rejected": -0.1397563356688355, "step": 280 }, { "epoch": 0.38860103626943004, "grad_norm": 16.739639282226562, "kl": 7.388824462890625, "learning_rate": 9.80233764225289e-07, "logits/chosen": -35040198.4, "logits/rejected": -36427360.0, "logps/chosen": -497.217431640625, "logps/rejected": -381.1005859375, "loss": 0.6029, "loss/base_kto": 3.805175542831421, "metrics/advantage_var": 236.3822021484375, "regularization/lipschitz_norm": 1033.6092529296875, "regularization/mmd": 0.14950346946716309, "regularization/rkhs_norm": 177.98031616210938, "regularization/w1": 0.8682317733764648, "rewards/chosen": 0.03671181797981262, "rewards/margins": 0.18501196503639222, "rewards/rejected": -0.1483001470565796, "step": 300 }, { "epoch": 0.41450777202072536, "grad_norm": 19.930891036987305, "kl": 10.909724235534668, "learning_rate": 9.760945423574868e-07, "logits/chosen": -36241877.268588774, "logits/rejected": -36504204.98550725, "logps/chosen": -457.81847496206376, "logps/rejected": -376.1501107085346, "loss": 0.5894, "loss/base_kto": 3.797499895095825, "metrics/advantage_var": 204.89968872070312, "regularization/lipschitz_norm": 928.67236328125, "regularization/mmd": 0.13729074597358704, "regularization/rkhs_norm": 163.4413299560547, "regularization/w1": 0.7800847887992859, "rewards/chosen": 0.11744685310514273, "rewards/margins": 0.17470345035685053, "rewards/rejected": -0.05725659725170781, "step": 320 }, { "epoch": 0.44041450777202074, "grad_norm": 16.12029457092285, "kl": 11.883231163024902, "learning_rate": 9.71572597692482e-07, "logits/chosen": -36761102.35514019, "logits/rejected": -37523456.0, "logps/chosen": -474.08041277258565, "logps/rejected": -384.4374020376176, "loss": 0.5977, "loss/base_kto": 3.7662932872772217, "metrics/advantage_var": 242.0256805419922, "regularization/lipschitz_norm": 1034.9364013671875, "regularization/mmd": 0.14618881046772003, "regularization/rkhs_norm": 174.0343017578125, "regularization/w1": 0.869346559047699, "rewards/chosen": 0.2054643482434044, "rewards/margins": 0.22209540588699583, "rewards/rejected": -0.016631057643591424, "step": 340 }, { "epoch": 0.46632124352331605, "grad_norm": 16.689865112304688, "kl": 6.03048849105835, "learning_rate": 9.666715653303588e-07, "logits/chosen": -37166285.437014, "logits/rejected": -37581134.36734694, "logps/chosen": -494.3160478227061, "logps/rejected": -382.0531053767661, "loss": 0.5956, "loss/base_kto": 3.7721123695373535, "metrics/advantage_var": 227.2195281982422, "regularization/lipschitz_norm": 1009.7874145507812, "regularization/mmd": 0.1444280594587326, "regularization/rkhs_norm": 171.9381866455078, "regularization/w1": 0.8482214212417603, "rewards/chosen": 0.05406781043828368, "rewards/margins": 0.22711620413094705, "rewards/rejected": -0.17304839369266337, "step": 360 }, { "epoch": 0.49222797927461137, "grad_norm": 21.190996170043945, "kl": 9.208587646484375, "learning_rate": 9.613953851121528e-07, "logits/chosen": -36699593.6, "logits/rejected": -38081651.2, "logps/chosen": -501.0798828125, "logps/rejected": -369.744287109375, "loss": 0.5961, "loss/base_kto": 3.7995357513427734, "metrics/advantage_var": 229.01504516601562, "regularization/lipschitz_norm": 984.9951171875, "regularization/mmd": 0.14215107262134552, "regularization/rkhs_norm": 169.2274627685547, "regularization/w1": 0.8273958563804626, "rewards/chosen": 0.11079213619232178, "rewards/margins": 0.17351986169815065, "rewards/rejected": -0.06272772550582886, "step": 380 }, { "epoch": 0.5181347150259067, "grad_norm": 22.635528564453125, "kl": 13.041945457458496, "learning_rate": 9.557482984526924e-07, "logits/chosen": -36352973.046548955, "logits/rejected": -37737732.28614917, "logps/chosen": -495.12720706260035, "logps/rejected": -374.9865391933029, "loss": 0.5969, "loss/base_kto": 3.7488961219787598, "metrics/advantage_var": 239.8693389892578, "regularization/lipschitz_norm": 1042.74267578125, "regularization/mmd": 0.15008819103240967, "regularization/rkhs_norm": 178.6764373779297, "regularization/w1": 0.8759037852287292, "rewards/chosen": 0.13551915935681683, "rewards/margins": 0.21548251828961387, "rewards/rejected": -0.07996335893279705, "step": 400 }, { "epoch": 0.5440414507772021, "grad_norm": 20.579927444458008, "kl": 12.666115760803223, "learning_rate": 9.497348449310107e-07, "logits/chosen": -36121143.5980551, "logits/rejected": -36648413.24886878, "logps/chosen": -482.49037682333875, "logps/rejected": -372.89698812217193, "loss": 0.6018, "loss/base_kto": 3.7951207160949707, "metrics/advantage_var": 251.12315368652344, "regularization/lipschitz_norm": 1035.3060302734375, "regularization/mmd": 0.14965009689331055, "regularization/rkhs_norm": 178.15489196777344, "regularization/w1": 0.869657039642334, "rewards/chosen": 0.19201514245625254, "rewards/margins": 0.17234569742416442, "rewards/rejected": 0.019669445032088107, "step": 420 }, { "epoch": 0.5699481865284974, "grad_norm": 22.452388763427734, "kl": 3.7606093883514404, "learning_rate": 9.433598586410701e-07, "logits/chosen": -36301097.18611988, "logits/rejected": -37192390.14241486, "logps/chosen": -497.71855283911674, "logps/rejected": -363.8777089783282, "loss": 0.5961, "loss/base_kto": 3.774768829345703, "metrics/advantage_var": 240.28408813476562, "regularization/lipschitz_norm": 1007.1629028320312, "regularization/mmd": 0.14802759885787964, "regularization/rkhs_norm": 176.2233428955078, "regularization/w1": 0.8460167050361633, "rewards/chosen": -0.104330766840312, "rewards/margins": 0.2134261221958843, "rewards/rejected": -0.3177568890361963, "step": 440 }, { "epoch": 0.5958549222797928, "grad_norm": 19.246440887451172, "kl": 9.679542541503906, "learning_rate": 9.366284643057313e-07, "logits/chosen": -36739738.79069767, "logits/rejected": -38059246.631268434, "logps/chosen": -476.8813330564784, "logps/rejected": -371.85965154867256, "loss": 0.5932, "loss/base_kto": 3.7439823150634766, "metrics/advantage_var": 243.2819061279297, "regularization/lipschitz_norm": 1014.6220092773438, "regularization/mmd": 0.1491519659757614, "regularization/rkhs_norm": 177.56185913085938, "regularization/w1": 0.8522824645042419, "rewards/chosen": 0.12866262898492656, "rewards/margins": 0.2296599123803393, "rewards/rejected": -0.10099728339541275, "step": 460 }, { "epoch": 0.6217616580310881, "grad_norm": 23.29594612121582, "kl": 3.4871933460235596, "learning_rate": 9.295460731570917e-07, "logits/chosen": -35390890.79694656, "logits/rejected": -35793141.76, "logps/chosen": -458.16049618320613, "logps/rejected": -371.07275, "loss": 0.6001, "loss/base_kto": 3.8229825496673584, "metrics/advantage_var": 241.88975524902344, "regularization/lipschitz_norm": 990.4679565429688, "regularization/mmd": 0.14610660076141357, "regularization/rkhs_norm": 173.9364471435547, "regularization/w1": 0.8319931030273438, "rewards/chosen": -0.07053758461056775, "rewards/margins": 0.18983951499880725, "rewards/rejected": -0.260377099609375, "step": 480 }, { "epoch": 0.6476683937823834, "grad_norm": 17.803701400756836, "kl": 15.291159629821777, "learning_rate": 9.221183785865056e-07, "logits/chosen": -36197520.47131783, "logits/rejected": -35400121.851968504, "logps/chosen": -474.8251453488372, "logps/rejected": -373.7671505905512, "loss": 0.5988, "loss/base_kto": 3.7114250659942627, "metrics/advantage_var": 276.8833923339844, "regularization/lipschitz_norm": 1095.9642333984375, "regularization/mmd": 0.15803752839565277, "regularization/rkhs_norm": 188.13990783691406, "regularization/w1": 0.9206100702285767, "rewards/chosen": 0.2920237933018411, "rewards/margins": 0.2693102267245004, "rewards/rejected": 0.022713566577340673, "step": 500 }, { "epoch": 0.6735751295336787, "grad_norm": 15.237549781799316, "kl": 11.103652954101562, "learning_rate": 9.143513515677817e-07, "logits/chosen": -35199852.32329635, "logits/rejected": -35573292.96764252, "logps/chosen": -449.81418383518223, "logps/rejected": -334.2816592835131, "loss": 0.5789, "loss/base_kto": 3.6592445373535156, "metrics/advantage_var": 248.9097137451172, "regularization/lipschitz_norm": 983.8563842773438, "regularization/mmd": 0.1453792303800583, "regularization/rkhs_norm": 173.0705108642578, "regularization/w1": 0.8264393210411072, "rewards/chosen": 0.20631609401309925, "rewards/margins": 0.326690952851667, "rewards/rejected": -0.12037485883856774, "step": 520 }, { "epoch": 0.6994818652849741, "grad_norm": 24.42544937133789, "kl": 5.859231472015381, "learning_rate": 9.062512358572373e-07, "logits/chosen": -35706488.038277514, "logits/rejected": -36856140.44716692, "logps/chosen": -468.8909489633174, "logps/rejected": -387.380288093415, "loss": 0.6009, "loss/base_kto": 3.785578966140747, "metrics/advantage_var": 247.8687286376953, "regularization/lipschitz_norm": 1037.9766845703125, "regularization/mmd": 0.14969880878925323, "regularization/rkhs_norm": 178.21286010742188, "regularization/w1": 0.8719003796577454, "rewards/chosen": -0.007102211126300137, "rewards/margins": 0.22319427579105247, "rewards/rejected": -0.2302964869173526, "step": 540 }, { "epoch": 0.7253886010362695, "grad_norm": 23.30228614807129, "kl": 6.485246181488037, "learning_rate": 8.978245429744691e-07, "logits/chosen": -35986983.384615384, "logits/rejected": -37118111.32576986, "logps/chosen": -495.470871040724, "logps/rejected": -374.2540012155592, "loss": 0.6044, "loss/base_kto": 3.758063554763794, "metrics/advantage_var": 266.31365966796875, "regularization/lipschitz_norm": 1095.349609375, "regularization/mmd": 0.1568516045808792, "regularization/rkhs_norm": 186.7281036376953, "regularization/w1": 0.9200937151908875, "rewards/chosen": 0.008832502868560285, "rewards/margins": 0.21875871858599344, "rewards/rejected": -0.20992621571743314, "step": 560 }, { "epoch": 0.7512953367875648, "grad_norm": 24.467670440673828, "kl": 18.701963424682617, "learning_rate": 8.890780469678738e-07, "logits/chosen": -38700092.23529412, "logits/rejected": -38453951.68881685, "logps/chosen": -507.2732371794872, "logps/rejected": -381.7732728930308, "loss": 0.6121, "loss/base_kto": 3.743682861328125, "metrics/advantage_var": 296.6300354003906, "regularization/lipschitz_norm": 1172.72998046875, "regularization/mmd": 0.16786277294158936, "regularization/rkhs_norm": 199.83665466308594, "regularization/w1": 0.9850932359695435, "rewards/chosen": 0.34446235300009426, "rewards/margins": 0.22968183423489977, "rewards/rejected": 0.11478051876519449, "step": 580 }, { "epoch": 0.7772020725388601, "grad_norm": 18.4597225189209, "kl": 10.100874900817871, "learning_rate": 8.800187789691269e-07, "logits/chosen": -36295174.440251574, "logits/rejected": -37668062.60869565, "logps/chosen": -495.23181996855345, "logps/rejected": -356.2565751164596, "loss": 0.5996, "loss/base_kto": 3.7534492015838623, "metrics/advantage_var": 248.06846618652344, "regularization/lipschitz_norm": 1063.7315673828125, "regularization/mmd": 0.14948324859142303, "regularization/rkhs_norm": 177.9562530517578, "regularization/w1": 0.8935344815254211, "rewards/chosen": 0.14588748284105985, "rewards/margins": 0.23258878711685688, "rewards/rejected": -0.08670130427579702, "step": 600 }, { "epoch": 0.8031088082901554, "grad_norm": 18.682607650756836, "kl": 13.347147941589355, "learning_rate": 8.706540215409981e-07, "logits/chosen": -35835687.384615384, "logits/rejected": -37218600.585365854, "logps/chosen": -465.88516626602564, "logps/rejected": -383.6118521341463, "loss": 0.5986, "loss/base_kto": 3.7235100269317627, "metrics/advantage_var": 252.84033203125, "regularization/lipschitz_norm": 1083.9730224609375, "regularization/mmd": 0.15455412864685059, "regularization/rkhs_norm": 183.99302673339844, "regularization/w1": 0.9105373620986938, "rewards/chosen": 0.10605437938983624, "rewards/margins": 0.22892328945825516, "rewards/rejected": -0.12286891006841892, "step": 620 }, { "epoch": 0.8290155440414507, "grad_norm": 18.112548828125, "kl": 8.68852424621582, "learning_rate": 8.609913028230462e-07, "logits/chosen": -37186758.3496063, "logits/rejected": -38183454.95813953, "logps/chosen": -483.29896653543307, "logps/rejected": -385.3201792635659, "loss": 0.5967, "loss/base_kto": 3.7061691284179688, "metrics/advantage_var": 267.4930114746094, "regularization/lipschitz_norm": 1083.5208740234375, "regularization/mmd": 0.15726128220558167, "regularization/rkhs_norm": 187.21580505371094, "regularization/w1": 0.9101576209068298, "rewards/chosen": 0.17891497274083415, "rewards/margins": 0.26187582602178133, "rewards/rejected": -0.08296085328094718, "step": 640 }, { "epoch": 0.8549222797927462, "grad_norm": 22.497026443481445, "kl": 11.724501609802246, "learning_rate": 8.510383904798994e-07, "logits/chosen": -37575972.792738274, "logits/rejected": -37687391.948303714, "logps/chosen": -480.875189107413, "logps/rejected": -383.28912560581585, "loss": 0.6031, "loss/base_kto": 3.8036885261535645, "metrics/advantage_var": 244.5902862548828, "regularization/lipschitz_norm": 1035.9989013671875, "regularization/mmd": 0.15057645738124847, "regularization/rkhs_norm": 179.2576904296875, "regularization/w1": 0.8702389597892761, "rewards/chosen": 0.1268555934057654, "rewards/margins": 0.18380138186166076, "rewards/rejected": -0.056945788455895346, "step": 660 }, { "epoch": 0.8808290155440415, "grad_norm": 21.271011352539062, "kl": 14.250314712524414, "learning_rate": 8.408032854569865e-07, "logits/chosen": -36566237.72561984, "logits/rejected": -37276209.3037037, "logps/chosen": -463.1956611570248, "logps/rejected": -371.7718981481481, "loss": 0.5984, "loss/base_kto": 3.7788636684417725, "metrics/advantage_var": 238.5911102294922, "regularization/lipschitz_norm": 1023.1630859375, "regularization/mmd": 0.14863084256649017, "regularization/rkhs_norm": 176.94146728515625, "regularization/w1": 0.8594570159912109, "rewards/chosen": 0.18816916725852273, "rewards/margins": 0.19544168414491597, "rewards/rejected": -0.007272516886393229, "step": 680 }, { "epoch": 0.9067357512953368, "grad_norm": 17.99951934814453, "kl": 9.81983470916748, "learning_rate": 8.302942155487377e-07, "logits/chosen": -36518954.47004608, "logits/rejected": -37850807.14785374, "logps/chosen": -487.53182603686633, "logps/rejected": -384.29409280604136, "loss": 0.5911, "loss/base_kto": 3.7152459621429443, "metrics/advantage_var": 247.6333465576172, "regularization/lipschitz_norm": 1027.8251953125, "regularization/mmd": 0.15019455552101135, "regularization/rkhs_norm": 178.8030242919922, "regularization/w1": 0.8633732199668884, "rewards/chosen": 0.14282357820900538, "rewards/margins": 0.2650409475918303, "rewards/rejected": -0.12221736938282492, "step": 700 }, { "epoch": 0.9326424870466321, "grad_norm": 25.400270462036133, "kl": 10.128746032714844, "learning_rate": 8.195196287844278e-07, "logits/chosen": -36794279.506172836, "logits/rejected": -37450661.26582278, "logps/chosen": -505.5550733024691, "logps/rejected": -378.05038568037975, "loss": 0.598, "loss/base_kto": 3.719536304473877, "metrics/advantage_var": 256.35247802734375, "regularization/lipschitz_norm": 1083.0006103515625, "regularization/mmd": 0.15447254478931427, "regularization/rkhs_norm": 183.89588928222656, "regularization/w1": 0.9097205400466919, "rewards/chosen": 0.12851585576563707, "rewards/margins": 0.24123774559949784, "rewards/rejected": -0.11272188983386076, "step": 720 }, { "epoch": 0.9585492227979274, "grad_norm": 20.682348251342773, "kl": 14.537857055664062, "learning_rate": 8.08488186636975e-07, "logits/chosen": -35585871.89808917, "logits/rejected": -38136034.159509204, "logps/chosen": -472.7933917197452, "logps/rejected": -360.1613305214724, "loss": 0.5861, "loss/base_kto": 3.7032296657562256, "metrics/advantage_var": 237.9302215576172, "regularization/lipschitz_norm": 999.3062744140625, "regularization/mmd": 0.14641115069389343, "regularization/rkhs_norm": 174.2989959716797, "regularization/w1": 0.8394172787666321, "rewards/chosen": 0.18850056836559514, "rewards/margins": 0.24888291991910838, "rewards/rejected": -0.06038235155351323, "step": 740 }, { "epoch": 0.9844559585492227, "grad_norm": 26.200773239135742, "kl": 17.288009643554688, "learning_rate": 7.972087570601576e-07, "logits/chosen": -36156413.01457726, "logits/rejected": -36837217.400673404, "logps/chosen": -480.846027696793, "logps/rejected": -401.2182239057239, "loss": 0.6014, "loss/base_kto": 3.726454496383667, "metrics/advantage_var": 262.059326171875, "regularization/lipschitz_norm": 1106.60986328125, "regularization/mmd": 0.15532676875591278, "regularization/rkhs_norm": 184.91282653808594, "regularization/w1": 0.9295522570610046, "rewards/chosen": 0.2757827714302797, "rewards/margins": 0.23156987140339955, "rewards/rejected": 0.04421290002688013, "step": 760 }, { "epoch": 1.0103626943005182, "grad_norm": 17.645538330078125, "kl": 20.367826461791992, "learning_rate": 7.856904073598458e-07, "logits/chosen": -36389639.08923077, "logits/rejected": -37462296.458598725, "logps/chosen": -478.2633653846154, "logps/rejected": -369.76769008757964, "loss": 0.5913, "loss/base_kto": 3.510164976119995, "metrics/advantage_var": 373.0108642578125, "regularization/lipschitz_norm": 1241.9139404296875, "regularization/mmd": 0.1766994446516037, "regularization/rkhs_norm": 210.3564910888672, "regularization/w1": 1.0432077646255493, "rewards/chosen": 0.4789816518930288, "rewards/margins": 0.5101663616485073, "rewards/rejected": -0.03118470975547839, "step": 780 }, { "epoch": 1.0362694300518134, "grad_norm": 14.581066131591797, "kl": 12.646075248718262, "learning_rate": 7.739423969049761e-07, "logits/chosen": -35601939.56687898, "logits/rejected": -36514652.66257669, "logps/chosen": -466.05677746815286, "logps/rejected": -359.2162816334356, "loss": 0.612, "loss/base_kto": 3.278748035430908, "metrics/advantage_var": 722.8309936523438, "regularization/lipschitz_norm": 1642.021728515625, "regularization/mmd": 0.23777084052562714, "regularization/rkhs_norm": 283.060546875, "regularization/w1": 1.379298210144043, "rewards/chosen": 0.49157175440697154, "rewards/margins": 0.8237190367323886, "rewards/rejected": -0.33214728232541696, "step": 800 }, { "epoch": 1.0621761658031088, "grad_norm": 17.722475051879883, "kl": 10.00409984588623, "learning_rate": 7.619741696841322e-07, "logits/chosen": -36037570.234920636, "logits/rejected": -37745036.996923074, "logps/chosen": -480.87296626984124, "logps/rejected": -400.6152403846154, "loss": 0.6267, "loss/base_kto": 3.3586418628692627, "metrics/advantage_var": 968.7614135742188, "regularization/lipschitz_norm": 1692.2047119140625, "regularization/mmd": 0.23324553668498993, "regularization/rkhs_norm": 277.6732482910156, "regularization/w1": 1.4214519262313843, "rewards/chosen": 0.3753167288643973, "rewards/margins": 0.6660401128412603, "rewards/rejected": -0.290723383976863, "step": 820 }, { "epoch": 1.0880829015544042, "grad_norm": 24.830984115600586, "kl": 11.239001274108887, "learning_rate": 7.497953467137135e-07, "logits/chosen": -36216176.89440994, "logits/rejected": -37063876.42767295, "logps/chosen": -485.518051242236, "logps/rejected": -400.12318199685535, "loss": 0.6103, "loss/base_kto": 3.2918148040771484, "metrics/advantage_var": 631.3637084960938, "regularization/lipschitz_norm": 1619.4119873046875, "regularization/mmd": 0.22996166348457336, "regularization/rkhs_norm": 273.7638854980469, "regularization/w1": 1.3603060245513916, "rewards/chosen": 0.44590764016098117, "rewards/margins": 0.7903715403612073, "rewards/rejected": -0.34446390020022605, "step": 840 }, { "epoch": 1.1139896373056994, "grad_norm": 22.797107696533203, "kl": 11.124322891235352, "learning_rate": 7.37415718303793e-07, "logits/chosen": -36511150.047543585, "logits/rejected": -36602401.9229584, "logps/chosen": -507.25445721077654, "logps/rejected": -366.174499229584, "loss": 0.6072, "loss/base_kto": 3.3020102977752686, "metrics/advantage_var": 611.6364135742188, "regularization/lipschitz_norm": 1584.796875, "regularization/mmd": 0.22439594566822052, "regularization/rkhs_norm": 267.1380310058594, "regularization/w1": 1.331229329109192, "rewards/chosen": 0.3487194321234895, "rewards/margins": 0.7601920289370969, "rewards/rejected": -0.4114725968136075, "step": 860 }, { "epoch": 1.1398963730569949, "grad_norm": 19.19955825805664, "kl": 18.63279151916504, "learning_rate": 7.248452361878855e-07, "logits/chosen": -34369725.33744222, "logits/rejected": -36344681.07765452, "logps/chosen": -486.60472842835134, "logps/rejected": -381.2710974643423, "loss": 0.6084, "loss/base_kto": 3.2762367725372314, "metrics/advantage_var": 632.5957641601562, "regularization/lipschitz_norm": 1622.939453125, "regularization/mmd": 0.227473646402359, "regularization/rkhs_norm": 270.8019714355469, "regularization/w1": 1.3632692098617554, "rewards/chosen": 0.5085174607569337, "rewards/margins": 0.7692140653450751, "rewards/rejected": -0.26069660458814137, "step": 880 }, { "epoch": 1.16580310880829, "grad_norm": 23.80451202392578, "kl": 15.435348510742188, "learning_rate": 7.120940055229497e-07, "logits/chosen": -36562309.719568565, "logits/rejected": -37276362.04120444, "logps/chosen": -479.53861710323577, "logps/rejected": -380.42415312995246, "loss": 0.6057, "loss/base_kto": 3.2696053981781006, "metrics/advantage_var": 602.6306762695312, "regularization/lipschitz_norm": 1605.048095703125, "regularization/mmd": 0.22752657532691956, "regularization/rkhs_norm": 270.8649597167969, "regularization/w1": 1.3482402563095093, "rewards/chosen": 0.5724000151976598, "rewards/margins": 0.7972763101876311, "rewards/rejected": -0.22487629498997128, "step": 900 }, { "epoch": 1.1917098445595855, "grad_norm": 48.86388397216797, "kl": 14.562422752380371, "learning_rate": 6.991722767660556e-07, "logits/chosen": -34969252.827371694, "logits/rejected": -37211677.73940346, "logps/chosen": -468.6008456454121, "logps/rejected": -369.25431711145995, "loss": 0.6037, "loss/base_kto": 3.3056893348693848, "metrics/advantage_var": 624.78662109375, "regularization/lipschitz_norm": 1547.953125, "regularization/mmd": 0.2235708236694336, "regularization/rkhs_norm": 266.1557312011719, "regularization/w1": 1.3002806901931763, "rewards/chosen": 0.478918191248299, "rewards/margins": 0.7449161572541123, "rewards/rejected": -0.2659979660058134, "step": 920 }, { "epoch": 1.2176165803108807, "grad_norm": 21.663223266601562, "kl": 21.121829986572266, "learning_rate": 6.860904374342499e-07, "logits/chosen": -36329721.294298925, "logits/rejected": -37947297.87638669, "logps/chosen": -514.2784572419106, "logps/rejected": -378.4793977812995, "loss": 0.6118, "loss/base_kto": 3.255121946334839, "metrics/advantage_var": 602.9996337890625, "regularization/lipschitz_norm": 1677.8475341796875, "regularization/mmd": 0.22991926968097687, "regularization/rkhs_norm": 273.7134094238281, "regularization/w1": 1.4093917608261108, "rewards/chosen": 0.6202737722999326, "rewards/margins": 0.8242826213335845, "rewards/rejected": -0.20400884903365193, "step": 940 }, { "epoch": 1.2435233160621761, "grad_norm": 19.38195037841797, "kl": 13.08390998840332, "learning_rate": 6.7285900375424e-07, "logits/chosen": -34997597.69678407, "logits/rejected": -35992002.755980864, "logps/chosen": -506.90438361408883, "logps/rejected": -375.1045155502392, "loss": 0.6042, "loss/base_kto": 3.2489612102508545, "metrics/advantage_var": 650.0698852539062, "regularization/lipschitz_norm": 1610.8154296875, "regularization/mmd": 0.23186349868774414, "regularization/rkhs_norm": 276.0279846191406, "regularization/w1": 1.353084921836853, "rewards/chosen": 0.5146272200720233, "rewards/margins": 0.853607911546804, "rewards/rejected": -0.3389806914747807, "step": 960 }, { "epoch": 1.2694300518134716, "grad_norm": 19.10856819152832, "kl": 15.936148643493652, "learning_rate": 6.594886122086123e-07, "logits/chosen": -36025036.8, "logits/rejected": -37407968.0, "logps/chosen": -461.17919921875, "logps/rejected": -373.235205078125, "loss": 0.6105, "loss/base_kto": 3.282215118408203, "metrics/advantage_var": 697.1913452148438, "regularization/lipschitz_norm": 1630.668212890625, "regularization/mmd": 0.23203685879707336, "regularization/rkhs_norm": 276.2343444824219, "regularization/w1": 1.369761347770691, "rewards/chosen": 0.5281445503234863, "rewards/margins": 0.783744716644287, "rewards/rejected": -0.2556001663208008, "step": 980 }, { "epoch": 1.2953367875647668, "grad_norm": 15.50611400604248, "kl": 12.658308982849121, "learning_rate": 6.459900109853766e-07, "logits/chosen": -35978363.01298701, "logits/rejected": -37760573.686746985, "logps/chosen": -470.4105113636364, "logps/rejected": -368.535203313253, "loss": 0.5937, "loss/base_kto": 3.2967498302459717, "metrics/advantage_var": 518.6314697265625, "regularization/lipschitz_norm": 1476.4432373046875, "regularization/mmd": 0.21278348565101624, "regularization/rkhs_norm": 253.3136749267578, "regularization/w1": 1.240212321281433, "rewards/chosen": 0.3881315751509233, "rewards/margins": 0.7245794632609808, "rewards/rejected": -0.33644788811005744, "step": 1000 }, { "epoch": 1.3212435233160622, "grad_norm": 16.433752059936523, "kl": 9.784865379333496, "learning_rate": 6.323740513377171e-07, "logits/chosen": -33988953.72347267, "logits/rejected": -36039717.34954407, "logps/chosen": -477.02783360128615, "logps/rejected": -367.58572378419456, "loss": 0.6024, "loss/base_kto": 3.2700486183166504, "metrics/advantage_var": 608.6986694335938, "regularization/lipschitz_norm": 1575.5340576171875, "regularization/mmd": 0.22585450112819672, "regularization/rkhs_norm": 268.8744201660156, "regularization/w1": 1.323448657989502, "rewards/chosen": 0.4100186755802854, "rewards/margins": 0.8063638199275023, "rewards/rejected": -0.39634514434721696, "step": 1020 }, { "epoch": 1.3471502590673574, "grad_norm": 19.169435501098633, "kl": 10.167763710021973, "learning_rate": 6.186516788608865e-07, "logits/chosen": -36013923.93157076, "logits/rejected": -36364095.09576138, "logps/chosen": -492.5692068429238, "logps/rejected": -398.8990875196232, "loss": 0.6232, "loss/base_kto": 3.2810959815979004, "metrics/advantage_var": 733.5505981445312, "regularization/lipschitz_norm": 1737.5484619140625, "regularization/mmd": 0.24507227540016174, "regularization/rkhs_norm": 291.752685546875, "regularization/w1": 1.4595407247543335, "rewards/chosen": 0.4657984803290241, "rewards/margins": 0.8314784982045638, "rewards/rejected": -0.36568001787553966, "step": 1040 }, { "epoch": 1.3730569948186528, "grad_norm": 15.603521347045898, "kl": 12.8410062789917, "learning_rate": 6.048339246932652e-07, "logits/chosen": -34583273.01547988, "logits/rejected": -36524241.96845426, "logps/chosen": -488.2435178018576, "logps/rejected": -379.0256555599369, "loss": 0.5997, "loss/base_kto": 3.2975711822509766, "metrics/advantage_var": 570.064697265625, "regularization/lipschitz_norm": 1525.0550537109375, "regularization/mmd": 0.21888184547424316, "regularization/rkhs_norm": 260.57366943359375, "regularization/w1": 1.2810462713241577, "rewards/chosen": 0.39716582401618133, "rewards/margins": 0.7907970942713815, "rewards/rejected": -0.3936312702552001, "step": 1060 }, { "epoch": 1.3989637305699483, "grad_norm": 22.659696578979492, "kl": 13.170989036560059, "learning_rate": 5.909318966486494e-07, "logits/chosen": -35158830.72698908, "logits/rejected": -35037594.24100156, "logps/chosen": -474.0039976599064, "logps/rejected": -377.1842478482003, "loss": 0.6033, "loss/base_kto": 3.3246707916259766, "metrics/advantage_var": 544.271484375, "regularization/lipschitz_norm": 1528.093994140625, "regularization/mmd": 0.2184295952320099, "regularization/rkhs_norm": 260.0352478027344, "regularization/w1": 1.2835988998413086, "rewards/chosen": 0.48960388469249705, "rewards/margins": 0.7395275191096772, "rewards/rejected": -0.24992363441718016, "step": 1080 }, { "epoch": 1.4248704663212435, "grad_norm": 21.347990036010742, "kl": 8.728641510009766, "learning_rate": 5.769567702869052e-07, "logits/chosen": -33387603.11179173, "logits/rejected": -35701879.22169059, "logps/chosen": -460.062547856049, "logps/rejected": -376.56215111642746, "loss": 0.5983, "loss/base_kto": 3.331209659576416, "metrics/advantage_var": 495.9743347167969, "regularization/lipschitz_norm": 1483.7119140625, "regularization/mmd": 0.20908823609352112, "regularization/rkhs_norm": 248.91455078125, "regularization/w1": 1.2463181018829346, "rewards/chosen": 0.3678303787208078, "rewards/margins": 0.7245289335796345, "rewards/rejected": -0.35669855485882673, "step": 1100 }, { "epoch": 1.450777202072539, "grad_norm": 19.782438278198242, "kl": 17.806982040405273, "learning_rate": 5.629197799301614e-07, "logits/chosen": -35410609.168253966, "logits/rejected": -36458754.363076925, "logps/chosen": -471.03184523809523, "logps/rejected": -367.13396634615384, "loss": 0.6164, "loss/base_kto": 3.304821729660034, "metrics/advantage_var": 631.5667724609375, "regularization/lipschitz_norm": 1657.6304931640625, "regularization/mmd": 0.23422546684741974, "regularization/rkhs_norm": 278.83984375, "regularization/w1": 1.3924096822738647, "rewards/chosen": 0.54564451187376, "rewards/margins": 0.7249720687773056, "rewards/rejected": -0.17932755690354568, "step": 1120 }, { "epoch": 1.4766839378238341, "grad_norm": 16.90350341796875, "kl": 15.593917846679688, "learning_rate": 5.488322096317633e-07, "logits/chosen": -34073868.15313936, "logits/rejected": -34781618.42424242, "logps/chosen": -470.34126148545175, "logps/rejected": -373.5643191786284, "loss": 0.6019, "loss/base_kto": 3.309987783432007, "metrics/advantage_var": 547.5170288085938, "regularization/lipschitz_norm": 1533.3909912109375, "regularization/mmd": 0.21713657677173615, "regularization/rkhs_norm": 258.4959411621094, "regularization/w1": 1.288048505783081, "rewards/chosen": 0.4688326264596095, "rewards/margins": 0.7340357099907473, "rewards/rejected": -0.26520308353113786, "step": 1140 }, { "epoch": 1.5025906735751295, "grad_norm": 17.07435417175293, "kl": 16.390722274780273, "learning_rate": 5.347053841052518e-07, "logits/chosen": -35766201.1572327, "logits/rejected": -36289828.571428575, "logps/chosen": -485.7150157232704, "logps/rejected": -376.8792216614907, "loss": 0.6122, "loss/base_kto": 3.317823886871338, "metrics/advantage_var": 673.7321166992188, "regularization/lipschitz_norm": 1607.3251953125, "regularization/mmd": 0.22924481332302094, "regularization/rkhs_norm": 272.91046142578125, "regularization/w1": 1.3501532077789307, "rewards/chosen": 0.54358586725199, "rewards/margins": 0.7645848089933647, "rewards/rejected": -0.22099894174137472, "step": 1160 }, { "epoch": 1.528497409326425, "grad_norm": 20.586442947387695, "kl": 8.326224327087402, "learning_rate": 5.205506596206531e-07, "logits/chosen": -35506605.41935484, "logits/rejected": -36913164.412121214, "logps/chosen": -498.81612903225806, "logps/rejected": -383.63522727272726, "loss": 0.6178, "loss/base_kto": 3.3446462154388428, "metrics/advantage_var": 600.1603393554688, "regularization/lipschitz_norm": 1631.9766845703125, "regularization/mmd": 0.226824089884758, "regularization/rkhs_norm": 270.0286865234375, "regularization/w1": 1.3708603382110596, "rewards/chosen": 0.33258100940335183, "rewards/margins": 0.706335591663946, "rewards/rejected": -0.3737545822605942, "step": 1180 }, { "epoch": 1.5544041450777202, "grad_norm": 14.240646362304688, "kl": 11.048199653625488, "learning_rate": 5.063794148754032e-07, "logits/chosen": -33645490.20775194, "logits/rejected": -35844999.055118114, "logps/chosen": -481.35532945736435, "logps/rejected": -356.21001476377955, "loss": 0.5999, "loss/base_kto": 3.2740700244903564, "metrics/advantage_var": 554.83984375, "regularization/lipschitz_norm": 1556.0499267578125, "regularization/mmd": 0.21828582882881165, "regularization/rkhs_norm": 259.8641052246094, "regularization/w1": 1.3070820569992065, "rewards/chosen": 0.45705481240915696, "rewards/margins": 0.8093554052671786, "rewards/rejected": -0.3523005928580217, "step": 1200 }, { "epoch": 1.5803108808290154, "grad_norm": 21.553014755249023, "kl": 11.094316482543945, "learning_rate": 4.922030418472422e-07, "logits/chosen": -34676400.98765432, "logits/rejected": -36567422.37974683, "logps/chosen": -501.79306520061726, "logps/rejected": -371.48116099683546, "loss": 0.6124, "loss/base_kto": 3.364614963531494, "metrics/advantage_var": 587.3946533203125, "regularization/lipschitz_norm": 1561.5902099609375, "regularization/mmd": 0.2229761928319931, "regularization/rkhs_norm": 265.4478454589844, "regularization/w1": 1.3117358684539795, "rewards/chosen": 0.3346147890444155, "rewards/margins": 0.7078894835595955, "rewards/rejected": -0.37327469451517997, "step": 1220 }, { "epoch": 1.6062176165803108, "grad_norm": 18.022768020629883, "kl": 15.335441589355469, "learning_rate": 4.780329366364336e-07, "logits/chosen": -33522519.174114022, "logits/rejected": -34918646.668779716, "logps/chosen": -460.5504622496148, "logps/rejected": -354.3644512678288, "loss": 0.6058, "loss/base_kto": 3.3383285999298096, "metrics/advantage_var": 562.71142578125, "regularization/lipschitz_norm": 1535.8997802734375, "regularization/mmd": 0.21826408803462982, "regularization/rkhs_norm": 259.83819580078125, "regularization/w1": 1.2901560068130493, "rewards/chosen": 0.524051143134871, "rewards/margins": 0.7177906820379638, "rewards/rejected": -0.1937395389030928, "step": 1240 }, { "epoch": 1.6321243523316062, "grad_norm": 17.134130477905273, "kl": 6.6206889152526855, "learning_rate": 4.638804903046684e-07, "logits/chosen": -35148567.578947365, "logits/rejected": -37054936.38095238, "logps/chosen": -505.05653782894734, "logps/rejected": -380.48214285714283, "loss": 0.6256, "loss/base_kto": 3.3530690670013428, "metrics/advantage_var": 691.9746704101562, "regularization/lipschitz_norm": 1683.4412841796875, "regularization/mmd": 0.23729148507118225, "regularization/rkhs_norm": 282.4898376464844, "regularization/w1": 1.4140905141830444, "rewards/chosen": 0.25868932824385793, "rewards/margins": 0.7247344354041536, "rewards/rejected": -0.46604510716029574, "step": 1260 }, { "epoch": 1.6580310880829017, "grad_norm": 18.29180145263672, "kl": 10.3164701461792, "learning_rate": 4.497570797180217e-07, "logits/chosen": -33816487.64252696, "logits/rejected": -34764576.05071315, "logps/chosen": -490.7649268104777, "logps/rejected": -366.11660558637084, "loss": 0.5993, "loss/base_kto": 3.299171209335327, "metrics/advantage_var": 547.89013671875, "regularization/lipschitz_norm": 1523.284423828125, "regularization/mmd": 0.21546481549739838, "regularization/rkhs_norm": 256.5057067871094, "regularization/w1": 1.2795588970184326, "rewards/chosen": 0.41266320556264446, "rewards/margins": 0.7335773032715143, "rewards/rejected": -0.32091409770886986, "step": 1280 }, { "epoch": 1.6839378238341969, "grad_norm": 16.146881103515625, "kl": 13.290518760681152, "learning_rate": 4.3567405840131853e-07, "logits/chosen": -33954004.08037094, "logits/rejected": -34616496.328594, "logps/chosen": -471.5366112828439, "logps/rejected": -361.43907977883094, "loss": 0.5996, "loss/base_kto": 3.35132098197937, "metrics/advantage_var": 550.5408325195312, "regularization/lipschitz_norm": 1469.648681640625, "regularization/mmd": 0.2109934389591217, "regularization/rkhs_norm": 251.18264770507812, "regularization/w1": 1.2345049381256104, "rewards/chosen": 0.42645782517870945, "rewards/margins": 0.6939193759229334, "rewards/rejected": -0.26746155074422395, "step": 1300 }, { "epoch": 1.709844559585492, "grad_norm": 20.550386428833008, "kl": 12.950957298278809, "learning_rate": 4.2164274741126506e-07, "logits/chosen": -34710448.53879941, "logits/rejected": -34624297.59463987, "logps/chosen": -472.0133144216691, "logps/rejected": -361.9915201005025, "loss": 0.5968, "loss/base_kto": 3.3124001026153564, "metrics/advantage_var": 535.0121459960938, "regularization/lipschitz_norm": 1486.1500244140625, "regularization/mmd": 0.21363840997219086, "regularization/rkhs_norm": 254.33140563964844, "regularization/w1": 1.2483659982681274, "rewards/chosen": 0.5021344432020955, "rewards/margins": 0.7558174599296134, "rewards/rejected": -0.2536830167275178, "step": 1320 }, { "epoch": 1.7357512953367875, "grad_norm": 14.962956428527832, "kl": 16.535037994384766, "learning_rate": 4.0767442623567856e-07, "logits/chosen": -35013050.64231355, "logits/rejected": -37614593.64365971, "logps/chosen": -467.08485540334857, "logps/rejected": -364.5472010433387, "loss": 0.6021, "loss/base_kto": 3.331411838531494, "metrics/advantage_var": 533.7169799804688, "regularization/lipschitz_norm": 1511.59228515625, "regularization/mmd": 0.2157890796661377, "regularization/rkhs_norm": 256.8918151855469, "regularization/w1": 1.2697376012802124, "rewards/chosen": 0.480613766558457, "rewards/margins": 0.7152077779417586, "rewards/rejected": -0.23459401138330158, "step": 1340 }, { "epoch": 1.761658031088083, "grad_norm": 19.377729415893555, "kl": 22.779943466186523, "learning_rate": 3.937803237261357e-07, "logits/chosen": -34853013.77910448, "logits/rejected": -35985589.29836065, "logps/chosen": -465.0221082089552, "logps/rejected": -394.65512295081965, "loss": 0.5978, "loss/base_kto": 3.3015334606170654, "metrics/advantage_var": 565.37890625, "regularization/lipschitz_norm": 1508.641845703125, "regularization/mmd": 0.21362176537513733, "regularization/rkhs_norm": 254.31163024902344, "regularization/w1": 1.267259120941162, "rewards/chosen": 0.618648289922458, "rewards/margins": 0.7440603022415538, "rewards/rejected": -0.1254120123190958, "step": 1360 }, { "epoch": 1.7875647668393784, "grad_norm": 19.16179084777832, "kl": 18.917919158935547, "learning_rate": 3.7997160907132456e-07, "logits/chosen": -34662096.7133758, "logits/rejected": -35347914.60122699, "logps/chosen": -455.1887440286624, "logps/rejected": -390.7230157208589, "loss": 0.6095, "loss/base_kto": 3.3978583812713623, "metrics/advantage_var": 583.5626831054688, "regularization/lipschitz_norm": 1502.7821044921875, "regularization/mmd": 0.21602332592010498, "regularization/rkhs_norm": 257.1706237792969, "regularization/w1": 1.2623369693756104, "rewards/chosen": 0.507355125087082, "rewards/margins": 0.6383283442272577, "rewards/rejected": -0.13097321914017565, "step": 1380 }, { "epoch": 1.8134715025906736, "grad_norm": 27.668109893798828, "kl": 20.363744735717773, "learning_rate": 3.662593828183601e-07, "logits/chosen": -33695011.45814308, "logits/rejected": -34444677.547351524, "logps/chosen": -499.056697108067, "logps/rejected": -376.24887138844304, "loss": 0.6014, "loss/base_kto": 3.3564345836639404, "metrics/advantage_var": 530.4850463867188, "regularization/lipschitz_norm": 1482.207275390625, "regularization/mmd": 0.20999467372894287, "regularization/rkhs_norm": 249.99365234375, "regularization/w1": 1.2450541257858276, "rewards/chosen": 0.5535609508032486, "rewards/margins": 0.6984056427824258, "rewards/rejected": -0.14484469197917713, "step": 1400 }, { "epoch": 1.8393782383419688, "grad_norm": 20.353731155395508, "kl": 17.986051559448242, "learning_rate": 3.5265466794927725e-07, "logits/chosen": -32922226.602254428, "logits/rejected": -34518328.32776935, "logps/chosen": -479.0992351046699, "logps/rejected": -366.3035375569044, "loss": 0.5932, "loss/base_kto": 3.274026870727539, "metrics/advantage_var": 492.223388671875, "regularization/lipschitz_norm": 1502.2119140625, "regularization/mmd": 0.20957601070404053, "regularization/rkhs_norm": 249.49526977539062, "regularization/w1": 1.2618581056594849, "rewards/chosen": 0.5238556547057418, "rewards/margins": 0.763230188838009, "rewards/rejected": -0.23937453413226717, "step": 1420 }, { "epoch": 1.8652849740932642, "grad_norm": 33.46779251098633, "kl": 13.584640502929688, "learning_rate": 3.3916840101987887e-07, "logits/chosen": -34771941.01085272, "logits/rejected": -37004770.16692913, "logps/chosen": -504.6795058139535, "logps/rejected": -387.7888533464567, "loss": 0.6056, "loss/base_kto": 3.319662570953369, "metrics/advantage_var": 564.02587890625, "regularization/lipschitz_norm": 1554.7366943359375, "regularization/mmd": 0.21924880146980286, "regularization/rkhs_norm": 261.010498046875, "regularization/w1": 1.3059788942337036, "rewards/chosen": 0.42508180603500484, "rewards/margins": 0.7293694536728001, "rewards/rejected": -0.30428764763779526, "step": 1440 }, { "epoch": 1.8911917098445596, "grad_norm": 17.88528060913086, "kl": 18.6299991607666, "learning_rate": 3.258114233680583e-07, "logits/chosen": -32324284.369529985, "logits/rejected": -34988773.357466064, "logps/chosen": -468.8882192058347, "logps/rejected": -365.79965592006033, "loss": 0.5903, "loss/base_kto": 3.2499802112579346, "metrics/advantage_var": 545.6959838867188, "regularization/lipschitz_norm": 1498.6328125, "regularization/mmd": 0.21394610404968262, "regularization/rkhs_norm": 254.69775390625, "regularization/w1": 1.2588516473770142, "rewards/chosen": 0.5019449144360312, "rewards/margins": 0.7761924190831725, "rewards/rejected": -0.2742475046471413, "step": 1460 }, { "epoch": 1.917098445595855, "grad_norm": 18.10062026977539, "kl": 9.969759941101074, "learning_rate": 3.1259447239866796e-07, "logits/chosen": -33411004.27086614, "logits/rejected": -35512853.43255814, "logps/chosen": -455.75275590551183, "logps/rejected": -363.99176356589146, "loss": 0.6041, "loss/base_kto": 3.375481367111206, "metrics/advantage_var": 507.2935485839844, "regularization/lipschitz_norm": 1484.4630126953125, "regularization/mmd": 0.2105344831943512, "regularization/rkhs_norm": 250.63633728027344, "regularization/w1": 1.2469488382339478, "rewards/chosen": 0.3615355243833046, "rewards/margins": 0.6633751192612721, "rewards/rejected": -0.3018395948779675, "step": 1480 }, { "epoch": 1.9430051813471503, "grad_norm": 15.774064064025879, "kl": 8.933207511901855, "learning_rate": 2.9952817295193435e-07, "logits/chosen": -35389627.356466874, "logits/rejected": -36346011.343653254, "logps/chosen": -511.0354889589905, "logps/rejected": -374.84123452012386, "loss": 0.6025, "loss/base_kto": 3.268543243408203, "metrics/advantage_var": 586.6609497070312, "regularization/lipschitz_norm": 1580.751953125, "regularization/mmd": 0.22369682788848877, "regularization/rkhs_norm": 266.3057556152344, "regularization/w1": 1.3278316259384155, "rewards/chosen": 0.3532002927377021, "rewards/margins": 0.8226004210815971, "rewards/rejected": -0.4694001283438951, "step": 1500 }, { "epoch": 1.9689119170984455, "grad_norm": 15.750038146972656, "kl": 10.857072830200195, "learning_rate": 2.866230287623651e-07, "logits/chosen": -34974265.25239617, "logits/rejected": -36301883.49847095, "logps/chosen": -494.6328873801917, "logps/rejected": -365.9459097859327, "loss": 0.5954, "loss/base_kto": 3.2659287452697754, "metrics/advantage_var": 526.2587890625, "regularization/lipschitz_norm": 1526.7413330078125, "regularization/mmd": 0.2148735374212265, "regularization/rkhs_norm": 255.8018341064453, "regularization/w1": 1.2824627161026, "rewards/chosen": 0.41584529206394766, "rewards/margins": 0.7909994664953315, "rewards/rejected": -0.37515417443138377, "step": 1520 }, { "epoch": 1.994818652849741, "grad_norm": 17.60833168029785, "kl": 8.485814094543457, "learning_rate": 2.738894140150075e-07, "logits/chosen": -35663408.801292405, "logits/rejected": -35159800.64145234, "logps/chosen": -486.67154684975765, "logps/rejected": -404.29850605143724, "loss": 0.6112, "loss/base_kto": 3.3222947120666504, "metrics/advantage_var": 591.0783081054688, "regularization/lipschitz_norm": 1599.240234375, "regularization/mmd": 0.22431206703186035, "regularization/rkhs_norm": 267.0381774902344, "regularization/w1": 1.343361735343933, "rewards/chosen": 0.26061789862366214, "rewards/margins": 0.7497240927778792, "rewards/rejected": -0.4891061941542171, "step": 1540 }, { "epoch": 2.0207253886010363, "grad_norm": 17.947343826293945, "kl": 6.821866512298584, "learning_rate": 2.6133756500585156e-07, "logits/chosen": -34982428.57315234, "logits/rejected": -35088347.36910569, "logps/chosen": -474.1717100301659, "logps/rejected": -404.2780741869919, "loss": 0.5755, "loss/base_kto": 3.2221360206604004, "metrics/advantage_var": 465.04351806640625, "regularization/lipschitz_norm": 1403.3729248046875, "regularization/mmd": 0.20289479196071625, "regularization/rkhs_norm": 241.54141235351562, "regularization/w1": 1.178833246231079, "rewards/chosen": 0.4334717717465592, "rewards/margins": 0.8401581979247859, "rewards/rejected": -0.40668642617822665, "step": 1560 }, { "epoch": 2.0466321243523318, "grad_norm": 16.408185958862305, "kl": 9.983183860778809, "learning_rate": 2.489775719130767e-07, "logits/chosen": -34488626.06041335, "logits/rejected": -35019982.05837174, "logps/chosen": -476.0058624801272, "logps/rejected": -371.22652649769583, "loss": 0.5656, "loss/base_kto": 3.2505149841308594, "metrics/advantage_var": 410.3097839355469, "regularization/lipschitz_norm": 1294.3602294921875, "regularization/mmd": 0.18716847896575928, "regularization/rkhs_norm": 222.8196258544922, "regularization/w1": 1.087262511253357, "rewards/chosen": 0.41420029001887915, "rewards/margins": 0.7896021282365251, "rewards/rejected": -0.37540183821764594, "step": 1580 }, { "epoch": 2.0725388601036268, "grad_norm": 16.845909118652344, "kl": 8.303881645202637, "learning_rate": 2.3681937068576303e-07, "logits/chosen": -33243454.13592233, "logits/rejected": -35099493.31722055, "logps/chosen": -481.70378236245955, "logps/rejected": -366.5403606495468, "loss": 0.5581, "loss/base_kto": 3.1919381618499756, "metrics/advantage_var": 431.11602783203125, "regularization/lipschitz_norm": 1283.7459716796875, "regularization/mmd": 0.1944064199924469, "regularization/rkhs_norm": 231.4362335205078, "regularization/w1": 1.078346610069275, "rewards/chosen": 0.4814342511124595, "rewards/margins": 0.8682639154522915, "rewards/rejected": -0.38682966433983196, "step": 1600 }, { "epoch": 2.098445595854922, "grad_norm": 18.615808486938477, "kl": 8.465904235839844, "learning_rate": 2.2487273505658e-07, "logits/chosen": -33294290.051282052, "logits/rejected": -35143998.43902439, "logps/chosen": -470.43569711538464, "logps/rejected": -368.7186309070122, "loss": 0.5498, "loss/base_kto": 3.2166802883148193, "metrics/advantage_var": 385.70819091796875, "regularization/lipschitz_norm": 1189.2044677734375, "regularization/mmd": 0.18294848501682281, "regularization/rkhs_norm": 217.7958221435547, "regularization/w1": 0.9989317059516907, "rewards/chosen": 0.3834571104783278, "rewards/margins": 0.8170791450629314, "rewards/rejected": -0.43362203458460363, "step": 1620 }, { "epoch": 2.1243523316062176, "grad_norm": 14.12332534790039, "kl": 4.959784984588623, "learning_rate": 2.131472686848817e-07, "logits/chosen": -33501098.13664596, "logits/rejected": -34493008.50314465, "logps/chosen": -511.83021156832297, "logps/rejected": -377.47845420597486, "loss": 0.5647, "loss/base_kto": 3.2280776500701904, "metrics/advantage_var": 395.3878479003906, "regularization/lipschitz_norm": 1310.1051025390625, "regularization/mmd": 0.1888968050479889, "regularization/rkhs_norm": 224.8771514892578, "regularization/w1": 1.1004881858825684, "rewards/chosen": 0.3688108313898122, "rewards/margins": 0.8398954740999881, "rewards/rejected": -0.4710846427101759, "step": 1640 }, { "epoch": 2.150259067357513, "grad_norm": 17.490766525268555, "kl": 8.799834251403809, "learning_rate": 2.016523974365188e-07, "logits/chosen": -32949561.532428358, "logits/rejected": -34604123.28038898, "logps/chosen": -469.9966063348416, "logps/rejected": -370.9157718800648, "loss": 0.5586, "loss/base_kto": 3.2049686908721924, "metrics/advantage_var": 434.2018737792969, "regularization/lipschitz_norm": 1275.1317138671875, "regularization/mmd": 0.19241748750209808, "regularization/rkhs_norm": 229.0684356689453, "regularization/w1": 1.0711106061935425, "rewards/chosen": 0.45355602051517724, "rewards/margins": 0.8488865145101884, "rewards/rejected": -0.39533049399501113, "step": 1660 }, { "epoch": 2.1761658031088085, "grad_norm": 18.122283935546875, "kl": 12.252435684204102, "learning_rate": 1.9039736180657372e-07, "logits/chosen": -33630768.87636933, "logits/rejected": -35612505.85959438, "logps/chosen": -494.43446791862283, "logps/rejected": -406.71265600624025, "loss": 0.5624, "loss/base_kto": 3.14216685295105, "metrics/advantage_var": 451.7399597167969, "regularization/lipschitz_norm": 1377.656494140625, "regularization/mmd": 0.19991855323314667, "regularization/rkhs_norm": 237.998291015625, "regularization/w1": 1.1572314500808716, "rewards/chosen": 0.5083081360340864, "rewards/margins": 0.914226203811485, "rewards/rejected": -0.4059180677773986, "step": 1680 }, { "epoch": 2.2020725388601035, "grad_norm": 17.93985366821289, "kl": 9.2858304977417, "learning_rate": 1.7939120949111498e-07, "logits/chosen": -34496537.40155039, "logits/rejected": -35233724.27086614, "logps/chosen": -457.42427325581394, "logps/rejected": -402.57536909448817, "loss": 0.5604, "loss/base_kto": 3.255056381225586, "metrics/advantage_var": 400.959228515625, "regularization/lipschitz_norm": 1238.921875, "regularization/mmd": 0.1878456175327301, "regularization/rkhs_norm": 223.625732421875, "regularization/w1": 1.040694236755371, "rewards/chosen": 0.39651699805444524, "rewards/margins": 0.815335049850705, "rewards/rejected": -0.41881805179625986, "step": 1700 }, { "epoch": 2.227979274611399, "grad_norm": 14.545886993408203, "kl": 13.314804077148438, "learning_rate": 1.6864278811393523e-07, "logits/chosen": -33729181.786163524, "logits/rejected": -35633031.1552795, "logps/chosen": -485.95700668238993, "logps/rejected": -368.83933423913044, "loss": 0.5529, "loss/base_kto": 3.202782154083252, "metrics/advantage_var": 382.2320251464844, "regularization/lipschitz_norm": 1233.8470458984375, "regularization/mmd": 0.18430650234222412, "regularization/rkhs_norm": 219.41250610351562, "regularization/w1": 1.0364315509796143, "rewards/chosen": 0.4813539517000786, "rewards/margins": 0.8171038918022234, "rewards/rejected": -0.3357499401021448, "step": 1720 }, { "epoch": 2.2538860103626943, "grad_norm": 17.223203659057617, "kl": 11.675740242004395, "learning_rate": 1.5816073811412584e-07, "logits/chosen": -34248610.46929134, "logits/rejected": -34210255.578294575, "logps/chosen": -477.9596456692913, "logps/rejected": -377.89670542635656, "loss": 0.5615, "loss/base_kto": 3.249102830886841, "metrics/advantage_var": 388.05426025390625, "regularization/lipschitz_norm": 1258.7603759765625, "regularization/mmd": 0.18586070835590363, "regularization/rkhs_norm": 221.2627410888672, "regularization/w1": 1.0573586225509644, "rewards/chosen": 0.4373135303887795, "rewards/margins": 0.7716517673528056, "rewards/rejected": -0.33433823696402615, "step": 1740 }, { "epoch": 2.2797927461139897, "grad_norm": 14.629900932312012, "kl": 10.75137710571289, "learning_rate": 1.4795348580020207e-07, "logits/chosen": -35498980.75743349, "logits/rejected": -35540998.3900156, "logps/chosen": -479.5279244913928, "logps/rejected": -372.66873049922, "loss": 0.5623, "loss/base_kto": 3.206221103668213, "metrics/advantage_var": 418.78106689453125, "regularization/lipschitz_norm": 1310.5302734375, "regularization/mmd": 0.19171538949012756, "regularization/rkhs_norm": 228.2325897216797, "regularization/w1": 1.1008453369140625, "rewards/chosen": 0.4715915733659771, "rewards/margins": 0.834670483729423, "rewards/rejected": -0.3630789103634458, "step": 1760 }, { "epoch": 2.305699481865285, "grad_norm": 14.324227333068848, "kl": 10.652953147888184, "learning_rate": 1.3802923657636355e-07, "logits/chosen": -33992343.502276175, "logits/rejected": -35529716.45732689, "logps/chosen": -469.60124241274656, "logps/rejected": -362.1941425120773, "loss": 0.5576, "loss/base_kto": 3.2229363918304443, "metrics/advantage_var": 393.4222717285156, "regularization/lipschitz_norm": 1256.2760009765625, "regularization/mmd": 0.18269923329353333, "regularization/rkhs_norm": 217.4990692138672, "regularization/w1": 1.0552717447280884, "rewards/chosen": 0.46617642809299126, "rewards/margins": 0.8198295296224674, "rewards/rejected": -0.35365310152947615, "step": 1780 }, { "epoch": 2.33160621761658, "grad_norm": 19.66016960144043, "kl": 13.546658515930176, "learning_rate": 1.28395968346336e-07, "logits/chosen": -35092717.44927536, "logits/rejected": -37277835.848254934, "logps/chosen": -495.62847222222223, "logps/rejected": -386.6493740515933, "loss": 0.5729, "loss/base_kto": 3.199143171310425, "metrics/advantage_var": 489.4619140625, "regularization/lipschitz_norm": 1405.9876708984375, "regularization/mmd": 0.2029687464237213, "regularization/rkhs_norm": 241.6294708251953, "regularization/w1": 1.1810296773910522, "rewards/chosen": 0.5008374888347926, "rewards/margins": 0.8418600092329456, "rewards/rejected": -0.34102252039815295, "step": 1800 }, { "epoch": 2.3575129533678756, "grad_norm": 19.954313278198242, "kl": 10.985320091247559, "learning_rate": 1.1906142510009415e-07, "logits/chosen": -34574593.61006289, "logits/rejected": -36158731.13043478, "logps/chosen": -475.04795597484275, "logps/rejected": -372.2355638586956, "loss": 0.552, "loss/base_kto": 3.1939830780029297, "metrics/advantage_var": 377.78436279296875, "regularization/lipschitz_norm": 1235.314208984375, "regularization/mmd": 0.18432655930519104, "regularization/rkhs_norm": 219.43638610839844, "regularization/w1": 1.0376638174057007, "rewards/chosen": 0.4707678069108687, "rewards/margins": 0.836925907299674, "rewards/rejected": -0.3661581003888053, "step": 1820 }, { "epoch": 2.383419689119171, "grad_norm": 21.724349975585938, "kl": 12.762263298034668, "learning_rate": 1.1003311068862547e-07, "logits/chosen": -35928067.21507064, "logits/rejected": -36228107.147744946, "logps/chosen": -489.86960361067503, "logps/rejected": -388.6978032659409, "loss": 0.5599, "loss/base_kto": 3.20194935798645, "metrics/advantage_var": 413.9568786621094, "regularization/lipschitz_norm": 1292.7647705078125, "regularization/mmd": 0.19111108779907227, "regularization/rkhs_norm": 227.51321411132812, "regularization/w1": 1.085922360420227, "rewards/chosen": 0.5163855919471154, "rewards/margins": 0.8182538467555087, "rewards/rejected": -0.3018682548083933, "step": 1840 }, { "epoch": 2.4093264248704664, "grad_norm": 18.801280975341797, "kl": 15.24552059173584, "learning_rate": 1.0131828279173588e-07, "logits/chosen": -34493345.18518519, "logits/rejected": -36644008.50632911, "logps/chosen": -472.06785300925924, "logps/rejected": -345.8674347310127, "loss": 0.5539, "loss/base_kto": 3.1891977787017822, "metrics/advantage_var": 402.05340576171875, "regularization/lipschitz_norm": 1254.8857421875, "regularization/mmd": 0.1878947615623474, "regularization/rkhs_norm": 223.68423461914062, "regularization/w1": 1.054103970527649, "rewards/chosen": 0.5337012020158179, "rewards/margins": 0.8231312167106113, "rewards/rejected": -0.2894300146947933, "step": 1860 }, { "epoch": 2.4352331606217614, "grad_norm": 18.543928146362305, "kl": 14.762819290161133, "learning_rate": 9.292394708374596e-08, "logits/chosen": -34066493.686746985, "logits/rejected": -35712126.33766234, "logps/chosen": -483.414250753012, "logps/rejected": -387.5329748376623, "loss": 0.5537, "loss/base_kto": 3.1797683238983154, "metrics/advantage_var": 413.9333190917969, "regularization/lipschitz_norm": 1260.632080078125, "regularization/mmd": 0.1905139535665512, "regularization/rkhs_norm": 226.80235290527344, "regularization/w1": 1.0589308738708496, "rewards/chosen": 0.6176203072789204, "rewards/margins": 0.8547411709580879, "rewards/rejected": -0.23712086367916752, "step": 1880 }, { "epoch": 2.461139896373057, "grad_norm": 17.16962432861328, "kl": 14.960174560546875, "learning_rate": 8.48568516017727e-08, "logits/chosen": -33796794.61682243, "logits/rejected": -34877481.73040752, "logps/chosen": -477.4481113707165, "logps/rejected": -361.3479134012539, "loss": 0.5596, "loss/base_kto": 3.220236301422119, "metrics/advantage_var": 375.538818359375, "regularization/lipschitz_norm": 1273.143798828125, "regularization/mmd": 0.18699096143245697, "regularization/rkhs_norm": 222.60830688476562, "regularization/w1": 1.0694407224655151, "rewards/chosen": 0.5138200896551305, "rewards/margins": 0.8047764014938844, "rewards/rejected": -0.2909563118387539, "step": 1900 }, { "epoch": 2.4870466321243523, "grad_norm": 19.583574295043945, "kl": 13.168062210083008, "learning_rate": 7.71234813211169e-08, "logits/chosen": -34306642.58064516, "logits/rejected": -36551040.77575757, "logps/chosen": -493.7453125, "logps/rejected": -375.03804450757576, "loss": 0.5504, "loss/base_kto": 3.174727439880371, "metrics/advantage_var": 382.2155456542969, "regularization/lipschitz_norm": 1240.6024169921875, "regularization/mmd": 0.1866205632686615, "regularization/rkhs_norm": 222.16734313964844, "regularization/w1": 1.042106032371521, "rewards/chosen": 0.5039766865391885, "rewards/margins": 0.8394093980537481, "rewards/rejected": -0.33543271151455967, "step": 1920 }, { "epoch": 2.5129533678756477, "grad_norm": 18.3836727142334, "kl": 9.91015911102295, "learning_rate": 6.973005294212353e-08, "logits/chosen": -34146055.47158218, "logits/rejected": -35701917.91414944, "logps/chosen": -491.77932987711216, "logps/rejected": -386.9768978537361, "loss": 0.5609, "loss/base_kto": 3.171435832977295, "metrics/advantage_var": 433.8333435058594, "regularization/lipschitz_norm": 1331.4329833984375, "regularization/mmd": 0.19731023907661438, "regularization/rkhs_norm": 234.8931427001953, "regularization/w1": 1.118403673171997, "rewards/chosen": 0.473641109906034, "rewards/margins": 0.8789256094216341, "rewards/rejected": -0.40528449951560014, "step": 1940 }, { "epoch": 2.538860103626943, "grad_norm": 15.16122055053711, "kl": 12.20919418334961, "learning_rate": 6.268250989270102e-08, "logits/chosen": -33439407.429457363, "logits/rejected": -37277218.67086614, "logps/chosen": -493.9566860465116, "logps/rejected": -350.99931102362206, "loss": 0.565, "loss/base_kto": 3.2192063331604004, "metrics/advantage_var": 436.88458251953125, "regularization/lipschitz_norm": 1318.0078125, "regularization/mmd": 0.19399665296077728, "regularization/rkhs_norm": 230.9484100341797, "regularization/w1": 1.1071265935897827, "rewards/chosen": 0.5183074241460756, "rewards/margins": 0.8289919406322961, "rewards/rejected": -0.3106845164862205, "step": 1960 }, { "epoch": 2.5647668393782386, "grad_norm": 12.267426490783691, "kl": 11.683924674987793, "learning_rate": 5.598651755051975e-08, "logits/chosen": -33398228.161550887, "logits/rejected": -35680361.34341906, "logps/chosen": -462.34344709208403, "logps/rejected": -372.54387291981845, "loss": 0.5572, "loss/base_kto": 3.2189643383026123, "metrics/advantage_var": 393.2417907714844, "regularization/lipschitz_norm": 1252.6536865234375, "regularization/mmd": 0.18667958676815033, "regularization/rkhs_norm": 222.2375946044922, "regularization/w1": 1.0522291660308838, "rewards/chosen": 0.46127393288065427, "rewards/margins": 0.8193112380113747, "rewards/rejected": -0.3580373051307205, "step": 1980 }, { "epoch": 2.5906735751295336, "grad_norm": 14.912087440490723, "kl": 12.115736961364746, "learning_rate": 4.964745868872933e-08, "logits/chosen": -34119704.6006006, "logits/rejected": -35423252.013029315, "logps/chosen": -475.6275807057057, "logps/rejected": -388.89311889250814, "loss": 0.5641, "loss/base_kto": 3.2131574153900146, "metrics/advantage_var": 409.0126647949219, "regularization/lipschitz_norm": 1318.6597900390625, "regularization/mmd": 0.19223010540008545, "regularization/rkhs_norm": 228.84536743164062, "regularization/w1": 1.107674241065979, "rewards/chosen": 0.4986439839497701, "rewards/margins": 0.8328326378522029, "rewards/rejected": -0.3341886539024328, "step": 2000 }, { "epoch": 2.616580310880829, "grad_norm": 14.157485961914062, "kl": 11.526637077331543, "learning_rate": 4.3670429148855493e-08, "logits/chosen": -35234653.433715224, "logits/rejected": -35704262.60089686, "logps/chosen": -489.0647504091653, "logps/rejected": -368.95975803437966, "loss": 0.5554, "loss/base_kto": 3.2270355224609375, "metrics/advantage_var": 381.1188659667969, "regularization/lipschitz_norm": 1226.8309326171875, "regularization/mmd": 0.18547473847866058, "regularization/rkhs_norm": 220.8032684326172, "regularization/w1": 1.0305380821228027, "rewards/chosen": 0.481105223810224, "rewards/margins": 0.7920113760080005, "rewards/rejected": -0.3109061521977765, "step": 2020 }, { "epoch": 2.6424870466321244, "grad_norm": 15.411792755126953, "kl": 12.602194786071777, "learning_rate": 3.806023374435663e-08, "logits/chosen": -34904763.241274655, "logits/rejected": -35494422.26086956, "logps/chosen": -484.5643019726859, "logps/rejected": -387.20959138486313, "loss": 0.5531, "loss/base_kto": 3.169900894165039, "metrics/advantage_var": 401.9240417480469, "regularization/lipschitz_norm": 1265.5244140625, "regularization/mmd": 0.19208136200904846, "regularization/rkhs_norm": 228.66831970214844, "regularization/w1": 1.0630406141281128, "rewards/chosen": 0.4658034560532056, "rewards/margins": 0.8653867412267537, "rewards/rejected": -0.3995832851735482, "step": 2040 }, { "epoch": 2.66839378238342, "grad_norm": 17.928422927856445, "kl": 12.969223022460938, "learning_rate": 3.282138239813037e-08, "logits/chosen": -33836700.37829457, "logits/rejected": -35256174.86614173, "logps/chosen": -483.8582364341085, "logps/rejected": -375.6524114173228, "loss": 0.5548, "loss/base_kto": 3.20304799079895, "metrics/advantage_var": 395.5731506347656, "regularization/lipschitz_norm": 1245.0765380859375, "regularization/mmd": 0.18924403190612793, "regularization/rkhs_norm": 225.29051208496094, "regularization/w1": 1.0458643436431885, "rewards/chosen": 0.47001281265140504, "rewards/margins": 0.7970668619255192, "rewards/rejected": -0.3270540492741142, "step": 2060 }, { "epoch": 2.694300518134715, "grad_norm": 14.488730430603027, "kl": 14.978285789489746, "learning_rate": 2.795808651707793e-08, "logits/chosen": -35953340.88540032, "logits/rejected": -37100988.31726283, "logps/chosen": -486.3620977237049, "logps/rejected": -371.02148133748057, "loss": 0.5518, "loss/base_kto": 3.1891443729400635, "metrics/advantage_var": 380.630859375, "regularization/lipschitz_norm": 1236.129150390625, "regularization/mmd": 0.18714351952075958, "regularization/rkhs_norm": 222.78990173339844, "regularization/w1": 1.0383485555648804, "rewards/chosen": 0.500652127587814, "rewards/margins": 0.8110233959951818, "rewards/rejected": -0.3103712684073678, "step": 2080 }, { "epoch": 2.7202072538860103, "grad_norm": 17.652151107788086, "kl": 12.483137130737305, "learning_rate": 2.3474255606639293e-08, "logits/chosen": -33551701.333333332, "logits/rejected": -35994428.18808778, "logps/chosen": -460.87032710280374, "logps/rejected": -376.2286931818182, "loss": 0.5484, "loss/base_kto": 3.1624042987823486, "metrics/advantage_var": 377.28350830078125, "regularization/lipschitz_norm": 1237.3677978515625, "regularization/mmd": 0.18508975207805634, "regularization/rkhs_norm": 220.3449249267578, "regularization/w1": 1.03938889503479, "rewards/chosen": 0.5844000225126558, "rewards/margins": 0.8646310798022816, "rewards/rejected": -0.2802310572896258, "step": 2100 }, { "epoch": 2.7461139896373057, "grad_norm": 14.638246536254883, "kl": 14.82068157196045, "learning_rate": 1.9373494128020195e-08, "logits/chosen": -34098961.788519636, "logits/rejected": -35118249.00970874, "logps/chosen": -477.7122356495468, "logps/rejected": -351.9229874595469, "loss": 0.5627, "loss/base_kto": 3.2100231647491455, "metrics/advantage_var": 428.5296325683594, "regularization/lipschitz_norm": 1304.7535400390625, "regularization/mmd": 0.19541814923286438, "regularization/rkhs_norm": 232.64065551757812, "regularization/w1": 1.095992922782898, "rewards/chosen": 0.5419090247946563, "rewards/margins": 0.8043162967878552, "rewards/rejected": -0.26240727199319885, "step": 2120 }, { "epoch": 2.772020725388601, "grad_norm": 13.750174522399902, "kl": 13.8255033493042, "learning_rate": 1.5659098600638798e-08, "logits/chosen": -34473980.7232, "logits/rejected": -35339681.41679389, "logps/chosen": -478.5715, "logps/rejected": -385.5200143129771, "loss": 0.5544, "loss/base_kto": 3.1820104122161865, "metrics/advantage_var": 420.1051330566406, "regularization/lipschitz_norm": 1263.3740234375, "regularization/mmd": 0.1922682672739029, "regularization/rkhs_norm": 228.8907928466797, "regularization/w1": 1.0612342357635498, "rewards/chosen": 0.544025732421875, "rewards/margins": 0.8477923936217796, "rewards/rejected": -0.3037666611999046, "step": 2140 }, { "epoch": 2.7979274611398965, "grad_norm": 15.82647705078125, "kl": 12.365191459655762, "learning_rate": 1.2334054952120143e-08, "logits/chosen": -36220718.2848, "logits/rejected": -36358015.80458015, "logps/chosen": -504.9765, "logps/rejected": -385.2235687022901, "loss": 0.5645, "loss/base_kto": 3.17185378074646, "metrics/advantage_var": 434.1415100097656, "regularization/lipschitz_norm": 1367.070068359375, "regularization/mmd": 0.19565115869045258, "regularization/rkhs_norm": 232.9180450439453, "regularization/w1": 1.1483389139175415, "rewards/chosen": 0.55656669921875, "rewards/margins": 0.869565347126968, "rewards/rejected": -0.312998647908218, "step": 2160 }, { "epoch": 2.823834196891192, "grad_norm": 18.393125534057617, "kl": 13.640936851501465, "learning_rate": 9.401036117969108e-09, "logits/chosen": -34971681.08562197, "logits/rejected": -35987747.24357035, "logps/chosen": -480.092084006462, "logps/rejected": -379.8142492435704, "loss": 0.5515, "loss/base_kto": 3.168067693710327, "metrics/advantage_var": 382.4317321777344, "regularization/lipschitz_norm": 1257.4322509765625, "regularization/mmd": 0.1876767873764038, "regularization/rkhs_norm": 223.4247589111328, "regularization/w1": 1.0562430620193481, "rewards/chosen": 0.5432558321606169, "rewards/margins": 0.8510814718016674, "rewards/rejected": -0.3078256396410505, "step": 2180 }, { "epoch": 2.849740932642487, "grad_norm": 12.669471740722656, "kl": 13.345707893371582, "learning_rate": 6.8623998928517555e-09, "logits/chosen": -35006115.87136294, "logits/rejected": -35269734.88995215, "logps/chosen": -489.25981049004594, "logps/rejected": -395.77606658692184, "loss": 0.561, "loss/base_kto": 3.112929344177246, "metrics/advantage_var": 460.5668029785156, "regularization/lipschitz_norm": 1393.0103759765625, "regularization/mmd": 0.20509754121303558, "regularization/rkhs_norm": 244.16372680664062, "regularization/w1": 1.1701288223266602, "rewards/chosen": 0.5679244644609016, "rewards/margins": 0.9302929614424358, "rewards/rejected": -0.3623684969815341, "step": 2200 }, { "epoch": 2.8756476683937824, "grad_norm": 37.84089660644531, "kl": 13.3887357711792, "learning_rate": 4.72018703521132e-09, "logits/chosen": -34525732.74641148, "logits/rejected": -34301378.05819295, "logps/chosen": -468.1487240829346, "logps/rejected": -367.65376148545175, "loss": 0.551, "loss/base_kto": 3.2018883228302, "metrics/advantage_var": 380.1961364746094, "regularization/lipschitz_norm": 1217.9705810546875, "regularization/mmd": 0.18332134187221527, "regularization/rkhs_norm": 218.2397003173828, "regularization/w1": 1.0230953693389893, "rewards/chosen": 0.5104755115661135, "rewards/margins": 0.8121196659497276, "rewards/rejected": -0.3016441543836141, "step": 2220 }, { "epoch": 2.901554404145078, "grad_norm": 21.137928009033203, "kl": 13.122614860534668, "learning_rate": 2.976119626744267e-09, "logits/chosen": -35794062.73939394, "logits/rejected": -35638503.22580645, "logps/chosen": -483.5817234848485, "logps/rejected": -371.6561491935484, "loss": 0.5559, "loss/base_kto": 3.177448034286499, "metrics/advantage_var": 399.42236328125, "regularization/lipschitz_norm": 1283.5113525390625, "regularization/mmd": 0.1913510113954544, "regularization/rkhs_norm": 227.798828125, "regularization/w1": 1.0781495571136475, "rewards/chosen": 0.531743876139323, "rewards/margins": 0.8441938420777679, "rewards/rejected": -0.31244996593844504, "step": 2240 }, { "epoch": 2.927461139896373, "grad_norm": 13.346651077270508, "kl": 14.126541137695312, "learning_rate": 1.631599688052765e-09, "logits/chosen": -34391896.55345912, "logits/rejected": -34710617.04347826, "logps/chosen": -478.78803066037733, "logps/rejected": -377.1985636645963, "loss": 0.5567, "loss/base_kto": 3.2097671031951904, "metrics/advantage_var": 383.3074645996094, "regularization/lipschitz_norm": 1259.958740234375, "regularization/mmd": 0.18560345470905304, "regularization/rkhs_norm": 220.9564666748047, "regularization/w1": 1.0583652257919312, "rewards/chosen": 0.509803628021816, "rewards/margins": 0.8211476562814725, "rewards/rejected": -0.31134402825965646, "step": 2260 }, { "epoch": 2.9533678756476682, "grad_norm": 16.06229591369629, "kl": 13.415672302246094, "learning_rate": 6.877080515894085e-10, "logits/chosen": -34598424.075235106, "logits/rejected": -35016576.3987539, "logps/chosen": -485.39371081504703, "logps/rejected": -354.51255841121497, "loss": 0.5592, "loss/base_kto": 3.1724281311035156, "metrics/advantage_var": 424.5101623535156, "regularization/lipschitz_norm": 1316.0338134765625, "regularization/mmd": 0.19575339555740356, "regularization/rkhs_norm": 233.03977966308594, "regularization/w1": 1.1054683923721313, "rewards/chosen": 0.5497104082735355, "rewards/margins": 0.8501877184066644, "rewards/rejected": -0.3004773101331289, "step": 2280 }, { "epoch": 2.9792746113989637, "grad_norm": 15.011834144592285, "kl": 13.388748168945312, "learning_rate": 1.4520349279739663e-10, "logits/chosen": -34554275.275590554, "logits/rejected": -35839434.81550387, "logps/chosen": -486.4338582677165, "logps/rejected": -381.23968023255816, "loss": 0.5837, "loss/base_kto": 3.2260849475860596, "metrics/advantage_var": 755.8993530273438, "regularization/lipschitz_norm": 1464.78369140625, "regularization/mmd": 0.21273119747638702, "regularization/rkhs_norm": 253.2514190673828, "regularization/w1": 1.2304182052612305, "rewards/chosen": 0.46978519469734253, "rewards/margins": 0.7591148299626042, "rewards/rejected": -0.2893296352652616, "step": 2300 }, { "epoch": 3.0, "step": 2316, "total_flos": 9.977114557203087e+17, "train_loss": 0.587135434356584, "train_runtime": 11136.5791, "train_samples_per_second": 13.309, "train_steps_per_second": 0.208 } ], "logging_steps": 20, "max_steps": 2316, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": false, "should_training_stop": false }, "attributes": {} } }, "total_flos": 9.977114557203087e+17, "train_batch_size": 8, "trial_name": null, "trial_params": null }