{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 3.0, "eval_steps": 500, "global_step": 2316, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.025906735751295335, "grad_norm": 20.5758113861084, "kl": 16.81874656677246, "learning_rate": 1.8999999999999998e-07, "logits/chosen": -37939062.65275708, "logits/rejected": -37362454.27914614, "logps/chosen": -463.85492734724295, "logps/rejected": -394.7774014778325, "loss": 0.6076, "loss/base_kto": 3.887288808822632, "metrics/advantage_var": 215.61167907714844, "regularization/lipschitz_norm": 992.4693603515625, "regularization/mmd": 0.1399136632680893, "regularization/rkhs_norm": 166.5638885498047, "regularization/w1": 0.8336742520332336, "rewards/chosen": 0.28945038251123556, "rewards/margins": 0.07722112203684106, "rewards/rejected": 0.2122292604743945, "step": 20 }, { "epoch": 0.05181347150259067, "grad_norm": 32.53988265991211, "kl": 8.703550338745117, "learning_rate": 3.8999999999999997e-07, "logits/chosen": -36340779.64590164, "logits/rejected": -37285878.82985075, "logps/chosen": -483.72079918032784, "logps/rejected": -371.6361473880597, "loss": 0.5888, "loss/base_kto": 3.9180238246917725, "metrics/advantage_var": 138.6885528564453, "regularization/lipschitz_norm": 807.34423828125, "regularization/mmd": 0.11442476511001587, "regularization/rkhs_norm": 136.21995544433594, "regularization/w1": 0.6781691908836365, "rewards/chosen": 0.08447965403072169, "rewards/margins": 0.06347960324400585, "rewards/rejected": 0.021000050786715834, "step": 40 }, { "epoch": 0.07772020725388601, "grad_norm": 19.574037551879883, "kl": 3.263112783432007, "learning_rate": 5.9e-07, "logits/chosen": -36193813.13015873, "logits/rejected": -37613397.85846154, "logps/chosen": -482.15208333333334, "logps/rejected": -347.1869711538462, "loss": 0.598, "loss/base_kto": 3.870199680328369, "metrics/advantage_var": 195.90281677246094, "regularization/lipschitz_norm": 928.9747314453125, "regularization/mmd": 0.13382986187934875, "regularization/rkhs_norm": 159.32127380371094, "regularization/w1": 0.780338704586029, "rewards/chosen": -0.051958592732747395, "rewards/margins": 0.12822778750688602, "rewards/rejected": -0.1801863802396334, "step": 60 }, { "epoch": 0.10362694300518134, "grad_norm": 22.571435928344727, "kl": 4.356871128082275, "learning_rate": 7.9e-07, "logits/chosen": -35967044.266666666, "logits/rejected": -38276518.20307692, "logps/chosen": -492.0336805555556, "logps/rejected": -381.4961057692308, "loss": 0.6131, "loss/base_kto": 3.9751222133636475, "metrics/advantage_var": 193.7662353515625, "regularization/lipschitz_norm": 949.2344970703125, "regularization/mmd": 0.13238470256328583, "regularization/rkhs_norm": 157.60084533691406, "regularization/w1": 0.797356903553009, "rewards/chosen": -0.11964053199404762, "rewards/margins": -0.01796555124359689, "rewards/rejected": -0.10167498075045073, "step": 80 }, { "epoch": 0.12953367875647667, "grad_norm": 22.95536994934082, "kl": 11.476832389831543, "learning_rate": 9.9e-07, "logits/chosen": -35546065.08688784, "logits/rejected": -35757168.370942816, "logps/chosen": -496.32237361769353, "logps/rejected": -362.64678323029364, "loss": 0.5953, "loss/base_kto": 3.8341598510742188, "metrics/advantage_var": 185.092041015625, "regularization/lipschitz_norm": 947.2268676757812, "regularization/mmd": 0.13265080749988556, "regularization/rkhs_norm": 157.91763305664062, "regularization/w1": 0.7956705093383789, "rewards/chosen": 0.16115551989225416, "rewards/margins": 0.16172028228484361, "rewards/rejected": -0.0005647623925894452, "step": 100 }, { "epoch": 0.15544041450777202, "grad_norm": 21.858009338378906, "kl": 17.05402183532715, "learning_rate": 9.998186234298189e-07, "logits/chosen": -35402981.75334324, "logits/rejected": -37303574.35255354, "logps/chosen": -482.651838781575, "logps/rejected": -376.8109297775947, "loss": 0.5927, "loss/base_kto": 3.8168811798095703, "metrics/advantage_var": 193.15184020996094, "regularization/lipschitz_norm": 941.7293090820312, "regularization/mmd": 0.13376301527023315, "regularization/rkhs_norm": 159.24168395996094, "regularization/w1": 0.791052520275116, "rewards/chosen": 0.2940350287382174, "rewards/margins": 0.17179536127625025, "rewards/rejected": 0.12223966746196716, "step": 120 }, { "epoch": 0.18134715025906736, "grad_norm": 17.485946655273438, "kl": 9.870765686035156, "learning_rate": 9.992359552107714e-07, "logits/chosen": -34899143.64779874, "logits/rejected": -36140066.98136646, "logps/chosen": -489.23265526729557, "logps/rejected": -406.5649505046584, "loss": 0.5965, "loss/base_kto": 3.8522095680236816, "metrics/advantage_var": 195.4907684326172, "regularization/lipschitz_norm": 934.1529541015625, "regularization/mmd": 0.1350112408399582, "regularization/rkhs_norm": 160.72767639160156, "regularization/w1": 0.7846884727478027, "rewards/chosen": 0.1335341735455975, "rewards/margins": 0.13950597845468166, "rewards/rejected": -0.005971804909084154, "step": 140 }, { "epoch": 0.20725388601036268, "grad_norm": 17.309173583984375, "kl": 9.891693115234375, "learning_rate": 9.982519612796161e-07, "logits/chosen": -35866083.73006135, "logits/rejected": -37282020.280254774, "logps/chosen": -460.4609375, "logps/rejected": -385.0896198248408, "loss": 0.6043, "loss/base_kto": 3.861051321029663, "metrics/advantage_var": 212.87026977539062, "regularization/lipschitz_norm": 990.7973022460938, "regularization/mmd": 0.1408347487449646, "regularization/rkhs_norm": 167.66041564941406, "regularization/w1": 0.8322697877883911, "rewards/chosen": 0.12143621854255536, "rewards/margins": 0.11573324613044599, "rewards/rejected": 0.005702972412109375, "step": 160 }, { "epoch": 0.23316062176165803, "grad_norm": 18.654821395874023, "kl": 5.233686923980713, "learning_rate": 9.968674326492213e-07, "logits/chosen": -36207757.58199357, "logits/rejected": -37505129.82370821, "logps/chosen": -499.97221663987136, "logps/rejected": -372.81532579787233, "loss": 0.5988, "loss/base_kto": 3.820173740386963, "metrics/advantage_var": 226.052001953125, "regularization/lipschitz_norm": 985.3980712890625, "regularization/mmd": 0.14236484467983246, "regularization/rkhs_norm": 169.48196411132812, "regularization/w1": 0.8277344107627869, "rewards/chosen": -0.0008185262465400328, "rewards/margins": 0.17960524511019915, "rewards/rejected": -0.18042377135673918, "step": 180 }, { "epoch": 0.25906735751295334, "grad_norm": 18.692941665649414, "kl": 12.598770141601562, "learning_rate": 9.950834823142198e-07, "logits/chosen": -37093495.36196319, "logits/rejected": -36910389.808917195, "logps/chosen": -475.8856403374233, "logps/rejected": -383.1358479299363, "loss": 0.5957, "loss/base_kto": 3.8510231971740723, "metrics/advantage_var": 197.63787841796875, "regularization/lipschitz_norm": 929.4817504882812, "regularization/mmd": 0.13404138386249542, "regularization/rkhs_norm": 159.5730743408203, "regularization/w1": 0.7807646989822388, "rewards/chosen": 0.18085748871411284, "rewards/margins": 0.13592879828364782, "rewards/rejected": 0.04492869043046502, "step": 200 }, { "epoch": 0.2849740932642487, "grad_norm": 24.100107192993164, "kl": 11.595545768737793, "learning_rate": 9.929015443562942e-07, "logits/chosen": -36806138.2656, "logits/rejected": -36215240.50076336, "logps/chosen": -488.6162, "logps/rejected": -355.44444179389313, "loss": 0.5923, "loss/base_kto": 3.8025033473968506, "metrics/advantage_var": 202.3291778564453, "regularization/lipschitz_norm": 952.2705078125, "regularization/mmd": 0.13572661578655243, "regularization/rkhs_norm": 161.5792999267578, "regularization/w1": 0.7999071478843689, "rewards/chosen": 0.18568939208984375, "rewards/margins": 0.18039366991465328, "rewards/rejected": 0.005295722175190467, "step": 220 }, { "epoch": 0.31088082901554404, "grad_norm": 26.79574966430664, "kl": 22.761743545532227, "learning_rate": 9.90323372791347e-07, "logits/chosen": -35564447.45595054, "logits/rejected": -37149658.79304897, "logps/chosen": -464.9503477588872, "logps/rejected": -362.37638230647707, "loss": 0.5982, "loss/base_kto": 3.7932441234588623, "metrics/advantage_var": 246.3934783935547, "regularization/lipschitz_norm": 1006.77734375, "regularization/mmd": 0.14705203473567963, "regularization/rkhs_norm": 175.06195068359375, "regularization/w1": 0.845693051815033, "rewards/chosen": 0.3306272527349787, "rewards/margins": 0.15932515638466893, "rewards/rejected": 0.1713020963503098, "step": 240 }, { "epoch": 0.33678756476683935, "grad_norm": 17.627756118774414, "kl": 6.831817150115967, "learning_rate": 9.87351040159484e-07, "logits/chosen": -36917455.72107766, "logits/rejected": -38925057.97226502, "logps/chosen": -495.70483359746436, "logps/rejected": -385.986999229584, "loss": 0.6027, "loss/base_kto": 3.8173015117645264, "metrics/advantage_var": 229.39768981933594, "regularization/lipschitz_norm": 1021.6549072265625, "regularization/mmd": 0.14589278399944305, "regularization/rkhs_norm": 173.681884765625, "regularization/w1": 0.8581901788711548, "rewards/chosen": 0.061865067519778875, "rewards/margins": 0.16022221671151918, "rewards/rejected": -0.0983571491917403, "step": 260 }, { "epoch": 0.3626943005181347, "grad_norm": 19.737218856811523, "kl": 9.316094398498535, "learning_rate": 9.839869358589396e-07, "logits/chosen": -36195308.43312102, "logits/rejected": -37284034.74846626, "logps/chosen": -483.2488554936306, "logps/rejected": -369.80840203220856, "loss": 0.5917, "loss/base_kto": 3.7503457069396973, "metrics/advantage_var": 227.41404724121094, "regularization/lipschitz_norm": 999.7609252929688, "regularization/mmd": 0.14342042803764343, "regularization/rkhs_norm": 170.7386016845703, "regularization/w1": 0.8397992253303528, "rewards/chosen": 0.1580808724567389, "rewards/margins": 0.22238207070229643, "rewards/rejected": -0.06430119824555754, "step": 280 }, { "epoch": 0.38860103626943004, "grad_norm": 23.97921371459961, "kl": 8.586662292480469, "learning_rate": 9.80233764225289e-07, "logits/chosen": -37549160.162754305, "logits/rejected": -38236319.750390016, "logps/chosen": -485.34477699530515, "logps/rejected": -376.4766965678627, "loss": 0.594, "loss/base_kto": 3.733426809310913, "metrics/advantage_var": 241.8022003173828, "regularization/lipschitz_norm": 1037.521240234375, "regularization/mmd": 0.14734356105327606, "regularization/rkhs_norm": 175.40899658203125, "regularization/w1": 0.8715177774429321, "rewards/chosen": 0.14147711621017336, "rewards/margins": 0.24885428605282645, "rewards/rejected": -0.10737716984265308, "step": 300 }, { "epoch": 0.41450777202072536, "grad_norm": 18.06004524230957, "kl": 6.466609954833984, "learning_rate": 9.760945423574868e-07, "logits/chosen": -35774181.09309309, "logits/rejected": -37414938.684039086, "logps/chosen": -485.11294106606607, "logps/rejected": -348.24541938110747, "loss": 0.5904, "loss/base_kto": 3.8044323921203613, "metrics/advantage_var": 211.8214874267578, "regularization/lipschitz_norm": 930.0750122070312, "regularization/mmd": 0.1376616209745407, "regularization/rkhs_norm": 163.88287353515625, "regularization/w1": 0.7812630534172058, "rewards/chosen": 0.13392112204978415, "rewards/margins": 0.1955093907647138, "rewards/rejected": -0.06158826871492964, "step": 320 }, { "epoch": 0.44041450777202074, "grad_norm": 17.632667541503906, "kl": 14.662436485290527, "learning_rate": 9.71572597692482e-07, "logits/chosen": -35479061.590361446, "logits/rejected": -37082886.64935065, "logps/chosen": -476.8266189759036, "logps/rejected": -385.76212459415586, "loss": 0.6003, "loss/base_kto": 3.810995578765869, "metrics/advantage_var": 233.14382934570312, "regularization/lipschitz_norm": 1004.1724853515625, "regularization/mmd": 0.14769704639911652, "regularization/rkhs_norm": 175.82981872558594, "regularization/w1": 0.8435049057006836, "rewards/chosen": 0.28432138282132435, "rewards/margins": 0.15912314241731917, "rewards/rejected": 0.12519824040400518, "step": 340 }, { "epoch": 0.46632124352331605, "grad_norm": 21.117231369018555, "kl": 16.584177017211914, "learning_rate": 9.666715653303588e-07, "logits/chosen": -34552640.91866029, "logits/rejected": -35992721.83767228, "logps/chosen": -498.9676036682616, "logps/rejected": -353.48281967840734, "loss": 0.5942, "loss/base_kto": 3.7767086029052734, "metrics/advantage_var": 222.5546417236328, "regularization/lipschitz_norm": 991.2771606445312, "regularization/mmd": 0.1440141201019287, "regularization/rkhs_norm": 171.44537353515625, "regularization/w1": 0.8326728940010071, "rewards/chosen": 0.2840682277649023, "rewards/margins": 0.2045750483267772, "rewards/rejected": 0.07949317943812512, "step": 360 }, { "epoch": 0.49222797927461137, "grad_norm": 22.647109985351562, "kl": 6.5619940757751465, "learning_rate": 9.613953851121528e-07, "logits/chosen": -35596677.9392, "logits/rejected": -37279328.146564886, "logps/chosen": -496.00245, "logps/rejected": -375.54489503816797, "loss": 0.594, "loss/base_kto": 3.7610390186309814, "metrics/advantage_var": 233.2661590576172, "regularization/lipschitz_norm": 1008.4299926757812, "regularization/mmd": 0.14352834224700928, "regularization/rkhs_norm": 170.86709594726562, "regularization/w1": 0.847081184387207, "rewards/chosen": 0.05087820129394531, "rewards/margins": 0.22610913316566528, "rewards/rejected": -0.17523093187171995, "step": 380 }, { "epoch": 0.5181347150259067, "grad_norm": 19.77211570739746, "kl": 7.502200603485107, "learning_rate": 9.557482984526924e-07, "logits/chosen": -35290638.17846154, "logits/rejected": -37069814.24761905, "logps/chosen": -491.0845673076923, "logps/rejected": -384.30562996031745, "loss": 0.6055, "loss/base_kto": 3.79258131980896, "metrics/advantage_var": 269.2097473144531, "regularization/lipschitz_norm": 1070.2557373046875, "regularization/mmd": 0.15260519087314606, "regularization/rkhs_norm": 181.6728515625, "regularization/w1": 0.8990148901939392, "rewards/chosen": 0.07853038494403546, "rewards/margins": 0.1819285172682542, "rewards/rejected": -0.10339813232421875, "step": 400 }, { "epoch": 0.5440414507772021, "grad_norm": 22.727684020996094, "kl": 16.226346969604492, "learning_rate": 9.497348449310107e-07, "logits/chosen": -35434669.82716049, "logits/rejected": -39028742.48101266, "logps/chosen": -492.70076195987656, "logps/rejected": -355.4692444620253, "loss": 0.593, "loss/base_kto": 3.71561598777771, "metrics/advantage_var": 290.4650573730469, "regularization/lipschitz_norm": 1039.91552734375, "regularization/mmd": 0.15495604276657104, "regularization/rkhs_norm": 184.47149658203125, "regularization/w1": 0.8735290765762329, "rewards/chosen": 0.21321501555266203, "rewards/margins": 0.25089171510652597, "rewards/rejected": -0.037676699553863914, "step": 420 }, { "epoch": 0.5699481865284974, "grad_norm": 27.383163452148438, "kl": 11.542716026306152, "learning_rate": 9.433598586410701e-07, "logits/chosen": -34382502.27652733, "logits/rejected": -36393355.282674775, "logps/chosen": -478.00753617363347, "logps/rejected": -374.1326225303951, "loss": 0.5948, "loss/base_kto": 3.7610371112823486, "metrics/advantage_var": 238.17247009277344, "regularization/lipschitz_norm": 1013.21728515625, "regularization/mmd": 0.14663951098918915, "regularization/rkhs_norm": 174.5708465576172, "regularization/w1": 0.8511025309562683, "rewards/chosen": 0.11473729909424613, "rewards/margins": 0.21073798787320164, "rewards/rejected": -0.09600068877895553, "step": 440 }, { "epoch": 0.5958549222797928, "grad_norm": 17.471017837524414, "kl": 12.239995002746582, "learning_rate": 9.366284643057313e-07, "logits/chosen": -35423626.084848486, "logits/rejected": -36434494.76129032, "logps/chosen": -460.1627840909091, "logps/rejected": -381.32910786290324, "loss": 0.5962, "loss/base_kto": 3.7733826637268066, "metrics/advantage_var": 226.7340545654297, "regularization/lipschitz_norm": 1011.71875, "regularization/mmd": 0.14616459608078003, "regularization/rkhs_norm": 174.0054931640625, "regularization/w1": 0.8498438000679016, "rewards/chosen": 0.19644125736120976, "rewards/margins": 0.21708291343696423, "rewards/rejected": -0.020641656075754473, "step": 460 }, { "epoch": 0.6217616580310881, "grad_norm": 19.190166473388672, "kl": 15.33696460723877, "learning_rate": 9.295460731570917e-07, "logits/chosen": -37426184.29821718, "logits/rejected": -37660202.47360483, "logps/chosen": -499.82860615883305, "logps/rejected": -364.14755373303166, "loss": 0.597, "loss/base_kto": 3.758046865463257, "metrics/advantage_var": 251.15982055664062, "regularization/lipschitz_norm": 1030.2054443359375, "regularization/mmd": 0.1522947996854782, "regularization/rkhs_norm": 181.30332946777344, "regularization/w1": 0.8653726577758789, "rewards/chosen": 0.2285088488116643, "rewards/margins": 0.22294865928116367, "rewards/rejected": 0.005560189530500639, "step": 480 }, { "epoch": 0.6476683937823834, "grad_norm": 16.460947036743164, "kl": 7.460095405578613, "learning_rate": 9.221183785865056e-07, "logits/chosen": -34947084.54517611, "logits/rejected": -35680053.48644338, "logps/chosen": -496.16993683001533, "logps/rejected": -382.27262759170657, "loss": 0.5912, "loss/base_kto": 3.7523276805877686, "metrics/advantage_var": 233.4416046142578, "regularization/lipschitz_norm": 989.814453125, "regularization/mmd": 0.14545856416225433, "regularization/rkhs_norm": 173.1649627685547, "regularization/w1": 0.8314442038536072, "rewards/chosen": 0.07514801726406968, "rewards/margins": 0.2212005466310329, "rewards/rejected": -0.14605252936696322, "step": 500 }, { "epoch": 0.6735751295336787, "grad_norm": 23.77032470703125, "kl": 11.39418888092041, "learning_rate": 9.143513515677817e-07, "logits/chosen": -36298183.80487805, "logits/rejected": -37196773.743589744, "logps/chosen": -477.8599466463415, "logps/rejected": -366.67387820512823, "loss": 0.5898, "loss/base_kto": 3.6974334716796875, "metrics/advantage_var": 272.9799499511719, "regularization/lipschitz_norm": 1035.4735107421875, "regularization/mmd": 0.15107448399066925, "regularization/rkhs_norm": 179.85057067871094, "regularization/w1": 0.8697977066040039, "rewards/chosen": 0.20378950165539253, "rewards/margins": 0.2523843554722808, "rewards/rejected": -0.04859485381688827, "step": 520 }, { "epoch": 0.6994818652849741, "grad_norm": 23.84042739868164, "kl": 15.18149471282959, "learning_rate": 9.062512358572373e-07, "logits/chosen": -37342823.04402516, "logits/rejected": -38569392.49689441, "logps/chosen": -483.0530169025157, "logps/rejected": -378.34714673913044, "loss": 0.5946, "loss/base_kto": 3.7625184059143066, "metrics/advantage_var": 227.36949157714844, "regularization/lipschitz_norm": 1011.3478393554688, "regularization/mmd": 0.14458440244197845, "regularization/rkhs_norm": 172.12429809570312, "regularization/w1": 0.8495321273803711, "rewards/chosen": 0.24147647881657822, "rewards/margins": 0.19763926026541634, "rewards/rejected": 0.04383721855116186, "step": 540 }, { "epoch": 0.7253886010362695, "grad_norm": 19.289283752441406, "kl": 12.326022148132324, "learning_rate": 8.978245429744691e-07, "logits/chosen": -35266791.8490566, "logits/rejected": -37670123.32919255, "logps/chosen": -474.1544811320755, "logps/rejected": -359.5655570652174, "loss": 0.5863, "loss/base_kto": 3.7010605335235596, "metrics/advantage_var": 240.5254669189453, "regularization/lipschitz_norm": 1004.1748046875, "regularization/mmd": 0.14562593400478363, "regularization/rkhs_norm": 173.36419677734375, "regularization/w1": 0.8435068130493164, "rewards/chosen": 0.20909660867175217, "rewards/margins": 0.25939465973581105, "rewards/rejected": -0.05029805106405886, "step": 560 }, { "epoch": 0.7512953367875648, "grad_norm": 19.455881118774414, "kl": 14.824966430664062, "learning_rate": 8.890780469678738e-07, "logits/chosen": -35932914.85196374, "logits/rejected": -36527412.19417476, "logps/chosen": -482.98319486404836, "logps/rejected": -364.8072411003236, "loss": 0.5934, "loss/base_kto": 3.7563083171844482, "metrics/advantage_var": 229.74356079101562, "regularization/lipschitz_norm": 1006.9215087890625, "regularization/mmd": 0.1447356939315796, "regularization/rkhs_norm": 172.30441284179688, "regularization/w1": 0.845814049243927, "rewards/chosen": 0.22214694757836104, "rewards/margins": 0.22541619251619605, "rewards/rejected": -0.003269244937835002, "step": 580 }, { "epoch": 0.7772020725388601, "grad_norm": 25.28292465209961, "kl": 10.836579322814941, "learning_rate": 8.800187789691269e-07, "logits/chosen": -36878989.26953748, "logits/rejected": -37204030.72588055, "logps/chosen": -482.2801036682616, "logps/rejected": -372.3872511485452, "loss": 0.5969, "loss/base_kto": 3.7240941524505615, "metrics/advantage_var": 252.6636199951172, "regularization/lipschitz_norm": 1069.439697265625, "regularization/mmd": 0.15283682942390442, "regularization/rkhs_norm": 181.9486083984375, "regularization/w1": 0.8983292579650879, "rewards/chosen": 0.17491405432304127, "rewards/margins": 0.2543630580479617, "rewards/rejected": -0.07944900372492043, "step": 600 }, { "epoch": 0.8031088082901554, "grad_norm": 19.931053161621094, "kl": 14.318656921386719, "learning_rate": 8.706540215409981e-07, "logits/chosen": -37684136.60547504, "logits/rejected": -37465844.73444613, "logps/chosen": -504.9434380032206, "logps/rejected": -389.2411086874052, "loss": 0.5954, "loss/base_kto": 3.7321908473968506, "metrics/advantage_var": 237.4651336669922, "regularization/lipschitz_norm": 1049.4945068359375, "regularization/mmd": 0.1490609049797058, "regularization/rkhs_norm": 177.45347595214844, "regularization/w1": 0.8815754055976868, "rewards/chosen": 0.1969018466230752, "rewards/margins": 0.25105918474376293, "rewards/rejected": -0.054157338120687716, "step": 620 }, { "epoch": 0.8290155440414507, "grad_norm": 20.67220115661621, "kl": 6.832446575164795, "learning_rate": 8.609913028230462e-07, "logits/chosen": -35766081.028938904, "logits/rejected": -36465218.91793313, "logps/chosen": -480.4846262057878, "logps/rejected": -383.38150645896656, "loss": 0.6006, "loss/base_kto": 3.8007652759552, "metrics/advantage_var": 238.26353454589844, "regularization/lipschitz_norm": 1017.7281494140625, "regularization/mmd": 0.148813396692276, "regularization/rkhs_norm": 177.15879821777344, "regularization/w1": 0.8548915982246399, "rewards/chosen": 0.048960977045286125, "rewards/margins": 0.18022028073247742, "rewards/rejected": -0.1312593036871913, "step": 640 }, { "epoch": 0.8549222797927462, "grad_norm": 19.877376556396484, "kl": 10.88232135772705, "learning_rate": 8.510383904798994e-07, "logits/chosen": -36232104.585365854, "logits/rejected": -36577145.43589743, "logps/chosen": -504.7980182926829, "logps/rejected": -382.63426482371796, "loss": 0.5954, "loss/base_kto": 3.724571943283081, "metrics/advantage_var": 240.63926696777344, "regularization/lipschitz_norm": 1058.7271728515625, "regularization/mmd": 0.14946918189525604, "regularization/rkhs_norm": 177.9394989013672, "regularization/w1": 0.8893308639526367, "rewards/chosen": 0.2028577851086128, "rewards/margins": 0.2583897881689781, "rewards/rejected": -0.055532003060365334, "step": 660 }, { "epoch": 0.8808290155440415, "grad_norm": 17.519556045532227, "kl": 10.411486625671387, "learning_rate": 8.408032854569865e-07, "logits/chosen": -35376066.03821656, "logits/rejected": -34851588.711656444, "logps/chosen": -471.26313694267515, "logps/rejected": -366.3571223159509, "loss": 0.5967, "loss/base_kto": 3.739750623703003, "metrics/advantage_var": 257.7501220703125, "regularization/lipschitz_norm": 1049.66015625, "regularization/mmd": 0.1522214263677597, "regularization/rkhs_norm": 181.2159881591797, "regularization/w1": 0.8817145228385925, "rewards/chosen": 0.09120152710349697, "rewards/margins": 0.22122545999927437, "rewards/rejected": -0.1300239328957774, "step": 680 }, { "epoch": 0.9067357512953368, "grad_norm": 37.141357421875, "kl": 11.514135360717773, "learning_rate": 8.302942155487377e-07, "logits/chosen": -37315386.006042294, "logits/rejected": -37213283.41747573, "logps/chosen": -477.4136612537764, "logps/rejected": -371.179636933657, "loss": 0.6061, "loss/base_kto": 3.7803478240966797, "metrics/advantage_var": 266.41778564453125, "regularization/lipschitz_norm": 1088.9759521484375, "regularization/mmd": 0.1539926379919052, "regularization/rkhs_norm": 183.32456970214844, "regularization/w1": 0.9147397875785828, "rewards/chosen": 0.11777314246601209, "rewards/margins": 0.16899296537122233, "rewards/rejected": -0.05121982290521023, "step": 700 }, { "epoch": 0.9326424870466321, "grad_norm": 25.138517379760742, "kl": 20.77939796447754, "learning_rate": 8.195196287844278e-07, "logits/chosen": -35795514.4913928, "logits/rejected": -35336252.705148205, "logps/chosen": -492.52963615023475, "logps/rejected": -373.00672776911074, "loss": 0.5921, "loss/base_kto": 3.708894729614258, "metrics/advantage_var": 245.8461151123047, "regularization/lipschitz_norm": 1045.6116943359375, "regularization/mmd": 0.1495220810174942, "regularization/rkhs_norm": 178.00247192382812, "regularization/w1": 0.8783137202262878, "rewards/chosen": 0.3159759473726037, "rewards/margins": 0.2526352321338867, "rewards/rejected": 0.06334071523871697, "step": 720 }, { "epoch": 0.9585492227979274, "grad_norm": 50.69983673095703, "kl": 17.803647994995117, "learning_rate": 8.08488186636975e-07, "logits/chosen": -36249531.51592357, "logits/rejected": -37110237.44785276, "logps/chosen": -474.6914808917197, "logps/rejected": -358.6874520705521, "loss": 0.5949, "loss/base_kto": 3.720240831375122, "metrics/advantage_var": 270.0563659667969, "regularization/lipschitz_norm": 1052.604736328125, "regularization/mmd": 0.15498439967632294, "regularization/rkhs_norm": 184.50523376464844, "regularization/w1": 0.8841879963874817, "rewards/chosen": 0.30120555610413763, "rewards/margins": 0.23346862034232901, "rewards/rejected": 0.06773693576180861, "step": 740 }, { "epoch": 0.9844559585492227, "grad_norm": 16.54012107849121, "kl": 11.75640869140625, "learning_rate": 7.972087570601576e-07, "logits/chosen": -35117618.32137285, "logits/rejected": -36250923.668231614, "logps/chosen": -508.0092628705148, "logps/rejected": -371.91378129890455, "loss": 0.5896, "loss/base_kto": 3.7095627784729004, "metrics/advantage_var": 245.6681365966797, "regularization/lipschitz_norm": 1019.3429565429688, "regularization/mmd": 0.15087106823921204, "regularization/rkhs_norm": 179.6083984375, "regularization/w1": 0.8562480807304382, "rewards/chosen": 0.1789109918888943, "rewards/margins": 0.2717039147908896, "rewards/rejected": -0.09279292290199531, "step": 760 }, { "epoch": 1.0103626943005182, "grad_norm": 21.221527099609375, "kl": 12.573948860168457, "learning_rate": 7.856904073598458e-07, "logits/chosen": -36170574.677067086, "logits/rejected": -37090292.74725275, "logps/chosen": -488.9374024960998, "logps/rejected": -362.7842425431711, "loss": 0.6028, "loss/base_kto": 3.579540967941284, "metrics/advantage_var": 391.9313049316406, "regularization/lipschitz_norm": 1264.6966552734375, "regularization/mmd": 0.1801941841840744, "regularization/rkhs_norm": 214.5168914794922, "regularization/w1": 1.0623451471328735, "rewards/chosen": 0.24875042181863055, "rewards/margins": 0.4382941653414303, "rewards/rejected": -0.18954374352279973, "step": 780 }, { "epoch": 1.0362694300518134, "grad_norm": 18.517812728881836, "kl": 22.912307739257812, "learning_rate": 7.739423969049761e-07, "logits/chosen": -35347484.35692307, "logits/rejected": -35902610.28571428, "logps/chosen": -484.1655769230769, "logps/rejected": -381.25637400793653, "loss": 0.6263, "loss/base_kto": 3.3201873302459717, "metrics/advantage_var": 688.6425170898438, "regularization/lipschitz_norm": 1724.913330078125, "regularization/mmd": 0.24138009548187256, "regularization/rkhs_norm": 287.35723876953125, "regularization/w1": 1.4489272832870483, "rewards/chosen": 0.6670431753305288, "rewards/margins": 0.795169204693283, "rewards/rejected": -0.12812602936275422, "step": 800 }, { "epoch": 1.0621761658031088, "grad_norm": 15.87170124053955, "kl": 16.535335540771484, "learning_rate": 7.619741696841322e-07, "logits/chosen": -35519548.04938272, "logits/rejected": -36609273.51898734, "logps/chosen": -495.86299189814815, "logps/rejected": -398.7484671677215, "loss": 0.6077, "loss/base_kto": 3.2903213500976562, "metrics/advantage_var": 619.0986938476562, "regularization/lipschitz_norm": 1596.5906982421875, "regularization/mmd": 0.22998562455177307, "regularization/rkhs_norm": 273.79241943359375, "regularization/w1": 1.3411362171173096, "rewards/chosen": 0.5365299648708768, "rewards/margins": 0.7547019175168667, "rewards/rejected": -0.2181719526459899, "step": 820 }, { "epoch": 1.0880829015544042, "grad_norm": 23.145084381103516, "kl": 17.9096736907959, "learning_rate": 7.497953467137135e-07, "logits/chosen": -35584755.220611915, "logits/rejected": -36302705.04400607, "logps/chosen": -490.21864935587763, "logps/rejected": -393.79267830045524, "loss": 0.6058, "loss/base_kto": 3.2760345935821533, "metrics/advantage_var": 598.9376831054688, "regularization/lipschitz_norm": 1604.2181396484375, "regularization/mmd": 0.22320659458637238, "regularization/rkhs_norm": 265.72216796875, "regularization/w1": 1.3475432395935059, "rewards/chosen": 0.5825202192469303, "rewards/margins": 0.7996018709490239, "rewards/rejected": -0.21708165170209362, "step": 840 }, { "epoch": 1.1139896373056994, "grad_norm": 16.735595703125, "kl": 5.670738697052002, "learning_rate": 7.37415718303793e-07, "logits/chosen": -35206040.7808, "logits/rejected": -36138748.48244275, "logps/chosen": -488.7985, "logps/rejected": -390.2844704198473, "loss": 0.6209, "loss/base_kto": 3.335326910018921, "metrics/advantage_var": 616.02587890625, "regularization/lipschitz_norm": 1667.9228515625, "regularization/mmd": 0.23069031536579132, "regularization/rkhs_norm": 274.6313171386719, "regularization/w1": 1.4010552167892456, "rewards/chosen": 0.1739558837890625, "rewards/margins": 0.7510106719271827, "rewards/rejected": -0.5770547881381203, "step": 860 }, { "epoch": 1.1398963730569949, "grad_norm": 19.573148727416992, "kl": 11.090420722961426, "learning_rate": 7.248452361878855e-07, "logits/chosen": -35530803.360501565, "logits/rejected": -36086717.00934579, "logps/chosen": -470.6704055642633, "logps/rejected": -362.2284852024922, "loss": 0.6109, "loss/base_kto": 3.280815839767456, "metrics/advantage_var": 622.8731689453125, "regularization/lipschitz_norm": 1638.9910888671875, "regularization/mmd": 0.2300119698047638, "regularization/rkhs_norm": 273.8237609863281, "regularization/w1": 1.376752495765686, "rewards/chosen": 0.47481845389339244, "rewards/margins": 0.7902909230449695, "rewards/rejected": -0.3154724691515771, "step": 880 }, { "epoch": 1.16580310880829, "grad_norm": 18.900663375854492, "kl": 10.095346450805664, "learning_rate": 7.120940055229497e-07, "logits/chosen": -34952144.73846154, "logits/rejected": -35983451.02222222, "logps/chosen": -475.2823076923077, "logps/rejected": -384.0702876984127, "loss": 0.6132, "loss/base_kto": 3.3758606910705566, "metrics/advantage_var": 604.9810791015625, "regularization/lipschitz_norm": 1555.710205078125, "regularization/mmd": 0.2226063311100006, "regularization/rkhs_norm": 265.0075378417969, "regularization/w1": 1.3067964315414429, "rewards/chosen": 0.2885575045072115, "rewards/margins": 0.6789511037600637, "rewards/rejected": -0.39039359925285216, "step": 900 }, { "epoch": 1.1917098445595855, "grad_norm": 14.313115119934082, "kl": 19.707983016967773, "learning_rate": 6.991722767660556e-07, "logits/chosen": -35337982.033794165, "logits/rejected": -36343599.61844197, "logps/chosen": -487.78619431643625, "logps/rejected": -354.9862380763116, "loss": 0.5923, "loss/base_kto": 3.183997631072998, "metrics/advantage_var": 639.8392944335938, "regularization/lipschitz_norm": 1578.1241455078125, "regularization/mmd": 0.2291080504655838, "regularization/rkhs_norm": 272.7476501464844, "regularization/w1": 1.3256242275238037, "rewards/chosen": 0.6527138049335157, "rewards/margins": 0.8894780062327009, "rewards/rejected": -0.2367642012991852, "step": 920 }, { "epoch": 1.2176165803108807, "grad_norm": 18.604690551757812, "kl": 12.943008422851562, "learning_rate": 6.860904374342499e-07, "logits/chosen": -34232329.767885536, "logits/rejected": -34887053.960061446, "logps/chosen": -473.987480127186, "logps/rejected": -348.35186251920123, "loss": 0.599, "loss/base_kto": 3.257160186767578, "metrics/advantage_var": 590.5481567382812, "regularization/lipschitz_norm": 1565.31982421875, "regularization/mmd": 0.2202320098876953, "regularization/rkhs_norm": 262.1809997558594, "regularization/w1": 1.3148685693740845, "rewards/chosen": 0.4355853009489269, "rewards/margins": 0.8222324213646335, "rewards/rejected": -0.3866471204157066, "step": 940 }, { "epoch": 1.2435233160621761, "grad_norm": 14.078204154968262, "kl": 12.49372386932373, "learning_rate": 6.7285900375424e-07, "logits/chosen": -34542604.8, "logits/rejected": -35873574.4, "logps/chosen": -435.915283203125, "logps/rejected": -376.5451171875, "loss": 0.591, "loss/base_kto": 3.2920472621917725, "metrics/advantage_var": 531.306884765625, "regularization/lipschitz_norm": 1460.0257568359375, "regularization/mmd": 0.20950733125209808, "regularization/rkhs_norm": 249.41348266601562, "regularization/w1": 1.226421594619751, "rewards/chosen": 0.36907153129577636, "rewards/margins": 0.7647289276123046, "rewards/rejected": -0.3956573963165283, "step": 960 }, { "epoch": 1.2694300518134716, "grad_norm": 19.92791748046875, "kl": 14.54132080078125, "learning_rate": 6.594886122086123e-07, "logits/chosen": -33633025.23274478, "logits/rejected": -36365460.06697108, "logps/chosen": -512.2743780096308, "logps/rejected": -389.1756326103501, "loss": 0.6156, "loss/base_kto": 3.275949478149414, "metrics/advantage_var": 649.2162475585938, "regularization/lipschitz_norm": 1685.2899169921875, "regularization/mmd": 0.232918381690979, "regularization/rkhs_norm": 277.2838134765625, "regularization/w1": 1.415643572807312, "rewards/chosen": 0.47823205154933285, "rewards/margins": 0.7808198306945955, "rewards/rejected": -0.3025877791452626, "step": 980 }, { "epoch": 1.2953367875647668, "grad_norm": 34.92301940917969, "kl": 12.782320976257324, "learning_rate": 6.459900109853766e-07, "logits/chosen": -35761696.405063294, "logits/rejected": -34188525.03703704, "logps/chosen": -468.26399327531647, "logps/rejected": -374.8835358796296, "loss": 0.6063, "loss/base_kto": 3.275601625442505, "metrics/advantage_var": 801.8453979492188, "regularization/lipschitz_norm": 1597.693115234375, "regularization/mmd": 0.23303942382335663, "regularization/rkhs_norm": 277.4279479980469, "regularization/w1": 1.34206223487854, "rewards/chosen": 0.5217841908901553, "rewards/margins": 0.8165568688415441, "rewards/rejected": -0.2947726779513889, "step": 1000 }, { "epoch": 1.3212435233160622, "grad_norm": 20.192045211791992, "kl": 15.831377029418945, "learning_rate": 6.323740513377171e-07, "logits/chosen": -34121421.26475038, "logits/rejected": -36387265.9644588, "logps/chosen": -472.9985344175492, "logps/rejected": -377.53367326332796, "loss": 0.612, "loss/base_kto": 3.369748830795288, "metrics/advantage_var": 577.3466186523438, "regularization/lipschitz_norm": 1555.6634521484375, "regularization/mmd": 0.21918420493602753, "regularization/rkhs_norm": 260.9335632324219, "regularization/w1": 1.3067572116851807, "rewards/chosen": 0.438801683203716, "rewards/margins": 0.6660324885838023, "rewards/rejected": -0.22723080538008633, "step": 1020 }, { "epoch": 1.3471502590673574, "grad_norm": 20.490093231201172, "kl": 24.298540115356445, "learning_rate": 6.186516788608865e-07, "logits/chosen": -34470267.25925926, "logits/rejected": -36366078.73057851, "logps/chosen": -482.6902777777778, "logps/rejected": -360.40996900826445, "loss": 0.5991, "loss/base_kto": 3.32615065574646, "metrics/advantage_var": 559.3719482421875, "regularization/lipschitz_norm": 1490.1746826171875, "regularization/mmd": 0.21459384262561798, "regularization/rkhs_norm": 255.46885681152344, "regularization/w1": 1.251746654510498, "rewards/chosen": 0.6812146448206019, "rewards/margins": 0.7386676300954922, "rewards/rejected": -0.05745298527489024, "step": 1040 }, { "epoch": 1.3730569948186528, "grad_norm": 13.66446590423584, "kl": 22.269344329833984, "learning_rate": 6.048339246932652e-07, "logits/chosen": -35219875.544764794, "logits/rejected": -36463080.09017713, "logps/chosen": -484.26242412746586, "logps/rejected": -381.37097423510465, "loss": 0.6116, "loss/base_kto": 3.2787845134735107, "metrics/advantage_var": 724.5116577148438, "regularization/lipschitz_norm": 1644.1292724609375, "regularization/mmd": 0.2325955480337143, "regularization/rkhs_norm": 276.8994445800781, "regularization/w1": 1.3810687065124512, "rewards/chosen": 0.6422472940772003, "rewards/margins": 0.7504795311758818, "rewards/rejected": -0.10823223709868156, "step": 1060 }, { "epoch": 1.3989637305699483, "grad_norm": 17.01795196533203, "kl": 13.111950874328613, "learning_rate": 5.909318966486494e-07, "logits/chosen": -34974592.58986175, "logits/rejected": -36928982.48648649, "logps/chosen": -498.9107142857143, "logps/rejected": -368.5732064785374, "loss": 0.6137, "loss/base_kto": 3.329371690750122, "metrics/advantage_var": 623.7325439453125, "regularization/lipschitz_norm": 1612.164306640625, "regularization/mmd": 0.22597865760326385, "regularization/rkhs_norm": 269.022216796875, "regularization/w1": 1.3542180061340332, "rewards/chosen": 0.4364518547937068, "rewards/margins": 0.7611252633383958, "rewards/rejected": -0.324673408544689, "step": 1080 }, { "epoch": 1.4248704663212435, "grad_norm": 19.452707290649414, "kl": 14.179718017578125, "learning_rate": 5.769567702869052e-07, "logits/chosen": -34936724.54320987, "logits/rejected": -35825404.75949367, "logps/chosen": -478.56968557098764, "logps/rejected": -357.82345233386076, "loss": 0.5943, "loss/base_kto": 3.280343770980835, "metrics/advantage_var": 581.9765014648438, "regularization/lipschitz_norm": 1497.4761962890625, "regularization/mmd": 0.21621882915496826, "regularization/rkhs_norm": 257.40338134765625, "regularization/w1": 1.2578800916671753, "rewards/chosen": 0.5376853942871094, "rewards/margins": 0.8094757176652739, "rewards/rejected": -0.27179032337816456, "step": 1100 }, { "epoch": 1.450777202072539, "grad_norm": 20.629621505737305, "kl": 12.300616264343262, "learning_rate": 5.629197799301614e-07, "logits/chosen": -35334603.75510204, "logits/rejected": -36255396.827371694, "logps/chosen": -471.71085164835165, "logps/rejected": -370.98532270606535, "loss": 0.6058, "loss/base_kto": 3.260944366455078, "metrics/advantage_var": 635.8053588867188, "regularization/lipschitz_norm": 1616.2861328125, "regularization/mmd": 0.22804021835327148, "regularization/rkhs_norm": 271.4764709472656, "regularization/w1": 1.357680320739746, "rewards/chosen": 0.4329929321863962, "rewards/margins": 0.792609865863678, "rewards/rejected": -0.35961693367728176, "step": 1120 }, { "epoch": 1.4766839378238341, "grad_norm": 17.78253746032715, "kl": 16.477476119995117, "learning_rate": 5.488322096317633e-07, "logits/chosen": -34614334.49765258, "logits/rejected": -36624674.74570983, "logps/chosen": -498.6641236306729, "logps/rejected": -393.81108619344775, "loss": 0.6232, "loss/base_kto": 3.346104145050049, "metrics/advantage_var": 653.1791381835938, "regularization/lipschitz_norm": 1673.0789794921875, "regularization/mmd": 0.23400922119617462, "regularization/rkhs_norm": 278.5823974609375, "regularization/w1": 1.4053863286972046, "rewards/chosen": 0.4271581228909918, "rewards/margins": 0.6889516433378644, "rewards/rejected": -0.26179352044687254, "step": 1140 }, { "epoch": 1.5025906735751295, "grad_norm": 22.57742691040039, "kl": 22.35113525390625, "learning_rate": 5.347053841052518e-07, "logits/chosen": -32957121.56097561, "logits/rejected": -36542132.51282051, "logps/chosen": -473.2158441310976, "logps/rejected": -367.58969350961536, "loss": 0.5908, "loss/base_kto": 3.2424709796905518, "metrics/advantage_var": 522.5794067382812, "regularization/lipschitz_norm": 1508.7386474609375, "regularization/mmd": 0.216816708445549, "regularization/rkhs_norm": 258.11517333984375, "regularization/w1": 1.2673405408859253, "rewards/chosen": 0.7005406356439358, "rewards/margins": 0.8212893633934913, "rewards/rejected": -0.12074872774955554, "step": 1160 }, { "epoch": 1.528497409326425, "grad_norm": 24.7183895111084, "kl": 19.532506942749023, "learning_rate": 5.205506596206531e-07, "logits/chosen": -35172556.16199377, "logits/rejected": -35466846.69592477, "logps/chosen": -463.80909267912773, "logps/rejected": -370.18005485893417, "loss": 0.5975, "loss/base_kto": 3.305455446243286, "metrics/advantage_var": 577.9130859375, "regularization/lipschitz_norm": 1493.23974609375, "regularization/mmd": 0.22011370956897736, "regularization/rkhs_norm": 262.0401306152344, "regularization/w1": 1.2543214559555054, "rewards/chosen": 0.5439251100534219, "rewards/margins": 0.7324913837098066, "rewards/rejected": -0.1885662736563847, "step": 1180 }, { "epoch": 1.5544041450777202, "grad_norm": 14.92409896850586, "kl": 13.285479545593262, "learning_rate": 5.063794148754032e-07, "logits/chosen": -35531352.79092383, "logits/rejected": -36195709.49019608, "logps/chosen": -472.19403363047, "logps/rejected": -351.37101715686276, "loss": 0.5986, "loss/base_kto": 3.337872266769409, "metrics/advantage_var": 564.6458129882812, "regularization/lipschitz_norm": 1476.8944091796875, "regularization/mmd": 0.21070383489131927, "regularization/rkhs_norm": 250.837890625, "regularization/w1": 1.240591287612915, "rewards/chosen": 0.44879150390625, "rewards/margins": 0.717865450529671, "rewards/rejected": -0.269073946623421, "step": 1200 }, { "epoch": 1.5803108808290154, "grad_norm": 14.848271369934082, "kl": 13.913154602050781, "learning_rate": 4.922030418472422e-07, "logits/chosen": -35476883.0984127, "logits/rejected": -36927629.78461538, "logps/chosen": -499.249503968254, "logps/rejected": -385.41865384615386, "loss": 0.6031, "loss/base_kto": 3.3059029579162598, "metrics/advantage_var": 570.443603515625, "regularization/lipschitz_norm": 1541.2706298828125, "regularization/mmd": 0.22412748634815216, "regularization/rkhs_norm": 266.81842041015625, "regularization/w1": 1.2946674823760986, "rewards/chosen": 0.44281790597098214, "rewards/margins": 0.758338113302713, "rewards/rejected": -0.31552020733173075, "step": 1220 }, { "epoch": 1.6062176165803108, "grad_norm": 18.774168014526367, "kl": 13.343116760253906, "learning_rate": 4.780329366364336e-07, "logits/chosen": -35339089.986928105, "logits/rejected": -36073269.65269461, "logps/chosen": -486.8254187091503, "logps/rejected": -396.15269461077844, "loss": 0.6162, "loss/base_kto": 3.307917356491089, "metrics/advantage_var": 598.0717163085938, "regularization/lipschitz_norm": 1659.9559326171875, "regularization/mmd": 0.22696201503276825, "regularization/rkhs_norm": 270.19287109375, "regularization/w1": 1.3943630456924438, "rewards/chosen": 0.36707116419972935, "rewards/margins": 0.7442218311275923, "rewards/rejected": -0.37715066692786303, "step": 1240 }, { "epoch": 1.6321243523316062, "grad_norm": 16.591535568237305, "kl": 15.358591079711914, "learning_rate": 4.638804903046684e-07, "logits/chosen": -34459275.63636363, "logits/rejected": -35436834.29283489, "logps/chosen": -496.42158111285266, "logps/rejected": -374.64193925233644, "loss": 0.6077, "loss/base_kto": 3.287248373031616, "metrics/advantage_var": 660.1201171875, "regularization/lipschitz_norm": 1603.1197509765625, "regularization/mmd": 0.22733287513256073, "regularization/rkhs_norm": 270.6343688964844, "regularization/w1": 1.3466205596923828, "rewards/chosen": 0.5073473700161638, "rewards/margins": 0.7654089780662636, "rewards/rejected": -0.2580616080500998, "step": 1260 }, { "epoch": 1.6580310880829017, "grad_norm": 21.79800033569336, "kl": 8.014674186706543, "learning_rate": 4.497570797180217e-07, "logits/chosen": -34720075.15227629, "logits/rejected": -35828568.783825815, "logps/chosen": -499.52266483516485, "logps/rejected": -373.08040921461895, "loss": 0.6157, "loss/base_kto": 3.312753677368164, "metrics/advantage_var": 660.47265625, "regularization/lipschitz_norm": 1642.948486328125, "regularization/mmd": 0.23258309066295624, "regularization/rkhs_norm": 276.8846130371094, "regularization/w1": 1.3800767660140991, "rewards/chosen": 0.37633331155103267, "rewards/margins": 0.7964948183581138, "rewards/rejected": -0.4201615068070811, "step": 1280 }, { "epoch": 1.6839378238341969, "grad_norm": 21.787792205810547, "kl": 11.092989921569824, "learning_rate": 4.3567405840131853e-07, "logits/chosen": -36956741.530864194, "logits/rejected": -36305531.1392405, "logps/chosen": -481.8137538580247, "logps/rejected": -380.1670292721519, "loss": 0.6044, "loss/base_kto": 3.354888916015625, "metrics/advantage_var": 610.9271850585938, "regularization/lipschitz_norm": 1505.3267822265625, "regularization/mmd": 0.21620440483093262, "regularization/rkhs_norm": 257.3861999511719, "regularization/w1": 1.2644745111465454, "rewards/chosen": 0.40942858472282506, "rewards/margins": 0.673559261571804, "rewards/rejected": -0.26413067684897895, "step": 1300 }, { "epoch": 1.709844559585492, "grad_norm": 15.7304105758667, "kl": 11.27443790435791, "learning_rate": 4.2164274741126506e-07, "logits/chosen": -35081312.0, "logits/rejected": -35930259.2, "logps/chosen": -509.440673828125, "logps/rejected": -362.72119140625, "loss": 0.6024, "loss/base_kto": 3.330542802810669, "metrics/advantage_var": 518.4404296875, "regularization/lipschitz_norm": 1518.8363037109375, "regularization/mmd": 0.2130681574344635, "regularization/rkhs_norm": 253.652587890625, "regularization/w1": 1.2758225202560425, "rewards/chosen": 0.40545225143432617, "rewards/margins": 0.6953860759735108, "rewards/rejected": -0.2899338245391846, "step": 1320 }, { "epoch": 1.7357512953367875, "grad_norm": 21.205015182495117, "kl": 8.930121421813965, "learning_rate": 4.0767442623567856e-07, "logits/chosen": -33595198.22512235, "logits/rejected": -34796834.15892054, "logps/chosen": -465.2855831973899, "logps/rejected": -372.65877998500747, "loss": 0.6031, "loss/base_kto": 3.3770835399627686, "metrics/advantage_var": 492.9637145996094, "regularization/lipschitz_norm": 1480.6346435546875, "regularization/mmd": 0.2036602795124054, "regularization/rkhs_norm": 242.4527130126953, "regularization/w1": 1.2437330484390259, "rewards/chosen": 0.241196973094349, "rewards/margins": 0.6486426948135675, "rewards/rejected": -0.4074457217192185, "step": 1340 }, { "epoch": 1.761658031088083, "grad_norm": 17.333303451538086, "kl": 10.10449504852295, "learning_rate": 3.937803237261357e-07, "logits/chosen": -34304521.54037267, "logits/rejected": -35787589.2327044, "logps/chosen": -462.81317934782606, "logps/rejected": -408.51533018867923, "loss": 0.6066, "loss/base_kto": 3.3171639442443848, "metrics/advantage_var": 561.0217895507812, "regularization/lipschitz_norm": 1567.8363037109375, "regularization/mmd": 0.21870306134223938, "regularization/rkhs_norm": 260.3608093261719, "regularization/w1": 1.316982626914978, "rewards/chosen": 0.3505211587277999, "rewards/margins": 0.7447365805843742, "rewards/rejected": -0.39421542185657427, "step": 1360 }, { "epoch": 1.7875647668393784, "grad_norm": 19.61787986755371, "kl": 11.242029190063477, "learning_rate": 3.7997160907132456e-07, "logits/chosen": -35242940.39291465, "logits/rejected": -36643089.481031865, "logps/chosen": -485.9791163446055, "logps/rejected": -394.5627371016692, "loss": 0.6038, "loss/base_kto": 3.283898115158081, "metrics/advantage_var": 582.4346923828125, "regularization/lipschitz_norm": 1574.2464599609375, "regularization/mmd": 0.22452466189861298, "regularization/rkhs_norm": 267.291259765625, "regularization/w1": 1.3223670721054077, "rewards/chosen": 0.35564372236218045, "rewards/margins": 0.7960194136617347, "rewards/rejected": -0.44037569129955423, "step": 1380 }, { "epoch": 1.8134715025906736, "grad_norm": 15.509449005126953, "kl": 5.774592876434326, "learning_rate": 3.662593828183601e-07, "logits/chosen": -34188235.11737089, "logits/rejected": -34408949.61622465, "logps/chosen": -467.61551251956183, "logps/rejected": -364.19283833853353, "loss": 0.6066, "loss/base_kto": 3.3596699237823486, "metrics/advantage_var": 553.5308227539062, "regularization/lipschitz_norm": 1517.386474609375, "regularization/mmd": 0.21879544854164124, "regularization/rkhs_norm": 260.47076416015625, "regularization/w1": 1.2746046781539917, "rewards/chosen": 0.2672982611380086, "rewards/margins": 0.7456527761779852, "rewards/rejected": -0.4783545150399766, "step": 1400 }, { "epoch": 1.8393782383419688, "grad_norm": 19.400392532348633, "kl": 8.308951377868652, "learning_rate": 3.5265466794927725e-07, "logits/chosen": -34242840.77419355, "logits/rejected": -35609572.07272727, "logps/chosen": -487.59637096774196, "logps/rejected": -374.04543087121215, "loss": 0.606, "loss/base_kto": 3.2787225246429443, "metrics/advantage_var": 566.2044677734375, "regularization/lipschitz_norm": 1603.628173828125, "regularization/mmd": 0.22200237214565277, "regularization/rkhs_norm": 264.2885437011719, "regularization/w1": 1.3470476865768433, "rewards/chosen": 0.362433107437626, "rewards/margins": 0.7876839989208173, "rewards/rejected": -0.4252508914831913, "step": 1420 }, { "epoch": 1.8652849740932642, "grad_norm": 17.38187026977539, "kl": 7.223329067230225, "learning_rate": 3.3916840101987887e-07, "logits/chosen": -35521924.62650602, "logits/rejected": -34677154.90909091, "logps/chosen": -489.94126506024094, "logps/rejected": -386.2927150974026, "loss": 0.6039, "loss/base_kto": 3.33835768699646, "metrics/advantage_var": 510.293212890625, "regularization/lipschitz_norm": 1523.18359375, "regularization/mmd": 0.21299903094768524, "regularization/rkhs_norm": 253.5702667236328, "regularization/w1": 1.279474139213562, "rewards/chosen": 0.3077183459178511, "rewards/margins": 0.7415810568458391, "rewards/rejected": -0.433862710927988, "step": 1440 }, { "epoch": 1.8911917098445596, "grad_norm": 13.490575790405273, "kl": 13.166955947875977, "learning_rate": 3.258114233680583e-07, "logits/chosen": -34149653.23317684, "logits/rejected": -35491149.878315136, "logps/chosen": -485.71273474178406, "logps/rejected": -367.64489079563185, "loss": 0.5847, "loss/base_kto": 3.3421249389648438, "metrics/advantage_var": 476.4816589355469, "regularization/lipschitz_norm": 1352.8961181640625, "regularization/mmd": 0.1990450620651245, "regularization/rkhs_norm": 236.95840454101562, "regularization/w1": 1.1364328861236572, "rewards/chosen": 0.4030161874021909, "rewards/margins": 0.730635266896816, "rewards/rejected": -0.3276190794946251, "step": 1460 }, { "epoch": 1.917098445595855, "grad_norm": 20.736454010009766, "kl": 10.202261924743652, "learning_rate": 3.1259447239866796e-07, "logits/chosen": -35675823.85410334, "logits/rejected": -35379628.03858521, "logps/chosen": -480.85020896656533, "logps/rejected": -378.16780546623795, "loss": 0.6031, "loss/base_kto": 3.305757522583008, "metrics/advantage_var": 567.9496459960938, "regularization/lipschitz_norm": 1546.3131103515625, "regularization/mmd": 0.22012697160243988, "regularization/rkhs_norm": 262.055908203125, "regularization/w1": 1.298902988433838, "rewards/chosen": 0.39345200373409006, "rewards/margins": 0.7709371256787997, "rewards/rejected": -0.3774851219447096, "step": 1480 }, { "epoch": 1.9430051813471503, "grad_norm": 16.839126586914062, "kl": 11.110552787780762, "learning_rate": 2.9952817295193435e-07, "logits/chosen": -35211466.013605446, "logits/rejected": -35807820.94797688, "logps/chosen": -465.5361394557823, "logps/rejected": -378.2607026734104, "loss": 0.5933, "loss/base_kto": 3.285698413848877, "metrics/advantage_var": 516.9336547851562, "regularization/lipschitz_norm": 1489.0986328125, "regularization/mmd": 0.2096785306930542, "regularization/rkhs_norm": 249.6172637939453, "regularization/w1": 1.2508429288864136, "rewards/chosen": 0.3581001904545998, "rewards/margins": 0.7581950771902843, "rewards/rejected": -0.4000948867356846, "step": 1500 }, { "epoch": 1.9689119170984455, "grad_norm": 16.851472854614258, "kl": 6.301633358001709, "learning_rate": 2.866230287623651e-07, "logits/chosen": -34655394.34146342, "logits/rejected": -35765563.07692308, "logps/chosen": -497.6768769054878, "logps/rejected": -359.32166466346155, "loss": 0.6056, "loss/base_kto": 3.331233263015747, "metrics/advantage_var": 577.916259765625, "regularization/lipschitz_norm": 1545.646728515625, "regularization/mmd": 0.21512162685394287, "regularization/rkhs_norm": 256.09716796875, "regularization/w1": 1.298343300819397, "rewards/chosen": 0.2812550707561214, "rewards/margins": 0.7595724293110593, "rewards/rejected": -0.4783173585549379, "step": 1520 }, { "epoch": 1.994818652849741, "grad_norm": 18.61896514892578, "kl": 8.949078559875488, "learning_rate": 2.738894140150075e-07, "logits/chosen": -34263785.27810651, "logits/rejected": -35954813.456953645, "logps/chosen": -486.1563424556213, "logps/rejected": -371.0991825331126, "loss": 0.6065, "loss/base_kto": 3.3602044582366943, "metrics/advantage_var": 523.9320068359375, "regularization/lipschitz_norm": 1520.69921875, "regularization/mmd": 0.21460656821727753, "regularization/rkhs_norm": 255.48399353027344, "regularization/w1": 1.2773874998092651, "rewards/chosen": 0.3820487930929872, "rewards/margins": 0.7061543400569126, "rewards/rejected": -0.3241055469639254, "step": 1540 }, { "epoch": 2.0207253886010363, "grad_norm": 15.663430213928223, "kl": 13.345422744750977, "learning_rate": 2.6133756500585156e-07, "logits/chosen": -34523730.36152571, "logits/rejected": -36343477.285925925, "logps/chosen": -481.4479166666667, "logps/rejected": -361.3463888888889, "loss": 0.5615, "loss/base_kto": 3.151230573654175, "metrics/advantage_var": 496.30792236328125, "regularization/lipschitz_norm": 1353.939697265625, "regularization/mmd": 0.2035330832004547, "regularization/rkhs_norm": 242.30126953125, "regularization/w1": 1.1373093128204346, "rewards/chosen": 0.5420287276184184, "rewards/margins": 0.9054012138742054, "rewards/rejected": -0.36337248625578705, "step": 1560 }, { "epoch": 2.0466321243523318, "grad_norm": 16.60082244873047, "kl": 4.14560604095459, "learning_rate": 2.489775719130767e-07, "logits/chosen": -34222845.11433172, "logits/rejected": -35006299.289833084, "logps/chosen": -467.01056763285027, "logps/rejected": -376.38766122913506, "loss": 0.5649, "loss/base_kto": 3.2409398555755615, "metrics/advantage_var": 410.4333190917969, "regularization/lipschitz_norm": 1293.7279052734375, "regularization/mmd": 0.19129277765750885, "regularization/rkhs_norm": 227.7294921875, "regularization/w1": 1.0867313146591187, "rewards/chosen": 0.2668771052706069, "rewards/margins": 0.8168642499144803, "rewards/rejected": -0.5499871446438733, "step": 1580 }, { "epoch": 2.0725388601036268, "grad_norm": 20.203248977661133, "kl": 7.194047451019287, "learning_rate": 2.3681937068576303e-07, "logits/chosen": -32956076.840764333, "logits/rejected": -35525902.134969324, "logps/chosen": -459.06797372611464, "logps/rejected": -380.4706192484663, "loss": 0.5599, "loss/base_kto": 3.150766372680664, "metrics/advantage_var": 444.0229187011719, "regularization/lipschitz_norm": 1342.6407470703125, "regularization/mmd": 0.20039306581020355, "regularization/rkhs_norm": 238.5631866455078, "regularization/w1": 1.1278181076049805, "rewards/chosen": 0.3972078797164237, "rewards/margins": 0.9025857135450279, "rewards/rejected": -0.5053778338286042, "step": 1600 }, { "epoch": 2.098445595854922, "grad_norm": 19.274572372436523, "kl": 9.700411796569824, "learning_rate": 2.2487273505658e-07, "logits/chosen": -34070280.718266256, "logits/rejected": -36092401.4637224, "logps/chosen": -484.202883126935, "logps/rejected": -378.37867212145113, "loss": 0.5628, "loss/base_kto": 3.1901321411132812, "metrics/advantage_var": 441.826171875, "regularization/lipschitz_norm": 1326.1185302734375, "regularization/mmd": 0.19808267056941986, "regularization/rkhs_norm": 235.81272888183594, "regularization/w1": 1.1139395236968994, "rewards/chosen": 0.41013607816430436, "rewards/margins": 0.8686482489980485, "rewards/rejected": -0.45851217083374407, "step": 1620 }, { "epoch": 2.1243523316062176, "grad_norm": 17.713275909423828, "kl": 16.2282657623291, "learning_rate": 2.131472686848817e-07, "logits/chosen": -33278884.450331125, "logits/rejected": -34799952.28402367, "logps/chosen": -450.5597061258278, "logps/rejected": -373.2557784763314, "loss": 0.5504, "loss/base_kto": 3.0897510051727295, "metrics/advantage_var": 430.9189147949219, "regularization/lipschitz_norm": 1330.6058349609375, "regularization/mmd": 0.1960301399230957, "regularization/rkhs_norm": 233.36924743652344, "regularization/w1": 1.1177090406417847, "rewards/chosen": 0.5879785398773799, "rewards/margins": 0.9322853051007758, "rewards/rejected": -0.34430676522339587, "step": 1640 }, { "epoch": 2.150259067357513, "grad_norm": 16.43911361694336, "kl": 10.072003364562988, "learning_rate": 2.016523974365188e-07, "logits/chosen": -34154459.537091985, "logits/rejected": -35742905.87458746, "logps/chosen": -467.65968100890206, "logps/rejected": -372.0141295379538, "loss": 0.5513, "loss/base_kto": 3.162606954574585, "metrics/advantage_var": 420.5672912597656, "regularization/lipschitz_norm": 1258.2938232421875, "regularization/mmd": 0.19048896431922913, "regularization/rkhs_norm": 226.7725830078125, "regularization/w1": 1.056966781616211, "rewards/chosen": 0.49096303877561664, "rewards/margins": 0.8975468940300386, "rewards/rejected": -0.4065838552544219, "step": 1660 }, { "epoch": 2.1761658031088085, "grad_norm": 12.407207489013672, "kl": 16.136207580566406, "learning_rate": 1.9039736180657372e-07, "logits/chosen": -33702826.15568862, "logits/rejected": -34882456.26143791, "logps/chosen": -469.79098053892216, "logps/rejected": -356.289164624183, "loss": 0.5506, "loss/base_kto": 3.1579740047454834, "metrics/advantage_var": 393.1698913574219, "regularization/lipschitz_norm": 1260.581298828125, "regularization/mmd": 0.1881152242422104, "regularization/rkhs_norm": 223.94668579101562, "regularization/w1": 1.05888831615448, "rewards/chosen": 0.5765886592293927, "rewards/margins": 0.8646527058522737, "rewards/rejected": -0.28806404662288093, "step": 1680 }, { "epoch": 2.2020725388601035, "grad_norm": 17.052236557006836, "kl": 20.198055267333984, "learning_rate": 1.7939120949111498e-07, "logits/chosen": -34386622.71406492, "logits/rejected": -34062801.8957346, "logps/chosen": -474.3678516228748, "logps/rejected": -367.033150671406, "loss": 0.5576, "loss/base_kto": 3.1356256008148193, "metrics/advantage_var": 421.7980651855469, "regularization/lipschitz_norm": 1345.038818359375, "regularization/mmd": 0.19535815715789795, "regularization/rkhs_norm": 232.56924438476562, "regularization/w1": 1.1298326253890991, "rewards/chosen": 0.6413323285959235, "rewards/margins": 0.8828754882615781, "rewards/rejected": -0.24154315966565462, "step": 1700 }, { "epoch": 2.227979274611399, "grad_norm": 12.275116920471191, "kl": 20.29020118713379, "learning_rate": 1.6864278811393523e-07, "logits/chosen": -34066009.396825396, "logits/rejected": -36403187.39692308, "logps/chosen": -470.1501488095238, "logps/rejected": -351.7273076923077, "loss": 0.5482, "loss/base_kto": 3.1216049194335938, "metrics/advantage_var": 432.7414245605469, "regularization/lipschitz_norm": 1274.5933837890625, "regularization/mmd": 0.19359762966632843, "regularization/rkhs_norm": 230.473388671875, "regularization/w1": 1.0706584453582764, "rewards/chosen": 0.6454751635354663, "rewards/margins": 0.9016580483386514, "rewards/rejected": -0.2561828848031851, "step": 1720 }, { "epoch": 2.2538860103626943, "grad_norm": 17.391368865966797, "kl": 15.871638298034668, "learning_rate": 1.5816073811412584e-07, "logits/chosen": -35591220.9118541, "logits/rejected": -35558969.62057878, "logps/chosen": -510.8705357142857, "logps/rejected": -366.8060942524116, "loss": 0.5625, "loss/base_kto": 3.204577684402466, "metrics/advantage_var": 406.9927673339844, "regularization/lipschitz_norm": 1313.569091796875, "regularization/mmd": 0.19188784062862396, "regularization/rkhs_norm": 228.43789672851562, "regularization/w1": 1.1033979654312134, "rewards/chosen": 0.5263376902664324, "rewards/margins": 0.8345126331171157, "rewards/rejected": -0.30817494285068325, "step": 1740 }, { "epoch": 2.2797927461139897, "grad_norm": 15.490945816040039, "kl": 14.441825866699219, "learning_rate": 1.4795348580020207e-07, "logits/chosen": -34796995.17593985, "logits/rejected": -35708375.20650406, "logps/chosen": -478.46508458646616, "logps/rejected": -369.3638973577236, "loss": 0.5561, "loss/base_kto": 3.1802051067352295, "metrics/advantage_var": 448.74444580078125, "regularization/lipschitz_norm": 1276.7210693359375, "regularization/mmd": 0.19625453650951385, "regularization/rkhs_norm": 233.63633728027344, "regularization/w1": 1.0724457502365112, "rewards/chosen": 0.580721426368656, "rewards/margins": 0.8381055637781454, "rewards/rejected": -0.25738413740948934, "step": 1760 }, { "epoch": 2.305699481865285, "grad_norm": 16.70163917541504, "kl": 16.509061813354492, "learning_rate": 1.3802923657636355e-07, "logits/chosen": -33709276.92598425, "logits/rejected": -35695503.28062016, "logps/chosen": -485.6650590551181, "logps/rejected": -369.8797722868217, "loss": 0.5535, "loss/base_kto": 3.1416361331939697, "metrics/advantage_var": 412.0977478027344, "regularization/lipschitz_norm": 1298.9788818359375, "regularization/mmd": 0.19537167251110077, "regularization/rkhs_norm": 232.5853271484375, "regularization/w1": 1.0911420583724976, "rewards/chosen": 0.5842356283833662, "rewards/margins": 0.8872957371300353, "rewards/rejected": -0.3030601087466691, "step": 1780 }, { "epoch": 2.33160621761658, "grad_norm": 15.036764144897461, "kl": 16.303043365478516, "learning_rate": 1.28395968346336e-07, "logits/chosen": -35427242.666666664, "logits/rejected": -36441643.70731708, "logps/chosen": -470.7861578525641, "logps/rejected": -388.3401295731707, "loss": 0.5537, "loss/base_kto": 3.210310459136963, "metrics/advantage_var": 389.3489074707031, "regularization/lipschitz_norm": 1229.18896484375, "regularization/mmd": 0.18670466542243958, "regularization/rkhs_norm": 222.2674560546875, "regularization/w1": 1.032518744468689, "rewards/chosen": 0.5515383695944761, "rewards/margins": 0.8148118645940593, "rewards/rejected": -0.2632734949995832, "step": 1800 }, { "epoch": 2.3575129533678756, "grad_norm": 14.74306869506836, "kl": 14.714845657348633, "learning_rate": 1.1906142510009415e-07, "logits/chosen": -33078640.64, "logits/rejected": -35340725.74045801, "logps/chosen": -491.2714, "logps/rejected": -382.17867366412213, "loss": 0.5506, "loss/base_kto": 3.153940200805664, "metrics/advantage_var": 408.9933166503906, "regularization/lipschitz_norm": 1263.418212890625, "regularization/mmd": 0.1893465220928192, "regularization/rkhs_norm": 225.4125213623047, "regularization/w1": 1.0612711906433105, "rewards/chosen": 0.540904443359375, "rewards/margins": 0.8782191247838145, "rewards/rejected": -0.33731468142443943, "step": 1820 }, { "epoch": 2.383419689119171, "grad_norm": 17.674104690551758, "kl": 12.485431671142578, "learning_rate": 1.1003311068862547e-07, "logits/chosen": -34308014.331288345, "logits/rejected": -36068224.81528662, "logps/chosen": -481.9826495398773, "logps/rejected": -391.43978901273886, "loss": 0.5636, "loss/base_kto": 3.1916422843933105, "metrics/advantage_var": 413.0802917480469, "regularization/lipschitz_norm": 1338.4227294921875, "regularization/mmd": 0.1930001825094223, "regularization/rkhs_norm": 229.76211547851562, "regularization/w1": 1.1242752075195312, "rewards/chosen": 0.5023735374029429, "rewards/margins": 0.8465773162955086, "rewards/rejected": -0.3442037788925657, "step": 1840 }, { "epoch": 2.4093264248704664, "grad_norm": 14.2947359085083, "kl": 12.327513694763184, "learning_rate": 1.0131828279173588e-07, "logits/chosen": -35413580.64670659, "logits/rejected": -35673466.14379085, "logps/chosen": -463.0991766467066, "logps/rejected": -396.7017463235294, "loss": 0.5658, "loss/base_kto": 3.20099139213562, "metrics/advantage_var": 460.7687683105469, "regularization/lipschitz_norm": 1338.125732421875, "regularization/mmd": 0.2013152688741684, "regularization/rkhs_norm": 239.66104125976562, "regularization/w1": 1.124025583267212, "rewards/chosen": 0.5205276397887818, "rewards/margins": 0.8575834943368185, "rewards/rejected": -0.33705585454803666, "step": 1860 }, { "epoch": 2.4352331606217614, "grad_norm": 31.240116119384766, "kl": 16.550434112548828, "learning_rate": 9.292394708374596e-08, "logits/chosen": -35559477.97829457, "logits/rejected": -35316447.34488189, "logps/chosen": -493.40707364341085, "logps/rejected": -362.5683070866142, "loss": 0.5543, "loss/base_kto": 3.1523091793060303, "metrics/advantage_var": 423.706298828125, "regularization/lipschitz_norm": 1295.798828125, "regularization/mmd": 0.19368301331996918, "regularization/rkhs_norm": 230.5749969482422, "regularization/w1": 1.0884710550308228, "rewards/chosen": 0.6050730623940165, "rewards/margins": 0.8743481810040681, "rewards/rejected": -0.26927511861005166, "step": 1880 }, { "epoch": 2.461139896373057, "grad_norm": 18.28568458557129, "kl": 12.479555130004883, "learning_rate": 8.48568516017727e-08, "logits/chosen": -34717428.06616541, "logits/rejected": -34797165.060162604, "logps/chosen": -489.3280545112782, "logps/rejected": -395.2839430894309, "loss": 0.5742, "loss/base_kto": 3.2356834411621094, "metrics/advantage_var": 445.1636657714844, "regularization/lipschitz_norm": 1380.8460693359375, "regularization/mmd": 0.1978769749403, "regularization/rkhs_norm": 235.56785583496094, "regularization/w1": 1.159910798072815, "rewards/chosen": 0.4817421361019737, "rewards/margins": 0.7853476266856881, "rewards/rejected": -0.30360549058371444, "step": 1900 }, { "epoch": 2.4870466321243523, "grad_norm": 20.037012100219727, "kl": 16.443828582763672, "learning_rate": 7.71234813211169e-08, "logits/chosen": -32732970.26791277, "logits/rejected": -36248964.4137931, "logps/chosen": -503.50603582554515, "logps/rejected": -360.37661637931035, "loss": 0.5559, "loss/base_kto": 3.1413798332214355, "metrics/advantage_var": 422.8507995605469, "regularization/lipschitz_norm": 1322.3681640625, "regularization/mmd": 0.19529306888580322, "regularization/rkhs_norm": 232.4917449951172, "regularization/w1": 1.110789179801941, "rewards/chosen": 0.582496619298822, "rewards/margins": 0.8898033215329766, "rewards/rejected": -0.30730670223415457, "step": 1920 }, { "epoch": 2.5129533678756477, "grad_norm": 13.40541934967041, "kl": 13.286964416503906, "learning_rate": 6.973005294212353e-08, "logits/chosen": -34099776.19571865, "logits/rejected": -35596026.27476038, "logps/chosen": -460.0447247706422, "logps/rejected": -377.27837959265173, "loss": 0.557, "loss/base_kto": 3.1802804470062256, "metrics/advantage_var": 421.4122619628906, "regularization/lipschitz_norm": 1286.3289794921875, "regularization/mmd": 0.19494830071926117, "regularization/rkhs_norm": 232.08132934570312, "regularization/w1": 1.0805162191390991, "rewards/chosen": 0.5918159134891054, "rewards/margins": 0.8760400123527985, "rewards/rejected": -0.2842240988636931, "step": 1940 }, { "epoch": 2.538860103626943, "grad_norm": 16.829252243041992, "kl": 15.944289207458496, "learning_rate": 6.268250989270102e-08, "logits/chosen": -34565764.62166405, "logits/rejected": -35543361.69206843, "logps/chosen": -485.2910616169545, "logps/rejected": -396.3447220062208, "loss": 0.5557, "loss/base_kto": 3.19449782371521, "metrics/advantage_var": 423.94140625, "regularization/lipschitz_norm": 1261.138427734375, "regularization/mmd": 0.19156305491924286, "regularization/rkhs_norm": 228.05125427246094, "regularization/w1": 1.0593562126159668, "rewards/chosen": 0.5014354280624509, "rewards/margins": 0.8286953520181517, "rewards/rejected": -0.3272599239557008, "step": 1960 }, { "epoch": 2.5647668393782386, "grad_norm": 15.671279907226562, "kl": 14.265724182128906, "learning_rate": 5.598651755051975e-08, "logits/chosen": -34766777.1572327, "logits/rejected": -35768644.37267081, "logps/chosen": -475.6912342767296, "logps/rejected": -404.1916246118012, "loss": 0.5656, "loss/base_kto": 3.1690189838409424, "metrics/advantage_var": 452.4483337402344, "regularization/lipschitz_norm": 1378.263916015625, "regularization/mmd": 0.19829636812210083, "regularization/rkhs_norm": 236.0670928955078, "regularization/w1": 1.1577415466308594, "rewards/chosen": 0.5210393749692905, "rewards/margins": 0.8297014341134943, "rewards/rejected": -0.3086620591442037, "step": 1980 }, { "epoch": 2.5906735751295336, "grad_norm": 15.375778198242188, "kl": 12.648940086364746, "learning_rate": 4.964745868872933e-08, "logits/chosen": -32652997.17274168, "logits/rejected": -35350613.201849, "logps/chosen": -510.5975633914422, "logps/rejected": -373.8830893682589, "loss": 0.5555, "loss/base_kto": 3.1570632457733154, "metrics/advantage_var": 412.75006103515625, "regularization/lipschitz_norm": 1301.3785400390625, "regularization/mmd": 0.19356784224510193, "regularization/rkhs_norm": 230.4379119873047, "regularization/w1": 1.0931578874588013, "rewards/chosen": 0.5231033059194236, "rewards/margins": 0.8678444924052431, "rewards/rejected": -0.34474118648581953, "step": 2000 }, { "epoch": 2.616580310880829, "grad_norm": 17.0692138671875, "kl": 10.169137954711914, "learning_rate": 4.3670429148855493e-08, "logits/chosen": -34557681.73607038, "logits/rejected": -35296550.52842809, "logps/chosen": -480.4759897360704, "logps/rejected": -381.8172554347826, "loss": 0.562, "loss/base_kto": 3.2036292552948, "metrics/advantage_var": 402.7635498046875, "regularization/lipschitz_norm": 1310.4910888671875, "regularization/mmd": 0.1911742240190506, "regularization/rkhs_norm": 227.58837890625, "regularization/w1": 1.100812554359436, "rewards/chosen": 0.5259508149714763, "rewards/margins": 0.8284874381065359, "rewards/rejected": -0.3025366231350596, "step": 2020 }, { "epoch": 2.6424870466321244, "grad_norm": 16.717609405517578, "kl": 14.279626846313477, "learning_rate": 3.806023374435663e-08, "logits/chosen": -34697203.11949685, "logits/rejected": -36516603.229813665, "logps/chosen": -497.8650746855346, "logps/rejected": -389.54755434782606, "loss": 0.5643, "loss/base_kto": 3.158191442489624, "metrics/advantage_var": 485.89434814453125, "regularization/lipschitz_norm": 1373.371337890625, "regularization/mmd": 0.20268678665161133, "regularization/rkhs_norm": 241.29380798339844, "regularization/w1": 1.1536319255828857, "rewards/chosen": 0.5690512507216735, "rewards/margins": 0.8931313210751164, "rewards/rejected": -0.32408007035344283, "step": 2040 }, { "epoch": 2.66839378238342, "grad_norm": 19.559938430786133, "kl": 14.719937324523926, "learning_rate": 3.282138239813037e-08, "logits/chosen": -34417054.8681672, "logits/rejected": -37310068.717325225, "logps/chosen": -510.5387359324759, "logps/rejected": -335.9021181610942, "loss": 0.5544, "loss/base_kto": 3.178042411804199, "metrics/advantage_var": 411.0628356933594, "regularization/lipschitz_norm": 1269.0377197265625, "regularization/mmd": 0.19129517674446106, "regularization/rkhs_norm": 227.7323455810547, "regularization/w1": 1.0659916400909424, "rewards/chosen": 0.520851797612917, "rewards/margins": 0.8334851380948461, "rewards/rejected": -0.31263334048192915, "step": 2060 }, { "epoch": 2.694300518134715, "grad_norm": 15.9247465133667, "kl": 15.070162773132324, "learning_rate": 2.795808651707793e-08, "logits/chosen": -34143676.8, "logits/rejected": -34931616.0, "logps/chosen": -463.45068359375, "logps/rejected": -384.00576171875, "loss": 0.5587, "loss/base_kto": 3.2235469818115234, "metrics/advantage_var": 408.8959655761719, "regularization/lipschitz_norm": 1258.9595947265625, "regularization/mmd": 0.18841521441936493, "regularization/rkhs_norm": 224.3038330078125, "regularization/w1": 1.0575259923934937, "rewards/chosen": 0.5217224597930908, "rewards/margins": 0.7967797040939331, "rewards/rejected": -0.2750572443008423, "step": 2080 }, { "epoch": 2.7202072538860103, "grad_norm": 14.346929550170898, "kl": 13.841235160827637, "learning_rate": 2.3474255606639293e-08, "logits/chosen": -33959118.73817035, "logits/rejected": -35736728.173374616, "logps/chosen": -488.43158517350156, "logps/rejected": -372.11822755417955, "loss": 0.5516, "loss/base_kto": 3.17337965965271, "metrics/advantage_var": 398.7940368652344, "regularization/lipschitz_norm": 1251.205810546875, "regularization/mmd": 0.18865838646888733, "regularization/rkhs_norm": 224.5933074951172, "regularization/w1": 1.0510128736495972, "rewards/chosen": 0.5624405051631506, "rewards/margins": 0.8490387579703899, "rewards/rejected": -0.2865982528072393, "step": 2100 }, { "epoch": 2.7461139896373057, "grad_norm": 14.097362518310547, "kl": 12.440503120422363, "learning_rate": 1.9373494128020195e-08, "logits/chosen": -34075282.28571428, "logits/rejected": -35199549.686746985, "logps/chosen": -471.0784801136364, "logps/rejected": -365.6298004518072, "loss": 0.5446, "loss/base_kto": 3.1548008918762207, "metrics/advantage_var": 377.3975830078125, "regularization/lipschitz_norm": 1210.8582763671875, "regularization/mmd": 0.18470266461372375, "regularization/rkhs_norm": 219.88414001464844, "regularization/w1": 1.0171208381652832, "rewards/chosen": 0.5069566701913809, "rewards/margins": 0.869115985553415, "rewards/rejected": -0.36215931536203405, "step": 2120 }, { "epoch": 2.772020725388601, "grad_norm": 14.731213569641113, "kl": 11.466120719909668, "learning_rate": 1.5659098600638798e-08, "logits/chosen": -34719825.17073171, "logits/rejected": -36402766.76923077, "logps/chosen": -477.3217416158537, "logps/rejected": -384.74464142628204, "loss": 0.5598, "loss/base_kto": 3.1886706352233887, "metrics/advantage_var": 416.6258239746094, "regularization/lipschitz_norm": 1307.2476806640625, "regularization/mmd": 0.19199298322200775, "regularization/rkhs_norm": 228.56309509277344, "regularization/w1": 1.0980881452560425, "rewards/chosen": 0.5373472818514196, "rewards/margins": 0.8622382499785479, "rewards/rejected": -0.3248909681271284, "step": 2140 }, { "epoch": 2.7979274611398965, "grad_norm": 12.770276069641113, "kl": 13.92181396484375, "learning_rate": 1.2334054952120143e-08, "logits/chosen": -34218596.4244373, "logits/rejected": -34844469.68996961, "logps/chosen": -501.15851085209005, "logps/rejected": -387.0451652735562, "loss": 0.555, "loss/base_kto": 3.1139473915100098, "metrics/advantage_var": 455.1474609375, "regularization/lipschitz_norm": 1338.568359375, "regularization/mmd": 0.20162983238697052, "regularization/rkhs_norm": 240.03555297851562, "regularization/w1": 1.1243975162506104, "rewards/chosen": 0.565682463323955, "rewards/margins": 0.934562598996388, "rewards/rejected": -0.36888013567243305, "step": 2160 }, { "epoch": 2.823834196891192, "grad_norm": 16.815080642700195, "kl": 13.590758323669434, "learning_rate": 9.401036117969108e-09, "logits/chosen": -34037570.66255778, "logits/rejected": -35828039.80982567, "logps/chosen": -444.85959167950693, "logps/rejected": -366.44552297939777, "loss": 0.5608, "loss/base_kto": 3.210402011871338, "metrics/advantage_var": 568.79443359375, "regularization/lipschitz_norm": 1287.3560791015625, "regularization/mmd": 0.19464194774627686, "regularization/rkhs_norm": 231.7165985107422, "regularization/w1": 1.0813791751861572, "rewards/chosen": 0.5177080950861903, "rewards/margins": 0.7827321744709714, "rewards/rejected": -0.2650240793847811, "step": 2180 }, { "epoch": 2.849740932642487, "grad_norm": 17.200023651123047, "kl": 11.700523376464844, "learning_rate": 6.8623998928517555e-09, "logits/chosen": -35237611.41122913, "logits/rejected": -36001030.18357488, "logps/chosen": -505.28106031866463, "logps/rejected": -374.33031400966183, "loss": 0.5603, "loss/base_kto": 3.1586668491363525, "metrics/advantage_var": 419.7179870605469, "regularization/lipschitz_norm": 1341.960693359375, "regularization/mmd": 0.196184903383255, "regularization/rkhs_norm": 233.55345153808594, "regularization/w1": 1.1272468566894531, "rewards/chosen": 0.5335658164595979, "rewards/margins": 0.8919853361512495, "rewards/rejected": -0.3584195196916516, "step": 2200 }, { "epoch": 2.8756476683937824, "grad_norm": 19.267410278320312, "kl": 11.981795310974121, "learning_rate": 4.72018703521132e-09, "logits/chosen": -33486727.145135567, "logits/rejected": -34819092.38591118, "logps/chosen": -476.64005183413076, "logps/rejected": -368.72468415007654, "loss": 0.5524, "loss/base_kto": 3.148010730743408, "metrics/advantage_var": 409.183349609375, "regularization/lipschitz_norm": 1285.4906005859375, "regularization/mmd": 0.19134068489074707, "regularization/rkhs_norm": 227.78652954101562, "regularization/w1": 1.0798120498657227, "rewards/chosen": 0.5336724726967454, "rewards/margins": 0.8878623352152897, "rewards/rejected": -0.35418986251854423, "step": 2220 }, { "epoch": 2.901554404145078, "grad_norm": 17.440208435058594, "kl": 11.75373649597168, "learning_rate": 2.976119626744267e-09, "logits/chosen": -35822797.4522293, "logits/rejected": -36269143.95092025, "logps/chosen": -483.26731687898086, "logps/rejected": -396.0221673696319, "loss": 0.5646, "loss/base_kto": 3.2159557342529297, "metrics/advantage_var": 405.16900634765625, "regularization/lipschitz_norm": 1322.2730712890625, "regularization/mmd": 0.18996773660182953, "regularization/rkhs_norm": 226.1520538330078, "regularization/w1": 1.1107094287872314, "rewards/chosen": 0.47785094437325837, "rewards/margins": 0.8298864668341959, "rewards/rejected": -0.3520355224609375, "step": 2240 }, { "epoch": 2.927461139896373, "grad_norm": 19.567821502685547, "kl": 11.295672416687012, "learning_rate": 1.631599688052765e-09, "logits/chosen": -33572715.227202475, "logits/rejected": -36172177.18799368, "logps/chosen": -480.57959814528596, "logps/rejected": -388.7501974723539, "loss": 0.558, "loss/base_kto": 3.155613422393799, "metrics/advantage_var": 415.93408203125, "regularization/lipschitz_norm": 1326.3670654296875, "regularization/mmd": 0.19387857615947723, "regularization/rkhs_norm": 230.807861328125, "regularization/w1": 1.1141483783721924, "rewards/chosen": 0.48880226571556223, "rewards/margins": 0.8732924611360549, "rewards/rejected": -0.3844901954204927, "step": 2260 }, { "epoch": 2.9533678756476682, "grad_norm": 16.0477294921875, "kl": 11.07884693145752, "learning_rate": 6.877080515894085e-10, "logits/chosen": -33802797.969040245, "logits/rejected": -35872819.68454259, "logps/chosen": -480.07410990712077, "logps/rejected": -364.4790023659306, "loss": 0.5558, "loss/base_kto": 3.205296039581299, "metrics/advantage_var": 400.572509765625, "regularization/lipschitz_norm": 1255.5992431640625, "regularization/mmd": 0.18615250289440155, "regularization/rkhs_norm": 221.610107421875, "regularization/w1": 1.0547033548355103, "rewards/chosen": 0.49147085656322564, "rewards/margins": 0.8313376391517633, "rewards/rejected": -0.3398667825885376, "step": 2280 }, { "epoch": 2.9792746113989637, "grad_norm": 14.80739974975586, "kl": 13.7398042678833, "learning_rate": 1.4520349279739663e-10, "logits/chosen": -33166031.1197411, "logits/rejected": -34830008.07250755, "logps/chosen": -500.65544093851133, "logps/rejected": -377.02317787009065, "loss": 0.5535, "loss/base_kto": 3.211195468902588, "metrics/advantage_var": 388.3515319824219, "regularization/lipschitz_norm": 1225.2630615234375, "regularization/mmd": 0.1875758022069931, "regularization/rkhs_norm": 223.30455017089844, "regularization/w1": 1.0292209386825562, "rewards/chosen": 0.5005215641750101, "rewards/margins": 0.8226207715662016, "rewards/rejected": -0.32209920739119147, "step": 2300 }, { "epoch": 3.0, "step": 2316, "total_flos": 9.960196480656998e+17, "train_loss": 0.5863801720640615, "train_runtime": 11092.9859, "train_samples_per_second": 13.361, "train_steps_per_second": 0.209 } ], "logging_steps": 20, "max_steps": 2316, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": false, "should_training_stop": false }, "attributes": {} } }, "total_flos": 9.960196480656998e+17, "train_batch_size": 8, "trial_name": null, "trial_params": null }