{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 3.0, "eval_steps": 500, "global_step": 2316, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.025906735751295335, "grad_norm": 10.319388389587402, "kl": 16.727964401245117, "learning_rate": 1.8999999999999998e-07, "logits/chosen": -37122425.3480315, "logits/rejected": -37737895.88837209, "logps/chosen": -463.6321358267717, "logps/rejected": -374.01157945736435, "loss": 0.4688, "loss/base_kto": 3.7502057552337646, "metrics/advantage_var": 476.1357421875, "rewards/chosen": 0.39666541392408955, "rewards/margins": 0.25662812570188753, "rewards/rejected": 0.14003728822220204, "step": 20 }, { "epoch": 0.05181347150259067, "grad_norm": 10.064275741577148, "kl": 13.24753475189209, "learning_rate": 3.8999999999999997e-07, "logits/chosen": -37318842.18181818, "logits/rejected": -38839044.46275753, "logps/chosen": -480.88530431432974, "logps/rejected": -376.75906299524564, "loss": 0.4448, "loss/base_kto": 3.558764696121216, "metrics/advantage_var": 669.9764404296875, "rewards/chosen": 0.49594534710853233, "rewards/margins": 0.5053853006420133, "rewards/rejected": -0.009439953533480927, "step": 40 }, { "epoch": 0.07772020725388601, "grad_norm": 9.0316801071167, "kl": 12.896925926208496, "learning_rate": 5.9e-07, "logits/chosen": -37219113.674418606, "logits/rejected": -37509648.93228346, "logps/chosen": -470.2107073643411, "logps/rejected": -360.15996555118113, "loss": 0.426, "loss/base_kto": 3.4081313610076904, "metrics/advantage_var": 1473.3863525390625, "rewards/chosen": 0.5174255844234497, "rewards/margins": 0.6775934647445618, "rewards/rejected": -0.1601678803211122, "step": 60 }, { "epoch": 0.10362694300518134, "grad_norm": 9.75800609588623, "kl": 22.625085830688477, "learning_rate": 7.9e-07, "logits/chosen": -40073294.40735069, "logits/rejected": -40570089.543859646, "logps/chosen": -483.6102603369066, "logps/rejected": -376.1366128389155, "loss": 0.42, "loss/base_kto": 3.360121965408325, "metrics/advantage_var": 2046.6541748046875, "rewards/chosen": 0.9029619529455398, "rewards/margins": 0.7994733654489663, "rewards/rejected": 0.10348858749657347, "step": 80 }, { "epoch": 0.12953367875647667, "grad_norm": 10.479662895202637, "kl": 7.0752153396606445, "learning_rate": 9.9e-07, "logits/chosen": -39373104.80267558, "logits/rejected": -39785216.75073314, "logps/chosen": -505.0452550167224, "logps/rejected": -389.1406708211144, "loss": 0.4144, "loss/base_kto": 3.315232038497925, "metrics/advantage_var": 2967.476806640625, "rewards/chosen": 0.3449013496322377, "rewards/margins": 1.078456133786151, "rewards/rejected": -0.7335547841539132, "step": 100 }, { "epoch": 0.15544041450777202, "grad_norm": 7.468899726867676, "kl": 29.222803115844727, "learning_rate": 9.998186234298189e-07, "logits/chosen": -38817840.07511737, "logits/rejected": -39936057.510140404, "logps/chosen": -447.14568661971833, "logps/rejected": -359.3209584633385, "loss": 0.4112, "loss/base_kto": 3.2892253398895264, "metrics/advantage_var": 3382.028076171875, "rewards/chosen": 0.9050804938135759, "rewards/margins": 0.9898408294174298, "rewards/rejected": -0.08476033560385385, "step": 120 }, { "epoch": 0.18134715025906736, "grad_norm": 8.750174522399902, "kl": 12.275041580200195, "learning_rate": 9.992359552107714e-07, "logits/chosen": -42091332.37267081, "logits/rejected": -41663439.69811321, "logps/chosen": -491.394264363354, "logps/rejected": -385.76407724056605, "loss": 0.3905, "loss/base_kto": 3.1238603591918945, "metrics/advantage_var": 4545.78857421875, "rewards/chosen": 0.9180897777865392, "rewards/margins": 1.4688283223706096, "rewards/rejected": -0.5507385445840703, "step": 140 }, { "epoch": 0.20725388601036268, "grad_norm": 8.236615180969238, "kl": 16.803390502929688, "learning_rate": 9.982519612796161e-07, "logits/chosen": -40913541.08868501, "logits/rejected": -40773331.01597444, "logps/chosen": -465.6788035168196, "logps/rejected": -370.9947084664537, "loss": 0.3854, "loss/base_kto": 3.083263635635376, "metrics/advantage_var": 4547.63671875, "rewards/chosen": 0.8942556585376051, "rewards/margins": 1.597708844377761, "rewards/rejected": -0.7034531858401557, "step": 160 }, { "epoch": 0.23316062176165803, "grad_norm": 8.821699142456055, "kl": 21.234865188598633, "learning_rate": 9.968674326492213e-07, "logits/chosen": -41670907.288343556, "logits/rejected": -41453613.65605096, "logps/chosen": -453.00896280674846, "logps/rejected": -369.6968053343949, "loss": 0.3838, "loss/base_kto": 3.070784091949463, "metrics/advantage_var": 4485.45849609375, "rewards/chosen": 1.1577457357769363, "rewards/margins": 1.5722619660746324, "rewards/rejected": -0.4145162302976961, "step": 180 }, { "epoch": 0.25906735751295334, "grad_norm": 9.399519920349121, "kl": 16.941009521484375, "learning_rate": 9.950834823142198e-07, "logits/chosen": -43490414.276923075, "logits/rejected": -42209328.76190476, "logps/chosen": -481.90163461538464, "logps/rejected": -407.65835813492066, "loss": 0.3737, "loss/base_kto": 2.9893739223480225, "metrics/advantage_var": 5094.6171875, "rewards/chosen": 1.177627704326923, "rewards/margins": 1.7559307719732522, "rewards/rejected": -0.5783030676463293, "step": 200 }, { "epoch": 0.2849740932642487, "grad_norm": 8.513607025146484, "kl": 19.285432815551758, "learning_rate": 9.929015443562942e-07, "logits/chosen": -42722276.67189953, "logits/rejected": -41917699.58320373, "logps/chosen": -482.56323587127156, "logps/rejected": -386.4064930015552, "loss": 0.3646, "loss/base_kto": 2.9167091846466064, "metrics/advantage_var": 6109.7998046875, "rewards/chosen": 1.1926577102445546, "rewards/margins": 1.9864442174313255, "rewards/rejected": -0.793786507186771, "step": 220 }, { "epoch": 0.31088082901554404, "grad_norm": 11.65726375579834, "kl": 14.581194877624512, "learning_rate": 9.90323372791347e-07, "logits/chosen": -44301136.36245955, "logits/rejected": -43484528.145015106, "logps/chosen": -471.87591019417476, "logps/rejected": -390.4674046450151, "loss": 0.3696, "loss/base_kto": 2.956815719604492, "metrics/advantage_var": 6047.51123046875, "rewards/chosen": 0.8881642363218042, "rewards/margins": 1.9577712362982016, "rewards/rejected": -1.0696069999763973, "step": 240 }, { "epoch": 0.33678756476683935, "grad_norm": 9.075246810913086, "kl": 13.598471641540527, "learning_rate": 9.87351040159484e-07, "logits/chosen": -43582794.21498372, "logits/rejected": -43640010.95495495, "logps/chosen": -507.21686685667754, "logps/rejected": -383.68947072072075, "loss": 0.3573, "loss/base_kto": 2.8587589263916016, "metrics/advantage_var": 6647.6220703125, "rewards/chosen": 1.0324669257049064, "rewards/margins": 2.329373634659955, "rewards/rejected": -1.2969067089550488, "step": 260 }, { "epoch": 0.3626943005181347, "grad_norm": 7.176731586456299, "kl": 17.565298080444336, "learning_rate": 9.839869358589396e-07, "logits/chosen": -44210205.4912, "logits/rejected": -44493703.62137405, "logps/chosen": -507.2881, "logps/rejected": -404.58382633587786, "loss": 0.3346, "loss/base_kto": 2.6767992973327637, "metrics/advantage_var": 6408.30615234375, "rewards/chosen": 0.931298828125, "rewards/margins": 2.5220157070014313, "rewards/rejected": -1.5907168788764312, "step": 280 }, { "epoch": 0.38860103626943004, "grad_norm": 8.242661476135254, "kl": 9.632750511169434, "learning_rate": 9.80233764225289e-07, "logits/chosen": -43166918.4, "logits/rejected": -43010860.8, "logps/chosen": -483.6794921875, "logps/rejected": -361.163037109375, "loss": 0.3398, "loss/base_kto": 2.7182796001434326, "metrics/advantage_var": 7442.8330078125, "rewards/chosen": 1.415898895263672, "rewards/margins": 2.555503082275391, "rewards/rejected": -1.1396041870117188, "step": 300 }, { "epoch": 0.41450777202072536, "grad_norm": 6.161278247833252, "kl": 11.036481857299805, "learning_rate": 9.760945423574868e-07, "logits/chosen": -43577174.89908257, "logits/rejected": -45461203.01597444, "logps/chosen": -480.4206804281346, "logps/rejected": -401.44393969648564, "loss": 0.3462, "loss/base_kto": 2.7698185443878174, "metrics/advantage_var": 8291.142578125, "rewards/chosen": 0.9927509086212252, "rewards/margins": 2.7852506824206458, "rewards/rejected": -1.7924997737994208, "step": 320 }, { "epoch": 0.44041450777202074, "grad_norm": 9.249044418334961, "kl": 28.86688804626465, "learning_rate": 9.71572597692482e-07, "logits/chosen": -46465939.79785605, "logits/rejected": -45670164.82296651, "logps/chosen": -476.4023258039816, "logps/rejected": -384.04410885167465, "loss": 0.3626, "loss/base_kto": 2.9010062217712402, "metrics/advantage_var": 7303.671875, "rewards/chosen": 1.7468029916012635, "rewards/margins": 2.238367095842691, "rewards/rejected": -0.49156410424142744, "step": 340 }, { "epoch": 0.46632124352331605, "grad_norm": 9.388398170471191, "kl": 25.781204223632812, "learning_rate": 9.666715653303588e-07, "logits/chosen": -45289124.102564104, "logits/rejected": -45208925.65853658, "logps/chosen": -481.48011818910254, "logps/rejected": -395.6542492378049, "loss": 0.3361, "loss/base_kto": 2.6887481212615967, "metrics/advantage_var": 8222.0947265625, "rewards/chosen": 1.5168069692758412, "rewards/margins": 2.7474430077071483, "rewards/rejected": -1.230636038431307, "step": 360 }, { "epoch": 0.49222797927461137, "grad_norm": 9.163446426391602, "kl": 19.06619644165039, "learning_rate": 9.613953851121528e-07, "logits/chosen": -44553825.940902025, "logits/rejected": -44534547.692307696, "logps/chosen": -471.5203635303266, "logps/rejected": -364.72792386185245, "loss": 0.3452, "loss/base_kto": 2.7618725299835205, "metrics/advantage_var": 7323.47998046875, "rewards/chosen": 1.4123068137636081, "rewards/margins": 2.6482218735224876, "rewards/rejected": -1.2359150597588795, "step": 380 }, { "epoch": 0.5181347150259067, "grad_norm": 8.153302192687988, "kl": 22.222400665283203, "learning_rate": 9.557482984526924e-07, "logits/chosen": -44122445.98153846, "logits/rejected": -45661642.36190476, "logps/chosen": -492.3990865384615, "logps/rejected": -374.6800843253968, "loss": 0.3357, "loss/base_kto": 2.6852593421936035, "metrics/advantage_var": 8430.4921875, "rewards/chosen": 1.713446326622596, "rewards/margins": 2.7226771673964056, "rewards/rejected": -1.0092308407738095, "step": 400 }, { "epoch": 0.5440414507772021, "grad_norm": 7.898141860961914, "kl": 20.997982025146484, "learning_rate": 9.497348449310107e-07, "logits/chosen": -46517715.75308642, "logits/rejected": -45683141.67088608, "logps/chosen": -496.25810185185185, "logps/rejected": -403.4624456091772, "loss": 0.3356, "loss/base_kto": 2.6848278045654297, "metrics/advantage_var": 9729.1015625, "rewards/chosen": 1.6485524118682484, "rewards/margins": 3.0480907658968777, "rewards/rejected": -1.3995383540286293, "step": 420 }, { "epoch": 0.5699481865284974, "grad_norm": 8.437301635742188, "kl": 27.33742332458496, "learning_rate": 9.433598586410701e-07, "logits/chosen": -47016659.97452229, "logits/rejected": -46722393.521472394, "logps/chosen": -472.54428742038215, "logps/rejected": -388.16971817484665, "loss": 0.3348, "loss/base_kto": 2.678339719772339, "metrics/advantage_var": 10187.8037109375, "rewards/chosen": 1.7116751701209196, "rewards/margins": 2.885346120232356, "rewards/rejected": -1.173670950111436, "step": 440 }, { "epoch": 0.5958549222797928, "grad_norm": 10.420513153076172, "kl": 29.8809814453125, "learning_rate": 9.366284643057313e-07, "logits/chosen": -45925395.14018691, "logits/rejected": -45740982.169278994, "logps/chosen": -458.6536214953271, "logps/rejected": -377.3076998432602, "loss": 0.3142, "loss/base_kto": 2.513406276702881, "metrics/advantage_var": 9882.564453125, "rewards/chosen": 1.8956435729410046, "rewards/margins": 3.2017841497251442, "rewards/rejected": -1.3061405767841399, "step": 460 }, { "epoch": 0.6217616580310881, "grad_norm": 8.041691780090332, "kl": 29.984716415405273, "learning_rate": 9.295460731570917e-07, "logits/chosen": -46290135.748427674, "logits/rejected": -46272499.27950311, "logps/chosen": -453.2558962264151, "logps/rejected": -389.4093070652174, "loss": 0.3321, "loss/base_kto": 2.656989336013794, "metrics/advantage_var": 9887.2763671875, "rewards/chosen": 2.058879348466981, "rewards/margins": 2.9575133172230466, "rewards/rejected": -0.8986339687560656, "step": 480 }, { "epoch": 0.6476683937823834, "grad_norm": 8.568934440612793, "kl": 14.765207290649414, "learning_rate": 9.221183785865056e-07, "logits/chosen": -46030885.57798165, "logits/rejected": -44988641.73801917, "logps/chosen": -455.4039564220183, "logps/rejected": -384.76402755591056, "loss": 0.3225, "loss/base_kto": 2.579798936843872, "metrics/advantage_var": 9816.142578125, "rewards/chosen": 1.8881363708309442, "rewards/margins": 3.233141589044303, "rewards/rejected": -1.3450052182133587, "step": 500 }, { "epoch": 0.6735751295336787, "grad_norm": 6.7368597984313965, "kl": 30.476104736328125, "learning_rate": 9.143513515677817e-07, "logits/chosen": -45823653.71980676, "logits/rejected": -45456227.05918058, "logps/chosen": -443.19444444444446, "logps/rejected": -379.547467754173, "loss": 0.3302, "loss/base_kto": 2.6419026851654053, "metrics/advantage_var": 9941.6689453125, "rewards/chosen": 1.8815548416113124, "rewards/margins": 3.1469455184773025, "rewards/rejected": -1.2653906768659902, "step": 520 }, { "epoch": 0.6994818652849741, "grad_norm": 9.077353477478027, "kl": 32.544036865234375, "learning_rate": 9.062512358572373e-07, "logits/chosen": -46674559.04903418, "logits/rejected": -47708240.9752883, "logps/chosen": -480.0802841753343, "logps/rejected": -386.7947899505766, "loss": 0.316, "loss/base_kto": 2.5276782512664795, "metrics/advantage_var": 10337.0224609375, "rewards/chosen": 2.4605105259797546, "rewards/margins": 3.265589274403097, "rewards/rejected": -0.8050787484233423, "step": 540 }, { "epoch": 0.7253886010362695, "grad_norm": 6.8249897956848145, "kl": 51.18595504760742, "learning_rate": 8.978245429744691e-07, "logits/chosen": -46264067.2, "logits/rejected": -47504531.2, "logps/chosen": -462.7865234375, "logps/rejected": -388.075048828125, "loss": 0.3242, "loss/base_kto": 2.593670606613159, "metrics/advantage_var": 9831.8037109375, "rewards/chosen": 2.6040317535400392, "rewards/margins": 3.0919196128845217, "rewards/rejected": -0.4878878593444824, "step": 560 }, { "epoch": 0.7512953367875648, "grad_norm": 5.395700931549072, "kl": 16.848234176635742, "learning_rate": 8.890780469678738e-07, "logits/chosen": -46107721.37071651, "logits/rejected": -46889512.12539185, "logps/chosen": -458.63721767912773, "logps/rejected": -370.9887343260188, "loss": 0.3291, "loss/base_kto": 2.632402181625366, "metrics/advantage_var": 11003.7841796875, "rewards/chosen": 1.5970843068535825, "rewards/margins": 3.241402412138653, "rewards/rejected": -1.6443181052850706, "step": 580 }, { "epoch": 0.7772020725388601, "grad_norm": 7.256164073944092, "kl": 40.421199798583984, "learning_rate": 8.800187789691269e-07, "logits/chosen": -47410145.6474259, "logits/rejected": -48573313.40219092, "logps/chosen": -472.3001170046802, "logps/rejected": -365.27787558685446, "loss": 0.3276, "loss/base_kto": 2.620436668395996, "metrics/advantage_var": 12412.2998046875, "rewards/chosen": 2.108003089654836, "rewards/margins": 2.9913788514958473, "rewards/rejected": -0.8833757618410113, "step": 600 }, { "epoch": 0.8031088082901554, "grad_norm": 9.761085510253906, "kl": 29.126300811767578, "learning_rate": 8.706540215409981e-07, "logits/chosen": -47805701.14374034, "logits/rejected": -47122011.39968404, "logps/chosen": -470.47498068006183, "logps/rejected": -376.11349723538706, "loss": 0.3132, "loss/base_kto": 2.5052177906036377, "metrics/advantage_var": 11753.0498046875, "rewards/chosen": 2.456938235063273, "rewards/margins": 3.7659804440075364, "rewards/rejected": -1.3090422089442635, "step": 620 }, { "epoch": 0.8290155440414507, "grad_norm": 7.527853965759277, "kl": 18.0603084564209, "learning_rate": 8.609913028230462e-07, "logits/chosen": -46224885.10638298, "logits/rejected": -47408901.76205788, "logps/chosen": -451.393047112462, "logps/rejected": -392.36600683279744, "loss": 0.3303, "loss/base_kto": 2.6424295902252197, "metrics/advantage_var": 12895.171875, "rewards/chosen": 1.7432306631720176, "rewards/margins": 3.2953440888653454, "rewards/rejected": -1.552113425693328, "step": 640 }, { "epoch": 0.8549222797927462, "grad_norm": 7.182866096496582, "kl": 20.800764083862305, "learning_rate": 8.510383904798994e-07, "logits/chosen": -47058805.152542375, "logits/rejected": -47342600.1141046, "logps/chosen": -462.9138097072419, "logps/rejected": -400.24985142630743, "loss": 0.3148, "loss/base_kto": 2.5186355113983154, "metrics/advantage_var": 13971.6015625, "rewards/chosen": 2.1760500303953196, "rewards/margins": 3.83824800793593, "rewards/rejected": -1.6621979775406102, "step": 660 }, { "epoch": 0.8808290155440415, "grad_norm": 8.891425132751465, "kl": 17.636144638061523, "learning_rate": 8.408032854569865e-07, "logits/chosen": -44455313.82278481, "logits/rejected": -44785935.802469134, "logps/chosen": -461.2084157436709, "logps/rejected": -389.9142554012346, "loss": 0.3401, "loss/base_kto": 2.7205283641815186, "metrics/advantage_var": 13725.75, "rewards/chosen": 1.3341555052165743, "rewards/margins": 3.3661077862736732, "rewards/rejected": -2.031952281057099, "step": 680 }, { "epoch": 0.9067357512953368, "grad_norm": 7.126125812530518, "kl": 20.660459518432617, "learning_rate": 8.302942155487377e-07, "logits/chosen": -45936999.52351097, "logits/rejected": -46289495.7258567, "logps/chosen": -450.60624020376173, "logps/rejected": -373.2173870716511, "loss": 0.3209, "loss/base_kto": 2.567134141921997, "metrics/advantage_var": 12918.2548828125, "rewards/chosen": 1.6922259196218652, "rewards/margins": 3.6139123000735784, "rewards/rejected": -1.9216863804517135, "step": 700 }, { "epoch": 0.9326424870466321, "grad_norm": 6.310122013092041, "kl": 27.32685661315918, "learning_rate": 8.195196287844278e-07, "logits/chosen": -47984717.40472441, "logits/rejected": -47533724.37829457, "logps/chosen": -470.71077755905515, "logps/rejected": -380.2222625968992, "loss": 0.3195, "loss/base_kto": 2.5560810565948486, "metrics/advantage_var": 14027.7880859375, "rewards/chosen": 2.4276184562623033, "rewards/margins": 3.788381461955133, "rewards/rejected": -1.3607630056928295, "step": 720 }, { "epoch": 0.9585492227979274, "grad_norm": 10.711471557617188, "kl": 18.596837997436523, "learning_rate": 8.08488186636975e-07, "logits/chosen": -47200074.45101088, "logits/rejected": -48807614.492935635, "logps/chosen": -459.070567651633, "logps/rejected": -409.03264815541604, "loss": 0.3205, "loss/base_kto": 2.564175844192505, "metrics/advantage_var": 17230.35546875, "rewards/chosen": 1.8940837854174766, "rewards/margins": 4.052348233023443, "rewards/rejected": -2.1582644476059656, "step": 740 }, { "epoch": 0.9844559585492227, "grad_norm": 5.282236576080322, "kl": 16.107288360595703, "learning_rate": 7.972087570601576e-07, "logits/chosen": -45939061.867528275, "logits/rejected": -45671859.3161876, "logps/chosen": -464.7586833602585, "logps/rejected": -385.3533472012103, "loss": 0.324, "loss/base_kto": 2.5922391414642334, "metrics/advantage_var": 14907.953125, "rewards/chosen": 1.3830086210432653, "rewards/margins": 3.8709718603350582, "rewards/rejected": -2.4879632392917927, "step": 760 }, { "epoch": 1.0103626943005182, "grad_norm": 6.966801643371582, "kl": 33.476539611816406, "learning_rate": 7.856904073598458e-07, "logits/chosen": -47285591.44358578, "logits/rejected": -47422079.39144216, "logps/chosen": -481.49927550231837, "logps/rejected": -387.48085875594296, "loss": 0.2973, "loss/base_kto": 2.3787217140197754, "metrics/advantage_var": 14550.7412109375, "rewards/chosen": 2.6301737436002703, "rewards/margins": 4.041040555023111, "rewards/rejected": -1.4108668114228406, "step": 780 }, { "epoch": 1.0362694300518134, "grad_norm": 7.4706525802612305, "kl": 26.45621681213379, "learning_rate": 7.739423969049761e-07, "logits/chosen": -46360979.2, "logits/rejected": -46993430.4, "logps/chosen": -458.044189453125, "logps/rejected": -392.3923828125, "loss": 0.27, "loss/base_kto": 2.159776210784912, "metrics/advantage_var": 14934.84375, "rewards/chosen": 2.360272026062012, "rewards/margins": 4.595606422424316, "rewards/rejected": -2.2353343963623047, "step": 800 }, { "epoch": 1.0621761658031088, "grad_norm": 7.161087512969971, "kl": 20.279638290405273, "learning_rate": 7.619741696841322e-07, "logits/chosen": -46109183.23922734, "logits/rejected": -47211197.78583196, "logps/chosen": -464.3273588410104, "logps/rejected": -389.81806013179573, "loss": 0.2719, "loss/base_kto": 2.175161123275757, "metrics/advantage_var": 14320.359375, "rewards/chosen": 2.531824256477526, "rewards/margins": 4.456279826905862, "rewards/rejected": -1.9244555704283361, "step": 820 }, { "epoch": 1.0880829015544042, "grad_norm": 4.648787021636963, "kl": 22.47624397277832, "learning_rate": 7.497953467137135e-07, "logits/chosen": -48343649.215189874, "logits/rejected": -47700252.44444445, "logps/chosen": -455.1236155063291, "logps/rejected": -385.0729166666667, "loss": 0.255, "loss/base_kto": 2.0397450923919678, "metrics/advantage_var": 13408.5517578125, "rewards/chosen": 2.3995195219788372, "rewards/margins": 4.7239884407674175, "rewards/rejected": -2.3244689187885803, "step": 840 }, { "epoch": 1.1139896373056994, "grad_norm": 8.42148494720459, "kl": 18.592853546142578, "learning_rate": 7.37415718303793e-07, "logits/chosen": -47214087.78115501, "logits/rejected": -49079750.37942122, "logps/chosen": -466.7443009118541, "logps/rejected": -395.5042453778135, "loss": 0.2471, "loss/base_kto": 1.9770435094833374, "metrics/advantage_var": 15593.9033203125, "rewards/chosen": 2.7582436419547873, "rewards/margins": 5.262467431770904, "rewards/rejected": -2.5042237898161175, "step": 860 }, { "epoch": 1.1398963730569949, "grad_norm": 7.439265727996826, "kl": 11.96108341217041, "learning_rate": 7.248452361878855e-07, "logits/chosen": -46719675.470769234, "logits/rejected": -48405676.29206349, "logps/chosen": -473.23932692307693, "logps/rejected": -387.12862103174604, "loss": 0.2452, "loss/base_kto": 1.9619816541671753, "metrics/advantage_var": 16483.15625, "rewards/chosen": 2.296476487379808, "rewards/margins": 5.290778710222069, "rewards/rejected": -2.9943022228422618, "step": 880 }, { "epoch": 1.16580310880829, "grad_norm": 7.7969584465026855, "kl": 32.29633331298828, "learning_rate": 7.120940055229497e-07, "logits/chosen": -47421925.218461536, "logits/rejected": -48460608.203174606, "logps/chosen": -468.878125, "logps/rejected": -376.4671626984127, "loss": 0.2681, "loss/base_kto": 2.1451966762542725, "metrics/advantage_var": 14988.861328125, "rewards/chosen": 2.5041038161057694, "rewards/margins": 4.649634298806662, "rewards/rejected": -2.145530482700893, "step": 900 }, { "epoch": 1.1917098445595855, "grad_norm": 7.675873279571533, "kl": 29.6217098236084, "learning_rate": 6.991722767660556e-07, "logits/chosen": -47351358.43902439, "logits/rejected": -49409986.40601504, "logps/chosen": -454.938262195122, "logps/rejected": -417.4201127819549, "loss": 0.2552, "loss/base_kto": 2.0416419506073, "metrics/advantage_var": 15909.7724609375, "rewards/chosen": 2.3638814786585365, "rewards/margins": 5.011706607887859, "rewards/rejected": -2.6478251292293233, "step": 920 }, { "epoch": 1.2176165803108807, "grad_norm": 7.191428184509277, "kl": 25.549884796142578, "learning_rate": 6.860904374342499e-07, "logits/chosen": -48202389.08485857, "logits/rejected": -47982344.671575844, "logps/chosen": -471.9688019966722, "logps/rejected": -407.2490795287187, "loss": 0.2533, "loss/base_kto": 2.026344060897827, "metrics/advantage_var": 15896.3876953125, "rewards/chosen": 2.4040238924708817, "rewards/margins": 4.864776579096434, "rewards/rejected": -2.4607526866255522, "step": 940 }, { "epoch": 1.2435233160621761, "grad_norm": 8.419614791870117, "kl": 16.007797241210938, "learning_rate": 6.7285900375424e-07, "logits/chosen": -49458072.95597484, "logits/rejected": -50207880.745341614, "logps/chosen": -478.63674331761007, "logps/rejected": -393.54697204968943, "loss": 0.2544, "loss/base_kto": 2.0351531505584717, "metrics/advantage_var": 15565.5380859375, "rewards/chosen": 2.083188230886399, "rewards/margins": 4.963903168653285, "rewards/rejected": -2.8807149377668866, "step": 960 }, { "epoch": 1.2694300518134716, "grad_norm": 11.954970359802246, "kl": 22.1839542388916, "learning_rate": 6.594886122086123e-07, "logits/chosen": -48730670.54545455, "logits/rejected": -50354456.67469879, "logps/chosen": -483.3146814123377, "logps/rejected": -423.3035579819277, "loss": 0.2647, "loss/base_kto": 2.1177659034729004, "metrics/advantage_var": 13992.3408203125, "rewards/chosen": 2.2816132384461243, "rewards/margins": 4.731054068171275, "rewards/rejected": -2.4494408297251504, "step": 980 }, { "epoch": 1.2953367875647668, "grad_norm": 8.50296401977539, "kl": 22.303434371948242, "learning_rate": 6.459900109853766e-07, "logits/chosen": -48743870.03680982, "logits/rejected": -48878109.35031847, "logps/chosen": -458.819018404908, "logps/rejected": -404.78393710191085, "loss": 0.2466, "loss/base_kto": 1.9726238250732422, "metrics/advantage_var": 14543.2841796875, "rewards/chosen": 2.665093357577646, "rewards/margins": 5.108054060267236, "rewards/rejected": -2.44296070268959, "step": 1000 }, { "epoch": 1.3212435233160622, "grad_norm": 6.078616619110107, "kl": 23.710634231567383, "learning_rate": 6.323740513377171e-07, "logits/chosen": -48693167.32121212, "logits/rejected": -50649269.67741936, "logps/chosen": -471.01226325757574, "logps/rejected": -380.1893397177419, "loss": 0.2634, "loss/base_kto": 2.107532501220703, "metrics/advantage_var": 13206.234375, "rewards/chosen": 2.6341057054924244, "rewards/margins": 4.685351807117929, "rewards/rejected": -2.051246101625504, "step": 1020 }, { "epoch": 1.3471502590673574, "grad_norm": 8.119199752807617, "kl": 23.26380729675293, "learning_rate": 6.186516788608865e-07, "logits/chosen": -49470722.77829457, "logits/rejected": -50942855.055118114, "logps/chosen": -468.51017441860466, "logps/rejected": -386.84995078740155, "loss": 0.2521, "loss/base_kto": 2.016773223876953, "metrics/advantage_var": 13627.8154296875, "rewards/chosen": 2.7830914637839146, "rewards/margins": 4.81463481700734, "rewards/rejected": -2.0315433532234253, "step": 1040 }, { "epoch": 1.3730569948186528, "grad_norm": 8.171038627624512, "kl": 23.872556686401367, "learning_rate": 6.048339246932652e-07, "logits/chosen": -50876945.766561516, "logits/rejected": -51860790.6873065, "logps/chosen": -471.33147673501577, "logps/rejected": -376.60531153250776, "loss": 0.2431, "loss/base_kto": 1.9447319507598877, "metrics/advantage_var": 13762.4755859375, "rewards/chosen": 2.4297029031940065, "rewards/margins": 5.0148431668961155, "rewards/rejected": -2.585140263702109, "step": 1060 }, { "epoch": 1.3989637305699483, "grad_norm": 8.106106758117676, "kl": 16.061141967773438, "learning_rate": 5.909318966486494e-07, "logits/chosen": -49467057.63265306, "logits/rejected": -49775573.00155521, "logps/chosen": -453.4469191522763, "logps/rejected": -412.4076594090202, "loss": 0.262, "loss/base_kto": 2.0961430072784424, "metrics/advantage_var": 13220.462890625, "rewards/chosen": 2.22434262166405, "rewards/margins": 4.581668814801686, "rewards/rejected": -2.357326193137636, "step": 1080 }, { "epoch": 1.4248704663212435, "grad_norm": 8.971443176269531, "kl": 20.7944393157959, "learning_rate": 5.769567702869052e-07, "logits/chosen": -51214772.86535552, "logits/rejected": -50312550.978998385, "logps/chosen": -445.6907148260212, "logps/rejected": -378.6051342891761, "loss": 0.2542, "loss/base_kto": 2.0339062213897705, "metrics/advantage_var": 12345.4638671875, "rewards/chosen": 2.8841517646085477, "rewards/margins": 4.582793096393685, "rewards/rejected": -1.6986413317851372, "step": 1100 }, { "epoch": 1.450777202072539, "grad_norm": 8.93839168548584, "kl": 27.64991569519043, "learning_rate": 5.629197799301614e-07, "logits/chosen": -50742585.2044374, "logits/rejected": -51969685.103235744, "logps/chosen": -455.51550118858955, "logps/rejected": -418.8906009244992, "loss": 0.2555, "loss/base_kto": 2.043959379196167, "metrics/advantage_var": 14285.34375, "rewards/chosen": 2.7165968421899764, "rewards/margins": 4.896977265196525, "rewards/rejected": -2.1803804230065484, "step": 1120 }, { "epoch": 1.4766839378238341, "grad_norm": 7.332820892333984, "kl": 27.189178466796875, "learning_rate": 5.488322096317633e-07, "logits/chosen": -51423125.40063091, "logits/rejected": -50545923.9628483, "logps/chosen": -452.23718454258676, "logps/rejected": -400.2590944272446, "loss": 0.2566, "loss/base_kto": 2.0524163246154785, "metrics/advantage_var": 14592.6845703125, "rewards/chosen": 2.5982067216458007, "rewards/margins": 4.938431799649864, "rewards/rejected": -2.3402250780040634, "step": 1140 }, { "epoch": 1.5025906735751295, "grad_norm": 7.5371832847595215, "kl": 19.167118072509766, "learning_rate": 5.347053841052518e-07, "logits/chosen": -49825617.63467492, "logits/rejected": -51343172.643533126, "logps/chosen": -486.61992066563465, "logps/rejected": -386.4467665615142, "loss": 0.2356, "loss/base_kto": 1.8851795196533203, "metrics/advantage_var": 14707.625, "rewards/chosen": 2.4065221071981426, "rewards/margins": 5.221589434559144, "rewards/rejected": -2.8150673273610014, "step": 1160 }, { "epoch": 1.528497409326425, "grad_norm": 9.608060836791992, "kl": 22.010770797729492, "learning_rate": 5.205506596206531e-07, "logits/chosen": -51650882.49350649, "logits/rejected": -51695082.409638554, "logps/chosen": -469.02404626623377, "logps/rejected": -414.7276920180723, "loss": 0.2506, "loss/base_kto": 2.00508451461792, "metrics/advantage_var": 16096.7578125, "rewards/chosen": 2.6388319932021105, "rewards/margins": 5.131839974835676, "rewards/rejected": -2.4930079816335655, "step": 1180 }, { "epoch": 1.5544041450777202, "grad_norm": 7.547207355499268, "kl": 19.215185165405273, "learning_rate": 5.063794148754032e-07, "logits/chosen": -48986785.77198697, "logits/rejected": -50203435.81981982, "logps/chosen": -476.5796009771987, "logps/rejected": -382.5185341591592, "loss": 0.2648, "loss/base_kto": 2.118427276611328, "metrics/advantage_var": 15124.556640625, "rewards/chosen": 2.5517281895740025, "rewards/margins": 4.824689871959513, "rewards/rejected": -2.2729616823855103, "step": 1200 }, { "epoch": 1.5803108808290154, "grad_norm": 8.951262474060059, "kl": 19.080490112304688, "learning_rate": 4.922030418472422e-07, "logits/chosen": -52171221.40031397, "logits/rejected": -52181638.56920684, "logps/chosen": -454.0738324175824, "logps/rejected": -409.19012441679627, "loss": 0.2503, "loss/base_kto": 2.002168655395508, "metrics/advantage_var": 16247.0625, "rewards/chosen": 2.1811902871124413, "rewards/margins": 5.068549574024377, "rewards/rejected": -2.8873592869119364, "step": 1220 }, { "epoch": 1.6062176165803108, "grad_norm": 7.5546159744262695, "kl": 16.825531005859375, "learning_rate": 4.780329366364336e-07, "logits/chosen": -51035750.4, "logits/rejected": -50864886.065671645, "logps/chosen": -432.0246413934426, "logps/rejected": -381.96408582089555, "loss": 0.249, "loss/base_kto": 1.9919849634170532, "metrics/advantage_var": 15307.09375, "rewards/chosen": 2.4189148949795083, "rewards/margins": 5.1869454089137434, "rewards/rejected": -2.768030513934235, "step": 1240 }, { "epoch": 1.6321243523316062, "grad_norm": 9.785651206970215, "kl": 14.184760093688965, "learning_rate": 4.638804903046684e-07, "logits/chosen": -50667513.88656716, "logits/rejected": -51588018.78032787, "logps/chosen": -462.3922574626866, "logps/rejected": -409.36296106557376, "loss": 0.267, "loss/base_kto": 2.1362154483795166, "metrics/advantage_var": 15636.0283203125, "rewards/chosen": 2.073510013409515, "rewards/margins": 4.814888647502753, "rewards/rejected": -2.7413786340932376, "step": 1260 }, { "epoch": 1.6580310880829017, "grad_norm": 7.976250648498535, "kl": 29.88347816467285, "learning_rate": 4.497570797180217e-07, "logits/chosen": -50107616.859399684, "logits/rejected": -49035365.29211746, "logps/chosen": -424.58046998420224, "logps/rejected": -370.0915282071097, "loss": 0.2641, "loss/base_kto": 2.1128010749816895, "metrics/advantage_var": 13511.4091796875, "rewards/chosen": 2.773539900214751, "rewards/margins": 4.7543954263208175, "rewards/rejected": -1.9808555261060665, "step": 1280 }, { "epoch": 1.6839378238341969, "grad_norm": 7.568881988525391, "kl": 19.313095092773438, "learning_rate": 4.3567405840131853e-07, "logits/chosen": -49129610.9022082, "logits/rejected": -48939949.57275542, "logps/chosen": -440.9421332807571, "logps/rejected": -370.9177147832817, "loss": 0.2474, "loss/base_kto": 1.9794552326202393, "metrics/advantage_var": 14084.15625, "rewards/chosen": 2.604433655362776, "rewards/margins": 4.982342934822915, "rewards/rejected": -2.3779092794601393, "step": 1300 }, { "epoch": 1.709844559585492, "grad_norm": 6.2476887702941895, "kl": 13.618782043457031, "learning_rate": 4.2164274741126506e-07, "logits/chosen": -50499784.8488746, "logits/rejected": -51509512.559270516, "logps/chosen": -465.0994774919614, "logps/rejected": -411.11241451367783, "loss": 0.2641, "loss/base_kto": 2.1127593517303467, "metrics/advantage_var": 16641.234375, "rewards/chosen": 2.1833678610455185, "rewards/margins": 4.954416641678117, "rewards/rejected": -2.771048780632599, "step": 1320 }, { "epoch": 1.7357512953367875, "grad_norm": 8.074265480041504, "kl": 20.739089965820312, "learning_rate": 4.0767442623567856e-07, "logits/chosen": -51888706.983458646, "logits/rejected": -51872393.36585366, "logps/chosen": -473.73853383458646, "logps/rejected": -398.342987804878, "loss": 0.257, "loss/base_kto": 2.05631422996521, "metrics/advantage_var": 14822.2880859375, "rewards/chosen": 2.704866291705827, "rewards/margins": 4.915345680679405, "rewards/rejected": -2.210479388973577, "step": 1340 }, { "epoch": 1.761658031088083, "grad_norm": 9.068573951721191, "kl": 21.232534408569336, "learning_rate": 3.937803237261357e-07, "logits/chosen": -52277266.70319635, "logits/rejected": -51626911.02407704, "logps/chosen": -485.71004566210047, "logps/rejected": -399.7011687399679, "loss": 0.2501, "loss/base_kto": 2.0007503032684326, "metrics/advantage_var": 15226.5771484375, "rewards/chosen": 2.7049560546875, "rewards/margins": 5.207591441048857, "rewards/rejected": -2.5026353863613564, "step": 1360 }, { "epoch": 1.7875647668393784, "grad_norm": 9.576692581176758, "kl": 28.596731185913086, "learning_rate": 3.7997160907132456e-07, "logits/chosen": -50640729.6, "logits/rejected": -50948531.2, "logps/chosen": -447.75751953125, "logps/rejected": -390.83759765625, "loss": 0.2562, "loss/base_kto": 2.0498600006103516, "metrics/advantage_var": 14499.0576171875, "rewards/chosen": 2.763779067993164, "rewards/margins": 4.837852859497071, "rewards/rejected": -2.0740737915039062, "step": 1380 }, { "epoch": 1.8134715025906736, "grad_norm": 8.336225509643555, "kl": 21.048917770385742, "learning_rate": 3.662593828183601e-07, "logits/chosen": -51244268.057233706, "logits/rejected": -53232616.40552995, "logps/chosen": -446.7321641494436, "logps/rejected": -404.64564132104454, "loss": 0.2442, "loss/base_kto": 1.9533166885375977, "metrics/advantage_var": 15715.361328125, "rewards/chosen": 2.4377893590396464, "rewards/margins": 5.201704249592642, "rewards/rejected": -2.7639148905529956, "step": 1400 }, { "epoch": 1.8393782383419688, "grad_norm": 7.756782054901123, "kl": 23.05873680114746, "learning_rate": 3.5265466794927725e-07, "logits/chosen": -53175127.69278034, "logits/rejected": -52764330.12400636, "logps/chosen": -454.0267857142857, "logps/rejected": -410.45588235294116, "loss": 0.2512, "loss/base_kto": 2.009918451309204, "metrics/advantage_var": 14705.5224609375, "rewards/chosen": 2.501078194004416, "rewards/margins": 5.026136570395513, "rewards/rejected": -2.525058376391097, "step": 1420 }, { "epoch": 1.8652849740932642, "grad_norm": 10.919984817504883, "kl": 31.348316192626953, "learning_rate": 3.3916840101987887e-07, "logits/chosen": -52322684.1088, "logits/rejected": -51838244.3480916, "logps/chosen": -434.9367, "logps/rejected": -396.92793416030537, "loss": 0.2649, "loss/base_kto": 2.1192855834960938, "metrics/advantage_var": 15045.2470703125, "rewards/chosen": 2.8001419921875, "rewards/margins": 4.800822044966603, "rewards/rejected": -2.000680052779103, "step": 1440 }, { "epoch": 1.8911917098445596, "grad_norm": 9.527816772460938, "kl": 12.20826530456543, "learning_rate": 3.258114233680583e-07, "logits/chosen": -51634665.3164557, "logits/rejected": -52495334.71604938, "logps/chosen": -464.9095628955696, "logps/rejected": -403.5522762345679, "loss": 0.2516, "loss/base_kto": 2.012443780899048, "metrics/advantage_var": 15119.6943359375, "rewards/chosen": 2.351209616359276, "rewards/margins": 5.110908178039446, "rewards/rejected": -2.7596985616801697, "step": 1460 }, { "epoch": 1.917098445595855, "grad_norm": 9.87900447845459, "kl": 17.386611938476562, "learning_rate": 3.1259447239866796e-07, "logits/chosen": -53422185.43525741, "logits/rejected": -53120264.41314554, "logps/chosen": -482.53310257410294, "logps/rejected": -407.90179968701096, "loss": 0.2483, "loss/base_kto": 1.986655592918396, "metrics/advantage_var": 16186.7998046875, "rewards/chosen": 2.3212818258824104, "rewards/margins": 5.302370479112556, "rewards/rejected": -2.981088653230145, "step": 1480 }, { "epoch": 1.9430051813471503, "grad_norm": 6.876319408416748, "kl": 27.84088706970215, "learning_rate": 2.9952817295193435e-07, "logits/chosen": -52926714.064914994, "logits/rejected": -54163553.06161138, "logps/chosen": -463.3681897217929, "logps/rejected": -392.51132997630333, "loss": 0.2423, "loss/base_kto": 1.9387661218643188, "metrics/advantage_var": 15857.3505859375, "rewards/chosen": 2.6382854762364762, "rewards/margins": 5.196615029825536, "rewards/rejected": -2.55832955358906, "step": 1500 }, { "epoch": 1.9689119170984455, "grad_norm": 9.612847328186035, "kl": 19.885042190551758, "learning_rate": 2.866230287623651e-07, "logits/chosen": -50576158.91021672, "logits/rejected": -52167256.83280757, "logps/chosen": -458.50880417956654, "logps/rejected": -413.5228213722398, "loss": 0.2445, "loss/base_kto": 1.955782175064087, "metrics/advantage_var": 16214.2626953125, "rewards/chosen": 2.4565017747436144, "rewards/margins": 5.124602222052369, "rewards/rejected": -2.668100447308754, "step": 1520 }, { "epoch": 1.994818652849741, "grad_norm": 7.085169315338135, "kl": 19.323680877685547, "learning_rate": 2.738894140150075e-07, "logits/chosen": -51409870.65060241, "logits/rejected": -51447382.44155844, "logps/chosen": -442.01571912650604, "logps/rejected": -404.3957234172078, "loss": 0.2585, "loss/base_kto": 2.0679147243499756, "metrics/advantage_var": 14929.962890625, "rewards/chosen": 2.428604861339891, "rewards/margins": 4.838879812828832, "rewards/rejected": -2.4102749514889408, "step": 1540 }, { "epoch": 2.0207253886010363, "grad_norm": 5.093369007110596, "kl": 21.76449203491211, "learning_rate": 2.6133756500585156e-07, "logits/chosen": -51313167.176287055, "logits/rejected": -51953249.25588697, "logps/chosen": -461.6126657566303, "logps/rejected": -384.9188088697017, "loss": 0.2277, "loss/base_kto": 1.8218530416488647, "metrics/advantage_var": 15466.078125, "rewards/chosen": 3.0937618071129096, "rewards/margins": 5.48768481351499, "rewards/rejected": -2.3939230064020802, "step": 1560 }, { "epoch": 2.0466321243523318, "grad_norm": 6.250664234161377, "kl": 11.092265129089355, "learning_rate": 2.489775719130767e-07, "logits/chosen": -52543289.6, "logits/rejected": -52555180.8, "logps/chosen": -448.8865234375, "logps/rejected": -426.451171875, "loss": 0.2125, "loss/base_kto": 1.699960708618164, "metrics/advantage_var": 17586.404296875, "rewards/chosen": 2.5158063888549806, "rewards/margins": 5.949070167541504, "rewards/rejected": -3.4332637786865234, "step": 1580 }, { "epoch": 2.0725388601036268, "grad_norm": 7.516881942749023, "kl": 27.575057983398438, "learning_rate": 2.3681937068576303e-07, "logits/chosen": -52040782.51757188, "logits/rejected": -53780530.103975534, "logps/chosen": -457.1747703674121, "logps/rejected": -412.95508409785936, "loss": 0.2147, "loss/base_kto": 1.7175458669662476, "metrics/advantage_var": 15806.40625, "rewards/chosen": 2.945287149935104, "rewards/margins": 5.667440186536786, "rewards/rejected": -2.722153036601682, "step": 1600 }, { "epoch": 2.098445595854922, "grad_norm": 7.4503560066223145, "kl": 22.494722366333008, "learning_rate": 2.2487273505658e-07, "logits/chosen": -53130994.61172742, "logits/rejected": -53505965.95377504, "logps/chosen": -474.13960974643425, "logps/rejected": -411.5372688751926, "loss": 0.2132, "loss/base_kto": 1.7054146528244019, "metrics/advantage_var": 17508.853515625, "rewards/chosen": 2.9541907454065965, "rewards/margins": 5.814634848112682, "rewards/rejected": -2.860444102706086, "step": 1620 }, { "epoch": 2.1243523316062176, "grad_norm": 10.237329483032227, "kl": 13.12766170501709, "learning_rate": 2.131472686848817e-07, "logits/chosen": -53387424.87009063, "logits/rejected": -52597710.291262135, "logps/chosen": -483.8654645015106, "logps/rejected": -389.9562601132686, "loss": 0.2036, "loss/base_kto": 1.6287109851837158, "metrics/advantage_var": 14979.9921875, "rewards/chosen": 2.758353149782855, "rewards/margins": 5.7842583268282635, "rewards/rejected": -3.0259051770454084, "step": 1640 }, { "epoch": 2.150259067357513, "grad_norm": 7.691054344177246, "kl": 18.150373458862305, "learning_rate": 2.016523974365188e-07, "logits/chosen": -51640392.803709425, "logits/rejected": -53083939.99368089, "logps/chosen": -438.0470923493045, "logps/rejected": -424.92683649289097, "loss": 0.2083, "loss/base_kto": 1.6663763523101807, "metrics/advantage_var": 17248.298828125, "rewards/chosen": 2.568194098966383, "rewards/margins": 5.949468088771873, "rewards/rejected": -3.3812739898054898, "step": 1660 }, { "epoch": 2.1761658031088085, "grad_norm": 6.853572845458984, "kl": 15.213935852050781, "learning_rate": 1.9039736180657372e-07, "logits/chosen": -53337403.43550835, "logits/rejected": -54221581.60386474, "logps/chosen": -459.4839719271624, "logps/rejected": -401.6209490740741, "loss": 0.2244, "loss/base_kto": 1.794970154762268, "metrics/advantage_var": 14274.5849609375, "rewards/chosen": 2.6967603020675264, "rewards/margins": 5.361152647452993, "rewards/rejected": -2.664392345385467, "step": 1680 }, { "epoch": 2.2020725388601035, "grad_norm": 6.441402912139893, "kl": 16.609342575073242, "learning_rate": 1.7939120949111498e-07, "logits/chosen": -51576548.280254774, "logits/rejected": -52661995.582822084, "logps/chosen": -469.22103901273886, "logps/rejected": -389.69545628834356, "loss": 0.205, "loss/base_kto": 1.6403454542160034, "metrics/advantage_var": 16205.587890625, "rewards/chosen": 2.563711761668989, "rewards/margins": 5.923686628664771, "rewards/rejected": -3.359974866995782, "step": 1700 }, { "epoch": 2.227979274611399, "grad_norm": 8.55733871459961, "kl": 25.37789535522461, "learning_rate": 1.6864278811393523e-07, "logits/chosen": -52256164.345679015, "logits/rejected": -52587818.12658228, "logps/chosen": -493.7014371141975, "logps/rejected": -412.27558840981015, "loss": 0.2122, "loss/base_kto": 1.6972593069076538, "metrics/advantage_var": 16703.544921875, "rewards/chosen": 2.814942913290895, "rewards/margins": 5.731951325326101, "rewards/rejected": -2.9170084120352056, "step": 1720 }, { "epoch": 2.2538860103626943, "grad_norm": 8.511039733886719, "kl": 16.398456573486328, "learning_rate": 1.5816073811412584e-07, "logits/chosen": -51757954.96754251, "logits/rejected": -52324258.17377567, "logps/chosen": -449.0143933539413, "logps/rejected": -397.59809439178514, "loss": 0.2144, "loss/base_kto": 1.7153100967407227, "metrics/advantage_var": 15016.7314453125, "rewards/chosen": 2.92261194998551, "rewards/margins": 5.685572423116928, "rewards/rejected": -2.7629604731314177, "step": 1740 }, { "epoch": 2.2797927461139897, "grad_norm": 7.376357078552246, "kl": 16.149038314819336, "learning_rate": 1.4795348580020207e-07, "logits/chosen": -52741254.69413629, "logits/rejected": -54535728.12326656, "logps/chosen": -455.31596671949285, "logps/rejected": -397.3636122881356, "loss": 0.2114, "loss/base_kto": 1.6911267042160034, "metrics/advantage_var": 17047.3984375, "rewards/chosen": 2.559685998786648, "rewards/margins": 5.678751011667041, "rewards/rejected": -3.1190650128803927, "step": 1760 }, { "epoch": 2.305699481865285, "grad_norm": 7.0808024406433105, "kl": 19.327743530273438, "learning_rate": 1.3802923657636355e-07, "logits/chosen": -51179646.95595432, "logits/rejected": -52681646.63268366, "logps/chosen": -452.35924755301795, "logps/rejected": -393.6358695652174, "loss": 0.2079, "loss/base_kto": 1.6628249883651733, "metrics/advantage_var": 17884.87890625, "rewards/chosen": 2.5431923796263254, "rewards/margins": 5.888858169778125, "rewards/rejected": -3.345665790151799, "step": 1780 }, { "epoch": 2.33160621761658, "grad_norm": 7.206068515777588, "kl": 13.962677001953125, "learning_rate": 1.28395968346336e-07, "logits/chosen": -52635359.09717868, "logits/rejected": -52769335.82554517, "logps/chosen": -459.94303487460814, "logps/rejected": -409.59657320872276, "loss": 0.2112, "loss/base_kto": 1.6896650791168213, "metrics/advantage_var": 16756.390625, "rewards/chosen": 2.7216389336182405, "rewards/margins": 5.849456438120772, "rewards/rejected": -3.127817504502531, "step": 1800 }, { "epoch": 2.3575129533678756, "grad_norm": 7.377704620361328, "kl": 22.29719352722168, "learning_rate": 1.1906142510009415e-07, "logits/chosen": -54559073.429892145, "logits/rejected": -54657004.52614897, "logps/chosen": -472.5718412942989, "logps/rejected": -420.8526148969889, "loss": 0.2174, "loss/base_kto": 1.7388498783111572, "metrics/advantage_var": 15162.697265625, "rewards/chosen": 2.6641059487552967, "rewards/margins": 5.5746843182828325, "rewards/rejected": -2.910578369527536, "step": 1820 }, { "epoch": 2.383419689119171, "grad_norm": 6.108307361602783, "kl": 18.389760971069336, "learning_rate": 1.1003311068862547e-07, "logits/chosen": -51068998.73155416, "logits/rejected": -52572131.334370136, "logps/chosen": -464.33035714285717, "logps/rejected": -417.0138024883359, "loss": 0.2056, "loss/base_kto": 1.645011305809021, "metrics/advantage_var": 15969.048828125, "rewards/chosen": 2.8435683317798275, "rewards/margins": 5.9239052154671334, "rewards/rejected": -3.0803368836873055, "step": 1840 }, { "epoch": 2.4093264248704664, "grad_norm": 7.382128715515137, "kl": 11.044879913330078, "learning_rate": 1.0131828279173588e-07, "logits/chosen": -51034927.22330097, "logits/rejected": -51440080.04833837, "logps/chosen": -439.081715210356, "logps/rejected": -402.0004248489426, "loss": 0.2036, "loss/base_kto": 1.6291121244430542, "metrics/advantage_var": 15075.765625, "rewards/chosen": 2.762153502035295, "rewards/margins": 5.691052892495076, "rewards/rejected": -2.928899390459781, "step": 1860 }, { "epoch": 2.4352331606217614, "grad_norm": 7.5083699226379395, "kl": 9.02786922454834, "learning_rate": 9.292394708374596e-08, "logits/chosen": -51969928.23391813, "logits/rejected": -53152341.906040266, "logps/chosen": -435.16282894736844, "logps/rejected": -393.66335465604027, "loss": 0.2005, "loss/base_kto": 1.6041138172149658, "metrics/advantage_var": 16324.6689453125, "rewards/chosen": 2.6327168425621346, "rewards/margins": 5.971829809214819, "rewards/rejected": -3.3391129666526846, "step": 1880 }, { "epoch": 2.461139896373057, "grad_norm": 6.553695201873779, "kl": 22.991432189941406, "learning_rate": 8.48568516017727e-08, "logits/chosen": -52758514.76575121, "logits/rejected": -52305994.36006051, "logps/chosen": -456.5091377221325, "logps/rejected": -399.68253593040845, "loss": 0.2148, "loss/base_kto": 1.7184559106826782, "metrics/advantage_var": 15160.0341796875, "rewards/chosen": 2.5292734075247374, "rewards/margins": 5.505444026733323, "rewards/rejected": -2.9761706192085855, "step": 1900 }, { "epoch": 2.4870466321243523, "grad_norm": 7.786435127258301, "kl": 11.857638359069824, "learning_rate": 7.71234813211169e-08, "logits/chosen": -52542490.496194825, "logits/rejected": -53520084.85393258, "logps/chosen": -461.29119101978694, "logps/rejected": -406.9080557784912, "loss": 0.2095, "loss/base_kto": 1.675807237625122, "metrics/advantage_var": 16317.4560546875, "rewards/chosen": 2.6273080021641935, "rewards/margins": 5.775256437156168, "rewards/rejected": -3.1479484349919744, "step": 1920 }, { "epoch": 2.5129533678756477, "grad_norm": 8.449359893798828, "kl": 22.929365158081055, "learning_rate": 6.973005294212353e-08, "logits/chosen": -53763288.906403944, "logits/rejected": -54059221.65126677, "logps/chosen": -457.6953509852217, "logps/rejected": -407.5998975409836, "loss": 0.2096, "loss/base_kto": 1.6766414642333984, "metrics/advantage_var": 15792.712890625, "rewards/chosen": 2.634127812628284, "rewards/margins": 5.735816203323143, "rewards/rejected": -3.1016883906948585, "step": 1940 }, { "epoch": 2.538860103626943, "grad_norm": 8.70055866241455, "kl": 14.306711196899414, "learning_rate": 6.268250989270102e-08, "logits/chosen": -52797474.7654321, "logits/rejected": -53016200.101265825, "logps/chosen": -480.6525848765432, "logps/rejected": -392.47201344936707, "loss": 0.1963, "loss/base_kto": 1.5704221725463867, "metrics/advantage_var": 15938.1923828125, "rewards/chosen": 2.8278782220534335, "rewards/margins": 5.77576037939125, "rewards/rejected": -2.9478821573378164, "step": 1960 }, { "epoch": 2.5647668393782386, "grad_norm": 8.104622840881348, "kl": 15.392233848571777, "learning_rate": 5.598651755051975e-08, "logits/chosen": -51529518.4372093, "logits/rejected": -53984957.48031496, "logps/chosen": -461.63788759689925, "logps/rejected": -396.53041338582676, "loss": 0.1926, "loss/base_kto": 1.5410044193267822, "metrics/advantage_var": 16571.763671875, "rewards/chosen": 2.636381116763566, "rewards/margins": 6.110318432216322, "rewards/rejected": -3.4739373154527557, "step": 1980 }, { "epoch": 2.5906735751295336, "grad_norm": 6.42228364944458, "kl": 10.110087394714355, "learning_rate": 4.964745868872933e-08, "logits/chosen": -51332418.37037037, "logits/rejected": -52560494.17721519, "logps/chosen": -452.5120563271605, "logps/rejected": -386.1056170886076, "loss": 0.211, "loss/base_kto": 1.6881433725357056, "metrics/advantage_var": 16214.1220703125, "rewards/chosen": 2.722373679832176, "rewards/margins": 5.686483462763347, "rewards/rejected": -2.9641097829311707, "step": 2000 }, { "epoch": 2.616580310880829, "grad_norm": 6.703454971313477, "kl": 16.846250534057617, "learning_rate": 4.3670429148855493e-08, "logits/chosen": -52858190.76923077, "logits/rejected": -53259863.414634146, "logps/chosen": -457.1239983974359, "logps/rejected": -412.1909298780488, "loss": 0.2052, "loss/base_kto": 1.641872763633728, "metrics/advantage_var": 17799.373046875, "rewards/chosen": 2.7151457957732372, "rewards/margins": 6.064503959002087, "rewards/rejected": -3.349358163228849, "step": 2020 }, { "epoch": 2.6424870466321244, "grad_norm": 6.7395477294921875, "kl": 16.90166664123535, "learning_rate": 3.806023374435663e-08, "logits/chosen": -52330051.62264151, "logits/rejected": -53894061.31677019, "logps/chosen": -482.8420794025157, "logps/rejected": -388.3456424689441, "loss": 0.2216, "loss/base_kto": 1.7730960845947266, "metrics/advantage_var": 15315.8974609375, "rewards/chosen": 2.178255093172661, "rewards/margins": 5.402397416542227, "rewards/rejected": -3.2241423233695654, "step": 2040 }, { "epoch": 2.66839378238342, "grad_norm": 6.1936163902282715, "kl": 11.923944473266602, "learning_rate": 3.282138239813037e-08, "logits/chosen": -51702307.17557252, "logits/rejected": -51026467.2256, "logps/chosen": -469.8072041984733, "logps/rejected": -390.839975, "loss": 0.2053, "loss/base_kto": 1.6426628828048706, "metrics/advantage_var": 15595.1533203125, "rewards/chosen": 2.7488445252862594, "rewards/margins": 5.67882479872376, "rewards/rejected": -2.9299802734375, "step": 2060 }, { "epoch": 2.694300518134715, "grad_norm": 8.137475967407227, "kl": 18.132556915283203, "learning_rate": 2.795808651707793e-08, "logits/chosen": -52089820.04274809, "logits/rejected": -52295008.256, "logps/chosen": -460.9177480916031, "logps/rejected": -393.893775, "loss": 0.2014, "loss/base_kto": 1.6112679243087769, "metrics/advantage_var": 17538.55078125, "rewards/chosen": 2.5705998777433208, "rewards/margins": 6.143112377743321, "rewards/rejected": -3.5725125, "step": 2080 }, { "epoch": 2.7202072538860103, "grad_norm": 8.598886489868164, "kl": 16.467830657958984, "learning_rate": 2.3474255606639293e-08, "logits/chosen": -52820833.26443769, "logits/rejected": -53313503.073954985, "logps/chosen": -429.13169642857144, "logps/rejected": -384.4918609324759, "loss": 0.2201, "loss/base_kto": 1.7607765197753906, "metrics/advantage_var": 14958.587890625, "rewards/chosen": 2.4377450682109614, "rewards/margins": 5.479708406296271, "rewards/rejected": -3.0419633380853095, "step": 2100 }, { "epoch": 2.7461139896373057, "grad_norm": 7.395063400268555, "kl": 12.96544361114502, "learning_rate": 1.9373494128020195e-08, "logits/chosen": -53403948.905547224, "logits/rejected": -55372835.079934746, "logps/chosen": -457.15821776611693, "logps/rejected": -412.7927966965742, "loss": 0.2175, "loss/base_kto": 1.7399282455444336, "metrics/advantage_var": 15877.1318359375, "rewards/chosen": 2.6581939743019114, "rewards/margins": 5.8172340675293785, "rewards/rejected": -3.1590400932274676, "step": 2120 }, { "epoch": 2.772020725388601, "grad_norm": 5.516819477081299, "kl": 13.18786334991455, "learning_rate": 1.5659098600638798e-08, "logits/chosen": -53165266.95939849, "logits/rejected": -52912474.328455284, "logps/chosen": -427.49783834586464, "logps/rejected": -416.99463922764227, "loss": 0.2309, "loss/base_kto": 1.847333550453186, "metrics/advantage_var": 15203.5458984375, "rewards/chosen": 2.697485902255639, "rewards/margins": 5.31505747714131, "rewards/rejected": -2.617571574885671, "step": 2140 }, { "epoch": 2.7979274611398965, "grad_norm": 8.08092975616455, "kl": 24.771360397338867, "learning_rate": 1.2334054952120143e-08, "logits/chosen": -52021904.905660376, "logits/rejected": -52015479.254658386, "logps/chosen": -466.30984669811323, "logps/rejected": -414.8922748447205, "loss": 0.2214, "loss/base_kto": 1.7714513540267944, "metrics/advantage_var": 15380.9560546875, "rewards/chosen": 2.7778289602987423, "rewards/margins": 5.55659945446363, "rewards/rejected": -2.7787704941648874, "step": 2160 }, { "epoch": 2.823834196891192, "grad_norm": 6.716619968414307, "kl": 17.462905883789062, "learning_rate": 9.401036117969108e-09, "logits/chosen": -50473313.774960384, "logits/rejected": -50735018.798151, "logps/chosen": -463.6503565768621, "logps/rejected": -398.61529757318954, "loss": 0.1975, "loss/base_kto": 1.579751968383789, "metrics/advantage_var": 15571.666015625, "rewards/chosen": 2.759819985947405, "rewards/margins": 5.925720123779646, "rewards/rejected": -3.165900137832242, "step": 2180 }, { "epoch": 2.849740932642487, "grad_norm": 7.008581161499023, "kl": 23.658918380737305, "learning_rate": 6.8623998928517555e-09, "logits/chosen": -51330135.21766561, "logits/rejected": -53182067.71517028, "logps/chosen": -464.6318020504732, "logps/rejected": -398.1510739164087, "loss": 0.213, "loss/base_kto": 1.7040843963623047, "metrics/advantage_var": 13738.359375, "rewards/chosen": 2.749936076744874, "rewards/margins": 5.473095347134773, "rewards/rejected": -2.7231592703898992, "step": 2200 }, { "epoch": 2.8756476683937824, "grad_norm": 6.6605424880981445, "kl": 15.576194763183594, "learning_rate": 4.72018703521132e-09, "logits/chosen": -51471504.935384616, "logits/rejected": -52842918.603174604, "logps/chosen": -452.46923076923076, "logps/rejected": -405.70731646825396, "loss": 0.2131, "loss/base_kto": 1.7047852277755737, "metrics/advantage_var": 15001.361328125, "rewards/chosen": 2.5818241060697114, "rewards/margins": 5.591657935434791, "rewards/rejected": -3.0098338293650793, "step": 2220 }, { "epoch": 2.901554404145078, "grad_norm": 10.156596183776855, "kl": 21.255380630493164, "learning_rate": 2.976119626744267e-09, "logits/chosen": -50288277.02113821, "logits/rejected": -52447093.41353384, "logps/chosen": -464.1432926829268, "logps/rejected": -394.63082706766914, "loss": 0.1964, "loss/base_kto": 1.5715006589889526, "metrics/advantage_var": 15936.7177734375, "rewards/chosen": 2.7470715034298783, "rewards/margins": 5.898373709139465, "rewards/rejected": -3.1513022057095865, "step": 2240 }, { "epoch": 2.927461139896373, "grad_norm": 7.635325908660889, "kl": 15.98388957977295, "learning_rate": 1.631599688052765e-09, "logits/chosen": -52831451.777424484, "logits/rejected": -54620543.80337942, "logps/chosen": -443.12117448330685, "logps/rejected": -405.9448924731183, "loss": 0.2129, "loss/base_kto": 1.7034294605255127, "metrics/advantage_var": 15774.0283203125, "rewards/chosen": 2.692273356766693, "rewards/margins": 5.745154178639293, "rewards/rejected": -3.0528808218726, "step": 2260 }, { "epoch": 2.9533678756476682, "grad_norm": 9.039216995239258, "kl": 18.50642204284668, "learning_rate": 6.877080515894085e-10, "logits/chosen": -54375990.36450079, "logits/rejected": -54110608.7642527, "logps/chosen": -487.3832210776545, "logps/rejected": -377.65841679506934, "loss": 0.2132, "loss/base_kto": 1.7055686712265015, "metrics/advantage_var": 14751.453125, "rewards/chosen": 2.72312112315521, "rewards/margins": 5.618464733216362, "rewards/rejected": -2.895343610061152, "step": 2280 }, { "epoch": 2.9792746113989637, "grad_norm": 8.901484489440918, "kl": 22.53584098815918, "learning_rate": 1.4520349279739663e-10, "logits/chosen": -54056707.63981043, "logits/rejected": -53963812.401854716, "logps/chosen": -465.6426737756714, "logps/rejected": -418.4019513137558, "loss": 0.1967, "loss/base_kto": 1.573914885520935, "metrics/advantage_var": 15834.7001953125, "rewards/chosen": 2.8055148011700237, "rewards/margins": 5.915360535991797, "rewards/rejected": -3.1098457348217736, "step": 2300 }, { "epoch": 3.0, "step": 2316, "total_flos": 9.978126922009805e+17, "train_loss": 0.2728243423867102, "train_runtime": 11019.9549, "train_samples_per_second": 13.45, "train_steps_per_second": 0.21 } ], "logging_steps": 20, "max_steps": 2316, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": false, "should_training_stop": false }, "attributes": {} } }, "total_flos": 9.978126922009805e+17, "train_batch_size": 8, "trial_name": null, "trial_params": null }