Files
ronpo-qwen3-8b-fair-inpo-av…/trainer_state.json

3644 lines
135 KiB
JSON
Raw Permalink Normal View History

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.8599068434252956,
"eval_steps": 500,
"global_step": 900,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"drift/chosen_abs": 0.24268421530723572,
"drift/rejected_abs": 0.09689199179410934,
"epoch": 0.004777260241251642,
"grad_norm": 158.0,
"learning_rate": 1.111111111111111e-08,
"logits/chosen": -1.9987547397613525,
"logits/rejected": -2.0148520469665527,
"logps/chosen": -0.27876606583595276,
"logps/rejected": -0.2827395498752594,
"loss": 23.720317840576172,
"loss/core": 23.703845977783203,
"loss/preference_sft": 0.27876606583595276,
"loss/reference_anchor": 0.19172723591327667,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 2.4264075756073,
"rewards/margins": 1.473706603050232,
"rewards/rejected": 0.9527010917663574,
"step": 5
},
{
"drift/chosen_abs": 0.1691116988658905,
"drift/rejected_abs": 0.1621948778629303,
"epoch": 0.009554520482503284,
"grad_norm": 1336.0,
"learning_rate": 2.5e-08,
"logits/chosen": -2.345815658569336,
"logits/rejected": -2.392836093902588,
"logps/chosen": -0.28935980796813965,
"logps/rejected": -0.2881030738353729,
"loss": 25.067256927490234,
"loss/core": 25.026386260986328,
"loss/preference_sft": 0.28935980796813965,
"loss/reference_anchor": 0.5160242915153503,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 1.6900745630264282,
"rewards/margins": 0.07324112951755524,
"rewards/rejected": 1.6168334484100342,
"step": 10
},
{
"drift/chosen_abs": 0.21343913674354553,
"drift/rejected_abs": 0.11456535756587982,
"epoch": 0.014331780723754926,
"grad_norm": 118.0,
"learning_rate": 3.888888888888889e-08,
"logits/chosen": -2.2311110496520996,
"logits/rejected": -2.1946258544921875,
"logps/chosen": -0.277534544467926,
"logps/rejected": -0.28368276357650757,
"loss": 24.18115997314453,
"loss/core": 24.16556167602539,
"loss/preference_sft": 0.277534544467926,
"loss/reference_anchor": 0.1802430897951126,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 2.1329588890075684,
"rewards/margins": 0.9891046285629272,
"rewards/rejected": 1.1438543796539307,
"step": 15
},
{
"drift/chosen_abs": 0.19140727818012238,
"drift/rejected_abs": 0.08797380328178406,
"epoch": 0.01910904096500657,
"grad_norm": 104.5,
"learning_rate": 5.2777777777777776e-08,
"logits/chosen": -2.1776981353759766,
"logits/rejected": -2.2193965911865234,
"logps/chosen": -0.30152779817581177,
"logps/rejected": -0.2865992486476898,
"loss": 24.163585662841797,
"loss/core": 24.14507484436035,
"loss/preference_sft": 0.30152779817581177,
"loss/reference_anchor": 0.21664480865001678,
"rewards/accuracies": 0.875,
"rewards/chosen": 1.9140727519989014,
"rewards/margins": 1.0348074436187744,
"rewards/rejected": 0.8792654275894165,
"step": 20
},
{
"drift/chosen_abs": 0.3856329321861267,
"drift/rejected_abs": 0.16464610397815704,
"epoch": 0.02388630120625821,
"grad_norm": 86.5,
"learning_rate": 6.666666666666667e-08,
"logits/chosen": -2.0732712745666504,
"logits/rejected": -2.13415789604187,
"logps/chosen": -0.2700391411781311,
"logps/rejected": -0.2578909993171692,
"loss": 24.2296142578125,
"loss/core": 24.161888122558594,
"loss/preference_sft": 0.2700391411781311,
"loss/reference_anchor": 0.8760007619857788,
"rewards/accuracies": 0.8374999761581421,
"rewards/chosen": 3.8547744750976562,
"rewards/margins": 2.2091641426086426,
"rewards/rejected": 1.6456102132797241,
"step": 25
},
{
"drift/chosen_abs": 0.22750432789325714,
"drift/rejected_abs": 0.11023910343647003,
"epoch": 0.028663561447509853,
"grad_norm": 77.5,
"learning_rate": 8.055555555555555e-08,
"logits/chosen": -2.3493716716766357,
"logits/rejected": -2.3317930698394775,
"logps/chosen": -0.3004586100578308,
"logps/rejected": -0.3256753087043762,
"loss": 24.168228149414062,
"loss/core": 24.141149520874023,
"loss/preference_sft": 0.3004586100578308,
"loss/reference_anchor": 0.33102959394454956,
"rewards/accuracies": 0.8500000238418579,
"rewards/chosen": 2.2747082710266113,
"rewards/margins": 1.2620917558670044,
"rewards/rejected": 1.0126166343688965,
"step": 30
},
{
"drift/chosen_abs": 0.26583537459373474,
"drift/rejected_abs": 0.11596353352069855,
"epoch": 0.033440821688761495,
"grad_norm": 50.25,
"learning_rate": 9.444444444444444e-08,
"logits/chosen": -2.203460693359375,
"logits/rejected": -2.18483829498291,
"logps/chosen": -0.2677518129348755,
"logps/rejected": -0.26530081033706665,
"loss": 23.941822052001953,
"loss/core": 23.910053253173828,
"loss/preference_sft": 0.2677518129348755,
"loss/reference_anchor": 0.3968318998813629,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 2.6582398414611816,
"rewards/margins": 1.4989526271820068,
"rewards/rejected": 1.1592872142791748,
"step": 35
},
{
"drift/chosen_abs": 0.44815701246261597,
"drift/rejected_abs": 0.16203448176383972,
"epoch": 0.03821808193001314,
"grad_norm": 151.0,
"learning_rate": 1.0833333333333334e-07,
"logits/chosen": -2.002789258956909,
"logits/rejected": -2.062656879425049,
"logps/chosen": -0.2923213839530945,
"logps/rejected": -0.2835318148136139,
"loss": 23.72269058227539,
"loss/core": 23.646509170532227,
"loss/preference_sft": 0.2923213839530945,
"loss/reference_anchor": 0.9865428805351257,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 4.481132984161377,
"rewards/margins": 2.8950064182281494,
"rewards/rejected": 1.5861257314682007,
"step": 40
},
{
"drift/chosen_abs": 0.20982900261878967,
"drift/rejected_abs": 0.08536230772733688,
"epoch": 0.04299534217126478,
"grad_norm": 65.5,
"learning_rate": 1.2222222222222222e-07,
"logits/chosen": -2.199631452560425,
"logits/rejected": -2.363292694091797,
"logps/chosen": -0.2886757254600525,
"logps/rejected": -0.2883760929107666,
"loss": 23.874040603637695,
"loss/core": 23.861454010009766,
"loss/preference_sft": 0.2886757254600525,
"loss/reference_anchor": 0.13895340263843536,
"rewards/accuracies": 0.949999988079071,
"rewards/chosen": 2.0968005657196045,
"rewards/margins": 1.254421353340149,
"rewards/rejected": 0.8423792123794556,
"step": 45
},
{
"drift/chosen_abs": 0.2884393632411957,
"drift/rejected_abs": 0.1451389044523239,
"epoch": 0.04777260241251642,
"grad_norm": 402.0,
"learning_rate": 1.3611111111111108e-07,
"logits/chosen": -2.166757106781006,
"logits/rejected": -2.1628246307373047,
"logps/chosen": -0.28129029273986816,
"logps/rejected": -0.2850467562675476,
"loss": 24.05858612060547,
"loss/core": 24.029706954956055,
"loss/preference_sft": 0.28129029273986816,
"loss/reference_anchor": 0.3569650650024414,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 2.8835978507995605,
"rewards/margins": 1.4343656301498413,
"rewards/rejected": 1.4492321014404297,
"step": 50
},
{
"drift/chosen_abs": 0.22632427513599396,
"drift/rejected_abs": 0.20729069411754608,
"epoch": 0.05254986265376806,
"grad_norm": 32.25,
"learning_rate": 1.5e-07,
"logits/chosen": -2.1963820457458496,
"logits/rejected": -2.1848561763763428,
"logps/chosen": -0.28860360383987427,
"logps/rejected": -0.28664013743400574,
"loss": 25.665725708007812,
"loss/core": 25.60601806640625,
"loss/preference_sft": 0.28860360383987427,
"loss/reference_anchor": 0.7672308087348938,
"rewards/accuracies": 0.875,
"rewards/chosen": 2.262362003326416,
"rewards/margins": 0.20232732594013214,
"rewards/rejected": 2.0600345134735107,
"step": 55
},
{
"drift/chosen_abs": 0.21578149497509003,
"drift/rejected_abs": 0.1569838523864746,
"epoch": 0.057327122895019705,
"grad_norm": 1848.0,
"learning_rate": 1.6388888888888888e-07,
"logits/chosen": -2.0918967723846436,
"logits/rejected": -2.1219000816345215,
"logps/chosen": -0.27454960346221924,
"logps/rejected": -0.2835273742675781,
"loss": 24.56880760192871,
"loss/core": 24.553863525390625,
"loss/preference_sft": 0.27454960346221924,
"loss/reference_anchor": 0.1717853546142578,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 2.1553452014923096,
"rewards/margins": 0.5968301892280579,
"rewards/rejected": 1.5585150718688965,
"step": 60
},
{
"drift/chosen_abs": 0.29738813638687134,
"drift/rejected_abs": 0.11811880022287369,
"epoch": 0.06210438313627135,
"grad_norm": 66.0,
"learning_rate": 1.7777777777777776e-07,
"logits/chosen": -1.962087869644165,
"logits/rejected": -2.0643563270568848,
"logps/chosen": -0.30899226665496826,
"logps/rejected": -0.3064674437046051,
"loss": 23.558834075927734,
"loss/core": 23.519794464111328,
"loss/preference_sft": 0.30899226665496826,
"loss/reference_anchor": 0.48962312936782837,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 2.9719326496124268,
"rewards/margins": 1.8016983270645142,
"rewards/rejected": 1.170233964920044,
"step": 65
},
{
"drift/chosen_abs": 0.3609868586063385,
"drift/rejected_abs": 0.228200763463974,
"epoch": 0.06688164337752299,
"grad_norm": 229.0,
"learning_rate": 1.9166666666666668e-07,
"logits/chosen": -1.9723434448242188,
"logits/rejected": -1.9571367502212524,
"logps/chosen": -0.3828391134738922,
"logps/rejected": -0.297024130821228,
"loss": 24.988039016723633,
"loss/core": 24.914230346679688,
"loss/preference_sft": 0.3828391134738922,
"loss/reference_anchor": 0.9458276629447937,
"rewards/accuracies": 0.8500000238418579,
"rewards/chosen": 3.6087005138397217,
"rewards/margins": 1.4257218837738037,
"rewards/rejected": 2.182979106903076,
"step": 70
},
{
"drift/chosen_abs": 0.2607436776161194,
"drift/rejected_abs": 0.1599571406841278,
"epoch": 0.07165890361877464,
"grad_norm": 56.5,
"learning_rate": 2.0555555555555553e-07,
"logits/chosen": -2.0862269401550293,
"logits/rejected": -2.050337553024292,
"logps/chosen": -0.31514787673950195,
"logps/rejected": -0.28866785764694214,
"loss": 24.35919189453125,
"loss/core": 24.329198837280273,
"loss/preference_sft": 0.31514787673950195,
"loss/reference_anchor": 0.36842408776283264,
"rewards/accuracies": 0.8500000238418579,
"rewards/chosen": 2.6053974628448486,
"rewards/margins": 1.00749671459198,
"rewards/rejected": 1.5979008674621582,
"step": 75
},
{
"drift/chosen_abs": 0.3240804970264435,
"drift/rejected_abs": 0.12827441096305847,
"epoch": 0.07643616386002627,
"grad_norm": 55.5,
"learning_rate": 2.1944444444444442e-07,
"logits/chosen": -2.0698435306549072,
"logits/rejected": -2.1897106170654297,
"logps/chosen": -0.26063475012779236,
"logps/rejected": -0.2740657925605774,
"loss": 23.68960189819336,
"loss/core": 23.653255462646484,
"loss/preference_sft": 0.26063475012779236,
"loss/reference_anchor": 0.45853161811828613,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 3.2406482696533203,
"rewards/margins": 1.9891496896743774,
"rewards/rejected": 1.2514985799789429,
"step": 80
},
{
"drift/chosen_abs": 0.3498837351799011,
"drift/rejected_abs": 0.13262492418289185,
"epoch": 0.08121342410127792,
"grad_norm": 79.0,
"learning_rate": 2.3333333333333333e-07,
"logits/chosen": -2.189903497695923,
"logits/rejected": -2.2383172512054443,
"logps/chosen": -0.3075157105922699,
"logps/rejected": -0.2782510817050934,
"loss": 23.684247970581055,
"loss/core": 23.61785125732422,
"loss/preference_sft": 0.3075157105922699,
"loss/reference_anchor": 0.8545700311660767,
"rewards/accuracies": 0.875,
"rewards/chosen": 3.498150587081909,
"rewards/margins": 2.172797918319702,
"rewards/rejected": 1.3253527879714966,
"step": 85
},
{
"drift/chosen_abs": 0.17537356913089752,
"drift/rejected_abs": 0.08442483097314835,
"epoch": 0.08599068434252956,
"grad_norm": 31.875,
"learning_rate": 2.4722222222222224e-07,
"logits/chosen": -2.4203712940216064,
"logits/rejected": -2.4085536003112793,
"logps/chosen": -0.28136521577835083,
"logps/rejected": -0.296181857585907,
"loss": 24.193899154663086,
"loss/core": 24.180316925048828,
"loss/preference_sft": 0.28136521577835083,
"loss/reference_anchor": 0.15298345685005188,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 1.7537355422973633,
"rewards/margins": 0.9103192090988159,
"rewards/rejected": 0.8434165716171265,
"step": 90
},
{
"drift/chosen_abs": 0.3204111158847809,
"drift/rejected_abs": 0.21080467104911804,
"epoch": 0.09076794458378121,
"grad_norm": 118.0,
"learning_rate": 2.6111111111111113e-07,
"logits/chosen": -2.0531086921691895,
"logits/rejected": -2.108947992324829,
"logps/chosen": -0.267969012260437,
"logps/rejected": -0.27856558561325073,
"loss": 24.32411766052246,
"loss/core": 24.288156509399414,
"loss/preference_sft": 0.267969012260437,
"loss/reference_anchor": 0.4526856541633606,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 3.2040367126464844,
"rewards/margins": 1.0959895849227905,
"rewards/rejected": 2.1080470085144043,
"step": 95
},
{
"drift/chosen_abs": 0.2465881109237671,
"drift/rejected_abs": 0.1286160796880722,
"epoch": 0.09554520482503284,
"grad_norm": 73.5,
"learning_rate": 2.75e-07,
"logits/chosen": -2.2330098152160645,
"logits/rejected": -2.2795863151550293,
"logps/chosen": -0.2569820284843445,
"logps/rejected": -0.2466917484998703,
"loss": 23.988306045532227,
"loss/core": 23.972742080688477,
"loss/preference_sft": 0.2569820284843445,
"loss/reference_anchor": 0.18182215094566345,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 2.4647648334503174,
"rewards/margins": 1.1787031888961792,
"rewards/rejected": 1.2860618829727173,
"step": 100
},
{
"drift/chosen_abs": 0.2001236379146576,
"drift/rejected_abs": 0.079637810587883,
"epoch": 0.10032246506628449,
"grad_norm": 50.25,
"learning_rate": 2.8888888888888885e-07,
"logits/chosen": -2.3382439613342285,
"logits/rejected": -2.424198865890503,
"logps/chosen": -0.2838006615638733,
"logps/rejected": -0.28019005060195923,
"loss": 24.08165168762207,
"loss/core": 24.064653396606445,
"loss/preference_sft": 0.2838006615638733,
"loss/reference_anchor": 0.1982627958059311,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 2.0012366771698,
"rewards/margins": 1.207162618637085,
"rewards/rejected": 0.7940739393234253,
"step": 105
},
{
"drift/chosen_abs": 0.4472831189632416,
"drift/rejected_abs": 0.18904665112495422,
"epoch": 0.10509972530753613,
"grad_norm": 71.0,
"learning_rate": 3.0277777777777773e-07,
"logits/chosen": -1.9077485799789429,
"logits/rejected": -1.8608009815216064,
"logps/chosen": -0.3383413255214691,
"logps/rejected": -0.2978266477584839,
"loss": 23.436580657958984,
"loss/core": 23.36850357055664,
"loss/preference_sft": 0.3383413255214691,
"loss/reference_anchor": 0.8738870620727539,
"rewards/accuracies": 0.875,
"rewards/chosen": 4.471864223480225,
"rewards/margins": 2.584223508834839,
"rewards/rejected": 1.8876409530639648,
"step": 110
},
{
"drift/chosen_abs": 0.17792600393295288,
"drift/rejected_abs": 0.14627966284751892,
"epoch": 0.10987698554878778,
"grad_norm": 334.0,
"learning_rate": 3.166666666666666e-07,
"logits/chosen": -2.088899850845337,
"logits/rejected": -2.032494068145752,
"logps/chosen": -0.30003082752227783,
"logps/rejected": -0.2972942888736725,
"loss": 24.94771957397461,
"loss/core": 24.928913116455078,
"loss/preference_sft": 0.30003082752227783,
"loss/reference_anchor": 0.22078463435173035,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 1.7790625095367432,
"rewards/margins": 0.31695252656936646,
"rewards/rejected": 1.4621098041534424,
"step": 115
},
{
"drift/chosen_abs": 0.18117384612560272,
"drift/rejected_abs": 0.11267610639333725,
"epoch": 0.11465424579003941,
"grad_norm": 768.0,
"learning_rate": 3.3055555555555556e-07,
"logits/chosen": -2.0376081466674805,
"logits/rejected": -2.0747933387756348,
"logps/chosen": -0.3019946813583374,
"logps/rejected": -0.29592204093933105,
"loss": 24.376644134521484,
"loss/core": 24.367816925048828,
"loss/preference_sft": 0.3019946813583374,
"loss/reference_anchor": 0.08752311021089554,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 1.8115949630737305,
"rewards/margins": 0.6873809099197388,
"rewards/rejected": 1.1242139339447021,
"step": 120
},
{
"drift/chosen_abs": 0.20648498833179474,
"drift/rejected_abs": 0.10197492688894272,
"epoch": 0.11943150603129106,
"grad_norm": 50.75,
"learning_rate": 3.4444444444444444e-07,
"logits/chosen": -2.1082651615142822,
"logits/rejected": -2.139118194580078,
"logps/chosen": -0.29931074380874634,
"logps/rejected": -0.30651599168777466,
"loss": 24.086589813232422,
"loss/core": 24.07431983947754,
"loss/preference_sft": 0.29931074380874634,
"loss/reference_anchor": 0.13366781175136566,
"rewards/accuracies": 0.875,
"rewards/chosen": 2.0623745918273926,
"rewards/margins": 1.0441718101501465,
"rewards/rejected": 1.018202543258667,
"step": 125
},
{
"drift/chosen_abs": 0.18083539605140686,
"drift/rejected_abs": 0.08944060653448105,
"epoch": 0.1242087662725427,
"grad_norm": 100.5,
"learning_rate": 3.583333333333333e-07,
"logits/chosen": -2.0009732246398926,
"logits/rejected": -2.0936858654022217,
"logps/chosen": -0.27988457679748535,
"logps/rejected": -0.278131902217865,
"loss": 24.129959106445312,
"loss/core": 24.122276306152344,
"loss/preference_sft": 0.27988457679748535,
"loss/reference_anchor": 0.07443337142467499,
"rewards/accuracies": 0.9375,
"rewards/chosen": 1.8083540201187134,
"rewards/margins": 0.9148699641227722,
"rewards/rejected": 0.8934842348098755,
"step": 130
},
{
"drift/chosen_abs": 0.33803224563598633,
"drift/rejected_abs": 0.13368059694766998,
"epoch": 0.12898602651379434,
"grad_norm": 134.0,
"learning_rate": 3.722222222222222e-07,
"logits/chosen": -2.0908658504486084,
"logits/rejected": -2.1650338172912598,
"logps/chosen": -0.3015690743923187,
"logps/rejected": -0.2998407483100891,
"loss": 23.31682777404785,
"loss/core": 23.28109359741211,
"loss/preference_sft": 0.3015690743923187,
"loss/reference_anchor": 0.446286141872406,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 3.3794403076171875,
"rewards/margins": 2.081610918045044,
"rewards/rejected": 1.2978298664093018,
"step": 135
},
{
"drift/chosen_abs": 0.16290757060050964,
"drift/rejected_abs": 0.07148541510105133,
"epoch": 0.13376328675504598,
"grad_norm": 60.25,
"learning_rate": 3.861111111111111e-07,
"logits/chosen": -2.4541397094726562,
"logits/rejected": -2.5143344402313232,
"logps/chosen": -0.28250986337661743,
"logps/rejected": -0.2895656228065491,
"loss": 24.135583877563477,
"loss/core": 24.1291446685791,
"loss/preference_sft": 0.28250986337661743,
"loss/reference_anchor": 0.05761883780360222,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 1.6281633377075195,
"rewards/margins": 0.9143427610397339,
"rewards/rejected": 0.7138205170631409,
"step": 140
},
{
"drift/chosen_abs": 0.3603426516056061,
"drift/rejected_abs": 0.17863936722278595,
"epoch": 0.13854054699629761,
"grad_norm": 96.0,
"learning_rate": 4e-07,
"logits/chosen": -1.77964186668396,
"logits/rejected": -1.8101189136505127,
"logps/chosen": -0.30144834518432617,
"logps/rejected": -0.30214372277259827,
"loss": 23.7529239654541,
"loss/core": 23.6727352142334,
"loss/preference_sft": 0.30144834518432617,
"loss/reference_anchor": 1.0389857292175293,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 3.6030845642089844,
"rewards/margins": 1.8218176364898682,
"rewards/rejected": 1.7812671661376953,
"step": 145
},
{
"drift/chosen_abs": 0.36440587043762207,
"drift/rejected_abs": 0.1463252753019333,
"epoch": 0.14331780723754928,
"grad_norm": 98.5,
"learning_rate": 4.1388888888888887e-07,
"logits/chosen": -2.2338650226593018,
"logits/rejected": -2.282841444015503,
"logps/chosen": -0.31720206141471863,
"logps/rejected": -0.3081175684928894,
"loss": 23.425756454467773,
"loss/core": 23.36142349243164,
"loss/preference_sft": 0.31720206141471863,
"loss/reference_anchor": 0.8260464668273926,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 3.640651226043701,
"rewards/margins": 2.182239055633545,
"rewards/rejected": 1.4584124088287354,
"step": 150
},
{
"drift/chosen_abs": 0.28685861825942993,
"drift/rejected_abs": 0.07811577618122101,
"epoch": 0.1480950674788009,
"grad_norm": 77.5,
"learning_rate": 4.2777777777777775e-07,
"logits/chosen": -2.0995328426361084,
"logits/rejected": -2.177826166152954,
"logps/chosen": -0.2826915383338928,
"logps/rejected": -0.29879477620124817,
"loss": 23.43790054321289,
"loss/core": 23.408916473388672,
"loss/preference_sft": 0.2826915383338928,
"loss/reference_anchor": 0.3581943213939667,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 2.8685860633850098,
"rewards/margins": 2.106802225112915,
"rewards/rejected": 0.7617841958999634,
"step": 155
},
{
"drift/chosen_abs": 0.31482672691345215,
"drift/rejected_abs": 0.1407286822795868,
"epoch": 0.15287232772005255,
"grad_norm": 200.0,
"learning_rate": 4.4166666666666664e-07,
"logits/chosen": -2.05705189704895,
"logits/rejected": -2.0315186977386475,
"logps/chosen": -0.31071725487709045,
"logps/rejected": -0.31473129987716675,
"loss": 24.094379425048828,
"loss/core": 24.039676666259766,
"loss/preference_sft": 0.31071725487709045,
"loss/reference_anchor": 0.698303759098053,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 3.1482670307159424,
"rewards/margins": 1.7411534786224365,
"rewards/rejected": 1.4071136713027954,
"step": 160
},
{
"drift/chosen_abs": 0.1602366864681244,
"drift/rejected_abs": 0.07925491034984589,
"epoch": 0.15764958796130418,
"grad_norm": 80.5,
"learning_rate": 4.555555555555555e-07,
"logits/chosen": -2.223989725112915,
"logits/rejected": -2.1556718349456787,
"logps/chosen": -0.3111506998538971,
"logps/rejected": -0.30567336082458496,
"loss": 24.250789642333984,
"loss/core": 24.241710662841797,
"loss/preference_sft": 0.3111506998538971,
"loss/reference_anchor": 0.08993285894393921,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 1.601798415184021,
"rewards/margins": 0.8125208020210266,
"rewards/rejected": 0.7892775535583496,
"step": 165
},
{
"drift/chosen_abs": 0.2597414255142212,
"drift/rejected_abs": 0.2784227728843689,
"epoch": 0.16242684820255585,
"grad_norm": 81.5,
"learning_rate": 4.694444444444444e-07,
"logits/chosen": -2.187836170196533,
"logits/rejected": -2.132575511932373,
"logps/chosen": -0.27488964796066284,
"logps/rejected": -0.2585277855396271,
"loss": 26.337051391601562,
"loss/core": 26.263935089111328,
"loss/preference_sft": 0.27488964796066284,
"loss/reference_anchor": 0.9473751783370972,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 2.59535551071167,
"rewards/margins": -0.186926007270813,
"rewards/rejected": 2.7822816371917725,
"step": 170
},
{
"drift/chosen_abs": 0.2583083212375641,
"drift/rejected_abs": 0.12779515981674194,
"epoch": 0.16720410844380748,
"grad_norm": 372.0,
"learning_rate": 4.833333333333333e-07,
"logits/chosen": -2.1770424842834473,
"logits/rejected": -2.216740608215332,
"logps/chosen": -0.2869277000427246,
"logps/rejected": -0.30118730664253235,
"loss": 23.88767433166504,
"loss/core": 23.843341827392578,
"loss/preference_sft": 0.2869277000427246,
"loss/reference_anchor": 0.5624145865440369,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": 2.583082914352417,
"rewards/margins": 1.3182199001312256,
"rewards/rejected": 1.2648632526397705,
"step": 175
},
{
"drift/chosen_abs": 0.3239268660545349,
"drift/rejected_abs": 0.1492597758769989,
"epoch": 0.17198136868505912,
"grad_norm": 280.0,
"learning_rate": 4.972222222222222e-07,
"logits/chosen": -2.201796054840088,
"logits/rejected": -2.111999988555908,
"logps/chosen": -0.27172645926475525,
"logps/rejected": -0.2618543803691864,
"loss": 23.988094329833984,
"loss/core": 23.94233512878418,
"loss/preference_sft": 0.27172645926475525,
"loss/reference_anchor": 0.5829019546508789,
"rewards/accuracies": 0.8500000238418579,
"rewards/chosen": 3.2370712757110596,
"rewards/margins": 1.7461532354354858,
"rewards/rejected": 1.4909178018569946,
"step": 180
},
{
"drift/chosen_abs": 0.10453528165817261,
"drift/rejected_abs": 0.06307251751422882,
"epoch": 0.17675862892631075,
"grad_norm": 62.0,
"learning_rate": 4.999619237890978e-07,
"logits/chosen": -2.206681966781616,
"logits/rejected": -2.1635756492614746,
"logps/chosen": -0.2884823679924011,
"logps/rejected": -0.29190367460250854,
"loss": 24.60689926147461,
"loss/core": 24.602405548095703,
"loss/preference_sft": 0.2884823679924011,
"loss/reference_anchor": 0.031054329127073288,
"rewards/accuracies": 0.875,
"rewards/chosen": 1.0448436737060547,
"rewards/margins": 0.41608095169067383,
"rewards/rejected": 0.6287627816200256,
"step": 185
},
{
"drift/chosen_abs": 0.28438663482666016,
"drift/rejected_abs": 0.12391813099384308,
"epoch": 0.18153588916756241,
"grad_norm": 125.0,
"learning_rate": 4.998072590601808e-07,
"logits/chosen": -2.2966725826263428,
"logits/rejected": -2.2743964195251465,
"logps/chosen": -0.28313106298446655,
"logps/rejected": -0.28445905447006226,
"loss": 23.94525718688965,
"loss/core": 23.900707244873047,
"loss/preference_sft": 0.28313106298446655,
"loss/reference_anchor": 0.5657359957695007,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 2.842867374420166,
"rewards/margins": 1.6057891845703125,
"rewards/rejected": 1.2370779514312744,
"step": 190
},
{
"drift/chosen_abs": 0.26715975999832153,
"drift/rejected_abs": 0.09772941470146179,
"epoch": 0.18631314940881405,
"grad_norm": 67.5,
"learning_rate": 4.995336996054667e-07,
"logits/chosen": -1.9860740900039673,
"logits/rejected": -2.006164073944092,
"logps/chosen": -0.29072457551956177,
"logps/rejected": -0.28935790061950684,
"loss": 24.14964485168457,
"loss/core": 24.105886459350586,
"loss/preference_sft": 0.29072457551956177,
"loss/reference_anchor": 0.5543695092201233,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 2.6712136268615723,
"rewards/margins": 1.701263427734375,
"rewards/rejected": 0.9699504971504211,
"step": 195
},
{
"drift/chosen_abs": 0.26089510321617126,
"drift/rejected_abs": 0.12243443727493286,
"epoch": 0.19109040965006568,
"grad_norm": 75.0,
"learning_rate": 4.991413756244404e-07,
"logits/chosen": -1.8967984914779663,
"logits/rejected": -1.9376294612884521,
"logps/chosen": -0.3242345452308655,
"logps/rejected": -0.3163239061832428,
"loss": 23.804271697998047,
"loss/core": 23.7833309173584,
"loss/preference_sft": 0.3242345452308655,
"loss/reference_anchor": 0.2467818558216095,
"rewards/accuracies": 0.8500000238418579,
"rewards/chosen": 2.6078362464904785,
"rewards/margins": 1.3843178749084473,
"rewards/rejected": 1.2235184907913208,
"step": 200
},
{
"drift/chosen_abs": 0.328901469707489,
"drift/rejected_abs": 0.2119167149066925,
"epoch": 0.19586766989131732,
"grad_norm": 50.75,
"learning_rate": 4.986304738420683e-07,
"logits/chosen": -2.1179518699645996,
"logits/rejected": -2.169663667678833,
"logps/chosen": -0.25019803643226624,
"logps/rejected": -0.2696530222892761,
"loss": 24.55345344543457,
"loss/core": 24.50376319885254,
"loss/preference_sft": 0.25019803643226624,
"loss/reference_anchor": 0.6374753713607788,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": 3.288543224334717,
"rewards/margins": 1.1873959302902222,
"rewards/rejected": 2.101147413253784,
"step": 205
},
{
"drift/chosen_abs": 0.2828282415866852,
"drift/rejected_abs": 0.1485763043165207,
"epoch": 0.20064493013256898,
"grad_norm": 121.0,
"learning_rate": 4.980012374199287e-07,
"logits/chosen": -2.1135048866271973,
"logits/rejected": -2.1378347873687744,
"logps/chosen": -0.3129284381866455,
"logps/rejected": -0.32191547751426697,
"loss": 23.932619094848633,
"loss/core": 23.88772964477539,
"loss/preference_sft": 0.3129284381866455,
"loss/reference_anchor": 0.5672147870063782,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 2.8268136978149414,
"rewards/margins": 1.3436048030853271,
"rewards/rejected": 1.4832088947296143,
"step": 210
},
{
"drift/chosen_abs": 0.3194449245929718,
"drift/rejected_abs": 0.1719251424074173,
"epoch": 0.20542219037382062,
"grad_norm": 133.0,
"learning_rate": 4.972539658404792e-07,
"logits/chosen": -2.0891597270965576,
"logits/rejected": -2.0813040733337402,
"logps/chosen": -0.2754015326499939,
"logps/rejected": -0.2838408946990967,
"loss": 24.59800910949707,
"loss/core": 24.53702735900879,
"loss/preference_sft": 0.2754015326499939,
"loss/reference_anchor": 0.7855226397514343,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": 3.1921732425689697,
"rewards/margins": 1.485547661781311,
"rewards/rejected": 1.7066256999969482,
"step": 215
},
{
"drift/chosen_abs": 0.18876484036445618,
"drift/rejected_abs": 0.10738082975149155,
"epoch": 0.21019945061507225,
"grad_norm": 138.0,
"learning_rate": 4.963890147645194e-07,
"logits/chosen": -2.1035685539245605,
"logits/rejected": -2.017023801803589,
"logps/chosen": -0.3024953007698059,
"logps/rejected": -0.30150723457336426,
"loss": 24.240825653076172,
"loss/core": 24.230350494384766,
"loss/preference_sft": 0.3024953007698059,
"loss/reference_anchor": 0.1094045639038086,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 1.8857002258300781,
"rewards/margins": 0.813431441783905,
"rewards/rejected": 1.0722688436508179,
"step": 220
},
{
"drift/chosen_abs": 0.36280855536460876,
"drift/rejected_abs": 0.14171245694160461,
"epoch": 0.2149767108563239,
"grad_norm": 68.0,
"learning_rate": 4.95406795861916e-07,
"logits/chosen": -2.189195156097412,
"logits/rejected": -2.1777374744415283,
"logps/chosen": -0.29006287455558777,
"logps/rejected": -0.2748886048793793,
"loss": 23.25436782836914,
"loss/core": 23.220571517944336,
"loss/preference_sft": 0.29006287455558777,
"loss/reference_anchor": 0.4215586185455322,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 3.6274166107177734,
"rewards/margins": 2.212296485900879,
"rewards/rejected": 1.4151195287704468,
"step": 225
},
{
"drift/chosen_abs": 0.18566292524337769,
"drift/rejected_abs": 0.07588974386453629,
"epoch": 0.21975397109757555,
"grad_norm": 828.0,
"learning_rate": 4.943077766156697e-07,
"logits/chosen": -2.2765140533447266,
"logits/rejected": -2.2845187187194824,
"logps/chosen": -0.2816498279571533,
"logps/rejected": -0.30764302611351013,
"loss": 24.015369415283203,
"loss/core": 24.00626564025879,
"loss/preference_sft": 0.2816498279571533,
"loss/reference_anchor": 0.09326620399951935,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": 1.8551431894302368,
"rewards/margins": 1.0997159481048584,
"rewards/rejected": 0.7554270625114441,
"step": 230
},
{
"drift/chosen_abs": 0.19052401185035706,
"drift/rejected_abs": 0.13283082842826843,
"epoch": 0.2245312313388272,
"grad_norm": 75.0,
"learning_rate": 4.930924800994191e-07,
"logits/chosen": -2.0162127017974854,
"logits/rejected": -2.050363302230835,
"logps/chosen": -0.2928079068660736,
"logps/rejected": -0.28698280453681946,
"loss": 24.55010414123535,
"loss/core": 24.53103256225586,
"loss/preference_sft": 0.2928079068660736,
"loss/reference_anchor": 0.22502753138542175,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 1.9030735492706299,
"rewards/margins": 0.5786088705062866,
"rewards/rejected": 1.3244645595550537,
"step": 235
},
{
"drift/chosen_abs": 0.1768554449081421,
"drift/rejected_abs": 0.10264088213443756,
"epoch": 0.22930849158007882,
"grad_norm": 88.0,
"learning_rate": 4.917614847284858e-07,
"logits/chosen": -2.0287160873413086,
"logits/rejected": -2.0479371547698975,
"logps/chosen": -0.29354214668273926,
"logps/rejected": -0.29428401589393616,
"loss": 24.292566299438477,
"loss/core": 24.284984588623047,
"loss/preference_sft": 0.29354214668273926,
"loss/reference_anchor": 0.07169236242771149,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": 1.767877221107483,
"rewards/margins": 0.7428776621818542,
"rewards/rejected": 1.0249996185302734,
"step": 240
},
{
"drift/chosen_abs": 0.35989120602607727,
"drift/rejected_abs": 0.1157422810792923,
"epoch": 0.23408575182133046,
"grad_norm": 1056.0,
"learning_rate": 4.903154239845797e-07,
"logits/chosen": -2.0682170391082764,
"logits/rejected": -2.0564630031585693,
"logps/chosen": -0.2781009078025818,
"logps/rejected": -0.2913815677165985,
"loss": 23.59634017944336,
"loss/core": 23.54959487915039,
"loss/preference_sft": 0.2781009078025818,
"loss/reference_anchor": 0.5954445600509644,
"rewards/accuracies": 0.875,
"rewards/chosen": 3.5985991954803467,
"rewards/margins": 2.4494547843933105,
"rewards/rejected": 1.1491445302963257,
"step": 245
},
{
"drift/chosen_abs": 0.2339925318956375,
"drift/rejected_abs": 0.10722045600414276,
"epoch": 0.23886301206258212,
"grad_norm": 101.0,
"learning_rate": 4.887549861142967e-07,
"logits/chosen": -1.9105064868927002,
"logits/rejected": -1.9906113147735596,
"logps/chosen": -0.2999528646469116,
"logps/rejected": -0.29507893323898315,
"loss": 23.889766693115234,
"loss/core": 23.876558303833008,
"loss/preference_sft": 0.2999528646469116,
"loss/reference_anchor": 0.1460881531238556,
"rewards/accuracies": 0.875,
"rewards/chosen": 2.337829351425171,
"rewards/margins": 1.2744026184082031,
"rewards/rejected": 1.0634267330169678,
"step": 250
},
{
"drift/chosen_abs": 0.24554595351219177,
"drift/rejected_abs": 0.16090847551822662,
"epoch": 0.24364027230383375,
"grad_norm": 64.0,
"learning_rate": 4.870809138015498e-07,
"logits/chosen": -2.220195770263672,
"logits/rejected": -2.2151570320129395,
"logps/chosen": -0.2845707833766937,
"logps/rejected": -0.28703150153160095,
"loss": 24.28571128845215,
"loss/core": 24.260061264038086,
"loss/preference_sft": 0.2845707833766937,
"loss/reference_anchor": 0.31353074312210083,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 2.4550528526306152,
"rewards/margins": 0.8476669192314148,
"rewards/rejected": 1.6073859930038452,
"step": 255
},
{
"drift/chosen_abs": 0.2403588742017746,
"drift/rejected_abs": 0.15879188477993011,
"epoch": 0.2484175325450854,
"grad_norm": 35.25,
"learning_rate": 4.852940038140927e-07,
"logits/chosen": -2.1549439430236816,
"logits/rejected": -2.227227210998535,
"logps/chosen": -0.28740060329437256,
"logps/rejected": -0.27014413475990295,
"loss": 24.529048919677734,
"loss/core": 24.506467819213867,
"loss/preference_sft": 0.28740060329437256,
"loss/reference_anchor": 0.2723291516304016,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 2.403057336807251,
"rewards/margins": 0.8171398043632507,
"rewards/rejected": 1.5859174728393555,
"step": 260
},
{
"drift/chosen_abs": 0.12319445610046387,
"drift/rejected_abs": 0.11670766770839691,
"epoch": 0.25319479278633705,
"grad_norm": 34.0,
"learning_rate": 4.833951066243004e-07,
"logits/chosen": -2.0384128093719482,
"logits/rejected": -2.0463626384735107,
"logps/chosen": -0.29939448833465576,
"logps/rejected": -0.30272746086120605,
"loss": 25.318052291870117,
"loss/core": 25.299692153930664,
"loss/preference_sft": 0.29939448833465576,
"loss/reference_anchor": 0.21487000584602356,
"rewards/accuracies": 0.9375,
"rewards/chosen": 1.2312783002853394,
"rewards/margins": 0.06888408958911896,
"rewards/rejected": 1.1623942852020264,
"step": 265
},
{
"drift/chosen_abs": 0.32817989587783813,
"drift/rejected_abs": 0.21317580342292786,
"epoch": 0.2579720530275887,
"grad_norm": 57.0,
"learning_rate": 4.813851260043915e-07,
"logits/chosen": -1.9417810440063477,
"logits/rejected": -2.031541347503662,
"logps/chosen": -0.28844502568244934,
"logps/rejected": -0.29021137952804565,
"loss": 24.536828994750977,
"loss/core": 24.490381240844727,
"loss/preference_sft": 0.28844502568244934,
"loss/reference_anchor": 0.5904703140258789,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 3.2817986011505127,
"rewards/margins": 1.1503736972808838,
"rewards/rejected": 2.13142466545105,
"step": 270
},
{
"drift/chosen_abs": 0.23207350075244904,
"drift/rejected_abs": 0.12252874672412872,
"epoch": 0.2627493132688403,
"grad_norm": 572.0,
"learning_rate": 4.79265018596281e-07,
"logits/chosen": -2.0927796363830566,
"logits/rejected": -2.0458498001098633,
"logps/chosen": -0.29707807302474976,
"logps/rejected": -0.3014887869358063,
"loss": 23.969472885131836,
"loss/core": 23.95018768310547,
"loss/preference_sft": 0.29707807302474976,
"loss/reference_anchor": 0.22740456461906433,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": 2.3190271854400635,
"rewards/margins": 1.1700794696807861,
"rewards/rejected": 1.1489474773406982,
"step": 275
},
{
"drift/chosen_abs": 0.2051713466644287,
"drift/rejected_abs": 0.08534234762191772,
"epoch": 0.26752657351009196,
"grad_norm": 56.75,
"learning_rate": 4.770357934562704e-07,
"logits/chosen": -2.063467502593994,
"logits/rejected": -1.9795265197753906,
"logps/chosen": -0.2879626750946045,
"logps/rejected": -0.3061186373233795,
"loss": 23.862253189086914,
"loss/core": 23.851999282836914,
"loss/preference_sft": 0.2879626750946045,
"loss/reference_anchor": 0.10792496055364609,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 2.0476605892181396,
"rewards/margins": 1.2737023830413818,
"rewards/rejected": 0.7739582061767578,
"step": 280
},
{
"drift/chosen_abs": 0.2606334090232849,
"drift/rejected_abs": 0.16303770244121552,
"epoch": 0.2723038337513436,
"grad_norm": 168.0,
"learning_rate": 4.746985115747917e-07,
"logits/chosen": -2.0845389366149902,
"logits/rejected": -2.0801751613616943,
"logps/chosen": -0.29716962575912476,
"logps/rejected": -0.29298409819602966,
"loss": 24.26735496520996,
"loss/core": 24.245363235473633,
"loss/preference_sft": 0.29716962575912476,
"loss/reference_anchor": 0.26353123784065247,
"rewards/accuracies": 0.8500000238418579,
"rewards/chosen": 2.605191707611084,
"rewards/margins": 0.9785102605819702,
"rewards/rejected": 1.6266816854476929,
"step": 285
},
{
"drift/chosen_abs": 0.14788036048412323,
"drift/rejected_abs": 0.14346002042293549,
"epoch": 0.27708109399259523,
"grad_norm": 1488.0,
"learning_rate": 4.722542853714341e-07,
"logits/chosen": -2.1646649837493896,
"logits/rejected": -2.176093578338623,
"logps/chosen": -0.2869679927825928,
"logps/rejected": -0.28978294134140015,
"loss": 25.25179672241211,
"loss/core": 25.234987258911133,
"loss/preference_sft": 0.2869679927825928,
"loss/reference_anchor": 0.19546569883823395,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 1.4774421453475952,
"rewards/margins": 0.04469200596213341,
"rewards/rejected": 1.4327499866485596,
"step": 290
},
{
"drift/chosen_abs": 0.1308569461107254,
"drift/rejected_abs": 0.0676531195640564,
"epoch": 0.28185835423384686,
"grad_norm": 64.5,
"learning_rate": 4.697042781654913e-07,
"logits/chosen": -2.565634250640869,
"logits/rejected": -2.5284571647644043,
"logps/chosen": -0.2447257786989212,
"logps/rejected": -0.2566220164299011,
"loss": 24.383955001831055,
"loss/core": 24.379867553710938,
"loss/preference_sft": 0.2447257786989212,
"loss/reference_anchor": 0.030016642063856125,
"rewards/accuracies": 0.9375,
"rewards/chosen": 1.308022379875183,
"rewards/margins": 0.6341660022735596,
"rewards/rejected": 0.6738564968109131,
"step": 295
},
{
"drift/chosen_abs": 0.3740275204181671,
"drift/rejected_abs": 0.10665237903594971,
"epoch": 0.28663561447509855,
"grad_norm": 388.0,
"learning_rate": 4.670497036222856e-07,
"logits/chosen": -1.9813871383666992,
"logits/rejected": -1.9485054016113281,
"logps/chosen": -0.31088101863861084,
"logps/rejected": -0.3178117573261261,
"loss": 23.0051326751709,
"loss/core": 22.965051651000977,
"loss/preference_sft": 0.31088101863861084,
"loss/reference_anchor": 0.5033376216888428,
"rewards/accuracies": 0.8500000238418579,
"rewards/chosen": 3.739037275314331,
"rewards/margins": 2.6878647804260254,
"rewards/rejected": 1.0511722564697266,
"step": 300
},
{
"drift/chosen_abs": 0.2159603089094162,
"drift/rejected_abs": 0.0897536352276802,
"epoch": 0.2914128747163502,
"grad_norm": 76.0,
"learning_rate": 4.642918251755281e-07,
"logits/chosen": -2.125406265258789,
"logits/rejected": -2.185771942138672,
"logps/chosen": -0.26945987343788147,
"logps/rejected": -0.26080164313316345,
"loss": 23.85554313659668,
"loss/core": 23.84500503540039,
"loss/preference_sft": 0.26945987343788147,
"loss/reference_anchor": 0.11357325315475464,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 2.159000873565674,
"rewards/margins": 1.2621368169784546,
"rewards/rejected": 0.896864116191864,
"step": 305
},
{
"drift/chosen_abs": 0.26018840074539185,
"drift/rejected_abs": 0.2073136568069458,
"epoch": 0.2961901349576018,
"grad_norm": 976.0,
"learning_rate": 4.614319554259933e-07,
"logits/chosen": -2.12811017036438,
"logits/rejected": -2.0370516777038574,
"logps/chosen": -0.2741633355617523,
"logps/rejected": -0.2802058160305023,
"loss": 25.01598358154297,
"loss/core": 24.98000144958496,
"loss/preference_sft": 0.2741633355617523,
"loss/reference_anchor": 0.452305406332016,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 2.6010148525238037,
"rewards/margins": 0.5811925530433655,
"rewards/rejected": 2.019822359085083,
"step": 310
},
{
"drift/chosen_abs": 0.29169219732284546,
"drift/rejected_abs": 0.13470803201198578,
"epoch": 0.30096739519885346,
"grad_norm": 61.0,
"learning_rate": 4.58471455516792e-07,
"logits/chosen": -1.9604593515396118,
"logits/rejected": -2.0688371658325195,
"logps/chosen": -0.2688148617744446,
"logps/rejected": -0.2757693827152252,
"loss": 23.543533325195312,
"loss/core": 23.524099349975586,
"loss/preference_sft": 0.2688148617744446,
"loss/reference_anchor": 0.23222799599170685,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": 2.9164979457855225,
"rewards/margins": 1.5716060400009155,
"rewards/rejected": 1.344891905784607,
"step": 315
},
{
"drift/chosen_abs": 0.1583484411239624,
"drift/rejected_abs": 0.12316056340932846,
"epoch": 0.3057446554401051,
"grad_norm": 51.5,
"learning_rate": 4.5541173448554095e-07,
"logits/chosen": -2.0016112327575684,
"logits/rejected": -2.0177295207977295,
"logps/chosen": -0.2901010513305664,
"logps/rejected": -0.2924564480781555,
"loss": 24.739116668701172,
"loss/core": 24.729549407958984,
"loss/preference_sft": 0.2901010513305664,
"loss/reference_anchor": 0.09852476418018341,
"rewards/accuracies": 0.875,
"rewards/chosen": 1.5812407732009888,
"rewards/margins": 0.35098347067832947,
"rewards/rejected": 1.2302576303482056,
"step": 320
},
{
"drift/chosen_abs": 0.36936116218566895,
"drift/rejected_abs": 0.1534915715456009,
"epoch": 0.31052191568135673,
"grad_norm": 146.0,
"learning_rate": 4.5225424859373684e-07,
"logits/chosen": -2.257908344268799,
"logits/rejected": -2.2035529613494873,
"logps/chosen": -0.28698205947875977,
"logps/rejected": -0.28376373648643494,
"loss": 24.22592544555664,
"loss/core": 24.155797958374023,
"loss/preference_sft": 0.28698205947875977,
"loss/reference_anchor": 0.9063272476196289,
"rewards/accuracies": 0.8500000238418579,
"rewards/chosen": 3.6920619010925293,
"rewards/margins": 2.15855073928833,
"rewards/rejected": 1.5335115194320679,
"step": 325
},
{
"drift/chosen_abs": 0.20329172909259796,
"drift/rejected_abs": 0.11353343725204468,
"epoch": 0.31529917592260837,
"grad_norm": 40.75,
"learning_rate": 4.4900050063365547e-07,
"logits/chosen": -2.2280595302581787,
"logits/rejected": -2.217438220977783,
"logps/chosen": -0.27844610810279846,
"logps/rejected": -0.270263135433197,
"loss": 24.234060287475586,
"loss/core": 24.221086502075195,
"loss/preference_sft": 0.27844610810279846,
"loss/reference_anchor": 0.14516863226890564,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": 2.0322957038879395,
"rewards/margins": 0.8984895944595337,
"rewards/rejected": 1.1338062286376953,
"step": 330
},
{
"drift/chosen_abs": 0.2127622663974762,
"drift/rejected_abs": 0.07780848443508148,
"epoch": 0.32007643616386,
"grad_norm": 165.0,
"learning_rate": 4.4565203921310344e-07,
"logits/chosen": -2.0511183738708496,
"logits/rejected": -2.0350396633148193,
"logps/chosen": -0.30186930298805237,
"logps/rejected": -0.3197532296180725,
"loss": 23.990903854370117,
"loss/core": 23.97220230102539,
"loss/preference_sft": 0.30186930298805237,
"loss/reference_anchor": 0.21921315789222717,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 2.124210834503174,
"rewards/margins": 1.4477331638336182,
"rewards/rejected": 0.6764776110649109,
"step": 335
},
{
"drift/chosen_abs": 0.2031564712524414,
"drift/rejected_abs": 0.087882399559021,
"epoch": 0.3248536964051117,
"grad_norm": 186.0,
"learning_rate": 4.422104580183649e-07,
"logits/chosen": -2.095062017440796,
"logits/rejected": -2.2184524536132812,
"logps/chosen": -0.28098320960998535,
"logps/rejected": -0.28097662329673767,
"loss": 24.006999969482422,
"loss/core": 23.993459701538086,
"loss/preference_sft": 0.28098320960998535,
"loss/reference_anchor": 0.15243388712406158,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 2.031026840209961,
"rewards/margins": 1.153816819190979,
"rewards/rejected": 0.8772099614143372,
"step": 340
},
{
"drift/chosen_abs": 0.16465213894844055,
"drift/rejected_abs": 0.0845918357372284,
"epoch": 0.3296309566463633,
"grad_norm": 98.5,
"learning_rate": 4.3867739505569303e-07,
"logits/chosen": -2.3218281269073486,
"logits/rejected": -2.3827481269836426,
"logps/chosen": -0.282081663608551,
"logps/rejected": -0.29249638319015503,
"loss": 24.309249877929688,
"loss/core": 24.29976463317871,
"loss/preference_sft": 0.282081663608551,
"loss/reference_anchor": 0.09826230257749557,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 1.644649863243103,
"rewards/margins": 0.799951434135437,
"rewards/rejected": 0.8446983098983765,
"step": 345
},
{
"drift/chosen_abs": 0.20000576972961426,
"drift/rejected_abs": 0.09551592916250229,
"epoch": 0.33440821688761496,
"grad_norm": 80.5,
"learning_rate": 4.35054531871708e-07,
"logits/chosen": -2.0598835945129395,
"logits/rejected": -2.03928804397583,
"logps/chosen": -0.26030445098876953,
"logps/rejected": -0.2558044195175171,
"loss": 24.042661666870117,
"loss/core": 24.03305435180664,
"loss/preference_sft": 0.26030445098876953,
"loss/reference_anchor": 0.1020883321762085,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 1.9989124536514282,
"rewards/margins": 1.0452065467834473,
"rewards/rejected": 0.953705906867981,
"step": 350
},
{
"drift/chosen_abs": 0.18520495295524597,
"drift/rejected_abs": 0.1412447839975357,
"epoch": 0.3391854771288666,
"grad_norm": 75.5,
"learning_rate": 4.3134359275307185e-07,
"logits/chosen": -2.106975555419922,
"logits/rejected": -2.2341411113739014,
"logps/chosen": -0.28064435720443726,
"logps/rejected": -0.2879922389984131,
"loss": 24.90737533569336,
"loss/core": 24.887197494506836,
"loss/preference_sft": 0.28064435720443726,
"loss/reference_anchor": 0.2410183846950531,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 1.851447343826294,
"rewards/margins": 0.45425519347190857,
"rewards/rejected": 1.3971920013427734,
"step": 355
},
{
"drift/chosen_abs": 0.26272064447402954,
"drift/rejected_abs": 0.1274389922618866,
"epoch": 0.34396273737011823,
"grad_norm": 472.0,
"learning_rate": 4.2754634390582133e-07,
"logits/chosen": -2.1305363178253174,
"logits/rejected": -2.192857265472412,
"logps/chosen": -0.28095608949661255,
"logps/rejected": -0.28217315673828125,
"loss": 24.006431579589844,
"loss/core": 23.981016159057617,
"loss/preference_sft": 0.28095608949661255,
"loss/reference_anchor": 0.31079161167144775,
"rewards/accuracies": 0.875,
"rewards/chosen": 2.62534761428833,
"rewards/margins": 1.353183627128601,
"rewards/rejected": 1.272163987159729,
"step": 360
},
{
"drift/chosen_abs": 0.2852028012275696,
"drift/rejected_abs": 0.08169830590486526,
"epoch": 0.34873999761136987,
"grad_norm": 205.0,
"learning_rate": 4.236645926147493e-07,
"logits/chosen": -2.069857120513916,
"logits/rejected": -2.1774981021881104,
"logps/chosen": -0.287311851978302,
"logps/rejected": -0.2833508551120758,
"loss": 23.85344123840332,
"loss/core": 23.815753936767578,
"loss/preference_sft": 0.287311851978302,
"loss/reference_anchor": 0.4737482964992523,
"rewards/accuracies": 0.875,
"rewards/chosen": 2.851012945175171,
"rewards/margins": 2.036228895187378,
"rewards/rejected": 0.8147839307785034,
"step": 365
},
{
"drift/chosen_abs": 0.1644589602947235,
"drift/rejected_abs": 0.10670790821313858,
"epoch": 0.3535172578526215,
"grad_norm": 188.0,
"learning_rate": 4.1970018638323547e-07,
"logits/chosen": -2.2686495780944824,
"logits/rejected": -2.3140177726745605,
"logps/chosen": -0.2849913239479065,
"logps/rejected": -0.2848779857158661,
"loss": 24.466651916503906,
"loss/core": 24.457897186279297,
"loss/preference_sft": 0.2849913239479065,
"loss/reference_anchor": 0.08822296559810638,
"rewards/accuracies": 0.875,
"rewards/chosen": 1.6427894830703735,
"rewards/margins": 0.5768302083015442,
"rewards/rejected": 1.0659592151641846,
"step": 370
},
{
"drift/chosen_abs": 0.3016364276409149,
"drift/rejected_abs": 0.22407476603984833,
"epoch": 0.35829451809387314,
"grad_norm": 70.5,
"learning_rate": 4.1565501205393436e-07,
"logits/chosen": -2.0465548038482666,
"logits/rejected": -2.024115562438965,
"logps/chosen": -0.25850996375083923,
"logps/rejected": -0.25814658403396606,
"loss": 24.701723098754883,
"loss/core": 24.66933822631836,
"loss/preference_sft": 0.25850996375083923,
"loss/reference_anchor": 0.4059620499610901,
"rewards/accuracies": 0.875,
"rewards/chosen": 3.0161895751953125,
"rewards/margins": 0.7962467670440674,
"rewards/rejected": 2.2199432849884033,
"step": 375
},
{
"drift/chosen_abs": 0.20642168819904327,
"drift/rejected_abs": 0.16034074127674103,
"epoch": 0.36307177833512483,
"grad_norm": 106.0,
"learning_rate": 4.1153099491074093e-07,
"logits/chosen": -2.122387409210205,
"logits/rejected": -2.131068468093872,
"logps/chosen": -0.27889400720596313,
"logps/rejected": -0.2892562448978424,
"loss": 25.11880874633789,
"loss/core": 25.087757110595703,
"loss/preference_sft": 0.27889400720596313,
"loss/reference_anchor": 0.38615480065345764,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 2.06227445602417,
"rewards/margins": 0.45964282751083374,
"rewards/rejected": 1.6026318073272705,
"step": 380
},
{
"drift/chosen_abs": 0.21806609630584717,
"drift/rejected_abs": 0.15287581086158752,
"epoch": 0.36784903857637646,
"grad_norm": 131.0,
"learning_rate": 4.0733009776245937e-07,
"logits/chosen": -2.115004062652588,
"logits/rejected": -2.1338284015655518,
"logps/chosen": -0.2700949013233185,
"logps/rejected": -0.27447065711021423,
"loss": 24.529088973999023,
"loss/core": 24.512638092041016,
"loss/preference_sft": 0.2700949013233185,
"loss/reference_anchor": 0.19232222437858582,
"rewards/accuracies": 0.8500000238418579,
"rewards/chosen": 2.179309129714966,
"rewards/margins": 0.6530361175537109,
"rewards/rejected": 1.5262731313705444,
"step": 385
},
{
"drift/chosen_abs": 0.17654861509799957,
"drift/rejected_abs": 0.09032897651195526,
"epoch": 0.3726262988176281,
"grad_norm": 42.75,
"learning_rate": 4.0305432000861226e-07,
"logits/chosen": -1.8726367950439453,
"logits/rejected": -1.9506858587265015,
"logps/chosen": -0.3072229325771332,
"logps/rejected": -0.3017742931842804,
"loss": 24.248693466186523,
"loss/core": 24.23879051208496,
"loss/preference_sft": 0.3072229325771332,
"loss/reference_anchor": 0.10132338106632233,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 1.761505126953125,
"rewards/margins": 0.8584615588188171,
"rewards/rejected": 0.9030437469482422,
"step": 390
},
{
"drift/chosen_abs": 0.1685396432876587,
"drift/rejected_abs": 0.08101732283830643,
"epoch": 0.37740355905887973,
"grad_norm": 101.0,
"learning_rate": 3.9870569668783533e-07,
"logits/chosen": -2.223672389984131,
"logits/rejected": -2.3257579803466797,
"logps/chosen": -0.29469752311706543,
"logps/rejected": -0.28933185338974,
"loss": 24.182411193847656,
"loss/core": 24.174169540405273,
"loss/preference_sft": 0.29469752311706543,
"loss/reference_anchor": 0.08043049275875092,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": 1.6851272583007812,
"rewards/margins": 0.8753724098205566,
"rewards/rejected": 0.8097550272941589,
"step": 395
},
{
"drift/chosen_abs": 0.29273721575737,
"drift/rejected_abs": 0.0846409797668457,
"epoch": 0.38218081930013137,
"grad_norm": 85.0,
"learning_rate": 3.942862975093084e-07,
"logits/chosen": -2.1020679473876953,
"logits/rejected": -2.1372578144073486,
"logps/chosen": -0.29274052381515503,
"logps/rejected": -0.2928157448768616,
"loss": 23.699491500854492,
"loss/core": 23.65845489501953,
"loss/preference_sft": 0.29274052381515503,
"loss/reference_anchor": 0.5178688168525696,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 2.925940990447998,
"rewards/margins": 2.0813891887664795,
"rewards/rejected": 0.8445518612861633,
"step": 400
},
{
"drift/chosen_abs": 0.2351594716310501,
"drift/rejected_abs": 0.12229617685079575,
"epoch": 0.386958079541383,
"grad_norm": 65.0,
"learning_rate": 3.8979822586768666e-07,
"logits/chosen": -2.135050058364868,
"logits/rejected": -2.189692735671997,
"logps/chosen": -0.3113452196121216,
"logps/rejected": -0.3050457835197449,
"loss": 24.190441131591797,
"loss/core": 24.1619873046875,
"loss/preference_sft": 0.3113452196121216,
"loss/reference_anchor": 0.3482899069786072,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 2.3515946865081787,
"rewards/margins": 1.1289160251617432,
"rewards/rejected": 1.2226788997650146,
"step": 405
},
{
"drift/chosen_abs": 0.20916077494621277,
"drift/rejected_abs": 0.11924557387828827,
"epoch": 0.39173533978263464,
"grad_norm": 86.0,
"learning_rate": 3.8524361784199847e-07,
"logits/chosen": -2.251237630844116,
"logits/rejected": -2.2815263271331787,
"logps/chosen": -0.27680549025535583,
"logps/rejected": -0.2878721058368683,
"loss": 24.154521942138672,
"loss/core": 24.142080307006836,
"loss/preference_sft": 0.27680549025535583,
"loss/reference_anchor": 0.1381910741329193,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 2.090045690536499,
"rewards/margins": 0.8996987342834473,
"rewards/rejected": 1.1903469562530518,
"step": 410
},
{
"drift/chosen_abs": 0.09965378046035767,
"drift/rejected_abs": 0.037877295166254044,
"epoch": 0.3965126000238863,
"grad_norm": 77.5,
"learning_rate": 3.806246411789872e-07,
"logits/chosen": -2.1194329261779785,
"logits/rejected": -2.1981375217437744,
"logps/chosen": -0.33038097620010376,
"logps/rejected": -0.32079142332077026,
"loss": 24.420391082763672,
"loss/core": 24.41567039489746,
"loss/preference_sft": 0.33038097620010376,
"loss/reference_anchor": 0.02990715578198433,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 0.9942773580551147,
"rewards/margins": 0.616710364818573,
"rewards/rejected": 0.37756696343421936,
"step": 415
},
{
"drift/chosen_abs": 0.2046138346195221,
"drift/rejected_abs": 0.07252134382724762,
"epoch": 0.40128986026513797,
"grad_norm": 129.0,
"learning_rate": 3.7594349426138154e-07,
"logits/chosen": -2.350454807281494,
"logits/rejected": -2.316537618637085,
"logps/chosen": -0.2832780182361603,
"logps/rejected": -0.29880502820014954,
"loss": 23.930326461791992,
"loss/core": 23.915685653686523,
"loss/preference_sft": 0.2832780182361603,
"loss/reference_anchor": 0.1668982058763504,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": 2.046138286590576,
"rewards/margins": 1.3250911235809326,
"rewards/rejected": 0.721047043800354,
"step": 420
},
{
"drift/chosen_abs": 0.2236243188381195,
"drift/rejected_abs": 0.1645563691854477,
"epoch": 0.4060671205063896,
"grad_norm": 486.0,
"learning_rate": 3.712024050615843e-07,
"logits/chosen": -2.0146186351776123,
"logits/rejected": -2.0732080936431885,
"logps/chosen": -0.2916070222854614,
"logps/rejected": -0.2652800679206848,
"loss": 25.089502334594727,
"loss/core": 25.058069229125977,
"loss/preference_sft": 0.2916070222854614,
"loss/reference_anchor": 0.3899894654750824,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 2.235166549682617,
"rewards/margins": 0.5908761620521545,
"rewards/rejected": 1.6442902088165283,
"step": 425
},
{
"drift/chosen_abs": 0.44021230936050415,
"drift/rejected_abs": 0.1417957842350006,
"epoch": 0.41084438074764124,
"grad_norm": 274.0,
"learning_rate": 3.664036300812778e-07,
"logits/chosen": -2.0683376789093018,
"logits/rejected": -2.091358184814453,
"logps/chosen": -0.27976277470588684,
"logps/rejected": -0.2667387127876282,
"loss": 23.26540184020996,
"loss/core": 23.194873809814453,
"loss/preference_sft": 0.27976277470588684,
"loss/reference_anchor": 0.9124003648757935,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 4.400694847106934,
"rewards/margins": 2.9839932918548584,
"rewards/rejected": 1.4167020320892334,
"step": 430
},
{
"drift/chosen_abs": 0.16288933157920837,
"drift/rejected_abs": 0.10126354545354843,
"epoch": 0.41562164098889287,
"grad_norm": 99.5,
"learning_rate": 3.615494532774522e-07,
"logits/chosen": -2.3494062423706055,
"logits/rejected": -2.3344578742980957,
"logps/chosen": -0.2779366374015808,
"logps/rejected": -0.29263314604759216,
"loss": 24.44803810119629,
"loss/core": 24.437061309814453,
"loss/preference_sft": 0.2779366374015808,
"loss/reference_anchor": 0.11851142346858978,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 1.628753900527954,
"rewards/margins": 0.6175113916397095,
"rewards/rejected": 1.0112426280975342,
"step": 435
},
{
"drift/chosen_abs": 0.30069416761398315,
"drift/rejected_abs": 0.13946831226348877,
"epoch": 0.4203989012301445,
"grad_norm": 668.0,
"learning_rate": 3.5664218497536456e-07,
"logits/chosen": -2.05379581451416,
"logits/rejected": -2.1259214878082275,
"logps/chosen": -0.303558886051178,
"logps/rejected": -0.3001348078250885,
"loss": 24.09839630126953,
"loss/core": 24.058101654052734,
"loss/preference_sft": 0.303558886051178,
"loss/reference_anchor": 0.5069498419761658,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 3.003722667694092,
"rewards/margins": 1.6185331344604492,
"rewards/rejected": 1.3851896524429321,
"step": 440
},
{
"drift/chosen_abs": 0.29670435190200806,
"drift/rejected_abs": 0.16009071469306946,
"epoch": 0.42517616147139614,
"grad_norm": 130.0,
"learning_rate": 3.516841607689501e-07,
"logits/chosen": -1.9354779720306396,
"logits/rejected": -1.9123506546020508,
"logps/chosen": -0.29504531621932983,
"logps/rejected": -0.2956696152687073,
"loss": 23.822757720947266,
"loss/core": 23.801040649414062,
"loss/preference_sft": 0.29504531621932983,
"loss/reference_anchor": 0.2600812315940857,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 2.9661905765533447,
"rewards/margins": 1.388580560684204,
"rewards/rejected": 1.577609896659851,
"step": 445
},
{
"drift/chosen_abs": 0.345471054315567,
"drift/rejected_abs": 0.161865234375,
"epoch": 0.4299534217126478,
"grad_norm": 768.0,
"learning_rate": 3.4667774040920515e-07,
"logits/chosen": -1.9765275716781616,
"logits/rejected": -1.9926903247833252,
"logps/chosen": -0.29864731431007385,
"logps/rejected": -0.2888573110103607,
"loss": 23.699243545532227,
"loss/core": 23.66305160522461,
"loss/preference_sft": 0.29864731431007385,
"loss/reference_anchor": 0.4526439309120178,
"rewards/accuracies": 0.949999988079071,
"rewards/chosen": 3.4545040130615234,
"rewards/margins": 1.8422412872314453,
"rewards/rejected": 1.6122627258300781,
"step": 450
},
{
"drift/chosen_abs": 0.34665170311927795,
"drift/rejected_abs": 0.14890094101428986,
"epoch": 0.4347306819538994,
"grad_norm": 246.0,
"learning_rate": 3.416253066810743e-07,
"logits/chosen": -1.936833143234253,
"logits/rejected": -2.127368927001953,
"logps/chosen": -0.32262879610061646,
"logps/rejected": -0.31309956312179565,
"loss": 23.719173431396484,
"loss/core": 23.66214370727539,
"loss/preference_sft": 0.32262879610061646,
"loss/reference_anchor": 0.728130042552948,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 3.4665169715881348,
"rewards/margins": 1.979360580444336,
"rewards/rejected": 1.4871563911437988,
"step": 455
},
{
"drift/chosen_abs": 0.36950841546058655,
"drift/rejected_abs": 0.18701323866844177,
"epoch": 0.4395079421951511,
"grad_norm": 141.0,
"learning_rate": 3.3652926426937325e-07,
"logits/chosen": -2.0627896785736084,
"logits/rejected": -2.0499472618103027,
"logps/chosen": -0.2930159270763397,
"logps/rejected": -0.3065492510795593,
"loss": 23.571096420288086,
"loss/core": 23.52437973022461,
"loss/preference_sft": 0.2930159270763397,
"loss/reference_anchor": 0.5935932397842407,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 3.694608688354492,
"rewards/margins": 1.8250821828842163,
"rewards/rejected": 1.8695262670516968,
"step": 460
},
{
"drift/chosen_abs": 0.23000410199165344,
"drift/rejected_abs": 0.09393614530563354,
"epoch": 0.44428520243640274,
"grad_norm": 60.25,
"learning_rate": 3.3139203861428914e-07,
"logits/chosen": -1.8922626972198486,
"logits/rejected": -1.9913305044174194,
"logps/chosen": -0.29730328917503357,
"logps/rejected": -0.29092690348625183,
"loss": 23.748533248901367,
"loss/core": 23.73752212524414,
"loss/preference_sft": 0.29730328917503357,
"loss/reference_anchor": 0.11708039045333862,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": 2.2995853424072266,
"rewards/margins": 1.3625905513763428,
"rewards/rejected": 0.936994731426239,
"step": 465
},
{
"drift/chosen_abs": 0.30310288071632385,
"drift/rejected_abs": 0.12414111942052841,
"epoch": 0.4490624626776544,
"grad_norm": 208.0,
"learning_rate": 3.262160747570027e-07,
"logits/chosen": -2.1301331520080566,
"logits/rejected": -2.198742628097534,
"logps/chosen": -0.27701377868652344,
"logps/rejected": -0.26015716791152954,
"loss": 23.711040496826172,
"loss/core": 23.664438247680664,
"loss/preference_sft": 0.27701377868652344,
"loss/reference_anchor": 0.5936552286148071,
"rewards/accuracies": 0.949999988079071,
"rewards/chosen": 3.030449151992798,
"rewards/margins": 1.86244797706604,
"rewards/rejected": 1.168001413345337,
"step": 470
},
{
"drift/chosen_abs": 0.18387170135974884,
"drift/rejected_abs": 0.15331368148326874,
"epoch": 0.453839722918906,
"grad_norm": 332.0,
"learning_rate": 3.210038361759807e-07,
"logits/chosen": -2.095447301864624,
"logits/rejected": -2.033949613571167,
"logps/chosen": -0.29470914602279663,
"logps/rejected": -0.3144375681877136,
"loss": 25.121068954467773,
"loss/core": 25.099435806274414,
"loss/preference_sft": 0.29470914602279663,
"loss/reference_anchor": 0.2589879631996155,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 1.838440179824829,
"rewards/margins": 0.307887464761734,
"rewards/rejected": 1.530552625656128,
"step": 475
},
{
"drift/chosen_abs": 0.2358885258436203,
"drift/rejected_abs": 0.10619956254959106,
"epoch": 0.45861698316015764,
"grad_norm": 70.0,
"learning_rate": 3.1575780361449364e-07,
"logits/chosen": -2.264855146408081,
"logits/rejected": -2.3214104175567627,
"logps/chosen": -0.2755188047885895,
"logps/rejected": -0.27138248085975647,
"loss": 24.032466888427734,
"loss/core": 24.010181427001953,
"loss/preference_sft": 0.2755188047885895,
"loss/reference_anchor": 0.2696211636066437,
"rewards/accuracies": 0.875,
"rewards/chosen": 2.3573050498962402,
"rewards/margins": 1.3217544555664062,
"rewards/rejected": 1.0355504751205444,
"step": 480
},
{
"drift/chosen_abs": 0.1745290607213974,
"drift/rejected_abs": 0.08883767575025558,
"epoch": 0.4633942434014093,
"grad_norm": 74.0,
"learning_rate": 3.104804738999169e-07,
"logits/chosen": -2.205657482147217,
"logits/rejected": -2.2127983570098877,
"logps/chosen": -0.29136472940444946,
"logps/rejected": -0.29586881399154663,
"loss": 24.19198226928711,
"loss/core": 24.183902740478516,
"loss/preference_sft": 0.29136472940444946,
"loss/reference_anchor": 0.07860977947711945,
"rewards/accuracies": 0.875,
"rewards/chosen": 1.74505615234375,
"rewards/margins": 0.8590679168701172,
"rewards/rejected": 0.8859883546829224,
"step": 485
},
{
"drift/chosen_abs": 0.20774760842323303,
"drift/rejected_abs": 0.10662759840488434,
"epoch": 0.4681715036426609,
"grad_norm": 99.5,
"learning_rate": 3.0517435875537536e-07,
"logits/chosen": -2.1565749645233154,
"logits/rejected": -2.198429822921753,
"logps/chosen": -0.30721935629844666,
"logps/rejected": -0.29325515031814575,
"loss": 24.078283309936523,
"loss/core": 24.06472396850586,
"loss/preference_sft": 0.30721935629844666,
"loss/reference_anchor": 0.15004561841487885,
"rewards/accuracies": 0.8500000238418579,
"rewards/chosen": 2.0768425464630127,
"rewards/margins": 1.012283444404602,
"rewards/rejected": 1.0645591020584106,
"step": 490
},
{
"drift/chosen_abs": 0.2635328471660614,
"drift/rejected_abs": 0.08991514146327972,
"epoch": 0.47294876388391255,
"grad_norm": 133.0,
"learning_rate": 2.998419836042993e-07,
"logits/chosen": -2.2264866828918457,
"logits/rejected": -2.3216514587402344,
"logps/chosen": -0.29546287655830383,
"logps/rejected": -0.2902601361274719,
"loss": 23.78059959411621,
"loss/core": 23.750764846801758,
"loss/preference_sft": 0.29546287655830383,
"loss/reference_anchor": 0.36827731132507324,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 2.6349475383758545,
"rewards/margins": 1.7373361587524414,
"rewards/rejected": 0.897611141204834,
"step": 495
},
{
"drift/chosen_abs": 0.4189828336238861,
"drift/rejected_abs": 0.20560988783836365,
"epoch": 0.47772602412516424,
"grad_norm": 284.0,
"learning_rate": 2.9448588636846043e-07,
"logits/chosen": -2.023249387741089,
"logits/rejected": -1.972783088684082,
"logps/chosen": -0.2784698009490967,
"logps/rejected": -0.2997981607913971,
"loss": 24.244253158569336,
"loss/core": 24.155033111572266,
"loss/preference_sft": 0.2784698009490967,
"loss/reference_anchor": 1.161747694015503,
"rewards/accuracies": 0.8500000238418579,
"rewards/chosen": 4.189828395843506,
"rewards/margins": 2.1354339122772217,
"rewards/rejected": 2.054394245147705,
"step": 500
},
{
"drift/chosen_abs": 0.3628165125846863,
"drift/rejected_abs": 0.19208696484565735,
"epoch": 0.4825032843664159,
"grad_norm": 76.0,
"learning_rate": 2.8910861626005773e-07,
"logits/chosen": -2.1512835025787354,
"logits/rejected": -2.1834206581115723,
"logps/chosen": -0.2839333713054657,
"logps/rejected": -0.278773695230484,
"loss": 24.71078109741211,
"loss/core": 24.65015983581543,
"loss/preference_sft": 0.2839333713054657,
"loss/reference_anchor": 0.7799011468887329,
"rewards/accuracies": 0.8125,
"rewards/chosen": 3.6272101402282715,
"rewards/margins": 1.7839975357055664,
"rewards/rejected": 1.8432128429412842,
"step": 505
},
{
"drift/chosen_abs": 0.2025258094072342,
"drift/rejected_abs": 0.08022260665893555,
"epoch": 0.4872805446076675,
"grad_norm": 27.5,
"learning_rate": 2.8371273256843074e-07,
"logits/chosen": -2.1484246253967285,
"logits/rejected": -2.282355546951294,
"logps/chosen": -0.3147265315055847,
"logps/rejected": -0.2912803888320923,
"loss": 24.102039337158203,
"loss/core": 24.08344078063965,
"loss/preference_sft": 0.3147265315055847,
"loss/reference_anchor": 0.21651633083820343,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 2.022645950317383,
"rewards/margins": 1.2219388484954834,
"rewards/rejected": 0.8007070422172546,
"step": 510
},
{
"drift/chosen_abs": 0.2555674910545349,
"drift/rejected_abs": 0.16905184090137482,
"epoch": 0.49205780484891914,
"grad_norm": 129.0,
"learning_rate": 2.783008034419767e-07,
"logits/chosen": -2.032346487045288,
"logits/rejected": -2.036229372024536,
"logps/chosen": -0.2818189561367035,
"logps/rejected": -0.30472418665885925,
"loss": 24.25507164001465,
"loss/core": 24.236268997192383,
"loss/preference_sft": 0.2818189561367035,
"loss/reference_anchor": 0.22251644730567932,
"rewards/accuracies": 0.8125,
"rewards/chosen": 2.553283214569092,
"rewards/margins": 0.8822887539863586,
"rewards/rejected": 1.670994758605957,
"step": 515
},
{
"drift/chosen_abs": 0.30994483828544617,
"drift/rejected_abs": 0.09894011914730072,
"epoch": 0.4968350650901708,
"grad_norm": 111.0,
"learning_rate": 2.7287540466585064e-07,
"logits/chosen": -2.059782028198242,
"logits/rejected": -2.228891372680664,
"logps/chosen": -0.3199217915534973,
"logps/rejected": -0.333048939704895,
"loss": 23.464609146118164,
"loss/core": 23.430858612060547,
"loss/preference_sft": 0.3199217915534973,
"loss/reference_anchor": 0.41807693243026733,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 3.0952601432800293,
"rewards/margins": 2.12144136428833,
"rewards/rejected": 0.9738188982009888,
"step": 520
},
{
"drift/chosen_abs": 0.43741607666015625,
"drift/rejected_abs": 0.14899471402168274,
"epoch": 0.5016123253314224,
"grad_norm": 668.0,
"learning_rate": 2.674391184360313e-07,
"logits/chosen": -2.195627450942993,
"logits/rejected": -2.1632399559020996,
"logps/chosen": -0.2940196394920349,
"logps/rejected": -0.2978762984275818,
"loss": 23.785734176635742,
"loss/core": 23.704212188720703,
"loss/preference_sft": 0.2940196394920349,
"loss/reference_anchor": 1.057555079460144,
"rewards/accuracies": 0.875,
"rewards/chosen": 4.371184349060059,
"rewards/margins": 2.8844447135925293,
"rewards/rejected": 1.4867396354675293,
"step": 525
},
{
"drift/chosen_abs": 0.3064503073692322,
"drift/rejected_abs": 0.1510452926158905,
"epoch": 0.5063895855726741,
"grad_norm": 27.0,
"learning_rate": 2.6199453213033593e-07,
"logits/chosen": -2.0389158725738525,
"logits/rejected": -2.002628803253174,
"logps/chosen": -0.28475403785705566,
"logps/rejected": -0.28787198662757874,
"loss": 23.84844970703125,
"loss/core": 23.816450119018555,
"loss/preference_sft": 0.28475403785705566,
"loss/reference_anchor": 0.3981722593307495,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 3.063196897506714,
"rewards/margins": 1.5666277408599854,
"rewards/rejected": 1.496569275856018,
"step": 530
},
{
"drift/chosen_abs": 0.3102155029773712,
"drift/rejected_abs": 0.10850729793310165,
"epoch": 0.5111668458139257,
"grad_norm": 58.0,
"learning_rate": 2.565442370769683e-07,
"logits/chosen": -2.1870720386505127,
"logits/rejected": -2.109102487564087,
"logps/chosen": -0.2847766578197479,
"logps/rejected": -0.27864956855773926,
"loss": 23.705360412597656,
"loss/core": 23.66876220703125,
"loss/preference_sft": 0.2847766578197479,
"loss/reference_anchor": 0.4595085680484772,
"rewards/accuracies": 0.8500000238418579,
"rewards/chosen": 3.1017348766326904,
"rewards/margins": 2.018510580062866,
"rewards/rejected": 1.0832241773605347,
"step": 535
},
{
"drift/chosen_abs": 0.15850523114204407,
"drift/rejected_abs": 0.15349014103412628,
"epoch": 0.5159441060551774,
"grad_norm": 40.5,
"learning_rate": 2.510908273211866e-07,
"logits/chosen": -2.1092724800109863,
"logits/rejected": -2.0874218940734863,
"logps/chosen": -0.27907878160476685,
"logps/rejected": -0.2851378917694092,
"loss": 25.15981674194336,
"loss/core": 25.145463943481445,
"loss/preference_sft": 0.27907878160476685,
"loss/reference_anchor": 0.163437157869339,
"rewards/accuracies": 0.875,
"rewards/chosen": 1.5850121974945068,
"rewards/margins": 0.05249936506152153,
"rewards/rejected": 1.532512903213501,
"step": 540
},
{
"drift/chosen_abs": 0.2638896703720093,
"drift/rejected_abs": 0.09009301662445068,
"epoch": 0.520721366296429,
"grad_norm": 344.0,
"learning_rate": 2.456368983906791e-07,
"logits/chosen": -2.334498882293701,
"logits/rejected": -2.1754422187805176,
"logps/chosen": -0.28355711698532104,
"logps/rejected": -0.2911638617515564,
"loss": 23.94521141052246,
"loss/core": 23.90779685974121,
"loss/preference_sft": 0.28355711698532104,
"loss/reference_anchor": 0.47052621841430664,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 2.637960433959961,
"rewards/margins": 1.7409608364105225,
"rewards/rejected": 0.8969996571540833,
"step": 545
},
{
"drift/chosen_abs": 0.2771431505680084,
"drift/rejected_abs": 0.16234190762043,
"epoch": 0.5254986265376806,
"grad_norm": 94.0,
"learning_rate": 2.401850460602329e-07,
"logits/chosen": -1.901158332824707,
"logits/rejected": -1.9195445775985718,
"logps/chosen": -0.27585816383361816,
"logps/rejected": -0.29788321256637573,
"loss": 23.990930557250977,
"loss/core": 23.959190368652344,
"loss/preference_sft": 0.27585816383361816,
"loss/reference_anchor": 0.3956103026866913,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 2.7710883617401123,
"rewards/margins": 1.148720383644104,
"rewards/rejected": 1.6223682165145874,
"step": 550
},
{
"drift/chosen_abs": 0.33259114623069763,
"drift/rejected_abs": 0.10077937692403793,
"epoch": 0.5302758867789323,
"grad_norm": 55.5,
"learning_rate": 2.3473786511628575e-07,
"logits/chosen": -2.095702648162842,
"logits/rejected": -2.1536788940429688,
"logps/chosen": -0.308633029460907,
"logps/rejected": -0.2737549841403961,
"loss": 23.32325553894043,
"loss/core": 23.289531707763672,
"loss/preference_sft": 0.308633029460907,
"loss/reference_anchor": 0.4187850058078766,
"rewards/accuracies": 0.875,
"rewards/chosen": 3.3254246711730957,
"rewards/margins": 2.317995548248291,
"rewards/rejected": 1.0074293613433838,
"step": 555
},
{
"drift/chosen_abs": 0.2825181186199188,
"drift/rejected_abs": 0.15401551127433777,
"epoch": 0.5350531470201839,
"grad_norm": 135.0,
"learning_rate": 2.2929794812194894e-07,
"logits/chosen": -2.1838390827178955,
"logits/rejected": -2.171027660369873,
"logps/chosen": -0.2748723030090332,
"logps/rejected": -0.2799665927886963,
"loss": 23.88632583618164,
"loss/core": 23.858224868774414,
"loss/preference_sft": 0.2748723030090332,
"loss/reference_anchor": 0.3471968472003937,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": 2.8238039016723633,
"rewards/margins": 1.2850908041000366,
"rewards/rejected": 1.5387130975723267,
"step": 560
},
{
"drift/chosen_abs": 0.280038982629776,
"drift/rejected_abs": 0.16534456610679626,
"epoch": 0.5398304072614356,
"grad_norm": 140.0,
"learning_rate": 2.2386788418308665e-07,
"logits/chosen": -2.077315092086792,
"logits/rejected": -2.1030631065368652,
"logps/chosen": -0.28564533591270447,
"logps/rejected": -0.3059332072734833,
"loss": 24.126893997192383,
"loss/core": 24.075992584228516,
"loss/preference_sft": 0.28564533591270447,
"loss/reference_anchor": 0.6501015424728394,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 2.7995214462280273,
"rewards/margins": 1.1462886333465576,
"rewards/rejected": 1.6532329320907593,
"step": 565
},
{
"drift/chosen_abs": 0.3362275958061218,
"drift/rejected_abs": 0.1704963594675064,
"epoch": 0.5446076675026872,
"grad_norm": 316.0,
"learning_rate": 2.184502577160426e-07,
"logits/chosen": -2.07682466506958,
"logits/rejected": -2.1273488998413086,
"logps/chosen": -0.286944180727005,
"logps/rejected": -0.2869289517402649,
"loss": 23.644794464111328,
"loss/core": 23.60843276977539,
"loss/preference_sft": 0.286944180727005,
"loss/reference_anchor": 0.4561174809932709,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 3.3612422943115234,
"rewards/margins": 1.6572866439819336,
"rewards/rejected": 1.703955888748169,
"step": 570
},
{
"drift/chosen_abs": 0.18439261615276337,
"drift/rejected_abs": 0.0657983049750328,
"epoch": 0.5493849277439389,
"grad_norm": 43.0,
"learning_rate": 2.1304764721759732e-07,
"logits/chosen": -2.1571121215820312,
"logits/rejected": -2.188605546951294,
"logps/chosen": -0.3006740212440491,
"logps/rejected": -0.32234296202659607,
"loss": 24.048736572265625,
"loss/core": 24.03409194946289,
"loss/preference_sft": 0.3006740212440491,
"loss/reference_anchor": 0.1651538759469986,
"rewards/accuracies": 0.8500000238418579,
"rewards/chosen": 1.8426148891448975,
"rewards/margins": 1.273414134979248,
"rewards/rejected": 0.569200873374939,
"step": 575
},
{
"drift/chosen_abs": 0.14222335815429688,
"drift/rejected_abs": 0.09565664827823639,
"epoch": 0.5541621879851905,
"grad_norm": 30.25,
"learning_rate": 2.0766262403774385e-07,
"logits/chosen": -2.4316046237945557,
"logits/rejected": -2.4871370792388916,
"logps/chosen": -0.26630157232284546,
"logps/rejected": -0.2813344895839691,
"loss": 24.60654067993164,
"loss/core": 24.598276138305664,
"loss/preference_sft": 0.26630157232284546,
"loss/reference_anchor": 0.08357779681682587,
"rewards/accuracies": 0.875,
"rewards/chosen": 1.4222335815429688,
"rewards/margins": 0.46712565422058105,
"rewards/rejected": 0.9551078677177429,
"step": 580
},
{
"drift/chosen_abs": 0.22317564487457275,
"drift/rejected_abs": 0.13778264820575714,
"epoch": 0.5589394482264421,
"grad_norm": 68.0,
"learning_rate": 2.0229775115586378e-07,
"logits/chosen": -2.1374573707580566,
"logits/rejected": -2.1010804176330566,
"logps/chosen": -0.26939648389816284,
"logps/rejected": -0.2822672426700592,
"loss": 24.302589416503906,
"loss/core": 24.24777603149414,
"loss/preference_sft": 0.26939648389816284,
"loss/reference_anchor": 0.7039062976837158,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 2.230914354324341,
"rewards/margins": 0.8574030995368958,
"rewards/rejected": 1.3735109567642212,
"step": 585
},
{
"drift/chosen_abs": 0.3644371032714844,
"drift/rejected_abs": 0.104056216776371,
"epoch": 0.5637167084676937,
"grad_norm": 51.0,
"learning_rate": 1.9695558196088844e-07,
"logits/chosen": -2.0276551246643066,
"logits/rejected": -2.1235756874084473,
"logps/chosen": -0.2852238714694977,
"logps/rejected": -0.2887842059135437,
"loss": 23.151445388793945,
"loss/core": 23.115150451660156,
"loss/preference_sft": 0.2852238714694977,
"loss/reference_anchor": 0.45538654923439026,
"rewards/accuracies": 0.9375,
"rewards/chosen": 3.6441140174865723,
"rewards/margins": 2.6299378871917725,
"rewards/rejected": 1.0141762495040894,
"step": 590
},
{
"drift/chosen_abs": 0.1715865433216095,
"drift/rejected_abs": 0.09020796418190002,
"epoch": 0.5684939687089454,
"grad_norm": 69.5,
"learning_rate": 1.9163865903602372e-07,
"logits/chosen": -2.0477294921875,
"logits/rejected": -2.0416600704193115,
"logps/chosen": -0.2748182415962219,
"logps/rejected": -0.27176275849342346,
"loss": 24.21047592163086,
"loss/core": 24.204145431518555,
"loss/preference_sft": 0.2748182415962219,
"loss/reference_anchor": 0.05691518262028694,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 1.7147114276885986,
"rewards/margins": 0.8242376446723938,
"rewards/rejected": 0.8904738426208496,
"step": 595
},
{
"drift/chosen_abs": 0.18755662441253662,
"drift/rejected_abs": 0.10950811952352524,
"epoch": 0.5732712289501971,
"grad_norm": 103.0,
"learning_rate": 1.8634951294861806e-07,
"logits/chosen": -2.2788078784942627,
"logits/rejected": -2.2681713104248047,
"logps/chosen": -0.266190767288208,
"logps/rejected": -0.2825302183628082,
"loss": 24.342437744140625,
"loss/core": 24.329063415527344,
"loss/preference_sft": 0.266190767288208,
"loss/reference_anchor": 0.15168902277946472,
"rewards/accuracies": 0.875,
"rewards/chosen": 1.8744417428970337,
"rewards/margins": 0.7936787009239197,
"rewards/rejected": 1.0807631015777588,
"step": 600
},
{
"drift/chosen_abs": 0.42088302969932556,
"drift/rejected_abs": 0.1206652969121933,
"epoch": 0.5780484891914487,
"grad_norm": 122.5,
"learning_rate": 1.810906610457502e-07,
"logits/chosen": -2.1177077293395996,
"logits/rejected": -2.1916587352752686,
"logps/chosen": -0.2778300940990448,
"logps/rejected": -0.275773286819458,
"loss": 23.372730255126953,
"loss/core": 23.302967071533203,
"loss/preference_sft": 0.2778300940990448,
"loss/reference_anchor": 0.9023693203926086,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 4.206851482391357,
"rewards/margins": 3.001718759536743,
"rewards/rejected": 1.2051331996917725,
"step": 605
},
{
"drift/chosen_abs": 0.4304037094116211,
"drift/rejected_abs": 0.19502094388008118,
"epoch": 0.5828257494327004,
"grad_norm": 145.0,
"learning_rate": 1.7586460625610726e-07,
"logits/chosen": -2.118242025375366,
"logits/rejected": -2.1343255043029785,
"logps/chosen": -0.27321526408195496,
"logps/rejected": -0.27437523007392883,
"loss": 23.397014617919922,
"loss/core": 23.323720932006836,
"loss/preference_sft": 0.27321526408195496,
"loss/reference_anchor": 0.9498865008354187,
"rewards/accuracies": 0.8500000238418579,
"rewards/chosen": 4.302402973175049,
"rewards/margins": 2.3571293354034424,
"rewards/rejected": 1.945273995399475,
"step": 610
},
{
"drift/chosen_abs": 0.27419549226760864,
"drift/rejected_abs": 0.1494186818599701,
"epoch": 0.587603009673952,
"grad_norm": 69.0,
"learning_rate": 1.70673835898727e-07,
"logits/chosen": -1.967576026916504,
"logits/rejected": -2.034571409225464,
"logps/chosen": -0.3140396773815155,
"logps/rejected": -0.3035440444946289,
"loss": 23.98012351989746,
"loss/core": 23.95610237121582,
"loss/preference_sft": 0.3140396773815155,
"loss/reference_anchor": 0.28889569640159607,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 2.739633321762085,
"rewards/margins": 1.2492014169692993,
"rewards/rejected": 1.4904316663742065,
"step": 615
},
{
"drift/chosen_abs": 0.16910451650619507,
"drift/rejected_abs": 0.14680986106395721,
"epoch": 0.5923802699152036,
"grad_norm": 61.25,
"learning_rate": 1.6552082049916824e-07,
"logits/chosen": -2.143625259399414,
"logits/rejected": -2.1699137687683105,
"logps/chosen": -0.286045640707016,
"logps/rejected": -0.2911421060562134,
"loss": 25.047000885009766,
"loss/core": 25.030277252197266,
"loss/preference_sft": 0.286045640707016,
"loss/reference_anchor": 0.19438524544239044,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 1.690314531326294,
"rewards/margins": 0.22506046295166016,
"rewards/rejected": 1.4652539491653442,
"step": 620
},
{
"drift/chosen_abs": 0.388736367225647,
"drift/rejected_abs": 0.1826535165309906,
"epoch": 0.5971575301564552,
"grad_norm": 95.5,
"learning_rate": 1.6040801261367493e-07,
"logits/chosen": -1.9324958324432373,
"logits/rejected": -1.961570143699646,
"logps/chosen": -0.304928719997406,
"logps/rejected": -0.33531856536865234,
"loss": 24.033096313476562,
"loss/core": 23.950403213500977,
"loss/preference_sft": 0.304928719997406,
"loss/reference_anchor": 1.0720922946929932,
"rewards/accuracies": 0.8500000238418579,
"rewards/chosen": 3.885380268096924,
"rewards/margins": 2.3656325340270996,
"rewards/rejected": 1.5197473764419556,
"step": 625
},
{
"drift/chosen_abs": 0.29494503140449524,
"drift/rejected_abs": 0.12427574396133423,
"epoch": 0.6019347903977069,
"grad_norm": 57.0,
"learning_rate": 1.5533784566189175e-07,
"logits/chosen": -1.9347823858261108,
"logits/rejected": -2.0498507022857666,
"logps/chosen": -0.27183371782302856,
"logps/rejected": -0.2836715281009674,
"loss": 23.67662239074707,
"loss/core": 23.64113998413086,
"loss/preference_sft": 0.27183371782302856,
"loss/reference_anchor": 0.4459313452243805,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 2.949350595474243,
"rewards/margins": 1.7082860469818115,
"rewards/rejected": 1.2410645484924316,
"step": 630
},
{
"drift/chosen_abs": 0.23291683197021484,
"drift/rejected_abs": 0.10206238925457001,
"epoch": 0.6067120506389586,
"grad_norm": 222.0,
"learning_rate": 1.5031273276868845e-07,
"logits/chosen": -1.984095573425293,
"logits/rejected": -2.0696752071380615,
"logps/chosen": -0.3027849495410919,
"logps/rejected": -0.2994707524776459,
"loss": 23.96482276916504,
"loss/core": 23.94552230834961,
"loss/preference_sft": 0.3027849495410919,
"loss/reference_anchor": 0.2270624190568924,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 2.327078342437744,
"rewards/margins": 1.3064545392990112,
"rewards/rejected": 1.0206239223480225,
"step": 635
},
{
"drift/chosen_abs": 0.1955791413784027,
"drift/rejected_abs": 0.08006999641656876,
"epoch": 0.6114893108802102,
"grad_norm": 49.5,
"learning_rate": 1.4533506561564305e-07,
"logits/chosen": -2.2103934288024902,
"logits/rejected": -2.2860031127929688,
"logps/chosen": -0.3017186224460602,
"logps/rejected": -0.2985337972640991,
"loss": 24.067489624023438,
"loss/core": 24.050811767578125,
"loss/preference_sft": 0.3017186224460602,
"loss/reference_anchor": 0.19217993319034576,
"rewards/accuracies": 0.9375,
"rewards/chosen": 1.9552767276763916,
"rewards/margins": 1.1555898189544678,
"rewards/rejected": 0.7996870279312134,
"step": 640
},
{
"drift/chosen_abs": 0.16859070956707,
"drift/rejected_abs": 0.12346317619085312,
"epoch": 0.6162665711214619,
"grad_norm": 117.5,
"learning_rate": 1.404072133027306e-07,
"logits/chosen": -2.1554760932922363,
"logits/rejected": -2.13128662109375,
"logps/chosen": -0.2895345687866211,
"logps/rejected": -0.2951858341693878,
"loss": 24.680572509765625,
"loss/core": 24.669631958007812,
"loss/preference_sft": 0.2895345687866211,
"loss/reference_anchor": 0.11693717539310455,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 1.6848987340927124,
"rewards/margins": 0.4532623291015625,
"rewards/rejected": 1.2316365242004395,
"step": 645
},
{
"drift/chosen_abs": 0.13376560807228088,
"drift/rejected_abs": 0.08641010522842407,
"epoch": 0.6210438313627135,
"grad_norm": 66.5,
"learning_rate": 1.3553152122076078e-07,
"logits/chosen": -2.2198781967163086,
"logits/rejected": -2.170907974243164,
"logps/chosen": -0.28950920701026917,
"logps/rejected": -0.2986505925655365,
"loss": 24.61799430847168,
"loss/core": 24.610118865966797,
"loss/preference_sft": 0.28950920701026917,
"loss/reference_anchor": 0.07604795694351196,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 1.3332895040512085,
"rewards/margins": 0.4888167381286621,
"rewards/rejected": 0.8444727063179016,
"step": 650
},
{
"drift/chosen_abs": 0.2010502815246582,
"drift/rejected_abs": 0.0992017537355423,
"epoch": 0.6258210916039652,
"grad_norm": 304.0,
"learning_rate": 1.3071030993509787e-07,
"logits/chosen": -2.059145450592041,
"logits/rejected": -2.1219570636749268,
"logps/chosen": -0.2817350924015045,
"logps/rejected": -0.28943654894828796,
"loss": 24.06000328063965,
"loss/core": 24.04839515686035,
"loss/preference_sft": 0.2817350924015045,
"loss/reference_anchor": 0.12662085890769958,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 2.009782314300537,
"rewards/margins": 1.0185507535934448,
"rewards/rejected": 0.9912316203117371,
"step": 655
},
{
"drift/chosen_abs": 0.2789165675640106,
"drift/rejected_abs": 0.1331566572189331,
"epoch": 0.6305983518452167,
"grad_norm": 45.75,
"learning_rate": 1.2594587408119804e-07,
"logits/chosen": -2.0298891067504883,
"logits/rejected": -2.0245847702026367,
"logps/chosen": -0.29279690980911255,
"logps/rejected": -0.30883678793907166,
"loss": 24.24443244934082,
"loss/core": 24.194019317626953,
"loss/preference_sft": 0.29279690980911255,
"loss/reference_anchor": 0.6429013609886169,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 2.7881667613983154,
"rewards/margins": 1.5086616277694702,
"rewards/rejected": 1.2795050144195557,
"step": 660
},
{
"drift/chosen_abs": 0.23610401153564453,
"drift/rejected_abs": 0.1503429114818573,
"epoch": 0.6353756120864684,
"grad_norm": 123.5,
"learning_rate": 1.2124048127248644e-07,
"logits/chosen": -2.188072681427002,
"logits/rejected": -2.164827823638916,
"logps/chosen": -0.28306499123573303,
"logps/rejected": -0.27927109599113464,
"loss": 24.441707611083984,
"loss/core": 24.4201717376709,
"loss/preference_sft": 0.28306499123573303,
"loss/reference_anchor": 0.25882014632225037,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 2.3602824211120605,
"rewards/margins": 0.8587505221366882,
"rewards/rejected": 1.5015321969985962,
"step": 665
},
{
"drift/chosen_abs": 0.3666432499885559,
"drift/rejected_abs": 0.1319333016872406,
"epoch": 0.64015287232772,
"grad_norm": 44.0,
"learning_rate": 1.1659637102109712e-07,
"logits/chosen": -1.9824602603912354,
"logits/rejected": -2.0293171405792236,
"logps/chosen": -0.2721920907497406,
"logps/rejected": -0.31627121567726135,
"loss": 23.281818389892578,
"loss/core": 23.24245834350586,
"loss/preference_sft": 0.2721920907497406,
"loss/reference_anchor": 0.49754709005355835,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": 3.666236162185669,
"rewards/margins": 2.3700363636016846,
"rewards/rejected": 1.2962002754211426,
"step": 670
},
{
"drift/chosen_abs": 0.162507563829422,
"drift/rejected_abs": 0.09013229608535767,
"epoch": 0.6449301325689717,
"grad_norm": 93.0,
"learning_rate": 1.1201575367198546e-07,
"logits/chosen": -2.038818359375,
"logits/rejected": -2.0799050331115723,
"logps/chosen": -0.28820866346359253,
"logps/rejected": -0.28691327571868896,
"loss": 24.332555770874023,
"loss/core": 24.325624465942383,
"loss/preference_sft": 0.28820866346359253,
"loss/reference_anchor": 0.06361403316259384,
"rewards/accuracies": 0.875,
"rewards/chosen": 1.6243938207626343,
"rewards/margins": 0.730514645576477,
"rewards/rejected": 0.893879234790802,
"step": 675
},
{
"drift/chosen_abs": 0.2139333039522171,
"drift/rejected_abs": 0.13963082432746887,
"epoch": 0.6497073928102234,
"grad_norm": 43.75,
"learning_rate": 1.0750080935092423e-07,
"logits/chosen": -2.1613402366638184,
"logits/rejected": -2.079357385635376,
"logps/chosen": -0.28284314274787903,
"logps/rejected": -0.2906249463558197,
"loss": 24.423181533813477,
"loss/core": 24.4051456451416,
"loss/preference_sft": 0.28284314274787903,
"loss/reference_anchor": 0.2122153490781784,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 2.1380627155303955,
"rewards/margins": 0.7430015802383423,
"rewards/rejected": 1.3950612545013428,
"step": 680
},
{
"drift/chosen_abs": 0.28872284293174744,
"drift/rejected_abs": 0.15741479396820068,
"epoch": 0.654484653051475,
"grad_norm": 57.25,
"learning_rate": 1.0305368692688174e-07,
"logits/chosen": -2.088265895843506,
"logits/rejected": -2.072359561920166,
"logps/chosen": -0.253498375415802,
"logps/rejected": -0.2732449471950531,
"loss": 24.38766098022461,
"loss/core": 24.349506378173828,
"loss/preference_sft": 0.253498375415802,
"loss/reference_anchor": 0.4833889901638031,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 2.8872287273406982,
"rewards/margins": 1.3145825862884521,
"rewards/rejected": 1.5726460218429565,
"step": 685
},
{
"drift/chosen_abs": 0.17745468020439148,
"drift/rejected_abs": 0.1100490465760231,
"epoch": 0.6592619132927267,
"grad_norm": 51.5,
"learning_rate": 9.867650298927643e-08,
"logits/chosen": -1.8866245746612549,
"logits/rejected": -1.9085317850112915,
"logps/chosen": -0.307719886302948,
"logps/rejected": -0.32763782143592834,
"loss": 24.435400009155273,
"loss/core": 24.425445556640625,
"loss/preference_sft": 0.307719886302948,
"loss/reference_anchor": 0.10196495056152344,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 1.7728378772735596,
"rewards/margins": 0.6770357489585876,
"rewards/rejected": 1.0958020687103271,
"step": 690
},
{
"drift/chosen_abs": 0.1973785161972046,
"drift/rejected_abs": 0.06951657682657242,
"epoch": 0.6640391735339782,
"grad_norm": 65.5,
"learning_rate": 9.437134084059515e-08,
"logits/chosen": -2.272217273712158,
"logits/rejected": -2.280867576599121,
"logps/chosen": -0.3060583770275116,
"logps/rejected": -0.29238781332969666,
"loss": 24.02126121520996,
"loss/core": 24.004791259765625,
"loss/preference_sft": 0.3060583770275116,
"loss/reference_anchor": 0.18900753557682037,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 1.972781777381897,
"rewards/margins": 1.285192847251892,
"rewards/rejected": 0.6875890493392944,
"step": 695
},
{
"drift/chosen_abs": 0.22317072749137878,
"drift/rejected_abs": 0.16237227618694305,
"epoch": 0.6688164337752299,
"grad_norm": 1552.0,
"learning_rate": 9.014024950485383e-08,
"logits/chosen": -2.1077773571014404,
"logits/rejected": -2.214353561401367,
"logps/chosen": -0.29673534631729126,
"logps/rejected": -0.3178013861179352,
"loss": 24.56673240661621,
"loss/core": 24.545368194580078,
"loss/preference_sft": 0.29673534631729126,
"loss/reference_anchor": 0.25515273213386536,
"rewards/accuracies": 0.875,
"rewards/chosen": 2.231229305267334,
"rewards/margins": 0.6277844309806824,
"rewards/rejected": 1.603445053100586,
"step": 700
},
{
"drift/chosen_abs": 0.341328501701355,
"drift/rejected_abs": 0.15423105657100677,
"epoch": 0.6735936940164815,
"grad_norm": 132.0,
"learning_rate": 8.598524275237321e-08,
"logits/chosen": -2.1965928077697754,
"logits/rejected": -2.154327630996704,
"logps/chosen": -0.27952122688293457,
"logps/rejected": -0.2664346396923065,
"loss": 23.59442138671875,
"loss/core": 23.561824798583984,
"loss/preference_sft": 0.27952122688293457,
"loss/reference_anchor": 0.40662726759910583,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 3.412951946258545,
"rewards/margins": 1.871299386024475,
"rewards/rejected": 1.5416524410247803,
"step": 705
},
{
"drift/chosen_abs": 0.3609875440597534,
"drift/rejected_abs": 0.19022467732429504,
"epoch": 0.6783709542577332,
"grad_norm": 576.0,
"learning_rate": 8.190829814133293e-08,
"logits/chosen": -1.8862717151641846,
"logits/rejected": -1.87451171875,
"logps/chosen": -0.2760660648345947,
"logps/rejected": -0.2974444329738617,
"loss": 23.68022346496582,
"loss/core": 23.627628326416016,
"loss/preference_sft": 0.2760660648345947,
"loss/reference_anchor": 0.6736692786216736,
"rewards/accuracies": 0.8374999761581421,
"rewards/chosen": 3.608205795288086,
"rewards/margins": 1.707396149635315,
"rewards/rejected": 1.90080988407135,
"step": 710
},
{
"drift/chosen_abs": 0.18668507039546967,
"drift/rejected_abs": 0.07842984795570374,
"epoch": 0.6831482144989849,
"grad_norm": 57.25,
"learning_rate": 7.791135607656146e-08,
"logits/chosen": -2.2538669109344482,
"logits/rejected": -2.2352232933044434,
"logps/chosen": -0.28401559591293335,
"logps/rejected": -0.3294680714607239,
"loss": 24.112934112548828,
"loss/core": 24.091781616210938,
"loss/preference_sft": 0.28401559591293335,
"loss/reference_anchor": 0.25365859270095825,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 1.8665748834609985,
"rewards/margins": 1.0951749086380005,
"rewards/rejected": 0.771399974822998,
"step": 715
},
{
"drift/chosen_abs": 0.21051010489463806,
"drift/rejected_abs": 0.1500566005706787,
"epoch": 0.6879254747402365,
"grad_norm": 136.0,
"learning_rate": 7.399631888600796e-08,
"logits/chosen": -1.9951555728912354,
"logits/rejected": -2.00339674949646,
"logps/chosen": -0.2962464392185211,
"logps/rejected": -0.30031222105026245,
"loss": 24.666812896728516,
"loss/core": 24.645822525024414,
"loss/preference_sft": 0.2962464392185211,
"loss/reference_anchor": 0.25020235776901245,
"rewards/accuracies": 0.800000011920929,
"rewards/chosen": 2.1030123233795166,
"rewards/margins": 0.6037241816520691,
"rewards/rejected": 1.4992883205413818,
"step": 720
},
{
"drift/chosen_abs": 0.15870442986488342,
"drift/rejected_abs": 0.07348223030567169,
"epoch": 0.6927027349814882,
"grad_norm": 66.5,
"learning_rate": 7.016504991533726e-08,
"logits/chosen": -2.1241562366485596,
"logits/rejected": -2.2400271892547607,
"logps/chosen": -0.28562217950820923,
"logps/rejected": -0.2771227955818176,
"loss": 24.232282638549805,
"loss/core": 24.223468780517578,
"loss/preference_sft": 0.28562217950820923,
"loss/reference_anchor": 0.08894944936037064,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 1.5855097770690918,
"rewards/margins": 0.8525517582893372,
"rewards/rejected": 0.7329580783843994,
"step": 725
},
{
"drift/chosen_abs": 0.102408766746521,
"drift/rejected_abs": 0.08807560056447983,
"epoch": 0.6974799952227397,
"grad_norm": 956.0,
"learning_rate": 6.641937264107867e-08,
"logits/chosen": -2.2225677967071533,
"logits/rejected": -2.271383285522461,
"logps/chosen": -0.28616029024124146,
"logps/rejected": -0.293459951877594,
"loss": 24.99797821044922,
"loss/core": 24.98850440979004,
"loss/preference_sft": 0.28616029024124146,
"loss/reference_anchor": 0.09770476073026657,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 1.022210717201233,
"rewards/margins": 0.14174190163612366,
"rewards/rejected": 0.8804686665534973,
"step": 730
},
{
"drift/chosen_abs": 0.1421697437763214,
"drift/rejected_abs": 0.06707651913166046,
"epoch": 0.7022572554639914,
"grad_norm": 119.0,
"learning_rate": 6.276106980274944e-08,
"logits/chosen": -2.0496909618377686,
"logits/rejected": -2.097294330596924,
"logps/chosen": -0.31965214014053345,
"logps/rejected": -0.31716209650039673,
"loss": 24.297515869140625,
"loss/core": 24.289684295654297,
"loss/preference_sft": 0.31965214014053345,
"loss/reference_anchor": 0.07245230674743652,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": 1.4212677478790283,
"rewards/margins": 0.7517526149749756,
"rewards/rejected": 0.6695151329040527,
"step": 735
},
{
"drift/chosen_abs": 0.2564278841018677,
"drift/rejected_abs": 0.18303130567073822,
"epoch": 0.707034515705243,
"grad_norm": 71.0,
"learning_rate": 5.919188255436777e-08,
"logits/chosen": -2.1012163162231445,
"logits/rejected": -2.1193010807037354,
"logps/chosen": -0.3130371868610382,
"logps/rejected": -0.3160560727119446,
"loss": 25.59921646118164,
"loss/core": 25.540393829345703,
"loss/preference_sft": 0.3130371868610382,
"loss/reference_anchor": 0.7530360221862793,
"rewards/accuracies": 0.875,
"rewards/chosen": 2.564279079437256,
"rewards/margins": 0.7340623736381531,
"rewards/rejected": 1.830216646194458,
"step": 740
},
{
"drift/chosen_abs": 0.3141566514968872,
"drift/rejected_abs": 0.15219292044639587,
"epoch": 0.7118117759464947,
"grad_norm": 126.0,
"learning_rate": 5.571350963575727e-08,
"logits/chosen": -2.0531277656555176,
"logits/rejected": -2.09647798538208,
"logps/chosen": -0.2884739339351654,
"logps/rejected": -0.2817172408103943,
"loss": 23.735965728759766,
"loss/core": 23.71042823791504,
"loss/preference_sft": 0.2884739339351654,
"loss/reference_anchor": 0.3116436302661896,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 3.141024351119995,
"rewards/margins": 1.6229345798492432,
"rewards/rejected": 1.5180898904800415,
"step": 745
},
{
"drift/chosen_abs": 0.12072908878326416,
"drift/rejected_abs": 0.12682561576366425,
"epoch": 0.7165890361877463,
"grad_norm": 340.0,
"learning_rate": 5.232760656403923e-08,
"logits/chosen": -2.1889564990997314,
"logits/rejected": -2.1800601482391357,
"logps/chosen": -0.3116965889930725,
"logps/rejected": -0.3028327226638794,
"loss": 25.507654190063477,
"loss/core": 25.483829498291016,
"loss/preference_sft": 0.3116965889930725,
"loss/reference_anchor": 0.28652527928352356,
"rewards/accuracies": 0.8374999761581421,
"rewards/chosen": 1.2060551643371582,
"rewards/margins": -0.05827074497938156,
"rewards/rejected": 1.2643258571624756,
"step": 750
},
{
"drift/chosen_abs": 0.24006719887256622,
"drift/rejected_abs": 0.17291317880153656,
"epoch": 0.721366296428998,
"grad_norm": 133.0,
"learning_rate": 4.9035784845695675e-08,
"logits/chosen": -1.9279276132583618,
"logits/rejected": -1.8381156921386719,
"logps/chosen": -0.3074774742126465,
"logps/rejected": -0.29301613569259644,
"loss": 24.52367401123047,
"loss/core": 24.506526947021484,
"loss/preference_sft": 0.3074774742126465,
"loss/reference_anchor": 0.19787776470184326,
"rewards/accuracies": 0.800000011920929,
"rewards/chosen": 2.3972103595733643,
"rewards/margins": 0.6746050715446472,
"rewards/rejected": 1.7226054668426514,
"step": 755
},
{
"drift/chosen_abs": 0.19889570772647858,
"drift/rejected_abs": 0.08718482404947281,
"epoch": 0.7261435566702497,
"grad_norm": 64.0,
"learning_rate": 4.583961120958027e-08,
"logits/chosen": -2.186131715774536,
"logits/rejected": -2.203399419784546,
"logps/chosen": -0.30299732089042664,
"logps/rejected": -0.29353067278862,
"loss": 24.01272964477539,
"loss/core": 24.000045776367188,
"loss/preference_sft": 0.30299732089042664,
"loss/reference_anchor": 0.13879242539405823,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 1.9878475666046143,
"rewards/margins": 1.1234432458877563,
"rewards/rejected": 0.8644043803215027,
"step": 760
},
{
"drift/chosen_abs": 0.1797488033771515,
"drift/rejected_abs": 0.1066058874130249,
"epoch": 0.7309208169115012,
"grad_norm": 106.5,
"learning_rate": 4.2740606861239594e-08,
"logits/chosen": -2.08768892288208,
"logits/rejected": -2.158001184463501,
"logps/chosen": -0.275774210691452,
"logps/rejected": -0.27186232805252075,
"loss": 24.34197425842285,
"loss/core": 24.330942153930664,
"loss/preference_sft": 0.275774210691452,
"loss/reference_anchor": 0.11952831596136093,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 1.7971556186676025,
"rewards/margins": 0.7334049344062805,
"rewards/rejected": 1.0637508630752563,
"step": 765
},
{
"drift/chosen_abs": 0.3747478127479553,
"drift/rejected_abs": 0.2356497049331665,
"epoch": 0.7356980771527529,
"grad_norm": 222.0,
"learning_rate": 3.974024675890189e-08,
"logits/chosen": -1.9823691844940186,
"logits/rejected": -1.9497228860855103,
"logps/chosen": -0.3086339831352234,
"logps/rejected": -0.28454282879829407,
"loss": 24.525297164916992,
"loss/core": 24.43834114074707,
"loss/preference_sft": 0.3086339831352234,
"loss/reference_anchor": 1.1285443305969238,
"rewards/accuracies": 0.8500000238418579,
"rewards/chosen": 3.744788408279419,
"rewards/margins": 1.3908659219741821,
"rewards/rejected": 2.3539223670959473,
"step": 770
},
{
"drift/chosen_abs": 0.15283748507499695,
"drift/rejected_abs": 0.09471901506185532,
"epoch": 0.7404753373940045,
"grad_norm": 32.75,
"learning_rate": 3.683995891147695e-08,
"logits/chosen": -2.0964419841766357,
"logits/rejected": -2.1264514923095703,
"logps/chosen": -0.30610623955726624,
"logps/rejected": -0.29977482557296753,
"loss": 24.4835147857666,
"loss/core": 24.475711822509766,
"loss/preference_sft": 0.30610623955726624,
"loss/reference_anchor": 0.0734710842370987,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 1.5278440713882446,
"rewards/margins": 0.5806539058685303,
"rewards/rejected": 0.9471901059150696,
"step": 775
},
{
"drift/chosen_abs": 0.1896996945142746,
"drift/rejected_abs": 0.13039933145046234,
"epoch": 0.7452525976352562,
"grad_norm": 102.5,
"learning_rate": 3.404112369890108e-08,
"logits/chosen": -2.1795246601104736,
"logits/rejected": -2.1940202713012695,
"logps/chosen": -0.3016170859336853,
"logps/rejected": -0.30035489797592163,
"loss": 24.48188018798828,
"loss/core": 24.470382690429688,
"loss/preference_sft": 0.3016170859336853,
"loss/reference_anchor": 0.1231255754828453,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 1.8962314128875732,
"rewards/margins": 0.5943207144737244,
"rewards/rejected": 1.3019107580184937,
"step": 780
},
{
"drift/chosen_abs": 0.3444829285144806,
"drift/rejected_abs": 0.13935281336307526,
"epoch": 0.7500298578765078,
"grad_norm": 42.5,
"learning_rate": 3.134507321515106e-08,
"logits/chosen": -1.9970579147338867,
"logits/rejected": -1.953643560409546,
"logps/chosen": -0.30979782342910767,
"logps/rejected": -0.2892361879348755,
"loss": 24.037694931030273,
"loss/core": 23.987783432006836,
"loss/preference_sft": 0.30979782342910767,
"loss/reference_anchor": 0.6345094442367554,
"rewards/accuracies": 0.8500000238418579,
"rewards/chosen": 3.4429678916931152,
"rewards/margins": 2.0524790287017822,
"rewards/rejected": 1.390488862991333,
"step": 785
},
{
"drift/chosen_abs": 0.26237040758132935,
"drift/rejected_abs": 0.19609911739826202,
"epoch": 0.7548071181177595,
"grad_norm": 780.0,
"learning_rate": 2.875309063423956e-08,
"logits/chosen": -2.1686906814575195,
"logits/rejected": -1.9951951503753662,
"logps/chosen": -0.28583893179893494,
"logps/rejected": -0.315361887216568,
"loss": 24.721479415893555,
"loss/core": 24.67513656616211,
"loss/preference_sft": 0.28583893179893494,
"loss/reference_anchor": 0.5893004536628723,
"rewards/accuracies": 0.8500000238418579,
"rewards/chosen": 2.6218254566192627,
"rewards/margins": 0.6629058122634888,
"rewards/rejected": 1.9589197635650635,
"step": 790
},
{
"drift/chosen_abs": 0.24005870521068573,
"drift/rejected_abs": 0.11813025176525116,
"epoch": 0.7595843783590112,
"grad_norm": 140.0,
"learning_rate": 2.626640959949375e-08,
"logits/chosen": -1.971401572227478,
"logits/rejected": -1.991015076637268,
"logps/chosen": -0.30549412965774536,
"logps/rejected": -0.296720415353775,
"loss": 24.04024887084961,
"loss/core": 23.997535705566406,
"loss/preference_sft": 0.30549412965774536,
"loss/reference_anchor": 0.5389922857284546,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 2.399735927581787,
"rewards/margins": 1.2197308540344238,
"rewards/rejected": 1.1800049543380737,
"step": 795
},
{
"drift/chosen_abs": 0.2291211634874344,
"drift/rejected_abs": 0.12003247439861298,
"epoch": 0.7643616386002627,
"grad_norm": 59.75,
"learning_rate": 2.388621363640797e-08,
"logits/chosen": -2.1559276580810547,
"logits/rejected": -2.1329169273376465,
"logps/chosen": -0.28992101550102234,
"logps/rejected": -0.2854466736316681,
"loss": 24.079273223876953,
"loss/core": 24.065502166748047,
"loss/preference_sft": 0.28992101550102234,
"loss/reference_anchor": 0.15460558235645294,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 2.290127754211426,
"rewards/margins": 1.0904570817947388,
"rewards/rejected": 1.1996705532073975,
"step": 800
},
{
"drift/chosen_abs": 0.22606876492500305,
"drift/rejected_abs": 0.2016010731458664,
"epoch": 0.7691388988415144,
"grad_norm": 104.0,
"learning_rate": 2.1613635589349756e-08,
"logits/chosen": -2.028775453567505,
"logits/rejected": -2.0167717933654785,
"logps/chosen": -0.2745590806007385,
"logps/rejected": -0.2676575779914856,
"loss": 24.971622467041016,
"loss/core": 24.949968338012695,
"loss/preference_sft": 0.2745590806007385,
"loss/reference_anchor": 0.2612423002719879,
"rewards/accuracies": 0.824999988079071,
"rewards/chosen": 2.2601115703582764,
"rewards/margins": 0.24478550255298615,
"rewards/rejected": 2.0153260231018066,
"step": 805
},
{
"drift/chosen_abs": 0.15367405116558075,
"drift/rejected_abs": 0.14802715182304382,
"epoch": 0.773916159082766,
"grad_norm": 51.5,
"learning_rate": 1.944975708238708e-08,
"logits/chosen": -2.2288622856140137,
"logits/rejected": -2.1330811977386475,
"logps/chosen": -0.30788537859916687,
"logps/rejected": -0.31650078296661377,
"loss": 25.090599060058594,
"loss/core": 25.078384399414062,
"loss/preference_sft": 0.30788537859916687,
"loss/reference_anchor": 0.13205906748771667,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 1.534415364265442,
"rewards/margins": 0.05462510138750076,
"rewards/rejected": 1.4797903299331665,
"step": 810
},
{
"drift/chosen_abs": 0.2130316197872162,
"drift/rejected_abs": 0.11016812175512314,
"epoch": 0.7786934193240177,
"grad_norm": 145.0,
"learning_rate": 1.7395608004493884e-08,
"logits/chosen": -2.0962109565734863,
"logits/rejected": -2.1853909492492676,
"logps/chosen": -0.2830978333950043,
"logps/rejected": -0.2838820815086365,
"loss": 24.020706176757812,
"loss/core": 24.00937843322754,
"loss/preference_sft": 0.2830978333950043,
"loss/reference_anchor": 0.12274503707885742,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 2.1303162574768066,
"rewards/margins": 1.032294750213623,
"rewards/rejected": 1.0980216264724731,
"step": 815
},
{
"drift/chosen_abs": 0.1970573216676712,
"drift/rejected_abs": 0.07308342307806015,
"epoch": 0.7834706795652693,
"grad_norm": 45.25,
"learning_rate": 1.5452166019378987e-08,
"logits/chosen": -2.099004030227661,
"logits/rejected": -2.1342720985412598,
"logps/chosen": -0.2875714898109436,
"logps/rejected": -0.31725940108299255,
"loss": 23.889062881469727,
"loss/core": 23.877830505371094,
"loss/preference_sft": 0.2875714898109436,
"loss/reference_anchor": 0.12097527086734772,
"rewards/accuracies": 0.8500000238418579,
"rewards/chosen": 1.9672977924346924,
"rewards/margins": 1.2818208932876587,
"rewards/rejected": 0.685477077960968,
"step": 820
},
{
"drift/chosen_abs": 0.2467678040266037,
"drift/rejected_abs": 0.12167330831289291,
"epoch": 0.788247939806521,
"grad_norm": 183.0,
"learning_rate": 1.3620356100170788e-08,
"logits/chosen": -2.1444103717803955,
"logits/rejected": -2.247798442840576,
"logps/chosen": -0.3017248809337616,
"logps/rejected": -0.28473973274230957,
"loss": 23.85074234008789,
"loss/core": 23.836971282958984,
"loss/preference_sft": 0.3017248809337616,
"loss/reference_anchor": 0.15346962213516235,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": 2.466996669769287,
"rewards/margins": 1.2521899938583374,
"rewards/rejected": 1.2148066759109497,
"step": 825
},
{
"drift/chosen_abs": 0.17280618846416473,
"drift/rejected_abs": 0.16574548184871674,
"epoch": 0.7930252000477725,
"grad_norm": 91.0,
"learning_rate": 1.190105008918041e-08,
"logits/chosen": -2.1808249950408936,
"logits/rejected": -2.1297428607940674,
"logps/chosen": -0.2784227430820465,
"logps/rejected": -0.30759522318840027,
"loss": 25.10189437866211,
"loss/core": 25.08694839477539,
"loss/preference_sft": 0.2784227430820465,
"loss/reference_anchor": 0.17144832015037537,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 1.7274526357650757,
"rewards/margins": 0.07077233493328094,
"rewards/rejected": 1.6566804647445679,
"step": 830
},
{
"drift/chosen_abs": 0.24050016701221466,
"drift/rejected_abs": 0.11438360065221786,
"epoch": 0.7978024602890242,
"grad_norm": 58.75,
"learning_rate": 1.0295066282951737e-08,
"logits/chosen": -2.096271276473999,
"logits/rejected": -2.096055507659912,
"logps/chosen": -0.2547900378704071,
"logps/rejected": -0.3017795979976654,
"loss": 23.816970825195312,
"loss/core": 23.80051040649414,
"loss/preference_sft": 0.2547900378704071,
"loss/reference_anchor": 0.19398611783981323,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 2.4034855365753174,
"rewards/margins": 1.5796620845794678,
"rewards/rejected": 0.8238231539726257,
"step": 835
},
{
"drift/chosen_abs": 0.28091713786125183,
"drift/rejected_abs": 0.10494539886713028,
"epoch": 0.8025797205302759,
"grad_norm": 796.0,
"learning_rate": 8.803169042796765e-09,
"logits/chosen": -2.0359435081481934,
"logits/rejected": -2.085045576095581,
"logps/chosen": -0.3219825327396393,
"logps/rejected": -0.3002759516239166,
"loss": 23.931066513061523,
"loss/core": 23.892078399658203,
"loss/preference_sft": 0.3219825327396393,
"loss/reference_anchor": 0.4876865744590759,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 2.8080499172210693,
"rewards/margins": 1.7595913410186768,
"rewards/rejected": 1.0484585762023926,
"step": 840
},
{
"drift/chosen_abs": 0.141829252243042,
"drift/rejected_abs": 0.06329073011875153,
"epoch": 0.8073569807715275,
"grad_norm": 54.5,
"learning_rate": 7.4260684310008815e-09,
"logits/chosen": -2.1739792823791504,
"logits/rejected": -2.248871326446533,
"logps/chosen": -0.29366642236709595,
"logps/rejected": -0.3113446831703186,
"loss": 24.187685012817383,
"loss/core": 24.17953109741211,
"loss/preference_sft": 0.29366642236709595,
"loss/reference_anchor": 0.07929544895887375,
"rewards/accuracies": 0.9375,
"rewards/chosen": 1.4174824953079224,
"rewards/margins": 0.963509202003479,
"rewards/rejected": 0.45397335290908813,
"step": 845
},
{
"drift/chosen_abs": 0.15600529313087463,
"drift/rejected_abs": 0.09067943692207336,
"epoch": 0.8121342410127792,
"grad_norm": 314.0,
"learning_rate": 6.164419872871835e-09,
"logits/chosen": -2.2953596115112305,
"logits/rejected": -2.3431358337402344,
"logps/chosen": -0.2520250082015991,
"logps/rejected": -0.24778322875499725,
"loss": 24.37624168395996,
"loss/core": 24.37070083618164,
"loss/preference_sft": 0.2520250082015991,
"loss/reference_anchor": 0.04869046062231064,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 1.5578166246414185,
"rewards/margins": 0.6599420309066772,
"rewards/rejected": 0.8978745341300964,
"step": 850
},
{
"drift/chosen_abs": 0.27003389596939087,
"drift/rejected_abs": 0.12391098588705063,
"epoch": 0.8169115012540308,
"grad_norm": 143.0,
"learning_rate": 5.018823844792602e-09,
"logits/chosen": -2.0034213066101074,
"logits/rejected": -2.040942668914795,
"logps/chosen": -0.2998163104057312,
"logps/rejected": -0.2942708730697632,
"loss": 23.890283584594727,
"loss/core": 23.85587501525879,
"loss/preference_sft": 0.2998163104057312,
"loss/reference_anchor": 0.42880433797836304,
"rewards/accuracies": 0.875,
"rewards/chosen": 2.6989176273345947,
"rewards/margins": 1.4601688385009766,
"rewards/rejected": 1.2387486696243286,
"step": 855
},
{
"drift/chosen_abs": 0.409585177898407,
"drift/rejected_abs": 0.19676879048347473,
"epoch": 0.8216887614952825,
"grad_norm": 37.25,
"learning_rate": 3.989825588427281e-09,
"logits/chosen": -1.9499990940093994,
"logits/rejected": -2.038193702697754,
"logps/chosen": -0.2986469268798828,
"logps/rejected": -0.2962108850479126,
"loss": 23.53319549560547,
"loss/core": 23.46843910217285,
"loss/preference_sft": 0.2986469268798828,
"loss/reference_anchor": 0.8335119485855103,
"rewards/accuracies": 0.875,
"rewards/chosen": 4.0953145027160645,
"rewards/margins": 2.138956308364868,
"rewards/rejected": 1.956358551979065,
"step": 860
},
{
"drift/chosen_abs": 0.24526743590831757,
"drift/rejected_abs": 0.15863600373268127,
"epoch": 0.826466021736534,
"grad_norm": 85.5,
"learning_rate": 3.077914851215585e-09,
"logits/chosen": -1.95840585231781,
"logits/rejected": -2.0312142372131348,
"logps/chosen": -0.29089808464050293,
"logps/rejected": -0.29388031363487244,
"loss": 24.42396354675293,
"loss/core": 24.399206161499023,
"loss/preference_sft": 0.29089808464050293,
"loss/reference_anchor": 0.30098140239715576,
"rewards/accuracies": 0.8374999761581421,
"rewards/chosen": 2.4520413875579834,
"rewards/margins": 0.8663004040718079,
"rewards/rejected": 1.5857408046722412,
"step": 865
},
{
"drift/chosen_abs": 0.3167889714241028,
"drift/rejected_abs": 0.09579071402549744,
"epoch": 0.8312432819777857,
"grad_norm": 91.0,
"learning_rate": 2.2835256532794387e-09,
"logits/chosen": -2.1105716228485107,
"logits/rejected": -2.119257926940918,
"logps/chosen": -0.3130267262458801,
"logps/rejected": -0.2952987551689148,
"loss": 23.687124252319336,
"loss/core": 23.64649772644043,
"loss/preference_sft": 0.3130267262458801,
"loss/reference_anchor": 0.5103899240493774,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 3.165898561477661,
"rewards/margins": 2.2113327980041504,
"rewards/rejected": 0.9545663595199585,
"step": 870
},
{
"drift/chosen_abs": 0.1863785833120346,
"drift/rejected_abs": 0.10340656340122223,
"epoch": 0.8360205422190374,
"grad_norm": 66.0,
"learning_rate": 1.6070360808531359e-09,
"logits/chosen": -2.1814465522766113,
"logits/rejected": -2.22865891456604,
"logps/chosen": -0.3077881932258606,
"logps/rejected": -0.3306838274002075,
"loss": 24.516956329345703,
"loss/core": 24.487125396728516,
"loss/preference_sft": 0.3077881932258606,
"loss/reference_anchor": 0.36692848801612854,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 1.8635761737823486,
"rewards/margins": 0.8385453224182129,
"rewards/rejected": 1.0250307321548462,
"step": 875
},
{
"drift/chosen_abs": 0.24594731628894806,
"drift/rejected_abs": 0.18863597512245178,
"epoch": 0.840797802460289,
"grad_norm": 194.0,
"learning_rate": 1.0487681063345854e-09,
"logits/chosen": -2.1177544593811035,
"logits/rejected": -2.1003167629241943,
"logps/chosen": -0.2906046509742737,
"logps/rejected": -0.3307008743286133,
"loss": 25.163158416748047,
"loss/core": 25.12496566772461,
"loss/preference_sft": 0.2906046509742737,
"loss/reference_anchor": 0.4801712930202484,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 2.458425521850586,
"rewards/margins": 0.6850012540817261,
"rewards/rejected": 1.7734243869781494,
"step": 880
},
{
"drift/chosen_abs": 0.27374953031539917,
"drift/rejected_abs": 0.11317259073257446,
"epoch": 0.8455750627015407,
"grad_norm": 96.0,
"learning_rate": 6.089874350439505e-10,
"logits/chosen": -2.0427865982055664,
"logits/rejected": -2.1189193725585938,
"logps/chosen": -0.2813889980316162,
"logps/rejected": -0.2768685817718506,
"loss": 23.570148468017578,
"loss/core": 23.551849365234375,
"loss/preference_sft": 0.2813889980316162,
"loss/reference_anchor": 0.215844064950943,
"rewards/accuracies": 0.9375,
"rewards/chosen": 2.7366836071014404,
"rewards/margins": 1.611907958984375,
"rewards/rejected": 1.1247756481170654,
"step": 885
},
{
"drift/chosen_abs": 0.246209055185318,
"drift/rejected_abs": 0.1439971625804901,
"epoch": 0.8503523229427923,
"grad_norm": 130.0,
"learning_rate": 2.8790337876233305e-10,
"logits/chosen": -1.9758459329605103,
"logits/rejected": -2.097522735595703,
"logps/chosen": -0.29943814873695374,
"logps/rejected": -0.27435192465782166,
"loss": 24.266326904296875,
"loss/core": 24.23988914489746,
"loss/preference_sft": 0.29943814873695374,
"loss/reference_anchor": 0.3225429058074951,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": 2.461657762527466,
"rewards/margins": 1.0233776569366455,
"rewards/rejected": 1.4382802248001099,
"step": 890
},
{
"drift/chosen_abs": 0.23041865229606628,
"drift/rejected_abs": 0.15222403407096863,
"epoch": 0.855129583184044,
"grad_norm": 172.0,
"learning_rate": 8.566875611068503e-11,
"logits/chosen": -2.044543504714966,
"logits/rejected": -2.07798433303833,
"logps/chosen": -0.27221474051475525,
"logps/rejected": -0.2905210852622986,
"loss": 24.323848724365234,
"loss/core": 24.309627532958984,
"loss/preference_sft": 0.27221474051475525,
"loss/reference_anchor": 0.162424698472023,
"rewards/accuracies": 0.8374999761581421,
"rewards/chosen": 2.3031530380249023,
"rewards/margins": 0.7896323800086975,
"rewards/rejected": 1.51352059841156,
"step": 895
},
{
"drift/chosen_abs": 0.31285884976387024,
"drift/rejected_abs": 0.08625397086143494,
"epoch": 0.8599068434252956,
"grad_norm": 135.0,
"learning_rate": 2.3798198163782478e-12,
"logits/chosen": -2.055809736251831,
"logits/rejected": -2.176356315612793,
"logps/chosen": -0.2678307294845581,
"logps/rejected": -0.268280953168869,
"loss": 23.679527282714844,
"loss/core": 23.63846778869629,
"loss/preference_sft": 0.2678307294845581,
"loss/reference_anchor": 0.5206762552261353,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": 3.1283411979675293,
"rewards/margins": 2.278930187225342,
"rewards/rejected": 0.8494111895561218,
"step": 900
},
{
"epoch": 0.8599068434252956,
"step": 900,
"total_flos": 0.0,
"train_loss": 24.184869588216145,
"train_runtime": 7109.0777,
"train_samples_per_second": 2.026,
"train_steps_per_second": 0.127
}
],
"logging_steps": 5,
"max_steps": 900,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 900,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}