Files
ronpo-qwen3-8b-fair-dpo-s42/trainer_state.json
ModelHub XC c5827a4516 初始化项目,由ModelHub XC社区提供模型
Model: promotion/ronpo-qwen3-8b-fair-dpo-s42
Source: Original Platform
2026-07-18 16:12:11 +08:00

3644 lines
136 KiB
JSON

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.8599068434252956,
"eval_steps": 500,
"global_step": 900,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"drift/chosen_abs": 0.24220439791679382,
"drift/rejected_abs": 0.09696104377508163,
"epoch": 0.004777260241251642,
"grad_norm": 0.9375,
"learning_rate": 1.4814814814814814e-08,
"logits/chosen": -1.9986450672149658,
"logits/rejected": -2.0149338245391846,
"logps/chosen": -0.2793148458003998,
"logps/rejected": -0.2823529839515686,
"loss": 0.6970014572143555,
"loss/core": 0.6860443949699402,
"loss/preference_sft": 0.2793148458003998,
"loss/reference_anchor": 0.191210076212883,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 2.420919179916382,
"rewards/margins": 1.4643528461456299,
"rewards/rejected": 0.9565665125846863,
"step": 5
},
{
"drift/chosen_abs": 0.16979221999645233,
"drift/rejected_abs": 0.15968844294548035,
"epoch": 0.009554520482503284,
"grad_norm": 28.875,
"learning_rate": 3.3333333333333334e-08,
"logits/chosen": -2.343964099884033,
"logits/rejected": -2.3917829990386963,
"logps/chosen": -0.2886165380477905,
"logps/rejected": -0.2906612753868103,
"loss": 0.719261646270752,
"loss/core": 0.6927183866500854,
"loss/preference_sft": 0.2886165380477905,
"loss/reference_anchor": 0.5020042657852173,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 1.6975072622299194,
"rewards/margins": 0.10625555366277695,
"rewards/rejected": 1.5912517309188843,
"step": 10
},
{
"drift/chosen_abs": 0.21399614214897156,
"drift/rejected_abs": 0.11550233513116837,
"epoch": 0.014331780723754926,
"grad_norm": 2.125,
"learning_rate": 5.1851851851851846e-08,
"logits/chosen": -2.2301273345947266,
"logits/rejected": -2.1927645206451416,
"logps/chosen": -0.2770230770111084,
"logps/rejected": -0.2827666401863098,
"loss": 0.6988939642906189,
"loss/core": 0.6884175539016724,
"loss/preference_sft": 0.2770230770111084,
"loss/reference_anchor": 0.1818254441022873,
"rewards/accuracies": 0.875,
"rewards/chosen": 2.138073682785034,
"rewards/margins": 0.9850578308105469,
"rewards/rejected": 1.1530158519744873,
"step": 15
},
{
"drift/chosen_abs": 0.19165699183940887,
"drift/rejected_abs": 0.08792886883020401,
"epoch": 0.01910904096500657,
"grad_norm": 0.29296875,
"learning_rate": 7.037037037037038e-08,
"logits/chosen": -2.1778664588928223,
"logits/rejected": -2.2186977863311768,
"logps/chosen": -0.30127808451652527,
"logps/rejected": -0.2866690754890442,
"loss": 0.7005060315132141,
"loss/core": 0.6881817579269409,
"loss/preference_sft": 0.30127808451652527,
"loss/reference_anchor": 0.2163558453321457,
"rewards/accuracies": 0.875,
"rewards/chosen": 1.9165700674057007,
"rewards/margins": 1.038002610206604,
"rewards/rejected": 0.8785673379898071,
"step": 20
},
{
"drift/chosen_abs": 0.3831271529197693,
"drift/rejected_abs": 0.1648741066455841,
"epoch": 0.02388630120625821,
"grad_norm": 0.671875,
"learning_rate": 8.888888888888888e-08,
"logits/chosen": -2.076991558074951,
"logits/rejected": -2.1371612548828125,
"logps/chosen": -0.2725714147090912,
"logps/rejected": -0.25773054361343384,
"loss": 0.7282012104988098,
"loss/core": 0.6838706135749817,
"loss/preference_sft": 0.2725714147090912,
"loss/reference_anchor": 0.8593538999557495,
"rewards/accuracies": 0.8500000238418579,
"rewards/chosen": 3.8294517993927,
"rewards/margins": 2.182237148284912,
"rewards/rejected": 1.6472148895263672,
"step": 25
},
{
"drift/chosen_abs": 0.22680720686912537,
"drift/rejected_abs": 0.11056505143642426,
"epoch": 0.028663561447509853,
"grad_norm": 5.25,
"learning_rate": 1.074074074074074e-07,
"logits/chosen": -2.348992347717285,
"logits/rejected": -2.3324456214904785,
"logps/chosen": -0.3011496067047119,
"logps/rejected": -0.32406991720199585,
"loss": 0.7054672837257385,
"loss/core": 0.6874420642852783,
"loss/preference_sft": 0.3011496067047119,
"loss/reference_anchor": 0.3303898274898529,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 2.26779842376709,
"rewards/margins": 1.2391281127929688,
"rewards/rejected": 1.028670310974121,
"step": 30
},
{
"drift/chosen_abs": 0.2659522593021393,
"drift/rejected_abs": 0.11598372459411621,
"epoch": 0.033440821688761495,
"grad_norm": 0.251953125,
"learning_rate": 1.2592592592592592e-07,
"logits/chosen": -2.201605796813965,
"logits/rejected": -2.18267822265625,
"logps/chosen": -0.26762351393699646,
"logps/rejected": -0.2652774751186371,
"loss": 0.7072523236274719,
"loss/core": 0.6861520409584045,
"loss/preference_sft": 0.26762351393699646,
"loss/reference_anchor": 0.395240843296051,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": 2.659522771835327,
"rewards/margins": 1.5000025033950806,
"rewards/rejected": 1.1595203876495361,
"step": 35
},
{
"drift/chosen_abs": 0.44708338379859924,
"drift/rejected_abs": 0.1636328548192978,
"epoch": 0.03821808193001314,
"grad_norm": 2.546875,
"learning_rate": 1.4444444444444442e-07,
"logits/chosen": -2.0019490718841553,
"logits/rejected": -2.062816858291626,
"logps/chosen": -0.29337409138679504,
"logps/rejected": -0.2815210223197937,
"loss": 0.7314882874488831,
"loss/core": 0.6806979775428772,
"loss/preference_sft": 0.29337409138679504,
"loss/reference_anchor": 0.9864678382873535,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 4.470605373382568,
"rewards/margins": 2.8643717765808105,
"rewards/rejected": 1.6062335968017578,
"step": 40
},
{
"drift/chosen_abs": 0.20861148834228516,
"drift/rejected_abs": 0.08526524901390076,
"epoch": 0.04299534217126478,
"grad_norm": 0.31640625,
"learning_rate": 1.6296296296296298e-07,
"logits/chosen": -2.199146270751953,
"logits/rejected": -2.3609375953674316,
"logps/chosen": -0.28975796699523926,
"logps/rejected": -0.2888508439064026,
"loss": 0.6954045295715332,
"loss/core": 0.6870486736297607,
"loss/preference_sft": 0.28975796699523926,
"loss/reference_anchor": 0.1381419450044632,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": 2.085977792739868,
"rewards/margins": 1.248346209526062,
"rewards/rejected": 0.8376315236091614,
"step": 45
},
{
"drift/chosen_abs": 0.28775015473365784,
"drift/rejected_abs": 0.1457628458738327,
"epoch": 0.04777260241251642,
"grad_norm": 3.75,
"learning_rate": 1.8148148148148149e-07,
"logits/chosen": -2.168269395828247,
"logits/rejected": -2.164731979370117,
"logps/chosen": -0.28189998865127563,
"logps/rejected": -0.28475481271743774,
"loss": 0.7057908177375793,
"loss/core": 0.6865909695625305,
"loss/preference_sft": 0.28189998865127563,
"loss/reference_anchor": 0.3558071553707123,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 2.8775012493133545,
"rewards/margins": 1.4253501892089844,
"rewards/rejected": 1.4521510601043701,
"step": 50
},
{
"drift/chosen_abs": 0.22688527405261993,
"drift/rejected_abs": 0.2027493268251419,
"epoch": 0.05254986265376806,
"grad_norm": 0.162109375,
"learning_rate": 2e-07,
"logits/chosen": -2.196228504180908,
"logits/rejected": -2.184458017349243,
"logps/chosen": -0.28806787729263306,
"logps/rejected": -0.29169613122940063,
"loss": 0.7314178347587585,
"loss/core": 0.6928032636642456,
"loss/preference_sft": 0.28806787729263306,
"loss/reference_anchor": 0.7434841394424438,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 2.2677197456359863,
"rewards/margins": 0.25824469327926636,
"rewards/rejected": 2.009474992752075,
"step": 55
},
{
"drift/chosen_abs": 0.2152278870344162,
"drift/rejected_abs": 0.1564132422208786,
"epoch": 0.057327122895019705,
"grad_norm": 20.75,
"learning_rate": 2.1851851851851852e-07,
"logits/chosen": -2.091794013977051,
"logits/rejected": -2.1202189922332764,
"logps/chosen": -0.27512186765670776,
"logps/rejected": -0.2831602692604065,
"loss": 0.7002712488174438,
"loss/core": 0.6903932690620422,
"loss/preference_sft": 0.27512186765670776,
"loss/reference_anchor": 0.17004787921905518,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 2.149622917175293,
"rewards/margins": 0.5874365568161011,
"rewards/rejected": 1.5621862411499023,
"step": 60
},
{
"drift/chosen_abs": 0.2973586320877075,
"drift/rejected_abs": 0.11919713020324707,
"epoch": 0.06210438313627135,
"grad_norm": 0.33984375,
"learning_rate": 2.3703703703703703e-07,
"logits/chosen": -1.9600942134857178,
"logits/rejected": -2.063352108001709,
"logps/chosen": -0.30903658270835876,
"logps/rejected": -0.3050587773323059,
"loss": 0.7107466459274292,
"loss/core": 0.6846051812171936,
"loss/preference_sft": 0.30903658270835876,
"loss/reference_anchor": 0.49192652106285095,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": 2.9714887142181396,
"rewards/margins": 1.7871677875518799,
"rewards/rejected": 1.1843211650848389,
"step": 65
},
{
"drift/chosen_abs": 0.36345982551574707,
"drift/rejected_abs": 0.22663752734661102,
"epoch": 0.06688164337752299,
"grad_norm": 1.703125,
"learning_rate": 2.5555555555555553e-07,
"logits/chosen": -1.971685767173767,
"logits/rejected": -1.9568895101547241,
"logps/chosen": -0.3803972005844116,
"logps/rejected": -0.2971033453941345,
"loss": 0.7371006011962891,
"loss/core": 0.6875497698783875,
"loss/preference_sft": 0.3803972005844116,
"loss/reference_anchor": 0.9529773592948914,
"rewards/accuracies": 0.8500000238418579,
"rewards/chosen": 3.63312029838562,
"rewards/margins": 1.450933575630188,
"rewards/rejected": 2.1821866035461426,
"step": 70
},
{
"drift/chosen_abs": 0.2583789527416229,
"drift/rejected_abs": 0.15998633205890656,
"epoch": 0.07165890361877464,
"grad_norm": 0.44140625,
"learning_rate": 2.7407407407407406e-07,
"logits/chosen": -2.086479663848877,
"logits/rejected": -2.0509562492370605,
"logps/chosen": -0.31756237149238586,
"logps/rejected": -0.2885989248752594,
"loss": 0.7078580856323242,
"loss/core": 0.688626229763031,
"loss/preference_sft": 0.31756237149238586,
"loss/reference_anchor": 0.35288190841674805,
"rewards/accuracies": 0.824999988079071,
"rewards/chosen": 2.5812525749206543,
"rewards/margins": 0.9826623201370239,
"rewards/rejected": 1.5985901355743408,
"step": 75
},
{
"drift/chosen_abs": 0.3245569169521332,
"drift/rejected_abs": 0.127544105052948,
"epoch": 0.07643616386002627,
"grad_norm": 0.29296875,
"learning_rate": 2.9259259259259254e-07,
"logits/chosen": -2.0680508613586426,
"logits/rejected": -2.1884958744049072,
"logps/chosen": -0.2601710259914398,
"logps/rejected": -0.274718701839447,
"loss": 0.7082482576370239,
"loss/core": 0.6839421987533569,
"loss/preference_sft": 0.2601710259914398,
"loss/reference_anchor": 0.46010416746139526,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 3.245285749435425,
"rewards/margins": 2.0003161430358887,
"rewards/rejected": 1.2449694871902466,
"step": 80
},
{
"drift/chosen_abs": 0.34736722707748413,
"drift/rejected_abs": 0.1335596740245819,
"epoch": 0.08121342410127792,
"grad_norm": 0.423828125,
"learning_rate": 3.111111111111111e-07,
"logits/chosen": -2.187932252883911,
"logits/rejected": -2.2362093925476074,
"logps/chosen": -0.31001752614974976,
"logps/rejected": -0.27728381752967834,
"loss": 0.7267902493476868,
"loss/core": 0.683385968208313,
"loss/preference_sft": 0.31001752614974976,
"loss/reference_anchor": 0.8370832204818726,
"rewards/accuracies": 0.875,
"rewards/chosen": 3.4731335639953613,
"rewards/margins": 2.138108015060425,
"rewards/rejected": 1.3350250720977783,
"step": 85
},
{
"drift/chosen_abs": 0.1755516231060028,
"drift/rejected_abs": 0.08407329767942429,
"epoch": 0.08599068434252956,
"grad_norm": 0.162109375,
"learning_rate": 3.296296296296296e-07,
"logits/chosen": -2.420429229736328,
"logits/rejected": -2.4072763919830322,
"logps/chosen": -0.28123074769973755,
"logps/rejected": -0.2965225577354431,
"loss": 0.6978365778923035,
"loss/core": 0.6886924505233765,
"loss/preference_sft": 0.28123074769973755,
"loss/reference_anchor": 0.15476098656654358,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 1.7550804615020752,
"rewards/margins": 0.9150702357292175,
"rewards/rejected": 0.8400100469589233,
"step": 90
},
{
"drift/chosen_abs": 0.3212953805923462,
"drift/rejected_abs": 0.21096964180469513,
"epoch": 0.09076794458378121,
"grad_norm": 0.94140625,
"learning_rate": 3.4814814814814814e-07,
"logits/chosen": -2.0551528930664062,
"logits/rejected": -2.111891269683838,
"logps/chosen": -0.2670920491218567,
"logps/rejected": -0.278430700302124,
"loss": 0.7121036648750305,
"loss/core": 0.6880958080291748,
"loss/preference_sft": 0.2670920491218567,
"loss/reference_anchor": 0.4534483850002289,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 3.212806224822998,
"rewards/margins": 1.103410005569458,
"rewards/rejected": 2.109395980834961,
"step": 95
},
{
"drift/chosen_abs": 0.24620285630226135,
"drift/rejected_abs": 0.1283082365989685,
"epoch": 0.09554520482503284,
"grad_norm": 0.39453125,
"learning_rate": 3.666666666666666e-07,
"logits/chosen": -2.2331910133361816,
"logits/rejected": -2.278862953186035,
"logps/chosen": -0.2573774755001068,
"logps/rejected": -0.2470593899488449,
"loss": 0.6977821588516235,
"loss/core": 0.6874433755874634,
"loss/preference_sft": 0.2573774755001068,
"loss/reference_anchor": 0.18103909492492676,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 2.460810422897339,
"rewards/margins": 1.1784250736236572,
"rewards/rejected": 1.2823854684829712,
"step": 100
},
{
"drift/chosen_abs": 0.20025713741779327,
"drift/rejected_abs": 0.07980473339557648,
"epoch": 0.10032246506628449,
"grad_norm": 5.8125,
"learning_rate": 3.8518518518518515e-07,
"logits/chosen": -2.33634614944458,
"logits/rejected": -2.421203374862671,
"logps/chosen": -0.2838136553764343,
"logps/rejected": -0.28014278411865234,
"loss": 0.6988551020622253,
"loss/core": 0.6874551773071289,
"loss/preference_sft": 0.2838136553764343,
"loss/reference_anchor": 0.1996181458234787,
"rewards/accuracies": 0.875,
"rewards/chosen": 2.001106023788452,
"rewards/margins": 1.206559419631958,
"rewards/rejected": 0.7945466041564941,
"step": 105
},
{
"drift/chosen_abs": 0.44312191009521484,
"drift/rejected_abs": 0.18942782282829285,
"epoch": 0.10509972530753613,
"grad_norm": 0.4921875,
"learning_rate": 4.0370370370370373e-07,
"logits/chosen": -1.9062073230743408,
"logits/rejected": -1.858873724937439,
"logps/chosen": -0.34249261021614075,
"logps/rejected": -0.29758021235466003,
"loss": 0.7256662249565125,
"loss/core": 0.6815618276596069,
"loss/preference_sft": 0.34249261021614075,
"loss/reference_anchor": 0.8478387594223022,
"rewards/accuracies": 0.949999988079071,
"rewards/chosen": 4.430351734161377,
"rewards/margins": 2.5402467250823975,
"rewards/rejected": 1.89010488986969,
"step": 110
},
{
"drift/chosen_abs": 0.17720595002174377,
"drift/rejected_abs": 0.14460505545139313,
"epoch": 0.10987698554878778,
"grad_norm": 2.0625,
"learning_rate": 4.222222222222222e-07,
"logits/chosen": -2.087794542312622,
"logits/rejected": -2.0313782691955566,
"logps/chosen": -0.30076345801353455,
"logps/rejected": -0.2990095615386963,
"loss": 0.7037674188613892,
"loss/core": 0.6917927861213684,
"loss/preference_sft": 0.30076345801353455,
"loss/reference_anchor": 0.20941567420959473,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 1.771735429763794,
"rewards/margins": 0.32677847146987915,
"rewards/rejected": 1.4449571371078491,
"step": 115
},
{
"drift/chosen_abs": 0.1807553470134735,
"drift/rejected_abs": 0.11256897449493408,
"epoch": 0.11465424579003941,
"grad_norm": 7.9375,
"learning_rate": 4.4074074074074074e-07,
"logits/chosen": -2.038364887237549,
"logits/rejected": -2.074918270111084,
"logps/chosen": -0.3024388551712036,
"logps/rejected": -0.2960285246372223,
"loss": 0.6956692337989807,
"loss/core": 0.6897962689399719,
"loss/preference_sft": 0.3024388551712036,
"loss/reference_anchor": 0.08721615374088287,
"rewards/accuracies": 0.875,
"rewards/chosen": 1.8071529865264893,
"rewards/margins": 0.6840036511421204,
"rewards/rejected": 1.1231491565704346,
"step": 120
},
{
"drift/chosen_abs": 0.2066231518983841,
"drift/rejected_abs": 0.10167888551950455,
"epoch": 0.11943150603129106,
"grad_norm": 0.2734375,
"learning_rate": 4.592592592592592e-07,
"logits/chosen": -2.1104722023010254,
"logits/rejected": -2.141206979751587,
"logps/chosen": -0.29907721281051636,
"logps/rejected": -0.30693620443344116,
"loss": 0.6962321400642395,
"loss/core": 0.6880409717559814,
"loss/preference_sft": 0.29907721281051636,
"loss/reference_anchor": 0.13391605019569397,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 2.0647101402282715,
"rewards/margins": 1.0507093667984009,
"rewards/rejected": 1.014000654220581,
"step": 125
},
{
"drift/chosen_abs": 0.18080219626426697,
"drift/rejected_abs": 0.0888272374868393,
"epoch": 0.1242087662725427,
"grad_norm": 0.5703125,
"learning_rate": 4.777777777777778e-07,
"logits/chosen": -1.999070405960083,
"logits/rejected": -2.092583179473877,
"logps/chosen": -0.27993208169937134,
"logps/rejected": -0.2788156569004059,
"loss": 0.6937012076377869,
"loss/core": 0.68858802318573,
"loss/preference_sft": 0.27993208169937134,
"loss/reference_anchor": 0.07427060604095459,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": 1.8078792095184326,
"rewards/margins": 0.9212325811386108,
"rewards/rejected": 0.8866468667984009,
"step": 130
},
{
"drift/chosen_abs": 0.3372951149940491,
"drift/rejected_abs": 0.13560067117214203,
"epoch": 0.12898602651379434,
"grad_norm": 0.765625,
"learning_rate": 4.962962962962963e-07,
"logits/chosen": -2.0918431282043457,
"logits/rejected": -2.1655802726745605,
"logps/chosen": -0.30224984884262085,
"logps/rejected": -0.29795363545417786,
"loss": 0.7072810530662537,
"loss/core": 0.6833052635192871,
"loss/preference_sft": 0.30224984884262085,
"loss/reference_anchor": 0.44929036498069763,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 3.3726329803466797,
"rewards/margins": 2.055931806564331,
"rewards/rejected": 1.3167011737823486,
"step": 135
},
{
"drift/chosen_abs": 0.16283419728279114,
"drift/rejected_abs": 0.07167728990316391,
"epoch": 0.13376328675504598,
"grad_norm": 0.294921875,
"learning_rate": 4.999662714939607e-07,
"logits/chosen": -2.4538674354553223,
"logits/rejected": -2.5128872394561768,
"logps/chosen": -0.2825615108013153,
"logps/rejected": -0.28934210538864136,
"loss": 0.6929519176483154,
"loss/core": 0.688643753528595,
"loss/preference_sft": 0.2825615108013153,
"loss/reference_anchor": 0.057906895875930786,
"rewards/accuracies": 0.875,
"rewards/chosen": 1.6276466846466064,
"rewards/margins": 0.9115911722183228,
"rewards/rejected": 0.7160555720329285,
"step": 140
},
{
"drift/chosen_abs": 0.3645097315311432,
"drift/rejected_abs": 0.17297443747520447,
"epoch": 0.13854054699629761,
"grad_norm": 0.53125,
"learning_rate": 4.998292650357557e-07,
"logits/chosen": -1.7773208618164062,
"logits/rejected": -1.8101383447647095,
"logps/chosen": -0.29743704199790955,
"logps/rejected": -0.3080594837665558,
"loss": 0.7377547025680542,
"loss/core": 0.6842484474182129,
"loss/preference_sft": 0.29743704199790955,
"loss/reference_anchor": 1.0403814315795898,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 3.643198013305664,
"rewards/margins": 1.9210885763168335,
"rewards/rejected": 1.7221091985702515,
"step": 145
},
{
"drift/chosen_abs": 0.3650224804878235,
"drift/rejected_abs": 0.14471963047981262,
"epoch": 0.14331780723754928,
"grad_norm": 2.484375,
"learning_rate": 4.995869303113768e-07,
"logits/chosen": -2.234192371368408,
"logits/rejected": -2.2828991413116455,
"logps/chosen": -0.31630638241767883,
"logps/rejected": -0.31051549315452576,
"loss": 0.7256408333778381,
"loss/core": 0.682770311832428,
"loss/preference_sft": 0.31630638241767883,
"loss/reference_anchor": 0.8257803916931152,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 3.649608612060547,
"rewards/margins": 2.215174913406372,
"rewards/rejected": 1.4344332218170166,
"step": 150
},
{
"drift/chosen_abs": 0.2868257462978363,
"drift/rejected_abs": 0.0814853385090828,
"epoch": 0.1480950674788009,
"grad_norm": 0.455078125,
"learning_rate": 4.992393694893844e-07,
"logits/chosen": -2.098144292831421,
"logits/rejected": -2.1760802268981934,
"logps/chosen": -0.28282657265663147,
"logps/rejected": -0.29578837752342224,
"loss": 0.7028457522392273,
"loss/core": 0.6833733320236206,
"loss/preference_sft": 0.28282657265663147,
"loss/reference_anchor": 0.36116594076156616,
"rewards/accuracies": 0.875,
"rewards/chosen": 2.8672358989715576,
"rewards/margins": 2.075387716293335,
"rewards/rejected": 0.7918483018875122,
"step": 155
},
{
"drift/chosen_abs": 0.3154504895210266,
"drift/rejected_abs": 0.14014051854610443,
"epoch": 0.15287232772005255,
"grad_norm": 6.78125,
"learning_rate": 4.987867291017661e-07,
"logits/chosen": -2.05576491355896,
"logits/rejected": -2.029587507247925,
"logps/chosen": -0.310093492269516,
"logps/rejected": -0.31532084941864014,
"loss": 0.7215666174888611,
"loss/core": 0.6853370070457458,
"loss/preference_sft": 0.310093492269516,
"loss/reference_anchor": 0.6935839653015137,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": 3.1545047760009766,
"rewards/margins": 1.7532867193222046,
"rewards/rejected": 1.401218056678772,
"step": 160
},
{
"drift/chosen_abs": 0.16013780236244202,
"drift/rejected_abs": 0.07896161824464798,
"epoch": 0.15764958796130418,
"grad_norm": 0.48046875,
"learning_rate": 4.982291999821587e-07,
"logits/chosen": -2.2207119464874268,
"logits/rejected": -2.152768850326538,
"logps/chosen": -0.3112797141075134,
"logps/rejected": -0.3058459758758545,
"loss": 0.6951904892921448,
"loss/core": 0.6891487240791321,
"loss/preference_sft": 0.3112797141075134,
"loss/reference_anchor": 0.08970671147108078,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 1.6005077362060547,
"rewards/margins": 0.8129563331604004,
"rewards/rejected": 0.7875513434410095,
"step": 165
},
{
"drift/chosen_abs": 0.2601718008518219,
"drift/rejected_abs": 0.27558404207229614,
"epoch": 0.16242684820255585,
"grad_norm": 7.875,
"learning_rate": 4.975670171853925e-07,
"logits/chosen": -2.1900925636291504,
"logits/rejected": -2.1342360973358154,
"logps/chosen": -0.27432286739349365,
"logps/rejected": -0.2613202929496765,
"loss": 0.7430840730667114,
"loss/core": 0.6951981782913208,
"loss/preference_sft": 0.27432286739349365,
"loss/reference_anchor": 0.9302865266799927,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 2.6010234355926514,
"rewards/margins": -0.15333333611488342,
"rewards/rejected": 2.754356861114502,
"step": 170
},
{
"drift/chosen_abs": 0.2583249509334564,
"drift/rejected_abs": 0.12602022290229797,
"epoch": 0.16720410844380748,
"grad_norm": 13.4375,
"learning_rate": 4.968004598883922e-07,
"logits/chosen": -2.1797878742218018,
"logits/rejected": -2.2193121910095215,
"logps/chosen": -0.2869110703468323,
"logps/rejected": -0.301838755607605,
"loss": 0.7159601449966431,
"loss/core": 0.6867267489433289,
"loss/preference_sft": 0.2869110703468323,
"loss/reference_anchor": 0.5559752583503723,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": 2.583249568939209,
"rewards/margins": 1.3249006271362305,
"rewards/rejected": 1.2583489418029785,
"step": 175
},
{
"drift/chosen_abs": 0.3220704197883606,
"drift/rejected_abs": 0.15029826760292053,
"epoch": 0.17198136868505912,
"grad_norm": 15.625,
"learning_rate": 4.959298512724752e-07,
"logits/chosen": -2.19909930229187,
"logits/rejected": -2.1092610359191895,
"logps/chosen": -0.27359136939048767,
"logps/rejected": -0.2609673738479614,
"loss": 0.7153160572052002,
"loss/core": 0.6853613257408142,
"loss/preference_sft": 0.27359136939048767,
"loss/reference_anchor": 0.5717340707778931,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 3.2184219360351562,
"rewards/margins": 1.718634009361267,
"rewards/rejected": 1.49978768825531,
"step": 180
},
{
"drift/chosen_abs": 0.10404728353023529,
"drift/rejected_abs": 0.0626899003982544,
"epoch": 0.17675862892631075,
"grad_norm": 0.314453125,
"learning_rate": 4.949555583870983e-07,
"logits/chosen": -2.204803466796875,
"logits/rejected": -2.1623644828796387,
"logps/chosen": -0.28916627168655396,
"logps/rejected": -0.2922504246234894,
"loss": 0.69410240650177,
"loss/core": 0.691106915473938,
"loss/preference_sft": 0.28916627168655396,
"loss/reference_anchor": 0.03099246881902218,
"rewards/accuracies": 0.8500000238418579,
"rewards/chosen": 1.0380046367645264,
"rewards/margins": 0.4127095639705658,
"rewards/rejected": 0.625295102596283,
"step": 185
},
{
"drift/chosen_abs": 0.28229960799217224,
"drift/rejected_abs": 0.12531210482120514,
"epoch": 0.18153588916756241,
"grad_norm": 0.9375,
"learning_rate": 4.938779919951092e-07,
"logits/chosen": -2.2970175743103027,
"logits/rejected": -2.2739336490631104,
"logps/chosen": -0.2851516008377075,
"logps/rejected": -0.2831699550151825,
"loss": 0.7151316404342651,
"loss/core": 0.6858740448951721,
"loss/preference_sft": 0.2851516008377075,
"loss/reference_anchor": 0.5566385984420776,
"rewards/accuracies": 0.9375,
"rewards/chosen": 2.822661876678467,
"rewards/margins": 1.5726929903030396,
"rewards/rejected": 1.2499691247940063,
"step": 190
},
{
"drift/chosen_abs": 0.26670801639556885,
"drift/rejected_abs": 0.097129687666893,
"epoch": 0.18631314940881405,
"grad_norm": 0.337890625,
"learning_rate": 4.926976063995686e-07,
"logits/chosen": -1.9850791692733765,
"logits/rejected": -2.0053915977478027,
"logps/chosen": -0.2911596894264221,
"logps/rejected": -0.2897758185863495,
"loss": 0.7147169709205627,
"loss/core": 0.6856262683868408,
"loss/preference_sft": 0.2911596894264221,
"loss/reference_anchor": 0.5526987314224243,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 2.6668624877929688,
"rewards/margins": 1.7010908126831055,
"rewards/rejected": 0.9657715559005737,
"step": 195
},
{
"drift/chosen_abs": 0.26155006885528564,
"drift/rejected_abs": 0.12203337997198105,
"epoch": 0.19109040965006568,
"grad_norm": 0.69140625,
"learning_rate": 4.914148992522156e-07,
"logits/chosen": -1.8971683979034424,
"logits/rejected": -1.9370143413543701,
"logps/chosen": -0.3235601484775543,
"logps/rejected": -0.3167949318885803,
"loss": 0.7003489136695862,
"loss/core": 0.6863821744918823,
"loss/preference_sft": 0.3235601484775543,
"loss/reference_anchor": 0.24697670340538025,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 2.6145803928375244,
"rewards/margins": 1.3957717418670654,
"rewards/rejected": 1.2188085317611694,
"step": 200
},
{
"drift/chosen_abs": 0.3286622166633606,
"drift/rejected_abs": 0.2124643623828888,
"epoch": 0.19586766989131732,
"grad_norm": 0.23046875,
"learning_rate": 4.90030411343657e-07,
"logits/chosen": -2.119131565093994,
"logits/rejected": -2.1706948280334473,
"logps/chosen": -0.2504412829875946,
"logps/rejected": -0.2682013511657715,
"loss": 0.7217109799385071,
"loss/core": 0.6881678104400635,
"loss/preference_sft": 0.2504412829875946,
"loss/reference_anchor": 0.6458190679550171,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 3.2861106395721436,
"rewards/margins": 1.170446753501892,
"rewards/rejected": 2.115664005279541,
"step": 205
},
{
"drift/chosen_abs": 0.2844642698764801,
"drift/rejected_abs": 0.15010371804237366,
"epoch": 0.20064493013256898,
"grad_norm": 0.447265625,
"learning_rate": 4.885447263753696e-07,
"logits/chosen": -2.1142611503601074,
"logits/rejected": -2.138841152191162,
"logps/chosen": -0.3113865256309509,
"logps/rejected": -0.32046282291412354,
"loss": 0.7174853086471558,
"loss/core": 0.6867169141769409,
"loss/preference_sft": 0.3113865256309509,
"loss/reference_anchor": 0.584227442741394,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 2.8422324657440186,
"rewards/margins": 1.3444972038269043,
"rewards/rejected": 1.4977353811264038,
"step": 210
},
{
"drift/chosen_abs": 0.3206380307674408,
"drift/rejected_abs": 0.16881483793258667,
"epoch": 0.20542219037382062,
"grad_norm": 0.828125,
"learning_rate": 4.869584707136108e-07,
"logits/chosen": -2.0880212783813477,
"logits/rejected": -2.079676389694214,
"logps/chosen": -0.2742551863193512,
"logps/rejected": -0.28655797243118286,
"loss": 0.7276748418807983,
"loss/core": 0.6868326663970947,
"loss/preference_sft": 0.2742551863193512,
"loss/reference_anchor": 0.7894173860549927,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": 3.203636884689331,
"rewards/margins": 1.5241820812225342,
"rewards/rejected": 1.6794548034667969,
"step": 215
},
{
"drift/chosen_abs": 0.1884107142686844,
"drift/rejected_abs": 0.10744212567806244,
"epoch": 0.21019945061507225,
"grad_norm": 1.421875,
"learning_rate": 4.852723131253429e-07,
"logits/chosen": -2.1026856899261475,
"logits/rejected": -2.0164294242858887,
"logps/chosen": -0.3028913140296936,
"logps/rejected": -0.3013783395290375,
"loss": 0.6961045265197754,
"loss/core": 0.689160168170929,
"loss/preference_sft": 0.3028913140296936,
"loss/reference_anchor": 0.10859811305999756,
"rewards/accuracies": 0.875,
"rewards/chosen": 1.881739616394043,
"rewards/margins": 0.8081823587417603,
"rewards/rejected": 1.0735574960708618,
"step": 220
},
{
"drift/chosen_abs": 0.36267831921577454,
"drift/rejected_abs": 0.14132729172706604,
"epoch": 0.2149767108563239,
"grad_norm": 0.35546875,
"learning_rate": 4.834869644962788e-07,
"logits/chosen": -2.1880686283111572,
"logits/rejected": -2.1765666007995605,
"logps/chosen": -0.29012617468833923,
"logps/rejected": -0.2754373252391815,
"loss": 0.7051090598106384,
"loss/core": 0.6825994253158569,
"loss/preference_sft": 0.29012617468833923,
"loss/reference_anchor": 0.42117825150489807,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 3.6267833709716797,
"rewards/margins": 2.217150926589966,
"rewards/rejected": 1.4096323251724243,
"step": 225
},
{
"drift/chosen_abs": 0.18478451669216156,
"drift/rejected_abs": 0.07309754192829132,
"epoch": 0.21975397109757555,
"grad_norm": 5.34375,
"learning_rate": 4.816031775311732e-07,
"logits/chosen": -2.2757763862609863,
"logits/rejected": -2.2832772731781006,
"logps/chosen": -0.2824876308441162,
"logps/rejected": -0.31052327156066895,
"loss": 0.693640410900116,
"loss/core": 0.6876736283302307,
"loss/preference_sft": 0.2824876308441162,
"loss/reference_anchor": 0.0910874456167221,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": 1.8467649221420288,
"rewards/margins": 1.1201399564743042,
"rewards/rejected": 0.7266249060630798,
"step": 230
},
{
"drift/chosen_abs": 0.1901187002658844,
"drift/rejected_abs": 0.13333821296691895,
"epoch": 0.2245312313388272,
"grad_norm": 0.447265625,
"learning_rate": 4.796217464364808e-07,
"logits/chosen": -2.0125269889831543,
"logits/rejected": -2.0471303462982178,
"logps/chosen": -0.29326948523521423,
"logps/rejected": -0.2864275574684143,
"loss": 0.703149676322937,
"loss/core": 0.6904449462890625,
"loss/preference_sft": 0.29326948523521423,
"loss/reference_anchor": 0.2247694432735443,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 1.8984577655792236,
"rewards/margins": 0.5684404373168945,
"rewards/rejected": 1.330017328262329,
"step": 235
},
{
"drift/chosen_abs": 0.17612558603286743,
"drift/rejected_abs": 0.10248030722141266,
"epoch": 0.22930849158007882,
"grad_norm": 0.49609375,
"learning_rate": 4.775435065855182e-07,
"logits/chosen": -2.0281519889831543,
"logits/rejected": -2.046496868133545,
"logps/chosen": -0.29431360960006714,
"logps/rejected": -0.2945192754268646,
"loss": 0.6945276260375977,
"loss/core": 0.6894940733909607,
"loss/preference_sft": 0.29431360960006714,
"loss/reference_anchor": 0.07123853266239166,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 1.760162353515625,
"rewards/margins": 0.7375157475471497,
"rewards/rejected": 1.0226467847824097,
"step": 240
},
{
"drift/chosen_abs": 0.3607032895088196,
"drift/rejected_abs": 0.11152495443820953,
"epoch": 0.23408575182133046,
"grad_norm": 12.125,
"learning_rate": 4.753693341662701e-07,
"logits/chosen": -2.0682380199432373,
"logits/rejected": -2.056436538696289,
"logps/chosen": -0.2773371934890747,
"logps/rejected": -0.2957698106765747,
"loss": 0.7130360007286072,
"loss/core": 0.6818927526473999,
"loss/preference_sft": 0.2773371934890747,
"loss/reference_anchor": 0.5951310396194458,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 3.606236219406128,
"rewards/margins": 2.500974178314209,
"rewards/rejected": 1.105262279510498,
"step": 245
},
{
"drift/chosen_abs": 0.2335798293352127,
"drift/rejected_abs": 0.10776785761117935,
"epoch": 0.23886301206258212,
"grad_norm": 0.58203125,
"learning_rate": 4.731001458119869e-07,
"logits/chosen": -1.9081608057022095,
"logits/rejected": -1.988088607788086,
"logps/chosen": -0.30037543177604675,
"logps/rejected": -0.2945137917995453,
"loss": 0.6957753896713257,
"loss/core": 0.6870092153549194,
"loss/preference_sft": 0.30037543177604675,
"loss/reference_anchor": 0.14528658986091614,
"rewards/accuracies": 0.8500000238418579,
"rewards/chosen": 2.333603620529175,
"rewards/margins": 1.2645257711410522,
"rewards/rejected": 1.069077730178833,
"step": 250
},
{
"drift/chosen_abs": 0.2451537400484085,
"drift/rejected_abs": 0.16124595701694489,
"epoch": 0.24364027230383375,
"grad_norm": 0.447265625,
"learning_rate": 4.707368982147317e-07,
"logits/chosen": -2.2194371223449707,
"logits/rejected": -2.215038299560547,
"logps/chosen": -0.2850092053413391,
"logps/rejected": -0.2866383194923401,
"loss": 0.7060943841934204,
"loss/core": 0.689082145690918,
"loss/preference_sft": 0.2850092053413391,
"loss/reference_anchor": 0.3117434084415436,
"rewards/accuracies": 0.875,
"rewards/chosen": 2.4506688117980957,
"rewards/margins": 0.8393514752388,
"rewards/rejected": 1.6113172769546509,
"step": 255
},
{
"drift/chosen_abs": 0.2390270233154297,
"drift/rejected_abs": 0.15710371732711792,
"epoch": 0.2484175325450854,
"grad_norm": 0.18359375,
"learning_rate": 4.682805877220377e-07,
"logits/chosen": -2.1546220779418945,
"logits/rejected": -2.227632999420166,
"logps/chosen": -0.28877514600753784,
"logps/rejected": -0.2719945013523102,
"loss": 0.7041021585464478,
"loss/core": 0.6894248127937317,
"loss/preference_sft": 0.28877514600753784,
"loss/reference_anchor": 0.2646702826023102,
"rewards/accuracies": 0.875,
"rewards/chosen": 2.3893117904663086,
"rewards/margins": 0.8218982815742493,
"rewards/rejected": 1.567413568496704,
"step": 260
},
{
"drift/chosen_abs": 0.12290436029434204,
"drift/rejected_abs": 0.11683180183172226,
"epoch": 0.25319479278633705,
"grad_norm": 0.1875,
"learning_rate": 4.657322499168474e-07,
"logits/chosen": -2.037142276763916,
"logits/rejected": -2.044814348220825,
"logps/chosen": -0.2997164726257324,
"logps/rejected": -0.3027000427246094,
"loss": 0.7055035829544067,
"loss/core": 0.6932748556137085,
"loss/preference_sft": 0.2997164726257324,
"loss/reference_anchor": 0.21460387110710144,
"rewards/accuracies": 0.9375,
"rewards/chosen": 1.2280583381652832,
"rewards/margins": 0.06538932025432587,
"rewards/rejected": 1.1626689434051514,
"step": 265
},
{
"drift/chosen_abs": 0.32724061608314514,
"drift/rejected_abs": 0.21098506450653076,
"epoch": 0.2579720530275887,
"grad_norm": 0.369140625,
"learning_rate": 4.630929591809094e-07,
"logits/chosen": -1.9422146081924438,
"logits/rejected": -2.031545400619507,
"logps/chosen": -0.28938454389572144,
"logps/rejected": -0.2925392985343933,
"loss": 0.7183395624160767,
"loss/core": 0.6880876421928406,
"loss/preference_sft": 0.28938454389572144,
"loss/reference_anchor": 0.5760983228683472,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 3.2724032402038574,
"rewards/margins": 1.1642584800720215,
"rewards/rejected": 2.108144998550415,
"step": 270
},
{
"drift/chosen_abs": 0.23237237334251404,
"drift/rejected_abs": 0.1247030645608902,
"epoch": 0.2627493132688403,
"grad_norm": 1.8515625,
"learning_rate": 4.603638282418183e-07,
"logits/chosen": -2.0928521156311035,
"logits/rejected": -2.0464084148406982,
"logps/chosen": -0.2967087924480438,
"logps/rejected": -0.30262163281440735,
"loss": 0.7003341913223267,
"loss/core": 0.6873778104782104,
"loss/preference_sft": 0.2967087924480438,
"loss/reference_anchor": 0.22945299744606018,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 2.3227198123931885,
"rewards/margins": 1.1851005554199219,
"rewards/rejected": 1.1376192569732666,
"step": 275
},
{
"drift/chosen_abs": 0.2046871930360794,
"drift/rejected_abs": 0.08532479405403137,
"epoch": 0.26752657351009196,
"grad_norm": 0.330078125,
"learning_rate": 4.5754600770388765e-07,
"logits/chosen": -2.061699867248535,
"logits/rejected": -1.97652268409729,
"logps/chosen": -0.28828340768814087,
"logps/rejected": -0.3085075914859772,
"loss": 0.6936501264572144,
"loss/core": 0.6868374347686768,
"loss/preference_sft": 0.28828340768814087,
"loss/reference_anchor": 0.10742677748203278,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 2.044452667236328,
"rewards/margins": 1.2943838834762573,
"rewards/rejected": 0.7500687837600708,
"step": 280
},
{
"drift/chosen_abs": 0.2622529864311218,
"drift/rejected_abs": 0.1607482135295868,
"epoch": 0.2723038337513436,
"grad_norm": 4.625,
"learning_rate": 4.5464068556305366e-07,
"logits/chosen": -2.086787700653076,
"logits/rejected": -2.0828757286071777,
"logps/chosen": -0.29549530148506165,
"logps/rejected": -0.2951886057853699,
"loss": 0.7032809853553772,
"loss/core": 0.6883570551872253,
"loss/preference_sft": 0.29549530148506165,
"loss/reference_anchor": 0.26892945170402527,
"rewards/accuracies": 0.8500000238418579,
"rewards/chosen": 2.6219353675842285,
"rewards/margins": 1.0172988176345825,
"rewards/rejected": 1.604636788368225,
"step": 285
},
{
"drift/chosen_abs": 0.14772982895374298,
"drift/rejected_abs": 0.14406272768974304,
"epoch": 0.27708109399259523,
"grad_norm": 20.75,
"learning_rate": 4.516490867060156e-07,
"logits/chosen": -2.1649439334869385,
"logits/rejected": -2.1754214763641357,
"logps/chosen": -0.2871306836605072,
"logps/rejected": -0.2890948951244354,
"loss": 0.7047442197799683,
"loss/core": 0.6933256387710571,
"loss/preference_sft": 0.2871306836605072,
"loss/reference_anchor": 0.19965848326683044,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": 1.4758152961730957,
"rewards/margins": 0.03618486598134041,
"rewards/rejected": 1.4396305084228516,
"step": 290
},
{
"drift/chosen_abs": 0.13134348392486572,
"drift/rejected_abs": 0.06761081516742706,
"epoch": 0.28185835423384686,
"grad_norm": 0.2470703125,
"learning_rate": 4.4857247239382153e-07,
"logits/chosen": -2.563570499420166,
"logits/rejected": -2.5265564918518066,
"logps/chosen": -0.24425753951072693,
"logps/rejected": -0.2567130923271179,
"loss": 0.6926940679550171,
"loss/core": 0.6899658441543579,
"loss/preference_sft": 0.24425753951072693,
"loss/reference_anchor": 0.03013770654797554,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 1.3127048015594482,
"rewards/margins": 0.639759361743927,
"rewards/rejected": 0.6729455590248108,
"step": 295
},
{
"drift/chosen_abs": 0.3717862665653229,
"drift/rejected_abs": 0.10653592646121979,
"epoch": 0.28663561447509855,
"grad_norm": 1.0625,
"learning_rate": 4.4541213973012e-07,
"logits/chosen": -1.9797508716583252,
"logits/rejected": -1.9465057849884033,
"logps/chosen": -0.3131170868873596,
"logps/rejected": -0.3174610435962677,
"loss": 0.7069228887557983,
"loss/core": 0.6806262731552124,
"loss/preference_sft": 0.3131170868873596,
"loss/reference_anchor": 0.49461978673934937,
"rewards/accuracies": 0.8500000238418579,
"rewards/chosen": 3.7166762351989746,
"rewards/margins": 2.6619973182678223,
"rewards/rejected": 1.0546791553497314,
"step": 300
},
{
"drift/chosen_abs": 0.21675559878349304,
"drift/rejected_abs": 0.08982045203447342,
"epoch": 0.2914128747163502,
"grad_norm": 0.4375,
"learning_rate": 4.4216942111429964e-07,
"logits/chosen": -2.1226086616516113,
"logits/rejected": -2.1839969158172607,
"logps/chosen": -0.26876428723335266,
"logps/rejected": -0.2606787085533142,
"loss": 0.6940160989761353,
"loss/core": 0.6869435906410217,
"loss/preference_sft": 0.26876428723335266,
"loss/reference_anchor": 0.11457415670156479,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 2.165956735610962,
"rewards/margins": 1.2678639888763428,
"rewards/rejected": 0.8980928659439087,
"step": 305
},
{
"drift/chosen_abs": 0.2610951066017151,
"drift/rejected_abs": 0.21184654533863068,
"epoch": 0.2961901349576018,
"grad_norm": 2.484375,
"learning_rate": 4.388456836797484e-07,
"logits/chosen": -2.1281096935272217,
"logits/rejected": -2.0378966331481934,
"logps/chosen": -0.2733157277107239,
"logps/rejected": -0.28335532546043396,
"loss": 0.7152631282806396,
"loss/core": 0.6907567977905273,
"loss/preference_sft": 0.2733157277107239,
"loss/reference_anchor": 0.46279603242874146,
"rewards/accuracies": 0.8500000238418579,
"rewards/chosen": 2.6094913482666016,
"rewards/margins": 0.6211642026901245,
"rewards/rejected": 1.9883270263671875,
"step": 310
},
{
"drift/chosen_abs": 0.2902871370315552,
"drift/rejected_abs": 0.13477492332458496,
"epoch": 0.30096739519885346,
"grad_norm": 0.271484375,
"learning_rate": 4.354423287174686e-07,
"logits/chosen": -1.9599071741104126,
"logits/rejected": -2.0659215450286865,
"logps/chosen": -0.27025145292282104,
"logps/rejected": -0.2758514881134033,
"loss": 0.698331892490387,
"loss/core": 0.6854726076126099,
"loss/preference_sft": 0.27025145292282104,
"loss/reference_anchor": 0.23015980422496796,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": 2.9021315574645996,
"rewards/margins": 1.5580607652664185,
"rewards/rejected": 1.3440710306167603,
"step": 315
},
{
"drift/chosen_abs": 0.15860998630523682,
"drift/rejected_abs": 0.12193727493286133,
"epoch": 0.3057446554401051,
"grad_norm": 0.244140625,
"learning_rate": 4.31960791085291e-07,
"logits/chosen": -1.9995390176773071,
"logits/rejected": -2.0159947872161865,
"logps/chosen": -0.28982076048851013,
"logps/rejected": -0.2935449182987213,
"loss": 0.6978195905685425,
"loss/core": 0.6914322376251221,
"loss/preference_sft": 0.28982076048851013,
"loss/reference_anchor": 0.09876595437526703,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 1.584044098854065,
"rewards/margins": 0.36467140913009644,
"rewards/rejected": 1.2193728685379028,
"step": 320
},
{
"drift/chosen_abs": 0.3709779977798462,
"drift/rejected_abs": 0.1553051918745041,
"epoch": 0.31052191568135673,
"grad_norm": 13.5625,
"learning_rate": 4.2840253860293806e-07,
"logits/chosen": -2.2568116188049316,
"logits/rejected": -2.2034993171691895,
"logps/chosen": -0.2853277027606964,
"logps/rejected": -0.2819185256958008,
"loss": 0.731056809425354,
"loss/core": 0.683963418006897,
"loss/preference_sft": 0.2853277027606964,
"loss/reference_anchor": 0.9133332967758179,
"rewards/accuracies": 0.8500000238418579,
"rewards/chosen": 3.708606004714966,
"rewards/margins": 2.156642436981201,
"rewards/rejected": 1.5519633293151855,
"step": 325
},
{
"drift/chosen_abs": 0.1991027593612671,
"drift/rejected_abs": 0.11322907358407974,
"epoch": 0.31529917592260837,
"grad_norm": 0.20703125,
"learning_rate": 4.24769071433189e-07,
"logits/chosen": -2.227357864379883,
"logits/rejected": -2.2161545753479004,
"logps/chosen": -0.2826363146305084,
"logps/rejected": -0.27046969532966614,
"loss": 0.6973029375076294,
"loss/core": 0.6889919638633728,
"loss/preference_sft": 0.2826363146305084,
"loss/reference_anchor": 0.13795623183250427,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": 1.9903936386108398,
"rewards/margins": 0.8586524724960327,
"rewards/rejected": 1.1317412853240967,
"step": 330
},
{
"drift/chosen_abs": 0.2119426280260086,
"drift/rejected_abs": 0.08484821766614914,
"epoch": 0.32007643616386,
"grad_norm": 3.09375,
"learning_rate": 4.2106192144940987e-07,
"logits/chosen": -2.0478832721710205,
"logits/rejected": -2.033395767211914,
"logps/chosen": -0.3026389479637146,
"logps/rejected": -0.32717952132225037,
"loss": 0.6988995671272278,
"loss/core": 0.6861973404884338,
"loss/preference_sft": 0.3026389479637146,
"loss/reference_anchor": 0.22377829253673553,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 2.1165146827697754,
"rewards/margins": 1.5143001079559326,
"rewards/rejected": 0.6022144556045532,
"step": 335
},
{
"drift/chosen_abs": 0.2043064534664154,
"drift/rejected_abs": 0.08732999116182327,
"epoch": 0.3248536964051117,
"grad_norm": 2.265625,
"learning_rate": 4.172826515897145e-07,
"logits/chosen": -2.094050645828247,
"logits/rejected": -2.2169277667999268,
"logps/chosen": -0.2799380123615265,
"logps/rejected": -0.28169578313827515,
"loss": 0.6966040134429932,
"loss/core": 0.6874774694442749,
"loss/preference_sft": 0.2799380123615265,
"loss/reference_anchor": 0.15453729033470154,
"rewards/accuracies": 0.9375,
"rewards/chosen": 2.0414788722991943,
"rewards/margins": 1.1714600324630737,
"rewards/rejected": 0.8700188398361206,
"step": 340
},
{
"drift/chosen_abs": 0.164683997631073,
"drift/rejected_abs": 0.08445769548416138,
"epoch": 0.3296309566463633,
"grad_norm": 0.4921875,
"learning_rate": 4.1343285519802783e-07,
"logits/chosen": -2.3189194202423096,
"logits/rejected": -2.378885269165039,
"logps/chosen": -0.2820732891559601,
"logps/rejected": -0.29256579279899597,
"loss": 0.6956444978713989,
"loss/core": 0.68927001953125,
"loss/preference_sft": 0.2820732891559601,
"loss/reference_anchor": 0.09928078949451447,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 1.6447336673736572,
"rewards/margins": 0.8007295727729797,
"rewards/rejected": 0.8440041542053223,
"step": 345
},
{
"drift/chosen_abs": 0.19914595782756805,
"drift/rejected_abs": 0.09469764679670334,
"epoch": 0.33440821688761496,
"grad_norm": 0.5234375,
"learning_rate": 4.0951415535233056e-07,
"logits/chosen": -2.0590832233428955,
"logits/rejected": -2.0390827655792236,
"logps/chosen": -0.2612057030200958,
"logps/rejected": -0.25672319531440735,
"loss": 0.6943715810775757,
"loss/core": 0.6880162954330444,
"loss/preference_sft": 0.2612057030200958,
"loss/reference_anchor": 0.10098560899496078,
"rewards/accuracies": 0.8374999761581421,
"rewards/chosen": 1.98989999294281,
"rewards/margins": 1.0453819036483765,
"rewards/rejected": 0.9445180892944336,
"step": 350
},
{
"drift/chosen_abs": 0.18552103638648987,
"drift/rejected_abs": 0.13385716080665588,
"epoch": 0.3391854771288666,
"grad_norm": 0.375,
"learning_rate": 4.0552820418036847e-07,
"logits/chosen": -2.1061980724334717,
"logits/rejected": -2.232513904571533,
"logps/chosen": -0.28036990761756897,
"logps/rejected": -0.29538074135780334,
"loss": 0.7025222182273865,
"loss/core": 0.6908389329910278,
"loss/preference_sft": 0.28036990761756897,
"loss/reference_anchor": 0.20562918484210968,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 1.8541920185089111,
"rewards/margins": 0.5308849215507507,
"rewards/rejected": 1.3233067989349365,
"step": 355
},
{
"drift/chosen_abs": 0.2627464234828949,
"drift/rejected_abs": 0.12656167149543762,
"epoch": 0.34396273737011823,
"grad_norm": 2.390625,
"learning_rate": 4.0147668216311276e-07,
"logits/chosen": -2.1296074390411377,
"logits/rejected": -2.192688465118408,
"logps/chosen": -0.2808237075805664,
"logps/rejected": -0.28292280435562134,
"loss": 0.7036789655685425,
"loss/core": 0.6867524981498718,
"loss/preference_sft": 0.2808237075805664,
"loss/reference_anchor": 0.310445636510849,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 2.626671314239502,
"rewards/margins": 1.3620039224624634,
"rewards/rejected": 1.2646673917770386,
"step": 360
},
{
"drift/chosen_abs": 0.2869020104408264,
"drift/rejected_abs": 0.08114350587129593,
"epoch": 0.34873999761136987,
"grad_norm": 9.625,
"learning_rate": 3.9736129742626843e-07,
"logits/chosen": -2.067612886428833,
"logits/rejected": -2.1757853031158447,
"logps/chosen": -0.2856762707233429,
"logps/rejected": -0.283938467502594,
"loss": 0.7096842527389526,
"loss/core": 0.683948278427124,
"loss/preference_sft": 0.2856762707233429,
"loss/reference_anchor": 0.4861505925655365,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 2.8673691749572754,
"rewards/margins": 2.0584607124328613,
"rewards/rejected": 0.8089081048965454,
"step": 365
},
{
"drift/chosen_abs": 0.1641189157962799,
"drift/rejected_abs": 0.10590697824954987,
"epoch": 0.3535172578526215,
"grad_norm": 1.296875,
"learning_rate": 3.931837850201263e-07,
"logits/chosen": -2.267899990081787,
"logits/rejected": -2.313075304031372,
"logps/chosen": -0.2852608561515808,
"logps/rejected": -0.28572216629981995,
"loss": 0.6960805654525757,
"loss/core": 0.6902772188186646,
"loss/preference_sft": 0.2852608561515808,
"loss/reference_anchor": 0.08754244446754456,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 1.640094518661499,
"rewards/margins": 0.5825773477554321,
"rewards/rejected": 1.0575170516967773,
"step": 370
},
{
"drift/chosen_abs": 0.30126437544822693,
"drift/rejected_abs": 0.2238939106464386,
"epoch": 0.35829451809387314,
"grad_norm": 0.37109375,
"learning_rate": 3.889459061880643e-07,
"logits/chosen": -2.046881914138794,
"logits/rejected": -2.0237812995910645,
"logps/chosen": -0.2588959336280823,
"logps/rejected": -0.25813889503479004,
"loss": 0.7113808393478394,
"loss/core": 0.6897670030593872,
"loss/preference_sft": 0.2588959336280823,
"loss/reference_anchor": 0.4063888192176819,
"rewards/accuracies": 0.875,
"rewards/chosen": 3.0123302936553955,
"rewards/margins": 0.7923107147216797,
"rewards/rejected": 2.220019817352295,
"step": 375
},
{
"drift/chosen_abs": 0.2056204378604889,
"drift/rejected_abs": 0.15891826152801514,
"epoch": 0.36307177833512483,
"grad_norm": 0.94140625,
"learning_rate": 3.846494476240056e-07,
"logits/chosen": -2.1194448471069336,
"logits/rejected": -2.1285529136657715,
"logps/chosen": -0.27972573041915894,
"logps/rejected": -0.2927209138870239,
"loss": 0.7116562128067017,
"loss/core": 0.6913924217224121,
"loss/preference_sft": 0.27972573041915894,
"loss/reference_anchor": 0.37730082869529724,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": 2.053956985473633,
"rewards/margins": 0.48597222566604614,
"rewards/rejected": 1.5679845809936523,
"step": 380
},
{
"drift/chosen_abs": 0.21692092716693878,
"drift/rejected_abs": 0.1518086940050125,
"epoch": 0.36784903857637646,
"grad_norm": 0.87109375,
"learning_rate": 3.8029622071914626e-07,
"logits/chosen": -2.1106455326080322,
"logits/rejected": -2.1308746337890625,
"logps/chosen": -0.2711559236049652,
"logps/rejected": -0.27569103240966797,
"loss": 0.7008264064788818,
"loss/core": 0.6900737881660461,
"loss/preference_sft": 0.2711559236049652,
"loss/reference_anchor": 0.18793678283691406,
"rewards/accuracies": 0.875,
"rewards/chosen": 2.168698787689209,
"rewards/margins": 0.6546289920806885,
"rewards/rejected": 1.514069676399231,
"step": 385
},
{
"drift/chosen_abs": 0.17692413926124573,
"drift/rejected_abs": 0.08787186443805695,
"epoch": 0.3726262988176281,
"grad_norm": 0.2119140625,
"learning_rate": 3.758880607982714e-07,
"logits/chosen": -1.869436502456665,
"logits/rejected": -1.9471441507339478,
"logps/chosen": -0.3066801428794861,
"logps/rejected": -0.3042067885398865,
"loss": 0.6953903436660767,
"loss/core": 0.6888266205787659,
"loss/preference_sft": 0.3066801428794861,
"loss/reference_anchor": 0.10060696303844452,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 1.7669336795806885,
"rewards/margins": 0.8882148861885071,
"rewards/rejected": 0.8787187337875366,
"step": 390
},
{
"drift/chosen_abs": 0.16815339028835297,
"drift/rejected_abs": 0.08043881505727768,
"epoch": 0.37740355905887973,
"grad_norm": 0.212890625,
"learning_rate": 3.714268263459801e-07,
"logits/chosen": -2.2196106910705566,
"logits/rejected": -2.3220858573913574,
"logps/chosen": -0.29513680934906006,
"logps/rejected": -0.28997355699539185,
"loss": 0.6943039894104004,
"loss/core": 0.6888213753700256,
"loss/preference_sft": 0.29513680934906006,
"loss/reference_anchor": 0.08013781160116196,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": 1.680734634399414,
"rewards/margins": 0.8773964643478394,
"rewards/rejected": 0.8033380508422852,
"step": 395
},
{
"drift/chosen_abs": 0.29227569699287415,
"drift/rejected_abs": 0.08427596837282181,
"epoch": 0.38218081930013137,
"grad_norm": 1.5390625,
"learning_rate": 3.6691439822314666e-07,
"logits/chosen": -2.1000590324401855,
"logits/rejected": -2.135270595550537,
"logps/chosen": -0.2931859791278839,
"logps/rejected": -0.2932865023612976,
"loss": 0.7107817530632019,
"loss/core": 0.6836472749710083,
"loss/preference_sft": 0.2931859791278839,
"loss/reference_anchor": 0.5133715867996216,
"rewards/accuracies": 0.8500000238418579,
"rewards/chosen": 2.9214870929718018,
"rewards/margins": 2.0816428661346436,
"rewards/rejected": 0.8398441076278687,
"step": 400
},
{
"drift/chosen_abs": 0.23128154873847961,
"drift/rejected_abs": 0.12374065816402435,
"epoch": 0.386958079541383,
"grad_norm": 0.310546875,
"learning_rate": 3.623526788739477e-07,
"logits/chosen": -2.131155014038086,
"logits/rejected": -2.1849007606506348,
"logps/chosen": -0.3152233064174652,
"logps/rejected": -0.3035925030708313,
"loss": 0.7062971591949463,
"loss/core": 0.6880842447280884,
"loss/preference_sft": 0.3152233064174652,
"loss/reference_anchor": 0.33273500204086304,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 2.312814235687256,
"rewards/margins": 1.0756020545959473,
"rewards/rejected": 1.2372119426727295,
"step": 405
},
{
"drift/chosen_abs": 0.20869719982147217,
"drift/rejected_abs": 0.11958236992359161,
"epoch": 0.39173533978263464,
"grad_norm": 0.71875,
"learning_rate": 3.5774359152378985e-07,
"logits/chosen": -2.248558521270752,
"logits/rejected": -2.2788643836975098,
"logps/chosen": -0.2772386372089386,
"logps/rejected": -0.28785425424575806,
"loss": 0.6970154047012329,
"loss/core": 0.6887233257293701,
"loss/preference_sft": 0.2772386372089386,
"loss/reference_anchor": 0.138116717338562,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 2.0857138633728027,
"rewards/margins": 0.8951884508132935,
"rewards/rejected": 1.1905254125595093,
"step": 410
},
{
"drift/chosen_abs": 0.09970752894878387,
"drift/rejected_abs": 0.03773488104343414,
"epoch": 0.3965126000238863,
"grad_norm": 0.2275390625,
"learning_rate": 3.530890793684759e-07,
"logits/chosen": -2.1164305210113525,
"logits/rejected": -2.1951279640197754,
"logps/chosen": -0.33025726675987244,
"logps/rejected": -0.32088834047317505,
"loss": 0.693244218826294,
"loss/core": 0.6900933384895325,
"loss/preference_sft": 0.33025726675987244,
"loss/reference_anchor": 0.02999264933168888,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": 0.9955142736434937,
"rewards/margins": 0.6189162731170654,
"rewards/rejected": 0.376598060131073,
"step": 415
},
{
"drift/chosen_abs": 0.2045033723115921,
"drift/rejected_abs": 0.07196368277072906,
"epoch": 0.40128986026513797,
"grad_norm": 1.9609375,
"learning_rate": 3.4839110475495146e-07,
"logits/chosen": -2.349240779876709,
"logits/rejected": -2.316765785217285,
"logps/chosen": -0.28340643644332886,
"logps/rejected": -0.2993830144405365,
"loss": 0.6966205835342407,
"loss/core": 0.6868051290512085,
"loss/preference_sft": 0.28340643644332886,
"loss/reference_anchor": 0.16796544194221497,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 2.0448544025421143,
"rewards/margins": 1.3295873403549194,
"rewards/rejected": 0.7152668237686157,
"step": 420
},
{
"drift/chosen_abs": 0.22461578249931335,
"drift/rejected_abs": 0.16200877726078033,
"epoch": 0.4060671205063896,
"grad_norm": 6.9375,
"learning_rate": 3.43651648353978e-07,
"logits/chosen": -2.012849807739258,
"logits/rejected": -2.072317123413086,
"logps/chosen": -0.29064491391181946,
"logps/rejected": -0.2678697109222412,
"loss": 0.7116137742996216,
"loss/core": 0.6908143758773804,
"loss/preference_sft": 0.29064491391181946,
"loss/reference_anchor": 0.3869226574897766,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": 2.2447874546051025,
"rewards/margins": 0.6263939142227173,
"rewards/rejected": 1.6183935403823853,
"step": 425
},
{
"drift/chosen_abs": 0.43855953216552734,
"drift/rejected_abs": 0.14190329611301422,
"epoch": 0.41084438074764124,
"grad_norm": 16.25,
"learning_rate": 3.388727083250795e-07,
"logits/chosen": -2.0672688484191895,
"logits/rejected": -2.0907437801361084,
"logps/chosen": -0.2815065085887909,
"logps/rejected": -0.26665714383125305,
"loss": 0.7262654304504395,
"loss/core": 0.6797505617141724,
"loss/preference_sft": 0.2815065085887909,
"loss/reference_anchor": 0.9021477699279785,
"rewards/accuracies": 0.875,
"rewards/chosen": 4.383257865905762,
"rewards/margins": 2.965740442276001,
"rewards/rejected": 1.4175175428390503,
"step": 430
},
{
"drift/chosen_abs": 0.162430077791214,
"drift/rejected_abs": 0.10076061636209488,
"epoch": 0.41562164098889287,
"grad_norm": 0.73046875,
"learning_rate": 3.3405629947411683e-07,
"logits/chosen": -2.350315570831299,
"logits/rejected": -2.3338377475738525,
"logps/chosen": -0.27856045961380005,
"logps/rejected": -0.293110191822052,
"loss": 0.6974702477455139,
"loss/core": 0.69013512134552,
"loss/preference_sft": 0.27856045961380005,
"loss/reference_anchor": 0.11884655803442001,
"rewards/accuracies": 0.8500000238418579,
"rewards/chosen": 1.6225159168243408,
"rewards/margins": 0.6160438656806946,
"rewards/rejected": 1.006471872329712,
"step": 435
},
{
"drift/chosen_abs": 0.299646258354187,
"drift/rejected_abs": 0.13414156436920166,
"epoch": 0.4203989012301445,
"grad_norm": 13.6875,
"learning_rate": 3.2920445240384325e-07,
"logits/chosen": -2.05702543258667,
"logits/rejected": -2.1284549236297607,
"logps/chosen": -0.3045402765274048,
"logps/rejected": -0.30474570393562317,
"loss": 0.711657702922821,
"loss/core": 0.6856769323348999,
"loss/preference_sft": 0.3045402765274048,
"loss/reference_anchor": 0.48916101455688477,
"rewards/accuracies": 0.8374999761581421,
"rewards/chosen": 2.993908643722534,
"rewards/margins": 1.6548278331756592,
"rewards/rejected": 1.339080810546875,
"step": 440
},
{
"drift/chosen_abs": 0.2965596318244934,
"drift/rejected_abs": 0.1601937860250473,
"epoch": 0.42517616147139614,
"grad_norm": 1.0078125,
"learning_rate": 3.2431921265780063e-07,
"logits/chosen": -1.9329261779785156,
"logits/rejected": -1.909558653831482,
"logps/chosen": -0.2952488958835602,
"logps/rejected": -0.298814594745636,
"loss": 0.7007791996002197,
"loss/core": 0.6862999796867371,
"loss/preference_sft": 0.2952488958835602,
"loss/reference_anchor": 0.2600591480731964,
"rewards/accuracies": 0.8500000238418579,
"rewards/chosen": 2.9641549587249756,
"rewards/margins": 1.417994737625122,
"rewards/rejected": 1.5461599826812744,
"step": 445
},
{
"drift/chosen_abs": 0.34632277488708496,
"drift/rejected_abs": 0.156765878200531,
"epoch": 0.4299534217126478,
"grad_norm": 13.0625,
"learning_rate": 3.1940263985791616e-07,
"logits/chosen": -1.973149061203003,
"logits/rejected": -1.990882158279419,
"logps/chosen": -0.297830194234848,
"logps/rejected": -0.2937723696231842,
"loss": 0.7078851461410522,
"loss/core": 0.6842607259750366,
"loss/preference_sft": 0.297830194234848,
"loss/reference_anchor": 0.44270557165145874,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 3.462675094604492,
"rewards/margins": 1.8995628356933594,
"rewards/rejected": 1.5631126165390015,
"step": 450
},
{
"drift/chosen_abs": 0.341677725315094,
"drift/rejected_abs": 0.14796192944049835,
"epoch": 0.4347306819538994,
"grad_norm": 4.9375,
"learning_rate": 3.144568068361634e-07,
"logits/chosen": -1.9354276657104492,
"logits/rejected": -2.1260530948638916,
"logps/chosen": -0.3276836574077606,
"logps/rejected": -0.3140363097190857,
"loss": 0.7205722332000732,
"loss/core": 0.6841714382171631,
"loss/preference_sft": 0.3276836574077606,
"loss/reference_anchor": 0.6952458620071411,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 3.415968418121338,
"rewards/margins": 1.9381797313690186,
"rewards/rejected": 1.4777886867523193,
"step": 455
},
{
"drift/chosen_abs": 0.3663923144340515,
"drift/rejected_abs": 0.18600957095623016,
"epoch": 0.4395079421951511,
"grad_norm": 1.1015625,
"learning_rate": 3.0948379876065465e-07,
"logits/chosen": -2.0609209537506104,
"logits/rejected": -2.048144578933716,
"logps/chosen": -0.2960844337940216,
"logps/rejected": -0.3075362741947174,
"loss": 0.7149934768676758,
"loss/core": 0.6845480799674988,
"loss/preference_sft": 0.2960844337940216,
"loss/reference_anchor": 0.579299807548523,
"rewards/accuracies": 0.9375,
"rewards/chosen": 3.6639232635498047,
"rewards/margins": 1.8042666912078857,
"rewards/rejected": 1.859656572341919,
"step": 460
},
{
"drift/chosen_abs": 0.23091194033622742,
"drift/rejected_abs": 0.09295056760311127,
"epoch": 0.44428520243640274,
"grad_norm": 0.341796875,
"learning_rate": 3.0448571225653193e-07,
"logits/chosen": -1.8885440826416016,
"logits/rejected": -1.988734245300293,
"logps/chosen": -0.29641199111938477,
"logps/rejected": -0.2917849123477936,
"loss": 0.6937438249588013,
"loss/core": 0.6863740682601929,
"loss/preference_sft": 0.29641199111938477,
"loss/reference_anchor": 0.11775638163089752,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": 2.3084988594055176,
"rewards/margins": 1.3800839185714722,
"rewards/rejected": 0.9284147024154663,
"step": 465
},
{
"drift/chosen_abs": 0.2984088957309723,
"drift/rejected_abs": 0.12458224594593048,
"epoch": 0.4490624626776544,
"grad_norm": 22.5,
"learning_rate": 2.9946465452202747e-07,
"logits/chosen": -2.1285500526428223,
"logits/rejected": -2.196565628051758,
"logps/chosen": -0.28165316581726074,
"logps/rejected": -0.2599329352378845,
"loss": 0.7142145037651062,
"loss/core": 0.6846899390220642,
"loss/preference_sft": 0.28165316581726074,
"loss/reference_anchor": 0.5623257756233215,
"rewards/accuracies": 0.9375,
"rewards/chosen": 2.984055757522583,
"rewards/margins": 1.8138116598129272,
"rewards/rejected": 1.170243501663208,
"step": 470
},
{
"drift/chosen_abs": 0.182987779378891,
"drift/rejected_abs": 0.14684465527534485,
"epoch": 0.453839722918906,
"grad_norm": 3.4375,
"learning_rate": 2.944227424400672e-07,
"logits/chosen": -2.0931344032287598,
"logits/rejected": -2.0336596965789795,
"logps/chosen": -0.29563307762145996,
"logps/rejected": -0.3208538889884949,
"loss": 0.7051785588264465,
"loss/core": 0.6917919516563416,
"loss/preference_sft": 0.29563307762145996,
"loss/reference_anchor": 0.23816709220409393,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 1.8292009830474854,
"rewards/margins": 0.3628115653991699,
"rewards/rejected": 1.4663891792297363,
"step": 475
},
{
"drift/chosen_abs": 0.23586270213127136,
"drift/rejected_abs": 0.10744066536426544,
"epoch": 0.45861698316015764,
"grad_norm": 0.466796875,
"learning_rate": 2.8936210168579037e-07,
"logits/chosen": -2.2626140117645264,
"logits/rejected": -2.318941593170166,
"logps/chosen": -0.275493860244751,
"logps/rejected": -0.2723752558231354,
"loss": 0.7019254565238953,
"loss/core": 0.6869186758995056,
"loss/preference_sft": 0.275493860244751,
"loss/reference_anchor": 0.27258676290512085,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 2.3575544357299805,
"rewards/margins": 1.3319319486618042,
"rewards/rejected": 1.0256226062774658,
"step": 480
},
{
"drift/chosen_abs": 0.17448770999908447,
"drift/rejected_abs": 0.08884555101394653,
"epoch": 0.4633942434014093,
"grad_norm": 0.478515625,
"learning_rate": 2.842848658303637e-07,
"logits/chosen": -2.2037127017974854,
"logits/rejected": -2.2105116844177246,
"logps/chosen": -0.29139575362205505,
"logps/rejected": -0.29565316438674927,
"loss": 0.694310188293457,
"loss/core": 0.6889179944992065,
"loss/preference_sft": 0.29139575362205505,
"loss/reference_anchor": 0.07870315760374069,
"rewards/accuracies": 0.875,
"rewards/chosen": 1.7447458505630493,
"rewards/margins": 0.8566008806228638,
"rewards/rejected": 0.8881451487541199,
"step": 485
},
{
"drift/chosen_abs": 0.20757827162742615,
"drift/rejected_abs": 0.10591663420200348,
"epoch": 0.4681715036426609,
"grad_norm": 0.65625,
"learning_rate": 2.79193175441464e-07,
"logits/chosen": -2.1531708240509033,
"logits/rejected": -2.1945109367370605,
"logps/chosen": -0.3073252737522125,
"logps/rejected": -0.29394882917404175,
"loss": 0.6971133947372437,
"loss/core": 0.688152015209198,
"loss/preference_sft": 0.3073252737522125,
"loss/reference_anchor": 0.1484949290752411,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 2.0757830142974854,
"rewards/margins": 1.0181604623794556,
"rewards/rejected": 1.0576225519180298,
"step": 490
},
{
"drift/chosen_abs": 0.25867894291877747,
"drift/rejected_abs": 0.08946122229099274,
"epoch": 0.47294876388391255,
"grad_norm": 0.390625,
"learning_rate": 2.74089177180815e-07,
"logits/chosen": -2.2221720218658447,
"logits/rejected": -2.3168718814849854,
"logps/chosen": -0.3004676401615143,
"logps/rejected": -0.29068127274513245,
"loss": 0.7042246460914612,
"loss/core": 0.6852529048919678,
"loss/preference_sft": 0.3004676401615143,
"loss/reference_anchor": 0.34938645362854004,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 2.584899663925171,
"rewards/margins": 1.6914997100830078,
"rewards/rejected": 0.8933998346328735,
"step": 495
},
{
"drift/chosen_abs": 0.4131302833557129,
"drift/rejected_abs": 0.20293641090393066,
"epoch": 0.47772602412516424,
"grad_norm": 4.125,
"learning_rate": 2.6897502289915026e-07,
"logits/chosen": -2.021841526031494,
"logits/rejected": -1.9711917638778687,
"logps/chosen": -0.28432515263557434,
"logps/rejected": -0.3025287389755249,
"loss": 0.741477370262146,
"loss/core": 0.6841000318527222,
"loss/preference_sft": 0.28432515263557434,
"loss/reference_anchor": 1.1191157102584839,
"rewards/accuracies": 0.875,
"rewards/chosen": 4.131275177001953,
"rewards/margins": 2.104186534881592,
"rewards/rejected": 2.0270884037017822,
"step": 500
},
{
"drift/chosen_abs": 0.36249279975891113,
"drift/rejected_abs": 0.1847756803035736,
"epoch": 0.4825032843664159,
"grad_norm": 6.1875,
"learning_rate": 2.638528687289925e-07,
"logits/chosen": -2.1491918563842773,
"logits/rejected": -2.1820521354675293,
"logps/chosen": -0.2843039035797119,
"logps/rejected": -0.28839248418807983,
"loss": 0.7243824005126953,
"loss/core": 0.6854826807975769,
"loss/preference_sft": 0.2843039035797119,
"loss/reference_anchor": 0.7495636940002441,
"rewards/accuracies": 0.8125,
"rewards/chosen": 3.623505115509033,
"rewards/margins": 1.8764804601669312,
"rewards/rejected": 1.7470247745513916,
"step": 505
},
{
"drift/chosen_abs": 0.20058460533618927,
"drift/rejected_abs": 0.08017744868993759,
"epoch": 0.4872805446076675,
"grad_norm": 0.1259765625,
"learning_rate": 2.5872487417562527e-07,
"logits/chosen": -2.1467156410217285,
"logits/rejected": -2.2804579734802246,
"logps/chosen": -0.3167296051979065,
"logps/rejected": -0.2912823259830475,
"loss": 0.6994425654411316,
"loss/core": 0.6874934434890747,
"loss/preference_sft": 0.3167296051979065,
"loss/reference_anchor": 0.2073097974061966,
"rewards/accuracies": 0.875,
"rewards/chosen": 2.002615451812744,
"rewards/margins": 1.2019274234771729,
"rewards/rejected": 0.8006879687309265,
"step": 510
},
{
"drift/chosen_abs": 0.2543594241142273,
"drift/rejected_abs": 0.16676507890224457,
"epoch": 0.49205780484891914,
"grad_norm": 0.38671875,
"learning_rate": 2.535932012066433e-07,
"logits/chosen": -2.0313689708709717,
"logits/rejected": -2.034614324569702,
"logps/chosen": -0.2830977141857147,
"logps/rejected": -0.3066386282444,
"loss": 0.7011044025421143,
"loss/core": 0.6888419985771179,
"loss/preference_sft": 0.2830977141857147,
"loss/reference_anchor": 0.216938778758049,
"rewards/accuracies": 0.800000011920929,
"rewards/chosen": 2.5404956340789795,
"rewards/margins": 0.8886449933052063,
"rewards/rejected": 1.6518504619598389,
"step": 515
},
{
"drift/chosen_abs": 0.30793458223342896,
"drift/rejected_abs": 0.09768765419721603,
"epoch": 0.4968350650901708,
"grad_norm": 2.0,
"learning_rate": 2.4846001334046535e-07,
"logits/chosen": -2.058237314224243,
"logits/rejected": -2.226836681365967,
"logps/chosen": -0.322182834148407,
"logps/rejected": -0.33398357033729553,
"loss": 0.7052879929542542,
"loss/core": 0.6832786798477173,
"loss/preference_sft": 0.322182834148407,
"loss/reference_anchor": 0.4079677164554596,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 3.0726497173309326,
"rewards/margins": 2.1081771850585938,
"rewards/rejected": 0.9644724726676941,
"step": 520
},
{
"drift/chosen_abs": 0.42069754004478455,
"drift/rejected_abs": 0.14602303504943848,
"epoch": 0.5016123253314224,
"grad_norm": 30.625,
"learning_rate": 2.433274747341919e-07,
"logits/chosen": -2.194186210632324,
"logits/rejected": -2.162163496017456,
"logps/chosen": -0.3106693625450134,
"logps/rejected": -0.30101826786994934,
"loss": 0.73024982213974,
"loss/core": 0.6811276078224182,
"loss/preference_sft": 0.3106693625450134,
"loss/reference_anchor": 0.951376736164093,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 4.204687118530273,
"rewards/margins": 2.749366521835327,
"rewards/rejected": 1.455320119857788,
"step": 525
},
{
"drift/chosen_abs": 0.30520981550216675,
"drift/rejected_abs": 0.1496325582265854,
"epoch": 0.5063895855726741,
"grad_norm": 0.140625,
"learning_rate": 2.3819774927119522e-07,
"logits/chosen": -2.0378127098083496,
"logits/rejected": -2.001634359359741,
"logps/chosen": -0.28599685430526733,
"logps/rejected": -0.28872916102409363,
"loss": 0.7070541977882385,
"loss/core": 0.6858066320419312,
"loss/preference_sft": 0.28599685430526733,
"loss/reference_anchor": 0.3963504433631897,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 3.050769090652466,
"rewards/margins": 1.5627717971801758,
"rewards/rejected": 1.4879971742630005,
"step": 530
},
{
"drift/chosen_abs": 0.30915752053260803,
"drift/rejected_abs": 0.10786645114421844,
"epoch": 0.5111668458139257,
"grad_norm": 13.6875,
"learning_rate": 2.3307299964882312e-07,
"logits/chosen": -2.186264991760254,
"logits/rejected": -2.108275890350342,
"logps/chosen": -0.2858208417892456,
"logps/rejected": -0.27927789092063904,
"loss": 0.7080153226852417,
"loss/core": 0.6839091181755066,
"loss/preference_sft": 0.2858208417892456,
"loss/reference_anchor": 0.4535427987575531,
"rewards/accuracies": 0.875,
"rewards/chosen": 3.0912933349609375,
"rewards/margins": 2.0143520832061768,
"rewards/rejected": 1.0769412517547607,
"step": 535
},
{
"drift/chosen_abs": 0.15930701792240143,
"drift/rejected_abs": 0.14954623579978943,
"epoch": 0.5159441060551774,
"grad_norm": 0.193359375,
"learning_rate": 2.279553864666046e-07,
"logits/chosen": -2.106029748916626,
"logits/rejected": -2.0835556983947754,
"logps/chosen": -0.27827921509742737,
"logps/rejected": -0.2890811562538147,
"loss": 0.7021555304527283,
"loss/core": 0.6928835511207581,
"loss/preference_sft": 0.27827921509742737,
"loss/reference_anchor": 0.15761205554008484,
"rewards/accuracies": 0.875,
"rewards/chosen": 1.5930081605911255,
"rewards/margins": 0.09992774575948715,
"rewards/rejected": 1.4930803775787354,
"step": 540
},
{
"drift/chosen_abs": 0.26317763328552246,
"drift/rejected_abs": 0.08720904588699341,
"epoch": 0.520721366296429,
"grad_norm": 23.375,
"learning_rate": 2.22847067315338e-07,
"logits/chosen": -2.331496477127075,
"logits/rejected": -2.172362804412842,
"logps/chosen": -0.2841755151748657,
"logps/rejected": -0.2938932776451111,
"loss": 0.7100147008895874,
"loss/core": 0.6851332187652588,
"loss/preference_sft": 0.2841755151748657,
"loss/reference_anchor": 0.46921229362487793,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 2.6317765712738037,
"rewards/margins": 1.762070655822754,
"rewards/rejected": 0.8697060346603394,
"step": 545
},
{
"drift/chosen_abs": 0.2769598066806793,
"drift/rejected_abs": 0.16232618689537048,
"epoch": 0.5254986265376806,
"grad_norm": 0.53515625,
"learning_rate": 2.1775019586744921e-07,
"logits/chosen": -1.8962993621826172,
"logits/rejected": -1.9161226749420166,
"logps/chosen": -0.27603915333747864,
"logps/rejected": -0.2979462742805481,
"loss": 0.7087868452072144,
"loss/core": 0.6875404119491577,
"loss/preference_sft": 0.27603915333747864,
"loss/reference_anchor": 0.3973239064216614,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": 2.7692787647247314,
"rewards/margins": 1.1475410461425781,
"rewards/rejected": 1.6217377185821533,
"step": 550
},
{
"drift/chosen_abs": 0.32226184010505676,
"drift/rejected_abs": 0.09745451807975769,
"epoch": 0.5302758867789323,
"grad_norm": 0.2578125,
"learning_rate": 2.126669209690008e-07,
"logits/chosen": -2.0920777320861816,
"logits/rejected": -2.14959979057312,
"logps/chosen": -0.31904277205467224,
"logps/rejected": -0.2770870327949524,
"loss": 0.7026501893997192,
"loss/core": 0.6825853586196899,
"loss/preference_sft": 0.31904277205467224,
"loss/reference_anchor": 0.3693930506706238,
"rewards/accuracies": 0.875,
"rewards/chosen": 3.221327543258667,
"rewards/margins": 2.247218608856201,
"rewards/rejected": 0.9741086959838867,
"step": 555
},
{
"drift/chosen_abs": 0.2818199098110199,
"drift/rejected_abs": 0.1541328728199005,
"epoch": 0.5350531470201839,
"grad_norm": 0.609375,
"learning_rate": 2.075993857337368e-07,
"logits/chosen": -2.180386781692505,
"logits/rejected": -2.1680946350097656,
"logps/chosen": -0.2756226062774658,
"logps/rejected": -0.27983418107032776,
"loss": 0.7056413888931274,
"loss/core": 0.6869414448738098,
"loss/preference_sft": 0.2756226062774658,
"loss/reference_anchor": 0.3464350402355194,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": 2.816300868988037,
"rewards/margins": 1.276263952255249,
"rewards/rejected": 1.540036916732788,
"step": 560
},
{
"drift/chosen_abs": 0.2778550386428833,
"drift/rejected_abs": 0.16609425842761993,
"epoch": 0.5398304072614356,
"grad_norm": 0.3203125,
"learning_rate": 2.0254972663954353e-07,
"logits/chosen": -2.0759246349334717,
"logits/rejected": -2.1022229194641113,
"logps/chosen": -0.2878085672855377,
"logps/rejected": -0.3052247166633606,
"loss": 0.7213435173034668,
"loss/core": 0.6878103017807007,
"loss/preference_sft": 0.2878085672855377,
"loss/reference_anchor": 0.6418825387954712,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 2.7778897285461426,
"rewards/margins": 1.1175713539123535,
"rewards/rejected": 1.6603180170059204,
"step": 565
},
{
"drift/chosen_abs": 0.3346030116081238,
"drift/rejected_abs": 0.16794054210186005,
"epoch": 0.5446076675026872,
"grad_norm": 2.421875,
"learning_rate": 1.9752007262770854e-07,
"logits/chosen": -2.0751147270202637,
"logits/rejected": -2.1243863105773926,
"logps/chosen": -0.28862354159355164,
"logps/rejected": -0.28968754410743713,
"loss": 0.7091944813728333,
"loss/core": 0.6851403713226318,
"loss/preference_sft": 0.28862354159355164,
"loss/reference_anchor": 0.45222073793411255,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 3.3444488048553467,
"rewards/margins": 1.6680787801742554,
"rewards/rejected": 1.6763699054718018,
"step": 570
},
{
"drift/chosen_abs": 0.18410475552082062,
"drift/rejected_abs": 0.0659659132361412,
"epoch": 0.5493849277439389,
"grad_norm": 0.3046875,
"learning_rate": 1.9251254420535664e-07,
"logits/chosen": -2.152061939239502,
"logits/rejected": -2.1839194297790527,
"logps/chosen": -0.3009091913700104,
"logps/rejected": -0.32279980182647705,
"loss": 0.6969389319419861,
"loss/core": 0.6871550679206848,
"loss/preference_sft": 0.3009091913700104,
"loss/reference_anchor": 0.16558721661567688,
"rewards/accuracies": 0.824999988079071,
"rewards/chosen": 1.84026300907135,
"rewards/margins": 1.2756303548812866,
"rewards/rejected": 0.5646325349807739,
"step": 575
},
{
"drift/chosen_abs": 0.1417587250471115,
"drift/rejected_abs": 0.09436655044555664,
"epoch": 0.5541621879851905,
"grad_norm": 0.1552734375,
"learning_rate": 1.8752925255144224e-07,
"logits/chosen": -2.428544044494629,
"logits/rejected": -2.4844648838043213,
"logps/chosen": -0.26681989431381226,
"logps/rejected": -0.28266364336013794,
"loss": 0.696236252784729,
"loss/core": 0.690847635269165,
"loss/preference_sft": 0.26681989431381226,
"loss/reference_anchor": 0.08109016716480255,
"rewards/accuracies": 0.875,
"rewards/chosen": 1.4170500040054321,
"rewards/margins": 0.47523316740989685,
"rewards/rejected": 0.9418169260025024,
"step": 580
},
{
"drift/chosen_abs": 0.22228363156318665,
"drift/rejected_abs": 0.13576579093933105,
"epoch": 0.5589394482264421,
"grad_norm": 0.5390625,
"learning_rate": 1.8257229862667433e-07,
"logits/chosen": -2.1347758769989014,
"logits/rejected": -2.0975234508514404,
"logps/chosen": -0.2703164219856262,
"logps/rejected": -0.28436440229415894,
"loss": 0.7252476811408997,
"loss/core": 0.6889234781265259,
"loss/preference_sft": 0.2703164219856262,
"loss/reference_anchor": 0.6994535326957703,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 2.221714496612549,
"rewards/margins": 0.8691756129264832,
"rewards/rejected": 1.3525389432907104,
"step": 585
},
{
"drift/chosen_abs": 0.3615594506263733,
"drift/rejected_abs": 0.10348814725875854,
"epoch": 0.5637167084676937,
"grad_norm": 0.2373046875,
"learning_rate": 1.7764377228774873e-07,
"logits/chosen": -2.0233283042907715,
"logits/rejected": -2.119215250015259,
"logps/chosen": -0.28815799951553345,
"logps/rejected": -0.2871782183647156,
"loss": 0.7047743797302246,
"loss/core": 0.6811040639877319,
"loss/preference_sft": 0.28815799951553345,
"loss/reference_anchor": 0.44459062814712524,
"rewards/accuracies": 0.9375,
"rewards/chosen": 3.6147727966308594,
"rewards/margins": 2.584536075592041,
"rewards/rejected": 1.0302363634109497,
"step": 590
},
{
"drift/chosen_abs": 0.17077796161174774,
"drift/rejected_abs": 0.08986127376556396,
"epoch": 0.5684939687089454,
"grad_norm": 0.43359375,
"learning_rate": 1.7274575140626315e-07,
"logits/chosen": -2.044630765914917,
"logits/rejected": -2.03894305229187,
"logps/chosen": -0.27572837471961975,
"logps/rejected": -0.2722456455230713,
"loss": 0.6933053135871887,
"loss/core": 0.6890828013420105,
"loss/preference_sft": 0.27572837471961975,
"loss/reference_anchor": 0.056876588612794876,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 1.705609917640686,
"rewards/margins": 0.8199650049209595,
"rewards/rejected": 0.8856450319290161,
"step": 595
},
{
"drift/chosen_abs": 0.18729227781295776,
"drift/rejected_abs": 0.10635222494602203,
"epoch": 0.5732712289501971,
"grad_norm": 0.703125,
"learning_rate": 1.6788030099268407e-07,
"logits/chosen": -2.2757256031036377,
"logits/rejected": -2.265326738357544,
"logps/chosen": -0.26656943559646606,
"logps/rejected": -0.28453245759010315,
"loss": 0.6980012655258179,
"loss/core": 0.6892417073249817,
"loss/preference_sft": 0.26656943559646606,
"loss/reference_anchor": 0.14853349328041077,
"rewards/accuracies": 0.8500000238418579,
"rewards/chosen": 1.8706554174423218,
"rewards/margins": 0.809914767742157,
"rewards/rejected": 1.0607407093048096,
"step": 600
},
{
"drift/chosen_abs": 0.41853857040405273,
"drift/rejected_abs": 0.12051737308502197,
"epoch": 0.5780484891914487,
"grad_norm": 1.2265625,
"learning_rate": 1.630494723257363e-07,
"logits/chosen": -2.1154239177703857,
"logits/rejected": -2.1893069744110107,
"logps/chosen": -0.28015339374542236,
"logps/rejected": -0.27586129307746887,
"loss": 0.7251626253128052,
"loss/core": 0.6798030138015747,
"loss/preference_sft": 0.28015339374542236,
"loss/reference_anchor": 0.8791759610176086,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 4.183618068695068,
"rewards/margins": 2.979365110397339,
"rewards/rejected": 1.2042533159255981,
"step": 605
},
{
"drift/chosen_abs": 0.4256836473941803,
"drift/rejected_abs": 0.19338993728160858,
"epoch": 0.5828257494327004,
"grad_norm": 1.65625,
"learning_rate": 1.5825530208758198e-07,
"logits/chosen": -2.1129722595214844,
"logits/rejected": -2.1302802562713623,
"logps/chosen": -0.2779896557331085,
"logps/rejected": -0.27780717611312866,
"loss": 0.7297109961509705,
"loss/core": 0.6822241544723511,
"loss/preference_sft": 0.2779896557331085,
"loss/reference_anchor": 0.9219374656677246,
"rewards/accuracies": 0.8374999761581421,
"rewards/chosen": 4.254659175872803,
"rewards/margins": 2.343705177307129,
"rewards/rejected": 1.9109541177749634,
"step": 610
},
{
"drift/chosen_abs": 0.2733246088027954,
"drift/rejected_abs": 0.14853966236114502,
"epoch": 0.587603009673952,
"grad_norm": 0.5,
"learning_rate": 1.534998115051533e-07,
"logits/chosen": -1.9654070138931274,
"logits/rejected": -2.0324883460998535,
"logps/chosen": -0.31496065855026245,
"logps/rejected": -0.30436021089553833,
"loss": 0.7030231952667236,
"loss/core": 0.6871589422225952,
"loss/preference_sft": 0.31496065855026245,
"loss/reference_anchor": 0.2857890725135803,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 2.7304234504699707,
"rewards/margins": 1.2481533288955688,
"rewards/rejected": 1.4822700023651123,
"step": 615
},
{
"drift/chosen_abs": 0.1698610484600067,
"drift/rejected_abs": 0.14360573887825012,
"epoch": 0.5923802699152036,
"grad_norm": 0.373046875,
"learning_rate": 1.4878500549800112e-07,
"logits/chosen": -2.1398520469665527,
"logits/rejected": -2.166027069091797,
"logps/chosen": -0.28533971309661865,
"logps/rejected": -0.29425957798957825,
"loss": 0.7028168439865112,
"loss/core": 0.6921274662017822,
"loss/preference_sft": 0.28533971309661865,
"loss/reference_anchor": 0.18525299429893494,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 1.6973737478256226,
"rewards/margins": 0.26329460740089417,
"rewards/rejected": 1.4340791702270508,
"step": 620
},
{
"drift/chosen_abs": 0.3897588551044464,
"drift/rejected_abs": 0.17362374067306519,
"epoch": 0.5971575301564552,
"grad_norm": 29.375,
"learning_rate": 1.4411287183301902e-07,
"logits/chosen": -1.9303457736968994,
"logits/rejected": -1.958958625793457,
"logps/chosen": -0.30389657616615295,
"logps/rejected": -0.347369909286499,
"loss": 0.7363072633743286,
"loss/core": 0.6822855472564697,
"loss/preference_sft": 0.30389657616615295,
"loss/reference_anchor": 1.0500433444976807,
"rewards/accuracies": 0.8500000238418579,
"rewards/chosen": 3.895702362060547,
"rewards/margins": 2.4964680671691895,
"rewards/rejected": 1.3992340564727783,
"step": 625
},
{
"drift/chosen_abs": 0.29475387930870056,
"drift/rejected_abs": 0.12502244114875793,
"epoch": 0.6019347903977069,
"grad_norm": 5.09375,
"learning_rate": 1.394853802863985e-07,
"logits/chosen": -1.929779052734375,
"logits/rejected": -2.04491925239563,
"logps/chosen": -0.27201491594314575,
"logps/rejected": -0.2829875349998474,
"loss": 0.7087033987045288,
"loss/core": 0.685075581073761,
"loss/preference_sft": 0.27201491594314575,
"loss/reference_anchor": 0.44535598158836365,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": 2.9475390911102295,
"rewards/margins": 1.699634313583374,
"rewards/rejected": 1.2479045391082764,
"step": 630
},
{
"drift/chosen_abs": 0.2301911860704422,
"drift/rejected_abs": 0.10143622010946274,
"epoch": 0.6067120506389586,
"grad_norm": 4.9375,
"learning_rate": 1.3490448181317024e-07,
"logits/chosen": -1.981834053993225,
"logits/rejected": -2.0678226947784424,
"logps/chosen": -0.3054197430610657,
"logps/rejected": -0.30018460750579834,
"loss": 0.6994880437850952,
"loss/core": 0.687004566192627,
"loss/preference_sft": 0.3054197430610657,
"loss/reference_anchor": 0.21912848949432373,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 2.3007302284240723,
"rewards/margins": 1.2872453927993774,
"rewards/rejected": 1.0134851932525635,
"step": 635
},
{
"drift/chosen_abs": 0.1967557668685913,
"drift/rejected_abs": 0.07957569509744644,
"epoch": 0.6114893108802102,
"grad_norm": 0.25390625,
"learning_rate": 1.303721077246784e-07,
"logits/chosen": -2.207252264022827,
"logits/rejected": -2.2832891941070557,
"logps/chosen": -0.30064091086387634,
"logps/rejected": -0.29895979166030884,
"loss": 0.6989712119102478,
"loss/core": 0.6875656843185425,
"loss/preference_sft": 0.30064091086387634,
"loss/reference_anchor": 0.19804587960243225,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": 1.9660539627075195,
"rewards/margins": 1.1706269979476929,
"rewards/rejected": 0.7954270839691162,
"step": 640
},
{
"drift/chosen_abs": 0.16765008866786957,
"drift/rejected_abs": 0.11835210025310516,
"epoch": 0.6162665711214619,
"grad_norm": 0.86328125,
"learning_rate": 1.2589016887433846e-07,
"logits/chosen": -2.1545424461364746,
"logits/rejected": -2.1316208839416504,
"logps/chosen": -0.29050302505493164,
"logps/rejected": -0.3003830313682556,
"loss": 0.6977421045303345,
"loss/core": 0.6908085942268372,
"loss/preference_sft": 0.29050302505493164,
"loss/reference_anchor": 0.10962003469467163,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 1.6752145290374756,
"rewards/margins": 0.49554985761642456,
"rewards/rejected": 1.1796646118164062,
"step": 645
},
{
"drift/chosen_abs": 0.13382819294929504,
"drift/rejected_abs": 0.0856524258852005,
"epoch": 0.6210438313627135,
"grad_norm": 0.3046875,
"learning_rate": 1.2146055485201943e-07,
"logits/chosen": -2.22021222114563,
"logits/rejected": -2.171934127807617,
"logps/chosen": -0.28915685415267944,
"logps/rejected": -0.29866427183151245,
"loss": 0.6960299015045166,
"loss/core": 0.6908055543899536,
"loss/preference_sft": 0.28915685415267944,
"loss/reference_anchor": 0.075570248067379,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 1.3368127346038818,
"rewards/margins": 0.4924766421318054,
"rewards/rejected": 0.844336211681366,
"step": 650
},
{
"drift/chosen_abs": 0.20044943690299988,
"drift/rejected_abs": 0.09594675153493881,
"epoch": 0.6258210916039652,
"grad_norm": 2.671875,
"learning_rate": 1.1708513318739094e-07,
"logits/chosen": -2.0582327842712402,
"logits/rejected": -2.1220715045928955,
"logps/chosen": -0.282463014125824,
"logps/rejected": -0.29273414611816406,
"loss": 0.6957246661186218,
"loss/core": 0.6880175471305847,
"loss/preference_sft": 0.282463014125824,
"loss/reference_anchor": 0.125896617770195,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 2.002502918243408,
"rewards/margins": 1.0442477464675903,
"rewards/rejected": 0.9582554697990417,
"step": 655
},
{
"drift/chosen_abs": 0.27859437465667725,
"drift/rejected_abs": 0.1346025913953781,
"epoch": 0.6305983518452167,
"grad_norm": 0.2265625,
"learning_rate": 1.1276574856257095e-07,
"logits/chosen": -2.0280890464782715,
"logits/rejected": -2.0235238075256348,
"logps/chosen": -0.29317161440849304,
"logps/rejected": -0.3068060576915741,
"loss": 0.7208054065704346,
"loss/core": 0.6866048574447632,
"loss/preference_sft": 0.29317161440849304,
"loss/reference_anchor": 0.6546904444694519,
"rewards/accuracies": 0.875,
"rewards/chosen": 2.784419536590576,
"rewards/margins": 1.4846069812774658,
"rewards/rejected": 1.2998125553131104,
"step": 660
},
{
"drift/chosen_abs": 0.23545166850090027,
"drift/rejected_abs": 0.14730089902877808,
"epoch": 0.6353756120864684,
"grad_norm": 2.484375,
"learning_rate": 1.0850422203440554e-07,
"logits/chosen": -2.188843250274658,
"logits/rejected": -2.1637561321258545,
"logps/chosen": -0.2837633192539215,
"logps/rejected": -0.2823261618614197,
"loss": 0.7029173374176025,
"loss/core": 0.6890594363212585,
"loss/preference_sft": 0.2837633192539215,
"loss/reference_anchor": 0.24877965450286865,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 2.353299379348755,
"rewards/margins": 0.8823181390762329,
"rewards/rejected": 1.470981240272522,
"step": 665
},
{
"drift/chosen_abs": 0.3646673560142517,
"drift/rejected_abs": 0.12857022881507874,
"epoch": 0.64015287232772,
"grad_norm": 0.2197265625,
"learning_rate": 1.0430235026670978e-07,
"logits/chosen": -1.9835231304168701,
"logits/rejected": -2.0292749404907227,
"logps/chosen": -0.27422162890434265,
"logps/rejected": -0.32053428888320923,
"loss": 0.7076139450073242,
"loss/core": 0.6819421648979187,
"loss/preference_sft": 0.27422162890434265,
"loss/reference_anchor": 0.4860144555568695,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 3.6459412574768066,
"rewards/margins": 2.392371654510498,
"rewards/rejected": 1.2535693645477295,
"step": 670
},
{
"drift/chosen_abs": 0.162667378783226,
"drift/rejected_abs": 0.0890541672706604,
"epoch": 0.6449301325689717,
"grad_norm": 0.73046875,
"learning_rate": 1.0016190477279274e-07,
"logits/chosen": -2.0347633361816406,
"logits/rejected": -2.0776588916778564,
"logps/chosen": -0.2881300151348114,
"logps/rejected": -0.2884693443775177,
"loss": 0.6940901875495911,
"loss/core": 0.6894824504852295,
"loss/preference_sft": 0.2881300151348114,
"loss/reference_anchor": 0.06333953142166138,
"rewards/accuracies": 0.875,
"rewards/chosen": 1.6251804828643799,
"rewards/margins": 0.74686199426651,
"rewards/rejected": 0.8783184885978699,
"step": 675
},
{
"drift/chosen_abs": 0.21540336310863495,
"drift/rejected_abs": 0.1353510469198227,
"epoch": 0.6497073928102234,
"grad_norm": 0.2265625,
"learning_rate": 9.608463116858542e-08,
"logits/chosen": -2.1595706939697266,
"logits/rejected": -2.077641725540161,
"logps/chosen": -0.2814193069934845,
"logps/rejected": -0.29484206438064575,
"loss": 0.7012907266616821,
"loss/core": 0.6893535852432251,
"loss/preference_sft": 0.2814193069934845,
"loss/reference_anchor": 0.21059997379779816,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 2.1523005962371826,
"rewards/margins": 0.7994104623794556,
"rewards/rejected": 1.3528902530670166,
"step": 680
},
{
"drift/chosen_abs": 0.28880634903907776,
"drift/rejected_abs": 0.15391790866851807,
"epoch": 0.654484653051475,
"grad_norm": 0.30078125,
"learning_rate": 9.207224843668731e-08,
"logits/chosen": -2.0853352546691895,
"logits/rejected": -2.0695528984069824,
"logps/chosen": -0.25348979234695435,
"logps/rejected": -0.27719801664352417,
"loss": 0.7120725512504578,
"loss/core": 0.6871707439422607,
"loss/preference_sft": 0.25348979234695435,
"loss/reference_anchor": 0.47268733382225037,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 2.887314558029175,
"rewards/margins": 1.3541991710662842,
"rewards/rejected": 1.5331155061721802,
"step": 685
},
{
"drift/chosen_abs": 0.17689254879951477,
"drift/rejected_abs": 0.10154334455728531,
"epoch": 0.6592619132927267,
"grad_norm": 0.26171875,
"learning_rate": 8.812644820164158e-08,
"logits/chosen": -1.8848329782485962,
"logits/rejected": -1.9065767526626587,
"logps/chosen": -0.30832767486572266,
"logps/rejected": -0.33626437187194824,
"loss": 0.6952409744262695,
"loss/core": 0.6894530057907104,
"loss/preference_sft": 0.30832767486572266,
"loss/reference_anchor": 0.08492577075958252,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 1.7667601108551025,
"rewards/margins": 0.7572234869003296,
"rewards/rejected": 1.0095365047454834,
"step": 690
},
{
"drift/chosen_abs": 0.19672070443630219,
"drift/rejected_abs": 0.06929643452167511,
"epoch": 0.6640391735339782,
"grad_norm": 0.2197265625,
"learning_rate": 8.424889401674504e-08,
"logits/chosen": -2.270711660385132,
"logits/rejected": -2.279158115386963,
"logps/chosen": -0.3068528175354004,
"logps/rejected": -0.29276537895202637,
"loss": 0.6979945302009583,
"loss/core": 0.6870979070663452,
"loss/preference_sft": 0.3068528175354004,
"loss/reference_anchor": 0.18724682927131653,
"rewards/accuracies": 0.875,
"rewards/chosen": 1.9648374319076538,
"rewards/margins": 1.2810237407684326,
"rewards/rejected": 0.6838136911392212,
"step": 695
},
{
"drift/chosen_abs": 0.22341635823249817,
"drift/rejected_abs": 0.15612784028053284,
"epoch": 0.6688164337752299,
"grad_norm": 16.875,
"learning_rate": 8.044122066269149e-08,
"logits/chosen": -2.1035265922546387,
"logits/rejected": -2.2100517749786377,
"logps/chosen": -0.2964898943901062,
"logps/rejected": -0.32455042004585266,
"loss": 0.7034405469894409,
"loss/core": 0.6898477673530579,
"loss/preference_sft": 0.2964898943901062,
"loss/reference_anchor": 0.2422069013118744,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 2.2336838245391846,
"rewards/margins": 0.6977290511131287,
"rewards/rejected": 1.5359545946121216,
"step": 700
},
{
"drift/chosen_abs": 0.3399743437767029,
"drift/rejected_abs": 0.1532609462738037,
"epoch": 0.6735936940164815,
"grad_norm": 1.3984375,
"learning_rate": 7.670503345834755e-08,
"logits/chosen": -2.1955857276916504,
"logits/rejected": -2.152186870574951,
"logps/chosen": -0.28090688586235046,
"logps/rejected": -0.26746469736099243,
"loss": 0.7058395743370056,
"loss/core": 0.6843441724777222,
"loss/preference_sft": 0.28090688586235046,
"loss/reference_anchor": 0.40181976556777954,
"rewards/accuracies": 0.875,
"rewards/chosen": 3.399095058441162,
"rewards/margins": 1.8677432537078857,
"rewards/rejected": 1.531352162361145,
"step": 705
},
{
"drift/chosen_abs": 0.35864269733428955,
"drift/rejected_abs": 0.18870094418525696,
"epoch": 0.6783709542577332,
"grad_norm": 12.5,
"learning_rate": 7.304190758394774e-08,
"logits/chosen": -1.886185884475708,
"logits/rejected": -1.873063325881958,
"logps/chosen": -0.2785230278968811,
"logps/rejected": -0.2990533411502838,
"loss": 0.7196978330612183,
"loss/core": 0.6850727796554565,
"loss/preference_sft": 0.2785230278968811,
"loss/reference_anchor": 0.6646484136581421,
"rewards/accuracies": 0.875,
"rewards/chosen": 3.5836358070373535,
"rewards/margins": 1.6989152431488037,
"rewards/rejected": 1.884720802307129,
"step": 710
},
{
"drift/chosen_abs": 0.18634703755378723,
"drift/rejected_abs": 0.09215612709522247,
"epoch": 0.6831482144989849,
"grad_norm": 0.330078125,
"learning_rate": 6.945338741699769e-08,
"logits/chosen": -2.252730131149292,
"logits/rejected": -2.2337136268615723,
"logps/chosen": -0.2843503952026367,
"logps/rejected": -0.3452153205871582,
"loss": 0.7017387747764587,
"loss/core": 0.6871799826622009,
"loss/preference_sft": 0.2843503952026367,
"loss/reference_anchor": 0.26274123787879944,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 1.863227128982544,
"rewards/margins": 1.2492995262145996,
"rewards/rejected": 0.6139274835586548,
"step": 715
},
{
"drift/chosen_abs": 0.20980620384216309,
"drift/rejected_abs": 0.14841270446777344,
"epoch": 0.6879254747402365,
"grad_norm": 0.4921875,
"learning_rate": 6.594098588116243e-08,
"logits/chosen": -1.9954087734222412,
"logits/rejected": -2.003382921218872,
"logps/chosen": -0.29687029123306274,
"logps/rejected": -0.30213814973831177,
"loss": 0.7040995955467224,
"loss/core": 0.6903706789016724,
"loss/preference_sft": 0.29687029123306274,
"loss/reference_anchor": 0.24489395320415497,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 2.096773624420166,
"rewards/margins": 0.6157442927360535,
"rewards/rejected": 1.4810290336608887,
"step": 720
},
{
"drift/chosen_abs": 0.1588420420885086,
"drift/rejected_abs": 0.0730825662612915,
"epoch": 0.6927027349814882,
"grad_norm": 0.3203125,
"learning_rate": 6.25061838084166e-08,
"logits/chosen": -2.1225600242614746,
"logits/rejected": -2.238051176071167,
"logps/chosen": -0.2854083180427551,
"logps/rejected": -0.277433305978775,
"loss": 0.6947664022445679,
"loss/core": 0.6889495253562927,
"loss/preference_sft": 0.2854083180427551,
"loss/reference_anchor": 0.08779795467853546,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 1.5876481533050537,
"rewards/margins": 0.8577953577041626,
"rewards/rejected": 0.7298528552055359,
"step": 725
},
{
"drift/chosen_abs": 0.10160217434167862,
"drift/rejected_abs": 0.08643589913845062,
"epoch": 0.6974799952227397,
"grad_norm": 13.8125,
"learning_rate": 5.915042931472425e-08,
"logits/chosen": -2.218738317489624,
"logits/rejected": -2.2675373554229736,
"logps/chosen": -0.28681716322898865,
"logps/rejected": -0.2953147888183594,
"loss": 0.6986241340637207,
"loss/core": 0.6925312876701355,
"loss/preference_sft": 0.28681716322898865,
"loss/reference_anchor": 0.09317411482334137,
"rewards/accuracies": 0.9375,
"rewards/chosen": 1.015641689300537,
"rewards/margins": 0.15372122824192047,
"rewards/rejected": 0.8619204759597778,
"step": 730
},
{
"drift/chosen_abs": 0.14239996671676636,
"drift/rejected_abs": 0.06578416377305984,
"epoch": 0.7022572554639914,
"grad_norm": 1.5625,
"learning_rate": 5.587513718951165e-08,
"logits/chosen": -2.047664165496826,
"logits/rejected": -2.09497332572937,
"logps/chosen": -0.31937894225120544,
"logps/rejected": -0.3183499276638031,
"loss": 0.6945558786392212,
"loss/core": 0.6893695592880249,
"loss/preference_sft": 0.31937894225120544,
"loss/reference_anchor": 0.0717906728386879,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 1.4239996671676636,
"rewards/margins": 0.7663625478744507,
"rewards/rejected": 0.6576371192932129,
"step": 735
},
{
"drift/chosen_abs": 0.25790858268737793,
"drift/rejected_abs": 0.17992377281188965,
"epoch": 0.707034515705243,
"grad_norm": 0.34765625,
"learning_rate": 5.2681688299190455e-08,
"logits/chosen": -2.1005473136901855,
"logits/rejected": -2.1174521446228027,
"logps/chosen": -0.31155890226364136,
"logps/rejected": -0.31915396451950073,
"loss": 0.7307167649269104,
"loss/core": 0.6908460259437561,
"loss/preference_sft": 0.31155890226364136,
"loss/reference_anchor": 0.7662578821182251,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 2.579061985015869,
"rewards/margins": 0.779824435710907,
"rewards/rejected": 1.799237608909607,
"step": 740
},
{
"drift/chosen_abs": 0.3101605176925659,
"drift/rejected_abs": 0.1494651436805725,
"epoch": 0.7118117759464947,
"grad_norm": 7.6875,
"learning_rate": 4.957142900498334e-08,
"logits/chosen": -2.0538952350616455,
"logits/rejected": -2.0975911617279053,
"logps/chosen": -0.29252904653549194,
"logps/rejected": -0.28451254963874817,
"loss": 0.7017096281051636,
"loss/core": 0.6854857206344604,
"loss/preference_sft": 0.29252904653549194,
"loss/reference_anchor": 0.29522526264190674,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 3.100473403930664,
"rewards/margins": 1.6103368997573853,
"rewards/rejected": 1.4901363849639893,
"step": 745
},
{
"drift/chosen_abs": 0.1206597089767456,
"drift/rejected_abs": 0.12509042024612427,
"epoch": 0.7165890361877463,
"grad_norm": 9.8125,
"learning_rate": 4.654567059529668e-08,
"logits/chosen": -2.1884284019470215,
"logits/rejected": -2.180311679840088,
"logps/chosen": -0.31168606877326965,
"logps/rejected": -0.30455487966537476,
"loss": 0.7092859745025635,
"loss/core": 0.6938542127609253,
"loss/preference_sft": 0.31168606877326965,
"loss/reference_anchor": 0.27746719121932983,
"rewards/accuracies": 0.8374999761581421,
"rewards/chosen": 1.206160306930542,
"rewards/margins": -0.0409439317882061,
"rewards/rejected": 1.2471041679382324,
"step": 750
},
{
"drift/chosen_abs": 0.23872093856334686,
"drift/rejected_abs": 0.17086395621299744,
"epoch": 0.721366296428998,
"grad_norm": 0.3515625,
"learning_rate": 4.360568873288009e-08,
"logits/chosen": -1.9273812770843506,
"logits/rejected": -1.8365058898925781,
"logps/chosen": -0.3087690770626068,
"logps/rejected": -0.29509294033050537,
"loss": 0.7011326551437378,
"loss/core": 0.6899515390396118,
"loss/preference_sft": 0.3087690770626068,
"loss/reference_anchor": 0.19274473190307617,
"rewards/accuracies": 0.8500000238418579,
"rewards/chosen": 2.384294033050537,
"rewards/margins": 0.682456374168396,
"rewards/rejected": 1.7018375396728516,
"step": 755
},
{
"drift/chosen_abs": 0.19956620037555695,
"drift/rejected_abs": 0.08658763021230698,
"epoch": 0.7261435566702497,
"grad_norm": 0.33984375,
"learning_rate": 4.075272291700557e-08,
"logits/chosen": -2.1839423179626465,
"logits/rejected": -2.2009308338165283,
"logps/chosen": -0.30236124992370605,
"logps/rejected": -0.29375168681144714,
"loss": 0.6960939168930054,
"loss/core": 0.6876411437988281,
"loss/preference_sft": 0.30236124992370605,
"loss/reference_anchor": 0.13882040977478027,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 1.9942079782485962,
"rewards/margins": 1.1320140361785889,
"rewards/rejected": 0.8621941804885864,
"step": 760
},
{
"drift/chosen_abs": 0.17910103499889374,
"drift/rejected_abs": 0.10586283355951309,
"epoch": 0.7309208169115012,
"grad_norm": 0.69921875,
"learning_rate": 3.798797596089351e-08,
"logits/chosen": -2.0851759910583496,
"logits/rejected": -2.157111644744873,
"logps/chosen": -0.2764049172401428,
"logps/rejected": -0.27264276146888733,
"loss": 0.6968425512313843,
"loss/core": 0.6895520091056824,
"loss/preference_sft": 0.2764049172401428,
"loss/reference_anchor": 0.1181713119149208,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 1.790848970413208,
"rewards/margins": 0.7349028587341309,
"rewards/rejected": 1.0559461116790771,
"step": 765
},
{
"drift/chosen_abs": 0.36868372559547424,
"drift/rejected_abs": 0.23421208560466766,
"epoch": 0.7356980771527529,
"grad_norm": 0.326171875,
"learning_rate": 3.531261348460554e-08,
"logits/chosen": -1.9794762134552002,
"logits/rejected": -1.945230484008789,
"logps/chosen": -0.31459537148475647,
"logps/rejected": -0.28590553998947144,
"loss": 0.7430247664451599,
"loss/core": 0.6873718500137329,
"loss/preference_sft": 0.31459537148475647,
"loss/reference_anchor": 1.0815989971160889,
"rewards/accuracies": 0.8374999761581421,
"rewards/chosen": 3.6851744651794434,
"rewards/margins": 1.344879388809204,
"rewards/rejected": 2.3402953147888184,
"step": 770
},
{
"drift/chosen_abs": 0.15195751190185547,
"drift/rejected_abs": 0.09389922767877579,
"epoch": 0.7404753373940045,
"grad_norm": 0.2109375,
"learning_rate": 3.272776342361791e-08,
"logits/chosen": -2.0958571434020996,
"logits/rejected": -2.123683452606201,
"logps/chosen": -0.30696946382522583,
"logps/rejected": -0.3006220757961273,
"loss": 0.6954344511032104,
"loss/core": 0.6903113722801208,
"loss/preference_sft": 0.30696946382522583,
"loss/reference_anchor": 0.07176429778337479,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 1.519211769104004,
"rewards/margins": 0.5804935693740845,
"rewards/rejected": 0.9387180209159851,
"step": 775
},
{
"drift/chosen_abs": 0.18850034475326538,
"drift/rejected_abs": 0.12492908537387848,
"epoch": 0.7452525976352562,
"grad_norm": 0.359375,
"learning_rate": 3.023451555328252e-08,
"logits/chosen": -2.181946277618408,
"logits/rejected": -2.1955080032348633,
"logps/chosen": -0.30274689197540283,
"logps/rejected": -0.30594930052757263,
"loss": 0.6972261667251587,
"loss/core": 0.6900213956832886,
"loss/preference_sft": 0.30274689197540283,
"loss/reference_anchor": 0.11382057517766953,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 1.8849332332611084,
"rewards/margins": 0.6389666795730591,
"rewards/rejected": 1.2459665536880493,
"step": 780
},
{
"drift/chosen_abs": 0.3422924876213074,
"drift/rejected_abs": 0.13462868332862854,
"epoch": 0.7500298578765078,
"grad_norm": 0.240234375,
"learning_rate": 2.7833921029376817e-08,
"logits/chosen": -1.9921424388885498,
"logits/rejected": -1.949812650680542,
"logps/chosen": -0.3121167719364166,
"logps/rejected": -0.2942814230918884,
"loss": 0.7160924673080444,
"loss/core": 0.6839752197265625,
"loss/preference_sft": 0.3121167719364166,
"loss/reference_anchor": 0.6111334562301636,
"rewards/accuracies": 0.8500000238418579,
"rewards/chosen": 3.419778347015381,
"rewards/margins": 2.079742431640625,
"rewards/rejected": 1.3400366306304932,
"step": 785
},
{
"drift/chosen_abs": 0.26127004623413086,
"drift/rejected_abs": 0.19187363982200623,
"epoch": 0.7548071181177595,
"grad_norm": 11.3125,
"learning_rate": 2.5526991944935488e-08,
"logits/chosen": -2.168665647506714,
"logits/rejected": -1.9961109161376953,
"logps/chosen": -0.2868359684944153,
"logps/rejected": -0.3195565342903137,
"loss": 0.720409095287323,
"loss/core": 0.6900395750999451,
"loss/preference_sft": 0.2868359684944153,
"loss/reference_anchor": 0.5787058472633362,
"rewards/accuracies": 0.8374999761581421,
"rewards/chosen": 2.6118552684783936,
"rewards/margins": 0.6948817372322083,
"rewards/rejected": 1.916973352432251,
"step": 790
},
{
"drift/chosen_abs": 0.23737922310829163,
"drift/rejected_abs": 0.11862516403198242,
"epoch": 0.7595843783590112,
"grad_norm": 0.5,
"learning_rate": 2.3314700903550838e-08,
"logits/chosen": -1.9713795185089111,
"logits/rejected": -1.989896535873413,
"logps/chosen": -0.3081986904144287,
"logps/rejected": -0.29614824056625366,
"loss": 0.7151690721511841,
"loss/core": 0.6874554753303528,
"loss/preference_sft": 0.3081986904144287,
"loss/reference_anchor": 0.5234512090682983,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": 2.3726906776428223,
"rewards/margins": 1.1869637966156006,
"rewards/rejected": 1.185726523399353,
"step": 795
},
{
"drift/chosen_abs": 0.22930972278118134,
"drift/rejected_abs": 0.11694236099720001,
"epoch": 0.7643616386002627,
"grad_norm": 0.31640625,
"learning_rate": 2.11979806093224e-08,
"logits/chosen": -2.1524062156677246,
"logits/rejected": -2.1292905807495117,
"logps/chosen": -0.28981950879096985,
"logps/rejected": -0.2884742319583893,
"loss": 0.696781575679779,
"loss/core": 0.6877356767654419,
"loss/preference_sft": 0.28981950879096985,
"loss/reference_anchor": 0.1519363820552826,
"rewards/accuracies": 0.8374999761581421,
"rewards/chosen": 2.2911429405212402,
"rewards/margins": 1.1217482089996338,
"rewards/rejected": 1.1693947315216064,
"step": 800
},
{
"drift/chosen_abs": 0.22585976123809814,
"drift/rejected_abs": 0.19897663593292236,
"epoch": 0.7691388988415144,
"grad_norm": 0.73828125,
"learning_rate": 1.9177723473627643e-08,
"logits/chosen": -2.0267646312713623,
"logits/rejected": -2.014665126800537,
"logps/chosen": -0.27477264404296875,
"logps/rejected": -0.2703710198402405,
"loss": 0.706299901008606,
"loss/core": 0.6920345425605774,
"loss/preference_sft": 0.27477264404296875,
"loss/reference_anchor": 0.2578306198120117,
"rewards/accuracies": 0.824999988079071,
"rewards/chosen": 2.2579760551452637,
"rewards/margins": 0.2697838544845581,
"rewards/rejected": 1.9881923198699951,
"step": 805
},
{
"drift/chosen_abs": 0.15302561223506927,
"drift/rejected_abs": 0.14136184751987457,
"epoch": 0.773916159082766,
"grad_norm": 0.404296875,
"learning_rate": 1.7254781238880828e-08,
"logits/chosen": -2.2281618118286133,
"logits/rejected": -2.132458209991455,
"logps/chosen": -0.30843856930732727,
"logps/rejected": -0.32327035069465637,
"loss": 0.7003055810928345,
"loss/core": 0.6927086114883423,
"loss/preference_sft": 0.30843856930732727,
"loss/reference_anchor": 0.12109792232513428,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 1.5288832187652588,
"rewards/margins": 0.11678824573755264,
"rewards/rejected": 1.4120948314666748,
"step": 810
},
{
"drift/chosen_abs": 0.2130151093006134,
"drift/rejected_abs": 0.11095918715000153,
"epoch": 0.7786934193240177,
"grad_norm": 1.53125,
"learning_rate": 1.5429964619437158e-08,
"logits/chosen": -2.0964717864990234,
"logits/rejected": -2.1862375736236572,
"logps/chosen": -0.2831994891166687,
"logps/rejected": -0.28318652510643005,
"loss": 0.6956707239151001,
"loss/core": 0.6880777478218079,
"loss/preference_sft": 0.2831994891166687,
"loss/reference_anchor": 0.1235402375459671,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": 2.1292998790740967,
"rewards/margins": 1.024322509765625,
"rewards/rejected": 1.1049773693084717,
"step": 815
},
{
"drift/chosen_abs": 0.19676700234413147,
"drift/rejected_abs": 0.0735253393650055,
"epoch": 0.7834706795652693,
"grad_norm": 0.2158203125,
"learning_rate": 1.3704042959795131e-08,
"logits/chosen": -2.1000118255615234,
"logits/rejected": -2.133841037750244,
"logps/chosen": -0.28775379061698914,
"logps/rejected": -0.3174736201763153,
"loss": 0.6944074034690857,
"loss/core": 0.6869372129440308,
"loss/preference_sft": 0.28775379061698914,
"loss/reference_anchor": 0.12063012272119522,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 1.9654747247695923,
"rewards/margins": 1.2821400165557861,
"rewards/rejected": 0.6833347082138062,
"step": 820
},
{
"drift/chosen_abs": 0.24645988643169403,
"drift/rejected_abs": 0.1214875802397728,
"epoch": 0.788247939806521,
"grad_norm": 1.0546875,
"learning_rate": 1.2077743910239996e-08,
"logits/chosen": -2.1431891918182373,
"logits/rejected": -2.247856616973877,
"logps/chosen": -0.3019647002220154,
"logps/rejected": -0.28489747643470764,
"loss": 0.696218729019165,
"loss/core": 0.6870028972625732,
"loss/preference_sft": 0.3019647002220154,
"loss/reference_anchor": 0.15411940217018127,
"rewards/accuracies": 0.949999988079071,
"rewards/chosen": 2.4645986557006836,
"rewards/margins": 1.2513694763183594,
"rewards/rejected": 1.2132294178009033,
"step": 825
},
{
"drift/chosen_abs": 0.17260222136974335,
"drift/rejected_abs": 0.1575520932674408,
"epoch": 0.7930252000477725,
"grad_norm": 0.52734375,
"learning_rate": 1.0551753120065621e-08,
"logits/chosen": -2.17891263961792,
"logits/rejected": -2.12709379196167,
"logps/chosen": -0.2786734700202942,
"logps/rejected": -0.31584739685058594,
"loss": 0.7015553116798401,
"loss/core": 0.692550539970398,
"loss/preference_sft": 0.2786734700202942,
"loss/reference_anchor": 0.15222761034965515,
"rewards/accuracies": 0.875,
"rewards/chosen": 1.724945306777954,
"rewards/margins": 0.15078657865524292,
"rewards/rejected": 1.5741586685180664,
"step": 830
},
{
"drift/chosen_abs": 0.24012541770935059,
"drift/rejected_abs": 0.11180107295513153,
"epoch": 0.7978024602890242,
"grad_norm": 1.71875,
"learning_rate": 9.126713948504228e-09,
"logits/chosen": -2.094947099685669,
"logits/rejected": -2.0943989753723145,
"logps/chosen": -0.2551843822002411,
"logps/rejected": -0.29870468378067017,
"loss": 0.6966162919998169,
"loss/core": 0.685853123664856,
"loss/preference_sft": 0.2551843822002411,
"loss/reference_anchor": 0.18974518775939941,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 2.3995418548583984,
"rewards/margins": 1.5449695587158203,
"rewards/rejected": 0.8545724749565125,
"step": 835
},
{
"drift/chosen_abs": 0.26994588971138,
"drift/rejected_abs": 0.10432889312505722,
"epoch": 0.8025797205302759,
"grad_norm": 61.0,
"learning_rate": 7.803227193485334e-09,
"logits/chosen": -2.03291916847229,
"logits/rejected": -2.0835347175598145,
"logps/chosen": -0.33308959007263184,
"logps/rejected": -0.30082958936691284,
"loss": 0.7072250843048096,
"loss/core": 0.6854801177978516,
"loss/preference_sft": 0.33308959007263184,
"loss/reference_anchor": 0.4015893340110779,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 2.696979522705078,
"rewards/margins": 1.6540577411651611,
"rewards/rejected": 1.042922019958496,
"step": 840
},
{
"drift/chosen_abs": 0.14128538966178894,
"drift/rejected_abs": 0.06555317342281342,
"epoch": 0.8073569807715275,
"grad_norm": 0.296875,
"learning_rate": 6.581850838338815e-09,
"logits/chosen": -2.1707913875579834,
"logits/rejected": -2.2462358474731445,
"logps/chosen": -0.29429852962493896,
"logps/rejected": -0.3137997090816498,
"loss": 0.6939007043838501,
"loss/core": 0.688424825668335,
"loss/preference_sft": 0.29429852962493896,
"loss/reference_anchor": 0.0800880640745163,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 1.4111610651016235,
"rewards/margins": 0.9817382097244263,
"rewards/rejected": 0.42942291498184204,
"step": 845
},
{
"drift/chosen_abs": 0.1559392213821411,
"drift/rejected_abs": 0.09002901613712311,
"epoch": 0.8121342410127792,
"grad_norm": 2.640625,
"learning_rate": 5.463099816548577e-09,
"logits/chosen": -2.2900779247283936,
"logits/rejected": -2.3381993770599365,
"logps/chosen": -0.25206631422042847,
"logps/rejected": -0.24866075813770294,
"loss": 0.6935194730758667,
"loss/core": 0.6898444294929504,
"loss/preference_sft": 0.25206631422042847,
"loss/reference_anchor": 0.0482938326895237,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 1.557403564453125,
"rewards/margins": 0.6683042645454407,
"rewards/rejected": 0.8890994191169739,
"step": 850
},
{
"drift/chosen_abs": 0.26853224635124207,
"drift/rejected_abs": 0.12536677718162537,
"epoch": 0.8169115012540308,
"grad_norm": 0.890625,
"learning_rate": 4.447445794656224e-09,
"logits/chosen": -2.002507209777832,
"logits/rejected": -2.0403895378112793,
"logps/chosen": -0.3012729287147522,
"logps/rejected": -0.2928231358528137,
"loss": 0.7090455293655396,
"loss/core": 0.6863538026809692,
"loss/preference_sft": 0.3012729287147522,
"loss/reference_anchor": 0.42370709776878357,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 2.6843512058258057,
"rewards/margins": 1.4311248064041138,
"rewards/rejected": 1.253226399421692,
"step": 855
},
{
"drift/chosen_abs": 0.4081405997276306,
"drift/rejected_abs": 0.19295448064804077,
"epoch": 0.8216887614952825,
"grad_norm": 0.1943359375,
"learning_rate": 3.535316973405672e-09,
"logits/chosen": -1.9501336812973022,
"logits/rejected": -2.0376601219177246,
"logps/chosen": -0.3001163601875305,
"logps/rejected": -0.30008673667907715,
"loss": 0.7247797250747681,
"loss/core": 0.6830560564994812,
"loss/preference_sft": 0.3001163601875305,
"loss/reference_anchor": 0.8044621348381042,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 4.080620765686035,
"rewards/margins": 2.163020610809326,
"rewards/rejected": 1.9175999164581299,
"step": 860
},
{
"drift/chosen_abs": 0.24484309554100037,
"drift/rejected_abs": 0.15850794315338135,
"epoch": 0.826466021736534,
"grad_norm": 0.8359375,
"learning_rate": 2.7270979072135104e-09,
"logits/chosen": -1.9584686756134033,
"logits/rejected": -2.0302765369415283,
"logps/chosen": -0.29134422540664673,
"logps/rejected": -0.2941442131996155,
"loss": 0.7054814696311951,
"loss/core": 0.6891493797302246,
"loss/preference_sft": 0.29134422540664673,
"loss/reference_anchor": 0.29750776290893555,
"rewards/accuracies": 0.8374999761581421,
"rewards/chosen": 2.447580099105835,
"rewards/margins": 0.864477813243866,
"rewards/rejected": 1.5831019878387451,
"step": 865
},
{
"drift/chosen_abs": 0.3205713629722595,
"drift/rejected_abs": 0.09417042136192322,
"epoch": 0.8312432819777857,
"grad_norm": 0.59765625,
"learning_rate": 2.0231293420405195e-09,
"logits/chosen": -2.1127753257751465,
"logits/rejected": -2.1212573051452637,
"logps/chosen": -0.3091801106929779,
"logps/rejected": -0.2969990670681,
"loss": 0.7111729979515076,
"loss/core": 0.6829420924186707,
"loss/preference_sft": 0.3091801106929779,
"loss/reference_anchor": 0.533698320388794,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 3.204364776611328,
"rewards/margins": 2.2668018341064453,
"rewards/rejected": 0.9375633001327515,
"step": 870
},
{
"drift/chosen_abs": 0.18526910245418549,
"drift/rejected_abs": 0.10249395668506622,
"epoch": 0.8360205422190374,
"grad_norm": 0.396484375,
"learning_rate": 1.423708071732671e-09,
"logits/chosen": -2.1826789379119873,
"logits/rejected": -2.230438232421875,
"logps/chosen": -0.30893266201019287,
"logps/rejected": -0.33167764544487,
"loss": 0.7087309956550598,
"loss/core": 0.6893488168716431,
"loss/preference_sft": 0.30893266201019287,
"loss/reference_anchor": 0.3567507863044739,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": 1.8521311283111572,
"rewards/margins": 0.8370383381843567,
"rewards/rejected": 1.0150927305221558,
"step": 875
},
{
"drift/chosen_abs": 0.24597208201885223,
"drift/rejected_abs": 0.18042945861816406,
"epoch": 0.840797802460289,
"grad_norm": 1.0625,
"learning_rate": 9.290868128926377e-10,
"logits/chosen": -2.1186165809631348,
"logits/rejected": -2.100987672805786,
"logps/chosen": -0.2905484139919281,
"logps/rejected": -0.3378651738166809,
"loss": 0.7146252393722534,
"loss/core": 0.6903001666069031,
"loss/preference_sft": 0.2905484139919281,
"loss/reference_anchor": 0.4574460983276367,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 2.4589881896972656,
"rewards/margins": 0.7572067379951477,
"rewards/rejected": 1.7017812728881836,
"step": 880
},
{
"drift/chosen_abs": 0.2725023329257965,
"drift/rejected_abs": 0.11308582872152328,
"epoch": 0.8455750627015407,
"grad_norm": 0.373046875,
"learning_rate": 5.394740983341861e-10,
"logits/chosen": -2.043205976486206,
"logits/rejected": -2.1195883750915527,
"logps/chosen": -0.2826032042503357,
"logps/rejected": -0.27686744928359985,
"loss": 0.6973305940628052,
"loss/core": 0.6853419542312622,
"loss/preference_sft": 0.2826032042503357,
"loss/reference_anchor": 0.2115131914615631,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": 2.724541187286377,
"rewards/margins": 1.5997540950775146,
"rewards/rejected": 1.1247870922088623,
"step": 885
},
{
"drift/chosen_abs": 0.2453497350215912,
"drift/rejected_abs": 0.14477917551994324,
"epoch": 0.8503523229427923,
"grad_norm": 5.6875,
"learning_rate": 2.550341891646435e-10,
"logits/chosen": -1.9740431308746338,
"logits/rejected": -2.0952517986297607,
"logps/chosen": -0.30029481649398804,
"logps/rejected": -0.2738454043865204,
"loss": 0.7060577869415283,
"loss/core": 0.6884250640869141,
"loss/preference_sft": 0.30029481649398804,
"loss/reference_anchor": 0.32262665033340454,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 2.4530909061431885,
"rewards/margins": 1.009745717048645,
"rewards/rejected": 1.443345308303833,
"step": 890
},
{
"drift/chosen_abs": 0.22996075451374054,
"drift/rejected_abs": 0.1483142226934433,
"epoch": 0.855129583184044,
"grad_norm": 2.015625,
"learning_rate": 7.588700553209926e-11,
"logits/chosen": -2.0447440147399902,
"logits/rejected": -2.0767829418182373,
"logps/chosen": -0.27262455224990845,
"logps/rejected": -0.2941727340221405,
"loss": 0.6983267068862915,
"loss/core": 0.6891483068466187,
"loss/preference_sft": 0.27262455224990845,
"loss/reference_anchor": 0.15630510449409485,
"rewards/accuracies": 0.8500000238418579,
"rewards/chosen": 2.2990550994873047,
"rewards/margins": 0.8220510482788086,
"rewards/rejected": 1.477004051208496,
"step": 895
},
{
"drift/chosen_abs": 0.30940914154052734,
"drift/rejected_abs": 0.08630160987377167,
"epoch": 0.8599068434252956,
"grad_norm": 0.65234375,
"learning_rate": 2.1080760670144636e-12,
"logits/chosen": -2.055746555328369,
"logits/rejected": -2.1760077476501465,
"logps/chosen": -0.2712702453136444,
"logps/rejected": -0.268751323223114,
"loss": 0.7091078758239746,
"loss/core": 0.6829676032066345,
"loss/preference_sft": 0.2712702453136444,
"loss/reference_anchor": 0.4956776201725006,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": 3.0939459800720215,
"rewards/margins": 2.2492384910583496,
"rewards/rejected": 0.8447073101997375,
"step": 900
},
{
"epoch": 0.8599068434252956,
"step": 900,
"total_flos": 0.0,
"train_loss": 0.7066660939322578,
"train_runtime": 7291.0823,
"train_samples_per_second": 1.975,
"train_steps_per_second": 0.123
}
],
"logging_steps": 5,
"max_steps": 900,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 900,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}