Files
ronpo-qwen3-8b-fair-sppo-av…/trainer_state.json

3644 lines
136 KiB
JSON
Raw Normal View History

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.8599068434252956,
"eval_steps": 500,
"global_step": 900,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"drift/chosen_abs": 0.241798996925354,
"drift/rejected_abs": 0.09728006273508072,
"epoch": 0.004777260241251642,
"grad_norm": 30.875,
"learning_rate": 1.111111111111111e-08,
"logits/chosen": -1.9988330602645874,
"logits/rejected": -2.015357494354248,
"logps/chosen": -0.279768705368042,
"logps/rejected": -0.28206831216812134,
"loss": 0.39691096544265747,
"loss/core": 0.3805164694786072,
"loss/preference_sft": 0.279768705368042,
"loss/reference_anchor": 0.19061610102653503,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 2.4163806438446045,
"rewards/margins": 1.4569675922393799,
"rewards/rejected": 0.9594132304191589,
"step": 5
},
{
"drift/chosen_abs": 0.16912893950939178,
"drift/rejected_abs": 0.16102473437786102,
"epoch": 0.009554520482503284,
"grad_norm": 716.0,
"learning_rate": 2.5e-08,
"logits/chosen": -2.344573497772217,
"logits/rejected": -2.3923327922821045,
"logps/chosen": -0.28925657272338867,
"logps/rejected": -0.28922492265701294,
"loss": 1.0646731853485107,
"loss/core": 1.0241014957427979,
"loss/preference_sft": 0.28925657272338867,
"loss/reference_anchor": 0.5120292901992798,
"rewards/accuracies": 0.875,
"rewards/chosen": 1.6911067962646484,
"rewards/margins": 0.08549212664365768,
"rewards/rejected": 1.6056146621704102,
"step": 10
},
{
"drift/chosen_abs": 0.21334102749824524,
"drift/rejected_abs": 0.11430090665817261,
"epoch": 0.014331780723754926,
"grad_norm": 100.0,
"learning_rate": 3.888888888888889e-08,
"logits/chosen": -2.2332091331481934,
"logits/rejected": -2.1960010528564453,
"logps/chosen": -0.27760133147239685,
"logps/rejected": -0.28394412994384766,
"loss": 0.37293222546577454,
"loss/core": 0.35742494463920593,
"loss/preference_sft": 0.27760133147239685,
"loss/reference_anchor": 0.17900365591049194,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 2.132291316986084,
"rewards/margins": 0.991050124168396,
"rewards/rejected": 1.1412410736083984,
"step": 15
},
{
"drift/chosen_abs": 0.19138672947883606,
"drift/rejected_abs": 0.08749718964099884,
"epoch": 0.01910904096500657,
"grad_norm": 22.5,
"learning_rate": 5.2777777777777776e-08,
"logits/chosen": -2.1781129837036133,
"logits/rejected": -2.219083309173584,
"logps/chosen": -0.30154842138290405,
"logps/rejected": -0.2870495915412903,
"loss": 0.45054665207862854,
"loss/core": 0.4320584833621979,
"loss/preference_sft": 0.30154842138290405,
"loss/reference_anchor": 0.216354101896286,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 1.9138669967651367,
"rewards/margins": 1.0391050577163696,
"rewards/rejected": 0.8747620582580566,
"step": 20
},
{
"drift/chosen_abs": 0.38581329584121704,
"drift/rejected_abs": 0.1625959426164627,
"epoch": 0.02388630120625821,
"grad_norm": 26.5,
"learning_rate": 6.666666666666667e-08,
"logits/chosen": -2.0747623443603516,
"logits/rejected": -2.1344943046569824,
"logps/chosen": -0.26991984248161316,
"logps/rejected": -0.2599589228630066,
"loss": 1.819545030593872,
"loss/core": 1.7517907619476318,
"loss/preference_sft": 0.26991984248161316,
"loss/reference_anchor": 0.8763998746871948,
"rewards/accuracies": 0.8500000238418579,
"rewards/chosen": 3.8559670448303223,
"rewards/margins": 2.2310361862182617,
"rewards/rejected": 1.6249310970306396,
"step": 25
},
{
"drift/chosen_abs": 0.22763633728027344,
"drift/rejected_abs": 0.11158541589975357,
"epoch": 0.028663561447509853,
"grad_norm": 252.0,
"learning_rate": 8.055555555555555e-08,
"logits/chosen": -2.349606513977051,
"logits/rejected": -2.331936836242676,
"logps/chosen": -0.3003299832344055,
"logps/rejected": -0.32463088631629944,
"loss": 0.6905651092529297,
"loss/core": 0.6633950471878052,
"loss/preference_sft": 0.3003299832344055,
"loss/reference_anchor": 0.3322353661060333,
"rewards/accuracies": 0.875,
"rewards/chosen": 2.275994300842285,
"rewards/margins": 1.2529335021972656,
"rewards/rejected": 1.0230610370635986,
"step": 30
},
{
"drift/chosen_abs": 0.26552093029022217,
"drift/rejected_abs": 0.11600001156330109,
"epoch": 0.033440821688761495,
"grad_norm": 2.28125,
"learning_rate": 9.444444444444444e-08,
"logits/chosen": -2.203125476837158,
"logits/rejected": -2.184936046600342,
"logps/chosen": -0.26805487275123596,
"logps/rejected": -0.2653547525405884,
"loss": 0.8213445544242859,
"loss/core": 0.7896862626075745,
"loss/preference_sft": 0.26805487275123596,
"loss/reference_anchor": 0.3953050374984741,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 2.6552093029022217,
"rewards/margins": 1.496461272239685,
"rewards/rejected": 1.1587477922439575,
"step": 35
},
{
"drift/chosen_abs": 0.44771280884742737,
"drift/rejected_abs": 0.16425152122974396,
"epoch": 0.03821808193001314,
"grad_norm": 81.0,
"learning_rate": 1.0833333333333334e-07,
"logits/chosen": -2.0018858909606934,
"logits/rejected": -2.061411142349243,
"logps/chosen": -0.2927972674369812,
"logps/rejected": -0.2809644341468811,
"loss": 2.044156789779663,
"loss/core": 1.9680871963500977,
"loss/preference_sft": 0.2927972674369812,
"loss/reference_anchor": 0.9849796295166016,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 4.476373672485352,
"rewards/margins": 2.8645739555358887,
"rewards/rejected": 1.6117998361587524,
"step": 40
},
{
"drift/chosen_abs": 0.21002939343452454,
"drift/rejected_abs": 0.08615503460168839,
"epoch": 0.04299534217126478,
"grad_norm": 8.3125,
"learning_rate": 1.2222222222222222e-07,
"logits/chosen": -2.2009475231170654,
"logits/rejected": -2.3619346618652344,
"logps/chosen": -0.2883842885494232,
"logps/rejected": -0.2879543900489807,
"loss": 0.2927166819572449,
"loss/core": 0.28003185987472534,
"loss/preference_sft": 0.2883842885494232,
"loss/reference_anchor": 0.14029237627983093,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": 2.099714756011963,
"rewards/margins": 1.253118634223938,
"rewards/rejected": 0.8465961217880249,
"step": 45
},
{
"drift/chosen_abs": 0.28804001212120056,
"drift/rejected_abs": 0.14722736179828644,
"epoch": 0.04777260241251642,
"grad_norm": 75.5,
"learning_rate": 1.3611111111111108e-07,
"logits/chosen": -2.1644270420074463,
"logits/rejected": -2.1614725589752197,
"logps/chosen": -0.2816537022590637,
"logps/rejected": -0.2829938530921936,
"loss": 0.7515085339546204,
"loss/core": 0.7222825884819031,
"loss/preference_sft": 0.2816537022590637,
"loss/reference_anchor": 0.36151474714279175,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 2.8799638748168945,
"rewards/margins": 1.4102028608322144,
"rewards/rejected": 1.4697611331939697,
"step": 50
},
{
"drift/chosen_abs": 0.2258037030696869,
"drift/rejected_abs": 0.20605143904685974,
"epoch": 0.05254986265376806,
"grad_norm": 0.8984375,
"learning_rate": 1.5e-07,
"logits/chosen": -2.1963486671447754,
"logits/rejected": -2.184718608856201,
"logps/chosen": -0.28904852271080017,
"logps/rejected": -0.28756090998649597,
"loss": 1.5850727558135986,
"loss/core": 1.5256582498550415,
"loss/preference_sft": 0.28904852271080017,
"loss/reference_anchor": 0.7632866501808167,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 2.2579128742218018,
"rewards/margins": 0.2070862054824829,
"rewards/rejected": 2.0508265495300293,
"step": 55
},
{
"drift/chosen_abs": 0.21603329479694366,
"drift/rejected_abs": 0.1505412757396698,
"epoch": 0.057327122895019705,
"grad_norm": 512.0,
"learning_rate": 1.6388888888888888e-07,
"logits/chosen": -2.091665744781494,
"logits/rejected": -2.120565176010132,
"logps/chosen": -0.2742917537689209,
"logps/rejected": -0.2904832065105438,
"loss": 0.3291396200656891,
"loss/core": 0.3152475953102112,
"loss/preference_sft": 0.2742917537689209,
"loss/reference_anchor": 0.1577974259853363,
"rewards/accuracies": 0.875,
"rewards/chosen": 2.157923698425293,
"rewards/margins": 0.668967068195343,
"rewards/rejected": 1.4889566898345947,
"step": 60
},
{
"drift/chosen_abs": 0.29638388752937317,
"drift/rejected_abs": 0.11892390251159668,
"epoch": 0.06210438313627135,
"grad_norm": 7.875,
"learning_rate": 1.7777777777777776e-07,
"logits/chosen": -1.9620473384857178,
"logits/rejected": -2.0643868446350098,
"logps/chosen": -0.3099573254585266,
"logps/rejected": -0.3055954873561859,
"loss": 1.0155407190322876,
"loss/core": 0.9765542149543762,
"loss/preference_sft": 0.3099573254585266,
"loss/reference_anchor": 0.4888220429420471,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 2.962282419204712,
"rewards/margins": 1.783328652381897,
"rewards/rejected": 1.178953766822815,
"step": 65
},
{
"drift/chosen_abs": 0.358979195356369,
"drift/rejected_abs": 0.22608236968517303,
"epoch": 0.06688164337752299,
"grad_norm": 56.25,
"learning_rate": 1.9166666666666668e-07,
"logits/chosen": -1.9711816310882568,
"logits/rejected": -1.9564964771270752,
"logps/chosen": -0.38483089208602905,
"logps/rejected": -0.2978837192058563,
"loss": 1.9197027683258057,
"loss/core": 1.84750235080719,
"loss/preference_sft": 0.38483089208602905,
"loss/reference_anchor": 0.9241858720779419,
"rewards/accuracies": 0.8500000238418579,
"rewards/chosen": 3.5887832641601562,
"rewards/margins": 1.4143999814987183,
"rewards/rejected": 2.1743829250335693,
"step": 70
},
{
"drift/chosen_abs": 0.2635686993598938,
"drift/rejected_abs": 0.15887705981731415,
"epoch": 0.07165890361877464,
"grad_norm": 8.25,
"learning_rate": 2.0555555555555553e-07,
"logits/chosen": -2.086611747741699,
"logits/rejected": -2.0510897636413574,
"logps/chosen": -0.3122991919517517,
"logps/rejected": -0.28983455896377563,
"loss": 0.7980114817619324,
"loss/core": 0.766870379447937,
"loss/preference_sft": 0.3122991919517517,
"loss/reference_anchor": 0.3839830458164215,
"rewards/accuracies": 0.8374999761581421,
"rewards/chosen": 2.6338839530944824,
"rewards/margins": 1.0476503372192383,
"rewards/rejected": 1.586233377456665,
"step": 75
},
{
"drift/chosen_abs": 0.32444751262664795,
"drift/rejected_abs": 0.12715654075145721,
"epoch": 0.07643616386002627,
"grad_norm": 4.15625,
"learning_rate": 2.1944444444444442e-07,
"logits/chosen": -2.069356918334961,
"logits/rejected": -2.190796375274658,
"logps/chosen": -0.26029911637306213,
"logps/rejected": -0.27222079038619995,
"loss": 0.951573371887207,
"loss/core": 0.9152650833129883,
"loss/preference_sft": 0.26029911637306213,
"loss/reference_anchor": 0.4580825865268707,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": 3.244004726409912,
"rewards/margins": 1.9740562438964844,
"rewards/rejected": 1.2699484825134277,
"step": 80
},
{
"drift/chosen_abs": 0.35097089409828186,
"drift/rejected_abs": 0.13202176988124847,
"epoch": 0.08121342410127792,
"grad_norm": 6.0,
"learning_rate": 2.3333333333333333e-07,
"logits/chosen": -2.186922073364258,
"logits/rejected": -2.2361488342285156,
"logps/chosen": -0.30639296770095825,
"logps/rejected": -0.2788568139076233,
"loss": 1.790135383605957,
"loss/core": 1.7231495380401611,
"loss/preference_sft": 0.30639296770095825,
"loss/reference_anchor": 0.8625059127807617,
"rewards/accuracies": 0.875,
"rewards/chosen": 3.509377956390381,
"rewards/margins": 2.1900832653045654,
"rewards/rejected": 1.3192951679229736,
"step": 85
},
{
"drift/chosen_abs": 0.17585346102714539,
"drift/rejected_abs": 0.08460784703493118,
"epoch": 0.08599068434252956,
"grad_norm": 1.0,
"learning_rate": 2.4722222222222224e-07,
"logits/chosen": -2.42102313041687,
"logits/rejected": -2.4086685180664062,
"logps/chosen": -0.2809022068977356,
"logps/rejected": -0.29607102274894714,
"loss": 0.32354456186294556,
"loss/core": 0.30980855226516724,
"loss/preference_sft": 0.2809022068977356,
"loss/reference_anchor": 0.1550559550523758,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 1.7583656311035156,
"rewards/margins": 0.9138404726982117,
"rewards/rejected": 0.844525158405304,
"step": 90
},
{
"drift/chosen_abs": 0.320295125246048,
"drift/rejected_abs": 0.21105077862739563,
"epoch": 0.09076794458378121,
"grad_norm": 67.0,
"learning_rate": 2.6111111111111113e-07,
"logits/chosen": -2.0537590980529785,
"logits/rejected": -2.1096103191375732,
"logps/chosen": -0.26810017228126526,
"logps/rejected": -0.2783377170562744,
"loss": 0.9392117261886597,
"loss/core": 0.903303325176239,
"loss/preference_sft": 0.26810017228126526,
"loss/reference_anchor": 0.45196953415870667,
"rewards/accuracies": 0.875,
"rewards/chosen": 3.2027251720428467,
"rewards/margins": 1.0923994779586792,
"rewards/rejected": 2.110325574874878,
"step": 95
},
{
"drift/chosen_abs": 0.24583487212657928,
"drift/rejected_abs": 0.12835685908794403,
"epoch": 0.09554520482503284,
"grad_norm": 10.8125,
"learning_rate": 2.75e-07,
"logits/chosen": -2.234044075012207,
"logits/rejected": -2.2795557975769043,
"logps/chosen": -0.2577240467071533,
"logps/rejected": -0.24702732264995575,
"loss": 0.37607091665267944,
"loss/core": 0.3605777323246002,
"loss/preference_sft": 0.2577240467071533,
"loss/reference_anchor": 0.18080314993858337,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 2.4573445320129395,
"rewards/margins": 1.1746383905410767,
"rewards/rejected": 1.282706379890442,
"step": 100
},
{
"drift/chosen_abs": 0.19956639409065247,
"drift/rejected_abs": 0.08023403584957123,
"epoch": 0.10032246506628449,
"grad_norm": 302.0,
"learning_rate": 2.8888888888888885e-07,
"logits/chosen": -2.3368284702301025,
"logits/rejected": -2.421706438064575,
"logps/chosen": -0.2843855023384094,
"logps/rejected": -0.27989473938941956,
"loss": 0.41286808252334595,
"loss/core": 0.39585790038108826,
"loss/preference_sft": 0.2843855023384094,
"loss/reference_anchor": 0.19836413860321045,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 1.9953877925872803,
"rewards/margins": 1.1983610391616821,
"rewards/rejected": 0.7970272302627563,
"step": 105
},
{
"drift/chosen_abs": 0.44724979996681213,
"drift/rejected_abs": 0.18898524343967438,
"epoch": 0.10509972530753613,
"grad_norm": 14.5625,
"learning_rate": 3.0277777777777773e-07,
"logits/chosen": -1.9066753387451172,
"logits/rejected": -1.8599035739898682,
"logps/chosen": -0.33843153715133667,
"logps/rejected": -0.2979224920272827,
"loss": 1.8243690729141235,
"loss/core": 1.7559093236923218,
"loss/preference_sft": 0.33843153715133667,
"loss/reference_anchor": 0.8789511919021606,
"rewards/accuracies": 0.875,
"rewards/chosen": 4.470961570739746,
"rewards/margins": 2.5842795372009277,
"rewards/rejected": 1.8866825103759766,
"step": 110
},
{
"drift/chosen_abs": 0.17774026095867157,
"drift/rejected_abs": 0.14382174611091614,
"epoch": 0.10987698554878778,
"grad_norm": 11.9375,
"learning_rate": 3.166666666666666e-07,
"logits/chosen": -2.086132764816284,
"logits/rejected": -2.030756711959839,
"logps/chosen": -0.3001967668533325,
"logps/rejected": -0.2998013198375702,
"loss": 0.43933549523353577,
"loss/core": 0.4212765693664551,
"loss/preference_sft": 0.3001967668533325,
"loss/reference_anchor": 0.21076564490795135,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 1.777402639389038,
"rewards/margins": 0.34036320447921753,
"rewards/rejected": 1.4370393753051758,
"step": 115
},
{
"drift/chosen_abs": 0.18121027946472168,
"drift/rejected_abs": 0.11058615148067474,
"epoch": 0.11465424579003941,
"grad_norm": 180.0,
"learning_rate": 3.3055555555555556e-07,
"logits/chosen": -2.0374550819396973,
"logits/rejected": -2.0756847858428955,
"logps/chosen": -0.301984578371048,
"logps/rejected": -0.29793334007263184,
"loss": 0.1780211180448532,
"loss/core": 0.16938777267932892,
"loss/preference_sft": 0.301984578371048,
"loss/reference_anchor": 0.08491319417953491,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 1.8116956949234009,
"rewards/margins": 0.7075945734977722,
"rewards/rejected": 1.1041011810302734,
"step": 120
},
{
"drift/chosen_abs": 0.2069893628358841,
"drift/rejected_abs": 0.10128186643123627,
"epoch": 0.11943150603129106,
"grad_norm": 6.09375,
"learning_rate": 3.4444444444444444e-07,
"logits/chosen": -2.108165979385376,
"logits/rejected": -2.139435291290283,
"logps/chosen": -0.29883089661598206,
"logps/rejected": -0.3071492612361908,
"loss": 0.2796749472618103,
"loss/core": 0.2673766613006592,
"loss/preference_sft": 0.29883089661598206,
"loss/reference_anchor": 0.1340940147638321,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 2.067173480987549,
"rewards/margins": 1.0553032159805298,
"rewards/rejected": 1.0118701457977295,
"step": 125
},
{
"drift/chosen_abs": 0.18067234754562378,
"drift/rejected_abs": 0.08859051764011383,
"epoch": 0.1242087662725427,
"grad_norm": 11.25,
"learning_rate": 3.583333333333333e-07,
"logits/chosen": -1.9984080791473389,
"logits/rejected": -2.0914056301116943,
"logps/chosen": -0.28005415201187134,
"logps/rejected": -0.27907031774520874,
"loss": 0.15530189871788025,
"loss/core": 0.14763937890529633,
"loss/preference_sft": 0.28005415201187134,
"loss/reference_anchor": 0.0741613507270813,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": 1.806658387184143,
"rewards/margins": 0.9225584268569946,
"rewards/rejected": 0.8841001391410828,
"step": 130
},
{
"drift/chosen_abs": 0.33673185110092163,
"drift/rejected_abs": 0.1371738612651825,
"epoch": 0.12898602651379434,
"grad_norm": 20.5,
"learning_rate": 3.722222222222222e-07,
"logits/chosen": -2.0906131267547607,
"logits/rejected": -2.16442608833313,
"logps/chosen": -0.3028051257133484,
"logps/rejected": -0.29675745964050293,
"loss": 0.9384252429008484,
"loss/core": 0.9022802114486694,
"loss/preference_sft": 0.3028051257133484,
"loss/reference_anchor": 0.4516521990299225,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 3.367079973220825,
"rewards/margins": 2.038417339324951,
"rewards/rejected": 1.3286627531051636,
"step": 135
},
{
"drift/chosen_abs": 0.1627669632434845,
"drift/rejected_abs": 0.0710747018456459,
"epoch": 0.13376328675504598,
"grad_norm": 12.1875,
"learning_rate": 3.861111111111111e-07,
"logits/chosen": -2.4494571685791016,
"logits/rejected": -2.5083508491516113,
"logps/chosen": -0.2825891971588135,
"logps/rejected": -0.2898746430873871,
"loss": 0.12142524868249893,
"loss/core": 0.11497412621974945,
"loss/preference_sft": 0.2825891971588135,
"loss/reference_anchor": 0.057755958288908005,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 1.6273698806762695,
"rewards/margins": 0.9166396856307983,
"rewards/rejected": 0.7107301950454712,
"step": 140
},
{
"drift/chosen_abs": 0.36183470487594604,
"drift/rejected_abs": 0.17905983328819275,
"epoch": 0.13854054699629761,
"grad_norm": 8.125,
"learning_rate": 4e-07,
"logits/chosen": -1.7783467769622803,
"logits/rejected": -1.8096199035644531,
"logps/chosen": -0.3000045418739319,
"logps/rejected": -0.30179673433303833,
"loss": 2.165755271911621,
"loss/core": 2.0852818489074707,
"loss/preference_sft": 0.3000045418739319,
"loss/reference_anchor": 1.0429770946502686,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 3.617523193359375,
"rewards/margins": 1.832786202430725,
"rewards/rejected": 1.78473699092865,
"step": 145
},
{
"drift/chosen_abs": 0.36336830258369446,
"drift/rejected_abs": 0.14750418066978455,
"epoch": 0.14331780723754928,
"grad_norm": 121.0,
"learning_rate": 4.1388888888888887e-07,
"logits/chosen": -2.2309694290161133,
"logits/rejected": -2.280487298965454,
"logps/chosen": -0.3181116282939911,
"logps/rejected": -0.3068601191043854,
"loss": 1.7123243808746338,
"loss/core": 1.6480745077133179,
"loss/preference_sft": 0.3181116282939911,
"loss/reference_anchor": 0.8248558044433594,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 3.6315560340881348,
"rewards/margins": 2.1605687141418457,
"rewards/rejected": 1.4709874391555786,
"step": 150
},
{
"drift/chosen_abs": 0.2860521078109741,
"drift/rejected_abs": 0.08609304577112198,
"epoch": 0.1480950674788009,
"grad_norm": 5.125,
"learning_rate": 4.2777777777777775e-07,
"logits/chosen": -2.0970890522003174,
"logits/rejected": -2.1750330924987793,
"logps/chosen": -0.28367698192596436,
"logps/rejected": -0.29151204228401184,
"loss": 0.7529366612434387,
"loss/core": 0.7236311435699463,
"loss/preference_sft": 0.28367698192596436,
"loss/reference_anchor": 0.36237236857414246,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 2.858731746673584,
"rewards/margins": 2.024120330810547,
"rewards/rejected": 0.8346115946769714,
"step": 155
},
{
"drift/chosen_abs": 0.31623023748397827,
"drift/rejected_abs": 0.13978847861289978,
"epoch": 0.15287232772005255,
"grad_norm": 282.0,
"learning_rate": 4.4166666666666664e-07,
"logits/chosen": -2.0535616874694824,
"logits/rejected": -2.027621030807495,
"logps/chosen": -0.30931371450424194,
"logps/rejected": -0.3156592547893524,
"loss": 1.4550539255142212,
"loss/core": 1.4001611471176147,
"loss/preference_sft": 0.30931371450424194,
"loss/reference_anchor": 0.7009710073471069,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": 3.1623027324676514,
"rewards/margins": 1.764468789100647,
"rewards/rejected": 1.397834062576294,
"step": 160
},
{
"drift/chosen_abs": 0.16005036234855652,
"drift/rejected_abs": 0.07912009209394455,
"epoch": 0.15764958796130418,
"grad_norm": 5.1875,
"learning_rate": 4.555555555555555e-07,
"logits/chosen": -2.2203352451324463,
"logits/rejected": -2.1501989364624023,
"logps/chosen": -0.31128016114234924,
"logps/rejected": -0.3056836724281311,
"loss": 0.18936026096343994,
"loss/core": 0.18025028705596924,
"loss/preference_sft": 0.31128016114234924,
"loss/reference_anchor": 0.09033866971731186,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 1.60050368309021,
"rewards/margins": 0.8113292455673218,
"rewards/rejected": 0.7891744375228882,
"step": 165
},
{
"drift/chosen_abs": 0.26069825887680054,
"drift/rejected_abs": 0.2761599123477936,
"epoch": 0.16242684820255585,
"grad_norm": 378.0,
"learning_rate": 4.694444444444444e-07,
"logits/chosen": -2.186049461364746,
"logits/rejected": -2.1308929920196533,
"logps/chosen": -0.273814857006073,
"logps/rejected": -0.2607230842113495,
"loss": 1.9536501169204712,
"loss/core": 1.8810440301895142,
"loss/preference_sft": 0.273814857006073,
"loss/reference_anchor": 0.9407007098197937,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 2.6061038970947266,
"rewards/margins": -0.15422509610652924,
"rewards/rejected": 2.760329008102417,
"step": 170
},
{
"drift/chosen_abs": 0.25758832693099976,
"drift/rejected_abs": 0.12776905298233032,
"epoch": 0.16720410844380748,
"grad_norm": 406.0,
"learning_rate": 4.833333333333333e-07,
"logits/chosen": -2.1730058193206787,
"logits/rejected": -2.212725877761841,
"logps/chosen": -0.2877016067504883,
"logps/rejected": -0.30032774806022644,
"loss": 1.1656818389892578,
"loss/core": 1.1214388608932495,
"loss/preference_sft": 0.2877016067504883,
"loss/reference_anchor": 0.5611380338668823,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": 2.5753438472747803,
"rewards/margins": 1.3018853664398193,
"rewards/rejected": 1.273458480834961,
"step": 175
},
{
"drift/chosen_abs": 0.3230380117893219,
"drift/rejected_abs": 0.150053471326828,
"epoch": 0.17198136868505912,
"grad_norm": 668.0,
"learning_rate": 4.972222222222222e-07,
"logits/chosen": -2.197150945663452,
"logits/rejected": -2.108093023300171,
"logps/chosen": -0.27259406447410583,
"logps/rejected": -0.2611132264137268,
"loss": 1.2022207975387573,
"loss/core": 1.1567691564559937,
"loss/preference_sft": 0.27259406447410583,
"loss/reference_anchor": 0.5787622332572937,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 3.2283949851989746,
"rewards/margins": 1.730065941810608,
"rewards/rejected": 1.4983290433883667,
"step": 180
},
{
"drift/chosen_abs": 0.10474558919668198,
"drift/rejected_abs": 0.06288503110408783,
"epoch": 0.17675862892631075,
"grad_norm": 3.453125,
"learning_rate": 4.999619237890978e-07,
"logits/chosen": -2.201859474182129,
"logits/rejected": -2.158825397491455,
"logps/chosen": -0.28844937682151794,
"logps/rejected": -0.2922508418560028,
"loss": 0.06655260920524597,
"loss/core": 0.06205412745475769,
"loss/preference_sft": 0.28844937682151794,
"loss/reference_anchor": 0.03113471530377865,
"rewards/accuracies": 0.8374999761581421,
"rewards/chosen": 1.0451735258102417,
"rewards/margins": 0.41988277435302734,
"rewards/rejected": 0.6252908706665039,
"step": 185
},
{
"drift/chosen_abs": 0.2833901643753052,
"drift/rejected_abs": 0.12482712417840958,
"epoch": 0.18153588916756241,
"grad_norm": 30.5,
"learning_rate": 4.998072590601808e-07,
"logits/chosen": -2.2913918495178223,
"logits/rejected": -2.2682085037231445,
"logps/chosen": -0.284027636051178,
"logps/rejected": -0.2837992310523987,
"loss": 1.1685082912445068,
"loss/core": 1.1242001056671143,
"loss/preference_sft": 0.284027636051178,
"loss/reference_anchor": 0.5623761415481567,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": 2.8339016437530518,
"rewards/margins": 1.590225100517273,
"rewards/rejected": 1.2436766624450684,
"step": 190
},
{
"drift/chosen_abs": 0.26705488562583923,
"drift/rejected_abs": 0.0977572649717331,
"epoch": 0.18631314940881405,
"grad_norm": 23.25,
"learning_rate": 4.995336996054667e-07,
"logits/chosen": -1.982912302017212,
"logits/rejected": -2.0029821395874023,
"logps/chosen": -0.2908513844013214,
"logps/rejected": -0.2896444797515869,
"loss": 1.151555061340332,
"loss/core": 1.1077957153320312,
"loss/preference_sft": 0.2908513844013214,
"loss/reference_anchor": 0.5543731451034546,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 2.66994571685791,
"rewards/margins": 1.7028605937957764,
"rewards/rejected": 0.9670848846435547,
"step": 195
},
{
"drift/chosen_abs": 0.2615807056427002,
"drift/rejected_abs": 0.12196584045886993,
"epoch": 0.19109040965006568,
"grad_norm": 21.375,
"learning_rate": 4.991413756244404e-07,
"logits/chosen": -1.8908970355987549,
"logits/rejected": -1.9317600727081299,
"logps/chosen": -0.3235652446746826,
"logps/rejected": -0.316772997379303,
"loss": 0.5153834819793701,
"loss/core": 0.4943995475769043,
"loss/preference_sft": 0.3235652446746826,
"loss/reference_anchor": 0.2474292516708374,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 2.6145291328430176,
"rewards/margins": 1.3955014944076538,
"rewards/rejected": 1.2190272808074951,
"step": 200
},
{
"drift/chosen_abs": 0.3288207948207855,
"drift/rejected_abs": 0.2144632786512375,
"epoch": 0.19586766989131732,
"grad_norm": 10.6875,
"learning_rate": 4.986304738420683e-07,
"logits/chosen": -2.1127889156341553,
"logits/rejected": -2.164623975753784,
"logps/chosen": -0.25030291080474854,
"logps/rejected": -0.26794177293777466,
"loss": 1.3577306270599365,
"loss/core": 1.3068211078643799,
"loss/preference_sft": 0.25030291080474854,
"loss/reference_anchor": 0.6537634134292603,
"rewards/accuracies": 0.9375,
"rewards/chosen": 3.287494659423828,
"rewards/margins": 1.1692345142364502,
"rewards/rejected": 2.118259906768799,
"step": 205
},
{
"drift/chosen_abs": 0.2845247685909271,
"drift/rejected_abs": 0.14929194748401642,
"epoch": 0.20064493013256898,
"grad_norm": 28.625,
"learning_rate": 4.980012374199287e-07,
"logits/chosen": -2.107903003692627,
"logits/rejected": -2.131675958633423,
"logps/chosen": -0.3113544285297394,
"logps/rejected": -0.3212708830833435,
"loss": 1.2182084321975708,
"loss/core": 1.1718981266021729,
"loss/preference_sft": 0.3113544285297394,
"loss/reference_anchor": 0.5863357782363892,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 2.8425536155700684,
"rewards/margins": 1.352899193763733,
"rewards/rejected": 1.489654779434204,
"step": 210
},
{
"drift/chosen_abs": 0.31894436478614807,
"drift/rejected_abs": 0.17038756608963013,
"epoch": 0.20542219037382062,
"grad_norm": 7.25,
"learning_rate": 4.972539658404792e-07,
"logits/chosen": -2.0803780555725098,
"logits/rejected": -2.071502208709717,
"logps/chosen": -0.27592846751213074,
"logps/rejected": -0.28498896956443787,
"loss": 1.6364405155181885,
"loss/core": 1.5752842426300049,
"loss/preference_sft": 0.27592846751213074,
"loss/reference_anchor": 0.78782057762146,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": 3.186903953552246,
"rewards/margins": 1.491759181022644,
"rewards/rejected": 1.6951450109481812,
"step": 215
},
{
"drift/chosen_abs": 0.1886764019727707,
"drift/rejected_abs": 0.10738885402679443,
"epoch": 0.21019945061507225,
"grad_norm": 34.25,
"learning_rate": 4.963890147645194e-07,
"logits/chosen": -2.0927789211273193,
"logits/rejected": -2.0071330070495605,
"logps/chosen": -0.3026772439479828,
"logps/rejected": -0.3015129268169403,
"loss": 0.2290460765361786,
"loss/core": 0.21856117248535156,
"loss/preference_sft": 0.3026772439479828,
"loss/reference_anchor": 0.10953140258789062,
"rewards/accuracies": 0.875,
"rewards/chosen": 1.8838809728622437,
"rewards/margins": 0.8116692304611206,
"rewards/rejected": 1.072211503982544,
"step": 220
},
{
"drift/chosen_abs": 0.3618369996547699,
"drift/rejected_abs": 0.1408586949110031,
"epoch": 0.2149767108563239,
"grad_norm": 8.875,
"learning_rate": 4.95406795861916e-07,
"logits/chosen": -2.1790313720703125,
"logits/rejected": -2.1682028770446777,
"logps/chosen": -0.2909870743751526,
"logps/rejected": -0.2756298780441284,
"loss": 0.8731632232666016,
"loss/core": 0.8394603729248047,
"loss/preference_sft": 0.2909870743751526,
"loss/reference_anchor": 0.4202722907066345,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 3.6181743144989014,
"rewards/margins": 2.2104671001434326,
"rewards/rejected": 1.4077072143554688,
"step": 225
},
{
"drift/chosen_abs": 0.18520915508270264,
"drift/rejected_abs": 0.07412123680114746,
"epoch": 0.21975397109757555,
"grad_norm": 74.0,
"learning_rate": 4.943077766156697e-07,
"logits/chosen": -2.2688801288604736,
"logits/rejected": -2.276559829711914,
"logps/chosen": -0.2821432948112488,
"logps/rejected": -0.30950599908828735,
"loss": 0.19297373294830322,
"loss/core": 0.18392691016197205,
"loss/preference_sft": 0.2821432948112488,
"loss/reference_anchor": 0.09240987151861191,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 1.8502082824707031,
"rewards/margins": 1.1134107112884521,
"rewards/rejected": 0.7367974519729614,
"step": 230
},
{
"drift/chosen_abs": 0.1905185729265213,
"drift/rejected_abs": 0.13251249492168427,
"epoch": 0.2245312313388272,
"grad_norm": 23.625,
"learning_rate": 4.930924800994191e-07,
"logits/chosen": -2.005171298980713,
"logits/rejected": -2.0407776832580566,
"logps/chosen": -0.29280489683151245,
"logps/rejected": -0.28741219639778137,
"loss": 0.4691334366798401,
"loss/core": 0.45003873109817505,
"loss/preference_sft": 0.29280489683151245,
"loss/reference_anchor": 0.2253153771162033,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 1.9031035900115967,
"rewards/margins": 0.58293217420578,
"rewards/rejected": 1.3201711177825928,
"step": 235
},
{
"drift/chosen_abs": 0.17637206614017487,
"drift/rejected_abs": 0.10210146754980087,
"epoch": 0.22930849158007882,
"grad_norm": 9.8125,
"learning_rate": 4.917614847284858e-07,
"logits/chosen": -2.019641399383545,
"logits/rejected": -2.0390303134918213,
"logps/chosen": -0.294040709733963,
"logps/rejected": -0.2948092818260193,
"loss": 0.14991113543510437,
"loss/core": 0.14234814047813416,
"loss/preference_sft": 0.294040709733963,
"loss/reference_anchor": 0.0714358538389206,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": 1.762891411781311,
"rewards/margins": 0.7431442141532898,
"rewards/rejected": 1.019747257232666,
"step": 240
},
{
"drift/chosen_abs": 0.3610271215438843,
"drift/rejected_abs": 0.11232628673315048,
"epoch": 0.23408575182133046,
"grad_norm": 304.0,
"learning_rate": 4.903154239845797e-07,
"logits/chosen": -2.057809829711914,
"logits/rejected": -2.0461342334747314,
"logps/chosen": -0.2769336998462677,
"logps/rejected": -0.29468828439712524,
"loss": 1.2440202236175537,
"loss/core": 1.1970118284225464,
"loss/preference_sft": 0.2769336998462677,
"loss/reference_anchor": 0.5990844964981079,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 3.610271453857422,
"rewards/margins": 2.4941940307617188,
"rewards/rejected": 1.1160774230957031,
"step": 245
},
{
"drift/chosen_abs": 0.2345919907093048,
"drift/rejected_abs": 0.10711641609668732,
"epoch": 0.23886301206258212,
"grad_norm": 21.625,
"learning_rate": 4.887549861142967e-07,
"logits/chosen": -1.89980149269104,
"logits/rejected": -1.978960633277893,
"logps/chosen": -0.2994912564754486,
"logps/rejected": -0.29508280754089355,
"loss": 0.3056420385837555,
"loss/core": 0.2923932373523712,
"loss/preference_sft": 0.2994912564754486,
"loss/reference_anchor": 0.14670124650001526,
"rewards/accuracies": 0.8374999761581421,
"rewards/chosen": 2.342444896697998,
"rewards/margins": 1.2790577411651611,
"rewards/rejected": 1.0633875131607056,
"step": 250
},
{
"drift/chosen_abs": 0.244302898645401,
"drift/rejected_abs": 0.1597694456577301,
"epoch": 0.24364027230383375,
"grad_norm": 13.75,
"learning_rate": 4.870809138015498e-07,
"logits/chosen": -2.2113137245178223,
"logits/rejected": -2.206145763397217,
"logps/chosen": -0.2858472466468811,
"logps/rejected": -0.28811052441596985,
"loss": 0.6415420174598694,
"loss/core": 0.6162611246109009,
"loss/preference_sft": 0.2858472466468811,
"loss/reference_anchor": 0.3084937036037445,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 2.442288398742676,
"rewards/margins": 0.8456929922103882,
"rewards/rejected": 1.5965955257415771,
"step": 255
},
{
"drift/chosen_abs": 0.23896794021129608,
"drift/rejected_abs": 0.15801241993904114,
"epoch": 0.2484175325450854,
"grad_norm": 0.8046875,
"learning_rate": 4.852940038140927e-07,
"logits/chosen": -2.1472392082214355,
"logits/rejected": -2.219313859939575,
"logps/chosen": -0.2888643741607666,
"logps/rejected": -0.27107033133506775,
"loss": 0.5575072765350342,
"loss/core": 0.5352469682693481,
"loss/preference_sft": 0.2888643741607666,
"loss/reference_anchor": 0.2679183781147003,
"rewards/accuracies": 0.875,
"rewards/chosen": 2.3884191513061523,
"rewards/margins": 0.8117639422416687,
"rewards/rejected": 1.5766551494598389,
"step": 260
},
{
"drift/chosen_abs": 0.1222555860877037,
"drift/rejected_abs": 0.11597619950771332,
"epoch": 0.25319479278633705,
"grad_norm": 1.203125,
"learning_rate": 4.833951066243004e-07,
"logits/chosen": -2.0287933349609375,
"logits/rejected": -2.036017656326294,
"logps/chosen": -0.3003501892089844,
"logps/rejected": -0.3035464286804199,
"loss": 0.44168415665626526,
"loss/core": 0.42354241013526917,
"loss/preference_sft": 0.3003501892089844,
"loss/reference_anchor": 0.21185505390167236,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 1.2217209339141846,
"rewards/margins": 0.06751598417758942,
"rewards/rejected": 1.154205083847046,
"step": 265
},
{
"drift/chosen_abs": 0.3274751305580139,
"drift/rejected_abs": 0.20972244441509247,
"epoch": 0.2579720530275887,
"grad_norm": 13.0,
"learning_rate": 4.813851260043915e-07,
"logits/chosen": -1.9322869777679443,
"logits/rejected": -2.0220537185668945,
"logps/chosen": -0.2892109155654907,
"logps/rejected": -0.2937650978565216,
"loss": 1.1844274997711182,
"loss/core": 1.1395008563995361,
"loss/preference_sft": 0.2892109155654907,
"loss/reference_anchor": 0.5701011419296265,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 3.274138927459717,
"rewards/margins": 1.1782522201538086,
"rewards/rejected": 2.0958871841430664,
"step": 270
},
{
"drift/chosen_abs": 0.23182424902915955,
"drift/rejected_abs": 0.12205634266138077,
"epoch": 0.2627493132688403,
"grad_norm": 35.0,
"learning_rate": 4.79265018596281e-07,
"logits/chosen": -2.081444501876831,
"logits/rejected": -2.0351366996765137,
"logps/chosen": -0.2973952293395996,
"logps/rejected": -0.30073636770248413,
"loss": 0.4742198586463928,
"loss/core": 0.45490771532058716,
"loss/preference_sft": 0.2973952293395996,
"loss/reference_anchor": 0.22775478661060333,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 2.3158555030822754,
"rewards/margins": 1.159383773803711,
"rewards/rejected": 1.1564717292785645,
"step": 275
},
{
"drift/chosen_abs": 0.20490439236164093,
"drift/rejected_abs": 0.08539918065071106,
"epoch": 0.26752657351009196,
"grad_norm": 4.1875,
"learning_rate": 4.770357934562704e-07,
"logits/chosen": -2.0511467456817627,
"logits/rejected": -1.9675155878067017,
"logps/chosen": -0.2882925868034363,
"logps/rejected": -0.3074631094932556,
"loss": 0.22447428107261658,
"loss/core": 0.21425719559192657,
"loss/preference_sft": 0.2882925868034363,
"loss/reference_anchor": 0.1073986068367958,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 2.044360876083374,
"rewards/margins": 1.2838475704193115,
"rewards/rejected": 0.7605134844779968,
"step": 280
},
{
"drift/chosen_abs": 0.2618315815925598,
"drift/rejected_abs": 0.1607695072889328,
"epoch": 0.2723038337513436,
"grad_norm": 245.0,
"learning_rate": 4.746985115747917e-07,
"logits/chosen": -2.0746307373046875,
"logits/rejected": -2.0701193809509277,
"logps/chosen": -0.2960381507873535,
"logps/rejected": -0.2952577471733093,
"loss": 0.5513629913330078,
"loss/core": 0.529272198677063,
"loss/preference_sft": 0.2960381507873535,
"loss/reference_anchor": 0.2649388313293457,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 2.616506814956665,
"rewards/margins": 1.0125617980957031,
"rewards/rejected": 1.6039451360702515,
"step": 285
},
{
"drift/chosen_abs": 0.14695926010608673,
"drift/rejected_abs": 0.14160466194152832,
"epoch": 0.27708109399259523,
"grad_norm": 676.0,
"learning_rate": 4.722542853714341e-07,
"logits/chosen": -2.154064655303955,
"logits/rejected": -2.165696144104004,
"logps/chosen": -0.28789079189300537,
"logps/rejected": -0.29165560007095337,
"loss": 0.3904039263725281,
"loss/core": 0.3742069602012634,
"loss/preference_sft": 0.28789079189300537,
"loss/reference_anchor": 0.18717019259929657,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 1.4682142734527588,
"rewards/margins": 0.05419105291366577,
"rewards/rejected": 1.4140231609344482,
"step": 290
},
{
"drift/chosen_abs": 0.13077983260154724,
"drift/rejected_abs": 0.06749530881643295,
"epoch": 0.28185835423384686,
"grad_norm": 8.625,
"learning_rate": 4.697042781654913e-07,
"logits/chosen": -2.5517144203186035,
"logits/rejected": -2.51605486869812,
"logps/chosen": -0.24481797218322754,
"logps/rejected": -0.2569727301597595,
"loss": 0.06375555694103241,
"loss/core": 0.05966717004776001,
"loss/preference_sft": 0.24481797218322754,
"loss/reference_anchor": 0.03002994880080223,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": 1.307100534439087,
"rewards/margins": 0.6367514133453369,
"rewards/rejected": 0.6703491806983948,
"step": 295
},
{
"drift/chosen_abs": 0.3725462555885315,
"drift/rejected_abs": 0.10222160816192627,
"epoch": 0.28663561447509855,
"grad_norm": 105.5,
"learning_rate": 4.670497036222856e-07,
"logits/chosen": -1.96623957157135,
"logits/rejected": -1.934470772743225,
"logps/chosen": -0.3124147355556488,
"logps/rejected": -0.32228654623031616,
"loss": 1.024113416671753,
"loss/core": 0.9847720861434937,
"loss/preference_sft": 0.3124147355556488,
"loss/reference_anchor": 0.49330902099609375,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 3.7237000465393066,
"rewards/margins": 2.717276096343994,
"rewards/rejected": 1.006424069404602,
"step": 300
},
{
"drift/chosen_abs": 0.21607303619384766,
"drift/rejected_abs": 0.08962901681661606,
"epoch": 0.2914128747163502,
"grad_norm": 13.0,
"learning_rate": 4.642918251755281e-07,
"logits/chosen": -2.1090660095214844,
"logits/rejected": -2.171133279800415,
"logps/chosen": -0.2694811224937439,
"logps/rejected": -0.26096317172050476,
"loss": 0.23768694698810577,
"loss/core": 0.2271147072315216,
"loss/preference_sft": 0.2694811224937439,
"loss/reference_anchor": 0.11401481926441193,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 2.1587884426116943,
"rewards/margins": 1.2635397911071777,
"rewards/rejected": 0.895248532295227,
"step": 305
},
{
"drift/chosen_abs": 0.2609344720840454,
"drift/rejected_abs": 0.2091202735900879,
"epoch": 0.2961901349576018,
"grad_norm": 83.0,
"learning_rate": 4.614319554259933e-07,
"logits/chosen": -2.1155569553375244,
"logits/rejected": -2.0249547958374023,
"logps/chosen": -0.2733913064002991,
"logps/rejected": -0.2829728126525879,
"loss": 0.948021411895752,
"loss/core": 0.9117604494094849,
"loss/preference_sft": 0.2733913064002991,
"loss/reference_anchor": 0.45614108443260193,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 2.6087353229522705,
"rewards/margins": 0.6165834665298462,
"rewards/rejected": 1.9921518564224243,
"step": 310
},
{
"drift/chosen_abs": 0.2914541959762573,
"drift/rejected_abs": 0.13409768044948578,
"epoch": 0.30096739519885346,
"grad_norm": 5.875,
"learning_rate": 4.58471455516792e-07,
"logits/chosen": -1.945861577987671,
"logits/rejected": -2.051717519760132,
"logps/chosen": -0.26913851499557495,
"logps/rejected": -0.27637916803359985,
"loss": 0.48234397172927856,
"loss/core": 0.46292680501937866,
"loss/preference_sft": 0.26913851499557495,
"loss/reference_anchor": 0.23198194801807404,
"rewards/accuracies": 0.9375,
"rewards/chosen": 2.9132609367370605,
"rewards/margins": 1.5744664669036865,
"rewards/rejected": 1.3387947082519531,
"step": 315
},
{
"drift/chosen_abs": 0.15800070762634277,
"drift/rejected_abs": 0.12147839367389679,
"epoch": 0.3057446554401051,
"grad_norm": 3.5625,
"learning_rate": 4.5541173448554095e-07,
"logits/chosen": -1.986737847328186,
"logits/rejected": -2.0025219917297363,
"logps/chosen": -0.29054489731788635,
"logps/rejected": -0.29405659437179565,
"loss": 0.2033577710390091,
"loss/core": 0.19389116764068604,
"loss/preference_sft": 0.29054489731788635,
"loss/reference_anchor": 0.09716695547103882,
"rewards/accuracies": 0.8500000238418579,
"rewards/chosen": 1.5768026113510132,
"rewards/margins": 0.3625461161136627,
"rewards/rejected": 1.2142564058303833,
"step": 320
},
{
"drift/chosen_abs": 0.37172552943229675,
"drift/rejected_abs": 0.15326622128486633,
"epoch": 0.31052191568135673,
"grad_norm": 548.0,
"learning_rate": 4.5225424859373684e-07,
"logits/chosen": -2.2413594722747803,
"logits/rejected": -2.1880881786346436,
"logps/chosen": -0.28455644845962524,
"logps/rejected": -0.2839685380458832,
"loss": 1.9195263385772705,
"loss/core": 1.848060965538025,
"loss/preference_sft": 0.28455644845962524,
"loss/reference_anchor": 0.9244130849838257,
"rewards/accuracies": 0.875,
"rewards/chosen": 3.716318130493164,
"rewards/margins": 2.1848549842834473,
"rewards/rejected": 1.5314635038375854,
"step": 325
},
{
"drift/chosen_abs": 0.20601582527160645,
"drift/rejected_abs": 0.11289147287607193,
"epoch": 0.31529917592260837,
"grad_norm": 2.765625,
"learning_rate": 4.4900050063365547e-07,
"logits/chosen": -2.2116036415100098,
"logits/rejected": -2.1998820304870605,
"logps/chosen": -0.27572888135910034,
"logps/rejected": -0.2708529829978943,
"loss": 0.31742313504219055,
"loss/core": 0.30393102765083313,
"loss/preference_sft": 0.27572888135910034,
"loss/reference_anchor": 0.15232183039188385,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": 2.0594685077667236,
"rewards/margins": 0.9315606951713562,
"rewards/rejected": 1.1279077529907227,
"step": 330
},
{
"drift/chosen_abs": 0.21230271458625793,
"drift/rejected_abs": 0.08433900028467178,
"epoch": 0.32007643616386,
"grad_norm": 320.0,
"learning_rate": 4.4565203921310344e-07,
"logits/chosen": -2.03387188911438,
"logits/rejected": -2.0167250633239746,
"logps/chosen": -0.3023034930229187,
"logps/rejected": -0.3277498781681061,
"loss": 0.46993932127952576,
"loss/core": 0.45074281096458435,
"loss/preference_sft": 0.3023034930229187,
"loss/reference_anchor": 0.22572243213653564,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 2.119868755340576,
"rewards/margins": 1.523357629776001,
"rewards/rejected": 0.5965113043785095,
"step": 335
},
{
"drift/chosen_abs": 0.20402033627033234,
"drift/rejected_abs": 0.08628232777118683,
"epoch": 0.3248536964051117,
"grad_norm": 154.0,
"learning_rate": 4.422104580183649e-07,
"logits/chosen": -2.082024335861206,
"logits/rejected": -2.2043795585632324,
"logps/chosen": -0.28011229634284973,
"logps/rejected": -0.28280124068260193,
"loss": 0.32376912236213684,
"loss/core": 0.3100174069404602,
"loss/preference_sft": 0.28011229634284973,
"loss/reference_anchor": 0.15534545481204987,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 2.039736032485962,
"rewards/margins": 1.180772066116333,
"rewards/rejected": 0.8589638471603394,
"step": 340
},
{
"drift/chosen_abs": 0.16444484889507294,
"drift/rejected_abs": 0.08357802778482437,
"epoch": 0.3296309566463633,
"grad_norm": 8.875,
"learning_rate": 4.3867739505569303e-07,
"logits/chosen": -2.301851987838745,
"logits/rejected": -2.362597942352295,
"logps/chosen": -0.2823006212711334,
"logps/rejected": -0.2937981188297272,
"loss": 0.2071170061826706,
"loss/core": 0.19756881892681122,
"loss/preference_sft": 0.2823006212711334,
"loss/reference_anchor": 0.09907897561788559,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 1.6424602270126343,
"rewards/margins": 0.8107796907424927,
"rewards/rejected": 0.8316806554794312,
"step": 345
},
{
"drift/chosen_abs": 0.19968092441558838,
"drift/rejected_abs": 0.09401963651180267,
"epoch": 0.33440821688761496,
"grad_norm": 7.9375,
"learning_rate": 4.35054531871708e-07,
"logits/chosen": -2.045243978500366,
"logits/rejected": -2.024528980255127,
"logps/chosen": -0.26065462827682495,
"logps/rejected": -0.2573546767234802,
"loss": 0.21272404491901398,
"loss/core": 0.2031305581331253,
"loss/preference_sft": 0.26065462827682495,
"loss/reference_anchor": 0.10184787213802338,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 1.995410680770874,
"rewards/margins": 1.057207703590393,
"rewards/rejected": 0.9382032155990601,
"step": 350
},
{
"drift/chosen_abs": 0.1851430982351303,
"drift/rejected_abs": 0.1371186524629593,
"epoch": 0.3391854771288666,
"grad_norm": 9.6875,
"learning_rate": 4.3134359275307185e-07,
"logits/chosen": -2.0893471240997314,
"logits/rejected": -2.2154877185821533,
"logps/chosen": -0.2807328701019287,
"logps/rejected": -0.29229921102523804,
"loss": 0.4610310196876526,
"loss/core": 0.4423205256462097,
"loss/preference_sft": 0.2807328701019287,
"loss/reference_anchor": 0.22139939665794373,
"rewards/accuracies": 0.9375,
"rewards/chosen": 1.850562334060669,
"rewards/margins": 0.49644041061401367,
"rewards/rejected": 1.3541219234466553,
"step": 355
},
{
"drift/chosen_abs": 0.2644307017326355,
"drift/rejected_abs": 0.12655285000801086,
"epoch": 0.34396273737011823,
"grad_norm": 140.0,
"learning_rate": 4.2754634390582133e-07,
"logits/chosen": -2.113999605178833,
"logits/rejected": -2.1762969493865967,
"logps/chosen": -0.2791525721549988,
"logps/rejected": -0.28297150135040283,
"loss": 0.6517452001571655,
"loss/core": 0.626146674156189,
"loss/preference_sft": 0.2791525721549988,
"loss/reference_anchor": 0.31339868903160095,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 2.643383026123047,
"rewards/margins": 1.3792022466659546,
"rewards/rejected": 1.2641807794570923,
"step": 360
},
{
"drift/chosen_abs": 0.28687232732772827,
"drift/rejected_abs": 0.07955290377140045,
"epoch": 0.34873999761136987,
"grad_norm": 470.0,
"learning_rate": 4.236645926147493e-07,
"logits/chosen": -2.053063154220581,
"logits/rejected": -2.159447193145752,
"logps/chosen": -0.2858540415763855,
"logps/rejected": -0.28544557094573975,
"loss": 1.0082862377166748,
"loss/core": 0.9697242975234985,
"loss/preference_sft": 0.2858540415763855,
"loss/reference_anchor": 0.4855729043483734,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 2.865591049194336,
"rewards/margins": 2.0717544555664062,
"rewards/rejected": 0.793836772441864,
"step": 365
},
{
"drift/chosen_abs": 0.16405682265758514,
"drift/rejected_abs": 0.1052694097161293,
"epoch": 0.3535172578526215,
"grad_norm": 22.375,
"learning_rate": 4.1970018638323547e-07,
"logits/chosen": -2.2507824897766113,
"logits/rejected": -2.2962427139282227,
"logps/chosen": -0.28528791666030884,
"logps/rejected": -0.28648024797439575,
"loss": 0.18379460275173187,
"loss/core": 0.17507164180278778,
"loss/preference_sft": 0.28528791666030884,
"loss/reference_anchor": 0.08777736127376556,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 1.639823317527771,
"rewards/margins": 0.5898867249488831,
"rewards/rejected": 1.0499365329742432,
"step": 370
},
{
"drift/chosen_abs": 0.30081304907798767,
"drift/rejected_abs": 0.22256799042224884,
"epoch": 0.35829451809387314,
"grad_norm": 8.8125,
"learning_rate": 4.1565501205393436e-07,
"logits/chosen": -2.0259885787963867,
"logits/rejected": -2.004533290863037,
"logps/chosen": -0.2593756318092346,
"logps/rejected": -0.2595575451850891,
"loss": 0.8363986015319824,
"loss/core": 0.8042640686035156,
"loss/preference_sft": 0.2593756318092346,
"loss/reference_anchor": 0.4025222659111023,
"rewards/accuracies": 0.875,
"rewards/chosen": 3.007532835006714,
"rewards/margins": 0.8016997575759888,
"rewards/rejected": 2.2058329582214355,
"step": 375
},
{
"drift/chosen_abs": 0.2039259374141693,
"drift/rejected_abs": 0.16159279644489288,
"epoch": 0.36307177833512483,
"grad_norm": 17.125,
"learning_rate": 4.1153099491074093e-07,
"logits/chosen": -2.1002986431121826,
"logits/rejected": -2.1101698875427246,
"logps/chosen": -0.28150156140327454,
"logps/rejected": -0.29337161779403687,
"loss": 0.7919434905052185,
"loss/core": 0.7612730264663696,
"loss/preference_sft": 0.28150156140327454,
"loss/reference_anchor": 0.3807896077632904,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 2.036198854446411,
"rewards/margins": 0.47472089529037476,
"rewards/rejected": 1.5614778995513916,
"step": 380
},
{
"drift/chosen_abs": 0.21656015515327454,
"drift/rejected_abs": 0.1512974351644516,
"epoch": 0.36784903857637646,
"grad_norm": 30.0,
"learning_rate": 4.0733009776245937e-07,
"logits/chosen": -2.0933432579040527,
"logits/rejected": -2.113175630569458,
"logps/chosen": -0.27162864804267883,
"logps/rejected": -0.2761984169483185,
"loss": 0.38956135511398315,
"loss/core": 0.37349286675453186,
"loss/preference_sft": 0.27162864804267883,
"loss/reference_anchor": 0.18708345293998718,
"rewards/accuracies": 0.8125,
"rewards/chosen": 2.1639719009399414,
"rewards/margins": 0.6549761295318604,
"rewards/rejected": 1.5089956521987915,
"step": 385
},
{
"drift/chosen_abs": 0.17612993717193604,
"drift/rejected_abs": 0.08776899427175522,
"epoch": 0.3726262988176281,
"grad_norm": 2.015625,
"learning_rate": 4.0305432000861226e-07,
"logits/chosen": -1.8524726629257202,
"logits/rejected": -1.9306892156600952,
"logps/chosen": -0.3076761066913605,
"logps/rejected": -0.3044106662273407,
"loss": 0.21172335743904114,
"loss/core": 0.20182469487190247,
"loss/preference_sft": 0.3076761066913605,
"loss/reference_anchor": 0.10121461004018784,
"rewards/accuracies": 0.875,
"rewards/chosen": 1.7569738626480103,
"rewards/margins": 0.8802940249443054,
"rewards/rejected": 0.8766800165176392,
"step": 390
},
{
"drift/chosen_abs": 0.16845259070396423,
"drift/rejected_abs": 0.07968206703662872,
"epoch": 0.37740355905887973,
"grad_norm": 18.375,
"learning_rate": 3.9870569668783533e-07,
"logits/chosen": -2.2020130157470703,
"logits/rejected": -2.3044018745422363,
"logps/chosen": -0.2947576642036438,
"logps/rejected": -0.2907804548740387,
"loss": 0.1688641607761383,
"loss/core": 0.1606094241142273,
"loss/preference_sft": 0.2947576642036438,
"loss/reference_anchor": 0.08058713376522064,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": 1.6845258474349976,
"rewards/margins": 0.8892566561698914,
"rewards/rejected": 0.7952693104743958,
"step": 395
},
{
"drift/chosen_abs": 0.2936556935310364,
"drift/rejected_abs": 0.08415323495864868,
"epoch": 0.38218081930013137,
"grad_norm": 53.25,
"learning_rate": 3.942862975093084e-07,
"logits/chosen": -2.0824859142303467,
"logits/rejected": -2.1172521114349365,
"logps/chosen": -0.2918018698692322,
"logps/rejected": -0.2934037148952484,
"loss": 1.0916287899017334,
"loss/core": 1.0500308275222778,
"loss/preference_sft": 0.2918018698692322,
"loss/reference_anchor": 0.5254592299461365,
"rewards/accuracies": 0.875,
"rewards/chosen": 2.9353275299072266,
"rewards/margins": 2.0966556072235107,
"rewards/rejected": 0.8386720418930054,
"step": 400
},
{
"drift/chosen_abs": 0.23455221951007843,
"drift/rejected_abs": 0.12242819368839264,
"epoch": 0.386958079541383,
"grad_norm": 6.0,
"learning_rate": 3.8979822586768666e-07,
"logits/chosen": -2.113771677017212,
"logits/rejected": -2.168362617492676,
"logps/chosen": -0.3119937777519226,
"logps/rejected": -0.30502599477767944,
"loss": 0.7244704961776733,
"loss/core": 0.69599449634552,
"loss/preference_sft": 0.3119937777519226,
"loss/reference_anchor": 0.3484812080860138,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 2.345109224319458,
"rewards/margins": 1.12223219871521,
"rewards/rejected": 1.222877025604248,
"step": 405
},
{
"drift/chosen_abs": 0.20881287753582,
"drift/rejected_abs": 0.11809121072292328,
"epoch": 0.39173533978263464,
"grad_norm": 21.875,
"learning_rate": 3.8524361784199847e-07,
"logits/chosen": -2.228954315185547,
"logits/rejected": -2.2588367462158203,
"logps/chosen": -0.2771432101726532,
"logps/rejected": -0.28896427154541016,
"loss": 0.2878721058368683,
"loss/core": 0.27545636892318726,
"loss/preference_sft": 0.2771432101726532,
"loss/reference_anchor": 0.13782820105552673,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 2.0866684913635254,
"rewards/margins": 0.9072427749633789,
"rewards/rejected": 1.179425597190857,
"step": 410
},
{
"drift/chosen_abs": 0.09865269809961319,
"drift/rejected_abs": 0.0373404435813427,
"epoch": 0.3965126000238863,
"grad_norm": 13.25,
"learning_rate": 3.806246411789872e-07,
"logits/chosen": -2.0978753566741943,
"logits/rejected": -2.176331043243408,
"logps/chosen": -0.33135882019996643,
"logps/rejected": -0.32153475284576416,
"loss": 0.06347070634365082,
"loss/core": 0.0587652213871479,
"loss/preference_sft": 0.33135882019996643,
"loss/reference_anchor": 0.029603928327560425,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": 0.9844989776611328,
"rewards/margins": 0.61436527967453,
"rewards/rejected": 0.37013378739356995,
"step": 415
},
{
"drift/chosen_abs": 0.20410975813865662,
"drift/rejected_abs": 0.07133093476295471,
"epoch": 0.40128986026513797,
"grad_norm": 92.5,
"learning_rate": 3.7594349426138154e-07,
"logits/chosen": -2.3295199871063232,
"logits/rejected": -2.2967400550842285,
"logps/chosen": -0.28380584716796875,
"logps/rejected": -0.2998279929161072,
"loss": 0.35089415311813354,
"loss/core": 0.3361276388168335,
"loss/preference_sft": 0.28380584716796875,
"loss/reference_anchor": 0.16850566864013672,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": 2.040860176086426,
"rewards/margins": 1.3300426006317139,
"rewards/rejected": 0.7108174562454224,
"step": 420
},
{
"drift/chosen_abs": 0.22340837121009827,
"drift/rejected_abs": 0.16072794795036316,
"epoch": 0.4060671205063896,
"grad_norm": 186.0,
"learning_rate": 3.712024050615843e-07,
"logits/chosen": -1.9938865900039673,
"logits/rejected": -2.0516488552093506,
"logps/chosen": -0.2920078635215759,
"logps/rejected": -0.2692197859287262,
"loss": 0.8027600049972534,
"loss/core": 0.7715979814529419,
"loss/preference_sft": 0.2920078635215759,
"loss/reference_anchor": 0.38629359006881714,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 2.2311575412750244,
"rewards/margins": 0.626264214515686,
"rewards/rejected": 1.6048933267593384,
"step": 425
},
{
"drift/chosen_abs": 0.4396797716617584,
"drift/rejected_abs": 0.1412547528743744,
"epoch": 0.41084438074764124,
"grad_norm": 696.0,
"learning_rate": 3.664036300812778e-07,
"logits/chosen": -2.0478415489196777,
"logits/rejected": -2.0716514587402344,
"logps/chosen": -0.2803536057472229,
"logps/rejected": -0.26729705929756165,
"loss": 1.897403359413147,
"loss/core": 1.8267196416854858,
"loss/preference_sft": 0.2803536057472229,
"loss/reference_anchor": 0.914415717124939,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 4.394786834716797,
"rewards/margins": 2.983668804168701,
"rewards/rejected": 1.4111182689666748,
"step": 430
},
{
"drift/chosen_abs": 0.1620672643184662,
"drift/rejected_abs": 0.10048636049032211,
"epoch": 0.41562164098889287,
"grad_norm": 8.6875,
"learning_rate": 3.615494532774522e-07,
"logits/chosen": -2.3244786262512207,
"logits/rejected": -2.30962872505188,
"logps/chosen": -0.27878594398498535,
"logps/rejected": -0.2934947609901428,
"loss": 0.2484576255083084,
"loss/core": 0.23745962977409363,
"loss/preference_sft": 0.27878594398498535,
"loss/reference_anchor": 0.11876034736633301,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 1.6202609539031982,
"rewards/margins": 0.6176348328590393,
"rewards/rejected": 1.0026261806488037,
"step": 435
},
{
"drift/chosen_abs": 0.29970285296440125,
"drift/rejected_abs": 0.13486061990261078,
"epoch": 0.4203989012301445,
"grad_norm": 490.0,
"learning_rate": 3.5664218497536456e-07,
"logits/chosen": -2.0376389026641846,
"logits/rejected": -2.108769416809082,
"logps/chosen": -0.304705411195755,
"logps/rejected": -0.3040980398654938,
"loss": 1.0282645225524902,
"loss/core": 0.9888750314712524,
"loss/preference_sft": 0.304705411195755,
"loss/reference_anchor": 0.4947218894958496,
"rewards/accuracies": 0.875,
"rewards/chosen": 2.992257595062256,
"rewards/margins": 1.6467006206512451,
"rewards/rejected": 1.3455569744110107,
"step": 440
},
{
"drift/chosen_abs": 0.2948855757713318,
"drift/rejected_abs": 0.1586662232875824,
"epoch": 0.42517616147139614,
"grad_norm": 40.0,
"learning_rate": 3.516841607689501e-07,
"logits/chosen": -1.9140384197235107,
"logits/rejected": -1.8901231288909912,
"logps/chosen": -0.29691654443740845,
"logps/rejected": -0.2970215678215027,
"loss": 0.5381649732589722,
"loss/core": 0.5165340900421143,
"loss/preference_sft": 0.29691654443740845,
"loss/reference_anchor": 0.2587199807167053,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 2.9474780559539795,
"rewards/margins": 1.3833874464035034,
"rewards/rejected": 1.5640907287597656,
"step": 445
},
{
"drift/chosen_abs": 0.3455376923084259,
"drift/rejected_abs": 0.15802158415317535,
"epoch": 0.4299534217126478,
"grad_norm": 426.0,
"learning_rate": 3.4667774040920515e-07,
"logits/chosen": -1.9539282321929932,
"logits/rejected": -1.9721944332122803,
"logps/chosen": -0.29860302805900574,
"logps/rejected": -0.29259243607521057,
"loss": 0.9283429980278015,
"loss/core": 0.8925935626029968,
"loss/preference_sft": 0.29860302805900574,
"loss/reference_anchor": 0.4467983841896057,
"rewards/accuracies": 0.9375,
"rewards/chosen": 3.454946994781494,
"rewards/margins": 1.8800350427627563,
"rewards/rejected": 1.5749118328094482,
"step": 450
},
{
"drift/chosen_abs": 0.3471214175224304,
"drift/rejected_abs": 0.14864817261695862,
"epoch": 0.4347306819538994,
"grad_norm": 200.0,
"learning_rate": 3.416253066810743e-07,
"logits/chosen": -1.918105125427246,
"logits/rejected": -2.1081409454345703,
"logps/chosen": -0.3223501741886139,
"logps/rejected": -0.31352201104164124,
"loss": 1.5264394283294678,
"loss/core": 1.4688888788223267,
"loss/preference_sft": 0.3223501741886139,
"loss/reference_anchor": 0.7351065278053284,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 3.4693026542663574,
"rewards/margins": 1.9863710403442383,
"rewards/rejected": 1.4829317331314087,
"step": 455
},
{
"drift/chosen_abs": 0.36486533284187317,
"drift/rejected_abs": 0.1869690865278244,
"epoch": 0.4395079421951511,
"grad_norm": 33.75,
"learning_rate": 3.3652926426937325e-07,
"logits/chosen": -2.0386669635772705,
"logits/rejected": -2.027118444442749,
"logps/chosen": -0.29761844873428345,
"logps/rejected": -0.3065989017486572,
"loss": 1.2015959024429321,
"loss/core": 1.155981421470642,
"loss/preference_sft": 0.29761844873428345,
"loss/reference_anchor": 0.5784320831298828,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 3.648583173751831,
"rewards/margins": 1.7795528173446655,
"rewards/rejected": 1.869030237197876,
"step": 460
},
{
"drift/chosen_abs": 0.2300829440355301,
"drift/rejected_abs": 0.09263820201158524,
"epoch": 0.44428520243640274,
"grad_norm": 11.0,
"learning_rate": 3.3139203861428914e-07,
"logits/chosen": -1.8710740804672241,
"logits/rejected": -1.9699445962905884,
"logps/chosen": -0.29734542965888977,
"logps/rejected": -0.29221880435943604,
"loss": 0.24437861144542694,
"loss/core": 0.23336219787597656,
"loss/preference_sft": 0.29734542965888977,
"loss/reference_anchor": 0.1171511560678482,
"rewards/accuracies": 0.949999988079071,
"rewards/chosen": 2.299163818359375,
"rewards/margins": 1.3750882148742676,
"rewards/rejected": 0.9240756034851074,
"step": 465
},
{
"drift/chosen_abs": 0.297715425491333,
"drift/rejected_abs": 0.12405421584844589,
"epoch": 0.4490624626776544,
"grad_norm": 1064.0,
"learning_rate": 3.262160747570027e-07,
"logits/chosen": -2.1081130504608154,
"logits/rejected": -2.1759676933288574,
"logps/chosen": -0.282444030046463,
"logps/rejected": -0.26066750288009644,
"loss": 1.1672271490097046,
"loss/core": 1.122953176498413,
"loss/preference_sft": 0.282444030046463,
"loss/reference_anchor": 0.5620765686035156,
"rewards/accuracies": 0.9375,
"rewards/chosen": 2.976147174835205,
"rewards/margins": 1.8132495880126953,
"rewards/rejected": 1.1628977060317993,
"step": 470
},
{
"drift/chosen_abs": 0.1827501803636551,
"drift/rejected_abs": 0.14713791012763977,
"epoch": 0.453839722918906,
"grad_norm": 82.5,
"learning_rate": 3.210038361759807e-07,
"logits/chosen": -2.0727429389953613,
"logits/rejected": -2.012450933456421,
"logps/chosen": -0.2958831191062927,
"logps/rejected": -0.32066217064857483,
"loss": 0.4937218129634857,
"loss/core": 0.47373858094215393,
"loss/preference_sft": 0.2958831191062927,
"loss/reference_anchor": 0.23685435950756073,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 1.8267005681991577,
"rewards/margins": 0.35839390754699707,
"rewards/rejected": 1.4683068990707397,
"step": 475
},
{
"drift/chosen_abs": 0.23704016208648682,
"drift/rejected_abs": 0.10950712114572525,
"epoch": 0.45861698316015764,
"grad_norm": 6.28125,
"learning_rate": 3.1575780361449364e-07,
"logits/chosen": -2.2403244972229004,
"logits/rejected": -2.296858310699463,
"logps/chosen": -0.2744103670120239,
"logps/rejected": -0.27569180727005005,
"loss": 0.5795036554336548,
"loss/core": 0.5565477013587952,
"loss/preference_sft": 0.2744103670120239,
"loss/reference_anchor": 0.2786380648612976,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 2.36838960647583,
"rewards/margins": 1.3759324550628662,
"rewards/rejected": 0.9924572110176086,
"step": 480
},
{
"drift/chosen_abs": 0.17343619465827942,
"drift/rejected_abs": 0.08826018869876862,
"epoch": 0.4633942434014093,
"grad_norm": 13.4375,
"learning_rate": 3.104804738999169e-07,
"logits/chosen": -2.1836743354797363,
"logits/rejected": -2.1913857460021973,
"logps/chosen": -0.2924710214138031,
"logps/rejected": -0.2964377999305725,
"loss": 0.16332216560840607,
"loss/core": 0.15528026223182678,
"loss/preference_sft": 0.2924710214138031,
"loss/reference_anchor": 0.07797853648662567,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 1.7339932918548584,
"rewards/margins": 0.8536950349807739,
"rewards/rejected": 0.8802981376647949,
"step": 485
},
{
"drift/chosen_abs": 0.2068719118833542,
"drift/rejected_abs": 0.1048976331949234,
"epoch": 0.4681715036426609,
"grad_norm": 21.25,
"learning_rate": 3.0517435875537536e-07,
"logits/chosen": -2.1321020126342773,
"logits/rejected": -2.1710128784179688,
"logps/chosen": -0.3080752491950989,
"logps/rejected": -0.2949379086494446,
"loss": 0.30973607301712036,
"loss/core": 0.2963031232357025,
"loss/preference_sft": 0.3080752491950989,
"loss/reference_anchor": 0.1482984721660614,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 2.0682833194732666,
"rewards/margins": 1.0205515623092651,
"rewards/rejected": 1.047731637954712,
"step": 490
},
{
"drift/chosen_abs": 0.26098620891571045,
"drift/rejected_abs": 0.0885407105088234,
"epoch": 0.47294876388391255,
"grad_norm": 20.875,
"learning_rate": 2.998419836042993e-07,
"logits/chosen": -2.2028145790100098,
"logits/rejected": -2.297614097595215,
"logps/chosen": -0.29816746711730957,
"logps/rejected": -0.2916865348815918,
"loss": 0.7447795271873474,
"loss/core": 0.7156817317008972,
"loss/preference_sft": 0.29816746711730957,
"loss/reference_anchor": 0.3581535518169403,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 2.6079015731811523,
"rewards/margins": 1.724554419517517,
"rewards/rejected": 0.8833469152450562,
"step": 495
},
{
"drift/chosen_abs": 0.41630882024765015,
"drift/rejected_abs": 0.20278768241405487,
"epoch": 0.47772602412516424,
"grad_norm": 123.0,
"learning_rate": 2.9448588636846043e-07,
"logits/chosen": -1.9985599517822266,
"logits/rejected": -1.949119210243225,
"logps/chosen": -0.28114375472068787,
"logps/rejected": -0.30273741483688354,
"loss": 2.383561134338379,
"loss/core": 2.295335292816162,
"loss/preference_sft": 0.28114375472068787,
"loss/reference_anchor": 1.1482231616973877,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 4.163088798522949,
"rewards/margins": 2.138087511062622,
"rewards/rejected": 2.025001049041748,
"step": 500
},
{
"drift/chosen_abs": 0.3645007014274597,
"drift/rejected_abs": 0.18596860766410828,
"epoch": 0.4825032843664159,
"grad_norm": 354.0,
"learning_rate": 2.8910861626005773e-07,
"logits/chosen": -2.129087209701538,
"logits/rejected": -2.1622016429901123,
"logps/chosen": -0.28229135274887085,
"logps/rejected": -0.28652527928352356,
"loss": 1.6089633703231812,
"loss/core": 1.548729658126831,
"loss/preference_sft": 0.28229135274887085,
"loss/reference_anchor": 0.7748891115188599,
"rewards/accuracies": 0.8374999761581421,
"rewards/chosen": 3.643630266189575,
"rewards/margins": 1.8779332637786865,
"rewards/rejected": 1.7656971216201782,
"step": 505
},
{
"drift/chosen_abs": 0.20183968544006348,
"drift/rejected_abs": 0.0795665830373764,
"epoch": 0.4872805446076675,
"grad_norm": 0.28515625,
"learning_rate": 2.8371273256843074e-07,
"logits/chosen": -2.1265504360198975,
"logits/rejected": -2.259223699569702,
"logps/chosen": -0.31546053290367126,
"logps/rejected": -0.29201287031173706,
"loss": 0.4467145502567291,
"loss/core": 0.42825937271118164,
"loss/preference_sft": 0.31546053290367126,
"loss/reference_anchor": 0.21452267467975616,
"rewards/accuracies": 0.875,
"rewards/chosen": 2.015305995941162,
"rewards/margins": 1.221923589706421,
"rewards/rejected": 0.793382465839386,
"step": 510
},
{
"drift/chosen_abs": 0.25470539927482605,
"drift/rejected_abs": 0.16728895902633667,
"epoch": 0.49205780484891914,
"grad_norm": 38.75,
"learning_rate": 2.783008034419767e-07,
"logits/chosen": -2.011662721633911,
"logits/rejected": -2.014399528503418,
"logps/chosen": -0.2826010584831238,
"logps/rejected": -0.306089848279953,
"loss": 0.4587891697883606,
"loss/core": 0.44014644622802734,
"loss/preference_sft": 0.2826010584831238,
"loss/reference_anchor": 0.22030992805957794,
"rewards/accuracies": 0.824999988079071,
"rewards/chosen": 2.545462131500244,
"rewards/margins": 0.8881236910820007,
"rewards/rejected": 1.6573383808135986,
"step": 515
},
{
"drift/chosen_abs": 0.3071853816509247,
"drift/rejected_abs": 0.09579263627529144,
"epoch": 0.4968350650901708,
"grad_norm": 55.5,
"learning_rate": 2.7287540466585064e-07,
"logits/chosen": -2.0407145023345947,
"logits/rejected": -2.208981990814209,
"logps/chosen": -0.32281801104545593,
"logps/rejected": -0.3359902501106262,
"loss": 0.8434049487113953,
"loss/core": 0.8105605244636536,
"loss/preference_sft": 0.32281801104545593,
"loss/reference_anchor": 0.40564513206481934,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 3.066298007965088,
"rewards/margins": 2.121892213821411,
"rewards/rejected": 0.9444060325622559,
"step": 520
},
{
"drift/chosen_abs": 0.41961222887039185,
"drift/rejected_abs": 0.15004144608974457,
"epoch": 0.5016123253314224,
"grad_norm": 1408.0,
"learning_rate": 2.674391184360313e-07,
"logits/chosen": -2.1737782955169678,
"logits/rejected": -2.141087293624878,
"logps/chosen": -0.31184646487236023,
"logps/rejected": -0.29689449071884155,
"loss": 1.9573285579681396,
"loss/core": 1.8842939138412476,
"loss/preference_sft": 0.31184646487236023,
"loss/reference_anchor": 0.9426106214523315,
"rewards/accuracies": 0.875,
"rewards/chosen": 4.192916393280029,
"rewards/margins": 2.6963582038879395,
"rewards/rejected": 1.4965574741363525,
"step": 525
},
{
"drift/chosen_abs": 0.3052569031715393,
"drift/rejected_abs": 0.1496833860874176,
"epoch": 0.5063895855726741,
"grad_norm": 0.41796875,
"learning_rate": 2.6199453213033593e-07,
"logits/chosen": -2.0180935859680176,
"logits/rejected": -1.9813159704208374,
"logps/chosen": -0.28599947690963745,
"logps/rejected": -0.28876030445098877,
"loss": 0.8264201283454895,
"loss/core": 0.7944486141204834,
"loss/preference_sft": 0.28599947690963745,
"loss/reference_anchor": 0.3976878523826599,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 3.0507431030273438,
"rewards/margins": 1.5630565881729126,
"rewards/rejected": 1.4876863956451416,
"step": 530
},
{
"drift/chosen_abs": 0.31068387627601624,
"drift/rejected_abs": 0.10734076797962189,
"epoch": 0.5111668458139257,
"grad_norm": 580.0,
"learning_rate": 2.565442370769683e-07,
"logits/chosen": -2.1644198894500732,
"logits/rejected": -2.085977554321289,
"logps/chosen": -0.2844741642475128,
"logps/rejected": -0.27978286147117615,
"loss": 0.9638272523880005,
"loss/core": 0.9268702268600464,
"loss/preference_sft": 0.2844741642475128,
"loss/reference_anchor": 0.46431416273117065,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 3.104759931564331,
"rewards/margins": 2.0328688621520996,
"rewards/rejected": 1.0718910694122314,
"step": 535
},
{
"drift/chosen_abs": 0.15837408602237701,
"drift/rejected_abs": 0.15098315477371216,
"epoch": 0.5159441060551774,
"grad_norm": 1.5,
"learning_rate": 2.510908273211866e-07,
"logits/chosen": -2.086716413497925,
"logits/rejected": -2.065261125564575,
"logps/chosen": -0.27920594811439514,
"logps/rejected": -0.2877506613731384,
"loss": 0.33345627784729004,
"loss/core": 0.31936904788017273,
"loss/preference_sft": 0.27920594811439514,
"loss/reference_anchor": 0.15990903973579407,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 1.5837407112121582,
"rewards/margins": 0.07735572755336761,
"rewards/rejected": 1.5063849687576294,
"step": 540
},
{
"drift/chosen_abs": 0.2585676312446594,
"drift/rejected_abs": 0.08764716237783432,
"epoch": 0.520721366296429,
"grad_norm": 1264.0,
"learning_rate": 2.456368983906791e-07,
"logits/chosen": -2.305999994277954,
"logits/rejected": -2.1507370471954346,
"logps/chosen": -0.28886252641677856,
"logps/rejected": -0.2935750484466553,
"loss": 0.9189807772636414,
"loss/core": 0.8836311101913452,
"loss/preference_sft": 0.28886252641677856,
"loss/reference_anchor": 0.44244223833084106,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 2.5849061012268066,
"rewards/margins": 1.7120176553726196,
"rewards/rejected": 0.8728883862495422,
"step": 545
},
{
"drift/chosen_abs": 0.27887991070747375,
"drift/rejected_abs": 0.1610538214445114,
"epoch": 0.5254986265376806,
"grad_norm": 12.75,
"learning_rate": 2.401850460602329e-07,
"logits/chosen": -1.8745006322860718,
"logits/rejected": -1.8935530185699463,
"logps/chosen": -0.2741144299507141,
"logps/rejected": -0.2991863191127777,
"loss": 0.8370600938796997,
"loss/core": 0.8047995567321777,
"loss/preference_sft": 0.2741144299507141,
"loss/reference_anchor": 0.40272873640060425,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 2.7885258197784424,
"rewards/margins": 1.1791884899139404,
"rewards/rejected": 1.6093372106552124,
"step": 550
},
{
"drift/chosen_abs": 0.3264530301094055,
"drift/rejected_abs": 0.09586937725543976,
"epoch": 0.5302758867789323,
"grad_norm": 5.8125,
"learning_rate": 2.3473786511628575e-07,
"logits/chosen": -2.0708940029144287,
"logits/rejected": -2.1273093223571777,
"logps/chosen": -0.3148099184036255,
"logps/rejected": -0.2786844074726105,
"loss": 0.81494140625,
"loss/core": 0.7831686735153198,
"loss/preference_sft": 0.3148099184036255,
"loss/reference_anchor": 0.39215487241744995,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 3.2636561393737793,
"rewards/margins": 2.305521011352539,
"rewards/rejected": 0.9581351280212402,
"step": 555
},
{
"drift/chosen_abs": 0.28125500679016113,
"drift/rejected_abs": 0.15266069769859314,
"epoch": 0.5350531470201839,
"grad_norm": 50.5,
"learning_rate": 2.2929794812194894e-07,
"logits/chosen": -2.1583635807037354,
"logits/rejected": -2.1458077430725098,
"logps/chosen": -0.27610182762145996,
"logps/rejected": -0.28124934434890747,
"loss": 0.7136462926864624,
"loss/core": 0.6858313083648682,
"loss/preference_sft": 0.27610182762145996,
"loss/reference_anchor": 0.3432568311691284,
"rewards/accuracies": 0.949999988079071,
"rewards/chosen": 2.8115084171295166,
"rewards/margins": 1.2856230735778809,
"rewards/rejected": 1.5258853435516357,
"step": 560
},
{
"drift/chosen_abs": 0.27818697690963745,
"drift/rejected_abs": 0.16565275192260742,
"epoch": 0.5398304072614356,
"grad_norm": 19.5,
"learning_rate": 2.2386788418308665e-07,
"logits/chosen": -2.056506395339966,
"logits/rejected": -2.082536220550537,
"logps/chosen": -0.28751203417778015,
"logps/rejected": -0.3056444227695465,
"loss": 1.35868239402771,
"loss/core": 1.3074853420257568,
"loss/preference_sft": 0.28751203417778015,
"loss/reference_anchor": 0.6538757085800171,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": 2.7808547019958496,
"rewards/margins": 1.124733805656433,
"rewards/rejected": 1.6561208963394165,
"step": 565
},
{
"drift/chosen_abs": 0.3337910771369934,
"drift/rejected_abs": 0.16797366738319397,
"epoch": 0.5446076675026872,
"grad_norm": 71.5,
"learning_rate": 2.184502577160426e-07,
"logits/chosen": -2.0548603534698486,
"logits/rejected": -2.1045546531677246,
"logps/chosen": -0.2894991338253021,
"logps/rejected": -0.2895090579986572,
"loss": 0.9317213892936707,
"loss/core": 0.8959233164787292,
"loss/preference_sft": 0.2894991338253021,
"loss/reference_anchor": 0.4483569264411926,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 3.335692882537842,
"rewards/margins": 1.657538652420044,
"rewards/rejected": 1.6781543493270874,
"step": 570
},
{
"drift/chosen_abs": 0.18387334048748016,
"drift/rejected_abs": 0.06442725658416748,
"epoch": 0.5493849277439389,
"grad_norm": 8.9375,
"learning_rate": 2.1304764721759732e-07,
"logits/chosen": -2.1352288722991943,
"logits/rejected": -2.1651110649108887,
"logps/chosen": -0.30129939317703247,
"logps/rejected": -0.32308152318000793,
"loss": 0.345123291015625,
"loss/core": 0.3304422199726105,
"loss/preference_sft": 0.30129939317703247,
"loss/reference_anchor": 0.16561798751354218,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 1.8363609313964844,
"rewards/margins": 1.274545669555664,
"rewards/rejected": 0.5618152022361755,
"step": 575
},
{
"drift/chosen_abs": 0.14127376675605774,
"drift/rejected_abs": 0.0939093828201294,
"epoch": 0.5541621879851905,
"grad_norm": 0.49609375,
"learning_rate": 2.0766262403774385e-07,
"logits/chosen": -2.4066150188446045,
"logits/rejected": -2.462902545928955,
"logps/chosen": -0.26729652285575867,
"logps/rejected": -0.2831682562828064,
"loss": 0.17010077834129333,
"loss/core": 0.1620091199874878,
"loss/preference_sft": 0.26729652285575867,
"loss/reference_anchor": 0.08115912973880768,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 1.4122838973999023,
"rewards/margins": 0.4755134582519531,
"rewards/rejected": 0.9367703199386597,
"step": 580
},
{
"drift/chosen_abs": 0.22129257023334503,
"drift/rejected_abs": 0.13631665706634521,
"epoch": 0.5589394482264421,
"grad_norm": 35.25,
"learning_rate": 2.0229775115586378e-07,
"logits/chosen": -2.1155853271484375,
"logits/rejected": -2.0802512168884277,
"logps/chosen": -0.2712664008140564,
"logps/rejected": -0.28381767868995667,
"loss": 1.4533600807189941,
"loss/core": 1.3988597393035889,
"loss/preference_sft": 0.2712664008140564,
"loss/reference_anchor": 0.6995447874069214,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 2.212214469909668,
"rewards/margins": 0.8542079925537109,
"rewards/rejected": 1.358006477355957,
"step": 585
},
{
"drift/chosen_abs": 0.3607145845890045,
"drift/rejected_abs": 0.10202290117740631,
"epoch": 0.5637167084676937,
"grad_norm": 4.625,
"learning_rate": 1.9695558196088844e-07,
"logits/chosen": -2.002814292907715,
"logits/rejected": -2.099381923675537,
"logps/chosen": -0.28898441791534424,
"logps/rejected": -0.28851771354675293,
"loss": 0.9255863428115845,
"loss/core": 0.8899755477905273,
"loss/preference_sft": 0.28898441791534424,
"loss/reference_anchor": 0.44591063261032104,
"rewards/accuracies": 0.9375,
"rewards/chosen": 3.606508731842041,
"rewards/margins": 2.5896670818328857,
"rewards/rejected": 1.0168412923812866,
"step": 590
},
{
"drift/chosen_abs": 0.1707986295223236,
"drift/rejected_abs": 0.08907818049192429,
"epoch": 0.5684939687089454,
"grad_norm": 4.28125,
"learning_rate": 1.9163865903602372e-07,
"logits/chosen": -2.0221307277679443,
"logits/rejected": -2.0168774127960205,
"logps/chosen": -0.2755976915359497,
"logps/rejected": -0.27291139960289,
"loss": 0.11963596194982529,
"loss/core": 0.1133008748292923,
"loss/preference_sft": 0.2755976915359497,
"loss/reference_anchor": 0.05690792202949524,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 1.7069168090820312,
"rewards/margins": 0.8279293775558472,
"rewards/rejected": 0.8789873123168945,
"step": 595
},
{
"drift/chosen_abs": 0.18752028048038483,
"drift/rejected_abs": 0.10666258633136749,
"epoch": 0.5732712289501971,
"grad_norm": 24.875,
"learning_rate": 1.8634951294861806e-07,
"logits/chosen": -2.253175735473633,
"logits/rejected": -2.2427711486816406,
"logps/chosen": -0.2663193345069885,
"logps/rejected": -0.28532105684280396,
"loss": 0.31239908933639526,
"loss/core": 0.2991681396961212,
"loss/preference_sft": 0.2663193345069885,
"loss/reference_anchor": 0.14978043735027313,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 1.8731563091278076,
"rewards/margins": 0.82030189037323,
"rewards/rejected": 1.052854299545288,
"step": 600
},
{
"drift/chosen_abs": 0.41676053404808044,
"drift/rejected_abs": 0.11940282583236694,
"epoch": 0.5780484891914487,
"grad_norm": 133.0,
"learning_rate": 1.810906610457502e-07,
"logits/chosen": -2.0973143577575684,
"logits/rejected": -2.171078681945801,
"logps/chosen": -0.2819843590259552,
"logps/rejected": -0.27706506848335266,
"loss": 1.816592812538147,
"loss/core": 1.7488460540771484,
"loss/preference_sft": 0.2819843590259552,
"loss/reference_anchor": 0.875086784362793,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 4.165308952331543,
"rewards/margins": 2.9730935096740723,
"rewards/rejected": 1.1922153234481812,
"step": 605
},
{
"drift/chosen_abs": 0.4254422187805176,
"drift/rejected_abs": 0.19570092856884003,
"epoch": 0.5828257494327004,
"grad_norm": 106.0,
"learning_rate": 1.7586460625610726e-07,
"logits/chosen": -2.0943334102630615,
"logits/rejected": -2.1102890968322754,
"logps/chosen": -0.2782813310623169,
"logps/rejected": -0.27373403310775757,
"loss": 1.9183744192123413,
"loss/core": 1.8469626903533936,
"loss/preference_sft": 0.2782813310623169,
"loss/reference_anchor": 0.9243267178535461,
"rewards/accuracies": 0.8374999761581421,
"rewards/chosen": 4.251742362976074,
"rewards/margins": 2.3000569343566895,
"rewards/rejected": 1.9516862630844116,
"step": 610
},
{
"drift/chosen_abs": 0.27416449785232544,
"drift/rejected_abs": 0.14728380739688873,
"epoch": 0.587603009673952,
"grad_norm": 13.5,
"learning_rate": 1.70673835898727e-07,
"logits/chosen": -1.9468109607696533,
"logits/rejected": -2.0125274658203125,
"logps/chosen": -0.3140425682067871,
"logps/rejected": -0.30548495054244995,
"loss": 0.6002452373504639,
"loss/core": 0.5762513279914856,
"loss/preference_sft": 0.3140425682067871,
"loss/reference_anchor": 0.2885145843029022,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 2.7396042346954346,
"rewards/margins": 1.2685816287994385,
"rewards/rejected": 1.471022367477417,
"step": 615
},
{
"drift/chosen_abs": 0.16883981227874756,
"drift/rejected_abs": 0.14558133482933044,
"epoch": 0.5923802699152036,
"grad_norm": 7.15625,
"learning_rate": 1.6552082049916824e-07,
"logits/chosen": -2.119967460632324,
"logits/rejected": -2.1456103324890137,
"logps/chosen": -0.2863292992115021,
"logps/rejected": -0.29261788725852966,
"loss": 0.40366506576538086,
"loss/core": 0.38699546456336975,
"loss/preference_sft": 0.2863292992115021,
"loss/reference_anchor": 0.1936284750699997,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 1.6874778270721436,
"rewards/margins": 0.236982062458992,
"rewards/rejected": 1.450495719909668,
"step": 620
},
{
"drift/chosen_abs": 0.388235867023468,
"drift/rejected_abs": 0.17607903480529785,
"epoch": 0.5971575301564552,
"grad_norm": 1256.0,
"learning_rate": 1.6040801261367493e-07,
"logits/chosen": -1.9117774963378906,
"logits/rejected": -1.9400612115859985,
"logps/chosen": -0.3054983913898468,
"logps/rejected": -0.3448588252067566,
"loss": 2.1722350120544434,
"loss/core": 2.0914366245269775,
"loss/preference_sft": 0.3054983913898468,
"loss/reference_anchor": 1.0467677116394043,
"rewards/accuracies": 0.8500000238418579,
"rewards/chosen": 3.8796839714050293,
"rewards/margins": 2.4553399085998535,
"rewards/rejected": 1.4243443012237549,
"step": 625
},
{
"drift/chosen_abs": 0.29388323426246643,
"drift/rejected_abs": 0.12398219108581543,
"epoch": 0.6019347903977069,
"grad_norm": 204.0,
"learning_rate": 1.5533784566189175e-07,
"logits/chosen": -1.9094196557998657,
"logits/rejected": -2.0244593620300293,
"logps/chosen": -0.27296558022499084,
"logps/rejected": -0.2840172350406647,
"loss": 0.9247919321060181,
"loss/core": 0.8893438577651978,
"loss/preference_sft": 0.27296558022499084,
"loss/reference_anchor": 0.4453449249267578,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 2.938032388687134,
"rewards/margins": 1.7004245519638062,
"rewards/rejected": 1.237607479095459,
"step": 630
},
{
"drift/chosen_abs": 0.23004408180713654,
"drift/rejected_abs": 0.10162544250488281,
"epoch": 0.6067120506389586,
"grad_norm": 300.0,
"learning_rate": 1.5031273276868845e-07,
"logits/chosen": -1.9615974426269531,
"logits/rejected": -2.0472800731658936,
"logps/chosen": -0.3058452904224396,
"logps/rejected": -0.3000328540802002,
"loss": 0.45604729652404785,
"loss/core": 0.43732786178588867,
"loss/preference_sft": 0.3058452904224396,
"loss/reference_anchor": 0.21900811791419983,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 2.2964746952056885,
"rewards/margins": 1.2814719676971436,
"rewards/rejected": 1.015002727508545,
"step": 635
},
{
"drift/chosen_abs": 0.19580507278442383,
"drift/rejected_abs": 0.07966174185276031,
"epoch": 0.6114893108802102,
"grad_norm": 2.625,
"learning_rate": 1.4533506561564305e-07,
"logits/chosen": -2.188485622406006,
"logits/rejected": -2.2632412910461426,
"logps/chosen": -0.30155614018440247,
"logps/rejected": -0.2989227771759033,
"loss": 0.4078275263309479,
"loss/core": 0.39089325070381165,
"loss/preference_sft": 0.30155614018440247,
"loss/reference_anchor": 0.19563566148281097,
"rewards/accuracies": 0.9375,
"rewards/chosen": 1.9569017887115479,
"rewards/margins": 1.161104440689087,
"rewards/rejected": 0.7957972288131714,
"step": 640
},
{
"drift/chosen_abs": 0.1673978865146637,
"drift/rejected_abs": 0.11365523189306259,
"epoch": 0.6162665711214619,
"grad_norm": 15.8125,
"learning_rate": 1.404072133027306e-07,
"logits/chosen": -2.133847713470459,
"logits/rejected": -2.1120846271514893,
"logps/chosen": -0.2908037602901459,
"logps/rejected": -0.30515560507774353,
"loss": 0.2214515656232834,
"loss/core": 0.21132436394691467,
"loss/preference_sft": 0.2908037602901459,
"loss/reference_anchor": 0.10594894737005234,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 1.6722071170806885,
"rewards/margins": 0.5402682423591614,
"rewards/rejected": 1.1319388151168823,
"step": 645
},
{
"drift/chosen_abs": 0.13293756544589996,
"drift/rejected_abs": 0.08515778928995132,
"epoch": 0.6210438313627135,
"grad_norm": 4.21875,
"learning_rate": 1.3553152122076078e-07,
"logits/chosen": -2.2003543376922607,
"logits/rejected": -2.1520040035247803,
"logps/chosen": -0.2900927662849426,
"logps/rejected": -0.30046719312667847,
"loss": 0.15672235190868378,
"loss/core": 0.14894674718379974,
"loss/preference_sft": 0.2900927662849426,
"loss/reference_anchor": 0.07466545701026917,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 1.327453851699829,
"rewards/margins": 0.5011469125747681,
"rewards/rejected": 0.8263068199157715,
"step": 650
},
{
"drift/chosen_abs": 0.20016181468963623,
"drift/rejected_abs": 0.09695510566234589,
"epoch": 0.6258210916039652,
"grad_norm": 56.0,
"learning_rate": 1.3071030993509787e-07,
"logits/chosen": -2.0374953746795654,
"logits/rejected": -2.099519729614258,
"logps/chosen": -0.2827564477920532,
"logps/rejected": -0.29163193702697754,
"loss": 0.2658204436302185,
"loss/core": 0.2541511654853821,
"loss/preference_sft": 0.2827564477920532,
"loss/reference_anchor": 0.12731416523456573,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 1.9995691776275635,
"rewards/margins": 1.030291199684143,
"rewards/rejected": 0.9692778587341309,
"step": 655
},
{
"drift/chosen_abs": 0.27798160910606384,
"drift/rejected_abs": 0.13286152482032776,
"epoch": 0.6305983518452167,
"grad_norm": 2.375,
"learning_rate": 1.2594587408119804e-07,
"logits/chosen": -2.0071966648101807,
"logits/rejected": -2.002094268798828,
"logps/chosen": -0.293853223323822,
"logps/rejected": -0.3049863874912262,
"loss": 1.3727947473526,
"loss/core": 1.321033000946045,
"loss/preference_sft": 0.293853223323822,
"loss/reference_anchor": 0.6607749462127686,
"rewards/accuracies": 0.875,
"rewards/chosen": 2.7776036262512207,
"rewards/margins": 1.4595942497253418,
"rewards/rejected": 1.3180092573165894,
"step": 660
},
{
"drift/chosen_abs": 0.23454730212688446,
"drift/rejected_abs": 0.14776912331581116,
"epoch": 0.6353756120864684,
"grad_norm": 141.0,
"learning_rate": 1.2124048127248644e-07,
"logits/chosen": -2.1691813468933105,
"logits/rejected": -2.143655776977539,
"logps/chosen": -0.28466880321502686,
"logps/rejected": -0.2818228602409363,
"loss": 0.5208796858787537,
"loss/core": 0.4999764859676361,
"loss/preference_sft": 0.28466880321502686,
"loss/reference_anchor": 0.2502433955669403,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 2.3442444801330566,
"rewards/margins": 0.8682305216789246,
"rewards/rejected": 1.4760141372680664,
"step": 665
},
{
"drift/chosen_abs": 0.364292711019516,
"drift/rejected_abs": 0.1280832588672638,
"epoch": 0.64015287232772,
"grad_norm": 1.484375,
"learning_rate": 1.1659637102109712e-07,
"logits/chosen": -1.9568021297454834,
"logits/rejected": -2.003387689590454,
"logps/chosen": -0.2745230197906494,
"logps/rejected": -0.31976574659347534,
"loss": 1.0210597515106201,
"loss/core": 0.982128918170929,
"loss/preference_sft": 0.2745230197906494,
"loss/reference_anchor": 0.49162501096725464,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": 3.6429271697998047,
"rewards/margins": 2.3816723823547363,
"rewards/rejected": 1.2612544298171997,
"step": 670
},
{
"drift/chosen_abs": 0.1619919240474701,
"drift/rejected_abs": 0.08836764097213745,
"epoch": 0.6449301325689717,
"grad_norm": 14.5625,
"learning_rate": 1.1201575367198546e-07,
"logits/chosen": -2.012540340423584,
"logits/rejected": -2.0545716285705566,
"logps/chosen": -0.2888466715812683,
"logps/rejected": -0.28877875208854675,
"loss": 0.13238023221492767,
"loss/core": 0.12548786401748657,
"loss/preference_sft": 0.2888466715812683,
"loss/reference_anchor": 0.06301363557577133,
"rewards/accuracies": 0.875,
"rewards/chosen": 1.6180137395858765,
"rewards/margins": 0.7427892088890076,
"rewards/rejected": 0.8752244114875793,
"step": 675
},
{
"drift/chosen_abs": 0.21459881961345673,
"drift/rejected_abs": 0.1355762928724289,
"epoch": 0.6497073928102234,
"grad_norm": 1.7734375,
"learning_rate": 1.0750080935092423e-07,
"logits/chosen": -2.1347737312316895,
"logits/rejected": -2.0533447265625,
"logps/chosen": -0.2823336720466614,
"logps/rejected": -0.2946282923221588,
"loss": 0.43657293915748596,
"loss/core": 0.41873565316200256,
"loss/preference_sft": 0.2823336720466614,
"loss/reference_anchor": 0.20959632098674774,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 2.1431565284729004,
"rewards/margins": 0.7881289720535278,
"rewards/rejected": 1.3550279140472412,
"step": 680
},
{
"drift/chosen_abs": 0.2882576882839203,
"drift/rejected_abs": 0.15576216578483582,
"epoch": 0.654484653051475,
"grad_norm": 4.375,
"learning_rate": 1.0305368692688174e-07,
"logits/chosen": -2.0634636878967285,
"logits/rejected": -2.049027919769287,
"logps/chosen": -0.25410422682762146,
"logps/rejected": -0.2750704884529114,
"loss": 1.0024207830429077,
"loss/core": 0.9643166661262512,
"loss/preference_sft": 0.25410422682762146,
"loss/reference_anchor": 0.4826439917087555,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 2.8811697959899902,
"rewards/margins": 1.326778769493103,
"rewards/rejected": 1.5543910264968872,
"step": 685
},
{
"drift/chosen_abs": 0.17661243677139282,
"drift/rejected_abs": 0.1041385754942894,
"epoch": 0.6592619132927267,
"grad_norm": 3.359375,
"learning_rate": 9.867650298927643e-08,
"logits/chosen": -1.8653026819229126,
"logits/rejected": -1.8865511417388916,
"logps/chosen": -0.3086770176887512,
"logps/rejected": -0.3341335952281952,
"loss": 0.19030842185020447,
"loss/core": 0.18117818236351013,
"loss/preference_sft": 0.3086770176887512,
"loss/reference_anchor": 0.0908689871430397,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 1.7632665634155273,
"rewards/margins": 0.7324223518371582,
"rewards/rejected": 1.0308443307876587,
"step": 690
},
{
"drift/chosen_abs": 0.19695012271404266,
"drift/rejected_abs": 0.06876302510499954,
"epoch": 0.6640391735339782,
"grad_norm": 10.125,
"learning_rate": 9.437134084059515e-08,
"logits/chosen": -2.2494120597839355,
"logits/rejected": -2.259532928466797,
"logps/chosen": -0.3065325617790222,
"logps/rejected": -0.29353365302085876,
"loss": 0.39579930901527405,
"loss/core": 0.3792479932308197,
"loss/preference_sft": 0.3065325617790222,
"loss/reference_anchor": 0.19003014266490936,
"rewards/accuracies": 0.875,
"rewards/chosen": 1.9680402278900146,
"rewards/margins": 1.29190993309021,
"rewards/rejected": 0.6761302947998047,
"step": 695
},
{
"drift/chosen_abs": 0.2228858470916748,
"drift/rejected_abs": 0.15424631536006927,
"epoch": 0.6688164337752299,
"grad_norm": 470.0,
"learning_rate": 9.014024950485383e-08,
"logits/chosen": -2.0826706886291504,
"logits/rejected": -2.187513828277588,
"logps/chosen": -0.2971203923225403,
"logps/rejected": -0.3260975480079651,
"loss": 0.5006673336029053,
"loss/core": 0.48041480779647827,
"loss/preference_sft": 0.2971203923225403,
"loss/reference_anchor": 0.24032163619995117,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 2.227379083633423,
"rewards/margins": 0.7068957090377808,
"rewards/rejected": 1.5204832553863525,
"step": 700
},
{
"drift/chosen_abs": 0.33960968255996704,
"drift/rejected_abs": 0.15266656875610352,
"epoch": 0.6735936940164815,
"grad_norm": 95.0,
"learning_rate": 8.598524275237321e-08,
"logits/chosen": -2.175156593322754,
"logits/rejected": -2.1317992210388184,
"logps/chosen": -0.28126639127731323,
"logps/rejected": -0.2680434584617615,
"loss": 0.8337176442146301,
"loss/core": 0.8014980554580688,
"loss/preference_sft": 0.28126639127731323,
"loss/reference_anchor": 0.4014674723148346,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 3.3955001831054688,
"rewards/margins": 1.8699357509613037,
"rewards/rejected": 1.525564432144165,
"step": 705
},
{
"drift/chosen_abs": 0.3576631546020508,
"drift/rejected_abs": 0.18644385039806366,
"epoch": 0.6783709542577332,
"grad_norm": 440.0,
"learning_rate": 8.190829814133293e-08,
"logits/chosen": -1.863407850265503,
"logits/rejected": -1.8509485721588135,
"logps/chosen": -0.27954185009002686,
"logps/rejected": -0.3012255132198334,
"loss": 1.3718466758728027,
"loss/core": 1.320197582244873,
"loss/preference_sft": 0.27954185009002686,
"loss/reference_anchor": 0.6606996655464172,
"rewards/accuracies": 0.8500000238418579,
"rewards/chosen": 3.5734474658966064,
"rewards/margins": 1.7104486227035522,
"rewards/rejected": 1.8629987239837646,
"step": 710
},
{
"drift/chosen_abs": 0.18702775239944458,
"drift/rejected_abs": 0.08271317183971405,
"epoch": 0.6831482144989849,
"grad_norm": 3.921875,
"learning_rate": 7.791135607656146e-08,
"logits/chosen": -2.228705644607544,
"logits/rejected": -2.209040403366089,
"logps/chosen": -0.2836971879005432,
"logps/rejected": -0.3425886332988739,
"loss": 0.5329797267913818,
"loss/core": 0.5116499066352844,
"loss/preference_sft": 0.2836971879005432,
"loss/reference_anchor": 0.25602635741233826,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 1.8697589635849,
"rewards/margins": 1.2295645475387573,
"rewards/rejected": 0.6401944160461426,
"step": 715
},
{
"drift/chosen_abs": 0.20850583910942078,
"drift/rejected_abs": 0.1485956758260727,
"epoch": 0.6879254747402365,
"grad_norm": 24.875,
"learning_rate": 7.399631888600796e-08,
"logits/chosen": -1.9758691787719727,
"logits/rejected": -1.9829914569854736,
"logps/chosen": -0.29822248220443726,
"logps/rejected": -0.30190637707710266,
"loss": 0.5085002183914185,
"loss/core": 0.487942636013031,
"loss/preference_sft": 0.29822248220443726,
"loss/reference_anchor": 0.24427810311317444,
"rewards/accuracies": 0.8374999761581421,
"rewards/chosen": 2.083251953125,
"rewards/margins": 0.5999056100845337,
"rewards/rejected": 1.4833463430404663,
"step": 720
},
{
"drift/chosen_abs": 0.15803976356983185,
"drift/rejected_abs": 0.07249420881271362,
"epoch": 0.6927027349814882,
"grad_norm": 4.03125,
"learning_rate": 7.016504991533726e-08,
"logits/chosen": -2.101017475128174,
"logits/rejected": -2.215353488922119,
"logps/chosen": -0.28623729944229126,
"logps/rejected": -0.2781991958618164,
"loss": 0.18330907821655273,
"loss/core": 0.17459434270858765,
"loss/preference_sft": 0.28623729944229126,
"loss/reference_anchor": 0.08757317811250687,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 1.5793583393096924,
"rewards/margins": 0.8571645021438599,
"rewards/rejected": 0.7221937775611877,
"step": 725
},
{
"drift/chosen_abs": 0.10135958343744278,
"drift/rejected_abs": 0.08568556606769562,
"epoch": 0.6974799952227397,
"grad_norm": 422.0,
"learning_rate": 6.641937264107867e-08,
"logits/chosen": -2.1984219551086426,
"logits/rejected": -2.248124599456787,
"logps/chosen": -0.287166953086853,
"logps/rejected": -0.2960854470729828,
"loss": 0.1953887790441513,
"loss/core": 0.18624430894851685,
"loss/preference_sft": 0.287166953086853,
"loss/reference_anchor": 0.09321005642414093,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 1.012143850326538,
"rewards/margins": 0.15792995691299438,
"rewards/rejected": 0.8542140126228333,
"step": 730
},
{
"drift/chosen_abs": 0.14169880747795105,
"drift/rejected_abs": 0.06580595672130585,
"epoch": 0.7022572554639914,
"grad_norm": 57.5,
"learning_rate": 6.276106980274944e-08,
"logits/chosen": -2.031146764755249,
"logits/rejected": -2.07769513130188,
"logps/chosen": -0.3201434314250946,
"logps/rejected": -0.3183977007865906,
"loss": 0.15187807381153107,
"loss/core": 0.14405521750450134,
"loss/preference_sft": 0.3201434314250946,
"loss/reference_anchor": 0.07229013741016388,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": 1.4163552522659302,
"rewards/margins": 0.759195864200592,
"rewards/rejected": 0.6571593880653381,
"step": 735
},
{
"drift/chosen_abs": 0.25509342551231384,
"drift/rejected_abs": 0.1779322326183319,
"epoch": 0.707034515705243,
"grad_norm": 5.75,
"learning_rate": 5.919188255436777e-08,
"logits/chosen": -2.076237440109253,
"logits/rejected": -2.094517230987549,
"logps/chosen": -0.31439438462257385,
"logps/rejected": -0.3211822211742401,
"loss": 1.5399339199066162,
"loss/core": 1.4819676876068115,
"loss/preference_sft": 0.31439438462257385,
"loss/reference_anchor": 0.7414413094520569,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 2.5507071018218994,
"rewards/margins": 0.7717518210411072,
"rewards/rejected": 1.7789552211761475,
"step": 740
},
{
"drift/chosen_abs": 0.31124961376190186,
"drift/rejected_abs": 0.15094509720802307,
"epoch": 0.7118117759464947,
"grad_norm": 402.0,
"learning_rate": 5.571350963575727e-08,
"logits/chosen": -2.030458450317383,
"logits/rejected": -2.0747735500335693,
"logps/chosen": -0.2915259897708893,
"logps/rejected": -0.2831938862800598,
"loss": 0.6287981271743774,
"loss/core": 0.6039372682571411,
"loss/preference_sft": 0.2915259897708893,
"loss/reference_anchor": 0.30232542753219604,
"rewards/accuracies": 0.875,
"rewards/chosen": 3.110504150390625,
"rewards/margins": 1.6071808338165283,
"rewards/rejected": 1.5033233165740967,
"step": 745
},
{
"drift/chosen_abs": 0.11992615461349487,
"drift/rejected_abs": 0.12524381279945374,
"epoch": 0.7165890361877463,
"grad_norm": 274.0,
"learning_rate": 5.232760656403923e-08,
"logits/chosen": -2.166827917098999,
"logits/rejected": -2.1589953899383545,
"logps/chosen": -0.3125108480453491,
"logps/rejected": -0.304274320602417,
"loss": 0.5836885571479797,
"loss/core": 0.5603240728378296,
"loss/preference_sft": 0.3125108480453491,
"loss/reference_anchor": 0.2802754044532776,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 1.197912335395813,
"rewards/margins": -0.051997799426317215,
"rewards/rejected": 1.2499101161956787,
"step": 750
},
{
"drift/chosen_abs": 0.23778387904167175,
"drift/rejected_abs": 0.16927723586559296,
"epoch": 0.721366296428998,
"grad_norm": 18.75,
"learning_rate": 4.9035784845695675e-08,
"logits/chosen": -1.9069569110870361,
"logits/rejected": -1.817491888999939,
"logps/chosen": -0.30986255407333374,
"logps/rejected": -0.29673609137535095,
"loss": 0.40122777223587036,
"loss/core": 0.3844679892063141,
"loss/preference_sft": 0.30986255407333374,
"loss/reference_anchor": 0.19247810542583466,
"rewards/accuracies": 0.824999988079071,
"rewards/chosen": 2.373359203338623,
"rewards/margins": 0.687952995300293,
"rewards/rejected": 1.6854064464569092,
"step": 755
},
{
"drift/chosen_abs": 0.19871307909488678,
"drift/rejected_abs": 0.08636997640132904,
"epoch": 0.7261435566702497,
"grad_norm": 22.0,
"learning_rate": 4.583961120958027e-08,
"logits/chosen": -2.157874345779419,
"logits/rejected": -2.1768975257873535,
"logps/chosen": -0.3034326434135437,
"logps/rejected": -0.2945040166378021,
"loss": 0.28818535804748535,
"loss/core": 0.27553677558898926,
"loss/preference_sft": 0.3034326434135437,
"loss/reference_anchor": 0.13830482959747314,
"rewards/accuracies": 0.875,
"rewards/chosen": 1.9834944009780884,
"rewards/margins": 1.1288237571716309,
"rewards/rejected": 0.8546707034111023,
"step": 760
},
{
"drift/chosen_abs": 0.17785514891147614,
"drift/rejected_abs": 0.10489670932292938,
"epoch": 0.7309208169115012,
"grad_norm": 44.75,
"learning_rate": 4.2740606861239594e-08,
"logits/chosen": -2.0543203353881836,
"logits/rejected": -2.1251354217529297,
"logps/chosen": -0.2776801586151123,
"logps/rejected": -0.2736127972602844,
"loss": 0.24507012963294983,
"loss/core": 0.2341887503862381,
"loss/preference_sft": 0.2776801586151123,
"loss/reference_anchor": 0.11731725931167603,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 1.7780964374542236,
"rewards/margins": 0.7318509817123413,
"rewards/rejected": 1.0462454557418823,
"step": 765
},
{
"drift/chosen_abs": 0.3685626983642578,
"drift/rejected_abs": 0.23492638766765594,
"epoch": 0.7356980771527529,
"grad_norm": 52.25,
"learning_rate": 3.974024675890189e-08,
"logits/chosen": -1.9574251174926758,
"logits/rejected": -1.9248749017715454,
"logps/chosen": -0.3148086667060852,
"logps/rejected": -0.28525421023368835,
"loss": 2.2472522258758545,
"loss/core": 2.1636857986450195,
"loss/preference_sft": 0.3148086667060852,
"loss/reference_anchor": 1.0827428102493286,
"rewards/accuracies": 0.8125,
"rewards/chosen": 3.68304181098938,
"rewards/margins": 1.3362334966659546,
"rewards/rejected": 2.346808433532715,
"step": 770
},
{
"drift/chosen_abs": 0.15117646753787994,
"drift/rejected_abs": 0.09319499135017395,
"epoch": 0.7404753373940045,
"grad_norm": 2.078125,
"learning_rate": 3.683995891147695e-08,
"logits/chosen": -2.073338031768799,
"logits/rejected": -2.103886127471924,
"logps/chosen": -0.30775031447410583,
"logps/rejected": -0.3014872670173645,
"loss": 0.1496042162179947,
"loss/core": 0.14195644855499268,
"loss/preference_sft": 0.30775031447410583,
"loss/reference_anchor": 0.07119497656822205,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 1.5114030838012695,
"rewards/margins": 0.5813368558883667,
"rewards/rejected": 0.9300659894943237,
"step": 775
},
{
"drift/chosen_abs": 0.18838293850421906,
"drift/rejected_abs": 0.12301009893417358,
"epoch": 0.7452525976352562,
"grad_norm": 19.75,
"learning_rate": 3.404112369890108e-08,
"logits/chosen": -2.15893816947937,
"logits/rejected": -2.1729979515075684,
"logps/chosen": -0.30296415090560913,
"logps/rejected": -0.307880163192749,
"loss": 0.23419561982154846,
"loss/core": 0.2235209047794342,
"loss/preference_sft": 0.30296415090560913,
"loss/reference_anchor": 0.11203303188085556,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 1.8827606439590454,
"rewards/margins": 0.6561026573181152,
"rewards/rejected": 1.2266579866409302,
"step": 780
},
{
"drift/chosen_abs": 0.34316182136535645,
"drift/rejected_abs": 0.13256040215492249,
"epoch": 0.7500298578765078,
"grad_norm": 1.765625,
"learning_rate": 3.134507321515106e-08,
"logits/chosen": -1.9713062047958374,
"logits/rejected": -1.9291038513183594,
"logps/chosen": -0.31109505891799927,
"logps/rejected": -0.2964383065700531,
"loss": 1.2833325862884521,
"loss/core": 1.2346382141113281,
"loss/preference_sft": 0.31109505891799927,
"loss/reference_anchor": 0.6181516647338867,
"rewards/accuracies": 0.8374999761581421,
"rewards/chosen": 3.4299960136413574,
"rewards/margins": 2.1115283966064453,
"rewards/rejected": 1.318467617034912,
"step": 785
},
{
"drift/chosen_abs": 0.2622746527194977,
"drift/rejected_abs": 0.18666431307792664,
"epoch": 0.7548071181177595,
"grad_norm": 576.0,
"learning_rate": 2.875309063423956e-08,
"logits/chosen": -2.1486878395080566,
"logits/rejected": -1.9767792224884033,
"logps/chosen": -0.28585386276245117,
"logps/rejected": -0.3247356414794922,
"loss": 1.1903468370437622,
"loss/core": 1.1452568769454956,
"loss/preference_sft": 0.28585386276245117,
"loss/reference_anchor": 0.5726125240325928,
"rewards/accuracies": 0.875,
"rewards/chosen": 2.621675968170166,
"rewards/margins": 0.7564936876296997,
"rewards/rejected": 1.8651822805404663,
"step": 790
},
{
"drift/chosen_abs": 0.2373015433549881,
"drift/rejected_abs": 0.11792800575494766,
"epoch": 0.7595843783590112,
"grad_norm": 25.0,
"learning_rate": 2.626640959949375e-08,
"logits/chosen": -1.9540714025497437,
"logits/rejected": -1.9722576141357422,
"logps/chosen": -0.30823540687561035,
"logps/rejected": -0.2971736788749695,
"loss": 1.095926284790039,
"loss/core": 1.0540673732757568,
"loss/preference_sft": 0.30823540687561035,
"loss/reference_anchor": 0.5272958278656006,
"rewards/accuracies": 0.9375,
"rewards/chosen": 2.3723232746124268,
"rewards/margins": 1.1968507766723633,
"rewards/rejected": 1.175472378730774,
"step": 795
},
{
"drift/chosen_abs": 0.22911421954631805,
"drift/rejected_abs": 0.11774910986423492,
"epoch": 0.7643616386002627,
"grad_norm": 4.5,
"learning_rate": 2.388621363640797e-08,
"logits/chosen": -2.1360487937927246,
"logits/rejected": -2.111950159072876,
"logps/chosen": -0.2900012731552124,
"logps/rejected": -0.287829726934433,
"loss": 0.3200365900993347,
"loss/core": 0.30634862184524536,
"loss/preference_sft": 0.2900012731552124,
"loss/reference_anchor": 0.15350642800331116,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 2.289325475692749,
"rewards/margins": 1.1134859323501587,
"rewards/rejected": 1.1758396625518799,
"step": 800
},
{
"drift/chosen_abs": 0.22425393760204315,
"drift/rejected_abs": 0.19786129891872406,
"epoch": 0.7691388988415144,
"grad_norm": 9.3125,
"learning_rate": 2.1613635589349756e-08,
"logits/chosen": -2.0049588680267334,
"logits/rejected": -1.9930200576782227,
"logps/chosen": -0.27656620740890503,
"logps/rejected": -0.271397203207016,
"loss": 0.5283772349357605,
"loss/core": 0.5072607398033142,
"loss/preference_sft": 0.27656620740890503,
"loss/reference_anchor": 0.25389814376831055,
"rewards/accuracies": 0.800000011920929,
"rewards/chosen": 2.2400403022766113,
"rewards/margins": 0.2621103823184967,
"rewards/rejected": 1.9779300689697266,
"step": 805
},
{
"drift/chosen_abs": 0.1524631530046463,
"drift/rejected_abs": 0.14172717928886414,
"epoch": 0.773916159082766,
"grad_norm": 25.5,
"learning_rate": 1.944975708238708e-08,
"logits/chosen": -2.2034547328948975,
"logits/rejected": -2.108600616455078,
"logps/chosen": -0.30901938676834106,
"logps/rejected": -0.32294124364852905,
"loss": 0.2564198076725006,
"loss/core": 0.2449137419462204,
"loss/preference_sft": 0.30901938676834106,
"loss/reference_anchor": 0.12251242250204086,
"rewards/accuracies": 0.875,
"rewards/chosen": 1.523074746131897,
"rewards/margins": 0.10768821090459824,
"rewards/rejected": 1.4153865575790405,
"step": 810
},
{
"drift/chosen_abs": 0.2113420069217682,
"drift/rejected_abs": 0.10915307700634003,
"epoch": 0.7786934193240177,
"grad_norm": 42.25,
"learning_rate": 1.7395608004493884e-08,
"logits/chosen": -2.0760385990142822,
"logits/rejected": -2.164649486541748,
"logps/chosen": -0.28481438755989075,
"logps/rejected": -0.28481075167655945,
"loss": 0.25434860587120056,
"loss/core": 0.24307891726493835,
"loss/preference_sft": 0.28481438755989075,
"loss/reference_anchor": 0.12178117036819458,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 2.1131508350372314,
"rewards/margins": 1.0244156122207642,
"rewards/rejected": 1.0887352228164673,
"step": 815
},
{
"drift/chosen_abs": 0.19611340761184692,
"drift/rejected_abs": 0.07267270982265472,
"epoch": 0.7834706795652693,
"grad_norm": 3.203125,
"learning_rate": 1.5452166019378987e-08,
"logits/chosen": -2.0779826641082764,
"logits/rejected": -2.111990213394165,
"logps/chosen": -0.28833597898483276,
"logps/rejected": -0.3186201751232147,
"loss": 0.25229331851005554,
"loss/core": 0.24105815589427948,
"loss/preference_sft": 0.28833597898483276,
"loss/reference_anchor": 0.12096866220235825,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 1.9596529006958008,
"rewards/margins": 1.2877837419509888,
"rewards/rejected": 0.6718690991401672,
"step": 820
},
{
"drift/chosen_abs": 0.24504788219928741,
"drift/rejected_abs": 0.12149325758218765,
"epoch": 0.788247939806521,
"grad_norm": 61.0,
"learning_rate": 1.3620356100170788e-08,
"logits/chosen": -2.120765209197998,
"logits/rejected": -2.2250657081604004,
"logps/chosen": -0.3034924864768982,
"logps/rejected": -0.2849355936050415,
"loss": 0.31910449266433716,
"loss/core": 0.3053540587425232,
"loss/preference_sft": 0.3034924864768982,
"loss/reference_anchor": 0.15299084782600403,
"rewards/accuracies": 0.9375,
"rewards/chosen": 2.4493212699890137,
"rewards/margins": 1.2364730834960938,
"rewards/rejected": 1.2128479480743408,
"step": 825
},
{
"drift/chosen_abs": 0.1710740029811859,
"drift/rejected_abs": 0.16245757043361664,
"epoch": 0.7930252000477725,
"grad_norm": 8.75,
"learning_rate": 1.190105008918041e-08,
"logits/chosen": -2.1558587551116943,
"logits/rejected": -2.1049137115478516,
"logps/chosen": -0.280143678188324,
"logps/rejected": -0.3109564781188965,
"loss": 0.34464460611343384,
"loss/core": 0.3301551938056946,
"loss/preference_sft": 0.280143678188324,
"loss/reference_anchor": 0.16517803072929382,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 1.7102434635162354,
"rewards/margins": 0.08717556297779083,
"rewards/rejected": 1.623067855834961,
"step": 830
},
{
"drift/chosen_abs": 0.23977330327033997,
"drift/rejected_abs": 0.11179669201374054,
"epoch": 0.7978024602890242,
"grad_norm": 160.0,
"learning_rate": 1.0295066282951737e-08,
"logits/chosen": -2.0725464820861816,
"logits/rejected": -2.0728602409362793,
"logps/chosen": -0.2556314766407013,
"logps/rejected": -0.3013136684894562,
"loss": 0.39849942922592163,
"loss/core": 0.38221579790115356,
"loss/preference_sft": 0.2556314766407013,
"loss/reference_anchor": 0.19155162572860718,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 2.395071268081665,
"rewards/margins": 1.566588282585144,
"rewards/rejected": 0.8284828066825867,
"step": 835
},
{
"drift/chosen_abs": 0.280472993850708,
"drift/rejected_abs": 0.10291789472103119,
"epoch": 0.8025797205302759,
"grad_norm": 2592.0,
"learning_rate": 8.803169042796765e-09,
"logits/chosen": -2.0131630897521973,
"logits/rejected": -2.0630502700805664,
"logps/chosen": -0.32252293825149536,
"logps/rejected": -0.30228742957115173,
"loss": 0.9987700581550598,
"loss/core": 0.9603092074394226,
"loss/preference_sft": 0.32252293825149536,
"loss/reference_anchor": 0.48055869340896606,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 2.8026461601257324,
"rewards/margins": 1.7743022441864014,
"rewards/rejected": 1.0283435583114624,
"step": 840
},
{
"drift/chosen_abs": 0.14095182716846466,
"drift/rejected_abs": 0.06469657272100449,
"epoch": 0.8073569807715275,
"grad_norm": 3.53125,
"learning_rate": 7.4260684310008815e-09,
"logits/chosen": -2.151334285736084,
"logits/rejected": -2.22589111328125,
"logps/chosen": -0.29466524720191956,
"logps/rejected": -0.3147200047969818,
"loss": 0.1673881560564041,
"loss/core": 0.15918193757534027,
"loss/preference_sft": 0.29466524720191956,
"loss/reference_anchor": 0.07995006442070007,
"rewards/accuracies": 0.9375,
"rewards/chosen": 1.4074944257736206,
"rewards/margins": 0.9872743487358093,
"rewards/rejected": 0.4202199876308441,
"step": 845
},
{
"drift/chosen_abs": 0.15515586733818054,
"drift/rejected_abs": 0.09092449396848679,
"epoch": 0.8121342410127792,
"grad_norm": 36.0,
"learning_rate": 6.164419872871835e-09,
"logits/chosen": -2.2680633068084717,
"logits/rejected": -2.3154819011688232,
"logps/chosen": -0.25293999910354614,
"logps/rejected": -0.24826927483081818,
"loss": 0.1021793931722641,
"loss/core": 0.09663856029510498,
"loss/preference_sft": 0.25293999910354614,
"loss/reference_anchor": 0.0485837496817112,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 1.5486667156219482,
"rewards/margins": 0.6556525826454163,
"rewards/rejected": 0.8930143117904663,
"step": 850
},
{
"drift/chosen_abs": 0.2674712538719177,
"drift/rejected_abs": 0.12466195970773697,
"epoch": 0.8169115012540308,
"grad_norm": 59.75,
"learning_rate": 5.018823844792602e-09,
"logits/chosen": -1.9834197759628296,
"logits/rejected": -2.0199997425079346,
"logps/chosen": -0.30243033170700073,
"logps/rejected": -0.29364144802093506,
"loss": 0.8800665736198425,
"loss/core": 0.8460347056388855,
"loss/preference_sft": 0.30243033170700073,
"loss/reference_anchor": 0.4235146939754486,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 2.672776937484741,
"rewards/margins": 1.4277340173721313,
"rewards/rejected": 1.2450430393218994,
"step": 855
},
{
"drift/chosen_abs": 0.4073793292045593,
"drift/rejected_abs": 0.19243915379047394,
"epoch": 0.8216887614952825,
"grad_norm": 2.71875,
"learning_rate": 3.989825588427281e-09,
"logits/chosen": -1.9286167621612549,
"logits/rejected": -2.017611026763916,
"logps/chosen": -0.3008403480052948,
"logps/rejected": -0.3007083833217621,
"loss": 1.669266939163208,
"loss/core": 1.606706976890564,
"loss/preference_sft": 0.3008403480052948,
"loss/reference_anchor": 0.8040491342544556,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 4.073380470275879,
"rewards/margins": 2.1619973182678223,
"rewards/rejected": 1.9113833904266357,
"step": 860
},
{
"drift/chosen_abs": 0.24328342080116272,
"drift/rejected_abs": 0.155743807554245,
"epoch": 0.826466021736534,
"grad_norm": 59.5,
"learning_rate": 3.077914851215585e-09,
"logits/chosen": -1.938284158706665,
"logits/rejected": -2.010418176651001,
"logps/chosen": -0.2928522229194641,
"logps/rejected": -0.29682302474975586,
"loss": 0.6092508435249329,
"loss/core": 0.5850942730903625,
"loss/preference_sft": 0.2928522229194641,
"loss/reference_anchor": 0.292802631855011,
"rewards/accuracies": 0.8500000238418579,
"rewards/chosen": 2.432499647140503,
"rewards/margins": 0.8761860132217407,
"rewards/rejected": 1.5563137531280518,
"step": 865
},
{
"drift/chosen_abs": 0.32113441824913025,
"drift/rejected_abs": 0.09325097501277924,
"epoch": 0.8312432819777857,
"grad_norm": 13.8125,
"learning_rate": 2.2835256532794387e-09,
"logits/chosen": -2.088789939880371,
"logits/rejected": -2.097416877746582,
"logps/chosen": -0.30860528349876404,
"logps/rejected": -0.2980922758579254,
"loss": 1.1249186992645264,
"loss/core": 1.0819661617279053,
"loss/preference_sft": 0.30860528349876404,
"loss/reference_anchor": 0.5418386459350586,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": 3.210113525390625,
"rewards/margins": 2.283482074737549,
"rewards/rejected": 0.9266314506530762,
"step": 870
},
{
"drift/chosen_abs": 0.1851302534341812,
"drift/rejected_abs": 0.101983942091465,
"epoch": 0.8360205422190374,
"grad_norm": 7.34375,
"learning_rate": 1.6070360808531359e-09,
"logits/chosen": -2.1583588123321533,
"logits/rejected": -2.2066867351531982,
"logps/chosen": -0.30905434489250183,
"logps/rejected": -0.3321419954299927,
"loss": 0.7497228980064392,
"loss/core": 0.7203631401062012,
"loss/preference_sft": 0.30905434489250183,
"loss/reference_anchor": 0.36055710911750793,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 1.8509142398834229,
"rewards/margins": 0.8404647707939148,
"rewards/rejected": 1.0104494094848633,
"step": 875
},
{
"drift/chosen_abs": 0.24564549326896667,
"drift/rejected_abs": 0.18484672904014587,
"epoch": 0.840797802460289,
"grad_norm": 56.5,
"learning_rate": 1.0487681063345854e-09,
"logits/chosen": -2.097510814666748,
"logits/rejected": -2.0806679725646973,
"logps/chosen": -0.2908017039299011,
"logps/rejected": -0.3314078450202942,
"loss": 0.9822714924812317,
"loss/core": 0.9446454048156738,
"loss/preference_sft": 0.2908017039299011,
"loss/reference_anchor": 0.4726010262966156,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 2.4564552307128906,
"rewards/margins": 0.6901001930236816,
"rewards/rejected": 1.7663547992706299,
"step": 880
},
{
"drift/chosen_abs": 0.2716746926307678,
"drift/rejected_abs": 0.11291627585887909,
"epoch": 0.8455750627015407,
"grad_norm": 24.875,
"learning_rate": 6.089874350439505e-10,
"logits/chosen": -2.0179717540740967,
"logits/rejected": -2.096179485321045,
"logps/chosen": -0.2834438979625702,
"logps/rejected": -0.27716511487960815,
"loss": 0.4409695565700531,
"loss/core": 0.42294350266456604,
"loss/preference_sft": 0.2834438979625702,
"loss/reference_anchor": 0.21200327575206757,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": 2.7161340713500977,
"rewards/margins": 1.5943241119384766,
"rewards/rejected": 1.1218100786209106,
"step": 885
},
{
"drift/chosen_abs": 0.2433289736509323,
"drift/rejected_abs": 0.14475123584270477,
"epoch": 0.8503523229427923,
"grad_norm": 342.0,
"learning_rate": 2.8790337876233305e-10,
"logits/chosen": -1.9500147104263306,
"logits/rejected": -2.0721776485443115,
"logps/chosen": -0.30229297280311584,
"logps/rejected": -0.2738516330718994,
"loss": 0.661720335483551,
"loss/core": 0.6356015205383301,
"loss/preference_sft": 0.30229297280311584,
"loss/reference_anchor": 0.3180215358734131,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 2.4331092834472656,
"rewards/margins": 0.9898265600204468,
"rewards/rejected": 1.443282961845398,
"step": 890
},
{
"drift/chosen_abs": 0.22940556704998016,
"drift/rejected_abs": 0.1513952761888504,
"epoch": 0.855129583184044,
"grad_norm": 50.75,
"learning_rate": 8.566875611068503e-11,
"logits/chosen": -2.022388458251953,
"logits/rejected": -2.0541129112243652,
"logps/chosen": -0.27332523465156555,
"logps/rejected": -0.29117733240127563,
"loss": 0.33594077825546265,
"loss/core": 0.3218122124671936,
"loss/preference_sft": 0.27332523465156555,
"loss/reference_anchor": 0.1610485315322876,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 2.292048454284668,
"rewards/margins": 0.7850906252861023,
"rewards/rejected": 1.506957769393921,
"step": 895
},
{
"drift/chosen_abs": 0.3108707070350647,
"drift/rejected_abs": 0.08576279878616333,
"epoch": 0.8599068434252956,
"grad_norm": 18.5,
"learning_rate": 2.3798198163782478e-12,
"logits/chosen": -2.0334689617156982,
"logits/rejected": -2.154085636138916,
"logps/chosen": -0.26980048418045044,
"logps/rejected": -0.26923516392707825,
"loss": 1.0657157897949219,
"loss/core": 1.0252106189727783,
"loss/preference_sft": 0.26980048418045044,
"loss/reference_anchor": 0.5130892395973206,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": 3.1086440086364746,
"rewards/margins": 2.26877498626709,
"rewards/rejected": 0.8398691415786743,
"step": 900
},
{
"epoch": 0.8599068434252956,
"step": 900,
"total_flos": 0.0,
"train_loss": 0.7444233691361215,
"train_runtime": 7251.7494,
"train_samples_per_second": 1.986,
"train_steps_per_second": 0.124
}
],
"logging_steps": 5,
"max_steps": 900,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 900,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}