{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.8599068434252956, "eval_steps": 500, "global_step": 900, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "drift/chosen_abs": 0.3420991003513336, "drift/rejected_abs": 0.1417631208896637, "epoch": 0.004777260241251642, "grad_norm": 374.0, "learning_rate": 1.111111111111111e-08, "logits/chosen": -2.2763760089874268, "logits/rejected": -2.2397658824920654, "logps/chosen": -0.3073771595954895, "logps/rejected": -0.3057326674461365, "loss": 2.170994281768799, "loss/core": 2.1488795280456543, "loss/preference_sft": 0.3073771595954895, "loss/reference_anchor": 1.075006365776062, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 3.418382167816162, "rewards/margins": 2.0053153038024902, "rewards/rejected": 1.4130665063858032, "step": 5 }, { "drift/chosen_abs": 0.29207316040992737, "drift/rejected_abs": 0.1325351893901825, "epoch": 0.009554520482503284, "grad_norm": 11.125, "learning_rate": 2.5e-08, "logits/chosen": -2.2057507038116455, "logits/rejected": -2.197091579437256, "logps/chosen": -0.2905746102333069, "logps/rejected": -0.28117018938064575, "loss": 0.5789883136749268, "loss/core": 0.5726724863052368, "loss/preference_sft": 0.2905746102333069, "loss/reference_anchor": 0.2867390513420105, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 2.920731782913208, "rewards/margins": 1.5960335731506348, "rewards/rejected": 1.3246982097625732, "step": 10 }, { "drift/chosen_abs": 0.1926683634519577, "drift/rejected_abs": 0.08847218751907349, "epoch": 0.014331780723754926, "grad_norm": 2.265625, "learning_rate": 3.888888888888889e-08, "logits/chosen": -1.8458455801010132, "logits/rejected": -1.9005146026611328, "logps/chosen": -0.2896016538143158, "logps/rejected": -0.28710517287254333, "loss": 0.23165909945964813, "loss/core": 0.22878754138946533, "loss/preference_sft": 0.2896016538143158, "loss/reference_anchor": 0.11461815983057022, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 1.9264246225357056, "rewards/margins": 1.057593584060669, "rewards/rejected": 0.8688309788703918, "step": 15 }, { "drift/chosen_abs": 0.1641753613948822, "drift/rejected_abs": 0.05660538747906685, "epoch": 0.01910904096500657, "grad_norm": 4.96875, "learning_rate": 5.2777777777777776e-08, "logits/chosen": -2.1686434745788574, "logits/rejected": -2.0960006713867188, "logps/chosen": -0.2862441837787628, "logps/rejected": -0.28391966223716736, "loss": 0.15841466188430786, "loss/core": 0.15627533197402954, "loss/preference_sft": 0.2862441837787628, "loss/reference_anchor": 0.07834186404943466, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 1.6407321691513062, "rewards/margins": 1.0884038209915161, "rewards/rejected": 0.5523284077644348, "step": 20 }, { "drift/chosen_abs": 0.18150915205478668, "drift/rejected_abs": 0.11916539818048477, "epoch": 0.02388630120625821, "grad_norm": 73.0, "learning_rate": 6.666666666666667e-08, "logits/chosen": -2.2032320499420166, "logits/rejected": -2.2200589179992676, "logps/chosen": -0.2700212597846985, "logps/rejected": -0.2805071473121643, "loss": 0.263420045375824, "loss/core": 0.2602730393409729, "loss/preference_sft": 0.2700212597846985, "loss/reference_anchor": 0.13034658133983612, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 1.8135448694229126, "rewards/margins": 0.6393396258354187, "rewards/rejected": 1.1742051839828491, "step": 25 }, { "drift/chosen_abs": 0.2730526924133301, "drift/rejected_abs": 0.1805466115474701, "epoch": 0.028663561447509853, "grad_norm": 156.0, "learning_rate": 8.055555555555555e-08, "logits/chosen": -2.1016995906829834, "logits/rejected": -2.0634474754333496, "logps/chosen": -0.31322628259658813, "logps/rejected": -0.27209383249282837, "loss": 1.1556752920150757, "loss/core": 1.1436045169830322, "loss/preference_sft": 0.31322628259658813, "loss/reference_anchor": 0.5722212791442871, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 2.7279961109161377, "rewards/margins": 0.923298180103302, "rewards/rejected": 1.8046979904174805, "step": 30 }, { "drift/chosen_abs": 0.18750497698783875, "drift/rejected_abs": 0.07988496869802475, "epoch": 0.033440821688761495, "grad_norm": 3.453125, "learning_rate": 9.444444444444444e-08, "logits/chosen": -2.1232945919036865, "logits/rejected": -2.225569248199463, "logps/chosen": -0.2830365300178528, "logps/rejected": -0.26490843296051025, "loss": 0.17748409509658813, "loss/core": 0.17516210675239563, "loss/preference_sft": 0.2830365300178528, "loss/reference_anchor": 0.08779536187648773, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 1.8736076354980469, "rewards/margins": 1.09036123752594, "rewards/rejected": 0.7832463979721069, "step": 35 }, { "drift/chosen_abs": 0.23411647975444794, "drift/rejected_abs": 0.09753605723381042, "epoch": 0.03821808193001314, "grad_norm": 13.5, "learning_rate": 1.0833333333333334e-07, "logits/chosen": -2.1147046089172363, "logits/rejected": -2.191413164138794, "logps/chosen": -0.29881948232650757, "logps/rejected": -0.3003283143043518, "loss": 0.31825491786003113, "loss/core": 0.3145065903663635, "loss/preference_sft": 0.29881948232650757, "loss/reference_anchor": 0.1575334519147873, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 2.3403539657592773, "rewards/margins": 1.3710139989852905, "rewards/rejected": 0.9693400263786316, "step": 40 }, { "drift/chosen_abs": 0.28226155042648315, "drift/rejected_abs": 0.18430650234222412, "epoch": 0.04299534217126478, "grad_norm": 69.5, "learning_rate": 1.2222222222222222e-07, "logits/chosen": -2.0363850593566895, "logits/rejected": -2.076094150543213, "logps/chosen": -0.28957605361938477, "logps/rejected": -0.2919236719608307, "loss": 1.3649934530258179, "loss/core": 1.3508943319320679, "loss/preference_sft": 0.28957605361938477, "loss/reference_anchor": 0.6759929060935974, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 2.8192150592803955, "rewards/margins": 0.9820273518562317, "rewards/rejected": 1.8371880054473877, "step": 45 }, { "drift/chosen_abs": 0.1817009598016739, "drift/rejected_abs": 0.1377423107624054, "epoch": 0.04777260241251642, "grad_norm": 0.984375, "learning_rate": 1.3611111111111108e-07, "logits/chosen": -2.1037697792053223, "logits/rejected": -2.192720890045166, "logps/chosen": -0.2859702706336975, "logps/rejected": -0.2898501455783844, "loss": 0.35004186630249023, "loss/core": 0.34600991010665894, "loss/preference_sft": 0.2859702706336975, "loss/reference_anchor": 0.17300085723400116, "rewards/accuracies": 0.949999988079071, "rewards/chosen": 1.816737413406372, "rewards/margins": 0.44307082891464233, "rewards/rejected": 1.3736662864685059, "step": 50 }, { "drift/chosen_abs": 0.1675940454006195, "drift/rejected_abs": 0.0922044888138771, "epoch": 0.05254986265376806, "grad_norm": 3.890625, "learning_rate": 1.5e-07, "logits/chosen": -2.1252381801605225, "logits/rejected": -2.2449936866760254, "logps/chosen": -0.2968815565109253, "logps/rejected": -0.293079674243927, "loss": 0.11641957610845566, "loss/core": 0.11467579752206802, "loss/preference_sft": 0.2968815565109253, "loss/reference_anchor": 0.05750115588307381, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 1.6759402751922607, "rewards/margins": 0.7550500631332397, "rewards/rejected": 0.9208904504776001, "step": 55 }, { "drift/chosen_abs": 0.14563629031181335, "drift/rejected_abs": 0.1081518679857254, "epoch": 0.057327122895019705, "grad_norm": 62.25, "learning_rate": 1.6388888888888888e-07, "logits/chosen": -2.1089062690734863, "logits/rejected": -2.1458160877227783, "logps/chosen": -0.29047664999961853, "logps/rejected": -0.2865060865879059, "loss": 0.29185742139816284, "loss/core": 0.2883908748626709, "loss/preference_sft": 0.29047664999961853, "loss/reference_anchor": 0.14428026974201202, "rewards/accuracies": 0.875, "rewards/chosen": 1.4559776782989502, "rewards/margins": 0.3751867413520813, "rewards/rejected": 1.0807908773422241, "step": 60 }, { "drift/chosen_abs": 0.2445906698703766, "drift/rejected_abs": 0.09041162580251694, "epoch": 0.06210438313627135, "grad_norm": 154.0, "learning_rate": 1.7777777777777776e-07, "logits/chosen": -2.1424062252044678, "logits/rejected": -2.2173452377319336, "logps/chosen": -0.3165227174758911, "logps/rejected": -0.310057133436203, "loss": 0.7591328620910645, "loss/core": 0.7509864568710327, "loss/preference_sft": 0.3165227174758911, "loss/reference_anchor": 0.37566640973091125, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 2.4453353881835938, "rewards/margins": 1.5434644222259521, "rewards/rejected": 0.901870846748352, "step": 65 }, { "drift/chosen_abs": 0.23211221396923065, "drift/rejected_abs": 0.10898170620203018, "epoch": 0.06688164337752299, "grad_norm": 21.5, "learning_rate": 1.9166666666666668e-07, "logits/chosen": -2.1081697940826416, "logits/rejected": -2.1647961139678955, "logps/chosen": -0.3016880452632904, "logps/rejected": -0.3038561940193176, "loss": 0.4961710572242737, "loss/core": 0.4906535744667053, "loss/preference_sft": 0.3016880452632904, "loss/reference_anchor": 0.24570658802986145, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 2.32112193107605, "rewards/margins": 1.3848812580108643, "rewards/rejected": 0.9362408518791199, "step": 70 }, { "drift/chosen_abs": 0.15495255589485168, "drift/rejected_abs": 0.10253290832042694, "epoch": 0.07165890361877464, "grad_norm": 3.71875, "learning_rate": 2.0555555555555553e-07, "logits/chosen": -2.0683295726776123, "logits/rejected": -2.1414763927459717, "logps/chosen": -0.28989818692207336, "logps/rejected": -0.29636505246162415, "loss": 0.21972903609275818, "loss/core": 0.21697552502155304, "loss/preference_sft": 0.28989818692207336, "loss/reference_anchor": 0.10868575423955917, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 1.5473926067352295, "rewards/margins": 0.5245345830917358, "rewards/rejected": 1.0228580236434937, "step": 75 }, { "drift/chosen_abs": 0.12912170588970184, "drift/rejected_abs": 0.07073847949504852, "epoch": 0.07643616386002627, "grad_norm": 3.546875, "learning_rate": 2.1944444444444442e-07, "logits/chosen": -2.271545648574829, "logits/rejected": -2.3474278450012207, "logps/chosen": -0.30917978286743164, "logps/rejected": -0.30712777376174927, "loss": 0.09423994272947311, "loss/core": 0.09269268810749054, "loss/preference_sft": 0.30917978286743164, "loss/reference_anchor": 0.046444639563560486, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 1.2905423641204834, "rewards/margins": 0.5846601724624634, "rewards/rejected": 0.7058821320533752, "step": 80 }, { "drift/chosen_abs": 0.2436620444059372, "drift/rejected_abs": 0.1702345758676529, "epoch": 0.08121342410127792, "grad_norm": 1.859375, "learning_rate": 2.3333333333333333e-07, "logits/chosen": -2.1165645122528076, "logits/rejected": -2.1273322105407715, "logps/chosen": -0.2930624485015869, "logps/rejected": -0.28557881712913513, "loss": 0.9216262698173523, "loss/core": 0.9119135141372681, "loss/preference_sft": 0.2930624485015869, "loss/reference_anchor": 0.45633044838905334, "rewards/accuracies": 0.824999988079071, "rewards/chosen": 2.4357974529266357, "rewards/margins": 0.7339332103729248, "rewards/rejected": 1.7018646001815796, "step": 85 }, { "drift/chosen_abs": 0.2897084355354309, "drift/rejected_abs": 0.06650175154209137, "epoch": 0.08599068434252956, "grad_norm": 21.375, "learning_rate": 2.4722222222222224e-07, "logits/chosen": -2.0020716190338135, "logits/rejected": -2.18646502494812, "logps/chosen": -0.30623993277549744, "logps/rejected": -0.3014351725578308, "loss": 0.6364718675613403, "loss/core": 0.6295538544654846, "loss/preference_sft": 0.30623993277549744, "loss/reference_anchor": 0.3152781128883362, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 2.8956007957458496, "rewards/margins": 2.232067584991455, "rewards/rejected": 0.6635335087776184, "step": 90 }, { "drift/chosen_abs": 0.21713528037071228, "drift/rejected_abs": 0.13760428130626678, "epoch": 0.09076794458378121, "grad_norm": 113.5, "learning_rate": 2.4998495746616845e-07, "logits/chosen": -2.0369200706481934, "logits/rejected": -1.9513944387435913, "logps/chosen": -0.2811819612979889, "logps/rejected": -0.30305975675582886, "loss": 0.6681066751480103, "loss/core": 0.6609320640563965, "loss/preference_sft": 0.2811819612979889, "loss/reference_anchor": 0.33061572909355164, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": 2.170912981033325, "rewards/margins": 0.7965704798698425, "rewards/rejected": 1.3743422031402588, "step": 95 }, { "drift/chosen_abs": 0.2975863218307495, "drift/rejected_abs": 0.1862352043390274, "epoch": 0.09554520482503284, "grad_norm": 1.671875, "learning_rate": 2.4992385337738696e-07, "logits/chosen": -2.008779525756836, "logits/rejected": -2.0400052070617676, "logps/chosen": -0.28240451216697693, "logps/rejected": -0.31364208459854126, "loss": 0.9967119097709656, "loss/core": 0.9862802624702454, "loss/preference_sft": 0.28240451216697693, "loss/reference_anchor": 0.4933498501777649, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 2.9755539894104004, "rewards/margins": 1.446618676185608, "rewards/rejected": 1.5289356708526611, "step": 100 }, { "drift/chosen_abs": 0.31854820251464844, "drift/rejected_abs": 0.13878673315048218, "epoch": 0.10032246506628449, "grad_norm": 4.375, "learning_rate": 2.4981577053636144e-07, "logits/chosen": -1.934293508529663, "logits/rejected": -1.9871383905410767, "logps/chosen": -0.2761833667755127, "logps/rejected": -0.26434868574142456, "loss": 0.7714275121688843, "loss/core": 0.7632346153259277, "loss/preference_sft": 0.2761833667755127, "loss/reference_anchor": 0.38203054666519165, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": 3.1841020584106445, "rewards/margins": 1.7970466613769531, "rewards/rejected": 1.3870553970336914, "step": 105 }, { "drift/chosen_abs": 0.21965603530406952, "drift/rejected_abs": 0.10388318449258804, "epoch": 0.10509972530753613, "grad_norm": 5.09375, "learning_rate": 2.496607495886281e-07, "logits/chosen": -2.1238505840301514, "logits/rejected": -2.097701072692871, "logps/chosen": -0.2954608201980591, "logps/rejected": -0.3057326674461365, "loss": 0.650016188621521, "loss/core": 0.6429935097694397, "loss/preference_sft": 0.2954608201980591, "loss/reference_anchor": 0.3215869665145874, "rewards/accuracies": 0.875, "rewards/chosen": 2.1926186084747314, "rewards/margins": 1.1593815088272095, "rewards/rejected": 1.0332369804382324, "step": 110 }, { "drift/chosen_abs": 0.3507579267024994, "drift/rejected_abs": 0.12545308470726013, "epoch": 0.10987698554878778, "grad_norm": 536.0, "learning_rate": 2.4945884883122553e-07, "logits/chosen": -2.0215022563934326, "logits/rejected": -2.0700583457946777, "logps/chosen": -0.28947877883911133, "logps/rejected": -0.2858577370643616, "loss": 1.4179147481918335, "loss/core": 1.4032930135726929, "loss/preference_sft": 0.28947877883911133, "loss/reference_anchor": 0.7021245956420898, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 3.5075790882110596, "rewards/margins": 2.2566137313842773, "rewards/rejected": 1.2509657144546509, "step": 115 }, { "drift/chosen_abs": 0.1810287982225418, "drift/rejected_abs": 0.14085547626018524, "epoch": 0.11465424579003941, "grad_norm": 181.0, "learning_rate": 2.492101441907714e-07, "logits/chosen": -2.2403197288513184, "logits/rejected": -2.1026992797851562, "logps/chosen": -0.260287880897522, "logps/rejected": -0.28016167879104614, "loss": 0.29911449551582336, "loss/core": 0.2956363260746002, "loss/preference_sft": 0.260287880897522, "loss/reference_anchor": 0.14787891507148743, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 1.8089395761489868, "rewards/margins": 0.4003846049308777, "rewards/rejected": 1.4085547924041748, "step": 120 }, { "drift/chosen_abs": 0.4085167944431305, "drift/rejected_abs": 0.10499458014965057, "epoch": 0.11943150603129106, "grad_norm": 1.140625, "learning_rate": 2.4891472919490977e-07, "logits/chosen": -1.9146769046783447, "logits/rejected": -1.9590771198272705, "logps/chosen": -0.28118112683296204, "logps/rejected": -0.27787166833877563, "loss": 1.8055627346038818, "loss/core": 1.7871158123016357, "loss/preference_sft": 0.28118112683296204, "loss/reference_anchor": 0.8942378759384155, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 4.083503723144531, "rewards/margins": 3.059095859527588, "rewards/rejected": 1.024407982826233, "step": 125 }, { "drift/chosen_abs": 0.2690292298793793, "drift/rejected_abs": 0.1741829663515091, "epoch": 0.1242087662725427, "grad_norm": 165.0, "learning_rate": 2.4857271493713894e-07, "logits/chosen": -2.0733864307403564, "logits/rejected": -2.071460247039795, "logps/chosen": -0.29650020599365234, "logps/rejected": -0.29231899976730347, "loss": 1.0611131191253662, "loss/core": 1.050018072128296, "loss/preference_sft": 0.29650020599365234, "loss/reference_anchor": 0.5251095294952393, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 2.689784049987793, "rewards/margins": 0.9507070779800415, "rewards/rejected": 1.7390769720077515, "step": 130 }, { "drift/chosen_abs": 0.1724942922592163, "drift/rejected_abs": 0.08941344916820526, "epoch": 0.12898602651379434, "grad_norm": 7.40625, "learning_rate": 2.481842300350339e-07, "logits/chosen": -2.0276589393615723, "logits/rejected": -2.0920987129211426, "logps/chosen": -0.27670344710350037, "logps/rejected": -0.263897567987442, "loss": 0.19596371054649353, "loss/core": 0.19347220659255981, "loss/preference_sft": 0.27670344710350037, "loss/reference_anchor": 0.09690549224615097, "rewards/accuracies": 0.949999988079071, "rewards/chosen": 1.7226674556732178, "rewards/margins": 0.83062744140625, "rewards/rejected": 0.8920401334762573, "step": 135 }, { "drift/chosen_abs": 0.22231808304786682, "drift/rejected_abs": 0.09158378839492798, "epoch": 0.13376328675504598, "grad_norm": 1.109375, "learning_rate": 2.4774942058187854e-07, "logits/chosen": -2.191605806350708, "logits/rejected": -2.250380039215088, "logps/chosen": -0.2993098199367523, "logps/rejected": -0.2922438979148865, "loss": 0.7870423793792725, "loss/core": 0.7786499261856079, "loss/preference_sft": 0.2993098199367523, "loss/reference_anchor": 0.38969308137893677, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 2.2213363647460938, "rewards/margins": 1.306333303451538, "rewards/rejected": 0.9150028228759766, "step": 140 }, { "drift/chosen_abs": 0.1859746277332306, "drift/rejected_abs": 0.1087212786078453, "epoch": 0.13854054699629761, "grad_norm": 24.0, "learning_rate": 2.472684500917257e-07, "logits/chosen": -1.9669681787490845, "logits/rejected": -1.9938608407974243, "logps/chosen": -0.3318449854850769, "logps/rejected": -0.3153822422027588, "loss": 0.21972651779651642, "loss/core": 0.21688850224018097, "loss/preference_sft": 0.3318449854850769, "loss/reference_anchor": 0.10871516168117523, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 1.858870267868042, "rewards/margins": 0.7766832709312439, "rewards/rejected": 1.0821870565414429, "step": 145 }, { "drift/chosen_abs": 0.14986830949783325, "drift/rejected_abs": 0.05766589194536209, "epoch": 0.14331780723754928, "grad_norm": 3.046875, "learning_rate": 2.467414994379065e-07, "logits/chosen": -2.068981170654297, "logits/rejected": -2.1354150772094727, "logps/chosen": -0.31118273735046387, "logps/rejected": -0.316683828830719, "loss": 0.3042221665382385, "loss/core": 0.30058878660202026, "loss/preference_sft": 0.31118273735046387, "loss/reference_anchor": 0.15054963529109955, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 1.497855305671692, "rewards/margins": 0.9212591052055359, "rewards/rejected": 0.5765963792800903, "step": 150 }, { "drift/chosen_abs": 0.15884414315223694, "drift/rejected_abs": 0.08928201347589493, "epoch": 0.1480950674788009, "grad_norm": 17.25, "learning_rate": 2.4616876678501114e-07, "logits/chosen": -2.2533211708068848, "logits/rejected": -2.299926280975342, "logps/chosen": -0.3172222971916199, "logps/rejected": -0.3034704029560089, "loss": 0.1397572010755539, "loss/core": 0.13774201273918152, "loss/preference_sft": 0.3172222971916199, "loss/reference_anchor": 0.06903725862503052, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 1.5872414112091064, "rewards/margins": 0.6962968111038208, "rewards/rejected": 0.89094477891922, "step": 155 }, { "drift/chosen_abs": 0.3720155358314514, "drift/rejected_abs": 0.11601382493972778, "epoch": 0.15287232772005255, "grad_norm": 948.0, "learning_rate": 2.4555046751436735e-07, "logits/chosen": -2.1271204948425293, "logits/rejected": -2.1136441230773926, "logps/chosen": -0.2963225841522217, "logps/rejected": -0.280845582485199, "loss": 1.3421189785003662, "loss/core": 1.3282365798950195, "loss/preference_sft": 0.2963225841522217, "loss/reference_anchor": 0.6644912958145142, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 3.718188762664795, "rewards/margins": 2.5581791400909424, "rewards/rejected": 1.160009741783142, "step": 160 }, { "drift/chosen_abs": 0.1847013384103775, "drift/rejected_abs": 0.09540971368551254, "epoch": 0.15764958796130418, "grad_norm": 14.9375, "learning_rate": 2.4488683414304425e-07, "logits/chosen": -2.129667282104492, "logits/rejected": -2.230297565460205, "logps/chosen": -0.3174905776977539, "logps/rejected": -0.31254857778549194, "loss": 0.2407360076904297, "loss/core": 0.23772159218788147, "loss/preference_sft": 0.3174905776977539, "loss/reference_anchor": 0.11897067725658417, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 1.846673607826233, "rewards/margins": 0.8936681747436523, "rewards/rejected": 0.9530051350593567, "step": 165 }, { "drift/chosen_abs": 0.15486204624176025, "drift/rejected_abs": 0.09620408713817596, "epoch": 0.16242684820255585, "grad_norm": 7.65625, "learning_rate": 2.4417811623641203e-07, "logits/chosen": -2.2738282680511475, "logits/rejected": -2.332890510559082, "logps/chosen": -0.27397435903549194, "logps/rejected": -0.2843550145626068, "loss": 0.23323550820350647, "loss/core": 0.230382040143013, "loss/preference_sft": 0.27397435903549194, "loss/reference_anchor": 0.11527644097805023, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 1.5484516620635986, "rewards/margins": 0.5872721076011658, "rewards/rejected": 0.9611795544624329, "step": 170 }, { "drift/chosen_abs": 0.5246831178665161, "drift/rejected_abs": 0.20105135440826416, "epoch": 0.16720410844380748, "grad_norm": 14.875, "learning_rate": 2.4342458031429113e-07, "logits/chosen": -1.8324203491210938, "logits/rejected": -1.8386204242706299, "logps/chosen": -0.2887090742588043, "logps/rejected": -0.2930302619934082, "loss": 2.519411563873291, "loss/core": 2.493882656097412, "loss/preference_sft": 0.2887090742588043, "loss/reference_anchor": 1.2475916147232056, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": 5.246148109436035, "rewards/margins": 3.2455039024353027, "rewards/rejected": 2.0006444454193115, "step": 175 }, { "drift/chosen_abs": 0.3295663297176361, "drift/rejected_abs": 0.15013830363750458, "epoch": 0.17198136868505912, "grad_norm": 0.8984375, "learning_rate": 2.4262650975072444e-07, "logits/chosen": -2.1856048107147217, "logits/rejected": -2.3016016483306885, "logps/chosen": -0.28502634167671204, "logps/rejected": -0.29640719294548035, "loss": 1.1087981462478638, "loss/core": 1.0972480773925781, "loss/preference_sft": 0.28502634167671204, "loss/reference_anchor": 0.5489994883537292, "rewards/accuracies": 0.9375, "rewards/chosen": 3.2941269874572754, "rewards/margins": 1.8216378688812256, "rewards/rejected": 1.4724891185760498, "step": 180 }, { "drift/chosen_abs": 0.19066013395786285, "drift/rejected_abs": 0.07735215127468109, "epoch": 0.17675862892631075, "grad_norm": 2.484375, "learning_rate": 2.417842046674122e-07, "logits/chosen": -2.3281235694885254, "logits/rejected": -2.3521463871002197, "logps/chosen": -0.26029735803604126, "logps/rejected": -0.2679922580718994, "loss": 0.19912585616111755, "loss/core": 0.1966342329978943, "loss/preference_sft": 0.26029735803604126, "loss/reference_anchor": 0.09855085611343384, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 1.9066013097763062, "rewards/margins": 1.1336138248443604, "rewards/rejected": 0.7729876041412354, "step": 185 }, { "drift/chosen_abs": 0.19174052774906158, "drift/rejected_abs": 0.09250342845916748, "epoch": 0.18153588916756241, "grad_norm": 2.0625, "learning_rate": 2.4089798182084843e-07, "logits/chosen": -2.0859601497650146, "logits/rejected": -2.158560276031494, "logps/chosen": -0.3072795271873474, "logps/rejected": -0.30823010206222534, "loss": 0.2847827076911926, "loss/core": 0.2813512980937958, "loss/preference_sft": 0.3072795271873474, "loss/reference_anchor": 0.14084270596504211, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 1.9145091772079468, "rewards/margins": 1.001261591911316, "rewards/rejected": 0.9132474660873413, "step": 190 }, { "drift/chosen_abs": 0.21405212581157684, "drift/rejected_abs": 0.13653413951396942, "epoch": 0.18631314940881405, "grad_norm": 2.34375, "learning_rate": 2.3996817448320195e-07, "logits/chosen": -2.154674530029297, "logits/rejected": -2.109269380569458, "logps/chosen": -0.28905612230300903, "logps/rejected": -0.2959071695804596, "loss": 0.47725993394851685, "loss/core": 0.47195786237716675, "loss/preference_sft": 0.28905612230300903, "loss/reference_anchor": 0.2361954003572464, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 2.1385719776153564, "rewards/margins": 0.8496444821357727, "rewards/rejected": 1.288927435874939, "step": 195 }, { "drift/chosen_abs": 0.2820349335670471, "drift/rejected_abs": 0.15623252093791962, "epoch": 0.19109040965006568, "grad_norm": 118.5, "learning_rate": 2.3899513231698607e-07, "logits/chosen": -2.1225414276123047, "logits/rejected": -2.0437445640563965, "logps/chosen": -0.29230794310569763, "logps/rejected": -0.2899274230003357, "loss": 0.5702517628669739, "loss/core": 0.5640192031860352, "loss/preference_sft": 0.29230794310569763, "loss/reference_anchor": 0.28239911794662476, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": 2.8195438385009766, "rewards/margins": 1.2614609003067017, "rewards/rejected": 1.5580826997756958, "step": 200 }, { "drift/chosen_abs": 0.2620348334312439, "drift/rejected_abs": 0.1418972909450531, "epoch": 0.19586766989131732, "grad_norm": 29.875, "learning_rate": 2.3797922124356506e-07, "logits/chosen": -2.029536008834839, "logits/rejected": -2.0266480445861816, "logps/chosen": -0.3911769688129425, "logps/rejected": -0.3083851635456085, "loss": 0.8301785588264465, "loss/core": 0.8211765289306641, "loss/preference_sft": 0.3911769688129425, "loss/reference_anchor": 0.41098326444625854, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 2.620229959487915, "rewards/margins": 1.3009237051010132, "rewards/rejected": 1.3193061351776123, "step": 205 }, { "drift/chosen_abs": 0.17181067168712616, "drift/rejected_abs": 0.07057416439056396, "epoch": 0.20064493013256898, "grad_norm": 1.625, "learning_rate": 2.3692082330554585e-07, "logits/chosen": -2.251944065093994, "logits/rejected": -2.347381114959717, "logps/chosen": -0.25848090648651123, "logps/rejected": -0.25597459077835083, "loss": 0.11508001387119293, "loss/core": 0.11342470347881317, "loss/preference_sft": 0.25848090648651123, "loss/reference_anchor": 0.056916702538728714, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 1.7172927856445312, "rewards/margins": 1.0118815898895264, "rewards/rejected": 0.7054111957550049, "step": 210 }, { "drift/chosen_abs": 0.2751947343349457, "drift/rejected_abs": 0.17245322465896606, "epoch": 0.20542219037382062, "grad_norm": 454.0, "learning_rate": 2.3582033652310765e-07, "logits/chosen": -1.9821306467056274, "logits/rejected": -1.956804633140564, "logps/chosen": -0.2867414355278015, "logps/rejected": -0.2776336669921875, "loss": 0.5166824460029602, "loss/core": 0.5109937787055969, "loss/preference_sft": 0.2867414355278015, "loss/reference_anchor": 0.25575685501098633, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 2.7519474029541016, "rewards/margins": 1.0281121730804443, "rewards/rejected": 1.7238352298736572, "step": 215 }, { "drift/chosen_abs": 0.347667396068573, "drift/rejected_abs": 0.07685881108045578, "epoch": 0.21019945061507225, "grad_norm": 2.8125, "learning_rate": 2.346781747443227e-07, "logits/chosen": -2.0388574600219727, "logits/rejected": -2.1317574977874756, "logps/chosen": -0.2959466874599457, "logps/rejected": -0.2806416153907776, "loss": 1.4209736585617065, "loss/core": 1.4063067436218262, "loss/preference_sft": 0.2959466874599457, "loss/reference_anchor": 0.7037451267242432, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 3.4755759239196777, "rewards/margins": 2.707566022872925, "rewards/rejected": 0.7680096626281738, "step": 220 }, { "drift/chosen_abs": 0.3234902322292328, "drift/rejected_abs": 0.10148955881595612, "epoch": 0.2149767108563239, "grad_norm": 188.0, "learning_rate": 2.3349476748952508e-07, "logits/chosen": -2.1488888263702393, "logits/rejected": -2.237083911895752, "logps/chosen": -0.2739250063896179, "logps/rejected": -0.27243196964263916, "loss": 0.5956701040267944, "loss/core": 0.5892229676246643, "loss/preference_sft": 0.2739250063896179, "loss/reference_anchor": 0.2949652075767517, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 3.233933210372925, "rewards/margins": 2.221308469772339, "rewards/rejected": 1.0126246213912964, "step": 225 }, { "drift/chosen_abs": 0.36533501744270325, "drift/rejected_abs": 0.1348879039287567, "epoch": 0.21975397109757555, "grad_norm": 844.0, "learning_rate": 2.3227055978978545e-07, "logits/chosen": -2.0082271099090576, "logits/rejected": -2.0484988689422607, "logps/chosen": -0.25067609548568726, "logps/rejected": -0.2521665692329407, "loss": 1.3585067987442017, "loss/core": 1.3445472717285156, "loss/preference_sft": 0.25067609548568726, "loss/reference_anchor": 0.6729066967964172, "rewards/accuracies": 0.875, "rewards/chosen": 3.6500682830810547, "rewards/margins": 2.3029842376708984, "rewards/rejected": 1.3470841646194458, "step": 230 }, { "drift/chosen_abs": 0.2073029726743698, "drift/rejected_abs": 0.12087440490722656, "epoch": 0.2245312313388272, "grad_norm": 1.5703125, "learning_rate": 2.3100601201955321e-07, "logits/chosen": -2.326741933822632, "logits/rejected": -2.3083624839782715, "logps/chosen": -0.25950273871421814, "logps/rejected": -0.2679215967655182, "loss": 0.7174883484840393, "loss/core": 0.709865391254425, "loss/preference_sft": 0.25950273871421814, "loss/reference_anchor": 0.35520219802856445, "rewards/accuracies": 0.8125, "rewards/chosen": 2.0721540451049805, "rewards/margins": 0.8642433285713196, "rewards/rejected": 1.2079106569290161, "step": 235 }, { "drift/chosen_abs": 0.339974582195282, "drift/rejected_abs": 0.19081738591194153, "epoch": 0.22930849158007882, "grad_norm": 14.9375, "learning_rate": 2.2970159972352864e-07, "logits/chosen": -2.121175527572632, "logits/rejected": -2.1394689083099365, "logps/chosen": -0.27825844287872314, "logps/rejected": -0.29647335410118103, "loss": 1.2494022846221924, "loss/core": 1.236472249031067, "loss/preference_sft": 0.27825844287872314, "loss/reference_anchor": 0.6186779737472534, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 3.3997459411621094, "rewards/margins": 1.4949043989181519, "rewards/rejected": 1.9048411846160889, "step": 240 }, { "drift/chosen_abs": 0.3295367658138275, "drift/rejected_abs": 0.16237182915210724, "epoch": 0.23408575182133046, "grad_norm": 552.0, "learning_rate": 2.2835781343782966e-07, "logits/chosen": -1.8566938638687134, "logits/rejected": -1.875113844871521, "logps/chosen": -0.2936326861381531, "logps/rejected": -0.29784101247787476, "loss": 1.379624843597412, "loss/core": 1.3653779029846191, "loss/preference_sft": 0.2936326861381531, "loss/reference_anchor": 0.6829947829246521, "rewards/accuracies": 0.875, "rewards/chosen": 3.2930209636688232, "rewards/margins": 1.6766458749771118, "rewards/rejected": 1.6163749694824219, "step": 245 }, { "drift/chosen_abs": 0.15949814021587372, "drift/rejected_abs": 0.10824527591466904, "epoch": 0.23886301206258212, "grad_norm": 0.53125, "learning_rate": 2.2697515850552152e-07, "logits/chosen": -2.3425869941711426, "logits/rejected": -2.325498104095459, "logps/chosen": -0.2886843681335449, "logps/rejected": -0.2921077609062195, "loss": 0.29327505826950073, "loss/core": 0.28979676961898804, "loss/preference_sft": 0.2886843681335449, "loss/reference_anchor": 0.14504632353782654, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 1.5941321849822998, "rewards/margins": 0.5128880739212036, "rewards/rejected": 1.0812442302703857, "step": 250 }, { "drift/chosen_abs": 0.14964722096920013, "drift/rejected_abs": 0.05588113144040108, "epoch": 0.24364027230383375, "grad_norm": 0.63671875, "learning_rate": 2.2555415488657775e-07, "logits/chosen": -2.117321729660034, "logits/rejected": -2.180022716522217, "logps/chosen": -0.3025610148906708, "logps/rejected": -0.30650925636291504, "loss": 0.14917774498462677, "loss/core": 0.14709773659706116, "loss/preference_sft": 0.3025610148906708, "loss/reference_anchor": 0.07374367862939835, "rewards/accuracies": 0.949999988079071, "rewards/chosen": 1.4962538480758667, "rewards/margins": 0.9412781000137329, "rewards/rejected": 0.5549757480621338, "step": 255 }, { "drift/chosen_abs": 0.23837116360664368, "drift/rejected_abs": 0.1084081158041954, "epoch": 0.2484175325450854, "grad_norm": 4.59375, "learning_rate": 2.240953369623447e-07, "logits/chosen": -2.271860122680664, "logits/rejected": -2.326420307159424, "logps/chosen": -0.2747231125831604, "logps/rejected": -0.276181697845459, "loss": 0.3998209536075592, "loss/core": 0.3953119218349457, "loss/preference_sft": 0.2747231125831604, "loss/reference_anchor": 0.19797541201114655, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 2.3820481300354004, "rewards/margins": 1.2980557680130005, "rewards/rejected": 1.0839922428131104, "step": 260 }, { "drift/chosen_abs": 0.14227482676506042, "drift/rejected_abs": 0.07095784693956375, "epoch": 0.25319479278633705, "grad_norm": 1.3828125, "learning_rate": 2.225992533345824e-07, "logits/chosen": -2.364943265914917, "logits/rejected": -2.4003348350524902, "logps/chosen": -0.2837630808353424, "logps/rejected": -0.28678828477859497, "loss": 0.1420137584209442, "loss/core": 0.14004194736480713, "loss/preference_sft": 0.2837630808353424, "loss/reference_anchor": 0.07021477073431015, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 1.422141671180725, "rewards/margins": 0.7143291234970093, "rewards/rejected": 0.7078123688697815, "step": 265 }, { "drift/chosen_abs": 0.18406164646148682, "drift/rejected_abs": 0.0678694099187851, "epoch": 0.2579720530275887, "grad_norm": 12.5, "learning_rate": 2.210664666191579e-07, "logits/chosen": -2.1580262184143066, "logits/rejected": -2.2362945079803467, "logps/chosen": -0.3155515789985657, "logps/rejected": -0.29309743642807007, "loss": 0.20326463878154755, "loss/core": 0.20061977207660675, "loss/preference_sft": 0.3155515789985657, "loss/reference_anchor": 0.10068801790475845, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 1.839700698852539, "rewards/margins": 1.163073182106018, "rewards/rejected": 0.6766273379325867, "step": 270 }, { "drift/chosen_abs": 0.24695925414562225, "drift/rejected_abs": 0.11996563524007797, "epoch": 0.2627493132688403, "grad_norm": 17.25, "learning_rate": 2.1949755323446848e-07, "logits/chosen": -2.250136375427246, "logits/rejected": -2.232349157333374, "logps/chosen": -0.2562440037727356, "logps/rejected": -0.2609252333641052, "loss": 0.5029779672622681, "loss/core": 0.49748414754867554, "loss/preference_sft": 0.2562440037727356, "loss/reference_anchor": 0.2490653693675995, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 2.4680981636047363, "rewards/margins": 1.2709671258926392, "rewards/rejected": 1.1971310377120972, "step": 275 }, { "drift/chosen_abs": 0.2423405647277832, "drift/rejected_abs": 0.13960115611553192, "epoch": 0.26752657351009196, "grad_norm": 27.375, "learning_rate": 2.1789310318467426e-07, "logits/chosen": -1.8027242422103882, "logits/rejected": -1.8857799768447876, "logps/chosen": -0.3176387846469879, "logps/rejected": -0.3207781910896301, "loss": 0.3058789372444153, "loss/core": 0.3022173047065735, "loss/preference_sft": 0.3176387846469879, "loss/reference_anchor": 0.1513180285692215, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": 2.4204940795898438, "rewards/margins": 1.0279791355133057, "rewards/rejected": 1.3925148248672485, "step": 280 }, { "drift/chosen_abs": 0.2865580916404724, "drift/rejected_abs": 0.1650657057762146, "epoch": 0.2723038337513436, "grad_norm": 84.0, "learning_rate": 2.1625371983782182e-07, "logits/chosen": -2.08091402053833, "logits/rejected": -2.043867826461792, "logps/chosen": -0.2672872543334961, "logps/rejected": -0.2768842577934265, "loss": 0.6620380282402039, "loss/core": 0.6549504995346069, "loss/preference_sft": 0.2672872543334961, "loss/reference_anchor": 0.32764729857444763, "rewards/accuracies": 0.875, "rewards/chosen": 2.865417242050171, "rewards/margins": 1.2915067672729492, "rewards/rejected": 1.5739107131958008, "step": 285 }, { "drift/chosen_abs": 0.20399828255176544, "drift/rejected_abs": 0.08803847432136536, "epoch": 0.27708109399259523, "grad_norm": 20.25, "learning_rate": 2.14580019698942e-07, "logits/chosen": -2.1715924739837646, "logits/rejected": -2.2407965660095215, "logps/chosen": -0.2938459813594818, "logps/rejected": -0.2942553758621216, "loss": 0.3727453947067261, "loss/core": 0.3684656322002411, "loss/preference_sft": 0.2938459813594818, "loss/reference_anchor": 0.18460234999656677, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 2.0391552448272705, "rewards/margins": 1.1640946865081787, "rewards/rejected": 0.8750606775283813, "step": 290 }, { "drift/chosen_abs": 0.22580035030841827, "drift/rejected_abs": 0.16777771711349487, "epoch": 0.28185835423384686, "grad_norm": 652.0, "learning_rate": 2.1287263217820773e-07, "logits/chosen": -2.1450181007385254, "logits/rejected": -2.1244781017303467, "logps/chosen": -0.2750265300273895, "logps/rejected": -0.2840802073478699, "loss": 0.6499078273773193, "loss/core": 0.6429253816604614, "loss/preference_sft": 0.2750265300273895, "loss/reference_anchor": 0.3216193616390228, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": 2.2560317516326904, "rewards/margins": 0.5812076330184937, "rewards/rejected": 1.6748244762420654, "step": 295 }, { "drift/chosen_abs": 0.27815431356430054, "drift/rejected_abs": 0.13376235961914062, "epoch": 0.28663561447509855, "grad_norm": 11.5, "learning_rate": 2.111321993542385e-07, "logits/chosen": -1.9923107624053955, "logits/rejected": -1.9791291952133179, "logps/chosen": -0.2681702673435211, "logps/rejected": -0.28962358832359314, "loss": 0.390531450510025, "loss/core": 0.38612592220306396, "loss/preference_sft": 0.2681702673435211, "loss/reference_anchor": 0.19345811009407043, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 2.778730869293213, "rewards/margins": 1.4537692070007324, "rewards/rejected": 1.3249620199203491, "step": 300 }, { "drift/chosen_abs": 0.18262216448783875, "drift/rejected_abs": 0.1317087560892105, "epoch": 0.2914128747163502, "grad_norm": 55.0, "learning_rate": 2.0935937573264096e-07, "logits/chosen": -2.0926907062530518, "logits/rejected": -2.105894088745117, "logps/chosen": -0.28904959559440613, "logps/rejected": -0.30133944749832153, "loss": 0.2560952305793762, "loss/core": 0.2529827654361725, "loss/preference_sft": 0.28904959559440613, "loss/reference_anchor": 0.1267165243625641, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": 1.8257789611816406, "rewards/margins": 0.510686993598938, "rewards/rejected": 1.315091848373413, "step": 305 }, { "drift/chosen_abs": 0.20964379608631134, "drift/rejected_abs": 0.13515421748161316, "epoch": 0.2961901349576018, "grad_norm": 7.53125, "learning_rate": 2.0755482799987596e-07, "logits/chosen": -2.020278215408325, "logits/rejected": -1.9860916137695312, "logps/chosen": -0.29890328645706177, "logps/rejected": -0.3041743338108063, "loss": 0.5346760749816895, "loss/core": 0.5287860035896301, "loss/preference_sft": 0.29890328645706177, "loss/reference_anchor": 0.2646165192127228, "rewards/accuracies": 0.875, "rewards/chosen": 2.094669818878174, "rewards/margins": 0.7476687431335449, "rewards/rejected": 1.347001075744629, "step": 310 }, { "drift/chosen_abs": 0.15830251574516296, "drift/rejected_abs": 0.09903346002101898, "epoch": 0.30096739519885346, "grad_norm": 3.578125, "learning_rate": 2.0571923477254526e-07, "logits/chosen": -2.271230697631836, "logits/rejected": -2.2453927993774414, "logps/chosen": -0.29073256254196167, "logps/rejected": -0.290340393781662, "loss": 0.21692290902137756, "loss/core": 0.21419718861579895, "loss/preference_sft": 0.29073256254196167, "loss/reference_anchor": 0.10721520334482193, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 1.582291603088379, "rewards/margins": 0.6015550494194031, "rewards/rejected": 0.9807365536689758, "step": 315 }, { "drift/chosen_abs": 0.28570857644081116, "drift/rejected_abs": 0.19199606776237488, "epoch": 0.3057446554401051, "grad_norm": 2.859375, "learning_rate": 2.038532863421914e-07, "logits/chosen": -2.1323790550231934, "logits/rejected": -2.0531458854675293, "logps/chosen": -0.29020506143569946, "logps/rejected": -0.2748698890209198, "loss": 0.6716278195381165, "loss/core": 0.6644001007080078, "loss/preference_sft": 0.29020506143569946, "loss/reference_anchor": 0.3323640823364258, "rewards/accuracies": 0.824999988079071, "rewards/chosen": 2.857085704803467, "rewards/margins": 0.9378870129585266, "rewards/rejected": 1.919198751449585, "step": 320 }, { "drift/chosen_abs": 0.15099409222602844, "drift/rejected_abs": 0.15222987532615662, "epoch": 0.31052191568135673, "grad_norm": 6.4375, "learning_rate": 2.0195768441570726e-07, "logits/chosen": -1.9938151836395264, "logits/rejected": -2.049948215484619, "logps/chosen": -0.2915424704551697, "logps/rejected": -0.28644031286239624, "loss": 0.6587117910385132, "loss/core": 0.6516103148460388, "loss/preference_sft": 0.2915424704551697, "loss/reference_anchor": 0.3259239196777344, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 1.5096241235733032, "rewards/margins": -0.008662676438689232, "rewards/rejected": 1.5182867050170898, "step": 325 }, { "drift/chosen_abs": 0.2591181993484497, "drift/rejected_abs": 0.11437433958053589, "epoch": 0.31529917592260837, "grad_norm": 18.75, "learning_rate": 2.0003314185145307e-07, "logits/chosen": -2.145712375640869, "logits/rejected": -2.0909924507141113, "logps/chosen": -0.28042882680892944, "logps/rejected": -0.2842772603034973, "loss": 0.46702370047569275, "loss/core": 0.46183985471725464, "loss/preference_sft": 0.28042882680892944, "loss/reference_anchor": 0.23115257918834686, "rewards/accuracies": 0.875, "rewards/chosen": 2.5909152030944824, "rewards/margins": 1.4475888013839722, "rewards/rejected": 1.1433266401290894, "step": 330 }, { "drift/chosen_abs": 0.2697688341140747, "drift/rejected_abs": 0.1486051231622696, "epoch": 0.32007643616386, "grad_norm": 26.5, "learning_rate": 1.9808038239117913e-07, "logits/chosen": -1.9927841424942017, "logits/rejected": -1.9601898193359375, "logps/chosen": -0.2884038984775543, "logps/rejected": -0.2860269844532013, "loss": 0.4839557111263275, "loss/core": 0.4785878658294678, "loss/preference_sft": 0.2884038984775543, "loss/reference_anchor": 0.23955455422401428, "rewards/accuracies": 0.875, "rewards/chosen": 2.6973326206207275, "rewards/margins": 1.2938122749328613, "rewards/rejected": 1.4035199880599976, "step": 335 }, { "drift/chosen_abs": 0.16600827872753143, "drift/rejected_abs": 0.08406911045312881, "epoch": 0.3248536964051117, "grad_norm": 8.5, "learning_rate": 1.9610014038785646e-07, "logits/chosen": -2.222121477127075, "logits/rejected": -2.2075448036193848, "logps/chosen": -0.2964716851711273, "logps/rejected": -0.30573147535324097, "loss": 0.17239664494991302, "loss/core": 0.17009879648685455, "loss/preference_sft": 0.2964716851711273, "loss/reference_anchor": 0.08524533361196518, "rewards/accuracies": 0.875, "rewards/chosen": 1.6584606170654297, "rewards/margins": 0.8196709752082825, "rewards/rejected": 0.8387895822525024, "step": 340 }, { "drift/chosen_abs": 0.2879965305328369, "drift/rejected_abs": 0.2307172268629074, "epoch": 0.3296309566463633, "grad_norm": 20.75, "learning_rate": 1.9409316052951657e-07, "logits/chosen": -1.9839036464691162, "logits/rejected": -2.0710253715515137, "logps/chosen": -0.2770405411720276, "logps/rejected": -0.2928730249404907, "loss": 1.3981668949127197, "loss/core": 1.3837751150131226, "loss/preference_sft": 0.2770405411720276, "loss/reference_anchor": 0.6918903589248657, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 2.87996506690979, "rewards/margins": 0.5738177299499512, "rewards/rejected": 2.3061470985412598, "step": 345 }, { "drift/chosen_abs": 0.3735573887825012, "drift/rejected_abs": 0.1227908581495285, "epoch": 0.33440821688761496, "grad_norm": 75.5, "learning_rate": 1.920601975592047e-07, "logits/chosen": -2.171405076980591, "logits/rejected": -2.1451284885406494, "logps/chosen": -0.2867693305015564, "logps/rejected": -0.29171350598335266, "loss": 1.53303062915802, "loss/core": 1.5172761678695679, "loss/preference_sft": 0.2867693305015564, "loss/reference_anchor": 0.7590527534484863, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 3.7349324226379395, "rewards/margins": 2.521451473236084, "rewards/rejected": 1.2134809494018555, "step": 350 }, { "drift/chosen_abs": 0.1963830143213272, "drift/rejected_abs": 0.07833238691091537, "epoch": 0.3391854771288666, "grad_norm": 1.8203125, "learning_rate": 1.900020159911519e-07, "logits/chosen": -2.0924370288848877, "logits/rejected": -2.159611701965332, "logps/chosen": -0.3114902377128601, "logps/rejected": -0.31218671798706055, "loss": 0.28884080052375793, "loss/core": 0.2853604257106781, "loss/preference_sft": 0.3114902377128601, "loss/reference_anchor": 0.14286813139915466, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": 1.9624801874160767, "rewards/margins": 1.1923706531524658, "rewards/rejected": 0.7701095342636108, "step": 355 }, { "drift/chosen_abs": 0.1754159778356552, "drift/rejected_abs": 0.18023176491260529, "epoch": 0.34396273737011823, "grad_norm": 21.5, "learning_rate": 1.879193898232725e-07, "logits/chosen": -2.1387431621551514, "logits/rejected": -2.1139893531799316, "logps/chosen": -0.3140478730201721, "logps/rejected": -0.3199792206287384, "loss": 0.39963623881340027, "loss/core": 0.39505690336227417, "loss/preference_sft": 0.3140478730201721, "loss/reference_anchor": 0.19756412506103516, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": 1.754159927368164, "rewards/margins": -0.04186423867940903, "rewards/rejected": 1.796023964881897, "step": 360 }, { "drift/chosen_abs": 0.37004557251930237, "drift/rejected_abs": 0.08763270825147629, "epoch": 0.34873999761136987, "grad_norm": 59.5, "learning_rate": 1.8581310224609496e-07, "logits/chosen": -2.1298484802246094, "logits/rejected": -2.202394962310791, "logps/chosen": -0.2909151315689087, "logps/rejected": -0.2845023572444916, "loss": 1.6612498760223389, "loss/core": 1.6442168951034546, "loss/preference_sft": 0.2909151315689087, "loss/reference_anchor": 0.8225665092468262, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 3.698554277420044, "rewards/margins": 2.8230626583099365, "rewards/rejected": 0.8754919767379761, "step": 365 }, { "drift/chosen_abs": 0.29484832286834717, "drift/rejected_abs": 0.12339384853839874, "epoch": 0.3535172578526215, "grad_norm": 30.125, "learning_rate": 1.8368394534823635e-07, "logits/chosen": -2.0275933742523193, "logits/rejected": -2.0372328758239746, "logps/chosen": -0.2683495581150055, "logps/rejected": -0.2806262671947479, "loss": 0.5110516548156738, "loss/core": 0.5054527521133423, "loss/preference_sft": 0.2683495581150055, "loss/reference_anchor": 0.2531072795391083, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 2.9470877647399902, "rewards/margins": 1.7142242193222046, "rewards/rejected": 1.2328637838363647, "step": 370 }, { "drift/chosen_abs": 0.4893800616264343, "drift/rejected_abs": 0.23103968799114227, "epoch": 0.35829451809387314, "grad_norm": 10.0625, "learning_rate": 1.8153271981852968e-07, "logits/chosen": -2.004993200302124, "logits/rejected": -1.9773603677749634, "logps/chosen": -0.3077290654182434, "logps/rejected": -0.2921420633792877, "loss": 3.063831329345703, "loss/core": 3.032869338989258, "loss/preference_sft": 0.3077290654182434, "loss/reference_anchor": 1.5173249244689941, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": 4.893084526062012, "rewards/margins": 2.5864005088806152, "rewards/rejected": 2.3066840171813965, "step": 375 }, { "drift/chosen_abs": 0.22893986105918884, "drift/rejected_abs": 0.13307783007621765, "epoch": 0.36307177833512483, "grad_norm": 156.0, "learning_rate": 1.7936023464491812e-07, "logits/chosen": -2.0798957347869873, "logits/rejected": -2.190671920776367, "logps/chosen": -0.2794080078601837, "logps/rejected": -0.27889859676361084, "loss": 0.7344735860824585, "loss/core": 0.7266415357589722, "loss/preference_sft": 0.2794080078601837, "loss/reference_anchor": 0.3636623024940491, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 2.2871289253234863, "rewards/margins": 0.9574325680732727, "rewards/rejected": 1.3296962976455688, "step": 380 }, { "drift/chosen_abs": 0.166697159409523, "drift/rejected_abs": 0.10592110455036163, "epoch": 0.36784903857637646, "grad_norm": 21.0, "learning_rate": 1.7716730681022723e-07, "logits/chosen": -2.1135611534118652, "logits/rejected": -2.0744059085845947, "logps/chosen": -0.31136012077331543, "logps/rejected": -0.2861802577972412, "loss": 0.23299483954906464, "loss/core": 0.23006677627563477, "loss/preference_sft": 0.31136012077331543, "loss/reference_anchor": 0.11526670306921005, "rewards/accuracies": 0.824999988079071, "rewards/chosen": 1.6641048192977905, "rewards/margins": 0.6075918078422546, "rewards/rejected": 1.0565129518508911, "step": 385 }, { "drift/chosen_abs": 0.22516271471977234, "drift/rejected_abs": 0.1247841864824295, "epoch": 0.3726262988176281, "grad_norm": 1.9453125, "learning_rate": 1.7495476098493152e-07, "logits/chosen": -2.1953511238098145, "logits/rejected": -2.2125370502471924, "logps/chosen": -0.27903926372528076, "logps/rejected": -0.28518766164779663, "loss": 0.3761298954486847, "loss/core": 0.37184834480285645, "loss/preference_sft": 0.27903926372528076, "loss/reference_anchor": 0.18617263436317444, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 2.250232219696045, "rewards/margins": 1.0177348852157593, "rewards/rejected": 1.232497215270996, "step": 390 }, { "drift/chosen_abs": 0.3017219603061676, "drift/rejected_abs": 0.16852721571922302, "epoch": 0.37740355905887973, "grad_norm": 3.484375, "learning_rate": 1.7272342921702937e-07, "logits/chosen": -2.087266445159912, "logits/rejected": -2.1111271381378174, "logps/chosen": -0.3051111102104187, "logps/rejected": -0.30405479669570923, "loss": 1.1819294691085815, "loss/core": 1.1696186065673828, "loss/preference_sft": 0.3051111102104187, "loss/reference_anchor": 0.5850434303283691, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 3.0164356231689453, "rewards/margins": 1.3323934078216553, "rewards/rejected": 1.6840423345565796, "step": 395 }, { "drift/chosen_abs": 0.27575579285621643, "drift/rejected_abs": 0.20994627475738525, "epoch": 0.38218081930013137, "grad_norm": 2.453125, "learning_rate": 1.7047415061914393e-07, "logits/chosen": -2.057664632797241, "logits/rejected": -2.212043046951294, "logps/chosen": -0.2742888331413269, "logps/rejected": -0.2956988215446472, "loss": 1.1588386297225952, "loss/core": 1.1468188762664795, "loss/preference_sft": 0.2742888331413269, "loss/reference_anchor": 0.5735639333724976, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 2.7565925121307373, "rewards/margins": 0.6574581861495972, "rewards/rejected": 2.0991344451904297, "step": 400 }, { "drift/chosen_abs": 0.25579676032066345, "drift/rejected_abs": 0.1272418051958084, "epoch": 0.386958079541383, "grad_norm": 202.0, "learning_rate": 1.6820777105296707e-07, "logits/chosen": -2.1076152324676514, "logits/rejected": -2.20607590675354, "logps/chosen": -0.3273892402648926, "logps/rejected": -0.28913551568984985, "loss": 0.8974112272262573, "loss/core": 0.8878701329231262, "loss/preference_sft": 0.3273892402648926, "loss/reference_anchor": 0.4443127512931824, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 2.552988052368164, "rewards/margins": 1.2856799364089966, "rewards/rejected": 1.2673081159591675, "step": 405 }, { "drift/chosen_abs": 0.2772047519683838, "drift/rejected_abs": 0.1283237189054489, "epoch": 0.39173533978263464, "grad_norm": 1.5703125, "learning_rate": 1.6592514281116553e-07, "logits/chosen": -2.0812337398529053, "logits/rejected": -2.0970664024353027, "logps/chosen": -0.26817846298217773, "logps/rejected": -0.2727079689502716, "loss": 0.5803694725036621, "loss/core": 0.574087381362915, "loss/preference_sft": 0.26817846298217773, "loss/reference_anchor": 0.2872823476791382, "rewards/accuracies": 0.9375, "rewards/chosen": 2.771658420562744, "rewards/margins": 1.4890962839126587, "rewards/rejected": 1.2825623750686646, "step": 410 }, { "drift/chosen_abs": 0.23107464611530304, "drift/rejected_abs": 0.0726277232170105, "epoch": 0.3965126000238863, "grad_norm": 10.5625, "learning_rate": 1.636271242968684e-07, "logits/chosen": -2.0305263996124268, "logits/rejected": -2.0474953651428223, "logps/chosen": -0.30018436908721924, "logps/rejected": -0.2916948199272156, "loss": 0.43483519554138184, "loss/core": 0.42992615699768066, "loss/preference_sft": 0.30018436908721924, "loss/reference_anchor": 0.21543259918689728, "rewards/accuracies": 0.9624999761581421, "rewards/chosen": 2.310746431350708, "rewards/margins": 1.701195478439331, "rewards/rejected": 0.6095508933067322, "step": 415 }, { "drift/chosen_abs": 0.32632407546043396, "drift/rejected_abs": 0.18786516785621643, "epoch": 0.40128986026513797, "grad_norm": 7.3125, "learning_rate": 1.6131457970085684e-07, "logits/chosen": -1.924475908279419, "logits/rejected": -1.9443466663360596, "logps/chosen": -0.2839311957359314, "logps/rejected": -0.2862430214881897, "loss": 0.9467588663101196, "loss/core": 0.9368128776550293, "loss/preference_sft": 0.2839311957359314, "loss/reference_anchor": 0.4689028859138489, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 3.2614026069641113, "rewards/margins": 1.3844013214111328, "rewards/rejected": 1.8770010471343994, "step": 420 }, { "drift/chosen_abs": 0.29126811027526855, "drift/rejected_abs": 0.19718101620674133, "epoch": 0.4060671205063896, "grad_norm": 98.0, "learning_rate": 1.5898837867657727e-07, "logits/chosen": -1.9464651346206665, "logits/rejected": -1.9939228296279907, "logps/chosen": -0.2907729744911194, "logps/rejected": -0.27748432755470276, "loss": 0.9655182957649231, "loss/core": 0.9553742408752441, "loss/preference_sft": 0.2907729744911194, "loss/reference_anchor": 0.4781121611595154, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 2.9124670028686523, "rewards/margins": 0.9434226751327515, "rewards/rejected": 1.9690440893173218, "step": 425 }, { "drift/chosen_abs": 0.2520788609981537, "drift/rejected_abs": 0.08256536722183228, "epoch": 0.41084438074764124, "grad_norm": 9.3125, "learning_rate": 1.5664939601310023e-07, "logits/chosen": -2.176443099975586, "logits/rejected": -2.245333194732666, "logps/chosen": -0.30696016550064087, "logps/rejected": -0.3062490224838257, "loss": 0.846347451210022, "loss/core": 0.8373504877090454, "loss/preference_sft": 0.30696016550064087, "loss/reference_anchor": 0.41915664076805115, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 2.5197196006774902, "rewards/margins": 1.6960992813110352, "rewards/rejected": 0.8236203193664551, "step": 430 }, { "drift/chosen_abs": 0.24701747298240662, "drift/rejected_abs": 0.12345242500305176, "epoch": 0.41562164098889287, "grad_norm": 3.65625, "learning_rate": 1.5429851130614807e-07, "logits/chosen": -2.1048972606658936, "logits/rejected": -2.033947467803955, "logps/chosen": -0.2840856909751892, "logps/rejected": -0.2637600898742676, "loss": 0.45461979508399963, "loss/core": 0.4495505392551422, "loss/preference_sft": 0.2840856909751892, "loss/reference_anchor": 0.2250523865222931, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": 2.468121290206909, "rewards/margins": 1.2350847721099854, "rewards/rejected": 1.233036756515503, "step": 435 }, { "drift/chosen_abs": 0.21977201104164124, "drift/rejected_abs": 0.0888163223862648, "epoch": 0.4203989012301445, "grad_norm": 88.5, "learning_rate": 1.51936608627315e-07, "logits/chosen": -1.996376395225525, "logits/rejected": -2.0227012634277344, "logps/chosen": -0.31263792514801025, "logps/rejected": -0.3157431185245514, "loss": 0.3650742173194885, "loss/core": 0.3608359098434448, "loss/preference_sft": 0.31263792514801025, "loss/reference_anchor": 0.1806512176990509, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 2.1961891651153564, "rewards/margins": 1.3100742101669312, "rewards/rejected": 0.8861148953437805, "step": 440 }, { "drift/chosen_abs": 0.3700529634952545, "drift/rejected_abs": 0.17902246117591858, "epoch": 0.42517616147139614, "grad_norm": 180.0, "learning_rate": 1.4956457619160375e-07, "logits/chosen": -2.0445446968078613, "logits/rejected": -2.02923321723938, "logps/chosen": -0.2807472348213196, "logps/rejected": -0.26079219579696655, "loss": 1.3479831218719482, "loss/core": 1.3340699672698975, "loss/preference_sft": 0.2807472348213196, "loss/reference_anchor": 0.6675775647163391, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": 3.700012683868408, "rewards/margins": 1.9215444326400757, "rewards/rejected": 1.778468132019043, "step": 445 }, { "drift/chosen_abs": 0.19167892634868622, "drift/rejected_abs": 0.08485953509807587, "epoch": 0.4299534217126478, "grad_norm": 5.6875, "learning_rate": 1.471833060234044e-07, "logits/chosen": -2.1029083728790283, "logits/rejected": -2.1657981872558594, "logps/chosen": -0.30128949880599976, "logps/rejected": -0.3000229001045227, "loss": 0.2482064664363861, "loss/core": 0.24514798820018768, "loss/preference_sft": 0.30128949880599976, "loss/reference_anchor": 0.12279714643955231, "rewards/accuracies": 0.875, "rewards/chosen": 1.9167217016220093, "rewards/margins": 1.0688178539276123, "rewards/rejected": 0.847903847694397, "step": 450 }, { "drift/chosen_abs": 0.2169889211654663, "drift/rejected_abs": 0.13156619668006897, "epoch": 0.4347306819538994, "grad_norm": 46.5, "learning_rate": 1.4479369362104037e-07, "logits/chosen": -2.13124418258667, "logits/rejected": -2.2444398403167725, "logps/chosen": -0.2661250829696655, "logps/rejected": -0.28118157386779785, "loss": 0.36354073882102966, "loss/core": 0.35940924286842346, "loss/preference_sft": 0.2661250829696655, "loss/reference_anchor": 0.17996393144130707, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 2.1693220138549805, "rewards/margins": 0.8696813583374023, "rewards/rejected": 1.2996408939361572, "step": 455 }, { "drift/chosen_abs": 0.20733904838562012, "drift/rejected_abs": 0.09261975437402725, "epoch": 0.4395079421951511, "grad_norm": 3.65625, "learning_rate": 1.4239663762000817e-07, "logits/chosen": -2.1311872005462646, "logits/rejected": -2.0629684925079346, "logps/chosen": -0.29252859950065613, "logps/rejected": -0.2915221154689789, "loss": 0.34754329919815063, "loss/core": 0.3435174524784088, "loss/preference_sft": 0.29252859950065613, "loss/reference_anchor": 0.17203818261623383, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 2.070737361907959, "rewards/margins": 1.146690845489502, "rewards/rejected": 0.924046516418457, "step": 460 }, { "drift/chosen_abs": 0.25771060585975647, "drift/rejected_abs": 0.14189331233501434, "epoch": 0.44428520243640274, "grad_norm": 96.5, "learning_rate": 1.3999303945503747e-07, "logits/chosen": -2.1602511405944824, "logits/rejected": -2.2427048683166504, "logps/chosen": -0.3139217793941498, "logps/rejected": -0.3135758340358734, "loss": 0.8517921566963196, "loss/core": 0.842727780342102, "loss/preference_sft": 0.3139217793941498, "loss/reference_anchor": 0.4218299984931946, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 2.5764236450195312, "rewards/margins": 1.158347487449646, "rewards/rejected": 1.4180762767791748, "step": 465 }, { "drift/chosen_abs": 0.15380379557609558, "drift/rejected_abs": 0.10157140344381332, "epoch": 0.4490624626776544, "grad_norm": 4.71875, "learning_rate": 1.3758380302109808e-07, "logits/chosen": -2.1404902935028076, "logits/rejected": -2.1485772132873535, "logps/chosen": -0.2958316206932068, "logps/rejected": -0.26554960012435913, "loss": 0.1802210509777069, "loss/core": 0.17784848809242249, "loss/preference_sft": 0.2958316206932068, "loss/reference_anchor": 0.08904588967561722, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 1.537377953529358, "rewards/margins": 0.5247774124145508, "rewards/rejected": 1.0126006603240967, "step": 470 }, { "drift/chosen_abs": 0.1924518495798111, "drift/rejected_abs": 0.0540982261300087, "epoch": 0.453839722918906, "grad_norm": 1.3125, "learning_rate": 1.351698343334823e-07, "logits/chosen": -2.097944498062134, "logits/rejected": -2.1556663513183594, "logps/chosen": -0.3016926348209381, "logps/rejected": -0.29718315601348877, "loss": 0.4531112611293793, "loss/core": 0.44802337884902954, "loss/preference_sft": 0.3016926348209381, "loss/reference_anchor": 0.22422640025615692, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 1.9209903478622437, "rewards/margins": 1.3928687572479248, "rewards/rejected": 0.5281215906143188, "step": 475 }, { "drift/chosen_abs": 0.24358682334423065, "drift/rejected_abs": 0.13433735072612762, "epoch": 0.45861698316015764, "grad_norm": 219.0, "learning_rate": 1.3275204118708942e-07, "logits/chosen": -2.0871355533599854, "logits/rejected": -1.9663331508636475, "logps/chosen": -0.3032604455947876, "logps/rejected": -0.3135993778705597, "loss": 1.2207492589950562, "loss/core": 1.2080614566802979, "loss/preference_sft": 0.3032604455947876, "loss/reference_anchor": 0.6040719747543335, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 2.4357502460479736, "rewards/margins": 1.0935547351837158, "rewards/rejected": 1.3421953916549683, "step": 480 }, { "drift/chosen_abs": 0.2088780403137207, "drift/rejected_abs": 0.10938602685928345, "epoch": 0.4633942434014093, "grad_norm": 105.5, "learning_rate": 1.3033133281504132e-07, "logits/chosen": -1.9471505880355835, "logits/rejected": -1.9641081094741821, "logps/chosen": -0.2977781295776367, "logps/rejected": -0.2958124577999115, "loss": 0.46540889143943787, "loss/core": 0.4602069854736328, "loss/preference_sft": 0.2977781295776367, "loss/reference_anchor": 0.23032017052173615, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 2.0887653827667236, "rewards/margins": 0.9960877299308777, "rewards/rejected": 1.0926777124404907, "step": 485 }, { "drift/chosen_abs": 0.23758061230182648, "drift/rejected_abs": 0.11018860340118408, "epoch": 0.4681715036426609, "grad_norm": 10.0625, "learning_rate": 1.2790861954675702e-07, "logits/chosen": -2.0518007278442383, "logits/rejected": -2.0877254009246826, "logps/chosen": -0.31017646193504333, "logps/rejected": -0.3069363832473755, "loss": 0.29436618089675903, "loss/core": 0.2908337116241455, "loss/preference_sft": 0.31017646193504333, "loss/reference_anchor": 0.1456061452627182, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 2.374509334564209, "rewards/margins": 1.2785499095916748, "rewards/rejected": 1.0959594249725342, "step": 490 }, { "drift/chosen_abs": 0.1931905448436737, "drift/rejected_abs": 0.09922536462545395, "epoch": 0.47294876388391255, "grad_norm": 47.5, "learning_rate": 1.2548481246561504e-07, "logits/chosen": -2.055600643157959, "logits/rejected": -2.0807411670684814, "logps/chosen": -0.28315284848213196, "logps/rejected": -0.28561973571777344, "loss": 0.28335708379745483, "loss/core": 0.2799864411354065, "loss/preference_sft": 0.28315284848213196, "loss/reference_anchor": 0.14021827280521393, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 1.9313852787017822, "rewards/margins": 0.9417422413825989, "rewards/rejected": 0.9896429181098938, "step": 495 }, { "drift/chosen_abs": 0.3655059039592743, "drift/rejected_abs": 0.16599538922309875, "epoch": 0.47772602412516424, "grad_norm": 400.0, "learning_rate": 1.230608230663321e-07, "logits/chosen": -2.061601161956787, "logits/rejected": -2.0343308448791504, "logps/chosen": -0.28122663497924805, "logps/rejected": -0.2838439345359802, "loss": 1.412589430809021, "loss/core": 1.3980388641357422, "loss/preference_sft": 0.28122663497924805, "loss/reference_anchor": 0.6994101405143738, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 3.652092456817627, "rewards/margins": 2.0014448165893555, "rewards/rejected": 1.650647759437561, "step": 500 }, { "drift/chosen_abs": 0.34218084812164307, "drift/rejected_abs": 0.13698555529117584, "epoch": 0.4825032843664159, "grad_norm": 3.296875, "learning_rate": 1.206375629121874e-07, "logits/chosen": -2.0119738578796387, "logits/rejected": -2.002357006072998, "logps/chosen": -0.31075453758239746, "logps/rejected": -0.31518369913101196, "loss": 0.8807415962219238, "loss/core": 0.8713995814323425, "loss/preference_sft": 0.31075453758239746, "loss/reference_anchor": 0.436026394367218, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 3.421598434448242, "rewards/margins": 2.0699105262756348, "rewards/rejected": 1.3516877889633179, "step": 505 }, { "drift/chosen_abs": 0.23318608105182648, "drift/rejected_abs": 0.12134194374084473, "epoch": 0.4872805446076675, "grad_norm": 9.3125, "learning_rate": 1.1821594329222079e-07, "logits/chosen": -2.206329584121704, "logits/rejected": -2.1498043537139893, "logps/chosen": -0.29152804613113403, "logps/rejected": -0.28346484899520874, "loss": 1.038659691810608, "loss/core": 1.027789831161499, "loss/preference_sft": 0.29152804613113403, "loss/reference_anchor": 0.5143306851387024, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 2.331209897994995, "rewards/margins": 1.118821382522583, "rewards/rejected": 1.2123886346817017, "step": 510 }, { "drift/chosen_abs": 0.18352241814136505, "drift/rejected_abs": 0.1801319718360901, "epoch": 0.49205780484891914, "grad_norm": 62.75, "learning_rate": 1.157968748785344e-07, "logits/chosen": -1.9077939987182617, "logits/rejected": -1.9757105112075806, "logps/chosen": -0.2810531258583069, "logps/rejected": -0.28047794103622437, "loss": 0.3822907507419586, "loss/core": 0.37794721126556396, "loss/preference_sft": 0.2810531258583069, "loss/reference_anchor": 0.18907247483730316, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": 1.832468032836914, "rewards/margins": 0.033732883632183075, "rewards/rejected": 1.7987350225448608, "step": 515 }, { "drift/chosen_abs": 0.32048696279525757, "drift/rejected_abs": 0.1339716911315918, "epoch": 0.4968350650901708, "grad_norm": 11.625, "learning_rate": 1.1338126738382597e-07, "logits/chosen": -1.9192636013031006, "logits/rejected": -1.922795295715332, "logps/chosen": -0.28838467597961426, "logps/rejected": -0.29027271270751953, "loss": 1.2226439714431763, "loss/core": 1.209959864616394, "loss/preference_sft": 0.28838467597961426, "loss/reference_anchor": 0.6053675413131714, "rewards/accuracies": 0.875, "rewards/chosen": 3.204869508743286, "rewards/margins": 1.8670326471328735, "rewards/rejected": 1.3378373384475708, "step": 520 }, { "drift/chosen_abs": 0.21345123648643494, "drift/rejected_abs": 0.07307306677103043, "epoch": 0.5016123253314224, "grad_norm": 2.796875, "learning_rate": 1.1097002921928316e-07, "logits/chosen": -2.0818798542022705, "logits/rejected": -2.164365291595459, "logps/chosen": -0.2766956388950348, "logps/rejected": -0.274677574634552, "loss": 0.38875702023506165, "loss/core": 0.3843541443347931, "loss/preference_sft": 0.2766956388950348, "loss/reference_anchor": 0.1924724131822586, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 2.1327221393585205, "rewards/margins": 1.4029709100723267, "rewards/rejected": 0.729751467704773, "step": 525 }, { "drift/chosen_abs": 0.16321828961372375, "drift/rejected_abs": 0.08229781687259674, "epoch": 0.5063895855726741, "grad_norm": 1.96875, "learning_rate": 1.0856406715296717e-07, "logits/chosen": -2.1804051399230957, "logits/rejected": -2.278212070465088, "logps/chosen": -0.2839670479297638, "logps/rejected": -0.2922574579715729, "loss": 0.15642455220222473, "loss/core": 0.1543111354112625, "loss/preference_sft": 0.2839670479297638, "loss/reference_anchor": 0.07727432250976562, "rewards/accuracies": 0.9375, "rewards/chosen": 1.6320085525512695, "rewards/margins": 0.8094345331192017, "rewards/rejected": 0.8225740194320679, "step": 530 }, { "drift/chosen_abs": 0.334153413772583, "drift/rejected_abs": 0.12186181545257568, "epoch": 0.5111668458139257, "grad_norm": 2.28125, "learning_rate": 1.061642859688146e-07, "logits/chosen": -2.1094107627868652, "logits/rejected": -2.038062334060669, "logps/chosen": -0.266519695520401, "logps/rejected": -0.27537840604782104, "loss": 0.5663573741912842, "loss/core": 0.560210108757019, "loss/preference_sft": 0.266519695520401, "loss/reference_anchor": 0.28070589900016785, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 3.3413596153259277, "rewards/margins": 2.1438353061676025, "rewards/rejected": 1.1975243091583252, "step": 535 }, { "drift/chosen_abs": 0.2915368974208832, "drift/rejected_abs": 0.08553571999073029, "epoch": 0.5159441060551774, "grad_norm": 402.0, "learning_rate": 1.0377158812638491e-07, "logits/chosen": -2.1358208656311035, "logits/rejected": -2.2264904975891113, "logps/chosen": -0.2915400564670563, "logps/rejected": -0.28075969219207764, "loss": 0.7008722424507141, "loss/core": 0.6933463215827942, "loss/preference_sft": 0.2915400564670563, "loss/reference_anchor": 0.34714406728744507, "rewards/accuracies": 0.875, "rewards/chosen": 2.914684534072876, "rewards/margins": 2.095693588256836, "rewards/rejected": 0.8189910054206848, "step": 540 }, { "drift/chosen_abs": 0.2902545928955078, "drift/rejected_abs": 0.14741960167884827, "epoch": 0.520721366296429, "grad_norm": 203.0, "learning_rate": 1.0138687342148249e-07, "logits/chosen": -2.057218551635742, "logits/rejected": -2.1033124923706055, "logps/chosen": -0.30191048979759216, "logps/rejected": -0.32187768816947937, "loss": 1.2491960525512695, "loss/core": 1.2362278699874878, "loss/preference_sft": 0.30191048979759216, "loss/reference_anchor": 0.6182119846343994, "rewards/accuracies": 0.875, "rewards/chosen": 2.9013302326202393, "rewards/margins": 1.42949640750885, "rewards/rejected": 1.4718337059020996, "step": 545 }, { "drift/chosen_abs": 0.24866187572479248, "drift/rejected_abs": 0.20654296875, "epoch": 0.5254986265376806, "grad_norm": 4.46875, "learning_rate": 9.90110386477801e-08, "logits/chosen": -2.1251871585845947, "logits/rejected": -2.2004730701446533, "logps/chosen": -0.2589234709739685, "logps/rejected": -0.2543538212776184, "loss": 0.9448872804641724, "loss/core": 0.935012936592102, "loss/preference_sft": 0.2589234709739685, "loss/reference_anchor": 0.46782487630844116, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 2.4865527153015137, "rewards/margins": 0.4227861762046814, "rewards/rejected": 2.0637667179107666, "step": 550 }, { "drift/chosen_abs": 0.2124369591474533, "drift/rejected_abs": 0.15426431596279144, "epoch": 0.5302758867789323, "grad_norm": 16.625, "learning_rate": 9.664497725957164e-08, "logits/chosen": -2.1896917819976807, "logits/rejected": -2.211423873901367, "logps/chosen": -0.29176199436187744, "logps/rejected": -0.27853789925575256, "loss": 0.46647167205810547, "loss/core": 0.46127018332481384, "loss/preference_sft": 0.29176199436187744, "loss/reference_anchor": 0.2309001386165619, "rewards/accuracies": 0.875, "rewards/chosen": 2.1223769187927246, "rewards/margins": 0.5811587572097778, "rewards/rejected": 1.5412182807922363, "step": 555 }, { "drift/chosen_abs": 0.267036497592926, "drift/rejected_abs": 0.19418852031230927, "epoch": 0.5350531470201839, "grad_norm": 241.0, "learning_rate": 9.428957903578045e-08, "logits/chosen": -1.961870789527893, "logits/rejected": -1.9748855829238892, "logps/chosen": -0.28386375308036804, "logps/rejected": -0.28560274839401245, "loss": 1.1362648010253906, "loss/core": 1.1244474649429321, "loss/preference_sft": 0.28386375308036804, "loss/reference_anchor": 0.5624862909317017, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": 2.6667327880859375, "rewards/margins": 0.7276301980018616, "rewards/rejected": 1.9391027688980103, "step": 560 }, { "drift/chosen_abs": 0.348408579826355, "drift/rejected_abs": 0.19584575295448303, "epoch": 0.5398304072614356, "grad_norm": 3.71875, "learning_rate": 9.194572974534976e-08, "logits/chosen": -2.02203369140625, "logits/rejected": -2.0890095233917236, "logps/chosen": -0.2719302773475647, "logps/rejected": -0.2636726200580597, "loss": 1.6560252904891968, "loss/core": 1.6390788555145264, "loss/preference_sft": 0.2719302773475647, "loss/reference_anchor": 0.8201166391372681, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 3.4829654693603516, "rewards/margins": 1.5329525470733643, "rewards/rejected": 1.9500129222869873, "step": 565 }, { "drift/chosen_abs": 0.22708716988563538, "drift/rejected_abs": 0.166388139128685, "epoch": 0.5446076675026872, "grad_norm": 79.5, "learning_rate": 8.96143108141412e-08, "logits/chosen": -1.9567362070083618, "logits/rejected": -1.9499162435531616, "logps/chosen": -0.27698129415512085, "logps/rejected": -0.27503517270088196, "loss": 0.4375968873500824, "loss/core": 0.4327124059200287, "loss/preference_sft": 0.27698129415512085, "loss/reference_anchor": 0.21652822196483612, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 2.270296812057495, "rewards/margins": 0.6087193489074707, "rewards/rejected": 1.6615772247314453, "step": 570 }, { "drift/chosen_abs": 0.2241770476102829, "drift/rejected_abs": 0.08824467658996582, "epoch": 0.5493849277439389, "grad_norm": 1.484375, "learning_rate": 8.72961989934668e-08, "logits/chosen": -2.2255711555480957, "logits/rejected": -2.238135814666748, "logps/chosen": -0.28202304244041443, "logps/rejected": -0.2808363735675812, "loss": 0.4496285319328308, "loss/core": 0.4446125626564026, "loss/preference_sft": 0.28202304244041443, "loss/reference_anchor": 0.22259919345378876, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 2.241278886795044, "rewards/margins": 1.3592052459716797, "rewards/rejected": 0.8820737600326538, "step": 575 }, { "drift/chosen_abs": 0.1400548666715622, "drift/rejected_abs": 0.10045614093542099, "epoch": 0.5541621879851905, "grad_norm": 9.0625, "learning_rate": 8.499226603037854e-08, "logits/chosen": -2.2342448234558105, "logits/rejected": -2.270289659500122, "logps/chosen": -0.29988688230514526, "logps/rejected": -0.301006555557251, "loss": 0.20430853962898254, "loss/core": 0.20168928802013397, "loss/preference_sft": 0.29988688230514526, "loss/reference_anchor": 0.1009727343916893, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 1.4003478288650513, "rewards/margins": 0.40323466062545776, "rewards/rejected": 0.9971132278442383, "step": 580 }, { "drift/chosen_abs": 0.22656722366809845, "drift/rejected_abs": 0.10197553783655167, "epoch": 0.5589394482264421, "grad_norm": 1.9921875, "learning_rate": 8.270337833983987e-08, "logits/chosen": -2.027678966522217, "logits/rejected": -2.1094918251037598, "logps/chosen": -0.30382272601127625, "logps/rejected": -0.29690489172935486, "loss": 0.5977300405502319, "loss/core": 0.5912034511566162, "loss/preference_sft": 0.30382272601127625, "loss/reference_anchor": 0.2959441840648651, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 2.2652218341827393, "rewards/margins": 1.2462141513824463, "rewards/rejected": 1.019007682800293, "step": 585 }, { "drift/chosen_abs": 0.21109525859355927, "drift/rejected_abs": 0.1344117820262909, "epoch": 0.5637167084676937, "grad_norm": 42.75, "learning_rate": 8.04303966789025e-08, "logits/chosen": -2.124232769012451, "logits/rejected": -2.143303632736206, "logps/chosen": -0.2748453617095947, "logps/rejected": -0.27825242280960083, "loss": 0.5149407982826233, "loss/core": 0.5092951655387878, "loss/preference_sft": 0.2748453617095947, "loss/reference_anchor": 0.25479501485824585, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": 2.109945297241211, "rewards/margins": 0.7668979167938232, "rewards/rejected": 1.3430473804473877, "step": 590 }, { "drift/chosen_abs": 0.21537485718727112, "drift/rejected_abs": 0.11827908456325531, "epoch": 0.5684939687089454, "grad_norm": 7.4375, "learning_rate": 7.817417582301098e-08, "logits/chosen": -1.8684651851654053, "logits/rejected": -1.888282060623169, "logps/chosen": -0.28441476821899414, "logps/rejected": -0.2889414429664612, "loss": 0.2612078785896301, "loss/core": 0.2580533027648926, "loss/preference_sft": 0.28441476821899414, "loss/reference_anchor": 0.1292877197265625, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 2.153564929962158, "rewards/margins": 0.9714028239250183, "rewards/rejected": 1.1821620464324951, "step": 595 }, { "drift/chosen_abs": 0.1943017989397049, "drift/rejected_abs": 0.12395434081554413, "epoch": 0.5732712289501971, "grad_norm": 37.25, "learning_rate": 7.59355642445566e-08, "logits/chosen": -2.2329204082489014, "logits/rejected": -2.143657922744751, "logps/chosen": -0.2619364559650421, "logps/rejected": -0.271796315908432, "loss": 0.325387179851532, "loss/core": 0.3216429650783539, "loss/preference_sft": 0.2619364559650421, "loss/reference_anchor": 0.16101622581481934, "rewards/accuracies": 0.875, "rewards/chosen": 1.9421056509017944, "rewards/margins": 0.7342923283576965, "rewards/rejected": 1.2078135013580322, "step": 600 }, { "drift/chosen_abs": 0.21480529010295868, "drift/rejected_abs": 0.09283845126628876, "epoch": 0.5780484891914487, "grad_norm": 226.0, "learning_rate": 7.37154037938015e-08, "logits/chosen": -2.0678582191467285, "logits/rejected": -2.1681721210479736, "logps/chosen": -0.32561880350112915, "logps/rejected": -0.33226823806762695, "loss": 0.3545982241630554, "loss/core": 0.3504359722137451, "loss/preference_sft": 0.32561880350112915, "loss/reference_anchor": 0.17555202543735504, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 2.146212339401245, "rewards/margins": 1.2209621667861938, "rewards/rejected": 0.925250232219696, "step": 605 }, { "drift/chosen_abs": 0.21430733799934387, "drift/rejected_abs": 0.11561570316553116, "epoch": 0.5828257494327004, "grad_norm": 6.875, "learning_rate": 7.151452938229325e-08, "logits/chosen": -2.048251152038574, "logits/rejected": -2.0495190620422363, "logps/chosen": -0.2833295464515686, "logps/rejected": -0.2934442460536957, "loss": 0.5116078853607178, "loss/core": 0.5059792399406433, "loss/preference_sft": 0.2833295464515686, "loss/reference_anchor": 0.2530977129936218, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 2.142573356628418, "rewards/margins": 0.9865756034851074, "rewards/rejected": 1.1559979915618896, "step": 610 }, { "drift/chosen_abs": 0.30491968989372253, "drift/rejected_abs": 0.16428294777870178, "epoch": 0.587603009673952, "grad_norm": 860.0, "learning_rate": 6.933376866888883e-08, "logits/chosen": -2.034879446029663, "logits/rejected": -2.1349658966064453, "logps/chosen": -0.2771604657173157, "logps/rejected": -0.3132755160331726, "loss": 1.1284635066986084, "loss/core": 1.1167380809783936, "loss/preference_sft": 0.2771604657173157, "loss/reference_anchor": 0.558564305305481, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 3.047480344772339, "rewards/margins": 1.4195116758346558, "rewards/rejected": 1.6279685497283936, "step": 615 }, { "drift/chosen_abs": 0.2592160105705261, "drift/rejected_abs": 0.14850470423698425, "epoch": 0.5923802699152036, "grad_norm": 788.0, "learning_rate": 6.717394174850605e-08, "logits/chosen": -2.144191265106201, "logits/rejected": -2.159964084625244, "logps/chosen": -0.28378695249557495, "logps/rejected": -0.2941509485244751, "loss": 0.699615478515625, "loss/core": 0.6921217441558838, "loss/preference_sft": 0.28378695249557495, "loss/reference_anchor": 0.3463062047958374, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 2.591275930404663, "rewards/margins": 1.1079087257385254, "rewards/rejected": 1.4833673238754272, "step": 620 }, { "drift/chosen_abs": 0.19440719485282898, "drift/rejected_abs": 0.1438429057598114, "epoch": 0.5971575301564552, "grad_norm": 7.3125, "learning_rate": 6.503586084371926e-08, "logits/chosen": -2.1661837100982666, "logits/rejected": -2.161391019821167, "logps/chosen": -0.2829047739505768, "logps/rejected": -0.30115213990211487, "loss": 0.34582698345184326, "loss/core": 0.3418407738208771, "loss/preference_sft": 0.2829047739505768, "loss/reference_anchor": 0.17102031409740448, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 1.9429868459701538, "rewards/margins": 0.5073825120925903, "rewards/rejected": 1.4356043338775635, "step": 625 }, { "drift/chosen_abs": 0.29011595249176025, "drift/rejected_abs": 0.13060837984085083, "epoch": 0.6019347903977069, "grad_norm": 35.5, "learning_rate": 6.29203299993155e-08, "logits/chosen": -2.108480215072632, "logits/rejected": -2.092172622680664, "logps/chosen": -0.30079469084739685, "logps/rejected": -0.3097718358039856, "loss": 0.8803378939628601, "loss/core": 0.8710153698921204, "loss/preference_sft": 0.30079469084739685, "loss/reference_anchor": 0.4360447824001312, "rewards/accuracies": 0.9750000238418579, "rewards/chosen": 2.9011597633361816, "rewards/margins": 1.9104152917861938, "rewards/rejected": 0.9907445907592773, "step": 630 }, { "drift/chosen_abs": 0.17126503586769104, "drift/rejected_abs": 0.13067471981048584, "epoch": 0.6067120506389586, "grad_norm": 50.75, "learning_rate": 6.082814477992656e-08, "logits/chosen": -2.184509754180908, "logits/rejected": -2.1129708290100098, "logps/chosen": -0.304170161485672, "logps/rejected": -0.3077109456062317, "loss": 0.464498370885849, "loss/core": 0.45929422974586487, "loss/preference_sft": 0.304170161485672, "loss/reference_anchor": 0.22978965938091278, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 1.7111921310424805, "rewards/margins": 0.4084002375602722, "rewards/rejected": 1.302791953086853, "step": 635 }, { "drift/chosen_abs": 0.1660601645708084, "drift/rejected_abs": 0.06357360631227493, "epoch": 0.6114893108802102, "grad_norm": 10.0, "learning_rate": 5.87600919708494e-08, "logits/chosen": -1.9939651489257812, "logits/rejected": -2.038660764694214, "logps/chosen": -0.28754812479019165, "logps/rejected": -0.2897412180900574, "loss": 0.26881492137908936, "loss/core": 0.2655784487724304, "loss/preference_sft": 0.28754812479019165, "loss/reference_anchor": 0.13306793570518494, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 1.6595392227172852, "rewards/margins": 1.0255340337753296, "rewards/rejected": 0.634005069732666, "step": 640 }, { "drift/chosen_abs": 0.20235376060009003, "drift/rejected_abs": 0.1837695837020874, "epoch": 0.6162665711214619, "grad_norm": 200.0, "learning_rate": 5.671694928216829e-08, "logits/chosen": -2.2157418727874756, "logits/rejected": -2.2581088542938232, "logps/chosen": -0.2847815155982971, "logps/rejected": -0.2754765748977661, "loss": 0.5128556489944458, "loss/core": 0.5072119832038879, "loss/preference_sft": 0.2847815155982971, "loss/reference_anchor": 0.25370898842811584, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 2.0232532024383545, "rewards/margins": 0.18848243355751038, "rewards/rejected": 1.8347707986831665, "step": 645 }, { "drift/chosen_abs": 0.31445202231407166, "drift/rejected_abs": 0.2099848985671997, "epoch": 0.6210438313627135, "grad_norm": 152.0, "learning_rate": 5.469948505629e-08, "logits/chosen": -2.0116679668426514, "logits/rejected": -2.073791980743408, "logps/chosen": -0.2909887731075287, "logps/rejected": -0.28746503591537476, "loss": 1.5114305019378662, "loss/core": 1.4958856105804443, "loss/preference_sft": 0.2909887731075287, "loss/reference_anchor": 0.748149573802948, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 3.143667697906494, "rewards/margins": 1.044376254081726, "rewards/rejected": 2.0992913246154785, "step": 650 }, { "drift/chosen_abs": 0.17652888596057892, "drift/rejected_abs": 0.12569592893123627, "epoch": 0.6258210916039652, "grad_norm": 157.0, "learning_rate": 5.270845797900168e-08, "logits/chosen": -2.215951919555664, "logits/rejected": -2.147303342819214, "logps/chosen": -0.2824100852012634, "logps/rejected": -0.2910049557685852, "loss": 0.5359405279159546, "loss/core": 0.5300716757774353, "loss/preference_sft": 0.2824100852012634, "loss/reference_anchor": 0.2652043402194977, "rewards/accuracies": 0.824999988079071, "rewards/chosen": 1.7618181705474854, "rewards/margins": 0.5078210234642029, "rewards/rejected": 1.2539972066879272, "step": 655 }, { "drift/chosen_abs": 0.18071475625038147, "drift/rejected_abs": 0.14076223969459534, "epoch": 0.6305983518452167, "grad_norm": 1.3203125, "learning_rate": 5.0744616794160104e-08, "logits/chosen": -2.0582504272460938, "logits/rejected": -2.1387999057769775, "logps/chosen": -0.2772466242313385, "logps/rejected": -0.28088733553886414, "loss": 0.2379394769668579, "loss/core": 0.2350325882434845, "loss/preference_sft": 0.2772466242313385, "loss/reference_anchor": 0.11762037128210068, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": 1.8062305450439453, "rewards/margins": 0.40019816160202026, "rewards/rejected": 1.4060323238372803, "step": 660 }, { "drift/chosen_abs": 0.22593644261360168, "drift/rejected_abs": 0.1269337683916092, "epoch": 0.6353756120864684, "grad_norm": 8.125, "learning_rate": 4.880870002211963e-08, "logits/chosen": -2.240903854370117, "logits/rejected": -2.2479407787323, "logps/chosen": -0.27797046303749084, "logps/rejected": -0.25145772099494934, "loss": 0.524042546749115, "loss/core": 0.5182952284812927, "loss/preference_sft": 0.27797046303749084, "loss/reference_anchor": 0.25957146286964417, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 2.2591378688812256, "rewards/margins": 0.9982420802116394, "rewards/rejected": 1.26089608669281, "step": 665 }, { "drift/chosen_abs": 0.13284215331077576, "drift/rejected_abs": 0.09541095048189163, "epoch": 0.64015287232772, "grad_norm": 1.09375, "learning_rate": 4.6901435682004996e-08, "logits/chosen": -2.236567974090576, "logits/rejected": -2.271984100341797, "logps/chosen": -0.29236721992492676, "logps/rejected": -0.2945176064968109, "loss": 0.12218450009822845, "loss/core": 0.12039539963006973, "loss/preference_sft": 0.29236721992492676, "loss/reference_anchor": 0.06021867319941521, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 1.3271570205688477, "rewards/margins": 0.3746449947357178, "rewards/rejected": 0.9525120854377747, "step": 670 }, { "drift/chosen_abs": 0.16276486217975616, "drift/rejected_abs": 0.1297510266304016, "epoch": 0.6449301325689717, "grad_norm": 27.875, "learning_rate": 4.502354101793314e-08, "logits/chosen": -2.358452320098877, "logits/rejected": -2.268037796020508, "logps/chosen": -0.279884934425354, "logps/rejected": -0.2925143837928772, "loss": 0.35353174805641174, "loss/core": 0.3494763970375061, "loss/preference_sft": 0.279884934425354, "loss/reference_anchor": 0.17477791011333466, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": 1.6270040273666382, "rewards/margins": 0.33251360058784485, "rewards/rejected": 1.2944905757904053, "step": 675 }, { "drift/chosen_abs": 0.31575721502304077, "drift/rejected_abs": 0.1288444995880127, "epoch": 0.6497073928102234, "grad_norm": 36.25, "learning_rate": 4.3175722229287034e-08, "logits/chosen": -2.114642381668091, "logits/rejected": -2.1079599857330322, "logps/chosen": -0.26992639899253845, "logps/rejected": -0.27495431900024414, "loss": 0.6401761174201965, "loss/core": 0.6332933306694031, "loss/preference_sft": 0.26992639899253845, "loss/reference_anchor": 0.3171465992927551, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 3.1569862365722656, "rewards/margins": 1.9471004009246826, "rewards/rejected": 1.209885835647583, "step": 680 }, { "drift/chosen_abs": 0.23132996261119843, "drift/rejected_abs": 0.23488974571228027, "epoch": 0.654484653051475, "grad_norm": 126.0, "learning_rate": 4.135867420514276e-08, "logits/chosen": -2.2158150672912598, "logits/rejected": -2.220139741897583, "logps/chosen": -0.29107457399368286, "logps/rejected": -0.26147180795669556, "loss": 0.934106707572937, "loss/core": 0.9242784380912781, "loss/preference_sft": 0.29107457399368286, "loss/reference_anchor": 0.4623136520385742, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": 2.3132710456848145, "rewards/margins": -0.03536492586135864, "rewards/rejected": 2.3486359119415283, "step": 685 }, { "drift/chosen_abs": 0.2907050848007202, "drift/rejected_abs": 0.21539370715618134, "epoch": 0.6592619132927267, "grad_norm": 704.0, "learning_rate": 3.957308026295035e-08, "logits/chosen": -2.0876173973083496, "logits/rejected": -2.159592390060425, "logps/chosen": -0.3214958608150482, "logps/rejected": -0.3213821053504944, "loss": 1.7343063354492188, "loss/core": 1.716496467590332, "loss/preference_sft": 0.3214958608150482, "loss/reference_anchor": 0.858340859413147, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 2.9058361053466797, "rewards/margins": 0.7544411420822144, "rewards/rejected": 2.151395082473755, "step": 690 }, { "drift/chosen_abs": 0.23619894683361053, "drift/rejected_abs": 0.11816170066595078, "epoch": 0.6640391735339782, "grad_norm": 40.25, "learning_rate": 3.7819611891566084e-08, "logits/chosen": -1.9863860607147217, "logits/rejected": -1.9883887767791748, "logps/chosen": -0.26810505986213684, "logps/rejected": -0.2822146713733673, "loss": 0.27285757660865784, "loss/core": 0.269618421792984, "loss/preference_sft": 0.26810505986213684, "loss/reference_anchor": 0.13514725863933563, "rewards/accuracies": 0.9375, "rewards/chosen": 2.361358880996704, "rewards/margins": 1.190822720527649, "rewards/rejected": 1.1705362796783447, "step": 695 }, { "drift/chosen_abs": 0.32739442586898804, "drift/rejected_abs": 0.16697341203689575, "epoch": 0.6688164337752299, "grad_norm": 45.25, "learning_rate": 3.609892849873286e-08, "logits/chosen": -2.238140106201172, "logits/rejected": -2.170215606689453, "logps/chosen": -0.28792768716812134, "logps/rejected": -0.26793545484542847, "loss": 1.2909228801727295, "loss/core": 1.2775663137435913, "loss/preference_sft": 0.28792768716812134, "loss/reference_anchor": 0.6390419006347656, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 3.2727417945861816, "rewards/margins": 1.6051795482635498, "rewards/rejected": 1.6675622463226318, "step": 700 }, { "drift/chosen_abs": 0.1326175481081009, "drift/rejected_abs": 0.05240592360496521, "epoch": 0.6735936940164815, "grad_norm": 0.875, "learning_rate": 3.4411677163103894e-08, "logits/chosen": -2.1258556842803955, "logits/rejected": -2.1329469680786133, "logps/chosen": -0.3264055550098419, "logps/rejected": -0.31279516220092773, "loss": 0.1313130259513855, "loss/core": 0.1293625682592392, "loss/preference_sft": 0.3264055550098419, "loss/reference_anchor": 0.06488193571567535, "rewards/accuracies": 0.824999988079071, "rewards/chosen": 1.3231408596038818, "rewards/margins": 0.7995508313179016, "rewards/rejected": 0.5235900282859802, "step": 705 }, { "drift/chosen_abs": 0.24739420413970947, "drift/rejected_abs": 0.08645138889551163, "epoch": 0.6783709542577332, "grad_norm": 39.0, "learning_rate": 3.2758492390902945e-08, "logits/chosen": -1.9009885787963867, "logits/rejected": -1.9612804651260376, "logps/chosen": -0.2778227627277374, "logps/rejected": -0.28797098994255066, "loss": 0.3639562726020813, "loss/core": 0.359793096780777, "loss/preference_sft": 0.2778227627277374, "loss/reference_anchor": 0.18037569522857666, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 2.4713692665100098, "rewards/margins": 1.64273202419281, "rewards/rejected": 0.828637421131134, "step": 710 }, { "drift/chosen_abs": 0.23490512371063232, "drift/rejected_abs": 0.0935138463973999, "epoch": 0.6831482144989849, "grad_norm": 10.5, "learning_rate": 3.11399958773126e-08, "logits/chosen": -2.0637762546539307, "logits/rejected": -2.1122887134552, "logps/chosen": -0.2840803563594818, "logps/rejected": -0.2814682424068451, "loss": 0.23643600940704346, "loss/core": 0.23352782428264618, "loss/preference_sft": 0.2840803563594818, "loss/reference_anchor": 0.11700389534235, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 2.348367214202881, "rewards/margins": 1.4155561923980713, "rewards/rejected": 0.9328109622001648, "step": 715 }, { "drift/chosen_abs": 0.25520801544189453, "drift/rejected_abs": 0.11677595227956772, "epoch": 0.6879254747402365, "grad_norm": 5.0625, "learning_rate": 2.9556796272679972e-08, "logits/chosen": -2.1001739501953125, "logits/rejected": -2.1356372833251953, "logps/chosen": -0.2884894907474518, "logps/rejected": -0.31645768880844116, "loss": 0.6001358032226562, "loss/core": 0.593619167804718, "loss/preference_sft": 0.2884894907474518, "loss/reference_anchor": 0.29698267579078674, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 2.5518627166748047, "rewards/margins": 1.5054526329040527, "rewards/rejected": 1.0464102029800415, "step": 720 }, { "drift/chosen_abs": 0.11836670339107513, "drift/rejected_abs": 0.11379599571228027, "epoch": 0.6927027349814882, "grad_norm": 2.453125, "learning_rate": 2.8009488953628215e-08, "logits/chosen": -2.0836520195007324, "logits/rejected": -2.0259056091308594, "logps/chosen": -0.28411412239074707, "logps/rejected": -0.2758258581161499, "loss": 0.23348887264728546, "loss/core": 0.2306121587753296, "loss/preference_sft": 0.28411412239074707, "loss/reference_anchor": 0.11542298644781113, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": 1.1802574396133423, "rewards/margins": 0.044753752648830414, "rewards/rejected": 1.1355037689208984, "step": 725 }, { "drift/chosen_abs": 0.280209481716156, "drift/rejected_abs": 0.10185222327709198, "epoch": 0.6974799952227397, "grad_norm": 37.25, "learning_rate": 2.649865579915976e-08, "logits/chosen": -2.075974941253662, "logits/rejected": -2.050661563873291, "logps/chosen": -0.3032965660095215, "logps/rejected": -0.31960076093673706, "loss": 0.8421915769577026, "loss/core": 0.8332451581954956, "loss/preference_sft": 0.3032965660095215, "loss/reference_anchor": 0.41699153184890747, "rewards/accuracies": 0.949999988079071, "rewards/chosen": 2.8020949363708496, "rewards/margins": 1.8411537408828735, "rewards/rejected": 0.9609411954879761, "step": 730 }, { "drift/chosen_abs": 0.2798532247543335, "drift/rejected_abs": 0.11052944511175156, "epoch": 0.7022572554639914, "grad_norm": 49.75, "learning_rate": 2.5024864971835507e-08, "logits/chosen": -2.1936328411102295, "logits/rejected": -2.1866257190704346, "logps/chosen": -0.266052782535553, "logps/rejected": -0.27340036630630493, "loss": 0.5987396240234375, "loss/core": 0.5922771692276001, "loss/preference_sft": 0.266052782535553, "loss/reference_anchor": 0.29651200771331787, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 2.7965667247772217, "rewards/margins": 1.6948391199111938, "rewards/rejected": 1.1017276048660278, "step": 735 }, { "drift/chosen_abs": 0.21841701865196228, "drift/rejected_abs": 0.16449300944805145, "epoch": 0.707034515705243, "grad_norm": 41.0, "learning_rate": 2.3588670704111997e-08, "logits/chosen": -1.9267356395721436, "logits/rejected": -1.848046898841858, "logps/chosen": -0.2917543947696686, "logps/rejected": -0.3047102689743042, "loss": 0.6575824022293091, "loss/core": 0.6504920125007629, "loss/preference_sft": 0.2917543947696686, "loss/reference_anchor": 0.3253471255302429, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 2.181687831878662, "rewards/margins": 0.5402703881263733, "rewards/rejected": 1.6414177417755127, "step": 740 }, { "drift/chosen_abs": 0.2311057597398758, "drift/rejected_abs": 0.12377341091632843, "epoch": 0.7118117759464947, "grad_norm": 2.3125, "learning_rate": 2.219061308991721e-08, "logits/chosen": -2.2026872634887695, "logits/rejected": -2.2262043952941895, "logps/chosen": -0.2942965626716614, "logps/rejected": -0.2818772792816162, "loss": 0.640469491481781, "loss/core": 0.6335400342941284, "loss/preference_sft": 0.2942965626716614, "loss/reference_anchor": 0.3170434832572937, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 2.3100028038024902, "rewards/margins": 1.0736254453659058, "rewards/rejected": 1.2363771200180054, "step": 745 }, { "drift/chosen_abs": 0.2225804626941681, "drift/rejected_abs": 0.14012092351913452, "epoch": 0.7165890361877463, "grad_norm": 147.0, "learning_rate": 2.0831217881543557e-08, "logits/chosen": -2.250375270843506, "logits/rejected": -2.1884655952453613, "logps/chosen": -0.27962955832481384, "logps/rejected": -0.30086082220077515, "loss": 0.2941736876964569, "loss/core": 0.29070359468460083, "loss/preference_sft": 0.27962955832481384, "loss/reference_anchor": 0.14554303884506226, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 2.221367120742798, "rewards/margins": 0.8238778114318848, "rewards/rejected": 1.397489309310913, "step": 750 }, { "drift/chosen_abs": 0.35864901542663574, "drift/rejected_abs": 0.1930883824825287, "epoch": 0.721366296428998, "grad_norm": 2.34375, "learning_rate": 1.951099629193366e-08, "logits/chosen": -2.1636476516723633, "logits/rejected": -2.140977144241333, "logps/chosen": -0.2771832346916199, "logps/rejected": -0.28425145149230957, "loss": 1.235163927078247, "loss/core": 1.2223742008209229, "loss/preference_sft": 0.2771832346916199, "loss/reference_anchor": 0.6117671132087708, "rewards/accuracies": 0.862500011920929, "rewards/chosen": 3.585937976837158, "rewards/margins": 1.6583614349365234, "rewards/rejected": 1.9275766611099243, "step": 755 }, { "drift/chosen_abs": 0.3538215160369873, "drift/rejected_abs": 0.19870851933956146, "epoch": 0.7261435566702497, "grad_norm": 213.0, "learning_rate": 1.823044480243431e-08, "logits/chosen": -2.004826784133911, "logits/rejected": -2.0009334087371826, "logps/chosen": -0.30821096897125244, "logps/rejected": -0.35763052105903625, "loss": 1.0943807363510132, "loss/core": 1.0829265117645264, "loss/preference_sft": 0.30821096897125244, "loss/reference_anchor": 0.5418857932090759, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": 3.537405014038086, "rewards/margins": 1.5527830123901367, "rewards/rejected": 1.9846217632293701, "step": 760 }, { "drift/chosen_abs": 0.16350261867046356, "drift/rejected_abs": 0.08384877443313599, "epoch": 0.7309208169115012, "grad_norm": 3.046875, "learning_rate": 1.699004497608994e-08, "logits/chosen": -2.3181560039520264, "logits/rejected": -2.325047016143799, "logps/chosen": -0.2780446410179138, "logps/rejected": -0.26890766620635986, "loss": 0.15251176059246063, "loss/core": 0.15044714510440826, "loss/preference_sft": 0.2780446410179138, "loss/reference_anchor": 0.07542603462934494, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": 1.6326892375946045, "rewards/margins": 0.7961629629135132, "rewards/rejected": 0.8365263938903809, "step": 765 }, { "drift/chosen_abs": 0.22837817668914795, "drift/rejected_abs": 0.07515065371990204, "epoch": 0.7356980771527529, "grad_norm": 364.0, "learning_rate": 1.5790263276546658e-08, "logits/chosen": -2.214590549468994, "logits/rejected": -2.287729263305664, "logps/chosen": -0.2873011529445648, "logps/rejected": -0.27970749139785767, "loss": 0.502562940120697, "loss/core": 0.4970094561576843, "loss/preference_sft": 0.2873011529445648, "loss/reference_anchor": 0.24894189834594727, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 2.281993865966797, "rewards/margins": 1.531829833984375, "rewards/rejected": 0.7501639127731323, "step": 770 }, { "drift/chosen_abs": 0.1840764731168747, "drift/rejected_abs": 0.14043626189231873, "epoch": 0.7404753373940045, "grad_norm": 1.5859375, "learning_rate": 1.4631550892634126e-08, "logits/chosen": -2.0965075492858887, "logits/rejected": -1.9921375513076782, "logps/chosen": -0.2745542526245117, "logps/rejected": -0.26717105507850647, "loss": 0.3951452076435089, "loss/core": 0.3906872868537903, "loss/preference_sft": 0.2745542526245117, "loss/reference_anchor": 0.19543880224227905, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": 1.8390769958496094, "rewards/margins": 0.4357059895992279, "rewards/rejected": 1.4033708572387695, "step": 775 }, { "drift/chosen_abs": 0.2997458875179291, "drift/rejected_abs": 0.19411607086658478, "epoch": 0.7452525976352562, "grad_norm": 464.0, "learning_rate": 1.3514343568692132e-08, "logits/chosen": -2.240328788757324, "logits/rejected": -2.2070069313049316, "logps/chosen": -0.2926557660102844, "logps/rejected": -0.2933287024497986, "loss": 1.8442484140396118, "loss/core": 1.8254058361053467, "loss/preference_sft": 0.2926557660102844, "loss/reference_anchor": 0.9128621816635132, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 2.995630979537964, "rewards/margins": 1.0562885999679565, "rewards/rejected": 1.9393424987792969, "step": 780 }, { "drift/chosen_abs": 0.1899985373020172, "drift/rejected_abs": 0.07741059362888336, "epoch": 0.7500298578765078, "grad_norm": 3.65625, "learning_rate": 1.2439061440704724e-08, "logits/chosen": -2.209710121154785, "logits/rejected": -2.2208352088928223, "logps/chosen": -0.28208765387535095, "logps/rejected": -0.28293755650520325, "loss": 0.6761240363121033, "loss/core": 0.6688669323921204, "loss/preference_sft": 0.28208765387535095, "loss/reference_anchor": 0.3346477448940277, "rewards/accuracies": 0.875, "rewards/chosen": 1.8997882604599, "rewards/margins": 1.1262468099594116, "rewards/rejected": 0.773541271686554, "step": 785 }, { "drift/chosen_abs": 0.3311009407043457, "drift/rejected_abs": 0.1309339702129364, "epoch": 0.7548071181177595, "grad_norm": 173.0, "learning_rate": 1.1406108878304468e-08, "logits/chosen": -2.0325357913970947, "logits/rejected": -2.026935577392578, "logps/chosen": -0.27717894315719604, "logps/rejected": -0.27080798149108887, "loss": 0.6806409955024719, "loss/core": 0.6733458638191223, "loss/preference_sft": 0.27717894315719604, "loss/reference_anchor": 0.33703652024269104, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": 3.310328960418701, "rewards/margins": 2.0351784229278564, "rewards/rejected": 1.2751507759094238, "step": 790 }, { "drift/chosen_abs": 0.3741660416126251, "drift/rejected_abs": 0.0975070595741272, "epoch": 0.7595843783590112, "grad_norm": 350.0, "learning_rate": 1.0415874332705381e-08, "logits/chosen": -2.150209903717041, "logits/rejected": -2.0983715057373047, "logps/chosen": -0.27431005239486694, "logps/rejected": -0.2787257730960846, "loss": 1.4984773397445679, "loss/core": 1.4830867052078247, "loss/preference_sft": 0.27431005239486694, "loss/reference_anchor": 0.7421107888221741, "rewards/accuracies": 0.875, "rewards/chosen": 3.738903760910034, "rewards/margins": 2.7708230018615723, "rewards/rejected": 0.9680808186531067, "step": 795 }, { "drift/chosen_abs": 0.2510735094547272, "drift/rejected_abs": 0.1462600976228714, "epoch": 0.7643616386002627, "grad_norm": 18.625, "learning_rate": 9.468730190622484e-09, "logits/chosen": -2.4673285484313965, "logits/rejected": -2.4519200325012207, "logps/chosen": -0.29721131920814514, "logps/rejected": -0.3075062036514282, "loss": 1.2491406202316284, "loss/core": 1.23618483543396, "loss/preference_sft": 0.29721131920814514, "loss/reference_anchor": 0.6180749535560608, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 2.509737730026245, "rewards/margins": 1.0481786727905273, "rewards/rejected": 1.4615590572357178, "step": 800 }, { "drift/chosen_abs": 0.09586870670318604, "drift/rejected_abs": 0.0631202682852745, "epoch": 0.7691388988415144, "grad_norm": 5.0, "learning_rate": 8.565032634232194e-09, "logits/chosen": -2.117633104324341, "logits/rejected": -2.0666775703430176, "logps/chosen": -0.30181869864463806, "logps/rejected": -0.3010576367378235, "loss": 0.04290010407567024, "loss/core": 0.04187611863017082, "loss/preference_sft": 0.30181869864463806, "loss/reference_anchor": 0.02101728692650795, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": 0.9572784304618835, "rewards/margins": 0.32730334997177124, "rewards/rejected": 0.6299751400947571, "step": 805 }, { "drift/chosen_abs": 0.18182532489299774, "drift/rejected_abs": 0.16493472456932068, "epoch": 0.773916159082766, "grad_norm": 90.5, "learning_rate": 7.70512150722702e-09, "logits/chosen": -2.0990633964538574, "logits/rejected": -2.0376296043395996, "logps/chosen": -0.26729169487953186, "logps/rejected": -0.26321226358413696, "loss": 0.49664896726608276, "loss/core": 0.491199254989624, "loss/preference_sft": 0.26729169487953186, "loss/reference_anchor": 0.24575798213481903, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": 1.8167064189910889, "rewards/margins": 0.16888391971588135, "rewards/rejected": 1.647822380065918, "step": 810 }, { "drift/chosen_abs": 0.24560102820396423, "drift/rejected_abs": 0.10801911354064941, "epoch": 0.7786934193240177, "grad_norm": 1.7109375, "learning_rate": 6.8893201870139915e-09, "logits/chosen": -2.091200113296509, "logits/rejected": -2.27951979637146, "logps/chosen": -0.31718164682388306, "logps/rejected": -0.3068375885486603, "loss": 0.5775214433670044, "loss/core": 0.5711715817451477, "loss/preference_sft": 0.31718164682388306, "loss/reference_anchor": 0.2857758402824402, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 2.4512245655059814, "rewards/margins": 1.3882179260253906, "rewards/rejected": 1.0630064010620117, "step": 815 }, { "drift/chosen_abs": 0.26311054825782776, "drift/rejected_abs": 0.20147815346717834, "epoch": 0.7834706795652693, "grad_norm": 30.375, "learning_rate": 6.117935463105808e-09, "logits/chosen": -1.8164457082748413, "logits/rejected": -1.7971694469451904, "logps/chosen": -0.279045045375824, "logps/rejected": -0.33144164085388184, "loss": 0.9571006894111633, "loss/core": 0.947068989276886, "loss/preference_sft": 0.279045045375824, "loss/reference_anchor": 0.4736693501472473, "rewards/accuracies": 0.7875000238418579, "rewards/chosen": 2.6302883625030518, "rewards/margins": 0.6288776397705078, "rewards/rejected": 2.001410961151123, "step": 820 }, { "drift/chosen_abs": 0.3537200093269348, "drift/rejected_abs": 0.16787850856781006, "epoch": 0.788247939806521, "grad_norm": 14.1875, "learning_rate": 5.391257421749826e-09, "logits/chosen": -2.1316933631896973, "logits/rejected": -2.1172828674316406, "logps/chosen": -0.29390478134155273, "logps/rejected": -0.2766962945461273, "loss": 1.5460574626922607, "loss/core": 1.530153512954712, "loss/preference_sft": 0.29390478134155273, "loss/reference_anchor": 0.7657959461212158, "rewards/accuracies": 0.9375, "rewards/chosen": 3.5372002124786377, "rewards/margins": 1.859610915184021, "rewards/rejected": 1.6775890588760376, "step": 825 }, { "drift/chosen_abs": 0.27988651394844055, "drift/rejected_abs": 0.12321482598781586, "epoch": 0.7930252000477725, "grad_norm": 612.0, "learning_rate": 4.709559336838462e-09, "logits/chosen": -1.8963066339492798, "logits/rejected": -1.9476807117462158, "logps/chosen": -0.30415278673171997, "logps/rejected": -0.3033929169178009, "loss": 0.9329975247383118, "loss/core": 0.9231513142585754, "loss/preference_sft": 0.30415278673171997, "loss/reference_anchor": 0.4618992209434509, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 2.798447370529175, "rewards/margins": 1.5701082944869995, "rewards/rejected": 1.2283390760421753, "step": 830 }, { "drift/chosen_abs": 0.16968384385108948, "drift/rejected_abs": 0.1050095334649086, "epoch": 0.7978024602890242, "grad_norm": 1.7578125, "learning_rate": 4.073097567142025e-09, "logits/chosen": -2.2337470054626465, "logits/rejected": -2.3164491653442383, "logps/chosen": -0.2991805672645569, "logps/rejected": -0.28817689418792725, "loss": 0.22842451930046082, "loss/core": 0.2255687713623047, "loss/preference_sft": 0.2991805672645569, "loss/reference_anchor": 0.11287200450897217, "rewards/accuracies": 0.875, "rewards/chosen": 1.696568250656128, "rewards/margins": 0.6477723121643066, "rewards/rejected": 1.0487959384918213, "step": 835 }, { "drift/chosen_abs": 0.2029610425233841, "drift/rejected_abs": 0.15892741084098816, "epoch": 0.8025797205302759, "grad_norm": 9.4375, "learning_rate": 3.482111459902695e-09, "logits/chosen": -2.029393196105957, "logits/rejected": -2.1248087882995605, "logps/chosen": -0.28962570428848267, "logps/rejected": -0.3038334250450134, "loss": 0.6708376407623291, "loss/core": 0.6636188626289368, "loss/preference_sft": 0.28962570428848267, "loss/reference_anchor": 0.3319765329360962, "rewards/accuracies": 0.949999988079071, "rewards/chosen": 2.0296101570129395, "rewards/margins": 0.4415357708930969, "rewards/rejected": 1.5880745649337769, "step": 840 }, { "drift/chosen_abs": 0.4587179124355316, "drift/rejected_abs": 0.22257618606090546, "epoch": 0.8073569807715275, "grad_norm": 22.875, "learning_rate": 2.9368232608258797e-09, "logits/chosen": -2.164417028427124, "logits/rejected": -2.176283121109009, "logps/chosen": -0.27492496371269226, "logps/rejected": -0.27344006299972534, "loss": 2.1201024055480957, "loss/core": 2.098555564880371, "loss/preference_sft": 0.27492496371269226, "loss/reference_anchor": 1.0498454570770264, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 4.5870513916015625, "rewards/margins": 2.364668846130371, "rewards/rejected": 2.222382068634033, "step": 845 }, { "drift/chosen_abs": 0.17442527413368225, "drift/rejected_abs": 0.06823588907718658, "epoch": 0.8121342410127792, "grad_norm": 0.87109375, "learning_rate": 2.4374380305025866e-09, "logits/chosen": -2.2421109676361084, "logits/rejected": -2.2991902828216553, "logps/chosen": -0.25456729531288147, "logps/rejected": -0.25157222151756287, "loss": 0.12556889653205872, "loss/core": 0.12381688505411148, "loss/preference_sft": 0.25456729531288147, "loss/reference_anchor": 0.06214389204978943, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 1.7427303791046143, "rewards/margins": 1.0707417726516724, "rewards/rejected": 0.6719885468482971, "step": 850 }, { "drift/chosen_abs": 0.2316814661026001, "drift/rejected_abs": 0.18873625993728638, "epoch": 0.8169115012540308, "grad_norm": 49.25, "learning_rate": 1.984143567294594e-09, "logits/chosen": -2.0805776119232178, "logits/rejected": -2.073974609375, "logps/chosen": -0.2674004137516022, "logps/rejected": -0.29779064655303955, "loss": 0.6567851305007935, "loss/core": 0.6497505307197571, "loss/preference_sft": 0.2674004137516022, "loss/reference_anchor": 0.3249875009059906, "rewards/accuracies": 0.875, "rewards/chosen": 2.3135294914245605, "rewards/margins": 0.4317246377468109, "rewards/rejected": 1.8818048238754272, "step": 855 }, { "drift/chosen_abs": 0.19219297170639038, "drift/rejected_abs": 0.1073886901140213, "epoch": 0.8216887614952825, "grad_norm": 1.2421875, "learning_rate": 1.577110336711096e-09, "logits/chosen": -2.1786136627197266, "logits/rejected": -2.251077175140381, "logps/chosen": -0.29990866780281067, "logps/rejected": -0.30773764848709106, "loss": 0.4442000985145569, "loss/core": 0.4392046332359314, "loss/preference_sft": 0.29990866780281067, "loss/reference_anchor": 0.21978160738945007, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 1.9197685718536377, "rewards/margins": 0.8469489812850952, "rewards/rejected": 1.072819471359253, "step": 860 }, { "drift/chosen_abs": 0.26136937737464905, "drift/rejected_abs": 0.1216052770614624, "epoch": 0.826466021736534, "grad_norm": 3.8125, "learning_rate": 1.2164914073037048e-09, "logits/chosen": -2.1374754905700684, "logits/rejected": -2.2176711559295654, "logps/chosen": -0.29837021231651306, "logps/rejected": -0.282470166683197, "loss": 1.20570707321167, "loss/core": 1.1931687593460083, "loss/preference_sft": 0.29837021231651306, "loss/reference_anchor": 0.5970777273178101, "rewards/accuracies": 0.9125000238418579, "rewards/chosen": 2.6126089096069336, "rewards/margins": 1.4006534814834595, "rewards/rejected": 1.2119553089141846, "step": 865 }, { "drift/chosen_abs": 0.4436754286289215, "drift/rejected_abs": 0.2094762623310089, "epoch": 0.8312432819777857, "grad_norm": 46.75, "learning_rate": 9.024223931035357e-10, "logits/chosen": -1.9862560033798218, "logits/rejected": -1.9510629177093506, "logps/chosen": -0.29855862259864807, "logps/rejected": -0.28159067034721375, "loss": 1.7128210067749023, "loss/core": 1.6952579021453857, "loss/preference_sft": 0.29855862259864807, "loss/reference_anchor": 0.8482988476753235, "rewards/accuracies": 0.887499988079071, "rewards/chosen": 4.433295726776123, "rewards/margins": 2.3404412269592285, "rewards/rejected": 2.0928549766540527, "step": 870 }, { "drift/chosen_abs": 0.19628901779651642, "drift/rejected_abs": 0.1381283849477768, "epoch": 0.8360205422190374, "grad_norm": 0.75390625, "learning_rate": 6.350214026223516e-10, "logits/chosen": -2.086601972579956, "logits/rejected": -2.0887794494628906, "logps/chosen": -0.3021940588951111, "logps/rejected": -0.30490565299987793, "loss": 0.4931362569332123, "loss/core": 0.48765283823013306, "loss/preference_sft": 0.3021940588951111, "loss/reference_anchor": 0.24395246803760529, "rewards/accuracies": 0.875, "rewards/chosen": 1.9610573053359985, "rewards/margins": 0.5812469720840454, "rewards/rejected": 1.379810094833374, "step": 875 }, { "drift/chosen_abs": 0.37091922760009766, "drift/rejected_abs": 0.14499905705451965, "epoch": 0.840797802460289, "grad_norm": 0.443359375, "learning_rate": 4.143889944367429e-10, "logits/chosen": -2.001990795135498, "logits/rejected": -1.9710228443145752, "logps/chosen": -0.28516069054603577, "logps/rejected": -0.30990806221961975, "loss": 1.4451124668121338, "loss/core": 1.4302270412445068, "loss/preference_sft": 0.28516069054603577, "loss/reference_anchor": 0.7157606482505798, "rewards/accuracies": 0.9375, "rewards/chosen": 3.7089836597442627, "rewards/margins": 2.2644705772399902, "rewards/rejected": 1.444512963294983, "step": 880 }, { "drift/chosen_abs": 0.15534690022468567, "drift/rejected_abs": 0.07884477078914642, "epoch": 0.8455750627015407, "grad_norm": 14.1875, "learning_rate": 2.406081393722531e-10, "logits/chosen": -2.0966742038726807, "logits/rejected": -2.1267499923706055, "logps/chosen": -0.2981413006782532, "logps/rejected": -0.30681678652763367, "loss": 0.11275926977396011, "loss/core": 0.11104929447174072, "loss/preference_sft": 0.2981413006782532, "loss/reference_anchor": 0.05568493530154228, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 1.5524650812149048, "rewards/margins": 0.7652949094772339, "rewards/rejected": 0.7871701121330261, "step": 885 }, { "drift/chosen_abs": 0.18543264269828796, "drift/rejected_abs": 0.16110344231128693, "epoch": 0.8503523229427923, "grad_norm": 14.9375, "learning_rate": 1.1374418930135133e-10, "logits/chosen": -2.1319258213043213, "logits/rejected": -2.1853280067443848, "logps/chosen": -0.26988840103149414, "logps/rejected": -0.2897631525993347, "loss": 0.5226936340332031, "loss/core": 0.5169836282730103, "loss/preference_sft": 0.26988840103149414, "loss/reference_anchor": 0.25851255655288696, "rewards/accuracies": 0.925000011920929, "rewards/chosen": 1.8515974283218384, "rewards/margins": 0.24080824851989746, "rewards/rejected": 1.6107892990112305, "step": 890 }, { "drift/chosen_abs": 0.21447238326072693, "drift/rejected_abs": 0.09845264256000519, "epoch": 0.855129583184044, "grad_norm": 176.0, "learning_rate": 3.3844852567285756e-11, "logits/chosen": -2.092803478240967, "logits/rejected": -2.0520870685577393, "logps/chosen": -0.289115846157074, "logps/rejected": -0.2914557456970215, "loss": 0.28112271428108215, "loss/core": 0.2777610719203949, "loss/preference_sft": 0.289115846157074, "loss/reference_anchor": 0.1391705721616745, "rewards/accuracies": 0.949999988079071, "rewards/chosen": 2.144585132598877, "rewards/margins": 1.1624013185501099, "rewards/rejected": 0.9821839332580566, "step": 895 }, { "drift/chosen_abs": 0.29047515988349915, "drift/rejected_abs": 0.14344081282615662, "epoch": 0.8599068434252956, "grad_norm": 89.0, "learning_rate": 9.401760429905703e-13, "logits/chosen": -2.0498125553131104, "logits/rejected": -2.014761447906494, "logps/chosen": -0.26901915669441223, "logps/rejected": -0.2722063958644867, "loss": 0.7836966514587402, "loss/core": 0.7753987312316895, "loss/preference_sft": 0.26901915669441223, "loss/reference_anchor": 0.3879950940608978, "rewards/accuracies": 0.8999999761581421, "rewards/chosen": 2.9047515392303467, "rewards/margins": 1.4703437089920044, "rewards/rejected": 1.4344079494476318, "step": 900 }, { "epoch": 0.8599068434252956, "step": 900, "total_flos": 0.0, "train_loss": 0.688900715245141, "train_runtime": 7064.5608, "train_samples_per_second": 2.038, "train_steps_per_second": 0.127 } ], "logging_steps": 5, "max_steps": 900, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 900, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 1, "trial_name": null, "trial_params": null }