{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 3.0, "eval_steps": 50, "global_step": 189, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 2.555654156208038, "epoch": 0.08, "grad_norm": 35.3809700012207, "learning_rate": 2.8571428571428573e-06, "logits/chosen": 0.4110352631849171, "logits/rejected": 0.4300117739250047, "logps/chosen": -157.81439809799195, "logps/rejected": -150.4315113067627, "loss": 0.6903757572174072, "mean_token_accuracy": 0.45491820499300956, "num_tokens": 63280.0, "rewards/accuracies": 0.54375, "rewards/chosen": 0.018655257727368736, "rewards/margins": 0.006082923361100256, "rewards/rejected": 0.012572333973366767, "step": 5 }, { "entropy": 2.5844572484493256, "epoch": 0.16, "grad_norm": 47.283817291259766, "learning_rate": 4.984280524733107e-06, "logits/chosen": 0.2089756903127898, "logits/rejected": 0.3923359114864852, "logps/chosen": -160.2436939239502, "logps/rejected": -154.7825647354126, "loss": 0.7087126731872558, "mean_token_accuracy": 0.4676915630698204, "num_tokens": 128751.0, "rewards/accuracies": 0.46875, "rewards/chosen": 0.026459120609797538, "rewards/margins": -0.018515753094106913, "rewards/rejected": 0.04497487433254719, "step": 10 }, { "entropy": 2.4940366342663767, "epoch": 0.24, "grad_norm": 48.20133972167969, "learning_rate": 4.809698831278217e-06, "logits/chosen": 0.12422276096059184, "logits/rejected": 0.18387425940175633, "logps/chosen": -151.31794481277467, "logps/rejected": -163.5261468887329, "loss": 0.6959157466888428, "mean_token_accuracy": 0.47235521450638773, "num_tokens": 194142.0, "rewards/accuracies": 0.46875, "rewards/chosen": -0.059232240472920236, "rewards/margins": 0.021671066922135652, "rewards/rejected": -0.0809033086989075, "step": 15 }, { "entropy": 2.5471011281013487, "epoch": 0.32, "grad_norm": 42.294281005859375, "learning_rate": 4.454578706170075e-06, "logits/chosen": -0.030133471365837695, "logits/rejected": 0.08451241878365641, "logps/chosen": -135.41445970535278, "logps/rejected": -135.83921966552734, "loss": 0.6954083442687988, "mean_token_accuracy": 0.4549576163291931, "num_tokens": 254871.0, "rewards/accuracies": 0.5375, "rewards/chosen": -0.18437330080196263, "rewards/margins": 0.07001338726840914, "rewards/rejected": -0.2543866881169379, "step": 20 }, { "entropy": 2.4626115679740908, "epoch": 0.4, "grad_norm": 53.21565628051758, "learning_rate": 3.946678240449515e-06, "logits/chosen": 0.035210923156354317, "logits/rejected": 0.03131556176291432, "logps/chosen": -147.02334337234498, "logps/rejected": -139.0251603126526, "loss": 0.7144542694091797, "mean_token_accuracy": 0.4505583204329014, "num_tokens": 317752.0, "rewards/accuracies": 0.55, "rewards/chosen": -0.3056703276000917, "rewards/margins": 0.030420188792049885, "rewards/rejected": -0.33609051471576096, "step": 25 }, { "entropy": 2.418185669183731, "epoch": 0.48, "grad_norm": 50.63364791870117, "learning_rate": 3.3256976548879183e-06, "logits/chosen": -0.0063577626599184795, "logits/rejected": 0.0660789555792278, "logps/chosen": -151.3002492904663, "logps/rejected": -150.41238498687744, "loss": 0.6920054435729981, "mean_token_accuracy": 0.445500810444355, "num_tokens": 387452.0, "rewards/accuracies": 0.55625, "rewards/chosen": -0.2962045251857489, "rewards/margins": 0.08783619347959756, "rewards/rejected": -0.38404072066769, "step": 30 }, { "entropy": 2.42596016228199, "epoch": 0.56, "grad_norm": 47.31837844848633, "learning_rate": 2.6401761180929798e-06, "logits/chosen": -0.04082900087497934, "logits/rejected": 0.015806176234233794, "logps/chosen": -182.25081090927125, "logps/rejected": -175.18973140716554, "loss": 0.6894076824188232, "mean_token_accuracy": 0.46841963976621626, "num_tokens": 454873.0, "rewards/accuracies": 0.55625, "rewards/chosen": -0.30482858400791885, "rewards/margins": 0.07829219745472074, "rewards/rejected": -0.38312078421004114, "step": 35 }, { "entropy": 2.421294018626213, "epoch": 0.64, "grad_norm": 47.72428894042969, "learning_rate": 1.9436976651092143e-06, "logits/chosen": 0.04491766159482387, "logits/rejected": 0.15141158319763592, "logps/chosen": -160.55729579925537, "logps/rejected": -161.91398558616638, "loss": 0.7262070178985596, "mean_token_accuracy": 0.4616738587617874, "num_tokens": 518527.0, "rewards/accuracies": 0.51875, "rewards/chosen": -0.2627937063574791, "rewards/margins": 0.037597383465617897, "rewards/rejected": -0.30039109364151956, "step": 40 }, { "entropy": 2.3493838876485826, "epoch": 0.72, "grad_norm": 41.70436096191406, "learning_rate": 1.2907027822369006e-06, "logits/chosen": 0.06111884454416239, "logits/rejected": 0.1077471313778626, "logps/chosen": -155.73900985717773, "logps/rejected": -162.23499221801757, "loss": 0.6567366123199463, "mean_token_accuracy": 0.47065152823925016, "num_tokens": 586496.0, "rewards/accuracies": 0.5875, "rewards/chosen": -0.15574295134283603, "rewards/margins": 0.16263325293548406, "rewards/rejected": -0.31837619938887657, "step": 45 }, { "entropy": 2.3660752564668655, "epoch": 0.8, "grad_norm": 46.26735305786133, "learning_rate": 7.322330470336314e-07, "logits/chosen": 0.04797605992282007, "logits/rejected": 0.137719508348569, "logps/chosen": -165.56337423324584, "logps/rejected": -165.80605907440184, "loss": 0.6880872249603271, "mean_token_accuracy": 0.4618512228131294, "num_tokens": 659345.0, "rewards/accuracies": 0.51875, "rewards/chosen": -0.13928775684908032, "rewards/margins": 0.09893286619335413, "rewards/rejected": -0.238220629747957, "step": 50 }, { "epoch": 0.8, "eval_entropy": 2.4305524230003357, "eval_logits/chosen": 0.060791561005096514, "eval_logits/rejected": 0.1157722840661163, "eval_logps/chosen": -163.22620516967774, "eval_logps/rejected": -155.69468914794922, "eval_loss": 0.699152946472168, "eval_mean_token_accuracy": 0.4591814261674881, "eval_num_tokens": 659345.0, "eval_rewards/accuracies": 0.523, "eval_rewards/chosen": -0.17783968531899155, "eval_rewards/margins": 0.07608089716732502, "eval_rewards/rejected": -0.2539205798432231, "eval_runtime": 204.6975, "eval_samples_per_second": 4.885, "eval_steps_per_second": 1.221, "step": 50 }, { "entropy": 2.3940737187862395, "epoch": 0.88, "grad_norm": 48.0695915222168, "learning_rate": 3.119414452281158e-07, "logits/chosen": 0.07112344903443206, "logits/rejected": 0.19535127089682655, "logps/chosen": -150.24068050384523, "logps/rejected": -145.48797540664674, "loss": 0.697087287902832, "mean_token_accuracy": 0.4701634831726551, "num_tokens": 731475.0, "rewards/accuracies": 0.56875, "rewards/chosen": -0.14963094238191843, "rewards/margins": 0.08578414842486382, "rewards/rejected": -0.2354150922037661, "step": 55 }, { "entropy": 2.357463392615318, "epoch": 0.96, "grad_norm": 48.10399627685547, "learning_rate": 6.268021954544095e-08, "logits/chosen": 0.01995007363434443, "logits/rejected": 0.16687794622622143, "logps/chosen": -158.93942432403566, "logps/rejected": -166.66946430206298, "loss": 0.6701779842376709, "mean_token_accuracy": 0.4689980365335941, "num_tokens": 797757.0, "rewards/accuracies": 0.5375, "rewards/chosen": -0.1631853505037725, "rewards/margins": 0.13551276298239828, "rewards/rejected": -0.2986981191672385, "step": 60 }, { "epoch": 1.0, "eval_entropy": 2.431350471973419, "eval_logits/chosen": 0.058027013522972216, "eval_logits/rejected": 0.11281541237759458, "eval_logps/chosen": -163.3362089691162, "eval_logps/rejected": -155.8263526611328, "eval_loss": 0.6985306143760681, "eval_mean_token_accuracy": 0.45935997557640074, "eval_num_tokens": 829784.0, "eval_rewards/accuracies": 0.529, "eval_rewards/chosen": -0.188840083822608, "eval_rewards/margins": 0.07824680726230145, "eval_rewards/rejected": -0.26708688925206664, "eval_runtime": 204.726, "eval_samples_per_second": 4.885, "eval_steps_per_second": 1.221, "step": 63 }, { "entropy": 2.402912601828575, "epoch": 1.032, "grad_norm": 32.69980239868164, "learning_rate": 4.184239109116393e-06, "logits/chosen": 0.05448504114962113, "logits/rejected": 0.09865282891809334, "logps/chosen": -146.60927033424377, "logps/rejected": -172.2928113937378, "loss": 0.3366573750972748, "mean_token_accuracy": 0.4740424118936062, "num_tokens": 27180.0, "rewards/accuracies": 0.859375, "rewards/chosen": 0.5033185752108693, "rewards/margins": 1.529684765264392, "rewards/rejected": -1.0263662077486515, "step": 65 }, { "entropy": 2.3992972910404204, "epoch": 1.112, "grad_norm": 17.76884651184082, "learning_rate": 4.006586590948141e-06, "logits/chosen": 0.0026862717521520412, "logits/rejected": 0.13353262495170462, "logps/chosen": -153.0885206222534, "logps/rejected": -156.96604356765747, "loss": 0.3243739604949951, "mean_token_accuracy": 0.47915840819478034, "num_tokens": 86611.0, "rewards/accuracies": 0.8625, "rewards/chosen": 0.4796073419041932, "rewards/margins": 1.6072665184736252, "rewards/rejected": -1.1276591904461384, "step": 70 }, { "entropy": 2.3780136823654177, "epoch": 1.192, "grad_norm": 22.48740005493164, "learning_rate": 3.81608040719339e-06, "logits/chosen": -0.11707000613882948, "logits/rejected": -0.06640926333257077, "logps/chosen": -153.8634229660034, "logps/rejected": -163.86640148162843, "loss": 0.35583436489105225, "mean_token_accuracy": 0.4692669503390789, "num_tokens": 153056.0, "rewards/accuracies": 0.83125, "rewards/chosen": 0.23908968223258853, "rewards/margins": 1.5137944724410772, "rewards/rejected": -1.2747048027813435, "step": 75 }, { "entropy": 2.310171273350716, "epoch": 1.272, "grad_norm": 19.922534942626953, "learning_rate": 3.6143458894413463e-06, "logits/chosen": -0.3582654699758253, "logits/rejected": -0.2914110555931979, "logps/chosen": -131.75142288208008, "logps/rejected": -160.25545768737794, "loss": 0.33200573921203613, "mean_token_accuracy": 0.4669229932129383, "num_tokens": 215920.0, "rewards/accuracies": 0.8875, "rewards/chosen": 0.15461167003959417, "rewards/margins": 1.571430729702115, "rewards/rejected": -1.4168190509080887, "step": 80 }, { "entropy": 2.211333890259266, "epoch": 1.3519999999999999, "grad_norm": 26.273008346557617, "learning_rate": 3.403104165467883e-06, "logits/chosen": -0.4359116041083054, "logits/rejected": -0.3527264562702821, "logps/chosen": -140.573939037323, "logps/rejected": -165.2755883216858, "loss": 0.3167553186416626, "mean_token_accuracy": 0.49101626574993135, "num_tokens": 287127.0, "rewards/accuracies": 0.86875, "rewards/chosen": 0.22212664941325783, "rewards/margins": 1.8355195850133896, "rewards/rejected": -1.6133929178118707, "step": 85 }, { "entropy": 2.284930866956711, "epoch": 1.432, "grad_norm": 23.699182510375977, "learning_rate": 3.184157475180208e-06, "logits/chosen": -0.49555035845434314, "logits/rejected": -0.4411274731208847, "logps/chosen": -159.97724952697754, "logps/rejected": -158.18697261810303, "loss": 0.31732380390167236, "mean_token_accuracy": 0.46273171752691267, "num_tokens": 354068.0, "rewards/accuracies": 0.9, "rewards/chosen": 0.2169143119826913, "rewards/margins": 1.6415132291615009, "rewards/rejected": -1.4245989315211773, "step": 90 }, { "entropy": 2.185201385617256, "epoch": 1.512, "grad_norm": 19.721302032470703, "learning_rate": 2.9593737945414264e-06, "logits/chosen": -0.6350667553105876, "logits/rejected": -0.6234260760266512, "logps/chosen": -140.15507984161377, "logps/rejected": -165.66675672531127, "loss": 0.3336572885513306, "mean_token_accuracy": 0.46677022203803065, "num_tokens": 421426.0, "rewards/accuracies": 0.8375, "rewards/chosen": 0.1235144454985857, "rewards/margins": 1.6951029762625693, "rewards/rejected": -1.5715885123237967, "step": 95 }, { "entropy": 2.116330775618553, "epoch": 1.592, "grad_norm": 33.37752151489258, "learning_rate": 2.730670898658255e-06, "logits/chosen": -0.8269758479064379, "logits/rejected": -0.6836210629893789, "logps/chosen": -157.39115772247314, "logps/rejected": -160.14211597442628, "loss": 0.33512029647827146, "mean_token_accuracy": 0.4874211989343166, "num_tokens": 489806.0, "rewards/accuracies": 0.8875, "rewards/chosen": 0.32783279549330474, "rewards/margins": 1.7466752111911774, "rewards/rejected": -1.4188424333930016, "step": 100 }, { "epoch": 1.592, "eval_entropy": 2.1636376428604125, "eval_logits/chosen": -0.8136097147525514, "eval_logits/rejected": -0.7600604176985916, "eval_logps/chosen": -167.09777592468262, "eval_logps/rejected": -159.95339458465577, "eval_loss": 0.7532036304473877, "eval_mean_token_accuracy": 0.4550632082223892, "eval_num_tokens": 489806.0, "eval_rewards/accuracies": 0.531, "eval_rewards/chosen": -0.5649967772588134, "eval_rewards/margins": 0.1147943808734417, "eval_rewards/rejected": -0.679791161686182, "eval_runtime": 204.516, "eval_samples_per_second": 4.89, "eval_steps_per_second": 1.222, "step": 100 }, { "entropy": 2.1376398682594298, "epoch": 1.6720000000000002, "grad_norm": 26.6827335357666, "learning_rate": 2.5e-06, "logits/chosen": -0.817711521022764, "logits/rejected": -0.7502540023514636, "logps/chosen": -166.91539459228517, "logps/rejected": -191.0643165588379, "loss": 0.27990891933441164, "mean_token_accuracy": 0.4785373486578465, "num_tokens": 67320.0, "rewards/accuracies": 0.9375, "rewards/chosen": 0.4409050527960062, "rewards/margins": 2.258123181760311, "rewards/rejected": -1.8172180943191052, "step": 105 }, { "entropy": 2.059819537401199, "epoch": 1.752, "grad_norm": 24.675567626953125, "learning_rate": 2.269329101341745e-06, "logits/chosen": -0.9049248824738976, "logits/rejected": -0.8284383619431989, "logps/chosen": -159.55292291641234, "logps/rejected": -177.96484870910643, "loss": 0.28675858974456786, "mean_token_accuracy": 0.4875997893512249, "num_tokens": 132140.0, "rewards/accuracies": 0.925, "rewards/chosen": 0.37930642515420915, "rewards/margins": 1.9427161723375321, "rewards/rejected": -1.5634097740054131, "step": 110 }, { "entropy": 2.037626123428345, "epoch": 1.8319999999999999, "grad_norm": 21.444379806518555, "learning_rate": 2.040626205458574e-06, "logits/chosen": -1.010849450295792, "logits/rejected": -0.8793864952798423, "logps/chosen": -151.68567123413087, "logps/rejected": -171.75303897857665, "loss": 0.31492087841033933, "mean_token_accuracy": 0.48049742802977563, "num_tokens": 201358.0, "rewards/accuracies": 0.8875, "rewards/chosen": 0.22566586136817932, "rewards/margins": 1.7971878163516521, "rewards/rejected": -1.5715219512581826, "step": 115 }, { "entropy": 2.0510205030441284, "epoch": 1.912, "grad_norm": 23.6982364654541, "learning_rate": 1.8158425248197931e-06, "logits/chosen": -0.9916353547588466, "logits/rejected": -0.919767900124741, "logps/chosen": -154.16109809875488, "logps/rejected": -166.89081039428712, "loss": 0.3056188106536865, "mean_token_accuracy": 0.4722383268177509, "num_tokens": 264721.0, "rewards/accuracies": 0.86875, "rewards/chosen": 0.2006932887248695, "rewards/margins": 1.8468371406197548, "rewards/rejected": -1.646143864095211, "step": 120 }, { "entropy": 2.093482795357704, "epoch": 1.992, "grad_norm": 22.745805740356445, "learning_rate": 1.5968958345321178e-06, "logits/chosen": -1.0079677581836826, "logits/rejected": -0.9303146415112165, "logps/chosen": -148.35024213790894, "logps/rejected": -164.5137134552002, "loss": 0.3322633981704712, "mean_token_accuracy": 0.4708759218454361, "num_tokens": 334037.0, "rewards/accuracies": 0.85625, "rewards/chosen": 0.11466053407639265, "rewards/margins": 1.6517433917149902, "rewards/rejected": -1.5370828822255134, "step": 125 }, { "entropy": 2.0945689843760595, "epoch": 2.064, "grad_norm": 10.98022174835205, "learning_rate": 1.3856541105586545e-06, "logits/chosen": -0.9942241856066296, "logits/rejected": -0.9094278407875448, "logps/chosen": -140.99659379323325, "logps/rejected": -170.61128277248807, "loss": 0.1790446400642395, "mean_token_accuracy": 0.49307963914341396, "num_tokens": 390815.0, "rewards/accuracies": 0.9583333333333334, "rewards/chosen": 0.6758623485349946, "rewards/margins": 2.894124209880829, "rewards/rejected": -2.218261867761612, "step": 130 }, { "entropy": 2.0529139041900635, "epoch": 2.144, "grad_norm": 10.028863906860352, "learning_rate": 1.1839195928066101e-06, "logits/chosen": -1.0788186523834689, "logits/rejected": -0.986635527035572, "logps/chosen": -145.5455855369568, "logps/rejected": -172.8044556617737, "loss": 0.12198150157928467, "mean_token_accuracy": 0.49735122323036196, "num_tokens": 457256.0, "rewards/accuracies": 0.975, "rewards/chosen": 0.6768257994204759, "rewards/margins": 3.0055406376719476, "rewards/rejected": -2.3287148490548133, "step": 135 }, { "entropy": 2.014680004119873, "epoch": 2.224, "grad_norm": 6.895854473114014, "learning_rate": 9.934134090518593e-07, "logits/chosen": -1.1362325910319455, "logits/rejected": -1.002460196026479, "logps/chosen": -141.88460431098937, "logps/rejected": -159.63373432159423, "loss": 0.14334821701049805, "mean_token_accuracy": 0.48404414057731626, "num_tokens": 519814.0, "rewards/accuracies": 0.95, "rewards/chosen": 0.5280852797441185, "rewards/margins": 2.968889817595482, "rewards/rejected": -2.4408045306801798, "step": 140 }, { "entropy": 1.9911637425422668, "epoch": 2.304, "grad_norm": 10.900385856628418, "learning_rate": 8.157608908836071e-07, "logits/chosen": -1.240284110529506, "logits/rejected": -1.2038341543285929, "logps/chosen": -149.32998390197753, "logps/rejected": -179.72271556854247, "loss": 0.11892527341842651, "mean_token_accuracy": 0.48943382054567336, "num_tokens": 583559.0, "rewards/accuracies": 0.975, "rewards/chosen": 0.5228322677314281, "rewards/margins": 3.2153540045022964, "rewards/rejected": -2.6925217270851136, "step": 145 }, { "entropy": 2.0109089225530625, "epoch": 2.384, "grad_norm": 7.562666893005371, "learning_rate": 6.524777069483526e-07, "logits/chosen": -1.362585639730851, "logits/rejected": -1.3277683060910546, "logps/chosen": -152.4582862854004, "logps/rejected": -190.31861305236816, "loss": 0.1071157455444336, "mean_token_accuracy": 0.47375648468732834, "num_tokens": 655280.0, "rewards/accuracies": 0.95, "rewards/chosen": 0.5572835557162762, "rewards/margins": 3.580769953131676, "rewards/rejected": -3.023486441373825, "step": 150 }, { "epoch": 2.384, "eval_entropy": 1.9984020476341247, "eval_logits/chosen": -1.3867654543550485, "eval_logits/rejected": -1.3457294671252336, "eval_logps/chosen": -172.3030450744629, "eval_logps/rejected": -165.6812739868164, "eval_loss": 0.7880498766899109, "eval_mean_token_accuracy": 0.451040216088295, "eval_num_tokens": 655280.0, "eval_rewards/accuracies": 0.54, "eval_rewards/chosen": -1.0855237049460411, "eval_rewards/margins": 0.1670554026067257, "eval_rewards/rejected": -1.25257910490036, "eval_runtime": 203.3449, "eval_samples_per_second": 4.918, "eval_steps_per_second": 1.229, "step": 150 }, { "entropy": 1.898311933875084, "epoch": 2.464, "grad_norm": 11.360427856445312, "learning_rate": 5.049569317994013e-07, "logits/chosen": -1.4353495696293097, "logits/rejected": -1.3758243692230172, "logps/chosen": -141.70478200912476, "logps/rejected": -200.1671936035156, "loss": 0.09740959405899048, "mean_token_accuracy": 0.4936802975833416, "num_tokens": 724110.0, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4263562995940447, "rewards/margins": 3.59362336397171, "rewards/rejected": -3.167267033457756, "step": 155 }, { "entropy": 1.939386433362961, "epoch": 2.544, "grad_norm": 8.742157936096191, "learning_rate": 3.7445716067596506e-07, "logits/chosen": -1.4550549474115178, "logits/rejected": -1.3327657359030232, "logps/chosen": -132.01672496795655, "logps/rejected": -159.5728401184082, "loss": 0.10442214012145996, "mean_token_accuracy": 0.4859817087650299, "num_tokens": 787960.0, "rewards/accuracies": 0.98125, "rewards/chosen": 0.42371090203523637, "rewards/margins": 3.1901376724243162, "rewards/rejected": -2.7664267748594282, "step": 160 }, { "entropy": 1.9298288524150848, "epoch": 2.624, "grad_norm": 6.683835029602051, "learning_rate": 2.620917716123444e-07, "logits/chosen": -1.5218572998191655, "logits/rejected": -1.5028220084321073, "logps/chosen": -146.9026556968689, "logps/rejected": -182.4629114151001, "loss": 0.11852377653121948, "mean_token_accuracy": 0.5008164420723915, "num_tokens": 854381.0, "rewards/accuracies": 0.975, "rewards/chosen": 0.340854674577713, "rewards/margins": 3.3918783754110335, "rewards/rejected": -3.051023706793785, "step": 165 }, { "entropy": 1.9614687770605088, "epoch": 2.7039999999999997, "grad_norm": 8.654135704040527, "learning_rate": 1.6881942648911077e-07, "logits/chosen": -1.483899302043358, "logits/rejected": -1.3984594015444671, "logps/chosen": -165.00297966003419, "logps/rejected": -223.27304649353027, "loss": 0.10529448986053466, "mean_token_accuracy": 0.4777096025645733, "num_tokens": 922218.0, "rewards/accuracies": 0.9625, "rewards/chosen": 0.1868226437829435, "rewards/margins": 3.6259077370166777, "rewards/rejected": -3.439085066318512, "step": 170 }, { "entropy": 1.947239425778389, "epoch": 2.784, "grad_norm": 8.482812881469727, "learning_rate": 9.54358920679524e-08, "logits/chosen": -1.5538378778015716, "logits/rejected": -1.4374772630805093, "logps/chosen": -167.4766321182251, "logps/rejected": -185.17562103271484, "loss": 0.10844930410385131, "mean_token_accuracy": 0.48532758429646494, "num_tokens": 989301.0, "rewards/accuracies": 0.98125, "rewards/chosen": 0.5600280098617076, "rewards/margins": 3.5826878786087035, "rewards/rejected": -3.0226599007844923, "step": 175 }, { "entropy": 1.9497412502765656, "epoch": 2.864, "grad_norm": 10.068187713623047, "learning_rate": 4.256725079024554e-08, "logits/chosen": -1.5250048523452793, "logits/rejected": -1.4418669213263424, "logps/chosen": -154.15428905487062, "logps/rejected": -163.1813151359558, "loss": 0.13129655122756959, "mean_token_accuracy": 0.4707398295402527, "num_tokens": 1057139.0, "rewards/accuracies": 0.9625, "rewards/chosen": 0.4407920534722507, "rewards/margins": 3.0125378251075743, "rewards/rejected": -2.571745750308037, "step": 180 }, { "entropy": 1.9340084820985795, "epoch": 2.944, "grad_norm": 9.49740219116211, "learning_rate": 1.0664559262413831e-08, "logits/chosen": -1.512207703275473, "logits/rejected": -1.4001704843220182, "logps/chosen": -157.45920839309693, "logps/rejected": -180.69428844451903, "loss": 0.09854952096939087, "mean_token_accuracy": 0.4828268110752106, "num_tokens": 1120692.0, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4773704446852207, "rewards/margins": 3.379485607147217, "rewards/rejected": -2.9021151691675184, "step": 185 }, { "epoch": 3.0, "eval_entropy": 1.9640341634750367, "eval_logits/chosen": -1.5042375842896538, "eval_logits/rejected": -1.4667329044378787, "eval_logps/chosen": -173.94541304016113, "eval_logps/rejected": -167.3245940551758, "eval_loss": 0.8192874193191528, "eval_mean_token_accuracy": 0.44932303857803346, "eval_num_tokens": 1169762.0, "eval_rewards/accuracies": 0.534, "eval_rewards/chosen": -1.2497604206800461, "eval_rewards/margins": 0.16715064680576325, "eval_rewards/rejected": -1.4169110633730888, "eval_runtime": 203.5561, "eval_samples_per_second": 4.913, "eval_steps_per_second": 1.228, "step": 189 } ], "logging_steps": 5, "max_steps": 189, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 100, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 9840760918671360.0, "train_batch_size": 4, "trial_name": null, "trial_params": null }