[ { "entropy": 2.5553497850894926, "epoch": 0.08, "grad_norm": 357.8926696777344, "learning_rate": 2.8571428571428573e-06, "logits/chosen": 0.41187580737484436, "logits/rejected": 0.43087167594886183, "logps/chosen": -157.8165241241455, "logps/rejected": -150.432616519928, "loss": 0.6890408515930175, "mean_token_accuracy": 0.45499045923352244, "num_tokens": 63280.0, "rewards/accuracies": 0.55625, "rewards/chosen": 0.18442693948745728, "rewards/margins": 0.05980904102325439, "rewards/rejected": 0.12461789846420288, "step": 5 }, { "entropy": 2.585687577724457, "epoch": 0.16, "grad_norm": 550.5374145507812, "learning_rate": 4.984280524733107e-06, "logits/chosen": 0.23282768258015127, "logits/rejected": 0.41657135452577226, "logps/chosen": -160.46632223129274, "logps/rejected": -155.05524663925172, "loss": 1.0951576232910156, "mean_token_accuracy": 0.4666588671505451, "num_tokens": 128751.0, "rewards/accuracies": 0.46875, "rewards/chosen": 0.04196357727050781, "rewards/margins": -0.13510316610336304, "rewards/rejected": 0.17706674337387085, "step": 10 }, { "entropy": 2.4887936890125273, "epoch": 0.24, "grad_norm": 544.36474609375, "learning_rate": 4.809698831278217e-06, "logits/chosen": 0.19960332682723014, "logits/rejected": 0.25714549020005323, "logps/chosen": -151.403657245636, "logps/rejected": -163.51016159057616, "loss": 1.1309956550598144, "mean_token_accuracy": 0.4729401096701622, "num_tokens": 194142.0, "rewards/accuracies": 0.45625, "rewards/chosen": -0.6780350089073182, "rewards/margins": 0.11501268744468689, "rewards/rejected": -0.793047696352005, "step": 15 }, { "entropy": 2.543038326501846, "epoch": 0.32, "grad_norm": 545.773193359375, "learning_rate": 4.454578706170075e-06, "logits/chosen": 0.10757563983449289, "logits/rejected": 0.2191312620805499, "logps/chosen": -134.6160714149475, "logps/rejected": -134.7640838623047, "loss": 1.2686697959899902, "mean_token_accuracy": 0.46390472874045374, "num_tokens": 254871.0, "rewards/accuracies": 0.54375, "rewards/chosen": -1.045345139503479, "rewards/margins": 0.4233867168426514, "rewards/rejected": -1.4687318563461305, "step": 20 }, { "entropy": 2.4839668542146685, "epoch": 0.4, "grad_norm": 609.0315551757812, "learning_rate": 3.946678240449515e-06, "logits/chosen": 0.23401674829751978, "logits/rejected": 0.22746947777638224, "logps/chosen": -144.78962602615357, "logps/rejected": -136.76443700790406, "loss": 1.4144909858703614, "mean_token_accuracy": 0.45985892340540885, "num_tokens": 317752.0, "rewards/accuracies": 0.5625, "rewards/chosen": -0.8229869723320007, "rewards/margins": 0.27719623446464536, "rewards/rejected": -1.1001832067966462, "step": 25 }, { "entropy": 2.4549559235572813, "epoch": 0.48, "grad_norm": 685.6503295898438, "learning_rate": 3.3256976548879183e-06, "logits/chosen": 0.21252182170691483, "logits/rejected": 0.27063995156819315, "logps/chosen": -148.57344274520875, "logps/rejected": -146.81006059646606, "loss": 1.6434017181396485, "mean_token_accuracy": 0.454254624247551, "num_tokens": 387452.0, "rewards/accuracies": 0.4625, "rewards/chosen": -0.23523921966552735, "rewards/margins": 0.0028411030769348146, "rewards/rejected": -0.23808032274246216, "step": 30 }, { "entropy": 2.4848766714334487, "epoch": 0.56, "grad_norm": 572.0255737304688, "learning_rate": 2.6401761180929798e-06, "logits/chosen": 0.1604402064572174, "logits/rejected": 0.23192453424270135, "logps/chosen": -178.91495656967163, "logps/rejected": -171.79455051422119, "loss": 1.2930749893188476, "mean_token_accuracy": 0.4774269789457321, "num_tokens": 454873.0, "rewards/accuracies": 0.54375, "rewards/chosen": 0.2875680088996887, "rewards/margins": 0.7235915064811707, "rewards/rejected": -0.43602349758148196, "step": 35 }, { "entropy": 2.4956657856702806, "epoch": 0.64, "grad_norm": 581.42724609375, "learning_rate": 1.9436976651092143e-06, "logits/chosen": 0.26337065405985355, "logits/rejected": 0.36300255439029444, "logps/chosen": -157.99055194854736, "logps/rejected": -159.0982545375824, "loss": 1.5171399116516113, "mean_token_accuracy": 0.46507507339119913, "num_tokens": 518527.0, "rewards/accuracies": 0.5, "rewards/chosen": -0.061191481351852414, "rewards/margins": 0.1269888162612915, "rewards/rejected": -0.18818029761314392, "step": 40 }, { "entropy": 2.434966567158699, "epoch": 0.72, "grad_norm": 432.56536865234375, "learning_rate": 1.2907027822369006e-06, "logits/chosen": 0.268132887364752, "logits/rejected": 0.30894473259910554, "logps/chosen": -154.1576229095459, "logps/rejected": -159.85538330078126, "loss": 1.3509400367736817, "mean_token_accuracy": 0.4740308240056038, "num_tokens": 586496.0, "rewards/accuracies": 0.5375, "rewards/chosen": 0.02395761013031006, "rewards/margins": 0.8281095027923584, "rewards/rejected": -0.8041518926620483, "step": 45 }, { "entropy": 2.4690693795681, "epoch": 0.8, "grad_norm": 504.9461364746094, "learning_rate": 7.322330470336314e-07, "logits/chosen": 0.27772643533489566, "logits/rejected": 0.36052606081661537, "logps/chosen": -164.17142915725708, "logps/rejected": -163.73542156219483, "loss": 1.4861845970153809, "mean_token_accuracy": 0.4653610520064831, "num_tokens": 659345.0, "rewards/accuracies": 0.55625, "rewards/chosen": -0.0009298324584960938, "rewards/margins": 0.31063854694366455, "rewards/rejected": -0.31156837940216064, "step": 50 }, { "epoch": 0.8, "eval_entropy": 2.536505832195282, "eval_logits/chosen": 0.2893901140152919, "eval_logits/rejected": 0.34482142702810936, "eval_logps/chosen": -161.61729994201661, "eval_logps/rejected": -153.7386490020752, "eval_loss": 1.3951599597930908, "eval_mean_token_accuracy": 0.46117462730407716, "eval_num_tokens": 659345.0, "eval_rewards/accuracies": 0.539, "eval_rewards/chosen": -0.16949110031127929, "eval_rewards/margins": 0.413674391746521, "eval_rewards/rejected": -0.5831654920578003, "eval_runtime": 204.2784, "eval_samples_per_second": 4.895, "eval_steps_per_second": 1.224, "step": 50 }, { "entropy": 2.5048249810934067, "epoch": 0.88, "grad_norm": 538.51953125, "learning_rate": 3.119414452281158e-07, "logits/chosen": 0.31241473497619054, "logits/rejected": 0.4336116565754852, "logps/chosen": -148.8257155418396, "logps/rejected": -143.5335810661316, "loss": 1.5545385360717774, "mean_token_accuracy": 0.47073024958372117, "num_tokens": 731475.0, "rewards/accuracies": 0.53125, "rewards/chosen": -0.08134242296218872, "rewards/margins": 0.31841338872909547, "rewards/rejected": -0.39975581169128416, "step": 55 }, { "entropy": 2.4619424283504485, "epoch": 0.96, "grad_norm": 439.4546813964844, "learning_rate": 6.268021954544095e-08, "logits/chosen": 0.26771219837052634, "logits/rejected": 0.3957730213546686, "logps/chosen": -157.09008331298827, "logps/rejected": -164.03927259445192, "loss": 1.2014739990234375, "mean_token_accuracy": 0.47436425387859343, "num_tokens": 797757.0, "rewards/accuracies": 0.525, "rewards/chosen": 0.21749011874198915, "rewards/margins": 0.5742806613445282, "rewards/rejected": -0.35679054260253906, "step": 60 }, { "epoch": 1.0, "eval_entropy": 2.5392660574913024, "eval_logits/chosen": 0.2875409764336183, "eval_logits/rejected": 0.34302489192485985, "eval_logps/chosen": -161.68841091918947, "eval_logps/rejected": -153.80732011413573, "eval_loss": 1.3833612203598022, "eval_mean_token_accuracy": 0.46109312522411344, "eval_num_tokens": 829784.0, "eval_rewards/accuracies": 0.543, "eval_rewards/chosen": -0.24060248374938964, "eval_rewards/margins": 0.4112340784072876, "eval_rewards/rejected": -0.6518365621566773, "eval_runtime": 204.0071, "eval_samples_per_second": 4.902, "eval_steps_per_second": 1.225, "step": 63 }, { "loss": 0.27623340487480164, "grad_norm": 189.56698608398438, "learning_rate": 4.184239109116393e-06, "entropy": 2.507671430706978, "num_tokens": 27180.0, "logits/chosen": 0.2979938850081893, "logits/rejected": 0.3261501650298202, "mean_token_accuracy": 0.47298500686883926, "rewards/chosen": 5.079042822122574, "rewards/rejected": -6.503820419311523, "rewards/accuracies": 0.828125, "rewards/margins": 11.58286327123642, "logps/chosen": -146.56341791152954, "logps/rejected": -168.53296971321106, "epoch": 1.032, "step": 65 }, { "loss": 0.13215208053588867, "grad_norm": 113.09912872314453, "learning_rate": 4.006586590948141e-06, "entropy": 2.5133699655532835, "num_tokens": 86611.0, "logits/chosen": 0.25969656721433304, "logits/rejected": 0.39782895997815093, "mean_token_accuracy": 0.4806541882455349, "rewards/chosen": 5.613885009288788, "rewards/rejected": -7.231478703022003, "rewards/accuracies": 0.93125, "rewards/margins": 12.845363640785218, "logps/chosen": -152.27070779800414, "logps/rejected": -152.92093172073365, "epoch": 1.112, "step": 70 }, { "loss": 0.13926982879638672, "grad_norm": 164.6415252685547, "learning_rate": 3.81608040719339e-06, "entropy": 2.5407466888427734, "num_tokens": 153056.0, "logits/chosen": 0.3012379954587533, "logits/rejected": 0.35636349940869577, "mean_token_accuracy": 0.4698187731206417, "rewards/chosen": 4.025047600269318, "rewards/rejected": -7.252596193552018, "rewards/accuracies": 0.925, "rewards/margins": 11.277643758058549, "logps/chosen": -152.22927570343018, "logps/rejected": -158.37194900512696, "epoch": 1.192, "step": 75 }, { "loss": 0.20328567028045655, "grad_norm": 77.16290283203125, "learning_rate": 3.6143458894413463e-06, "entropy": 2.5421448230743406, "num_tokens": 215920.0, "logits/chosen": 0.2523993960550924, "logits/rejected": 0.3098906828719798, "mean_token_accuracy": 0.4690698154270649, "rewards/chosen": 5.010193508863449, "rewards/rejected": -5.472190934419632, "rewards/accuracies": 0.9, "rewards/margins": 10.482384419441223, "logps/chosen": -128.28734722137452, "logps/rejected": -151.55945873260498, "epoch": 1.272, "step": 80 }, { "loss": 0.24072544574737548, "grad_norm": 181.0267791748047, "learning_rate": 3.403104165467883e-06, "entropy": 2.462119910120964, "num_tokens": 287127.0, "logits/chosen": 0.2615454777932041, "logits/rejected": 0.34690817078532066, "mean_token_accuracy": 0.49424040541052816, "rewards/chosen": 6.286368477344513, "rewards/rejected": -7.02618248462677, "rewards/accuracies": 0.89375, "rewards/margins": 13.312550961971283, "logps/chosen": -136.50883808135987, "logps/rejected": -156.16784238815308, "epoch": 1.3519999999999999, "step": 85 }, { "loss": 0.2306227684020996, "grad_norm": 128.99142456054688, "learning_rate": 3.184157475180208e-06, "entropy": 2.5757258504629137, "num_tokens": 354068.0, "logits/chosen": 0.26197732623753106, "logits/rejected": 0.3165610941969709, "mean_token_accuracy": 0.46578485444188117, "rewards/chosen": 5.876923865079879, "rewards/rejected": -4.679693168401718, "rewards/accuracies": 0.89375, "rewards/margins": 10.556617093086242, "logps/chosen": -156.26946783065796, "logps/rejected": -148.62067685127258, "epoch": 1.432, "step": 90 }, { "loss": 0.18702551126480102, "grad_norm": 99.29806518554688, "learning_rate": 2.9593737945414264e-06, "entropy": 2.4905955940485, "num_tokens": 421426.0, "logits/chosen": 0.18172540683269275, "logits/rejected": 0.17394183194436158, "mean_token_accuracy": 0.4736903429031372, "rewards/chosen": 5.762694102525711, "rewards/rejected": -6.312865370512009, "rewards/accuracies": 0.8875, "rewards/margins": 12.075559437274933, "logps/chosen": -135.62753200531006, "logps/rejected": -156.26373701095582, "epoch": 1.512, "step": 95 }, { "loss": 0.21797585487365723, "grad_norm": 277.9349670410156, "learning_rate": 2.730670898658255e-06, "entropy": 2.4252312004566194, "num_tokens": 489806.0, "logits/chosen": -0.04065577566546924, "logits/rejected": 0.10009592183059253, "mean_token_accuracy": 0.490592048317194, "rewards/chosen": 6.565640062093735, "rewards/rejected": -6.080355882644653, "rewards/accuracies": 0.89375, "rewards/margins": 12.645995873212815, "logps/chosen": -154.10384283065795, "logps/rejected": -152.03404664993286, "epoch": 1.592, "step": 100 }, { "eval_loss": 1.7032477855682373, "eval_runtime": 206.5591, "eval_samples_per_second": 4.841, "eval_steps_per_second": 1.21, "eval_entropy": 2.4817885313034056, "eval_num_tokens": 489806.0, "eval_logits/chosen": -0.02915419819877984, "eval_logits/rejected": 0.030335744896749582, "eval_mean_token_accuracy": 0.46294176495075223, "eval_rewards/chosen": -0.3251441774368286, "eval_rewards/rejected": -0.8992602396011352, "eval_rewards/accuracies": 0.535, "eval_rewards/margins": 0.5741160621643067, "eval_logps/chosen": -161.77295245361327, "eval_logps/rejected": -154.0547428894043, "epoch": 1.592, "step": 100 }, { "loss": 0.201928448677063, "grad_norm": 165.99703979492188, "learning_rate": 2.5e-06, "entropy": 2.456927877664566, "num_tokens": 557126.0, "logits/chosen": -0.054035433190315674, "logits/rejected": 0.023870603039078404, "mean_token_accuracy": 0.4830969862639904, "rewards/chosen": 7.902144932746888, "rewards/rejected": -7.419315588474274, "rewards/accuracies": 0.91875, "rewards/margins": 15.32146052122116, "logps/chosen": -163.42230014801027, "logps/rejected": -180.3114507675171, "epoch": 1.6720000000000002, "step": 105 }, { "loss": 0.2925128936767578, "grad_norm": 223.44317626953125, "learning_rate": 2.269329101341745e-06, "entropy": 2.3846511244773865, "num_tokens": 621946.0, "logits/chosen": -0.08168034990535702, "logits/rejected": 0.0008842671251679538, "mean_token_accuracy": 0.4920019693672657, "rewards/chosen": 5.381330716609955, "rewards/rejected": -7.425176107883454, "rewards/accuracies": 0.86875, "rewards/margins": 12.80650681257248, "logps/chosen": -157.9646562576294, "logps/rejected": -169.75593194961547, "epoch": 1.752, "step": 110 }, { "loss": 0.3038404703140259, "grad_norm": 161.18760681152344, "learning_rate": 2.040626205458574e-06, "entropy": 2.390929380059242, "num_tokens": 691164.0, "logits/chosen": -0.13911858224201848, "logits/rejected": 0.005971987129984738, "mean_token_accuracy": 0.4787629432976246, "rewards/chosen": 4.273123002052307, "rewards/rejected": -7.144606101512909, "rewards/accuracies": 0.875, "rewards/margins": 11.417729103565216, "logps/chosen": -149.66920585632323, "logps/rejected": -163.18242540359498, "epoch": 1.8319999999999999, "step": 115 }, { "loss": 0.30124845504760744, "grad_norm": 89.2537612915039, "learning_rate": 1.8158425248197931e-06, "entropy": 2.396760308742523, "num_tokens": 754527.0, "logits/chosen": -0.12405535128295105, "logits/rejected": -0.04780259835323798, "mean_token_accuracy": 0.4764955550432205, "rewards/chosen": 4.300834584236145, "rewards/rejected": -7.164772701263428, "rewards/accuracies": 0.86875, "rewards/margins": 11.465607309341431, "logps/chosen": -151.86719579696654, "logps/rejected": -157.59414463043214, "epoch": 1.912, "step": 120 }, { "loss": 0.24916279315948486, "grad_norm": 133.04541015625, "learning_rate": 1.5968958345321178e-06, "entropy": 2.4199918031692507, "num_tokens": 823843.0, "logits/chosen": -0.13994722177665678, "logits/rejected": -0.04187930260754162, "mean_token_accuracy": 0.4763185203075409, "rewards/chosen": 4.19235634803772, "rewards/rejected": -7.094201683998108, "rewards/accuracies": 0.86875, "rewards/margins": 11.286557984352111, "logps/chosen": -145.3044916152954, "logps/rejected": -156.23708686828613, "epoch": 1.992, "step": 125 }, { "loss": 0.11149348020553589, "grad_norm": 12.131107330322266, "learning_rate": 1.3856541105586545e-06, "entropy": 2.415849642621146, "num_tokens": 880621.0, "logits/chosen": -0.05668467466104803, "logits/rejected": 0.011222639368738605, "mean_token_accuracy": 0.4910110185543696, "rewards/chosen": 6.9378207259707985, "rewards/rejected": -10.694794721073574, "rewards/accuracies": 0.9652777777777778, "rewards/margins": 17.63261538081699, "logps/chosen": -140.81739722357855, "logps/rejected": -159.12346098158093, "epoch": 2.064, "step": 130 }, { "loss": 0.055275356769561766, "grad_norm": 49.40803146362305, "learning_rate": 1.1839195928066101e-06, "entropy": 2.393415144085884, "num_tokens": 947062.0, "logits/chosen": -0.06260905999738418, "logits/rejected": 0.01862583566735894, "mean_token_accuracy": 0.488899864256382, "rewards/chosen": 6.641458833217621, "rewards/rejected": -8.486654794216156, "rewards/accuracies": 0.96875, "rewards/margins": 15.128113627433777, "logps/chosen": -145.67238521575928, "logps/rejected": -158.00395879745483, "epoch": 2.144, "step": 135 }, { "loss": 0.08347327113151551, "grad_norm": 247.27073669433594, "learning_rate": 9.934134090518593e-07, "entropy": 2.3886053651571273, "num_tokens": 1009620.0, "logits/chosen": 0.015752432688678975, "logits/rejected": 0.14565652903713386, "mean_token_accuracy": 0.48201576992869377, "rewards/chosen": 6.356861460208893, "rewards/rejected": -9.22689858675003, "rewards/accuracies": 0.9375, "rewards/margins": 15.583760273456573, "logps/chosen": -140.80859432220458, "logps/rejected": -144.45258922576903, "epoch": 2.224, "step": 140 }, { "loss": 0.043124151229858396, "grad_norm": 53.45302200317383, "learning_rate": 8.157608908836071e-07, "entropy": 2.386504426598549, "num_tokens": 1073365.0, "logits/chosen": -0.020702211829369148, "logits/rejected": 0.04769667472695908, "mean_token_accuracy": 0.4906194917857647, "rewards/chosen": 7.815622496604919, "rewards/rejected": -10.351620376110077, "rewards/accuracies": 0.96875, "rewards/margins": 18.167242777347564, "logps/chosen": -146.7426830291748, "logps/rejected": -163.1491216659546, "epoch": 2.304, "step": 145 }, { "loss": 0.043502068519592284, "grad_norm": 58.150901794433594, "learning_rate": 6.524777069483526e-07, "entropy": 2.4140032857656477, "num_tokens": 1145086.0, "logits/chosen": -0.050803879241865094, "logits/rejected": 0.016077080657433143, "mean_token_accuracy": 0.47633846253156664, "rewards/chosen": 8.080148875713348, "rewards/rejected": -10.390690636634826, "rewards/accuracies": 0.95625, "rewards/margins": 18.47083934545517, "logps/chosen": -149.95097274780272, "logps/rejected": -170.474439907074, "epoch": 2.384, "step": 150 }, { "eval_loss": 1.7026314735412598, "eval_runtime": 206.5417, "eval_samples_per_second": 4.842, "eval_steps_per_second": 1.21, "eval_entropy": 2.4216558537483217, "eval_num_tokens": 1145086.0, "eval_logits/chosen": -0.029028150294289495, "eval_logits/rejected": 0.0280112105939085, "eval_mean_token_accuracy": 0.46184870624542235, "eval_rewards/chosen": -1.093953761100769, "eval_rewards/rejected": -1.85626819896698, "eval_rewards/accuracies": 0.548, "eval_rewards/margins": 0.762314435005188, "eval_logps/chosen": -162.54176181030275, "eval_logps/rejected": -155.01175158691407, "epoch": 2.384, "step": 150 }, { "loss": 0.04540476202964783, "grad_norm": 64.46814727783203, "learning_rate": 5.049569317994013e-07, "entropy": 2.3098636120557785, "num_tokens": 1213916.0, "logits/chosen": -0.06188787605804125, "logits/rejected": 0.027120160451300827, "mean_token_accuracy": 0.494048598408699, "rewards/chosen": 6.214471685886383, "rewards/rejected": -9.97102323770523, "rewards/accuracies": 0.95625, "rewards/margins": 16.185495030879974, "logps/chosen": -139.7538740158081, "logps/rejected": -178.46554546356202, "epoch": 2.464, "step": 155 }, { "loss": 0.049390339851379396, "grad_norm": 68.03170013427734, "learning_rate": 3.7445716067596506e-07, "entropy": 2.409408602118492, "num_tokens": 1277766.0, "logits/chosen": -0.003306678294279577, "logits/rejected": 0.18536064407876787, "mean_token_accuracy": 0.4815196588635445, "rewards/chosen": 6.468300366401673, "rewards/rejected": -8.37518800497055, "rewards/accuracies": 0.9625, "rewards/margins": 14.843488407135009, "logps/chosen": -129.7855330467224, "logps/rejected": -140.2837603569031, "epoch": 2.544, "step": 160 }, { "loss": 0.03415984511375427, "grad_norm": 29.85422134399414, "learning_rate": 2.620917716123444e-07, "entropy": 2.373009890317917, "num_tokens": 1344187.0, "logits/chosen": -0.034215040255231824, "logits/rejected": 0.003781206712556699, "mean_token_accuracy": 0.49681628569960595, "rewards/chosen": 6.034191703796386, "rewards/rejected": -8.828164434432983, "rewards/accuracies": 0.975, "rewards/margins": 14.862355995178223, "logps/chosen": -144.27701168060304, "logps/rejected": -160.7808395385742, "epoch": 2.624, "step": 165 }, { "loss": 0.039914682507514954, "grad_norm": 31.656320571899414, "learning_rate": 1.6881942648911077e-07, "entropy": 2.4209450781345367, "num_tokens": 1412024.0, "logits/chosen": -0.020082851941010425, "logits/rejected": 0.05684754955497793, "mean_token_accuracy": 0.47963607460260393, "rewards/chosen": 7.226568651199341, "rewards/rejected": -11.922263181209564, "rewards/accuracies": 0.9625, "rewards/margins": 19.14883189201355, "logps/chosen": -159.64463758468628, "logps/rejected": -200.80445861816406, "epoch": 2.7039999999999997, "step": 170 }, { "loss": 0.02738744020462036, "grad_norm": 7.714607238769531, "learning_rate": 9.54358920679524e-08, "entropy": 2.398535707592964, "num_tokens": 1479107.0, "logits/chosen": -0.0991577681817519, "logits/rejected": 0.04568099312173675, "mean_token_accuracy": 0.4867618277668953, "rewards/chosen": 9.70926661491394, "rewards/rejected": -10.595936667919158, "rewards/accuracies": 0.98125, "rewards/margins": 20.305203425884248, "logps/chosen": -163.36764631271362, "logps/rejected": -165.54495639801024, "epoch": 2.784, "step": 175 }, { "loss": 0.04212303757667542, "grad_norm": 24.47334861755371, "learning_rate": 4.256725079024554e-08, "entropy": 2.4347573101520537, "num_tokens": 1546945.0, "logits/chosen": -0.02471525168225915, "logits/rejected": 0.07145450971571757, "mean_token_accuracy": 0.4759250283241272, "rewards/chosen": 8.439748311042786, "rewards/rejected": -8.140615552663803, "rewards/accuracies": 0.96875, "rewards/margins": 16.580363899469376, "logps/chosen": -150.1224630355835, "logps/rejected": -145.60447340011598, "epoch": 2.864, "step": 180 }, { "loss": 0.0593170702457428, "grad_norm": 11.518243789672852, "learning_rate": 1.0664559262413831e-08, "entropy": 2.3951420307159426, "num_tokens": 1610498.0, "logits/chosen": -0.04937423423232102, "logits/rejected": 0.10506708711402735, "mean_token_accuracy": 0.47507822662591936, "rewards/chosen": 7.954719412326813, "rewards/rejected": -8.796785068511962, "rewards/accuracies": 0.9625, "rewards/margins": 16.75150465965271, "logps/chosen": -154.27819213867187, "logps/rejected": -160.4699233055115, "epoch": 2.944, "step": 185 }, { "eval_loss": 1.706053614616394, "eval_runtime": 206.75, "eval_samples_per_second": 4.837, "eval_steps_per_second": 1.209, "eval_entropy": 2.4251069741249083, "eval_num_tokens": 1659568.0, "eval_logits/chosen": -0.03056270304781408, "eval_logits/rejected": 0.02707430725326769, "eval_mean_token_accuracy": 0.4618482575416565, "eval_rewards/chosen": -0.9163762617111206, "eval_rewards/rejected": -1.668631679534912, "eval_rewards/accuracies": 0.551, "eval_rewards/margins": 0.7522554168701172, "eval_logps/chosen": -162.3641845550537, "eval_logps/rejected": -154.82411492919923, "epoch": 3.0, "step": 189 }, { "train_runtime": 2671.7282, "train_samples_per_second": 2.246, "train_steps_per_second": 0.071, "total_flos": 9840760918671360.0, "train_loss": 0.09329431752363841, "epoch": 3.0, "step": 189 } ]