772 lines
25 KiB
JSON
772 lines
25 KiB
JSON
[
|
|
{
|
|
"entropy": 2.5553497850894926,
|
|
"epoch": 0.08,
|
|
"grad_norm": 357.8926696777344,
|
|
"learning_rate": 2.8571428571428573e-06,
|
|
"logits/chosen": 0.41187580737484436,
|
|
"logits/rejected": 0.43087167594886183,
|
|
"logps/chosen": -157.8165241241455,
|
|
"logps/rejected": -150.432616519928,
|
|
"loss": 0.6890408515930175,
|
|
"mean_token_accuracy": 0.45499045923352244,
|
|
"num_tokens": 63280.0,
|
|
"rewards/accuracies": 0.55625,
|
|
"rewards/chosen": 0.18442693948745728,
|
|
"rewards/margins": 0.05980904102325439,
|
|
"rewards/rejected": 0.12461789846420288,
|
|
"step": 5
|
|
},
|
|
{
|
|
"entropy": 2.585687577724457,
|
|
"epoch": 0.16,
|
|
"grad_norm": 550.5374145507812,
|
|
"learning_rate": 4.984280524733107e-06,
|
|
"logits/chosen": 0.23282768258015127,
|
|
"logits/rejected": 0.41657135452577226,
|
|
"logps/chosen": -160.46632223129274,
|
|
"logps/rejected": -155.05524663925172,
|
|
"loss": 1.0951576232910156,
|
|
"mean_token_accuracy": 0.4666588671505451,
|
|
"num_tokens": 128751.0,
|
|
"rewards/accuracies": 0.46875,
|
|
"rewards/chosen": 0.04196357727050781,
|
|
"rewards/margins": -0.13510316610336304,
|
|
"rewards/rejected": 0.17706674337387085,
|
|
"step": 10
|
|
},
|
|
{
|
|
"entropy": 2.4887936890125273,
|
|
"epoch": 0.24,
|
|
"grad_norm": 544.36474609375,
|
|
"learning_rate": 4.809698831278217e-06,
|
|
"logits/chosen": 0.19960332682723014,
|
|
"logits/rejected": 0.25714549020005323,
|
|
"logps/chosen": -151.403657245636,
|
|
"logps/rejected": -163.51016159057616,
|
|
"loss": 1.1309956550598144,
|
|
"mean_token_accuracy": 0.4729401096701622,
|
|
"num_tokens": 194142.0,
|
|
"rewards/accuracies": 0.45625,
|
|
"rewards/chosen": -0.6780350089073182,
|
|
"rewards/margins": 0.11501268744468689,
|
|
"rewards/rejected": -0.793047696352005,
|
|
"step": 15
|
|
},
|
|
{
|
|
"entropy": 2.543038326501846,
|
|
"epoch": 0.32,
|
|
"grad_norm": 545.773193359375,
|
|
"learning_rate": 4.454578706170075e-06,
|
|
"logits/chosen": 0.10757563983449289,
|
|
"logits/rejected": 0.2191312620805499,
|
|
"logps/chosen": -134.6160714149475,
|
|
"logps/rejected": -134.7640838623047,
|
|
"loss": 1.2686697959899902,
|
|
"mean_token_accuracy": 0.46390472874045374,
|
|
"num_tokens": 254871.0,
|
|
"rewards/accuracies": 0.54375,
|
|
"rewards/chosen": -1.045345139503479,
|
|
"rewards/margins": 0.4233867168426514,
|
|
"rewards/rejected": -1.4687318563461305,
|
|
"step": 20
|
|
},
|
|
{
|
|
"entropy": 2.4839668542146685,
|
|
"epoch": 0.4,
|
|
"grad_norm": 609.0315551757812,
|
|
"learning_rate": 3.946678240449515e-06,
|
|
"logits/chosen": 0.23401674829751978,
|
|
"logits/rejected": 0.22746947777638224,
|
|
"logps/chosen": -144.78962602615357,
|
|
"logps/rejected": -136.76443700790406,
|
|
"loss": 1.4144909858703614,
|
|
"mean_token_accuracy": 0.45985892340540885,
|
|
"num_tokens": 317752.0,
|
|
"rewards/accuracies": 0.5625,
|
|
"rewards/chosen": -0.8229869723320007,
|
|
"rewards/margins": 0.27719623446464536,
|
|
"rewards/rejected": -1.1001832067966462,
|
|
"step": 25
|
|
},
|
|
{
|
|
"entropy": 2.4549559235572813,
|
|
"epoch": 0.48,
|
|
"grad_norm": 685.6503295898438,
|
|
"learning_rate": 3.3256976548879183e-06,
|
|
"logits/chosen": 0.21252182170691483,
|
|
"logits/rejected": 0.27063995156819315,
|
|
"logps/chosen": -148.57344274520875,
|
|
"logps/rejected": -146.81006059646606,
|
|
"loss": 1.6434017181396485,
|
|
"mean_token_accuracy": 0.454254624247551,
|
|
"num_tokens": 387452.0,
|
|
"rewards/accuracies": 0.4625,
|
|
"rewards/chosen": -0.23523921966552735,
|
|
"rewards/margins": 0.0028411030769348146,
|
|
"rewards/rejected": -0.23808032274246216,
|
|
"step": 30
|
|
},
|
|
{
|
|
"entropy": 2.4848766714334487,
|
|
"epoch": 0.56,
|
|
"grad_norm": 572.0255737304688,
|
|
"learning_rate": 2.6401761180929798e-06,
|
|
"logits/chosen": 0.1604402064572174,
|
|
"logits/rejected": 0.23192453424270135,
|
|
"logps/chosen": -178.91495656967163,
|
|
"logps/rejected": -171.79455051422119,
|
|
"loss": 1.2930749893188476,
|
|
"mean_token_accuracy": 0.4774269789457321,
|
|
"num_tokens": 454873.0,
|
|
"rewards/accuracies": 0.54375,
|
|
"rewards/chosen": 0.2875680088996887,
|
|
"rewards/margins": 0.7235915064811707,
|
|
"rewards/rejected": -0.43602349758148196,
|
|
"step": 35
|
|
},
|
|
{
|
|
"entropy": 2.4956657856702806,
|
|
"epoch": 0.64,
|
|
"grad_norm": 581.42724609375,
|
|
"learning_rate": 1.9436976651092143e-06,
|
|
"logits/chosen": 0.26337065405985355,
|
|
"logits/rejected": 0.36300255439029444,
|
|
"logps/chosen": -157.99055194854736,
|
|
"logps/rejected": -159.0982545375824,
|
|
"loss": 1.5171399116516113,
|
|
"mean_token_accuracy": 0.46507507339119913,
|
|
"num_tokens": 518527.0,
|
|
"rewards/accuracies": 0.5,
|
|
"rewards/chosen": -0.061191481351852414,
|
|
"rewards/margins": 0.1269888162612915,
|
|
"rewards/rejected": -0.18818029761314392,
|
|
"step": 40
|
|
},
|
|
{
|
|
"entropy": 2.434966567158699,
|
|
"epoch": 0.72,
|
|
"grad_norm": 432.56536865234375,
|
|
"learning_rate": 1.2907027822369006e-06,
|
|
"logits/chosen": 0.268132887364752,
|
|
"logits/rejected": 0.30894473259910554,
|
|
"logps/chosen": -154.1576229095459,
|
|
"logps/rejected": -159.85538330078126,
|
|
"loss": 1.3509400367736817,
|
|
"mean_token_accuracy": 0.4740308240056038,
|
|
"num_tokens": 586496.0,
|
|
"rewards/accuracies": 0.5375,
|
|
"rewards/chosen": 0.02395761013031006,
|
|
"rewards/margins": 0.8281095027923584,
|
|
"rewards/rejected": -0.8041518926620483,
|
|
"step": 45
|
|
},
|
|
{
|
|
"entropy": 2.4690693795681,
|
|
"epoch": 0.8,
|
|
"grad_norm": 504.9461364746094,
|
|
"learning_rate": 7.322330470336314e-07,
|
|
"logits/chosen": 0.27772643533489566,
|
|
"logits/rejected": 0.36052606081661537,
|
|
"logps/chosen": -164.17142915725708,
|
|
"logps/rejected": -163.73542156219483,
|
|
"loss": 1.4861845970153809,
|
|
"mean_token_accuracy": 0.4653610520064831,
|
|
"num_tokens": 659345.0,
|
|
"rewards/accuracies": 0.55625,
|
|
"rewards/chosen": -0.0009298324584960938,
|
|
"rewards/margins": 0.31063854694366455,
|
|
"rewards/rejected": -0.31156837940216064,
|
|
"step": 50
|
|
},
|
|
{
|
|
"epoch": 0.8,
|
|
"eval_entropy": 2.536505832195282,
|
|
"eval_logits/chosen": 0.2893901140152919,
|
|
"eval_logits/rejected": 0.34482142702810936,
|
|
"eval_logps/chosen": -161.61729994201661,
|
|
"eval_logps/rejected": -153.7386490020752,
|
|
"eval_loss": 1.3951599597930908,
|
|
"eval_mean_token_accuracy": 0.46117462730407716,
|
|
"eval_num_tokens": 659345.0,
|
|
"eval_rewards/accuracies": 0.539,
|
|
"eval_rewards/chosen": -0.16949110031127929,
|
|
"eval_rewards/margins": 0.413674391746521,
|
|
"eval_rewards/rejected": -0.5831654920578003,
|
|
"eval_runtime": 204.2784,
|
|
"eval_samples_per_second": 4.895,
|
|
"eval_steps_per_second": 1.224,
|
|
"step": 50
|
|
},
|
|
{
|
|
"entropy": 2.5048249810934067,
|
|
"epoch": 0.88,
|
|
"grad_norm": 538.51953125,
|
|
"learning_rate": 3.119414452281158e-07,
|
|
"logits/chosen": 0.31241473497619054,
|
|
"logits/rejected": 0.4336116565754852,
|
|
"logps/chosen": -148.8257155418396,
|
|
"logps/rejected": -143.5335810661316,
|
|
"loss": 1.5545385360717774,
|
|
"mean_token_accuracy": 0.47073024958372117,
|
|
"num_tokens": 731475.0,
|
|
"rewards/accuracies": 0.53125,
|
|
"rewards/chosen": -0.08134242296218872,
|
|
"rewards/margins": 0.31841338872909547,
|
|
"rewards/rejected": -0.39975581169128416,
|
|
"step": 55
|
|
},
|
|
{
|
|
"entropy": 2.4619424283504485,
|
|
"epoch": 0.96,
|
|
"grad_norm": 439.4546813964844,
|
|
"learning_rate": 6.268021954544095e-08,
|
|
"logits/chosen": 0.26771219837052634,
|
|
"logits/rejected": 0.3957730213546686,
|
|
"logps/chosen": -157.09008331298827,
|
|
"logps/rejected": -164.03927259445192,
|
|
"loss": 1.2014739990234375,
|
|
"mean_token_accuracy": 0.47436425387859343,
|
|
"num_tokens": 797757.0,
|
|
"rewards/accuracies": 0.525,
|
|
"rewards/chosen": 0.21749011874198915,
|
|
"rewards/margins": 0.5742806613445282,
|
|
"rewards/rejected": -0.35679054260253906,
|
|
"step": 60
|
|
},
|
|
{
|
|
"epoch": 1.0,
|
|
"eval_entropy": 2.5392660574913024,
|
|
"eval_logits/chosen": 0.2875409764336183,
|
|
"eval_logits/rejected": 0.34302489192485985,
|
|
"eval_logps/chosen": -161.68841091918947,
|
|
"eval_logps/rejected": -153.80732011413573,
|
|
"eval_loss": 1.3833612203598022,
|
|
"eval_mean_token_accuracy": 0.46109312522411344,
|
|
"eval_num_tokens": 829784.0,
|
|
"eval_rewards/accuracies": 0.543,
|
|
"eval_rewards/chosen": -0.24060248374938964,
|
|
"eval_rewards/margins": 0.4112340784072876,
|
|
"eval_rewards/rejected": -0.6518365621566773,
|
|
"eval_runtime": 204.0071,
|
|
"eval_samples_per_second": 4.902,
|
|
"eval_steps_per_second": 1.225,
|
|
"step": 63
|
|
},
|
|
{
|
|
"loss": 0.27623340487480164,
|
|
"grad_norm": 189.56698608398438,
|
|
"learning_rate": 4.184239109116393e-06,
|
|
"entropy": 2.507671430706978,
|
|
"num_tokens": 27180.0,
|
|
"logits/chosen": 0.2979938850081893,
|
|
"logits/rejected": 0.3261501650298202,
|
|
"mean_token_accuracy": 0.47298500686883926,
|
|
"rewards/chosen": 5.079042822122574,
|
|
"rewards/rejected": -6.503820419311523,
|
|
"rewards/accuracies": 0.828125,
|
|
"rewards/margins": 11.58286327123642,
|
|
"logps/chosen": -146.56341791152954,
|
|
"logps/rejected": -168.53296971321106,
|
|
"epoch": 1.032,
|
|
"step": 65
|
|
},
|
|
{
|
|
"loss": 0.13215208053588867,
|
|
"grad_norm": 113.09912872314453,
|
|
"learning_rate": 4.006586590948141e-06,
|
|
"entropy": 2.5133699655532835,
|
|
"num_tokens": 86611.0,
|
|
"logits/chosen": 0.25969656721433304,
|
|
"logits/rejected": 0.39782895997815093,
|
|
"mean_token_accuracy": 0.4806541882455349,
|
|
"rewards/chosen": 5.613885009288788,
|
|
"rewards/rejected": -7.231478703022003,
|
|
"rewards/accuracies": 0.93125,
|
|
"rewards/margins": 12.845363640785218,
|
|
"logps/chosen": -152.27070779800414,
|
|
"logps/rejected": -152.92093172073365,
|
|
"epoch": 1.112,
|
|
"step": 70
|
|
},
|
|
{
|
|
"loss": 0.13926982879638672,
|
|
"grad_norm": 164.6415252685547,
|
|
"learning_rate": 3.81608040719339e-06,
|
|
"entropy": 2.5407466888427734,
|
|
"num_tokens": 153056.0,
|
|
"logits/chosen": 0.3012379954587533,
|
|
"logits/rejected": 0.35636349940869577,
|
|
"mean_token_accuracy": 0.4698187731206417,
|
|
"rewards/chosen": 4.025047600269318,
|
|
"rewards/rejected": -7.252596193552018,
|
|
"rewards/accuracies": 0.925,
|
|
"rewards/margins": 11.277643758058549,
|
|
"logps/chosen": -152.22927570343018,
|
|
"logps/rejected": -158.37194900512696,
|
|
"epoch": 1.192,
|
|
"step": 75
|
|
},
|
|
{
|
|
"loss": 0.20328567028045655,
|
|
"grad_norm": 77.16290283203125,
|
|
"learning_rate": 3.6143458894413463e-06,
|
|
"entropy": 2.5421448230743406,
|
|
"num_tokens": 215920.0,
|
|
"logits/chosen": 0.2523993960550924,
|
|
"logits/rejected": 0.3098906828719798,
|
|
"mean_token_accuracy": 0.4690698154270649,
|
|
"rewards/chosen": 5.010193508863449,
|
|
"rewards/rejected": -5.472190934419632,
|
|
"rewards/accuracies": 0.9,
|
|
"rewards/margins": 10.482384419441223,
|
|
"logps/chosen": -128.28734722137452,
|
|
"logps/rejected": -151.55945873260498,
|
|
"epoch": 1.272,
|
|
"step": 80
|
|
},
|
|
{
|
|
"loss": 0.24072544574737548,
|
|
"grad_norm": 181.0267791748047,
|
|
"learning_rate": 3.403104165467883e-06,
|
|
"entropy": 2.462119910120964,
|
|
"num_tokens": 287127.0,
|
|
"logits/chosen": 0.2615454777932041,
|
|
"logits/rejected": 0.34690817078532066,
|
|
"mean_token_accuracy": 0.49424040541052816,
|
|
"rewards/chosen": 6.286368477344513,
|
|
"rewards/rejected": -7.02618248462677,
|
|
"rewards/accuracies": 0.89375,
|
|
"rewards/margins": 13.312550961971283,
|
|
"logps/chosen": -136.50883808135987,
|
|
"logps/rejected": -156.16784238815308,
|
|
"epoch": 1.3519999999999999,
|
|
"step": 85
|
|
},
|
|
{
|
|
"loss": 0.2306227684020996,
|
|
"grad_norm": 128.99142456054688,
|
|
"learning_rate": 3.184157475180208e-06,
|
|
"entropy": 2.5757258504629137,
|
|
"num_tokens": 354068.0,
|
|
"logits/chosen": 0.26197732623753106,
|
|
"logits/rejected": 0.3165610941969709,
|
|
"mean_token_accuracy": 0.46578485444188117,
|
|
"rewards/chosen": 5.876923865079879,
|
|
"rewards/rejected": -4.679693168401718,
|
|
"rewards/accuracies": 0.89375,
|
|
"rewards/margins": 10.556617093086242,
|
|
"logps/chosen": -156.26946783065796,
|
|
"logps/rejected": -148.62067685127258,
|
|
"epoch": 1.432,
|
|
"step": 90
|
|
},
|
|
{
|
|
"loss": 0.18702551126480102,
|
|
"grad_norm": 99.29806518554688,
|
|
"learning_rate": 2.9593737945414264e-06,
|
|
"entropy": 2.4905955940485,
|
|
"num_tokens": 421426.0,
|
|
"logits/chosen": 0.18172540683269275,
|
|
"logits/rejected": 0.17394183194436158,
|
|
"mean_token_accuracy": 0.4736903429031372,
|
|
"rewards/chosen": 5.762694102525711,
|
|
"rewards/rejected": -6.312865370512009,
|
|
"rewards/accuracies": 0.8875,
|
|
"rewards/margins": 12.075559437274933,
|
|
"logps/chosen": -135.62753200531006,
|
|
"logps/rejected": -156.26373701095582,
|
|
"epoch": 1.512,
|
|
"step": 95
|
|
},
|
|
{
|
|
"loss": 0.21797585487365723,
|
|
"grad_norm": 277.9349670410156,
|
|
"learning_rate": 2.730670898658255e-06,
|
|
"entropy": 2.4252312004566194,
|
|
"num_tokens": 489806.0,
|
|
"logits/chosen": -0.04065577566546924,
|
|
"logits/rejected": 0.10009592183059253,
|
|
"mean_token_accuracy": 0.490592048317194,
|
|
"rewards/chosen": 6.565640062093735,
|
|
"rewards/rejected": -6.080355882644653,
|
|
"rewards/accuracies": 0.89375,
|
|
"rewards/margins": 12.645995873212815,
|
|
"logps/chosen": -154.10384283065795,
|
|
"logps/rejected": -152.03404664993286,
|
|
"epoch": 1.592,
|
|
"step": 100
|
|
},
|
|
{
|
|
"eval_loss": 1.7032477855682373,
|
|
"eval_runtime": 206.5591,
|
|
"eval_samples_per_second": 4.841,
|
|
"eval_steps_per_second": 1.21,
|
|
"eval_entropy": 2.4817885313034056,
|
|
"eval_num_tokens": 489806.0,
|
|
"eval_logits/chosen": -0.02915419819877984,
|
|
"eval_logits/rejected": 0.030335744896749582,
|
|
"eval_mean_token_accuracy": 0.46294176495075223,
|
|
"eval_rewards/chosen": -0.3251441774368286,
|
|
"eval_rewards/rejected": -0.8992602396011352,
|
|
"eval_rewards/accuracies": 0.535,
|
|
"eval_rewards/margins": 0.5741160621643067,
|
|
"eval_logps/chosen": -161.77295245361327,
|
|
"eval_logps/rejected": -154.0547428894043,
|
|
"epoch": 1.592,
|
|
"step": 100
|
|
},
|
|
{
|
|
"loss": 0.201928448677063,
|
|
"grad_norm": 165.99703979492188,
|
|
"learning_rate": 2.5e-06,
|
|
"entropy": 2.456927877664566,
|
|
"num_tokens": 557126.0,
|
|
"logits/chosen": -0.054035433190315674,
|
|
"logits/rejected": 0.023870603039078404,
|
|
"mean_token_accuracy": 0.4830969862639904,
|
|
"rewards/chosen": 7.902144932746888,
|
|
"rewards/rejected": -7.419315588474274,
|
|
"rewards/accuracies": 0.91875,
|
|
"rewards/margins": 15.32146052122116,
|
|
"logps/chosen": -163.42230014801027,
|
|
"logps/rejected": -180.3114507675171,
|
|
"epoch": 1.6720000000000002,
|
|
"step": 105
|
|
},
|
|
{
|
|
"loss": 0.2925128936767578,
|
|
"grad_norm": 223.44317626953125,
|
|
"learning_rate": 2.269329101341745e-06,
|
|
"entropy": 2.3846511244773865,
|
|
"num_tokens": 621946.0,
|
|
"logits/chosen": -0.08168034990535702,
|
|
"logits/rejected": 0.0008842671251679538,
|
|
"mean_token_accuracy": 0.4920019693672657,
|
|
"rewards/chosen": 5.381330716609955,
|
|
"rewards/rejected": -7.425176107883454,
|
|
"rewards/accuracies": 0.86875,
|
|
"rewards/margins": 12.80650681257248,
|
|
"logps/chosen": -157.9646562576294,
|
|
"logps/rejected": -169.75593194961547,
|
|
"epoch": 1.752,
|
|
"step": 110
|
|
},
|
|
{
|
|
"loss": 0.3038404703140259,
|
|
"grad_norm": 161.18760681152344,
|
|
"learning_rate": 2.040626205458574e-06,
|
|
"entropy": 2.390929380059242,
|
|
"num_tokens": 691164.0,
|
|
"logits/chosen": -0.13911858224201848,
|
|
"logits/rejected": 0.005971987129984738,
|
|
"mean_token_accuracy": 0.4787629432976246,
|
|
"rewards/chosen": 4.273123002052307,
|
|
"rewards/rejected": -7.144606101512909,
|
|
"rewards/accuracies": 0.875,
|
|
"rewards/margins": 11.417729103565216,
|
|
"logps/chosen": -149.66920585632323,
|
|
"logps/rejected": -163.18242540359498,
|
|
"epoch": 1.8319999999999999,
|
|
"step": 115
|
|
},
|
|
{
|
|
"loss": 0.30124845504760744,
|
|
"grad_norm": 89.2537612915039,
|
|
"learning_rate": 1.8158425248197931e-06,
|
|
"entropy": 2.396760308742523,
|
|
"num_tokens": 754527.0,
|
|
"logits/chosen": -0.12405535128295105,
|
|
"logits/rejected": -0.04780259835323798,
|
|
"mean_token_accuracy": 0.4764955550432205,
|
|
"rewards/chosen": 4.300834584236145,
|
|
"rewards/rejected": -7.164772701263428,
|
|
"rewards/accuracies": 0.86875,
|
|
"rewards/margins": 11.465607309341431,
|
|
"logps/chosen": -151.86719579696654,
|
|
"logps/rejected": -157.59414463043214,
|
|
"epoch": 1.912,
|
|
"step": 120
|
|
},
|
|
{
|
|
"loss": 0.24916279315948486,
|
|
"grad_norm": 133.04541015625,
|
|
"learning_rate": 1.5968958345321178e-06,
|
|
"entropy": 2.4199918031692507,
|
|
"num_tokens": 823843.0,
|
|
"logits/chosen": -0.13994722177665678,
|
|
"logits/rejected": -0.04187930260754162,
|
|
"mean_token_accuracy": 0.4763185203075409,
|
|
"rewards/chosen": 4.19235634803772,
|
|
"rewards/rejected": -7.094201683998108,
|
|
"rewards/accuracies": 0.86875,
|
|
"rewards/margins": 11.286557984352111,
|
|
"logps/chosen": -145.3044916152954,
|
|
"logps/rejected": -156.23708686828613,
|
|
"epoch": 1.992,
|
|
"step": 125
|
|
},
|
|
{
|
|
"loss": 0.11149348020553589,
|
|
"grad_norm": 12.131107330322266,
|
|
"learning_rate": 1.3856541105586545e-06,
|
|
"entropy": 2.415849642621146,
|
|
"num_tokens": 880621.0,
|
|
"logits/chosen": -0.05668467466104803,
|
|
"logits/rejected": 0.011222639368738605,
|
|
"mean_token_accuracy": 0.4910110185543696,
|
|
"rewards/chosen": 6.9378207259707985,
|
|
"rewards/rejected": -10.694794721073574,
|
|
"rewards/accuracies": 0.9652777777777778,
|
|
"rewards/margins": 17.63261538081699,
|
|
"logps/chosen": -140.81739722357855,
|
|
"logps/rejected": -159.12346098158093,
|
|
"epoch": 2.064,
|
|
"step": 130
|
|
},
|
|
{
|
|
"loss": 0.055275356769561766,
|
|
"grad_norm": 49.40803146362305,
|
|
"learning_rate": 1.1839195928066101e-06,
|
|
"entropy": 2.393415144085884,
|
|
"num_tokens": 947062.0,
|
|
"logits/chosen": -0.06260905999738418,
|
|
"logits/rejected": 0.01862583566735894,
|
|
"mean_token_accuracy": 0.488899864256382,
|
|
"rewards/chosen": 6.641458833217621,
|
|
"rewards/rejected": -8.486654794216156,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/margins": 15.128113627433777,
|
|
"logps/chosen": -145.67238521575928,
|
|
"logps/rejected": -158.00395879745483,
|
|
"epoch": 2.144,
|
|
"step": 135
|
|
},
|
|
{
|
|
"loss": 0.08347327113151551,
|
|
"grad_norm": 247.27073669433594,
|
|
"learning_rate": 9.934134090518593e-07,
|
|
"entropy": 2.3886053651571273,
|
|
"num_tokens": 1009620.0,
|
|
"logits/chosen": 0.015752432688678975,
|
|
"logits/rejected": 0.14565652903713386,
|
|
"mean_token_accuracy": 0.48201576992869377,
|
|
"rewards/chosen": 6.356861460208893,
|
|
"rewards/rejected": -9.22689858675003,
|
|
"rewards/accuracies": 0.9375,
|
|
"rewards/margins": 15.583760273456573,
|
|
"logps/chosen": -140.80859432220458,
|
|
"logps/rejected": -144.45258922576903,
|
|
"epoch": 2.224,
|
|
"step": 140
|
|
},
|
|
{
|
|
"loss": 0.043124151229858396,
|
|
"grad_norm": 53.45302200317383,
|
|
"learning_rate": 8.157608908836071e-07,
|
|
"entropy": 2.386504426598549,
|
|
"num_tokens": 1073365.0,
|
|
"logits/chosen": -0.020702211829369148,
|
|
"logits/rejected": 0.04769667472695908,
|
|
"mean_token_accuracy": 0.4906194917857647,
|
|
"rewards/chosen": 7.815622496604919,
|
|
"rewards/rejected": -10.351620376110077,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/margins": 18.167242777347564,
|
|
"logps/chosen": -146.7426830291748,
|
|
"logps/rejected": -163.1491216659546,
|
|
"epoch": 2.304,
|
|
"step": 145
|
|
},
|
|
{
|
|
"loss": 0.043502068519592284,
|
|
"grad_norm": 58.150901794433594,
|
|
"learning_rate": 6.524777069483526e-07,
|
|
"entropy": 2.4140032857656477,
|
|
"num_tokens": 1145086.0,
|
|
"logits/chosen": -0.050803879241865094,
|
|
"logits/rejected": 0.016077080657433143,
|
|
"mean_token_accuracy": 0.47633846253156664,
|
|
"rewards/chosen": 8.080148875713348,
|
|
"rewards/rejected": -10.390690636634826,
|
|
"rewards/accuracies": 0.95625,
|
|
"rewards/margins": 18.47083934545517,
|
|
"logps/chosen": -149.95097274780272,
|
|
"logps/rejected": -170.474439907074,
|
|
"epoch": 2.384,
|
|
"step": 150
|
|
},
|
|
{
|
|
"eval_loss": 1.7026314735412598,
|
|
"eval_runtime": 206.5417,
|
|
"eval_samples_per_second": 4.842,
|
|
"eval_steps_per_second": 1.21,
|
|
"eval_entropy": 2.4216558537483217,
|
|
"eval_num_tokens": 1145086.0,
|
|
"eval_logits/chosen": -0.029028150294289495,
|
|
"eval_logits/rejected": 0.0280112105939085,
|
|
"eval_mean_token_accuracy": 0.46184870624542235,
|
|
"eval_rewards/chosen": -1.093953761100769,
|
|
"eval_rewards/rejected": -1.85626819896698,
|
|
"eval_rewards/accuracies": 0.548,
|
|
"eval_rewards/margins": 0.762314435005188,
|
|
"eval_logps/chosen": -162.54176181030275,
|
|
"eval_logps/rejected": -155.01175158691407,
|
|
"epoch": 2.384,
|
|
"step": 150
|
|
},
|
|
{
|
|
"loss": 0.04540476202964783,
|
|
"grad_norm": 64.46814727783203,
|
|
"learning_rate": 5.049569317994013e-07,
|
|
"entropy": 2.3098636120557785,
|
|
"num_tokens": 1213916.0,
|
|
"logits/chosen": -0.06188787605804125,
|
|
"logits/rejected": 0.027120160451300827,
|
|
"mean_token_accuracy": 0.494048598408699,
|
|
"rewards/chosen": 6.214471685886383,
|
|
"rewards/rejected": -9.97102323770523,
|
|
"rewards/accuracies": 0.95625,
|
|
"rewards/margins": 16.185495030879974,
|
|
"logps/chosen": -139.7538740158081,
|
|
"logps/rejected": -178.46554546356202,
|
|
"epoch": 2.464,
|
|
"step": 155
|
|
},
|
|
{
|
|
"loss": 0.049390339851379396,
|
|
"grad_norm": 68.03170013427734,
|
|
"learning_rate": 3.7445716067596506e-07,
|
|
"entropy": 2.409408602118492,
|
|
"num_tokens": 1277766.0,
|
|
"logits/chosen": -0.003306678294279577,
|
|
"logits/rejected": 0.18536064407876787,
|
|
"mean_token_accuracy": 0.4815196588635445,
|
|
"rewards/chosen": 6.468300366401673,
|
|
"rewards/rejected": -8.37518800497055,
|
|
"rewards/accuracies": 0.9625,
|
|
"rewards/margins": 14.843488407135009,
|
|
"logps/chosen": -129.7855330467224,
|
|
"logps/rejected": -140.2837603569031,
|
|
"epoch": 2.544,
|
|
"step": 160
|
|
},
|
|
{
|
|
"loss": 0.03415984511375427,
|
|
"grad_norm": 29.85422134399414,
|
|
"learning_rate": 2.620917716123444e-07,
|
|
"entropy": 2.373009890317917,
|
|
"num_tokens": 1344187.0,
|
|
"logits/chosen": -0.034215040255231824,
|
|
"logits/rejected": 0.003781206712556699,
|
|
"mean_token_accuracy": 0.49681628569960595,
|
|
"rewards/chosen": 6.034191703796386,
|
|
"rewards/rejected": -8.828164434432983,
|
|
"rewards/accuracies": 0.975,
|
|
"rewards/margins": 14.862355995178223,
|
|
"logps/chosen": -144.27701168060304,
|
|
"logps/rejected": -160.7808395385742,
|
|
"epoch": 2.624,
|
|
"step": 165
|
|
},
|
|
{
|
|
"loss": 0.039914682507514954,
|
|
"grad_norm": 31.656320571899414,
|
|
"learning_rate": 1.6881942648911077e-07,
|
|
"entropy": 2.4209450781345367,
|
|
"num_tokens": 1412024.0,
|
|
"logits/chosen": -0.020082851941010425,
|
|
"logits/rejected": 0.05684754955497793,
|
|
"mean_token_accuracy": 0.47963607460260393,
|
|
"rewards/chosen": 7.226568651199341,
|
|
"rewards/rejected": -11.922263181209564,
|
|
"rewards/accuracies": 0.9625,
|
|
"rewards/margins": 19.14883189201355,
|
|
"logps/chosen": -159.64463758468628,
|
|
"logps/rejected": -200.80445861816406,
|
|
"epoch": 2.7039999999999997,
|
|
"step": 170
|
|
},
|
|
{
|
|
"loss": 0.02738744020462036,
|
|
"grad_norm": 7.714607238769531,
|
|
"learning_rate": 9.54358920679524e-08,
|
|
"entropy": 2.398535707592964,
|
|
"num_tokens": 1479107.0,
|
|
"logits/chosen": -0.0991577681817519,
|
|
"logits/rejected": 0.04568099312173675,
|
|
"mean_token_accuracy": 0.4867618277668953,
|
|
"rewards/chosen": 9.70926661491394,
|
|
"rewards/rejected": -10.595936667919158,
|
|
"rewards/accuracies": 0.98125,
|
|
"rewards/margins": 20.305203425884248,
|
|
"logps/chosen": -163.36764631271362,
|
|
"logps/rejected": -165.54495639801024,
|
|
"epoch": 2.784,
|
|
"step": 175
|
|
},
|
|
{
|
|
"loss": 0.04212303757667542,
|
|
"grad_norm": 24.47334861755371,
|
|
"learning_rate": 4.256725079024554e-08,
|
|
"entropy": 2.4347573101520537,
|
|
"num_tokens": 1546945.0,
|
|
"logits/chosen": -0.02471525168225915,
|
|
"logits/rejected": 0.07145450971571757,
|
|
"mean_token_accuracy": 0.4759250283241272,
|
|
"rewards/chosen": 8.439748311042786,
|
|
"rewards/rejected": -8.140615552663803,
|
|
"rewards/accuracies": 0.96875,
|
|
"rewards/margins": 16.580363899469376,
|
|
"logps/chosen": -150.1224630355835,
|
|
"logps/rejected": -145.60447340011598,
|
|
"epoch": 2.864,
|
|
"step": 180
|
|
},
|
|
{
|
|
"loss": 0.0593170702457428,
|
|
"grad_norm": 11.518243789672852,
|
|
"learning_rate": 1.0664559262413831e-08,
|
|
"entropy": 2.3951420307159426,
|
|
"num_tokens": 1610498.0,
|
|
"logits/chosen": -0.04937423423232102,
|
|
"logits/rejected": 0.10506708711402735,
|
|
"mean_token_accuracy": 0.47507822662591936,
|
|
"rewards/chosen": 7.954719412326813,
|
|
"rewards/rejected": -8.796785068511962,
|
|
"rewards/accuracies": 0.9625,
|
|
"rewards/margins": 16.75150465965271,
|
|
"logps/chosen": -154.27819213867187,
|
|
"logps/rejected": -160.4699233055115,
|
|
"epoch": 2.944,
|
|
"step": 185
|
|
},
|
|
{
|
|
"eval_loss": 1.706053614616394,
|
|
"eval_runtime": 206.75,
|
|
"eval_samples_per_second": 4.837,
|
|
"eval_steps_per_second": 1.209,
|
|
"eval_entropy": 2.4251069741249083,
|
|
"eval_num_tokens": 1659568.0,
|
|
"eval_logits/chosen": -0.03056270304781408,
|
|
"eval_logits/rejected": 0.02707430725326769,
|
|
"eval_mean_token_accuracy": 0.4618482575416565,
|
|
"eval_rewards/chosen": -0.9163762617111206,
|
|
"eval_rewards/rejected": -1.668631679534912,
|
|
"eval_rewards/accuracies": 0.551,
|
|
"eval_rewards/margins": 0.7522554168701172,
|
|
"eval_logps/chosen": -162.3641845550537,
|
|
"eval_logps/rejected": -154.82411492919923,
|
|
"epoch": 3.0,
|
|
"step": 189
|
|
},
|
|
{
|
|
"train_runtime": 2671.7282,
|
|
"train_samples_per_second": 2.246,
|
|
"train_steps_per_second": 0.071,
|
|
"total_flos": 9840760918671360.0,
|
|
"train_loss": 0.09329431752363841,
|
|
"epoch": 3.0,
|
|
"step": 189
|
|
}
|
|
] |