Files
eng-latn-10mb-ppt-Dp-100mb_…/checkpoint-1000/trainer_state.json

2035 lines
54 KiB
JSON
Raw Normal View History

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.07128091809822511,
"eval_steps": 500,
"global_step": 1000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 10.742571830749512,
"epoch": 0.0003564045904911255,
"grad_norm": 5.375,
"learning_rate": 2e-06,
"loss": 10.7796,
"mean_token_accuracy": 0.0001526242063846439,
"num_tokens": 11399.0,
"step": 5
},
{
"entropy": 10.742592334747314,
"epoch": 0.000712809180982251,
"grad_norm": 5.65625,
"learning_rate": 4.5e-06,
"loss": 10.7732,
"mean_token_accuracy": 0.00015220778295770286,
"num_tokens": 22686.0,
"step": 10
},
{
"entropy": 10.742580223083497,
"epoch": 0.0010692137714733766,
"grad_norm": 5.28125,
"learning_rate": 7e-06,
"loss": 10.7223,
"mean_token_accuracy": 0.0,
"num_tokens": 32728.0,
"step": 15
},
{
"entropy": 10.742625427246093,
"epoch": 0.001425618361964502,
"grad_norm": 5.25,
"learning_rate": 9.5e-06,
"loss": 10.6798,
"mean_token_accuracy": 0.0005484026798512787,
"num_tokens": 42808.0,
"step": 20
},
{
"entropy": 10.742498874664307,
"epoch": 0.0017820229524556277,
"grad_norm": 4.75,
"learning_rate": 1.2e-05,
"loss": 10.5751,
"mean_token_accuracy": 0.006744108803104609,
"num_tokens": 54058.0,
"step": 25
},
{
"entropy": 10.742173194885254,
"epoch": 0.002138427542946753,
"grad_norm": 3.96875,
"learning_rate": 1.4500000000000002e-05,
"loss": 10.4546,
"mean_token_accuracy": 0.025261138379573823,
"num_tokens": 65338.0,
"step": 30
},
{
"entropy": 10.741145706176757,
"epoch": 0.0024948321334378786,
"grad_norm": 3.9375,
"learning_rate": 1.7000000000000003e-05,
"loss": 10.2901,
"mean_token_accuracy": 0.034458070248365405,
"num_tokens": 76598.0,
"step": 35
},
{
"entropy": 10.738759613037109,
"epoch": 0.002851236723929004,
"grad_norm": 2.65625,
"learning_rate": 1.95e-05,
"loss": 10.1426,
"mean_token_accuracy": 0.039705483429133895,
"num_tokens": 87364.0,
"step": 40
},
{
"entropy": 10.735179233551026,
"epoch": 0.00320764131442013,
"grad_norm": 2.359375,
"learning_rate": 2.2e-05,
"loss": 10.0394,
"mean_token_accuracy": 0.04000021629035473,
"num_tokens": 99019.0,
"step": 45
},
{
"entropy": 10.732727909088135,
"epoch": 0.0035640459049112554,
"grad_norm": 2.171875,
"learning_rate": 2.4500000000000003e-05,
"loss": 9.9672,
"mean_token_accuracy": 0.04283946715295315,
"num_tokens": 111087.0,
"step": 50
},
{
"entropy": 10.73162260055542,
"epoch": 0.00392045049540238,
"grad_norm": 2.140625,
"learning_rate": 2.7e-05,
"loss": 9.9085,
"mean_token_accuracy": 0.03926678970456123,
"num_tokens": 123401.0,
"step": 55
},
{
"entropy": 10.730762577056884,
"epoch": 0.004276855085893506,
"grad_norm": 2.171875,
"learning_rate": 2.95e-05,
"loss": 9.8396,
"mean_token_accuracy": 0.04287007227540016,
"num_tokens": 135554.0,
"step": 60
},
{
"entropy": 10.729378986358643,
"epoch": 0.004633259676384632,
"grad_norm": 2.09375,
"learning_rate": 3.2e-05,
"loss": 9.7598,
"mean_token_accuracy": 0.0466454017907381,
"num_tokens": 146700.0,
"step": 65
},
{
"entropy": 10.726875305175781,
"epoch": 0.004989664266875757,
"grad_norm": 1.9453125,
"learning_rate": 3.4500000000000005e-05,
"loss": 9.7227,
"mean_token_accuracy": 0.041810817271471026,
"num_tokens": 157606.0,
"step": 70
},
{
"entropy": 10.724038028717041,
"epoch": 0.005346068857366883,
"grad_norm": 1.9453125,
"learning_rate": 3.7e-05,
"loss": 9.664,
"mean_token_accuracy": 0.04535525776445866,
"num_tokens": 168705.0,
"step": 75
},
{
"entropy": 10.720051860809326,
"epoch": 0.005702473447858008,
"grad_norm": 2.09375,
"learning_rate": 3.95e-05,
"loss": 9.6147,
"mean_token_accuracy": 0.04609923996031284,
"num_tokens": 181497.0,
"step": 80
},
{
"entropy": 10.71345911026001,
"epoch": 0.006058878038349134,
"grad_norm": 1.9609375,
"learning_rate": 4.2000000000000004e-05,
"loss": 9.5166,
"mean_token_accuracy": 0.0461752537637949,
"num_tokens": 192991.0,
"step": 85
},
{
"entropy": 10.705201339721679,
"epoch": 0.00641528262884026,
"grad_norm": 2.109375,
"learning_rate": 4.45e-05,
"loss": 9.3949,
"mean_token_accuracy": 0.049161479249596594,
"num_tokens": 203969.0,
"step": 90
},
{
"entropy": 10.695504951477051,
"epoch": 0.006771687219331385,
"grad_norm": 1.8984375,
"learning_rate": 4.7000000000000004e-05,
"loss": 9.3681,
"mean_token_accuracy": 0.049966185539960864,
"num_tokens": 215809.0,
"step": 95
},
{
"entropy": 10.68418607711792,
"epoch": 0.007128091809822511,
"grad_norm": 1.796875,
"learning_rate": 4.9500000000000004e-05,
"loss": 9.316,
"mean_token_accuracy": 0.048291167616844176,
"num_tokens": 227826.0,
"step": 100
},
{
"entropy": 10.668262958526611,
"epoch": 0.007484496400313636,
"grad_norm": 1.9609375,
"learning_rate": 5.2e-05,
"loss": 9.1803,
"mean_token_accuracy": 0.058137640729546546,
"num_tokens": 240073.0,
"step": 105
},
{
"entropy": 10.644538402557373,
"epoch": 0.00784090099080476,
"grad_norm": 1.96875,
"learning_rate": 5.45e-05,
"loss": 9.0385,
"mean_token_accuracy": 0.057943309843540194,
"num_tokens": 251073.0,
"step": 110
},
{
"entropy": 10.616683769226075,
"epoch": 0.008197305581295887,
"grad_norm": 1.71875,
"learning_rate": 5.7e-05,
"loss": 9.0264,
"mean_token_accuracy": 0.05736844353377819,
"num_tokens": 264607.0,
"step": 115
},
{
"entropy": 10.58455696105957,
"epoch": 0.008553710171787013,
"grad_norm": 1.875,
"learning_rate": 5.9499999999999996e-05,
"loss": 8.7984,
"mean_token_accuracy": 0.06613890007138253,
"num_tokens": 275688.0,
"step": 120
},
{
"entropy": 10.523236083984376,
"epoch": 0.008910114762278138,
"grad_norm": 1.78125,
"learning_rate": 6.2e-05,
"loss": 8.652,
"mean_token_accuracy": 0.06381725408136844,
"num_tokens": 287024.0,
"step": 125
},
{
"entropy": 10.454036426544189,
"epoch": 0.009266519352769264,
"grad_norm": 1.828125,
"learning_rate": 6.450000000000001e-05,
"loss": 8.5662,
"mean_token_accuracy": 0.06661000251770019,
"num_tokens": 297605.0,
"step": 130
},
{
"entropy": 10.365349960327148,
"epoch": 0.009622923943260388,
"grad_norm": 1.828125,
"learning_rate": 6.7e-05,
"loss": 8.4279,
"mean_token_accuracy": 0.06779800169169903,
"num_tokens": 307956.0,
"step": 135
},
{
"entropy": 10.26084508895874,
"epoch": 0.009979328533751514,
"grad_norm": 1.6640625,
"learning_rate": 6.950000000000001e-05,
"loss": 8.3001,
"mean_token_accuracy": 0.06663309819996358,
"num_tokens": 318724.0,
"step": 140
},
{
"entropy": 10.160690593719483,
"epoch": 0.01033573312424264,
"grad_norm": 1.6015625,
"learning_rate": 7.2e-05,
"loss": 8.1425,
"mean_token_accuracy": 0.07099423781037331,
"num_tokens": 330488.0,
"step": 145
},
{
"entropy": 10.021271991729737,
"epoch": 0.010692137714733766,
"grad_norm": 1.359375,
"learning_rate": 7.45e-05,
"loss": 8.1226,
"mean_token_accuracy": 0.07147609815001488,
"num_tokens": 343057.0,
"step": 150
},
{
"entropy": 9.84426851272583,
"epoch": 0.011048542305224892,
"grad_norm": 1.265625,
"learning_rate": 7.7e-05,
"loss": 7.922,
"mean_token_accuracy": 0.07516647689044476,
"num_tokens": 355224.0,
"step": 155
},
{
"entropy": 9.662067031860351,
"epoch": 0.011404946895716016,
"grad_norm": 1.2421875,
"learning_rate": 7.950000000000001e-05,
"loss": 7.8644,
"mean_token_accuracy": 0.07227759584784507,
"num_tokens": 366926.0,
"step": 160
},
{
"entropy": 9.455039691925048,
"epoch": 0.011761351486207142,
"grad_norm": 1.171875,
"learning_rate": 8.2e-05,
"loss": 7.742,
"mean_token_accuracy": 0.07173869498074055,
"num_tokens": 378180.0,
"step": 165
},
{
"entropy": 9.217700099945068,
"epoch": 0.012117756076698268,
"grad_norm": 1.2265625,
"learning_rate": 8.450000000000001e-05,
"loss": 7.6739,
"mean_token_accuracy": 0.07917889729142188,
"num_tokens": 388639.0,
"step": 170
},
{
"entropy": 8.98402910232544,
"epoch": 0.012474160667189394,
"grad_norm": 1.0859375,
"learning_rate": 8.7e-05,
"loss": 7.563,
"mean_token_accuracy": 0.08437970206141472,
"num_tokens": 398752.0,
"step": 175
},
{
"entropy": 8.738731479644775,
"epoch": 0.01283056525768052,
"grad_norm": 0.88671875,
"learning_rate": 8.95e-05,
"loss": 7.4995,
"mean_token_accuracy": 0.07861107215285301,
"num_tokens": 411341.0,
"step": 180
},
{
"entropy": 8.582833385467529,
"epoch": 0.013186969848171644,
"grad_norm": 0.87890625,
"learning_rate": 9.2e-05,
"loss": 7.4019,
"mean_token_accuracy": 0.07919293940067292,
"num_tokens": 421736.0,
"step": 185
},
{
"entropy": 8.410860538482666,
"epoch": 0.01354337443866277,
"grad_norm": 0.87109375,
"learning_rate": 9.45e-05,
"loss": 7.4428,
"mean_token_accuracy": 0.08342698290944099,
"num_tokens": 432934.0,
"step": 190
},
{
"entropy": 8.250172996520996,
"epoch": 0.013899779029153896,
"grad_norm": 0.953125,
"learning_rate": 9.7e-05,
"loss": 7.3743,
"mean_token_accuracy": 0.08416533321142197,
"num_tokens": 442929.0,
"step": 195
},
{
"entropy": 8.198361492156982,
"epoch": 0.014256183619645021,
"grad_norm": 0.84375,
"learning_rate": 9.95e-05,
"loss": 7.3499,
"mean_token_accuracy": 0.08039835765957833,
"num_tokens": 455544.0,
"step": 200
},
{
"entropy": 8.08715353012085,
"epoch": 0.014612588210136147,
"grad_norm": 0.84375,
"learning_rate": 0.000102,
"loss": 7.2678,
"mean_token_accuracy": 0.08803733438253403,
"num_tokens": 466476.0,
"step": 205
},
{
"entropy": 8.042504119873048,
"epoch": 0.014968992800627271,
"grad_norm": 1.0859375,
"learning_rate": 0.00010449999999999999,
"loss": 7.2552,
"mean_token_accuracy": 0.08520074412226677,
"num_tokens": 477149.0,
"step": 210
},
{
"entropy": 7.974717617034912,
"epoch": 0.015325397391118397,
"grad_norm": 1.15625,
"learning_rate": 0.000107,
"loss": 7.3936,
"mean_token_accuracy": 0.0847919188439846,
"num_tokens": 489684.0,
"step": 215
},
{
"entropy": 7.970945692062378,
"epoch": 0.01568180198160952,
"grad_norm": 1.1484375,
"learning_rate": 0.0001095,
"loss": 7.32,
"mean_token_accuracy": 0.08788989782333374,
"num_tokens": 500724.0,
"step": 220
},
{
"entropy": 7.915714168548584,
"epoch": 0.016038206572100647,
"grad_norm": 1.2421875,
"learning_rate": 0.000112,
"loss": 7.1834,
"mean_token_accuracy": 0.09220796525478363,
"num_tokens": 511301.0,
"step": 225
},
{
"entropy": 7.900463056564331,
"epoch": 0.016394611162591773,
"grad_norm": 1.0625,
"learning_rate": 0.0001145,
"loss": 7.2187,
"mean_token_accuracy": 0.08324612528085709,
"num_tokens": 522925.0,
"step": 230
},
{
"entropy": 7.857335376739502,
"epoch": 0.0167510157530829,
"grad_norm": 1.0078125,
"learning_rate": 0.00011700000000000001,
"loss": 7.2262,
"mean_token_accuracy": 0.09082898795604706,
"num_tokens": 533742.0,
"step": 235
},
{
"entropy": 7.882049703598023,
"epoch": 0.017107420343574025,
"grad_norm": 0.89453125,
"learning_rate": 0.00011949999999999999,
"loss": 7.1824,
"mean_token_accuracy": 0.0936901956796646,
"num_tokens": 545526.0,
"step": 240
},
{
"entropy": 7.793568754196167,
"epoch": 0.01746382493406515,
"grad_norm": 0.96875,
"learning_rate": 0.000122,
"loss": 7.1257,
"mean_token_accuracy": 0.09565059095621109,
"num_tokens": 555735.0,
"step": 245
},
{
"entropy": 7.741059350967407,
"epoch": 0.017820229524556277,
"grad_norm": 1.0546875,
"learning_rate": 0.0001245,
"loss": 7.2118,
"mean_token_accuracy": 0.09219442456960678,
"num_tokens": 568443.0,
"step": 250
},
{
"entropy": 7.821925401687622,
"epoch": 0.018176634115047403,
"grad_norm": 1.0,
"learning_rate": 0.000127,
"loss": 7.1074,
"mean_token_accuracy": 0.09640756845474244,
"num_tokens": 579091.0,
"step": 255
},
{
"entropy": 7.703673696517944,
"epoch": 0.01853303870553853,
"grad_norm": 0.89453125,
"learning_rate": 0.0001295,
"loss": 7.0316,
"mean_token_accuracy": 0.09788540452718734,
"num_tokens": 591683.0,
"step": 260
},
{
"entropy": 7.649093818664551,
"epoch": 0.018889443296029654,
"grad_norm": 1.03125,
"learning_rate": 0.000132,
"loss": 7.1601,
"mean_token_accuracy": 0.09608315378427505,
"num_tokens": 603464.0,
"step": 265
},
{
"entropy": 7.753079223632812,
"epoch": 0.019245847886520777,
"grad_norm": 0.91796875,
"learning_rate": 0.00013450000000000002,
"loss": 7.2118,
"mean_token_accuracy": 0.0977549560368061,
"num_tokens": 615626.0,
"step": 270
},
{
"entropy": 7.689573907852173,
"epoch": 0.019602252477011903,
"grad_norm": 1.0703125,
"learning_rate": 0.00013700000000000002,
"loss": 7.1333,
"mean_token_accuracy": 0.09726834744215011,
"num_tokens": 627270.0,
"step": 275
},
{
"entropy": 7.662051963806152,
"epoch": 0.01995865706750303,
"grad_norm": 0.9453125,
"learning_rate": 0.0001395,
"loss": 7.0505,
"mean_token_accuracy": 0.09889725744724273,
"num_tokens": 638403.0,
"step": 280
},
{
"entropy": 7.641796112060547,
"epoch": 0.020315061657994155,
"grad_norm": 1.3046875,
"learning_rate": 0.00014199999999999998,
"loss": 7.0687,
"mean_token_accuracy": 0.10083996653556823,
"num_tokens": 650046.0,
"step": 285
},
{
"entropy": 7.634785175323486,
"epoch": 0.02067146624848528,
"grad_norm": 1.15625,
"learning_rate": 0.0001445,
"loss": 6.9997,
"mean_token_accuracy": 0.10420416370034218,
"num_tokens": 659818.0,
"step": 290
},
{
"entropy": 7.5922698974609375,
"epoch": 0.021027870838976406,
"grad_norm": 0.92578125,
"learning_rate": 0.000147,
"loss": 7.0209,
"mean_token_accuracy": 0.10451438650488853,
"num_tokens": 672404.0,
"step": 295
},
{
"entropy": 7.534389448165894,
"epoch": 0.021384275429467532,
"grad_norm": 0.93359375,
"learning_rate": 0.0001495,
"loss": 6.9976,
"mean_token_accuracy": 0.10352390706539154,
"num_tokens": 684048.0,
"step": 300
},
{
"entropy": 7.588808202743531,
"epoch": 0.021740680019958658,
"grad_norm": 1.171875,
"learning_rate": 0.000152,
"loss": 7.0077,
"mean_token_accuracy": 0.10355912148952484,
"num_tokens": 694590.0,
"step": 305
},
{
"entropy": 7.526580429077148,
"epoch": 0.022097084610449784,
"grad_norm": 0.890625,
"learning_rate": 0.00015450000000000001,
"loss": 6.9348,
"mean_token_accuracy": 0.10375382453203201,
"num_tokens": 706949.0,
"step": 310
},
{
"entropy": 7.53011155128479,
"epoch": 0.02245348920094091,
"grad_norm": 1.015625,
"learning_rate": 0.000157,
"loss": 7.0441,
"mean_token_accuracy": 0.10697530284523964,
"num_tokens": 717400.0,
"step": 315
},
{
"entropy": 7.550104141235352,
"epoch": 0.022809893791432032,
"grad_norm": 1.125,
"learning_rate": 0.0001595,
"loss": 6.9815,
"mean_token_accuracy": 0.10357886925339699,
"num_tokens": 728842.0,
"step": 320
},
{
"entropy": 7.465000009536743,
"epoch": 0.023166298381923158,
"grad_norm": 0.92578125,
"learning_rate": 0.000162,
"loss": 6.9683,
"mean_token_accuracy": 0.10274564027786255,
"num_tokens": 740598.0,
"step": 325
},
{
"entropy": 7.529222631454468,
"epoch": 0.023522702972414284,
"grad_norm": 0.94921875,
"learning_rate": 0.00016450000000000001,
"loss": 6.9989,
"mean_token_accuracy": 0.1049557864665985,
"num_tokens": 752512.0,
"step": 330
},
{
"entropy": 7.580902624130249,
"epoch": 0.02387910756290541,
"grad_norm": 1.0,
"learning_rate": 0.00016700000000000002,
"loss": 7.0602,
"mean_token_accuracy": 0.09983156248927116,
"num_tokens": 764679.0,
"step": 335
},
{
"entropy": 7.5142491340637205,
"epoch": 0.024235512153396536,
"grad_norm": 1.0703125,
"learning_rate": 0.00016950000000000003,
"loss": 7.0932,
"mean_token_accuracy": 0.10753691717982292,
"num_tokens": 776267.0,
"step": 340
},
{
"entropy": 7.439674139022827,
"epoch": 0.02459191674388766,
"grad_norm": 1.0390625,
"learning_rate": 0.00017199999999999998,
"loss": 6.8853,
"mean_token_accuracy": 0.11588529199361801,
"num_tokens": 788178.0,
"step": 345
},
{
"entropy": 7.517330646514893,
"epoch": 0.024948321334378788,
"grad_norm": 0.9765625,
"learning_rate": 0.00017449999999999999,
"loss": 6.9833,
"mean_token_accuracy": 0.11000660359859467,
"num_tokens": 798643.0,
"step": 350
},
{
"entropy": 7.445536041259766,
"epoch": 0.025304725924869913,
"grad_norm": 1.25,
"learning_rate": 0.000177,
"loss": 6.9894,
"mean_token_accuracy": 0.10883523225784301,
"num_tokens": 809448.0,
"step": 355
},
{
"entropy": 7.333874130249024,
"epoch": 0.02566113051536104,
"grad_norm": 0.99609375,
"learning_rate": 0.0001795,
"loss": 6.9268,
"mean_token_accuracy": 0.11306785941123962,
"num_tokens": 821107.0,
"step": 360
},
{
"entropy": 7.386691951751709,
"epoch": 0.02601753510585216,
"grad_norm": 1.15625,
"learning_rate": 0.000182,
"loss": 6.8761,
"mean_token_accuracy": 0.11081241220235824,
"num_tokens": 832800.0,
"step": 365
},
{
"entropy": 7.474579668045044,
"epoch": 0.026373939696343288,
"grad_norm": 0.96875,
"learning_rate": 0.0001845,
"loss": 6.928,
"mean_token_accuracy": 0.11076254919171333,
"num_tokens": 845207.0,
"step": 370
},
{
"entropy": 7.365311479568481,
"epoch": 0.026730344286834413,
"grad_norm": 1.015625,
"learning_rate": 0.000187,
"loss": 6.9474,
"mean_token_accuracy": 0.11366913244128227,
"num_tokens": 857270.0,
"step": 375
},
{
"entropy": 7.398762464523315,
"epoch": 0.02708674887732554,
"grad_norm": 0.91015625,
"learning_rate": 0.0001895,
"loss": 6.8581,
"mean_token_accuracy": 0.11230278387665749,
"num_tokens": 867892.0,
"step": 380
},
{
"entropy": 7.316660690307617,
"epoch": 0.027443153467816665,
"grad_norm": 0.91015625,
"learning_rate": 0.000192,
"loss": 6.7972,
"mean_token_accuracy": 0.10899836272001266,
"num_tokens": 879516.0,
"step": 385
},
{
"entropy": 7.332602882385254,
"epoch": 0.02779955805830779,
"grad_norm": 1.0234375,
"learning_rate": 0.0001945,
"loss": 6.7966,
"mean_token_accuracy": 0.11280329450964928,
"num_tokens": 889693.0,
"step": 390
},
{
"entropy": 7.21000304222107,
"epoch": 0.028155962648798917,
"grad_norm": 0.9765625,
"learning_rate": 0.00019700000000000002,
"loss": 6.8075,
"mean_token_accuracy": 0.11519677788019181,
"num_tokens": 901591.0,
"step": 395
},
{
"entropy": 7.289150762557983,
"epoch": 0.028512367239290043,
"grad_norm": 1.0703125,
"learning_rate": 0.00019950000000000002,
"loss": 6.7701,
"mean_token_accuracy": 0.11484072580933571,
"num_tokens": 912146.0,
"step": 400
},
{
"entropy": 7.22770209312439,
"epoch": 0.02886877182978117,
"grad_norm": 0.921875,
"learning_rate": 0.000202,
"loss": 6.6398,
"mean_token_accuracy": 0.12384215593338013,
"num_tokens": 923219.0,
"step": 405
},
{
"entropy": 7.202323579788208,
"epoch": 0.029225176420272295,
"grad_norm": 1.1953125,
"learning_rate": 0.00020449999999999998,
"loss": 6.6816,
"mean_token_accuracy": 0.12373454198241234,
"num_tokens": 934330.0,
"step": 410
},
{
"entropy": 7.256154108047485,
"epoch": 0.029581581010763417,
"grad_norm": 1.046875,
"learning_rate": 0.000207,
"loss": 6.7722,
"mean_token_accuracy": 0.11721484363079071,
"num_tokens": 944993.0,
"step": 415
},
{
"entropy": 7.258368110656738,
"epoch": 0.029937985601254543,
"grad_norm": 1.4453125,
"learning_rate": 0.0002095,
"loss": 6.8156,
"mean_token_accuracy": 0.11557363644242287,
"num_tokens": 955746.0,
"step": 420
},
{
"entropy": 7.2072389125823975,
"epoch": 0.03029439019174567,
"grad_norm": 1.0390625,
"learning_rate": 0.000212,
"loss": 6.8293,
"mean_token_accuracy": 0.11993886753916741,
"num_tokens": 966600.0,
"step": 425
},
{
"entropy": 7.266004419326782,
"epoch": 0.030650794782236795,
"grad_norm": 0.99609375,
"learning_rate": 0.0002145,
"loss": 6.805,
"mean_token_accuracy": 0.1269981436431408,
"num_tokens": 976984.0,
"step": 430
},
{
"entropy": 7.150535726547242,
"epoch": 0.03100719937272792,
"grad_norm": 0.95703125,
"learning_rate": 0.00021700000000000002,
"loss": 6.8464,
"mean_token_accuracy": 0.11060970276594162,
"num_tokens": 990221.0,
"step": 435
},
{
"entropy": 7.21864423751831,
"epoch": 0.03136360396321904,
"grad_norm": 1.2734375,
"learning_rate": 0.0002195,
"loss": 6.7375,
"mean_token_accuracy": 0.1192592665553093,
"num_tokens": 1001583.0,
"step": 440
},
{
"entropy": 7.220152044296265,
"epoch": 0.03172000855371017,
"grad_norm": 1.1953125,
"learning_rate": 0.000222,
"loss": 6.677,
"mean_token_accuracy": 0.12302321866154671,
"num_tokens": 1012170.0,
"step": 445
},
{
"entropy": 7.151835870742798,
"epoch": 0.032076413144201295,
"grad_norm": 1.125,
"learning_rate": 0.0002245,
"loss": 6.7166,
"mean_token_accuracy": 0.11390936076641082,
"num_tokens": 1022948.0,
"step": 450
},
{
"entropy": 7.09367880821228,
"epoch": 0.03243281773469242,
"grad_norm": 0.9921875,
"learning_rate": 0.00022700000000000002,
"loss": 6.7164,
"mean_token_accuracy": 0.12434423863887786,
"num_tokens": 1034764.0,
"step": 455
},
{
"entropy": 7.170623111724853,
"epoch": 0.03278922232518355,
"grad_norm": 0.9921875,
"learning_rate": 0.00022950000000000002,
"loss": 6.7499,
"mean_token_accuracy": 0.12258012518286705,
"num_tokens": 1046485.0,
"step": 460
},
{
"entropy": 7.13931450843811,
"epoch": 0.03314562691567467,
"grad_norm": 1.0390625,
"learning_rate": 0.00023200000000000003,
"loss": 6.6814,
"mean_token_accuracy": 0.11752169504761696,
"num_tokens": 1057819.0,
"step": 465
},
{
"entropy": 7.144642114639282,
"epoch": 0.0335020315061658,
"grad_norm": 1.1484375,
"learning_rate": 0.00023449999999999998,
"loss": 6.734,
"mean_token_accuracy": 0.12212828546762466,
"num_tokens": 1068905.0,
"step": 470
},
{
"entropy": 7.147123908996582,
"epoch": 0.033858436096656924,
"grad_norm": 1.09375,
"learning_rate": 0.000237,
"loss": 6.73,
"mean_token_accuracy": 0.11864650025963783,
"num_tokens": 1081033.0,
"step": 475
},
{
"entropy": 7.132015943527222,
"epoch": 0.03421484068714805,
"grad_norm": 1.1640625,
"learning_rate": 0.0002395,
"loss": 6.7168,
"mean_token_accuracy": 0.1197434201836586,
"num_tokens": 1091294.0,
"step": 480
},
{
"entropy": 6.992530441284179,
"epoch": 0.034571245277639176,
"grad_norm": 0.90234375,
"learning_rate": 0.000242,
"loss": 6.6487,
"mean_token_accuracy": 0.11802349910140038,
"num_tokens": 1103184.0,
"step": 485
},
{
"entropy": 7.111927604675293,
"epoch": 0.0349276498681303,
"grad_norm": 1.1015625,
"learning_rate": 0.0002445,
"loss": 6.7453,
"mean_token_accuracy": 0.11722799465060234,
"num_tokens": 1115141.0,
"step": 490
},
{
"entropy": 7.059013175964355,
"epoch": 0.03528405445862143,
"grad_norm": 1.0,
"learning_rate": 0.000247,
"loss": 6.6724,
"mean_token_accuracy": 0.12403023093938828,
"num_tokens": 1126021.0,
"step": 495
},
{
"entropy": 7.1118261337280275,
"epoch": 0.035640459049112554,
"grad_norm": 1.0859375,
"learning_rate": 0.0002495,
"loss": 6.7861,
"mean_token_accuracy": 0.11621439829468727,
"num_tokens": 1138198.0,
"step": 500
},
{
"entropy": 7.165898847579956,
"epoch": 0.03599686363960368,
"grad_norm": 1.0703125,
"learning_rate": 0.000252,
"loss": 6.6867,
"mean_token_accuracy": 0.12091630846261978,
"num_tokens": 1149477.0,
"step": 505
},
{
"entropy": 6.95703706741333,
"epoch": 0.036353268230094805,
"grad_norm": 1.171875,
"learning_rate": 0.0002545,
"loss": 6.658,
"mean_token_accuracy": 0.1214058168232441,
"num_tokens": 1160088.0,
"step": 510
},
{
"entropy": 7.09820671081543,
"epoch": 0.03670967282058593,
"grad_norm": 1.1328125,
"learning_rate": 0.000257,
"loss": 6.644,
"mean_token_accuracy": 0.119209773093462,
"num_tokens": 1171592.0,
"step": 515
},
{
"entropy": 6.949794054031372,
"epoch": 0.03706607741107706,
"grad_norm": 1.1796875,
"learning_rate": 0.0002595,
"loss": 6.5107,
"mean_token_accuracy": 0.12729595527052878,
"num_tokens": 1182696.0,
"step": 520
},
{
"entropy": 6.995568799972534,
"epoch": 0.03742248200156818,
"grad_norm": 0.93359375,
"learning_rate": 0.000262,
"loss": 6.6161,
"mean_token_accuracy": 0.12147256955504418,
"num_tokens": 1194334.0,
"step": 525
},
{
"entropy": 7.04883918762207,
"epoch": 0.03777888659205931,
"grad_norm": 0.96484375,
"learning_rate": 0.00026450000000000003,
"loss": 6.7079,
"mean_token_accuracy": 0.11811556592583657,
"num_tokens": 1206258.0,
"step": 530
},
{
"entropy": 6.914236545562744,
"epoch": 0.03813529118255043,
"grad_norm": 1.0234375,
"learning_rate": 0.00026700000000000004,
"loss": 6.6213,
"mean_token_accuracy": 0.1181189239025116,
"num_tokens": 1219233.0,
"step": 535
},
{
"entropy": 7.0149024486541744,
"epoch": 0.038491695773041554,
"grad_norm": 1.0625,
"learning_rate": 0.00026950000000000005,
"loss": 6.6481,
"mean_token_accuracy": 0.12671870738267899,
"num_tokens": 1230581.0,
"step": 540
},
{
"entropy": 7.061033487319946,
"epoch": 0.03884810036353268,
"grad_norm": 0.99609375,
"learning_rate": 0.00027200000000000005,
"loss": 6.6519,
"mean_token_accuracy": 0.12108869552612304,
"num_tokens": 1242046.0,
"step": 545
},
{
"entropy": 7.034649324417114,
"epoch": 0.039204504954023806,
"grad_norm": 1.0078125,
"learning_rate": 0.0002745,
"loss": 6.6349,
"mean_token_accuracy": 0.12597717642784118,
"num_tokens": 1254167.0,
"step": 550
},
{
"entropy": 6.992681217193604,
"epoch": 0.03956090954451493,
"grad_norm": 1.1015625,
"learning_rate": 0.000277,
"loss": 6.6283,
"mean_token_accuracy": 0.12463193610310555,
"num_tokens": 1265613.0,
"step": 555
},
{
"entropy": 7.001772451400757,
"epoch": 0.03991731413500606,
"grad_norm": 0.95703125,
"learning_rate": 0.0002795,
"loss": 6.7235,
"mean_token_accuracy": 0.12044223845005035,
"num_tokens": 1277347.0,
"step": 560
},
{
"entropy": 7.027985954284668,
"epoch": 0.04027371872549718,
"grad_norm": 1.0078125,
"learning_rate": 0.00028199999999999997,
"loss": 6.6211,
"mean_token_accuracy": 0.1214037649333477,
"num_tokens": 1289523.0,
"step": 565
},
{
"entropy": 6.880720520019532,
"epoch": 0.04063012331598831,
"grad_norm": 0.890625,
"learning_rate": 0.0002845,
"loss": 6.5531,
"mean_token_accuracy": 0.12212896570563317,
"num_tokens": 1302811.0,
"step": 570
},
{
"entropy": 6.998388957977295,
"epoch": 0.040986527906479435,
"grad_norm": 1.1484375,
"learning_rate": 0.000287,
"loss": 6.5889,
"mean_token_accuracy": 0.12987946718931198,
"num_tokens": 1313312.0,
"step": 575
},
{
"entropy": 6.876024341583252,
"epoch": 0.04134293249697056,
"grad_norm": 1.1796875,
"learning_rate": 0.0002895,
"loss": 6.5007,
"mean_token_accuracy": 0.12956202328205108,
"num_tokens": 1324211.0,
"step": 580
},
{
"entropy": 6.991645812988281,
"epoch": 0.04169933708746169,
"grad_norm": 1.078125,
"learning_rate": 0.000292,
"loss": 6.5618,
"mean_token_accuracy": 0.12750987112522125,
"num_tokens": 1334630.0,
"step": 585
},
{
"entropy": 6.935083198547363,
"epoch": 0.04205574167795281,
"grad_norm": 1.0234375,
"learning_rate": 0.0002945,
"loss": 6.6521,
"mean_token_accuracy": 0.11829652786254882,
"num_tokens": 1346765.0,
"step": 590
},
{
"entropy": 6.905052947998047,
"epoch": 0.04241214626844394,
"grad_norm": 1.0234375,
"learning_rate": 0.000297,
"loss": 6.5791,
"mean_token_accuracy": 0.12493314743041992,
"num_tokens": 1358328.0,
"step": 595
},
{
"entropy": 6.977377986907959,
"epoch": 0.042768550858935064,
"grad_norm": 1.125,
"learning_rate": 0.0002995,
"loss": 6.5177,
"mean_token_accuracy": 0.12914821356534958,
"num_tokens": 1369679.0,
"step": 600
},
{
"entropy": 6.795419549942016,
"epoch": 0.04312495544942619,
"grad_norm": 1.1328125,
"learning_rate": 0.000302,
"loss": 6.4988,
"mean_token_accuracy": 0.131401277333498,
"num_tokens": 1380819.0,
"step": 605
},
{
"entropy": 6.811457586288452,
"epoch": 0.043481360039917316,
"grad_norm": 1.0546875,
"learning_rate": 0.0003045,
"loss": 6.4622,
"mean_token_accuracy": 0.13207267299294473,
"num_tokens": 1391634.0,
"step": 610
},
{
"entropy": 6.793901538848877,
"epoch": 0.04383776463040844,
"grad_norm": 1.1171875,
"learning_rate": 0.000307,
"loss": 6.4491,
"mean_token_accuracy": 0.13501692414283753,
"num_tokens": 1403502.0,
"step": 615
},
{
"entropy": 6.929700136184692,
"epoch": 0.04419416922089957,
"grad_norm": 1.109375,
"learning_rate": 0.0003095,
"loss": 6.6266,
"mean_token_accuracy": 0.12311487495899201,
"num_tokens": 1415154.0,
"step": 620
},
{
"entropy": 6.988297605514527,
"epoch": 0.044550573811390694,
"grad_norm": 1.0546875,
"learning_rate": 0.000312,
"loss": 6.6518,
"mean_token_accuracy": 0.12687993273139,
"num_tokens": 1427373.0,
"step": 625
},
{
"entropy": 6.761775636672974,
"epoch": 0.04490697840188182,
"grad_norm": 1.0625,
"learning_rate": 0.0003145,
"loss": 6.4766,
"mean_token_accuracy": 0.12533363997936248,
"num_tokens": 1438366.0,
"step": 630
},
{
"entropy": 6.912030506134033,
"epoch": 0.04526338299237294,
"grad_norm": 1.1484375,
"learning_rate": 0.000317,
"loss": 6.5966,
"mean_token_accuracy": 0.12334503754973411,
"num_tokens": 1450263.0,
"step": 635
},
{
"entropy": 6.9853339195251465,
"epoch": 0.045619787582864064,
"grad_norm": 0.921875,
"learning_rate": 0.0003195,
"loss": 6.6467,
"mean_token_accuracy": 0.12394749969244004,
"num_tokens": 1461545.0,
"step": 640
},
{
"entropy": 6.7714978694915775,
"epoch": 0.04597619217335519,
"grad_norm": 1.09375,
"learning_rate": 0.000322,
"loss": 6.5482,
"mean_token_accuracy": 0.13250895142555236,
"num_tokens": 1472475.0,
"step": 645
},
{
"entropy": 6.914073848724366,
"epoch": 0.046332596763846316,
"grad_norm": 1.171875,
"learning_rate": 0.00032450000000000003,
"loss": 6.5147,
"mean_token_accuracy": 0.12853944823145866,
"num_tokens": 1483360.0,
"step": 650
},
{
"entropy": 6.7364819049835205,
"epoch": 0.04668900135433744,
"grad_norm": 0.9765625,
"learning_rate": 0.00032700000000000003,
"loss": 6.5725,
"mean_token_accuracy": 0.126601692289114,
"num_tokens": 1495306.0,
"step": 655
},
{
"entropy": 6.908847141265869,
"epoch": 0.04704540594482857,
"grad_norm": 1.1640625,
"learning_rate": 0.00032950000000000004,
"loss": 6.4701,
"mean_token_accuracy": 0.1324954815208912,
"num_tokens": 1506595.0,
"step": 660
},
{
"entropy": 6.72453932762146,
"epoch": 0.047401810535319694,
"grad_norm": 1.0,
"learning_rate": 0.00033200000000000005,
"loss": 6.4883,
"mean_token_accuracy": 0.1351894736289978,
"num_tokens": 1517657.0,
"step": 665
},
{
"entropy": 6.76901330947876,
"epoch": 0.04775821512581082,
"grad_norm": 1.1875,
"learning_rate": 0.00033450000000000005,
"loss": 6.5066,
"mean_token_accuracy": 0.12837395146489144,
"num_tokens": 1528780.0,
"step": 670
},
{
"entropy": 6.883447074890137,
"epoch": 0.048114619716301946,
"grad_norm": 1.109375,
"learning_rate": 0.000337,
"loss": 6.6557,
"mean_token_accuracy": 0.12886545956134796,
"num_tokens": 1541282.0,
"step": 675
},
{
"entropy": 6.983727931976318,
"epoch": 0.04847102430679307,
"grad_norm": 0.921875,
"learning_rate": 0.0003395,
"loss": 6.6294,
"mean_token_accuracy": 0.12646585181355477,
"num_tokens": 1552176.0,
"step": 680
},
{
"entropy": 6.7384772300720215,
"epoch": 0.0488274288972842,
"grad_norm": 1.078125,
"learning_rate": 0.000342,
"loss": 6.4845,
"mean_token_accuracy": 0.13945906087756157,
"num_tokens": 1562610.0,
"step": 685
},
{
"entropy": 6.775937175750732,
"epoch": 0.04918383348777532,
"grad_norm": 0.98828125,
"learning_rate": 0.00034449999999999997,
"loss": 6.5136,
"mean_token_accuracy": 0.13401032537221907,
"num_tokens": 1573800.0,
"step": 690
},
{
"entropy": 6.877204656600952,
"epoch": 0.04954023807826645,
"grad_norm": 1.03125,
"learning_rate": 0.000347,
"loss": 6.4827,
"mean_token_accuracy": 0.13020721524953843,
"num_tokens": 1584090.0,
"step": 695
},
{
"entropy": 6.9024406433105465,
"epoch": 0.049896642668757575,
"grad_norm": 1.09375,
"learning_rate": 0.0003495,
"loss": 6.6362,
"mean_token_accuracy": 0.1303427055478096,
"num_tokens": 1595784.0,
"step": 700
},
{
"entropy": 6.756772804260254,
"epoch": 0.0502530472592487,
"grad_norm": 0.98046875,
"learning_rate": 0.000352,
"loss": 6.482,
"mean_token_accuracy": 0.13334475085139275,
"num_tokens": 1607655.0,
"step": 705
},
{
"entropy": 6.8570647716522215,
"epoch": 0.05060945184973983,
"grad_norm": 1.0546875,
"learning_rate": 0.0003545,
"loss": 6.5875,
"mean_token_accuracy": 0.124277064204216,
"num_tokens": 1619488.0,
"step": 710
},
{
"entropy": 6.745927190780639,
"epoch": 0.05096585644023095,
"grad_norm": 0.97265625,
"learning_rate": 0.000357,
"loss": 6.429,
"mean_token_accuracy": 0.13606646284461021,
"num_tokens": 1631854.0,
"step": 715
},
{
"entropy": 6.785527133941651,
"epoch": 0.05132226103072208,
"grad_norm": 0.87109375,
"learning_rate": 0.0003595,
"loss": 6.4182,
"mean_token_accuracy": 0.13637634217739106,
"num_tokens": 1643039.0,
"step": 720
},
{
"entropy": 6.759277868270874,
"epoch": 0.051678665621213205,
"grad_norm": 1.2578125,
"learning_rate": 0.000362,
"loss": 6.4038,
"mean_token_accuracy": 0.13771493583917618,
"num_tokens": 1654398.0,
"step": 725
},
{
"entropy": 6.646927261352539,
"epoch": 0.05203507021170432,
"grad_norm": 0.9921875,
"learning_rate": 0.0003645,
"loss": 6.4415,
"mean_token_accuracy": 0.1340085059404373,
"num_tokens": 1665853.0,
"step": 730
},
{
"entropy": 6.707148218154908,
"epoch": 0.05239147480219545,
"grad_norm": 0.9296875,
"learning_rate": 0.000367,
"loss": 6.5177,
"mean_token_accuracy": 0.12795716300606727,
"num_tokens": 1677116.0,
"step": 735
},
{
"entropy": 6.809055185317993,
"epoch": 0.052747879392686575,
"grad_norm": 0.96484375,
"learning_rate": 0.0003695,
"loss": 6.4727,
"mean_token_accuracy": 0.12375391125679017,
"num_tokens": 1688429.0,
"step": 740
},
{
"entropy": 6.689341831207275,
"epoch": 0.0531042839831777,
"grad_norm": 1.1015625,
"learning_rate": 0.000372,
"loss": 6.4236,
"mean_token_accuracy": 0.12736357524991035,
"num_tokens": 1698462.0,
"step": 745
},
{
"entropy": 6.835480451583862,
"epoch": 0.05346068857366883,
"grad_norm": 0.97265625,
"learning_rate": 0.0003745,
"loss": 6.5816,
"mean_token_accuracy": 0.12983981892466545,
"num_tokens": 1710856.0,
"step": 750
},
{
"entropy": 6.8312695026397705,
"epoch": 0.05381709316415995,
"grad_norm": 0.9453125,
"learning_rate": 0.000377,
"loss": 6.4812,
"mean_token_accuracy": 0.13393254578113556,
"num_tokens": 1721241.0,
"step": 755
},
{
"entropy": 6.739031744003296,
"epoch": 0.05417349775465108,
"grad_norm": 0.93359375,
"learning_rate": 0.0003795,
"loss": 6.5516,
"mean_token_accuracy": 0.12359286397695542,
"num_tokens": 1733352.0,
"step": 760
},
{
"entropy": 6.7102278709411625,
"epoch": 0.054529902345142205,
"grad_norm": 0.97265625,
"learning_rate": 0.000382,
"loss": 6.4266,
"mean_token_accuracy": 0.13157257735729216,
"num_tokens": 1744935.0,
"step": 765
},
{
"entropy": 6.713577079772949,
"epoch": 0.05488630693563333,
"grad_norm": 1.125,
"learning_rate": 0.0003845,
"loss": 6.5414,
"mean_token_accuracy": 0.13242409154772758,
"num_tokens": 1756853.0,
"step": 770
},
{
"entropy": 6.73391637802124,
"epoch": 0.055242711526124456,
"grad_norm": 1.015625,
"learning_rate": 0.00038700000000000003,
"loss": 6.4323,
"mean_token_accuracy": 0.13262861594557762,
"num_tokens": 1768563.0,
"step": 775
},
{
"entropy": 6.727639198303223,
"epoch": 0.05559911611661558,
"grad_norm": 0.94140625,
"learning_rate": 0.00038950000000000003,
"loss": 6.4837,
"mean_token_accuracy": 0.1318040557205677,
"num_tokens": 1781122.0,
"step": 780
},
{
"entropy": 6.765384674072266,
"epoch": 0.05595552070710671,
"grad_norm": 1.0859375,
"learning_rate": 0.00039200000000000004,
"loss": 6.4905,
"mean_token_accuracy": 0.1305277794599533,
"num_tokens": 1792844.0,
"step": 785
},
{
"entropy": 6.762694787979126,
"epoch": 0.056311925297597834,
"grad_norm": 0.9921875,
"learning_rate": 0.00039450000000000005,
"loss": 6.5816,
"mean_token_accuracy": 0.13148098587989807,
"num_tokens": 1804558.0,
"step": 790
},
{
"entropy": 6.628223323822022,
"epoch": 0.05666832988808896,
"grad_norm": 0.984375,
"learning_rate": 0.00039700000000000005,
"loss": 6.3768,
"mean_token_accuracy": 0.1320876434445381,
"num_tokens": 1818413.0,
"step": 795
},
{
"entropy": 6.7265161037445065,
"epoch": 0.057024734478580086,
"grad_norm": 0.9609375,
"learning_rate": 0.0003995,
"loss": 6.434,
"mean_token_accuracy": 0.12983452826738356,
"num_tokens": 1828987.0,
"step": 800
},
{
"entropy": 6.651925802230835,
"epoch": 0.05738113906907121,
"grad_norm": 1.109375,
"learning_rate": 0.000402,
"loss": 6.3597,
"mean_token_accuracy": 0.13189667835831642,
"num_tokens": 1839797.0,
"step": 805
},
{
"entropy": 6.78912935256958,
"epoch": 0.05773754365956234,
"grad_norm": 0.984375,
"learning_rate": 0.0004045,
"loss": 6.5578,
"mean_token_accuracy": 0.13069733381271362,
"num_tokens": 1850979.0,
"step": 810
},
{
"entropy": 6.611517429351807,
"epoch": 0.05809394825005346,
"grad_norm": 1.0078125,
"learning_rate": 0.00040699999999999997,
"loss": 6.3432,
"mean_token_accuracy": 0.12866022661328316,
"num_tokens": 1862328.0,
"step": 815
},
{
"entropy": 6.648383569717407,
"epoch": 0.05845035284054459,
"grad_norm": 1.109375,
"learning_rate": 0.0004095,
"loss": 6.2747,
"mean_token_accuracy": 0.13372489884495736,
"num_tokens": 1872347.0,
"step": 820
},
{
"entropy": 6.708392572402954,
"epoch": 0.05880675743103571,
"grad_norm": 1.0625,
"learning_rate": 0.000412,
"loss": 6.5044,
"mean_token_accuracy": 0.13602936267852783,
"num_tokens": 1883523.0,
"step": 825
},
{
"entropy": 6.62314805984497,
"epoch": 0.059163162021526834,
"grad_norm": 0.890625,
"learning_rate": 0.0004145,
"loss": 6.4716,
"mean_token_accuracy": 0.13223329558968544,
"num_tokens": 1895686.0,
"step": 830
},
{
"entropy": 6.793389987945557,
"epoch": 0.05951956661201796,
"grad_norm": 1.046875,
"learning_rate": 0.000417,
"loss": 6.555,
"mean_token_accuracy": 0.13007057085633278,
"num_tokens": 1908262.0,
"step": 835
},
{
"entropy": 6.7379124641418455,
"epoch": 0.059875971202509086,
"grad_norm": 1.0859375,
"learning_rate": 0.0004195,
"loss": 6.4524,
"mean_token_accuracy": 0.13491783887147904,
"num_tokens": 1919907.0,
"step": 840
},
{
"entropy": 6.659872436523438,
"epoch": 0.06023237579300021,
"grad_norm": 0.9609375,
"learning_rate": 0.000422,
"loss": 6.3794,
"mean_token_accuracy": 0.13242117315530777,
"num_tokens": 1931671.0,
"step": 845
},
{
"entropy": 6.677573537826538,
"epoch": 0.06058878038349134,
"grad_norm": 1.0390625,
"learning_rate": 0.0004245,
"loss": 6.4063,
"mean_token_accuracy": 0.1419834591448307,
"num_tokens": 1941687.0,
"step": 850
},
{
"entropy": 6.6825648784637455,
"epoch": 0.060945184973982464,
"grad_norm": 1.0078125,
"learning_rate": 0.000427,
"loss": 6.4172,
"mean_token_accuracy": 0.13183393254876136,
"num_tokens": 1953444.0,
"step": 855
},
{
"entropy": 6.597352790832519,
"epoch": 0.06130158956447359,
"grad_norm": 1.0546875,
"learning_rate": 0.0004295,
"loss": 6.4252,
"mean_token_accuracy": 0.1228848785161972,
"num_tokens": 1964999.0,
"step": 860
},
{
"entropy": 6.660594177246094,
"epoch": 0.061657994154964715,
"grad_norm": 1.03125,
"learning_rate": 0.000432,
"loss": 6.4603,
"mean_token_accuracy": 0.12707777544856072,
"num_tokens": 1977452.0,
"step": 865
},
{
"entropy": 6.819603204727173,
"epoch": 0.06201439874545584,
"grad_norm": 1.0390625,
"learning_rate": 0.0004345,
"loss": 6.5555,
"mean_token_accuracy": 0.12444835752248765,
"num_tokens": 1988362.0,
"step": 870
},
{
"entropy": 6.520086097717285,
"epoch": 0.06237080333594697,
"grad_norm": 1.0625,
"learning_rate": 0.000437,
"loss": 6.3114,
"mean_token_accuracy": 0.13859584480524062,
"num_tokens": 2000201.0,
"step": 875
},
{
"entropy": 6.698511362075806,
"epoch": 0.06272720792643809,
"grad_norm": 0.921875,
"learning_rate": 0.0004395,
"loss": 6.4336,
"mean_token_accuracy": 0.13139647170901297,
"num_tokens": 2011944.0,
"step": 880
},
{
"entropy": 6.610819149017334,
"epoch": 0.06308361251692922,
"grad_norm": 1.046875,
"learning_rate": 0.000442,
"loss": 6.456,
"mean_token_accuracy": 0.1323610559105873,
"num_tokens": 2023630.0,
"step": 885
},
{
"entropy": 6.629882764816284,
"epoch": 0.06344001710742034,
"grad_norm": 0.92578125,
"learning_rate": 0.0004445,
"loss": 6.4278,
"mean_token_accuracy": 0.1294134572148323,
"num_tokens": 2036171.0,
"step": 890
},
{
"entropy": 6.699557304382324,
"epoch": 0.06379642169791147,
"grad_norm": 0.79296875,
"learning_rate": 0.000447,
"loss": 6.441,
"mean_token_accuracy": 0.13226123079657554,
"num_tokens": 2049504.0,
"step": 895
},
{
"entropy": 6.537369918823242,
"epoch": 0.06415282628840259,
"grad_norm": 1.2421875,
"learning_rate": 0.00044950000000000003,
"loss": 6.383,
"mean_token_accuracy": 0.13730206191539765,
"num_tokens": 2059325.0,
"step": 900
},
{
"entropy": 6.74651985168457,
"epoch": 0.06450923087889372,
"grad_norm": 1.1015625,
"learning_rate": 0.00045200000000000004,
"loss": 6.4479,
"mean_token_accuracy": 0.13434667736291886,
"num_tokens": 2070412.0,
"step": 905
},
{
"entropy": 6.6923853874206545,
"epoch": 0.06486563546938484,
"grad_norm": 1.0234375,
"learning_rate": 0.00045450000000000004,
"loss": 6.4556,
"mean_token_accuracy": 0.1349116161465645,
"num_tokens": 2080236.0,
"step": 910
},
{
"entropy": 6.508125162124633,
"epoch": 0.06522204005987597,
"grad_norm": 1.0078125,
"learning_rate": 0.00045700000000000005,
"loss": 6.354,
"mean_token_accuracy": 0.12869082465767862,
"num_tokens": 2091518.0,
"step": 915
},
{
"entropy": 6.685258865356445,
"epoch": 0.0655784446503671,
"grad_norm": 0.94921875,
"learning_rate": 0.00045950000000000006,
"loss": 6.3914,
"mean_token_accuracy": 0.13282919228076934,
"num_tokens": 2101516.0,
"step": 920
},
{
"entropy": 6.615972900390625,
"epoch": 0.06593484924085823,
"grad_norm": 1.0234375,
"learning_rate": 0.000462,
"loss": 6.3598,
"mean_token_accuracy": 0.1325875200331211,
"num_tokens": 2112528.0,
"step": 925
},
{
"entropy": 6.45463752746582,
"epoch": 0.06629125383134934,
"grad_norm": 1.109375,
"learning_rate": 0.0004645,
"loss": 6.2579,
"mean_token_accuracy": 0.13719168826937675,
"num_tokens": 2123141.0,
"step": 930
},
{
"entropy": 6.491483449935913,
"epoch": 0.06664765842184048,
"grad_norm": 0.92578125,
"learning_rate": 0.000467,
"loss": 6.2799,
"mean_token_accuracy": 0.13875195309519767,
"num_tokens": 2133846.0,
"step": 935
},
{
"entropy": 6.569090509414673,
"epoch": 0.0670040630123316,
"grad_norm": 0.9921875,
"learning_rate": 0.0004695,
"loss": 6.3159,
"mean_token_accuracy": 0.1401278555393219,
"num_tokens": 2145149.0,
"step": 940
},
{
"entropy": 6.563496923446655,
"epoch": 0.06736046760282273,
"grad_norm": 0.96484375,
"learning_rate": 0.000472,
"loss": 6.4206,
"mean_token_accuracy": 0.1346551574766636,
"num_tokens": 2157701.0,
"step": 945
},
{
"entropy": 6.657681465148926,
"epoch": 0.06771687219331385,
"grad_norm": 1.03125,
"learning_rate": 0.0004745,
"loss": 6.5454,
"mean_token_accuracy": 0.12614896148443222,
"num_tokens": 2169628.0,
"step": 950
},
{
"entropy": 6.63694200515747,
"epoch": 0.06807327678380498,
"grad_norm": 1.09375,
"learning_rate": 0.000477,
"loss": 6.4097,
"mean_token_accuracy": 0.1357708416879177,
"num_tokens": 2180514.0,
"step": 955
},
{
"entropy": 6.544112730026245,
"epoch": 0.0684296813742961,
"grad_norm": 1.015625,
"learning_rate": 0.0004795,
"loss": 6.3959,
"mean_token_accuracy": 0.13459453284740447,
"num_tokens": 2191444.0,
"step": 960
},
{
"entropy": 6.548870086669922,
"epoch": 0.06878608596478723,
"grad_norm": 1.046875,
"learning_rate": 0.000482,
"loss": 6.2975,
"mean_token_accuracy": 0.14402723759412767,
"num_tokens": 2201697.0,
"step": 965
},
{
"entropy": 6.695021486282348,
"epoch": 0.06914249055527835,
"grad_norm": 0.921875,
"learning_rate": 0.0004845,
"loss": 6.4719,
"mean_token_accuracy": 0.1333928443491459,
"num_tokens": 2214445.0,
"step": 970
},
{
"entropy": 6.353151130676269,
"epoch": 0.06949889514576947,
"grad_norm": 1.171875,
"learning_rate": 0.000487,
"loss": 6.3057,
"mean_token_accuracy": 0.1354503057897091,
"num_tokens": 2225641.0,
"step": 975
},
{
"entropy": 6.599798679351807,
"epoch": 0.0698552997362606,
"grad_norm": 0.9921875,
"learning_rate": 0.0004895,
"loss": 6.3392,
"mean_token_accuracy": 0.13334417194128037,
"num_tokens": 2236361.0,
"step": 980
},
{
"entropy": 6.480152273178101,
"epoch": 0.07021170432675172,
"grad_norm": 0.984375,
"learning_rate": 0.000492,
"loss": 6.2559,
"mean_token_accuracy": 0.13550300300121307,
"num_tokens": 2248165.0,
"step": 985
},
{
"entropy": 6.541980743408203,
"epoch": 0.07056810891724286,
"grad_norm": 1.046875,
"learning_rate": 0.0004945,
"loss": 6.3156,
"mean_token_accuracy": 0.13731209933757782,
"num_tokens": 2259620.0,
"step": 990
},
{
"entropy": 6.51890196800232,
"epoch": 0.07092451350773397,
"grad_norm": 1.09375,
"learning_rate": 0.000497,
"loss": 6.3517,
"mean_token_accuracy": 0.13439717069268226,
"num_tokens": 2272002.0,
"step": 995
},
{
"entropy": 6.613651514053345,
"epoch": 0.07128091809822511,
"grad_norm": 1.0078125,
"learning_rate": 0.0004995,
"loss": 6.3743,
"mean_token_accuracy": 0.13549346923828126,
"num_tokens": 2283141.0,
"step": 1000
}
],
"logging_steps": 5,
"max_steps": 4000,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 539080254259200.0,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}