2339 lines
61 KiB
JSON
2339 lines
61 KiB
JSON
{
|
|
"best_global_step": null,
|
|
"best_metric": null,
|
|
"best_model_checkpoint": null,
|
|
"epoch": 3.0,
|
|
"eval_steps": 500,
|
|
"global_step": 255,
|
|
"is_hyper_param_search": false,
|
|
"is_local_process_zero": true,
|
|
"is_world_process_zero": true,
|
|
"log_history": [
|
|
{
|
|
"epoch": 0.011869436201780416,
|
|
"grad_norm": 3.2152560893850857,
|
|
"learning_rate": 0.0,
|
|
"loss": 0.1236,
|
|
"mean_token_accuracy": 0.7561265975236893,
|
|
"num_tokens": 2290573.0,
|
|
"step": 1
|
|
},
|
|
{
|
|
"epoch": 0.02373887240356083,
|
|
"grad_norm": 3.2250172975911267,
|
|
"learning_rate": 3.846153846153846e-08,
|
|
"loss": 0.1248,
|
|
"mean_token_accuracy": 0.7545289695262909,
|
|
"num_tokens": 4622867.0,
|
|
"step": 2
|
|
},
|
|
{
|
|
"epoch": 0.03560830860534125,
|
|
"grad_norm": 3.180844229549486,
|
|
"learning_rate": 7.692307692307692e-08,
|
|
"loss": 0.124,
|
|
"mean_token_accuracy": 0.7563015222549438,
|
|
"num_tokens": 6978673.0,
|
|
"step": 3
|
|
},
|
|
{
|
|
"epoch": 0.04747774480712166,
|
|
"grad_norm": 3.15672198495362,
|
|
"learning_rate": 1.1538461538461539e-07,
|
|
"loss": 0.1237,
|
|
"mean_token_accuracy": 0.7567781209945679,
|
|
"num_tokens": 9318885.0,
|
|
"step": 4
|
|
},
|
|
{
|
|
"epoch": 0.05934718100890208,
|
|
"grad_norm": 3.2124564799598487,
|
|
"learning_rate": 1.5384615384615385e-07,
|
|
"loss": 0.1247,
|
|
"mean_token_accuracy": 0.7538372427225113,
|
|
"num_tokens": 11597297.0,
|
|
"step": 5
|
|
},
|
|
{
|
|
"epoch": 0.0712166172106825,
|
|
"grad_norm": 3.1463219947916956,
|
|
"learning_rate": 1.9230769230769231e-07,
|
|
"loss": 0.1234,
|
|
"mean_token_accuracy": 0.7577445954084396,
|
|
"num_tokens": 13949095.0,
|
|
"step": 6
|
|
},
|
|
{
|
|
"epoch": 0.0830860534124629,
|
|
"grad_norm": 3.045421841462273,
|
|
"learning_rate": 2.3076923076923078e-07,
|
|
"loss": 0.1231,
|
|
"mean_token_accuracy": 0.7580108344554901,
|
|
"num_tokens": 16313689.0,
|
|
"step": 7
|
|
},
|
|
{
|
|
"epoch": 0.09495548961424333,
|
|
"grad_norm": 3.016510432486079,
|
|
"learning_rate": 2.692307692307692e-07,
|
|
"loss": 0.1232,
|
|
"mean_token_accuracy": 0.7580540329217911,
|
|
"num_tokens": 18719486.0,
|
|
"step": 8
|
|
},
|
|
{
|
|
"epoch": 0.10682492581602374,
|
|
"grad_norm": 2.8629431606764797,
|
|
"learning_rate": 3.076923076923077e-07,
|
|
"loss": 0.1227,
|
|
"mean_token_accuracy": 0.7579344063997269,
|
|
"num_tokens": 21103818.0,
|
|
"step": 9
|
|
},
|
|
{
|
|
"epoch": 0.11869436201780416,
|
|
"grad_norm": 2.8611765713147768,
|
|
"learning_rate": 3.461538461538461e-07,
|
|
"loss": 0.1223,
|
|
"mean_token_accuracy": 0.757907822728157,
|
|
"num_tokens": 23444913.0,
|
|
"step": 10
|
|
},
|
|
{
|
|
"epoch": 0.13056379821958458,
|
|
"grad_norm": 2.8642594746974255,
|
|
"learning_rate": 3.8461538461538463e-07,
|
|
"loss": 0.1217,
|
|
"mean_token_accuracy": 0.7570387870073318,
|
|
"num_tokens": 25694202.0,
|
|
"step": 11
|
|
},
|
|
{
|
|
"epoch": 0.142433234421365,
|
|
"grad_norm": 2.7118303715943166,
|
|
"learning_rate": 4.2307692307692304e-07,
|
|
"loss": 0.118,
|
|
"mean_token_accuracy": 0.7608297020196915,
|
|
"num_tokens": 28031822.0,
|
|
"step": 12
|
|
},
|
|
{
|
|
"epoch": 0.1543026706231454,
|
|
"grad_norm": 2.715697922376162,
|
|
"learning_rate": 4.6153846153846156e-07,
|
|
"loss": 0.1185,
|
|
"mean_token_accuracy": 0.7603854835033417,
|
|
"num_tokens": 30396499.0,
|
|
"step": 13
|
|
},
|
|
{
|
|
"epoch": 0.1661721068249258,
|
|
"grad_norm": 2.6891820203118137,
|
|
"learning_rate": 5e-07,
|
|
"loss": 0.1172,
|
|
"mean_token_accuracy": 0.7601627558469772,
|
|
"num_tokens": 32701303.0,
|
|
"step": 14
|
|
},
|
|
{
|
|
"epoch": 0.17804154302670624,
|
|
"grad_norm": 2.656581515248564,
|
|
"learning_rate": 5.384615384615384e-07,
|
|
"loss": 0.1159,
|
|
"mean_token_accuracy": 0.7632767111063004,
|
|
"num_tokens": 35046898.0,
|
|
"step": 15
|
|
},
|
|
{
|
|
"epoch": 0.18991097922848665,
|
|
"grad_norm": 2.4373233814061366,
|
|
"learning_rate": 5.769230769230768e-07,
|
|
"loss": 0.1059,
|
|
"mean_token_accuracy": 0.766400933265686,
|
|
"num_tokens": 37364426.0,
|
|
"step": 16
|
|
},
|
|
{
|
|
"epoch": 0.20178041543026706,
|
|
"grad_norm": 2.411335795566316,
|
|
"learning_rate": 6.153846153846154e-07,
|
|
"loss": 0.1046,
|
|
"mean_token_accuracy": 0.7666898667812347,
|
|
"num_tokens": 39707009.0,
|
|
"step": 17
|
|
},
|
|
{
|
|
"epoch": 0.21364985163204747,
|
|
"grad_norm": 2.367446160082905,
|
|
"learning_rate": 6.538461538461538e-07,
|
|
"loss": 0.103,
|
|
"mean_token_accuracy": 0.7664102017879486,
|
|
"num_tokens": 42034841.0,
|
|
"step": 18
|
|
},
|
|
{
|
|
"epoch": 0.22551928783382788,
|
|
"grad_norm": 2.4710146547034415,
|
|
"learning_rate": 6.923076923076922e-07,
|
|
"loss": 0.0987,
|
|
"mean_token_accuracy": 0.7710998058319092,
|
|
"num_tokens": 44353533.0,
|
|
"step": 19
|
|
},
|
|
{
|
|
"epoch": 0.23738872403560832,
|
|
"grad_norm": 2.8127852020593305,
|
|
"learning_rate": 7.307692307692307e-07,
|
|
"loss": 0.0972,
|
|
"mean_token_accuracy": 0.7685794085264206,
|
|
"num_tokens": 46679052.0,
|
|
"step": 20
|
|
},
|
|
{
|
|
"epoch": 0.24925816023738873,
|
|
"grad_norm": 4.605724908775716,
|
|
"learning_rate": 7.692307692307693e-07,
|
|
"loss": 0.0861,
|
|
"mean_token_accuracy": 0.7683484256267548,
|
|
"num_tokens": 48999106.0,
|
|
"step": 21
|
|
},
|
|
{
|
|
"epoch": 0.26112759643916916,
|
|
"grad_norm": 8.204623188359811,
|
|
"learning_rate": 8.076923076923077e-07,
|
|
"loss": 0.054,
|
|
"mean_token_accuracy": 0.7688327878713608,
|
|
"num_tokens": 51302017.0,
|
|
"step": 22
|
|
},
|
|
{
|
|
"epoch": 0.27299703264094954,
|
|
"grad_norm": 9.224224001158943,
|
|
"learning_rate": 8.461538461538461e-07,
|
|
"loss": 0.0721,
|
|
"mean_token_accuracy": 0.7725718915462494,
|
|
"num_tokens": 53657033.0,
|
|
"step": 23
|
|
},
|
|
{
|
|
"epoch": 0.28486646884273,
|
|
"grad_norm": 7.595568015739181,
|
|
"learning_rate": 8.846153846153846e-07,
|
|
"loss": 0.0585,
|
|
"mean_token_accuracy": 0.7722394913434982,
|
|
"num_tokens": 56006517.0,
|
|
"step": 24
|
|
},
|
|
{
|
|
"epoch": 0.29673590504451036,
|
|
"grad_norm": 4.2367804861684295,
|
|
"learning_rate": 9.230769230769231e-07,
|
|
"loss": 0.0389,
|
|
"mean_token_accuracy": 0.7716410011053085,
|
|
"num_tokens": 58305048.0,
|
|
"step": 25
|
|
},
|
|
{
|
|
"epoch": 0.3086053412462908,
|
|
"grad_norm": 2.895203467405504,
|
|
"learning_rate": 9.615384615384615e-07,
|
|
"loss": 0.0408,
|
|
"mean_token_accuracy": 0.7746732085943222,
|
|
"num_tokens": 60608727.0,
|
|
"step": 26
|
|
},
|
|
{
|
|
"epoch": 0.32047477744807124,
|
|
"grad_norm": 1.6331453127362403,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0324,
|
|
"mean_token_accuracy": 0.7731764614582062,
|
|
"num_tokens": 62941824.0,
|
|
"step": 27
|
|
},
|
|
{
|
|
"epoch": 0.3323442136498516,
|
|
"grad_norm": 1.296971047666381,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0346,
|
|
"mean_token_accuracy": 0.7756147533655167,
|
|
"num_tokens": 65293785.0,
|
|
"step": 28
|
|
},
|
|
{
|
|
"epoch": 0.34421364985163205,
|
|
"grad_norm": 1.003701485513675,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0296,
|
|
"mean_token_accuracy": 0.775902733206749,
|
|
"num_tokens": 67669747.0,
|
|
"step": 29
|
|
},
|
|
{
|
|
"epoch": 0.3560830860534125,
|
|
"grad_norm": 1.2860005142743778,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0322,
|
|
"mean_token_accuracy": 0.7794527858495712,
|
|
"num_tokens": 69955657.0,
|
|
"step": 30
|
|
},
|
|
{
|
|
"epoch": 0.36795252225519287,
|
|
"grad_norm": 0.44191619760108036,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0271,
|
|
"mean_token_accuracy": 0.7809270471334457,
|
|
"num_tokens": 72284850.0,
|
|
"step": 31
|
|
},
|
|
{
|
|
"epoch": 0.3798219584569733,
|
|
"grad_norm": 0.37103617260075983,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0256,
|
|
"mean_token_accuracy": 0.7824061512947083,
|
|
"num_tokens": 74603521.0,
|
|
"step": 32
|
|
},
|
|
{
|
|
"epoch": 0.3916913946587537,
|
|
"grad_norm": 0.38582934408257835,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0254,
|
|
"mean_token_accuracy": 0.7847687900066376,
|
|
"num_tokens": 76911416.0,
|
|
"step": 33
|
|
},
|
|
{
|
|
"epoch": 0.4035608308605341,
|
|
"grad_norm": 0.656214906274882,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0221,
|
|
"mean_token_accuracy": 0.7871638685464859,
|
|
"num_tokens": 79263237.0,
|
|
"step": 34
|
|
},
|
|
{
|
|
"epoch": 0.41543026706231456,
|
|
"grad_norm": 1.5134308178097498,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0283,
|
|
"mean_token_accuracy": 0.7896798700094223,
|
|
"num_tokens": 81610384.0,
|
|
"step": 35
|
|
},
|
|
{
|
|
"epoch": 0.42729970326409494,
|
|
"grad_norm": 0.39991737309081576,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0215,
|
|
"mean_token_accuracy": 0.7910042405128479,
|
|
"num_tokens": 83874502.0,
|
|
"step": 36
|
|
},
|
|
{
|
|
"epoch": 0.4391691394658754,
|
|
"grad_norm": 0.6400470364557864,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0196,
|
|
"mean_token_accuracy": 0.7916673272848129,
|
|
"num_tokens": 86201988.0,
|
|
"step": 37
|
|
},
|
|
{
|
|
"epoch": 0.45103857566765576,
|
|
"grad_norm": 0.9613971093559055,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0255,
|
|
"mean_token_accuracy": 0.7909542322158813,
|
|
"num_tokens": 88524461.0,
|
|
"step": 38
|
|
},
|
|
{
|
|
"epoch": 0.4629080118694362,
|
|
"grad_norm": 0.3123629244119897,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0218,
|
|
"mean_token_accuracy": 0.7927649170160294,
|
|
"num_tokens": 90872811.0,
|
|
"step": 39
|
|
},
|
|
{
|
|
"epoch": 0.47477744807121663,
|
|
"grad_norm": 0.7557028662953238,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0199,
|
|
"mean_token_accuracy": 0.7952917069196701,
|
|
"num_tokens": 93247501.0,
|
|
"step": 40
|
|
},
|
|
{
|
|
"epoch": 0.486646884272997,
|
|
"grad_norm": 0.3499598586063452,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.022,
|
|
"mean_token_accuracy": 0.7959036231040955,
|
|
"num_tokens": 95548846.0,
|
|
"step": 41
|
|
},
|
|
{
|
|
"epoch": 0.49851632047477745,
|
|
"grad_norm": 0.8203042850137877,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0231,
|
|
"mean_token_accuracy": 0.7958742678165436,
|
|
"num_tokens": 97864181.0,
|
|
"step": 42
|
|
},
|
|
{
|
|
"epoch": 0.5103857566765578,
|
|
"grad_norm": 0.4487900989758514,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0205,
|
|
"mean_token_accuracy": 0.8000545054674149,
|
|
"num_tokens": 100184907.0,
|
|
"step": 43
|
|
},
|
|
{
|
|
"epoch": 0.5222551928783383,
|
|
"grad_norm": 1.5465814758998127,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.019,
|
|
"mean_token_accuracy": 0.7995493113994598,
|
|
"num_tokens": 102549749.0,
|
|
"step": 44
|
|
},
|
|
{
|
|
"epoch": 0.5341246290801187,
|
|
"grad_norm": 1.059419007142133,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0188,
|
|
"mean_token_accuracy": 0.8000313937664032,
|
|
"num_tokens": 104889657.0,
|
|
"step": 45
|
|
},
|
|
{
|
|
"epoch": 0.5459940652818991,
|
|
"grad_norm": 0.5480083288262315,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0188,
|
|
"mean_token_accuracy": 0.8024607598781586,
|
|
"num_tokens": 107212972.0,
|
|
"step": 46
|
|
},
|
|
{
|
|
"epoch": 0.5578635014836796,
|
|
"grad_norm": 0.30635884751887604,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.021,
|
|
"mean_token_accuracy": 0.8047385960817337,
|
|
"num_tokens": 109542877.0,
|
|
"step": 47
|
|
},
|
|
{
|
|
"epoch": 0.56973293768546,
|
|
"grad_norm": 0.21179889070009844,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0203,
|
|
"mean_token_accuracy": 0.8036370128393173,
|
|
"num_tokens": 111901284.0,
|
|
"step": 48
|
|
},
|
|
{
|
|
"epoch": 0.5816023738872403,
|
|
"grad_norm": 0.32565712115141265,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0187,
|
|
"mean_token_accuracy": 0.8056425452232361,
|
|
"num_tokens": 114222715.0,
|
|
"step": 49
|
|
},
|
|
{
|
|
"epoch": 0.5934718100890207,
|
|
"grad_norm": 0.2139623505486364,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0198,
|
|
"mean_token_accuracy": 0.8063786029815674,
|
|
"num_tokens": 116550504.0,
|
|
"step": 50
|
|
},
|
|
{
|
|
"epoch": 0.6053412462908012,
|
|
"grad_norm": 0.21003258324082552,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0191,
|
|
"mean_token_accuracy": 0.8063046187162399,
|
|
"num_tokens": 118879158.0,
|
|
"step": 51
|
|
},
|
|
{
|
|
"epoch": 0.6172106824925816,
|
|
"grad_norm": 0.21142146859940075,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0174,
|
|
"mean_token_accuracy": 0.8085653483867645,
|
|
"num_tokens": 121239325.0,
|
|
"step": 52
|
|
},
|
|
{
|
|
"epoch": 0.629080118694362,
|
|
"grad_norm": 0.6865432724807192,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0182,
|
|
"mean_token_accuracy": 0.8079569041728973,
|
|
"num_tokens": 123554680.0,
|
|
"step": 53
|
|
},
|
|
{
|
|
"epoch": 0.6409495548961425,
|
|
"grad_norm": 0.19490009185097878,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0188,
|
|
"mean_token_accuracy": 0.8106120377779007,
|
|
"num_tokens": 125926535.0,
|
|
"step": 54
|
|
},
|
|
{
|
|
"epoch": 0.6528189910979229,
|
|
"grad_norm": 0.1712228222680173,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0179,
|
|
"mean_token_accuracy": 0.8121017813682556,
|
|
"num_tokens": 128256735.0,
|
|
"step": 55
|
|
},
|
|
{
|
|
"epoch": 0.6646884272997032,
|
|
"grad_norm": 0.22336238069013759,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0171,
|
|
"mean_token_accuracy": 0.8105458319187164,
|
|
"num_tokens": 130584073.0,
|
|
"step": 56
|
|
},
|
|
{
|
|
"epoch": 0.6765578635014837,
|
|
"grad_norm": 0.19214931716936623,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0178,
|
|
"mean_token_accuracy": 0.8113240301609039,
|
|
"num_tokens": 132957955.0,
|
|
"step": 57
|
|
},
|
|
{
|
|
"epoch": 0.6884272997032641,
|
|
"grad_norm": 0.32172016855259117,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0187,
|
|
"mean_token_accuracy": 0.8138258010149002,
|
|
"num_tokens": 135277884.0,
|
|
"step": 58
|
|
},
|
|
{
|
|
"epoch": 0.7002967359050445,
|
|
"grad_norm": 0.20903648169932504,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0185,
|
|
"mean_token_accuracy": 0.8124063462018967,
|
|
"num_tokens": 137619581.0,
|
|
"step": 59
|
|
},
|
|
{
|
|
"epoch": 0.712166172106825,
|
|
"grad_norm": 0.2260588940643747,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0165,
|
|
"mean_token_accuracy": 0.8144129067659378,
|
|
"num_tokens": 139936030.0,
|
|
"step": 60
|
|
},
|
|
{
|
|
"epoch": 0.7240356083086054,
|
|
"grad_norm": 0.2260799216293802,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0162,
|
|
"mean_token_accuracy": 0.8165196180343628,
|
|
"num_tokens": 142288664.0,
|
|
"step": 61
|
|
},
|
|
{
|
|
"epoch": 0.7359050445103857,
|
|
"grad_norm": 0.30108772849879634,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0173,
|
|
"mean_token_accuracy": 0.8164613097906113,
|
|
"num_tokens": 144615793.0,
|
|
"step": 62
|
|
},
|
|
{
|
|
"epoch": 0.7477744807121661,
|
|
"grad_norm": 0.19947249163422276,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0181,
|
|
"mean_token_accuracy": 0.8176918923854828,
|
|
"num_tokens": 146938433.0,
|
|
"step": 63
|
|
},
|
|
{
|
|
"epoch": 0.7596439169139466,
|
|
"grad_norm": 0.5752104928113616,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0177,
|
|
"mean_token_accuracy": 0.8165967762470245,
|
|
"num_tokens": 149212095.0,
|
|
"step": 64
|
|
},
|
|
{
|
|
"epoch": 0.771513353115727,
|
|
"grad_norm": 0.1881435567519284,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0164,
|
|
"mean_token_accuracy": 0.819744199514389,
|
|
"num_tokens": 151589218.0,
|
|
"step": 65
|
|
},
|
|
{
|
|
"epoch": 0.7833827893175074,
|
|
"grad_norm": 0.18988664730955299,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.016,
|
|
"mean_token_accuracy": 0.8202340602874756,
|
|
"num_tokens": 153929077.0,
|
|
"step": 66
|
|
},
|
|
{
|
|
"epoch": 0.7952522255192879,
|
|
"grad_norm": 0.18129508603745173,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0165,
|
|
"mean_token_accuracy": 0.8181180208921432,
|
|
"num_tokens": 156230987.0,
|
|
"step": 67
|
|
},
|
|
{
|
|
"epoch": 0.8071216617210683,
|
|
"grad_norm": 0.1858689260213232,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0169,
|
|
"mean_token_accuracy": 0.8191461265087128,
|
|
"num_tokens": 158571534.0,
|
|
"step": 68
|
|
},
|
|
{
|
|
"epoch": 0.8189910979228486,
|
|
"grad_norm": 0.18529854391133757,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0166,
|
|
"mean_token_accuracy": 0.8206346482038498,
|
|
"num_tokens": 160953244.0,
|
|
"step": 69
|
|
},
|
|
{
|
|
"epoch": 0.8308605341246291,
|
|
"grad_norm": 0.22598596715227354,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0161,
|
|
"mean_token_accuracy": 0.8196168690919876,
|
|
"num_tokens": 163286609.0,
|
|
"step": 70
|
|
},
|
|
{
|
|
"epoch": 0.8427299703264095,
|
|
"grad_norm": 0.21883347135946216,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0154,
|
|
"mean_token_accuracy": 0.8231918811798096,
|
|
"num_tokens": 165621992.0,
|
|
"step": 71
|
|
},
|
|
{
|
|
"epoch": 0.8545994065281899,
|
|
"grad_norm": 0.20328656692656982,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0156,
|
|
"mean_token_accuracy": 0.8234526813030243,
|
|
"num_tokens": 167934474.0,
|
|
"step": 72
|
|
},
|
|
{
|
|
"epoch": 0.8664688427299704,
|
|
"grad_norm": 0.2005816896751338,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.016,
|
|
"mean_token_accuracy": 0.8232927918434143,
|
|
"num_tokens": 170244497.0,
|
|
"step": 73
|
|
},
|
|
{
|
|
"epoch": 0.8783382789317508,
|
|
"grad_norm": 0.6704266095860585,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0162,
|
|
"mean_token_accuracy": 0.8247952312231064,
|
|
"num_tokens": 172605697.0,
|
|
"step": 74
|
|
},
|
|
{
|
|
"epoch": 0.8902077151335311,
|
|
"grad_norm": 0.20941852657090568,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0164,
|
|
"mean_token_accuracy": 0.8257458209991455,
|
|
"num_tokens": 174938829.0,
|
|
"step": 75
|
|
},
|
|
{
|
|
"epoch": 0.9020771513353115,
|
|
"grad_norm": 0.18457885049747738,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0159,
|
|
"mean_token_accuracy": 0.8246800750494003,
|
|
"num_tokens": 177294957.0,
|
|
"step": 76
|
|
},
|
|
{
|
|
"epoch": 0.913946587537092,
|
|
"grad_norm": 0.19835676628847007,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0152,
|
|
"mean_token_accuracy": 0.824032798409462,
|
|
"num_tokens": 179640704.0,
|
|
"step": 77
|
|
},
|
|
{
|
|
"epoch": 0.9258160237388724,
|
|
"grad_norm": 0.18815116390339623,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0151,
|
|
"mean_token_accuracy": 0.8243458718061447,
|
|
"num_tokens": 181920396.0,
|
|
"step": 78
|
|
},
|
|
{
|
|
"epoch": 0.9376854599406528,
|
|
"grad_norm": 0.17175746479890108,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0154,
|
|
"mean_token_accuracy": 0.8257217854261398,
|
|
"num_tokens": 184269534.0,
|
|
"step": 79
|
|
},
|
|
{
|
|
"epoch": 0.9495548961424333,
|
|
"grad_norm": 0.1769618930984516,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0159,
|
|
"mean_token_accuracy": 0.8259020298719406,
|
|
"num_tokens": 186567793.0,
|
|
"step": 80
|
|
},
|
|
{
|
|
"epoch": 0.9614243323442137,
|
|
"grad_norm": 0.17228034191641364,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0159,
|
|
"mean_token_accuracy": 0.8267694860696793,
|
|
"num_tokens": 188908485.0,
|
|
"step": 81
|
|
},
|
|
{
|
|
"epoch": 0.973293768545994,
|
|
"grad_norm": 0.16245335547796955,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0152,
|
|
"mean_token_accuracy": 0.8268506079912186,
|
|
"num_tokens": 191247414.0,
|
|
"step": 82
|
|
},
|
|
{
|
|
"epoch": 0.9851632047477745,
|
|
"grad_norm": 0.16633248758859392,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0149,
|
|
"mean_token_accuracy": 0.8266868740320206,
|
|
"num_tokens": 193555228.0,
|
|
"step": 83
|
|
},
|
|
{
|
|
"epoch": 0.9970326409495549,
|
|
"grad_norm": 0.15415109235043925,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0147,
|
|
"mean_token_accuracy": 0.8292517513036728,
|
|
"num_tokens": 195890489.0,
|
|
"step": 84
|
|
},
|
|
{
|
|
"epoch": 1.0,
|
|
"grad_norm": 0.15415109235043925,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0148,
|
|
"mean_token_accuracy": 0.8305932879447937,
|
|
"num_tokens": 196469724.0,
|
|
"step": 85
|
|
},
|
|
{
|
|
"epoch": 1.0118694362017804,
|
|
"grad_norm": 0.3116761327588541,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.015,
|
|
"mean_token_accuracy": 0.8279892951250076,
|
|
"num_tokens": 198776243.0,
|
|
"step": 86
|
|
},
|
|
{
|
|
"epoch": 1.0237388724035608,
|
|
"grad_norm": 0.15328286040468705,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0148,
|
|
"mean_token_accuracy": 0.8283537775278091,
|
|
"num_tokens": 201114145.0,
|
|
"step": 87
|
|
},
|
|
{
|
|
"epoch": 1.0356083086053411,
|
|
"grad_norm": 0.14358827014965028,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0145,
|
|
"mean_token_accuracy": 0.8292107433080673,
|
|
"num_tokens": 203439954.0,
|
|
"step": 88
|
|
},
|
|
{
|
|
"epoch": 1.0474777448071217,
|
|
"grad_norm": 0.16474629583827105,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0143,
|
|
"mean_token_accuracy": 0.8285880088806152,
|
|
"num_tokens": 205758410.0,
|
|
"step": 89
|
|
},
|
|
{
|
|
"epoch": 1.0593471810089021,
|
|
"grad_norm": 0.16140309025289706,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0145,
|
|
"mean_token_accuracy": 0.8287246972322464,
|
|
"num_tokens": 208102565.0,
|
|
"step": 90
|
|
},
|
|
{
|
|
"epoch": 1.0712166172106825,
|
|
"grad_norm": 0.43186301641011227,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0147,
|
|
"mean_token_accuracy": 0.8308908343315125,
|
|
"num_tokens": 210428123.0,
|
|
"step": 91
|
|
},
|
|
{
|
|
"epoch": 1.083086053412463,
|
|
"grad_norm": 0.16167921560279802,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0148,
|
|
"mean_token_accuracy": 0.8303626775741577,
|
|
"num_tokens": 212732633.0,
|
|
"step": 92
|
|
},
|
|
{
|
|
"epoch": 1.0949554896142433,
|
|
"grad_norm": 0.1521272030530282,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0143,
|
|
"mean_token_accuracy": 0.8308236747980118,
|
|
"num_tokens": 215071035.0,
|
|
"step": 93
|
|
},
|
|
{
|
|
"epoch": 1.1068249258160237,
|
|
"grad_norm": 0.1459922203085822,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0138,
|
|
"mean_token_accuracy": 0.8315918147563934,
|
|
"num_tokens": 217409841.0,
|
|
"step": 94
|
|
},
|
|
{
|
|
"epoch": 1.1186943620178043,
|
|
"grad_norm": 0.14671738915695245,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0138,
|
|
"mean_token_accuracy": 0.8309248983860016,
|
|
"num_tokens": 219774305.0,
|
|
"step": 95
|
|
},
|
|
{
|
|
"epoch": 1.1305637982195846,
|
|
"grad_norm": 0.15835230953085352,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0141,
|
|
"mean_token_accuracy": 0.8289886116981506,
|
|
"num_tokens": 222112932.0,
|
|
"step": 96
|
|
},
|
|
{
|
|
"epoch": 1.142433234421365,
|
|
"grad_norm": 0.15298535579566455,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0143,
|
|
"mean_token_accuracy": 0.832336962223053,
|
|
"num_tokens": 224479751.0,
|
|
"step": 97
|
|
},
|
|
{
|
|
"epoch": 1.1543026706231454,
|
|
"grad_norm": 0.16280640448166128,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0146,
|
|
"mean_token_accuracy": 0.8312350958585739,
|
|
"num_tokens": 226782508.0,
|
|
"step": 98
|
|
},
|
|
{
|
|
"epoch": 1.1661721068249258,
|
|
"grad_norm": 0.14918333917916343,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0145,
|
|
"mean_token_accuracy": 0.8335230201482773,
|
|
"num_tokens": 229151318.0,
|
|
"step": 99
|
|
},
|
|
{
|
|
"epoch": 1.1780415430267062,
|
|
"grad_norm": 0.4428864325379026,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0144,
|
|
"mean_token_accuracy": 0.8327280879020691,
|
|
"num_tokens": 231530591.0,
|
|
"step": 100
|
|
},
|
|
{
|
|
"epoch": 1.1899109792284865,
|
|
"grad_norm": 0.14841270277863286,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0143,
|
|
"mean_token_accuracy": 0.8321553170681,
|
|
"num_tokens": 233874169.0,
|
|
"step": 101
|
|
},
|
|
{
|
|
"epoch": 1.2017804154302671,
|
|
"grad_norm": 0.14971279511543792,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0141,
|
|
"mean_token_accuracy": 0.8340474963188171,
|
|
"num_tokens": 236202847.0,
|
|
"step": 102
|
|
},
|
|
{
|
|
"epoch": 1.2136498516320475,
|
|
"grad_norm": 0.15636738838016948,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0141,
|
|
"mean_token_accuracy": 0.8326583802700043,
|
|
"num_tokens": 238496908.0,
|
|
"step": 103
|
|
},
|
|
{
|
|
"epoch": 1.225519287833828,
|
|
"grad_norm": 0.14271065708831393,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0139,
|
|
"mean_token_accuracy": 0.8338731080293655,
|
|
"num_tokens": 240836612.0,
|
|
"step": 104
|
|
},
|
|
{
|
|
"epoch": 1.2373887240356083,
|
|
"grad_norm": 0.1517830747389464,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0138,
|
|
"mean_token_accuracy": 0.8339741975069046,
|
|
"num_tokens": 243136145.0,
|
|
"step": 105
|
|
},
|
|
{
|
|
"epoch": 1.2492581602373887,
|
|
"grad_norm": 0.15281126492836827,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0137,
|
|
"mean_token_accuracy": 0.8339486122131348,
|
|
"num_tokens": 245441963.0,
|
|
"step": 106
|
|
},
|
|
{
|
|
"epoch": 1.2611275964391693,
|
|
"grad_norm": 0.14617900308909745,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0135,
|
|
"mean_token_accuracy": 0.8357819467782974,
|
|
"num_tokens": 247743217.0,
|
|
"step": 107
|
|
},
|
|
{
|
|
"epoch": 1.2729970326409497,
|
|
"grad_norm": 0.15096069913133417,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0137,
|
|
"mean_token_accuracy": 0.8328426033258438,
|
|
"num_tokens": 250034174.0,
|
|
"step": 108
|
|
},
|
|
{
|
|
"epoch": 1.28486646884273,
|
|
"grad_norm": 0.15808705772186424,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0135,
|
|
"mean_token_accuracy": 0.8353458195924759,
|
|
"num_tokens": 252348356.0,
|
|
"step": 109
|
|
},
|
|
{
|
|
"epoch": 1.2967359050445104,
|
|
"grad_norm": 0.1542848580507735,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0136,
|
|
"mean_token_accuracy": 0.8328954726457596,
|
|
"num_tokens": 254711594.0,
|
|
"step": 110
|
|
},
|
|
{
|
|
"epoch": 1.3086053412462908,
|
|
"grad_norm": 0.14257758395451306,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0133,
|
|
"mean_token_accuracy": 0.8376496732234955,
|
|
"num_tokens": 257069717.0,
|
|
"step": 111
|
|
},
|
|
{
|
|
"epoch": 1.3204747774480712,
|
|
"grad_norm": 0.14630270733389236,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0136,
|
|
"mean_token_accuracy": 0.8342637121677399,
|
|
"num_tokens": 259405653.0,
|
|
"step": 112
|
|
},
|
|
{
|
|
"epoch": 1.3323442136498516,
|
|
"grad_norm": 0.14776285808192977,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0134,
|
|
"mean_token_accuracy": 0.8369212299585342,
|
|
"num_tokens": 261764259.0,
|
|
"step": 113
|
|
},
|
|
{
|
|
"epoch": 1.344213649851632,
|
|
"grad_norm": 0.14394383070686967,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0134,
|
|
"mean_token_accuracy": 0.835752010345459,
|
|
"num_tokens": 264094762.0,
|
|
"step": 114
|
|
},
|
|
{
|
|
"epoch": 1.3560830860534125,
|
|
"grad_norm": 0.14740626096483098,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0135,
|
|
"mean_token_accuracy": 0.834359273314476,
|
|
"num_tokens": 266419945.0,
|
|
"step": 115
|
|
},
|
|
{
|
|
"epoch": 1.367952522255193,
|
|
"grad_norm": 0.14330925732922073,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0136,
|
|
"mean_token_accuracy": 0.8366974145174026,
|
|
"num_tokens": 268740456.0,
|
|
"step": 116
|
|
},
|
|
{
|
|
"epoch": 1.3798219584569733,
|
|
"grad_norm": 0.14038054641496378,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0137,
|
|
"mean_token_accuracy": 0.8354261368513107,
|
|
"num_tokens": 271100261.0,
|
|
"step": 117
|
|
},
|
|
{
|
|
"epoch": 1.3916913946587537,
|
|
"grad_norm": 0.15724481228055495,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0137,
|
|
"mean_token_accuracy": 0.8347800672054291,
|
|
"num_tokens": 273474328.0,
|
|
"step": 118
|
|
},
|
|
{
|
|
"epoch": 1.403560830860534,
|
|
"grad_norm": 0.1484066047013235,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0133,
|
|
"mean_token_accuracy": 0.8368805050849915,
|
|
"num_tokens": 275857483.0,
|
|
"step": 119
|
|
},
|
|
{
|
|
"epoch": 1.4154302670623147,
|
|
"grad_norm": 0.1473992990225255,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0132,
|
|
"mean_token_accuracy": 0.8345441520214081,
|
|
"num_tokens": 278183382.0,
|
|
"step": 120
|
|
},
|
|
{
|
|
"epoch": 1.427299703264095,
|
|
"grad_norm": 0.16523066796882357,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0133,
|
|
"mean_token_accuracy": 0.8347988724708557,
|
|
"num_tokens": 280514091.0,
|
|
"step": 121
|
|
},
|
|
{
|
|
"epoch": 1.4391691394658754,
|
|
"grad_norm": 0.15491677799543688,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0132,
|
|
"mean_token_accuracy": 0.8360999226570129,
|
|
"num_tokens": 282827601.0,
|
|
"step": 122
|
|
},
|
|
{
|
|
"epoch": 1.4510385756676558,
|
|
"grad_norm": 0.1458927506912295,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0135,
|
|
"mean_token_accuracy": 0.8346279263496399,
|
|
"num_tokens": 285151149.0,
|
|
"step": 123
|
|
},
|
|
{
|
|
"epoch": 1.4629080118694362,
|
|
"grad_norm": 0.15213550829495853,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0134,
|
|
"mean_token_accuracy": 0.8380093276500702,
|
|
"num_tokens": 287506862.0,
|
|
"step": 124
|
|
},
|
|
{
|
|
"epoch": 1.4747774480712166,
|
|
"grad_norm": 0.15101959050706015,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0134,
|
|
"mean_token_accuracy": 0.8388644456863403,
|
|
"num_tokens": 289797993.0,
|
|
"step": 125
|
|
},
|
|
{
|
|
"epoch": 1.486646884272997,
|
|
"grad_norm": 0.1529188388270889,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0132,
|
|
"mean_token_accuracy": 0.8372837603092194,
|
|
"num_tokens": 292152610.0,
|
|
"step": 126
|
|
},
|
|
{
|
|
"epoch": 1.4985163204747773,
|
|
"grad_norm": 0.15956653351254294,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.013,
|
|
"mean_token_accuracy": 0.8359941095113754,
|
|
"num_tokens": 294492312.0,
|
|
"step": 127
|
|
},
|
|
{
|
|
"epoch": 1.5103857566765577,
|
|
"grad_norm": 0.16204266215433016,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0128,
|
|
"mean_token_accuracy": 0.8374476432800293,
|
|
"num_tokens": 296772069.0,
|
|
"step": 128
|
|
},
|
|
{
|
|
"epoch": 1.5222551928783383,
|
|
"grad_norm": 0.15838949036341246,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.013,
|
|
"mean_token_accuracy": 0.8375313878059387,
|
|
"num_tokens": 299112026.0,
|
|
"step": 129
|
|
},
|
|
{
|
|
"epoch": 1.5341246290801187,
|
|
"grad_norm": 0.1619935011228884,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0134,
|
|
"mean_token_accuracy": 0.8367749005556107,
|
|
"num_tokens": 301495450.0,
|
|
"step": 130
|
|
},
|
|
{
|
|
"epoch": 1.545994065281899,
|
|
"grad_norm": 0.1667534822016722,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0136,
|
|
"mean_token_accuracy": 0.8385860025882721,
|
|
"num_tokens": 303809823.0,
|
|
"step": 131
|
|
},
|
|
{
|
|
"epoch": 1.5578635014836797,
|
|
"grad_norm": 0.15787418632638234,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0133,
|
|
"mean_token_accuracy": 0.8404732644557953,
|
|
"num_tokens": 306143694.0,
|
|
"step": 132
|
|
},
|
|
{
|
|
"epoch": 1.56973293768546,
|
|
"grad_norm": 0.1537006266420476,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.013,
|
|
"mean_token_accuracy": 0.8377364575862885,
|
|
"num_tokens": 308481147.0,
|
|
"step": 133
|
|
},
|
|
{
|
|
"epoch": 1.5816023738872405,
|
|
"grad_norm": 0.17442338202026778,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0128,
|
|
"mean_token_accuracy": 0.836244747042656,
|
|
"num_tokens": 310796457.0,
|
|
"step": 134
|
|
},
|
|
{
|
|
"epoch": 1.5934718100890208,
|
|
"grad_norm": 0.1540260482572547,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0125,
|
|
"mean_token_accuracy": 0.8393439203500748,
|
|
"num_tokens": 313100776.0,
|
|
"step": 135
|
|
},
|
|
{
|
|
"epoch": 1.6053412462908012,
|
|
"grad_norm": 0.14884715059614773,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0125,
|
|
"mean_token_accuracy": 0.840284675359726,
|
|
"num_tokens": 315418773.0,
|
|
"step": 136
|
|
},
|
|
{
|
|
"epoch": 1.6172106824925816,
|
|
"grad_norm": 0.1640251983845523,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0126,
|
|
"mean_token_accuracy": 0.8392654955387115,
|
|
"num_tokens": 317734140.0,
|
|
"step": 137
|
|
},
|
|
{
|
|
"epoch": 1.629080118694362,
|
|
"grad_norm": 0.16419139059139087,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.013,
|
|
"mean_token_accuracy": 0.8366883993148804,
|
|
"num_tokens": 320059666.0,
|
|
"step": 138
|
|
},
|
|
{
|
|
"epoch": 1.6409495548961424,
|
|
"grad_norm": 0.15175337858368157,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0129,
|
|
"mean_token_accuracy": 0.8394629508256912,
|
|
"num_tokens": 322408540.0,
|
|
"step": 139
|
|
},
|
|
{
|
|
"epoch": 1.6528189910979227,
|
|
"grad_norm": 0.1565466228997984,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0128,
|
|
"mean_token_accuracy": 0.839805543422699,
|
|
"num_tokens": 324741984.0,
|
|
"step": 140
|
|
},
|
|
{
|
|
"epoch": 1.6646884272997031,
|
|
"grad_norm": 0.1389576374622122,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0128,
|
|
"mean_token_accuracy": 0.8384060859680176,
|
|
"num_tokens": 327109403.0,
|
|
"step": 141
|
|
},
|
|
{
|
|
"epoch": 1.6765578635014837,
|
|
"grad_norm": 0.15532855949301472,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0128,
|
|
"mean_token_accuracy": 0.837606817483902,
|
|
"num_tokens": 329444999.0,
|
|
"step": 142
|
|
},
|
|
{
|
|
"epoch": 1.688427299703264,
|
|
"grad_norm": 0.14877020894799647,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0127,
|
|
"mean_token_accuracy": 0.838249072432518,
|
|
"num_tokens": 331731405.0,
|
|
"step": 143
|
|
},
|
|
{
|
|
"epoch": 1.7002967359050445,
|
|
"grad_norm": 0.147980619157775,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0126,
|
|
"mean_token_accuracy": 0.8386299908161163,
|
|
"num_tokens": 334075941.0,
|
|
"step": 144
|
|
},
|
|
{
|
|
"epoch": 1.712166172106825,
|
|
"grad_norm": 0.15493682132303654,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0126,
|
|
"mean_token_accuracy": 0.8392934054136276,
|
|
"num_tokens": 336440607.0,
|
|
"step": 145
|
|
},
|
|
{
|
|
"epoch": 1.7240356083086055,
|
|
"grad_norm": 0.14934338807249498,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.013,
|
|
"mean_token_accuracy": 0.8383898288011551,
|
|
"num_tokens": 338785529.0,
|
|
"step": 146
|
|
},
|
|
{
|
|
"epoch": 1.7359050445103859,
|
|
"grad_norm": 0.15072592104622665,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0129,
|
|
"mean_token_accuracy": 0.8399733155965805,
|
|
"num_tokens": 341137059.0,
|
|
"step": 147
|
|
},
|
|
{
|
|
"epoch": 1.7477744807121662,
|
|
"grad_norm": 0.15102947486779117,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.013,
|
|
"mean_token_accuracy": 0.8390212655067444,
|
|
"num_tokens": 343488213.0,
|
|
"step": 148
|
|
},
|
|
{
|
|
"epoch": 1.7596439169139466,
|
|
"grad_norm": 0.15006590483088414,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0128,
|
|
"mean_token_accuracy": 0.8411392271518707,
|
|
"num_tokens": 345832373.0,
|
|
"step": 149
|
|
},
|
|
{
|
|
"epoch": 1.771513353115727,
|
|
"grad_norm": 0.15391072195800817,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0128,
|
|
"mean_token_accuracy": 0.8399299085140228,
|
|
"num_tokens": 348192657.0,
|
|
"step": 150
|
|
},
|
|
{
|
|
"epoch": 1.7833827893175074,
|
|
"grad_norm": 0.15678563955781627,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0126,
|
|
"mean_token_accuracy": 0.839920163154602,
|
|
"num_tokens": 350476440.0,
|
|
"step": 151
|
|
},
|
|
{
|
|
"epoch": 1.7952522255192878,
|
|
"grad_norm": 0.15773625831181937,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0125,
|
|
"mean_token_accuracy": 0.8385206013917923,
|
|
"num_tokens": 352793879.0,
|
|
"step": 152
|
|
},
|
|
{
|
|
"epoch": 1.8071216617210681,
|
|
"grad_norm": 0.15487188249536785,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0124,
|
|
"mean_token_accuracy": 0.8399877697229385,
|
|
"num_tokens": 355144216.0,
|
|
"step": 153
|
|
},
|
|
{
|
|
"epoch": 1.8189910979228485,
|
|
"grad_norm": 0.14349917654420669,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0124,
|
|
"mean_token_accuracy": 0.8399911224842072,
|
|
"num_tokens": 357517093.0,
|
|
"step": 154
|
|
},
|
|
{
|
|
"epoch": 1.8308605341246291,
|
|
"grad_norm": 0.16264862652893464,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0124,
|
|
"mean_token_accuracy": 0.8417282104492188,
|
|
"num_tokens": 359875879.0,
|
|
"step": 155
|
|
},
|
|
{
|
|
"epoch": 1.8427299703264095,
|
|
"grad_norm": 0.1540544925031808,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0126,
|
|
"mean_token_accuracy": 0.8406098783016205,
|
|
"num_tokens": 362253176.0,
|
|
"step": 156
|
|
},
|
|
{
|
|
"epoch": 1.8545994065281899,
|
|
"grad_norm": 0.1463029431340891,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0127,
|
|
"mean_token_accuracy": 0.8387903124094009,
|
|
"num_tokens": 364585918.0,
|
|
"step": 157
|
|
},
|
|
{
|
|
"epoch": 1.8664688427299705,
|
|
"grad_norm": 0.16942153494229648,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0125,
|
|
"mean_token_accuracy": 0.8405653387308121,
|
|
"num_tokens": 366851906.0,
|
|
"step": 158
|
|
},
|
|
{
|
|
"epoch": 1.8783382789317509,
|
|
"grad_norm": 0.1566234339795249,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0123,
|
|
"mean_token_accuracy": 0.842450425028801,
|
|
"num_tokens": 369179066.0,
|
|
"step": 159
|
|
},
|
|
{
|
|
"epoch": 1.8902077151335313,
|
|
"grad_norm": 0.162306317719642,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0123,
|
|
"mean_token_accuracy": 0.84206223487854,
|
|
"num_tokens": 371506086.0,
|
|
"step": 160
|
|
},
|
|
{
|
|
"epoch": 1.9020771513353116,
|
|
"grad_norm": 0.18689853670633572,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0124,
|
|
"mean_token_accuracy": 0.8419952839612961,
|
|
"num_tokens": 373785639.0,
|
|
"step": 161
|
|
},
|
|
{
|
|
"epoch": 1.913946587537092,
|
|
"grad_norm": 0.1668630272213164,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0125,
|
|
"mean_token_accuracy": 0.8410981148481369,
|
|
"num_tokens": 376131309.0,
|
|
"step": 162
|
|
},
|
|
{
|
|
"epoch": 1.9258160237388724,
|
|
"grad_norm": 0.15756693077374478,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0123,
|
|
"mean_token_accuracy": 0.8421346545219421,
|
|
"num_tokens": 378419394.0,
|
|
"step": 163
|
|
},
|
|
{
|
|
"epoch": 1.9376854599406528,
|
|
"grad_norm": 0.17949596436353418,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0123,
|
|
"mean_token_accuracy": 0.840390682220459,
|
|
"num_tokens": 380734391.0,
|
|
"step": 164
|
|
},
|
|
{
|
|
"epoch": 1.9495548961424332,
|
|
"grad_norm": 0.16490339497438353,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0123,
|
|
"mean_token_accuracy": 0.842183455824852,
|
|
"num_tokens": 383036897.0,
|
|
"step": 165
|
|
},
|
|
{
|
|
"epoch": 1.9614243323442135,
|
|
"grad_norm": 0.14585688354436238,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0124,
|
|
"mean_token_accuracy": 0.8406427949666977,
|
|
"num_tokens": 385390014.0,
|
|
"step": 166
|
|
},
|
|
{
|
|
"epoch": 1.973293768545994,
|
|
"grad_norm": 0.1714673251393673,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0125,
|
|
"mean_token_accuracy": 0.8410854488611221,
|
|
"num_tokens": 387748456.0,
|
|
"step": 167
|
|
},
|
|
{
|
|
"epoch": 1.9851632047477745,
|
|
"grad_norm": 0.15794078895384803,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0126,
|
|
"mean_token_accuracy": 0.8396919220685959,
|
|
"num_tokens": 390027307.0,
|
|
"step": 168
|
|
},
|
|
{
|
|
"epoch": 1.997032640949555,
|
|
"grad_norm": 0.16310186783719505,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0123,
|
|
"mean_token_accuracy": 0.8412618339061737,
|
|
"num_tokens": 392380198.0,
|
|
"step": 169
|
|
},
|
|
{
|
|
"epoch": 2.0,
|
|
"grad_norm": 0.16310186783719505,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0121,
|
|
"mean_token_accuracy": 0.8421222567558289,
|
|
"num_tokens": 392950558.0,
|
|
"step": 170
|
|
},
|
|
{
|
|
"epoch": 2.0118694362017804,
|
|
"grad_norm": 0.3199909720438928,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0118,
|
|
"mean_token_accuracy": 0.8441486656665802,
|
|
"num_tokens": 395268392.0,
|
|
"step": 171
|
|
},
|
|
{
|
|
"epoch": 2.0237388724035608,
|
|
"grad_norm": 0.16097626253230995,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0118,
|
|
"mean_token_accuracy": 0.8432995080947876,
|
|
"num_tokens": 397668985.0,
|
|
"step": 172
|
|
},
|
|
{
|
|
"epoch": 2.035608308605341,
|
|
"grad_norm": 0.1651653232783317,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0116,
|
|
"mean_token_accuracy": 0.8442197740077972,
|
|
"num_tokens": 400017455.0,
|
|
"step": 173
|
|
},
|
|
{
|
|
"epoch": 2.0474777448071215,
|
|
"grad_norm": 0.16514837702525287,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0114,
|
|
"mean_token_accuracy": 0.8442776948213577,
|
|
"num_tokens": 402347844.0,
|
|
"step": 174
|
|
},
|
|
{
|
|
"epoch": 2.059347181008902,
|
|
"grad_norm": 0.15989929189371058,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0114,
|
|
"mean_token_accuracy": 0.8441167175769806,
|
|
"num_tokens": 404687376.0,
|
|
"step": 175
|
|
},
|
|
{
|
|
"epoch": 2.0712166172106823,
|
|
"grad_norm": 0.1907051292688766,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0114,
|
|
"mean_token_accuracy": 0.8434965312480927,
|
|
"num_tokens": 407017979.0,
|
|
"step": 176
|
|
},
|
|
{
|
|
"epoch": 2.083086053412463,
|
|
"grad_norm": 0.17375320315365758,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0114,
|
|
"mean_token_accuracy": 0.8421911895275116,
|
|
"num_tokens": 409380396.0,
|
|
"step": 177
|
|
},
|
|
{
|
|
"epoch": 2.0949554896142435,
|
|
"grad_norm": 0.17781057304271017,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0114,
|
|
"mean_token_accuracy": 0.8430353552103043,
|
|
"num_tokens": 411648026.0,
|
|
"step": 178
|
|
},
|
|
{
|
|
"epoch": 2.106824925816024,
|
|
"grad_norm": 0.1770096523661809,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0114,
|
|
"mean_token_accuracy": 0.8450231999158859,
|
|
"num_tokens": 413993567.0,
|
|
"step": 179
|
|
},
|
|
{
|
|
"epoch": 2.1186943620178043,
|
|
"grad_norm": 0.17212113091654105,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0115,
|
|
"mean_token_accuracy": 0.843005433678627,
|
|
"num_tokens": 416301091.0,
|
|
"step": 180
|
|
},
|
|
{
|
|
"epoch": 2.1305637982195846,
|
|
"grad_norm": 0.1612690305072081,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0116,
|
|
"mean_token_accuracy": 0.8420022577047348,
|
|
"num_tokens": 418695849.0,
|
|
"step": 181
|
|
},
|
|
{
|
|
"epoch": 2.142433234421365,
|
|
"grad_norm": 0.18444247317874857,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0114,
|
|
"mean_token_accuracy": 0.8448250144720078,
|
|
"num_tokens": 421001494.0,
|
|
"step": 182
|
|
},
|
|
{
|
|
"epoch": 2.1543026706231454,
|
|
"grad_norm": 0.15535433945556404,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0113,
|
|
"mean_token_accuracy": 0.8446276634931564,
|
|
"num_tokens": 423309275.0,
|
|
"step": 183
|
|
},
|
|
{
|
|
"epoch": 2.166172106824926,
|
|
"grad_norm": 0.18215562380634584,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0112,
|
|
"mean_token_accuracy": 0.8438670933246613,
|
|
"num_tokens": 425641897.0,
|
|
"step": 184
|
|
},
|
|
{
|
|
"epoch": 2.178041543026706,
|
|
"grad_norm": 0.17827012657180505,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0112,
|
|
"mean_token_accuracy": 0.8447795212268829,
|
|
"num_tokens": 427893289.0,
|
|
"step": 185
|
|
},
|
|
{
|
|
"epoch": 2.1899109792284865,
|
|
"grad_norm": 0.17242001871670576,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0113,
|
|
"mean_token_accuracy": 0.8444274663925171,
|
|
"num_tokens": 430207255.0,
|
|
"step": 186
|
|
},
|
|
{
|
|
"epoch": 2.201780415430267,
|
|
"grad_norm": 0.16841154754195645,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0114,
|
|
"mean_token_accuracy": 0.8438236862421036,
|
|
"num_tokens": 432477862.0,
|
|
"step": 187
|
|
},
|
|
{
|
|
"epoch": 2.2136498516320473,
|
|
"grad_norm": 0.17895831808545734,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0113,
|
|
"mean_token_accuracy": 0.8448720574378967,
|
|
"num_tokens": 434753923.0,
|
|
"step": 188
|
|
},
|
|
{
|
|
"epoch": 2.2255192878338277,
|
|
"grad_norm": 0.17579053217225954,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0112,
|
|
"mean_token_accuracy": 0.8439971655607224,
|
|
"num_tokens": 437077377.0,
|
|
"step": 189
|
|
},
|
|
{
|
|
"epoch": 2.2373887240356085,
|
|
"grad_norm": 0.16995585590836096,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0111,
|
|
"mean_token_accuracy": 0.8451563566923141,
|
|
"num_tokens": 439406442.0,
|
|
"step": 190
|
|
},
|
|
{
|
|
"epoch": 2.249258160237389,
|
|
"grad_norm": 0.17382922100725173,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0112,
|
|
"mean_token_accuracy": 0.8443274050951004,
|
|
"num_tokens": 441714456.0,
|
|
"step": 191
|
|
},
|
|
{
|
|
"epoch": 2.2611275964391693,
|
|
"grad_norm": 0.1615837741348334,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0113,
|
|
"mean_token_accuracy": 0.8433321714401245,
|
|
"num_tokens": 444062944.0,
|
|
"step": 192
|
|
},
|
|
{
|
|
"epoch": 2.2729970326409497,
|
|
"grad_norm": 0.17720367014864583,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0112,
|
|
"mean_token_accuracy": 0.8450319916009903,
|
|
"num_tokens": 446384174.0,
|
|
"step": 193
|
|
},
|
|
{
|
|
"epoch": 2.28486646884273,
|
|
"grad_norm": 0.21787595123997625,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0112,
|
|
"mean_token_accuracy": 0.8436912149190903,
|
|
"num_tokens": 448680472.0,
|
|
"step": 194
|
|
},
|
|
{
|
|
"epoch": 2.2967359050445104,
|
|
"grad_norm": 0.17820957067936397,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.011,
|
|
"mean_token_accuracy": 0.8451165854930878,
|
|
"num_tokens": 451017865.0,
|
|
"step": 195
|
|
},
|
|
{
|
|
"epoch": 2.308605341246291,
|
|
"grad_norm": 0.17345203999706377,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.011,
|
|
"mean_token_accuracy": 0.8446851670742035,
|
|
"num_tokens": 453295702.0,
|
|
"step": 196
|
|
},
|
|
{
|
|
"epoch": 2.320474777448071,
|
|
"grad_norm": 0.1838976757693602,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0113,
|
|
"mean_token_accuracy": 0.8435336947441101,
|
|
"num_tokens": 455663683.0,
|
|
"step": 197
|
|
},
|
|
{
|
|
"epoch": 2.3323442136498516,
|
|
"grad_norm": 0.1652466504794609,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0113,
|
|
"mean_token_accuracy": 0.8464784175157547,
|
|
"num_tokens": 457969380.0,
|
|
"step": 198
|
|
},
|
|
{
|
|
"epoch": 2.344213649851632,
|
|
"grad_norm": 0.1633987994385219,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0115,
|
|
"mean_token_accuracy": 0.8447457551956177,
|
|
"num_tokens": 460285340.0,
|
|
"step": 199
|
|
},
|
|
{
|
|
"epoch": 2.3560830860534123,
|
|
"grad_norm": 0.18053435780567084,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0113,
|
|
"mean_token_accuracy": 0.8445694297552109,
|
|
"num_tokens": 462652099.0,
|
|
"step": 200
|
|
},
|
|
{
|
|
"epoch": 2.3679525222551927,
|
|
"grad_norm": 0.1737219836015744,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.011,
|
|
"mean_token_accuracy": 0.8447594940662384,
|
|
"num_tokens": 464992512.0,
|
|
"step": 201
|
|
},
|
|
{
|
|
"epoch": 2.379821958456973,
|
|
"grad_norm": 0.17168342755756863,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0109,
|
|
"mean_token_accuracy": 0.8425739407539368,
|
|
"num_tokens": 467311204.0,
|
|
"step": 202
|
|
},
|
|
{
|
|
"epoch": 2.3916913946587535,
|
|
"grad_norm": 0.18122722944142608,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0107,
|
|
"mean_token_accuracy": 0.846357449889183,
|
|
"num_tokens": 469654020.0,
|
|
"step": 203
|
|
},
|
|
{
|
|
"epoch": 2.4035608308605343,
|
|
"grad_norm": 0.18214856713332722,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.011,
|
|
"mean_token_accuracy": 0.8442234247922897,
|
|
"num_tokens": 472006846.0,
|
|
"step": 204
|
|
},
|
|
{
|
|
"epoch": 2.4154302670623147,
|
|
"grad_norm": 0.17486423315323535,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.011,
|
|
"mean_token_accuracy": 0.8459763824939728,
|
|
"num_tokens": 474317944.0,
|
|
"step": 205
|
|
},
|
|
{
|
|
"epoch": 2.427299703264095,
|
|
"grad_norm": 0.16708481795731592,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0112,
|
|
"mean_token_accuracy": 0.8463287949562073,
|
|
"num_tokens": 476674814.0,
|
|
"step": 206
|
|
},
|
|
{
|
|
"epoch": 2.4391691394658754,
|
|
"grad_norm": 0.17688005140559518,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0112,
|
|
"mean_token_accuracy": 0.8453598469495773,
|
|
"num_tokens": 478985425.0,
|
|
"step": 207
|
|
},
|
|
{
|
|
"epoch": 2.451038575667656,
|
|
"grad_norm": 0.17316711620224629,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0111,
|
|
"mean_token_accuracy": 0.8450761288404465,
|
|
"num_tokens": 481367271.0,
|
|
"step": 208
|
|
},
|
|
{
|
|
"epoch": 2.462908011869436,
|
|
"grad_norm": 0.16825465828593125,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0108,
|
|
"mean_token_accuracy": 0.8452746421098709,
|
|
"num_tokens": 483694290.0,
|
|
"step": 209
|
|
},
|
|
{
|
|
"epoch": 2.4747774480712166,
|
|
"grad_norm": 0.16061838025042255,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0108,
|
|
"mean_token_accuracy": 0.845185860991478,
|
|
"num_tokens": 486046210.0,
|
|
"step": 210
|
|
},
|
|
{
|
|
"epoch": 2.486646884272997,
|
|
"grad_norm": 0.16532429893723433,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0107,
|
|
"mean_token_accuracy": 0.8459579348564148,
|
|
"num_tokens": 488382644.0,
|
|
"step": 211
|
|
},
|
|
{
|
|
"epoch": 2.4985163204747773,
|
|
"grad_norm": 0.17821640684092369,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0108,
|
|
"mean_token_accuracy": 0.845456674695015,
|
|
"num_tokens": 490754324.0,
|
|
"step": 212
|
|
},
|
|
{
|
|
"epoch": 2.5103857566765577,
|
|
"grad_norm": 0.16085932244490853,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0109,
|
|
"mean_token_accuracy": 0.8449293076992035,
|
|
"num_tokens": 493063716.0,
|
|
"step": 213
|
|
},
|
|
{
|
|
"epoch": 2.5222551928783385,
|
|
"grad_norm": 0.16887603265684098,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0111,
|
|
"mean_token_accuracy": 0.8446237146854401,
|
|
"num_tokens": 495363596.0,
|
|
"step": 214
|
|
},
|
|
{
|
|
"epoch": 2.534124629080119,
|
|
"grad_norm": 0.17130393726305443,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.011,
|
|
"mean_token_accuracy": 0.8447113633155823,
|
|
"num_tokens": 497724148.0,
|
|
"step": 215
|
|
},
|
|
{
|
|
"epoch": 2.5459940652818993,
|
|
"grad_norm": 0.16035961578072197,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.011,
|
|
"mean_token_accuracy": 0.8460115790367126,
|
|
"num_tokens": 500058861.0,
|
|
"step": 216
|
|
},
|
|
{
|
|
"epoch": 2.5578635014836797,
|
|
"grad_norm": 0.17780699055152324,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.011,
|
|
"mean_token_accuracy": 0.8460410833358765,
|
|
"num_tokens": 502393202.0,
|
|
"step": 217
|
|
},
|
|
{
|
|
"epoch": 2.56973293768546,
|
|
"grad_norm": 0.15509314820541814,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0109,
|
|
"mean_token_accuracy": 0.8467365354299545,
|
|
"num_tokens": 504749291.0,
|
|
"step": 218
|
|
},
|
|
{
|
|
"epoch": 2.5816023738872405,
|
|
"grad_norm": 0.15731103094512372,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.011,
|
|
"mean_token_accuracy": 0.8453492075204849,
|
|
"num_tokens": 507104733.0,
|
|
"step": 219
|
|
},
|
|
{
|
|
"epoch": 2.593471810089021,
|
|
"grad_norm": 0.17071925582322153,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0109,
|
|
"mean_token_accuracy": 0.8460611999034882,
|
|
"num_tokens": 509467221.0,
|
|
"step": 220
|
|
},
|
|
{
|
|
"epoch": 2.605341246290801,
|
|
"grad_norm": 0.16120989419985313,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0107,
|
|
"mean_token_accuracy": 0.8475139737129211,
|
|
"num_tokens": 511716365.0,
|
|
"step": 221
|
|
},
|
|
{
|
|
"epoch": 2.6172106824925816,
|
|
"grad_norm": 0.17795571303370816,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0109,
|
|
"mean_token_accuracy": 0.8441258668899536,
|
|
"num_tokens": 514052324.0,
|
|
"step": 222
|
|
},
|
|
{
|
|
"epoch": 2.629080118694362,
|
|
"grad_norm": 0.1638241886248985,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0107,
|
|
"mean_token_accuracy": 0.8466744869947433,
|
|
"num_tokens": 516422413.0,
|
|
"step": 223
|
|
},
|
|
{
|
|
"epoch": 2.6409495548961424,
|
|
"grad_norm": 0.16682957751333452,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0107,
|
|
"mean_token_accuracy": 0.8469160050153732,
|
|
"num_tokens": 518759302.0,
|
|
"step": 224
|
|
},
|
|
{
|
|
"epoch": 2.6528189910979227,
|
|
"grad_norm": 0.16486037981995366,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0109,
|
|
"mean_token_accuracy": 0.8450434356927872,
|
|
"num_tokens": 521060538.0,
|
|
"step": 225
|
|
},
|
|
{
|
|
"epoch": 2.664688427299703,
|
|
"grad_norm": 0.1681080671249638,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0107,
|
|
"mean_token_accuracy": 0.8467290550470352,
|
|
"num_tokens": 523420187.0,
|
|
"step": 226
|
|
},
|
|
{
|
|
"epoch": 2.6765578635014835,
|
|
"grad_norm": 0.16777930461581952,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0108,
|
|
"mean_token_accuracy": 0.845617413520813,
|
|
"num_tokens": 525805529.0,
|
|
"step": 227
|
|
},
|
|
{
|
|
"epoch": 2.688427299703264,
|
|
"grad_norm": 0.164525257040879,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0107,
|
|
"mean_token_accuracy": 0.847090408205986,
|
|
"num_tokens": 528111456.0,
|
|
"step": 228
|
|
},
|
|
{
|
|
"epoch": 2.7002967359050443,
|
|
"grad_norm": 0.17286886066372595,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0108,
|
|
"mean_token_accuracy": 0.8468398898839951,
|
|
"num_tokens": 530399066.0,
|
|
"step": 229
|
|
},
|
|
{
|
|
"epoch": 2.712166172106825,
|
|
"grad_norm": 0.1726513319138899,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0109,
|
|
"mean_token_accuracy": 0.8455411791801453,
|
|
"num_tokens": 532716080.0,
|
|
"step": 230
|
|
},
|
|
{
|
|
"epoch": 2.7240356083086055,
|
|
"grad_norm": 0.18762860661804548,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0108,
|
|
"mean_token_accuracy": 0.8481049686670303,
|
|
"num_tokens": 534986387.0,
|
|
"step": 231
|
|
},
|
|
{
|
|
"epoch": 2.735905044510386,
|
|
"grad_norm": 0.18114634401015242,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.011,
|
|
"mean_token_accuracy": 0.8461740463972092,
|
|
"num_tokens": 537339746.0,
|
|
"step": 232
|
|
},
|
|
{
|
|
"epoch": 2.7477744807121662,
|
|
"grad_norm": 0.1865976393380101,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.011,
|
|
"mean_token_accuracy": 0.8469324260950089,
|
|
"num_tokens": 539647692.0,
|
|
"step": 233
|
|
},
|
|
{
|
|
"epoch": 2.7596439169139466,
|
|
"grad_norm": 0.1780578662391402,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.011,
|
|
"mean_token_accuracy": 0.847784236073494,
|
|
"num_tokens": 542021392.0,
|
|
"step": 234
|
|
},
|
|
{
|
|
"epoch": 2.771513353115727,
|
|
"grad_norm": 0.16241081296093524,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0109,
|
|
"mean_token_accuracy": 0.8469081372022629,
|
|
"num_tokens": 544365763.0,
|
|
"step": 235
|
|
},
|
|
{
|
|
"epoch": 2.7833827893175074,
|
|
"grad_norm": 0.1790509715481758,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0108,
|
|
"mean_token_accuracy": 0.8461012840270996,
|
|
"num_tokens": 546711519.0,
|
|
"step": 236
|
|
},
|
|
{
|
|
"epoch": 2.7952522255192878,
|
|
"grad_norm": 0.16459481663242645,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0107,
|
|
"mean_token_accuracy": 0.848334327340126,
|
|
"num_tokens": 549075501.0,
|
|
"step": 237
|
|
},
|
|
{
|
|
"epoch": 2.807121661721068,
|
|
"grad_norm": 0.1796910483071128,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0106,
|
|
"mean_token_accuracy": 0.8482127636671066,
|
|
"num_tokens": 551432753.0,
|
|
"step": 238
|
|
},
|
|
{
|
|
"epoch": 2.8189910979228485,
|
|
"grad_norm": 0.16083588243472663,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0108,
|
|
"mean_token_accuracy": 0.8448426425457001,
|
|
"num_tokens": 553802166.0,
|
|
"step": 239
|
|
},
|
|
{
|
|
"epoch": 2.8308605341246293,
|
|
"grad_norm": 0.18833561933145523,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0109,
|
|
"mean_token_accuracy": 0.845383808016777,
|
|
"num_tokens": 556103895.0,
|
|
"step": 240
|
|
},
|
|
{
|
|
"epoch": 2.8427299703264097,
|
|
"grad_norm": 0.16675029882823478,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0107,
|
|
"mean_token_accuracy": 0.8466987758874893,
|
|
"num_tokens": 558435766.0,
|
|
"step": 241
|
|
},
|
|
{
|
|
"epoch": 2.85459940652819,
|
|
"grad_norm": 0.17831274635635708,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0107,
|
|
"mean_token_accuracy": 0.8454578667879105,
|
|
"num_tokens": 560791123.0,
|
|
"step": 242
|
|
},
|
|
{
|
|
"epoch": 2.8664688427299705,
|
|
"grad_norm": 0.1763042528202974,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0108,
|
|
"mean_token_accuracy": 0.8452757298946381,
|
|
"num_tokens": 563122356.0,
|
|
"step": 243
|
|
},
|
|
{
|
|
"epoch": 2.878338278931751,
|
|
"grad_norm": 0.17603791063376903,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0108,
|
|
"mean_token_accuracy": 0.8475597500801086,
|
|
"num_tokens": 565481141.0,
|
|
"step": 244
|
|
},
|
|
{
|
|
"epoch": 2.8902077151335313,
|
|
"grad_norm": 0.17464138932012688,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0109,
|
|
"mean_token_accuracy": 0.8453344404697418,
|
|
"num_tokens": 567844507.0,
|
|
"step": 245
|
|
},
|
|
{
|
|
"epoch": 2.9020771513353116,
|
|
"grad_norm": 0.17825372719856264,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0107,
|
|
"mean_token_accuracy": 0.8480927348136902,
|
|
"num_tokens": 570148576.0,
|
|
"step": 246
|
|
},
|
|
{
|
|
"epoch": 2.913946587537092,
|
|
"grad_norm": 0.1702490069495149,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0106,
|
|
"mean_token_accuracy": 0.847556933760643,
|
|
"num_tokens": 572459747.0,
|
|
"step": 247
|
|
},
|
|
{
|
|
"epoch": 2.9258160237388724,
|
|
"grad_norm": 0.17362533861855406,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0108,
|
|
"mean_token_accuracy": 0.8463536947965622,
|
|
"num_tokens": 574811184.0,
|
|
"step": 248
|
|
},
|
|
{
|
|
"epoch": 2.9376854599406528,
|
|
"grad_norm": 0.1608694501149249,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0105,
|
|
"mean_token_accuracy": 0.8485918045043945,
|
|
"num_tokens": 577192604.0,
|
|
"step": 249
|
|
},
|
|
{
|
|
"epoch": 2.949554896142433,
|
|
"grad_norm": 0.16769807446283022,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0106,
|
|
"mean_token_accuracy": 0.8459580093622208,
|
|
"num_tokens": 579543207.0,
|
|
"step": 250
|
|
},
|
|
{
|
|
"epoch": 2.9614243323442135,
|
|
"grad_norm": 0.17254054407457348,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0105,
|
|
"mean_token_accuracy": 0.8476663827896118,
|
|
"num_tokens": 581848871.0,
|
|
"step": 251
|
|
},
|
|
{
|
|
"epoch": 2.973293768545994,
|
|
"grad_norm": 0.17627551634684985,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0105,
|
|
"mean_token_accuracy": 0.8483349084854126,
|
|
"num_tokens": 584147932.0,
|
|
"step": 252
|
|
},
|
|
{
|
|
"epoch": 2.9851632047477743,
|
|
"grad_norm": 0.17744854241882618,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0107,
|
|
"mean_token_accuracy": 0.8475817143917084,
|
|
"num_tokens": 586535996.0,
|
|
"step": 253
|
|
},
|
|
{
|
|
"epoch": 2.9970326409495547,
|
|
"grad_norm": 0.18950170733048102,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0108,
|
|
"mean_token_accuracy": 0.8464547842741013,
|
|
"num_tokens": 588852007.0,
|
|
"step": 254
|
|
},
|
|
{
|
|
"epoch": 3.0,
|
|
"grad_norm": 0.18950170733048102,
|
|
"learning_rate": 1e-06,
|
|
"loss": 0.0104,
|
|
"mean_token_accuracy": 0.8517395257949829,
|
|
"num_tokens": 589423771.0,
|
|
"step": 255
|
|
},
|
|
{
|
|
"epoch": 3.0,
|
|
"step": 255,
|
|
"total_flos": 1.396241431747625e+18,
|
|
"train_loss": 0.023126277875374347,
|
|
"train_runtime": 17196.7264,
|
|
"train_samples_per_second": 15.03,
|
|
"train_steps_per_second": 0.015
|
|
}
|
|
],
|
|
"logging_steps": 1,
|
|
"max_steps": 255,
|
|
"num_input_tokens_seen": 0,
|
|
"num_train_epochs": 3,
|
|
"save_steps": 128,
|
|
"stateful_callbacks": {
|
|
"TrainerControl": {
|
|
"args": {
|
|
"should_epoch_stop": false,
|
|
"should_evaluate": false,
|
|
"should_log": false,
|
|
"should_save": true,
|
|
"should_training_stop": true
|
|
},
|
|
"attributes": {}
|
|
}
|
|
},
|
|
"total_flos": 1.396241431747625e+18,
|
|
"train_batch_size": 64,
|
|
"trial_name": null,
|
|
"trial_params": null
|
|
}
|