Files

1279 lines
36 KiB
JSON
Raw Permalink Normal View History

[
{
"loss": 0.6644901275634766,
"grad_norm": 0.69140625,
"learning_rate": 5e-05,
"entropy": 0.41775863207876685,
"num_tokens": 17886.0,
"mean_token_accuracy": 0.8308710962533951,
"epoch": 0.008412197686645636,
"step": 10
},
{
"loss": 0.5578639030456543,
"grad_norm": 0.6328125,
"learning_rate": 0.00010555555555555557,
"entropy": 0.5046202793717385,
"num_tokens": 35672.0,
"mean_token_accuracy": 0.8467379540205002,
"epoch": 0.016824395373291272,
"step": 20
},
{
"loss": 0.49953713417053225,
"grad_norm": 0.42578125,
"learning_rate": 0.0001611111111111111,
"entropy": 0.5429252408444881,
"num_tokens": 52882.0,
"mean_token_accuracy": 0.848870538175106,
"epoch": 0.025236593059936908,
"step": 30
},
{
"loss": 0.4875448703765869,
"grad_norm": 0.388671875,
"learning_rate": 0.00019999665919423514,
"entropy": 0.49813074097037313,
"num_tokens": 70413.0,
"mean_token_accuracy": 0.8602197140455246,
"epoch": 0.033648790746582544,
"step": 40
},
{
"loss": 0.5065551280975342,
"grad_norm": 0.396484375,
"learning_rate": 0.0001999372733012762,
"entropy": 0.5205996319651603,
"num_tokens": 87742.0,
"mean_token_accuracy": 0.8523474678397178,
"epoch": 0.04206098843322818,
"step": 50
},
{
"loss": 0.5336020946502685,
"grad_norm": 0.58984375,
"learning_rate": 0.0001998036980255298,
"entropy": 0.5422930240631103,
"num_tokens": 106667.0,
"mean_token_accuracy": 0.8395245373249054,
"epoch": 0.050473186119873815,
"step": 60
},
{
"loss": 0.584792947769165,
"grad_norm": 0.4453125,
"learning_rate": 0.00019959603252786895,
"entropy": 0.5817637398838997,
"num_tokens": 123772.0,
"mean_token_accuracy": 0.8319423466920852,
"epoch": 0.058885383806519455,
"step": 70
},
{
"loss": 0.5139331817626953,
"grad_norm": 0.314453125,
"learning_rate": 0.00019931443097074569,
"entropy": 0.5499239668250084,
"num_tokens": 142732.0,
"mean_token_accuracy": 0.8438791155815124,
"epoch": 0.06729758149316509,
"step": 80
},
{
"loss": 0.48215503692626954,
"grad_norm": 0.353515625,
"learning_rate": 0.000198959102403747,
"entropy": 0.5112259805202484,
"num_tokens": 161271.0,
"mean_token_accuracy": 0.8517454102635383,
"epoch": 0.07570977917981073,
"step": 90
},
{
"loss": 0.5477577209472656,
"grad_norm": 0.423828125,
"learning_rate": 0.00019853031060840508,
"entropy": 0.5490782242268324,
"num_tokens": 179202.0,
"mean_token_accuracy": 0.835928975045681,
"epoch": 0.08412197686645637,
"step": 100
},
{
"loss": 0.5046371936798095,
"grad_norm": 0.37890625,
"learning_rate": 0.0001980283739023765,
"entropy": 0.49583916887640955,
"num_tokens": 197597.0,
"mean_token_accuracy": 0.8535919323563576,
"epoch": 0.09253417455310199,
"step": 110
},
{
"loss": 0.4952244758605957,
"grad_norm": 0.421875,
"learning_rate": 0.00019745366490313607,
"entropy": 0.5152403030544519,
"num_tokens": 214819.0,
"mean_token_accuracy": 0.8491240337491035,
"epoch": 0.10094637223974763,
"step": 120
},
{
"loss": 0.5076200485229492,
"grad_norm": 0.390625,
"learning_rate": 0.00019680661025136078,
"entropy": 0.49193753488361835,
"num_tokens": 232053.0,
"mean_token_accuracy": 0.8580134496092796,
"epoch": 0.10935856992639327,
"step": 130
},
{
"loss": 0.5707052230834961,
"grad_norm": 0.462890625,
"learning_rate": 0.00019608769029420895,
"entropy": 0.5594139508903027,
"num_tokens": 248970.0,
"mean_token_accuracy": 0.8354306548833847,
"epoch": 0.11777076761303891,
"step": 140
},
{
"loss": 0.5284650325775146,
"grad_norm": 0.48828125,
"learning_rate": 0.00019529743872873014,
"entropy": 0.5149690546095371,
"num_tokens": 266885.0,
"mean_token_accuracy": 0.8453154772520065,
"epoch": 0.12618296529968454,
"step": 150
},
{
"eval_loss": 0.5157255530357361,
"eval_runtime": 43.5089,
"eval_samples_per_second": 23.03,
"eval_steps_per_second": 5.769,
"eval_entropy": 0.5205607345973353,
"eval_num_tokens": 266885.0,
"eval_mean_token_accuracy": 0.8498107833691327,
"epoch": 0.12618296529968454,
"step": 150
},
{
"loss": 0.5166601181030274,
"grad_norm": 0.3984375,
"learning_rate": 0.00019443644220566985,
"entropy": 0.5193028658628464,
"num_tokens": 285094.0,
"mean_token_accuracy": 0.8514553621411324,
"epoch": 0.13459516298633017,
"step": 160
},
{
"loss": 0.4895184993743896,
"grad_norm": 0.396484375,
"learning_rate": 0.00019350533989396395,
"entropy": 0.5498913679271936,
"num_tokens": 302878.0,
"mean_token_accuracy": 0.8499076500535011,
"epoch": 0.14300736067297581,
"step": 170
},
{
"loss": 0.489929723739624,
"grad_norm": 0.34765625,
"learning_rate": 0.00019250482300624543,
"entropy": 0.4781280752271414,
"num_tokens": 321038.0,
"mean_token_accuracy": 0.8518652722239495,
"epoch": 0.15141955835962145,
"step": 180
},
{
"loss": 0.5677974700927735,
"grad_norm": 0.392578125,
"learning_rate": 0.00019143563428571634,
"entropy": 0.560076616331935,
"num_tokens": 338613.0,
"mean_token_accuracy": 0.8355910241603851,
"epoch": 0.1598317560462671,
"step": 190
},
{
"loss": 0.47907423973083496,
"grad_norm": 0.380859375,
"learning_rate": 0.00019029856745476508,
"entropy": 0.486137630045414,
"num_tokens": 355794.0,
"mean_token_accuracy": 0.8546374544501305,
"epoch": 0.16824395373291273,
"step": 200
},
{
"loss": 0.5049150466918946,
"grad_norm": 0.515625,
"learning_rate": 0.0001890944666257392,
"entropy": 0.5356668088585138,
"num_tokens": 374388.0,
"mean_token_accuracy": 0.8522498905658722,
"epoch": 0.17665615141955837,
"step": 210
},
{
"loss": 0.5084699153900146,
"grad_norm": 0.474609375,
"learning_rate": 0.00018782422567431063,
"entropy": 0.48354478403925893,
"num_tokens": 393466.0,
"mean_token_accuracy": 0.8485782667994499,
"epoch": 0.18506834910620398,
"step": 220
},
{
"loss": 0.5076002597808837,
"grad_norm": 0.357421875,
"learning_rate": 0.0001864887875758985,
"entropy": 0.5002748906612396,
"num_tokens": 411947.0,
"mean_token_accuracy": 0.8519161671400071,
"epoch": 0.19348054679284962,
"step": 230
},
{
"loss": 0.5514575004577636,
"grad_norm": 0.60546875,
"learning_rate": 0.00018508914370564243,
"entropy": 0.5646139703691005,
"num_tokens": 429099.0,
"mean_token_accuracy": 0.8357668131589889,
"epoch": 0.20189274447949526,
"step": 240
},
{
"loss": 0.49529438018798827,
"grad_norm": 0.58984375,
"learning_rate": 0.00018362633310244574,
"entropy": 0.518617831915617,
"num_tokens": 446977.0,
"mean_token_accuracy": 0.8446412399411202,
"epoch": 0.2103049421661409,
"step": 250
},
{
"loss": 0.5090048313140869,
"grad_norm": 0.408203125,
"learning_rate": 0.00018210144169763522,
"entropy": 0.502267974242568,
"num_tokens": 465009.0,
"mean_token_accuracy": 0.851601280272007,
"epoch": 0.21871713985278654,
"step": 260
},
{
"loss": 0.5145918369293213,
"grad_norm": 0.41796875,
"learning_rate": 0.00018051560150880952,
"entropy": 0.5074335142970086,
"num_tokens": 481925.0,
"mean_token_accuracy": 0.8518189460039138,
"epoch": 0.22712933753943218,
"step": 270
},
{
"loss": 0.47620458602905275,
"grad_norm": 0.29296875,
"learning_rate": 0.00017886998979947522,
"entropy": 0.5017431110143662,
"num_tokens": 499792.0,
"mean_token_accuracy": 0.8548987463116646,
"epoch": 0.23554153522607782,
"step": 280
},
{
"loss": 0.507429552078247,
"grad_norm": 0.39453125,
"learning_rate": 0.00017716582820509423,
"entropy": 0.5222229663282633,
"num_tokens": 517055.0,
"mean_token_accuracy": 0.8444660127162933,
"epoch": 0.24395373291272346,
"step": 290
},
{
"loss": 0.5420027732849121,
"grad_norm": 0.39453125,
"learning_rate": 0.00017540438182619083,
"entropy": 0.5492073997855187,
"num_tokens": 536355.0,
"mean_token_accuracy": 0.8354690104722977,
"epoch": 0.25236593059936907,
"step": 300
},
{
"eval_loss": 0.5092939138412476,
"eval_runtime": 43.2398,
"eval_samples_per_second": 23.173,
"eval_steps_per_second": 5.805,
"eval_entropy": 0.4988216485872687,
"eval_num_tokens": 536355.0,
"eval_mean_token_accuracy": 0.849776790911458,
"epoch": 0.25236593059936907,
"step": 300
},
{
"loss": 0.536237096786499,
"grad_norm": 0.91015625,
"learning_rate": 0.00017358695828919264,
"entropy": 0.5142859980463982,
"num_tokens": 553515.0,
"mean_token_accuracy": 0.8491675749421119,
"epoch": 0.2607781282860147,
"step": 310
},
{
"loss": 0.5729623317718506,
"grad_norm": 0.44921875,
"learning_rate": 0.00017171490677570138,
"entropy": 0.558933037891984,
"num_tokens": 571228.0,
"mean_token_accuracy": 0.8405497163534165,
"epoch": 0.26919032597266035,
"step": 320
},
{
"loss": 0.5896058559417725,
"grad_norm": 0.5703125,
"learning_rate": 0.00016978961702091548,
"entropy": 0.572591795027256,
"num_tokens": 589110.0,
"mean_token_accuracy": 0.8290358498692513,
"epoch": 0.277602523659306,
"step": 330
},
{
"loss": 0.5112470626831055,
"grad_norm": 0.400390625,
"learning_rate": 0.0001678125182819466,
"entropy": 0.5400734946131707,
"num_tokens": 606112.0,
"mean_token_accuracy": 0.8408979564905167,
"epoch": 0.28601472134595163,
"step": 340
},
{
"loss": 0.4602771282196045,
"grad_norm": 0.4296875,
"learning_rate": 0.0001657850782767974,
"entropy": 0.4790476318448782,
"num_tokens": 623646.0,
"mean_token_accuracy": 0.8584060147404671,
"epoch": 0.29442691903259727,
"step": 350
},
{
"loss": 0.5069724559783936,
"grad_norm": 0.48046875,
"learning_rate": 0.00016370880209478684,
"entropy": 0.5200437907129526,
"num_tokens": 641902.0,
"mean_token_accuracy": 0.8489004954695701,
"epoch": 0.3028391167192429,
"step": 360
},
{
"loss": 0.5578237533569336,
"grad_norm": 0.369140625,
"learning_rate": 0.00016158523107923317,
"entropy": 0.5649974066764116,
"num_tokens": 659952.0,
"mean_token_accuracy": 0.8369685173034668,
"epoch": 0.31125131440588855,
"step": 370
},
{
"loss": 0.47066588401794435,
"grad_norm": 0.359375,
"learning_rate": 0.00015941594168322282,
"entropy": 0.47163805216550825,
"num_tokens": 676446.0,
"mean_token_accuracy": 0.8630838245153427,
"epoch": 0.3196635120925342,
"step": 380
},
{
"loss": 0.4772009372711182,
"grad_norm": 0.400390625,
"learning_rate": 0.0001572025442993157,
"entropy": 0.4667525518685579,
"num_tokens": 694154.0,
"mean_token_accuracy": 0.8570062339305877,
"epoch": 0.3280757097791798,
"step": 390
},
{
"loss": 0.5249220848083496,
"grad_norm": 0.375,
"learning_rate": 0.00015494668206405483,
"entropy": 0.5329773716628552,
"num_tokens": 711669.0,
"mean_token_accuracy": 0.8415302649140358,
"epoch": 0.33648790746582546,
"step": 400
},
{
"loss": 0.4875462055206299,
"grad_norm": 0.5234375,
"learning_rate": 0.00015265002963816846,
"entropy": 0.4823704816401005,
"num_tokens": 728983.0,
"mean_token_accuracy": 0.858619874715805,
"epoch": 0.3449001051524711,
"step": 410
},
{
"loss": 0.44158411026000977,
"grad_norm": 0.37890625,
"learning_rate": 0.00015031429196336982,
"entropy": 0.4349179297685623,
"num_tokens": 745793.0,
"mean_token_accuracy": 0.8672094404697418,
"epoch": 0.35331230283911674,
"step": 420
},
{
"loss": 0.44835238456726073,
"grad_norm": 0.390625,
"learning_rate": 0.00014794120299667737,
"entropy": 0.4709930635988712,
"num_tokens": 763754.0,
"mean_token_accuracy": 0.8656966030597687,
"epoch": 0.3617245005257624,
"step": 430
},
{
"loss": 0.46076221466064454,
"grad_norm": 0.375,
"learning_rate": 0.00014553252442319538,
"entropy": 0.45636184960603715,
"num_tokens": 782350.0,
"mean_token_accuracy": 0.8606420174241066,
"epoch": 0.37013669821240797,
"step": 440
},
{
"loss": 0.41022934913635256,
"grad_norm": 0.32421875,
"learning_rate": 0.00014309004434831036,
"entropy": 0.41649786606431005,
"num_tokens": 801737.0,
"mean_token_accuracy": 0.8772262930870056,
"epoch": 0.3785488958990536,
"step": 450
},
{
"eval_loss": 0.5019798278808594,
"eval_runtime": 43.2448,
"eval_samples_per_second": 23.17,
"eval_steps_per_second": 5.804,
"eval_entropy": 0.49474223777354953,
"eval_num_tokens": 801737.0,
"eval_mean_token_accuracy": 0.8509889845829086,
"epoch": 0.3785488958990536,
"step": 450
},
{
"loss": 0.4886730670928955,
"grad_norm": 0.40625,
"learning_rate": 0.0001406155759702739,
"entropy": 0.4626791954040527,
"num_tokens": 818998.0,
"mean_token_accuracy": 0.8578041106462478,
"epoch": 0.38696109358569925,
"step": 460
},
{
"loss": 0.43723235130310056,
"grad_norm": 0.36328125,
"learning_rate": 0.00013811095623415804,
"entropy": 0.4580305341631174,
"num_tokens": 837490.0,
"mean_token_accuracy": 0.8644093602895737,
"epoch": 0.3953732912723449,
"step": 470
},
{
"loss": 0.5131179332733155,
"grad_norm": 0.44921875,
"learning_rate": 0.00013557804446818133,
"entropy": 0.5031312361359597,
"num_tokens": 853819.0,
"mean_token_accuracy": 0.8500203013420105,
"epoch": 0.4037854889589905,
"step": 480
},
{
"loss": 0.4966330051422119,
"grad_norm": 0.46875,
"learning_rate": 0.00013301872100341912,
"entropy": 0.5123794697225094,
"num_tokens": 870402.0,
"mean_token_accuracy": 0.8551265612244606,
"epoch": 0.41219768664563616,
"step": 490
},
{
"loss": 0.5083879947662353,
"grad_norm": 0.408203125,
"learning_rate": 0.00013043488577792184,
"entropy": 0.5123440526425839,
"num_tokens": 887321.0,
"mean_token_accuracy": 0.8488352715969085,
"epoch": 0.4206098843322818,
"step": 500
},
{
"loss": 0.4652432918548584,
"grad_norm": 0.447265625,
"learning_rate": 0.0001278284569262781,
"entropy": 0.4698960553854704,
"num_tokens": 905696.0,
"mean_token_accuracy": 0.8606894016265869,
"epoch": 0.42902208201892744,
"step": 510
},
{
"loss": 0.4380183219909668,
"grad_norm": 0.408203125,
"learning_rate": 0.00012520136935566904,
"entropy": 0.43917837329208853,
"num_tokens": 924737.0,
"mean_token_accuracy": 0.8651972591876984,
"epoch": 0.4374342797055731,
"step": 520
},
{
"loss": 0.46619858741760256,
"grad_norm": 0.51171875,
"learning_rate": 0.0001225555733094719,
"entropy": 0.4861061923205853,
"num_tokens": 941252.0,
"mean_token_accuracy": 0.8588027134537697,
"epoch": 0.4458464773922187,
"step": 530
},
{
"loss": 0.4590827465057373,
"grad_norm": 0.32421875,
"learning_rate": 0.00011989303291947826,
"entropy": 0.4769519090652466,
"num_tokens": 959549.0,
"mean_token_accuracy": 0.8566611051559448,
"epoch": 0.45425867507886436,
"step": 540
},
{
"loss": 0.5028058528900147,
"grad_norm": 0.390625,
"learning_rate": 0.00011721572474780205,
"entropy": 0.49060247242450716,
"num_tokens": 977934.0,
"mean_token_accuracy": 0.8463574901223183,
"epoch": 0.46267087276551,
"step": 550
},
{
"loss": 0.5106627941131592,
"grad_norm": 0.353515625,
"learning_rate": 0.00011452563631955997,
"entropy": 0.5243487633764744,
"num_tokens": 995534.0,
"mean_token_accuracy": 0.8489840433001519,
"epoch": 0.47108307045215564,
"step": 560
},
{
"loss": 0.5040833473205566,
"grad_norm": 0.431640625,
"learning_rate": 0.00011182476464741359,
"entropy": 0.511018768697977,
"num_tokens": 1012521.0,
"mean_token_accuracy": 0.8465926513075829,
"epoch": 0.4794952681388013,
"step": 570
},
{
"loss": 0.520852518081665,
"grad_norm": 0.380859375,
"learning_rate": 0.0001091151147490677,
"entropy": 0.5150163471698761,
"num_tokens": 1029532.0,
"mean_token_accuracy": 0.8415179714560509,
"epoch": 0.4879074658254469,
"step": 580
},
{
"loss": 0.3955108404159546,
"grad_norm": 0.404296875,
"learning_rate": 0.00010639869815882668,
"entropy": 0.42485857382416725,
"num_tokens": 1047599.0,
"mean_token_accuracy": 0.8708899393677711,
"epoch": 0.49631966351209256,
"step": 590
},
{
"loss": 0.5156550884246827,
"grad_norm": 0.404296875,
"learning_rate": 0.00010367753143431278,
"entropy": 0.4836477965116501,
"num_tokens": 1066584.0,
"mean_token_accuracy": 0.8515340134501457,
"epoch": 0.5047318611987381,
"step": 600
},
{
"eval_loss": 0.5016828179359436,
"eval_runtime": 44.4349,
"eval_samples_per_second": 22.55,
"eval_steps_per_second": 5.649,
"eval_entropy": 0.5061054474922765,
"eval_num_tokens": 1066584.0,
"eval_mean_token_accuracy": 0.8509582224120182,
"epoch": 0.5047318611987381,
"step": 600
},
{
"loss": 0.5101516246795654,
"grad_norm": 0.412109375,
"learning_rate": 0.00010095363465945549,
"entropy": 0.5069868132472038,
"num_tokens": 1084792.0,
"mean_token_accuracy": 0.8516661524772644,
"epoch": 0.5131440588853838,
"step": 610
},
{
"loss": 0.5655738353729248,
"grad_norm": 0.43359375,
"learning_rate": 9.822902994486313e-05,
"entropy": 0.5374718602746725,
"num_tokens": 1102585.0,
"mean_token_accuracy": 0.8460393868386745,
"epoch": 0.5215562565720294,
"step": 620
},
{
"loss": 0.5003692626953125,
"grad_norm": 0.380859375,
"learning_rate": 9.550573992668964e-05,
"entropy": 0.4945683263242245,
"num_tokens": 1118590.0,
"mean_token_accuracy": 0.8570186719298363,
"epoch": 0.5299684542586751,
"step": 630
},
{
"loss": 0.4934247970581055,
"grad_norm": 0.35546875,
"learning_rate": 9.278578626511173e-05,
"entropy": 0.49867704808712005,
"num_tokens": 1136773.0,
"mean_token_accuracy": 0.8551020383834839,
"epoch": 0.5383806519453207,
"step": 640
},
{
"loss": 0.45653066635131834,
"grad_norm": 0.361328125,
"learning_rate": 9.007118814353019e-05,
"entropy": 0.4587596397846937,
"num_tokens": 1154768.0,
"mean_token_accuracy": 0.8645354241132737,
"epoch": 0.5467928496319664,
"step": 650
},
{
"loss": 0.43801026344299315,
"grad_norm": 0.3515625,
"learning_rate": 8.736396076960973e-05,
"entropy": 0.436482329107821,
"num_tokens": 1171141.0,
"mean_token_accuracy": 0.8680778846144677,
"epoch": 0.555205047318612,
"step": 660
},
{
"loss": 0.48572382926940916,
"grad_norm": 0.33984375,
"learning_rate": 8.466611387927075e-05,
"entropy": 0.4897559147328138,
"num_tokens": 1188848.0,
"mean_token_accuracy": 0.8528486609458923,
"epoch": 0.5636172450052577,
"step": 670
},
{
"loss": 0.4595578670501709,
"grad_norm": 0.423828125,
"learning_rate": 8.197965024474269e-05,
"entropy": 0.48105588629841806,
"num_tokens": 1205462.0,
"mean_token_accuracy": 0.8587836340069771,
"epoch": 0.5720294426919033,
"step": 680
},
{
"loss": 0.5170315265655517,
"grad_norm": 0.296875,
"learning_rate": 7.930656418778692e-05,
"entropy": 0.5295548569411039,
"num_tokens": 1223225.0,
"mean_token_accuracy": 0.8485119223594666,
"epoch": 0.580441640378549,
"step": 690
},
{
"loss": 0.49773259162902833,
"grad_norm": 0.439453125,
"learning_rate": 7.664884009919337e-05,
"entropy": 0.4959330677986145,
"num_tokens": 1241341.0,
"mean_token_accuracy": 0.8523301362991333,
"epoch": 0.5888538380651945,
"step": 700
},
{
"loss": 0.45866031646728517,
"grad_norm": 0.333984375,
"learning_rate": 7.400845096564895e-05,
"entropy": 0.4629350196570158,
"num_tokens": 1260070.0,
"mean_token_accuracy": 0.8623251214623451,
"epoch": 0.5972660357518401,
"step": 710
},
{
"loss": 0.45479936599731446,
"grad_norm": 0.466796875,
"learning_rate": 7.138735690507232e-05,
"entropy": 0.45315413922071457,
"num_tokens": 1277817.0,
"mean_token_accuracy": 0.8606215000152588,
"epoch": 0.6056782334384858,
"step": 720
},
{
"loss": 0.4651636600494385,
"grad_norm": 0.50390625,
"learning_rate": 6.87875037115016e-05,
"entropy": 0.4955283936113119,
"num_tokens": 1296319.0,
"mean_token_accuracy": 0.8529913663864136,
"epoch": 0.6140904311251314,
"step": 730
},
{
"loss": 0.458605432510376,
"grad_norm": 0.375,
"learning_rate": 6.621082141061594e-05,
"entropy": 0.46719060391187667,
"num_tokens": 1314222.0,
"mean_token_accuracy": 0.8618179276585579,
"epoch": 0.6225026288117771,
"step": 740
},
{
"loss": 0.4238747119903564,
"grad_norm": 0.37890625,
"learning_rate": 6.365922282696246e-05,
"entropy": 0.46433731317520144,
"num_tokens": 1332578.0,
"mean_token_accuracy": 0.8674190878868103,
"epoch": 0.6309148264984227,
"step": 750
},
{
"eval_loss": 0.49650052189826965,
"eval_runtime": 44.1675,
"eval_samples_per_second": 22.686,
"eval_steps_per_second": 5.683,
"eval_entropy": 0.49466295991523335,
"eval_num_tokens": 1332578.0,
"eval_mean_token_accuracy": 0.8537447065471178,
"epoch": 0.6309148264984227,
"step": 750
},
{
"loss": 0.4777510166168213,
"grad_norm": 0.296875,
"learning_rate": 6.113460216395276e-05,
"entropy": 0.46779244504868983,
"num_tokens": 1350642.0,
"mean_token_accuracy": 0.8585006296634674,
"epoch": 0.6393270241850684,
"step": 760
},
{
"loss": 0.43058485984802247,
"grad_norm": 0.390625,
"learning_rate": 5.8638833597683295e-05,
"entropy": 0.4450514350086451,
"num_tokens": 1368256.0,
"mean_token_accuracy": 0.8651673465967178,
"epoch": 0.647739221871714,
"step": 770
},
{
"loss": 0.4754780292510986,
"grad_norm": 0.2294921875,
"learning_rate": 5.6173769885622816e-05,
"entropy": 0.48611559383571146,
"num_tokens": 1385497.0,
"mean_token_accuracy": 0.8574813604354858,
"epoch": 0.6561514195583596,
"step": 780
},
{
"loss": 0.48357625007629396,
"grad_norm": 0.380859375,
"learning_rate": 5.3741240991200214e-05,
"entropy": 0.47957778461277484,
"num_tokens": 1404550.0,
"mean_token_accuracy": 0.8487858697772026,
"epoch": 0.6645636172450052,
"step": 790
},
{
"loss": 0.5497960567474365,
"grad_norm": 0.54296875,
"learning_rate": 5.134305272531394e-05,
"entropy": 0.5210029605776072,
"num_tokens": 1421268.0,
"mean_token_accuracy": 0.840529902279377,
"epoch": 0.6729758149316509,
"step": 800
},
{
"loss": 0.4972085952758789,
"grad_norm": 0.443359375,
"learning_rate": 4.898098540577122e-05,
"entropy": 0.5074868854135275,
"num_tokens": 1438077.0,
"mean_token_accuracy": 0.8451508775353431,
"epoch": 0.6813880126182965,
"step": 810
},
{
"loss": 0.42497959136962893,
"grad_norm": 0.578125,
"learning_rate": 4.665679253565191e-05,
"entropy": 0.4287653032690287,
"num_tokens": 1455329.0,
"mean_token_accuracy": 0.870225128531456,
"epoch": 0.6898002103049422,
"step": 820
},
{
"loss": 0.49147672653198243,
"grad_norm": 0.302734375,
"learning_rate": 4.437219950157927e-05,
"entropy": 0.5095056083053351,
"num_tokens": 1472973.0,
"mean_token_accuracy": 0.8493282213807106,
"epoch": 0.6982124079915878,
"step": 830
},
{
"loss": 0.49974665641784666,
"grad_norm": 0.400390625,
"learning_rate": 4.2128902292862625e-05,
"entropy": 0.5031959179788827,
"num_tokens": 1491004.0,
"mean_token_accuracy": 0.8519662648439408,
"epoch": 0.7066246056782335,
"step": 840
},
{
"loss": 0.4568824768066406,
"grad_norm": 0.369140625,
"learning_rate": 3.9928566242463516e-05,
"entropy": 0.46861373744904994,
"num_tokens": 1507930.0,
"mean_token_accuracy": 0.8673135682940483,
"epoch": 0.7150368033648791,
"step": 850
},
{
"loss": 0.4371347427368164,
"grad_norm": 0.3515625,
"learning_rate": 3.777282479072023e-05,
"entropy": 0.4369157709181309,
"num_tokens": 1525250.0,
"mean_token_accuracy": 0.8657293424010277,
"epoch": 0.7234490010515248,
"step": 860
},
{
"loss": 0.48940362930297854,
"grad_norm": 0.54296875,
"learning_rate": 3.56632782727477e-05,
"entropy": 0.48742267247289417,
"num_tokens": 1542980.0,
"mean_token_accuracy": 0.8546120315790177,
"epoch": 0.7318611987381703,
"step": 870
},
{
"loss": 0.4359768867492676,
"grad_norm": 0.51171875,
"learning_rate": 3.360149273041358e-05,
"entropy": 0.4555686455219984,
"num_tokens": 1560118.0,
"mean_token_accuracy": 0.8625203266739845,
"epoch": 0.7402733964248159,
"step": 880
},
{
"loss": 0.47966947555541994,
"grad_norm": 0.326171875,
"learning_rate": 3.158899874977221e-05,
"entropy": 0.5010597914457321,
"num_tokens": 1577819.0,
"mean_token_accuracy": 0.8502609938383102,
"epoch": 0.7486855941114616,
"step": 890
},
{
"loss": 0.48172292709350584,
"grad_norm": 0.353515625,
"learning_rate": 2.9627290324819635e-05,
"entropy": 0.47771124467253684,
"num_tokens": 1595465.0,
"mean_token_accuracy": 0.8525931060314178,
"epoch": 0.7570977917981072,
"step": 900
},
{
"eval_loss": 0.49366605281829834,
"eval_runtime": 44.2235,
"eval_samples_per_second": 22.658,
"eval_steps_per_second": 5.676,
"eval_entropy": 0.49088804530669966,
"eval_num_tokens": 1595465.0,
"eval_mean_token_accuracy": 0.8535285991026585,
"epoch": 0.7570977917981072,
"step": 900
},
{
"loss": 0.4764974117279053,
"grad_norm": 0.318359375,
"learning_rate": 2.7717823748412786e-05,
"entropy": 0.4569669846445322,
"num_tokens": 1612331.0,
"mean_token_accuracy": 0.859618866443634,
"epoch": 0.7655099894847529,
"step": 910
},
{
"loss": 0.5832089900970459,
"grad_norm": 0.5078125,
"learning_rate": 2.586201653117687e-05,
"entropy": 0.5448153771460056,
"num_tokens": 1629141.0,
"mean_token_accuracy": 0.8399338677525521,
"epoch": 0.7739221871713985,
"step": 920
},
{
"loss": 0.4664586067199707,
"grad_norm": 0.5234375,
"learning_rate": 2.4061246349202836e-05,
"entropy": 0.468376400321722,
"num_tokens": 1646892.0,
"mean_token_accuracy": 0.8635450974106789,
"epoch": 0.7823343848580442,
"step": 930
},
{
"loss": 0.515719985961914,
"grad_norm": 0.390625,
"learning_rate": 2.2316850021316383e-05,
"entropy": 0.4714161459356546,
"num_tokens": 1664928.0,
"mean_token_accuracy": 0.8522258847951889,
"epoch": 0.7907465825446898,
"step": 940
},
{
"loss": 0.46754937171936034,
"grad_norm": 0.361328125,
"learning_rate": 2.0630122516677952e-05,
"entropy": 0.4566764455288649,
"num_tokens": 1683193.0,
"mean_token_accuracy": 0.860313655436039,
"epoch": 0.7991587802313355,
"step": 950
},
{
"loss": 0.45092215538024905,
"grad_norm": 0.53515625,
"learning_rate": 1.900231599345006e-05,
"entropy": 0.49635875867679713,
"num_tokens": 1700570.0,
"mean_token_accuracy": 0.8524207696318626,
"epoch": 0.807570977917981,
"step": 960
},
{
"loss": 0.5068153381347656,
"grad_norm": 0.375,
"learning_rate": 1.743463886924569e-05,
"entropy": 0.49028092734515666,
"num_tokens": 1718365.0,
"mean_token_accuracy": 0.8554800346493721,
"epoch": 0.8159831756046267,
"step": 970
},
{
"loss": 0.4151425838470459,
"grad_norm": 0.341796875,
"learning_rate": 1.592825492404816e-05,
"entropy": 0.453617250174284,
"num_tokens": 1736733.0,
"mean_token_accuracy": 0.8672206476330757,
"epoch": 0.8243953732912723,
"step": 980
},
{
"loss": 0.47887310981750486,
"grad_norm": 0.439453125,
"learning_rate": 1.448428243626796e-05,
"entropy": 0.48988366313278675,
"num_tokens": 1756048.0,
"mean_token_accuracy": 0.8519709303975105,
"epoch": 0.832807570977918,
"step": 990
},
{
"loss": 0.41326084136962893,
"grad_norm": 0.37109375,
"learning_rate": 1.3103793352578153e-05,
"entropy": 0.425517388433218,
"num_tokens": 1773583.0,
"mean_token_accuracy": 0.8752173602581024,
"epoch": 0.8412197686645636,
"step": 1000
},
{
"loss": 0.44759268760681153,
"grad_norm": 0.283203125,
"learning_rate": 1.1787812492144611e-05,
"entropy": 0.4636589106172323,
"num_tokens": 1791572.0,
"mean_token_accuracy": 0.8631374597549438,
"epoch": 0.8496319663512093,
"step": 1010
},
{
"loss": 0.48625845909118653,
"grad_norm": 0.423828125,
"learning_rate": 1.05373167858418e-05,
"entropy": 0.49628445636481044,
"num_tokens": 1809222.0,
"mean_token_accuracy": 0.8517171651124954,
"epoch": 0.8580441640378549,
"step": 1020
},
{
"loss": 0.4556222438812256,
"grad_norm": 0.3828125,
"learning_rate": 9.353234551018787e-06,
"entropy": 0.45326445177197455,
"num_tokens": 1827208.0,
"mean_token_accuracy": 0.8658925801515579,
"epoch": 0.8664563617245006,
"step": 1030
},
{
"loss": 0.49567365646362305,
"grad_norm": 0.466796875,
"learning_rate": 8.236444802354194e-06,
"entropy": 0.4830797161906958,
"num_tokens": 1844866.0,
"mean_token_accuracy": 0.8538633629679679,
"epoch": 0.8748685594111462,
"step": 1040
},
{
"loss": 0.49363341331481936,
"grad_norm": 0.365234375,
"learning_rate": 7.187776599311225e-06,
"entropy": 0.49590680450201036,
"num_tokens": 1863508.0,
"mean_token_accuracy": 0.8481405600905418,
"epoch": 0.8832807570977917,
"step": 1050
},
{
"eval_loss": 0.492710679769516,
"eval_runtime": 44.3795,
"eval_samples_per_second": 22.578,
"eval_steps_per_second": 5.656,
"eval_entropy": 0.4946926224279214,
"eval_num_tokens": 1863508.0,
"eval_mean_token_accuracy": 0.8535925515619407,
"epoch": 0.8832807570977917,
"step": 1050
},
{
"loss": 0.46772065162658694,
"grad_norm": 0.330078125,
"learning_rate": 6.2080084306775255e-06,
"entropy": 0.48166475519537927,
"num_tokens": 1882313.0,
"mean_token_accuracy": 0.859215559065342,
"epoch": 0.8916929547844374,
"step": 1060
},
{
"loss": 0.4697853088378906,
"grad_norm": 0.419921875,
"learning_rate": 5.297867636646625e-06,
"entropy": 0.4738619901239872,
"num_tokens": 1899903.0,
"mean_token_accuracy": 0.8621121436357498,
"epoch": 0.900105152471083,
"step": 1070
},
{
"loss": 0.48142337799072266,
"grad_norm": 0.369140625,
"learning_rate": 4.458029868870106e-06,
"entropy": 0.4744772035628557,
"num_tokens": 1917878.0,
"mean_token_accuracy": 0.8594217240810395,
"epoch": 0.9085173501577287,
"step": 1080
},
{
"loss": 0.40869989395141604,
"grad_norm": 0.4296875,
"learning_rate": 3.6891185888811354e-06,
"entropy": 0.42849237024784087,
"num_tokens": 1935443.0,
"mean_token_accuracy": 0.8725451439619064,
"epoch": 0.9169295478443743,
"step": 1090
},
{
"loss": 0.4973776817321777,
"grad_norm": 0.29296875,
"learning_rate": 2.9917046052618913e-06,
"entropy": 0.4887580588459969,
"num_tokens": 1953376.0,
"mean_token_accuracy": 0.8516494154930114,
"epoch": 0.92534174553102,
"step": 1100
},
{
"loss": 0.5040076732635498,
"grad_norm": 0.333984375,
"learning_rate": 2.3663056498984035e-06,
"entropy": 0.5119045183062554,
"num_tokens": 1970989.0,
"mean_token_accuracy": 0.8522839710116387,
"epoch": 0.9337539432176656,
"step": 1110
},
{
"loss": 0.5222736358642578,
"grad_norm": 0.458984375,
"learning_rate": 1.8133859936374065e-06,
"entropy": 0.5279249057173729,
"num_tokens": 1987794.0,
"mean_token_accuracy": 0.8435431227087975,
"epoch": 0.9421661409043113,
"step": 1120
},
{
"loss": 0.5045926570892334,
"grad_norm": 0.494140625,
"learning_rate": 1.333356101630434e-06,
"entropy": 0.5016367115080357,
"num_tokens": 2006103.0,
"mean_token_accuracy": 0.8468659013509751,
"epoch": 0.9505783385909569,
"step": 1130
},
{
"loss": 0.4517922878265381,
"grad_norm": 0.41015625,
"learning_rate": 9.265723286211114e-07,
"entropy": 0.4635258123278618,
"num_tokens": 2024653.0,
"mean_token_accuracy": 0.858749409019947,
"epoch": 0.9589905362776026,
"step": 1140
},
{
"loss": 0.4429300308227539,
"grad_norm": 0.333984375,
"learning_rate": 5.933366544018881e-07,
"entropy": 0.46379459239542487,
"num_tokens": 2042110.0,
"mean_token_accuracy": 0.8633494853973389,
"epoch": 0.9674027339642481,
"step": 1150
},
{
"loss": 0.48291401863098143,
"grad_norm": 0.404296875,
"learning_rate": 3.338964596363958e-07,
"entropy": 0.4801469299942255,
"num_tokens": 2059221.0,
"mean_token_accuracy": 0.8571181014180184,
"epoch": 0.9758149316508938,
"step": 1160
},
{
"loss": 0.4716052055358887,
"grad_norm": 0.3828125,
"learning_rate": 1.4844434221414904e-07,
"entropy": 0.4888222087174654,
"num_tokens": 2076725.0,
"mean_token_accuracy": 0.8568236321210861,
"epoch": 0.9842271293375394,
"step": 1170
},
{
"loss": 0.4568983554840088,
"grad_norm": 0.4453125,
"learning_rate": 3.7117974273603865e-08,
"entropy": 0.4492193166166544,
"num_tokens": 2093837.0,
"mean_token_accuracy": 0.8625048115849495,
"epoch": 0.9926393270241851,
"step": 1180
},
{
"eval_loss": 0.49275869131088257,
"eval_runtime": 44.373,
"eval_samples_per_second": 22.581,
"eval_steps_per_second": 5.657,
"eval_entropy": 0.4945634504950854,
"eval_num_tokens": 2109469.0,
"eval_mean_token_accuracy": 0.8536091024182232,
"epoch": 1.0,
"step": 1189
},
{
"train_runtime": 2984.9918,
"train_samples_per_second": 6.372,
"train_steps_per_second": 0.398,
"total_flos": 2.585949872638771e+16,
"train_loss": 0.49064892395090115,
"epoch": 1.0,
"step": 1189
}
]