4405 lines
124 KiB
JSON
4405 lines
124 KiB
JSON
{
|
|
"best_global_step": null,
|
|
"best_metric": null,
|
|
"best_model_checkpoint": null,
|
|
"epoch": 1.0,
|
|
"eval_steps": 500,
|
|
"global_step": 4375,
|
|
"is_hyper_param_search": false,
|
|
"is_local_process_zero": true,
|
|
"is_world_process_zero": true,
|
|
"log_history": [
|
|
{
|
|
"entropy": 0.4608087057247758,
|
|
"epoch": 0.002285714285714286,
|
|
"grad_norm": 262.0,
|
|
"learning_rate": 8.256880733944956e-07,
|
|
"loss": 4.128694152832031,
|
|
"mean_token_accuracy": 0.5559752065688371,
|
|
"num_tokens": 30583.0,
|
|
"step": 10
|
|
},
|
|
{
|
|
"entropy": 0.4808954084292054,
|
|
"epoch": 0.004571428571428572,
|
|
"grad_norm": 208.0,
|
|
"learning_rate": 1.743119266055046e-06,
|
|
"loss": 4.0306652069091795,
|
|
"mean_token_accuracy": 0.5491989776492119,
|
|
"num_tokens": 64875.0,
|
|
"step": 20
|
|
},
|
|
{
|
|
"entropy": 0.4882832657545805,
|
|
"epoch": 0.006857142857142857,
|
|
"grad_norm": 88.0,
|
|
"learning_rate": 2.6605504587155968e-06,
|
|
"loss": 3.4539260864257812,
|
|
"mean_token_accuracy": 0.5994260810315609,
|
|
"num_tokens": 96479.0,
|
|
"step": 30
|
|
},
|
|
{
|
|
"entropy": 0.6207152051851154,
|
|
"epoch": 0.009142857142857144,
|
|
"grad_norm": 50.25,
|
|
"learning_rate": 3.5779816513761473e-06,
|
|
"loss": 3.065783882141113,
|
|
"mean_token_accuracy": 0.6057824719697237,
|
|
"num_tokens": 129267.0,
|
|
"step": 40
|
|
},
|
|
{
|
|
"entropy": 0.7509429801255465,
|
|
"epoch": 0.011428571428571429,
|
|
"grad_norm": 47.5,
|
|
"learning_rate": 4.4954128440366975e-06,
|
|
"loss": 2.414494514465332,
|
|
"mean_token_accuracy": 0.6280621752142906,
|
|
"num_tokens": 157969.0,
|
|
"step": 50
|
|
},
|
|
{
|
|
"entropy": 0.9442974735051394,
|
|
"epoch": 0.013714285714285714,
|
|
"grad_norm": 21.625,
|
|
"learning_rate": 5.412844036697248e-06,
|
|
"loss": 2.0897136688232423,
|
|
"mean_token_accuracy": 0.6582186311483383,
|
|
"num_tokens": 191753.0,
|
|
"step": 60
|
|
},
|
|
{
|
|
"entropy": 1.133295001834631,
|
|
"epoch": 0.016,
|
|
"grad_norm": 15.6875,
|
|
"learning_rate": 6.330275229357799e-06,
|
|
"loss": 1.9386701583862305,
|
|
"mean_token_accuracy": 0.6817213766276836,
|
|
"num_tokens": 224874.0,
|
|
"step": 70
|
|
},
|
|
{
|
|
"entropy": 1.161771859228611,
|
|
"epoch": 0.018285714285714287,
|
|
"grad_norm": 18.875,
|
|
"learning_rate": 7.247706422018349e-06,
|
|
"loss": 1.6953561782836915,
|
|
"mean_token_accuracy": 0.7058230180293321,
|
|
"num_tokens": 259557.0,
|
|
"step": 80
|
|
},
|
|
{
|
|
"entropy": 1.0966269705444573,
|
|
"epoch": 0.02057142857142857,
|
|
"grad_norm": 15.0625,
|
|
"learning_rate": 8.1651376146789e-06,
|
|
"loss": 1.4140602111816407,
|
|
"mean_token_accuracy": 0.7321123115718364,
|
|
"num_tokens": 290863.0,
|
|
"step": 90
|
|
},
|
|
{
|
|
"entropy": 1.0357405820861458,
|
|
"epoch": 0.022857142857142857,
|
|
"grad_norm": 16.75,
|
|
"learning_rate": 9.08256880733945e-06,
|
|
"loss": 1.3797801971435546,
|
|
"mean_token_accuracy": 0.7626342628151178,
|
|
"num_tokens": 324054.0,
|
|
"step": 100
|
|
},
|
|
{
|
|
"entropy": 0.9538093984127045,
|
|
"epoch": 0.025142857142857144,
|
|
"grad_norm": 11.75,
|
|
"learning_rate": 1e-05,
|
|
"loss": 1.3015310287475585,
|
|
"mean_token_accuracy": 0.7864577785134316,
|
|
"num_tokens": 358048.0,
|
|
"step": 110
|
|
},
|
|
{
|
|
"entropy": 0.931211198028177,
|
|
"epoch": 0.027428571428571427,
|
|
"grad_norm": 12.625,
|
|
"learning_rate": 1.091743119266055e-05,
|
|
"loss": 1.2297636985778808,
|
|
"mean_token_accuracy": 0.7865072574466467,
|
|
"num_tokens": 389056.0,
|
|
"step": 120
|
|
},
|
|
{
|
|
"entropy": 0.9721011022105813,
|
|
"epoch": 0.029714285714285714,
|
|
"grad_norm": 15.125,
|
|
"learning_rate": 1.1834862385321102e-05,
|
|
"loss": 1.3690268516540527,
|
|
"mean_token_accuracy": 0.7615244656801223,
|
|
"num_tokens": 422901.0,
|
|
"step": 130
|
|
},
|
|
{
|
|
"entropy": 1.0186741236597299,
|
|
"epoch": 0.032,
|
|
"grad_norm": 10.3125,
|
|
"learning_rate": 1.2752293577981652e-05,
|
|
"loss": 1.3675042152404786,
|
|
"mean_token_accuracy": 0.7797191683202982,
|
|
"num_tokens": 452506.0,
|
|
"step": 140
|
|
},
|
|
{
|
|
"entropy": 0.9464143239893019,
|
|
"epoch": 0.03428571428571429,
|
|
"grad_norm": 13.0625,
|
|
"learning_rate": 1.3669724770642203e-05,
|
|
"loss": 1.3897374153137207,
|
|
"mean_token_accuracy": 0.7744678042829036,
|
|
"num_tokens": 483811.0,
|
|
"step": 150
|
|
},
|
|
{
|
|
"entropy": 0.9546993720345199,
|
|
"epoch": 0.036571428571428574,
|
|
"grad_norm": 10.0625,
|
|
"learning_rate": 1.4587155963302753e-05,
|
|
"loss": 1.2690893173217774,
|
|
"mean_token_accuracy": 0.7874016337096691,
|
|
"num_tokens": 511576.0,
|
|
"step": 160
|
|
},
|
|
{
|
|
"entropy": 1.002905413042754,
|
|
"epoch": 0.038857142857142854,
|
|
"grad_norm": 9.75,
|
|
"learning_rate": 1.5504587155963304e-05,
|
|
"loss": 1.3503832817077637,
|
|
"mean_token_accuracy": 0.7721866790205241,
|
|
"num_tokens": 543265.0,
|
|
"step": 170
|
|
},
|
|
{
|
|
"entropy": 0.7613611572422088,
|
|
"epoch": 0.04114285714285714,
|
|
"grad_norm": 10.4375,
|
|
"learning_rate": 1.6422018348623852e-05,
|
|
"loss": 0.977170753479004,
|
|
"mean_token_accuracy": 0.8188995130360126,
|
|
"num_tokens": 576882.0,
|
|
"step": 180
|
|
},
|
|
{
|
|
"entropy": 0.9535474652424455,
|
|
"epoch": 0.04342857142857143,
|
|
"grad_norm": 10.5625,
|
|
"learning_rate": 1.7339449541284407e-05,
|
|
"loss": 1.2448718070983886,
|
|
"mean_token_accuracy": 0.7809058628976345,
|
|
"num_tokens": 612893.0,
|
|
"step": 190
|
|
},
|
|
{
|
|
"entropy": 0.8438695728778839,
|
|
"epoch": 0.045714285714285714,
|
|
"grad_norm": 8.625,
|
|
"learning_rate": 1.8256880733944955e-05,
|
|
"loss": 1.161054801940918,
|
|
"mean_token_accuracy": 0.810321356356144,
|
|
"num_tokens": 645362.0,
|
|
"step": 200
|
|
},
|
|
{
|
|
"entropy": 0.8822290134616196,
|
|
"epoch": 0.048,
|
|
"grad_norm": 10.5,
|
|
"learning_rate": 1.9174311926605506e-05,
|
|
"loss": 1.1970745086669923,
|
|
"mean_token_accuracy": 0.7906114481389522,
|
|
"num_tokens": 678993.0,
|
|
"step": 210
|
|
},
|
|
{
|
|
"entropy": 0.9281622164882719,
|
|
"epoch": 0.05028571428571429,
|
|
"grad_norm": 9.25,
|
|
"learning_rate": 1.9995188838104405e-05,
|
|
"loss": 1.2374305725097656,
|
|
"mean_token_accuracy": 0.7800474755465985,
|
|
"num_tokens": 714146.0,
|
|
"step": 220
|
|
},
|
|
{
|
|
"entropy": 1.06684466060251,
|
|
"epoch": 0.052571428571428575,
|
|
"grad_norm": 8.25,
|
|
"learning_rate": 1.9947077219148424e-05,
|
|
"loss": 1.3902817726135255,
|
|
"mean_token_accuracy": 0.7615161284804344,
|
|
"num_tokens": 747373.0,
|
|
"step": 230
|
|
},
|
|
{
|
|
"entropy": 0.9200185919180512,
|
|
"epoch": 0.054857142857142854,
|
|
"grad_norm": 11.5,
|
|
"learning_rate": 1.9898965600192447e-05,
|
|
"loss": 1.201821517944336,
|
|
"mean_token_accuracy": 0.7907239098101855,
|
|
"num_tokens": 780155.0,
|
|
"step": 240
|
|
},
|
|
{
|
|
"entropy": 0.7674560694023966,
|
|
"epoch": 0.05714285714285714,
|
|
"grad_norm": 10.1875,
|
|
"learning_rate": 1.985085398123647e-05,
|
|
"loss": 1.063106632232666,
|
|
"mean_token_accuracy": 0.8229942351579667,
|
|
"num_tokens": 814128.0,
|
|
"step": 250
|
|
},
|
|
{
|
|
"entropy": 1.0007737869396807,
|
|
"epoch": 0.05942857142857143,
|
|
"grad_norm": 12.125,
|
|
"learning_rate": 1.9802742362280492e-05,
|
|
"loss": 1.2750150680541992,
|
|
"mean_token_accuracy": 0.7728326875716448,
|
|
"num_tokens": 845910.0,
|
|
"step": 260
|
|
},
|
|
{
|
|
"entropy": 0.9125091641210019,
|
|
"epoch": 0.061714285714285715,
|
|
"grad_norm": 10.125,
|
|
"learning_rate": 1.9754630743324514e-05,
|
|
"loss": 1.2319644927978515,
|
|
"mean_token_accuracy": 0.7889250412583351,
|
|
"num_tokens": 875424.0,
|
|
"step": 270
|
|
},
|
|
{
|
|
"entropy": 0.783863732777536,
|
|
"epoch": 0.064,
|
|
"grad_norm": 9.625,
|
|
"learning_rate": 1.9706519124368537e-05,
|
|
"loss": 1.1022482872009278,
|
|
"mean_token_accuracy": 0.8143158428370952,
|
|
"num_tokens": 912199.0,
|
|
"step": 280
|
|
},
|
|
{
|
|
"entropy": 0.7469094243831933,
|
|
"epoch": 0.06628571428571428,
|
|
"grad_norm": 9.0,
|
|
"learning_rate": 1.965840750541256e-05,
|
|
"loss": 1.012520694732666,
|
|
"mean_token_accuracy": 0.8163027696311473,
|
|
"num_tokens": 945467.0,
|
|
"step": 290
|
|
},
|
|
{
|
|
"entropy": 0.8857646442949771,
|
|
"epoch": 0.06857142857142857,
|
|
"grad_norm": 8.0625,
|
|
"learning_rate": 1.9610295886456582e-05,
|
|
"loss": 1.158743667602539,
|
|
"mean_token_accuracy": 0.7900811523199082,
|
|
"num_tokens": 975590.0,
|
|
"step": 300
|
|
},
|
|
{
|
|
"entropy": 0.909662488102913,
|
|
"epoch": 0.07085714285714285,
|
|
"grad_norm": 7.75,
|
|
"learning_rate": 1.9562184267500604e-05,
|
|
"loss": 1.2604731559753417,
|
|
"mean_token_accuracy": 0.7842940967530012,
|
|
"num_tokens": 1006723.0,
|
|
"step": 310
|
|
},
|
|
{
|
|
"entropy": 0.7755309957079589,
|
|
"epoch": 0.07314285714285715,
|
|
"grad_norm": 7.96875,
|
|
"learning_rate": 1.9514072648544624e-05,
|
|
"loss": 1.0989351272583008,
|
|
"mean_token_accuracy": 0.8179159574210644,
|
|
"num_tokens": 1039345.0,
|
|
"step": 320
|
|
},
|
|
{
|
|
"entropy": 0.6633960926905275,
|
|
"epoch": 0.07542857142857143,
|
|
"grad_norm": 8.75,
|
|
"learning_rate": 1.9465961029588646e-05,
|
|
"loss": 0.9405019760131836,
|
|
"mean_token_accuracy": 0.8347477428615093,
|
|
"num_tokens": 1072231.0,
|
|
"step": 330
|
|
},
|
|
{
|
|
"entropy": 0.7519668426364661,
|
|
"epoch": 0.07771428571428571,
|
|
"grad_norm": 11.125,
|
|
"learning_rate": 1.941784941063267e-05,
|
|
"loss": 1.120675754547119,
|
|
"mean_token_accuracy": 0.8173437312245369,
|
|
"num_tokens": 1107977.0,
|
|
"step": 340
|
|
},
|
|
{
|
|
"entropy": 0.8688408816233277,
|
|
"epoch": 0.08,
|
|
"grad_norm": 7.53125,
|
|
"learning_rate": 1.936973779167669e-05,
|
|
"loss": 1.137878131866455,
|
|
"mean_token_accuracy": 0.8090878508985042,
|
|
"num_tokens": 1137182.0,
|
|
"step": 350
|
|
},
|
|
{
|
|
"entropy": 0.7986814582720398,
|
|
"epoch": 0.08228571428571428,
|
|
"grad_norm": 8.0625,
|
|
"learning_rate": 1.9321626172720714e-05,
|
|
"loss": 1.0986030578613282,
|
|
"mean_token_accuracy": 0.8076537061482668,
|
|
"num_tokens": 1171297.0,
|
|
"step": 360
|
|
},
|
|
{
|
|
"entropy": 0.7295990631915629,
|
|
"epoch": 0.08457142857142858,
|
|
"grad_norm": 9.1875,
|
|
"learning_rate": 1.9273514553764736e-05,
|
|
"loss": 1.0371208190917969,
|
|
"mean_token_accuracy": 0.8235810197889805,
|
|
"num_tokens": 1203878.0,
|
|
"step": 370
|
|
},
|
|
{
|
|
"entropy": 0.7101914969272911,
|
|
"epoch": 0.08685714285714285,
|
|
"grad_norm": 8.5625,
|
|
"learning_rate": 1.922540293480876e-05,
|
|
"loss": 0.9649307250976562,
|
|
"mean_token_accuracy": 0.8310844466090203,
|
|
"num_tokens": 1238543.0,
|
|
"step": 380
|
|
},
|
|
{
|
|
"entropy": 0.8718695783987641,
|
|
"epoch": 0.08914285714285715,
|
|
"grad_norm": 9.0625,
|
|
"learning_rate": 1.917729131585278e-05,
|
|
"loss": 1.1625357627868653,
|
|
"mean_token_accuracy": 0.8035985276103019,
|
|
"num_tokens": 1269739.0,
|
|
"step": 390
|
|
},
|
|
{
|
|
"entropy": 0.7572122471407056,
|
|
"epoch": 0.09142857142857143,
|
|
"grad_norm": 7.375,
|
|
"learning_rate": 1.9129179696896804e-05,
|
|
"loss": 1.0944371223449707,
|
|
"mean_token_accuracy": 0.8201560072600842,
|
|
"num_tokens": 1300389.0,
|
|
"step": 400
|
|
},
|
|
{
|
|
"entropy": 0.7699693274684251,
|
|
"epoch": 0.09371428571428571,
|
|
"grad_norm": 7.5625,
|
|
"learning_rate": 1.9081068077940826e-05,
|
|
"loss": 1.1060125350952148,
|
|
"mean_token_accuracy": 0.8187883667647838,
|
|
"num_tokens": 1332082.0,
|
|
"step": 410
|
|
},
|
|
{
|
|
"entropy": 0.7879621520638466,
|
|
"epoch": 0.096,
|
|
"grad_norm": 7.125,
|
|
"learning_rate": 1.9032956458984845e-05,
|
|
"loss": 1.0424601554870605,
|
|
"mean_token_accuracy": 0.8205794245004654,
|
|
"num_tokens": 1365790.0,
|
|
"step": 420
|
|
},
|
|
{
|
|
"entropy": 0.7572797378525138,
|
|
"epoch": 0.09828571428571428,
|
|
"grad_norm": 7.34375,
|
|
"learning_rate": 1.8984844840028868e-05,
|
|
"loss": 1.078255844116211,
|
|
"mean_token_accuracy": 0.8151584453880787,
|
|
"num_tokens": 1400056.0,
|
|
"step": 430
|
|
},
|
|
{
|
|
"entropy": 0.7952604771591723,
|
|
"epoch": 0.10057142857142858,
|
|
"grad_norm": 7.375,
|
|
"learning_rate": 1.893673322107289e-05,
|
|
"loss": 1.105555820465088,
|
|
"mean_token_accuracy": 0.8153948955237865,
|
|
"num_tokens": 1430264.0,
|
|
"step": 440
|
|
},
|
|
{
|
|
"entropy": 0.8230121753178536,
|
|
"epoch": 0.10285714285714286,
|
|
"grad_norm": 7.125,
|
|
"learning_rate": 1.8888621602116913e-05,
|
|
"loss": 1.0710087776184083,
|
|
"mean_token_accuracy": 0.8046157158911228,
|
|
"num_tokens": 1461481.0,
|
|
"step": 450
|
|
},
|
|
{
|
|
"entropy": 0.9548539834097027,
|
|
"epoch": 0.10514285714285715,
|
|
"grad_norm": 7.09375,
|
|
"learning_rate": 1.8840509983160935e-05,
|
|
"loss": 1.240159511566162,
|
|
"mean_token_accuracy": 0.7864300020039081,
|
|
"num_tokens": 1493711.0,
|
|
"step": 460
|
|
},
|
|
{
|
|
"entropy": 1.0574401247315108,
|
|
"epoch": 0.10742857142857143,
|
|
"grad_norm": 7.90625,
|
|
"learning_rate": 1.8792398364204958e-05,
|
|
"loss": 1.345158290863037,
|
|
"mean_token_accuracy": 0.7603430174291134,
|
|
"num_tokens": 1526418.0,
|
|
"step": 470
|
|
},
|
|
{
|
|
"entropy": 0.8240675249136984,
|
|
"epoch": 0.10971428571428571,
|
|
"grad_norm": 7.65625,
|
|
"learning_rate": 1.874428674524898e-05,
|
|
"loss": 1.0730896949768067,
|
|
"mean_token_accuracy": 0.8100373946130276,
|
|
"num_tokens": 1558046.0,
|
|
"step": 480
|
|
},
|
|
{
|
|
"entropy": 0.8802061447873711,
|
|
"epoch": 0.112,
|
|
"grad_norm": 7.84375,
|
|
"learning_rate": 1.8696175126293003e-05,
|
|
"loss": 1.145187759399414,
|
|
"mean_token_accuracy": 0.7953318640589714,
|
|
"num_tokens": 1586212.0,
|
|
"step": 490
|
|
},
|
|
{
|
|
"entropy": 0.7748386798426509,
|
|
"epoch": 0.11428571428571428,
|
|
"grad_norm": 7.625,
|
|
"learning_rate": 1.8648063507337025e-05,
|
|
"loss": 0.9954061508178711,
|
|
"mean_token_accuracy": 0.8151729434728623,
|
|
"num_tokens": 1622364.0,
|
|
"step": 500
|
|
},
|
|
{
|
|
"entropy": 0.7383366953581572,
|
|
"epoch": 0.11657142857142858,
|
|
"grad_norm": 8.75,
|
|
"learning_rate": 1.8599951888381044e-05,
|
|
"loss": 0.9818957328796387,
|
|
"mean_token_accuracy": 0.8187249258160592,
|
|
"num_tokens": 1655806.0,
|
|
"step": 510
|
|
},
|
|
{
|
|
"entropy": 0.7778955462388695,
|
|
"epoch": 0.11885714285714286,
|
|
"grad_norm": 7.6875,
|
|
"learning_rate": 1.8551840269425067e-05,
|
|
"loss": 1.070115566253662,
|
|
"mean_token_accuracy": 0.8072714075446129,
|
|
"num_tokens": 1687198.0,
|
|
"step": 520
|
|
},
|
|
{
|
|
"entropy": 0.806643515639007,
|
|
"epoch": 0.12114285714285715,
|
|
"grad_norm": 8.5,
|
|
"learning_rate": 1.850372865046909e-05,
|
|
"loss": 1.1104951858520509,
|
|
"mean_token_accuracy": 0.8077441163361072,
|
|
"num_tokens": 1718591.0,
|
|
"step": 530
|
|
},
|
|
{
|
|
"entropy": 0.8236157631501555,
|
|
"epoch": 0.12342857142857143,
|
|
"grad_norm": 7.84375,
|
|
"learning_rate": 1.8455617031513112e-05,
|
|
"loss": 1.0954437255859375,
|
|
"mean_token_accuracy": 0.8092149019241333,
|
|
"num_tokens": 1750163.0,
|
|
"step": 540
|
|
},
|
|
{
|
|
"entropy": 0.9514989891089499,
|
|
"epoch": 0.12571428571428572,
|
|
"grad_norm": 8.0,
|
|
"learning_rate": 1.8407505412557134e-05,
|
|
"loss": 1.2232957839965821,
|
|
"mean_token_accuracy": 0.7788458302617073,
|
|
"num_tokens": 1783654.0,
|
|
"step": 550
|
|
},
|
|
{
|
|
"entropy": 0.8126472384203225,
|
|
"epoch": 0.128,
|
|
"grad_norm": 7.25,
|
|
"learning_rate": 1.8359393793601157e-05,
|
|
"loss": 1.1193376541137696,
|
|
"mean_token_accuracy": 0.8038583904504776,
|
|
"num_tokens": 1818298.0,
|
|
"step": 560
|
|
},
|
|
{
|
|
"entropy": 0.7461063047870994,
|
|
"epoch": 0.13028571428571428,
|
|
"grad_norm": 10.125,
|
|
"learning_rate": 1.8311282174645176e-05,
|
|
"loss": 1.0971127510070802,
|
|
"mean_token_accuracy": 0.8208389431238174,
|
|
"num_tokens": 1852353.0,
|
|
"step": 570
|
|
},
|
|
{
|
|
"entropy": 0.8738343502394855,
|
|
"epoch": 0.13257142857142856,
|
|
"grad_norm": 7.78125,
|
|
"learning_rate": 1.8263170555689202e-05,
|
|
"loss": 1.1203450202941894,
|
|
"mean_token_accuracy": 0.7919381201267243,
|
|
"num_tokens": 1883233.0,
|
|
"step": 580
|
|
},
|
|
{
|
|
"entropy": 0.9372453663498164,
|
|
"epoch": 0.13485714285714287,
|
|
"grad_norm": 7.09375,
|
|
"learning_rate": 1.8215058936733224e-05,
|
|
"loss": 1.2445517539978028,
|
|
"mean_token_accuracy": 0.7886677496135235,
|
|
"num_tokens": 1914856.0,
|
|
"step": 590
|
|
},
|
|
{
|
|
"entropy": 0.922083193808794,
|
|
"epoch": 0.13714285714285715,
|
|
"grad_norm": 7.28125,
|
|
"learning_rate": 1.8166947317777243e-05,
|
|
"loss": 1.2312170028686524,
|
|
"mean_token_accuracy": 0.7963043257594109,
|
|
"num_tokens": 1944932.0,
|
|
"step": 600
|
|
},
|
|
{
|
|
"entropy": 0.885446681920439,
|
|
"epoch": 0.13942857142857143,
|
|
"grad_norm": 7.75,
|
|
"learning_rate": 1.8118835698821266e-05,
|
|
"loss": 1.1832991600036622,
|
|
"mean_token_accuracy": 0.7979222141206265,
|
|
"num_tokens": 1977483.0,
|
|
"step": 610
|
|
},
|
|
{
|
|
"entropy": 0.7927633517421782,
|
|
"epoch": 0.1417142857142857,
|
|
"grad_norm": 10.875,
|
|
"learning_rate": 1.807072407986529e-05,
|
|
"loss": 1.072523021697998,
|
|
"mean_token_accuracy": 0.8096244156360626,
|
|
"num_tokens": 2012646.0,
|
|
"step": 620
|
|
},
|
|
{
|
|
"entropy": 0.8450389008037746,
|
|
"epoch": 0.144,
|
|
"grad_norm": 8.5625,
|
|
"learning_rate": 1.802261246090931e-05,
|
|
"loss": 1.1467965126037598,
|
|
"mean_token_accuracy": 0.8004457049071789,
|
|
"num_tokens": 2044969.0,
|
|
"step": 630
|
|
},
|
|
{
|
|
"entropy": 0.9473820111714304,
|
|
"epoch": 0.1462857142857143,
|
|
"grad_norm": 7.8125,
|
|
"learning_rate": 1.7974500841953333e-05,
|
|
"loss": 1.2415997505187988,
|
|
"mean_token_accuracy": 0.7821900390088559,
|
|
"num_tokens": 2077063.0,
|
|
"step": 640
|
|
},
|
|
{
|
|
"entropy": 0.8002779926173389,
|
|
"epoch": 0.14857142857142858,
|
|
"grad_norm": 7.1875,
|
|
"learning_rate": 1.7926389222997356e-05,
|
|
"loss": 1.08231201171875,
|
|
"mean_token_accuracy": 0.8153595373034477,
|
|
"num_tokens": 2108559.0,
|
|
"step": 650
|
|
},
|
|
{
|
|
"entropy": 0.7409520236775279,
|
|
"epoch": 0.15085714285714286,
|
|
"grad_norm": 6.625,
|
|
"learning_rate": 1.7878277604041375e-05,
|
|
"loss": 1.0647228240966797,
|
|
"mean_token_accuracy": 0.8233258232474328,
|
|
"num_tokens": 2143996.0,
|
|
"step": 660
|
|
},
|
|
{
|
|
"entropy": 0.6605528288520872,
|
|
"epoch": 0.15314285714285714,
|
|
"grad_norm": 7.0,
|
|
"learning_rate": 1.7830165985085398e-05,
|
|
"loss": 0.8986818313598632,
|
|
"mean_token_accuracy": 0.8348655626177788,
|
|
"num_tokens": 2177219.0,
|
|
"step": 670
|
|
},
|
|
{
|
|
"entropy": 0.8855553255416453,
|
|
"epoch": 0.15542857142857142,
|
|
"grad_norm": 7.25,
|
|
"learning_rate": 1.7782054366129423e-05,
|
|
"loss": 1.2236814498901367,
|
|
"mean_token_accuracy": 0.7893378108739852,
|
|
"num_tokens": 2209056.0,
|
|
"step": 680
|
|
},
|
|
{
|
|
"entropy": 0.7778299384750426,
|
|
"epoch": 0.15771428571428572,
|
|
"grad_norm": 8.75,
|
|
"learning_rate": 1.7733942747173446e-05,
|
|
"loss": 1.1849853515625,
|
|
"mean_token_accuracy": 0.8148446299135685,
|
|
"num_tokens": 2241537.0,
|
|
"step": 690
|
|
},
|
|
{
|
|
"entropy": 0.9553269637282937,
|
|
"epoch": 0.16,
|
|
"grad_norm": 7.9375,
|
|
"learning_rate": 1.7685831128217465e-05,
|
|
"loss": 1.185690212249756,
|
|
"mean_token_accuracy": 0.7805978901684284,
|
|
"num_tokens": 2273475.0,
|
|
"step": 700
|
|
},
|
|
{
|
|
"entropy": 0.921497387625277,
|
|
"epoch": 0.16228571428571428,
|
|
"grad_norm": 7.65625,
|
|
"learning_rate": 1.7637719509261488e-05,
|
|
"loss": 1.1969280242919922,
|
|
"mean_token_accuracy": 0.7880251817405224,
|
|
"num_tokens": 2303700.0,
|
|
"step": 710
|
|
},
|
|
{
|
|
"entropy": 0.9623362662270665,
|
|
"epoch": 0.16457142857142856,
|
|
"grad_norm": 7.84375,
|
|
"learning_rate": 1.758960789030551e-05,
|
|
"loss": 1.2279460906982422,
|
|
"mean_token_accuracy": 0.7762100405991077,
|
|
"num_tokens": 2335528.0,
|
|
"step": 720
|
|
},
|
|
{
|
|
"entropy": 0.7501861874945461,
|
|
"epoch": 0.16685714285714287,
|
|
"grad_norm": 6.53125,
|
|
"learning_rate": 1.7541496271349533e-05,
|
|
"loss": 1.092702579498291,
|
|
"mean_token_accuracy": 0.8136215195059776,
|
|
"num_tokens": 2369322.0,
|
|
"step": 730
|
|
},
|
|
{
|
|
"entropy": 0.741880859900266,
|
|
"epoch": 0.16914285714285715,
|
|
"grad_norm": 9.1875,
|
|
"learning_rate": 1.7493384652393555e-05,
|
|
"loss": 1.0542023658752442,
|
|
"mean_token_accuracy": 0.8248877495527267,
|
|
"num_tokens": 2402789.0,
|
|
"step": 740
|
|
},
|
|
{
|
|
"entropy": 0.7251557628624141,
|
|
"epoch": 0.17142857142857143,
|
|
"grad_norm": 7.21875,
|
|
"learning_rate": 1.7445273033437578e-05,
|
|
"loss": 0.9859682083129883,
|
|
"mean_token_accuracy": 0.8190685380250216,
|
|
"num_tokens": 2435813.0,
|
|
"step": 750
|
|
},
|
|
{
|
|
"entropy": 0.8274217823520302,
|
|
"epoch": 0.1737142857142857,
|
|
"grad_norm": 7.8125,
|
|
"learning_rate": 1.7397161414481597e-05,
|
|
"loss": 1.1144951820373534,
|
|
"mean_token_accuracy": 0.8048250667750836,
|
|
"num_tokens": 2469061.0,
|
|
"step": 760
|
|
},
|
|
{
|
|
"entropy": 0.9110285563394427,
|
|
"epoch": 0.176,
|
|
"grad_norm": 7.9375,
|
|
"learning_rate": 1.7349049795525623e-05,
|
|
"loss": 1.2487107276916505,
|
|
"mean_token_accuracy": 0.7836838386952877,
|
|
"num_tokens": 2499540.0,
|
|
"step": 770
|
|
},
|
|
{
|
|
"entropy": 0.7952723279595375,
|
|
"epoch": 0.1782857142857143,
|
|
"grad_norm": 8.125,
|
|
"learning_rate": 1.7300938176569645e-05,
|
|
"loss": 1.1460785865783691,
|
|
"mean_token_accuracy": 0.8108866758644581,
|
|
"num_tokens": 2528841.0,
|
|
"step": 780
|
|
},
|
|
{
|
|
"entropy": 0.8681487245485187,
|
|
"epoch": 0.18057142857142858,
|
|
"grad_norm": 7.0625,
|
|
"learning_rate": 1.7252826557613664e-05,
|
|
"loss": 1.088980770111084,
|
|
"mean_token_accuracy": 0.7965113393962383,
|
|
"num_tokens": 2560120.0,
|
|
"step": 790
|
|
},
|
|
{
|
|
"entropy": 0.7640921414829791,
|
|
"epoch": 0.18285714285714286,
|
|
"grad_norm": 9.75,
|
|
"learning_rate": 1.7204714938657687e-05,
|
|
"loss": 1.1072608947753906,
|
|
"mean_token_accuracy": 0.81538320556283,
|
|
"num_tokens": 2592460.0,
|
|
"step": 800
|
|
},
|
|
{
|
|
"entropy": 0.8132671658881009,
|
|
"epoch": 0.18514285714285714,
|
|
"grad_norm": 7.1875,
|
|
"learning_rate": 1.715660331970171e-05,
|
|
"loss": 1.1375692367553711,
|
|
"mean_token_accuracy": 0.8027771405875683,
|
|
"num_tokens": 2628458.0,
|
|
"step": 810
|
|
},
|
|
{
|
|
"entropy": 0.71722816741094,
|
|
"epoch": 0.18742857142857142,
|
|
"grad_norm": 6.625,
|
|
"learning_rate": 1.7108491700745732e-05,
|
|
"loss": 0.9269392013549804,
|
|
"mean_token_accuracy": 0.8260728389024734,
|
|
"num_tokens": 2663216.0,
|
|
"step": 820
|
|
},
|
|
{
|
|
"entropy": 0.7395319850184023,
|
|
"epoch": 0.18971428571428572,
|
|
"grad_norm": 8.0625,
|
|
"learning_rate": 1.7060380081789754e-05,
|
|
"loss": 0.9782637596130371,
|
|
"mean_token_accuracy": 0.8158168852329254,
|
|
"num_tokens": 2695026.0,
|
|
"step": 830
|
|
},
|
|
{
|
|
"entropy": 0.7296101478859782,
|
|
"epoch": 0.192,
|
|
"grad_norm": 7.21875,
|
|
"learning_rate": 1.7012268462833777e-05,
|
|
"loss": 1.0164703369140624,
|
|
"mean_token_accuracy": 0.8283582173287869,
|
|
"num_tokens": 2727324.0,
|
|
"step": 840
|
|
},
|
|
{
|
|
"entropy": 0.8305218723602593,
|
|
"epoch": 0.19428571428571428,
|
|
"grad_norm": 8.0,
|
|
"learning_rate": 1.6964156843877796e-05,
|
|
"loss": 1.1646985054016112,
|
|
"mean_token_accuracy": 0.8054761447012424,
|
|
"num_tokens": 2759422.0,
|
|
"step": 850
|
|
},
|
|
{
|
|
"entropy": 0.8524466481991112,
|
|
"epoch": 0.19657142857142856,
|
|
"grad_norm": 8.25,
|
|
"learning_rate": 1.691604522492182e-05,
|
|
"loss": 1.1327482223510743,
|
|
"mean_token_accuracy": 0.8032685436308384,
|
|
"num_tokens": 2792518.0,
|
|
"step": 860
|
|
},
|
|
{
|
|
"entropy": 0.6850544813089072,
|
|
"epoch": 0.19885714285714284,
|
|
"grad_norm": 8.1875,
|
|
"learning_rate": 1.6867933605965844e-05,
|
|
"loss": 0.9866686820983886,
|
|
"mean_token_accuracy": 0.8292375847697258,
|
|
"num_tokens": 2826870.0,
|
|
"step": 870
|
|
},
|
|
{
|
|
"entropy": 0.7483350836671889,
|
|
"epoch": 0.20114285714285715,
|
|
"grad_norm": 9.3125,
|
|
"learning_rate": 1.6819821987009863e-05,
|
|
"loss": 1.0796706199645996,
|
|
"mean_token_accuracy": 0.8100242014974356,
|
|
"num_tokens": 2859320.0,
|
|
"step": 880
|
|
},
|
|
{
|
|
"entropy": 0.761015557963401,
|
|
"epoch": 0.20342857142857143,
|
|
"grad_norm": 7.65625,
|
|
"learning_rate": 1.6771710368053886e-05,
|
|
"loss": 1.0168207168579102,
|
|
"mean_token_accuracy": 0.8171908967196941,
|
|
"num_tokens": 2893696.0,
|
|
"step": 890
|
|
},
|
|
{
|
|
"entropy": 0.7136277809739113,
|
|
"epoch": 0.2057142857142857,
|
|
"grad_norm": 6.75,
|
|
"learning_rate": 1.672359874909791e-05,
|
|
"loss": 0.9646918296813964,
|
|
"mean_token_accuracy": 0.8310928396880627,
|
|
"num_tokens": 2925196.0,
|
|
"step": 900
|
|
},
|
|
{
|
|
"entropy": 0.8552220237441361,
|
|
"epoch": 0.208,
|
|
"grad_norm": 7.28125,
|
|
"learning_rate": 1.667548713014193e-05,
|
|
"loss": 1.0989733695983888,
|
|
"mean_token_accuracy": 0.8012546695768833,
|
|
"num_tokens": 2957056.0,
|
|
"step": 910
|
|
},
|
|
{
|
|
"entropy": 0.8601699252612889,
|
|
"epoch": 0.2102857142857143,
|
|
"grad_norm": 7.09375,
|
|
"learning_rate": 1.6627375511185953e-05,
|
|
"loss": 1.1599449157714843,
|
|
"mean_token_accuracy": 0.7934970580041408,
|
|
"num_tokens": 2988772.0,
|
|
"step": 920
|
|
},
|
|
{
|
|
"entropy": 0.7465516209602356,
|
|
"epoch": 0.21257142857142858,
|
|
"grad_norm": 6.0625,
|
|
"learning_rate": 1.6579263892229976e-05,
|
|
"loss": 1.014716911315918,
|
|
"mean_token_accuracy": 0.8273697007447481,
|
|
"num_tokens": 3024521.0,
|
|
"step": 930
|
|
},
|
|
{
|
|
"entropy": 0.7951956107281148,
|
|
"epoch": 0.21485714285714286,
|
|
"grad_norm": 7.0,
|
|
"learning_rate": 1.6531152273273995e-05,
|
|
"loss": 1.023974895477295,
|
|
"mean_token_accuracy": 0.81702711135149,
|
|
"num_tokens": 3055362.0,
|
|
"step": 940
|
|
},
|
|
{
|
|
"entropy": 0.8373465910553932,
|
|
"epoch": 0.21714285714285714,
|
|
"grad_norm": 8.5625,
|
|
"learning_rate": 1.6483040654318018e-05,
|
|
"loss": 1.149094009399414,
|
|
"mean_token_accuracy": 0.7994145810604095,
|
|
"num_tokens": 3085932.0,
|
|
"step": 950
|
|
},
|
|
{
|
|
"entropy": 0.7051204042509198,
|
|
"epoch": 0.21942857142857142,
|
|
"grad_norm": 6.375,
|
|
"learning_rate": 1.643492903536204e-05,
|
|
"loss": 0.9659648895263672,
|
|
"mean_token_accuracy": 0.8331427097320556,
|
|
"num_tokens": 3114791.0,
|
|
"step": 960
|
|
},
|
|
{
|
|
"entropy": 0.7798629926517606,
|
|
"epoch": 0.22171428571428572,
|
|
"grad_norm": 7.1875,
|
|
"learning_rate": 1.6386817416406066e-05,
|
|
"loss": 1.008477783203125,
|
|
"mean_token_accuracy": 0.8194496557116508,
|
|
"num_tokens": 3149473.0,
|
|
"step": 970
|
|
},
|
|
{
|
|
"entropy": 0.6989101554267109,
|
|
"epoch": 0.224,
|
|
"grad_norm": 8.125,
|
|
"learning_rate": 1.6338705797450085e-05,
|
|
"loss": 0.9564552307128906,
|
|
"mean_token_accuracy": 0.8339050948619843,
|
|
"num_tokens": 3182913.0,
|
|
"step": 980
|
|
},
|
|
{
|
|
"entropy": 0.8009612016379833,
|
|
"epoch": 0.22628571428571428,
|
|
"grad_norm": 7.96875,
|
|
"learning_rate": 1.6290594178494108e-05,
|
|
"loss": 1.082752799987793,
|
|
"mean_token_accuracy": 0.8148751087486744,
|
|
"num_tokens": 3214329.0,
|
|
"step": 990
|
|
},
|
|
{
|
|
"entropy": 0.7472866786643863,
|
|
"epoch": 0.22857142857142856,
|
|
"grad_norm": 7.03125,
|
|
"learning_rate": 1.624248255953813e-05,
|
|
"loss": 0.9995194435119629,
|
|
"mean_token_accuracy": 0.8205188862979412,
|
|
"num_tokens": 3246465.0,
|
|
"step": 1000
|
|
},
|
|
{
|
|
"entropy": 0.8845632201060653,
|
|
"epoch": 0.23085714285714284,
|
|
"grad_norm": 7.28125,
|
|
"learning_rate": 1.6194370940582153e-05,
|
|
"loss": 1.1626070976257323,
|
|
"mean_token_accuracy": 0.7972030624747276,
|
|
"num_tokens": 3280259.0,
|
|
"step": 1010
|
|
},
|
|
{
|
|
"entropy": 0.7615264546126127,
|
|
"epoch": 0.23314285714285715,
|
|
"grad_norm": 6.59375,
|
|
"learning_rate": 1.6146259321626175e-05,
|
|
"loss": 1.0563675880432128,
|
|
"mean_token_accuracy": 0.8191345028579236,
|
|
"num_tokens": 3308134.0,
|
|
"step": 1020
|
|
},
|
|
{
|
|
"entropy": 0.7456497238948941,
|
|
"epoch": 0.23542857142857143,
|
|
"grad_norm": 9.125,
|
|
"learning_rate": 1.6098147702670198e-05,
|
|
"loss": 0.9785372734069824,
|
|
"mean_token_accuracy": 0.8168387658894062,
|
|
"num_tokens": 3339804.0,
|
|
"step": 1030
|
|
},
|
|
{
|
|
"entropy": 0.9259420620277524,
|
|
"epoch": 0.2377142857142857,
|
|
"grad_norm": 7.1875,
|
|
"learning_rate": 1.6050036083714217e-05,
|
|
"loss": 1.2626006126403808,
|
|
"mean_token_accuracy": 0.7905944272875786,
|
|
"num_tokens": 3374600.0,
|
|
"step": 1040
|
|
},
|
|
{
|
|
"entropy": 0.7013174806721508,
|
|
"epoch": 0.24,
|
|
"grad_norm": 7.28125,
|
|
"learning_rate": 1.600192446475824e-05,
|
|
"loss": 0.8472931861877442,
|
|
"mean_token_accuracy": 0.834729814529419,
|
|
"num_tokens": 3406084.0,
|
|
"step": 1050
|
|
},
|
|
{
|
|
"entropy": 0.8099798344075679,
|
|
"epoch": 0.2422857142857143,
|
|
"grad_norm": 8.375,
|
|
"learning_rate": 1.5953812845802265e-05,
|
|
"loss": 1.1302724838256837,
|
|
"mean_token_accuracy": 0.8053847432136536,
|
|
"num_tokens": 3436595.0,
|
|
"step": 1060
|
|
},
|
|
{
|
|
"entropy": 0.6409325916320086,
|
|
"epoch": 0.24457142857142858,
|
|
"grad_norm": 8.1875,
|
|
"learning_rate": 1.5905701226846284e-05,
|
|
"loss": 0.9276237487792969,
|
|
"mean_token_accuracy": 0.8369442120194435,
|
|
"num_tokens": 3468462.0,
|
|
"step": 1070
|
|
},
|
|
{
|
|
"entropy": 0.6651454066857696,
|
|
"epoch": 0.24685714285714286,
|
|
"grad_norm": 8.75,
|
|
"learning_rate": 1.5857589607890307e-05,
|
|
"loss": 0.9005106925964356,
|
|
"mean_token_accuracy": 0.8366246894001961,
|
|
"num_tokens": 3502363.0,
|
|
"step": 1080
|
|
},
|
|
{
|
|
"entropy": 0.6705873743630946,
|
|
"epoch": 0.24914285714285714,
|
|
"grad_norm": 6.96875,
|
|
"learning_rate": 1.580947798893433e-05,
|
|
"loss": 0.9289634704589844,
|
|
"mean_token_accuracy": 0.8348163716495037,
|
|
"num_tokens": 3532774.0,
|
|
"step": 1090
|
|
},
|
|
{
|
|
"entropy": 0.8024829808622599,
|
|
"epoch": 0.25142857142857145,
|
|
"grad_norm": 8.25,
|
|
"learning_rate": 1.5761366369978352e-05,
|
|
"loss": 1.1945523262023925,
|
|
"mean_token_accuracy": 0.8085858777165413,
|
|
"num_tokens": 3565974.0,
|
|
"step": 1100
|
|
},
|
|
{
|
|
"entropy": 0.7451043974608182,
|
|
"epoch": 0.2537142857142857,
|
|
"grad_norm": 7.0625,
|
|
"learning_rate": 1.5713254751022374e-05,
|
|
"loss": 1.0138811111450194,
|
|
"mean_token_accuracy": 0.8233392249792815,
|
|
"num_tokens": 3599243.0,
|
|
"step": 1110
|
|
},
|
|
{
|
|
"entropy": 0.8042388122528792,
|
|
"epoch": 0.256,
|
|
"grad_norm": 6.71875,
|
|
"learning_rate": 1.5665143132066397e-05,
|
|
"loss": 1.0674107551574707,
|
|
"mean_token_accuracy": 0.8107536815106868,
|
|
"num_tokens": 3631217.0,
|
|
"step": 1120
|
|
},
|
|
{
|
|
"entropy": 0.6658579808659851,
|
|
"epoch": 0.2582857142857143,
|
|
"grad_norm": 7.9375,
|
|
"learning_rate": 1.5617031513110416e-05,
|
|
"loss": 0.8685308456420898,
|
|
"mean_token_accuracy": 0.8395798467099667,
|
|
"num_tokens": 3663654.0,
|
|
"step": 1130
|
|
},
|
|
{
|
|
"entropy": 0.6915052223019302,
|
|
"epoch": 0.26057142857142856,
|
|
"grad_norm": 6.75,
|
|
"learning_rate": 1.556891989415444e-05,
|
|
"loss": 0.9267234802246094,
|
|
"mean_token_accuracy": 0.8305907912552357,
|
|
"num_tokens": 3695008.0,
|
|
"step": 1140
|
|
},
|
|
{
|
|
"entropy": 0.7746626659296453,
|
|
"epoch": 0.26285714285714284,
|
|
"grad_norm": 7.46875,
|
|
"learning_rate": 1.552080827519846e-05,
|
|
"loss": 1.1303828239440918,
|
|
"mean_token_accuracy": 0.8152431160211563,
|
|
"num_tokens": 3725769.0,
|
|
"step": 1150
|
|
},
|
|
{
|
|
"entropy": 0.815077618137002,
|
|
"epoch": 0.2651428571428571,
|
|
"grad_norm": 8.375,
|
|
"learning_rate": 1.5472696656242483e-05,
|
|
"loss": 1.1592507362365723,
|
|
"mean_token_accuracy": 0.8096996866166591,
|
|
"num_tokens": 3759222.0,
|
|
"step": 1160
|
|
},
|
|
{
|
|
"entropy": 0.9105647809803485,
|
|
"epoch": 0.2674285714285714,
|
|
"grad_norm": 7.84375,
|
|
"learning_rate": 1.5424585037286506e-05,
|
|
"loss": 1.2050976753234863,
|
|
"mean_token_accuracy": 0.7931383229792118,
|
|
"num_tokens": 3789235.0,
|
|
"step": 1170
|
|
},
|
|
{
|
|
"entropy": 0.8901564389467239,
|
|
"epoch": 0.26971428571428574,
|
|
"grad_norm": 7.40625,
|
|
"learning_rate": 1.537647341833053e-05,
|
|
"loss": 1.1315418243408204,
|
|
"mean_token_accuracy": 0.7916867211461067,
|
|
"num_tokens": 3822530.0,
|
|
"step": 1180
|
|
},
|
|
{
|
|
"entropy": 0.8138524909503758,
|
|
"epoch": 0.272,
|
|
"grad_norm": 7.46875,
|
|
"learning_rate": 1.532836179937455e-05,
|
|
"loss": 1.0824806213378906,
|
|
"mean_token_accuracy": 0.807539875805378,
|
|
"num_tokens": 3857294.0,
|
|
"step": 1190
|
|
},
|
|
{
|
|
"entropy": 0.8327909021638333,
|
|
"epoch": 0.2742857142857143,
|
|
"grad_norm": 7.40625,
|
|
"learning_rate": 1.5280250180418573e-05,
|
|
"loss": 1.0807191848754882,
|
|
"mean_token_accuracy": 0.8046631902456284,
|
|
"num_tokens": 3887638.0,
|
|
"step": 1200
|
|
},
|
|
{
|
|
"entropy": 0.6820507633499802,
|
|
"epoch": 0.2765714285714286,
|
|
"grad_norm": 7.25,
|
|
"learning_rate": 1.5232138561462594e-05,
|
|
"loss": 0.9238566398620606,
|
|
"mean_token_accuracy": 0.8344717890024185,
|
|
"num_tokens": 3921320.0,
|
|
"step": 1210
|
|
},
|
|
{
|
|
"entropy": 0.6690340504981578,
|
|
"epoch": 0.27885714285714286,
|
|
"grad_norm": 8.625,
|
|
"learning_rate": 1.5184026942506615e-05,
|
|
"loss": 0.9770146369934082,
|
|
"mean_token_accuracy": 0.83714384958148,
|
|
"num_tokens": 3952659.0,
|
|
"step": 1220
|
|
},
|
|
{
|
|
"entropy": 0.7821415845304728,
|
|
"epoch": 0.28114285714285714,
|
|
"grad_norm": 8.9375,
|
|
"learning_rate": 1.513591532355064e-05,
|
|
"loss": 1.1273323059082032,
|
|
"mean_token_accuracy": 0.8086842469871044,
|
|
"num_tokens": 3985673.0,
|
|
"step": 1230
|
|
},
|
|
{
|
|
"entropy": 0.7746237487532198,
|
|
"epoch": 0.2834285714285714,
|
|
"grad_norm": 6.96875,
|
|
"learning_rate": 1.5087803704594662e-05,
|
|
"loss": 0.9969350814819335,
|
|
"mean_token_accuracy": 0.8176074028015137,
|
|
"num_tokens": 4014425.0,
|
|
"step": 1240
|
|
},
|
|
{
|
|
"entropy": 0.7822927181608975,
|
|
"epoch": 0.2857142857142857,
|
|
"grad_norm": 7.90625,
|
|
"learning_rate": 1.5039692085638682e-05,
|
|
"loss": 1.0581744194030762,
|
|
"mean_token_accuracy": 0.8114182919263839,
|
|
"num_tokens": 4044735.0,
|
|
"step": 1250
|
|
},
|
|
{
|
|
"entropy": 0.8262449711561203,
|
|
"epoch": 0.288,
|
|
"grad_norm": 8.125,
|
|
"learning_rate": 1.4991580466682705e-05,
|
|
"loss": 1.1058235168457031,
|
|
"mean_token_accuracy": 0.8093136258423328,
|
|
"num_tokens": 4077366.0,
|
|
"step": 1260
|
|
},
|
|
{
|
|
"entropy": 0.7183008762076497,
|
|
"epoch": 0.29028571428571426,
|
|
"grad_norm": 6.75,
|
|
"learning_rate": 1.4943468847726727e-05,
|
|
"loss": 1.0642513275146483,
|
|
"mean_token_accuracy": 0.8284725159406662,
|
|
"num_tokens": 4112231.0,
|
|
"step": 1270
|
|
},
|
|
{
|
|
"entropy": 0.7519657079130411,
|
|
"epoch": 0.2925714285714286,
|
|
"grad_norm": 7.65625,
|
|
"learning_rate": 1.489535722877075e-05,
|
|
"loss": 1.0380656242370605,
|
|
"mean_token_accuracy": 0.8182306826114655,
|
|
"num_tokens": 4141706.0,
|
|
"step": 1280
|
|
},
|
|
{
|
|
"entropy": 0.8959639485925436,
|
|
"epoch": 0.2948571428571429,
|
|
"grad_norm": 8.8125,
|
|
"learning_rate": 1.484724560981477e-05,
|
|
"loss": 1.1817408561706544,
|
|
"mean_token_accuracy": 0.7842808924615383,
|
|
"num_tokens": 4174772.0,
|
|
"step": 1290
|
|
},
|
|
{
|
|
"entropy": 0.7940410540439189,
|
|
"epoch": 0.29714285714285715,
|
|
"grad_norm": 7.9375,
|
|
"learning_rate": 1.4799133990858793e-05,
|
|
"loss": 1.0543545722961425,
|
|
"mean_token_accuracy": 0.8153316840529442,
|
|
"num_tokens": 4207107.0,
|
|
"step": 1300
|
|
},
|
|
{
|
|
"entropy": 0.7827737585641443,
|
|
"epoch": 0.29942857142857143,
|
|
"grad_norm": 11.0,
|
|
"learning_rate": 1.4751022371902818e-05,
|
|
"loss": 1.1160078048706055,
|
|
"mean_token_accuracy": 0.812502384185791,
|
|
"num_tokens": 4242521.0,
|
|
"step": 1310
|
|
},
|
|
{
|
|
"entropy": 0.735058065969497,
|
|
"epoch": 0.3017142857142857,
|
|
"grad_norm": 7.5,
|
|
"learning_rate": 1.4702910752946837e-05,
|
|
"loss": 1.0581280708312988,
|
|
"mean_token_accuracy": 0.8288455225527287,
|
|
"num_tokens": 4276982.0,
|
|
"step": 1320
|
|
},
|
|
{
|
|
"entropy": 0.7287354637868703,
|
|
"epoch": 0.304,
|
|
"grad_norm": 6.9375,
|
|
"learning_rate": 1.465479913399086e-05,
|
|
"loss": 0.9759371757507325,
|
|
"mean_token_accuracy": 0.8249299876391888,
|
|
"num_tokens": 4306046.0,
|
|
"step": 1330
|
|
},
|
|
{
|
|
"entropy": 0.7787643402814866,
|
|
"epoch": 0.3062857142857143,
|
|
"grad_norm": 7.5,
|
|
"learning_rate": 1.4606687515034883e-05,
|
|
"loss": 1.0230366706848144,
|
|
"mean_token_accuracy": 0.816937967389822,
|
|
"num_tokens": 4338652.0,
|
|
"step": 1340
|
|
},
|
|
{
|
|
"entropy": 0.8934064561501145,
|
|
"epoch": 0.30857142857142855,
|
|
"grad_norm": 5.875,
|
|
"learning_rate": 1.4558575896078904e-05,
|
|
"loss": 1.086491012573242,
|
|
"mean_token_accuracy": 0.7942407630383969,
|
|
"num_tokens": 4370871.0,
|
|
"step": 1350
|
|
},
|
|
{
|
|
"entropy": 0.833009172603488,
|
|
"epoch": 0.31085714285714283,
|
|
"grad_norm": 7.625,
|
|
"learning_rate": 1.4510464277122927e-05,
|
|
"loss": 1.1905370712280274,
|
|
"mean_token_accuracy": 0.8013229362666607,
|
|
"num_tokens": 4402989.0,
|
|
"step": 1360
|
|
},
|
|
{
|
|
"entropy": 0.7927345955744386,
|
|
"epoch": 0.31314285714285717,
|
|
"grad_norm": 6.875,
|
|
"learning_rate": 1.4462352658166949e-05,
|
|
"loss": 1.1041228294372558,
|
|
"mean_token_accuracy": 0.8128574416041374,
|
|
"num_tokens": 4434506.0,
|
|
"step": 1370
|
|
},
|
|
{
|
|
"entropy": 0.7229848534800112,
|
|
"epoch": 0.31542857142857145,
|
|
"grad_norm": 7.53125,
|
|
"learning_rate": 1.441424103921097e-05,
|
|
"loss": 1.0535061836242676,
|
|
"mean_token_accuracy": 0.8302266910672188,
|
|
"num_tokens": 4467742.0,
|
|
"step": 1380
|
|
},
|
|
{
|
|
"entropy": 0.6736922577954829,
|
|
"epoch": 0.3177142857142857,
|
|
"grad_norm": 8.3125,
|
|
"learning_rate": 1.4366129420254992e-05,
|
|
"loss": 0.9416308403015137,
|
|
"mean_token_accuracy": 0.8366274513304234,
|
|
"num_tokens": 4498266.0,
|
|
"step": 1390
|
|
},
|
|
{
|
|
"entropy": 0.7866813028231263,
|
|
"epoch": 0.32,
|
|
"grad_norm": 7.0,
|
|
"learning_rate": 1.4318017801299015e-05,
|
|
"loss": 1.0644832611083985,
|
|
"mean_token_accuracy": 0.8135197319090366,
|
|
"num_tokens": 4526424.0,
|
|
"step": 1400
|
|
},
|
|
{
|
|
"entropy": 0.755329312197864,
|
|
"epoch": 0.3222857142857143,
|
|
"grad_norm": 7.25,
|
|
"learning_rate": 1.4269906182343036e-05,
|
|
"loss": 1.0085858345031737,
|
|
"mean_token_accuracy": 0.8171801075339318,
|
|
"num_tokens": 4556781.0,
|
|
"step": 1410
|
|
},
|
|
{
|
|
"entropy": 0.7350449176505208,
|
|
"epoch": 0.32457142857142857,
|
|
"grad_norm": 8.0,
|
|
"learning_rate": 1.4221794563387058e-05,
|
|
"loss": 1.0485240936279296,
|
|
"mean_token_accuracy": 0.8203142821788788,
|
|
"num_tokens": 4586938.0,
|
|
"step": 1420
|
|
},
|
|
{
|
|
"entropy": 0.7315349031239748,
|
|
"epoch": 0.32685714285714285,
|
|
"grad_norm": 6.4375,
|
|
"learning_rate": 1.4173682944431082e-05,
|
|
"loss": 0.9750032424926758,
|
|
"mean_token_accuracy": 0.8210594050586224,
|
|
"num_tokens": 4623204.0,
|
|
"step": 1430
|
|
},
|
|
{
|
|
"entropy": 0.8201613875105978,
|
|
"epoch": 0.3291428571428571,
|
|
"grad_norm": 8.375,
|
|
"learning_rate": 1.4125571325475103e-05,
|
|
"loss": 1.0923168182373046,
|
|
"mean_token_accuracy": 0.8091586381196976,
|
|
"num_tokens": 4655204.0,
|
|
"step": 1440
|
|
},
|
|
{
|
|
"entropy": 0.731718104891479,
|
|
"epoch": 0.3314285714285714,
|
|
"grad_norm": 7.65625,
|
|
"learning_rate": 1.4077459706519126e-05,
|
|
"loss": 0.939968490600586,
|
|
"mean_token_accuracy": 0.8259035252034664,
|
|
"num_tokens": 4684009.0,
|
|
"step": 1450
|
|
},
|
|
{
|
|
"entropy": 0.7582659061998129,
|
|
"epoch": 0.33371428571428574,
|
|
"grad_norm": 7.78125,
|
|
"learning_rate": 1.4029348087563148e-05,
|
|
"loss": 1.141510581970215,
|
|
"mean_token_accuracy": 0.8165373567491769,
|
|
"num_tokens": 4713643.0,
|
|
"step": 1460
|
|
},
|
|
{
|
|
"entropy": 0.8316841575317084,
|
|
"epoch": 0.336,
|
|
"grad_norm": 6.8125,
|
|
"learning_rate": 1.3981236468607169e-05,
|
|
"loss": 1.0487807273864747,
|
|
"mean_token_accuracy": 0.8056000970304013,
|
|
"num_tokens": 4745897.0,
|
|
"step": 1470
|
|
},
|
|
{
|
|
"entropy": 0.7131205608136952,
|
|
"epoch": 0.3382857142857143,
|
|
"grad_norm": 7.59375,
|
|
"learning_rate": 1.3933124849651192e-05,
|
|
"loss": 0.9551529884338379,
|
|
"mean_token_accuracy": 0.8345349170267582,
|
|
"num_tokens": 4779342.0,
|
|
"step": 1480
|
|
},
|
|
{
|
|
"entropy": 0.7310262706130743,
|
|
"epoch": 0.3405714285714286,
|
|
"grad_norm": 8.0,
|
|
"learning_rate": 1.3885013230695214e-05,
|
|
"loss": 1.071888256072998,
|
|
"mean_token_accuracy": 0.8165734991431236,
|
|
"num_tokens": 4810006.0,
|
|
"step": 1490
|
|
},
|
|
{
|
|
"entropy": 0.8448133600875736,
|
|
"epoch": 0.34285714285714286,
|
|
"grad_norm": 7.71875,
|
|
"learning_rate": 1.3836901611739235e-05,
|
|
"loss": 1.1719935417175293,
|
|
"mean_token_accuracy": 0.8007844358682632,
|
|
"num_tokens": 4841370.0,
|
|
"step": 1500
|
|
},
|
|
{
|
|
"entropy": 0.6549595400691033,
|
|
"epoch": 0.34514285714285714,
|
|
"grad_norm": 6.125,
|
|
"learning_rate": 1.3788789992783257e-05,
|
|
"loss": 0.9889472007751465,
|
|
"mean_token_accuracy": 0.8453674554824829,
|
|
"num_tokens": 4872052.0,
|
|
"step": 1510
|
|
},
|
|
{
|
|
"entropy": 0.8164440121501684,
|
|
"epoch": 0.3474285714285714,
|
|
"grad_norm": 7.5625,
|
|
"learning_rate": 1.3740678373827282e-05,
|
|
"loss": 1.0972503662109374,
|
|
"mean_token_accuracy": 0.810026689618826,
|
|
"num_tokens": 4908227.0,
|
|
"step": 1520
|
|
},
|
|
{
|
|
"entropy": 0.7791354645043611,
|
|
"epoch": 0.3497142857142857,
|
|
"grad_norm": 7.8125,
|
|
"learning_rate": 1.36925667548713e-05,
|
|
"loss": 1.0852085113525392,
|
|
"mean_token_accuracy": 0.8248721182346344,
|
|
"num_tokens": 4940131.0,
|
|
"step": 1530
|
|
},
|
|
{
|
|
"entropy": 0.8590768910944462,
|
|
"epoch": 0.352,
|
|
"grad_norm": 7.9375,
|
|
"learning_rate": 1.3644455135915325e-05,
|
|
"loss": 1.1454149246215821,
|
|
"mean_token_accuracy": 0.8017402648925781,
|
|
"num_tokens": 4971176.0,
|
|
"step": 1540
|
|
},
|
|
{
|
|
"entropy": 0.6812219545245171,
|
|
"epoch": 0.35428571428571426,
|
|
"grad_norm": 7.0,
|
|
"learning_rate": 1.3596343516959347e-05,
|
|
"loss": 0.919462776184082,
|
|
"mean_token_accuracy": 0.8335798256099224,
|
|
"num_tokens": 5002886.0,
|
|
"step": 1550
|
|
},
|
|
{
|
|
"entropy": 0.6795941894873977,
|
|
"epoch": 0.3565714285714286,
|
|
"grad_norm": 6.8125,
|
|
"learning_rate": 1.354823189800337e-05,
|
|
"loss": 0.9362202644348144,
|
|
"mean_token_accuracy": 0.8309865556657314,
|
|
"num_tokens": 5034604.0,
|
|
"step": 1560
|
|
},
|
|
{
|
|
"entropy": 0.8111153118312359,
|
|
"epoch": 0.3588571428571429,
|
|
"grad_norm": 7.5625,
|
|
"learning_rate": 1.350012027904739e-05,
|
|
"loss": 1.1012299537658692,
|
|
"mean_token_accuracy": 0.8071676261723042,
|
|
"num_tokens": 5067068.0,
|
|
"step": 1570
|
|
},
|
|
{
|
|
"entropy": 0.8018769213929773,
|
|
"epoch": 0.36114285714285715,
|
|
"grad_norm": 7.625,
|
|
"learning_rate": 1.3452008660091413e-05,
|
|
"loss": 1.0980539321899414,
|
|
"mean_token_accuracy": 0.8049051895737648,
|
|
"num_tokens": 5101840.0,
|
|
"step": 1580
|
|
},
|
|
{
|
|
"entropy": 0.8108965801075101,
|
|
"epoch": 0.36342857142857143,
|
|
"grad_norm": 9.4375,
|
|
"learning_rate": 1.3403897041135436e-05,
|
|
"loss": 1.097167682647705,
|
|
"mean_token_accuracy": 0.8064502902328968,
|
|
"num_tokens": 5133106.0,
|
|
"step": 1590
|
|
},
|
|
{
|
|
"entropy": 0.7126147777773439,
|
|
"epoch": 0.3657142857142857,
|
|
"grad_norm": 7.21875,
|
|
"learning_rate": 1.3355785422179457e-05,
|
|
"loss": 0.9641182899475098,
|
|
"mean_token_accuracy": 0.8308103702962398,
|
|
"num_tokens": 5163625.0,
|
|
"step": 1600
|
|
},
|
|
{
|
|
"entropy": 0.6579177615232765,
|
|
"epoch": 0.368,
|
|
"grad_norm": 7.6875,
|
|
"learning_rate": 1.3307673803223479e-05,
|
|
"loss": 0.8962146759033203,
|
|
"mean_token_accuracy": 0.8413269713521003,
|
|
"num_tokens": 5197413.0,
|
|
"step": 1610
|
|
},
|
|
{
|
|
"entropy": 0.8362961991690099,
|
|
"epoch": 0.3702857142857143,
|
|
"grad_norm": 7.53125,
|
|
"learning_rate": 1.3259562184267503e-05,
|
|
"loss": 1.1765104293823243,
|
|
"mean_token_accuracy": 0.8035941451787949,
|
|
"num_tokens": 5230359.0,
|
|
"step": 1620
|
|
},
|
|
{
|
|
"entropy": 0.8460681514814496,
|
|
"epoch": 0.37257142857142855,
|
|
"grad_norm": 7.125,
|
|
"learning_rate": 1.3211450565311524e-05,
|
|
"loss": 1.1312347412109376,
|
|
"mean_token_accuracy": 0.806734037399292,
|
|
"num_tokens": 5261631.0,
|
|
"step": 1630
|
|
},
|
|
{
|
|
"entropy": 0.8401033844798803,
|
|
"epoch": 0.37485714285714283,
|
|
"grad_norm": 7.6875,
|
|
"learning_rate": 1.3163338946355547e-05,
|
|
"loss": 1.1048646926879884,
|
|
"mean_token_accuracy": 0.8016112253069878,
|
|
"num_tokens": 5293666.0,
|
|
"step": 1640
|
|
},
|
|
{
|
|
"entropy": 0.8607065804302693,
|
|
"epoch": 0.37714285714285717,
|
|
"grad_norm": 6.25,
|
|
"learning_rate": 1.3115227327399569e-05,
|
|
"loss": 1.224336814880371,
|
|
"mean_token_accuracy": 0.7972042057663202,
|
|
"num_tokens": 5328829.0,
|
|
"step": 1650
|
|
},
|
|
{
|
|
"entropy": 0.6591957551427186,
|
|
"epoch": 0.37942857142857145,
|
|
"grad_norm": 8.3125,
|
|
"learning_rate": 1.306711570844359e-05,
|
|
"loss": 0.9134272575378418,
|
|
"mean_token_accuracy": 0.8408956363797188,
|
|
"num_tokens": 5359723.0,
|
|
"step": 1660
|
|
},
|
|
{
|
|
"entropy": 0.7585498026572168,
|
|
"epoch": 0.38171428571428573,
|
|
"grad_norm": 6.84375,
|
|
"learning_rate": 1.3019004089487612e-05,
|
|
"loss": 1.0762030601501464,
|
|
"mean_token_accuracy": 0.815737747400999,
|
|
"num_tokens": 5391030.0,
|
|
"step": 1670
|
|
},
|
|
{
|
|
"entropy": 0.7825943292118609,
|
|
"epoch": 0.384,
|
|
"grad_norm": 6.6875,
|
|
"learning_rate": 1.2970892470531635e-05,
|
|
"loss": 1.0779932975769042,
|
|
"mean_token_accuracy": 0.8169842332601547,
|
|
"num_tokens": 5422205.0,
|
|
"step": 1680
|
|
},
|
|
{
|
|
"entropy": 0.8554381128400564,
|
|
"epoch": 0.3862857142857143,
|
|
"grad_norm": 7.375,
|
|
"learning_rate": 1.2922780851575656e-05,
|
|
"loss": 1.12919340133667,
|
|
"mean_token_accuracy": 0.8013027586042881,
|
|
"num_tokens": 5452941.0,
|
|
"step": 1690
|
|
},
|
|
{
|
|
"entropy": 0.7908354031853377,
|
|
"epoch": 0.38857142857142857,
|
|
"grad_norm": 7.28125,
|
|
"learning_rate": 1.2874669232619678e-05,
|
|
"loss": 1.0936867713928222,
|
|
"mean_token_accuracy": 0.8094826623797416,
|
|
"num_tokens": 5486102.0,
|
|
"step": 1700
|
|
},
|
|
{
|
|
"entropy": 0.8072810024954379,
|
|
"epoch": 0.39085714285714285,
|
|
"grad_norm": 6.09375,
|
|
"learning_rate": 1.28265576136637e-05,
|
|
"loss": 1.0153223991394043,
|
|
"mean_token_accuracy": 0.8126743011176586,
|
|
"num_tokens": 5518871.0,
|
|
"step": 1710
|
|
},
|
|
{
|
|
"entropy": 0.7387428401969374,
|
|
"epoch": 0.3931428571428571,
|
|
"grad_norm": 7.34375,
|
|
"learning_rate": 1.2778445994707722e-05,
|
|
"loss": 1.021730613708496,
|
|
"mean_token_accuracy": 0.8178475465625524,
|
|
"num_tokens": 5548678.0,
|
|
"step": 1720
|
|
},
|
|
{
|
|
"entropy": 0.6844640583731234,
|
|
"epoch": 0.3954285714285714,
|
|
"grad_norm": 8.0625,
|
|
"learning_rate": 1.2730334375751746e-05,
|
|
"loss": 0.9658615112304687,
|
|
"mean_token_accuracy": 0.833624093234539,
|
|
"num_tokens": 5580416.0,
|
|
"step": 1730
|
|
},
|
|
{
|
|
"entropy": 0.8338166723027826,
|
|
"epoch": 0.3977142857142857,
|
|
"grad_norm": 7.375,
|
|
"learning_rate": 1.2682222756795768e-05,
|
|
"loss": 1.0406496047973632,
|
|
"mean_token_accuracy": 0.8031456172466278,
|
|
"num_tokens": 5613199.0,
|
|
"step": 1740
|
|
},
|
|
{
|
|
"entropy": 0.6859139285050333,
|
|
"epoch": 0.4,
|
|
"grad_norm": 8.1875,
|
|
"learning_rate": 1.2634111137839789e-05,
|
|
"loss": 1.0559725761413574,
|
|
"mean_token_accuracy": 0.8320677742362023,
|
|
"num_tokens": 5644289.0,
|
|
"step": 1750
|
|
},
|
|
{
|
|
"entropy": 0.8010108925402164,
|
|
"epoch": 0.4022857142857143,
|
|
"grad_norm": 7.875,
|
|
"learning_rate": 1.2585999518883812e-05,
|
|
"loss": 1.113631820678711,
|
|
"mean_token_accuracy": 0.8092500284314156,
|
|
"num_tokens": 5676021.0,
|
|
"step": 1760
|
|
},
|
|
{
|
|
"entropy": 0.8805123227648437,
|
|
"epoch": 0.4045714285714286,
|
|
"grad_norm": 8.5625,
|
|
"learning_rate": 1.2537887899927834e-05,
|
|
"loss": 1.1203717231750487,
|
|
"mean_token_accuracy": 0.799303562939167,
|
|
"num_tokens": 5708259.0,
|
|
"step": 1770
|
|
},
|
|
{
|
|
"entropy": 0.7750554161146284,
|
|
"epoch": 0.40685714285714286,
|
|
"grad_norm": 7.15625,
|
|
"learning_rate": 1.2489776280971855e-05,
|
|
"loss": 1.1084386825561523,
|
|
"mean_token_accuracy": 0.8079812493175268,
|
|
"num_tokens": 5741700.0,
|
|
"step": 1780
|
|
},
|
|
{
|
|
"entropy": 0.8413273308426141,
|
|
"epoch": 0.40914285714285714,
|
|
"grad_norm": 7.21875,
|
|
"learning_rate": 1.2441664662015877e-05,
|
|
"loss": 1.0813825607299805,
|
|
"mean_token_accuracy": 0.8091316163539887,
|
|
"num_tokens": 5774895.0,
|
|
"step": 1790
|
|
},
|
|
{
|
|
"entropy": 0.754073722101748,
|
|
"epoch": 0.4114285714285714,
|
|
"grad_norm": 6.90625,
|
|
"learning_rate": 1.23935530430599e-05,
|
|
"loss": 1.0666906356811523,
|
|
"mean_token_accuracy": 0.819086953997612,
|
|
"num_tokens": 5808852.0,
|
|
"step": 1800
|
|
},
|
|
{
|
|
"entropy": 0.7851035035215318,
|
|
"epoch": 0.4137142857142857,
|
|
"grad_norm": 7.25,
|
|
"learning_rate": 1.234544142410392e-05,
|
|
"loss": 1.1307811737060547,
|
|
"mean_token_accuracy": 0.8178651243448257,
|
|
"num_tokens": 5841915.0,
|
|
"step": 1810
|
|
},
|
|
{
|
|
"entropy": 0.6699810542166234,
|
|
"epoch": 0.416,
|
|
"grad_norm": 6.375,
|
|
"learning_rate": 1.2297329805147943e-05,
|
|
"loss": 0.948750114440918,
|
|
"mean_token_accuracy": 0.8368007637560367,
|
|
"num_tokens": 5876884.0,
|
|
"step": 1820
|
|
},
|
|
{
|
|
"entropy": 0.7877312513999641,
|
|
"epoch": 0.41828571428571426,
|
|
"grad_norm": 8.375,
|
|
"learning_rate": 1.2249218186191967e-05,
|
|
"loss": 1.0736566543579102,
|
|
"mean_token_accuracy": 0.8172481268644333,
|
|
"num_tokens": 5909524.0,
|
|
"step": 1830
|
|
},
|
|
{
|
|
"entropy": 0.7636531024239958,
|
|
"epoch": 0.4205714285714286,
|
|
"grad_norm": 7.375,
|
|
"learning_rate": 1.2201106567235988e-05,
|
|
"loss": 1.0859886169433595,
|
|
"mean_token_accuracy": 0.8179905354976654,
|
|
"num_tokens": 5944343.0,
|
|
"step": 1840
|
|
},
|
|
{
|
|
"entropy": 0.7100124446675181,
|
|
"epoch": 0.4228571428571429,
|
|
"grad_norm": 7.15625,
|
|
"learning_rate": 1.215299494828001e-05,
|
|
"loss": 1.042219352722168,
|
|
"mean_token_accuracy": 0.8213589303195477,
|
|
"num_tokens": 5979532.0,
|
|
"step": 1850
|
|
},
|
|
{
|
|
"entropy": 0.7539400187321007,
|
|
"epoch": 0.42514285714285716,
|
|
"grad_norm": 7.03125,
|
|
"learning_rate": 1.2104883329324033e-05,
|
|
"loss": 1.0224475860595703,
|
|
"mean_token_accuracy": 0.8227170191705226,
|
|
"num_tokens": 6013588.0,
|
|
"step": 1860
|
|
},
|
|
{
|
|
"entropy": 0.6926140191964805,
|
|
"epoch": 0.42742857142857144,
|
|
"grad_norm": 6.1875,
|
|
"learning_rate": 1.2056771710368056e-05,
|
|
"loss": 0.9315377235412597,
|
|
"mean_token_accuracy": 0.8341933377087116,
|
|
"num_tokens": 6049253.0,
|
|
"step": 1870
|
|
},
|
|
{
|
|
"entropy": 0.8801758374087513,
|
|
"epoch": 0.4297142857142857,
|
|
"grad_norm": 7.53125,
|
|
"learning_rate": 1.2008660091412077e-05,
|
|
"loss": 1.1752006530761718,
|
|
"mean_token_accuracy": 0.7919330909848213,
|
|
"num_tokens": 6079866.0,
|
|
"step": 1880
|
|
},
|
|
{
|
|
"entropy": 0.899750160984695,
|
|
"epoch": 0.432,
|
|
"grad_norm": 7.21875,
|
|
"learning_rate": 1.1960548472456099e-05,
|
|
"loss": 1.1849931716918944,
|
|
"mean_token_accuracy": 0.7877020232379437,
|
|
"num_tokens": 6109239.0,
|
|
"step": 1890
|
|
},
|
|
{
|
|
"entropy": 0.7825359049253165,
|
|
"epoch": 0.4342857142857143,
|
|
"grad_norm": 7.46875,
|
|
"learning_rate": 1.1912436853500122e-05,
|
|
"loss": 1.0007784843444825,
|
|
"mean_token_accuracy": 0.818300225585699,
|
|
"num_tokens": 6138853.0,
|
|
"step": 1900
|
|
},
|
|
{
|
|
"entropy": 0.7607327317818999,
|
|
"epoch": 0.43657142857142855,
|
|
"grad_norm": 8.0,
|
|
"learning_rate": 1.1864325234544142e-05,
|
|
"loss": 1.0711479187011719,
|
|
"mean_token_accuracy": 0.8240827091038228,
|
|
"num_tokens": 6172839.0,
|
|
"step": 1910
|
|
},
|
|
{
|
|
"entropy": 0.8882574066519737,
|
|
"epoch": 0.43885714285714283,
|
|
"grad_norm": 7.71875,
|
|
"learning_rate": 1.1816213615588167e-05,
|
|
"loss": 1.2051098823547364,
|
|
"mean_token_accuracy": 0.7916370362043381,
|
|
"num_tokens": 6204250.0,
|
|
"step": 1920
|
|
},
|
|
{
|
|
"entropy": 0.6951690092682838,
|
|
"epoch": 0.44114285714285717,
|
|
"grad_norm": 8.5,
|
|
"learning_rate": 1.1768101996632189e-05,
|
|
"loss": 0.9240032196044922,
|
|
"mean_token_accuracy": 0.8321454405784607,
|
|
"num_tokens": 6236171.0,
|
|
"step": 1930
|
|
},
|
|
{
|
|
"entropy": 0.7487597663886845,
|
|
"epoch": 0.44342857142857145,
|
|
"grad_norm": 7.71875,
|
|
"learning_rate": 1.171999037767621e-05,
|
|
"loss": 0.9808469772338867,
|
|
"mean_token_accuracy": 0.8196887351572514,
|
|
"num_tokens": 6268135.0,
|
|
"step": 1940
|
|
},
|
|
{
|
|
"entropy": 0.8591405102983117,
|
|
"epoch": 0.44571428571428573,
|
|
"grad_norm": 7.78125,
|
|
"learning_rate": 1.1671878758720232e-05,
|
|
"loss": 1.1255832672119142,
|
|
"mean_token_accuracy": 0.7943931568413973,
|
|
"num_tokens": 6299543.0,
|
|
"step": 1950
|
|
},
|
|
{
|
|
"entropy": 0.9221633022651077,
|
|
"epoch": 0.448,
|
|
"grad_norm": 7.34375,
|
|
"learning_rate": 1.1623767139764255e-05,
|
|
"loss": 1.218088436126709,
|
|
"mean_token_accuracy": 0.7879602633416652,
|
|
"num_tokens": 6328776.0,
|
|
"step": 1960
|
|
},
|
|
{
|
|
"entropy": 0.7521216680295766,
|
|
"epoch": 0.4502857142857143,
|
|
"grad_norm": 4.125,
|
|
"learning_rate": 1.1575655520808276e-05,
|
|
"loss": 1.0790873527526856,
|
|
"mean_token_accuracy": 0.8138045072555542,
|
|
"num_tokens": 6359815.0,
|
|
"step": 1970
|
|
},
|
|
{
|
|
"entropy": 0.7044279471971094,
|
|
"epoch": 0.45257142857142857,
|
|
"grad_norm": 8.125,
|
|
"learning_rate": 1.1527543901852298e-05,
|
|
"loss": 0.925055980682373,
|
|
"mean_token_accuracy": 0.8344494268298149,
|
|
"num_tokens": 6393539.0,
|
|
"step": 1980
|
|
},
|
|
{
|
|
"entropy": 0.7118433593772352,
|
|
"epoch": 0.45485714285714285,
|
|
"grad_norm": 6.03125,
|
|
"learning_rate": 1.147943228289632e-05,
|
|
"loss": 0.9561774253845214,
|
|
"mean_token_accuracy": 0.8290005512535572,
|
|
"num_tokens": 6426378.0,
|
|
"step": 1990
|
|
},
|
|
{
|
|
"entropy": 0.7948009348474443,
|
|
"epoch": 0.45714285714285713,
|
|
"grad_norm": 6.78125,
|
|
"learning_rate": 1.1431320663940341e-05,
|
|
"loss": 1.0137686729431152,
|
|
"mean_token_accuracy": 0.8080471381545067,
|
|
"num_tokens": 6460145.0,
|
|
"step": 2000
|
|
},
|
|
{
|
|
"entropy": 0.7212188862264156,
|
|
"epoch": 0.4594285714285714,
|
|
"grad_norm": 6.3125,
|
|
"learning_rate": 1.1383209044984364e-05,
|
|
"loss": 0.9326017379760743,
|
|
"mean_token_accuracy": 0.8261952839791775,
|
|
"num_tokens": 6492010.0,
|
|
"step": 2010
|
|
},
|
|
{
|
|
"entropy": 0.7147583740763366,
|
|
"epoch": 0.4617142857142857,
|
|
"grad_norm": 7.96875,
|
|
"learning_rate": 1.1335097426028388e-05,
|
|
"loss": 1.0504631996154785,
|
|
"mean_token_accuracy": 0.831389506906271,
|
|
"num_tokens": 6526521.0,
|
|
"step": 2020
|
|
},
|
|
{
|
|
"entropy": 0.8111877050250769,
|
|
"epoch": 0.464,
|
|
"grad_norm": 7.71875,
|
|
"learning_rate": 1.1286985807072407e-05,
|
|
"loss": 1.0568114280700684,
|
|
"mean_token_accuracy": 0.8077960222959518,
|
|
"num_tokens": 6559743.0,
|
|
"step": 2030
|
|
},
|
|
{
|
|
"entropy": 0.8017427391372621,
|
|
"epoch": 0.4662857142857143,
|
|
"grad_norm": 8.125,
|
|
"learning_rate": 1.1238874188116432e-05,
|
|
"loss": 1.0879751205444337,
|
|
"mean_token_accuracy": 0.8064081892371178,
|
|
"num_tokens": 6591260.0,
|
|
"step": 2040
|
|
},
|
|
{
|
|
"entropy": 0.7713497207500041,
|
|
"epoch": 0.4685714285714286,
|
|
"grad_norm": 8.0,
|
|
"learning_rate": 1.1190762569160454e-05,
|
|
"loss": 1.1264875411987305,
|
|
"mean_token_accuracy": 0.8138973511755466,
|
|
"num_tokens": 6622826.0,
|
|
"step": 2050
|
|
},
|
|
{
|
|
"entropy": 0.7645074154250324,
|
|
"epoch": 0.47085714285714286,
|
|
"grad_norm": 7.5625,
|
|
"learning_rate": 1.1142650950204475e-05,
|
|
"loss": 1.0584564208984375,
|
|
"mean_token_accuracy": 0.8198134288191795,
|
|
"num_tokens": 6655484.0,
|
|
"step": 2060
|
|
},
|
|
{
|
|
"entropy": 0.8299776021391153,
|
|
"epoch": 0.47314285714285714,
|
|
"grad_norm": 6.40625,
|
|
"learning_rate": 1.1094539331248497e-05,
|
|
"loss": 1.1237126350402833,
|
|
"mean_token_accuracy": 0.8051372021436691,
|
|
"num_tokens": 6685590.0,
|
|
"step": 2070
|
|
},
|
|
{
|
|
"entropy": 0.7288541275076568,
|
|
"epoch": 0.4754285714285714,
|
|
"grad_norm": 7.125,
|
|
"learning_rate": 1.104642771229252e-05,
|
|
"loss": 0.9620414733886719,
|
|
"mean_token_accuracy": 0.8219352796673774,
|
|
"num_tokens": 6721547.0,
|
|
"step": 2080
|
|
},
|
|
{
|
|
"entropy": 0.773728856164962,
|
|
"epoch": 0.4777142857142857,
|
|
"grad_norm": 6.1875,
|
|
"learning_rate": 1.099831609333654e-05,
|
|
"loss": 1.0007498741149903,
|
|
"mean_token_accuracy": 0.8184696063399315,
|
|
"num_tokens": 6754220.0,
|
|
"step": 2090
|
|
},
|
|
{
|
|
"entropy": 0.7731793771497906,
|
|
"epoch": 0.48,
|
|
"grad_norm": 7.34375,
|
|
"learning_rate": 1.0950204474380563e-05,
|
|
"loss": 1.026624584197998,
|
|
"mean_token_accuracy": 0.8176170207560063,
|
|
"num_tokens": 6785160.0,
|
|
"step": 2100
|
|
},
|
|
{
|
|
"entropy": 0.6699161239899695,
|
|
"epoch": 0.48228571428571426,
|
|
"grad_norm": 7.09375,
|
|
"learning_rate": 1.0902092855424586e-05,
|
|
"loss": 0.9981835365295411,
|
|
"mean_token_accuracy": 0.8343960210680962,
|
|
"num_tokens": 6819546.0,
|
|
"step": 2110
|
|
},
|
|
{
|
|
"entropy": 0.773171486146748,
|
|
"epoch": 0.4845714285714286,
|
|
"grad_norm": 6.375,
|
|
"learning_rate": 1.0853981236468606e-05,
|
|
"loss": 1.0869997024536133,
|
|
"mean_token_accuracy": 0.8096975103020668,
|
|
"num_tokens": 6849214.0,
|
|
"step": 2120
|
|
},
|
|
{
|
|
"entropy": 0.7241250389255584,
|
|
"epoch": 0.4868571428571429,
|
|
"grad_norm": 7.71875,
|
|
"learning_rate": 1.080586961751263e-05,
|
|
"loss": 1.0170108795166015,
|
|
"mean_token_accuracy": 0.826240535825491,
|
|
"num_tokens": 6880349.0,
|
|
"step": 2130
|
|
},
|
|
{
|
|
"entropy": 0.7947101121768355,
|
|
"epoch": 0.48914285714285716,
|
|
"grad_norm": 6.15625,
|
|
"learning_rate": 1.0757757998556653e-05,
|
|
"loss": 1.0710148811340332,
|
|
"mean_token_accuracy": 0.8159072741866111,
|
|
"num_tokens": 6914887.0,
|
|
"step": 2140
|
|
},
|
|
{
|
|
"entropy": 0.8211502507328987,
|
|
"epoch": 0.49142857142857144,
|
|
"grad_norm": 7.625,
|
|
"learning_rate": 1.0709646379600676e-05,
|
|
"loss": 1.1436882972717286,
|
|
"mean_token_accuracy": 0.8062957197427749,
|
|
"num_tokens": 6947890.0,
|
|
"step": 2150
|
|
},
|
|
{
|
|
"entropy": 0.7476996140554547,
|
|
"epoch": 0.4937142857142857,
|
|
"grad_norm": 7.375,
|
|
"learning_rate": 1.0661534760644696e-05,
|
|
"loss": 1.0358779907226563,
|
|
"mean_token_accuracy": 0.82193743288517,
|
|
"num_tokens": 6976819.0,
|
|
"step": 2160
|
|
},
|
|
{
|
|
"entropy": 0.8045617615804076,
|
|
"epoch": 0.496,
|
|
"grad_norm": 7.375,
|
|
"learning_rate": 1.0613423141688719e-05,
|
|
"loss": 1.023204517364502,
|
|
"mean_token_accuracy": 0.8044866040349007,
|
|
"num_tokens": 7006918.0,
|
|
"step": 2170
|
|
},
|
|
{
|
|
"entropy": 0.7655783969908952,
|
|
"epoch": 0.4982857142857143,
|
|
"grad_norm": 7.125,
|
|
"learning_rate": 1.0565311522732741e-05,
|
|
"loss": 1.0738348007202148,
|
|
"mean_token_accuracy": 0.8179361633956432,
|
|
"num_tokens": 7040325.0,
|
|
"step": 2180
|
|
},
|
|
{
|
|
"entropy": 0.7762483460828662,
|
|
"epoch": 0.5005714285714286,
|
|
"grad_norm": 7.75,
|
|
"learning_rate": 1.0517199903776762e-05,
|
|
"loss": 1.0218994140625,
|
|
"mean_token_accuracy": 0.8140566550195217,
|
|
"num_tokens": 7073925.0,
|
|
"step": 2190
|
|
},
|
|
{
|
|
"entropy": 0.6888056830503047,
|
|
"epoch": 0.5028571428571429,
|
|
"grad_norm": 7.84375,
|
|
"learning_rate": 1.0469088284820785e-05,
|
|
"loss": 1.0055737495422363,
|
|
"mean_token_accuracy": 0.8302330307662487,
|
|
"num_tokens": 7106764.0,
|
|
"step": 2200
|
|
},
|
|
{
|
|
"entropy": 0.8743803231045604,
|
|
"epoch": 0.5051428571428571,
|
|
"grad_norm": 7.46875,
|
|
"learning_rate": 1.0420976665864809e-05,
|
|
"loss": 1.14207181930542,
|
|
"mean_token_accuracy": 0.7981645628809929,
|
|
"num_tokens": 7139473.0,
|
|
"step": 2210
|
|
},
|
|
{
|
|
"entropy": 0.7461634024046362,
|
|
"epoch": 0.5074285714285715,
|
|
"grad_norm": 7.84375,
|
|
"learning_rate": 1.0372865046908828e-05,
|
|
"loss": 0.9760645866394043,
|
|
"mean_token_accuracy": 0.8265540286898613,
|
|
"num_tokens": 7170534.0,
|
|
"step": 2220
|
|
},
|
|
{
|
|
"entropy": 0.6452060268260539,
|
|
"epoch": 0.5097142857142857,
|
|
"grad_norm": 6.59375,
|
|
"learning_rate": 1.0324753427952852e-05,
|
|
"loss": 0.8791199684143066,
|
|
"mean_token_accuracy": 0.8427741400897503,
|
|
"num_tokens": 7203692.0,
|
|
"step": 2230
|
|
},
|
|
{
|
|
"entropy": 0.7903048783540726,
|
|
"epoch": 0.512,
|
|
"grad_norm": 7.09375,
|
|
"learning_rate": 1.0276641808996875e-05,
|
|
"loss": 1.0589832305908202,
|
|
"mean_token_accuracy": 0.8105465799570084,
|
|
"num_tokens": 7235512.0,
|
|
"step": 2240
|
|
},
|
|
{
|
|
"entropy": 0.757332621794194,
|
|
"epoch": 0.5142857142857142,
|
|
"grad_norm": 6.34375,
|
|
"learning_rate": 1.0228530190040896e-05,
|
|
"loss": 1.0270901679992677,
|
|
"mean_token_accuracy": 0.8171210527420044,
|
|
"num_tokens": 7268071.0,
|
|
"step": 2250
|
|
},
|
|
{
|
|
"entropy": 0.7633547084406018,
|
|
"epoch": 0.5165714285714286,
|
|
"grad_norm": 6.84375,
|
|
"learning_rate": 1.0180418571084918e-05,
|
|
"loss": 1.0296350479125977,
|
|
"mean_token_accuracy": 0.8162448532879353,
|
|
"num_tokens": 7298520.0,
|
|
"step": 2260
|
|
},
|
|
{
|
|
"entropy": 0.7190552426502108,
|
|
"epoch": 0.5188571428571429,
|
|
"grad_norm": 6.90625,
|
|
"learning_rate": 1.013230695212894e-05,
|
|
"loss": 1.059223461151123,
|
|
"mean_token_accuracy": 0.8252359744161367,
|
|
"num_tokens": 7329180.0,
|
|
"step": 2270
|
|
},
|
|
{
|
|
"entropy": 0.7730093291960657,
|
|
"epoch": 0.5211428571428571,
|
|
"grad_norm": 7.65625,
|
|
"learning_rate": 1.0084195333172961e-05,
|
|
"loss": 1.1134568214416505,
|
|
"mean_token_accuracy": 0.810255641490221,
|
|
"num_tokens": 7363397.0,
|
|
"step": 2280
|
|
},
|
|
{
|
|
"entropy": 0.7890252031385898,
|
|
"epoch": 0.5234285714285715,
|
|
"grad_norm": 8.5625,
|
|
"learning_rate": 1.0036083714216984e-05,
|
|
"loss": 1.062121868133545,
|
|
"mean_token_accuracy": 0.8097737640142441,
|
|
"num_tokens": 7391404.0,
|
|
"step": 2290
|
|
},
|
|
{
|
|
"entropy": 0.7083958725444972,
|
|
"epoch": 0.5257142857142857,
|
|
"grad_norm": 7.625,
|
|
"learning_rate": 9.987972095261006e-06,
|
|
"loss": 0.9515584945678711,
|
|
"mean_token_accuracy": 0.8254938945174217,
|
|
"num_tokens": 7423099.0,
|
|
"step": 2300
|
|
},
|
|
{
|
|
"entropy": 0.6942234938032925,
|
|
"epoch": 0.528,
|
|
"grad_norm": 6.84375,
|
|
"learning_rate": 9.939860476305029e-06,
|
|
"loss": 0.9809045791625977,
|
|
"mean_token_accuracy": 0.8210146620869636,
|
|
"num_tokens": 7456548.0,
|
|
"step": 2310
|
|
},
|
|
{
|
|
"entropy": 0.7144082696177065,
|
|
"epoch": 0.5302857142857142,
|
|
"grad_norm": 7.40625,
|
|
"learning_rate": 9.89174885734905e-06,
|
|
"loss": 1.0528292655944824,
|
|
"mean_token_accuracy": 0.8277196332812309,
|
|
"num_tokens": 7489319.0,
|
|
"step": 2320
|
|
},
|
|
{
|
|
"entropy": 0.7327054421417415,
|
|
"epoch": 0.5325714285714286,
|
|
"grad_norm": 8.1875,
|
|
"learning_rate": 9.843637238393072e-06,
|
|
"loss": 1.0515410423278808,
|
|
"mean_token_accuracy": 0.822493951767683,
|
|
"num_tokens": 7524338.0,
|
|
"step": 2330
|
|
},
|
|
{
|
|
"entropy": 0.7691349984146655,
|
|
"epoch": 0.5348571428571428,
|
|
"grad_norm": 7.875,
|
|
"learning_rate": 9.795525619437095e-06,
|
|
"loss": 1.078810977935791,
|
|
"mean_token_accuracy": 0.8136450231075287,
|
|
"num_tokens": 7557739.0,
|
|
"step": 2340
|
|
},
|
|
{
|
|
"entropy": 0.8708611608482897,
|
|
"epoch": 0.5371428571428571,
|
|
"grad_norm": 6.75,
|
|
"learning_rate": 9.747414000481117e-06,
|
|
"loss": 1.1824729919433594,
|
|
"mean_token_accuracy": 0.7978243462741375,
|
|
"num_tokens": 7590943.0,
|
|
"step": 2350
|
|
},
|
|
{
|
|
"entropy": 0.7193792495876551,
|
|
"epoch": 0.5394285714285715,
|
|
"grad_norm": 6.09375,
|
|
"learning_rate": 9.699302381525138e-06,
|
|
"loss": 1.009437370300293,
|
|
"mean_token_accuracy": 0.8306246355175972,
|
|
"num_tokens": 7624726.0,
|
|
"step": 2360
|
|
},
|
|
{
|
|
"entropy": 0.7145123222842813,
|
|
"epoch": 0.5417142857142857,
|
|
"grad_norm": 8.25,
|
|
"learning_rate": 9.651190762569162e-06,
|
|
"loss": 1.0352288246154786,
|
|
"mean_token_accuracy": 0.8277433931827545,
|
|
"num_tokens": 7655654.0,
|
|
"step": 2370
|
|
},
|
|
{
|
|
"entropy": 0.7357332297600806,
|
|
"epoch": 0.544,
|
|
"grad_norm": 8.1875,
|
|
"learning_rate": 9.603079143613183e-06,
|
|
"loss": 1.113128662109375,
|
|
"mean_token_accuracy": 0.821478446573019,
|
|
"num_tokens": 7687948.0,
|
|
"step": 2380
|
|
},
|
|
{
|
|
"entropy": 0.7043834974989295,
|
|
"epoch": 0.5462857142857143,
|
|
"grad_norm": 7.375,
|
|
"learning_rate": 9.554967524657206e-06,
|
|
"loss": 0.9789829254150391,
|
|
"mean_token_accuracy": 0.8271778743714094,
|
|
"num_tokens": 7720028.0,
|
|
"step": 2390
|
|
},
|
|
{
|
|
"entropy": 0.8476279047317803,
|
|
"epoch": 0.5485714285714286,
|
|
"grad_norm": 7.6875,
|
|
"learning_rate": 9.506855905701228e-06,
|
|
"loss": 1.1467313766479492,
|
|
"mean_token_accuracy": 0.8044891074299813,
|
|
"num_tokens": 7754391.0,
|
|
"step": 2400
|
|
},
|
|
{
|
|
"entropy": 0.7447409811429679,
|
|
"epoch": 0.5508571428571428,
|
|
"grad_norm": 6.84375,
|
|
"learning_rate": 9.458744286745249e-06,
|
|
"loss": 1.0126939773559571,
|
|
"mean_token_accuracy": 0.8301733404397964,
|
|
"num_tokens": 7788615.0,
|
|
"step": 2410
|
|
},
|
|
{
|
|
"entropy": 0.6487678562290966,
|
|
"epoch": 0.5531428571428572,
|
|
"grad_norm": 6.90625,
|
|
"learning_rate": 9.410632667789273e-06,
|
|
"loss": 0.9349337577819824,
|
|
"mean_token_accuracy": 0.8430794902145863,
|
|
"num_tokens": 7823652.0,
|
|
"step": 2420
|
|
},
|
|
{
|
|
"entropy": 0.7297495853155851,
|
|
"epoch": 0.5554285714285714,
|
|
"grad_norm": 8.0,
|
|
"learning_rate": 9.362521048833294e-06,
|
|
"loss": 1.0516100883483888,
|
|
"mean_token_accuracy": 0.8286796424537897,
|
|
"num_tokens": 7855368.0,
|
|
"step": 2430
|
|
},
|
|
{
|
|
"entropy": 0.7656750591471791,
|
|
"epoch": 0.5577142857142857,
|
|
"grad_norm": 8.5,
|
|
"learning_rate": 9.314409429877316e-06,
|
|
"loss": 1.0632817268371582,
|
|
"mean_token_accuracy": 0.8258335165679455,
|
|
"num_tokens": 7885759.0,
|
|
"step": 2440
|
|
},
|
|
{
|
|
"entropy": 0.7843017770908773,
|
|
"epoch": 0.56,
|
|
"grad_norm": 8.875,
|
|
"learning_rate": 9.266297810921339e-06,
|
|
"loss": 1.074361228942871,
|
|
"mean_token_accuracy": 0.8084652818739414,
|
|
"num_tokens": 7916094.0,
|
|
"step": 2450
|
|
},
|
|
{
|
|
"entropy": 0.7119234027341008,
|
|
"epoch": 0.5622857142857143,
|
|
"grad_norm": 7.375,
|
|
"learning_rate": 9.21818619196536e-06,
|
|
"loss": 1.0436591148376464,
|
|
"mean_token_accuracy": 0.8270700290799141,
|
|
"num_tokens": 7948214.0,
|
|
"step": 2460
|
|
},
|
|
{
|
|
"entropy": 0.6967569976113737,
|
|
"epoch": 0.5645714285714286,
|
|
"grad_norm": 7.03125,
|
|
"learning_rate": 9.170074573009382e-06,
|
|
"loss": 0.9530592918395996,
|
|
"mean_token_accuracy": 0.8300783924758435,
|
|
"num_tokens": 7981204.0,
|
|
"step": 2470
|
|
},
|
|
{
|
|
"entropy": 0.7442635943181812,
|
|
"epoch": 0.5668571428571428,
|
|
"grad_norm": 6.96875,
|
|
"learning_rate": 9.121962954053405e-06,
|
|
"loss": 1.0191211700439453,
|
|
"mean_token_accuracy": 0.8192649222910404,
|
|
"num_tokens": 8013076.0,
|
|
"step": 2480
|
|
},
|
|
{
|
|
"entropy": 0.7923426426947117,
|
|
"epoch": 0.5691428571428572,
|
|
"grad_norm": 7.25,
|
|
"learning_rate": 9.073851335097427e-06,
|
|
"loss": 1.1116843223571777,
|
|
"mean_token_accuracy": 0.813247837871313,
|
|
"num_tokens": 8047471.0,
|
|
"step": 2490
|
|
},
|
|
{
|
|
"entropy": 0.7783824296668171,
|
|
"epoch": 0.5714285714285714,
|
|
"grad_norm": 7.1875,
|
|
"learning_rate": 9.025739716141448e-06,
|
|
"loss": 1.0703957557678223,
|
|
"mean_token_accuracy": 0.813652578741312,
|
|
"num_tokens": 8075967.0,
|
|
"step": 2500
|
|
},
|
|
{
|
|
"entropy": 0.7609690563753247,
|
|
"epoch": 0.5737142857142857,
|
|
"grad_norm": 7.84375,
|
|
"learning_rate": 8.97762809718547e-06,
|
|
"loss": 0.9853609085083008,
|
|
"mean_token_accuracy": 0.8176385164260864,
|
|
"num_tokens": 8109554.0,
|
|
"step": 2510
|
|
},
|
|
{
|
|
"entropy": 0.796685915440321,
|
|
"epoch": 0.576,
|
|
"grad_norm": 7.8125,
|
|
"learning_rate": 8.929516478229493e-06,
|
|
"loss": 1.047004508972168,
|
|
"mean_token_accuracy": 0.811551482975483,
|
|
"num_tokens": 8142729.0,
|
|
"step": 2520
|
|
},
|
|
{
|
|
"entropy": 0.717453905660659,
|
|
"epoch": 0.5782857142857143,
|
|
"grad_norm": 7.0,
|
|
"learning_rate": 8.881404859273516e-06,
|
|
"loss": 1.0155123710632323,
|
|
"mean_token_accuracy": 0.8243556626141071,
|
|
"num_tokens": 8171878.0,
|
|
"step": 2530
|
|
},
|
|
{
|
|
"entropy": 0.7719296976923943,
|
|
"epoch": 0.5805714285714285,
|
|
"grad_norm": 6.625,
|
|
"learning_rate": 8.833293240317538e-06,
|
|
"loss": 1.060032844543457,
|
|
"mean_token_accuracy": 0.8186002224683762,
|
|
"num_tokens": 8203389.0,
|
|
"step": 2540
|
|
},
|
|
{
|
|
"entropy": 0.6772220591083169,
|
|
"epoch": 0.5828571428571429,
|
|
"grad_norm": 7.5625,
|
|
"learning_rate": 8.785181621361559e-06,
|
|
"loss": 0.9524177551269531,
|
|
"mean_token_accuracy": 0.8351402230560779,
|
|
"num_tokens": 8233812.0,
|
|
"step": 2550
|
|
},
|
|
{
|
|
"entropy": 0.7519471907988191,
|
|
"epoch": 0.5851428571428572,
|
|
"grad_norm": 7.15625,
|
|
"learning_rate": 8.737070002405581e-06,
|
|
"loss": 1.0217690467834473,
|
|
"mean_token_accuracy": 0.8147253841161728,
|
|
"num_tokens": 8264075.0,
|
|
"step": 2560
|
|
},
|
|
{
|
|
"entropy": 0.8792341394349933,
|
|
"epoch": 0.5874285714285714,
|
|
"grad_norm": 7.625,
|
|
"learning_rate": 8.688958383449604e-06,
|
|
"loss": 1.171504306793213,
|
|
"mean_token_accuracy": 0.7875504352152347,
|
|
"num_tokens": 8294266.0,
|
|
"step": 2570
|
|
},
|
|
{
|
|
"entropy": 0.5147198906168342,
|
|
"epoch": 0.5897142857142857,
|
|
"grad_norm": 7.1875,
|
|
"learning_rate": 8.640846764493626e-06,
|
|
"loss": 0.7446643352508545,
|
|
"mean_token_accuracy": 0.8638051569461822,
|
|
"num_tokens": 8328371.0,
|
|
"step": 2580
|
|
},
|
|
{
|
|
"entropy": 0.5512435308657586,
|
|
"epoch": 0.592,
|
|
"grad_norm": 6.71875,
|
|
"learning_rate": 8.592735145537649e-06,
|
|
"loss": 0.7508518695831299,
|
|
"mean_token_accuracy": 0.8605974681675435,
|
|
"num_tokens": 8358614.0,
|
|
"step": 2590
|
|
},
|
|
{
|
|
"entropy": 0.753514638543129,
|
|
"epoch": 0.5942857142857143,
|
|
"grad_norm": 7.96875,
|
|
"learning_rate": 8.54462352658167e-06,
|
|
"loss": 1.0647204399108887,
|
|
"mean_token_accuracy": 0.8166808724403382,
|
|
"num_tokens": 8390572.0,
|
|
"step": 2600
|
|
},
|
|
{
|
|
"entropy": 0.6976428182795644,
|
|
"epoch": 0.5965714285714285,
|
|
"grad_norm": 6.96875,
|
|
"learning_rate": 8.496511907625692e-06,
|
|
"loss": 0.9744165420532227,
|
|
"mean_token_accuracy": 0.8334845989942551,
|
|
"num_tokens": 8422186.0,
|
|
"step": 2610
|
|
},
|
|
{
|
|
"entropy": 0.6873942642472685,
|
|
"epoch": 0.5988571428571429,
|
|
"grad_norm": 8.1875,
|
|
"learning_rate": 8.448400288669715e-06,
|
|
"loss": 1.0646495819091797,
|
|
"mean_token_accuracy": 0.8329671390354634,
|
|
"num_tokens": 8456520.0,
|
|
"step": 2620
|
|
},
|
|
{
|
|
"entropy": 0.7481124849990011,
|
|
"epoch": 0.6011428571428571,
|
|
"grad_norm": 7.15625,
|
|
"learning_rate": 8.400288669713737e-06,
|
|
"loss": 0.9621360778808594,
|
|
"mean_token_accuracy": 0.8160779684782028,
|
|
"num_tokens": 8489868.0,
|
|
"step": 2630
|
|
},
|
|
{
|
|
"entropy": 0.7540229024365545,
|
|
"epoch": 0.6034285714285714,
|
|
"grad_norm": 8.1875,
|
|
"learning_rate": 8.352177050757758e-06,
|
|
"loss": 1.068429946899414,
|
|
"mean_token_accuracy": 0.8157521851360798,
|
|
"num_tokens": 8522110.0,
|
|
"step": 2640
|
|
},
|
|
{
|
|
"entropy": 0.8098990395665169,
|
|
"epoch": 0.6057142857142858,
|
|
"grad_norm": 7.46875,
|
|
"learning_rate": 8.30406543180178e-06,
|
|
"loss": 1.0495105743408204,
|
|
"mean_token_accuracy": 0.8076829589903355,
|
|
"num_tokens": 8554094.0,
|
|
"step": 2650
|
|
},
|
|
{
|
|
"entropy": 0.8042045352049172,
|
|
"epoch": 0.608,
|
|
"grad_norm": 7.25,
|
|
"learning_rate": 8.255953812845803e-06,
|
|
"loss": 1.1015840530395509,
|
|
"mean_token_accuracy": 0.8066806077957154,
|
|
"num_tokens": 8589902.0,
|
|
"step": 2660
|
|
},
|
|
{
|
|
"entropy": 0.9022464168258011,
|
|
"epoch": 0.6102857142857143,
|
|
"grad_norm": 6.59375,
|
|
"learning_rate": 8.207842193889826e-06,
|
|
"loss": 1.2131352424621582,
|
|
"mean_token_accuracy": 0.7915476217865944,
|
|
"num_tokens": 8623794.0,
|
|
"step": 2670
|
|
},
|
|
{
|
|
"entropy": 0.8746935517527163,
|
|
"epoch": 0.6125714285714285,
|
|
"grad_norm": 6.96875,
|
|
"learning_rate": 8.159730574933848e-06,
|
|
"loss": 1.1575665473937988,
|
|
"mean_token_accuracy": 0.7986876778304577,
|
|
"num_tokens": 8651194.0,
|
|
"step": 2680
|
|
},
|
|
{
|
|
"entropy": 0.8122401271015406,
|
|
"epoch": 0.6148571428571429,
|
|
"grad_norm": 6.65625,
|
|
"learning_rate": 8.111618955977869e-06,
|
|
"loss": 1.0654847145080566,
|
|
"mean_token_accuracy": 0.8131648566573858,
|
|
"num_tokens": 8681096.0,
|
|
"step": 2690
|
|
},
|
|
{
|
|
"entropy": 0.8027309827506542,
|
|
"epoch": 0.6171428571428571,
|
|
"grad_norm": 9.0,
|
|
"learning_rate": 8.063507337021891e-06,
|
|
"loss": 1.1084778785705567,
|
|
"mean_token_accuracy": 0.8057775877416133,
|
|
"num_tokens": 8713083.0,
|
|
"step": 2700
|
|
},
|
|
{
|
|
"entropy": 0.7622825523838401,
|
|
"epoch": 0.6194285714285714,
|
|
"grad_norm": 7.59375,
|
|
"learning_rate": 8.015395718065914e-06,
|
|
"loss": 1.033258819580078,
|
|
"mean_token_accuracy": 0.818463982641697,
|
|
"num_tokens": 8745917.0,
|
|
"step": 2710
|
|
},
|
|
{
|
|
"entropy": 0.7353868483565748,
|
|
"epoch": 0.6217142857142857,
|
|
"grad_norm": 7.5,
|
|
"learning_rate": 7.967284099109935e-06,
|
|
"loss": 1.0230457305908203,
|
|
"mean_token_accuracy": 0.8215658769011498,
|
|
"num_tokens": 8781507.0,
|
|
"step": 2720
|
|
},
|
|
{
|
|
"entropy": 0.7007935558445751,
|
|
"epoch": 0.624,
|
|
"grad_norm": 7.375,
|
|
"learning_rate": 7.919172480153959e-06,
|
|
"loss": 0.9617188453674317,
|
|
"mean_token_accuracy": 0.8268887743353843,
|
|
"num_tokens": 8815964.0,
|
|
"step": 2730
|
|
},
|
|
{
|
|
"entropy": 0.7421483082696796,
|
|
"epoch": 0.6262857142857143,
|
|
"grad_norm": 7.25,
|
|
"learning_rate": 7.87106086119798e-06,
|
|
"loss": 1.0290477752685547,
|
|
"mean_token_accuracy": 0.8229492858052254,
|
|
"num_tokens": 8848344.0,
|
|
"step": 2740
|
|
},
|
|
{
|
|
"entropy": 0.73214913867414,
|
|
"epoch": 0.6285714285714286,
|
|
"grad_norm": 8.625,
|
|
"learning_rate": 7.822949242242002e-06,
|
|
"loss": 1.060285472869873,
|
|
"mean_token_accuracy": 0.8267331637442112,
|
|
"num_tokens": 8879118.0,
|
|
"step": 2750
|
|
},
|
|
{
|
|
"entropy": 0.8049950825981795,
|
|
"epoch": 0.6308571428571429,
|
|
"grad_norm": 7.625,
|
|
"learning_rate": 7.774837623286025e-06,
|
|
"loss": 1.1363885879516602,
|
|
"mean_token_accuracy": 0.8102126717567444,
|
|
"num_tokens": 8913125.0,
|
|
"step": 2760
|
|
},
|
|
{
|
|
"entropy": 0.6610826853662729,
|
|
"epoch": 0.6331428571428571,
|
|
"grad_norm": 6.125,
|
|
"learning_rate": 7.726726004330045e-06,
|
|
"loss": 0.9042505264282227,
|
|
"mean_token_accuracy": 0.8309091664850712,
|
|
"num_tokens": 8946194.0,
|
|
"step": 2770
|
|
},
|
|
{
|
|
"entropy": 0.6915491444058717,
|
|
"epoch": 0.6354285714285715,
|
|
"grad_norm": 8.0,
|
|
"learning_rate": 7.678614385374068e-06,
|
|
"loss": 0.96341552734375,
|
|
"mean_token_accuracy": 0.8264155894517898,
|
|
"num_tokens": 8982077.0,
|
|
"step": 2780
|
|
},
|
|
{
|
|
"entropy": 0.6272562616504729,
|
|
"epoch": 0.6377142857142857,
|
|
"grad_norm": 7.875,
|
|
"learning_rate": 7.63050276641809e-06,
|
|
"loss": 0.928917121887207,
|
|
"mean_token_accuracy": 0.8460888244211674,
|
|
"num_tokens": 9019879.0,
|
|
"step": 2790
|
|
},
|
|
{
|
|
"entropy": 0.701786683825776,
|
|
"epoch": 0.64,
|
|
"grad_norm": 7.1875,
|
|
"learning_rate": 7.582391147462112e-06,
|
|
"loss": 1.046267604827881,
|
|
"mean_token_accuracy": 0.8271472752094269,
|
|
"num_tokens": 9053435.0,
|
|
"step": 2800
|
|
},
|
|
{
|
|
"entropy": 0.8251914168708027,
|
|
"epoch": 0.6422857142857142,
|
|
"grad_norm": 7.8125,
|
|
"learning_rate": 7.534279528506135e-06,
|
|
"loss": 1.1346126556396485,
|
|
"mean_token_accuracy": 0.8051226794719696,
|
|
"num_tokens": 9087735.0,
|
|
"step": 2810
|
|
},
|
|
{
|
|
"entropy": 0.8158627865836025,
|
|
"epoch": 0.6445714285714286,
|
|
"grad_norm": 7.5,
|
|
"learning_rate": 7.486167909550157e-06,
|
|
"loss": 1.0751116752624512,
|
|
"mean_token_accuracy": 0.8058493196964264,
|
|
"num_tokens": 9120051.0,
|
|
"step": 2820
|
|
},
|
|
{
|
|
"entropy": 0.8153355809859931,
|
|
"epoch": 0.6468571428571429,
|
|
"grad_norm": 8.1875,
|
|
"learning_rate": 7.438056290594179e-06,
|
|
"loss": 1.1167887687683105,
|
|
"mean_token_accuracy": 0.8044289343059063,
|
|
"num_tokens": 9150131.0,
|
|
"step": 2830
|
|
},
|
|
{
|
|
"entropy": 0.7215716702863574,
|
|
"epoch": 0.6491428571428571,
|
|
"grad_norm": 6.8125,
|
|
"learning_rate": 7.389944671638201e-06,
|
|
"loss": 0.9800872802734375,
|
|
"mean_token_accuracy": 0.8230889447033405,
|
|
"num_tokens": 9183592.0,
|
|
"step": 2840
|
|
},
|
|
{
|
|
"entropy": 0.6650403100065887,
|
|
"epoch": 0.6514285714285715,
|
|
"grad_norm": 6.6875,
|
|
"learning_rate": 7.341833052682224e-06,
|
|
"loss": 0.930327320098877,
|
|
"mean_token_accuracy": 0.8409841381013393,
|
|
"num_tokens": 9215447.0,
|
|
"step": 2850
|
|
},
|
|
{
|
|
"entropy": 0.8310886896215379,
|
|
"epoch": 0.6537142857142857,
|
|
"grad_norm": 6.59375,
|
|
"learning_rate": 7.2937214337262455e-06,
|
|
"loss": 1.108950424194336,
|
|
"mean_token_accuracy": 0.8052147164940834,
|
|
"num_tokens": 9247756.0,
|
|
"step": 2860
|
|
},
|
|
{
|
|
"entropy": 0.7922366439364851,
|
|
"epoch": 0.656,
|
|
"grad_norm": 9.3125,
|
|
"learning_rate": 7.245609814770268e-06,
|
|
"loss": 1.089939498901367,
|
|
"mean_token_accuracy": 0.8171895481646061,
|
|
"num_tokens": 9281235.0,
|
|
"step": 2870
|
|
},
|
|
{
|
|
"entropy": 0.7316854421980679,
|
|
"epoch": 0.6582857142857143,
|
|
"grad_norm": 6.96875,
|
|
"learning_rate": 7.19749819581429e-06,
|
|
"loss": 0.975350284576416,
|
|
"mean_token_accuracy": 0.8272683911025525,
|
|
"num_tokens": 9315295.0,
|
|
"step": 2880
|
|
},
|
|
{
|
|
"entropy": 0.7693224214017391,
|
|
"epoch": 0.6605714285714286,
|
|
"grad_norm": 8.3125,
|
|
"learning_rate": 7.149386576858311e-06,
|
|
"loss": 1.1402573585510254,
|
|
"mean_token_accuracy": 0.8134943917393684,
|
|
"num_tokens": 9346923.0,
|
|
"step": 2890
|
|
},
|
|
{
|
|
"entropy": 0.7617660995572806,
|
|
"epoch": 0.6628571428571428,
|
|
"grad_norm": 7.59375,
|
|
"learning_rate": 7.101274957902335e-06,
|
|
"loss": 1.038425350189209,
|
|
"mean_token_accuracy": 0.8179185189306736,
|
|
"num_tokens": 9379433.0,
|
|
"step": 2900
|
|
},
|
|
{
|
|
"entropy": 0.7871399355120957,
|
|
"epoch": 0.6651428571428571,
|
|
"grad_norm": 7.46875,
|
|
"learning_rate": 7.053163338946356e-06,
|
|
"loss": 1.0193154335021972,
|
|
"mean_token_accuracy": 0.8183310203254223,
|
|
"num_tokens": 9413192.0,
|
|
"step": 2910
|
|
},
|
|
{
|
|
"entropy": 0.811190924886614,
|
|
"epoch": 0.6674285714285715,
|
|
"grad_norm": 6.625,
|
|
"learning_rate": 7.005051719990378e-06,
|
|
"loss": 1.1274406433105468,
|
|
"mean_token_accuracy": 0.8116770260035991,
|
|
"num_tokens": 9445678.0,
|
|
"step": 2920
|
|
},
|
|
{
|
|
"entropy": 0.8758432329632342,
|
|
"epoch": 0.6697142857142857,
|
|
"grad_norm": 8.6875,
|
|
"learning_rate": 6.9569401010344005e-06,
|
|
"loss": 1.195134162902832,
|
|
"mean_token_accuracy": 0.7941108390688896,
|
|
"num_tokens": 9476534.0,
|
|
"step": 2930
|
|
},
|
|
{
|
|
"entropy": 0.8360557379201055,
|
|
"epoch": 0.672,
|
|
"grad_norm": 6.46875,
|
|
"learning_rate": 6.908828482078422e-06,
|
|
"loss": 1.1135424613952636,
|
|
"mean_token_accuracy": 0.80475138053298,
|
|
"num_tokens": 9509834.0,
|
|
"step": 2940
|
|
},
|
|
{
|
|
"entropy": 0.8121384960599244,
|
|
"epoch": 0.6742857142857143,
|
|
"grad_norm": 7.09375,
|
|
"learning_rate": 6.860716863122444e-06,
|
|
"loss": 1.0921581268310547,
|
|
"mean_token_accuracy": 0.8104615144431591,
|
|
"num_tokens": 9544560.0,
|
|
"step": 2950
|
|
},
|
|
{
|
|
"entropy": 0.6809657582081854,
|
|
"epoch": 0.6765714285714286,
|
|
"grad_norm": 6.78125,
|
|
"learning_rate": 6.812605244166467e-06,
|
|
"loss": 0.9061110496520997,
|
|
"mean_token_accuracy": 0.8335768587887287,
|
|
"num_tokens": 9576699.0,
|
|
"step": 2960
|
|
},
|
|
{
|
|
"entropy": 0.7368661808781326,
|
|
"epoch": 0.6788571428571428,
|
|
"grad_norm": 7.0,
|
|
"learning_rate": 6.764493625210489e-06,
|
|
"loss": 0.9945035934448242,
|
|
"mean_token_accuracy": 0.8268292259424925,
|
|
"num_tokens": 9609831.0,
|
|
"step": 2970
|
|
},
|
|
{
|
|
"entropy": 0.7591518526896834,
|
|
"epoch": 0.6811428571428572,
|
|
"grad_norm": 7.875,
|
|
"learning_rate": 6.716382006254511e-06,
|
|
"loss": 1.0467313766479491,
|
|
"mean_token_accuracy": 0.8203754242509603,
|
|
"num_tokens": 9642043.0,
|
|
"step": 2980
|
|
},
|
|
{
|
|
"entropy": 0.6456474749371409,
|
|
"epoch": 0.6834285714285714,
|
|
"grad_norm": 8.5625,
|
|
"learning_rate": 6.668270387298533e-06,
|
|
"loss": 0.9298653602600098,
|
|
"mean_token_accuracy": 0.8404752813279629,
|
|
"num_tokens": 9672316.0,
|
|
"step": 2990
|
|
},
|
|
{
|
|
"entropy": 0.7651321108452975,
|
|
"epoch": 0.6857142857142857,
|
|
"grad_norm": 7.78125,
|
|
"learning_rate": 6.620158768342555e-06,
|
|
"loss": 0.9670675277709961,
|
|
"mean_token_accuracy": 0.8202950492501259,
|
|
"num_tokens": 9704667.0,
|
|
"step": 3000
|
|
},
|
|
{
|
|
"entropy": 0.7684257586486638,
|
|
"epoch": 0.688,
|
|
"grad_norm": 6.96875,
|
|
"learning_rate": 6.572047149386578e-06,
|
|
"loss": 1.0198678016662597,
|
|
"mean_token_accuracy": 0.8141922578215599,
|
|
"num_tokens": 9736453.0,
|
|
"step": 3010
|
|
},
|
|
{
|
|
"entropy": 0.9071576375514269,
|
|
"epoch": 0.6902857142857143,
|
|
"grad_norm": 7.46875,
|
|
"learning_rate": 6.5239355304306e-06,
|
|
"loss": 1.2006649017333983,
|
|
"mean_token_accuracy": 0.7815720088779926,
|
|
"num_tokens": 9766239.0,
|
|
"step": 3020
|
|
},
|
|
{
|
|
"entropy": 0.7002435548231005,
|
|
"epoch": 0.6925714285714286,
|
|
"grad_norm": 8.1875,
|
|
"learning_rate": 6.475823911474621e-06,
|
|
"loss": 1.0064776420593262,
|
|
"mean_token_accuracy": 0.8239927910268307,
|
|
"num_tokens": 9797633.0,
|
|
"step": 3030
|
|
},
|
|
{
|
|
"entropy": 0.7579085680190474,
|
|
"epoch": 0.6948571428571428,
|
|
"grad_norm": 7.71875,
|
|
"learning_rate": 6.427712292518644e-06,
|
|
"loss": 1.0041309356689454,
|
|
"mean_token_accuracy": 0.8205542616546154,
|
|
"num_tokens": 9829628.0,
|
|
"step": 3040
|
|
},
|
|
{
|
|
"entropy": 0.8784082194790244,
|
|
"epoch": 0.6971428571428572,
|
|
"grad_norm": 7.40625,
|
|
"learning_rate": 6.379600673562666e-06,
|
|
"loss": 1.1010237693786622,
|
|
"mean_token_accuracy": 0.7967388294637203,
|
|
"num_tokens": 9864302.0,
|
|
"step": 3050
|
|
},
|
|
{
|
|
"entropy": 0.6545436557382345,
|
|
"epoch": 0.6994285714285714,
|
|
"grad_norm": 7.71875,
|
|
"learning_rate": 6.331489054606688e-06,
|
|
"loss": 1.0129745483398438,
|
|
"mean_token_accuracy": 0.8387912206351757,
|
|
"num_tokens": 9895779.0,
|
|
"step": 3060
|
|
},
|
|
{
|
|
"entropy": 0.8425466694869101,
|
|
"epoch": 0.7017142857142857,
|
|
"grad_norm": 6.78125,
|
|
"learning_rate": 6.2833774356507104e-06,
|
|
"loss": 1.0562131881713868,
|
|
"mean_token_accuracy": 0.8017945110797882,
|
|
"num_tokens": 9924158.0,
|
|
"step": 3070
|
|
},
|
|
{
|
|
"entropy": 0.873399674333632,
|
|
"epoch": 0.704,
|
|
"grad_norm": 8.75,
|
|
"learning_rate": 6.235265816694732e-06,
|
|
"loss": 1.1048128128051757,
|
|
"mean_token_accuracy": 0.7917656324803829,
|
|
"num_tokens": 9955099.0,
|
|
"step": 3080
|
|
},
|
|
{
|
|
"entropy": 0.6073906374163925,
|
|
"epoch": 0.7062857142857143,
|
|
"grad_norm": 9.0625,
|
|
"learning_rate": 6.187154197738754e-06,
|
|
"loss": 0.8535347938537597,
|
|
"mean_token_accuracy": 0.8521837316453457,
|
|
"num_tokens": 9988123.0,
|
|
"step": 3090
|
|
},
|
|
{
|
|
"entropy": 0.8428573332726955,
|
|
"epoch": 0.7085714285714285,
|
|
"grad_norm": 7.15625,
|
|
"learning_rate": 6.139042578782777e-06,
|
|
"loss": 1.1206453323364258,
|
|
"mean_token_accuracy": 0.7989229038357735,
|
|
"num_tokens": 10016364.0,
|
|
"step": 3100
|
|
},
|
|
{
|
|
"entropy": 0.740996487159282,
|
|
"epoch": 0.7108571428571429,
|
|
"grad_norm": 7.96875,
|
|
"learning_rate": 6.090930959826799e-06,
|
|
"loss": 1.0498098373413085,
|
|
"mean_token_accuracy": 0.8253378972411156,
|
|
"num_tokens": 10047098.0,
|
|
"step": 3110
|
|
},
|
|
{
|
|
"entropy": 0.7634292658418417,
|
|
"epoch": 0.7131428571428572,
|
|
"grad_norm": 7.40625,
|
|
"learning_rate": 6.042819340870821e-06,
|
|
"loss": 1.027073860168457,
|
|
"mean_token_accuracy": 0.8156747639179229,
|
|
"num_tokens": 10078377.0,
|
|
"step": 3120
|
|
},
|
|
{
|
|
"entropy": 0.7800739608705044,
|
|
"epoch": 0.7154285714285714,
|
|
"grad_norm": 8.0625,
|
|
"learning_rate": 5.994707721914843e-06,
|
|
"loss": 1.0465456962585449,
|
|
"mean_token_accuracy": 0.8120176091790199,
|
|
"num_tokens": 10108276.0,
|
|
"step": 3130
|
|
},
|
|
{
|
|
"entropy": 0.6941058835014701,
|
|
"epoch": 0.7177142857142857,
|
|
"grad_norm": 8.25,
|
|
"learning_rate": 5.946596102958865e-06,
|
|
"loss": 0.9293928146362305,
|
|
"mean_token_accuracy": 0.8261455290019513,
|
|
"num_tokens": 10140397.0,
|
|
"step": 3140
|
|
},
|
|
{
|
|
"entropy": 0.7566414731554687,
|
|
"epoch": 0.72,
|
|
"grad_norm": 7.78125,
|
|
"learning_rate": 5.898484484002888e-06,
|
|
"loss": 1.0103553771972655,
|
|
"mean_token_accuracy": 0.8191342234611512,
|
|
"num_tokens": 10170396.0,
|
|
"step": 3150
|
|
},
|
|
{
|
|
"entropy": 0.6843882665038109,
|
|
"epoch": 0.7222857142857143,
|
|
"grad_norm": 6.90625,
|
|
"learning_rate": 5.85037286504691e-06,
|
|
"loss": 0.9306538581848145,
|
|
"mean_token_accuracy": 0.8384991563856602,
|
|
"num_tokens": 10203787.0,
|
|
"step": 3160
|
|
},
|
|
{
|
|
"entropy": 0.9223319502547384,
|
|
"epoch": 0.7245714285714285,
|
|
"grad_norm": 7.09375,
|
|
"learning_rate": 5.802261246090931e-06,
|
|
"loss": 1.2310810089111328,
|
|
"mean_token_accuracy": 0.7850386075675487,
|
|
"num_tokens": 10237964.0,
|
|
"step": 3170
|
|
},
|
|
{
|
|
"entropy": 0.9315114512108267,
|
|
"epoch": 0.7268571428571429,
|
|
"grad_norm": 7.875,
|
|
"learning_rate": 5.754149627134954e-06,
|
|
"loss": 1.2219575881958007,
|
|
"mean_token_accuracy": 0.788118976727128,
|
|
"num_tokens": 10272012.0,
|
|
"step": 3180
|
|
},
|
|
{
|
|
"entropy": 0.9613786770962178,
|
|
"epoch": 0.7291428571428571,
|
|
"grad_norm": 7.71875,
|
|
"learning_rate": 5.706038008178975e-06,
|
|
"loss": 1.2217192649841309,
|
|
"mean_token_accuracy": 0.7753416560590267,
|
|
"num_tokens": 10301067.0,
|
|
"step": 3190
|
|
},
|
|
{
|
|
"entropy": 0.8978491752408445,
|
|
"epoch": 0.7314285714285714,
|
|
"grad_norm": 8.125,
|
|
"learning_rate": 5.657926389222997e-06,
|
|
"loss": 1.220133399963379,
|
|
"mean_token_accuracy": 0.7887196414172649,
|
|
"num_tokens": 10332467.0,
|
|
"step": 3200
|
|
},
|
|
{
|
|
"entropy": 0.7975409649312496,
|
|
"epoch": 0.7337142857142858,
|
|
"grad_norm": 6.875,
|
|
"learning_rate": 5.60981477026702e-06,
|
|
"loss": 1.0842624664306642,
|
|
"mean_token_accuracy": 0.8157493643462658,
|
|
"num_tokens": 10363576.0,
|
|
"step": 3210
|
|
},
|
|
{
|
|
"entropy": 0.7229632311500609,
|
|
"epoch": 0.736,
|
|
"grad_norm": 5.84375,
|
|
"learning_rate": 5.561703151311042e-06,
|
|
"loss": 0.9485625267028809,
|
|
"mean_token_accuracy": 0.8276536233723164,
|
|
"num_tokens": 10395203.0,
|
|
"step": 3220
|
|
},
|
|
{
|
|
"entropy": 0.7023040059953928,
|
|
"epoch": 0.7382857142857143,
|
|
"grad_norm": 6.90625,
|
|
"learning_rate": 5.513591532355064e-06,
|
|
"loss": 1.0307831764221191,
|
|
"mean_token_accuracy": 0.8284949451684952,
|
|
"num_tokens": 10426392.0,
|
|
"step": 3230
|
|
},
|
|
{
|
|
"entropy": 0.7922056226991117,
|
|
"epoch": 0.7405714285714285,
|
|
"grad_norm": 7.78125,
|
|
"learning_rate": 5.465479913399086e-06,
|
|
"loss": 1.0614632606506347,
|
|
"mean_token_accuracy": 0.8134492255747319,
|
|
"num_tokens": 10461629.0,
|
|
"step": 3240
|
|
},
|
|
{
|
|
"entropy": 0.5897016246803105,
|
|
"epoch": 0.7428571428571429,
|
|
"grad_norm": 7.1875,
|
|
"learning_rate": 5.417368294443108e-06,
|
|
"loss": 0.9088504791259766,
|
|
"mean_token_accuracy": 0.8521728955209256,
|
|
"num_tokens": 10497681.0,
|
|
"step": 3250
|
|
},
|
|
{
|
|
"entropy": 0.7967038029804826,
|
|
"epoch": 0.7451428571428571,
|
|
"grad_norm": 7.8125,
|
|
"learning_rate": 5.36925667548713e-06,
|
|
"loss": 1.0916454315185546,
|
|
"mean_token_accuracy": 0.8093243841081857,
|
|
"num_tokens": 10531276.0,
|
|
"step": 3260
|
|
},
|
|
{
|
|
"entropy": 0.7693165981210768,
|
|
"epoch": 0.7474285714285714,
|
|
"grad_norm": 6.84375,
|
|
"learning_rate": 5.321145056531153e-06,
|
|
"loss": 0.9624992370605469,
|
|
"mean_token_accuracy": 0.818351661413908,
|
|
"num_tokens": 10560781.0,
|
|
"step": 3270
|
|
},
|
|
{
|
|
"entropy": 0.7283342545852065,
|
|
"epoch": 0.7497142857142857,
|
|
"grad_norm": 6.78125,
|
|
"learning_rate": 5.2730334375751746e-06,
|
|
"loss": 1.0297183990478516,
|
|
"mean_token_accuracy": 0.8240480080246926,
|
|
"num_tokens": 10594592.0,
|
|
"step": 3280
|
|
},
|
|
{
|
|
"entropy": 0.7524079182185233,
|
|
"epoch": 0.752,
|
|
"grad_norm": 6.96875,
|
|
"learning_rate": 5.224921818619197e-06,
|
|
"loss": 0.980162239074707,
|
|
"mean_token_accuracy": 0.8201256044209003,
|
|
"num_tokens": 10627039.0,
|
|
"step": 3290
|
|
},
|
|
{
|
|
"entropy": 0.7365978182293474,
|
|
"epoch": 0.7542857142857143,
|
|
"grad_norm": 6.9375,
|
|
"learning_rate": 5.1768101996632196e-06,
|
|
"loss": 0.9751132011413575,
|
|
"mean_token_accuracy": 0.8289193719625473,
|
|
"num_tokens": 10659890.0,
|
|
"step": 3300
|
|
},
|
|
{
|
|
"entropy": 0.766766385640949,
|
|
"epoch": 0.7565714285714286,
|
|
"grad_norm": 7.0,
|
|
"learning_rate": 5.128698580707241e-06,
|
|
"loss": 1.066256618499756,
|
|
"mean_token_accuracy": 0.813833087682724,
|
|
"num_tokens": 10689935.0,
|
|
"step": 3310
|
|
},
|
|
{
|
|
"entropy": 0.7413464878685773,
|
|
"epoch": 0.7588571428571429,
|
|
"grad_norm": 7.4375,
|
|
"learning_rate": 5.080586961751264e-06,
|
|
"loss": 0.9947978019714355,
|
|
"mean_token_accuracy": 0.8286945290863514,
|
|
"num_tokens": 10719202.0,
|
|
"step": 3320
|
|
},
|
|
{
|
|
"entropy": 0.8110045059584081,
|
|
"epoch": 0.7611428571428571,
|
|
"grad_norm": 6.875,
|
|
"learning_rate": 5.032475342795285e-06,
|
|
"loss": 1.1004474639892579,
|
|
"mean_token_accuracy": 0.8095826417207718,
|
|
"num_tokens": 10752706.0,
|
|
"step": 3330
|
|
},
|
|
{
|
|
"entropy": 0.8748351650312542,
|
|
"epoch": 0.7634285714285715,
|
|
"grad_norm": 5.71875,
|
|
"learning_rate": 4.984363723839308e-06,
|
|
"loss": 1.1687129020690918,
|
|
"mean_token_accuracy": 0.792143489792943,
|
|
"num_tokens": 10785853.0,
|
|
"step": 3340
|
|
},
|
|
{
|
|
"entropy": 0.7911639436148107,
|
|
"epoch": 0.7657142857142857,
|
|
"grad_norm": 7.25,
|
|
"learning_rate": 4.9362521048833295e-06,
|
|
"loss": 1.075576114654541,
|
|
"mean_token_accuracy": 0.8155123472213746,
|
|
"num_tokens": 10818229.0,
|
|
"step": 3350
|
|
},
|
|
{
|
|
"entropy": 0.7263018532656134,
|
|
"epoch": 0.768,
|
|
"grad_norm": 7.625,
|
|
"learning_rate": 4.888140485927352e-06,
|
|
"loss": 1.0433449745178223,
|
|
"mean_token_accuracy": 0.8173217661678791,
|
|
"num_tokens": 10850567.0,
|
|
"step": 3360
|
|
},
|
|
{
|
|
"entropy": 0.8579608911648393,
|
|
"epoch": 0.7702857142857142,
|
|
"grad_norm": 8.0,
|
|
"learning_rate": 4.840028866971374e-06,
|
|
"loss": 1.106894302368164,
|
|
"mean_token_accuracy": 0.7974334202706814,
|
|
"num_tokens": 10883673.0,
|
|
"step": 3370
|
|
},
|
|
{
|
|
"entropy": 0.844954667147249,
|
|
"epoch": 0.7725714285714286,
|
|
"grad_norm": 7.09375,
|
|
"learning_rate": 4.791917248015396e-06,
|
|
"loss": 1.1396818161010742,
|
|
"mean_token_accuracy": 0.8037762485444546,
|
|
"num_tokens": 10916999.0,
|
|
"step": 3380
|
|
},
|
|
{
|
|
"entropy": 0.8294042806141079,
|
|
"epoch": 0.7748571428571429,
|
|
"grad_norm": 7.15625,
|
|
"learning_rate": 4.743805629059418e-06,
|
|
"loss": 1.07614164352417,
|
|
"mean_token_accuracy": 0.8013096928596497,
|
|
"num_tokens": 10947976.0,
|
|
"step": 3390
|
|
},
|
|
{
|
|
"entropy": 0.699165354296565,
|
|
"epoch": 0.7771428571428571,
|
|
"grad_norm": 7.3125,
|
|
"learning_rate": 4.69569401010344e-06,
|
|
"loss": 0.9428619384765625,
|
|
"mean_token_accuracy": 0.8234991244971752,
|
|
"num_tokens": 10981402.0,
|
|
"step": 3400
|
|
},
|
|
{
|
|
"entropy": 0.6559101923368871,
|
|
"epoch": 0.7794285714285715,
|
|
"grad_norm": 8.6875,
|
|
"learning_rate": 4.647582391147463e-06,
|
|
"loss": 0.851567554473877,
|
|
"mean_token_accuracy": 0.8403317756950855,
|
|
"num_tokens": 11011139.0,
|
|
"step": 3410
|
|
},
|
|
{
|
|
"entropy": 0.8098050164990127,
|
|
"epoch": 0.7817142857142857,
|
|
"grad_norm": 7.53125,
|
|
"learning_rate": 4.5994707721914845e-06,
|
|
"loss": 1.11738862991333,
|
|
"mean_token_accuracy": 0.8105709552764893,
|
|
"num_tokens": 11044319.0,
|
|
"step": 3420
|
|
},
|
|
{
|
|
"entropy": 0.6640732565894722,
|
|
"epoch": 0.784,
|
|
"grad_norm": 8.125,
|
|
"learning_rate": 4.551359153235507e-06,
|
|
"loss": 0.9586344718933105,
|
|
"mean_token_accuracy": 0.8361151710152626,
|
|
"num_tokens": 11079905.0,
|
|
"step": 3430
|
|
},
|
|
{
|
|
"entropy": 0.7955016130581498,
|
|
"epoch": 0.7862857142857143,
|
|
"grad_norm": 8.0,
|
|
"learning_rate": 4.503247534279529e-06,
|
|
"loss": 1.0718993186950683,
|
|
"mean_token_accuracy": 0.8115546323359013,
|
|
"num_tokens": 11111800.0,
|
|
"step": 3440
|
|
},
|
|
{
|
|
"entropy": 0.7911881297826767,
|
|
"epoch": 0.7885714285714286,
|
|
"grad_norm": 7.78125,
|
|
"learning_rate": 4.455135915323551e-06,
|
|
"loss": 1.099710750579834,
|
|
"mean_token_accuracy": 0.8119720377027988,
|
|
"num_tokens": 11145332.0,
|
|
"step": 3450
|
|
},
|
|
{
|
|
"entropy": 0.774864933360368,
|
|
"epoch": 0.7908571428571428,
|
|
"grad_norm": 6.21875,
|
|
"learning_rate": 4.407024296367573e-06,
|
|
"loss": 1.0780227661132813,
|
|
"mean_token_accuracy": 0.8145800329744816,
|
|
"num_tokens": 11174470.0,
|
|
"step": 3460
|
|
},
|
|
{
|
|
"entropy": 0.6018477959558368,
|
|
"epoch": 0.7931428571428571,
|
|
"grad_norm": 7.4375,
|
|
"learning_rate": 4.358912677411595e-06,
|
|
"loss": 0.8521579742431641,
|
|
"mean_token_accuracy": 0.8514960691332817,
|
|
"num_tokens": 11210615.0,
|
|
"step": 3470
|
|
},
|
|
{
|
|
"entropy": 0.8444686807692051,
|
|
"epoch": 0.7954285714285714,
|
|
"grad_norm": 6.6875,
|
|
"learning_rate": 4.310801058455618e-06,
|
|
"loss": 1.1099799156188965,
|
|
"mean_token_accuracy": 0.8008836135268211,
|
|
"num_tokens": 11241513.0,
|
|
"step": 3480
|
|
},
|
|
{
|
|
"entropy": 0.829711533524096,
|
|
"epoch": 0.7977142857142857,
|
|
"grad_norm": 6.625,
|
|
"learning_rate": 4.2626894394996395e-06,
|
|
"loss": 1.0666452407836915,
|
|
"mean_token_accuracy": 0.8077532455325127,
|
|
"num_tokens": 11274813.0,
|
|
"step": 3490
|
|
},
|
|
{
|
|
"entropy": 0.7473221772350371,
|
|
"epoch": 0.8,
|
|
"grad_norm": 7.3125,
|
|
"learning_rate": 4.214577820543661e-06,
|
|
"loss": 1.0066685676574707,
|
|
"mean_token_accuracy": 0.8148701801896095,
|
|
"num_tokens": 11303959.0,
|
|
"step": 3500
|
|
},
|
|
{
|
|
"entropy": 0.8557392791844904,
|
|
"epoch": 0.8022857142857143,
|
|
"grad_norm": 7.6875,
|
|
"learning_rate": 4.166466201587684e-06,
|
|
"loss": 1.0541882514953613,
|
|
"mean_token_accuracy": 0.7998419582843781,
|
|
"num_tokens": 11334910.0,
|
|
"step": 3510
|
|
},
|
|
{
|
|
"entropy": 0.7890441759489477,
|
|
"epoch": 0.8045714285714286,
|
|
"grad_norm": 7.71875,
|
|
"learning_rate": 4.118354582631705e-06,
|
|
"loss": 1.0888317108154297,
|
|
"mean_token_accuracy": 0.8178003937005996,
|
|
"num_tokens": 11365426.0,
|
|
"step": 3520
|
|
},
|
|
{
|
|
"entropy": 0.7986143685877323,
|
|
"epoch": 0.8068571428571428,
|
|
"grad_norm": 6.78125,
|
|
"learning_rate": 4.070242963675728e-06,
|
|
"loss": 1.0438194274902344,
|
|
"mean_token_accuracy": 0.8172411516308784,
|
|
"num_tokens": 11396568.0,
|
|
"step": 3530
|
|
},
|
|
{
|
|
"entropy": 0.7023409645073115,
|
|
"epoch": 0.8091428571428572,
|
|
"grad_norm": 7.125,
|
|
"learning_rate": 4.02213134471975e-06,
|
|
"loss": 0.982151985168457,
|
|
"mean_token_accuracy": 0.8304105646908283,
|
|
"num_tokens": 11429858.0,
|
|
"step": 3540
|
|
},
|
|
{
|
|
"entropy": 0.8511648692190648,
|
|
"epoch": 0.8114285714285714,
|
|
"grad_norm": 7.625,
|
|
"learning_rate": 3.974019725763773e-06,
|
|
"loss": 1.118496799468994,
|
|
"mean_token_accuracy": 0.8004165187478065,
|
|
"num_tokens": 11458825.0,
|
|
"step": 3550
|
|
},
|
|
{
|
|
"entropy": 0.8242282169871032,
|
|
"epoch": 0.8137142857142857,
|
|
"grad_norm": 7.15625,
|
|
"learning_rate": 3.9259081068077945e-06,
|
|
"loss": 1.0889615058898925,
|
|
"mean_token_accuracy": 0.8154613308608532,
|
|
"num_tokens": 11485780.0,
|
|
"step": 3560
|
|
},
|
|
{
|
|
"entropy": 0.8761372335255146,
|
|
"epoch": 0.816,
|
|
"grad_norm": 8.1875,
|
|
"learning_rate": 3.877796487851816e-06,
|
|
"loss": 1.1666927337646484,
|
|
"mean_token_accuracy": 0.7958627745509148,
|
|
"num_tokens": 11515089.0,
|
|
"step": 3570
|
|
},
|
|
{
|
|
"entropy": 0.8123947971500456,
|
|
"epoch": 0.8182857142857143,
|
|
"grad_norm": 7.1875,
|
|
"learning_rate": 3.829684868895839e-06,
|
|
"loss": 1.0921098709106445,
|
|
"mean_token_accuracy": 0.8081369504332543,
|
|
"num_tokens": 11545683.0,
|
|
"step": 3580
|
|
},
|
|
{
|
|
"entropy": 0.7641672321595252,
|
|
"epoch": 0.8205714285714286,
|
|
"grad_norm": 12.875,
|
|
"learning_rate": 3.7815732499398603e-06,
|
|
"loss": 1.0089197158813477,
|
|
"mean_token_accuracy": 0.8187419034540653,
|
|
"num_tokens": 11579338.0,
|
|
"step": 3590
|
|
},
|
|
{
|
|
"entropy": 0.9396181921474636,
|
|
"epoch": 0.8228571428571428,
|
|
"grad_norm": 6.875,
|
|
"learning_rate": 3.733461630983883e-06,
|
|
"loss": 1.1994843482971191,
|
|
"mean_token_accuracy": 0.7850606590509415,
|
|
"num_tokens": 11611832.0,
|
|
"step": 3600
|
|
},
|
|
{
|
|
"entropy": 0.692871849052608,
|
|
"epoch": 0.8251428571428572,
|
|
"grad_norm": 7.4375,
|
|
"learning_rate": 3.685350012027905e-06,
|
|
"loss": 0.9562499046325683,
|
|
"mean_token_accuracy": 0.8297605454921723,
|
|
"num_tokens": 11647063.0,
|
|
"step": 3610
|
|
},
|
|
{
|
|
"entropy": 0.8553698582574725,
|
|
"epoch": 0.8274285714285714,
|
|
"grad_norm": 6.40625,
|
|
"learning_rate": 3.6372383930719274e-06,
|
|
"loss": 1.1813543319702149,
|
|
"mean_token_accuracy": 0.7899277493357658,
|
|
"num_tokens": 11678198.0,
|
|
"step": 3620
|
|
},
|
|
{
|
|
"entropy": 0.7769951789639891,
|
|
"epoch": 0.8297142857142857,
|
|
"grad_norm": 7.84375,
|
|
"learning_rate": 3.589126774115949e-06,
|
|
"loss": 1.1048757553100585,
|
|
"mean_token_accuracy": 0.8161457117646933,
|
|
"num_tokens": 11711274.0,
|
|
"step": 3630
|
|
},
|
|
{
|
|
"entropy": 0.7809062311425805,
|
|
"epoch": 0.832,
|
|
"grad_norm": 7.03125,
|
|
"learning_rate": 3.5410151551599716e-06,
|
|
"loss": 1.116710090637207,
|
|
"mean_token_accuracy": 0.8137276962399482,
|
|
"num_tokens": 11742228.0,
|
|
"step": 3640
|
|
},
|
|
{
|
|
"entropy": 0.7451124029234052,
|
|
"epoch": 0.8342857142857143,
|
|
"grad_norm": 7.53125,
|
|
"learning_rate": 3.4929035362039937e-06,
|
|
"loss": 0.9379715919494629,
|
|
"mean_token_accuracy": 0.8171642825007439,
|
|
"num_tokens": 11773088.0,
|
|
"step": 3650
|
|
},
|
|
{
|
|
"entropy": 0.7952216092497111,
|
|
"epoch": 0.8365714285714285,
|
|
"grad_norm": 6.40625,
|
|
"learning_rate": 3.4447919172480153e-06,
|
|
"loss": 1.1145612716674804,
|
|
"mean_token_accuracy": 0.8073516443371773,
|
|
"num_tokens": 11805230.0,
|
|
"step": 3660
|
|
},
|
|
{
|
|
"entropy": 0.6641817208379507,
|
|
"epoch": 0.8388571428571429,
|
|
"grad_norm": 8.5625,
|
|
"learning_rate": 3.396680298292038e-06,
|
|
"loss": 0.8219084739685059,
|
|
"mean_token_accuracy": 0.8350592002272605,
|
|
"num_tokens": 11836944.0,
|
|
"step": 3670
|
|
},
|
|
{
|
|
"entropy": 0.8327237972058356,
|
|
"epoch": 0.8411428571428572,
|
|
"grad_norm": 7.90625,
|
|
"learning_rate": 3.34856867933606e-06,
|
|
"loss": 1.152987289428711,
|
|
"mean_token_accuracy": 0.8037018492817879,
|
|
"num_tokens": 11870633.0,
|
|
"step": 3680
|
|
},
|
|
{
|
|
"entropy": 0.7739829862490296,
|
|
"epoch": 0.8434285714285714,
|
|
"grad_norm": 7.6875,
|
|
"learning_rate": 3.3004570603800824e-06,
|
|
"loss": 1.0689297676086427,
|
|
"mean_token_accuracy": 0.8115721188485623,
|
|
"num_tokens": 11901509.0,
|
|
"step": 3690
|
|
},
|
|
{
|
|
"entropy": 0.7023711124435067,
|
|
"epoch": 0.8457142857142858,
|
|
"grad_norm": 7.09375,
|
|
"learning_rate": 3.252345441424104e-06,
|
|
"loss": 0.9941452980041504,
|
|
"mean_token_accuracy": 0.8265939429402351,
|
|
"num_tokens": 11931513.0,
|
|
"step": 3700
|
|
},
|
|
{
|
|
"entropy": 0.8765215444844217,
|
|
"epoch": 0.848,
|
|
"grad_norm": 7.75,
|
|
"learning_rate": 3.204233822468126e-06,
|
|
"loss": 1.1260786056518555,
|
|
"mean_token_accuracy": 0.7915762890130281,
|
|
"num_tokens": 11964449.0,
|
|
"step": 3710
|
|
},
|
|
{
|
|
"entropy": 0.8084148010239005,
|
|
"epoch": 0.8502857142857143,
|
|
"grad_norm": 6.84375,
|
|
"learning_rate": 3.1561222035121486e-06,
|
|
"loss": 1.1048534393310547,
|
|
"mean_token_accuracy": 0.8068965047597885,
|
|
"num_tokens": 11994053.0,
|
|
"step": 3720
|
|
},
|
|
{
|
|
"entropy": 0.8611850501969457,
|
|
"epoch": 0.8525714285714285,
|
|
"grad_norm": 6.6875,
|
|
"learning_rate": 3.1080105845561703e-06,
|
|
"loss": 1.1287246704101563,
|
|
"mean_token_accuracy": 0.7991515025496483,
|
|
"num_tokens": 12027638.0,
|
|
"step": 3730
|
|
},
|
|
{
|
|
"entropy": 0.6358927502296865,
|
|
"epoch": 0.8548571428571429,
|
|
"grad_norm": 7.0,
|
|
"learning_rate": 3.059898965600193e-06,
|
|
"loss": 0.9071885108947754,
|
|
"mean_token_accuracy": 0.8444961465895175,
|
|
"num_tokens": 12062607.0,
|
|
"step": 3740
|
|
},
|
|
{
|
|
"entropy": 0.8599010735284537,
|
|
"epoch": 0.8571428571428571,
|
|
"grad_norm": 6.5,
|
|
"learning_rate": 3.011787346644215e-06,
|
|
"loss": 1.148247241973877,
|
|
"mean_token_accuracy": 0.7988054849207401,
|
|
"num_tokens": 12093334.0,
|
|
"step": 3750
|
|
},
|
|
{
|
|
"entropy": 0.749000935535878,
|
|
"epoch": 0.8594285714285714,
|
|
"grad_norm": 6.90625,
|
|
"learning_rate": 2.9636757276882374e-06,
|
|
"loss": 1.0731889724731445,
|
|
"mean_token_accuracy": 0.8171209901571274,
|
|
"num_tokens": 12124493.0,
|
|
"step": 3760
|
|
},
|
|
{
|
|
"entropy": 0.6133915192447603,
|
|
"epoch": 0.8617142857142858,
|
|
"grad_norm": 6.0,
|
|
"learning_rate": 2.915564108732259e-06,
|
|
"loss": 0.9234248161315918,
|
|
"mean_token_accuracy": 0.8530650399625301,
|
|
"num_tokens": 12160800.0,
|
|
"step": 3770
|
|
},
|
|
{
|
|
"entropy": 0.8550255595706403,
|
|
"epoch": 0.864,
|
|
"grad_norm": 7.40625,
|
|
"learning_rate": 2.867452489776281e-06,
|
|
"loss": 1.1787774085998535,
|
|
"mean_token_accuracy": 0.7914231061935425,
|
|
"num_tokens": 12189992.0,
|
|
"step": 3780
|
|
},
|
|
{
|
|
"entropy": 0.854400450270623,
|
|
"epoch": 0.8662857142857143,
|
|
"grad_norm": 6.5625,
|
|
"learning_rate": 2.8193408708203036e-06,
|
|
"loss": 1.1640611648559571,
|
|
"mean_token_accuracy": 0.8066024430096149,
|
|
"num_tokens": 12224329.0,
|
|
"step": 3790
|
|
},
|
|
{
|
|
"entropy": 0.8460091168992221,
|
|
"epoch": 0.8685714285714285,
|
|
"grad_norm": 6.96875,
|
|
"learning_rate": 2.7712292518643253e-06,
|
|
"loss": 1.1152153015136719,
|
|
"mean_token_accuracy": 0.806992469727993,
|
|
"num_tokens": 12257176.0,
|
|
"step": 3800
|
|
},
|
|
{
|
|
"entropy": 0.7765115794725717,
|
|
"epoch": 0.8708571428571429,
|
|
"grad_norm": 7.1875,
|
|
"learning_rate": 2.7231176329083474e-06,
|
|
"loss": 1.0872262954711913,
|
|
"mean_token_accuracy": 0.813801209628582,
|
|
"num_tokens": 12290364.0,
|
|
"step": 3810
|
|
},
|
|
{
|
|
"entropy": 0.7125355136580765,
|
|
"epoch": 0.8731428571428571,
|
|
"grad_norm": 6.3125,
|
|
"learning_rate": 2.67500601395237e-06,
|
|
"loss": 0.9770938873291015,
|
|
"mean_token_accuracy": 0.8250508345663548,
|
|
"num_tokens": 12325455.0,
|
|
"step": 3820
|
|
},
|
|
{
|
|
"entropy": 0.7758281454443932,
|
|
"epoch": 0.8754285714285714,
|
|
"grad_norm": 7.625,
|
|
"learning_rate": 2.626894394996392e-06,
|
|
"loss": 1.130514430999756,
|
|
"mean_token_accuracy": 0.8151266768574714,
|
|
"num_tokens": 12358823.0,
|
|
"step": 3830
|
|
},
|
|
{
|
|
"entropy": 0.7530996017158031,
|
|
"epoch": 0.8777142857142857,
|
|
"grad_norm": 7.6875,
|
|
"learning_rate": 2.578782776040414e-06,
|
|
"loss": 1.056538200378418,
|
|
"mean_token_accuracy": 0.8141079384833574,
|
|
"num_tokens": 12392420.0,
|
|
"step": 3840
|
|
},
|
|
{
|
|
"entropy": 0.582604228099808,
|
|
"epoch": 0.88,
|
|
"grad_norm": 8.3125,
|
|
"learning_rate": 2.530671157084436e-06,
|
|
"loss": 0.8646469116210938,
|
|
"mean_token_accuracy": 0.850695987790823,
|
|
"num_tokens": 12424048.0,
|
|
"step": 3850
|
|
},
|
|
{
|
|
"entropy": 0.8167831319384277,
|
|
"epoch": 0.8822857142857143,
|
|
"grad_norm": 7.09375,
|
|
"learning_rate": 2.482559538128458e-06,
|
|
"loss": 1.1348252296447754,
|
|
"mean_token_accuracy": 0.8092688016593457,
|
|
"num_tokens": 12455436.0,
|
|
"step": 3860
|
|
},
|
|
{
|
|
"entropy": 0.8215475841425359,
|
|
"epoch": 0.8845714285714286,
|
|
"grad_norm": 7.4375,
|
|
"learning_rate": 2.4344479191724803e-06,
|
|
"loss": 1.1215962409973144,
|
|
"mean_token_accuracy": 0.8079402819275856,
|
|
"num_tokens": 12489334.0,
|
|
"step": 3870
|
|
},
|
|
{
|
|
"entropy": 0.7927017042413353,
|
|
"epoch": 0.8868571428571429,
|
|
"grad_norm": 7.28125,
|
|
"learning_rate": 2.3863363002165024e-06,
|
|
"loss": 1.0800617218017579,
|
|
"mean_token_accuracy": 0.8097000844776631,
|
|
"num_tokens": 12522105.0,
|
|
"step": 3880
|
|
},
|
|
{
|
|
"entropy": 0.8486208325251937,
|
|
"epoch": 0.8891428571428571,
|
|
"grad_norm": 7.0,
|
|
"learning_rate": 2.338224681260525e-06,
|
|
"loss": 1.125669288635254,
|
|
"mean_token_accuracy": 0.7976283885538578,
|
|
"num_tokens": 12553195.0,
|
|
"step": 3890
|
|
},
|
|
{
|
|
"entropy": 0.8716784932184964,
|
|
"epoch": 0.8914285714285715,
|
|
"grad_norm": 6.96875,
|
|
"learning_rate": 2.2901130623045465e-06,
|
|
"loss": 1.1960984230041505,
|
|
"mean_token_accuracy": 0.7935221865773201,
|
|
"num_tokens": 12585132.0,
|
|
"step": 3900
|
|
},
|
|
{
|
|
"entropy": 0.8773073226213455,
|
|
"epoch": 0.8937142857142857,
|
|
"grad_norm": 8.6875,
|
|
"learning_rate": 2.2420014433485686e-06,
|
|
"loss": 1.166949462890625,
|
|
"mean_token_accuracy": 0.7921496272087097,
|
|
"num_tokens": 12620190.0,
|
|
"step": 3910
|
|
},
|
|
{
|
|
"entropy": 0.8945854822173714,
|
|
"epoch": 0.896,
|
|
"grad_norm": 7.90625,
|
|
"learning_rate": 2.193889824392591e-06,
|
|
"loss": 1.20922908782959,
|
|
"mean_token_accuracy": 0.7929078787565231,
|
|
"num_tokens": 12652043.0,
|
|
"step": 3920
|
|
},
|
|
{
|
|
"entropy": 0.7110437804833054,
|
|
"epoch": 0.8982857142857142,
|
|
"grad_norm": 7.4375,
|
|
"learning_rate": 2.145778205436613e-06,
|
|
"loss": 0.9799498558044434,
|
|
"mean_token_accuracy": 0.8256872028112412,
|
|
"num_tokens": 12686506.0,
|
|
"step": 3930
|
|
},
|
|
{
|
|
"entropy": 0.8520329046063125,
|
|
"epoch": 0.9005714285714286,
|
|
"grad_norm": 7.84375,
|
|
"learning_rate": 2.0976665864806353e-06,
|
|
"loss": 1.1127940177917481,
|
|
"mean_token_accuracy": 0.7984279960393905,
|
|
"num_tokens": 12717624.0,
|
|
"step": 3940
|
|
},
|
|
{
|
|
"entropy": 0.7722635400481522,
|
|
"epoch": 0.9028571428571428,
|
|
"grad_norm": 6.96875,
|
|
"learning_rate": 2.0495549675246573e-06,
|
|
"loss": 1.031348705291748,
|
|
"mean_token_accuracy": 0.8082475580275059,
|
|
"num_tokens": 12751004.0,
|
|
"step": 3950
|
|
},
|
|
{
|
|
"entropy": 0.8996719061397016,
|
|
"epoch": 0.9051428571428571,
|
|
"grad_norm": 9.0,
|
|
"learning_rate": 2.0014433485686794e-06,
|
|
"loss": 1.2313031196594237,
|
|
"mean_token_accuracy": 0.7899208262562751,
|
|
"num_tokens": 12784386.0,
|
|
"step": 3960
|
|
},
|
|
{
|
|
"entropy": 0.8467463178560137,
|
|
"epoch": 0.9074285714285715,
|
|
"grad_norm": 6.3125,
|
|
"learning_rate": 1.9533317296127015e-06,
|
|
"loss": 1.1081655502319336,
|
|
"mean_token_accuracy": 0.7957226369529963,
|
|
"num_tokens": 12813355.0,
|
|
"step": 3970
|
|
},
|
|
{
|
|
"entropy": 0.8022918193601072,
|
|
"epoch": 0.9097142857142857,
|
|
"grad_norm": 7.90625,
|
|
"learning_rate": 1.9052201106567236e-06,
|
|
"loss": 1.0847484588623046,
|
|
"mean_token_accuracy": 0.8091882210224867,
|
|
"num_tokens": 12846173.0,
|
|
"step": 3980
|
|
},
|
|
{
|
|
"entropy": 0.7512643322348594,
|
|
"epoch": 0.912,
|
|
"grad_norm": 7.34375,
|
|
"learning_rate": 1.8571084917007459e-06,
|
|
"loss": 1.0247625350952148,
|
|
"mean_token_accuracy": 0.8154100321233273,
|
|
"num_tokens": 12879534.0,
|
|
"step": 3990
|
|
},
|
|
{
|
|
"entropy": 0.8367441557347775,
|
|
"epoch": 0.9142857142857143,
|
|
"grad_norm": 7.15625,
|
|
"learning_rate": 1.808996872744768e-06,
|
|
"loss": 1.2222256660461426,
|
|
"mean_token_accuracy": 0.8002955429255962,
|
|
"num_tokens": 12907935.0,
|
|
"step": 4000
|
|
},
|
|
{
|
|
"entropy": 0.849480548966676,
|
|
"epoch": 0.9165714285714286,
|
|
"grad_norm": 7.25,
|
|
"learning_rate": 1.7608852537887902e-06,
|
|
"loss": 1.1237051963806153,
|
|
"mean_token_accuracy": 0.7980944596230983,
|
|
"num_tokens": 12939436.0,
|
|
"step": 4010
|
|
},
|
|
{
|
|
"entropy": 0.7073171893134713,
|
|
"epoch": 0.9188571428571428,
|
|
"grad_norm": 7.6875,
|
|
"learning_rate": 1.7127736348328123e-06,
|
|
"loss": 1.0514840126037597,
|
|
"mean_token_accuracy": 0.8278530709445476,
|
|
"num_tokens": 12968488.0,
|
|
"step": 4020
|
|
},
|
|
{
|
|
"entropy": 0.7504108159802854,
|
|
"epoch": 0.9211428571428572,
|
|
"grad_norm": 7.96875,
|
|
"learning_rate": 1.6646620158768346e-06,
|
|
"loss": 1.0060768127441406,
|
|
"mean_token_accuracy": 0.8199899084866047,
|
|
"num_tokens": 13002635.0,
|
|
"step": 4030
|
|
},
|
|
{
|
|
"entropy": 0.906342108361423,
|
|
"epoch": 0.9234285714285714,
|
|
"grad_norm": 6.84375,
|
|
"learning_rate": 1.6165503969208565e-06,
|
|
"loss": 1.2012577056884766,
|
|
"mean_token_accuracy": 0.7861776262521744,
|
|
"num_tokens": 13034904.0,
|
|
"step": 4040
|
|
},
|
|
{
|
|
"entropy": 0.8890602920204401,
|
|
"epoch": 0.9257142857142857,
|
|
"grad_norm": 7.09375,
|
|
"learning_rate": 1.5684387779648786e-06,
|
|
"loss": 1.1589385986328125,
|
|
"mean_token_accuracy": 0.7936351835727692,
|
|
"num_tokens": 13064519.0,
|
|
"step": 4050
|
|
},
|
|
{
|
|
"entropy": 0.8940521791577339,
|
|
"epoch": 0.928,
|
|
"grad_norm": 7.53125,
|
|
"learning_rate": 1.5203271590089009e-06,
|
|
"loss": 1.1503165245056153,
|
|
"mean_token_accuracy": 0.7895523980259895,
|
|
"num_tokens": 13098510.0,
|
|
"step": 4060
|
|
},
|
|
{
|
|
"entropy": 0.6112047893926501,
|
|
"epoch": 0.9302857142857143,
|
|
"grad_norm": 9.1875,
|
|
"learning_rate": 1.4722155400529227e-06,
|
|
"loss": 0.8700815200805664,
|
|
"mean_token_accuracy": 0.852671717107296,
|
|
"num_tokens": 13132618.0,
|
|
"step": 4070
|
|
},
|
|
{
|
|
"entropy": 0.7455820512957871,
|
|
"epoch": 0.9325714285714286,
|
|
"grad_norm": 6.96875,
|
|
"learning_rate": 1.424103921096945e-06,
|
|
"loss": 0.9891318321228028,
|
|
"mean_token_accuracy": 0.8168230719864369,
|
|
"num_tokens": 13161914.0,
|
|
"step": 4080
|
|
},
|
|
{
|
|
"entropy": 0.8070791523903609,
|
|
"epoch": 0.9348571428571428,
|
|
"grad_norm": 7.34375,
|
|
"learning_rate": 1.375992302140967e-06,
|
|
"loss": 1.1282638549804687,
|
|
"mean_token_accuracy": 0.8067759692668914,
|
|
"num_tokens": 13189053.0,
|
|
"step": 4090
|
|
},
|
|
{
|
|
"entropy": 0.8544201260432601,
|
|
"epoch": 0.9371428571428572,
|
|
"grad_norm": 7.34375,
|
|
"learning_rate": 1.3278806831849894e-06,
|
|
"loss": 1.2156527519226075,
|
|
"mean_token_accuracy": 0.8019159339368344,
|
|
"num_tokens": 13219478.0,
|
|
"step": 4100
|
|
},
|
|
{
|
|
"entropy": 0.8153353109024465,
|
|
"epoch": 0.9394285714285714,
|
|
"grad_norm": 7.84375,
|
|
"learning_rate": 1.2797690642290115e-06,
|
|
"loss": 1.0747637748718262,
|
|
"mean_token_accuracy": 0.8093126803636551,
|
|
"num_tokens": 13254616.0,
|
|
"step": 4110
|
|
},
|
|
{
|
|
"entropy": 0.7539664410986007,
|
|
"epoch": 0.9417142857142857,
|
|
"grad_norm": 7.78125,
|
|
"learning_rate": 1.2316574452730336e-06,
|
|
"loss": 1.0411237716674804,
|
|
"mean_token_accuracy": 0.8247020401060581,
|
|
"num_tokens": 13286977.0,
|
|
"step": 4120
|
|
},
|
|
{
|
|
"entropy": 0.7033959114924073,
|
|
"epoch": 0.944,
|
|
"grad_norm": 7.28125,
|
|
"learning_rate": 1.1835458263170556e-06,
|
|
"loss": 0.9389317512512207,
|
|
"mean_token_accuracy": 0.8293626546859741,
|
|
"num_tokens": 13320518.0,
|
|
"step": 4130
|
|
},
|
|
{
|
|
"entropy": 0.8039538188837468,
|
|
"epoch": 0.9462857142857143,
|
|
"grad_norm": 7.34375,
|
|
"learning_rate": 1.1354342073610777e-06,
|
|
"loss": 1.0717804908752442,
|
|
"mean_token_accuracy": 0.8100807063281537,
|
|
"num_tokens": 13349708.0,
|
|
"step": 4140
|
|
},
|
|
{
|
|
"entropy": 0.6700900404714047,
|
|
"epoch": 0.9485714285714286,
|
|
"grad_norm": 5.40625,
|
|
"learning_rate": 1.0873225884050998e-06,
|
|
"loss": 0.8449858665466309,
|
|
"mean_token_accuracy": 0.8380967788398266,
|
|
"num_tokens": 13382386.0,
|
|
"step": 4150
|
|
},
|
|
{
|
|
"entropy": 0.7454655093140901,
|
|
"epoch": 0.9508571428571428,
|
|
"grad_norm": 8.1875,
|
|
"learning_rate": 1.039210969449122e-06,
|
|
"loss": 1.0423049926757812,
|
|
"mean_token_accuracy": 0.8296139296144247,
|
|
"num_tokens": 13415633.0,
|
|
"step": 4160
|
|
},
|
|
{
|
|
"entropy": 0.651054497435689,
|
|
"epoch": 0.9531428571428572,
|
|
"grad_norm": 7.46875,
|
|
"learning_rate": 9.910993504931442e-07,
|
|
"loss": 0.9426624298095703,
|
|
"mean_token_accuracy": 0.8385513253509999,
|
|
"num_tokens": 13447710.0,
|
|
"step": 4170
|
|
},
|
|
{
|
|
"entropy": 0.8339191220700741,
|
|
"epoch": 0.9554285714285714,
|
|
"grad_norm": 9.0625,
|
|
"learning_rate": 9.429877315371664e-07,
|
|
"loss": 1.211918830871582,
|
|
"mean_token_accuracy": 0.801718657463789,
|
|
"num_tokens": 13477514.0,
|
|
"step": 4180
|
|
},
|
|
{
|
|
"entropy": 0.8227419966831804,
|
|
"epoch": 0.9577142857142857,
|
|
"grad_norm": 7.09375,
|
|
"learning_rate": 8.948761125811884e-07,
|
|
"loss": 1.0787554740905763,
|
|
"mean_token_accuracy": 0.8115898109972477,
|
|
"num_tokens": 13512089.0,
|
|
"step": 4190
|
|
},
|
|
{
|
|
"entropy": 0.8163104236125946,
|
|
"epoch": 0.96,
|
|
"grad_norm": 5.71875,
|
|
"learning_rate": 8.467644936252106e-07,
|
|
"loss": 1.0611876487731933,
|
|
"mean_token_accuracy": 0.8015380769968032,
|
|
"num_tokens": 13545584.0,
|
|
"step": 4200
|
|
},
|
|
{
|
|
"entropy": 0.7111412956379354,
|
|
"epoch": 0.9622857142857143,
|
|
"grad_norm": 7.40625,
|
|
"learning_rate": 7.986528746692326e-07,
|
|
"loss": 0.9729216575622559,
|
|
"mean_token_accuracy": 0.8238789007067681,
|
|
"num_tokens": 13578776.0,
|
|
"step": 4210
|
|
},
|
|
{
|
|
"entropy": 0.8085635328665376,
|
|
"epoch": 0.9645714285714285,
|
|
"grad_norm": 7.5,
|
|
"learning_rate": 7.505412557132548e-07,
|
|
"loss": 1.1126985549926758,
|
|
"mean_token_accuracy": 0.8126947581768036,
|
|
"num_tokens": 13612547.0,
|
|
"step": 4220
|
|
},
|
|
{
|
|
"entropy": 0.7815977847203612,
|
|
"epoch": 0.9668571428571429,
|
|
"grad_norm": 8.125,
|
|
"learning_rate": 7.02429636757277e-07,
|
|
"loss": 1.1313226699829102,
|
|
"mean_token_accuracy": 0.809683870524168,
|
|
"num_tokens": 13643015.0,
|
|
"step": 4230
|
|
},
|
|
{
|
|
"entropy": 0.7985246267169714,
|
|
"epoch": 0.9691428571428572,
|
|
"grad_norm": 9.1875,
|
|
"learning_rate": 6.54318017801299e-07,
|
|
"loss": 1.0159822463989259,
|
|
"mean_token_accuracy": 0.8185107290744782,
|
|
"num_tokens": 13675162.0,
|
|
"step": 4240
|
|
},
|
|
{
|
|
"entropy": 0.671059988765046,
|
|
"epoch": 0.9714285714285714,
|
|
"grad_norm": 8.0625,
|
|
"learning_rate": 6.062063988453211e-07,
|
|
"loss": 0.9259526252746582,
|
|
"mean_token_accuracy": 0.8424249842762948,
|
|
"num_tokens": 13710886.0,
|
|
"step": 4250
|
|
},
|
|
{
|
|
"entropy": 0.7151353804394602,
|
|
"epoch": 0.9737142857142858,
|
|
"grad_norm": 7.03125,
|
|
"learning_rate": 5.580947798893433e-07,
|
|
"loss": 0.9961103439331055,
|
|
"mean_token_accuracy": 0.8268160626292229,
|
|
"num_tokens": 13747143.0,
|
|
"step": 4260
|
|
},
|
|
{
|
|
"entropy": 0.825507890433073,
|
|
"epoch": 0.976,
|
|
"grad_norm": 8.4375,
|
|
"learning_rate": 5.099831609333655e-07,
|
|
"loss": 1.116166591644287,
|
|
"mean_token_accuracy": 0.8088098622858524,
|
|
"num_tokens": 13779619.0,
|
|
"step": 4270
|
|
},
|
|
{
|
|
"entropy": 0.8729933000169694,
|
|
"epoch": 0.9782857142857143,
|
|
"grad_norm": 7.5625,
|
|
"learning_rate": 4.618715419773876e-07,
|
|
"loss": 1.1322175025939942,
|
|
"mean_token_accuracy": 0.7934217296540738,
|
|
"num_tokens": 13812123.0,
|
|
"step": 4280
|
|
},
|
|
{
|
|
"entropy": 0.739137639477849,
|
|
"epoch": 0.9805714285714285,
|
|
"grad_norm": 8.4375,
|
|
"learning_rate": 4.1375992302140966e-07,
|
|
"loss": 1.0004518508911133,
|
|
"mean_token_accuracy": 0.8218909092247486,
|
|
"num_tokens": 13844075.0,
|
|
"step": 4290
|
|
},
|
|
{
|
|
"entropy": 0.8571365299634636,
|
|
"epoch": 0.9828571428571429,
|
|
"grad_norm": 8.375,
|
|
"learning_rate": 3.6564830406543185e-07,
|
|
"loss": 1.1517833709716796,
|
|
"mean_token_accuracy": 0.7975596848875284,
|
|
"num_tokens": 13874945.0,
|
|
"step": 4300
|
|
},
|
|
{
|
|
"entropy": 0.8440510330721736,
|
|
"epoch": 0.9851428571428571,
|
|
"grad_norm": 8.5,
|
|
"learning_rate": 3.17536685109454e-07,
|
|
"loss": 1.165059471130371,
|
|
"mean_token_accuracy": 0.8028948895633221,
|
|
"num_tokens": 13906888.0,
|
|
"step": 4310
|
|
},
|
|
{
|
|
"entropy": 0.839153022505343,
|
|
"epoch": 0.9874285714285714,
|
|
"grad_norm": 7.5,
|
|
"learning_rate": 2.694250661534761e-07,
|
|
"loss": 1.0769323348999023,
|
|
"mean_token_accuracy": 0.801658408343792,
|
|
"num_tokens": 13942830.0,
|
|
"step": 4320
|
|
},
|
|
{
|
|
"entropy": 0.7648129913024604,
|
|
"epoch": 0.9897142857142858,
|
|
"grad_norm": 11.9375,
|
|
"learning_rate": 2.2131344719749822e-07,
|
|
"loss": 1.0284333229064941,
|
|
"mean_token_accuracy": 0.8126491412520409,
|
|
"num_tokens": 13975429.0,
|
|
"step": 4330
|
|
},
|
|
{
|
|
"entropy": 0.7054416437633335,
|
|
"epoch": 0.992,
|
|
"grad_norm": 6.625,
|
|
"learning_rate": 1.7320182824152033e-07,
|
|
"loss": 0.9879807472229004,
|
|
"mean_token_accuracy": 0.834271340072155,
|
|
"num_tokens": 14007911.0,
|
|
"step": 4340
|
|
},
|
|
{
|
|
"entropy": 0.5742446383461356,
|
|
"epoch": 0.9942857142857143,
|
|
"grad_norm": 6.8125,
|
|
"learning_rate": 1.2509020928554246e-07,
|
|
"loss": 0.8198482513427734,
|
|
"mean_token_accuracy": 0.8546571791172027,
|
|
"num_tokens": 14041386.0,
|
|
"step": 4350
|
|
},
|
|
{
|
|
"entropy": 0.8128698419779539,
|
|
"epoch": 0.9965714285714286,
|
|
"grad_norm": 6.78125,
|
|
"learning_rate": 7.69785903295646e-08,
|
|
"loss": 1.0970548629760741,
|
|
"mean_token_accuracy": 0.8060387209057808,
|
|
"num_tokens": 14074136.0,
|
|
"step": 4360
|
|
},
|
|
{
|
|
"entropy": 0.7844365012831986,
|
|
"epoch": 0.9988571428571429,
|
|
"grad_norm": 8.0625,
|
|
"learning_rate": 2.8866971373586724e-08,
|
|
"loss": 1.0246350288391113,
|
|
"mean_token_accuracy": 0.8180203422904014,
|
|
"num_tokens": 14106425.0,
|
|
"step": 4370
|
|
}
|
|
],
|
|
"logging_steps": 10,
|
|
"max_steps": 4375,
|
|
"num_input_tokens_seen": 0,
|
|
"num_train_epochs": 1,
|
|
"save_steps": 500,
|
|
"stateful_callbacks": {
|
|
"TrainerControl": {
|
|
"args": {
|
|
"should_epoch_stop": false,
|
|
"should_evaluate": false,
|
|
"should_log": false,
|
|
"should_save": true,
|
|
"should_training_stop": true
|
|
},
|
|
"attributes": {}
|
|
}
|
|
},
|
|
"total_flos": 1.602238427340718e+17,
|
|
"train_batch_size": 2,
|
|
"trial_name": null,
|
|
"trial_params": null
|
|
}
|