Files
general_knowledge_model/checkpoint-4375/trainer_state.json
ModelHub XC e7f998cf6d 初始化项目,由ModelHub XC社区提供模型
Model: cs-552-2026-the-transformers/general_knowledge_model
Source: Original Platform
2026-07-20 05:53:10 +08:00

4405 lines
124 KiB
JSON

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 500,
"global_step": 4375,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 0.4608087057247758,
"epoch": 0.002285714285714286,
"grad_norm": 262.0,
"learning_rate": 8.256880733944956e-07,
"loss": 4.128694152832031,
"mean_token_accuracy": 0.5559752065688371,
"num_tokens": 30583.0,
"step": 10
},
{
"entropy": 0.4808954084292054,
"epoch": 0.004571428571428572,
"grad_norm": 208.0,
"learning_rate": 1.743119266055046e-06,
"loss": 4.0306652069091795,
"mean_token_accuracy": 0.5491989776492119,
"num_tokens": 64875.0,
"step": 20
},
{
"entropy": 0.4882832657545805,
"epoch": 0.006857142857142857,
"grad_norm": 88.0,
"learning_rate": 2.6605504587155968e-06,
"loss": 3.4539260864257812,
"mean_token_accuracy": 0.5994260810315609,
"num_tokens": 96479.0,
"step": 30
},
{
"entropy": 0.6207152051851154,
"epoch": 0.009142857142857144,
"grad_norm": 50.25,
"learning_rate": 3.5779816513761473e-06,
"loss": 3.065783882141113,
"mean_token_accuracy": 0.6057824719697237,
"num_tokens": 129267.0,
"step": 40
},
{
"entropy": 0.7509429801255465,
"epoch": 0.011428571428571429,
"grad_norm": 47.5,
"learning_rate": 4.4954128440366975e-06,
"loss": 2.414494514465332,
"mean_token_accuracy": 0.6280621752142906,
"num_tokens": 157969.0,
"step": 50
},
{
"entropy": 0.9442974735051394,
"epoch": 0.013714285714285714,
"grad_norm": 21.625,
"learning_rate": 5.412844036697248e-06,
"loss": 2.0897136688232423,
"mean_token_accuracy": 0.6582186311483383,
"num_tokens": 191753.0,
"step": 60
},
{
"entropy": 1.133295001834631,
"epoch": 0.016,
"grad_norm": 15.6875,
"learning_rate": 6.330275229357799e-06,
"loss": 1.9386701583862305,
"mean_token_accuracy": 0.6817213766276836,
"num_tokens": 224874.0,
"step": 70
},
{
"entropy": 1.161771859228611,
"epoch": 0.018285714285714287,
"grad_norm": 18.875,
"learning_rate": 7.247706422018349e-06,
"loss": 1.6953561782836915,
"mean_token_accuracy": 0.7058230180293321,
"num_tokens": 259557.0,
"step": 80
},
{
"entropy": 1.0966269705444573,
"epoch": 0.02057142857142857,
"grad_norm": 15.0625,
"learning_rate": 8.1651376146789e-06,
"loss": 1.4140602111816407,
"mean_token_accuracy": 0.7321123115718364,
"num_tokens": 290863.0,
"step": 90
},
{
"entropy": 1.0357405820861458,
"epoch": 0.022857142857142857,
"grad_norm": 16.75,
"learning_rate": 9.08256880733945e-06,
"loss": 1.3797801971435546,
"mean_token_accuracy": 0.7626342628151178,
"num_tokens": 324054.0,
"step": 100
},
{
"entropy": 0.9538093984127045,
"epoch": 0.025142857142857144,
"grad_norm": 11.75,
"learning_rate": 1e-05,
"loss": 1.3015310287475585,
"mean_token_accuracy": 0.7864577785134316,
"num_tokens": 358048.0,
"step": 110
},
{
"entropy": 0.931211198028177,
"epoch": 0.027428571428571427,
"grad_norm": 12.625,
"learning_rate": 1.091743119266055e-05,
"loss": 1.2297636985778808,
"mean_token_accuracy": 0.7865072574466467,
"num_tokens": 389056.0,
"step": 120
},
{
"entropy": 0.9721011022105813,
"epoch": 0.029714285714285714,
"grad_norm": 15.125,
"learning_rate": 1.1834862385321102e-05,
"loss": 1.3690268516540527,
"mean_token_accuracy": 0.7615244656801223,
"num_tokens": 422901.0,
"step": 130
},
{
"entropy": 1.0186741236597299,
"epoch": 0.032,
"grad_norm": 10.3125,
"learning_rate": 1.2752293577981652e-05,
"loss": 1.3675042152404786,
"mean_token_accuracy": 0.7797191683202982,
"num_tokens": 452506.0,
"step": 140
},
{
"entropy": 0.9464143239893019,
"epoch": 0.03428571428571429,
"grad_norm": 13.0625,
"learning_rate": 1.3669724770642203e-05,
"loss": 1.3897374153137207,
"mean_token_accuracy": 0.7744678042829036,
"num_tokens": 483811.0,
"step": 150
},
{
"entropy": 0.9546993720345199,
"epoch": 0.036571428571428574,
"grad_norm": 10.0625,
"learning_rate": 1.4587155963302753e-05,
"loss": 1.2690893173217774,
"mean_token_accuracy": 0.7874016337096691,
"num_tokens": 511576.0,
"step": 160
},
{
"entropy": 1.002905413042754,
"epoch": 0.038857142857142854,
"grad_norm": 9.75,
"learning_rate": 1.5504587155963304e-05,
"loss": 1.3503832817077637,
"mean_token_accuracy": 0.7721866790205241,
"num_tokens": 543265.0,
"step": 170
},
{
"entropy": 0.7613611572422088,
"epoch": 0.04114285714285714,
"grad_norm": 10.4375,
"learning_rate": 1.6422018348623852e-05,
"loss": 0.977170753479004,
"mean_token_accuracy": 0.8188995130360126,
"num_tokens": 576882.0,
"step": 180
},
{
"entropy": 0.9535474652424455,
"epoch": 0.04342857142857143,
"grad_norm": 10.5625,
"learning_rate": 1.7339449541284407e-05,
"loss": 1.2448718070983886,
"mean_token_accuracy": 0.7809058628976345,
"num_tokens": 612893.0,
"step": 190
},
{
"entropy": 0.8438695728778839,
"epoch": 0.045714285714285714,
"grad_norm": 8.625,
"learning_rate": 1.8256880733944955e-05,
"loss": 1.161054801940918,
"mean_token_accuracy": 0.810321356356144,
"num_tokens": 645362.0,
"step": 200
},
{
"entropy": 0.8822290134616196,
"epoch": 0.048,
"grad_norm": 10.5,
"learning_rate": 1.9174311926605506e-05,
"loss": 1.1970745086669923,
"mean_token_accuracy": 0.7906114481389522,
"num_tokens": 678993.0,
"step": 210
},
{
"entropy": 0.9281622164882719,
"epoch": 0.05028571428571429,
"grad_norm": 9.25,
"learning_rate": 1.9995188838104405e-05,
"loss": 1.2374305725097656,
"mean_token_accuracy": 0.7800474755465985,
"num_tokens": 714146.0,
"step": 220
},
{
"entropy": 1.06684466060251,
"epoch": 0.052571428571428575,
"grad_norm": 8.25,
"learning_rate": 1.9947077219148424e-05,
"loss": 1.3902817726135255,
"mean_token_accuracy": 0.7615161284804344,
"num_tokens": 747373.0,
"step": 230
},
{
"entropy": 0.9200185919180512,
"epoch": 0.054857142857142854,
"grad_norm": 11.5,
"learning_rate": 1.9898965600192447e-05,
"loss": 1.201821517944336,
"mean_token_accuracy": 0.7907239098101855,
"num_tokens": 780155.0,
"step": 240
},
{
"entropy": 0.7674560694023966,
"epoch": 0.05714285714285714,
"grad_norm": 10.1875,
"learning_rate": 1.985085398123647e-05,
"loss": 1.063106632232666,
"mean_token_accuracy": 0.8229942351579667,
"num_tokens": 814128.0,
"step": 250
},
{
"entropy": 1.0007737869396807,
"epoch": 0.05942857142857143,
"grad_norm": 12.125,
"learning_rate": 1.9802742362280492e-05,
"loss": 1.2750150680541992,
"mean_token_accuracy": 0.7728326875716448,
"num_tokens": 845910.0,
"step": 260
},
{
"entropy": 0.9125091641210019,
"epoch": 0.061714285714285715,
"grad_norm": 10.125,
"learning_rate": 1.9754630743324514e-05,
"loss": 1.2319644927978515,
"mean_token_accuracy": 0.7889250412583351,
"num_tokens": 875424.0,
"step": 270
},
{
"entropy": 0.783863732777536,
"epoch": 0.064,
"grad_norm": 9.625,
"learning_rate": 1.9706519124368537e-05,
"loss": 1.1022482872009278,
"mean_token_accuracy": 0.8143158428370952,
"num_tokens": 912199.0,
"step": 280
},
{
"entropy": 0.7469094243831933,
"epoch": 0.06628571428571428,
"grad_norm": 9.0,
"learning_rate": 1.965840750541256e-05,
"loss": 1.012520694732666,
"mean_token_accuracy": 0.8163027696311473,
"num_tokens": 945467.0,
"step": 290
},
{
"entropy": 0.8857646442949771,
"epoch": 0.06857142857142857,
"grad_norm": 8.0625,
"learning_rate": 1.9610295886456582e-05,
"loss": 1.158743667602539,
"mean_token_accuracy": 0.7900811523199082,
"num_tokens": 975590.0,
"step": 300
},
{
"entropy": 0.909662488102913,
"epoch": 0.07085714285714285,
"grad_norm": 7.75,
"learning_rate": 1.9562184267500604e-05,
"loss": 1.2604731559753417,
"mean_token_accuracy": 0.7842940967530012,
"num_tokens": 1006723.0,
"step": 310
},
{
"entropy": 0.7755309957079589,
"epoch": 0.07314285714285715,
"grad_norm": 7.96875,
"learning_rate": 1.9514072648544624e-05,
"loss": 1.0989351272583008,
"mean_token_accuracy": 0.8179159574210644,
"num_tokens": 1039345.0,
"step": 320
},
{
"entropy": 0.6633960926905275,
"epoch": 0.07542857142857143,
"grad_norm": 8.75,
"learning_rate": 1.9465961029588646e-05,
"loss": 0.9405019760131836,
"mean_token_accuracy": 0.8347477428615093,
"num_tokens": 1072231.0,
"step": 330
},
{
"entropy": 0.7519668426364661,
"epoch": 0.07771428571428571,
"grad_norm": 11.125,
"learning_rate": 1.941784941063267e-05,
"loss": 1.120675754547119,
"mean_token_accuracy": 0.8173437312245369,
"num_tokens": 1107977.0,
"step": 340
},
{
"entropy": 0.8688408816233277,
"epoch": 0.08,
"grad_norm": 7.53125,
"learning_rate": 1.936973779167669e-05,
"loss": 1.137878131866455,
"mean_token_accuracy": 0.8090878508985042,
"num_tokens": 1137182.0,
"step": 350
},
{
"entropy": 0.7986814582720398,
"epoch": 0.08228571428571428,
"grad_norm": 8.0625,
"learning_rate": 1.9321626172720714e-05,
"loss": 1.0986030578613282,
"mean_token_accuracy": 0.8076537061482668,
"num_tokens": 1171297.0,
"step": 360
},
{
"entropy": 0.7295990631915629,
"epoch": 0.08457142857142858,
"grad_norm": 9.1875,
"learning_rate": 1.9273514553764736e-05,
"loss": 1.0371208190917969,
"mean_token_accuracy": 0.8235810197889805,
"num_tokens": 1203878.0,
"step": 370
},
{
"entropy": 0.7101914969272911,
"epoch": 0.08685714285714285,
"grad_norm": 8.5625,
"learning_rate": 1.922540293480876e-05,
"loss": 0.9649307250976562,
"mean_token_accuracy": 0.8310844466090203,
"num_tokens": 1238543.0,
"step": 380
},
{
"entropy": 0.8718695783987641,
"epoch": 0.08914285714285715,
"grad_norm": 9.0625,
"learning_rate": 1.917729131585278e-05,
"loss": 1.1625357627868653,
"mean_token_accuracy": 0.8035985276103019,
"num_tokens": 1269739.0,
"step": 390
},
{
"entropy": 0.7572122471407056,
"epoch": 0.09142857142857143,
"grad_norm": 7.375,
"learning_rate": 1.9129179696896804e-05,
"loss": 1.0944371223449707,
"mean_token_accuracy": 0.8201560072600842,
"num_tokens": 1300389.0,
"step": 400
},
{
"entropy": 0.7699693274684251,
"epoch": 0.09371428571428571,
"grad_norm": 7.5625,
"learning_rate": 1.9081068077940826e-05,
"loss": 1.1060125350952148,
"mean_token_accuracy": 0.8187883667647838,
"num_tokens": 1332082.0,
"step": 410
},
{
"entropy": 0.7879621520638466,
"epoch": 0.096,
"grad_norm": 7.125,
"learning_rate": 1.9032956458984845e-05,
"loss": 1.0424601554870605,
"mean_token_accuracy": 0.8205794245004654,
"num_tokens": 1365790.0,
"step": 420
},
{
"entropy": 0.7572797378525138,
"epoch": 0.09828571428571428,
"grad_norm": 7.34375,
"learning_rate": 1.8984844840028868e-05,
"loss": 1.078255844116211,
"mean_token_accuracy": 0.8151584453880787,
"num_tokens": 1400056.0,
"step": 430
},
{
"entropy": 0.7952604771591723,
"epoch": 0.10057142857142858,
"grad_norm": 7.375,
"learning_rate": 1.893673322107289e-05,
"loss": 1.105555820465088,
"mean_token_accuracy": 0.8153948955237865,
"num_tokens": 1430264.0,
"step": 440
},
{
"entropy": 0.8230121753178536,
"epoch": 0.10285714285714286,
"grad_norm": 7.125,
"learning_rate": 1.8888621602116913e-05,
"loss": 1.0710087776184083,
"mean_token_accuracy": 0.8046157158911228,
"num_tokens": 1461481.0,
"step": 450
},
{
"entropy": 0.9548539834097027,
"epoch": 0.10514285714285715,
"grad_norm": 7.09375,
"learning_rate": 1.8840509983160935e-05,
"loss": 1.240159511566162,
"mean_token_accuracy": 0.7864300020039081,
"num_tokens": 1493711.0,
"step": 460
},
{
"entropy": 1.0574401247315108,
"epoch": 0.10742857142857143,
"grad_norm": 7.90625,
"learning_rate": 1.8792398364204958e-05,
"loss": 1.345158290863037,
"mean_token_accuracy": 0.7603430174291134,
"num_tokens": 1526418.0,
"step": 470
},
{
"entropy": 0.8240675249136984,
"epoch": 0.10971428571428571,
"grad_norm": 7.65625,
"learning_rate": 1.874428674524898e-05,
"loss": 1.0730896949768067,
"mean_token_accuracy": 0.8100373946130276,
"num_tokens": 1558046.0,
"step": 480
},
{
"entropy": 0.8802061447873711,
"epoch": 0.112,
"grad_norm": 7.84375,
"learning_rate": 1.8696175126293003e-05,
"loss": 1.145187759399414,
"mean_token_accuracy": 0.7953318640589714,
"num_tokens": 1586212.0,
"step": 490
},
{
"entropy": 0.7748386798426509,
"epoch": 0.11428571428571428,
"grad_norm": 7.625,
"learning_rate": 1.8648063507337025e-05,
"loss": 0.9954061508178711,
"mean_token_accuracy": 0.8151729434728623,
"num_tokens": 1622364.0,
"step": 500
},
{
"entropy": 0.7383366953581572,
"epoch": 0.11657142857142858,
"grad_norm": 8.75,
"learning_rate": 1.8599951888381044e-05,
"loss": 0.9818957328796387,
"mean_token_accuracy": 0.8187249258160592,
"num_tokens": 1655806.0,
"step": 510
},
{
"entropy": 0.7778955462388695,
"epoch": 0.11885714285714286,
"grad_norm": 7.6875,
"learning_rate": 1.8551840269425067e-05,
"loss": 1.070115566253662,
"mean_token_accuracy": 0.8072714075446129,
"num_tokens": 1687198.0,
"step": 520
},
{
"entropy": 0.806643515639007,
"epoch": 0.12114285714285715,
"grad_norm": 8.5,
"learning_rate": 1.850372865046909e-05,
"loss": 1.1104951858520509,
"mean_token_accuracy": 0.8077441163361072,
"num_tokens": 1718591.0,
"step": 530
},
{
"entropy": 0.8236157631501555,
"epoch": 0.12342857142857143,
"grad_norm": 7.84375,
"learning_rate": 1.8455617031513112e-05,
"loss": 1.0954437255859375,
"mean_token_accuracy": 0.8092149019241333,
"num_tokens": 1750163.0,
"step": 540
},
{
"entropy": 0.9514989891089499,
"epoch": 0.12571428571428572,
"grad_norm": 8.0,
"learning_rate": 1.8407505412557134e-05,
"loss": 1.2232957839965821,
"mean_token_accuracy": 0.7788458302617073,
"num_tokens": 1783654.0,
"step": 550
},
{
"entropy": 0.8126472384203225,
"epoch": 0.128,
"grad_norm": 7.25,
"learning_rate": 1.8359393793601157e-05,
"loss": 1.1193376541137696,
"mean_token_accuracy": 0.8038583904504776,
"num_tokens": 1818298.0,
"step": 560
},
{
"entropy": 0.7461063047870994,
"epoch": 0.13028571428571428,
"grad_norm": 10.125,
"learning_rate": 1.8311282174645176e-05,
"loss": 1.0971127510070802,
"mean_token_accuracy": 0.8208389431238174,
"num_tokens": 1852353.0,
"step": 570
},
{
"entropy": 0.8738343502394855,
"epoch": 0.13257142857142856,
"grad_norm": 7.78125,
"learning_rate": 1.8263170555689202e-05,
"loss": 1.1203450202941894,
"mean_token_accuracy": 0.7919381201267243,
"num_tokens": 1883233.0,
"step": 580
},
{
"entropy": 0.9372453663498164,
"epoch": 0.13485714285714287,
"grad_norm": 7.09375,
"learning_rate": 1.8215058936733224e-05,
"loss": 1.2445517539978028,
"mean_token_accuracy": 0.7886677496135235,
"num_tokens": 1914856.0,
"step": 590
},
{
"entropy": 0.922083193808794,
"epoch": 0.13714285714285715,
"grad_norm": 7.28125,
"learning_rate": 1.8166947317777243e-05,
"loss": 1.2312170028686524,
"mean_token_accuracy": 0.7963043257594109,
"num_tokens": 1944932.0,
"step": 600
},
{
"entropy": 0.885446681920439,
"epoch": 0.13942857142857143,
"grad_norm": 7.75,
"learning_rate": 1.8118835698821266e-05,
"loss": 1.1832991600036622,
"mean_token_accuracy": 0.7979222141206265,
"num_tokens": 1977483.0,
"step": 610
},
{
"entropy": 0.7927633517421782,
"epoch": 0.1417142857142857,
"grad_norm": 10.875,
"learning_rate": 1.807072407986529e-05,
"loss": 1.072523021697998,
"mean_token_accuracy": 0.8096244156360626,
"num_tokens": 2012646.0,
"step": 620
},
{
"entropy": 0.8450389008037746,
"epoch": 0.144,
"grad_norm": 8.5625,
"learning_rate": 1.802261246090931e-05,
"loss": 1.1467965126037598,
"mean_token_accuracy": 0.8004457049071789,
"num_tokens": 2044969.0,
"step": 630
},
{
"entropy": 0.9473820111714304,
"epoch": 0.1462857142857143,
"grad_norm": 7.8125,
"learning_rate": 1.7974500841953333e-05,
"loss": 1.2415997505187988,
"mean_token_accuracy": 0.7821900390088559,
"num_tokens": 2077063.0,
"step": 640
},
{
"entropy": 0.8002779926173389,
"epoch": 0.14857142857142858,
"grad_norm": 7.1875,
"learning_rate": 1.7926389222997356e-05,
"loss": 1.08231201171875,
"mean_token_accuracy": 0.8153595373034477,
"num_tokens": 2108559.0,
"step": 650
},
{
"entropy": 0.7409520236775279,
"epoch": 0.15085714285714286,
"grad_norm": 6.625,
"learning_rate": 1.7878277604041375e-05,
"loss": 1.0647228240966797,
"mean_token_accuracy": 0.8233258232474328,
"num_tokens": 2143996.0,
"step": 660
},
{
"entropy": 0.6605528288520872,
"epoch": 0.15314285714285714,
"grad_norm": 7.0,
"learning_rate": 1.7830165985085398e-05,
"loss": 0.8986818313598632,
"mean_token_accuracy": 0.8348655626177788,
"num_tokens": 2177219.0,
"step": 670
},
{
"entropy": 0.8855553255416453,
"epoch": 0.15542857142857142,
"grad_norm": 7.25,
"learning_rate": 1.7782054366129423e-05,
"loss": 1.2236814498901367,
"mean_token_accuracy": 0.7893378108739852,
"num_tokens": 2209056.0,
"step": 680
},
{
"entropy": 0.7778299384750426,
"epoch": 0.15771428571428572,
"grad_norm": 8.75,
"learning_rate": 1.7733942747173446e-05,
"loss": 1.1849853515625,
"mean_token_accuracy": 0.8148446299135685,
"num_tokens": 2241537.0,
"step": 690
},
{
"entropy": 0.9553269637282937,
"epoch": 0.16,
"grad_norm": 7.9375,
"learning_rate": 1.7685831128217465e-05,
"loss": 1.185690212249756,
"mean_token_accuracy": 0.7805978901684284,
"num_tokens": 2273475.0,
"step": 700
},
{
"entropy": 0.921497387625277,
"epoch": 0.16228571428571428,
"grad_norm": 7.65625,
"learning_rate": 1.7637719509261488e-05,
"loss": 1.1969280242919922,
"mean_token_accuracy": 0.7880251817405224,
"num_tokens": 2303700.0,
"step": 710
},
{
"entropy": 0.9623362662270665,
"epoch": 0.16457142857142856,
"grad_norm": 7.84375,
"learning_rate": 1.758960789030551e-05,
"loss": 1.2279460906982422,
"mean_token_accuracy": 0.7762100405991077,
"num_tokens": 2335528.0,
"step": 720
},
{
"entropy": 0.7501861874945461,
"epoch": 0.16685714285714287,
"grad_norm": 6.53125,
"learning_rate": 1.7541496271349533e-05,
"loss": 1.092702579498291,
"mean_token_accuracy": 0.8136215195059776,
"num_tokens": 2369322.0,
"step": 730
},
{
"entropy": 0.741880859900266,
"epoch": 0.16914285714285715,
"grad_norm": 9.1875,
"learning_rate": 1.7493384652393555e-05,
"loss": 1.0542023658752442,
"mean_token_accuracy": 0.8248877495527267,
"num_tokens": 2402789.0,
"step": 740
},
{
"entropy": 0.7251557628624141,
"epoch": 0.17142857142857143,
"grad_norm": 7.21875,
"learning_rate": 1.7445273033437578e-05,
"loss": 0.9859682083129883,
"mean_token_accuracy": 0.8190685380250216,
"num_tokens": 2435813.0,
"step": 750
},
{
"entropy": 0.8274217823520302,
"epoch": 0.1737142857142857,
"grad_norm": 7.8125,
"learning_rate": 1.7397161414481597e-05,
"loss": 1.1144951820373534,
"mean_token_accuracy": 0.8048250667750836,
"num_tokens": 2469061.0,
"step": 760
},
{
"entropy": 0.9110285563394427,
"epoch": 0.176,
"grad_norm": 7.9375,
"learning_rate": 1.7349049795525623e-05,
"loss": 1.2487107276916505,
"mean_token_accuracy": 0.7836838386952877,
"num_tokens": 2499540.0,
"step": 770
},
{
"entropy": 0.7952723279595375,
"epoch": 0.1782857142857143,
"grad_norm": 8.125,
"learning_rate": 1.7300938176569645e-05,
"loss": 1.1460785865783691,
"mean_token_accuracy": 0.8108866758644581,
"num_tokens": 2528841.0,
"step": 780
},
{
"entropy": 0.8681487245485187,
"epoch": 0.18057142857142858,
"grad_norm": 7.0625,
"learning_rate": 1.7252826557613664e-05,
"loss": 1.088980770111084,
"mean_token_accuracy": 0.7965113393962383,
"num_tokens": 2560120.0,
"step": 790
},
{
"entropy": 0.7640921414829791,
"epoch": 0.18285714285714286,
"grad_norm": 9.75,
"learning_rate": 1.7204714938657687e-05,
"loss": 1.1072608947753906,
"mean_token_accuracy": 0.81538320556283,
"num_tokens": 2592460.0,
"step": 800
},
{
"entropy": 0.8132671658881009,
"epoch": 0.18514285714285714,
"grad_norm": 7.1875,
"learning_rate": 1.715660331970171e-05,
"loss": 1.1375692367553711,
"mean_token_accuracy": 0.8027771405875683,
"num_tokens": 2628458.0,
"step": 810
},
{
"entropy": 0.71722816741094,
"epoch": 0.18742857142857142,
"grad_norm": 6.625,
"learning_rate": 1.7108491700745732e-05,
"loss": 0.9269392013549804,
"mean_token_accuracy": 0.8260728389024734,
"num_tokens": 2663216.0,
"step": 820
},
{
"entropy": 0.7395319850184023,
"epoch": 0.18971428571428572,
"grad_norm": 8.0625,
"learning_rate": 1.7060380081789754e-05,
"loss": 0.9782637596130371,
"mean_token_accuracy": 0.8158168852329254,
"num_tokens": 2695026.0,
"step": 830
},
{
"entropy": 0.7296101478859782,
"epoch": 0.192,
"grad_norm": 7.21875,
"learning_rate": 1.7012268462833777e-05,
"loss": 1.0164703369140624,
"mean_token_accuracy": 0.8283582173287869,
"num_tokens": 2727324.0,
"step": 840
},
{
"entropy": 0.8305218723602593,
"epoch": 0.19428571428571428,
"grad_norm": 8.0,
"learning_rate": 1.6964156843877796e-05,
"loss": 1.1646985054016112,
"mean_token_accuracy": 0.8054761447012424,
"num_tokens": 2759422.0,
"step": 850
},
{
"entropy": 0.8524466481991112,
"epoch": 0.19657142857142856,
"grad_norm": 8.25,
"learning_rate": 1.691604522492182e-05,
"loss": 1.1327482223510743,
"mean_token_accuracy": 0.8032685436308384,
"num_tokens": 2792518.0,
"step": 860
},
{
"entropy": 0.6850544813089072,
"epoch": 0.19885714285714284,
"grad_norm": 8.1875,
"learning_rate": 1.6867933605965844e-05,
"loss": 0.9866686820983886,
"mean_token_accuracy": 0.8292375847697258,
"num_tokens": 2826870.0,
"step": 870
},
{
"entropy": 0.7483350836671889,
"epoch": 0.20114285714285715,
"grad_norm": 9.3125,
"learning_rate": 1.6819821987009863e-05,
"loss": 1.0796706199645996,
"mean_token_accuracy": 0.8100242014974356,
"num_tokens": 2859320.0,
"step": 880
},
{
"entropy": 0.761015557963401,
"epoch": 0.20342857142857143,
"grad_norm": 7.65625,
"learning_rate": 1.6771710368053886e-05,
"loss": 1.0168207168579102,
"mean_token_accuracy": 0.8171908967196941,
"num_tokens": 2893696.0,
"step": 890
},
{
"entropy": 0.7136277809739113,
"epoch": 0.2057142857142857,
"grad_norm": 6.75,
"learning_rate": 1.672359874909791e-05,
"loss": 0.9646918296813964,
"mean_token_accuracy": 0.8310928396880627,
"num_tokens": 2925196.0,
"step": 900
},
{
"entropy": 0.8552220237441361,
"epoch": 0.208,
"grad_norm": 7.28125,
"learning_rate": 1.667548713014193e-05,
"loss": 1.0989733695983888,
"mean_token_accuracy": 0.8012546695768833,
"num_tokens": 2957056.0,
"step": 910
},
{
"entropy": 0.8601699252612889,
"epoch": 0.2102857142857143,
"grad_norm": 7.09375,
"learning_rate": 1.6627375511185953e-05,
"loss": 1.1599449157714843,
"mean_token_accuracy": 0.7934970580041408,
"num_tokens": 2988772.0,
"step": 920
},
{
"entropy": 0.7465516209602356,
"epoch": 0.21257142857142858,
"grad_norm": 6.0625,
"learning_rate": 1.6579263892229976e-05,
"loss": 1.014716911315918,
"mean_token_accuracy": 0.8273697007447481,
"num_tokens": 3024521.0,
"step": 930
},
{
"entropy": 0.7951956107281148,
"epoch": 0.21485714285714286,
"grad_norm": 7.0,
"learning_rate": 1.6531152273273995e-05,
"loss": 1.023974895477295,
"mean_token_accuracy": 0.81702711135149,
"num_tokens": 3055362.0,
"step": 940
},
{
"entropy": 0.8373465910553932,
"epoch": 0.21714285714285714,
"grad_norm": 8.5625,
"learning_rate": 1.6483040654318018e-05,
"loss": 1.149094009399414,
"mean_token_accuracy": 0.7994145810604095,
"num_tokens": 3085932.0,
"step": 950
},
{
"entropy": 0.7051204042509198,
"epoch": 0.21942857142857142,
"grad_norm": 6.375,
"learning_rate": 1.643492903536204e-05,
"loss": 0.9659648895263672,
"mean_token_accuracy": 0.8331427097320556,
"num_tokens": 3114791.0,
"step": 960
},
{
"entropy": 0.7798629926517606,
"epoch": 0.22171428571428572,
"grad_norm": 7.1875,
"learning_rate": 1.6386817416406066e-05,
"loss": 1.008477783203125,
"mean_token_accuracy": 0.8194496557116508,
"num_tokens": 3149473.0,
"step": 970
},
{
"entropy": 0.6989101554267109,
"epoch": 0.224,
"grad_norm": 8.125,
"learning_rate": 1.6338705797450085e-05,
"loss": 0.9564552307128906,
"mean_token_accuracy": 0.8339050948619843,
"num_tokens": 3182913.0,
"step": 980
},
{
"entropy": 0.8009612016379833,
"epoch": 0.22628571428571428,
"grad_norm": 7.96875,
"learning_rate": 1.6290594178494108e-05,
"loss": 1.082752799987793,
"mean_token_accuracy": 0.8148751087486744,
"num_tokens": 3214329.0,
"step": 990
},
{
"entropy": 0.7472866786643863,
"epoch": 0.22857142857142856,
"grad_norm": 7.03125,
"learning_rate": 1.624248255953813e-05,
"loss": 0.9995194435119629,
"mean_token_accuracy": 0.8205188862979412,
"num_tokens": 3246465.0,
"step": 1000
},
{
"entropy": 0.8845632201060653,
"epoch": 0.23085714285714284,
"grad_norm": 7.28125,
"learning_rate": 1.6194370940582153e-05,
"loss": 1.1626070976257323,
"mean_token_accuracy": 0.7972030624747276,
"num_tokens": 3280259.0,
"step": 1010
},
{
"entropy": 0.7615264546126127,
"epoch": 0.23314285714285715,
"grad_norm": 6.59375,
"learning_rate": 1.6146259321626175e-05,
"loss": 1.0563675880432128,
"mean_token_accuracy": 0.8191345028579236,
"num_tokens": 3308134.0,
"step": 1020
},
{
"entropy": 0.7456497238948941,
"epoch": 0.23542857142857143,
"grad_norm": 9.125,
"learning_rate": 1.6098147702670198e-05,
"loss": 0.9785372734069824,
"mean_token_accuracy": 0.8168387658894062,
"num_tokens": 3339804.0,
"step": 1030
},
{
"entropy": 0.9259420620277524,
"epoch": 0.2377142857142857,
"grad_norm": 7.1875,
"learning_rate": 1.6050036083714217e-05,
"loss": 1.2626006126403808,
"mean_token_accuracy": 0.7905944272875786,
"num_tokens": 3374600.0,
"step": 1040
},
{
"entropy": 0.7013174806721508,
"epoch": 0.24,
"grad_norm": 7.28125,
"learning_rate": 1.600192446475824e-05,
"loss": 0.8472931861877442,
"mean_token_accuracy": 0.834729814529419,
"num_tokens": 3406084.0,
"step": 1050
},
{
"entropy": 0.8099798344075679,
"epoch": 0.2422857142857143,
"grad_norm": 8.375,
"learning_rate": 1.5953812845802265e-05,
"loss": 1.1302724838256837,
"mean_token_accuracy": 0.8053847432136536,
"num_tokens": 3436595.0,
"step": 1060
},
{
"entropy": 0.6409325916320086,
"epoch": 0.24457142857142858,
"grad_norm": 8.1875,
"learning_rate": 1.5905701226846284e-05,
"loss": 0.9276237487792969,
"mean_token_accuracy": 0.8369442120194435,
"num_tokens": 3468462.0,
"step": 1070
},
{
"entropy": 0.6651454066857696,
"epoch": 0.24685714285714286,
"grad_norm": 8.75,
"learning_rate": 1.5857589607890307e-05,
"loss": 0.9005106925964356,
"mean_token_accuracy": 0.8366246894001961,
"num_tokens": 3502363.0,
"step": 1080
},
{
"entropy": 0.6705873743630946,
"epoch": 0.24914285714285714,
"grad_norm": 6.96875,
"learning_rate": 1.580947798893433e-05,
"loss": 0.9289634704589844,
"mean_token_accuracy": 0.8348163716495037,
"num_tokens": 3532774.0,
"step": 1090
},
{
"entropy": 0.8024829808622599,
"epoch": 0.25142857142857145,
"grad_norm": 8.25,
"learning_rate": 1.5761366369978352e-05,
"loss": 1.1945523262023925,
"mean_token_accuracy": 0.8085858777165413,
"num_tokens": 3565974.0,
"step": 1100
},
{
"entropy": 0.7451043974608182,
"epoch": 0.2537142857142857,
"grad_norm": 7.0625,
"learning_rate": 1.5713254751022374e-05,
"loss": 1.0138811111450194,
"mean_token_accuracy": 0.8233392249792815,
"num_tokens": 3599243.0,
"step": 1110
},
{
"entropy": 0.8042388122528792,
"epoch": 0.256,
"grad_norm": 6.71875,
"learning_rate": 1.5665143132066397e-05,
"loss": 1.0674107551574707,
"mean_token_accuracy": 0.8107536815106868,
"num_tokens": 3631217.0,
"step": 1120
},
{
"entropy": 0.6658579808659851,
"epoch": 0.2582857142857143,
"grad_norm": 7.9375,
"learning_rate": 1.5617031513110416e-05,
"loss": 0.8685308456420898,
"mean_token_accuracy": 0.8395798467099667,
"num_tokens": 3663654.0,
"step": 1130
},
{
"entropy": 0.6915052223019302,
"epoch": 0.26057142857142856,
"grad_norm": 6.75,
"learning_rate": 1.556891989415444e-05,
"loss": 0.9267234802246094,
"mean_token_accuracy": 0.8305907912552357,
"num_tokens": 3695008.0,
"step": 1140
},
{
"entropy": 0.7746626659296453,
"epoch": 0.26285714285714284,
"grad_norm": 7.46875,
"learning_rate": 1.552080827519846e-05,
"loss": 1.1303828239440918,
"mean_token_accuracy": 0.8152431160211563,
"num_tokens": 3725769.0,
"step": 1150
},
{
"entropy": 0.815077618137002,
"epoch": 0.2651428571428571,
"grad_norm": 8.375,
"learning_rate": 1.5472696656242483e-05,
"loss": 1.1592507362365723,
"mean_token_accuracy": 0.8096996866166591,
"num_tokens": 3759222.0,
"step": 1160
},
{
"entropy": 0.9105647809803485,
"epoch": 0.2674285714285714,
"grad_norm": 7.84375,
"learning_rate": 1.5424585037286506e-05,
"loss": 1.2050976753234863,
"mean_token_accuracy": 0.7931383229792118,
"num_tokens": 3789235.0,
"step": 1170
},
{
"entropy": 0.8901564389467239,
"epoch": 0.26971428571428574,
"grad_norm": 7.40625,
"learning_rate": 1.537647341833053e-05,
"loss": 1.1315418243408204,
"mean_token_accuracy": 0.7916867211461067,
"num_tokens": 3822530.0,
"step": 1180
},
{
"entropy": 0.8138524909503758,
"epoch": 0.272,
"grad_norm": 7.46875,
"learning_rate": 1.532836179937455e-05,
"loss": 1.0824806213378906,
"mean_token_accuracy": 0.807539875805378,
"num_tokens": 3857294.0,
"step": 1190
},
{
"entropy": 0.8327909021638333,
"epoch": 0.2742857142857143,
"grad_norm": 7.40625,
"learning_rate": 1.5280250180418573e-05,
"loss": 1.0807191848754882,
"mean_token_accuracy": 0.8046631902456284,
"num_tokens": 3887638.0,
"step": 1200
},
{
"entropy": 0.6820507633499802,
"epoch": 0.2765714285714286,
"grad_norm": 7.25,
"learning_rate": 1.5232138561462594e-05,
"loss": 0.9238566398620606,
"mean_token_accuracy": 0.8344717890024185,
"num_tokens": 3921320.0,
"step": 1210
},
{
"entropy": 0.6690340504981578,
"epoch": 0.27885714285714286,
"grad_norm": 8.625,
"learning_rate": 1.5184026942506615e-05,
"loss": 0.9770146369934082,
"mean_token_accuracy": 0.83714384958148,
"num_tokens": 3952659.0,
"step": 1220
},
{
"entropy": 0.7821415845304728,
"epoch": 0.28114285714285714,
"grad_norm": 8.9375,
"learning_rate": 1.513591532355064e-05,
"loss": 1.1273323059082032,
"mean_token_accuracy": 0.8086842469871044,
"num_tokens": 3985673.0,
"step": 1230
},
{
"entropy": 0.7746237487532198,
"epoch": 0.2834285714285714,
"grad_norm": 6.96875,
"learning_rate": 1.5087803704594662e-05,
"loss": 0.9969350814819335,
"mean_token_accuracy": 0.8176074028015137,
"num_tokens": 4014425.0,
"step": 1240
},
{
"entropy": 0.7822927181608975,
"epoch": 0.2857142857142857,
"grad_norm": 7.90625,
"learning_rate": 1.5039692085638682e-05,
"loss": 1.0581744194030762,
"mean_token_accuracy": 0.8114182919263839,
"num_tokens": 4044735.0,
"step": 1250
},
{
"entropy": 0.8262449711561203,
"epoch": 0.288,
"grad_norm": 8.125,
"learning_rate": 1.4991580466682705e-05,
"loss": 1.1058235168457031,
"mean_token_accuracy": 0.8093136258423328,
"num_tokens": 4077366.0,
"step": 1260
},
{
"entropy": 0.7183008762076497,
"epoch": 0.29028571428571426,
"grad_norm": 6.75,
"learning_rate": 1.4943468847726727e-05,
"loss": 1.0642513275146483,
"mean_token_accuracy": 0.8284725159406662,
"num_tokens": 4112231.0,
"step": 1270
},
{
"entropy": 0.7519657079130411,
"epoch": 0.2925714285714286,
"grad_norm": 7.65625,
"learning_rate": 1.489535722877075e-05,
"loss": 1.0380656242370605,
"mean_token_accuracy": 0.8182306826114655,
"num_tokens": 4141706.0,
"step": 1280
},
{
"entropy": 0.8959639485925436,
"epoch": 0.2948571428571429,
"grad_norm": 8.8125,
"learning_rate": 1.484724560981477e-05,
"loss": 1.1817408561706544,
"mean_token_accuracy": 0.7842808924615383,
"num_tokens": 4174772.0,
"step": 1290
},
{
"entropy": 0.7940410540439189,
"epoch": 0.29714285714285715,
"grad_norm": 7.9375,
"learning_rate": 1.4799133990858793e-05,
"loss": 1.0543545722961425,
"mean_token_accuracy": 0.8153316840529442,
"num_tokens": 4207107.0,
"step": 1300
},
{
"entropy": 0.7827737585641443,
"epoch": 0.29942857142857143,
"grad_norm": 11.0,
"learning_rate": 1.4751022371902818e-05,
"loss": 1.1160078048706055,
"mean_token_accuracy": 0.812502384185791,
"num_tokens": 4242521.0,
"step": 1310
},
{
"entropy": 0.735058065969497,
"epoch": 0.3017142857142857,
"grad_norm": 7.5,
"learning_rate": 1.4702910752946837e-05,
"loss": 1.0581280708312988,
"mean_token_accuracy": 0.8288455225527287,
"num_tokens": 4276982.0,
"step": 1320
},
{
"entropy": 0.7287354637868703,
"epoch": 0.304,
"grad_norm": 6.9375,
"learning_rate": 1.465479913399086e-05,
"loss": 0.9759371757507325,
"mean_token_accuracy": 0.8249299876391888,
"num_tokens": 4306046.0,
"step": 1330
},
{
"entropy": 0.7787643402814866,
"epoch": 0.3062857142857143,
"grad_norm": 7.5,
"learning_rate": 1.4606687515034883e-05,
"loss": 1.0230366706848144,
"mean_token_accuracy": 0.816937967389822,
"num_tokens": 4338652.0,
"step": 1340
},
{
"entropy": 0.8934064561501145,
"epoch": 0.30857142857142855,
"grad_norm": 5.875,
"learning_rate": 1.4558575896078904e-05,
"loss": 1.086491012573242,
"mean_token_accuracy": 0.7942407630383969,
"num_tokens": 4370871.0,
"step": 1350
},
{
"entropy": 0.833009172603488,
"epoch": 0.31085714285714283,
"grad_norm": 7.625,
"learning_rate": 1.4510464277122927e-05,
"loss": 1.1905370712280274,
"mean_token_accuracy": 0.8013229362666607,
"num_tokens": 4402989.0,
"step": 1360
},
{
"entropy": 0.7927345955744386,
"epoch": 0.31314285714285717,
"grad_norm": 6.875,
"learning_rate": 1.4462352658166949e-05,
"loss": 1.1041228294372558,
"mean_token_accuracy": 0.8128574416041374,
"num_tokens": 4434506.0,
"step": 1370
},
{
"entropy": 0.7229848534800112,
"epoch": 0.31542857142857145,
"grad_norm": 7.53125,
"learning_rate": 1.441424103921097e-05,
"loss": 1.0535061836242676,
"mean_token_accuracy": 0.8302266910672188,
"num_tokens": 4467742.0,
"step": 1380
},
{
"entropy": 0.6736922577954829,
"epoch": 0.3177142857142857,
"grad_norm": 8.3125,
"learning_rate": 1.4366129420254992e-05,
"loss": 0.9416308403015137,
"mean_token_accuracy": 0.8366274513304234,
"num_tokens": 4498266.0,
"step": 1390
},
{
"entropy": 0.7866813028231263,
"epoch": 0.32,
"grad_norm": 7.0,
"learning_rate": 1.4318017801299015e-05,
"loss": 1.0644832611083985,
"mean_token_accuracy": 0.8135197319090366,
"num_tokens": 4526424.0,
"step": 1400
},
{
"entropy": 0.755329312197864,
"epoch": 0.3222857142857143,
"grad_norm": 7.25,
"learning_rate": 1.4269906182343036e-05,
"loss": 1.0085858345031737,
"mean_token_accuracy": 0.8171801075339318,
"num_tokens": 4556781.0,
"step": 1410
},
{
"entropy": 0.7350449176505208,
"epoch": 0.32457142857142857,
"grad_norm": 8.0,
"learning_rate": 1.4221794563387058e-05,
"loss": 1.0485240936279296,
"mean_token_accuracy": 0.8203142821788788,
"num_tokens": 4586938.0,
"step": 1420
},
{
"entropy": 0.7315349031239748,
"epoch": 0.32685714285714285,
"grad_norm": 6.4375,
"learning_rate": 1.4173682944431082e-05,
"loss": 0.9750032424926758,
"mean_token_accuracy": 0.8210594050586224,
"num_tokens": 4623204.0,
"step": 1430
},
{
"entropy": 0.8201613875105978,
"epoch": 0.3291428571428571,
"grad_norm": 8.375,
"learning_rate": 1.4125571325475103e-05,
"loss": 1.0923168182373046,
"mean_token_accuracy": 0.8091586381196976,
"num_tokens": 4655204.0,
"step": 1440
},
{
"entropy": 0.731718104891479,
"epoch": 0.3314285714285714,
"grad_norm": 7.65625,
"learning_rate": 1.4077459706519126e-05,
"loss": 0.939968490600586,
"mean_token_accuracy": 0.8259035252034664,
"num_tokens": 4684009.0,
"step": 1450
},
{
"entropy": 0.7582659061998129,
"epoch": 0.33371428571428574,
"grad_norm": 7.78125,
"learning_rate": 1.4029348087563148e-05,
"loss": 1.141510581970215,
"mean_token_accuracy": 0.8165373567491769,
"num_tokens": 4713643.0,
"step": 1460
},
{
"entropy": 0.8316841575317084,
"epoch": 0.336,
"grad_norm": 6.8125,
"learning_rate": 1.3981236468607169e-05,
"loss": 1.0487807273864747,
"mean_token_accuracy": 0.8056000970304013,
"num_tokens": 4745897.0,
"step": 1470
},
{
"entropy": 0.7131205608136952,
"epoch": 0.3382857142857143,
"grad_norm": 7.59375,
"learning_rate": 1.3933124849651192e-05,
"loss": 0.9551529884338379,
"mean_token_accuracy": 0.8345349170267582,
"num_tokens": 4779342.0,
"step": 1480
},
{
"entropy": 0.7310262706130743,
"epoch": 0.3405714285714286,
"grad_norm": 8.0,
"learning_rate": 1.3885013230695214e-05,
"loss": 1.071888256072998,
"mean_token_accuracy": 0.8165734991431236,
"num_tokens": 4810006.0,
"step": 1490
},
{
"entropy": 0.8448133600875736,
"epoch": 0.34285714285714286,
"grad_norm": 7.71875,
"learning_rate": 1.3836901611739235e-05,
"loss": 1.1719935417175293,
"mean_token_accuracy": 0.8007844358682632,
"num_tokens": 4841370.0,
"step": 1500
},
{
"entropy": 0.6549595400691033,
"epoch": 0.34514285714285714,
"grad_norm": 6.125,
"learning_rate": 1.3788789992783257e-05,
"loss": 0.9889472007751465,
"mean_token_accuracy": 0.8453674554824829,
"num_tokens": 4872052.0,
"step": 1510
},
{
"entropy": 0.8164440121501684,
"epoch": 0.3474285714285714,
"grad_norm": 7.5625,
"learning_rate": 1.3740678373827282e-05,
"loss": 1.0972503662109374,
"mean_token_accuracy": 0.810026689618826,
"num_tokens": 4908227.0,
"step": 1520
},
{
"entropy": 0.7791354645043611,
"epoch": 0.3497142857142857,
"grad_norm": 7.8125,
"learning_rate": 1.36925667548713e-05,
"loss": 1.0852085113525392,
"mean_token_accuracy": 0.8248721182346344,
"num_tokens": 4940131.0,
"step": 1530
},
{
"entropy": 0.8590768910944462,
"epoch": 0.352,
"grad_norm": 7.9375,
"learning_rate": 1.3644455135915325e-05,
"loss": 1.1454149246215821,
"mean_token_accuracy": 0.8017402648925781,
"num_tokens": 4971176.0,
"step": 1540
},
{
"entropy": 0.6812219545245171,
"epoch": 0.35428571428571426,
"grad_norm": 7.0,
"learning_rate": 1.3596343516959347e-05,
"loss": 0.919462776184082,
"mean_token_accuracy": 0.8335798256099224,
"num_tokens": 5002886.0,
"step": 1550
},
{
"entropy": 0.6795941894873977,
"epoch": 0.3565714285714286,
"grad_norm": 6.8125,
"learning_rate": 1.354823189800337e-05,
"loss": 0.9362202644348144,
"mean_token_accuracy": 0.8309865556657314,
"num_tokens": 5034604.0,
"step": 1560
},
{
"entropy": 0.8111153118312359,
"epoch": 0.3588571428571429,
"grad_norm": 7.5625,
"learning_rate": 1.350012027904739e-05,
"loss": 1.1012299537658692,
"mean_token_accuracy": 0.8071676261723042,
"num_tokens": 5067068.0,
"step": 1570
},
{
"entropy": 0.8018769213929773,
"epoch": 0.36114285714285715,
"grad_norm": 7.625,
"learning_rate": 1.3452008660091413e-05,
"loss": 1.0980539321899414,
"mean_token_accuracy": 0.8049051895737648,
"num_tokens": 5101840.0,
"step": 1580
},
{
"entropy": 0.8108965801075101,
"epoch": 0.36342857142857143,
"grad_norm": 9.4375,
"learning_rate": 1.3403897041135436e-05,
"loss": 1.097167682647705,
"mean_token_accuracy": 0.8064502902328968,
"num_tokens": 5133106.0,
"step": 1590
},
{
"entropy": 0.7126147777773439,
"epoch": 0.3657142857142857,
"grad_norm": 7.21875,
"learning_rate": 1.3355785422179457e-05,
"loss": 0.9641182899475098,
"mean_token_accuracy": 0.8308103702962398,
"num_tokens": 5163625.0,
"step": 1600
},
{
"entropy": 0.6579177615232765,
"epoch": 0.368,
"grad_norm": 7.6875,
"learning_rate": 1.3307673803223479e-05,
"loss": 0.8962146759033203,
"mean_token_accuracy": 0.8413269713521003,
"num_tokens": 5197413.0,
"step": 1610
},
{
"entropy": 0.8362961991690099,
"epoch": 0.3702857142857143,
"grad_norm": 7.53125,
"learning_rate": 1.3259562184267503e-05,
"loss": 1.1765104293823243,
"mean_token_accuracy": 0.8035941451787949,
"num_tokens": 5230359.0,
"step": 1620
},
{
"entropy": 0.8460681514814496,
"epoch": 0.37257142857142855,
"grad_norm": 7.125,
"learning_rate": 1.3211450565311524e-05,
"loss": 1.1312347412109376,
"mean_token_accuracy": 0.806734037399292,
"num_tokens": 5261631.0,
"step": 1630
},
{
"entropy": 0.8401033844798803,
"epoch": 0.37485714285714283,
"grad_norm": 7.6875,
"learning_rate": 1.3163338946355547e-05,
"loss": 1.1048646926879884,
"mean_token_accuracy": 0.8016112253069878,
"num_tokens": 5293666.0,
"step": 1640
},
{
"entropy": 0.8607065804302693,
"epoch": 0.37714285714285717,
"grad_norm": 6.25,
"learning_rate": 1.3115227327399569e-05,
"loss": 1.224336814880371,
"mean_token_accuracy": 0.7972042057663202,
"num_tokens": 5328829.0,
"step": 1650
},
{
"entropy": 0.6591957551427186,
"epoch": 0.37942857142857145,
"grad_norm": 8.3125,
"learning_rate": 1.306711570844359e-05,
"loss": 0.9134272575378418,
"mean_token_accuracy": 0.8408956363797188,
"num_tokens": 5359723.0,
"step": 1660
},
{
"entropy": 0.7585498026572168,
"epoch": 0.38171428571428573,
"grad_norm": 6.84375,
"learning_rate": 1.3019004089487612e-05,
"loss": 1.0762030601501464,
"mean_token_accuracy": 0.815737747400999,
"num_tokens": 5391030.0,
"step": 1670
},
{
"entropy": 0.7825943292118609,
"epoch": 0.384,
"grad_norm": 6.6875,
"learning_rate": 1.2970892470531635e-05,
"loss": 1.0779932975769042,
"mean_token_accuracy": 0.8169842332601547,
"num_tokens": 5422205.0,
"step": 1680
},
{
"entropy": 0.8554381128400564,
"epoch": 0.3862857142857143,
"grad_norm": 7.375,
"learning_rate": 1.2922780851575656e-05,
"loss": 1.12919340133667,
"mean_token_accuracy": 0.8013027586042881,
"num_tokens": 5452941.0,
"step": 1690
},
{
"entropy": 0.7908354031853377,
"epoch": 0.38857142857142857,
"grad_norm": 7.28125,
"learning_rate": 1.2874669232619678e-05,
"loss": 1.0936867713928222,
"mean_token_accuracy": 0.8094826623797416,
"num_tokens": 5486102.0,
"step": 1700
},
{
"entropy": 0.8072810024954379,
"epoch": 0.39085714285714285,
"grad_norm": 6.09375,
"learning_rate": 1.28265576136637e-05,
"loss": 1.0153223991394043,
"mean_token_accuracy": 0.8126743011176586,
"num_tokens": 5518871.0,
"step": 1710
},
{
"entropy": 0.7387428401969374,
"epoch": 0.3931428571428571,
"grad_norm": 7.34375,
"learning_rate": 1.2778445994707722e-05,
"loss": 1.021730613708496,
"mean_token_accuracy": 0.8178475465625524,
"num_tokens": 5548678.0,
"step": 1720
},
{
"entropy": 0.6844640583731234,
"epoch": 0.3954285714285714,
"grad_norm": 8.0625,
"learning_rate": 1.2730334375751746e-05,
"loss": 0.9658615112304687,
"mean_token_accuracy": 0.833624093234539,
"num_tokens": 5580416.0,
"step": 1730
},
{
"entropy": 0.8338166723027826,
"epoch": 0.3977142857142857,
"grad_norm": 7.375,
"learning_rate": 1.2682222756795768e-05,
"loss": 1.0406496047973632,
"mean_token_accuracy": 0.8031456172466278,
"num_tokens": 5613199.0,
"step": 1740
},
{
"entropy": 0.6859139285050333,
"epoch": 0.4,
"grad_norm": 8.1875,
"learning_rate": 1.2634111137839789e-05,
"loss": 1.0559725761413574,
"mean_token_accuracy": 0.8320677742362023,
"num_tokens": 5644289.0,
"step": 1750
},
{
"entropy": 0.8010108925402164,
"epoch": 0.4022857142857143,
"grad_norm": 7.875,
"learning_rate": 1.2585999518883812e-05,
"loss": 1.113631820678711,
"mean_token_accuracy": 0.8092500284314156,
"num_tokens": 5676021.0,
"step": 1760
},
{
"entropy": 0.8805123227648437,
"epoch": 0.4045714285714286,
"grad_norm": 8.5625,
"learning_rate": 1.2537887899927834e-05,
"loss": 1.1203717231750487,
"mean_token_accuracy": 0.799303562939167,
"num_tokens": 5708259.0,
"step": 1770
},
{
"entropy": 0.7750554161146284,
"epoch": 0.40685714285714286,
"grad_norm": 7.15625,
"learning_rate": 1.2489776280971855e-05,
"loss": 1.1084386825561523,
"mean_token_accuracy": 0.8079812493175268,
"num_tokens": 5741700.0,
"step": 1780
},
{
"entropy": 0.8413273308426141,
"epoch": 0.40914285714285714,
"grad_norm": 7.21875,
"learning_rate": 1.2441664662015877e-05,
"loss": 1.0813825607299805,
"mean_token_accuracy": 0.8091316163539887,
"num_tokens": 5774895.0,
"step": 1790
},
{
"entropy": 0.754073722101748,
"epoch": 0.4114285714285714,
"grad_norm": 6.90625,
"learning_rate": 1.23935530430599e-05,
"loss": 1.0666906356811523,
"mean_token_accuracy": 0.819086953997612,
"num_tokens": 5808852.0,
"step": 1800
},
{
"entropy": 0.7851035035215318,
"epoch": 0.4137142857142857,
"grad_norm": 7.25,
"learning_rate": 1.234544142410392e-05,
"loss": 1.1307811737060547,
"mean_token_accuracy": 0.8178651243448257,
"num_tokens": 5841915.0,
"step": 1810
},
{
"entropy": 0.6699810542166234,
"epoch": 0.416,
"grad_norm": 6.375,
"learning_rate": 1.2297329805147943e-05,
"loss": 0.948750114440918,
"mean_token_accuracy": 0.8368007637560367,
"num_tokens": 5876884.0,
"step": 1820
},
{
"entropy": 0.7877312513999641,
"epoch": 0.41828571428571426,
"grad_norm": 8.375,
"learning_rate": 1.2249218186191967e-05,
"loss": 1.0736566543579102,
"mean_token_accuracy": 0.8172481268644333,
"num_tokens": 5909524.0,
"step": 1830
},
{
"entropy": 0.7636531024239958,
"epoch": 0.4205714285714286,
"grad_norm": 7.375,
"learning_rate": 1.2201106567235988e-05,
"loss": 1.0859886169433595,
"mean_token_accuracy": 0.8179905354976654,
"num_tokens": 5944343.0,
"step": 1840
},
{
"entropy": 0.7100124446675181,
"epoch": 0.4228571428571429,
"grad_norm": 7.15625,
"learning_rate": 1.215299494828001e-05,
"loss": 1.042219352722168,
"mean_token_accuracy": 0.8213589303195477,
"num_tokens": 5979532.0,
"step": 1850
},
{
"entropy": 0.7539400187321007,
"epoch": 0.42514285714285716,
"grad_norm": 7.03125,
"learning_rate": 1.2104883329324033e-05,
"loss": 1.0224475860595703,
"mean_token_accuracy": 0.8227170191705226,
"num_tokens": 6013588.0,
"step": 1860
},
{
"entropy": 0.6926140191964805,
"epoch": 0.42742857142857144,
"grad_norm": 6.1875,
"learning_rate": 1.2056771710368056e-05,
"loss": 0.9315377235412597,
"mean_token_accuracy": 0.8341933377087116,
"num_tokens": 6049253.0,
"step": 1870
},
{
"entropy": 0.8801758374087513,
"epoch": 0.4297142857142857,
"grad_norm": 7.53125,
"learning_rate": 1.2008660091412077e-05,
"loss": 1.1752006530761718,
"mean_token_accuracy": 0.7919330909848213,
"num_tokens": 6079866.0,
"step": 1880
},
{
"entropy": 0.899750160984695,
"epoch": 0.432,
"grad_norm": 7.21875,
"learning_rate": 1.1960548472456099e-05,
"loss": 1.1849931716918944,
"mean_token_accuracy": 0.7877020232379437,
"num_tokens": 6109239.0,
"step": 1890
},
{
"entropy": 0.7825359049253165,
"epoch": 0.4342857142857143,
"grad_norm": 7.46875,
"learning_rate": 1.1912436853500122e-05,
"loss": 1.0007784843444825,
"mean_token_accuracy": 0.818300225585699,
"num_tokens": 6138853.0,
"step": 1900
},
{
"entropy": 0.7607327317818999,
"epoch": 0.43657142857142855,
"grad_norm": 8.0,
"learning_rate": 1.1864325234544142e-05,
"loss": 1.0711479187011719,
"mean_token_accuracy": 0.8240827091038228,
"num_tokens": 6172839.0,
"step": 1910
},
{
"entropy": 0.8882574066519737,
"epoch": 0.43885714285714283,
"grad_norm": 7.71875,
"learning_rate": 1.1816213615588167e-05,
"loss": 1.2051098823547364,
"mean_token_accuracy": 0.7916370362043381,
"num_tokens": 6204250.0,
"step": 1920
},
{
"entropy": 0.6951690092682838,
"epoch": 0.44114285714285717,
"grad_norm": 8.5,
"learning_rate": 1.1768101996632189e-05,
"loss": 0.9240032196044922,
"mean_token_accuracy": 0.8321454405784607,
"num_tokens": 6236171.0,
"step": 1930
},
{
"entropy": 0.7487597663886845,
"epoch": 0.44342857142857145,
"grad_norm": 7.71875,
"learning_rate": 1.171999037767621e-05,
"loss": 0.9808469772338867,
"mean_token_accuracy": 0.8196887351572514,
"num_tokens": 6268135.0,
"step": 1940
},
{
"entropy": 0.8591405102983117,
"epoch": 0.44571428571428573,
"grad_norm": 7.78125,
"learning_rate": 1.1671878758720232e-05,
"loss": 1.1255832672119142,
"mean_token_accuracy": 0.7943931568413973,
"num_tokens": 6299543.0,
"step": 1950
},
{
"entropy": 0.9221633022651077,
"epoch": 0.448,
"grad_norm": 7.34375,
"learning_rate": 1.1623767139764255e-05,
"loss": 1.218088436126709,
"mean_token_accuracy": 0.7879602633416652,
"num_tokens": 6328776.0,
"step": 1960
},
{
"entropy": 0.7521216680295766,
"epoch": 0.4502857142857143,
"grad_norm": 4.125,
"learning_rate": 1.1575655520808276e-05,
"loss": 1.0790873527526856,
"mean_token_accuracy": 0.8138045072555542,
"num_tokens": 6359815.0,
"step": 1970
},
{
"entropy": 0.7044279471971094,
"epoch": 0.45257142857142857,
"grad_norm": 8.125,
"learning_rate": 1.1527543901852298e-05,
"loss": 0.925055980682373,
"mean_token_accuracy": 0.8344494268298149,
"num_tokens": 6393539.0,
"step": 1980
},
{
"entropy": 0.7118433593772352,
"epoch": 0.45485714285714285,
"grad_norm": 6.03125,
"learning_rate": 1.147943228289632e-05,
"loss": 0.9561774253845214,
"mean_token_accuracy": 0.8290005512535572,
"num_tokens": 6426378.0,
"step": 1990
},
{
"entropy": 0.7948009348474443,
"epoch": 0.45714285714285713,
"grad_norm": 6.78125,
"learning_rate": 1.1431320663940341e-05,
"loss": 1.0137686729431152,
"mean_token_accuracy": 0.8080471381545067,
"num_tokens": 6460145.0,
"step": 2000
},
{
"entropy": 0.7212188862264156,
"epoch": 0.4594285714285714,
"grad_norm": 6.3125,
"learning_rate": 1.1383209044984364e-05,
"loss": 0.9326017379760743,
"mean_token_accuracy": 0.8261952839791775,
"num_tokens": 6492010.0,
"step": 2010
},
{
"entropy": 0.7147583740763366,
"epoch": 0.4617142857142857,
"grad_norm": 7.96875,
"learning_rate": 1.1335097426028388e-05,
"loss": 1.0504631996154785,
"mean_token_accuracy": 0.831389506906271,
"num_tokens": 6526521.0,
"step": 2020
},
{
"entropy": 0.8111877050250769,
"epoch": 0.464,
"grad_norm": 7.71875,
"learning_rate": 1.1286985807072407e-05,
"loss": 1.0568114280700684,
"mean_token_accuracy": 0.8077960222959518,
"num_tokens": 6559743.0,
"step": 2030
},
{
"entropy": 0.8017427391372621,
"epoch": 0.4662857142857143,
"grad_norm": 8.125,
"learning_rate": 1.1238874188116432e-05,
"loss": 1.0879751205444337,
"mean_token_accuracy": 0.8064081892371178,
"num_tokens": 6591260.0,
"step": 2040
},
{
"entropy": 0.7713497207500041,
"epoch": 0.4685714285714286,
"grad_norm": 8.0,
"learning_rate": 1.1190762569160454e-05,
"loss": 1.1264875411987305,
"mean_token_accuracy": 0.8138973511755466,
"num_tokens": 6622826.0,
"step": 2050
},
{
"entropy": 0.7645074154250324,
"epoch": 0.47085714285714286,
"grad_norm": 7.5625,
"learning_rate": 1.1142650950204475e-05,
"loss": 1.0584564208984375,
"mean_token_accuracy": 0.8198134288191795,
"num_tokens": 6655484.0,
"step": 2060
},
{
"entropy": 0.8299776021391153,
"epoch": 0.47314285714285714,
"grad_norm": 6.40625,
"learning_rate": 1.1094539331248497e-05,
"loss": 1.1237126350402833,
"mean_token_accuracy": 0.8051372021436691,
"num_tokens": 6685590.0,
"step": 2070
},
{
"entropy": 0.7288541275076568,
"epoch": 0.4754285714285714,
"grad_norm": 7.125,
"learning_rate": 1.104642771229252e-05,
"loss": 0.9620414733886719,
"mean_token_accuracy": 0.8219352796673774,
"num_tokens": 6721547.0,
"step": 2080
},
{
"entropy": 0.773728856164962,
"epoch": 0.4777142857142857,
"grad_norm": 6.1875,
"learning_rate": 1.099831609333654e-05,
"loss": 1.0007498741149903,
"mean_token_accuracy": 0.8184696063399315,
"num_tokens": 6754220.0,
"step": 2090
},
{
"entropy": 0.7731793771497906,
"epoch": 0.48,
"grad_norm": 7.34375,
"learning_rate": 1.0950204474380563e-05,
"loss": 1.026624584197998,
"mean_token_accuracy": 0.8176170207560063,
"num_tokens": 6785160.0,
"step": 2100
},
{
"entropy": 0.6699161239899695,
"epoch": 0.48228571428571426,
"grad_norm": 7.09375,
"learning_rate": 1.0902092855424586e-05,
"loss": 0.9981835365295411,
"mean_token_accuracy": 0.8343960210680962,
"num_tokens": 6819546.0,
"step": 2110
},
{
"entropy": 0.773171486146748,
"epoch": 0.4845714285714286,
"grad_norm": 6.375,
"learning_rate": 1.0853981236468606e-05,
"loss": 1.0869997024536133,
"mean_token_accuracy": 0.8096975103020668,
"num_tokens": 6849214.0,
"step": 2120
},
{
"entropy": 0.7241250389255584,
"epoch": 0.4868571428571429,
"grad_norm": 7.71875,
"learning_rate": 1.080586961751263e-05,
"loss": 1.0170108795166015,
"mean_token_accuracy": 0.826240535825491,
"num_tokens": 6880349.0,
"step": 2130
},
{
"entropy": 0.7947101121768355,
"epoch": 0.48914285714285716,
"grad_norm": 6.15625,
"learning_rate": 1.0757757998556653e-05,
"loss": 1.0710148811340332,
"mean_token_accuracy": 0.8159072741866111,
"num_tokens": 6914887.0,
"step": 2140
},
{
"entropy": 0.8211502507328987,
"epoch": 0.49142857142857144,
"grad_norm": 7.625,
"learning_rate": 1.0709646379600676e-05,
"loss": 1.1436882972717286,
"mean_token_accuracy": 0.8062957197427749,
"num_tokens": 6947890.0,
"step": 2150
},
{
"entropy": 0.7476996140554547,
"epoch": 0.4937142857142857,
"grad_norm": 7.375,
"learning_rate": 1.0661534760644696e-05,
"loss": 1.0358779907226563,
"mean_token_accuracy": 0.82193743288517,
"num_tokens": 6976819.0,
"step": 2160
},
{
"entropy": 0.8045617615804076,
"epoch": 0.496,
"grad_norm": 7.375,
"learning_rate": 1.0613423141688719e-05,
"loss": 1.023204517364502,
"mean_token_accuracy": 0.8044866040349007,
"num_tokens": 7006918.0,
"step": 2170
},
{
"entropy": 0.7655783969908952,
"epoch": 0.4982857142857143,
"grad_norm": 7.125,
"learning_rate": 1.0565311522732741e-05,
"loss": 1.0738348007202148,
"mean_token_accuracy": 0.8179361633956432,
"num_tokens": 7040325.0,
"step": 2180
},
{
"entropy": 0.7762483460828662,
"epoch": 0.5005714285714286,
"grad_norm": 7.75,
"learning_rate": 1.0517199903776762e-05,
"loss": 1.0218994140625,
"mean_token_accuracy": 0.8140566550195217,
"num_tokens": 7073925.0,
"step": 2190
},
{
"entropy": 0.6888056830503047,
"epoch": 0.5028571428571429,
"grad_norm": 7.84375,
"learning_rate": 1.0469088284820785e-05,
"loss": 1.0055737495422363,
"mean_token_accuracy": 0.8302330307662487,
"num_tokens": 7106764.0,
"step": 2200
},
{
"entropy": 0.8743803231045604,
"epoch": 0.5051428571428571,
"grad_norm": 7.46875,
"learning_rate": 1.0420976665864809e-05,
"loss": 1.14207181930542,
"mean_token_accuracy": 0.7981645628809929,
"num_tokens": 7139473.0,
"step": 2210
},
{
"entropy": 0.7461634024046362,
"epoch": 0.5074285714285715,
"grad_norm": 7.84375,
"learning_rate": 1.0372865046908828e-05,
"loss": 0.9760645866394043,
"mean_token_accuracy": 0.8265540286898613,
"num_tokens": 7170534.0,
"step": 2220
},
{
"entropy": 0.6452060268260539,
"epoch": 0.5097142857142857,
"grad_norm": 6.59375,
"learning_rate": 1.0324753427952852e-05,
"loss": 0.8791199684143066,
"mean_token_accuracy": 0.8427741400897503,
"num_tokens": 7203692.0,
"step": 2230
},
{
"entropy": 0.7903048783540726,
"epoch": 0.512,
"grad_norm": 7.09375,
"learning_rate": 1.0276641808996875e-05,
"loss": 1.0589832305908202,
"mean_token_accuracy": 0.8105465799570084,
"num_tokens": 7235512.0,
"step": 2240
},
{
"entropy": 0.757332621794194,
"epoch": 0.5142857142857142,
"grad_norm": 6.34375,
"learning_rate": 1.0228530190040896e-05,
"loss": 1.0270901679992677,
"mean_token_accuracy": 0.8171210527420044,
"num_tokens": 7268071.0,
"step": 2250
},
{
"entropy": 0.7633547084406018,
"epoch": 0.5165714285714286,
"grad_norm": 6.84375,
"learning_rate": 1.0180418571084918e-05,
"loss": 1.0296350479125977,
"mean_token_accuracy": 0.8162448532879353,
"num_tokens": 7298520.0,
"step": 2260
},
{
"entropy": 0.7190552426502108,
"epoch": 0.5188571428571429,
"grad_norm": 6.90625,
"learning_rate": 1.013230695212894e-05,
"loss": 1.059223461151123,
"mean_token_accuracy": 0.8252359744161367,
"num_tokens": 7329180.0,
"step": 2270
},
{
"entropy": 0.7730093291960657,
"epoch": 0.5211428571428571,
"grad_norm": 7.65625,
"learning_rate": 1.0084195333172961e-05,
"loss": 1.1134568214416505,
"mean_token_accuracy": 0.810255641490221,
"num_tokens": 7363397.0,
"step": 2280
},
{
"entropy": 0.7890252031385898,
"epoch": 0.5234285714285715,
"grad_norm": 8.5625,
"learning_rate": 1.0036083714216984e-05,
"loss": 1.062121868133545,
"mean_token_accuracy": 0.8097737640142441,
"num_tokens": 7391404.0,
"step": 2290
},
{
"entropy": 0.7083958725444972,
"epoch": 0.5257142857142857,
"grad_norm": 7.625,
"learning_rate": 9.987972095261006e-06,
"loss": 0.9515584945678711,
"mean_token_accuracy": 0.8254938945174217,
"num_tokens": 7423099.0,
"step": 2300
},
{
"entropy": 0.6942234938032925,
"epoch": 0.528,
"grad_norm": 6.84375,
"learning_rate": 9.939860476305029e-06,
"loss": 0.9809045791625977,
"mean_token_accuracy": 0.8210146620869636,
"num_tokens": 7456548.0,
"step": 2310
},
{
"entropy": 0.7144082696177065,
"epoch": 0.5302857142857142,
"grad_norm": 7.40625,
"learning_rate": 9.89174885734905e-06,
"loss": 1.0528292655944824,
"mean_token_accuracy": 0.8277196332812309,
"num_tokens": 7489319.0,
"step": 2320
},
{
"entropy": 0.7327054421417415,
"epoch": 0.5325714285714286,
"grad_norm": 8.1875,
"learning_rate": 9.843637238393072e-06,
"loss": 1.0515410423278808,
"mean_token_accuracy": 0.822493951767683,
"num_tokens": 7524338.0,
"step": 2330
},
{
"entropy": 0.7691349984146655,
"epoch": 0.5348571428571428,
"grad_norm": 7.875,
"learning_rate": 9.795525619437095e-06,
"loss": 1.078810977935791,
"mean_token_accuracy": 0.8136450231075287,
"num_tokens": 7557739.0,
"step": 2340
},
{
"entropy": 0.8708611608482897,
"epoch": 0.5371428571428571,
"grad_norm": 6.75,
"learning_rate": 9.747414000481117e-06,
"loss": 1.1824729919433594,
"mean_token_accuracy": 0.7978243462741375,
"num_tokens": 7590943.0,
"step": 2350
},
{
"entropy": 0.7193792495876551,
"epoch": 0.5394285714285715,
"grad_norm": 6.09375,
"learning_rate": 9.699302381525138e-06,
"loss": 1.009437370300293,
"mean_token_accuracy": 0.8306246355175972,
"num_tokens": 7624726.0,
"step": 2360
},
{
"entropy": 0.7145123222842813,
"epoch": 0.5417142857142857,
"grad_norm": 8.25,
"learning_rate": 9.651190762569162e-06,
"loss": 1.0352288246154786,
"mean_token_accuracy": 0.8277433931827545,
"num_tokens": 7655654.0,
"step": 2370
},
{
"entropy": 0.7357332297600806,
"epoch": 0.544,
"grad_norm": 8.1875,
"learning_rate": 9.603079143613183e-06,
"loss": 1.113128662109375,
"mean_token_accuracy": 0.821478446573019,
"num_tokens": 7687948.0,
"step": 2380
},
{
"entropy": 0.7043834974989295,
"epoch": 0.5462857142857143,
"grad_norm": 7.375,
"learning_rate": 9.554967524657206e-06,
"loss": 0.9789829254150391,
"mean_token_accuracy": 0.8271778743714094,
"num_tokens": 7720028.0,
"step": 2390
},
{
"entropy": 0.8476279047317803,
"epoch": 0.5485714285714286,
"grad_norm": 7.6875,
"learning_rate": 9.506855905701228e-06,
"loss": 1.1467313766479492,
"mean_token_accuracy": 0.8044891074299813,
"num_tokens": 7754391.0,
"step": 2400
},
{
"entropy": 0.7447409811429679,
"epoch": 0.5508571428571428,
"grad_norm": 6.84375,
"learning_rate": 9.458744286745249e-06,
"loss": 1.0126939773559571,
"mean_token_accuracy": 0.8301733404397964,
"num_tokens": 7788615.0,
"step": 2410
},
{
"entropy": 0.6487678562290966,
"epoch": 0.5531428571428572,
"grad_norm": 6.90625,
"learning_rate": 9.410632667789273e-06,
"loss": 0.9349337577819824,
"mean_token_accuracy": 0.8430794902145863,
"num_tokens": 7823652.0,
"step": 2420
},
{
"entropy": 0.7297495853155851,
"epoch": 0.5554285714285714,
"grad_norm": 8.0,
"learning_rate": 9.362521048833294e-06,
"loss": 1.0516100883483888,
"mean_token_accuracy": 0.8286796424537897,
"num_tokens": 7855368.0,
"step": 2430
},
{
"entropy": 0.7656750591471791,
"epoch": 0.5577142857142857,
"grad_norm": 8.5,
"learning_rate": 9.314409429877316e-06,
"loss": 1.0632817268371582,
"mean_token_accuracy": 0.8258335165679455,
"num_tokens": 7885759.0,
"step": 2440
},
{
"entropy": 0.7843017770908773,
"epoch": 0.56,
"grad_norm": 8.875,
"learning_rate": 9.266297810921339e-06,
"loss": 1.074361228942871,
"mean_token_accuracy": 0.8084652818739414,
"num_tokens": 7916094.0,
"step": 2450
},
{
"entropy": 0.7119234027341008,
"epoch": 0.5622857142857143,
"grad_norm": 7.375,
"learning_rate": 9.21818619196536e-06,
"loss": 1.0436591148376464,
"mean_token_accuracy": 0.8270700290799141,
"num_tokens": 7948214.0,
"step": 2460
},
{
"entropy": 0.6967569976113737,
"epoch": 0.5645714285714286,
"grad_norm": 7.03125,
"learning_rate": 9.170074573009382e-06,
"loss": 0.9530592918395996,
"mean_token_accuracy": 0.8300783924758435,
"num_tokens": 7981204.0,
"step": 2470
},
{
"entropy": 0.7442635943181812,
"epoch": 0.5668571428571428,
"grad_norm": 6.96875,
"learning_rate": 9.121962954053405e-06,
"loss": 1.0191211700439453,
"mean_token_accuracy": 0.8192649222910404,
"num_tokens": 8013076.0,
"step": 2480
},
{
"entropy": 0.7923426426947117,
"epoch": 0.5691428571428572,
"grad_norm": 7.25,
"learning_rate": 9.073851335097427e-06,
"loss": 1.1116843223571777,
"mean_token_accuracy": 0.813247837871313,
"num_tokens": 8047471.0,
"step": 2490
},
{
"entropy": 0.7783824296668171,
"epoch": 0.5714285714285714,
"grad_norm": 7.1875,
"learning_rate": 9.025739716141448e-06,
"loss": 1.0703957557678223,
"mean_token_accuracy": 0.813652578741312,
"num_tokens": 8075967.0,
"step": 2500
},
{
"entropy": 0.7609690563753247,
"epoch": 0.5737142857142857,
"grad_norm": 7.84375,
"learning_rate": 8.97762809718547e-06,
"loss": 0.9853609085083008,
"mean_token_accuracy": 0.8176385164260864,
"num_tokens": 8109554.0,
"step": 2510
},
{
"entropy": 0.796685915440321,
"epoch": 0.576,
"grad_norm": 7.8125,
"learning_rate": 8.929516478229493e-06,
"loss": 1.047004508972168,
"mean_token_accuracy": 0.811551482975483,
"num_tokens": 8142729.0,
"step": 2520
},
{
"entropy": 0.717453905660659,
"epoch": 0.5782857142857143,
"grad_norm": 7.0,
"learning_rate": 8.881404859273516e-06,
"loss": 1.0155123710632323,
"mean_token_accuracy": 0.8243556626141071,
"num_tokens": 8171878.0,
"step": 2530
},
{
"entropy": 0.7719296976923943,
"epoch": 0.5805714285714285,
"grad_norm": 6.625,
"learning_rate": 8.833293240317538e-06,
"loss": 1.060032844543457,
"mean_token_accuracy": 0.8186002224683762,
"num_tokens": 8203389.0,
"step": 2540
},
{
"entropy": 0.6772220591083169,
"epoch": 0.5828571428571429,
"grad_norm": 7.5625,
"learning_rate": 8.785181621361559e-06,
"loss": 0.9524177551269531,
"mean_token_accuracy": 0.8351402230560779,
"num_tokens": 8233812.0,
"step": 2550
},
{
"entropy": 0.7519471907988191,
"epoch": 0.5851428571428572,
"grad_norm": 7.15625,
"learning_rate": 8.737070002405581e-06,
"loss": 1.0217690467834473,
"mean_token_accuracy": 0.8147253841161728,
"num_tokens": 8264075.0,
"step": 2560
},
{
"entropy": 0.8792341394349933,
"epoch": 0.5874285714285714,
"grad_norm": 7.625,
"learning_rate": 8.688958383449604e-06,
"loss": 1.171504306793213,
"mean_token_accuracy": 0.7875504352152347,
"num_tokens": 8294266.0,
"step": 2570
},
{
"entropy": 0.5147198906168342,
"epoch": 0.5897142857142857,
"grad_norm": 7.1875,
"learning_rate": 8.640846764493626e-06,
"loss": 0.7446643352508545,
"mean_token_accuracy": 0.8638051569461822,
"num_tokens": 8328371.0,
"step": 2580
},
{
"entropy": 0.5512435308657586,
"epoch": 0.592,
"grad_norm": 6.71875,
"learning_rate": 8.592735145537649e-06,
"loss": 0.7508518695831299,
"mean_token_accuracy": 0.8605974681675435,
"num_tokens": 8358614.0,
"step": 2590
},
{
"entropy": 0.753514638543129,
"epoch": 0.5942857142857143,
"grad_norm": 7.96875,
"learning_rate": 8.54462352658167e-06,
"loss": 1.0647204399108887,
"mean_token_accuracy": 0.8166808724403382,
"num_tokens": 8390572.0,
"step": 2600
},
{
"entropy": 0.6976428182795644,
"epoch": 0.5965714285714285,
"grad_norm": 6.96875,
"learning_rate": 8.496511907625692e-06,
"loss": 0.9744165420532227,
"mean_token_accuracy": 0.8334845989942551,
"num_tokens": 8422186.0,
"step": 2610
},
{
"entropy": 0.6873942642472685,
"epoch": 0.5988571428571429,
"grad_norm": 8.1875,
"learning_rate": 8.448400288669715e-06,
"loss": 1.0646495819091797,
"mean_token_accuracy": 0.8329671390354634,
"num_tokens": 8456520.0,
"step": 2620
},
{
"entropy": 0.7481124849990011,
"epoch": 0.6011428571428571,
"grad_norm": 7.15625,
"learning_rate": 8.400288669713737e-06,
"loss": 0.9621360778808594,
"mean_token_accuracy": 0.8160779684782028,
"num_tokens": 8489868.0,
"step": 2630
},
{
"entropy": 0.7540229024365545,
"epoch": 0.6034285714285714,
"grad_norm": 8.1875,
"learning_rate": 8.352177050757758e-06,
"loss": 1.068429946899414,
"mean_token_accuracy": 0.8157521851360798,
"num_tokens": 8522110.0,
"step": 2640
},
{
"entropy": 0.8098990395665169,
"epoch": 0.6057142857142858,
"grad_norm": 7.46875,
"learning_rate": 8.30406543180178e-06,
"loss": 1.0495105743408204,
"mean_token_accuracy": 0.8076829589903355,
"num_tokens": 8554094.0,
"step": 2650
},
{
"entropy": 0.8042045352049172,
"epoch": 0.608,
"grad_norm": 7.25,
"learning_rate": 8.255953812845803e-06,
"loss": 1.1015840530395509,
"mean_token_accuracy": 0.8066806077957154,
"num_tokens": 8589902.0,
"step": 2660
},
{
"entropy": 0.9022464168258011,
"epoch": 0.6102857142857143,
"grad_norm": 6.59375,
"learning_rate": 8.207842193889826e-06,
"loss": 1.2131352424621582,
"mean_token_accuracy": 0.7915476217865944,
"num_tokens": 8623794.0,
"step": 2670
},
{
"entropy": 0.8746935517527163,
"epoch": 0.6125714285714285,
"grad_norm": 6.96875,
"learning_rate": 8.159730574933848e-06,
"loss": 1.1575665473937988,
"mean_token_accuracy": 0.7986876778304577,
"num_tokens": 8651194.0,
"step": 2680
},
{
"entropy": 0.8122401271015406,
"epoch": 0.6148571428571429,
"grad_norm": 6.65625,
"learning_rate": 8.111618955977869e-06,
"loss": 1.0654847145080566,
"mean_token_accuracy": 0.8131648566573858,
"num_tokens": 8681096.0,
"step": 2690
},
{
"entropy": 0.8027309827506542,
"epoch": 0.6171428571428571,
"grad_norm": 9.0,
"learning_rate": 8.063507337021891e-06,
"loss": 1.1084778785705567,
"mean_token_accuracy": 0.8057775877416133,
"num_tokens": 8713083.0,
"step": 2700
},
{
"entropy": 0.7622825523838401,
"epoch": 0.6194285714285714,
"grad_norm": 7.59375,
"learning_rate": 8.015395718065914e-06,
"loss": 1.033258819580078,
"mean_token_accuracy": 0.818463982641697,
"num_tokens": 8745917.0,
"step": 2710
},
{
"entropy": 0.7353868483565748,
"epoch": 0.6217142857142857,
"grad_norm": 7.5,
"learning_rate": 7.967284099109935e-06,
"loss": 1.0230457305908203,
"mean_token_accuracy": 0.8215658769011498,
"num_tokens": 8781507.0,
"step": 2720
},
{
"entropy": 0.7007935558445751,
"epoch": 0.624,
"grad_norm": 7.375,
"learning_rate": 7.919172480153959e-06,
"loss": 0.9617188453674317,
"mean_token_accuracy": 0.8268887743353843,
"num_tokens": 8815964.0,
"step": 2730
},
{
"entropy": 0.7421483082696796,
"epoch": 0.6262857142857143,
"grad_norm": 7.25,
"learning_rate": 7.87106086119798e-06,
"loss": 1.0290477752685547,
"mean_token_accuracy": 0.8229492858052254,
"num_tokens": 8848344.0,
"step": 2740
},
{
"entropy": 0.73214913867414,
"epoch": 0.6285714285714286,
"grad_norm": 8.625,
"learning_rate": 7.822949242242002e-06,
"loss": 1.060285472869873,
"mean_token_accuracy": 0.8267331637442112,
"num_tokens": 8879118.0,
"step": 2750
},
{
"entropy": 0.8049950825981795,
"epoch": 0.6308571428571429,
"grad_norm": 7.625,
"learning_rate": 7.774837623286025e-06,
"loss": 1.1363885879516602,
"mean_token_accuracy": 0.8102126717567444,
"num_tokens": 8913125.0,
"step": 2760
},
{
"entropy": 0.6610826853662729,
"epoch": 0.6331428571428571,
"grad_norm": 6.125,
"learning_rate": 7.726726004330045e-06,
"loss": 0.9042505264282227,
"mean_token_accuracy": 0.8309091664850712,
"num_tokens": 8946194.0,
"step": 2770
},
{
"entropy": 0.6915491444058717,
"epoch": 0.6354285714285715,
"grad_norm": 8.0,
"learning_rate": 7.678614385374068e-06,
"loss": 0.96341552734375,
"mean_token_accuracy": 0.8264155894517898,
"num_tokens": 8982077.0,
"step": 2780
},
{
"entropy": 0.6272562616504729,
"epoch": 0.6377142857142857,
"grad_norm": 7.875,
"learning_rate": 7.63050276641809e-06,
"loss": 0.928917121887207,
"mean_token_accuracy": 0.8460888244211674,
"num_tokens": 9019879.0,
"step": 2790
},
{
"entropy": 0.701786683825776,
"epoch": 0.64,
"grad_norm": 7.1875,
"learning_rate": 7.582391147462112e-06,
"loss": 1.046267604827881,
"mean_token_accuracy": 0.8271472752094269,
"num_tokens": 9053435.0,
"step": 2800
},
{
"entropy": 0.8251914168708027,
"epoch": 0.6422857142857142,
"grad_norm": 7.8125,
"learning_rate": 7.534279528506135e-06,
"loss": 1.1346126556396485,
"mean_token_accuracy": 0.8051226794719696,
"num_tokens": 9087735.0,
"step": 2810
},
{
"entropy": 0.8158627865836025,
"epoch": 0.6445714285714286,
"grad_norm": 7.5,
"learning_rate": 7.486167909550157e-06,
"loss": 1.0751116752624512,
"mean_token_accuracy": 0.8058493196964264,
"num_tokens": 9120051.0,
"step": 2820
},
{
"entropy": 0.8153355809859931,
"epoch": 0.6468571428571429,
"grad_norm": 8.1875,
"learning_rate": 7.438056290594179e-06,
"loss": 1.1167887687683105,
"mean_token_accuracy": 0.8044289343059063,
"num_tokens": 9150131.0,
"step": 2830
},
{
"entropy": 0.7215716702863574,
"epoch": 0.6491428571428571,
"grad_norm": 6.8125,
"learning_rate": 7.389944671638201e-06,
"loss": 0.9800872802734375,
"mean_token_accuracy": 0.8230889447033405,
"num_tokens": 9183592.0,
"step": 2840
},
{
"entropy": 0.6650403100065887,
"epoch": 0.6514285714285715,
"grad_norm": 6.6875,
"learning_rate": 7.341833052682224e-06,
"loss": 0.930327320098877,
"mean_token_accuracy": 0.8409841381013393,
"num_tokens": 9215447.0,
"step": 2850
},
{
"entropy": 0.8310886896215379,
"epoch": 0.6537142857142857,
"grad_norm": 6.59375,
"learning_rate": 7.2937214337262455e-06,
"loss": 1.108950424194336,
"mean_token_accuracy": 0.8052147164940834,
"num_tokens": 9247756.0,
"step": 2860
},
{
"entropy": 0.7922366439364851,
"epoch": 0.656,
"grad_norm": 9.3125,
"learning_rate": 7.245609814770268e-06,
"loss": 1.089939498901367,
"mean_token_accuracy": 0.8171895481646061,
"num_tokens": 9281235.0,
"step": 2870
},
{
"entropy": 0.7316854421980679,
"epoch": 0.6582857142857143,
"grad_norm": 6.96875,
"learning_rate": 7.19749819581429e-06,
"loss": 0.975350284576416,
"mean_token_accuracy": 0.8272683911025525,
"num_tokens": 9315295.0,
"step": 2880
},
{
"entropy": 0.7693224214017391,
"epoch": 0.6605714285714286,
"grad_norm": 8.3125,
"learning_rate": 7.149386576858311e-06,
"loss": 1.1402573585510254,
"mean_token_accuracy": 0.8134943917393684,
"num_tokens": 9346923.0,
"step": 2890
},
{
"entropy": 0.7617660995572806,
"epoch": 0.6628571428571428,
"grad_norm": 7.59375,
"learning_rate": 7.101274957902335e-06,
"loss": 1.038425350189209,
"mean_token_accuracy": 0.8179185189306736,
"num_tokens": 9379433.0,
"step": 2900
},
{
"entropy": 0.7871399355120957,
"epoch": 0.6651428571428571,
"grad_norm": 7.46875,
"learning_rate": 7.053163338946356e-06,
"loss": 1.0193154335021972,
"mean_token_accuracy": 0.8183310203254223,
"num_tokens": 9413192.0,
"step": 2910
},
{
"entropy": 0.811190924886614,
"epoch": 0.6674285714285715,
"grad_norm": 6.625,
"learning_rate": 7.005051719990378e-06,
"loss": 1.1274406433105468,
"mean_token_accuracy": 0.8116770260035991,
"num_tokens": 9445678.0,
"step": 2920
},
{
"entropy": 0.8758432329632342,
"epoch": 0.6697142857142857,
"grad_norm": 8.6875,
"learning_rate": 6.9569401010344005e-06,
"loss": 1.195134162902832,
"mean_token_accuracy": 0.7941108390688896,
"num_tokens": 9476534.0,
"step": 2930
},
{
"entropy": 0.8360557379201055,
"epoch": 0.672,
"grad_norm": 6.46875,
"learning_rate": 6.908828482078422e-06,
"loss": 1.1135424613952636,
"mean_token_accuracy": 0.80475138053298,
"num_tokens": 9509834.0,
"step": 2940
},
{
"entropy": 0.8121384960599244,
"epoch": 0.6742857142857143,
"grad_norm": 7.09375,
"learning_rate": 6.860716863122444e-06,
"loss": 1.0921581268310547,
"mean_token_accuracy": 0.8104615144431591,
"num_tokens": 9544560.0,
"step": 2950
},
{
"entropy": 0.6809657582081854,
"epoch": 0.6765714285714286,
"grad_norm": 6.78125,
"learning_rate": 6.812605244166467e-06,
"loss": 0.9061110496520997,
"mean_token_accuracy": 0.8335768587887287,
"num_tokens": 9576699.0,
"step": 2960
},
{
"entropy": 0.7368661808781326,
"epoch": 0.6788571428571428,
"grad_norm": 7.0,
"learning_rate": 6.764493625210489e-06,
"loss": 0.9945035934448242,
"mean_token_accuracy": 0.8268292259424925,
"num_tokens": 9609831.0,
"step": 2970
},
{
"entropy": 0.7591518526896834,
"epoch": 0.6811428571428572,
"grad_norm": 7.875,
"learning_rate": 6.716382006254511e-06,
"loss": 1.0467313766479491,
"mean_token_accuracy": 0.8203754242509603,
"num_tokens": 9642043.0,
"step": 2980
},
{
"entropy": 0.6456474749371409,
"epoch": 0.6834285714285714,
"grad_norm": 8.5625,
"learning_rate": 6.668270387298533e-06,
"loss": 0.9298653602600098,
"mean_token_accuracy": 0.8404752813279629,
"num_tokens": 9672316.0,
"step": 2990
},
{
"entropy": 0.7651321108452975,
"epoch": 0.6857142857142857,
"grad_norm": 7.78125,
"learning_rate": 6.620158768342555e-06,
"loss": 0.9670675277709961,
"mean_token_accuracy": 0.8202950492501259,
"num_tokens": 9704667.0,
"step": 3000
},
{
"entropy": 0.7684257586486638,
"epoch": 0.688,
"grad_norm": 6.96875,
"learning_rate": 6.572047149386578e-06,
"loss": 1.0198678016662597,
"mean_token_accuracy": 0.8141922578215599,
"num_tokens": 9736453.0,
"step": 3010
},
{
"entropy": 0.9071576375514269,
"epoch": 0.6902857142857143,
"grad_norm": 7.46875,
"learning_rate": 6.5239355304306e-06,
"loss": 1.2006649017333983,
"mean_token_accuracy": 0.7815720088779926,
"num_tokens": 9766239.0,
"step": 3020
},
{
"entropy": 0.7002435548231005,
"epoch": 0.6925714285714286,
"grad_norm": 8.1875,
"learning_rate": 6.475823911474621e-06,
"loss": 1.0064776420593262,
"mean_token_accuracy": 0.8239927910268307,
"num_tokens": 9797633.0,
"step": 3030
},
{
"entropy": 0.7579085680190474,
"epoch": 0.6948571428571428,
"grad_norm": 7.71875,
"learning_rate": 6.427712292518644e-06,
"loss": 1.0041309356689454,
"mean_token_accuracy": 0.8205542616546154,
"num_tokens": 9829628.0,
"step": 3040
},
{
"entropy": 0.8784082194790244,
"epoch": 0.6971428571428572,
"grad_norm": 7.40625,
"learning_rate": 6.379600673562666e-06,
"loss": 1.1010237693786622,
"mean_token_accuracy": 0.7967388294637203,
"num_tokens": 9864302.0,
"step": 3050
},
{
"entropy": 0.6545436557382345,
"epoch": 0.6994285714285714,
"grad_norm": 7.71875,
"learning_rate": 6.331489054606688e-06,
"loss": 1.0129745483398438,
"mean_token_accuracy": 0.8387912206351757,
"num_tokens": 9895779.0,
"step": 3060
},
{
"entropy": 0.8425466694869101,
"epoch": 0.7017142857142857,
"grad_norm": 6.78125,
"learning_rate": 6.2833774356507104e-06,
"loss": 1.0562131881713868,
"mean_token_accuracy": 0.8017945110797882,
"num_tokens": 9924158.0,
"step": 3070
},
{
"entropy": 0.873399674333632,
"epoch": 0.704,
"grad_norm": 8.75,
"learning_rate": 6.235265816694732e-06,
"loss": 1.1048128128051757,
"mean_token_accuracy": 0.7917656324803829,
"num_tokens": 9955099.0,
"step": 3080
},
{
"entropy": 0.6073906374163925,
"epoch": 0.7062857142857143,
"grad_norm": 9.0625,
"learning_rate": 6.187154197738754e-06,
"loss": 0.8535347938537597,
"mean_token_accuracy": 0.8521837316453457,
"num_tokens": 9988123.0,
"step": 3090
},
{
"entropy": 0.8428573332726955,
"epoch": 0.7085714285714285,
"grad_norm": 7.15625,
"learning_rate": 6.139042578782777e-06,
"loss": 1.1206453323364258,
"mean_token_accuracy": 0.7989229038357735,
"num_tokens": 10016364.0,
"step": 3100
},
{
"entropy": 0.740996487159282,
"epoch": 0.7108571428571429,
"grad_norm": 7.96875,
"learning_rate": 6.090930959826799e-06,
"loss": 1.0498098373413085,
"mean_token_accuracy": 0.8253378972411156,
"num_tokens": 10047098.0,
"step": 3110
},
{
"entropy": 0.7634292658418417,
"epoch": 0.7131428571428572,
"grad_norm": 7.40625,
"learning_rate": 6.042819340870821e-06,
"loss": 1.027073860168457,
"mean_token_accuracy": 0.8156747639179229,
"num_tokens": 10078377.0,
"step": 3120
},
{
"entropy": 0.7800739608705044,
"epoch": 0.7154285714285714,
"grad_norm": 8.0625,
"learning_rate": 5.994707721914843e-06,
"loss": 1.0465456962585449,
"mean_token_accuracy": 0.8120176091790199,
"num_tokens": 10108276.0,
"step": 3130
},
{
"entropy": 0.6941058835014701,
"epoch": 0.7177142857142857,
"grad_norm": 8.25,
"learning_rate": 5.946596102958865e-06,
"loss": 0.9293928146362305,
"mean_token_accuracy": 0.8261455290019513,
"num_tokens": 10140397.0,
"step": 3140
},
{
"entropy": 0.7566414731554687,
"epoch": 0.72,
"grad_norm": 7.78125,
"learning_rate": 5.898484484002888e-06,
"loss": 1.0103553771972655,
"mean_token_accuracy": 0.8191342234611512,
"num_tokens": 10170396.0,
"step": 3150
},
{
"entropy": 0.6843882665038109,
"epoch": 0.7222857142857143,
"grad_norm": 6.90625,
"learning_rate": 5.85037286504691e-06,
"loss": 0.9306538581848145,
"mean_token_accuracy": 0.8384991563856602,
"num_tokens": 10203787.0,
"step": 3160
},
{
"entropy": 0.9223319502547384,
"epoch": 0.7245714285714285,
"grad_norm": 7.09375,
"learning_rate": 5.802261246090931e-06,
"loss": 1.2310810089111328,
"mean_token_accuracy": 0.7850386075675487,
"num_tokens": 10237964.0,
"step": 3170
},
{
"entropy": 0.9315114512108267,
"epoch": 0.7268571428571429,
"grad_norm": 7.875,
"learning_rate": 5.754149627134954e-06,
"loss": 1.2219575881958007,
"mean_token_accuracy": 0.788118976727128,
"num_tokens": 10272012.0,
"step": 3180
},
{
"entropy": 0.9613786770962178,
"epoch": 0.7291428571428571,
"grad_norm": 7.71875,
"learning_rate": 5.706038008178975e-06,
"loss": 1.2217192649841309,
"mean_token_accuracy": 0.7753416560590267,
"num_tokens": 10301067.0,
"step": 3190
},
{
"entropy": 0.8978491752408445,
"epoch": 0.7314285714285714,
"grad_norm": 8.125,
"learning_rate": 5.657926389222997e-06,
"loss": 1.220133399963379,
"mean_token_accuracy": 0.7887196414172649,
"num_tokens": 10332467.0,
"step": 3200
},
{
"entropy": 0.7975409649312496,
"epoch": 0.7337142857142858,
"grad_norm": 6.875,
"learning_rate": 5.60981477026702e-06,
"loss": 1.0842624664306642,
"mean_token_accuracy": 0.8157493643462658,
"num_tokens": 10363576.0,
"step": 3210
},
{
"entropy": 0.7229632311500609,
"epoch": 0.736,
"grad_norm": 5.84375,
"learning_rate": 5.561703151311042e-06,
"loss": 0.9485625267028809,
"mean_token_accuracy": 0.8276536233723164,
"num_tokens": 10395203.0,
"step": 3220
},
{
"entropy": 0.7023040059953928,
"epoch": 0.7382857142857143,
"grad_norm": 6.90625,
"learning_rate": 5.513591532355064e-06,
"loss": 1.0307831764221191,
"mean_token_accuracy": 0.8284949451684952,
"num_tokens": 10426392.0,
"step": 3230
},
{
"entropy": 0.7922056226991117,
"epoch": 0.7405714285714285,
"grad_norm": 7.78125,
"learning_rate": 5.465479913399086e-06,
"loss": 1.0614632606506347,
"mean_token_accuracy": 0.8134492255747319,
"num_tokens": 10461629.0,
"step": 3240
},
{
"entropy": 0.5897016246803105,
"epoch": 0.7428571428571429,
"grad_norm": 7.1875,
"learning_rate": 5.417368294443108e-06,
"loss": 0.9088504791259766,
"mean_token_accuracy": 0.8521728955209256,
"num_tokens": 10497681.0,
"step": 3250
},
{
"entropy": 0.7967038029804826,
"epoch": 0.7451428571428571,
"grad_norm": 7.8125,
"learning_rate": 5.36925667548713e-06,
"loss": 1.0916454315185546,
"mean_token_accuracy": 0.8093243841081857,
"num_tokens": 10531276.0,
"step": 3260
},
{
"entropy": 0.7693165981210768,
"epoch": 0.7474285714285714,
"grad_norm": 6.84375,
"learning_rate": 5.321145056531153e-06,
"loss": 0.9624992370605469,
"mean_token_accuracy": 0.818351661413908,
"num_tokens": 10560781.0,
"step": 3270
},
{
"entropy": 0.7283342545852065,
"epoch": 0.7497142857142857,
"grad_norm": 6.78125,
"learning_rate": 5.2730334375751746e-06,
"loss": 1.0297183990478516,
"mean_token_accuracy": 0.8240480080246926,
"num_tokens": 10594592.0,
"step": 3280
},
{
"entropy": 0.7524079182185233,
"epoch": 0.752,
"grad_norm": 6.96875,
"learning_rate": 5.224921818619197e-06,
"loss": 0.980162239074707,
"mean_token_accuracy": 0.8201256044209003,
"num_tokens": 10627039.0,
"step": 3290
},
{
"entropy": 0.7365978182293474,
"epoch": 0.7542857142857143,
"grad_norm": 6.9375,
"learning_rate": 5.1768101996632196e-06,
"loss": 0.9751132011413575,
"mean_token_accuracy": 0.8289193719625473,
"num_tokens": 10659890.0,
"step": 3300
},
{
"entropy": 0.766766385640949,
"epoch": 0.7565714285714286,
"grad_norm": 7.0,
"learning_rate": 5.128698580707241e-06,
"loss": 1.066256618499756,
"mean_token_accuracy": 0.813833087682724,
"num_tokens": 10689935.0,
"step": 3310
},
{
"entropy": 0.7413464878685773,
"epoch": 0.7588571428571429,
"grad_norm": 7.4375,
"learning_rate": 5.080586961751264e-06,
"loss": 0.9947978019714355,
"mean_token_accuracy": 0.8286945290863514,
"num_tokens": 10719202.0,
"step": 3320
},
{
"entropy": 0.8110045059584081,
"epoch": 0.7611428571428571,
"grad_norm": 6.875,
"learning_rate": 5.032475342795285e-06,
"loss": 1.1004474639892579,
"mean_token_accuracy": 0.8095826417207718,
"num_tokens": 10752706.0,
"step": 3330
},
{
"entropy": 0.8748351650312542,
"epoch": 0.7634285714285715,
"grad_norm": 5.71875,
"learning_rate": 4.984363723839308e-06,
"loss": 1.1687129020690918,
"mean_token_accuracy": 0.792143489792943,
"num_tokens": 10785853.0,
"step": 3340
},
{
"entropy": 0.7911639436148107,
"epoch": 0.7657142857142857,
"grad_norm": 7.25,
"learning_rate": 4.9362521048833295e-06,
"loss": 1.075576114654541,
"mean_token_accuracy": 0.8155123472213746,
"num_tokens": 10818229.0,
"step": 3350
},
{
"entropy": 0.7263018532656134,
"epoch": 0.768,
"grad_norm": 7.625,
"learning_rate": 4.888140485927352e-06,
"loss": 1.0433449745178223,
"mean_token_accuracy": 0.8173217661678791,
"num_tokens": 10850567.0,
"step": 3360
},
{
"entropy": 0.8579608911648393,
"epoch": 0.7702857142857142,
"grad_norm": 8.0,
"learning_rate": 4.840028866971374e-06,
"loss": 1.106894302368164,
"mean_token_accuracy": 0.7974334202706814,
"num_tokens": 10883673.0,
"step": 3370
},
{
"entropy": 0.844954667147249,
"epoch": 0.7725714285714286,
"grad_norm": 7.09375,
"learning_rate": 4.791917248015396e-06,
"loss": 1.1396818161010742,
"mean_token_accuracy": 0.8037762485444546,
"num_tokens": 10916999.0,
"step": 3380
},
{
"entropy": 0.8294042806141079,
"epoch": 0.7748571428571429,
"grad_norm": 7.15625,
"learning_rate": 4.743805629059418e-06,
"loss": 1.07614164352417,
"mean_token_accuracy": 0.8013096928596497,
"num_tokens": 10947976.0,
"step": 3390
},
{
"entropy": 0.699165354296565,
"epoch": 0.7771428571428571,
"grad_norm": 7.3125,
"learning_rate": 4.69569401010344e-06,
"loss": 0.9428619384765625,
"mean_token_accuracy": 0.8234991244971752,
"num_tokens": 10981402.0,
"step": 3400
},
{
"entropy": 0.6559101923368871,
"epoch": 0.7794285714285715,
"grad_norm": 8.6875,
"learning_rate": 4.647582391147463e-06,
"loss": 0.851567554473877,
"mean_token_accuracy": 0.8403317756950855,
"num_tokens": 11011139.0,
"step": 3410
},
{
"entropy": 0.8098050164990127,
"epoch": 0.7817142857142857,
"grad_norm": 7.53125,
"learning_rate": 4.5994707721914845e-06,
"loss": 1.11738862991333,
"mean_token_accuracy": 0.8105709552764893,
"num_tokens": 11044319.0,
"step": 3420
},
{
"entropy": 0.6640732565894722,
"epoch": 0.784,
"grad_norm": 8.125,
"learning_rate": 4.551359153235507e-06,
"loss": 0.9586344718933105,
"mean_token_accuracy": 0.8361151710152626,
"num_tokens": 11079905.0,
"step": 3430
},
{
"entropy": 0.7955016130581498,
"epoch": 0.7862857142857143,
"grad_norm": 8.0,
"learning_rate": 4.503247534279529e-06,
"loss": 1.0718993186950683,
"mean_token_accuracy": 0.8115546323359013,
"num_tokens": 11111800.0,
"step": 3440
},
{
"entropy": 0.7911881297826767,
"epoch": 0.7885714285714286,
"grad_norm": 7.78125,
"learning_rate": 4.455135915323551e-06,
"loss": 1.099710750579834,
"mean_token_accuracy": 0.8119720377027988,
"num_tokens": 11145332.0,
"step": 3450
},
{
"entropy": 0.774864933360368,
"epoch": 0.7908571428571428,
"grad_norm": 6.21875,
"learning_rate": 4.407024296367573e-06,
"loss": 1.0780227661132813,
"mean_token_accuracy": 0.8145800329744816,
"num_tokens": 11174470.0,
"step": 3460
},
{
"entropy": 0.6018477959558368,
"epoch": 0.7931428571428571,
"grad_norm": 7.4375,
"learning_rate": 4.358912677411595e-06,
"loss": 0.8521579742431641,
"mean_token_accuracy": 0.8514960691332817,
"num_tokens": 11210615.0,
"step": 3470
},
{
"entropy": 0.8444686807692051,
"epoch": 0.7954285714285714,
"grad_norm": 6.6875,
"learning_rate": 4.310801058455618e-06,
"loss": 1.1099799156188965,
"mean_token_accuracy": 0.8008836135268211,
"num_tokens": 11241513.0,
"step": 3480
},
{
"entropy": 0.829711533524096,
"epoch": 0.7977142857142857,
"grad_norm": 6.625,
"learning_rate": 4.2626894394996395e-06,
"loss": 1.0666452407836915,
"mean_token_accuracy": 0.8077532455325127,
"num_tokens": 11274813.0,
"step": 3490
},
{
"entropy": 0.7473221772350371,
"epoch": 0.8,
"grad_norm": 7.3125,
"learning_rate": 4.214577820543661e-06,
"loss": 1.0066685676574707,
"mean_token_accuracy": 0.8148701801896095,
"num_tokens": 11303959.0,
"step": 3500
},
{
"entropy": 0.8557392791844904,
"epoch": 0.8022857142857143,
"grad_norm": 7.6875,
"learning_rate": 4.166466201587684e-06,
"loss": 1.0541882514953613,
"mean_token_accuracy": 0.7998419582843781,
"num_tokens": 11334910.0,
"step": 3510
},
{
"entropy": 0.7890441759489477,
"epoch": 0.8045714285714286,
"grad_norm": 7.71875,
"learning_rate": 4.118354582631705e-06,
"loss": 1.0888317108154297,
"mean_token_accuracy": 0.8178003937005996,
"num_tokens": 11365426.0,
"step": 3520
},
{
"entropy": 0.7986143685877323,
"epoch": 0.8068571428571428,
"grad_norm": 6.78125,
"learning_rate": 4.070242963675728e-06,
"loss": 1.0438194274902344,
"mean_token_accuracy": 0.8172411516308784,
"num_tokens": 11396568.0,
"step": 3530
},
{
"entropy": 0.7023409645073115,
"epoch": 0.8091428571428572,
"grad_norm": 7.125,
"learning_rate": 4.02213134471975e-06,
"loss": 0.982151985168457,
"mean_token_accuracy": 0.8304105646908283,
"num_tokens": 11429858.0,
"step": 3540
},
{
"entropy": 0.8511648692190648,
"epoch": 0.8114285714285714,
"grad_norm": 7.625,
"learning_rate": 3.974019725763773e-06,
"loss": 1.118496799468994,
"mean_token_accuracy": 0.8004165187478065,
"num_tokens": 11458825.0,
"step": 3550
},
{
"entropy": 0.8242282169871032,
"epoch": 0.8137142857142857,
"grad_norm": 7.15625,
"learning_rate": 3.9259081068077945e-06,
"loss": 1.0889615058898925,
"mean_token_accuracy": 0.8154613308608532,
"num_tokens": 11485780.0,
"step": 3560
},
{
"entropy": 0.8761372335255146,
"epoch": 0.816,
"grad_norm": 8.1875,
"learning_rate": 3.877796487851816e-06,
"loss": 1.1666927337646484,
"mean_token_accuracy": 0.7958627745509148,
"num_tokens": 11515089.0,
"step": 3570
},
{
"entropy": 0.8123947971500456,
"epoch": 0.8182857142857143,
"grad_norm": 7.1875,
"learning_rate": 3.829684868895839e-06,
"loss": 1.0921098709106445,
"mean_token_accuracy": 0.8081369504332543,
"num_tokens": 11545683.0,
"step": 3580
},
{
"entropy": 0.7641672321595252,
"epoch": 0.8205714285714286,
"grad_norm": 12.875,
"learning_rate": 3.7815732499398603e-06,
"loss": 1.0089197158813477,
"mean_token_accuracy": 0.8187419034540653,
"num_tokens": 11579338.0,
"step": 3590
},
{
"entropy": 0.9396181921474636,
"epoch": 0.8228571428571428,
"grad_norm": 6.875,
"learning_rate": 3.733461630983883e-06,
"loss": 1.1994843482971191,
"mean_token_accuracy": 0.7850606590509415,
"num_tokens": 11611832.0,
"step": 3600
},
{
"entropy": 0.692871849052608,
"epoch": 0.8251428571428572,
"grad_norm": 7.4375,
"learning_rate": 3.685350012027905e-06,
"loss": 0.9562499046325683,
"mean_token_accuracy": 0.8297605454921723,
"num_tokens": 11647063.0,
"step": 3610
},
{
"entropy": 0.8553698582574725,
"epoch": 0.8274285714285714,
"grad_norm": 6.40625,
"learning_rate": 3.6372383930719274e-06,
"loss": 1.1813543319702149,
"mean_token_accuracy": 0.7899277493357658,
"num_tokens": 11678198.0,
"step": 3620
},
{
"entropy": 0.7769951789639891,
"epoch": 0.8297142857142857,
"grad_norm": 7.84375,
"learning_rate": 3.589126774115949e-06,
"loss": 1.1048757553100585,
"mean_token_accuracy": 0.8161457117646933,
"num_tokens": 11711274.0,
"step": 3630
},
{
"entropy": 0.7809062311425805,
"epoch": 0.832,
"grad_norm": 7.03125,
"learning_rate": 3.5410151551599716e-06,
"loss": 1.116710090637207,
"mean_token_accuracy": 0.8137276962399482,
"num_tokens": 11742228.0,
"step": 3640
},
{
"entropy": 0.7451124029234052,
"epoch": 0.8342857142857143,
"grad_norm": 7.53125,
"learning_rate": 3.4929035362039937e-06,
"loss": 0.9379715919494629,
"mean_token_accuracy": 0.8171642825007439,
"num_tokens": 11773088.0,
"step": 3650
},
{
"entropy": 0.7952216092497111,
"epoch": 0.8365714285714285,
"grad_norm": 6.40625,
"learning_rate": 3.4447919172480153e-06,
"loss": 1.1145612716674804,
"mean_token_accuracy": 0.8073516443371773,
"num_tokens": 11805230.0,
"step": 3660
},
{
"entropy": 0.6641817208379507,
"epoch": 0.8388571428571429,
"grad_norm": 8.5625,
"learning_rate": 3.396680298292038e-06,
"loss": 0.8219084739685059,
"mean_token_accuracy": 0.8350592002272605,
"num_tokens": 11836944.0,
"step": 3670
},
{
"entropy": 0.8327237972058356,
"epoch": 0.8411428571428572,
"grad_norm": 7.90625,
"learning_rate": 3.34856867933606e-06,
"loss": 1.152987289428711,
"mean_token_accuracy": 0.8037018492817879,
"num_tokens": 11870633.0,
"step": 3680
},
{
"entropy": 0.7739829862490296,
"epoch": 0.8434285714285714,
"grad_norm": 7.6875,
"learning_rate": 3.3004570603800824e-06,
"loss": 1.0689297676086427,
"mean_token_accuracy": 0.8115721188485623,
"num_tokens": 11901509.0,
"step": 3690
},
{
"entropy": 0.7023711124435067,
"epoch": 0.8457142857142858,
"grad_norm": 7.09375,
"learning_rate": 3.252345441424104e-06,
"loss": 0.9941452980041504,
"mean_token_accuracy": 0.8265939429402351,
"num_tokens": 11931513.0,
"step": 3700
},
{
"entropy": 0.8765215444844217,
"epoch": 0.848,
"grad_norm": 7.75,
"learning_rate": 3.204233822468126e-06,
"loss": 1.1260786056518555,
"mean_token_accuracy": 0.7915762890130281,
"num_tokens": 11964449.0,
"step": 3710
},
{
"entropy": 0.8084148010239005,
"epoch": 0.8502857142857143,
"grad_norm": 6.84375,
"learning_rate": 3.1561222035121486e-06,
"loss": 1.1048534393310547,
"mean_token_accuracy": 0.8068965047597885,
"num_tokens": 11994053.0,
"step": 3720
},
{
"entropy": 0.8611850501969457,
"epoch": 0.8525714285714285,
"grad_norm": 6.6875,
"learning_rate": 3.1080105845561703e-06,
"loss": 1.1287246704101563,
"mean_token_accuracy": 0.7991515025496483,
"num_tokens": 12027638.0,
"step": 3730
},
{
"entropy": 0.6358927502296865,
"epoch": 0.8548571428571429,
"grad_norm": 7.0,
"learning_rate": 3.059898965600193e-06,
"loss": 0.9071885108947754,
"mean_token_accuracy": 0.8444961465895175,
"num_tokens": 12062607.0,
"step": 3740
},
{
"entropy": 0.8599010735284537,
"epoch": 0.8571428571428571,
"grad_norm": 6.5,
"learning_rate": 3.011787346644215e-06,
"loss": 1.148247241973877,
"mean_token_accuracy": 0.7988054849207401,
"num_tokens": 12093334.0,
"step": 3750
},
{
"entropy": 0.749000935535878,
"epoch": 0.8594285714285714,
"grad_norm": 6.90625,
"learning_rate": 2.9636757276882374e-06,
"loss": 1.0731889724731445,
"mean_token_accuracy": 0.8171209901571274,
"num_tokens": 12124493.0,
"step": 3760
},
{
"entropy": 0.6133915192447603,
"epoch": 0.8617142857142858,
"grad_norm": 6.0,
"learning_rate": 2.915564108732259e-06,
"loss": 0.9234248161315918,
"mean_token_accuracy": 0.8530650399625301,
"num_tokens": 12160800.0,
"step": 3770
},
{
"entropy": 0.8550255595706403,
"epoch": 0.864,
"grad_norm": 7.40625,
"learning_rate": 2.867452489776281e-06,
"loss": 1.1787774085998535,
"mean_token_accuracy": 0.7914231061935425,
"num_tokens": 12189992.0,
"step": 3780
},
{
"entropy": 0.854400450270623,
"epoch": 0.8662857142857143,
"grad_norm": 6.5625,
"learning_rate": 2.8193408708203036e-06,
"loss": 1.1640611648559571,
"mean_token_accuracy": 0.8066024430096149,
"num_tokens": 12224329.0,
"step": 3790
},
{
"entropy": 0.8460091168992221,
"epoch": 0.8685714285714285,
"grad_norm": 6.96875,
"learning_rate": 2.7712292518643253e-06,
"loss": 1.1152153015136719,
"mean_token_accuracy": 0.806992469727993,
"num_tokens": 12257176.0,
"step": 3800
},
{
"entropy": 0.7765115794725717,
"epoch": 0.8708571428571429,
"grad_norm": 7.1875,
"learning_rate": 2.7231176329083474e-06,
"loss": 1.0872262954711913,
"mean_token_accuracy": 0.813801209628582,
"num_tokens": 12290364.0,
"step": 3810
},
{
"entropy": 0.7125355136580765,
"epoch": 0.8731428571428571,
"grad_norm": 6.3125,
"learning_rate": 2.67500601395237e-06,
"loss": 0.9770938873291015,
"mean_token_accuracy": 0.8250508345663548,
"num_tokens": 12325455.0,
"step": 3820
},
{
"entropy": 0.7758281454443932,
"epoch": 0.8754285714285714,
"grad_norm": 7.625,
"learning_rate": 2.626894394996392e-06,
"loss": 1.130514430999756,
"mean_token_accuracy": 0.8151266768574714,
"num_tokens": 12358823.0,
"step": 3830
},
{
"entropy": 0.7530996017158031,
"epoch": 0.8777142857142857,
"grad_norm": 7.6875,
"learning_rate": 2.578782776040414e-06,
"loss": 1.056538200378418,
"mean_token_accuracy": 0.8141079384833574,
"num_tokens": 12392420.0,
"step": 3840
},
{
"entropy": 0.582604228099808,
"epoch": 0.88,
"grad_norm": 8.3125,
"learning_rate": 2.530671157084436e-06,
"loss": 0.8646469116210938,
"mean_token_accuracy": 0.850695987790823,
"num_tokens": 12424048.0,
"step": 3850
},
{
"entropy": 0.8167831319384277,
"epoch": 0.8822857142857143,
"grad_norm": 7.09375,
"learning_rate": 2.482559538128458e-06,
"loss": 1.1348252296447754,
"mean_token_accuracy": 0.8092688016593457,
"num_tokens": 12455436.0,
"step": 3860
},
{
"entropy": 0.8215475841425359,
"epoch": 0.8845714285714286,
"grad_norm": 7.4375,
"learning_rate": 2.4344479191724803e-06,
"loss": 1.1215962409973144,
"mean_token_accuracy": 0.8079402819275856,
"num_tokens": 12489334.0,
"step": 3870
},
{
"entropy": 0.7927017042413353,
"epoch": 0.8868571428571429,
"grad_norm": 7.28125,
"learning_rate": 2.3863363002165024e-06,
"loss": 1.0800617218017579,
"mean_token_accuracy": 0.8097000844776631,
"num_tokens": 12522105.0,
"step": 3880
},
{
"entropy": 0.8486208325251937,
"epoch": 0.8891428571428571,
"grad_norm": 7.0,
"learning_rate": 2.338224681260525e-06,
"loss": 1.125669288635254,
"mean_token_accuracy": 0.7976283885538578,
"num_tokens": 12553195.0,
"step": 3890
},
{
"entropy": 0.8716784932184964,
"epoch": 0.8914285714285715,
"grad_norm": 6.96875,
"learning_rate": 2.2901130623045465e-06,
"loss": 1.1960984230041505,
"mean_token_accuracy": 0.7935221865773201,
"num_tokens": 12585132.0,
"step": 3900
},
{
"entropy": 0.8773073226213455,
"epoch": 0.8937142857142857,
"grad_norm": 8.6875,
"learning_rate": 2.2420014433485686e-06,
"loss": 1.166949462890625,
"mean_token_accuracy": 0.7921496272087097,
"num_tokens": 12620190.0,
"step": 3910
},
{
"entropy": 0.8945854822173714,
"epoch": 0.896,
"grad_norm": 7.90625,
"learning_rate": 2.193889824392591e-06,
"loss": 1.20922908782959,
"mean_token_accuracy": 0.7929078787565231,
"num_tokens": 12652043.0,
"step": 3920
},
{
"entropy": 0.7110437804833054,
"epoch": 0.8982857142857142,
"grad_norm": 7.4375,
"learning_rate": 2.145778205436613e-06,
"loss": 0.9799498558044434,
"mean_token_accuracy": 0.8256872028112412,
"num_tokens": 12686506.0,
"step": 3930
},
{
"entropy": 0.8520329046063125,
"epoch": 0.9005714285714286,
"grad_norm": 7.84375,
"learning_rate": 2.0976665864806353e-06,
"loss": 1.1127940177917481,
"mean_token_accuracy": 0.7984279960393905,
"num_tokens": 12717624.0,
"step": 3940
},
{
"entropy": 0.7722635400481522,
"epoch": 0.9028571428571428,
"grad_norm": 6.96875,
"learning_rate": 2.0495549675246573e-06,
"loss": 1.031348705291748,
"mean_token_accuracy": 0.8082475580275059,
"num_tokens": 12751004.0,
"step": 3950
},
{
"entropy": 0.8996719061397016,
"epoch": 0.9051428571428571,
"grad_norm": 9.0,
"learning_rate": 2.0014433485686794e-06,
"loss": 1.2313031196594237,
"mean_token_accuracy": 0.7899208262562751,
"num_tokens": 12784386.0,
"step": 3960
},
{
"entropy": 0.8467463178560137,
"epoch": 0.9074285714285715,
"grad_norm": 6.3125,
"learning_rate": 1.9533317296127015e-06,
"loss": 1.1081655502319336,
"mean_token_accuracy": 0.7957226369529963,
"num_tokens": 12813355.0,
"step": 3970
},
{
"entropy": 0.8022918193601072,
"epoch": 0.9097142857142857,
"grad_norm": 7.90625,
"learning_rate": 1.9052201106567236e-06,
"loss": 1.0847484588623046,
"mean_token_accuracy": 0.8091882210224867,
"num_tokens": 12846173.0,
"step": 3980
},
{
"entropy": 0.7512643322348594,
"epoch": 0.912,
"grad_norm": 7.34375,
"learning_rate": 1.8571084917007459e-06,
"loss": 1.0247625350952148,
"mean_token_accuracy": 0.8154100321233273,
"num_tokens": 12879534.0,
"step": 3990
},
{
"entropy": 0.8367441557347775,
"epoch": 0.9142857142857143,
"grad_norm": 7.15625,
"learning_rate": 1.808996872744768e-06,
"loss": 1.2222256660461426,
"mean_token_accuracy": 0.8002955429255962,
"num_tokens": 12907935.0,
"step": 4000
},
{
"entropy": 0.849480548966676,
"epoch": 0.9165714285714286,
"grad_norm": 7.25,
"learning_rate": 1.7608852537887902e-06,
"loss": 1.1237051963806153,
"mean_token_accuracy": 0.7980944596230983,
"num_tokens": 12939436.0,
"step": 4010
},
{
"entropy": 0.7073171893134713,
"epoch": 0.9188571428571428,
"grad_norm": 7.6875,
"learning_rate": 1.7127736348328123e-06,
"loss": 1.0514840126037597,
"mean_token_accuracy": 0.8278530709445476,
"num_tokens": 12968488.0,
"step": 4020
},
{
"entropy": 0.7504108159802854,
"epoch": 0.9211428571428572,
"grad_norm": 7.96875,
"learning_rate": 1.6646620158768346e-06,
"loss": 1.0060768127441406,
"mean_token_accuracy": 0.8199899084866047,
"num_tokens": 13002635.0,
"step": 4030
},
{
"entropy": 0.906342108361423,
"epoch": 0.9234285714285714,
"grad_norm": 6.84375,
"learning_rate": 1.6165503969208565e-06,
"loss": 1.2012577056884766,
"mean_token_accuracy": 0.7861776262521744,
"num_tokens": 13034904.0,
"step": 4040
},
{
"entropy": 0.8890602920204401,
"epoch": 0.9257142857142857,
"grad_norm": 7.09375,
"learning_rate": 1.5684387779648786e-06,
"loss": 1.1589385986328125,
"mean_token_accuracy": 0.7936351835727692,
"num_tokens": 13064519.0,
"step": 4050
},
{
"entropy": 0.8940521791577339,
"epoch": 0.928,
"grad_norm": 7.53125,
"learning_rate": 1.5203271590089009e-06,
"loss": 1.1503165245056153,
"mean_token_accuracy": 0.7895523980259895,
"num_tokens": 13098510.0,
"step": 4060
},
{
"entropy": 0.6112047893926501,
"epoch": 0.9302857142857143,
"grad_norm": 9.1875,
"learning_rate": 1.4722155400529227e-06,
"loss": 0.8700815200805664,
"mean_token_accuracy": 0.852671717107296,
"num_tokens": 13132618.0,
"step": 4070
},
{
"entropy": 0.7455820512957871,
"epoch": 0.9325714285714286,
"grad_norm": 6.96875,
"learning_rate": 1.424103921096945e-06,
"loss": 0.9891318321228028,
"mean_token_accuracy": 0.8168230719864369,
"num_tokens": 13161914.0,
"step": 4080
},
{
"entropy": 0.8070791523903609,
"epoch": 0.9348571428571428,
"grad_norm": 7.34375,
"learning_rate": 1.375992302140967e-06,
"loss": 1.1282638549804687,
"mean_token_accuracy": 0.8067759692668914,
"num_tokens": 13189053.0,
"step": 4090
},
{
"entropy": 0.8544201260432601,
"epoch": 0.9371428571428572,
"grad_norm": 7.34375,
"learning_rate": 1.3278806831849894e-06,
"loss": 1.2156527519226075,
"mean_token_accuracy": 0.8019159339368344,
"num_tokens": 13219478.0,
"step": 4100
},
{
"entropy": 0.8153353109024465,
"epoch": 0.9394285714285714,
"grad_norm": 7.84375,
"learning_rate": 1.2797690642290115e-06,
"loss": 1.0747637748718262,
"mean_token_accuracy": 0.8093126803636551,
"num_tokens": 13254616.0,
"step": 4110
},
{
"entropy": 0.7539664410986007,
"epoch": 0.9417142857142857,
"grad_norm": 7.78125,
"learning_rate": 1.2316574452730336e-06,
"loss": 1.0411237716674804,
"mean_token_accuracy": 0.8247020401060581,
"num_tokens": 13286977.0,
"step": 4120
},
{
"entropy": 0.7033959114924073,
"epoch": 0.944,
"grad_norm": 7.28125,
"learning_rate": 1.1835458263170556e-06,
"loss": 0.9389317512512207,
"mean_token_accuracy": 0.8293626546859741,
"num_tokens": 13320518.0,
"step": 4130
},
{
"entropy": 0.8039538188837468,
"epoch": 0.9462857142857143,
"grad_norm": 7.34375,
"learning_rate": 1.1354342073610777e-06,
"loss": 1.0717804908752442,
"mean_token_accuracy": 0.8100807063281537,
"num_tokens": 13349708.0,
"step": 4140
},
{
"entropy": 0.6700900404714047,
"epoch": 0.9485714285714286,
"grad_norm": 5.40625,
"learning_rate": 1.0873225884050998e-06,
"loss": 0.8449858665466309,
"mean_token_accuracy": 0.8380967788398266,
"num_tokens": 13382386.0,
"step": 4150
},
{
"entropy": 0.7454655093140901,
"epoch": 0.9508571428571428,
"grad_norm": 8.1875,
"learning_rate": 1.039210969449122e-06,
"loss": 1.0423049926757812,
"mean_token_accuracy": 0.8296139296144247,
"num_tokens": 13415633.0,
"step": 4160
},
{
"entropy": 0.651054497435689,
"epoch": 0.9531428571428572,
"grad_norm": 7.46875,
"learning_rate": 9.910993504931442e-07,
"loss": 0.9426624298095703,
"mean_token_accuracy": 0.8385513253509999,
"num_tokens": 13447710.0,
"step": 4170
},
{
"entropy": 0.8339191220700741,
"epoch": 0.9554285714285714,
"grad_norm": 9.0625,
"learning_rate": 9.429877315371664e-07,
"loss": 1.211918830871582,
"mean_token_accuracy": 0.801718657463789,
"num_tokens": 13477514.0,
"step": 4180
},
{
"entropy": 0.8227419966831804,
"epoch": 0.9577142857142857,
"grad_norm": 7.09375,
"learning_rate": 8.948761125811884e-07,
"loss": 1.0787554740905763,
"mean_token_accuracy": 0.8115898109972477,
"num_tokens": 13512089.0,
"step": 4190
},
{
"entropy": 0.8163104236125946,
"epoch": 0.96,
"grad_norm": 5.71875,
"learning_rate": 8.467644936252106e-07,
"loss": 1.0611876487731933,
"mean_token_accuracy": 0.8015380769968032,
"num_tokens": 13545584.0,
"step": 4200
},
{
"entropy": 0.7111412956379354,
"epoch": 0.9622857142857143,
"grad_norm": 7.40625,
"learning_rate": 7.986528746692326e-07,
"loss": 0.9729216575622559,
"mean_token_accuracy": 0.8238789007067681,
"num_tokens": 13578776.0,
"step": 4210
},
{
"entropy": 0.8085635328665376,
"epoch": 0.9645714285714285,
"grad_norm": 7.5,
"learning_rate": 7.505412557132548e-07,
"loss": 1.1126985549926758,
"mean_token_accuracy": 0.8126947581768036,
"num_tokens": 13612547.0,
"step": 4220
},
{
"entropy": 0.7815977847203612,
"epoch": 0.9668571428571429,
"grad_norm": 8.125,
"learning_rate": 7.02429636757277e-07,
"loss": 1.1313226699829102,
"mean_token_accuracy": 0.809683870524168,
"num_tokens": 13643015.0,
"step": 4230
},
{
"entropy": 0.7985246267169714,
"epoch": 0.9691428571428572,
"grad_norm": 9.1875,
"learning_rate": 6.54318017801299e-07,
"loss": 1.0159822463989259,
"mean_token_accuracy": 0.8185107290744782,
"num_tokens": 13675162.0,
"step": 4240
},
{
"entropy": 0.671059988765046,
"epoch": 0.9714285714285714,
"grad_norm": 8.0625,
"learning_rate": 6.062063988453211e-07,
"loss": 0.9259526252746582,
"mean_token_accuracy": 0.8424249842762948,
"num_tokens": 13710886.0,
"step": 4250
},
{
"entropy": 0.7151353804394602,
"epoch": 0.9737142857142858,
"grad_norm": 7.03125,
"learning_rate": 5.580947798893433e-07,
"loss": 0.9961103439331055,
"mean_token_accuracy": 0.8268160626292229,
"num_tokens": 13747143.0,
"step": 4260
},
{
"entropy": 0.825507890433073,
"epoch": 0.976,
"grad_norm": 8.4375,
"learning_rate": 5.099831609333655e-07,
"loss": 1.116166591644287,
"mean_token_accuracy": 0.8088098622858524,
"num_tokens": 13779619.0,
"step": 4270
},
{
"entropy": 0.8729933000169694,
"epoch": 0.9782857142857143,
"grad_norm": 7.5625,
"learning_rate": 4.618715419773876e-07,
"loss": 1.1322175025939942,
"mean_token_accuracy": 0.7934217296540738,
"num_tokens": 13812123.0,
"step": 4280
},
{
"entropy": 0.739137639477849,
"epoch": 0.9805714285714285,
"grad_norm": 8.4375,
"learning_rate": 4.1375992302140966e-07,
"loss": 1.0004518508911133,
"mean_token_accuracy": 0.8218909092247486,
"num_tokens": 13844075.0,
"step": 4290
},
{
"entropy": 0.8571365299634636,
"epoch": 0.9828571428571429,
"grad_norm": 8.375,
"learning_rate": 3.6564830406543185e-07,
"loss": 1.1517833709716796,
"mean_token_accuracy": 0.7975596848875284,
"num_tokens": 13874945.0,
"step": 4300
},
{
"entropy": 0.8440510330721736,
"epoch": 0.9851428571428571,
"grad_norm": 8.5,
"learning_rate": 3.17536685109454e-07,
"loss": 1.165059471130371,
"mean_token_accuracy": 0.8028948895633221,
"num_tokens": 13906888.0,
"step": 4310
},
{
"entropy": 0.839153022505343,
"epoch": 0.9874285714285714,
"grad_norm": 7.5,
"learning_rate": 2.694250661534761e-07,
"loss": 1.0769323348999023,
"mean_token_accuracy": 0.801658408343792,
"num_tokens": 13942830.0,
"step": 4320
},
{
"entropy": 0.7648129913024604,
"epoch": 0.9897142857142858,
"grad_norm": 11.9375,
"learning_rate": 2.2131344719749822e-07,
"loss": 1.0284333229064941,
"mean_token_accuracy": 0.8126491412520409,
"num_tokens": 13975429.0,
"step": 4330
},
{
"entropy": 0.7054416437633335,
"epoch": 0.992,
"grad_norm": 6.625,
"learning_rate": 1.7320182824152033e-07,
"loss": 0.9879807472229004,
"mean_token_accuracy": 0.834271340072155,
"num_tokens": 14007911.0,
"step": 4340
},
{
"entropy": 0.5742446383461356,
"epoch": 0.9942857142857143,
"grad_norm": 6.8125,
"learning_rate": 1.2509020928554246e-07,
"loss": 0.8198482513427734,
"mean_token_accuracy": 0.8546571791172027,
"num_tokens": 14041386.0,
"step": 4350
},
{
"entropy": 0.8128698419779539,
"epoch": 0.9965714285714286,
"grad_norm": 6.78125,
"learning_rate": 7.69785903295646e-08,
"loss": 1.0970548629760741,
"mean_token_accuracy": 0.8060387209057808,
"num_tokens": 14074136.0,
"step": 4360
},
{
"entropy": 0.7844365012831986,
"epoch": 0.9988571428571429,
"grad_norm": 8.0625,
"learning_rate": 2.8866971373586724e-08,
"loss": 1.0246350288391113,
"mean_token_accuracy": 0.8180203422904014,
"num_tokens": 14106425.0,
"step": 4370
}
],
"logging_steps": 10,
"max_steps": 4375,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.602238427340718e+17,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}