{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 500, "global_step": 4375, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 0.4608087057247758, "epoch": 0.002285714285714286, "grad_norm": 262.0, "learning_rate": 8.256880733944956e-07, "loss": 4.128694152832031, "mean_token_accuracy": 0.5559752065688371, "num_tokens": 30583.0, "step": 10 }, { "entropy": 0.4808954084292054, "epoch": 0.004571428571428572, "grad_norm": 208.0, "learning_rate": 1.743119266055046e-06, "loss": 4.0306652069091795, "mean_token_accuracy": 0.5491989776492119, "num_tokens": 64875.0, "step": 20 }, { "entropy": 0.4882832657545805, "epoch": 0.006857142857142857, "grad_norm": 88.0, "learning_rate": 2.6605504587155968e-06, "loss": 3.4539260864257812, "mean_token_accuracy": 0.5994260810315609, "num_tokens": 96479.0, "step": 30 }, { "entropy": 0.6207152051851154, "epoch": 0.009142857142857144, "grad_norm": 50.25, "learning_rate": 3.5779816513761473e-06, "loss": 3.065783882141113, "mean_token_accuracy": 0.6057824719697237, "num_tokens": 129267.0, "step": 40 }, { "entropy": 0.7509429801255465, "epoch": 0.011428571428571429, "grad_norm": 47.5, "learning_rate": 4.4954128440366975e-06, "loss": 2.414494514465332, "mean_token_accuracy": 0.6280621752142906, "num_tokens": 157969.0, "step": 50 }, { "entropy": 0.9442974735051394, "epoch": 0.013714285714285714, "grad_norm": 21.625, "learning_rate": 5.412844036697248e-06, "loss": 2.0897136688232423, "mean_token_accuracy": 0.6582186311483383, "num_tokens": 191753.0, "step": 60 }, { "entropy": 1.133295001834631, "epoch": 0.016, "grad_norm": 15.6875, "learning_rate": 6.330275229357799e-06, "loss": 1.9386701583862305, "mean_token_accuracy": 0.6817213766276836, "num_tokens": 224874.0, "step": 70 }, { "entropy": 1.161771859228611, "epoch": 0.018285714285714287, "grad_norm": 18.875, "learning_rate": 7.247706422018349e-06, "loss": 1.6953561782836915, "mean_token_accuracy": 0.7058230180293321, "num_tokens": 259557.0, "step": 80 }, { "entropy": 1.0966269705444573, "epoch": 0.02057142857142857, "grad_norm": 15.0625, "learning_rate": 8.1651376146789e-06, "loss": 1.4140602111816407, "mean_token_accuracy": 0.7321123115718364, "num_tokens": 290863.0, "step": 90 }, { "entropy": 1.0357405820861458, "epoch": 0.022857142857142857, "grad_norm": 16.75, "learning_rate": 9.08256880733945e-06, "loss": 1.3797801971435546, "mean_token_accuracy": 0.7626342628151178, "num_tokens": 324054.0, "step": 100 }, { "entropy": 0.9538093984127045, "epoch": 0.025142857142857144, "grad_norm": 11.75, "learning_rate": 1e-05, "loss": 1.3015310287475585, "mean_token_accuracy": 0.7864577785134316, "num_tokens": 358048.0, "step": 110 }, { "entropy": 0.931211198028177, "epoch": 0.027428571428571427, "grad_norm": 12.625, "learning_rate": 1.091743119266055e-05, "loss": 1.2297636985778808, "mean_token_accuracy": 0.7865072574466467, "num_tokens": 389056.0, "step": 120 }, { "entropy": 0.9721011022105813, "epoch": 0.029714285714285714, "grad_norm": 15.125, "learning_rate": 1.1834862385321102e-05, "loss": 1.3690268516540527, "mean_token_accuracy": 0.7615244656801223, "num_tokens": 422901.0, "step": 130 }, { "entropy": 1.0186741236597299, "epoch": 0.032, "grad_norm": 10.3125, "learning_rate": 1.2752293577981652e-05, "loss": 1.3675042152404786, "mean_token_accuracy": 0.7797191683202982, "num_tokens": 452506.0, "step": 140 }, { "entropy": 0.9464143239893019, "epoch": 0.03428571428571429, "grad_norm": 13.0625, "learning_rate": 1.3669724770642203e-05, "loss": 1.3897374153137207, "mean_token_accuracy": 0.7744678042829036, "num_tokens": 483811.0, "step": 150 }, { "entropy": 0.9546993720345199, "epoch": 0.036571428571428574, "grad_norm": 10.0625, "learning_rate": 1.4587155963302753e-05, "loss": 1.2690893173217774, "mean_token_accuracy": 0.7874016337096691, "num_tokens": 511576.0, "step": 160 }, { "entropy": 1.002905413042754, "epoch": 0.038857142857142854, "grad_norm": 9.75, "learning_rate": 1.5504587155963304e-05, "loss": 1.3503832817077637, "mean_token_accuracy": 0.7721866790205241, "num_tokens": 543265.0, "step": 170 }, { "entropy": 0.7613611572422088, "epoch": 0.04114285714285714, "grad_norm": 10.4375, "learning_rate": 1.6422018348623852e-05, "loss": 0.977170753479004, "mean_token_accuracy": 0.8188995130360126, "num_tokens": 576882.0, "step": 180 }, { "entropy": 0.9535474652424455, "epoch": 0.04342857142857143, "grad_norm": 10.5625, "learning_rate": 1.7339449541284407e-05, "loss": 1.2448718070983886, "mean_token_accuracy": 0.7809058628976345, "num_tokens": 612893.0, "step": 190 }, { "entropy": 0.8438695728778839, "epoch": 0.045714285714285714, "grad_norm": 8.625, "learning_rate": 1.8256880733944955e-05, "loss": 1.161054801940918, "mean_token_accuracy": 0.810321356356144, "num_tokens": 645362.0, "step": 200 }, { "entropy": 0.8822290134616196, "epoch": 0.048, "grad_norm": 10.5, "learning_rate": 1.9174311926605506e-05, "loss": 1.1970745086669923, "mean_token_accuracy": 0.7906114481389522, "num_tokens": 678993.0, "step": 210 }, { "entropy": 0.9281622164882719, "epoch": 0.05028571428571429, "grad_norm": 9.25, "learning_rate": 1.9995188838104405e-05, "loss": 1.2374305725097656, "mean_token_accuracy": 0.7800474755465985, "num_tokens": 714146.0, "step": 220 }, { "entropy": 1.06684466060251, "epoch": 0.052571428571428575, "grad_norm": 8.25, "learning_rate": 1.9947077219148424e-05, "loss": 1.3902817726135255, "mean_token_accuracy": 0.7615161284804344, "num_tokens": 747373.0, "step": 230 }, { "entropy": 0.9200185919180512, "epoch": 0.054857142857142854, "grad_norm": 11.5, "learning_rate": 1.9898965600192447e-05, "loss": 1.201821517944336, "mean_token_accuracy": 0.7907239098101855, "num_tokens": 780155.0, "step": 240 }, { "entropy": 0.7674560694023966, "epoch": 0.05714285714285714, "grad_norm": 10.1875, "learning_rate": 1.985085398123647e-05, "loss": 1.063106632232666, "mean_token_accuracy": 0.8229942351579667, "num_tokens": 814128.0, "step": 250 }, { "entropy": 1.0007737869396807, "epoch": 0.05942857142857143, "grad_norm": 12.125, "learning_rate": 1.9802742362280492e-05, "loss": 1.2750150680541992, "mean_token_accuracy": 0.7728326875716448, "num_tokens": 845910.0, "step": 260 }, { "entropy": 0.9125091641210019, "epoch": 0.061714285714285715, "grad_norm": 10.125, "learning_rate": 1.9754630743324514e-05, "loss": 1.2319644927978515, "mean_token_accuracy": 0.7889250412583351, "num_tokens": 875424.0, "step": 270 }, { "entropy": 0.783863732777536, "epoch": 0.064, "grad_norm": 9.625, "learning_rate": 1.9706519124368537e-05, "loss": 1.1022482872009278, "mean_token_accuracy": 0.8143158428370952, "num_tokens": 912199.0, "step": 280 }, { "entropy": 0.7469094243831933, "epoch": 0.06628571428571428, "grad_norm": 9.0, "learning_rate": 1.965840750541256e-05, "loss": 1.012520694732666, "mean_token_accuracy": 0.8163027696311473, "num_tokens": 945467.0, "step": 290 }, { "entropy": 0.8857646442949771, "epoch": 0.06857142857142857, "grad_norm": 8.0625, "learning_rate": 1.9610295886456582e-05, "loss": 1.158743667602539, "mean_token_accuracy": 0.7900811523199082, "num_tokens": 975590.0, "step": 300 }, { "entropy": 0.909662488102913, "epoch": 0.07085714285714285, "grad_norm": 7.75, "learning_rate": 1.9562184267500604e-05, "loss": 1.2604731559753417, "mean_token_accuracy": 0.7842940967530012, "num_tokens": 1006723.0, "step": 310 }, { "entropy": 0.7755309957079589, "epoch": 0.07314285714285715, "grad_norm": 7.96875, "learning_rate": 1.9514072648544624e-05, "loss": 1.0989351272583008, "mean_token_accuracy": 0.8179159574210644, "num_tokens": 1039345.0, "step": 320 }, { "entropy": 0.6633960926905275, "epoch": 0.07542857142857143, "grad_norm": 8.75, "learning_rate": 1.9465961029588646e-05, "loss": 0.9405019760131836, "mean_token_accuracy": 0.8347477428615093, "num_tokens": 1072231.0, "step": 330 }, { "entropy": 0.7519668426364661, "epoch": 0.07771428571428571, "grad_norm": 11.125, "learning_rate": 1.941784941063267e-05, "loss": 1.120675754547119, "mean_token_accuracy": 0.8173437312245369, "num_tokens": 1107977.0, "step": 340 }, { "entropy": 0.8688408816233277, "epoch": 0.08, "grad_norm": 7.53125, "learning_rate": 1.936973779167669e-05, "loss": 1.137878131866455, "mean_token_accuracy": 0.8090878508985042, "num_tokens": 1137182.0, "step": 350 }, { "entropy": 0.7986814582720398, "epoch": 0.08228571428571428, "grad_norm": 8.0625, "learning_rate": 1.9321626172720714e-05, "loss": 1.0986030578613282, "mean_token_accuracy": 0.8076537061482668, "num_tokens": 1171297.0, "step": 360 }, { "entropy": 0.7295990631915629, "epoch": 0.08457142857142858, "grad_norm": 9.1875, "learning_rate": 1.9273514553764736e-05, "loss": 1.0371208190917969, "mean_token_accuracy": 0.8235810197889805, "num_tokens": 1203878.0, "step": 370 }, { "entropy": 0.7101914969272911, "epoch": 0.08685714285714285, "grad_norm": 8.5625, "learning_rate": 1.922540293480876e-05, "loss": 0.9649307250976562, "mean_token_accuracy": 0.8310844466090203, "num_tokens": 1238543.0, "step": 380 }, { "entropy": 0.8718695783987641, "epoch": 0.08914285714285715, "grad_norm": 9.0625, "learning_rate": 1.917729131585278e-05, "loss": 1.1625357627868653, "mean_token_accuracy": 0.8035985276103019, "num_tokens": 1269739.0, "step": 390 }, { "entropy": 0.7572122471407056, "epoch": 0.09142857142857143, "grad_norm": 7.375, "learning_rate": 1.9129179696896804e-05, "loss": 1.0944371223449707, "mean_token_accuracy": 0.8201560072600842, "num_tokens": 1300389.0, "step": 400 }, { "entropy": 0.7699693274684251, "epoch": 0.09371428571428571, "grad_norm": 7.5625, "learning_rate": 1.9081068077940826e-05, "loss": 1.1060125350952148, "mean_token_accuracy": 0.8187883667647838, "num_tokens": 1332082.0, "step": 410 }, { "entropy": 0.7879621520638466, "epoch": 0.096, "grad_norm": 7.125, "learning_rate": 1.9032956458984845e-05, "loss": 1.0424601554870605, "mean_token_accuracy": 0.8205794245004654, "num_tokens": 1365790.0, "step": 420 }, { "entropy": 0.7572797378525138, "epoch": 0.09828571428571428, "grad_norm": 7.34375, "learning_rate": 1.8984844840028868e-05, "loss": 1.078255844116211, "mean_token_accuracy": 0.8151584453880787, "num_tokens": 1400056.0, "step": 430 }, { "entropy": 0.7952604771591723, "epoch": 0.10057142857142858, "grad_norm": 7.375, "learning_rate": 1.893673322107289e-05, "loss": 1.105555820465088, "mean_token_accuracy": 0.8153948955237865, "num_tokens": 1430264.0, "step": 440 }, { "entropy": 0.8230121753178536, "epoch": 0.10285714285714286, "grad_norm": 7.125, "learning_rate": 1.8888621602116913e-05, "loss": 1.0710087776184083, "mean_token_accuracy": 0.8046157158911228, "num_tokens": 1461481.0, "step": 450 }, { "entropy": 0.9548539834097027, "epoch": 0.10514285714285715, "grad_norm": 7.09375, "learning_rate": 1.8840509983160935e-05, "loss": 1.240159511566162, "mean_token_accuracy": 0.7864300020039081, "num_tokens": 1493711.0, "step": 460 }, { "entropy": 1.0574401247315108, "epoch": 0.10742857142857143, "grad_norm": 7.90625, "learning_rate": 1.8792398364204958e-05, "loss": 1.345158290863037, "mean_token_accuracy": 0.7603430174291134, "num_tokens": 1526418.0, "step": 470 }, { "entropy": 0.8240675249136984, "epoch": 0.10971428571428571, "grad_norm": 7.65625, "learning_rate": 1.874428674524898e-05, "loss": 1.0730896949768067, "mean_token_accuracy": 0.8100373946130276, "num_tokens": 1558046.0, "step": 480 }, { "entropy": 0.8802061447873711, "epoch": 0.112, "grad_norm": 7.84375, "learning_rate": 1.8696175126293003e-05, "loss": 1.145187759399414, "mean_token_accuracy": 0.7953318640589714, "num_tokens": 1586212.0, "step": 490 }, { "entropy": 0.7748386798426509, "epoch": 0.11428571428571428, "grad_norm": 7.625, "learning_rate": 1.8648063507337025e-05, "loss": 0.9954061508178711, "mean_token_accuracy": 0.8151729434728623, "num_tokens": 1622364.0, "step": 500 }, { "entropy": 0.7383366953581572, "epoch": 0.11657142857142858, "grad_norm": 8.75, "learning_rate": 1.8599951888381044e-05, "loss": 0.9818957328796387, "mean_token_accuracy": 0.8187249258160592, "num_tokens": 1655806.0, "step": 510 }, { "entropy": 0.7778955462388695, "epoch": 0.11885714285714286, "grad_norm": 7.6875, "learning_rate": 1.8551840269425067e-05, "loss": 1.070115566253662, "mean_token_accuracy": 0.8072714075446129, "num_tokens": 1687198.0, "step": 520 }, { "entropy": 0.806643515639007, "epoch": 0.12114285714285715, "grad_norm": 8.5, "learning_rate": 1.850372865046909e-05, "loss": 1.1104951858520509, "mean_token_accuracy": 0.8077441163361072, "num_tokens": 1718591.0, "step": 530 }, { "entropy": 0.8236157631501555, "epoch": 0.12342857142857143, "grad_norm": 7.84375, "learning_rate": 1.8455617031513112e-05, "loss": 1.0954437255859375, "mean_token_accuracy": 0.8092149019241333, "num_tokens": 1750163.0, "step": 540 }, { "entropy": 0.9514989891089499, "epoch": 0.12571428571428572, "grad_norm": 8.0, "learning_rate": 1.8407505412557134e-05, "loss": 1.2232957839965821, "mean_token_accuracy": 0.7788458302617073, "num_tokens": 1783654.0, "step": 550 }, { "entropy": 0.8126472384203225, "epoch": 0.128, "grad_norm": 7.25, "learning_rate": 1.8359393793601157e-05, "loss": 1.1193376541137696, "mean_token_accuracy": 0.8038583904504776, "num_tokens": 1818298.0, "step": 560 }, { "entropy": 0.7461063047870994, "epoch": 0.13028571428571428, "grad_norm": 10.125, "learning_rate": 1.8311282174645176e-05, "loss": 1.0971127510070802, "mean_token_accuracy": 0.8208389431238174, "num_tokens": 1852353.0, "step": 570 }, { "entropy": 0.8738343502394855, "epoch": 0.13257142857142856, "grad_norm": 7.78125, "learning_rate": 1.8263170555689202e-05, "loss": 1.1203450202941894, "mean_token_accuracy": 0.7919381201267243, "num_tokens": 1883233.0, "step": 580 }, { "entropy": 0.9372453663498164, "epoch": 0.13485714285714287, "grad_norm": 7.09375, "learning_rate": 1.8215058936733224e-05, "loss": 1.2445517539978028, "mean_token_accuracy": 0.7886677496135235, "num_tokens": 1914856.0, "step": 590 }, { "entropy": 0.922083193808794, "epoch": 0.13714285714285715, "grad_norm": 7.28125, "learning_rate": 1.8166947317777243e-05, "loss": 1.2312170028686524, "mean_token_accuracy": 0.7963043257594109, "num_tokens": 1944932.0, "step": 600 }, { "entropy": 0.885446681920439, "epoch": 0.13942857142857143, "grad_norm": 7.75, "learning_rate": 1.8118835698821266e-05, "loss": 1.1832991600036622, "mean_token_accuracy": 0.7979222141206265, "num_tokens": 1977483.0, "step": 610 }, { "entropy": 0.7927633517421782, "epoch": 0.1417142857142857, "grad_norm": 10.875, "learning_rate": 1.807072407986529e-05, "loss": 1.072523021697998, "mean_token_accuracy": 0.8096244156360626, "num_tokens": 2012646.0, "step": 620 }, { "entropy": 0.8450389008037746, "epoch": 0.144, "grad_norm": 8.5625, "learning_rate": 1.802261246090931e-05, "loss": 1.1467965126037598, "mean_token_accuracy": 0.8004457049071789, "num_tokens": 2044969.0, "step": 630 }, { "entropy": 0.9473820111714304, "epoch": 0.1462857142857143, "grad_norm": 7.8125, "learning_rate": 1.7974500841953333e-05, "loss": 1.2415997505187988, "mean_token_accuracy": 0.7821900390088559, "num_tokens": 2077063.0, "step": 640 }, { "entropy": 0.8002779926173389, "epoch": 0.14857142857142858, "grad_norm": 7.1875, "learning_rate": 1.7926389222997356e-05, "loss": 1.08231201171875, "mean_token_accuracy": 0.8153595373034477, "num_tokens": 2108559.0, "step": 650 }, { "entropy": 0.7409520236775279, "epoch": 0.15085714285714286, "grad_norm": 6.625, "learning_rate": 1.7878277604041375e-05, "loss": 1.0647228240966797, "mean_token_accuracy": 0.8233258232474328, "num_tokens": 2143996.0, "step": 660 }, { "entropy": 0.6605528288520872, "epoch": 0.15314285714285714, "grad_norm": 7.0, "learning_rate": 1.7830165985085398e-05, "loss": 0.8986818313598632, "mean_token_accuracy": 0.8348655626177788, "num_tokens": 2177219.0, "step": 670 }, { "entropy": 0.8855553255416453, "epoch": 0.15542857142857142, "grad_norm": 7.25, "learning_rate": 1.7782054366129423e-05, "loss": 1.2236814498901367, "mean_token_accuracy": 0.7893378108739852, "num_tokens": 2209056.0, "step": 680 }, { "entropy": 0.7778299384750426, "epoch": 0.15771428571428572, "grad_norm": 8.75, "learning_rate": 1.7733942747173446e-05, "loss": 1.1849853515625, "mean_token_accuracy": 0.8148446299135685, "num_tokens": 2241537.0, "step": 690 }, { "entropy": 0.9553269637282937, "epoch": 0.16, "grad_norm": 7.9375, "learning_rate": 1.7685831128217465e-05, "loss": 1.185690212249756, "mean_token_accuracy": 0.7805978901684284, "num_tokens": 2273475.0, "step": 700 }, { "entropy": 0.921497387625277, "epoch": 0.16228571428571428, "grad_norm": 7.65625, "learning_rate": 1.7637719509261488e-05, "loss": 1.1969280242919922, "mean_token_accuracy": 0.7880251817405224, "num_tokens": 2303700.0, "step": 710 }, { "entropy": 0.9623362662270665, "epoch": 0.16457142857142856, "grad_norm": 7.84375, "learning_rate": 1.758960789030551e-05, "loss": 1.2279460906982422, "mean_token_accuracy": 0.7762100405991077, "num_tokens": 2335528.0, "step": 720 }, { "entropy": 0.7501861874945461, "epoch": 0.16685714285714287, "grad_norm": 6.53125, "learning_rate": 1.7541496271349533e-05, "loss": 1.092702579498291, "mean_token_accuracy": 0.8136215195059776, "num_tokens": 2369322.0, "step": 730 }, { "entropy": 0.741880859900266, "epoch": 0.16914285714285715, "grad_norm": 9.1875, "learning_rate": 1.7493384652393555e-05, "loss": 1.0542023658752442, "mean_token_accuracy": 0.8248877495527267, "num_tokens": 2402789.0, "step": 740 }, { "entropy": 0.7251557628624141, "epoch": 0.17142857142857143, "grad_norm": 7.21875, "learning_rate": 1.7445273033437578e-05, "loss": 0.9859682083129883, "mean_token_accuracy": 0.8190685380250216, "num_tokens": 2435813.0, "step": 750 }, { "entropy": 0.8274217823520302, "epoch": 0.1737142857142857, "grad_norm": 7.8125, "learning_rate": 1.7397161414481597e-05, "loss": 1.1144951820373534, "mean_token_accuracy": 0.8048250667750836, "num_tokens": 2469061.0, "step": 760 }, { "entropy": 0.9110285563394427, "epoch": 0.176, "grad_norm": 7.9375, "learning_rate": 1.7349049795525623e-05, "loss": 1.2487107276916505, "mean_token_accuracy": 0.7836838386952877, "num_tokens": 2499540.0, "step": 770 }, { "entropy": 0.7952723279595375, "epoch": 0.1782857142857143, "grad_norm": 8.125, "learning_rate": 1.7300938176569645e-05, "loss": 1.1460785865783691, "mean_token_accuracy": 0.8108866758644581, "num_tokens": 2528841.0, "step": 780 }, { "entropy": 0.8681487245485187, "epoch": 0.18057142857142858, "grad_norm": 7.0625, "learning_rate": 1.7252826557613664e-05, "loss": 1.088980770111084, "mean_token_accuracy": 0.7965113393962383, "num_tokens": 2560120.0, "step": 790 }, { "entropy": 0.7640921414829791, "epoch": 0.18285714285714286, "grad_norm": 9.75, "learning_rate": 1.7204714938657687e-05, "loss": 1.1072608947753906, "mean_token_accuracy": 0.81538320556283, "num_tokens": 2592460.0, "step": 800 }, { "entropy": 0.8132671658881009, "epoch": 0.18514285714285714, "grad_norm": 7.1875, "learning_rate": 1.715660331970171e-05, "loss": 1.1375692367553711, "mean_token_accuracy": 0.8027771405875683, "num_tokens": 2628458.0, "step": 810 }, { "entropy": 0.71722816741094, "epoch": 0.18742857142857142, "grad_norm": 6.625, "learning_rate": 1.7108491700745732e-05, "loss": 0.9269392013549804, "mean_token_accuracy": 0.8260728389024734, "num_tokens": 2663216.0, "step": 820 }, { "entropy": 0.7395319850184023, "epoch": 0.18971428571428572, "grad_norm": 8.0625, "learning_rate": 1.7060380081789754e-05, "loss": 0.9782637596130371, "mean_token_accuracy": 0.8158168852329254, "num_tokens": 2695026.0, "step": 830 }, { "entropy": 0.7296101478859782, "epoch": 0.192, "grad_norm": 7.21875, "learning_rate": 1.7012268462833777e-05, "loss": 1.0164703369140624, "mean_token_accuracy": 0.8283582173287869, "num_tokens": 2727324.0, "step": 840 }, { "entropy": 0.8305218723602593, "epoch": 0.19428571428571428, "grad_norm": 8.0, "learning_rate": 1.6964156843877796e-05, "loss": 1.1646985054016112, "mean_token_accuracy": 0.8054761447012424, "num_tokens": 2759422.0, "step": 850 }, { "entropy": 0.8524466481991112, "epoch": 0.19657142857142856, "grad_norm": 8.25, "learning_rate": 1.691604522492182e-05, "loss": 1.1327482223510743, "mean_token_accuracy": 0.8032685436308384, "num_tokens": 2792518.0, "step": 860 }, { "entropy": 0.6850544813089072, "epoch": 0.19885714285714284, "grad_norm": 8.1875, "learning_rate": 1.6867933605965844e-05, "loss": 0.9866686820983886, "mean_token_accuracy": 0.8292375847697258, "num_tokens": 2826870.0, "step": 870 }, { "entropy": 0.7483350836671889, "epoch": 0.20114285714285715, "grad_norm": 9.3125, "learning_rate": 1.6819821987009863e-05, "loss": 1.0796706199645996, "mean_token_accuracy": 0.8100242014974356, "num_tokens": 2859320.0, "step": 880 }, { "entropy": 0.761015557963401, "epoch": 0.20342857142857143, "grad_norm": 7.65625, "learning_rate": 1.6771710368053886e-05, "loss": 1.0168207168579102, "mean_token_accuracy": 0.8171908967196941, "num_tokens": 2893696.0, "step": 890 }, { "entropy": 0.7136277809739113, "epoch": 0.2057142857142857, "grad_norm": 6.75, "learning_rate": 1.672359874909791e-05, "loss": 0.9646918296813964, "mean_token_accuracy": 0.8310928396880627, "num_tokens": 2925196.0, "step": 900 }, { "entropy": 0.8552220237441361, "epoch": 0.208, "grad_norm": 7.28125, "learning_rate": 1.667548713014193e-05, "loss": 1.0989733695983888, "mean_token_accuracy": 0.8012546695768833, "num_tokens": 2957056.0, "step": 910 }, { "entropy": 0.8601699252612889, "epoch": 0.2102857142857143, "grad_norm": 7.09375, "learning_rate": 1.6627375511185953e-05, "loss": 1.1599449157714843, "mean_token_accuracy": 0.7934970580041408, "num_tokens": 2988772.0, "step": 920 }, { "entropy": 0.7465516209602356, "epoch": 0.21257142857142858, "grad_norm": 6.0625, "learning_rate": 1.6579263892229976e-05, "loss": 1.014716911315918, "mean_token_accuracy": 0.8273697007447481, "num_tokens": 3024521.0, "step": 930 }, { "entropy": 0.7951956107281148, "epoch": 0.21485714285714286, "grad_norm": 7.0, "learning_rate": 1.6531152273273995e-05, "loss": 1.023974895477295, "mean_token_accuracy": 0.81702711135149, "num_tokens": 3055362.0, "step": 940 }, { "entropy": 0.8373465910553932, "epoch": 0.21714285714285714, "grad_norm": 8.5625, "learning_rate": 1.6483040654318018e-05, "loss": 1.149094009399414, "mean_token_accuracy": 0.7994145810604095, "num_tokens": 3085932.0, "step": 950 }, { "entropy": 0.7051204042509198, "epoch": 0.21942857142857142, "grad_norm": 6.375, "learning_rate": 1.643492903536204e-05, "loss": 0.9659648895263672, "mean_token_accuracy": 0.8331427097320556, "num_tokens": 3114791.0, "step": 960 }, { "entropy": 0.7798629926517606, "epoch": 0.22171428571428572, "grad_norm": 7.1875, "learning_rate": 1.6386817416406066e-05, "loss": 1.008477783203125, "mean_token_accuracy": 0.8194496557116508, "num_tokens": 3149473.0, "step": 970 }, { "entropy": 0.6989101554267109, "epoch": 0.224, "grad_norm": 8.125, "learning_rate": 1.6338705797450085e-05, "loss": 0.9564552307128906, "mean_token_accuracy": 0.8339050948619843, "num_tokens": 3182913.0, "step": 980 }, { "entropy": 0.8009612016379833, "epoch": 0.22628571428571428, "grad_norm": 7.96875, "learning_rate": 1.6290594178494108e-05, "loss": 1.082752799987793, "mean_token_accuracy": 0.8148751087486744, "num_tokens": 3214329.0, "step": 990 }, { "entropy": 0.7472866786643863, "epoch": 0.22857142857142856, "grad_norm": 7.03125, "learning_rate": 1.624248255953813e-05, "loss": 0.9995194435119629, "mean_token_accuracy": 0.8205188862979412, "num_tokens": 3246465.0, "step": 1000 }, { "entropy": 0.8845632201060653, "epoch": 0.23085714285714284, "grad_norm": 7.28125, "learning_rate": 1.6194370940582153e-05, "loss": 1.1626070976257323, "mean_token_accuracy": 0.7972030624747276, "num_tokens": 3280259.0, "step": 1010 }, { "entropy": 0.7615264546126127, "epoch": 0.23314285714285715, "grad_norm": 6.59375, "learning_rate": 1.6146259321626175e-05, "loss": 1.0563675880432128, "mean_token_accuracy": 0.8191345028579236, "num_tokens": 3308134.0, "step": 1020 }, { "entropy": 0.7456497238948941, "epoch": 0.23542857142857143, "grad_norm": 9.125, "learning_rate": 1.6098147702670198e-05, "loss": 0.9785372734069824, "mean_token_accuracy": 0.8168387658894062, "num_tokens": 3339804.0, "step": 1030 }, { "entropy": 0.9259420620277524, "epoch": 0.2377142857142857, "grad_norm": 7.1875, "learning_rate": 1.6050036083714217e-05, "loss": 1.2626006126403808, "mean_token_accuracy": 0.7905944272875786, "num_tokens": 3374600.0, "step": 1040 }, { "entropy": 0.7013174806721508, "epoch": 0.24, "grad_norm": 7.28125, "learning_rate": 1.600192446475824e-05, "loss": 0.8472931861877442, "mean_token_accuracy": 0.834729814529419, "num_tokens": 3406084.0, "step": 1050 }, { "entropy": 0.8099798344075679, "epoch": 0.2422857142857143, "grad_norm": 8.375, "learning_rate": 1.5953812845802265e-05, "loss": 1.1302724838256837, "mean_token_accuracy": 0.8053847432136536, "num_tokens": 3436595.0, "step": 1060 }, { "entropy": 0.6409325916320086, "epoch": 0.24457142857142858, "grad_norm": 8.1875, "learning_rate": 1.5905701226846284e-05, "loss": 0.9276237487792969, "mean_token_accuracy": 0.8369442120194435, "num_tokens": 3468462.0, "step": 1070 }, { "entropy": 0.6651454066857696, "epoch": 0.24685714285714286, "grad_norm": 8.75, "learning_rate": 1.5857589607890307e-05, "loss": 0.9005106925964356, "mean_token_accuracy": 0.8366246894001961, "num_tokens": 3502363.0, "step": 1080 }, { "entropy": 0.6705873743630946, "epoch": 0.24914285714285714, "grad_norm": 6.96875, "learning_rate": 1.580947798893433e-05, "loss": 0.9289634704589844, "mean_token_accuracy": 0.8348163716495037, "num_tokens": 3532774.0, "step": 1090 }, { "entropy": 0.8024829808622599, "epoch": 0.25142857142857145, "grad_norm": 8.25, "learning_rate": 1.5761366369978352e-05, "loss": 1.1945523262023925, "mean_token_accuracy": 0.8085858777165413, "num_tokens": 3565974.0, "step": 1100 }, { "entropy": 0.7451043974608182, "epoch": 0.2537142857142857, "grad_norm": 7.0625, "learning_rate": 1.5713254751022374e-05, "loss": 1.0138811111450194, "mean_token_accuracy": 0.8233392249792815, "num_tokens": 3599243.0, "step": 1110 }, { "entropy": 0.8042388122528792, "epoch": 0.256, "grad_norm": 6.71875, "learning_rate": 1.5665143132066397e-05, "loss": 1.0674107551574707, "mean_token_accuracy": 0.8107536815106868, "num_tokens": 3631217.0, "step": 1120 }, { "entropy": 0.6658579808659851, "epoch": 0.2582857142857143, "grad_norm": 7.9375, "learning_rate": 1.5617031513110416e-05, "loss": 0.8685308456420898, "mean_token_accuracy": 0.8395798467099667, "num_tokens": 3663654.0, "step": 1130 }, { "entropy": 0.6915052223019302, "epoch": 0.26057142857142856, "grad_norm": 6.75, "learning_rate": 1.556891989415444e-05, "loss": 0.9267234802246094, "mean_token_accuracy": 0.8305907912552357, "num_tokens": 3695008.0, "step": 1140 }, { "entropy": 0.7746626659296453, "epoch": 0.26285714285714284, "grad_norm": 7.46875, "learning_rate": 1.552080827519846e-05, "loss": 1.1303828239440918, "mean_token_accuracy": 0.8152431160211563, "num_tokens": 3725769.0, "step": 1150 }, { "entropy": 0.815077618137002, "epoch": 0.2651428571428571, "grad_norm": 8.375, "learning_rate": 1.5472696656242483e-05, "loss": 1.1592507362365723, "mean_token_accuracy": 0.8096996866166591, "num_tokens": 3759222.0, "step": 1160 }, { "entropy": 0.9105647809803485, "epoch": 0.2674285714285714, "grad_norm": 7.84375, "learning_rate": 1.5424585037286506e-05, "loss": 1.2050976753234863, "mean_token_accuracy": 0.7931383229792118, "num_tokens": 3789235.0, "step": 1170 }, { "entropy": 0.8901564389467239, "epoch": 0.26971428571428574, "grad_norm": 7.40625, "learning_rate": 1.537647341833053e-05, "loss": 1.1315418243408204, "mean_token_accuracy": 0.7916867211461067, "num_tokens": 3822530.0, "step": 1180 }, { "entropy": 0.8138524909503758, "epoch": 0.272, "grad_norm": 7.46875, "learning_rate": 1.532836179937455e-05, "loss": 1.0824806213378906, "mean_token_accuracy": 0.807539875805378, "num_tokens": 3857294.0, "step": 1190 }, { "entropy": 0.8327909021638333, "epoch": 0.2742857142857143, "grad_norm": 7.40625, "learning_rate": 1.5280250180418573e-05, "loss": 1.0807191848754882, "mean_token_accuracy": 0.8046631902456284, "num_tokens": 3887638.0, "step": 1200 }, { "entropy": 0.6820507633499802, "epoch": 0.2765714285714286, "grad_norm": 7.25, "learning_rate": 1.5232138561462594e-05, "loss": 0.9238566398620606, "mean_token_accuracy": 0.8344717890024185, "num_tokens": 3921320.0, "step": 1210 }, { "entropy": 0.6690340504981578, "epoch": 0.27885714285714286, "grad_norm": 8.625, "learning_rate": 1.5184026942506615e-05, "loss": 0.9770146369934082, "mean_token_accuracy": 0.83714384958148, "num_tokens": 3952659.0, "step": 1220 }, { "entropy": 0.7821415845304728, "epoch": 0.28114285714285714, "grad_norm": 8.9375, "learning_rate": 1.513591532355064e-05, "loss": 1.1273323059082032, "mean_token_accuracy": 0.8086842469871044, "num_tokens": 3985673.0, "step": 1230 }, { "entropy": 0.7746237487532198, "epoch": 0.2834285714285714, "grad_norm": 6.96875, "learning_rate": 1.5087803704594662e-05, "loss": 0.9969350814819335, "mean_token_accuracy": 0.8176074028015137, "num_tokens": 4014425.0, "step": 1240 }, { "entropy": 0.7822927181608975, "epoch": 0.2857142857142857, "grad_norm": 7.90625, "learning_rate": 1.5039692085638682e-05, "loss": 1.0581744194030762, "mean_token_accuracy": 0.8114182919263839, "num_tokens": 4044735.0, "step": 1250 }, { "entropy": 0.8262449711561203, "epoch": 0.288, "grad_norm": 8.125, "learning_rate": 1.4991580466682705e-05, "loss": 1.1058235168457031, "mean_token_accuracy": 0.8093136258423328, "num_tokens": 4077366.0, "step": 1260 }, { "entropy": 0.7183008762076497, "epoch": 0.29028571428571426, "grad_norm": 6.75, "learning_rate": 1.4943468847726727e-05, "loss": 1.0642513275146483, "mean_token_accuracy": 0.8284725159406662, "num_tokens": 4112231.0, "step": 1270 }, { "entropy": 0.7519657079130411, "epoch": 0.2925714285714286, "grad_norm": 7.65625, "learning_rate": 1.489535722877075e-05, "loss": 1.0380656242370605, "mean_token_accuracy": 0.8182306826114655, "num_tokens": 4141706.0, "step": 1280 }, { "entropy": 0.8959639485925436, "epoch": 0.2948571428571429, "grad_norm": 8.8125, "learning_rate": 1.484724560981477e-05, "loss": 1.1817408561706544, "mean_token_accuracy": 0.7842808924615383, "num_tokens": 4174772.0, "step": 1290 }, { "entropy": 0.7940410540439189, "epoch": 0.29714285714285715, "grad_norm": 7.9375, "learning_rate": 1.4799133990858793e-05, "loss": 1.0543545722961425, "mean_token_accuracy": 0.8153316840529442, "num_tokens": 4207107.0, "step": 1300 }, { "entropy": 0.7827737585641443, "epoch": 0.29942857142857143, "grad_norm": 11.0, "learning_rate": 1.4751022371902818e-05, "loss": 1.1160078048706055, "mean_token_accuracy": 0.812502384185791, "num_tokens": 4242521.0, "step": 1310 }, { "entropy": 0.735058065969497, "epoch": 0.3017142857142857, "grad_norm": 7.5, "learning_rate": 1.4702910752946837e-05, "loss": 1.0581280708312988, "mean_token_accuracy": 0.8288455225527287, "num_tokens": 4276982.0, "step": 1320 }, { "entropy": 0.7287354637868703, "epoch": 0.304, "grad_norm": 6.9375, "learning_rate": 1.465479913399086e-05, "loss": 0.9759371757507325, "mean_token_accuracy": 0.8249299876391888, "num_tokens": 4306046.0, "step": 1330 }, { "entropy": 0.7787643402814866, "epoch": 0.3062857142857143, "grad_norm": 7.5, "learning_rate": 1.4606687515034883e-05, "loss": 1.0230366706848144, "mean_token_accuracy": 0.816937967389822, "num_tokens": 4338652.0, "step": 1340 }, { "entropy": 0.8934064561501145, "epoch": 0.30857142857142855, "grad_norm": 5.875, "learning_rate": 1.4558575896078904e-05, "loss": 1.086491012573242, "mean_token_accuracy": 0.7942407630383969, "num_tokens": 4370871.0, "step": 1350 }, { "entropy": 0.833009172603488, "epoch": 0.31085714285714283, "grad_norm": 7.625, "learning_rate": 1.4510464277122927e-05, "loss": 1.1905370712280274, "mean_token_accuracy": 0.8013229362666607, "num_tokens": 4402989.0, "step": 1360 }, { "entropy": 0.7927345955744386, "epoch": 0.31314285714285717, "grad_norm": 6.875, "learning_rate": 1.4462352658166949e-05, "loss": 1.1041228294372558, "mean_token_accuracy": 0.8128574416041374, "num_tokens": 4434506.0, "step": 1370 }, { "entropy": 0.7229848534800112, "epoch": 0.31542857142857145, "grad_norm": 7.53125, "learning_rate": 1.441424103921097e-05, "loss": 1.0535061836242676, "mean_token_accuracy": 0.8302266910672188, "num_tokens": 4467742.0, "step": 1380 }, { "entropy": 0.6736922577954829, "epoch": 0.3177142857142857, "grad_norm": 8.3125, "learning_rate": 1.4366129420254992e-05, "loss": 0.9416308403015137, "mean_token_accuracy": 0.8366274513304234, "num_tokens": 4498266.0, "step": 1390 }, { "entropy": 0.7866813028231263, "epoch": 0.32, "grad_norm": 7.0, "learning_rate": 1.4318017801299015e-05, "loss": 1.0644832611083985, "mean_token_accuracy": 0.8135197319090366, "num_tokens": 4526424.0, "step": 1400 }, { "entropy": 0.755329312197864, "epoch": 0.3222857142857143, "grad_norm": 7.25, "learning_rate": 1.4269906182343036e-05, "loss": 1.0085858345031737, "mean_token_accuracy": 0.8171801075339318, "num_tokens": 4556781.0, "step": 1410 }, { "entropy": 0.7350449176505208, "epoch": 0.32457142857142857, "grad_norm": 8.0, "learning_rate": 1.4221794563387058e-05, "loss": 1.0485240936279296, "mean_token_accuracy": 0.8203142821788788, "num_tokens": 4586938.0, "step": 1420 }, { "entropy": 0.7315349031239748, "epoch": 0.32685714285714285, "grad_norm": 6.4375, "learning_rate": 1.4173682944431082e-05, "loss": 0.9750032424926758, "mean_token_accuracy": 0.8210594050586224, "num_tokens": 4623204.0, "step": 1430 }, { "entropy": 0.8201613875105978, "epoch": 0.3291428571428571, "grad_norm": 8.375, "learning_rate": 1.4125571325475103e-05, "loss": 1.0923168182373046, "mean_token_accuracy": 0.8091586381196976, "num_tokens": 4655204.0, "step": 1440 }, { "entropy": 0.731718104891479, "epoch": 0.3314285714285714, "grad_norm": 7.65625, "learning_rate": 1.4077459706519126e-05, "loss": 0.939968490600586, "mean_token_accuracy": 0.8259035252034664, "num_tokens": 4684009.0, "step": 1450 }, { "entropy": 0.7582659061998129, "epoch": 0.33371428571428574, "grad_norm": 7.78125, "learning_rate": 1.4029348087563148e-05, "loss": 1.141510581970215, "mean_token_accuracy": 0.8165373567491769, "num_tokens": 4713643.0, "step": 1460 }, { "entropy": 0.8316841575317084, "epoch": 0.336, "grad_norm": 6.8125, "learning_rate": 1.3981236468607169e-05, "loss": 1.0487807273864747, "mean_token_accuracy": 0.8056000970304013, "num_tokens": 4745897.0, "step": 1470 }, { "entropy": 0.7131205608136952, "epoch": 0.3382857142857143, "grad_norm": 7.59375, "learning_rate": 1.3933124849651192e-05, "loss": 0.9551529884338379, "mean_token_accuracy": 0.8345349170267582, "num_tokens": 4779342.0, "step": 1480 }, { "entropy": 0.7310262706130743, "epoch": 0.3405714285714286, "grad_norm": 8.0, "learning_rate": 1.3885013230695214e-05, "loss": 1.071888256072998, "mean_token_accuracy": 0.8165734991431236, "num_tokens": 4810006.0, "step": 1490 }, { "entropy": 0.8448133600875736, "epoch": 0.34285714285714286, "grad_norm": 7.71875, "learning_rate": 1.3836901611739235e-05, "loss": 1.1719935417175293, "mean_token_accuracy": 0.8007844358682632, "num_tokens": 4841370.0, "step": 1500 }, { "entropy": 0.6549595400691033, "epoch": 0.34514285714285714, "grad_norm": 6.125, "learning_rate": 1.3788789992783257e-05, "loss": 0.9889472007751465, "mean_token_accuracy": 0.8453674554824829, "num_tokens": 4872052.0, "step": 1510 }, { "entropy": 0.8164440121501684, "epoch": 0.3474285714285714, "grad_norm": 7.5625, "learning_rate": 1.3740678373827282e-05, "loss": 1.0972503662109374, "mean_token_accuracy": 0.810026689618826, "num_tokens": 4908227.0, "step": 1520 }, { "entropy": 0.7791354645043611, "epoch": 0.3497142857142857, "grad_norm": 7.8125, "learning_rate": 1.36925667548713e-05, "loss": 1.0852085113525392, "mean_token_accuracy": 0.8248721182346344, "num_tokens": 4940131.0, "step": 1530 }, { "entropy": 0.8590768910944462, "epoch": 0.352, "grad_norm": 7.9375, "learning_rate": 1.3644455135915325e-05, "loss": 1.1454149246215821, "mean_token_accuracy": 0.8017402648925781, "num_tokens": 4971176.0, "step": 1540 }, { "entropy": 0.6812219545245171, "epoch": 0.35428571428571426, "grad_norm": 7.0, "learning_rate": 1.3596343516959347e-05, "loss": 0.919462776184082, "mean_token_accuracy": 0.8335798256099224, "num_tokens": 5002886.0, "step": 1550 }, { "entropy": 0.6795941894873977, "epoch": 0.3565714285714286, "grad_norm": 6.8125, "learning_rate": 1.354823189800337e-05, "loss": 0.9362202644348144, "mean_token_accuracy": 0.8309865556657314, "num_tokens": 5034604.0, "step": 1560 }, { "entropy": 0.8111153118312359, "epoch": 0.3588571428571429, "grad_norm": 7.5625, "learning_rate": 1.350012027904739e-05, "loss": 1.1012299537658692, "mean_token_accuracy": 0.8071676261723042, "num_tokens": 5067068.0, "step": 1570 }, { "entropy": 0.8018769213929773, "epoch": 0.36114285714285715, "grad_norm": 7.625, "learning_rate": 1.3452008660091413e-05, "loss": 1.0980539321899414, "mean_token_accuracy": 0.8049051895737648, "num_tokens": 5101840.0, "step": 1580 }, { "entropy": 0.8108965801075101, "epoch": 0.36342857142857143, "grad_norm": 9.4375, "learning_rate": 1.3403897041135436e-05, "loss": 1.097167682647705, "mean_token_accuracy": 0.8064502902328968, "num_tokens": 5133106.0, "step": 1590 }, { "entropy": 0.7126147777773439, "epoch": 0.3657142857142857, "grad_norm": 7.21875, "learning_rate": 1.3355785422179457e-05, "loss": 0.9641182899475098, "mean_token_accuracy": 0.8308103702962398, "num_tokens": 5163625.0, "step": 1600 }, { "entropy": 0.6579177615232765, "epoch": 0.368, "grad_norm": 7.6875, "learning_rate": 1.3307673803223479e-05, "loss": 0.8962146759033203, "mean_token_accuracy": 0.8413269713521003, "num_tokens": 5197413.0, "step": 1610 }, { "entropy": 0.8362961991690099, "epoch": 0.3702857142857143, "grad_norm": 7.53125, "learning_rate": 1.3259562184267503e-05, "loss": 1.1765104293823243, "mean_token_accuracy": 0.8035941451787949, "num_tokens": 5230359.0, "step": 1620 }, { "entropy": 0.8460681514814496, "epoch": 0.37257142857142855, "grad_norm": 7.125, "learning_rate": 1.3211450565311524e-05, "loss": 1.1312347412109376, "mean_token_accuracy": 0.806734037399292, "num_tokens": 5261631.0, "step": 1630 }, { "entropy": 0.8401033844798803, "epoch": 0.37485714285714283, "grad_norm": 7.6875, "learning_rate": 1.3163338946355547e-05, "loss": 1.1048646926879884, "mean_token_accuracy": 0.8016112253069878, "num_tokens": 5293666.0, "step": 1640 }, { "entropy": 0.8607065804302693, "epoch": 0.37714285714285717, "grad_norm": 6.25, "learning_rate": 1.3115227327399569e-05, "loss": 1.224336814880371, "mean_token_accuracy": 0.7972042057663202, "num_tokens": 5328829.0, "step": 1650 }, { "entropy": 0.6591957551427186, "epoch": 0.37942857142857145, "grad_norm": 8.3125, "learning_rate": 1.306711570844359e-05, "loss": 0.9134272575378418, "mean_token_accuracy": 0.8408956363797188, "num_tokens": 5359723.0, "step": 1660 }, { "entropy": 0.7585498026572168, "epoch": 0.38171428571428573, "grad_norm": 6.84375, "learning_rate": 1.3019004089487612e-05, "loss": 1.0762030601501464, "mean_token_accuracy": 0.815737747400999, "num_tokens": 5391030.0, "step": 1670 }, { "entropy": 0.7825943292118609, "epoch": 0.384, "grad_norm": 6.6875, "learning_rate": 1.2970892470531635e-05, "loss": 1.0779932975769042, "mean_token_accuracy": 0.8169842332601547, "num_tokens": 5422205.0, "step": 1680 }, { "entropy": 0.8554381128400564, "epoch": 0.3862857142857143, "grad_norm": 7.375, "learning_rate": 1.2922780851575656e-05, "loss": 1.12919340133667, "mean_token_accuracy": 0.8013027586042881, "num_tokens": 5452941.0, "step": 1690 }, { "entropy": 0.7908354031853377, "epoch": 0.38857142857142857, "grad_norm": 7.28125, "learning_rate": 1.2874669232619678e-05, "loss": 1.0936867713928222, "mean_token_accuracy": 0.8094826623797416, "num_tokens": 5486102.0, "step": 1700 }, { "entropy": 0.8072810024954379, "epoch": 0.39085714285714285, "grad_norm": 6.09375, "learning_rate": 1.28265576136637e-05, "loss": 1.0153223991394043, "mean_token_accuracy": 0.8126743011176586, "num_tokens": 5518871.0, "step": 1710 }, { "entropy": 0.7387428401969374, "epoch": 0.3931428571428571, "grad_norm": 7.34375, "learning_rate": 1.2778445994707722e-05, "loss": 1.021730613708496, "mean_token_accuracy": 0.8178475465625524, "num_tokens": 5548678.0, "step": 1720 }, { "entropy": 0.6844640583731234, "epoch": 0.3954285714285714, "grad_norm": 8.0625, "learning_rate": 1.2730334375751746e-05, "loss": 0.9658615112304687, "mean_token_accuracy": 0.833624093234539, "num_tokens": 5580416.0, "step": 1730 }, { "entropy": 0.8338166723027826, "epoch": 0.3977142857142857, "grad_norm": 7.375, "learning_rate": 1.2682222756795768e-05, "loss": 1.0406496047973632, "mean_token_accuracy": 0.8031456172466278, "num_tokens": 5613199.0, "step": 1740 }, { "entropy": 0.6859139285050333, "epoch": 0.4, "grad_norm": 8.1875, "learning_rate": 1.2634111137839789e-05, "loss": 1.0559725761413574, "mean_token_accuracy": 0.8320677742362023, "num_tokens": 5644289.0, "step": 1750 }, { "entropy": 0.8010108925402164, "epoch": 0.4022857142857143, "grad_norm": 7.875, "learning_rate": 1.2585999518883812e-05, "loss": 1.113631820678711, "mean_token_accuracy": 0.8092500284314156, "num_tokens": 5676021.0, "step": 1760 }, { "entropy": 0.8805123227648437, "epoch": 0.4045714285714286, "grad_norm": 8.5625, "learning_rate": 1.2537887899927834e-05, "loss": 1.1203717231750487, "mean_token_accuracy": 0.799303562939167, "num_tokens": 5708259.0, "step": 1770 }, { "entropy": 0.7750554161146284, "epoch": 0.40685714285714286, "grad_norm": 7.15625, "learning_rate": 1.2489776280971855e-05, "loss": 1.1084386825561523, "mean_token_accuracy": 0.8079812493175268, "num_tokens": 5741700.0, "step": 1780 }, { "entropy": 0.8413273308426141, "epoch": 0.40914285714285714, "grad_norm": 7.21875, "learning_rate": 1.2441664662015877e-05, "loss": 1.0813825607299805, "mean_token_accuracy": 0.8091316163539887, "num_tokens": 5774895.0, "step": 1790 }, { "entropy": 0.754073722101748, "epoch": 0.4114285714285714, "grad_norm": 6.90625, "learning_rate": 1.23935530430599e-05, "loss": 1.0666906356811523, "mean_token_accuracy": 0.819086953997612, "num_tokens": 5808852.0, "step": 1800 }, { "entropy": 0.7851035035215318, "epoch": 0.4137142857142857, "grad_norm": 7.25, "learning_rate": 1.234544142410392e-05, "loss": 1.1307811737060547, "mean_token_accuracy": 0.8178651243448257, "num_tokens": 5841915.0, "step": 1810 }, { "entropy": 0.6699810542166234, "epoch": 0.416, "grad_norm": 6.375, "learning_rate": 1.2297329805147943e-05, "loss": 0.948750114440918, "mean_token_accuracy": 0.8368007637560367, "num_tokens": 5876884.0, "step": 1820 }, { "entropy": 0.7877312513999641, "epoch": 0.41828571428571426, "grad_norm": 8.375, "learning_rate": 1.2249218186191967e-05, "loss": 1.0736566543579102, "mean_token_accuracy": 0.8172481268644333, "num_tokens": 5909524.0, "step": 1830 }, { "entropy": 0.7636531024239958, "epoch": 0.4205714285714286, "grad_norm": 7.375, "learning_rate": 1.2201106567235988e-05, "loss": 1.0859886169433595, "mean_token_accuracy": 0.8179905354976654, "num_tokens": 5944343.0, "step": 1840 }, { "entropy": 0.7100124446675181, "epoch": 0.4228571428571429, "grad_norm": 7.15625, "learning_rate": 1.215299494828001e-05, "loss": 1.042219352722168, "mean_token_accuracy": 0.8213589303195477, "num_tokens": 5979532.0, "step": 1850 }, { "entropy": 0.7539400187321007, "epoch": 0.42514285714285716, "grad_norm": 7.03125, "learning_rate": 1.2104883329324033e-05, "loss": 1.0224475860595703, "mean_token_accuracy": 0.8227170191705226, "num_tokens": 6013588.0, "step": 1860 }, { "entropy": 0.6926140191964805, "epoch": 0.42742857142857144, "grad_norm": 6.1875, "learning_rate": 1.2056771710368056e-05, "loss": 0.9315377235412597, "mean_token_accuracy": 0.8341933377087116, "num_tokens": 6049253.0, "step": 1870 }, { "entropy": 0.8801758374087513, "epoch": 0.4297142857142857, "grad_norm": 7.53125, "learning_rate": 1.2008660091412077e-05, "loss": 1.1752006530761718, "mean_token_accuracy": 0.7919330909848213, "num_tokens": 6079866.0, "step": 1880 }, { "entropy": 0.899750160984695, "epoch": 0.432, "grad_norm": 7.21875, "learning_rate": 1.1960548472456099e-05, "loss": 1.1849931716918944, "mean_token_accuracy": 0.7877020232379437, "num_tokens": 6109239.0, "step": 1890 }, { "entropy": 0.7825359049253165, "epoch": 0.4342857142857143, "grad_norm": 7.46875, "learning_rate": 1.1912436853500122e-05, "loss": 1.0007784843444825, "mean_token_accuracy": 0.818300225585699, "num_tokens": 6138853.0, "step": 1900 }, { "entropy": 0.7607327317818999, "epoch": 0.43657142857142855, "grad_norm": 8.0, "learning_rate": 1.1864325234544142e-05, "loss": 1.0711479187011719, "mean_token_accuracy": 0.8240827091038228, "num_tokens": 6172839.0, "step": 1910 }, { "entropy": 0.8882574066519737, "epoch": 0.43885714285714283, "grad_norm": 7.71875, "learning_rate": 1.1816213615588167e-05, "loss": 1.2051098823547364, "mean_token_accuracy": 0.7916370362043381, "num_tokens": 6204250.0, "step": 1920 }, { "entropy": 0.6951690092682838, "epoch": 0.44114285714285717, "grad_norm": 8.5, "learning_rate": 1.1768101996632189e-05, "loss": 0.9240032196044922, "mean_token_accuracy": 0.8321454405784607, "num_tokens": 6236171.0, "step": 1930 }, { "entropy": 0.7487597663886845, "epoch": 0.44342857142857145, "grad_norm": 7.71875, "learning_rate": 1.171999037767621e-05, "loss": 0.9808469772338867, "mean_token_accuracy": 0.8196887351572514, "num_tokens": 6268135.0, "step": 1940 }, { "entropy": 0.8591405102983117, "epoch": 0.44571428571428573, "grad_norm": 7.78125, "learning_rate": 1.1671878758720232e-05, "loss": 1.1255832672119142, "mean_token_accuracy": 0.7943931568413973, "num_tokens": 6299543.0, "step": 1950 }, { "entropy": 0.9221633022651077, "epoch": 0.448, "grad_norm": 7.34375, "learning_rate": 1.1623767139764255e-05, "loss": 1.218088436126709, "mean_token_accuracy": 0.7879602633416652, "num_tokens": 6328776.0, "step": 1960 }, { "entropy": 0.7521216680295766, "epoch": 0.4502857142857143, "grad_norm": 4.125, "learning_rate": 1.1575655520808276e-05, "loss": 1.0790873527526856, "mean_token_accuracy": 0.8138045072555542, "num_tokens": 6359815.0, "step": 1970 }, { "entropy": 0.7044279471971094, "epoch": 0.45257142857142857, "grad_norm": 8.125, "learning_rate": 1.1527543901852298e-05, "loss": 0.925055980682373, "mean_token_accuracy": 0.8344494268298149, "num_tokens": 6393539.0, "step": 1980 }, { "entropy": 0.7118433593772352, "epoch": 0.45485714285714285, "grad_norm": 6.03125, "learning_rate": 1.147943228289632e-05, "loss": 0.9561774253845214, "mean_token_accuracy": 0.8290005512535572, "num_tokens": 6426378.0, "step": 1990 }, { "entropy": 0.7948009348474443, "epoch": 0.45714285714285713, "grad_norm": 6.78125, "learning_rate": 1.1431320663940341e-05, "loss": 1.0137686729431152, "mean_token_accuracy": 0.8080471381545067, "num_tokens": 6460145.0, "step": 2000 }, { "entropy": 0.7212188862264156, "epoch": 0.4594285714285714, "grad_norm": 6.3125, "learning_rate": 1.1383209044984364e-05, "loss": 0.9326017379760743, "mean_token_accuracy": 0.8261952839791775, "num_tokens": 6492010.0, "step": 2010 }, { "entropy": 0.7147583740763366, "epoch": 0.4617142857142857, "grad_norm": 7.96875, "learning_rate": 1.1335097426028388e-05, "loss": 1.0504631996154785, "mean_token_accuracy": 0.831389506906271, "num_tokens": 6526521.0, "step": 2020 }, { "entropy": 0.8111877050250769, "epoch": 0.464, "grad_norm": 7.71875, "learning_rate": 1.1286985807072407e-05, "loss": 1.0568114280700684, "mean_token_accuracy": 0.8077960222959518, "num_tokens": 6559743.0, "step": 2030 }, { "entropy": 0.8017427391372621, "epoch": 0.4662857142857143, "grad_norm": 8.125, "learning_rate": 1.1238874188116432e-05, "loss": 1.0879751205444337, "mean_token_accuracy": 0.8064081892371178, "num_tokens": 6591260.0, "step": 2040 }, { "entropy": 0.7713497207500041, "epoch": 0.4685714285714286, "grad_norm": 8.0, "learning_rate": 1.1190762569160454e-05, "loss": 1.1264875411987305, "mean_token_accuracy": 0.8138973511755466, "num_tokens": 6622826.0, "step": 2050 }, { "entropy": 0.7645074154250324, "epoch": 0.47085714285714286, "grad_norm": 7.5625, "learning_rate": 1.1142650950204475e-05, "loss": 1.0584564208984375, "mean_token_accuracy": 0.8198134288191795, "num_tokens": 6655484.0, "step": 2060 }, { "entropy": 0.8299776021391153, "epoch": 0.47314285714285714, "grad_norm": 6.40625, "learning_rate": 1.1094539331248497e-05, "loss": 1.1237126350402833, "mean_token_accuracy": 0.8051372021436691, "num_tokens": 6685590.0, "step": 2070 }, { "entropy": 0.7288541275076568, "epoch": 0.4754285714285714, "grad_norm": 7.125, "learning_rate": 1.104642771229252e-05, "loss": 0.9620414733886719, "mean_token_accuracy": 0.8219352796673774, "num_tokens": 6721547.0, "step": 2080 }, { "entropy": 0.773728856164962, "epoch": 0.4777142857142857, "grad_norm": 6.1875, "learning_rate": 1.099831609333654e-05, "loss": 1.0007498741149903, "mean_token_accuracy": 0.8184696063399315, "num_tokens": 6754220.0, "step": 2090 }, { "entropy": 0.7731793771497906, "epoch": 0.48, "grad_norm": 7.34375, "learning_rate": 1.0950204474380563e-05, "loss": 1.026624584197998, "mean_token_accuracy": 0.8176170207560063, "num_tokens": 6785160.0, "step": 2100 }, { "entropy": 0.6699161239899695, "epoch": 0.48228571428571426, "grad_norm": 7.09375, "learning_rate": 1.0902092855424586e-05, "loss": 0.9981835365295411, "mean_token_accuracy": 0.8343960210680962, "num_tokens": 6819546.0, "step": 2110 }, { "entropy": 0.773171486146748, "epoch": 0.4845714285714286, "grad_norm": 6.375, "learning_rate": 1.0853981236468606e-05, "loss": 1.0869997024536133, "mean_token_accuracy": 0.8096975103020668, "num_tokens": 6849214.0, "step": 2120 }, { "entropy": 0.7241250389255584, "epoch": 0.4868571428571429, "grad_norm": 7.71875, "learning_rate": 1.080586961751263e-05, "loss": 1.0170108795166015, "mean_token_accuracy": 0.826240535825491, "num_tokens": 6880349.0, "step": 2130 }, { "entropy": 0.7947101121768355, "epoch": 0.48914285714285716, "grad_norm": 6.15625, "learning_rate": 1.0757757998556653e-05, "loss": 1.0710148811340332, "mean_token_accuracy": 0.8159072741866111, "num_tokens": 6914887.0, "step": 2140 }, { "entropy": 0.8211502507328987, "epoch": 0.49142857142857144, "grad_norm": 7.625, "learning_rate": 1.0709646379600676e-05, "loss": 1.1436882972717286, "mean_token_accuracy": 0.8062957197427749, "num_tokens": 6947890.0, "step": 2150 }, { "entropy": 0.7476996140554547, "epoch": 0.4937142857142857, "grad_norm": 7.375, "learning_rate": 1.0661534760644696e-05, "loss": 1.0358779907226563, "mean_token_accuracy": 0.82193743288517, "num_tokens": 6976819.0, "step": 2160 }, { "entropy": 0.8045617615804076, "epoch": 0.496, "grad_norm": 7.375, "learning_rate": 1.0613423141688719e-05, "loss": 1.023204517364502, "mean_token_accuracy": 0.8044866040349007, "num_tokens": 7006918.0, "step": 2170 }, { "entropy": 0.7655783969908952, "epoch": 0.4982857142857143, "grad_norm": 7.125, "learning_rate": 1.0565311522732741e-05, "loss": 1.0738348007202148, "mean_token_accuracy": 0.8179361633956432, "num_tokens": 7040325.0, "step": 2180 }, { "entropy": 0.7762483460828662, "epoch": 0.5005714285714286, "grad_norm": 7.75, "learning_rate": 1.0517199903776762e-05, "loss": 1.0218994140625, "mean_token_accuracy": 0.8140566550195217, "num_tokens": 7073925.0, "step": 2190 }, { "entropy": 0.6888056830503047, "epoch": 0.5028571428571429, "grad_norm": 7.84375, "learning_rate": 1.0469088284820785e-05, "loss": 1.0055737495422363, "mean_token_accuracy": 0.8302330307662487, "num_tokens": 7106764.0, "step": 2200 }, { "entropy": 0.8743803231045604, "epoch": 0.5051428571428571, "grad_norm": 7.46875, "learning_rate": 1.0420976665864809e-05, "loss": 1.14207181930542, "mean_token_accuracy": 0.7981645628809929, "num_tokens": 7139473.0, "step": 2210 }, { "entropy": 0.7461634024046362, "epoch": 0.5074285714285715, "grad_norm": 7.84375, "learning_rate": 1.0372865046908828e-05, "loss": 0.9760645866394043, "mean_token_accuracy": 0.8265540286898613, "num_tokens": 7170534.0, "step": 2220 }, { "entropy": 0.6452060268260539, "epoch": 0.5097142857142857, "grad_norm": 6.59375, "learning_rate": 1.0324753427952852e-05, "loss": 0.8791199684143066, "mean_token_accuracy": 0.8427741400897503, "num_tokens": 7203692.0, "step": 2230 }, { "entropy": 0.7903048783540726, "epoch": 0.512, "grad_norm": 7.09375, "learning_rate": 1.0276641808996875e-05, "loss": 1.0589832305908202, "mean_token_accuracy": 0.8105465799570084, "num_tokens": 7235512.0, "step": 2240 }, { "entropy": 0.757332621794194, "epoch": 0.5142857142857142, "grad_norm": 6.34375, "learning_rate": 1.0228530190040896e-05, "loss": 1.0270901679992677, "mean_token_accuracy": 0.8171210527420044, "num_tokens": 7268071.0, "step": 2250 }, { "entropy": 0.7633547084406018, "epoch": 0.5165714285714286, "grad_norm": 6.84375, "learning_rate": 1.0180418571084918e-05, "loss": 1.0296350479125977, "mean_token_accuracy": 0.8162448532879353, "num_tokens": 7298520.0, "step": 2260 }, { "entropy": 0.7190552426502108, "epoch": 0.5188571428571429, "grad_norm": 6.90625, "learning_rate": 1.013230695212894e-05, "loss": 1.059223461151123, "mean_token_accuracy": 0.8252359744161367, "num_tokens": 7329180.0, "step": 2270 }, { "entropy": 0.7730093291960657, "epoch": 0.5211428571428571, "grad_norm": 7.65625, "learning_rate": 1.0084195333172961e-05, "loss": 1.1134568214416505, "mean_token_accuracy": 0.810255641490221, "num_tokens": 7363397.0, "step": 2280 }, { "entropy": 0.7890252031385898, "epoch": 0.5234285714285715, "grad_norm": 8.5625, "learning_rate": 1.0036083714216984e-05, "loss": 1.062121868133545, "mean_token_accuracy": 0.8097737640142441, "num_tokens": 7391404.0, "step": 2290 }, { "entropy": 0.7083958725444972, "epoch": 0.5257142857142857, "grad_norm": 7.625, "learning_rate": 9.987972095261006e-06, "loss": 0.9515584945678711, "mean_token_accuracy": 0.8254938945174217, "num_tokens": 7423099.0, "step": 2300 }, { "entropy": 0.6942234938032925, "epoch": 0.528, "grad_norm": 6.84375, "learning_rate": 9.939860476305029e-06, "loss": 0.9809045791625977, "mean_token_accuracy": 0.8210146620869636, "num_tokens": 7456548.0, "step": 2310 }, { "entropy": 0.7144082696177065, "epoch": 0.5302857142857142, "grad_norm": 7.40625, "learning_rate": 9.89174885734905e-06, "loss": 1.0528292655944824, "mean_token_accuracy": 0.8277196332812309, "num_tokens": 7489319.0, "step": 2320 }, { "entropy": 0.7327054421417415, "epoch": 0.5325714285714286, "grad_norm": 8.1875, "learning_rate": 9.843637238393072e-06, "loss": 1.0515410423278808, "mean_token_accuracy": 0.822493951767683, "num_tokens": 7524338.0, "step": 2330 }, { "entropy": 0.7691349984146655, "epoch": 0.5348571428571428, "grad_norm": 7.875, "learning_rate": 9.795525619437095e-06, "loss": 1.078810977935791, "mean_token_accuracy": 0.8136450231075287, "num_tokens": 7557739.0, "step": 2340 }, { "entropy": 0.8708611608482897, "epoch": 0.5371428571428571, "grad_norm": 6.75, "learning_rate": 9.747414000481117e-06, "loss": 1.1824729919433594, "mean_token_accuracy": 0.7978243462741375, "num_tokens": 7590943.0, "step": 2350 }, { "entropy": 0.7193792495876551, "epoch": 0.5394285714285715, "grad_norm": 6.09375, "learning_rate": 9.699302381525138e-06, "loss": 1.009437370300293, "mean_token_accuracy": 0.8306246355175972, "num_tokens": 7624726.0, "step": 2360 }, { "entropy": 0.7145123222842813, "epoch": 0.5417142857142857, "grad_norm": 8.25, "learning_rate": 9.651190762569162e-06, "loss": 1.0352288246154786, "mean_token_accuracy": 0.8277433931827545, "num_tokens": 7655654.0, "step": 2370 }, { "entropy": 0.7357332297600806, "epoch": 0.544, "grad_norm": 8.1875, "learning_rate": 9.603079143613183e-06, "loss": 1.113128662109375, "mean_token_accuracy": 0.821478446573019, "num_tokens": 7687948.0, "step": 2380 }, { "entropy": 0.7043834974989295, "epoch": 0.5462857142857143, "grad_norm": 7.375, "learning_rate": 9.554967524657206e-06, "loss": 0.9789829254150391, "mean_token_accuracy": 0.8271778743714094, "num_tokens": 7720028.0, "step": 2390 }, { "entropy": 0.8476279047317803, "epoch": 0.5485714285714286, "grad_norm": 7.6875, "learning_rate": 9.506855905701228e-06, "loss": 1.1467313766479492, "mean_token_accuracy": 0.8044891074299813, "num_tokens": 7754391.0, "step": 2400 }, { "entropy": 0.7447409811429679, "epoch": 0.5508571428571428, "grad_norm": 6.84375, "learning_rate": 9.458744286745249e-06, "loss": 1.0126939773559571, "mean_token_accuracy": 0.8301733404397964, "num_tokens": 7788615.0, "step": 2410 }, { "entropy": 0.6487678562290966, "epoch": 0.5531428571428572, "grad_norm": 6.90625, "learning_rate": 9.410632667789273e-06, "loss": 0.9349337577819824, "mean_token_accuracy": 0.8430794902145863, "num_tokens": 7823652.0, "step": 2420 }, { "entropy": 0.7297495853155851, "epoch": 0.5554285714285714, "grad_norm": 8.0, "learning_rate": 9.362521048833294e-06, "loss": 1.0516100883483888, "mean_token_accuracy": 0.8286796424537897, "num_tokens": 7855368.0, "step": 2430 }, { "entropy": 0.7656750591471791, "epoch": 0.5577142857142857, "grad_norm": 8.5, "learning_rate": 9.314409429877316e-06, "loss": 1.0632817268371582, "mean_token_accuracy": 0.8258335165679455, "num_tokens": 7885759.0, "step": 2440 }, { "entropy": 0.7843017770908773, "epoch": 0.56, "grad_norm": 8.875, "learning_rate": 9.266297810921339e-06, "loss": 1.074361228942871, "mean_token_accuracy": 0.8084652818739414, "num_tokens": 7916094.0, "step": 2450 }, { "entropy": 0.7119234027341008, "epoch": 0.5622857142857143, "grad_norm": 7.375, "learning_rate": 9.21818619196536e-06, "loss": 1.0436591148376464, "mean_token_accuracy": 0.8270700290799141, "num_tokens": 7948214.0, "step": 2460 }, { "entropy": 0.6967569976113737, "epoch": 0.5645714285714286, "grad_norm": 7.03125, "learning_rate": 9.170074573009382e-06, "loss": 0.9530592918395996, "mean_token_accuracy": 0.8300783924758435, "num_tokens": 7981204.0, "step": 2470 }, { "entropy": 0.7442635943181812, "epoch": 0.5668571428571428, "grad_norm": 6.96875, "learning_rate": 9.121962954053405e-06, "loss": 1.0191211700439453, "mean_token_accuracy": 0.8192649222910404, "num_tokens": 8013076.0, "step": 2480 }, { "entropy": 0.7923426426947117, "epoch": 0.5691428571428572, "grad_norm": 7.25, "learning_rate": 9.073851335097427e-06, "loss": 1.1116843223571777, "mean_token_accuracy": 0.813247837871313, "num_tokens": 8047471.0, "step": 2490 }, { "entropy": 0.7783824296668171, "epoch": 0.5714285714285714, "grad_norm": 7.1875, "learning_rate": 9.025739716141448e-06, "loss": 1.0703957557678223, "mean_token_accuracy": 0.813652578741312, "num_tokens": 8075967.0, "step": 2500 }, { "entropy": 0.7609690563753247, "epoch": 0.5737142857142857, "grad_norm": 7.84375, "learning_rate": 8.97762809718547e-06, "loss": 0.9853609085083008, "mean_token_accuracy": 0.8176385164260864, "num_tokens": 8109554.0, "step": 2510 }, { "entropy": 0.796685915440321, "epoch": 0.576, "grad_norm": 7.8125, "learning_rate": 8.929516478229493e-06, "loss": 1.047004508972168, "mean_token_accuracy": 0.811551482975483, "num_tokens": 8142729.0, "step": 2520 }, { "entropy": 0.717453905660659, "epoch": 0.5782857142857143, "grad_norm": 7.0, "learning_rate": 8.881404859273516e-06, "loss": 1.0155123710632323, "mean_token_accuracy": 0.8243556626141071, "num_tokens": 8171878.0, "step": 2530 }, { "entropy": 0.7719296976923943, "epoch": 0.5805714285714285, "grad_norm": 6.625, "learning_rate": 8.833293240317538e-06, "loss": 1.060032844543457, "mean_token_accuracy": 0.8186002224683762, "num_tokens": 8203389.0, "step": 2540 }, { "entropy": 0.6772220591083169, "epoch": 0.5828571428571429, "grad_norm": 7.5625, "learning_rate": 8.785181621361559e-06, "loss": 0.9524177551269531, "mean_token_accuracy": 0.8351402230560779, "num_tokens": 8233812.0, "step": 2550 }, { "entropy": 0.7519471907988191, "epoch": 0.5851428571428572, "grad_norm": 7.15625, "learning_rate": 8.737070002405581e-06, "loss": 1.0217690467834473, "mean_token_accuracy": 0.8147253841161728, "num_tokens": 8264075.0, "step": 2560 }, { "entropy": 0.8792341394349933, "epoch": 0.5874285714285714, "grad_norm": 7.625, "learning_rate": 8.688958383449604e-06, "loss": 1.171504306793213, "mean_token_accuracy": 0.7875504352152347, "num_tokens": 8294266.0, "step": 2570 }, { "entropy": 0.5147198906168342, "epoch": 0.5897142857142857, "grad_norm": 7.1875, "learning_rate": 8.640846764493626e-06, "loss": 0.7446643352508545, "mean_token_accuracy": 0.8638051569461822, "num_tokens": 8328371.0, "step": 2580 }, { "entropy": 0.5512435308657586, "epoch": 0.592, "grad_norm": 6.71875, "learning_rate": 8.592735145537649e-06, "loss": 0.7508518695831299, "mean_token_accuracy": 0.8605974681675435, "num_tokens": 8358614.0, "step": 2590 }, { "entropy": 0.753514638543129, "epoch": 0.5942857142857143, "grad_norm": 7.96875, "learning_rate": 8.54462352658167e-06, "loss": 1.0647204399108887, "mean_token_accuracy": 0.8166808724403382, "num_tokens": 8390572.0, "step": 2600 }, { "entropy": 0.6976428182795644, "epoch": 0.5965714285714285, "grad_norm": 6.96875, "learning_rate": 8.496511907625692e-06, "loss": 0.9744165420532227, "mean_token_accuracy": 0.8334845989942551, "num_tokens": 8422186.0, "step": 2610 }, { "entropy": 0.6873942642472685, "epoch": 0.5988571428571429, "grad_norm": 8.1875, "learning_rate": 8.448400288669715e-06, "loss": 1.0646495819091797, "mean_token_accuracy": 0.8329671390354634, "num_tokens": 8456520.0, "step": 2620 }, { "entropy": 0.7481124849990011, "epoch": 0.6011428571428571, "grad_norm": 7.15625, "learning_rate": 8.400288669713737e-06, "loss": 0.9621360778808594, "mean_token_accuracy": 0.8160779684782028, "num_tokens": 8489868.0, "step": 2630 }, { "entropy": 0.7540229024365545, "epoch": 0.6034285714285714, "grad_norm": 8.1875, "learning_rate": 8.352177050757758e-06, "loss": 1.068429946899414, "mean_token_accuracy": 0.8157521851360798, "num_tokens": 8522110.0, "step": 2640 }, { "entropy": 0.8098990395665169, "epoch": 0.6057142857142858, "grad_norm": 7.46875, "learning_rate": 8.30406543180178e-06, "loss": 1.0495105743408204, "mean_token_accuracy": 0.8076829589903355, "num_tokens": 8554094.0, "step": 2650 }, { "entropy": 0.8042045352049172, "epoch": 0.608, "grad_norm": 7.25, "learning_rate": 8.255953812845803e-06, "loss": 1.1015840530395509, "mean_token_accuracy": 0.8066806077957154, "num_tokens": 8589902.0, "step": 2660 }, { "entropy": 0.9022464168258011, "epoch": 0.6102857142857143, "grad_norm": 6.59375, "learning_rate": 8.207842193889826e-06, "loss": 1.2131352424621582, "mean_token_accuracy": 0.7915476217865944, "num_tokens": 8623794.0, "step": 2670 }, { "entropy": 0.8746935517527163, "epoch": 0.6125714285714285, "grad_norm": 6.96875, "learning_rate": 8.159730574933848e-06, "loss": 1.1575665473937988, "mean_token_accuracy": 0.7986876778304577, "num_tokens": 8651194.0, "step": 2680 }, { "entropy": 0.8122401271015406, "epoch": 0.6148571428571429, "grad_norm": 6.65625, "learning_rate": 8.111618955977869e-06, "loss": 1.0654847145080566, "mean_token_accuracy": 0.8131648566573858, "num_tokens": 8681096.0, "step": 2690 }, { "entropy": 0.8027309827506542, "epoch": 0.6171428571428571, "grad_norm": 9.0, "learning_rate": 8.063507337021891e-06, "loss": 1.1084778785705567, "mean_token_accuracy": 0.8057775877416133, "num_tokens": 8713083.0, "step": 2700 }, { "entropy": 0.7622825523838401, "epoch": 0.6194285714285714, "grad_norm": 7.59375, "learning_rate": 8.015395718065914e-06, "loss": 1.033258819580078, "mean_token_accuracy": 0.818463982641697, "num_tokens": 8745917.0, "step": 2710 }, { "entropy": 0.7353868483565748, "epoch": 0.6217142857142857, "grad_norm": 7.5, "learning_rate": 7.967284099109935e-06, "loss": 1.0230457305908203, "mean_token_accuracy": 0.8215658769011498, "num_tokens": 8781507.0, "step": 2720 }, { "entropy": 0.7007935558445751, "epoch": 0.624, "grad_norm": 7.375, "learning_rate": 7.919172480153959e-06, "loss": 0.9617188453674317, "mean_token_accuracy": 0.8268887743353843, "num_tokens": 8815964.0, "step": 2730 }, { "entropy": 0.7421483082696796, "epoch": 0.6262857142857143, "grad_norm": 7.25, "learning_rate": 7.87106086119798e-06, "loss": 1.0290477752685547, "mean_token_accuracy": 0.8229492858052254, "num_tokens": 8848344.0, "step": 2740 }, { "entropy": 0.73214913867414, "epoch": 0.6285714285714286, "grad_norm": 8.625, "learning_rate": 7.822949242242002e-06, "loss": 1.060285472869873, "mean_token_accuracy": 0.8267331637442112, "num_tokens": 8879118.0, "step": 2750 }, { "entropy": 0.8049950825981795, "epoch": 0.6308571428571429, "grad_norm": 7.625, "learning_rate": 7.774837623286025e-06, "loss": 1.1363885879516602, "mean_token_accuracy": 0.8102126717567444, "num_tokens": 8913125.0, "step": 2760 }, { "entropy": 0.6610826853662729, "epoch": 0.6331428571428571, "grad_norm": 6.125, "learning_rate": 7.726726004330045e-06, "loss": 0.9042505264282227, "mean_token_accuracy": 0.8309091664850712, "num_tokens": 8946194.0, "step": 2770 }, { "entropy": 0.6915491444058717, "epoch": 0.6354285714285715, "grad_norm": 8.0, "learning_rate": 7.678614385374068e-06, "loss": 0.96341552734375, "mean_token_accuracy": 0.8264155894517898, "num_tokens": 8982077.0, "step": 2780 }, { "entropy": 0.6272562616504729, "epoch": 0.6377142857142857, "grad_norm": 7.875, "learning_rate": 7.63050276641809e-06, "loss": 0.928917121887207, "mean_token_accuracy": 0.8460888244211674, "num_tokens": 9019879.0, "step": 2790 }, { "entropy": 0.701786683825776, "epoch": 0.64, "grad_norm": 7.1875, "learning_rate": 7.582391147462112e-06, "loss": 1.046267604827881, "mean_token_accuracy": 0.8271472752094269, "num_tokens": 9053435.0, "step": 2800 }, { "entropy": 0.8251914168708027, "epoch": 0.6422857142857142, "grad_norm": 7.8125, "learning_rate": 7.534279528506135e-06, "loss": 1.1346126556396485, "mean_token_accuracy": 0.8051226794719696, "num_tokens": 9087735.0, "step": 2810 }, { "entropy": 0.8158627865836025, "epoch": 0.6445714285714286, "grad_norm": 7.5, "learning_rate": 7.486167909550157e-06, "loss": 1.0751116752624512, "mean_token_accuracy": 0.8058493196964264, "num_tokens": 9120051.0, "step": 2820 }, { "entropy": 0.8153355809859931, "epoch": 0.6468571428571429, "grad_norm": 8.1875, "learning_rate": 7.438056290594179e-06, "loss": 1.1167887687683105, "mean_token_accuracy": 0.8044289343059063, "num_tokens": 9150131.0, "step": 2830 }, { "entropy": 0.7215716702863574, "epoch": 0.6491428571428571, "grad_norm": 6.8125, "learning_rate": 7.389944671638201e-06, "loss": 0.9800872802734375, "mean_token_accuracy": 0.8230889447033405, "num_tokens": 9183592.0, "step": 2840 }, { "entropy": 0.6650403100065887, "epoch": 0.6514285714285715, "grad_norm": 6.6875, "learning_rate": 7.341833052682224e-06, "loss": 0.930327320098877, "mean_token_accuracy": 0.8409841381013393, "num_tokens": 9215447.0, "step": 2850 }, { "entropy": 0.8310886896215379, "epoch": 0.6537142857142857, "grad_norm": 6.59375, "learning_rate": 7.2937214337262455e-06, "loss": 1.108950424194336, "mean_token_accuracy": 0.8052147164940834, "num_tokens": 9247756.0, "step": 2860 }, { "entropy": 0.7922366439364851, "epoch": 0.656, "grad_norm": 9.3125, "learning_rate": 7.245609814770268e-06, "loss": 1.089939498901367, "mean_token_accuracy": 0.8171895481646061, "num_tokens": 9281235.0, "step": 2870 }, { "entropy": 0.7316854421980679, "epoch": 0.6582857142857143, "grad_norm": 6.96875, "learning_rate": 7.19749819581429e-06, "loss": 0.975350284576416, "mean_token_accuracy": 0.8272683911025525, "num_tokens": 9315295.0, "step": 2880 }, { "entropy": 0.7693224214017391, "epoch": 0.6605714285714286, "grad_norm": 8.3125, "learning_rate": 7.149386576858311e-06, "loss": 1.1402573585510254, "mean_token_accuracy": 0.8134943917393684, "num_tokens": 9346923.0, "step": 2890 }, { "entropy": 0.7617660995572806, "epoch": 0.6628571428571428, "grad_norm": 7.59375, "learning_rate": 7.101274957902335e-06, "loss": 1.038425350189209, "mean_token_accuracy": 0.8179185189306736, "num_tokens": 9379433.0, "step": 2900 }, { "entropy": 0.7871399355120957, "epoch": 0.6651428571428571, "grad_norm": 7.46875, "learning_rate": 7.053163338946356e-06, "loss": 1.0193154335021972, "mean_token_accuracy": 0.8183310203254223, "num_tokens": 9413192.0, "step": 2910 }, { "entropy": 0.811190924886614, "epoch": 0.6674285714285715, "grad_norm": 6.625, "learning_rate": 7.005051719990378e-06, "loss": 1.1274406433105468, "mean_token_accuracy": 0.8116770260035991, "num_tokens": 9445678.0, "step": 2920 }, { "entropy": 0.8758432329632342, "epoch": 0.6697142857142857, "grad_norm": 8.6875, "learning_rate": 6.9569401010344005e-06, "loss": 1.195134162902832, "mean_token_accuracy": 0.7941108390688896, "num_tokens": 9476534.0, "step": 2930 }, { "entropy": 0.8360557379201055, "epoch": 0.672, "grad_norm": 6.46875, "learning_rate": 6.908828482078422e-06, "loss": 1.1135424613952636, "mean_token_accuracy": 0.80475138053298, "num_tokens": 9509834.0, "step": 2940 }, { "entropy": 0.8121384960599244, "epoch": 0.6742857142857143, "grad_norm": 7.09375, "learning_rate": 6.860716863122444e-06, "loss": 1.0921581268310547, "mean_token_accuracy": 0.8104615144431591, "num_tokens": 9544560.0, "step": 2950 }, { "entropy": 0.6809657582081854, "epoch": 0.6765714285714286, "grad_norm": 6.78125, "learning_rate": 6.812605244166467e-06, "loss": 0.9061110496520997, "mean_token_accuracy": 0.8335768587887287, "num_tokens": 9576699.0, "step": 2960 }, { "entropy": 0.7368661808781326, "epoch": 0.6788571428571428, "grad_norm": 7.0, "learning_rate": 6.764493625210489e-06, "loss": 0.9945035934448242, "mean_token_accuracy": 0.8268292259424925, "num_tokens": 9609831.0, "step": 2970 }, { "entropy": 0.7591518526896834, "epoch": 0.6811428571428572, "grad_norm": 7.875, "learning_rate": 6.716382006254511e-06, "loss": 1.0467313766479491, "mean_token_accuracy": 0.8203754242509603, "num_tokens": 9642043.0, "step": 2980 }, { "entropy": 0.6456474749371409, "epoch": 0.6834285714285714, "grad_norm": 8.5625, "learning_rate": 6.668270387298533e-06, "loss": 0.9298653602600098, "mean_token_accuracy": 0.8404752813279629, "num_tokens": 9672316.0, "step": 2990 }, { "entropy": 0.7651321108452975, "epoch": 0.6857142857142857, "grad_norm": 7.78125, "learning_rate": 6.620158768342555e-06, "loss": 0.9670675277709961, "mean_token_accuracy": 0.8202950492501259, "num_tokens": 9704667.0, "step": 3000 }, { "entropy": 0.7684257586486638, "epoch": 0.688, "grad_norm": 6.96875, "learning_rate": 6.572047149386578e-06, "loss": 1.0198678016662597, "mean_token_accuracy": 0.8141922578215599, "num_tokens": 9736453.0, "step": 3010 }, { "entropy": 0.9071576375514269, "epoch": 0.6902857142857143, "grad_norm": 7.46875, "learning_rate": 6.5239355304306e-06, "loss": 1.2006649017333983, "mean_token_accuracy": 0.7815720088779926, "num_tokens": 9766239.0, "step": 3020 }, { "entropy": 0.7002435548231005, "epoch": 0.6925714285714286, "grad_norm": 8.1875, "learning_rate": 6.475823911474621e-06, "loss": 1.0064776420593262, "mean_token_accuracy": 0.8239927910268307, "num_tokens": 9797633.0, "step": 3030 }, { "entropy": 0.7579085680190474, "epoch": 0.6948571428571428, "grad_norm": 7.71875, "learning_rate": 6.427712292518644e-06, "loss": 1.0041309356689454, "mean_token_accuracy": 0.8205542616546154, "num_tokens": 9829628.0, "step": 3040 }, { "entropy": 0.8784082194790244, "epoch": 0.6971428571428572, "grad_norm": 7.40625, "learning_rate": 6.379600673562666e-06, "loss": 1.1010237693786622, "mean_token_accuracy": 0.7967388294637203, "num_tokens": 9864302.0, "step": 3050 }, { "entropy": 0.6545436557382345, "epoch": 0.6994285714285714, "grad_norm": 7.71875, "learning_rate": 6.331489054606688e-06, "loss": 1.0129745483398438, "mean_token_accuracy": 0.8387912206351757, "num_tokens": 9895779.0, "step": 3060 }, { "entropy": 0.8425466694869101, "epoch": 0.7017142857142857, "grad_norm": 6.78125, "learning_rate": 6.2833774356507104e-06, "loss": 1.0562131881713868, "mean_token_accuracy": 0.8017945110797882, "num_tokens": 9924158.0, "step": 3070 }, { "entropy": 0.873399674333632, "epoch": 0.704, "grad_norm": 8.75, "learning_rate": 6.235265816694732e-06, "loss": 1.1048128128051757, "mean_token_accuracy": 0.7917656324803829, "num_tokens": 9955099.0, "step": 3080 }, { "entropy": 0.6073906374163925, "epoch": 0.7062857142857143, "grad_norm": 9.0625, "learning_rate": 6.187154197738754e-06, "loss": 0.8535347938537597, "mean_token_accuracy": 0.8521837316453457, "num_tokens": 9988123.0, "step": 3090 }, { "entropy": 0.8428573332726955, "epoch": 0.7085714285714285, "grad_norm": 7.15625, "learning_rate": 6.139042578782777e-06, "loss": 1.1206453323364258, "mean_token_accuracy": 0.7989229038357735, "num_tokens": 10016364.0, "step": 3100 }, { "entropy": 0.740996487159282, "epoch": 0.7108571428571429, "grad_norm": 7.96875, "learning_rate": 6.090930959826799e-06, "loss": 1.0498098373413085, "mean_token_accuracy": 0.8253378972411156, "num_tokens": 10047098.0, "step": 3110 }, { "entropy": 0.7634292658418417, "epoch": 0.7131428571428572, "grad_norm": 7.40625, "learning_rate": 6.042819340870821e-06, "loss": 1.027073860168457, "mean_token_accuracy": 0.8156747639179229, "num_tokens": 10078377.0, "step": 3120 }, { "entropy": 0.7800739608705044, "epoch": 0.7154285714285714, "grad_norm": 8.0625, "learning_rate": 5.994707721914843e-06, "loss": 1.0465456962585449, "mean_token_accuracy": 0.8120176091790199, "num_tokens": 10108276.0, "step": 3130 }, { "entropy": 0.6941058835014701, "epoch": 0.7177142857142857, "grad_norm": 8.25, "learning_rate": 5.946596102958865e-06, "loss": 0.9293928146362305, "mean_token_accuracy": 0.8261455290019513, "num_tokens": 10140397.0, "step": 3140 }, { "entropy": 0.7566414731554687, "epoch": 0.72, "grad_norm": 7.78125, "learning_rate": 5.898484484002888e-06, "loss": 1.0103553771972655, "mean_token_accuracy": 0.8191342234611512, "num_tokens": 10170396.0, "step": 3150 }, { "entropy": 0.6843882665038109, "epoch": 0.7222857142857143, "grad_norm": 6.90625, "learning_rate": 5.85037286504691e-06, "loss": 0.9306538581848145, "mean_token_accuracy": 0.8384991563856602, "num_tokens": 10203787.0, "step": 3160 }, { "entropy": 0.9223319502547384, "epoch": 0.7245714285714285, "grad_norm": 7.09375, "learning_rate": 5.802261246090931e-06, "loss": 1.2310810089111328, "mean_token_accuracy": 0.7850386075675487, "num_tokens": 10237964.0, "step": 3170 }, { "entropy": 0.9315114512108267, "epoch": 0.7268571428571429, "grad_norm": 7.875, "learning_rate": 5.754149627134954e-06, "loss": 1.2219575881958007, "mean_token_accuracy": 0.788118976727128, "num_tokens": 10272012.0, "step": 3180 }, { "entropy": 0.9613786770962178, "epoch": 0.7291428571428571, "grad_norm": 7.71875, "learning_rate": 5.706038008178975e-06, "loss": 1.2217192649841309, "mean_token_accuracy": 0.7753416560590267, "num_tokens": 10301067.0, "step": 3190 }, { "entropy": 0.8978491752408445, "epoch": 0.7314285714285714, "grad_norm": 8.125, "learning_rate": 5.657926389222997e-06, "loss": 1.220133399963379, "mean_token_accuracy": 0.7887196414172649, "num_tokens": 10332467.0, "step": 3200 }, { "entropy": 0.7975409649312496, "epoch": 0.7337142857142858, "grad_norm": 6.875, "learning_rate": 5.60981477026702e-06, "loss": 1.0842624664306642, "mean_token_accuracy": 0.8157493643462658, "num_tokens": 10363576.0, "step": 3210 }, { "entropy": 0.7229632311500609, "epoch": 0.736, "grad_norm": 5.84375, "learning_rate": 5.561703151311042e-06, "loss": 0.9485625267028809, "mean_token_accuracy": 0.8276536233723164, "num_tokens": 10395203.0, "step": 3220 }, { "entropy": 0.7023040059953928, "epoch": 0.7382857142857143, "grad_norm": 6.90625, "learning_rate": 5.513591532355064e-06, "loss": 1.0307831764221191, "mean_token_accuracy": 0.8284949451684952, "num_tokens": 10426392.0, "step": 3230 }, { "entropy": 0.7922056226991117, "epoch": 0.7405714285714285, "grad_norm": 7.78125, "learning_rate": 5.465479913399086e-06, "loss": 1.0614632606506347, "mean_token_accuracy": 0.8134492255747319, "num_tokens": 10461629.0, "step": 3240 }, { "entropy": 0.5897016246803105, "epoch": 0.7428571428571429, "grad_norm": 7.1875, "learning_rate": 5.417368294443108e-06, "loss": 0.9088504791259766, "mean_token_accuracy": 0.8521728955209256, "num_tokens": 10497681.0, "step": 3250 }, { "entropy": 0.7967038029804826, "epoch": 0.7451428571428571, "grad_norm": 7.8125, "learning_rate": 5.36925667548713e-06, "loss": 1.0916454315185546, "mean_token_accuracy": 0.8093243841081857, "num_tokens": 10531276.0, "step": 3260 }, { "entropy": 0.7693165981210768, "epoch": 0.7474285714285714, "grad_norm": 6.84375, "learning_rate": 5.321145056531153e-06, "loss": 0.9624992370605469, "mean_token_accuracy": 0.818351661413908, "num_tokens": 10560781.0, "step": 3270 }, { "entropy": 0.7283342545852065, "epoch": 0.7497142857142857, "grad_norm": 6.78125, "learning_rate": 5.2730334375751746e-06, "loss": 1.0297183990478516, "mean_token_accuracy": 0.8240480080246926, "num_tokens": 10594592.0, "step": 3280 }, { "entropy": 0.7524079182185233, "epoch": 0.752, "grad_norm": 6.96875, "learning_rate": 5.224921818619197e-06, "loss": 0.980162239074707, "mean_token_accuracy": 0.8201256044209003, "num_tokens": 10627039.0, "step": 3290 }, { "entropy": 0.7365978182293474, "epoch": 0.7542857142857143, "grad_norm": 6.9375, "learning_rate": 5.1768101996632196e-06, "loss": 0.9751132011413575, "mean_token_accuracy": 0.8289193719625473, "num_tokens": 10659890.0, "step": 3300 }, { "entropy": 0.766766385640949, "epoch": 0.7565714285714286, "grad_norm": 7.0, "learning_rate": 5.128698580707241e-06, "loss": 1.066256618499756, "mean_token_accuracy": 0.813833087682724, "num_tokens": 10689935.0, "step": 3310 }, { "entropy": 0.7413464878685773, "epoch": 0.7588571428571429, "grad_norm": 7.4375, "learning_rate": 5.080586961751264e-06, "loss": 0.9947978019714355, "mean_token_accuracy": 0.8286945290863514, "num_tokens": 10719202.0, "step": 3320 }, { "entropy": 0.8110045059584081, "epoch": 0.7611428571428571, "grad_norm": 6.875, "learning_rate": 5.032475342795285e-06, "loss": 1.1004474639892579, "mean_token_accuracy": 0.8095826417207718, "num_tokens": 10752706.0, "step": 3330 }, { "entropy": 0.8748351650312542, "epoch": 0.7634285714285715, "grad_norm": 5.71875, "learning_rate": 4.984363723839308e-06, "loss": 1.1687129020690918, "mean_token_accuracy": 0.792143489792943, "num_tokens": 10785853.0, "step": 3340 }, { "entropy": 0.7911639436148107, "epoch": 0.7657142857142857, "grad_norm": 7.25, "learning_rate": 4.9362521048833295e-06, "loss": 1.075576114654541, "mean_token_accuracy": 0.8155123472213746, "num_tokens": 10818229.0, "step": 3350 }, { "entropy": 0.7263018532656134, "epoch": 0.768, "grad_norm": 7.625, "learning_rate": 4.888140485927352e-06, "loss": 1.0433449745178223, "mean_token_accuracy": 0.8173217661678791, "num_tokens": 10850567.0, "step": 3360 }, { "entropy": 0.8579608911648393, "epoch": 0.7702857142857142, "grad_norm": 8.0, "learning_rate": 4.840028866971374e-06, "loss": 1.106894302368164, "mean_token_accuracy": 0.7974334202706814, "num_tokens": 10883673.0, "step": 3370 }, { "entropy": 0.844954667147249, "epoch": 0.7725714285714286, "grad_norm": 7.09375, "learning_rate": 4.791917248015396e-06, "loss": 1.1396818161010742, "mean_token_accuracy": 0.8037762485444546, "num_tokens": 10916999.0, "step": 3380 }, { "entropy": 0.8294042806141079, "epoch": 0.7748571428571429, "grad_norm": 7.15625, "learning_rate": 4.743805629059418e-06, "loss": 1.07614164352417, "mean_token_accuracy": 0.8013096928596497, "num_tokens": 10947976.0, "step": 3390 }, { "entropy": 0.699165354296565, "epoch": 0.7771428571428571, "grad_norm": 7.3125, "learning_rate": 4.69569401010344e-06, "loss": 0.9428619384765625, "mean_token_accuracy": 0.8234991244971752, "num_tokens": 10981402.0, "step": 3400 }, { "entropy": 0.6559101923368871, "epoch": 0.7794285714285715, "grad_norm": 8.6875, "learning_rate": 4.647582391147463e-06, "loss": 0.851567554473877, "mean_token_accuracy": 0.8403317756950855, "num_tokens": 11011139.0, "step": 3410 }, { "entropy": 0.8098050164990127, "epoch": 0.7817142857142857, "grad_norm": 7.53125, "learning_rate": 4.5994707721914845e-06, "loss": 1.11738862991333, "mean_token_accuracy": 0.8105709552764893, "num_tokens": 11044319.0, "step": 3420 }, { "entropy": 0.6640732565894722, "epoch": 0.784, "grad_norm": 8.125, "learning_rate": 4.551359153235507e-06, "loss": 0.9586344718933105, "mean_token_accuracy": 0.8361151710152626, "num_tokens": 11079905.0, "step": 3430 }, { "entropy": 0.7955016130581498, "epoch": 0.7862857142857143, "grad_norm": 8.0, "learning_rate": 4.503247534279529e-06, "loss": 1.0718993186950683, "mean_token_accuracy": 0.8115546323359013, "num_tokens": 11111800.0, "step": 3440 }, { "entropy": 0.7911881297826767, "epoch": 0.7885714285714286, "grad_norm": 7.78125, "learning_rate": 4.455135915323551e-06, "loss": 1.099710750579834, "mean_token_accuracy": 0.8119720377027988, "num_tokens": 11145332.0, "step": 3450 }, { "entropy": 0.774864933360368, "epoch": 0.7908571428571428, "grad_norm": 6.21875, "learning_rate": 4.407024296367573e-06, "loss": 1.0780227661132813, "mean_token_accuracy": 0.8145800329744816, "num_tokens": 11174470.0, "step": 3460 }, { "entropy": 0.6018477959558368, "epoch": 0.7931428571428571, "grad_norm": 7.4375, "learning_rate": 4.358912677411595e-06, "loss": 0.8521579742431641, "mean_token_accuracy": 0.8514960691332817, "num_tokens": 11210615.0, "step": 3470 }, { "entropy": 0.8444686807692051, "epoch": 0.7954285714285714, "grad_norm": 6.6875, "learning_rate": 4.310801058455618e-06, "loss": 1.1099799156188965, "mean_token_accuracy": 0.8008836135268211, "num_tokens": 11241513.0, "step": 3480 }, { "entropy": 0.829711533524096, "epoch": 0.7977142857142857, "grad_norm": 6.625, "learning_rate": 4.2626894394996395e-06, "loss": 1.0666452407836915, "mean_token_accuracy": 0.8077532455325127, "num_tokens": 11274813.0, "step": 3490 }, { "entropy": 0.7473221772350371, "epoch": 0.8, "grad_norm": 7.3125, "learning_rate": 4.214577820543661e-06, "loss": 1.0066685676574707, "mean_token_accuracy": 0.8148701801896095, "num_tokens": 11303959.0, "step": 3500 }, { "entropy": 0.8557392791844904, "epoch": 0.8022857142857143, "grad_norm": 7.6875, "learning_rate": 4.166466201587684e-06, "loss": 1.0541882514953613, "mean_token_accuracy": 0.7998419582843781, "num_tokens": 11334910.0, "step": 3510 }, { "entropy": 0.7890441759489477, "epoch": 0.8045714285714286, "grad_norm": 7.71875, "learning_rate": 4.118354582631705e-06, "loss": 1.0888317108154297, "mean_token_accuracy": 0.8178003937005996, "num_tokens": 11365426.0, "step": 3520 }, { "entropy": 0.7986143685877323, "epoch": 0.8068571428571428, "grad_norm": 6.78125, "learning_rate": 4.070242963675728e-06, "loss": 1.0438194274902344, "mean_token_accuracy": 0.8172411516308784, "num_tokens": 11396568.0, "step": 3530 }, { "entropy": 0.7023409645073115, "epoch": 0.8091428571428572, "grad_norm": 7.125, "learning_rate": 4.02213134471975e-06, "loss": 0.982151985168457, "mean_token_accuracy": 0.8304105646908283, "num_tokens": 11429858.0, "step": 3540 }, { "entropy": 0.8511648692190648, "epoch": 0.8114285714285714, "grad_norm": 7.625, "learning_rate": 3.974019725763773e-06, "loss": 1.118496799468994, "mean_token_accuracy": 0.8004165187478065, "num_tokens": 11458825.0, "step": 3550 }, { "entropy": 0.8242282169871032, "epoch": 0.8137142857142857, "grad_norm": 7.15625, "learning_rate": 3.9259081068077945e-06, "loss": 1.0889615058898925, "mean_token_accuracy": 0.8154613308608532, "num_tokens": 11485780.0, "step": 3560 }, { "entropy": 0.8761372335255146, "epoch": 0.816, "grad_norm": 8.1875, "learning_rate": 3.877796487851816e-06, "loss": 1.1666927337646484, "mean_token_accuracy": 0.7958627745509148, "num_tokens": 11515089.0, "step": 3570 }, { "entropy": 0.8123947971500456, "epoch": 0.8182857142857143, "grad_norm": 7.1875, "learning_rate": 3.829684868895839e-06, "loss": 1.0921098709106445, "mean_token_accuracy": 0.8081369504332543, "num_tokens": 11545683.0, "step": 3580 }, { "entropy": 0.7641672321595252, "epoch": 0.8205714285714286, "grad_norm": 12.875, "learning_rate": 3.7815732499398603e-06, "loss": 1.0089197158813477, "mean_token_accuracy": 0.8187419034540653, "num_tokens": 11579338.0, "step": 3590 }, { "entropy": 0.9396181921474636, "epoch": 0.8228571428571428, "grad_norm": 6.875, "learning_rate": 3.733461630983883e-06, "loss": 1.1994843482971191, "mean_token_accuracy": 0.7850606590509415, "num_tokens": 11611832.0, "step": 3600 }, { "entropy": 0.692871849052608, "epoch": 0.8251428571428572, "grad_norm": 7.4375, "learning_rate": 3.685350012027905e-06, "loss": 0.9562499046325683, "mean_token_accuracy": 0.8297605454921723, "num_tokens": 11647063.0, "step": 3610 }, { "entropy": 0.8553698582574725, "epoch": 0.8274285714285714, "grad_norm": 6.40625, "learning_rate": 3.6372383930719274e-06, "loss": 1.1813543319702149, "mean_token_accuracy": 0.7899277493357658, "num_tokens": 11678198.0, "step": 3620 }, { "entropy": 0.7769951789639891, "epoch": 0.8297142857142857, "grad_norm": 7.84375, "learning_rate": 3.589126774115949e-06, "loss": 1.1048757553100585, "mean_token_accuracy": 0.8161457117646933, "num_tokens": 11711274.0, "step": 3630 }, { "entropy": 0.7809062311425805, "epoch": 0.832, "grad_norm": 7.03125, "learning_rate": 3.5410151551599716e-06, "loss": 1.116710090637207, "mean_token_accuracy": 0.8137276962399482, "num_tokens": 11742228.0, "step": 3640 }, { "entropy": 0.7451124029234052, "epoch": 0.8342857142857143, "grad_norm": 7.53125, "learning_rate": 3.4929035362039937e-06, "loss": 0.9379715919494629, "mean_token_accuracy": 0.8171642825007439, "num_tokens": 11773088.0, "step": 3650 }, { "entropy": 0.7952216092497111, "epoch": 0.8365714285714285, "grad_norm": 6.40625, "learning_rate": 3.4447919172480153e-06, "loss": 1.1145612716674804, "mean_token_accuracy": 0.8073516443371773, "num_tokens": 11805230.0, "step": 3660 }, { "entropy": 0.6641817208379507, "epoch": 0.8388571428571429, "grad_norm": 8.5625, "learning_rate": 3.396680298292038e-06, "loss": 0.8219084739685059, "mean_token_accuracy": 0.8350592002272605, "num_tokens": 11836944.0, "step": 3670 }, { "entropy": 0.8327237972058356, "epoch": 0.8411428571428572, "grad_norm": 7.90625, "learning_rate": 3.34856867933606e-06, "loss": 1.152987289428711, "mean_token_accuracy": 0.8037018492817879, "num_tokens": 11870633.0, "step": 3680 }, { "entropy": 0.7739829862490296, "epoch": 0.8434285714285714, "grad_norm": 7.6875, "learning_rate": 3.3004570603800824e-06, "loss": 1.0689297676086427, "mean_token_accuracy": 0.8115721188485623, "num_tokens": 11901509.0, "step": 3690 }, { "entropy": 0.7023711124435067, "epoch": 0.8457142857142858, "grad_norm": 7.09375, "learning_rate": 3.252345441424104e-06, "loss": 0.9941452980041504, "mean_token_accuracy": 0.8265939429402351, "num_tokens": 11931513.0, "step": 3700 }, { "entropy": 0.8765215444844217, "epoch": 0.848, "grad_norm": 7.75, "learning_rate": 3.204233822468126e-06, "loss": 1.1260786056518555, "mean_token_accuracy": 0.7915762890130281, "num_tokens": 11964449.0, "step": 3710 }, { "entropy": 0.8084148010239005, "epoch": 0.8502857142857143, "grad_norm": 6.84375, "learning_rate": 3.1561222035121486e-06, "loss": 1.1048534393310547, "mean_token_accuracy": 0.8068965047597885, "num_tokens": 11994053.0, "step": 3720 }, { "entropy": 0.8611850501969457, "epoch": 0.8525714285714285, "grad_norm": 6.6875, "learning_rate": 3.1080105845561703e-06, "loss": 1.1287246704101563, "mean_token_accuracy": 0.7991515025496483, "num_tokens": 12027638.0, "step": 3730 }, { "entropy": 0.6358927502296865, "epoch": 0.8548571428571429, "grad_norm": 7.0, "learning_rate": 3.059898965600193e-06, "loss": 0.9071885108947754, "mean_token_accuracy": 0.8444961465895175, "num_tokens": 12062607.0, "step": 3740 }, { "entropy": 0.8599010735284537, "epoch": 0.8571428571428571, "grad_norm": 6.5, "learning_rate": 3.011787346644215e-06, "loss": 1.148247241973877, "mean_token_accuracy": 0.7988054849207401, "num_tokens": 12093334.0, "step": 3750 }, { "entropy": 0.749000935535878, "epoch": 0.8594285714285714, "grad_norm": 6.90625, "learning_rate": 2.9636757276882374e-06, "loss": 1.0731889724731445, "mean_token_accuracy": 0.8171209901571274, "num_tokens": 12124493.0, "step": 3760 }, { "entropy": 0.6133915192447603, "epoch": 0.8617142857142858, "grad_norm": 6.0, "learning_rate": 2.915564108732259e-06, "loss": 0.9234248161315918, "mean_token_accuracy": 0.8530650399625301, "num_tokens": 12160800.0, "step": 3770 }, { "entropy": 0.8550255595706403, "epoch": 0.864, "grad_norm": 7.40625, "learning_rate": 2.867452489776281e-06, "loss": 1.1787774085998535, "mean_token_accuracy": 0.7914231061935425, "num_tokens": 12189992.0, "step": 3780 }, { "entropy": 0.854400450270623, "epoch": 0.8662857142857143, "grad_norm": 6.5625, "learning_rate": 2.8193408708203036e-06, "loss": 1.1640611648559571, "mean_token_accuracy": 0.8066024430096149, "num_tokens": 12224329.0, "step": 3790 }, { "entropy": 0.8460091168992221, "epoch": 0.8685714285714285, "grad_norm": 6.96875, "learning_rate": 2.7712292518643253e-06, "loss": 1.1152153015136719, "mean_token_accuracy": 0.806992469727993, "num_tokens": 12257176.0, "step": 3800 }, { "entropy": 0.7765115794725717, "epoch": 0.8708571428571429, "grad_norm": 7.1875, "learning_rate": 2.7231176329083474e-06, "loss": 1.0872262954711913, "mean_token_accuracy": 0.813801209628582, "num_tokens": 12290364.0, "step": 3810 }, { "entropy": 0.7125355136580765, "epoch": 0.8731428571428571, "grad_norm": 6.3125, "learning_rate": 2.67500601395237e-06, "loss": 0.9770938873291015, "mean_token_accuracy": 0.8250508345663548, "num_tokens": 12325455.0, "step": 3820 }, { "entropy": 0.7758281454443932, "epoch": 0.8754285714285714, "grad_norm": 7.625, "learning_rate": 2.626894394996392e-06, "loss": 1.130514430999756, "mean_token_accuracy": 0.8151266768574714, "num_tokens": 12358823.0, "step": 3830 }, { "entropy": 0.7530996017158031, "epoch": 0.8777142857142857, "grad_norm": 7.6875, "learning_rate": 2.578782776040414e-06, "loss": 1.056538200378418, "mean_token_accuracy": 0.8141079384833574, "num_tokens": 12392420.0, "step": 3840 }, { "entropy": 0.582604228099808, "epoch": 0.88, "grad_norm": 8.3125, "learning_rate": 2.530671157084436e-06, "loss": 0.8646469116210938, "mean_token_accuracy": 0.850695987790823, "num_tokens": 12424048.0, "step": 3850 }, { "entropy": 0.8167831319384277, "epoch": 0.8822857142857143, "grad_norm": 7.09375, "learning_rate": 2.482559538128458e-06, "loss": 1.1348252296447754, "mean_token_accuracy": 0.8092688016593457, "num_tokens": 12455436.0, "step": 3860 }, { "entropy": 0.8215475841425359, "epoch": 0.8845714285714286, "grad_norm": 7.4375, "learning_rate": 2.4344479191724803e-06, "loss": 1.1215962409973144, "mean_token_accuracy": 0.8079402819275856, "num_tokens": 12489334.0, "step": 3870 }, { "entropy": 0.7927017042413353, "epoch": 0.8868571428571429, "grad_norm": 7.28125, "learning_rate": 2.3863363002165024e-06, "loss": 1.0800617218017579, "mean_token_accuracy": 0.8097000844776631, "num_tokens": 12522105.0, "step": 3880 }, { "entropy": 0.8486208325251937, "epoch": 0.8891428571428571, "grad_norm": 7.0, "learning_rate": 2.338224681260525e-06, "loss": 1.125669288635254, "mean_token_accuracy": 0.7976283885538578, "num_tokens": 12553195.0, "step": 3890 }, { "entropy": 0.8716784932184964, "epoch": 0.8914285714285715, "grad_norm": 6.96875, "learning_rate": 2.2901130623045465e-06, "loss": 1.1960984230041505, "mean_token_accuracy": 0.7935221865773201, "num_tokens": 12585132.0, "step": 3900 }, { "entropy": 0.8773073226213455, "epoch": 0.8937142857142857, "grad_norm": 8.6875, "learning_rate": 2.2420014433485686e-06, "loss": 1.166949462890625, "mean_token_accuracy": 0.7921496272087097, "num_tokens": 12620190.0, "step": 3910 }, { "entropy": 0.8945854822173714, "epoch": 0.896, "grad_norm": 7.90625, "learning_rate": 2.193889824392591e-06, "loss": 1.20922908782959, "mean_token_accuracy": 0.7929078787565231, "num_tokens": 12652043.0, "step": 3920 }, { "entropy": 0.7110437804833054, "epoch": 0.8982857142857142, "grad_norm": 7.4375, "learning_rate": 2.145778205436613e-06, "loss": 0.9799498558044434, "mean_token_accuracy": 0.8256872028112412, "num_tokens": 12686506.0, "step": 3930 }, { "entropy": 0.8520329046063125, "epoch": 0.9005714285714286, "grad_norm": 7.84375, "learning_rate": 2.0976665864806353e-06, "loss": 1.1127940177917481, "mean_token_accuracy": 0.7984279960393905, "num_tokens": 12717624.0, "step": 3940 }, { "entropy": 0.7722635400481522, "epoch": 0.9028571428571428, "grad_norm": 6.96875, "learning_rate": 2.0495549675246573e-06, "loss": 1.031348705291748, "mean_token_accuracy": 0.8082475580275059, "num_tokens": 12751004.0, "step": 3950 }, { "entropy": 0.8996719061397016, "epoch": 0.9051428571428571, "grad_norm": 9.0, "learning_rate": 2.0014433485686794e-06, "loss": 1.2313031196594237, "mean_token_accuracy": 0.7899208262562751, "num_tokens": 12784386.0, "step": 3960 }, { "entropy": 0.8467463178560137, "epoch": 0.9074285714285715, "grad_norm": 6.3125, "learning_rate": 1.9533317296127015e-06, "loss": 1.1081655502319336, "mean_token_accuracy": 0.7957226369529963, "num_tokens": 12813355.0, "step": 3970 }, { "entropy": 0.8022918193601072, "epoch": 0.9097142857142857, "grad_norm": 7.90625, "learning_rate": 1.9052201106567236e-06, "loss": 1.0847484588623046, "mean_token_accuracy": 0.8091882210224867, "num_tokens": 12846173.0, "step": 3980 }, { "entropy": 0.7512643322348594, "epoch": 0.912, "grad_norm": 7.34375, "learning_rate": 1.8571084917007459e-06, "loss": 1.0247625350952148, "mean_token_accuracy": 0.8154100321233273, "num_tokens": 12879534.0, "step": 3990 }, { "entropy": 0.8367441557347775, "epoch": 0.9142857142857143, "grad_norm": 7.15625, "learning_rate": 1.808996872744768e-06, "loss": 1.2222256660461426, "mean_token_accuracy": 0.8002955429255962, "num_tokens": 12907935.0, "step": 4000 }, { "entropy": 0.849480548966676, "epoch": 0.9165714285714286, "grad_norm": 7.25, "learning_rate": 1.7608852537887902e-06, "loss": 1.1237051963806153, "mean_token_accuracy": 0.7980944596230983, "num_tokens": 12939436.0, "step": 4010 }, { "entropy": 0.7073171893134713, "epoch": 0.9188571428571428, "grad_norm": 7.6875, "learning_rate": 1.7127736348328123e-06, "loss": 1.0514840126037597, "mean_token_accuracy": 0.8278530709445476, "num_tokens": 12968488.0, "step": 4020 }, { "entropy": 0.7504108159802854, "epoch": 0.9211428571428572, "grad_norm": 7.96875, "learning_rate": 1.6646620158768346e-06, "loss": 1.0060768127441406, "mean_token_accuracy": 0.8199899084866047, "num_tokens": 13002635.0, "step": 4030 }, { "entropy": 0.906342108361423, "epoch": 0.9234285714285714, "grad_norm": 6.84375, "learning_rate": 1.6165503969208565e-06, "loss": 1.2012577056884766, "mean_token_accuracy": 0.7861776262521744, "num_tokens": 13034904.0, "step": 4040 }, { "entropy": 0.8890602920204401, "epoch": 0.9257142857142857, "grad_norm": 7.09375, "learning_rate": 1.5684387779648786e-06, "loss": 1.1589385986328125, "mean_token_accuracy": 0.7936351835727692, "num_tokens": 13064519.0, "step": 4050 }, { "entropy": 0.8940521791577339, "epoch": 0.928, "grad_norm": 7.53125, "learning_rate": 1.5203271590089009e-06, "loss": 1.1503165245056153, "mean_token_accuracy": 0.7895523980259895, "num_tokens": 13098510.0, "step": 4060 }, { "entropy": 0.6112047893926501, "epoch": 0.9302857142857143, "grad_norm": 9.1875, "learning_rate": 1.4722155400529227e-06, "loss": 0.8700815200805664, "mean_token_accuracy": 0.852671717107296, "num_tokens": 13132618.0, "step": 4070 }, { "entropy": 0.7455820512957871, "epoch": 0.9325714285714286, "grad_norm": 6.96875, "learning_rate": 1.424103921096945e-06, "loss": 0.9891318321228028, "mean_token_accuracy": 0.8168230719864369, "num_tokens": 13161914.0, "step": 4080 }, { "entropy": 0.8070791523903609, "epoch": 0.9348571428571428, "grad_norm": 7.34375, "learning_rate": 1.375992302140967e-06, "loss": 1.1282638549804687, "mean_token_accuracy": 0.8067759692668914, "num_tokens": 13189053.0, "step": 4090 }, { "entropy": 0.8544201260432601, "epoch": 0.9371428571428572, "grad_norm": 7.34375, "learning_rate": 1.3278806831849894e-06, "loss": 1.2156527519226075, "mean_token_accuracy": 0.8019159339368344, "num_tokens": 13219478.0, "step": 4100 }, { "entropy": 0.8153353109024465, "epoch": 0.9394285714285714, "grad_norm": 7.84375, "learning_rate": 1.2797690642290115e-06, "loss": 1.0747637748718262, "mean_token_accuracy": 0.8093126803636551, "num_tokens": 13254616.0, "step": 4110 }, { "entropy": 0.7539664410986007, "epoch": 0.9417142857142857, "grad_norm": 7.78125, "learning_rate": 1.2316574452730336e-06, "loss": 1.0411237716674804, "mean_token_accuracy": 0.8247020401060581, "num_tokens": 13286977.0, "step": 4120 }, { "entropy": 0.7033959114924073, "epoch": 0.944, "grad_norm": 7.28125, "learning_rate": 1.1835458263170556e-06, "loss": 0.9389317512512207, "mean_token_accuracy": 0.8293626546859741, "num_tokens": 13320518.0, "step": 4130 }, { "entropy": 0.8039538188837468, "epoch": 0.9462857142857143, "grad_norm": 7.34375, "learning_rate": 1.1354342073610777e-06, "loss": 1.0717804908752442, "mean_token_accuracy": 0.8100807063281537, "num_tokens": 13349708.0, "step": 4140 }, { "entropy": 0.6700900404714047, "epoch": 0.9485714285714286, "grad_norm": 5.40625, "learning_rate": 1.0873225884050998e-06, "loss": 0.8449858665466309, "mean_token_accuracy": 0.8380967788398266, "num_tokens": 13382386.0, "step": 4150 }, { "entropy": 0.7454655093140901, "epoch": 0.9508571428571428, "grad_norm": 8.1875, "learning_rate": 1.039210969449122e-06, "loss": 1.0423049926757812, "mean_token_accuracy": 0.8296139296144247, "num_tokens": 13415633.0, "step": 4160 }, { "entropy": 0.651054497435689, "epoch": 0.9531428571428572, "grad_norm": 7.46875, "learning_rate": 9.910993504931442e-07, "loss": 0.9426624298095703, "mean_token_accuracy": 0.8385513253509999, "num_tokens": 13447710.0, "step": 4170 }, { "entropy": 0.8339191220700741, "epoch": 0.9554285714285714, "grad_norm": 9.0625, "learning_rate": 9.429877315371664e-07, "loss": 1.211918830871582, "mean_token_accuracy": 0.801718657463789, "num_tokens": 13477514.0, "step": 4180 }, { "entropy": 0.8227419966831804, "epoch": 0.9577142857142857, "grad_norm": 7.09375, "learning_rate": 8.948761125811884e-07, "loss": 1.0787554740905763, "mean_token_accuracy": 0.8115898109972477, "num_tokens": 13512089.0, "step": 4190 }, { "entropy": 0.8163104236125946, "epoch": 0.96, "grad_norm": 5.71875, "learning_rate": 8.467644936252106e-07, "loss": 1.0611876487731933, "mean_token_accuracy": 0.8015380769968032, "num_tokens": 13545584.0, "step": 4200 }, { "entropy": 0.7111412956379354, "epoch": 0.9622857142857143, "grad_norm": 7.40625, "learning_rate": 7.986528746692326e-07, "loss": 0.9729216575622559, "mean_token_accuracy": 0.8238789007067681, "num_tokens": 13578776.0, "step": 4210 }, { "entropy": 0.8085635328665376, "epoch": 0.9645714285714285, "grad_norm": 7.5, "learning_rate": 7.505412557132548e-07, "loss": 1.1126985549926758, "mean_token_accuracy": 0.8126947581768036, "num_tokens": 13612547.0, "step": 4220 }, { "entropy": 0.7815977847203612, "epoch": 0.9668571428571429, "grad_norm": 8.125, "learning_rate": 7.02429636757277e-07, "loss": 1.1313226699829102, "mean_token_accuracy": 0.809683870524168, "num_tokens": 13643015.0, "step": 4230 }, { "entropy": 0.7985246267169714, "epoch": 0.9691428571428572, "grad_norm": 9.1875, "learning_rate": 6.54318017801299e-07, "loss": 1.0159822463989259, "mean_token_accuracy": 0.8185107290744782, "num_tokens": 13675162.0, "step": 4240 }, { "entropy": 0.671059988765046, "epoch": 0.9714285714285714, "grad_norm": 8.0625, "learning_rate": 6.062063988453211e-07, "loss": 0.9259526252746582, "mean_token_accuracy": 0.8424249842762948, "num_tokens": 13710886.0, "step": 4250 }, { "entropy": 0.7151353804394602, "epoch": 0.9737142857142858, "grad_norm": 7.03125, "learning_rate": 5.580947798893433e-07, "loss": 0.9961103439331055, "mean_token_accuracy": 0.8268160626292229, "num_tokens": 13747143.0, "step": 4260 }, { "entropy": 0.825507890433073, "epoch": 0.976, "grad_norm": 8.4375, "learning_rate": 5.099831609333655e-07, "loss": 1.116166591644287, "mean_token_accuracy": 0.8088098622858524, "num_tokens": 13779619.0, "step": 4270 }, { "entropy": 0.8729933000169694, "epoch": 0.9782857142857143, "grad_norm": 7.5625, "learning_rate": 4.618715419773876e-07, "loss": 1.1322175025939942, "mean_token_accuracy": 0.7934217296540738, "num_tokens": 13812123.0, "step": 4280 }, { "entropy": 0.739137639477849, "epoch": 0.9805714285714285, "grad_norm": 8.4375, "learning_rate": 4.1375992302140966e-07, "loss": 1.0004518508911133, "mean_token_accuracy": 0.8218909092247486, "num_tokens": 13844075.0, "step": 4290 }, { "entropy": 0.8571365299634636, "epoch": 0.9828571428571429, "grad_norm": 8.375, "learning_rate": 3.6564830406543185e-07, "loss": 1.1517833709716796, "mean_token_accuracy": 0.7975596848875284, "num_tokens": 13874945.0, "step": 4300 }, { "entropy": 0.8440510330721736, "epoch": 0.9851428571428571, "grad_norm": 8.5, "learning_rate": 3.17536685109454e-07, "loss": 1.165059471130371, "mean_token_accuracy": 0.8028948895633221, "num_tokens": 13906888.0, "step": 4310 }, { "entropy": 0.839153022505343, "epoch": 0.9874285714285714, "grad_norm": 7.5, "learning_rate": 2.694250661534761e-07, "loss": 1.0769323348999023, "mean_token_accuracy": 0.801658408343792, "num_tokens": 13942830.0, "step": 4320 }, { "entropy": 0.7648129913024604, "epoch": 0.9897142857142858, "grad_norm": 11.9375, "learning_rate": 2.2131344719749822e-07, "loss": 1.0284333229064941, "mean_token_accuracy": 0.8126491412520409, "num_tokens": 13975429.0, "step": 4330 }, { "entropy": 0.7054416437633335, "epoch": 0.992, "grad_norm": 6.625, "learning_rate": 1.7320182824152033e-07, "loss": 0.9879807472229004, "mean_token_accuracy": 0.834271340072155, "num_tokens": 14007911.0, "step": 4340 }, { "entropy": 0.5742446383461356, "epoch": 0.9942857142857143, "grad_norm": 6.8125, "learning_rate": 1.2509020928554246e-07, "loss": 0.8198482513427734, "mean_token_accuracy": 0.8546571791172027, "num_tokens": 14041386.0, "step": 4350 }, { "entropy": 0.8128698419779539, "epoch": 0.9965714285714286, "grad_norm": 6.78125, "learning_rate": 7.69785903295646e-08, "loss": 1.0970548629760741, "mean_token_accuracy": 0.8060387209057808, "num_tokens": 14074136.0, "step": 4360 }, { "entropy": 0.7844365012831986, "epoch": 0.9988571428571429, "grad_norm": 8.0625, "learning_rate": 2.8866971373586724e-08, "loss": 1.0246350288391113, "mean_token_accuracy": 0.8180203422904014, "num_tokens": 14106425.0, "step": 4370 } ], "logging_steps": 10, "max_steps": 4375, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.602238427340718e+17, "train_batch_size": 2, "trial_name": null, "trial_params": null }