{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.27213352685050796, "eval_steps": 3000, "global_step": 3000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.691939735412598, "epoch": 0.00045355587808418, "grad_norm": 13.6875, "learning_rate": 2e-06, "loss": 10.8323, "mean_token_accuracy": 0.0, "num_tokens": 9883.0, "step": 5 }, { "entropy": 10.69197416305542, "epoch": 0.00090711175616836, "grad_norm": 12.4375, "learning_rate": 4.5e-06, "loss": 10.7629, "mean_token_accuracy": 0.00031574604799970983, "num_tokens": 20400.0, "step": 10 }, { "entropy": 10.691064357757568, "epoch": 0.00136066763425254, "grad_norm": 9.6875, "learning_rate": 7e-06, "loss": 10.5051, "mean_token_accuracy": 0.027546282985713332, "num_tokens": 31503.0, "step": 15 }, { "entropy": 10.68053970336914, "epoch": 0.00181422351233672, "grad_norm": 6.40625, "learning_rate": 9.5e-06, "loss": 10.1556, "mean_token_accuracy": 0.04329935684800148, "num_tokens": 41648.0, "step": 20 }, { "entropy": 10.629761695861816, "epoch": 0.0022677793904208998, "grad_norm": 4.21875, "learning_rate": 1.2e-05, "loss": 9.8493, "mean_token_accuracy": 0.04506267905235291, "num_tokens": 51580.0, "step": 25 }, { "entropy": 10.582753944396973, "epoch": 0.00272133526850508, "grad_norm": 3.203125, "learning_rate": 1.4500000000000002e-05, "loss": 9.6753, "mean_token_accuracy": 0.046586386114358905, "num_tokens": 61612.0, "step": 30 }, { "entropy": 10.568104076385499, "epoch": 0.00317489114658926, "grad_norm": 2.78125, "learning_rate": 1.7000000000000003e-05, "loss": 9.6287, "mean_token_accuracy": 0.045973442122340204, "num_tokens": 71673.0, "step": 35 }, { "entropy": 10.570516300201415, "epoch": 0.00362844702467344, "grad_norm": 2.6875, "learning_rate": 1.95e-05, "loss": 9.5556, "mean_token_accuracy": 0.05169081836938858, "num_tokens": 81437.0, "step": 40 }, { "entropy": 10.541032028198241, "epoch": 0.00408200290275762, "grad_norm": 2.53125, "learning_rate": 2.2e-05, "loss": 9.5206, "mean_token_accuracy": 0.049654603004455566, "num_tokens": 90827.0, "step": 45 }, { "entropy": 10.549186420440673, "epoch": 0.0045355587808417995, "grad_norm": 2.484375, "learning_rate": 2.4500000000000003e-05, "loss": 9.48, "mean_token_accuracy": 0.05328560955822468, "num_tokens": 100253.0, "step": 50 }, { "entropy": 10.541085529327393, "epoch": 0.00498911465892598, "grad_norm": 2.5, "learning_rate": 2.7e-05, "loss": 9.3843, "mean_token_accuracy": 0.061034252494573595, "num_tokens": 110393.0, "step": 55 }, { "entropy": 10.490248107910157, "epoch": 0.00544267053701016, "grad_norm": 2.4375, "learning_rate": 2.95e-05, "loss": 9.3537, "mean_token_accuracy": 0.060261032357811925, "num_tokens": 121012.0, "step": 60 }, { "entropy": 10.395410060882568, "epoch": 0.00589622641509434, "grad_norm": 2.515625, "learning_rate": 3.2e-05, "loss": 9.287, "mean_token_accuracy": 0.06284476146101951, "num_tokens": 131118.0, "step": 65 }, { "entropy": 10.410375499725342, "epoch": 0.00634978229317852, "grad_norm": 2.34375, "learning_rate": 3.4500000000000005e-05, "loss": 9.1803, "mean_token_accuracy": 0.06393150016665458, "num_tokens": 142145.0, "step": 70 }, { "entropy": 10.449656963348389, "epoch": 0.006803338171262699, "grad_norm": 2.5, "learning_rate": 3.7e-05, "loss": 9.0845, "mean_token_accuracy": 0.06696042232215405, "num_tokens": 152691.0, "step": 75 }, { "entropy": 10.315881538391114, "epoch": 0.00725689404934688, "grad_norm": 2.78125, "learning_rate": 3.95e-05, "loss": 8.9505, "mean_token_accuracy": 0.07629339359700679, "num_tokens": 162278.0, "step": 80 }, { "entropy": 10.312966537475585, "epoch": 0.007710449927431059, "grad_norm": 2.5, "learning_rate": 4.2000000000000004e-05, "loss": 8.8565, "mean_token_accuracy": 0.07719368785619736, "num_tokens": 171942.0, "step": 85 }, { "entropy": 10.19672908782959, "epoch": 0.00816400580551524, "grad_norm": 2.25, "learning_rate": 4.45e-05, "loss": 8.8517, "mean_token_accuracy": 0.07195285111665725, "num_tokens": 183194.0, "step": 90 }, { "entropy": 10.182042503356934, "epoch": 0.00861756168359942, "grad_norm": 2.28125, "learning_rate": 4.7000000000000004e-05, "loss": 8.6574, "mean_token_accuracy": 0.07674754187464713, "num_tokens": 194775.0, "step": 95 }, { "entropy": 10.162378025054931, "epoch": 0.009071117561683599, "grad_norm": 2.34375, "learning_rate": 4.9500000000000004e-05, "loss": 8.6036, "mean_token_accuracy": 0.07473644688725471, "num_tokens": 204720.0, "step": 100 }, { "entropy": 10.052161598205567, "epoch": 0.009524673439767779, "grad_norm": 2.078125, "learning_rate": 5.2e-05, "loss": 8.4531, "mean_token_accuracy": 0.08001778945326805, "num_tokens": 214822.0, "step": 105 }, { "entropy": 10.04954490661621, "epoch": 0.00997822931785196, "grad_norm": 1.890625, "learning_rate": 5.45e-05, "loss": 8.3787, "mean_token_accuracy": 0.07661775350570679, "num_tokens": 225365.0, "step": 110 }, { "entropy": 9.939160346984863, "epoch": 0.01043178519593614, "grad_norm": 1.9375, "learning_rate": 5.7e-05, "loss": 8.282, "mean_token_accuracy": 0.07927817553281784, "num_tokens": 236145.0, "step": 115 }, { "entropy": 9.821665000915527, "epoch": 0.01088534107402032, "grad_norm": 1.8203125, "learning_rate": 5.9499999999999996e-05, "loss": 8.1728, "mean_token_accuracy": 0.08287631459534169, "num_tokens": 247703.0, "step": 120 }, { "entropy": 9.734042263031006, "epoch": 0.011338896952104499, "grad_norm": 1.7265625, "learning_rate": 6.2e-05, "loss": 8.086, "mean_token_accuracy": 0.0859085351228714, "num_tokens": 258291.0, "step": 125 }, { "entropy": 9.552165699005126, "epoch": 0.01179245283018868, "grad_norm": 1.5390625, "learning_rate": 6.450000000000001e-05, "loss": 7.915, "mean_token_accuracy": 0.07912573739886283, "num_tokens": 268784.0, "step": 130 }, { "entropy": 9.39622163772583, "epoch": 0.01224600870827286, "grad_norm": 1.6015625, "learning_rate": 6.7e-05, "loss": 7.8058, "mean_token_accuracy": 0.07961424812674522, "num_tokens": 279135.0, "step": 135 }, { "entropy": 9.229594898223876, "epoch": 0.01269956458635704, "grad_norm": 1.5, "learning_rate": 6.950000000000001e-05, "loss": 7.7052, "mean_token_accuracy": 0.08270319849252701, "num_tokens": 289234.0, "step": 140 }, { "entropy": 8.944133758544922, "epoch": 0.013153120464441219, "grad_norm": 1.6015625, "learning_rate": 7.2e-05, "loss": 7.578, "mean_token_accuracy": 0.08616896718740463, "num_tokens": 299424.0, "step": 145 }, { "entropy": 8.690094184875488, "epoch": 0.013606676342525399, "grad_norm": 1.671875, "learning_rate": 7.45e-05, "loss": 7.4444, "mean_token_accuracy": 0.09042754545807838, "num_tokens": 310040.0, "step": 150 }, { "entropy": 8.549762439727782, "epoch": 0.01406023222060958, "grad_norm": 1.21875, "learning_rate": 7.7e-05, "loss": 7.4418, "mean_token_accuracy": 0.08952978774905204, "num_tokens": 319995.0, "step": 155 }, { "entropy": 8.382944869995118, "epoch": 0.01451378809869376, "grad_norm": 1.0390625, "learning_rate": 7.950000000000001e-05, "loss": 7.3727, "mean_token_accuracy": 0.08898745998740196, "num_tokens": 331212.0, "step": 160 }, { "entropy": 8.153345584869385, "epoch": 0.014967343976777939, "grad_norm": 1.3046875, "learning_rate": 8.2e-05, "loss": 7.3922, "mean_token_accuracy": 0.0851880744099617, "num_tokens": 341435.0, "step": 165 }, { "entropy": 8.16848258972168, "epoch": 0.015420899854862119, "grad_norm": 1.2890625, "learning_rate": 8.450000000000001e-05, "loss": 7.3169, "mean_token_accuracy": 0.09060425236821175, "num_tokens": 351415.0, "step": 170 }, { "entropy": 8.10801820755005, "epoch": 0.0158744557329463, "grad_norm": 1.2734375, "learning_rate": 8.7e-05, "loss": 7.377, "mean_token_accuracy": 0.08710973337292671, "num_tokens": 361862.0, "step": 175 }, { "entropy": 7.906155395507812, "epoch": 0.01632801161103048, "grad_norm": 1.2734375, "learning_rate": 8.95e-05, "loss": 7.2797, "mean_token_accuracy": 0.08494263291358947, "num_tokens": 371658.0, "step": 180 }, { "entropy": 7.864446401596069, "epoch": 0.01678156748911466, "grad_norm": 1.2265625, "learning_rate": 9.2e-05, "loss": 7.2279, "mean_token_accuracy": 0.08928770050406457, "num_tokens": 382288.0, "step": 185 }, { "entropy": 7.861935758590699, "epoch": 0.01723512336719884, "grad_norm": 1.3203125, "learning_rate": 9.45e-05, "loss": 7.3235, "mean_token_accuracy": 0.09150304198265076, "num_tokens": 392852.0, "step": 190 }, { "entropy": 7.856825923919677, "epoch": 0.01768867924528302, "grad_norm": 1.40625, "learning_rate": 9.7e-05, "loss": 7.1984, "mean_token_accuracy": 0.09069699421525002, "num_tokens": 403813.0, "step": 195 }, { "entropy": 7.694656801223755, "epoch": 0.018142235123367198, "grad_norm": 1.234375, "learning_rate": 9.95e-05, "loss": 7.2223, "mean_token_accuracy": 0.08859646022319793, "num_tokens": 414470.0, "step": 200 }, { "entropy": 7.705080652236939, "epoch": 0.018595791001451378, "grad_norm": 1.2265625, "learning_rate": 0.000102, "loss": 7.2239, "mean_token_accuracy": 0.09004590287804604, "num_tokens": 424949.0, "step": 205 }, { "entropy": 7.736959314346313, "epoch": 0.019049346879535557, "grad_norm": 1.2421875, "learning_rate": 0.00010449999999999999, "loss": 7.0639, "mean_token_accuracy": 0.09480814039707183, "num_tokens": 435133.0, "step": 210 }, { "entropy": 7.6014525413513185, "epoch": 0.01950290275761974, "grad_norm": 1.359375, "learning_rate": 0.000107, "loss": 7.1543, "mean_token_accuracy": 0.0943043127655983, "num_tokens": 445789.0, "step": 215 }, { "entropy": 7.600877857208252, "epoch": 0.01995645863570392, "grad_norm": 1.2578125, "learning_rate": 0.0001095, "loss": 7.1506, "mean_token_accuracy": 0.09123467728495598, "num_tokens": 455516.0, "step": 220 }, { "entropy": 7.597001695632935, "epoch": 0.0204100145137881, "grad_norm": 1.2890625, "learning_rate": 0.000112, "loss": 7.1802, "mean_token_accuracy": 0.09758866354823112, "num_tokens": 466350.0, "step": 225 }, { "entropy": 7.643424654006958, "epoch": 0.02086357039187228, "grad_norm": 1.5078125, "learning_rate": 0.0001145, "loss": 7.1326, "mean_token_accuracy": 0.0965645931661129, "num_tokens": 477342.0, "step": 230 }, { "entropy": 7.578091096878052, "epoch": 0.02131712626995646, "grad_norm": 1.484375, "learning_rate": 0.00011700000000000001, "loss": 7.1025, "mean_token_accuracy": 0.09310675337910652, "num_tokens": 487095.0, "step": 235 }, { "entropy": 7.599606895446778, "epoch": 0.02177068214804064, "grad_norm": 1.0703125, "learning_rate": 0.00011949999999999999, "loss": 7.0785, "mean_token_accuracy": 0.09243985787034034, "num_tokens": 498945.0, "step": 240 }, { "entropy": 7.6134318828582765, "epoch": 0.022224238026124818, "grad_norm": 1.3046875, "learning_rate": 0.000122, "loss": 7.1216, "mean_token_accuracy": 0.0947557583451271, "num_tokens": 508863.0, "step": 245 }, { "entropy": 7.505317640304566, "epoch": 0.022677793904208998, "grad_norm": 1.359375, "learning_rate": 0.0001245, "loss": 7.083, "mean_token_accuracy": 0.09349310845136642, "num_tokens": 518887.0, "step": 250 }, { "entropy": 7.506907272338867, "epoch": 0.023131349782293177, "grad_norm": 1.1171875, "learning_rate": 0.000127, "loss": 7.0638, "mean_token_accuracy": 0.0991144374012947, "num_tokens": 529198.0, "step": 255 }, { "entropy": 7.526238584518433, "epoch": 0.02358490566037736, "grad_norm": 1.1328125, "learning_rate": 0.0001295, "loss": 7.0582, "mean_token_accuracy": 0.09299291446805, "num_tokens": 540003.0, "step": 260 }, { "entropy": 7.563022041320801, "epoch": 0.02403846153846154, "grad_norm": 1.3125, "learning_rate": 0.000132, "loss": 7.0378, "mean_token_accuracy": 0.09797687977552413, "num_tokens": 549243.0, "step": 265 }, { "entropy": 7.543271493911743, "epoch": 0.02449201741654572, "grad_norm": 1.15625, "learning_rate": 0.00013450000000000002, "loss": 7.1975, "mean_token_accuracy": 0.09064211472868919, "num_tokens": 559721.0, "step": 270 }, { "entropy": 7.47391448020935, "epoch": 0.0249455732946299, "grad_norm": 1.234375, "learning_rate": 0.00013700000000000002, "loss": 7.0127, "mean_token_accuracy": 0.09864112585783005, "num_tokens": 569034.0, "step": 275 }, { "entropy": 7.420712518692016, "epoch": 0.02539912917271408, "grad_norm": 1.0625, "learning_rate": 0.0001395, "loss": 7.073, "mean_token_accuracy": 0.09223218783736228, "num_tokens": 580082.0, "step": 280 }, { "entropy": 7.422401809692383, "epoch": 0.025852685050798258, "grad_norm": 1.4140625, "learning_rate": 0.00014199999999999998, "loss": 6.9636, "mean_token_accuracy": 0.09520288854837418, "num_tokens": 590326.0, "step": 285 }, { "entropy": 7.595379972457886, "epoch": 0.026306240928882438, "grad_norm": 1.109375, "learning_rate": 0.0001445, "loss": 7.1377, "mean_token_accuracy": 0.0937683179974556, "num_tokens": 601745.0, "step": 290 }, { "entropy": 7.418688154220581, "epoch": 0.026759796806966617, "grad_norm": 1.28125, "learning_rate": 0.000147, "loss": 7.0825, "mean_token_accuracy": 0.09572035521268844, "num_tokens": 612306.0, "step": 295 }, { "entropy": 7.382623720169067, "epoch": 0.027213352685050797, "grad_norm": 1.34375, "learning_rate": 0.0001495, "loss": 7.0017, "mean_token_accuracy": 0.09278988242149352, "num_tokens": 623315.0, "step": 300 }, { "entropy": 7.3942585468292235, "epoch": 0.027666908563134977, "grad_norm": 1.2421875, "learning_rate": 0.000152, "loss": 6.9455, "mean_token_accuracy": 0.09706330373883247, "num_tokens": 632981.0, "step": 305 }, { "entropy": 7.5014002323150635, "epoch": 0.02812046444121916, "grad_norm": 1.3984375, "learning_rate": 0.00015450000000000001, "loss": 6.9848, "mean_token_accuracy": 0.10258090272545814, "num_tokens": 642872.0, "step": 310 }, { "entropy": 7.2068887710571286, "epoch": 0.02857402031930334, "grad_norm": 1.1953125, "learning_rate": 0.000157, "loss": 6.9519, "mean_token_accuracy": 0.09786502793431281, "num_tokens": 652756.0, "step": 315 }, { "entropy": 7.3521472930908205, "epoch": 0.02902757619738752, "grad_norm": 1.3203125, "learning_rate": 0.0001595, "loss": 6.9107, "mean_token_accuracy": 0.09691967144608497, "num_tokens": 663537.0, "step": 320 }, { "entropy": 7.311666536331177, "epoch": 0.0294811320754717, "grad_norm": 1.4375, "learning_rate": 0.000162, "loss": 6.915, "mean_token_accuracy": 0.0960552416741848, "num_tokens": 673811.0, "step": 325 }, { "entropy": 7.272817134857178, "epoch": 0.029934687953555878, "grad_norm": 1.15625, "learning_rate": 0.00016450000000000001, "loss": 6.91, "mean_token_accuracy": 0.09867974072694778, "num_tokens": 683733.0, "step": 330 }, { "entropy": 7.3990702629089355, "epoch": 0.030388243831640058, "grad_norm": 1.1171875, "learning_rate": 0.00016700000000000002, "loss": 6.9882, "mean_token_accuracy": 0.09951149746775627, "num_tokens": 693110.0, "step": 335 }, { "entropy": 7.159088897705078, "epoch": 0.030841799709724237, "grad_norm": 1.203125, "learning_rate": 0.00016950000000000003, "loss": 6.7683, "mean_token_accuracy": 0.10487765744328499, "num_tokens": 703808.0, "step": 340 }, { "entropy": 7.251721620559692, "epoch": 0.03129535558780842, "grad_norm": 1.1171875, "learning_rate": 0.00017199999999999998, "loss": 6.9813, "mean_token_accuracy": 0.09775393083691597, "num_tokens": 715701.0, "step": 345 }, { "entropy": 7.248662281036377, "epoch": 0.0317489114658926, "grad_norm": 1.5625, "learning_rate": 0.00017449999999999999, "loss": 6.8396, "mean_token_accuracy": 0.10250790566205978, "num_tokens": 725635.0, "step": 350 }, { "entropy": 7.2260857105255125, "epoch": 0.032202467343976776, "grad_norm": 1.203125, "learning_rate": 0.000177, "loss": 6.8703, "mean_token_accuracy": 0.0953724816441536, "num_tokens": 734827.0, "step": 355 }, { "entropy": 7.1952399730682375, "epoch": 0.03265602322206096, "grad_norm": 1.09375, "learning_rate": 0.0001795, "loss": 6.7781, "mean_token_accuracy": 0.10356629341840744, "num_tokens": 744916.0, "step": 360 }, { "entropy": 7.194821214675903, "epoch": 0.033109579100145135, "grad_norm": 1.2890625, "learning_rate": 0.000182, "loss": 6.8991, "mean_token_accuracy": 0.10033663883805274, "num_tokens": 756021.0, "step": 365 }, { "entropy": 7.260288143157959, "epoch": 0.03356313497822932, "grad_norm": 1.2265625, "learning_rate": 0.0001845, "loss": 6.9113, "mean_token_accuracy": 0.0992978885769844, "num_tokens": 766513.0, "step": 370 }, { "entropy": 7.201397514343261, "epoch": 0.034016690856313495, "grad_norm": 1.4296875, "learning_rate": 0.000187, "loss": 6.8958, "mean_token_accuracy": 0.0985984705388546, "num_tokens": 776049.0, "step": 375 }, { "entropy": 7.044051551818848, "epoch": 0.03447024673439768, "grad_norm": 1.2421875, "learning_rate": 0.0001895, "loss": 6.8231, "mean_token_accuracy": 0.10297032371163369, "num_tokens": 786736.0, "step": 380 }, { "entropy": 7.260237407684326, "epoch": 0.03492380261248186, "grad_norm": 1.203125, "learning_rate": 0.000192, "loss": 6.8279, "mean_token_accuracy": 0.09664658829569817, "num_tokens": 797550.0, "step": 385 }, { "entropy": 7.245859956741333, "epoch": 0.03537735849056604, "grad_norm": 1.0546875, "learning_rate": 0.0001945, "loss": 6.8971, "mean_token_accuracy": 0.09864228665828705, "num_tokens": 808382.0, "step": 390 }, { "entropy": 7.1667686939239506, "epoch": 0.03583091436865022, "grad_norm": 1.0859375, "learning_rate": 0.00019700000000000002, "loss": 6.8204, "mean_token_accuracy": 0.10059952437877655, "num_tokens": 819223.0, "step": 395 }, { "entropy": 7.2114091396331785, "epoch": 0.036284470246734396, "grad_norm": 1.1328125, "learning_rate": 0.00019950000000000002, "loss": 6.8042, "mean_token_accuracy": 0.09473831579089165, "num_tokens": 828994.0, "step": 400 }, { "entropy": 7.191949510574341, "epoch": 0.03673802612481858, "grad_norm": 1.171875, "learning_rate": 0.000202, "loss": 6.9443, "mean_token_accuracy": 0.09205318689346313, "num_tokens": 840333.0, "step": 405 }, { "entropy": 7.121156358718872, "epoch": 0.037191582002902755, "grad_norm": 1.2421875, "learning_rate": 0.00020449999999999998, "loss": 6.7293, "mean_token_accuracy": 0.10459425449371337, "num_tokens": 851033.0, "step": 410 }, { "entropy": 7.063291597366333, "epoch": 0.03764513788098694, "grad_norm": 1.2734375, "learning_rate": 0.000207, "loss": 6.7723, "mean_token_accuracy": 0.09623789712786675, "num_tokens": 861588.0, "step": 415 }, { "entropy": 7.116500473022461, "epoch": 0.038098693759071114, "grad_norm": 1.1875, "learning_rate": 0.0002095, "loss": 6.8824, "mean_token_accuracy": 0.10527986362576484, "num_tokens": 871401.0, "step": 420 }, { "entropy": 7.107698678970337, "epoch": 0.0385522496371553, "grad_norm": 1.09375, "learning_rate": 0.000212, "loss": 6.798, "mean_token_accuracy": 0.09808883890509605, "num_tokens": 881948.0, "step": 425 }, { "entropy": 7.093855142593384, "epoch": 0.03900580551523948, "grad_norm": 1.2890625, "learning_rate": 0.0002145, "loss": 6.7499, "mean_token_accuracy": 0.10276206359267234, "num_tokens": 891624.0, "step": 430 }, { "entropy": 7.118248414993286, "epoch": 0.03945936139332366, "grad_norm": 1.1015625, "learning_rate": 0.00021700000000000002, "loss": 6.8649, "mean_token_accuracy": 0.09989958107471467, "num_tokens": 902468.0, "step": 435 }, { "entropy": 7.01951036453247, "epoch": 0.03991291727140784, "grad_norm": 1.0546875, "learning_rate": 0.0002195, "loss": 6.7933, "mean_token_accuracy": 0.10295612290501595, "num_tokens": 912508.0, "step": 440 }, { "entropy": 7.089923477172851, "epoch": 0.040366473149492016, "grad_norm": 1.1015625, "learning_rate": 0.000222, "loss": 6.8227, "mean_token_accuracy": 0.10121235325932502, "num_tokens": 923728.0, "step": 445 }, { "entropy": 7.064526224136353, "epoch": 0.0408200290275762, "grad_norm": 1.3828125, "learning_rate": 0.0002245, "loss": 6.7884, "mean_token_accuracy": 0.10058841332793236, "num_tokens": 933197.0, "step": 450 }, { "entropy": 6.956214904785156, "epoch": 0.041273584905660375, "grad_norm": 1.2109375, "learning_rate": 0.00022700000000000002, "loss": 6.5999, "mean_token_accuracy": 0.10817481204867363, "num_tokens": 943385.0, "step": 455 }, { "entropy": 6.93480110168457, "epoch": 0.04172714078374456, "grad_norm": 1.15625, "learning_rate": 0.00022950000000000002, "loss": 6.6521, "mean_token_accuracy": 0.10884237810969352, "num_tokens": 952674.0, "step": 460 }, { "entropy": 6.947038888931274, "epoch": 0.042180696661828734, "grad_norm": 1.203125, "learning_rate": 0.00023200000000000003, "loss": 6.7395, "mean_token_accuracy": 0.10702011436223983, "num_tokens": 962406.0, "step": 465 }, { "entropy": 7.075675964355469, "epoch": 0.04263425253991292, "grad_norm": 1.1875, "learning_rate": 0.00023449999999999998, "loss": 6.759, "mean_token_accuracy": 0.10087487250566482, "num_tokens": 973131.0, "step": 470 }, { "entropy": 6.923453664779663, "epoch": 0.0430878084179971, "grad_norm": 1.2109375, "learning_rate": 0.000237, "loss": 6.6279, "mean_token_accuracy": 0.10887465253472328, "num_tokens": 982777.0, "step": 475 }, { "entropy": 6.913258600234985, "epoch": 0.04354136429608128, "grad_norm": 1.1171875, "learning_rate": 0.0002395, "loss": 6.7205, "mean_token_accuracy": 0.0963176041841507, "num_tokens": 994498.0, "step": 480 }, { "entropy": 6.931819868087769, "epoch": 0.04399492017416546, "grad_norm": 1.3125, "learning_rate": 0.000242, "loss": 6.7911, "mean_token_accuracy": 0.1031719870865345, "num_tokens": 1004256.0, "step": 485 }, { "entropy": 7.00779275894165, "epoch": 0.044448476052249636, "grad_norm": 1.171875, "learning_rate": 0.0002445, "loss": 6.7541, "mean_token_accuracy": 0.09925626143813134, "num_tokens": 1015172.0, "step": 490 }, { "entropy": 6.965081644058228, "epoch": 0.04490203193033382, "grad_norm": 1.4765625, "learning_rate": 0.000247, "loss": 6.6909, "mean_token_accuracy": 0.10554371923208236, "num_tokens": 1025636.0, "step": 495 }, { "entropy": 6.928272819519043, "epoch": 0.045355587808417995, "grad_norm": 1.1796875, "learning_rate": 0.0002495, "loss": 6.7203, "mean_token_accuracy": 0.11081329062581062, "num_tokens": 1035674.0, "step": 500 }, { "entropy": 6.931467914581299, "epoch": 0.04580914368650218, "grad_norm": 0.99609375, "learning_rate": 0.000252, "loss": 6.6966, "mean_token_accuracy": 0.10857350751757622, "num_tokens": 1045643.0, "step": 505 }, { "entropy": 6.945031785964966, "epoch": 0.046262699564586354, "grad_norm": 1.0703125, "learning_rate": 0.0002545, "loss": 6.6697, "mean_token_accuracy": 0.10533757880330086, "num_tokens": 1056543.0, "step": 510 }, { "entropy": 6.877411794662476, "epoch": 0.04671625544267054, "grad_norm": 1.234375, "learning_rate": 0.000257, "loss": 6.6419, "mean_token_accuracy": 0.10245436802506447, "num_tokens": 1066828.0, "step": 515 }, { "entropy": 6.901714277267456, "epoch": 0.04716981132075472, "grad_norm": 1.1875, "learning_rate": 0.0002595, "loss": 6.6714, "mean_token_accuracy": 0.10999734550714493, "num_tokens": 1076230.0, "step": 520 }, { "entropy": 6.883963012695313, "epoch": 0.047623367198838897, "grad_norm": 1.1171875, "learning_rate": 0.000262, "loss": 6.707, "mean_token_accuracy": 0.10455554500222206, "num_tokens": 1086430.0, "step": 525 }, { "entropy": 6.921725177764893, "epoch": 0.04807692307692308, "grad_norm": 1.078125, "learning_rate": 0.00026450000000000003, "loss": 6.6064, "mean_token_accuracy": 0.11501444876194, "num_tokens": 1096403.0, "step": 530 }, { "entropy": 6.7906153202056885, "epoch": 0.048530478955007256, "grad_norm": 1.1953125, "learning_rate": 0.00026700000000000004, "loss": 6.5687, "mean_token_accuracy": 0.11038950607180595, "num_tokens": 1107289.0, "step": 535 }, { "entropy": 6.942843580245972, "epoch": 0.04898403483309144, "grad_norm": 1.1953125, "learning_rate": 0.00026950000000000005, "loss": 6.7614, "mean_token_accuracy": 0.09955370277166367, "num_tokens": 1118301.0, "step": 540 }, { "entropy": 6.997049474716187, "epoch": 0.049437590711175615, "grad_norm": 1.203125, "learning_rate": 0.00027200000000000005, "loss": 6.737, "mean_token_accuracy": 0.10176396444439888, "num_tokens": 1129002.0, "step": 545 }, { "entropy": 6.818488597869873, "epoch": 0.0498911465892598, "grad_norm": 1.1328125, "learning_rate": 0.0002745, "loss": 6.7196, "mean_token_accuracy": 0.10543971955776214, "num_tokens": 1139415.0, "step": 550 }, { "entropy": 6.8720558166503904, "epoch": 0.050344702467343974, "grad_norm": 1.0625, "learning_rate": 0.000277, "loss": 6.6889, "mean_token_accuracy": 0.10523920580744743, "num_tokens": 1151231.0, "step": 555 }, { "entropy": 6.720426321029663, "epoch": 0.05079825834542816, "grad_norm": 1.1328125, "learning_rate": 0.0002795, "loss": 6.5739, "mean_token_accuracy": 0.10560568794608116, "num_tokens": 1161643.0, "step": 560 }, { "entropy": 6.868243741989136, "epoch": 0.05125181422351233, "grad_norm": 1.2109375, "learning_rate": 0.00028199999999999997, "loss": 6.624, "mean_token_accuracy": 0.10310710221529007, "num_tokens": 1173362.0, "step": 565 }, { "entropy": 6.858621978759766, "epoch": 0.051705370101596516, "grad_norm": 1.09375, "learning_rate": 0.0002845, "loss": 6.629, "mean_token_accuracy": 0.10223327353596687, "num_tokens": 1184812.0, "step": 570 }, { "entropy": 6.851276063919068, "epoch": 0.0521589259796807, "grad_norm": 1.140625, "learning_rate": 0.000287, "loss": 6.5943, "mean_token_accuracy": 0.1135420560836792, "num_tokens": 1195556.0, "step": 575 }, { "entropy": 6.787323379516602, "epoch": 0.052612481857764876, "grad_norm": 1.1328125, "learning_rate": 0.0002895, "loss": 6.6018, "mean_token_accuracy": 0.11323990225791931, "num_tokens": 1206735.0, "step": 580 }, { "entropy": 6.803449630737305, "epoch": 0.05306603773584906, "grad_norm": 1.109375, "learning_rate": 0.000292, "loss": 6.7011, "mean_token_accuracy": 0.10117989927530288, "num_tokens": 1216778.0, "step": 585 }, { "entropy": 6.848930168151855, "epoch": 0.053519593613933235, "grad_norm": 1.125, "learning_rate": 0.0002945, "loss": 6.6297, "mean_token_accuracy": 0.1108930803835392, "num_tokens": 1227462.0, "step": 590 }, { "entropy": 6.823454809188843, "epoch": 0.05397314949201742, "grad_norm": 1.1875, "learning_rate": 0.000297, "loss": 6.6961, "mean_token_accuracy": 0.10993156135082245, "num_tokens": 1237378.0, "step": 595 }, { "entropy": 6.806218099594116, "epoch": 0.054426705370101594, "grad_norm": 1.140625, "learning_rate": 0.0002995, "loss": 6.6763, "mean_token_accuracy": 0.10614893436431885, "num_tokens": 1247599.0, "step": 600 }, { "entropy": 6.748168039321899, "epoch": 0.05488026124818578, "grad_norm": 1.140625, "learning_rate": 0.000302, "loss": 6.5415, "mean_token_accuracy": 0.10683367103338241, "num_tokens": 1257989.0, "step": 605 }, { "entropy": 6.828956031799317, "epoch": 0.05533381712626995, "grad_norm": 1.0703125, "learning_rate": 0.0003045, "loss": 6.6517, "mean_token_accuracy": 0.10376828461885453, "num_tokens": 1269313.0, "step": 610 }, { "entropy": 6.829959964752197, "epoch": 0.055787373004354136, "grad_norm": 1.2265625, "learning_rate": 0.000307, "loss": 6.6361, "mean_token_accuracy": 0.10490350201725959, "num_tokens": 1280422.0, "step": 615 }, { "entropy": 6.7708775997161865, "epoch": 0.05624092888243832, "grad_norm": 1.2421875, "learning_rate": 0.0003095, "loss": 6.6623, "mean_token_accuracy": 0.10884316489100457, "num_tokens": 1289482.0, "step": 620 }, { "entropy": 6.763772773742676, "epoch": 0.056694484760522496, "grad_norm": 1.078125, "learning_rate": 0.000312, "loss": 6.6181, "mean_token_accuracy": 0.10594562590122222, "num_tokens": 1299782.0, "step": 625 }, { "entropy": 6.758108377456665, "epoch": 0.05714804063860668, "grad_norm": 1.171875, "learning_rate": 0.0003145, "loss": 6.5993, "mean_token_accuracy": 0.11340658813714981, "num_tokens": 1311628.0, "step": 630 }, { "entropy": 6.796287631988525, "epoch": 0.057601596516690855, "grad_norm": 1.140625, "learning_rate": 0.000317, "loss": 6.655, "mean_token_accuracy": 0.10296097546815872, "num_tokens": 1322456.0, "step": 635 }, { "entropy": 6.721327924728394, "epoch": 0.05805515239477504, "grad_norm": 1.09375, "learning_rate": 0.0003195, "loss": 6.5153, "mean_token_accuracy": 0.11600816994905472, "num_tokens": 1331737.0, "step": 640 }, { "entropy": 6.746915245056153, "epoch": 0.058508708272859214, "grad_norm": 1.3359375, "learning_rate": 0.000322, "loss": 6.5369, "mean_token_accuracy": 0.10856858938932419, "num_tokens": 1341236.0, "step": 645 }, { "entropy": 6.563586473464966, "epoch": 0.0589622641509434, "grad_norm": 1.15625, "learning_rate": 0.00032450000000000003, "loss": 6.5459, "mean_token_accuracy": 0.11117523983120918, "num_tokens": 1352885.0, "step": 650 }, { "entropy": 6.767751598358155, "epoch": 0.05941582002902757, "grad_norm": 0.96875, "learning_rate": 0.00032700000000000003, "loss": 6.5208, "mean_token_accuracy": 0.10883594155311585, "num_tokens": 1363455.0, "step": 655 }, { "entropy": 6.698432683944702, "epoch": 0.059869375907111756, "grad_norm": 1.1328125, "learning_rate": 0.00032950000000000004, "loss": 6.5548, "mean_token_accuracy": 0.11928504556417466, "num_tokens": 1373176.0, "step": 660 }, { "entropy": 6.799010419845581, "epoch": 0.06032293178519594, "grad_norm": 1.28125, "learning_rate": 0.00033200000000000005, "loss": 6.6198, "mean_token_accuracy": 0.10528008192777634, "num_tokens": 1383122.0, "step": 665 }, { "entropy": 6.690959692001343, "epoch": 0.060776487663280115, "grad_norm": 1.21875, "learning_rate": 0.00033450000000000005, "loss": 6.4729, "mean_token_accuracy": 0.11281677708029747, "num_tokens": 1392889.0, "step": 670 }, { "entropy": 6.623794364929199, "epoch": 0.0612300435413643, "grad_norm": 1.1953125, "learning_rate": 0.000337, "loss": 6.5809, "mean_token_accuracy": 0.10769900307059288, "num_tokens": 1403450.0, "step": 675 }, { "entropy": 6.742135953903198, "epoch": 0.061683599419448475, "grad_norm": 1.1953125, "learning_rate": 0.0003395, "loss": 6.6187, "mean_token_accuracy": 0.1039137601852417, "num_tokens": 1414075.0, "step": 680 }, { "entropy": 6.662317562103271, "epoch": 0.06213715529753266, "grad_norm": 1.0234375, "learning_rate": 0.000342, "loss": 6.5274, "mean_token_accuracy": 0.10077093541622162, "num_tokens": 1424376.0, "step": 685 }, { "entropy": 6.750758123397827, "epoch": 0.06259071117561683, "grad_norm": 1.1484375, "learning_rate": 0.00034449999999999997, "loss": 6.512, "mean_token_accuracy": 0.11837425976991653, "num_tokens": 1433780.0, "step": 690 }, { "entropy": 6.588320541381836, "epoch": 0.06304426705370102, "grad_norm": 0.98046875, "learning_rate": 0.000347, "loss": 6.5228, "mean_token_accuracy": 0.1112312689423561, "num_tokens": 1444179.0, "step": 695 }, { "entropy": 6.737683391571045, "epoch": 0.0634978229317852, "grad_norm": 1.1328125, "learning_rate": 0.0003495, "loss": 6.5988, "mean_token_accuracy": 0.10832765325903893, "num_tokens": 1455342.0, "step": 700 }, { "entropy": 6.5270322322845455, "epoch": 0.06395137880986937, "grad_norm": 1.125, "learning_rate": 0.000352, "loss": 6.4367, "mean_token_accuracy": 0.11744177639484406, "num_tokens": 1465007.0, "step": 705 }, { "entropy": 6.8013591289520265, "epoch": 0.06440493468795355, "grad_norm": 1.2890625, "learning_rate": 0.0003545, "loss": 6.6072, "mean_token_accuracy": 0.11265634968876839, "num_tokens": 1474658.0, "step": 710 }, { "entropy": 6.754550743103027, "epoch": 0.06485849056603774, "grad_norm": 1.0625, "learning_rate": 0.000357, "loss": 6.6558, "mean_token_accuracy": 0.10501691550016404, "num_tokens": 1485366.0, "step": 715 }, { "entropy": 6.6456946849823, "epoch": 0.06531204644412192, "grad_norm": 1.1796875, "learning_rate": 0.0003595, "loss": 6.5397, "mean_token_accuracy": 0.11587660536170005, "num_tokens": 1496931.0, "step": 720 }, { "entropy": 6.688676929473877, "epoch": 0.0657656023222061, "grad_norm": 1.171875, "learning_rate": 0.000362, "loss": 6.5915, "mean_token_accuracy": 0.11367620155215263, "num_tokens": 1507134.0, "step": 725 }, { "entropy": 6.569495010375976, "epoch": 0.06621915820029027, "grad_norm": 1.171875, "learning_rate": 0.0003645, "loss": 6.492, "mean_token_accuracy": 0.11305128559470176, "num_tokens": 1516558.0, "step": 730 }, { "entropy": 6.637685918807984, "epoch": 0.06667271407837445, "grad_norm": 1.1171875, "learning_rate": 0.000367, "loss": 6.5268, "mean_token_accuracy": 0.11118611544370652, "num_tokens": 1526373.0, "step": 735 }, { "entropy": 6.5918787002563475, "epoch": 0.06712626995645864, "grad_norm": 1.2109375, "learning_rate": 0.0003695, "loss": 6.4146, "mean_token_accuracy": 0.11430680304765702, "num_tokens": 1536431.0, "step": 740 }, { "entropy": 6.4868128299713135, "epoch": 0.06757982583454282, "grad_norm": 1.2265625, "learning_rate": 0.000372, "loss": 6.3912, "mean_token_accuracy": 0.11714110746979714, "num_tokens": 1546428.0, "step": 745 }, { "entropy": 6.633748626708984, "epoch": 0.06803338171262699, "grad_norm": 1.046875, "learning_rate": 0.0003745, "loss": 6.5954, "mean_token_accuracy": 0.10997304171323777, "num_tokens": 1557299.0, "step": 750 }, { "entropy": 6.572169256210327, "epoch": 0.06848693759071117, "grad_norm": 1.125, "learning_rate": 0.000377, "loss": 6.5201, "mean_token_accuracy": 0.11121420338749885, "num_tokens": 1567629.0, "step": 755 }, { "entropy": 6.670825052261352, "epoch": 0.06894049346879536, "grad_norm": 1.1875, "learning_rate": 0.0003795, "loss": 6.567, "mean_token_accuracy": 0.10907985046505927, "num_tokens": 1578305.0, "step": 760 }, { "entropy": 6.6835836410522464, "epoch": 0.06939404934687954, "grad_norm": 1.0859375, "learning_rate": 0.000382, "loss": 6.5758, "mean_token_accuracy": 0.10975592210888863, "num_tokens": 1588843.0, "step": 765 }, { "entropy": 6.6111774921417235, "epoch": 0.06984760522496372, "grad_norm": 1.1640625, "learning_rate": 0.0003845, "loss": 6.5869, "mean_token_accuracy": 0.10726779997348786, "num_tokens": 1599144.0, "step": 770 }, { "entropy": 6.559026432037354, "epoch": 0.07030116110304789, "grad_norm": 1.078125, "learning_rate": 0.00038700000000000003, "loss": 6.5004, "mean_token_accuracy": 0.11508158072829247, "num_tokens": 1608933.0, "step": 775 }, { "entropy": 6.675729131698608, "epoch": 0.07075471698113207, "grad_norm": 1.15625, "learning_rate": 0.00038950000000000003, "loss": 6.4774, "mean_token_accuracy": 0.11884681731462479, "num_tokens": 1618926.0, "step": 780 }, { "entropy": 6.550394296646118, "epoch": 0.07120827285921626, "grad_norm": 1.1171875, "learning_rate": 0.00039200000000000004, "loss": 6.4787, "mean_token_accuracy": 0.11670367419719696, "num_tokens": 1628810.0, "step": 785 }, { "entropy": 6.621820545196533, "epoch": 0.07166182873730044, "grad_norm": 1.234375, "learning_rate": 0.00039450000000000005, "loss": 6.5208, "mean_token_accuracy": 0.11667616367340088, "num_tokens": 1638087.0, "step": 790 }, { "entropy": 6.551448202133178, "epoch": 0.07211538461538461, "grad_norm": 1.046875, "learning_rate": 0.00039700000000000005, "loss": 6.5028, "mean_token_accuracy": 0.11246806755661964, "num_tokens": 1648901.0, "step": 795 }, { "entropy": 6.536881732940674, "epoch": 0.07256894049346879, "grad_norm": 0.97265625, "learning_rate": 0.0003995, "loss": 6.4789, "mean_token_accuracy": 0.11289835795760154, "num_tokens": 1659520.0, "step": 800 }, { "entropy": 6.606709718704224, "epoch": 0.07302249637155298, "grad_norm": 1.046875, "learning_rate": 0.000402, "loss": 6.5056, "mean_token_accuracy": 0.11811064779758454, "num_tokens": 1670368.0, "step": 805 }, { "entropy": 6.547958660125732, "epoch": 0.07347605224963716, "grad_norm": 1.0234375, "learning_rate": 0.0004045, "loss": 6.4255, "mean_token_accuracy": 0.11519890055060386, "num_tokens": 1680566.0, "step": 810 }, { "entropy": 6.525753402709961, "epoch": 0.07392960812772134, "grad_norm": 1.0078125, "learning_rate": 0.00040699999999999997, "loss": 6.4451, "mean_token_accuracy": 0.1210486575961113, "num_tokens": 1690360.0, "step": 815 }, { "entropy": 6.6042615413665775, "epoch": 0.07438316400580551, "grad_norm": 1.109375, "learning_rate": 0.0004095, "loss": 6.5412, "mean_token_accuracy": 0.11525689661502839, "num_tokens": 1700558.0, "step": 820 }, { "entropy": 6.546953964233398, "epoch": 0.0748367198838897, "grad_norm": 1.171875, "learning_rate": 0.000412, "loss": 6.4773, "mean_token_accuracy": 0.1132320411503315, "num_tokens": 1711067.0, "step": 825 }, { "entropy": 6.471474742889404, "epoch": 0.07529027576197388, "grad_norm": 1.203125, "learning_rate": 0.0004145, "loss": 6.4551, "mean_token_accuracy": 0.11387050226330757, "num_tokens": 1721083.0, "step": 830 }, { "entropy": 6.426329278945923, "epoch": 0.07574383164005806, "grad_norm": 1.046875, "learning_rate": 0.000417, "loss": 6.387, "mean_token_accuracy": 0.11764025613665581, "num_tokens": 1731395.0, "step": 835 }, { "entropy": 6.560748338699341, "epoch": 0.07619738751814223, "grad_norm": 1.171875, "learning_rate": 0.0004195, "loss": 6.4163, "mean_token_accuracy": 0.12031056880950927, "num_tokens": 1741650.0, "step": 840 }, { "entropy": 6.521653699874878, "epoch": 0.07665094339622641, "grad_norm": 1.0, "learning_rate": 0.000422, "loss": 6.4952, "mean_token_accuracy": 0.11156592816114426, "num_tokens": 1752775.0, "step": 845 }, { "entropy": 6.523869276046753, "epoch": 0.0771044992743106, "grad_norm": 0.9921875, "learning_rate": 0.0004245, "loss": 6.5518, "mean_token_accuracy": 0.10881832614541054, "num_tokens": 1763635.0, "step": 850 }, { "entropy": 6.519516324996948, "epoch": 0.07755805515239478, "grad_norm": 1.0234375, "learning_rate": 0.000427, "loss": 6.4713, "mean_token_accuracy": 0.11356355622410774, "num_tokens": 1773519.0, "step": 855 }, { "entropy": 6.527148103713989, "epoch": 0.07801161103047896, "grad_norm": 1.1875, "learning_rate": 0.0004295, "loss": 6.4688, "mean_token_accuracy": 0.11615480259060859, "num_tokens": 1783643.0, "step": 860 }, { "entropy": 6.563126754760742, "epoch": 0.07846516690856313, "grad_norm": 1.109375, "learning_rate": 0.000432, "loss": 6.4573, "mean_token_accuracy": 0.11113109216094016, "num_tokens": 1794175.0, "step": 865 }, { "entropy": 6.464490938186645, "epoch": 0.07891872278664731, "grad_norm": 1.109375, "learning_rate": 0.0004345, "loss": 6.3923, "mean_token_accuracy": 0.11603446528315545, "num_tokens": 1804455.0, "step": 870 }, { "entropy": 6.563748025894165, "epoch": 0.0793722786647315, "grad_norm": 1.1015625, "learning_rate": 0.000437, "loss": 6.5214, "mean_token_accuracy": 0.10870628133416176, "num_tokens": 1816711.0, "step": 875 }, { "entropy": 6.4233174324035645, "epoch": 0.07982583454281568, "grad_norm": 1.1328125, "learning_rate": 0.0004395, "loss": 6.3755, "mean_token_accuracy": 0.11397543773055077, "num_tokens": 1827110.0, "step": 880 }, { "entropy": 6.4231466293334964, "epoch": 0.08027939042089985, "grad_norm": 1.15625, "learning_rate": 0.000442, "loss": 6.3352, "mean_token_accuracy": 0.11892382502555847, "num_tokens": 1837131.0, "step": 885 }, { "entropy": 6.53260645866394, "epoch": 0.08073294629898403, "grad_norm": 1.203125, "learning_rate": 0.0004445, "loss": 6.4013, "mean_token_accuracy": 0.11561454683542252, "num_tokens": 1847487.0, "step": 890 }, { "entropy": 6.347210311889649, "epoch": 0.08118650217706821, "grad_norm": 1.0859375, "learning_rate": 0.000447, "loss": 6.3894, "mean_token_accuracy": 0.11477004811167717, "num_tokens": 1857846.0, "step": 895 }, { "entropy": 6.445382356643677, "epoch": 0.0816400580551524, "grad_norm": 1.0859375, "learning_rate": 0.00044950000000000003, "loss": 6.4744, "mean_token_accuracy": 0.11803903207182884, "num_tokens": 1868917.0, "step": 900 }, { "entropy": 6.475826025009155, "epoch": 0.08209361393323658, "grad_norm": 1.078125, "learning_rate": 0.00045200000000000004, "loss": 6.3185, "mean_token_accuracy": 0.12133634760975838, "num_tokens": 1878702.0, "step": 905 }, { "entropy": 6.4152826309204105, "epoch": 0.08254716981132075, "grad_norm": 0.97265625, "learning_rate": 0.00045450000000000004, "loss": 6.4281, "mean_token_accuracy": 0.11487874239683152, "num_tokens": 1888818.0, "step": 910 }, { "entropy": 6.452651023864746, "epoch": 0.08300072568940493, "grad_norm": 0.9921875, "learning_rate": 0.00045700000000000005, "loss": 6.4189, "mean_token_accuracy": 0.11924608796834946, "num_tokens": 1899418.0, "step": 915 }, { "entropy": 6.365463924407959, "epoch": 0.08345428156748912, "grad_norm": 1.1796875, "learning_rate": 0.00045950000000000006, "loss": 6.3128, "mean_token_accuracy": 0.12437145933508872, "num_tokens": 1909747.0, "step": 920 }, { "entropy": 6.544213724136353, "epoch": 0.0839078374455733, "grad_norm": 1.0234375, "learning_rate": 0.000462, "loss": 6.5157, "mean_token_accuracy": 0.11182530298829078, "num_tokens": 1920580.0, "step": 925 }, { "entropy": 6.49947943687439, "epoch": 0.08436139332365747, "grad_norm": 1.03125, "learning_rate": 0.0004645, "loss": 6.4255, "mean_token_accuracy": 0.11744101867079734, "num_tokens": 1930924.0, "step": 930 }, { "entropy": 6.417445230484009, "epoch": 0.08481494920174165, "grad_norm": 1.1640625, "learning_rate": 0.000467, "loss": 6.4568, "mean_token_accuracy": 0.11753653734922409, "num_tokens": 1943110.0, "step": 935 }, { "entropy": 6.492831611633301, "epoch": 0.08526850507982583, "grad_norm": 1.171875, "learning_rate": 0.0004695, "loss": 6.3711, "mean_token_accuracy": 0.11840087100863457, "num_tokens": 1952620.0, "step": 940 }, { "entropy": 6.451150608062744, "epoch": 0.08572206095791002, "grad_norm": 1.0078125, "learning_rate": 0.000472, "loss": 6.4812, "mean_token_accuracy": 0.11905809268355369, "num_tokens": 1962893.0, "step": 945 }, { "entropy": 6.375366497039795, "epoch": 0.0861756168359942, "grad_norm": 1.1171875, "learning_rate": 0.0004745, "loss": 6.3692, "mean_token_accuracy": 0.1131294883787632, "num_tokens": 1973455.0, "step": 950 }, { "entropy": 6.364347743988037, "epoch": 0.08662917271407837, "grad_norm": 1.140625, "learning_rate": 0.000477, "loss": 6.3287, "mean_token_accuracy": 0.12613395005464553, "num_tokens": 1983559.0, "step": 955 }, { "entropy": 6.371630477905273, "epoch": 0.08708272859216255, "grad_norm": 1.0703125, "learning_rate": 0.0004795, "loss": 6.3393, "mean_token_accuracy": 0.12109395638108253, "num_tokens": 1994630.0, "step": 960 }, { "entropy": 6.490744590759277, "epoch": 0.08753628447024674, "grad_norm": 1.03125, "learning_rate": 0.000482, "loss": 6.4846, "mean_token_accuracy": 0.12091940119862557, "num_tokens": 2005225.0, "step": 965 }, { "entropy": 6.43569803237915, "epoch": 0.08798984034833092, "grad_norm": 1.046875, "learning_rate": 0.0004845, "loss": 6.4423, "mean_token_accuracy": 0.11586240753531456, "num_tokens": 2016431.0, "step": 970 }, { "entropy": 6.4423645496368405, "epoch": 0.08844339622641509, "grad_norm": 1.125, "learning_rate": 0.000487, "loss": 6.417, "mean_token_accuracy": 0.11866187751293182, "num_tokens": 2025740.0, "step": 975 }, { "entropy": 6.464833211898804, "epoch": 0.08889695210449927, "grad_norm": 1.0078125, "learning_rate": 0.0004895, "loss": 6.4715, "mean_token_accuracy": 0.11230053454637527, "num_tokens": 2037748.0, "step": 980 }, { "entropy": 6.4517669677734375, "epoch": 0.08935050798258345, "grad_norm": 1.171875, "learning_rate": 0.000492, "loss": 6.4799, "mean_token_accuracy": 0.11359175741672516, "num_tokens": 2047882.0, "step": 985 }, { "entropy": 6.344726705551148, "epoch": 0.08980406386066764, "grad_norm": 1.109375, "learning_rate": 0.0004945, "loss": 6.2499, "mean_token_accuracy": 0.12739444598555566, "num_tokens": 2057291.0, "step": 990 }, { "entropy": 6.410989761352539, "epoch": 0.09025761973875182, "grad_norm": 1.21875, "learning_rate": 0.000497, "loss": 6.3915, "mean_token_accuracy": 0.11595515459775925, "num_tokens": 2068420.0, "step": 995 }, { "entropy": 6.440128231048584, "epoch": 0.09071117561683599, "grad_norm": 1.078125, "learning_rate": 0.0004995, "loss": 6.5057, "mean_token_accuracy": 0.11650898307561874, "num_tokens": 2077721.0, "step": 1000 }, { "entropy": 6.404371500015259, "epoch": 0.09116473149492017, "grad_norm": 1.1015625, "learning_rate": 0.0004999999985110217, "loss": 6.4196, "mean_token_accuracy": 0.11519975513219834, "num_tokens": 2087434.0, "step": 1005 }, { "entropy": 6.462897062301636, "epoch": 0.09161828737300436, "grad_norm": 0.9375, "learning_rate": 0.0004999999924620471, "loss": 6.4416, "mean_token_accuracy": 0.11368417963385583, "num_tokens": 2098193.0, "step": 1010 }, { "entropy": 6.384410095214844, "epoch": 0.09207184325108854, "grad_norm": 1.171875, "learning_rate": 0.0004999999817600155, "loss": 6.3826, "mean_token_accuracy": 0.12369435802102088, "num_tokens": 2108201.0, "step": 1015 }, { "entropy": 6.309185791015625, "epoch": 0.09252539912917271, "grad_norm": 1.1875, "learning_rate": 0.0004999999664049268, "loss": 6.32, "mean_token_accuracy": 0.11705849245190621, "num_tokens": 2119036.0, "step": 1020 }, { "entropy": 6.421576452255249, "epoch": 0.09297895500725689, "grad_norm": 1.078125, "learning_rate": 0.0004999999463967816, "loss": 6.3502, "mean_token_accuracy": 0.1220113031566143, "num_tokens": 2129487.0, "step": 1025 }, { "entropy": 6.344693613052368, "epoch": 0.09343251088534107, "grad_norm": 1.09375, "learning_rate": 0.00049999992173558, "loss": 6.3793, "mean_token_accuracy": 0.11463537812232971, "num_tokens": 2139992.0, "step": 1030 }, { "entropy": 6.273680925369263, "epoch": 0.09388606676342526, "grad_norm": 1.0546875, "learning_rate": 0.0004999998924213228, "loss": 6.2978, "mean_token_accuracy": 0.12567788735032082, "num_tokens": 2149579.0, "step": 1035 }, { "entropy": 6.34424147605896, "epoch": 0.09433962264150944, "grad_norm": 1.0546875, "learning_rate": 0.0004999998584540105, "loss": 6.3323, "mean_token_accuracy": 0.11910404115915299, "num_tokens": 2159876.0, "step": 1040 }, { "entropy": 6.344080543518066, "epoch": 0.09479317851959361, "grad_norm": 1.0234375, "learning_rate": 0.0004999998198336437, "loss": 6.3607, "mean_token_accuracy": 0.11824791878461838, "num_tokens": 2169975.0, "step": 1045 }, { "entropy": 6.427093935012818, "epoch": 0.09524673439767779, "grad_norm": 1.0, "learning_rate": 0.0004999997765602233, "loss": 6.4922, "mean_token_accuracy": 0.11570862457156181, "num_tokens": 2180050.0, "step": 1050 }, { "entropy": 6.349902772903443, "epoch": 0.09570029027576198, "grad_norm": 1.1328125, "learning_rate": 0.0004999997286337502, "loss": 6.3077, "mean_token_accuracy": 0.12012091800570487, "num_tokens": 2189876.0, "step": 1055 }, { "entropy": 6.452189254760742, "epoch": 0.09615384615384616, "grad_norm": 1.4375, "learning_rate": 0.0004999996760542254, "loss": 6.4339, "mean_token_accuracy": 0.11986624225974082, "num_tokens": 2200281.0, "step": 1060 }, { "entropy": 6.32034740447998, "epoch": 0.09660740203193033, "grad_norm": 1.0546875, "learning_rate": 0.00049999961882165, "loss": 6.3044, "mean_token_accuracy": 0.12321286574006081, "num_tokens": 2210369.0, "step": 1065 }, { "entropy": 6.327759885787964, "epoch": 0.09706095791001451, "grad_norm": 1.015625, "learning_rate": 0.0004999995569360251, "loss": 6.3127, "mean_token_accuracy": 0.12402729466557502, "num_tokens": 2221990.0, "step": 1070 }, { "entropy": 6.366653490066528, "epoch": 0.0975145137880987, "grad_norm": 1.109375, "learning_rate": 0.000499999490397352, "loss": 6.4474, "mean_token_accuracy": 0.11773798763751983, "num_tokens": 2233252.0, "step": 1075 }, { "entropy": 6.317323875427246, "epoch": 0.09796806966618288, "grad_norm": 1.078125, "learning_rate": 0.0004999994192056321, "loss": 6.3302, "mean_token_accuracy": 0.1180254340171814, "num_tokens": 2243527.0, "step": 1080 }, { "entropy": 6.509728670120239, "epoch": 0.09842162554426705, "grad_norm": 1.015625, "learning_rate": 0.0004999993433608669, "loss": 6.5429, "mean_token_accuracy": 0.11201546043157577, "num_tokens": 2255879.0, "step": 1085 }, { "entropy": 6.402245807647705, "epoch": 0.09887518142235123, "grad_norm": 1.0390625, "learning_rate": 0.0004999992628630579, "loss": 6.3557, "mean_token_accuracy": 0.11973690539598465, "num_tokens": 2266515.0, "step": 1090 }, { "entropy": 6.339201927185059, "epoch": 0.09932873730043541, "grad_norm": 1.140625, "learning_rate": 0.0004999991777122069, "loss": 6.4273, "mean_token_accuracy": 0.12359791249036789, "num_tokens": 2276876.0, "step": 1095 }, { "entropy": 6.246776485443116, "epoch": 0.0997822931785196, "grad_norm": 0.95703125, "learning_rate": 0.0004999990879083156, "loss": 6.2678, "mean_token_accuracy": 0.12031552121043206, "num_tokens": 2287467.0, "step": 1100 }, { "entropy": 6.35769305229187, "epoch": 0.10023584905660378, "grad_norm": 1.1015625, "learning_rate": 0.0004999989934513857, "loss": 6.2462, "mean_token_accuracy": 0.12475912868976594, "num_tokens": 2297907.0, "step": 1105 }, { "entropy": 6.35407977104187, "epoch": 0.10068940493468795, "grad_norm": 1.0625, "learning_rate": 0.0004999988943414193, "loss": 6.3535, "mean_token_accuracy": 0.1271662712097168, "num_tokens": 2307955.0, "step": 1110 }, { "entropy": 6.295737075805664, "epoch": 0.10114296081277213, "grad_norm": 1.1640625, "learning_rate": 0.0004999987905784184, "loss": 6.2987, "mean_token_accuracy": 0.12096831873059273, "num_tokens": 2318545.0, "step": 1115 }, { "entropy": 6.236451482772827, "epoch": 0.10159651669085631, "grad_norm": 1.0625, "learning_rate": 0.0004999986821623853, "loss": 6.2202, "mean_token_accuracy": 0.12809522673487664, "num_tokens": 2327706.0, "step": 1120 }, { "entropy": 6.412763261795044, "epoch": 0.1020500725689405, "grad_norm": 0.9921875, "learning_rate": 0.0004999985690933219, "loss": 6.4203, "mean_token_accuracy": 0.11205516159534454, "num_tokens": 2337853.0, "step": 1125 }, { "entropy": 6.159422540664673, "epoch": 0.10250362844702467, "grad_norm": 1.0703125, "learning_rate": 0.0004999984513712311, "loss": 6.1984, "mean_token_accuracy": 0.12132447883486748, "num_tokens": 2348340.0, "step": 1130 }, { "entropy": 6.364528322219849, "epoch": 0.10295718432510885, "grad_norm": 1.0703125, "learning_rate": 0.0004999983289961146, "loss": 6.2307, "mean_token_accuracy": 0.1275188758969307, "num_tokens": 2358616.0, "step": 1135 }, { "entropy": 6.197306394577026, "epoch": 0.10341074020319303, "grad_norm": 1.0625, "learning_rate": 0.0004999982019679755, "loss": 6.2656, "mean_token_accuracy": 0.12436863258481026, "num_tokens": 2368226.0, "step": 1140 }, { "entropy": 6.445528173446656, "epoch": 0.10386429608127722, "grad_norm": 1.0390625, "learning_rate": 0.0004999980702868164, "loss": 6.4449, "mean_token_accuracy": 0.1217611476778984, "num_tokens": 2378627.0, "step": 1145 }, { "entropy": 6.300698471069336, "epoch": 0.1043178519593614, "grad_norm": 0.9921875, "learning_rate": 0.0004999979339526396, "loss": 6.3391, "mean_token_accuracy": 0.12193103209137916, "num_tokens": 2389601.0, "step": 1150 }, { "entropy": 6.353440380096435, "epoch": 0.10477140783744557, "grad_norm": 0.96875, "learning_rate": 0.0004999977929654484, "loss": 6.3341, "mean_token_accuracy": 0.12355378419160842, "num_tokens": 2400010.0, "step": 1155 }, { "entropy": 6.193485832214355, "epoch": 0.10522496371552975, "grad_norm": 1.015625, "learning_rate": 0.0004999976473252453, "loss": 6.2651, "mean_token_accuracy": 0.12575532719492913, "num_tokens": 2409443.0, "step": 1160 }, { "entropy": 6.352375030517578, "epoch": 0.10567851959361393, "grad_norm": 1.1171875, "learning_rate": 0.0004999974970320338, "loss": 6.2298, "mean_token_accuracy": 0.12666020169854164, "num_tokens": 2419616.0, "step": 1165 }, { "entropy": 6.147144079208374, "epoch": 0.10613207547169812, "grad_norm": 1.015625, "learning_rate": 0.0004999973420858165, "loss": 6.21, "mean_token_accuracy": 0.12970640361309052, "num_tokens": 2430193.0, "step": 1170 }, { "entropy": 6.327436637878418, "epoch": 0.10658563134978229, "grad_norm": 1.15625, "learning_rate": 0.0004999971824865968, "loss": 6.3592, "mean_token_accuracy": 0.12428862676024437, "num_tokens": 2440682.0, "step": 1175 }, { "entropy": 6.273407697677612, "epoch": 0.10703918722786647, "grad_norm": 0.95703125, "learning_rate": 0.0004999970182343782, "loss": 6.2968, "mean_token_accuracy": 0.13017050549387932, "num_tokens": 2452357.0, "step": 1180 }, { "entropy": 6.420224666595459, "epoch": 0.10749274310595065, "grad_norm": 1.0859375, "learning_rate": 0.0004999968493291638, "loss": 6.3124, "mean_token_accuracy": 0.1259176842868328, "num_tokens": 2463372.0, "step": 1185 }, { "entropy": 6.11242709159851, "epoch": 0.10794629898403484, "grad_norm": 1.0390625, "learning_rate": 0.0004999966757709573, "loss": 6.2185, "mean_token_accuracy": 0.1255997322499752, "num_tokens": 2473937.0, "step": 1190 }, { "entropy": 6.333364057540893, "epoch": 0.10839985486211902, "grad_norm": 0.96484375, "learning_rate": 0.0004999964975597622, "loss": 6.2463, "mean_token_accuracy": 0.12876395285129547, "num_tokens": 2484178.0, "step": 1195 }, { "entropy": 6.290256929397583, "epoch": 0.10885341074020319, "grad_norm": 1.0625, "learning_rate": 0.0004999963146955821, "loss": 6.2757, "mean_token_accuracy": 0.12604986280202865, "num_tokens": 2493855.0, "step": 1200 }, { "entropy": 6.16634783744812, "epoch": 0.10930696661828737, "grad_norm": 1.15625, "learning_rate": 0.000499996127178421, "loss": 6.1956, "mean_token_accuracy": 0.128883396089077, "num_tokens": 2502777.0, "step": 1205 }, { "entropy": 6.308694171905517, "epoch": 0.10976052249637155, "grad_norm": 1.0234375, "learning_rate": 0.0004999959350082825, "loss": 6.218, "mean_token_accuracy": 0.127637080848217, "num_tokens": 2513646.0, "step": 1210 }, { "entropy": 6.315856885910034, "epoch": 0.11021407837445574, "grad_norm": 1.1171875, "learning_rate": 0.0004999957381851709, "loss": 6.29, "mean_token_accuracy": 0.13161664754152297, "num_tokens": 2523614.0, "step": 1215 }, { "entropy": 6.190816354751587, "epoch": 0.1106676342525399, "grad_norm": 1.03125, "learning_rate": 0.0004999955367090901, "loss": 6.2384, "mean_token_accuracy": 0.13483407124876975, "num_tokens": 2533279.0, "step": 1220 }, { "entropy": 6.172196102142334, "epoch": 0.11112119013062409, "grad_norm": 1.1328125, "learning_rate": 0.0004999953305800441, "loss": 6.1165, "mean_token_accuracy": 0.12950356379151345, "num_tokens": 2542748.0, "step": 1225 }, { "entropy": 6.226431798934937, "epoch": 0.11157474600870827, "grad_norm": 0.9921875, "learning_rate": 0.0004999951197980374, "loss": 6.2074, "mean_token_accuracy": 0.12376128509640694, "num_tokens": 2553003.0, "step": 1230 }, { "entropy": 6.211793422698975, "epoch": 0.11202830188679246, "grad_norm": 1.0390625, "learning_rate": 0.0004999949043630744, "loss": 6.2499, "mean_token_accuracy": 0.1253039300441742, "num_tokens": 2563099.0, "step": 1235 }, { "entropy": 6.247184419631958, "epoch": 0.11248185776487664, "grad_norm": 1.078125, "learning_rate": 0.0004999946842751593, "loss": 6.2433, "mean_token_accuracy": 0.129485647380352, "num_tokens": 2572816.0, "step": 1240 }, { "entropy": 6.208843231201172, "epoch": 0.11293541364296081, "grad_norm": 1.140625, "learning_rate": 0.0004999944595342968, "loss": 6.2615, "mean_token_accuracy": 0.13151264265179635, "num_tokens": 2582633.0, "step": 1245 }, { "entropy": 6.3658373832702635, "epoch": 0.11338896952104499, "grad_norm": 0.96484375, "learning_rate": 0.0004999942301404916, "loss": 6.3094, "mean_token_accuracy": 0.12087921500205993, "num_tokens": 2593581.0, "step": 1250 }, { "entropy": 6.2705951690673825, "epoch": 0.11384252539912917, "grad_norm": 1.140625, "learning_rate": 0.0004999939960937484, "loss": 6.3018, "mean_token_accuracy": 0.11847401112318039, "num_tokens": 2603811.0, "step": 1255 }, { "entropy": 6.270603513717651, "epoch": 0.11429608127721336, "grad_norm": 1.1328125, "learning_rate": 0.0004999937573940721, "loss": 6.3224, "mean_token_accuracy": 0.12249375060200692, "num_tokens": 2615147.0, "step": 1260 }, { "entropy": 6.228997707366943, "epoch": 0.11474963715529753, "grad_norm": 1.03125, "learning_rate": 0.0004999935140414674, "loss": 6.1669, "mean_token_accuracy": 0.1293345607817173, "num_tokens": 2625201.0, "step": 1265 }, { "entropy": 6.2709190368652346, "epoch": 0.11520319303338171, "grad_norm": 1.171875, "learning_rate": 0.0004999932660359395, "loss": 6.3101, "mean_token_accuracy": 0.1249003492295742, "num_tokens": 2635377.0, "step": 1270 }, { "entropy": 6.189292049407959, "epoch": 0.11565674891146589, "grad_norm": 0.99609375, "learning_rate": 0.0004999930133774936, "loss": 6.2372, "mean_token_accuracy": 0.12723963409662248, "num_tokens": 2645849.0, "step": 1275 }, { "entropy": 6.398007583618164, "epoch": 0.11611030478955008, "grad_norm": 0.97265625, "learning_rate": 0.0004999927560661348, "loss": 6.3526, "mean_token_accuracy": 0.12062773033976555, "num_tokens": 2657125.0, "step": 1280 }, { "entropy": 6.223501682281494, "epoch": 0.11656386066763426, "grad_norm": 1.1171875, "learning_rate": 0.0004999924941018685, "loss": 6.1835, "mean_token_accuracy": 0.12893526181578635, "num_tokens": 2667575.0, "step": 1285 }, { "entropy": 6.175991201400757, "epoch": 0.11701741654571843, "grad_norm": 1.015625, "learning_rate": 0.0004999922274847, "loss": 6.2356, "mean_token_accuracy": 0.12373170107603074, "num_tokens": 2678287.0, "step": 1290 }, { "entropy": 6.321875476837159, "epoch": 0.11747097242380261, "grad_norm": 0.99609375, "learning_rate": 0.000499991956214635, "loss": 6.3511, "mean_token_accuracy": 0.13218481838703156, "num_tokens": 2687903.0, "step": 1295 }, { "entropy": 6.180214071273804, "epoch": 0.1179245283018868, "grad_norm": 0.97265625, "learning_rate": 0.000499991680291679, "loss": 6.1958, "mean_token_accuracy": 0.12728189304471016, "num_tokens": 2697975.0, "step": 1300 }, { "entropy": 6.23911418914795, "epoch": 0.11837808417997098, "grad_norm": 0.9921875, "learning_rate": 0.0004999913997158378, "loss": 6.212, "mean_token_accuracy": 0.12432057186961173, "num_tokens": 2708861.0, "step": 1305 }, { "entropy": 6.25122103691101, "epoch": 0.11883164005805515, "grad_norm": 1.1484375, "learning_rate": 0.0004999911144871169, "loss": 6.3343, "mean_token_accuracy": 0.1229264110326767, "num_tokens": 2718751.0, "step": 1310 }, { "entropy": 6.240471696853637, "epoch": 0.11928519593613933, "grad_norm": 1.140625, "learning_rate": 0.0004999908246055226, "loss": 6.1875, "mean_token_accuracy": 0.12787612676620483, "num_tokens": 2728393.0, "step": 1315 }, { "entropy": 6.22295913696289, "epoch": 0.11973875181422351, "grad_norm": 0.97265625, "learning_rate": 0.0004999905300710607, "loss": 6.2265, "mean_token_accuracy": 0.12778055742383004, "num_tokens": 2738953.0, "step": 1320 }, { "entropy": 6.260966491699219, "epoch": 0.1201923076923077, "grad_norm": 1.1484375, "learning_rate": 0.0004999902308837373, "loss": 6.304, "mean_token_accuracy": 0.12310394868254662, "num_tokens": 2748598.0, "step": 1325 }, { "entropy": 6.344991064071655, "epoch": 0.12064586357039188, "grad_norm": 1.09375, "learning_rate": 0.0004999899270435584, "loss": 6.3314, "mean_token_accuracy": 0.12434870079159736, "num_tokens": 2758543.0, "step": 1330 }, { "entropy": 6.20733380317688, "epoch": 0.12109941944847605, "grad_norm": 1.0390625, "learning_rate": 0.0004999896185505307, "loss": 6.1451, "mean_token_accuracy": 0.12950560450553894, "num_tokens": 2767686.0, "step": 1335 }, { "entropy": 6.168848514556885, "epoch": 0.12155297532656023, "grad_norm": 1.0, "learning_rate": 0.0004999893054046603, "loss": 6.2278, "mean_token_accuracy": 0.1261433832347393, "num_tokens": 2778826.0, "step": 1340 }, { "entropy": 6.23694486618042, "epoch": 0.12200653120464441, "grad_norm": 1.0859375, "learning_rate": 0.0004999889876059537, "loss": 6.1686, "mean_token_accuracy": 0.1320178970694542, "num_tokens": 2788798.0, "step": 1345 }, { "entropy": 6.205473756790161, "epoch": 0.1224600870827286, "grad_norm": 1.015625, "learning_rate": 0.0004999886651544176, "loss": 6.243, "mean_token_accuracy": 0.12421647608280181, "num_tokens": 2799789.0, "step": 1350 }, { "entropy": 6.292304515838623, "epoch": 0.12291364296081277, "grad_norm": 1.078125, "learning_rate": 0.0004999883380500584, "loss": 6.3019, "mean_token_accuracy": 0.11881196796894074, "num_tokens": 2811256.0, "step": 1355 }, { "entropy": 6.227163362503052, "epoch": 0.12336719883889695, "grad_norm": 1.0, "learning_rate": 0.0004999880062928831, "loss": 6.1407, "mean_token_accuracy": 0.12354236915707588, "num_tokens": 2821181.0, "step": 1360 }, { "entropy": 6.2017885684967045, "epoch": 0.12382075471698113, "grad_norm": 1.03125, "learning_rate": 0.0004999876698828985, "loss": 6.2911, "mean_token_accuracy": 0.12848431915044783, "num_tokens": 2831844.0, "step": 1365 }, { "entropy": 6.140119552612305, "epoch": 0.12427431059506532, "grad_norm": 1.1015625, "learning_rate": 0.0004999873288201116, "loss": 6.1389, "mean_token_accuracy": 0.128109622746706, "num_tokens": 2842311.0, "step": 1370 }, { "entropy": 6.265316724777222, "epoch": 0.1247278664731495, "grad_norm": 1.046875, "learning_rate": 0.0004999869831045294, "loss": 6.1958, "mean_token_accuracy": 0.12854474037885666, "num_tokens": 2852668.0, "step": 1375 }, { "entropy": 6.160908985137939, "epoch": 0.12518142235123367, "grad_norm": 1.03125, "learning_rate": 0.0004999866327361589, "loss": 6.2176, "mean_token_accuracy": 0.12579773738980293, "num_tokens": 2862998.0, "step": 1380 }, { "entropy": 6.213189792633057, "epoch": 0.12563497822931785, "grad_norm": 1.0546875, "learning_rate": 0.0004999862777150077, "loss": 6.1426, "mean_token_accuracy": 0.13384611159563065, "num_tokens": 2872280.0, "step": 1385 }, { "entropy": 6.110375881195068, "epoch": 0.12608853410740203, "grad_norm": 0.96875, "learning_rate": 0.0004999859180410829, "loss": 6.1983, "mean_token_accuracy": 0.1303381085395813, "num_tokens": 2883755.0, "step": 1390 }, { "entropy": 6.233339548110962, "epoch": 0.12654208998548622, "grad_norm": 0.99609375, "learning_rate": 0.0004999855537143919, "loss": 6.2045, "mean_token_accuracy": 0.12790499925613402, "num_tokens": 2893926.0, "step": 1395 }, { "entropy": 6.063788890838623, "epoch": 0.1269956458635704, "grad_norm": 1.015625, "learning_rate": 0.0004999851847349425, "loss": 6.1219, "mean_token_accuracy": 0.12827676758170128, "num_tokens": 2904666.0, "step": 1400 }, { "entropy": 6.179912185668945, "epoch": 0.12744920174165458, "grad_norm": 1.1171875, "learning_rate": 0.0004999848111027419, "loss": 6.0826, "mean_token_accuracy": 0.1336699068546295, "num_tokens": 2915089.0, "step": 1405 }, { "entropy": 6.247713565826416, "epoch": 0.12790275761973874, "grad_norm": 1.0859375, "learning_rate": 0.0004999844328177983, "loss": 6.2475, "mean_token_accuracy": 0.12141420245170594, "num_tokens": 2926123.0, "step": 1410 }, { "entropy": 6.126826429367066, "epoch": 0.12835631349782292, "grad_norm": 1.1015625, "learning_rate": 0.0004999840498801191, "loss": 6.0732, "mean_token_accuracy": 0.13073234036564826, "num_tokens": 2935308.0, "step": 1415 }, { "entropy": 6.148389720916748, "epoch": 0.1288098693759071, "grad_norm": 1.0390625, "learning_rate": 0.0004999836622897126, "loss": 6.1871, "mean_token_accuracy": 0.12865355014801025, "num_tokens": 2945352.0, "step": 1420 }, { "entropy": 6.213321590423584, "epoch": 0.1292634252539913, "grad_norm": 1.15625, "learning_rate": 0.0004999832700465865, "loss": 6.1989, "mean_token_accuracy": 0.12411043643951417, "num_tokens": 2956766.0, "step": 1425 }, { "entropy": 6.172161293029785, "epoch": 0.12971698113207547, "grad_norm": 1.015625, "learning_rate": 0.0004999828731507491, "loss": 6.1263, "mean_token_accuracy": 0.1324382685124874, "num_tokens": 2967203.0, "step": 1430 }, { "entropy": 6.163990879058838, "epoch": 0.13017053701015965, "grad_norm": 1.0859375, "learning_rate": 0.0004999824716022085, "loss": 6.1356, "mean_token_accuracy": 0.13465460762381554, "num_tokens": 2976669.0, "step": 1435 }, { "entropy": 6.156468915939331, "epoch": 0.13062409288824384, "grad_norm": 1.171875, "learning_rate": 0.0004999820654009731, "loss": 6.1866, "mean_token_accuracy": 0.1345203198492527, "num_tokens": 2987009.0, "step": 1440 }, { "entropy": 6.1427467346191404, "epoch": 0.13107764876632802, "grad_norm": 1.03125, "learning_rate": 0.0004999816545470513, "loss": 6.2045, "mean_token_accuracy": 0.13020925000309944, "num_tokens": 2998252.0, "step": 1445 }, { "entropy": 6.175037908554077, "epoch": 0.1315312046444122, "grad_norm": 0.96484375, "learning_rate": 0.0004999812390404514, "loss": 6.0761, "mean_token_accuracy": 0.13165489509701728, "num_tokens": 3009091.0, "step": 1450 }, { "entropy": 6.20917649269104, "epoch": 0.13198476052249636, "grad_norm": 1.0703125, "learning_rate": 0.0004999808188811823, "loss": 6.3049, "mean_token_accuracy": 0.12950452715158461, "num_tokens": 3018692.0, "step": 1455 }, { "entropy": 6.149243974685669, "epoch": 0.13243831640058054, "grad_norm": 1.1875, "learning_rate": 0.0004999803940692524, "loss": 6.0922, "mean_token_accuracy": 0.1306043490767479, "num_tokens": 3028194.0, "step": 1460 }, { "entropy": 6.147744083404541, "epoch": 0.13289187227866472, "grad_norm": 1.0625, "learning_rate": 0.0004999799646046707, "loss": 6.108, "mean_token_accuracy": 0.13267887458205224, "num_tokens": 3037893.0, "step": 1465 }, { "entropy": 6.136689615249634, "epoch": 0.1333454281567489, "grad_norm": 1.0234375, "learning_rate": 0.0004999795304874461, "loss": 6.1956, "mean_token_accuracy": 0.12603257223963737, "num_tokens": 3048593.0, "step": 1470 }, { "entropy": 6.1764789581298825, "epoch": 0.1337989840348331, "grad_norm": 1.125, "learning_rate": 0.0004999790917175873, "loss": 6.1384, "mean_token_accuracy": 0.1398916281759739, "num_tokens": 3059591.0, "step": 1475 }, { "entropy": 6.148527336120606, "epoch": 0.13425253991291727, "grad_norm": 0.98046875, "learning_rate": 0.0004999786482951036, "loss": 6.1489, "mean_token_accuracy": 0.13112814351916313, "num_tokens": 3070543.0, "step": 1480 }, { "entropy": 6.194287872314453, "epoch": 0.13470609579100146, "grad_norm": 1.125, "learning_rate": 0.0004999782002200041, "loss": 6.1506, "mean_token_accuracy": 0.1290934108197689, "num_tokens": 3081665.0, "step": 1485 }, { "entropy": 6.116252756118774, "epoch": 0.13515965166908564, "grad_norm": 1.015625, "learning_rate": 0.0004999777474922982, "loss": 6.1252, "mean_token_accuracy": 0.135535828769207, "num_tokens": 3092347.0, "step": 1490 }, { "entropy": 6.084321165084839, "epoch": 0.13561320754716982, "grad_norm": 1.15625, "learning_rate": 0.0004999772901119951, "loss": 6.0665, "mean_token_accuracy": 0.140205679833889, "num_tokens": 3101953.0, "step": 1495 }, { "entropy": 6.182489442825317, "epoch": 0.13606676342525398, "grad_norm": 1.140625, "learning_rate": 0.0004999768280791043, "loss": 6.1673, "mean_token_accuracy": 0.12897372841835023, "num_tokens": 3111555.0, "step": 1500 }, { "entropy": 6.074414539337158, "epoch": 0.13652031930333816, "grad_norm": 1.0546875, "learning_rate": 0.0004999763613936352, "loss": 6.1214, "mean_token_accuracy": 0.13250304833054544, "num_tokens": 3121263.0, "step": 1505 }, { "entropy": 6.1420024871826175, "epoch": 0.13697387518142234, "grad_norm": 1.0546875, "learning_rate": 0.0004999758900555979, "loss": 6.1528, "mean_token_accuracy": 0.1297949396073818, "num_tokens": 3131187.0, "step": 1510 }, { "entropy": 6.122401189804077, "epoch": 0.13742743105950653, "grad_norm": 1.0390625, "learning_rate": 0.0004999754140650017, "loss": 6.1055, "mean_token_accuracy": 0.1283240534365177, "num_tokens": 3141116.0, "step": 1515 }, { "entropy": 6.16475772857666, "epoch": 0.1378809869375907, "grad_norm": 1.0625, "learning_rate": 0.0004999749334218567, "loss": 6.1595, "mean_token_accuracy": 0.134047494828701, "num_tokens": 3150727.0, "step": 1520 }, { "entropy": 6.178267621994019, "epoch": 0.1383345428156749, "grad_norm": 1.0234375, "learning_rate": 0.0004999744481261726, "loss": 6.188, "mean_token_accuracy": 0.12995831593871116, "num_tokens": 3160977.0, "step": 1525 }, { "entropy": 6.131053876876831, "epoch": 0.13878809869375908, "grad_norm": 1.1328125, "learning_rate": 0.0004999739581779597, "loss": 6.0237, "mean_token_accuracy": 0.13834299221634866, "num_tokens": 3171177.0, "step": 1530 }, { "entropy": 6.096694660186768, "epoch": 0.13924165457184326, "grad_norm": 1.1171875, "learning_rate": 0.000499973463577228, "loss": 6.193, "mean_token_accuracy": 0.13165855631232262, "num_tokens": 3181691.0, "step": 1535 }, { "entropy": 6.233206558227539, "epoch": 0.13969521044992744, "grad_norm": 1.078125, "learning_rate": 0.0004999729643239877, "loss": 6.1496, "mean_token_accuracy": 0.13230349868535995, "num_tokens": 3192546.0, "step": 1540 }, { "entropy": 6.082428359985352, "epoch": 0.1401487663280116, "grad_norm": 1.015625, "learning_rate": 0.0004999724604182492, "loss": 6.2144, "mean_token_accuracy": 0.13026824072003365, "num_tokens": 3203068.0, "step": 1545 }, { "entropy": 6.223723411560059, "epoch": 0.14060232220609578, "grad_norm": 0.9921875, "learning_rate": 0.0004999719518600229, "loss": 6.118, "mean_token_accuracy": 0.12941280901432037, "num_tokens": 3213974.0, "step": 1550 }, { "entropy": 6.0789594650268555, "epoch": 0.14105587808417996, "grad_norm": 1.1171875, "learning_rate": 0.0004999714386493192, "loss": 6.1984, "mean_token_accuracy": 0.13254104405641556, "num_tokens": 3224787.0, "step": 1555 }, { "entropy": 6.247838258743286, "epoch": 0.14150943396226415, "grad_norm": 1.15625, "learning_rate": 0.0004999709207861489, "loss": 6.2061, "mean_token_accuracy": 0.1280451625585556, "num_tokens": 3236072.0, "step": 1560 }, { "entropy": 6.11969223022461, "epoch": 0.14196298984034833, "grad_norm": 1.046875, "learning_rate": 0.0004999703982705227, "loss": 6.1511, "mean_token_accuracy": 0.1358342684805393, "num_tokens": 3247029.0, "step": 1565 }, { "entropy": 6.206550121307373, "epoch": 0.1424165457184325, "grad_norm": 1.0390625, "learning_rate": 0.0004999698711024513, "loss": 6.1205, "mean_token_accuracy": 0.13635100796818733, "num_tokens": 3257536.0, "step": 1570 }, { "entropy": 6.042502069473267, "epoch": 0.1428701015965167, "grad_norm": 1.1328125, "learning_rate": 0.0004999693392819456, "loss": 6.1236, "mean_token_accuracy": 0.13696237206459044, "num_tokens": 3266821.0, "step": 1575 }, { "entropy": 6.179642629623413, "epoch": 0.14332365747460088, "grad_norm": 1.0234375, "learning_rate": 0.0004999688028090166, "loss": 6.045, "mean_token_accuracy": 0.13624384254217148, "num_tokens": 3278118.0, "step": 1580 }, { "entropy": 5.984438037872314, "epoch": 0.14377721335268506, "grad_norm": 0.94921875, "learning_rate": 0.0004999682616836755, "loss": 6.0577, "mean_token_accuracy": 0.13041958436369896, "num_tokens": 3289331.0, "step": 1585 }, { "entropy": 6.199773597717285, "epoch": 0.14423076923076922, "grad_norm": 0.984375, "learning_rate": 0.0004999677159059334, "loss": 6.1481, "mean_token_accuracy": 0.12837196588516236, "num_tokens": 3299965.0, "step": 1590 }, { "entropy": 6.125565862655639, "epoch": 0.1446843251088534, "grad_norm": 1.1015625, "learning_rate": 0.0004999671654758016, "loss": 6.2454, "mean_token_accuracy": 0.12566872015595437, "num_tokens": 3310741.0, "step": 1595 }, { "entropy": 6.205886650085449, "epoch": 0.14513788098693758, "grad_norm": 1.0625, "learning_rate": 0.0004999666103932915, "loss": 6.173, "mean_token_accuracy": 0.13071803301572799, "num_tokens": 3321335.0, "step": 1600 }, { "entropy": 6.197109222412109, "epoch": 0.14559143686502177, "grad_norm": 1.0859375, "learning_rate": 0.0004999660506584145, "loss": 6.148, "mean_token_accuracy": 0.12749085575342178, "num_tokens": 3332032.0, "step": 1605 }, { "entropy": 6.019048070907592, "epoch": 0.14604499274310595, "grad_norm": 1.046875, "learning_rate": 0.0004999654862711823, "loss": 6.1304, "mean_token_accuracy": 0.13608851209282874, "num_tokens": 3342122.0, "step": 1610 }, { "entropy": 6.169208431243897, "epoch": 0.14649854862119013, "grad_norm": 1.03125, "learning_rate": 0.0004999649172316065, "loss": 6.1136, "mean_token_accuracy": 0.1308113157749176, "num_tokens": 3352680.0, "step": 1615 }, { "entropy": 6.2383091926574705, "epoch": 0.14695210449927432, "grad_norm": 1.1328125, "learning_rate": 0.000499964343539699, "loss": 6.1395, "mean_token_accuracy": 0.13406497463583947, "num_tokens": 3363230.0, "step": 1620 }, { "entropy": 6.094653749465943, "epoch": 0.1474056603773585, "grad_norm": 1.1484375, "learning_rate": 0.0004999637651954714, "loss": 6.1348, "mean_token_accuracy": 0.13433574065566062, "num_tokens": 3373794.0, "step": 1625 }, { "entropy": 6.197765684127807, "epoch": 0.14785921625544268, "grad_norm": 0.98828125, "learning_rate": 0.0004999631821989358, "loss": 6.1994, "mean_token_accuracy": 0.12583935111761094, "num_tokens": 3384514.0, "step": 1630 }, { "entropy": 6.256759357452393, "epoch": 0.14831277213352684, "grad_norm": 1.1640625, "learning_rate": 0.0004999625945501043, "loss": 6.2303, "mean_token_accuracy": 0.12956068590283393, "num_tokens": 3394803.0, "step": 1635 }, { "entropy": 6.122566747665405, "epoch": 0.14876632801161102, "grad_norm": 1.0390625, "learning_rate": 0.000499962002248989, "loss": 6.0898, "mean_token_accuracy": 0.13396508246660233, "num_tokens": 3405151.0, "step": 1640 }, { "entropy": 6.0934981346130375, "epoch": 0.1492198838896952, "grad_norm": 1.0625, "learning_rate": 0.0004999614052956024, "loss": 6.0583, "mean_token_accuracy": 0.1364964097738266, "num_tokens": 3414841.0, "step": 1645 }, { "entropy": 6.048268461227417, "epoch": 0.1496734397677794, "grad_norm": 1.046875, "learning_rate": 0.0004999608036899563, "loss": 6.0788, "mean_token_accuracy": 0.13555450439453126, "num_tokens": 3425139.0, "step": 1650 }, { "entropy": 6.194241523742676, "epoch": 0.15012699564586357, "grad_norm": 1.0859375, "learning_rate": 0.0004999601974320636, "loss": 6.1343, "mean_token_accuracy": 0.13373469784855843, "num_tokens": 3436113.0, "step": 1655 }, { "entropy": 6.095238971710205, "epoch": 0.15058055152394775, "grad_norm": 1.1484375, "learning_rate": 0.0004999595865219367, "loss": 6.0556, "mean_token_accuracy": 0.13025515004992486, "num_tokens": 3445605.0, "step": 1660 }, { "entropy": 6.008597135543823, "epoch": 0.15103410740203194, "grad_norm": 1.03125, "learning_rate": 0.0004999589709595881, "loss": 6.0895, "mean_token_accuracy": 0.1334249906241894, "num_tokens": 3456035.0, "step": 1665 }, { "entropy": 6.121166181564331, "epoch": 0.15148766328011612, "grad_norm": 1.015625, "learning_rate": 0.0004999583507450308, "loss": 5.9982, "mean_token_accuracy": 0.13778249844908713, "num_tokens": 3465607.0, "step": 1670 }, { "entropy": 6.085819149017334, "epoch": 0.1519412191582003, "grad_norm": 1.046875, "learning_rate": 0.0004999577258782774, "loss": 6.0603, "mean_token_accuracy": 0.13757585138082504, "num_tokens": 3475637.0, "step": 1675 }, { "entropy": 6.190000343322754, "epoch": 0.15239477503628446, "grad_norm": 1.09375, "learning_rate": 0.000499957096359341, "loss": 6.2364, "mean_token_accuracy": 0.12960681244730948, "num_tokens": 3486200.0, "step": 1680 }, { "entropy": 6.079170513153076, "epoch": 0.15284833091436864, "grad_norm": 1.0859375, "learning_rate": 0.0004999564621882343, "loss": 6.0739, "mean_token_accuracy": 0.142069224268198, "num_tokens": 3495892.0, "step": 1685 }, { "entropy": 6.0179280757904055, "epoch": 0.15330188679245282, "grad_norm": 1.1328125, "learning_rate": 0.0004999558233649708, "loss": 5.9601, "mean_token_accuracy": 0.14071570262312888, "num_tokens": 3504837.0, "step": 1690 }, { "entropy": 6.181920051574707, "epoch": 0.153755442670537, "grad_norm": 1.1640625, "learning_rate": 0.0004999551798895636, "loss": 6.1237, "mean_token_accuracy": 0.13454843834042549, "num_tokens": 3514966.0, "step": 1695 }, { "entropy": 6.123470783233643, "epoch": 0.1542089985486212, "grad_norm": 1.046875, "learning_rate": 0.0004999545317620258, "loss": 6.1948, "mean_token_accuracy": 0.1286864012479782, "num_tokens": 3526927.0, "step": 1700 }, { "entropy": 6.103703546524048, "epoch": 0.15466255442670537, "grad_norm": 1.0703125, "learning_rate": 0.0004999538789823711, "loss": 6.1362, "mean_token_accuracy": 0.13410764262080194, "num_tokens": 3537493.0, "step": 1705 }, { "entropy": 6.200163269042969, "epoch": 0.15511611030478956, "grad_norm": 1.0625, "learning_rate": 0.0004999532215506127, "loss": 6.1782, "mean_token_accuracy": 0.13086570724844931, "num_tokens": 3548188.0, "step": 1710 }, { "entropy": 6.023609161376953, "epoch": 0.15556966618287374, "grad_norm": 0.99609375, "learning_rate": 0.0004999525594667645, "loss": 6.0613, "mean_token_accuracy": 0.13730209618806838, "num_tokens": 3558895.0, "step": 1715 }, { "entropy": 6.090526866912842, "epoch": 0.15602322206095792, "grad_norm": 1.0859375, "learning_rate": 0.00049995189273084, "loss": 5.9685, "mean_token_accuracy": 0.13569305986166, "num_tokens": 3569052.0, "step": 1720 }, { "entropy": 6.121201276779175, "epoch": 0.15647677793904208, "grad_norm": 0.9609375, "learning_rate": 0.000499951221342853, "loss": 6.1226, "mean_token_accuracy": 0.1320158787071705, "num_tokens": 3579714.0, "step": 1725 }, { "entropy": 6.001186561584473, "epoch": 0.15693033381712626, "grad_norm": 1.171875, "learning_rate": 0.0004999505453028174, "loss": 5.9801, "mean_token_accuracy": 0.13680141866207124, "num_tokens": 3589305.0, "step": 1730 }, { "entropy": 6.076255941390992, "epoch": 0.15738388969521044, "grad_norm": 1.140625, "learning_rate": 0.0004999498646107472, "loss": 6.0586, "mean_token_accuracy": 0.1337602600455284, "num_tokens": 3599848.0, "step": 1735 }, { "entropy": 6.0408961296081545, "epoch": 0.15783744557329463, "grad_norm": 1.1875, "learning_rate": 0.0004999491792666566, "loss": 6.1816, "mean_token_accuracy": 0.13034821301698685, "num_tokens": 3610588.0, "step": 1740 }, { "entropy": 6.26001992225647, "epoch": 0.1582910014513788, "grad_norm": 1.0703125, "learning_rate": 0.0004999484892705597, "loss": 6.1291, "mean_token_accuracy": 0.1350434586405754, "num_tokens": 3620649.0, "step": 1745 }, { "entropy": 6.085051679611206, "epoch": 0.158744557329463, "grad_norm": 1.109375, "learning_rate": 0.0004999477946224705, "loss": 6.0635, "mean_token_accuracy": 0.13476430699229242, "num_tokens": 3630412.0, "step": 1750 }, { "entropy": 6.041621828079224, "epoch": 0.15919811320754718, "grad_norm": 1.09375, "learning_rate": 0.0004999470953224037, "loss": 6.0457, "mean_token_accuracy": 0.13242931589484214, "num_tokens": 3640946.0, "step": 1755 }, { "entropy": 6.114254808425903, "epoch": 0.15965166908563136, "grad_norm": 1.1171875, "learning_rate": 0.0004999463913703735, "loss": 6.1408, "mean_token_accuracy": 0.13187248036265373, "num_tokens": 3651478.0, "step": 1760 }, { "entropy": 6.029904985427857, "epoch": 0.16010522496371554, "grad_norm": 1.046875, "learning_rate": 0.0004999456827663948, "loss": 5.9905, "mean_token_accuracy": 0.13920539617538452, "num_tokens": 3661509.0, "step": 1765 }, { "entropy": 6.057517337799072, "epoch": 0.1605587808417997, "grad_norm": 1.1015625, "learning_rate": 0.000499944969510482, "loss": 6.0412, "mean_token_accuracy": 0.1356307126581669, "num_tokens": 3672293.0, "step": 1770 }, { "entropy": 6.089949989318848, "epoch": 0.16101233671988388, "grad_norm": 1.140625, "learning_rate": 0.0004999442516026498, "loss": 6.0526, "mean_token_accuracy": 0.13480686247348786, "num_tokens": 3682687.0, "step": 1775 }, { "entropy": 6.129207468032837, "epoch": 0.16146589259796806, "grad_norm": 1.1875, "learning_rate": 0.0004999435290429133, "loss": 6.0789, "mean_token_accuracy": 0.14450050964951516, "num_tokens": 3692787.0, "step": 1780 }, { "entropy": 6.038466596603394, "epoch": 0.16191944847605225, "grad_norm": 1.1875, "learning_rate": 0.0004999428018312872, "loss": 6.0478, "mean_token_accuracy": 0.13742451071739198, "num_tokens": 3703182.0, "step": 1785 }, { "entropy": 6.083740758895874, "epoch": 0.16237300435413643, "grad_norm": 1.1875, "learning_rate": 0.0004999420699677867, "loss": 6.1061, "mean_token_accuracy": 0.12973477616906165, "num_tokens": 3713384.0, "step": 1790 }, { "entropy": 6.063831567764282, "epoch": 0.1628265602322206, "grad_norm": 1.0859375, "learning_rate": 0.0004999413334524269, "loss": 6.0992, "mean_token_accuracy": 0.13103547915816308, "num_tokens": 3725122.0, "step": 1795 }, { "entropy": 6.214202642440796, "epoch": 0.1632801161103048, "grad_norm": 1.0390625, "learning_rate": 0.0004999405922852229, "loss": 6.1184, "mean_token_accuracy": 0.13545257672667504, "num_tokens": 3735460.0, "step": 1800 }, { "entropy": 6.04037709236145, "epoch": 0.16373367198838898, "grad_norm": 1.09375, "learning_rate": 0.0004999398464661901, "loss": 6.0184, "mean_token_accuracy": 0.13665979579091073, "num_tokens": 3745442.0, "step": 1805 }, { "entropy": 5.931473588943481, "epoch": 0.16418722786647316, "grad_norm": 1.0625, "learning_rate": 0.0004999390959953441, "loss": 5.9745, "mean_token_accuracy": 0.1391763061285019, "num_tokens": 3756443.0, "step": 1810 }, { "entropy": 6.160908555984497, "epoch": 0.16464078374455732, "grad_norm": 1.1796875, "learning_rate": 0.0004999383408727002, "loss": 6.1473, "mean_token_accuracy": 0.13380085676908493, "num_tokens": 3767502.0, "step": 1815 }, { "entropy": 6.0393414974212645, "epoch": 0.1650943396226415, "grad_norm": 1.1171875, "learning_rate": 0.0004999375810982741, "loss": 6.0104, "mean_token_accuracy": 0.13753475695848466, "num_tokens": 3778476.0, "step": 1820 }, { "entropy": 6.044342517852783, "epoch": 0.16554789550072568, "grad_norm": 1.1015625, "learning_rate": 0.0004999368166720815, "loss": 6.069, "mean_token_accuracy": 0.13943940550088882, "num_tokens": 3788616.0, "step": 1825 }, { "entropy": 6.084714126586914, "epoch": 0.16600145137880987, "grad_norm": 1.140625, "learning_rate": 0.0004999360475941382, "loss": 6.0156, "mean_token_accuracy": 0.14626918584108353, "num_tokens": 3798257.0, "step": 1830 }, { "entropy": 6.04117636680603, "epoch": 0.16645500725689405, "grad_norm": 1.1328125, "learning_rate": 0.00049993527386446, "loss": 6.005, "mean_token_accuracy": 0.13517511934041976, "num_tokens": 3807833.0, "step": 1835 }, { "entropy": 6.109489679336548, "epoch": 0.16690856313497823, "grad_norm": 1.140625, "learning_rate": 0.0004999344954830633, "loss": 6.0797, "mean_token_accuracy": 0.13237160220742225, "num_tokens": 3817246.0, "step": 1840 }, { "entropy": 6.177425670623779, "epoch": 0.16736211901306242, "grad_norm": 1.2109375, "learning_rate": 0.0004999337124499638, "loss": 6.064, "mean_token_accuracy": 0.14445747211575508, "num_tokens": 3827709.0, "step": 1845 }, { "entropy": 5.908847332000732, "epoch": 0.1678156748911466, "grad_norm": 1.2265625, "learning_rate": 0.0004999329247651777, "loss": 6.0674, "mean_token_accuracy": 0.14029163047671317, "num_tokens": 3837498.0, "step": 1850 }, { "entropy": 6.158235931396485, "epoch": 0.16826923076923078, "grad_norm": 1.1015625, "learning_rate": 0.0004999321324287213, "loss": 6.0969, "mean_token_accuracy": 0.13958577588200569, "num_tokens": 3849227.0, "step": 1855 }, { "entropy": 5.956509160995483, "epoch": 0.16872278664731494, "grad_norm": 1.125, "learning_rate": 0.0004999313354406114, "loss": 6.0774, "mean_token_accuracy": 0.13036854714155197, "num_tokens": 3859110.0, "step": 1860 }, { "entropy": 6.06641263961792, "epoch": 0.16917634252539912, "grad_norm": 1.046875, "learning_rate": 0.000499930533800864, "loss": 6.0666, "mean_token_accuracy": 0.14033757895231247, "num_tokens": 3869906.0, "step": 1865 }, { "entropy": 6.1277564525604244, "epoch": 0.1696298984034833, "grad_norm": 1.046875, "learning_rate": 0.0004999297275094958, "loss": 6.0638, "mean_token_accuracy": 0.135610331594944, "num_tokens": 3880343.0, "step": 1870 }, { "entropy": 6.04757661819458, "epoch": 0.1700834542815675, "grad_norm": 1.0859375, "learning_rate": 0.0004999289165665235, "loss": 5.9914, "mean_token_accuracy": 0.13660356178879737, "num_tokens": 3890969.0, "step": 1875 }, { "entropy": 6.006391096115112, "epoch": 0.17053701015965167, "grad_norm": 1.078125, "learning_rate": 0.0004999281009719639, "loss": 5.9267, "mean_token_accuracy": 0.14178500920534134, "num_tokens": 3900744.0, "step": 1880 }, { "entropy": 5.981471347808838, "epoch": 0.17099056603773585, "grad_norm": 1.1015625, "learning_rate": 0.0004999272807258339, "loss": 6.0796, "mean_token_accuracy": 0.13724706768989564, "num_tokens": 3911415.0, "step": 1885 }, { "entropy": 6.117090654373169, "epoch": 0.17144412191582004, "grad_norm": 1.1484375, "learning_rate": 0.0004999264558281504, "loss": 6.0299, "mean_token_accuracy": 0.1346352569758892, "num_tokens": 3922405.0, "step": 1890 }, { "entropy": 6.084085512161255, "epoch": 0.17189767779390422, "grad_norm": 1.0, "learning_rate": 0.0004999256262789305, "loss": 6.0987, "mean_token_accuracy": 0.1346895545721054, "num_tokens": 3934715.0, "step": 1895 }, { "entropy": 5.962582588195801, "epoch": 0.1723512336719884, "grad_norm": 1.125, "learning_rate": 0.0004999247920781913, "loss": 5.9625, "mean_token_accuracy": 0.14006249159574508, "num_tokens": 3945410.0, "step": 1900 }, { "entropy": 6.040754938125611, "epoch": 0.17280478955007256, "grad_norm": 1.1484375, "learning_rate": 0.0004999239532259502, "loss": 6.022, "mean_token_accuracy": 0.13346246182918547, "num_tokens": 3956435.0, "step": 1905 }, { "entropy": 6.0511785507202145, "epoch": 0.17325834542815674, "grad_norm": 1.1171875, "learning_rate": 0.0004999231097222244, "loss": 5.9648, "mean_token_accuracy": 0.1416295848786831, "num_tokens": 3967855.0, "step": 1910 }, { "entropy": 6.059988403320313, "epoch": 0.17371190130624092, "grad_norm": 1.0390625, "learning_rate": 0.0004999222615670312, "loss": 6.1613, "mean_token_accuracy": 0.1296894371509552, "num_tokens": 3979467.0, "step": 1915 }, { "entropy": 6.160438489913941, "epoch": 0.1741654571843251, "grad_norm": 1.1171875, "learning_rate": 0.0004999214087603885, "loss": 6.1026, "mean_token_accuracy": 0.13720218911767007, "num_tokens": 3989624.0, "step": 1920 }, { "entropy": 6.01017427444458, "epoch": 0.1746190130624093, "grad_norm": 1.0234375, "learning_rate": 0.0004999205513023135, "loss": 5.9484, "mean_token_accuracy": 0.13784751817584037, "num_tokens": 4000408.0, "step": 1925 }, { "entropy": 5.971663951873779, "epoch": 0.17507256894049347, "grad_norm": 1.0859375, "learning_rate": 0.0004999196891928245, "loss": 5.9627, "mean_token_accuracy": 0.14002003520727158, "num_tokens": 4011110.0, "step": 1930 }, { "entropy": 6.0252245426177975, "epoch": 0.17552612481857766, "grad_norm": 1.28125, "learning_rate": 0.0004999188224319388, "loss": 6.0273, "mean_token_accuracy": 0.1419824965298176, "num_tokens": 4021370.0, "step": 1935 }, { "entropy": 6.083719778060913, "epoch": 0.17597968069666184, "grad_norm": 1.109375, "learning_rate": 0.0004999179510196746, "loss": 6.0176, "mean_token_accuracy": 0.1337435156106949, "num_tokens": 4032189.0, "step": 1940 }, { "entropy": 6.030994844436646, "epoch": 0.17643323657474602, "grad_norm": 1.125, "learning_rate": 0.0004999170749560498, "loss": 6.0009, "mean_token_accuracy": 0.13951044976711274, "num_tokens": 4043245.0, "step": 1945 }, { "entropy": 5.954610395431518, "epoch": 0.17688679245283018, "grad_norm": 1.15625, "learning_rate": 0.0004999161942410827, "loss": 5.9581, "mean_token_accuracy": 0.14021288603544235, "num_tokens": 4054432.0, "step": 1950 }, { "entropy": 6.065416479110718, "epoch": 0.17734034833091436, "grad_norm": 1.171875, "learning_rate": 0.0004999153088747913, "loss": 6.0134, "mean_token_accuracy": 0.14068708717823028, "num_tokens": 4064696.0, "step": 1955 }, { "entropy": 6.007389259338379, "epoch": 0.17779390420899854, "grad_norm": 1.0546875, "learning_rate": 0.000499914418857194, "loss": 6.0498, "mean_token_accuracy": 0.1319423608481884, "num_tokens": 4075556.0, "step": 1960 }, { "entropy": 6.072854518890381, "epoch": 0.17824746008708273, "grad_norm": 1.125, "learning_rate": 0.0004999135241883092, "loss": 6.0347, "mean_token_accuracy": 0.13773117437958718, "num_tokens": 4086532.0, "step": 1965 }, { "entropy": 6.0589231014251705, "epoch": 0.1787010159651669, "grad_norm": 1.1875, "learning_rate": 0.0004999126248681555, "loss": 6.04, "mean_token_accuracy": 0.13843712881207465, "num_tokens": 4096940.0, "step": 1970 }, { "entropy": 5.971566438674927, "epoch": 0.1791545718432511, "grad_norm": 1.15625, "learning_rate": 0.0004999117208967513, "loss": 5.9022, "mean_token_accuracy": 0.1378993310034275, "num_tokens": 4106074.0, "step": 1975 }, { "entropy": 6.018008756637573, "epoch": 0.17960812772133528, "grad_norm": 1.0078125, "learning_rate": 0.0004999108122741154, "loss": 5.9724, "mean_token_accuracy": 0.13504682332277299, "num_tokens": 4117738.0, "step": 1980 }, { "entropy": 6.027943420410156, "epoch": 0.18006168359941946, "grad_norm": 1.0703125, "learning_rate": 0.0004999098990002666, "loss": 5.9853, "mean_token_accuracy": 0.13756806403398514, "num_tokens": 4128244.0, "step": 1985 }, { "entropy": 5.966828727722168, "epoch": 0.18051523947750364, "grad_norm": 1.0703125, "learning_rate": 0.0004999089810752237, "loss": 6.0861, "mean_token_accuracy": 0.14235653579235077, "num_tokens": 4138139.0, "step": 1990 }, { "entropy": 6.050969362258911, "epoch": 0.1809687953555878, "grad_norm": 1.078125, "learning_rate": 0.000499908058499006, "loss": 5.9128, "mean_token_accuracy": 0.1413744457066059, "num_tokens": 4148150.0, "step": 1995 }, { "entropy": 6.0185212135314945, "epoch": 0.18142235123367198, "grad_norm": 1.078125, "learning_rate": 0.0004999071312716321, "loss": 6.0106, "mean_token_accuracy": 0.13587939217686654, "num_tokens": 4160223.0, "step": 2000 }, { "entropy": 5.95493450164795, "epoch": 0.18187590711175616, "grad_norm": 1.3515625, "learning_rate": 0.0004999061993931215, "loss": 5.9437, "mean_token_accuracy": 0.14110832214355468, "num_tokens": 4169948.0, "step": 2005 }, { "entropy": 6.005291557312011, "epoch": 0.18232946298984035, "grad_norm": 1.0625, "learning_rate": 0.0004999052628634934, "loss": 5.9396, "mean_token_accuracy": 0.14428384751081466, "num_tokens": 4179936.0, "step": 2010 }, { "entropy": 6.0180689811706545, "epoch": 0.18278301886792453, "grad_norm": 1.25, "learning_rate": 0.0004999043216827671, "loss": 5.9833, "mean_token_accuracy": 0.14723006561398505, "num_tokens": 4189698.0, "step": 2015 }, { "entropy": 6.009299468994141, "epoch": 0.1832365747460087, "grad_norm": 1.1171875, "learning_rate": 0.0004999033758509621, "loss": 6.1257, "mean_token_accuracy": 0.13319993391633034, "num_tokens": 4200162.0, "step": 2020 }, { "entropy": 6.149590396881104, "epoch": 0.1836901306240929, "grad_norm": 1.109375, "learning_rate": 0.000499902425368098, "loss": 6.0815, "mean_token_accuracy": 0.13354766517877578, "num_tokens": 4210470.0, "step": 2025 }, { "entropy": 5.932142543792724, "epoch": 0.18414368650217708, "grad_norm": 1.2265625, "learning_rate": 0.0004999014702341944, "loss": 5.8913, "mean_token_accuracy": 0.14411630854010582, "num_tokens": 4221062.0, "step": 2030 }, { "entropy": 5.980024766921997, "epoch": 0.18459724238026126, "grad_norm": 1.171875, "learning_rate": 0.0004999005104492712, "loss": 5.9284, "mean_token_accuracy": 0.14326827973127365, "num_tokens": 4231389.0, "step": 2035 }, { "entropy": 5.908800649642944, "epoch": 0.18505079825834542, "grad_norm": 1.0390625, "learning_rate": 0.0004998995460133481, "loss": 5.9101, "mean_token_accuracy": 0.13965596854686738, "num_tokens": 4241164.0, "step": 2040 }, { "entropy": 5.992084264755249, "epoch": 0.1855043541364296, "grad_norm": 1.1796875, "learning_rate": 0.0004998985769264451, "loss": 5.9429, "mean_token_accuracy": 0.14413947463035584, "num_tokens": 4251301.0, "step": 2045 }, { "entropy": 5.983407258987427, "epoch": 0.18595791001451378, "grad_norm": 1.3125, "learning_rate": 0.0004998976031885821, "loss": 5.8994, "mean_token_accuracy": 0.14310136139392854, "num_tokens": 4261600.0, "step": 2050 }, { "entropy": 6.001372003555298, "epoch": 0.18641146589259797, "grad_norm": 1.09375, "learning_rate": 0.0004998966247997794, "loss": 5.9863, "mean_token_accuracy": 0.13233172073960303, "num_tokens": 4271835.0, "step": 2055 }, { "entropy": 5.980549955368042, "epoch": 0.18686502177068215, "grad_norm": 1.0546875, "learning_rate": 0.0004998956417600572, "loss": 6.0495, "mean_token_accuracy": 0.13583017364144326, "num_tokens": 4282866.0, "step": 2060 }, { "entropy": 5.956373786926269, "epoch": 0.18731857764876633, "grad_norm": 1.109375, "learning_rate": 0.0004998946540694358, "loss": 5.8294, "mean_token_accuracy": 0.1468118757009506, "num_tokens": 4293092.0, "step": 2065 }, { "entropy": 5.973520803451538, "epoch": 0.18777213352685052, "grad_norm": 1.109375, "learning_rate": 0.0004998936617279357, "loss": 5.9067, "mean_token_accuracy": 0.13692934289574624, "num_tokens": 4302944.0, "step": 2070 }, { "entropy": 6.059836578369141, "epoch": 0.1882256894049347, "grad_norm": 1.1328125, "learning_rate": 0.0004998926647355773, "loss": 6.0568, "mean_token_accuracy": 0.1373896986246109, "num_tokens": 4314373.0, "step": 2075 }, { "entropy": 5.971044874191284, "epoch": 0.18867924528301888, "grad_norm": 1.1015625, "learning_rate": 0.0004998916630923813, "loss": 6.0485, "mean_token_accuracy": 0.13327606469392778, "num_tokens": 4325204.0, "step": 2080 }, { "entropy": 5.9976475715637205, "epoch": 0.18913280116110304, "grad_norm": 1.2421875, "learning_rate": 0.0004998906567983685, "loss": 5.9668, "mean_token_accuracy": 0.13214946836233138, "num_tokens": 4335667.0, "step": 2085 }, { "entropy": 5.938468980789184, "epoch": 0.18958635703918722, "grad_norm": 1.09375, "learning_rate": 0.0004998896458535595, "loss": 5.8699, "mean_token_accuracy": 0.14601458087563515, "num_tokens": 4345600.0, "step": 2090 }, { "entropy": 5.8882725715637205, "epoch": 0.1900399129172714, "grad_norm": 1.109375, "learning_rate": 0.0004998886302579752, "loss": 5.9109, "mean_token_accuracy": 0.14233326613903047, "num_tokens": 4355994.0, "step": 2095 }, { "entropy": 5.941480922698974, "epoch": 0.19049346879535559, "grad_norm": 1.09375, "learning_rate": 0.000499887610011637, "loss": 5.9773, "mean_token_accuracy": 0.1386798821389675, "num_tokens": 4367514.0, "step": 2100 }, { "entropy": 6.065828418731689, "epoch": 0.19094702467343977, "grad_norm": 1.09375, "learning_rate": 0.0004998865851145656, "loss": 6.0287, "mean_token_accuracy": 0.13639298528432847, "num_tokens": 4378186.0, "step": 2105 }, { "entropy": 6.01219220161438, "epoch": 0.19140058055152395, "grad_norm": 1.203125, "learning_rate": 0.0004998855555667822, "loss": 5.9504, "mean_token_accuracy": 0.14203562438488007, "num_tokens": 4388249.0, "step": 2110 }, { "entropy": 5.9509602069854735, "epoch": 0.19185413642960814, "grad_norm": 1.015625, "learning_rate": 0.0004998845213683084, "loss": 5.9511, "mean_token_accuracy": 0.14101598560810089, "num_tokens": 4398755.0, "step": 2115 }, { "entropy": 6.0761778354644775, "epoch": 0.19230769230769232, "grad_norm": 1.1875, "learning_rate": 0.0004998834825191652, "loss": 6.012, "mean_token_accuracy": 0.14403366893529893, "num_tokens": 4408336.0, "step": 2120 }, { "entropy": 6.001263093948364, "epoch": 0.1927612481857765, "grad_norm": 1.2109375, "learning_rate": 0.0004998824390193743, "loss": 5.9641, "mean_token_accuracy": 0.1412390351295471, "num_tokens": 4418780.0, "step": 2125 }, { "entropy": 5.989875268936157, "epoch": 0.19321480406386066, "grad_norm": 1.2421875, "learning_rate": 0.0004998813908689573, "loss": 5.9049, "mean_token_accuracy": 0.14285448640584947, "num_tokens": 4428780.0, "step": 2130 }, { "entropy": 5.930006456375122, "epoch": 0.19366835994194484, "grad_norm": 1.21875, "learning_rate": 0.0004998803380679359, "loss": 5.8762, "mean_token_accuracy": 0.14344791322946548, "num_tokens": 4439058.0, "step": 2135 }, { "entropy": 5.942577266693116, "epoch": 0.19412191582002902, "grad_norm": 1.1015625, "learning_rate": 0.0004998792806163317, "loss": 5.9551, "mean_token_accuracy": 0.14150920659303665, "num_tokens": 4450120.0, "step": 2140 }, { "entropy": 6.024294757843018, "epoch": 0.1945754716981132, "grad_norm": 1.1640625, "learning_rate": 0.0004998782185141667, "loss": 5.982, "mean_token_accuracy": 0.14056125581264495, "num_tokens": 4460622.0, "step": 2145 }, { "entropy": 5.960634088516235, "epoch": 0.1950290275761974, "grad_norm": 1.2109375, "learning_rate": 0.0004998771517614629, "loss": 5.9543, "mean_token_accuracy": 0.13400557562708854, "num_tokens": 4470494.0, "step": 2150 }, { "entropy": 6.062064456939697, "epoch": 0.19548258345428157, "grad_norm": 1.1484375, "learning_rate": 0.0004998760803582422, "loss": 6.0045, "mean_token_accuracy": 0.1384950064122677, "num_tokens": 4481135.0, "step": 2155 }, { "entropy": 5.964612913131714, "epoch": 0.19593613933236576, "grad_norm": 1.203125, "learning_rate": 0.0004998750043045269, "loss": 5.9767, "mean_token_accuracy": 0.13727275878190995, "num_tokens": 4491092.0, "step": 2160 }, { "entropy": 5.996477460861206, "epoch": 0.19638969521044994, "grad_norm": 1.1875, "learning_rate": 0.0004998739236003392, "loss": 5.975, "mean_token_accuracy": 0.14493463039398194, "num_tokens": 4501004.0, "step": 2165 }, { "entropy": 6.00132417678833, "epoch": 0.1968432510885341, "grad_norm": 1.1484375, "learning_rate": 0.0004998728382457014, "loss": 5.9459, "mean_token_accuracy": 0.14853413999080659, "num_tokens": 4510648.0, "step": 2170 }, { "entropy": 5.998470830917358, "epoch": 0.19729680696661828, "grad_norm": 1.2109375, "learning_rate": 0.0004998717482406362, "loss": 5.993, "mean_token_accuracy": 0.13211097493767737, "num_tokens": 4521999.0, "step": 2175 }, { "entropy": 5.93568229675293, "epoch": 0.19775036284470246, "grad_norm": 1.1015625, "learning_rate": 0.0004998706535851657, "loss": 5.9347, "mean_token_accuracy": 0.13946531787514688, "num_tokens": 4532209.0, "step": 2180 }, { "entropy": 6.073374080657959, "epoch": 0.19820391872278664, "grad_norm": 1.15625, "learning_rate": 0.0004998695542793129, "loss": 6.0389, "mean_token_accuracy": 0.13209992721676828, "num_tokens": 4542215.0, "step": 2185 }, { "entropy": 5.9528271675109865, "epoch": 0.19865747460087083, "grad_norm": 1.0859375, "learning_rate": 0.0004998684503231003, "loss": 5.9099, "mean_token_accuracy": 0.1399923861026764, "num_tokens": 4552424.0, "step": 2190 }, { "entropy": 5.9139893531799315, "epoch": 0.199111030478955, "grad_norm": 1.0859375, "learning_rate": 0.000499867341716551, "loss": 6.0183, "mean_token_accuracy": 0.13691750392317772, "num_tokens": 4562936.0, "step": 2195 }, { "entropy": 6.05651707649231, "epoch": 0.1995645863570392, "grad_norm": 1.125, "learning_rate": 0.0004998662284596878, "loss": 5.9132, "mean_token_accuracy": 0.14678076058626174, "num_tokens": 4573094.0, "step": 2200 }, { "entropy": 6.008046674728393, "epoch": 0.20001814223512338, "grad_norm": 1.1640625, "learning_rate": 0.0004998651105525335, "loss": 5.9501, "mean_token_accuracy": 0.13911140859127044, "num_tokens": 4583194.0, "step": 2205 }, { "entropy": 5.923662614822388, "epoch": 0.20047169811320756, "grad_norm": 1.0390625, "learning_rate": 0.0004998639879951115, "loss": 5.8844, "mean_token_accuracy": 0.14621676206588746, "num_tokens": 4593352.0, "step": 2210 }, { "entropy": 5.91765398979187, "epoch": 0.2009252539912917, "grad_norm": 1.1171875, "learning_rate": 0.000499862860787445, "loss": 5.8657, "mean_token_accuracy": 0.14437806457281113, "num_tokens": 4603895.0, "step": 2215 }, { "entropy": 5.987819957733154, "epoch": 0.2013788098693759, "grad_norm": 1.203125, "learning_rate": 0.0004998617289295571, "loss": 6.0096, "mean_token_accuracy": 0.13959661424160003, "num_tokens": 4614456.0, "step": 2220 }, { "entropy": 5.925340270996093, "epoch": 0.20183236574746008, "grad_norm": 1.1796875, "learning_rate": 0.0004998605924214714, "loss": 5.9116, "mean_token_accuracy": 0.14096696227788924, "num_tokens": 4624139.0, "step": 2225 }, { "entropy": 6.006181907653809, "epoch": 0.20228592162554426, "grad_norm": 1.4296875, "learning_rate": 0.0004998594512632114, "loss": 5.9403, "mean_token_accuracy": 0.14316802397370337, "num_tokens": 4634208.0, "step": 2230 }, { "entropy": 5.891085243225097, "epoch": 0.20273947750362845, "grad_norm": 1.109375, "learning_rate": 0.0004998583054548006, "loss": 6.0011, "mean_token_accuracy": 0.1386461637914181, "num_tokens": 4646019.0, "step": 2235 }, { "entropy": 6.067434978485108, "epoch": 0.20319303338171263, "grad_norm": 1.1640625, "learning_rate": 0.0004998571549962628, "loss": 6.0042, "mean_token_accuracy": 0.13608953431248666, "num_tokens": 4656604.0, "step": 2240 }, { "entropy": 6.018786478042602, "epoch": 0.2036465892597968, "grad_norm": 1.5625, "learning_rate": 0.0004998559998876216, "loss": 5.905, "mean_token_accuracy": 0.14071310609579085, "num_tokens": 4667373.0, "step": 2245 }, { "entropy": 6.00168890953064, "epoch": 0.204100145137881, "grad_norm": 1.203125, "learning_rate": 0.0004998548401289012, "loss": 5.9825, "mean_token_accuracy": 0.13470427468419074, "num_tokens": 4678351.0, "step": 2250 }, { "entropy": 5.980109548568725, "epoch": 0.20455370101596518, "grad_norm": 1.125, "learning_rate": 0.0004998536757201253, "loss": 5.9328, "mean_token_accuracy": 0.13843259811401368, "num_tokens": 4688414.0, "step": 2255 }, { "entropy": 5.926772880554199, "epoch": 0.20500725689404933, "grad_norm": 1.0703125, "learning_rate": 0.0004998525066613181, "loss": 5.9745, "mean_token_accuracy": 0.14305582344532014, "num_tokens": 4699031.0, "step": 2260 }, { "entropy": 5.994556140899658, "epoch": 0.20546081277213352, "grad_norm": 1.1796875, "learning_rate": 0.0004998513329525038, "loss": 5.8892, "mean_token_accuracy": 0.1420019529759884, "num_tokens": 4709559.0, "step": 2265 }, { "entropy": 5.835793304443359, "epoch": 0.2059143686502177, "grad_norm": 1.1484375, "learning_rate": 0.0004998501545937066, "loss": 5.8173, "mean_token_accuracy": 0.1476012036204338, "num_tokens": 4719887.0, "step": 2270 }, { "entropy": 5.935054349899292, "epoch": 0.20636792452830188, "grad_norm": 1.03125, "learning_rate": 0.000499848971584951, "loss": 5.8989, "mean_token_accuracy": 0.1409054510295391, "num_tokens": 4730105.0, "step": 2275 }, { "entropy": 5.962164735794067, "epoch": 0.20682148040638607, "grad_norm": 1.234375, "learning_rate": 0.0004998477839262611, "loss": 5.9575, "mean_token_accuracy": 0.13953802660107611, "num_tokens": 4740447.0, "step": 2280 }, { "entropy": 5.928989315032959, "epoch": 0.20727503628447025, "grad_norm": 1.1953125, "learning_rate": 0.000499846591617662, "loss": 5.9272, "mean_token_accuracy": 0.14312953129410744, "num_tokens": 4750709.0, "step": 2285 }, { "entropy": 5.949032163619995, "epoch": 0.20772859216255443, "grad_norm": 1.1953125, "learning_rate": 0.0004998453946591779, "loss": 5.9673, "mean_token_accuracy": 0.14141981452703475, "num_tokens": 4760349.0, "step": 2290 }, { "entropy": 6.042676591873169, "epoch": 0.20818214804063861, "grad_norm": 1.171875, "learning_rate": 0.0004998441930508339, "loss": 6.0217, "mean_token_accuracy": 0.13636812418699265, "num_tokens": 4770488.0, "step": 2295 }, { "entropy": 5.99560956954956, "epoch": 0.2086357039187228, "grad_norm": 1.2109375, "learning_rate": 0.0004998429867926547, "loss": 5.9516, "mean_token_accuracy": 0.13818990290164948, "num_tokens": 4779991.0, "step": 2300 }, { "entropy": 5.914564037322998, "epoch": 0.20908925979680695, "grad_norm": 1.2109375, "learning_rate": 0.0004998417758846651, "loss": 5.8844, "mean_token_accuracy": 0.14226182624697686, "num_tokens": 4790160.0, "step": 2305 }, { "entropy": 5.927054691314697, "epoch": 0.20954281567489114, "grad_norm": 1.25, "learning_rate": 0.0004998405603268903, "loss": 5.7898, "mean_token_accuracy": 0.14916908890008926, "num_tokens": 4800268.0, "step": 2310 }, { "entropy": 5.854596281051636, "epoch": 0.20999637155297532, "grad_norm": 1.1875, "learning_rate": 0.0004998393401193554, "loss": 5.8737, "mean_token_accuracy": 0.14095887839794158, "num_tokens": 4810777.0, "step": 2315 }, { "entropy": 6.093844556808472, "epoch": 0.2104499274310595, "grad_norm": 1.2109375, "learning_rate": 0.0004998381152620857, "loss": 6.0447, "mean_token_accuracy": 0.13425768688321113, "num_tokens": 4821966.0, "step": 2320 }, { "entropy": 6.052251672744751, "epoch": 0.21090348330914369, "grad_norm": 1.203125, "learning_rate": 0.0004998368857551067, "loss": 5.9375, "mean_token_accuracy": 0.1455095313489437, "num_tokens": 4832175.0, "step": 2325 }, { "entropy": 5.84284200668335, "epoch": 0.21135703918722787, "grad_norm": 1.296875, "learning_rate": 0.0004998356515984433, "loss": 5.8432, "mean_token_accuracy": 0.14820571541786193, "num_tokens": 4841506.0, "step": 2330 }, { "entropy": 5.887610673904419, "epoch": 0.21181059506531205, "grad_norm": 1.1875, "learning_rate": 0.0004998344127921213, "loss": 5.9033, "mean_token_accuracy": 0.13908652514219283, "num_tokens": 4851169.0, "step": 2335 }, { "entropy": 5.955441951751709, "epoch": 0.21226415094339623, "grad_norm": 1.1640625, "learning_rate": 0.0004998331693361666, "loss": 5.8309, "mean_token_accuracy": 0.14300615340471268, "num_tokens": 4860957.0, "step": 2340 }, { "entropy": 6.039245557785034, "epoch": 0.21271770682148042, "grad_norm": 1.2265625, "learning_rate": 0.0004998319212306046, "loss": 6.0324, "mean_token_accuracy": 0.12900658324360847, "num_tokens": 4872809.0, "step": 2345 }, { "entropy": 5.892557668685913, "epoch": 0.21317126269956457, "grad_norm": 1.1953125, "learning_rate": 0.000499830668475461, "loss": 5.8898, "mean_token_accuracy": 0.14457644373178483, "num_tokens": 4882487.0, "step": 2350 }, { "entropy": 5.989882373809815, "epoch": 0.21362481857764876, "grad_norm": 1.0546875, "learning_rate": 0.000499829411070762, "loss": 5.989, "mean_token_accuracy": 0.1365087829530239, "num_tokens": 4894084.0, "step": 2355 }, { "entropy": 5.947244024276733, "epoch": 0.21407837445573294, "grad_norm": 1.125, "learning_rate": 0.0004998281490165335, "loss": 5.892, "mean_token_accuracy": 0.14107751250267028, "num_tokens": 4905336.0, "step": 2360 }, { "entropy": 5.917174339294434, "epoch": 0.21453193033381712, "grad_norm": 1.125, "learning_rate": 0.0004998268823128016, "loss": 5.9134, "mean_token_accuracy": 0.14147956743836404, "num_tokens": 4916271.0, "step": 2365 }, { "entropy": 5.941757583618164, "epoch": 0.2149854862119013, "grad_norm": 1.171875, "learning_rate": 0.0004998256109595923, "loss": 5.9371, "mean_token_accuracy": 0.14648856744170188, "num_tokens": 4926284.0, "step": 2370 }, { "entropy": 6.002183961868286, "epoch": 0.2154390420899855, "grad_norm": 1.234375, "learning_rate": 0.0004998243349569323, "loss": 5.9466, "mean_token_accuracy": 0.14225479438900948, "num_tokens": 4936771.0, "step": 2375 }, { "entropy": 5.98759355545044, "epoch": 0.21589259796806967, "grad_norm": 1.1328125, "learning_rate": 0.0004998230543048477, "loss": 6.0056, "mean_token_accuracy": 0.142339825630188, "num_tokens": 4947148.0, "step": 2380 }, { "entropy": 5.987500143051148, "epoch": 0.21634615384615385, "grad_norm": 1.0625, "learning_rate": 0.000499821769003365, "loss": 5.9377, "mean_token_accuracy": 0.14021862521767617, "num_tokens": 4957790.0, "step": 2385 }, { "entropy": 5.997272586822509, "epoch": 0.21679970972423804, "grad_norm": 1.234375, "learning_rate": 0.0004998204790525109, "loss": 5.9226, "mean_token_accuracy": 0.14474812299013137, "num_tokens": 4967266.0, "step": 2390 }, { "entropy": 5.935082054138183, "epoch": 0.2172532656023222, "grad_norm": 1.2109375, "learning_rate": 0.0004998191844523119, "loss": 5.9333, "mean_token_accuracy": 0.14002179726958275, "num_tokens": 4977147.0, "step": 2395 }, { "entropy": 5.969844818115234, "epoch": 0.21770682148040638, "grad_norm": 1.15625, "learning_rate": 0.000499817885202795, "loss": 5.9435, "mean_token_accuracy": 0.14077059850096701, "num_tokens": 4986221.0, "step": 2400 }, { "entropy": 5.965543937683106, "epoch": 0.21816037735849056, "grad_norm": 1.1484375, "learning_rate": 0.0004998165813039869, "loss": 5.928, "mean_token_accuracy": 0.14429101943969727, "num_tokens": 4997015.0, "step": 2405 }, { "entropy": 5.987357711791992, "epoch": 0.21861393323657474, "grad_norm": 1.03125, "learning_rate": 0.0004998152727559145, "loss": 5.9535, "mean_token_accuracy": 0.1384763464331627, "num_tokens": 5007210.0, "step": 2410 }, { "entropy": 5.9590071678161625, "epoch": 0.21906748911465893, "grad_norm": 1.015625, "learning_rate": 0.000499813959558605, "loss": 5.8448, "mean_token_accuracy": 0.14687777310609818, "num_tokens": 5018522.0, "step": 2415 }, { "entropy": 5.920127916336059, "epoch": 0.2195210449927431, "grad_norm": 1.015625, "learning_rate": 0.0004998126417120856, "loss": 5.8532, "mean_token_accuracy": 0.14418737962841988, "num_tokens": 5028704.0, "step": 2420 }, { "entropy": 5.925795173645019, "epoch": 0.2199746008708273, "grad_norm": 1.1796875, "learning_rate": 0.0004998113192163835, "loss": 5.9707, "mean_token_accuracy": 0.1384512260556221, "num_tokens": 5038714.0, "step": 2425 }, { "entropy": 5.915235757827759, "epoch": 0.22042815674891147, "grad_norm": 1.21875, "learning_rate": 0.000499809992071526, "loss": 5.8578, "mean_token_accuracy": 0.1408664584159851, "num_tokens": 5048932.0, "step": 2430 }, { "entropy": 5.9984221935272215, "epoch": 0.22088171262699566, "grad_norm": 1.109375, "learning_rate": 0.0004998086602775406, "loss": 5.9102, "mean_token_accuracy": 0.140318613499403, "num_tokens": 5059027.0, "step": 2435 }, { "entropy": 5.9371038436889645, "epoch": 0.2213352685050798, "grad_norm": 1.125, "learning_rate": 0.0004998073238344547, "loss": 5.9129, "mean_token_accuracy": 0.1459469713270664, "num_tokens": 5069277.0, "step": 2440 }, { "entropy": 5.962320852279663, "epoch": 0.221788824383164, "grad_norm": 1.2421875, "learning_rate": 0.0004998059827422962, "loss": 5.9677, "mean_token_accuracy": 0.14480481147766114, "num_tokens": 5079282.0, "step": 2445 }, { "entropy": 5.982713794708252, "epoch": 0.22224238026124818, "grad_norm": 1.2421875, "learning_rate": 0.0004998046370010926, "loss": 5.9289, "mean_token_accuracy": 0.14125189632177354, "num_tokens": 5089847.0, "step": 2450 }, { "entropy": 5.867915201187134, "epoch": 0.22269593613933236, "grad_norm": 1.25, "learning_rate": 0.0004998032866108718, "loss": 5.8794, "mean_token_accuracy": 0.14892499893903732, "num_tokens": 5099305.0, "step": 2455 }, { "entropy": 5.875945329666138, "epoch": 0.22314949201741655, "grad_norm": 1.1953125, "learning_rate": 0.0004998019315716618, "loss": 5.7864, "mean_token_accuracy": 0.14948971420526505, "num_tokens": 5109394.0, "step": 2460 }, { "entropy": 5.978427791595459, "epoch": 0.22360304789550073, "grad_norm": 1.2421875, "learning_rate": 0.0004998005718834905, "loss": 6.0369, "mean_token_accuracy": 0.13315446451306343, "num_tokens": 5119999.0, "step": 2465 }, { "entropy": 6.013746356964111, "epoch": 0.2240566037735849, "grad_norm": 1.0546875, "learning_rate": 0.0004997992075463862, "loss": 6.0137, "mean_token_accuracy": 0.13928034231066705, "num_tokens": 5130828.0, "step": 2470 }, { "entropy": 6.077896165847778, "epoch": 0.2245101596516691, "grad_norm": 1.1640625, "learning_rate": 0.0004997978385603769, "loss": 5.936, "mean_token_accuracy": 0.1441244065761566, "num_tokens": 5140477.0, "step": 2475 }, { "entropy": 5.827495908737182, "epoch": 0.22496371552975328, "grad_norm": 1.1875, "learning_rate": 0.0004997964649254911, "loss": 5.9129, "mean_token_accuracy": 0.1431684747338295, "num_tokens": 5150934.0, "step": 2480 }, { "entropy": 6.012978363037109, "epoch": 0.22541727140783743, "grad_norm": 1.203125, "learning_rate": 0.0004997950866417572, "loss": 5.8917, "mean_token_accuracy": 0.14228983074426652, "num_tokens": 5160446.0, "step": 2485 }, { "entropy": 5.945698070526123, "epoch": 0.22587082728592162, "grad_norm": 1.0703125, "learning_rate": 0.0004997937037092034, "loss": 5.9799, "mean_token_accuracy": 0.13791251853108405, "num_tokens": 5171818.0, "step": 2490 }, { "entropy": 5.991513013839722, "epoch": 0.2263243831640058, "grad_norm": 1.1953125, "learning_rate": 0.0004997923161278587, "loss": 5.9261, "mean_token_accuracy": 0.14048070907592775, "num_tokens": 5181357.0, "step": 2495 }, { "entropy": 5.976591348648071, "epoch": 0.22677793904208998, "grad_norm": 1.25, "learning_rate": 0.0004997909238977514, "loss": 5.9351, "mean_token_accuracy": 0.13984388560056688, "num_tokens": 5190952.0, "step": 2500 }, { "entropy": 5.979648303985596, "epoch": 0.22723149492017417, "grad_norm": 1.1796875, "learning_rate": 0.0004997895270189108, "loss": 5.942, "mean_token_accuracy": 0.15530682802200318, "num_tokens": 5200757.0, "step": 2505 }, { "entropy": 6.040076065063476, "epoch": 0.22768505079825835, "grad_norm": 1.25, "learning_rate": 0.0004997881254913653, "loss": 5.9891, "mean_token_accuracy": 0.13575384318828582, "num_tokens": 5212160.0, "step": 2510 }, { "entropy": 5.943009519577027, "epoch": 0.22813860667634253, "grad_norm": 1.265625, "learning_rate": 0.0004997867193151441, "loss": 5.9362, "mean_token_accuracy": 0.14286721348762513, "num_tokens": 5222274.0, "step": 2515 }, { "entropy": 5.955537176132202, "epoch": 0.22859216255442671, "grad_norm": 1.609375, "learning_rate": 0.0004997853084902763, "loss": 5.9225, "mean_token_accuracy": 0.14721989408135414, "num_tokens": 5232657.0, "step": 2520 }, { "entropy": 6.057634258270264, "epoch": 0.2290457184325109, "grad_norm": 1.2109375, "learning_rate": 0.0004997838930167911, "loss": 5.9874, "mean_token_accuracy": 0.14284725338220597, "num_tokens": 5242789.0, "step": 2525 }, { "entropy": 5.972007989883423, "epoch": 0.22949927431059505, "grad_norm": 1.2265625, "learning_rate": 0.0004997824728947176, "loss": 5.9744, "mean_token_accuracy": 0.1313949629664421, "num_tokens": 5254045.0, "step": 2530 }, { "entropy": 5.916559791564941, "epoch": 0.22995283018867924, "grad_norm": 1.203125, "learning_rate": 0.0004997810481240853, "loss": 5.8952, "mean_token_accuracy": 0.1435857117176056, "num_tokens": 5263356.0, "step": 2535 }, { "entropy": 5.9302077293396, "epoch": 0.23040638606676342, "grad_norm": 1.28125, "learning_rate": 0.0004997796187049238, "loss": 5.8347, "mean_token_accuracy": 0.14040180593729018, "num_tokens": 5273449.0, "step": 2540 }, { "entropy": 5.912052631378174, "epoch": 0.2308599419448476, "grad_norm": 1.078125, "learning_rate": 0.0004997781846372623, "loss": 5.9068, "mean_token_accuracy": 0.1452646702528, "num_tokens": 5284594.0, "step": 2545 }, { "entropy": 5.873109149932861, "epoch": 0.23131349782293179, "grad_norm": 1.28125, "learning_rate": 0.0004997767459211307, "loss": 5.8432, "mean_token_accuracy": 0.1450057938694954, "num_tokens": 5295138.0, "step": 2550 }, { "entropy": 5.952861070632935, "epoch": 0.23176705370101597, "grad_norm": 1.2578125, "learning_rate": 0.0004997753025565587, "loss": 5.8315, "mean_token_accuracy": 0.14779942333698273, "num_tokens": 5305430.0, "step": 2555 }, { "entropy": 5.839398622512817, "epoch": 0.23222060957910015, "grad_norm": 1.1640625, "learning_rate": 0.0004997738545435763, "loss": 5.8083, "mean_token_accuracy": 0.14324629306793213, "num_tokens": 5315626.0, "step": 2560 }, { "entropy": 5.854900598526001, "epoch": 0.23267416545718433, "grad_norm": 1.25, "learning_rate": 0.0004997724018822133, "loss": 5.8666, "mean_token_accuracy": 0.14416230767965316, "num_tokens": 5325010.0, "step": 2565 }, { "entropy": 5.936237144470215, "epoch": 0.23312772133526852, "grad_norm": 1.140625, "learning_rate": 0.0004997709445724996, "loss": 5.8806, "mean_token_accuracy": 0.14533936828374863, "num_tokens": 5335835.0, "step": 2570 }, { "entropy": 5.905138731002808, "epoch": 0.23358127721335267, "grad_norm": 1.1953125, "learning_rate": 0.0004997694826144656, "loss": 5.9236, "mean_token_accuracy": 0.14513202160596847, "num_tokens": 5346709.0, "step": 2575 }, { "entropy": 5.902335453033447, "epoch": 0.23403483309143686, "grad_norm": 1.234375, "learning_rate": 0.0004997680160081414, "loss": 5.8284, "mean_token_accuracy": 0.14653799757361413, "num_tokens": 5357285.0, "step": 2580 }, { "entropy": 5.973487043380738, "epoch": 0.23448838896952104, "grad_norm": 1.5, "learning_rate": 0.0004997665447535573, "loss": 6.0278, "mean_token_accuracy": 0.1390775978565216, "num_tokens": 5366662.0, "step": 2585 }, { "entropy": 6.149343061447143, "epoch": 0.23494194484760522, "grad_norm": 1.2578125, "learning_rate": 0.0004997650688507438, "loss": 6.0375, "mean_token_accuracy": 0.13486452773213387, "num_tokens": 5377516.0, "step": 2590 }, { "entropy": 5.886330938339233, "epoch": 0.2353955007256894, "grad_norm": 1.1796875, "learning_rate": 0.0004997635882997314, "loss": 5.8939, "mean_token_accuracy": 0.15408131331205369, "num_tokens": 5387557.0, "step": 2595 }, { "entropy": 5.851848316192627, "epoch": 0.2358490566037736, "grad_norm": 1.1015625, "learning_rate": 0.0004997621031005507, "loss": 5.8844, "mean_token_accuracy": 0.1519714578986168, "num_tokens": 5397862.0, "step": 2600 }, { "entropy": 5.8382651805877686, "epoch": 0.23630261248185777, "grad_norm": 1.2734375, "learning_rate": 0.0004997606132532325, "loss": 5.9154, "mean_token_accuracy": 0.13924724757671356, "num_tokens": 5408368.0, "step": 2605 }, { "entropy": 5.978755903244019, "epoch": 0.23675616835994195, "grad_norm": 1.015625, "learning_rate": 0.0004997591187578075, "loss": 5.8955, "mean_token_accuracy": 0.14127107188105584, "num_tokens": 5419315.0, "step": 2610 }, { "entropy": 5.983459186553955, "epoch": 0.23720972423802614, "grad_norm": 1.1328125, "learning_rate": 0.0004997576196143067, "loss": 5.8621, "mean_token_accuracy": 0.13962915763258935, "num_tokens": 5429417.0, "step": 2615 }, { "entropy": 5.836444425582886, "epoch": 0.2376632801161103, "grad_norm": 1.2734375, "learning_rate": 0.000499756115822761, "loss": 5.7937, "mean_token_accuracy": 0.14924170970916747, "num_tokens": 5438697.0, "step": 2620 }, { "entropy": 5.8208709239959715, "epoch": 0.23811683599419448, "grad_norm": 1.2421875, "learning_rate": 0.0004997546073832015, "loss": 5.868, "mean_token_accuracy": 0.14800073951482773, "num_tokens": 5448566.0, "step": 2625 }, { "entropy": 5.945734119415283, "epoch": 0.23857039187227866, "grad_norm": 1.2890625, "learning_rate": 0.0004997530942956595, "loss": 5.8393, "mean_token_accuracy": 0.14892902076244355, "num_tokens": 5457716.0, "step": 2630 }, { "entropy": 5.8889336585998535, "epoch": 0.23902394775036284, "grad_norm": 1.2421875, "learning_rate": 0.0004997515765601662, "loss": 5.9133, "mean_token_accuracy": 0.14614535719156266, "num_tokens": 5467905.0, "step": 2635 }, { "entropy": 5.860836315155029, "epoch": 0.23947750362844702, "grad_norm": 1.234375, "learning_rate": 0.0004997500541767531, "loss": 5.7794, "mean_token_accuracy": 0.14639949202537536, "num_tokens": 5477840.0, "step": 2640 }, { "entropy": 5.775539827346802, "epoch": 0.2399310595065312, "grad_norm": 1.7421875, "learning_rate": 0.0004997485271454516, "loss": 5.783, "mean_token_accuracy": 0.14732736945152283, "num_tokens": 5488336.0, "step": 2645 }, { "entropy": 5.97319803237915, "epoch": 0.2403846153846154, "grad_norm": 1.125, "learning_rate": 0.0004997469954662933, "loss": 5.9824, "mean_token_accuracy": 0.1375535361468792, "num_tokens": 5499663.0, "step": 2650 }, { "entropy": 5.995337295532226, "epoch": 0.24083817126269957, "grad_norm": 1.28125, "learning_rate": 0.0004997454591393097, "loss": 5.8985, "mean_token_accuracy": 0.1435574099421501, "num_tokens": 5508899.0, "step": 2655 }, { "entropy": 5.879145812988281, "epoch": 0.24129172714078376, "grad_norm": 1.203125, "learning_rate": 0.0004997439181645329, "loss": 5.8628, "mean_token_accuracy": 0.14226806908845901, "num_tokens": 5518523.0, "step": 2660 }, { "entropy": 5.9952600479125975, "epoch": 0.2417452830188679, "grad_norm": 1.15625, "learning_rate": 0.0004997423725419945, "loss": 5.9503, "mean_token_accuracy": 0.14343410283327102, "num_tokens": 5528751.0, "step": 2665 }, { "entropy": 6.054172945022583, "epoch": 0.2421988388969521, "grad_norm": 1.2109375, "learning_rate": 0.0004997408222717267, "loss": 5.8535, "mean_token_accuracy": 0.14445326030254363, "num_tokens": 5538769.0, "step": 2670 }, { "entropy": 5.828339338302612, "epoch": 0.24265239477503628, "grad_norm": 1.265625, "learning_rate": 0.0004997392673537612, "loss": 5.8943, "mean_token_accuracy": 0.14723632782697677, "num_tokens": 5549229.0, "step": 2675 }, { "entropy": 6.001218986511231, "epoch": 0.24310595065312046, "grad_norm": 1.0859375, "learning_rate": 0.0004997377077881306, "loss": 6.0027, "mean_token_accuracy": 0.13532417714595796, "num_tokens": 5561115.0, "step": 2680 }, { "entropy": 5.941242027282715, "epoch": 0.24355950653120464, "grad_norm": 1.15625, "learning_rate": 0.0004997361435748668, "loss": 5.8692, "mean_token_accuracy": 0.14536329954862595, "num_tokens": 5571995.0, "step": 2685 }, { "entropy": 5.888056325912475, "epoch": 0.24401306240928883, "grad_norm": 1.1171875, "learning_rate": 0.0004997345747140024, "loss": 5.826, "mean_token_accuracy": 0.14596109837293625, "num_tokens": 5582477.0, "step": 2690 }, { "entropy": 5.9173914909362795, "epoch": 0.244466618287373, "grad_norm": 1.140625, "learning_rate": 0.0004997330012055695, "loss": 5.7922, "mean_token_accuracy": 0.15324772000312806, "num_tokens": 5592355.0, "step": 2695 }, { "entropy": 5.7889283180236815, "epoch": 0.2449201741654572, "grad_norm": 1.1640625, "learning_rate": 0.0004997314230496011, "loss": 5.8323, "mean_token_accuracy": 0.14904937148094177, "num_tokens": 5602448.0, "step": 2700 }, { "entropy": 5.879192256927491, "epoch": 0.24537373004354138, "grad_norm": 1.109375, "learning_rate": 0.0004997298402461296, "loss": 5.8207, "mean_token_accuracy": 0.14821702241897583, "num_tokens": 5613501.0, "step": 2705 }, { "entropy": 5.954217576980591, "epoch": 0.24582728592162553, "grad_norm": 1.0625, "learning_rate": 0.0004997282527951876, "loss": 5.8956, "mean_token_accuracy": 0.14211225211620332, "num_tokens": 5624834.0, "step": 2710 }, { "entropy": 5.956999349594116, "epoch": 0.24628084179970972, "grad_norm": 1.15625, "learning_rate": 0.0004997266606968081, "loss": 5.9062, "mean_token_accuracy": 0.14094941169023514, "num_tokens": 5635200.0, "step": 2715 }, { "entropy": 5.852967071533203, "epoch": 0.2467343976777939, "grad_norm": 1.109375, "learning_rate": 0.0004997250639510241, "loss": 5.7953, "mean_token_accuracy": 0.14844689518213272, "num_tokens": 5645710.0, "step": 2720 }, { "entropy": 5.750450468063354, "epoch": 0.24718795355587808, "grad_norm": 1.328125, "learning_rate": 0.0004997234625578684, "loss": 5.7916, "mean_token_accuracy": 0.13893610686063768, "num_tokens": 5655898.0, "step": 2725 }, { "entropy": 5.899655771255493, "epoch": 0.24764150943396226, "grad_norm": 1.09375, "learning_rate": 0.0004997218565173742, "loss": 5.8707, "mean_token_accuracy": 0.14310870319604874, "num_tokens": 5666412.0, "step": 2730 }, { "entropy": 5.898589086532593, "epoch": 0.24809506531204645, "grad_norm": 1.2265625, "learning_rate": 0.0004997202458295748, "loss": 5.9183, "mean_token_accuracy": 0.14258762449026108, "num_tokens": 5676410.0, "step": 2735 }, { "entropy": 5.940978002548218, "epoch": 0.24854862119013063, "grad_norm": 1.1484375, "learning_rate": 0.0004997186304945034, "loss": 5.8711, "mean_token_accuracy": 0.13710892349481582, "num_tokens": 5687033.0, "step": 2740 }, { "entropy": 5.84973406791687, "epoch": 0.24900217706821481, "grad_norm": 1.1796875, "learning_rate": 0.0004997170105121935, "loss": 5.7994, "mean_token_accuracy": 0.14377631098031998, "num_tokens": 5696310.0, "step": 2745 }, { "entropy": 5.842684984207153, "epoch": 0.249455732946299, "grad_norm": 1.1328125, "learning_rate": 0.0004997153858826786, "loss": 5.8483, "mean_token_accuracy": 0.15185194611549377, "num_tokens": 5706275.0, "step": 2750 }, { "entropy": 5.912807130813599, "epoch": 0.24990928882438315, "grad_norm": 1.1953125, "learning_rate": 0.0004997137566059922, "loss": 5.9279, "mean_token_accuracy": 0.1422789663076401, "num_tokens": 5716572.0, "step": 2755 }, { "entropy": 5.954165983200073, "epoch": 0.25036284470246734, "grad_norm": 1.2109375, "learning_rate": 0.0004997121226821681, "loss": 5.8373, "mean_token_accuracy": 0.14658476859331132, "num_tokens": 5726469.0, "step": 2760 }, { "entropy": 5.846992874145508, "epoch": 0.25081640058055155, "grad_norm": 1.1171875, "learning_rate": 0.00049971048411124, "loss": 5.7856, "mean_token_accuracy": 0.1450542390346527, "num_tokens": 5737126.0, "step": 2765 }, { "entropy": 5.932477760314941, "epoch": 0.2512699564586357, "grad_norm": 1.15625, "learning_rate": 0.0004997088408932418, "loss": 5.9739, "mean_token_accuracy": 0.14914767369627951, "num_tokens": 5747557.0, "step": 2770 }, { "entropy": 5.90068359375, "epoch": 0.25172351233671986, "grad_norm": 1.125, "learning_rate": 0.0004997071930282076, "loss": 5.9454, "mean_token_accuracy": 0.13878969848155975, "num_tokens": 5758652.0, "step": 2775 }, { "entropy": 5.963881874084473, "epoch": 0.25217706821480407, "grad_norm": 1.1796875, "learning_rate": 0.0004997055405161712, "loss": 5.8894, "mean_token_accuracy": 0.14103187918663024, "num_tokens": 5768889.0, "step": 2780 }, { "entropy": 5.9532280445098875, "epoch": 0.2526306240928882, "grad_norm": 1.28125, "learning_rate": 0.0004997038833571671, "loss": 5.8383, "mean_token_accuracy": 0.14568528681993484, "num_tokens": 5779401.0, "step": 2785 }, { "entropy": 5.858279228210449, "epoch": 0.25308417997097243, "grad_norm": 1.171875, "learning_rate": 0.0004997022215512295, "loss": 5.8208, "mean_token_accuracy": 0.14427980780601501, "num_tokens": 5790481.0, "step": 2790 }, { "entropy": 5.93959412574768, "epoch": 0.2535377358490566, "grad_norm": 1.1328125, "learning_rate": 0.0004997005550983925, "loss": 5.9005, "mean_token_accuracy": 0.1436707317829132, "num_tokens": 5801050.0, "step": 2795 }, { "entropy": 5.937245941162109, "epoch": 0.2539912917271408, "grad_norm": 1.1796875, "learning_rate": 0.000499698883998691, "loss": 5.8902, "mean_token_accuracy": 0.1422402374446392, "num_tokens": 5812277.0, "step": 2800 }, { "entropy": 5.900210762023926, "epoch": 0.25444484760522496, "grad_norm": 1.203125, "learning_rate": 0.0004996972082521591, "loss": 5.902, "mean_token_accuracy": 0.1445831313729286, "num_tokens": 5822300.0, "step": 2805 }, { "entropy": 5.884892416000366, "epoch": 0.25489840348330917, "grad_norm": 1.3125, "learning_rate": 0.0004996955278588319, "loss": 5.8068, "mean_token_accuracy": 0.15077413916587828, "num_tokens": 5831764.0, "step": 2810 }, { "entropy": 5.913922739028931, "epoch": 0.2553519593613933, "grad_norm": 1.234375, "learning_rate": 0.0004996938428187437, "loss": 5.8143, "mean_token_accuracy": 0.1524057112634182, "num_tokens": 5841651.0, "step": 2815 }, { "entropy": 5.9320954322814945, "epoch": 0.2558055152394775, "grad_norm": 1.1328125, "learning_rate": 0.0004996921531319297, "loss": 5.8831, "mean_token_accuracy": 0.14498303830623627, "num_tokens": 5851855.0, "step": 2820 }, { "entropy": 5.932426071166992, "epoch": 0.2562590711175617, "grad_norm": 1.265625, "learning_rate": 0.0004996904587984246, "loss": 5.9912, "mean_token_accuracy": 0.13337972834706308, "num_tokens": 5863190.0, "step": 2825 }, { "entropy": 6.019015502929688, "epoch": 0.25671262699564584, "grad_norm": 1.4765625, "learning_rate": 0.0004996887598182636, "loss": 5.9354, "mean_token_accuracy": 0.14033464342355728, "num_tokens": 5873771.0, "step": 2830 }, { "entropy": 5.9573073387146, "epoch": 0.25716618287373005, "grad_norm": 1.1953125, "learning_rate": 0.0004996870561914819, "loss": 5.9239, "mean_token_accuracy": 0.14105542823672296, "num_tokens": 5884449.0, "step": 2835 }, { "entropy": 5.962704849243164, "epoch": 0.2576197387518142, "grad_norm": 1.1796875, "learning_rate": 0.0004996853479181145, "loss": 5.9356, "mean_token_accuracy": 0.14173914715647698, "num_tokens": 5896134.0, "step": 2840 }, { "entropy": 5.9352422714233395, "epoch": 0.2580732946298984, "grad_norm": 1.3359375, "learning_rate": 0.0004996836349981969, "loss": 5.8243, "mean_token_accuracy": 0.14533241838216782, "num_tokens": 5907004.0, "step": 2845 }, { "entropy": 5.864476871490479, "epoch": 0.2585268505079826, "grad_norm": 1.375, "learning_rate": 0.0004996819174317645, "loss": 5.851, "mean_token_accuracy": 0.14395025223493577, "num_tokens": 5917400.0, "step": 2850 }, { "entropy": 5.9380591869354244, "epoch": 0.2589804063860668, "grad_norm": 1.203125, "learning_rate": 0.0004996801952188528, "loss": 5.95, "mean_token_accuracy": 0.13919704630970955, "num_tokens": 5929008.0, "step": 2855 }, { "entropy": 5.842560720443726, "epoch": 0.25943396226415094, "grad_norm": 1.3515625, "learning_rate": 0.0004996784683594973, "loss": 5.8327, "mean_token_accuracy": 0.14070578664541245, "num_tokens": 5939250.0, "step": 2860 }, { "entropy": 5.959221267700196, "epoch": 0.2598875181422351, "grad_norm": 1.40625, "learning_rate": 0.0004996767368537338, "loss": 5.817, "mean_token_accuracy": 0.13839129433035852, "num_tokens": 5950068.0, "step": 2865 }, { "entropy": 5.877241897583008, "epoch": 0.2603410740203193, "grad_norm": 1.3671875, "learning_rate": 0.0004996750007015983, "loss": 5.7696, "mean_token_accuracy": 0.14700621664524077, "num_tokens": 5960847.0, "step": 2870 }, { "entropy": 5.894535636901855, "epoch": 0.26079462989840346, "grad_norm": 1.3515625, "learning_rate": 0.0004996732599031264, "loss": 5.9437, "mean_token_accuracy": 0.1424281269311905, "num_tokens": 5971372.0, "step": 2875 }, { "entropy": 5.862865686416626, "epoch": 0.2612481857764877, "grad_norm": 1.2578125, "learning_rate": 0.0004996715144583543, "loss": 5.8244, "mean_token_accuracy": 0.1482554256916046, "num_tokens": 5981834.0, "step": 2880 }, { "entropy": 5.897699880599975, "epoch": 0.26170174165457183, "grad_norm": 1.4921875, "learning_rate": 0.000499669764367318, "loss": 5.8284, "mean_token_accuracy": 0.1392040655016899, "num_tokens": 5992256.0, "step": 2885 }, { "entropy": 5.846699953079224, "epoch": 0.26215529753265604, "grad_norm": 1.4375, "learning_rate": 0.0004996680096300537, "loss": 5.7288, "mean_token_accuracy": 0.1538042202591896, "num_tokens": 6002965.0, "step": 2890 }, { "entropy": 5.875544452667237, "epoch": 0.2626088534107402, "grad_norm": 1.3671875, "learning_rate": 0.0004996662502465978, "loss": 5.8626, "mean_token_accuracy": 0.14618532732129097, "num_tokens": 6014384.0, "step": 2895 }, { "entropy": 5.852958822250367, "epoch": 0.2630624092888244, "grad_norm": 1.4140625, "learning_rate": 0.0004996644862169864, "loss": 5.8098, "mean_token_accuracy": 0.14801875948905946, "num_tokens": 6024191.0, "step": 2900 }, { "entropy": 5.8199280261993405, "epoch": 0.26351596516690856, "grad_norm": 1.6484375, "learning_rate": 0.0004996627175412563, "loss": 5.8239, "mean_token_accuracy": 0.1518359899520874, "num_tokens": 6035043.0, "step": 2905 }, { "entropy": 5.853754234313965, "epoch": 0.2639695210449927, "grad_norm": 1.2890625, "learning_rate": 0.000499660944219444, "loss": 5.7854, "mean_token_accuracy": 0.14921433106064796, "num_tokens": 6043940.0, "step": 2910 }, { "entropy": 5.8335946559906, "epoch": 0.2644230769230769, "grad_norm": 1.28125, "learning_rate": 0.0004996591662515861, "loss": 5.8371, "mean_token_accuracy": 0.14537594690918923, "num_tokens": 6054338.0, "step": 2915 }, { "entropy": 5.961825037002564, "epoch": 0.2648766328011611, "grad_norm": 1.2578125, "learning_rate": 0.0004996573836377193, "loss": 5.8348, "mean_token_accuracy": 0.13997972533106803, "num_tokens": 6065150.0, "step": 2920 }, { "entropy": 5.930986785888672, "epoch": 0.2653301886792453, "grad_norm": 1.4296875, "learning_rate": 0.0004996555963778806, "loss": 5.9492, "mean_token_accuracy": 0.1413875937461853, "num_tokens": 6076552.0, "step": 2925 }, { "entropy": 5.867830467224121, "epoch": 0.26578374455732945, "grad_norm": 1.1640625, "learning_rate": 0.000499653804472107, "loss": 5.8141, "mean_token_accuracy": 0.14914955347776412, "num_tokens": 6086224.0, "step": 2930 }, { "entropy": 5.865148401260376, "epoch": 0.26623730043541366, "grad_norm": 1.3125, "learning_rate": 0.0004996520079204353, "loss": 5.8759, "mean_token_accuracy": 0.1438009113073349, "num_tokens": 6095607.0, "step": 2935 }, { "entropy": 6.042435073852539, "epoch": 0.2666908563134978, "grad_norm": 1.1484375, "learning_rate": 0.000499650206722903, "loss": 5.869, "mean_token_accuracy": 0.14277777075767517, "num_tokens": 6106338.0, "step": 2940 }, { "entropy": 5.798783254623413, "epoch": 0.267144412191582, "grad_norm": 1.28125, "learning_rate": 0.0004996484008795471, "loss": 5.857, "mean_token_accuracy": 0.1411480873823166, "num_tokens": 6116676.0, "step": 2945 }, { "entropy": 5.893274641036987, "epoch": 0.2675979680696662, "grad_norm": 1.3046875, "learning_rate": 0.000499646590390405, "loss": 5.8818, "mean_token_accuracy": 0.14448646381497382, "num_tokens": 6127104.0, "step": 2950 }, { "entropy": 5.97404203414917, "epoch": 0.26805152394775034, "grad_norm": 1.2109375, "learning_rate": 0.0004996447752555142, "loss": 5.8849, "mean_token_accuracy": 0.14420673102140427, "num_tokens": 6136854.0, "step": 2955 }, { "entropy": 5.874495887756348, "epoch": 0.26850507982583455, "grad_norm": 1.15625, "learning_rate": 0.0004996429554749122, "loss": 5.7478, "mean_token_accuracy": 0.14988255202770234, "num_tokens": 6146949.0, "step": 2960 }, { "entropy": 5.814474868774414, "epoch": 0.2689586357039187, "grad_norm": 1.2890625, "learning_rate": 0.0004996411310486367, "loss": 5.8163, "mean_token_accuracy": 0.14709441363811493, "num_tokens": 6156565.0, "step": 2965 }, { "entropy": 5.8766576766967775, "epoch": 0.2694121915820029, "grad_norm": 1.25, "learning_rate": 0.0004996393019767253, "loss": 5.8539, "mean_token_accuracy": 0.14178219437599182, "num_tokens": 6167547.0, "step": 2970 }, { "entropy": 6.001531267166138, "epoch": 0.26986574746008707, "grad_norm": 1.234375, "learning_rate": 0.0004996374682592158, "loss": 5.8851, "mean_token_accuracy": 0.13923771157860756, "num_tokens": 6177664.0, "step": 2975 }, { "entropy": 5.9096832275390625, "epoch": 0.2703193033381713, "grad_norm": 1.203125, "learning_rate": 0.0004996356298961463, "loss": 5.9059, "mean_token_accuracy": 0.1396166890859604, "num_tokens": 6187917.0, "step": 2980 }, { "entropy": 5.94624695777893, "epoch": 0.27077285921625543, "grad_norm": 1.296875, "learning_rate": 0.0004996337868875549, "loss": 5.7766, "mean_token_accuracy": 0.15335213392972946, "num_tokens": 6197912.0, "step": 2985 }, { "entropy": 5.868017482757568, "epoch": 0.27122641509433965, "grad_norm": 1.2109375, "learning_rate": 0.0004996319392334792, "loss": 5.856, "mean_token_accuracy": 0.14923167005181312, "num_tokens": 6207661.0, "step": 2990 }, { "entropy": 5.830333042144775, "epoch": 0.2716799709724238, "grad_norm": 1.3125, "learning_rate": 0.000499630086933958, "loss": 5.8397, "mean_token_accuracy": 0.14484328925609588, "num_tokens": 6218178.0, "step": 2995 }, { "entropy": 5.951654672622681, "epoch": 0.27213352685050796, "grad_norm": 1.2265625, "learning_rate": 0.0004996282299890292, "loss": 5.9512, "mean_token_accuracy": 0.1427612841129303, "num_tokens": 6229397.0, "step": 3000 }, { "epoch": 0.27213352685050796, "eval_entropy": 5.809842018088604, "eval_loss": 5.885278701782227, "eval_mean_token_accuracy": 0.14895868243152335, "eval_num_tokens": 6229397.0, "eval_runtime": 26.7157, "eval_samples_per_second": 1323.565, "eval_steps_per_second": 165.446, "step": 3000 } ], "logging_steps": 5, "max_steps": 110230, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 3000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 9122521374720000.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }