{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.5442670537010159, "eval_steps": 3000, "global_step": 6000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.691939735412598, "epoch": 0.00045355587808418, "grad_norm": 13.6875, "learning_rate": 2e-06, "loss": 10.8323, "mean_token_accuracy": 0.0, "num_tokens": 9883.0, "step": 5 }, { "entropy": 10.69197416305542, "epoch": 0.00090711175616836, "grad_norm": 12.4375, "learning_rate": 4.5e-06, "loss": 10.7629, "mean_token_accuracy": 0.00031574604799970983, "num_tokens": 20400.0, "step": 10 }, { "entropy": 10.691064357757568, "epoch": 0.00136066763425254, "grad_norm": 9.6875, "learning_rate": 7e-06, "loss": 10.5051, "mean_token_accuracy": 0.027546282985713332, "num_tokens": 31503.0, "step": 15 }, { "entropy": 10.68053970336914, "epoch": 0.00181422351233672, "grad_norm": 6.40625, "learning_rate": 9.5e-06, "loss": 10.1556, "mean_token_accuracy": 0.04329935684800148, "num_tokens": 41648.0, "step": 20 }, { "entropy": 10.629761695861816, "epoch": 0.0022677793904208998, "grad_norm": 4.21875, "learning_rate": 1.2e-05, "loss": 9.8493, "mean_token_accuracy": 0.04506267905235291, "num_tokens": 51580.0, "step": 25 }, { "entropy": 10.582753944396973, "epoch": 0.00272133526850508, "grad_norm": 3.203125, "learning_rate": 1.4500000000000002e-05, "loss": 9.6753, "mean_token_accuracy": 0.046586386114358905, "num_tokens": 61612.0, "step": 30 }, { "entropy": 10.568104076385499, "epoch": 0.00317489114658926, "grad_norm": 2.78125, "learning_rate": 1.7000000000000003e-05, "loss": 9.6287, "mean_token_accuracy": 0.045973442122340204, "num_tokens": 71673.0, "step": 35 }, { "entropy": 10.570516300201415, "epoch": 0.00362844702467344, "grad_norm": 2.6875, "learning_rate": 1.95e-05, "loss": 9.5556, "mean_token_accuracy": 0.05169081836938858, "num_tokens": 81437.0, "step": 40 }, { "entropy": 10.541032028198241, "epoch": 0.00408200290275762, "grad_norm": 2.53125, "learning_rate": 2.2e-05, "loss": 9.5206, "mean_token_accuracy": 0.049654603004455566, "num_tokens": 90827.0, "step": 45 }, { "entropy": 10.549186420440673, "epoch": 0.0045355587808417995, "grad_norm": 2.484375, "learning_rate": 2.4500000000000003e-05, "loss": 9.48, "mean_token_accuracy": 0.05328560955822468, "num_tokens": 100253.0, "step": 50 }, { "entropy": 10.541085529327393, "epoch": 0.00498911465892598, "grad_norm": 2.5, "learning_rate": 2.7e-05, "loss": 9.3843, "mean_token_accuracy": 0.061034252494573595, "num_tokens": 110393.0, "step": 55 }, { "entropy": 10.490248107910157, "epoch": 0.00544267053701016, "grad_norm": 2.4375, "learning_rate": 2.95e-05, "loss": 9.3537, "mean_token_accuracy": 0.060261032357811925, "num_tokens": 121012.0, "step": 60 }, { "entropy": 10.395410060882568, "epoch": 0.00589622641509434, "grad_norm": 2.515625, "learning_rate": 3.2e-05, "loss": 9.287, "mean_token_accuracy": 0.06284476146101951, "num_tokens": 131118.0, "step": 65 }, { "entropy": 10.410375499725342, "epoch": 0.00634978229317852, "grad_norm": 2.34375, "learning_rate": 3.4500000000000005e-05, "loss": 9.1803, "mean_token_accuracy": 0.06393150016665458, "num_tokens": 142145.0, "step": 70 }, { "entropy": 10.449656963348389, "epoch": 0.006803338171262699, "grad_norm": 2.5, "learning_rate": 3.7e-05, "loss": 9.0845, "mean_token_accuracy": 0.06696042232215405, "num_tokens": 152691.0, "step": 75 }, { "entropy": 10.315881538391114, "epoch": 0.00725689404934688, "grad_norm": 2.78125, "learning_rate": 3.95e-05, "loss": 8.9505, "mean_token_accuracy": 0.07629339359700679, "num_tokens": 162278.0, "step": 80 }, { "entropy": 10.312966537475585, "epoch": 0.007710449927431059, "grad_norm": 2.5, "learning_rate": 4.2000000000000004e-05, "loss": 8.8565, "mean_token_accuracy": 0.07719368785619736, "num_tokens": 171942.0, "step": 85 }, { "entropy": 10.19672908782959, "epoch": 0.00816400580551524, "grad_norm": 2.25, "learning_rate": 4.45e-05, "loss": 8.8517, "mean_token_accuracy": 0.07195285111665725, "num_tokens": 183194.0, "step": 90 }, { "entropy": 10.182042503356934, "epoch": 0.00861756168359942, "grad_norm": 2.28125, "learning_rate": 4.7000000000000004e-05, "loss": 8.6574, "mean_token_accuracy": 0.07674754187464713, "num_tokens": 194775.0, "step": 95 }, { "entropy": 10.162378025054931, "epoch": 0.009071117561683599, "grad_norm": 2.34375, "learning_rate": 4.9500000000000004e-05, "loss": 8.6036, "mean_token_accuracy": 0.07473644688725471, "num_tokens": 204720.0, "step": 100 }, { "entropy": 10.052161598205567, "epoch": 0.009524673439767779, "grad_norm": 2.078125, "learning_rate": 5.2e-05, "loss": 8.4531, "mean_token_accuracy": 0.08001778945326805, "num_tokens": 214822.0, "step": 105 }, { "entropy": 10.04954490661621, "epoch": 0.00997822931785196, "grad_norm": 1.890625, "learning_rate": 5.45e-05, "loss": 8.3787, "mean_token_accuracy": 0.07661775350570679, "num_tokens": 225365.0, "step": 110 }, { "entropy": 9.939160346984863, "epoch": 0.01043178519593614, "grad_norm": 1.9375, "learning_rate": 5.7e-05, "loss": 8.282, "mean_token_accuracy": 0.07927817553281784, "num_tokens": 236145.0, "step": 115 }, { "entropy": 9.821665000915527, "epoch": 0.01088534107402032, "grad_norm": 1.8203125, "learning_rate": 5.9499999999999996e-05, "loss": 8.1728, "mean_token_accuracy": 0.08287631459534169, "num_tokens": 247703.0, "step": 120 }, { "entropy": 9.734042263031006, "epoch": 0.011338896952104499, "grad_norm": 1.7265625, "learning_rate": 6.2e-05, "loss": 8.086, "mean_token_accuracy": 0.0859085351228714, "num_tokens": 258291.0, "step": 125 }, { "entropy": 9.552165699005126, "epoch": 0.01179245283018868, "grad_norm": 1.5390625, "learning_rate": 6.450000000000001e-05, "loss": 7.915, "mean_token_accuracy": 0.07912573739886283, "num_tokens": 268784.0, "step": 130 }, { "entropy": 9.39622163772583, "epoch": 0.01224600870827286, "grad_norm": 1.6015625, "learning_rate": 6.7e-05, "loss": 7.8058, "mean_token_accuracy": 0.07961424812674522, "num_tokens": 279135.0, "step": 135 }, { "entropy": 9.229594898223876, "epoch": 0.01269956458635704, "grad_norm": 1.5, "learning_rate": 6.950000000000001e-05, "loss": 7.7052, "mean_token_accuracy": 0.08270319849252701, "num_tokens": 289234.0, "step": 140 }, { "entropy": 8.944133758544922, "epoch": 0.013153120464441219, "grad_norm": 1.6015625, "learning_rate": 7.2e-05, "loss": 7.578, "mean_token_accuracy": 0.08616896718740463, "num_tokens": 299424.0, "step": 145 }, { "entropy": 8.690094184875488, "epoch": 0.013606676342525399, "grad_norm": 1.671875, "learning_rate": 7.45e-05, "loss": 7.4444, "mean_token_accuracy": 0.09042754545807838, "num_tokens": 310040.0, "step": 150 }, { "entropy": 8.549762439727782, "epoch": 0.01406023222060958, "grad_norm": 1.21875, "learning_rate": 7.7e-05, "loss": 7.4418, "mean_token_accuracy": 0.08952978774905204, "num_tokens": 319995.0, "step": 155 }, { "entropy": 8.382944869995118, "epoch": 0.01451378809869376, "grad_norm": 1.0390625, "learning_rate": 7.950000000000001e-05, "loss": 7.3727, "mean_token_accuracy": 0.08898745998740196, "num_tokens": 331212.0, "step": 160 }, { "entropy": 8.153345584869385, "epoch": 0.014967343976777939, "grad_norm": 1.3046875, "learning_rate": 8.2e-05, "loss": 7.3922, "mean_token_accuracy": 0.0851880744099617, "num_tokens": 341435.0, "step": 165 }, { "entropy": 8.16848258972168, "epoch": 0.015420899854862119, "grad_norm": 1.2890625, "learning_rate": 8.450000000000001e-05, "loss": 7.3169, "mean_token_accuracy": 0.09060425236821175, "num_tokens": 351415.0, "step": 170 }, { "entropy": 8.10801820755005, "epoch": 0.0158744557329463, "grad_norm": 1.2734375, "learning_rate": 8.7e-05, "loss": 7.377, "mean_token_accuracy": 0.08710973337292671, "num_tokens": 361862.0, "step": 175 }, { "entropy": 7.906155395507812, "epoch": 0.01632801161103048, "grad_norm": 1.2734375, "learning_rate": 8.95e-05, "loss": 7.2797, "mean_token_accuracy": 0.08494263291358947, "num_tokens": 371658.0, "step": 180 }, { "entropy": 7.864446401596069, "epoch": 0.01678156748911466, "grad_norm": 1.2265625, "learning_rate": 9.2e-05, "loss": 7.2279, "mean_token_accuracy": 0.08928770050406457, "num_tokens": 382288.0, "step": 185 }, { "entropy": 7.861935758590699, "epoch": 0.01723512336719884, "grad_norm": 1.3203125, "learning_rate": 9.45e-05, "loss": 7.3235, "mean_token_accuracy": 0.09150304198265076, "num_tokens": 392852.0, "step": 190 }, { "entropy": 7.856825923919677, "epoch": 0.01768867924528302, "grad_norm": 1.40625, "learning_rate": 9.7e-05, "loss": 7.1984, "mean_token_accuracy": 0.09069699421525002, "num_tokens": 403813.0, "step": 195 }, { "entropy": 7.694656801223755, "epoch": 0.018142235123367198, "grad_norm": 1.234375, "learning_rate": 9.95e-05, "loss": 7.2223, "mean_token_accuracy": 0.08859646022319793, "num_tokens": 414470.0, "step": 200 }, { "entropy": 7.705080652236939, "epoch": 0.018595791001451378, "grad_norm": 1.2265625, "learning_rate": 0.000102, "loss": 7.2239, "mean_token_accuracy": 0.09004590287804604, "num_tokens": 424949.0, "step": 205 }, { "entropy": 7.736959314346313, "epoch": 0.019049346879535557, "grad_norm": 1.2421875, "learning_rate": 0.00010449999999999999, "loss": 7.0639, "mean_token_accuracy": 0.09480814039707183, "num_tokens": 435133.0, "step": 210 }, { "entropy": 7.6014525413513185, "epoch": 0.01950290275761974, "grad_norm": 1.359375, "learning_rate": 0.000107, "loss": 7.1543, "mean_token_accuracy": 0.0943043127655983, "num_tokens": 445789.0, "step": 215 }, { "entropy": 7.600877857208252, "epoch": 0.01995645863570392, "grad_norm": 1.2578125, "learning_rate": 0.0001095, "loss": 7.1506, "mean_token_accuracy": 0.09123467728495598, "num_tokens": 455516.0, "step": 220 }, { "entropy": 7.597001695632935, "epoch": 0.0204100145137881, "grad_norm": 1.2890625, "learning_rate": 0.000112, "loss": 7.1802, "mean_token_accuracy": 0.09758866354823112, "num_tokens": 466350.0, "step": 225 }, { "entropy": 7.643424654006958, "epoch": 0.02086357039187228, "grad_norm": 1.5078125, "learning_rate": 0.0001145, "loss": 7.1326, "mean_token_accuracy": 0.0965645931661129, "num_tokens": 477342.0, "step": 230 }, { "entropy": 7.578091096878052, "epoch": 0.02131712626995646, "grad_norm": 1.484375, "learning_rate": 0.00011700000000000001, "loss": 7.1025, "mean_token_accuracy": 0.09310675337910652, "num_tokens": 487095.0, "step": 235 }, { "entropy": 7.599606895446778, "epoch": 0.02177068214804064, "grad_norm": 1.0703125, "learning_rate": 0.00011949999999999999, "loss": 7.0785, "mean_token_accuracy": 0.09243985787034034, "num_tokens": 498945.0, "step": 240 }, { "entropy": 7.6134318828582765, "epoch": 0.022224238026124818, "grad_norm": 1.3046875, "learning_rate": 0.000122, "loss": 7.1216, "mean_token_accuracy": 0.0947557583451271, "num_tokens": 508863.0, "step": 245 }, { "entropy": 7.505317640304566, "epoch": 0.022677793904208998, "grad_norm": 1.359375, "learning_rate": 0.0001245, "loss": 7.083, "mean_token_accuracy": 0.09349310845136642, "num_tokens": 518887.0, "step": 250 }, { "entropy": 7.506907272338867, "epoch": 0.023131349782293177, "grad_norm": 1.1171875, "learning_rate": 0.000127, "loss": 7.0638, "mean_token_accuracy": 0.0991144374012947, "num_tokens": 529198.0, "step": 255 }, { "entropy": 7.526238584518433, "epoch": 0.02358490566037736, "grad_norm": 1.1328125, "learning_rate": 0.0001295, "loss": 7.0582, "mean_token_accuracy": 0.09299291446805, "num_tokens": 540003.0, "step": 260 }, { "entropy": 7.563022041320801, "epoch": 0.02403846153846154, "grad_norm": 1.3125, "learning_rate": 0.000132, "loss": 7.0378, "mean_token_accuracy": 0.09797687977552413, "num_tokens": 549243.0, "step": 265 }, { "entropy": 7.543271493911743, "epoch": 0.02449201741654572, "grad_norm": 1.15625, "learning_rate": 0.00013450000000000002, "loss": 7.1975, "mean_token_accuracy": 0.09064211472868919, "num_tokens": 559721.0, "step": 270 }, { "entropy": 7.47391448020935, "epoch": 0.0249455732946299, "grad_norm": 1.234375, "learning_rate": 0.00013700000000000002, "loss": 7.0127, "mean_token_accuracy": 0.09864112585783005, "num_tokens": 569034.0, "step": 275 }, { "entropy": 7.420712518692016, "epoch": 0.02539912917271408, "grad_norm": 1.0625, "learning_rate": 0.0001395, "loss": 7.073, "mean_token_accuracy": 0.09223218783736228, "num_tokens": 580082.0, "step": 280 }, { "entropy": 7.422401809692383, "epoch": 0.025852685050798258, "grad_norm": 1.4140625, "learning_rate": 0.00014199999999999998, "loss": 6.9636, "mean_token_accuracy": 0.09520288854837418, "num_tokens": 590326.0, "step": 285 }, { "entropy": 7.595379972457886, "epoch": 0.026306240928882438, "grad_norm": 1.109375, "learning_rate": 0.0001445, "loss": 7.1377, "mean_token_accuracy": 0.0937683179974556, "num_tokens": 601745.0, "step": 290 }, { "entropy": 7.418688154220581, "epoch": 0.026759796806966617, "grad_norm": 1.28125, "learning_rate": 0.000147, "loss": 7.0825, "mean_token_accuracy": 0.09572035521268844, "num_tokens": 612306.0, "step": 295 }, { "entropy": 7.382623720169067, "epoch": 0.027213352685050797, "grad_norm": 1.34375, "learning_rate": 0.0001495, "loss": 7.0017, "mean_token_accuracy": 0.09278988242149352, "num_tokens": 623315.0, "step": 300 }, { "entropy": 7.3942585468292235, "epoch": 0.027666908563134977, "grad_norm": 1.2421875, "learning_rate": 0.000152, "loss": 6.9455, "mean_token_accuracy": 0.09706330373883247, "num_tokens": 632981.0, "step": 305 }, { "entropy": 7.5014002323150635, "epoch": 0.02812046444121916, "grad_norm": 1.3984375, "learning_rate": 0.00015450000000000001, "loss": 6.9848, "mean_token_accuracy": 0.10258090272545814, "num_tokens": 642872.0, "step": 310 }, { "entropy": 7.2068887710571286, "epoch": 0.02857402031930334, "grad_norm": 1.1953125, "learning_rate": 0.000157, "loss": 6.9519, "mean_token_accuracy": 0.09786502793431281, "num_tokens": 652756.0, "step": 315 }, { "entropy": 7.3521472930908205, "epoch": 0.02902757619738752, "grad_norm": 1.3203125, "learning_rate": 0.0001595, "loss": 6.9107, "mean_token_accuracy": 0.09691967144608497, "num_tokens": 663537.0, "step": 320 }, { "entropy": 7.311666536331177, "epoch": 0.0294811320754717, "grad_norm": 1.4375, "learning_rate": 0.000162, "loss": 6.915, "mean_token_accuracy": 0.0960552416741848, "num_tokens": 673811.0, "step": 325 }, { "entropy": 7.272817134857178, "epoch": 0.029934687953555878, "grad_norm": 1.15625, "learning_rate": 0.00016450000000000001, "loss": 6.91, "mean_token_accuracy": 0.09867974072694778, "num_tokens": 683733.0, "step": 330 }, { "entropy": 7.3990702629089355, "epoch": 0.030388243831640058, "grad_norm": 1.1171875, "learning_rate": 0.00016700000000000002, "loss": 6.9882, "mean_token_accuracy": 0.09951149746775627, "num_tokens": 693110.0, "step": 335 }, { "entropy": 7.159088897705078, "epoch": 0.030841799709724237, "grad_norm": 1.203125, "learning_rate": 0.00016950000000000003, "loss": 6.7683, "mean_token_accuracy": 0.10487765744328499, "num_tokens": 703808.0, "step": 340 }, { "entropy": 7.251721620559692, "epoch": 0.03129535558780842, "grad_norm": 1.1171875, "learning_rate": 0.00017199999999999998, "loss": 6.9813, "mean_token_accuracy": 0.09775393083691597, "num_tokens": 715701.0, "step": 345 }, { "entropy": 7.248662281036377, "epoch": 0.0317489114658926, "grad_norm": 1.5625, "learning_rate": 0.00017449999999999999, "loss": 6.8396, "mean_token_accuracy": 0.10250790566205978, "num_tokens": 725635.0, "step": 350 }, { "entropy": 7.2260857105255125, "epoch": 0.032202467343976776, "grad_norm": 1.203125, "learning_rate": 0.000177, "loss": 6.8703, "mean_token_accuracy": 0.0953724816441536, "num_tokens": 734827.0, "step": 355 }, { "entropy": 7.1952399730682375, "epoch": 0.03265602322206096, "grad_norm": 1.09375, "learning_rate": 0.0001795, "loss": 6.7781, "mean_token_accuracy": 0.10356629341840744, "num_tokens": 744916.0, "step": 360 }, { "entropy": 7.194821214675903, "epoch": 0.033109579100145135, "grad_norm": 1.2890625, "learning_rate": 0.000182, "loss": 6.8991, "mean_token_accuracy": 0.10033663883805274, "num_tokens": 756021.0, "step": 365 }, { "entropy": 7.260288143157959, "epoch": 0.03356313497822932, "grad_norm": 1.2265625, "learning_rate": 0.0001845, "loss": 6.9113, "mean_token_accuracy": 0.0992978885769844, "num_tokens": 766513.0, "step": 370 }, { "entropy": 7.201397514343261, "epoch": 0.034016690856313495, "grad_norm": 1.4296875, "learning_rate": 0.000187, "loss": 6.8958, "mean_token_accuracy": 0.0985984705388546, "num_tokens": 776049.0, "step": 375 }, { "entropy": 7.044051551818848, "epoch": 0.03447024673439768, "grad_norm": 1.2421875, "learning_rate": 0.0001895, "loss": 6.8231, "mean_token_accuracy": 0.10297032371163369, "num_tokens": 786736.0, "step": 380 }, { "entropy": 7.260237407684326, "epoch": 0.03492380261248186, "grad_norm": 1.203125, "learning_rate": 0.000192, "loss": 6.8279, "mean_token_accuracy": 0.09664658829569817, "num_tokens": 797550.0, "step": 385 }, { "entropy": 7.245859956741333, "epoch": 0.03537735849056604, "grad_norm": 1.0546875, "learning_rate": 0.0001945, "loss": 6.8971, "mean_token_accuracy": 0.09864228665828705, "num_tokens": 808382.0, "step": 390 }, { "entropy": 7.1667686939239506, "epoch": 0.03583091436865022, "grad_norm": 1.0859375, "learning_rate": 0.00019700000000000002, "loss": 6.8204, "mean_token_accuracy": 0.10059952437877655, "num_tokens": 819223.0, "step": 395 }, { "entropy": 7.2114091396331785, "epoch": 0.036284470246734396, "grad_norm": 1.1328125, "learning_rate": 0.00019950000000000002, "loss": 6.8042, "mean_token_accuracy": 0.09473831579089165, "num_tokens": 828994.0, "step": 400 }, { "entropy": 7.191949510574341, "epoch": 0.03673802612481858, "grad_norm": 1.171875, "learning_rate": 0.000202, "loss": 6.9443, "mean_token_accuracy": 0.09205318689346313, "num_tokens": 840333.0, "step": 405 }, { "entropy": 7.121156358718872, "epoch": 0.037191582002902755, "grad_norm": 1.2421875, "learning_rate": 0.00020449999999999998, "loss": 6.7293, "mean_token_accuracy": 0.10459425449371337, "num_tokens": 851033.0, "step": 410 }, { "entropy": 7.063291597366333, "epoch": 0.03764513788098694, "grad_norm": 1.2734375, "learning_rate": 0.000207, "loss": 6.7723, "mean_token_accuracy": 0.09623789712786675, "num_tokens": 861588.0, "step": 415 }, { "entropy": 7.116500473022461, "epoch": 0.038098693759071114, "grad_norm": 1.1875, "learning_rate": 0.0002095, "loss": 6.8824, "mean_token_accuracy": 0.10527986362576484, "num_tokens": 871401.0, "step": 420 }, { "entropy": 7.107698678970337, "epoch": 0.0385522496371553, "grad_norm": 1.09375, "learning_rate": 0.000212, "loss": 6.798, "mean_token_accuracy": 0.09808883890509605, "num_tokens": 881948.0, "step": 425 }, { "entropy": 7.093855142593384, "epoch": 0.03900580551523948, "grad_norm": 1.2890625, "learning_rate": 0.0002145, "loss": 6.7499, "mean_token_accuracy": 0.10276206359267234, "num_tokens": 891624.0, "step": 430 }, { "entropy": 7.118248414993286, "epoch": 0.03945936139332366, "grad_norm": 1.1015625, "learning_rate": 0.00021700000000000002, "loss": 6.8649, "mean_token_accuracy": 0.09989958107471467, "num_tokens": 902468.0, "step": 435 }, { "entropy": 7.01951036453247, "epoch": 0.03991291727140784, "grad_norm": 1.0546875, "learning_rate": 0.0002195, "loss": 6.7933, "mean_token_accuracy": 0.10295612290501595, "num_tokens": 912508.0, "step": 440 }, { "entropy": 7.089923477172851, "epoch": 0.040366473149492016, "grad_norm": 1.1015625, "learning_rate": 0.000222, "loss": 6.8227, "mean_token_accuracy": 0.10121235325932502, "num_tokens": 923728.0, "step": 445 }, { "entropy": 7.064526224136353, "epoch": 0.0408200290275762, "grad_norm": 1.3828125, "learning_rate": 0.0002245, "loss": 6.7884, "mean_token_accuracy": 0.10058841332793236, "num_tokens": 933197.0, "step": 450 }, { "entropy": 6.956214904785156, "epoch": 0.041273584905660375, "grad_norm": 1.2109375, "learning_rate": 0.00022700000000000002, "loss": 6.5999, "mean_token_accuracy": 0.10817481204867363, "num_tokens": 943385.0, "step": 455 }, { "entropy": 6.93480110168457, "epoch": 0.04172714078374456, "grad_norm": 1.15625, "learning_rate": 0.00022950000000000002, "loss": 6.6521, "mean_token_accuracy": 0.10884237810969352, "num_tokens": 952674.0, "step": 460 }, { "entropy": 6.947038888931274, "epoch": 0.042180696661828734, "grad_norm": 1.203125, "learning_rate": 0.00023200000000000003, "loss": 6.7395, "mean_token_accuracy": 0.10702011436223983, "num_tokens": 962406.0, "step": 465 }, { "entropy": 7.075675964355469, "epoch": 0.04263425253991292, "grad_norm": 1.1875, "learning_rate": 0.00023449999999999998, "loss": 6.759, "mean_token_accuracy": 0.10087487250566482, "num_tokens": 973131.0, "step": 470 }, { "entropy": 6.923453664779663, "epoch": 0.0430878084179971, "grad_norm": 1.2109375, "learning_rate": 0.000237, "loss": 6.6279, "mean_token_accuracy": 0.10887465253472328, "num_tokens": 982777.0, "step": 475 }, { "entropy": 6.913258600234985, "epoch": 0.04354136429608128, "grad_norm": 1.1171875, "learning_rate": 0.0002395, "loss": 6.7205, "mean_token_accuracy": 0.0963176041841507, "num_tokens": 994498.0, "step": 480 }, { "entropy": 6.931819868087769, "epoch": 0.04399492017416546, "grad_norm": 1.3125, "learning_rate": 0.000242, "loss": 6.7911, "mean_token_accuracy": 0.1031719870865345, "num_tokens": 1004256.0, "step": 485 }, { "entropy": 7.00779275894165, "epoch": 0.044448476052249636, "grad_norm": 1.171875, "learning_rate": 0.0002445, "loss": 6.7541, "mean_token_accuracy": 0.09925626143813134, "num_tokens": 1015172.0, "step": 490 }, { "entropy": 6.965081644058228, "epoch": 0.04490203193033382, "grad_norm": 1.4765625, "learning_rate": 0.000247, "loss": 6.6909, "mean_token_accuracy": 0.10554371923208236, "num_tokens": 1025636.0, "step": 495 }, { "entropy": 6.928272819519043, "epoch": 0.045355587808417995, "grad_norm": 1.1796875, "learning_rate": 0.0002495, "loss": 6.7203, "mean_token_accuracy": 0.11081329062581062, "num_tokens": 1035674.0, "step": 500 }, { "entropy": 6.931467914581299, "epoch": 0.04580914368650218, "grad_norm": 0.99609375, "learning_rate": 0.000252, "loss": 6.6966, "mean_token_accuracy": 0.10857350751757622, "num_tokens": 1045643.0, "step": 505 }, { "entropy": 6.945031785964966, "epoch": 0.046262699564586354, "grad_norm": 1.0703125, "learning_rate": 0.0002545, "loss": 6.6697, "mean_token_accuracy": 0.10533757880330086, "num_tokens": 1056543.0, "step": 510 }, { "entropy": 6.877411794662476, "epoch": 0.04671625544267054, "grad_norm": 1.234375, "learning_rate": 0.000257, "loss": 6.6419, "mean_token_accuracy": 0.10245436802506447, "num_tokens": 1066828.0, "step": 515 }, { "entropy": 6.901714277267456, "epoch": 0.04716981132075472, "grad_norm": 1.1875, "learning_rate": 0.0002595, "loss": 6.6714, "mean_token_accuracy": 0.10999734550714493, "num_tokens": 1076230.0, "step": 520 }, { "entropy": 6.883963012695313, "epoch": 0.047623367198838897, "grad_norm": 1.1171875, "learning_rate": 0.000262, "loss": 6.707, "mean_token_accuracy": 0.10455554500222206, "num_tokens": 1086430.0, "step": 525 }, { "entropy": 6.921725177764893, "epoch": 0.04807692307692308, "grad_norm": 1.078125, "learning_rate": 0.00026450000000000003, "loss": 6.6064, "mean_token_accuracy": 0.11501444876194, "num_tokens": 1096403.0, "step": 530 }, { "entropy": 6.7906153202056885, "epoch": 0.048530478955007256, "grad_norm": 1.1953125, "learning_rate": 0.00026700000000000004, "loss": 6.5687, "mean_token_accuracy": 0.11038950607180595, "num_tokens": 1107289.0, "step": 535 }, { "entropy": 6.942843580245972, "epoch": 0.04898403483309144, "grad_norm": 1.1953125, "learning_rate": 0.00026950000000000005, "loss": 6.7614, "mean_token_accuracy": 0.09955370277166367, "num_tokens": 1118301.0, "step": 540 }, { "entropy": 6.997049474716187, "epoch": 0.049437590711175615, "grad_norm": 1.203125, "learning_rate": 0.00027200000000000005, "loss": 6.737, "mean_token_accuracy": 0.10176396444439888, "num_tokens": 1129002.0, "step": 545 }, { "entropy": 6.818488597869873, "epoch": 0.0498911465892598, "grad_norm": 1.1328125, "learning_rate": 0.0002745, "loss": 6.7196, "mean_token_accuracy": 0.10543971955776214, "num_tokens": 1139415.0, "step": 550 }, { "entropy": 6.8720558166503904, "epoch": 0.050344702467343974, "grad_norm": 1.0625, "learning_rate": 0.000277, "loss": 6.6889, "mean_token_accuracy": 0.10523920580744743, "num_tokens": 1151231.0, "step": 555 }, { "entropy": 6.720426321029663, "epoch": 0.05079825834542816, "grad_norm": 1.1328125, "learning_rate": 0.0002795, "loss": 6.5739, "mean_token_accuracy": 0.10560568794608116, "num_tokens": 1161643.0, "step": 560 }, { "entropy": 6.868243741989136, "epoch": 0.05125181422351233, "grad_norm": 1.2109375, "learning_rate": 0.00028199999999999997, "loss": 6.624, "mean_token_accuracy": 0.10310710221529007, "num_tokens": 1173362.0, "step": 565 }, { "entropy": 6.858621978759766, "epoch": 0.051705370101596516, "grad_norm": 1.09375, "learning_rate": 0.0002845, "loss": 6.629, "mean_token_accuracy": 0.10223327353596687, "num_tokens": 1184812.0, "step": 570 }, { "entropy": 6.851276063919068, "epoch": 0.0521589259796807, "grad_norm": 1.140625, "learning_rate": 0.000287, "loss": 6.5943, "mean_token_accuracy": 0.1135420560836792, "num_tokens": 1195556.0, "step": 575 }, { "entropy": 6.787323379516602, "epoch": 0.052612481857764876, "grad_norm": 1.1328125, "learning_rate": 0.0002895, "loss": 6.6018, "mean_token_accuracy": 0.11323990225791931, "num_tokens": 1206735.0, "step": 580 }, { "entropy": 6.803449630737305, "epoch": 0.05306603773584906, "grad_norm": 1.109375, "learning_rate": 0.000292, "loss": 6.7011, "mean_token_accuracy": 0.10117989927530288, "num_tokens": 1216778.0, "step": 585 }, { "entropy": 6.848930168151855, "epoch": 0.053519593613933235, "grad_norm": 1.125, "learning_rate": 0.0002945, "loss": 6.6297, "mean_token_accuracy": 0.1108930803835392, "num_tokens": 1227462.0, "step": 590 }, { "entropy": 6.823454809188843, "epoch": 0.05397314949201742, "grad_norm": 1.1875, "learning_rate": 0.000297, "loss": 6.6961, "mean_token_accuracy": 0.10993156135082245, "num_tokens": 1237378.0, "step": 595 }, { "entropy": 6.806218099594116, "epoch": 0.054426705370101594, "grad_norm": 1.140625, "learning_rate": 0.0002995, "loss": 6.6763, "mean_token_accuracy": 0.10614893436431885, "num_tokens": 1247599.0, "step": 600 }, { "entropy": 6.748168039321899, "epoch": 0.05488026124818578, "grad_norm": 1.140625, "learning_rate": 0.000302, "loss": 6.5415, "mean_token_accuracy": 0.10683367103338241, "num_tokens": 1257989.0, "step": 605 }, { "entropy": 6.828956031799317, "epoch": 0.05533381712626995, "grad_norm": 1.0703125, "learning_rate": 0.0003045, "loss": 6.6517, "mean_token_accuracy": 0.10376828461885453, "num_tokens": 1269313.0, "step": 610 }, { "entropy": 6.829959964752197, "epoch": 0.055787373004354136, "grad_norm": 1.2265625, "learning_rate": 0.000307, "loss": 6.6361, "mean_token_accuracy": 0.10490350201725959, "num_tokens": 1280422.0, "step": 615 }, { "entropy": 6.7708775997161865, "epoch": 0.05624092888243832, "grad_norm": 1.2421875, "learning_rate": 0.0003095, "loss": 6.6623, "mean_token_accuracy": 0.10884316489100457, "num_tokens": 1289482.0, "step": 620 }, { "entropy": 6.763772773742676, "epoch": 0.056694484760522496, "grad_norm": 1.078125, "learning_rate": 0.000312, "loss": 6.6181, "mean_token_accuracy": 0.10594562590122222, "num_tokens": 1299782.0, "step": 625 }, { "entropy": 6.758108377456665, "epoch": 0.05714804063860668, "grad_norm": 1.171875, "learning_rate": 0.0003145, "loss": 6.5993, "mean_token_accuracy": 0.11340658813714981, "num_tokens": 1311628.0, "step": 630 }, { "entropy": 6.796287631988525, "epoch": 0.057601596516690855, "grad_norm": 1.140625, "learning_rate": 0.000317, "loss": 6.655, "mean_token_accuracy": 0.10296097546815872, "num_tokens": 1322456.0, "step": 635 }, { "entropy": 6.721327924728394, "epoch": 0.05805515239477504, "grad_norm": 1.09375, "learning_rate": 0.0003195, "loss": 6.5153, "mean_token_accuracy": 0.11600816994905472, "num_tokens": 1331737.0, "step": 640 }, { "entropy": 6.746915245056153, "epoch": 0.058508708272859214, "grad_norm": 1.3359375, "learning_rate": 0.000322, "loss": 6.5369, "mean_token_accuracy": 0.10856858938932419, "num_tokens": 1341236.0, "step": 645 }, { "entropy": 6.563586473464966, "epoch": 0.0589622641509434, "grad_norm": 1.15625, "learning_rate": 0.00032450000000000003, "loss": 6.5459, "mean_token_accuracy": 0.11117523983120918, "num_tokens": 1352885.0, "step": 650 }, { "entropy": 6.767751598358155, "epoch": 0.05941582002902757, "grad_norm": 0.96875, "learning_rate": 0.00032700000000000003, "loss": 6.5208, "mean_token_accuracy": 0.10883594155311585, "num_tokens": 1363455.0, "step": 655 }, { "entropy": 6.698432683944702, "epoch": 0.059869375907111756, "grad_norm": 1.1328125, "learning_rate": 0.00032950000000000004, "loss": 6.5548, "mean_token_accuracy": 0.11928504556417466, "num_tokens": 1373176.0, "step": 660 }, { "entropy": 6.799010419845581, "epoch": 0.06032293178519594, "grad_norm": 1.28125, "learning_rate": 0.00033200000000000005, "loss": 6.6198, "mean_token_accuracy": 0.10528008192777634, "num_tokens": 1383122.0, "step": 665 }, { "entropy": 6.690959692001343, "epoch": 0.060776487663280115, "grad_norm": 1.21875, "learning_rate": 0.00033450000000000005, "loss": 6.4729, "mean_token_accuracy": 0.11281677708029747, "num_tokens": 1392889.0, "step": 670 }, { "entropy": 6.623794364929199, "epoch": 0.0612300435413643, "grad_norm": 1.1953125, "learning_rate": 0.000337, "loss": 6.5809, "mean_token_accuracy": 0.10769900307059288, "num_tokens": 1403450.0, "step": 675 }, { "entropy": 6.742135953903198, "epoch": 0.061683599419448475, "grad_norm": 1.1953125, "learning_rate": 0.0003395, "loss": 6.6187, "mean_token_accuracy": 0.1039137601852417, "num_tokens": 1414075.0, "step": 680 }, { "entropy": 6.662317562103271, "epoch": 0.06213715529753266, "grad_norm": 1.0234375, "learning_rate": 0.000342, "loss": 6.5274, "mean_token_accuracy": 0.10077093541622162, "num_tokens": 1424376.0, "step": 685 }, { "entropy": 6.750758123397827, "epoch": 0.06259071117561683, "grad_norm": 1.1484375, "learning_rate": 0.00034449999999999997, "loss": 6.512, "mean_token_accuracy": 0.11837425976991653, "num_tokens": 1433780.0, "step": 690 }, { "entropy": 6.588320541381836, "epoch": 0.06304426705370102, "grad_norm": 0.98046875, "learning_rate": 0.000347, "loss": 6.5228, "mean_token_accuracy": 0.1112312689423561, "num_tokens": 1444179.0, "step": 695 }, { "entropy": 6.737683391571045, "epoch": 0.0634978229317852, "grad_norm": 1.1328125, "learning_rate": 0.0003495, "loss": 6.5988, "mean_token_accuracy": 0.10832765325903893, "num_tokens": 1455342.0, "step": 700 }, { "entropy": 6.5270322322845455, "epoch": 0.06395137880986937, "grad_norm": 1.125, "learning_rate": 0.000352, "loss": 6.4367, "mean_token_accuracy": 0.11744177639484406, "num_tokens": 1465007.0, "step": 705 }, { "entropy": 6.8013591289520265, "epoch": 0.06440493468795355, "grad_norm": 1.2890625, "learning_rate": 0.0003545, "loss": 6.6072, "mean_token_accuracy": 0.11265634968876839, "num_tokens": 1474658.0, "step": 710 }, { "entropy": 6.754550743103027, "epoch": 0.06485849056603774, "grad_norm": 1.0625, "learning_rate": 0.000357, "loss": 6.6558, "mean_token_accuracy": 0.10501691550016404, "num_tokens": 1485366.0, "step": 715 }, { "entropy": 6.6456946849823, "epoch": 0.06531204644412192, "grad_norm": 1.1796875, "learning_rate": 0.0003595, "loss": 6.5397, "mean_token_accuracy": 0.11587660536170005, "num_tokens": 1496931.0, "step": 720 }, { "entropy": 6.688676929473877, "epoch": 0.0657656023222061, "grad_norm": 1.171875, "learning_rate": 0.000362, "loss": 6.5915, "mean_token_accuracy": 0.11367620155215263, "num_tokens": 1507134.0, "step": 725 }, { "entropy": 6.569495010375976, "epoch": 0.06621915820029027, "grad_norm": 1.171875, "learning_rate": 0.0003645, "loss": 6.492, "mean_token_accuracy": 0.11305128559470176, "num_tokens": 1516558.0, "step": 730 }, { "entropy": 6.637685918807984, "epoch": 0.06667271407837445, "grad_norm": 1.1171875, "learning_rate": 0.000367, "loss": 6.5268, "mean_token_accuracy": 0.11118611544370652, "num_tokens": 1526373.0, "step": 735 }, { "entropy": 6.5918787002563475, "epoch": 0.06712626995645864, "grad_norm": 1.2109375, "learning_rate": 0.0003695, "loss": 6.4146, "mean_token_accuracy": 0.11430680304765702, "num_tokens": 1536431.0, "step": 740 }, { "entropy": 6.4868128299713135, "epoch": 0.06757982583454282, "grad_norm": 1.2265625, "learning_rate": 0.000372, "loss": 6.3912, "mean_token_accuracy": 0.11714110746979714, "num_tokens": 1546428.0, "step": 745 }, { "entropy": 6.633748626708984, "epoch": 0.06803338171262699, "grad_norm": 1.046875, "learning_rate": 0.0003745, "loss": 6.5954, "mean_token_accuracy": 0.10997304171323777, "num_tokens": 1557299.0, "step": 750 }, { "entropy": 6.572169256210327, "epoch": 0.06848693759071117, "grad_norm": 1.125, "learning_rate": 0.000377, "loss": 6.5201, "mean_token_accuracy": 0.11121420338749885, "num_tokens": 1567629.0, "step": 755 }, { "entropy": 6.670825052261352, "epoch": 0.06894049346879536, "grad_norm": 1.1875, "learning_rate": 0.0003795, "loss": 6.567, "mean_token_accuracy": 0.10907985046505927, "num_tokens": 1578305.0, "step": 760 }, { "entropy": 6.6835836410522464, "epoch": 0.06939404934687954, "grad_norm": 1.0859375, "learning_rate": 0.000382, "loss": 6.5758, "mean_token_accuracy": 0.10975592210888863, "num_tokens": 1588843.0, "step": 765 }, { "entropy": 6.6111774921417235, "epoch": 0.06984760522496372, "grad_norm": 1.1640625, "learning_rate": 0.0003845, "loss": 6.5869, "mean_token_accuracy": 0.10726779997348786, "num_tokens": 1599144.0, "step": 770 }, { "entropy": 6.559026432037354, "epoch": 0.07030116110304789, "grad_norm": 1.078125, "learning_rate": 0.00038700000000000003, "loss": 6.5004, "mean_token_accuracy": 0.11508158072829247, "num_tokens": 1608933.0, "step": 775 }, { "entropy": 6.675729131698608, "epoch": 0.07075471698113207, "grad_norm": 1.15625, "learning_rate": 0.00038950000000000003, "loss": 6.4774, "mean_token_accuracy": 0.11884681731462479, "num_tokens": 1618926.0, "step": 780 }, { "entropy": 6.550394296646118, "epoch": 0.07120827285921626, "grad_norm": 1.1171875, "learning_rate": 0.00039200000000000004, "loss": 6.4787, "mean_token_accuracy": 0.11670367419719696, "num_tokens": 1628810.0, "step": 785 }, { "entropy": 6.621820545196533, "epoch": 0.07166182873730044, "grad_norm": 1.234375, "learning_rate": 0.00039450000000000005, "loss": 6.5208, "mean_token_accuracy": 0.11667616367340088, "num_tokens": 1638087.0, "step": 790 }, { "entropy": 6.551448202133178, "epoch": 0.07211538461538461, "grad_norm": 1.046875, "learning_rate": 0.00039700000000000005, "loss": 6.5028, "mean_token_accuracy": 0.11246806755661964, "num_tokens": 1648901.0, "step": 795 }, { "entropy": 6.536881732940674, "epoch": 0.07256894049346879, "grad_norm": 0.97265625, "learning_rate": 0.0003995, "loss": 6.4789, "mean_token_accuracy": 0.11289835795760154, "num_tokens": 1659520.0, "step": 800 }, { "entropy": 6.606709718704224, "epoch": 0.07302249637155298, "grad_norm": 1.046875, "learning_rate": 0.000402, "loss": 6.5056, "mean_token_accuracy": 0.11811064779758454, "num_tokens": 1670368.0, "step": 805 }, { "entropy": 6.547958660125732, "epoch": 0.07347605224963716, "grad_norm": 1.0234375, "learning_rate": 0.0004045, "loss": 6.4255, "mean_token_accuracy": 0.11519890055060386, "num_tokens": 1680566.0, "step": 810 }, { "entropy": 6.525753402709961, "epoch": 0.07392960812772134, "grad_norm": 1.0078125, "learning_rate": 0.00040699999999999997, "loss": 6.4451, "mean_token_accuracy": 0.1210486575961113, "num_tokens": 1690360.0, "step": 815 }, { "entropy": 6.6042615413665775, "epoch": 0.07438316400580551, "grad_norm": 1.109375, "learning_rate": 0.0004095, "loss": 6.5412, "mean_token_accuracy": 0.11525689661502839, "num_tokens": 1700558.0, "step": 820 }, { "entropy": 6.546953964233398, "epoch": 0.0748367198838897, "grad_norm": 1.171875, "learning_rate": 0.000412, "loss": 6.4773, "mean_token_accuracy": 0.1132320411503315, "num_tokens": 1711067.0, "step": 825 }, { "entropy": 6.471474742889404, "epoch": 0.07529027576197388, "grad_norm": 1.203125, "learning_rate": 0.0004145, "loss": 6.4551, "mean_token_accuracy": 0.11387050226330757, "num_tokens": 1721083.0, "step": 830 }, { "entropy": 6.426329278945923, "epoch": 0.07574383164005806, "grad_norm": 1.046875, "learning_rate": 0.000417, "loss": 6.387, "mean_token_accuracy": 0.11764025613665581, "num_tokens": 1731395.0, "step": 835 }, { "entropy": 6.560748338699341, "epoch": 0.07619738751814223, "grad_norm": 1.171875, "learning_rate": 0.0004195, "loss": 6.4163, "mean_token_accuracy": 0.12031056880950927, "num_tokens": 1741650.0, "step": 840 }, { "entropy": 6.521653699874878, "epoch": 0.07665094339622641, "grad_norm": 1.0, "learning_rate": 0.000422, "loss": 6.4952, "mean_token_accuracy": 0.11156592816114426, "num_tokens": 1752775.0, "step": 845 }, { "entropy": 6.523869276046753, "epoch": 0.0771044992743106, "grad_norm": 0.9921875, "learning_rate": 0.0004245, "loss": 6.5518, "mean_token_accuracy": 0.10881832614541054, "num_tokens": 1763635.0, "step": 850 }, { "entropy": 6.519516324996948, "epoch": 0.07755805515239478, "grad_norm": 1.0234375, "learning_rate": 0.000427, "loss": 6.4713, "mean_token_accuracy": 0.11356355622410774, "num_tokens": 1773519.0, "step": 855 }, { "entropy": 6.527148103713989, "epoch": 0.07801161103047896, "grad_norm": 1.1875, "learning_rate": 0.0004295, "loss": 6.4688, "mean_token_accuracy": 0.11615480259060859, "num_tokens": 1783643.0, "step": 860 }, { "entropy": 6.563126754760742, "epoch": 0.07846516690856313, "grad_norm": 1.109375, "learning_rate": 0.000432, "loss": 6.4573, "mean_token_accuracy": 0.11113109216094016, "num_tokens": 1794175.0, "step": 865 }, { "entropy": 6.464490938186645, "epoch": 0.07891872278664731, "grad_norm": 1.109375, "learning_rate": 0.0004345, "loss": 6.3923, "mean_token_accuracy": 0.11603446528315545, "num_tokens": 1804455.0, "step": 870 }, { "entropy": 6.563748025894165, "epoch": 0.0793722786647315, "grad_norm": 1.1015625, "learning_rate": 0.000437, "loss": 6.5214, "mean_token_accuracy": 0.10870628133416176, "num_tokens": 1816711.0, "step": 875 }, { "entropy": 6.4233174324035645, "epoch": 0.07982583454281568, "grad_norm": 1.1328125, "learning_rate": 0.0004395, "loss": 6.3755, "mean_token_accuracy": 0.11397543773055077, "num_tokens": 1827110.0, "step": 880 }, { "entropy": 6.4231466293334964, "epoch": 0.08027939042089985, "grad_norm": 1.15625, "learning_rate": 0.000442, "loss": 6.3352, "mean_token_accuracy": 0.11892382502555847, "num_tokens": 1837131.0, "step": 885 }, { "entropy": 6.53260645866394, "epoch": 0.08073294629898403, "grad_norm": 1.203125, "learning_rate": 0.0004445, "loss": 6.4013, "mean_token_accuracy": 0.11561454683542252, "num_tokens": 1847487.0, "step": 890 }, { "entropy": 6.347210311889649, "epoch": 0.08118650217706821, "grad_norm": 1.0859375, "learning_rate": 0.000447, "loss": 6.3894, "mean_token_accuracy": 0.11477004811167717, "num_tokens": 1857846.0, "step": 895 }, { "entropy": 6.445382356643677, "epoch": 0.0816400580551524, "grad_norm": 1.0859375, "learning_rate": 0.00044950000000000003, "loss": 6.4744, "mean_token_accuracy": 0.11803903207182884, "num_tokens": 1868917.0, "step": 900 }, { "entropy": 6.475826025009155, "epoch": 0.08209361393323658, "grad_norm": 1.078125, "learning_rate": 0.00045200000000000004, "loss": 6.3185, "mean_token_accuracy": 0.12133634760975838, "num_tokens": 1878702.0, "step": 905 }, { "entropy": 6.4152826309204105, "epoch": 0.08254716981132075, "grad_norm": 0.97265625, "learning_rate": 0.00045450000000000004, "loss": 6.4281, "mean_token_accuracy": 0.11487874239683152, "num_tokens": 1888818.0, "step": 910 }, { "entropy": 6.452651023864746, "epoch": 0.08300072568940493, "grad_norm": 0.9921875, "learning_rate": 0.00045700000000000005, "loss": 6.4189, "mean_token_accuracy": 0.11924608796834946, "num_tokens": 1899418.0, "step": 915 }, { "entropy": 6.365463924407959, "epoch": 0.08345428156748912, "grad_norm": 1.1796875, "learning_rate": 0.00045950000000000006, "loss": 6.3128, "mean_token_accuracy": 0.12437145933508872, "num_tokens": 1909747.0, "step": 920 }, { "entropy": 6.544213724136353, "epoch": 0.0839078374455733, "grad_norm": 1.0234375, "learning_rate": 0.000462, "loss": 6.5157, "mean_token_accuracy": 0.11182530298829078, "num_tokens": 1920580.0, "step": 925 }, { "entropy": 6.49947943687439, "epoch": 0.08436139332365747, "grad_norm": 1.03125, "learning_rate": 0.0004645, "loss": 6.4255, "mean_token_accuracy": 0.11744101867079734, "num_tokens": 1930924.0, "step": 930 }, { "entropy": 6.417445230484009, "epoch": 0.08481494920174165, "grad_norm": 1.1640625, "learning_rate": 0.000467, "loss": 6.4568, "mean_token_accuracy": 0.11753653734922409, "num_tokens": 1943110.0, "step": 935 }, { "entropy": 6.492831611633301, "epoch": 0.08526850507982583, "grad_norm": 1.171875, "learning_rate": 0.0004695, "loss": 6.3711, "mean_token_accuracy": 0.11840087100863457, "num_tokens": 1952620.0, "step": 940 }, { "entropy": 6.451150608062744, "epoch": 0.08572206095791002, "grad_norm": 1.0078125, "learning_rate": 0.000472, "loss": 6.4812, "mean_token_accuracy": 0.11905809268355369, "num_tokens": 1962893.0, "step": 945 }, { "entropy": 6.375366497039795, "epoch": 0.0861756168359942, "grad_norm": 1.1171875, "learning_rate": 0.0004745, "loss": 6.3692, "mean_token_accuracy": 0.1131294883787632, "num_tokens": 1973455.0, "step": 950 }, { "entropy": 6.364347743988037, "epoch": 0.08662917271407837, "grad_norm": 1.140625, "learning_rate": 0.000477, "loss": 6.3287, "mean_token_accuracy": 0.12613395005464553, "num_tokens": 1983559.0, "step": 955 }, { "entropy": 6.371630477905273, "epoch": 0.08708272859216255, "grad_norm": 1.0703125, "learning_rate": 0.0004795, "loss": 6.3393, "mean_token_accuracy": 0.12109395638108253, "num_tokens": 1994630.0, "step": 960 }, { "entropy": 6.490744590759277, "epoch": 0.08753628447024674, "grad_norm": 1.03125, "learning_rate": 0.000482, "loss": 6.4846, "mean_token_accuracy": 0.12091940119862557, "num_tokens": 2005225.0, "step": 965 }, { "entropy": 6.43569803237915, "epoch": 0.08798984034833092, "grad_norm": 1.046875, "learning_rate": 0.0004845, "loss": 6.4423, "mean_token_accuracy": 0.11586240753531456, "num_tokens": 2016431.0, "step": 970 }, { "entropy": 6.4423645496368405, "epoch": 0.08844339622641509, "grad_norm": 1.125, "learning_rate": 0.000487, "loss": 6.417, "mean_token_accuracy": 0.11866187751293182, "num_tokens": 2025740.0, "step": 975 }, { "entropy": 6.464833211898804, "epoch": 0.08889695210449927, "grad_norm": 1.0078125, "learning_rate": 0.0004895, "loss": 6.4715, "mean_token_accuracy": 0.11230053454637527, "num_tokens": 2037748.0, "step": 980 }, { "entropy": 6.4517669677734375, "epoch": 0.08935050798258345, "grad_norm": 1.171875, "learning_rate": 0.000492, "loss": 6.4799, "mean_token_accuracy": 0.11359175741672516, "num_tokens": 2047882.0, "step": 985 }, { "entropy": 6.344726705551148, "epoch": 0.08980406386066764, "grad_norm": 1.109375, "learning_rate": 0.0004945, "loss": 6.2499, "mean_token_accuracy": 0.12739444598555566, "num_tokens": 2057291.0, "step": 990 }, { "entropy": 6.410989761352539, "epoch": 0.09025761973875182, "grad_norm": 1.21875, "learning_rate": 0.000497, "loss": 6.3915, "mean_token_accuracy": 0.11595515459775925, "num_tokens": 2068420.0, "step": 995 }, { "entropy": 6.440128231048584, "epoch": 0.09071117561683599, "grad_norm": 1.078125, "learning_rate": 0.0004995, "loss": 6.5057, "mean_token_accuracy": 0.11650898307561874, "num_tokens": 2077721.0, "step": 1000 }, { "entropy": 6.404371500015259, "epoch": 0.09116473149492017, "grad_norm": 1.1015625, "learning_rate": 0.0004999999985110217, "loss": 6.4196, "mean_token_accuracy": 0.11519975513219834, "num_tokens": 2087434.0, "step": 1005 }, { "entropy": 6.462897062301636, "epoch": 0.09161828737300436, "grad_norm": 0.9375, "learning_rate": 0.0004999999924620471, "loss": 6.4416, "mean_token_accuracy": 0.11368417963385583, "num_tokens": 2098193.0, "step": 1010 }, { "entropy": 6.384410095214844, "epoch": 0.09207184325108854, "grad_norm": 1.171875, "learning_rate": 0.0004999999817600155, "loss": 6.3826, "mean_token_accuracy": 0.12369435802102088, "num_tokens": 2108201.0, "step": 1015 }, { "entropy": 6.309185791015625, "epoch": 0.09252539912917271, "grad_norm": 1.1875, "learning_rate": 0.0004999999664049268, "loss": 6.32, "mean_token_accuracy": 0.11705849245190621, "num_tokens": 2119036.0, "step": 1020 }, { "entropy": 6.421576452255249, "epoch": 0.09297895500725689, "grad_norm": 1.078125, "learning_rate": 0.0004999999463967816, "loss": 6.3502, "mean_token_accuracy": 0.1220113031566143, "num_tokens": 2129487.0, "step": 1025 }, { "entropy": 6.344693613052368, "epoch": 0.09343251088534107, "grad_norm": 1.09375, "learning_rate": 0.00049999992173558, "loss": 6.3793, "mean_token_accuracy": 0.11463537812232971, "num_tokens": 2139992.0, "step": 1030 }, { "entropy": 6.273680925369263, "epoch": 0.09388606676342526, "grad_norm": 1.0546875, "learning_rate": 0.0004999998924213228, "loss": 6.2978, "mean_token_accuracy": 0.12567788735032082, "num_tokens": 2149579.0, "step": 1035 }, { "entropy": 6.34424147605896, "epoch": 0.09433962264150944, "grad_norm": 1.0546875, "learning_rate": 0.0004999998584540105, "loss": 6.3323, "mean_token_accuracy": 0.11910404115915299, "num_tokens": 2159876.0, "step": 1040 }, { "entropy": 6.344080543518066, "epoch": 0.09479317851959361, "grad_norm": 1.0234375, "learning_rate": 0.0004999998198336437, "loss": 6.3607, "mean_token_accuracy": 0.11824791878461838, "num_tokens": 2169975.0, "step": 1045 }, { "entropy": 6.427093935012818, "epoch": 0.09524673439767779, "grad_norm": 1.0, "learning_rate": 0.0004999997765602233, "loss": 6.4922, "mean_token_accuracy": 0.11570862457156181, "num_tokens": 2180050.0, "step": 1050 }, { "entropy": 6.349902772903443, "epoch": 0.09570029027576198, "grad_norm": 1.1328125, "learning_rate": 0.0004999997286337502, "loss": 6.3077, "mean_token_accuracy": 0.12012091800570487, "num_tokens": 2189876.0, "step": 1055 }, { "entropy": 6.452189254760742, "epoch": 0.09615384615384616, "grad_norm": 1.4375, "learning_rate": 0.0004999996760542254, "loss": 6.4339, "mean_token_accuracy": 0.11986624225974082, "num_tokens": 2200281.0, "step": 1060 }, { "entropy": 6.32034740447998, "epoch": 0.09660740203193033, "grad_norm": 1.0546875, "learning_rate": 0.00049999961882165, "loss": 6.3044, "mean_token_accuracy": 0.12321286574006081, "num_tokens": 2210369.0, "step": 1065 }, { "entropy": 6.327759885787964, "epoch": 0.09706095791001451, "grad_norm": 1.015625, "learning_rate": 0.0004999995569360251, "loss": 6.3127, "mean_token_accuracy": 0.12402729466557502, "num_tokens": 2221990.0, "step": 1070 }, { "entropy": 6.366653490066528, "epoch": 0.0975145137880987, "grad_norm": 1.109375, "learning_rate": 0.000499999490397352, "loss": 6.4474, "mean_token_accuracy": 0.11773798763751983, "num_tokens": 2233252.0, "step": 1075 }, { "entropy": 6.317323875427246, "epoch": 0.09796806966618288, "grad_norm": 1.078125, "learning_rate": 0.0004999994192056321, "loss": 6.3302, "mean_token_accuracy": 0.1180254340171814, "num_tokens": 2243527.0, "step": 1080 }, { "entropy": 6.509728670120239, "epoch": 0.09842162554426705, "grad_norm": 1.015625, "learning_rate": 0.0004999993433608669, "loss": 6.5429, "mean_token_accuracy": 0.11201546043157577, "num_tokens": 2255879.0, "step": 1085 }, { "entropy": 6.402245807647705, "epoch": 0.09887518142235123, "grad_norm": 1.0390625, "learning_rate": 0.0004999992628630579, "loss": 6.3557, "mean_token_accuracy": 0.11973690539598465, "num_tokens": 2266515.0, "step": 1090 }, { "entropy": 6.339201927185059, "epoch": 0.09932873730043541, "grad_norm": 1.140625, "learning_rate": 0.0004999991777122069, "loss": 6.4273, "mean_token_accuracy": 0.12359791249036789, "num_tokens": 2276876.0, "step": 1095 }, { "entropy": 6.246776485443116, "epoch": 0.0997822931785196, "grad_norm": 0.95703125, "learning_rate": 0.0004999990879083156, "loss": 6.2678, "mean_token_accuracy": 0.12031552121043206, "num_tokens": 2287467.0, "step": 1100 }, { "entropy": 6.35769305229187, "epoch": 0.10023584905660378, "grad_norm": 1.1015625, "learning_rate": 0.0004999989934513857, "loss": 6.2462, "mean_token_accuracy": 0.12475912868976594, "num_tokens": 2297907.0, "step": 1105 }, { "entropy": 6.35407977104187, "epoch": 0.10068940493468795, "grad_norm": 1.0625, "learning_rate": 0.0004999988943414193, "loss": 6.3535, "mean_token_accuracy": 0.1271662712097168, "num_tokens": 2307955.0, "step": 1110 }, { "entropy": 6.295737075805664, "epoch": 0.10114296081277213, "grad_norm": 1.1640625, "learning_rate": 0.0004999987905784184, "loss": 6.2987, "mean_token_accuracy": 0.12096831873059273, "num_tokens": 2318545.0, "step": 1115 }, { "entropy": 6.236451482772827, "epoch": 0.10159651669085631, "grad_norm": 1.0625, "learning_rate": 0.0004999986821623853, "loss": 6.2202, "mean_token_accuracy": 0.12809522673487664, "num_tokens": 2327706.0, "step": 1120 }, { "entropy": 6.412763261795044, "epoch": 0.1020500725689405, "grad_norm": 0.9921875, "learning_rate": 0.0004999985690933219, "loss": 6.4203, "mean_token_accuracy": 0.11205516159534454, "num_tokens": 2337853.0, "step": 1125 }, { "entropy": 6.159422540664673, "epoch": 0.10250362844702467, "grad_norm": 1.0703125, "learning_rate": 0.0004999984513712311, "loss": 6.1984, "mean_token_accuracy": 0.12132447883486748, "num_tokens": 2348340.0, "step": 1130 }, { "entropy": 6.364528322219849, "epoch": 0.10295718432510885, "grad_norm": 1.0703125, "learning_rate": 0.0004999983289961146, "loss": 6.2307, "mean_token_accuracy": 0.1275188758969307, "num_tokens": 2358616.0, "step": 1135 }, { "entropy": 6.197306394577026, "epoch": 0.10341074020319303, "grad_norm": 1.0625, "learning_rate": 0.0004999982019679755, "loss": 6.2656, "mean_token_accuracy": 0.12436863258481026, "num_tokens": 2368226.0, "step": 1140 }, { "entropy": 6.445528173446656, "epoch": 0.10386429608127722, "grad_norm": 1.0390625, "learning_rate": 0.0004999980702868164, "loss": 6.4449, "mean_token_accuracy": 0.1217611476778984, "num_tokens": 2378627.0, "step": 1145 }, { "entropy": 6.300698471069336, "epoch": 0.1043178519593614, "grad_norm": 0.9921875, "learning_rate": 0.0004999979339526396, "loss": 6.3391, "mean_token_accuracy": 0.12193103209137916, "num_tokens": 2389601.0, "step": 1150 }, { "entropy": 6.353440380096435, "epoch": 0.10477140783744557, "grad_norm": 0.96875, "learning_rate": 0.0004999977929654484, "loss": 6.3341, "mean_token_accuracy": 0.12355378419160842, "num_tokens": 2400010.0, "step": 1155 }, { "entropy": 6.193485832214355, "epoch": 0.10522496371552975, "grad_norm": 1.015625, "learning_rate": 0.0004999976473252453, "loss": 6.2651, "mean_token_accuracy": 0.12575532719492913, "num_tokens": 2409443.0, "step": 1160 }, { "entropy": 6.352375030517578, "epoch": 0.10567851959361393, "grad_norm": 1.1171875, "learning_rate": 0.0004999974970320338, "loss": 6.2298, "mean_token_accuracy": 0.12666020169854164, "num_tokens": 2419616.0, "step": 1165 }, { "entropy": 6.147144079208374, "epoch": 0.10613207547169812, "grad_norm": 1.015625, "learning_rate": 0.0004999973420858165, "loss": 6.21, "mean_token_accuracy": 0.12970640361309052, "num_tokens": 2430193.0, "step": 1170 }, { "entropy": 6.327436637878418, "epoch": 0.10658563134978229, "grad_norm": 1.15625, "learning_rate": 0.0004999971824865968, "loss": 6.3592, "mean_token_accuracy": 0.12428862676024437, "num_tokens": 2440682.0, "step": 1175 }, { "entropy": 6.273407697677612, "epoch": 0.10703918722786647, "grad_norm": 0.95703125, "learning_rate": 0.0004999970182343782, "loss": 6.2968, "mean_token_accuracy": 0.13017050549387932, "num_tokens": 2452357.0, "step": 1180 }, { "entropy": 6.420224666595459, "epoch": 0.10749274310595065, "grad_norm": 1.0859375, "learning_rate": 0.0004999968493291638, "loss": 6.3124, "mean_token_accuracy": 0.1259176842868328, "num_tokens": 2463372.0, "step": 1185 }, { "entropy": 6.11242709159851, "epoch": 0.10794629898403484, "grad_norm": 1.0390625, "learning_rate": 0.0004999966757709573, "loss": 6.2185, "mean_token_accuracy": 0.1255997322499752, "num_tokens": 2473937.0, "step": 1190 }, { "entropy": 6.333364057540893, "epoch": 0.10839985486211902, "grad_norm": 0.96484375, "learning_rate": 0.0004999964975597622, "loss": 6.2463, "mean_token_accuracy": 0.12876395285129547, "num_tokens": 2484178.0, "step": 1195 }, { "entropy": 6.290256929397583, "epoch": 0.10885341074020319, "grad_norm": 1.0625, "learning_rate": 0.0004999963146955821, "loss": 6.2757, "mean_token_accuracy": 0.12604986280202865, "num_tokens": 2493855.0, "step": 1200 }, { "entropy": 6.16634783744812, "epoch": 0.10930696661828737, "grad_norm": 1.15625, "learning_rate": 0.000499996127178421, "loss": 6.1956, "mean_token_accuracy": 0.128883396089077, "num_tokens": 2502777.0, "step": 1205 }, { "entropy": 6.308694171905517, "epoch": 0.10976052249637155, "grad_norm": 1.0234375, "learning_rate": 0.0004999959350082825, "loss": 6.218, "mean_token_accuracy": 0.127637080848217, "num_tokens": 2513646.0, "step": 1210 }, { "entropy": 6.315856885910034, "epoch": 0.11021407837445574, "grad_norm": 1.1171875, "learning_rate": 0.0004999957381851709, "loss": 6.29, "mean_token_accuracy": 0.13161664754152297, "num_tokens": 2523614.0, "step": 1215 }, { "entropy": 6.190816354751587, "epoch": 0.1106676342525399, "grad_norm": 1.03125, "learning_rate": 0.0004999955367090901, "loss": 6.2384, "mean_token_accuracy": 0.13483407124876975, "num_tokens": 2533279.0, "step": 1220 }, { "entropy": 6.172196102142334, "epoch": 0.11112119013062409, "grad_norm": 1.1328125, "learning_rate": 0.0004999953305800441, "loss": 6.1165, "mean_token_accuracy": 0.12950356379151345, "num_tokens": 2542748.0, "step": 1225 }, { "entropy": 6.226431798934937, "epoch": 0.11157474600870827, "grad_norm": 0.9921875, "learning_rate": 0.0004999951197980374, "loss": 6.2074, "mean_token_accuracy": 0.12376128509640694, "num_tokens": 2553003.0, "step": 1230 }, { "entropy": 6.211793422698975, "epoch": 0.11202830188679246, "grad_norm": 1.0390625, "learning_rate": 0.0004999949043630744, "loss": 6.2499, "mean_token_accuracy": 0.1253039300441742, "num_tokens": 2563099.0, "step": 1235 }, { "entropy": 6.247184419631958, "epoch": 0.11248185776487664, "grad_norm": 1.078125, "learning_rate": 0.0004999946842751593, "loss": 6.2433, "mean_token_accuracy": 0.129485647380352, "num_tokens": 2572816.0, "step": 1240 }, { "entropy": 6.208843231201172, "epoch": 0.11293541364296081, "grad_norm": 1.140625, "learning_rate": 0.0004999944595342968, "loss": 6.2615, "mean_token_accuracy": 0.13151264265179635, "num_tokens": 2582633.0, "step": 1245 }, { "entropy": 6.3658373832702635, "epoch": 0.11338896952104499, "grad_norm": 0.96484375, "learning_rate": 0.0004999942301404916, "loss": 6.3094, "mean_token_accuracy": 0.12087921500205993, "num_tokens": 2593581.0, "step": 1250 }, { "entropy": 6.2705951690673825, "epoch": 0.11384252539912917, "grad_norm": 1.140625, "learning_rate": 0.0004999939960937484, "loss": 6.3018, "mean_token_accuracy": 0.11847401112318039, "num_tokens": 2603811.0, "step": 1255 }, { "entropy": 6.270603513717651, "epoch": 0.11429608127721336, "grad_norm": 1.1328125, "learning_rate": 0.0004999937573940721, "loss": 6.3224, "mean_token_accuracy": 0.12249375060200692, "num_tokens": 2615147.0, "step": 1260 }, { "entropy": 6.228997707366943, "epoch": 0.11474963715529753, "grad_norm": 1.03125, "learning_rate": 0.0004999935140414674, "loss": 6.1669, "mean_token_accuracy": 0.1293345607817173, "num_tokens": 2625201.0, "step": 1265 }, { "entropy": 6.2709190368652346, "epoch": 0.11520319303338171, "grad_norm": 1.171875, "learning_rate": 0.0004999932660359395, "loss": 6.3101, "mean_token_accuracy": 0.1249003492295742, "num_tokens": 2635377.0, "step": 1270 }, { "entropy": 6.189292049407959, "epoch": 0.11565674891146589, "grad_norm": 0.99609375, "learning_rate": 0.0004999930133774936, "loss": 6.2372, "mean_token_accuracy": 0.12723963409662248, "num_tokens": 2645849.0, "step": 1275 }, { "entropy": 6.398007583618164, "epoch": 0.11611030478955008, "grad_norm": 0.97265625, "learning_rate": 0.0004999927560661348, "loss": 6.3526, "mean_token_accuracy": 0.12062773033976555, "num_tokens": 2657125.0, "step": 1280 }, { "entropy": 6.223501682281494, "epoch": 0.11656386066763426, "grad_norm": 1.1171875, "learning_rate": 0.0004999924941018685, "loss": 6.1835, "mean_token_accuracy": 0.12893526181578635, "num_tokens": 2667575.0, "step": 1285 }, { "entropy": 6.175991201400757, "epoch": 0.11701741654571843, "grad_norm": 1.015625, "learning_rate": 0.0004999922274847, "loss": 6.2356, "mean_token_accuracy": 0.12373170107603074, "num_tokens": 2678287.0, "step": 1290 }, { "entropy": 6.321875476837159, "epoch": 0.11747097242380261, "grad_norm": 0.99609375, "learning_rate": 0.000499991956214635, "loss": 6.3511, "mean_token_accuracy": 0.13218481838703156, "num_tokens": 2687903.0, "step": 1295 }, { "entropy": 6.180214071273804, "epoch": 0.1179245283018868, "grad_norm": 0.97265625, "learning_rate": 0.000499991680291679, "loss": 6.1958, "mean_token_accuracy": 0.12728189304471016, "num_tokens": 2697975.0, "step": 1300 }, { "entropy": 6.23911418914795, "epoch": 0.11837808417997098, "grad_norm": 0.9921875, "learning_rate": 0.0004999913997158378, "loss": 6.212, "mean_token_accuracy": 0.12432057186961173, "num_tokens": 2708861.0, "step": 1305 }, { "entropy": 6.25122103691101, "epoch": 0.11883164005805515, "grad_norm": 1.1484375, "learning_rate": 0.0004999911144871169, "loss": 6.3343, "mean_token_accuracy": 0.1229264110326767, "num_tokens": 2718751.0, "step": 1310 }, { "entropy": 6.240471696853637, "epoch": 0.11928519593613933, "grad_norm": 1.140625, "learning_rate": 0.0004999908246055226, "loss": 6.1875, "mean_token_accuracy": 0.12787612676620483, "num_tokens": 2728393.0, "step": 1315 }, { "entropy": 6.22295913696289, "epoch": 0.11973875181422351, "grad_norm": 0.97265625, "learning_rate": 0.0004999905300710607, "loss": 6.2265, "mean_token_accuracy": 0.12778055742383004, "num_tokens": 2738953.0, "step": 1320 }, { "entropy": 6.260966491699219, "epoch": 0.1201923076923077, "grad_norm": 1.1484375, "learning_rate": 0.0004999902308837373, "loss": 6.304, "mean_token_accuracy": 0.12310394868254662, "num_tokens": 2748598.0, "step": 1325 }, { "entropy": 6.344991064071655, "epoch": 0.12064586357039188, "grad_norm": 1.09375, "learning_rate": 0.0004999899270435584, "loss": 6.3314, "mean_token_accuracy": 0.12434870079159736, "num_tokens": 2758543.0, "step": 1330 }, { "entropy": 6.20733380317688, "epoch": 0.12109941944847605, "grad_norm": 1.0390625, "learning_rate": 0.0004999896185505307, "loss": 6.1451, "mean_token_accuracy": 0.12950560450553894, "num_tokens": 2767686.0, "step": 1335 }, { "entropy": 6.168848514556885, "epoch": 0.12155297532656023, "grad_norm": 1.0, "learning_rate": 0.0004999893054046603, "loss": 6.2278, "mean_token_accuracy": 0.1261433832347393, "num_tokens": 2778826.0, "step": 1340 }, { "entropy": 6.23694486618042, "epoch": 0.12200653120464441, "grad_norm": 1.0859375, "learning_rate": 0.0004999889876059537, "loss": 6.1686, "mean_token_accuracy": 0.1320178970694542, "num_tokens": 2788798.0, "step": 1345 }, { "entropy": 6.205473756790161, "epoch": 0.1224600870827286, "grad_norm": 1.015625, "learning_rate": 0.0004999886651544176, "loss": 6.243, "mean_token_accuracy": 0.12421647608280181, "num_tokens": 2799789.0, "step": 1350 }, { "entropy": 6.292304515838623, "epoch": 0.12291364296081277, "grad_norm": 1.078125, "learning_rate": 0.0004999883380500584, "loss": 6.3019, "mean_token_accuracy": 0.11881196796894074, "num_tokens": 2811256.0, "step": 1355 }, { "entropy": 6.227163362503052, "epoch": 0.12336719883889695, "grad_norm": 1.0, "learning_rate": 0.0004999880062928831, "loss": 6.1407, "mean_token_accuracy": 0.12354236915707588, "num_tokens": 2821181.0, "step": 1360 }, { "entropy": 6.2017885684967045, "epoch": 0.12382075471698113, "grad_norm": 1.03125, "learning_rate": 0.0004999876698828985, "loss": 6.2911, "mean_token_accuracy": 0.12848431915044783, "num_tokens": 2831844.0, "step": 1365 }, { "entropy": 6.140119552612305, "epoch": 0.12427431059506532, "grad_norm": 1.1015625, "learning_rate": 0.0004999873288201116, "loss": 6.1389, "mean_token_accuracy": 0.128109622746706, "num_tokens": 2842311.0, "step": 1370 }, { "entropy": 6.265316724777222, "epoch": 0.1247278664731495, "grad_norm": 1.046875, "learning_rate": 0.0004999869831045294, "loss": 6.1958, "mean_token_accuracy": 0.12854474037885666, "num_tokens": 2852668.0, "step": 1375 }, { "entropy": 6.160908985137939, "epoch": 0.12518142235123367, "grad_norm": 1.03125, "learning_rate": 0.0004999866327361589, "loss": 6.2176, "mean_token_accuracy": 0.12579773738980293, "num_tokens": 2862998.0, "step": 1380 }, { "entropy": 6.213189792633057, "epoch": 0.12563497822931785, "grad_norm": 1.0546875, "learning_rate": 0.0004999862777150077, "loss": 6.1426, "mean_token_accuracy": 0.13384611159563065, "num_tokens": 2872280.0, "step": 1385 }, { "entropy": 6.110375881195068, "epoch": 0.12608853410740203, "grad_norm": 0.96875, "learning_rate": 0.0004999859180410829, "loss": 6.1983, "mean_token_accuracy": 0.1303381085395813, "num_tokens": 2883755.0, "step": 1390 }, { "entropy": 6.233339548110962, "epoch": 0.12654208998548622, "grad_norm": 0.99609375, "learning_rate": 0.0004999855537143919, "loss": 6.2045, "mean_token_accuracy": 0.12790499925613402, "num_tokens": 2893926.0, "step": 1395 }, { "entropy": 6.063788890838623, "epoch": 0.1269956458635704, "grad_norm": 1.015625, "learning_rate": 0.0004999851847349425, "loss": 6.1219, "mean_token_accuracy": 0.12827676758170128, "num_tokens": 2904666.0, "step": 1400 }, { "entropy": 6.179912185668945, "epoch": 0.12744920174165458, "grad_norm": 1.1171875, "learning_rate": 0.0004999848111027419, "loss": 6.0826, "mean_token_accuracy": 0.1336699068546295, "num_tokens": 2915089.0, "step": 1405 }, { "entropy": 6.247713565826416, "epoch": 0.12790275761973874, "grad_norm": 1.0859375, "learning_rate": 0.0004999844328177983, "loss": 6.2475, "mean_token_accuracy": 0.12141420245170594, "num_tokens": 2926123.0, "step": 1410 }, { "entropy": 6.126826429367066, "epoch": 0.12835631349782292, "grad_norm": 1.1015625, "learning_rate": 0.0004999840498801191, "loss": 6.0732, "mean_token_accuracy": 0.13073234036564826, "num_tokens": 2935308.0, "step": 1415 }, { "entropy": 6.148389720916748, "epoch": 0.1288098693759071, "grad_norm": 1.0390625, "learning_rate": 0.0004999836622897126, "loss": 6.1871, "mean_token_accuracy": 0.12865355014801025, "num_tokens": 2945352.0, "step": 1420 }, { "entropy": 6.213321590423584, "epoch": 0.1292634252539913, "grad_norm": 1.15625, "learning_rate": 0.0004999832700465865, "loss": 6.1989, "mean_token_accuracy": 0.12411043643951417, "num_tokens": 2956766.0, "step": 1425 }, { "entropy": 6.172161293029785, "epoch": 0.12971698113207547, "grad_norm": 1.015625, "learning_rate": 0.0004999828731507491, "loss": 6.1263, "mean_token_accuracy": 0.1324382685124874, "num_tokens": 2967203.0, "step": 1430 }, { "entropy": 6.163990879058838, "epoch": 0.13017053701015965, "grad_norm": 1.0859375, "learning_rate": 0.0004999824716022085, "loss": 6.1356, "mean_token_accuracy": 0.13465460762381554, "num_tokens": 2976669.0, "step": 1435 }, { "entropy": 6.156468915939331, "epoch": 0.13062409288824384, "grad_norm": 1.171875, "learning_rate": 0.0004999820654009731, "loss": 6.1866, "mean_token_accuracy": 0.1345203198492527, "num_tokens": 2987009.0, "step": 1440 }, { "entropy": 6.1427467346191404, "epoch": 0.13107764876632802, "grad_norm": 1.03125, "learning_rate": 0.0004999816545470513, "loss": 6.2045, "mean_token_accuracy": 0.13020925000309944, "num_tokens": 2998252.0, "step": 1445 }, { "entropy": 6.175037908554077, "epoch": 0.1315312046444122, "grad_norm": 0.96484375, "learning_rate": 0.0004999812390404514, "loss": 6.0761, "mean_token_accuracy": 0.13165489509701728, "num_tokens": 3009091.0, "step": 1450 }, { "entropy": 6.20917649269104, "epoch": 0.13198476052249636, "grad_norm": 1.0703125, "learning_rate": 0.0004999808188811823, "loss": 6.3049, "mean_token_accuracy": 0.12950452715158461, "num_tokens": 3018692.0, "step": 1455 }, { "entropy": 6.149243974685669, "epoch": 0.13243831640058054, "grad_norm": 1.1875, "learning_rate": 0.0004999803940692524, "loss": 6.0922, "mean_token_accuracy": 0.1306043490767479, "num_tokens": 3028194.0, "step": 1460 }, { "entropy": 6.147744083404541, "epoch": 0.13289187227866472, "grad_norm": 1.0625, "learning_rate": 0.0004999799646046707, "loss": 6.108, "mean_token_accuracy": 0.13267887458205224, "num_tokens": 3037893.0, "step": 1465 }, { "entropy": 6.136689615249634, "epoch": 0.1333454281567489, "grad_norm": 1.0234375, "learning_rate": 0.0004999795304874461, "loss": 6.1956, "mean_token_accuracy": 0.12603257223963737, "num_tokens": 3048593.0, "step": 1470 }, { "entropy": 6.1764789581298825, "epoch": 0.1337989840348331, "grad_norm": 1.125, "learning_rate": 0.0004999790917175873, "loss": 6.1384, "mean_token_accuracy": 0.1398916281759739, "num_tokens": 3059591.0, "step": 1475 }, { "entropy": 6.148527336120606, "epoch": 0.13425253991291727, "grad_norm": 0.98046875, "learning_rate": 0.0004999786482951036, "loss": 6.1489, "mean_token_accuracy": 0.13112814351916313, "num_tokens": 3070543.0, "step": 1480 }, { "entropy": 6.194287872314453, "epoch": 0.13470609579100146, "grad_norm": 1.125, "learning_rate": 0.0004999782002200041, "loss": 6.1506, "mean_token_accuracy": 0.1290934108197689, "num_tokens": 3081665.0, "step": 1485 }, { "entropy": 6.116252756118774, "epoch": 0.13515965166908564, "grad_norm": 1.015625, "learning_rate": 0.0004999777474922982, "loss": 6.1252, "mean_token_accuracy": 0.135535828769207, "num_tokens": 3092347.0, "step": 1490 }, { "entropy": 6.084321165084839, "epoch": 0.13561320754716982, "grad_norm": 1.15625, "learning_rate": 0.0004999772901119951, "loss": 6.0665, "mean_token_accuracy": 0.140205679833889, "num_tokens": 3101953.0, "step": 1495 }, { "entropy": 6.182489442825317, "epoch": 0.13606676342525398, "grad_norm": 1.140625, "learning_rate": 0.0004999768280791043, "loss": 6.1673, "mean_token_accuracy": 0.12897372841835023, "num_tokens": 3111555.0, "step": 1500 }, { "entropy": 6.074414539337158, "epoch": 0.13652031930333816, "grad_norm": 1.0546875, "learning_rate": 0.0004999763613936352, "loss": 6.1214, "mean_token_accuracy": 0.13250304833054544, "num_tokens": 3121263.0, "step": 1505 }, { "entropy": 6.1420024871826175, "epoch": 0.13697387518142234, "grad_norm": 1.0546875, "learning_rate": 0.0004999758900555979, "loss": 6.1528, "mean_token_accuracy": 0.1297949396073818, "num_tokens": 3131187.0, "step": 1510 }, { "entropy": 6.122401189804077, "epoch": 0.13742743105950653, "grad_norm": 1.0390625, "learning_rate": 0.0004999754140650017, "loss": 6.1055, "mean_token_accuracy": 0.1283240534365177, "num_tokens": 3141116.0, "step": 1515 }, { "entropy": 6.16475772857666, "epoch": 0.1378809869375907, "grad_norm": 1.0625, "learning_rate": 0.0004999749334218567, "loss": 6.1595, "mean_token_accuracy": 0.134047494828701, "num_tokens": 3150727.0, "step": 1520 }, { "entropy": 6.178267621994019, "epoch": 0.1383345428156749, "grad_norm": 1.0234375, "learning_rate": 0.0004999744481261726, "loss": 6.188, "mean_token_accuracy": 0.12995831593871116, "num_tokens": 3160977.0, "step": 1525 }, { "entropy": 6.131053876876831, "epoch": 0.13878809869375908, "grad_norm": 1.1328125, "learning_rate": 0.0004999739581779597, "loss": 6.0237, "mean_token_accuracy": 0.13834299221634866, "num_tokens": 3171177.0, "step": 1530 }, { "entropy": 6.096694660186768, "epoch": 0.13924165457184326, "grad_norm": 1.1171875, "learning_rate": 0.000499973463577228, "loss": 6.193, "mean_token_accuracy": 0.13165855631232262, "num_tokens": 3181691.0, "step": 1535 }, { "entropy": 6.233206558227539, "epoch": 0.13969521044992744, "grad_norm": 1.078125, "learning_rate": 0.0004999729643239877, "loss": 6.1496, "mean_token_accuracy": 0.13230349868535995, "num_tokens": 3192546.0, "step": 1540 }, { "entropy": 6.082428359985352, "epoch": 0.1401487663280116, "grad_norm": 1.015625, "learning_rate": 0.0004999724604182492, "loss": 6.2144, "mean_token_accuracy": 0.13026824072003365, "num_tokens": 3203068.0, "step": 1545 }, { "entropy": 6.223723411560059, "epoch": 0.14060232220609578, "grad_norm": 0.9921875, "learning_rate": 0.0004999719518600229, "loss": 6.118, "mean_token_accuracy": 0.12941280901432037, "num_tokens": 3213974.0, "step": 1550 }, { "entropy": 6.0789594650268555, "epoch": 0.14105587808417996, "grad_norm": 1.1171875, "learning_rate": 0.0004999714386493192, "loss": 6.1984, "mean_token_accuracy": 0.13254104405641556, "num_tokens": 3224787.0, "step": 1555 }, { "entropy": 6.247838258743286, "epoch": 0.14150943396226415, "grad_norm": 1.15625, "learning_rate": 0.0004999709207861489, "loss": 6.2061, "mean_token_accuracy": 0.1280451625585556, "num_tokens": 3236072.0, "step": 1560 }, { "entropy": 6.11969223022461, "epoch": 0.14196298984034833, "grad_norm": 1.046875, "learning_rate": 0.0004999703982705227, "loss": 6.1511, "mean_token_accuracy": 0.1358342684805393, "num_tokens": 3247029.0, "step": 1565 }, { "entropy": 6.206550121307373, "epoch": 0.1424165457184325, "grad_norm": 1.0390625, "learning_rate": 0.0004999698711024513, "loss": 6.1205, "mean_token_accuracy": 0.13635100796818733, "num_tokens": 3257536.0, "step": 1570 }, { "entropy": 6.042502069473267, "epoch": 0.1428701015965167, "grad_norm": 1.1328125, "learning_rate": 0.0004999693392819456, "loss": 6.1236, "mean_token_accuracy": 0.13696237206459044, "num_tokens": 3266821.0, "step": 1575 }, { "entropy": 6.179642629623413, "epoch": 0.14332365747460088, "grad_norm": 1.0234375, "learning_rate": 0.0004999688028090166, "loss": 6.045, "mean_token_accuracy": 0.13624384254217148, "num_tokens": 3278118.0, "step": 1580 }, { "entropy": 5.984438037872314, "epoch": 0.14377721335268506, "grad_norm": 0.94921875, "learning_rate": 0.0004999682616836755, "loss": 6.0577, "mean_token_accuracy": 0.13041958436369896, "num_tokens": 3289331.0, "step": 1585 }, { "entropy": 6.199773597717285, "epoch": 0.14423076923076922, "grad_norm": 0.984375, "learning_rate": 0.0004999677159059334, "loss": 6.1481, "mean_token_accuracy": 0.12837196588516236, "num_tokens": 3299965.0, "step": 1590 }, { "entropy": 6.125565862655639, "epoch": 0.1446843251088534, "grad_norm": 1.1015625, "learning_rate": 0.0004999671654758016, "loss": 6.2454, "mean_token_accuracy": 0.12566872015595437, "num_tokens": 3310741.0, "step": 1595 }, { "entropy": 6.205886650085449, "epoch": 0.14513788098693758, "grad_norm": 1.0625, "learning_rate": 0.0004999666103932915, "loss": 6.173, "mean_token_accuracy": 0.13071803301572799, "num_tokens": 3321335.0, "step": 1600 }, { "entropy": 6.197109222412109, "epoch": 0.14559143686502177, "grad_norm": 1.0859375, "learning_rate": 0.0004999660506584145, "loss": 6.148, "mean_token_accuracy": 0.12749085575342178, "num_tokens": 3332032.0, "step": 1605 }, { "entropy": 6.019048070907592, "epoch": 0.14604499274310595, "grad_norm": 1.046875, "learning_rate": 0.0004999654862711823, "loss": 6.1304, "mean_token_accuracy": 0.13608851209282874, "num_tokens": 3342122.0, "step": 1610 }, { "entropy": 6.169208431243897, "epoch": 0.14649854862119013, "grad_norm": 1.03125, "learning_rate": 0.0004999649172316065, "loss": 6.1136, "mean_token_accuracy": 0.1308113157749176, "num_tokens": 3352680.0, "step": 1615 }, { "entropy": 6.2383091926574705, "epoch": 0.14695210449927432, "grad_norm": 1.1328125, "learning_rate": 0.000499964343539699, "loss": 6.1395, "mean_token_accuracy": 0.13406497463583947, "num_tokens": 3363230.0, "step": 1620 }, { "entropy": 6.094653749465943, "epoch": 0.1474056603773585, "grad_norm": 1.1484375, "learning_rate": 0.0004999637651954714, "loss": 6.1348, "mean_token_accuracy": 0.13433574065566062, "num_tokens": 3373794.0, "step": 1625 }, { "entropy": 6.197765684127807, "epoch": 0.14785921625544268, "grad_norm": 0.98828125, "learning_rate": 0.0004999631821989358, "loss": 6.1994, "mean_token_accuracy": 0.12583935111761094, "num_tokens": 3384514.0, "step": 1630 }, { "entropy": 6.256759357452393, "epoch": 0.14831277213352684, "grad_norm": 1.1640625, "learning_rate": 0.0004999625945501043, "loss": 6.2303, "mean_token_accuracy": 0.12956068590283393, "num_tokens": 3394803.0, "step": 1635 }, { "entropy": 6.122566747665405, "epoch": 0.14876632801161102, "grad_norm": 1.0390625, "learning_rate": 0.000499962002248989, "loss": 6.0898, "mean_token_accuracy": 0.13396508246660233, "num_tokens": 3405151.0, "step": 1640 }, { "entropy": 6.0934981346130375, "epoch": 0.1492198838896952, "grad_norm": 1.0625, "learning_rate": 0.0004999614052956024, "loss": 6.0583, "mean_token_accuracy": 0.1364964097738266, "num_tokens": 3414841.0, "step": 1645 }, { "entropy": 6.048268461227417, "epoch": 0.1496734397677794, "grad_norm": 1.046875, "learning_rate": 0.0004999608036899563, "loss": 6.0788, "mean_token_accuracy": 0.13555450439453126, "num_tokens": 3425139.0, "step": 1650 }, { "entropy": 6.194241523742676, "epoch": 0.15012699564586357, "grad_norm": 1.0859375, "learning_rate": 0.0004999601974320636, "loss": 6.1343, "mean_token_accuracy": 0.13373469784855843, "num_tokens": 3436113.0, "step": 1655 }, { "entropy": 6.095238971710205, "epoch": 0.15058055152394775, "grad_norm": 1.1484375, "learning_rate": 0.0004999595865219367, "loss": 6.0556, "mean_token_accuracy": 0.13025515004992486, "num_tokens": 3445605.0, "step": 1660 }, { "entropy": 6.008597135543823, "epoch": 0.15103410740203194, "grad_norm": 1.03125, "learning_rate": 0.0004999589709595881, "loss": 6.0895, "mean_token_accuracy": 0.1334249906241894, "num_tokens": 3456035.0, "step": 1665 }, { "entropy": 6.121166181564331, "epoch": 0.15148766328011612, "grad_norm": 1.015625, "learning_rate": 0.0004999583507450308, "loss": 5.9982, "mean_token_accuracy": 0.13778249844908713, "num_tokens": 3465607.0, "step": 1670 }, { "entropy": 6.085819149017334, "epoch": 0.1519412191582003, "grad_norm": 1.046875, "learning_rate": 0.0004999577258782774, "loss": 6.0603, "mean_token_accuracy": 0.13757585138082504, "num_tokens": 3475637.0, "step": 1675 }, { "entropy": 6.190000343322754, "epoch": 0.15239477503628446, "grad_norm": 1.09375, "learning_rate": 0.000499957096359341, "loss": 6.2364, "mean_token_accuracy": 0.12960681244730948, "num_tokens": 3486200.0, "step": 1680 }, { "entropy": 6.079170513153076, "epoch": 0.15284833091436864, "grad_norm": 1.0859375, "learning_rate": 0.0004999564621882343, "loss": 6.0739, "mean_token_accuracy": 0.142069224268198, "num_tokens": 3495892.0, "step": 1685 }, { "entropy": 6.0179280757904055, "epoch": 0.15330188679245282, "grad_norm": 1.1328125, "learning_rate": 0.0004999558233649708, "loss": 5.9601, "mean_token_accuracy": 0.14071570262312888, "num_tokens": 3504837.0, "step": 1690 }, { "entropy": 6.181920051574707, "epoch": 0.153755442670537, "grad_norm": 1.1640625, "learning_rate": 0.0004999551798895636, "loss": 6.1237, "mean_token_accuracy": 0.13454843834042549, "num_tokens": 3514966.0, "step": 1695 }, { "entropy": 6.123470783233643, "epoch": 0.1542089985486212, "grad_norm": 1.046875, "learning_rate": 0.0004999545317620258, "loss": 6.1948, "mean_token_accuracy": 0.1286864012479782, "num_tokens": 3526927.0, "step": 1700 }, { "entropy": 6.103703546524048, "epoch": 0.15466255442670537, "grad_norm": 1.0703125, "learning_rate": 0.0004999538789823711, "loss": 6.1362, "mean_token_accuracy": 0.13410764262080194, "num_tokens": 3537493.0, "step": 1705 }, { "entropy": 6.200163269042969, "epoch": 0.15511611030478956, "grad_norm": 1.0625, "learning_rate": 0.0004999532215506127, "loss": 6.1782, "mean_token_accuracy": 0.13086570724844931, "num_tokens": 3548188.0, "step": 1710 }, { "entropy": 6.023609161376953, "epoch": 0.15556966618287374, "grad_norm": 0.99609375, "learning_rate": 0.0004999525594667645, "loss": 6.0613, "mean_token_accuracy": 0.13730209618806838, "num_tokens": 3558895.0, "step": 1715 }, { "entropy": 6.090526866912842, "epoch": 0.15602322206095792, "grad_norm": 1.0859375, "learning_rate": 0.00049995189273084, "loss": 5.9685, "mean_token_accuracy": 0.13569305986166, "num_tokens": 3569052.0, "step": 1720 }, { "entropy": 6.121201276779175, "epoch": 0.15647677793904208, "grad_norm": 0.9609375, "learning_rate": 0.000499951221342853, "loss": 6.1226, "mean_token_accuracy": 0.1320158787071705, "num_tokens": 3579714.0, "step": 1725 }, { "entropy": 6.001186561584473, "epoch": 0.15693033381712626, "grad_norm": 1.171875, "learning_rate": 0.0004999505453028174, "loss": 5.9801, "mean_token_accuracy": 0.13680141866207124, "num_tokens": 3589305.0, "step": 1730 }, { "entropy": 6.076255941390992, "epoch": 0.15738388969521044, "grad_norm": 1.140625, "learning_rate": 0.0004999498646107472, "loss": 6.0586, "mean_token_accuracy": 0.1337602600455284, "num_tokens": 3599848.0, "step": 1735 }, { "entropy": 6.0408961296081545, "epoch": 0.15783744557329463, "grad_norm": 1.1875, "learning_rate": 0.0004999491792666566, "loss": 6.1816, "mean_token_accuracy": 0.13034821301698685, "num_tokens": 3610588.0, "step": 1740 }, { "entropy": 6.26001992225647, "epoch": 0.1582910014513788, "grad_norm": 1.0703125, "learning_rate": 0.0004999484892705597, "loss": 6.1291, "mean_token_accuracy": 0.1350434586405754, "num_tokens": 3620649.0, "step": 1745 }, { "entropy": 6.085051679611206, "epoch": 0.158744557329463, "grad_norm": 1.109375, "learning_rate": 0.0004999477946224705, "loss": 6.0635, "mean_token_accuracy": 0.13476430699229242, "num_tokens": 3630412.0, "step": 1750 }, { "entropy": 6.041621828079224, "epoch": 0.15919811320754718, "grad_norm": 1.09375, "learning_rate": 0.0004999470953224037, "loss": 6.0457, "mean_token_accuracy": 0.13242931589484214, "num_tokens": 3640946.0, "step": 1755 }, { "entropy": 6.114254808425903, "epoch": 0.15965166908563136, "grad_norm": 1.1171875, "learning_rate": 0.0004999463913703735, "loss": 6.1408, "mean_token_accuracy": 0.13187248036265373, "num_tokens": 3651478.0, "step": 1760 }, { "entropy": 6.029904985427857, "epoch": 0.16010522496371554, "grad_norm": 1.046875, "learning_rate": 0.0004999456827663948, "loss": 5.9905, "mean_token_accuracy": 0.13920539617538452, "num_tokens": 3661509.0, "step": 1765 }, { "entropy": 6.057517337799072, "epoch": 0.1605587808417997, "grad_norm": 1.1015625, "learning_rate": 0.000499944969510482, "loss": 6.0412, "mean_token_accuracy": 0.1356307126581669, "num_tokens": 3672293.0, "step": 1770 }, { "entropy": 6.089949989318848, "epoch": 0.16101233671988388, "grad_norm": 1.140625, "learning_rate": 0.0004999442516026498, "loss": 6.0526, "mean_token_accuracy": 0.13480686247348786, "num_tokens": 3682687.0, "step": 1775 }, { "entropy": 6.129207468032837, "epoch": 0.16146589259796806, "grad_norm": 1.1875, "learning_rate": 0.0004999435290429133, "loss": 6.0789, "mean_token_accuracy": 0.14450050964951516, "num_tokens": 3692787.0, "step": 1780 }, { "entropy": 6.038466596603394, "epoch": 0.16191944847605225, "grad_norm": 1.1875, "learning_rate": 0.0004999428018312872, "loss": 6.0478, "mean_token_accuracy": 0.13742451071739198, "num_tokens": 3703182.0, "step": 1785 }, { "entropy": 6.083740758895874, "epoch": 0.16237300435413643, "grad_norm": 1.1875, "learning_rate": 0.0004999420699677867, "loss": 6.1061, "mean_token_accuracy": 0.12973477616906165, "num_tokens": 3713384.0, "step": 1790 }, { "entropy": 6.063831567764282, "epoch": 0.1628265602322206, "grad_norm": 1.0859375, "learning_rate": 0.0004999413334524269, "loss": 6.0992, "mean_token_accuracy": 0.13103547915816308, "num_tokens": 3725122.0, "step": 1795 }, { "entropy": 6.214202642440796, "epoch": 0.1632801161103048, "grad_norm": 1.0390625, "learning_rate": 0.0004999405922852229, "loss": 6.1184, "mean_token_accuracy": 0.13545257672667504, "num_tokens": 3735460.0, "step": 1800 }, { "entropy": 6.04037709236145, "epoch": 0.16373367198838898, "grad_norm": 1.09375, "learning_rate": 0.0004999398464661901, "loss": 6.0184, "mean_token_accuracy": 0.13665979579091073, "num_tokens": 3745442.0, "step": 1805 }, { "entropy": 5.931473588943481, "epoch": 0.16418722786647316, "grad_norm": 1.0625, "learning_rate": 0.0004999390959953441, "loss": 5.9745, "mean_token_accuracy": 0.1391763061285019, "num_tokens": 3756443.0, "step": 1810 }, { "entropy": 6.160908555984497, "epoch": 0.16464078374455732, "grad_norm": 1.1796875, "learning_rate": 0.0004999383408727002, "loss": 6.1473, "mean_token_accuracy": 0.13380085676908493, "num_tokens": 3767502.0, "step": 1815 }, { "entropy": 6.0393414974212645, "epoch": 0.1650943396226415, "grad_norm": 1.1171875, "learning_rate": 0.0004999375810982741, "loss": 6.0104, "mean_token_accuracy": 0.13753475695848466, "num_tokens": 3778476.0, "step": 1820 }, { "entropy": 6.044342517852783, "epoch": 0.16554789550072568, "grad_norm": 1.1015625, "learning_rate": 0.0004999368166720815, "loss": 6.069, "mean_token_accuracy": 0.13943940550088882, "num_tokens": 3788616.0, "step": 1825 }, { "entropy": 6.084714126586914, "epoch": 0.16600145137880987, "grad_norm": 1.140625, "learning_rate": 0.0004999360475941382, "loss": 6.0156, "mean_token_accuracy": 0.14626918584108353, "num_tokens": 3798257.0, "step": 1830 }, { "entropy": 6.04117636680603, "epoch": 0.16645500725689405, "grad_norm": 1.1328125, "learning_rate": 0.00049993527386446, "loss": 6.005, "mean_token_accuracy": 0.13517511934041976, "num_tokens": 3807833.0, "step": 1835 }, { "entropy": 6.109489679336548, "epoch": 0.16690856313497823, "grad_norm": 1.140625, "learning_rate": 0.0004999344954830633, "loss": 6.0797, "mean_token_accuracy": 0.13237160220742225, "num_tokens": 3817246.0, "step": 1840 }, { "entropy": 6.177425670623779, "epoch": 0.16736211901306242, "grad_norm": 1.2109375, "learning_rate": 0.0004999337124499638, "loss": 6.064, "mean_token_accuracy": 0.14445747211575508, "num_tokens": 3827709.0, "step": 1845 }, { "entropy": 5.908847332000732, "epoch": 0.1678156748911466, "grad_norm": 1.2265625, "learning_rate": 0.0004999329247651777, "loss": 6.0674, "mean_token_accuracy": 0.14029163047671317, "num_tokens": 3837498.0, "step": 1850 }, { "entropy": 6.158235931396485, "epoch": 0.16826923076923078, "grad_norm": 1.1015625, "learning_rate": 0.0004999321324287213, "loss": 6.0969, "mean_token_accuracy": 0.13958577588200569, "num_tokens": 3849227.0, "step": 1855 }, { "entropy": 5.956509160995483, "epoch": 0.16872278664731494, "grad_norm": 1.125, "learning_rate": 0.0004999313354406114, "loss": 6.0774, "mean_token_accuracy": 0.13036854714155197, "num_tokens": 3859110.0, "step": 1860 }, { "entropy": 6.06641263961792, "epoch": 0.16917634252539912, "grad_norm": 1.046875, "learning_rate": 0.000499930533800864, "loss": 6.0666, "mean_token_accuracy": 0.14033757895231247, "num_tokens": 3869906.0, "step": 1865 }, { "entropy": 6.1277564525604244, "epoch": 0.1696298984034833, "grad_norm": 1.046875, "learning_rate": 0.0004999297275094958, "loss": 6.0638, "mean_token_accuracy": 0.135610331594944, "num_tokens": 3880343.0, "step": 1870 }, { "entropy": 6.04757661819458, "epoch": 0.1700834542815675, "grad_norm": 1.0859375, "learning_rate": 0.0004999289165665235, "loss": 5.9914, "mean_token_accuracy": 0.13660356178879737, "num_tokens": 3890969.0, "step": 1875 }, { "entropy": 6.006391096115112, "epoch": 0.17053701015965167, "grad_norm": 1.078125, "learning_rate": 0.0004999281009719639, "loss": 5.9267, "mean_token_accuracy": 0.14178500920534134, "num_tokens": 3900744.0, "step": 1880 }, { "entropy": 5.981471347808838, "epoch": 0.17099056603773585, "grad_norm": 1.1015625, "learning_rate": 0.0004999272807258339, "loss": 6.0796, "mean_token_accuracy": 0.13724706768989564, "num_tokens": 3911415.0, "step": 1885 }, { "entropy": 6.117090654373169, "epoch": 0.17144412191582004, "grad_norm": 1.1484375, "learning_rate": 0.0004999264558281504, "loss": 6.0299, "mean_token_accuracy": 0.1346352569758892, "num_tokens": 3922405.0, "step": 1890 }, { "entropy": 6.084085512161255, "epoch": 0.17189767779390422, "grad_norm": 1.0, "learning_rate": 0.0004999256262789305, "loss": 6.0987, "mean_token_accuracy": 0.1346895545721054, "num_tokens": 3934715.0, "step": 1895 }, { "entropy": 5.962582588195801, "epoch": 0.1723512336719884, "grad_norm": 1.125, "learning_rate": 0.0004999247920781913, "loss": 5.9625, "mean_token_accuracy": 0.14006249159574508, "num_tokens": 3945410.0, "step": 1900 }, { "entropy": 6.040754938125611, "epoch": 0.17280478955007256, "grad_norm": 1.1484375, "learning_rate": 0.0004999239532259502, "loss": 6.022, "mean_token_accuracy": 0.13346246182918547, "num_tokens": 3956435.0, "step": 1905 }, { "entropy": 6.0511785507202145, "epoch": 0.17325834542815674, "grad_norm": 1.1171875, "learning_rate": 0.0004999231097222244, "loss": 5.9648, "mean_token_accuracy": 0.1416295848786831, "num_tokens": 3967855.0, "step": 1910 }, { "entropy": 6.059988403320313, "epoch": 0.17371190130624092, "grad_norm": 1.0390625, "learning_rate": 0.0004999222615670312, "loss": 6.1613, "mean_token_accuracy": 0.1296894371509552, "num_tokens": 3979467.0, "step": 1915 }, { "entropy": 6.160438489913941, "epoch": 0.1741654571843251, "grad_norm": 1.1171875, "learning_rate": 0.0004999214087603885, "loss": 6.1026, "mean_token_accuracy": 0.13720218911767007, "num_tokens": 3989624.0, "step": 1920 }, { "entropy": 6.01017427444458, "epoch": 0.1746190130624093, "grad_norm": 1.0234375, "learning_rate": 0.0004999205513023135, "loss": 5.9484, "mean_token_accuracy": 0.13784751817584037, "num_tokens": 4000408.0, "step": 1925 }, { "entropy": 5.971663951873779, "epoch": 0.17507256894049347, "grad_norm": 1.0859375, "learning_rate": 0.0004999196891928245, "loss": 5.9627, "mean_token_accuracy": 0.14002003520727158, "num_tokens": 4011110.0, "step": 1930 }, { "entropy": 6.0252245426177975, "epoch": 0.17552612481857766, "grad_norm": 1.28125, "learning_rate": 0.0004999188224319388, "loss": 6.0273, "mean_token_accuracy": 0.1419824965298176, "num_tokens": 4021370.0, "step": 1935 }, { "entropy": 6.083719778060913, "epoch": 0.17597968069666184, "grad_norm": 1.109375, "learning_rate": 0.0004999179510196746, "loss": 6.0176, "mean_token_accuracy": 0.1337435156106949, "num_tokens": 4032189.0, "step": 1940 }, { "entropy": 6.030994844436646, "epoch": 0.17643323657474602, "grad_norm": 1.125, "learning_rate": 0.0004999170749560498, "loss": 6.0009, "mean_token_accuracy": 0.13951044976711274, "num_tokens": 4043245.0, "step": 1945 }, { "entropy": 5.954610395431518, "epoch": 0.17688679245283018, "grad_norm": 1.15625, "learning_rate": 0.0004999161942410827, "loss": 5.9581, "mean_token_accuracy": 0.14021288603544235, "num_tokens": 4054432.0, "step": 1950 }, { "entropy": 6.065416479110718, "epoch": 0.17734034833091436, "grad_norm": 1.171875, "learning_rate": 0.0004999153088747913, "loss": 6.0134, "mean_token_accuracy": 0.14068708717823028, "num_tokens": 4064696.0, "step": 1955 }, { "entropy": 6.007389259338379, "epoch": 0.17779390420899854, "grad_norm": 1.0546875, "learning_rate": 0.000499914418857194, "loss": 6.0498, "mean_token_accuracy": 0.1319423608481884, "num_tokens": 4075556.0, "step": 1960 }, { "entropy": 6.072854518890381, "epoch": 0.17824746008708273, "grad_norm": 1.125, "learning_rate": 0.0004999135241883092, "loss": 6.0347, "mean_token_accuracy": 0.13773117437958718, "num_tokens": 4086532.0, "step": 1965 }, { "entropy": 6.0589231014251705, "epoch": 0.1787010159651669, "grad_norm": 1.1875, "learning_rate": 0.0004999126248681555, "loss": 6.04, "mean_token_accuracy": 0.13843712881207465, "num_tokens": 4096940.0, "step": 1970 }, { "entropy": 5.971566438674927, "epoch": 0.1791545718432511, "grad_norm": 1.15625, "learning_rate": 0.0004999117208967513, "loss": 5.9022, "mean_token_accuracy": 0.1378993310034275, "num_tokens": 4106074.0, "step": 1975 }, { "entropy": 6.018008756637573, "epoch": 0.17960812772133528, "grad_norm": 1.0078125, "learning_rate": 0.0004999108122741154, "loss": 5.9724, "mean_token_accuracy": 0.13504682332277299, "num_tokens": 4117738.0, "step": 1980 }, { "entropy": 6.027943420410156, "epoch": 0.18006168359941946, "grad_norm": 1.0703125, "learning_rate": 0.0004999098990002666, "loss": 5.9853, "mean_token_accuracy": 0.13756806403398514, "num_tokens": 4128244.0, "step": 1985 }, { "entropy": 5.966828727722168, "epoch": 0.18051523947750364, "grad_norm": 1.0703125, "learning_rate": 0.0004999089810752237, "loss": 6.0861, "mean_token_accuracy": 0.14235653579235077, "num_tokens": 4138139.0, "step": 1990 }, { "entropy": 6.050969362258911, "epoch": 0.1809687953555878, "grad_norm": 1.078125, "learning_rate": 0.000499908058499006, "loss": 5.9128, "mean_token_accuracy": 0.1413744457066059, "num_tokens": 4148150.0, "step": 1995 }, { "entropy": 6.0185212135314945, "epoch": 0.18142235123367198, "grad_norm": 1.078125, "learning_rate": 0.0004999071312716321, "loss": 6.0106, "mean_token_accuracy": 0.13587939217686654, "num_tokens": 4160223.0, "step": 2000 }, { "entropy": 5.95493450164795, "epoch": 0.18187590711175616, "grad_norm": 1.3515625, "learning_rate": 0.0004999061993931215, "loss": 5.9437, "mean_token_accuracy": 0.14110832214355468, "num_tokens": 4169948.0, "step": 2005 }, { "entropy": 6.005291557312011, "epoch": 0.18232946298984035, "grad_norm": 1.0625, "learning_rate": 0.0004999052628634934, "loss": 5.9396, "mean_token_accuracy": 0.14428384751081466, "num_tokens": 4179936.0, "step": 2010 }, { "entropy": 6.0180689811706545, "epoch": 0.18278301886792453, "grad_norm": 1.25, "learning_rate": 0.0004999043216827671, "loss": 5.9833, "mean_token_accuracy": 0.14723006561398505, "num_tokens": 4189698.0, "step": 2015 }, { "entropy": 6.009299468994141, "epoch": 0.1832365747460087, "grad_norm": 1.1171875, "learning_rate": 0.0004999033758509621, "loss": 6.1257, "mean_token_accuracy": 0.13319993391633034, "num_tokens": 4200162.0, "step": 2020 }, { "entropy": 6.149590396881104, "epoch": 0.1836901306240929, "grad_norm": 1.109375, "learning_rate": 0.000499902425368098, "loss": 6.0815, "mean_token_accuracy": 0.13354766517877578, "num_tokens": 4210470.0, "step": 2025 }, { "entropy": 5.932142543792724, "epoch": 0.18414368650217708, "grad_norm": 1.2265625, "learning_rate": 0.0004999014702341944, "loss": 5.8913, "mean_token_accuracy": 0.14411630854010582, "num_tokens": 4221062.0, "step": 2030 }, { "entropy": 5.980024766921997, "epoch": 0.18459724238026126, "grad_norm": 1.171875, "learning_rate": 0.0004999005104492712, "loss": 5.9284, "mean_token_accuracy": 0.14326827973127365, "num_tokens": 4231389.0, "step": 2035 }, { "entropy": 5.908800649642944, "epoch": 0.18505079825834542, "grad_norm": 1.0390625, "learning_rate": 0.0004998995460133481, "loss": 5.9101, "mean_token_accuracy": 0.13965596854686738, "num_tokens": 4241164.0, "step": 2040 }, { "entropy": 5.992084264755249, "epoch": 0.1855043541364296, "grad_norm": 1.1796875, "learning_rate": 0.0004998985769264451, "loss": 5.9429, "mean_token_accuracy": 0.14413947463035584, "num_tokens": 4251301.0, "step": 2045 }, { "entropy": 5.983407258987427, "epoch": 0.18595791001451378, "grad_norm": 1.3125, "learning_rate": 0.0004998976031885821, "loss": 5.8994, "mean_token_accuracy": 0.14310136139392854, "num_tokens": 4261600.0, "step": 2050 }, { "entropy": 6.001372003555298, "epoch": 0.18641146589259797, "grad_norm": 1.09375, "learning_rate": 0.0004998966247997794, "loss": 5.9863, "mean_token_accuracy": 0.13233172073960303, "num_tokens": 4271835.0, "step": 2055 }, { "entropy": 5.980549955368042, "epoch": 0.18686502177068215, "grad_norm": 1.0546875, "learning_rate": 0.0004998956417600572, "loss": 6.0495, "mean_token_accuracy": 0.13583017364144326, "num_tokens": 4282866.0, "step": 2060 }, { "entropy": 5.956373786926269, "epoch": 0.18731857764876633, "grad_norm": 1.109375, "learning_rate": 0.0004998946540694358, "loss": 5.8294, "mean_token_accuracy": 0.1468118757009506, "num_tokens": 4293092.0, "step": 2065 }, { "entropy": 5.973520803451538, "epoch": 0.18777213352685052, "grad_norm": 1.109375, "learning_rate": 0.0004998936617279357, "loss": 5.9067, "mean_token_accuracy": 0.13692934289574624, "num_tokens": 4302944.0, "step": 2070 }, { "entropy": 6.059836578369141, "epoch": 0.1882256894049347, "grad_norm": 1.1328125, "learning_rate": 0.0004998926647355773, "loss": 6.0568, "mean_token_accuracy": 0.1373896986246109, "num_tokens": 4314373.0, "step": 2075 }, { "entropy": 5.971044874191284, "epoch": 0.18867924528301888, "grad_norm": 1.1015625, "learning_rate": 0.0004998916630923813, "loss": 6.0485, "mean_token_accuracy": 0.13327606469392778, "num_tokens": 4325204.0, "step": 2080 }, { "entropy": 5.9976475715637205, "epoch": 0.18913280116110304, "grad_norm": 1.2421875, "learning_rate": 0.0004998906567983685, "loss": 5.9668, "mean_token_accuracy": 0.13214946836233138, "num_tokens": 4335667.0, "step": 2085 }, { "entropy": 5.938468980789184, "epoch": 0.18958635703918722, "grad_norm": 1.09375, "learning_rate": 0.0004998896458535595, "loss": 5.8699, "mean_token_accuracy": 0.14601458087563515, "num_tokens": 4345600.0, "step": 2090 }, { "entropy": 5.8882725715637205, "epoch": 0.1900399129172714, "grad_norm": 1.109375, "learning_rate": 0.0004998886302579752, "loss": 5.9109, "mean_token_accuracy": 0.14233326613903047, "num_tokens": 4355994.0, "step": 2095 }, { "entropy": 5.941480922698974, "epoch": 0.19049346879535559, "grad_norm": 1.09375, "learning_rate": 0.000499887610011637, "loss": 5.9773, "mean_token_accuracy": 0.1386798821389675, "num_tokens": 4367514.0, "step": 2100 }, { "entropy": 6.065828418731689, "epoch": 0.19094702467343977, "grad_norm": 1.09375, "learning_rate": 0.0004998865851145656, "loss": 6.0287, "mean_token_accuracy": 0.13639298528432847, "num_tokens": 4378186.0, "step": 2105 }, { "entropy": 6.01219220161438, "epoch": 0.19140058055152395, "grad_norm": 1.203125, "learning_rate": 0.0004998855555667822, "loss": 5.9504, "mean_token_accuracy": 0.14203562438488007, "num_tokens": 4388249.0, "step": 2110 }, { "entropy": 5.9509602069854735, "epoch": 0.19185413642960814, "grad_norm": 1.015625, "learning_rate": 0.0004998845213683084, "loss": 5.9511, "mean_token_accuracy": 0.14101598560810089, "num_tokens": 4398755.0, "step": 2115 }, { "entropy": 6.0761778354644775, "epoch": 0.19230769230769232, "grad_norm": 1.1875, "learning_rate": 0.0004998834825191652, "loss": 6.012, "mean_token_accuracy": 0.14403366893529893, "num_tokens": 4408336.0, "step": 2120 }, { "entropy": 6.001263093948364, "epoch": 0.1927612481857765, "grad_norm": 1.2109375, "learning_rate": 0.0004998824390193743, "loss": 5.9641, "mean_token_accuracy": 0.1412390351295471, "num_tokens": 4418780.0, "step": 2125 }, { "entropy": 5.989875268936157, "epoch": 0.19321480406386066, "grad_norm": 1.2421875, "learning_rate": 0.0004998813908689573, "loss": 5.9049, "mean_token_accuracy": 0.14285448640584947, "num_tokens": 4428780.0, "step": 2130 }, { "entropy": 5.930006456375122, "epoch": 0.19366835994194484, "grad_norm": 1.21875, "learning_rate": 0.0004998803380679359, "loss": 5.8762, "mean_token_accuracy": 0.14344791322946548, "num_tokens": 4439058.0, "step": 2135 }, { "entropy": 5.942577266693116, "epoch": 0.19412191582002902, "grad_norm": 1.1015625, "learning_rate": 0.0004998792806163317, "loss": 5.9551, "mean_token_accuracy": 0.14150920659303665, "num_tokens": 4450120.0, "step": 2140 }, { "entropy": 6.024294757843018, "epoch": 0.1945754716981132, "grad_norm": 1.1640625, "learning_rate": 0.0004998782185141667, "loss": 5.982, "mean_token_accuracy": 0.14056125581264495, "num_tokens": 4460622.0, "step": 2145 }, { "entropy": 5.960634088516235, "epoch": 0.1950290275761974, "grad_norm": 1.2109375, "learning_rate": 0.0004998771517614629, "loss": 5.9543, "mean_token_accuracy": 0.13400557562708854, "num_tokens": 4470494.0, "step": 2150 }, { "entropy": 6.062064456939697, "epoch": 0.19548258345428157, "grad_norm": 1.1484375, "learning_rate": 0.0004998760803582422, "loss": 6.0045, "mean_token_accuracy": 0.1384950064122677, "num_tokens": 4481135.0, "step": 2155 }, { "entropy": 5.964612913131714, "epoch": 0.19593613933236576, "grad_norm": 1.203125, "learning_rate": 0.0004998750043045269, "loss": 5.9767, "mean_token_accuracy": 0.13727275878190995, "num_tokens": 4491092.0, "step": 2160 }, { "entropy": 5.996477460861206, "epoch": 0.19638969521044994, "grad_norm": 1.1875, "learning_rate": 0.0004998739236003392, "loss": 5.975, "mean_token_accuracy": 0.14493463039398194, "num_tokens": 4501004.0, "step": 2165 }, { "entropy": 6.00132417678833, "epoch": 0.1968432510885341, "grad_norm": 1.1484375, "learning_rate": 0.0004998728382457014, "loss": 5.9459, "mean_token_accuracy": 0.14853413999080659, "num_tokens": 4510648.0, "step": 2170 }, { "entropy": 5.998470830917358, "epoch": 0.19729680696661828, "grad_norm": 1.2109375, "learning_rate": 0.0004998717482406362, "loss": 5.993, "mean_token_accuracy": 0.13211097493767737, "num_tokens": 4521999.0, "step": 2175 }, { "entropy": 5.93568229675293, "epoch": 0.19775036284470246, "grad_norm": 1.1015625, "learning_rate": 0.0004998706535851657, "loss": 5.9347, "mean_token_accuracy": 0.13946531787514688, "num_tokens": 4532209.0, "step": 2180 }, { "entropy": 6.073374080657959, "epoch": 0.19820391872278664, "grad_norm": 1.15625, "learning_rate": 0.0004998695542793129, "loss": 6.0389, "mean_token_accuracy": 0.13209992721676828, "num_tokens": 4542215.0, "step": 2185 }, { "entropy": 5.9528271675109865, "epoch": 0.19865747460087083, "grad_norm": 1.0859375, "learning_rate": 0.0004998684503231003, "loss": 5.9099, "mean_token_accuracy": 0.1399923861026764, "num_tokens": 4552424.0, "step": 2190 }, { "entropy": 5.9139893531799315, "epoch": 0.199111030478955, "grad_norm": 1.0859375, "learning_rate": 0.000499867341716551, "loss": 6.0183, "mean_token_accuracy": 0.13691750392317772, "num_tokens": 4562936.0, "step": 2195 }, { "entropy": 6.05651707649231, "epoch": 0.1995645863570392, "grad_norm": 1.125, "learning_rate": 0.0004998662284596878, "loss": 5.9132, "mean_token_accuracy": 0.14678076058626174, "num_tokens": 4573094.0, "step": 2200 }, { "entropy": 6.008046674728393, "epoch": 0.20001814223512338, "grad_norm": 1.1640625, "learning_rate": 0.0004998651105525335, "loss": 5.9501, "mean_token_accuracy": 0.13911140859127044, "num_tokens": 4583194.0, "step": 2205 }, { "entropy": 5.923662614822388, "epoch": 0.20047169811320756, "grad_norm": 1.0390625, "learning_rate": 0.0004998639879951115, "loss": 5.8844, "mean_token_accuracy": 0.14621676206588746, "num_tokens": 4593352.0, "step": 2210 }, { "entropy": 5.91765398979187, "epoch": 0.2009252539912917, "grad_norm": 1.1171875, "learning_rate": 0.000499862860787445, "loss": 5.8657, "mean_token_accuracy": 0.14437806457281113, "num_tokens": 4603895.0, "step": 2215 }, { "entropy": 5.987819957733154, "epoch": 0.2013788098693759, "grad_norm": 1.203125, "learning_rate": 0.0004998617289295571, "loss": 6.0096, "mean_token_accuracy": 0.13959661424160003, "num_tokens": 4614456.0, "step": 2220 }, { "entropy": 5.925340270996093, "epoch": 0.20183236574746008, "grad_norm": 1.1796875, "learning_rate": 0.0004998605924214714, "loss": 5.9116, "mean_token_accuracy": 0.14096696227788924, "num_tokens": 4624139.0, "step": 2225 }, { "entropy": 6.006181907653809, "epoch": 0.20228592162554426, "grad_norm": 1.4296875, "learning_rate": 0.0004998594512632114, "loss": 5.9403, "mean_token_accuracy": 0.14316802397370337, "num_tokens": 4634208.0, "step": 2230 }, { "entropy": 5.891085243225097, "epoch": 0.20273947750362845, "grad_norm": 1.109375, "learning_rate": 0.0004998583054548006, "loss": 6.0011, "mean_token_accuracy": 0.1386461637914181, "num_tokens": 4646019.0, "step": 2235 }, { "entropy": 6.067434978485108, "epoch": 0.20319303338171263, "grad_norm": 1.1640625, "learning_rate": 0.0004998571549962628, "loss": 6.0042, "mean_token_accuracy": 0.13608953431248666, "num_tokens": 4656604.0, "step": 2240 }, { "entropy": 6.018786478042602, "epoch": 0.2036465892597968, "grad_norm": 1.5625, "learning_rate": 0.0004998559998876216, "loss": 5.905, "mean_token_accuracy": 0.14071310609579085, "num_tokens": 4667373.0, "step": 2245 }, { "entropy": 6.00168890953064, "epoch": 0.204100145137881, "grad_norm": 1.203125, "learning_rate": 0.0004998548401289012, "loss": 5.9825, "mean_token_accuracy": 0.13470427468419074, "num_tokens": 4678351.0, "step": 2250 }, { "entropy": 5.980109548568725, "epoch": 0.20455370101596518, "grad_norm": 1.125, "learning_rate": 0.0004998536757201253, "loss": 5.9328, "mean_token_accuracy": 0.13843259811401368, "num_tokens": 4688414.0, "step": 2255 }, { "entropy": 5.926772880554199, "epoch": 0.20500725689404933, "grad_norm": 1.0703125, "learning_rate": 0.0004998525066613181, "loss": 5.9745, "mean_token_accuracy": 0.14305582344532014, "num_tokens": 4699031.0, "step": 2260 }, { "entropy": 5.994556140899658, "epoch": 0.20546081277213352, "grad_norm": 1.1796875, "learning_rate": 0.0004998513329525038, "loss": 5.8892, "mean_token_accuracy": 0.1420019529759884, "num_tokens": 4709559.0, "step": 2265 }, { "entropy": 5.835793304443359, "epoch": 0.2059143686502177, "grad_norm": 1.1484375, "learning_rate": 0.0004998501545937066, "loss": 5.8173, "mean_token_accuracy": 0.1476012036204338, "num_tokens": 4719887.0, "step": 2270 }, { "entropy": 5.935054349899292, "epoch": 0.20636792452830188, "grad_norm": 1.03125, "learning_rate": 0.000499848971584951, "loss": 5.8989, "mean_token_accuracy": 0.1409054510295391, "num_tokens": 4730105.0, "step": 2275 }, { "entropy": 5.962164735794067, "epoch": 0.20682148040638607, "grad_norm": 1.234375, "learning_rate": 0.0004998477839262611, "loss": 5.9575, "mean_token_accuracy": 0.13953802660107611, "num_tokens": 4740447.0, "step": 2280 }, { "entropy": 5.928989315032959, "epoch": 0.20727503628447025, "grad_norm": 1.1953125, "learning_rate": 0.000499846591617662, "loss": 5.9272, "mean_token_accuracy": 0.14312953129410744, "num_tokens": 4750709.0, "step": 2285 }, { "entropy": 5.949032163619995, "epoch": 0.20772859216255443, "grad_norm": 1.1953125, "learning_rate": 0.0004998453946591779, "loss": 5.9673, "mean_token_accuracy": 0.14141981452703475, "num_tokens": 4760349.0, "step": 2290 }, { "entropy": 6.042676591873169, "epoch": 0.20818214804063861, "grad_norm": 1.171875, "learning_rate": 0.0004998441930508339, "loss": 6.0217, "mean_token_accuracy": 0.13636812418699265, "num_tokens": 4770488.0, "step": 2295 }, { "entropy": 5.99560956954956, "epoch": 0.2086357039187228, "grad_norm": 1.2109375, "learning_rate": 0.0004998429867926547, "loss": 5.9516, "mean_token_accuracy": 0.13818990290164948, "num_tokens": 4779991.0, "step": 2300 }, { "entropy": 5.914564037322998, "epoch": 0.20908925979680695, "grad_norm": 1.2109375, "learning_rate": 0.0004998417758846651, "loss": 5.8844, "mean_token_accuracy": 0.14226182624697686, "num_tokens": 4790160.0, "step": 2305 }, { "entropy": 5.927054691314697, "epoch": 0.20954281567489114, "grad_norm": 1.25, "learning_rate": 0.0004998405603268903, "loss": 5.7898, "mean_token_accuracy": 0.14916908890008926, "num_tokens": 4800268.0, "step": 2310 }, { "entropy": 5.854596281051636, "epoch": 0.20999637155297532, "grad_norm": 1.1875, "learning_rate": 0.0004998393401193554, "loss": 5.8737, "mean_token_accuracy": 0.14095887839794158, "num_tokens": 4810777.0, "step": 2315 }, { "entropy": 6.093844556808472, "epoch": 0.2104499274310595, "grad_norm": 1.2109375, "learning_rate": 0.0004998381152620857, "loss": 6.0447, "mean_token_accuracy": 0.13425768688321113, "num_tokens": 4821966.0, "step": 2320 }, { "entropy": 6.052251672744751, "epoch": 0.21090348330914369, "grad_norm": 1.203125, "learning_rate": 0.0004998368857551067, "loss": 5.9375, "mean_token_accuracy": 0.1455095313489437, "num_tokens": 4832175.0, "step": 2325 }, { "entropy": 5.84284200668335, "epoch": 0.21135703918722787, "grad_norm": 1.296875, "learning_rate": 0.0004998356515984433, "loss": 5.8432, "mean_token_accuracy": 0.14820571541786193, "num_tokens": 4841506.0, "step": 2330 }, { "entropy": 5.887610673904419, "epoch": 0.21181059506531205, "grad_norm": 1.1875, "learning_rate": 0.0004998344127921213, "loss": 5.9033, "mean_token_accuracy": 0.13908652514219283, "num_tokens": 4851169.0, "step": 2335 }, { "entropy": 5.955441951751709, "epoch": 0.21226415094339623, "grad_norm": 1.1640625, "learning_rate": 0.0004998331693361666, "loss": 5.8309, "mean_token_accuracy": 0.14300615340471268, "num_tokens": 4860957.0, "step": 2340 }, { "entropy": 6.039245557785034, "epoch": 0.21271770682148042, "grad_norm": 1.2265625, "learning_rate": 0.0004998319212306046, "loss": 6.0324, "mean_token_accuracy": 0.12900658324360847, "num_tokens": 4872809.0, "step": 2345 }, { "entropy": 5.892557668685913, "epoch": 0.21317126269956457, "grad_norm": 1.1953125, "learning_rate": 0.000499830668475461, "loss": 5.8898, "mean_token_accuracy": 0.14457644373178483, "num_tokens": 4882487.0, "step": 2350 }, { "entropy": 5.989882373809815, "epoch": 0.21362481857764876, "grad_norm": 1.0546875, "learning_rate": 0.000499829411070762, "loss": 5.989, "mean_token_accuracy": 0.1365087829530239, "num_tokens": 4894084.0, "step": 2355 }, { "entropy": 5.947244024276733, "epoch": 0.21407837445573294, "grad_norm": 1.125, "learning_rate": 0.0004998281490165335, "loss": 5.892, "mean_token_accuracy": 0.14107751250267028, "num_tokens": 4905336.0, "step": 2360 }, { "entropy": 5.917174339294434, "epoch": 0.21453193033381712, "grad_norm": 1.125, "learning_rate": 0.0004998268823128016, "loss": 5.9134, "mean_token_accuracy": 0.14147956743836404, "num_tokens": 4916271.0, "step": 2365 }, { "entropy": 5.941757583618164, "epoch": 0.2149854862119013, "grad_norm": 1.171875, "learning_rate": 0.0004998256109595923, "loss": 5.9371, "mean_token_accuracy": 0.14648856744170188, "num_tokens": 4926284.0, "step": 2370 }, { "entropy": 6.002183961868286, "epoch": 0.2154390420899855, "grad_norm": 1.234375, "learning_rate": 0.0004998243349569323, "loss": 5.9466, "mean_token_accuracy": 0.14225479438900948, "num_tokens": 4936771.0, "step": 2375 }, { "entropy": 5.98759355545044, "epoch": 0.21589259796806967, "grad_norm": 1.1328125, "learning_rate": 0.0004998230543048477, "loss": 6.0056, "mean_token_accuracy": 0.142339825630188, "num_tokens": 4947148.0, "step": 2380 }, { "entropy": 5.987500143051148, "epoch": 0.21634615384615385, "grad_norm": 1.0625, "learning_rate": 0.000499821769003365, "loss": 5.9377, "mean_token_accuracy": 0.14021862521767617, "num_tokens": 4957790.0, "step": 2385 }, { "entropy": 5.997272586822509, "epoch": 0.21679970972423804, "grad_norm": 1.234375, "learning_rate": 0.0004998204790525109, "loss": 5.9226, "mean_token_accuracy": 0.14474812299013137, "num_tokens": 4967266.0, "step": 2390 }, { "entropy": 5.935082054138183, "epoch": 0.2172532656023222, "grad_norm": 1.2109375, "learning_rate": 0.0004998191844523119, "loss": 5.9333, "mean_token_accuracy": 0.14002179726958275, "num_tokens": 4977147.0, "step": 2395 }, { "entropy": 5.969844818115234, "epoch": 0.21770682148040638, "grad_norm": 1.15625, "learning_rate": 0.000499817885202795, "loss": 5.9435, "mean_token_accuracy": 0.14077059850096701, "num_tokens": 4986221.0, "step": 2400 }, { "entropy": 5.965543937683106, "epoch": 0.21816037735849056, "grad_norm": 1.1484375, "learning_rate": 0.0004998165813039869, "loss": 5.928, "mean_token_accuracy": 0.14429101943969727, "num_tokens": 4997015.0, "step": 2405 }, { "entropy": 5.987357711791992, "epoch": 0.21861393323657474, "grad_norm": 1.03125, "learning_rate": 0.0004998152727559145, "loss": 5.9535, "mean_token_accuracy": 0.1384763464331627, "num_tokens": 5007210.0, "step": 2410 }, { "entropy": 5.9590071678161625, "epoch": 0.21906748911465893, "grad_norm": 1.015625, "learning_rate": 0.000499813959558605, "loss": 5.8448, "mean_token_accuracy": 0.14687777310609818, "num_tokens": 5018522.0, "step": 2415 }, { "entropy": 5.920127916336059, "epoch": 0.2195210449927431, "grad_norm": 1.015625, "learning_rate": 0.0004998126417120856, "loss": 5.8532, "mean_token_accuracy": 0.14418737962841988, "num_tokens": 5028704.0, "step": 2420 }, { "entropy": 5.925795173645019, "epoch": 0.2199746008708273, "grad_norm": 1.1796875, "learning_rate": 0.0004998113192163835, "loss": 5.9707, "mean_token_accuracy": 0.1384512260556221, "num_tokens": 5038714.0, "step": 2425 }, { "entropy": 5.915235757827759, "epoch": 0.22042815674891147, "grad_norm": 1.21875, "learning_rate": 0.000499809992071526, "loss": 5.8578, "mean_token_accuracy": 0.1408664584159851, "num_tokens": 5048932.0, "step": 2430 }, { "entropy": 5.9984221935272215, "epoch": 0.22088171262699566, "grad_norm": 1.109375, "learning_rate": 0.0004998086602775406, "loss": 5.9102, "mean_token_accuracy": 0.140318613499403, "num_tokens": 5059027.0, "step": 2435 }, { "entropy": 5.9371038436889645, "epoch": 0.2213352685050798, "grad_norm": 1.125, "learning_rate": 0.0004998073238344547, "loss": 5.9129, "mean_token_accuracy": 0.1459469713270664, "num_tokens": 5069277.0, "step": 2440 }, { "entropy": 5.962320852279663, "epoch": 0.221788824383164, "grad_norm": 1.2421875, "learning_rate": 0.0004998059827422962, "loss": 5.9677, "mean_token_accuracy": 0.14480481147766114, "num_tokens": 5079282.0, "step": 2445 }, { "entropy": 5.982713794708252, "epoch": 0.22224238026124818, "grad_norm": 1.2421875, "learning_rate": 0.0004998046370010926, "loss": 5.9289, "mean_token_accuracy": 0.14125189632177354, "num_tokens": 5089847.0, "step": 2450 }, { "entropy": 5.867915201187134, "epoch": 0.22269593613933236, "grad_norm": 1.25, "learning_rate": 0.0004998032866108718, "loss": 5.8794, "mean_token_accuracy": 0.14892499893903732, "num_tokens": 5099305.0, "step": 2455 }, { "entropy": 5.875945329666138, "epoch": 0.22314949201741655, "grad_norm": 1.1953125, "learning_rate": 0.0004998019315716618, "loss": 5.7864, "mean_token_accuracy": 0.14948971420526505, "num_tokens": 5109394.0, "step": 2460 }, { "entropy": 5.978427791595459, "epoch": 0.22360304789550073, "grad_norm": 1.2421875, "learning_rate": 0.0004998005718834905, "loss": 6.0369, "mean_token_accuracy": 0.13315446451306343, "num_tokens": 5119999.0, "step": 2465 }, { "entropy": 6.013746356964111, "epoch": 0.2240566037735849, "grad_norm": 1.0546875, "learning_rate": 0.0004997992075463862, "loss": 6.0137, "mean_token_accuracy": 0.13928034231066705, "num_tokens": 5130828.0, "step": 2470 }, { "entropy": 6.077896165847778, "epoch": 0.2245101596516691, "grad_norm": 1.1640625, "learning_rate": 0.0004997978385603769, "loss": 5.936, "mean_token_accuracy": 0.1441244065761566, "num_tokens": 5140477.0, "step": 2475 }, { "entropy": 5.827495908737182, "epoch": 0.22496371552975328, "grad_norm": 1.1875, "learning_rate": 0.0004997964649254911, "loss": 5.9129, "mean_token_accuracy": 0.1431684747338295, "num_tokens": 5150934.0, "step": 2480 }, { "entropy": 6.012978363037109, "epoch": 0.22541727140783743, "grad_norm": 1.203125, "learning_rate": 0.0004997950866417572, "loss": 5.8917, "mean_token_accuracy": 0.14228983074426652, "num_tokens": 5160446.0, "step": 2485 }, { "entropy": 5.945698070526123, "epoch": 0.22587082728592162, "grad_norm": 1.0703125, "learning_rate": 0.0004997937037092034, "loss": 5.9799, "mean_token_accuracy": 0.13791251853108405, "num_tokens": 5171818.0, "step": 2490 }, { "entropy": 5.991513013839722, "epoch": 0.2263243831640058, "grad_norm": 1.1953125, "learning_rate": 0.0004997923161278587, "loss": 5.9261, "mean_token_accuracy": 0.14048070907592775, "num_tokens": 5181357.0, "step": 2495 }, { "entropy": 5.976591348648071, "epoch": 0.22677793904208998, "grad_norm": 1.25, "learning_rate": 0.0004997909238977514, "loss": 5.9351, "mean_token_accuracy": 0.13984388560056688, "num_tokens": 5190952.0, "step": 2500 }, { "entropy": 5.979648303985596, "epoch": 0.22723149492017417, "grad_norm": 1.1796875, "learning_rate": 0.0004997895270189108, "loss": 5.942, "mean_token_accuracy": 0.15530682802200318, "num_tokens": 5200757.0, "step": 2505 }, { "entropy": 6.040076065063476, "epoch": 0.22768505079825835, "grad_norm": 1.25, "learning_rate": 0.0004997881254913653, "loss": 5.9891, "mean_token_accuracy": 0.13575384318828582, "num_tokens": 5212160.0, "step": 2510 }, { "entropy": 5.943009519577027, "epoch": 0.22813860667634253, "grad_norm": 1.265625, "learning_rate": 0.0004997867193151441, "loss": 5.9362, "mean_token_accuracy": 0.14286721348762513, "num_tokens": 5222274.0, "step": 2515 }, { "entropy": 5.955537176132202, "epoch": 0.22859216255442671, "grad_norm": 1.609375, "learning_rate": 0.0004997853084902763, "loss": 5.9225, "mean_token_accuracy": 0.14721989408135414, "num_tokens": 5232657.0, "step": 2520 }, { "entropy": 6.057634258270264, "epoch": 0.2290457184325109, "grad_norm": 1.2109375, "learning_rate": 0.0004997838930167911, "loss": 5.9874, "mean_token_accuracy": 0.14284725338220597, "num_tokens": 5242789.0, "step": 2525 }, { "entropy": 5.972007989883423, "epoch": 0.22949927431059505, "grad_norm": 1.2265625, "learning_rate": 0.0004997824728947176, "loss": 5.9744, "mean_token_accuracy": 0.1313949629664421, "num_tokens": 5254045.0, "step": 2530 }, { "entropy": 5.916559791564941, "epoch": 0.22995283018867924, "grad_norm": 1.203125, "learning_rate": 0.0004997810481240853, "loss": 5.8952, "mean_token_accuracy": 0.1435857117176056, "num_tokens": 5263356.0, "step": 2535 }, { "entropy": 5.9302077293396, "epoch": 0.23040638606676342, "grad_norm": 1.28125, "learning_rate": 0.0004997796187049238, "loss": 5.8347, "mean_token_accuracy": 0.14040180593729018, "num_tokens": 5273449.0, "step": 2540 }, { "entropy": 5.912052631378174, "epoch": 0.2308599419448476, "grad_norm": 1.078125, "learning_rate": 0.0004997781846372623, "loss": 5.9068, "mean_token_accuracy": 0.1452646702528, "num_tokens": 5284594.0, "step": 2545 }, { "entropy": 5.873109149932861, "epoch": 0.23131349782293179, "grad_norm": 1.28125, "learning_rate": 0.0004997767459211307, "loss": 5.8432, "mean_token_accuracy": 0.1450057938694954, "num_tokens": 5295138.0, "step": 2550 }, { "entropy": 5.952861070632935, "epoch": 0.23176705370101597, "grad_norm": 1.2578125, "learning_rate": 0.0004997753025565587, "loss": 5.8315, "mean_token_accuracy": 0.14779942333698273, "num_tokens": 5305430.0, "step": 2555 }, { "entropy": 5.839398622512817, "epoch": 0.23222060957910015, "grad_norm": 1.1640625, "learning_rate": 0.0004997738545435763, "loss": 5.8083, "mean_token_accuracy": 0.14324629306793213, "num_tokens": 5315626.0, "step": 2560 }, { "entropy": 5.854900598526001, "epoch": 0.23267416545718433, "grad_norm": 1.25, "learning_rate": 0.0004997724018822133, "loss": 5.8666, "mean_token_accuracy": 0.14416230767965316, "num_tokens": 5325010.0, "step": 2565 }, { "entropy": 5.936237144470215, "epoch": 0.23312772133526852, "grad_norm": 1.140625, "learning_rate": 0.0004997709445724996, "loss": 5.8806, "mean_token_accuracy": 0.14533936828374863, "num_tokens": 5335835.0, "step": 2570 }, { "entropy": 5.905138731002808, "epoch": 0.23358127721335267, "grad_norm": 1.1953125, "learning_rate": 0.0004997694826144656, "loss": 5.9236, "mean_token_accuracy": 0.14513202160596847, "num_tokens": 5346709.0, "step": 2575 }, { "entropy": 5.902335453033447, "epoch": 0.23403483309143686, "grad_norm": 1.234375, "learning_rate": 0.0004997680160081414, "loss": 5.8284, "mean_token_accuracy": 0.14653799757361413, "num_tokens": 5357285.0, "step": 2580 }, { "entropy": 5.973487043380738, "epoch": 0.23448838896952104, "grad_norm": 1.5, "learning_rate": 0.0004997665447535573, "loss": 6.0278, "mean_token_accuracy": 0.1390775978565216, "num_tokens": 5366662.0, "step": 2585 }, { "entropy": 6.149343061447143, "epoch": 0.23494194484760522, "grad_norm": 1.2578125, "learning_rate": 0.0004997650688507438, "loss": 6.0375, "mean_token_accuracy": 0.13486452773213387, "num_tokens": 5377516.0, "step": 2590 }, { "entropy": 5.886330938339233, "epoch": 0.2353955007256894, "grad_norm": 1.1796875, "learning_rate": 0.0004997635882997314, "loss": 5.8939, "mean_token_accuracy": 0.15408131331205369, "num_tokens": 5387557.0, "step": 2595 }, { "entropy": 5.851848316192627, "epoch": 0.2358490566037736, "grad_norm": 1.1015625, "learning_rate": 0.0004997621031005507, "loss": 5.8844, "mean_token_accuracy": 0.1519714578986168, "num_tokens": 5397862.0, "step": 2600 }, { "entropy": 5.8382651805877686, "epoch": 0.23630261248185777, "grad_norm": 1.2734375, "learning_rate": 0.0004997606132532325, "loss": 5.9154, "mean_token_accuracy": 0.13924724757671356, "num_tokens": 5408368.0, "step": 2605 }, { "entropy": 5.978755903244019, "epoch": 0.23675616835994195, "grad_norm": 1.015625, "learning_rate": 0.0004997591187578075, "loss": 5.8955, "mean_token_accuracy": 0.14127107188105584, "num_tokens": 5419315.0, "step": 2610 }, { "entropy": 5.983459186553955, "epoch": 0.23720972423802614, "grad_norm": 1.1328125, "learning_rate": 0.0004997576196143067, "loss": 5.8621, "mean_token_accuracy": 0.13962915763258935, "num_tokens": 5429417.0, "step": 2615 }, { "entropy": 5.836444425582886, "epoch": 0.2376632801161103, "grad_norm": 1.2734375, "learning_rate": 0.000499756115822761, "loss": 5.7937, "mean_token_accuracy": 0.14924170970916747, "num_tokens": 5438697.0, "step": 2620 }, { "entropy": 5.8208709239959715, "epoch": 0.23811683599419448, "grad_norm": 1.2421875, "learning_rate": 0.0004997546073832015, "loss": 5.868, "mean_token_accuracy": 0.14800073951482773, "num_tokens": 5448566.0, "step": 2625 }, { "entropy": 5.945734119415283, "epoch": 0.23857039187227866, "grad_norm": 1.2890625, "learning_rate": 0.0004997530942956595, "loss": 5.8393, "mean_token_accuracy": 0.14892902076244355, "num_tokens": 5457716.0, "step": 2630 }, { "entropy": 5.8889336585998535, "epoch": 0.23902394775036284, "grad_norm": 1.2421875, "learning_rate": 0.0004997515765601662, "loss": 5.9133, "mean_token_accuracy": 0.14614535719156266, "num_tokens": 5467905.0, "step": 2635 }, { "entropy": 5.860836315155029, "epoch": 0.23947750362844702, "grad_norm": 1.234375, "learning_rate": 0.0004997500541767531, "loss": 5.7794, "mean_token_accuracy": 0.14639949202537536, "num_tokens": 5477840.0, "step": 2640 }, { "entropy": 5.775539827346802, "epoch": 0.2399310595065312, "grad_norm": 1.7421875, "learning_rate": 0.0004997485271454516, "loss": 5.783, "mean_token_accuracy": 0.14732736945152283, "num_tokens": 5488336.0, "step": 2645 }, { "entropy": 5.97319803237915, "epoch": 0.2403846153846154, "grad_norm": 1.125, "learning_rate": 0.0004997469954662933, "loss": 5.9824, "mean_token_accuracy": 0.1375535361468792, "num_tokens": 5499663.0, "step": 2650 }, { "entropy": 5.995337295532226, "epoch": 0.24083817126269957, "grad_norm": 1.28125, "learning_rate": 0.0004997454591393097, "loss": 5.8985, "mean_token_accuracy": 0.1435574099421501, "num_tokens": 5508899.0, "step": 2655 }, { "entropy": 5.879145812988281, "epoch": 0.24129172714078376, "grad_norm": 1.203125, "learning_rate": 0.0004997439181645329, "loss": 5.8628, "mean_token_accuracy": 0.14226806908845901, "num_tokens": 5518523.0, "step": 2660 }, { "entropy": 5.9952600479125975, "epoch": 0.2417452830188679, "grad_norm": 1.15625, "learning_rate": 0.0004997423725419945, "loss": 5.9503, "mean_token_accuracy": 0.14343410283327102, "num_tokens": 5528751.0, "step": 2665 }, { "entropy": 6.054172945022583, "epoch": 0.2421988388969521, "grad_norm": 1.2109375, "learning_rate": 0.0004997408222717267, "loss": 5.8535, "mean_token_accuracy": 0.14445326030254363, "num_tokens": 5538769.0, "step": 2670 }, { "entropy": 5.828339338302612, "epoch": 0.24265239477503628, "grad_norm": 1.265625, "learning_rate": 0.0004997392673537612, "loss": 5.8943, "mean_token_accuracy": 0.14723632782697677, "num_tokens": 5549229.0, "step": 2675 }, { "entropy": 6.001218986511231, "epoch": 0.24310595065312046, "grad_norm": 1.0859375, "learning_rate": 0.0004997377077881306, "loss": 6.0027, "mean_token_accuracy": 0.13532417714595796, "num_tokens": 5561115.0, "step": 2680 }, { "entropy": 5.941242027282715, "epoch": 0.24355950653120464, "grad_norm": 1.15625, "learning_rate": 0.0004997361435748668, "loss": 5.8692, "mean_token_accuracy": 0.14536329954862595, "num_tokens": 5571995.0, "step": 2685 }, { "entropy": 5.888056325912475, "epoch": 0.24401306240928883, "grad_norm": 1.1171875, "learning_rate": 0.0004997345747140024, "loss": 5.826, "mean_token_accuracy": 0.14596109837293625, "num_tokens": 5582477.0, "step": 2690 }, { "entropy": 5.9173914909362795, "epoch": 0.244466618287373, "grad_norm": 1.140625, "learning_rate": 0.0004997330012055695, "loss": 5.7922, "mean_token_accuracy": 0.15324772000312806, "num_tokens": 5592355.0, "step": 2695 }, { "entropy": 5.7889283180236815, "epoch": 0.2449201741654572, "grad_norm": 1.1640625, "learning_rate": 0.0004997314230496011, "loss": 5.8323, "mean_token_accuracy": 0.14904937148094177, "num_tokens": 5602448.0, "step": 2700 }, { "entropy": 5.879192256927491, "epoch": 0.24537373004354138, "grad_norm": 1.109375, "learning_rate": 0.0004997298402461296, "loss": 5.8207, "mean_token_accuracy": 0.14821702241897583, "num_tokens": 5613501.0, "step": 2705 }, { "entropy": 5.954217576980591, "epoch": 0.24582728592162553, "grad_norm": 1.0625, "learning_rate": 0.0004997282527951876, "loss": 5.8956, "mean_token_accuracy": 0.14211225211620332, "num_tokens": 5624834.0, "step": 2710 }, { "entropy": 5.956999349594116, "epoch": 0.24628084179970972, "grad_norm": 1.15625, "learning_rate": 0.0004997266606968081, "loss": 5.9062, "mean_token_accuracy": 0.14094941169023514, "num_tokens": 5635200.0, "step": 2715 }, { "entropy": 5.852967071533203, "epoch": 0.2467343976777939, "grad_norm": 1.109375, "learning_rate": 0.0004997250639510241, "loss": 5.7953, "mean_token_accuracy": 0.14844689518213272, "num_tokens": 5645710.0, "step": 2720 }, { "entropy": 5.750450468063354, "epoch": 0.24718795355587808, "grad_norm": 1.328125, "learning_rate": 0.0004997234625578684, "loss": 5.7916, "mean_token_accuracy": 0.13893610686063768, "num_tokens": 5655898.0, "step": 2725 }, { "entropy": 5.899655771255493, "epoch": 0.24764150943396226, "grad_norm": 1.09375, "learning_rate": 0.0004997218565173742, "loss": 5.8707, "mean_token_accuracy": 0.14310870319604874, "num_tokens": 5666412.0, "step": 2730 }, { "entropy": 5.898589086532593, "epoch": 0.24809506531204645, "grad_norm": 1.2265625, "learning_rate": 0.0004997202458295748, "loss": 5.9183, "mean_token_accuracy": 0.14258762449026108, "num_tokens": 5676410.0, "step": 2735 }, { "entropy": 5.940978002548218, "epoch": 0.24854862119013063, "grad_norm": 1.1484375, "learning_rate": 0.0004997186304945034, "loss": 5.8711, "mean_token_accuracy": 0.13710892349481582, "num_tokens": 5687033.0, "step": 2740 }, { "entropy": 5.84973406791687, "epoch": 0.24900217706821481, "grad_norm": 1.1796875, "learning_rate": 0.0004997170105121935, "loss": 5.7994, "mean_token_accuracy": 0.14377631098031998, "num_tokens": 5696310.0, "step": 2745 }, { "entropy": 5.842684984207153, "epoch": 0.249455732946299, "grad_norm": 1.1328125, "learning_rate": 0.0004997153858826786, "loss": 5.8483, "mean_token_accuracy": 0.15185194611549377, "num_tokens": 5706275.0, "step": 2750 }, { "entropy": 5.912807130813599, "epoch": 0.24990928882438315, "grad_norm": 1.1953125, "learning_rate": 0.0004997137566059922, "loss": 5.9279, "mean_token_accuracy": 0.1422789663076401, "num_tokens": 5716572.0, "step": 2755 }, { "entropy": 5.954165983200073, "epoch": 0.25036284470246734, "grad_norm": 1.2109375, "learning_rate": 0.0004997121226821681, "loss": 5.8373, "mean_token_accuracy": 0.14658476859331132, "num_tokens": 5726469.0, "step": 2760 }, { "entropy": 5.846992874145508, "epoch": 0.25081640058055155, "grad_norm": 1.1171875, "learning_rate": 0.00049971048411124, "loss": 5.7856, "mean_token_accuracy": 0.1450542390346527, "num_tokens": 5737126.0, "step": 2765 }, { "entropy": 5.932477760314941, "epoch": 0.2512699564586357, "grad_norm": 1.15625, "learning_rate": 0.0004997088408932418, "loss": 5.9739, "mean_token_accuracy": 0.14914767369627951, "num_tokens": 5747557.0, "step": 2770 }, { "entropy": 5.90068359375, "epoch": 0.25172351233671986, "grad_norm": 1.125, "learning_rate": 0.0004997071930282076, "loss": 5.9454, "mean_token_accuracy": 0.13878969848155975, "num_tokens": 5758652.0, "step": 2775 }, { "entropy": 5.963881874084473, "epoch": 0.25217706821480407, "grad_norm": 1.1796875, "learning_rate": 0.0004997055405161712, "loss": 5.8894, "mean_token_accuracy": 0.14103187918663024, "num_tokens": 5768889.0, "step": 2780 }, { "entropy": 5.9532280445098875, "epoch": 0.2526306240928882, "grad_norm": 1.28125, "learning_rate": 0.0004997038833571671, "loss": 5.8383, "mean_token_accuracy": 0.14568528681993484, "num_tokens": 5779401.0, "step": 2785 }, { "entropy": 5.858279228210449, "epoch": 0.25308417997097243, "grad_norm": 1.171875, "learning_rate": 0.0004997022215512295, "loss": 5.8208, "mean_token_accuracy": 0.14427980780601501, "num_tokens": 5790481.0, "step": 2790 }, { "entropy": 5.93959412574768, "epoch": 0.2535377358490566, "grad_norm": 1.1328125, "learning_rate": 0.0004997005550983925, "loss": 5.9005, "mean_token_accuracy": 0.1436707317829132, "num_tokens": 5801050.0, "step": 2795 }, { "entropy": 5.937245941162109, "epoch": 0.2539912917271408, "grad_norm": 1.1796875, "learning_rate": 0.000499698883998691, "loss": 5.8902, "mean_token_accuracy": 0.1422402374446392, "num_tokens": 5812277.0, "step": 2800 }, { "entropy": 5.900210762023926, "epoch": 0.25444484760522496, "grad_norm": 1.203125, "learning_rate": 0.0004996972082521591, "loss": 5.902, "mean_token_accuracy": 0.1445831313729286, "num_tokens": 5822300.0, "step": 2805 }, { "entropy": 5.884892416000366, "epoch": 0.25489840348330917, "grad_norm": 1.3125, "learning_rate": 0.0004996955278588319, "loss": 5.8068, "mean_token_accuracy": 0.15077413916587828, "num_tokens": 5831764.0, "step": 2810 }, { "entropy": 5.913922739028931, "epoch": 0.2553519593613933, "grad_norm": 1.234375, "learning_rate": 0.0004996938428187437, "loss": 5.8143, "mean_token_accuracy": 0.1524057112634182, "num_tokens": 5841651.0, "step": 2815 }, { "entropy": 5.9320954322814945, "epoch": 0.2558055152394775, "grad_norm": 1.1328125, "learning_rate": 0.0004996921531319297, "loss": 5.8831, "mean_token_accuracy": 0.14498303830623627, "num_tokens": 5851855.0, "step": 2820 }, { "entropy": 5.932426071166992, "epoch": 0.2562590711175617, "grad_norm": 1.265625, "learning_rate": 0.0004996904587984246, "loss": 5.9912, "mean_token_accuracy": 0.13337972834706308, "num_tokens": 5863190.0, "step": 2825 }, { "entropy": 6.019015502929688, "epoch": 0.25671262699564584, "grad_norm": 1.4765625, "learning_rate": 0.0004996887598182636, "loss": 5.9354, "mean_token_accuracy": 0.14033464342355728, "num_tokens": 5873771.0, "step": 2830 }, { "entropy": 5.9573073387146, "epoch": 0.25716618287373005, "grad_norm": 1.1953125, "learning_rate": 0.0004996870561914819, "loss": 5.9239, "mean_token_accuracy": 0.14105542823672296, "num_tokens": 5884449.0, "step": 2835 }, { "entropy": 5.962704849243164, "epoch": 0.2576197387518142, "grad_norm": 1.1796875, "learning_rate": 0.0004996853479181145, "loss": 5.9356, "mean_token_accuracy": 0.14173914715647698, "num_tokens": 5896134.0, "step": 2840 }, { "entropy": 5.9352422714233395, "epoch": 0.2580732946298984, "grad_norm": 1.3359375, "learning_rate": 0.0004996836349981969, "loss": 5.8243, "mean_token_accuracy": 0.14533241838216782, "num_tokens": 5907004.0, "step": 2845 }, { "entropy": 5.864476871490479, "epoch": 0.2585268505079826, "grad_norm": 1.375, "learning_rate": 0.0004996819174317645, "loss": 5.851, "mean_token_accuracy": 0.14395025223493577, "num_tokens": 5917400.0, "step": 2850 }, { "entropy": 5.9380591869354244, "epoch": 0.2589804063860668, "grad_norm": 1.203125, "learning_rate": 0.0004996801952188528, "loss": 5.95, "mean_token_accuracy": 0.13919704630970955, "num_tokens": 5929008.0, "step": 2855 }, { "entropy": 5.842560720443726, "epoch": 0.25943396226415094, "grad_norm": 1.3515625, "learning_rate": 0.0004996784683594973, "loss": 5.8327, "mean_token_accuracy": 0.14070578664541245, "num_tokens": 5939250.0, "step": 2860 }, { "entropy": 5.959221267700196, "epoch": 0.2598875181422351, "grad_norm": 1.40625, "learning_rate": 0.0004996767368537338, "loss": 5.817, "mean_token_accuracy": 0.13839129433035852, "num_tokens": 5950068.0, "step": 2865 }, { "entropy": 5.877241897583008, "epoch": 0.2603410740203193, "grad_norm": 1.3671875, "learning_rate": 0.0004996750007015983, "loss": 5.7696, "mean_token_accuracy": 0.14700621664524077, "num_tokens": 5960847.0, "step": 2870 }, { "entropy": 5.894535636901855, "epoch": 0.26079462989840346, "grad_norm": 1.3515625, "learning_rate": 0.0004996732599031264, "loss": 5.9437, "mean_token_accuracy": 0.1424281269311905, "num_tokens": 5971372.0, "step": 2875 }, { "entropy": 5.862865686416626, "epoch": 0.2612481857764877, "grad_norm": 1.2578125, "learning_rate": 0.0004996715144583543, "loss": 5.8244, "mean_token_accuracy": 0.1482554256916046, "num_tokens": 5981834.0, "step": 2880 }, { "entropy": 5.897699880599975, "epoch": 0.26170174165457183, "grad_norm": 1.4921875, "learning_rate": 0.000499669764367318, "loss": 5.8284, "mean_token_accuracy": 0.1392040655016899, "num_tokens": 5992256.0, "step": 2885 }, { "entropy": 5.846699953079224, "epoch": 0.26215529753265604, "grad_norm": 1.4375, "learning_rate": 0.0004996680096300537, "loss": 5.7288, "mean_token_accuracy": 0.1538042202591896, "num_tokens": 6002965.0, "step": 2890 }, { "entropy": 5.875544452667237, "epoch": 0.2626088534107402, "grad_norm": 1.3671875, "learning_rate": 0.0004996662502465978, "loss": 5.8626, "mean_token_accuracy": 0.14618532732129097, "num_tokens": 6014384.0, "step": 2895 }, { "entropy": 5.852958822250367, "epoch": 0.2630624092888244, "grad_norm": 1.4140625, "learning_rate": 0.0004996644862169864, "loss": 5.8098, "mean_token_accuracy": 0.14801875948905946, "num_tokens": 6024191.0, "step": 2900 }, { "entropy": 5.8199280261993405, "epoch": 0.26351596516690856, "grad_norm": 1.6484375, "learning_rate": 0.0004996627175412563, "loss": 5.8239, "mean_token_accuracy": 0.1518359899520874, "num_tokens": 6035043.0, "step": 2905 }, { "entropy": 5.853754234313965, "epoch": 0.2639695210449927, "grad_norm": 1.2890625, "learning_rate": 0.000499660944219444, "loss": 5.7854, "mean_token_accuracy": 0.14921433106064796, "num_tokens": 6043940.0, "step": 2910 }, { "entropy": 5.8335946559906, "epoch": 0.2644230769230769, "grad_norm": 1.28125, "learning_rate": 0.0004996591662515861, "loss": 5.8371, "mean_token_accuracy": 0.14537594690918923, "num_tokens": 6054338.0, "step": 2915 }, { "entropy": 5.961825037002564, "epoch": 0.2648766328011611, "grad_norm": 1.2578125, "learning_rate": 0.0004996573836377193, "loss": 5.8348, "mean_token_accuracy": 0.13997972533106803, "num_tokens": 6065150.0, "step": 2920 }, { "entropy": 5.930986785888672, "epoch": 0.2653301886792453, "grad_norm": 1.4296875, "learning_rate": 0.0004996555963778806, "loss": 5.9492, "mean_token_accuracy": 0.1413875937461853, "num_tokens": 6076552.0, "step": 2925 }, { "entropy": 5.867830467224121, "epoch": 0.26578374455732945, "grad_norm": 1.1640625, "learning_rate": 0.000499653804472107, "loss": 5.8141, "mean_token_accuracy": 0.14914955347776412, "num_tokens": 6086224.0, "step": 2930 }, { "entropy": 5.865148401260376, "epoch": 0.26623730043541366, "grad_norm": 1.3125, "learning_rate": 0.0004996520079204353, "loss": 5.8759, "mean_token_accuracy": 0.1438009113073349, "num_tokens": 6095607.0, "step": 2935 }, { "entropy": 6.042435073852539, "epoch": 0.2666908563134978, "grad_norm": 1.1484375, "learning_rate": 0.000499650206722903, "loss": 5.869, "mean_token_accuracy": 0.14277777075767517, "num_tokens": 6106338.0, "step": 2940 }, { "entropy": 5.798783254623413, "epoch": 0.267144412191582, "grad_norm": 1.28125, "learning_rate": 0.0004996484008795471, "loss": 5.857, "mean_token_accuracy": 0.1411480873823166, "num_tokens": 6116676.0, "step": 2945 }, { "entropy": 5.893274641036987, "epoch": 0.2675979680696662, "grad_norm": 1.3046875, "learning_rate": 0.000499646590390405, "loss": 5.8818, "mean_token_accuracy": 0.14448646381497382, "num_tokens": 6127104.0, "step": 2950 }, { "entropy": 5.97404203414917, "epoch": 0.26805152394775034, "grad_norm": 1.2109375, "learning_rate": 0.0004996447752555142, "loss": 5.8849, "mean_token_accuracy": 0.14420673102140427, "num_tokens": 6136854.0, "step": 2955 }, { "entropy": 5.874495887756348, "epoch": 0.26850507982583455, "grad_norm": 1.15625, "learning_rate": 0.0004996429554749122, "loss": 5.7478, "mean_token_accuracy": 0.14988255202770234, "num_tokens": 6146949.0, "step": 2960 }, { "entropy": 5.814474868774414, "epoch": 0.2689586357039187, "grad_norm": 1.2890625, "learning_rate": 0.0004996411310486367, "loss": 5.8163, "mean_token_accuracy": 0.14709441363811493, "num_tokens": 6156565.0, "step": 2965 }, { "entropy": 5.8766576766967775, "epoch": 0.2694121915820029, "grad_norm": 1.25, "learning_rate": 0.0004996393019767253, "loss": 5.8539, "mean_token_accuracy": 0.14178219437599182, "num_tokens": 6167547.0, "step": 2970 }, { "entropy": 6.001531267166138, "epoch": 0.26986574746008707, "grad_norm": 1.234375, "learning_rate": 0.0004996374682592158, "loss": 5.8851, "mean_token_accuracy": 0.13923771157860756, "num_tokens": 6177664.0, "step": 2975 }, { "entropy": 5.9096832275390625, "epoch": 0.2703193033381713, "grad_norm": 1.203125, "learning_rate": 0.0004996356298961463, "loss": 5.9059, "mean_token_accuracy": 0.1396166890859604, "num_tokens": 6187917.0, "step": 2980 }, { "entropy": 5.94624695777893, "epoch": 0.27077285921625543, "grad_norm": 1.296875, "learning_rate": 0.0004996337868875549, "loss": 5.7766, "mean_token_accuracy": 0.15335213392972946, "num_tokens": 6197912.0, "step": 2985 }, { "entropy": 5.868017482757568, "epoch": 0.27122641509433965, "grad_norm": 1.2109375, "learning_rate": 0.0004996319392334792, "loss": 5.856, "mean_token_accuracy": 0.14923167005181312, "num_tokens": 6207661.0, "step": 2990 }, { "entropy": 5.830333042144775, "epoch": 0.2716799709724238, "grad_norm": 1.3125, "learning_rate": 0.000499630086933958, "loss": 5.8397, "mean_token_accuracy": 0.14484328925609588, "num_tokens": 6218178.0, "step": 2995 }, { "entropy": 5.951654672622681, "epoch": 0.27213352685050796, "grad_norm": 1.2265625, "learning_rate": 0.0004996282299890292, "loss": 5.9512, "mean_token_accuracy": 0.1427612841129303, "num_tokens": 6229397.0, "step": 3000 }, { "epoch": 0.27213352685050796, "eval_entropy": 5.809842018088604, "eval_loss": 5.885278701782227, "eval_mean_token_accuracy": 0.14895868243152335, "eval_num_tokens": 6229397.0, "eval_runtime": 26.7157, "eval_samples_per_second": 1323.565, "eval_steps_per_second": 165.446, "step": 3000 }, { "entropy": 5.958879184722901, "epoch": 0.27258708272859217, "grad_norm": 1.1640625, "learning_rate": 0.0004996263683987316, "loss": 5.9397, "mean_token_accuracy": 0.135448008030653, "num_tokens": 6239746.0, "step": 3005 }, { "entropy": 5.985172605514526, "epoch": 0.2730406386066763, "grad_norm": 1.328125, "learning_rate": 0.0004996245021631033, "loss": 5.9173, "mean_token_accuracy": 0.13839664533734322, "num_tokens": 6250254.0, "step": 3010 }, { "entropy": 5.869852018356323, "epoch": 0.27349419448476053, "grad_norm": 1.296875, "learning_rate": 0.000499622631282183, "loss": 5.7857, "mean_token_accuracy": 0.14560491144657134, "num_tokens": 6260289.0, "step": 3015 }, { "entropy": 5.819940757751465, "epoch": 0.2739477503628447, "grad_norm": 2.4375, "learning_rate": 0.0004996207557560095, "loss": 5.8158, "mean_token_accuracy": 0.14539813250303268, "num_tokens": 6270613.0, "step": 3020 }, { "entropy": 5.839310836791992, "epoch": 0.2744013062409289, "grad_norm": 1.15625, "learning_rate": 0.0004996188755846216, "loss": 5.7273, "mean_token_accuracy": 0.14885752648115158, "num_tokens": 6281105.0, "step": 3025 }, { "entropy": 5.782553625106812, "epoch": 0.27485486211901305, "grad_norm": 1.234375, "learning_rate": 0.000499616990768058, "loss": 5.7718, "mean_token_accuracy": 0.14648960307240486, "num_tokens": 6291743.0, "step": 3030 }, { "entropy": 5.850036144256592, "epoch": 0.27530841799709727, "grad_norm": 1.1171875, "learning_rate": 0.0004996151013063579, "loss": 5.7904, "mean_token_accuracy": 0.14614589661359786, "num_tokens": 6301972.0, "step": 3035 }, { "entropy": 5.964907217025757, "epoch": 0.2757619738751814, "grad_norm": 1.0859375, "learning_rate": 0.0004996132071995601, "loss": 5.9164, "mean_token_accuracy": 0.1384211391210556, "num_tokens": 6313077.0, "step": 3040 }, { "entropy": 5.8856535911560055, "epoch": 0.2762155297532656, "grad_norm": 1.328125, "learning_rate": 0.0004996113084477042, "loss": 5.9312, "mean_token_accuracy": 0.14106005281209946, "num_tokens": 6323259.0, "step": 3045 }, { "entropy": 5.935484266281128, "epoch": 0.2766690856313498, "grad_norm": 1.734375, "learning_rate": 0.0004996094050508291, "loss": 5.9297, "mean_token_accuracy": 0.14095510616898538, "num_tokens": 6332944.0, "step": 3050 }, { "entropy": 5.961835670471191, "epoch": 0.27712264150943394, "grad_norm": 1.25, "learning_rate": 0.0004996074970089741, "loss": 5.8642, "mean_token_accuracy": 0.1443409040570259, "num_tokens": 6343655.0, "step": 3055 }, { "entropy": 5.947761917114258, "epoch": 0.27757619738751815, "grad_norm": 1.34375, "learning_rate": 0.0004996055843221789, "loss": 5.8648, "mean_token_accuracy": 0.14549115747213365, "num_tokens": 6353764.0, "step": 3060 }, { "entropy": 5.912136363983154, "epoch": 0.2780297532656023, "grad_norm": 1.21875, "learning_rate": 0.0004996036669904831, "loss": 5.8709, "mean_token_accuracy": 0.14337181076407432, "num_tokens": 6364158.0, "step": 3065 }, { "entropy": 6.009150266647339, "epoch": 0.2784833091436865, "grad_norm": 1.2109375, "learning_rate": 0.0004996017450139261, "loss": 5.9597, "mean_token_accuracy": 0.14345912635326385, "num_tokens": 6374626.0, "step": 3070 }, { "entropy": 5.861038589477539, "epoch": 0.2789368650217707, "grad_norm": 1.3828125, "learning_rate": 0.0004995998183925478, "loss": 5.7917, "mean_token_accuracy": 0.14217267483472823, "num_tokens": 6385828.0, "step": 3075 }, { "entropy": 5.858433866500855, "epoch": 0.2793904208998549, "grad_norm": 1.375, "learning_rate": 0.0004995978871263881, "loss": 5.8631, "mean_token_accuracy": 0.14555875808000565, "num_tokens": 6394995.0, "step": 3080 }, { "entropy": 5.8555628776550295, "epoch": 0.27984397677793904, "grad_norm": 1.390625, "learning_rate": 0.0004995959512154868, "loss": 5.7251, "mean_token_accuracy": 0.15479629933834077, "num_tokens": 6403851.0, "step": 3085 }, { "entropy": 5.868296670913696, "epoch": 0.2802975326560232, "grad_norm": 1.1484375, "learning_rate": 0.000499594010659884, "loss": 5.8663, "mean_token_accuracy": 0.14205797165632247, "num_tokens": 6415444.0, "step": 3090 }, { "entropy": 5.91460108757019, "epoch": 0.2807510885341074, "grad_norm": 1.2421875, "learning_rate": 0.0004995920654596199, "loss": 5.8395, "mean_token_accuracy": 0.14932074174284934, "num_tokens": 6425725.0, "step": 3095 }, { "entropy": 5.898306369781494, "epoch": 0.28120464441219156, "grad_norm": 1.3671875, "learning_rate": 0.0004995901156147345, "loss": 5.8395, "mean_token_accuracy": 0.14300182536244394, "num_tokens": 6436897.0, "step": 3100 }, { "entropy": 5.913700866699219, "epoch": 0.2816582002902758, "grad_norm": 1.3125, "learning_rate": 0.0004995881611252684, "loss": 5.965, "mean_token_accuracy": 0.1330859951674938, "num_tokens": 6448785.0, "step": 3105 }, { "entropy": 5.849992322921753, "epoch": 0.28211175616835993, "grad_norm": 1.3671875, "learning_rate": 0.0004995862019912619, "loss": 5.85, "mean_token_accuracy": 0.15349818915128707, "num_tokens": 6458471.0, "step": 3110 }, { "entropy": 5.924998188018799, "epoch": 0.28256531204644414, "grad_norm": 1.265625, "learning_rate": 0.0004995842382127555, "loss": 5.877, "mean_token_accuracy": 0.1460927091538906, "num_tokens": 6469405.0, "step": 3115 }, { "entropy": 5.889486837387085, "epoch": 0.2830188679245283, "grad_norm": 1.3515625, "learning_rate": 0.0004995822697897897, "loss": 5.8027, "mean_token_accuracy": 0.14449920505285263, "num_tokens": 6480143.0, "step": 3120 }, { "entropy": 5.821135234832764, "epoch": 0.2834724238026125, "grad_norm": 1.640625, "learning_rate": 0.0004995802967224056, "loss": 5.7916, "mean_token_accuracy": 0.15088085681200028, "num_tokens": 6490609.0, "step": 3125 }, { "entropy": 5.939887523651123, "epoch": 0.28392597968069666, "grad_norm": 1.2578125, "learning_rate": 0.0004995783190106434, "loss": 5.9064, "mean_token_accuracy": 0.14183955937623977, "num_tokens": 6501982.0, "step": 3130 }, { "entropy": 5.880724811553955, "epoch": 0.2843795355587808, "grad_norm": 1.3671875, "learning_rate": 0.0004995763366545445, "loss": 5.7333, "mean_token_accuracy": 0.1553550824522972, "num_tokens": 6511394.0, "step": 3135 }, { "entropy": 5.852282428741455, "epoch": 0.284833091436865, "grad_norm": 1.3125, "learning_rate": 0.0004995743496541497, "loss": 5.7882, "mean_token_accuracy": 0.1472353495657444, "num_tokens": 6522307.0, "step": 3140 }, { "entropy": 5.868274068832397, "epoch": 0.2852866473149492, "grad_norm": 1.3203125, "learning_rate": 0.0004995723580095001, "loss": 5.8706, "mean_token_accuracy": 0.14255028143525122, "num_tokens": 6533560.0, "step": 3145 }, { "entropy": 5.819251966476441, "epoch": 0.2857402031930334, "grad_norm": 1.453125, "learning_rate": 0.000499570361720637, "loss": 5.8307, "mean_token_accuracy": 0.14855025410652162, "num_tokens": 6543669.0, "step": 3150 }, { "entropy": 5.892589426040649, "epoch": 0.28619375907111755, "grad_norm": 1.3125, "learning_rate": 0.0004995683607876015, "loss": 5.8724, "mean_token_accuracy": 0.14935246258974075, "num_tokens": 6553439.0, "step": 3155 }, { "entropy": 5.932051801681519, "epoch": 0.28664731494920176, "grad_norm": 1.4140625, "learning_rate": 0.0004995663552104352, "loss": 5.7927, "mean_token_accuracy": 0.15133242607116698, "num_tokens": 6563631.0, "step": 3160 }, { "entropy": 5.809592628479004, "epoch": 0.2871008708272859, "grad_norm": 1.2890625, "learning_rate": 0.0004995643449891793, "loss": 5.8032, "mean_token_accuracy": 0.14714159369468688, "num_tokens": 6574610.0, "step": 3165 }, { "entropy": 5.843514728546142, "epoch": 0.2875544267053701, "grad_norm": 1.3984375, "learning_rate": 0.0004995623301238757, "loss": 5.7887, "mean_token_accuracy": 0.14544542878866196, "num_tokens": 6583878.0, "step": 3170 }, { "entropy": 5.893237638473511, "epoch": 0.2880079825834543, "grad_norm": 1.2734375, "learning_rate": 0.0004995603106145657, "loss": 5.8246, "mean_token_accuracy": 0.14911970496177673, "num_tokens": 6594844.0, "step": 3175 }, { "entropy": 5.957679510116577, "epoch": 0.28846153846153844, "grad_norm": 1.3359375, "learning_rate": 0.0004995582864612913, "loss": 5.8756, "mean_token_accuracy": 0.1441011093556881, "num_tokens": 6605695.0, "step": 3180 }, { "entropy": 5.776202726364136, "epoch": 0.28891509433962265, "grad_norm": 1.546875, "learning_rate": 0.0004995562576640943, "loss": 5.7007, "mean_token_accuracy": 0.15618097633123398, "num_tokens": 6615155.0, "step": 3185 }, { "entropy": 5.849746513366699, "epoch": 0.2893686502177068, "grad_norm": 1.3359375, "learning_rate": 0.0004995542242230167, "loss": 5.8392, "mean_token_accuracy": 0.1439945727586746, "num_tokens": 6625095.0, "step": 3190 }, { "entropy": 5.937306308746338, "epoch": 0.289822206095791, "grad_norm": 1.203125, "learning_rate": 0.0004995521861381006, "loss": 5.8947, "mean_token_accuracy": 0.14612530022859574, "num_tokens": 6636483.0, "step": 3195 }, { "entropy": 5.880060768127441, "epoch": 0.29027576197387517, "grad_norm": 1.59375, "learning_rate": 0.000499550143409388, "loss": 5.8295, "mean_token_accuracy": 0.14944281354546546, "num_tokens": 6646807.0, "step": 3200 }, { "entropy": 5.923206090927124, "epoch": 0.2907293178519594, "grad_norm": 1.328125, "learning_rate": 0.0004995480960369211, "loss": 5.859, "mean_token_accuracy": 0.14405411332845688, "num_tokens": 6656999.0, "step": 3205 }, { "entropy": 5.9521387100219725, "epoch": 0.29118287373004353, "grad_norm": 1.5546875, "learning_rate": 0.0004995460440207425, "loss": 5.7856, "mean_token_accuracy": 0.1485783725976944, "num_tokens": 6667507.0, "step": 3210 }, { "entropy": 5.80417103767395, "epoch": 0.29163642960812775, "grad_norm": 1.9140625, "learning_rate": 0.0004995439873608945, "loss": 5.8614, "mean_token_accuracy": 0.14702842235565186, "num_tokens": 6678701.0, "step": 3215 }, { "entropy": 5.996509981155396, "epoch": 0.2920899854862119, "grad_norm": 1.4453125, "learning_rate": 0.0004995419260574196, "loss": 5.9203, "mean_token_accuracy": 0.14138441830873488, "num_tokens": 6688153.0, "step": 3220 }, { "entropy": 5.804137706756592, "epoch": 0.29254354136429606, "grad_norm": 1.4453125, "learning_rate": 0.0004995398601103603, "loss": 5.7742, "mean_token_accuracy": 0.14464350715279578, "num_tokens": 6697992.0, "step": 3225 }, { "entropy": 5.876363611221313, "epoch": 0.29299709724238027, "grad_norm": 1.296875, "learning_rate": 0.0004995377895197597, "loss": 5.8138, "mean_token_accuracy": 0.15277422666549684, "num_tokens": 6708203.0, "step": 3230 }, { "entropy": 5.924364757537842, "epoch": 0.2934506531204644, "grad_norm": 1.359375, "learning_rate": 0.0004995357142856602, "loss": 5.8602, "mean_token_accuracy": 0.1478705033659935, "num_tokens": 6718531.0, "step": 3235 }, { "entropy": 5.851564741134643, "epoch": 0.29390420899854863, "grad_norm": 1.3359375, "learning_rate": 0.000499533634408105, "loss": 5.8488, "mean_token_accuracy": 0.14651849120855331, "num_tokens": 6729704.0, "step": 3240 }, { "entropy": 5.922415637969971, "epoch": 0.2943577648766328, "grad_norm": 1.28125, "learning_rate": 0.000499531549887137, "loss": 5.8031, "mean_token_accuracy": 0.15899783372879028, "num_tokens": 6740736.0, "step": 3245 }, { "entropy": 5.880781555175782, "epoch": 0.294811320754717, "grad_norm": 1.328125, "learning_rate": 0.0004995294607227993, "loss": 5.8681, "mean_token_accuracy": 0.14151869863271713, "num_tokens": 6751462.0, "step": 3250 }, { "entropy": 5.8272419452667235, "epoch": 0.29526487663280115, "grad_norm": 1.4765625, "learning_rate": 0.0004995273669151351, "loss": 5.7525, "mean_token_accuracy": 0.14723548889160157, "num_tokens": 6761438.0, "step": 3255 }, { "entropy": 5.87422890663147, "epoch": 0.29571843251088537, "grad_norm": 1.265625, "learning_rate": 0.000499525268464188, "loss": 5.8797, "mean_token_accuracy": 0.13691834434866906, "num_tokens": 6772906.0, "step": 3260 }, { "entropy": 5.919430732727051, "epoch": 0.2961719883889695, "grad_norm": 1.4296875, "learning_rate": 0.0004995231653700009, "loss": 5.832, "mean_token_accuracy": 0.14906056374311447, "num_tokens": 6782412.0, "step": 3265 }, { "entropy": 5.823684120178223, "epoch": 0.2966255442670537, "grad_norm": 1.234375, "learning_rate": 0.0004995210576326176, "loss": 5.7617, "mean_token_accuracy": 0.14652365446090698, "num_tokens": 6793296.0, "step": 3270 }, { "entropy": 5.937224197387695, "epoch": 0.2970791001451379, "grad_norm": 1.34375, "learning_rate": 0.0004995189452520816, "loss": 5.8337, "mean_token_accuracy": 0.1496664322912693, "num_tokens": 6803194.0, "step": 3275 }, { "entropy": 5.8328405857086185, "epoch": 0.29753265602322204, "grad_norm": 1.453125, "learning_rate": 0.0004995168282284366, "loss": 5.8272, "mean_token_accuracy": 0.1477750986814499, "num_tokens": 6813720.0, "step": 3280 }, { "entropy": 5.831604099273681, "epoch": 0.29798621190130625, "grad_norm": 1.15625, "learning_rate": 0.0004995147065617263, "loss": 5.6927, "mean_token_accuracy": 0.14981145784258842, "num_tokens": 6824835.0, "step": 3285 }, { "entropy": 5.885361862182617, "epoch": 0.2984397677793904, "grad_norm": 1.2890625, "learning_rate": 0.0004995125802519946, "loss": 5.8362, "mean_token_accuracy": 0.14518534615635872, "num_tokens": 6835913.0, "step": 3290 }, { "entropy": 5.92800350189209, "epoch": 0.2988933236574746, "grad_norm": 1.234375, "learning_rate": 0.0004995104492992857, "loss": 5.8293, "mean_token_accuracy": 0.14723531454801558, "num_tokens": 6846305.0, "step": 3295 }, { "entropy": 5.803650140762329, "epoch": 0.2993468795355588, "grad_norm": 1.34375, "learning_rate": 0.0004995083137036434, "loss": 5.8549, "mean_token_accuracy": 0.1440051704645157, "num_tokens": 6856466.0, "step": 3300 }, { "entropy": 5.9008081436157225, "epoch": 0.299800435413643, "grad_norm": 1.4140625, "learning_rate": 0.0004995061734651121, "loss": 5.8678, "mean_token_accuracy": 0.14289252310991288, "num_tokens": 6866982.0, "step": 3305 }, { "entropy": 5.892164897918701, "epoch": 0.30025399129172714, "grad_norm": 1.25, "learning_rate": 0.0004995040285837358, "loss": 5.8759, "mean_token_accuracy": 0.1448530837893486, "num_tokens": 6876915.0, "step": 3310 }, { "entropy": 5.9458733081817625, "epoch": 0.3007075471698113, "grad_norm": 1.2109375, "learning_rate": 0.0004995018790595589, "loss": 5.8415, "mean_token_accuracy": 0.1469773143529892, "num_tokens": 6886962.0, "step": 3315 }, { "entropy": 5.817418050765991, "epoch": 0.3011611030478955, "grad_norm": 1.203125, "learning_rate": 0.0004994997248926261, "loss": 5.7322, "mean_token_accuracy": 0.15008108466863632, "num_tokens": 6897712.0, "step": 3320 }, { "entropy": 5.811979007720947, "epoch": 0.30161465892597966, "grad_norm": 1.1953125, "learning_rate": 0.0004994975660829817, "loss": 5.7633, "mean_token_accuracy": 0.15170645713806152, "num_tokens": 6908113.0, "step": 3325 }, { "entropy": 5.814332485198975, "epoch": 0.3020682148040639, "grad_norm": 1.3046875, "learning_rate": 0.0004994954026306705, "loss": 5.8455, "mean_token_accuracy": 0.1410839483141899, "num_tokens": 6918348.0, "step": 3330 }, { "entropy": 5.8640532970428465, "epoch": 0.30252177068214803, "grad_norm": 1.3515625, "learning_rate": 0.0004994932345357371, "loss": 5.7376, "mean_token_accuracy": 0.16013350784778596, "num_tokens": 6929309.0, "step": 3335 }, { "entropy": 5.850185680389404, "epoch": 0.30297532656023224, "grad_norm": 1.2421875, "learning_rate": 0.0004994910617982264, "loss": 5.8239, "mean_token_accuracy": 0.15335479825735093, "num_tokens": 6938023.0, "step": 3340 }, { "entropy": 5.89008207321167, "epoch": 0.3034288824383164, "grad_norm": 1.3515625, "learning_rate": 0.0004994888844181833, "loss": 5.7687, "mean_token_accuracy": 0.15248255282640458, "num_tokens": 6948957.0, "step": 3345 }, { "entropy": 5.891032981872558, "epoch": 0.3038824383164006, "grad_norm": 1.28125, "learning_rate": 0.0004994867023956529, "loss": 5.7944, "mean_token_accuracy": 0.14604247882962226, "num_tokens": 6960343.0, "step": 3350 }, { "entropy": 5.824883317947387, "epoch": 0.30433599419448476, "grad_norm": 1.203125, "learning_rate": 0.0004994845157306803, "loss": 5.7599, "mean_token_accuracy": 0.1555237963795662, "num_tokens": 6969858.0, "step": 3355 }, { "entropy": 5.783804941177368, "epoch": 0.3047895500725689, "grad_norm": 1.40625, "learning_rate": 0.0004994823244233107, "loss": 5.7386, "mean_token_accuracy": 0.1461342416703701, "num_tokens": 6980805.0, "step": 3360 }, { "entropy": 5.849851274490357, "epoch": 0.3052431059506531, "grad_norm": 1.203125, "learning_rate": 0.0004994801284735895, "loss": 5.7778, "mean_token_accuracy": 0.1516255334019661, "num_tokens": 6991076.0, "step": 3365 }, { "entropy": 5.833066177368164, "epoch": 0.3056966618287373, "grad_norm": 1.328125, "learning_rate": 0.0004994779278815619, "loss": 5.7431, "mean_token_accuracy": 0.1499674066901207, "num_tokens": 7001179.0, "step": 3370 }, { "entropy": 5.87516975402832, "epoch": 0.3061502177068215, "grad_norm": 1.3203125, "learning_rate": 0.0004994757226472736, "loss": 5.884, "mean_token_accuracy": 0.14582084268331527, "num_tokens": 7011284.0, "step": 3375 }, { "entropy": 5.896537160873413, "epoch": 0.30660377358490565, "grad_norm": 1.2578125, "learning_rate": 0.0004994735127707702, "loss": 5.8938, "mean_token_accuracy": 0.14885310232639312, "num_tokens": 7021429.0, "step": 3380 }, { "entropy": 5.940958404541016, "epoch": 0.30705732946298986, "grad_norm": 1.4140625, "learning_rate": 0.0004994712982520972, "loss": 5.8062, "mean_token_accuracy": 0.15399947464466096, "num_tokens": 7032313.0, "step": 3385 }, { "entropy": 5.8307092666625975, "epoch": 0.307510885341074, "grad_norm": 1.3125, "learning_rate": 0.0004994690790913008, "loss": 5.7213, "mean_token_accuracy": 0.15415123999118804, "num_tokens": 7042791.0, "step": 3390 }, { "entropy": 5.759172677993774, "epoch": 0.3079644412191582, "grad_norm": 1.25, "learning_rate": 0.0004994668552884265, "loss": 5.7435, "mean_token_accuracy": 0.1518249973654747, "num_tokens": 7054048.0, "step": 3395 }, { "entropy": 5.948722553253174, "epoch": 0.3084179970972424, "grad_norm": 1.2890625, "learning_rate": 0.0004994646268435204, "loss": 5.8554, "mean_token_accuracy": 0.14281615018844604, "num_tokens": 7064179.0, "step": 3400 }, { "entropy": 5.822907161712647, "epoch": 0.30887155297532654, "grad_norm": 1.3203125, "learning_rate": 0.0004994623937566286, "loss": 5.6967, "mean_token_accuracy": 0.15609691590070723, "num_tokens": 7073570.0, "step": 3405 }, { "entropy": 5.700627851486206, "epoch": 0.30932510885341075, "grad_norm": 3.515625, "learning_rate": 0.0004994601560277974, "loss": 5.7584, "mean_token_accuracy": 0.15373585373163223, "num_tokens": 7083646.0, "step": 3410 }, { "entropy": 5.739640378952027, "epoch": 0.3097786647314949, "grad_norm": 1.5703125, "learning_rate": 0.000499457913657073, "loss": 5.683, "mean_token_accuracy": 0.1485663816332817, "num_tokens": 7093950.0, "step": 3415 }, { "entropy": 5.8701647281646725, "epoch": 0.3102322206095791, "grad_norm": 1.1796875, "learning_rate": 0.0004994556666445016, "loss": 5.8153, "mean_token_accuracy": 0.14636703729629516, "num_tokens": 7103501.0, "step": 3420 }, { "entropy": 5.828254222869873, "epoch": 0.31068577648766327, "grad_norm": 1.265625, "learning_rate": 0.0004994534149901299, "loss": 5.7896, "mean_token_accuracy": 0.15028128027915955, "num_tokens": 7113595.0, "step": 3425 }, { "entropy": 5.871004867553711, "epoch": 0.3111393323657475, "grad_norm": 1.2890625, "learning_rate": 0.0004994511586940044, "loss": 5.7553, "mean_token_accuracy": 0.14996377378702164, "num_tokens": 7123314.0, "step": 3430 }, { "entropy": 5.794569110870361, "epoch": 0.31159288824383163, "grad_norm": 1.5078125, "learning_rate": 0.0004994488977561717, "loss": 5.7229, "mean_token_accuracy": 0.15273373425006867, "num_tokens": 7132603.0, "step": 3435 }, { "entropy": 5.889085912704468, "epoch": 0.31204644412191584, "grad_norm": 1.40625, "learning_rate": 0.0004994466321766786, "loss": 5.7693, "mean_token_accuracy": 0.14626731872558593, "num_tokens": 7142112.0, "step": 3440 }, { "entropy": 5.870463895797729, "epoch": 0.3125, "grad_norm": 1.328125, "learning_rate": 0.000499444361955572, "loss": 5.8708, "mean_token_accuracy": 0.14073101803660393, "num_tokens": 7152862.0, "step": 3445 }, { "entropy": 5.847962331771851, "epoch": 0.31295355587808416, "grad_norm": 1.3359375, "learning_rate": 0.0004994420870928988, "loss": 5.7976, "mean_token_accuracy": 0.15040374025702477, "num_tokens": 7163217.0, "step": 3450 }, { "entropy": 5.846856784820557, "epoch": 0.31340711175616837, "grad_norm": 1.734375, "learning_rate": 0.0004994398075887059, "loss": 5.8103, "mean_token_accuracy": 0.1441519945859909, "num_tokens": 7173555.0, "step": 3455 }, { "entropy": 5.851716375350952, "epoch": 0.3138606676342525, "grad_norm": 1.2734375, "learning_rate": 0.0004994375234430407, "loss": 5.8194, "mean_token_accuracy": 0.1495192438364029, "num_tokens": 7184011.0, "step": 3460 }, { "entropy": 5.965654373168945, "epoch": 0.31431422351233673, "grad_norm": 1.5859375, "learning_rate": 0.0004994352346559504, "loss": 5.8129, "mean_token_accuracy": 0.14340534433722496, "num_tokens": 7194709.0, "step": 3465 }, { "entropy": 5.822262144088745, "epoch": 0.3147677793904209, "grad_norm": 1.265625, "learning_rate": 0.0004994329412274821, "loss": 5.7452, "mean_token_accuracy": 0.15087789446115493, "num_tokens": 7205010.0, "step": 3470 }, { "entropy": 5.87249641418457, "epoch": 0.3152213352685051, "grad_norm": 1.296875, "learning_rate": 0.0004994306431576835, "loss": 5.8343, "mean_token_accuracy": 0.14334458857774734, "num_tokens": 7215673.0, "step": 3475 }, { "entropy": 5.864829349517822, "epoch": 0.31567489114658925, "grad_norm": 1.296875, "learning_rate": 0.000499428340446602, "loss": 5.7393, "mean_token_accuracy": 0.14581746309995652, "num_tokens": 7226084.0, "step": 3480 }, { "entropy": 5.927701616287232, "epoch": 0.31612844702467346, "grad_norm": 1.4375, "learning_rate": 0.0004994260330942851, "loss": 5.8581, "mean_token_accuracy": 0.14685110300779342, "num_tokens": 7236155.0, "step": 3485 }, { "entropy": 5.849013614654541, "epoch": 0.3165820029027576, "grad_norm": 1.3359375, "learning_rate": 0.0004994237211007808, "loss": 5.8153, "mean_token_accuracy": 0.1452503725886345, "num_tokens": 7246226.0, "step": 3490 }, { "entropy": 5.9544209957122805, "epoch": 0.3170355587808418, "grad_norm": 1.46875, "learning_rate": 0.0004994214044661367, "loss": 5.867, "mean_token_accuracy": 0.14869623333215715, "num_tokens": 7256573.0, "step": 3495 }, { "entropy": 5.792372131347657, "epoch": 0.317489114658926, "grad_norm": 1.1640625, "learning_rate": 0.0004994190831904007, "loss": 5.7755, "mean_token_accuracy": 0.15131996273994447, "num_tokens": 7266546.0, "step": 3500 }, { "entropy": 5.813211441040039, "epoch": 0.31794267053701014, "grad_norm": 1.171875, "learning_rate": 0.000499416757273621, "loss": 5.6998, "mean_token_accuracy": 0.1527576208114624, "num_tokens": 7276902.0, "step": 3505 }, { "entropy": 5.7668062210083, "epoch": 0.31839622641509435, "grad_norm": 1.4296875, "learning_rate": 0.0004994144267158454, "loss": 5.7249, "mean_token_accuracy": 0.14934021681547166, "num_tokens": 7286932.0, "step": 3510 }, { "entropy": 5.773153018951416, "epoch": 0.3188497822931785, "grad_norm": 1.390625, "learning_rate": 0.0004994120915171224, "loss": 5.7187, "mean_token_accuracy": 0.14774317145347596, "num_tokens": 7296317.0, "step": 3515 }, { "entropy": 5.840611457824707, "epoch": 0.3193033381712627, "grad_norm": 1.5859375, "learning_rate": 0.0004994097516775002, "loss": 5.8046, "mean_token_accuracy": 0.15059873461723328, "num_tokens": 7307127.0, "step": 3520 }, { "entropy": 6.010704231262207, "epoch": 0.3197568940493469, "grad_norm": 1.5, "learning_rate": 0.0004994074071970271, "loss": 5.9297, "mean_token_accuracy": 0.13786763176321984, "num_tokens": 7318962.0, "step": 3525 }, { "entropy": 5.847193717956543, "epoch": 0.3202104499274311, "grad_norm": 1.265625, "learning_rate": 0.0004994050580757515, "loss": 5.7375, "mean_token_accuracy": 0.1580265372991562, "num_tokens": 7328834.0, "step": 3530 }, { "entropy": 5.82778787612915, "epoch": 0.32066400580551524, "grad_norm": 1.4375, "learning_rate": 0.0004994027043137223, "loss": 5.8404, "mean_token_accuracy": 0.14816899076104165, "num_tokens": 7338454.0, "step": 3535 }, { "entropy": 5.902290487289429, "epoch": 0.3211175616835994, "grad_norm": 1.5390625, "learning_rate": 0.0004994003459109879, "loss": 5.775, "mean_token_accuracy": 0.15195251405239105, "num_tokens": 7349604.0, "step": 3540 }, { "entropy": 5.754151678085327, "epoch": 0.3215711175616836, "grad_norm": 1.2734375, "learning_rate": 0.0004993979828675972, "loss": 5.6986, "mean_token_accuracy": 0.1630345344543457, "num_tokens": 7359892.0, "step": 3545 }, { "entropy": 5.864100790023803, "epoch": 0.32202467343976776, "grad_norm": 1.3828125, "learning_rate": 0.000499395615183599, "loss": 5.8551, "mean_token_accuracy": 0.13787850961089135, "num_tokens": 7370430.0, "step": 3550 }, { "entropy": 5.989569902420044, "epoch": 0.32247822931785197, "grad_norm": 1.265625, "learning_rate": 0.0004993932428590422, "loss": 5.8823, "mean_token_accuracy": 0.1492062494158745, "num_tokens": 7380328.0, "step": 3555 }, { "entropy": 5.8746685028076175, "epoch": 0.3229317851959361, "grad_norm": 1.5, "learning_rate": 0.0004993908658939762, "loss": 5.7863, "mean_token_accuracy": 0.1424688369035721, "num_tokens": 7390155.0, "step": 3560 }, { "entropy": 5.767589282989502, "epoch": 0.32338534107402034, "grad_norm": 1.3984375, "learning_rate": 0.0004993884842884496, "loss": 5.7555, "mean_token_accuracy": 0.14230301976203918, "num_tokens": 7400659.0, "step": 3565 }, { "entropy": 5.876905155181885, "epoch": 0.3238388969521045, "grad_norm": 1.5234375, "learning_rate": 0.0004993860980425121, "loss": 5.7084, "mean_token_accuracy": 0.14975891560316085, "num_tokens": 7410580.0, "step": 3570 }, { "entropy": 5.772308874130249, "epoch": 0.3242924528301887, "grad_norm": 1.3515625, "learning_rate": 0.0004993837071562131, "loss": 5.7153, "mean_token_accuracy": 0.1530524328351021, "num_tokens": 7421119.0, "step": 3575 }, { "entropy": 5.865143728256226, "epoch": 0.32474600870827286, "grad_norm": 1.34375, "learning_rate": 0.0004993813116296017, "loss": 5.7948, "mean_token_accuracy": 0.1488372266292572, "num_tokens": 7431565.0, "step": 3580 }, { "entropy": 5.804593276977539, "epoch": 0.325199564586357, "grad_norm": 1.6796875, "learning_rate": 0.0004993789114627275, "loss": 5.7803, "mean_token_accuracy": 0.14988463148474693, "num_tokens": 7441638.0, "step": 3585 }, { "entropy": 5.884509611129761, "epoch": 0.3256531204644412, "grad_norm": 1.171875, "learning_rate": 0.0004993765066556403, "loss": 5.8635, "mean_token_accuracy": 0.14145209044218063, "num_tokens": 7452547.0, "step": 3590 }, { "entropy": 6.058124256134033, "epoch": 0.3261066763425254, "grad_norm": 1.3046875, "learning_rate": 0.0004993740972083899, "loss": 5.8273, "mean_token_accuracy": 0.14561535716056823, "num_tokens": 7463009.0, "step": 3595 }, { "entropy": 5.7878905773162845, "epoch": 0.3265602322206096, "grad_norm": 1.4765625, "learning_rate": 0.0004993716831210259, "loss": 5.7909, "mean_token_accuracy": 0.14785151481628417, "num_tokens": 7473929.0, "step": 3600 }, { "entropy": 5.814364290237426, "epoch": 0.32701378809869375, "grad_norm": 1.40625, "learning_rate": 0.0004993692643935983, "loss": 5.7488, "mean_token_accuracy": 0.1513546124100685, "num_tokens": 7483480.0, "step": 3605 }, { "entropy": 5.831703853607178, "epoch": 0.32746734397677796, "grad_norm": 1.265625, "learning_rate": 0.0004993668410261571, "loss": 5.7732, "mean_token_accuracy": 0.15670879930257797, "num_tokens": 7492430.0, "step": 3610 }, { "entropy": 5.79875431060791, "epoch": 0.3279208998548621, "grad_norm": 1.6328125, "learning_rate": 0.0004993644130187525, "loss": 5.7154, "mean_token_accuracy": 0.1530866101384163, "num_tokens": 7502647.0, "step": 3615 }, { "entropy": 5.8937335968017575, "epoch": 0.3283744557329463, "grad_norm": 1.2734375, "learning_rate": 0.0004993619803714347, "loss": 5.7763, "mean_token_accuracy": 0.1489662602543831, "num_tokens": 7512841.0, "step": 3620 }, { "entropy": 5.819048357009888, "epoch": 0.3288280116110305, "grad_norm": 1.375, "learning_rate": 0.0004993595430842539, "loss": 5.7788, "mean_token_accuracy": 0.1483454167842865, "num_tokens": 7522998.0, "step": 3625 }, { "entropy": 5.798835420608521, "epoch": 0.32928156748911463, "grad_norm": 1.4609375, "learning_rate": 0.0004993571011572606, "loss": 5.7548, "mean_token_accuracy": 0.14865725487470627, "num_tokens": 7533918.0, "step": 3630 }, { "entropy": 5.797335433959961, "epoch": 0.32973512336719885, "grad_norm": 1.2421875, "learning_rate": 0.0004993546545905053, "loss": 5.7506, "mean_token_accuracy": 0.14760544002056122, "num_tokens": 7543871.0, "step": 3635 }, { "entropy": 5.8824381828308105, "epoch": 0.330188679245283, "grad_norm": 1.1484375, "learning_rate": 0.0004993522033840386, "loss": 5.8131, "mean_token_accuracy": 0.14790321439504622, "num_tokens": 7554426.0, "step": 3640 }, { "entropy": 5.838723278045654, "epoch": 0.3306422351233672, "grad_norm": 1.40625, "learning_rate": 0.000499349747537911, "loss": 5.762, "mean_token_accuracy": 0.142730812728405, "num_tokens": 7564578.0, "step": 3645 }, { "entropy": 5.806462001800537, "epoch": 0.33109579100145137, "grad_norm": 1.3828125, "learning_rate": 0.0004993472870521736, "loss": 5.7714, "mean_token_accuracy": 0.15052106082439423, "num_tokens": 7574167.0, "step": 3650 }, { "entropy": 5.846491432189941, "epoch": 0.3315493468795356, "grad_norm": 1.8203125, "learning_rate": 0.0004993448219268771, "loss": 5.8119, "mean_token_accuracy": 0.14406854510307313, "num_tokens": 7584869.0, "step": 3655 }, { "entropy": 5.897862386703491, "epoch": 0.33200290275761973, "grad_norm": 1.421875, "learning_rate": 0.0004993423521620726, "loss": 5.8474, "mean_token_accuracy": 0.1513499826192856, "num_tokens": 7595385.0, "step": 3660 }, { "entropy": 5.896338558197021, "epoch": 0.33245645863570394, "grad_norm": 1.4453125, "learning_rate": 0.0004993398777578109, "loss": 5.7756, "mean_token_accuracy": 0.15635844320058823, "num_tokens": 7604498.0, "step": 3665 }, { "entropy": 5.838066625595093, "epoch": 0.3329100145137881, "grad_norm": 1.3125, "learning_rate": 0.0004993373987141435, "loss": 5.7877, "mean_token_accuracy": 0.15075664073228837, "num_tokens": 7615029.0, "step": 3670 }, { "entropy": 5.829625225067138, "epoch": 0.33336357039187225, "grad_norm": 1.46875, "learning_rate": 0.0004993349150311214, "loss": 5.7578, "mean_token_accuracy": 0.15550185292959212, "num_tokens": 7625088.0, "step": 3675 }, { "entropy": 5.873695707321167, "epoch": 0.33381712626995647, "grad_norm": 1.5, "learning_rate": 0.0004993324267087962, "loss": 5.7235, "mean_token_accuracy": 0.15278095602989197, "num_tokens": 7634668.0, "step": 3680 }, { "entropy": 5.771748781204224, "epoch": 0.3342706821480406, "grad_norm": 1.4921875, "learning_rate": 0.0004993299337472192, "loss": 5.7393, "mean_token_accuracy": 0.14780182838439943, "num_tokens": 7644581.0, "step": 3685 }, { "entropy": 5.806529855728149, "epoch": 0.33472423802612483, "grad_norm": 1.453125, "learning_rate": 0.000499327436146442, "loss": 5.7868, "mean_token_accuracy": 0.15356959104537965, "num_tokens": 7653772.0, "step": 3690 }, { "entropy": 5.854533910751343, "epoch": 0.335177793904209, "grad_norm": 1.4375, "learning_rate": 0.0004993249339065162, "loss": 5.7995, "mean_token_accuracy": 0.14647793769836426, "num_tokens": 7663489.0, "step": 3695 }, { "entropy": 5.83122410774231, "epoch": 0.3356313497822932, "grad_norm": 1.515625, "learning_rate": 0.0004993224270274937, "loss": 5.8487, "mean_token_accuracy": 0.14324984103441238, "num_tokens": 7674195.0, "step": 3700 }, { "entropy": 5.93805251121521, "epoch": 0.33608490566037735, "grad_norm": 1.4375, "learning_rate": 0.0004993199155094263, "loss": 5.7818, "mean_token_accuracy": 0.14835535734891891, "num_tokens": 7684385.0, "step": 3705 }, { "entropy": 5.856555938720703, "epoch": 0.33653846153846156, "grad_norm": 1.28125, "learning_rate": 0.0004993173993523658, "loss": 5.7167, "mean_token_accuracy": 0.14758910685777665, "num_tokens": 7694025.0, "step": 3710 }, { "entropy": 5.785606622695923, "epoch": 0.3369920174165457, "grad_norm": 1.46875, "learning_rate": 0.0004993148785563643, "loss": 5.867, "mean_token_accuracy": 0.14351308196783066, "num_tokens": 7702568.0, "step": 3715 }, { "entropy": 5.921364879608154, "epoch": 0.3374455732946299, "grad_norm": 1.4140625, "learning_rate": 0.000499312353121474, "loss": 5.7901, "mean_token_accuracy": 0.14799848794937134, "num_tokens": 7712895.0, "step": 3720 }, { "entropy": 5.888604354858399, "epoch": 0.3378991291727141, "grad_norm": 1.484375, "learning_rate": 0.0004993098230477471, "loss": 5.8151, "mean_token_accuracy": 0.15019485503435134, "num_tokens": 7723182.0, "step": 3725 }, { "entropy": 5.775590276718139, "epoch": 0.33835268505079824, "grad_norm": 1.390625, "learning_rate": 0.0004993072883352358, "loss": 5.7256, "mean_token_accuracy": 0.1515362799167633, "num_tokens": 7732628.0, "step": 3730 }, { "entropy": 5.752090549468994, "epoch": 0.33880624092888245, "grad_norm": 1.3046875, "learning_rate": 0.0004993047489839927, "loss": 5.7602, "mean_token_accuracy": 0.14875489473342896, "num_tokens": 7742396.0, "step": 3735 }, { "entropy": 5.858716344833374, "epoch": 0.3392597968069666, "grad_norm": 1.5, "learning_rate": 0.0004993022049940702, "loss": 5.8165, "mean_token_accuracy": 0.145614355802536, "num_tokens": 7752070.0, "step": 3740 }, { "entropy": 5.987333536148071, "epoch": 0.3397133526850508, "grad_norm": 1.46875, "learning_rate": 0.0004992996563655209, "loss": 5.8532, "mean_token_accuracy": 0.1467878058552742, "num_tokens": 7762471.0, "step": 3745 }, { "entropy": 5.87470383644104, "epoch": 0.340166908563135, "grad_norm": 1.6796875, "learning_rate": 0.0004992971030983975, "loss": 5.8111, "mean_token_accuracy": 0.1498027741909027, "num_tokens": 7772707.0, "step": 3750 }, { "entropy": 5.763695287704468, "epoch": 0.3406204644412192, "grad_norm": 1.453125, "learning_rate": 0.0004992945451927531, "loss": 5.7885, "mean_token_accuracy": 0.14555259197950363, "num_tokens": 7782883.0, "step": 3755 }, { "entropy": 5.843745946884155, "epoch": 0.34107402031930334, "grad_norm": 1.8984375, "learning_rate": 0.0004992919826486402, "loss": 5.7445, "mean_token_accuracy": 0.14721848517656327, "num_tokens": 7793876.0, "step": 3760 }, { "entropy": 5.876995658874511, "epoch": 0.3415275761973875, "grad_norm": 1.359375, "learning_rate": 0.0004992894154661118, "loss": 5.8008, "mean_token_accuracy": 0.1452129989862442, "num_tokens": 7804777.0, "step": 3765 }, { "entropy": 5.837781381607056, "epoch": 0.3419811320754717, "grad_norm": 1.359375, "learning_rate": 0.0004992868436452213, "loss": 5.7358, "mean_token_accuracy": 0.1464160442352295, "num_tokens": 7815392.0, "step": 3770 }, { "entropy": 5.848176908493042, "epoch": 0.34243468795355586, "grad_norm": 2.296875, "learning_rate": 0.0004992842671860217, "loss": 5.7548, "mean_token_accuracy": 0.15367420464754106, "num_tokens": 7825909.0, "step": 3775 }, { "entropy": 5.799251651763916, "epoch": 0.34288824383164007, "grad_norm": 1.671875, "learning_rate": 0.0004992816860885662, "loss": 5.7141, "mean_token_accuracy": 0.15675887688994408, "num_tokens": 7836513.0, "step": 3780 }, { "entropy": 5.899875736236572, "epoch": 0.3433417997097242, "grad_norm": 1.484375, "learning_rate": 0.0004992791003529084, "loss": 5.8178, "mean_token_accuracy": 0.14457211792469024, "num_tokens": 7847363.0, "step": 3785 }, { "entropy": 5.771605920791626, "epoch": 0.34379535558780844, "grad_norm": 1.71875, "learning_rate": 0.0004992765099791017, "loss": 5.6438, "mean_token_accuracy": 0.15770225077867508, "num_tokens": 7857510.0, "step": 3790 }, { "entropy": 5.728345155715942, "epoch": 0.3442489114658926, "grad_norm": 2.03125, "learning_rate": 0.0004992739149671995, "loss": 5.7539, "mean_token_accuracy": 0.1475256159901619, "num_tokens": 7868239.0, "step": 3795 }, { "entropy": 5.828153514862061, "epoch": 0.3447024673439768, "grad_norm": 1.8515625, "learning_rate": 0.0004992713153172556, "loss": 5.7376, "mean_token_accuracy": 0.1523927077651024, "num_tokens": 7878145.0, "step": 3800 }, { "entropy": 5.877768325805664, "epoch": 0.34515602322206096, "grad_norm": 1.453125, "learning_rate": 0.0004992687110293238, "loss": 5.8837, "mean_token_accuracy": 0.1435710608959198, "num_tokens": 7889011.0, "step": 3805 }, { "entropy": 5.886313724517822, "epoch": 0.3456095791001451, "grad_norm": 1.59375, "learning_rate": 0.0004992661021034579, "loss": 5.7437, "mean_token_accuracy": 0.1526486322283745, "num_tokens": 7898400.0, "step": 3810 }, { "entropy": 5.824654531478882, "epoch": 0.3460631349782293, "grad_norm": 1.6171875, "learning_rate": 0.0004992634885397118, "loss": 5.7714, "mean_token_accuracy": 0.153218924254179, "num_tokens": 7908598.0, "step": 3815 }, { "entropy": 5.864112329483032, "epoch": 0.3465166908563135, "grad_norm": 2.421875, "learning_rate": 0.0004992608703381396, "loss": 5.8513, "mean_token_accuracy": 0.13871943727135658, "num_tokens": 7918870.0, "step": 3820 }, { "entropy": 5.77078537940979, "epoch": 0.3469702467343977, "grad_norm": 1.625, "learning_rate": 0.0004992582474987955, "loss": 5.7228, "mean_token_accuracy": 0.1529923766851425, "num_tokens": 7928669.0, "step": 3825 }, { "entropy": 5.823331737518311, "epoch": 0.34742380261248185, "grad_norm": 1.4921875, "learning_rate": 0.0004992556200217337, "loss": 5.7597, "mean_token_accuracy": 0.14865635335445404, "num_tokens": 7939500.0, "step": 3830 }, { "entropy": 5.77082085609436, "epoch": 0.34787735849056606, "grad_norm": 1.3984375, "learning_rate": 0.0004992529879070085, "loss": 5.7085, "mean_token_accuracy": 0.15079121440649032, "num_tokens": 7949411.0, "step": 3835 }, { "entropy": 5.860919952392578, "epoch": 0.3483309143686502, "grad_norm": 1.4609375, "learning_rate": 0.0004992503511546745, "loss": 5.6855, "mean_token_accuracy": 0.15580998584628106, "num_tokens": 7959242.0, "step": 3840 }, { "entropy": 5.858591938018799, "epoch": 0.3487844702467344, "grad_norm": 1.9609375, "learning_rate": 0.0004992477097647859, "loss": 5.7569, "mean_token_accuracy": 0.14921135529875756, "num_tokens": 7969903.0, "step": 3845 }, { "entropy": 5.800677537918091, "epoch": 0.3492380261248186, "grad_norm": 1.3203125, "learning_rate": 0.0004992450637373976, "loss": 5.8584, "mean_token_accuracy": 0.14383849501609802, "num_tokens": 7981765.0, "step": 3850 }, { "entropy": 5.8215028762817385, "epoch": 0.34969158200290273, "grad_norm": 1.46875, "learning_rate": 0.0004992424130725642, "loss": 5.7196, "mean_token_accuracy": 0.15478193014860153, "num_tokens": 7992480.0, "step": 3855 }, { "entropy": 5.939544343948365, "epoch": 0.35014513788098695, "grad_norm": 1.6328125, "learning_rate": 0.0004992397577703406, "loss": 5.8448, "mean_token_accuracy": 0.1454885832965374, "num_tokens": 8002874.0, "step": 3860 }, { "entropy": 5.930872011184692, "epoch": 0.3505986937590711, "grad_norm": 1.625, "learning_rate": 0.0004992370978307816, "loss": 5.7948, "mean_token_accuracy": 0.14592455103993415, "num_tokens": 8013582.0, "step": 3865 }, { "entropy": 5.803278875350952, "epoch": 0.3510522496371553, "grad_norm": 1.390625, "learning_rate": 0.0004992344332539424, "loss": 5.8452, "mean_token_accuracy": 0.14719062745571138, "num_tokens": 8023492.0, "step": 3870 }, { "entropy": 5.832758569717408, "epoch": 0.35150580551523947, "grad_norm": 1.546875, "learning_rate": 0.0004992317640398779, "loss": 5.7896, "mean_token_accuracy": 0.1514344558119774, "num_tokens": 8034400.0, "step": 3875 }, { "entropy": 5.846541547775269, "epoch": 0.3519593613933237, "grad_norm": 1.5546875, "learning_rate": 0.0004992290901886434, "loss": 5.7428, "mean_token_accuracy": 0.14580017030239106, "num_tokens": 8044779.0, "step": 3880 }, { "entropy": 5.809729337692261, "epoch": 0.35241291727140783, "grad_norm": 1.40625, "learning_rate": 0.000499226411700294, "loss": 5.817, "mean_token_accuracy": 0.152392890304327, "num_tokens": 8055017.0, "step": 3885 }, { "entropy": 5.825460529327392, "epoch": 0.35286647314949204, "grad_norm": 1.6015625, "learning_rate": 0.0004992237285748855, "loss": 5.7631, "mean_token_accuracy": 0.1490686446428299, "num_tokens": 8065369.0, "step": 3890 }, { "entropy": 5.810965633392334, "epoch": 0.3533200290275762, "grad_norm": 1.328125, "learning_rate": 0.0004992210408124731, "loss": 5.7273, "mean_token_accuracy": 0.14731293469667434, "num_tokens": 8075697.0, "step": 3895 }, { "entropy": 5.816468000411987, "epoch": 0.35377358490566035, "grad_norm": 1.6875, "learning_rate": 0.0004992183484131123, "loss": 5.77, "mean_token_accuracy": 0.14932163804769516, "num_tokens": 8086808.0, "step": 3900 }, { "entropy": 5.838976526260376, "epoch": 0.35422714078374457, "grad_norm": 1.8828125, "learning_rate": 0.0004992156513768591, "loss": 5.6807, "mean_token_accuracy": 0.1584209680557251, "num_tokens": 8095933.0, "step": 3905 }, { "entropy": 5.826946640014649, "epoch": 0.3546806966618287, "grad_norm": 1.640625, "learning_rate": 0.000499212949703769, "loss": 5.7467, "mean_token_accuracy": 0.1475004769861698, "num_tokens": 8106591.0, "step": 3910 }, { "entropy": 5.946511936187744, "epoch": 0.35513425253991293, "grad_norm": 1.3671875, "learning_rate": 0.0004992102433938981, "loss": 5.8134, "mean_token_accuracy": 0.1470434546470642, "num_tokens": 8117189.0, "step": 3915 }, { "entropy": 5.775824356079101, "epoch": 0.3555878084179971, "grad_norm": 1.4921875, "learning_rate": 0.0004992075324473021, "loss": 5.7303, "mean_token_accuracy": 0.1483267366886139, "num_tokens": 8128182.0, "step": 3920 }, { "entropy": 5.79977331161499, "epoch": 0.3560413642960813, "grad_norm": 1.515625, "learning_rate": 0.0004992048168640371, "loss": 5.7825, "mean_token_accuracy": 0.14967008605599402, "num_tokens": 8137998.0, "step": 3925 }, { "entropy": 5.905167484283448, "epoch": 0.35649492017416545, "grad_norm": 1.7109375, "learning_rate": 0.0004992020966441595, "loss": 5.7238, "mean_token_accuracy": 0.15360095202922822, "num_tokens": 8148512.0, "step": 3930 }, { "entropy": 5.827831888198853, "epoch": 0.35694847605224966, "grad_norm": 1.3203125, "learning_rate": 0.0004991993717877254, "loss": 5.8453, "mean_token_accuracy": 0.1487443283200264, "num_tokens": 8160154.0, "step": 3935 }, { "entropy": 5.784213018417359, "epoch": 0.3574020319303338, "grad_norm": 1.390625, "learning_rate": 0.0004991966422947911, "loss": 5.7345, "mean_token_accuracy": 0.15293765664100648, "num_tokens": 8169087.0, "step": 3940 }, { "entropy": 5.776965713500976, "epoch": 0.357855587808418, "grad_norm": 1.40625, "learning_rate": 0.0004991939081654132, "loss": 5.6821, "mean_token_accuracy": 0.15219976007938385, "num_tokens": 8178934.0, "step": 3945 }, { "entropy": 5.852101612091064, "epoch": 0.3583091436865022, "grad_norm": 1.46875, "learning_rate": 0.000499191169399648, "loss": 5.7385, "mean_token_accuracy": 0.14779181852936746, "num_tokens": 8189476.0, "step": 3950 }, { "entropy": 5.826294946670532, "epoch": 0.35876269956458634, "grad_norm": 1.5234375, "learning_rate": 0.0004991884259975525, "loss": 5.7689, "mean_token_accuracy": 0.14812640249729156, "num_tokens": 8199297.0, "step": 3955 }, { "entropy": 5.7677168369293215, "epoch": 0.35921625544267055, "grad_norm": 1.34375, "learning_rate": 0.000499185677959183, "loss": 5.702, "mean_token_accuracy": 0.15490943789482117, "num_tokens": 8209723.0, "step": 3960 }, { "entropy": 5.719799375534057, "epoch": 0.3596698113207547, "grad_norm": 1.28125, "learning_rate": 0.0004991829252845966, "loss": 5.725, "mean_token_accuracy": 0.14933027178049088, "num_tokens": 8220246.0, "step": 3965 }, { "entropy": 5.765957307815552, "epoch": 0.3601233671988389, "grad_norm": 1.453125, "learning_rate": 0.0004991801679738502, "loss": 5.8098, "mean_token_accuracy": 0.14969587549567223, "num_tokens": 8230368.0, "step": 3970 }, { "entropy": 5.888836622238159, "epoch": 0.3605769230769231, "grad_norm": 1.390625, "learning_rate": 0.0004991774060270008, "loss": 5.7849, "mean_token_accuracy": 0.14979653880000116, "num_tokens": 8241658.0, "step": 3975 }, { "entropy": 5.876078271865845, "epoch": 0.3610304789550073, "grad_norm": 1.515625, "learning_rate": 0.0004991746394441055, "loss": 5.7625, "mean_token_accuracy": 0.15129579454660416, "num_tokens": 8252675.0, "step": 3980 }, { "entropy": 5.8728478908538815, "epoch": 0.36148403483309144, "grad_norm": 1.8203125, "learning_rate": 0.0004991718682252216, "loss": 5.8308, "mean_token_accuracy": 0.14199524223804474, "num_tokens": 8264492.0, "step": 3985 }, { "entropy": 5.861414003372192, "epoch": 0.3619375907111756, "grad_norm": 1.46875, "learning_rate": 0.0004991690923704063, "loss": 5.8043, "mean_token_accuracy": 0.1468754529953003, "num_tokens": 8275806.0, "step": 3990 }, { "entropy": 5.7705151557922365, "epoch": 0.3623911465892598, "grad_norm": 1.484375, "learning_rate": 0.0004991663118797171, "loss": 5.8434, "mean_token_accuracy": 0.14178252667188646, "num_tokens": 8286478.0, "step": 3995 }, { "entropy": 5.897064113616944, "epoch": 0.36284470246734396, "grad_norm": 1.5703125, "learning_rate": 0.0004991635267532113, "loss": 5.736, "mean_token_accuracy": 0.1468100905418396, "num_tokens": 8296612.0, "step": 4000 }, { "entropy": 5.827452564239502, "epoch": 0.36329825834542817, "grad_norm": 1.5703125, "learning_rate": 0.0004991607369909468, "loss": 5.6949, "mean_token_accuracy": 0.15380942299962044, "num_tokens": 8306990.0, "step": 4005 }, { "entropy": 5.833603858947754, "epoch": 0.3637518142235123, "grad_norm": 1.609375, "learning_rate": 0.0004991579425929811, "loss": 5.8261, "mean_token_accuracy": 0.14629884138703347, "num_tokens": 8316445.0, "step": 4010 }, { "entropy": 5.928536128997803, "epoch": 0.36420537010159654, "grad_norm": 1.671875, "learning_rate": 0.000499155143559372, "loss": 5.7363, "mean_token_accuracy": 0.15292509347200395, "num_tokens": 8327801.0, "step": 4015 }, { "entropy": 5.861473417282104, "epoch": 0.3646589259796807, "grad_norm": 1.34375, "learning_rate": 0.0004991523398901773, "loss": 5.758, "mean_token_accuracy": 0.1410280466079712, "num_tokens": 8338714.0, "step": 4020 }, { "entropy": 5.821960020065307, "epoch": 0.3651124818577649, "grad_norm": 1.265625, "learning_rate": 0.0004991495315854553, "loss": 5.8238, "mean_token_accuracy": 0.1508706659078598, "num_tokens": 8348873.0, "step": 4025 }, { "entropy": 5.8338765621185305, "epoch": 0.36556603773584906, "grad_norm": 1.3359375, "learning_rate": 0.0004991467186452637, "loss": 5.736, "mean_token_accuracy": 0.14726780652999877, "num_tokens": 8359913.0, "step": 4030 }, { "entropy": 5.9051182746887205, "epoch": 0.3660195936139332, "grad_norm": 1.34375, "learning_rate": 0.0004991439010696609, "loss": 5.8848, "mean_token_accuracy": 0.1464948311448097, "num_tokens": 8370697.0, "step": 4035 }, { "entropy": 5.810081911087036, "epoch": 0.3664731494920174, "grad_norm": 1.53125, "learning_rate": 0.0004991410788587051, "loss": 5.7361, "mean_token_accuracy": 0.1557631567120552, "num_tokens": 8380263.0, "step": 4040 }, { "entropy": 5.743243885040283, "epoch": 0.3669267053701016, "grad_norm": 1.5, "learning_rate": 0.0004991382520124547, "loss": 5.6837, "mean_token_accuracy": 0.1497320204973221, "num_tokens": 8390525.0, "step": 4045 }, { "entropy": 5.841325187683106, "epoch": 0.3673802612481858, "grad_norm": 1.765625, "learning_rate": 0.0004991354205309681, "loss": 5.8711, "mean_token_accuracy": 0.14423007443547248, "num_tokens": 8401003.0, "step": 4050 }, { "entropy": 5.945683765411377, "epoch": 0.36783381712626995, "grad_norm": 1.7109375, "learning_rate": 0.000499132584414304, "loss": 5.7648, "mean_token_accuracy": 0.1532066524028778, "num_tokens": 8411688.0, "step": 4055 }, { "entropy": 5.793200826644897, "epoch": 0.36828737300435416, "grad_norm": 1.328125, "learning_rate": 0.0004991297436625207, "loss": 5.7271, "mean_token_accuracy": 0.14746315777301788, "num_tokens": 8422291.0, "step": 4060 }, { "entropy": 5.770292615890503, "epoch": 0.3687409288824383, "grad_norm": 1.5, "learning_rate": 0.0004991268982756774, "loss": 5.7497, "mean_token_accuracy": 0.1400376409292221, "num_tokens": 8433275.0, "step": 4065 }, { "entropy": 5.821974849700927, "epoch": 0.3691944847605225, "grad_norm": 1.3359375, "learning_rate": 0.0004991240482538327, "loss": 5.7172, "mean_token_accuracy": 0.15129573345184327, "num_tokens": 8443877.0, "step": 4070 }, { "entropy": 5.753021097183227, "epoch": 0.3696480406386067, "grad_norm": 1.4765625, "learning_rate": 0.0004991211935970455, "loss": 5.5993, "mean_token_accuracy": 0.15860457271337508, "num_tokens": 8453384.0, "step": 4075 }, { "entropy": 5.8465124607086185, "epoch": 0.37010159651669083, "grad_norm": 1.3203125, "learning_rate": 0.0004991183343053748, "loss": 5.8092, "mean_token_accuracy": 0.14608121365308763, "num_tokens": 8464357.0, "step": 4080 }, { "entropy": 5.834251165390015, "epoch": 0.37055515239477504, "grad_norm": 2.265625, "learning_rate": 0.00049911547037888, "loss": 5.754, "mean_token_accuracy": 0.14439125806093217, "num_tokens": 8474544.0, "step": 4085 }, { "entropy": 5.841232872009277, "epoch": 0.3710087082728592, "grad_norm": 1.328125, "learning_rate": 0.0004991126018176202, "loss": 5.7139, "mean_token_accuracy": 0.14939453601837158, "num_tokens": 8485383.0, "step": 4090 }, { "entropy": 5.789280891418457, "epoch": 0.3714622641509434, "grad_norm": 1.3828125, "learning_rate": 0.0004991097286216545, "loss": 5.7472, "mean_token_accuracy": 0.15124303996562957, "num_tokens": 8497186.0, "step": 4095 }, { "entropy": 5.71776647567749, "epoch": 0.37191582002902757, "grad_norm": 1.7109375, "learning_rate": 0.0004991068507910427, "loss": 5.6491, "mean_token_accuracy": 0.15781550407409667, "num_tokens": 8507583.0, "step": 4100 }, { "entropy": 5.858701610565186, "epoch": 0.3723693759071118, "grad_norm": 1.71875, "learning_rate": 0.000499103968325844, "loss": 5.7401, "mean_token_accuracy": 0.15454131364822388, "num_tokens": 8518301.0, "step": 4105 }, { "entropy": 5.730893135070801, "epoch": 0.37282293178519593, "grad_norm": 1.5703125, "learning_rate": 0.0004991010812261181, "loss": 5.5903, "mean_token_accuracy": 0.16097321063280107, "num_tokens": 8527177.0, "step": 4110 }, { "entropy": 5.769358444213867, "epoch": 0.37327648766328014, "grad_norm": 1.2890625, "learning_rate": 0.0004990981894919248, "loss": 5.693, "mean_token_accuracy": 0.15519624277949334, "num_tokens": 8538207.0, "step": 4115 }, { "entropy": 5.869311189651489, "epoch": 0.3737300435413643, "grad_norm": 1.5234375, "learning_rate": 0.0004990952931233238, "loss": 5.7927, "mean_token_accuracy": 0.15326275080442428, "num_tokens": 8548001.0, "step": 4120 }, { "entropy": 5.816793584823609, "epoch": 0.37418359941944845, "grad_norm": 1.484375, "learning_rate": 0.000499092392120375, "loss": 5.7203, "mean_token_accuracy": 0.14967464953660964, "num_tokens": 8557670.0, "step": 4125 }, { "entropy": 5.683045482635498, "epoch": 0.37463715529753266, "grad_norm": 2.3125, "learning_rate": 0.0004990894864831385, "loss": 5.6447, "mean_token_accuracy": 0.14838514626026153, "num_tokens": 8568820.0, "step": 4130 }, { "entropy": 5.810424661636352, "epoch": 0.3750907111756168, "grad_norm": 1.6015625, "learning_rate": 0.0004990865762116743, "loss": 5.72, "mean_token_accuracy": 0.1498174101114273, "num_tokens": 8579107.0, "step": 4135 }, { "entropy": 5.6872163772583, "epoch": 0.37554426705370103, "grad_norm": 1.3984375, "learning_rate": 0.0004990836613060426, "loss": 5.6298, "mean_token_accuracy": 0.15544298142194748, "num_tokens": 8588487.0, "step": 4140 }, { "entropy": 5.8146415710449215, "epoch": 0.3759978229317852, "grad_norm": 1.3203125, "learning_rate": 0.0004990807417663036, "loss": 5.6826, "mean_token_accuracy": 0.15894482880830765, "num_tokens": 8598526.0, "step": 4145 }, { "entropy": 5.78179669380188, "epoch": 0.3764513788098694, "grad_norm": 1.5234375, "learning_rate": 0.0004990778175925179, "loss": 5.7087, "mean_token_accuracy": 0.15587593317031861, "num_tokens": 8608734.0, "step": 4150 }, { "entropy": 5.733596324920654, "epoch": 0.37690493468795355, "grad_norm": 1.625, "learning_rate": 0.0004990748887847457, "loss": 5.7009, "mean_token_accuracy": 0.15680316239595413, "num_tokens": 8619351.0, "step": 4155 }, { "entropy": 5.780179786682129, "epoch": 0.37735849056603776, "grad_norm": 1.5625, "learning_rate": 0.0004990719553430477, "loss": 5.7569, "mean_token_accuracy": 0.14881235957145691, "num_tokens": 8630570.0, "step": 4160 }, { "entropy": 5.869149160385132, "epoch": 0.3778120464441219, "grad_norm": 1.375, "learning_rate": 0.0004990690172674847, "loss": 5.7907, "mean_token_accuracy": 0.14882688820362092, "num_tokens": 8641081.0, "step": 4165 }, { "entropy": 5.818000078201294, "epoch": 0.3782656023222061, "grad_norm": 1.7109375, "learning_rate": 0.0004990660745581172, "loss": 5.7505, "mean_token_accuracy": 0.15332180112600327, "num_tokens": 8651792.0, "step": 4170 }, { "entropy": 5.863195323944092, "epoch": 0.3787191582002903, "grad_norm": 1.421875, "learning_rate": 0.0004990631272150062, "loss": 5.7807, "mean_token_accuracy": 0.15578781217336654, "num_tokens": 8662385.0, "step": 4175 }, { "entropy": 5.813625764846802, "epoch": 0.37917271407837444, "grad_norm": 1.5703125, "learning_rate": 0.0004990601752382127, "loss": 5.7738, "mean_token_accuracy": 0.15300806015729904, "num_tokens": 8673963.0, "step": 4180 }, { "entropy": 5.777889728546143, "epoch": 0.37962626995645865, "grad_norm": 1.484375, "learning_rate": 0.0004990572186277975, "loss": 5.7038, "mean_token_accuracy": 0.151040218770504, "num_tokens": 8684560.0, "step": 4185 }, { "entropy": 5.844574594497681, "epoch": 0.3800798258345428, "grad_norm": 1.4609375, "learning_rate": 0.0004990542573838221, "loss": 5.7213, "mean_token_accuracy": 0.1503355860710144, "num_tokens": 8694777.0, "step": 4190 }, { "entropy": 5.768202114105224, "epoch": 0.380533381712627, "grad_norm": 1.6171875, "learning_rate": 0.0004990512915063475, "loss": 5.7156, "mean_token_accuracy": 0.14577075690031052, "num_tokens": 8705284.0, "step": 4195 }, { "entropy": 5.800690317153931, "epoch": 0.38098693759071117, "grad_norm": 1.53125, "learning_rate": 0.0004990483209954352, "loss": 5.6345, "mean_token_accuracy": 0.1547250419855118, "num_tokens": 8715156.0, "step": 4200 }, { "entropy": 5.959943342208862, "epoch": 0.3814404934687954, "grad_norm": 1.953125, "learning_rate": 0.0004990453458511464, "loss": 5.8672, "mean_token_accuracy": 0.1470291867852211, "num_tokens": 8726110.0, "step": 4205 }, { "entropy": 5.8400044441223145, "epoch": 0.38189404934687954, "grad_norm": 1.828125, "learning_rate": 0.0004990423660735428, "loss": 5.7056, "mean_token_accuracy": 0.15206836611032487, "num_tokens": 8736331.0, "step": 4210 }, { "entropy": 5.780660247802734, "epoch": 0.3823476052249637, "grad_norm": 1.4453125, "learning_rate": 0.000499039381662686, "loss": 5.7628, "mean_token_accuracy": 0.15221548229455947, "num_tokens": 8747126.0, "step": 4215 }, { "entropy": 5.794266891479492, "epoch": 0.3828011611030479, "grad_norm": 1.5078125, "learning_rate": 0.0004990363926186377, "loss": 5.6882, "mean_token_accuracy": 0.15492002815008163, "num_tokens": 8757948.0, "step": 4220 }, { "entropy": 5.801687479019165, "epoch": 0.38325471698113206, "grad_norm": 1.3828125, "learning_rate": 0.0004990333989414597, "loss": 5.6807, "mean_token_accuracy": 0.15561317056417465, "num_tokens": 8767157.0, "step": 4225 }, { "entropy": 5.817021226882934, "epoch": 0.38370827285921627, "grad_norm": 1.7421875, "learning_rate": 0.0004990304006312138, "loss": 5.7414, "mean_token_accuracy": 0.15308658108115197, "num_tokens": 8777456.0, "step": 4230 }, { "entropy": 5.834913682937622, "epoch": 0.3841618287373004, "grad_norm": 1.8828125, "learning_rate": 0.0004990273976879622, "loss": 5.7314, "mean_token_accuracy": 0.14769532680511474, "num_tokens": 8788147.0, "step": 4235 }, { "entropy": 5.782855558395386, "epoch": 0.38461538461538464, "grad_norm": 1.6640625, "learning_rate": 0.0004990243901117669, "loss": 5.7446, "mean_token_accuracy": 0.15237949043512344, "num_tokens": 8798597.0, "step": 4240 }, { "entropy": 5.880156373977661, "epoch": 0.3850689404934688, "grad_norm": 1.40625, "learning_rate": 0.0004990213779026903, "loss": 5.8421, "mean_token_accuracy": 0.14258336871862412, "num_tokens": 8808644.0, "step": 4245 }, { "entropy": 5.890059137344361, "epoch": 0.385522496371553, "grad_norm": 1.65625, "learning_rate": 0.0004990183610607944, "loss": 5.82, "mean_token_accuracy": 0.14745595827698707, "num_tokens": 8819096.0, "step": 4250 }, { "entropy": 5.921150493621826, "epoch": 0.38597605224963716, "grad_norm": 2.0625, "learning_rate": 0.0004990153395861415, "loss": 5.788, "mean_token_accuracy": 0.15066457390785218, "num_tokens": 8829395.0, "step": 4255 }, { "entropy": 5.76968822479248, "epoch": 0.3864296081277213, "grad_norm": 2.328125, "learning_rate": 0.0004990123134787946, "loss": 5.6839, "mean_token_accuracy": 0.15857364386320114, "num_tokens": 8839841.0, "step": 4260 }, { "entropy": 5.795496988296509, "epoch": 0.3868831640058055, "grad_norm": 1.484375, "learning_rate": 0.0004990092827388159, "loss": 5.7741, "mean_token_accuracy": 0.14829214215278624, "num_tokens": 8850675.0, "step": 4265 }, { "entropy": 5.810708332061767, "epoch": 0.3873367198838897, "grad_norm": 1.875, "learning_rate": 0.0004990062473662681, "loss": 5.6822, "mean_token_accuracy": 0.15104758739471436, "num_tokens": 8862065.0, "step": 4270 }, { "entropy": 5.85414080619812, "epoch": 0.3877902757619739, "grad_norm": 2.09375, "learning_rate": 0.000499003207361214, "loss": 5.7873, "mean_token_accuracy": 0.14664969742298126, "num_tokens": 8872039.0, "step": 4275 }, { "entropy": 5.804039144515992, "epoch": 0.38824383164005805, "grad_norm": 1.78125, "learning_rate": 0.0004990001627237165, "loss": 5.74, "mean_token_accuracy": 0.14450578540563583, "num_tokens": 8882637.0, "step": 4280 }, { "entropy": 5.853966474533081, "epoch": 0.38869738751814226, "grad_norm": 1.71875, "learning_rate": 0.0004989971134538386, "loss": 5.7544, "mean_token_accuracy": 0.15939705222845077, "num_tokens": 8892659.0, "step": 4285 }, { "entropy": 5.836553001403809, "epoch": 0.3891509433962264, "grad_norm": 1.5, "learning_rate": 0.0004989940595516432, "loss": 5.7398, "mean_token_accuracy": 0.1540324307978153, "num_tokens": 8902938.0, "step": 4290 }, { "entropy": 5.771514558792115, "epoch": 0.3896044992743106, "grad_norm": 1.578125, "learning_rate": 0.0004989910010171938, "loss": 5.7289, "mean_token_accuracy": 0.15150050669908524, "num_tokens": 8914084.0, "step": 4295 }, { "entropy": 5.721285963058472, "epoch": 0.3900580551523948, "grad_norm": 1.4765625, "learning_rate": 0.0004989879378505532, "loss": 5.8024, "mean_token_accuracy": 0.1427184097468853, "num_tokens": 8925289.0, "step": 4300 }, { "entropy": 5.827619647979736, "epoch": 0.39051161103047893, "grad_norm": 1.4375, "learning_rate": 0.0004989848700517849, "loss": 5.7478, "mean_token_accuracy": 0.1433940462768078, "num_tokens": 8935193.0, "step": 4305 }, { "entropy": 5.90316915512085, "epoch": 0.39096516690856314, "grad_norm": 1.5234375, "learning_rate": 0.0004989817976209526, "loss": 5.7425, "mean_token_accuracy": 0.15149454772472382, "num_tokens": 8944882.0, "step": 4310 }, { "entropy": 5.884109878540039, "epoch": 0.3914187227866473, "grad_norm": 1.4765625, "learning_rate": 0.0004989787205581196, "loss": 5.8644, "mean_token_accuracy": 0.14161792322993277, "num_tokens": 8956226.0, "step": 4315 }, { "entropy": 5.756166315078735, "epoch": 0.3918722786647315, "grad_norm": 1.5703125, "learning_rate": 0.0004989756388633496, "loss": 5.722, "mean_token_accuracy": 0.15241281241178511, "num_tokens": 8966933.0, "step": 4320 }, { "entropy": 5.809850406646729, "epoch": 0.39232583454281567, "grad_norm": 1.40625, "learning_rate": 0.0004989725525367063, "loss": 5.7099, "mean_token_accuracy": 0.14727903604507447, "num_tokens": 8977352.0, "step": 4325 }, { "entropy": 5.821715021133423, "epoch": 0.3927793904208999, "grad_norm": 1.578125, "learning_rate": 0.0004989694615782534, "loss": 5.7175, "mean_token_accuracy": 0.14821901619434358, "num_tokens": 8987091.0, "step": 4330 }, { "entropy": 5.801403760910034, "epoch": 0.39323294629898403, "grad_norm": 1.703125, "learning_rate": 0.0004989663659880552, "loss": 5.7594, "mean_token_accuracy": 0.15159819200634955, "num_tokens": 8996618.0, "step": 4335 }, { "entropy": 5.806633806228637, "epoch": 0.3936865021770682, "grad_norm": 1.6015625, "learning_rate": 0.0004989632657661754, "loss": 5.7832, "mean_token_accuracy": 0.142975378036499, "num_tokens": 9007618.0, "step": 4340 }, { "entropy": 5.863812828063965, "epoch": 0.3941400580551524, "grad_norm": 1.7734375, "learning_rate": 0.000498960160912678, "loss": 5.738, "mean_token_accuracy": 0.14942926466464995, "num_tokens": 9018472.0, "step": 4345 }, { "entropy": 5.881016540527344, "epoch": 0.39459361393323655, "grad_norm": 1.6953125, "learning_rate": 0.0004989570514276276, "loss": 5.7841, "mean_token_accuracy": 0.15038543343544006, "num_tokens": 9030211.0, "step": 4350 }, { "entropy": 5.824518918991089, "epoch": 0.39504716981132076, "grad_norm": 2.0, "learning_rate": 0.0004989539373110883, "loss": 5.7763, "mean_token_accuracy": 0.1506713002920151, "num_tokens": 9039582.0, "step": 4355 }, { "entropy": 5.853713321685791, "epoch": 0.3955007256894049, "grad_norm": 1.453125, "learning_rate": 0.0004989508185631245, "loss": 5.7896, "mean_token_accuracy": 0.15014094859361649, "num_tokens": 9050645.0, "step": 4360 }, { "entropy": 5.878240489959717, "epoch": 0.39595428156748913, "grad_norm": 2.828125, "learning_rate": 0.0004989476951838006, "loss": 5.8626, "mean_token_accuracy": 0.1465392716228962, "num_tokens": 9061204.0, "step": 4365 }, { "entropy": 5.797079563140869, "epoch": 0.3964078374455733, "grad_norm": 1.53125, "learning_rate": 0.0004989445671731814, "loss": 5.6994, "mean_token_accuracy": 0.14646837934851648, "num_tokens": 9072646.0, "step": 4370 }, { "entropy": 5.806577920913696, "epoch": 0.3968613933236575, "grad_norm": 1.40625, "learning_rate": 0.0004989414345313315, "loss": 5.6603, "mean_token_accuracy": 0.1560521364212036, "num_tokens": 9082693.0, "step": 4375 }, { "entropy": 5.785579872131348, "epoch": 0.39731494920174165, "grad_norm": 1.6484375, "learning_rate": 0.0004989382972583156, "loss": 5.7644, "mean_token_accuracy": 0.14637374579906465, "num_tokens": 9093776.0, "step": 4380 }, { "entropy": 5.823543930053711, "epoch": 0.3977685050798258, "grad_norm": 1.7578125, "learning_rate": 0.0004989351553541986, "loss": 5.7203, "mean_token_accuracy": 0.14628972858190536, "num_tokens": 9103744.0, "step": 4385 }, { "entropy": 5.87626805305481, "epoch": 0.39822206095791, "grad_norm": 1.5, "learning_rate": 0.0004989320088190456, "loss": 5.7449, "mean_token_accuracy": 0.14754146486520767, "num_tokens": 9113588.0, "step": 4390 }, { "entropy": 5.819130325317383, "epoch": 0.3986756168359942, "grad_norm": 1.3984375, "learning_rate": 0.0004989288576529216, "loss": 5.7556, "mean_token_accuracy": 0.14487292245030403, "num_tokens": 9123061.0, "step": 4395 }, { "entropy": 5.816460275650025, "epoch": 0.3991291727140784, "grad_norm": 1.796875, "learning_rate": 0.0004989257018558917, "loss": 5.8459, "mean_token_accuracy": 0.1455293267965317, "num_tokens": 9132810.0, "step": 4400 }, { "entropy": 5.832490015029907, "epoch": 0.39958272859216254, "grad_norm": 1.6015625, "learning_rate": 0.0004989225414280213, "loss": 5.7779, "mean_token_accuracy": 0.15219624638557433, "num_tokens": 9142539.0, "step": 4405 }, { "entropy": 5.840099477767945, "epoch": 0.40003628447024675, "grad_norm": 1.734375, "learning_rate": 0.0004989193763693756, "loss": 5.8218, "mean_token_accuracy": 0.14683979749679565, "num_tokens": 9153646.0, "step": 4410 }, { "entropy": 5.794438648223877, "epoch": 0.4004898403483309, "grad_norm": 2.109375, "learning_rate": 0.0004989162066800202, "loss": 5.6833, "mean_token_accuracy": 0.15239149183034897, "num_tokens": 9164006.0, "step": 4415 }, { "entropy": 5.7646324157714846, "epoch": 0.4009433962264151, "grad_norm": 1.71875, "learning_rate": 0.0004989130323600205, "loss": 5.6939, "mean_token_accuracy": 0.15271419584751128, "num_tokens": 9173398.0, "step": 4420 }, { "entropy": 5.802749443054199, "epoch": 0.40139695210449927, "grad_norm": 2.546875, "learning_rate": 0.0004989098534094424, "loss": 5.7421, "mean_token_accuracy": 0.14769546911120415, "num_tokens": 9184669.0, "step": 4425 }, { "entropy": 5.854629230499268, "epoch": 0.4018505079825834, "grad_norm": 2.625, "learning_rate": 0.0004989066698283512, "loss": 5.7477, "mean_token_accuracy": 0.15191508308053017, "num_tokens": 9194990.0, "step": 4430 }, { "entropy": 5.821303033828736, "epoch": 0.40230406386066764, "grad_norm": 1.5234375, "learning_rate": 0.0004989034816168132, "loss": 5.7576, "mean_token_accuracy": 0.1518094629049301, "num_tokens": 9205548.0, "step": 4435 }, { "entropy": 5.876933431625366, "epoch": 0.4027576197387518, "grad_norm": 1.7265625, "learning_rate": 0.0004989002887748941, "loss": 5.8676, "mean_token_accuracy": 0.14785950928926467, "num_tokens": 9217189.0, "step": 4440 }, { "entropy": 5.897108030319214, "epoch": 0.403211175616836, "grad_norm": 2.03125, "learning_rate": 0.0004988970913026601, "loss": 5.6841, "mean_token_accuracy": 0.15338665544986724, "num_tokens": 9226774.0, "step": 4445 }, { "entropy": 5.785064220428467, "epoch": 0.40366473149492016, "grad_norm": 2.03125, "learning_rate": 0.0004988938892001771, "loss": 5.6011, "mean_token_accuracy": 0.15826690644025804, "num_tokens": 9236058.0, "step": 4450 }, { "entropy": 5.826375579833984, "epoch": 0.40411828737300437, "grad_norm": 1.5078125, "learning_rate": 0.0004988906824675113, "loss": 5.7579, "mean_token_accuracy": 0.15533598959445954, "num_tokens": 9247204.0, "step": 4455 }, { "entropy": 5.755468320846558, "epoch": 0.4045718432510885, "grad_norm": 1.515625, "learning_rate": 0.0004988874711047293, "loss": 5.6998, "mean_token_accuracy": 0.15389265343546868, "num_tokens": 9257658.0, "step": 4460 }, { "entropy": 5.851498746871949, "epoch": 0.40502539912917274, "grad_norm": 1.578125, "learning_rate": 0.0004988842551118972, "loss": 5.6804, "mean_token_accuracy": 0.16036645770072938, "num_tokens": 9267078.0, "step": 4465 }, { "entropy": 5.778662586212159, "epoch": 0.4054789550072569, "grad_norm": 1.5, "learning_rate": 0.0004988810344890818, "loss": 5.7089, "mean_token_accuracy": 0.15287381559610366, "num_tokens": 9277653.0, "step": 4470 }, { "entropy": 5.814766693115234, "epoch": 0.40593251088534105, "grad_norm": 1.5859375, "learning_rate": 0.0004988778092363494, "loss": 5.7226, "mean_token_accuracy": 0.14548192843794822, "num_tokens": 9287854.0, "step": 4475 }, { "entropy": 5.7822350025177, "epoch": 0.40638606676342526, "grad_norm": 1.8359375, "learning_rate": 0.0004988745793537671, "loss": 5.6167, "mean_token_accuracy": 0.15381321907043458, "num_tokens": 9298389.0, "step": 4480 }, { "entropy": 5.788981294631958, "epoch": 0.4068396226415094, "grad_norm": 1.578125, "learning_rate": 0.0004988713448414011, "loss": 5.6521, "mean_token_accuracy": 0.1534888431429863, "num_tokens": 9308350.0, "step": 4485 }, { "entropy": 5.803249788284302, "epoch": 0.4072931785195936, "grad_norm": 1.5703125, "learning_rate": 0.000498868105699319, "loss": 5.7757, "mean_token_accuracy": 0.14718539863824845, "num_tokens": 9319386.0, "step": 4490 }, { "entropy": 5.938737583160401, "epoch": 0.4077467343976778, "grad_norm": 1.921875, "learning_rate": 0.0004988648619275872, "loss": 5.8108, "mean_token_accuracy": 0.14430881813168525, "num_tokens": 9331151.0, "step": 4495 }, { "entropy": 5.78353066444397, "epoch": 0.408200290275762, "grad_norm": 1.484375, "learning_rate": 0.0004988616135262729, "loss": 5.784, "mean_token_accuracy": 0.1513584613800049, "num_tokens": 9341472.0, "step": 4500 }, { "entropy": 5.890974712371826, "epoch": 0.40865384615384615, "grad_norm": 1.5859375, "learning_rate": 0.0004988583604954436, "loss": 5.7534, "mean_token_accuracy": 0.1468189090490341, "num_tokens": 9351641.0, "step": 4505 }, { "entropy": 5.831851387023926, "epoch": 0.40910740203193036, "grad_norm": 2.046875, "learning_rate": 0.0004988551028351663, "loss": 5.7248, "mean_token_accuracy": 0.1530272752046585, "num_tokens": 9362220.0, "step": 4510 }, { "entropy": 5.753470230102539, "epoch": 0.4095609579100145, "grad_norm": 1.890625, "learning_rate": 0.0004988518405455084, "loss": 5.6809, "mean_token_accuracy": 0.15855793803930282, "num_tokens": 9372667.0, "step": 4515 }, { "entropy": 5.71013650894165, "epoch": 0.41001451378809867, "grad_norm": 1.71875, "learning_rate": 0.0004988485736265374, "loss": 5.6626, "mean_token_accuracy": 0.15513231456279755, "num_tokens": 9383133.0, "step": 4520 }, { "entropy": 5.893728303909302, "epoch": 0.4104680696661829, "grad_norm": 2.0625, "learning_rate": 0.000498845302078321, "loss": 5.7767, "mean_token_accuracy": 0.1552646741271019, "num_tokens": 9394484.0, "step": 4525 }, { "entropy": 5.881732940673828, "epoch": 0.41092162554426703, "grad_norm": 2.078125, "learning_rate": 0.0004988420259009266, "loss": 5.7546, "mean_token_accuracy": 0.1457567699253559, "num_tokens": 9404360.0, "step": 4530 }, { "entropy": 5.79802098274231, "epoch": 0.41137518142235124, "grad_norm": 1.984375, "learning_rate": 0.000498838745094422, "loss": 5.7456, "mean_token_accuracy": 0.15776007771492004, "num_tokens": 9414638.0, "step": 4535 }, { "entropy": 5.890639591217041, "epoch": 0.4118287373004354, "grad_norm": 2.328125, "learning_rate": 0.0004988354596588751, "loss": 5.7998, "mean_token_accuracy": 0.14425266459584235, "num_tokens": 9424602.0, "step": 4540 }, { "entropy": 5.780306434631347, "epoch": 0.4122822931785196, "grad_norm": 1.96875, "learning_rate": 0.0004988321695943539, "loss": 5.6926, "mean_token_accuracy": 0.1462174102663994, "num_tokens": 9434724.0, "step": 4545 }, { "entropy": 5.876906967163086, "epoch": 0.41273584905660377, "grad_norm": 1.734375, "learning_rate": 0.0004988288749009264, "loss": 5.8353, "mean_token_accuracy": 0.14362881630659102, "num_tokens": 9444604.0, "step": 4550 }, { "entropy": 5.931415939331055, "epoch": 0.413189404934688, "grad_norm": 1.921875, "learning_rate": 0.0004988255755786608, "loss": 5.6943, "mean_token_accuracy": 0.1535832941532135, "num_tokens": 9455447.0, "step": 4555 }, { "entropy": 5.800370836257935, "epoch": 0.41364296081277213, "grad_norm": 2.125, "learning_rate": 0.0004988222716276251, "loss": 5.6941, "mean_token_accuracy": 0.14634924903512, "num_tokens": 9466030.0, "step": 4560 }, { "entropy": 5.8000507831573485, "epoch": 0.4140965166908563, "grad_norm": 2.1875, "learning_rate": 0.000498818963047888, "loss": 5.784, "mean_token_accuracy": 0.14505551978945733, "num_tokens": 9476352.0, "step": 4565 }, { "entropy": 5.809683704376221, "epoch": 0.4145500725689405, "grad_norm": 1.9453125, "learning_rate": 0.0004988156498395176, "loss": 5.6833, "mean_token_accuracy": 0.15042722076177598, "num_tokens": 9486782.0, "step": 4570 }, { "entropy": 5.720265960693359, "epoch": 0.41500362844702465, "grad_norm": 1.5234375, "learning_rate": 0.0004988123320025825, "loss": 5.7464, "mean_token_accuracy": 0.14237145334482193, "num_tokens": 9496381.0, "step": 4575 }, { "entropy": 5.881400394439697, "epoch": 0.41545718432510886, "grad_norm": 2.171875, "learning_rate": 0.0004988090095371514, "loss": 5.7141, "mean_token_accuracy": 0.1511618971824646, "num_tokens": 9506848.0, "step": 4580 }, { "entropy": 5.860961961746216, "epoch": 0.415910740203193, "grad_norm": 1.578125, "learning_rate": 0.0004988056824432928, "loss": 5.7217, "mean_token_accuracy": 0.15837913155555725, "num_tokens": 9517454.0, "step": 4585 }, { "entropy": 5.8560021877288815, "epoch": 0.41636429608127723, "grad_norm": 1.703125, "learning_rate": 0.0004988023507210758, "loss": 5.7768, "mean_token_accuracy": 0.14282424747943878, "num_tokens": 9528124.0, "step": 4590 }, { "entropy": 5.789300346374512, "epoch": 0.4168178519593614, "grad_norm": 1.9453125, "learning_rate": 0.0004987990143705692, "loss": 5.657, "mean_token_accuracy": 0.15939900577068328, "num_tokens": 9537754.0, "step": 4595 }, { "entropy": 5.859958600997925, "epoch": 0.4172714078374456, "grad_norm": 2.046875, "learning_rate": 0.0004987956733918418, "loss": 5.7809, "mean_token_accuracy": 0.15173441544175148, "num_tokens": 9547239.0, "step": 4600 }, { "entropy": 5.76247010231018, "epoch": 0.41772496371552975, "grad_norm": 2.859375, "learning_rate": 0.0004987923277849629, "loss": 5.749, "mean_token_accuracy": 0.1517804205417633, "num_tokens": 9557854.0, "step": 4605 }, { "entropy": 5.802983283996582, "epoch": 0.4181785195936139, "grad_norm": 1.734375, "learning_rate": 0.0004987889775500017, "loss": 5.7077, "mean_token_accuracy": 0.15349361896514893, "num_tokens": 9567524.0, "step": 4610 }, { "entropy": 5.7994297504425045, "epoch": 0.4186320754716981, "grad_norm": 2.1875, "learning_rate": 0.0004987856226870272, "loss": 5.6602, "mean_token_accuracy": 0.15707680732011794, "num_tokens": 9578478.0, "step": 4615 }, { "entropy": 5.7925835132598875, "epoch": 0.4190856313497823, "grad_norm": 1.78125, "learning_rate": 0.0004987822631961092, "loss": 5.7887, "mean_token_accuracy": 0.14697084799408913, "num_tokens": 9588552.0, "step": 4620 }, { "entropy": 5.900826263427734, "epoch": 0.4195391872278665, "grad_norm": 1.609375, "learning_rate": 0.000498778899077317, "loss": 5.724, "mean_token_accuracy": 0.14913754314184188, "num_tokens": 9598722.0, "step": 4625 }, { "entropy": 5.903703784942627, "epoch": 0.41999274310595064, "grad_norm": 1.78125, "learning_rate": 0.00049877553033072, "loss": 5.8056, "mean_token_accuracy": 0.14776846021413803, "num_tokens": 9608430.0, "step": 4630 }, { "entropy": 5.866693353652954, "epoch": 0.42044629898403485, "grad_norm": 1.3515625, "learning_rate": 0.0004987721569563882, "loss": 5.758, "mean_token_accuracy": 0.15444098860025407, "num_tokens": 9618299.0, "step": 4635 }, { "entropy": 5.758925914764404, "epoch": 0.420899854862119, "grad_norm": 2.28125, "learning_rate": 0.000498768778954391, "loss": 5.6869, "mean_token_accuracy": 0.1507744535803795, "num_tokens": 9627271.0, "step": 4640 }, { "entropy": 5.765277528762818, "epoch": 0.4213534107402032, "grad_norm": 2.296875, "learning_rate": 0.0004987653963247985, "loss": 5.6903, "mean_token_accuracy": 0.15712204724550247, "num_tokens": 9637670.0, "step": 4645 }, { "entropy": 5.841526508331299, "epoch": 0.42180696661828737, "grad_norm": 1.5625, "learning_rate": 0.0004987620090676805, "loss": 5.7219, "mean_token_accuracy": 0.15380015224218369, "num_tokens": 9647740.0, "step": 4650 }, { "entropy": 5.8366029262542725, "epoch": 0.4222605224963715, "grad_norm": 1.46875, "learning_rate": 0.0004987586171831072, "loss": 5.7637, "mean_token_accuracy": 0.1503145769238472, "num_tokens": 9657917.0, "step": 4655 }, { "entropy": 5.762486696243286, "epoch": 0.42271407837445574, "grad_norm": 1.6796875, "learning_rate": 0.0004987552206711487, "loss": 5.6918, "mean_token_accuracy": 0.15710619539022447, "num_tokens": 9668066.0, "step": 4660 }, { "entropy": 5.8115678310394285, "epoch": 0.4231676342525399, "grad_norm": 1.7109375, "learning_rate": 0.0004987518195318752, "loss": 5.6498, "mean_token_accuracy": 0.15243688523769378, "num_tokens": 9677636.0, "step": 4665 }, { "entropy": 5.867781496047973, "epoch": 0.4236211901306241, "grad_norm": 1.4765625, "learning_rate": 0.000498748413765357, "loss": 5.8377, "mean_token_accuracy": 0.14748723134398461, "num_tokens": 9688268.0, "step": 4670 }, { "entropy": 5.835544300079346, "epoch": 0.42407474600870826, "grad_norm": 1.5625, "learning_rate": 0.0004987450033716646, "loss": 5.7391, "mean_token_accuracy": 0.1544426128268242, "num_tokens": 9698238.0, "step": 4675 }, { "entropy": 5.823677968978882, "epoch": 0.42452830188679247, "grad_norm": 1.671875, "learning_rate": 0.0004987415883508686, "loss": 5.6951, "mean_token_accuracy": 0.15021548718214034, "num_tokens": 9709149.0, "step": 4680 }, { "entropy": 5.771041297912598, "epoch": 0.4249818577648766, "grad_norm": 1.5, "learning_rate": 0.0004987381687030394, "loss": 5.7586, "mean_token_accuracy": 0.1466877669095993, "num_tokens": 9719486.0, "step": 4685 }, { "entropy": 5.784495067596436, "epoch": 0.42543541364296084, "grad_norm": 1.7109375, "learning_rate": 0.0004987347444282479, "loss": 5.6918, "mean_token_accuracy": 0.15039761662483214, "num_tokens": 9729891.0, "step": 4690 }, { "entropy": 5.818458509445191, "epoch": 0.425888969521045, "grad_norm": 1.921875, "learning_rate": 0.0004987313155265649, "loss": 5.7094, "mean_token_accuracy": 0.15848611816763877, "num_tokens": 9739418.0, "step": 4695 }, { "entropy": 5.782320213317871, "epoch": 0.42634252539912915, "grad_norm": 1.6953125, "learning_rate": 0.0004987278819980613, "loss": 5.7544, "mean_token_accuracy": 0.15276919007301332, "num_tokens": 9750410.0, "step": 4700 }, { "entropy": 5.833681964874268, "epoch": 0.42679608127721336, "grad_norm": 1.734375, "learning_rate": 0.0004987244438428081, "loss": 5.8478, "mean_token_accuracy": 0.14890251234173774, "num_tokens": 9761986.0, "step": 4705 }, { "entropy": 5.861217498779297, "epoch": 0.4272496371552975, "grad_norm": 1.671875, "learning_rate": 0.0004987210010608764, "loss": 5.675, "mean_token_accuracy": 0.15809816718101502, "num_tokens": 9772368.0, "step": 4710 }, { "entropy": 5.840431547164917, "epoch": 0.4277031930333817, "grad_norm": 2.171875, "learning_rate": 0.0004987175536523373, "loss": 5.7687, "mean_token_accuracy": 0.15153285264968872, "num_tokens": 9782249.0, "step": 4715 }, { "entropy": 5.903892135620117, "epoch": 0.4281567489114659, "grad_norm": 1.609375, "learning_rate": 0.0004987141016172622, "loss": 5.7235, "mean_token_accuracy": 0.15167634487152098, "num_tokens": 9791932.0, "step": 4720 }, { "entropy": 5.7715545177459715, "epoch": 0.4286103047895501, "grad_norm": 1.8359375, "learning_rate": 0.0004987106449557225, "loss": 5.6834, "mean_token_accuracy": 0.14576440975069999, "num_tokens": 9803226.0, "step": 4725 }, { "entropy": 5.82260537147522, "epoch": 0.42906386066763424, "grad_norm": 1.84375, "learning_rate": 0.0004987071836677896, "loss": 5.7597, "mean_token_accuracy": 0.14706346690654754, "num_tokens": 9814036.0, "step": 4730 }, { "entropy": 5.897468614578247, "epoch": 0.42951741654571846, "grad_norm": 2.484375, "learning_rate": 0.0004987037177535353, "loss": 5.7455, "mean_token_accuracy": 0.14280677139759063, "num_tokens": 9825537.0, "step": 4735 }, { "entropy": 5.824542474746704, "epoch": 0.4299709724238026, "grad_norm": 1.4140625, "learning_rate": 0.0004987002472130309, "loss": 5.6583, "mean_token_accuracy": 0.14865368008613586, "num_tokens": 9835437.0, "step": 4740 }, { "entropy": 5.757734489440918, "epoch": 0.43042452830188677, "grad_norm": 2.5, "learning_rate": 0.0004986967720463485, "loss": 5.6658, "mean_token_accuracy": 0.14633326083421708, "num_tokens": 9845834.0, "step": 4745 }, { "entropy": 5.862345170974732, "epoch": 0.430878084179971, "grad_norm": 1.6953125, "learning_rate": 0.0004986932922535598, "loss": 5.749, "mean_token_accuracy": 0.15574838668107988, "num_tokens": 9855984.0, "step": 4750 }, { "entropy": 5.840075349807739, "epoch": 0.43133164005805513, "grad_norm": 2.453125, "learning_rate": 0.0004986898078347368, "loss": 5.7115, "mean_token_accuracy": 0.15084850937128066, "num_tokens": 9866203.0, "step": 4755 }, { "entropy": 5.747245264053345, "epoch": 0.43178519593613934, "grad_norm": 1.75, "learning_rate": 0.0004986863187899516, "loss": 5.6573, "mean_token_accuracy": 0.15622658431529998, "num_tokens": 9875940.0, "step": 4760 }, { "entropy": 5.843631267547607, "epoch": 0.4322387518142235, "grad_norm": 1.90625, "learning_rate": 0.0004986828251192764, "loss": 5.8129, "mean_token_accuracy": 0.14796200692653655, "num_tokens": 9886769.0, "step": 4765 }, { "entropy": 5.827453851699829, "epoch": 0.4326923076923077, "grad_norm": 1.859375, "learning_rate": 0.0004986793268227833, "loss": 5.6781, "mean_token_accuracy": 0.1584503948688507, "num_tokens": 9897066.0, "step": 4770 }, { "entropy": 5.7666703224182125, "epoch": 0.43314586357039186, "grad_norm": 1.671875, "learning_rate": 0.0004986758239005448, "loss": 5.6937, "mean_token_accuracy": 0.15196367353200912, "num_tokens": 9907113.0, "step": 4775 }, { "entropy": 5.822373628616333, "epoch": 0.4335994194484761, "grad_norm": 1.84375, "learning_rate": 0.0004986723163526331, "loss": 5.7041, "mean_token_accuracy": 0.15160846412181855, "num_tokens": 9917410.0, "step": 4780 }, { "entropy": 5.920275545120239, "epoch": 0.43405297532656023, "grad_norm": 1.7890625, "learning_rate": 0.0004986688041791209, "loss": 5.6623, "mean_token_accuracy": 0.15733712017536164, "num_tokens": 9927482.0, "step": 4785 }, { "entropy": 5.683720445632934, "epoch": 0.4345065312046444, "grad_norm": 1.640625, "learning_rate": 0.000498665287380081, "loss": 5.6526, "mean_token_accuracy": 0.1548801988363266, "num_tokens": 9937623.0, "step": 4790 }, { "entropy": 5.768561315536499, "epoch": 0.4349600870827286, "grad_norm": 1.625, "learning_rate": 0.0004986617659555859, "loss": 5.6815, "mean_token_accuracy": 0.1445303425192833, "num_tokens": 9947669.0, "step": 4795 }, { "entropy": 5.814534473419189, "epoch": 0.43541364296081275, "grad_norm": 1.625, "learning_rate": 0.0004986582399057085, "loss": 5.676, "mean_token_accuracy": 0.14978551864624023, "num_tokens": 9958574.0, "step": 4800 }, { "entropy": 5.796423864364624, "epoch": 0.43586719883889696, "grad_norm": 1.9296875, "learning_rate": 0.0004986547092305216, "loss": 5.7087, "mean_token_accuracy": 0.15057784467935562, "num_tokens": 9969404.0, "step": 4805 }, { "entropy": 5.715034484863281, "epoch": 0.4363207547169811, "grad_norm": 1.7109375, "learning_rate": 0.0004986511739300984, "loss": 5.6993, "mean_token_accuracy": 0.15097863227128983, "num_tokens": 9979860.0, "step": 4810 }, { "entropy": 5.806329584121704, "epoch": 0.43677431059506533, "grad_norm": 3.125, "learning_rate": 0.0004986476340045119, "loss": 5.7253, "mean_token_accuracy": 0.15245338007807732, "num_tokens": 9989390.0, "step": 4815 }, { "entropy": 5.770902156829834, "epoch": 0.4372278664731495, "grad_norm": 2.640625, "learning_rate": 0.0004986440894538354, "loss": 5.7683, "mean_token_accuracy": 0.1453310377895832, "num_tokens": 9999853.0, "step": 4820 }, { "entropy": 5.86833610534668, "epoch": 0.4376814223512337, "grad_norm": 2.046875, "learning_rate": 0.0004986405402781421, "loss": 5.7106, "mean_token_accuracy": 0.14741745889186858, "num_tokens": 10010591.0, "step": 4825 }, { "entropy": 5.895445060729981, "epoch": 0.43813497822931785, "grad_norm": 2.421875, "learning_rate": 0.0004986369864775054, "loss": 5.7029, "mean_token_accuracy": 0.15746968388557434, "num_tokens": 10020662.0, "step": 4830 }, { "entropy": 5.737722682952881, "epoch": 0.438588534107402, "grad_norm": 1.484375, "learning_rate": 0.0004986334280519989, "loss": 5.6887, "mean_token_accuracy": 0.15356032699346542, "num_tokens": 10029887.0, "step": 4835 }, { "entropy": 5.78506498336792, "epoch": 0.4390420899854862, "grad_norm": 2.453125, "learning_rate": 0.000498629865001696, "loss": 5.7734, "mean_token_accuracy": 0.1432656690478325, "num_tokens": 10040535.0, "step": 4840 }, { "entropy": 5.846698236465454, "epoch": 0.43949564586357037, "grad_norm": 1.5234375, "learning_rate": 0.0004986262973266706, "loss": 5.7041, "mean_token_accuracy": 0.14938746839761735, "num_tokens": 10051133.0, "step": 4845 }, { "entropy": 5.737699556350708, "epoch": 0.4399492017416546, "grad_norm": 1.453125, "learning_rate": 0.0004986227250269964, "loss": 5.6403, "mean_token_accuracy": 0.15840096175670623, "num_tokens": 10060955.0, "step": 4850 }, { "entropy": 5.754516363143921, "epoch": 0.44040275761973874, "grad_norm": 1.671875, "learning_rate": 0.0004986191481027472, "loss": 5.7054, "mean_token_accuracy": 0.15085024312138556, "num_tokens": 10070800.0, "step": 4855 }, { "entropy": 5.799833726882935, "epoch": 0.44085631349782295, "grad_norm": 1.78125, "learning_rate": 0.0004986155665539971, "loss": 5.6972, "mean_token_accuracy": 0.15538632571697236, "num_tokens": 10080279.0, "step": 4860 }, { "entropy": 5.7664475440979, "epoch": 0.4413098693759071, "grad_norm": 1.5234375, "learning_rate": 0.00049861198038082, "loss": 5.7044, "mean_token_accuracy": 0.14653226137161254, "num_tokens": 10089441.0, "step": 4865 }, { "entropy": 5.894711446762085, "epoch": 0.4417634252539913, "grad_norm": 1.890625, "learning_rate": 0.0004986083895832903, "loss": 5.8118, "mean_token_accuracy": 0.14082608968019486, "num_tokens": 10100642.0, "step": 4870 }, { "entropy": 5.872471046447754, "epoch": 0.44221698113207547, "grad_norm": 1.4375, "learning_rate": 0.0004986047941614821, "loss": 5.749, "mean_token_accuracy": 0.15137091875076295, "num_tokens": 10112434.0, "step": 4875 }, { "entropy": 5.77865195274353, "epoch": 0.4426705370101596, "grad_norm": 1.8125, "learning_rate": 0.0004986011941154696, "loss": 5.7504, "mean_token_accuracy": 0.1506796345114708, "num_tokens": 10123094.0, "step": 4880 }, { "entropy": 5.942609786987305, "epoch": 0.44312409288824384, "grad_norm": 1.5625, "learning_rate": 0.0004985975894453275, "loss": 5.7935, "mean_token_accuracy": 0.15835359022021295, "num_tokens": 10133357.0, "step": 4885 }, { "entropy": 5.7874181270599365, "epoch": 0.443577648766328, "grad_norm": 1.5, "learning_rate": 0.0004985939801511304, "loss": 5.6562, "mean_token_accuracy": 0.15655628293752671, "num_tokens": 10143561.0, "step": 4890 }, { "entropy": 5.748687791824341, "epoch": 0.4440312046444122, "grad_norm": 1.6640625, "learning_rate": 0.0004985903662329527, "loss": 5.7435, "mean_token_accuracy": 0.1459873951971531, "num_tokens": 10154302.0, "step": 4895 }, { "entropy": 5.8301349639892575, "epoch": 0.44448476052249636, "grad_norm": 1.7265625, "learning_rate": 0.0004985867476908693, "loss": 5.726, "mean_token_accuracy": 0.15291691124439238, "num_tokens": 10164357.0, "step": 4900 }, { "entropy": 5.749996614456177, "epoch": 0.44493831640058057, "grad_norm": 1.65625, "learning_rate": 0.0004985831245249549, "loss": 5.6574, "mean_token_accuracy": 0.15303636640310286, "num_tokens": 10173456.0, "step": 4905 }, { "entropy": 5.747867584228516, "epoch": 0.4453918722786647, "grad_norm": 1.59375, "learning_rate": 0.0004985794967352846, "loss": 5.5875, "mean_token_accuracy": 0.1556650996208191, "num_tokens": 10182823.0, "step": 4910 }, { "entropy": 5.773955678939819, "epoch": 0.44584542815674894, "grad_norm": 1.890625, "learning_rate": 0.0004985758643219334, "loss": 5.6849, "mean_token_accuracy": 0.15339920967817305, "num_tokens": 10192668.0, "step": 4915 }, { "entropy": 5.762610244750976, "epoch": 0.4462989840348331, "grad_norm": 1.6328125, "learning_rate": 0.0004985722272849762, "loss": 5.64, "mean_token_accuracy": 0.15597241818904878, "num_tokens": 10202997.0, "step": 4920 }, { "entropy": 5.782825231552124, "epoch": 0.44675253991291725, "grad_norm": 1.7421875, "learning_rate": 0.0004985685856244884, "loss": 5.6605, "mean_token_accuracy": 0.15476631075143815, "num_tokens": 10212136.0, "step": 4925 }, { "entropy": 5.7222226619720455, "epoch": 0.44720609579100146, "grad_norm": 1.625, "learning_rate": 0.0004985649393405453, "loss": 5.7605, "mean_token_accuracy": 0.15388176888227462, "num_tokens": 10221910.0, "step": 4930 }, { "entropy": 5.806464099884034, "epoch": 0.4476596516690856, "grad_norm": 2.046875, "learning_rate": 0.0004985612884332223, "loss": 5.7126, "mean_token_accuracy": 0.1526092231273651, "num_tokens": 10231430.0, "step": 4935 }, { "entropy": 5.784297037124634, "epoch": 0.4481132075471698, "grad_norm": 2.484375, "learning_rate": 0.0004985576329025949, "loss": 5.6452, "mean_token_accuracy": 0.1589261770248413, "num_tokens": 10242095.0, "step": 4940 }, { "entropy": 5.742293357849121, "epoch": 0.448566763425254, "grad_norm": 1.7578125, "learning_rate": 0.0004985539727487385, "loss": 5.6367, "mean_token_accuracy": 0.1511576235294342, "num_tokens": 10252083.0, "step": 4945 }, { "entropy": 5.782474040985107, "epoch": 0.4490203193033382, "grad_norm": 1.546875, "learning_rate": 0.0004985503079717292, "loss": 5.7418, "mean_token_accuracy": 0.15320956856012344, "num_tokens": 10262621.0, "step": 4950 }, { "entropy": 5.908123397827149, "epoch": 0.44947387518142234, "grad_norm": 1.5859375, "learning_rate": 0.0004985466385716425, "loss": 5.8807, "mean_token_accuracy": 0.14101727977395057, "num_tokens": 10274406.0, "step": 4955 }, { "entropy": 5.851602983474732, "epoch": 0.44992743105950656, "grad_norm": 1.6015625, "learning_rate": 0.0004985429645485543, "loss": 5.6811, "mean_token_accuracy": 0.14795504212379457, "num_tokens": 10284688.0, "step": 4960 }, { "entropy": 5.842687511444092, "epoch": 0.4503809869375907, "grad_norm": 1.4375, "learning_rate": 0.0004985392859025407, "loss": 5.7318, "mean_token_accuracy": 0.15307743102312088, "num_tokens": 10295708.0, "step": 4965 }, { "entropy": 5.841201591491699, "epoch": 0.45083454281567487, "grad_norm": 1.984375, "learning_rate": 0.0004985356026336776, "loss": 5.7051, "mean_token_accuracy": 0.14724947661161422, "num_tokens": 10306345.0, "step": 4970 }, { "entropy": 5.797213697433472, "epoch": 0.4512880986937591, "grad_norm": 2.09375, "learning_rate": 0.0004985319147420414, "loss": 5.6929, "mean_token_accuracy": 0.14897643476724626, "num_tokens": 10316289.0, "step": 4975 }, { "entropy": 5.752896404266357, "epoch": 0.45174165457184323, "grad_norm": 2.125, "learning_rate": 0.0004985282222277082, "loss": 5.7097, "mean_token_accuracy": 0.1546037197113037, "num_tokens": 10326355.0, "step": 4980 }, { "entropy": 5.856582164764404, "epoch": 0.45219521044992744, "grad_norm": 2.15625, "learning_rate": 0.0004985245250907544, "loss": 5.7639, "mean_token_accuracy": 0.1496923163533211, "num_tokens": 10336010.0, "step": 4985 }, { "entropy": 5.797954511642456, "epoch": 0.4526487663280116, "grad_norm": 1.859375, "learning_rate": 0.0004985208233312564, "loss": 5.6639, "mean_token_accuracy": 0.1572360098361969, "num_tokens": 10346559.0, "step": 4990 }, { "entropy": 5.830086183547974, "epoch": 0.4531023222060958, "grad_norm": 1.734375, "learning_rate": 0.0004985171169492908, "loss": 5.6968, "mean_token_accuracy": 0.161420102417469, "num_tokens": 10356695.0, "step": 4995 }, { "entropy": 5.8636914730072025, "epoch": 0.45355587808417996, "grad_norm": 1.53125, "learning_rate": 0.0004985134059449344, "loss": 5.8988, "mean_token_accuracy": 0.1391928419470787, "num_tokens": 10367813.0, "step": 5000 }, { "entropy": 5.822160959243774, "epoch": 0.4540094339622642, "grad_norm": 1.6328125, "learning_rate": 0.0004985096903182637, "loss": 5.6941, "mean_token_accuracy": 0.15162536948919297, "num_tokens": 10378146.0, "step": 5005 }, { "entropy": 5.8184010028839115, "epoch": 0.45446298984034833, "grad_norm": 1.5625, "learning_rate": 0.0004985059700693557, "loss": 5.6652, "mean_token_accuracy": 0.15473043769598008, "num_tokens": 10389702.0, "step": 5010 }, { "entropy": 5.726432371139526, "epoch": 0.4549165457184325, "grad_norm": 1.765625, "learning_rate": 0.0004985022451982872, "loss": 5.6486, "mean_token_accuracy": 0.15523469001054763, "num_tokens": 10400150.0, "step": 5015 }, { "entropy": 5.768562316894531, "epoch": 0.4553701015965167, "grad_norm": 1.6640625, "learning_rate": 0.0004984985157051354, "loss": 5.6974, "mean_token_accuracy": 0.15065493658185006, "num_tokens": 10410928.0, "step": 5020 }, { "entropy": 5.909054613113403, "epoch": 0.45582365747460085, "grad_norm": 1.8671875, "learning_rate": 0.0004984947815899774, "loss": 5.8095, "mean_token_accuracy": 0.14077219292521476, "num_tokens": 10422129.0, "step": 5025 }, { "entropy": 5.8900409698486325, "epoch": 0.45627721335268506, "grad_norm": 2.671875, "learning_rate": 0.0004984910428528902, "loss": 5.8198, "mean_token_accuracy": 0.15190441012382508, "num_tokens": 10432536.0, "step": 5030 }, { "entropy": 5.81307315826416, "epoch": 0.4567307692307692, "grad_norm": 2.0, "learning_rate": 0.0004984872994939514, "loss": 5.6729, "mean_token_accuracy": 0.15173702389001847, "num_tokens": 10442639.0, "step": 5035 }, { "entropy": 5.709221887588501, "epoch": 0.45718432510885343, "grad_norm": 1.59375, "learning_rate": 0.0004984835515132382, "loss": 5.6662, "mean_token_accuracy": 0.1524081900715828, "num_tokens": 10453118.0, "step": 5040 }, { "entropy": 5.77504186630249, "epoch": 0.4576378809869376, "grad_norm": 2.078125, "learning_rate": 0.0004984797989108282, "loss": 5.6227, "mean_token_accuracy": 0.15486747324466704, "num_tokens": 10463717.0, "step": 5045 }, { "entropy": 5.740967559814453, "epoch": 0.4580914368650218, "grad_norm": 2.359375, "learning_rate": 0.0004984760416867991, "loss": 5.6268, "mean_token_accuracy": 0.15707418620586394, "num_tokens": 10473566.0, "step": 5050 }, { "entropy": 5.837207460403443, "epoch": 0.45854499274310595, "grad_norm": 2.03125, "learning_rate": 0.0004984722798412286, "loss": 5.875, "mean_token_accuracy": 0.14405538737773896, "num_tokens": 10485517.0, "step": 5055 }, { "entropy": 5.8029149055480955, "epoch": 0.4589985486211901, "grad_norm": 2.09375, "learning_rate": 0.0004984685133741941, "loss": 5.7576, "mean_token_accuracy": 0.14697242826223372, "num_tokens": 10495585.0, "step": 5060 }, { "entropy": 5.974255466461182, "epoch": 0.4594521044992743, "grad_norm": 1.9140625, "learning_rate": 0.000498464742285774, "loss": 5.8296, "mean_token_accuracy": 0.14219358265399934, "num_tokens": 10507307.0, "step": 5065 }, { "entropy": 5.802126026153564, "epoch": 0.45990566037735847, "grad_norm": 2.359375, "learning_rate": 0.000498460966576046, "loss": 5.6525, "mean_token_accuracy": 0.15711713284254075, "num_tokens": 10517504.0, "step": 5070 }, { "entropy": 5.719477128982544, "epoch": 0.4603592162554427, "grad_norm": 2.0, "learning_rate": 0.0004984571862450884, "loss": 5.6994, "mean_token_accuracy": 0.156757353246212, "num_tokens": 10527805.0, "step": 5075 }, { "entropy": 5.790680837631226, "epoch": 0.46081277213352684, "grad_norm": 1.859375, "learning_rate": 0.0004984534012929791, "loss": 5.6448, "mean_token_accuracy": 0.15808457583189012, "num_tokens": 10537395.0, "step": 5080 }, { "entropy": 5.806749296188355, "epoch": 0.46126632801161105, "grad_norm": 1.6484375, "learning_rate": 0.0004984496117197967, "loss": 5.661, "mean_token_accuracy": 0.15927357822656632, "num_tokens": 10547370.0, "step": 5085 }, { "entropy": 5.751757955551147, "epoch": 0.4617198838896952, "grad_norm": 2.9375, "learning_rate": 0.0004984458175256193, "loss": 5.7242, "mean_token_accuracy": 0.15044082552194596, "num_tokens": 10558616.0, "step": 5090 }, { "entropy": 5.748292541503906, "epoch": 0.4621734397677794, "grad_norm": 1.9453125, "learning_rate": 0.0004984420187105253, "loss": 5.6144, "mean_token_accuracy": 0.1535917639732361, "num_tokens": 10568021.0, "step": 5095 }, { "entropy": 5.787271165847779, "epoch": 0.46262699564586357, "grad_norm": 2.359375, "learning_rate": 0.0004984382152745936, "loss": 5.6424, "mean_token_accuracy": 0.1560645118355751, "num_tokens": 10578585.0, "step": 5100 }, { "entropy": 5.743627309799194, "epoch": 0.4630805515239477, "grad_norm": 1.65625, "learning_rate": 0.0004984344072179026, "loss": 5.7202, "mean_token_accuracy": 0.14723466336727142, "num_tokens": 10588908.0, "step": 5105 }, { "entropy": 5.8628967761993405, "epoch": 0.46353410740203194, "grad_norm": 1.7734375, "learning_rate": 0.0004984305945405312, "loss": 5.6885, "mean_token_accuracy": 0.1542614743113518, "num_tokens": 10598479.0, "step": 5110 }, { "entropy": 5.825188493728637, "epoch": 0.4639876632801161, "grad_norm": 1.671875, "learning_rate": 0.000498426777242558, "loss": 5.7072, "mean_token_accuracy": 0.14926993921399118, "num_tokens": 10609725.0, "step": 5115 }, { "entropy": 5.875491189956665, "epoch": 0.4644412191582003, "grad_norm": 2.8125, "learning_rate": 0.0004984229553240623, "loss": 5.7486, "mean_token_accuracy": 0.15380418300628662, "num_tokens": 10620634.0, "step": 5120 }, { "entropy": 5.79208197593689, "epoch": 0.46489477503628446, "grad_norm": 1.5078125, "learning_rate": 0.0004984191287851228, "loss": 5.6496, "mean_token_accuracy": 0.1518457368016243, "num_tokens": 10630626.0, "step": 5125 }, { "entropy": 5.854870986938477, "epoch": 0.46534833091436867, "grad_norm": 1.828125, "learning_rate": 0.0004984152976258188, "loss": 5.744, "mean_token_accuracy": 0.1433987408876419, "num_tokens": 10641033.0, "step": 5130 }, { "entropy": 5.773093795776367, "epoch": 0.4658018867924528, "grad_norm": 1.828125, "learning_rate": 0.0004984114618462296, "loss": 5.6728, "mean_token_accuracy": 0.157008358836174, "num_tokens": 10651333.0, "step": 5135 }, { "entropy": 5.831416845321655, "epoch": 0.46625544267053703, "grad_norm": 1.4296875, "learning_rate": 0.0004984076214464343, "loss": 5.7365, "mean_token_accuracy": 0.14905158132314683, "num_tokens": 10661752.0, "step": 5140 }, { "entropy": 5.831983804702759, "epoch": 0.4667089985486212, "grad_norm": 2.375, "learning_rate": 0.0004984037764265126, "loss": 5.7934, "mean_token_accuracy": 0.14510700330138207, "num_tokens": 10672977.0, "step": 5145 }, { "entropy": 5.871959590911866, "epoch": 0.46716255442670535, "grad_norm": 1.8828125, "learning_rate": 0.0004983999267865438, "loss": 5.699, "mean_token_accuracy": 0.1503434360027313, "num_tokens": 10683629.0, "step": 5150 }, { "entropy": 5.849706983566284, "epoch": 0.46761611030478956, "grad_norm": 1.609375, "learning_rate": 0.0004983960725266078, "loss": 5.7336, "mean_token_accuracy": 0.14961588084697724, "num_tokens": 10693566.0, "step": 5155 }, { "entropy": 5.834669923782348, "epoch": 0.4680696661828737, "grad_norm": 1.8828125, "learning_rate": 0.0004983922136467838, "loss": 5.8189, "mean_token_accuracy": 0.14934680312871934, "num_tokens": 10703437.0, "step": 5160 }, { "entropy": 5.771584939956665, "epoch": 0.4685232220609579, "grad_norm": 3.453125, "learning_rate": 0.000498388350147152, "loss": 5.6684, "mean_token_accuracy": 0.1507238656282425, "num_tokens": 10713614.0, "step": 5165 }, { "entropy": 5.778143882751465, "epoch": 0.4689767779390421, "grad_norm": 1.90625, "learning_rate": 0.0004983844820277922, "loss": 5.6655, "mean_token_accuracy": 0.15385135263204575, "num_tokens": 10723460.0, "step": 5170 }, { "entropy": 5.858981895446777, "epoch": 0.4694303338171263, "grad_norm": 1.765625, "learning_rate": 0.0004983806092887843, "loss": 5.7319, "mean_token_accuracy": 0.15325873494148254, "num_tokens": 10734656.0, "step": 5175 }, { "entropy": 5.901455020904541, "epoch": 0.46988388969521044, "grad_norm": 1.9140625, "learning_rate": 0.0004983767319302086, "loss": 5.7835, "mean_token_accuracy": 0.1446901760995388, "num_tokens": 10745699.0, "step": 5180 }, { "entropy": 5.751908636093139, "epoch": 0.47033744557329465, "grad_norm": 1.5390625, "learning_rate": 0.0004983728499521451, "loss": 5.7019, "mean_token_accuracy": 0.1527523472905159, "num_tokens": 10755837.0, "step": 5185 }, { "entropy": 5.7134605884552006, "epoch": 0.4707910014513788, "grad_norm": 2.046875, "learning_rate": 0.0004983689633546741, "loss": 5.6559, "mean_token_accuracy": 0.14864804670214654, "num_tokens": 10766538.0, "step": 5190 }, { "entropy": 5.910651826858521, "epoch": 0.47124455732946297, "grad_norm": 2.15625, "learning_rate": 0.0004983650721378761, "loss": 5.8019, "mean_token_accuracy": 0.14270213842391968, "num_tokens": 10777309.0, "step": 5195 }, { "entropy": 5.823569345474243, "epoch": 0.4716981132075472, "grad_norm": 1.6640625, "learning_rate": 0.0004983611763018314, "loss": 5.6584, "mean_token_accuracy": 0.15261757224798203, "num_tokens": 10787747.0, "step": 5200 }, { "entropy": 5.786646938323974, "epoch": 0.47215166908563133, "grad_norm": 1.6953125, "learning_rate": 0.0004983572758466208, "loss": 5.737, "mean_token_accuracy": 0.15750621408224105, "num_tokens": 10798857.0, "step": 5205 }, { "entropy": 5.828906869888305, "epoch": 0.47260522496371554, "grad_norm": 1.671875, "learning_rate": 0.0004983533707723247, "loss": 5.6847, "mean_token_accuracy": 0.15451455861330032, "num_tokens": 10808766.0, "step": 5210 }, { "entropy": 5.711640405654907, "epoch": 0.4730587808417997, "grad_norm": 1.9921875, "learning_rate": 0.0004983494610790241, "loss": 5.5887, "mean_token_accuracy": 0.15516856759786607, "num_tokens": 10819129.0, "step": 5215 }, { "entropy": 5.722329807281494, "epoch": 0.4735123367198839, "grad_norm": 1.765625, "learning_rate": 0.0004983455467667996, "loss": 5.6476, "mean_token_accuracy": 0.15732542127370835, "num_tokens": 10829952.0, "step": 5220 }, { "entropy": 5.8139319896698, "epoch": 0.47396589259796806, "grad_norm": 2.4375, "learning_rate": 0.0004983416278357322, "loss": 5.7923, "mean_token_accuracy": 0.14603560641407967, "num_tokens": 10841163.0, "step": 5225 }, { "entropy": 5.918250179290771, "epoch": 0.4744194484760523, "grad_norm": 1.78125, "learning_rate": 0.0004983377042859032, "loss": 5.7629, "mean_token_accuracy": 0.14654296189546584, "num_tokens": 10853047.0, "step": 5230 }, { "entropy": 5.793363475799561, "epoch": 0.47487300435413643, "grad_norm": 2.734375, "learning_rate": 0.0004983337761173936, "loss": 5.6738, "mean_token_accuracy": 0.14845061898231507, "num_tokens": 10863040.0, "step": 5235 }, { "entropy": 5.739855766296387, "epoch": 0.4753265602322206, "grad_norm": 1.3671875, "learning_rate": 0.0004983298433302843, "loss": 5.6765, "mean_token_accuracy": 0.1506304681301117, "num_tokens": 10872710.0, "step": 5240 }, { "entropy": 5.826231050491333, "epoch": 0.4757801161103048, "grad_norm": 1.859375, "learning_rate": 0.0004983259059246572, "loss": 5.752, "mean_token_accuracy": 0.14818743392825126, "num_tokens": 10883438.0, "step": 5245 }, { "entropy": 5.831701707839966, "epoch": 0.47623367198838895, "grad_norm": 1.9765625, "learning_rate": 0.0004983219639005934, "loss": 5.6501, "mean_token_accuracy": 0.15101292133331298, "num_tokens": 10892987.0, "step": 5250 }, { "entropy": 5.759233617782593, "epoch": 0.47668722786647316, "grad_norm": 2.3125, "learning_rate": 0.0004983180172581745, "loss": 5.6962, "mean_token_accuracy": 0.1499043494462967, "num_tokens": 10903118.0, "step": 5255 }, { "entropy": 5.76815357208252, "epoch": 0.4771407837445573, "grad_norm": 1.5234375, "learning_rate": 0.0004983140659974819, "loss": 5.6355, "mean_token_accuracy": 0.1572742462158203, "num_tokens": 10913084.0, "step": 5260 }, { "entropy": 5.782183504104614, "epoch": 0.47759433962264153, "grad_norm": 2.4375, "learning_rate": 0.0004983101101185977, "loss": 5.6249, "mean_token_accuracy": 0.16095837205648422, "num_tokens": 10923002.0, "step": 5265 }, { "entropy": 5.79695348739624, "epoch": 0.4780478955007257, "grad_norm": 1.921875, "learning_rate": 0.0004983061496216035, "loss": 5.7592, "mean_token_accuracy": 0.1515378013253212, "num_tokens": 10933902.0, "step": 5270 }, { "entropy": 5.914425182342529, "epoch": 0.4785014513788099, "grad_norm": 1.953125, "learning_rate": 0.0004983021845065812, "loss": 5.7215, "mean_token_accuracy": 0.1509646564722061, "num_tokens": 10944665.0, "step": 5275 }, { "entropy": 5.848713016510009, "epoch": 0.47895500725689405, "grad_norm": 2.484375, "learning_rate": 0.0004982982147736128, "loss": 5.7333, "mean_token_accuracy": 0.1508101060986519, "num_tokens": 10955104.0, "step": 5280 }, { "entropy": 5.783365154266358, "epoch": 0.4794085631349782, "grad_norm": 2.15625, "learning_rate": 0.0004982942404227805, "loss": 5.7647, "mean_token_accuracy": 0.1501639798283577, "num_tokens": 10966074.0, "step": 5285 }, { "entropy": 5.793298768997192, "epoch": 0.4798621190130624, "grad_norm": 2.171875, "learning_rate": 0.0004982902614541662, "loss": 5.6624, "mean_token_accuracy": 0.1498418629169464, "num_tokens": 10975943.0, "step": 5290 }, { "entropy": 5.807666254043579, "epoch": 0.48031567489114657, "grad_norm": 1.8515625, "learning_rate": 0.0004982862778678526, "loss": 5.7099, "mean_token_accuracy": 0.15479816794395446, "num_tokens": 10985567.0, "step": 5295 }, { "entropy": 5.70306134223938, "epoch": 0.4807692307692308, "grad_norm": 1.9765625, "learning_rate": 0.0004982822896639218, "loss": 5.602, "mean_token_accuracy": 0.15984350740909575, "num_tokens": 10995155.0, "step": 5300 }, { "entropy": 5.81755895614624, "epoch": 0.48122278664731494, "grad_norm": 2.125, "learning_rate": 0.0004982782968424563, "loss": 5.6949, "mean_token_accuracy": 0.1501569300889969, "num_tokens": 11006608.0, "step": 5305 }, { "entropy": 5.852555847167968, "epoch": 0.48167634252539915, "grad_norm": 1.9140625, "learning_rate": 0.0004982742994035388, "loss": 5.7532, "mean_token_accuracy": 0.14663399159908294, "num_tokens": 11016753.0, "step": 5310 }, { "entropy": 5.839328002929688, "epoch": 0.4821298984034833, "grad_norm": 2.078125, "learning_rate": 0.0004982702973472518, "loss": 5.7281, "mean_token_accuracy": 0.1561571702361107, "num_tokens": 11027234.0, "step": 5315 }, { "entropy": 5.783762979507446, "epoch": 0.4825834542815675, "grad_norm": 2.34375, "learning_rate": 0.0004982662906736783, "loss": 5.7026, "mean_token_accuracy": 0.15801250636577607, "num_tokens": 11036885.0, "step": 5320 }, { "entropy": 5.827364730834961, "epoch": 0.48303701015965167, "grad_norm": 1.875, "learning_rate": 0.0004982622793829009, "loss": 5.7481, "mean_token_accuracy": 0.14987791031599046, "num_tokens": 11047417.0, "step": 5325 }, { "entropy": 5.820127344131469, "epoch": 0.4834905660377358, "grad_norm": 1.640625, "learning_rate": 0.0004982582634750027, "loss": 5.6639, "mean_token_accuracy": 0.14887322336435319, "num_tokens": 11057728.0, "step": 5330 }, { "entropy": 5.787255716323853, "epoch": 0.48394412191582004, "grad_norm": 1.8359375, "learning_rate": 0.0004982542429500667, "loss": 5.7213, "mean_token_accuracy": 0.14780182540416717, "num_tokens": 11067201.0, "step": 5335 }, { "entropy": 5.820434999465943, "epoch": 0.4843976777939042, "grad_norm": 2.015625, "learning_rate": 0.0004982502178081761, "loss": 5.758, "mean_token_accuracy": 0.1484843149781227, "num_tokens": 11077714.0, "step": 5340 }, { "entropy": 5.861207103729248, "epoch": 0.4848512336719884, "grad_norm": 1.8828125, "learning_rate": 0.0004982461880494141, "loss": 5.7045, "mean_token_accuracy": 0.15382479578256608, "num_tokens": 11087790.0, "step": 5345 }, { "entropy": 5.871987390518188, "epoch": 0.48530478955007256, "grad_norm": 2.65625, "learning_rate": 0.000498242153673864, "loss": 5.7951, "mean_token_accuracy": 0.14940507858991622, "num_tokens": 11098351.0, "step": 5350 }, { "entropy": 5.882188415527343, "epoch": 0.48575834542815677, "grad_norm": 1.796875, "learning_rate": 0.0004982381146816094, "loss": 5.7614, "mean_token_accuracy": 0.14735559076070787, "num_tokens": 11108648.0, "step": 5355 }, { "entropy": 5.844276762008667, "epoch": 0.4862119013062409, "grad_norm": 3.921875, "learning_rate": 0.0004982340710727336, "loss": 5.7012, "mean_token_accuracy": 0.15624714493751526, "num_tokens": 11119035.0, "step": 5360 }, { "entropy": 5.82732195854187, "epoch": 0.48666545718432513, "grad_norm": 2.078125, "learning_rate": 0.0004982300228473203, "loss": 5.7015, "mean_token_accuracy": 0.15547741055488587, "num_tokens": 11129468.0, "step": 5365 }, { "entropy": 5.746838140487671, "epoch": 0.4871190130624093, "grad_norm": 1.7734375, "learning_rate": 0.0004982259700054533, "loss": 5.7228, "mean_token_accuracy": 0.1501197710633278, "num_tokens": 11139828.0, "step": 5370 }, { "entropy": 5.755753469467163, "epoch": 0.48757256894049344, "grad_norm": 3.296875, "learning_rate": 0.0004982219125472163, "loss": 5.6705, "mean_token_accuracy": 0.1561184525489807, "num_tokens": 11150427.0, "step": 5375 }, { "entropy": 5.759000968933106, "epoch": 0.48802612481857766, "grad_norm": 2.9375, "learning_rate": 0.0004982178504726933, "loss": 5.6587, "mean_token_accuracy": 0.1554884731769562, "num_tokens": 11161358.0, "step": 5380 }, { "entropy": 5.807296991348267, "epoch": 0.4884796806966618, "grad_norm": 2.203125, "learning_rate": 0.0004982137837819682, "loss": 5.7884, "mean_token_accuracy": 0.1499861791729927, "num_tokens": 11171929.0, "step": 5385 }, { "entropy": 5.8052185535430905, "epoch": 0.488933236574746, "grad_norm": 1.828125, "learning_rate": 0.0004982097124751252, "loss": 5.7325, "mean_token_accuracy": 0.1465311512351036, "num_tokens": 11182262.0, "step": 5390 }, { "entropy": 5.811205768585205, "epoch": 0.4893867924528302, "grad_norm": 2.125, "learning_rate": 0.0004982056365522486, "loss": 5.6256, "mean_token_accuracy": 0.1551127627491951, "num_tokens": 11192722.0, "step": 5395 }, { "entropy": 5.805147171020508, "epoch": 0.4898403483309144, "grad_norm": 1.640625, "learning_rate": 0.0004982015560134225, "loss": 5.7015, "mean_token_accuracy": 0.14520970433950425, "num_tokens": 11202951.0, "step": 5400 }, { "entropy": 5.767069959640503, "epoch": 0.49029390420899854, "grad_norm": 2.328125, "learning_rate": 0.0004981974708587312, "loss": 5.6291, "mean_token_accuracy": 0.15299493372440337, "num_tokens": 11212018.0, "step": 5405 }, { "entropy": 5.786797094345093, "epoch": 0.49074746008708275, "grad_norm": 1.875, "learning_rate": 0.0004981933810882594, "loss": 5.7443, "mean_token_accuracy": 0.14947062432765962, "num_tokens": 11222034.0, "step": 5410 }, { "entropy": 5.8002769470214846, "epoch": 0.4912010159651669, "grad_norm": 1.8046875, "learning_rate": 0.0004981892867020917, "loss": 5.6749, "mean_token_accuracy": 0.15354969650506972, "num_tokens": 11232105.0, "step": 5415 }, { "entropy": 5.893782138824463, "epoch": 0.49165457184325106, "grad_norm": 2.03125, "learning_rate": 0.0004981851877003125, "loss": 5.808, "mean_token_accuracy": 0.14583044201135636, "num_tokens": 11241452.0, "step": 5420 }, { "entropy": 5.8148712635040285, "epoch": 0.4921081277213353, "grad_norm": 2.671875, "learning_rate": 0.0004981810840830068, "loss": 5.6554, "mean_token_accuracy": 0.1535477250814438, "num_tokens": 11252172.0, "step": 5425 }, { "entropy": 5.768006420135498, "epoch": 0.49256168359941943, "grad_norm": 1.78125, "learning_rate": 0.0004981769758502596, "loss": 5.6176, "mean_token_accuracy": 0.1569655179977417, "num_tokens": 11261660.0, "step": 5430 }, { "entropy": 5.723521661758423, "epoch": 0.49301523947750364, "grad_norm": 1.859375, "learning_rate": 0.0004981728630021555, "loss": 5.683, "mean_token_accuracy": 0.15691534727811812, "num_tokens": 11271423.0, "step": 5435 }, { "entropy": 5.833865833282471, "epoch": 0.4934687953555878, "grad_norm": 2.328125, "learning_rate": 0.0004981687455387797, "loss": 5.6859, "mean_token_accuracy": 0.1534940168261528, "num_tokens": 11282596.0, "step": 5440 }, { "entropy": 5.789115333557129, "epoch": 0.493922351233672, "grad_norm": 1.875, "learning_rate": 0.0004981646234602173, "loss": 5.657, "mean_token_accuracy": 0.1574923425912857, "num_tokens": 11292489.0, "step": 5445 }, { "entropy": 5.828164672851562, "epoch": 0.49437590711175616, "grad_norm": 1.5546875, "learning_rate": 0.0004981604967665539, "loss": 5.7223, "mean_token_accuracy": 0.15355284214019777, "num_tokens": 11303847.0, "step": 5450 }, { "entropy": 5.722614383697509, "epoch": 0.4948294629898404, "grad_norm": 1.6015625, "learning_rate": 0.0004981563654578743, "loss": 5.6588, "mean_token_accuracy": 0.15813755989074707, "num_tokens": 11313945.0, "step": 5455 }, { "entropy": 5.811623859405517, "epoch": 0.49528301886792453, "grad_norm": 2.1875, "learning_rate": 0.0004981522295342643, "loss": 5.6877, "mean_token_accuracy": 0.15314490497112274, "num_tokens": 11323152.0, "step": 5460 }, { "entropy": 5.818774223327637, "epoch": 0.4957365747460087, "grad_norm": 1.953125, "learning_rate": 0.0004981480889958092, "loss": 5.7324, "mean_token_accuracy": 0.15346988290548325, "num_tokens": 11334961.0, "step": 5465 }, { "entropy": 5.823841524124146, "epoch": 0.4961901306240929, "grad_norm": 2.359375, "learning_rate": 0.0004981439438425949, "loss": 5.7, "mean_token_accuracy": 0.1509547233581543, "num_tokens": 11346172.0, "step": 5470 }, { "entropy": 5.844482898712158, "epoch": 0.49664368650217705, "grad_norm": 1.921875, "learning_rate": 0.000498139794074707, "loss": 5.7412, "mean_token_accuracy": 0.15192751735448837, "num_tokens": 11356439.0, "step": 5475 }, { "entropy": 5.779028701782226, "epoch": 0.49709724238026126, "grad_norm": 4.21875, "learning_rate": 0.0004981356396922313, "loss": 5.7457, "mean_token_accuracy": 0.1459797888994217, "num_tokens": 11368230.0, "step": 5480 }, { "entropy": 5.776658916473389, "epoch": 0.4975507982583454, "grad_norm": 2.5, "learning_rate": 0.0004981314806952535, "loss": 5.7504, "mean_token_accuracy": 0.1563531845808029, "num_tokens": 11377613.0, "step": 5485 }, { "entropy": 5.844314098358154, "epoch": 0.49800435413642963, "grad_norm": 1.9609375, "learning_rate": 0.00049812731708386, "loss": 5.6825, "mean_token_accuracy": 0.15813061594963074, "num_tokens": 11387898.0, "step": 5490 }, { "entropy": 5.868491315841675, "epoch": 0.4984579100145138, "grad_norm": 1.9921875, "learning_rate": 0.0004981231488581367, "loss": 5.7704, "mean_token_accuracy": 0.1497861698269844, "num_tokens": 11397725.0, "step": 5495 }, { "entropy": 5.815413761138916, "epoch": 0.498911465892598, "grad_norm": 2.46875, "learning_rate": 0.0004981189760181699, "loss": 5.6501, "mean_token_accuracy": 0.15616128146648406, "num_tokens": 11407193.0, "step": 5500 }, { "entropy": 5.773203563690186, "epoch": 0.49936502177068215, "grad_norm": 2.140625, "learning_rate": 0.0004981147985640456, "loss": 5.6549, "mean_token_accuracy": 0.151999793946743, "num_tokens": 11417133.0, "step": 5505 }, { "entropy": 5.732791996002197, "epoch": 0.4998185776487663, "grad_norm": 1.890625, "learning_rate": 0.0004981106164958506, "loss": 5.5816, "mean_token_accuracy": 0.16263532042503356, "num_tokens": 11428194.0, "step": 5510 }, { "entropy": 5.748931980133056, "epoch": 0.5002721335268505, "grad_norm": 2.828125, "learning_rate": 0.0004981064298136712, "loss": 5.6426, "mean_token_accuracy": 0.15091810673475264, "num_tokens": 11438026.0, "step": 5515 }, { "entropy": 5.770444059371949, "epoch": 0.5007256894049347, "grad_norm": 2.46875, "learning_rate": 0.0004981022385175939, "loss": 5.7004, "mean_token_accuracy": 0.15599464625120163, "num_tokens": 11447455.0, "step": 5520 }, { "entropy": 5.82069878578186, "epoch": 0.5011792452830188, "grad_norm": 2.28125, "learning_rate": 0.0004980980426077054, "loss": 5.6978, "mean_token_accuracy": 0.15249895304441452, "num_tokens": 11458331.0, "step": 5525 }, { "entropy": 5.813779544830322, "epoch": 0.5016328011611031, "grad_norm": 1.9296875, "learning_rate": 0.0004980938420840926, "loss": 5.654, "mean_token_accuracy": 0.14837791472673417, "num_tokens": 11468182.0, "step": 5530 }, { "entropy": 5.819776010513306, "epoch": 0.5020863570391872, "grad_norm": 1.7109375, "learning_rate": 0.0004980896369468423, "loss": 5.6735, "mean_token_accuracy": 0.15344102680683136, "num_tokens": 11478727.0, "step": 5535 }, { "entropy": 5.769030523300171, "epoch": 0.5025399129172714, "grad_norm": 1.6171875, "learning_rate": 0.0004980854271960415, "loss": 5.6935, "mean_token_accuracy": 0.1578574597835541, "num_tokens": 11489085.0, "step": 5540 }, { "entropy": 5.785058164596558, "epoch": 0.5029934687953556, "grad_norm": 1.8359375, "learning_rate": 0.0004980812128317772, "loss": 5.7823, "mean_token_accuracy": 0.14549713134765624, "num_tokens": 11500354.0, "step": 5545 }, { "entropy": 5.875575017929077, "epoch": 0.5034470246734397, "grad_norm": 2.21875, "learning_rate": 0.0004980769938541364, "loss": 5.6758, "mean_token_accuracy": 0.15565661191940308, "num_tokens": 11511272.0, "step": 5550 }, { "entropy": 5.820347309112549, "epoch": 0.503900580551524, "grad_norm": 2.15625, "learning_rate": 0.0004980727702632066, "loss": 5.7794, "mean_token_accuracy": 0.14426911622285843, "num_tokens": 11521133.0, "step": 5555 }, { "entropy": 5.776409053802491, "epoch": 0.5043541364296081, "grad_norm": 1.9453125, "learning_rate": 0.0004980685420590752, "loss": 5.6803, "mean_token_accuracy": 0.15292732566595077, "num_tokens": 11531797.0, "step": 5560 }, { "entropy": 5.740556383132935, "epoch": 0.5048076923076923, "grad_norm": 1.671875, "learning_rate": 0.0004980643092418294, "loss": 5.6319, "mean_token_accuracy": 0.15992224663496019, "num_tokens": 11540655.0, "step": 5565 }, { "entropy": 5.7666182041168215, "epoch": 0.5052612481857764, "grad_norm": 1.4609375, "learning_rate": 0.0004980600718115568, "loss": 5.6364, "mean_token_accuracy": 0.1610444650053978, "num_tokens": 11550697.0, "step": 5570 }, { "entropy": 5.862971830368042, "epoch": 0.5057148040638607, "grad_norm": 1.4921875, "learning_rate": 0.0004980558297683452, "loss": 5.6558, "mean_token_accuracy": 0.15864361375570296, "num_tokens": 11560643.0, "step": 5575 }, { "entropy": 5.893351984024048, "epoch": 0.5061683599419449, "grad_norm": 1.7109375, "learning_rate": 0.0004980515831122822, "loss": 5.7904, "mean_token_accuracy": 0.1495205745100975, "num_tokens": 11571823.0, "step": 5580 }, { "entropy": 5.69124813079834, "epoch": 0.506621915820029, "grad_norm": 2.703125, "learning_rate": 0.0004980473318434555, "loss": 5.5679, "mean_token_accuracy": 0.15229919999837876, "num_tokens": 11581342.0, "step": 5585 }, { "entropy": 5.670686101913452, "epoch": 0.5070754716981132, "grad_norm": 1.78125, "learning_rate": 0.0004980430759619532, "loss": 5.6289, "mean_token_accuracy": 0.15128677636384963, "num_tokens": 11591683.0, "step": 5590 }, { "entropy": 5.732837772369384, "epoch": 0.5075290275761973, "grad_norm": 1.890625, "learning_rate": 0.0004980388154678633, "loss": 5.6162, "mean_token_accuracy": 0.15577002465724946, "num_tokens": 11602416.0, "step": 5595 }, { "entropy": 5.8033887386322025, "epoch": 0.5079825834542816, "grad_norm": 1.9609375, "learning_rate": 0.0004980345503612738, "loss": 5.6906, "mean_token_accuracy": 0.151105298101902, "num_tokens": 11612686.0, "step": 5600 }, { "entropy": 5.788366889953613, "epoch": 0.5084361393323658, "grad_norm": 1.78125, "learning_rate": 0.0004980302806422729, "loss": 5.6929, "mean_token_accuracy": 0.15298312157392502, "num_tokens": 11621501.0, "step": 5605 }, { "entropy": 5.7911474227905275, "epoch": 0.5088896952104499, "grad_norm": 1.6796875, "learning_rate": 0.0004980260063109491, "loss": 5.6866, "mean_token_accuracy": 0.15597617030143737, "num_tokens": 11631562.0, "step": 5610 }, { "entropy": 5.780478191375733, "epoch": 0.5093432510885341, "grad_norm": 1.6875, "learning_rate": 0.0004980217273673906, "loss": 5.6583, "mean_token_accuracy": 0.15059893652796746, "num_tokens": 11641564.0, "step": 5615 }, { "entropy": 5.807359504699707, "epoch": 0.5097968069666183, "grad_norm": 1.78125, "learning_rate": 0.0004980174438116859, "loss": 5.7122, "mean_token_accuracy": 0.15435375571250914, "num_tokens": 11651392.0, "step": 5620 }, { "entropy": 5.830365610122681, "epoch": 0.5102503628447025, "grad_norm": 1.6015625, "learning_rate": 0.0004980131556439236, "loss": 5.7075, "mean_token_accuracy": 0.1523994840681553, "num_tokens": 11661101.0, "step": 5625 }, { "entropy": 5.8104228496551515, "epoch": 0.5107039187227866, "grad_norm": 1.609375, "learning_rate": 0.0004980088628641925, "loss": 5.6505, "mean_token_accuracy": 0.15648772418498993, "num_tokens": 11671812.0, "step": 5630 }, { "entropy": 5.764213562011719, "epoch": 0.5111574746008708, "grad_norm": 1.9765625, "learning_rate": 0.0004980045654725812, "loss": 5.5614, "mean_token_accuracy": 0.16013796925544738, "num_tokens": 11681549.0, "step": 5635 }, { "entropy": 5.734517049789429, "epoch": 0.511611030478955, "grad_norm": 1.5234375, "learning_rate": 0.0004980002634691787, "loss": 5.6323, "mean_token_accuracy": 0.15375378280878066, "num_tokens": 11692070.0, "step": 5640 }, { "entropy": 5.672871732711792, "epoch": 0.5120645863570392, "grad_norm": 2.1875, "learning_rate": 0.000497995956854074, "loss": 5.6884, "mean_token_accuracy": 0.15432974994182586, "num_tokens": 11702826.0, "step": 5645 }, { "entropy": 5.854795503616333, "epoch": 0.5125181422351234, "grad_norm": 1.734375, "learning_rate": 0.0004979916456273561, "loss": 5.8033, "mean_token_accuracy": 0.1496042028069496, "num_tokens": 11714368.0, "step": 5650 }, { "entropy": 5.9430516242980955, "epoch": 0.5129716981132075, "grad_norm": 1.5859375, "learning_rate": 0.0004979873297891141, "loss": 5.7142, "mean_token_accuracy": 0.1523452430963516, "num_tokens": 11724986.0, "step": 5655 }, { "entropy": 5.782175970077515, "epoch": 0.5134252539912917, "grad_norm": 4.1875, "learning_rate": 0.0004979830093394372, "loss": 5.6649, "mean_token_accuracy": 0.15547989010810853, "num_tokens": 11735056.0, "step": 5660 }, { "entropy": 5.754619359970093, "epoch": 0.513878809869376, "grad_norm": 1.9921875, "learning_rate": 0.0004979786842784149, "loss": 5.7305, "mean_token_accuracy": 0.1475801281630993, "num_tokens": 11746511.0, "step": 5665 }, { "entropy": 5.684448289871216, "epoch": 0.5143323657474601, "grad_norm": 2.046875, "learning_rate": 0.0004979743546061366, "loss": 5.6343, "mean_token_accuracy": 0.15331252962350844, "num_tokens": 11755892.0, "step": 5670 }, { "entropy": 5.8178552150726315, "epoch": 0.5147859216255443, "grad_norm": 1.671875, "learning_rate": 0.0004979700203226918, "loss": 5.7322, "mean_token_accuracy": 0.14956021532416344, "num_tokens": 11766452.0, "step": 5675 }, { "entropy": 5.790278959274292, "epoch": 0.5152394775036284, "grad_norm": 3.015625, "learning_rate": 0.0004979656814281702, "loss": 5.6442, "mean_token_accuracy": 0.15524719655513763, "num_tokens": 11776138.0, "step": 5680 }, { "entropy": 5.867595958709717, "epoch": 0.5156930333817126, "grad_norm": 1.5, "learning_rate": 0.0004979613379226615, "loss": 5.7289, "mean_token_accuracy": 0.15170384347438812, "num_tokens": 11786174.0, "step": 5685 }, { "entropy": 5.753278112411499, "epoch": 0.5161465892597968, "grad_norm": 1.9453125, "learning_rate": 0.0004979569898062554, "loss": 5.6281, "mean_token_accuracy": 0.1571716770529747, "num_tokens": 11796202.0, "step": 5690 }, { "entropy": 5.772783041000366, "epoch": 0.516600145137881, "grad_norm": 1.796875, "learning_rate": 0.000497952637079042, "loss": 5.5941, "mean_token_accuracy": 0.1638539105653763, "num_tokens": 11806020.0, "step": 5695 }, { "entropy": 5.734279537200928, "epoch": 0.5170537010159652, "grad_norm": 2.09375, "learning_rate": 0.0004979482797411114, "loss": 5.6517, "mean_token_accuracy": 0.15160437747836114, "num_tokens": 11815802.0, "step": 5700 }, { "entropy": 5.728960037231445, "epoch": 0.5175072568940493, "grad_norm": 1.609375, "learning_rate": 0.0004979439177925534, "loss": 5.6584, "mean_token_accuracy": 0.15317385345697404, "num_tokens": 11827391.0, "step": 5705 }, { "entropy": 5.708126592636108, "epoch": 0.5179608127721336, "grad_norm": 2.265625, "learning_rate": 0.0004979395512334584, "loss": 5.5692, "mean_token_accuracy": 0.1625960573554039, "num_tokens": 11837229.0, "step": 5710 }, { "entropy": 5.7941161632537845, "epoch": 0.5184143686502177, "grad_norm": 2.015625, "learning_rate": 0.0004979351800639166, "loss": 5.734, "mean_token_accuracy": 0.15362083166837692, "num_tokens": 11847622.0, "step": 5715 }, { "entropy": 5.8385223865509035, "epoch": 0.5188679245283019, "grad_norm": 1.6953125, "learning_rate": 0.0004979308042840186, "loss": 5.7124, "mean_token_accuracy": 0.15736438930034638, "num_tokens": 11858013.0, "step": 5720 }, { "entropy": 5.809688663482666, "epoch": 0.519321480406386, "grad_norm": 2.453125, "learning_rate": 0.0004979264238938547, "loss": 5.6807, "mean_token_accuracy": 0.15295029133558274, "num_tokens": 11866763.0, "step": 5725 }, { "entropy": 5.701699304580688, "epoch": 0.5197750362844702, "grad_norm": 2.21875, "learning_rate": 0.0004979220388935155, "loss": 5.6291, "mean_token_accuracy": 0.15494942665100098, "num_tokens": 11877731.0, "step": 5730 }, { "entropy": 5.830405569076538, "epoch": 0.5202285921625545, "grad_norm": 2.140625, "learning_rate": 0.0004979176492830918, "loss": 5.6566, "mean_token_accuracy": 0.1564646691083908, "num_tokens": 11887698.0, "step": 5735 }, { "entropy": 5.837483501434326, "epoch": 0.5206821480406386, "grad_norm": 2.265625, "learning_rate": 0.0004979132550626742, "loss": 5.7678, "mean_token_accuracy": 0.15171240121126175, "num_tokens": 11898559.0, "step": 5740 }, { "entropy": 5.760894012451172, "epoch": 0.5211357039187228, "grad_norm": 1.8046875, "learning_rate": 0.0004979088562323538, "loss": 5.6517, "mean_token_accuracy": 0.1545734629034996, "num_tokens": 11908547.0, "step": 5745 }, { "entropy": 5.849686622619629, "epoch": 0.5215892597968069, "grad_norm": 1.8671875, "learning_rate": 0.0004979044527922214, "loss": 5.691, "mean_token_accuracy": 0.16176672726869584, "num_tokens": 11918447.0, "step": 5750 }, { "entropy": 5.835568428039551, "epoch": 0.5220428156748912, "grad_norm": 2.0625, "learning_rate": 0.0004979000447423681, "loss": 5.718, "mean_token_accuracy": 0.15124733746051788, "num_tokens": 11929439.0, "step": 5755 }, { "entropy": 5.731830263137818, "epoch": 0.5224963715529753, "grad_norm": 2.609375, "learning_rate": 0.0004978956320828851, "loss": 5.6411, "mean_token_accuracy": 0.15208978950977325, "num_tokens": 11940693.0, "step": 5760 }, { "entropy": 5.763946151733398, "epoch": 0.5229499274310595, "grad_norm": 3.0, "learning_rate": 0.0004978912148138637, "loss": 5.597, "mean_token_accuracy": 0.15466375052928924, "num_tokens": 11949934.0, "step": 5765 }, { "entropy": 5.754511499404908, "epoch": 0.5234034833091437, "grad_norm": 2.046875, "learning_rate": 0.000497886792935395, "loss": 5.7148, "mean_token_accuracy": 0.15965479016304016, "num_tokens": 11960245.0, "step": 5770 }, { "entropy": 5.835350847244262, "epoch": 0.5238570391872278, "grad_norm": 2.3125, "learning_rate": 0.0004978823664475707, "loss": 5.6011, "mean_token_accuracy": 0.1534401074051857, "num_tokens": 11970364.0, "step": 5775 }, { "entropy": 5.846774005889893, "epoch": 0.5243105950653121, "grad_norm": 1.7890625, "learning_rate": 0.0004978779353504824, "loss": 5.7091, "mean_token_accuracy": 0.14929343163967132, "num_tokens": 11981073.0, "step": 5780 }, { "entropy": 5.7207191467285154, "epoch": 0.5247641509433962, "grad_norm": 2.390625, "learning_rate": 0.0004978734996442214, "loss": 5.6885, "mean_token_accuracy": 0.14204260632395743, "num_tokens": 11991420.0, "step": 5785 }, { "entropy": 5.767483806610107, "epoch": 0.5252177068214804, "grad_norm": 1.8359375, "learning_rate": 0.0004978690593288798, "loss": 5.7101, "mean_token_accuracy": 0.14270815402269363, "num_tokens": 12002325.0, "step": 5790 }, { "entropy": 5.838377571105957, "epoch": 0.5256712626995645, "grad_norm": 2.1875, "learning_rate": 0.0004978646144045491, "loss": 5.6622, "mean_token_accuracy": 0.15048326328396797, "num_tokens": 12013027.0, "step": 5795 }, { "entropy": 5.8212944030761715, "epoch": 0.5261248185776488, "grad_norm": 2.4375, "learning_rate": 0.0004978601648713215, "loss": 5.6707, "mean_token_accuracy": 0.15283343344926834, "num_tokens": 12023821.0, "step": 5800 }, { "entropy": 5.801069211959839, "epoch": 0.526578374455733, "grad_norm": 2.1875, "learning_rate": 0.0004978557107292889, "loss": 5.6653, "mean_token_accuracy": 0.15791814774274826, "num_tokens": 12034315.0, "step": 5805 }, { "entropy": 5.732563400268555, "epoch": 0.5270319303338171, "grad_norm": 2.25, "learning_rate": 0.0004978512519785433, "loss": 5.646, "mean_token_accuracy": 0.1561321035027504, "num_tokens": 12045172.0, "step": 5810 }, { "entropy": 5.74445161819458, "epoch": 0.5274854862119013, "grad_norm": 3.703125, "learning_rate": 0.000497846788619177, "loss": 5.6418, "mean_token_accuracy": 0.1543836459517479, "num_tokens": 12055809.0, "step": 5815 }, { "entropy": 5.775337076187133, "epoch": 0.5279390420899854, "grad_norm": 2.390625, "learning_rate": 0.0004978423206512825, "loss": 5.6212, "mean_token_accuracy": 0.1571818545460701, "num_tokens": 12065649.0, "step": 5820 }, { "entropy": 5.770995473861694, "epoch": 0.5283925979680697, "grad_norm": 2.546875, "learning_rate": 0.000497837848074952, "loss": 5.7297, "mean_token_accuracy": 0.14517660439014435, "num_tokens": 12076600.0, "step": 5825 }, { "entropy": 5.794981956481934, "epoch": 0.5288461538461539, "grad_norm": 1.640625, "learning_rate": 0.000497833370890278, "loss": 5.7276, "mean_token_accuracy": 0.1495457574725151, "num_tokens": 12087991.0, "step": 5830 }, { "entropy": 5.7484033584594725, "epoch": 0.529299709724238, "grad_norm": 1.953125, "learning_rate": 0.0004978288890973529, "loss": 5.5982, "mean_token_accuracy": 0.15729666352272034, "num_tokens": 12097737.0, "step": 5835 }, { "entropy": 5.734858179092408, "epoch": 0.5297532656023222, "grad_norm": 2.0, "learning_rate": 0.0004978244026962698, "loss": 5.5958, "mean_token_accuracy": 0.1559059202671051, "num_tokens": 12108088.0, "step": 5840 }, { "entropy": 5.824561834335327, "epoch": 0.5302068214804064, "grad_norm": 2.578125, "learning_rate": 0.0004978199116871212, "loss": 5.7516, "mean_token_accuracy": 0.14970595389604568, "num_tokens": 12118633.0, "step": 5845 }, { "entropy": 5.833733129501343, "epoch": 0.5306603773584906, "grad_norm": 2.34375, "learning_rate": 0.00049781541607, "loss": 5.7448, "mean_token_accuracy": 0.15598972886800766, "num_tokens": 12129293.0, "step": 5850 }, { "entropy": 5.885995531082154, "epoch": 0.5311139332365747, "grad_norm": 1.9765625, "learning_rate": 0.0004978109158449993, "loss": 5.6941, "mean_token_accuracy": 0.15428496152162552, "num_tokens": 12140003.0, "step": 5855 }, { "entropy": 5.804030895233154, "epoch": 0.5315674891146589, "grad_norm": 1.921875, "learning_rate": 0.0004978064110122121, "loss": 5.74, "mean_token_accuracy": 0.1436428152024746, "num_tokens": 12151367.0, "step": 5860 }, { "entropy": 5.767576074600219, "epoch": 0.532021044992743, "grad_norm": 2.109375, "learning_rate": 0.0004978019015717314, "loss": 5.6862, "mean_token_accuracy": 0.14855829924345015, "num_tokens": 12162161.0, "step": 5865 }, { "entropy": 5.821201229095459, "epoch": 0.5324746008708273, "grad_norm": 2.0625, "learning_rate": 0.0004977973875236508, "loss": 5.6878, "mean_token_accuracy": 0.15125086307525634, "num_tokens": 12172297.0, "step": 5870 }, { "entropy": 5.777795076370239, "epoch": 0.5329281567489115, "grad_norm": 2.078125, "learning_rate": 0.0004977928688680634, "loss": 5.6422, "mean_token_accuracy": 0.15870457887649536, "num_tokens": 12182204.0, "step": 5875 }, { "entropy": 5.736477279663086, "epoch": 0.5333817126269956, "grad_norm": 2.09375, "learning_rate": 0.0004977883456050626, "loss": 5.6563, "mean_token_accuracy": 0.15875795036554335, "num_tokens": 12192448.0, "step": 5880 }, { "entropy": 5.804166078567505, "epoch": 0.5338352685050798, "grad_norm": 2.171875, "learning_rate": 0.000497783817734742, "loss": 5.664, "mean_token_accuracy": 0.15547409802675247, "num_tokens": 12202827.0, "step": 5885 }, { "entropy": 5.754812479019165, "epoch": 0.534288824383164, "grad_norm": 2.234375, "learning_rate": 0.0004977792852571954, "loss": 5.6518, "mean_token_accuracy": 0.159761381149292, "num_tokens": 12213313.0, "step": 5890 }, { "entropy": 5.819279527664184, "epoch": 0.5347423802612482, "grad_norm": 2.09375, "learning_rate": 0.0004977747481725164, "loss": 5.6568, "mean_token_accuracy": 0.15718502700328826, "num_tokens": 12223558.0, "step": 5895 }, { "entropy": 5.9023620128631595, "epoch": 0.5351959361393324, "grad_norm": 2.53125, "learning_rate": 0.0004977702064807987, "loss": 5.7099, "mean_token_accuracy": 0.15210497453808786, "num_tokens": 12235367.0, "step": 5900 }, { "entropy": 5.8268383026123045, "epoch": 0.5356494920174165, "grad_norm": 1.78125, "learning_rate": 0.0004977656601821366, "loss": 5.6465, "mean_token_accuracy": 0.15551152527332307, "num_tokens": 12245690.0, "step": 5905 }, { "entropy": 5.702606582641602, "epoch": 0.5361030478955007, "grad_norm": 1.703125, "learning_rate": 0.0004977611092766238, "loss": 5.5843, "mean_token_accuracy": 0.15972213745117186, "num_tokens": 12256773.0, "step": 5910 }, { "entropy": 5.649114608764648, "epoch": 0.5365566037735849, "grad_norm": 3.546875, "learning_rate": 0.0004977565537643544, "loss": 5.6369, "mean_token_accuracy": 0.15980817824602128, "num_tokens": 12267123.0, "step": 5915 }, { "entropy": 5.711336660385132, "epoch": 0.5370101596516691, "grad_norm": 1.9140625, "learning_rate": 0.0004977519936454227, "loss": 5.5961, "mean_token_accuracy": 0.15738640278577803, "num_tokens": 12276883.0, "step": 5920 }, { "entropy": 5.780760192871094, "epoch": 0.5374637155297532, "grad_norm": 2.4375, "learning_rate": 0.0004977474289199231, "loss": 5.6971, "mean_token_accuracy": 0.15041918009519578, "num_tokens": 12286608.0, "step": 5925 }, { "entropy": 5.856068229675293, "epoch": 0.5379172714078374, "grad_norm": 2.234375, "learning_rate": 0.0004977428595879499, "loss": 5.7392, "mean_token_accuracy": 0.14627672284841536, "num_tokens": 12297005.0, "step": 5930 }, { "entropy": 5.926909971237182, "epoch": 0.5383708272859217, "grad_norm": 2.0625, "learning_rate": 0.0004977382856495975, "loss": 5.7715, "mean_token_accuracy": 0.14751360639929773, "num_tokens": 12307844.0, "step": 5935 }, { "entropy": 5.734508275985718, "epoch": 0.5388243831640058, "grad_norm": 3.265625, "learning_rate": 0.0004977337071049606, "loss": 5.602, "mean_token_accuracy": 0.15361868292093278, "num_tokens": 12318593.0, "step": 5940 }, { "entropy": 5.803959321975708, "epoch": 0.53927793904209, "grad_norm": 2.890625, "learning_rate": 0.000497729123954134, "loss": 5.738, "mean_token_accuracy": 0.1524718463420868, "num_tokens": 12329225.0, "step": 5945 }, { "entropy": 5.830508041381836, "epoch": 0.5397314949201741, "grad_norm": 3.25, "learning_rate": 0.0004977245361972123, "loss": 5.6175, "mean_token_accuracy": 0.15675749778747558, "num_tokens": 12338825.0, "step": 5950 }, { "entropy": 5.816405010223389, "epoch": 0.5401850507982583, "grad_norm": 2.125, "learning_rate": 0.0004977199438342904, "loss": 5.713, "mean_token_accuracy": 0.15117572098970414, "num_tokens": 12349537.0, "step": 5955 }, { "entropy": 5.80316424369812, "epoch": 0.5406386066763426, "grad_norm": 2.25, "learning_rate": 0.0004977153468654634, "loss": 5.6903, "mean_token_accuracy": 0.15550419837236404, "num_tokens": 12360274.0, "step": 5960 }, { "entropy": 5.836670064926148, "epoch": 0.5410921625544267, "grad_norm": 3.421875, "learning_rate": 0.0004977107452908262, "loss": 5.7279, "mean_token_accuracy": 0.14425202012062072, "num_tokens": 12371575.0, "step": 5965 }, { "entropy": 5.84296875, "epoch": 0.5415457184325109, "grad_norm": 2.1875, "learning_rate": 0.000497706139110474, "loss": 5.6996, "mean_token_accuracy": 0.14984800666570663, "num_tokens": 12383486.0, "step": 5970 }, { "entropy": 5.789977788925171, "epoch": 0.541999274310595, "grad_norm": 1.890625, "learning_rate": 0.0004977015283245021, "loss": 5.612, "mean_token_accuracy": 0.1607540026307106, "num_tokens": 12394063.0, "step": 5975 }, { "entropy": 5.716253280639648, "epoch": 0.5424528301886793, "grad_norm": 3.890625, "learning_rate": 0.0004976969129330059, "loss": 5.6359, "mean_token_accuracy": 0.15388800203800201, "num_tokens": 12403413.0, "step": 5980 }, { "entropy": 5.834080648422241, "epoch": 0.5429063860667634, "grad_norm": 2.5, "learning_rate": 0.0004976922929360808, "loss": 5.6923, "mean_token_accuracy": 0.15336927622556687, "num_tokens": 12414099.0, "step": 5985 }, { "entropy": 5.805603790283203, "epoch": 0.5433599419448476, "grad_norm": 2.15625, "learning_rate": 0.0004976876683338222, "loss": 5.5614, "mean_token_accuracy": 0.15590637177228928, "num_tokens": 12423665.0, "step": 5990 }, { "entropy": 5.691508340835571, "epoch": 0.5438134978229318, "grad_norm": 1.671875, "learning_rate": 0.000497683039126326, "loss": 5.6086, "mean_token_accuracy": 0.15369207561016082, "num_tokens": 12433614.0, "step": 5995 }, { "entropy": 5.756490850448609, "epoch": 0.5442670537010159, "grad_norm": 2.03125, "learning_rate": 0.0004976784053136878, "loss": 5.6433, "mean_token_accuracy": 0.15434167087078093, "num_tokens": 12443669.0, "step": 6000 }, { "epoch": 0.5442670537010159, "eval_entropy": 5.587137994183674, "eval_loss": 5.719257831573486, "eval_mean_token_accuracy": 0.15730181987401587, "eval_num_tokens": 12443669.0, "eval_runtime": 26.845, "eval_samples_per_second": 1317.191, "eval_steps_per_second": 164.649, "step": 6000 } ], "logging_steps": 5, "max_steps": 110230, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 3000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.8229455046656e+16, "train_batch_size": 16, "trial_name": null, "trial_params": null }