{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 4.898403483309144, "eval_steps": 3000, "global_step": 54000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 4.902761459350586, "epoch": 0.00045355587808418, "grad_norm": 15.0625, "learning_rate": 2e-06, "loss": 14.2424, "mean_token_accuracy": 6.570302066393197e-05, "num_tokens": 10827.0, "step": 5 }, { "entropy": 4.906017255783081, "epoch": 0.00090711175616836, "grad_norm": 15.0625, "learning_rate": 4.5e-06, "loss": 14.1679, "mean_token_accuracy": 0.00036321740481071174, "num_tokens": 21025.0, "step": 10 }, { "entropy": 4.919331836700439, "epoch": 0.00136066763425254, "grad_norm": 16.25, "learning_rate": 7e-06, "loss": 14.1379, "mean_token_accuracy": 0.00018726952257566153, "num_tokens": 31678.0, "step": 15 }, { "entropy": 4.969941806793213, "epoch": 0.00181422351233672, "grad_norm": 17.75, "learning_rate": 9.5e-06, "loss": 13.9183, "mean_token_accuracy": 0.0, "num_tokens": 41025.0, "step": 20 }, { "entropy": 5.119146680831909, "epoch": 0.0022677793904208998, "grad_norm": 21.875, "learning_rate": 1.2e-05, "loss": 13.5438, "mean_token_accuracy": 0.0, "num_tokens": 51270.0, "step": 25 }, { "entropy": 5.423425340652466, "epoch": 0.00272133526850508, "grad_norm": 26.625, "learning_rate": 1.4500000000000002e-05, "loss": 13.082, "mean_token_accuracy": 0.0, "num_tokens": 62142.0, "step": 30 }, { "entropy": 6.89132776260376, "epoch": 0.00317489114658926, "grad_norm": 25.625, "learning_rate": 1.7000000000000003e-05, "loss": 11.989, "mean_token_accuracy": 0.0, "num_tokens": 72709.0, "step": 35 }, { "entropy": 10.029912281036378, "epoch": 0.00362844702467344, "grad_norm": 3.671875, "learning_rate": 1.95e-05, "loss": 10.9002, "mean_token_accuracy": 0.0, "num_tokens": 82313.0, "step": 40 }, { "entropy": 10.710572910308837, "epoch": 0.00408200290275762, "grad_norm": 3.59375, "learning_rate": 2.2e-05, "loss": 10.6789, "mean_token_accuracy": 0.001249837997602299, "num_tokens": 92450.0, "step": 45 }, { "entropy": 10.739872074127197, "epoch": 0.0045355587808417995, "grad_norm": 3.03125, "learning_rate": 2.4500000000000003e-05, "loss": 10.5409, "mean_token_accuracy": 0.010005939414259046, "num_tokens": 103978.0, "step": 50 }, { "entropy": 10.732357597351074, "epoch": 0.00498911465892598, "grad_norm": 2.140625, "learning_rate": 2.7e-05, "loss": 10.2901, "mean_token_accuracy": 0.0165672049857676, "num_tokens": 114134.0, "step": 55 }, { "entropy": 10.688269710540771, "epoch": 0.00544267053701016, "grad_norm": 2.296875, "learning_rate": 2.95e-05, "loss": 10.1413, "mean_token_accuracy": 0.015207256283611059, "num_tokens": 125037.0, "step": 60 }, { "entropy": 10.711676120758057, "epoch": 0.00589622641509434, "grad_norm": 1.90625, "learning_rate": 3.2e-05, "loss": 9.9497, "mean_token_accuracy": 0.017865559458732604, "num_tokens": 134721.0, "step": 65 }, { "entropy": 10.7262864112854, "epoch": 0.00634978229317852, "grad_norm": 1.9765625, "learning_rate": 3.4500000000000005e-05, "loss": 9.8497, "mean_token_accuracy": 0.03912395965307951, "num_tokens": 144448.0, "step": 70 }, { "entropy": 10.72291088104248, "epoch": 0.006803338171262699, "grad_norm": 1.9609375, "learning_rate": 3.7e-05, "loss": 9.7736, "mean_token_accuracy": 0.0496896930038929, "num_tokens": 154343.0, "step": 75 }, { "entropy": 10.716559219360352, "epoch": 0.00725689404934688, "grad_norm": 1.953125, "learning_rate": 3.95e-05, "loss": 9.7443, "mean_token_accuracy": 0.046880177780985834, "num_tokens": 165650.0, "step": 80 }, { "entropy": 10.707624149322509, "epoch": 0.007710449927431059, "grad_norm": 1.7734375, "learning_rate": 4.2000000000000004e-05, "loss": 9.711, "mean_token_accuracy": 0.04450351819396019, "num_tokens": 177098.0, "step": 85 }, { "entropy": 10.704974555969239, "epoch": 0.00816400580551524, "grad_norm": 1.96875, "learning_rate": 4.45e-05, "loss": 9.4919, "mean_token_accuracy": 0.05480348989367485, "num_tokens": 187903.0, "step": 90 }, { "entropy": 10.689633083343505, "epoch": 0.00861756168359942, "grad_norm": 1.8671875, "learning_rate": 4.7000000000000004e-05, "loss": 9.4033, "mean_token_accuracy": 0.052090702950954436, "num_tokens": 198077.0, "step": 95 }, { "entropy": 10.674059963226318, "epoch": 0.009071117561683599, "grad_norm": 1.8046875, "learning_rate": 4.9500000000000004e-05, "loss": 9.3565, "mean_token_accuracy": 0.05150817483663559, "num_tokens": 208641.0, "step": 100 }, { "entropy": 10.649502754211426, "epoch": 0.009524673439767779, "grad_norm": 1.84375, "learning_rate": 5.2e-05, "loss": 9.1936, "mean_token_accuracy": 0.05499474816024304, "num_tokens": 218398.0, "step": 105 }, { "entropy": 10.621120071411132, "epoch": 0.00997822931785196, "grad_norm": 1.6796875, "learning_rate": 5.45e-05, "loss": 9.066, "mean_token_accuracy": 0.05329935699701309, "num_tokens": 229059.0, "step": 110 }, { "entropy": 10.593021678924561, "epoch": 0.01043178519593614, "grad_norm": 1.7421875, "learning_rate": 5.7e-05, "loss": 8.9831, "mean_token_accuracy": 0.05141277946531773, "num_tokens": 239775.0, "step": 115 }, { "entropy": 10.551456928253174, "epoch": 0.01088534107402032, "grad_norm": 1.8515625, "learning_rate": 5.9499999999999996e-05, "loss": 8.842, "mean_token_accuracy": 0.05272237621247768, "num_tokens": 249954.0, "step": 120 }, { "entropy": 10.502390956878662, "epoch": 0.011338896952104499, "grad_norm": 1.65625, "learning_rate": 6.2e-05, "loss": 8.7334, "mean_token_accuracy": 0.05634862557053566, "num_tokens": 260056.0, "step": 125 }, { "entropy": 10.426200675964356, "epoch": 0.01179245283018868, "grad_norm": 1.5078125, "learning_rate": 6.450000000000001e-05, "loss": 8.6347, "mean_token_accuracy": 0.05641283132135868, "num_tokens": 269904.0, "step": 130 }, { "entropy": 10.35210132598877, "epoch": 0.01224600870827286, "grad_norm": 1.65625, "learning_rate": 6.7e-05, "loss": 8.5138, "mean_token_accuracy": 0.05234182849526405, "num_tokens": 280900.0, "step": 135 }, { "entropy": 10.270804977416992, "epoch": 0.01269956458635704, "grad_norm": 1.5546875, "learning_rate": 6.950000000000001e-05, "loss": 8.406, "mean_token_accuracy": 0.05256233848631382, "num_tokens": 290844.0, "step": 140 }, { "entropy": 10.143964767456055, "epoch": 0.013153120464441219, "grad_norm": 1.2578125, "learning_rate": 7.2e-05, "loss": 8.2834, "mean_token_accuracy": 0.056692027300596234, "num_tokens": 301345.0, "step": 145 }, { "entropy": 10.030607223510742, "epoch": 0.013606676342525399, "grad_norm": 1.40625, "learning_rate": 7.45e-05, "loss": 8.1592, "mean_token_accuracy": 0.05243662744760513, "num_tokens": 312681.0, "step": 150 }, { "entropy": 9.876211452484132, "epoch": 0.01406023222060958, "grad_norm": 1.203125, "learning_rate": 7.7e-05, "loss": 8.0357, "mean_token_accuracy": 0.05974825695157051, "num_tokens": 323492.0, "step": 155 }, { "entropy": 9.703791522979737, "epoch": 0.01451378809869376, "grad_norm": 1.1015625, "learning_rate": 7.950000000000001e-05, "loss": 7.9778, "mean_token_accuracy": 0.05336504280567169, "num_tokens": 334521.0, "step": 160 }, { "entropy": 9.493086814880371, "epoch": 0.014967343976777939, "grad_norm": 0.99609375, "learning_rate": 8.2e-05, "loss": 7.9038, "mean_token_accuracy": 0.05283032245934009, "num_tokens": 345468.0, "step": 165 }, { "entropy": 9.287709426879882, "epoch": 0.015420899854862119, "grad_norm": 1.0625, "learning_rate": 8.450000000000001e-05, "loss": 7.7788, "mean_token_accuracy": 0.055317680910229684, "num_tokens": 355911.0, "step": 170 }, { "entropy": 9.030819416046143, "epoch": 0.0158744557329463, "grad_norm": 0.87890625, "learning_rate": 8.7e-05, "loss": 7.7522, "mean_token_accuracy": 0.05364949442446232, "num_tokens": 367537.0, "step": 175 }, { "entropy": 8.806273078918457, "epoch": 0.01632801161103048, "grad_norm": 0.890625, "learning_rate": 8.95e-05, "loss": 7.8067, "mean_token_accuracy": 0.05446445494890213, "num_tokens": 377918.0, "step": 180 }, { "entropy": 8.59828290939331, "epoch": 0.01678156748911466, "grad_norm": 0.703125, "learning_rate": 9.2e-05, "loss": 7.6514, "mean_token_accuracy": 0.055352770164608954, "num_tokens": 388461.0, "step": 185 }, { "entropy": 8.414749145507812, "epoch": 0.01723512336719884, "grad_norm": 0.9140625, "learning_rate": 9.45e-05, "loss": 7.6092, "mean_token_accuracy": 0.06770730689167977, "num_tokens": 399771.0, "step": 190 }, { "entropy": 8.264602565765381, "epoch": 0.01768867924528302, "grad_norm": 0.6953125, "learning_rate": 9.7e-05, "loss": 7.4766, "mean_token_accuracy": 0.07282306849956513, "num_tokens": 410254.0, "step": 195 }, { "entropy": 8.190978908538819, "epoch": 0.018142235123367198, "grad_norm": 1.25, "learning_rate": 9.95e-05, "loss": 7.4886, "mean_token_accuracy": 0.06817287020385265, "num_tokens": 419792.0, "step": 200 }, { "entropy": 8.113365936279298, "epoch": 0.018595791001451378, "grad_norm": 0.81640625, "learning_rate": 0.000102, "loss": 7.4782, "mean_token_accuracy": 0.07438576593995094, "num_tokens": 429264.0, "step": 205 }, { "entropy": 8.046414375305176, "epoch": 0.019049346879535557, "grad_norm": 0.69140625, "learning_rate": 0.00010449999999999999, "loss": 7.4294, "mean_token_accuracy": 0.0784988671541214, "num_tokens": 439624.0, "step": 210 }, { "entropy": 8.01142177581787, "epoch": 0.01950290275761974, "grad_norm": 0.83203125, "learning_rate": 0.000107, "loss": 7.4206, "mean_token_accuracy": 0.07665222510695457, "num_tokens": 449556.0, "step": 215 }, { "entropy": 7.982991123199463, "epoch": 0.01995645863570392, "grad_norm": 1.03125, "learning_rate": 0.0001095, "loss": 7.4192, "mean_token_accuracy": 0.07819079160690308, "num_tokens": 460243.0, "step": 220 }, { "entropy": 7.913471603393555, "epoch": 0.0204100145137881, "grad_norm": 1.015625, "learning_rate": 0.000112, "loss": 7.4682, "mean_token_accuracy": 0.07565705217421055, "num_tokens": 469767.0, "step": 225 }, { "entropy": 7.974834537506103, "epoch": 0.02086357039187228, "grad_norm": 0.83203125, "learning_rate": 0.0001145, "loss": 7.3948, "mean_token_accuracy": 0.07845633998513221, "num_tokens": 480329.0, "step": 230 }, { "entropy": 7.921621561050415, "epoch": 0.02131712626995646, "grad_norm": 0.8671875, "learning_rate": 0.00011700000000000001, "loss": 7.3597, "mean_token_accuracy": 0.07565821185708047, "num_tokens": 490096.0, "step": 235 }, { "entropy": 7.9462236881256105, "epoch": 0.02177068214804064, "grad_norm": 1.328125, "learning_rate": 0.00011949999999999999, "loss": 7.404, "mean_token_accuracy": 0.07110006958246232, "num_tokens": 501231.0, "step": 240 }, { "entropy": 7.90762996673584, "epoch": 0.022224238026124818, "grad_norm": 1.3359375, "learning_rate": 0.000122, "loss": 7.3003, "mean_token_accuracy": 0.07855217903852463, "num_tokens": 510722.0, "step": 245 }, { "entropy": 7.791062259674073, "epoch": 0.022677793904208998, "grad_norm": 0.8359375, "learning_rate": 0.0001245, "loss": 7.342, "mean_token_accuracy": 0.0785796582698822, "num_tokens": 521452.0, "step": 250 }, { "entropy": 7.835426616668701, "epoch": 0.023131349782293177, "grad_norm": 1.0, "learning_rate": 0.000127, "loss": 7.3275, "mean_token_accuracy": 0.07848411723971367, "num_tokens": 532397.0, "step": 255 }, { "entropy": 7.834844970703125, "epoch": 0.02358490566037736, "grad_norm": 0.9375, "learning_rate": 0.0001295, "loss": 7.3126, "mean_token_accuracy": 0.08216355144977569, "num_tokens": 542271.0, "step": 260 }, { "entropy": 7.783105802536011, "epoch": 0.02403846153846154, "grad_norm": 1.046875, "learning_rate": 0.000132, "loss": 7.2852, "mean_token_accuracy": 0.08326507434248924, "num_tokens": 552411.0, "step": 265 }, { "entropy": 7.789214849472046, "epoch": 0.02449201741654572, "grad_norm": 0.87890625, "learning_rate": 0.00013450000000000002, "loss": 7.2853, "mean_token_accuracy": 0.07970908731222152, "num_tokens": 561518.0, "step": 270 }, { "entropy": 7.8078306198120115, "epoch": 0.0249455732946299, "grad_norm": 0.859375, "learning_rate": 0.00013700000000000002, "loss": 7.3048, "mean_token_accuracy": 0.08076792433857918, "num_tokens": 571361.0, "step": 275 }, { "entropy": 7.704005384445191, "epoch": 0.02539912917271408, "grad_norm": 0.87890625, "learning_rate": 0.0001395, "loss": 7.2079, "mean_token_accuracy": 0.08890472128987312, "num_tokens": 580926.0, "step": 280 }, { "entropy": 7.777441549301147, "epoch": 0.025852685050798258, "grad_norm": 1.2109375, "learning_rate": 0.00014199999999999998, "loss": 7.305, "mean_token_accuracy": 0.07825151681900025, "num_tokens": 592282.0, "step": 285 }, { "entropy": 7.756225681304931, "epoch": 0.026306240928882438, "grad_norm": 1.25, "learning_rate": 0.0001445, "loss": 7.3123, "mean_token_accuracy": 0.08080485239624977, "num_tokens": 602767.0, "step": 290 }, { "entropy": 7.716958808898926, "epoch": 0.026759796806966617, "grad_norm": 0.86328125, "learning_rate": 0.000147, "loss": 7.2177, "mean_token_accuracy": 0.08552644699811936, "num_tokens": 612763.0, "step": 295 }, { "entropy": 7.706277990341187, "epoch": 0.027213352685050797, "grad_norm": 0.9296875, "learning_rate": 0.0001495, "loss": 7.1737, "mean_token_accuracy": 0.08685687705874442, "num_tokens": 622796.0, "step": 300 }, { "entropy": 7.668240880966186, "epoch": 0.027666908563134977, "grad_norm": 1.2265625, "learning_rate": 0.000152, "loss": 7.1609, "mean_token_accuracy": 0.08536986410617828, "num_tokens": 633136.0, "step": 305 }, { "entropy": 7.649664688110351, "epoch": 0.02812046444121916, "grad_norm": 0.9921875, "learning_rate": 0.00015450000000000001, "loss": 7.143, "mean_token_accuracy": 0.08583157956600189, "num_tokens": 643347.0, "step": 310 }, { "entropy": 7.697743082046509, "epoch": 0.02857402031930334, "grad_norm": 0.859375, "learning_rate": 0.000157, "loss": 7.1414, "mean_token_accuracy": 0.09304612576961517, "num_tokens": 653096.0, "step": 315 }, { "entropy": 7.587596750259399, "epoch": 0.02902757619738752, "grad_norm": 1.4296875, "learning_rate": 0.0001595, "loss": 7.1706, "mean_token_accuracy": 0.08879687860608101, "num_tokens": 663557.0, "step": 320 }, { "entropy": 7.612160730361938, "epoch": 0.0294811320754717, "grad_norm": 0.96484375, "learning_rate": 0.000162, "loss": 7.2254, "mean_token_accuracy": 0.08831041827797889, "num_tokens": 674395.0, "step": 325 }, { "entropy": 7.695938348770142, "epoch": 0.029934687953555878, "grad_norm": 1.0390625, "learning_rate": 0.00016450000000000001, "loss": 7.1265, "mean_token_accuracy": 0.09078574851155281, "num_tokens": 684776.0, "step": 330 }, { "entropy": 7.576247215270996, "epoch": 0.030388243831640058, "grad_norm": 1.0703125, "learning_rate": 0.00016700000000000002, "loss": 7.109, "mean_token_accuracy": 0.08843011409044266, "num_tokens": 694886.0, "step": 335 }, { "entropy": 7.556908130645752, "epoch": 0.030841799709724237, "grad_norm": 1.2109375, "learning_rate": 0.00016950000000000003, "loss": 7.171, "mean_token_accuracy": 0.09018958061933517, "num_tokens": 705426.0, "step": 340 }, { "entropy": 7.578840160369873, "epoch": 0.03129535558780842, "grad_norm": 0.87890625, "learning_rate": 0.00017199999999999998, "loss": 7.1594, "mean_token_accuracy": 0.08782409057021141, "num_tokens": 716271.0, "step": 345 }, { "entropy": 7.638495922088623, "epoch": 0.0317489114658926, "grad_norm": 1.0234375, "learning_rate": 0.00017449999999999999, "loss": 7.1606, "mean_token_accuracy": 0.09265835508704186, "num_tokens": 726875.0, "step": 350 }, { "entropy": 7.563690900802612, "epoch": 0.032202467343976776, "grad_norm": 0.88671875, "learning_rate": 0.000177, "loss": 7.0773, "mean_token_accuracy": 0.08827165514230728, "num_tokens": 737825.0, "step": 355 }, { "entropy": 7.58997654914856, "epoch": 0.03265602322206096, "grad_norm": 1.1171875, "learning_rate": 0.0001795, "loss": 7.089, "mean_token_accuracy": 0.0890809178352356, "num_tokens": 747424.0, "step": 360 }, { "entropy": 7.506178569793701, "epoch": 0.033109579100145135, "grad_norm": 1.3671875, "learning_rate": 0.000182, "loss": 7.0901, "mean_token_accuracy": 0.09158140644431115, "num_tokens": 757649.0, "step": 365 }, { "entropy": 7.567615652084351, "epoch": 0.03356313497822932, "grad_norm": 1.078125, "learning_rate": 0.0001845, "loss": 7.0671, "mean_token_accuracy": 0.0931968331336975, "num_tokens": 768556.0, "step": 370 }, { "entropy": 7.400697326660156, "epoch": 0.034016690856313495, "grad_norm": 1.140625, "learning_rate": 0.000187, "loss": 7.0591, "mean_token_accuracy": 0.09333095103502273, "num_tokens": 778331.0, "step": 375 }, { "entropy": 7.539828157424926, "epoch": 0.03447024673439768, "grad_norm": 1.0546875, "learning_rate": 0.0001895, "loss": 7.0387, "mean_token_accuracy": 0.09365462064743042, "num_tokens": 788065.0, "step": 380 }, { "entropy": 7.495446348190308, "epoch": 0.03492380261248186, "grad_norm": 1.0, "learning_rate": 0.000192, "loss": 7.0671, "mean_token_accuracy": 0.09628497660160065, "num_tokens": 798912.0, "step": 385 }, { "entropy": 7.502418661117554, "epoch": 0.03537735849056604, "grad_norm": 1.1328125, "learning_rate": 0.0001945, "loss": 7.0166, "mean_token_accuracy": 0.09867717772722244, "num_tokens": 809580.0, "step": 390 }, { "entropy": 7.49851360321045, "epoch": 0.03583091436865022, "grad_norm": 1.0234375, "learning_rate": 0.00019700000000000002, "loss": 7.1108, "mean_token_accuracy": 0.09084957540035248, "num_tokens": 820207.0, "step": 395 }, { "entropy": 7.348110675811768, "epoch": 0.036284470246734396, "grad_norm": 1.015625, "learning_rate": 0.00019950000000000002, "loss": 6.9336, "mean_token_accuracy": 0.08944878205657006, "num_tokens": 831038.0, "step": 400 }, { "entropy": 7.545411586761475, "epoch": 0.03673802612481858, "grad_norm": 1.0078125, "learning_rate": 0.000202, "loss": 7.0186, "mean_token_accuracy": 0.09372441694140435, "num_tokens": 842144.0, "step": 405 }, { "entropy": 7.47612156867981, "epoch": 0.037191582002902755, "grad_norm": 1.609375, "learning_rate": 0.00020449999999999998, "loss": 6.9989, "mean_token_accuracy": 0.09804348424077033, "num_tokens": 851315.0, "step": 410 }, { "entropy": 7.322836017608642, "epoch": 0.03764513788098694, "grad_norm": 1.0625, "learning_rate": 0.000207, "loss": 7.0063, "mean_token_accuracy": 0.09803526178002357, "num_tokens": 861233.0, "step": 415 }, { "entropy": 7.406570482254028, "epoch": 0.038098693759071114, "grad_norm": 1.171875, "learning_rate": 0.0002095, "loss": 6.9994, "mean_token_accuracy": 0.0946230135858059, "num_tokens": 871131.0, "step": 420 }, { "entropy": 7.391973686218262, "epoch": 0.0385522496371553, "grad_norm": 1.2890625, "learning_rate": 0.000212, "loss": 6.975, "mean_token_accuracy": 0.09175262376666068, "num_tokens": 882195.0, "step": 425 }, { "entropy": 7.452529048919677, "epoch": 0.03900580551523948, "grad_norm": 1.1328125, "learning_rate": 0.0002145, "loss": 6.9467, "mean_token_accuracy": 0.09589996412396432, "num_tokens": 891806.0, "step": 430 }, { "entropy": 7.431856489181518, "epoch": 0.03945936139332366, "grad_norm": 0.9375, "learning_rate": 0.00021700000000000002, "loss": 7.0087, "mean_token_accuracy": 0.09551806971430779, "num_tokens": 901350.0, "step": 435 }, { "entropy": 7.414364910125732, "epoch": 0.03991291727140784, "grad_norm": 1.296875, "learning_rate": 0.0002195, "loss": 6.9182, "mean_token_accuracy": 0.09558806866407395, "num_tokens": 912061.0, "step": 440 }, { "entropy": 7.305682420730591, "epoch": 0.040366473149492016, "grad_norm": 1.765625, "learning_rate": 0.000222, "loss": 6.89, "mean_token_accuracy": 0.09567090198397636, "num_tokens": 922220.0, "step": 445 }, { "entropy": 7.367461013793945, "epoch": 0.0408200290275762, "grad_norm": 1.0625, "learning_rate": 0.0002245, "loss": 6.8992, "mean_token_accuracy": 0.09762913659214974, "num_tokens": 932319.0, "step": 450 }, { "entropy": 7.292191886901856, "epoch": 0.041273584905660375, "grad_norm": 1.0859375, "learning_rate": 0.00022700000000000002, "loss": 6.9231, "mean_token_accuracy": 0.09886682778596878, "num_tokens": 943254.0, "step": 455 }, { "entropy": 7.387064361572266, "epoch": 0.04172714078374456, "grad_norm": 0.83984375, "learning_rate": 0.00022950000000000002, "loss": 6.939, "mean_token_accuracy": 0.09336472377181053, "num_tokens": 953921.0, "step": 460 }, { "entropy": 7.296272230148316, "epoch": 0.042180696661828734, "grad_norm": 1.015625, "learning_rate": 0.00023200000000000003, "loss": 6.8498, "mean_token_accuracy": 0.10429160594940186, "num_tokens": 963832.0, "step": 465 }, { "entropy": 7.304851102828979, "epoch": 0.04263425253991292, "grad_norm": 1.234375, "learning_rate": 0.00023449999999999998, "loss": 6.9459, "mean_token_accuracy": 0.09589096009731293, "num_tokens": 974066.0, "step": 470 }, { "entropy": 7.324310684204102, "epoch": 0.0430878084179971, "grad_norm": 1.5234375, "learning_rate": 0.000237, "loss": 6.9353, "mean_token_accuracy": 0.09945596382021904, "num_tokens": 984402.0, "step": 475 }, { "entropy": 7.312732458114624, "epoch": 0.04354136429608128, "grad_norm": 1.078125, "learning_rate": 0.0002395, "loss": 6.8591, "mean_token_accuracy": 0.09938167333602906, "num_tokens": 993555.0, "step": 480 }, { "entropy": 7.334518146514893, "epoch": 0.04399492017416546, "grad_norm": 1.171875, "learning_rate": 0.000242, "loss": 6.8404, "mean_token_accuracy": 0.10574882701039315, "num_tokens": 1002920.0, "step": 485 }, { "entropy": 7.289060401916504, "epoch": 0.044448476052249636, "grad_norm": 1.3828125, "learning_rate": 0.0002445, "loss": 6.907, "mean_token_accuracy": 0.09448245465755463, "num_tokens": 1013611.0, "step": 490 }, { "entropy": 7.166425371170044, "epoch": 0.04490203193033382, "grad_norm": 1.2109375, "learning_rate": 0.000247, "loss": 6.8012, "mean_token_accuracy": 0.0957680583000183, "num_tokens": 1024121.0, "step": 495 }, { "entropy": 7.363502073287964, "epoch": 0.045355587808417995, "grad_norm": 1.015625, "learning_rate": 0.0002495, "loss": 7.032, "mean_token_accuracy": 0.1009724922478199, "num_tokens": 1033845.0, "step": 500 }, { "entropy": 7.24678144454956, "epoch": 0.04580914368650218, "grad_norm": 1.0625, "learning_rate": 0.000252, "loss": 6.831, "mean_token_accuracy": 0.09820592999458314, "num_tokens": 1044642.0, "step": 505 }, { "entropy": 7.280577898025513, "epoch": 0.046262699564586354, "grad_norm": 1.1640625, "learning_rate": 0.0002545, "loss": 6.8867, "mean_token_accuracy": 0.09730055406689644, "num_tokens": 1054728.0, "step": 510 }, { "entropy": 7.20595383644104, "epoch": 0.04671625544267054, "grad_norm": 1.015625, "learning_rate": 0.000257, "loss": 6.8504, "mean_token_accuracy": 0.0942535676062107, "num_tokens": 1065743.0, "step": 515 }, { "entropy": 7.1944211483001705, "epoch": 0.04716981132075472, "grad_norm": 1.2578125, "learning_rate": 0.0002595, "loss": 6.7719, "mean_token_accuracy": 0.09884541779756546, "num_tokens": 1076798.0, "step": 520 }, { "entropy": 7.200849342346191, "epoch": 0.047623367198838897, "grad_norm": 1.078125, "learning_rate": 0.000262, "loss": 6.8921, "mean_token_accuracy": 0.09789391681551933, "num_tokens": 1087445.0, "step": 525 }, { "entropy": 7.216012907028198, "epoch": 0.04807692307692308, "grad_norm": 1.046875, "learning_rate": 0.00026450000000000003, "loss": 6.7985, "mean_token_accuracy": 0.10271445363759994, "num_tokens": 1098379.0, "step": 530 }, { "entropy": 7.228269386291504, "epoch": 0.048530478955007256, "grad_norm": 1.171875, "learning_rate": 0.00026700000000000004, "loss": 6.8866, "mean_token_accuracy": 0.09828322008252144, "num_tokens": 1108016.0, "step": 535 }, { "entropy": 7.184875774383545, "epoch": 0.04898403483309144, "grad_norm": 1.140625, "learning_rate": 0.00026950000000000005, "loss": 6.7837, "mean_token_accuracy": 0.09823340401053429, "num_tokens": 1117887.0, "step": 540 }, { "entropy": 7.186046075820923, "epoch": 0.049437590711175615, "grad_norm": 1.265625, "learning_rate": 0.00027200000000000005, "loss": 6.7773, "mean_token_accuracy": 0.0981587328016758, "num_tokens": 1128497.0, "step": 545 }, { "entropy": 7.1298119068145756, "epoch": 0.0498911465892598, "grad_norm": 0.9453125, "learning_rate": 0.0002745, "loss": 6.8017, "mean_token_accuracy": 0.10637210011482238, "num_tokens": 1138168.0, "step": 550 }, { "entropy": 7.136086797714233, "epoch": 0.050344702467343974, "grad_norm": 1.0234375, "learning_rate": 0.000277, "loss": 6.7618, "mean_token_accuracy": 0.10049154385924339, "num_tokens": 1148357.0, "step": 555 }, { "entropy": 7.1673754215240475, "epoch": 0.05079825834542816, "grad_norm": 1.265625, "learning_rate": 0.0002795, "loss": 6.7907, "mean_token_accuracy": 0.10017752796411514, "num_tokens": 1159964.0, "step": 560 }, { "entropy": 7.23973536491394, "epoch": 0.05125181422351233, "grad_norm": 1.4296875, "learning_rate": 0.00028199999999999997, "loss": 6.8508, "mean_token_accuracy": 0.09828138649463654, "num_tokens": 1170683.0, "step": 565 }, { "entropy": 7.192407703399658, "epoch": 0.051705370101596516, "grad_norm": 1.515625, "learning_rate": 0.0002845, "loss": 6.8052, "mean_token_accuracy": 0.1006213940680027, "num_tokens": 1181680.0, "step": 570 }, { "entropy": 7.093324756622314, "epoch": 0.0521589259796807, "grad_norm": 1.34375, "learning_rate": 0.000287, "loss": 6.6997, "mean_token_accuracy": 0.10036976039409637, "num_tokens": 1191619.0, "step": 575 }, { "entropy": 7.011592292785645, "epoch": 0.052612481857764876, "grad_norm": 1.2421875, "learning_rate": 0.0002895, "loss": 6.6916, "mean_token_accuracy": 0.10292767509818077, "num_tokens": 1202264.0, "step": 580 }, { "entropy": 7.043795013427735, "epoch": 0.05306603773584906, "grad_norm": 1.0390625, "learning_rate": 0.000292, "loss": 6.6999, "mean_token_accuracy": 0.1045819990336895, "num_tokens": 1212119.0, "step": 585 }, { "entropy": 7.129189682006836, "epoch": 0.053519593613933235, "grad_norm": 1.0546875, "learning_rate": 0.0002945, "loss": 6.8212, "mean_token_accuracy": 0.102519890666008, "num_tokens": 1222317.0, "step": 590 }, { "entropy": 7.168576860427857, "epoch": 0.05397314949201742, "grad_norm": 1.2265625, "learning_rate": 0.000297, "loss": 6.7716, "mean_token_accuracy": 0.10512009784579276, "num_tokens": 1232914.0, "step": 595 }, { "entropy": 6.968721580505371, "epoch": 0.054426705370101594, "grad_norm": 1.1171875, "learning_rate": 0.0002995, "loss": 6.6181, "mean_token_accuracy": 0.10760264396667481, "num_tokens": 1244214.0, "step": 600 }, { "entropy": 7.105316591262818, "epoch": 0.05488026124818578, "grad_norm": 1.1875, "learning_rate": 0.000302, "loss": 6.7149, "mean_token_accuracy": 0.10045301765203477, "num_tokens": 1254626.0, "step": 605 }, { "entropy": 6.98553991317749, "epoch": 0.05533381712626995, "grad_norm": 1.3046875, "learning_rate": 0.0003045, "loss": 6.8113, "mean_token_accuracy": 0.10129074826836586, "num_tokens": 1265461.0, "step": 610 }, { "entropy": 7.082133436203003, "epoch": 0.055787373004354136, "grad_norm": 1.0625, "learning_rate": 0.000307, "loss": 6.6817, "mean_token_accuracy": 0.11003390699625015, "num_tokens": 1275810.0, "step": 615 }, { "entropy": 6.964151763916016, "epoch": 0.05624092888243832, "grad_norm": 1.3203125, "learning_rate": 0.0003095, "loss": 6.6878, "mean_token_accuracy": 0.11000289767980576, "num_tokens": 1285170.0, "step": 620 }, { "entropy": 7.021602058410645, "epoch": 0.056694484760522496, "grad_norm": 0.99609375, "learning_rate": 0.000312, "loss": 6.6361, "mean_token_accuracy": 0.10547553822398185, "num_tokens": 1295460.0, "step": 625 }, { "entropy": 7.010881614685059, "epoch": 0.05714804063860668, "grad_norm": 1.2734375, "learning_rate": 0.0003145, "loss": 6.7523, "mean_token_accuracy": 0.10284495502710342, "num_tokens": 1306656.0, "step": 630 }, { "entropy": 7.070465517044068, "epoch": 0.057601596516690855, "grad_norm": 1.0703125, "learning_rate": 0.000317, "loss": 6.7338, "mean_token_accuracy": 0.1056830108165741, "num_tokens": 1318019.0, "step": 635 }, { "entropy": 6.88353590965271, "epoch": 0.05805515239477504, "grad_norm": 1.578125, "learning_rate": 0.0003195, "loss": 6.6511, "mean_token_accuracy": 0.10918820276856422, "num_tokens": 1328120.0, "step": 640 }, { "entropy": 7.09418797492981, "epoch": 0.058508708272859214, "grad_norm": 1.1953125, "learning_rate": 0.000322, "loss": 6.7483, "mean_token_accuracy": 0.10312345400452613, "num_tokens": 1338354.0, "step": 645 }, { "entropy": 7.009733867645264, "epoch": 0.0589622641509434, "grad_norm": 1.40625, "learning_rate": 0.00032450000000000003, "loss": 6.7237, "mean_token_accuracy": 0.1024971716105938, "num_tokens": 1348666.0, "step": 650 }, { "entropy": 7.047331762313843, "epoch": 0.05941582002902757, "grad_norm": 0.9453125, "learning_rate": 0.00032700000000000003, "loss": 6.7554, "mean_token_accuracy": 0.10805487632751465, "num_tokens": 1359713.0, "step": 655 }, { "entropy": 6.9947686195373535, "epoch": 0.059869375907111756, "grad_norm": 0.97265625, "learning_rate": 0.00032950000000000004, "loss": 6.6124, "mean_token_accuracy": 0.10892275646328926, "num_tokens": 1369507.0, "step": 660 }, { "entropy": 6.998069620132446, "epoch": 0.06032293178519594, "grad_norm": 1.1171875, "learning_rate": 0.00033200000000000005, "loss": 6.768, "mean_token_accuracy": 0.10034214109182357, "num_tokens": 1380726.0, "step": 665 }, { "entropy": 7.112451839447021, "epoch": 0.060776487663280115, "grad_norm": 1.171875, "learning_rate": 0.00033450000000000005, "loss": 6.6933, "mean_token_accuracy": 0.10579130649566651, "num_tokens": 1391423.0, "step": 670 }, { "entropy": 7.052730226516724, "epoch": 0.0612300435413643, "grad_norm": 1.2890625, "learning_rate": 0.000337, "loss": 6.6678, "mean_token_accuracy": 0.11295373067259788, "num_tokens": 1402492.0, "step": 675 }, { "entropy": 6.922665405273437, "epoch": 0.061683599419448475, "grad_norm": 1.0390625, "learning_rate": 0.0003395, "loss": 6.7161, "mean_token_accuracy": 0.10829840004444122, "num_tokens": 1412497.0, "step": 680 }, { "entropy": 7.03723840713501, "epoch": 0.06213715529753266, "grad_norm": 1.171875, "learning_rate": 0.000342, "loss": 6.6772, "mean_token_accuracy": 0.11061608865857124, "num_tokens": 1423214.0, "step": 685 }, { "entropy": 6.935256671905518, "epoch": 0.06259071117561683, "grad_norm": 1.2109375, "learning_rate": 0.00034449999999999997, "loss": 6.6745, "mean_token_accuracy": 0.10797292739152908, "num_tokens": 1434044.0, "step": 690 }, { "entropy": 6.918494129180909, "epoch": 0.06304426705370102, "grad_norm": 1.1640625, "learning_rate": 0.000347, "loss": 6.6361, "mean_token_accuracy": 0.10982377529144287, "num_tokens": 1444387.0, "step": 695 }, { "entropy": 6.957173490524292, "epoch": 0.0634978229317852, "grad_norm": 1.015625, "learning_rate": 0.0003495, "loss": 6.5862, "mean_token_accuracy": 0.10744345635175705, "num_tokens": 1455157.0, "step": 700 }, { "entropy": 6.938698959350586, "epoch": 0.06395137880986937, "grad_norm": 1.125, "learning_rate": 0.000352, "loss": 6.6693, "mean_token_accuracy": 0.11478404849767684, "num_tokens": 1466145.0, "step": 705 }, { "entropy": 6.962664556503296, "epoch": 0.06440493468795355, "grad_norm": 0.9765625, "learning_rate": 0.0003545, "loss": 6.667, "mean_token_accuracy": 0.10709880217909813, "num_tokens": 1476713.0, "step": 710 }, { "entropy": 6.92603645324707, "epoch": 0.06485849056603774, "grad_norm": 1.1640625, "learning_rate": 0.000357, "loss": 6.671, "mean_token_accuracy": 0.11409479826688766, "num_tokens": 1486908.0, "step": 715 }, { "entropy": 6.899812459945679, "epoch": 0.06531204644412192, "grad_norm": 1.375, "learning_rate": 0.0003595, "loss": 6.5941, "mean_token_accuracy": 0.11084994897246361, "num_tokens": 1498185.0, "step": 720 }, { "entropy": 6.901278781890869, "epoch": 0.0657656023222061, "grad_norm": 1.2265625, "learning_rate": 0.000362, "loss": 6.6413, "mean_token_accuracy": 0.1077586367726326, "num_tokens": 1508376.0, "step": 725 }, { "entropy": 6.9933178424835205, "epoch": 0.06621915820029027, "grad_norm": 1.0625, "learning_rate": 0.0003645, "loss": 6.7199, "mean_token_accuracy": 0.10835012272000313, "num_tokens": 1519953.0, "step": 730 }, { "entropy": 6.853632211685181, "epoch": 0.06667271407837445, "grad_norm": 1.0859375, "learning_rate": 0.000367, "loss": 6.592, "mean_token_accuracy": 0.11243074238300324, "num_tokens": 1529793.0, "step": 735 }, { "entropy": 6.829979610443115, "epoch": 0.06712626995645864, "grad_norm": 0.95703125, "learning_rate": 0.0003695, "loss": 6.5882, "mean_token_accuracy": 0.11395004838705063, "num_tokens": 1540859.0, "step": 740 }, { "entropy": 6.908363008499146, "epoch": 0.06757982583454282, "grad_norm": 1.0859375, "learning_rate": 0.000372, "loss": 6.5104, "mean_token_accuracy": 0.11262088865041733, "num_tokens": 1549783.0, "step": 745 }, { "entropy": 6.84120545387268, "epoch": 0.06803338171262699, "grad_norm": 1.125, "learning_rate": 0.0003745, "loss": 6.5803, "mean_token_accuracy": 0.10933975651860237, "num_tokens": 1560522.0, "step": 750 }, { "entropy": 6.878204107284546, "epoch": 0.06848693759071117, "grad_norm": 1.421875, "learning_rate": 0.000377, "loss": 6.553, "mean_token_accuracy": 0.11197188422083855, "num_tokens": 1570668.0, "step": 755 }, { "entropy": 6.856545925140381, "epoch": 0.06894049346879536, "grad_norm": 1.0390625, "learning_rate": 0.0003795, "loss": 6.669, "mean_token_accuracy": 0.11744550019502639, "num_tokens": 1581523.0, "step": 760 }, { "entropy": 6.84909029006958, "epoch": 0.06939404934687954, "grad_norm": 1.1796875, "learning_rate": 0.000382, "loss": 6.5917, "mean_token_accuracy": 0.1113414227962494, "num_tokens": 1591356.0, "step": 765 }, { "entropy": 6.83960976600647, "epoch": 0.06984760522496372, "grad_norm": 1.046875, "learning_rate": 0.0003845, "loss": 6.5574, "mean_token_accuracy": 0.11633669957518578, "num_tokens": 1601779.0, "step": 770 }, { "entropy": 6.888131904602051, "epoch": 0.07030116110304789, "grad_norm": 1.0234375, "learning_rate": 0.00038700000000000003, "loss": 6.5633, "mean_token_accuracy": 0.1150720700621605, "num_tokens": 1611995.0, "step": 775 }, { "entropy": 6.856516313552857, "epoch": 0.07075471698113207, "grad_norm": 1.1328125, "learning_rate": 0.00038950000000000003, "loss": 6.586, "mean_token_accuracy": 0.11050437688827515, "num_tokens": 1621834.0, "step": 780 }, { "entropy": 6.778967618942261, "epoch": 0.07120827285921626, "grad_norm": 1.1953125, "learning_rate": 0.00039200000000000004, "loss": 6.6288, "mean_token_accuracy": 0.10744166076183319, "num_tokens": 1632881.0, "step": 785 }, { "entropy": 6.7607427597045895, "epoch": 0.07166182873730044, "grad_norm": 1.0625, "learning_rate": 0.00039450000000000005, "loss": 6.6028, "mean_token_accuracy": 0.10911152362823487, "num_tokens": 1642870.0, "step": 790 }, { "entropy": 6.8341546058654785, "epoch": 0.07211538461538461, "grad_norm": 1.2578125, "learning_rate": 0.00039700000000000005, "loss": 6.484, "mean_token_accuracy": 0.11779236048460007, "num_tokens": 1653390.0, "step": 795 }, { "entropy": 6.802682399749756, "epoch": 0.07256894049346879, "grad_norm": 1.015625, "learning_rate": 0.0003995, "loss": 6.6078, "mean_token_accuracy": 0.11580143421888352, "num_tokens": 1663382.0, "step": 800 }, { "entropy": 6.889751863479614, "epoch": 0.07302249637155298, "grad_norm": 1.03125, "learning_rate": 0.000402, "loss": 6.6263, "mean_token_accuracy": 0.10960384383797646, "num_tokens": 1673601.0, "step": 805 }, { "entropy": 6.744623231887817, "epoch": 0.07347605224963716, "grad_norm": 1.234375, "learning_rate": 0.0004045, "loss": 6.5301, "mean_token_accuracy": 0.1178050920367241, "num_tokens": 1683565.0, "step": 810 }, { "entropy": 6.720245599746704, "epoch": 0.07392960812772134, "grad_norm": 1.9140625, "learning_rate": 0.00040699999999999997, "loss": 6.4975, "mean_token_accuracy": 0.1157220259308815, "num_tokens": 1693636.0, "step": 815 }, { "entropy": 6.888108444213867, "epoch": 0.07438316400580551, "grad_norm": 1.265625, "learning_rate": 0.0004095, "loss": 6.6028, "mean_token_accuracy": 0.11490728184580803, "num_tokens": 1703415.0, "step": 820 }, { "entropy": 6.8595898151397705, "epoch": 0.0748367198838897, "grad_norm": 1.5703125, "learning_rate": 0.000412, "loss": 6.5759, "mean_token_accuracy": 0.11677221283316612, "num_tokens": 1713579.0, "step": 825 }, { "entropy": 6.7610352516174315, "epoch": 0.07529027576197388, "grad_norm": 1.015625, "learning_rate": 0.0004145, "loss": 6.5869, "mean_token_accuracy": 0.11174456626176835, "num_tokens": 1724583.0, "step": 830 }, { "entropy": 6.793128204345703, "epoch": 0.07574383164005806, "grad_norm": 1.3984375, "learning_rate": 0.000417, "loss": 6.4998, "mean_token_accuracy": 0.12149128615856171, "num_tokens": 1735293.0, "step": 835 }, { "entropy": 6.784815979003906, "epoch": 0.07619738751814223, "grad_norm": 1.03125, "learning_rate": 0.0004195, "loss": 6.5285, "mean_token_accuracy": 0.11545130759477615, "num_tokens": 1745623.0, "step": 840 }, { "entropy": 6.785441732406616, "epoch": 0.07665094339622641, "grad_norm": 0.8984375, "learning_rate": 0.000422, "loss": 6.5589, "mean_token_accuracy": 0.11196033582091332, "num_tokens": 1755713.0, "step": 845 }, { "entropy": 6.844113492965699, "epoch": 0.0771044992743106, "grad_norm": 1.2890625, "learning_rate": 0.0004245, "loss": 6.5448, "mean_token_accuracy": 0.11228399202227593, "num_tokens": 1765264.0, "step": 850 }, { "entropy": 6.778715133666992, "epoch": 0.07755805515239478, "grad_norm": 1.1640625, "learning_rate": 0.000427, "loss": 6.5551, "mean_token_accuracy": 0.11371968314051628, "num_tokens": 1775769.0, "step": 855 }, { "entropy": 6.709914636611939, "epoch": 0.07801161103047896, "grad_norm": 1.1015625, "learning_rate": 0.0004295, "loss": 6.4821, "mean_token_accuracy": 0.11689155176281929, "num_tokens": 1786245.0, "step": 860 }, { "entropy": 6.716907548904419, "epoch": 0.07846516690856313, "grad_norm": 1.21875, "learning_rate": 0.000432, "loss": 6.5182, "mean_token_accuracy": 0.12198375314474105, "num_tokens": 1796040.0, "step": 865 }, { "entropy": 6.72428708076477, "epoch": 0.07891872278664731, "grad_norm": 1.0078125, "learning_rate": 0.0004345, "loss": 6.5268, "mean_token_accuracy": 0.11597820520401, "num_tokens": 1806007.0, "step": 870 }, { "entropy": 6.862047719955444, "epoch": 0.0793722786647315, "grad_norm": 1.109375, "learning_rate": 0.000437, "loss": 6.6034, "mean_token_accuracy": 0.11016635000705718, "num_tokens": 1816935.0, "step": 875 }, { "entropy": 6.7226348400115965, "epoch": 0.07982583454281568, "grad_norm": 1.234375, "learning_rate": 0.0004395, "loss": 6.4647, "mean_token_accuracy": 0.11464838534593583, "num_tokens": 1827419.0, "step": 880 }, { "entropy": 6.80533652305603, "epoch": 0.08027939042089985, "grad_norm": 1.3515625, "learning_rate": 0.000442, "loss": 6.5762, "mean_token_accuracy": 0.11279575228691101, "num_tokens": 1837933.0, "step": 885 }, { "entropy": 6.692126846313476, "epoch": 0.08073294629898403, "grad_norm": 1.0703125, "learning_rate": 0.0004445, "loss": 6.6181, "mean_token_accuracy": 0.11968202516436577, "num_tokens": 1848551.0, "step": 890 }, { "entropy": 6.773914003372193, "epoch": 0.08118650217706821, "grad_norm": 1.2578125, "learning_rate": 0.000447, "loss": 6.4874, "mean_token_accuracy": 0.11803188994526863, "num_tokens": 1858380.0, "step": 895 }, { "entropy": 6.64626522064209, "epoch": 0.0816400580551524, "grad_norm": 1.0859375, "learning_rate": 0.00044950000000000003, "loss": 6.4255, "mean_token_accuracy": 0.11616697832942009, "num_tokens": 1868291.0, "step": 900 }, { "entropy": 6.739772891998291, "epoch": 0.08209361393323658, "grad_norm": 1.234375, "learning_rate": 0.00045200000000000004, "loss": 6.5222, "mean_token_accuracy": 0.11596911773085594, "num_tokens": 1879219.0, "step": 905 }, { "entropy": 6.701965379714966, "epoch": 0.08254716981132075, "grad_norm": 0.96875, "learning_rate": 0.00045450000000000004, "loss": 6.5064, "mean_token_accuracy": 0.1169955737888813, "num_tokens": 1889809.0, "step": 910 }, { "entropy": 6.736312532424927, "epoch": 0.08300072568940493, "grad_norm": 1.0546875, "learning_rate": 0.00045700000000000005, "loss": 6.4667, "mean_token_accuracy": 0.11598963215947151, "num_tokens": 1899986.0, "step": 915 }, { "entropy": 6.627064943313599, "epoch": 0.08345428156748912, "grad_norm": 1.0390625, "learning_rate": 0.00045950000000000006, "loss": 6.4631, "mean_token_accuracy": 0.11359920203685761, "num_tokens": 1909314.0, "step": 920 }, { "entropy": 6.714141511917115, "epoch": 0.0839078374455733, "grad_norm": 1.078125, "learning_rate": 0.000462, "loss": 6.4954, "mean_token_accuracy": 0.1206825278699398, "num_tokens": 1918443.0, "step": 925 }, { "entropy": 6.711059856414795, "epoch": 0.08436139332365747, "grad_norm": 1.140625, "learning_rate": 0.0004645, "loss": 6.4599, "mean_token_accuracy": 0.11760578602552414, "num_tokens": 1928683.0, "step": 930 }, { "entropy": 6.563105583190918, "epoch": 0.08481494920174165, "grad_norm": 1.109375, "learning_rate": 0.000467, "loss": 6.3733, "mean_token_accuracy": 0.11783806160092354, "num_tokens": 1938293.0, "step": 935 }, { "entropy": 6.621684551239014, "epoch": 0.08526850507982583, "grad_norm": 1.03125, "learning_rate": 0.0004695, "loss": 6.4649, "mean_token_accuracy": 0.1159488506615162, "num_tokens": 1948233.0, "step": 940 }, { "entropy": 6.703399705886841, "epoch": 0.08572206095791002, "grad_norm": 1.0390625, "learning_rate": 0.000472, "loss": 6.3795, "mean_token_accuracy": 0.12225733622908593, "num_tokens": 1958611.0, "step": 945 }, { "entropy": 6.67765588760376, "epoch": 0.0861756168359942, "grad_norm": 1.03125, "learning_rate": 0.0004745, "loss": 6.5279, "mean_token_accuracy": 0.12170163914561272, "num_tokens": 1968957.0, "step": 950 }, { "entropy": 6.721297121047973, "epoch": 0.08662917271407837, "grad_norm": 1.203125, "learning_rate": 0.000477, "loss": 6.4022, "mean_token_accuracy": 0.12271194607019424, "num_tokens": 1978503.0, "step": 955 }, { "entropy": 6.51479959487915, "epoch": 0.08708272859216255, "grad_norm": 1.09375, "learning_rate": 0.0004795, "loss": 6.3838, "mean_token_accuracy": 0.12056222185492516, "num_tokens": 1988458.0, "step": 960 }, { "entropy": 6.663824939727784, "epoch": 0.08753628447024674, "grad_norm": 1.0703125, "learning_rate": 0.000482, "loss": 6.5235, "mean_token_accuracy": 0.1133016251027584, "num_tokens": 1999984.0, "step": 965 }, { "entropy": 6.534238243103028, "epoch": 0.08798984034833092, "grad_norm": 1.1171875, "learning_rate": 0.0004845, "loss": 6.38, "mean_token_accuracy": 0.12614745199680327, "num_tokens": 2010645.0, "step": 970 }, { "entropy": 6.69314603805542, "epoch": 0.08844339622641509, "grad_norm": 1.1953125, "learning_rate": 0.000487, "loss": 6.4879, "mean_token_accuracy": 0.11517181396484374, "num_tokens": 2020196.0, "step": 975 }, { "entropy": 6.586405944824219, "epoch": 0.08889695210449927, "grad_norm": 1.078125, "learning_rate": 0.0004895, "loss": 6.3749, "mean_token_accuracy": 0.12108265981078148, "num_tokens": 2030101.0, "step": 980 }, { "entropy": 6.620171546936035, "epoch": 0.08935050798258345, "grad_norm": 1.03125, "learning_rate": 0.000492, "loss": 6.4594, "mean_token_accuracy": 0.1197955846786499, "num_tokens": 2040454.0, "step": 985 }, { "entropy": 6.581764078140258, "epoch": 0.08980406386066764, "grad_norm": 1.09375, "learning_rate": 0.0004945, "loss": 6.402, "mean_token_accuracy": 0.1192368857562542, "num_tokens": 2050378.0, "step": 990 }, { "entropy": 6.651663303375244, "epoch": 0.09025761973875182, "grad_norm": 1.0546875, "learning_rate": 0.000497, "loss": 6.4549, "mean_token_accuracy": 0.11869885623455048, "num_tokens": 2060282.0, "step": 995 }, { "entropy": 6.589950847625732, "epoch": 0.09071117561683599, "grad_norm": 1.2109375, "learning_rate": 0.0004995, "loss": 6.4433, "mean_token_accuracy": 0.12011284530162811, "num_tokens": 2070563.0, "step": 1000 }, { "entropy": 6.661682939529419, "epoch": 0.09116473149492017, "grad_norm": 1.015625, "learning_rate": 0.0004999999985110217, "loss": 6.5128, "mean_token_accuracy": 0.11984694451093673, "num_tokens": 2080153.0, "step": 1005 }, { "entropy": 6.546395254135132, "epoch": 0.09161828737300436, "grad_norm": 0.9453125, "learning_rate": 0.0004999999924620471, "loss": 6.3602, "mean_token_accuracy": 0.12557145729660987, "num_tokens": 2090590.0, "step": 1010 }, { "entropy": 6.653158855438233, "epoch": 0.09207184325108854, "grad_norm": 0.953125, "learning_rate": 0.0004999999817600155, "loss": 6.4314, "mean_token_accuracy": 0.11608105525374413, "num_tokens": 2101945.0, "step": 1015 }, { "entropy": 6.635874509811401, "epoch": 0.09252539912917271, "grad_norm": 0.98046875, "learning_rate": 0.0004999999664049268, "loss": 6.4312, "mean_token_accuracy": 0.12001314610242844, "num_tokens": 2112514.0, "step": 1020 }, { "entropy": 6.546846055984497, "epoch": 0.09297895500725689, "grad_norm": 1.40625, "learning_rate": 0.0004999999463967816, "loss": 6.3852, "mean_token_accuracy": 0.11658050194382667, "num_tokens": 2122296.0, "step": 1025 }, { "entropy": 6.713669490814209, "epoch": 0.09343251088534107, "grad_norm": 0.87109375, "learning_rate": 0.00049999992173558, "loss": 6.5311, "mean_token_accuracy": 0.10938856825232506, "num_tokens": 2134512.0, "step": 1030 }, { "entropy": 6.649443817138672, "epoch": 0.09388606676342526, "grad_norm": 1.1875, "learning_rate": 0.0004999998924213228, "loss": 6.4339, "mean_token_accuracy": 0.12238849774003029, "num_tokens": 2143934.0, "step": 1035 }, { "entropy": 6.488268947601318, "epoch": 0.09433962264150944, "grad_norm": 1.0078125, "learning_rate": 0.0004999998584540105, "loss": 6.3351, "mean_token_accuracy": 0.11762306764721871, "num_tokens": 2155730.0, "step": 1040 }, { "entropy": 6.570074510574341, "epoch": 0.09479317851959361, "grad_norm": 0.98828125, "learning_rate": 0.0004999998198336437, "loss": 6.3681, "mean_token_accuracy": 0.11555026769638062, "num_tokens": 2166422.0, "step": 1045 }, { "entropy": 6.646327686309815, "epoch": 0.09524673439767779, "grad_norm": 0.9609375, "learning_rate": 0.0004999997765602233, "loss": 6.469, "mean_token_accuracy": 0.11361956149339676, "num_tokens": 2177842.0, "step": 1050 }, { "entropy": 6.617121315002441, "epoch": 0.09570029027576198, "grad_norm": 0.984375, "learning_rate": 0.0004999997286337502, "loss": 6.5398, "mean_token_accuracy": 0.11744040250778198, "num_tokens": 2188614.0, "step": 1055 }, { "entropy": 6.604910278320313, "epoch": 0.09615384615384616, "grad_norm": 1.1328125, "learning_rate": 0.0004999996760542254, "loss": 6.3246, "mean_token_accuracy": 0.12567146718502045, "num_tokens": 2197886.0, "step": 1060 }, { "entropy": 6.525793075561523, "epoch": 0.09660740203193033, "grad_norm": 1.0234375, "learning_rate": 0.00049999961882165, "loss": 6.3772, "mean_token_accuracy": 0.12232817932963372, "num_tokens": 2209930.0, "step": 1065 }, { "entropy": 6.564913749694824, "epoch": 0.09706095791001451, "grad_norm": 1.0, "learning_rate": 0.0004999995569360251, "loss": 6.3959, "mean_token_accuracy": 0.11825868040323258, "num_tokens": 2219767.0, "step": 1070 }, { "entropy": 6.555662298202515, "epoch": 0.0975145137880987, "grad_norm": 0.94921875, "learning_rate": 0.000499999490397352, "loss": 6.3192, "mean_token_accuracy": 0.121416836977005, "num_tokens": 2230082.0, "step": 1075 }, { "entropy": 6.495458173751831, "epoch": 0.09796806966618288, "grad_norm": 1.078125, "learning_rate": 0.0004999994192056321, "loss": 6.3673, "mean_token_accuracy": 0.12748734578490256, "num_tokens": 2240066.0, "step": 1080 }, { "entropy": 6.524483871459961, "epoch": 0.09842162554426705, "grad_norm": 0.9765625, "learning_rate": 0.0004999993433608669, "loss": 6.3942, "mean_token_accuracy": 0.11839633882045746, "num_tokens": 2250732.0, "step": 1085 }, { "entropy": 6.593288707733154, "epoch": 0.09887518142235123, "grad_norm": 0.96875, "learning_rate": 0.0004999992628630579, "loss": 6.2797, "mean_token_accuracy": 0.12327790930867195, "num_tokens": 2261452.0, "step": 1090 }, { "entropy": 6.485133695602417, "epoch": 0.09932873730043541, "grad_norm": 0.9453125, "learning_rate": 0.0004999991777122069, "loss": 6.3782, "mean_token_accuracy": 0.12279095351696015, "num_tokens": 2271929.0, "step": 1095 }, { "entropy": 6.531335401535034, "epoch": 0.0997822931785196, "grad_norm": 0.9921875, "learning_rate": 0.0004999990879083156, "loss": 6.3604, "mean_token_accuracy": 0.12319791615009308, "num_tokens": 2282987.0, "step": 1100 }, { "entropy": 6.444648933410645, "epoch": 0.10023584905660378, "grad_norm": 1.046875, "learning_rate": 0.0004999989934513857, "loss": 6.3295, "mean_token_accuracy": 0.12565099447965622, "num_tokens": 2292796.0, "step": 1105 }, { "entropy": 6.598123359680176, "epoch": 0.10068940493468795, "grad_norm": 1.109375, "learning_rate": 0.0004999988943414193, "loss": 6.3766, "mean_token_accuracy": 0.12076297253370286, "num_tokens": 2303057.0, "step": 1110 }, { "entropy": 6.4050017356872555, "epoch": 0.10114296081277213, "grad_norm": 1.109375, "learning_rate": 0.0004999987905784184, "loss": 6.3638, "mean_token_accuracy": 0.12473835423588753, "num_tokens": 2314168.0, "step": 1115 }, { "entropy": 6.548490381240844, "epoch": 0.10159651669085631, "grad_norm": 0.98828125, "learning_rate": 0.0004999986821623853, "loss": 6.335, "mean_token_accuracy": 0.12088372111320496, "num_tokens": 2325241.0, "step": 1120 }, { "entropy": 6.579931640625, "epoch": 0.1020500725689405, "grad_norm": 1.125, "learning_rate": 0.0004999985690933219, "loss": 6.3584, "mean_token_accuracy": 0.12107386961579322, "num_tokens": 2334866.0, "step": 1125 }, { "entropy": 6.416501808166504, "epoch": 0.10250362844702467, "grad_norm": 1.1171875, "learning_rate": 0.0004999984513712311, "loss": 6.366, "mean_token_accuracy": 0.12216197848320007, "num_tokens": 2345422.0, "step": 1130 }, { "entropy": 6.573203802108765, "epoch": 0.10295718432510885, "grad_norm": 1.1796875, "learning_rate": 0.0004999983289961146, "loss": 6.3667, "mean_token_accuracy": 0.12462597936391831, "num_tokens": 2356285.0, "step": 1135 }, { "entropy": 6.414275217056274, "epoch": 0.10341074020319303, "grad_norm": 1.109375, "learning_rate": 0.0004999982019679755, "loss": 6.2962, "mean_token_accuracy": 0.12918335497379302, "num_tokens": 2366861.0, "step": 1140 }, { "entropy": 6.546162033081055, "epoch": 0.10386429608127722, "grad_norm": 0.9609375, "learning_rate": 0.0004999980702868164, "loss": 6.3186, "mean_token_accuracy": 0.12778222039341927, "num_tokens": 2376851.0, "step": 1145 }, { "entropy": 6.468019723892212, "epoch": 0.1043178519593614, "grad_norm": 0.96875, "learning_rate": 0.0004999979339526396, "loss": 6.3967, "mean_token_accuracy": 0.12601374089717865, "num_tokens": 2386857.0, "step": 1150 }, { "entropy": 6.512000989913941, "epoch": 0.10477140783744557, "grad_norm": 0.953125, "learning_rate": 0.0004999977929654484, "loss": 6.3197, "mean_token_accuracy": 0.12597798183560371, "num_tokens": 2397035.0, "step": 1155 }, { "entropy": 6.556376361846924, "epoch": 0.10522496371552975, "grad_norm": 1.3359375, "learning_rate": 0.0004999976473252453, "loss": 6.3936, "mean_token_accuracy": 0.12374778017401696, "num_tokens": 2408177.0, "step": 1160 }, { "entropy": 6.569843435287476, "epoch": 0.10567851959361393, "grad_norm": 0.96484375, "learning_rate": 0.0004999974970320338, "loss": 6.342, "mean_token_accuracy": 0.12336181774735451, "num_tokens": 2418445.0, "step": 1165 }, { "entropy": 6.446996784210205, "epoch": 0.10613207547169812, "grad_norm": 1.0859375, "learning_rate": 0.0004999973420858165, "loss": 6.3375, "mean_token_accuracy": 0.12320749461650848, "num_tokens": 2428990.0, "step": 1170 }, { "entropy": 6.456551933288575, "epoch": 0.10658563134978229, "grad_norm": 1.015625, "learning_rate": 0.0004999971824865968, "loss": 6.3706, "mean_token_accuracy": 0.11951386407017708, "num_tokens": 2439643.0, "step": 1175 }, { "entropy": 6.636844635009766, "epoch": 0.10703918722786647, "grad_norm": 0.9296875, "learning_rate": 0.0004999970182343782, "loss": 6.4152, "mean_token_accuracy": 0.12312159314751625, "num_tokens": 2450691.0, "step": 1180 }, { "entropy": 6.513713598251343, "epoch": 0.10749274310595065, "grad_norm": 0.9765625, "learning_rate": 0.0004999968493291638, "loss": 6.3519, "mean_token_accuracy": 0.12444976568222046, "num_tokens": 2460706.0, "step": 1185 }, { "entropy": 6.332309865951538, "epoch": 0.10794629898403484, "grad_norm": 0.9453125, "learning_rate": 0.0004999966757709573, "loss": 6.2426, "mean_token_accuracy": 0.13491440415382386, "num_tokens": 2470947.0, "step": 1190 }, { "entropy": 6.500934410095215, "epoch": 0.10839985486211902, "grad_norm": 1.0625, "learning_rate": 0.0004999964975597622, "loss": 6.2077, "mean_token_accuracy": 0.12923589274287223, "num_tokens": 2481132.0, "step": 1195 }, { "entropy": 6.5095055103302, "epoch": 0.10885341074020319, "grad_norm": 1.0546875, "learning_rate": 0.0004999963146955821, "loss": 6.2492, "mean_token_accuracy": 0.12882558181881903, "num_tokens": 2491701.0, "step": 1200 }, { "entropy": 6.308234691619873, "epoch": 0.10930696661828737, "grad_norm": 0.92578125, "learning_rate": 0.000499996127178421, "loss": 6.3173, "mean_token_accuracy": 0.1222999058663845, "num_tokens": 2502360.0, "step": 1205 }, { "entropy": 6.526607275009155, "epoch": 0.10976052249637155, "grad_norm": 1.03125, "learning_rate": 0.0004999959350082825, "loss": 6.2211, "mean_token_accuracy": 0.1294765926897526, "num_tokens": 2512140.0, "step": 1210 }, { "entropy": 6.4609130859375, "epoch": 0.11021407837445574, "grad_norm": 1.0859375, "learning_rate": 0.0004999957381851709, "loss": 6.3314, "mean_token_accuracy": 0.12224320769309997, "num_tokens": 2522721.0, "step": 1215 }, { "entropy": 6.3936292171478275, "epoch": 0.1106676342525399, "grad_norm": 1.1015625, "learning_rate": 0.0004999955367090901, "loss": 6.1999, "mean_token_accuracy": 0.1303488314151764, "num_tokens": 2531786.0, "step": 1220 }, { "entropy": 6.481017780303955, "epoch": 0.11112119013062409, "grad_norm": 1.1015625, "learning_rate": 0.0004999953305800441, "loss": 6.3062, "mean_token_accuracy": 0.12003768384456634, "num_tokens": 2542895.0, "step": 1225 }, { "entropy": 6.442375755310058, "epoch": 0.11157474600870827, "grad_norm": 1.015625, "learning_rate": 0.0004999951197980374, "loss": 6.305, "mean_token_accuracy": 0.12665605992078782, "num_tokens": 2554120.0, "step": 1230 }, { "entropy": 6.489529991149903, "epoch": 0.11202830188679246, "grad_norm": 0.9453125, "learning_rate": 0.0004999949043630744, "loss": 6.3339, "mean_token_accuracy": 0.12409112006425857, "num_tokens": 2563935.0, "step": 1235 }, { "entropy": 6.3626786231994625, "epoch": 0.11248185776487664, "grad_norm": 1.0859375, "learning_rate": 0.0004999946842751593, "loss": 6.2477, "mean_token_accuracy": 0.1251929335296154, "num_tokens": 2574465.0, "step": 1240 }, { "entropy": 6.431154251098633, "epoch": 0.11293541364296081, "grad_norm": 0.9765625, "learning_rate": 0.0004999944595342968, "loss": 6.2144, "mean_token_accuracy": 0.12585682272911072, "num_tokens": 2584694.0, "step": 1245 }, { "entropy": 6.402558374404907, "epoch": 0.11338896952104499, "grad_norm": 0.96875, "learning_rate": 0.0004999942301404916, "loss": 6.1836, "mean_token_accuracy": 0.1319870851933956, "num_tokens": 2594540.0, "step": 1250 }, { "entropy": 6.334234380722046, "epoch": 0.11384252539912917, "grad_norm": 1.0703125, "learning_rate": 0.0004999939960937484, "loss": 6.1343, "mean_token_accuracy": 0.1355540633201599, "num_tokens": 2604896.0, "step": 1255 }, { "entropy": 6.494117069244385, "epoch": 0.11429608127721336, "grad_norm": 1.09375, "learning_rate": 0.0004999937573940721, "loss": 6.2886, "mean_token_accuracy": 0.1345356211066246, "num_tokens": 2614143.0, "step": 1260 }, { "entropy": 6.274349880218506, "epoch": 0.11474963715529753, "grad_norm": 1.125, "learning_rate": 0.0004999935140414674, "loss": 6.1951, "mean_token_accuracy": 0.12857473343610765, "num_tokens": 2623999.0, "step": 1265 }, { "entropy": 6.511336469650269, "epoch": 0.11520319303338171, "grad_norm": 0.984375, "learning_rate": 0.0004999932660359395, "loss": 6.4052, "mean_token_accuracy": 0.12467710450291633, "num_tokens": 2636208.0, "step": 1270 }, { "entropy": 6.449693775177002, "epoch": 0.11565674891146589, "grad_norm": 1.015625, "learning_rate": 0.0004999930133774936, "loss": 6.2795, "mean_token_accuracy": 0.13579537123441696, "num_tokens": 2645854.0, "step": 1275 }, { "entropy": 6.469302797317505, "epoch": 0.11611030478955008, "grad_norm": 1.046875, "learning_rate": 0.0004999927560661348, "loss": 6.2593, "mean_token_accuracy": 0.1359974443912506, "num_tokens": 2655877.0, "step": 1280 }, { "entropy": 6.474381637573242, "epoch": 0.11656386066763426, "grad_norm": 0.98828125, "learning_rate": 0.0004999924941018685, "loss": 6.2797, "mean_token_accuracy": 0.1305759347975254, "num_tokens": 2666157.0, "step": 1285 }, { "entropy": 6.2998865127563475, "epoch": 0.11701741654571843, "grad_norm": 1.0234375, "learning_rate": 0.0004999922274847, "loss": 6.1961, "mean_token_accuracy": 0.13332010209560394, "num_tokens": 2676647.0, "step": 1290 }, { "entropy": 6.388902854919434, "epoch": 0.11747097242380261, "grad_norm": 1.046875, "learning_rate": 0.000499991956214635, "loss": 6.2308, "mean_token_accuracy": 0.14106824845075608, "num_tokens": 2686417.0, "step": 1295 }, { "entropy": 6.417198610305786, "epoch": 0.1179245283018868, "grad_norm": 0.94140625, "learning_rate": 0.000499991680291679, "loss": 6.2281, "mean_token_accuracy": 0.12554471418261529, "num_tokens": 2697540.0, "step": 1300 }, { "entropy": 6.371242427825928, "epoch": 0.11837808417997098, "grad_norm": 0.953125, "learning_rate": 0.0004999913997158378, "loss": 6.2766, "mean_token_accuracy": 0.12081151455640793, "num_tokens": 2709397.0, "step": 1305 }, { "entropy": 6.381704521179199, "epoch": 0.11883164005805515, "grad_norm": 0.95703125, "learning_rate": 0.0004999911144871169, "loss": 6.2198, "mean_token_accuracy": 0.12881449088454247, "num_tokens": 2720430.0, "step": 1310 }, { "entropy": 6.3669020652771, "epoch": 0.11928519593613933, "grad_norm": 1.0546875, "learning_rate": 0.0004999908246055226, "loss": 6.1855, "mean_token_accuracy": 0.1260046534240246, "num_tokens": 2730648.0, "step": 1315 }, { "entropy": 6.3640461444854735, "epoch": 0.11973875181422351, "grad_norm": 1.0, "learning_rate": 0.0004999905300710607, "loss": 6.1767, "mean_token_accuracy": 0.12971787378191948, "num_tokens": 2739979.0, "step": 1320 }, { "entropy": 6.467068099975586, "epoch": 0.1201923076923077, "grad_norm": 1.234375, "learning_rate": 0.0004999902308837373, "loss": 6.3039, "mean_token_accuracy": 0.12591902986168862, "num_tokens": 2750329.0, "step": 1325 }, { "entropy": 6.297173976898193, "epoch": 0.12064586357039188, "grad_norm": 0.98828125, "learning_rate": 0.0004999899270435584, "loss": 6.1752, "mean_token_accuracy": 0.1377357542514801, "num_tokens": 2760535.0, "step": 1330 }, { "entropy": 6.402283620834351, "epoch": 0.12109941944847605, "grad_norm": 1.0234375, "learning_rate": 0.0004999896185505307, "loss": 6.2099, "mean_token_accuracy": 0.1282433770596981, "num_tokens": 2770470.0, "step": 1335 }, { "entropy": 6.357119464874268, "epoch": 0.12155297532656023, "grad_norm": 0.9609375, "learning_rate": 0.0004999893054046603, "loss": 6.2395, "mean_token_accuracy": 0.12727272063493728, "num_tokens": 2781506.0, "step": 1340 }, { "entropy": 6.281704378128052, "epoch": 0.12200653120464441, "grad_norm": 1.0234375, "learning_rate": 0.0004999889876059537, "loss": 6.0945, "mean_token_accuracy": 0.1367440052330494, "num_tokens": 2791245.0, "step": 1345 }, { "entropy": 6.390601301193238, "epoch": 0.1224600870827286, "grad_norm": 0.9921875, "learning_rate": 0.0004999886651544176, "loss": 6.1272, "mean_token_accuracy": 0.13428937569260596, "num_tokens": 2801680.0, "step": 1350 }, { "entropy": 6.298570585250855, "epoch": 0.12291364296081277, "grad_norm": 1.078125, "learning_rate": 0.0004999883380500584, "loss": 6.2077, "mean_token_accuracy": 0.13555841743946076, "num_tokens": 2812805.0, "step": 1355 }, { "entropy": 6.452785491943359, "epoch": 0.12336719883889695, "grad_norm": 0.9609375, "learning_rate": 0.0004999880062928831, "loss": 6.2401, "mean_token_accuracy": 0.12772336453199387, "num_tokens": 2822834.0, "step": 1360 }, { "entropy": 6.322773456573486, "epoch": 0.12382075471698113, "grad_norm": 0.96484375, "learning_rate": 0.0004999876698828985, "loss": 6.1829, "mean_token_accuracy": 0.1308009184896946, "num_tokens": 2832312.0, "step": 1365 }, { "entropy": 6.387462949752807, "epoch": 0.12427431059506532, "grad_norm": 0.9375, "learning_rate": 0.0004999873288201116, "loss": 6.1993, "mean_token_accuracy": 0.13682973608374596, "num_tokens": 2842998.0, "step": 1370 }, { "entropy": 6.381214332580567, "epoch": 0.1247278664731495, "grad_norm": 1.3203125, "learning_rate": 0.0004999869831045294, "loss": 6.2182, "mean_token_accuracy": 0.1281896151602268, "num_tokens": 2854218.0, "step": 1375 }, { "entropy": 6.274281024932861, "epoch": 0.12518142235123367, "grad_norm": 0.9921875, "learning_rate": 0.0004999866327361589, "loss": 6.1073, "mean_token_accuracy": 0.13887619599699974, "num_tokens": 2864484.0, "step": 1380 }, { "entropy": 6.392649173736572, "epoch": 0.12563497822931785, "grad_norm": 1.0234375, "learning_rate": 0.0004999862777150077, "loss": 6.2187, "mean_token_accuracy": 0.13294630274176597, "num_tokens": 2873800.0, "step": 1385 }, { "entropy": 6.378524923324585, "epoch": 0.12608853410740203, "grad_norm": 0.9140625, "learning_rate": 0.0004999859180410829, "loss": 6.2196, "mean_token_accuracy": 0.12941672652959824, "num_tokens": 2884247.0, "step": 1390 }, { "entropy": 6.3022987842559814, "epoch": 0.12654208998548622, "grad_norm": 0.953125, "learning_rate": 0.0004999855537143919, "loss": 6.1277, "mean_token_accuracy": 0.13321435153484346, "num_tokens": 2894739.0, "step": 1395 }, { "entropy": 6.330821084976196, "epoch": 0.1269956458635704, "grad_norm": 0.98828125, "learning_rate": 0.0004999851847349425, "loss": 6.2018, "mean_token_accuracy": 0.13309190422296524, "num_tokens": 2904376.0, "step": 1400 }, { "entropy": 6.41134204864502, "epoch": 0.12744920174165458, "grad_norm": 0.96875, "learning_rate": 0.0004999848111027419, "loss": 6.2438, "mean_token_accuracy": 0.12967129945755004, "num_tokens": 2914304.0, "step": 1405 }, { "entropy": 6.346340560913086, "epoch": 0.12790275761973874, "grad_norm": 1.015625, "learning_rate": 0.0004999844328177983, "loss": 6.1142, "mean_token_accuracy": 0.13302754908800124, "num_tokens": 2924400.0, "step": 1410 }, { "entropy": 6.468166971206665, "epoch": 0.12835631349782292, "grad_norm": 1.0, "learning_rate": 0.0004999840498801191, "loss": 6.3637, "mean_token_accuracy": 0.13450959250330924, "num_tokens": 2935040.0, "step": 1415 }, { "entropy": 6.250949144363403, "epoch": 0.1288098693759071, "grad_norm": 0.9296875, "learning_rate": 0.0004999836622897126, "loss": 6.139, "mean_token_accuracy": 0.13291264548897744, "num_tokens": 2945536.0, "step": 1420 }, { "entropy": 6.240394401550293, "epoch": 0.1292634252539913, "grad_norm": 1.0390625, "learning_rate": 0.0004999832700465865, "loss": 6.0631, "mean_token_accuracy": 0.13600366339087486, "num_tokens": 2954969.0, "step": 1425 }, { "entropy": 6.372559261322022, "epoch": 0.12971698113207547, "grad_norm": 0.91015625, "learning_rate": 0.0004999828731507491, "loss": 6.1846, "mean_token_accuracy": 0.13019020035862922, "num_tokens": 2966218.0, "step": 1430 }, { "entropy": 6.348944854736328, "epoch": 0.13017053701015965, "grad_norm": 1.03125, "learning_rate": 0.0004999824716022085, "loss": 6.2124, "mean_token_accuracy": 0.12568282783031465, "num_tokens": 2976640.0, "step": 1435 }, { "entropy": 6.317825126647949, "epoch": 0.13062409288824384, "grad_norm": 1.0546875, "learning_rate": 0.0004999820654009731, "loss": 6.1754, "mean_token_accuracy": 0.13333930373191832, "num_tokens": 2985883.0, "step": 1440 }, { "entropy": 6.33205885887146, "epoch": 0.13107764876632802, "grad_norm": 0.9453125, "learning_rate": 0.0004999816545470513, "loss": 6.1738, "mean_token_accuracy": 0.1286979652941227, "num_tokens": 2996695.0, "step": 1445 }, { "entropy": 6.338008069992066, "epoch": 0.1315312046444122, "grad_norm": 0.984375, "learning_rate": 0.0004999812390404514, "loss": 6.1786, "mean_token_accuracy": 0.13488187193870543, "num_tokens": 3007500.0, "step": 1450 }, { "entropy": 6.171080303192139, "epoch": 0.13198476052249636, "grad_norm": 0.98828125, "learning_rate": 0.0004999808188811823, "loss": 6.0426, "mean_token_accuracy": 0.13422525823116302, "num_tokens": 3017299.0, "step": 1455 }, { "entropy": 6.42709584236145, "epoch": 0.13243831640058054, "grad_norm": 1.0078125, "learning_rate": 0.0004999803940692524, "loss": 6.3248, "mean_token_accuracy": 0.12495478615164757, "num_tokens": 3028389.0, "step": 1460 }, { "entropy": 6.34055233001709, "epoch": 0.13289187227866472, "grad_norm": 0.98828125, "learning_rate": 0.0004999799646046707, "loss": 6.1313, "mean_token_accuracy": 0.13551339507102966, "num_tokens": 3038883.0, "step": 1465 }, { "entropy": 6.360403776168823, "epoch": 0.1333454281567489, "grad_norm": 0.98828125, "learning_rate": 0.0004999795304874461, "loss": 6.2634, "mean_token_accuracy": 0.13484074100852012, "num_tokens": 3049904.0, "step": 1470 }, { "entropy": 6.292270040512085, "epoch": 0.1337989840348331, "grad_norm": 0.9765625, "learning_rate": 0.0004999790917175873, "loss": 6.0954, "mean_token_accuracy": 0.13213692530989646, "num_tokens": 3059788.0, "step": 1475 }, { "entropy": 6.332358312606812, "epoch": 0.13425253991291727, "grad_norm": 0.96875, "learning_rate": 0.0004999786482951036, "loss": 6.0914, "mean_token_accuracy": 0.13121994063258172, "num_tokens": 3070413.0, "step": 1480 }, { "entropy": 6.2656394958496096, "epoch": 0.13470609579100146, "grad_norm": 0.8203125, "learning_rate": 0.0004999782002200041, "loss": 6.2047, "mean_token_accuracy": 0.1304186299443245, "num_tokens": 3081093.0, "step": 1485 }, { "entropy": 6.334182834625244, "epoch": 0.13515965166908564, "grad_norm": 1.0390625, "learning_rate": 0.0004999777474922982, "loss": 6.1612, "mean_token_accuracy": 0.12822958827018738, "num_tokens": 3090594.0, "step": 1490 }, { "entropy": 6.352655935287475, "epoch": 0.13561320754716982, "grad_norm": 0.9296875, "learning_rate": 0.0004999772901119951, "loss": 6.2409, "mean_token_accuracy": 0.13285785242915155, "num_tokens": 3101061.0, "step": 1495 }, { "entropy": 6.28689432144165, "epoch": 0.13606676342525398, "grad_norm": 0.90234375, "learning_rate": 0.0004999768280791043, "loss": 6.1627, "mean_token_accuracy": 0.13513913974165917, "num_tokens": 3111715.0, "step": 1500 }, { "entropy": 6.282320547103882, "epoch": 0.13652031930333816, "grad_norm": 0.90234375, "learning_rate": 0.0004999763613936352, "loss": 6.0892, "mean_token_accuracy": 0.13638533875346184, "num_tokens": 3121378.0, "step": 1505 }, { "entropy": 6.252392864227295, "epoch": 0.13697387518142234, "grad_norm": 0.9296875, "learning_rate": 0.0004999758900555979, "loss": 6.0183, "mean_token_accuracy": 0.13862146139144899, "num_tokens": 3131229.0, "step": 1510 }, { "entropy": 6.241233825683594, "epoch": 0.13742743105950653, "grad_norm": 1.046875, "learning_rate": 0.0004999754140650017, "loss": 6.1025, "mean_token_accuracy": 0.13484096452593802, "num_tokens": 3140859.0, "step": 1515 }, { "entropy": 6.310092401504517, "epoch": 0.1378809869375907, "grad_norm": 0.94140625, "learning_rate": 0.0004999749334218567, "loss": 6.1048, "mean_token_accuracy": 0.13604142144322395, "num_tokens": 3151692.0, "step": 1520 }, { "entropy": 6.2527360916137695, "epoch": 0.1383345428156749, "grad_norm": 1.0234375, "learning_rate": 0.0004999744481261726, "loss": 6.1801, "mean_token_accuracy": 0.13370710536837577, "num_tokens": 3161879.0, "step": 1525 }, { "entropy": 6.248764514923096, "epoch": 0.13878809869375908, "grad_norm": 1.1015625, "learning_rate": 0.0004999739581779597, "loss": 6.0456, "mean_token_accuracy": 0.1446085900068283, "num_tokens": 3171282.0, "step": 1530 }, { "entropy": 6.270263290405273, "epoch": 0.13924165457184326, "grad_norm": 0.98828125, "learning_rate": 0.000499973463577228, "loss": 6.1068, "mean_token_accuracy": 0.1418723337352276, "num_tokens": 3181398.0, "step": 1535 }, { "entropy": 6.2894738674163815, "epoch": 0.13969521044992744, "grad_norm": 0.97265625, "learning_rate": 0.0004999729643239877, "loss": 6.2273, "mean_token_accuracy": 0.1322890356183052, "num_tokens": 3191431.0, "step": 1540 }, { "entropy": 6.347840642929077, "epoch": 0.1401487663280116, "grad_norm": 0.94921875, "learning_rate": 0.0004999724604182492, "loss": 6.2145, "mean_token_accuracy": 0.12926804050803184, "num_tokens": 3202147.0, "step": 1545 }, { "entropy": 6.323010873794556, "epoch": 0.14060232220609578, "grad_norm": 1.015625, "learning_rate": 0.0004999719518600229, "loss": 6.0864, "mean_token_accuracy": 0.13912193179130555, "num_tokens": 3212428.0, "step": 1550 }, { "entropy": 6.246621894836426, "epoch": 0.14105587808417996, "grad_norm": 0.9921875, "learning_rate": 0.0004999714386493192, "loss": 6.1409, "mean_token_accuracy": 0.1369505174458027, "num_tokens": 3222099.0, "step": 1555 }, { "entropy": 6.316340351104737, "epoch": 0.14150943396226415, "grad_norm": 0.9609375, "learning_rate": 0.0004999709207861489, "loss": 6.0828, "mean_token_accuracy": 0.13749494701623916, "num_tokens": 3232079.0, "step": 1560 }, { "entropy": 6.204212045669555, "epoch": 0.14196298984034833, "grad_norm": 1.0546875, "learning_rate": 0.0004999703982705227, "loss": 6.005, "mean_token_accuracy": 0.14854954034090043, "num_tokens": 3241762.0, "step": 1565 }, { "entropy": 6.180720520019531, "epoch": 0.1424165457184325, "grad_norm": 1.0234375, "learning_rate": 0.0004999698711024513, "loss": 6.0869, "mean_token_accuracy": 0.13718333020806311, "num_tokens": 3252571.0, "step": 1570 }, { "entropy": 6.293680715560913, "epoch": 0.1428701015965167, "grad_norm": 0.93359375, "learning_rate": 0.0004999693392819456, "loss": 6.1328, "mean_token_accuracy": 0.1329519271850586, "num_tokens": 3263542.0, "step": 1575 }, { "entropy": 6.287594938278199, "epoch": 0.14332365747460088, "grad_norm": 1.0, "learning_rate": 0.0004999688028090166, "loss": 6.1936, "mean_token_accuracy": 0.13597823828458785, "num_tokens": 3273295.0, "step": 1580 }, { "entropy": 6.440543842315674, "epoch": 0.14377721335268506, "grad_norm": 1.0078125, "learning_rate": 0.0004999682616836755, "loss": 6.2261, "mean_token_accuracy": 0.1362229973077774, "num_tokens": 3283605.0, "step": 1585 }, { "entropy": 6.197280740737915, "epoch": 0.14423076923076922, "grad_norm": 0.97265625, "learning_rate": 0.0004999677159059334, "loss": 6.0532, "mean_token_accuracy": 0.14048462361097336, "num_tokens": 3293837.0, "step": 1590 }, { "entropy": 6.210299730300903, "epoch": 0.1446843251088534, "grad_norm": 0.90234375, "learning_rate": 0.0004999671654758016, "loss": 6.0692, "mean_token_accuracy": 0.14433105364441873, "num_tokens": 3304131.0, "step": 1595 }, { "entropy": 6.238543367385864, "epoch": 0.14513788098693758, "grad_norm": 1.140625, "learning_rate": 0.0004999666103932915, "loss": 6.1103, "mean_token_accuracy": 0.13127385154366494, "num_tokens": 3313543.0, "step": 1600 }, { "entropy": 6.23192195892334, "epoch": 0.14559143686502177, "grad_norm": 0.91015625, "learning_rate": 0.0004999660506584145, "loss": 6.0745, "mean_token_accuracy": 0.1385864198207855, "num_tokens": 3324487.0, "step": 1605 }, { "entropy": 6.296097135543823, "epoch": 0.14604499274310595, "grad_norm": 0.921875, "learning_rate": 0.0004999654862711823, "loss": 6.1001, "mean_token_accuracy": 0.13781747072935105, "num_tokens": 3335094.0, "step": 1610 }, { "entropy": 6.208214139938354, "epoch": 0.14649854862119013, "grad_norm": 1.03125, "learning_rate": 0.0004999649172316065, "loss": 6.04, "mean_token_accuracy": 0.13336168527603148, "num_tokens": 3344252.0, "step": 1615 }, { "entropy": 6.273281383514404, "epoch": 0.14695210449927432, "grad_norm": 0.9609375, "learning_rate": 0.000499964343539699, "loss": 6.1072, "mean_token_accuracy": 0.1359778583049774, "num_tokens": 3354265.0, "step": 1620 }, { "entropy": 6.312763309478759, "epoch": 0.1474056603773585, "grad_norm": 0.91796875, "learning_rate": 0.0004999637651954714, "loss": 6.2133, "mean_token_accuracy": 0.13838177993893624, "num_tokens": 3364616.0, "step": 1625 }, { "entropy": 6.300515222549438, "epoch": 0.14785921625544268, "grad_norm": 1.0234375, "learning_rate": 0.0004999631821989358, "loss": 6.1601, "mean_token_accuracy": 0.13766503930091858, "num_tokens": 3373650.0, "step": 1630 }, { "entropy": 6.221302127838134, "epoch": 0.14831277213352684, "grad_norm": 1.03125, "learning_rate": 0.0004999625945501043, "loss": 6.0573, "mean_token_accuracy": 0.1438056230545044, "num_tokens": 3384590.0, "step": 1635 }, { "entropy": 6.271721410751343, "epoch": 0.14876632801161102, "grad_norm": 1.0546875, "learning_rate": 0.000499962002248989, "loss": 6.0793, "mean_token_accuracy": 0.13807034716010094, "num_tokens": 3395616.0, "step": 1640 }, { "entropy": 6.2336437702178955, "epoch": 0.1492198838896952, "grad_norm": 0.91015625, "learning_rate": 0.0004999614052956024, "loss": 6.0885, "mean_token_accuracy": 0.13720295056700707, "num_tokens": 3405810.0, "step": 1645 }, { "entropy": 6.2871723651885985, "epoch": 0.1496734397677794, "grad_norm": 0.9375, "learning_rate": 0.0004999608036899563, "loss": 6.1248, "mean_token_accuracy": 0.13411571234464645, "num_tokens": 3415932.0, "step": 1650 }, { "entropy": 6.227649116516114, "epoch": 0.15012699564586357, "grad_norm": 1.0546875, "learning_rate": 0.0004999601974320636, "loss": 6.0773, "mean_token_accuracy": 0.13326597362756729, "num_tokens": 3425626.0, "step": 1655 }, { "entropy": 6.198207044601441, "epoch": 0.15058055152394775, "grad_norm": 1.078125, "learning_rate": 0.0004999595865219367, "loss": 6.098, "mean_token_accuracy": 0.13101402595639228, "num_tokens": 3434837.0, "step": 1660 }, { "entropy": 6.252737283706665, "epoch": 0.15103410740203194, "grad_norm": 1.0, "learning_rate": 0.0004999589709595881, "loss": 6.0898, "mean_token_accuracy": 0.14350827634334565, "num_tokens": 3445238.0, "step": 1665 }, { "entropy": 6.187345504760742, "epoch": 0.15148766328011612, "grad_norm": 0.89453125, "learning_rate": 0.0004999583507450308, "loss": 6.0692, "mean_token_accuracy": 0.13529428243637084, "num_tokens": 3456738.0, "step": 1670 }, { "entropy": 6.133850383758545, "epoch": 0.1519412191582003, "grad_norm": 0.9140625, "learning_rate": 0.0004999577258782774, "loss": 5.9664, "mean_token_accuracy": 0.13891834691166877, "num_tokens": 3466296.0, "step": 1675 }, { "entropy": 6.328598546981811, "epoch": 0.15239477503628446, "grad_norm": 0.95703125, "learning_rate": 0.000499957096359341, "loss": 6.1502, "mean_token_accuracy": 0.13001871183514596, "num_tokens": 3476989.0, "step": 1680 }, { "entropy": 6.21191725730896, "epoch": 0.15284833091436864, "grad_norm": 1.078125, "learning_rate": 0.0004999564621882343, "loss": 5.9815, "mean_token_accuracy": 0.14194255620241164, "num_tokens": 3487050.0, "step": 1685 }, { "entropy": 6.256222677230835, "epoch": 0.15330188679245282, "grad_norm": 0.9375, "learning_rate": 0.0004999558233649708, "loss": 6.2052, "mean_token_accuracy": 0.1338474340736866, "num_tokens": 3497777.0, "step": 1690 }, { "entropy": 6.257563257217408, "epoch": 0.153755442670537, "grad_norm": 0.90625, "learning_rate": 0.0004999551798895636, "loss": 6.1012, "mean_token_accuracy": 0.13192513063549996, "num_tokens": 3509066.0, "step": 1695 }, { "entropy": 6.171849775314331, "epoch": 0.1542089985486212, "grad_norm": 0.9609375, "learning_rate": 0.0004999545317620258, "loss": 6.0377, "mean_token_accuracy": 0.13509414941072465, "num_tokens": 3519567.0, "step": 1700 }, { "entropy": 6.180337810516358, "epoch": 0.15466255442670537, "grad_norm": 0.87890625, "learning_rate": 0.0004999538789823711, "loss": 6.0677, "mean_token_accuracy": 0.1376472532749176, "num_tokens": 3529402.0, "step": 1705 }, { "entropy": 6.29026083946228, "epoch": 0.15511611030478956, "grad_norm": 0.9609375, "learning_rate": 0.0004999532215506127, "loss": 6.0768, "mean_token_accuracy": 0.14445007145404815, "num_tokens": 3539805.0, "step": 1710 }, { "entropy": 6.146165990829468, "epoch": 0.15556966618287374, "grad_norm": 0.93359375, "learning_rate": 0.0004999525594667645, "loss": 5.9557, "mean_token_accuracy": 0.1396943673491478, "num_tokens": 3550477.0, "step": 1715 }, { "entropy": 6.103784704208374, "epoch": 0.15602322206095792, "grad_norm": 0.96875, "learning_rate": 0.00049995189273084, "loss": 6.0572, "mean_token_accuracy": 0.13744304925203324, "num_tokens": 3560729.0, "step": 1720 }, { "entropy": 6.271568822860718, "epoch": 0.15647677793904208, "grad_norm": 0.98046875, "learning_rate": 0.000499951221342853, "loss": 6.1321, "mean_token_accuracy": 0.1289873942732811, "num_tokens": 3571538.0, "step": 1725 }, { "entropy": 6.223130464553833, "epoch": 0.15693033381712626, "grad_norm": 0.94140625, "learning_rate": 0.0004999505453028174, "loss": 6.1212, "mean_token_accuracy": 0.1351299576461315, "num_tokens": 3583128.0, "step": 1730 }, { "entropy": 6.263720464706421, "epoch": 0.15738388969521044, "grad_norm": 0.8671875, "learning_rate": 0.0004999498646107472, "loss": 6.0628, "mean_token_accuracy": 0.13980068638920784, "num_tokens": 3594358.0, "step": 1735 }, { "entropy": 6.227974891662598, "epoch": 0.15783744557329463, "grad_norm": 0.984375, "learning_rate": 0.0004999491792666566, "loss": 5.9844, "mean_token_accuracy": 0.14432255774736405, "num_tokens": 3604345.0, "step": 1740 }, { "entropy": 6.122195100784301, "epoch": 0.1582910014513788, "grad_norm": 0.94140625, "learning_rate": 0.0004999484892705597, "loss": 6.0287, "mean_token_accuracy": 0.13807731494307518, "num_tokens": 3616129.0, "step": 1745 }, { "entropy": 6.275023746490478, "epoch": 0.158744557329463, "grad_norm": 0.87109375, "learning_rate": 0.0004999477946224705, "loss": 6.0836, "mean_token_accuracy": 0.14040916562080383, "num_tokens": 3627458.0, "step": 1750 }, { "entropy": 6.181599187850952, "epoch": 0.15919811320754718, "grad_norm": 0.96875, "learning_rate": 0.0004999470953224037, "loss": 5.9586, "mean_token_accuracy": 0.1387786313891411, "num_tokens": 3636047.0, "step": 1755 }, { "entropy": 6.1431786060333256, "epoch": 0.15965166908563136, "grad_norm": 0.8828125, "learning_rate": 0.0004999463913703735, "loss": 5.9542, "mean_token_accuracy": 0.13981650844216348, "num_tokens": 3646930.0, "step": 1760 }, { "entropy": 6.141822052001953, "epoch": 0.16010522496371554, "grad_norm": 0.95703125, "learning_rate": 0.0004999456827663948, "loss": 6.0495, "mean_token_accuracy": 0.1432150684297085, "num_tokens": 3657279.0, "step": 1765 }, { "entropy": 6.173039388656616, "epoch": 0.1605587808417997, "grad_norm": 0.921875, "learning_rate": 0.000499944969510482, "loss": 5.9656, "mean_token_accuracy": 0.141604046523571, "num_tokens": 3667070.0, "step": 1770 }, { "entropy": 6.148836374282837, "epoch": 0.16101233671988388, "grad_norm": 0.86328125, "learning_rate": 0.0004999442516026498, "loss": 5.9909, "mean_token_accuracy": 0.13877027854323387, "num_tokens": 3677560.0, "step": 1775 }, { "entropy": 6.135176277160644, "epoch": 0.16146589259796806, "grad_norm": 0.96875, "learning_rate": 0.0004999435290429133, "loss": 5.951, "mean_token_accuracy": 0.14585819393396376, "num_tokens": 3686701.0, "step": 1780 }, { "entropy": 6.194845485687256, "epoch": 0.16191944847605225, "grad_norm": 0.88671875, "learning_rate": 0.0004999428018312872, "loss": 6.0453, "mean_token_accuracy": 0.14197150394320487, "num_tokens": 3696338.0, "step": 1785 }, { "entropy": 6.213848018646241, "epoch": 0.16237300435413643, "grad_norm": 0.96484375, "learning_rate": 0.0004999420699677867, "loss": 6.0178, "mean_token_accuracy": 0.13948137164115906, "num_tokens": 3705752.0, "step": 1790 }, { "entropy": 6.173350286483765, "epoch": 0.1628265602322206, "grad_norm": 1.03125, "learning_rate": 0.0004999413334524269, "loss": 6.1086, "mean_token_accuracy": 0.13366367369890214, "num_tokens": 3716225.0, "step": 1795 }, { "entropy": 6.1766557693481445, "epoch": 0.1632801161103048, "grad_norm": 1.0234375, "learning_rate": 0.0004999405922852229, "loss": 5.9812, "mean_token_accuracy": 0.1403820961713791, "num_tokens": 3726593.0, "step": 1800 }, { "entropy": 6.1498106002807615, "epoch": 0.16373367198838898, "grad_norm": 0.84765625, "learning_rate": 0.0004999398464661901, "loss": 6.0292, "mean_token_accuracy": 0.13524944633245467, "num_tokens": 3737563.0, "step": 1805 }, { "entropy": 6.278463888168335, "epoch": 0.16418722786647316, "grad_norm": 0.9609375, "learning_rate": 0.0004999390959953441, "loss": 6.0868, "mean_token_accuracy": 0.13811569064855575, "num_tokens": 3747752.0, "step": 1810 }, { "entropy": 6.124238109588623, "epoch": 0.16464078374455732, "grad_norm": 0.91796875, "learning_rate": 0.0004999383408727002, "loss": 6.0109, "mean_token_accuracy": 0.13542224168777467, "num_tokens": 3758795.0, "step": 1815 }, { "entropy": 6.21006441116333, "epoch": 0.1650943396226415, "grad_norm": 1.046875, "learning_rate": 0.0004999375810982741, "loss": 6.0051, "mean_token_accuracy": 0.14309126287698745, "num_tokens": 3768690.0, "step": 1820 }, { "entropy": 6.147620582580567, "epoch": 0.16554789550072568, "grad_norm": 0.9296875, "learning_rate": 0.0004999368166720815, "loss": 6.0588, "mean_token_accuracy": 0.137413576990366, "num_tokens": 3779018.0, "step": 1825 }, { "entropy": 6.241029739379883, "epoch": 0.16600145137880987, "grad_norm": 0.91796875, "learning_rate": 0.0004999360475941382, "loss": 5.9743, "mean_token_accuracy": 0.14609253406524658, "num_tokens": 3788985.0, "step": 1830 }, { "entropy": 6.181500005722046, "epoch": 0.16645500725689405, "grad_norm": 0.890625, "learning_rate": 0.00049993527386446, "loss": 6.0916, "mean_token_accuracy": 0.13334065973758696, "num_tokens": 3800787.0, "step": 1835 }, { "entropy": 6.164537858963013, "epoch": 0.16690856313497823, "grad_norm": 1.03125, "learning_rate": 0.0004999344954830633, "loss": 5.9801, "mean_token_accuracy": 0.1378617025911808, "num_tokens": 3811381.0, "step": 1840 }, { "entropy": 6.188645315170288, "epoch": 0.16736211901306242, "grad_norm": 1.03125, "learning_rate": 0.0004999337124499638, "loss": 6.0844, "mean_token_accuracy": 0.14289560168981552, "num_tokens": 3822055.0, "step": 1845 }, { "entropy": 6.152506732940674, "epoch": 0.1678156748911466, "grad_norm": 0.99609375, "learning_rate": 0.0004999329247651777, "loss": 6.0558, "mean_token_accuracy": 0.13555024489760398, "num_tokens": 3831900.0, "step": 1850 }, { "entropy": 6.184814882278443, "epoch": 0.16826923076923078, "grad_norm": 1.0390625, "learning_rate": 0.0004999321324287213, "loss": 6.0046, "mean_token_accuracy": 0.1400987111032009, "num_tokens": 3842702.0, "step": 1855 }, { "entropy": 6.251664876937866, "epoch": 0.16872278664731494, "grad_norm": 0.91015625, "learning_rate": 0.0004999313354406114, "loss": 5.986, "mean_token_accuracy": 0.1382150486111641, "num_tokens": 3852690.0, "step": 1860 }, { "entropy": 6.014293146133423, "epoch": 0.16917634252539912, "grad_norm": 0.90234375, "learning_rate": 0.000499930533800864, "loss": 5.9598, "mean_token_accuracy": 0.15227705091238022, "num_tokens": 3863040.0, "step": 1865 }, { "entropy": 6.209018230438232, "epoch": 0.1696298984034833, "grad_norm": 0.921875, "learning_rate": 0.0004999297275094958, "loss": 6.065, "mean_token_accuracy": 0.13639552444219588, "num_tokens": 3873613.0, "step": 1870 }, { "entropy": 6.046637344360351, "epoch": 0.1700834542815675, "grad_norm": 1.015625, "learning_rate": 0.0004999289165665235, "loss": 5.8751, "mean_token_accuracy": 0.14939435720443725, "num_tokens": 3883936.0, "step": 1875 }, { "entropy": 6.090919876098633, "epoch": 0.17053701015965167, "grad_norm": 1.1015625, "learning_rate": 0.0004999281009719639, "loss": 5.8273, "mean_token_accuracy": 0.15036647394299507, "num_tokens": 3893788.0, "step": 1880 }, { "entropy": 6.0542162418365475, "epoch": 0.17099056603773585, "grad_norm": 1.03125, "learning_rate": 0.0004999272807258339, "loss": 5.912, "mean_token_accuracy": 0.14638229012489318, "num_tokens": 3903434.0, "step": 1885 }, { "entropy": 6.142886686325073, "epoch": 0.17144412191582004, "grad_norm": 0.9375, "learning_rate": 0.0004999264558281504, "loss": 5.9101, "mean_token_accuracy": 0.14875417798757554, "num_tokens": 3913476.0, "step": 1890 }, { "entropy": 5.993232488632202, "epoch": 0.17189767779390422, "grad_norm": 0.9765625, "learning_rate": 0.0004999256262789305, "loss": 5.8601, "mean_token_accuracy": 0.14939367920160293, "num_tokens": 3923301.0, "step": 1895 }, { "entropy": 6.073164653778076, "epoch": 0.1723512336719884, "grad_norm": 0.99609375, "learning_rate": 0.0004999247920781913, "loss": 6.0334, "mean_token_accuracy": 0.13975203409790993, "num_tokens": 3933335.0, "step": 1900 }, { "entropy": 6.233634042739868, "epoch": 0.17280478955007256, "grad_norm": 0.890625, "learning_rate": 0.0004999239532259502, "loss": 6.037, "mean_token_accuracy": 0.13394607827067376, "num_tokens": 3944171.0, "step": 1905 }, { "entropy": 6.214393186569214, "epoch": 0.17325834542815674, "grad_norm": 0.93359375, "learning_rate": 0.0004999231097222244, "loss": 6.1071, "mean_token_accuracy": 0.14265160858631135, "num_tokens": 3954160.0, "step": 1910 }, { "entropy": 6.173836088180542, "epoch": 0.17371190130624092, "grad_norm": 0.95703125, "learning_rate": 0.0004999222615670312, "loss": 5.9094, "mean_token_accuracy": 0.14953405708074569, "num_tokens": 3964110.0, "step": 1915 }, { "entropy": 6.1780534267425535, "epoch": 0.1741654571843251, "grad_norm": 0.91796875, "learning_rate": 0.0004999214087603885, "loss": 6.0034, "mean_token_accuracy": 0.14108952656388282, "num_tokens": 3974293.0, "step": 1920 }, { "entropy": 6.1007123470306395, "epoch": 0.1746190130624093, "grad_norm": 0.87890625, "learning_rate": 0.0004999205513023135, "loss": 5.9491, "mean_token_accuracy": 0.1505696728825569, "num_tokens": 3984346.0, "step": 1925 }, { "entropy": 6.014599132537842, "epoch": 0.17507256894049347, "grad_norm": 0.8828125, "learning_rate": 0.0004999196891928245, "loss": 5.8944, "mean_token_accuracy": 0.1506063535809517, "num_tokens": 3992897.0, "step": 1930 }, { "entropy": 6.1384530544281, "epoch": 0.17552612481857766, "grad_norm": 0.96875, "learning_rate": 0.0004999188224319388, "loss": 5.929, "mean_token_accuracy": 0.1495840311050415, "num_tokens": 4002575.0, "step": 1935 }, { "entropy": 6.0449896335601805, "epoch": 0.17597968069666184, "grad_norm": 0.96875, "learning_rate": 0.0004999179510196746, "loss": 6.0023, "mean_token_accuracy": 0.1404266342520714, "num_tokens": 4013752.0, "step": 1940 }, { "entropy": 6.181995582580567, "epoch": 0.17643323657474602, "grad_norm": 1.03125, "learning_rate": 0.0004999170749560498, "loss": 5.8891, "mean_token_accuracy": 0.14904519468545913, "num_tokens": 4023718.0, "step": 1945 }, { "entropy": 6.080067110061646, "epoch": 0.17688679245283018, "grad_norm": 1.0625, "learning_rate": 0.0004999161942410827, "loss": 5.9877, "mean_token_accuracy": 0.13862392008304597, "num_tokens": 4034210.0, "step": 1950 }, { "entropy": 6.194681644439697, "epoch": 0.17734034833091436, "grad_norm": 1.015625, "learning_rate": 0.0004999153088747913, "loss": 5.9752, "mean_token_accuracy": 0.14118978679180144, "num_tokens": 4044868.0, "step": 1955 }, { "entropy": 6.018691873550415, "epoch": 0.17779390420899854, "grad_norm": 0.99609375, "learning_rate": 0.000499914418857194, "loss": 5.9759, "mean_token_accuracy": 0.14467088282108306, "num_tokens": 4055049.0, "step": 1960 }, { "entropy": 6.195721387863159, "epoch": 0.17824746008708273, "grad_norm": 0.953125, "learning_rate": 0.0004999135241883092, "loss": 6.0328, "mean_token_accuracy": 0.13953902348876, "num_tokens": 4065889.0, "step": 1965 }, { "entropy": 6.124079751968384, "epoch": 0.1787010159651669, "grad_norm": 1.078125, "learning_rate": 0.0004999126248681555, "loss": 6.0438, "mean_token_accuracy": 0.13967278376221656, "num_tokens": 4077288.0, "step": 1970 }, { "entropy": 6.1740796089172365, "epoch": 0.1791545718432511, "grad_norm": 0.96484375, "learning_rate": 0.0004999117208967513, "loss": 5.9939, "mean_token_accuracy": 0.14228827133774757, "num_tokens": 4087402.0, "step": 1975 }, { "entropy": 6.136812305450439, "epoch": 0.17960812772133528, "grad_norm": 0.88671875, "learning_rate": 0.0004999108122741154, "loss": 6.0412, "mean_token_accuracy": 0.13958762884140014, "num_tokens": 4098150.0, "step": 1980 }, { "entropy": 6.085280323028565, "epoch": 0.18006168359941946, "grad_norm": 0.9609375, "learning_rate": 0.0004999098990002666, "loss": 5.9088, "mean_token_accuracy": 0.14206465110182762, "num_tokens": 4108134.0, "step": 1985 }, { "entropy": 6.158121109008789, "epoch": 0.18051523947750364, "grad_norm": 0.92578125, "learning_rate": 0.0004999089810752237, "loss": 6.0448, "mean_token_accuracy": 0.13666467741131783, "num_tokens": 4118251.0, "step": 1990 }, { "entropy": 6.078621101379395, "epoch": 0.1809687953555878, "grad_norm": 0.921875, "learning_rate": 0.000499908058499006, "loss": 5.8876, "mean_token_accuracy": 0.14455655217170715, "num_tokens": 4129228.0, "step": 1995 }, { "entropy": 6.047148942947388, "epoch": 0.18142235123367198, "grad_norm": 0.94921875, "learning_rate": 0.0004999071312716321, "loss": 5.9426, "mean_token_accuracy": 0.15172967463731765, "num_tokens": 4139391.0, "step": 2000 }, { "entropy": 6.093998432159424, "epoch": 0.18187590711175616, "grad_norm": 0.92578125, "learning_rate": 0.0004999061993931215, "loss": 5.88, "mean_token_accuracy": 0.15255183577537537, "num_tokens": 4148891.0, "step": 2005 }, { "entropy": 6.305850887298584, "epoch": 0.18232946298984035, "grad_norm": 0.92578125, "learning_rate": 0.0004999052628634934, "loss": 6.2083, "mean_token_accuracy": 0.13769319280982018, "num_tokens": 4159551.0, "step": 2010 }, { "entropy": 6.18409833908081, "epoch": 0.18278301886792453, "grad_norm": 0.8828125, "learning_rate": 0.0004999043216827671, "loss": 6.0219, "mean_token_accuracy": 0.1419105350971222, "num_tokens": 4170055.0, "step": 2015 }, { "entropy": 6.019263553619385, "epoch": 0.1832365747460087, "grad_norm": 0.98828125, "learning_rate": 0.0004999033758509621, "loss": 5.8725, "mean_token_accuracy": 0.142510387301445, "num_tokens": 4180767.0, "step": 2020 }, { "entropy": 6.1171001434326175, "epoch": 0.1836901306240929, "grad_norm": 0.8828125, "learning_rate": 0.000499902425368098, "loss": 5.99, "mean_token_accuracy": 0.1484679900109768, "num_tokens": 4190654.0, "step": 2025 }, { "entropy": 6.084097576141358, "epoch": 0.18414368650217708, "grad_norm": 0.96484375, "learning_rate": 0.0004999014702341944, "loss": 5.9217, "mean_token_accuracy": 0.14448753595352173, "num_tokens": 4200753.0, "step": 2030 }, { "entropy": 6.135722398757935, "epoch": 0.18459724238026126, "grad_norm": 0.953125, "learning_rate": 0.0004999005104492712, "loss": 5.9985, "mean_token_accuracy": 0.14054833576083184, "num_tokens": 4210994.0, "step": 2035 }, { "entropy": 6.120487928390503, "epoch": 0.18505079825834542, "grad_norm": 0.9609375, "learning_rate": 0.0004998995460133481, "loss": 5.9412, "mean_token_accuracy": 0.14108474180102348, "num_tokens": 4220883.0, "step": 2040 }, { "entropy": 6.127297973632812, "epoch": 0.1855043541364296, "grad_norm": 0.859375, "learning_rate": 0.0004998985769264451, "loss": 5.977, "mean_token_accuracy": 0.13780092522501947, "num_tokens": 4231269.0, "step": 2045 }, { "entropy": 6.101497316360474, "epoch": 0.18595791001451378, "grad_norm": 0.97265625, "learning_rate": 0.0004998976031885821, "loss": 5.9776, "mean_token_accuracy": 0.1418766401708126, "num_tokens": 4241559.0, "step": 2050 }, { "entropy": 6.121247720718384, "epoch": 0.18641146589259797, "grad_norm": 1.09375, "learning_rate": 0.0004998966247997794, "loss": 5.8733, "mean_token_accuracy": 0.14405595809221267, "num_tokens": 4250870.0, "step": 2055 }, { "entropy": 6.015826034545898, "epoch": 0.18686502177068215, "grad_norm": 0.97265625, "learning_rate": 0.0004998956417600572, "loss": 5.8246, "mean_token_accuracy": 0.15058073103427888, "num_tokens": 4260848.0, "step": 2060 }, { "entropy": 6.08300142288208, "epoch": 0.18731857764876633, "grad_norm": 0.8828125, "learning_rate": 0.0004998946540694358, "loss": 5.9464, "mean_token_accuracy": 0.1485067129135132, "num_tokens": 4270973.0, "step": 2065 }, { "entropy": 6.14107756614685, "epoch": 0.18777213352685052, "grad_norm": 0.98046875, "learning_rate": 0.0004998936617279357, "loss": 6.0361, "mean_token_accuracy": 0.14370361119508743, "num_tokens": 4281211.0, "step": 2070 }, { "entropy": 6.045505952835083, "epoch": 0.1882256894049347, "grad_norm": 1.046875, "learning_rate": 0.0004998926647355773, "loss": 5.8954, "mean_token_accuracy": 0.14735701233148574, "num_tokens": 4291425.0, "step": 2075 }, { "entropy": 6.1746431350708, "epoch": 0.18867924528301888, "grad_norm": 0.9609375, "learning_rate": 0.0004998916630923813, "loss": 5.9993, "mean_token_accuracy": 0.14234295561909677, "num_tokens": 4301079.0, "step": 2080 }, { "entropy": 6.0917683124542235, "epoch": 0.18913280116110304, "grad_norm": 0.9609375, "learning_rate": 0.0004998906567983685, "loss": 5.9599, "mean_token_accuracy": 0.14310015216469765, "num_tokens": 4312374.0, "step": 2085 }, { "entropy": 6.10637731552124, "epoch": 0.18958635703918722, "grad_norm": 0.8828125, "learning_rate": 0.0004998896458535595, "loss": 5.8884, "mean_token_accuracy": 0.15468773394823074, "num_tokens": 4322810.0, "step": 2090 }, { "entropy": 6.0409440994262695, "epoch": 0.1900399129172714, "grad_norm": 1.0, "learning_rate": 0.0004998886302579752, "loss": 5.888, "mean_token_accuracy": 0.14332466721534728, "num_tokens": 4332082.0, "step": 2095 }, { "entropy": 6.115694570541382, "epoch": 0.19049346879535559, "grad_norm": 0.9609375, "learning_rate": 0.000499887610011637, "loss": 5.9771, "mean_token_accuracy": 0.14411457404494285, "num_tokens": 4342632.0, "step": 2100 }, { "entropy": 6.025098752975464, "epoch": 0.19094702467343977, "grad_norm": 0.87109375, "learning_rate": 0.0004998865851145656, "loss": 5.9079, "mean_token_accuracy": 0.14562978297472, "num_tokens": 4353544.0, "step": 2105 }, { "entropy": 6.080524492263794, "epoch": 0.19140058055152395, "grad_norm": 0.9765625, "learning_rate": 0.0004998855555667822, "loss": 6.0337, "mean_token_accuracy": 0.13668391555547715, "num_tokens": 4363636.0, "step": 2110 }, { "entropy": 6.174575281143189, "epoch": 0.19185413642960814, "grad_norm": 0.88671875, "learning_rate": 0.0004998845213683084, "loss": 5.91, "mean_token_accuracy": 0.14217197224497796, "num_tokens": 4373672.0, "step": 2115 }, { "entropy": 5.952403831481933, "epoch": 0.19230769230769232, "grad_norm": 0.93359375, "learning_rate": 0.0004998834825191652, "loss": 5.8609, "mean_token_accuracy": 0.14928537905216216, "num_tokens": 4383199.0, "step": 2120 }, { "entropy": 6.0944489479064945, "epoch": 0.1927612481857765, "grad_norm": 0.953125, "learning_rate": 0.0004998824390193743, "loss": 5.9295, "mean_token_accuracy": 0.14216511845588684, "num_tokens": 4394446.0, "step": 2125 }, { "entropy": 6.156260538101196, "epoch": 0.19321480406386066, "grad_norm": 0.9765625, "learning_rate": 0.0004998813908689573, "loss": 5.9814, "mean_token_accuracy": 0.14446035400032997, "num_tokens": 4405882.0, "step": 2130 }, { "entropy": 6.021085166931153, "epoch": 0.19366835994194484, "grad_norm": 1.03125, "learning_rate": 0.0004998803380679359, "loss": 5.8395, "mean_token_accuracy": 0.15445481687784196, "num_tokens": 4415280.0, "step": 2135 }, { "entropy": 6.026923942565918, "epoch": 0.19412191582002902, "grad_norm": 0.9453125, "learning_rate": 0.0004998792806163317, "loss": 6.0418, "mean_token_accuracy": 0.1423596292734146, "num_tokens": 4425755.0, "step": 2140 }, { "entropy": 6.0691611766815186, "epoch": 0.1945754716981132, "grad_norm": 0.87890625, "learning_rate": 0.0004998782185141667, "loss": 5.899, "mean_token_accuracy": 0.1436906062066555, "num_tokens": 4436259.0, "step": 2145 }, { "entropy": 6.100642156600952, "epoch": 0.1950290275761974, "grad_norm": 0.9609375, "learning_rate": 0.0004998771517614629, "loss": 5.9354, "mean_token_accuracy": 0.14032572209835054, "num_tokens": 4446423.0, "step": 2150 }, { "entropy": 6.079388666152954, "epoch": 0.19548258345428157, "grad_norm": 0.96484375, "learning_rate": 0.0004998760803582422, "loss": 5.8765, "mean_token_accuracy": 0.15558486431837082, "num_tokens": 4456678.0, "step": 2155 }, { "entropy": 6.038434076309204, "epoch": 0.19593613933236576, "grad_norm": 1.0, "learning_rate": 0.0004998750043045269, "loss": 5.88, "mean_token_accuracy": 0.1474220186471939, "num_tokens": 4467031.0, "step": 2160 }, { "entropy": 6.084740686416626, "epoch": 0.19638969521044994, "grad_norm": 0.8828125, "learning_rate": 0.0004998739236003392, "loss": 5.9457, "mean_token_accuracy": 0.13701039925217628, "num_tokens": 4477771.0, "step": 2165 }, { "entropy": 6.058000755310059, "epoch": 0.1968432510885341, "grad_norm": 0.88671875, "learning_rate": 0.0004998728382457014, "loss": 5.9724, "mean_token_accuracy": 0.14374302327632904, "num_tokens": 4488426.0, "step": 2170 }, { "entropy": 6.157823610305786, "epoch": 0.19729680696661828, "grad_norm": 0.890625, "learning_rate": 0.0004998717482406362, "loss": 5.9512, "mean_token_accuracy": 0.14008950740098952, "num_tokens": 4499735.0, "step": 2175 }, { "entropy": 6.083208417892456, "epoch": 0.19775036284470246, "grad_norm": 1.0, "learning_rate": 0.0004998706535851657, "loss": 5.9067, "mean_token_accuracy": 0.1461469426751137, "num_tokens": 4509500.0, "step": 2180 }, { "entropy": 6.037715578079224, "epoch": 0.19820391872278664, "grad_norm": 0.890625, "learning_rate": 0.0004998695542793129, "loss": 5.9079, "mean_token_accuracy": 0.14525417983531952, "num_tokens": 4520431.0, "step": 2185 }, { "entropy": 6.084038925170899, "epoch": 0.19865747460087083, "grad_norm": 0.87890625, "learning_rate": 0.0004998684503231003, "loss": 5.9846, "mean_token_accuracy": 0.14418850764632224, "num_tokens": 4532294.0, "step": 2190 }, { "entropy": 6.027761554718017, "epoch": 0.199111030478955, "grad_norm": 0.93359375, "learning_rate": 0.000499867341716551, "loss": 5.8985, "mean_token_accuracy": 0.1443702645599842, "num_tokens": 4542488.0, "step": 2195 }, { "entropy": 6.043829488754272, "epoch": 0.1995645863570392, "grad_norm": 0.94921875, "learning_rate": 0.0004998662284596878, "loss": 5.8528, "mean_token_accuracy": 0.1418704494833946, "num_tokens": 4552933.0, "step": 2200 }, { "entropy": 6.060906505584716, "epoch": 0.20001814223512338, "grad_norm": 0.91796875, "learning_rate": 0.0004998651105525335, "loss": 5.8336, "mean_token_accuracy": 0.15473553836345671, "num_tokens": 4562373.0, "step": 2205 }, { "entropy": 5.9967522621154785, "epoch": 0.20047169811320756, "grad_norm": 0.8671875, "learning_rate": 0.0004998639879951115, "loss": 5.9557, "mean_token_accuracy": 0.14503294080495835, "num_tokens": 4572715.0, "step": 2210 }, { "entropy": 6.131484937667847, "epoch": 0.2009252539912917, "grad_norm": 0.92578125, "learning_rate": 0.000499862860787445, "loss": 5.8461, "mean_token_accuracy": 0.1420556351542473, "num_tokens": 4582782.0, "step": 2215 }, { "entropy": 6.036686944961548, "epoch": 0.2013788098693759, "grad_norm": 0.83984375, "learning_rate": 0.0004998617289295571, "loss": 5.9439, "mean_token_accuracy": 0.14234896376729012, "num_tokens": 4594108.0, "step": 2220 }, { "entropy": 6.102933645248413, "epoch": 0.20183236574746008, "grad_norm": 0.93359375, "learning_rate": 0.0004998605924214714, "loss": 5.9103, "mean_token_accuracy": 0.14780050218105317, "num_tokens": 4604732.0, "step": 2225 }, { "entropy": 6.049504566192627, "epoch": 0.20228592162554426, "grad_norm": 0.95703125, "learning_rate": 0.0004998594512632114, "loss": 6.0456, "mean_token_accuracy": 0.13591379299759865, "num_tokens": 4614998.0, "step": 2230 }, { "entropy": 6.057260751724243, "epoch": 0.20273947750362845, "grad_norm": 1.0546875, "learning_rate": 0.0004998583054548006, "loss": 5.8648, "mean_token_accuracy": 0.14422834739089013, "num_tokens": 4624665.0, "step": 2235 }, { "entropy": 6.085105228424072, "epoch": 0.20319303338171263, "grad_norm": 1.09375, "learning_rate": 0.0004998571549962628, "loss": 5.8612, "mean_token_accuracy": 0.15319595485925674, "num_tokens": 4633731.0, "step": 2240 }, { "entropy": 6.046474456787109, "epoch": 0.2036465892597968, "grad_norm": 0.94140625, "learning_rate": 0.0004998559998876216, "loss": 5.8897, "mean_token_accuracy": 0.14516430646181105, "num_tokens": 4643421.0, "step": 2245 }, { "entropy": 6.105594730377197, "epoch": 0.204100145137881, "grad_norm": 1.015625, "learning_rate": 0.0004998548401289012, "loss": 5.9729, "mean_token_accuracy": 0.14359490424394608, "num_tokens": 4653795.0, "step": 2250 }, { "entropy": 6.111778020858765, "epoch": 0.20455370101596518, "grad_norm": 0.875, "learning_rate": 0.0004998536757201253, "loss": 5.9528, "mean_token_accuracy": 0.14500485807657243, "num_tokens": 4664840.0, "step": 2255 }, { "entropy": 6.058202457427979, "epoch": 0.20500725689404933, "grad_norm": 0.96484375, "learning_rate": 0.0004998525066613181, "loss": 5.9537, "mean_token_accuracy": 0.14941285997629167, "num_tokens": 4675508.0, "step": 2260 }, { "entropy": 6.049920320510864, "epoch": 0.20546081277213352, "grad_norm": 1.015625, "learning_rate": 0.0004998513329525038, "loss": 5.8734, "mean_token_accuracy": 0.15032386034727097, "num_tokens": 4685995.0, "step": 2265 }, { "entropy": 6.082958173751831, "epoch": 0.2059143686502177, "grad_norm": 0.8828125, "learning_rate": 0.0004998501545937066, "loss": 5.9052, "mean_token_accuracy": 0.14433911442756653, "num_tokens": 4696659.0, "step": 2270 }, { "entropy": 6.0467150688171385, "epoch": 0.20636792452830188, "grad_norm": 0.9609375, "learning_rate": 0.000499848971584951, "loss": 5.8595, "mean_token_accuracy": 0.15614939630031585, "num_tokens": 4706438.0, "step": 2275 }, { "entropy": 5.930180215835572, "epoch": 0.20682148040638607, "grad_norm": 0.9140625, "learning_rate": 0.0004998477839262611, "loss": 5.8678, "mean_token_accuracy": 0.1469499036669731, "num_tokens": 4716402.0, "step": 2280 }, { "entropy": 6.050282192230225, "epoch": 0.20727503628447025, "grad_norm": 0.85546875, "learning_rate": 0.000499846591617662, "loss": 5.9457, "mean_token_accuracy": 0.1466635584831238, "num_tokens": 4728488.0, "step": 2285 }, { "entropy": 6.057934761047363, "epoch": 0.20772859216255443, "grad_norm": 1.0234375, "learning_rate": 0.0004998453946591779, "loss": 5.976, "mean_token_accuracy": 0.14741047471761703, "num_tokens": 4738693.0, "step": 2290 }, { "entropy": 6.034505462646484, "epoch": 0.20818214804063861, "grad_norm": 0.9375, "learning_rate": 0.0004998441930508339, "loss": 5.8617, "mean_token_accuracy": 0.149900358915329, "num_tokens": 4748895.0, "step": 2295 }, { "entropy": 6.12192120552063, "epoch": 0.2086357039187228, "grad_norm": 0.88671875, "learning_rate": 0.0004998429867926547, "loss": 5.9731, "mean_token_accuracy": 0.1417195826768875, "num_tokens": 4760135.0, "step": 2300 }, { "entropy": 6.1114363193511965, "epoch": 0.20908925979680695, "grad_norm": 0.9296875, "learning_rate": 0.0004998417758846651, "loss": 6.0106, "mean_token_accuracy": 0.1492314174771309, "num_tokens": 4769935.0, "step": 2305 }, { "entropy": 6.163050842285156, "epoch": 0.20954281567489114, "grad_norm": 0.94140625, "learning_rate": 0.0004998405603268903, "loss": 5.9454, "mean_token_accuracy": 0.14845321476459503, "num_tokens": 4779520.0, "step": 2310 }, { "entropy": 5.973990440368652, "epoch": 0.20999637155297532, "grad_norm": 0.94140625, "learning_rate": 0.0004998393401193554, "loss": 5.8416, "mean_token_accuracy": 0.15259672403335572, "num_tokens": 4791256.0, "step": 2315 }, { "entropy": 5.966838359832764, "epoch": 0.2104499274310595, "grad_norm": 0.86328125, "learning_rate": 0.0004998381152620857, "loss": 5.811, "mean_token_accuracy": 0.15300733894109725, "num_tokens": 4801334.0, "step": 2320 }, { "entropy": 5.96552734375, "epoch": 0.21090348330914369, "grad_norm": 0.8828125, "learning_rate": 0.0004998368857551067, "loss": 5.7882, "mean_token_accuracy": 0.15469710677862167, "num_tokens": 4811361.0, "step": 2325 }, { "entropy": 6.016611623764038, "epoch": 0.21135703918722787, "grad_norm": 0.9375, "learning_rate": 0.0004998356515984433, "loss": 5.85, "mean_token_accuracy": 0.1501396507024765, "num_tokens": 4821190.0, "step": 2330 }, { "entropy": 6.041166496276856, "epoch": 0.21181059506531205, "grad_norm": 0.92578125, "learning_rate": 0.0004998344127921213, "loss": 5.8821, "mean_token_accuracy": 0.1504140943288803, "num_tokens": 4830694.0, "step": 2335 }, { "entropy": 5.997649621963501, "epoch": 0.21226415094339623, "grad_norm": 0.8359375, "learning_rate": 0.0004998331693361666, "loss": 5.8687, "mean_token_accuracy": 0.1483940526843071, "num_tokens": 4841344.0, "step": 2340 }, { "entropy": 6.003773546218872, "epoch": 0.21271770682148042, "grad_norm": 0.953125, "learning_rate": 0.0004998319212306046, "loss": 5.8398, "mean_token_accuracy": 0.14764055758714675, "num_tokens": 4851161.0, "step": 2345 }, { "entropy": 5.979840612411499, "epoch": 0.21317126269956457, "grad_norm": 0.94140625, "learning_rate": 0.000499830668475461, "loss": 5.831, "mean_token_accuracy": 0.1507522940635681, "num_tokens": 4860740.0, "step": 2350 }, { "entropy": 6.029822587966919, "epoch": 0.21362481857764876, "grad_norm": 0.921875, "learning_rate": 0.000499829411070762, "loss": 5.856, "mean_token_accuracy": 0.147916804254055, "num_tokens": 4871733.0, "step": 2355 }, { "entropy": 5.999858570098877, "epoch": 0.21407837445573294, "grad_norm": 0.87890625, "learning_rate": 0.0004998281490165335, "loss": 5.9117, "mean_token_accuracy": 0.14421676099300385, "num_tokens": 4883617.0, "step": 2360 }, { "entropy": 6.043055486679077, "epoch": 0.21453193033381712, "grad_norm": 0.88671875, "learning_rate": 0.0004998268823128016, "loss": 5.8607, "mean_token_accuracy": 0.14836216866970062, "num_tokens": 4894519.0, "step": 2365 }, { "entropy": 6.004064750671387, "epoch": 0.2149854862119013, "grad_norm": 0.98046875, "learning_rate": 0.0004998256109595923, "loss": 5.8134, "mean_token_accuracy": 0.14691278859972953, "num_tokens": 4904965.0, "step": 2370 }, { "entropy": 5.955627918243408, "epoch": 0.2154390420899855, "grad_norm": 1.0078125, "learning_rate": 0.0004998243349569323, "loss": 5.7279, "mean_token_accuracy": 0.157587631046772, "num_tokens": 4914618.0, "step": 2375 }, { "entropy": 5.92179274559021, "epoch": 0.21589259796806967, "grad_norm": 0.89453125, "learning_rate": 0.0004998230543048477, "loss": 5.7896, "mean_token_accuracy": 0.15410214364528657, "num_tokens": 4924341.0, "step": 2380 }, { "entropy": 5.918932485580444, "epoch": 0.21634615384615385, "grad_norm": 0.92578125, "learning_rate": 0.000499821769003365, "loss": 5.7633, "mean_token_accuracy": 0.15452138409018518, "num_tokens": 4934231.0, "step": 2385 }, { "entropy": 5.887126874923706, "epoch": 0.21679970972423804, "grad_norm": 0.984375, "learning_rate": 0.0004998204790525109, "loss": 5.7905, "mean_token_accuracy": 0.1511450305581093, "num_tokens": 4944303.0, "step": 2390 }, { "entropy": 6.001142930984497, "epoch": 0.2172532656023222, "grad_norm": 0.9296875, "learning_rate": 0.0004998191844523119, "loss": 5.8693, "mean_token_accuracy": 0.15268588662147523, "num_tokens": 4954571.0, "step": 2395 }, { "entropy": 5.987411212921143, "epoch": 0.21770682148040638, "grad_norm": 0.96875, "learning_rate": 0.000499817885202795, "loss": 5.848, "mean_token_accuracy": 0.14666955098509787, "num_tokens": 4964418.0, "step": 2400 }, { "entropy": 6.03399133682251, "epoch": 0.21816037735849056, "grad_norm": 0.9296875, "learning_rate": 0.0004998165813039869, "loss": 5.8291, "mean_token_accuracy": 0.1442165307700634, "num_tokens": 4975036.0, "step": 2405 }, { "entropy": 5.994223356246948, "epoch": 0.21861393323657474, "grad_norm": 0.93359375, "learning_rate": 0.0004998152727559145, "loss": 5.9302, "mean_token_accuracy": 0.14429473355412484, "num_tokens": 4985272.0, "step": 2410 }, { "entropy": 6.091732931137085, "epoch": 0.21906748911465893, "grad_norm": 0.9140625, "learning_rate": 0.000499813959558605, "loss": 5.8548, "mean_token_accuracy": 0.15049488544464112, "num_tokens": 4995187.0, "step": 2415 }, { "entropy": 6.026802444458008, "epoch": 0.2195210449927431, "grad_norm": 0.9609375, "learning_rate": 0.0004998126417120856, "loss": 5.9175, "mean_token_accuracy": 0.15209949463605882, "num_tokens": 5005013.0, "step": 2420 }, { "entropy": 6.094258975982666, "epoch": 0.2199746008708273, "grad_norm": 0.8671875, "learning_rate": 0.0004998113192163835, "loss": 5.9259, "mean_token_accuracy": 0.14370185285806655, "num_tokens": 5016789.0, "step": 2425 }, { "entropy": 5.985634708404541, "epoch": 0.22042815674891147, "grad_norm": 0.90234375, "learning_rate": 0.000499809992071526, "loss": 5.8749, "mean_token_accuracy": 0.15012458711862564, "num_tokens": 5026913.0, "step": 2430 }, { "entropy": 6.017763757705689, "epoch": 0.22088171262699566, "grad_norm": 0.953125, "learning_rate": 0.0004998086602775406, "loss": 5.9623, "mean_token_accuracy": 0.1502877563238144, "num_tokens": 5037501.0, "step": 2435 }, { "entropy": 5.990037059783935, "epoch": 0.2213352685050798, "grad_norm": 0.984375, "learning_rate": 0.0004998073238344547, "loss": 5.8105, "mean_token_accuracy": 0.144505974650383, "num_tokens": 5048478.0, "step": 2440 }, { "entropy": 6.0197502136230465, "epoch": 0.221788824383164, "grad_norm": 0.9140625, "learning_rate": 0.0004998059827422962, "loss": 5.8716, "mean_token_accuracy": 0.13962874338030815, "num_tokens": 5059118.0, "step": 2445 }, { "entropy": 6.010491847991943, "epoch": 0.22224238026124818, "grad_norm": 0.9921875, "learning_rate": 0.0004998046370010926, "loss": 5.8321, "mean_token_accuracy": 0.15523343831300734, "num_tokens": 5070180.0, "step": 2450 }, { "entropy": 6.002876043319702, "epoch": 0.22269593613933236, "grad_norm": 0.97265625, "learning_rate": 0.0004998032866108718, "loss": 5.8404, "mean_token_accuracy": 0.15497579723596572, "num_tokens": 5079912.0, "step": 2455 }, { "entropy": 6.074828386306763, "epoch": 0.22314949201741655, "grad_norm": 0.96484375, "learning_rate": 0.0004998019315716618, "loss": 5.9112, "mean_token_accuracy": 0.15170105695724487, "num_tokens": 5090549.0, "step": 2460 }, { "entropy": 5.936306381225586, "epoch": 0.22360304789550073, "grad_norm": 0.90234375, "learning_rate": 0.0004998005718834905, "loss": 5.767, "mean_token_accuracy": 0.15424081236124038, "num_tokens": 5100880.0, "step": 2465 }, { "entropy": 5.983072996139526, "epoch": 0.2240566037735849, "grad_norm": 0.9140625, "learning_rate": 0.0004997992075463862, "loss": 5.8865, "mean_token_accuracy": 0.1511937439441681, "num_tokens": 5111796.0, "step": 2470 }, { "entropy": 6.071778011322022, "epoch": 0.2245101596516691, "grad_norm": 0.94140625, "learning_rate": 0.0004997978385603769, "loss": 5.8722, "mean_token_accuracy": 0.14768328070640563, "num_tokens": 5123468.0, "step": 2475 }, { "entropy": 5.959640073776245, "epoch": 0.22496371552975328, "grad_norm": 0.98046875, "learning_rate": 0.0004997964649254911, "loss": 5.8051, "mean_token_accuracy": 0.15414749532938005, "num_tokens": 5132925.0, "step": 2480 }, { "entropy": 5.989591789245606, "epoch": 0.22541727140783743, "grad_norm": 1.0078125, "learning_rate": 0.0004997950866417572, "loss": 5.8777, "mean_token_accuracy": 0.1485254153609276, "num_tokens": 5143445.0, "step": 2485 }, { "entropy": 5.993931770324707, "epoch": 0.22587082728592162, "grad_norm": 1.078125, "learning_rate": 0.0004997937037092034, "loss": 5.8058, "mean_token_accuracy": 0.14833374321460724, "num_tokens": 5153176.0, "step": 2490 }, { "entropy": 6.067162322998047, "epoch": 0.2263243831640058, "grad_norm": 0.9921875, "learning_rate": 0.0004997923161278587, "loss": 5.8445, "mean_token_accuracy": 0.14823048263788224, "num_tokens": 5162765.0, "step": 2495 }, { "entropy": 5.973460483551025, "epoch": 0.22677793904208998, "grad_norm": 0.9765625, "learning_rate": 0.0004997909238977514, "loss": 5.8977, "mean_token_accuracy": 0.150830414891243, "num_tokens": 5173390.0, "step": 2500 }, { "entropy": 5.978850793838501, "epoch": 0.22723149492017417, "grad_norm": 0.85546875, "learning_rate": 0.0004997895270189108, "loss": 5.8062, "mean_token_accuracy": 0.1472632072865963, "num_tokens": 5184212.0, "step": 2505 }, { "entropy": 5.894932794570923, "epoch": 0.22768505079825835, "grad_norm": 0.9375, "learning_rate": 0.0004997881254913653, "loss": 5.7866, "mean_token_accuracy": 0.14934516549110413, "num_tokens": 5194311.0, "step": 2510 }, { "entropy": 5.951768064498902, "epoch": 0.22813860667634253, "grad_norm": 1.0078125, "learning_rate": 0.0004997867193151441, "loss": 5.7758, "mean_token_accuracy": 0.1520687684416771, "num_tokens": 5204708.0, "step": 2515 }, { "entropy": 5.913540315628052, "epoch": 0.22859216255442671, "grad_norm": 0.93359375, "learning_rate": 0.0004997853084902763, "loss": 5.7608, "mean_token_accuracy": 0.15067852139472962, "num_tokens": 5214566.0, "step": 2520 }, { "entropy": 5.952923536300659, "epoch": 0.2290457184325109, "grad_norm": 0.89453125, "learning_rate": 0.0004997838930167911, "loss": 5.8035, "mean_token_accuracy": 0.15393685698509216, "num_tokens": 5224762.0, "step": 2525 }, { "entropy": 6.007725048065185, "epoch": 0.22949927431059505, "grad_norm": 0.92578125, "learning_rate": 0.0004997824728947176, "loss": 5.8629, "mean_token_accuracy": 0.14823582395911217, "num_tokens": 5235146.0, "step": 2530 }, { "entropy": 6.064925336837769, "epoch": 0.22995283018867924, "grad_norm": 0.9140625, "learning_rate": 0.0004997810481240853, "loss": 5.8276, "mean_token_accuracy": 0.1468263030052185, "num_tokens": 5243867.0, "step": 2535 }, { "entropy": 5.916410827636719, "epoch": 0.23040638606676342, "grad_norm": 0.875, "learning_rate": 0.0004997796187049238, "loss": 5.7346, "mean_token_accuracy": 0.1514027461409569, "num_tokens": 5254279.0, "step": 2540 }, { "entropy": 6.060354948043823, "epoch": 0.2308599419448476, "grad_norm": 0.96875, "learning_rate": 0.0004997781846372623, "loss": 5.8574, "mean_token_accuracy": 0.14669395685195924, "num_tokens": 5264769.0, "step": 2545 }, { "entropy": 5.961148881912232, "epoch": 0.23131349782293179, "grad_norm": 0.94921875, "learning_rate": 0.0004997767459211307, "loss": 5.8023, "mean_token_accuracy": 0.14596094489097594, "num_tokens": 5274291.0, "step": 2550 }, { "entropy": 5.973608541488647, "epoch": 0.23176705370101597, "grad_norm": 1.015625, "learning_rate": 0.0004997753025565587, "loss": 5.751, "mean_token_accuracy": 0.15511572808027269, "num_tokens": 5284366.0, "step": 2555 }, { "entropy": 5.983015012741089, "epoch": 0.23222060957910015, "grad_norm": 0.96484375, "learning_rate": 0.0004997738545435763, "loss": 5.8651, "mean_token_accuracy": 0.14840636104345323, "num_tokens": 5294494.0, "step": 2560 }, { "entropy": 5.955273532867432, "epoch": 0.23267416545718433, "grad_norm": 0.87890625, "learning_rate": 0.0004997724018822133, "loss": 5.8663, "mean_token_accuracy": 0.14921268746256827, "num_tokens": 5305606.0, "step": 2565 }, { "entropy": 5.970898771286011, "epoch": 0.23312772133526852, "grad_norm": 0.96875, "learning_rate": 0.0004997709445724996, "loss": 5.856, "mean_token_accuracy": 0.1487169645726681, "num_tokens": 5315677.0, "step": 2570 }, { "entropy": 6.037318992614746, "epoch": 0.23358127721335267, "grad_norm": 0.9140625, "learning_rate": 0.0004997694826144656, "loss": 5.9139, "mean_token_accuracy": 0.14366162866353988, "num_tokens": 5326453.0, "step": 2575 }, { "entropy": 5.969986534118652, "epoch": 0.23403483309143686, "grad_norm": 0.796875, "learning_rate": 0.0004997680160081414, "loss": 5.805, "mean_token_accuracy": 0.15401693433523178, "num_tokens": 5337591.0, "step": 2580 }, { "entropy": 5.923111820220948, "epoch": 0.23448838896952104, "grad_norm": 0.93359375, "learning_rate": 0.0004997665447535573, "loss": 5.798, "mean_token_accuracy": 0.15265310406684876, "num_tokens": 5349400.0, "step": 2585 }, { "entropy": 6.048951911926269, "epoch": 0.23494194484760522, "grad_norm": 1.0234375, "learning_rate": 0.0004997650688507438, "loss": 5.7909, "mean_token_accuracy": 0.1504625990986824, "num_tokens": 5359984.0, "step": 2590 }, { "entropy": 5.95233383178711, "epoch": 0.2353955007256894, "grad_norm": 0.9765625, "learning_rate": 0.0004997635882997314, "loss": 5.8509, "mean_token_accuracy": 0.15640779882669448, "num_tokens": 5369254.0, "step": 2595 }, { "entropy": 5.96616530418396, "epoch": 0.2358490566037736, "grad_norm": 0.90625, "learning_rate": 0.0004997621031005507, "loss": 5.7868, "mean_token_accuracy": 0.15061139017343522, "num_tokens": 5379648.0, "step": 2600 }, { "entropy": 5.9050251007080075, "epoch": 0.23630261248185777, "grad_norm": 0.95703125, "learning_rate": 0.0004997606132532325, "loss": 5.7438, "mean_token_accuracy": 0.1579679898917675, "num_tokens": 5390321.0, "step": 2605 }, { "entropy": 5.978159952163696, "epoch": 0.23675616835994195, "grad_norm": 1.03125, "learning_rate": 0.0004997591187578075, "loss": 5.7975, "mean_token_accuracy": 0.15755213797092438, "num_tokens": 5401078.0, "step": 2610 }, { "entropy": 5.922601938247681, "epoch": 0.23720972423802614, "grad_norm": 1.0234375, "learning_rate": 0.0004997576196143067, "loss": 5.7705, "mean_token_accuracy": 0.15626103281974793, "num_tokens": 5411977.0, "step": 2615 }, { "entropy": 5.919599151611328, "epoch": 0.2376632801161103, "grad_norm": 0.92578125, "learning_rate": 0.000499756115822761, "loss": 5.7429, "mean_token_accuracy": 0.14914836585521699, "num_tokens": 5422967.0, "step": 2620 }, { "entropy": 6.0454573154449465, "epoch": 0.23811683599419448, "grad_norm": 0.9375, "learning_rate": 0.0004997546073832015, "loss": 5.7987, "mean_token_accuracy": 0.16146147549152373, "num_tokens": 5432260.0, "step": 2625 }, { "entropy": 5.874481344223023, "epoch": 0.23857039187227866, "grad_norm": 0.97265625, "learning_rate": 0.0004997530942956595, "loss": 5.7685, "mean_token_accuracy": 0.15337550789117813, "num_tokens": 5441706.0, "step": 2630 }, { "entropy": 5.954086065292358, "epoch": 0.23902394775036284, "grad_norm": 0.94140625, "learning_rate": 0.0004997515765601662, "loss": 5.7734, "mean_token_accuracy": 0.16176194995641707, "num_tokens": 5452397.0, "step": 2635 }, { "entropy": 5.8905235767364506, "epoch": 0.23947750362844702, "grad_norm": 0.796875, "learning_rate": 0.0004997500541767531, "loss": 5.732, "mean_token_accuracy": 0.15274471640586854, "num_tokens": 5463762.0, "step": 2640 }, { "entropy": 5.96301908493042, "epoch": 0.2399310595065312, "grad_norm": 0.94921875, "learning_rate": 0.0004997485271454516, "loss": 5.8042, "mean_token_accuracy": 0.14668141603469848, "num_tokens": 5474622.0, "step": 2645 }, { "entropy": 5.9286675453186035, "epoch": 0.2403846153846154, "grad_norm": 1.015625, "learning_rate": 0.0004997469954662933, "loss": 5.7846, "mean_token_accuracy": 0.1540173590183258, "num_tokens": 5484697.0, "step": 2650 }, { "entropy": 5.917514657974243, "epoch": 0.24083817126269957, "grad_norm": 0.9765625, "learning_rate": 0.0004997454591393097, "loss": 5.7995, "mean_token_accuracy": 0.15156363248825072, "num_tokens": 5496433.0, "step": 2655 }, { "entropy": 6.03740963935852, "epoch": 0.24129172714078376, "grad_norm": 0.890625, "learning_rate": 0.0004997439181645329, "loss": 5.9087, "mean_token_accuracy": 0.14503674134612082, "num_tokens": 5507917.0, "step": 2660 }, { "entropy": 6.060143232345581, "epoch": 0.2417452830188679, "grad_norm": 0.9375, "learning_rate": 0.0004997423725419945, "loss": 5.8745, "mean_token_accuracy": 0.14898139089345933, "num_tokens": 5519159.0, "step": 2665 }, { "entropy": 5.990707302093506, "epoch": 0.2421988388969521, "grad_norm": 0.98828125, "learning_rate": 0.0004997408222717267, "loss": 5.8503, "mean_token_accuracy": 0.15473444908857345, "num_tokens": 5529180.0, "step": 2670 }, { "entropy": 5.912744617462158, "epoch": 0.24265239477503628, "grad_norm": 0.89453125, "learning_rate": 0.0004997392673537612, "loss": 5.7518, "mean_token_accuracy": 0.1590703994035721, "num_tokens": 5539363.0, "step": 2675 }, { "entropy": 5.91375207901001, "epoch": 0.24310595065312046, "grad_norm": 0.85546875, "learning_rate": 0.0004997377077881306, "loss": 5.8534, "mean_token_accuracy": 0.15084453225135802, "num_tokens": 5549841.0, "step": 2680 }, { "entropy": 5.941425514221192, "epoch": 0.24355950653120464, "grad_norm": 0.953125, "learning_rate": 0.0004997361435748668, "loss": 5.7527, "mean_token_accuracy": 0.1558105766773224, "num_tokens": 5560299.0, "step": 2685 }, { "entropy": 5.983996868133545, "epoch": 0.24401306240928883, "grad_norm": 0.88671875, "learning_rate": 0.0004997345747140024, "loss": 5.818, "mean_token_accuracy": 0.1520366132259369, "num_tokens": 5571081.0, "step": 2690 }, { "entropy": 5.893987655639648, "epoch": 0.244466618287373, "grad_norm": 0.8828125, "learning_rate": 0.0004997330012055695, "loss": 5.7623, "mean_token_accuracy": 0.1579376369714737, "num_tokens": 5581389.0, "step": 2695 }, { "entropy": 5.951496028900147, "epoch": 0.2449201741654572, "grad_norm": 0.98828125, "learning_rate": 0.0004997314230496011, "loss": 5.7861, "mean_token_accuracy": 0.14917654246091844, "num_tokens": 5592347.0, "step": 2700 }, { "entropy": 5.928359746932983, "epoch": 0.24537373004354138, "grad_norm": 0.8984375, "learning_rate": 0.0004997298402461296, "loss": 5.7622, "mean_token_accuracy": 0.1548761934041977, "num_tokens": 5603411.0, "step": 2705 }, { "entropy": 5.997703504562378, "epoch": 0.24582728592162553, "grad_norm": 0.83984375, "learning_rate": 0.0004997282527951876, "loss": 5.7484, "mean_token_accuracy": 0.1618112340569496, "num_tokens": 5614615.0, "step": 2710 }, { "entropy": 5.855966997146607, "epoch": 0.24628084179970972, "grad_norm": 0.9140625, "learning_rate": 0.0004997266606968081, "loss": 5.7219, "mean_token_accuracy": 0.1555338978767395, "num_tokens": 5624582.0, "step": 2715 }, { "entropy": 5.882028532028198, "epoch": 0.2467343976777939, "grad_norm": 1.0390625, "learning_rate": 0.0004997250639510241, "loss": 5.7521, "mean_token_accuracy": 0.1485395088791847, "num_tokens": 5634310.0, "step": 2720 }, { "entropy": 5.959417104721069, "epoch": 0.24718795355587808, "grad_norm": 0.94140625, "learning_rate": 0.0004997234625578684, "loss": 5.8284, "mean_token_accuracy": 0.1493539556860924, "num_tokens": 5644018.0, "step": 2725 }, { "entropy": 5.905500411987305, "epoch": 0.24764150943396226, "grad_norm": 0.953125, "learning_rate": 0.0004997218565173742, "loss": 5.7685, "mean_token_accuracy": 0.15543410778045655, "num_tokens": 5653592.0, "step": 2730 }, { "entropy": 5.994117975234985, "epoch": 0.24809506531204645, "grad_norm": 0.984375, "learning_rate": 0.0004997202458295748, "loss": 5.829, "mean_token_accuracy": 0.15618719160556793, "num_tokens": 5662812.0, "step": 2735 }, { "entropy": 5.947774648666382, "epoch": 0.24854862119013063, "grad_norm": 0.921875, "learning_rate": 0.0004997186304945034, "loss": 5.7997, "mean_token_accuracy": 0.15028751492500306, "num_tokens": 5672939.0, "step": 2740 }, { "entropy": 5.8947399139404295, "epoch": 0.24900217706821481, "grad_norm": 0.890625, "learning_rate": 0.0004997170105121935, "loss": 5.7789, "mean_token_accuracy": 0.15528277158737183, "num_tokens": 5683350.0, "step": 2745 }, { "entropy": 6.005437898635864, "epoch": 0.249455732946299, "grad_norm": 0.828125, "learning_rate": 0.0004997153858826786, "loss": 5.8528, "mean_token_accuracy": 0.1439196802675724, "num_tokens": 5694516.0, "step": 2750 }, { "entropy": 5.938060188293457, "epoch": 0.24990928882438315, "grad_norm": 0.9375, "learning_rate": 0.0004997137566059922, "loss": 5.6847, "mean_token_accuracy": 0.15682510733604432, "num_tokens": 5705443.0, "step": 2755 }, { "entropy": 5.872813892364502, "epoch": 0.25036284470246734, "grad_norm": 0.921875, "learning_rate": 0.0004997121226821681, "loss": 5.7821, "mean_token_accuracy": 0.15022583901882172, "num_tokens": 5715933.0, "step": 2760 }, { "entropy": 5.941016101837159, "epoch": 0.25081640058055155, "grad_norm": 0.953125, "learning_rate": 0.00049971048411124, "loss": 5.8439, "mean_token_accuracy": 0.14352803230285643, "num_tokens": 5726630.0, "step": 2765 }, { "entropy": 6.003946161270141, "epoch": 0.2512699564586357, "grad_norm": 0.91796875, "learning_rate": 0.0004997088408932418, "loss": 5.7792, "mean_token_accuracy": 0.1525881379842758, "num_tokens": 5736890.0, "step": 2770 }, { "entropy": 5.804270029067993, "epoch": 0.25172351233671986, "grad_norm": 0.9140625, "learning_rate": 0.0004997071930282076, "loss": 5.6826, "mean_token_accuracy": 0.16186858713626862, "num_tokens": 5747042.0, "step": 2775 }, { "entropy": 5.935064744949341, "epoch": 0.25217706821480407, "grad_norm": 0.92578125, "learning_rate": 0.0004997055405161712, "loss": 5.7996, "mean_token_accuracy": 0.1525806337594986, "num_tokens": 5757367.0, "step": 2780 }, { "entropy": 5.97401123046875, "epoch": 0.2526306240928882, "grad_norm": 0.9140625, "learning_rate": 0.0004997038833571671, "loss": 5.8662, "mean_token_accuracy": 0.1486934617161751, "num_tokens": 5769557.0, "step": 2785 }, { "entropy": 5.932326173782348, "epoch": 0.25308417997097243, "grad_norm": 0.875, "learning_rate": 0.0004997022215512295, "loss": 5.7594, "mean_token_accuracy": 0.1602458581328392, "num_tokens": 5780615.0, "step": 2790 }, { "entropy": 5.959806776046753, "epoch": 0.2535377358490566, "grad_norm": 0.86328125, "learning_rate": 0.0004997005550983925, "loss": 5.737, "mean_token_accuracy": 0.15268604904413224, "num_tokens": 5791271.0, "step": 2795 }, { "entropy": 5.863793230056762, "epoch": 0.2539912917271408, "grad_norm": 1.046875, "learning_rate": 0.000499698883998691, "loss": 5.6886, "mean_token_accuracy": 0.15530947148799895, "num_tokens": 5801117.0, "step": 2800 }, { "entropy": 5.88543930053711, "epoch": 0.25444484760522496, "grad_norm": 0.94921875, "learning_rate": 0.0004996972082521591, "loss": 5.7122, "mean_token_accuracy": 0.1563066676259041, "num_tokens": 5811696.0, "step": 2805 }, { "entropy": 5.911672639846802, "epoch": 0.25489840348330917, "grad_norm": 0.9140625, "learning_rate": 0.0004996955278588319, "loss": 5.738, "mean_token_accuracy": 0.16307492852210997, "num_tokens": 5822207.0, "step": 2810 }, { "entropy": 5.838271713256836, "epoch": 0.2553519593613933, "grad_norm": 0.87890625, "learning_rate": 0.0004996938428187437, "loss": 5.7025, "mean_token_accuracy": 0.15967562049627304, "num_tokens": 5831927.0, "step": 2815 }, { "entropy": 5.887790107727051, "epoch": 0.2558055152394775, "grad_norm": 0.9140625, "learning_rate": 0.0004996921531319297, "loss": 5.7578, "mean_token_accuracy": 0.15641293302178383, "num_tokens": 5842093.0, "step": 2820 }, { "entropy": 5.887936401367187, "epoch": 0.2562590711175617, "grad_norm": 0.9921875, "learning_rate": 0.0004996904587984246, "loss": 5.704, "mean_token_accuracy": 0.16297227442264556, "num_tokens": 5850551.0, "step": 2825 }, { "entropy": 5.81576018333435, "epoch": 0.25671262699564584, "grad_norm": 0.9453125, "learning_rate": 0.0004996887598182636, "loss": 5.6901, "mean_token_accuracy": 0.15636582523584366, "num_tokens": 5860651.0, "step": 2830 }, { "entropy": 5.827975130081176, "epoch": 0.25716618287373005, "grad_norm": 0.95703125, "learning_rate": 0.0004996870561914819, "loss": 5.6698, "mean_token_accuracy": 0.15702708512544633, "num_tokens": 5871500.0, "step": 2835 }, { "entropy": 5.840231275558471, "epoch": 0.2576197387518142, "grad_norm": 0.921875, "learning_rate": 0.0004996853479181145, "loss": 5.6725, "mean_token_accuracy": 0.15341195613145828, "num_tokens": 5881523.0, "step": 2840 }, { "entropy": 5.9528480052948, "epoch": 0.2580732946298984, "grad_norm": 1.0, "learning_rate": 0.0004996836349981969, "loss": 5.8174, "mean_token_accuracy": 0.15260155200958253, "num_tokens": 5891162.0, "step": 2845 }, { "entropy": 5.902073764801026, "epoch": 0.2585268505079826, "grad_norm": 0.9296875, "learning_rate": 0.0004996819174317645, "loss": 5.7173, "mean_token_accuracy": 0.1552115336060524, "num_tokens": 5901818.0, "step": 2850 }, { "entropy": 5.874346494674683, "epoch": 0.2589804063860668, "grad_norm": 0.9609375, "learning_rate": 0.0004996801952188528, "loss": 5.79, "mean_token_accuracy": 0.15259438008069992, "num_tokens": 5913889.0, "step": 2855 }, { "entropy": 5.9258890628814695, "epoch": 0.25943396226415094, "grad_norm": 0.93359375, "learning_rate": 0.0004996784683594973, "loss": 5.7571, "mean_token_accuracy": 0.156342051923275, "num_tokens": 5923429.0, "step": 2860 }, { "entropy": 5.998136568069458, "epoch": 0.2598875181422351, "grad_norm": 0.95703125, "learning_rate": 0.0004996767368537338, "loss": 5.7779, "mean_token_accuracy": 0.15545209050178527, "num_tokens": 5933847.0, "step": 2865 }, { "entropy": 5.854821443557739, "epoch": 0.2603410740203193, "grad_norm": 0.8984375, "learning_rate": 0.0004996750007015983, "loss": 5.6677, "mean_token_accuracy": 0.15953482687473297, "num_tokens": 5943874.0, "step": 2870 }, { "entropy": 5.930334520339966, "epoch": 0.26079462989840346, "grad_norm": 0.8828125, "learning_rate": 0.0004996732599031264, "loss": 5.7357, "mean_token_accuracy": 0.1538098156452179, "num_tokens": 5953653.0, "step": 2875 }, { "entropy": 5.918991279602051, "epoch": 0.2612481857764877, "grad_norm": 0.90234375, "learning_rate": 0.0004996715144583543, "loss": 5.6866, "mean_token_accuracy": 0.15937823802232742, "num_tokens": 5964039.0, "step": 2880 }, { "entropy": 5.940640115737915, "epoch": 0.26170174165457183, "grad_norm": 0.98828125, "learning_rate": 0.000499669764367318, "loss": 5.8108, "mean_token_accuracy": 0.15168801695108414, "num_tokens": 5974083.0, "step": 2885 }, { "entropy": 5.8325118064880375, "epoch": 0.26215529753265604, "grad_norm": 0.9609375, "learning_rate": 0.0004996680096300537, "loss": 5.7435, "mean_token_accuracy": 0.15367064327001573, "num_tokens": 5984629.0, "step": 2890 }, { "entropy": 5.8481368064880375, "epoch": 0.2626088534107402, "grad_norm": 0.94140625, "learning_rate": 0.0004996662502465978, "loss": 5.6702, "mean_token_accuracy": 0.1644247755408287, "num_tokens": 5994295.0, "step": 2895 }, { "entropy": 5.873128223419189, "epoch": 0.2630624092888244, "grad_norm": 0.92578125, "learning_rate": 0.0004996644862169864, "loss": 5.7046, "mean_token_accuracy": 0.15299894511699677, "num_tokens": 6004156.0, "step": 2900 }, { "entropy": 5.876518249511719, "epoch": 0.26351596516690856, "grad_norm": 0.96484375, "learning_rate": 0.0004996627175412563, "loss": 5.7805, "mean_token_accuracy": 0.15570748448371888, "num_tokens": 6014188.0, "step": 2905 }, { "entropy": 5.96129150390625, "epoch": 0.2639695210449927, "grad_norm": 0.84765625, "learning_rate": 0.000499660944219444, "loss": 5.8435, "mean_token_accuracy": 0.1530625268816948, "num_tokens": 6024879.0, "step": 2910 }, { "entropy": 5.983526945114136, "epoch": 0.2644230769230769, "grad_norm": 0.8203125, "learning_rate": 0.0004996591662515861, "loss": 5.8974, "mean_token_accuracy": 0.15041209682822226, "num_tokens": 6036374.0, "step": 2915 }, { "entropy": 5.880353546142578, "epoch": 0.2648766328011611, "grad_norm": 0.94140625, "learning_rate": 0.0004996573836377193, "loss": 5.7655, "mean_token_accuracy": 0.1547638565301895, "num_tokens": 6046432.0, "step": 2920 }, { "entropy": 5.962761545181275, "epoch": 0.2653301886792453, "grad_norm": 1.015625, "learning_rate": 0.0004996555963778806, "loss": 5.763, "mean_token_accuracy": 0.15179126113653182, "num_tokens": 6056864.0, "step": 2925 }, { "entropy": 6.006943416595459, "epoch": 0.26578374455732945, "grad_norm": 0.921875, "learning_rate": 0.000499653804472107, "loss": 5.7827, "mean_token_accuracy": 0.15777789205312728, "num_tokens": 6067294.0, "step": 2930 }, { "entropy": 5.932409477233887, "epoch": 0.26623730043541366, "grad_norm": 0.921875, "learning_rate": 0.0004996520079204353, "loss": 5.7948, "mean_token_accuracy": 0.15130407512187957, "num_tokens": 6077587.0, "step": 2935 }, { "entropy": 5.947808265686035, "epoch": 0.2666908563134978, "grad_norm": 0.84375, "learning_rate": 0.000499650206722903, "loss": 5.7315, "mean_token_accuracy": 0.1543162226676941, "num_tokens": 6089306.0, "step": 2940 }, { "entropy": 5.866966199874878, "epoch": 0.267144412191582, "grad_norm": 0.9140625, "learning_rate": 0.0004996484008795471, "loss": 5.6891, "mean_token_accuracy": 0.15265745371580125, "num_tokens": 6099651.0, "step": 2945 }, { "entropy": 5.864347743988037, "epoch": 0.2675979680696662, "grad_norm": 0.95703125, "learning_rate": 0.000499646590390405, "loss": 5.688, "mean_token_accuracy": 0.1571669578552246, "num_tokens": 6110063.0, "step": 2950 }, { "entropy": 5.873627424240112, "epoch": 0.26805152394775034, "grad_norm": 0.96875, "learning_rate": 0.0004996447752555142, "loss": 5.7144, "mean_token_accuracy": 0.15664682239294053, "num_tokens": 6120031.0, "step": 2955 }, { "entropy": 5.848915719985962, "epoch": 0.26850507982583455, "grad_norm": 0.85546875, "learning_rate": 0.0004996429554749122, "loss": 5.7616, "mean_token_accuracy": 0.15996424555778505, "num_tokens": 6131274.0, "step": 2960 }, { "entropy": 5.9580456733703615, "epoch": 0.2689586357039187, "grad_norm": 0.921875, "learning_rate": 0.0004996411310486367, "loss": 5.8021, "mean_token_accuracy": 0.1580547109246254, "num_tokens": 6140878.0, "step": 2965 }, { "entropy": 5.900578355789184, "epoch": 0.2694121915820029, "grad_norm": 0.84375, "learning_rate": 0.0004996393019767253, "loss": 5.7986, "mean_token_accuracy": 0.15211150646209717, "num_tokens": 6152229.0, "step": 2970 }, { "entropy": 5.871568775177002, "epoch": 0.26986574746008707, "grad_norm": 0.82421875, "learning_rate": 0.0004996374682592158, "loss": 5.6994, "mean_token_accuracy": 0.15565146058797835, "num_tokens": 6162311.0, "step": 2975 }, { "entropy": 5.939528369903565, "epoch": 0.2703193033381713, "grad_norm": 0.8828125, "learning_rate": 0.0004996356298961463, "loss": 5.8077, "mean_token_accuracy": 0.15412216633558273, "num_tokens": 6172806.0, "step": 2980 }, { "entropy": 5.916967105865479, "epoch": 0.27077285921625543, "grad_norm": 0.98828125, "learning_rate": 0.0004996337868875549, "loss": 5.774, "mean_token_accuracy": 0.15645444989204407, "num_tokens": 6183479.0, "step": 2985 }, { "entropy": 5.928597736358642, "epoch": 0.27122641509433965, "grad_norm": 0.87890625, "learning_rate": 0.0004996319392334792, "loss": 5.7363, "mean_token_accuracy": 0.1543424740433693, "num_tokens": 6194201.0, "step": 2990 }, { "entropy": 5.853014802932739, "epoch": 0.2716799709724238, "grad_norm": 0.95703125, "learning_rate": 0.000499630086933958, "loss": 5.6793, "mean_token_accuracy": 0.15483027845621108, "num_tokens": 6204774.0, "step": 2995 }, { "entropy": 5.876689767837524, "epoch": 0.27213352685050796, "grad_norm": 0.890625, "learning_rate": 0.0004996282299890292, "loss": 5.6781, "mean_token_accuracy": 0.15287237316370011, "num_tokens": 6215056.0, "step": 3000 }, { "epoch": 0.27213352685050796, "eval_entropy": 5.712364828856282, "eval_loss": 5.759267330169678, "eval_mean_token_accuracy": 0.1617233954799863, "eval_num_tokens": 6215056.0, "eval_runtime": 21.065, "eval_samples_per_second": 1678.618, "eval_steps_per_second": 209.827, "step": 3000 }, { "entropy": 5.969257974624634, "epoch": 0.27258708272859217, "grad_norm": 0.84375, "learning_rate": 0.0004996263683987316, "loss": 5.7935, "mean_token_accuracy": 0.15573310405015944, "num_tokens": 6226264.0, "step": 3005 }, { "entropy": 5.891745710372925, "epoch": 0.2730406386066763, "grad_norm": 0.96875, "learning_rate": 0.0004996245021631033, "loss": 5.7187, "mean_token_accuracy": 0.16169505268335344, "num_tokens": 6235137.0, "step": 3010 }, { "entropy": 5.822071361541748, "epoch": 0.27349419448476053, "grad_norm": 0.95703125, "learning_rate": 0.000499622631282183, "loss": 5.7275, "mean_token_accuracy": 0.1584876984357834, "num_tokens": 6245411.0, "step": 3015 }, { "entropy": 5.966612482070923, "epoch": 0.2739477503628447, "grad_norm": 0.97265625, "learning_rate": 0.0004996207557560095, "loss": 5.7953, "mean_token_accuracy": 0.152059169113636, "num_tokens": 6255633.0, "step": 3020 }, { "entropy": 5.933960390090943, "epoch": 0.2744013062409289, "grad_norm": 0.96484375, "learning_rate": 0.0004996188755846216, "loss": 5.7423, "mean_token_accuracy": 0.15434571653604506, "num_tokens": 6265109.0, "step": 3025 }, { "entropy": 5.862824583053589, "epoch": 0.27485486211901305, "grad_norm": 0.9609375, "learning_rate": 0.000499616990768058, "loss": 5.7933, "mean_token_accuracy": 0.14787728786468507, "num_tokens": 6275241.0, "step": 3030 }, { "entropy": 5.949290132522583, "epoch": 0.27530841799709727, "grad_norm": 0.87890625, "learning_rate": 0.0004996151013063579, "loss": 5.8252, "mean_token_accuracy": 0.14647485911846161, "num_tokens": 6286603.0, "step": 3035 }, { "entropy": 5.912906169891357, "epoch": 0.2757619738751814, "grad_norm": 0.90625, "learning_rate": 0.0004996132071995601, "loss": 5.6852, "mean_token_accuracy": 0.16648433357477188, "num_tokens": 6297219.0, "step": 3040 }, { "entropy": 5.883165311813355, "epoch": 0.2762155297532656, "grad_norm": 1.0546875, "learning_rate": 0.0004996113084477042, "loss": 5.719, "mean_token_accuracy": 0.16386881619691848, "num_tokens": 6307694.0, "step": 3045 }, { "entropy": 5.807434129714966, "epoch": 0.2766690856313498, "grad_norm": 0.96484375, "learning_rate": 0.0004996094050508291, "loss": 5.6527, "mean_token_accuracy": 0.16033376455307008, "num_tokens": 6317384.0, "step": 3050 }, { "entropy": 5.947029972076416, "epoch": 0.27712264150943394, "grad_norm": 0.96484375, "learning_rate": 0.0004996074970089741, "loss": 5.7779, "mean_token_accuracy": 0.15559548288583755, "num_tokens": 6327558.0, "step": 3055 }, { "entropy": 5.87425684928894, "epoch": 0.27757619738751815, "grad_norm": 1.03125, "learning_rate": 0.0004996055843221789, "loss": 5.6409, "mean_token_accuracy": 0.1627122566103935, "num_tokens": 6337828.0, "step": 3060 }, { "entropy": 5.822861051559448, "epoch": 0.2780297532656023, "grad_norm": 0.9296875, "learning_rate": 0.0004996036669904831, "loss": 5.7058, "mean_token_accuracy": 0.16010485142469405, "num_tokens": 6348678.0, "step": 3065 }, { "entropy": 5.901842355728149, "epoch": 0.2784833091436865, "grad_norm": 0.9296875, "learning_rate": 0.0004996017450139261, "loss": 5.7969, "mean_token_accuracy": 0.1491397202014923, "num_tokens": 6359670.0, "step": 3070 }, { "entropy": 5.95522518157959, "epoch": 0.2789368650217707, "grad_norm": 0.87890625, "learning_rate": 0.0004995998183925478, "loss": 5.7541, "mean_token_accuracy": 0.15521771609783172, "num_tokens": 6371034.0, "step": 3075 }, { "entropy": 5.83247013092041, "epoch": 0.2793904208998549, "grad_norm": 1.0078125, "learning_rate": 0.0004995978871263881, "loss": 5.7014, "mean_token_accuracy": 0.15728666633367538, "num_tokens": 6380672.0, "step": 3080 }, { "entropy": 5.874285125732422, "epoch": 0.27984397677793904, "grad_norm": 1.046875, "learning_rate": 0.0004995959512154868, "loss": 5.8151, "mean_token_accuracy": 0.14317371249198912, "num_tokens": 6390799.0, "step": 3085 }, { "entropy": 5.8934972286224365, "epoch": 0.2802975326560232, "grad_norm": 0.87890625, "learning_rate": 0.000499594010659884, "loss": 5.6884, "mean_token_accuracy": 0.16007015258073806, "num_tokens": 6400965.0, "step": 3090 }, { "entropy": 5.899712657928466, "epoch": 0.2807510885341074, "grad_norm": 0.875, "learning_rate": 0.0004995920654596199, "loss": 5.7049, "mean_token_accuracy": 0.1535528853535652, "num_tokens": 6411567.0, "step": 3095 }, { "entropy": 5.8801034450531, "epoch": 0.28120464441219156, "grad_norm": 0.93359375, "learning_rate": 0.0004995901156147345, "loss": 5.7613, "mean_token_accuracy": 0.1587476283311844, "num_tokens": 6421193.0, "step": 3100 }, { "entropy": 5.9482683658599855, "epoch": 0.2816582002902758, "grad_norm": 1.03125, "learning_rate": 0.0004995881611252684, "loss": 5.7637, "mean_token_accuracy": 0.164001926779747, "num_tokens": 6430281.0, "step": 3105 }, { "entropy": 5.899417304992676, "epoch": 0.28211175616835993, "grad_norm": 0.8515625, "learning_rate": 0.0004995862019912619, "loss": 5.756, "mean_token_accuracy": 0.15074933171272278, "num_tokens": 6441055.0, "step": 3110 }, { "entropy": 5.860140228271485, "epoch": 0.28256531204644414, "grad_norm": 0.9921875, "learning_rate": 0.0004995842382127555, "loss": 5.6706, "mean_token_accuracy": 0.15401192158460617, "num_tokens": 6451082.0, "step": 3115 }, { "entropy": 5.84559817314148, "epoch": 0.2830188679245283, "grad_norm": 0.8828125, "learning_rate": 0.0004995822697897897, "loss": 5.7639, "mean_token_accuracy": 0.1507149502635002, "num_tokens": 6461617.0, "step": 3120 }, { "entropy": 5.967565059661865, "epoch": 0.2834724238026125, "grad_norm": 0.890625, "learning_rate": 0.0004995802967224056, "loss": 5.7685, "mean_token_accuracy": 0.15601267218589782, "num_tokens": 6472780.0, "step": 3125 }, { "entropy": 5.77694001197815, "epoch": 0.28392597968069666, "grad_norm": 0.91796875, "learning_rate": 0.0004995783190106434, "loss": 5.6677, "mean_token_accuracy": 0.15176742225885392, "num_tokens": 6484078.0, "step": 3130 }, { "entropy": 5.900559663772583, "epoch": 0.2843795355587808, "grad_norm": 0.921875, "learning_rate": 0.0004995763366545445, "loss": 5.7619, "mean_token_accuracy": 0.15375943332910538, "num_tokens": 6494366.0, "step": 3135 }, { "entropy": 5.787074327468872, "epoch": 0.284833091436865, "grad_norm": 0.91796875, "learning_rate": 0.0004995743496541497, "loss": 5.6902, "mean_token_accuracy": 0.16150298565626145, "num_tokens": 6505461.0, "step": 3140 }, { "entropy": 5.881974554061889, "epoch": 0.2852866473149492, "grad_norm": 0.875, "learning_rate": 0.0004995723580095001, "loss": 5.6923, "mean_token_accuracy": 0.15881099700927734, "num_tokens": 6516141.0, "step": 3145 }, { "entropy": 5.84017424583435, "epoch": 0.2857402031930334, "grad_norm": 0.94921875, "learning_rate": 0.000499570361720637, "loss": 5.7058, "mean_token_accuracy": 0.1565474107861519, "num_tokens": 6525536.0, "step": 3150 }, { "entropy": 5.8899266719818115, "epoch": 0.28619375907111755, "grad_norm": 0.875, "learning_rate": 0.0004995683607876015, "loss": 5.7579, "mean_token_accuracy": 0.15209461599588395, "num_tokens": 6535852.0, "step": 3155 }, { "entropy": 5.924435234069824, "epoch": 0.28664731494920176, "grad_norm": 0.921875, "learning_rate": 0.0004995663552104352, "loss": 5.7252, "mean_token_accuracy": 0.16235753893852234, "num_tokens": 6546353.0, "step": 3160 }, { "entropy": 5.779373979568481, "epoch": 0.2871008708272859, "grad_norm": 0.8984375, "learning_rate": 0.0004995643449891793, "loss": 5.6751, "mean_token_accuracy": 0.1516367569565773, "num_tokens": 6557782.0, "step": 3165 }, { "entropy": 5.916032218933106, "epoch": 0.2875544267053701, "grad_norm": 0.96875, "learning_rate": 0.0004995623301238757, "loss": 5.6995, "mean_token_accuracy": 0.15973981767892836, "num_tokens": 6568100.0, "step": 3170 }, { "entropy": 5.865595197677612, "epoch": 0.2880079825834543, "grad_norm": 0.9296875, "learning_rate": 0.0004995603106145657, "loss": 5.7505, "mean_token_accuracy": 0.15267078280448915, "num_tokens": 6578698.0, "step": 3175 }, { "entropy": 5.876104164123535, "epoch": 0.28846153846153844, "grad_norm": 0.9765625, "learning_rate": 0.0004995582864612913, "loss": 5.7308, "mean_token_accuracy": 0.1522951140999794, "num_tokens": 6588908.0, "step": 3180 }, { "entropy": 5.780710887908936, "epoch": 0.28891509433962265, "grad_norm": 0.91796875, "learning_rate": 0.0004995562576640943, "loss": 5.589, "mean_token_accuracy": 0.15807687640190124, "num_tokens": 6599445.0, "step": 3185 }, { "entropy": 5.823026847839356, "epoch": 0.2893686502177068, "grad_norm": 0.9921875, "learning_rate": 0.0004995542242230167, "loss": 5.6838, "mean_token_accuracy": 0.16184857338666916, "num_tokens": 6610246.0, "step": 3190 }, { "entropy": 5.840323448181152, "epoch": 0.289822206095791, "grad_norm": 0.86328125, "learning_rate": 0.0004995521861381006, "loss": 5.6896, "mean_token_accuracy": 0.16104330569505693, "num_tokens": 6620501.0, "step": 3195 }, { "entropy": 5.950109958648682, "epoch": 0.29027576197387517, "grad_norm": 0.84765625, "learning_rate": 0.000499550143409388, "loss": 5.7599, "mean_token_accuracy": 0.1512766182422638, "num_tokens": 6631206.0, "step": 3200 }, { "entropy": 5.829269504547119, "epoch": 0.2907293178519594, "grad_norm": 0.88671875, "learning_rate": 0.0004995480960369211, "loss": 5.7188, "mean_token_accuracy": 0.1548565149307251, "num_tokens": 6641600.0, "step": 3205 }, { "entropy": 5.827369594573975, "epoch": 0.29118287373004353, "grad_norm": 0.9375, "learning_rate": 0.0004995460440207425, "loss": 5.7759, "mean_token_accuracy": 0.15423371642827988, "num_tokens": 6652319.0, "step": 3210 }, { "entropy": 5.945125961303711, "epoch": 0.29163642960812775, "grad_norm": 0.890625, "learning_rate": 0.0004995439873608945, "loss": 5.712, "mean_token_accuracy": 0.14905817657709122, "num_tokens": 6663702.0, "step": 3215 }, { "entropy": 5.812268924713135, "epoch": 0.2920899854862119, "grad_norm": 0.90234375, "learning_rate": 0.0004995419260574196, "loss": 5.7027, "mean_token_accuracy": 0.1491316169500351, "num_tokens": 6673908.0, "step": 3220 }, { "entropy": 5.916238164901733, "epoch": 0.29254354136429606, "grad_norm": 1.0078125, "learning_rate": 0.0004995398601103603, "loss": 5.727, "mean_token_accuracy": 0.15841997563838958, "num_tokens": 6683237.0, "step": 3225 }, { "entropy": 5.824212837219238, "epoch": 0.29299709724238027, "grad_norm": 0.984375, "learning_rate": 0.0004995377895197597, "loss": 5.6527, "mean_token_accuracy": 0.15979209095239638, "num_tokens": 6693451.0, "step": 3230 }, { "entropy": 5.761458158493042, "epoch": 0.2934506531204644, "grad_norm": 0.96484375, "learning_rate": 0.0004995357142856602, "loss": 5.6124, "mean_token_accuracy": 0.15973278135061264, "num_tokens": 6703479.0, "step": 3235 }, { "entropy": 5.817833805084229, "epoch": 0.29390420899854863, "grad_norm": 0.83984375, "learning_rate": 0.000499533634408105, "loss": 5.619, "mean_token_accuracy": 0.15864339768886565, "num_tokens": 6715321.0, "step": 3240 }, { "entropy": 5.808075428009033, "epoch": 0.2943577648766328, "grad_norm": 0.88671875, "learning_rate": 0.000499531549887137, "loss": 5.6835, "mean_token_accuracy": 0.15339466109871863, "num_tokens": 6725541.0, "step": 3245 }, { "entropy": 5.856081151962281, "epoch": 0.294811320754717, "grad_norm": 1.0546875, "learning_rate": 0.0004995294607227993, "loss": 5.7241, "mean_token_accuracy": 0.16161034405231475, "num_tokens": 6735165.0, "step": 3250 }, { "entropy": 5.899437427520752, "epoch": 0.29526487663280115, "grad_norm": 1.0390625, "learning_rate": 0.0004995273669151351, "loss": 5.7105, "mean_token_accuracy": 0.16171984821558, "num_tokens": 6744245.0, "step": 3255 }, { "entropy": 5.866788148880005, "epoch": 0.29571843251088537, "grad_norm": 1.0234375, "learning_rate": 0.000499525268464188, "loss": 5.6832, "mean_token_accuracy": 0.16346385776996614, "num_tokens": 6754894.0, "step": 3260 }, { "entropy": 5.863985061645508, "epoch": 0.2961719883889695, "grad_norm": 0.9296875, "learning_rate": 0.0004995231653700009, "loss": 5.7333, "mean_token_accuracy": 0.15298420935869217, "num_tokens": 6764442.0, "step": 3265 }, { "entropy": 5.820025396347046, "epoch": 0.2966255442670537, "grad_norm": 0.8828125, "learning_rate": 0.0004995210576326176, "loss": 5.6891, "mean_token_accuracy": 0.15496449172496796, "num_tokens": 6775054.0, "step": 3270 }, { "entropy": 5.862255716323853, "epoch": 0.2970791001451379, "grad_norm": 0.92578125, "learning_rate": 0.0004995189452520816, "loss": 5.6861, "mean_token_accuracy": 0.16984087377786636, "num_tokens": 6784825.0, "step": 3275 }, { "entropy": 5.884560394287109, "epoch": 0.29753265602322204, "grad_norm": 0.921875, "learning_rate": 0.0004995168282284366, "loss": 5.7215, "mean_token_accuracy": 0.160723876953125, "num_tokens": 6795928.0, "step": 3280 }, { "entropy": 5.787168312072754, "epoch": 0.29798621190130625, "grad_norm": 0.87109375, "learning_rate": 0.0004995147065617263, "loss": 5.6523, "mean_token_accuracy": 0.15839823037385942, "num_tokens": 6805456.0, "step": 3285 }, { "entropy": 5.925667858123779, "epoch": 0.2984397677793904, "grad_norm": 0.9765625, "learning_rate": 0.0004995125802519946, "loss": 5.7188, "mean_token_accuracy": 0.15525027811527253, "num_tokens": 6816215.0, "step": 3290 }, { "entropy": 5.892514085769653, "epoch": 0.2988933236574746, "grad_norm": 0.9765625, "learning_rate": 0.0004995104492992857, "loss": 5.7558, "mean_token_accuracy": 0.15865902602672577, "num_tokens": 6826545.0, "step": 3295 }, { "entropy": 5.798425722122192, "epoch": 0.2993468795355588, "grad_norm": 1.046875, "learning_rate": 0.0004995083137036434, "loss": 5.6637, "mean_token_accuracy": 0.1575020283460617, "num_tokens": 6836184.0, "step": 3300 }, { "entropy": 5.924666786193848, "epoch": 0.299800435413643, "grad_norm": 0.890625, "learning_rate": 0.0004995061734651121, "loss": 5.7419, "mean_token_accuracy": 0.15869775861501695, "num_tokens": 6846646.0, "step": 3305 }, { "entropy": 5.840148878097534, "epoch": 0.30025399129172714, "grad_norm": 0.8671875, "learning_rate": 0.0004995040285837358, "loss": 5.6502, "mean_token_accuracy": 0.16409194618463516, "num_tokens": 6857597.0, "step": 3310 }, { "entropy": 5.853920841217041, "epoch": 0.3007075471698113, "grad_norm": 1.046875, "learning_rate": 0.0004995018790595589, "loss": 5.7448, "mean_token_accuracy": 0.15398296862840652, "num_tokens": 6867523.0, "step": 3315 }, { "entropy": 5.901988887786866, "epoch": 0.3011611030478955, "grad_norm": 0.96875, "learning_rate": 0.0004994997248926261, "loss": 5.8385, "mean_token_accuracy": 0.15451575368642806, "num_tokens": 6878190.0, "step": 3320 }, { "entropy": 5.849097967147827, "epoch": 0.30161465892597966, "grad_norm": 1.015625, "learning_rate": 0.0004994975660829817, "loss": 5.6408, "mean_token_accuracy": 0.16445966064929962, "num_tokens": 6888483.0, "step": 3325 }, { "entropy": 5.7745849132537845, "epoch": 0.3020682148040639, "grad_norm": 0.9609375, "learning_rate": 0.0004994954026306705, "loss": 5.6223, "mean_token_accuracy": 0.15969739556312562, "num_tokens": 6898337.0, "step": 3330 }, { "entropy": 5.876712703704834, "epoch": 0.30252177068214803, "grad_norm": 0.90625, "learning_rate": 0.0004994932345357371, "loss": 5.6971, "mean_token_accuracy": 0.15568175464868544, "num_tokens": 6909131.0, "step": 3335 }, { "entropy": 5.822457551956177, "epoch": 0.30297532656023224, "grad_norm": 1.0078125, "learning_rate": 0.0004994910617982264, "loss": 5.6823, "mean_token_accuracy": 0.15465617924928665, "num_tokens": 6919790.0, "step": 3340 }, { "entropy": 5.841094827651977, "epoch": 0.3034288824383164, "grad_norm": 0.92578125, "learning_rate": 0.0004994888844181833, "loss": 5.6997, "mean_token_accuracy": 0.16144252866506575, "num_tokens": 6930072.0, "step": 3345 }, { "entropy": 5.7801776885986325, "epoch": 0.3038824383164006, "grad_norm": 0.94140625, "learning_rate": 0.0004994867023956529, "loss": 5.5965, "mean_token_accuracy": 0.15485866814851762, "num_tokens": 6940646.0, "step": 3350 }, { "entropy": 5.740756988525391, "epoch": 0.30433599419448476, "grad_norm": 0.9609375, "learning_rate": 0.0004994845157306803, "loss": 5.5767, "mean_token_accuracy": 0.16163998693227768, "num_tokens": 6951645.0, "step": 3355 }, { "entropy": 5.876171684265136, "epoch": 0.3047895500725689, "grad_norm": 0.96875, "learning_rate": 0.0004994823244233107, "loss": 5.7416, "mean_token_accuracy": 0.1575745850801468, "num_tokens": 6963020.0, "step": 3360 }, { "entropy": 5.882272481918335, "epoch": 0.3052431059506531, "grad_norm": 1.015625, "learning_rate": 0.0004994801284735895, "loss": 5.6823, "mean_token_accuracy": 0.1615156725049019, "num_tokens": 6972895.0, "step": 3365 }, { "entropy": 5.877938604354858, "epoch": 0.3056966618287373, "grad_norm": 0.890625, "learning_rate": 0.0004994779278815619, "loss": 5.8195, "mean_token_accuracy": 0.1476362816989422, "num_tokens": 6985363.0, "step": 3370 }, { "entropy": 5.906639528274536, "epoch": 0.3061502177068215, "grad_norm": 0.953125, "learning_rate": 0.0004994757226472736, "loss": 5.7638, "mean_token_accuracy": 0.15788324922323227, "num_tokens": 6997040.0, "step": 3375 }, { "entropy": 5.863248682022094, "epoch": 0.30660377358490565, "grad_norm": 0.85546875, "learning_rate": 0.0004994735127707702, "loss": 5.6891, "mean_token_accuracy": 0.15913514643907548, "num_tokens": 7007591.0, "step": 3380 }, { "entropy": 5.887237691879273, "epoch": 0.30705732946298986, "grad_norm": 1.03125, "learning_rate": 0.0004994712982520972, "loss": 5.6886, "mean_token_accuracy": 0.1630169630050659, "num_tokens": 7017858.0, "step": 3385 }, { "entropy": 5.760348892211914, "epoch": 0.307510885341074, "grad_norm": 0.890625, "learning_rate": 0.0004994690790913008, "loss": 5.6526, "mean_token_accuracy": 0.15853054076433182, "num_tokens": 7027365.0, "step": 3390 }, { "entropy": 5.775932741165161, "epoch": 0.3079644412191582, "grad_norm": 0.90234375, "learning_rate": 0.0004994668552884265, "loss": 5.6393, "mean_token_accuracy": 0.16287402510643006, "num_tokens": 7038728.0, "step": 3395 }, { "entropy": 5.94070987701416, "epoch": 0.3084179970972424, "grad_norm": 1.078125, "learning_rate": 0.0004994646268435204, "loss": 5.5879, "mean_token_accuracy": 0.16382095515727996, "num_tokens": 7048736.0, "step": 3400 }, { "entropy": 5.77776608467102, "epoch": 0.30887155297532654, "grad_norm": 0.94921875, "learning_rate": 0.0004994623937566286, "loss": 5.7134, "mean_token_accuracy": 0.16350821107625962, "num_tokens": 7059205.0, "step": 3405 }, { "entropy": 5.802759027481079, "epoch": 0.30932510885341075, "grad_norm": 0.98046875, "learning_rate": 0.0004994601560277974, "loss": 5.7095, "mean_token_accuracy": 0.15878489315509797, "num_tokens": 7069513.0, "step": 3410 }, { "entropy": 5.834039211273193, "epoch": 0.3097786647314949, "grad_norm": 0.90234375, "learning_rate": 0.000499457913657073, "loss": 5.6357, "mean_token_accuracy": 0.1570906937122345, "num_tokens": 7079940.0, "step": 3415 }, { "entropy": 5.844655847549438, "epoch": 0.3102322206095791, "grad_norm": 0.90625, "learning_rate": 0.0004994556666445016, "loss": 5.6323, "mean_token_accuracy": 0.1617613285779953, "num_tokens": 7090792.0, "step": 3420 }, { "entropy": 5.776029062271118, "epoch": 0.31068577648766327, "grad_norm": 0.859375, "learning_rate": 0.0004994534149901299, "loss": 5.583, "mean_token_accuracy": 0.16228142231702805, "num_tokens": 7101964.0, "step": 3425 }, { "entropy": 5.8066362857818605, "epoch": 0.3111393323657475, "grad_norm": 0.921875, "learning_rate": 0.0004994511586940044, "loss": 5.6499, "mean_token_accuracy": 0.15664990097284318, "num_tokens": 7113332.0, "step": 3430 }, { "entropy": 5.942155599594116, "epoch": 0.31159288824383163, "grad_norm": 1.03125, "learning_rate": 0.0004994488977561717, "loss": 5.8081, "mean_token_accuracy": 0.15569447129964828, "num_tokens": 7123481.0, "step": 3435 }, { "entropy": 5.719643592834473, "epoch": 0.31204644412191584, "grad_norm": 0.9296875, "learning_rate": 0.0004994466321766786, "loss": 5.5667, "mean_token_accuracy": 0.16554133594036102, "num_tokens": 7133694.0, "step": 3440 }, { "entropy": 5.836681747436524, "epoch": 0.3125, "grad_norm": 0.9140625, "learning_rate": 0.000499444361955572, "loss": 5.6901, "mean_token_accuracy": 0.16068354696035386, "num_tokens": 7144491.0, "step": 3445 }, { "entropy": 5.970473051071167, "epoch": 0.31295355587808416, "grad_norm": 0.921875, "learning_rate": 0.0004994420870928988, "loss": 5.7727, "mean_token_accuracy": 0.1537349671125412, "num_tokens": 7154716.0, "step": 3450 }, { "entropy": 5.861110353469849, "epoch": 0.31340711175616837, "grad_norm": 0.98046875, "learning_rate": 0.0004994398075887059, "loss": 5.7654, "mean_token_accuracy": 0.15032783523201942, "num_tokens": 7164258.0, "step": 3455 }, { "entropy": 5.91595458984375, "epoch": 0.3138606676342525, "grad_norm": 0.89453125, "learning_rate": 0.0004994375234430407, "loss": 5.6193, "mean_token_accuracy": 0.15683988332748414, "num_tokens": 7175098.0, "step": 3460 }, { "entropy": 5.792357158660889, "epoch": 0.31431422351233673, "grad_norm": 0.94140625, "learning_rate": 0.0004994352346559504, "loss": 5.7077, "mean_token_accuracy": 0.15706134140491484, "num_tokens": 7186480.0, "step": 3465 }, { "entropy": 5.765750789642334, "epoch": 0.3147677793904209, "grad_norm": 0.9140625, "learning_rate": 0.0004994329412274821, "loss": 5.6699, "mean_token_accuracy": 0.16495281904935838, "num_tokens": 7197056.0, "step": 3470 }, { "entropy": 5.9141796112060545, "epoch": 0.3152213352685051, "grad_norm": 1.0078125, "learning_rate": 0.0004994306431576835, "loss": 5.8035, "mean_token_accuracy": 0.1533171132206917, "num_tokens": 7206040.0, "step": 3475 }, { "entropy": 5.938131999969483, "epoch": 0.31567489114658925, "grad_norm": 0.84765625, "learning_rate": 0.000499428340446602, "loss": 5.6422, "mean_token_accuracy": 0.16303373575210572, "num_tokens": 7216344.0, "step": 3480 }, { "entropy": 5.862201881408692, "epoch": 0.31612844702467346, "grad_norm": 0.91015625, "learning_rate": 0.0004994260330942851, "loss": 5.7168, "mean_token_accuracy": 0.1532277211546898, "num_tokens": 7226729.0, "step": 3485 }, { "entropy": 5.746544456481933, "epoch": 0.3165820029027576, "grad_norm": 0.9375, "learning_rate": 0.0004994237211007808, "loss": 5.6695, "mean_token_accuracy": 0.15737406313419341, "num_tokens": 7237616.0, "step": 3490 }, { "entropy": 5.85200867652893, "epoch": 0.3170355587808418, "grad_norm": 0.94921875, "learning_rate": 0.0004994214044661367, "loss": 5.5787, "mean_token_accuracy": 0.16485872715711594, "num_tokens": 7247857.0, "step": 3495 }, { "entropy": 5.749833250045777, "epoch": 0.317489114658926, "grad_norm": 0.94140625, "learning_rate": 0.0004994190831904007, "loss": 5.5717, "mean_token_accuracy": 0.16816714257001877, "num_tokens": 7257858.0, "step": 3500 }, { "entropy": 5.678181076049805, "epoch": 0.31794267053701014, "grad_norm": 0.9375, "learning_rate": 0.000499416757273621, "loss": 5.588, "mean_token_accuracy": 0.1626364231109619, "num_tokens": 7268440.0, "step": 3505 }, { "entropy": 5.893909215927124, "epoch": 0.31839622641509435, "grad_norm": 0.9453125, "learning_rate": 0.0004994144267158454, "loss": 5.6453, "mean_token_accuracy": 0.1645614832639694, "num_tokens": 7278560.0, "step": 3510 }, { "entropy": 5.826103019714355, "epoch": 0.3188497822931785, "grad_norm": 1.0, "learning_rate": 0.0004994120915171224, "loss": 5.6564, "mean_token_accuracy": 0.16230306029319763, "num_tokens": 7288422.0, "step": 3515 }, { "entropy": 5.89535002708435, "epoch": 0.3193033381712627, "grad_norm": 0.94140625, "learning_rate": 0.0004994097516775002, "loss": 5.7283, "mean_token_accuracy": 0.15988563597202302, "num_tokens": 7298613.0, "step": 3520 }, { "entropy": 5.8722318649292, "epoch": 0.3197568940493469, "grad_norm": 0.87109375, "learning_rate": 0.0004994074071970271, "loss": 5.7538, "mean_token_accuracy": 0.15464695021510125, "num_tokens": 7309509.0, "step": 3525 }, { "entropy": 5.882004261016846, "epoch": 0.3202104499274311, "grad_norm": 1.015625, "learning_rate": 0.0004994050580757515, "loss": 5.6563, "mean_token_accuracy": 0.15909888744354247, "num_tokens": 7319015.0, "step": 3530 }, { "entropy": 5.759677457809448, "epoch": 0.32066400580551524, "grad_norm": 0.9609375, "learning_rate": 0.0004994027043137223, "loss": 5.6356, "mean_token_accuracy": 0.1678672254085541, "num_tokens": 7329026.0, "step": 3535 }, { "entropy": 5.873507308959961, "epoch": 0.3211175616835994, "grad_norm": 0.89453125, "learning_rate": 0.0004994003459109879, "loss": 5.7247, "mean_token_accuracy": 0.1562524437904358, "num_tokens": 7339638.0, "step": 3540 }, { "entropy": 5.856282138824463, "epoch": 0.3215711175616836, "grad_norm": 0.9296875, "learning_rate": 0.0004993979828675972, "loss": 5.6467, "mean_token_accuracy": 0.1605513334274292, "num_tokens": 7349979.0, "step": 3545 }, { "entropy": 5.731431865692139, "epoch": 0.32202467343976776, "grad_norm": 0.953125, "learning_rate": 0.000499395615183599, "loss": 5.5759, "mean_token_accuracy": 0.1669188141822815, "num_tokens": 7359398.0, "step": 3550 }, { "entropy": 5.755496263504028, "epoch": 0.32247822931785197, "grad_norm": 0.94921875, "learning_rate": 0.0004993932428590422, "loss": 5.6178, "mean_token_accuracy": 0.16151758432388305, "num_tokens": 7370418.0, "step": 3555 }, { "entropy": 5.8418971538543705, "epoch": 0.3229317851959361, "grad_norm": 0.9453125, "learning_rate": 0.0004993908658939762, "loss": 5.643, "mean_token_accuracy": 0.15817937552928923, "num_tokens": 7380461.0, "step": 3560 }, { "entropy": 5.819117832183838, "epoch": 0.32338534107402034, "grad_norm": 0.90234375, "learning_rate": 0.0004993884842884496, "loss": 5.656, "mean_token_accuracy": 0.16232847571372985, "num_tokens": 7390646.0, "step": 3565 }, { "entropy": 5.789481115341187, "epoch": 0.3238388969521045, "grad_norm": 0.98046875, "learning_rate": 0.0004993860980425121, "loss": 5.7402, "mean_token_accuracy": 0.16244688481092454, "num_tokens": 7402106.0, "step": 3570 }, { "entropy": 5.829900217056275, "epoch": 0.3242924528301887, "grad_norm": 0.88671875, "learning_rate": 0.0004993837071562131, "loss": 5.7286, "mean_token_accuracy": 0.15734863579273223, "num_tokens": 7412936.0, "step": 3575 }, { "entropy": 5.834792232513427, "epoch": 0.32474600870827286, "grad_norm": 0.98046875, "learning_rate": 0.0004993813116296017, "loss": 5.5932, "mean_token_accuracy": 0.1646380230784416, "num_tokens": 7422303.0, "step": 3580 }, { "entropy": 5.787908029556275, "epoch": 0.325199564586357, "grad_norm": 0.9375, "learning_rate": 0.0004993789114627275, "loss": 5.6734, "mean_token_accuracy": 0.1588895797729492, "num_tokens": 7432829.0, "step": 3585 }, { "entropy": 5.904963636398316, "epoch": 0.3256531204644412, "grad_norm": 0.96484375, "learning_rate": 0.0004993765066556403, "loss": 5.6859, "mean_token_accuracy": 0.15745299607515334, "num_tokens": 7443218.0, "step": 3590 }, { "entropy": 5.824350261688233, "epoch": 0.3261066763425254, "grad_norm": 0.8671875, "learning_rate": 0.0004993740972083899, "loss": 5.6363, "mean_token_accuracy": 0.16018294245004655, "num_tokens": 7454531.0, "step": 3595 }, { "entropy": 5.835407304763794, "epoch": 0.3265602322206096, "grad_norm": 0.9453125, "learning_rate": 0.0004993716831210259, "loss": 5.7004, "mean_token_accuracy": 0.16122788041830063, "num_tokens": 7464993.0, "step": 3600 }, { "entropy": 5.760484457015991, "epoch": 0.32701378809869375, "grad_norm": 0.921875, "learning_rate": 0.0004993692643935983, "loss": 5.7176, "mean_token_accuracy": 0.15775671675801278, "num_tokens": 7475755.0, "step": 3605 }, { "entropy": 5.829902124404907, "epoch": 0.32746734397677796, "grad_norm": 0.90234375, "learning_rate": 0.0004993668410261571, "loss": 5.7147, "mean_token_accuracy": 0.16331727802753448, "num_tokens": 7486778.0, "step": 3610 }, { "entropy": 5.919011974334717, "epoch": 0.3279208998548621, "grad_norm": 0.91796875, "learning_rate": 0.0004993644130187525, "loss": 5.6816, "mean_token_accuracy": 0.16154048442840577, "num_tokens": 7497439.0, "step": 3615 }, { "entropy": 5.813072729110718, "epoch": 0.3283744557329463, "grad_norm": 1.0625, "learning_rate": 0.0004993619803714347, "loss": 5.7209, "mean_token_accuracy": 0.15986181199550628, "num_tokens": 7508274.0, "step": 3620 }, { "entropy": 5.799656772613526, "epoch": 0.3288280116110305, "grad_norm": 0.890625, "learning_rate": 0.0004993595430842539, "loss": 5.6925, "mean_token_accuracy": 0.15679641515016557, "num_tokens": 7519315.0, "step": 3625 }, { "entropy": 5.926063013076782, "epoch": 0.32928156748911463, "grad_norm": 0.921875, "learning_rate": 0.0004993571011572606, "loss": 5.6989, "mean_token_accuracy": 0.16154777109622956, "num_tokens": 7529910.0, "step": 3630 }, { "entropy": 5.83719687461853, "epoch": 0.32973512336719885, "grad_norm": 0.98046875, "learning_rate": 0.0004993546545905053, "loss": 5.6263, "mean_token_accuracy": 0.16304632276296616, "num_tokens": 7538966.0, "step": 3635 }, { "entropy": 5.795618629455566, "epoch": 0.330188679245283, "grad_norm": 0.94140625, "learning_rate": 0.0004993522033840386, "loss": 5.6618, "mean_token_accuracy": 0.1593761846423149, "num_tokens": 7549683.0, "step": 3640 }, { "entropy": 5.746255350112915, "epoch": 0.3306422351233672, "grad_norm": 0.8828125, "learning_rate": 0.000499349747537911, "loss": 5.6375, "mean_token_accuracy": 0.1627708211541176, "num_tokens": 7560629.0, "step": 3645 }, { "entropy": 5.824515104293823, "epoch": 0.33109579100145137, "grad_norm": 0.9375, "learning_rate": 0.0004993472870521736, "loss": 5.5937, "mean_token_accuracy": 0.16678274869918824, "num_tokens": 7570613.0, "step": 3650 }, { "entropy": 5.780102157592774, "epoch": 0.3315493468795356, "grad_norm": 0.9453125, "learning_rate": 0.0004993448219268771, "loss": 5.5616, "mean_token_accuracy": 0.16153461784124373, "num_tokens": 7580640.0, "step": 3655 }, { "entropy": 5.7738007545471195, "epoch": 0.33200290275761973, "grad_norm": 1.0625, "learning_rate": 0.0004993423521620726, "loss": 5.6566, "mean_token_accuracy": 0.16400932371616364, "num_tokens": 7590164.0, "step": 3660 }, { "entropy": 5.878917837142945, "epoch": 0.33245645863570394, "grad_norm": 0.98046875, "learning_rate": 0.0004993398777578109, "loss": 5.7057, "mean_token_accuracy": 0.15703917518258095, "num_tokens": 7600173.0, "step": 3665 }, { "entropy": 5.718817949295044, "epoch": 0.3329100145137881, "grad_norm": 0.95703125, "learning_rate": 0.0004993373987141435, "loss": 5.5171, "mean_token_accuracy": 0.16777506917715074, "num_tokens": 7609958.0, "step": 3670 }, { "entropy": 5.847012901306153, "epoch": 0.33336357039187225, "grad_norm": 0.89453125, "learning_rate": 0.0004993349150311214, "loss": 5.6535, "mean_token_accuracy": 0.15843262523412704, "num_tokens": 7620237.0, "step": 3675 }, { "entropy": 5.759278964996338, "epoch": 0.33381712626995647, "grad_norm": 0.9296875, "learning_rate": 0.0004993324267087962, "loss": 5.5564, "mean_token_accuracy": 0.16717470437288284, "num_tokens": 7629886.0, "step": 3680 }, { "entropy": 5.757597494125366, "epoch": 0.3342706821480406, "grad_norm": 0.96484375, "learning_rate": 0.0004993299337472192, "loss": 5.6311, "mean_token_accuracy": 0.16425763219594955, "num_tokens": 7640057.0, "step": 3685 }, { "entropy": 5.725239229202271, "epoch": 0.33472423802612483, "grad_norm": 0.89453125, "learning_rate": 0.000499327436146442, "loss": 5.5767, "mean_token_accuracy": 0.16163882464170456, "num_tokens": 7649766.0, "step": 3690 }, { "entropy": 5.778099012374878, "epoch": 0.335177793904209, "grad_norm": 0.89453125, "learning_rate": 0.0004993249339065162, "loss": 5.6323, "mean_token_accuracy": 0.16390450447797775, "num_tokens": 7660890.0, "step": 3695 }, { "entropy": 5.83032078742981, "epoch": 0.3356313497822932, "grad_norm": 0.9140625, "learning_rate": 0.0004993224270274937, "loss": 5.6562, "mean_token_accuracy": 0.16339348554611205, "num_tokens": 7670737.0, "step": 3700 }, { "entropy": 5.714012575149536, "epoch": 0.33608490566037735, "grad_norm": 0.90234375, "learning_rate": 0.0004993199155094263, "loss": 5.6157, "mean_token_accuracy": 0.16412198096513747, "num_tokens": 7681407.0, "step": 3705 }, { "entropy": 5.795091533660889, "epoch": 0.33653846153846156, "grad_norm": 0.8984375, "learning_rate": 0.0004993173993523658, "loss": 5.5506, "mean_token_accuracy": 0.1710594192147255, "num_tokens": 7691758.0, "step": 3710 }, { "entropy": 5.689993810653687, "epoch": 0.3369920174165457, "grad_norm": 0.96875, "learning_rate": 0.0004993148785563643, "loss": 5.5826, "mean_token_accuracy": 0.1621573567390442, "num_tokens": 7702934.0, "step": 3715 }, { "entropy": 5.717300510406494, "epoch": 0.3374455732946299, "grad_norm": 0.87890625, "learning_rate": 0.000499312353121474, "loss": 5.5771, "mean_token_accuracy": 0.1630354642868042, "num_tokens": 7713001.0, "step": 3720 }, { "entropy": 5.836460018157959, "epoch": 0.3378991291727141, "grad_norm": 0.89453125, "learning_rate": 0.0004993098230477471, "loss": 5.6475, "mean_token_accuracy": 0.15897637307643891, "num_tokens": 7724005.0, "step": 3725 }, { "entropy": 5.8066576480865475, "epoch": 0.33835268505079824, "grad_norm": 0.91796875, "learning_rate": 0.0004993072883352358, "loss": 5.6038, "mean_token_accuracy": 0.1632534846663475, "num_tokens": 7733743.0, "step": 3730 }, { "entropy": 5.836714839935302, "epoch": 0.33880624092888245, "grad_norm": 1.0234375, "learning_rate": 0.0004993047489839927, "loss": 5.7837, "mean_token_accuracy": 0.15582592636346818, "num_tokens": 7743762.0, "step": 3735 }, { "entropy": 5.886009645462036, "epoch": 0.3392597968069666, "grad_norm": 0.875, "learning_rate": 0.0004993022049940702, "loss": 5.666, "mean_token_accuracy": 0.15896076560020447, "num_tokens": 7753758.0, "step": 3740 }, { "entropy": 5.778275203704834, "epoch": 0.3397133526850508, "grad_norm": 0.90234375, "learning_rate": 0.0004992996563655209, "loss": 5.6211, "mean_token_accuracy": 0.16299140006303786, "num_tokens": 7764692.0, "step": 3745 }, { "entropy": 5.749185180664062, "epoch": 0.340166908563135, "grad_norm": 0.88671875, "learning_rate": 0.0004992971030983975, "loss": 5.6453, "mean_token_accuracy": 0.16236765682697296, "num_tokens": 7776892.0, "step": 3750 }, { "entropy": 5.860137844085694, "epoch": 0.3406204644412192, "grad_norm": 0.90234375, "learning_rate": 0.0004992945451927531, "loss": 5.7017, "mean_token_accuracy": 0.15955468267202377, "num_tokens": 7787143.0, "step": 3755 }, { "entropy": 5.734303283691406, "epoch": 0.34107402031930334, "grad_norm": 0.94921875, "learning_rate": 0.0004992919826486402, "loss": 5.6101, "mean_token_accuracy": 0.16399556547403335, "num_tokens": 7798537.0, "step": 3760 }, { "entropy": 5.734641885757446, "epoch": 0.3415275761973875, "grad_norm": 0.859375, "learning_rate": 0.0004992894154661118, "loss": 5.5799, "mean_token_accuracy": 0.16684457361698152, "num_tokens": 7808434.0, "step": 3765 }, { "entropy": 5.806569623947143, "epoch": 0.3419811320754717, "grad_norm": 0.89453125, "learning_rate": 0.0004992868436452213, "loss": 5.6955, "mean_token_accuracy": 0.15859481543302537, "num_tokens": 7819592.0, "step": 3770 }, { "entropy": 5.850445795059204, "epoch": 0.34243468795355586, "grad_norm": 1.0, "learning_rate": 0.0004992842671860217, "loss": 5.5788, "mean_token_accuracy": 0.16591217517852783, "num_tokens": 7830602.0, "step": 3775 }, { "entropy": 5.835497093200684, "epoch": 0.34288824383164007, "grad_norm": 0.9140625, "learning_rate": 0.0004992816860885662, "loss": 5.735, "mean_token_accuracy": 0.15822505801916123, "num_tokens": 7840850.0, "step": 3780 }, { "entropy": 5.917944717407226, "epoch": 0.3433417997097242, "grad_norm": 0.9375, "learning_rate": 0.0004992791003529084, "loss": 5.6846, "mean_token_accuracy": 0.15368564128875734, "num_tokens": 7852371.0, "step": 3785 }, { "entropy": 5.72100830078125, "epoch": 0.34379535558780844, "grad_norm": 0.9375, "learning_rate": 0.0004992765099791017, "loss": 5.6964, "mean_token_accuracy": 0.15722172409296037, "num_tokens": 7863290.0, "step": 3790 }, { "entropy": 5.7610937595367435, "epoch": 0.3442489114658926, "grad_norm": 0.91796875, "learning_rate": 0.0004992739149671995, "loss": 5.5333, "mean_token_accuracy": 0.1643339917063713, "num_tokens": 7873927.0, "step": 3795 }, { "entropy": 5.7489160060882565, "epoch": 0.3447024673439768, "grad_norm": 0.91796875, "learning_rate": 0.0004992713153172556, "loss": 5.5691, "mean_token_accuracy": 0.1632430613040924, "num_tokens": 7884977.0, "step": 3800 }, { "entropy": 5.745196342468262, "epoch": 0.34515602322206096, "grad_norm": 0.90625, "learning_rate": 0.0004992687110293238, "loss": 5.6531, "mean_token_accuracy": 0.16766562685370445, "num_tokens": 7894620.0, "step": 3805 }, { "entropy": 5.78018045425415, "epoch": 0.3456095791001451, "grad_norm": 0.9375, "learning_rate": 0.0004992661021034579, "loss": 5.5848, "mean_token_accuracy": 0.16409669667482377, "num_tokens": 7904541.0, "step": 3810 }, { "entropy": 5.75669412612915, "epoch": 0.3460631349782293, "grad_norm": 0.8203125, "learning_rate": 0.0004992634885397118, "loss": 5.6036, "mean_token_accuracy": 0.1641060397028923, "num_tokens": 7915435.0, "step": 3815 }, { "entropy": 5.751991319656372, "epoch": 0.3465166908563135, "grad_norm": 0.9140625, "learning_rate": 0.0004992608703381396, "loss": 5.5681, "mean_token_accuracy": 0.1672964349389076, "num_tokens": 7925870.0, "step": 3820 }, { "entropy": 5.787299251556396, "epoch": 0.3469702467343977, "grad_norm": 0.921875, "learning_rate": 0.0004992582474987955, "loss": 5.5792, "mean_token_accuracy": 0.16019600182771682, "num_tokens": 7937046.0, "step": 3825 }, { "entropy": 5.747065591812134, "epoch": 0.34742380261248185, "grad_norm": 0.88671875, "learning_rate": 0.0004992556200217337, "loss": 5.5366, "mean_token_accuracy": 0.1621662676334381, "num_tokens": 7947150.0, "step": 3830 }, { "entropy": 5.782345485687256, "epoch": 0.34787735849056606, "grad_norm": 1.0546875, "learning_rate": 0.0004992529879070085, "loss": 5.6463, "mean_token_accuracy": 0.16273225396871566, "num_tokens": 7956815.0, "step": 3835 }, { "entropy": 5.83603720664978, "epoch": 0.3483309143686502, "grad_norm": 0.85546875, "learning_rate": 0.0004992503511546745, "loss": 5.6669, "mean_token_accuracy": 0.16219530552625655, "num_tokens": 7968114.0, "step": 3840 }, { "entropy": 5.786204385757446, "epoch": 0.3487844702467344, "grad_norm": 0.9296875, "learning_rate": 0.0004992477097647859, "loss": 5.6001, "mean_token_accuracy": 0.15802547633647918, "num_tokens": 7977840.0, "step": 3845 }, { "entropy": 5.839146471023559, "epoch": 0.3492380261248186, "grad_norm": 0.92578125, "learning_rate": 0.0004992450637373976, "loss": 5.7159, "mean_token_accuracy": 0.16593586057424545, "num_tokens": 7988663.0, "step": 3850 }, { "entropy": 5.7088793277740475, "epoch": 0.34969158200290273, "grad_norm": 0.90234375, "learning_rate": 0.0004992424130725642, "loss": 5.5105, "mean_token_accuracy": 0.1633152462542057, "num_tokens": 7999693.0, "step": 3855 }, { "entropy": 5.813177061080933, "epoch": 0.35014513788098695, "grad_norm": 0.859375, "learning_rate": 0.0004992397577703406, "loss": 5.7066, "mean_token_accuracy": 0.15328351110219957, "num_tokens": 8010154.0, "step": 3860 }, { "entropy": 5.895718193054199, "epoch": 0.3505986937590711, "grad_norm": 1.0, "learning_rate": 0.0004992370978307816, "loss": 5.6764, "mean_token_accuracy": 0.15621304959058763, "num_tokens": 8020921.0, "step": 3865 }, { "entropy": 5.780423545837403, "epoch": 0.3510522496371553, "grad_norm": 0.89453125, "learning_rate": 0.0004992344332539424, "loss": 5.6006, "mean_token_accuracy": 0.16626923233270646, "num_tokens": 8031404.0, "step": 3870 }, { "entropy": 5.6891073226928714, "epoch": 0.35150580551523947, "grad_norm": 0.90625, "learning_rate": 0.0004992317640398779, "loss": 5.6086, "mean_token_accuracy": 0.16590815931558608, "num_tokens": 8041310.0, "step": 3875 }, { "entropy": 5.7839179039001465, "epoch": 0.3519593613933237, "grad_norm": 0.9375, "learning_rate": 0.0004992290901886434, "loss": 5.5748, "mean_token_accuracy": 0.16641812920570373, "num_tokens": 8051054.0, "step": 3880 }, { "entropy": 5.776237964630127, "epoch": 0.35241291727140783, "grad_norm": 1.0, "learning_rate": 0.000499226411700294, "loss": 5.577, "mean_token_accuracy": 0.16576359570026397, "num_tokens": 8061063.0, "step": 3885 }, { "entropy": 5.721409654617309, "epoch": 0.35286647314949204, "grad_norm": 0.94921875, "learning_rate": 0.0004992237285748855, "loss": 5.6016, "mean_token_accuracy": 0.16601926535367967, "num_tokens": 8071715.0, "step": 3890 }, { "entropy": 5.865892457962036, "epoch": 0.3533200290275762, "grad_norm": 0.90625, "learning_rate": 0.0004992210408124731, "loss": 5.6575, "mean_token_accuracy": 0.1572970688343048, "num_tokens": 8082679.0, "step": 3895 }, { "entropy": 5.7754655361175535, "epoch": 0.35377358490566035, "grad_norm": 0.84765625, "learning_rate": 0.0004992183484131123, "loss": 5.6963, "mean_token_accuracy": 0.15824397653341293, "num_tokens": 8093785.0, "step": 3900 }, { "entropy": 5.733349323272705, "epoch": 0.35422714078374457, "grad_norm": 0.90625, "learning_rate": 0.0004992156513768591, "loss": 5.5862, "mean_token_accuracy": 0.16918893307447433, "num_tokens": 8105822.0, "step": 3905 }, { "entropy": 5.746071147918701, "epoch": 0.3546806966618287, "grad_norm": 0.93359375, "learning_rate": 0.000499212949703769, "loss": 5.5009, "mean_token_accuracy": 0.16611845195293426, "num_tokens": 8115521.0, "step": 3910 }, { "entropy": 5.764930868148804, "epoch": 0.35513425253991293, "grad_norm": 0.89453125, "learning_rate": 0.0004992102433938981, "loss": 5.5949, "mean_token_accuracy": 0.1668561689555645, "num_tokens": 8125524.0, "step": 3915 }, { "entropy": 5.734392976760864, "epoch": 0.3555878084179971, "grad_norm": 0.99609375, "learning_rate": 0.0004992075324473021, "loss": 5.5131, "mean_token_accuracy": 0.17593824863433838, "num_tokens": 8135552.0, "step": 3920 }, { "entropy": 5.831735563278198, "epoch": 0.3560413642960813, "grad_norm": 0.94140625, "learning_rate": 0.0004992048168640371, "loss": 5.6308, "mean_token_accuracy": 0.1653963729739189, "num_tokens": 8145617.0, "step": 3925 }, { "entropy": 5.727599000930786, "epoch": 0.35649492017416545, "grad_norm": 0.86328125, "learning_rate": 0.0004992020966441595, "loss": 5.6406, "mean_token_accuracy": 0.1605748012661934, "num_tokens": 8156729.0, "step": 3930 }, { "entropy": 5.772192573547363, "epoch": 0.35694847605224966, "grad_norm": 0.9140625, "learning_rate": 0.0004991993717877254, "loss": 5.6209, "mean_token_accuracy": 0.1616794392466545, "num_tokens": 8167637.0, "step": 3935 }, { "entropy": 5.763149976730347, "epoch": 0.3574020319303338, "grad_norm": 0.9296875, "learning_rate": 0.0004991966422947911, "loss": 5.6039, "mean_token_accuracy": 0.1692925289273262, "num_tokens": 8177354.0, "step": 3940 }, { "entropy": 5.721889448165894, "epoch": 0.357855587808418, "grad_norm": 0.8828125, "learning_rate": 0.0004991939081654132, "loss": 5.5608, "mean_token_accuracy": 0.17194263488054276, "num_tokens": 8187580.0, "step": 3945 }, { "entropy": 5.723434352874756, "epoch": 0.3583091436865022, "grad_norm": 0.85546875, "learning_rate": 0.000499191169399648, "loss": 5.6598, "mean_token_accuracy": 0.16233123391866683, "num_tokens": 8199382.0, "step": 3950 }, { "entropy": 5.781085586547851, "epoch": 0.35876269956458634, "grad_norm": 0.91796875, "learning_rate": 0.0004991884259975525, "loss": 5.5557, "mean_token_accuracy": 0.16617808789014815, "num_tokens": 8208484.0, "step": 3955 }, { "entropy": 5.797117471694946, "epoch": 0.35921625544267055, "grad_norm": 0.91015625, "learning_rate": 0.000499185677959183, "loss": 5.6052, "mean_token_accuracy": 0.15923126488924028, "num_tokens": 8219056.0, "step": 3960 }, { "entropy": 5.777331686019897, "epoch": 0.3596698113207547, "grad_norm": 0.94921875, "learning_rate": 0.0004991829252845966, "loss": 5.6232, "mean_token_accuracy": 0.1578235447406769, "num_tokens": 8230149.0, "step": 3965 }, { "entropy": 5.772022676467896, "epoch": 0.3601233671988389, "grad_norm": 0.90625, "learning_rate": 0.0004991801679738502, "loss": 5.6806, "mean_token_accuracy": 0.15451672971248626, "num_tokens": 8240803.0, "step": 3970 }, { "entropy": 5.766995000839233, "epoch": 0.3605769230769231, "grad_norm": 0.90234375, "learning_rate": 0.0004991774060270008, "loss": 5.632, "mean_token_accuracy": 0.1565280094742775, "num_tokens": 8251563.0, "step": 3975 }, { "entropy": 5.758525943756103, "epoch": 0.3610304789550073, "grad_norm": 0.875, "learning_rate": 0.0004991746394441055, "loss": 5.5818, "mean_token_accuracy": 0.15869568139314652, "num_tokens": 8261342.0, "step": 3980 }, { "entropy": 5.76960334777832, "epoch": 0.36148403483309144, "grad_norm": 0.890625, "learning_rate": 0.0004991718682252216, "loss": 5.6749, "mean_token_accuracy": 0.15879870802164078, "num_tokens": 8271540.0, "step": 3985 }, { "entropy": 5.807124662399292, "epoch": 0.3619375907111756, "grad_norm": 0.9453125, "learning_rate": 0.0004991690923704063, "loss": 5.6018, "mean_token_accuracy": 0.16289105713367463, "num_tokens": 8280593.0, "step": 3990 }, { "entropy": 5.7926068782806395, "epoch": 0.3623911465892598, "grad_norm": 0.96875, "learning_rate": 0.0004991663118797171, "loss": 5.6189, "mean_token_accuracy": 0.16317871809005738, "num_tokens": 8290126.0, "step": 3995 }, { "entropy": 5.760343790054321, "epoch": 0.36284470246734396, "grad_norm": 0.9296875, "learning_rate": 0.0004991635267532113, "loss": 5.542, "mean_token_accuracy": 0.16164259910583495, "num_tokens": 8301416.0, "step": 4000 }, { "entropy": 5.794639825820923, "epoch": 0.36329825834542817, "grad_norm": 0.96875, "learning_rate": 0.0004991607369909468, "loss": 5.6311, "mean_token_accuracy": 0.15973753184080125, "num_tokens": 8311034.0, "step": 4005 }, { "entropy": 5.767417287826538, "epoch": 0.3637518142235123, "grad_norm": 0.94921875, "learning_rate": 0.0004991579425929811, "loss": 5.6506, "mean_token_accuracy": 0.16089941710233688, "num_tokens": 8322203.0, "step": 4010 }, { "entropy": 5.765074586868286, "epoch": 0.36420537010159654, "grad_norm": 1.0390625, "learning_rate": 0.000499155143559372, "loss": 5.5372, "mean_token_accuracy": 0.1657981812953949, "num_tokens": 8330981.0, "step": 4015 }, { "entropy": 5.65937442779541, "epoch": 0.3646589259796807, "grad_norm": 0.85546875, "learning_rate": 0.0004991523398901773, "loss": 5.5613, "mean_token_accuracy": 0.15952345728874207, "num_tokens": 8341294.0, "step": 4020 }, { "entropy": 5.869492626190185, "epoch": 0.3651124818577649, "grad_norm": 0.95703125, "learning_rate": 0.0004991495315854553, "loss": 5.7122, "mean_token_accuracy": 0.15741421282291412, "num_tokens": 8351824.0, "step": 4025 }, { "entropy": 5.71394624710083, "epoch": 0.36556603773584906, "grad_norm": 1.0234375, "learning_rate": 0.0004991467186452637, "loss": 5.5716, "mean_token_accuracy": 0.16435191184282302, "num_tokens": 8361975.0, "step": 4030 }, { "entropy": 5.745710849761963, "epoch": 0.3660195936139332, "grad_norm": 0.890625, "learning_rate": 0.0004991439010696609, "loss": 5.5203, "mean_token_accuracy": 0.16883532404899598, "num_tokens": 8372145.0, "step": 4035 }, { "entropy": 5.778649616241455, "epoch": 0.3664731494920174, "grad_norm": 0.9140625, "learning_rate": 0.0004991410788587051, "loss": 5.6151, "mean_token_accuracy": 0.159750834107399, "num_tokens": 8382542.0, "step": 4040 }, { "entropy": 5.749556159973144, "epoch": 0.3669267053701016, "grad_norm": 0.91015625, "learning_rate": 0.0004991382520124547, "loss": 5.6097, "mean_token_accuracy": 0.16143932342529296, "num_tokens": 8393450.0, "step": 4045 }, { "entropy": 5.771503353118897, "epoch": 0.3673802612481858, "grad_norm": 0.8984375, "learning_rate": 0.0004991354205309681, "loss": 5.5472, "mean_token_accuracy": 0.16442203521728516, "num_tokens": 8404929.0, "step": 4050 }, { "entropy": 5.770533847808838, "epoch": 0.36783381712626995, "grad_norm": 0.87890625, "learning_rate": 0.000499132584414304, "loss": 5.5662, "mean_token_accuracy": 0.1639400228857994, "num_tokens": 8415703.0, "step": 4055 }, { "entropy": 5.767830038070679, "epoch": 0.36828737300435416, "grad_norm": 1.0390625, "learning_rate": 0.0004991297436625207, "loss": 5.6591, "mean_token_accuracy": 0.1587003231048584, "num_tokens": 8426220.0, "step": 4060 }, { "entropy": 5.680564117431641, "epoch": 0.3687409288824383, "grad_norm": 1.0, "learning_rate": 0.0004991268982756774, "loss": 5.5295, "mean_token_accuracy": 0.1664980798959732, "num_tokens": 8436220.0, "step": 4065 }, { "entropy": 5.850871753692627, "epoch": 0.3691944847605225, "grad_norm": 0.93359375, "learning_rate": 0.0004991240482538327, "loss": 5.6776, "mean_token_accuracy": 0.15412717759609224, "num_tokens": 8446724.0, "step": 4070 }, { "entropy": 5.742097663879394, "epoch": 0.3696480406386067, "grad_norm": 0.89453125, "learning_rate": 0.0004991211935970455, "loss": 5.5408, "mean_token_accuracy": 0.16396154165267945, "num_tokens": 8457270.0, "step": 4075 }, { "entropy": 5.729263162612915, "epoch": 0.37010159651669083, "grad_norm": 0.90234375, "learning_rate": 0.0004991183343053748, "loss": 5.6115, "mean_token_accuracy": 0.15851412415504457, "num_tokens": 8468137.0, "step": 4080 }, { "entropy": 5.771952438354492, "epoch": 0.37055515239477504, "grad_norm": 0.87890625, "learning_rate": 0.00049911547037888, "loss": 5.5452, "mean_token_accuracy": 0.1679990693926811, "num_tokens": 8477574.0, "step": 4085 }, { "entropy": 5.742566680908203, "epoch": 0.3710087082728592, "grad_norm": 0.9609375, "learning_rate": 0.0004991126018176202, "loss": 5.6413, "mean_token_accuracy": 0.1597900688648224, "num_tokens": 8487268.0, "step": 4090 }, { "entropy": 5.877599859237671, "epoch": 0.3714622641509434, "grad_norm": 0.95703125, "learning_rate": 0.0004991097286216545, "loss": 5.7002, "mean_token_accuracy": 0.1654977947473526, "num_tokens": 8497785.0, "step": 4095 }, { "entropy": 5.80135407447815, "epoch": 0.37191582002902757, "grad_norm": 0.9765625, "learning_rate": 0.0004991068507910427, "loss": 5.5666, "mean_token_accuracy": 0.16508724838495253, "num_tokens": 8508169.0, "step": 4100 }, { "entropy": 5.709864664077759, "epoch": 0.3723693759071118, "grad_norm": 0.84765625, "learning_rate": 0.000499103968325844, "loss": 5.5366, "mean_token_accuracy": 0.16589654237031937, "num_tokens": 8519201.0, "step": 4105 }, { "entropy": 5.795285272598266, "epoch": 0.37282293178519593, "grad_norm": 0.9140625, "learning_rate": 0.0004991010812261181, "loss": 5.6332, "mean_token_accuracy": 0.1585421934723854, "num_tokens": 8531093.0, "step": 4110 }, { "entropy": 5.659151411056518, "epoch": 0.37327648766328014, "grad_norm": 0.9140625, "learning_rate": 0.0004990981894919248, "loss": 5.5081, "mean_token_accuracy": 0.16795153617858888, "num_tokens": 8541730.0, "step": 4115 }, { "entropy": 5.7505875587463375, "epoch": 0.3737300435413643, "grad_norm": 0.95703125, "learning_rate": 0.0004990952931233238, "loss": 5.588, "mean_token_accuracy": 0.16281794607639313, "num_tokens": 8552570.0, "step": 4120 }, { "entropy": 5.799954271316528, "epoch": 0.37418359941944845, "grad_norm": 0.98046875, "learning_rate": 0.000499092392120375, "loss": 5.4892, "mean_token_accuracy": 0.1670244187116623, "num_tokens": 8562340.0, "step": 4125 }, { "entropy": 5.737644052505493, "epoch": 0.37463715529753266, "grad_norm": 0.8671875, "learning_rate": 0.0004990894864831385, "loss": 5.6899, "mean_token_accuracy": 0.15905696153640747, "num_tokens": 8573240.0, "step": 4130 }, { "entropy": 5.830232810974121, "epoch": 0.3750907111756168, "grad_norm": 0.9453125, "learning_rate": 0.0004990865762116743, "loss": 5.5424, "mean_token_accuracy": 0.16745613217353822, "num_tokens": 8583194.0, "step": 4135 }, { "entropy": 5.733665180206299, "epoch": 0.37554426705370103, "grad_norm": 1.0, "learning_rate": 0.0004990836613060426, "loss": 5.6071, "mean_token_accuracy": 0.16095204204320906, "num_tokens": 8593603.0, "step": 4140 }, { "entropy": 5.6964035987854, "epoch": 0.3759978229317852, "grad_norm": 0.94921875, "learning_rate": 0.0004990807417663036, "loss": 5.6133, "mean_token_accuracy": 0.1622975468635559, "num_tokens": 8603176.0, "step": 4145 }, { "entropy": 5.8237403392791744, "epoch": 0.3764513788098694, "grad_norm": 0.8125, "learning_rate": 0.0004990778175925179, "loss": 5.6325, "mean_token_accuracy": 0.16655509024858475, "num_tokens": 8614801.0, "step": 4150 }, { "entropy": 5.793196535110473, "epoch": 0.37690493468795355, "grad_norm": 0.8671875, "learning_rate": 0.0004990748887847457, "loss": 5.6557, "mean_token_accuracy": 0.1599831074476242, "num_tokens": 8624999.0, "step": 4155 }, { "entropy": 5.700607967376709, "epoch": 0.37735849056603776, "grad_norm": 0.9609375, "learning_rate": 0.0004990719553430477, "loss": 5.507, "mean_token_accuracy": 0.17496906369924545, "num_tokens": 8635358.0, "step": 4160 }, { "entropy": 5.739441013336181, "epoch": 0.3778120464441219, "grad_norm": 0.9609375, "learning_rate": 0.0004990690172674847, "loss": 5.5865, "mean_token_accuracy": 0.16173218041658402, "num_tokens": 8645430.0, "step": 4165 }, { "entropy": 5.801822137832642, "epoch": 0.3782656023222061, "grad_norm": 0.90625, "learning_rate": 0.0004990660745581172, "loss": 5.5416, "mean_token_accuracy": 0.1737535923719406, "num_tokens": 8655115.0, "step": 4170 }, { "entropy": 5.693522024154663, "epoch": 0.3787191582002903, "grad_norm": 0.87109375, "learning_rate": 0.0004990631272150062, "loss": 5.5394, "mean_token_accuracy": 0.16801448911428452, "num_tokens": 8665391.0, "step": 4175 }, { "entropy": 5.767375373840332, "epoch": 0.37917271407837444, "grad_norm": 0.8125, "learning_rate": 0.0004990601752382127, "loss": 5.632, "mean_token_accuracy": 0.1633898064494133, "num_tokens": 8676819.0, "step": 4180 }, { "entropy": 5.8388364791870115, "epoch": 0.37962626995645865, "grad_norm": 0.8828125, "learning_rate": 0.0004990572186277975, "loss": 5.5607, "mean_token_accuracy": 0.16711350232362748, "num_tokens": 8687052.0, "step": 4185 }, { "entropy": 5.7258948802948, "epoch": 0.3800798258345428, "grad_norm": 1.0078125, "learning_rate": 0.0004990542573838221, "loss": 5.6467, "mean_token_accuracy": 0.1595759868621826, "num_tokens": 8697756.0, "step": 4190 }, { "entropy": 5.6451514720916744, "epoch": 0.380533381712627, "grad_norm": 0.8984375, "learning_rate": 0.0004990512915063475, "loss": 5.5475, "mean_token_accuracy": 0.17015636712312698, "num_tokens": 8708388.0, "step": 4195 }, { "entropy": 5.812650442123413, "epoch": 0.38098693759071117, "grad_norm": 1.015625, "learning_rate": 0.0004990483209954352, "loss": 5.6359, "mean_token_accuracy": 0.1576849937438965, "num_tokens": 8719475.0, "step": 4200 }, { "entropy": 5.7326311588287355, "epoch": 0.3814404934687954, "grad_norm": 0.87890625, "learning_rate": 0.0004990453458511464, "loss": 5.4986, "mean_token_accuracy": 0.17547574192285537, "num_tokens": 8729395.0, "step": 4205 }, { "entropy": 5.758198976516724, "epoch": 0.38189404934687954, "grad_norm": 0.9140625, "learning_rate": 0.0004990423660735428, "loss": 5.5483, "mean_token_accuracy": 0.16976142972707747, "num_tokens": 8740351.0, "step": 4210 }, { "entropy": 5.7952666759490965, "epoch": 0.3823476052249637, "grad_norm": 0.98046875, "learning_rate": 0.000499039381662686, "loss": 5.5672, "mean_token_accuracy": 0.16848132163286209, "num_tokens": 8749260.0, "step": 4215 }, { "entropy": 5.78771185874939, "epoch": 0.3828011611030479, "grad_norm": 0.9140625, "learning_rate": 0.0004990363926186377, "loss": 5.666, "mean_token_accuracy": 0.15561919510364533, "num_tokens": 8759604.0, "step": 4220 }, { "entropy": 5.8073570251464846, "epoch": 0.38325471698113206, "grad_norm": 1.03125, "learning_rate": 0.0004990333989414597, "loss": 5.6851, "mean_token_accuracy": 0.155071659386158, "num_tokens": 8769815.0, "step": 4225 }, { "entropy": 5.687266063690186, "epoch": 0.38370827285921627, "grad_norm": 0.93359375, "learning_rate": 0.0004990304006312138, "loss": 5.6015, "mean_token_accuracy": 0.16185775846242906, "num_tokens": 8780557.0, "step": 4230 }, { "entropy": 5.777766180038452, "epoch": 0.3841618287373004, "grad_norm": 0.94921875, "learning_rate": 0.0004990273976879622, "loss": 5.5629, "mean_token_accuracy": 0.17335893511772155, "num_tokens": 8790993.0, "step": 4235 }, { "entropy": 5.768019533157348, "epoch": 0.38461538461538464, "grad_norm": 0.9453125, "learning_rate": 0.0004990243901117669, "loss": 5.6234, "mean_token_accuracy": 0.16034475564956666, "num_tokens": 8800657.0, "step": 4240 }, { "entropy": 5.67515926361084, "epoch": 0.3850689404934688, "grad_norm": 0.86328125, "learning_rate": 0.0004990213779026903, "loss": 5.6138, "mean_token_accuracy": 0.15936714857816697, "num_tokens": 8812983.0, "step": 4245 }, { "entropy": 5.800050735473633, "epoch": 0.385522496371553, "grad_norm": 0.9453125, "learning_rate": 0.0004990183610607944, "loss": 5.5895, "mean_token_accuracy": 0.16557528376579284, "num_tokens": 8822980.0, "step": 4250 }, { "entropy": 5.733969593048096, "epoch": 0.38597605224963716, "grad_norm": 0.91015625, "learning_rate": 0.0004990153395861415, "loss": 5.5572, "mean_token_accuracy": 0.16649172306060792, "num_tokens": 8833821.0, "step": 4255 }, { "entropy": 5.672335815429688, "epoch": 0.3864296081277213, "grad_norm": 0.89453125, "learning_rate": 0.0004990123134787946, "loss": 5.509, "mean_token_accuracy": 0.16983023583889006, "num_tokens": 8843929.0, "step": 4260 }, { "entropy": 5.780575275421143, "epoch": 0.3868831640058055, "grad_norm": 0.94921875, "learning_rate": 0.0004990092827388159, "loss": 5.493, "mean_token_accuracy": 0.16734486669301987, "num_tokens": 8854180.0, "step": 4265 }, { "entropy": 5.6601338386535645, "epoch": 0.3873367198838897, "grad_norm": 0.89453125, "learning_rate": 0.0004990062473662681, "loss": 5.5037, "mean_token_accuracy": 0.17173054963350295, "num_tokens": 8865018.0, "step": 4270 }, { "entropy": 5.781656074523926, "epoch": 0.3877902757619739, "grad_norm": 1.03125, "learning_rate": 0.000499003207361214, "loss": 5.6868, "mean_token_accuracy": 0.1598363995552063, "num_tokens": 8875423.0, "step": 4275 }, { "entropy": 5.845520830154419, "epoch": 0.38824383164005805, "grad_norm": 0.8984375, "learning_rate": 0.0004990001627237165, "loss": 5.6193, "mean_token_accuracy": 0.1609180137515068, "num_tokens": 8887850.0, "step": 4280 }, { "entropy": 5.6677868366241455, "epoch": 0.38869738751814226, "grad_norm": 1.03125, "learning_rate": 0.0004989971134538386, "loss": 5.5183, "mean_token_accuracy": 0.16817747205495834, "num_tokens": 8897429.0, "step": 4285 }, { "entropy": 5.684417486190796, "epoch": 0.3891509433962264, "grad_norm": 0.93359375, "learning_rate": 0.0004989940595516432, "loss": 5.5406, "mean_token_accuracy": 0.1706473186612129, "num_tokens": 8907048.0, "step": 4290 }, { "entropy": 5.759358978271484, "epoch": 0.3896044992743106, "grad_norm": 0.97265625, "learning_rate": 0.0004989910010171938, "loss": 5.6105, "mean_token_accuracy": 0.16018391102552415, "num_tokens": 8917987.0, "step": 4295 }, { "entropy": 5.771234941482544, "epoch": 0.3900580551523948, "grad_norm": 0.8046875, "learning_rate": 0.0004989879378505532, "loss": 5.4998, "mean_token_accuracy": 0.1641297698020935, "num_tokens": 8929339.0, "step": 4300 }, { "entropy": 5.629133081436157, "epoch": 0.39051161103047893, "grad_norm": 0.875, "learning_rate": 0.0004989848700517849, "loss": 5.5118, "mean_token_accuracy": 0.1678486481308937, "num_tokens": 8939473.0, "step": 4305 }, { "entropy": 5.693001365661621, "epoch": 0.39096516690856314, "grad_norm": 0.9921875, "learning_rate": 0.0004989817976209526, "loss": 5.542, "mean_token_accuracy": 0.16416483521461486, "num_tokens": 8949173.0, "step": 4310 }, { "entropy": 5.759200525283814, "epoch": 0.3914187227866473, "grad_norm": 0.91015625, "learning_rate": 0.0004989787205581196, "loss": 5.5195, "mean_token_accuracy": 0.17088344991207122, "num_tokens": 8959879.0, "step": 4315 }, { "entropy": 5.704134798049926, "epoch": 0.3918722786647315, "grad_norm": 0.953125, "learning_rate": 0.0004989756388633496, "loss": 5.6041, "mean_token_accuracy": 0.1627824455499649, "num_tokens": 8970643.0, "step": 4320 }, { "entropy": 5.710903739929199, "epoch": 0.39232583454281567, "grad_norm": 0.90625, "learning_rate": 0.0004989725525367063, "loss": 5.4835, "mean_token_accuracy": 0.17103770971298218, "num_tokens": 8979882.0, "step": 4325 }, { "entropy": 5.7799781322479244, "epoch": 0.3927793904208999, "grad_norm": 0.86328125, "learning_rate": 0.0004989694615782534, "loss": 5.5981, "mean_token_accuracy": 0.15929665714502333, "num_tokens": 8990925.0, "step": 4330 }, { "entropy": 5.762790632247925, "epoch": 0.39323294629898403, "grad_norm": 0.98828125, "learning_rate": 0.0004989663659880552, "loss": 5.6236, "mean_token_accuracy": 0.16410700231790543, "num_tokens": 9001365.0, "step": 4335 }, { "entropy": 5.808406639099121, "epoch": 0.3936865021770682, "grad_norm": 0.91015625, "learning_rate": 0.0004989632657661754, "loss": 5.6151, "mean_token_accuracy": 0.16846253722906113, "num_tokens": 9011942.0, "step": 4340 }, { "entropy": 5.748916530609131, "epoch": 0.3941400580551524, "grad_norm": 0.93359375, "learning_rate": 0.000498960160912678, "loss": 5.665, "mean_token_accuracy": 0.16369327455759047, "num_tokens": 9022610.0, "step": 4345 }, { "entropy": 5.734598922729492, "epoch": 0.39459361393323655, "grad_norm": 0.9921875, "learning_rate": 0.0004989570514276276, "loss": 5.5523, "mean_token_accuracy": 0.16294773668050766, "num_tokens": 9033034.0, "step": 4350 }, { "entropy": 5.767314720153808, "epoch": 0.39504716981132076, "grad_norm": 0.8828125, "learning_rate": 0.0004989539373110883, "loss": 5.5898, "mean_token_accuracy": 0.160574010014534, "num_tokens": 9043418.0, "step": 4355 }, { "entropy": 5.782724094390869, "epoch": 0.3955007256894049, "grad_norm": 0.99609375, "learning_rate": 0.0004989508185631245, "loss": 5.6765, "mean_token_accuracy": 0.15920473337173463, "num_tokens": 9052708.0, "step": 4360 }, { "entropy": 5.673357582092285, "epoch": 0.39595428156748913, "grad_norm": 0.96875, "learning_rate": 0.0004989476951838006, "loss": 5.5266, "mean_token_accuracy": 0.1611687034368515, "num_tokens": 9062883.0, "step": 4365 }, { "entropy": 5.750123310089111, "epoch": 0.3964078374455733, "grad_norm": 0.96484375, "learning_rate": 0.0004989445671731814, "loss": 5.4954, "mean_token_accuracy": 0.17254894524812697, "num_tokens": 9072830.0, "step": 4370 }, { "entropy": 5.673724603652954, "epoch": 0.3968613933236575, "grad_norm": 0.94140625, "learning_rate": 0.0004989414345313315, "loss": 5.4632, "mean_token_accuracy": 0.16166009455919267, "num_tokens": 9082749.0, "step": 4375 }, { "entropy": 5.779737043380737, "epoch": 0.39731494920174165, "grad_norm": 0.82421875, "learning_rate": 0.0004989382972583156, "loss": 5.5433, "mean_token_accuracy": 0.1635667696595192, "num_tokens": 9094188.0, "step": 4380 }, { "entropy": 5.701415920257569, "epoch": 0.3977685050798258, "grad_norm": 1.03125, "learning_rate": 0.0004989351553541986, "loss": 5.5767, "mean_token_accuracy": 0.15773947685956954, "num_tokens": 9105023.0, "step": 4385 }, { "entropy": 5.63522777557373, "epoch": 0.39822206095791, "grad_norm": 0.87109375, "learning_rate": 0.0004989320088190456, "loss": 5.5136, "mean_token_accuracy": 0.16800401508808135, "num_tokens": 9115563.0, "step": 4390 }, { "entropy": 5.710983753204346, "epoch": 0.3986756168359942, "grad_norm": 0.92578125, "learning_rate": 0.0004989288576529216, "loss": 5.5451, "mean_token_accuracy": 0.16579101979732513, "num_tokens": 9125394.0, "step": 4395 }, { "entropy": 5.7169290542602536, "epoch": 0.3991291727140784, "grad_norm": 0.90625, "learning_rate": 0.0004989257018558917, "loss": 5.5305, "mean_token_accuracy": 0.1630067154765129, "num_tokens": 9137061.0, "step": 4400 }, { "entropy": 5.747994899749756, "epoch": 0.39958272859216254, "grad_norm": 0.90625, "learning_rate": 0.0004989225414280213, "loss": 5.5093, "mean_token_accuracy": 0.16748605370521547, "num_tokens": 9148196.0, "step": 4405 }, { "entropy": 5.673751354217529, "epoch": 0.40003628447024675, "grad_norm": 0.9296875, "learning_rate": 0.0004989193763693756, "loss": 5.5305, "mean_token_accuracy": 0.17181627005338668, "num_tokens": 9158013.0, "step": 4410 }, { "entropy": 5.692364835739136, "epoch": 0.4004898403483309, "grad_norm": 0.8984375, "learning_rate": 0.0004989162066800202, "loss": 5.4596, "mean_token_accuracy": 0.17420485466718674, "num_tokens": 9167813.0, "step": 4415 }, { "entropy": 5.68905611038208, "epoch": 0.4009433962264151, "grad_norm": 0.9296875, "learning_rate": 0.0004989130323600205, "loss": 5.5125, "mean_token_accuracy": 0.16890402287244796, "num_tokens": 9177783.0, "step": 4420 }, { "entropy": 5.698638820648194, "epoch": 0.40139695210449927, "grad_norm": 0.94140625, "learning_rate": 0.0004989098534094424, "loss": 5.5409, "mean_token_accuracy": 0.16684163510799407, "num_tokens": 9187556.0, "step": 4425 }, { "entropy": 5.702458286285401, "epoch": 0.4018505079825834, "grad_norm": 0.88671875, "learning_rate": 0.0004989066698283512, "loss": 5.6142, "mean_token_accuracy": 0.16072579473257065, "num_tokens": 9198659.0, "step": 4430 }, { "entropy": 5.740787506103516, "epoch": 0.40230406386066764, "grad_norm": 0.9609375, "learning_rate": 0.0004989034816168132, "loss": 5.5916, "mean_token_accuracy": 0.16459962129592895, "num_tokens": 9209546.0, "step": 4435 }, { "entropy": 5.698708724975586, "epoch": 0.4027576197387518, "grad_norm": 0.8984375, "learning_rate": 0.0004989002887748941, "loss": 5.5123, "mean_token_accuracy": 0.16735931783914565, "num_tokens": 9219339.0, "step": 4440 }, { "entropy": 5.7313940048217775, "epoch": 0.403211175616836, "grad_norm": 0.90234375, "learning_rate": 0.0004988970913026601, "loss": 5.6901, "mean_token_accuracy": 0.15663133114576339, "num_tokens": 9230364.0, "step": 4445 }, { "entropy": 5.746043014526367, "epoch": 0.40366473149492016, "grad_norm": 0.91015625, "learning_rate": 0.0004988938892001771, "loss": 5.5391, "mean_token_accuracy": 0.16293537616729736, "num_tokens": 9240732.0, "step": 4450 }, { "entropy": 5.651700019836426, "epoch": 0.40411828737300437, "grad_norm": 0.9296875, "learning_rate": 0.0004988906824675113, "loss": 5.4611, "mean_token_accuracy": 0.16927590519189833, "num_tokens": 9251049.0, "step": 4455 }, { "entropy": 5.702632808685303, "epoch": 0.4045718432510885, "grad_norm": 0.90625, "learning_rate": 0.0004988874711047293, "loss": 5.5209, "mean_token_accuracy": 0.1687337875366211, "num_tokens": 9261660.0, "step": 4460 }, { "entropy": 5.723224210739136, "epoch": 0.40502539912917274, "grad_norm": 0.890625, "learning_rate": 0.0004988842551118972, "loss": 5.5738, "mean_token_accuracy": 0.1679667592048645, "num_tokens": 9272114.0, "step": 4465 }, { "entropy": 5.7394585609436035, "epoch": 0.4054789550072569, "grad_norm": 0.94140625, "learning_rate": 0.0004988810344890818, "loss": 5.5537, "mean_token_accuracy": 0.1705055981874466, "num_tokens": 9282125.0, "step": 4470 }, { "entropy": 5.77500205039978, "epoch": 0.40593251088534105, "grad_norm": 0.890625, "learning_rate": 0.0004988778092363494, "loss": 5.5773, "mean_token_accuracy": 0.16275593191385268, "num_tokens": 9294078.0, "step": 4475 }, { "entropy": 5.723077011108399, "epoch": 0.40638606676342526, "grad_norm": 0.98828125, "learning_rate": 0.0004988745793537671, "loss": 5.5452, "mean_token_accuracy": 0.16284733265638351, "num_tokens": 9304026.0, "step": 4480 }, { "entropy": 5.714406442642212, "epoch": 0.4068396226415094, "grad_norm": 0.9296875, "learning_rate": 0.0004988713448414011, "loss": 5.5858, "mean_token_accuracy": 0.17267868667840958, "num_tokens": 9313933.0, "step": 4485 }, { "entropy": 5.722243356704712, "epoch": 0.4072931785195936, "grad_norm": 0.90234375, "learning_rate": 0.000498868105699319, "loss": 5.6213, "mean_token_accuracy": 0.16226827800273896, "num_tokens": 9323932.0, "step": 4490 }, { "entropy": 5.6608726978302, "epoch": 0.4077467343976778, "grad_norm": 0.91796875, "learning_rate": 0.0004988648619275872, "loss": 5.5272, "mean_token_accuracy": 0.17585674673318863, "num_tokens": 9333467.0, "step": 4495 }, { "entropy": 5.7471529006958, "epoch": 0.408200290275762, "grad_norm": 0.8515625, "learning_rate": 0.0004988616135262729, "loss": 5.5802, "mean_token_accuracy": 0.16007377952337265, "num_tokens": 9344909.0, "step": 4500 }, { "entropy": 5.8212768077850345, "epoch": 0.40865384615384615, "grad_norm": 0.82421875, "learning_rate": 0.0004988583604954436, "loss": 5.6265, "mean_token_accuracy": 0.1633604183793068, "num_tokens": 9355630.0, "step": 4505 }, { "entropy": 5.634971952438354, "epoch": 0.40910740203193036, "grad_norm": 0.9140625, "learning_rate": 0.0004988551028351663, "loss": 5.5539, "mean_token_accuracy": 0.16576218158006667, "num_tokens": 9365700.0, "step": 4510 }, { "entropy": 5.6949104309082035, "epoch": 0.4095609579100145, "grad_norm": 0.9140625, "learning_rate": 0.0004988518405455084, "loss": 5.6367, "mean_token_accuracy": 0.15977054387331008, "num_tokens": 9377088.0, "step": 4515 }, { "entropy": 5.749986362457276, "epoch": 0.41001451378809867, "grad_norm": 0.8828125, "learning_rate": 0.0004988485736265374, "loss": 5.4339, "mean_token_accuracy": 0.1753544732928276, "num_tokens": 9386855.0, "step": 4520 }, { "entropy": 5.69621696472168, "epoch": 0.4104680696661829, "grad_norm": 0.96875, "learning_rate": 0.000498845302078321, "loss": 5.5548, "mean_token_accuracy": 0.16240098476409912, "num_tokens": 9398661.0, "step": 4525 }, { "entropy": 5.738919639587403, "epoch": 0.41092162554426703, "grad_norm": 1.0, "learning_rate": 0.0004988420259009266, "loss": 5.5603, "mean_token_accuracy": 0.17131945639848709, "num_tokens": 9408670.0, "step": 4530 }, { "entropy": 5.6992714405059814, "epoch": 0.41137518142235124, "grad_norm": 0.85546875, "learning_rate": 0.000498838745094422, "loss": 5.5582, "mean_token_accuracy": 0.16838853061199188, "num_tokens": 9418740.0, "step": 4535 }, { "entropy": 5.6787707805633545, "epoch": 0.4118287373004354, "grad_norm": 0.9453125, "learning_rate": 0.0004988354596588751, "loss": 5.5485, "mean_token_accuracy": 0.16721292436122895, "num_tokens": 9429339.0, "step": 4540 }, { "entropy": 5.7141166687011715, "epoch": 0.4122822931785196, "grad_norm": 0.87890625, "learning_rate": 0.0004988321695943539, "loss": 5.4913, "mean_token_accuracy": 0.17288169413805007, "num_tokens": 9438996.0, "step": 4545 }, { "entropy": 5.6817183017730715, "epoch": 0.41273584905660377, "grad_norm": 1.0234375, "learning_rate": 0.0004988288749009264, "loss": 5.5176, "mean_token_accuracy": 0.16724181026220322, "num_tokens": 9448669.0, "step": 4550 }, { "entropy": 5.677099323272705, "epoch": 0.413189404934688, "grad_norm": 0.93359375, "learning_rate": 0.0004988255755786608, "loss": 5.489, "mean_token_accuracy": 0.17341368198394774, "num_tokens": 9458857.0, "step": 4555 }, { "entropy": 5.6843749523162845, "epoch": 0.41364296081277213, "grad_norm": 0.9140625, "learning_rate": 0.0004988222716276251, "loss": 5.4927, "mean_token_accuracy": 0.16991052776575089, "num_tokens": 9470241.0, "step": 4560 }, { "entropy": 5.75704345703125, "epoch": 0.4140965166908563, "grad_norm": 0.89453125, "learning_rate": 0.000498818963047888, "loss": 5.6476, "mean_token_accuracy": 0.16511964052915573, "num_tokens": 9480528.0, "step": 4565 }, { "entropy": 5.7459704875946045, "epoch": 0.4145500725689405, "grad_norm": 1.0234375, "learning_rate": 0.0004988156498395176, "loss": 5.5663, "mean_token_accuracy": 0.16632131338119507, "num_tokens": 9491000.0, "step": 4570 }, { "entropy": 5.728471374511718, "epoch": 0.41500362844702465, "grad_norm": 1.3203125, "learning_rate": 0.0004988123320025825, "loss": 5.5504, "mean_token_accuracy": 0.1686439707875252, "num_tokens": 9501612.0, "step": 4575 }, { "entropy": 5.721394157409668, "epoch": 0.41545718432510886, "grad_norm": 0.875, "learning_rate": 0.0004988090095371514, "loss": 5.6569, "mean_token_accuracy": 0.16329480931162835, "num_tokens": 9513999.0, "step": 4580 }, { "entropy": 5.723319435119629, "epoch": 0.415910740203193, "grad_norm": 0.93359375, "learning_rate": 0.0004988056824432928, "loss": 5.5296, "mean_token_accuracy": 0.1624149963259697, "num_tokens": 9524392.0, "step": 4585 }, { "entropy": 5.747483777999878, "epoch": 0.41636429608127723, "grad_norm": 0.953125, "learning_rate": 0.0004988023507210758, "loss": 5.5387, "mean_token_accuracy": 0.16955992728471755, "num_tokens": 9534227.0, "step": 4590 }, { "entropy": 5.693861675262451, "epoch": 0.4168178519593614, "grad_norm": 0.93359375, "learning_rate": 0.0004987990143705692, "loss": 5.5163, "mean_token_accuracy": 0.1732896625995636, "num_tokens": 9544242.0, "step": 4595 }, { "entropy": 5.671651411056518, "epoch": 0.4172714078374456, "grad_norm": 0.921875, "learning_rate": 0.0004987956733918418, "loss": 5.4526, "mean_token_accuracy": 0.16845765262842177, "num_tokens": 9553921.0, "step": 4600 }, { "entropy": 5.6189477920532225, "epoch": 0.41772496371552975, "grad_norm": 0.83984375, "learning_rate": 0.0004987923277849629, "loss": 5.5082, "mean_token_accuracy": 0.16487912237644195, "num_tokens": 9564768.0, "step": 4605 }, { "entropy": 5.716268110275268, "epoch": 0.4181785195936139, "grad_norm": 0.92578125, "learning_rate": 0.0004987889775500017, "loss": 5.5388, "mean_token_accuracy": 0.16002229750156402, "num_tokens": 9576360.0, "step": 4610 }, { "entropy": 5.702955532073974, "epoch": 0.4186320754716981, "grad_norm": 0.8203125, "learning_rate": 0.0004987856226870272, "loss": 5.5542, "mean_token_accuracy": 0.16782574057579042, "num_tokens": 9587623.0, "step": 4615 }, { "entropy": 5.687364339828491, "epoch": 0.4190856313497823, "grad_norm": 0.94140625, "learning_rate": 0.0004987822631961092, "loss": 5.5773, "mean_token_accuracy": 0.16299049258232118, "num_tokens": 9597837.0, "step": 4620 }, { "entropy": 5.740718221664428, "epoch": 0.4195391872278665, "grad_norm": 0.88671875, "learning_rate": 0.000498778899077317, "loss": 5.5345, "mean_token_accuracy": 0.1651468500494957, "num_tokens": 9609509.0, "step": 4625 }, { "entropy": 5.688720798492431, "epoch": 0.41999274310595064, "grad_norm": 0.93359375, "learning_rate": 0.00049877553033072, "loss": 5.5257, "mean_token_accuracy": 0.1684991091489792, "num_tokens": 9619954.0, "step": 4630 }, { "entropy": 5.647857522964477, "epoch": 0.42044629898403485, "grad_norm": 0.94140625, "learning_rate": 0.0004987721569563882, "loss": 5.5167, "mean_token_accuracy": 0.1662772074341774, "num_tokens": 9629742.0, "step": 4635 }, { "entropy": 5.702399444580078, "epoch": 0.420899854862119, "grad_norm": 0.90234375, "learning_rate": 0.000498768778954391, "loss": 5.5327, "mean_token_accuracy": 0.16915884912014006, "num_tokens": 9641378.0, "step": 4640 }, { "entropy": 5.798724412918091, "epoch": 0.4213534107402032, "grad_norm": 0.875, "learning_rate": 0.0004987653963247985, "loss": 5.5901, "mean_token_accuracy": 0.16833552569150925, "num_tokens": 9652279.0, "step": 4645 }, { "entropy": 5.7283261775970455, "epoch": 0.42180696661828737, "grad_norm": 0.8125, "learning_rate": 0.0004987620090676805, "loss": 5.6067, "mean_token_accuracy": 0.16763487905263902, "num_tokens": 9663416.0, "step": 4650 }, { "entropy": 5.70868330001831, "epoch": 0.4222605224963715, "grad_norm": 0.85546875, "learning_rate": 0.0004987586171831072, "loss": 5.5433, "mean_token_accuracy": 0.16505215167999268, "num_tokens": 9674647.0, "step": 4655 }, { "entropy": 5.6503729820251465, "epoch": 0.42271407837445574, "grad_norm": 0.91796875, "learning_rate": 0.0004987552206711487, "loss": 5.4025, "mean_token_accuracy": 0.17310979068279267, "num_tokens": 9685084.0, "step": 4660 }, { "entropy": 5.647482967376709, "epoch": 0.4231676342525399, "grad_norm": 0.875, "learning_rate": 0.0004987518195318752, "loss": 5.4772, "mean_token_accuracy": 0.16532573699951172, "num_tokens": 9695661.0, "step": 4665 }, { "entropy": 5.748704338073731, "epoch": 0.4236211901306241, "grad_norm": 0.98828125, "learning_rate": 0.000498748413765357, "loss": 5.5315, "mean_token_accuracy": 0.1663697361946106, "num_tokens": 9705773.0, "step": 4670 }, { "entropy": 5.718989038467408, "epoch": 0.42407474600870826, "grad_norm": 0.98046875, "learning_rate": 0.0004987450033716646, "loss": 5.5801, "mean_token_accuracy": 0.16458225697278978, "num_tokens": 9715799.0, "step": 4675 }, { "entropy": 5.71646819114685, "epoch": 0.42452830188679247, "grad_norm": 0.84375, "learning_rate": 0.0004987415883508686, "loss": 5.5205, "mean_token_accuracy": 0.1714474231004715, "num_tokens": 9727012.0, "step": 4680 }, { "entropy": 5.704070425033569, "epoch": 0.4249818577648766, "grad_norm": 0.9140625, "learning_rate": 0.0004987381687030394, "loss": 5.5332, "mean_token_accuracy": 0.16558614522218704, "num_tokens": 9737044.0, "step": 4685 }, { "entropy": 5.787160110473633, "epoch": 0.42543541364296084, "grad_norm": 0.98046875, "learning_rate": 0.0004987347444282479, "loss": 5.6288, "mean_token_accuracy": 0.157316155731678, "num_tokens": 9747648.0, "step": 4690 }, { "entropy": 5.674534463882447, "epoch": 0.425888969521045, "grad_norm": 0.984375, "learning_rate": 0.0004987313155265649, "loss": 5.5383, "mean_token_accuracy": 0.16501632183790207, "num_tokens": 9757812.0, "step": 4695 }, { "entropy": 5.7545582294464115, "epoch": 0.42634252539912915, "grad_norm": 0.87109375, "learning_rate": 0.0004987278819980613, "loss": 5.5327, "mean_token_accuracy": 0.17061222344636917, "num_tokens": 9768337.0, "step": 4700 }, { "entropy": 5.7120167255401615, "epoch": 0.42679608127721336, "grad_norm": 0.87890625, "learning_rate": 0.0004987244438428081, "loss": 5.5817, "mean_token_accuracy": 0.16203325092792512, "num_tokens": 9779433.0, "step": 4705 }, { "entropy": 5.6578521728515625, "epoch": 0.4272496371552975, "grad_norm": 0.8671875, "learning_rate": 0.0004987210010608764, "loss": 5.4676, "mean_token_accuracy": 0.16993781328201293, "num_tokens": 9790069.0, "step": 4710 }, { "entropy": 5.673728132247925, "epoch": 0.4277031930333817, "grad_norm": 0.87890625, "learning_rate": 0.0004987175536523373, "loss": 5.4468, "mean_token_accuracy": 0.17233940958976746, "num_tokens": 9799669.0, "step": 4715 }, { "entropy": 5.647679948806763, "epoch": 0.4281567489114659, "grad_norm": 0.88671875, "learning_rate": 0.0004987141016172622, "loss": 5.49, "mean_token_accuracy": 0.17301111817359924, "num_tokens": 9809615.0, "step": 4720 }, { "entropy": 5.668295860290527, "epoch": 0.4286103047895501, "grad_norm": 1.0078125, "learning_rate": 0.0004987106449557225, "loss": 5.4647, "mean_token_accuracy": 0.17097459584474564, "num_tokens": 9819666.0, "step": 4725 }, { "entropy": 5.747781991958618, "epoch": 0.42906386066763424, "grad_norm": 0.953125, "learning_rate": 0.0004987071836677896, "loss": 5.6161, "mean_token_accuracy": 0.16620567291975022, "num_tokens": 9831015.0, "step": 4730 }, { "entropy": 5.681993722915649, "epoch": 0.42951741654571846, "grad_norm": 0.984375, "learning_rate": 0.0004987037177535353, "loss": 5.4838, "mean_token_accuracy": 0.16538906544446946, "num_tokens": 9841354.0, "step": 4735 }, { "entropy": 5.61437578201294, "epoch": 0.4299709724238026, "grad_norm": 0.9765625, "learning_rate": 0.0004987002472130309, "loss": 5.4796, "mean_token_accuracy": 0.1654519483447075, "num_tokens": 9850467.0, "step": 4740 }, { "entropy": 5.749066305160523, "epoch": 0.43042452830188677, "grad_norm": 0.91015625, "learning_rate": 0.0004986967720463485, "loss": 5.5535, "mean_token_accuracy": 0.1634979486465454, "num_tokens": 9861115.0, "step": 4745 }, { "entropy": 5.75732159614563, "epoch": 0.430878084179971, "grad_norm": 0.91015625, "learning_rate": 0.0004986932922535598, "loss": 5.5587, "mean_token_accuracy": 0.16462093889713286, "num_tokens": 9871172.0, "step": 4750 }, { "entropy": 5.690928268432617, "epoch": 0.43133164005805513, "grad_norm": 0.9375, "learning_rate": 0.0004986898078347368, "loss": 5.4576, "mean_token_accuracy": 0.171144238114357, "num_tokens": 9881997.0, "step": 4755 }, { "entropy": 5.67418532371521, "epoch": 0.43178519593613934, "grad_norm": 0.89453125, "learning_rate": 0.0004986863187899516, "loss": 5.4497, "mean_token_accuracy": 0.17098109871149064, "num_tokens": 9892310.0, "step": 4760 }, { "entropy": 5.6178083419799805, "epoch": 0.4322387518142235, "grad_norm": 0.91796875, "learning_rate": 0.0004986828251192764, "loss": 5.4971, "mean_token_accuracy": 0.16893473714590074, "num_tokens": 9902664.0, "step": 4765 }, { "entropy": 5.691957664489746, "epoch": 0.4326923076923077, "grad_norm": 1.0, "learning_rate": 0.0004986793268227833, "loss": 5.4794, "mean_token_accuracy": 0.17000094205141067, "num_tokens": 9912491.0, "step": 4770 }, { "entropy": 5.6628247737884525, "epoch": 0.43314586357039186, "grad_norm": 0.9765625, "learning_rate": 0.0004986758239005448, "loss": 5.4546, "mean_token_accuracy": 0.1711384743452072, "num_tokens": 9922057.0, "step": 4775 }, { "entropy": 5.629938793182373, "epoch": 0.4335994194484761, "grad_norm": 0.8203125, "learning_rate": 0.0004986723163526331, "loss": 5.4915, "mean_token_accuracy": 0.16978790760040283, "num_tokens": 9933661.0, "step": 4780 }, { "entropy": 5.644828224182129, "epoch": 0.43405297532656023, "grad_norm": 0.82421875, "learning_rate": 0.0004986688041791209, "loss": 5.4595, "mean_token_accuracy": 0.16317514777183534, "num_tokens": 9945177.0, "step": 4785 }, { "entropy": 5.686159992218018, "epoch": 0.4345065312046444, "grad_norm": 0.94921875, "learning_rate": 0.000498665287380081, "loss": 5.5007, "mean_token_accuracy": 0.1679864302277565, "num_tokens": 9956226.0, "step": 4790 }, { "entropy": 5.728806781768799, "epoch": 0.4349600870827286, "grad_norm": 0.91015625, "learning_rate": 0.0004986617659555859, "loss": 5.566, "mean_token_accuracy": 0.1681407630443573, "num_tokens": 9965877.0, "step": 4795 }, { "entropy": 5.666096782684326, "epoch": 0.43541364296081275, "grad_norm": 0.95703125, "learning_rate": 0.0004986582399057085, "loss": 5.5077, "mean_token_accuracy": 0.1807382047176361, "num_tokens": 9975592.0, "step": 4800 }, { "entropy": 5.740148448944092, "epoch": 0.43586719883889696, "grad_norm": 0.94140625, "learning_rate": 0.0004986547092305216, "loss": 5.5476, "mean_token_accuracy": 0.16806693226099015, "num_tokens": 9986094.0, "step": 4805 }, { "entropy": 5.738724565505981, "epoch": 0.4363207547169811, "grad_norm": 0.9375, "learning_rate": 0.0004986511739300984, "loss": 5.5802, "mean_token_accuracy": 0.16459282785654067, "num_tokens": 9997241.0, "step": 4810 }, { "entropy": 5.62156834602356, "epoch": 0.43677431059506533, "grad_norm": 0.859375, "learning_rate": 0.0004986476340045119, "loss": 5.4877, "mean_token_accuracy": 0.1692790299654007, "num_tokens": 10008091.0, "step": 4815 }, { "entropy": 5.640922546386719, "epoch": 0.4372278664731495, "grad_norm": 0.91796875, "learning_rate": 0.0004986440894538354, "loss": 5.5512, "mean_token_accuracy": 0.16694139540195466, "num_tokens": 10018794.0, "step": 4820 }, { "entropy": 5.696912527084351, "epoch": 0.4376814223512337, "grad_norm": 0.921875, "learning_rate": 0.0004986405402781421, "loss": 5.477, "mean_token_accuracy": 0.17061326652765274, "num_tokens": 10028414.0, "step": 4825 }, { "entropy": 5.734801959991455, "epoch": 0.43813497822931785, "grad_norm": 0.86328125, "learning_rate": 0.0004986369864775054, "loss": 5.5394, "mean_token_accuracy": 0.1690880686044693, "num_tokens": 10038749.0, "step": 4830 }, { "entropy": 5.673574686050415, "epoch": 0.438588534107402, "grad_norm": 0.90625, "learning_rate": 0.0004986334280519989, "loss": 5.4989, "mean_token_accuracy": 0.16510852426290512, "num_tokens": 10049866.0, "step": 4835 }, { "entropy": 5.658323574066162, "epoch": 0.4390420899854862, "grad_norm": 0.921875, "learning_rate": 0.000498629865001696, "loss": 5.5213, "mean_token_accuracy": 0.173689503967762, "num_tokens": 10060680.0, "step": 4840 }, { "entropy": 5.773933458328247, "epoch": 0.43949564586357037, "grad_norm": 0.89453125, "learning_rate": 0.0004986262973266706, "loss": 5.6142, "mean_token_accuracy": 0.1640276402235031, "num_tokens": 10070931.0, "step": 4845 }, { "entropy": 5.665406703948975, "epoch": 0.4399492017416546, "grad_norm": 0.921875, "learning_rate": 0.0004986227250269964, "loss": 5.5471, "mean_token_accuracy": 0.1679753065109253, "num_tokens": 10080189.0, "step": 4850 }, { "entropy": 5.692187070846558, "epoch": 0.44040275761973874, "grad_norm": 1.046875, "learning_rate": 0.0004986191481027472, "loss": 5.4578, "mean_token_accuracy": 0.17034661769866943, "num_tokens": 10088813.0, "step": 4855 }, { "entropy": 5.625132513046265, "epoch": 0.44085631349782295, "grad_norm": 0.984375, "learning_rate": 0.0004986155665539971, "loss": 5.4795, "mean_token_accuracy": 0.16770929843187332, "num_tokens": 10098125.0, "step": 4860 }, { "entropy": 5.675574922561646, "epoch": 0.4413098693759071, "grad_norm": 0.921875, "learning_rate": 0.00049861198038082, "loss": 5.5161, "mean_token_accuracy": 0.1693737342953682, "num_tokens": 10109125.0, "step": 4865 }, { "entropy": 5.682723617553711, "epoch": 0.4417634252539913, "grad_norm": 0.88671875, "learning_rate": 0.0004986083895832903, "loss": 5.4948, "mean_token_accuracy": 0.16549968123435974, "num_tokens": 10120182.0, "step": 4870 }, { "entropy": 5.645736122131348, "epoch": 0.44221698113207547, "grad_norm": 0.96484375, "learning_rate": 0.0004986047941614821, "loss": 5.561, "mean_token_accuracy": 0.1642124354839325, "num_tokens": 10130941.0, "step": 4875 }, { "entropy": 5.717188692092895, "epoch": 0.4426705370101596, "grad_norm": 1.03125, "learning_rate": 0.0004986011941154696, "loss": 5.5279, "mean_token_accuracy": 0.1694575533270836, "num_tokens": 10141708.0, "step": 4880 }, { "entropy": 5.697762584686279, "epoch": 0.44312409288824384, "grad_norm": 0.9296875, "learning_rate": 0.0004985975894453275, "loss": 5.4623, "mean_token_accuracy": 0.1702752724289894, "num_tokens": 10151816.0, "step": 4885 }, { "entropy": 5.738364410400391, "epoch": 0.443577648766328, "grad_norm": 0.921875, "learning_rate": 0.0004985939801511304, "loss": 5.5813, "mean_token_accuracy": 0.163410022854805, "num_tokens": 10162470.0, "step": 4890 }, { "entropy": 5.693057489395142, "epoch": 0.4440312046444122, "grad_norm": 0.8671875, "learning_rate": 0.0004985903662329527, "loss": 5.4715, "mean_token_accuracy": 0.17365510314702987, "num_tokens": 10173171.0, "step": 4895 }, { "entropy": 5.6850179672241214, "epoch": 0.44448476052249636, "grad_norm": 0.87109375, "learning_rate": 0.0004985867476908693, "loss": 5.5027, "mean_token_accuracy": 0.17133045196533203, "num_tokens": 10184185.0, "step": 4900 }, { "entropy": 5.753661489486694, "epoch": 0.44493831640058057, "grad_norm": 0.921875, "learning_rate": 0.0004985831245249549, "loss": 5.5589, "mean_token_accuracy": 0.17009343653917314, "num_tokens": 10195516.0, "step": 4905 }, { "entropy": 5.651303815841675, "epoch": 0.4453918722786647, "grad_norm": 0.94140625, "learning_rate": 0.0004985794967352846, "loss": 5.4905, "mean_token_accuracy": 0.17255396246910096, "num_tokens": 10204936.0, "step": 4910 }, { "entropy": 5.680718088150025, "epoch": 0.44584542815674894, "grad_norm": 0.8359375, "learning_rate": 0.0004985758643219334, "loss": 5.5193, "mean_token_accuracy": 0.1686270222067833, "num_tokens": 10216218.0, "step": 4915 }, { "entropy": 5.769064855575562, "epoch": 0.4462989840348331, "grad_norm": 0.96875, "learning_rate": 0.0004985722272849762, "loss": 5.5302, "mean_token_accuracy": 0.1625892087817192, "num_tokens": 10226370.0, "step": 4920 }, { "entropy": 5.608448934555054, "epoch": 0.44675253991291725, "grad_norm": 1.0078125, "learning_rate": 0.0004985685856244884, "loss": 5.4482, "mean_token_accuracy": 0.17939605712890624, "num_tokens": 10236170.0, "step": 4925 }, { "entropy": 5.718491077423096, "epoch": 0.44720609579100146, "grad_norm": 1.015625, "learning_rate": 0.0004985649393405453, "loss": 5.5439, "mean_token_accuracy": 0.16827276796102525, "num_tokens": 10246119.0, "step": 4930 }, { "entropy": 5.671393918991089, "epoch": 0.4476596516690856, "grad_norm": 0.859375, "learning_rate": 0.0004985612884332223, "loss": 5.5383, "mean_token_accuracy": 0.16240749210119249, "num_tokens": 10256762.0, "step": 4935 }, { "entropy": 5.633547115325928, "epoch": 0.4481132075471698, "grad_norm": 0.94140625, "learning_rate": 0.0004985576329025949, "loss": 5.4727, "mean_token_accuracy": 0.17245685309171677, "num_tokens": 10267317.0, "step": 4940 }, { "entropy": 5.726488828659058, "epoch": 0.448566763425254, "grad_norm": 0.87109375, "learning_rate": 0.0004985539727487385, "loss": 5.6217, "mean_token_accuracy": 0.15205846652388572, "num_tokens": 10279111.0, "step": 4945 }, { "entropy": 5.708870220184326, "epoch": 0.4490203193033382, "grad_norm": 0.9375, "learning_rate": 0.0004985503079717292, "loss": 5.4791, "mean_token_accuracy": 0.16987659484148027, "num_tokens": 10289383.0, "step": 4950 }, { "entropy": 5.69928617477417, "epoch": 0.44947387518142234, "grad_norm": 0.921875, "learning_rate": 0.0004985466385716425, "loss": 5.49, "mean_token_accuracy": 0.17275461703538894, "num_tokens": 10299806.0, "step": 4955 }, { "entropy": 5.615327405929565, "epoch": 0.44992743105950656, "grad_norm": 0.87890625, "learning_rate": 0.0004985429645485543, "loss": 5.5166, "mean_token_accuracy": 0.16595803648233415, "num_tokens": 10310348.0, "step": 4960 }, { "entropy": 5.738679695129394, "epoch": 0.4503809869375907, "grad_norm": 0.9921875, "learning_rate": 0.0004985392859025407, "loss": 5.5192, "mean_token_accuracy": 0.1689467638731003, "num_tokens": 10320354.0, "step": 4965 }, { "entropy": 5.647083950042725, "epoch": 0.45083454281567487, "grad_norm": 0.8984375, "learning_rate": 0.0004985356026336776, "loss": 5.4311, "mean_token_accuracy": 0.1705056294798851, "num_tokens": 10330292.0, "step": 4970 }, { "entropy": 5.634524917602539, "epoch": 0.4512880986937591, "grad_norm": 0.87890625, "learning_rate": 0.0004985319147420414, "loss": 5.4075, "mean_token_accuracy": 0.17841226756572723, "num_tokens": 10340449.0, "step": 4975 }, { "entropy": 5.688153219223023, "epoch": 0.45174165457184323, "grad_norm": 0.9140625, "learning_rate": 0.0004985282222277082, "loss": 5.4677, "mean_token_accuracy": 0.1669263258576393, "num_tokens": 10350637.0, "step": 4980 }, { "entropy": 5.597547960281372, "epoch": 0.45219521044992744, "grad_norm": 0.90625, "learning_rate": 0.0004985245250907544, "loss": 5.4141, "mean_token_accuracy": 0.17463358342647553, "num_tokens": 10361548.0, "step": 4985 }, { "entropy": 5.60842866897583, "epoch": 0.4526487663280116, "grad_norm": 0.92578125, "learning_rate": 0.0004985208233312564, "loss": 5.4248, "mean_token_accuracy": 0.1648386925458908, "num_tokens": 10371765.0, "step": 4990 }, { "entropy": 5.716899347305298, "epoch": 0.4531023222060958, "grad_norm": 0.89453125, "learning_rate": 0.0004985171169492908, "loss": 5.5395, "mean_token_accuracy": 0.1704647123813629, "num_tokens": 10382108.0, "step": 4995 }, { "entropy": 5.6541526317596436, "epoch": 0.45355587808417996, "grad_norm": 0.90625, "learning_rate": 0.0004985134059449344, "loss": 5.4909, "mean_token_accuracy": 0.1751002311706543, "num_tokens": 10392390.0, "step": 5000 }, { "entropy": 5.6331511497497555, "epoch": 0.4540094339622642, "grad_norm": 0.91015625, "learning_rate": 0.0004985096903182637, "loss": 5.5349, "mean_token_accuracy": 0.1757347598671913, "num_tokens": 10402094.0, "step": 5005 }, { "entropy": 5.689352416992188, "epoch": 0.45446298984034833, "grad_norm": 0.84765625, "learning_rate": 0.0004985059700693557, "loss": 5.4904, "mean_token_accuracy": 0.17052320688962935, "num_tokens": 10413350.0, "step": 5010 }, { "entropy": 5.726061534881592, "epoch": 0.4549165457184325, "grad_norm": 0.95703125, "learning_rate": 0.0004985022451982872, "loss": 5.6072, "mean_token_accuracy": 0.16370004415512085, "num_tokens": 10424292.0, "step": 5015 }, { "entropy": 5.757494688034058, "epoch": 0.4553701015965167, "grad_norm": 0.97265625, "learning_rate": 0.0004984985157051354, "loss": 5.4711, "mean_token_accuracy": 0.17044610232114793, "num_tokens": 10433724.0, "step": 5020 }, { "entropy": 5.700105333328247, "epoch": 0.45582365747460085, "grad_norm": 0.90234375, "learning_rate": 0.0004984947815899774, "loss": 5.5438, "mean_token_accuracy": 0.1677020400762558, "num_tokens": 10444724.0, "step": 5025 }, { "entropy": 5.677012205123901, "epoch": 0.45627721335268506, "grad_norm": 0.9609375, "learning_rate": 0.0004984910428528902, "loss": 5.4799, "mean_token_accuracy": 0.1747812494635582, "num_tokens": 10455086.0, "step": 5030 }, { "entropy": 5.592632293701172, "epoch": 0.4567307692307692, "grad_norm": 0.875, "learning_rate": 0.0004984872994939514, "loss": 5.4252, "mean_token_accuracy": 0.16925584375858307, "num_tokens": 10465076.0, "step": 5035 }, { "entropy": 5.68324499130249, "epoch": 0.45718432510885343, "grad_norm": 0.9375, "learning_rate": 0.0004984835515132382, "loss": 5.4663, "mean_token_accuracy": 0.17937684208154678, "num_tokens": 10474817.0, "step": 5040 }, { "entropy": 5.662622547149658, "epoch": 0.4576378809869376, "grad_norm": 0.85546875, "learning_rate": 0.0004984797989108282, "loss": 5.4851, "mean_token_accuracy": 0.16741085201501846, "num_tokens": 10485735.0, "step": 5045 }, { "entropy": 5.636821985244751, "epoch": 0.4580914368650218, "grad_norm": 0.984375, "learning_rate": 0.0004984760416867991, "loss": 5.5723, "mean_token_accuracy": 0.16558835059404373, "num_tokens": 10496731.0, "step": 5050 }, { "entropy": 5.630299758911133, "epoch": 0.45854499274310595, "grad_norm": 0.89453125, "learning_rate": 0.0004984722798412286, "loss": 5.4242, "mean_token_accuracy": 0.1714159443974495, "num_tokens": 10506787.0, "step": 5055 }, { "entropy": 5.7004170417785645, "epoch": 0.4589985486211901, "grad_norm": 0.953125, "learning_rate": 0.0004984685133741941, "loss": 5.5117, "mean_token_accuracy": 0.16912039518356323, "num_tokens": 10517170.0, "step": 5060 }, { "entropy": 5.6526471138000485, "epoch": 0.4594521044992743, "grad_norm": 0.95703125, "learning_rate": 0.000498464742285774, "loss": 5.4944, "mean_token_accuracy": 0.16828947961330415, "num_tokens": 10527342.0, "step": 5065 }, { "entropy": 5.692163467407227, "epoch": 0.45990566037735847, "grad_norm": 0.88671875, "learning_rate": 0.000498460966576046, "loss": 5.4743, "mean_token_accuracy": 0.17233156114816667, "num_tokens": 10537253.0, "step": 5070 }, { "entropy": 5.7053141593933105, "epoch": 0.4603592162554427, "grad_norm": 0.84765625, "learning_rate": 0.0004984571862450884, "loss": 5.4828, "mean_token_accuracy": 0.1697017401456833, "num_tokens": 10547249.0, "step": 5075 }, { "entropy": 5.753048896789551, "epoch": 0.46081277213352684, "grad_norm": 0.95703125, "learning_rate": 0.0004984534012929791, "loss": 5.5371, "mean_token_accuracy": 0.17120666801929474, "num_tokens": 10558174.0, "step": 5080 }, { "entropy": 5.728115892410278, "epoch": 0.46126632801161105, "grad_norm": 1.0, "learning_rate": 0.0004984496117197967, "loss": 5.4753, "mean_token_accuracy": 0.17589109838008882, "num_tokens": 10567610.0, "step": 5085 }, { "entropy": 5.601778030395508, "epoch": 0.4617198838896952, "grad_norm": 0.93359375, "learning_rate": 0.0004984458175256193, "loss": 5.4797, "mean_token_accuracy": 0.16605047583580018, "num_tokens": 10578494.0, "step": 5090 }, { "entropy": 5.7371217727661135, "epoch": 0.4621734397677794, "grad_norm": 0.9140625, "learning_rate": 0.0004984420187105253, "loss": 5.586, "mean_token_accuracy": 0.17094989866018295, "num_tokens": 10589482.0, "step": 5095 }, { "entropy": 5.755274152755737, "epoch": 0.46262699564586357, "grad_norm": 0.890625, "learning_rate": 0.0004984382152745936, "loss": 5.5401, "mean_token_accuracy": 0.16257912814617156, "num_tokens": 10599965.0, "step": 5100 }, { "entropy": 5.66287579536438, "epoch": 0.4630805515239477, "grad_norm": 0.84375, "learning_rate": 0.0004984344072179026, "loss": 5.5603, "mean_token_accuracy": 0.17168972343206407, "num_tokens": 10610500.0, "step": 5105 }, { "entropy": 5.742537546157837, "epoch": 0.46353410740203194, "grad_norm": 1.0234375, "learning_rate": 0.0004984305945405312, "loss": 5.5188, "mean_token_accuracy": 0.17038158923387528, "num_tokens": 10619843.0, "step": 5110 }, { "entropy": 5.658458423614502, "epoch": 0.4639876632801161, "grad_norm": 0.8984375, "learning_rate": 0.000498426777242558, "loss": 5.4436, "mean_token_accuracy": 0.17783846333622932, "num_tokens": 10631026.0, "step": 5115 }, { "entropy": 5.538843965530395, "epoch": 0.4644412191582003, "grad_norm": 0.953125, "learning_rate": 0.0004984229553240623, "loss": 5.4496, "mean_token_accuracy": 0.17878477275371552, "num_tokens": 10641130.0, "step": 5120 }, { "entropy": 5.746715879440307, "epoch": 0.46489477503628446, "grad_norm": 0.921875, "learning_rate": 0.0004984191287851228, "loss": 5.5067, "mean_token_accuracy": 0.17264201045036315, "num_tokens": 10652305.0, "step": 5125 }, { "entropy": 5.73653655052185, "epoch": 0.46534833091436867, "grad_norm": 0.8984375, "learning_rate": 0.0004984152976258188, "loss": 5.5573, "mean_token_accuracy": 0.1695479616522789, "num_tokens": 10663083.0, "step": 5130 }, { "entropy": 5.683012914657593, "epoch": 0.4658018867924528, "grad_norm": 0.890625, "learning_rate": 0.0004984114618462296, "loss": 5.572, "mean_token_accuracy": 0.1649271011352539, "num_tokens": 10673602.0, "step": 5135 }, { "entropy": 5.6376933574676515, "epoch": 0.46625544267053703, "grad_norm": 0.85546875, "learning_rate": 0.0004984076214464343, "loss": 5.392, "mean_token_accuracy": 0.1789440020918846, "num_tokens": 10684622.0, "step": 5140 }, { "entropy": 5.665349912643433, "epoch": 0.4667089985486212, "grad_norm": 0.9765625, "learning_rate": 0.0004984037764265126, "loss": 5.5034, "mean_token_accuracy": 0.1705288678407669, "num_tokens": 10695129.0, "step": 5145 }, { "entropy": 5.6029088497161865, "epoch": 0.46716255442670535, "grad_norm": 0.9375, "learning_rate": 0.0004983999267865438, "loss": 5.3525, "mean_token_accuracy": 0.18145803660154342, "num_tokens": 10705236.0, "step": 5150 }, { "entropy": 5.638808965682983, "epoch": 0.46761611030478956, "grad_norm": 1.0390625, "learning_rate": 0.0004983960725266078, "loss": 5.4762, "mean_token_accuracy": 0.17050447314977646, "num_tokens": 10715748.0, "step": 5155 }, { "entropy": 5.656491661071778, "epoch": 0.4680696661828737, "grad_norm": 0.94921875, "learning_rate": 0.0004983922136467838, "loss": 5.3904, "mean_token_accuracy": 0.17664045691490174, "num_tokens": 10725799.0, "step": 5160 }, { "entropy": 5.659603071212769, "epoch": 0.4685232220609579, "grad_norm": 0.9453125, "learning_rate": 0.000498388350147152, "loss": 5.5361, "mean_token_accuracy": 0.1669347897171974, "num_tokens": 10735668.0, "step": 5165 }, { "entropy": 5.695495986938477, "epoch": 0.4689767779390421, "grad_norm": 0.8828125, "learning_rate": 0.0004983844820277922, "loss": 5.6331, "mean_token_accuracy": 0.16362748593091964, "num_tokens": 10746466.0, "step": 5170 }, { "entropy": 5.791701602935791, "epoch": 0.4694303338171263, "grad_norm": 0.91796875, "learning_rate": 0.0004983806092887843, "loss": 5.5238, "mean_token_accuracy": 0.16722518354654312, "num_tokens": 10756724.0, "step": 5175 }, { "entropy": 5.698781108856201, "epoch": 0.46988388969521044, "grad_norm": 0.9296875, "learning_rate": 0.0004983767319302086, "loss": 5.554, "mean_token_accuracy": 0.17089424878358841, "num_tokens": 10766919.0, "step": 5180 }, { "entropy": 5.584889268875122, "epoch": 0.47033744557329465, "grad_norm": 0.9453125, "learning_rate": 0.0004983728499521451, "loss": 5.3443, "mean_token_accuracy": 0.18152898848056792, "num_tokens": 10777550.0, "step": 5185 }, { "entropy": 5.667958736419678, "epoch": 0.4707910014513788, "grad_norm": 0.87109375, "learning_rate": 0.0004983689633546741, "loss": 5.4103, "mean_token_accuracy": 0.16942705661058427, "num_tokens": 10788456.0, "step": 5190 }, { "entropy": 5.64146933555603, "epoch": 0.47124455732946297, "grad_norm": 0.87109375, "learning_rate": 0.0004983650721378761, "loss": 5.449, "mean_token_accuracy": 0.17425691485404968, "num_tokens": 10800049.0, "step": 5195 }, { "entropy": 5.6370322704315186, "epoch": 0.4716981132075472, "grad_norm": 0.89453125, "learning_rate": 0.0004983611763018314, "loss": 5.5038, "mean_token_accuracy": 0.16732366234064103, "num_tokens": 10810743.0, "step": 5200 }, { "entropy": 5.801402473449707, "epoch": 0.47215166908563133, "grad_norm": 0.94140625, "learning_rate": 0.0004983572758466208, "loss": 5.6878, "mean_token_accuracy": 0.16397374272346496, "num_tokens": 10821897.0, "step": 5205 }, { "entropy": 5.7822551250457765, "epoch": 0.47260522496371554, "grad_norm": 0.9921875, "learning_rate": 0.0004983533707723247, "loss": 5.5451, "mean_token_accuracy": 0.17132560312747955, "num_tokens": 10831589.0, "step": 5210 }, { "entropy": 5.684686899185181, "epoch": 0.4730587808417997, "grad_norm": 0.9296875, "learning_rate": 0.0004983494610790241, "loss": 5.4469, "mean_token_accuracy": 0.16281144618988036, "num_tokens": 10841404.0, "step": 5215 }, { "entropy": 5.6485227108001705, "epoch": 0.4735123367198839, "grad_norm": 0.9140625, "learning_rate": 0.0004983455467667996, "loss": 5.5001, "mean_token_accuracy": 0.16492253094911574, "num_tokens": 10851577.0, "step": 5220 }, { "entropy": 5.6523786067962645, "epoch": 0.47396589259796806, "grad_norm": 0.97265625, "learning_rate": 0.0004983416278357322, "loss": 5.4073, "mean_token_accuracy": 0.17646127343177795, "num_tokens": 10861403.0, "step": 5225 }, { "entropy": 5.64488115310669, "epoch": 0.4744194484760523, "grad_norm": 0.93359375, "learning_rate": 0.0004983377042859032, "loss": 5.4546, "mean_token_accuracy": 0.16768310219049454, "num_tokens": 10871933.0, "step": 5230 }, { "entropy": 5.648560285568237, "epoch": 0.47487300435413643, "grad_norm": 0.96484375, "learning_rate": 0.0004983337761173936, "loss": 5.5315, "mean_token_accuracy": 0.16874219328165055, "num_tokens": 10881800.0, "step": 5235 }, { "entropy": 5.737661933898925, "epoch": 0.4753265602322206, "grad_norm": 0.94140625, "learning_rate": 0.0004983298433302843, "loss": 5.4753, "mean_token_accuracy": 0.1727318361401558, "num_tokens": 10891830.0, "step": 5240 }, { "entropy": 5.6505979061126705, "epoch": 0.4757801161103048, "grad_norm": 0.94140625, "learning_rate": 0.0004983259059246572, "loss": 5.403, "mean_token_accuracy": 0.17735837250947953, "num_tokens": 10901557.0, "step": 5245 }, { "entropy": 5.579076051712036, "epoch": 0.47623367198838895, "grad_norm": 0.88671875, "learning_rate": 0.0004983219639005934, "loss": 5.5252, "mean_token_accuracy": 0.16280789524316788, "num_tokens": 10912155.0, "step": 5250 }, { "entropy": 5.642884588241577, "epoch": 0.47668722786647316, "grad_norm": 1.0078125, "learning_rate": 0.0004983180172581745, "loss": 5.4296, "mean_token_accuracy": 0.17732747346162797, "num_tokens": 10922291.0, "step": 5255 }, { "entropy": 5.7082366943359375, "epoch": 0.4771407837445573, "grad_norm": 0.875, "learning_rate": 0.0004983140659974819, "loss": 5.5024, "mean_token_accuracy": 0.1679125025868416, "num_tokens": 10933176.0, "step": 5260 }, { "entropy": 5.698912668228149, "epoch": 0.47759433962264153, "grad_norm": 0.9296875, "learning_rate": 0.0004983101101185977, "loss": 5.5828, "mean_token_accuracy": 0.16323981285095215, "num_tokens": 10944049.0, "step": 5265 }, { "entropy": 5.633695650100708, "epoch": 0.4780478955007257, "grad_norm": 0.91015625, "learning_rate": 0.0004983061496216035, "loss": 5.4238, "mean_token_accuracy": 0.17720418572425842, "num_tokens": 10954347.0, "step": 5270 }, { "entropy": 5.6351593971252445, "epoch": 0.4785014513788099, "grad_norm": 0.921875, "learning_rate": 0.0004983021845065812, "loss": 5.4756, "mean_token_accuracy": 0.175036196410656, "num_tokens": 10965123.0, "step": 5275 }, { "entropy": 5.597521591186523, "epoch": 0.47895500725689405, "grad_norm": 0.98046875, "learning_rate": 0.0004982982147736128, "loss": 5.4642, "mean_token_accuracy": 0.17434579282999038, "num_tokens": 10976395.0, "step": 5280 }, { "entropy": 5.691222858428955, "epoch": 0.4794085631349782, "grad_norm": 0.92578125, "learning_rate": 0.0004982942404227805, "loss": 5.4586, "mean_token_accuracy": 0.16569167971611024, "num_tokens": 10986797.0, "step": 5285 }, { "entropy": 5.708698081970215, "epoch": 0.4798621190130624, "grad_norm": 0.8671875, "learning_rate": 0.0004982902614541662, "loss": 5.5117, "mean_token_accuracy": 0.17047134935855865, "num_tokens": 10997229.0, "step": 5290 }, { "entropy": 5.614826726913452, "epoch": 0.48031567489114657, "grad_norm": 0.87109375, "learning_rate": 0.0004982862778678526, "loss": 5.4412, "mean_token_accuracy": 0.17899638414382935, "num_tokens": 11008180.0, "step": 5295 }, { "entropy": 5.683491897583008, "epoch": 0.4807692307692308, "grad_norm": 0.890625, "learning_rate": 0.0004982822896639218, "loss": 5.4705, "mean_token_accuracy": 0.17429982572793962, "num_tokens": 11019248.0, "step": 5300 }, { "entropy": 5.617243051528931, "epoch": 0.48122278664731494, "grad_norm": 0.87109375, "learning_rate": 0.0004982782968424563, "loss": 5.3761, "mean_token_accuracy": 0.1775210216641426, "num_tokens": 11029760.0, "step": 5305 }, { "entropy": 5.588413190841675, "epoch": 0.48167634252539915, "grad_norm": 1.0, "learning_rate": 0.0004982742994035388, "loss": 5.4821, "mean_token_accuracy": 0.17242670059204102, "num_tokens": 11039211.0, "step": 5310 }, { "entropy": 5.662622356414795, "epoch": 0.4821298984034833, "grad_norm": 0.94140625, "learning_rate": 0.0004982702973472518, "loss": 5.454, "mean_token_accuracy": 0.17342988401651382, "num_tokens": 11049892.0, "step": 5315 }, { "entropy": 5.746756601333618, "epoch": 0.4825834542815675, "grad_norm": 0.890625, "learning_rate": 0.0004982662906736783, "loss": 5.5041, "mean_token_accuracy": 0.17146852016448974, "num_tokens": 11060823.0, "step": 5320 }, { "entropy": 5.609480905532837, "epoch": 0.48303701015965167, "grad_norm": 0.83984375, "learning_rate": 0.0004982622793829009, "loss": 5.4768, "mean_token_accuracy": 0.17211514413356782, "num_tokens": 11072353.0, "step": 5325 }, { "entropy": 5.6528795719146725, "epoch": 0.4834905660377358, "grad_norm": 0.95703125, "learning_rate": 0.0004982582634750027, "loss": 5.491, "mean_token_accuracy": 0.1721246212720871, "num_tokens": 11082655.0, "step": 5330 }, { "entropy": 5.676597452163696, "epoch": 0.48394412191582004, "grad_norm": 0.8828125, "learning_rate": 0.0004982542429500667, "loss": 5.5053, "mean_token_accuracy": 0.17382133454084397, "num_tokens": 11093315.0, "step": 5335 }, { "entropy": 5.524261379241944, "epoch": 0.4843976777939042, "grad_norm": 0.9453125, "learning_rate": 0.0004982502178081761, "loss": 5.4042, "mean_token_accuracy": 0.17310083359479905, "num_tokens": 11103074.0, "step": 5340 }, { "entropy": 5.666402530670166, "epoch": 0.4848512336719884, "grad_norm": 0.93359375, "learning_rate": 0.0004982461880494141, "loss": 5.4279, "mean_token_accuracy": 0.17441916912794114, "num_tokens": 11113636.0, "step": 5345 }, { "entropy": 5.656398725509644, "epoch": 0.48530478955007256, "grad_norm": 0.92578125, "learning_rate": 0.000498242153673864, "loss": 5.4039, "mean_token_accuracy": 0.17608933597803117, "num_tokens": 11123509.0, "step": 5350 }, { "entropy": 5.613732099533081, "epoch": 0.48575834542815677, "grad_norm": 0.921875, "learning_rate": 0.0004982381146816094, "loss": 5.4686, "mean_token_accuracy": 0.16522315591573716, "num_tokens": 11133405.0, "step": 5355 }, { "entropy": 5.73980131149292, "epoch": 0.4862119013062409, "grad_norm": 0.84375, "learning_rate": 0.0004982340710727336, "loss": 5.533, "mean_token_accuracy": 0.16312984079122544, "num_tokens": 11144725.0, "step": 5360 }, { "entropy": 5.67049765586853, "epoch": 0.48666545718432513, "grad_norm": 0.9609375, "learning_rate": 0.0004982300228473203, "loss": 5.4184, "mean_token_accuracy": 0.16829311102628708, "num_tokens": 11155446.0, "step": 5365 }, { "entropy": 5.636474370956421, "epoch": 0.4871190130624093, "grad_norm": 0.9296875, "learning_rate": 0.0004982259700054533, "loss": 5.4818, "mean_token_accuracy": 0.17630883306264877, "num_tokens": 11165380.0, "step": 5370 }, { "entropy": 5.647053050994873, "epoch": 0.48757256894049344, "grad_norm": 0.890625, "learning_rate": 0.0004982219125472163, "loss": 5.5238, "mean_token_accuracy": 0.1691724866628647, "num_tokens": 11175641.0, "step": 5375 }, { "entropy": 5.799345302581787, "epoch": 0.48802612481857766, "grad_norm": 0.921875, "learning_rate": 0.0004982178504726933, "loss": 5.6734, "mean_token_accuracy": 0.17320263534784316, "num_tokens": 11186257.0, "step": 5380 }, { "entropy": 5.727895784378052, "epoch": 0.4884796806966618, "grad_norm": 0.86328125, "learning_rate": 0.0004982137837819682, "loss": 5.4966, "mean_token_accuracy": 0.16289989352226258, "num_tokens": 11197284.0, "step": 5385 }, { "entropy": 5.688380861282349, "epoch": 0.488933236574746, "grad_norm": 0.91796875, "learning_rate": 0.0004982097124751252, "loss": 5.4741, "mean_token_accuracy": 0.17410095632076264, "num_tokens": 11208413.0, "step": 5390 }, { "entropy": 5.629041337966919, "epoch": 0.4893867924528302, "grad_norm": 0.89453125, "learning_rate": 0.0004982056365522486, "loss": 5.4667, "mean_token_accuracy": 0.17381504625082017, "num_tokens": 11219016.0, "step": 5395 }, { "entropy": 5.625274276733398, "epoch": 0.4898403483309144, "grad_norm": 0.890625, "learning_rate": 0.0004982015560134225, "loss": 5.4451, "mean_token_accuracy": 0.1747204378247261, "num_tokens": 11228934.0, "step": 5400 }, { "entropy": 5.639862775802612, "epoch": 0.49029390420899854, "grad_norm": 1.0625, "learning_rate": 0.0004981974708587312, "loss": 5.3724, "mean_token_accuracy": 0.17818964570760726, "num_tokens": 11239596.0, "step": 5405 }, { "entropy": 5.603957653045654, "epoch": 0.49074746008708275, "grad_norm": 0.91796875, "learning_rate": 0.0004981933810882594, "loss": 5.3515, "mean_token_accuracy": 0.17084526121616364, "num_tokens": 11249560.0, "step": 5410 }, { "entropy": 5.707994842529297, "epoch": 0.4912010159651669, "grad_norm": 0.91796875, "learning_rate": 0.0004981892867020917, "loss": 5.5617, "mean_token_accuracy": 0.17124133110046386, "num_tokens": 11259787.0, "step": 5415 }, { "entropy": 5.722805786132812, "epoch": 0.49165457184325106, "grad_norm": 0.96875, "learning_rate": 0.0004981851877003125, "loss": 5.5011, "mean_token_accuracy": 0.1731458768248558, "num_tokens": 11269717.0, "step": 5420 }, { "entropy": 5.625773620605469, "epoch": 0.4921081277213353, "grad_norm": 1.015625, "learning_rate": 0.0004981810840830068, "loss": 5.474, "mean_token_accuracy": 0.18215908706188202, "num_tokens": 11279863.0, "step": 5425 }, { "entropy": 5.666403102874756, "epoch": 0.49256168359941943, "grad_norm": 0.94140625, "learning_rate": 0.0004981769758502596, "loss": 5.5915, "mean_token_accuracy": 0.1605565443634987, "num_tokens": 11291161.0, "step": 5430 }, { "entropy": 5.609889507293701, "epoch": 0.49301523947750364, "grad_norm": 0.95703125, "learning_rate": 0.0004981728630021555, "loss": 5.4073, "mean_token_accuracy": 0.17431867867708206, "num_tokens": 11301151.0, "step": 5435 }, { "entropy": 5.583493232727051, "epoch": 0.4934687953555878, "grad_norm": 0.9609375, "learning_rate": 0.0004981687455387797, "loss": 5.4231, "mean_token_accuracy": 0.1704528123140335, "num_tokens": 11311466.0, "step": 5440 }, { "entropy": 5.651216983795166, "epoch": 0.493922351233672, "grad_norm": 0.921875, "learning_rate": 0.0004981646234602173, "loss": 5.3677, "mean_token_accuracy": 0.17543147057294844, "num_tokens": 11321522.0, "step": 5445 }, { "entropy": 5.70766978263855, "epoch": 0.49437590711175616, "grad_norm": 0.8671875, "learning_rate": 0.0004981604967665539, "loss": 5.4904, "mean_token_accuracy": 0.17429745495319365, "num_tokens": 11332317.0, "step": 5450 }, { "entropy": 5.638960981369019, "epoch": 0.4948294629898404, "grad_norm": 0.91015625, "learning_rate": 0.0004981563654578743, "loss": 5.4383, "mean_token_accuracy": 0.1693056493997574, "num_tokens": 11343024.0, "step": 5455 }, { "entropy": 5.579675197601318, "epoch": 0.49528301886792453, "grad_norm": 0.96484375, "learning_rate": 0.0004981522295342643, "loss": 5.392, "mean_token_accuracy": 0.17219439148902893, "num_tokens": 11353114.0, "step": 5460 }, { "entropy": 5.644372177124024, "epoch": 0.4957365747460087, "grad_norm": 0.87109375, "learning_rate": 0.0004981480889958092, "loss": 5.4615, "mean_token_accuracy": 0.17464147955179216, "num_tokens": 11363446.0, "step": 5465 }, { "entropy": 5.612289381027222, "epoch": 0.4961901306240929, "grad_norm": 0.90625, "learning_rate": 0.0004981439438425949, "loss": 5.4536, "mean_token_accuracy": 0.1771087482571602, "num_tokens": 11373413.0, "step": 5470 }, { "entropy": 5.613510656356811, "epoch": 0.49664368650217705, "grad_norm": 0.9921875, "learning_rate": 0.000498139794074707, "loss": 5.3264, "mean_token_accuracy": 0.17951995581388475, "num_tokens": 11383142.0, "step": 5475 }, { "entropy": 5.666054725646973, "epoch": 0.49709724238026126, "grad_norm": 0.9609375, "learning_rate": 0.0004981356396922313, "loss": 5.4847, "mean_token_accuracy": 0.17279811352491378, "num_tokens": 11394635.0, "step": 5480 }, { "entropy": 5.604884958267212, "epoch": 0.4975507982583454, "grad_norm": 1.3203125, "learning_rate": 0.0004981314806952535, "loss": 5.3892, "mean_token_accuracy": 0.17838599234819413, "num_tokens": 11404442.0, "step": 5485 }, { "entropy": 5.557573413848877, "epoch": 0.49800435413642963, "grad_norm": 0.96875, "learning_rate": 0.00049812731708386, "loss": 5.3433, "mean_token_accuracy": 0.17274410128593445, "num_tokens": 11414217.0, "step": 5490 }, { "entropy": 5.678751802444458, "epoch": 0.4984579100145138, "grad_norm": 0.9609375, "learning_rate": 0.0004981231488581367, "loss": 5.4886, "mean_token_accuracy": 0.16931686848402022, "num_tokens": 11423834.0, "step": 5495 }, { "entropy": 5.5513814926147464, "epoch": 0.498911465892598, "grad_norm": 0.9140625, "learning_rate": 0.0004981189760181699, "loss": 5.358, "mean_token_accuracy": 0.17370127141475677, "num_tokens": 11433613.0, "step": 5500 }, { "entropy": 5.579940223693848, "epoch": 0.49936502177068215, "grad_norm": 0.96875, "learning_rate": 0.0004981147985640456, "loss": 5.4257, "mean_token_accuracy": 0.17723614424467088, "num_tokens": 11443915.0, "step": 5505 }, { "entropy": 5.704259824752808, "epoch": 0.4998185776487663, "grad_norm": 0.890625, "learning_rate": 0.0004981106164958506, "loss": 5.4561, "mean_token_accuracy": 0.1709003448486328, "num_tokens": 11454588.0, "step": 5510 }, { "entropy": 5.648460054397583, "epoch": 0.5002721335268505, "grad_norm": 0.92578125, "learning_rate": 0.0004981064298136712, "loss": 5.5067, "mean_token_accuracy": 0.16957272291183473, "num_tokens": 11465533.0, "step": 5515 }, { "entropy": 5.622145414352417, "epoch": 0.5007256894049347, "grad_norm": 0.94921875, "learning_rate": 0.0004981022385175939, "loss": 5.4586, "mean_token_accuracy": 0.16735394597053527, "num_tokens": 11475776.0, "step": 5520 }, { "entropy": 5.620416879653931, "epoch": 0.5011792452830188, "grad_norm": 0.9296875, "learning_rate": 0.0004980980426077054, "loss": 5.4385, "mean_token_accuracy": 0.18021399825811385, "num_tokens": 11486200.0, "step": 5525 }, { "entropy": 5.633817100524903, "epoch": 0.5016328011611031, "grad_norm": 0.91015625, "learning_rate": 0.0004980938420840926, "loss": 5.4609, "mean_token_accuracy": 0.16805864125490189, "num_tokens": 11496768.0, "step": 5530 }, { "entropy": 5.64311728477478, "epoch": 0.5020863570391872, "grad_norm": 0.93359375, "learning_rate": 0.0004980896369468423, "loss": 5.438, "mean_token_accuracy": 0.17364895343780518, "num_tokens": 11507096.0, "step": 5535 }, { "entropy": 5.617955064773559, "epoch": 0.5025399129172714, "grad_norm": 0.90234375, "learning_rate": 0.0004980854271960415, "loss": 5.4858, "mean_token_accuracy": 0.17146076411008834, "num_tokens": 11517301.0, "step": 5540 }, { "entropy": 5.691181278228759, "epoch": 0.5029934687953556, "grad_norm": 0.89453125, "learning_rate": 0.0004980812128317772, "loss": 5.5381, "mean_token_accuracy": 0.17311448901891707, "num_tokens": 11528616.0, "step": 5545 }, { "entropy": 5.710403871536255, "epoch": 0.5034470246734397, "grad_norm": 0.8671875, "learning_rate": 0.0004980769938541364, "loss": 5.4596, "mean_token_accuracy": 0.17918587774038314, "num_tokens": 11539344.0, "step": 5550 }, { "entropy": 5.611640930175781, "epoch": 0.503900580551524, "grad_norm": 0.921875, "learning_rate": 0.0004980727702632066, "loss": 5.5158, "mean_token_accuracy": 0.1702592894434929, "num_tokens": 11549511.0, "step": 5555 }, { "entropy": 5.654125452041626, "epoch": 0.5043541364296081, "grad_norm": 0.9375, "learning_rate": 0.0004980685420590752, "loss": 5.4425, "mean_token_accuracy": 0.17124981731176375, "num_tokens": 11559425.0, "step": 5560 }, { "entropy": 5.7445450782775875, "epoch": 0.5048076923076923, "grad_norm": 0.90234375, "learning_rate": 0.0004980643092418294, "loss": 5.564, "mean_token_accuracy": 0.16161303967237473, "num_tokens": 11570406.0, "step": 5565 }, { "entropy": 5.652337265014649, "epoch": 0.5052612481857764, "grad_norm": 0.890625, "learning_rate": 0.0004980600718115568, "loss": 5.4435, "mean_token_accuracy": 0.17120484560728072, "num_tokens": 11580509.0, "step": 5570 }, { "entropy": 5.657799530029297, "epoch": 0.5057148040638607, "grad_norm": 0.87890625, "learning_rate": 0.0004980558297683452, "loss": 5.4658, "mean_token_accuracy": 0.17254962921142578, "num_tokens": 11590860.0, "step": 5575 }, { "entropy": 5.69189043045044, "epoch": 0.5061683599419449, "grad_norm": 0.96875, "learning_rate": 0.0004980515831122822, "loss": 5.4658, "mean_token_accuracy": 0.16972111016511918, "num_tokens": 11601954.0, "step": 5580 }, { "entropy": 5.641917419433594, "epoch": 0.506621915820029, "grad_norm": 0.83203125, "learning_rate": 0.0004980473318434555, "loss": 5.4643, "mean_token_accuracy": 0.17524617165327072, "num_tokens": 11612581.0, "step": 5585 }, { "entropy": 5.54950852394104, "epoch": 0.5070754716981132, "grad_norm": 1.1171875, "learning_rate": 0.0004980430759619532, "loss": 5.3893, "mean_token_accuracy": 0.17424534559249877, "num_tokens": 11622599.0, "step": 5590 }, { "entropy": 5.572847175598144, "epoch": 0.5075290275761973, "grad_norm": 0.984375, "learning_rate": 0.0004980388154678633, "loss": 5.4041, "mean_token_accuracy": 0.1734546795487404, "num_tokens": 11633611.0, "step": 5595 }, { "entropy": 5.59787654876709, "epoch": 0.5079825834542816, "grad_norm": 0.98828125, "learning_rate": 0.0004980345503612738, "loss": 5.3836, "mean_token_accuracy": 0.1732645958662033, "num_tokens": 11643159.0, "step": 5600 }, { "entropy": 5.615271997451782, "epoch": 0.5084361393323658, "grad_norm": 0.91796875, "learning_rate": 0.0004980302806422729, "loss": 5.3753, "mean_token_accuracy": 0.1775027260184288, "num_tokens": 11653174.0, "step": 5605 }, { "entropy": 5.674450540542603, "epoch": 0.5088896952104499, "grad_norm": 0.92578125, "learning_rate": 0.0004980260063109491, "loss": 5.4227, "mean_token_accuracy": 0.17737311273813247, "num_tokens": 11662621.0, "step": 5610 }, { "entropy": 5.543775224685669, "epoch": 0.5093432510885341, "grad_norm": 0.83203125, "learning_rate": 0.0004980217273673906, "loss": 5.3793, "mean_token_accuracy": 0.17156035602092742, "num_tokens": 11673538.0, "step": 5615 }, { "entropy": 5.653875684738159, "epoch": 0.5097968069666183, "grad_norm": 0.9296875, "learning_rate": 0.0004980174438116859, "loss": 5.3914, "mean_token_accuracy": 0.17867197394371032, "num_tokens": 11683203.0, "step": 5620 }, { "entropy": 5.552722072601318, "epoch": 0.5102503628447025, "grad_norm": 0.96484375, "learning_rate": 0.0004980131556439236, "loss": 5.3829, "mean_token_accuracy": 0.180565182864666, "num_tokens": 11693313.0, "step": 5625 }, { "entropy": 5.640235567092896, "epoch": 0.5107039187227866, "grad_norm": 0.8828125, "learning_rate": 0.0004980088628641925, "loss": 5.4783, "mean_token_accuracy": 0.17274700552225114, "num_tokens": 11704194.0, "step": 5630 }, { "entropy": 5.642412567138672, "epoch": 0.5111574746008708, "grad_norm": 0.84375, "learning_rate": 0.0004980045654725812, "loss": 5.336, "mean_token_accuracy": 0.17914541512727739, "num_tokens": 11715109.0, "step": 5635 }, { "entropy": 5.5468549728393555, "epoch": 0.511611030478955, "grad_norm": 0.96484375, "learning_rate": 0.0004980002634691787, "loss": 5.3796, "mean_token_accuracy": 0.17843705415725708, "num_tokens": 11724961.0, "step": 5640 }, { "entropy": 5.552511072158813, "epoch": 0.5120645863570392, "grad_norm": 0.9765625, "learning_rate": 0.000497995956854074, "loss": 5.3914, "mean_token_accuracy": 0.17831180095672608, "num_tokens": 11735334.0, "step": 5645 }, { "entropy": 5.550053977966309, "epoch": 0.5125181422351234, "grad_norm": 0.9140625, "learning_rate": 0.0004979916456273561, "loss": 5.3935, "mean_token_accuracy": 0.1712997004389763, "num_tokens": 11746858.0, "step": 5650 }, { "entropy": 5.689655733108521, "epoch": 0.5129716981132075, "grad_norm": 0.89453125, "learning_rate": 0.0004979873297891141, "loss": 5.4965, "mean_token_accuracy": 0.16972004026174545, "num_tokens": 11757819.0, "step": 5655 }, { "entropy": 5.650430011749267, "epoch": 0.5134252539912917, "grad_norm": 1.0546875, "learning_rate": 0.0004979830093394372, "loss": 5.4349, "mean_token_accuracy": 0.17406515330076217, "num_tokens": 11767470.0, "step": 5660 }, { "entropy": 5.574281358718872, "epoch": 0.513878809869376, "grad_norm": 0.9140625, "learning_rate": 0.0004979786842784149, "loss": 5.3549, "mean_token_accuracy": 0.1825924515724182, "num_tokens": 11777060.0, "step": 5665 }, { "entropy": 5.566286706924439, "epoch": 0.5143323657474601, "grad_norm": 0.921875, "learning_rate": 0.0004979743546061366, "loss": 5.4107, "mean_token_accuracy": 0.17651544213294984, "num_tokens": 11787176.0, "step": 5670 }, { "entropy": 5.5616296291351315, "epoch": 0.5147859216255443, "grad_norm": 1.015625, "learning_rate": 0.0004979700203226918, "loss": 5.2849, "mean_token_accuracy": 0.17933404445648193, "num_tokens": 11796419.0, "step": 5675 }, { "entropy": 5.682236576080323, "epoch": 0.5152394775036284, "grad_norm": 0.9140625, "learning_rate": 0.0004979656814281702, "loss": 5.5213, "mean_token_accuracy": 0.1706225335597992, "num_tokens": 11807279.0, "step": 5680 }, { "entropy": 5.606097984313965, "epoch": 0.5156930333817126, "grad_norm": 1.015625, "learning_rate": 0.0004979613379226615, "loss": 5.4088, "mean_token_accuracy": 0.1719408765435219, "num_tokens": 11817669.0, "step": 5685 }, { "entropy": 5.544135332107544, "epoch": 0.5161465892597968, "grad_norm": 0.9375, "learning_rate": 0.0004979569898062554, "loss": 5.415, "mean_token_accuracy": 0.179472017288208, "num_tokens": 11827247.0, "step": 5690 }, { "entropy": 5.619077444076538, "epoch": 0.516600145137881, "grad_norm": 0.9609375, "learning_rate": 0.000497952637079042, "loss": 5.402, "mean_token_accuracy": 0.17077631801366805, "num_tokens": 11838201.0, "step": 5695 }, { "entropy": 5.608509302139282, "epoch": 0.5170537010159652, "grad_norm": 0.9375, "learning_rate": 0.0004979482797411114, "loss": 5.3538, "mean_token_accuracy": 0.18213389366865157, "num_tokens": 11847561.0, "step": 5700 }, { "entropy": 5.63592209815979, "epoch": 0.5175072568940493, "grad_norm": 0.96875, "learning_rate": 0.0004979439177925534, "loss": 5.4601, "mean_token_accuracy": 0.17978523373603822, "num_tokens": 11858272.0, "step": 5705 }, { "entropy": 5.664514636993408, "epoch": 0.5179608127721336, "grad_norm": 0.88671875, "learning_rate": 0.0004979395512334584, "loss": 5.4897, "mean_token_accuracy": 0.1710379973053932, "num_tokens": 11869660.0, "step": 5710 }, { "entropy": 5.657863283157349, "epoch": 0.5184143686502177, "grad_norm": 0.87109375, "learning_rate": 0.0004979351800639166, "loss": 5.522, "mean_token_accuracy": 0.16624149084091186, "num_tokens": 11880239.0, "step": 5715 }, { "entropy": 5.723998975753784, "epoch": 0.5188679245283019, "grad_norm": 0.8984375, "learning_rate": 0.0004979308042840186, "loss": 5.5019, "mean_token_accuracy": 0.16436144411563874, "num_tokens": 11890630.0, "step": 5720 }, { "entropy": 5.692220687866211, "epoch": 0.519321480406386, "grad_norm": 0.88671875, "learning_rate": 0.0004979264238938547, "loss": 5.5387, "mean_token_accuracy": 0.16605993658304213, "num_tokens": 11900948.0, "step": 5725 }, { "entropy": 5.5566572666168215, "epoch": 0.5197750362844702, "grad_norm": 0.89453125, "learning_rate": 0.0004979220388935155, "loss": 5.4197, "mean_token_accuracy": 0.1711593523621559, "num_tokens": 11912528.0, "step": 5730 }, { "entropy": 5.620328950881958, "epoch": 0.5202285921625545, "grad_norm": 0.91796875, "learning_rate": 0.0004979176492830918, "loss": 5.36, "mean_token_accuracy": 0.1769677922129631, "num_tokens": 11922211.0, "step": 5735 }, { "entropy": 5.6201256275177, "epoch": 0.5206821480406386, "grad_norm": 0.9609375, "learning_rate": 0.0004979132550626742, "loss": 5.4102, "mean_token_accuracy": 0.1742950886487961, "num_tokens": 11932520.0, "step": 5740 }, { "entropy": 5.587960624694825, "epoch": 0.5211357039187228, "grad_norm": 0.921875, "learning_rate": 0.0004979088562323538, "loss": 5.3434, "mean_token_accuracy": 0.17956214398145676, "num_tokens": 11943312.0, "step": 5745 }, { "entropy": 5.564781379699707, "epoch": 0.5215892597968069, "grad_norm": 1.015625, "learning_rate": 0.0004979044527922214, "loss": 5.4926, "mean_token_accuracy": 0.1721508026123047, "num_tokens": 11954455.0, "step": 5750 }, { "entropy": 5.6627356052398685, "epoch": 0.5220428156748912, "grad_norm": 0.9453125, "learning_rate": 0.0004979000447423681, "loss": 5.3863, "mean_token_accuracy": 0.17926096618175508, "num_tokens": 11964650.0, "step": 5755 }, { "entropy": 5.575634002685547, "epoch": 0.5224963715529753, "grad_norm": 0.87890625, "learning_rate": 0.0004978956320828851, "loss": 5.4195, "mean_token_accuracy": 0.1762705847620964, "num_tokens": 11975134.0, "step": 5760 }, { "entropy": 5.606097459793091, "epoch": 0.5229499274310595, "grad_norm": 0.90234375, "learning_rate": 0.0004978912148138637, "loss": 5.4532, "mean_token_accuracy": 0.17324555963277816, "num_tokens": 11986486.0, "step": 5765 }, { "entropy": 5.678210592269897, "epoch": 0.5234034833091437, "grad_norm": 0.98046875, "learning_rate": 0.000497886792935395, "loss": 5.4704, "mean_token_accuracy": 0.1706312969326973, "num_tokens": 11998045.0, "step": 5770 }, { "entropy": 5.717112493515015, "epoch": 0.5238570391872278, "grad_norm": 0.875, "learning_rate": 0.0004978823664475707, "loss": 5.4668, "mean_token_accuracy": 0.17400625944137574, "num_tokens": 12008130.0, "step": 5775 }, { "entropy": 5.6386171817779545, "epoch": 0.5243105950653121, "grad_norm": 0.94921875, "learning_rate": 0.0004978779353504824, "loss": 5.5292, "mean_token_accuracy": 0.1656391978263855, "num_tokens": 12018753.0, "step": 5780 }, { "entropy": 5.631770372390747, "epoch": 0.5247641509433962, "grad_norm": 1.0, "learning_rate": 0.0004978734996442214, "loss": 5.4048, "mean_token_accuracy": 0.17983568012714385, "num_tokens": 12028202.0, "step": 5785 }, { "entropy": 5.612694168090821, "epoch": 0.5252177068214804, "grad_norm": 0.90625, "learning_rate": 0.0004978690593288798, "loss": 5.4843, "mean_token_accuracy": 0.17659876495599747, "num_tokens": 12039652.0, "step": 5790 }, { "entropy": 5.678992748260498, "epoch": 0.5256712626995645, "grad_norm": 1.0234375, "learning_rate": 0.0004978646144045491, "loss": 5.3938, "mean_token_accuracy": 0.16736219227313995, "num_tokens": 12051269.0, "step": 5795 }, { "entropy": 5.46131854057312, "epoch": 0.5261248185776488, "grad_norm": 0.93359375, "learning_rate": 0.0004978601648713215, "loss": 5.291, "mean_token_accuracy": 0.17717837989330293, "num_tokens": 12060647.0, "step": 5800 }, { "entropy": 5.585661935806274, "epoch": 0.526578374455733, "grad_norm": 0.9140625, "learning_rate": 0.0004978557107292889, "loss": 5.4256, "mean_token_accuracy": 0.17812251448631286, "num_tokens": 12071669.0, "step": 5805 }, { "entropy": 5.561780834197998, "epoch": 0.5270319303338171, "grad_norm": 0.96484375, "learning_rate": 0.0004978512519785433, "loss": 5.3141, "mean_token_accuracy": 0.1775515452027321, "num_tokens": 12081971.0, "step": 5810 }, { "entropy": 5.567921876907349, "epoch": 0.5274854862119013, "grad_norm": 0.875, "learning_rate": 0.000497846788619177, "loss": 5.4346, "mean_token_accuracy": 0.18071742057800294, "num_tokens": 12092465.0, "step": 5815 }, { "entropy": 5.65427074432373, "epoch": 0.5279390420899854, "grad_norm": 0.89453125, "learning_rate": 0.0004978423206512825, "loss": 5.3935, "mean_token_accuracy": 0.17432788610458375, "num_tokens": 12101752.0, "step": 5820 }, { "entropy": 5.673962211608886, "epoch": 0.5283925979680697, "grad_norm": 1.03125, "learning_rate": 0.000497837848074952, "loss": 5.4643, "mean_token_accuracy": 0.17431971430778503, "num_tokens": 12111805.0, "step": 5825 }, { "entropy": 5.694564437866211, "epoch": 0.5288461538461539, "grad_norm": 0.9140625, "learning_rate": 0.000497833370890278, "loss": 5.4918, "mean_token_accuracy": 0.17020126730203627, "num_tokens": 12122511.0, "step": 5830 }, { "entropy": 5.607981729507446, "epoch": 0.529299709724238, "grad_norm": 0.953125, "learning_rate": 0.0004978288890973529, "loss": 5.3752, "mean_token_accuracy": 0.1757800757884979, "num_tokens": 12132510.0, "step": 5835 }, { "entropy": 5.561420106887818, "epoch": 0.5297532656023222, "grad_norm": 0.90234375, "learning_rate": 0.0004978244026962698, "loss": 5.3859, "mean_token_accuracy": 0.17332411408424378, "num_tokens": 12142419.0, "step": 5840 }, { "entropy": 5.6124217987060545, "epoch": 0.5302068214804064, "grad_norm": 1.0546875, "learning_rate": 0.0004978199116871212, "loss": 5.4348, "mean_token_accuracy": 0.17327335476875305, "num_tokens": 12152759.0, "step": 5845 }, { "entropy": 5.605248260498047, "epoch": 0.5306603773584906, "grad_norm": 0.86328125, "learning_rate": 0.00049781541607, "loss": 5.3847, "mean_token_accuracy": 0.17561568468809127, "num_tokens": 12162758.0, "step": 5850 }, { "entropy": 5.59306902885437, "epoch": 0.5311139332365747, "grad_norm": 0.921875, "learning_rate": 0.0004978109158449993, "loss": 5.444, "mean_token_accuracy": 0.17255426645278932, "num_tokens": 12172664.0, "step": 5855 }, { "entropy": 5.647549057006836, "epoch": 0.5315674891146589, "grad_norm": 0.8984375, "learning_rate": 0.0004978064110122121, "loss": 5.402, "mean_token_accuracy": 0.17630172818899154, "num_tokens": 12182028.0, "step": 5860 }, { "entropy": 5.641605806350708, "epoch": 0.532021044992743, "grad_norm": 0.91015625, "learning_rate": 0.0004978019015717314, "loss": 5.4504, "mean_token_accuracy": 0.17413344085216523, "num_tokens": 12192168.0, "step": 5865 }, { "entropy": 5.551989269256592, "epoch": 0.5324746008708273, "grad_norm": 0.92578125, "learning_rate": 0.0004977973875236508, "loss": 5.3544, "mean_token_accuracy": 0.1735835164785385, "num_tokens": 12202889.0, "step": 5870 }, { "entropy": 5.55653338432312, "epoch": 0.5329281567489115, "grad_norm": 0.9453125, "learning_rate": 0.0004977928688680634, "loss": 5.3953, "mean_token_accuracy": 0.17994537502527236, "num_tokens": 12212514.0, "step": 5875 }, { "entropy": 5.547123765945434, "epoch": 0.5333817126269956, "grad_norm": 0.96484375, "learning_rate": 0.0004977883456050626, "loss": 5.2653, "mean_token_accuracy": 0.18208599984645843, "num_tokens": 12222353.0, "step": 5880 }, { "entropy": 5.6921580791473385, "epoch": 0.5338352685050798, "grad_norm": 0.9296875, "learning_rate": 0.000497783817734742, "loss": 5.5429, "mean_token_accuracy": 0.16759776920080185, "num_tokens": 12232845.0, "step": 5885 }, { "entropy": 5.606061315536499, "epoch": 0.534288824383164, "grad_norm": 0.96875, "learning_rate": 0.0004977792852571954, "loss": 5.4554, "mean_token_accuracy": 0.16563831120729447, "num_tokens": 12242950.0, "step": 5890 }, { "entropy": 5.595444107055664, "epoch": 0.5347423802612482, "grad_norm": 0.8828125, "learning_rate": 0.0004977747481725164, "loss": 5.4387, "mean_token_accuracy": 0.17201048582792283, "num_tokens": 12253132.0, "step": 5895 }, { "entropy": 5.632798957824707, "epoch": 0.5351959361393324, "grad_norm": 0.94140625, "learning_rate": 0.0004977702064807987, "loss": 5.395, "mean_token_accuracy": 0.17704534381628037, "num_tokens": 12263214.0, "step": 5900 }, { "entropy": 5.541617584228516, "epoch": 0.5356494920174165, "grad_norm": 0.953125, "learning_rate": 0.0004977656601821366, "loss": 5.3208, "mean_token_accuracy": 0.1798873171210289, "num_tokens": 12273250.0, "step": 5905 }, { "entropy": 5.7590607643127445, "epoch": 0.5361030478955007, "grad_norm": 0.97265625, "learning_rate": 0.0004977611092766238, "loss": 5.5101, "mean_token_accuracy": 0.1787897080183029, "num_tokens": 12283767.0, "step": 5910 }, { "entropy": 5.534255886077881, "epoch": 0.5365566037735849, "grad_norm": 0.8515625, "learning_rate": 0.0004977565537643544, "loss": 5.3581, "mean_token_accuracy": 0.17475240379571916, "num_tokens": 12294612.0, "step": 5915 }, { "entropy": 5.534429550170898, "epoch": 0.5370101596516691, "grad_norm": 0.859375, "learning_rate": 0.0004977519936454227, "loss": 5.4397, "mean_token_accuracy": 0.17676630169153212, "num_tokens": 12305614.0, "step": 5920 }, { "entropy": 5.567504644393921, "epoch": 0.5374637155297532, "grad_norm": 0.90625, "learning_rate": 0.0004977474289199231, "loss": 5.3132, "mean_token_accuracy": 0.1735585629940033, "num_tokens": 12316152.0, "step": 5925 }, { "entropy": 5.551148366928101, "epoch": 0.5379172714078374, "grad_norm": 0.97265625, "learning_rate": 0.0004977428595879499, "loss": 5.3905, "mean_token_accuracy": 0.178743177652359, "num_tokens": 12325940.0, "step": 5930 }, { "entropy": 5.566306829452515, "epoch": 0.5383708272859217, "grad_norm": 1.140625, "learning_rate": 0.0004977382856495975, "loss": 5.39, "mean_token_accuracy": 0.17976804822683334, "num_tokens": 12335482.0, "step": 5935 }, { "entropy": 5.655665397644043, "epoch": 0.5388243831640058, "grad_norm": 0.98828125, "learning_rate": 0.0004977337071049606, "loss": 5.4884, "mean_token_accuracy": 0.1725362166762352, "num_tokens": 12346386.0, "step": 5940 }, { "entropy": 5.696004199981689, "epoch": 0.53927793904209, "grad_norm": 0.96484375, "learning_rate": 0.000497729123954134, "loss": 5.4451, "mean_token_accuracy": 0.17383963018655776, "num_tokens": 12356282.0, "step": 5945 }, { "entropy": 5.601561498641968, "epoch": 0.5397314949201741, "grad_norm": 0.90625, "learning_rate": 0.0004977245361972123, "loss": 5.4141, "mean_token_accuracy": 0.17678642570972442, "num_tokens": 12366994.0, "step": 5950 }, { "entropy": 5.545989513397217, "epoch": 0.5401850507982583, "grad_norm": 0.91015625, "learning_rate": 0.0004977199438342904, "loss": 5.3017, "mean_token_accuracy": 0.18050941973924636, "num_tokens": 12377524.0, "step": 5955 }, { "entropy": 5.595731210708618, "epoch": 0.5406386066763426, "grad_norm": 0.93359375, "learning_rate": 0.0004977153468654634, "loss": 5.4655, "mean_token_accuracy": 0.17503209561109542, "num_tokens": 12387593.0, "step": 5960 }, { "entropy": 5.697256326675415, "epoch": 0.5410921625544267, "grad_norm": 0.8671875, "learning_rate": 0.0004977107452908262, "loss": 5.4273, "mean_token_accuracy": 0.1787885919213295, "num_tokens": 12398732.0, "step": 5965 }, { "entropy": 5.61314206123352, "epoch": 0.5415457184325109, "grad_norm": 0.984375, "learning_rate": 0.000497706139110474, "loss": 5.4252, "mean_token_accuracy": 0.18124329149723054, "num_tokens": 12409821.0, "step": 5970 }, { "entropy": 5.593740558624267, "epoch": 0.541999274310595, "grad_norm": 1.0078125, "learning_rate": 0.0004977015283245021, "loss": 5.4482, "mean_token_accuracy": 0.17267510890960694, "num_tokens": 12420044.0, "step": 5975 }, { "entropy": 5.538191413879394, "epoch": 0.5424528301886793, "grad_norm": 0.91015625, "learning_rate": 0.0004976969129330059, "loss": 5.3615, "mean_token_accuracy": 0.17179904878139496, "num_tokens": 12430980.0, "step": 5980 }, { "entropy": 5.598214149475098, "epoch": 0.5429063860667634, "grad_norm": 0.8828125, "learning_rate": 0.0004976922929360808, "loss": 5.4067, "mean_token_accuracy": 0.1799796149134636, "num_tokens": 12441999.0, "step": 5985 }, { "entropy": 5.655162572860718, "epoch": 0.5433599419448476, "grad_norm": 0.8515625, "learning_rate": 0.0004976876683338222, "loss": 5.4457, "mean_token_accuracy": 0.1742375373840332, "num_tokens": 12452837.0, "step": 5990 }, { "entropy": 5.573116827011108, "epoch": 0.5438134978229318, "grad_norm": 0.97265625, "learning_rate": 0.000497683039126326, "loss": 5.3746, "mean_token_accuracy": 0.17719283998012542, "num_tokens": 12462142.0, "step": 5995 }, { "entropy": 5.566186046600341, "epoch": 0.5442670537010159, "grad_norm": 0.91015625, "learning_rate": 0.0004976784053136878, "loss": 5.4094, "mean_token_accuracy": 0.1800991877913475, "num_tokens": 12472756.0, "step": 6000 }, { "epoch": 0.5442670537010159, "eval_entropy": 5.364191224024846, "eval_loss": 5.434150695800781, "eval_mean_token_accuracy": 0.18153274842238737, "eval_num_tokens": 12472756.0, "eval_runtime": 20.5722, "eval_samples_per_second": 1718.825, "eval_steps_per_second": 214.853, "step": 6000 }, { "entropy": 5.625031852722168, "epoch": 0.5447206095791002, "grad_norm": 0.88671875, "learning_rate": 0.0004976737668960034, "loss": 5.5318, "mean_token_accuracy": 0.1683395102620125, "num_tokens": 12483115.0, "step": 6005 }, { "entropy": 5.665145683288574, "epoch": 0.5451741654571843, "grad_norm": 0.9140625, "learning_rate": 0.0004976691238733688, "loss": 5.3863, "mean_token_accuracy": 0.17331260144710542, "num_tokens": 12493280.0, "step": 6010 }, { "entropy": 5.628579378128052, "epoch": 0.5456277213352685, "grad_norm": 0.96875, "learning_rate": 0.00049766447624588, "loss": 5.5164, "mean_token_accuracy": 0.17446643561124803, "num_tokens": 12503665.0, "step": 6015 }, { "entropy": 5.585593891143799, "epoch": 0.5460812772133526, "grad_norm": 1.0, "learning_rate": 0.000497659824013633, "loss": 5.4308, "mean_token_accuracy": 0.17111265659332275, "num_tokens": 12513381.0, "step": 6020 }, { "entropy": 5.681701898574829, "epoch": 0.5465348330914369, "grad_norm": 0.85546875, "learning_rate": 0.0004976551671767241, "loss": 5.4617, "mean_token_accuracy": 0.16975319087505342, "num_tokens": 12524121.0, "step": 6025 }, { "entropy": 5.595137882232666, "epoch": 0.5469883889695211, "grad_norm": 0.86328125, "learning_rate": 0.0004976505057352496, "loss": 5.4145, "mean_token_accuracy": 0.17792607247829437, "num_tokens": 12533972.0, "step": 6030 }, { "entropy": 5.633500862121582, "epoch": 0.5474419448476052, "grad_norm": 0.93359375, "learning_rate": 0.0004976458396893059, "loss": 5.5324, "mean_token_accuracy": 0.1650451496243477, "num_tokens": 12544110.0, "step": 6035 }, { "entropy": 5.641628408432007, "epoch": 0.5478955007256894, "grad_norm": 0.87890625, "learning_rate": 0.0004976411690389896, "loss": 5.3603, "mean_token_accuracy": 0.17129435241222382, "num_tokens": 12554273.0, "step": 6040 }, { "entropy": 5.655753946304321, "epoch": 0.5483490566037735, "grad_norm": 0.94140625, "learning_rate": 0.000497636493784397, "loss": 5.4287, "mean_token_accuracy": 0.17427540570497513, "num_tokens": 12564633.0, "step": 6045 }, { "entropy": 5.596440839767456, "epoch": 0.5488026124818578, "grad_norm": 0.9609375, "learning_rate": 0.0004976318139256251, "loss": 5.3635, "mean_token_accuracy": 0.1775827169418335, "num_tokens": 12573790.0, "step": 6050 }, { "entropy": 5.63446683883667, "epoch": 0.549256168359942, "grad_norm": 0.99609375, "learning_rate": 0.0004976271294627706, "loss": 5.441, "mean_token_accuracy": 0.17123547047376633, "num_tokens": 12584265.0, "step": 6055 }, { "entropy": 5.5846747875213625, "epoch": 0.5497097242380261, "grad_norm": 0.875, "learning_rate": 0.0004976224403959303, "loss": 5.3174, "mean_token_accuracy": 0.17618338912725448, "num_tokens": 12594413.0, "step": 6060 }, { "entropy": 5.568248081207275, "epoch": 0.5501632801161103, "grad_norm": 0.92578125, "learning_rate": 0.0004976177467252012, "loss": 5.3923, "mean_token_accuracy": 0.1851392775774002, "num_tokens": 12604637.0, "step": 6065 }, { "entropy": 5.624586772918701, "epoch": 0.5506168359941945, "grad_norm": 0.859375, "learning_rate": 0.0004976130484506804, "loss": 5.4582, "mean_token_accuracy": 0.17681263536214828, "num_tokens": 12614873.0, "step": 6070 }, { "entropy": 5.648846769332886, "epoch": 0.5510703918722787, "grad_norm": 0.87109375, "learning_rate": 0.0004976083455724649, "loss": 5.3823, "mean_token_accuracy": 0.17441451996564866, "num_tokens": 12626182.0, "step": 6075 }, { "entropy": 5.535418891906739, "epoch": 0.5515239477503628, "grad_norm": 0.9140625, "learning_rate": 0.0004976036380906523, "loss": 5.3149, "mean_token_accuracy": 0.17663441896438598, "num_tokens": 12635418.0, "step": 6080 }, { "entropy": 5.582258033752441, "epoch": 0.551977503628447, "grad_norm": 0.91796875, "learning_rate": 0.0004975989260053395, "loss": 5.4765, "mean_token_accuracy": 0.16567691415548325, "num_tokens": 12645942.0, "step": 6085 }, { "entropy": 5.617289209365845, "epoch": 0.5524310595065312, "grad_norm": 0.98046875, "learning_rate": 0.0004975942093166242, "loss": 5.3982, "mean_token_accuracy": 0.17294339835643768, "num_tokens": 12656460.0, "step": 6090 }, { "entropy": 5.636151075363159, "epoch": 0.5528846153846154, "grad_norm": 0.90625, "learning_rate": 0.0004975894880246041, "loss": 5.3228, "mean_token_accuracy": 0.1788621500134468, "num_tokens": 12666916.0, "step": 6095 }, { "entropy": 5.526174592971802, "epoch": 0.5533381712626996, "grad_norm": 0.953125, "learning_rate": 0.0004975847621293766, "loss": 5.3853, "mean_token_accuracy": 0.18073209524154663, "num_tokens": 12677562.0, "step": 6100 }, { "entropy": 5.550758695602417, "epoch": 0.5537917271407837, "grad_norm": 0.89453125, "learning_rate": 0.0004975800316310394, "loss": 5.3618, "mean_token_accuracy": 0.1773673951625824, "num_tokens": 12687349.0, "step": 6105 }, { "entropy": 5.643798589706421, "epoch": 0.5542452830188679, "grad_norm": 0.8828125, "learning_rate": 0.0004975752965296906, "loss": 5.4098, "mean_token_accuracy": 0.17631264328956603, "num_tokens": 12697850.0, "step": 6110 }, { "entropy": 5.540865325927735, "epoch": 0.5546988388969522, "grad_norm": 0.921875, "learning_rate": 0.0004975705568254278, "loss": 5.2774, "mean_token_accuracy": 0.17912191450595855, "num_tokens": 12708283.0, "step": 6115 }, { "entropy": 5.57166051864624, "epoch": 0.5551523947750363, "grad_norm": 0.88671875, "learning_rate": 0.0004975658125183493, "loss": 5.3814, "mean_token_accuracy": 0.17749570310115814, "num_tokens": 12718201.0, "step": 6120 }, { "entropy": 5.551891422271728, "epoch": 0.5556059506531205, "grad_norm": 0.9453125, "learning_rate": 0.000497561063608553, "loss": 5.3217, "mean_token_accuracy": 0.18132489323616027, "num_tokens": 12728860.0, "step": 6125 }, { "entropy": 5.574612474441528, "epoch": 0.5560595065312046, "grad_norm": 0.81640625, "learning_rate": 0.0004975563100961372, "loss": 5.3979, "mean_token_accuracy": 0.17559077590703964, "num_tokens": 12739007.0, "step": 6130 }, { "entropy": 5.578898191452026, "epoch": 0.5565130624092888, "grad_norm": 0.9140625, "learning_rate": 0.0004975515519812002, "loss": 5.2461, "mean_token_accuracy": 0.1819448158144951, "num_tokens": 12749004.0, "step": 6135 }, { "entropy": 5.543379449844361, "epoch": 0.556966618287373, "grad_norm": 0.93359375, "learning_rate": 0.0004975467892638402, "loss": 5.3959, "mean_token_accuracy": 0.17813464105129242, "num_tokens": 12760085.0, "step": 6140 }, { "entropy": 5.59183669090271, "epoch": 0.5574201741654572, "grad_norm": 0.87890625, "learning_rate": 0.0004975420219441561, "loss": 5.3429, "mean_token_accuracy": 0.18399171233177186, "num_tokens": 12770303.0, "step": 6145 }, { "entropy": 5.58007698059082, "epoch": 0.5578737300435413, "grad_norm": 0.9921875, "learning_rate": 0.0004975372500222462, "loss": 5.3724, "mean_token_accuracy": 0.17818562537431717, "num_tokens": 12780334.0, "step": 6150 }, { "entropy": 5.587021446228027, "epoch": 0.5583272859216255, "grad_norm": 0.9453125, "learning_rate": 0.0004975324734982094, "loss": 5.4218, "mean_token_accuracy": 0.17108138799667358, "num_tokens": 12790980.0, "step": 6155 }, { "entropy": 5.621369981765747, "epoch": 0.5587808417997098, "grad_norm": 1.0078125, "learning_rate": 0.0004975276923721442, "loss": 5.4611, "mean_token_accuracy": 0.17504812330007552, "num_tokens": 12801713.0, "step": 6160 }, { "entropy": 5.644250059127808, "epoch": 0.5592343976777939, "grad_norm": 0.87109375, "learning_rate": 0.0004975229066441496, "loss": 5.4677, "mean_token_accuracy": 0.1687561482191086, "num_tokens": 12813040.0, "step": 6165 }, { "entropy": 5.577824926376342, "epoch": 0.5596879535558781, "grad_norm": 0.8984375, "learning_rate": 0.0004975181163143247, "loss": 5.4127, "mean_token_accuracy": 0.17071571797132493, "num_tokens": 12824048.0, "step": 6170 }, { "entropy": 5.64132513999939, "epoch": 0.5601415094339622, "grad_norm": 0.9453125, "learning_rate": 0.0004975133213827684, "loss": 5.3687, "mean_token_accuracy": 0.17483995854854584, "num_tokens": 12834297.0, "step": 6175 }, { "entropy": 5.66928539276123, "epoch": 0.5605950653120464, "grad_norm": 0.9296875, "learning_rate": 0.0004975085218495798, "loss": 5.4364, "mean_token_accuracy": 0.17078946828842162, "num_tokens": 12844574.0, "step": 6180 }, { "entropy": 5.536151313781739, "epoch": 0.5610486211901307, "grad_norm": 0.91015625, "learning_rate": 0.0004975037177148585, "loss": 5.3661, "mean_token_accuracy": 0.177015121281147, "num_tokens": 12854670.0, "step": 6185 }, { "entropy": 5.536833953857422, "epoch": 0.5615021770682148, "grad_norm": 0.87109375, "learning_rate": 0.0004974989089787035, "loss": 5.3828, "mean_token_accuracy": 0.17939384132623673, "num_tokens": 12865281.0, "step": 6190 }, { "entropy": 5.683811044692993, "epoch": 0.561955732946299, "grad_norm": 0.921875, "learning_rate": 0.0004974940956412143, "loss": 5.3903, "mean_token_accuracy": 0.1783251017332077, "num_tokens": 12875222.0, "step": 6195 }, { "entropy": 5.7399190902709964, "epoch": 0.5624092888243831, "grad_norm": 0.91796875, "learning_rate": 0.0004974892777024905, "loss": 5.4623, "mean_token_accuracy": 0.16634879112243653, "num_tokens": 12885079.0, "step": 6200 }, { "entropy": 5.523637962341309, "epoch": 0.5628628447024674, "grad_norm": 0.859375, "learning_rate": 0.0004974844551626318, "loss": 5.3998, "mean_token_accuracy": 0.1781408593058586, "num_tokens": 12896402.0, "step": 6205 }, { "entropy": 5.585960006713867, "epoch": 0.5633164005805515, "grad_norm": 0.92578125, "learning_rate": 0.0004974796280217379, "loss": 5.3653, "mean_token_accuracy": 0.18042189478874207, "num_tokens": 12906403.0, "step": 6210 }, { "entropy": 5.643087482452392, "epoch": 0.5637699564586357, "grad_norm": 0.9296875, "learning_rate": 0.0004974747962799086, "loss": 5.3895, "mean_token_accuracy": 0.17042631208896636, "num_tokens": 12917061.0, "step": 6215 }, { "entropy": 5.540905570983886, "epoch": 0.5642235123367199, "grad_norm": 0.9765625, "learning_rate": 0.0004974699599372437, "loss": 5.427, "mean_token_accuracy": 0.1783065214753151, "num_tokens": 12927182.0, "step": 6220 }, { "entropy": 5.561410760879516, "epoch": 0.564677068214804, "grad_norm": 0.86328125, "learning_rate": 0.0004974651189938434, "loss": 5.3857, "mean_token_accuracy": 0.1792475163936615, "num_tokens": 12937371.0, "step": 6225 }, { "entropy": 5.633272504806518, "epoch": 0.5651306240928883, "grad_norm": 0.84375, "learning_rate": 0.0004974602734498079, "loss": 5.4352, "mean_token_accuracy": 0.1712818294763565, "num_tokens": 12948569.0, "step": 6230 }, { "entropy": 5.621938037872314, "epoch": 0.5655841799709724, "grad_norm": 0.87109375, "learning_rate": 0.000497455423305237, "loss": 5.3768, "mean_token_accuracy": 0.17150397896766661, "num_tokens": 12958503.0, "step": 6235 }, { "entropy": 5.601767444610596, "epoch": 0.5660377358490566, "grad_norm": 0.91796875, "learning_rate": 0.0004974505685602314, "loss": 5.3988, "mean_token_accuracy": 0.17525841742753984, "num_tokens": 12968714.0, "step": 6240 }, { "entropy": 5.590086603164673, "epoch": 0.5664912917271407, "grad_norm": 0.9375, "learning_rate": 0.0004974457092148912, "loss": 5.4284, "mean_token_accuracy": 0.1741039887070656, "num_tokens": 12978857.0, "step": 6245 }, { "entropy": 5.720824956893921, "epoch": 0.566944847605225, "grad_norm": 0.88671875, "learning_rate": 0.0004974408452693172, "loss": 5.5322, "mean_token_accuracy": 0.16714059710502624, "num_tokens": 12989863.0, "step": 6250 }, { "entropy": 5.586817884445191, "epoch": 0.5673984034833092, "grad_norm": 0.93359375, "learning_rate": 0.0004974359767236099, "loss": 5.3248, "mean_token_accuracy": 0.17573193907737733, "num_tokens": 13000307.0, "step": 6255 }, { "entropy": 5.545666122436524, "epoch": 0.5678519593613933, "grad_norm": 0.99609375, "learning_rate": 0.0004974311035778698, "loss": 5.411, "mean_token_accuracy": 0.18314283788204194, "num_tokens": 13009053.0, "step": 6260 }, { "entropy": 5.5987457752227785, "epoch": 0.5683055152394775, "grad_norm": 0.9296875, "learning_rate": 0.0004974262258321979, "loss": 5.4269, "mean_token_accuracy": 0.1716617226600647, "num_tokens": 13019136.0, "step": 6265 }, { "entropy": 5.655656051635742, "epoch": 0.5687590711175616, "grad_norm": 0.859375, "learning_rate": 0.0004974213434866949, "loss": 5.4723, "mean_token_accuracy": 0.16619940251111984, "num_tokens": 13030356.0, "step": 6270 }, { "entropy": 5.637882804870605, "epoch": 0.5692126269956459, "grad_norm": 0.9765625, "learning_rate": 0.0004974164565414617, "loss": 5.4883, "mean_token_accuracy": 0.1748768150806427, "num_tokens": 13040477.0, "step": 6275 }, { "entropy": 5.596619510650635, "epoch": 0.56966618287373, "grad_norm": 0.8515625, "learning_rate": 0.0004974115649965998, "loss": 5.3524, "mean_token_accuracy": 0.18151768296957016, "num_tokens": 13051755.0, "step": 6280 }, { "entropy": 5.604301977157593, "epoch": 0.5701197387518142, "grad_norm": 0.89453125, "learning_rate": 0.0004974066688522098, "loss": 5.3913, "mean_token_accuracy": 0.18713292777538298, "num_tokens": 13061670.0, "step": 6285 }, { "entropy": 5.60211033821106, "epoch": 0.5705732946298984, "grad_norm": 1.0, "learning_rate": 0.0004974017681083934, "loss": 5.3646, "mean_token_accuracy": 0.1776226207613945, "num_tokens": 13070917.0, "step": 6290 }, { "entropy": 5.585918712615967, "epoch": 0.5710268505079826, "grad_norm": 1.3046875, "learning_rate": 0.0004973968627652516, "loss": 5.4146, "mean_token_accuracy": 0.17641005665063858, "num_tokens": 13080577.0, "step": 6295 }, { "entropy": 5.6024633884429935, "epoch": 0.5714804063860668, "grad_norm": 0.9375, "learning_rate": 0.000497391952822886, "loss": 5.4371, "mean_token_accuracy": 0.16923494786024093, "num_tokens": 13091446.0, "step": 6300 }, { "entropy": 5.649172449111939, "epoch": 0.5719339622641509, "grad_norm": 0.8828125, "learning_rate": 0.0004973870382813983, "loss": 5.4614, "mean_token_accuracy": 0.17273851484060287, "num_tokens": 13102752.0, "step": 6305 }, { "entropy": 5.702681827545166, "epoch": 0.5723875181422351, "grad_norm": 0.890625, "learning_rate": 0.0004973821191408899, "loss": 5.4819, "mean_token_accuracy": 0.17141962498426438, "num_tokens": 13113944.0, "step": 6310 }, { "entropy": 5.622271108627319, "epoch": 0.5728410740203193, "grad_norm": 0.91015625, "learning_rate": 0.0004973771954014626, "loss": 5.4073, "mean_token_accuracy": 0.17560603171586991, "num_tokens": 13124316.0, "step": 6315 }, { "entropy": 5.6871038436889645, "epoch": 0.5732946298984035, "grad_norm": 0.9921875, "learning_rate": 0.0004973722670632182, "loss": 5.5038, "mean_token_accuracy": 0.16931897699832915, "num_tokens": 13133567.0, "step": 6320 }, { "entropy": 5.574843692779541, "epoch": 0.5737481857764877, "grad_norm": 0.90234375, "learning_rate": 0.0004973673341262587, "loss": 5.4081, "mean_token_accuracy": 0.17334946990013123, "num_tokens": 13144279.0, "step": 6325 }, { "entropy": 5.626540994644165, "epoch": 0.5742017416545718, "grad_norm": 0.95703125, "learning_rate": 0.000497362396590686, "loss": 5.4835, "mean_token_accuracy": 0.16946994364261628, "num_tokens": 13154463.0, "step": 6330 }, { "entropy": 5.65912938117981, "epoch": 0.574655297532656, "grad_norm": 0.828125, "learning_rate": 0.0004973574544566024, "loss": 5.4457, "mean_token_accuracy": 0.16746120303869247, "num_tokens": 13165565.0, "step": 6335 }, { "entropy": 5.559062385559082, "epoch": 0.5751088534107403, "grad_norm": 0.92578125, "learning_rate": 0.0004973525077241098, "loss": 5.3533, "mean_token_accuracy": 0.18145330846309662, "num_tokens": 13175839.0, "step": 6340 }, { "entropy": 5.5439225196838375, "epoch": 0.5755624092888244, "grad_norm": 0.9140625, "learning_rate": 0.0004973475563933109, "loss": 5.3421, "mean_token_accuracy": 0.17647033035755158, "num_tokens": 13186372.0, "step": 6345 }, { "entropy": 5.629715633392334, "epoch": 0.5760159651669086, "grad_norm": 0.93359375, "learning_rate": 0.0004973426004643077, "loss": 5.4044, "mean_token_accuracy": 0.18002848476171493, "num_tokens": 13196259.0, "step": 6350 }, { "entropy": 5.643421077728272, "epoch": 0.5764695210449927, "grad_norm": 0.99609375, "learning_rate": 0.0004973376399372029, "loss": 5.3786, "mean_token_accuracy": 0.1787116289138794, "num_tokens": 13206497.0, "step": 6355 }, { "entropy": 5.605941486358643, "epoch": 0.5769230769230769, "grad_norm": 0.8984375, "learning_rate": 0.0004973326748120991, "loss": 5.4201, "mean_token_accuracy": 0.17948209047317504, "num_tokens": 13217188.0, "step": 6360 }, { "entropy": 5.575176668167114, "epoch": 0.5773766328011611, "grad_norm": 0.921875, "learning_rate": 0.0004973277050890988, "loss": 5.4289, "mean_token_accuracy": 0.17635478228330612, "num_tokens": 13226544.0, "step": 6365 }, { "entropy": 5.662482213973999, "epoch": 0.5778301886792453, "grad_norm": 0.98046875, "learning_rate": 0.0004973227307683049, "loss": 5.4469, "mean_token_accuracy": 0.17289083003997802, "num_tokens": 13236572.0, "step": 6370 }, { "entropy": 5.716796112060547, "epoch": 0.5782837445573294, "grad_norm": 0.87109375, "learning_rate": 0.0004973177518498204, "loss": 5.4467, "mean_token_accuracy": 0.1772434666752815, "num_tokens": 13247958.0, "step": 6375 }, { "entropy": 5.598628664016724, "epoch": 0.5787373004354136, "grad_norm": 0.9375, "learning_rate": 0.0004973127683337482, "loss": 5.3668, "mean_token_accuracy": 0.17798337638378142, "num_tokens": 13258255.0, "step": 6380 }, { "entropy": 5.528913688659668, "epoch": 0.5791908563134979, "grad_norm": 0.89453125, "learning_rate": 0.0004973077802201911, "loss": 5.3936, "mean_token_accuracy": 0.17277796119451522, "num_tokens": 13268416.0, "step": 6385 }, { "entropy": 5.572034215927124, "epoch": 0.579644412191582, "grad_norm": 1.0078125, "learning_rate": 0.0004973027875092526, "loss": 5.3724, "mean_token_accuracy": 0.17329427152872084, "num_tokens": 13278087.0, "step": 6390 }, { "entropy": 5.559347438812256, "epoch": 0.5800979680696662, "grad_norm": 0.9609375, "learning_rate": 0.0004972977902010357, "loss": 5.2809, "mean_token_accuracy": 0.18577326983213424, "num_tokens": 13288121.0, "step": 6395 }, { "entropy": 5.696083450317383, "epoch": 0.5805515239477503, "grad_norm": 0.9609375, "learning_rate": 0.0004972927882956439, "loss": 5.4854, "mean_token_accuracy": 0.16661122292280198, "num_tokens": 13298620.0, "step": 6400 }, { "entropy": 5.555794334411621, "epoch": 0.5810050798258345, "grad_norm": 0.94921875, "learning_rate": 0.0004972877817931807, "loss": 5.3054, "mean_token_accuracy": 0.17329084128141403, "num_tokens": 13308413.0, "step": 6405 }, { "entropy": 5.545690584182739, "epoch": 0.5814586357039188, "grad_norm": 0.93359375, "learning_rate": 0.0004972827706937493, "loss": 5.3926, "mean_token_accuracy": 0.17548721879720688, "num_tokens": 13319387.0, "step": 6410 }, { "entropy": 5.60416431427002, "epoch": 0.5819121915820029, "grad_norm": 0.875, "learning_rate": 0.0004972777549974537, "loss": 5.3385, "mean_token_accuracy": 0.17935979068279267, "num_tokens": 13330494.0, "step": 6415 }, { "entropy": 5.593369865417481, "epoch": 0.5823657474600871, "grad_norm": 0.94140625, "learning_rate": 0.0004972727347043975, "loss": 5.3587, "mean_token_accuracy": 0.17618109732866288, "num_tokens": 13341009.0, "step": 6420 }, { "entropy": 5.541242694854736, "epoch": 0.5828193033381712, "grad_norm": 0.9921875, "learning_rate": 0.0004972677098146845, "loss": 5.3054, "mean_token_accuracy": 0.17940136939287185, "num_tokens": 13351269.0, "step": 6425 }, { "entropy": 5.521207714080811, "epoch": 0.5832728592162555, "grad_norm": 0.93359375, "learning_rate": 0.0004972626803284185, "loss": 5.4117, "mean_token_accuracy": 0.17470855563879012, "num_tokens": 13362160.0, "step": 6430 }, { "entropy": 5.640540981292725, "epoch": 0.5837264150943396, "grad_norm": 0.98828125, "learning_rate": 0.0004972576462457038, "loss": 5.4703, "mean_token_accuracy": 0.17759566456079484, "num_tokens": 13372497.0, "step": 6435 }, { "entropy": 5.697097206115723, "epoch": 0.5841799709724238, "grad_norm": 0.96875, "learning_rate": 0.0004972526075666442, "loss": 5.4133, "mean_token_accuracy": 0.18020133376121522, "num_tokens": 13381665.0, "step": 6440 }, { "entropy": 5.543485450744629, "epoch": 0.584633526850508, "grad_norm": 0.9140625, "learning_rate": 0.0004972475642913442, "loss": 5.3197, "mean_token_accuracy": 0.18023221790790558, "num_tokens": 13392507.0, "step": 6445 }, { "entropy": 5.505417203903198, "epoch": 0.5850870827285921, "grad_norm": 0.98828125, "learning_rate": 0.0004972425164199078, "loss": 5.3031, "mean_token_accuracy": 0.18267336785793303, "num_tokens": 13402171.0, "step": 6450 }, { "entropy": 5.613723850250244, "epoch": 0.5855406386066764, "grad_norm": 0.87109375, "learning_rate": 0.0004972374639524396, "loss": 5.525, "mean_token_accuracy": 0.16901201158761978, "num_tokens": 13412933.0, "step": 6455 }, { "entropy": 5.6370524883270265, "epoch": 0.5859941944847605, "grad_norm": 0.82421875, "learning_rate": 0.000497232406889044, "loss": 5.3751, "mean_token_accuracy": 0.16950386315584182, "num_tokens": 13423563.0, "step": 6460 }, { "entropy": 5.6557940483093265, "epoch": 0.5864477503628447, "grad_norm": 0.96875, "learning_rate": 0.0004972273452298255, "loss": 5.3847, "mean_token_accuracy": 0.1834123909473419, "num_tokens": 13433998.0, "step": 6465 }, { "entropy": 5.559069585800171, "epoch": 0.5869013062409288, "grad_norm": 0.8984375, "learning_rate": 0.0004972222789748888, "loss": 5.3315, "mean_token_accuracy": 0.18007088154554368, "num_tokens": 13443878.0, "step": 6470 }, { "entropy": 5.556202745437622, "epoch": 0.5873548621190131, "grad_norm": 0.82421875, "learning_rate": 0.0004972172081243389, "loss": 5.4097, "mean_token_accuracy": 0.1707281395792961, "num_tokens": 13456051.0, "step": 6475 }, { "entropy": 5.606028318405151, "epoch": 0.5878084179970973, "grad_norm": 0.84375, "learning_rate": 0.0004972121326782806, "loss": 5.3974, "mean_token_accuracy": 0.17891442328691481, "num_tokens": 13467276.0, "step": 6480 }, { "entropy": 5.6323326587677, "epoch": 0.5882619738751814, "grad_norm": 0.9140625, "learning_rate": 0.0004972070526368186, "loss": 5.3717, "mean_token_accuracy": 0.17427799254655837, "num_tokens": 13478331.0, "step": 6485 }, { "entropy": 5.632275676727295, "epoch": 0.5887155297532656, "grad_norm": 0.9765625, "learning_rate": 0.0004972019680000582, "loss": 5.3205, "mean_token_accuracy": 0.17633114755153656, "num_tokens": 13489879.0, "step": 6490 }, { "entropy": 5.563889217376709, "epoch": 0.5891690856313497, "grad_norm": 0.86328125, "learning_rate": 0.0004971968787681044, "loss": 5.4351, "mean_token_accuracy": 0.18205238431692122, "num_tokens": 13500879.0, "step": 6495 }, { "entropy": 5.674321556091309, "epoch": 0.589622641509434, "grad_norm": 0.87109375, "learning_rate": 0.0004971917849410627, "loss": 5.4231, "mean_token_accuracy": 0.16968515366315842, "num_tokens": 13511719.0, "step": 6500 }, { "entropy": 5.5601965427398685, "epoch": 0.5900761973875182, "grad_norm": 0.91015625, "learning_rate": 0.0004971866865190381, "loss": 5.3502, "mean_token_accuracy": 0.17365157157182692, "num_tokens": 13521850.0, "step": 6505 }, { "entropy": 5.614747524261475, "epoch": 0.5905297532656023, "grad_norm": 0.9296875, "learning_rate": 0.0004971815835021362, "loss": 5.3834, "mean_token_accuracy": 0.18184393644332886, "num_tokens": 13532095.0, "step": 6510 }, { "entropy": 5.575075674057007, "epoch": 0.5909833091436865, "grad_norm": 0.89453125, "learning_rate": 0.0004971764758904626, "loss": 5.3719, "mean_token_accuracy": 0.17141948640346527, "num_tokens": 13543133.0, "step": 6515 }, { "entropy": 5.587063646316528, "epoch": 0.5914368650217707, "grad_norm": 0.93359375, "learning_rate": 0.0004971713636841229, "loss": 5.438, "mean_token_accuracy": 0.17123900204896927, "num_tokens": 13553771.0, "step": 6520 }, { "entropy": 5.544393587112427, "epoch": 0.5918904208998549, "grad_norm": 0.875, "learning_rate": 0.0004971662468832228, "loss": 5.3763, "mean_token_accuracy": 0.1815660074353218, "num_tokens": 13564548.0, "step": 6525 }, { "entropy": 5.5182641506195065, "epoch": 0.592343976777939, "grad_norm": 0.94140625, "learning_rate": 0.000497161125487868, "loss": 5.3729, "mean_token_accuracy": 0.17794521152973175, "num_tokens": 13574567.0, "step": 6530 }, { "entropy": 5.551377677917481, "epoch": 0.5927975326560232, "grad_norm": 0.88671875, "learning_rate": 0.0004971559994981645, "loss": 5.3972, "mean_token_accuracy": 0.17787606418132781, "num_tokens": 13585302.0, "step": 6535 }, { "entropy": 5.653764629364014, "epoch": 0.5932510885341074, "grad_norm": 0.93359375, "learning_rate": 0.0004971508689142184, "loss": 5.428, "mean_token_accuracy": 0.17052206993103028, "num_tokens": 13594754.0, "step": 6540 }, { "entropy": 5.5617927551269535, "epoch": 0.5937046444121916, "grad_norm": 0.90625, "learning_rate": 0.0004971457337361356, "loss": 5.3676, "mean_token_accuracy": 0.17397885471582414, "num_tokens": 13604691.0, "step": 6545 }, { "entropy": 5.476242637634277, "epoch": 0.5941582002902758, "grad_norm": 0.9375, "learning_rate": 0.0004971405939640225, "loss": 5.2587, "mean_token_accuracy": 0.17924531549215317, "num_tokens": 13613911.0, "step": 6550 }, { "entropy": 5.727000761032104, "epoch": 0.5946117561683599, "grad_norm": 0.89453125, "learning_rate": 0.0004971354495979854, "loss": 5.4647, "mean_token_accuracy": 0.17712009847164153, "num_tokens": 13624285.0, "step": 6555 }, { "entropy": 5.584723997116089, "epoch": 0.5950653120464441, "grad_norm": 0.91796875, "learning_rate": 0.0004971303006381305, "loss": 5.3066, "mean_token_accuracy": 0.18122798055410386, "num_tokens": 13635434.0, "step": 6560 }, { "entropy": 5.511235284805298, "epoch": 0.5955188679245284, "grad_norm": 0.9453125, "learning_rate": 0.0004971251470845643, "loss": 5.3757, "mean_token_accuracy": 0.17572649121284484, "num_tokens": 13645582.0, "step": 6565 }, { "entropy": 5.580762100219727, "epoch": 0.5959724238026125, "grad_norm": 0.97265625, "learning_rate": 0.0004971199889373935, "loss": 5.3365, "mean_token_accuracy": 0.179083950817585, "num_tokens": 13655029.0, "step": 6570 }, { "entropy": 5.564962148666382, "epoch": 0.5964259796806967, "grad_norm": 0.87890625, "learning_rate": 0.0004971148261967249, "loss": 5.3325, "mean_token_accuracy": 0.17644450217485427, "num_tokens": 13665204.0, "step": 6575 }, { "entropy": 5.571329927444458, "epoch": 0.5968795355587808, "grad_norm": 0.90234375, "learning_rate": 0.0004971096588626649, "loss": 5.4285, "mean_token_accuracy": 0.174003441631794, "num_tokens": 13676281.0, "step": 6580 }, { "entropy": 5.577637481689453, "epoch": 0.597333091436865, "grad_norm": 0.85546875, "learning_rate": 0.0004971044869353206, "loss": 5.3917, "mean_token_accuracy": 0.18069213032722473, "num_tokens": 13687144.0, "step": 6585 }, { "entropy": 5.600950384140015, "epoch": 0.5977866473149492, "grad_norm": 0.9921875, "learning_rate": 0.000497099310414799, "loss": 5.3665, "mean_token_accuracy": 0.1816061720252037, "num_tokens": 13696371.0, "step": 6590 }, { "entropy": 5.622022247314453, "epoch": 0.5982402031930334, "grad_norm": 1.0, "learning_rate": 0.0004970941293012069, "loss": 5.3139, "mean_token_accuracy": 0.17685348838567733, "num_tokens": 13706900.0, "step": 6595 }, { "entropy": 5.555879068374634, "epoch": 0.5986937590711175, "grad_norm": 0.84765625, "learning_rate": 0.0004970889435946518, "loss": 5.3977, "mean_token_accuracy": 0.18049706071615218, "num_tokens": 13717874.0, "step": 6600 }, { "entropy": 5.588134765625, "epoch": 0.5991473149492017, "grad_norm": 0.88671875, "learning_rate": 0.0004970837532952406, "loss": 5.3653, "mean_token_accuracy": 0.1767413467168808, "num_tokens": 13728020.0, "step": 6605 }, { "entropy": 5.60174593925476, "epoch": 0.599600870827286, "grad_norm": 0.89453125, "learning_rate": 0.0004970785584030808, "loss": 5.3963, "mean_token_accuracy": 0.1784649208188057, "num_tokens": 13738007.0, "step": 6610 }, { "entropy": 5.601901006698609, "epoch": 0.6000544267053701, "grad_norm": 0.90234375, "learning_rate": 0.0004970733589182799, "loss": 5.4084, "mean_token_accuracy": 0.1740790531039238, "num_tokens": 13749429.0, "step": 6615 }, { "entropy": 5.5603643417358395, "epoch": 0.6005079825834543, "grad_norm": 1.03125, "learning_rate": 0.0004970681548409452, "loss": 5.2764, "mean_token_accuracy": 0.18648878186941148, "num_tokens": 13760279.0, "step": 6620 }, { "entropy": 5.591698074340821, "epoch": 0.6009615384615384, "grad_norm": 0.96484375, "learning_rate": 0.0004970629461711846, "loss": 5.4861, "mean_token_accuracy": 0.1701574757695198, "num_tokens": 13770575.0, "step": 6625 }, { "entropy": 5.536564922332763, "epoch": 0.6014150943396226, "grad_norm": 0.875, "learning_rate": 0.0004970577329091057, "loss": 5.326, "mean_token_accuracy": 0.18177662342786788, "num_tokens": 13781068.0, "step": 6630 }, { "entropy": 5.604051685333252, "epoch": 0.6018686502177069, "grad_norm": 1.015625, "learning_rate": 0.0004970525150548162, "loss": 5.4189, "mean_token_accuracy": 0.17805569767951965, "num_tokens": 13790745.0, "step": 6635 }, { "entropy": 5.590482139587403, "epoch": 0.602322206095791, "grad_norm": 1.0625, "learning_rate": 0.0004970472926084242, "loss": 5.3506, "mean_token_accuracy": 0.17441321313381195, "num_tokens": 13800196.0, "step": 6640 }, { "entropy": 5.5683002948760985, "epoch": 0.6027757619738752, "grad_norm": 0.88671875, "learning_rate": 0.0004970420655700375, "loss": 5.2585, "mean_token_accuracy": 0.18444105684757234, "num_tokens": 13809954.0, "step": 6645 }, { "entropy": 5.542122173309326, "epoch": 0.6032293178519593, "grad_norm": 0.96875, "learning_rate": 0.0004970368339397643, "loss": 5.436, "mean_token_accuracy": 0.17155808210372925, "num_tokens": 13820281.0, "step": 6650 }, { "entropy": 5.6209453582763675, "epoch": 0.6036828737300436, "grad_norm": 0.83203125, "learning_rate": 0.0004970315977177129, "loss": 5.3867, "mean_token_accuracy": 0.178961344063282, "num_tokens": 13830614.0, "step": 6655 }, { "entropy": 5.566452884674073, "epoch": 0.6041364296081277, "grad_norm": 0.9453125, "learning_rate": 0.0004970263569039914, "loss": 5.3345, "mean_token_accuracy": 0.1751037433743477, "num_tokens": 13840551.0, "step": 6660 }, { "entropy": 5.64999303817749, "epoch": 0.6045899854862119, "grad_norm": 0.87890625, "learning_rate": 0.0004970211114987083, "loss": 5.5084, "mean_token_accuracy": 0.17182745039463043, "num_tokens": 13851830.0, "step": 6665 }, { "entropy": 5.598976469039917, "epoch": 0.6050435413642961, "grad_norm": 0.953125, "learning_rate": 0.0004970158615019719, "loss": 5.3166, "mean_token_accuracy": 0.17749295830726625, "num_tokens": 13862299.0, "step": 6670 }, { "entropy": 5.650000429153442, "epoch": 0.6054970972423802, "grad_norm": 0.8828125, "learning_rate": 0.0004970106069138912, "loss": 5.4553, "mean_token_accuracy": 0.16745540499687195, "num_tokens": 13872852.0, "step": 6675 }, { "entropy": 5.541075944900513, "epoch": 0.6059506531204645, "grad_norm": 1.171875, "learning_rate": 0.0004970053477345743, "loss": 5.3897, "mean_token_accuracy": 0.18472966998815538, "num_tokens": 13883601.0, "step": 6680 }, { "entropy": 5.573489952087402, "epoch": 0.6064042089985486, "grad_norm": 0.99609375, "learning_rate": 0.0004970000839641304, "loss": 5.3771, "mean_token_accuracy": 0.1835797294974327, "num_tokens": 13894246.0, "step": 6685 }, { "entropy": 5.5467630386352536, "epoch": 0.6068577648766328, "grad_norm": 0.91015625, "learning_rate": 0.0004969948156026681, "loss": 5.4114, "mean_token_accuracy": 0.1743486538529396, "num_tokens": 13904823.0, "step": 6690 }, { "entropy": 5.654760503768921, "epoch": 0.6073113207547169, "grad_norm": 0.93359375, "learning_rate": 0.0004969895426502965, "loss": 5.4214, "mean_token_accuracy": 0.17350844889879227, "num_tokens": 13915338.0, "step": 6695 }, { "entropy": 5.578554439544678, "epoch": 0.6077648766328012, "grad_norm": 0.9453125, "learning_rate": 0.0004969842651071246, "loss": 5.3676, "mean_token_accuracy": 0.18019723445177077, "num_tokens": 13925838.0, "step": 6700 }, { "entropy": 5.63786473274231, "epoch": 0.6082184325108854, "grad_norm": 0.94921875, "learning_rate": 0.0004969789829732615, "loss": 5.3876, "mean_token_accuracy": 0.1755361571907997, "num_tokens": 13936341.0, "step": 6705 }, { "entropy": 5.589788913726807, "epoch": 0.6086719883889695, "grad_norm": 1.0, "learning_rate": 0.0004969736962488164, "loss": 5.3615, "mean_token_accuracy": 0.17749459445476531, "num_tokens": 13945438.0, "step": 6710 }, { "entropy": 5.552593803405761, "epoch": 0.6091255442670537, "grad_norm": 0.875, "learning_rate": 0.0004969684049338987, "loss": 5.27, "mean_token_accuracy": 0.1792834594845772, "num_tokens": 13956029.0, "step": 6715 }, { "entropy": 5.6268645286560055, "epoch": 0.6095791001451378, "grad_norm": 0.9140625, "learning_rate": 0.000496963109028618, "loss": 5.3858, "mean_token_accuracy": 0.1727551519870758, "num_tokens": 13966498.0, "step": 6720 }, { "entropy": 5.575082731246948, "epoch": 0.6100326560232221, "grad_norm": 0.90234375, "learning_rate": 0.0004969578085330834, "loss": 5.3385, "mean_token_accuracy": 0.17911534309387206, "num_tokens": 13976997.0, "step": 6725 }, { "entropy": 5.628406524658203, "epoch": 0.6104862119013063, "grad_norm": 0.98828125, "learning_rate": 0.0004969525034474049, "loss": 5.3492, "mean_token_accuracy": 0.1798671528697014, "num_tokens": 13986664.0, "step": 6730 }, { "entropy": 5.485960388183594, "epoch": 0.6109397677793904, "grad_norm": 0.86328125, "learning_rate": 0.000496947193771692, "loss": 5.3458, "mean_token_accuracy": 0.18172517567873, "num_tokens": 13997828.0, "step": 6735 }, { "entropy": 5.5296248435974125, "epoch": 0.6113933236574746, "grad_norm": 1.015625, "learning_rate": 0.0004969418795060548, "loss": 5.2938, "mean_token_accuracy": 0.17550018876791001, "num_tokens": 14008293.0, "step": 6740 }, { "entropy": 5.513893079757691, "epoch": 0.6118468795355588, "grad_norm": 0.9609375, "learning_rate": 0.0004969365606506027, "loss": 5.2821, "mean_token_accuracy": 0.1838718071579933, "num_tokens": 14018031.0, "step": 6745 }, { "entropy": 5.516136503219604, "epoch": 0.612300435413643, "grad_norm": 0.91796875, "learning_rate": 0.0004969312372054461, "loss": 5.2563, "mean_token_accuracy": 0.18612198829650878, "num_tokens": 14028013.0, "step": 6750 }, { "entropy": 5.543424034118653, "epoch": 0.6127539912917271, "grad_norm": 0.87890625, "learning_rate": 0.0004969259091706948, "loss": 5.3988, "mean_token_accuracy": 0.17460741549730302, "num_tokens": 14039787.0, "step": 6755 }, { "entropy": 5.577391767501831, "epoch": 0.6132075471698113, "grad_norm": 0.89453125, "learning_rate": 0.0004969205765464593, "loss": 5.3011, "mean_token_accuracy": 0.17705341130495073, "num_tokens": 14049223.0, "step": 6760 }, { "entropy": 5.564587926864624, "epoch": 0.6136611030478955, "grad_norm": 0.9453125, "learning_rate": 0.0004969152393328497, "loss": 5.3386, "mean_token_accuracy": 0.1833565875887871, "num_tokens": 14059004.0, "step": 6765 }, { "entropy": 5.589889240264893, "epoch": 0.6141146589259797, "grad_norm": 0.91796875, "learning_rate": 0.0004969098975299764, "loss": 5.433, "mean_token_accuracy": 0.17130700796842574, "num_tokens": 14069615.0, "step": 6770 }, { "entropy": 5.584448528289795, "epoch": 0.6145682148040639, "grad_norm": 0.92578125, "learning_rate": 0.0004969045511379499, "loss": 5.3674, "mean_token_accuracy": 0.17663028091192245, "num_tokens": 14078886.0, "step": 6775 }, { "entropy": 5.650965642929077, "epoch": 0.615021770682148, "grad_norm": 0.921875, "learning_rate": 0.0004968992001568806, "loss": 5.4354, "mean_token_accuracy": 0.17254979014396668, "num_tokens": 14089021.0, "step": 6780 }, { "entropy": 5.535510587692261, "epoch": 0.6154753265602322, "grad_norm": 0.9375, "learning_rate": 0.0004968938445868795, "loss": 5.2588, "mean_token_accuracy": 0.18511583507061005, "num_tokens": 14098316.0, "step": 6785 }, { "entropy": 5.4947816848754885, "epoch": 0.6159288824383164, "grad_norm": 1.0390625, "learning_rate": 0.0004968884844280569, "loss": 5.3341, "mean_token_accuracy": 0.1732075110077858, "num_tokens": 14108874.0, "step": 6790 }, { "entropy": 5.591892051696777, "epoch": 0.6163824383164006, "grad_norm": 0.8984375, "learning_rate": 0.0004968831196805242, "loss": 5.3912, "mean_token_accuracy": 0.17782093733549117, "num_tokens": 14119613.0, "step": 6795 }, { "entropy": 5.60273003578186, "epoch": 0.6168359941944848, "grad_norm": 0.8515625, "learning_rate": 0.0004968777503443918, "loss": 5.3499, "mean_token_accuracy": 0.17755615413188935, "num_tokens": 14129085.0, "step": 6800 }, { "entropy": 5.454257392883301, "epoch": 0.6172895500725689, "grad_norm": 0.98828125, "learning_rate": 0.0004968723764197711, "loss": 5.2412, "mean_token_accuracy": 0.1916737213730812, "num_tokens": 14138461.0, "step": 6805 }, { "entropy": 5.528428459167481, "epoch": 0.6177431059506531, "grad_norm": 0.8828125, "learning_rate": 0.000496866997906773, "loss": 5.3161, "mean_token_accuracy": 0.18484087139368058, "num_tokens": 14149126.0, "step": 6810 }, { "entropy": 5.5417094230651855, "epoch": 0.6181966618287373, "grad_norm": 0.84375, "learning_rate": 0.0004968616148055089, "loss": 5.3186, "mean_token_accuracy": 0.18229269832372666, "num_tokens": 14160068.0, "step": 6815 }, { "entropy": 5.5963634014129635, "epoch": 0.6186502177068215, "grad_norm": 0.91796875, "learning_rate": 0.0004968562271160901, "loss": 5.4037, "mean_token_accuracy": 0.1814342111349106, "num_tokens": 14170288.0, "step": 6820 }, { "entropy": 5.6165848731994625, "epoch": 0.6191037735849056, "grad_norm": 0.86328125, "learning_rate": 0.000496850834838628, "loss": 5.4088, "mean_token_accuracy": 0.1776348978281021, "num_tokens": 14181231.0, "step": 6825 }, { "entropy": 5.5837572574615475, "epoch": 0.6195573294629898, "grad_norm": 0.90234375, "learning_rate": 0.0004968454379732342, "loss": 5.3227, "mean_token_accuracy": 0.18313741385936738, "num_tokens": 14191715.0, "step": 6830 }, { "entropy": 5.502680969238281, "epoch": 0.6200108853410741, "grad_norm": 0.91015625, "learning_rate": 0.00049684003652002, "loss": 5.31, "mean_token_accuracy": 0.17466335743665695, "num_tokens": 14203416.0, "step": 6835 }, { "entropy": 5.496374702453613, "epoch": 0.6204644412191582, "grad_norm": 1.0234375, "learning_rate": 0.0004968346304790973, "loss": 5.2663, "mean_token_accuracy": 0.18976710140705108, "num_tokens": 14213658.0, "step": 6840 }, { "entropy": 5.611422061920166, "epoch": 0.6209179970972424, "grad_norm": 0.91796875, "learning_rate": 0.0004968292198505781, "loss": 5.449, "mean_token_accuracy": 0.17389458268880845, "num_tokens": 14223956.0, "step": 6845 }, { "entropy": 5.6339301586151125, "epoch": 0.6213715529753265, "grad_norm": 0.81640625, "learning_rate": 0.000496823804634574, "loss": 5.4206, "mean_token_accuracy": 0.17541918456554412, "num_tokens": 14236801.0, "step": 6850 }, { "entropy": 5.559810400009155, "epoch": 0.6218251088534107, "grad_norm": 0.9140625, "learning_rate": 0.0004968183848311972, "loss": 5.241, "mean_token_accuracy": 0.1860935151576996, "num_tokens": 14247382.0, "step": 6855 }, { "entropy": 5.591649961471558, "epoch": 0.622278664731495, "grad_norm": 0.8828125, "learning_rate": 0.0004968129604405596, "loss": 5.3308, "mean_token_accuracy": 0.18287506848573684, "num_tokens": 14258627.0, "step": 6860 }, { "entropy": 5.489435148239136, "epoch": 0.6227322206095791, "grad_norm": 0.94921875, "learning_rate": 0.0004968075314627734, "loss": 5.3319, "mean_token_accuracy": 0.18305183500051497, "num_tokens": 14269013.0, "step": 6865 }, { "entropy": 5.5313599586486815, "epoch": 0.6231857764876633, "grad_norm": 0.94921875, "learning_rate": 0.000496802097897951, "loss": 5.3212, "mean_token_accuracy": 0.18085480630397796, "num_tokens": 14279620.0, "step": 6870 }, { "entropy": 5.593470907211303, "epoch": 0.6236393323657474, "grad_norm": 0.84765625, "learning_rate": 0.0004967966597462046, "loss": 5.3233, "mean_token_accuracy": 0.18621707558631898, "num_tokens": 14289448.0, "step": 6875 }, { "entropy": 5.573109865188599, "epoch": 0.6240928882438317, "grad_norm": 0.875, "learning_rate": 0.0004967912170076469, "loss": 5.3223, "mean_token_accuracy": 0.17920063734054564, "num_tokens": 14299999.0, "step": 6880 }, { "entropy": 5.4895679473876955, "epoch": 0.6245464441219158, "grad_norm": 0.88671875, "learning_rate": 0.0004967857696823901, "loss": 5.2935, "mean_token_accuracy": 0.18258029073476792, "num_tokens": 14310384.0, "step": 6885 }, { "entropy": 5.6066499710083, "epoch": 0.625, "grad_norm": 0.9296875, "learning_rate": 0.0004967803177705472, "loss": 5.421, "mean_token_accuracy": 0.17535581439733505, "num_tokens": 14320644.0, "step": 6890 }, { "entropy": 5.613523244857788, "epoch": 0.6254535558780842, "grad_norm": 1.078125, "learning_rate": 0.0004967748612722308, "loss": 5.3771, "mean_token_accuracy": 0.1768083542585373, "num_tokens": 14330077.0, "step": 6895 }, { "entropy": 5.6285642147064205, "epoch": 0.6259071117561683, "grad_norm": 0.875, "learning_rate": 0.0004967694001875538, "loss": 5.4657, "mean_token_accuracy": 0.17162772566080092, "num_tokens": 14341549.0, "step": 6900 }, { "entropy": 5.5867125511169435, "epoch": 0.6263606676342526, "grad_norm": 0.94921875, "learning_rate": 0.000496763934516629, "loss": 5.3252, "mean_token_accuracy": 0.18651908189058303, "num_tokens": 14352146.0, "step": 6905 }, { "entropy": 5.49106731414795, "epoch": 0.6268142235123367, "grad_norm": 0.8984375, "learning_rate": 0.0004967584642595696, "loss": 5.3502, "mean_token_accuracy": 0.1742198124527931, "num_tokens": 14362521.0, "step": 6910 }, { "entropy": 5.613452339172364, "epoch": 0.6272677793904209, "grad_norm": 0.89453125, "learning_rate": 0.0004967529894164887, "loss": 5.3842, "mean_token_accuracy": 0.1770589143037796, "num_tokens": 14373216.0, "step": 6915 }, { "entropy": 5.554586124420166, "epoch": 0.627721335268505, "grad_norm": 0.92578125, "learning_rate": 0.0004967475099874992, "loss": 5.2975, "mean_token_accuracy": 0.18457451462745667, "num_tokens": 14383104.0, "step": 6920 }, { "entropy": 5.516722202301025, "epoch": 0.6281748911465893, "grad_norm": 0.91015625, "learning_rate": 0.000496742025972715, "loss": 5.3284, "mean_token_accuracy": 0.19065247923135759, "num_tokens": 14393854.0, "step": 6925 }, { "entropy": 5.571130990982056, "epoch": 0.6286284470246735, "grad_norm": 1.0625, "learning_rate": 0.000496736537372249, "loss": 5.2746, "mean_token_accuracy": 0.18790257424116136, "num_tokens": 14403213.0, "step": 6930 }, { "entropy": 5.6476743698120115, "epoch": 0.6290820029027576, "grad_norm": 1.0, "learning_rate": 0.0004967310441862151, "loss": 5.4889, "mean_token_accuracy": 0.17305789291858673, "num_tokens": 14412792.0, "step": 6935 }, { "entropy": 5.5903888702392575, "epoch": 0.6295355587808418, "grad_norm": 0.84375, "learning_rate": 0.0004967255464147265, "loss": 5.3434, "mean_token_accuracy": 0.18606058061122893, "num_tokens": 14423061.0, "step": 6940 }, { "entropy": 5.547424602508545, "epoch": 0.6299891146589259, "grad_norm": 0.98046875, "learning_rate": 0.0004967200440578972, "loss": 5.2801, "mean_token_accuracy": 0.1876331478357315, "num_tokens": 14433338.0, "step": 6945 }, { "entropy": 5.512516736984253, "epoch": 0.6304426705370102, "grad_norm": 0.9375, "learning_rate": 0.0004967145371158408, "loss": 5.282, "mean_token_accuracy": 0.1900091901421547, "num_tokens": 14444124.0, "step": 6950 }, { "entropy": 5.559875965118408, "epoch": 0.6308962264150944, "grad_norm": 0.9921875, "learning_rate": 0.0004967090255886714, "loss": 5.4059, "mean_token_accuracy": 0.17928589284420013, "num_tokens": 14453868.0, "step": 6955 }, { "entropy": 5.547641086578369, "epoch": 0.6313497822931785, "grad_norm": 0.85546875, "learning_rate": 0.0004967035094765028, "loss": 5.3001, "mean_token_accuracy": 0.17467721551656723, "num_tokens": 14465015.0, "step": 6960 }, { "entropy": 5.53034987449646, "epoch": 0.6318033381712627, "grad_norm": 0.95703125, "learning_rate": 0.0004966979887794491, "loss": 5.2563, "mean_token_accuracy": 0.18848009556531906, "num_tokens": 14475523.0, "step": 6965 }, { "entropy": 5.5402673244476315, "epoch": 0.6322568940493469, "grad_norm": 0.95703125, "learning_rate": 0.0004966924634976245, "loss": 5.3295, "mean_token_accuracy": 0.18160206973552703, "num_tokens": 14485523.0, "step": 6970 }, { "entropy": 5.61271300315857, "epoch": 0.6327104499274311, "grad_norm": 0.859375, "learning_rate": 0.0004966869336311433, "loss": 5.4094, "mean_token_accuracy": 0.17774551808834077, "num_tokens": 14495237.0, "step": 6975 }, { "entropy": 5.5918501853942875, "epoch": 0.6331640058055152, "grad_norm": 0.91015625, "learning_rate": 0.0004966813991801197, "loss": 5.5141, "mean_token_accuracy": 0.17085262537002563, "num_tokens": 14506431.0, "step": 6980 }, { "entropy": 5.62278151512146, "epoch": 0.6336175616835994, "grad_norm": 0.90234375, "learning_rate": 0.0004966758601446684, "loss": 5.4451, "mean_token_accuracy": 0.17433076500892639, "num_tokens": 14517445.0, "step": 6985 }, { "entropy": 5.636280870437622, "epoch": 0.6340711175616836, "grad_norm": 0.92578125, "learning_rate": 0.0004966703165249038, "loss": 5.3707, "mean_token_accuracy": 0.1714874342083931, "num_tokens": 14527818.0, "step": 6990 }, { "entropy": 5.606985330581665, "epoch": 0.6345246734397678, "grad_norm": 0.90234375, "learning_rate": 0.0004966647683209406, "loss": 5.4616, "mean_token_accuracy": 0.16598857343196868, "num_tokens": 14538235.0, "step": 6995 }, { "entropy": 5.69085431098938, "epoch": 0.634978229317852, "grad_norm": 0.88671875, "learning_rate": 0.0004966592155328935, "loss": 5.4577, "mean_token_accuracy": 0.17015783339738846, "num_tokens": 14549784.0, "step": 7000 }, { "entropy": 5.577909851074219, "epoch": 0.6354317851959361, "grad_norm": 0.8203125, "learning_rate": 0.0004966536581608771, "loss": 5.4601, "mean_token_accuracy": 0.16502557843923568, "num_tokens": 14561057.0, "step": 7005 }, { "entropy": 5.6043314933776855, "epoch": 0.6358853410740203, "grad_norm": 0.94921875, "learning_rate": 0.0004966480962050069, "loss": 5.3663, "mean_token_accuracy": 0.17885040044784545, "num_tokens": 14570859.0, "step": 7010 }, { "entropy": 5.596745586395263, "epoch": 0.6363388969521045, "grad_norm": 0.953125, "learning_rate": 0.0004966425296653974, "loss": 5.3727, "mean_token_accuracy": 0.18546929955482483, "num_tokens": 14581066.0, "step": 7015 }, { "entropy": 5.507768726348877, "epoch": 0.6367924528301887, "grad_norm": 0.8984375, "learning_rate": 0.000496636958542164, "loss": 5.3266, "mean_token_accuracy": 0.17755770236253737, "num_tokens": 14590709.0, "step": 7020 }, { "entropy": 5.553393363952637, "epoch": 0.6372460087082729, "grad_norm": 1.015625, "learning_rate": 0.0004966313828354218, "loss": 5.3268, "mean_token_accuracy": 0.184244504570961, "num_tokens": 14600849.0, "step": 7025 }, { "entropy": 5.520700263977051, "epoch": 0.637699564586357, "grad_norm": 0.97265625, "learning_rate": 0.000496625802545286, "loss": 5.2116, "mean_token_accuracy": 0.1859947547316551, "num_tokens": 14611427.0, "step": 7030 }, { "entropy": 5.530115747451783, "epoch": 0.6381531204644412, "grad_norm": 0.94921875, "learning_rate": 0.0004966202176718723, "loss": 5.3635, "mean_token_accuracy": 0.182247893512249, "num_tokens": 14623860.0, "step": 7035 }, { "entropy": 5.564819049835205, "epoch": 0.6386066763425254, "grad_norm": 0.9609375, "learning_rate": 0.0004966146282152959, "loss": 5.2998, "mean_token_accuracy": 0.1783895254135132, "num_tokens": 14633481.0, "step": 7040 }, { "entropy": 5.564633512496949, "epoch": 0.6390602322206096, "grad_norm": 0.90234375, "learning_rate": 0.0004966090341756726, "loss": 5.2811, "mean_token_accuracy": 0.18869292736053467, "num_tokens": 14643519.0, "step": 7045 }, { "entropy": 5.450642681121826, "epoch": 0.6395137880986937, "grad_norm": 0.94140625, "learning_rate": 0.000496603435553118, "loss": 5.2722, "mean_token_accuracy": 0.18621875643730162, "num_tokens": 14654570.0, "step": 7050 }, { "entropy": 5.501469135284424, "epoch": 0.6399673439767779, "grad_norm": 0.94921875, "learning_rate": 0.0004965978323477478, "loss": 5.3098, "mean_token_accuracy": 0.17667924016714096, "num_tokens": 14665596.0, "step": 7055 }, { "entropy": 5.580057382583618, "epoch": 0.6404208998548622, "grad_norm": 0.97265625, "learning_rate": 0.000496592224559678, "loss": 5.2669, "mean_token_accuracy": 0.18460346013307571, "num_tokens": 14675660.0, "step": 7060 }, { "entropy": 5.580855798721314, "epoch": 0.6408744557329463, "grad_norm": 0.984375, "learning_rate": 0.0004965866121890245, "loss": 5.4209, "mean_token_accuracy": 0.17853408306837082, "num_tokens": 14685229.0, "step": 7065 }, { "entropy": 5.619711685180664, "epoch": 0.6413280116110305, "grad_norm": 1.015625, "learning_rate": 0.0004965809952359034, "loss": 5.3312, "mean_token_accuracy": 0.17109032422304155, "num_tokens": 14695672.0, "step": 7070 }, { "entropy": 5.563270711898804, "epoch": 0.6417815674891146, "grad_norm": 0.91015625, "learning_rate": 0.0004965753737004309, "loss": 5.2857, "mean_token_accuracy": 0.18523964136838914, "num_tokens": 14705160.0, "step": 7075 }, { "entropy": 5.51725435256958, "epoch": 0.6422351233671988, "grad_norm": 0.9609375, "learning_rate": 0.0004965697475827231, "loss": 5.3204, "mean_token_accuracy": 0.1778504505753517, "num_tokens": 14715487.0, "step": 7080 }, { "entropy": 5.580355167388916, "epoch": 0.6426886792452831, "grad_norm": 1.0, "learning_rate": 0.0004965641168828965, "loss": 5.3743, "mean_token_accuracy": 0.18160596191883088, "num_tokens": 14726987.0, "step": 7085 }, { "entropy": 5.494480085372925, "epoch": 0.6431422351233672, "grad_norm": 0.9296875, "learning_rate": 0.0004965584816010676, "loss": 5.3176, "mean_token_accuracy": 0.1852257654070854, "num_tokens": 14737810.0, "step": 7090 }, { "entropy": 5.610119819641113, "epoch": 0.6435957910014514, "grad_norm": 0.89453125, "learning_rate": 0.0004965528417373528, "loss": 5.3285, "mean_token_accuracy": 0.17879804968833923, "num_tokens": 14748997.0, "step": 7095 }, { "entropy": 5.566685581207276, "epoch": 0.6440493468795355, "grad_norm": 0.86328125, "learning_rate": 0.0004965471972918688, "loss": 5.3404, "mean_token_accuracy": 0.1756565198302269, "num_tokens": 14760439.0, "step": 7100 }, { "entropy": 5.460477256774903, "epoch": 0.6445029027576198, "grad_norm": 0.87109375, "learning_rate": 0.0004965415482647322, "loss": 5.2521, "mean_token_accuracy": 0.18281868398189544, "num_tokens": 14770828.0, "step": 7105 }, { "entropy": 5.489846992492676, "epoch": 0.6449564586357039, "grad_norm": 0.9140625, "learning_rate": 0.00049653589465606, "loss": 5.3957, "mean_token_accuracy": 0.18351997137069703, "num_tokens": 14781753.0, "step": 7110 }, { "entropy": 5.6520702838897705, "epoch": 0.6454100145137881, "grad_norm": 1.0078125, "learning_rate": 0.000496530236465969, "loss": 5.4102, "mean_token_accuracy": 0.17198631465435027, "num_tokens": 14792241.0, "step": 7115 }, { "entropy": 5.531635856628418, "epoch": 0.6458635703918723, "grad_norm": 0.92578125, "learning_rate": 0.0004965245736945763, "loss": 5.2285, "mean_token_accuracy": 0.1889130190014839, "num_tokens": 14802580.0, "step": 7120 }, { "entropy": 5.519139194488526, "epoch": 0.6463171262699564, "grad_norm": 0.94140625, "learning_rate": 0.0004965189063419989, "loss": 5.442, "mean_token_accuracy": 0.17884785532951356, "num_tokens": 14813103.0, "step": 7125 }, { "entropy": 5.568569326400757, "epoch": 0.6467706821480407, "grad_norm": 1.015625, "learning_rate": 0.0004965132344083541, "loss": 5.3276, "mean_token_accuracy": 0.17959365546703338, "num_tokens": 14823334.0, "step": 7130 }, { "entropy": 5.568736124038696, "epoch": 0.6472242380261248, "grad_norm": 0.875, "learning_rate": 0.0004965075578937593, "loss": 5.3492, "mean_token_accuracy": 0.17829880565404893, "num_tokens": 14834850.0, "step": 7135 }, { "entropy": 5.513080644607544, "epoch": 0.647677793904209, "grad_norm": 0.99609375, "learning_rate": 0.0004965018767983316, "loss": 5.3575, "mean_token_accuracy": 0.1796330839395523, "num_tokens": 14844276.0, "step": 7140 }, { "entropy": 5.4893872261047365, "epoch": 0.6481313497822931, "grad_norm": 0.9375, "learning_rate": 0.0004964961911221886, "loss": 5.1964, "mean_token_accuracy": 0.1915486693382263, "num_tokens": 14854352.0, "step": 7145 }, { "entropy": 5.584615421295166, "epoch": 0.6485849056603774, "grad_norm": 0.94921875, "learning_rate": 0.000496490500865448, "loss": 5.378, "mean_token_accuracy": 0.1796365812420845, "num_tokens": 14864395.0, "step": 7150 }, { "entropy": 5.5620684146881105, "epoch": 0.6490384615384616, "grad_norm": 0.97265625, "learning_rate": 0.0004964848060282275, "loss": 5.2599, "mean_token_accuracy": 0.18747452944517135, "num_tokens": 14874373.0, "step": 7155 }, { "entropy": 5.53101077079773, "epoch": 0.6494920174165457, "grad_norm": 0.9375, "learning_rate": 0.0004964791066106447, "loss": 5.2642, "mean_token_accuracy": 0.18159855753183365, "num_tokens": 14884932.0, "step": 7160 }, { "entropy": 5.5659397602081295, "epoch": 0.6499455732946299, "grad_norm": 0.87890625, "learning_rate": 0.0004964734026128175, "loss": 5.4253, "mean_token_accuracy": 0.17503994554281235, "num_tokens": 14896254.0, "step": 7165 }, { "entropy": 5.623956346511841, "epoch": 0.650399129172714, "grad_norm": 0.9375, "learning_rate": 0.0004964676940348638, "loss": 5.3453, "mean_token_accuracy": 0.17856290340423583, "num_tokens": 14907392.0, "step": 7170 }, { "entropy": 5.5940752029418945, "epoch": 0.6508526850507983, "grad_norm": 0.94140625, "learning_rate": 0.000496461980876902, "loss": 5.4614, "mean_token_accuracy": 0.17526094764471054, "num_tokens": 14917676.0, "step": 7175 }, { "entropy": 5.5578306198120115, "epoch": 0.6513062409288825, "grad_norm": 0.92578125, "learning_rate": 0.0004964562631390498, "loss": 5.3008, "mean_token_accuracy": 0.18212647140026092, "num_tokens": 14928500.0, "step": 7180 }, { "entropy": 5.551118040084839, "epoch": 0.6517597968069666, "grad_norm": 0.9140625, "learning_rate": 0.0004964505408214257, "loss": 5.2703, "mean_token_accuracy": 0.18634399622678757, "num_tokens": 14938970.0, "step": 7185 }, { "entropy": 5.526061344146728, "epoch": 0.6522133526850508, "grad_norm": 0.953125, "learning_rate": 0.000496444813924148, "loss": 5.3255, "mean_token_accuracy": 0.18173780143260956, "num_tokens": 14949017.0, "step": 7190 }, { "entropy": 5.52117953300476, "epoch": 0.652666908563135, "grad_norm": 0.94140625, "learning_rate": 0.0004964390824473351, "loss": 5.2443, "mean_token_accuracy": 0.19174836874008178, "num_tokens": 14958529.0, "step": 7195 }, { "entropy": 5.527310991287232, "epoch": 0.6531204644412192, "grad_norm": 0.9453125, "learning_rate": 0.0004964333463911056, "loss": 5.3604, "mean_token_accuracy": 0.17524895071983337, "num_tokens": 14968044.0, "step": 7200 }, { "entropy": 5.596441411972046, "epoch": 0.6535740203193033, "grad_norm": 0.92578125, "learning_rate": 0.0004964276057555779, "loss": 5.3771, "mean_token_accuracy": 0.17824496030807496, "num_tokens": 14977867.0, "step": 7205 }, { "entropy": 5.6655659675598145, "epoch": 0.6540275761973875, "grad_norm": 1.015625, "learning_rate": 0.000496421860540871, "loss": 5.3958, "mean_token_accuracy": 0.1837482750415802, "num_tokens": 14986936.0, "step": 7210 }, { "entropy": 5.506159448623658, "epoch": 0.6544811320754716, "grad_norm": 0.9921875, "learning_rate": 0.0004964161107471036, "loss": 5.3354, "mean_token_accuracy": 0.18265933394432068, "num_tokens": 14996681.0, "step": 7215 }, { "entropy": 5.5519446849823, "epoch": 0.6549346879535559, "grad_norm": 0.91015625, "learning_rate": 0.0004964103563743946, "loss": 5.3364, "mean_token_accuracy": 0.18156073987483978, "num_tokens": 15007100.0, "step": 7220 }, { "entropy": 5.5976849555969235, "epoch": 0.6553882438316401, "grad_norm": 0.984375, "learning_rate": 0.000496404597422863, "loss": 5.4102, "mean_token_accuracy": 0.18126775324344635, "num_tokens": 15017452.0, "step": 7225 }, { "entropy": 5.539013767242432, "epoch": 0.6558417997097242, "grad_norm": 0.921875, "learning_rate": 0.000496398833892628, "loss": 5.254, "mean_token_accuracy": 0.18298355340957642, "num_tokens": 15028362.0, "step": 7230 }, { "entropy": 5.589620161056518, "epoch": 0.6562953555878084, "grad_norm": 0.96484375, "learning_rate": 0.0004963930657838086, "loss": 5.3474, "mean_token_accuracy": 0.17923036962747574, "num_tokens": 15038691.0, "step": 7235 }, { "entropy": 5.547629928588867, "epoch": 0.6567489114658926, "grad_norm": 0.91796875, "learning_rate": 0.0004963872930965242, "loss": 5.3283, "mean_token_accuracy": 0.1816704109311104, "num_tokens": 15050037.0, "step": 7240 }, { "entropy": 5.559830236434936, "epoch": 0.6572024673439768, "grad_norm": 0.9921875, "learning_rate": 0.0004963815158308941, "loss": 5.3057, "mean_token_accuracy": 0.18500083684921265, "num_tokens": 15059793.0, "step": 7245 }, { "entropy": 5.537407398223877, "epoch": 0.657656023222061, "grad_norm": 0.94921875, "learning_rate": 0.0004963757339870379, "loss": 5.3896, "mean_token_accuracy": 0.17124081701040267, "num_tokens": 15070500.0, "step": 7250 }, { "entropy": 5.612113428115845, "epoch": 0.6581095791001451, "grad_norm": 0.90625, "learning_rate": 0.0004963699475650751, "loss": 5.4467, "mean_token_accuracy": 0.17665672302246094, "num_tokens": 15081109.0, "step": 7255 }, { "entropy": 5.5193017482757565, "epoch": 0.6585631349782293, "grad_norm": 0.95703125, "learning_rate": 0.0004963641565651255, "loss": 5.323, "mean_token_accuracy": 0.18454677164554595, "num_tokens": 15092315.0, "step": 7260 }, { "entropy": 5.568742418289185, "epoch": 0.6590166908563135, "grad_norm": 0.90234375, "learning_rate": 0.0004963583609873084, "loss": 5.3849, "mean_token_accuracy": 0.1800144374370575, "num_tokens": 15103957.0, "step": 7265 }, { "entropy": 5.6056946277618405, "epoch": 0.6594702467343977, "grad_norm": 0.88671875, "learning_rate": 0.0004963525608317443, "loss": 5.3721, "mean_token_accuracy": 0.1770993635058403, "num_tokens": 15114996.0, "step": 7270 }, { "entropy": 5.574876546859741, "epoch": 0.6599238026124818, "grad_norm": 0.9609375, "learning_rate": 0.0004963467560985527, "loss": 5.3184, "mean_token_accuracy": 0.1811333030462265, "num_tokens": 15125098.0, "step": 7275 }, { "entropy": 5.508492565155029, "epoch": 0.660377358490566, "grad_norm": 0.99609375, "learning_rate": 0.0004963409467878538, "loss": 5.3165, "mean_token_accuracy": 0.17881869971752168, "num_tokens": 15134746.0, "step": 7280 }, { "entropy": 5.631923818588257, "epoch": 0.6608309143686503, "grad_norm": 1.0234375, "learning_rate": 0.0004963351328997678, "loss": 5.3384, "mean_token_accuracy": 0.17652247250080108, "num_tokens": 15145698.0, "step": 7285 }, { "entropy": 5.570781326293945, "epoch": 0.6612844702467344, "grad_norm": 0.96484375, "learning_rate": 0.0004963293144344148, "loss": 5.3904, "mean_token_accuracy": 0.17904452234506607, "num_tokens": 15156026.0, "step": 7290 }, { "entropy": 5.555085945129394, "epoch": 0.6617380261248186, "grad_norm": 0.953125, "learning_rate": 0.0004963234913919151, "loss": 5.3322, "mean_token_accuracy": 0.17398147583007811, "num_tokens": 15165900.0, "step": 7295 }, { "entropy": 5.565875434875489, "epoch": 0.6621915820029027, "grad_norm": 0.90234375, "learning_rate": 0.0004963176637723893, "loss": 5.3794, "mean_token_accuracy": 0.17941929996013642, "num_tokens": 15176693.0, "step": 7300 }, { "entropy": 5.58468017578125, "epoch": 0.6626451378809869, "grad_norm": 0.93359375, "learning_rate": 0.0004963118315759578, "loss": 5.4007, "mean_token_accuracy": 0.16982991248369217, "num_tokens": 15186535.0, "step": 7305 }, { "entropy": 5.587566995620728, "epoch": 0.6630986937590712, "grad_norm": 1.015625, "learning_rate": 0.0004963059948027411, "loss": 5.3162, "mean_token_accuracy": 0.1796189233660698, "num_tokens": 15196019.0, "step": 7310 }, { "entropy": 5.465688180923462, "epoch": 0.6635522496371553, "grad_norm": 1.015625, "learning_rate": 0.0004963001534528601, "loss": 5.1812, "mean_token_accuracy": 0.19228140413761138, "num_tokens": 15205273.0, "step": 7315 }, { "entropy": 5.560149812698365, "epoch": 0.6640058055152395, "grad_norm": 0.921875, "learning_rate": 0.0004962943075264355, "loss": 5.3427, "mean_token_accuracy": 0.1783326655626297, "num_tokens": 15216716.0, "step": 7320 }, { "entropy": 5.571094942092896, "epoch": 0.6644593613933236, "grad_norm": 0.890625, "learning_rate": 0.0004962884570235884, "loss": 5.3928, "mean_token_accuracy": 0.17626622021198274, "num_tokens": 15227306.0, "step": 7325 }, { "entropy": 5.510771894454956, "epoch": 0.6649129172714079, "grad_norm": 0.91015625, "learning_rate": 0.0004962826019444394, "loss": 5.2786, "mean_token_accuracy": 0.18220029771327972, "num_tokens": 15237302.0, "step": 7330 }, { "entropy": 5.515999460220337, "epoch": 0.665366473149492, "grad_norm": 0.90625, "learning_rate": 0.0004962767422891099, "loss": 5.2859, "mean_token_accuracy": 0.1832537442445755, "num_tokens": 15247064.0, "step": 7335 }, { "entropy": 5.559939670562744, "epoch": 0.6658200290275762, "grad_norm": 0.890625, "learning_rate": 0.000496270878057721, "loss": 5.3565, "mean_token_accuracy": 0.18223199248313904, "num_tokens": 15257006.0, "step": 7340 }, { "entropy": 5.5652186393737795, "epoch": 0.6662735849056604, "grad_norm": 0.96875, "learning_rate": 0.0004962650092503939, "loss": 5.3333, "mean_token_accuracy": 0.1857373908162117, "num_tokens": 15266720.0, "step": 7345 }, { "entropy": 5.540846633911133, "epoch": 0.6667271407837445, "grad_norm": 0.93359375, "learning_rate": 0.0004962591358672502, "loss": 5.3651, "mean_token_accuracy": 0.17481739670038224, "num_tokens": 15277330.0, "step": 7350 }, { "entropy": 5.548562622070312, "epoch": 0.6671806966618288, "grad_norm": 0.8828125, "learning_rate": 0.000496253257908411, "loss": 5.2984, "mean_token_accuracy": 0.1819293111562729, "num_tokens": 15287401.0, "step": 7355 }, { "entropy": 5.485146522521973, "epoch": 0.6676342525399129, "grad_norm": 0.90625, "learning_rate": 0.0004962473753739981, "loss": 5.2411, "mean_token_accuracy": 0.18803683817386627, "num_tokens": 15297426.0, "step": 7360 }, { "entropy": 5.565172481536865, "epoch": 0.6680878084179971, "grad_norm": 0.93359375, "learning_rate": 0.000496241488264133, "loss": 5.2356, "mean_token_accuracy": 0.1826209083199501, "num_tokens": 15308412.0, "step": 7365 }, { "entropy": 5.527874851226807, "epoch": 0.6685413642960812, "grad_norm": 1.0, "learning_rate": 0.0004962355965789377, "loss": 5.2316, "mean_token_accuracy": 0.17745898216962813, "num_tokens": 15318821.0, "step": 7370 }, { "entropy": 5.4749537944793705, "epoch": 0.6689949201741655, "grad_norm": 0.984375, "learning_rate": 0.0004962297003185338, "loss": 5.3039, "mean_token_accuracy": 0.18267119228839873, "num_tokens": 15328737.0, "step": 7375 }, { "entropy": 5.598972654342651, "epoch": 0.6694484760522497, "grad_norm": 1.0234375, "learning_rate": 0.0004962237994830433, "loss": 5.411, "mean_token_accuracy": 0.17150809168815612, "num_tokens": 15339695.0, "step": 7380 }, { "entropy": 5.633320331573486, "epoch": 0.6699020319303338, "grad_norm": 0.99609375, "learning_rate": 0.0004962178940725883, "loss": 5.3667, "mean_token_accuracy": 0.17928486466407775, "num_tokens": 15350270.0, "step": 7385 }, { "entropy": 5.533000087738037, "epoch": 0.670355587808418, "grad_norm": 0.9453125, "learning_rate": 0.0004962119840872908, "loss": 5.367, "mean_token_accuracy": 0.18240504264831542, "num_tokens": 15360986.0, "step": 7390 }, { "entropy": 5.531470489501953, "epoch": 0.6708091436865021, "grad_norm": 0.87109375, "learning_rate": 0.0004962060695272733, "loss": 5.3501, "mean_token_accuracy": 0.18166522681713104, "num_tokens": 15371786.0, "step": 7395 }, { "entropy": 5.559743118286133, "epoch": 0.6712626995645864, "grad_norm": 0.94921875, "learning_rate": 0.0004962001503926577, "loss": 5.309, "mean_token_accuracy": 0.18303101807832717, "num_tokens": 15382960.0, "step": 7400 }, { "entropy": 5.551979637145996, "epoch": 0.6717162554426706, "grad_norm": 0.953125, "learning_rate": 0.0004961942266835667, "loss": 5.3077, "mean_token_accuracy": 0.18894487917423247, "num_tokens": 15392807.0, "step": 7405 }, { "entropy": 5.554458045959473, "epoch": 0.6721698113207547, "grad_norm": 0.97265625, "learning_rate": 0.0004961882984001227, "loss": 5.3527, "mean_token_accuracy": 0.1719239681959152, "num_tokens": 15403712.0, "step": 7410 }, { "entropy": 5.548364591598511, "epoch": 0.6726233671988389, "grad_norm": 0.9296875, "learning_rate": 0.0004961823655424484, "loss": 5.4027, "mean_token_accuracy": 0.1698218837380409, "num_tokens": 15414839.0, "step": 7415 }, { "entropy": 5.563115072250366, "epoch": 0.6730769230769231, "grad_norm": 0.9296875, "learning_rate": 0.0004961764281106664, "loss": 5.293, "mean_token_accuracy": 0.18119843751192094, "num_tokens": 15425320.0, "step": 7420 }, { "entropy": 5.544220876693726, "epoch": 0.6735304789550073, "grad_norm": 0.921875, "learning_rate": 0.0004961704861048995, "loss": 5.288, "mean_token_accuracy": 0.1794519156217575, "num_tokens": 15435476.0, "step": 7425 }, { "entropy": 5.5448249816894535, "epoch": 0.6739840348330914, "grad_norm": 0.953125, "learning_rate": 0.0004961645395252705, "loss": 5.4071, "mean_token_accuracy": 0.1752161681652069, "num_tokens": 15445786.0, "step": 7430 }, { "entropy": 5.524516010284424, "epoch": 0.6744375907111756, "grad_norm": 0.9765625, "learning_rate": 0.0004961585883719025, "loss": 5.3816, "mean_token_accuracy": 0.1858324810862541, "num_tokens": 15455915.0, "step": 7435 }, { "entropy": 5.600856065750122, "epoch": 0.6748911465892597, "grad_norm": 0.94921875, "learning_rate": 0.0004961526326449186, "loss": 5.3712, "mean_token_accuracy": 0.17852281779050827, "num_tokens": 15466523.0, "step": 7440 }, { "entropy": 5.600769948959351, "epoch": 0.675344702467344, "grad_norm": 0.96875, "learning_rate": 0.0004961466723444419, "loss": 5.3662, "mean_token_accuracy": 0.17874794453382492, "num_tokens": 15476821.0, "step": 7445 }, { "entropy": 5.514429330825806, "epoch": 0.6757982583454282, "grad_norm": 0.9921875, "learning_rate": 0.0004961407074705955, "loss": 5.2923, "mean_token_accuracy": 0.17971670627593994, "num_tokens": 15487182.0, "step": 7450 }, { "entropy": 5.549853372573852, "epoch": 0.6762518142235123, "grad_norm": 0.90234375, "learning_rate": 0.0004961347380235031, "loss": 5.2785, "mean_token_accuracy": 0.18686819225549697, "num_tokens": 15497600.0, "step": 7455 }, { "entropy": 5.616761255264282, "epoch": 0.6767053701015965, "grad_norm": 1.0, "learning_rate": 0.0004961287640032879, "loss": 5.4268, "mean_token_accuracy": 0.17058165371418, "num_tokens": 15508278.0, "step": 7460 }, { "entropy": 5.64322600364685, "epoch": 0.6771589259796807, "grad_norm": 1.0078125, "learning_rate": 0.0004961227854100734, "loss": 5.4467, "mean_token_accuracy": 0.17577812671661378, "num_tokens": 15518458.0, "step": 7465 }, { "entropy": 5.549437522888184, "epoch": 0.6776124818577649, "grad_norm": 0.9140625, "learning_rate": 0.0004961168022439835, "loss": 5.2543, "mean_token_accuracy": 0.1862138107419014, "num_tokens": 15528738.0, "step": 7470 }, { "entropy": 5.498688793182373, "epoch": 0.6780660377358491, "grad_norm": 0.95703125, "learning_rate": 0.0004961108145051417, "loss": 5.3016, "mean_token_accuracy": 0.1857891008257866, "num_tokens": 15538656.0, "step": 7475 }, { "entropy": 5.4875250339508055, "epoch": 0.6785195936139332, "grad_norm": 0.921875, "learning_rate": 0.000496104822193672, "loss": 5.3009, "mean_token_accuracy": 0.18368335962295532, "num_tokens": 15549285.0, "step": 7480 }, { "entropy": 5.609712409973144, "epoch": 0.6789731494920174, "grad_norm": 0.9453125, "learning_rate": 0.0004960988253096982, "loss": 5.3807, "mean_token_accuracy": 0.1867237627506256, "num_tokens": 15559766.0, "step": 7485 }, { "entropy": 5.533083581924439, "epoch": 0.6794267053701016, "grad_norm": 0.8671875, "learning_rate": 0.0004960928238533443, "loss": 5.2478, "mean_token_accuracy": 0.18986229747533798, "num_tokens": 15570873.0, "step": 7490 }, { "entropy": 5.5704052448272705, "epoch": 0.6798802612481858, "grad_norm": 1.0, "learning_rate": 0.0004960868178247344, "loss": 5.4891, "mean_token_accuracy": 0.17788162529468537, "num_tokens": 15581229.0, "step": 7495 }, { "entropy": 5.540935468673706, "epoch": 0.68033381712627, "grad_norm": 0.953125, "learning_rate": 0.0004960808072239929, "loss": 5.3557, "mean_token_accuracy": 0.17538125514984132, "num_tokens": 15591686.0, "step": 7500 }, { "entropy": 5.620772171020508, "epoch": 0.6807873730043541, "grad_norm": 0.9765625, "learning_rate": 0.0004960747920512439, "loss": 5.3755, "mean_token_accuracy": 0.17827560752630234, "num_tokens": 15601869.0, "step": 7505 }, { "entropy": 5.558009386062622, "epoch": 0.6812409288824384, "grad_norm": 0.8359375, "learning_rate": 0.000496068772306612, "loss": 5.3513, "mean_token_accuracy": 0.17730835527181626, "num_tokens": 15612946.0, "step": 7510 }, { "entropy": 5.558612203598022, "epoch": 0.6816944847605225, "grad_norm": 0.9375, "learning_rate": 0.0004960627479902214, "loss": 5.3976, "mean_token_accuracy": 0.1726248562335968, "num_tokens": 15623761.0, "step": 7515 }, { "entropy": 5.559710741043091, "epoch": 0.6821480406386067, "grad_norm": 0.93359375, "learning_rate": 0.000496056719102197, "loss": 5.3926, "mean_token_accuracy": 0.17348738610744477, "num_tokens": 15634500.0, "step": 7520 }, { "entropy": 5.487872171401977, "epoch": 0.6826015965166908, "grad_norm": 0.9140625, "learning_rate": 0.0004960506856426631, "loss": 5.2369, "mean_token_accuracy": 0.18374142199754714, "num_tokens": 15644896.0, "step": 7525 }, { "entropy": 5.5576379776000975, "epoch": 0.683055152394775, "grad_norm": 0.9296875, "learning_rate": 0.0004960446476117448, "loss": 5.3577, "mean_token_accuracy": 0.1801358714699745, "num_tokens": 15655008.0, "step": 7530 }, { "entropy": 5.5583741664886475, "epoch": 0.6835087082728593, "grad_norm": 0.91796875, "learning_rate": 0.0004960386050095668, "loss": 5.2713, "mean_token_accuracy": 0.17511853575706482, "num_tokens": 15665944.0, "step": 7535 }, { "entropy": 5.568644237518311, "epoch": 0.6839622641509434, "grad_norm": 0.921875, "learning_rate": 0.0004960325578362543, "loss": 5.3761, "mean_token_accuracy": 0.1809030920267105, "num_tokens": 15677099.0, "step": 7540 }, { "entropy": 5.601432275772095, "epoch": 0.6844158200290276, "grad_norm": 0.97265625, "learning_rate": 0.000496026506091932, "loss": 5.3376, "mean_token_accuracy": 0.1795408010482788, "num_tokens": 15687531.0, "step": 7545 }, { "entropy": 5.5705641746521, "epoch": 0.6848693759071117, "grad_norm": 1.0, "learning_rate": 0.0004960204497767253, "loss": 5.3587, "mean_token_accuracy": 0.18146915584802628, "num_tokens": 15697002.0, "step": 7550 }, { "entropy": 5.470752716064453, "epoch": 0.685322931785196, "grad_norm": 0.9375, "learning_rate": 0.0004960143888907594, "loss": 5.2251, "mean_token_accuracy": 0.1819280982017517, "num_tokens": 15707249.0, "step": 7555 }, { "entropy": 5.5658492088317875, "epoch": 0.6857764876632801, "grad_norm": 0.87890625, "learning_rate": 0.0004960083234341595, "loss": 5.3005, "mean_token_accuracy": 0.18364818543195724, "num_tokens": 15718764.0, "step": 7560 }, { "entropy": 5.512791872024536, "epoch": 0.6862300435413643, "grad_norm": 0.921875, "learning_rate": 0.0004960022534070513, "loss": 5.2503, "mean_token_accuracy": 0.18830282539129256, "num_tokens": 15728854.0, "step": 7565 }, { "entropy": 5.458533000946045, "epoch": 0.6866835994194485, "grad_norm": 0.90234375, "learning_rate": 0.00049599617880956, "loss": 5.2675, "mean_token_accuracy": 0.18406953662633896, "num_tokens": 15739682.0, "step": 7570 }, { "entropy": 5.505916738510132, "epoch": 0.6871371552975326, "grad_norm": 0.9765625, "learning_rate": 0.0004959900996418115, "loss": 5.2657, "mean_token_accuracy": 0.1874595806002617, "num_tokens": 15749628.0, "step": 7575 }, { "entropy": 5.530863189697266, "epoch": 0.6875907111756169, "grad_norm": 1.03125, "learning_rate": 0.0004959840159039315, "loss": 5.3281, "mean_token_accuracy": 0.1795841246843338, "num_tokens": 15760137.0, "step": 7580 }, { "entropy": 5.592649602890015, "epoch": 0.688044267053701, "grad_norm": 1.0078125, "learning_rate": 0.0004959779275960456, "loss": 5.2881, "mean_token_accuracy": 0.18079988062381744, "num_tokens": 15769889.0, "step": 7585 }, { "entropy": 5.537004804611206, "epoch": 0.6884978229317852, "grad_norm": 0.8984375, "learning_rate": 0.00049597183471828, "loss": 5.3876, "mean_token_accuracy": 0.17896100878715515, "num_tokens": 15780912.0, "step": 7590 }, { "entropy": 5.553856658935547, "epoch": 0.6889513788098693, "grad_norm": 0.8828125, "learning_rate": 0.0004959657372707604, "loss": 5.2688, "mean_token_accuracy": 0.18778923004865647, "num_tokens": 15791719.0, "step": 7595 }, { "entropy": 5.547277927398682, "epoch": 0.6894049346879536, "grad_norm": 0.9921875, "learning_rate": 0.0004959596352536132, "loss": 5.3197, "mean_token_accuracy": 0.18113720566034316, "num_tokens": 15802551.0, "step": 7600 }, { "entropy": 5.58339672088623, "epoch": 0.6898584905660378, "grad_norm": 0.9765625, "learning_rate": 0.0004959535286669643, "loss": 5.3653, "mean_token_accuracy": 0.17841881066560744, "num_tokens": 15813551.0, "step": 7605 }, { "entropy": 5.554733753204346, "epoch": 0.6903120464441219, "grad_norm": 0.90625, "learning_rate": 0.0004959474175109402, "loss": 5.3373, "mean_token_accuracy": 0.18408777713775634, "num_tokens": 15824262.0, "step": 7610 }, { "entropy": 5.616608047485352, "epoch": 0.6907656023222061, "grad_norm": 0.96484375, "learning_rate": 0.0004959413017856672, "loss": 5.3833, "mean_token_accuracy": 0.18150201439857483, "num_tokens": 15835493.0, "step": 7615 }, { "entropy": 5.446601104736328, "epoch": 0.6912191582002902, "grad_norm": 0.828125, "learning_rate": 0.0004959351814912716, "loss": 5.2793, "mean_token_accuracy": 0.1799856498837471, "num_tokens": 15846224.0, "step": 7620 }, { "entropy": 5.5849120140075685, "epoch": 0.6916727140783745, "grad_norm": 1.03125, "learning_rate": 0.0004959290566278803, "loss": 5.3063, "mean_token_accuracy": 0.1804905876517296, "num_tokens": 15855622.0, "step": 7625 }, { "entropy": 5.562844371795654, "epoch": 0.6921262699564587, "grad_norm": 0.8984375, "learning_rate": 0.0004959229271956199, "loss": 5.3789, "mean_token_accuracy": 0.17874677032232283, "num_tokens": 15865835.0, "step": 7630 }, { "entropy": 5.54128589630127, "epoch": 0.6925798258345428, "grad_norm": 0.95703125, "learning_rate": 0.0004959167931946169, "loss": 5.3154, "mean_token_accuracy": 0.18270861357450485, "num_tokens": 15875915.0, "step": 7635 }, { "entropy": 5.585084104537964, "epoch": 0.693033381712627, "grad_norm": 0.94921875, "learning_rate": 0.0004959106546249984, "loss": 5.3078, "mean_token_accuracy": 0.18133632242679595, "num_tokens": 15887111.0, "step": 7640 }, { "entropy": 5.5735945224761965, "epoch": 0.6934869375907112, "grad_norm": 0.84375, "learning_rate": 0.0004959045114868913, "loss": 5.4066, "mean_token_accuracy": 0.17114051580429077, "num_tokens": 15899528.0, "step": 7645 }, { "entropy": 5.567831516265869, "epoch": 0.6939404934687954, "grad_norm": 0.8515625, "learning_rate": 0.0004958983637804225, "loss": 5.3237, "mean_token_accuracy": 0.18822288066148757, "num_tokens": 15910881.0, "step": 7650 }, { "entropy": 5.634607219696045, "epoch": 0.6943940493468795, "grad_norm": 0.94140625, "learning_rate": 0.0004958922115057194, "loss": 5.3678, "mean_token_accuracy": 0.17664799243211746, "num_tokens": 15921189.0, "step": 7655 }, { "entropy": 5.580757188796997, "epoch": 0.6948476052249637, "grad_norm": 0.94921875, "learning_rate": 0.0004958860546629089, "loss": 5.3637, "mean_token_accuracy": 0.18410303443670273, "num_tokens": 15931276.0, "step": 7660 }, { "entropy": 5.585839080810547, "epoch": 0.6953011611030478, "grad_norm": 0.94140625, "learning_rate": 0.0004958798932521186, "loss": 5.442, "mean_token_accuracy": 0.17055700719356537, "num_tokens": 15941506.0, "step": 7665 }, { "entropy": 5.496153450012207, "epoch": 0.6957547169811321, "grad_norm": 1.015625, "learning_rate": 0.0004958737272734759, "loss": 5.2914, "mean_token_accuracy": 0.18633339554071426, "num_tokens": 15951158.0, "step": 7670 }, { "entropy": 5.613697624206543, "epoch": 0.6962082728592163, "grad_norm": 0.89453125, "learning_rate": 0.0004958675567271081, "loss": 5.3059, "mean_token_accuracy": 0.18212190866470337, "num_tokens": 15960852.0, "step": 7675 }, { "entropy": 5.579945516586304, "epoch": 0.6966618287373004, "grad_norm": 0.90234375, "learning_rate": 0.000495861381613143, "loss": 5.3139, "mean_token_accuracy": 0.1766521543264389, "num_tokens": 15971291.0, "step": 7680 }, { "entropy": 5.51633129119873, "epoch": 0.6971153846153846, "grad_norm": 0.98046875, "learning_rate": 0.0004958552019317082, "loss": 5.377, "mean_token_accuracy": 0.17974497824907304, "num_tokens": 15982180.0, "step": 7685 }, { "entropy": 5.4834810256958, "epoch": 0.6975689404934688, "grad_norm": 0.93359375, "learning_rate": 0.0004958490176829316, "loss": 5.2641, "mean_token_accuracy": 0.18528165817260742, "num_tokens": 15992363.0, "step": 7690 }, { "entropy": 5.580470180511474, "epoch": 0.698022496371553, "grad_norm": 0.92578125, "learning_rate": 0.000495842828866941, "loss": 5.3566, "mean_token_accuracy": 0.17209097146987914, "num_tokens": 16003477.0, "step": 7695 }, { "entropy": 5.598789501190185, "epoch": 0.6984760522496372, "grad_norm": 0.8984375, "learning_rate": 0.0004958366354838645, "loss": 5.3261, "mean_token_accuracy": 0.18081470876932143, "num_tokens": 16013747.0, "step": 7700 }, { "entropy": 5.516934061050415, "epoch": 0.6989296081277213, "grad_norm": 0.90625, "learning_rate": 0.00049583043753383, "loss": 5.3303, "mean_token_accuracy": 0.18622443526983262, "num_tokens": 16025662.0, "step": 7705 }, { "entropy": 5.5949502944946286, "epoch": 0.6993831640058055, "grad_norm": 0.89453125, "learning_rate": 0.0004958242350169658, "loss": 5.407, "mean_token_accuracy": 0.18321597278118135, "num_tokens": 16037315.0, "step": 7710 }, { "entropy": 5.47448148727417, "epoch": 0.6998367198838897, "grad_norm": 1.0546875, "learning_rate": 0.0004958180279334001, "loss": 5.2332, "mean_token_accuracy": 0.18107860833406447, "num_tokens": 16047297.0, "step": 7715 }, { "entropy": 5.4877598762512205, "epoch": 0.7002902757619739, "grad_norm": 0.90234375, "learning_rate": 0.0004958118162832614, "loss": 5.2136, "mean_token_accuracy": 0.18834895491600037, "num_tokens": 16057573.0, "step": 7720 }, { "entropy": 5.5364970684051515, "epoch": 0.700743831640058, "grad_norm": 0.98046875, "learning_rate": 0.0004958056000666781, "loss": 5.3848, "mean_token_accuracy": 0.17313725650310516, "num_tokens": 16067926.0, "step": 7725 }, { "entropy": 5.547545146942139, "epoch": 0.7011973875181422, "grad_norm": 0.94140625, "learning_rate": 0.0004957993792837786, "loss": 5.3135, "mean_token_accuracy": 0.18305060714483262, "num_tokens": 16077938.0, "step": 7730 }, { "entropy": 5.518269681930542, "epoch": 0.7016509433962265, "grad_norm": 1.0, "learning_rate": 0.0004957931539346917, "loss": 5.2126, "mean_token_accuracy": 0.183458811044693, "num_tokens": 16088163.0, "step": 7735 }, { "entropy": 5.6031519889831545, "epoch": 0.7021044992743106, "grad_norm": 0.875, "learning_rate": 0.0004957869240195462, "loss": 5.4064, "mean_token_accuracy": 0.1752445250749588, "num_tokens": 16100640.0, "step": 7740 }, { "entropy": 5.54415545463562, "epoch": 0.7025580551523948, "grad_norm": 0.87109375, "learning_rate": 0.0004957806895384707, "loss": 5.2409, "mean_token_accuracy": 0.18716129958629607, "num_tokens": 16111018.0, "step": 7745 }, { "entropy": 5.503624105453492, "epoch": 0.7030116110304789, "grad_norm": 0.92578125, "learning_rate": 0.0004957744504915944, "loss": 5.2766, "mean_token_accuracy": 0.17956742346286775, "num_tokens": 16120873.0, "step": 7750 }, { "entropy": 5.564220190048218, "epoch": 0.7034651669085631, "grad_norm": 0.953125, "learning_rate": 0.0004957682068790463, "loss": 5.2998, "mean_token_accuracy": 0.17889865934848787, "num_tokens": 16131178.0, "step": 7755 }, { "entropy": 5.516436815261841, "epoch": 0.7039187227866474, "grad_norm": 0.921875, "learning_rate": 0.0004957619587009553, "loss": 5.3, "mean_token_accuracy": 0.18320292234420776, "num_tokens": 16141156.0, "step": 7760 }, { "entropy": 5.544557237625122, "epoch": 0.7043722786647315, "grad_norm": 0.98046875, "learning_rate": 0.0004957557059574507, "loss": 5.405, "mean_token_accuracy": 0.17417299449443818, "num_tokens": 16150077.0, "step": 7765 }, { "entropy": 5.541102647781372, "epoch": 0.7048258345428157, "grad_norm": 0.921875, "learning_rate": 0.0004957494486486618, "loss": 5.3246, "mean_token_accuracy": 0.17782566845417022, "num_tokens": 16160514.0, "step": 7770 }, { "entropy": 5.551746559143067, "epoch": 0.7052793904208998, "grad_norm": 0.9609375, "learning_rate": 0.0004957431867747182, "loss": 5.3671, "mean_token_accuracy": 0.18455520123243332, "num_tokens": 16170811.0, "step": 7775 }, { "entropy": 5.478965806961059, "epoch": 0.7057329462989841, "grad_norm": 0.93359375, "learning_rate": 0.0004957369203357492, "loss": 5.2566, "mean_token_accuracy": 0.1847606912255287, "num_tokens": 16181553.0, "step": 7780 }, { "entropy": 5.55667085647583, "epoch": 0.7061865021770682, "grad_norm": 0.8828125, "learning_rate": 0.0004957306493318844, "loss": 5.2794, "mean_token_accuracy": 0.1900545060634613, "num_tokens": 16191308.0, "step": 7785 }, { "entropy": 5.5251086235046385, "epoch": 0.7066400580551524, "grad_norm": 0.9140625, "learning_rate": 0.0004957243737632535, "loss": 5.2563, "mean_token_accuracy": 0.18701473474502564, "num_tokens": 16201311.0, "step": 7790 }, { "entropy": 5.555533313751221, "epoch": 0.7070936139332366, "grad_norm": 0.9375, "learning_rate": 0.0004957180936299863, "loss": 5.3075, "mean_token_accuracy": 0.1831939309835434, "num_tokens": 16211105.0, "step": 7795 }, { "entropy": 5.557322025299072, "epoch": 0.7075471698113207, "grad_norm": 0.93359375, "learning_rate": 0.0004957118089322127, "loss": 5.328, "mean_token_accuracy": 0.17431456744670867, "num_tokens": 16220836.0, "step": 7800 }, { "entropy": 5.510331630706787, "epoch": 0.708000725689405, "grad_norm": 0.8984375, "learning_rate": 0.0004957055196700628, "loss": 5.2236, "mean_token_accuracy": 0.1855901911854744, "num_tokens": 16231630.0, "step": 7805 }, { "entropy": 5.560601472854614, "epoch": 0.7084542815674891, "grad_norm": 0.91015625, "learning_rate": 0.0004956992258436663, "loss": 5.3236, "mean_token_accuracy": 0.18146177083253862, "num_tokens": 16242272.0, "step": 7810 }, { "entropy": 5.4510585308074955, "epoch": 0.7089078374455733, "grad_norm": 0.91015625, "learning_rate": 0.0004956929274531536, "loss": 5.235, "mean_token_accuracy": 0.1826574593782425, "num_tokens": 16252555.0, "step": 7815 }, { "entropy": 5.519144773483276, "epoch": 0.7093613933236574, "grad_norm": 0.9609375, "learning_rate": 0.000495686624498655, "loss": 5.3509, "mean_token_accuracy": 0.18719311952590942, "num_tokens": 16261964.0, "step": 7820 }, { "entropy": 5.61521577835083, "epoch": 0.7098149492017417, "grad_norm": 0.83203125, "learning_rate": 0.0004956803169803007, "loss": 5.3896, "mean_token_accuracy": 0.17692660838365554, "num_tokens": 16274543.0, "step": 7825 }, { "entropy": 5.509320163726807, "epoch": 0.7102685050798259, "grad_norm": 0.859375, "learning_rate": 0.0004956740048982212, "loss": 5.3055, "mean_token_accuracy": 0.17120635658502578, "num_tokens": 16285124.0, "step": 7830 }, { "entropy": 5.523042774200439, "epoch": 0.71072206095791, "grad_norm": 0.984375, "learning_rate": 0.0004956676882525472, "loss": 5.3757, "mean_token_accuracy": 0.17950959950685502, "num_tokens": 16295727.0, "step": 7835 }, { "entropy": 5.622578430175781, "epoch": 0.7111756168359942, "grad_norm": 0.90234375, "learning_rate": 0.000495661367043409, "loss": 5.2772, "mean_token_accuracy": 0.19084594547748565, "num_tokens": 16305496.0, "step": 7840 }, { "entropy": 5.515881633758545, "epoch": 0.7116291727140783, "grad_norm": 0.97265625, "learning_rate": 0.0004956550412709376, "loss": 5.2645, "mean_token_accuracy": 0.18688923120498657, "num_tokens": 16315112.0, "step": 7845 }, { "entropy": 5.537652444839478, "epoch": 0.7120827285921626, "grad_norm": 0.87109375, "learning_rate": 0.0004956487109352637, "loss": 5.304, "mean_token_accuracy": 0.18639636486768724, "num_tokens": 16325613.0, "step": 7850 }, { "entropy": 5.522394752502441, "epoch": 0.7125362844702468, "grad_norm": 0.953125, "learning_rate": 0.0004956423760365181, "loss": 5.2433, "mean_token_accuracy": 0.18728332221508026, "num_tokens": 16335317.0, "step": 7855 }, { "entropy": 5.5846155166625975, "epoch": 0.7129898403483309, "grad_norm": 1.0390625, "learning_rate": 0.0004956360365748321, "loss": 5.3926, "mean_token_accuracy": 0.17209500968456268, "num_tokens": 16345003.0, "step": 7860 }, { "entropy": 5.571717071533203, "epoch": 0.7134433962264151, "grad_norm": 0.83984375, "learning_rate": 0.0004956296925503367, "loss": 5.379, "mean_token_accuracy": 0.17814605087041854, "num_tokens": 16356108.0, "step": 7865 }, { "entropy": 5.506393384933472, "epoch": 0.7138969521044993, "grad_norm": 0.98828125, "learning_rate": 0.0004956233439631628, "loss": 5.1874, "mean_token_accuracy": 0.18501874059438705, "num_tokens": 16364733.0, "step": 7870 }, { "entropy": 5.588735723495484, "epoch": 0.7143505079825835, "grad_norm": 0.94921875, "learning_rate": 0.0004956169908134421, "loss": 5.2879, "mean_token_accuracy": 0.18495833426713942, "num_tokens": 16375229.0, "step": 7875 }, { "entropy": 5.532235622406006, "epoch": 0.7148040638606676, "grad_norm": 0.90625, "learning_rate": 0.0004956106331013057, "loss": 5.3668, "mean_token_accuracy": 0.18426259309053422, "num_tokens": 16386366.0, "step": 7880 }, { "entropy": 5.4934896469116214, "epoch": 0.7152576197387518, "grad_norm": 0.90234375, "learning_rate": 0.0004956042708268853, "loss": 5.2602, "mean_token_accuracy": 0.1904539719223976, "num_tokens": 16397067.0, "step": 7885 }, { "entropy": 5.464821481704712, "epoch": 0.715711175616836, "grad_norm": 0.99609375, "learning_rate": 0.0004955979039903123, "loss": 5.2136, "mean_token_accuracy": 0.1833643287420273, "num_tokens": 16407256.0, "step": 7890 }, { "entropy": 5.49287257194519, "epoch": 0.7161647314949202, "grad_norm": 0.87109375, "learning_rate": 0.0004955915325917183, "loss": 5.2733, "mean_token_accuracy": 0.1792703688144684, "num_tokens": 16418701.0, "step": 7895 }, { "entropy": 5.476460409164429, "epoch": 0.7166182873730044, "grad_norm": 0.9296875, "learning_rate": 0.0004955851566312354, "loss": 5.1877, "mean_token_accuracy": 0.1884955197572708, "num_tokens": 16428019.0, "step": 7900 }, { "entropy": 5.452414226531983, "epoch": 0.7170718432510885, "grad_norm": 0.91796875, "learning_rate": 0.0004955787761089952, "loss": 5.2773, "mean_token_accuracy": 0.18074552565813065, "num_tokens": 16440122.0, "step": 7905 }, { "entropy": 5.62509765625, "epoch": 0.7175253991291727, "grad_norm": 1.015625, "learning_rate": 0.0004955723910251296, "loss": 5.3613, "mean_token_accuracy": 0.17514893114566804, "num_tokens": 16449801.0, "step": 7910 }, { "entropy": 5.495181322097778, "epoch": 0.717978955007257, "grad_norm": 0.984375, "learning_rate": 0.0004955660013797709, "loss": 5.2102, "mean_token_accuracy": 0.18785545378923416, "num_tokens": 16460155.0, "step": 7915 }, { "entropy": 5.575676202774048, "epoch": 0.7184325108853411, "grad_norm": 0.92578125, "learning_rate": 0.000495559607173051, "loss": 5.4192, "mean_token_accuracy": 0.17114308923482896, "num_tokens": 16470656.0, "step": 7920 }, { "entropy": 5.56002631187439, "epoch": 0.7188860667634253, "grad_norm": 0.90625, "learning_rate": 0.0004955532084051022, "loss": 5.3067, "mean_token_accuracy": 0.18146676570177078, "num_tokens": 16481449.0, "step": 7925 }, { "entropy": 5.530605125427246, "epoch": 0.7193396226415094, "grad_norm": 0.91796875, "learning_rate": 0.0004955468050760568, "loss": 5.3295, "mean_token_accuracy": 0.1831614077091217, "num_tokens": 16492032.0, "step": 7930 }, { "entropy": 5.593453073501587, "epoch": 0.7197931785195936, "grad_norm": 0.9375, "learning_rate": 0.0004955403971860474, "loss": 5.2551, "mean_token_accuracy": 0.18039434105157853, "num_tokens": 16502221.0, "step": 7935 }, { "entropy": 5.539740943908692, "epoch": 0.7202467343976778, "grad_norm": 1.015625, "learning_rate": 0.0004955339847352063, "loss": 5.2528, "mean_token_accuracy": 0.18457072079181672, "num_tokens": 16512021.0, "step": 7940 }, { "entropy": 5.499135541915893, "epoch": 0.720700290275762, "grad_norm": 0.9765625, "learning_rate": 0.0004955275677236662, "loss": 5.3026, "mean_token_accuracy": 0.1828033670783043, "num_tokens": 16522060.0, "step": 7945 }, { "entropy": 5.528159189224243, "epoch": 0.7211538461538461, "grad_norm": 1.0390625, "learning_rate": 0.0004955211461515599, "loss": 5.2898, "mean_token_accuracy": 0.1860054388642311, "num_tokens": 16532827.0, "step": 7950 }, { "entropy": 5.551040935516357, "epoch": 0.7216074020319303, "grad_norm": 0.87890625, "learning_rate": 0.00049551472001902, "loss": 5.3431, "mean_token_accuracy": 0.18500829637050628, "num_tokens": 16542838.0, "step": 7955 }, { "entropy": 5.509801578521729, "epoch": 0.7220609579100146, "grad_norm": 0.875, "learning_rate": 0.0004955082893261796, "loss": 5.2815, "mean_token_accuracy": 0.18686290830373764, "num_tokens": 16552615.0, "step": 7960 }, { "entropy": 5.583999919891357, "epoch": 0.7225145137880987, "grad_norm": 1.046875, "learning_rate": 0.0004955018540731714, "loss": 5.3489, "mean_token_accuracy": 0.18032243102788925, "num_tokens": 16561777.0, "step": 7965 }, { "entropy": 5.553142452239991, "epoch": 0.7229680696661829, "grad_norm": 0.890625, "learning_rate": 0.0004954954142601288, "loss": 5.3082, "mean_token_accuracy": 0.18332842886447906, "num_tokens": 16572111.0, "step": 7970 }, { "entropy": 5.5559593677520756, "epoch": 0.723421625544267, "grad_norm": 1.0, "learning_rate": 0.0004954889698871849, "loss": 5.3549, "mean_token_accuracy": 0.18638369292020798, "num_tokens": 16581674.0, "step": 7975 }, { "entropy": 5.570011758804322, "epoch": 0.7238751814223512, "grad_norm": 0.90234375, "learning_rate": 0.0004954825209544728, "loss": 5.335, "mean_token_accuracy": 0.19101521968841553, "num_tokens": 16591802.0, "step": 7980 }, { "entropy": 5.542544221878051, "epoch": 0.7243287373004355, "grad_norm": 0.9296875, "learning_rate": 0.000495476067462126, "loss": 5.2403, "mean_token_accuracy": 0.1896628573536873, "num_tokens": 16602772.0, "step": 7985 }, { "entropy": 5.562042999267578, "epoch": 0.7247822931785196, "grad_norm": 0.94921875, "learning_rate": 0.000495469609410278, "loss": 5.2866, "mean_token_accuracy": 0.18497096598148347, "num_tokens": 16613526.0, "step": 7990 }, { "entropy": 5.4583722114562985, "epoch": 0.7252358490566038, "grad_norm": 1.0859375, "learning_rate": 0.0004954631467990622, "loss": 5.2867, "mean_token_accuracy": 0.18482371866703035, "num_tokens": 16623583.0, "step": 7995 }, { "entropy": 5.544550371170044, "epoch": 0.7256894049346879, "grad_norm": 0.9765625, "learning_rate": 0.0004954566796286124, "loss": 5.346, "mean_token_accuracy": 0.17807176262140273, "num_tokens": 16635068.0, "step": 8000 }, { "entropy": 5.589382553100586, "epoch": 0.7261429608127722, "grad_norm": 0.98046875, "learning_rate": 0.0004954502078990623, "loss": 5.2463, "mean_token_accuracy": 0.18150110691785812, "num_tokens": 16645021.0, "step": 8005 }, { "entropy": 5.525119733810425, "epoch": 0.7265965166908563, "grad_norm": 0.90234375, "learning_rate": 0.0004954437316105457, "loss": 5.333, "mean_token_accuracy": 0.1788739249110222, "num_tokens": 16656021.0, "step": 8010 }, { "entropy": 5.494053888320923, "epoch": 0.7270500725689405, "grad_norm": 0.9765625, "learning_rate": 0.0004954372507631965, "loss": 5.2201, "mean_token_accuracy": 0.19220224618911744, "num_tokens": 16665236.0, "step": 8015 }, { "entropy": 5.558600378036499, "epoch": 0.7275036284470247, "grad_norm": 0.92578125, "learning_rate": 0.0004954307653571489, "loss": 5.4189, "mean_token_accuracy": 0.17521561533212662, "num_tokens": 16676690.0, "step": 8020 }, { "entropy": 5.557137393951416, "epoch": 0.7279571843251088, "grad_norm": 0.93359375, "learning_rate": 0.0004954242753925367, "loss": 5.3067, "mean_token_accuracy": 0.17874979972839355, "num_tokens": 16687288.0, "step": 8025 }, { "entropy": 5.520791292190552, "epoch": 0.7284107402031931, "grad_norm": 0.98046875, "learning_rate": 0.0004954177808694946, "loss": 5.3288, "mean_token_accuracy": 0.17826912701129913, "num_tokens": 16697873.0, "step": 8030 }, { "entropy": 5.5447221279144285, "epoch": 0.7288642960812772, "grad_norm": 0.9140625, "learning_rate": 0.0004954112817881565, "loss": 5.3312, "mean_token_accuracy": 0.17438385188579558, "num_tokens": 16709002.0, "step": 8035 }, { "entropy": 5.5151759624481205, "epoch": 0.7293178519593614, "grad_norm": 0.9765625, "learning_rate": 0.0004954047781486568, "loss": 5.2998, "mean_token_accuracy": 0.1815633311867714, "num_tokens": 16718989.0, "step": 8040 }, { "entropy": 5.594701957702637, "epoch": 0.7297714078374455, "grad_norm": 0.91796875, "learning_rate": 0.0004953982699511303, "loss": 5.3723, "mean_token_accuracy": 0.1834247812628746, "num_tokens": 16730425.0, "step": 8045 }, { "entropy": 5.574563789367676, "epoch": 0.7302249637155298, "grad_norm": 1.0390625, "learning_rate": 0.0004953917571957114, "loss": 5.2844, "mean_token_accuracy": 0.18223824948072434, "num_tokens": 16740216.0, "step": 8050 }, { "entropy": 5.513731193542481, "epoch": 0.730678519593614, "grad_norm": 0.9453125, "learning_rate": 0.0004953852398825346, "loss": 5.2599, "mean_token_accuracy": 0.1835854694247246, "num_tokens": 16752436.0, "step": 8055 }, { "entropy": 5.4929563999176025, "epoch": 0.7311320754716981, "grad_norm": 0.94921875, "learning_rate": 0.000495378718011735, "loss": 5.2833, "mean_token_accuracy": 0.18290273547172547, "num_tokens": 16762631.0, "step": 8060 }, { "entropy": 5.570620965957642, "epoch": 0.7315856313497823, "grad_norm": 0.91796875, "learning_rate": 0.0004953721915834473, "loss": 5.3062, "mean_token_accuracy": 0.18442205041646959, "num_tokens": 16772613.0, "step": 8065 }, { "entropy": 5.580399417877198, "epoch": 0.7320391872278664, "grad_norm": 0.9296875, "learning_rate": 0.0004953656605978067, "loss": 5.3126, "mean_token_accuracy": 0.17444958239793779, "num_tokens": 16782963.0, "step": 8070 }, { "entropy": 5.502667856216431, "epoch": 0.7324927431059507, "grad_norm": 0.875, "learning_rate": 0.000495359125054948, "loss": 5.2461, "mean_token_accuracy": 0.1868554711341858, "num_tokens": 16793892.0, "step": 8075 }, { "entropy": 5.453513860702515, "epoch": 0.7329462989840348, "grad_norm": 1.1640625, "learning_rate": 0.0004953525849550063, "loss": 5.2373, "mean_token_accuracy": 0.17641406506299973, "num_tokens": 16803388.0, "step": 8080 }, { "entropy": 5.5092305660247805, "epoch": 0.733399854862119, "grad_norm": 0.9375, "learning_rate": 0.0004953460402981172, "loss": 5.2064, "mean_token_accuracy": 0.18928418755531312, "num_tokens": 16813201.0, "step": 8085 }, { "entropy": 5.587248516082764, "epoch": 0.7338534107402032, "grad_norm": 0.875, "learning_rate": 0.0004953394910844157, "loss": 5.4576, "mean_token_accuracy": 0.17749661803245545, "num_tokens": 16823265.0, "step": 8090 }, { "entropy": 5.514876079559326, "epoch": 0.7343069666182874, "grad_norm": 1.0078125, "learning_rate": 0.0004953329373140374, "loss": 5.2368, "mean_token_accuracy": 0.18455445468425752, "num_tokens": 16833057.0, "step": 8095 }, { "entropy": 5.529699420928955, "epoch": 0.7347605224963716, "grad_norm": 0.84375, "learning_rate": 0.0004953263789871179, "loss": 5.2033, "mean_token_accuracy": 0.18069398403167725, "num_tokens": 16843488.0, "step": 8100 }, { "entropy": 5.451847314834595, "epoch": 0.7352140783744557, "grad_norm": 1.0390625, "learning_rate": 0.0004953198161037925, "loss": 5.2423, "mean_token_accuracy": 0.1972143605351448, "num_tokens": 16852448.0, "step": 8105 }, { "entropy": 5.398800182342529, "epoch": 0.7356676342525399, "grad_norm": 0.93359375, "learning_rate": 0.0004953132486641975, "loss": 5.2678, "mean_token_accuracy": 0.182267963886261, "num_tokens": 16863944.0, "step": 8110 }, { "entropy": 5.561413669586182, "epoch": 0.736121190130624, "grad_norm": 1.078125, "learning_rate": 0.000495306676668468, "loss": 5.1982, "mean_token_accuracy": 0.18368888199329375, "num_tokens": 16873923.0, "step": 8115 }, { "entropy": 5.5462486743927, "epoch": 0.7365747460087083, "grad_norm": 0.94921875, "learning_rate": 0.0004953001001167406, "loss": 5.3103, "mean_token_accuracy": 0.17963693737983705, "num_tokens": 16884373.0, "step": 8120 }, { "entropy": 5.5512104511260985, "epoch": 0.7370283018867925, "grad_norm": 0.96484375, "learning_rate": 0.0004952935190091508, "loss": 5.4311, "mean_token_accuracy": 0.17719766050577163, "num_tokens": 16895869.0, "step": 8125 }, { "entropy": 5.482508754730224, "epoch": 0.7374818577648766, "grad_norm": 0.94921875, "learning_rate": 0.0004952869333458349, "loss": 5.2713, "mean_token_accuracy": 0.1831250846385956, "num_tokens": 16906737.0, "step": 8130 }, { "entropy": 5.466742324829101, "epoch": 0.7379354136429608, "grad_norm": 0.984375, "learning_rate": 0.0004952803431269292, "loss": 5.2061, "mean_token_accuracy": 0.18994556814432145, "num_tokens": 16916083.0, "step": 8135 }, { "entropy": 5.5881688594818115, "epoch": 0.738388969521045, "grad_norm": 0.99609375, "learning_rate": 0.0004952737483525699, "loss": 5.3836, "mean_token_accuracy": 0.182338385283947, "num_tokens": 16926419.0, "step": 8140 }, { "entropy": 5.624546480178833, "epoch": 0.7388425253991292, "grad_norm": 0.9375, "learning_rate": 0.0004952671490228932, "loss": 5.3094, "mean_token_accuracy": 0.18363170474767684, "num_tokens": 16936067.0, "step": 8145 }, { "entropy": 5.578293991088867, "epoch": 0.7392960812772134, "grad_norm": 0.9296875, "learning_rate": 0.0004952605451380357, "loss": 5.253, "mean_token_accuracy": 0.18858592212200165, "num_tokens": 16946571.0, "step": 8150 }, { "entropy": 5.479947805404663, "epoch": 0.7397496371552975, "grad_norm": 0.9140625, "learning_rate": 0.0004952539366981342, "loss": 5.3013, "mean_token_accuracy": 0.1838264137506485, "num_tokens": 16956764.0, "step": 8155 }, { "entropy": 5.496211385726928, "epoch": 0.7402031930333817, "grad_norm": 0.9765625, "learning_rate": 0.000495247323703325, "loss": 5.2438, "mean_token_accuracy": 0.192402121424675, "num_tokens": 16966002.0, "step": 8160 }, { "entropy": 5.586853837966919, "epoch": 0.7406567489114659, "grad_norm": 0.9921875, "learning_rate": 0.000495240706153745, "loss": 5.341, "mean_token_accuracy": 0.1828116625547409, "num_tokens": 16975705.0, "step": 8165 }, { "entropy": 5.531956195831299, "epoch": 0.7411103047895501, "grad_norm": 0.95703125, "learning_rate": 0.0004952340840495312, "loss": 5.24, "mean_token_accuracy": 0.18215106874704362, "num_tokens": 16985945.0, "step": 8170 }, { "entropy": 5.4779589653015135, "epoch": 0.7415638606676342, "grad_norm": 1.0703125, "learning_rate": 0.0004952274573908203, "loss": 5.2237, "mean_token_accuracy": 0.1873907685279846, "num_tokens": 16995475.0, "step": 8175 }, { "entropy": 5.511494302749634, "epoch": 0.7420174165457184, "grad_norm": 0.9609375, "learning_rate": 0.0004952208261777496, "loss": 5.2523, "mean_token_accuracy": 0.1826030820608139, "num_tokens": 17005028.0, "step": 8180 }, { "entropy": 5.54114727973938, "epoch": 0.7424709724238027, "grad_norm": 0.94140625, "learning_rate": 0.000495214190410456, "loss": 5.309, "mean_token_accuracy": 0.18562476485967636, "num_tokens": 17014786.0, "step": 8185 }, { "entropy": 5.539929485321045, "epoch": 0.7429245283018868, "grad_norm": 0.96875, "learning_rate": 0.0004952075500890768, "loss": 5.3124, "mean_token_accuracy": 0.18346714675426484, "num_tokens": 17024431.0, "step": 8190 }, { "entropy": 5.508410024642944, "epoch": 0.743378084179971, "grad_norm": 0.93359375, "learning_rate": 0.0004952009052137493, "loss": 5.2929, "mean_token_accuracy": 0.18714380860328675, "num_tokens": 17034368.0, "step": 8195 }, { "entropy": 5.503003263473511, "epoch": 0.7438316400580551, "grad_norm": 0.94140625, "learning_rate": 0.0004951942557846112, "loss": 5.3261, "mean_token_accuracy": 0.18206837624311448, "num_tokens": 17043818.0, "step": 8200 }, { "entropy": 5.5616518497467045, "epoch": 0.7442851959361393, "grad_norm": 0.98828125, "learning_rate": 0.0004951876018017997, "loss": 5.3205, "mean_token_accuracy": 0.18540932089090348, "num_tokens": 17054843.0, "step": 8205 }, { "entropy": 5.535712146759034, "epoch": 0.7447387518142236, "grad_norm": 0.8515625, "learning_rate": 0.0004951809432654524, "loss": 5.3265, "mean_token_accuracy": 0.182991661131382, "num_tokens": 17065539.0, "step": 8210 }, { "entropy": 5.500705003738403, "epoch": 0.7451923076923077, "grad_norm": 0.96875, "learning_rate": 0.000495174280175707, "loss": 5.2422, "mean_token_accuracy": 0.18335951268672943, "num_tokens": 17075443.0, "step": 8215 }, { "entropy": 5.61527829170227, "epoch": 0.7456458635703919, "grad_norm": 0.95703125, "learning_rate": 0.0004951676125327015, "loss": 5.3673, "mean_token_accuracy": 0.1847109615802765, "num_tokens": 17085490.0, "step": 8220 }, { "entropy": 5.5724077224731445, "epoch": 0.746099419448476, "grad_norm": 0.96875, "learning_rate": 0.0004951609403365737, "loss": 5.3522, "mean_token_accuracy": 0.1829810321331024, "num_tokens": 17094803.0, "step": 8225 }, { "entropy": 5.525753211975098, "epoch": 0.7465529753265603, "grad_norm": 0.93359375, "learning_rate": 0.0004951542635874615, "loss": 5.2136, "mean_token_accuracy": 0.18302233666181564, "num_tokens": 17104373.0, "step": 8230 }, { "entropy": 5.557919216156006, "epoch": 0.7470065312046444, "grad_norm": 0.87109375, "learning_rate": 0.0004951475822855029, "loss": 5.2884, "mean_token_accuracy": 0.18372104465961456, "num_tokens": 17115469.0, "step": 8235 }, { "entropy": 5.532179355621338, "epoch": 0.7474600870827286, "grad_norm": 0.9765625, "learning_rate": 0.0004951408964308364, "loss": 5.2668, "mean_token_accuracy": 0.18367121368646622, "num_tokens": 17125443.0, "step": 8240 }, { "entropy": 5.463788461685181, "epoch": 0.7479136429608128, "grad_norm": 0.9921875, "learning_rate": 0.0004951342060236, "loss": 5.2343, "mean_token_accuracy": 0.18693330585956575, "num_tokens": 17136253.0, "step": 8245 }, { "entropy": 5.573167133331299, "epoch": 0.7483671988388969, "grad_norm": 1.0546875, "learning_rate": 0.0004951275110639321, "loss": 5.2911, "mean_token_accuracy": 0.18700899928808212, "num_tokens": 17145544.0, "step": 8250 }, { "entropy": 5.55022964477539, "epoch": 0.7488207547169812, "grad_norm": 0.9140625, "learning_rate": 0.0004951208115519712, "loss": 5.2952, "mean_token_accuracy": 0.18260560929775238, "num_tokens": 17155043.0, "step": 8255 }, { "entropy": 5.5254528522491455, "epoch": 0.7492743105950653, "grad_norm": 1.046875, "learning_rate": 0.0004951141074878558, "loss": 5.3393, "mean_token_accuracy": 0.1820871725678444, "num_tokens": 17164885.0, "step": 8260 }, { "entropy": 5.631131505966186, "epoch": 0.7497278664731495, "grad_norm": 0.9765625, "learning_rate": 0.0004951073988717246, "loss": 5.3404, "mean_token_accuracy": 0.1810414507985115, "num_tokens": 17175681.0, "step": 8265 }, { "entropy": 5.473759317398072, "epoch": 0.7501814223512336, "grad_norm": 0.9140625, "learning_rate": 0.0004951006857037163, "loss": 5.213, "mean_token_accuracy": 0.1888574704527855, "num_tokens": 17186002.0, "step": 8270 }, { "entropy": 5.524263381958008, "epoch": 0.7506349782293179, "grad_norm": 1.0, "learning_rate": 0.0004950939679839696, "loss": 5.2646, "mean_token_accuracy": 0.18346552699804305, "num_tokens": 17195499.0, "step": 8275 }, { "entropy": 5.533853340148926, "epoch": 0.7510885341074021, "grad_norm": 0.96875, "learning_rate": 0.0004950872457126237, "loss": 5.2716, "mean_token_accuracy": 0.18572352528572084, "num_tokens": 17204684.0, "step": 8280 }, { "entropy": 5.538997459411621, "epoch": 0.7515420899854862, "grad_norm": 0.9453125, "learning_rate": 0.0004950805188898175, "loss": 5.3085, "mean_token_accuracy": 0.17798569202423095, "num_tokens": 17213987.0, "step": 8285 }, { "entropy": 5.532698488235473, "epoch": 0.7519956458635704, "grad_norm": 0.91015625, "learning_rate": 0.00049507378751569, "loss": 5.3141, "mean_token_accuracy": 0.17800866514444352, "num_tokens": 17224512.0, "step": 8290 }, { "entropy": 5.616262674331665, "epoch": 0.7524492017416545, "grad_norm": 1.015625, "learning_rate": 0.0004950670515903805, "loss": 5.3375, "mean_token_accuracy": 0.18572027534246444, "num_tokens": 17234362.0, "step": 8295 }, { "entropy": 5.554524564743042, "epoch": 0.7529027576197388, "grad_norm": 1.0, "learning_rate": 0.0004950603111140283, "loss": 5.3147, "mean_token_accuracy": 0.18971499800682068, "num_tokens": 17244241.0, "step": 8300 }, { "entropy": 5.4980474472045895, "epoch": 0.753356313497823, "grad_norm": 0.93359375, "learning_rate": 0.0004950535660867728, "loss": 5.2489, "mean_token_accuracy": 0.18815081119537352, "num_tokens": 17254689.0, "step": 8305 }, { "entropy": 5.564259672164917, "epoch": 0.7538098693759071, "grad_norm": 0.92578125, "learning_rate": 0.0004950468165087535, "loss": 5.3434, "mean_token_accuracy": 0.17959407716989517, "num_tokens": 17265506.0, "step": 8310 }, { "entropy": 5.543921327590942, "epoch": 0.7542634252539913, "grad_norm": 0.91015625, "learning_rate": 0.0004950400623801098, "loss": 5.4162, "mean_token_accuracy": 0.18204887360334396, "num_tokens": 17276376.0, "step": 8315 }, { "entropy": 5.59347243309021, "epoch": 0.7547169811320755, "grad_norm": 0.85546875, "learning_rate": 0.0004950333037009818, "loss": 5.3005, "mean_token_accuracy": 0.17268142551183702, "num_tokens": 17287005.0, "step": 8320 }, { "entropy": 5.582093858718872, "epoch": 0.7551705370101597, "grad_norm": 0.93359375, "learning_rate": 0.0004950265404715089, "loss": 5.3053, "mean_token_accuracy": 0.17970646917819977, "num_tokens": 17297595.0, "step": 8325 }, { "entropy": 5.458274936676025, "epoch": 0.7556240928882438, "grad_norm": 0.96484375, "learning_rate": 0.000495019772691831, "loss": 5.175, "mean_token_accuracy": 0.1917903169989586, "num_tokens": 17307319.0, "step": 8330 }, { "entropy": 5.572049331665039, "epoch": 0.756077648766328, "grad_norm": 0.94140625, "learning_rate": 0.0004950130003620882, "loss": 5.4002, "mean_token_accuracy": 0.1848435267806053, "num_tokens": 17317978.0, "step": 8335 }, { "entropy": 5.51245903968811, "epoch": 0.7565312046444121, "grad_norm": 0.9296875, "learning_rate": 0.0004950062234824204, "loss": 5.2928, "mean_token_accuracy": 0.18260230571031572, "num_tokens": 17328339.0, "step": 8340 }, { "entropy": 5.52795376777649, "epoch": 0.7569847605224964, "grad_norm": 0.9375, "learning_rate": 0.0004949994420529679, "loss": 5.3443, "mean_token_accuracy": 0.18249064534902573, "num_tokens": 17338668.0, "step": 8345 }, { "entropy": 5.498517084121704, "epoch": 0.7574383164005806, "grad_norm": 0.98828125, "learning_rate": 0.0004949926560738709, "loss": 5.2917, "mean_token_accuracy": 0.177150858938694, "num_tokens": 17348609.0, "step": 8350 }, { "entropy": 5.578651428222656, "epoch": 0.7578918722786647, "grad_norm": 0.98046875, "learning_rate": 0.0004949858655452697, "loss": 5.2962, "mean_token_accuracy": 0.18345605581998825, "num_tokens": 17358014.0, "step": 8355 }, { "entropy": 5.5646138191223145, "epoch": 0.7583454281567489, "grad_norm": 0.87109375, "learning_rate": 0.0004949790704673048, "loss": 5.296, "mean_token_accuracy": 0.186521714925766, "num_tokens": 17367975.0, "step": 8360 }, { "entropy": 5.550845050811768, "epoch": 0.7587989840348331, "grad_norm": 0.91015625, "learning_rate": 0.0004949722708401166, "loss": 5.2444, "mean_token_accuracy": 0.1873399719595909, "num_tokens": 17377960.0, "step": 8365 }, { "entropy": 5.570762348175049, "epoch": 0.7592525399129173, "grad_norm": 0.95703125, "learning_rate": 0.0004949654666638457, "loss": 5.3189, "mean_token_accuracy": 0.18686124682426453, "num_tokens": 17387334.0, "step": 8370 }, { "entropy": 5.525769948959351, "epoch": 0.7597060957910015, "grad_norm": 0.91796875, "learning_rate": 0.000494958657938633, "loss": 5.2811, "mean_token_accuracy": 0.1862280398607254, "num_tokens": 17396521.0, "step": 8375 }, { "entropy": 5.485896825790405, "epoch": 0.7601596516690856, "grad_norm": 0.921875, "learning_rate": 0.0004949518446646192, "loss": 5.2506, "mean_token_accuracy": 0.18615950345993043, "num_tokens": 17407217.0, "step": 8380 }, { "entropy": 5.662817144393921, "epoch": 0.7606132075471698, "grad_norm": 0.9453125, "learning_rate": 0.0004949450268419451, "loss": 5.3806, "mean_token_accuracy": 0.17769204825162888, "num_tokens": 17416982.0, "step": 8385 }, { "entropy": 5.483257293701172, "epoch": 0.761066763425254, "grad_norm": 0.91796875, "learning_rate": 0.000494938204470752, "loss": 5.2216, "mean_token_accuracy": 0.18211308419704436, "num_tokens": 17427636.0, "step": 8390 }, { "entropy": 5.508321857452392, "epoch": 0.7615203193033382, "grad_norm": 0.8984375, "learning_rate": 0.0004949313775511806, "loss": 5.3514, "mean_token_accuracy": 0.17798120081424712, "num_tokens": 17437488.0, "step": 8395 }, { "entropy": 5.528272867202759, "epoch": 0.7619738751814223, "grad_norm": 0.87890625, "learning_rate": 0.0004949245460833723, "loss": 5.1376, "mean_token_accuracy": 0.19336626231670379, "num_tokens": 17447838.0, "step": 8400 }, { "entropy": 5.554759931564331, "epoch": 0.7624274310595065, "grad_norm": 0.9375, "learning_rate": 0.0004949177100674684, "loss": 5.3676, "mean_token_accuracy": 0.18535151779651643, "num_tokens": 17457257.0, "step": 8405 }, { "entropy": 5.545297145843506, "epoch": 0.7628809869375908, "grad_norm": 0.91796875, "learning_rate": 0.0004949108695036102, "loss": 5.2635, "mean_token_accuracy": 0.18526664525270461, "num_tokens": 17467729.0, "step": 8410 }, { "entropy": 5.5293680191040036, "epoch": 0.7633345428156749, "grad_norm": 0.92578125, "learning_rate": 0.0004949040243919392, "loss": 5.3014, "mean_token_accuracy": 0.17469221204519272, "num_tokens": 17477692.0, "step": 8415 }, { "entropy": 5.5139758586883545, "epoch": 0.7637880986937591, "grad_norm": 0.9609375, "learning_rate": 0.0004948971747325968, "loss": 5.2971, "mean_token_accuracy": 0.18337151855230333, "num_tokens": 17488730.0, "step": 8420 }, { "entropy": 5.5645856857299805, "epoch": 0.7642416545718432, "grad_norm": 0.98828125, "learning_rate": 0.000494890320525725, "loss": 5.3605, "mean_token_accuracy": 0.18363076001405715, "num_tokens": 17498374.0, "step": 8425 }, { "entropy": 5.513505125045777, "epoch": 0.7646952104499274, "grad_norm": 0.953125, "learning_rate": 0.0004948834617714652, "loss": 5.2246, "mean_token_accuracy": 0.19082147926092147, "num_tokens": 17508601.0, "step": 8430 }, { "entropy": 5.500728511810303, "epoch": 0.7651487663280117, "grad_norm": 0.9765625, "learning_rate": 0.0004948765984699595, "loss": 5.2605, "mean_token_accuracy": 0.1817544087767601, "num_tokens": 17518164.0, "step": 8435 }, { "entropy": 5.560157108306885, "epoch": 0.7656023222060958, "grad_norm": 1.0390625, "learning_rate": 0.0004948697306213494, "loss": 5.2384, "mean_token_accuracy": 0.19223212003707885, "num_tokens": 17527244.0, "step": 8440 }, { "entropy": 5.5458314418792725, "epoch": 0.76605587808418, "grad_norm": 0.98828125, "learning_rate": 0.0004948628582257775, "loss": 5.2992, "mean_token_accuracy": 0.18211422115564346, "num_tokens": 17538045.0, "step": 8445 }, { "entropy": 5.500934314727783, "epoch": 0.7665094339622641, "grad_norm": 0.96875, "learning_rate": 0.0004948559812833857, "loss": 5.2567, "mean_token_accuracy": 0.18168097883462905, "num_tokens": 17547584.0, "step": 8450 }, { "entropy": 5.520407390594483, "epoch": 0.7669629898403484, "grad_norm": 0.88671875, "learning_rate": 0.0004948490997943162, "loss": 5.3063, "mean_token_accuracy": 0.17883863002061845, "num_tokens": 17558925.0, "step": 8455 }, { "entropy": 5.576011705398559, "epoch": 0.7674165457184325, "grad_norm": 1.015625, "learning_rate": 0.0004948422137587111, "loss": 5.3824, "mean_token_accuracy": 0.17435939311981202, "num_tokens": 17569355.0, "step": 8460 }, { "entropy": 5.576209831237793, "epoch": 0.7678701015965167, "grad_norm": 0.8828125, "learning_rate": 0.0004948353231767131, "loss": 5.2571, "mean_token_accuracy": 0.1864034727215767, "num_tokens": 17579782.0, "step": 8465 }, { "entropy": 5.518272352218628, "epoch": 0.7683236574746009, "grad_norm": 0.9296875, "learning_rate": 0.0004948284280484645, "loss": 5.301, "mean_token_accuracy": 0.19304556250572205, "num_tokens": 17589772.0, "step": 8470 }, { "entropy": 5.47354040145874, "epoch": 0.768777213352685, "grad_norm": 1.09375, "learning_rate": 0.0004948215283741081, "loss": 5.2239, "mean_token_accuracy": 0.1867895171046257, "num_tokens": 17599613.0, "step": 8475 }, { "entropy": 5.533515357971192, "epoch": 0.7692307692307693, "grad_norm": 0.99609375, "learning_rate": 0.0004948146241537866, "loss": 5.3134, "mean_token_accuracy": 0.17987559139728546, "num_tokens": 17609056.0, "step": 8480 }, { "entropy": 5.526946115493774, "epoch": 0.7696843251088534, "grad_norm": 0.9609375, "learning_rate": 0.0004948077153876425, "loss": 5.2421, "mean_token_accuracy": 0.1833679959177971, "num_tokens": 17618620.0, "step": 8485 }, { "entropy": 5.498790073394775, "epoch": 0.7701378809869376, "grad_norm": 0.95703125, "learning_rate": 0.0004948008020758188, "loss": 5.2163, "mean_token_accuracy": 0.190741603076458, "num_tokens": 17627630.0, "step": 8490 }, { "entropy": 5.430834245681763, "epoch": 0.7705914368650217, "grad_norm": 0.91015625, "learning_rate": 0.0004947938842184585, "loss": 5.1991, "mean_token_accuracy": 0.1896286591887474, "num_tokens": 17638903.0, "step": 8495 }, { "entropy": 5.4956201076507565, "epoch": 0.771044992743106, "grad_norm": 0.9375, "learning_rate": 0.0004947869618157048, "loss": 5.2584, "mean_token_accuracy": 0.18483953028917313, "num_tokens": 17649257.0, "step": 8500 }, { "entropy": 5.515977144241333, "epoch": 0.7714985486211902, "grad_norm": 0.98046875, "learning_rate": 0.0004947800348677006, "loss": 5.2287, "mean_token_accuracy": 0.189926940202713, "num_tokens": 17659495.0, "step": 8505 }, { "entropy": 5.451489019393921, "epoch": 0.7719521044992743, "grad_norm": 1.0078125, "learning_rate": 0.0004947731033745893, "loss": 5.1979, "mean_token_accuracy": 0.1842445269227028, "num_tokens": 17669671.0, "step": 8510 }, { "entropy": 5.574065208435059, "epoch": 0.7724056603773585, "grad_norm": 0.90234375, "learning_rate": 0.0004947661673365142, "loss": 5.3786, "mean_token_accuracy": 0.1808546781539917, "num_tokens": 17680927.0, "step": 8515 }, { "entropy": 5.518579769134521, "epoch": 0.7728592162554426, "grad_norm": 0.93359375, "learning_rate": 0.0004947592267536188, "loss": 5.2422, "mean_token_accuracy": 0.18695141077041627, "num_tokens": 17691378.0, "step": 8520 }, { "entropy": 5.5204674243927006, "epoch": 0.7733127721335269, "grad_norm": 0.9140625, "learning_rate": 0.0004947522816260466, "loss": 5.327, "mean_token_accuracy": 0.18174126297235488, "num_tokens": 17700942.0, "step": 8525 }, { "entropy": 5.538609600067138, "epoch": 0.773766328011611, "grad_norm": 1.015625, "learning_rate": 0.0004947453319539411, "loss": 5.2441, "mean_token_accuracy": 0.18784799724817275, "num_tokens": 17710076.0, "step": 8530 }, { "entropy": 5.509739780426026, "epoch": 0.7742198838896952, "grad_norm": 0.9140625, "learning_rate": 0.0004947383777374462, "loss": 5.2607, "mean_token_accuracy": 0.18655650168657303, "num_tokens": 17721009.0, "step": 8535 }, { "entropy": 5.4949547290802006, "epoch": 0.7746734397677794, "grad_norm": 0.85546875, "learning_rate": 0.0004947314189767058, "loss": 5.2825, "mean_token_accuracy": 0.18507248163223267, "num_tokens": 17731821.0, "step": 8540 }, { "entropy": 5.481418752670288, "epoch": 0.7751269956458636, "grad_norm": 0.90625, "learning_rate": 0.0004947244556718635, "loss": 5.1695, "mean_token_accuracy": 0.19244110435247422, "num_tokens": 17741425.0, "step": 8545 }, { "entropy": 5.49365496635437, "epoch": 0.7755805515239478, "grad_norm": 0.9296875, "learning_rate": 0.0004947174878230635, "loss": 5.2346, "mean_token_accuracy": 0.18750640451908113, "num_tokens": 17752381.0, "step": 8550 }, { "entropy": 5.427494478225708, "epoch": 0.7760341074020319, "grad_norm": 0.9375, "learning_rate": 0.0004947105154304498, "loss": 5.2263, "mean_token_accuracy": 0.18348337858915328, "num_tokens": 17762768.0, "step": 8555 }, { "entropy": 5.489666557312011, "epoch": 0.7764876632801161, "grad_norm": 0.9296875, "learning_rate": 0.0004947035384941667, "loss": 5.2553, "mean_token_accuracy": 0.1805388867855072, "num_tokens": 17774032.0, "step": 8560 }, { "entropy": 5.582749938964843, "epoch": 0.7769412191582002, "grad_norm": 0.9140625, "learning_rate": 0.0004946965570143584, "loss": 5.3812, "mean_token_accuracy": 0.17563943713903427, "num_tokens": 17785098.0, "step": 8565 }, { "entropy": 5.570175743103027, "epoch": 0.7773947750362845, "grad_norm": 0.98828125, "learning_rate": 0.0004946895709911695, "loss": 5.2531, "mean_token_accuracy": 0.1870201513171196, "num_tokens": 17795487.0, "step": 8570 }, { "entropy": 5.5367103099823, "epoch": 0.7778483309143687, "grad_norm": 0.98828125, "learning_rate": 0.0004946825804247442, "loss": 5.3738, "mean_token_accuracy": 0.17667229026556014, "num_tokens": 17806045.0, "step": 8575 }, { "entropy": 5.615284633636475, "epoch": 0.7783018867924528, "grad_norm": 0.90234375, "learning_rate": 0.000494675585315227, "loss": 5.3441, "mean_token_accuracy": 0.17770788669586182, "num_tokens": 17816948.0, "step": 8580 }, { "entropy": 5.56788387298584, "epoch": 0.778755442670537, "grad_norm": 0.93359375, "learning_rate": 0.0004946685856627628, "loss": 5.2718, "mean_token_accuracy": 0.18811210244894028, "num_tokens": 17826929.0, "step": 8585 }, { "entropy": 5.522318029403687, "epoch": 0.7792089985486212, "grad_norm": 0.90234375, "learning_rate": 0.0004946615814674963, "loss": 5.3625, "mean_token_accuracy": 0.18369622081518172, "num_tokens": 17837780.0, "step": 8590 }, { "entropy": 5.443318319320679, "epoch": 0.7796625544267054, "grad_norm": 1.03125, "learning_rate": 0.0004946545727295724, "loss": 5.1325, "mean_token_accuracy": 0.1949272483587265, "num_tokens": 17847835.0, "step": 8595 }, { "entropy": 5.502077627182007, "epoch": 0.7801161103047896, "grad_norm": 0.9609375, "learning_rate": 0.0004946475594491359, "loss": 5.2175, "mean_token_accuracy": 0.19205821305513382, "num_tokens": 17858324.0, "step": 8600 }, { "entropy": 5.500710916519165, "epoch": 0.7805696661828737, "grad_norm": 1.0, "learning_rate": 0.0004946405416263319, "loss": 5.2842, "mean_token_accuracy": 0.17803624123334885, "num_tokens": 17868455.0, "step": 8605 }, { "entropy": 5.545377159118653, "epoch": 0.7810232220609579, "grad_norm": 0.890625, "learning_rate": 0.0004946335192613054, "loss": 5.2662, "mean_token_accuracy": 0.18817005157470704, "num_tokens": 17879038.0, "step": 8610 }, { "entropy": 5.456969118118286, "epoch": 0.7814767779390421, "grad_norm": 0.8671875, "learning_rate": 0.0004946264923542019, "loss": 5.1368, "mean_token_accuracy": 0.19142608642578124, "num_tokens": 17888153.0, "step": 8615 }, { "entropy": 5.476630306243896, "epoch": 0.7819303338171263, "grad_norm": 0.96484375, "learning_rate": 0.0004946194609051664, "loss": 5.262, "mean_token_accuracy": 0.18682017773389817, "num_tokens": 17898289.0, "step": 8620 }, { "entropy": 5.496731328964233, "epoch": 0.7823838896952104, "grad_norm": 0.859375, "learning_rate": 0.0004946124249143447, "loss": 5.2527, "mean_token_accuracy": 0.18772162050008773, "num_tokens": 17909192.0, "step": 8625 }, { "entropy": 5.486784315109253, "epoch": 0.7828374455732946, "grad_norm": 0.88671875, "learning_rate": 0.000494605384381882, "loss": 5.2113, "mean_token_accuracy": 0.18046634793281555, "num_tokens": 17918937.0, "step": 8630 }, { "entropy": 5.44954481124878, "epoch": 0.7832910014513788, "grad_norm": 0.92578125, "learning_rate": 0.0004945983393079239, "loss": 5.2437, "mean_token_accuracy": 0.19104671776294707, "num_tokens": 17929346.0, "step": 8635 }, { "entropy": 5.5133326053619385, "epoch": 0.783744557329463, "grad_norm": 0.921875, "learning_rate": 0.0004945912896926163, "loss": 5.2583, "mean_token_accuracy": 0.18662541210651398, "num_tokens": 17939479.0, "step": 8640 }, { "entropy": 5.582485771179199, "epoch": 0.7841981132075472, "grad_norm": 0.921875, "learning_rate": 0.0004945842355361049, "loss": 5.3415, "mean_token_accuracy": 0.1828889235854149, "num_tokens": 17949841.0, "step": 8645 }, { "entropy": 5.457309579849243, "epoch": 0.7846516690856313, "grad_norm": 0.99609375, "learning_rate": 0.0004945771768385355, "loss": 5.2602, "mean_token_accuracy": 0.19243107438087464, "num_tokens": 17960334.0, "step": 8650 }, { "entropy": 5.485492467880249, "epoch": 0.7851052249637155, "grad_norm": 0.8984375, "learning_rate": 0.000494570113600054, "loss": 5.2071, "mean_token_accuracy": 0.19041529893875123, "num_tokens": 17970595.0, "step": 8655 }, { "entropy": 5.548058986663818, "epoch": 0.7855587808417998, "grad_norm": 0.87890625, "learning_rate": 0.0004945630458208068, "loss": 5.3477, "mean_token_accuracy": 0.17438185960054398, "num_tokens": 17981301.0, "step": 8660 }, { "entropy": 5.470705938339234, "epoch": 0.7860123367198839, "grad_norm": 0.921875, "learning_rate": 0.0004945559735009397, "loss": 5.1765, "mean_token_accuracy": 0.19010596424341203, "num_tokens": 17991262.0, "step": 8665 }, { "entropy": 5.533977603912353, "epoch": 0.7864658925979681, "grad_norm": 0.90234375, "learning_rate": 0.0004945488966405993, "loss": 5.2227, "mean_token_accuracy": 0.18723469227552414, "num_tokens": 18001212.0, "step": 8670 }, { "entropy": 5.502318048477173, "epoch": 0.7869194484760522, "grad_norm": 0.94140625, "learning_rate": 0.0004945418152399317, "loss": 5.2378, "mean_token_accuracy": 0.1913598209619522, "num_tokens": 18010432.0, "step": 8675 }, { "entropy": 5.518057823181152, "epoch": 0.7873730043541364, "grad_norm": 0.92578125, "learning_rate": 0.0004945347292990833, "loss": 5.2782, "mean_token_accuracy": 0.18441058844327926, "num_tokens": 18020902.0, "step": 8680 }, { "entropy": 5.491929054260254, "epoch": 0.7878265602322206, "grad_norm": 0.96484375, "learning_rate": 0.0004945276388182008, "loss": 5.1539, "mean_token_accuracy": 0.1898062765598297, "num_tokens": 18031133.0, "step": 8685 }, { "entropy": 5.53517780303955, "epoch": 0.7882801161103048, "grad_norm": 0.9140625, "learning_rate": 0.0004945205437974309, "loss": 5.255, "mean_token_accuracy": 0.18925394713878632, "num_tokens": 18042050.0, "step": 8690 }, { "entropy": 5.424103832244873, "epoch": 0.788733671988389, "grad_norm": 0.97265625, "learning_rate": 0.0004945134442369201, "loss": 5.2306, "mean_token_accuracy": 0.1864193484187126, "num_tokens": 18051642.0, "step": 8695 }, { "entropy": 5.54458270072937, "epoch": 0.7891872278664731, "grad_norm": 1.0625, "learning_rate": 0.0004945063401368154, "loss": 5.2821, "mean_token_accuracy": 0.17556448727846147, "num_tokens": 18062180.0, "step": 8700 }, { "entropy": 5.519570016860962, "epoch": 0.7896407837445574, "grad_norm": 0.953125, "learning_rate": 0.0004944992314972637, "loss": 5.2274, "mean_token_accuracy": 0.18374626189470292, "num_tokens": 18072302.0, "step": 8705 }, { "entropy": 5.469928026199341, "epoch": 0.7900943396226415, "grad_norm": 0.9453125, "learning_rate": 0.0004944921183184118, "loss": 5.2358, "mean_token_accuracy": 0.19111284017562866, "num_tokens": 18081824.0, "step": 8710 }, { "entropy": 5.518294858932495, "epoch": 0.7905478955007257, "grad_norm": 0.9453125, "learning_rate": 0.000494485000600407, "loss": 5.2924, "mean_token_accuracy": 0.188755401968956, "num_tokens": 18092696.0, "step": 8715 }, { "entropy": 5.5013707160949705, "epoch": 0.7910014513788098, "grad_norm": 1.0, "learning_rate": 0.0004944778783433965, "loss": 5.1994, "mean_token_accuracy": 0.19762906432151794, "num_tokens": 18101790.0, "step": 8720 }, { "entropy": 5.563456010818482, "epoch": 0.791455007256894, "grad_norm": 0.8828125, "learning_rate": 0.0004944707515475276, "loss": 5.3227, "mean_token_accuracy": 0.18671682476997375, "num_tokens": 18111572.0, "step": 8725 }, { "entropy": 5.548861169815064, "epoch": 0.7919085631349783, "grad_norm": 0.94140625, "learning_rate": 0.0004944636202129475, "loss": 5.3125, "mean_token_accuracy": 0.1888110116124153, "num_tokens": 18120650.0, "step": 8730 }, { "entropy": 5.486426162719726, "epoch": 0.7923621190130624, "grad_norm": 0.94140625, "learning_rate": 0.0004944564843398039, "loss": 5.1831, "mean_token_accuracy": 0.1958876892924309, "num_tokens": 18131055.0, "step": 8735 }, { "entropy": 5.5568522930145265, "epoch": 0.7928156748911466, "grad_norm": 0.9921875, "learning_rate": 0.0004944493439282443, "loss": 5.292, "mean_token_accuracy": 0.18856184631586076, "num_tokens": 18141423.0, "step": 8740 }, { "entropy": 5.456881761550903, "epoch": 0.7932692307692307, "grad_norm": 0.93359375, "learning_rate": 0.0004944421989784162, "loss": 5.2098, "mean_token_accuracy": 0.18828487694263457, "num_tokens": 18152015.0, "step": 8745 }, { "entropy": 5.548474550247192, "epoch": 0.793722786647315, "grad_norm": 0.94921875, "learning_rate": 0.0004944350494904676, "loss": 5.3002, "mean_token_accuracy": 0.18480850607156754, "num_tokens": 18161934.0, "step": 8750 }, { "entropy": 5.479960775375366, "epoch": 0.7941763425253991, "grad_norm": 0.90625, "learning_rate": 0.0004944278954645463, "loss": 5.2243, "mean_token_accuracy": 0.18462625294923782, "num_tokens": 18172287.0, "step": 8755 }, { "entropy": 5.498562955856324, "epoch": 0.7946298984034833, "grad_norm": 1.046875, "learning_rate": 0.0004944207369008002, "loss": 5.2699, "mean_token_accuracy": 0.1924784377217293, "num_tokens": 18181015.0, "step": 8760 }, { "entropy": 5.600859260559082, "epoch": 0.7950834542815675, "grad_norm": 0.859375, "learning_rate": 0.0004944135737993773, "loss": 5.3619, "mean_token_accuracy": 0.1822371244430542, "num_tokens": 18192382.0, "step": 8765 }, { "entropy": 5.50996584892273, "epoch": 0.7955370101596516, "grad_norm": 0.95703125, "learning_rate": 0.0004944064061604258, "loss": 5.2123, "mean_token_accuracy": 0.19568186849355698, "num_tokens": 18202597.0, "step": 8770 }, { "entropy": 5.5370594501495365, "epoch": 0.7959905660377359, "grad_norm": 0.890625, "learning_rate": 0.0004943992339840939, "loss": 5.2795, "mean_token_accuracy": 0.1780181646347046, "num_tokens": 18213756.0, "step": 8775 }, { "entropy": 5.419239091873169, "epoch": 0.79644412191582, "grad_norm": 0.8984375, "learning_rate": 0.00049439205727053, "loss": 5.2022, "mean_token_accuracy": 0.18264902830123902, "num_tokens": 18223669.0, "step": 8780 }, { "entropy": 5.498378324508667, "epoch": 0.7968976777939042, "grad_norm": 0.8984375, "learning_rate": 0.0004943848760198823, "loss": 5.2325, "mean_token_accuracy": 0.19068809002637863, "num_tokens": 18234884.0, "step": 8785 }, { "entropy": 5.486072826385498, "epoch": 0.7973512336719883, "grad_norm": 0.921875, "learning_rate": 0.0004943776902322995, "loss": 5.1603, "mean_token_accuracy": 0.19515904933214187, "num_tokens": 18245155.0, "step": 8790 }, { "entropy": 5.39517731666565, "epoch": 0.7978047895500726, "grad_norm": 0.8828125, "learning_rate": 0.0004943704999079302, "loss": 5.1019, "mean_token_accuracy": 0.2020408481359482, "num_tokens": 18254686.0, "step": 8795 }, { "entropy": 5.470184278488159, "epoch": 0.7982583454281568, "grad_norm": 0.8671875, "learning_rate": 0.0004943633050469231, "loss": 5.1363, "mean_token_accuracy": 0.1927419751882553, "num_tokens": 18265473.0, "step": 8800 }, { "entropy": 5.523016786575317, "epoch": 0.7987119013062409, "grad_norm": 0.96875, "learning_rate": 0.0004943561056494269, "loss": 5.3438, "mean_token_accuracy": 0.18321252465248108, "num_tokens": 18276024.0, "step": 8805 }, { "entropy": 5.513629722595215, "epoch": 0.7991654571843251, "grad_norm": 1.0859375, "learning_rate": 0.0004943489017155906, "loss": 5.3079, "mean_token_accuracy": 0.17381245493888856, "num_tokens": 18287261.0, "step": 8810 }, { "entropy": 5.530607414245606, "epoch": 0.7996190130624092, "grad_norm": 0.85546875, "learning_rate": 0.0004943416932455631, "loss": 5.3088, "mean_token_accuracy": 0.186485455930233, "num_tokens": 18299374.0, "step": 8815 }, { "entropy": 5.456578254699707, "epoch": 0.8000725689404935, "grad_norm": 0.98046875, "learning_rate": 0.0004943344802394935, "loss": 5.2843, "mean_token_accuracy": 0.1819461315870285, "num_tokens": 18309344.0, "step": 8820 }, { "entropy": 5.578178882598877, "epoch": 0.8005261248185777, "grad_norm": 0.91015625, "learning_rate": 0.0004943272626975309, "loss": 5.2664, "mean_token_accuracy": 0.18679665625095368, "num_tokens": 18319778.0, "step": 8825 }, { "entropy": 5.534620904922486, "epoch": 0.8009796806966618, "grad_norm": 1.0234375, "learning_rate": 0.0004943200406198246, "loss": 5.2527, "mean_token_accuracy": 0.18746354728937148, "num_tokens": 18329787.0, "step": 8830 }, { "entropy": 5.45460352897644, "epoch": 0.801433236574746, "grad_norm": 0.92578125, "learning_rate": 0.000494312814006524, "loss": 5.2254, "mean_token_accuracy": 0.19326054751873017, "num_tokens": 18340670.0, "step": 8835 }, { "entropy": 5.486133813858032, "epoch": 0.8018867924528302, "grad_norm": 0.8984375, "learning_rate": 0.0004943055828577784, "loss": 5.2071, "mean_token_accuracy": 0.18043867200613023, "num_tokens": 18352484.0, "step": 8840 }, { "entropy": 5.4944739818573, "epoch": 0.8023403483309144, "grad_norm": 0.94921875, "learning_rate": 0.0004942983471737376, "loss": 5.1898, "mean_token_accuracy": 0.1878673404455185, "num_tokens": 18363103.0, "step": 8845 }, { "entropy": 5.427543020248413, "epoch": 0.8027939042089985, "grad_norm": 0.96875, "learning_rate": 0.0004942911069545511, "loss": 5.2345, "mean_token_accuracy": 0.1885596677660942, "num_tokens": 18373925.0, "step": 8850 }, { "entropy": 5.503770256042481, "epoch": 0.8032474600870827, "grad_norm": 0.9453125, "learning_rate": 0.0004942838622003686, "loss": 5.3038, "mean_token_accuracy": 0.18221967965364455, "num_tokens": 18384081.0, "step": 8855 }, { "entropy": 5.5707417011260985, "epoch": 0.8037010159651669, "grad_norm": 1.015625, "learning_rate": 0.0004942766129113399, "loss": 5.1835, "mean_token_accuracy": 0.18571112006902696, "num_tokens": 18392510.0, "step": 8860 }, { "entropy": 5.6038836479187015, "epoch": 0.8041545718432511, "grad_norm": 0.9921875, "learning_rate": 0.0004942693590876151, "loss": 5.3186, "mean_token_accuracy": 0.18732109665870667, "num_tokens": 18402809.0, "step": 8865 }, { "entropy": 5.571398639678955, "epoch": 0.8046081277213353, "grad_norm": 1.0703125, "learning_rate": 0.000494262100729344, "loss": 5.3388, "mean_token_accuracy": 0.18695981055498123, "num_tokens": 18413342.0, "step": 8870 }, { "entropy": 5.530296659469604, "epoch": 0.8050616835994194, "grad_norm": 0.859375, "learning_rate": 0.0004942548378366768, "loss": 5.3305, "mean_token_accuracy": 0.18433057516813278, "num_tokens": 18424735.0, "step": 8875 }, { "entropy": 5.518608522415161, "epoch": 0.8055152394775036, "grad_norm": 0.87890625, "learning_rate": 0.0004942475704097635, "loss": 5.2385, "mean_token_accuracy": 0.18847633004188538, "num_tokens": 18434797.0, "step": 8880 }, { "entropy": 5.474301147460937, "epoch": 0.8059687953555879, "grad_norm": 0.921875, "learning_rate": 0.0004942402984487548, "loss": 5.2676, "mean_token_accuracy": 0.1808571606874466, "num_tokens": 18445456.0, "step": 8885 }, { "entropy": 5.495883464813232, "epoch": 0.806422351233672, "grad_norm": 0.97265625, "learning_rate": 0.0004942330219538008, "loss": 5.2401, "mean_token_accuracy": 0.18492464423179628, "num_tokens": 18456728.0, "step": 8890 }, { "entropy": 5.701735019683838, "epoch": 0.8068759071117562, "grad_norm": 1.109375, "learning_rate": 0.000494225740925052, "loss": 5.3843, "mean_token_accuracy": 0.18247078955173493, "num_tokens": 18468813.0, "step": 8895 }, { "entropy": 5.576275253295899, "epoch": 0.8073294629898403, "grad_norm": 0.98046875, "learning_rate": 0.0004942184553626591, "loss": 5.2811, "mean_token_accuracy": 0.18496292531490327, "num_tokens": 18477912.0, "step": 8900 }, { "entropy": 5.4743218421936035, "epoch": 0.8077830188679245, "grad_norm": 0.95703125, "learning_rate": 0.0004942111652667726, "loss": 5.2282, "mean_token_accuracy": 0.19448551237583162, "num_tokens": 18488115.0, "step": 8905 }, { "entropy": 5.5077948570251465, "epoch": 0.8082365747460087, "grad_norm": 0.9453125, "learning_rate": 0.0004942038706375433, "loss": 5.2667, "mean_token_accuracy": 0.18090982586145402, "num_tokens": 18498853.0, "step": 8910 }, { "entropy": 5.5216956615448, "epoch": 0.8086901306240929, "grad_norm": 0.83984375, "learning_rate": 0.0004941965714751222, "loss": 5.3132, "mean_token_accuracy": 0.18184340447187425, "num_tokens": 18510047.0, "step": 8915 }, { "entropy": 5.518053579330444, "epoch": 0.809143686502177, "grad_norm": 1.0, "learning_rate": 0.0004941892677796601, "loss": 5.2792, "mean_token_accuracy": 0.18840029388666152, "num_tokens": 18519673.0, "step": 8920 }, { "entropy": 5.470839023590088, "epoch": 0.8095972423802612, "grad_norm": 0.89453125, "learning_rate": 0.0004941819595513081, "loss": 5.2919, "mean_token_accuracy": 0.18582451194524766, "num_tokens": 18530090.0, "step": 8925 }, { "entropy": 5.61807107925415, "epoch": 0.8100507982583455, "grad_norm": 0.8359375, "learning_rate": 0.0004941746467902173, "loss": 5.3426, "mean_token_accuracy": 0.18165055215358733, "num_tokens": 18541862.0, "step": 8930 }, { "entropy": 5.5928370475769045, "epoch": 0.8105043541364296, "grad_norm": 0.921875, "learning_rate": 0.000494167329496539, "loss": 5.336, "mean_token_accuracy": 0.17665406912565232, "num_tokens": 18551624.0, "step": 8935 }, { "entropy": 5.498425483703613, "epoch": 0.8109579100145138, "grad_norm": 1.0234375, "learning_rate": 0.0004941600076704244, "loss": 5.2709, "mean_token_accuracy": 0.18561748266220093, "num_tokens": 18561784.0, "step": 8940 }, { "entropy": 5.549371147155762, "epoch": 0.8114114658925979, "grad_norm": 0.984375, "learning_rate": 0.0004941526813120251, "loss": 5.3371, "mean_token_accuracy": 0.18125243335962296, "num_tokens": 18572110.0, "step": 8945 }, { "entropy": 5.547827100753784, "epoch": 0.8118650217706821, "grad_norm": 1.015625, "learning_rate": 0.0004941453504214924, "loss": 5.2792, "mean_token_accuracy": 0.17551750242710112, "num_tokens": 18582012.0, "step": 8950 }, { "entropy": 5.443738269805908, "epoch": 0.8123185776487664, "grad_norm": 0.9453125, "learning_rate": 0.0004941380149989781, "loss": 5.1279, "mean_token_accuracy": 0.1954687461256981, "num_tokens": 18592850.0, "step": 8955 }, { "entropy": 5.469958543777466, "epoch": 0.8127721335268505, "grad_norm": 0.9296875, "learning_rate": 0.0004941306750446336, "loss": 5.3026, "mean_token_accuracy": 0.18596144616603852, "num_tokens": 18602590.0, "step": 8960 }, { "entropy": 5.473424339294434, "epoch": 0.8132256894049347, "grad_norm": 1.0, "learning_rate": 0.000494123330558611, "loss": 5.1992, "mean_token_accuracy": 0.1891501232981682, "num_tokens": 18612607.0, "step": 8965 }, { "entropy": 5.497609806060791, "epoch": 0.8136792452830188, "grad_norm": 0.90234375, "learning_rate": 0.0004941159815410622, "loss": 5.1835, "mean_token_accuracy": 0.19193311184644699, "num_tokens": 18622936.0, "step": 8970 }, { "entropy": 5.518314170837402, "epoch": 0.8141328011611031, "grad_norm": 1.046875, "learning_rate": 0.000494108627992139, "loss": 5.3462, "mean_token_accuracy": 0.17709500193595887, "num_tokens": 18633997.0, "step": 8975 }, { "entropy": 5.47372260093689, "epoch": 0.8145863570391872, "grad_norm": 0.94140625, "learning_rate": 0.0004941012699119936, "loss": 5.183, "mean_token_accuracy": 0.19488824605941774, "num_tokens": 18644347.0, "step": 8980 }, { "entropy": 5.532529067993164, "epoch": 0.8150399129172714, "grad_norm": 0.9296875, "learning_rate": 0.0004940939073007779, "loss": 5.2676, "mean_token_accuracy": 0.18627604395151137, "num_tokens": 18654989.0, "step": 8985 }, { "entropy": 5.508123207092285, "epoch": 0.8154934687953556, "grad_norm": 0.93359375, "learning_rate": 0.0004940865401586446, "loss": 5.2336, "mean_token_accuracy": 0.1885010004043579, "num_tokens": 18665526.0, "step": 8990 }, { "entropy": 5.4809952735900875, "epoch": 0.8159470246734397, "grad_norm": 0.9453125, "learning_rate": 0.0004940791684857458, "loss": 5.2181, "mean_token_accuracy": 0.1932695686817169, "num_tokens": 18676226.0, "step": 8995 }, { "entropy": 5.489676904678345, "epoch": 0.816400580551524, "grad_norm": 0.9140625, "learning_rate": 0.0004940717922822339, "loss": 5.1614, "mean_token_accuracy": 0.1885027691721916, "num_tokens": 18686499.0, "step": 9000 }, { "epoch": 0.816400580551524, "eval_entropy": 5.369530144104591, "eval_loss": 5.262591361999512, "eval_mean_token_accuracy": 0.19346466002421142, "eval_num_tokens": 18686499.0, "eval_runtime": 20.8639, "eval_samples_per_second": 1694.795, "eval_steps_per_second": 211.849, "step": 9000 }, { "entropy": 5.573095512390137, "epoch": 0.8168541364296081, "grad_norm": 0.87109375, "learning_rate": 0.0004940644115482615, "loss": 5.2266, "mean_token_accuracy": 0.18318518102169037, "num_tokens": 18696543.0, "step": 9005 }, { "entropy": 5.455431079864502, "epoch": 0.8173076923076923, "grad_norm": 0.953125, "learning_rate": 0.0004940570262839812, "loss": 5.2858, "mean_token_accuracy": 0.18343722075223923, "num_tokens": 18707029.0, "step": 9010 }, { "entropy": 5.486490535736084, "epoch": 0.8177612481857764, "grad_norm": 0.9921875, "learning_rate": 0.0004940496364895457, "loss": 5.2753, "mean_token_accuracy": 0.18756048530340194, "num_tokens": 18716937.0, "step": 9015 }, { "entropy": 5.61928539276123, "epoch": 0.8182148040638607, "grad_norm": 0.9296875, "learning_rate": 0.0004940422421651082, "loss": 5.2611, "mean_token_accuracy": 0.18611169457435608, "num_tokens": 18727478.0, "step": 9020 }, { "entropy": 5.478516626358032, "epoch": 0.8186683599419449, "grad_norm": 1.0234375, "learning_rate": 0.0004940348433108211, "loss": 5.177, "mean_token_accuracy": 0.18611731976270676, "num_tokens": 18737339.0, "step": 9025 }, { "entropy": 5.460969638824463, "epoch": 0.819121915820029, "grad_norm": 0.875, "learning_rate": 0.0004940274399268377, "loss": 5.3027, "mean_token_accuracy": 0.18202684968709945, "num_tokens": 18747810.0, "step": 9030 }, { "entropy": 5.50574049949646, "epoch": 0.8195754716981132, "grad_norm": 0.98828125, "learning_rate": 0.0004940200320133109, "loss": 5.2689, "mean_token_accuracy": 0.18433540016412736, "num_tokens": 18757564.0, "step": 9035 }, { "entropy": 5.58858289718628, "epoch": 0.8200290275761973, "grad_norm": 0.9609375, "learning_rate": 0.0004940126195703941, "loss": 5.2907, "mean_token_accuracy": 0.17852483838796615, "num_tokens": 18768196.0, "step": 9040 }, { "entropy": 5.563227224349975, "epoch": 0.8204825834542816, "grad_norm": 0.9140625, "learning_rate": 0.0004940052025982405, "loss": 5.2627, "mean_token_accuracy": 0.19672567546367645, "num_tokens": 18778350.0, "step": 9045 }, { "entropy": 5.480757808685302, "epoch": 0.8209361393323658, "grad_norm": 1.046875, "learning_rate": 0.0004939977810970035, "loss": 5.2175, "mean_token_accuracy": 0.18037040233612062, "num_tokens": 18789825.0, "step": 9050 }, { "entropy": 5.474230337142944, "epoch": 0.8213896952104499, "grad_norm": 1.015625, "learning_rate": 0.0004939903550668366, "loss": 5.2226, "mean_token_accuracy": 0.18781944513320922, "num_tokens": 18799793.0, "step": 9055 }, { "entropy": 5.498127698898315, "epoch": 0.8218432510885341, "grad_norm": 0.89453125, "learning_rate": 0.0004939829245078934, "loss": 5.2642, "mean_token_accuracy": 0.1901239588856697, "num_tokens": 18809771.0, "step": 9060 }, { "entropy": 5.501215839385987, "epoch": 0.8222968069666183, "grad_norm": 0.98046875, "learning_rate": 0.0004939754894203275, "loss": 5.2714, "mean_token_accuracy": 0.1833363428711891, "num_tokens": 18820529.0, "step": 9065 }, { "entropy": 5.4365602970123295, "epoch": 0.8227503628447025, "grad_norm": 0.984375, "learning_rate": 0.0004939680498042926, "loss": 5.1891, "mean_token_accuracy": 0.19763432294130326, "num_tokens": 18830797.0, "step": 9070 }, { "entropy": 5.490671968460083, "epoch": 0.8232039187227866, "grad_norm": 1.0390625, "learning_rate": 0.0004939606056599428, "loss": 5.1978, "mean_token_accuracy": 0.18469800502061845, "num_tokens": 18840526.0, "step": 9075 }, { "entropy": 5.4513916015625, "epoch": 0.8236574746008708, "grad_norm": 0.90625, "learning_rate": 0.0004939531569874316, "loss": 5.2314, "mean_token_accuracy": 0.1814821556210518, "num_tokens": 18851201.0, "step": 9080 }, { "entropy": 5.403475999832153, "epoch": 0.824111030478955, "grad_norm": 1.0078125, "learning_rate": 0.0004939457037869135, "loss": 5.0451, "mean_token_accuracy": 0.207870976626873, "num_tokens": 18861676.0, "step": 9085 }, { "entropy": 5.449726533889771, "epoch": 0.8245645863570392, "grad_norm": 0.9609375, "learning_rate": 0.0004939382460585424, "loss": 5.1931, "mean_token_accuracy": 0.18134815692901612, "num_tokens": 18872669.0, "step": 9090 }, { "entropy": 5.451654291152954, "epoch": 0.8250181422351234, "grad_norm": 0.97265625, "learning_rate": 0.0004939307838024726, "loss": 5.2454, "mean_token_accuracy": 0.18319953382015228, "num_tokens": 18882130.0, "step": 9095 }, { "entropy": 5.457068681716919, "epoch": 0.8254716981132075, "grad_norm": 0.95703125, "learning_rate": 0.0004939233170188585, "loss": 5.2186, "mean_token_accuracy": 0.18625770807266234, "num_tokens": 18892457.0, "step": 9100 }, { "entropy": 5.556639909744263, "epoch": 0.8259252539912917, "grad_norm": 0.95703125, "learning_rate": 0.0004939158457078543, "loss": 5.2405, "mean_token_accuracy": 0.18714095652103424, "num_tokens": 18903152.0, "step": 9105 }, { "entropy": 5.496951627731323, "epoch": 0.826378809869376, "grad_norm": 0.9765625, "learning_rate": 0.0004939083698696146, "loss": 5.208, "mean_token_accuracy": 0.18759516775608062, "num_tokens": 18913740.0, "step": 9110 }, { "entropy": 5.478869867324829, "epoch": 0.8268323657474601, "grad_norm": 0.98046875, "learning_rate": 0.000493900889504294, "loss": 5.2528, "mean_token_accuracy": 0.1898530900478363, "num_tokens": 18923501.0, "step": 9115 }, { "entropy": 5.482793998718262, "epoch": 0.8272859216255443, "grad_norm": 1.0390625, "learning_rate": 0.0004938934046120473, "loss": 5.238, "mean_token_accuracy": 0.18646990209817887, "num_tokens": 18933255.0, "step": 9120 }, { "entropy": 5.451048803329468, "epoch": 0.8277394775036284, "grad_norm": 1.046875, "learning_rate": 0.0004938859151930293, "loss": 5.2061, "mean_token_accuracy": 0.18621120303869249, "num_tokens": 18943649.0, "step": 9125 }, { "entropy": 5.4907585144042965, "epoch": 0.8281930333817126, "grad_norm": 1.0078125, "learning_rate": 0.0004938784212473947, "loss": 5.1236, "mean_token_accuracy": 0.1988166391849518, "num_tokens": 18953187.0, "step": 9130 }, { "entropy": 5.570322036743164, "epoch": 0.8286465892597968, "grad_norm": 0.96875, "learning_rate": 0.0004938709227752985, "loss": 5.2262, "mean_token_accuracy": 0.19010987728834153, "num_tokens": 18963015.0, "step": 9135 }, { "entropy": 5.494019985198975, "epoch": 0.829100145137881, "grad_norm": 0.91015625, "learning_rate": 0.000493863419776896, "loss": 5.2711, "mean_token_accuracy": 0.18064223527908324, "num_tokens": 18974184.0, "step": 9140 }, { "entropy": 5.450629234313965, "epoch": 0.8295537010159652, "grad_norm": 0.984375, "learning_rate": 0.0004938559122523421, "loss": 5.2186, "mean_token_accuracy": 0.1903683364391327, "num_tokens": 18985036.0, "step": 9145 }, { "entropy": 5.573251056671142, "epoch": 0.8300072568940493, "grad_norm": 0.89453125, "learning_rate": 0.0004938484002017921, "loss": 5.3258, "mean_token_accuracy": 0.18096655309200288, "num_tokens": 18995237.0, "step": 9150 }, { "entropy": 5.539033031463623, "epoch": 0.8304608127721336, "grad_norm": 0.8828125, "learning_rate": 0.0004938408836254015, "loss": 5.3335, "mean_token_accuracy": 0.17874883860349655, "num_tokens": 19006272.0, "step": 9155 }, { "entropy": 5.459480285644531, "epoch": 0.8309143686502177, "grad_norm": 0.93359375, "learning_rate": 0.0004938333625233258, "loss": 5.2308, "mean_token_accuracy": 0.18578039556741716, "num_tokens": 19016728.0, "step": 9160 }, { "entropy": 5.545877456665039, "epoch": 0.8313679245283019, "grad_norm": 0.91015625, "learning_rate": 0.0004938258368957202, "loss": 5.2922, "mean_token_accuracy": 0.17642530798912048, "num_tokens": 19028024.0, "step": 9165 }, { "entropy": 5.562115573883057, "epoch": 0.831821480406386, "grad_norm": 0.95703125, "learning_rate": 0.0004938183067427406, "loss": 5.2373, "mean_token_accuracy": 0.1918642923235893, "num_tokens": 19038218.0, "step": 9170 }, { "entropy": 5.454094696044922, "epoch": 0.8322750362844702, "grad_norm": 1.078125, "learning_rate": 0.0004938107720645426, "loss": 5.2595, "mean_token_accuracy": 0.18231881111860276, "num_tokens": 19048574.0, "step": 9175 }, { "entropy": 5.495149421691894, "epoch": 0.8327285921625545, "grad_norm": 0.96484375, "learning_rate": 0.0004938032328612821, "loss": 5.2385, "mean_token_accuracy": 0.1852733686566353, "num_tokens": 19057721.0, "step": 9180 }, { "entropy": 5.491014194488526, "epoch": 0.8331821480406386, "grad_norm": 0.984375, "learning_rate": 0.000493795689133115, "loss": 5.2183, "mean_token_accuracy": 0.17995734810829161, "num_tokens": 19067582.0, "step": 9185 }, { "entropy": 5.468677616119384, "epoch": 0.8336357039187228, "grad_norm": 0.8671875, "learning_rate": 0.0004937881408801974, "loss": 5.1722, "mean_token_accuracy": 0.1918642297387123, "num_tokens": 19077896.0, "step": 9190 }, { "entropy": 5.4998781204223635, "epoch": 0.8340892597968069, "grad_norm": 0.94140625, "learning_rate": 0.000493780588102685, "loss": 5.2799, "mean_token_accuracy": 0.19266057163476943, "num_tokens": 19088082.0, "step": 9195 }, { "entropy": 5.577761936187744, "epoch": 0.8345428156748912, "grad_norm": 0.91796875, "learning_rate": 0.0004937730308007346, "loss": 5.2969, "mean_token_accuracy": 0.18470134884119033, "num_tokens": 19097176.0, "step": 9200 }, { "entropy": 5.499684047698975, "epoch": 0.8349963715529753, "grad_norm": 0.97265625, "learning_rate": 0.0004937654689745021, "loss": 5.1837, "mean_token_accuracy": 0.19089347273111343, "num_tokens": 19107835.0, "step": 9205 }, { "entropy": 5.430692720413208, "epoch": 0.8354499274310595, "grad_norm": 0.97265625, "learning_rate": 0.0004937579026241439, "loss": 5.2017, "mean_token_accuracy": 0.1925992026925087, "num_tokens": 19118028.0, "step": 9210 }, { "entropy": 5.486698341369629, "epoch": 0.8359034833091437, "grad_norm": 0.91015625, "learning_rate": 0.0004937503317498165, "loss": 5.2276, "mean_token_accuracy": 0.19192424416542053, "num_tokens": 19129223.0, "step": 9215 }, { "entropy": 5.497008609771728, "epoch": 0.8363570391872278, "grad_norm": 0.87109375, "learning_rate": 0.0004937427563516765, "loss": 5.3335, "mean_token_accuracy": 0.18186921924352645, "num_tokens": 19140048.0, "step": 9220 }, { "entropy": 5.568466663360596, "epoch": 0.8368105950653121, "grad_norm": 0.91796875, "learning_rate": 0.0004937351764298805, "loss": 5.2985, "mean_token_accuracy": 0.1766539365053177, "num_tokens": 19150853.0, "step": 9225 }, { "entropy": 5.551784181594849, "epoch": 0.8372641509433962, "grad_norm": 0.96875, "learning_rate": 0.0004937275919845855, "loss": 5.2839, "mean_token_accuracy": 0.18331123888492584, "num_tokens": 19161645.0, "step": 9230 }, { "entropy": 5.518892812728882, "epoch": 0.8377177068214804, "grad_norm": 0.8671875, "learning_rate": 0.0004937200030159481, "loss": 5.3715, "mean_token_accuracy": 0.17670943588018417, "num_tokens": 19173276.0, "step": 9235 }, { "entropy": 5.517861652374267, "epoch": 0.8381712626995645, "grad_norm": 0.90625, "learning_rate": 0.0004937124095241252, "loss": 5.248, "mean_token_accuracy": 0.19307708144187927, "num_tokens": 19182949.0, "step": 9240 }, { "entropy": 5.553634691238403, "epoch": 0.8386248185776488, "grad_norm": 0.9375, "learning_rate": 0.0004937048115092739, "loss": 5.2414, "mean_token_accuracy": 0.18353976160287858, "num_tokens": 19193504.0, "step": 9245 }, { "entropy": 5.5102275848388675, "epoch": 0.839078374455733, "grad_norm": 0.984375, "learning_rate": 0.0004936972089715515, "loss": 5.3207, "mean_token_accuracy": 0.18096430003643035, "num_tokens": 19203406.0, "step": 9250 }, { "entropy": 5.4884428024292, "epoch": 0.8395319303338171, "grad_norm": 0.92578125, "learning_rate": 0.000493689601911115, "loss": 5.2644, "mean_token_accuracy": 0.18698281645774842, "num_tokens": 19214325.0, "step": 9255 }, { "entropy": 5.499520349502563, "epoch": 0.8399854862119013, "grad_norm": 0.94921875, "learning_rate": 0.0004936819903281219, "loss": 5.3032, "mean_token_accuracy": 0.17399130165576934, "num_tokens": 19226466.0, "step": 9260 }, { "entropy": 5.601823616027832, "epoch": 0.8404390420899854, "grad_norm": 0.91796875, "learning_rate": 0.0004936743742227295, "loss": 5.3281, "mean_token_accuracy": 0.1854452520608902, "num_tokens": 19237032.0, "step": 9265 }, { "entropy": 5.55287766456604, "epoch": 0.8408925979680697, "grad_norm": 0.94921875, "learning_rate": 0.0004936667535950952, "loss": 5.3213, "mean_token_accuracy": 0.1790757581591606, "num_tokens": 19248009.0, "step": 9270 }, { "entropy": 5.548722505569458, "epoch": 0.8413461538461539, "grad_norm": 0.8828125, "learning_rate": 0.0004936591284453768, "loss": 5.372, "mean_token_accuracy": 0.1818295806646347, "num_tokens": 19259363.0, "step": 9275 }, { "entropy": 5.5150541305542, "epoch": 0.841799709724238, "grad_norm": 0.953125, "learning_rate": 0.0004936514987737319, "loss": 5.2678, "mean_token_accuracy": 0.18624502122402192, "num_tokens": 19269191.0, "step": 9280 }, { "entropy": 5.576925992965698, "epoch": 0.8422532656023222, "grad_norm": 0.93359375, "learning_rate": 0.0004936438645803182, "loss": 5.2344, "mean_token_accuracy": 0.18304483443498612, "num_tokens": 19280278.0, "step": 9285 }, { "entropy": 5.511117076873779, "epoch": 0.8427068214804064, "grad_norm": 0.96484375, "learning_rate": 0.0004936362258652938, "loss": 5.2203, "mean_token_accuracy": 0.19137237817049027, "num_tokens": 19290130.0, "step": 9290 }, { "entropy": 5.563754463195801, "epoch": 0.8431603773584906, "grad_norm": 0.88671875, "learning_rate": 0.0004936285826288165, "loss": 5.3249, "mean_token_accuracy": 0.18893066346645354, "num_tokens": 19301669.0, "step": 9295 }, { "entropy": 5.46899380683899, "epoch": 0.8436139332365747, "grad_norm": 0.84765625, "learning_rate": 0.0004936209348710444, "loss": 5.2003, "mean_token_accuracy": 0.18793248534202575, "num_tokens": 19312490.0, "step": 9300 }, { "entropy": 5.502799987792969, "epoch": 0.8440674891146589, "grad_norm": 0.9296875, "learning_rate": 0.0004936132825921355, "loss": 5.2355, "mean_token_accuracy": 0.18560146540403366, "num_tokens": 19321743.0, "step": 9305 }, { "entropy": 5.462376737594605, "epoch": 0.844521044992743, "grad_norm": 0.98828125, "learning_rate": 0.0004936056257922484, "loss": 5.1537, "mean_token_accuracy": 0.18894000202417374, "num_tokens": 19332149.0, "step": 9310 }, { "entropy": 5.499111986160278, "epoch": 0.8449746008708273, "grad_norm": 1.0, "learning_rate": 0.0004935979644715412, "loss": 5.259, "mean_token_accuracy": 0.1819048583507538, "num_tokens": 19341655.0, "step": 9315 }, { "entropy": 5.5421395778656, "epoch": 0.8454281567489115, "grad_norm": 0.984375, "learning_rate": 0.0004935902986301724, "loss": 5.2892, "mean_token_accuracy": 0.17833438664674758, "num_tokens": 19351404.0, "step": 9320 }, { "entropy": 5.5445465564727785, "epoch": 0.8458817126269956, "grad_norm": 0.96875, "learning_rate": 0.0004935826282683005, "loss": 5.3296, "mean_token_accuracy": 0.17884413450956343, "num_tokens": 19361788.0, "step": 9325 }, { "entropy": 5.52082576751709, "epoch": 0.8463352685050798, "grad_norm": 0.953125, "learning_rate": 0.0004935749533860842, "loss": 5.2941, "mean_token_accuracy": 0.1879544198513031, "num_tokens": 19372902.0, "step": 9330 }, { "entropy": 5.456793355941772, "epoch": 0.846788824383164, "grad_norm": 0.91015625, "learning_rate": 0.000493567273983682, "loss": 5.164, "mean_token_accuracy": 0.18452823758125306, "num_tokens": 19382181.0, "step": 9335 }, { "entropy": 5.480916547775268, "epoch": 0.8472423802612482, "grad_norm": 0.87109375, "learning_rate": 0.000493559590061253, "loss": 5.2346, "mean_token_accuracy": 0.18342400044202806, "num_tokens": 19393692.0, "step": 9340 }, { "entropy": 5.526205110549927, "epoch": 0.8476959361393324, "grad_norm": 0.92578125, "learning_rate": 0.0004935519016189559, "loss": 5.2629, "mean_token_accuracy": 0.19290686994791031, "num_tokens": 19404587.0, "step": 9345 }, { "entropy": 5.486667442321777, "epoch": 0.8481494920174165, "grad_norm": 0.921875, "learning_rate": 0.0004935442086569498, "loss": 5.235, "mean_token_accuracy": 0.1877764046192169, "num_tokens": 19415296.0, "step": 9350 }, { "entropy": 5.559003782272339, "epoch": 0.8486030478955007, "grad_norm": 0.90234375, "learning_rate": 0.0004935365111753939, "loss": 5.3125, "mean_token_accuracy": 0.1837704747915268, "num_tokens": 19426119.0, "step": 9355 }, { "entropy": 5.567704677581787, "epoch": 0.8490566037735849, "grad_norm": 0.9609375, "learning_rate": 0.0004935288091744472, "loss": 5.2818, "mean_token_accuracy": 0.17886171042919158, "num_tokens": 19436828.0, "step": 9360 }, { "entropy": 5.552606248855591, "epoch": 0.8495101596516691, "grad_norm": 1.015625, "learning_rate": 0.000493521102654269, "loss": 5.2655, "mean_token_accuracy": 0.18383633941411973, "num_tokens": 19446583.0, "step": 9365 }, { "entropy": 5.441853189468384, "epoch": 0.8499637155297532, "grad_norm": 0.95703125, "learning_rate": 0.0004935133916150187, "loss": 5.1426, "mean_token_accuracy": 0.19354938864707946, "num_tokens": 19456757.0, "step": 9370 }, { "entropy": 5.4375901222229, "epoch": 0.8504172714078374, "grad_norm": 1.03125, "learning_rate": 0.0004935056760568558, "loss": 5.2203, "mean_token_accuracy": 0.18387676924467086, "num_tokens": 19467624.0, "step": 9375 }, { "entropy": 5.507636260986328, "epoch": 0.8508708272859217, "grad_norm": 1.015625, "learning_rate": 0.0004934979559799399, "loss": 5.1784, "mean_token_accuracy": 0.19261115789413452, "num_tokens": 19477759.0, "step": 9380 }, { "entropy": 5.50710015296936, "epoch": 0.8513243831640058, "grad_norm": 0.890625, "learning_rate": 0.0004934902313844306, "loss": 5.1971, "mean_token_accuracy": 0.1891529604792595, "num_tokens": 19488877.0, "step": 9385 }, { "entropy": 5.452629899978637, "epoch": 0.85177793904209, "grad_norm": 0.8828125, "learning_rate": 0.0004934825022704875, "loss": 5.1932, "mean_token_accuracy": 0.18864367604255677, "num_tokens": 19499170.0, "step": 9390 }, { "entropy": 5.495832824707032, "epoch": 0.8522314949201741, "grad_norm": 0.93359375, "learning_rate": 0.0004934747686382707, "loss": 5.2215, "mean_token_accuracy": 0.1803721621632576, "num_tokens": 19509944.0, "step": 9395 }, { "entropy": 5.506520843505859, "epoch": 0.8526850507982583, "grad_norm": 0.953125, "learning_rate": 0.0004934670304879398, "loss": 5.1906, "mean_token_accuracy": 0.18765731602907182, "num_tokens": 19519014.0, "step": 9400 }, { "entropy": 5.4330939769744875, "epoch": 0.8531386066763426, "grad_norm": 1.015625, "learning_rate": 0.0004934592878196553, "loss": 5.2022, "mean_token_accuracy": 0.18718813359737396, "num_tokens": 19528586.0, "step": 9405 }, { "entropy": 5.527695608139038, "epoch": 0.8535921625544267, "grad_norm": 0.95703125, "learning_rate": 0.000493451540633577, "loss": 5.3372, "mean_token_accuracy": 0.18059038519859313, "num_tokens": 19539912.0, "step": 9410 }, { "entropy": 5.507913064956665, "epoch": 0.8540457184325109, "grad_norm": 0.98046875, "learning_rate": 0.0004934437889298651, "loss": 5.2781, "mean_token_accuracy": 0.1787128046154976, "num_tokens": 19549860.0, "step": 9415 }, { "entropy": 5.537213087081909, "epoch": 0.854499274310595, "grad_norm": 0.9296875, "learning_rate": 0.0004934360327086799, "loss": 5.2581, "mean_token_accuracy": 0.1831861764192581, "num_tokens": 19559446.0, "step": 9420 }, { "entropy": 5.57012186050415, "epoch": 0.8549528301886793, "grad_norm": 0.9140625, "learning_rate": 0.000493428271970182, "loss": 5.2586, "mean_token_accuracy": 0.19021736234426498, "num_tokens": 19570282.0, "step": 9425 }, { "entropy": 5.526591825485229, "epoch": 0.8554063860667634, "grad_norm": 0.953125, "learning_rate": 0.0004934205067145318, "loss": 5.1816, "mean_token_accuracy": 0.18626246899366378, "num_tokens": 19581087.0, "step": 9430 }, { "entropy": 5.495096015930176, "epoch": 0.8558599419448476, "grad_norm": 0.90625, "learning_rate": 0.0004934127369418898, "loss": 5.2741, "mean_token_accuracy": 0.19055798500776291, "num_tokens": 19592100.0, "step": 9435 }, { "entropy": 5.49104151725769, "epoch": 0.8563134978229318, "grad_norm": 1.0, "learning_rate": 0.0004934049626524168, "loss": 5.2558, "mean_token_accuracy": 0.18784750998020172, "num_tokens": 19602557.0, "step": 9440 }, { "entropy": 5.539940404891968, "epoch": 0.8567670537010159, "grad_norm": 0.94921875, "learning_rate": 0.0004933971838462734, "loss": 5.2965, "mean_token_accuracy": 0.17805867195129393, "num_tokens": 19613643.0, "step": 9445 }, { "entropy": 5.516980266571045, "epoch": 0.8572206095791002, "grad_norm": 0.94921875, "learning_rate": 0.0004933894005236207, "loss": 5.212, "mean_token_accuracy": 0.1881819874048233, "num_tokens": 19624180.0, "step": 9450 }, { "entropy": 5.535392236709595, "epoch": 0.8576741654571843, "grad_norm": 0.94140625, "learning_rate": 0.0004933816126846195, "loss": 5.2281, "mean_token_accuracy": 0.18857050836086273, "num_tokens": 19634799.0, "step": 9455 }, { "entropy": 5.4610528469085695, "epoch": 0.8581277213352685, "grad_norm": 0.95703125, "learning_rate": 0.0004933738203294309, "loss": 5.2042, "mean_token_accuracy": 0.1919635698199272, "num_tokens": 19644618.0, "step": 9460 }, { "entropy": 5.458015203475952, "epoch": 0.8585812772133526, "grad_norm": 0.9609375, "learning_rate": 0.000493366023458216, "loss": 5.2114, "mean_token_accuracy": 0.18096943944692612, "num_tokens": 19655550.0, "step": 9465 }, { "entropy": 5.538266515731811, "epoch": 0.8590348330914369, "grad_norm": 1.0078125, "learning_rate": 0.0004933582220711362, "loss": 5.2769, "mean_token_accuracy": 0.19205545336008073, "num_tokens": 19665734.0, "step": 9470 }, { "entropy": 5.527783441543579, "epoch": 0.8594883889695211, "grad_norm": 0.89453125, "learning_rate": 0.0004933504161683526, "loss": 5.2234, "mean_token_accuracy": 0.1832062631845474, "num_tokens": 19677130.0, "step": 9475 }, { "entropy": 5.452576208114624, "epoch": 0.8599419448476052, "grad_norm": 0.92578125, "learning_rate": 0.0004933426057500269, "loss": 5.1462, "mean_token_accuracy": 0.19649119079113006, "num_tokens": 19687374.0, "step": 9480 }, { "entropy": 5.5538092136383055, "epoch": 0.8603955007256894, "grad_norm": 0.92578125, "learning_rate": 0.0004933347908163203, "loss": 5.2585, "mean_token_accuracy": 0.1857781171798706, "num_tokens": 19698182.0, "step": 9485 }, { "entropy": 5.515981197357178, "epoch": 0.8608490566037735, "grad_norm": 0.99609375, "learning_rate": 0.0004933269713673947, "loss": 5.2181, "mean_token_accuracy": 0.18882352858781815, "num_tokens": 19707664.0, "step": 9490 }, { "entropy": 5.435214948654175, "epoch": 0.8613026124818578, "grad_norm": 0.953125, "learning_rate": 0.0004933191474034116, "loss": 5.2636, "mean_token_accuracy": 0.18053202778100969, "num_tokens": 19717647.0, "step": 9495 }, { "entropy": 5.499503469467163, "epoch": 0.861756168359942, "grad_norm": 0.9375, "learning_rate": 0.000493311318924533, "loss": 5.2917, "mean_token_accuracy": 0.18424864560365678, "num_tokens": 19727444.0, "step": 9500 }, { "entropy": 5.5348368167877195, "epoch": 0.8622097242380261, "grad_norm": 0.95703125, "learning_rate": 0.0004933034859309208, "loss": 5.3074, "mean_token_accuracy": 0.17919572144746782, "num_tokens": 19738719.0, "step": 9505 }, { "entropy": 5.5768194675445555, "epoch": 0.8626632801161103, "grad_norm": 0.88671875, "learning_rate": 0.0004932956484227367, "loss": 5.2775, "mean_token_accuracy": 0.19209030717611314, "num_tokens": 19749786.0, "step": 9510 }, { "entropy": 5.507620334625244, "epoch": 0.8631168359941945, "grad_norm": 0.953125, "learning_rate": 0.000493287806400143, "loss": 5.2268, "mean_token_accuracy": 0.19589438587427138, "num_tokens": 19759623.0, "step": 9515 }, { "entropy": 5.516129493713379, "epoch": 0.8635703918722787, "grad_norm": 0.9375, "learning_rate": 0.0004932799598633018, "loss": 5.2349, "mean_token_accuracy": 0.1868974268436432, "num_tokens": 19770117.0, "step": 9520 }, { "entropy": 5.536385726928711, "epoch": 0.8640239477503628, "grad_norm": 1.0234375, "learning_rate": 0.0004932721088123753, "loss": 5.3231, "mean_token_accuracy": 0.18734574615955352, "num_tokens": 19780748.0, "step": 9525 }, { "entropy": 5.513698625564575, "epoch": 0.864477503628447, "grad_norm": 0.88671875, "learning_rate": 0.0004932642532475262, "loss": 5.2632, "mean_token_accuracy": 0.18844823986291886, "num_tokens": 19791816.0, "step": 9530 }, { "entropy": 5.5973162174224855, "epoch": 0.8649310595065312, "grad_norm": 0.984375, "learning_rate": 0.0004932563931689168, "loss": 5.3348, "mean_token_accuracy": 0.18349990099668503, "num_tokens": 19801096.0, "step": 9535 }, { "entropy": 5.519701194763184, "epoch": 0.8653846153846154, "grad_norm": 1.0234375, "learning_rate": 0.0004932485285767093, "loss": 5.1903, "mean_token_accuracy": 0.1904284492135048, "num_tokens": 19811258.0, "step": 9540 }, { "entropy": 5.541377305984497, "epoch": 0.8658381712626996, "grad_norm": 1.0, "learning_rate": 0.0004932406594710667, "loss": 5.2816, "mean_token_accuracy": 0.19132487922906877, "num_tokens": 19821765.0, "step": 9545 }, { "entropy": 5.5216514587402346, "epoch": 0.8662917271407837, "grad_norm": 0.99609375, "learning_rate": 0.0004932327858521517, "loss": 5.1445, "mean_token_accuracy": 0.19365739524364473, "num_tokens": 19831537.0, "step": 9550 }, { "entropy": 5.463690662384034, "epoch": 0.8667452830188679, "grad_norm": 0.96875, "learning_rate": 0.000493224907720127, "loss": 5.1567, "mean_token_accuracy": 0.18910293579101561, "num_tokens": 19841830.0, "step": 9555 }, { "entropy": 5.486150312423706, "epoch": 0.8671988388969522, "grad_norm": 0.92578125, "learning_rate": 0.0004932170250751556, "loss": 5.2631, "mean_token_accuracy": 0.18096060454845428, "num_tokens": 19851896.0, "step": 9560 }, { "entropy": 5.550594329833984, "epoch": 0.8676523947750363, "grad_norm": 1.0078125, "learning_rate": 0.0004932091379174006, "loss": 5.298, "mean_token_accuracy": 0.17869172990322113, "num_tokens": 19861735.0, "step": 9565 }, { "entropy": 5.523482179641723, "epoch": 0.8681059506531205, "grad_norm": 0.91015625, "learning_rate": 0.000493201246247025, "loss": 5.1781, "mean_token_accuracy": 0.19788408875465394, "num_tokens": 19872333.0, "step": 9570 }, { "entropy": 5.48471360206604, "epoch": 0.8685595065312046, "grad_norm": 0.890625, "learning_rate": 0.000493193350064192, "loss": 5.1956, "mean_token_accuracy": 0.1868165984749794, "num_tokens": 19882896.0, "step": 9575 }, { "entropy": 5.470310354232788, "epoch": 0.8690130624092888, "grad_norm": 0.91015625, "learning_rate": 0.0004931854493690649, "loss": 5.1672, "mean_token_accuracy": 0.18842218518257142, "num_tokens": 19893767.0, "step": 9580 }, { "entropy": 5.4305318832397464, "epoch": 0.869466618287373, "grad_norm": 0.91796875, "learning_rate": 0.0004931775441618071, "loss": 5.1424, "mean_token_accuracy": 0.19409455507993698, "num_tokens": 19904242.0, "step": 9585 }, { "entropy": 5.474945592880249, "epoch": 0.8699201741654572, "grad_norm": 0.96484375, "learning_rate": 0.0004931696344425821, "loss": 5.2879, "mean_token_accuracy": 0.18741385638713837, "num_tokens": 19913898.0, "step": 9590 }, { "entropy": 5.589535808563232, "epoch": 0.8703737300435413, "grad_norm": 0.91015625, "learning_rate": 0.0004931617202115535, "loss": 5.2727, "mean_token_accuracy": 0.18905438631772994, "num_tokens": 19923756.0, "step": 9595 }, { "entropy": 5.507710361480713, "epoch": 0.8708272859216255, "grad_norm": 1.015625, "learning_rate": 0.0004931538014688849, "loss": 5.1986, "mean_token_accuracy": 0.19067411869764328, "num_tokens": 19932720.0, "step": 9600 }, { "entropy": 5.565124797821045, "epoch": 0.8712808417997098, "grad_norm": 1.109375, "learning_rate": 0.0004931458782147401, "loss": 5.4096, "mean_token_accuracy": 0.17565523087978363, "num_tokens": 19942962.0, "step": 9605 }, { "entropy": 5.584523773193359, "epoch": 0.8717343976777939, "grad_norm": 1.0078125, "learning_rate": 0.000493137950449283, "loss": 5.2822, "mean_token_accuracy": 0.19391026049852372, "num_tokens": 19953735.0, "step": 9610 }, { "entropy": 5.485487079620361, "epoch": 0.8721879535558781, "grad_norm": 0.921875, "learning_rate": 0.0004931300181726775, "loss": 5.2473, "mean_token_accuracy": 0.18759722262620926, "num_tokens": 19964416.0, "step": 9615 }, { "entropy": 5.493893098831177, "epoch": 0.8726415094339622, "grad_norm": 0.99609375, "learning_rate": 0.0004931220813850875, "loss": 5.2659, "mean_token_accuracy": 0.18439658731222153, "num_tokens": 19974531.0, "step": 9620 }, { "entropy": 5.551490545272827, "epoch": 0.8730950653120464, "grad_norm": 0.98046875, "learning_rate": 0.0004931141400866773, "loss": 5.2484, "mean_token_accuracy": 0.18889303654432296, "num_tokens": 19984964.0, "step": 9625 }, { "entropy": 5.4911480903625485, "epoch": 0.8735486211901307, "grad_norm": 0.8984375, "learning_rate": 0.0004931061942776112, "loss": 5.186, "mean_token_accuracy": 0.19389327317476274, "num_tokens": 19995568.0, "step": 9630 }, { "entropy": 5.588620948791504, "epoch": 0.8740021770682148, "grad_norm": 1.0234375, "learning_rate": 0.0004930982439580534, "loss": 5.3836, "mean_token_accuracy": 0.17700846791267394, "num_tokens": 20005856.0, "step": 9635 }, { "entropy": 5.57611494064331, "epoch": 0.874455732946299, "grad_norm": 1.1015625, "learning_rate": 0.0004930902891281683, "loss": 5.283, "mean_token_accuracy": 0.18396832197904586, "num_tokens": 20015683.0, "step": 9640 }, { "entropy": 5.41850471496582, "epoch": 0.8749092888243831, "grad_norm": 0.953125, "learning_rate": 0.0004930823297881205, "loss": 5.1013, "mean_token_accuracy": 0.19724885672330855, "num_tokens": 20025998.0, "step": 9645 }, { "entropy": 5.539435148239136, "epoch": 0.8753628447024674, "grad_norm": 0.9296875, "learning_rate": 0.0004930743659380745, "loss": 5.2599, "mean_token_accuracy": 0.18563385009765626, "num_tokens": 20036486.0, "step": 9650 }, { "entropy": 5.479112577438355, "epoch": 0.8758164005805515, "grad_norm": 0.9453125, "learning_rate": 0.000493066397578195, "loss": 5.1674, "mean_token_accuracy": 0.19481005817651748, "num_tokens": 20046784.0, "step": 9655 }, { "entropy": 5.480585336685181, "epoch": 0.8762699564586357, "grad_norm": 1.0, "learning_rate": 0.0004930584247086468, "loss": 5.2326, "mean_token_accuracy": 0.1877565011382103, "num_tokens": 20056999.0, "step": 9660 }, { "entropy": 5.465516996383667, "epoch": 0.8767235123367199, "grad_norm": 0.9609375, "learning_rate": 0.000493050447329595, "loss": 5.122, "mean_token_accuracy": 0.19252620935440062, "num_tokens": 20067612.0, "step": 9665 }, { "entropy": 5.5493165969848635, "epoch": 0.877177068214804, "grad_norm": 0.97265625, "learning_rate": 0.0004930424654412043, "loss": 5.275, "mean_token_accuracy": 0.1878029227256775, "num_tokens": 20077330.0, "step": 9670 }, { "entropy": 5.546081256866455, "epoch": 0.8776306240928883, "grad_norm": 1.0390625, "learning_rate": 0.0004930344790436398, "loss": 5.2745, "mean_token_accuracy": 0.17999620139598846, "num_tokens": 20086801.0, "step": 9675 }, { "entropy": 5.52485613822937, "epoch": 0.8780841799709724, "grad_norm": 0.94921875, "learning_rate": 0.0004930264881370666, "loss": 5.2166, "mean_token_accuracy": 0.18604013770818711, "num_tokens": 20097047.0, "step": 9680 }, { "entropy": 5.471764802932739, "epoch": 0.8785377358490566, "grad_norm": 0.93359375, "learning_rate": 0.0004930184927216504, "loss": 5.2546, "mean_token_accuracy": 0.18681764751672744, "num_tokens": 20107185.0, "step": 9685 }, { "entropy": 5.53357629776001, "epoch": 0.8789912917271407, "grad_norm": 0.93359375, "learning_rate": 0.0004930104927975559, "loss": 5.1947, "mean_token_accuracy": 0.19048551768064498, "num_tokens": 20118493.0, "step": 9690 }, { "entropy": 5.484797573089599, "epoch": 0.879444847605225, "grad_norm": 0.93359375, "learning_rate": 0.0004930024883649489, "loss": 5.2524, "mean_token_accuracy": 0.18750473260879516, "num_tokens": 20129294.0, "step": 9695 }, { "entropy": 5.442465543746948, "epoch": 0.8798984034833092, "grad_norm": 1.0078125, "learning_rate": 0.000492994479423995, "loss": 5.2124, "mean_token_accuracy": 0.19394612908363343, "num_tokens": 20139194.0, "step": 9700 }, { "entropy": 5.467197561264038, "epoch": 0.8803519593613933, "grad_norm": 0.94921875, "learning_rate": 0.0004929864659748597, "loss": 5.2374, "mean_token_accuracy": 0.18322389721870422, "num_tokens": 20149681.0, "step": 9705 }, { "entropy": 5.549167013168335, "epoch": 0.8808055152394775, "grad_norm": 0.90625, "learning_rate": 0.0004929784480177087, "loss": 5.3222, "mean_token_accuracy": 0.18286841213703156, "num_tokens": 20160557.0, "step": 9710 }, { "entropy": 5.519404029846191, "epoch": 0.8812590711175616, "grad_norm": 0.94921875, "learning_rate": 0.0004929704255527078, "loss": 5.1887, "mean_token_accuracy": 0.187822188436985, "num_tokens": 20171047.0, "step": 9715 }, { "entropy": 5.523070621490478, "epoch": 0.8817126269956459, "grad_norm": 0.89453125, "learning_rate": 0.000492962398580023, "loss": 5.3707, "mean_token_accuracy": 0.17758570462465287, "num_tokens": 20182148.0, "step": 9720 }, { "entropy": 5.421023654937744, "epoch": 0.88216618287373, "grad_norm": 0.92578125, "learning_rate": 0.0004929543670998203, "loss": 5.1276, "mean_token_accuracy": 0.19135259091854095, "num_tokens": 20192131.0, "step": 9725 }, { "entropy": 5.531173181533814, "epoch": 0.8826197387518142, "grad_norm": 0.8515625, "learning_rate": 0.0004929463311122657, "loss": 5.2426, "mean_token_accuracy": 0.1861494779586792, "num_tokens": 20202805.0, "step": 9730 }, { "entropy": 5.539679002761841, "epoch": 0.8830732946298984, "grad_norm": 0.87890625, "learning_rate": 0.0004929382906175253, "loss": 5.1717, "mean_token_accuracy": 0.19339725226163865, "num_tokens": 20212702.0, "step": 9735 }, { "entropy": 5.504897594451904, "epoch": 0.8835268505079826, "grad_norm": 0.94921875, "learning_rate": 0.0004929302456157657, "loss": 5.2068, "mean_token_accuracy": 0.19339656680822373, "num_tokens": 20222661.0, "step": 9740 }, { "entropy": 5.490061807632446, "epoch": 0.8839804063860668, "grad_norm": 0.94140625, "learning_rate": 0.0004929221961071531, "loss": 5.2559, "mean_token_accuracy": 0.18547530472278595, "num_tokens": 20233012.0, "step": 9745 }, { "entropy": 5.521569061279297, "epoch": 0.8844339622641509, "grad_norm": 1.0390625, "learning_rate": 0.0004929141420918538, "loss": 5.2627, "mean_token_accuracy": 0.19188135862350464, "num_tokens": 20242918.0, "step": 9750 }, { "entropy": 5.4918468475341795, "epoch": 0.8848875181422351, "grad_norm": 0.9609375, "learning_rate": 0.0004929060835700347, "loss": 5.191, "mean_token_accuracy": 0.19425636231899263, "num_tokens": 20253254.0, "step": 9755 }, { "entropy": 5.500729370117187, "epoch": 0.8853410740203193, "grad_norm": 0.95703125, "learning_rate": 0.000492898020541862, "loss": 5.2469, "mean_token_accuracy": 0.18291963785886764, "num_tokens": 20263355.0, "step": 9760 }, { "entropy": 5.450434637069702, "epoch": 0.8857946298984035, "grad_norm": 0.9453125, "learning_rate": 0.0004928899530075029, "loss": 5.1715, "mean_token_accuracy": 0.1866050571203232, "num_tokens": 20274716.0, "step": 9765 }, { "entropy": 5.4292707443237305, "epoch": 0.8862481857764877, "grad_norm": 1.0234375, "learning_rate": 0.0004928818809671241, "loss": 5.1607, "mean_token_accuracy": 0.18965840190649033, "num_tokens": 20285631.0, "step": 9770 }, { "entropy": 5.558332729339599, "epoch": 0.8867017416545718, "grad_norm": 1.0234375, "learning_rate": 0.0004928738044208923, "loss": 5.2411, "mean_token_accuracy": 0.1915654197335243, "num_tokens": 20295717.0, "step": 9775 }, { "entropy": 5.459675216674805, "epoch": 0.887155297532656, "grad_norm": 0.9375, "learning_rate": 0.0004928657233689748, "loss": 5.2183, "mean_token_accuracy": 0.18936942964792253, "num_tokens": 20306637.0, "step": 9780 }, { "entropy": 5.490768623352051, "epoch": 0.8876088534107403, "grad_norm": 0.921875, "learning_rate": 0.0004928576378115387, "loss": 5.1846, "mean_token_accuracy": 0.1875806614756584, "num_tokens": 20316629.0, "step": 9785 }, { "entropy": 5.597564649581909, "epoch": 0.8880624092888244, "grad_norm": 0.94921875, "learning_rate": 0.0004928495477487509, "loss": 5.3573, "mean_token_accuracy": 0.17805679738521576, "num_tokens": 20327935.0, "step": 9790 }, { "entropy": 5.491835212707519, "epoch": 0.8885159651669086, "grad_norm": 0.87890625, "learning_rate": 0.0004928414531807792, "loss": 5.1762, "mean_token_accuracy": 0.1839013561606407, "num_tokens": 20339142.0, "step": 9795 }, { "entropy": 5.464007425308227, "epoch": 0.8889695210449927, "grad_norm": 0.9296875, "learning_rate": 0.0004928333541077906, "loss": 5.1896, "mean_token_accuracy": 0.20151338577270508, "num_tokens": 20348474.0, "step": 9800 }, { "entropy": 5.500573539733887, "epoch": 0.8894230769230769, "grad_norm": 0.984375, "learning_rate": 0.0004928252505299527, "loss": 5.2498, "mean_token_accuracy": 0.1855317085981369, "num_tokens": 20359440.0, "step": 9805 }, { "entropy": 5.579951906204224, "epoch": 0.8898766328011611, "grad_norm": 0.97265625, "learning_rate": 0.0004928171424474332, "loss": 5.2963, "mean_token_accuracy": 0.18381822854280472, "num_tokens": 20370355.0, "step": 9810 }, { "entropy": 5.492842674255371, "epoch": 0.8903301886792453, "grad_norm": 0.95703125, "learning_rate": 0.0004928090298603996, "loss": 5.1795, "mean_token_accuracy": 0.18734454959630967, "num_tokens": 20380214.0, "step": 9815 }, { "entropy": 5.527317905426026, "epoch": 0.8907837445573294, "grad_norm": 1.0859375, "learning_rate": 0.0004928009127690199, "loss": 5.1963, "mean_token_accuracy": 0.18887149095535277, "num_tokens": 20389190.0, "step": 9820 }, { "entropy": 5.4723756313323975, "epoch": 0.8912373004354136, "grad_norm": 0.98046875, "learning_rate": 0.0004927927911734617, "loss": 5.238, "mean_token_accuracy": 0.18437635898590088, "num_tokens": 20399531.0, "step": 9825 }, { "entropy": 5.463613748550415, "epoch": 0.8916908563134979, "grad_norm": 0.84375, "learning_rate": 0.0004927846650738931, "loss": 5.2246, "mean_token_accuracy": 0.18858011811971664, "num_tokens": 20410201.0, "step": 9830 }, { "entropy": 5.494712591171265, "epoch": 0.892144412191582, "grad_norm": 0.88671875, "learning_rate": 0.0004927765344704821, "loss": 5.1865, "mean_token_accuracy": 0.19300392419099807, "num_tokens": 20421579.0, "step": 9835 }, { "entropy": 5.510917329788208, "epoch": 0.8925979680696662, "grad_norm": 0.89453125, "learning_rate": 0.0004927683993633969, "loss": 5.2522, "mean_token_accuracy": 0.18945046067237853, "num_tokens": 20432048.0, "step": 9840 }, { "entropy": 5.559658622741699, "epoch": 0.8930515239477503, "grad_norm": 1.1484375, "learning_rate": 0.0004927602597528057, "loss": 5.2763, "mean_token_accuracy": 0.18216387331485748, "num_tokens": 20441752.0, "step": 9845 }, { "entropy": 5.437015390396118, "epoch": 0.8935050798258345, "grad_norm": 0.91796875, "learning_rate": 0.0004927521156388769, "loss": 5.1443, "mean_token_accuracy": 0.1886148139834404, "num_tokens": 20451693.0, "step": 9850 }, { "entropy": 5.512848711013794, "epoch": 0.8939586357039188, "grad_norm": 1.0078125, "learning_rate": 0.0004927439670217788, "loss": 5.2784, "mean_token_accuracy": 0.18574748635292054, "num_tokens": 20462312.0, "step": 9855 }, { "entropy": 5.51384711265564, "epoch": 0.8944121915820029, "grad_norm": 0.90234375, "learning_rate": 0.00049273581390168, "loss": 5.1842, "mean_token_accuracy": 0.18325104117393493, "num_tokens": 20472546.0, "step": 9860 }, { "entropy": 5.482762384414673, "epoch": 0.8948657474600871, "grad_norm": 0.875, "learning_rate": 0.000492727656278749, "loss": 5.2265, "mean_token_accuracy": 0.189279143512249, "num_tokens": 20483266.0, "step": 9865 }, { "entropy": 5.43660979270935, "epoch": 0.8953193033381712, "grad_norm": 1.0390625, "learning_rate": 0.0004927194941531547, "loss": 5.1597, "mean_token_accuracy": 0.18750689327716827, "num_tokens": 20492490.0, "step": 9870 }, { "entropy": 5.482614469528198, "epoch": 0.8957728592162555, "grad_norm": 0.9765625, "learning_rate": 0.0004927113275250657, "loss": 5.2002, "mean_token_accuracy": 0.19175224751234055, "num_tokens": 20503077.0, "step": 9875 }, { "entropy": 5.448323917388916, "epoch": 0.8962264150943396, "grad_norm": 0.921875, "learning_rate": 0.0004927031563946511, "loss": 5.2231, "mean_token_accuracy": 0.18685709685087204, "num_tokens": 20513771.0, "step": 9880 }, { "entropy": 5.513888883590698, "epoch": 0.8966799709724238, "grad_norm": 0.94140625, "learning_rate": 0.0004926949807620796, "loss": 5.3107, "mean_token_accuracy": 0.1844270795583725, "num_tokens": 20523616.0, "step": 9885 }, { "entropy": 5.525784826278686, "epoch": 0.897133526850508, "grad_norm": 0.98046875, "learning_rate": 0.0004926868006275204, "loss": 5.0908, "mean_token_accuracy": 0.19574417024850846, "num_tokens": 20533613.0, "step": 9890 }, { "entropy": 5.473994970321655, "epoch": 0.8975870827285921, "grad_norm": 1.0078125, "learning_rate": 0.0004926786159911427, "loss": 5.2053, "mean_token_accuracy": 0.18760427534580232, "num_tokens": 20543812.0, "step": 9895 }, { "entropy": 5.449514675140381, "epoch": 0.8980406386066764, "grad_norm": 1.046875, "learning_rate": 0.000492670426853116, "loss": 5.1502, "mean_token_accuracy": 0.19117735475301742, "num_tokens": 20553785.0, "step": 9900 }, { "entropy": 5.578982305526734, "epoch": 0.8984941944847605, "grad_norm": 0.9453125, "learning_rate": 0.0004926622332136092, "loss": 5.2671, "mean_token_accuracy": 0.1900632604956627, "num_tokens": 20563326.0, "step": 9905 }, { "entropy": 5.484088993072509, "epoch": 0.8989477503628447, "grad_norm": 0.90625, "learning_rate": 0.0004926540350727918, "loss": 5.1148, "mean_token_accuracy": 0.19918729811906816, "num_tokens": 20573643.0, "step": 9910 }, { "entropy": 5.387427949905396, "epoch": 0.8994013062409288, "grad_norm": 0.9609375, "learning_rate": 0.0004926458324308337, "loss": 5.1496, "mean_token_accuracy": 0.1918700322508812, "num_tokens": 20583916.0, "step": 9915 }, { "entropy": 5.506546497344971, "epoch": 0.8998548621190131, "grad_norm": 0.95703125, "learning_rate": 0.0004926376252879043, "loss": 5.3024, "mean_token_accuracy": 0.18872980624437333, "num_tokens": 20593984.0, "step": 9920 }, { "entropy": 5.531512498855591, "epoch": 0.9003084179970973, "grad_norm": 0.90234375, "learning_rate": 0.0004926294136441733, "loss": 5.141, "mean_token_accuracy": 0.19161704182624817, "num_tokens": 20603927.0, "step": 9925 }, { "entropy": 5.491614151000976, "epoch": 0.9007619738751814, "grad_norm": 0.96484375, "learning_rate": 0.0004926211974998106, "loss": 5.2693, "mean_token_accuracy": 0.18857511729002, "num_tokens": 20614147.0, "step": 9930 }, { "entropy": 5.524622821807862, "epoch": 0.9012155297532656, "grad_norm": 0.9375, "learning_rate": 0.000492612976854986, "loss": 5.2403, "mean_token_accuracy": 0.18621373921632767, "num_tokens": 20623631.0, "step": 9935 }, { "entropy": 5.438816690444947, "epoch": 0.9016690856313497, "grad_norm": 1.0, "learning_rate": 0.0004926047517098697, "loss": 5.1165, "mean_token_accuracy": 0.19730497598648072, "num_tokens": 20632566.0, "step": 9940 }, { "entropy": 5.500843334197998, "epoch": 0.902122641509434, "grad_norm": 0.953125, "learning_rate": 0.0004925965220646315, "loss": 5.233, "mean_token_accuracy": 0.18363679200410843, "num_tokens": 20643246.0, "step": 9945 }, { "entropy": 5.507595014572144, "epoch": 0.9025761973875182, "grad_norm": 1.0, "learning_rate": 0.0004925882879194419, "loss": 5.296, "mean_token_accuracy": 0.18696873188018798, "num_tokens": 20653372.0, "step": 9950 }, { "entropy": 5.515101146697998, "epoch": 0.9030297532656023, "grad_norm": 0.9375, "learning_rate": 0.0004925800492744712, "loss": 5.2455, "mean_token_accuracy": 0.18492357879877092, "num_tokens": 20662687.0, "step": 9955 }, { "entropy": 5.465108442306518, "epoch": 0.9034833091436865, "grad_norm": 0.90625, "learning_rate": 0.0004925718061298895, "loss": 5.1691, "mean_token_accuracy": 0.19537947028875352, "num_tokens": 20673168.0, "step": 9960 }, { "entropy": 5.555444622039795, "epoch": 0.9039368650217707, "grad_norm": 0.9921875, "learning_rate": 0.0004925635584858675, "loss": 5.2785, "mean_token_accuracy": 0.18311350643634797, "num_tokens": 20683100.0, "step": 9965 }, { "entropy": 5.589123487472534, "epoch": 0.9043904208998549, "grad_norm": 0.96484375, "learning_rate": 0.0004925553063425755, "loss": 5.2853, "mean_token_accuracy": 0.18646423369646073, "num_tokens": 20694097.0, "step": 9970 }, { "entropy": 5.501810359954834, "epoch": 0.904843976777939, "grad_norm": 1.0078125, "learning_rate": 0.0004925470497001844, "loss": 5.2467, "mean_token_accuracy": 0.18978470414876938, "num_tokens": 20704640.0, "step": 9975 }, { "entropy": 5.486598873138428, "epoch": 0.9052975326560232, "grad_norm": 0.92578125, "learning_rate": 0.0004925387885588648, "loss": 5.2002, "mean_token_accuracy": 0.19009471386671067, "num_tokens": 20714419.0, "step": 9980 }, { "entropy": 5.574535608291626, "epoch": 0.9057510885341074, "grad_norm": 1.015625, "learning_rate": 0.0004925305229187877, "loss": 5.2849, "mean_token_accuracy": 0.1879521057009697, "num_tokens": 20724705.0, "step": 9985 }, { "entropy": 5.561985349655151, "epoch": 0.9062046444121916, "grad_norm": 1.0625, "learning_rate": 0.000492522252780124, "loss": 5.3439, "mean_token_accuracy": 0.18506076335906982, "num_tokens": 20734753.0, "step": 9990 }, { "entropy": 5.5091822147369385, "epoch": 0.9066582002902758, "grad_norm": 0.85546875, "learning_rate": 0.0004925139781430446, "loss": 5.1525, "mean_token_accuracy": 0.1960643097758293, "num_tokens": 20745389.0, "step": 9995 }, { "entropy": 5.480530834197998, "epoch": 0.9071117561683599, "grad_norm": 1.0859375, "learning_rate": 0.0004925056990077207, "loss": 5.2167, "mean_token_accuracy": 0.19059233814477922, "num_tokens": 20755702.0, "step": 10000 }, { "entropy": 5.462615489959717, "epoch": 0.9075653120464441, "grad_norm": 0.9375, "learning_rate": 0.0004924974153743235, "loss": 5.1057, "mean_token_accuracy": 0.1962900161743164, "num_tokens": 20766046.0, "step": 10005 }, { "entropy": 5.492237567901611, "epoch": 0.9080188679245284, "grad_norm": 0.859375, "learning_rate": 0.0004924891272430244, "loss": 5.2233, "mean_token_accuracy": 0.19067611545324326, "num_tokens": 20776654.0, "step": 10010 }, { "entropy": 5.538366174697876, "epoch": 0.9084724238026125, "grad_norm": 0.96484375, "learning_rate": 0.0004924808346139948, "loss": 5.2699, "mean_token_accuracy": 0.19199298322200775, "num_tokens": 20787066.0, "step": 10015 }, { "entropy": 5.483625793457032, "epoch": 0.9089259796806967, "grad_norm": 0.9921875, "learning_rate": 0.0004924725374874059, "loss": 5.1807, "mean_token_accuracy": 0.18984902501106263, "num_tokens": 20796822.0, "step": 10020 }, { "entropy": 5.530815505981446, "epoch": 0.9093795355587808, "grad_norm": 0.91015625, "learning_rate": 0.0004924642358634297, "loss": 5.2346, "mean_token_accuracy": 0.18641554266214372, "num_tokens": 20807602.0, "step": 10025 }, { "entropy": 5.51546082496643, "epoch": 0.909833091436865, "grad_norm": 1.0234375, "learning_rate": 0.0004924559297422376, "loss": 5.193, "mean_token_accuracy": 0.19486915022134782, "num_tokens": 20819046.0, "step": 10030 }, { "entropy": 5.520950222015381, "epoch": 0.9102866473149492, "grad_norm": 0.921875, "learning_rate": 0.0004924476191240014, "loss": 5.2297, "mean_token_accuracy": 0.18605352193117142, "num_tokens": 20828989.0, "step": 10035 }, { "entropy": 5.47696099281311, "epoch": 0.9107402031930334, "grad_norm": 0.93359375, "learning_rate": 0.000492439304008893, "loss": 5.2303, "mean_token_accuracy": 0.18616906255483628, "num_tokens": 20839366.0, "step": 10040 }, { "entropy": 5.507669305801391, "epoch": 0.9111937590711175, "grad_norm": 0.9921875, "learning_rate": 0.0004924309843970847, "loss": 5.2253, "mean_token_accuracy": 0.18729967921972274, "num_tokens": 20849513.0, "step": 10045 }, { "entropy": 5.5649864196777346, "epoch": 0.9116473149492017, "grad_norm": 0.86328125, "learning_rate": 0.0004924226602887479, "loss": 5.2685, "mean_token_accuracy": 0.18344479352235793, "num_tokens": 20861406.0, "step": 10050 }, { "entropy": 5.495461368560791, "epoch": 0.912100870827286, "grad_norm": 0.89453125, "learning_rate": 0.0004924143316840552, "loss": 5.1824, "mean_token_accuracy": 0.19835592210292816, "num_tokens": 20871190.0, "step": 10055 }, { "entropy": 5.505907154083252, "epoch": 0.9125544267053701, "grad_norm": 0.92578125, "learning_rate": 0.0004924059985831787, "loss": 5.3313, "mean_token_accuracy": 0.18035977929830552, "num_tokens": 20881589.0, "step": 10060 }, { "entropy": 5.508808231353759, "epoch": 0.9130079825834543, "grad_norm": 1.0234375, "learning_rate": 0.0004923976609862908, "loss": 5.26, "mean_token_accuracy": 0.1787053018808365, "num_tokens": 20892072.0, "step": 10065 }, { "entropy": 5.547299718856811, "epoch": 0.9134615384615384, "grad_norm": 0.953125, "learning_rate": 0.0004923893188935638, "loss": 5.2435, "mean_token_accuracy": 0.18379553705453872, "num_tokens": 20902616.0, "step": 10070 }, { "entropy": 5.545641326904297, "epoch": 0.9139150943396226, "grad_norm": 0.94140625, "learning_rate": 0.0004923809723051702, "loss": 5.2337, "mean_token_accuracy": 0.18797029107809066, "num_tokens": 20913832.0, "step": 10075 }, { "entropy": 5.4296571731567385, "epoch": 0.9143686502177069, "grad_norm": 1.0390625, "learning_rate": 0.0004923726212212829, "loss": 5.1311, "mean_token_accuracy": 0.1946079269051552, "num_tokens": 20923322.0, "step": 10080 }, { "entropy": 5.484694910049439, "epoch": 0.914822206095791, "grad_norm": 1.015625, "learning_rate": 0.0004923642656420742, "loss": 5.2231, "mean_token_accuracy": 0.18851592838764192, "num_tokens": 20933334.0, "step": 10085 }, { "entropy": 5.500257778167724, "epoch": 0.9152757619738752, "grad_norm": 0.93359375, "learning_rate": 0.0004923559055677173, "loss": 5.1922, "mean_token_accuracy": 0.1872135117650032, "num_tokens": 20944171.0, "step": 10090 }, { "entropy": 5.50403790473938, "epoch": 0.9157293178519593, "grad_norm": 1.0078125, "learning_rate": 0.0004923475409983848, "loss": 5.2372, "mean_token_accuracy": 0.1875006526708603, "num_tokens": 20954200.0, "step": 10095 }, { "entropy": 5.483087778091431, "epoch": 0.9161828737300436, "grad_norm": 0.8984375, "learning_rate": 0.0004923391719342497, "loss": 5.2503, "mean_token_accuracy": 0.18236380070447922, "num_tokens": 20964935.0, "step": 10100 }, { "entropy": 5.502628421783447, "epoch": 0.9166364296081277, "grad_norm": 0.92578125, "learning_rate": 0.0004923307983754852, "loss": 5.2312, "mean_token_accuracy": 0.19101871997117997, "num_tokens": 20975499.0, "step": 10105 }, { "entropy": 5.433144903182983, "epoch": 0.9170899854862119, "grad_norm": 0.96875, "learning_rate": 0.0004923224203222645, "loss": 5.1678, "mean_token_accuracy": 0.19008324295282364, "num_tokens": 20986199.0, "step": 10110 }, { "entropy": 5.4952733516693115, "epoch": 0.9175435413642961, "grad_norm": 1.0, "learning_rate": 0.0004923140377747606, "loss": 5.2464, "mean_token_accuracy": 0.18770486861467361, "num_tokens": 20996313.0, "step": 10115 }, { "entropy": 5.533897113800049, "epoch": 0.9179970972423802, "grad_norm": 0.9375, "learning_rate": 0.0004923056507331471, "loss": 5.2228, "mean_token_accuracy": 0.18642332404851913, "num_tokens": 21006133.0, "step": 10120 }, { "entropy": 5.531605768203735, "epoch": 0.9184506531204645, "grad_norm": 0.9296875, "learning_rate": 0.0004922972591975974, "loss": 5.192, "mean_token_accuracy": 0.18831069022417068, "num_tokens": 21016448.0, "step": 10125 }, { "entropy": 5.451457118988037, "epoch": 0.9189042089985486, "grad_norm": 0.98828125, "learning_rate": 0.0004922888631682849, "loss": 5.1271, "mean_token_accuracy": 0.18411844819784165, "num_tokens": 21026458.0, "step": 10130 }, { "entropy": 5.449035692214966, "epoch": 0.9193577648766328, "grad_norm": 1.0390625, "learning_rate": 0.0004922804626453834, "loss": 5.1663, "mean_token_accuracy": 0.192974516749382, "num_tokens": 21037111.0, "step": 10135 }, { "entropy": 5.457956552505493, "epoch": 0.9198113207547169, "grad_norm": 1.0390625, "learning_rate": 0.0004922720576290665, "loss": 5.2224, "mean_token_accuracy": 0.19142512679100038, "num_tokens": 21048041.0, "step": 10140 }, { "entropy": 5.433384132385254, "epoch": 0.9202648766328012, "grad_norm": 1.015625, "learning_rate": 0.0004922636481195082, "loss": 5.0919, "mean_token_accuracy": 0.20250018388032914, "num_tokens": 21058099.0, "step": 10145 }, { "entropy": 5.501229667663575, "epoch": 0.9207184325108854, "grad_norm": 0.9765625, "learning_rate": 0.0004922552341168823, "loss": 5.2367, "mean_token_accuracy": 0.18169017881155014, "num_tokens": 21068137.0, "step": 10150 }, { "entropy": 5.41462550163269, "epoch": 0.9211719883889695, "grad_norm": 0.9453125, "learning_rate": 0.0004922468156213627, "loss": 5.1188, "mean_token_accuracy": 0.19230714738368987, "num_tokens": 21077556.0, "step": 10155 }, { "entropy": 5.499750471115112, "epoch": 0.9216255442670537, "grad_norm": 1.0234375, "learning_rate": 0.0004922383926331236, "loss": 5.1527, "mean_token_accuracy": 0.19040969759225845, "num_tokens": 21087524.0, "step": 10160 }, { "entropy": 5.438167142868042, "epoch": 0.9220791001451378, "grad_norm": 0.92578125, "learning_rate": 0.0004922299651523392, "loss": 5.2295, "mean_token_accuracy": 0.1860123857855797, "num_tokens": 21098446.0, "step": 10165 }, { "entropy": 5.48976616859436, "epoch": 0.9225326560232221, "grad_norm": 0.953125, "learning_rate": 0.0004922215331791837, "loss": 5.2352, "mean_token_accuracy": 0.18725680112838744, "num_tokens": 21109291.0, "step": 10170 }, { "entropy": 5.514573240280152, "epoch": 0.9229862119013063, "grad_norm": 1.0078125, "learning_rate": 0.0004922130967138316, "loss": 5.1208, "mean_token_accuracy": 0.1932806611061096, "num_tokens": 21120043.0, "step": 10175 }, { "entropy": 5.518204164505005, "epoch": 0.9234397677793904, "grad_norm": 0.97265625, "learning_rate": 0.0004922046557564574, "loss": 5.2357, "mean_token_accuracy": 0.18277695327997207, "num_tokens": 21130339.0, "step": 10180 }, { "entropy": 5.500779438018799, "epoch": 0.9238933236574746, "grad_norm": 0.96484375, "learning_rate": 0.0004921962103072355, "loss": 5.3023, "mean_token_accuracy": 0.18717591762542723, "num_tokens": 21142307.0, "step": 10185 }, { "entropy": 5.526569557189942, "epoch": 0.9243468795355588, "grad_norm": 0.921875, "learning_rate": 0.0004921877603663406, "loss": 5.2036, "mean_token_accuracy": 0.19003356993198395, "num_tokens": 21151843.0, "step": 10190 }, { "entropy": 5.502495908737183, "epoch": 0.924800435413643, "grad_norm": 0.9765625, "learning_rate": 0.0004921793059339474, "loss": 5.2119, "mean_token_accuracy": 0.19041070491075515, "num_tokens": 21162574.0, "step": 10195 }, { "entropy": 5.510891437530518, "epoch": 0.9252539912917271, "grad_norm": 0.92578125, "learning_rate": 0.0004921708470102309, "loss": 5.16, "mean_token_accuracy": 0.19265214800834657, "num_tokens": 21172637.0, "step": 10200 }, { "entropy": 5.473992538452149, "epoch": 0.9257075471698113, "grad_norm": 0.953125, "learning_rate": 0.000492162383595366, "loss": 5.168, "mean_token_accuracy": 0.19391350150108339, "num_tokens": 21182272.0, "step": 10205 }, { "entropy": 5.540949773788452, "epoch": 0.9261611030478955, "grad_norm": 0.89453125, "learning_rate": 0.0004921539156895275, "loss": 5.3006, "mean_token_accuracy": 0.18155533522367479, "num_tokens": 21193712.0, "step": 10210 }, { "entropy": 5.566745138168335, "epoch": 0.9266146589259797, "grad_norm": 1.09375, "learning_rate": 0.0004921454432928908, "loss": 5.303, "mean_token_accuracy": 0.18065586537122727, "num_tokens": 21205104.0, "step": 10215 }, { "entropy": 5.536470413208008, "epoch": 0.9270682148040639, "grad_norm": 0.94921875, "learning_rate": 0.000492136966405631, "loss": 5.1908, "mean_token_accuracy": 0.18957612067461013, "num_tokens": 21215495.0, "step": 10220 }, { "entropy": 5.49644718170166, "epoch": 0.927521770682148, "grad_norm": 1.046875, "learning_rate": 0.0004921284850279233, "loss": 5.2023, "mean_token_accuracy": 0.1892085149884224, "num_tokens": 21226047.0, "step": 10225 }, { "entropy": 5.50606107711792, "epoch": 0.9279753265602322, "grad_norm": 1.0078125, "learning_rate": 0.0004921199991599433, "loss": 5.2756, "mean_token_accuracy": 0.18349545150995256, "num_tokens": 21235784.0, "step": 10230 }, { "entropy": 5.548442935943603, "epoch": 0.9284288824383164, "grad_norm": 0.98828125, "learning_rate": 0.0004921115088018665, "loss": 5.2245, "mean_token_accuracy": 0.18641836047172547, "num_tokens": 21245493.0, "step": 10235 }, { "entropy": 5.592808103561401, "epoch": 0.9288824383164006, "grad_norm": 0.93359375, "learning_rate": 0.000492103013953868, "loss": 5.3075, "mean_token_accuracy": 0.18445847779512406, "num_tokens": 21255541.0, "step": 10240 }, { "entropy": 5.46482138633728, "epoch": 0.9293359941944848, "grad_norm": 0.953125, "learning_rate": 0.0004920945146161242, "loss": 5.16, "mean_token_accuracy": 0.19516148865222932, "num_tokens": 21265427.0, "step": 10245 }, { "entropy": 5.470294094085693, "epoch": 0.9297895500725689, "grad_norm": 0.9140625, "learning_rate": 0.0004920860107888105, "loss": 5.164, "mean_token_accuracy": 0.19581332057714462, "num_tokens": 21276597.0, "step": 10250 }, { "entropy": 5.450829267501831, "epoch": 0.9302431059506531, "grad_norm": 0.97265625, "learning_rate": 0.0004920775024721026, "loss": 5.1916, "mean_token_accuracy": 0.18773079216480254, "num_tokens": 21286416.0, "step": 10255 }, { "entropy": 5.497037076950074, "epoch": 0.9306966618287373, "grad_norm": 0.94921875, "learning_rate": 0.0004920689896661767, "loss": 5.2054, "mean_token_accuracy": 0.1940332069993019, "num_tokens": 21296064.0, "step": 10260 }, { "entropy": 5.476668024063111, "epoch": 0.9311502177068215, "grad_norm": 1.0078125, "learning_rate": 0.0004920604723712088, "loss": 5.214, "mean_token_accuracy": 0.19466549903154373, "num_tokens": 21306836.0, "step": 10265 }, { "entropy": 5.485483455657959, "epoch": 0.9316037735849056, "grad_norm": 0.953125, "learning_rate": 0.0004920519505873751, "loss": 5.1735, "mean_token_accuracy": 0.19273321628570556, "num_tokens": 21316936.0, "step": 10270 }, { "entropy": 5.449879693984985, "epoch": 0.9320573294629898, "grad_norm": 0.93359375, "learning_rate": 0.0004920434243148515, "loss": 5.1367, "mean_token_accuracy": 0.19561291486024857, "num_tokens": 21326892.0, "step": 10275 }, { "entropy": 5.469815301895141, "epoch": 0.9325108853410741, "grad_norm": 0.98046875, "learning_rate": 0.0004920348935538147, "loss": 5.1665, "mean_token_accuracy": 0.18587524741888045, "num_tokens": 21337270.0, "step": 10280 }, { "entropy": 5.525975322723388, "epoch": 0.9329644412191582, "grad_norm": 0.9765625, "learning_rate": 0.000492026358304441, "loss": 5.2366, "mean_token_accuracy": 0.1867948666214943, "num_tokens": 21347968.0, "step": 10285 }, { "entropy": 5.483292770385742, "epoch": 0.9334179970972424, "grad_norm": 0.92578125, "learning_rate": 0.000492017818566907, "loss": 5.1862, "mean_token_accuracy": 0.1958588868379593, "num_tokens": 21358312.0, "step": 10290 }, { "entropy": 5.477849340438842, "epoch": 0.9338715529753265, "grad_norm": 0.96484375, "learning_rate": 0.0004920092743413892, "loss": 5.1513, "mean_token_accuracy": 0.19156461209058762, "num_tokens": 21368794.0, "step": 10295 }, { "entropy": 5.515837144851685, "epoch": 0.9343251088534107, "grad_norm": 0.86328125, "learning_rate": 0.0004920007256280642, "loss": 5.2094, "mean_token_accuracy": 0.19680030047893524, "num_tokens": 21380080.0, "step": 10300 }, { "entropy": 5.507870388031006, "epoch": 0.934778664731495, "grad_norm": 0.90234375, "learning_rate": 0.000491992172427109, "loss": 5.1906, "mean_token_accuracy": 0.19244442880153656, "num_tokens": 21389961.0, "step": 10305 }, { "entropy": 5.452802419662476, "epoch": 0.9352322206095791, "grad_norm": 0.9453125, "learning_rate": 0.0004919836147387002, "loss": 5.2319, "mean_token_accuracy": 0.18641486167907714, "num_tokens": 21399869.0, "step": 10310 }, { "entropy": 5.499537134170533, "epoch": 0.9356857764876633, "grad_norm": 0.9140625, "learning_rate": 0.0004919750525630151, "loss": 5.2171, "mean_token_accuracy": 0.19221128672361373, "num_tokens": 21410343.0, "step": 10315 }, { "entropy": 5.527597951889038, "epoch": 0.9361393323657474, "grad_norm": 0.9140625, "learning_rate": 0.0004919664859002306, "loss": 5.1953, "mean_token_accuracy": 0.18969294428825378, "num_tokens": 21420915.0, "step": 10320 }, { "entropy": 5.487546443939209, "epoch": 0.9365928882438317, "grad_norm": 0.984375, "learning_rate": 0.0004919579147505239, "loss": 5.1638, "mean_token_accuracy": 0.19285682290792466, "num_tokens": 21430879.0, "step": 10325 }, { "entropy": 5.531203317642212, "epoch": 0.9370464441219158, "grad_norm": 0.9453125, "learning_rate": 0.0004919493391140721, "loss": 5.2574, "mean_token_accuracy": 0.18837825804948807, "num_tokens": 21440843.0, "step": 10330 }, { "entropy": 5.592268323898315, "epoch": 0.9375, "grad_norm": 0.92578125, "learning_rate": 0.0004919407589910529, "loss": 5.4086, "mean_token_accuracy": 0.1807285413146019, "num_tokens": 21452132.0, "step": 10335 }, { "entropy": 5.493322324752808, "epoch": 0.9379535558780842, "grad_norm": 0.98046875, "learning_rate": 0.0004919321743816434, "loss": 5.194, "mean_token_accuracy": 0.18563437461853027, "num_tokens": 21461861.0, "step": 10340 }, { "entropy": 5.499019622802734, "epoch": 0.9384071117561683, "grad_norm": 1.0625, "learning_rate": 0.0004919235852860213, "loss": 5.1976, "mean_token_accuracy": 0.18736050128936768, "num_tokens": 21472244.0, "step": 10345 }, { "entropy": 5.545416593551636, "epoch": 0.9388606676342526, "grad_norm": 1.015625, "learning_rate": 0.0004919149917043641, "loss": 5.2515, "mean_token_accuracy": 0.1836113914847374, "num_tokens": 21482394.0, "step": 10350 }, { "entropy": 5.498862457275391, "epoch": 0.9393142235123367, "grad_norm": 0.88671875, "learning_rate": 0.0004919063936368496, "loss": 5.276, "mean_token_accuracy": 0.18350204527378083, "num_tokens": 21493334.0, "step": 10355 }, { "entropy": 5.553494691848755, "epoch": 0.9397677793904209, "grad_norm": 0.93359375, "learning_rate": 0.0004918977910836557, "loss": 5.2386, "mean_token_accuracy": 0.1844620883464813, "num_tokens": 21504443.0, "step": 10360 }, { "entropy": 5.539630651473999, "epoch": 0.940221335268505, "grad_norm": 0.94140625, "learning_rate": 0.0004918891840449601, "loss": 5.2604, "mean_token_accuracy": 0.18865265250205993, "num_tokens": 21513908.0, "step": 10365 }, { "entropy": 5.566462993621826, "epoch": 0.9406748911465893, "grad_norm": 0.8515625, "learning_rate": 0.000491880572520941, "loss": 5.2809, "mean_token_accuracy": 0.17776426523923874, "num_tokens": 21524349.0, "step": 10370 }, { "entropy": 5.651615619659424, "epoch": 0.9411284470246735, "grad_norm": 0.9453125, "learning_rate": 0.0004918719565117763, "loss": 5.3383, "mean_token_accuracy": 0.18980624675750732, "num_tokens": 21535003.0, "step": 10375 }, { "entropy": 5.603833770751953, "epoch": 0.9415820029027576, "grad_norm": 1.0234375, "learning_rate": 0.0004918633360176444, "loss": 5.3558, "mean_token_accuracy": 0.17872778922319413, "num_tokens": 21545045.0, "step": 10380 }, { "entropy": 5.461150074005127, "epoch": 0.9420355587808418, "grad_norm": 0.9296875, "learning_rate": 0.0004918547110387234, "loss": 5.1816, "mean_token_accuracy": 0.19119360893964768, "num_tokens": 21554830.0, "step": 10385 }, { "entropy": 5.5173086643219, "epoch": 0.9424891146589259, "grad_norm": 1.0078125, "learning_rate": 0.0004918460815751916, "loss": 5.1546, "mean_token_accuracy": 0.19252003729343414, "num_tokens": 21564693.0, "step": 10390 }, { "entropy": 5.464719247817993, "epoch": 0.9429426705370102, "grad_norm": 0.9140625, "learning_rate": 0.0004918374476272277, "loss": 5.1676, "mean_token_accuracy": 0.19065018594264985, "num_tokens": 21575475.0, "step": 10395 }, { "entropy": 5.483359146118164, "epoch": 0.9433962264150944, "grad_norm": 0.890625, "learning_rate": 0.0004918288091950101, "loss": 5.1769, "mean_token_accuracy": 0.188684843480587, "num_tokens": 21586944.0, "step": 10400 }, { "entropy": 5.520866012573242, "epoch": 0.9438497822931785, "grad_norm": 0.94140625, "learning_rate": 0.0004918201662787174, "loss": 5.2096, "mean_token_accuracy": 0.18385448306798935, "num_tokens": 21598170.0, "step": 10405 }, { "entropy": 5.47841067314148, "epoch": 0.9443033381712627, "grad_norm": 0.8515625, "learning_rate": 0.0004918115188785285, "loss": 5.2258, "mean_token_accuracy": 0.1873992457985878, "num_tokens": 21609170.0, "step": 10410 }, { "entropy": 5.554736661911011, "epoch": 0.9447568940493469, "grad_norm": 0.8828125, "learning_rate": 0.0004918028669946221, "loss": 5.2796, "mean_token_accuracy": 0.18662892132997513, "num_tokens": 21620171.0, "step": 10415 }, { "entropy": 5.514125776290894, "epoch": 0.9452104499274311, "grad_norm": 1.1171875, "learning_rate": 0.0004917942106271771, "loss": 5.2234, "mean_token_accuracy": 0.19277503490447997, "num_tokens": 21631072.0, "step": 10420 }, { "entropy": 5.437767839431762, "epoch": 0.9456640058055152, "grad_norm": 0.94140625, "learning_rate": 0.0004917855497763727, "loss": 5.0861, "mean_token_accuracy": 0.19857796430587768, "num_tokens": 21641543.0, "step": 10425 }, { "entropy": 5.445878791809082, "epoch": 0.9461175616835994, "grad_norm": 1.171875, "learning_rate": 0.0004917768844423878, "loss": 5.2319, "mean_token_accuracy": 0.19050681293010713, "num_tokens": 21651342.0, "step": 10430 }, { "entropy": 5.514336013793946, "epoch": 0.9465711175616836, "grad_norm": 0.96875, "learning_rate": 0.0004917682146254017, "loss": 5.1868, "mean_token_accuracy": 0.19425029307603836, "num_tokens": 21661043.0, "step": 10435 }, { "entropy": 5.445535373687744, "epoch": 0.9470246734397678, "grad_norm": 0.89453125, "learning_rate": 0.0004917595403255938, "loss": 5.0752, "mean_token_accuracy": 0.20240829586982728, "num_tokens": 21671197.0, "step": 10440 }, { "entropy": 5.40161247253418, "epoch": 0.947478229317852, "grad_norm": 0.94140625, "learning_rate": 0.0004917508615431431, "loss": 5.1289, "mean_token_accuracy": 0.19438163042068482, "num_tokens": 21682066.0, "step": 10445 }, { "entropy": 5.521121835708618, "epoch": 0.9479317851959361, "grad_norm": 0.98828125, "learning_rate": 0.0004917421782782296, "loss": 5.193, "mean_token_accuracy": 0.19061861038208008, "num_tokens": 21692117.0, "step": 10450 }, { "entropy": 5.518373441696167, "epoch": 0.9483853410740203, "grad_norm": 0.97265625, "learning_rate": 0.0004917334905310325, "loss": 5.302, "mean_token_accuracy": 0.183126300573349, "num_tokens": 21703544.0, "step": 10455 }, { "entropy": 5.4479773998260494, "epoch": 0.9488388969521045, "grad_norm": 1.0859375, "learning_rate": 0.0004917247983017317, "loss": 5.1334, "mean_token_accuracy": 0.19209074079990388, "num_tokens": 21712850.0, "step": 10460 }, { "entropy": 5.4908843517303465, "epoch": 0.9492924528301887, "grad_norm": 0.94921875, "learning_rate": 0.0004917161015905067, "loss": 5.2731, "mean_token_accuracy": 0.1897297501564026, "num_tokens": 21723015.0, "step": 10465 }, { "entropy": 5.532942295074463, "epoch": 0.9497460087082729, "grad_norm": 1.015625, "learning_rate": 0.0004917074003975376, "loss": 5.2384, "mean_token_accuracy": 0.18643336445093156, "num_tokens": 21732453.0, "step": 10470 }, { "entropy": 5.5696944236755375, "epoch": 0.950199564586357, "grad_norm": 0.98828125, "learning_rate": 0.0004916986947230042, "loss": 5.3059, "mean_token_accuracy": 0.18505144864320755, "num_tokens": 21743251.0, "step": 10475 }, { "entropy": 5.516680526733398, "epoch": 0.9506531204644412, "grad_norm": 0.98828125, "learning_rate": 0.0004916899845670866, "loss": 5.2131, "mean_token_accuracy": 0.18668761998414993, "num_tokens": 21752891.0, "step": 10480 }, { "entropy": 5.535280227661133, "epoch": 0.9511066763425254, "grad_norm": 0.93359375, "learning_rate": 0.0004916812699299649, "loss": 5.2144, "mean_token_accuracy": 0.19159982055425645, "num_tokens": 21763230.0, "step": 10485 }, { "entropy": 5.482826519012451, "epoch": 0.9515602322206096, "grad_norm": 0.921875, "learning_rate": 0.0004916725508118193, "loss": 5.1622, "mean_token_accuracy": 0.19009662866592408, "num_tokens": 21773663.0, "step": 10490 }, { "entropy": 5.464633321762085, "epoch": 0.9520137880986937, "grad_norm": 0.91796875, "learning_rate": 0.0004916638272128301, "loss": 5.2258, "mean_token_accuracy": 0.1891879215836525, "num_tokens": 21784265.0, "step": 10495 }, { "entropy": 5.4609263896942135, "epoch": 0.9524673439767779, "grad_norm": 1.0, "learning_rate": 0.0004916550991331777, "loss": 5.1746, "mean_token_accuracy": 0.19152846932411194, "num_tokens": 21795056.0, "step": 10500 }, { "entropy": 5.498981094360351, "epoch": 0.9529208998548622, "grad_norm": 0.88671875, "learning_rate": 0.0004916463665730427, "loss": 5.1927, "mean_token_accuracy": 0.19459545016288757, "num_tokens": 21806204.0, "step": 10505 }, { "entropy": 5.49833664894104, "epoch": 0.9533744557329463, "grad_norm": 0.94140625, "learning_rate": 0.0004916376295326057, "loss": 5.2152, "mean_token_accuracy": 0.1886645570397377, "num_tokens": 21816993.0, "step": 10510 }, { "entropy": 5.439201021194458, "epoch": 0.9538280116110305, "grad_norm": 0.9375, "learning_rate": 0.0004916288880120472, "loss": 5.0649, "mean_token_accuracy": 0.2021304950118065, "num_tokens": 21827457.0, "step": 10515 }, { "entropy": 5.504736804962159, "epoch": 0.9542815674891146, "grad_norm": 0.95703125, "learning_rate": 0.0004916201420115482, "loss": 5.1988, "mean_token_accuracy": 0.18791094422340393, "num_tokens": 21837555.0, "step": 10520 }, { "entropy": 5.517563915252685, "epoch": 0.9547351233671988, "grad_norm": 0.9453125, "learning_rate": 0.0004916113915312895, "loss": 5.2174, "mean_token_accuracy": 0.19141177833080292, "num_tokens": 21847074.0, "step": 10525 }, { "entropy": 5.554729223251343, "epoch": 0.9551886792452831, "grad_norm": 0.9609375, "learning_rate": 0.0004916026365714519, "loss": 5.198, "mean_token_accuracy": 0.18883113265037538, "num_tokens": 21858333.0, "step": 10530 }, { "entropy": 5.469289255142212, "epoch": 0.9556422351233672, "grad_norm": 1.03125, "learning_rate": 0.0004915938771322165, "loss": 5.2141, "mean_token_accuracy": 0.19106341451406478, "num_tokens": 21869132.0, "step": 10535 }, { "entropy": 5.455795764923096, "epoch": 0.9560957910014514, "grad_norm": 1.0, "learning_rate": 0.0004915851132137646, "loss": 5.2446, "mean_token_accuracy": 0.1872527241706848, "num_tokens": 21879153.0, "step": 10540 }, { "entropy": 5.502502346038819, "epoch": 0.9565493468795355, "grad_norm": 0.87109375, "learning_rate": 0.0004915763448162774, "loss": 5.1259, "mean_token_accuracy": 0.19310393184423447, "num_tokens": 21889063.0, "step": 10545 }, { "entropy": 5.538162755966186, "epoch": 0.9570029027576198, "grad_norm": 1.0859375, "learning_rate": 0.0004915675719399362, "loss": 5.2476, "mean_token_accuracy": 0.18670725971460342, "num_tokens": 21899005.0, "step": 10550 }, { "entropy": 5.509344387054443, "epoch": 0.9574564586357039, "grad_norm": 1.03125, "learning_rate": 0.0004915587945849225, "loss": 5.1119, "mean_token_accuracy": 0.19825160056352614, "num_tokens": 21908391.0, "step": 10555 }, { "entropy": 5.460941791534424, "epoch": 0.9579100145137881, "grad_norm": 0.953125, "learning_rate": 0.0004915500127514176, "loss": 5.193, "mean_token_accuracy": 0.19470654428005219, "num_tokens": 21917655.0, "step": 10560 }, { "entropy": 5.555629873275757, "epoch": 0.9583635703918723, "grad_norm": 0.99609375, "learning_rate": 0.0004915412264396034, "loss": 5.2493, "mean_token_accuracy": 0.19042410403490068, "num_tokens": 21928038.0, "step": 10565 }, { "entropy": 5.521947193145752, "epoch": 0.9588171262699564, "grad_norm": 1.0, "learning_rate": 0.0004915324356496613, "loss": 5.14, "mean_token_accuracy": 0.19917869120836257, "num_tokens": 21938106.0, "step": 10570 }, { "entropy": 5.487814474105835, "epoch": 0.9592706821480407, "grad_norm": 0.96875, "learning_rate": 0.0004915236403817733, "loss": 5.1474, "mean_token_accuracy": 0.19220392405986786, "num_tokens": 21947484.0, "step": 10575 }, { "entropy": 5.473394870758057, "epoch": 0.9597242380261248, "grad_norm": 0.9765625, "learning_rate": 0.0004915148406361213, "loss": 5.2315, "mean_token_accuracy": 0.18975483775138854, "num_tokens": 21957139.0, "step": 10580 }, { "entropy": 5.487856483459472, "epoch": 0.960177793904209, "grad_norm": 1.046875, "learning_rate": 0.0004915060364128872, "loss": 5.2299, "mean_token_accuracy": 0.185565547645092, "num_tokens": 21967030.0, "step": 10585 }, { "entropy": 5.448148107528686, "epoch": 0.9606313497822931, "grad_norm": 1.0234375, "learning_rate": 0.0004914972277122532, "loss": 5.169, "mean_token_accuracy": 0.1888902634382248, "num_tokens": 21976418.0, "step": 10590 }, { "entropy": 5.49601378440857, "epoch": 0.9610849056603774, "grad_norm": 0.890625, "learning_rate": 0.0004914884145344012, "loss": 5.1779, "mean_token_accuracy": 0.19263349920511247, "num_tokens": 21987284.0, "step": 10595 }, { "entropy": 5.42640495300293, "epoch": 0.9615384615384616, "grad_norm": 0.90625, "learning_rate": 0.0004914795968795137, "loss": 5.103, "mean_token_accuracy": 0.1972813591361046, "num_tokens": 21997106.0, "step": 10600 }, { "entropy": 5.467606544494629, "epoch": 0.9619920174165457, "grad_norm": 0.9296875, "learning_rate": 0.0004914707747477728, "loss": 5.0823, "mean_token_accuracy": 0.192961286008358, "num_tokens": 22007589.0, "step": 10605 }, { "entropy": 5.48398494720459, "epoch": 0.9624455732946299, "grad_norm": 0.9765625, "learning_rate": 0.0004914619481393613, "loss": 5.2221, "mean_token_accuracy": 0.189901639521122, "num_tokens": 22017669.0, "step": 10610 }, { "entropy": 5.617108011245728, "epoch": 0.962899129172714, "grad_norm": 0.90625, "learning_rate": 0.0004914531170544615, "loss": 5.3711, "mean_token_accuracy": 0.18461449742317199, "num_tokens": 22029330.0, "step": 10615 }, { "entropy": 5.473918676376343, "epoch": 0.9633526850507983, "grad_norm": 0.9765625, "learning_rate": 0.0004914442814932561, "loss": 5.1331, "mean_token_accuracy": 0.19325099438428878, "num_tokens": 22039877.0, "step": 10620 }, { "entropy": 5.480970811843872, "epoch": 0.9638062409288825, "grad_norm": 1.0, "learning_rate": 0.0004914354414559278, "loss": 5.2025, "mean_token_accuracy": 0.19430873394012452, "num_tokens": 22049579.0, "step": 10625 }, { "entropy": 5.378883743286133, "epoch": 0.9642597968069666, "grad_norm": 0.99609375, "learning_rate": 0.0004914265969426594, "loss": 5.0784, "mean_token_accuracy": 0.20659508407115937, "num_tokens": 22059608.0, "step": 10630 }, { "entropy": 5.469490385055542, "epoch": 0.9647133526850508, "grad_norm": 0.96484375, "learning_rate": 0.0004914177479536338, "loss": 5.2372, "mean_token_accuracy": 0.186066897213459, "num_tokens": 22070036.0, "step": 10635 }, { "entropy": 5.514468145370484, "epoch": 0.965166908563135, "grad_norm": 0.9140625, "learning_rate": 0.000491408894489034, "loss": 5.2266, "mean_token_accuracy": 0.18473343849182128, "num_tokens": 22080679.0, "step": 10640 }, { "entropy": 5.485489368438721, "epoch": 0.9656204644412192, "grad_norm": 0.875, "learning_rate": 0.0004914000365490432, "loss": 5.0439, "mean_token_accuracy": 0.20180499255657197, "num_tokens": 22092192.0, "step": 10645 }, { "entropy": 5.480154228210449, "epoch": 0.9660740203193033, "grad_norm": 0.89453125, "learning_rate": 0.0004913911741338445, "loss": 5.2587, "mean_token_accuracy": 0.18562012463808059, "num_tokens": 22102722.0, "step": 10650 }, { "entropy": 5.419040966033935, "epoch": 0.9665275761973875, "grad_norm": 0.94921875, "learning_rate": 0.0004913823072436211, "loss": 5.1247, "mean_token_accuracy": 0.2006438970565796, "num_tokens": 22113521.0, "step": 10655 }, { "entropy": 5.514348745346069, "epoch": 0.9669811320754716, "grad_norm": 0.921875, "learning_rate": 0.0004913734358785565, "loss": 5.2083, "mean_token_accuracy": 0.19085652083158494, "num_tokens": 22124891.0, "step": 10660 }, { "entropy": 5.4864380836486815, "epoch": 0.9674346879535559, "grad_norm": 0.9375, "learning_rate": 0.0004913645600388341, "loss": 5.2233, "mean_token_accuracy": 0.18323416858911515, "num_tokens": 22135972.0, "step": 10665 }, { "entropy": 5.536486482620239, "epoch": 0.9678882438316401, "grad_norm": 0.9453125, "learning_rate": 0.0004913556797246374, "loss": 5.2795, "mean_token_accuracy": 0.17618962824344636, "num_tokens": 22146623.0, "step": 10670 }, { "entropy": 5.481680917739868, "epoch": 0.9683417997097242, "grad_norm": 0.90234375, "learning_rate": 0.0004913467949361503, "loss": 5.2002, "mean_token_accuracy": 0.18713169544935226, "num_tokens": 22157619.0, "step": 10675 }, { "entropy": 5.543104553222657, "epoch": 0.9687953555878084, "grad_norm": 0.89453125, "learning_rate": 0.0004913379056735561, "loss": 5.1873, "mean_token_accuracy": 0.1843522697687149, "num_tokens": 22168655.0, "step": 10680 }, { "entropy": 5.477829074859619, "epoch": 0.9692489114658926, "grad_norm": 0.92578125, "learning_rate": 0.000491329011937039, "loss": 5.2341, "mean_token_accuracy": 0.18528518527746202, "num_tokens": 22178500.0, "step": 10685 }, { "entropy": 5.516538763046265, "epoch": 0.9697024673439768, "grad_norm": 0.95703125, "learning_rate": 0.0004913201137267828, "loss": 5.2278, "mean_token_accuracy": 0.18400785326957703, "num_tokens": 22188873.0, "step": 10690 }, { "entropy": 5.441410827636719, "epoch": 0.970156023222061, "grad_norm": 0.88671875, "learning_rate": 0.0004913112110429715, "loss": 5.1433, "mean_token_accuracy": 0.19197122305631636, "num_tokens": 22199743.0, "step": 10695 }, { "entropy": 5.446821880340576, "epoch": 0.9706095791001451, "grad_norm": 1.0390625, "learning_rate": 0.0004913023038857892, "loss": 5.096, "mean_token_accuracy": 0.1934520870447159, "num_tokens": 22210301.0, "step": 10700 }, { "entropy": 5.454444456100464, "epoch": 0.9710631349782293, "grad_norm": 0.91015625, "learning_rate": 0.0004912933922554203, "loss": 5.1086, "mean_token_accuracy": 0.19499189853668214, "num_tokens": 22220771.0, "step": 10705 }, { "entropy": 5.497599124908447, "epoch": 0.9715166908563135, "grad_norm": 0.890625, "learning_rate": 0.0004912844761520487, "loss": 5.2156, "mean_token_accuracy": 0.18877754956483841, "num_tokens": 22231100.0, "step": 10710 }, { "entropy": 5.513539361953735, "epoch": 0.9719702467343977, "grad_norm": 0.90234375, "learning_rate": 0.0004912755555758592, "loss": 5.1916, "mean_token_accuracy": 0.19085400849580764, "num_tokens": 22240997.0, "step": 10715 }, { "entropy": 5.515014171600342, "epoch": 0.9724238026124818, "grad_norm": 0.98828125, "learning_rate": 0.000491266630527036, "loss": 5.2256, "mean_token_accuracy": 0.18837058991193772, "num_tokens": 22251795.0, "step": 10720 }, { "entropy": 5.54486312866211, "epoch": 0.972877358490566, "grad_norm": 0.94921875, "learning_rate": 0.0004912577010057638, "loss": 5.2592, "mean_token_accuracy": 0.1850780189037323, "num_tokens": 22262465.0, "step": 10725 }, { "entropy": 5.606755971908569, "epoch": 0.9733309143686503, "grad_norm": 0.96875, "learning_rate": 0.0004912487670122273, "loss": 5.3558, "mean_token_accuracy": 0.18126363158226014, "num_tokens": 22272399.0, "step": 10730 }, { "entropy": 5.5661256313323975, "epoch": 0.9737844702467344, "grad_norm": 1.046875, "learning_rate": 0.0004912398285466111, "loss": 5.2756, "mean_token_accuracy": 0.18773142844438553, "num_tokens": 22282545.0, "step": 10735 }, { "entropy": 5.54059739112854, "epoch": 0.9742380261248186, "grad_norm": 1.015625, "learning_rate": 0.0004912308856091002, "loss": 5.2244, "mean_token_accuracy": 0.19068962037563325, "num_tokens": 22293154.0, "step": 10740 }, { "entropy": 5.5106744289398195, "epoch": 0.9746915820029027, "grad_norm": 0.94140625, "learning_rate": 0.0004912219381998795, "loss": 5.1466, "mean_token_accuracy": 0.19592952430248262, "num_tokens": 22302309.0, "step": 10745 }, { "entropy": 5.534269857406616, "epoch": 0.9751451378809869, "grad_norm": 0.9609375, "learning_rate": 0.0004912129863191339, "loss": 5.2587, "mean_token_accuracy": 0.17782827466726303, "num_tokens": 22312316.0, "step": 10750 }, { "entropy": 5.525972032546997, "epoch": 0.9755986937590712, "grad_norm": 0.9296875, "learning_rate": 0.0004912040299670487, "loss": 5.2329, "mean_token_accuracy": 0.19108207672834396, "num_tokens": 22322387.0, "step": 10755 }, { "entropy": 5.502649593353271, "epoch": 0.9760522496371553, "grad_norm": 0.984375, "learning_rate": 0.0004911950691438091, "loss": 5.2336, "mean_token_accuracy": 0.19430004805326462, "num_tokens": 22332759.0, "step": 10760 }, { "entropy": 5.5075767993927, "epoch": 0.9765058055152395, "grad_norm": 0.80859375, "learning_rate": 0.0004911861038496004, "loss": 5.2656, "mean_token_accuracy": 0.18402133882045746, "num_tokens": 22344056.0, "step": 10765 }, { "entropy": 5.455955648422242, "epoch": 0.9769593613933236, "grad_norm": 0.90625, "learning_rate": 0.0004911771340846079, "loss": 5.2084, "mean_token_accuracy": 0.18565851747989653, "num_tokens": 22353877.0, "step": 10770 }, { "entropy": 5.542308616638183, "epoch": 0.9774129172714079, "grad_norm": 0.9921875, "learning_rate": 0.0004911681598490172, "loss": 5.2525, "mean_token_accuracy": 0.1882826343178749, "num_tokens": 22363549.0, "step": 10775 }, { "entropy": 5.567686128616333, "epoch": 0.977866473149492, "grad_norm": 0.99609375, "learning_rate": 0.0004911591811430139, "loss": 5.2817, "mean_token_accuracy": 0.1853038787841797, "num_tokens": 22374040.0, "step": 10780 }, { "entropy": 5.568281555175782, "epoch": 0.9783200290275762, "grad_norm": 1.03125, "learning_rate": 0.0004911501979667836, "loss": 5.3363, "mean_token_accuracy": 0.18623031675815582, "num_tokens": 22384819.0, "step": 10785 }, { "entropy": 5.527229642868042, "epoch": 0.9787735849056604, "grad_norm": 0.95703125, "learning_rate": 0.0004911412103205122, "loss": 5.199, "mean_token_accuracy": 0.19130196273326874, "num_tokens": 22395130.0, "step": 10790 }, { "entropy": 5.504364633560181, "epoch": 0.9792271407837445, "grad_norm": 0.9453125, "learning_rate": 0.0004911322182043855, "loss": 5.2072, "mean_token_accuracy": 0.18604805320501328, "num_tokens": 22405093.0, "step": 10795 }, { "entropy": 5.493117141723633, "epoch": 0.9796806966618288, "grad_norm": 0.92578125, "learning_rate": 0.0004911232216185893, "loss": 5.2306, "mean_token_accuracy": 0.18620621860027314, "num_tokens": 22415008.0, "step": 10800 }, { "entropy": 5.524082040786743, "epoch": 0.9801342525399129, "grad_norm": 0.92578125, "learning_rate": 0.0004911142205633099, "loss": 5.2778, "mean_token_accuracy": 0.1835907757282257, "num_tokens": 22426486.0, "step": 10805 }, { "entropy": 5.492581939697265, "epoch": 0.9805878084179971, "grad_norm": 0.94140625, "learning_rate": 0.0004911052150387334, "loss": 5.1811, "mean_token_accuracy": 0.18908338397741317, "num_tokens": 22436844.0, "step": 10810 }, { "entropy": 5.553999710083008, "epoch": 0.9810413642960812, "grad_norm": 1.125, "learning_rate": 0.0004910962050450458, "loss": 5.3059, "mean_token_accuracy": 0.18974106162786483, "num_tokens": 22446630.0, "step": 10815 }, { "entropy": 5.542135238647461, "epoch": 0.9814949201741655, "grad_norm": 0.9921875, "learning_rate": 0.0004910871905824338, "loss": 5.1387, "mean_token_accuracy": 0.1928548112511635, "num_tokens": 22456406.0, "step": 10820 }, { "entropy": 5.45408296585083, "epoch": 0.9819484760522497, "grad_norm": 0.9921875, "learning_rate": 0.0004910781716510837, "loss": 5.138, "mean_token_accuracy": 0.1933705762028694, "num_tokens": 22466210.0, "step": 10825 }, { "entropy": 5.4947069644927975, "epoch": 0.9824020319303338, "grad_norm": 0.9609375, "learning_rate": 0.0004910691482511817, "loss": 5.2356, "mean_token_accuracy": 0.1944747418165207, "num_tokens": 22476978.0, "step": 10830 }, { "entropy": 5.59715723991394, "epoch": 0.982855587808418, "grad_norm": 0.9453125, "learning_rate": 0.0004910601203829148, "loss": 5.194, "mean_token_accuracy": 0.18800618201494218, "num_tokens": 22488613.0, "step": 10835 }, { "entropy": 5.467583513259887, "epoch": 0.9833091436865021, "grad_norm": 0.96484375, "learning_rate": 0.0004910510880464696, "loss": 5.1093, "mean_token_accuracy": 0.20096988826990128, "num_tokens": 22498312.0, "step": 10840 }, { "entropy": 5.482868099212647, "epoch": 0.9837626995645864, "grad_norm": 1.0, "learning_rate": 0.0004910420512420327, "loss": 5.2111, "mean_token_accuracy": 0.1898895427584648, "num_tokens": 22508131.0, "step": 10845 }, { "entropy": 5.539039945602417, "epoch": 0.9842162554426706, "grad_norm": 0.9765625, "learning_rate": 0.0004910330099697913, "loss": 5.2132, "mean_token_accuracy": 0.1903369903564453, "num_tokens": 22517842.0, "step": 10850 }, { "entropy": 5.527409839630127, "epoch": 0.9846698113207547, "grad_norm": 0.94140625, "learning_rate": 0.0004910239642299321, "loss": 5.1837, "mean_token_accuracy": 0.19023292511701584, "num_tokens": 22528239.0, "step": 10855 }, { "entropy": 5.466523361206055, "epoch": 0.9851233671988389, "grad_norm": 0.890625, "learning_rate": 0.0004910149140226422, "loss": 5.1724, "mean_token_accuracy": 0.1914309471845627, "num_tokens": 22539734.0, "step": 10860 }, { "entropy": 5.503134536743164, "epoch": 0.9855769230769231, "grad_norm": 0.90625, "learning_rate": 0.0004910058593481089, "loss": 5.1701, "mean_token_accuracy": 0.19570856541395187, "num_tokens": 22549796.0, "step": 10865 }, { "entropy": 5.4575072765350345, "epoch": 0.9860304789550073, "grad_norm": 0.98828125, "learning_rate": 0.0004909968002065195, "loss": 5.158, "mean_token_accuracy": 0.1910772830247879, "num_tokens": 22559934.0, "step": 10870 }, { "entropy": 5.6052713871002195, "epoch": 0.9864840348330914, "grad_norm": 1.0234375, "learning_rate": 0.000490987736598061, "loss": 5.2598, "mean_token_accuracy": 0.1797322601079941, "num_tokens": 22569864.0, "step": 10875 }, { "entropy": 5.504677820205688, "epoch": 0.9869375907111756, "grad_norm": 0.890625, "learning_rate": 0.0004909786685229211, "loss": 5.1964, "mean_token_accuracy": 0.19451596289873124, "num_tokens": 22580687.0, "step": 10880 }, { "entropy": 5.538554286956787, "epoch": 0.9873911465892597, "grad_norm": 0.9765625, "learning_rate": 0.0004909695959812875, "loss": 5.2494, "mean_token_accuracy": 0.18825656920671463, "num_tokens": 22590507.0, "step": 10885 }, { "entropy": 5.55866584777832, "epoch": 0.987844702467344, "grad_norm": 1.0234375, "learning_rate": 0.0004909605189733474, "loss": 5.2668, "mean_token_accuracy": 0.18947904407978058, "num_tokens": 22601901.0, "step": 10890 }, { "entropy": 5.501526641845703, "epoch": 0.9882982583454282, "grad_norm": 1.0078125, "learning_rate": 0.0004909514374992889, "loss": 5.2155, "mean_token_accuracy": 0.18769705891609192, "num_tokens": 22613003.0, "step": 10895 }, { "entropy": 5.447288465499878, "epoch": 0.9887518142235123, "grad_norm": 0.98828125, "learning_rate": 0.0004909423515592996, "loss": 5.0577, "mean_token_accuracy": 0.1979197680950165, "num_tokens": 22623401.0, "step": 10900 }, { "entropy": 5.519672107696533, "epoch": 0.9892053701015965, "grad_norm": 1.0, "learning_rate": 0.0004909332611535675, "loss": 5.2108, "mean_token_accuracy": 0.1883891209959984, "num_tokens": 22633147.0, "step": 10905 }, { "entropy": 5.47981538772583, "epoch": 0.9896589259796807, "grad_norm": 0.8984375, "learning_rate": 0.0004909241662822804, "loss": 5.0727, "mean_token_accuracy": 0.20440202653408052, "num_tokens": 22642990.0, "step": 10910 }, { "entropy": 5.50399341583252, "epoch": 0.9901124818577649, "grad_norm": 1.0, "learning_rate": 0.0004909150669456265, "loss": 5.2827, "mean_token_accuracy": 0.18473678827285767, "num_tokens": 22652734.0, "step": 10915 }, { "entropy": 5.488545656204224, "epoch": 0.9905660377358491, "grad_norm": 0.94921875, "learning_rate": 0.000490905963143794, "loss": 5.2849, "mean_token_accuracy": 0.18099266439676284, "num_tokens": 22662968.0, "step": 10920 }, { "entropy": 5.44248948097229, "epoch": 0.9910195936139332, "grad_norm": 0.95703125, "learning_rate": 0.0004908968548769713, "loss": 5.1281, "mean_token_accuracy": 0.20352931469678878, "num_tokens": 22673157.0, "step": 10925 }, { "entropy": 5.515015172958374, "epoch": 0.9914731494920174, "grad_norm": 1.0078125, "learning_rate": 0.0004908877421453466, "loss": 5.2599, "mean_token_accuracy": 0.18747966289520263, "num_tokens": 22683105.0, "step": 10930 }, { "entropy": 5.4896814823150635, "epoch": 0.9919267053701016, "grad_norm": 0.9453125, "learning_rate": 0.0004908786249491082, "loss": 5.2022, "mean_token_accuracy": 0.1996642142534256, "num_tokens": 22693793.0, "step": 10935 }, { "entropy": 5.618080711364746, "epoch": 0.9923802612481858, "grad_norm": 1.0, "learning_rate": 0.000490869503288445, "loss": 5.252, "mean_token_accuracy": 0.18813893795013428, "num_tokens": 22703884.0, "step": 10940 }, { "entropy": 5.548908472061157, "epoch": 0.99283381712627, "grad_norm": 0.9921875, "learning_rate": 0.0004908603771635454, "loss": 5.2763, "mean_token_accuracy": 0.18646926432847977, "num_tokens": 22713699.0, "step": 10945 }, { "entropy": 5.472669267654419, "epoch": 0.9932873730043541, "grad_norm": 1.0, "learning_rate": 0.0004908512465745982, "loss": 5.1256, "mean_token_accuracy": 0.19451946765184402, "num_tokens": 22722871.0, "step": 10950 }, { "entropy": 5.479227352142334, "epoch": 0.9937409288824384, "grad_norm": 0.9765625, "learning_rate": 0.0004908421115217922, "loss": 5.1383, "mean_token_accuracy": 0.1876304790377617, "num_tokens": 22733314.0, "step": 10955 }, { "entropy": 5.432501792907715, "epoch": 0.9941944847605225, "grad_norm": 0.953125, "learning_rate": 0.0004908329720053164, "loss": 5.1323, "mean_token_accuracy": 0.19701928347349168, "num_tokens": 22743255.0, "step": 10960 }, { "entropy": 5.412756109237671, "epoch": 0.9946480406386067, "grad_norm": 0.9296875, "learning_rate": 0.0004908238280253597, "loss": 5.1195, "mean_token_accuracy": 0.19759708195924758, "num_tokens": 22753857.0, "step": 10965 }, { "entropy": 5.531611490249634, "epoch": 0.9951015965166908, "grad_norm": 1.0078125, "learning_rate": 0.0004908146795821112, "loss": 5.1134, "mean_token_accuracy": 0.19179392755031585, "num_tokens": 22764326.0, "step": 10970 }, { "entropy": 5.5185198307037355, "epoch": 0.995555152394775, "grad_norm": 0.96484375, "learning_rate": 0.0004908055266757602, "loss": 5.1934, "mean_token_accuracy": 0.19486576914787293, "num_tokens": 22774958.0, "step": 10975 }, { "entropy": 5.425844955444336, "epoch": 0.9960087082728593, "grad_norm": 0.99609375, "learning_rate": 0.0004907963693064958, "loss": 5.1128, "mean_token_accuracy": 0.1925733730196953, "num_tokens": 22785616.0, "step": 10980 }, { "entropy": 5.565258312225342, "epoch": 0.9964622641509434, "grad_norm": 0.8359375, "learning_rate": 0.0004907872074745075, "loss": 5.2837, "mean_token_accuracy": 0.1845133572816849, "num_tokens": 22795967.0, "step": 10985 }, { "entropy": 5.490162181854248, "epoch": 0.9969158200290276, "grad_norm": 0.96484375, "learning_rate": 0.0004907780411799849, "loss": 5.2794, "mean_token_accuracy": 0.18557634502649306, "num_tokens": 22806335.0, "step": 10990 }, { "entropy": 5.548031806945801, "epoch": 0.9973693759071117, "grad_norm": 0.96484375, "learning_rate": 0.0004907688704231173, "loss": 5.2144, "mean_token_accuracy": 0.19313637167215347, "num_tokens": 22816390.0, "step": 10995 }, { "entropy": 5.6186151027679445, "epoch": 0.997822931785196, "grad_norm": 1.0, "learning_rate": 0.0004907596952040945, "loss": 5.2726, "mean_token_accuracy": 0.18671630173921586, "num_tokens": 22826395.0, "step": 11000 }, { "entropy": 5.547494173049927, "epoch": 0.9982764876632801, "grad_norm": 0.9921875, "learning_rate": 0.0004907505155231063, "loss": 5.2584, "mean_token_accuracy": 0.18838359266519547, "num_tokens": 22836790.0, "step": 11005 }, { "entropy": 5.488029050827026, "epoch": 0.9987300435413643, "grad_norm": 0.97265625, "learning_rate": 0.0004907413313803424, "loss": 5.1407, "mean_token_accuracy": 0.19004008322954177, "num_tokens": 22846687.0, "step": 11010 }, { "entropy": 5.53559718132019, "epoch": 0.9991835994194485, "grad_norm": 0.96875, "learning_rate": 0.0004907321427759928, "loss": 5.168, "mean_token_accuracy": 0.19271109402179717, "num_tokens": 22857208.0, "step": 11015 }, { "entropy": 5.513091611862182, "epoch": 0.9996371552975326, "grad_norm": 0.88671875, "learning_rate": 0.0004907229497102475, "loss": 5.2714, "mean_token_accuracy": 0.18417642563581466, "num_tokens": 22868556.0, "step": 11020 }, { "entropy": 5.550210618972779, "epoch": 1.0000907111756168, "grad_norm": 0.79296875, "learning_rate": 0.0004907137521832966, "loss": 5.2531, "mean_token_accuracy": 0.18888288289308547, "num_tokens": 22880081.0, "step": 11025 }, { "entropy": 5.494132804870605, "epoch": 1.000544267053701, "grad_norm": 0.83984375, "learning_rate": 0.0004907045501953304, "loss": 5.0935, "mean_token_accuracy": 0.19637981653213502, "num_tokens": 22892141.0, "step": 11030 }, { "entropy": 5.521714591979981, "epoch": 1.0009978229317853, "grad_norm": 0.92578125, "learning_rate": 0.000490695343746539, "loss": 5.1043, "mean_token_accuracy": 0.19702826887369157, "num_tokens": 22902688.0, "step": 11035 }, { "entropy": 5.4263575077056885, "epoch": 1.0014513788098693, "grad_norm": 1.046875, "learning_rate": 0.0004906861328371131, "loss": 5.0424, "mean_token_accuracy": 0.1953244224190712, "num_tokens": 22912453.0, "step": 11040 }, { "entropy": 5.511580848693848, "epoch": 1.0019049346879536, "grad_norm": 0.96484375, "learning_rate": 0.0004906769174672429, "loss": 5.2007, "mean_token_accuracy": 0.18563229739665985, "num_tokens": 22923167.0, "step": 11045 }, { "entropy": 5.539322376251221, "epoch": 1.0023584905660377, "grad_norm": 0.953125, "learning_rate": 0.000490667697637119, "loss": 5.1607, "mean_token_accuracy": 0.18884927779436111, "num_tokens": 22934753.0, "step": 11050 }, { "entropy": 5.468543291091919, "epoch": 1.002812046444122, "grad_norm": 1.015625, "learning_rate": 0.0004906584733469324, "loss": 5.0864, "mean_token_accuracy": 0.20028799921274185, "num_tokens": 22945277.0, "step": 11055 }, { "entropy": 5.522582197189331, "epoch": 1.0032656023222062, "grad_norm": 1.0625, "learning_rate": 0.0004906492445968735, "loss": 5.153, "mean_token_accuracy": 0.18677352368831635, "num_tokens": 22955797.0, "step": 11060 }, { "entropy": 5.507099533081055, "epoch": 1.0037191582002902, "grad_norm": 0.9609375, "learning_rate": 0.0004906400113871332, "loss": 5.1494, "mean_token_accuracy": 0.19461202323436738, "num_tokens": 22965969.0, "step": 11065 }, { "entropy": 5.490888786315918, "epoch": 1.0041727140783745, "grad_norm": 1.0703125, "learning_rate": 0.0004906307737179026, "loss": 5.0969, "mean_token_accuracy": 0.20535642355680467, "num_tokens": 22975323.0, "step": 11070 }, { "entropy": 5.465540266036987, "epoch": 1.0046262699564585, "grad_norm": 0.890625, "learning_rate": 0.0004906215315893726, "loss": 5.1059, "mean_token_accuracy": 0.19620248824357986, "num_tokens": 22985063.0, "step": 11075 }, { "entropy": 5.544905090332032, "epoch": 1.0050798258345428, "grad_norm": 0.890625, "learning_rate": 0.0004906122850017344, "loss": 5.2382, "mean_token_accuracy": 0.1847388505935669, "num_tokens": 22996001.0, "step": 11080 }, { "entropy": 5.487858152389526, "epoch": 1.005533381712627, "grad_norm": 0.97265625, "learning_rate": 0.0004906030339551792, "loss": 5.1552, "mean_token_accuracy": 0.1921267867088318, "num_tokens": 23006896.0, "step": 11085 }, { "entropy": 5.534958028793335, "epoch": 1.0059869375907111, "grad_norm": 0.96875, "learning_rate": 0.0004905937784498983, "loss": 5.1214, "mean_token_accuracy": 0.19611595422029496, "num_tokens": 23017080.0, "step": 11090 }, { "entropy": 5.504563283920288, "epoch": 1.0064404934687954, "grad_norm": 1.078125, "learning_rate": 0.0004905845184860831, "loss": 5.0746, "mean_token_accuracy": 0.19814439564943315, "num_tokens": 23027168.0, "step": 11095 }, { "entropy": 5.45788164138794, "epoch": 1.0068940493468794, "grad_norm": 0.93359375, "learning_rate": 0.0004905752540639252, "loss": 5.1253, "mean_token_accuracy": 0.1916827917098999, "num_tokens": 23037364.0, "step": 11100 }, { "entropy": 5.4299335956573485, "epoch": 1.0073476052249637, "grad_norm": 0.984375, "learning_rate": 0.0004905659851836161, "loss": 5.0356, "mean_token_accuracy": 0.19612774699926377, "num_tokens": 23047609.0, "step": 11105 }, { "entropy": 5.502022409439087, "epoch": 1.007801161103048, "grad_norm": 0.9296875, "learning_rate": 0.0004905567118453475, "loss": 5.1641, "mean_token_accuracy": 0.19047075808048247, "num_tokens": 23057942.0, "step": 11110 }, { "entropy": 5.470209121704102, "epoch": 1.008254716981132, "grad_norm": 0.96484375, "learning_rate": 0.0004905474340493111, "loss": 5.0727, "mean_token_accuracy": 0.19394411146640778, "num_tokens": 23069119.0, "step": 11115 }, { "entropy": 5.443198490142822, "epoch": 1.0087082728592163, "grad_norm": 0.9609375, "learning_rate": 0.0004905381517956988, "loss": 5.0687, "mean_token_accuracy": 0.19524529427289963, "num_tokens": 23080060.0, "step": 11120 }, { "entropy": 5.4462425231933596, "epoch": 1.0091618287373005, "grad_norm": 0.8984375, "learning_rate": 0.0004905288650847027, "loss": 5.0992, "mean_token_accuracy": 0.1914682611823082, "num_tokens": 23090645.0, "step": 11125 }, { "entropy": 5.510693311691284, "epoch": 1.0096153846153846, "grad_norm": 0.984375, "learning_rate": 0.0004905195739165146, "loss": 5.1079, "mean_token_accuracy": 0.19879512786865233, "num_tokens": 23100449.0, "step": 11130 }, { "entropy": 5.496145629882813, "epoch": 1.0100689404934688, "grad_norm": 0.99609375, "learning_rate": 0.000490510278291327, "loss": 5.1084, "mean_token_accuracy": 0.19123156666755675, "num_tokens": 23110415.0, "step": 11135 }, { "entropy": 5.447995948791504, "epoch": 1.010522496371553, "grad_norm": 0.95703125, "learning_rate": 0.0004905009782093318, "loss": 5.097, "mean_token_accuracy": 0.19483419209718705, "num_tokens": 23120336.0, "step": 11140 }, { "entropy": 5.425385141372681, "epoch": 1.0109760522496372, "grad_norm": 0.99609375, "learning_rate": 0.0004904916736707214, "loss": 5.1687, "mean_token_accuracy": 0.1853318989276886, "num_tokens": 23130568.0, "step": 11145 }, { "entropy": 5.5349946975708, "epoch": 1.0114296081277214, "grad_norm": 0.953125, "learning_rate": 0.0004904823646756885, "loss": 5.1248, "mean_token_accuracy": 0.19526209384202958, "num_tokens": 23140080.0, "step": 11150 }, { "entropy": 5.4925604343414305, "epoch": 1.0118831640058055, "grad_norm": 0.96875, "learning_rate": 0.0004904730512244252, "loss": 5.0562, "mean_token_accuracy": 0.1917285680770874, "num_tokens": 23150360.0, "step": 11155 }, { "entropy": 5.417743730545044, "epoch": 1.0123367198838897, "grad_norm": 0.93359375, "learning_rate": 0.0004904637333171243, "loss": 5.0548, "mean_token_accuracy": 0.18818178176879882, "num_tokens": 23160620.0, "step": 11160 }, { "entropy": 5.523185205459595, "epoch": 1.0127902757619738, "grad_norm": 0.9453125, "learning_rate": 0.0004904544109539785, "loss": 5.1555, "mean_token_accuracy": 0.19521294981241227, "num_tokens": 23171920.0, "step": 11165 }, { "entropy": 5.492150783538818, "epoch": 1.013243831640058, "grad_norm": 0.88671875, "learning_rate": 0.0004904450841351805, "loss": 5.1168, "mean_token_accuracy": 0.19893324375152588, "num_tokens": 23182929.0, "step": 11170 }, { "entropy": 5.490244626998901, "epoch": 1.0136973875181423, "grad_norm": 0.89453125, "learning_rate": 0.0004904357528609236, "loss": 5.0738, "mean_token_accuracy": 0.18984648883342742, "num_tokens": 23193020.0, "step": 11175 }, { "entropy": 5.427248907089234, "epoch": 1.0141509433962264, "grad_norm": 0.99609375, "learning_rate": 0.0004904264171314, "loss": 5.0854, "mean_token_accuracy": 0.19872664362192155, "num_tokens": 23204073.0, "step": 11180 }, { "entropy": 5.426294994354248, "epoch": 1.0146044992743106, "grad_norm": 0.921875, "learning_rate": 0.0004904170769468035, "loss": 4.9959, "mean_token_accuracy": 0.1919043093919754, "num_tokens": 23214376.0, "step": 11185 }, { "entropy": 5.511206245422363, "epoch": 1.0150580551523947, "grad_norm": 0.9765625, "learning_rate": 0.0004904077323073268, "loss": 5.1612, "mean_token_accuracy": 0.19419621229171752, "num_tokens": 23224304.0, "step": 11190 }, { "entropy": 5.498494100570679, "epoch": 1.015511611030479, "grad_norm": 0.9453125, "learning_rate": 0.0004903983832131633, "loss": 5.1779, "mean_token_accuracy": 0.1909933015704155, "num_tokens": 23235324.0, "step": 11195 }, { "entropy": 5.499328231811523, "epoch": 1.0159651669085632, "grad_norm": 1.0078125, "learning_rate": 0.0004903890296645063, "loss": 5.1352, "mean_token_accuracy": 0.19310501515865325, "num_tokens": 23245774.0, "step": 11200 }, { "entropy": 5.526724481582642, "epoch": 1.0164187227866472, "grad_norm": 0.90234375, "learning_rate": 0.0004903796716615495, "loss": 5.0739, "mean_token_accuracy": 0.19474828839302064, "num_tokens": 23256274.0, "step": 11205 }, { "entropy": 5.4702582359313965, "epoch": 1.0168722786647315, "grad_norm": 1.0234375, "learning_rate": 0.0004903703092044861, "loss": 5.107, "mean_token_accuracy": 0.19234081357717514, "num_tokens": 23266304.0, "step": 11210 }, { "entropy": 5.389174270629883, "epoch": 1.0173258345428158, "grad_norm": 1.015625, "learning_rate": 0.0004903609422935097, "loss": 5.0099, "mean_token_accuracy": 0.19811663776636124, "num_tokens": 23276552.0, "step": 11215 }, { "entropy": 5.4639805316925045, "epoch": 1.0177793904208998, "grad_norm": 0.8828125, "learning_rate": 0.0004903515709288143, "loss": 5.1256, "mean_token_accuracy": 0.1883719265460968, "num_tokens": 23287799.0, "step": 11220 }, { "entropy": 5.401679563522339, "epoch": 1.018232946298984, "grad_norm": 0.98046875, "learning_rate": 0.0004903421951105933, "loss": 4.9809, "mean_token_accuracy": 0.20238814353942872, "num_tokens": 23297958.0, "step": 11225 }, { "entropy": 5.5005217552185055, "epoch": 1.0186865021770681, "grad_norm": 1.109375, "learning_rate": 0.0004903328148390411, "loss": 5.1624, "mean_token_accuracy": 0.18677162379026413, "num_tokens": 23307523.0, "step": 11230 }, { "entropy": 5.501028251647949, "epoch": 1.0191400580551524, "grad_norm": 0.92578125, "learning_rate": 0.0004903234301143513, "loss": 5.1515, "mean_token_accuracy": 0.19437760561704637, "num_tokens": 23317970.0, "step": 11235 }, { "entropy": 5.460223770141601, "epoch": 1.0195936139332367, "grad_norm": 0.98046875, "learning_rate": 0.0004903140409367181, "loss": 5.1074, "mean_token_accuracy": 0.19670169800519943, "num_tokens": 23328612.0, "step": 11240 }, { "entropy": 5.452767467498779, "epoch": 1.0200471698113207, "grad_norm": 1.0390625, "learning_rate": 0.0004903046473063357, "loss": 5.0766, "mean_token_accuracy": 0.1902572751045227, "num_tokens": 23338104.0, "step": 11245 }, { "entropy": 5.446892786026001, "epoch": 1.020500725689405, "grad_norm": 0.96484375, "learning_rate": 0.0004902952492233983, "loss": 5.0129, "mean_token_accuracy": 0.2074433147907257, "num_tokens": 23348105.0, "step": 11250 }, { "entropy": 5.42758994102478, "epoch": 1.020954281567489, "grad_norm": 0.984375, "learning_rate": 0.0004902858466881002, "loss": 4.9701, "mean_token_accuracy": 0.19822793155908586, "num_tokens": 23357150.0, "step": 11255 }, { "entropy": 5.470262479782105, "epoch": 1.0214078374455733, "grad_norm": 1.0390625, "learning_rate": 0.000490276439700636, "loss": 5.182, "mean_token_accuracy": 0.18963402211666108, "num_tokens": 23367223.0, "step": 11260 }, { "entropy": 5.476350355148315, "epoch": 1.0218613933236576, "grad_norm": 0.96484375, "learning_rate": 0.0004902670282612002, "loss": 5.1177, "mean_token_accuracy": 0.19103692173957826, "num_tokens": 23377664.0, "step": 11265 }, { "entropy": 5.442233085632324, "epoch": 1.0223149492017416, "grad_norm": 0.94140625, "learning_rate": 0.0004902576123699873, "loss": 5.0096, "mean_token_accuracy": 0.19532963782548904, "num_tokens": 23388057.0, "step": 11270 }, { "entropy": 5.381910991668701, "epoch": 1.0227685050798259, "grad_norm": 1.0, "learning_rate": 0.0004902481920271922, "loss": 4.9596, "mean_token_accuracy": 0.19629869908094405, "num_tokens": 23397808.0, "step": 11275 }, { "entropy": 5.395374584197998, "epoch": 1.02322206095791, "grad_norm": 0.96875, "learning_rate": 0.0004902387672330097, "loss": 5.0443, "mean_token_accuracy": 0.19195702075958251, "num_tokens": 23406979.0, "step": 11280 }, { "entropy": 5.450476551055909, "epoch": 1.0236756168359942, "grad_norm": 1.0546875, "learning_rate": 0.0004902293379876345, "loss": 5.0932, "mean_token_accuracy": 0.19491908848285674, "num_tokens": 23416545.0, "step": 11285 }, { "entropy": 5.444452714920044, "epoch": 1.0241291727140784, "grad_norm": 0.87109375, "learning_rate": 0.0004902199042912618, "loss": 5.0985, "mean_token_accuracy": 0.18906430751085282, "num_tokens": 23427464.0, "step": 11290 }, { "entropy": 5.502170610427856, "epoch": 1.0245827285921625, "grad_norm": 1.0, "learning_rate": 0.0004902104661440868, "loss": 5.1325, "mean_token_accuracy": 0.19716407209634781, "num_tokens": 23436690.0, "step": 11295 }, { "entropy": 5.468004512786865, "epoch": 1.0250362844702468, "grad_norm": 0.98828125, "learning_rate": 0.0004902010235463042, "loss": 5.0506, "mean_token_accuracy": 0.19812326580286027, "num_tokens": 23446701.0, "step": 11300 }, { "entropy": 5.535991668701172, "epoch": 1.025489840348331, "grad_norm": 0.96875, "learning_rate": 0.0004901915764981098, "loss": 5.1445, "mean_token_accuracy": 0.19191909879446029, "num_tokens": 23456966.0, "step": 11305 }, { "entropy": 5.470449829101563, "epoch": 1.025943396226415, "grad_norm": 1.09375, "learning_rate": 0.0004901821249996988, "loss": 5.1001, "mean_token_accuracy": 0.1941937953233719, "num_tokens": 23467300.0, "step": 11310 }, { "entropy": 5.5109635353088375, "epoch": 1.0263969521044993, "grad_norm": 0.9609375, "learning_rate": 0.0004901726690512665, "loss": 5.162, "mean_token_accuracy": 0.18955274671316147, "num_tokens": 23478457.0, "step": 11315 }, { "entropy": 5.4429868221282955, "epoch": 1.0268505079825834, "grad_norm": 0.9921875, "learning_rate": 0.0004901632086530087, "loss": 5.044, "mean_token_accuracy": 0.2002337396144867, "num_tokens": 23488066.0, "step": 11320 }, { "entropy": 5.4729485511779785, "epoch": 1.0273040638606676, "grad_norm": 1.0, "learning_rate": 0.0004901537438051207, "loss": 5.1232, "mean_token_accuracy": 0.18899547904729844, "num_tokens": 23498856.0, "step": 11325 }, { "entropy": 5.491955137252807, "epoch": 1.027757619738752, "grad_norm": 0.96875, "learning_rate": 0.0004901442745077986, "loss": 5.0879, "mean_token_accuracy": 0.1923009291291237, "num_tokens": 23509845.0, "step": 11330 }, { "entropy": 5.527870321273804, "epoch": 1.028211175616836, "grad_norm": 1.046875, "learning_rate": 0.0004901348007612381, "loss": 5.2004, "mean_token_accuracy": 0.1924690917134285, "num_tokens": 23520322.0, "step": 11335 }, { "entropy": 5.480651807785034, "epoch": 1.0286647314949202, "grad_norm": 0.9609375, "learning_rate": 0.0004901253225656351, "loss": 5.1352, "mean_token_accuracy": 0.19338575154542922, "num_tokens": 23530030.0, "step": 11340 }, { "entropy": 5.565394401550293, "epoch": 1.0291182873730043, "grad_norm": 0.9921875, "learning_rate": 0.0004901158399211855, "loss": 5.1925, "mean_token_accuracy": 0.19459724128246308, "num_tokens": 23541063.0, "step": 11345 }, { "entropy": 5.423709774017334, "epoch": 1.0295718432510885, "grad_norm": 1.0234375, "learning_rate": 0.0004901063528280856, "loss": 5.0923, "mean_token_accuracy": 0.19012126177549363, "num_tokens": 23551693.0, "step": 11350 }, { "entropy": 5.477392244338989, "epoch": 1.0300253991291728, "grad_norm": 1.0390625, "learning_rate": 0.0004900968612865314, "loss": 5.1251, "mean_token_accuracy": 0.1971671923995018, "num_tokens": 23561758.0, "step": 11355 }, { "entropy": 5.418482398986816, "epoch": 1.0304789550072568, "grad_norm": 1.03125, "learning_rate": 0.0004900873652967195, "loss": 5.0701, "mean_token_accuracy": 0.19031274020671846, "num_tokens": 23571912.0, "step": 11360 }, { "entropy": 5.442516422271728, "epoch": 1.030932510885341, "grad_norm": 0.9375, "learning_rate": 0.0004900778648588459, "loss": 5.035, "mean_token_accuracy": 0.19667790979146957, "num_tokens": 23582600.0, "step": 11365 }, { "entropy": 5.440606641769409, "epoch": 1.0313860667634251, "grad_norm": 1.046875, "learning_rate": 0.0004900683599731073, "loss": 5.0044, "mean_token_accuracy": 0.20124102234840394, "num_tokens": 23592761.0, "step": 11370 }, { "entropy": 5.49815354347229, "epoch": 1.0318396226415094, "grad_norm": 1.046875, "learning_rate": 0.0004900588506397002, "loss": 5.1829, "mean_token_accuracy": 0.1900082364678383, "num_tokens": 23603119.0, "step": 11375 }, { "entropy": 5.384500169754029, "epoch": 1.0322931785195937, "grad_norm": 0.97265625, "learning_rate": 0.0004900493368588213, "loss": 5.0585, "mean_token_accuracy": 0.20479914397001267, "num_tokens": 23613916.0, "step": 11380 }, { "entropy": 5.526654195785523, "epoch": 1.0327467343976777, "grad_norm": 1.0625, "learning_rate": 0.0004900398186306672, "loss": 5.2217, "mean_token_accuracy": 0.1877501666545868, "num_tokens": 23623956.0, "step": 11385 }, { "entropy": 5.456167316436767, "epoch": 1.033200290275762, "grad_norm": 0.94140625, "learning_rate": 0.000490030295955435, "loss": 5.1032, "mean_token_accuracy": 0.19367883652448653, "num_tokens": 23634666.0, "step": 11390 }, { "entropy": 5.424622917175293, "epoch": 1.0336538461538463, "grad_norm": 1.0234375, "learning_rate": 0.0004900207688333215, "loss": 5.0608, "mean_token_accuracy": 0.18913532048463821, "num_tokens": 23645601.0, "step": 11395 }, { "entropy": 5.510989427566528, "epoch": 1.0341074020319303, "grad_norm": 1.015625, "learning_rate": 0.0004900112372645236, "loss": 5.1375, "mean_token_accuracy": 0.19037441164255142, "num_tokens": 23656339.0, "step": 11400 }, { "entropy": 5.461063098907471, "epoch": 1.0345609579100146, "grad_norm": 0.89453125, "learning_rate": 0.0004900017012492386, "loss": 5.1066, "mean_token_accuracy": 0.19083172529935838, "num_tokens": 23667433.0, "step": 11405 }, { "entropy": 5.502894353866577, "epoch": 1.0350145137880986, "grad_norm": 0.9765625, "learning_rate": 0.0004899921607876634, "loss": 5.1234, "mean_token_accuracy": 0.19392693638801575, "num_tokens": 23678186.0, "step": 11410 }, { "entropy": 5.466448020935059, "epoch": 1.0354680696661829, "grad_norm": 0.9609375, "learning_rate": 0.0004899826158799958, "loss": 5.0781, "mean_token_accuracy": 0.19278447926044465, "num_tokens": 23688317.0, "step": 11415 }, { "entropy": 5.432892513275147, "epoch": 1.0359216255442671, "grad_norm": 1.0078125, "learning_rate": 0.0004899730665264328, "loss": 5.0298, "mean_token_accuracy": 0.19775377660989762, "num_tokens": 23697752.0, "step": 11420 }, { "entropy": 5.389712142944336, "epoch": 1.0363751814223512, "grad_norm": 0.9921875, "learning_rate": 0.0004899635127271721, "loss": 5.007, "mean_token_accuracy": 0.20241805762052537, "num_tokens": 23707803.0, "step": 11425 }, { "entropy": 5.372399187088012, "epoch": 1.0368287373004355, "grad_norm": 1.0234375, "learning_rate": 0.0004899539544824111, "loss": 5.0122, "mean_token_accuracy": 0.2028212293982506, "num_tokens": 23717630.0, "step": 11430 }, { "entropy": 5.464516067504883, "epoch": 1.0372822931785195, "grad_norm": 1.0, "learning_rate": 0.0004899443917923476, "loss": 5.1428, "mean_token_accuracy": 0.1955379366874695, "num_tokens": 23728836.0, "step": 11435 }, { "entropy": 5.42895884513855, "epoch": 1.0377358490566038, "grad_norm": 0.96484375, "learning_rate": 0.0004899348246571792, "loss": 5.1186, "mean_token_accuracy": 0.18906114101409913, "num_tokens": 23740145.0, "step": 11440 }, { "entropy": 5.456284904479981, "epoch": 1.038189404934688, "grad_norm": 0.98046875, "learning_rate": 0.000489925253077104, "loss": 5.1029, "mean_token_accuracy": 0.19079043120145797, "num_tokens": 23751162.0, "step": 11445 }, { "entropy": 5.491913223266602, "epoch": 1.038642960812772, "grad_norm": 0.96875, "learning_rate": 0.0004899156770523196, "loss": 5.1081, "mean_token_accuracy": 0.19240654408931732, "num_tokens": 23761634.0, "step": 11450 }, { "entropy": 5.470863246917725, "epoch": 1.0390965166908563, "grad_norm": 0.921875, "learning_rate": 0.0004899060965830244, "loss": 5.0733, "mean_token_accuracy": 0.198917418718338, "num_tokens": 23772483.0, "step": 11455 }, { "entropy": 5.45157265663147, "epoch": 1.0395500725689404, "grad_norm": 1.0625, "learning_rate": 0.0004898965116694162, "loss": 5.0458, "mean_token_accuracy": 0.1927415356040001, "num_tokens": 23782298.0, "step": 11460 }, { "entropy": 5.468653631210327, "epoch": 1.0400036284470247, "grad_norm": 0.9921875, "learning_rate": 0.0004898869223116935, "loss": 5.1224, "mean_token_accuracy": 0.19079854786396028, "num_tokens": 23792492.0, "step": 11465 }, { "entropy": 5.510800075531006, "epoch": 1.040457184325109, "grad_norm": 0.9375, "learning_rate": 0.0004898773285100546, "loss": 5.2672, "mean_token_accuracy": 0.184591606259346, "num_tokens": 23802999.0, "step": 11470 }, { "entropy": 5.473024654388428, "epoch": 1.040910740203193, "grad_norm": 0.96484375, "learning_rate": 0.0004898677302646975, "loss": 5.0636, "mean_token_accuracy": 0.19724741876125335, "num_tokens": 23812541.0, "step": 11475 }, { "entropy": 5.47519736289978, "epoch": 1.0413642960812772, "grad_norm": 0.90234375, "learning_rate": 0.0004898581275758211, "loss": 5.1705, "mean_token_accuracy": 0.18411127626895904, "num_tokens": 23823244.0, "step": 11480 }, { "entropy": 5.45018162727356, "epoch": 1.0418178519593615, "grad_norm": 1.0078125, "learning_rate": 0.0004898485204436239, "loss": 5.0092, "mean_token_accuracy": 0.2057377353310585, "num_tokens": 23832346.0, "step": 11485 }, { "entropy": 5.522273445129395, "epoch": 1.0422714078374455, "grad_norm": 1.0390625, "learning_rate": 0.0004898389088683047, "loss": 5.1458, "mean_token_accuracy": 0.20061220675706865, "num_tokens": 23842554.0, "step": 11490 }, { "entropy": 5.405847120285034, "epoch": 1.0427249637155298, "grad_norm": 0.88671875, "learning_rate": 0.0004898292928500619, "loss": 4.9989, "mean_token_accuracy": 0.1994738131761551, "num_tokens": 23852938.0, "step": 11495 }, { "entropy": 5.394134998321533, "epoch": 1.0431785195936139, "grad_norm": 0.94140625, "learning_rate": 0.0004898196723890947, "loss": 5.0153, "mean_token_accuracy": 0.1991426929831505, "num_tokens": 23862367.0, "step": 11500 }, { "entropy": 5.448208570480347, "epoch": 1.0436320754716981, "grad_norm": 1.0, "learning_rate": 0.0004898100474856019, "loss": 5.1276, "mean_token_accuracy": 0.19397516846656798, "num_tokens": 23873249.0, "step": 11505 }, { "entropy": 5.48231987953186, "epoch": 1.0440856313497824, "grad_norm": 0.953125, "learning_rate": 0.0004898004181397824, "loss": 5.1428, "mean_token_accuracy": 0.18477273732423782, "num_tokens": 23883830.0, "step": 11510 }, { "entropy": 5.4982703685760494, "epoch": 1.0445391872278664, "grad_norm": 0.98828125, "learning_rate": 0.0004897907843518358, "loss": 5.0533, "mean_token_accuracy": 0.19381560236215592, "num_tokens": 23894359.0, "step": 11515 }, { "entropy": 5.442965316772461, "epoch": 1.0449927431059507, "grad_norm": 0.9375, "learning_rate": 0.0004897811461219609, "loss": 5.0583, "mean_token_accuracy": 0.19391554594039917, "num_tokens": 23903779.0, "step": 11520 }, { "entropy": 5.438404083251953, "epoch": 1.0454462989840347, "grad_norm": 0.93359375, "learning_rate": 0.0004897715034503571, "loss": 5.1322, "mean_token_accuracy": 0.19373399317264556, "num_tokens": 23914523.0, "step": 11525 }, { "entropy": 5.456286334991455, "epoch": 1.045899854862119, "grad_norm": 0.96875, "learning_rate": 0.000489761856337224, "loss": 5.0995, "mean_token_accuracy": 0.19320344924926758, "num_tokens": 23924996.0, "step": 11530 }, { "entropy": 5.477241516113281, "epoch": 1.0463534107402033, "grad_norm": 0.93359375, "learning_rate": 0.0004897522047827609, "loss": 5.0655, "mean_token_accuracy": 0.19749463647603988, "num_tokens": 23935843.0, "step": 11535 }, { "entropy": 5.444448661804199, "epoch": 1.0468069666182873, "grad_norm": 1.0625, "learning_rate": 0.0004897425487871676, "loss": 5.0376, "mean_token_accuracy": 0.19542952328920365, "num_tokens": 23945044.0, "step": 11540 }, { "entropy": 5.400130081176758, "epoch": 1.0472605224963716, "grad_norm": 0.99609375, "learning_rate": 0.0004897328883506436, "loss": 5.0997, "mean_token_accuracy": 0.19553857147693635, "num_tokens": 23955933.0, "step": 11545 }, { "entropy": 5.461530494689941, "epoch": 1.0477140783744556, "grad_norm": 1.0234375, "learning_rate": 0.0004897232234733887, "loss": 5.1683, "mean_token_accuracy": 0.18461367785930632, "num_tokens": 23966320.0, "step": 11550 }, { "entropy": 5.461652421951294, "epoch": 1.04816763425254, "grad_norm": 1.0078125, "learning_rate": 0.0004897135541556028, "loss": 5.061, "mean_token_accuracy": 0.19855878949165345, "num_tokens": 23976233.0, "step": 11555 }, { "entropy": 5.471328020095825, "epoch": 1.0486211901306242, "grad_norm": 0.85546875, "learning_rate": 0.000489703880397486, "loss": 5.1227, "mean_token_accuracy": 0.1904810532927513, "num_tokens": 23987854.0, "step": 11560 }, { "entropy": 5.4512513160705565, "epoch": 1.0490747460087082, "grad_norm": 0.96875, "learning_rate": 0.0004896942021992382, "loss": 5.1113, "mean_token_accuracy": 0.1881568431854248, "num_tokens": 23997973.0, "step": 11565 }, { "entropy": 5.459875631332397, "epoch": 1.0495283018867925, "grad_norm": 1.0234375, "learning_rate": 0.0004896845195610595, "loss": 5.1236, "mean_token_accuracy": 0.1908821791410446, "num_tokens": 24007313.0, "step": 11570 }, { "entropy": 5.449109792709351, "epoch": 1.0499818577648767, "grad_norm": 0.921875, "learning_rate": 0.0004896748324831504, "loss": 5.1376, "mean_token_accuracy": 0.18894692361354828, "num_tokens": 24018254.0, "step": 11575 }, { "entropy": 5.488360786437989, "epoch": 1.0504354136429608, "grad_norm": 0.87109375, "learning_rate": 0.0004896651409657109, "loss": 5.1272, "mean_token_accuracy": 0.19029901772737504, "num_tokens": 24029799.0, "step": 11580 }, { "entropy": 5.407639503479004, "epoch": 1.050888969521045, "grad_norm": 0.95703125, "learning_rate": 0.0004896554450089417, "loss": 5.0307, "mean_token_accuracy": 0.20030184984207153, "num_tokens": 24040972.0, "step": 11585 }, { "entropy": 5.443329524993897, "epoch": 1.051342525399129, "grad_norm": 0.95703125, "learning_rate": 0.0004896457446130431, "loss": 4.9667, "mean_token_accuracy": 0.20220689922571183, "num_tokens": 24050781.0, "step": 11590 }, { "entropy": 5.429394340515136, "epoch": 1.0517960812772134, "grad_norm": 1.03125, "learning_rate": 0.0004896360397782159, "loss": 5.0991, "mean_token_accuracy": 0.19227786213159562, "num_tokens": 24060184.0, "step": 11595 }, { "entropy": 5.489581871032715, "epoch": 1.0522496371552976, "grad_norm": 1.0625, "learning_rate": 0.0004896263305046607, "loss": 5.1549, "mean_token_accuracy": 0.19510595351457596, "num_tokens": 24070777.0, "step": 11600 }, { "entropy": 5.507211112976075, "epoch": 1.0527031930333817, "grad_norm": 1.0234375, "learning_rate": 0.0004896166167925782, "loss": 5.1887, "mean_token_accuracy": 0.1927416890859604, "num_tokens": 24080878.0, "step": 11605 }, { "entropy": 5.492761325836182, "epoch": 1.053156748911466, "grad_norm": 0.98828125, "learning_rate": 0.0004896068986421693, "loss": 5.137, "mean_token_accuracy": 0.20071599036455154, "num_tokens": 24090038.0, "step": 11610 }, { "entropy": 5.528735876083374, "epoch": 1.05361030478955, "grad_norm": 0.88671875, "learning_rate": 0.0004895971760536351, "loss": 5.1714, "mean_token_accuracy": 0.19025161862373352, "num_tokens": 24100425.0, "step": 11615 }, { "entropy": 5.519040775299072, "epoch": 1.0540638606676342, "grad_norm": 0.96875, "learning_rate": 0.0004895874490271768, "loss": 5.2288, "mean_token_accuracy": 0.18544750064611434, "num_tokens": 24112182.0, "step": 11620 }, { "entropy": 5.479070711135864, "epoch": 1.0545174165457185, "grad_norm": 0.98046875, "learning_rate": 0.0004895777175629952, "loss": 5.0768, "mean_token_accuracy": 0.19402081668376922, "num_tokens": 24122182.0, "step": 11625 }, { "entropy": 5.512710905075073, "epoch": 1.0549709724238026, "grad_norm": 1.046875, "learning_rate": 0.0004895679816612917, "loss": 5.0755, "mean_token_accuracy": 0.1985362336039543, "num_tokens": 24131930.0, "step": 11630 }, { "entropy": 5.499684190750122, "epoch": 1.0554245283018868, "grad_norm": 0.98828125, "learning_rate": 0.0004895582413222678, "loss": 5.0746, "mean_token_accuracy": 0.20388585031032563, "num_tokens": 24141575.0, "step": 11635 }, { "entropy": 5.482347249984741, "epoch": 1.0558780841799709, "grad_norm": 0.98046875, "learning_rate": 0.0004895484965461247, "loss": 5.2114, "mean_token_accuracy": 0.1858080580830574, "num_tokens": 24151720.0, "step": 11640 }, { "entropy": 5.427149391174316, "epoch": 1.0563316400580551, "grad_norm": 1.0390625, "learning_rate": 0.000489538747333064, "loss": 5.1075, "mean_token_accuracy": 0.19254984259605407, "num_tokens": 24161881.0, "step": 11645 }, { "entropy": 5.449149322509766, "epoch": 1.0567851959361394, "grad_norm": 1.0546875, "learning_rate": 0.0004895289936832874, "loss": 5.0637, "mean_token_accuracy": 0.20020053237676622, "num_tokens": 24171474.0, "step": 11650 }, { "entropy": 5.552807998657227, "epoch": 1.0572387518142234, "grad_norm": 0.90234375, "learning_rate": 0.0004895192355969966, "loss": 5.1718, "mean_token_accuracy": 0.19173015356063844, "num_tokens": 24182186.0, "step": 11655 }, { "entropy": 5.49303035736084, "epoch": 1.0576923076923077, "grad_norm": 0.90234375, "learning_rate": 0.0004895094730743932, "loss": 5.0972, "mean_token_accuracy": 0.20089954733848572, "num_tokens": 24192318.0, "step": 11660 }, { "entropy": 5.480742073059082, "epoch": 1.058145863570392, "grad_norm": 0.95703125, "learning_rate": 0.0004894997061156793, "loss": 5.1583, "mean_token_accuracy": 0.19043267518281937, "num_tokens": 24202918.0, "step": 11665 }, { "entropy": 5.426549005508423, "epoch": 1.058599419448476, "grad_norm": 1.0, "learning_rate": 0.0004894899347210567, "loss": 5.0545, "mean_token_accuracy": 0.19537004977464675, "num_tokens": 24213218.0, "step": 11670 }, { "entropy": 5.448081922531128, "epoch": 1.0590529753265603, "grad_norm": 0.91015625, "learning_rate": 0.0004894801588907278, "loss": 5.0414, "mean_token_accuracy": 0.19819533377885817, "num_tokens": 24223229.0, "step": 11675 }, { "entropy": 5.508687114715576, "epoch": 1.0595065312046443, "grad_norm": 0.984375, "learning_rate": 0.0004894703786248944, "loss": 5.1189, "mean_token_accuracy": 0.19095162451267242, "num_tokens": 24233637.0, "step": 11680 }, { "entropy": 5.4921238899230955, "epoch": 1.0599600870827286, "grad_norm": 1.03125, "learning_rate": 0.000489460593923759, "loss": 5.149, "mean_token_accuracy": 0.19814313352108, "num_tokens": 24244251.0, "step": 11685 }, { "entropy": 5.471730422973633, "epoch": 1.0604136429608129, "grad_norm": 0.953125, "learning_rate": 0.0004894508047875237, "loss": 5.0565, "mean_token_accuracy": 0.19785570055246354, "num_tokens": 24254380.0, "step": 11690 }, { "entropy": 5.340200662612915, "epoch": 1.060867198838897, "grad_norm": 0.9140625, "learning_rate": 0.0004894410112163913, "loss": 4.9937, "mean_token_accuracy": 0.19913735389709472, "num_tokens": 24264841.0, "step": 11695 }, { "entropy": 5.391559076309204, "epoch": 1.0613207547169812, "grad_norm": 1.0390625, "learning_rate": 0.0004894312132105641, "loss": 5.0239, "mean_token_accuracy": 0.19785647094249725, "num_tokens": 24274383.0, "step": 11700 }, { "entropy": 5.534787845611572, "epoch": 1.0617743105950652, "grad_norm": 1.0078125, "learning_rate": 0.0004894214107702447, "loss": 5.11, "mean_token_accuracy": 0.19086095243692397, "num_tokens": 24284140.0, "step": 11705 }, { "entropy": 5.560810375213623, "epoch": 1.0622278664731495, "grad_norm": 1.0546875, "learning_rate": 0.000489411603895636, "loss": 5.1878, "mean_token_accuracy": 0.1921544551849365, "num_tokens": 24295044.0, "step": 11710 }, { "entropy": 5.451190757751465, "epoch": 1.0626814223512338, "grad_norm": 1.015625, "learning_rate": 0.0004894017925869406, "loss": 5.0975, "mean_token_accuracy": 0.19553182721138002, "num_tokens": 24305080.0, "step": 11715 }, { "entropy": 5.466040515899659, "epoch": 1.0631349782293178, "grad_norm": 0.9765625, "learning_rate": 0.0004893919768443615, "loss": 5.1308, "mean_token_accuracy": 0.19310673475265502, "num_tokens": 24316306.0, "step": 11720 }, { "entropy": 5.445856237411499, "epoch": 1.063588534107402, "grad_norm": 0.9921875, "learning_rate": 0.0004893821566681017, "loss": 5.1232, "mean_token_accuracy": 0.19693950265645982, "num_tokens": 24326740.0, "step": 11725 }, { "entropy": 5.489151525497436, "epoch": 1.0640420899854863, "grad_norm": 1.015625, "learning_rate": 0.0004893723320583644, "loss": 5.162, "mean_token_accuracy": 0.188465815782547, "num_tokens": 24337621.0, "step": 11730 }, { "entropy": 5.386200571060181, "epoch": 1.0644956458635704, "grad_norm": 0.96484375, "learning_rate": 0.0004893625030153525, "loss": 4.9959, "mean_token_accuracy": 0.20463671237230302, "num_tokens": 24347732.0, "step": 11735 }, { "entropy": 5.40708589553833, "epoch": 1.0649492017416546, "grad_norm": 0.9765625, "learning_rate": 0.0004893526695392694, "loss": 5.0112, "mean_token_accuracy": 0.20490798354148865, "num_tokens": 24359173.0, "step": 11740 }, { "entropy": 5.431822299957275, "epoch": 1.0654027576197387, "grad_norm": 0.95703125, "learning_rate": 0.0004893428316303185, "loss": 5.0139, "mean_token_accuracy": 0.20014695078134537, "num_tokens": 24369465.0, "step": 11745 }, { "entropy": 5.387581729888916, "epoch": 1.065856313497823, "grad_norm": 0.94140625, "learning_rate": 0.0004893329892887031, "loss": 5.0756, "mean_token_accuracy": 0.19761465936899186, "num_tokens": 24378899.0, "step": 11750 }, { "entropy": 5.4371435165405275, "epoch": 1.0663098693759072, "grad_norm": 1.0078125, "learning_rate": 0.0004893231425146271, "loss": 5.1867, "mean_token_accuracy": 0.18819210082292556, "num_tokens": 24388919.0, "step": 11755 }, { "entropy": 5.407600069046021, "epoch": 1.0667634252539913, "grad_norm": 0.98828125, "learning_rate": 0.0004893132913082937, "loss": 5.0453, "mean_token_accuracy": 0.19777143746614456, "num_tokens": 24399632.0, "step": 11760 }, { "entropy": 5.466056203842163, "epoch": 1.0672169811320755, "grad_norm": 0.91015625, "learning_rate": 0.0004893034356699069, "loss": 5.0721, "mean_token_accuracy": 0.19814738631248474, "num_tokens": 24410817.0, "step": 11765 }, { "entropy": 5.454527950286865, "epoch": 1.0676705370101596, "grad_norm": 0.98046875, "learning_rate": 0.0004892935755996705, "loss": 5.0955, "mean_token_accuracy": 0.19848891198635102, "num_tokens": 24421058.0, "step": 11770 }, { "entropy": 5.412892913818359, "epoch": 1.0681240928882438, "grad_norm": 1.015625, "learning_rate": 0.0004892837110977883, "loss": 5.0184, "mean_token_accuracy": 0.1985347628593445, "num_tokens": 24431522.0, "step": 11775 }, { "entropy": 5.420146083831787, "epoch": 1.068577648766328, "grad_norm": 0.89453125, "learning_rate": 0.0004892738421644644, "loss": 5.0563, "mean_token_accuracy": 0.19299584180116652, "num_tokens": 24441746.0, "step": 11780 }, { "entropy": 5.373950052261352, "epoch": 1.0690312046444121, "grad_norm": 1.015625, "learning_rate": 0.0004892639687999027, "loss": 4.9627, "mean_token_accuracy": 0.206170853972435, "num_tokens": 24451916.0, "step": 11785 }, { "entropy": 5.455459642410278, "epoch": 1.0694847605224964, "grad_norm": 0.99609375, "learning_rate": 0.0004892540910043076, "loss": 5.0879, "mean_token_accuracy": 0.19918798059225082, "num_tokens": 24461935.0, "step": 11790 }, { "entropy": 5.435303163528443, "epoch": 1.0699383164005805, "grad_norm": 1.03125, "learning_rate": 0.0004892442087778833, "loss": 5.0002, "mean_token_accuracy": 0.19787367433309555, "num_tokens": 24472437.0, "step": 11795 }, { "entropy": 5.431952667236328, "epoch": 1.0703918722786647, "grad_norm": 1.046875, "learning_rate": 0.0004892343221208342, "loss": 5.1029, "mean_token_accuracy": 0.19617521166801452, "num_tokens": 24481726.0, "step": 11800 }, { "entropy": 5.498169612884522, "epoch": 1.070845428156749, "grad_norm": 0.93359375, "learning_rate": 0.0004892244310333646, "loss": 5.184, "mean_token_accuracy": 0.19032939225435258, "num_tokens": 24492340.0, "step": 11805 }, { "entropy": 5.476718950271606, "epoch": 1.071298984034833, "grad_norm": 1.0, "learning_rate": 0.0004892145355156793, "loss": 5.05, "mean_token_accuracy": 0.19708126336336135, "num_tokens": 24502138.0, "step": 11810 }, { "entropy": 5.4611780643463135, "epoch": 1.0717525399129173, "grad_norm": 0.91796875, "learning_rate": 0.0004892046355679829, "loss": 5.1045, "mean_token_accuracy": 0.19246915280818938, "num_tokens": 24512723.0, "step": 11815 }, { "entropy": 5.510536956787109, "epoch": 1.0722060957910013, "grad_norm": 0.97265625, "learning_rate": 0.0004891947311904799, "loss": 5.1444, "mean_token_accuracy": 0.1910214379429817, "num_tokens": 24523766.0, "step": 11820 }, { "entropy": 5.4847740650177, "epoch": 1.0726596516690856, "grad_norm": 0.97265625, "learning_rate": 0.0004891848223833753, "loss": 5.1062, "mean_token_accuracy": 0.19305452108383178, "num_tokens": 24534571.0, "step": 11825 }, { "entropy": 5.456302833557129, "epoch": 1.0731132075471699, "grad_norm": 1.015625, "learning_rate": 0.000489174909146874, "loss": 5.1088, "mean_token_accuracy": 0.19871936440467836, "num_tokens": 24545265.0, "step": 11830 }, { "entropy": 5.524204874038697, "epoch": 1.073566763425254, "grad_norm": 1.0625, "learning_rate": 0.0004891649914811811, "loss": 5.1979, "mean_token_accuracy": 0.18889098316431047, "num_tokens": 24555524.0, "step": 11835 }, { "entropy": 5.410844326019287, "epoch": 1.0740203193033382, "grad_norm": 0.98046875, "learning_rate": 0.0004891550693865014, "loss": 5.052, "mean_token_accuracy": 0.20847347378730774, "num_tokens": 24565420.0, "step": 11840 }, { "entropy": 5.468236207962036, "epoch": 1.0744738751814222, "grad_norm": 0.93359375, "learning_rate": 0.0004891451428630405, "loss": 5.0912, "mean_token_accuracy": 0.19379322081804276, "num_tokens": 24576794.0, "step": 11845 }, { "entropy": 5.4929125785827635, "epoch": 1.0749274310595065, "grad_norm": 0.921875, "learning_rate": 0.0004891352119110033, "loss": 5.1068, "mean_token_accuracy": 0.19399791359901428, "num_tokens": 24586320.0, "step": 11850 }, { "entropy": 5.448437881469727, "epoch": 1.0753809869375908, "grad_norm": 0.98828125, "learning_rate": 0.0004891252765305954, "loss": 5.0875, "mean_token_accuracy": 0.20086531192064286, "num_tokens": 24596524.0, "step": 11855 }, { "entropy": 5.4746064186096195, "epoch": 1.0758345428156748, "grad_norm": 0.9921875, "learning_rate": 0.0004891153367220222, "loss": 5.0173, "mean_token_accuracy": 0.2089245080947876, "num_tokens": 24605877.0, "step": 11860 }, { "entropy": 5.502732610702514, "epoch": 1.076288098693759, "grad_norm": 0.93359375, "learning_rate": 0.0004891053924854894, "loss": 5.2305, "mean_token_accuracy": 0.18587556779384612, "num_tokens": 24616719.0, "step": 11865 }, { "entropy": 5.43260178565979, "epoch": 1.0767416545718433, "grad_norm": 1.015625, "learning_rate": 0.0004890954438212024, "loss": 4.9843, "mean_token_accuracy": 0.20658824294805528, "num_tokens": 24626882.0, "step": 11870 }, { "entropy": 5.486688423156738, "epoch": 1.0771952104499274, "grad_norm": 0.984375, "learning_rate": 0.0004890854907293671, "loss": 5.0936, "mean_token_accuracy": 0.1938313826918602, "num_tokens": 24637884.0, "step": 11875 }, { "entropy": 5.4502464771270756, "epoch": 1.0776487663280117, "grad_norm": 0.96875, "learning_rate": 0.0004890755332101893, "loss": 5.0895, "mean_token_accuracy": 0.19480091631412505, "num_tokens": 24647389.0, "step": 11880 }, { "entropy": 5.448260498046875, "epoch": 1.0781023222060957, "grad_norm": 0.890625, "learning_rate": 0.0004890655712638749, "loss": 5.0976, "mean_token_accuracy": 0.19201536923646928, "num_tokens": 24657595.0, "step": 11885 }, { "entropy": 5.448187303543091, "epoch": 1.07855587808418, "grad_norm": 1.171875, "learning_rate": 0.00048905560489063, "loss": 5.015, "mean_token_accuracy": 0.19760590493679048, "num_tokens": 24667683.0, "step": 11890 }, { "entropy": 5.492201042175293, "epoch": 1.0790094339622642, "grad_norm": 0.96484375, "learning_rate": 0.0004890456340906605, "loss": 5.1742, "mean_token_accuracy": 0.1939292684197426, "num_tokens": 24678041.0, "step": 11895 }, { "entropy": 5.450703811645508, "epoch": 1.0794629898403483, "grad_norm": 1.0078125, "learning_rate": 0.0004890356588641729, "loss": 5.1517, "mean_token_accuracy": 0.19592384546995162, "num_tokens": 24688569.0, "step": 11900 }, { "entropy": 5.494032478332519, "epoch": 1.0799165457184325, "grad_norm": 0.94921875, "learning_rate": 0.0004890256792113733, "loss": 5.1069, "mean_token_accuracy": 0.19837442487478257, "num_tokens": 24699913.0, "step": 11905 }, { "entropy": 5.5294829368591305, "epoch": 1.0803701015965168, "grad_norm": 0.890625, "learning_rate": 0.0004890156951324681, "loss": 5.1323, "mean_token_accuracy": 0.1929474338889122, "num_tokens": 24710682.0, "step": 11910 }, { "entropy": 5.526803922653198, "epoch": 1.0808236574746009, "grad_norm": 1.0390625, "learning_rate": 0.0004890057066276636, "loss": 5.2058, "mean_token_accuracy": 0.18813426196575164, "num_tokens": 24721087.0, "step": 11915 }, { "entropy": 5.43285641670227, "epoch": 1.0812772133526851, "grad_norm": 0.91015625, "learning_rate": 0.0004889957136971668, "loss": 5.0328, "mean_token_accuracy": 0.20273849219083787, "num_tokens": 24731323.0, "step": 11920 }, { "entropy": 5.442595529556274, "epoch": 1.0817307692307692, "grad_norm": 0.9765625, "learning_rate": 0.000488985716341184, "loss": 5.097, "mean_token_accuracy": 0.19515804946422577, "num_tokens": 24742559.0, "step": 11925 }, { "entropy": 5.497393083572388, "epoch": 1.0821843251088534, "grad_norm": 0.96484375, "learning_rate": 0.0004889757145599222, "loss": 5.1055, "mean_token_accuracy": 0.19816650450229645, "num_tokens": 24752307.0, "step": 11930 }, { "entropy": 5.361609315872192, "epoch": 1.0826378809869377, "grad_norm": 0.96484375, "learning_rate": 0.000488965708353588, "loss": 5.0406, "mean_token_accuracy": 0.1924867585301399, "num_tokens": 24762792.0, "step": 11935 }, { "entropy": 5.508419227600098, "epoch": 1.0830914368650217, "grad_norm": 0.91796875, "learning_rate": 0.0004889556977223883, "loss": 5.1613, "mean_token_accuracy": 0.19042742848396302, "num_tokens": 24774377.0, "step": 11940 }, { "entropy": 5.484889316558838, "epoch": 1.083544992743106, "grad_norm": 0.875, "learning_rate": 0.0004889456826665304, "loss": 5.0786, "mean_token_accuracy": 0.195466311275959, "num_tokens": 24785919.0, "step": 11945 }, { "entropy": 5.465774250030518, "epoch": 1.08399854862119, "grad_norm": 0.984375, "learning_rate": 0.0004889356631862211, "loss": 5.1187, "mean_token_accuracy": 0.18686763644218446, "num_tokens": 24796594.0, "step": 11950 }, { "entropy": 5.453439331054687, "epoch": 1.0844521044992743, "grad_norm": 0.9375, "learning_rate": 0.000488925639281668, "loss": 5.1122, "mean_token_accuracy": 0.1970463752746582, "num_tokens": 24807322.0, "step": 11955 }, { "entropy": 5.438632583618164, "epoch": 1.0849056603773586, "grad_norm": 0.921875, "learning_rate": 0.0004889156109530781, "loss": 4.999, "mean_token_accuracy": 0.1978117287158966, "num_tokens": 24817593.0, "step": 11960 }, { "entropy": 5.442756128311157, "epoch": 1.0853592162554426, "grad_norm": 1.0, "learning_rate": 0.0004889055782006588, "loss": 5.0073, "mean_token_accuracy": 0.2037275940179825, "num_tokens": 24827577.0, "step": 11965 }, { "entropy": 5.4089408874511715, "epoch": 1.085812772133527, "grad_norm": 1.0546875, "learning_rate": 0.0004888955410246176, "loss": 5.0577, "mean_token_accuracy": 0.19720772951841353, "num_tokens": 24838148.0, "step": 11970 }, { "entropy": 5.425878286361694, "epoch": 1.086266328011611, "grad_norm": 0.9375, "learning_rate": 0.0004888854994251621, "loss": 5.0117, "mean_token_accuracy": 0.19913591742515563, "num_tokens": 24848451.0, "step": 11975 }, { "entropy": 5.492869567871094, "epoch": 1.0867198838896952, "grad_norm": 0.89453125, "learning_rate": 0.0004888754534025, "loss": 5.1374, "mean_token_accuracy": 0.18826611191034318, "num_tokens": 24859619.0, "step": 11980 }, { "entropy": 5.474278116226197, "epoch": 1.0871734397677795, "grad_norm": 0.95703125, "learning_rate": 0.0004888654029568391, "loss": 5.1732, "mean_token_accuracy": 0.18208261132240294, "num_tokens": 24869863.0, "step": 11985 }, { "entropy": 5.450355195999146, "epoch": 1.0876269956458635, "grad_norm": 0.94921875, "learning_rate": 0.0004888553480883871, "loss": 5.1074, "mean_token_accuracy": 0.1931120127439499, "num_tokens": 24880524.0, "step": 11990 }, { "entropy": 5.3892419815063475, "epoch": 1.0880805515239478, "grad_norm": 0.8984375, "learning_rate": 0.000488845288797352, "loss": 5.076, "mean_token_accuracy": 0.19475484490394593, "num_tokens": 24891514.0, "step": 11995 }, { "entropy": 5.428224277496338, "epoch": 1.0885341074020318, "grad_norm": 1.0234375, "learning_rate": 0.0004888352250839418, "loss": 5.0443, "mean_token_accuracy": 0.1945518046617508, "num_tokens": 24900842.0, "step": 12000 }, { "epoch": 1.0885341074020318, "eval_entropy": 5.255034273674045, "eval_loss": 5.174998760223389, "eval_mean_token_accuracy": 0.20042603093608202, "eval_num_tokens": 24900842.0, "eval_runtime": 20.8388, "eval_samples_per_second": 1696.832, "eval_steps_per_second": 212.104, "step": 12000 }, { "entropy": 5.4489906311035154, "epoch": 1.088987663280116, "grad_norm": 0.921875, "learning_rate": 0.0004888251569483647, "loss": 5.025, "mean_token_accuracy": 0.19985171556472778, "num_tokens": 24911845.0, "step": 12005 }, { "entropy": 5.368015575408935, "epoch": 1.0894412191582004, "grad_norm": 0.9765625, "learning_rate": 0.0004888150843908288, "loss": 5.0431, "mean_token_accuracy": 0.20289771109819413, "num_tokens": 24922211.0, "step": 12010 }, { "entropy": 5.479585027694702, "epoch": 1.0898947750362844, "grad_norm": 1.0703125, "learning_rate": 0.0004888050074115426, "loss": 5.1556, "mean_token_accuracy": 0.19275439232587815, "num_tokens": 24932129.0, "step": 12015 }, { "entropy": 5.521604299545288, "epoch": 1.0903483309143687, "grad_norm": 1.015625, "learning_rate": 0.0004887949260107143, "loss": 5.1387, "mean_token_accuracy": 0.18956592082977294, "num_tokens": 24942869.0, "step": 12020 }, { "entropy": 5.414851093292237, "epoch": 1.0908018867924527, "grad_norm": 1.03125, "learning_rate": 0.0004887848401885524, "loss": 5.08, "mean_token_accuracy": 0.19793568402528763, "num_tokens": 24952621.0, "step": 12025 }, { "entropy": 5.561692905426026, "epoch": 1.091255442670537, "grad_norm": 1.0703125, "learning_rate": 0.0004887747499452656, "loss": 5.1966, "mean_token_accuracy": 0.18556403815746308, "num_tokens": 24963587.0, "step": 12030 }, { "entropy": 5.484190034866333, "epoch": 1.0917089985486212, "grad_norm": 0.88671875, "learning_rate": 0.0004887646552810624, "loss": 5.046, "mean_token_accuracy": 0.19763047248125076, "num_tokens": 24974122.0, "step": 12035 }, { "entropy": 5.438176679611206, "epoch": 1.0921625544267053, "grad_norm": 0.95703125, "learning_rate": 0.0004887545561961517, "loss": 5.1421, "mean_token_accuracy": 0.18937054723501207, "num_tokens": 24985145.0, "step": 12040 }, { "entropy": 5.410459756851196, "epoch": 1.0926161103047896, "grad_norm": 0.9609375, "learning_rate": 0.0004887444526907424, "loss": 5.0487, "mean_token_accuracy": 0.19937893897294998, "num_tokens": 24995511.0, "step": 12045 }, { "entropy": 5.481537866592407, "epoch": 1.0930696661828738, "grad_norm": 0.94140625, "learning_rate": 0.0004887343447650432, "loss": 5.0793, "mean_token_accuracy": 0.19209745675325393, "num_tokens": 25006193.0, "step": 12050 }, { "entropy": 5.504720258712768, "epoch": 1.0935232220609579, "grad_norm": 0.96484375, "learning_rate": 0.0004887242324192634, "loss": 5.1121, "mean_token_accuracy": 0.19623176604509354, "num_tokens": 25016444.0, "step": 12055 }, { "entropy": 5.4893440246582035, "epoch": 1.0939767779390421, "grad_norm": 0.92578125, "learning_rate": 0.0004887141156536119, "loss": 5.0958, "mean_token_accuracy": 0.19245172739028932, "num_tokens": 25027898.0, "step": 12060 }, { "entropy": 5.439944267272949, "epoch": 1.0944303338171262, "grad_norm": 0.98828125, "learning_rate": 0.0004887039944682981, "loss": 5.0109, "mean_token_accuracy": 0.19628615528345109, "num_tokens": 25038201.0, "step": 12065 }, { "entropy": 5.535740566253662, "epoch": 1.0948838896952104, "grad_norm": 1.0390625, "learning_rate": 0.0004886938688635313, "loss": 5.2025, "mean_token_accuracy": 0.1854793146252632, "num_tokens": 25048466.0, "step": 12070 }, { "entropy": 5.569825315475464, "epoch": 1.0953374455732947, "grad_norm": 0.9609375, "learning_rate": 0.0004886837388395207, "loss": 5.1386, "mean_token_accuracy": 0.19498365968465806, "num_tokens": 25059064.0, "step": 12075 }, { "entropy": 5.544608736038208, "epoch": 1.0957910014513788, "grad_norm": 1.0625, "learning_rate": 0.000488673604396476, "loss": 5.229, "mean_token_accuracy": 0.18380790054798127, "num_tokens": 25068834.0, "step": 12080 }, { "entropy": 5.470860290527344, "epoch": 1.096244557329463, "grad_norm": 1.015625, "learning_rate": 0.0004886634655346067, "loss": 5.1643, "mean_token_accuracy": 0.18487847447395325, "num_tokens": 25080058.0, "step": 12085 }, { "entropy": 5.452997398376465, "epoch": 1.0966981132075473, "grad_norm": 1.015625, "learning_rate": 0.0004886533222541225, "loss": 5.0314, "mean_token_accuracy": 0.1977093443274498, "num_tokens": 25089751.0, "step": 12090 }, { "entropy": 5.490142726898194, "epoch": 1.0971516690856313, "grad_norm": 1.046875, "learning_rate": 0.0004886431745552331, "loss": 5.1177, "mean_token_accuracy": 0.1926141932606697, "num_tokens": 25099055.0, "step": 12095 }, { "entropy": 5.540484094619751, "epoch": 1.0976052249637156, "grad_norm": 0.94921875, "learning_rate": 0.0004886330224381485, "loss": 5.1985, "mean_token_accuracy": 0.18552614599466324, "num_tokens": 25109793.0, "step": 12100 }, { "entropy": 5.512198829650879, "epoch": 1.0980587808417996, "grad_norm": 1.0703125, "learning_rate": 0.0004886228659030785, "loss": 5.1145, "mean_token_accuracy": 0.19541315287351607, "num_tokens": 25119814.0, "step": 12105 }, { "entropy": 5.5101316452026365, "epoch": 1.098512336719884, "grad_norm": 0.93359375, "learning_rate": 0.0004886127049502331, "loss": 5.1705, "mean_token_accuracy": 0.19278408586978912, "num_tokens": 25130747.0, "step": 12110 }, { "entropy": 5.426028537750244, "epoch": 1.0989658925979682, "grad_norm": 1.0546875, "learning_rate": 0.0004886025395798228, "loss": 5.0612, "mean_token_accuracy": 0.19459046125411988, "num_tokens": 25142235.0, "step": 12115 }, { "entropy": 5.361623859405517, "epoch": 1.0994194484760522, "grad_norm": 0.98046875, "learning_rate": 0.0004885923697920573, "loss": 5.0037, "mean_token_accuracy": 0.20498927682638168, "num_tokens": 25152047.0, "step": 12120 }, { "entropy": 5.411035346984863, "epoch": 1.0998730043541365, "grad_norm": 0.98046875, "learning_rate": 0.0004885821955871472, "loss": 5.058, "mean_token_accuracy": 0.2009945407509804, "num_tokens": 25162678.0, "step": 12125 }, { "entropy": 5.496362113952637, "epoch": 1.1003265602322205, "grad_norm": 0.96875, "learning_rate": 0.0004885720169653028, "loss": 5.0533, "mean_token_accuracy": 0.19901553094387053, "num_tokens": 25172973.0, "step": 12130 }, { "entropy": 5.540875244140625, "epoch": 1.1007801161103048, "grad_norm": 0.95703125, "learning_rate": 0.0004885618339267348, "loss": 5.1815, "mean_token_accuracy": 0.18809981942176818, "num_tokens": 25183458.0, "step": 12135 }, { "entropy": 5.438296604156494, "epoch": 1.101233671988389, "grad_norm": 0.9609375, "learning_rate": 0.0004885516464716537, "loss": 5.061, "mean_token_accuracy": 0.198656103014946, "num_tokens": 25193827.0, "step": 12140 }, { "entropy": 5.515053462982178, "epoch": 1.101687227866473, "grad_norm": 1.0859375, "learning_rate": 0.00048854145460027, "loss": 5.0917, "mean_token_accuracy": 0.18708029985427857, "num_tokens": 25204448.0, "step": 12145 }, { "entropy": 5.481131553649902, "epoch": 1.1021407837445574, "grad_norm": 1.03125, "learning_rate": 0.0004885312583127946, "loss": 5.0465, "mean_token_accuracy": 0.2026984691619873, "num_tokens": 25215041.0, "step": 12150 }, { "entropy": 5.445676517486572, "epoch": 1.1025943396226414, "grad_norm": 0.98046875, "learning_rate": 0.0004885210576094385, "loss": 5.0978, "mean_token_accuracy": 0.19386008232831956, "num_tokens": 25225937.0, "step": 12155 }, { "entropy": 5.3993080139160154, "epoch": 1.1030478955007257, "grad_norm": 1.03125, "learning_rate": 0.0004885108524904124, "loss": 5.012, "mean_token_accuracy": 0.19879624843597413, "num_tokens": 25235270.0, "step": 12160 }, { "entropy": 5.419803476333618, "epoch": 1.10350145137881, "grad_norm": 0.9296875, "learning_rate": 0.0004885006429559275, "loss": 5.1018, "mean_token_accuracy": 0.18878085315227508, "num_tokens": 25247080.0, "step": 12165 }, { "entropy": 5.491727638244629, "epoch": 1.103955007256894, "grad_norm": 1.0859375, "learning_rate": 0.0004884904290061949, "loss": 5.0817, "mean_token_accuracy": 0.18722966760396959, "num_tokens": 25256718.0, "step": 12170 }, { "entropy": 5.499802446365356, "epoch": 1.1044085631349783, "grad_norm": 0.94140625, "learning_rate": 0.0004884802106414258, "loss": 5.2064, "mean_token_accuracy": 0.1875415787100792, "num_tokens": 25266632.0, "step": 12175 }, { "entropy": 5.468026447296142, "epoch": 1.1048621190130623, "grad_norm": 1.046875, "learning_rate": 0.0004884699878618316, "loss": 5.0665, "mean_token_accuracy": 0.20060146898031234, "num_tokens": 25275598.0, "step": 12180 }, { "entropy": 5.5242133140563965, "epoch": 1.1053156748911466, "grad_norm": 0.9453125, "learning_rate": 0.0004884597606676236, "loss": 5.1664, "mean_token_accuracy": 0.19410443753004075, "num_tokens": 25286598.0, "step": 12185 }, { "entropy": 5.47405595779419, "epoch": 1.1057692307692308, "grad_norm": 1.0234375, "learning_rate": 0.0004884495290590134, "loss": 5.0676, "mean_token_accuracy": 0.199165478348732, "num_tokens": 25296730.0, "step": 12190 }, { "entropy": 5.415151071548462, "epoch": 1.1062227866473149, "grad_norm": 0.9375, "learning_rate": 0.0004884392930362124, "loss": 4.9844, "mean_token_accuracy": 0.20322936922311782, "num_tokens": 25306326.0, "step": 12195 }, { "entropy": 5.477290248870849, "epoch": 1.1066763425253991, "grad_norm": 0.953125, "learning_rate": 0.0004884290525994326, "loss": 5.1077, "mean_token_accuracy": 0.19518473744392395, "num_tokens": 25316342.0, "step": 12200 }, { "entropy": 5.539191722869873, "epoch": 1.1071298984034832, "grad_norm": 0.99609375, "learning_rate": 0.0004884188077488855, "loss": 5.1426, "mean_token_accuracy": 0.18671423494815825, "num_tokens": 25326129.0, "step": 12205 }, { "entropy": 5.463911628723144, "epoch": 1.1075834542815675, "grad_norm": 0.99609375, "learning_rate": 0.0004884085584847831, "loss": 5.1031, "mean_token_accuracy": 0.1914559096097946, "num_tokens": 25337156.0, "step": 12210 }, { "entropy": 5.540527200698852, "epoch": 1.1080370101596517, "grad_norm": 0.9453125, "learning_rate": 0.0004883983048073375, "loss": 5.2233, "mean_token_accuracy": 0.18347180634737015, "num_tokens": 25347632.0, "step": 12215 }, { "entropy": 5.4638416290283205, "epoch": 1.1084905660377358, "grad_norm": 0.89453125, "learning_rate": 0.0004883880467167603, "loss": 4.9907, "mean_token_accuracy": 0.19963539987802506, "num_tokens": 25359186.0, "step": 12220 }, { "entropy": 5.502979707717896, "epoch": 1.10894412191582, "grad_norm": 1.1484375, "learning_rate": 0.000488377784213264, "loss": 5.1043, "mean_token_accuracy": 0.19738257825374603, "num_tokens": 25368993.0, "step": 12225 }, { "entropy": 5.3920735836029055, "epoch": 1.1093976777939043, "grad_norm": 0.96875, "learning_rate": 0.0004883675172970608, "loss": 5.0669, "mean_token_accuracy": 0.19466077238321305, "num_tokens": 25379880.0, "step": 12230 }, { "entropy": 5.495429229736328, "epoch": 1.1098512336719883, "grad_norm": 0.94921875, "learning_rate": 0.000488357245968363, "loss": 5.2538, "mean_token_accuracy": 0.1847075939178467, "num_tokens": 25389942.0, "step": 12235 }, { "entropy": 5.468625593185425, "epoch": 1.1103047895500726, "grad_norm": 0.9609375, "learning_rate": 0.0004883469702273829, "loss": 5.0429, "mean_token_accuracy": 0.19933029413223266, "num_tokens": 25400836.0, "step": 12240 }, { "entropy": 5.4450860023498535, "epoch": 1.1107583454281567, "grad_norm": 0.95703125, "learning_rate": 0.0004883366900743331, "loss": 5.062, "mean_token_accuracy": 0.20043474137783052, "num_tokens": 25410502.0, "step": 12245 }, { "entropy": 5.436722755432129, "epoch": 1.111211901306241, "grad_norm": 0.96875, "learning_rate": 0.0004883264055094262, "loss": 5.0162, "mean_token_accuracy": 0.2023913726210594, "num_tokens": 25420301.0, "step": 12250 }, { "entropy": 5.462346839904785, "epoch": 1.1116654571843252, "grad_norm": 1.0390625, "learning_rate": 0.0004883161165328749, "loss": 5.1073, "mean_token_accuracy": 0.19105413258075715, "num_tokens": 25431107.0, "step": 12255 }, { "entropy": 5.468860864639282, "epoch": 1.1121190130624092, "grad_norm": 1.015625, "learning_rate": 0.000488305823144892, "loss": 5.109, "mean_token_accuracy": 0.1985253646969795, "num_tokens": 25441256.0, "step": 12260 }, { "entropy": 5.512408590316772, "epoch": 1.1125725689404935, "grad_norm": 1.0703125, "learning_rate": 0.0004882955253456902, "loss": 5.0441, "mean_token_accuracy": 0.20018399506807327, "num_tokens": 25451627.0, "step": 12265 }, { "entropy": 5.519826793670655, "epoch": 1.1130261248185778, "grad_norm": 1.0546875, "learning_rate": 0.0004882852231354826, "loss": 5.1596, "mean_token_accuracy": 0.1922303855419159, "num_tokens": 25461273.0, "step": 12270 }, { "entropy": 5.394473886489868, "epoch": 1.1134796806966618, "grad_norm": 0.953125, "learning_rate": 0.0004882749165144822, "loss": 5.0502, "mean_token_accuracy": 0.1974688798189163, "num_tokens": 25471949.0, "step": 12275 }, { "entropy": 5.462115383148193, "epoch": 1.113933236574746, "grad_norm": 0.96875, "learning_rate": 0.0004882646054829023, "loss": 5.0608, "mean_token_accuracy": 0.19317834824323654, "num_tokens": 25482175.0, "step": 12280 }, { "entropy": 5.498352575302124, "epoch": 1.1143867924528301, "grad_norm": 0.98828125, "learning_rate": 0.00048825429004095597, "loss": 5.1434, "mean_token_accuracy": 0.19709102362394332, "num_tokens": 25491786.0, "step": 12285 }, { "entropy": 5.473578929901123, "epoch": 1.1148403483309144, "grad_norm": 0.8828125, "learning_rate": 0.0004882439701888566, "loss": 5.0586, "mean_token_accuracy": 0.20382800549268723, "num_tokens": 25502103.0, "step": 12290 }, { "entropy": 5.438637828826904, "epoch": 1.1152939042089987, "grad_norm": 0.9609375, "learning_rate": 0.00048823364592681754, "loss": 5.0393, "mean_token_accuracy": 0.1983577087521553, "num_tokens": 25512530.0, "step": 12295 }, { "entropy": 5.4492512226104735, "epoch": 1.1157474600870827, "grad_norm": 0.99609375, "learning_rate": 0.00048822331725505234, "loss": 5.0464, "mean_token_accuracy": 0.19616839587688445, "num_tokens": 25522905.0, "step": 12300 }, { "entropy": 5.4275946617126465, "epoch": 1.116201015965167, "grad_norm": 0.921875, "learning_rate": 0.00048821298417377456, "loss": 5.0121, "mean_token_accuracy": 0.2009132131934166, "num_tokens": 25532963.0, "step": 12305 }, { "entropy": 5.365885400772095, "epoch": 1.116654571843251, "grad_norm": 0.9765625, "learning_rate": 0.000488202646683198, "loss": 5.093, "mean_token_accuracy": 0.19705985486507416, "num_tokens": 25542583.0, "step": 12310 }, { "entropy": 5.445810461044312, "epoch": 1.1171081277213353, "grad_norm": 0.98046875, "learning_rate": 0.0004881923047835364, "loss": 5.0706, "mean_token_accuracy": 0.19825900644063948, "num_tokens": 25553367.0, "step": 12315 }, { "entropy": 5.599606609344482, "epoch": 1.1175616835994195, "grad_norm": 0.890625, "learning_rate": 0.0004881819584750036, "loss": 5.1615, "mean_token_accuracy": 0.18648526966571807, "num_tokens": 25564823.0, "step": 12320 }, { "entropy": 5.49623966217041, "epoch": 1.1180152394775036, "grad_norm": 0.9296875, "learning_rate": 0.00048817160775781356, "loss": 5.1427, "mean_token_accuracy": 0.19345640689134597, "num_tokens": 25574946.0, "step": 12325 }, { "entropy": 5.480826711654663, "epoch": 1.1184687953555879, "grad_norm": 1.0078125, "learning_rate": 0.00048816125263218023, "loss": 5.123, "mean_token_accuracy": 0.19235989600419998, "num_tokens": 25584779.0, "step": 12330 }, { "entropy": 5.5709977626800535, "epoch": 1.118922351233672, "grad_norm": 1.0078125, "learning_rate": 0.00048815089309831803, "loss": 5.1842, "mean_token_accuracy": 0.1899712488055229, "num_tokens": 25594725.0, "step": 12335 }, { "entropy": 5.492442321777344, "epoch": 1.1193759071117562, "grad_norm": 0.99609375, "learning_rate": 0.000488140529156441, "loss": 5.1615, "mean_token_accuracy": 0.19133716225624084, "num_tokens": 25605499.0, "step": 12340 }, { "entropy": 5.456181573867798, "epoch": 1.1198294629898404, "grad_norm": 0.93359375, "learning_rate": 0.0004881301608067635, "loss": 5.1027, "mean_token_accuracy": 0.19733177721500397, "num_tokens": 25616443.0, "step": 12345 }, { "entropy": 5.474880027770996, "epoch": 1.1202830188679245, "grad_norm": 0.9375, "learning_rate": 0.00048811978804949997, "loss": 5.0835, "mean_token_accuracy": 0.19235514104366302, "num_tokens": 25627762.0, "step": 12350 }, { "entropy": 5.548942899703979, "epoch": 1.1207365747460087, "grad_norm": 1.078125, "learning_rate": 0.000488109410884865, "loss": 5.1536, "mean_token_accuracy": 0.1956962913274765, "num_tokens": 25637904.0, "step": 12355 }, { "entropy": 5.486640548706054, "epoch": 1.1211901306240928, "grad_norm": 0.890625, "learning_rate": 0.00048809902931307294, "loss": 5.0252, "mean_token_accuracy": 0.19654428511857985, "num_tokens": 25649058.0, "step": 12360 }, { "entropy": 5.459781503677368, "epoch": 1.121643686502177, "grad_norm": 0.9453125, "learning_rate": 0.0004880886433343388, "loss": 5.0976, "mean_token_accuracy": 0.1945563241839409, "num_tokens": 25659161.0, "step": 12365 }, { "entropy": 5.438920974731445, "epoch": 1.1220972423802613, "grad_norm": 0.98046875, "learning_rate": 0.0004880782529488771, "loss": 4.9989, "mean_token_accuracy": 0.20202931463718415, "num_tokens": 25669336.0, "step": 12370 }, { "entropy": 5.476479721069336, "epoch": 1.1225507982583454, "grad_norm": 0.953125, "learning_rate": 0.0004880678581569029, "loss": 5.1366, "mean_token_accuracy": 0.19516809284687042, "num_tokens": 25680443.0, "step": 12375 }, { "entropy": 5.456211900711059, "epoch": 1.1230043541364296, "grad_norm": 0.9921875, "learning_rate": 0.00048805745895863105, "loss": 5.0602, "mean_token_accuracy": 0.19789458215236663, "num_tokens": 25690202.0, "step": 12380 }, { "entropy": 5.44689302444458, "epoch": 1.1234579100145137, "grad_norm": 1.046875, "learning_rate": 0.0004880470553542767, "loss": 5.117, "mean_token_accuracy": 0.19373457729816437, "num_tokens": 25699255.0, "step": 12385 }, { "entropy": 5.493829441070557, "epoch": 1.123911465892598, "grad_norm": 0.88671875, "learning_rate": 0.00048803664734405495, "loss": 5.1017, "mean_token_accuracy": 0.19037623703479767, "num_tokens": 25710714.0, "step": 12390 }, { "entropy": 5.485815620422363, "epoch": 1.1243650217706822, "grad_norm": 0.95703125, "learning_rate": 0.000488026234928181, "loss": 5.0729, "mean_token_accuracy": 0.1951461464166641, "num_tokens": 25721722.0, "step": 12395 }, { "entropy": 5.467492341995239, "epoch": 1.1248185776487662, "grad_norm": 0.97265625, "learning_rate": 0.0004880158181068703, "loss": 5.0577, "mean_token_accuracy": 0.206204853951931, "num_tokens": 25732096.0, "step": 12400 }, { "entropy": 5.469112682342529, "epoch": 1.1252721335268505, "grad_norm": 1.0078125, "learning_rate": 0.00048800539688033807, "loss": 5.1189, "mean_token_accuracy": 0.19479695409536363, "num_tokens": 25741499.0, "step": 12405 }, { "entropy": 5.50004940032959, "epoch": 1.1257256894049348, "grad_norm": 1.0234375, "learning_rate": 0.0004879949712488001, "loss": 5.1899, "mean_token_accuracy": 0.19636364728212358, "num_tokens": 25751913.0, "step": 12410 }, { "entropy": 5.4780515193939205, "epoch": 1.1261792452830188, "grad_norm": 0.97265625, "learning_rate": 0.00048798454121247177, "loss": 5.1325, "mean_token_accuracy": 0.19104093164205552, "num_tokens": 25762602.0, "step": 12415 }, { "entropy": 5.4434812545776365, "epoch": 1.126632801161103, "grad_norm": 0.98828125, "learning_rate": 0.0004879741067715688, "loss": 5.0821, "mean_token_accuracy": 0.19571268558502197, "num_tokens": 25773872.0, "step": 12420 }, { "entropy": 5.521503114700318, "epoch": 1.1270863570391871, "grad_norm": 1.0078125, "learning_rate": 0.00048796366792630715, "loss": 5.0933, "mean_token_accuracy": 0.19417802542448043, "num_tokens": 25784723.0, "step": 12425 }, { "entropy": 5.4688825607299805, "epoch": 1.1275399129172714, "grad_norm": 1.03125, "learning_rate": 0.0004879532246769025, "loss": 5.1012, "mean_token_accuracy": 0.19289073944091797, "num_tokens": 25794897.0, "step": 12430 }, { "entropy": 5.425449371337891, "epoch": 1.1279934687953557, "grad_norm": 1.0078125, "learning_rate": 0.0004879427770235709, "loss": 5.0159, "mean_token_accuracy": 0.20814288258552552, "num_tokens": 25804445.0, "step": 12435 }, { "entropy": 5.499363708496094, "epoch": 1.1284470246734397, "grad_norm": 0.8984375, "learning_rate": 0.00048793232496652846, "loss": 5.1645, "mean_token_accuracy": 0.18461741954088212, "num_tokens": 25815495.0, "step": 12440 }, { "entropy": 5.4840599536895756, "epoch": 1.128900580551524, "grad_norm": 0.96875, "learning_rate": 0.00048792186850599124, "loss": 5.0966, "mean_token_accuracy": 0.19891237020492553, "num_tokens": 25826120.0, "step": 12445 }, { "entropy": 5.423397397994995, "epoch": 1.1293541364296082, "grad_norm": 0.96875, "learning_rate": 0.0004879114076421755, "loss": 5.0847, "mean_token_accuracy": 0.19845402240753174, "num_tokens": 25835926.0, "step": 12450 }, { "entropy": 5.442421865463257, "epoch": 1.1298076923076923, "grad_norm": 0.96484375, "learning_rate": 0.00048790094237529763, "loss": 5.1257, "mean_token_accuracy": 0.19075507521629334, "num_tokens": 25846095.0, "step": 12455 }, { "entropy": 5.547850894927978, "epoch": 1.1302612481857766, "grad_norm": 1.03125, "learning_rate": 0.000487890472705574, "loss": 5.1221, "mean_token_accuracy": 0.1937321200966835, "num_tokens": 25858541.0, "step": 12460 }, { "entropy": 5.51123275756836, "epoch": 1.1307148040638606, "grad_norm": 1.03125, "learning_rate": 0.00048787999863322113, "loss": 5.0326, "mean_token_accuracy": 0.1969616174697876, "num_tokens": 25867664.0, "step": 12465 }, { "entropy": 5.458842515945435, "epoch": 1.1311683599419449, "grad_norm": 0.98828125, "learning_rate": 0.0004878695201584557, "loss": 5.1305, "mean_token_accuracy": 0.19804387539625168, "num_tokens": 25877300.0, "step": 12470 }, { "entropy": 5.440077924728394, "epoch": 1.1316219158200291, "grad_norm": 0.8984375, "learning_rate": 0.0004878590372814943, "loss": 5.0784, "mean_token_accuracy": 0.1993800789117813, "num_tokens": 25888009.0, "step": 12475 }, { "entropy": 5.5107615947723385, "epoch": 1.1320754716981132, "grad_norm": 1.046875, "learning_rate": 0.00048784855000255374, "loss": 5.139, "mean_token_accuracy": 0.18950151801109313, "num_tokens": 25897285.0, "step": 12480 }, { "entropy": 5.44799313545227, "epoch": 1.1325290275761974, "grad_norm": 0.984375, "learning_rate": 0.00048783805832185097, "loss": 5.0295, "mean_token_accuracy": 0.1994224727153778, "num_tokens": 25907355.0, "step": 12485 }, { "entropy": 5.481715393066406, "epoch": 1.1329825834542815, "grad_norm": 0.890625, "learning_rate": 0.0004878275622396029, "loss": 5.0931, "mean_token_accuracy": 0.20050271451473237, "num_tokens": 25918566.0, "step": 12490 }, { "entropy": 5.4791121006011965, "epoch": 1.1334361393323658, "grad_norm": 1.0390625, "learning_rate": 0.00048781706175602665, "loss": 5.1519, "mean_token_accuracy": 0.1925746187567711, "num_tokens": 25929145.0, "step": 12495 }, { "entropy": 5.451447343826294, "epoch": 1.13388969521045, "grad_norm": 1.03125, "learning_rate": 0.00048780655687133927, "loss": 5.0148, "mean_token_accuracy": 0.19808944463729858, "num_tokens": 25938163.0, "step": 12500 }, { "entropy": 5.449240875244141, "epoch": 1.134343251088534, "grad_norm": 0.90625, "learning_rate": 0.00048779604758575806, "loss": 5.0501, "mean_token_accuracy": 0.19204022139310836, "num_tokens": 25948962.0, "step": 12505 }, { "entropy": 5.41950626373291, "epoch": 1.1347968069666183, "grad_norm": 1.0, "learning_rate": 0.0004877855338995004, "loss": 5.0298, "mean_token_accuracy": 0.195741006731987, "num_tokens": 25959653.0, "step": 12510 }, { "entropy": 5.537498331069946, "epoch": 1.1352503628447024, "grad_norm": 1.0078125, "learning_rate": 0.00048777501581278367, "loss": 5.1117, "mean_token_accuracy": 0.1958885371685028, "num_tokens": 25970268.0, "step": 12515 }, { "entropy": 5.4535798072814945, "epoch": 1.1357039187227866, "grad_norm": 1.03125, "learning_rate": 0.0004877644933258254, "loss": 5.0691, "mean_token_accuracy": 0.19766748696565628, "num_tokens": 25980321.0, "step": 12520 }, { "entropy": 5.394514036178589, "epoch": 1.136157474600871, "grad_norm": 0.953125, "learning_rate": 0.0004877539664388432, "loss": 5.0674, "mean_token_accuracy": 0.19097693562507628, "num_tokens": 25992466.0, "step": 12525 }, { "entropy": 5.459747552871704, "epoch": 1.136611030478955, "grad_norm": 0.95703125, "learning_rate": 0.00048774343515205464, "loss": 5.054, "mean_token_accuracy": 0.2004119947552681, "num_tokens": 26003553.0, "step": 12530 }, { "entropy": 5.461809778213501, "epoch": 1.1370645863570392, "grad_norm": 1.0390625, "learning_rate": 0.0004877328994656778, "loss": 5.0776, "mean_token_accuracy": 0.19754336774349213, "num_tokens": 26013299.0, "step": 12535 }, { "entropy": 5.421274185180664, "epoch": 1.1375181422351233, "grad_norm": 0.99609375, "learning_rate": 0.0004877223593799303, "loss": 5.0922, "mean_token_accuracy": 0.1976127028465271, "num_tokens": 26022913.0, "step": 12540 }, { "entropy": 5.381703662872314, "epoch": 1.1379716981132075, "grad_norm": 1.03125, "learning_rate": 0.0004877118148950302, "loss": 5.0667, "mean_token_accuracy": 0.2003282517194748, "num_tokens": 26033191.0, "step": 12545 }, { "entropy": 5.607171106338501, "epoch": 1.1384252539912918, "grad_norm": 0.984375, "learning_rate": 0.00048770126601119555, "loss": 5.2287, "mean_token_accuracy": 0.18697791695594787, "num_tokens": 26043517.0, "step": 12550 }, { "entropy": 5.564448261260987, "epoch": 1.1388788098693758, "grad_norm": 1.03125, "learning_rate": 0.00048769071272864454, "loss": 5.1749, "mean_token_accuracy": 0.18821585327386856, "num_tokens": 26054173.0, "step": 12555 }, { "entropy": 5.46494140625, "epoch": 1.13933236574746, "grad_norm": 0.98828125, "learning_rate": 0.00048768015504759536, "loss": 5.1396, "mean_token_accuracy": 0.1895514503121376, "num_tokens": 26064929.0, "step": 12560 }, { "entropy": 5.430631017684936, "epoch": 1.1397859216255442, "grad_norm": 0.99609375, "learning_rate": 0.0004876695929682665, "loss": 5.051, "mean_token_accuracy": 0.20218482315540315, "num_tokens": 26074872.0, "step": 12565 }, { "entropy": 5.438392305374146, "epoch": 1.1402394775036284, "grad_norm": 0.953125, "learning_rate": 0.00048765902649087605, "loss": 4.9689, "mean_token_accuracy": 0.20143624842166902, "num_tokens": 26086328.0, "step": 12570 }, { "entropy": 5.489910888671875, "epoch": 1.1406930333817127, "grad_norm": 1.015625, "learning_rate": 0.00048764845561564285, "loss": 5.0667, "mean_token_accuracy": 0.19734783172607423, "num_tokens": 26096477.0, "step": 12575 }, { "entropy": 5.443499040603638, "epoch": 1.1411465892597967, "grad_norm": 1.0625, "learning_rate": 0.00048763788034278545, "loss": 5.0228, "mean_token_accuracy": 0.2042930543422699, "num_tokens": 26106183.0, "step": 12580 }, { "entropy": 5.452051162719727, "epoch": 1.141600145137881, "grad_norm": 0.9296875, "learning_rate": 0.0004876273006725225, "loss": 5.0863, "mean_token_accuracy": 0.1972722053527832, "num_tokens": 26117932.0, "step": 12585 }, { "entropy": 5.421517372131348, "epoch": 1.1420537010159653, "grad_norm": 0.93359375, "learning_rate": 0.00048761671660507266, "loss": 5.0487, "mean_token_accuracy": 0.20064830929040908, "num_tokens": 26128616.0, "step": 12590 }, { "entropy": 5.465033340454101, "epoch": 1.1425072568940493, "grad_norm": 0.9375, "learning_rate": 0.000487606128140655, "loss": 5.0636, "mean_token_accuracy": 0.194732204079628, "num_tokens": 26138758.0, "step": 12595 }, { "entropy": 5.431522226333618, "epoch": 1.1429608127721336, "grad_norm": 1.03125, "learning_rate": 0.0004875955352794885, "loss": 5.0686, "mean_token_accuracy": 0.19568051546812057, "num_tokens": 26149199.0, "step": 12600 }, { "entropy": 5.385068941116333, "epoch": 1.1434143686502176, "grad_norm": 0.8671875, "learning_rate": 0.0004875849380217921, "loss": 5.1498, "mean_token_accuracy": 0.19365084618330003, "num_tokens": 26160276.0, "step": 12605 }, { "entropy": 5.453707456588745, "epoch": 1.1438679245283019, "grad_norm": 1.0390625, "learning_rate": 0.000487574336367785, "loss": 5.0343, "mean_token_accuracy": 0.20267068594694138, "num_tokens": 26169564.0, "step": 12610 }, { "entropy": 5.410078430175782, "epoch": 1.1443214804063861, "grad_norm": 1.0625, "learning_rate": 0.0004875637303176865, "loss": 5.0018, "mean_token_accuracy": 0.20318748354911803, "num_tokens": 26179135.0, "step": 12615 }, { "entropy": 5.486770486831665, "epoch": 1.1447750362844702, "grad_norm": 1.03125, "learning_rate": 0.00048755311987171585, "loss": 5.1419, "mean_token_accuracy": 0.19420150220394133, "num_tokens": 26190116.0, "step": 12620 }, { "entropy": 5.481070184707642, "epoch": 1.1452285921625545, "grad_norm": 1.046875, "learning_rate": 0.00048754250503009244, "loss": 5.2052, "mean_token_accuracy": 0.19010931998491287, "num_tokens": 26200847.0, "step": 12625 }, { "entropy": 5.567831230163574, "epoch": 1.1456821480406387, "grad_norm": 0.98828125, "learning_rate": 0.00048753188579303596, "loss": 5.1633, "mean_token_accuracy": 0.18948815912008285, "num_tokens": 26211151.0, "step": 12630 }, { "entropy": 5.521000099182129, "epoch": 1.1461357039187228, "grad_norm": 0.92578125, "learning_rate": 0.0004875212621607659, "loss": 5.0759, "mean_token_accuracy": 0.2008240759372711, "num_tokens": 26221273.0, "step": 12635 }, { "entropy": 5.4748125076293945, "epoch": 1.146589259796807, "grad_norm": 1.015625, "learning_rate": 0.00048751063413350203, "loss": 5.1833, "mean_token_accuracy": 0.19045755565166472, "num_tokens": 26231770.0, "step": 12640 }, { "entropy": 5.499720907211303, "epoch": 1.147042815674891, "grad_norm": 1.0625, "learning_rate": 0.000487500001711464, "loss": 5.1391, "mean_token_accuracy": 0.18866709470748902, "num_tokens": 26241386.0, "step": 12645 }, { "entropy": 5.602534341812134, "epoch": 1.1474963715529753, "grad_norm": 0.9375, "learning_rate": 0.0004874893648948719, "loss": 5.2091, "mean_token_accuracy": 0.18955794870853424, "num_tokens": 26251991.0, "step": 12650 }, { "entropy": 5.6351649284362795, "epoch": 1.1479499274310596, "grad_norm": 0.9609375, "learning_rate": 0.00048747872368394546, "loss": 5.2513, "mean_token_accuracy": 0.19125227779150009, "num_tokens": 26262331.0, "step": 12655 }, { "entropy": 5.529968738555908, "epoch": 1.1484034833091437, "grad_norm": 1.0703125, "learning_rate": 0.00048746807807890496, "loss": 5.1308, "mean_token_accuracy": 0.19330211877822875, "num_tokens": 26272939.0, "step": 12660 }, { "entropy": 5.46607928276062, "epoch": 1.148857039187228, "grad_norm": 1.0546875, "learning_rate": 0.00048745742807997046, "loss": 5.0857, "mean_token_accuracy": 0.2012448266148567, "num_tokens": 26282849.0, "step": 12665 }, { "entropy": 5.438662672042847, "epoch": 1.149310595065312, "grad_norm": 1.1015625, "learning_rate": 0.00048744677368736216, "loss": 5.0912, "mean_token_accuracy": 0.20526786148548126, "num_tokens": 26292449.0, "step": 12670 }, { "entropy": 5.380973482131958, "epoch": 1.1497641509433962, "grad_norm": 0.93359375, "learning_rate": 0.00048743611490130044, "loss": 5.0434, "mean_token_accuracy": 0.19729205071926117, "num_tokens": 26302506.0, "step": 12675 }, { "entropy": 5.474449586868286, "epoch": 1.1502177068214805, "grad_norm": 1.0, "learning_rate": 0.00048742545172200576, "loss": 5.1151, "mean_token_accuracy": 0.20258864015340805, "num_tokens": 26312346.0, "step": 12680 }, { "entropy": 5.537198209762574, "epoch": 1.1506712626995645, "grad_norm": 1.078125, "learning_rate": 0.0004874147841496986, "loss": 5.108, "mean_token_accuracy": 0.19865725040435792, "num_tokens": 26323173.0, "step": 12685 }, { "entropy": 5.49872899055481, "epoch": 1.1511248185776488, "grad_norm": 1.078125, "learning_rate": 0.0004874041121845996, "loss": 5.1664, "mean_token_accuracy": 0.18717677444219588, "num_tokens": 26334371.0, "step": 12690 }, { "entropy": 5.454615879058838, "epoch": 1.1515783744557329, "grad_norm": 1.03125, "learning_rate": 0.0004873934358269294, "loss": 5.1039, "mean_token_accuracy": 0.19639908522367477, "num_tokens": 26344506.0, "step": 12695 }, { "entropy": 5.584876155853271, "epoch": 1.1520319303338171, "grad_norm": 1.046875, "learning_rate": 0.0004873827550769088, "loss": 5.1198, "mean_token_accuracy": 0.19069299846887589, "num_tokens": 26354534.0, "step": 12700 }, { "entropy": 5.472890901565552, "epoch": 1.1524854862119014, "grad_norm": 0.95703125, "learning_rate": 0.0004873720699347587, "loss": 5.0802, "mean_token_accuracy": 0.1938564732670784, "num_tokens": 26365682.0, "step": 12705 }, { "entropy": 5.532165241241455, "epoch": 1.1529390420899854, "grad_norm": 1.0546875, "learning_rate": 0.0004873613804007001, "loss": 5.1995, "mean_token_accuracy": 0.19634334295988082, "num_tokens": 26376702.0, "step": 12710 }, { "entropy": 5.466576480865479, "epoch": 1.1533925979680697, "grad_norm": 1.0234375, "learning_rate": 0.0004873506864749541, "loss": 5.0072, "mean_token_accuracy": 0.19673150926828384, "num_tokens": 26387154.0, "step": 12715 }, { "entropy": 5.5687531471252445, "epoch": 1.1538461538461537, "grad_norm": 0.9609375, "learning_rate": 0.0004873399881577417, "loss": 5.1791, "mean_token_accuracy": 0.18616852909326553, "num_tokens": 26397883.0, "step": 12720 }, { "entropy": 5.3821008682250975, "epoch": 1.154299709724238, "grad_norm": 1.09375, "learning_rate": 0.0004873292854492842, "loss": 5.016, "mean_token_accuracy": 0.20302650928497315, "num_tokens": 26407613.0, "step": 12725 }, { "entropy": 5.341051197052002, "epoch": 1.1547532656023223, "grad_norm": 1.015625, "learning_rate": 0.0004873185783498031, "loss": 5.0092, "mean_token_accuracy": 0.19885518699884414, "num_tokens": 26417221.0, "step": 12730 }, { "entropy": 5.447017526626587, "epoch": 1.1552068214804063, "grad_norm": 0.90625, "learning_rate": 0.0004873078668595197, "loss": 5.0995, "mean_token_accuracy": 0.19121682792901992, "num_tokens": 26427976.0, "step": 12735 }, { "entropy": 5.496642923355102, "epoch": 1.1556603773584906, "grad_norm": 1.0, "learning_rate": 0.00048729715097865534, "loss": 5.1308, "mean_token_accuracy": 0.19671087712049484, "num_tokens": 26439213.0, "step": 12740 }, { "entropy": 5.446049642562866, "epoch": 1.1561139332365746, "grad_norm": 1.0234375, "learning_rate": 0.0004872864307074319, "loss": 5.0675, "mean_token_accuracy": 0.20202318876981734, "num_tokens": 26449763.0, "step": 12745 }, { "entropy": 5.519284391403199, "epoch": 1.156567489114659, "grad_norm": 1.046875, "learning_rate": 0.00048727570604607096, "loss": 5.1338, "mean_token_accuracy": 0.19712906181812287, "num_tokens": 26460133.0, "step": 12750 }, { "entropy": 5.514515590667725, "epoch": 1.1570210449927432, "grad_norm": 0.984375, "learning_rate": 0.00048726497699479437, "loss": 5.095, "mean_token_accuracy": 0.19766767770051957, "num_tokens": 26470164.0, "step": 12755 }, { "entropy": 5.455454349517822, "epoch": 1.1574746008708272, "grad_norm": 0.91015625, "learning_rate": 0.000487254243553824, "loss": 5.1113, "mean_token_accuracy": 0.19574321955442428, "num_tokens": 26480314.0, "step": 12760 }, { "entropy": 5.411750841140747, "epoch": 1.1579281567489115, "grad_norm": 0.95703125, "learning_rate": 0.0004872435057233817, "loss": 5.0544, "mean_token_accuracy": 0.198037189245224, "num_tokens": 26491184.0, "step": 12765 }, { "entropy": 5.450663471221924, "epoch": 1.1583817126269957, "grad_norm": 0.92578125, "learning_rate": 0.00048723276350368957, "loss": 4.9735, "mean_token_accuracy": 0.20026253461837767, "num_tokens": 26501432.0, "step": 12770 }, { "entropy": 5.466466188430786, "epoch": 1.1588352685050798, "grad_norm": 0.99609375, "learning_rate": 0.00048722201689496984, "loss": 5.0924, "mean_token_accuracy": 0.1962462067604065, "num_tokens": 26510379.0, "step": 12775 }, { "entropy": 5.437568092346192, "epoch": 1.159288824383164, "grad_norm": 1.0, "learning_rate": 0.0004872112658974447, "loss": 5.0774, "mean_token_accuracy": 0.20696530789136885, "num_tokens": 26519454.0, "step": 12780 }, { "entropy": 5.414034652709961, "epoch": 1.159742380261248, "grad_norm": 0.90234375, "learning_rate": 0.00048720051051133657, "loss": 4.9892, "mean_token_accuracy": 0.20221693068742752, "num_tokens": 26531325.0, "step": 12785 }, { "entropy": 5.438589096069336, "epoch": 1.1601959361393324, "grad_norm": 0.98046875, "learning_rate": 0.0004871897507368678, "loss": 5.0816, "mean_token_accuracy": 0.1968888595700264, "num_tokens": 26541510.0, "step": 12790 }, { "entropy": 5.505600023269653, "epoch": 1.1606494920174166, "grad_norm": 1.0625, "learning_rate": 0.00048717898657426093, "loss": 5.276, "mean_token_accuracy": 0.18606994152069092, "num_tokens": 26553400.0, "step": 12795 }, { "entropy": 5.515153980255127, "epoch": 1.1611030478955007, "grad_norm": 0.98046875, "learning_rate": 0.00048716821802373856, "loss": 5.0795, "mean_token_accuracy": 0.19739335477352143, "num_tokens": 26564340.0, "step": 12800 }, { "entropy": 5.503932476043701, "epoch": 1.161556603773585, "grad_norm": 1.0625, "learning_rate": 0.00048715744508552334, "loss": 5.0786, "mean_token_accuracy": 0.1971112832427025, "num_tokens": 26573615.0, "step": 12805 }, { "entropy": 5.499038791656494, "epoch": 1.1620101596516692, "grad_norm": 0.99609375, "learning_rate": 0.0004871466677598381, "loss": 5.2099, "mean_token_accuracy": 0.18656449317932128, "num_tokens": 26584149.0, "step": 12810 }, { "entropy": 5.446244955062866, "epoch": 1.1624637155297532, "grad_norm": 1.015625, "learning_rate": 0.0004871358860469057, "loss": 5.132, "mean_token_accuracy": 0.18631608486175538, "num_tokens": 26595064.0, "step": 12815 }, { "entropy": 5.452750778198242, "epoch": 1.1629172714078375, "grad_norm": 1.0625, "learning_rate": 0.00048712509994694903, "loss": 5.1086, "mean_token_accuracy": 0.19741549342870712, "num_tokens": 26605636.0, "step": 12820 }, { "entropy": 5.553749752044678, "epoch": 1.1633708272859216, "grad_norm": 1.0625, "learning_rate": 0.0004871143094601914, "loss": 5.2182, "mean_token_accuracy": 0.18952305167913436, "num_tokens": 26616065.0, "step": 12825 }, { "entropy": 5.554434728622437, "epoch": 1.1638243831640058, "grad_norm": 1.03125, "learning_rate": 0.0004871035145868557, "loss": 5.1269, "mean_token_accuracy": 0.19301836639642717, "num_tokens": 26627246.0, "step": 12830 }, { "entropy": 5.463024234771728, "epoch": 1.16427793904209, "grad_norm": 1.0078125, "learning_rate": 0.00048709271532716524, "loss": 5.1245, "mean_token_accuracy": 0.19043943732976915, "num_tokens": 26637630.0, "step": 12835 }, { "entropy": 5.514437246322632, "epoch": 1.1647314949201741, "grad_norm": 0.98828125, "learning_rate": 0.0004870819116813434, "loss": 5.163, "mean_token_accuracy": 0.1924004301428795, "num_tokens": 26648683.0, "step": 12840 }, { "entropy": 5.532897567749023, "epoch": 1.1651850507982584, "grad_norm": 0.98828125, "learning_rate": 0.00048707110364961363, "loss": 5.1197, "mean_token_accuracy": 0.19806863516569137, "num_tokens": 26659573.0, "step": 12845 }, { "entropy": 5.439857530593872, "epoch": 1.1656386066763424, "grad_norm": 1.015625, "learning_rate": 0.00048706029123219937, "loss": 5.0343, "mean_token_accuracy": 0.20120469629764556, "num_tokens": 26669384.0, "step": 12850 }, { "entropy": 5.511091804504394, "epoch": 1.1660921625544267, "grad_norm": 1.0390625, "learning_rate": 0.00048704947442932426, "loss": 5.1868, "mean_token_accuracy": 0.1870729684829712, "num_tokens": 26679721.0, "step": 12855 }, { "entropy": 5.5536027431488035, "epoch": 1.166545718432511, "grad_norm": 1.0234375, "learning_rate": 0.00048703865324121196, "loss": 5.0409, "mean_token_accuracy": 0.2025377035140991, "num_tokens": 26689923.0, "step": 12860 }, { "entropy": 5.392845726013183, "epoch": 1.166999274310595, "grad_norm": 0.96484375, "learning_rate": 0.00048702782766808637, "loss": 5.059, "mean_token_accuracy": 0.19589492827653884, "num_tokens": 26699953.0, "step": 12865 }, { "entropy": 5.492673873901367, "epoch": 1.1674528301886793, "grad_norm": 0.98046875, "learning_rate": 0.0004870169977101711, "loss": 5.2635, "mean_token_accuracy": 0.18201562464237214, "num_tokens": 26712099.0, "step": 12870 }, { "entropy": 5.562848711013794, "epoch": 1.1679063860667633, "grad_norm": 0.97265625, "learning_rate": 0.00048700616336769037, "loss": 5.1057, "mean_token_accuracy": 0.19736160188913346, "num_tokens": 26722334.0, "step": 12875 }, { "entropy": 5.480432987213135, "epoch": 1.1683599419448476, "grad_norm": 1.015625, "learning_rate": 0.00048699532464086817, "loss": 5.0638, "mean_token_accuracy": 0.19508631229400636, "num_tokens": 26732470.0, "step": 12880 }, { "entropy": 5.472351932525635, "epoch": 1.1688134978229319, "grad_norm": 0.984375, "learning_rate": 0.00048698448152992865, "loss": 5.0924, "mean_token_accuracy": 0.19666123986244202, "num_tokens": 26742015.0, "step": 12885 }, { "entropy": 5.415881586074829, "epoch": 1.169267053701016, "grad_norm": 0.93359375, "learning_rate": 0.00048697363403509605, "loss": 5.1137, "mean_token_accuracy": 0.19333956092596055, "num_tokens": 26753231.0, "step": 12890 }, { "entropy": 5.477305698394775, "epoch": 1.1697206095791002, "grad_norm": 1.03125, "learning_rate": 0.0004869627821565946, "loss": 5.0836, "mean_token_accuracy": 0.19506437778472902, "num_tokens": 26763895.0, "step": 12895 }, { "entropy": 5.524114513397217, "epoch": 1.1701741654571842, "grad_norm": 1.015625, "learning_rate": 0.0004869519258946489, "loss": 5.1779, "mean_token_accuracy": 0.19316886812448503, "num_tokens": 26774208.0, "step": 12900 }, { "entropy": 5.472482967376709, "epoch": 1.1706277213352685, "grad_norm": 1.0390625, "learning_rate": 0.00048694106524948324, "loss": 5.1097, "mean_token_accuracy": 0.19007119983434678, "num_tokens": 26785554.0, "step": 12905 }, { "entropy": 5.507984304428101, "epoch": 1.1710812772133528, "grad_norm": 0.98046875, "learning_rate": 0.00048693020022132243, "loss": 5.0287, "mean_token_accuracy": 0.19974969327449799, "num_tokens": 26795488.0, "step": 12910 }, { "entropy": 5.523132848739624, "epoch": 1.1715348330914368, "grad_norm": 0.9765625, "learning_rate": 0.000486919330810391, "loss": 5.1786, "mean_token_accuracy": 0.18989856988191606, "num_tokens": 26806801.0, "step": 12915 }, { "entropy": 5.499798250198364, "epoch": 1.171988388969521, "grad_norm": 1.0546875, "learning_rate": 0.0004869084570169139, "loss": 5.1058, "mean_token_accuracy": 0.1985375016927719, "num_tokens": 26816869.0, "step": 12920 }, { "entropy": 5.437505578994751, "epoch": 1.172441944847605, "grad_norm": 1.0234375, "learning_rate": 0.00048689757884111585, "loss": 5.0449, "mean_token_accuracy": 0.19810945689678192, "num_tokens": 26827003.0, "step": 12925 }, { "entropy": 5.412903690338135, "epoch": 1.1728955007256894, "grad_norm": 1.0703125, "learning_rate": 0.00048688669628322185, "loss": 5.0516, "mean_token_accuracy": 0.20033528953790664, "num_tokens": 26837065.0, "step": 12930 }, { "entropy": 5.415971422195435, "epoch": 1.1733490566037736, "grad_norm": 1.0234375, "learning_rate": 0.000486875809343457, "loss": 4.9935, "mean_token_accuracy": 0.19860540628433226, "num_tokens": 26847487.0, "step": 12935 }, { "entropy": 5.4496697902679445, "epoch": 1.1738026124818577, "grad_norm": 0.97265625, "learning_rate": 0.00048686491802204645, "loss": 5.0589, "mean_token_accuracy": 0.2041519746184349, "num_tokens": 26858407.0, "step": 12940 }, { "entropy": 5.50268669128418, "epoch": 1.174256168359942, "grad_norm": 1.0390625, "learning_rate": 0.0004868540223192154, "loss": 5.1209, "mean_token_accuracy": 0.19359382688999177, "num_tokens": 26868469.0, "step": 12945 }, { "entropy": 5.496904468536377, "epoch": 1.1747097242380262, "grad_norm": 0.921875, "learning_rate": 0.0004868431222351892, "loss": 5.1311, "mean_token_accuracy": 0.19695413410663604, "num_tokens": 26879580.0, "step": 12950 }, { "entropy": 5.48253755569458, "epoch": 1.1751632801161103, "grad_norm": 1.0078125, "learning_rate": 0.00048683221777019313, "loss": 5.0919, "mean_token_accuracy": 0.20048645436763762, "num_tokens": 26889513.0, "step": 12955 }, { "entropy": 5.4880575180053714, "epoch": 1.1756168359941945, "grad_norm": 0.9140625, "learning_rate": 0.00048682130892445293, "loss": 5.1826, "mean_token_accuracy": 0.1907653406262398, "num_tokens": 26900792.0, "step": 12960 }, { "entropy": 5.44629693031311, "epoch": 1.1760703918722786, "grad_norm": 1.03125, "learning_rate": 0.000486810395698194, "loss": 5.0568, "mean_token_accuracy": 0.20455744862556458, "num_tokens": 26911298.0, "step": 12965 }, { "entropy": 5.521710538864136, "epoch": 1.1765239477503628, "grad_norm": 1.0, "learning_rate": 0.00048679947809164223, "loss": 5.1252, "mean_token_accuracy": 0.19028752148151398, "num_tokens": 26921545.0, "step": 12970 }, { "entropy": 5.504205179214478, "epoch": 1.176977503628447, "grad_norm": 0.9296875, "learning_rate": 0.0004867885561050232, "loss": 5.0804, "mean_token_accuracy": 0.20825183987617493, "num_tokens": 26932140.0, "step": 12975 }, { "entropy": 5.494733381271362, "epoch": 1.1774310595065312, "grad_norm": 1.046875, "learning_rate": 0.0004867776297385629, "loss": 5.1252, "mean_token_accuracy": 0.1926521986722946, "num_tokens": 26942634.0, "step": 12980 }, { "entropy": 5.4838728427886965, "epoch": 1.1778846153846154, "grad_norm": 1.0546875, "learning_rate": 0.00048676669899248723, "loss": 5.0897, "mean_token_accuracy": 0.1977209985256195, "num_tokens": 26952758.0, "step": 12985 }, { "entropy": 5.42335000038147, "epoch": 1.1783381712626997, "grad_norm": 0.9375, "learning_rate": 0.0004867557638670222, "loss": 5.0317, "mean_token_accuracy": 0.20029369443655015, "num_tokens": 26963439.0, "step": 12990 }, { "entropy": 5.463872289657592, "epoch": 1.1787917271407837, "grad_norm": 1.0390625, "learning_rate": 0.0004867448243623941, "loss": 5.0948, "mean_token_accuracy": 0.19276442527770996, "num_tokens": 26974331.0, "step": 12995 }, { "entropy": 5.4251199722290036, "epoch": 1.179245283018868, "grad_norm": 1.078125, "learning_rate": 0.000486733880478829, "loss": 4.9758, "mean_token_accuracy": 0.20203347504138947, "num_tokens": 26983416.0, "step": 13000 }, { "entropy": 5.454279279708862, "epoch": 1.179698838896952, "grad_norm": 0.96484375, "learning_rate": 0.00048672293221655333, "loss": 5.0946, "mean_token_accuracy": 0.1995358645915985, "num_tokens": 26994176.0, "step": 13005 }, { "entropy": 5.443188714981079, "epoch": 1.1801523947750363, "grad_norm": 1.0546875, "learning_rate": 0.0004867119795757935, "loss": 5.093, "mean_token_accuracy": 0.19391274601221084, "num_tokens": 27003295.0, "step": 13010 }, { "entropy": 5.487621116638183, "epoch": 1.1806059506531206, "grad_norm": 0.94921875, "learning_rate": 0.000486701022556776, "loss": 5.0536, "mean_token_accuracy": 0.19664328843355178, "num_tokens": 27014018.0, "step": 13015 }, { "entropy": 5.482475519180298, "epoch": 1.1810595065312046, "grad_norm": 0.92578125, "learning_rate": 0.0004866900611597273, "loss": 5.0813, "mean_token_accuracy": 0.19794545322656631, "num_tokens": 27024706.0, "step": 13020 }, { "entropy": 5.491993808746338, "epoch": 1.1815130624092889, "grad_norm": 1.0625, "learning_rate": 0.00048667909538487427, "loss": 5.0877, "mean_token_accuracy": 0.20044560730457306, "num_tokens": 27035801.0, "step": 13025 }, { "entropy": 5.386587238311767, "epoch": 1.181966618287373, "grad_norm": 0.953125, "learning_rate": 0.0004866681252324436, "loss": 4.969, "mean_token_accuracy": 0.20623714625835418, "num_tokens": 27046596.0, "step": 13030 }, { "entropy": 5.445072841644287, "epoch": 1.1824201741654572, "grad_norm": 1.046875, "learning_rate": 0.00048665715070266214, "loss": 5.0696, "mean_token_accuracy": 0.1931762620806694, "num_tokens": 27057057.0, "step": 13035 }, { "entropy": 5.394736051559448, "epoch": 1.1828737300435415, "grad_norm": 1.03125, "learning_rate": 0.00048664617179575685, "loss": 5.0205, "mean_token_accuracy": 0.20542708784341812, "num_tokens": 27067947.0, "step": 13040 }, { "entropy": 5.499419689178467, "epoch": 1.1833272859216255, "grad_norm": 0.93359375, "learning_rate": 0.0004866351885119548, "loss": 5.0745, "mean_token_accuracy": 0.19452230632305145, "num_tokens": 27077503.0, "step": 13045 }, { "entropy": 5.47869291305542, "epoch": 1.1837808417997098, "grad_norm": 1.0, "learning_rate": 0.0004866242008514832, "loss": 5.1851, "mean_token_accuracy": 0.1935773551464081, "num_tokens": 27088298.0, "step": 13050 }, { "entropy": 5.44662823677063, "epoch": 1.1842343976777938, "grad_norm": 1.0703125, "learning_rate": 0.00048661320881456904, "loss": 5.0567, "mean_token_accuracy": 0.19659170955419542, "num_tokens": 27097841.0, "step": 13055 }, { "entropy": 5.3786825180053714, "epoch": 1.184687953555878, "grad_norm": 1.0625, "learning_rate": 0.0004866022124014399, "loss": 5.0059, "mean_token_accuracy": 0.2037520781159401, "num_tokens": 27108263.0, "step": 13060 }, { "entropy": 5.43059778213501, "epoch": 1.1851415094339623, "grad_norm": 0.953125, "learning_rate": 0.00048659121161232313, "loss": 5.0636, "mean_token_accuracy": 0.1974889948964119, "num_tokens": 27119339.0, "step": 13065 }, { "entropy": 5.508020401000977, "epoch": 1.1855950653120464, "grad_norm": 0.921875, "learning_rate": 0.0004865802064474461, "loss": 5.1138, "mean_token_accuracy": 0.19474893063306808, "num_tokens": 27130393.0, "step": 13070 }, { "entropy": 5.490651798248291, "epoch": 1.1860486211901307, "grad_norm": 0.94921875, "learning_rate": 0.00048656919690703653, "loss": 5.108, "mean_token_accuracy": 0.18990262150764464, "num_tokens": 27141156.0, "step": 13075 }, { "entropy": 5.511962604522705, "epoch": 1.1865021770682147, "grad_norm": 1.0, "learning_rate": 0.000486558182991322, "loss": 5.1341, "mean_token_accuracy": 0.19704943150281906, "num_tokens": 27151630.0, "step": 13080 }, { "entropy": 5.4343561172485355, "epoch": 1.186955732946299, "grad_norm": 0.96484375, "learning_rate": 0.0004865471647005304, "loss": 5.0101, "mean_token_accuracy": 0.19913599342107774, "num_tokens": 27160734.0, "step": 13085 }, { "entropy": 5.443252897262573, "epoch": 1.1874092888243832, "grad_norm": 0.99609375, "learning_rate": 0.00048653614203488947, "loss": 5.1014, "mean_token_accuracy": 0.19857311248779297, "num_tokens": 27171584.0, "step": 13090 }, { "entropy": 5.445315742492676, "epoch": 1.1878628447024673, "grad_norm": 1.109375, "learning_rate": 0.0004865251149946273, "loss": 5.0209, "mean_token_accuracy": 0.20458347499370574, "num_tokens": 27180817.0, "step": 13095 }, { "entropy": 5.498758268356323, "epoch": 1.1883164005805515, "grad_norm": 1.0625, "learning_rate": 0.00048651408357997173, "loss": 5.0997, "mean_token_accuracy": 0.19201551973819733, "num_tokens": 27190363.0, "step": 13100 }, { "entropy": 5.456967306137085, "epoch": 1.1887699564586356, "grad_norm": 0.9609375, "learning_rate": 0.00048650304779115114, "loss": 5.0168, "mean_token_accuracy": 0.20326564013957976, "num_tokens": 27202181.0, "step": 13105 }, { "entropy": 5.41337947845459, "epoch": 1.1892235123367199, "grad_norm": 0.9453125, "learning_rate": 0.0004864920076283935, "loss": 5.0946, "mean_token_accuracy": 0.19548821747303008, "num_tokens": 27212514.0, "step": 13110 }, { "entropy": 5.52031717300415, "epoch": 1.1896770682148041, "grad_norm": 1.0078125, "learning_rate": 0.0004864809630919273, "loss": 5.0607, "mean_token_accuracy": 0.20517010539770125, "num_tokens": 27223352.0, "step": 13115 }, { "entropy": 5.459183692932129, "epoch": 1.1901306240928882, "grad_norm": 1.0703125, "learning_rate": 0.0004864699141819809, "loss": 5.0186, "mean_token_accuracy": 0.20343892574310302, "num_tokens": 27232643.0, "step": 13120 }, { "entropy": 5.368879985809326, "epoch": 1.1905841799709724, "grad_norm": 0.99609375, "learning_rate": 0.00048645886089878276, "loss": 5.0647, "mean_token_accuracy": 0.19952337443828583, "num_tokens": 27243793.0, "step": 13125 }, { "entropy": 5.4699231624603275, "epoch": 1.1910377358490567, "grad_norm": 1.0, "learning_rate": 0.00048644780324256153, "loss": 5.0822, "mean_token_accuracy": 0.19614837914705277, "num_tokens": 27254554.0, "step": 13130 }, { "entropy": 5.496552801132202, "epoch": 1.1914912917271407, "grad_norm": 0.953125, "learning_rate": 0.0004864367412135458, "loss": 5.1303, "mean_token_accuracy": 0.19582335501909257, "num_tokens": 27265842.0, "step": 13135 }, { "entropy": 5.496447563171387, "epoch": 1.191944847605225, "grad_norm": 0.9609375, "learning_rate": 0.00048642567481196446, "loss": 5.1131, "mean_token_accuracy": 0.19201270192861558, "num_tokens": 27277617.0, "step": 13140 }, { "entropy": 5.461776828765869, "epoch": 1.192398403483309, "grad_norm": 1.046875, "learning_rate": 0.0004864146040380462, "loss": 5.0622, "mean_token_accuracy": 0.1964070349931717, "num_tokens": 27287450.0, "step": 13145 }, { "entropy": 5.460700607299804, "epoch": 1.1928519593613933, "grad_norm": 1.03125, "learning_rate": 0.0004864035288920202, "loss": 5.0682, "mean_token_accuracy": 0.20016777515411377, "num_tokens": 27297010.0, "step": 13150 }, { "entropy": 5.455751180648804, "epoch": 1.1933055152394776, "grad_norm": 1.078125, "learning_rate": 0.00048639244937411516, "loss": 5.1094, "mean_token_accuracy": 0.19363460689783096, "num_tokens": 27306874.0, "step": 13155 }, { "entropy": 5.536878776550293, "epoch": 1.1937590711175616, "grad_norm": 0.95703125, "learning_rate": 0.00048638136548456045, "loss": 5.1071, "mean_token_accuracy": 0.1993100017309189, "num_tokens": 27318762.0, "step": 13160 }, { "entropy": 5.464996767044068, "epoch": 1.194212626995646, "grad_norm": 1.0625, "learning_rate": 0.00048637027722358536, "loss": 4.9826, "mean_token_accuracy": 0.20638133138418197, "num_tokens": 27327231.0, "step": 13165 }, { "entropy": 5.395813655853272, "epoch": 1.1946661828737302, "grad_norm": 0.9296875, "learning_rate": 0.00048635918459141893, "loss": 5.0149, "mean_token_accuracy": 0.19718607515096664, "num_tokens": 27338517.0, "step": 13170 }, { "entropy": 5.485543155670166, "epoch": 1.1951197387518142, "grad_norm": 0.97265625, "learning_rate": 0.00048634808758829073, "loss": 5.0998, "mean_token_accuracy": 0.19311325401067733, "num_tokens": 27348861.0, "step": 13175 }, { "entropy": 5.473777770996094, "epoch": 1.1955732946298985, "grad_norm": 0.96875, "learning_rate": 0.00048633698621443024, "loss": 5.0493, "mean_token_accuracy": 0.20883545130491257, "num_tokens": 27358610.0, "step": 13180 }, { "entropy": 5.458179235458374, "epoch": 1.1960268505079825, "grad_norm": 0.9609375, "learning_rate": 0.000486325880470067, "loss": 5.1405, "mean_token_accuracy": 0.19589586257934571, "num_tokens": 27369707.0, "step": 13185 }, { "entropy": 5.470612907409668, "epoch": 1.1964804063860668, "grad_norm": 0.953125, "learning_rate": 0.0004863147703554307, "loss": 5.0763, "mean_token_accuracy": 0.19433997869491576, "num_tokens": 27381030.0, "step": 13190 }, { "entropy": 5.499072742462158, "epoch": 1.196933962264151, "grad_norm": 1.015625, "learning_rate": 0.00048630365587075115, "loss": 5.1137, "mean_token_accuracy": 0.19215388000011444, "num_tokens": 27390866.0, "step": 13195 }, { "entropy": 5.472330141067505, "epoch": 1.197387518142235, "grad_norm": 0.98046875, "learning_rate": 0.00048629253701625816, "loss": 5.0335, "mean_token_accuracy": 0.20051812678575515, "num_tokens": 27400724.0, "step": 13200 }, { "entropy": 5.4769697189331055, "epoch": 1.1978410740203194, "grad_norm": 1.03125, "learning_rate": 0.0004862814137921816, "loss": 5.0573, "mean_token_accuracy": 0.19676778018474578, "num_tokens": 27411212.0, "step": 13205 }, { "entropy": 5.438337230682373, "epoch": 1.1982946298984034, "grad_norm": 1.0078125, "learning_rate": 0.00048627028619875157, "loss": 5.0807, "mean_token_accuracy": 0.19674912691116334, "num_tokens": 27421279.0, "step": 13210 }, { "entropy": 5.466053295135498, "epoch": 1.1987481857764877, "grad_norm": 0.95703125, "learning_rate": 0.0004862591542361982, "loss": 5.0637, "mean_token_accuracy": 0.19462242722511292, "num_tokens": 27432520.0, "step": 13215 }, { "entropy": 5.410159397125244, "epoch": 1.199201741654572, "grad_norm": 1.015625, "learning_rate": 0.0004862480179047516, "loss": 5.0096, "mean_token_accuracy": 0.20343201607465744, "num_tokens": 27442246.0, "step": 13220 }, { "entropy": 5.463499593734741, "epoch": 1.199655297532656, "grad_norm": 1.0703125, "learning_rate": 0.0004862368772046423, "loss": 5.0684, "mean_token_accuracy": 0.195850670337677, "num_tokens": 27452134.0, "step": 13225 }, { "entropy": 5.512796545028687, "epoch": 1.2001088534107403, "grad_norm": 0.98046875, "learning_rate": 0.00048622573213610057, "loss": 5.1497, "mean_token_accuracy": 0.1871631845831871, "num_tokens": 27462253.0, "step": 13230 }, { "entropy": 5.477445459365844, "epoch": 1.2005624092888243, "grad_norm": 1.0859375, "learning_rate": 0.00048621458269935676, "loss": 5.047, "mean_token_accuracy": 0.1999499797821045, "num_tokens": 27473131.0, "step": 13235 }, { "entropy": 5.465921449661255, "epoch": 1.2010159651669086, "grad_norm": 0.9609375, "learning_rate": 0.00048620342889464153, "loss": 5.0659, "mean_token_accuracy": 0.20435721725225447, "num_tokens": 27483683.0, "step": 13240 }, { "entropy": 5.383798551559448, "epoch": 1.2014695210449928, "grad_norm": 0.96484375, "learning_rate": 0.00048619227072218565, "loss": 5.055, "mean_token_accuracy": 0.19200326055288314, "num_tokens": 27493679.0, "step": 13245 }, { "entropy": 5.422492218017578, "epoch": 1.2019230769230769, "grad_norm": 1.0390625, "learning_rate": 0.0004861811081822198, "loss": 5.0529, "mean_token_accuracy": 0.20524911731481552, "num_tokens": 27503897.0, "step": 13250 }, { "entropy": 5.520388746261597, "epoch": 1.2023766328011611, "grad_norm": 1.0234375, "learning_rate": 0.0004861699412749748, "loss": 5.1464, "mean_token_accuracy": 0.19123760461807252, "num_tokens": 27514560.0, "step": 13255 }, { "entropy": 5.461540365219117, "epoch": 1.2028301886792452, "grad_norm": 0.95703125, "learning_rate": 0.0004861587700006816, "loss": 5.0457, "mean_token_accuracy": 0.1977246880531311, "num_tokens": 27525594.0, "step": 13260 }, { "entropy": 5.387940454483032, "epoch": 1.2032837445573294, "grad_norm": 0.94921875, "learning_rate": 0.00048614759435957114, "loss": 4.991, "mean_token_accuracy": 0.2023061916232109, "num_tokens": 27535676.0, "step": 13265 }, { "entropy": 5.392179822921753, "epoch": 1.2037373004354137, "grad_norm": 0.9921875, "learning_rate": 0.0004861364143518747, "loss": 5.0217, "mean_token_accuracy": 0.19669488519430162, "num_tokens": 27545520.0, "step": 13270 }, { "entropy": 5.527988004684448, "epoch": 1.2041908563134978, "grad_norm": 0.93359375, "learning_rate": 0.0004861252299778234, "loss": 5.1158, "mean_token_accuracy": 0.19062118828296662, "num_tokens": 27556866.0, "step": 13275 }, { "entropy": 5.429691362380981, "epoch": 1.204644412191582, "grad_norm": 0.93359375, "learning_rate": 0.00048611404123764855, "loss": 5.0426, "mean_token_accuracy": 0.20097893178462983, "num_tokens": 27566951.0, "step": 13280 }, { "entropy": 5.440868282318116, "epoch": 1.205097968069666, "grad_norm": 1.046875, "learning_rate": 0.00048610284813158154, "loss": 5.1474, "mean_token_accuracy": 0.1993878111243248, "num_tokens": 27576796.0, "step": 13285 }, { "entropy": 5.375292730331421, "epoch": 1.2055515239477503, "grad_norm": 1.03125, "learning_rate": 0.0004860916506598538, "loss": 5.0122, "mean_token_accuracy": 0.1960039883852005, "num_tokens": 27586902.0, "step": 13290 }, { "entropy": 5.583034420013428, "epoch": 1.2060050798258346, "grad_norm": 0.97265625, "learning_rate": 0.00048608044882269695, "loss": 5.1944, "mean_token_accuracy": 0.19058731198310852, "num_tokens": 27599232.0, "step": 13295 }, { "entropy": 5.469849109649658, "epoch": 1.2064586357039186, "grad_norm": 0.98046875, "learning_rate": 0.0004860692426203427, "loss": 4.9867, "mean_token_accuracy": 0.1980736255645752, "num_tokens": 27609022.0, "step": 13300 }, { "entropy": 5.465440654754639, "epoch": 1.206912191582003, "grad_norm": 0.9921875, "learning_rate": 0.0004860580320530226, "loss": 5.1503, "mean_token_accuracy": 0.19946297705173494, "num_tokens": 27619829.0, "step": 13305 }, { "entropy": 5.488517141342163, "epoch": 1.2073657474600872, "grad_norm": 1.0546875, "learning_rate": 0.0004860468171209687, "loss": 5.1323, "mean_token_accuracy": 0.1990528702735901, "num_tokens": 27629337.0, "step": 13310 }, { "entropy": 5.55136661529541, "epoch": 1.2078193033381712, "grad_norm": 1.0078125, "learning_rate": 0.0004860355978244128, "loss": 5.1626, "mean_token_accuracy": 0.19753118902444838, "num_tokens": 27639377.0, "step": 13315 }, { "entropy": 5.485705947875976, "epoch": 1.2082728592162555, "grad_norm": 0.96484375, "learning_rate": 0.000486024374163587, "loss": 5.0487, "mean_token_accuracy": 0.19785596281290055, "num_tokens": 27649989.0, "step": 13320 }, { "entropy": 5.465881109237671, "epoch": 1.2087264150943395, "grad_norm": 1.0, "learning_rate": 0.00048601314613872334, "loss": 5.1105, "mean_token_accuracy": 0.1890886515378952, "num_tokens": 27659967.0, "step": 13325 }, { "entropy": 5.469597816467285, "epoch": 1.2091799709724238, "grad_norm": 1.0625, "learning_rate": 0.000486001913750054, "loss": 5.0743, "mean_token_accuracy": 0.19993726462125777, "num_tokens": 27670099.0, "step": 13330 }, { "entropy": 5.449666976928711, "epoch": 1.209633526850508, "grad_norm": 0.9921875, "learning_rate": 0.0004859906769978113, "loss": 5.1182, "mean_token_accuracy": 0.1906730830669403, "num_tokens": 27681497.0, "step": 13335 }, { "entropy": 5.556787586212158, "epoch": 1.2100870827285921, "grad_norm": 0.95703125, "learning_rate": 0.00048597943588222776, "loss": 5.2207, "mean_token_accuracy": 0.19126688838005065, "num_tokens": 27691828.0, "step": 13340 }, { "entropy": 5.517446708679199, "epoch": 1.2105406386066764, "grad_norm": 1.0546875, "learning_rate": 0.00048596819040353564, "loss": 5.0303, "mean_token_accuracy": 0.20397276282310486, "num_tokens": 27701426.0, "step": 13345 }, { "entropy": 5.471580123901367, "epoch": 1.2109941944847606, "grad_norm": 1.0078125, "learning_rate": 0.0004859569405619676, "loss": 5.02, "mean_token_accuracy": 0.2044997438788414, "num_tokens": 27711112.0, "step": 13350 }, { "entropy": 5.45523157119751, "epoch": 1.2114477503628447, "grad_norm": 0.95703125, "learning_rate": 0.0004859456863577562, "loss": 5.1359, "mean_token_accuracy": 0.194906784594059, "num_tokens": 27723160.0, "step": 13355 }, { "entropy": 5.506615352630615, "epoch": 1.211901306240929, "grad_norm": 1.1171875, "learning_rate": 0.00048593442779113437, "loss": 5.1053, "mean_token_accuracy": 0.19654038101434707, "num_tokens": 27733143.0, "step": 13360 }, { "entropy": 5.465633964538574, "epoch": 1.212354862119013, "grad_norm": 0.94140625, "learning_rate": 0.0004859231648623348, "loss": 5.0949, "mean_token_accuracy": 0.19797311574220658, "num_tokens": 27743956.0, "step": 13365 }, { "entropy": 5.477122449874878, "epoch": 1.2128084179970973, "grad_norm": 0.95703125, "learning_rate": 0.00048591189757159035, "loss": 5.0989, "mean_token_accuracy": 0.20149367451667785, "num_tokens": 27754192.0, "step": 13370 }, { "entropy": 5.450489521026611, "epoch": 1.2132619738751815, "grad_norm": 0.9765625, "learning_rate": 0.0004859006259191342, "loss": 5.1346, "mean_token_accuracy": 0.1882784515619278, "num_tokens": 27763939.0, "step": 13375 }, { "entropy": 5.462380647659302, "epoch": 1.2137155297532656, "grad_norm": 1.078125, "learning_rate": 0.0004858893499051993, "loss": 5.0858, "mean_token_accuracy": 0.20263192504644395, "num_tokens": 27774743.0, "step": 13380 }, { "entropy": 5.48222074508667, "epoch": 1.2141690856313498, "grad_norm": 1.09375, "learning_rate": 0.0004858780695300189, "loss": 5.0647, "mean_token_accuracy": 0.1981904089450836, "num_tokens": 27785344.0, "step": 13385 }, { "entropy": 5.501078081130982, "epoch": 1.2146226415094339, "grad_norm": 0.9140625, "learning_rate": 0.0004858667847938263, "loss": 5.1402, "mean_token_accuracy": 0.19375266283750534, "num_tokens": 27797101.0, "step": 13390 }, { "entropy": 5.436707925796509, "epoch": 1.2150761973875182, "grad_norm": 1.015625, "learning_rate": 0.00048585549569685486, "loss": 5.0428, "mean_token_accuracy": 0.20690445750951766, "num_tokens": 27807581.0, "step": 13395 }, { "entropy": 5.416332244873047, "epoch": 1.2155297532656024, "grad_norm": 0.98046875, "learning_rate": 0.00048584420223933805, "loss": 5.0154, "mean_token_accuracy": 0.19844310879707336, "num_tokens": 27818170.0, "step": 13400 }, { "entropy": 5.414180326461792, "epoch": 1.2159833091436865, "grad_norm": 0.97265625, "learning_rate": 0.0004858329044215094, "loss": 5.0384, "mean_token_accuracy": 0.19891184717416763, "num_tokens": 27828153.0, "step": 13405 }, { "entropy": 5.476301193237305, "epoch": 1.2164368650217707, "grad_norm": 0.99609375, "learning_rate": 0.00048582160224360253, "loss": 4.9767, "mean_token_accuracy": 0.20489715337753295, "num_tokens": 27837681.0, "step": 13410 }, { "entropy": 5.449605989456177, "epoch": 1.2168904208998548, "grad_norm": 1.015625, "learning_rate": 0.0004858102957058513, "loss": 5.1101, "mean_token_accuracy": 0.1980344220995903, "num_tokens": 27847447.0, "step": 13415 }, { "entropy": 5.381835842132569, "epoch": 1.217343976777939, "grad_norm": 0.99609375, "learning_rate": 0.00048579898480848933, "loss": 4.9634, "mean_token_accuracy": 0.20579961985349654, "num_tokens": 27858586.0, "step": 13420 }, { "entropy": 5.446962022781372, "epoch": 1.2177975326560233, "grad_norm": 1.03125, "learning_rate": 0.0004857876695517507, "loss": 5.102, "mean_token_accuracy": 0.19679246246814727, "num_tokens": 27868832.0, "step": 13425 }, { "entropy": 5.4643807888031, "epoch": 1.2182510885341074, "grad_norm": 0.984375, "learning_rate": 0.00048577634993586923, "loss": 5.0896, "mean_token_accuracy": 0.19575538486242294, "num_tokens": 27879339.0, "step": 13430 }, { "entropy": 5.522566127777099, "epoch": 1.2187046444121916, "grad_norm": 0.9921875, "learning_rate": 0.00048576502596107924, "loss": 5.094, "mean_token_accuracy": 0.19788532853126525, "num_tokens": 27889964.0, "step": 13435 }, { "entropy": 5.506246519088745, "epoch": 1.2191582002902757, "grad_norm": 0.98046875, "learning_rate": 0.0004857536976276148, "loss": 5.1457, "mean_token_accuracy": 0.1924672469496727, "num_tokens": 27901004.0, "step": 13440 }, { "entropy": 5.431326627731323, "epoch": 1.21961175616836, "grad_norm": 1.015625, "learning_rate": 0.0004857423649357102, "loss": 5.0627, "mean_token_accuracy": 0.19715383052825927, "num_tokens": 27910788.0, "step": 13445 }, { "entropy": 5.488765573501587, "epoch": 1.2200653120464442, "grad_norm": 0.96484375, "learning_rate": 0.00048573102788559974, "loss": 5.0954, "mean_token_accuracy": 0.19984215795993804, "num_tokens": 27921360.0, "step": 13450 }, { "entropy": 5.448400926589966, "epoch": 1.2205188679245282, "grad_norm": 0.99609375, "learning_rate": 0.0004857196864775179, "loss": 5.0587, "mean_token_accuracy": 0.20081372559070587, "num_tokens": 27931889.0, "step": 13455 }, { "entropy": 5.435266065597534, "epoch": 1.2209724238026125, "grad_norm": 1.0234375, "learning_rate": 0.00048570834071169926, "loss": 5.0417, "mean_token_accuracy": 0.20292796045541764, "num_tokens": 27942049.0, "step": 13460 }, { "entropy": 5.521530485153198, "epoch": 1.2214259796806965, "grad_norm": 0.99609375, "learning_rate": 0.00048569699058837856, "loss": 5.1713, "mean_token_accuracy": 0.19670335203409195, "num_tokens": 27952416.0, "step": 13465 }, { "entropy": 5.450357818603516, "epoch": 1.2218795355587808, "grad_norm": 1.0390625, "learning_rate": 0.0004856856361077903, "loss": 5.0435, "mean_token_accuracy": 0.20239394903182983, "num_tokens": 27962009.0, "step": 13470 }, { "entropy": 5.495120096206665, "epoch": 1.222333091436865, "grad_norm": 1.0078125, "learning_rate": 0.0004856742772701694, "loss": 5.0895, "mean_token_accuracy": 0.19622547924518585, "num_tokens": 27972175.0, "step": 13475 }, { "entropy": 5.491621303558349, "epoch": 1.2227866473149491, "grad_norm": 0.890625, "learning_rate": 0.00048566291407575073, "loss": 5.1242, "mean_token_accuracy": 0.19951627105474473, "num_tokens": 27982899.0, "step": 13480 }, { "entropy": 5.510865592956543, "epoch": 1.2232402031930334, "grad_norm": 0.96875, "learning_rate": 0.00048565154652476937, "loss": 5.0314, "mean_token_accuracy": 0.1987655982375145, "num_tokens": 27993231.0, "step": 13485 }, { "entropy": 5.397731161117553, "epoch": 1.2236937590711174, "grad_norm": 0.921875, "learning_rate": 0.0004856401746174603, "loss": 5.0049, "mean_token_accuracy": 0.20129185318946838, "num_tokens": 28003623.0, "step": 13490 }, { "entropy": 5.455231428146362, "epoch": 1.2241473149492017, "grad_norm": 1.078125, "learning_rate": 0.00048562879835405874, "loss": 5.0118, "mean_token_accuracy": 0.19701914489269257, "num_tokens": 28013878.0, "step": 13495 }, { "entropy": 5.433118629455566, "epoch": 1.224600870827286, "grad_norm": 0.953125, "learning_rate": 0.0004856174177348, "loss": 5.1104, "mean_token_accuracy": 0.19880663901567458, "num_tokens": 28024224.0, "step": 13500 }, { "entropy": 5.461540269851684, "epoch": 1.22505442670537, "grad_norm": 0.9296875, "learning_rate": 0.0004856060327599194, "loss": 5.0032, "mean_token_accuracy": 0.19849352687597274, "num_tokens": 28034819.0, "step": 13505 }, { "entropy": 5.429188776016235, "epoch": 1.2255079825834543, "grad_norm": 1.0, "learning_rate": 0.00048559464342965233, "loss": 5.0944, "mean_token_accuracy": 0.19491631388664246, "num_tokens": 28044240.0, "step": 13510 }, { "entropy": 5.544237375259399, "epoch": 1.2259615384615385, "grad_norm": 1.0, "learning_rate": 0.0004855832497442344, "loss": 5.2122, "mean_token_accuracy": 0.189100544154644, "num_tokens": 28055046.0, "step": 13515 }, { "entropy": 5.425240516662598, "epoch": 1.2264150943396226, "grad_norm": 0.9765625, "learning_rate": 0.0004855718517039012, "loss": 5.0203, "mean_token_accuracy": 0.20204996764659883, "num_tokens": 28065272.0, "step": 13520 }, { "entropy": 5.490952062606811, "epoch": 1.2268686502177069, "grad_norm": 0.96484375, "learning_rate": 0.00048556044930888844, "loss": 5.0057, "mean_token_accuracy": 0.20701412707567216, "num_tokens": 28076255.0, "step": 13525 }, { "entropy": 5.460171794891357, "epoch": 1.2273222060957911, "grad_norm": 1.0078125, "learning_rate": 0.0004855490425594319, "loss": 5.1362, "mean_token_accuracy": 0.1976022332906723, "num_tokens": 28086258.0, "step": 13530 }, { "entropy": 5.450643873214721, "epoch": 1.2277757619738752, "grad_norm": 0.98828125, "learning_rate": 0.0004855376314557675, "loss": 5.0531, "mean_token_accuracy": 0.20115755647420883, "num_tokens": 28096497.0, "step": 13535 }, { "entropy": 5.500379276275635, "epoch": 1.2282293178519594, "grad_norm": 1.0234375, "learning_rate": 0.0004855262159981313, "loss": 5.0554, "mean_token_accuracy": 0.20335399657487868, "num_tokens": 28106282.0, "step": 13540 }, { "entropy": 5.439828586578369, "epoch": 1.2286828737300435, "grad_norm": 1.0546875, "learning_rate": 0.00048551479618675925, "loss": 5.1141, "mean_token_accuracy": 0.19755692631006241, "num_tokens": 28115771.0, "step": 13545 }, { "entropy": 5.497058439254761, "epoch": 1.2291364296081277, "grad_norm": 1.0859375, "learning_rate": 0.00048550337202188756, "loss": 5.0382, "mean_token_accuracy": 0.20264212042093277, "num_tokens": 28125477.0, "step": 13550 }, { "entropy": 5.520259809494019, "epoch": 1.229589985486212, "grad_norm": 0.9765625, "learning_rate": 0.0004854919435037525, "loss": 5.0868, "mean_token_accuracy": 0.19803554713726043, "num_tokens": 28135800.0, "step": 13555 }, { "entropy": 5.379249429702758, "epoch": 1.230043541364296, "grad_norm": 1.0, "learning_rate": 0.0004854805106325904, "loss": 4.9601, "mean_token_accuracy": 0.1981172114610672, "num_tokens": 28146779.0, "step": 13560 }, { "entropy": 5.455027389526367, "epoch": 1.2304970972423803, "grad_norm": 1.0390625, "learning_rate": 0.0004854690734086378, "loss": 5.1082, "mean_token_accuracy": 0.1966257244348526, "num_tokens": 28156819.0, "step": 13565 }, { "entropy": 5.474935817718506, "epoch": 1.2309506531204644, "grad_norm": 1.109375, "learning_rate": 0.0004854576318321311, "loss": 5.0927, "mean_token_accuracy": 0.20191271901130675, "num_tokens": 28168553.0, "step": 13570 }, { "entropy": 5.49287052154541, "epoch": 1.2314042089985486, "grad_norm": 1.015625, "learning_rate": 0.00048544618590330685, "loss": 5.0638, "mean_token_accuracy": 0.1998132899403572, "num_tokens": 28178064.0, "step": 13575 }, { "entropy": 5.531149291992188, "epoch": 1.231857764876633, "grad_norm": 1.046875, "learning_rate": 0.00048543473562240194, "loss": 5.1918, "mean_token_accuracy": 0.20091952234506608, "num_tokens": 28188580.0, "step": 13580 }, { "entropy": 5.513899660110473, "epoch": 1.232311320754717, "grad_norm": 0.97265625, "learning_rate": 0.000485423280989653, "loss": 5.1592, "mean_token_accuracy": 0.19042342901229858, "num_tokens": 28199955.0, "step": 13585 }, { "entropy": 5.512563610076905, "epoch": 1.2327648766328012, "grad_norm": 0.95703125, "learning_rate": 0.000485411822005297, "loss": 5.1129, "mean_token_accuracy": 0.1964597672224045, "num_tokens": 28210506.0, "step": 13590 }, { "entropy": 5.463253450393677, "epoch": 1.2332184325108853, "grad_norm": 1.0546875, "learning_rate": 0.00048540035866957097, "loss": 5.0449, "mean_token_accuracy": 0.2079138681292534, "num_tokens": 28220486.0, "step": 13595 }, { "entropy": 5.510498094558716, "epoch": 1.2336719883889695, "grad_norm": 0.90625, "learning_rate": 0.0004853888909827118, "loss": 5.1748, "mean_token_accuracy": 0.18756349235773087, "num_tokens": 28232668.0, "step": 13600 }, { "entropy": 5.4791748046875, "epoch": 1.2341255442670538, "grad_norm": 1.015625, "learning_rate": 0.0004853774189449568, "loss": 5.1066, "mean_token_accuracy": 0.19442913085222244, "num_tokens": 28243733.0, "step": 13605 }, { "entropy": 5.5049889087677, "epoch": 1.2345791001451378, "grad_norm": 1.046875, "learning_rate": 0.00048536594255654315, "loss": 5.1473, "mean_token_accuracy": 0.1973620057106018, "num_tokens": 28254953.0, "step": 13610 }, { "entropy": 5.4978475093841555, "epoch": 1.235032656023222, "grad_norm": 1.015625, "learning_rate": 0.0004853544618177083, "loss": 5.0958, "mean_token_accuracy": 0.1997261881828308, "num_tokens": 28264959.0, "step": 13615 }, { "entropy": 5.510729646682739, "epoch": 1.2354862119013061, "grad_norm": 1.0703125, "learning_rate": 0.00048534297672868945, "loss": 5.0605, "mean_token_accuracy": 0.19888156205415725, "num_tokens": 28275509.0, "step": 13620 }, { "entropy": 5.475466060638428, "epoch": 1.2359397677793904, "grad_norm": 1.0, "learning_rate": 0.00048533148728972434, "loss": 5.0441, "mean_token_accuracy": 0.20334992408752442, "num_tokens": 28285983.0, "step": 13625 }, { "entropy": 5.499315881729126, "epoch": 1.2363933236574747, "grad_norm": 1.03125, "learning_rate": 0.00048531999350105037, "loss": 5.1161, "mean_token_accuracy": 0.19479625076055526, "num_tokens": 28296178.0, "step": 13630 }, { "entropy": 5.468041181564331, "epoch": 1.2368468795355587, "grad_norm": 1.0703125, "learning_rate": 0.00048530849536290537, "loss": 5.0874, "mean_token_accuracy": 0.18888186365365983, "num_tokens": 28305741.0, "step": 13635 }, { "entropy": 5.425489664077759, "epoch": 1.237300435413643, "grad_norm": 1.0078125, "learning_rate": 0.0004852969928755271, "loss": 5.0267, "mean_token_accuracy": 0.20155393332242966, "num_tokens": 28315607.0, "step": 13640 }, { "entropy": 5.400540924072265, "epoch": 1.237753991291727, "grad_norm": 0.9375, "learning_rate": 0.00048528548603915344, "loss": 5.0544, "mean_token_accuracy": 0.20124746710062028, "num_tokens": 28327349.0, "step": 13645 }, { "entropy": 5.484639644622803, "epoch": 1.2382075471698113, "grad_norm": 0.9140625, "learning_rate": 0.00048527397485402236, "loss": 5.0484, "mean_token_accuracy": 0.19532727748155593, "num_tokens": 28339949.0, "step": 13650 }, { "entropy": 5.502997541427613, "epoch": 1.2386611030478956, "grad_norm": 1.046875, "learning_rate": 0.00048526245932037186, "loss": 5.0787, "mean_token_accuracy": 0.20198170691728592, "num_tokens": 28351340.0, "step": 13655 }, { "entropy": 5.357645320892334, "epoch": 1.2391146589259796, "grad_norm": 1.0078125, "learning_rate": 0.00048525093943844013, "loss": 4.9507, "mean_token_accuracy": 0.2061908334493637, "num_tokens": 28360929.0, "step": 13660 }, { "entropy": 5.406160879135132, "epoch": 1.2395682148040639, "grad_norm": 1.03125, "learning_rate": 0.0004852394152084654, "loss": 5.045, "mean_token_accuracy": 0.19744858294725418, "num_tokens": 28370477.0, "step": 13665 }, { "entropy": 5.410417938232422, "epoch": 1.240021770682148, "grad_norm": 0.96484375, "learning_rate": 0.000485227886630686, "loss": 4.9677, "mean_token_accuracy": 0.2147770643234253, "num_tokens": 28380876.0, "step": 13670 }, { "entropy": 5.360565090179444, "epoch": 1.2404753265602322, "grad_norm": 1.015625, "learning_rate": 0.0004852163537053403, "loss": 4.9512, "mean_token_accuracy": 0.20302784889936448, "num_tokens": 28390685.0, "step": 13675 }, { "entropy": 5.4372467517852785, "epoch": 1.2409288824383164, "grad_norm": 0.984375, "learning_rate": 0.0004852048164326669, "loss": 5.0647, "mean_token_accuracy": 0.19382647573947906, "num_tokens": 28400236.0, "step": 13680 }, { "entropy": 5.514097785949707, "epoch": 1.2413824383164005, "grad_norm": 1.109375, "learning_rate": 0.0004851932748129043, "loss": 5.1066, "mean_token_accuracy": 0.20565356761217118, "num_tokens": 28410353.0, "step": 13685 }, { "entropy": 5.482953500747681, "epoch": 1.2418359941944848, "grad_norm": 0.953125, "learning_rate": 0.0004851817288462912, "loss": 5.023, "mean_token_accuracy": 0.1984424039721489, "num_tokens": 28420241.0, "step": 13690 }, { "entropy": 5.446218776702881, "epoch": 1.242289550072569, "grad_norm": 1.0625, "learning_rate": 0.0004851701785330663, "loss": 5.099, "mean_token_accuracy": 0.19731494635343552, "num_tokens": 28430610.0, "step": 13695 }, { "entropy": 5.443164396286011, "epoch": 1.242743105950653, "grad_norm": 0.9921875, "learning_rate": 0.0004851586238734687, "loss": 5.0296, "mean_token_accuracy": 0.20113435238599778, "num_tokens": 28440026.0, "step": 13700 }, { "entropy": 5.466651964187622, "epoch": 1.2431966618287373, "grad_norm": 0.94140625, "learning_rate": 0.0004851470648677371, "loss": 5.0943, "mean_token_accuracy": 0.18652191311120986, "num_tokens": 28450707.0, "step": 13705 }, { "entropy": 5.482295846939087, "epoch": 1.2436502177068216, "grad_norm": 0.953125, "learning_rate": 0.0004851355015161107, "loss": 5.0342, "mean_token_accuracy": 0.19864806681871414, "num_tokens": 28462378.0, "step": 13710 }, { "entropy": 5.530763387680054, "epoch": 1.2441037735849056, "grad_norm": 0.93359375, "learning_rate": 0.0004851239338188286, "loss": 5.1238, "mean_token_accuracy": 0.1938784420490265, "num_tokens": 28473084.0, "step": 13715 }, { "entropy": 5.45649676322937, "epoch": 1.24455732946299, "grad_norm": 1.0546875, "learning_rate": 0.00048511236177612994, "loss": 5.0648, "mean_token_accuracy": 0.19571323394775392, "num_tokens": 28482767.0, "step": 13720 }, { "entropy": 5.450520944595337, "epoch": 1.245010885341074, "grad_norm": 0.91796875, "learning_rate": 0.00048510078538825413, "loss": 5.0151, "mean_token_accuracy": 0.20403538793325424, "num_tokens": 28493274.0, "step": 13725 }, { "entropy": 5.501022720336914, "epoch": 1.2454644412191582, "grad_norm": 0.9921875, "learning_rate": 0.00048508920465544056, "loss": 5.0387, "mean_token_accuracy": 0.20316553562879563, "num_tokens": 28503823.0, "step": 13730 }, { "entropy": 5.4013471603393555, "epoch": 1.2459179970972425, "grad_norm": 0.94921875, "learning_rate": 0.0004850776195779286, "loss": 5.1028, "mean_token_accuracy": 0.20056904554367067, "num_tokens": 28514209.0, "step": 13735 }, { "entropy": 5.504916524887085, "epoch": 1.2463715529753265, "grad_norm": 0.984375, "learning_rate": 0.000485066030155958, "loss": 5.0889, "mean_token_accuracy": 0.19162350594997407, "num_tokens": 28524665.0, "step": 13740 }, { "entropy": 5.453751277923584, "epoch": 1.2468251088534108, "grad_norm": 1.0546875, "learning_rate": 0.0004850544363897684, "loss": 4.9957, "mean_token_accuracy": 0.20215146988630295, "num_tokens": 28533639.0, "step": 13745 }, { "entropy": 5.350737571716309, "epoch": 1.2472786647314948, "grad_norm": 0.96875, "learning_rate": 0.00048504283827959947, "loss": 5.0313, "mean_token_accuracy": 0.20369759500026702, "num_tokens": 28544469.0, "step": 13750 }, { "entropy": 5.499988698959351, "epoch": 1.2477322206095791, "grad_norm": 1.0390625, "learning_rate": 0.0004850312358256912, "loss": 5.0252, "mean_token_accuracy": 0.2021592527627945, "num_tokens": 28554637.0, "step": 13755 }, { "entropy": 5.422092723846435, "epoch": 1.2481857764876634, "grad_norm": 0.96484375, "learning_rate": 0.0004850196290282834, "loss": 5.0486, "mean_token_accuracy": 0.20041492730379104, "num_tokens": 28564752.0, "step": 13760 }, { "entropy": 5.465345001220703, "epoch": 1.2486393323657474, "grad_norm": 0.984375, "learning_rate": 0.00048500801788761613, "loss": 5.1718, "mean_token_accuracy": 0.1989479646086693, "num_tokens": 28575007.0, "step": 13765 }, { "entropy": 5.534001684188842, "epoch": 1.2490928882438317, "grad_norm": 1.1015625, "learning_rate": 0.0004849964024039296, "loss": 5.0591, "mean_token_accuracy": 0.19341023862361909, "num_tokens": 28584907.0, "step": 13770 }, { "entropy": 5.562993860244751, "epoch": 1.2495464441219157, "grad_norm": 0.9375, "learning_rate": 0.00048498478257746387, "loss": 5.1333, "mean_token_accuracy": 0.20470116883516312, "num_tokens": 28594244.0, "step": 13775 }, { "entropy": 5.505571889877319, "epoch": 1.25, "grad_norm": 0.9453125, "learning_rate": 0.00048497315840845934, "loss": 5.0859, "mean_token_accuracy": 0.20225802212953567, "num_tokens": 28603816.0, "step": 13780 }, { "entropy": 5.5165565490722654, "epoch": 1.2504535558780843, "grad_norm": 1.0703125, "learning_rate": 0.0004849615298971565, "loss": 5.1478, "mean_token_accuracy": 0.19335326850414275, "num_tokens": 28613067.0, "step": 13785 }, { "entropy": 5.4746994972229, "epoch": 1.2509071117561683, "grad_norm": 0.9921875, "learning_rate": 0.00048494989704379556, "loss": 5.0639, "mean_token_accuracy": 0.2013370230793953, "num_tokens": 28623752.0, "step": 13790 }, { "entropy": 5.424532461166382, "epoch": 1.2513606676342526, "grad_norm": 1.0859375, "learning_rate": 0.0004849382598486173, "loss": 5.036, "mean_token_accuracy": 0.20286421626806259, "num_tokens": 28633190.0, "step": 13795 }, { "entropy": 5.5794517993927, "epoch": 1.2518142235123366, "grad_norm": 0.94921875, "learning_rate": 0.00048492661831186243, "loss": 5.1173, "mean_token_accuracy": 0.1939726009964943, "num_tokens": 28644567.0, "step": 13800 }, { "entropy": 5.531249856948852, "epoch": 1.2522677793904209, "grad_norm": 0.9765625, "learning_rate": 0.0004849149724337715, "loss": 5.1219, "mean_token_accuracy": 0.19003446996212006, "num_tokens": 28654785.0, "step": 13805 }, { "entropy": 5.394008159637451, "epoch": 1.2527213352685052, "grad_norm": 1.0078125, "learning_rate": 0.00048490332221458543, "loss": 5.0068, "mean_token_accuracy": 0.19606393128633498, "num_tokens": 28665286.0, "step": 13810 }, { "entropy": 5.487374210357666, "epoch": 1.2531748911465892, "grad_norm": 0.98828125, "learning_rate": 0.0004848916676545452, "loss": 5.1148, "mean_token_accuracy": 0.19793294072151185, "num_tokens": 28675830.0, "step": 13815 }, { "entropy": 5.577816677093506, "epoch": 1.2536284470246735, "grad_norm": 1.109375, "learning_rate": 0.00048488000875389174, "loss": 5.1786, "mean_token_accuracy": 0.19012221544981003, "num_tokens": 28686640.0, "step": 13820 }, { "entropy": 5.465760231018066, "epoch": 1.2540820029027575, "grad_norm": 0.93359375, "learning_rate": 0.0004848683455128663, "loss": 5.056, "mean_token_accuracy": 0.19991220235824586, "num_tokens": 28697677.0, "step": 13825 }, { "entropy": 5.452733993530273, "epoch": 1.2545355587808418, "grad_norm": 0.984375, "learning_rate": 0.00048485667793170994, "loss": 5.0608, "mean_token_accuracy": 0.19883179068565368, "num_tokens": 28708831.0, "step": 13830 }, { "entropy": 5.497370481491089, "epoch": 1.254989114658926, "grad_norm": 0.9921875, "learning_rate": 0.000484845006010664, "loss": 5.1084, "mean_token_accuracy": 0.19644265174865722, "num_tokens": 28718959.0, "step": 13835 }, { "entropy": 5.454852151870727, "epoch": 1.25544267053701, "grad_norm": 0.984375, "learning_rate": 0.0004848333297499699, "loss": 5.0425, "mean_token_accuracy": 0.20070620626211166, "num_tokens": 28728719.0, "step": 13840 }, { "entropy": 5.512126350402832, "epoch": 1.2558962264150944, "grad_norm": 0.96875, "learning_rate": 0.00048482164914986903, "loss": 5.2075, "mean_token_accuracy": 0.1850140228867531, "num_tokens": 28740032.0, "step": 13845 }, { "entropy": 5.433183240890503, "epoch": 1.2563497822931784, "grad_norm": 1.0625, "learning_rate": 0.00048480996421060307, "loss": 5.0214, "mean_token_accuracy": 0.20678891539573668, "num_tokens": 28749374.0, "step": 13850 }, { "entropy": 5.4531410217285154, "epoch": 1.2568033381712627, "grad_norm": 0.953125, "learning_rate": 0.00048479827493241347, "loss": 5.0522, "mean_token_accuracy": 0.19824664890766144, "num_tokens": 28760038.0, "step": 13855 }, { "entropy": 5.492013168334961, "epoch": 1.257256894049347, "grad_norm": 0.98828125, "learning_rate": 0.00048478658131554216, "loss": 5.083, "mean_token_accuracy": 0.20080812126398087, "num_tokens": 28770247.0, "step": 13860 }, { "entropy": 5.422021341323853, "epoch": 1.2577104499274312, "grad_norm": 1.0390625, "learning_rate": 0.0004847748833602308, "loss": 5.0447, "mean_token_accuracy": 0.2001783072948456, "num_tokens": 28780251.0, "step": 13865 }, { "entropy": 5.410889577865601, "epoch": 1.2581640058055152, "grad_norm": 1.078125, "learning_rate": 0.0004847631810667215, "loss": 5.0378, "mean_token_accuracy": 0.20500718355178832, "num_tokens": 28790829.0, "step": 13870 }, { "entropy": 5.42143063545227, "epoch": 1.2586175616835993, "grad_norm": 1.0234375, "learning_rate": 0.0004847514744352561, "loss": 4.9858, "mean_token_accuracy": 0.20584760904312133, "num_tokens": 28801036.0, "step": 13875 }, { "entropy": 5.376169872283936, "epoch": 1.2590711175616836, "grad_norm": 1.0625, "learning_rate": 0.0004847397634660768, "loss": 5.0113, "mean_token_accuracy": 0.20472907721996308, "num_tokens": 28811013.0, "step": 13880 }, { "entropy": 5.407306241989136, "epoch": 1.2595246734397678, "grad_norm": 1.0078125, "learning_rate": 0.00048472804815942575, "loss": 5.026, "mean_token_accuracy": 0.1978759750723839, "num_tokens": 28821367.0, "step": 13885 }, { "entropy": 5.475953722000122, "epoch": 1.259978229317852, "grad_norm": 1.0234375, "learning_rate": 0.00048471632851554517, "loss": 5.0641, "mean_token_accuracy": 0.20478258281946182, "num_tokens": 28831077.0, "step": 13890 }, { "entropy": 5.479902696609497, "epoch": 1.2604317851959361, "grad_norm": 1.046875, "learning_rate": 0.0004847046045346775, "loss": 5.0887, "mean_token_accuracy": 0.19575609862804413, "num_tokens": 28841490.0, "step": 13895 }, { "entropy": 5.496106100082398, "epoch": 1.2608853410740204, "grad_norm": 0.984375, "learning_rate": 0.00048469287621706516, "loss": 5.0975, "mean_token_accuracy": 0.19364373236894608, "num_tokens": 28852510.0, "step": 13900 }, { "entropy": 5.453580331802368, "epoch": 1.2613388969521044, "grad_norm": 1.03125, "learning_rate": 0.0004846811435629507, "loss": 5.0643, "mean_token_accuracy": 0.20205463320016862, "num_tokens": 28863388.0, "step": 13905 }, { "entropy": 5.371431636810303, "epoch": 1.2617924528301887, "grad_norm": 1.078125, "learning_rate": 0.0004846694065725768, "loss": 5.0237, "mean_token_accuracy": 0.1987258344888687, "num_tokens": 28873798.0, "step": 13910 }, { "entropy": 5.477045679092408, "epoch": 1.262246008708273, "grad_norm": 1.0625, "learning_rate": 0.0004846576652461861, "loss": 5.0344, "mean_token_accuracy": 0.19760629385709763, "num_tokens": 28883482.0, "step": 13915 }, { "entropy": 5.460442686080933, "epoch": 1.262699564586357, "grad_norm": 1.0, "learning_rate": 0.00048464591958402147, "loss": 5.002, "mean_token_accuracy": 0.2040782615542412, "num_tokens": 28893573.0, "step": 13920 }, { "entropy": 5.488413143157959, "epoch": 1.2631531204644413, "grad_norm": 1.0234375, "learning_rate": 0.00048463416958632573, "loss": 5.1558, "mean_token_accuracy": 0.19369145929813386, "num_tokens": 28904064.0, "step": 13925 }, { "entropy": 5.496292495727539, "epoch": 1.2636066763425253, "grad_norm": 0.953125, "learning_rate": 0.00048462241525334206, "loss": 5.0952, "mean_token_accuracy": 0.19503602236509324, "num_tokens": 28915329.0, "step": 13930 }, { "entropy": 5.488839101791382, "epoch": 1.2640602322206096, "grad_norm": 1.015625, "learning_rate": 0.0004846106565853133, "loss": 5.1786, "mean_token_accuracy": 0.1940974101424217, "num_tokens": 28925228.0, "step": 13935 }, { "entropy": 5.454708576202393, "epoch": 1.2645137880986939, "grad_norm": 1.0546875, "learning_rate": 0.00048459889358248284, "loss": 5.0234, "mean_token_accuracy": 0.1984314426779747, "num_tokens": 28935891.0, "step": 13940 }, { "entropy": 5.43781156539917, "epoch": 1.264967343976778, "grad_norm": 0.9921875, "learning_rate": 0.00048458712624509383, "loss": 4.9921, "mean_token_accuracy": 0.20576515346765517, "num_tokens": 28946372.0, "step": 13945 }, { "entropy": 5.475255060195923, "epoch": 1.2654208998548622, "grad_norm": 0.984375, "learning_rate": 0.00048457535457338964, "loss": 5.0767, "mean_token_accuracy": 0.19604025781154633, "num_tokens": 28957874.0, "step": 13950 }, { "entropy": 5.479547214508057, "epoch": 1.2658744557329462, "grad_norm": 0.9765625, "learning_rate": 0.0004845635785676137, "loss": 5.0597, "mean_token_accuracy": 0.18991512060165405, "num_tokens": 28968023.0, "step": 13955 }, { "entropy": 5.42999267578125, "epoch": 1.2663280116110305, "grad_norm": 1.046875, "learning_rate": 0.00048455179822800957, "loss": 4.9644, "mean_token_accuracy": 0.20645622462034224, "num_tokens": 28977744.0, "step": 13960 }, { "entropy": 5.52282338142395, "epoch": 1.2667815674891147, "grad_norm": 0.96875, "learning_rate": 0.0004845400135548208, "loss": 5.2031, "mean_token_accuracy": 0.18940825760364532, "num_tokens": 28988875.0, "step": 13965 }, { "entropy": 5.4079639434814455, "epoch": 1.2672351233671988, "grad_norm": 1.046875, "learning_rate": 0.0004845282245482912, "loss": 5.011, "mean_token_accuracy": 0.2026742398738861, "num_tokens": 28998562.0, "step": 13970 }, { "entropy": 5.474730110168457, "epoch": 1.267688679245283, "grad_norm": 1.0, "learning_rate": 0.0004845164312086646, "loss": 5.0452, "mean_token_accuracy": 0.2058258980512619, "num_tokens": 29008783.0, "step": 13975 }, { "entropy": 5.420112085342407, "epoch": 1.268142235123367, "grad_norm": 1.03125, "learning_rate": 0.0004845046335361847, "loss": 4.9778, "mean_token_accuracy": 0.2004618838429451, "num_tokens": 29019303.0, "step": 13980 }, { "entropy": 5.500355291366577, "epoch": 1.2685957910014514, "grad_norm": 0.9140625, "learning_rate": 0.00048449283153109566, "loss": 5.1978, "mean_token_accuracy": 0.18973972648382187, "num_tokens": 29029843.0, "step": 13985 }, { "entropy": 5.511347150802612, "epoch": 1.2690493468795356, "grad_norm": 0.95703125, "learning_rate": 0.0004844810251936413, "loss": 5.1089, "mean_token_accuracy": 0.19228664934635162, "num_tokens": 29040603.0, "step": 13990 }, { "entropy": 5.46467547416687, "epoch": 1.2695029027576197, "grad_norm": 0.94921875, "learning_rate": 0.0004844692145240661, "loss": 5.0475, "mean_token_accuracy": 0.20179881155490875, "num_tokens": 29050599.0, "step": 13995 }, { "entropy": 5.44791259765625, "epoch": 1.269956458635704, "grad_norm": 0.98828125, "learning_rate": 0.0004844573995226142, "loss": 5.0958, "mean_token_accuracy": 0.19354299306869507, "num_tokens": 29061292.0, "step": 14000 }, { "entropy": 5.39538836479187, "epoch": 1.270410014513788, "grad_norm": 0.94140625, "learning_rate": 0.00048444558018952984, "loss": 5.0136, "mean_token_accuracy": 0.20973615050315858, "num_tokens": 29071779.0, "step": 14005 }, { "entropy": 5.394731140136718, "epoch": 1.2708635703918723, "grad_norm": 0.9375, "learning_rate": 0.00048443375652505754, "loss": 4.9827, "mean_token_accuracy": 0.2039197489619255, "num_tokens": 29082073.0, "step": 14010 }, { "entropy": 5.456092166900635, "epoch": 1.2713171262699565, "grad_norm": 0.9921875, "learning_rate": 0.0004844219285294418, "loss": 4.9651, "mean_token_accuracy": 0.20332453697919844, "num_tokens": 29092032.0, "step": 14015 }, { "entropy": 5.456031847000122, "epoch": 1.2717706821480406, "grad_norm": 1.03125, "learning_rate": 0.00048441009620292714, "loss": 5.012, "mean_token_accuracy": 0.20634298771619797, "num_tokens": 29102936.0, "step": 14020 }, { "entropy": 5.451512145996094, "epoch": 1.2722242380261248, "grad_norm": 0.953125, "learning_rate": 0.0004843982595457584, "loss": 5.05, "mean_token_accuracy": 0.20064093321561813, "num_tokens": 29113385.0, "step": 14025 }, { "entropy": 5.43087363243103, "epoch": 1.2726777939042089, "grad_norm": 0.94140625, "learning_rate": 0.00048438641855818026, "loss": 5.0859, "mean_token_accuracy": 0.1958359807729721, "num_tokens": 29125075.0, "step": 14030 }, { "entropy": 5.471334028244018, "epoch": 1.2731313497822931, "grad_norm": 1.0234375, "learning_rate": 0.0004843745732404376, "loss": 5.0238, "mean_token_accuracy": 0.19629547894001007, "num_tokens": 29135098.0, "step": 14035 }, { "entropy": 5.53118257522583, "epoch": 1.2735849056603774, "grad_norm": 1.03125, "learning_rate": 0.0004843627235927755, "loss": 5.1128, "mean_token_accuracy": 0.19498565495014192, "num_tokens": 29145577.0, "step": 14040 }, { "entropy": 5.4487803936004635, "epoch": 1.2740384615384617, "grad_norm": 0.99609375, "learning_rate": 0.0004843508696154388, "loss": 5.0529, "mean_token_accuracy": 0.2005828231573105, "num_tokens": 29155905.0, "step": 14045 }, { "entropy": 5.411189699172974, "epoch": 1.2744920174165457, "grad_norm": 1.015625, "learning_rate": 0.00048433901130867283, "loss": 4.9746, "mean_token_accuracy": 0.20621789246797562, "num_tokens": 29164926.0, "step": 14050 }, { "entropy": 5.406766605377197, "epoch": 1.2749455732946298, "grad_norm": 1.0390625, "learning_rate": 0.0004843271486727228, "loss": 5.0156, "mean_token_accuracy": 0.19711293280124664, "num_tokens": 29175050.0, "step": 14055 }, { "entropy": 5.4486559391021725, "epoch": 1.275399129172714, "grad_norm": 0.93359375, "learning_rate": 0.00048431528170783395, "loss": 5.0923, "mean_token_accuracy": 0.19830595701932907, "num_tokens": 29186255.0, "step": 14060 }, { "entropy": 5.471863603591919, "epoch": 1.2758526850507983, "grad_norm": 0.98828125, "learning_rate": 0.0004843034104142517, "loss": 5.0657, "mean_token_accuracy": 0.20228296816349028, "num_tokens": 29195639.0, "step": 14065 }, { "entropy": 5.458148193359375, "epoch": 1.2763062409288826, "grad_norm": 1.078125, "learning_rate": 0.0004842915347922216, "loss": 5.0802, "mean_token_accuracy": 0.1935840979218483, "num_tokens": 29206482.0, "step": 14070 }, { "entropy": 5.49206395149231, "epoch": 1.2767597968069666, "grad_norm": 0.93359375, "learning_rate": 0.0004842796548419893, "loss": 5.0558, "mean_token_accuracy": 0.19867073446512223, "num_tokens": 29217433.0, "step": 14075 }, { "entropy": 5.525887107849121, "epoch": 1.2772133526850509, "grad_norm": 1.1484375, "learning_rate": 0.00048426777056380035, "loss": 5.1259, "mean_token_accuracy": 0.19111961275339126, "num_tokens": 29226193.0, "step": 14080 }, { "entropy": 5.457399654388428, "epoch": 1.277666908563135, "grad_norm": 0.96875, "learning_rate": 0.0004842558819579006, "loss": 5.0642, "mean_token_accuracy": 0.2021912306547165, "num_tokens": 29237061.0, "step": 14085 }, { "entropy": 5.421337223052978, "epoch": 1.2781204644412192, "grad_norm": 1.0625, "learning_rate": 0.0004842439890245358, "loss": 5.022, "mean_token_accuracy": 0.20495831370353698, "num_tokens": 29247689.0, "step": 14090 }, { "entropy": 5.431916189193726, "epoch": 1.2785740203193035, "grad_norm": 0.9296875, "learning_rate": 0.00048423209176395204, "loss": 5.0206, "mean_token_accuracy": 0.2016739085316658, "num_tokens": 29258235.0, "step": 14095 }, { "entropy": 5.448566150665283, "epoch": 1.2790275761973875, "grad_norm": 1.0625, "learning_rate": 0.0004842201901763954, "loss": 4.9887, "mean_token_accuracy": 0.2021269142627716, "num_tokens": 29268884.0, "step": 14100 }, { "entropy": 5.418848896026612, "epoch": 1.2794811320754718, "grad_norm": 0.91015625, "learning_rate": 0.0004842082842621118, "loss": 5.1334, "mean_token_accuracy": 0.19570833295583726, "num_tokens": 29280484.0, "step": 14105 }, { "entropy": 5.488956546783447, "epoch": 1.2799346879535558, "grad_norm": 1.0625, "learning_rate": 0.0004841963740213476, "loss": 5.1062, "mean_token_accuracy": 0.19842521697282792, "num_tokens": 29291199.0, "step": 14110 }, { "entropy": 5.534154844284058, "epoch": 1.28038824383164, "grad_norm": 0.9140625, "learning_rate": 0.0004841844594543491, "loss": 5.0599, "mean_token_accuracy": 0.19891676008701326, "num_tokens": 29302007.0, "step": 14115 }, { "entropy": 5.4513023853302, "epoch": 1.2808417997097243, "grad_norm": 1.015625, "learning_rate": 0.0004841725405613626, "loss": 5.0398, "mean_token_accuracy": 0.20795077979564666, "num_tokens": 29312127.0, "step": 14120 }, { "entropy": 5.4811718463897705, "epoch": 1.2812953555878084, "grad_norm": 0.921875, "learning_rate": 0.0004841606173426347, "loss": 5.1642, "mean_token_accuracy": 0.19157685488462448, "num_tokens": 29323691.0, "step": 14125 }, { "entropy": 5.46334490776062, "epoch": 1.2817489114658926, "grad_norm": 0.9375, "learning_rate": 0.00048414868979841197, "loss": 5.0798, "mean_token_accuracy": 0.1970996528863907, "num_tokens": 29335203.0, "step": 14130 }, { "entropy": 5.507711458206177, "epoch": 1.2822024673439767, "grad_norm": 1.0, "learning_rate": 0.00048413675792894105, "loss": 5.095, "mean_token_accuracy": 0.19961245954036713, "num_tokens": 29346422.0, "step": 14135 }, { "entropy": 5.438190031051636, "epoch": 1.282656023222061, "grad_norm": 1.015625, "learning_rate": 0.0004841248217344686, "loss": 5.0282, "mean_token_accuracy": 0.20192458480596542, "num_tokens": 29356084.0, "step": 14140 }, { "entropy": 5.429281902313233, "epoch": 1.2831095791001452, "grad_norm": 1.0078125, "learning_rate": 0.0004841128812152415, "loss": 5.0308, "mean_token_accuracy": 0.19918602108955383, "num_tokens": 29366093.0, "step": 14145 }, { "entropy": 5.484508800506592, "epoch": 1.2835631349782293, "grad_norm": 1.0234375, "learning_rate": 0.0004841009363715068, "loss": 5.0892, "mean_token_accuracy": 0.19784653931856155, "num_tokens": 29376621.0, "step": 14150 }, { "entropy": 5.510742902755737, "epoch": 1.2840166908563135, "grad_norm": 1.0390625, "learning_rate": 0.0004840889872035115, "loss": 5.1285, "mean_token_accuracy": 0.19336931705474852, "num_tokens": 29387119.0, "step": 14155 }, { "entropy": 5.46896710395813, "epoch": 1.2844702467343976, "grad_norm": 1.0390625, "learning_rate": 0.0004840770337115026, "loss": 5.0579, "mean_token_accuracy": 0.20229030400514603, "num_tokens": 29396981.0, "step": 14160 }, { "entropy": 5.504418849945068, "epoch": 1.2849238026124818, "grad_norm": 1.0625, "learning_rate": 0.00048406507589572747, "loss": 5.0347, "mean_token_accuracy": 0.200796540081501, "num_tokens": 29406737.0, "step": 14165 }, { "entropy": 5.473976898193359, "epoch": 1.2853773584905661, "grad_norm": 1.0390625, "learning_rate": 0.0004840531137564331, "loss": 5.0579, "mean_token_accuracy": 0.19947080463171005, "num_tokens": 29417300.0, "step": 14170 }, { "entropy": 5.47886095046997, "epoch": 1.2858309143686502, "grad_norm": 0.97265625, "learning_rate": 0.0004840411472938672, "loss": 4.9791, "mean_token_accuracy": 0.20759643763303756, "num_tokens": 29426749.0, "step": 14175 }, { "entropy": 5.409400892257691, "epoch": 1.2862844702467344, "grad_norm": 0.91796875, "learning_rate": 0.0004840291765082771, "loss": 5.0038, "mean_token_accuracy": 0.19947194159030915, "num_tokens": 29437264.0, "step": 14180 }, { "entropy": 5.426572322845459, "epoch": 1.2867380261248185, "grad_norm": 0.96484375, "learning_rate": 0.00048401720139991036, "loss": 5.0046, "mean_token_accuracy": 0.19459227323532105, "num_tokens": 29448192.0, "step": 14185 }, { "entropy": 5.482336568832397, "epoch": 1.2871915820029027, "grad_norm": 1.0625, "learning_rate": 0.0004840052219690146, "loss": 4.911, "mean_token_accuracy": 0.21285396963357925, "num_tokens": 29457923.0, "step": 14190 }, { "entropy": 5.365271377563476, "epoch": 1.287645137880987, "grad_norm": 1.0390625, "learning_rate": 0.0004839932382158376, "loss": 4.9968, "mean_token_accuracy": 0.2121126487851143, "num_tokens": 29466914.0, "step": 14195 }, { "entropy": 5.429365825653076, "epoch": 1.288098693759071, "grad_norm": 0.96875, "learning_rate": 0.0004839812501406272, "loss": 5.0911, "mean_token_accuracy": 0.19476546943187714, "num_tokens": 29477648.0, "step": 14200 }, { "entropy": 5.48526816368103, "epoch": 1.2885522496371553, "grad_norm": 0.94140625, "learning_rate": 0.0004839692577436313, "loss": 5.0693, "mean_token_accuracy": 0.2014537572860718, "num_tokens": 29487947.0, "step": 14205 }, { "entropy": 5.572406339645386, "epoch": 1.2890058055152394, "grad_norm": 1.0859375, "learning_rate": 0.0004839572610250978, "loss": 5.162, "mean_token_accuracy": 0.18987073600292206, "num_tokens": 29497667.0, "step": 14210 }, { "entropy": 5.466194772720337, "epoch": 1.2894593613933236, "grad_norm": 1.015625, "learning_rate": 0.00048394525998527496, "loss": 5.0344, "mean_token_accuracy": 0.19715804904699324, "num_tokens": 29507065.0, "step": 14215 }, { "entropy": 5.515470218658447, "epoch": 1.2899129172714079, "grad_norm": 0.9609375, "learning_rate": 0.0004839332546244109, "loss": 5.1207, "mean_token_accuracy": 0.19964057207107544, "num_tokens": 29517752.0, "step": 14220 }, { "entropy": 5.451497173309326, "epoch": 1.2903664731494922, "grad_norm": 1.0546875, "learning_rate": 0.00048392124494275385, "loss": 5.0396, "mean_token_accuracy": 0.19701832681894302, "num_tokens": 29527894.0, "step": 14225 }, { "entropy": 5.436139106750488, "epoch": 1.2908200290275762, "grad_norm": 1.015625, "learning_rate": 0.0004839092309405523, "loss": 5.0849, "mean_token_accuracy": 0.1972740739583969, "num_tokens": 29538136.0, "step": 14230 }, { "entropy": 5.476589345932007, "epoch": 1.2912735849056602, "grad_norm": 0.91796875, "learning_rate": 0.00048389721261805457, "loss": 5.06, "mean_token_accuracy": 0.19925848245620728, "num_tokens": 29549193.0, "step": 14235 }, { "entropy": 5.418052005767822, "epoch": 1.2917271407837445, "grad_norm": 1.0078125, "learning_rate": 0.00048388518997550926, "loss": 4.9638, "mean_token_accuracy": 0.20766545832157135, "num_tokens": 29558889.0, "step": 14240 }, { "entropy": 5.454746294021606, "epoch": 1.2921806966618288, "grad_norm": 1.046875, "learning_rate": 0.00048387316301316493, "loss": 5.0817, "mean_token_accuracy": 0.19525161534547805, "num_tokens": 29569691.0, "step": 14245 }, { "entropy": 5.488633298873902, "epoch": 1.292634252539913, "grad_norm": 1.0546875, "learning_rate": 0.0004838611317312705, "loss": 5.1593, "mean_token_accuracy": 0.19238779544830323, "num_tokens": 29580459.0, "step": 14250 }, { "entropy": 5.471126317977905, "epoch": 1.293087808417997, "grad_norm": 1.0859375, "learning_rate": 0.0004838490961300745, "loss": 5.0597, "mean_token_accuracy": 0.20004819929599763, "num_tokens": 29590652.0, "step": 14255 }, { "entropy": 5.503458690643311, "epoch": 1.2935413642960814, "grad_norm": 1.0390625, "learning_rate": 0.00048383705620982606, "loss": 5.0768, "mean_token_accuracy": 0.20538977682590484, "num_tokens": 29600353.0, "step": 14260 }, { "entropy": 5.4731116771698, "epoch": 1.2939949201741654, "grad_norm": 1.046875, "learning_rate": 0.00048382501197077405, "loss": 5.0315, "mean_token_accuracy": 0.21094868183135987, "num_tokens": 29610561.0, "step": 14265 }, { "entropy": 5.405670833587647, "epoch": 1.2944484760522497, "grad_norm": 0.875, "learning_rate": 0.0004838129634131675, "loss": 5.0372, "mean_token_accuracy": 0.1995544448494911, "num_tokens": 29621741.0, "step": 14270 }, { "entropy": 5.4140002727508545, "epoch": 1.294902031930334, "grad_norm": 0.94921875, "learning_rate": 0.0004838009105372558, "loss": 4.9694, "mean_token_accuracy": 0.1997040554881096, "num_tokens": 29633097.0, "step": 14275 }, { "entropy": 5.444863653182983, "epoch": 1.295355587808418, "grad_norm": 0.95703125, "learning_rate": 0.00048378885334328793, "loss": 5.0716, "mean_token_accuracy": 0.19167536050081252, "num_tokens": 29644290.0, "step": 14280 }, { "entropy": 5.548151206970215, "epoch": 1.2958091436865022, "grad_norm": 1.0234375, "learning_rate": 0.0004837767918315135, "loss": 5.1291, "mean_token_accuracy": 0.19501840472221374, "num_tokens": 29654977.0, "step": 14285 }, { "entropy": 5.546808052062988, "epoch": 1.2962626995645863, "grad_norm": 1.03125, "learning_rate": 0.00048376472600218174, "loss": 5.1217, "mean_token_accuracy": 0.1964360550045967, "num_tokens": 29665020.0, "step": 14290 }, { "entropy": 5.469972610473633, "epoch": 1.2967162554426706, "grad_norm": 0.9765625, "learning_rate": 0.0004837526558555422, "loss": 5.0756, "mean_token_accuracy": 0.20108735859394072, "num_tokens": 29675098.0, "step": 14295 }, { "entropy": 5.390252161026001, "epoch": 1.2971698113207548, "grad_norm": 0.91796875, "learning_rate": 0.0004837405813918446, "loss": 4.9864, "mean_token_accuracy": 0.20647544860839845, "num_tokens": 29685450.0, "step": 14300 }, { "entropy": 5.44470853805542, "epoch": 1.2976233671988389, "grad_norm": 1.0546875, "learning_rate": 0.00048372850261133856, "loss": 5.0165, "mean_token_accuracy": 0.20059045404195786, "num_tokens": 29694818.0, "step": 14305 }, { "entropy": 5.487842845916748, "epoch": 1.2980769230769231, "grad_norm": 0.98046875, "learning_rate": 0.00048371641951427393, "loss": 5.1113, "mean_token_accuracy": 0.1938343659043312, "num_tokens": 29705573.0, "step": 14310 }, { "entropy": 5.478750896453858, "epoch": 1.2985304789550072, "grad_norm": 1.0625, "learning_rate": 0.00048370433210090055, "loss": 5.014, "mean_token_accuracy": 0.19965904355049133, "num_tokens": 29716366.0, "step": 14315 }, { "entropy": 5.4626648902893065, "epoch": 1.2989840348330914, "grad_norm": 1.0, "learning_rate": 0.0004836922403714683, "loss": 5.0361, "mean_token_accuracy": 0.19631998986005783, "num_tokens": 29727181.0, "step": 14320 }, { "entropy": 5.407274341583252, "epoch": 1.2994375907111757, "grad_norm": 1.0390625, "learning_rate": 0.00048368014432622746, "loss": 5.0567, "mean_token_accuracy": 0.2011177882552147, "num_tokens": 29736960.0, "step": 14325 }, { "entropy": 5.408423233032226, "epoch": 1.2998911465892597, "grad_norm": 1.0078125, "learning_rate": 0.000483668043965428, "loss": 4.9477, "mean_token_accuracy": 0.2119763821363449, "num_tokens": 29746354.0, "step": 14330 }, { "entropy": 5.4474845886230465, "epoch": 1.300344702467344, "grad_norm": 0.9921875, "learning_rate": 0.0004836559392893203, "loss": 5.0611, "mean_token_accuracy": 0.19734853953123094, "num_tokens": 29756627.0, "step": 14335 }, { "entropy": 5.443008661270142, "epoch": 1.300798258345428, "grad_norm": 1.046875, "learning_rate": 0.0004836438302981545, "loss": 5.0522, "mean_token_accuracy": 0.20591117888689042, "num_tokens": 29766684.0, "step": 14340 }, { "entropy": 5.4376171112060545, "epoch": 1.3012518142235123, "grad_norm": 1.0625, "learning_rate": 0.0004836317169921811, "loss": 5.062, "mean_token_accuracy": 0.1998087629675865, "num_tokens": 29776556.0, "step": 14345 }, { "entropy": 5.5232834815979, "epoch": 1.3017053701015966, "grad_norm": 0.9609375, "learning_rate": 0.00048361959937165075, "loss": 5.1949, "mean_token_accuracy": 0.1920908659696579, "num_tokens": 29786896.0, "step": 14350 }, { "entropy": 5.478964185714721, "epoch": 1.3021589259796806, "grad_norm": 1.015625, "learning_rate": 0.0004836074774368138, "loss": 5.0017, "mean_token_accuracy": 0.20372447669506072, "num_tokens": 29797332.0, "step": 14355 }, { "entropy": 5.4851744174957275, "epoch": 1.302612481857765, "grad_norm": 1.0234375, "learning_rate": 0.00048359535118792116, "loss": 5.0952, "mean_token_accuracy": 0.20031577795743943, "num_tokens": 29806428.0, "step": 14360 }, { "entropy": 5.419641160964966, "epoch": 1.303066037735849, "grad_norm": 1.015625, "learning_rate": 0.0004835832206252235, "loss": 5.0647, "mean_token_accuracy": 0.1950739622116089, "num_tokens": 29816794.0, "step": 14365 }, { "entropy": 5.536451816558838, "epoch": 1.3035195936139332, "grad_norm": 0.96484375, "learning_rate": 0.0004835710857489716, "loss": 5.1039, "mean_token_accuracy": 0.20131175667047502, "num_tokens": 29827077.0, "step": 14370 }, { "entropy": 5.44500036239624, "epoch": 1.3039731494920175, "grad_norm": 0.99609375, "learning_rate": 0.0004835589465594165, "loss": 5.0549, "mean_token_accuracy": 0.195481513440609, "num_tokens": 29837868.0, "step": 14375 }, { "entropy": 5.45031886100769, "epoch": 1.3044267053701015, "grad_norm": 1.0390625, "learning_rate": 0.00048354680305680926, "loss": 5.0795, "mean_token_accuracy": 0.20101405531167985, "num_tokens": 29846929.0, "step": 14380 }, { "entropy": 5.445803642272949, "epoch": 1.3048802612481858, "grad_norm": 0.9453125, "learning_rate": 0.00048353465524140105, "loss": 5.0217, "mean_token_accuracy": 0.2037921890616417, "num_tokens": 29857905.0, "step": 14385 }, { "entropy": 5.464574575424194, "epoch": 1.3053338171262698, "grad_norm": 1.0625, "learning_rate": 0.000483522503113443, "loss": 5.0777, "mean_token_accuracy": 0.1997160106897354, "num_tokens": 29868230.0, "step": 14390 }, { "entropy": 5.444516229629516, "epoch": 1.305787373004354, "grad_norm": 0.98046875, "learning_rate": 0.00048351034667318634, "loss": 5.0378, "mean_token_accuracy": 0.2014074981212616, "num_tokens": 29879224.0, "step": 14395 }, { "entropy": 5.525046682357788, "epoch": 1.3062409288824384, "grad_norm": 0.953125, "learning_rate": 0.0004834981859208827, "loss": 5.1799, "mean_token_accuracy": 0.19462355971336365, "num_tokens": 29890416.0, "step": 14400 }, { "entropy": 5.508916282653809, "epoch": 1.3066944847605226, "grad_norm": 0.9296875, "learning_rate": 0.00048348602085678346, "loss": 5.1018, "mean_token_accuracy": 0.19744647145271302, "num_tokens": 29901064.0, "step": 14405 }, { "entropy": 5.538735198974609, "epoch": 1.3071480406386067, "grad_norm": 0.95703125, "learning_rate": 0.00048347385148114004, "loss": 5.1547, "mean_token_accuracy": 0.19499599188566208, "num_tokens": 29911084.0, "step": 14410 }, { "entropy": 5.428773021697998, "epoch": 1.3076015965166907, "grad_norm": 0.953125, "learning_rate": 0.00048346167779420436, "loss": 4.9999, "mean_token_accuracy": 0.20560617744922638, "num_tokens": 29921104.0, "step": 14415 }, { "entropy": 5.46851372718811, "epoch": 1.308055152394775, "grad_norm": 0.9453125, "learning_rate": 0.00048344949979622806, "loss": 5.0304, "mean_token_accuracy": 0.2017678901553154, "num_tokens": 29932014.0, "step": 14420 }, { "entropy": 5.4437024116516115, "epoch": 1.3085087082728593, "grad_norm": 1.1015625, "learning_rate": 0.00048343731748746294, "loss": 5.0517, "mean_token_accuracy": 0.1981023967266083, "num_tokens": 29941707.0, "step": 14425 }, { "entropy": 5.467644309997558, "epoch": 1.3089622641509435, "grad_norm": 1.09375, "learning_rate": 0.000483425130868161, "loss": 5.0408, "mean_token_accuracy": 0.19608643800020217, "num_tokens": 29952082.0, "step": 14430 }, { "entropy": 5.40396409034729, "epoch": 1.3094158200290276, "grad_norm": 1.0234375, "learning_rate": 0.0004834129399385742, "loss": 4.8721, "mean_token_accuracy": 0.21680345386266708, "num_tokens": 29961744.0, "step": 14435 }, { "entropy": 5.432842874526978, "epoch": 1.3098693759071118, "grad_norm": 0.95703125, "learning_rate": 0.0004834007446989548, "loss": 5.025, "mean_token_accuracy": 0.21272454410791397, "num_tokens": 29972611.0, "step": 14440 }, { "entropy": 5.401928472518921, "epoch": 1.3103229317851959, "grad_norm": 1.0078125, "learning_rate": 0.00048338854514955474, "loss": 4.9591, "mean_token_accuracy": 0.2062120631337166, "num_tokens": 29982660.0, "step": 14445 }, { "entropy": 5.446466875076294, "epoch": 1.3107764876632801, "grad_norm": 1.0, "learning_rate": 0.00048337634129062655, "loss": 5.0776, "mean_token_accuracy": 0.18785275816917418, "num_tokens": 29993349.0, "step": 14450 }, { "entropy": 5.570342636108398, "epoch": 1.3112300435413644, "grad_norm": 0.97265625, "learning_rate": 0.00048336413312242255, "loss": 5.1498, "mean_token_accuracy": 0.19252850264310836, "num_tokens": 30004474.0, "step": 14455 }, { "entropy": 5.484516429901123, "epoch": 1.3116835994194485, "grad_norm": 1.046875, "learning_rate": 0.00048335192064519514, "loss": 5.0997, "mean_token_accuracy": 0.19876566678285598, "num_tokens": 30015189.0, "step": 14460 }, { "entropy": 5.453644609451294, "epoch": 1.3121371552975327, "grad_norm": 1.0703125, "learning_rate": 0.00048333970385919695, "loss": 4.9971, "mean_token_accuracy": 0.20059075802564622, "num_tokens": 30025491.0, "step": 14465 }, { "entropy": 5.501976776123047, "epoch": 1.3125907111756168, "grad_norm": 1.0234375, "learning_rate": 0.00048332748276468053, "loss": 5.0647, "mean_token_accuracy": 0.20270003527402877, "num_tokens": 30034683.0, "step": 14470 }, { "entropy": 5.436651277542114, "epoch": 1.313044267053701, "grad_norm": 1.0, "learning_rate": 0.0004833152573618987, "loss": 5.0282, "mean_token_accuracy": 0.20032430738210677, "num_tokens": 30044135.0, "step": 14475 }, { "entropy": 5.495923280715942, "epoch": 1.3134978229317853, "grad_norm": 1.03125, "learning_rate": 0.00048330302765110436, "loss": 5.111, "mean_token_accuracy": 0.19856578707695008, "num_tokens": 30054520.0, "step": 14480 }, { "entropy": 5.477340984344482, "epoch": 1.3139513788098693, "grad_norm": 0.98828125, "learning_rate": 0.00048329079363255024, "loss": 5.0921, "mean_token_accuracy": 0.19396299123764038, "num_tokens": 30065439.0, "step": 14485 }, { "entropy": 5.484131002426148, "epoch": 1.3144049346879536, "grad_norm": 0.921875, "learning_rate": 0.00048327855530648934, "loss": 5.0769, "mean_token_accuracy": 0.1978706508874893, "num_tokens": 30075362.0, "step": 14490 }, { "entropy": 5.46552734375, "epoch": 1.3148584905660377, "grad_norm": 1.046875, "learning_rate": 0.000483266312673175, "loss": 5.0492, "mean_token_accuracy": 0.1971236765384674, "num_tokens": 30084913.0, "step": 14495 }, { "entropy": 5.467570734024048, "epoch": 1.315312046444122, "grad_norm": 0.93359375, "learning_rate": 0.0004832540657328602, "loss": 5.0579, "mean_token_accuracy": 0.19743605107069015, "num_tokens": 30095704.0, "step": 14500 }, { "entropy": 5.436670017242432, "epoch": 1.3157656023222062, "grad_norm": 0.90234375, "learning_rate": 0.0004832418144857982, "loss": 5.0195, "mean_token_accuracy": 0.20036741942167283, "num_tokens": 30105981.0, "step": 14505 }, { "entropy": 5.463035917282104, "epoch": 1.3162191582002902, "grad_norm": 1.0234375, "learning_rate": 0.00048322955893224245, "loss": 5.0763, "mean_token_accuracy": 0.18886080384254456, "num_tokens": 30115772.0, "step": 14510 }, { "entropy": 5.453473901748657, "epoch": 1.3166727140783745, "grad_norm": 0.97265625, "learning_rate": 0.00048321729907244626, "loss": 5.0138, "mean_token_accuracy": 0.20168087184429168, "num_tokens": 30127050.0, "step": 14515 }, { "entropy": 5.467558574676514, "epoch": 1.3171262699564585, "grad_norm": 0.9296875, "learning_rate": 0.0004832050349066634, "loss": 5.0707, "mean_token_accuracy": 0.1975627213716507, "num_tokens": 30138221.0, "step": 14520 }, { "entropy": 5.512048435211182, "epoch": 1.3175798258345428, "grad_norm": 0.96875, "learning_rate": 0.0004831927664351473, "loss": 5.1326, "mean_token_accuracy": 0.19621213227510453, "num_tokens": 30150181.0, "step": 14525 }, { "entropy": 5.4882982730865475, "epoch": 1.318033381712627, "grad_norm": 1.03125, "learning_rate": 0.0004831804936581518, "loss": 5.0917, "mean_token_accuracy": 0.20324126482009888, "num_tokens": 30160521.0, "step": 14530 }, { "entropy": 5.497390937805176, "epoch": 1.3184869375907111, "grad_norm": 1.015625, "learning_rate": 0.0004831682165759305, "loss": 5.0713, "mean_token_accuracy": 0.19804712533950805, "num_tokens": 30170611.0, "step": 14535 }, { "entropy": 5.481413221359253, "epoch": 1.3189404934687954, "grad_norm": 1.0, "learning_rate": 0.00048315593518873757, "loss": 5.0389, "mean_token_accuracy": 0.21308245956897737, "num_tokens": 30179914.0, "step": 14540 }, { "entropy": 5.426105308532715, "epoch": 1.3193940493468794, "grad_norm": 1.046875, "learning_rate": 0.0004831436494968268, "loss": 5.0418, "mean_token_accuracy": 0.20314780473709107, "num_tokens": 30191426.0, "step": 14545 }, { "entropy": 5.449762868881225, "epoch": 1.3198476052249637, "grad_norm": 0.94921875, "learning_rate": 0.00048313135950045234, "loss": 5.0039, "mean_token_accuracy": 0.2015809252858162, "num_tokens": 30202813.0, "step": 14550 }, { "entropy": 5.46356725692749, "epoch": 1.320301161103048, "grad_norm": 0.9765625, "learning_rate": 0.00048311906519986824, "loss": 4.9521, "mean_token_accuracy": 0.20454393625259398, "num_tokens": 30213044.0, "step": 14555 }, { "entropy": 5.469812726974487, "epoch": 1.320754716981132, "grad_norm": 1.1640625, "learning_rate": 0.000483106766595329, "loss": 5.0443, "mean_token_accuracy": 0.19463009834289552, "num_tokens": 30223419.0, "step": 14560 }, { "entropy": 5.502302455902099, "epoch": 1.3212082728592163, "grad_norm": 0.96484375, "learning_rate": 0.0004830944636870887, "loss": 5.0734, "mean_token_accuracy": 0.1953321412205696, "num_tokens": 30233203.0, "step": 14565 }, { "entropy": 5.46925950050354, "epoch": 1.3216618287373003, "grad_norm": 0.9765625, "learning_rate": 0.00048308215647540183, "loss": 5.0812, "mean_token_accuracy": 0.19541971534490585, "num_tokens": 30244604.0, "step": 14570 }, { "entropy": 5.537690687179565, "epoch": 1.3221153846153846, "grad_norm": 1.1171875, "learning_rate": 0.00048306984496052297, "loss": 5.1297, "mean_token_accuracy": 0.19922395199537277, "num_tokens": 30255355.0, "step": 14575 }, { "entropy": 5.56852240562439, "epoch": 1.3225689404934688, "grad_norm": 1.015625, "learning_rate": 0.00048305752914270665, "loss": 5.1509, "mean_token_accuracy": 0.19310900270938874, "num_tokens": 30265665.0, "step": 14580 }, { "entropy": 5.525383424758911, "epoch": 1.3230224963715531, "grad_norm": 1.1328125, "learning_rate": 0.00048304520902220767, "loss": 5.1272, "mean_token_accuracy": 0.20262507051229478, "num_tokens": 30274347.0, "step": 14585 }, { "entropy": 5.494300079345703, "epoch": 1.3234760522496372, "grad_norm": 1.015625, "learning_rate": 0.0004830328845992808, "loss": 4.9577, "mean_token_accuracy": 0.2104866087436676, "num_tokens": 30284243.0, "step": 14590 }, { "entropy": 5.389914608001709, "epoch": 1.3239296081277212, "grad_norm": 1.0390625, "learning_rate": 0.00048302055587418074, "loss": 4.9932, "mean_token_accuracy": 0.20106371939182283, "num_tokens": 30294327.0, "step": 14595 }, { "entropy": 5.408010959625244, "epoch": 1.3243831640058055, "grad_norm": 1.0078125, "learning_rate": 0.0004830082228471626, "loss": 5.0871, "mean_token_accuracy": 0.19902536869049073, "num_tokens": 30304188.0, "step": 14600 }, { "entropy": 5.46526951789856, "epoch": 1.3248367198838897, "grad_norm": 0.91015625, "learning_rate": 0.00048299588551848146, "loss": 4.9869, "mean_token_accuracy": 0.2069094717502594, "num_tokens": 30314917.0, "step": 14605 }, { "entropy": 5.475058126449585, "epoch": 1.325290275761974, "grad_norm": 1.015625, "learning_rate": 0.00048298354388839237, "loss": 5.001, "mean_token_accuracy": 0.20261586606502532, "num_tokens": 30325221.0, "step": 14610 }, { "entropy": 5.51237211227417, "epoch": 1.325743831640058, "grad_norm": 1.015625, "learning_rate": 0.0004829711979571506, "loss": 5.1072, "mean_token_accuracy": 0.19983938336372375, "num_tokens": 30336196.0, "step": 14615 }, { "entropy": 5.4390116214752195, "epoch": 1.3261973875181423, "grad_norm": 1.171875, "learning_rate": 0.0004829588477250115, "loss": 4.9183, "mean_token_accuracy": 0.2147581547498703, "num_tokens": 30345546.0, "step": 14620 }, { "entropy": 5.432073783874512, "epoch": 1.3266509433962264, "grad_norm": 0.984375, "learning_rate": 0.0004829464931922304, "loss": 5.0602, "mean_token_accuracy": 0.1990799367427826, "num_tokens": 30355672.0, "step": 14625 }, { "entropy": 5.4688026905059814, "epoch": 1.3271044992743106, "grad_norm": 1.0234375, "learning_rate": 0.00048293413435906285, "loss": 5.0597, "mean_token_accuracy": 0.19611307680606843, "num_tokens": 30366233.0, "step": 14630 }, { "entropy": 5.497386026382446, "epoch": 1.327558055152395, "grad_norm": 0.99609375, "learning_rate": 0.0004829217712257644, "loss": 5.0499, "mean_token_accuracy": 0.20204354375600814, "num_tokens": 30377366.0, "step": 14635 }, { "entropy": 5.476496028900146, "epoch": 1.328011611030479, "grad_norm": 0.97265625, "learning_rate": 0.00048290940379259073, "loss": 5.1074, "mean_token_accuracy": 0.20131379812955857, "num_tokens": 30388022.0, "step": 14640 }, { "entropy": 5.456486654281616, "epoch": 1.3284651669085632, "grad_norm": 0.953125, "learning_rate": 0.00048289703205979756, "loss": 4.9573, "mean_token_accuracy": 0.19921093732118605, "num_tokens": 30399235.0, "step": 14645 }, { "entropy": 5.572162103652954, "epoch": 1.3289187227866472, "grad_norm": 1.0859375, "learning_rate": 0.00048288465602764084, "loss": 5.1251, "mean_token_accuracy": 0.197314490377903, "num_tokens": 30409112.0, "step": 14650 }, { "entropy": 5.440092134475708, "epoch": 1.3293722786647315, "grad_norm": 0.9140625, "learning_rate": 0.00048287227569637645, "loss": 5.0338, "mean_token_accuracy": 0.20172401070594786, "num_tokens": 30420202.0, "step": 14655 }, { "entropy": 5.446317291259765, "epoch": 1.3298258345428158, "grad_norm": 0.97265625, "learning_rate": 0.00048285989106626036, "loss": 5.0917, "mean_token_accuracy": 0.202370548248291, "num_tokens": 30431210.0, "step": 14660 }, { "entropy": 5.453888940811157, "epoch": 1.3302793904208998, "grad_norm": 1.109375, "learning_rate": 0.0004828475021375489, "loss": 5.0018, "mean_token_accuracy": 0.20676329433918, "num_tokens": 30441291.0, "step": 14665 }, { "entropy": 5.445957326889038, "epoch": 1.330732946298984, "grad_norm": 1.09375, "learning_rate": 0.0004828351089104981, "loss": 4.9628, "mean_token_accuracy": 0.20900101065635682, "num_tokens": 30450285.0, "step": 14670 }, { "entropy": 5.398617792129516, "epoch": 1.3311865021770681, "grad_norm": 0.9765625, "learning_rate": 0.00048282271138536424, "loss": 5.0678, "mean_token_accuracy": 0.2006645008921623, "num_tokens": 30460311.0, "step": 14675 }, { "entropy": 5.515023851394654, "epoch": 1.3316400580551524, "grad_norm": 1.0078125, "learning_rate": 0.0004828103095624037, "loss": 5.08, "mean_token_accuracy": 0.19864129275083542, "num_tokens": 30470188.0, "step": 14680 }, { "entropy": 5.424178123474121, "epoch": 1.3320936139332367, "grad_norm": 0.94921875, "learning_rate": 0.000482797903441873, "loss": 5.0092, "mean_token_accuracy": 0.19827580600976943, "num_tokens": 30481406.0, "step": 14685 }, { "entropy": 5.3669273853302, "epoch": 1.3325471698113207, "grad_norm": 1.046875, "learning_rate": 0.0004827854930240288, "loss": 5.0042, "mean_token_accuracy": 0.20122469812631608, "num_tokens": 30492314.0, "step": 14690 }, { "entropy": 5.5031452655792235, "epoch": 1.333000725689405, "grad_norm": 1.0390625, "learning_rate": 0.0004827730783091276, "loss": 5.1494, "mean_token_accuracy": 0.19222668260335923, "num_tokens": 30503273.0, "step": 14695 }, { "entropy": 5.5146866798400875, "epoch": 1.333454281567489, "grad_norm": 1.0078125, "learning_rate": 0.00048276065929742616, "loss": 5.0528, "mean_token_accuracy": 0.19601842612028123, "num_tokens": 30513582.0, "step": 14700 }, { "entropy": 5.419421625137329, "epoch": 1.3339078374455733, "grad_norm": 1.125, "learning_rate": 0.0004827482359891814, "loss": 4.9681, "mean_token_accuracy": 0.20890097320079803, "num_tokens": 30523261.0, "step": 14705 }, { "entropy": 5.488310194015503, "epoch": 1.3343613933236576, "grad_norm": 1.0703125, "learning_rate": 0.00048273580838465016, "loss": 5.0861, "mean_token_accuracy": 0.20133254528045655, "num_tokens": 30533774.0, "step": 14710 }, { "entropy": 5.472191381454468, "epoch": 1.3348149492017416, "grad_norm": 0.96875, "learning_rate": 0.0004827233764840894, "loss": 5.1304, "mean_token_accuracy": 0.19558546394109727, "num_tokens": 30544580.0, "step": 14715 }, { "entropy": 5.479812335968018, "epoch": 1.3352685050798259, "grad_norm": 1.0546875, "learning_rate": 0.0004827109402877564, "loss": 4.977, "mean_token_accuracy": 0.20922414660453797, "num_tokens": 30555105.0, "step": 14720 }, { "entropy": 5.459916496276856, "epoch": 1.33572206095791, "grad_norm": 1.0390625, "learning_rate": 0.0004826984997959082, "loss": 5.12, "mean_token_accuracy": 0.18927535861730577, "num_tokens": 30564912.0, "step": 14725 }, { "entropy": 5.4101158618927006, "epoch": 1.3361756168359942, "grad_norm": 0.953125, "learning_rate": 0.000482686055008802, "loss": 5.045, "mean_token_accuracy": 0.19525108784437178, "num_tokens": 30575862.0, "step": 14730 }, { "entropy": 5.481841659545898, "epoch": 1.3366291727140784, "grad_norm": 0.97265625, "learning_rate": 0.00048267360592669535, "loss": 5.1607, "mean_token_accuracy": 0.19661880582571029, "num_tokens": 30586951.0, "step": 14735 }, { "entropy": 5.499304676055909, "epoch": 1.3370827285921625, "grad_norm": 1.03125, "learning_rate": 0.0004826611525498456, "loss": 5.0775, "mean_token_accuracy": 0.1934316173195839, "num_tokens": 30597604.0, "step": 14740 }, { "entropy": 5.521953535079956, "epoch": 1.3375362844702468, "grad_norm": 1.0078125, "learning_rate": 0.0004826486948785103, "loss": 5.1222, "mean_token_accuracy": 0.1946622535586357, "num_tokens": 30608157.0, "step": 14745 }, { "entropy": 5.504887104034424, "epoch": 1.3379898403483308, "grad_norm": 1.046875, "learning_rate": 0.00048263623291294706, "loss": 5.0639, "mean_token_accuracy": 0.20173074901103974, "num_tokens": 30618527.0, "step": 14750 }, { "entropy": 5.509787225723267, "epoch": 1.338443396226415, "grad_norm": 0.94140625, "learning_rate": 0.00048262376665341355, "loss": 5.1546, "mean_token_accuracy": 0.1950371593236923, "num_tokens": 30629253.0, "step": 14755 }, { "entropy": 5.474182891845703, "epoch": 1.3388969521044993, "grad_norm": 1.03125, "learning_rate": 0.0004826112961001677, "loss": 5.1213, "mean_token_accuracy": 0.18329809308052064, "num_tokens": 30639015.0, "step": 14760 }, { "entropy": 5.5530884742736815, "epoch": 1.3393505079825834, "grad_norm": 0.94921875, "learning_rate": 0.00048259882125346735, "loss": 5.1857, "mean_token_accuracy": 0.18424032181501387, "num_tokens": 30650035.0, "step": 14765 }, { "entropy": 5.540981578826904, "epoch": 1.3398040638606676, "grad_norm": 1.078125, "learning_rate": 0.00048258634211357045, "loss": 5.0958, "mean_token_accuracy": 0.19299462735652922, "num_tokens": 30659813.0, "step": 14770 }, { "entropy": 5.463839292526245, "epoch": 1.3402576197387517, "grad_norm": 1.1015625, "learning_rate": 0.0004825738586807351, "loss": 5.052, "mean_token_accuracy": 0.19634215533733368, "num_tokens": 30670243.0, "step": 14775 }, { "entropy": 5.429623126983643, "epoch": 1.340711175616836, "grad_norm": 0.98046875, "learning_rate": 0.00048256137095521945, "loss": 5.0258, "mean_token_accuracy": 0.20084659308195113, "num_tokens": 30680056.0, "step": 14780 }, { "entropy": 5.449593257904053, "epoch": 1.3411647314949202, "grad_norm": 1.125, "learning_rate": 0.00048254887893728175, "loss": 4.9581, "mean_token_accuracy": 0.20344403088092805, "num_tokens": 30690536.0, "step": 14785 }, { "entropy": 5.412839269638061, "epoch": 1.3416182873730045, "grad_norm": 0.9765625, "learning_rate": 0.0004825363826271804, "loss": 5.0553, "mean_token_accuracy": 0.1934947982430458, "num_tokens": 30700200.0, "step": 14790 }, { "entropy": 5.435486841201782, "epoch": 1.3420718432510885, "grad_norm": 1.046875, "learning_rate": 0.0004825238820251737, "loss": 4.955, "mean_token_accuracy": 0.201063634455204, "num_tokens": 30710576.0, "step": 14795 }, { "entropy": 5.445123243331909, "epoch": 1.3425253991291728, "grad_norm": 0.93359375, "learning_rate": 0.00048251137713152027, "loss": 5.0726, "mean_token_accuracy": 0.1973447948694229, "num_tokens": 30721495.0, "step": 14800 }, { "entropy": 5.471863698959351, "epoch": 1.3429789550072568, "grad_norm": 1.0859375, "learning_rate": 0.0004824988679464787, "loss": 5.0947, "mean_token_accuracy": 0.19781219959259033, "num_tokens": 30731700.0, "step": 14805 }, { "entropy": 5.519728946685791, "epoch": 1.343432510885341, "grad_norm": 0.984375, "learning_rate": 0.00048248635447030767, "loss": 5.0695, "mean_token_accuracy": 0.19798239916563035, "num_tokens": 30743421.0, "step": 14810 }, { "entropy": 5.450216913223267, "epoch": 1.3438860667634254, "grad_norm": 0.97265625, "learning_rate": 0.0004824738367032659, "loss": 4.9795, "mean_token_accuracy": 0.21160862743854522, "num_tokens": 30754238.0, "step": 14815 }, { "entropy": 5.4210090160369875, "epoch": 1.3443396226415094, "grad_norm": 1.015625, "learning_rate": 0.0004824613146456123, "loss": 5.0741, "mean_token_accuracy": 0.19306592792272567, "num_tokens": 30763938.0, "step": 14820 }, { "entropy": 5.5478850364685055, "epoch": 1.3447931785195937, "grad_norm": 1.078125, "learning_rate": 0.0004824487882976059, "loss": 5.1285, "mean_token_accuracy": 0.19809957444667817, "num_tokens": 30773654.0, "step": 14825 }, { "entropy": 5.549471998214722, "epoch": 1.3452467343976777, "grad_norm": 0.9140625, "learning_rate": 0.00048243625765950564, "loss": 5.1109, "mean_token_accuracy": 0.19516264647245407, "num_tokens": 30784659.0, "step": 14830 }, { "entropy": 5.42782187461853, "epoch": 1.345700290275762, "grad_norm": 0.9765625, "learning_rate": 0.0004824237227315708, "loss": 4.9903, "mean_token_accuracy": 0.19554276317358016, "num_tokens": 30795194.0, "step": 14835 }, { "entropy": 5.377277421951294, "epoch": 1.3461538461538463, "grad_norm": 1.1484375, "learning_rate": 0.0004824111835140604, "loss": 4.9352, "mean_token_accuracy": 0.21078951060771942, "num_tokens": 30805623.0, "step": 14840 }, { "entropy": 5.444870948791504, "epoch": 1.3466074020319303, "grad_norm": 0.984375, "learning_rate": 0.000482398640007234, "loss": 4.9894, "mean_token_accuracy": 0.20046668946743013, "num_tokens": 30814899.0, "step": 14845 }, { "entropy": 5.45310230255127, "epoch": 1.3470609579100146, "grad_norm": 0.89453125, "learning_rate": 0.00048238609221135076, "loss": 5.1044, "mean_token_accuracy": 0.19705725312232972, "num_tokens": 30825546.0, "step": 14850 }, { "entropy": 5.390522193908692, "epoch": 1.3475145137880986, "grad_norm": 0.9921875, "learning_rate": 0.0004823735401266704, "loss": 5.0051, "mean_token_accuracy": 0.20084163993597032, "num_tokens": 30836406.0, "step": 14855 }, { "entropy": 5.426594924926758, "epoch": 1.3479680696661829, "grad_norm": 0.984375, "learning_rate": 0.00048236098375345227, "loss": 5.0773, "mean_token_accuracy": 0.19645799398422242, "num_tokens": 30847966.0, "step": 14860 }, { "entropy": 5.549108076095581, "epoch": 1.3484216255442671, "grad_norm": 0.9609375, "learning_rate": 0.0004823484230919563, "loss": 5.1136, "mean_token_accuracy": 0.19642357230186464, "num_tokens": 30856831.0, "step": 14865 }, { "entropy": 5.419999265670777, "epoch": 1.3488751814223512, "grad_norm": 1.046875, "learning_rate": 0.00048233585814244195, "loss": 4.9012, "mean_token_accuracy": 0.21475642621517183, "num_tokens": 30866076.0, "step": 14870 }, { "entropy": 5.456047296524048, "epoch": 1.3493287373004355, "grad_norm": 0.99609375, "learning_rate": 0.0004823232889051693, "loss": 4.9971, "mean_token_accuracy": 0.20405160784721374, "num_tokens": 30876845.0, "step": 14875 }, { "entropy": 5.412720108032227, "epoch": 1.3497822931785195, "grad_norm": 1.0234375, "learning_rate": 0.00048231071538039816, "loss": 5.0493, "mean_token_accuracy": 0.19774454087018967, "num_tokens": 30887448.0, "step": 14880 }, { "entropy": 5.48894739151001, "epoch": 1.3502358490566038, "grad_norm": 1.0078125, "learning_rate": 0.00048229813756838863, "loss": 5.0432, "mean_token_accuracy": 0.19980101734399797, "num_tokens": 30898414.0, "step": 14885 }, { "entropy": 5.447532844543457, "epoch": 1.350689404934688, "grad_norm": 0.99609375, "learning_rate": 0.0004822855554694007, "loss": 5.0433, "mean_token_accuracy": 0.20601948350667953, "num_tokens": 30908559.0, "step": 14890 }, { "entropy": 5.48134036064148, "epoch": 1.351142960812772, "grad_norm": 1.0078125, "learning_rate": 0.00048227296908369475, "loss": 5.0418, "mean_token_accuracy": 0.20251586586236953, "num_tokens": 30918655.0, "step": 14895 }, { "entropy": 5.429618644714355, "epoch": 1.3515965166908563, "grad_norm": 0.99609375, "learning_rate": 0.00048226037841153104, "loss": 5.0461, "mean_token_accuracy": 0.20045506954193115, "num_tokens": 30929188.0, "step": 14900 }, { "entropy": 5.479700326919556, "epoch": 1.3520500725689404, "grad_norm": 1.1171875, "learning_rate": 0.0004822477834531698, "loss": 5.1245, "mean_token_accuracy": 0.19964405596256257, "num_tokens": 30939902.0, "step": 14905 }, { "entropy": 5.485004711151123, "epoch": 1.3525036284470247, "grad_norm": 1.03125, "learning_rate": 0.0004822351842088716, "loss": 5.0292, "mean_token_accuracy": 0.20128275007009505, "num_tokens": 30951289.0, "step": 14910 }, { "entropy": 5.554483938217163, "epoch": 1.352957184325109, "grad_norm": 1.0078125, "learning_rate": 0.0004822225806788969, "loss": 5.1911, "mean_token_accuracy": 0.18752760589122772, "num_tokens": 30961233.0, "step": 14915 }, { "entropy": 5.470905351638794, "epoch": 1.353410740203193, "grad_norm": 0.98046875, "learning_rate": 0.00048220997286350654, "loss": 5.0064, "mean_token_accuracy": 0.20632905662059783, "num_tokens": 30971922.0, "step": 14920 }, { "entropy": 5.432500791549683, "epoch": 1.3538642960812772, "grad_norm": 1.015625, "learning_rate": 0.00048219736076296114, "loss": 5.0407, "mean_token_accuracy": 0.20198279917240142, "num_tokens": 30981358.0, "step": 14925 }, { "entropy": 5.508542013168335, "epoch": 1.3543178519593613, "grad_norm": 1.0390625, "learning_rate": 0.0004821847443775214, "loss": 5.1255, "mean_token_accuracy": 0.19548910856246948, "num_tokens": 30991984.0, "step": 14930 }, { "entropy": 5.48363094329834, "epoch": 1.3547714078374455, "grad_norm": 1.1171875, "learning_rate": 0.00048217212370744853, "loss": 5.012, "mean_token_accuracy": 0.2035112589597702, "num_tokens": 31002790.0, "step": 14935 }, { "entropy": 5.354962682723999, "epoch": 1.3552249637155298, "grad_norm": 1.046875, "learning_rate": 0.00048215949875300327, "loss": 4.901, "mean_token_accuracy": 0.21152547597885132, "num_tokens": 31012827.0, "step": 14940 }, { "entropy": 5.364318990707398, "epoch": 1.3556785195936139, "grad_norm": 1.015625, "learning_rate": 0.0004821468695144467, "loss": 5.0066, "mean_token_accuracy": 0.19802123308181763, "num_tokens": 31023075.0, "step": 14945 }, { "entropy": 5.5149751663208, "epoch": 1.3561320754716981, "grad_norm": 1.0078125, "learning_rate": 0.00048213423599204015, "loss": 5.0758, "mean_token_accuracy": 0.20247676521539687, "num_tokens": 31032454.0, "step": 14950 }, { "entropy": 5.6186676025390625, "epoch": 1.3565856313497822, "grad_norm": 1.046875, "learning_rate": 0.00048212159818604477, "loss": 5.1925, "mean_token_accuracy": 0.1810927450656891, "num_tokens": 31042498.0, "step": 14955 }, { "entropy": 5.4338109493255615, "epoch": 1.3570391872278664, "grad_norm": 1.0078125, "learning_rate": 0.000482108956096722, "loss": 5.0364, "mean_token_accuracy": 0.1993908926844597, "num_tokens": 31053188.0, "step": 14960 }, { "entropy": 5.442950296401977, "epoch": 1.3574927431059507, "grad_norm": 1.2578125, "learning_rate": 0.00048209630972433326, "loss": 5.0307, "mean_token_accuracy": 0.20058060586452484, "num_tokens": 31062840.0, "step": 14965 }, { "entropy": 5.524459314346314, "epoch": 1.357946298984035, "grad_norm": 1.0625, "learning_rate": 0.00048208365906914, "loss": 5.168, "mean_token_accuracy": 0.19421842992305755, "num_tokens": 31072646.0, "step": 14970 }, { "entropy": 5.450298213958741, "epoch": 1.358399854862119, "grad_norm": 1.125, "learning_rate": 0.00048207100413140397, "loss": 4.9871, "mean_token_accuracy": 0.19912175089120865, "num_tokens": 31082700.0, "step": 14975 }, { "entropy": 5.545132780075074, "epoch": 1.3588534107402033, "grad_norm": 1.0, "learning_rate": 0.0004820583449113868, "loss": 5.0835, "mean_token_accuracy": 0.19726261049509047, "num_tokens": 31093743.0, "step": 14980 }, { "entropy": 5.483267974853516, "epoch": 1.3593069666182873, "grad_norm": 1.2265625, "learning_rate": 0.00048204568140935023, "loss": 5.0115, "mean_token_accuracy": 0.20355513095855712, "num_tokens": 31104293.0, "step": 14985 }, { "entropy": 5.392659854888916, "epoch": 1.3597605224963716, "grad_norm": 1.0625, "learning_rate": 0.0004820330136255563, "loss": 5.0478, "mean_token_accuracy": 0.20134875327348709, "num_tokens": 31114244.0, "step": 14990 }, { "entropy": 5.4197766304016115, "epoch": 1.3602140783744558, "grad_norm": 1.0625, "learning_rate": 0.00048202034156026683, "loss": 5.0153, "mean_token_accuracy": 0.19811320751905442, "num_tokens": 31123596.0, "step": 14995 }, { "entropy": 5.513525199890137, "epoch": 1.36066763425254, "grad_norm": 0.94921875, "learning_rate": 0.00048200766521374396, "loss": 5.0825, "mean_token_accuracy": 0.18835832476615905, "num_tokens": 31134258.0, "step": 15000 }, { "epoch": 1.36066763425254, "eval_entropy": 5.275724767451912, "eval_loss": 5.111834526062012, "eval_mean_token_accuracy": 0.20582324026902607, "eval_num_tokens": 31134258.0, "eval_runtime": 20.6029, "eval_samples_per_second": 1716.262, "eval_steps_per_second": 214.533, "step": 15000 }, { "entropy": 5.456406593322754, "epoch": 1.3611211901306242, "grad_norm": 0.96484375, "learning_rate": 0.0004819949845862498, "loss": 5.0653, "mean_token_accuracy": 0.20120365917682648, "num_tokens": 31144806.0, "step": 15005 }, { "entropy": 5.505934858322144, "epoch": 1.3615747460087082, "grad_norm": 0.921875, "learning_rate": 0.0004819822996780466, "loss": 5.1438, "mean_token_accuracy": 0.19504766017198563, "num_tokens": 31155642.0, "step": 15010 }, { "entropy": 5.507110118865967, "epoch": 1.3620283018867925, "grad_norm": 1.1015625, "learning_rate": 0.0004819696104893967, "loss": 4.9994, "mean_token_accuracy": 0.20176680386066437, "num_tokens": 31165034.0, "step": 15015 }, { "entropy": 5.468253564834595, "epoch": 1.3624818577648767, "grad_norm": 0.9453125, "learning_rate": 0.0004819569170205625, "loss": 5.0514, "mean_token_accuracy": 0.19909994155168534, "num_tokens": 31176491.0, "step": 15020 }, { "entropy": 5.488339900970459, "epoch": 1.3629354136429608, "grad_norm": 1.0390625, "learning_rate": 0.00048194421927180654, "loss": 5.068, "mean_token_accuracy": 0.19485954642295839, "num_tokens": 31186198.0, "step": 15025 }, { "entropy": 5.518307781219482, "epoch": 1.363388969521045, "grad_norm": 0.98828125, "learning_rate": 0.0004819315172433914, "loss": 5.0467, "mean_token_accuracy": 0.20029103010892868, "num_tokens": 31197094.0, "step": 15030 }, { "entropy": 5.494000768661499, "epoch": 1.363842525399129, "grad_norm": 0.98046875, "learning_rate": 0.00048191881093557977, "loss": 5.0799, "mean_token_accuracy": 0.19154375940561294, "num_tokens": 31207505.0, "step": 15035 }, { "entropy": 5.5333664894104, "epoch": 1.3642960812772134, "grad_norm": 1.015625, "learning_rate": 0.00048190610034863434, "loss": 5.1862, "mean_token_accuracy": 0.19173948913812638, "num_tokens": 31218809.0, "step": 15040 }, { "entropy": 5.508054113388061, "epoch": 1.3647496371552976, "grad_norm": 0.96875, "learning_rate": 0.0004818933854828181, "loss": 5.1105, "mean_token_accuracy": 0.1877943217754364, "num_tokens": 31230281.0, "step": 15045 }, { "entropy": 5.43084864616394, "epoch": 1.3652031930333817, "grad_norm": 1.109375, "learning_rate": 0.0004818806663383939, "loss": 4.9882, "mean_token_accuracy": 0.20633529424667357, "num_tokens": 31239573.0, "step": 15050 }, { "entropy": 5.463028526306152, "epoch": 1.365656748911466, "grad_norm": 1.0078125, "learning_rate": 0.0004818679429156248, "loss": 5.028, "mean_token_accuracy": 0.19652057439088821, "num_tokens": 31249671.0, "step": 15055 }, { "entropy": 5.4452272891998295, "epoch": 1.36611030478955, "grad_norm": 1.0, "learning_rate": 0.00048185521521477385, "loss": 5.0508, "mean_token_accuracy": 0.19330381453037263, "num_tokens": 31259601.0, "step": 15060 }, { "entropy": 5.439665651321411, "epoch": 1.3665638606676342, "grad_norm": 1.0234375, "learning_rate": 0.0004818424832361044, "loss": 5.016, "mean_token_accuracy": 0.20150518268346787, "num_tokens": 31269085.0, "step": 15065 }, { "entropy": 5.419748544692993, "epoch": 1.3670174165457185, "grad_norm": 1.015625, "learning_rate": 0.0004818297469798797, "loss": 5.0592, "mean_token_accuracy": 0.19574157893657684, "num_tokens": 31280177.0, "step": 15070 }, { "entropy": 5.5028900623321535, "epoch": 1.3674709724238026, "grad_norm": 0.984375, "learning_rate": 0.00048181700644636314, "loss": 4.9727, "mean_token_accuracy": 0.2023068070411682, "num_tokens": 31290545.0, "step": 15075 }, { "entropy": 5.394643783569336, "epoch": 1.3679245283018868, "grad_norm": 1.0078125, "learning_rate": 0.00048180426163581816, "loss": 4.9101, "mean_token_accuracy": 0.21144856065511702, "num_tokens": 31301143.0, "step": 15080 }, { "entropy": 5.434935140609741, "epoch": 1.3683780841799709, "grad_norm": 1.0234375, "learning_rate": 0.0004817915125485083, "loss": 5.0074, "mean_token_accuracy": 0.20205068588256836, "num_tokens": 31311071.0, "step": 15085 }, { "entropy": 5.510846424102783, "epoch": 1.3688316400580551, "grad_norm": 0.99609375, "learning_rate": 0.00048177875918469735, "loss": 5.113, "mean_token_accuracy": 0.19890975058078766, "num_tokens": 31322263.0, "step": 15090 }, { "entropy": 5.495527935028076, "epoch": 1.3692851959361394, "grad_norm": 1.0625, "learning_rate": 0.00048176600154464897, "loss": 5.0074, "mean_token_accuracy": 0.201681686937809, "num_tokens": 31332975.0, "step": 15095 }, { "entropy": 5.548653268814087, "epoch": 1.3697387518142234, "grad_norm": 1.0390625, "learning_rate": 0.0004817532396286269, "loss": 5.1204, "mean_token_accuracy": 0.1935277834534645, "num_tokens": 31345252.0, "step": 15100 }, { "entropy": 5.489936208724975, "epoch": 1.3701923076923077, "grad_norm": 1.0859375, "learning_rate": 0.0004817404734368952, "loss": 4.9904, "mean_token_accuracy": 0.21002684384584427, "num_tokens": 31355479.0, "step": 15105 }, { "entropy": 5.509968948364258, "epoch": 1.3706458635703918, "grad_norm": 0.96875, "learning_rate": 0.00048172770296971785, "loss": 5.124, "mean_token_accuracy": 0.19348738938570023, "num_tokens": 31366020.0, "step": 15110 }, { "entropy": 5.490027999877929, "epoch": 1.371099419448476, "grad_norm": 0.9609375, "learning_rate": 0.0004817149282273589, "loss": 5.0569, "mean_token_accuracy": 0.20011508613824844, "num_tokens": 31376055.0, "step": 15115 }, { "entropy": 5.490016269683838, "epoch": 1.3715529753265603, "grad_norm": 1.0234375, "learning_rate": 0.0004817021492100825, "loss": 5.1669, "mean_token_accuracy": 0.1912306636571884, "num_tokens": 31386179.0, "step": 15120 }, { "entropy": 5.437982177734375, "epoch": 1.3720065312046443, "grad_norm": 1.015625, "learning_rate": 0.000481689365918153, "loss": 4.9713, "mean_token_accuracy": 0.20575360506772994, "num_tokens": 31395850.0, "step": 15125 }, { "entropy": 5.469276380538941, "epoch": 1.3724600870827286, "grad_norm": 1.0390625, "learning_rate": 0.0004816765783518348, "loss": 4.9244, "mean_token_accuracy": 0.2126341849565506, "num_tokens": 31405053.0, "step": 15130 }, { "entropy": 5.424975299835205, "epoch": 1.3729136429608126, "grad_norm": 1.0546875, "learning_rate": 0.0004816637865113923, "loss": 4.9868, "mean_token_accuracy": 0.2035997673869133, "num_tokens": 31415153.0, "step": 15135 }, { "entropy": 5.450738382339478, "epoch": 1.373367198838897, "grad_norm": 0.984375, "learning_rate": 0.00048165099039708994, "loss": 5.0448, "mean_token_accuracy": 0.1943662479519844, "num_tokens": 31425451.0, "step": 15140 }, { "entropy": 5.429855871200561, "epoch": 1.3738207547169812, "grad_norm": 1.03125, "learning_rate": 0.0004816381900091925, "loss": 5.0263, "mean_token_accuracy": 0.19575783163309096, "num_tokens": 31436298.0, "step": 15145 }, { "entropy": 5.482528924942017, "epoch": 1.3742743105950654, "grad_norm": 1.0, "learning_rate": 0.00048162538534796465, "loss": 5.0497, "mean_token_accuracy": 0.2034153923392296, "num_tokens": 31446932.0, "step": 15150 }, { "entropy": 5.5162004947662355, "epoch": 1.3747278664731495, "grad_norm": 1.0703125, "learning_rate": 0.0004816125764136711, "loss": 5.0866, "mean_token_accuracy": 0.18720396608114243, "num_tokens": 31457582.0, "step": 15155 }, { "entropy": 5.542390441894531, "epoch": 1.3751814223512338, "grad_norm": 1.0078125, "learning_rate": 0.0004815997632065769, "loss": 5.0513, "mean_token_accuracy": 0.19751511067152022, "num_tokens": 31468168.0, "step": 15160 }, { "entropy": 5.435163164138794, "epoch": 1.3756349782293178, "grad_norm": 1.0703125, "learning_rate": 0.00048158694572694694, "loss": 5.0422, "mean_token_accuracy": 0.20532604455947875, "num_tokens": 31478524.0, "step": 15165 }, { "entropy": 5.4072364330291744, "epoch": 1.376088534107402, "grad_norm": 1.0234375, "learning_rate": 0.00048157412397504623, "loss": 5.0091, "mean_token_accuracy": 0.20544958263635635, "num_tokens": 31488608.0, "step": 15170 }, { "entropy": 5.451086902618409, "epoch": 1.3765420899854863, "grad_norm": 0.98828125, "learning_rate": 0.0004815612979511401, "loss": 5.0447, "mean_token_accuracy": 0.20353641360998154, "num_tokens": 31498984.0, "step": 15175 }, { "entropy": 5.523633098602295, "epoch": 1.3769956458635704, "grad_norm": 1.015625, "learning_rate": 0.00048154846765549353, "loss": 5.0453, "mean_token_accuracy": 0.20317785888910295, "num_tokens": 31509110.0, "step": 15180 }, { "entropy": 5.476151084899902, "epoch": 1.3774492017416546, "grad_norm": 1.046875, "learning_rate": 0.00048153563308837215, "loss": 5.0368, "mean_token_accuracy": 0.20274375528097152, "num_tokens": 31519266.0, "step": 15185 }, { "entropy": 5.4552610397338865, "epoch": 1.3779027576197387, "grad_norm": 0.9921875, "learning_rate": 0.00048152279425004124, "loss": 5.0538, "mean_token_accuracy": 0.20143594443798066, "num_tokens": 31529043.0, "step": 15190 }, { "entropy": 5.483608388900757, "epoch": 1.378356313497823, "grad_norm": 1.046875, "learning_rate": 0.0004815099511407663, "loss": 5.0393, "mean_token_accuracy": 0.2035144805908203, "num_tokens": 31538650.0, "step": 15195 }, { "entropy": 5.400378751754761, "epoch": 1.3788098693759072, "grad_norm": 0.9453125, "learning_rate": 0.000481497103760813, "loss": 4.9856, "mean_token_accuracy": 0.20239569693803788, "num_tokens": 31549392.0, "step": 15200 }, { "entropy": 5.51238226890564, "epoch": 1.3792634252539913, "grad_norm": 1.0078125, "learning_rate": 0.00048148425211044684, "loss": 5.1609, "mean_token_accuracy": 0.18882282227277755, "num_tokens": 31559999.0, "step": 15205 }, { "entropy": 5.533956813812256, "epoch": 1.3797169811320755, "grad_norm": 1.0703125, "learning_rate": 0.0004814713961899338, "loss": 5.0553, "mean_token_accuracy": 0.19863239973783492, "num_tokens": 31570108.0, "step": 15210 }, { "entropy": 5.471551513671875, "epoch": 1.3801705370101596, "grad_norm": 0.98828125, "learning_rate": 0.00048145853599953966, "loss": 5.0164, "mean_token_accuracy": 0.1964831069111824, "num_tokens": 31579698.0, "step": 15215 }, { "entropy": 5.4328672885894775, "epoch": 1.3806240928882438, "grad_norm": 1.03125, "learning_rate": 0.00048144567153953036, "loss": 5.0713, "mean_token_accuracy": 0.19548798054456712, "num_tokens": 31589292.0, "step": 15220 }, { "entropy": 5.529256439208984, "epoch": 1.381077648766328, "grad_norm": 1.046875, "learning_rate": 0.00048143280281017197, "loss": 5.1392, "mean_token_accuracy": 0.194683501124382, "num_tokens": 31599848.0, "step": 15225 }, { "entropy": 5.525971078872681, "epoch": 1.3815312046444121, "grad_norm": 1.0390625, "learning_rate": 0.0004814199298117307, "loss": 5.0865, "mean_token_accuracy": 0.20013927072286605, "num_tokens": 31611109.0, "step": 15230 }, { "entropy": 5.412837266921997, "epoch": 1.3819847605224964, "grad_norm": 1.0, "learning_rate": 0.00048140705254447256, "loss": 4.9897, "mean_token_accuracy": 0.20205961763858796, "num_tokens": 31621140.0, "step": 15235 }, { "entropy": 5.52912654876709, "epoch": 1.3824383164005805, "grad_norm": 1.015625, "learning_rate": 0.00048139417100866405, "loss": 5.0911, "mean_token_accuracy": 0.1939746081829071, "num_tokens": 31631268.0, "step": 15240 }, { "entropy": 5.528049659729004, "epoch": 1.3828918722786647, "grad_norm": 0.9453125, "learning_rate": 0.00048138128520457146, "loss": 5.0372, "mean_token_accuracy": 0.19948768615722656, "num_tokens": 31640758.0, "step": 15245 }, { "entropy": 5.4472252368927006, "epoch": 1.383345428156749, "grad_norm": 1.09375, "learning_rate": 0.0004813683951324613, "loss": 5.0599, "mean_token_accuracy": 0.19628065526485444, "num_tokens": 31651060.0, "step": 15250 }, { "entropy": 5.495986890792847, "epoch": 1.383798984034833, "grad_norm": 1.0, "learning_rate": 0.00048135550079260014, "loss": 5.1384, "mean_token_accuracy": 0.19810788631439208, "num_tokens": 31662282.0, "step": 15255 }, { "entropy": 5.462776374816895, "epoch": 1.3842525399129173, "grad_norm": 0.95703125, "learning_rate": 0.0004813426021852547, "loss": 5.009, "mean_token_accuracy": 0.19480444192886354, "num_tokens": 31672364.0, "step": 15260 }, { "entropy": 5.481860637664795, "epoch": 1.3847060957910013, "grad_norm": 1.046875, "learning_rate": 0.00048132969931069156, "loss": 5.0597, "mean_token_accuracy": 0.19527684450149535, "num_tokens": 31683094.0, "step": 15265 }, { "entropy": 5.486013317108155, "epoch": 1.3851596516690856, "grad_norm": 1.078125, "learning_rate": 0.0004813167921691777, "loss": 5.035, "mean_token_accuracy": 0.20312470048666, "num_tokens": 31693087.0, "step": 15270 }, { "entropy": 5.480851173400879, "epoch": 1.3856132075471699, "grad_norm": 1.078125, "learning_rate": 0.00048130388076098003, "loss": 5.0259, "mean_token_accuracy": 0.19591172337532042, "num_tokens": 31703708.0, "step": 15275 }, { "entropy": 5.413898563385009, "epoch": 1.386066763425254, "grad_norm": 1.0390625, "learning_rate": 0.00048129096508636547, "loss": 4.9689, "mean_token_accuracy": 0.20569125115871428, "num_tokens": 31713640.0, "step": 15280 }, { "entropy": 5.476882982254028, "epoch": 1.3865203193033382, "grad_norm": 1.078125, "learning_rate": 0.00048127804514560126, "loss": 5.0702, "mean_token_accuracy": 0.19898393005132675, "num_tokens": 31723526.0, "step": 15285 }, { "entropy": 5.417530298233032, "epoch": 1.3869738751814222, "grad_norm": 1.0625, "learning_rate": 0.00048126512093895447, "loss": 4.9925, "mean_token_accuracy": 0.20380101948976517, "num_tokens": 31733265.0, "step": 15290 }, { "entropy": 5.482056903839111, "epoch": 1.3874274310595065, "grad_norm": 0.94921875, "learning_rate": 0.0004812521924666925, "loss": 4.9968, "mean_token_accuracy": 0.20224116146564483, "num_tokens": 31743832.0, "step": 15295 }, { "entropy": 5.508058977127075, "epoch": 1.3878809869375908, "grad_norm": 1.015625, "learning_rate": 0.0004812392597290825, "loss": 5.0582, "mean_token_accuracy": 0.21130288690328597, "num_tokens": 31754443.0, "step": 15300 }, { "entropy": 5.400997304916382, "epoch": 1.3883345428156748, "grad_norm": 1.0, "learning_rate": 0.0004812263227263921, "loss": 5.0241, "mean_token_accuracy": 0.19950023740530015, "num_tokens": 31765304.0, "step": 15305 }, { "entropy": 5.395258903503418, "epoch": 1.388788098693759, "grad_norm": 1.046875, "learning_rate": 0.0004812133814588888, "loss": 5.0624, "mean_token_accuracy": 0.19518595784902573, "num_tokens": 31775809.0, "step": 15310 }, { "entropy": 5.463767671585083, "epoch": 1.3892416545718431, "grad_norm": 1.0546875, "learning_rate": 0.0004812004359268402, "loss": 5.0341, "mean_token_accuracy": 0.20550617277622224, "num_tokens": 31786271.0, "step": 15315 }, { "entropy": 5.524199151992798, "epoch": 1.3896952104499274, "grad_norm": 0.953125, "learning_rate": 0.0004811874861305141, "loss": 5.0928, "mean_token_accuracy": 0.20250213742256165, "num_tokens": 31797358.0, "step": 15320 }, { "entropy": 5.477554082870483, "epoch": 1.3901487663280117, "grad_norm": 0.9765625, "learning_rate": 0.0004811745320701782, "loss": 5.005, "mean_token_accuracy": 0.20689014941453934, "num_tokens": 31808303.0, "step": 15325 }, { "entropy": 5.406842136383057, "epoch": 1.390602322206096, "grad_norm": 0.99609375, "learning_rate": 0.0004811615737461004, "loss": 5.0166, "mean_token_accuracy": 0.20240322798490523, "num_tokens": 31818837.0, "step": 15330 }, { "entropy": 5.503112363815307, "epoch": 1.39105587808418, "grad_norm": 1.0546875, "learning_rate": 0.00048114861115854877, "loss": 5.0376, "mean_token_accuracy": 0.19811082929372786, "num_tokens": 31829729.0, "step": 15335 }, { "entropy": 5.46115345954895, "epoch": 1.3915094339622642, "grad_norm": 0.9921875, "learning_rate": 0.00048113564430779136, "loss": 4.9801, "mean_token_accuracy": 0.19977615475654603, "num_tokens": 31839996.0, "step": 15340 }, { "entropy": 5.373750066757202, "epoch": 1.3919629898403483, "grad_norm": 0.96484375, "learning_rate": 0.0004811226731940962, "loss": 4.9753, "mean_token_accuracy": 0.20393562465906143, "num_tokens": 31850298.0, "step": 15345 }, { "entropy": 5.4442449569702145, "epoch": 1.3924165457184325, "grad_norm": 0.96484375, "learning_rate": 0.00048110969781773173, "loss": 5.0661, "mean_token_accuracy": 0.2088144063949585, "num_tokens": 31862170.0, "step": 15350 }, { "entropy": 5.551015758514405, "epoch": 1.3928701015965168, "grad_norm": 1.0703125, "learning_rate": 0.00048109671817896614, "loss": 5.1045, "mean_token_accuracy": 0.19858555495738983, "num_tokens": 31872081.0, "step": 15355 }, { "entropy": 5.462356090545654, "epoch": 1.3933236574746009, "grad_norm": 0.98046875, "learning_rate": 0.00048108373427806797, "loss": 5.043, "mean_token_accuracy": 0.2021666869521141, "num_tokens": 31882715.0, "step": 15360 }, { "entropy": 5.470950031280518, "epoch": 1.3937772133526851, "grad_norm": 1.109375, "learning_rate": 0.00048107074611530555, "loss": 5.0286, "mean_token_accuracy": 0.2057737648487091, "num_tokens": 31891925.0, "step": 15365 }, { "entropy": 5.505783176422119, "epoch": 1.3942307692307692, "grad_norm": 1.0390625, "learning_rate": 0.00048105775369094756, "loss": 5.0476, "mean_token_accuracy": 0.19917611926794052, "num_tokens": 31902320.0, "step": 15370 }, { "entropy": 5.4439263343811035, "epoch": 1.3946843251088534, "grad_norm": 1.0390625, "learning_rate": 0.0004810447570052628, "loss": 4.9677, "mean_token_accuracy": 0.2073088452219963, "num_tokens": 31912726.0, "step": 15375 }, { "entropy": 5.4545204639434814, "epoch": 1.3951378809869377, "grad_norm": 1.1015625, "learning_rate": 0.00048103175605851997, "loss": 5.0646, "mean_token_accuracy": 0.1981646478176117, "num_tokens": 31924039.0, "step": 15380 }, { "entropy": 5.380268859863281, "epoch": 1.3955914368650217, "grad_norm": 1.0, "learning_rate": 0.0004810187508509879, "loss": 4.9447, "mean_token_accuracy": 0.21212603002786637, "num_tokens": 31933280.0, "step": 15385 }, { "entropy": 5.469443225860596, "epoch": 1.396044992743106, "grad_norm": 1.0, "learning_rate": 0.0004810057413829355, "loss": 5.1515, "mean_token_accuracy": 0.19671646058559417, "num_tokens": 31943182.0, "step": 15390 }, { "entropy": 5.516176080703735, "epoch": 1.39649854862119, "grad_norm": 0.953125, "learning_rate": 0.00048099272765463193, "loss": 5.0792, "mean_token_accuracy": 0.20332831591367723, "num_tokens": 31953256.0, "step": 15395 }, { "entropy": 5.561001348495483, "epoch": 1.3969521044992743, "grad_norm": 1.046875, "learning_rate": 0.0004809797096663463, "loss": 5.1809, "mean_token_accuracy": 0.19255884289741515, "num_tokens": 31964231.0, "step": 15400 }, { "entropy": 5.494784498214722, "epoch": 1.3974056603773586, "grad_norm": 1.109375, "learning_rate": 0.0004809666874183477, "loss": 5.0164, "mean_token_accuracy": 0.1996073842048645, "num_tokens": 31974322.0, "step": 15405 }, { "entropy": 5.449486875534058, "epoch": 1.3978592162554426, "grad_norm": 1.0703125, "learning_rate": 0.0004809536609109056, "loss": 5.0634, "mean_token_accuracy": 0.20428977459669112, "num_tokens": 31984239.0, "step": 15410 }, { "entropy": 5.438951206207276, "epoch": 1.398312772133527, "grad_norm": 1.03125, "learning_rate": 0.00048094063014428925, "loss": 5.0689, "mean_token_accuracy": 0.19528097063302993, "num_tokens": 31994366.0, "step": 15415 }, { "entropy": 5.548461151123047, "epoch": 1.398766328011611, "grad_norm": 0.99609375, "learning_rate": 0.0004809275951187682, "loss": 5.1392, "mean_token_accuracy": 0.19679973125457764, "num_tokens": 32004921.0, "step": 15420 }, { "entropy": 5.449678993225097, "epoch": 1.3992198838896952, "grad_norm": 1.0078125, "learning_rate": 0.00048091455583461204, "loss": 5.0751, "mean_token_accuracy": 0.20041013807058333, "num_tokens": 32016385.0, "step": 15425 }, { "entropy": 5.460604858398438, "epoch": 1.3996734397677795, "grad_norm": 1.0859375, "learning_rate": 0.00048090151229209036, "loss": 5.0646, "mean_token_accuracy": 0.19743129163980483, "num_tokens": 32027398.0, "step": 15430 }, { "entropy": 5.5013045310974125, "epoch": 1.4001269956458635, "grad_norm": 0.99609375, "learning_rate": 0.0004808884644914729, "loss": 5.0638, "mean_token_accuracy": 0.20003216117620468, "num_tokens": 32038326.0, "step": 15435 }, { "entropy": 5.484676790237427, "epoch": 1.4005805515239478, "grad_norm": 1.0703125, "learning_rate": 0.0004808754124330296, "loss": 5.1221, "mean_token_accuracy": 0.19728430211544037, "num_tokens": 32048744.0, "step": 15440 }, { "entropy": 5.480916595458984, "epoch": 1.4010341074020318, "grad_norm": 1.109375, "learning_rate": 0.0004808623561170302, "loss": 4.9932, "mean_token_accuracy": 0.2117033764719963, "num_tokens": 32059133.0, "step": 15445 }, { "entropy": 5.453863954544067, "epoch": 1.401487663280116, "grad_norm": 1.1015625, "learning_rate": 0.0004808492955437449, "loss": 5.0271, "mean_token_accuracy": 0.20180729478597642, "num_tokens": 32069277.0, "step": 15450 }, { "entropy": 5.47017912864685, "epoch": 1.4019412191582004, "grad_norm": 1.03125, "learning_rate": 0.00048083623071344374, "loss": 4.9909, "mean_token_accuracy": 0.20217232257127762, "num_tokens": 32079802.0, "step": 15455 }, { "entropy": 5.472327995300293, "epoch": 1.4023947750362844, "grad_norm": 1.0234375, "learning_rate": 0.00048082316162639685, "loss": 5.1019, "mean_token_accuracy": 0.19852525889873504, "num_tokens": 32090962.0, "step": 15460 }, { "entropy": 5.458762836456299, "epoch": 1.4028483309143687, "grad_norm": 1.0390625, "learning_rate": 0.00048081008828287447, "loss": 5.0714, "mean_token_accuracy": 0.19673923403024673, "num_tokens": 32101058.0, "step": 15465 }, { "entropy": 5.529480838775635, "epoch": 1.4033018867924527, "grad_norm": 1.0078125, "learning_rate": 0.00048079701068314706, "loss": 5.067, "mean_token_accuracy": 0.20346747487783431, "num_tokens": 32111763.0, "step": 15470 }, { "entropy": 5.504124450683594, "epoch": 1.403755442670537, "grad_norm": 1.0078125, "learning_rate": 0.00048078392882748507, "loss": 5.1165, "mean_token_accuracy": 0.19799258857965468, "num_tokens": 32123556.0, "step": 15475 }, { "entropy": 5.4855447769165036, "epoch": 1.4042089985486212, "grad_norm": 1.0390625, "learning_rate": 0.00048077084271615895, "loss": 4.9947, "mean_token_accuracy": 0.20316202342510223, "num_tokens": 32134012.0, "step": 15480 }, { "entropy": 5.389006567001343, "epoch": 1.4046625544267053, "grad_norm": 0.90625, "learning_rate": 0.0004807577523494394, "loss": 4.9911, "mean_token_accuracy": 0.2130587175488472, "num_tokens": 32144540.0, "step": 15485 }, { "entropy": 5.4568949222564695, "epoch": 1.4051161103047896, "grad_norm": 1.0703125, "learning_rate": 0.00048074465772759707, "loss": 5.1083, "mean_token_accuracy": 0.19622644633054734, "num_tokens": 32154655.0, "step": 15490 }, { "entropy": 5.44367094039917, "epoch": 1.4055696661828736, "grad_norm": 1.0, "learning_rate": 0.00048073155885090276, "loss": 4.9845, "mean_token_accuracy": 0.20090605169534684, "num_tokens": 32165191.0, "step": 15495 }, { "entropy": 5.490029430389404, "epoch": 1.4060232220609579, "grad_norm": 1.0078125, "learning_rate": 0.00048071845571962733, "loss": 5.0829, "mean_token_accuracy": 0.19338328689336776, "num_tokens": 32175961.0, "step": 15500 }, { "entropy": 5.523004674911499, "epoch": 1.4064767779390421, "grad_norm": 0.98046875, "learning_rate": 0.0004807053483340419, "loss": 5.0543, "mean_token_accuracy": 0.20064833015203476, "num_tokens": 32187073.0, "step": 15505 }, { "entropy": 5.489319515228272, "epoch": 1.4069303338171264, "grad_norm": 1.046875, "learning_rate": 0.0004806922366944175, "loss": 5.0447, "mean_token_accuracy": 0.20276428312063216, "num_tokens": 32197426.0, "step": 15510 }, { "entropy": 5.542129039764404, "epoch": 1.4073838896952104, "grad_norm": 1.2109375, "learning_rate": 0.00048067912080102513, "loss": 5.0303, "mean_token_accuracy": 0.20442990511655806, "num_tokens": 32206847.0, "step": 15515 }, { "entropy": 5.4296956062316895, "epoch": 1.4078374455732947, "grad_norm": 1.015625, "learning_rate": 0.0004806660006541362, "loss": 5.0558, "mean_token_accuracy": 0.19724748134613038, "num_tokens": 32217647.0, "step": 15520 }, { "entropy": 5.371573066711425, "epoch": 1.4082910014513788, "grad_norm": 0.9765625, "learning_rate": 0.0004806528762540219, "loss": 4.9086, "mean_token_accuracy": 0.21202264577150345, "num_tokens": 32227133.0, "step": 15525 }, { "entropy": 5.496533393859863, "epoch": 1.408744557329463, "grad_norm": 0.9765625, "learning_rate": 0.00048063974760095374, "loss": 5.1022, "mean_token_accuracy": 0.20068910866975784, "num_tokens": 32237378.0, "step": 15530 }, { "entropy": 5.445556259155273, "epoch": 1.4091981132075473, "grad_norm": 1.0078125, "learning_rate": 0.00048062661469520327, "loss": 5.003, "mean_token_accuracy": 0.2052423760294914, "num_tokens": 32247213.0, "step": 15535 }, { "entropy": 5.518263244628907, "epoch": 1.4096516690856313, "grad_norm": 1.0078125, "learning_rate": 0.00048061347753704193, "loss": 5.0724, "mean_token_accuracy": 0.2015862599015236, "num_tokens": 32257100.0, "step": 15540 }, { "entropy": 5.474034023284912, "epoch": 1.4101052249637156, "grad_norm": 1.015625, "learning_rate": 0.0004806003361267415, "loss": 5.0426, "mean_token_accuracy": 0.19485013782978058, "num_tokens": 32267456.0, "step": 15545 }, { "entropy": 5.427051591873169, "epoch": 1.4105587808417996, "grad_norm": 1.140625, "learning_rate": 0.0004805871904645737, "loss": 4.9735, "mean_token_accuracy": 0.20818628072738649, "num_tokens": 32278220.0, "step": 15550 }, { "entropy": 5.4042943000793455, "epoch": 1.411012336719884, "grad_norm": 0.96484375, "learning_rate": 0.0004805740405508103, "loss": 5.0439, "mean_token_accuracy": 0.20270225405693054, "num_tokens": 32289036.0, "step": 15555 }, { "entropy": 5.419226264953613, "epoch": 1.4114658925979682, "grad_norm": 1.1015625, "learning_rate": 0.0004805608863857236, "loss": 4.9856, "mean_token_accuracy": 0.1986078605055809, "num_tokens": 32298909.0, "step": 15560 }, { "entropy": 5.476052188873291, "epoch": 1.4119194484760522, "grad_norm": 1.03125, "learning_rate": 0.00048054772796958517, "loss": 5.0173, "mean_token_accuracy": 0.20129195749759674, "num_tokens": 32309851.0, "step": 15565 }, { "entropy": 5.433191394805908, "epoch": 1.4123730043541365, "grad_norm": 1.078125, "learning_rate": 0.0004805345653026675, "loss": 4.989, "mean_token_accuracy": 0.20712781250476836, "num_tokens": 32319336.0, "step": 15570 }, { "entropy": 5.4757801532745365, "epoch": 1.4128265602322205, "grad_norm": 1.015625, "learning_rate": 0.00048052139838524263, "loss": 5.034, "mean_token_accuracy": 0.20390822142362594, "num_tokens": 32329898.0, "step": 15575 }, { "entropy": 5.436186265945435, "epoch": 1.4132801161103048, "grad_norm": 0.984375, "learning_rate": 0.00048050822721758274, "loss": 4.927, "mean_token_accuracy": 0.1992727115750313, "num_tokens": 32340100.0, "step": 15580 }, { "entropy": 5.454240322113037, "epoch": 1.413733671988389, "grad_norm": 0.9921875, "learning_rate": 0.0004804950517999604, "loss": 5.0396, "mean_token_accuracy": 0.1967187151312828, "num_tokens": 32349663.0, "step": 15585 }, { "entropy": 5.503654623031617, "epoch": 1.414187227866473, "grad_norm": 1.0078125, "learning_rate": 0.0004804818721326481, "loss": 5.069, "mean_token_accuracy": 0.2061235189437866, "num_tokens": 32360461.0, "step": 15590 }, { "entropy": 5.490416049957275, "epoch": 1.4146407837445574, "grad_norm": 1.03125, "learning_rate": 0.0004804686882159183, "loss": 5.0824, "mean_token_accuracy": 0.19882456213235855, "num_tokens": 32370910.0, "step": 15595 }, { "entropy": 5.500588846206665, "epoch": 1.4150943396226414, "grad_norm": 1.1640625, "learning_rate": 0.00048045550005004355, "loss": 5.0829, "mean_token_accuracy": 0.20531621873378753, "num_tokens": 32381669.0, "step": 15600 }, { "entropy": 5.435694789886474, "epoch": 1.4155478955007257, "grad_norm": 1.0546875, "learning_rate": 0.0004804423076352968, "loss": 5.0115, "mean_token_accuracy": 0.20064838975667953, "num_tokens": 32392024.0, "step": 15605 }, { "entropy": 5.399255847930908, "epoch": 1.41600145137881, "grad_norm": 1.0234375, "learning_rate": 0.00048042911097195075, "loss": 5.0247, "mean_token_accuracy": 0.20648539066314697, "num_tokens": 32401872.0, "step": 15610 }, { "entropy": 5.384214258193969, "epoch": 1.416455007256894, "grad_norm": 0.96484375, "learning_rate": 0.0004804159100602784, "loss": 4.9693, "mean_token_accuracy": 0.2077912986278534, "num_tokens": 32411749.0, "step": 15615 }, { "entropy": 5.557152605056762, "epoch": 1.4169085631349783, "grad_norm": 0.9921875, "learning_rate": 0.00048040270490055264, "loss": 5.1548, "mean_token_accuracy": 0.19015388786792756, "num_tokens": 32421358.0, "step": 15620 }, { "entropy": 5.519060230255127, "epoch": 1.4173621190130623, "grad_norm": 0.9609375, "learning_rate": 0.0004803894954930465, "loss": 5.0508, "mean_token_accuracy": 0.19911952018737794, "num_tokens": 32432322.0, "step": 15625 }, { "entropy": 5.472004652023315, "epoch": 1.4178156748911466, "grad_norm": 1.09375, "learning_rate": 0.0004803762818380334, "loss": 5.0694, "mean_token_accuracy": 0.19749792218208312, "num_tokens": 32440930.0, "step": 15630 }, { "entropy": 5.486641693115234, "epoch": 1.4182692307692308, "grad_norm": 1.015625, "learning_rate": 0.00048036306393578644, "loss": 5.0702, "mean_token_accuracy": 0.19684210419654846, "num_tokens": 32451124.0, "step": 15635 }, { "entropy": 5.513130187988281, "epoch": 1.4187227866473149, "grad_norm": 0.99609375, "learning_rate": 0.0004803498417865789, "loss": 5.0444, "mean_token_accuracy": 0.20012172907590867, "num_tokens": 32460636.0, "step": 15640 }, { "entropy": 5.513883113861084, "epoch": 1.4191763425253991, "grad_norm": 1.046875, "learning_rate": 0.0004803366153906844, "loss": 5.0866, "mean_token_accuracy": 0.1964539885520935, "num_tokens": 32470501.0, "step": 15645 }, { "entropy": 5.506065940856933, "epoch": 1.4196298984034832, "grad_norm": 0.99609375, "learning_rate": 0.0004803233847483763, "loss": 5.1449, "mean_token_accuracy": 0.19621914476156235, "num_tokens": 32481559.0, "step": 15650 }, { "entropy": 5.58727011680603, "epoch": 1.4200834542815675, "grad_norm": 1.015625, "learning_rate": 0.00048031014985992825, "loss": 5.2193, "mean_token_accuracy": 0.1937747061252594, "num_tokens": 32493000.0, "step": 15655 }, { "entropy": 5.50272855758667, "epoch": 1.4205370101596517, "grad_norm": 1.0546875, "learning_rate": 0.000480296910725614, "loss": 5.016, "mean_token_accuracy": 0.2094208136200905, "num_tokens": 32502773.0, "step": 15660 }, { "entropy": 5.4724994659423825, "epoch": 1.4209905660377358, "grad_norm": 1.03125, "learning_rate": 0.0004802836673457074, "loss": 5.114, "mean_token_accuracy": 0.1955271691083908, "num_tokens": 32513430.0, "step": 15665 }, { "entropy": 5.415779685974121, "epoch": 1.42144412191582, "grad_norm": 0.97265625, "learning_rate": 0.00048027041972048225, "loss": 5.014, "mean_token_accuracy": 0.20310366600751878, "num_tokens": 32524409.0, "step": 15670 }, { "entropy": 5.523543453216552, "epoch": 1.421897677793904, "grad_norm": 1.015625, "learning_rate": 0.0004802571678502124, "loss": 5.0637, "mean_token_accuracy": 0.19521717131137847, "num_tokens": 32534696.0, "step": 15675 }, { "entropy": 5.557691240310669, "epoch": 1.4223512336719883, "grad_norm": 0.921875, "learning_rate": 0.000480243911735172, "loss": 5.0458, "mean_token_accuracy": 0.20486830770969391, "num_tokens": 32544782.0, "step": 15680 }, { "entropy": 5.4342268943786625, "epoch": 1.4228047895500726, "grad_norm": 1.046875, "learning_rate": 0.00048023065137563534, "loss": 5.0496, "mean_token_accuracy": 0.1975138857960701, "num_tokens": 32554818.0, "step": 15685 }, { "entropy": 5.446495103836059, "epoch": 1.4232583454281569, "grad_norm": 1.015625, "learning_rate": 0.0004802173867718764, "loss": 5.0916, "mean_token_accuracy": 0.19939793050289153, "num_tokens": 32565007.0, "step": 15690 }, { "entropy": 5.508305311203003, "epoch": 1.423711901306241, "grad_norm": 0.94921875, "learning_rate": 0.0004802041179241697, "loss": 5.0222, "mean_token_accuracy": 0.20239437520503997, "num_tokens": 32575657.0, "step": 15695 }, { "entropy": 5.482709550857544, "epoch": 1.4241654571843252, "grad_norm": 0.93359375, "learning_rate": 0.0004801908448327895, "loss": 5.0802, "mean_token_accuracy": 0.19548770189285278, "num_tokens": 32586676.0, "step": 15700 }, { "entropy": 5.481083011627197, "epoch": 1.4246190130624092, "grad_norm": 1.015625, "learning_rate": 0.0004801775674980103, "loss": 5.0281, "mean_token_accuracy": 0.2019490569829941, "num_tokens": 32596191.0, "step": 15705 }, { "entropy": 5.517948341369629, "epoch": 1.4250725689404935, "grad_norm": 1.078125, "learning_rate": 0.00048016428592010676, "loss": 5.0849, "mean_token_accuracy": 0.1982520654797554, "num_tokens": 32607178.0, "step": 15710 }, { "entropy": 5.50854721069336, "epoch": 1.4255261248185778, "grad_norm": 1.046875, "learning_rate": 0.00048015100009935347, "loss": 5.019, "mean_token_accuracy": 0.20194409042596817, "num_tokens": 32617301.0, "step": 15715 }, { "entropy": 5.397899341583252, "epoch": 1.4259796806966618, "grad_norm": 1.015625, "learning_rate": 0.0004801377100360253, "loss": 5.0129, "mean_token_accuracy": 0.20444879978895186, "num_tokens": 32627395.0, "step": 15720 }, { "entropy": 5.425991058349609, "epoch": 1.426433236574746, "grad_norm": 0.953125, "learning_rate": 0.000480124415730397, "loss": 5.0305, "mean_token_accuracy": 0.20138730853796005, "num_tokens": 32638460.0, "step": 15725 }, { "entropy": 5.538776016235351, "epoch": 1.4268867924528301, "grad_norm": 1.03125, "learning_rate": 0.0004801111171827434, "loss": 5.0948, "mean_token_accuracy": 0.19654250293970107, "num_tokens": 32649319.0, "step": 15730 }, { "entropy": 5.501091003417969, "epoch": 1.4273403483309144, "grad_norm": 1.03125, "learning_rate": 0.0004800978143933398, "loss": 5.0367, "mean_token_accuracy": 0.20251665711402894, "num_tokens": 32659976.0, "step": 15735 }, { "entropy": 5.428359079360962, "epoch": 1.4277939042089987, "grad_norm": 1.0625, "learning_rate": 0.00048008450736246094, "loss": 4.9659, "mean_token_accuracy": 0.19979297667741774, "num_tokens": 32670772.0, "step": 15740 }, { "entropy": 5.4992910861969, "epoch": 1.4282474600870827, "grad_norm": 0.9375, "learning_rate": 0.00048007119609038237, "loss": 5.1025, "mean_token_accuracy": 0.19040610939264296, "num_tokens": 32682368.0, "step": 15745 }, { "entropy": 5.393808746337891, "epoch": 1.428701015965167, "grad_norm": 1.0390625, "learning_rate": 0.00048005788057737907, "loss": 4.9348, "mean_token_accuracy": 0.20572381764650344, "num_tokens": 32692649.0, "step": 15750 }, { "entropy": 5.491480875015259, "epoch": 1.429154571843251, "grad_norm": 1.0078125, "learning_rate": 0.0004800445608237266, "loss": 5.1442, "mean_token_accuracy": 0.20096337646245957, "num_tokens": 32704075.0, "step": 15755 }, { "entropy": 5.547732925415039, "epoch": 1.4296081277213353, "grad_norm": 1.0625, "learning_rate": 0.00048003123682970045, "loss": 5.1663, "mean_token_accuracy": 0.1921308755874634, "num_tokens": 32714670.0, "step": 15760 }, { "entropy": 5.468905401229859, "epoch": 1.4300616835994195, "grad_norm": 1.0234375, "learning_rate": 0.00048001790859557596, "loss": 4.9892, "mean_token_accuracy": 0.21046035885810851, "num_tokens": 32724601.0, "step": 15765 }, { "entropy": 5.418109798431397, "epoch": 1.4305152394775036, "grad_norm": 1.0234375, "learning_rate": 0.0004800045761216289, "loss": 4.9591, "mean_token_accuracy": 0.20541216880083085, "num_tokens": 32735015.0, "step": 15770 }, { "entropy": 5.4703583240509035, "epoch": 1.4309687953555879, "grad_norm": 1.0390625, "learning_rate": 0.000479991239408135, "loss": 5.045, "mean_token_accuracy": 0.20821180194616318, "num_tokens": 32745899.0, "step": 15775 }, { "entropy": 5.461346435546875, "epoch": 1.431422351233672, "grad_norm": 1.046875, "learning_rate": 0.00047997789845537003, "loss": 5.0153, "mean_token_accuracy": 0.20634830445051194, "num_tokens": 32756052.0, "step": 15780 }, { "entropy": 5.3901145458221436, "epoch": 1.4318759071117562, "grad_norm": 0.953125, "learning_rate": 0.0004799645532636098, "loss": 5.0034, "mean_token_accuracy": 0.20348911136388778, "num_tokens": 32767118.0, "step": 15785 }, { "entropy": 5.40638279914856, "epoch": 1.4323294629898404, "grad_norm": 1.0625, "learning_rate": 0.00047995120383313044, "loss": 4.8862, "mean_token_accuracy": 0.21329449415206908, "num_tokens": 32777069.0, "step": 15790 }, { "entropy": 5.486865758895874, "epoch": 1.4327830188679245, "grad_norm": 1.0078125, "learning_rate": 0.00047993785016420796, "loss": 5.1306, "mean_token_accuracy": 0.1897103577852249, "num_tokens": 32786967.0, "step": 15795 }, { "entropy": 5.473412895202637, "epoch": 1.4332365747460087, "grad_norm": 1.03125, "learning_rate": 0.00047992449225711854, "loss": 5.0111, "mean_token_accuracy": 0.20178884714841844, "num_tokens": 32797563.0, "step": 15800 }, { "entropy": 5.470533037185669, "epoch": 1.4336901306240928, "grad_norm": 0.90234375, "learning_rate": 0.00047991113011213837, "loss": 4.9736, "mean_token_accuracy": 0.20526070892810822, "num_tokens": 32808730.0, "step": 15805 }, { "entropy": 5.418741655349732, "epoch": 1.434143686502177, "grad_norm": 1.078125, "learning_rate": 0.0004798977637295438, "loss": 4.9915, "mean_token_accuracy": 0.20455852299928665, "num_tokens": 32818050.0, "step": 15810 }, { "entropy": 5.436024475097656, "epoch": 1.4345972423802613, "grad_norm": 0.98828125, "learning_rate": 0.0004798843931096113, "loss": 5.0085, "mean_token_accuracy": 0.2018474042415619, "num_tokens": 32828993.0, "step": 15815 }, { "entropy": 5.470671367645264, "epoch": 1.4350507982583454, "grad_norm": 0.95703125, "learning_rate": 0.0004798710182526173, "loss": 5.0318, "mean_token_accuracy": 0.20728410184383392, "num_tokens": 32839331.0, "step": 15820 }, { "entropy": 5.470010042190552, "epoch": 1.4355043541364296, "grad_norm": 0.98046875, "learning_rate": 0.00047985763915883847, "loss": 5.0273, "mean_token_accuracy": 0.2018204912543297, "num_tokens": 32849946.0, "step": 15825 }, { "entropy": 5.388349962234497, "epoch": 1.4359579100145137, "grad_norm": 1.0, "learning_rate": 0.0004798442558285514, "loss": 4.9572, "mean_token_accuracy": 0.20606671422719955, "num_tokens": 32859960.0, "step": 15830 }, { "entropy": 5.4434051513671875, "epoch": 1.436411465892598, "grad_norm": 0.9765625, "learning_rate": 0.0004798308682620329, "loss": 4.9816, "mean_token_accuracy": 0.1954537570476532, "num_tokens": 32870317.0, "step": 15835 }, { "entropy": 5.541861629486084, "epoch": 1.4368650217706822, "grad_norm": 1.09375, "learning_rate": 0.00047981747645955996, "loss": 5.1581, "mean_token_accuracy": 0.1936565160751343, "num_tokens": 32880906.0, "step": 15840 }, { "entropy": 5.533978796005249, "epoch": 1.4373185776487662, "grad_norm": 1.015625, "learning_rate": 0.0004798040804214094, "loss": 5.1911, "mean_token_accuracy": 0.19131509214639664, "num_tokens": 32891038.0, "step": 15845 }, { "entropy": 5.570695543289185, "epoch": 1.4377721335268505, "grad_norm": 1.0859375, "learning_rate": 0.0004797906801478582, "loss": 5.1348, "mean_token_accuracy": 0.20294843167066573, "num_tokens": 32901013.0, "step": 15850 }, { "entropy": 5.543267345428466, "epoch": 1.4382256894049346, "grad_norm": 1.0, "learning_rate": 0.0004797772756391836, "loss": 5.0557, "mean_token_accuracy": 0.20270682871341705, "num_tokens": 32911592.0, "step": 15855 }, { "entropy": 5.4332098960876465, "epoch": 1.4386792452830188, "grad_norm": 1.0546875, "learning_rate": 0.0004797638668956627, "loss": 4.9519, "mean_token_accuracy": 0.20300047993659973, "num_tokens": 32922087.0, "step": 15860 }, { "entropy": 5.471498680114746, "epoch": 1.439132801161103, "grad_norm": 1.0234375, "learning_rate": 0.0004797504539175729, "loss": 5.0443, "mean_token_accuracy": 0.20456573367118835, "num_tokens": 32932039.0, "step": 15865 }, { "entropy": 5.462139129638672, "epoch": 1.4395863570391874, "grad_norm": 1.09375, "learning_rate": 0.0004797370367051915, "loss": 5.0036, "mean_token_accuracy": 0.200211963057518, "num_tokens": 32941896.0, "step": 15870 }, { "entropy": 5.44089994430542, "epoch": 1.4400399129172714, "grad_norm": 1.0703125, "learning_rate": 0.000479723615258796, "loss": 5.0184, "mean_token_accuracy": 0.19286007285118104, "num_tokens": 32951675.0, "step": 15875 }, { "entropy": 5.474519538879394, "epoch": 1.4404934687953557, "grad_norm": 1.0234375, "learning_rate": 0.00047971018957866396, "loss": 5.1058, "mean_token_accuracy": 0.20704136788845062, "num_tokens": 32961378.0, "step": 15880 }, { "entropy": 5.483541822433471, "epoch": 1.4409470246734397, "grad_norm": 1.0078125, "learning_rate": 0.00047969675966507314, "loss": 5.0127, "mean_token_accuracy": 0.2028401717543602, "num_tokens": 32971770.0, "step": 15885 }, { "entropy": 5.458818769454956, "epoch": 1.441400580551524, "grad_norm": 1.0078125, "learning_rate": 0.000479683325518301, "loss": 5.027, "mean_token_accuracy": 0.20152291655540466, "num_tokens": 32982934.0, "step": 15890 }, { "entropy": 5.436052989959717, "epoch": 1.4418541364296082, "grad_norm": 0.99609375, "learning_rate": 0.0004796698871386257, "loss": 5.0145, "mean_token_accuracy": 0.20192381739616394, "num_tokens": 32993252.0, "step": 15895 }, { "entropy": 5.496966934204101, "epoch": 1.4423076923076923, "grad_norm": 1.0390625, "learning_rate": 0.0004796564445263249, "loss": 5.0521, "mean_token_accuracy": 0.20016196519136428, "num_tokens": 33003610.0, "step": 15900 }, { "entropy": 5.482189559936524, "epoch": 1.4427612481857766, "grad_norm": 1.0546875, "learning_rate": 0.00047964299768167665, "loss": 4.9995, "mean_token_accuracy": 0.20372257828712464, "num_tokens": 33014037.0, "step": 15905 }, { "entropy": 5.478550577163697, "epoch": 1.4432148040638606, "grad_norm": 1.0390625, "learning_rate": 0.0004796295466049591, "loss": 5.0386, "mean_token_accuracy": 0.19845939427614212, "num_tokens": 33023299.0, "step": 15910 }, { "entropy": 5.499065399169922, "epoch": 1.4436683599419449, "grad_norm": 1.015625, "learning_rate": 0.00047961609129645036, "loss": 5.0815, "mean_token_accuracy": 0.1942521184682846, "num_tokens": 33034194.0, "step": 15915 }, { "entropy": 5.490591764450073, "epoch": 1.4441219158200291, "grad_norm": 0.9453125, "learning_rate": 0.00047960263175642867, "loss": 4.9545, "mean_token_accuracy": 0.2109111577272415, "num_tokens": 33044715.0, "step": 15920 }, { "entropy": 5.407504224777222, "epoch": 1.4445754716981132, "grad_norm": 1.046875, "learning_rate": 0.0004795891679851724, "loss": 4.9818, "mean_token_accuracy": 0.21129163801670076, "num_tokens": 33055214.0, "step": 15925 }, { "entropy": 5.442496252059937, "epoch": 1.4450290275761974, "grad_norm": 1.03125, "learning_rate": 0.0004795756999829601, "loss": 5.0054, "mean_token_accuracy": 0.20301516205072404, "num_tokens": 33065026.0, "step": 15930 }, { "entropy": 5.5316237449646, "epoch": 1.4454825834542815, "grad_norm": 0.9765625, "learning_rate": 0.00047956222775007016, "loss": 5.0594, "mean_token_accuracy": 0.1945800945162773, "num_tokens": 33075138.0, "step": 15935 }, { "entropy": 5.504463338851929, "epoch": 1.4459361393323658, "grad_norm": 0.97265625, "learning_rate": 0.0004795487512867812, "loss": 5.0516, "mean_token_accuracy": 0.20541611164808274, "num_tokens": 33086625.0, "step": 15940 }, { "entropy": 5.5062093257904055, "epoch": 1.44638969521045, "grad_norm": 1.015625, "learning_rate": 0.00047953527059337194, "loss": 5.082, "mean_token_accuracy": 0.19432028532028198, "num_tokens": 33097076.0, "step": 15945 }, { "entropy": 5.4663145542144775, "epoch": 1.446843251088534, "grad_norm": 1.078125, "learning_rate": 0.0004795217856701212, "loss": 5.0238, "mean_token_accuracy": 0.20231714248657226, "num_tokens": 33107168.0, "step": 15950 }, { "entropy": 5.481114721298217, "epoch": 1.4472968069666183, "grad_norm": 1.03125, "learning_rate": 0.00047950829651730774, "loss": 5.056, "mean_token_accuracy": 0.20539132058620452, "num_tokens": 33117862.0, "step": 15955 }, { "entropy": 5.437439918518066, "epoch": 1.4477503628447024, "grad_norm": 1.0625, "learning_rate": 0.0004794948031352107, "loss": 4.9827, "mean_token_accuracy": 0.2031979814171791, "num_tokens": 33127144.0, "step": 15960 }, { "entropy": 5.5240884780883786, "epoch": 1.4482039187227866, "grad_norm": 1.0390625, "learning_rate": 0.00047948130552410897, "loss": 5.1119, "mean_token_accuracy": 0.1925661489367485, "num_tokens": 33139180.0, "step": 15965 }, { "entropy": 5.532641744613647, "epoch": 1.448657474600871, "grad_norm": 1.0078125, "learning_rate": 0.00047946780368428175, "loss": 5.0333, "mean_token_accuracy": 0.19493882209062577, "num_tokens": 33149467.0, "step": 15970 }, { "entropy": 5.422984313964844, "epoch": 1.449111030478955, "grad_norm": 1.0546875, "learning_rate": 0.0004794542976160081, "loss": 4.8927, "mean_token_accuracy": 0.21469856351613997, "num_tokens": 33158752.0, "step": 15975 }, { "entropy": 5.424119520187378, "epoch": 1.4495645863570392, "grad_norm": 1.1015625, "learning_rate": 0.00047944078731956765, "loss": 4.9725, "mean_token_accuracy": 0.20479470044374465, "num_tokens": 33168242.0, "step": 15980 }, { "entropy": 5.406200122833252, "epoch": 1.4500181422351233, "grad_norm": 1.0703125, "learning_rate": 0.00047942727279523957, "loss": 4.9954, "mean_token_accuracy": 0.20532746464014054, "num_tokens": 33179134.0, "step": 15985 }, { "entropy": 5.453504800796509, "epoch": 1.4504716981132075, "grad_norm": 1.078125, "learning_rate": 0.0004794137540433034, "loss": 5.1209, "mean_token_accuracy": 0.1939221903681755, "num_tokens": 33188388.0, "step": 15990 }, { "entropy": 5.495200109481812, "epoch": 1.4509252539912918, "grad_norm": 0.9609375, "learning_rate": 0.0004794002310640386, "loss": 5.021, "mean_token_accuracy": 0.20037586092948914, "num_tokens": 33198750.0, "step": 15995 }, { "entropy": 5.575225591659546, "epoch": 1.4513788098693758, "grad_norm": 0.875, "learning_rate": 0.00047938670385772503, "loss": 5.1325, "mean_token_accuracy": 0.18529079705476761, "num_tokens": 33209532.0, "step": 16000 }, { "entropy": 5.478796434402466, "epoch": 1.45183236574746, "grad_norm": 1.3671875, "learning_rate": 0.00047937317242464244, "loss": 4.9824, "mean_token_accuracy": 0.206252583861351, "num_tokens": 33219675.0, "step": 16005 }, { "entropy": 5.494966888427735, "epoch": 1.4522859216255442, "grad_norm": 1.015625, "learning_rate": 0.0004793596367650704, "loss": 5.0944, "mean_token_accuracy": 0.1961601510643959, "num_tokens": 33230919.0, "step": 16010 }, { "entropy": 5.469520187377929, "epoch": 1.4527394775036284, "grad_norm": 1.03125, "learning_rate": 0.0004793460968792891, "loss": 4.9976, "mean_token_accuracy": 0.20618475079536439, "num_tokens": 33241146.0, "step": 16015 }, { "entropy": 5.479263734817505, "epoch": 1.4531930333817127, "grad_norm": 1.0078125, "learning_rate": 0.00047933255276757836, "loss": 5.0472, "mean_token_accuracy": 0.19950176626443863, "num_tokens": 33251434.0, "step": 16020 }, { "entropy": 5.528160095214844, "epoch": 1.4536465892597967, "grad_norm": 1.03125, "learning_rate": 0.0004793190044302184, "loss": 5.1318, "mean_token_accuracy": 0.19096487164497375, "num_tokens": 33261868.0, "step": 16025 }, { "entropy": 5.474983215332031, "epoch": 1.454100145137881, "grad_norm": 1.015625, "learning_rate": 0.00047930545186748936, "loss": 4.9595, "mean_token_accuracy": 0.2037203401327133, "num_tokens": 33271798.0, "step": 16030 }, { "entropy": 5.460812616348266, "epoch": 1.454553701015965, "grad_norm": 0.984375, "learning_rate": 0.00047929189507967153, "loss": 5.0707, "mean_token_accuracy": 0.19978414475917816, "num_tokens": 33282614.0, "step": 16035 }, { "entropy": 5.400892162322998, "epoch": 1.4550072568940493, "grad_norm": 1.0, "learning_rate": 0.00047927833406704516, "loss": 4.9878, "mean_token_accuracy": 0.19926196336746216, "num_tokens": 33292906.0, "step": 16040 }, { "entropy": 5.449161148071289, "epoch": 1.4554608127721336, "grad_norm": 0.953125, "learning_rate": 0.0004792647688298909, "loss": 4.9946, "mean_token_accuracy": 0.20244804173707961, "num_tokens": 33302720.0, "step": 16045 }, { "entropy": 5.430754852294922, "epoch": 1.4559143686502178, "grad_norm": 1.0078125, "learning_rate": 0.0004792511993684891, "loss": 4.9956, "mean_token_accuracy": 0.20477315187454223, "num_tokens": 33312959.0, "step": 16050 }, { "entropy": 5.42355523109436, "epoch": 1.4563679245283019, "grad_norm": 1.046875, "learning_rate": 0.00047923762568312053, "loss": 4.9357, "mean_token_accuracy": 0.21084294021129607, "num_tokens": 33322737.0, "step": 16055 }, { "entropy": 5.408132886886596, "epoch": 1.4568214804063861, "grad_norm": 1.078125, "learning_rate": 0.0004792240477740657, "loss": 4.9589, "mean_token_accuracy": 0.2052319809794426, "num_tokens": 33333185.0, "step": 16060 }, { "entropy": 5.496552848815918, "epoch": 1.4572750362844702, "grad_norm": 1.0390625, "learning_rate": 0.0004792104656416056, "loss": 5.0933, "mean_token_accuracy": 0.19294783622026443, "num_tokens": 33343414.0, "step": 16065 }, { "entropy": 5.4850352764129635, "epoch": 1.4577285921625545, "grad_norm": 1.0703125, "learning_rate": 0.00047919687928602104, "loss": 5.01, "mean_token_accuracy": 0.20524217933416367, "num_tokens": 33352527.0, "step": 16070 }, { "entropy": 5.477297830581665, "epoch": 1.4581821480406387, "grad_norm": 1.0703125, "learning_rate": 0.00047918328870759293, "loss": 5.0688, "mean_token_accuracy": 0.19643971771001817, "num_tokens": 33363526.0, "step": 16075 }, { "entropy": 5.457568788528443, "epoch": 1.4586357039187228, "grad_norm": 1.015625, "learning_rate": 0.0004791696939066024, "loss": 5.0815, "mean_token_accuracy": 0.2038888618350029, "num_tokens": 33374302.0, "step": 16080 }, { "entropy": 5.488372564315796, "epoch": 1.459089259796807, "grad_norm": 1.0625, "learning_rate": 0.0004791560948833306, "loss": 5.0624, "mean_token_accuracy": 0.20285871326923371, "num_tokens": 33384786.0, "step": 16085 }, { "entropy": 5.478956651687622, "epoch": 1.459542815674891, "grad_norm": 1.015625, "learning_rate": 0.0004791424916380586, "loss": 5.0481, "mean_token_accuracy": 0.20411778539419173, "num_tokens": 33394464.0, "step": 16090 }, { "entropy": 5.479393053054809, "epoch": 1.4599963715529753, "grad_norm": 0.984375, "learning_rate": 0.000479128884171068, "loss": 5.0644, "mean_token_accuracy": 0.19856854975223542, "num_tokens": 33405476.0, "step": 16095 }, { "entropy": 5.509451675415039, "epoch": 1.4604499274310596, "grad_norm": 0.9921875, "learning_rate": 0.00047911527248264003, "loss": 5.088, "mean_token_accuracy": 0.2023351863026619, "num_tokens": 33415758.0, "step": 16100 }, { "entropy": 5.450877618789673, "epoch": 1.4609034833091437, "grad_norm": 1.0859375, "learning_rate": 0.00047910165657305613, "loss": 5.0506, "mean_token_accuracy": 0.20088934898376465, "num_tokens": 33424845.0, "step": 16105 }, { "entropy": 5.4813680171966555, "epoch": 1.461357039187228, "grad_norm": 0.99609375, "learning_rate": 0.00047908803644259804, "loss": 5.089, "mean_token_accuracy": 0.1970730498433113, "num_tokens": 33435928.0, "step": 16110 }, { "entropy": 5.485598707199097, "epoch": 1.461810595065312, "grad_norm": 0.96484375, "learning_rate": 0.00047907441209154726, "loss": 4.987, "mean_token_accuracy": 0.20164019763469695, "num_tokens": 33447307.0, "step": 16115 }, { "entropy": 5.460571575164795, "epoch": 1.4622641509433962, "grad_norm": 0.8359375, "learning_rate": 0.00047906078352018575, "loss": 5.0579, "mean_token_accuracy": 0.19293845891952516, "num_tokens": 33458116.0, "step": 16120 }, { "entropy": 5.335807943344117, "epoch": 1.4627177068214805, "grad_norm": 0.99609375, "learning_rate": 0.0004790471507287952, "loss": 4.8939, "mean_token_accuracy": 0.21040795743465424, "num_tokens": 33469065.0, "step": 16125 }, { "entropy": 5.503554630279541, "epoch": 1.4631712626995645, "grad_norm": 1.0546875, "learning_rate": 0.00047903351371765757, "loss": 5.0374, "mean_token_accuracy": 0.20361997336149215, "num_tokens": 33479118.0, "step": 16130 }, { "entropy": 5.522790050506591, "epoch": 1.4636248185776488, "grad_norm": 0.95703125, "learning_rate": 0.00047901987248705484, "loss": 5.0594, "mean_token_accuracy": 0.19907349944114686, "num_tokens": 33489642.0, "step": 16135 }, { "entropy": 5.454414033889771, "epoch": 1.4640783744557329, "grad_norm": 1.015625, "learning_rate": 0.0004790062270372693, "loss": 5.0972, "mean_token_accuracy": 0.1919420763850212, "num_tokens": 33499771.0, "step": 16140 }, { "entropy": 5.458485412597656, "epoch": 1.4645319303338171, "grad_norm": 0.98046875, "learning_rate": 0.0004789925773685828, "loss": 5.0324, "mean_token_accuracy": 0.19968261271715165, "num_tokens": 33509975.0, "step": 16145 }, { "entropy": 5.477542972564697, "epoch": 1.4649854862119014, "grad_norm": 1.0390625, "learning_rate": 0.0004789789234812779, "loss": 5.0799, "mean_token_accuracy": 0.19430531114339827, "num_tokens": 33520017.0, "step": 16150 }, { "entropy": 5.483196592330932, "epoch": 1.4654390420899854, "grad_norm": 0.9609375, "learning_rate": 0.00047896526537563686, "loss": 5.1284, "mean_token_accuracy": 0.1917436122894287, "num_tokens": 33531977.0, "step": 16155 }, { "entropy": 5.468639326095581, "epoch": 1.4658925979680697, "grad_norm": 0.91015625, "learning_rate": 0.00047895160305194223, "loss": 5.0825, "mean_token_accuracy": 0.1999267041683197, "num_tokens": 33543660.0, "step": 16160 }, { "entropy": 5.474434423446655, "epoch": 1.4663461538461537, "grad_norm": 1.0546875, "learning_rate": 0.0004789379365104764, "loss": 5.0326, "mean_token_accuracy": 0.2019614279270172, "num_tokens": 33553814.0, "step": 16165 }, { "entropy": 5.493988704681397, "epoch": 1.466799709724238, "grad_norm": 1.0078125, "learning_rate": 0.0004789242657515221, "loss": 5.0303, "mean_token_accuracy": 0.20582034438848495, "num_tokens": 33564250.0, "step": 16170 }, { "entropy": 5.461010551452636, "epoch": 1.4672532656023223, "grad_norm": 1.0390625, "learning_rate": 0.0004789105907753621, "loss": 5.0146, "mean_token_accuracy": 0.20410160422325135, "num_tokens": 33574755.0, "step": 16175 }, { "entropy": 5.439325046539307, "epoch": 1.4677068214804063, "grad_norm": 0.9765625, "learning_rate": 0.000478896911582279, "loss": 4.9751, "mean_token_accuracy": 0.2002486065030098, "num_tokens": 33585268.0, "step": 16180 }, { "entropy": 5.457125616073609, "epoch": 1.4681603773584906, "grad_norm": 0.97265625, "learning_rate": 0.0004788832281725558, "loss": 5.0848, "mean_token_accuracy": 0.20506412535905838, "num_tokens": 33595753.0, "step": 16185 }, { "entropy": 5.452261877059937, "epoch": 1.4686139332365746, "grad_norm": 1.046875, "learning_rate": 0.0004788695405464755, "loss": 4.9748, "mean_token_accuracy": 0.2044246807694435, "num_tokens": 33605270.0, "step": 16190 }, { "entropy": 5.448578643798828, "epoch": 1.469067489114659, "grad_norm": 0.9453125, "learning_rate": 0.00047885584870432127, "loss": 5.0649, "mean_token_accuracy": 0.20005607455968857, "num_tokens": 33615096.0, "step": 16195 }, { "entropy": 5.453908920288086, "epoch": 1.4695210449927432, "grad_norm": 1.078125, "learning_rate": 0.00047884215264637606, "loss": 4.9705, "mean_token_accuracy": 0.20482762157917023, "num_tokens": 33624770.0, "step": 16200 }, { "entropy": 5.514669418334961, "epoch": 1.4699746008708272, "grad_norm": 1.046875, "learning_rate": 0.0004788284523729232, "loss": 5.1089, "mean_token_accuracy": 0.19363716393709182, "num_tokens": 33634545.0, "step": 16205 }, { "entropy": 5.529506874084473, "epoch": 1.4704281567489115, "grad_norm": 1.015625, "learning_rate": 0.00047881474788424595, "loss": 5.0652, "mean_token_accuracy": 0.20077794492244722, "num_tokens": 33644950.0, "step": 16210 }, { "entropy": 5.479498720169067, "epoch": 1.4708817126269955, "grad_norm": 1.046875, "learning_rate": 0.00047880103918062776, "loss": 5.0076, "mean_token_accuracy": 0.2026103839278221, "num_tokens": 33654369.0, "step": 16215 }, { "entropy": 5.368625020980835, "epoch": 1.4713352685050798, "grad_norm": 0.98828125, "learning_rate": 0.00047878732626235225, "loss": 5.0446, "mean_token_accuracy": 0.19709902852773667, "num_tokens": 33664687.0, "step": 16220 }, { "entropy": 5.434810829162598, "epoch": 1.471788824383164, "grad_norm": 1.1171875, "learning_rate": 0.0004787736091297028, "loss": 4.9992, "mean_token_accuracy": 0.21163554936647416, "num_tokens": 33675832.0, "step": 16225 }, { "entropy": 5.503649663925171, "epoch": 1.4722423802612483, "grad_norm": 1.046875, "learning_rate": 0.0004787598877829633, "loss": 5.074, "mean_token_accuracy": 0.19952421486377717, "num_tokens": 33686788.0, "step": 16230 }, { "entropy": 5.438729190826416, "epoch": 1.4726959361393324, "grad_norm": 1.109375, "learning_rate": 0.0004787461622224173, "loss": 4.9779, "mean_token_accuracy": 0.21022354513406755, "num_tokens": 33696384.0, "step": 16235 }, { "entropy": 5.4412675380706785, "epoch": 1.4731494920174166, "grad_norm": 1.0234375, "learning_rate": 0.0004787324324483488, "loss": 5.0081, "mean_token_accuracy": 0.19890953004360198, "num_tokens": 33707758.0, "step": 16240 }, { "entropy": 5.462802696228027, "epoch": 1.4736030478955007, "grad_norm": 1.0, "learning_rate": 0.0004787186984610416, "loss": 4.9875, "mean_token_accuracy": 0.2026902347803116, "num_tokens": 33717747.0, "step": 16245 }, { "entropy": 5.427540922164917, "epoch": 1.474056603773585, "grad_norm": 0.99609375, "learning_rate": 0.00047870496026077984, "loss": 4.9811, "mean_token_accuracy": 0.20165301412343978, "num_tokens": 33727960.0, "step": 16250 }, { "entropy": 5.405560445785523, "epoch": 1.4745101596516692, "grad_norm": 1.015625, "learning_rate": 0.0004786912178478476, "loss": 4.9615, "mean_token_accuracy": 0.20851432383060456, "num_tokens": 33738874.0, "step": 16255 }, { "entropy": 5.426895332336426, "epoch": 1.4749637155297532, "grad_norm": 1.0234375, "learning_rate": 0.0004786774712225291, "loss": 4.9643, "mean_token_accuracy": 0.21164844632148744, "num_tokens": 33749071.0, "step": 16260 }, { "entropy": 5.4466687679290775, "epoch": 1.4754172714078375, "grad_norm": 0.94921875, "learning_rate": 0.0004786637203851086, "loss": 4.9916, "mean_token_accuracy": 0.2025420770049095, "num_tokens": 33759509.0, "step": 16265 }, { "entropy": 5.507283735275268, "epoch": 1.4758708272859216, "grad_norm": 1.0078125, "learning_rate": 0.0004786499653358705, "loss": 5.0361, "mean_token_accuracy": 0.20561971068382262, "num_tokens": 33769974.0, "step": 16270 }, { "entropy": 5.548575830459595, "epoch": 1.4763243831640058, "grad_norm": 1.0, "learning_rate": 0.0004786362060750991, "loss": 5.0762, "mean_token_accuracy": 0.20296125039458274, "num_tokens": 33780403.0, "step": 16275 }, { "entropy": 5.459582138061523, "epoch": 1.47677793904209, "grad_norm": 0.984375, "learning_rate": 0.00047862244260307913, "loss": 5.0763, "mean_token_accuracy": 0.20544939637184143, "num_tokens": 33791364.0, "step": 16280 }, { "entropy": 5.447279024124145, "epoch": 1.4772314949201741, "grad_norm": 1.03125, "learning_rate": 0.0004786086749200951, "loss": 5.0177, "mean_token_accuracy": 0.20414622575044633, "num_tokens": 33801964.0, "step": 16285 }, { "entropy": 5.504152631759643, "epoch": 1.4776850507982584, "grad_norm": 1.015625, "learning_rate": 0.0004785949030264319, "loss": 5.0246, "mean_token_accuracy": 0.20249088406562804, "num_tokens": 33813132.0, "step": 16290 }, { "entropy": 5.44755973815918, "epoch": 1.4781386066763424, "grad_norm": 1.0390625, "learning_rate": 0.0004785811269223741, "loss": 5.0101, "mean_token_accuracy": 0.2099921613931656, "num_tokens": 33823069.0, "step": 16295 }, { "entropy": 5.50404543876648, "epoch": 1.4785921625544267, "grad_norm": 1.0703125, "learning_rate": 0.0004785673466082068, "loss": 5.0149, "mean_token_accuracy": 0.19754787534475327, "num_tokens": 33832626.0, "step": 16300 }, { "entropy": 5.426759576797485, "epoch": 1.479045718432511, "grad_norm": 1.0625, "learning_rate": 0.00047855356208421484, "loss": 4.9929, "mean_token_accuracy": 0.20693277418613434, "num_tokens": 33843384.0, "step": 16305 }, { "entropy": 5.3980459690094, "epoch": 1.479499274310595, "grad_norm": 1.0859375, "learning_rate": 0.0004785397733506834, "loss": 4.9885, "mean_token_accuracy": 0.2088317394256592, "num_tokens": 33854286.0, "step": 16310 }, { "entropy": 5.406148290634155, "epoch": 1.4799528301886793, "grad_norm": 1.0546875, "learning_rate": 0.0004785259804078976, "loss": 4.9741, "mean_token_accuracy": 0.20360536724328995, "num_tokens": 33863379.0, "step": 16315 }, { "entropy": 5.4936699867248535, "epoch": 1.4804063860667633, "grad_norm": 0.96875, "learning_rate": 0.0004785121832561426, "loss": 5.184, "mean_token_accuracy": 0.19662310928106308, "num_tokens": 33875641.0, "step": 16320 }, { "entropy": 5.4985864639282225, "epoch": 1.4808599419448476, "grad_norm": 0.9765625, "learning_rate": 0.00047849838189570375, "loss": 4.9796, "mean_token_accuracy": 0.20845424234867097, "num_tokens": 33885023.0, "step": 16325 }, { "entropy": 5.5839954853057865, "epoch": 1.4813134978229319, "grad_norm": 1.078125, "learning_rate": 0.0004784845763268666, "loss": 5.121, "mean_token_accuracy": 0.1973605066537857, "num_tokens": 33895562.0, "step": 16330 }, { "entropy": 5.433398008346558, "epoch": 1.481767053701016, "grad_norm": 0.9921875, "learning_rate": 0.0004784707665499165, "loss": 5.0334, "mean_token_accuracy": 0.20686419904232026, "num_tokens": 33907095.0, "step": 16335 }, { "entropy": 5.3774275302886965, "epoch": 1.4822206095791002, "grad_norm": 1.03125, "learning_rate": 0.0004784569525651391, "loss": 4.8602, "mean_token_accuracy": 0.2152920514345169, "num_tokens": 33917475.0, "step": 16340 }, { "entropy": 5.42539005279541, "epoch": 1.4826741654571842, "grad_norm": 0.96484375, "learning_rate": 0.00047844313437282005, "loss": 5.0253, "mean_token_accuracy": 0.2041505143046379, "num_tokens": 33927740.0, "step": 16345 }, { "entropy": 5.410151386260987, "epoch": 1.4831277213352685, "grad_norm": 1.0234375, "learning_rate": 0.00047842931197324525, "loss": 4.9587, "mean_token_accuracy": 0.20373953580856324, "num_tokens": 33937416.0, "step": 16350 }, { "entropy": 5.409642457962036, "epoch": 1.4835812772133528, "grad_norm": 0.984375, "learning_rate": 0.00047841548536670033, "loss": 4.9432, "mean_token_accuracy": 0.21611718833446503, "num_tokens": 33946968.0, "step": 16355 }, { "entropy": 5.516166925430298, "epoch": 1.4840348330914368, "grad_norm": 1.0859375, "learning_rate": 0.00047840165455347136, "loss": 5.0801, "mean_token_accuracy": 0.19407518357038497, "num_tokens": 33957877.0, "step": 16360 }, { "entropy": 5.499650478363037, "epoch": 1.484488388969521, "grad_norm": 1.0, "learning_rate": 0.00047838781953384436, "loss": 5.0664, "mean_token_accuracy": 0.1990896999835968, "num_tokens": 33967890.0, "step": 16365 }, { "entropy": 5.427718257904052, "epoch": 1.484941944847605, "grad_norm": 1.0625, "learning_rate": 0.0004783739803081054, "loss": 5.0084, "mean_token_accuracy": 0.205517914891243, "num_tokens": 33977117.0, "step": 16370 }, { "entropy": 5.469697761535644, "epoch": 1.4853955007256894, "grad_norm": 0.99609375, "learning_rate": 0.00047836013687654075, "loss": 5.1103, "mean_token_accuracy": 0.1963505521416664, "num_tokens": 33986943.0, "step": 16375 }, { "entropy": 5.468562316894531, "epoch": 1.4858490566037736, "grad_norm": 1.046875, "learning_rate": 0.00047834628923943654, "loss": 4.9892, "mean_token_accuracy": 0.20292943418025972, "num_tokens": 33996499.0, "step": 16380 }, { "entropy": 5.511895990371704, "epoch": 1.4863026124818577, "grad_norm": 0.98046875, "learning_rate": 0.0004783324373970793, "loss": 5.1124, "mean_token_accuracy": 0.1989882156252861, "num_tokens": 34006749.0, "step": 16385 }, { "entropy": 5.5462761402130125, "epoch": 1.486756168359942, "grad_norm": 0.953125, "learning_rate": 0.0004783185813497555, "loss": 5.1142, "mean_token_accuracy": 0.19380537718534468, "num_tokens": 34017194.0, "step": 16390 }, { "entropy": 5.528011274337769, "epoch": 1.487209724238026, "grad_norm": 1.046875, "learning_rate": 0.0004783047210977516, "loss": 5.0467, "mean_token_accuracy": 0.20265622884035112, "num_tokens": 34027386.0, "step": 16395 }, { "entropy": 5.534073352813721, "epoch": 1.4876632801161103, "grad_norm": 1.1015625, "learning_rate": 0.00047829085664135424, "loss": 5.067, "mean_token_accuracy": 0.1954236224293709, "num_tokens": 34037540.0, "step": 16400 }, { "entropy": 5.428753852844238, "epoch": 1.4881168359941945, "grad_norm": 0.984375, "learning_rate": 0.00047827698798085015, "loss": 5.0028, "mean_token_accuracy": 0.20653520077466964, "num_tokens": 34048008.0, "step": 16405 }, { "entropy": 5.503815984725952, "epoch": 1.4885703918722788, "grad_norm": 1.109375, "learning_rate": 0.0004782631151165262, "loss": 5.0187, "mean_token_accuracy": 0.2068993330001831, "num_tokens": 34058009.0, "step": 16410 }, { "entropy": 5.5186210632324215, "epoch": 1.4890239477503628, "grad_norm": 1.03125, "learning_rate": 0.00047824923804866914, "loss": 4.971, "mean_token_accuracy": 0.20440451204776763, "num_tokens": 34067625.0, "step": 16415 }, { "entropy": 5.44329948425293, "epoch": 1.4894775036284469, "grad_norm": 0.984375, "learning_rate": 0.00047823535677756607, "loss": 5.0274, "mean_token_accuracy": 0.19958255141973497, "num_tokens": 34077349.0, "step": 16420 }, { "entropy": 5.520338439941407, "epoch": 1.4899310595065312, "grad_norm": 1.140625, "learning_rate": 0.0004782214713035041, "loss": 5.1387, "mean_token_accuracy": 0.19416306912899017, "num_tokens": 34088636.0, "step": 16425 }, { "entropy": 5.518615245819092, "epoch": 1.4903846153846154, "grad_norm": 1.0, "learning_rate": 0.00047820758162677026, "loss": 5.0519, "mean_token_accuracy": 0.20491172522306442, "num_tokens": 34098806.0, "step": 16430 }, { "entropy": 5.448275423049926, "epoch": 1.4908381712626997, "grad_norm": 1.0078125, "learning_rate": 0.00047819368774765187, "loss": 5.039, "mean_token_accuracy": 0.20588411688804625, "num_tokens": 34109713.0, "step": 16435 }, { "entropy": 5.424658107757568, "epoch": 1.4912917271407837, "grad_norm": 1.078125, "learning_rate": 0.00047817978966643626, "loss": 4.9907, "mean_token_accuracy": 0.2082641527056694, "num_tokens": 34119585.0, "step": 16440 }, { "entropy": 5.534990835189819, "epoch": 1.491745283018868, "grad_norm": 0.9765625, "learning_rate": 0.0004781658873834108, "loss": 5.0459, "mean_token_accuracy": 0.1953447639942169, "num_tokens": 34131245.0, "step": 16445 }, { "entropy": 5.513223123550415, "epoch": 1.492198838896952, "grad_norm": 0.99609375, "learning_rate": 0.00047815198089886296, "loss": 5.0228, "mean_token_accuracy": 0.2032491758465767, "num_tokens": 34141229.0, "step": 16450 }, { "entropy": 5.458254146575928, "epoch": 1.4926523947750363, "grad_norm": 1.109375, "learning_rate": 0.0004781380702130805, "loss": 5.0673, "mean_token_accuracy": 0.19513534903526306, "num_tokens": 34151781.0, "step": 16455 }, { "entropy": 5.426235008239746, "epoch": 1.4931059506531206, "grad_norm": 0.94140625, "learning_rate": 0.00047812415532635087, "loss": 5.0094, "mean_token_accuracy": 0.20614495277404785, "num_tokens": 34162305.0, "step": 16460 }, { "entropy": 5.492601633071899, "epoch": 1.4935595065312046, "grad_norm": 0.9375, "learning_rate": 0.000478110236238962, "loss": 5.0856, "mean_token_accuracy": 0.19664422869682313, "num_tokens": 34173613.0, "step": 16465 }, { "entropy": 5.444189500808716, "epoch": 1.4940130624092889, "grad_norm": 1.0703125, "learning_rate": 0.00047809631295120164, "loss": 5.0046, "mean_token_accuracy": 0.20410215258598327, "num_tokens": 34183540.0, "step": 16470 }, { "entropy": 5.437660074234008, "epoch": 1.494466618287373, "grad_norm": 1.0390625, "learning_rate": 0.00047808238546335786, "loss": 5.033, "mean_token_accuracy": 0.20073717087507248, "num_tokens": 34193292.0, "step": 16475 }, { "entropy": 5.490480756759643, "epoch": 1.4949201741654572, "grad_norm": 0.984375, "learning_rate": 0.00047806845377571856, "loss": 5.0788, "mean_token_accuracy": 0.2080323338508606, "num_tokens": 34202697.0, "step": 16480 }, { "entropy": 5.4534783363342285, "epoch": 1.4953737300435415, "grad_norm": 1.015625, "learning_rate": 0.00047805451788857187, "loss": 4.986, "mean_token_accuracy": 0.20318156331777573, "num_tokens": 34213396.0, "step": 16485 }, { "entropy": 5.480810022354126, "epoch": 1.4958272859216255, "grad_norm": 1.1171875, "learning_rate": 0.000478040577802206, "loss": 4.9772, "mean_token_accuracy": 0.20488856732845306, "num_tokens": 34223020.0, "step": 16490 }, { "entropy": 5.404968214035034, "epoch": 1.4962808417997098, "grad_norm": 1.1015625, "learning_rate": 0.0004780266335169093, "loss": 5.0273, "mean_token_accuracy": 0.20515892803668975, "num_tokens": 34233249.0, "step": 16495 }, { "entropy": 5.5380853652954105, "epoch": 1.4967343976777938, "grad_norm": 1.03125, "learning_rate": 0.00047801268503297, "loss": 5.0762, "mean_token_accuracy": 0.1973375201225281, "num_tokens": 34244091.0, "step": 16500 }, { "entropy": 5.49814920425415, "epoch": 1.497187953555878, "grad_norm": 0.90625, "learning_rate": 0.00047799873235067667, "loss": 5.0724, "mean_token_accuracy": 0.20048414617776872, "num_tokens": 34255060.0, "step": 16505 }, { "entropy": 5.422490882873535, "epoch": 1.4976415094339623, "grad_norm": 1.0703125, "learning_rate": 0.0004779847754703178, "loss": 4.9489, "mean_token_accuracy": 0.206888285279274, "num_tokens": 34264361.0, "step": 16510 }, { "entropy": 5.423403739929199, "epoch": 1.4980950653120464, "grad_norm": 1.0390625, "learning_rate": 0.0004779708143921821, "loss": 5.0295, "mean_token_accuracy": 0.2039859652519226, "num_tokens": 34274480.0, "step": 16515 }, { "entropy": 5.452390336990357, "epoch": 1.4985486211901307, "grad_norm": 0.98046875, "learning_rate": 0.00047795684911655824, "loss": 5.0217, "mean_token_accuracy": 0.20332777947187425, "num_tokens": 34285951.0, "step": 16520 }, { "entropy": 5.48722357749939, "epoch": 1.4990021770682147, "grad_norm": 1.0, "learning_rate": 0.000477942879643735, "loss": 5.071, "mean_token_accuracy": 0.19658953696489334, "num_tokens": 34296384.0, "step": 16525 }, { "entropy": 5.462945890426636, "epoch": 1.499455732946299, "grad_norm": 1.0703125, "learning_rate": 0.00047792890597400125, "loss": 5.0143, "mean_token_accuracy": 0.20717779994010926, "num_tokens": 34306776.0, "step": 16530 }, { "entropy": 5.502072858810425, "epoch": 1.4999092888243832, "grad_norm": 1.046875, "learning_rate": 0.00047791492810764604, "loss": 5.0132, "mean_token_accuracy": 0.20408144295215608, "num_tokens": 34317047.0, "step": 16535 }, { "entropy": 5.450231695175171, "epoch": 1.5003628447024675, "grad_norm": 1.0, "learning_rate": 0.0004779009460449584, "loss": 4.9775, "mean_token_accuracy": 0.20671842098236085, "num_tokens": 34326392.0, "step": 16540 }, { "entropy": 5.4880836486816404, "epoch": 1.5008164005805515, "grad_norm": 0.91796875, "learning_rate": 0.00047788695978622756, "loss": 5.0363, "mean_token_accuracy": 0.209957118332386, "num_tokens": 34336580.0, "step": 16545 }, { "entropy": 5.4223161220550535, "epoch": 1.5012699564586356, "grad_norm": 1.0078125, "learning_rate": 0.00047787296933174265, "loss": 5.0481, "mean_token_accuracy": 0.2016463026404381, "num_tokens": 34346792.0, "step": 16550 }, { "entropy": 5.499814701080322, "epoch": 1.5017235123367199, "grad_norm": 1.015625, "learning_rate": 0.000477858974681793, "loss": 5.0654, "mean_token_accuracy": 0.1987570568919182, "num_tokens": 34356675.0, "step": 16555 }, { "entropy": 5.512963771820068, "epoch": 1.5021770682148041, "grad_norm": 1.015625, "learning_rate": 0.0004778449758366681, "loss": 5.0245, "mean_token_accuracy": 0.21385493725538254, "num_tokens": 34366357.0, "step": 16560 }, { "entropy": 5.437784957885742, "epoch": 1.5026306240928884, "grad_norm": 1.0625, "learning_rate": 0.0004778309727966574, "loss": 5.0111, "mean_token_accuracy": 0.20755893886089324, "num_tokens": 34377229.0, "step": 16565 }, { "entropy": 5.405068588256836, "epoch": 1.5030841799709724, "grad_norm": 1.046875, "learning_rate": 0.00047781696556205045, "loss": 4.9645, "mean_token_accuracy": 0.20646806359291076, "num_tokens": 34387873.0, "step": 16570 }, { "entropy": 5.459356737136841, "epoch": 1.5035377358490565, "grad_norm": 1.0390625, "learning_rate": 0.00047780295413313696, "loss": 4.9645, "mean_token_accuracy": 0.21081265956163406, "num_tokens": 34398889.0, "step": 16575 }, { "entropy": 5.429965829849243, "epoch": 1.5039912917271407, "grad_norm": 1.09375, "learning_rate": 0.00047778893851020676, "loss": 4.9218, "mean_token_accuracy": 0.20821678191423415, "num_tokens": 34408508.0, "step": 16580 }, { "entropy": 5.436028480529785, "epoch": 1.504444847605225, "grad_norm": 1.0625, "learning_rate": 0.0004777749186935496, "loss": 5.0968, "mean_token_accuracy": 0.20087021440267563, "num_tokens": 34418928.0, "step": 16585 }, { "entropy": 5.492291975021362, "epoch": 1.5048984034833093, "grad_norm": 0.953125, "learning_rate": 0.0004777608946834555, "loss": 5.0675, "mean_token_accuracy": 0.19984024167060851, "num_tokens": 34429789.0, "step": 16590 }, { "entropy": 5.525197219848633, "epoch": 1.5053519593613933, "grad_norm": 0.95703125, "learning_rate": 0.0004777468664802144, "loss": 5.1595, "mean_token_accuracy": 0.19593982249498368, "num_tokens": 34440795.0, "step": 16595 }, { "entropy": 5.5145854473114015, "epoch": 1.5058055152394774, "grad_norm": 1.0703125, "learning_rate": 0.00047773283408411636, "loss": 5.0635, "mean_token_accuracy": 0.19572877287864685, "num_tokens": 34450772.0, "step": 16600 }, { "entropy": 5.445775747299194, "epoch": 1.5062590711175616, "grad_norm": 1.015625, "learning_rate": 0.00047771879749545175, "loss": 4.9983, "mean_token_accuracy": 0.20167359709739685, "num_tokens": 34461273.0, "step": 16605 }, { "entropy": 5.469457149505615, "epoch": 1.506712626995646, "grad_norm": 1.0, "learning_rate": 0.00047770475671451073, "loss": 5.0667, "mean_token_accuracy": 0.19966941922903061, "num_tokens": 34470942.0, "step": 16610 }, { "entropy": 5.509217023849487, "epoch": 1.5071661828737302, "grad_norm": 0.9453125, "learning_rate": 0.0004776907117415837, "loss": 4.9942, "mean_token_accuracy": 0.2073441728949547, "num_tokens": 34481117.0, "step": 16615 }, { "entropy": 5.429892539978027, "epoch": 1.5076197387518142, "grad_norm": 1.0390625, "learning_rate": 0.00047767666257696103, "loss": 4.9633, "mean_token_accuracy": 0.20793781578540801, "num_tokens": 34490953.0, "step": 16620 }, { "entropy": 5.421083641052246, "epoch": 1.5080732946298983, "grad_norm": 0.99609375, "learning_rate": 0.00047766260922093337, "loss": 4.9287, "mean_token_accuracy": 0.20670849829912186, "num_tokens": 34502765.0, "step": 16625 }, { "entropy": 5.52827205657959, "epoch": 1.5085268505079825, "grad_norm": 1.1015625, "learning_rate": 0.0004776485516737913, "loss": 5.0962, "mean_token_accuracy": 0.1967792272567749, "num_tokens": 34514473.0, "step": 16630 }, { "entropy": 5.533112478256226, "epoch": 1.5089804063860668, "grad_norm": 1.0546875, "learning_rate": 0.0004776344899358256, "loss": 5.1332, "mean_token_accuracy": 0.19769856035709382, "num_tokens": 34524218.0, "step": 16635 }, { "entropy": 5.490613555908203, "epoch": 1.509433962264151, "grad_norm": 0.9375, "learning_rate": 0.0004776204240073269, "loss": 4.9999, "mean_token_accuracy": 0.20425005704164506, "num_tokens": 34535697.0, "step": 16640 }, { "entropy": 5.524890518188476, "epoch": 1.509887518142235, "grad_norm": 1.1796875, "learning_rate": 0.00047760635388858624, "loss": 5.055, "mean_token_accuracy": 0.20605057328939438, "num_tokens": 34545130.0, "step": 16645 }, { "entropy": 5.4361841678619385, "epoch": 1.5103410740203191, "grad_norm": 1.0546875, "learning_rate": 0.00047759227957989465, "loss": 4.9839, "mean_token_accuracy": 0.20409290939569474, "num_tokens": 34554974.0, "step": 16650 }, { "entropy": 5.47480525970459, "epoch": 1.5107946298984034, "grad_norm": 1.03125, "learning_rate": 0.000477578201081543, "loss": 5.0313, "mean_token_accuracy": 0.2005136340856552, "num_tokens": 34565660.0, "step": 16655 }, { "entropy": 5.52646484375, "epoch": 1.5112481857764877, "grad_norm": 0.9296875, "learning_rate": 0.0004775641183938225, "loss": 5.0526, "mean_token_accuracy": 0.20296634435653688, "num_tokens": 34576447.0, "step": 16660 }, { "entropy": 5.542837333679199, "epoch": 1.511701741654572, "grad_norm": 1.046875, "learning_rate": 0.00047755003151702443, "loss": 5.1749, "mean_token_accuracy": 0.19983410090208054, "num_tokens": 34588333.0, "step": 16665 }, { "entropy": 5.417311525344848, "epoch": 1.512155297532656, "grad_norm": 1.046875, "learning_rate": 0.00047753594045144015, "loss": 4.9536, "mean_token_accuracy": 0.20125583112239837, "num_tokens": 34598166.0, "step": 16670 }, { "entropy": 5.449014949798584, "epoch": 1.5126088534107403, "grad_norm": 1.0859375, "learning_rate": 0.0004775218451973609, "loss": 4.9596, "mean_token_accuracy": 0.20207023173570632, "num_tokens": 34608615.0, "step": 16675 }, { "entropy": 5.45111665725708, "epoch": 1.5130624092888243, "grad_norm": 0.94140625, "learning_rate": 0.0004775077457550784, "loss": 5.0394, "mean_token_accuracy": 0.2035181000828743, "num_tokens": 34618618.0, "step": 16680 }, { "entropy": 5.498604202270508, "epoch": 1.5135159651669086, "grad_norm": 0.9921875, "learning_rate": 0.00047749364212488403, "loss": 5.0443, "mean_token_accuracy": 0.2016269311308861, "num_tokens": 34629412.0, "step": 16685 }, { "entropy": 5.554146385192871, "epoch": 1.5139695210449928, "grad_norm": 1.0078125, "learning_rate": 0.0004774795343070696, "loss": 5.123, "mean_token_accuracy": 0.19738198965787887, "num_tokens": 34640487.0, "step": 16690 }, { "entropy": 5.4859092235565186, "epoch": 1.5144230769230769, "grad_norm": 1.03125, "learning_rate": 0.0004774654223019268, "loss": 5.0311, "mean_token_accuracy": 0.20505344718694687, "num_tokens": 34650126.0, "step": 16695 }, { "entropy": 5.395961618423462, "epoch": 1.5148766328011611, "grad_norm": 1.0546875, "learning_rate": 0.0004774513061097474, "loss": 4.8903, "mean_token_accuracy": 0.20872655212879182, "num_tokens": 34659721.0, "step": 16700 }, { "entropy": 5.442564296722412, "epoch": 1.5153301886792452, "grad_norm": 1.015625, "learning_rate": 0.0004774371857308235, "loss": 5.014, "mean_token_accuracy": 0.20492298454046248, "num_tokens": 34670611.0, "step": 16705 }, { "entropy": 5.48886137008667, "epoch": 1.5157837445573294, "grad_norm": 1.0, "learning_rate": 0.00047742306116544693, "loss": 5.0092, "mean_token_accuracy": 0.20673186480998992, "num_tokens": 34680173.0, "step": 16710 }, { "entropy": 5.466881942749024, "epoch": 1.5162373004354137, "grad_norm": 1.015625, "learning_rate": 0.00047740893241390994, "loss": 5.0577, "mean_token_accuracy": 0.20070289373397826, "num_tokens": 34690176.0, "step": 16715 }, { "entropy": 5.518379592895508, "epoch": 1.516690856313498, "grad_norm": 1.0078125, "learning_rate": 0.0004773947994765046, "loss": 4.983, "mean_token_accuracy": 0.21208746135234832, "num_tokens": 34700481.0, "step": 16720 }, { "entropy": 5.449109649658203, "epoch": 1.517144412191582, "grad_norm": 1.0, "learning_rate": 0.0004773806623535232, "loss": 5.1467, "mean_token_accuracy": 0.2002828910946846, "num_tokens": 34710643.0, "step": 16725 }, { "entropy": 5.492352247238159, "epoch": 1.517597968069666, "grad_norm": 1.03125, "learning_rate": 0.00047736652104525816, "loss": 5.0237, "mean_token_accuracy": 0.20047015994787215, "num_tokens": 34720998.0, "step": 16730 }, { "entropy": 5.532505941390991, "epoch": 1.5180515239477503, "grad_norm": 1.0546875, "learning_rate": 0.0004773523755520019, "loss": 5.0728, "mean_token_accuracy": 0.1998874217271805, "num_tokens": 34731071.0, "step": 16735 }, { "entropy": 5.438583946228027, "epoch": 1.5185050798258346, "grad_norm": 1.046875, "learning_rate": 0.000477338225874047, "loss": 4.9808, "mean_token_accuracy": 0.20761779695749283, "num_tokens": 34741346.0, "step": 16740 }, { "entropy": 5.498762369155884, "epoch": 1.5189586357039189, "grad_norm": 1.03125, "learning_rate": 0.00047732407201168595, "loss": 4.9795, "mean_token_accuracy": 0.20281408131122589, "num_tokens": 34751092.0, "step": 16745 }, { "entropy": 5.544218111038208, "epoch": 1.519412191582003, "grad_norm": 1.0078125, "learning_rate": 0.0004773099139652116, "loss": 5.0918, "mean_token_accuracy": 0.19871319681406022, "num_tokens": 34761477.0, "step": 16750 }, { "entropy": 5.425150299072266, "epoch": 1.519865747460087, "grad_norm": 0.97265625, "learning_rate": 0.0004772957517349167, "loss": 5.0129, "mean_token_accuracy": 0.2022230938076973, "num_tokens": 34772491.0, "step": 16755 }, { "entropy": 5.4748804569244385, "epoch": 1.5203193033381712, "grad_norm": 1.0703125, "learning_rate": 0.0004772815853210939, "loss": 5.0592, "mean_token_accuracy": 0.19688044041395186, "num_tokens": 34783192.0, "step": 16760 }, { "entropy": 5.477023792266846, "epoch": 1.5207728592162555, "grad_norm": 0.98046875, "learning_rate": 0.00047726741472403655, "loss": 5.026, "mean_token_accuracy": 0.20596080124378205, "num_tokens": 34794164.0, "step": 16765 }, { "entropy": 5.490565490722656, "epoch": 1.5212264150943398, "grad_norm": 1.078125, "learning_rate": 0.00047725323994403753, "loss": 5.0809, "mean_token_accuracy": 0.19330866187810897, "num_tokens": 34804390.0, "step": 16770 }, { "entropy": 5.591202640533448, "epoch": 1.5216799709724238, "grad_norm": 1.0234375, "learning_rate": 0.00047723906098138993, "loss": 5.1577, "mean_token_accuracy": 0.19566252678632737, "num_tokens": 34814751.0, "step": 16775 }, { "entropy": 5.498318529129028, "epoch": 1.5221335268505078, "grad_norm": 0.9453125, "learning_rate": 0.00047722487783638697, "loss": 4.995, "mean_token_accuracy": 0.20829154253005983, "num_tokens": 34824977.0, "step": 16780 }, { "entropy": 5.4572632789611815, "epoch": 1.5225870827285921, "grad_norm": 1.09375, "learning_rate": 0.000477210690509322, "loss": 5.0428, "mean_token_accuracy": 0.20372531265020372, "num_tokens": 34835540.0, "step": 16785 }, { "entropy": 5.523160743713379, "epoch": 1.5230406386066764, "grad_norm": 1.0234375, "learning_rate": 0.00047719649900048843, "loss": 5.0357, "mean_token_accuracy": 0.19952683597803117, "num_tokens": 34845233.0, "step": 16790 }, { "entropy": 5.537006473541259, "epoch": 1.5234941944847606, "grad_norm": 1.046875, "learning_rate": 0.00047718230331017975, "loss": 5.1319, "mean_token_accuracy": 0.1903398737311363, "num_tokens": 34855756.0, "step": 16795 }, { "entropy": 5.468630743026734, "epoch": 1.5239477503628447, "grad_norm": 1.0859375, "learning_rate": 0.00047716810343868956, "loss": 5.037, "mean_token_accuracy": 0.1923644244670868, "num_tokens": 34867869.0, "step": 16800 }, { "entropy": 5.585168933868408, "epoch": 1.5244013062409287, "grad_norm": 1.109375, "learning_rate": 0.00047715389938631143, "loss": 5.088, "mean_token_accuracy": 0.19788610190153122, "num_tokens": 34878625.0, "step": 16805 }, { "entropy": 5.5586803436279295, "epoch": 1.524854862119013, "grad_norm": 1.046875, "learning_rate": 0.00047713969115333916, "loss": 5.0944, "mean_token_accuracy": 0.1903443843126297, "num_tokens": 34889408.0, "step": 16810 }, { "entropy": 5.450815200805664, "epoch": 1.5253084179970973, "grad_norm": 1.0078125, "learning_rate": 0.0004771254787400666, "loss": 5.1132, "mean_token_accuracy": 0.1963221773505211, "num_tokens": 34899602.0, "step": 16815 }, { "entropy": 5.44207181930542, "epoch": 1.5257619738751815, "grad_norm": 0.98046875, "learning_rate": 0.0004771112621467876, "loss": 4.9505, "mean_token_accuracy": 0.2069842994213104, "num_tokens": 34910215.0, "step": 16820 }, { "entropy": 5.456229877471924, "epoch": 1.5262155297532656, "grad_norm": 1.0703125, "learning_rate": 0.0004770970413737961, "loss": 5.0213, "mean_token_accuracy": 0.20532291382551193, "num_tokens": 34919641.0, "step": 16825 }, { "entropy": 5.471002292633057, "epoch": 1.5266690856313496, "grad_norm": 1.0, "learning_rate": 0.0004770828164213865, "loss": 4.9172, "mean_token_accuracy": 0.21224741041660308, "num_tokens": 34930243.0, "step": 16830 }, { "entropy": 5.45788197517395, "epoch": 1.5271226415094339, "grad_norm": 0.9609375, "learning_rate": 0.0004770685872898525, "loss": 5.0918, "mean_token_accuracy": 0.20198608040809632, "num_tokens": 34941057.0, "step": 16835 }, { "entropy": 5.445715427398682, "epoch": 1.5275761973875182, "grad_norm": 0.875, "learning_rate": 0.00047705435397948876, "loss": 4.9567, "mean_token_accuracy": 0.21087784171104432, "num_tokens": 34951150.0, "step": 16840 }, { "entropy": 5.500549840927124, "epoch": 1.5280297532656024, "grad_norm": 1.0390625, "learning_rate": 0.0004770401164905895, "loss": 5.0544, "mean_token_accuracy": 0.20310222804546357, "num_tokens": 34961648.0, "step": 16845 }, { "entropy": 5.493280649185181, "epoch": 1.5284833091436865, "grad_norm": 1.0859375, "learning_rate": 0.00047702587482344915, "loss": 5.0518, "mean_token_accuracy": 0.19782250225543976, "num_tokens": 34971573.0, "step": 16850 }, { "entropy": 5.533852434158325, "epoch": 1.5289368650217707, "grad_norm": 1.015625, "learning_rate": 0.0004770116289783622, "loss": 5.0572, "mean_token_accuracy": 0.19783697724342347, "num_tokens": 34981984.0, "step": 16855 }, { "entropy": 5.477599287033081, "epoch": 1.5293904208998548, "grad_norm": 1.046875, "learning_rate": 0.0004769973789556233, "loss": 5.0673, "mean_token_accuracy": 0.19427067041397095, "num_tokens": 34990861.0, "step": 16860 }, { "entropy": 5.468864870071411, "epoch": 1.529843976777939, "grad_norm": 0.99609375, "learning_rate": 0.00047698312475552714, "loss": 5.0612, "mean_token_accuracy": 0.19865902960300447, "num_tokens": 35001504.0, "step": 16865 }, { "entropy": 5.513449048995971, "epoch": 1.5302975326560233, "grad_norm": 0.96484375, "learning_rate": 0.0004769688663783684, "loss": 4.9603, "mean_token_accuracy": 0.21178119778633117, "num_tokens": 35012425.0, "step": 16870 }, { "entropy": 5.4784149646759035, "epoch": 1.5307510885341074, "grad_norm": 0.97265625, "learning_rate": 0.0004769546038244421, "loss": 5.0175, "mean_token_accuracy": 0.2098090261220932, "num_tokens": 35022854.0, "step": 16875 }, { "entropy": 5.484833526611328, "epoch": 1.5312046444121916, "grad_norm": 1.1015625, "learning_rate": 0.00047694033709404313, "loss": 5.0873, "mean_token_accuracy": 0.19617604464292526, "num_tokens": 35032694.0, "step": 16880 }, { "entropy": 5.469423055648804, "epoch": 1.5316582002902757, "grad_norm": 1.34375, "learning_rate": 0.00047692606618746655, "loss": 5.0101, "mean_token_accuracy": 0.20585087388753892, "num_tokens": 35042217.0, "step": 16885 }, { "entropy": 5.493360424041748, "epoch": 1.53211175616836, "grad_norm": 1.046875, "learning_rate": 0.00047691179110500735, "loss": 5.0947, "mean_token_accuracy": 0.19408292472362518, "num_tokens": 35052831.0, "step": 16890 }, { "entropy": 5.550473403930664, "epoch": 1.5325653120464442, "grad_norm": 1.0859375, "learning_rate": 0.00047689751184696097, "loss": 5.1233, "mean_token_accuracy": 0.1965404063463211, "num_tokens": 35061955.0, "step": 16895 }, { "entropy": 5.496463680267334, "epoch": 1.5330188679245285, "grad_norm": 0.9609375, "learning_rate": 0.0004768832284136226, "loss": 5.0052, "mean_token_accuracy": 0.2008708745241165, "num_tokens": 35072526.0, "step": 16900 }, { "entropy": 5.461774492263794, "epoch": 1.5334724238026125, "grad_norm": 1.015625, "learning_rate": 0.0004768689408052876, "loss": 4.9881, "mean_token_accuracy": 0.20676737129688263, "num_tokens": 35082415.0, "step": 16905 }, { "entropy": 5.41850266456604, "epoch": 1.5339259796806965, "grad_norm": 1.015625, "learning_rate": 0.00047685464902225144, "loss": 4.9846, "mean_token_accuracy": 0.20743297040462494, "num_tokens": 35092805.0, "step": 16910 }, { "entropy": 5.480488967895508, "epoch": 1.5343795355587808, "grad_norm": 1.109375, "learning_rate": 0.0004768403530648097, "loss": 5.0452, "mean_token_accuracy": 0.20416479408740998, "num_tokens": 35102963.0, "step": 16915 }, { "entropy": 5.512208795547485, "epoch": 1.534833091436865, "grad_norm": 0.921875, "learning_rate": 0.00047682605293325806, "loss": 5.0476, "mean_token_accuracy": 0.2029525101184845, "num_tokens": 35114140.0, "step": 16920 }, { "entropy": 5.556297397613525, "epoch": 1.5352866473149493, "grad_norm": 1.046875, "learning_rate": 0.00047681174862789215, "loss": 5.1231, "mean_token_accuracy": 0.20083469599485398, "num_tokens": 35125314.0, "step": 16925 }, { "entropy": 5.4553551197052, "epoch": 1.5357402031930334, "grad_norm": 0.96875, "learning_rate": 0.00047679744014900795, "loss": 5.031, "mean_token_accuracy": 0.20120671689510344, "num_tokens": 35134934.0, "step": 16930 }, { "entropy": 5.445842266082764, "epoch": 1.5361937590711174, "grad_norm": 1.0234375, "learning_rate": 0.0004767831274969011, "loss": 4.9867, "mean_token_accuracy": 0.20646168738603593, "num_tokens": 35145341.0, "step": 16935 }, { "entropy": 5.405188322067261, "epoch": 1.5366473149492017, "grad_norm": 1.0546875, "learning_rate": 0.00047676881067186793, "loss": 4.9621, "mean_token_accuracy": 0.20318075865507126, "num_tokens": 35156046.0, "step": 16940 }, { "entropy": 5.509601879119873, "epoch": 1.537100870827286, "grad_norm": 0.9921875, "learning_rate": 0.00047675448967420426, "loss": 5.1078, "mean_token_accuracy": 0.19604229927062988, "num_tokens": 35168232.0, "step": 16945 }, { "entropy": 5.554637670516968, "epoch": 1.5375544267053702, "grad_norm": 1.015625, "learning_rate": 0.0004767401645042064, "loss": 5.0774, "mean_token_accuracy": 0.19910754561424254, "num_tokens": 35178585.0, "step": 16950 }, { "entropy": 5.462687826156616, "epoch": 1.5380079825834543, "grad_norm": 1.0078125, "learning_rate": 0.00047672583516217043, "loss": 4.925, "mean_token_accuracy": 0.20886939018964767, "num_tokens": 35189417.0, "step": 16955 }, { "entropy": 5.446977043151856, "epoch": 1.5384615384615383, "grad_norm": 1.0859375, "learning_rate": 0.0004767115016483928, "loss": 4.9911, "mean_token_accuracy": 0.20271214097738266, "num_tokens": 35200167.0, "step": 16960 }, { "entropy": 5.450547170639038, "epoch": 1.5389150943396226, "grad_norm": 0.9921875, "learning_rate": 0.0004766971639631699, "loss": 5.0159, "mean_token_accuracy": 0.2063390478491783, "num_tokens": 35210711.0, "step": 16965 }, { "entropy": 5.46052041053772, "epoch": 1.5393686502177069, "grad_norm": 1.0234375, "learning_rate": 0.00047668282210679825, "loss": 5.027, "mean_token_accuracy": 0.19931799173355103, "num_tokens": 35220866.0, "step": 16970 }, { "entropy": 5.4065755844116214, "epoch": 1.5398222060957911, "grad_norm": 0.9453125, "learning_rate": 0.0004766684760795745, "loss": 4.991, "mean_token_accuracy": 0.20433398187160492, "num_tokens": 35231478.0, "step": 16975 }, { "entropy": 5.4228180885314945, "epoch": 1.5402757619738752, "grad_norm": 0.984375, "learning_rate": 0.00047665412588179524, "loss": 4.9414, "mean_token_accuracy": 0.21080203652381896, "num_tokens": 35242233.0, "step": 16980 }, { "entropy": 5.461465692520141, "epoch": 1.5407293178519592, "grad_norm": 1.0625, "learning_rate": 0.0004766397715137573, "loss": 4.9863, "mean_token_accuracy": 0.20382720977067947, "num_tokens": 35253097.0, "step": 16985 }, { "entropy": 5.542710876464843, "epoch": 1.5411828737300435, "grad_norm": 1.0234375, "learning_rate": 0.00047662541297575743, "loss": 5.1513, "mean_token_accuracy": 0.19889177531003951, "num_tokens": 35264258.0, "step": 16990 }, { "entropy": 5.590462064743042, "epoch": 1.5416364296081277, "grad_norm": 1.0859375, "learning_rate": 0.00047661105026809274, "loss": 5.1201, "mean_token_accuracy": 0.19689531922340392, "num_tokens": 35273501.0, "step": 16995 }, { "entropy": 5.468330144882202, "epoch": 1.542089985486212, "grad_norm": 0.96875, "learning_rate": 0.0004765966833910601, "loss": 5.0759, "mean_token_accuracy": 0.19669248908758163, "num_tokens": 35284125.0, "step": 17000 }, { "entropy": 5.526789712905884, "epoch": 1.542543541364296, "grad_norm": 1.0390625, "learning_rate": 0.0004765823123449567, "loss": 5.0628, "mean_token_accuracy": 0.1985797628760338, "num_tokens": 35296039.0, "step": 17005 }, { "entropy": 5.508655261993408, "epoch": 1.54299709724238, "grad_norm": 1.203125, "learning_rate": 0.00047656793713007965, "loss": 5.026, "mean_token_accuracy": 0.19966490119695662, "num_tokens": 35306178.0, "step": 17010 }, { "entropy": 5.454088258743286, "epoch": 1.5434506531204644, "grad_norm": 1.0625, "learning_rate": 0.00047655355774672636, "loss": 5.0297, "mean_token_accuracy": 0.20606312453746795, "num_tokens": 35316445.0, "step": 17015 }, { "entropy": 5.4946277141571045, "epoch": 1.5439042089985486, "grad_norm": 1.046875, "learning_rate": 0.00047653917419519413, "loss": 5.0172, "mean_token_accuracy": 0.19846705198287964, "num_tokens": 35327274.0, "step": 17020 }, { "entropy": 5.464788627624512, "epoch": 1.544357764876633, "grad_norm": 0.9140625, "learning_rate": 0.0004765247864757804, "loss": 5.0074, "mean_token_accuracy": 0.2081199824810028, "num_tokens": 35339007.0, "step": 17025 }, { "entropy": 5.501817512512207, "epoch": 1.544811320754717, "grad_norm": 1.0859375, "learning_rate": 0.0004765103945887827, "loss": 5.1151, "mean_token_accuracy": 0.1939708948135376, "num_tokens": 35349303.0, "step": 17030 }, { "entropy": 5.495471715927124, "epoch": 1.5452648766328012, "grad_norm": 1.09375, "learning_rate": 0.0004764959985344987, "loss": 4.9503, "mean_token_accuracy": 0.2076071947813034, "num_tokens": 35359556.0, "step": 17035 }, { "entropy": 5.4351763248443605, "epoch": 1.5457184325108853, "grad_norm": 1.0703125, "learning_rate": 0.0004764815983132261, "loss": 4.9882, "mean_token_accuracy": 0.2113174244761467, "num_tokens": 35370043.0, "step": 17040 }, { "entropy": 5.492875957489014, "epoch": 1.5461719883889695, "grad_norm": 1.078125, "learning_rate": 0.0004764671939252628, "loss": 4.9773, "mean_token_accuracy": 0.20762020200490952, "num_tokens": 35380031.0, "step": 17045 }, { "entropy": 5.480923652648926, "epoch": 1.5466255442670538, "grad_norm": 0.96484375, "learning_rate": 0.0004764527853709064, "loss": 5.0822, "mean_token_accuracy": 0.19705075174570083, "num_tokens": 35390481.0, "step": 17050 }, { "entropy": 5.484901428222656, "epoch": 1.5470791001451378, "grad_norm": 1.0078125, "learning_rate": 0.0004764383726504552, "loss": 5.0492, "mean_token_accuracy": 0.2008197546005249, "num_tokens": 35401756.0, "step": 17055 }, { "entropy": 5.496542692184448, "epoch": 1.547532656023222, "grad_norm": 1.0390625, "learning_rate": 0.0004764239557642071, "loss": 4.9519, "mean_token_accuracy": 0.210030297935009, "num_tokens": 35411045.0, "step": 17060 }, { "entropy": 5.452884578704834, "epoch": 1.5479862119013061, "grad_norm": 1.0234375, "learning_rate": 0.0004764095347124603, "loss": 5.0422, "mean_token_accuracy": 0.19790094047784806, "num_tokens": 35421256.0, "step": 17065 }, { "entropy": 5.477028656005859, "epoch": 1.5484397677793904, "grad_norm": 1.0078125, "learning_rate": 0.0004763951094955129, "loss": 5.0534, "mean_token_accuracy": 0.20634722858667373, "num_tokens": 35430798.0, "step": 17070 }, { "entropy": 5.459696531295776, "epoch": 1.5488933236574747, "grad_norm": 1.140625, "learning_rate": 0.0004763806801136634, "loss": 4.98, "mean_token_accuracy": 0.20889404863119126, "num_tokens": 35440459.0, "step": 17075 }, { "entropy": 5.47511854171753, "epoch": 1.549346879535559, "grad_norm": 0.9921875, "learning_rate": 0.0004763662465672101, "loss": 5.0503, "mean_token_accuracy": 0.20117164999246598, "num_tokens": 35451586.0, "step": 17080 }, { "entropy": 5.461205959320068, "epoch": 1.549800435413643, "grad_norm": 1.09375, "learning_rate": 0.00047635180885645146, "loss": 5.0447, "mean_token_accuracy": 0.20177337080240249, "num_tokens": 35462197.0, "step": 17085 }, { "entropy": 5.4906360626220705, "epoch": 1.550253991291727, "grad_norm": 1.140625, "learning_rate": 0.0004763373669816862, "loss": 4.976, "mean_token_accuracy": 0.20594133883714677, "num_tokens": 35471737.0, "step": 17090 }, { "entropy": 5.531971597671509, "epoch": 1.5507075471698113, "grad_norm": 1.0390625, "learning_rate": 0.0004763229209432128, "loss": 5.0663, "mean_token_accuracy": 0.19618499726057054, "num_tokens": 35482016.0, "step": 17095 }, { "entropy": 5.5213315963745115, "epoch": 1.5511611030478956, "grad_norm": 1.109375, "learning_rate": 0.0004763084707413301, "loss": 5.1459, "mean_token_accuracy": 0.19054511934518814, "num_tokens": 35492622.0, "step": 17100 }, { "entropy": 5.563022708892822, "epoch": 1.5516146589259798, "grad_norm": 1.109375, "learning_rate": 0.00047629401637633696, "loss": 5.1641, "mean_token_accuracy": 0.19278692454099655, "num_tokens": 35504468.0, "step": 17105 }, { "entropy": 5.48358039855957, "epoch": 1.5520682148040639, "grad_norm": 1.0625, "learning_rate": 0.00047627955784853226, "loss": 5.0069, "mean_token_accuracy": 0.20332055240869523, "num_tokens": 35514272.0, "step": 17110 }, { "entropy": 5.466148757934571, "epoch": 1.552521770682148, "grad_norm": 1.046875, "learning_rate": 0.000476265095158215, "loss": 5.0114, "mean_token_accuracy": 0.1989905506372452, "num_tokens": 35524110.0, "step": 17115 }, { "entropy": 5.470710515975952, "epoch": 1.5529753265602322, "grad_norm": 0.9453125, "learning_rate": 0.0004762506283056843, "loss": 4.9318, "mean_token_accuracy": 0.20816477686166762, "num_tokens": 35535504.0, "step": 17120 }, { "entropy": 5.559068012237549, "epoch": 1.5534288824383164, "grad_norm": 1.09375, "learning_rate": 0.0004762361572912393, "loss": 5.1155, "mean_token_accuracy": 0.19728371649980544, "num_tokens": 35544885.0, "step": 17125 }, { "entropy": 5.5046227931976315, "epoch": 1.5538824383164007, "grad_norm": 0.9765625, "learning_rate": 0.00047622168211517926, "loss": 5.1221, "mean_token_accuracy": 0.20438388139009475, "num_tokens": 35555485.0, "step": 17130 }, { "entropy": 5.402403116226196, "epoch": 1.5543359941944848, "grad_norm": 0.9921875, "learning_rate": 0.00047620720277780353, "loss": 4.9691, "mean_token_accuracy": 0.20560143738985062, "num_tokens": 35567197.0, "step": 17135 }, { "entropy": 5.494960880279541, "epoch": 1.5547895500725688, "grad_norm": 1.0234375, "learning_rate": 0.00047619271927941165, "loss": 4.9806, "mean_token_accuracy": 0.20391893535852432, "num_tokens": 35577576.0, "step": 17140 }, { "entropy": 5.511598587036133, "epoch": 1.555243105950653, "grad_norm": 1.0546875, "learning_rate": 0.000476178231620303, "loss": 5.0432, "mean_token_accuracy": 0.20576838552951812, "num_tokens": 35588012.0, "step": 17145 }, { "entropy": 5.445739316940307, "epoch": 1.5556966618287373, "grad_norm": 1.0859375, "learning_rate": 0.0004761637398007774, "loss": 5.041, "mean_token_accuracy": 0.19566175490617752, "num_tokens": 35598076.0, "step": 17150 }, { "entropy": 5.369255447387696, "epoch": 1.5561502177068216, "grad_norm": 1.1015625, "learning_rate": 0.0004761492438211342, "loss": 4.8647, "mean_token_accuracy": 0.21140484064817427, "num_tokens": 35607170.0, "step": 17155 }, { "entropy": 5.459671115875244, "epoch": 1.5566037735849056, "grad_norm": 0.99609375, "learning_rate": 0.00047613474368167355, "loss": 4.9952, "mean_token_accuracy": 0.1980486512184143, "num_tokens": 35617865.0, "step": 17160 }, { "entropy": 5.46323184967041, "epoch": 1.5570573294629897, "grad_norm": 1.078125, "learning_rate": 0.000476120239382695, "loss": 5.052, "mean_token_accuracy": 0.2007809489965439, "num_tokens": 35629329.0, "step": 17165 }, { "entropy": 5.436124324798584, "epoch": 1.557510885341074, "grad_norm": 0.98828125, "learning_rate": 0.00047610573092449877, "loss": 5.0538, "mean_token_accuracy": 0.2006940186023712, "num_tokens": 35640044.0, "step": 17170 }, { "entropy": 5.494205141067505, "epoch": 1.5579644412191582, "grad_norm": 1.078125, "learning_rate": 0.0004760912183073847, "loss": 5.0762, "mean_token_accuracy": 0.20123564600944518, "num_tokens": 35650435.0, "step": 17175 }, { "entropy": 5.4975340366363525, "epoch": 1.5584179970972425, "grad_norm": 0.9765625, "learning_rate": 0.000476076701531653, "loss": 4.9882, "mean_token_accuracy": 0.19984416663646698, "num_tokens": 35659613.0, "step": 17180 }, { "entropy": 5.459752035140991, "epoch": 1.5588715529753265, "grad_norm": 1.0078125, "learning_rate": 0.0004760621805976039, "loss": 4.9859, "mean_token_accuracy": 0.20718168765306472, "num_tokens": 35670987.0, "step": 17185 }, { "entropy": 5.444336748123169, "epoch": 1.5593251088534106, "grad_norm": 0.97265625, "learning_rate": 0.00047604765550553766, "loss": 5.0055, "mean_token_accuracy": 0.2051151990890503, "num_tokens": 35682505.0, "step": 17190 }, { "entropy": 5.491911554336548, "epoch": 1.5597786647314948, "grad_norm": 1.078125, "learning_rate": 0.00047603312625575466, "loss": 4.9619, "mean_token_accuracy": 0.201934751868248, "num_tokens": 35693056.0, "step": 17195 }, { "entropy": 5.482431507110595, "epoch": 1.5602322206095791, "grad_norm": 0.95703125, "learning_rate": 0.00047601859284855544, "loss": 4.9538, "mean_token_accuracy": 0.2076956808567047, "num_tokens": 35703659.0, "step": 17200 }, { "entropy": 5.4399041652679445, "epoch": 1.5606857764876634, "grad_norm": 1.0078125, "learning_rate": 0.0004760040552842403, "loss": 5.0202, "mean_token_accuracy": 0.20117031484842302, "num_tokens": 35714367.0, "step": 17205 }, { "entropy": 5.427831983566284, "epoch": 1.5611393323657474, "grad_norm": 0.90625, "learning_rate": 0.00047598951356311035, "loss": 4.9772, "mean_token_accuracy": 0.2012833297252655, "num_tokens": 35724773.0, "step": 17210 }, { "entropy": 5.503310632705689, "epoch": 1.5615928882438317, "grad_norm": 0.99609375, "learning_rate": 0.0004759749676854658, "loss": 5.1229, "mean_token_accuracy": 0.20039318054914473, "num_tokens": 35735622.0, "step": 17215 }, { "entropy": 5.483645105361939, "epoch": 1.5620464441219157, "grad_norm": 1.03125, "learning_rate": 0.0004759604176516079, "loss": 4.9969, "mean_token_accuracy": 0.20171262621879577, "num_tokens": 35744967.0, "step": 17220 }, { "entropy": 5.514835691452026, "epoch": 1.5625, "grad_norm": 1.0, "learning_rate": 0.0004759458634618372, "loss": 5.038, "mean_token_accuracy": 0.20375445038080214, "num_tokens": 35755647.0, "step": 17225 }, { "entropy": 5.5152352809906, "epoch": 1.5629535558780843, "grad_norm": 0.99609375, "learning_rate": 0.0004759313051164549, "loss": 5.0657, "mean_token_accuracy": 0.19798210710287095, "num_tokens": 35765595.0, "step": 17230 }, { "entropy": 5.488061761856079, "epoch": 1.5634071117561683, "grad_norm": 0.96875, "learning_rate": 0.000475916742615762, "loss": 5.0201, "mean_token_accuracy": 0.2076081156730652, "num_tokens": 35775804.0, "step": 17235 }, { "entropy": 5.439621925354004, "epoch": 1.5638606676342526, "grad_norm": 1.03125, "learning_rate": 0.0004759021759600597, "loss": 4.9551, "mean_token_accuracy": 0.20495265871286392, "num_tokens": 35786227.0, "step": 17240 }, { "entropy": 5.534026145935059, "epoch": 1.5643142235123366, "grad_norm": 0.96875, "learning_rate": 0.0004758876051496492, "loss": 5.0943, "mean_token_accuracy": 0.20041575878858567, "num_tokens": 35797511.0, "step": 17245 }, { "entropy": 5.522281551361084, "epoch": 1.5647677793904209, "grad_norm": 1.0546875, "learning_rate": 0.00047587303018483177, "loss": 5.0393, "mean_token_accuracy": 0.1994968682527542, "num_tokens": 35807248.0, "step": 17250 }, { "entropy": 5.456273937225342, "epoch": 1.5652213352685052, "grad_norm": 0.98046875, "learning_rate": 0.00047585845106590897, "loss": 5.0502, "mean_token_accuracy": 0.19496332108974457, "num_tokens": 35818164.0, "step": 17255 }, { "entropy": 5.452196455001831, "epoch": 1.5656748911465894, "grad_norm": 0.984375, "learning_rate": 0.00047584386779318214, "loss": 5.0088, "mean_token_accuracy": 0.2102777451276779, "num_tokens": 35828746.0, "step": 17260 }, { "entropy": 5.505143165588379, "epoch": 1.5661284470246735, "grad_norm": 0.9453125, "learning_rate": 0.000475829280366953, "loss": 5.0681, "mean_token_accuracy": 0.19939089864492415, "num_tokens": 35839325.0, "step": 17265 }, { "entropy": 5.5186365127563475, "epoch": 1.5665820029027575, "grad_norm": 1.171875, "learning_rate": 0.00047581468878752313, "loss": 5.0031, "mean_token_accuracy": 0.2021453469991684, "num_tokens": 35849406.0, "step": 17270 }, { "entropy": 5.4193699836730955, "epoch": 1.5670355587808418, "grad_norm": 1.1015625, "learning_rate": 0.00047580009305519427, "loss": 4.9274, "mean_token_accuracy": 0.20751346796751022, "num_tokens": 35858715.0, "step": 17275 }, { "entropy": 5.423898935317993, "epoch": 1.567489114658926, "grad_norm": 1.0703125, "learning_rate": 0.0004757854931702684, "loss": 5.0165, "mean_token_accuracy": 0.19944613724946975, "num_tokens": 35869063.0, "step": 17280 }, { "entropy": 5.410208749771118, "epoch": 1.5679426705370103, "grad_norm": 1.03125, "learning_rate": 0.00047577088913304733, "loss": 4.8774, "mean_token_accuracy": 0.211069056391716, "num_tokens": 35878428.0, "step": 17285 }, { "entropy": 5.506030941009522, "epoch": 1.5683962264150944, "grad_norm": 0.98828125, "learning_rate": 0.00047575628094383317, "loss": 5.0343, "mean_token_accuracy": 0.20377001017332078, "num_tokens": 35888801.0, "step": 17290 }, { "entropy": 5.4538154125213625, "epoch": 1.5688497822931784, "grad_norm": 0.9609375, "learning_rate": 0.0004757416686029279, "loss": 5.0433, "mean_token_accuracy": 0.19881603121757507, "num_tokens": 35899381.0, "step": 17295 }, { "entropy": 5.532286357879639, "epoch": 1.5693033381712627, "grad_norm": 1.046875, "learning_rate": 0.0004757270521106338, "loss": 5.0492, "mean_token_accuracy": 0.20354195833206176, "num_tokens": 35909546.0, "step": 17300 }, { "entropy": 5.494843816757202, "epoch": 1.569756894049347, "grad_norm": 1.0703125, "learning_rate": 0.0004757124314672531, "loss": 5.0429, "mean_token_accuracy": 0.20009820461273192, "num_tokens": 35919301.0, "step": 17305 }, { "entropy": 5.554700803756714, "epoch": 1.5702104499274312, "grad_norm": 1.0546875, "learning_rate": 0.00047569780667308816, "loss": 5.0887, "mean_token_accuracy": 0.19441407918930054, "num_tokens": 35928603.0, "step": 17310 }, { "entropy": 5.518079233169556, "epoch": 1.5706640058055152, "grad_norm": 0.93359375, "learning_rate": 0.00047568317772844147, "loss": 5.0644, "mean_token_accuracy": 0.20570893883705138, "num_tokens": 35939005.0, "step": 17315 }, { "entropy": 5.520797824859619, "epoch": 1.5711175616835993, "grad_norm": 1.0234375, "learning_rate": 0.00047566854463361544, "loss": 5.0279, "mean_token_accuracy": 0.21340527683496474, "num_tokens": 35948471.0, "step": 17320 }, { "entropy": 5.453506898880005, "epoch": 1.5715711175616836, "grad_norm": 1.0546875, "learning_rate": 0.0004756539073889128, "loss": 5.0509, "mean_token_accuracy": 0.20369320809841157, "num_tokens": 35958488.0, "step": 17325 }, { "entropy": 5.469555282592774, "epoch": 1.5720246734397678, "grad_norm": 1.125, "learning_rate": 0.00047563926599463623, "loss": 5.0951, "mean_token_accuracy": 0.19554762095212935, "num_tokens": 35968291.0, "step": 17330 }, { "entropy": 5.52074933052063, "epoch": 1.572478229317852, "grad_norm": 1.078125, "learning_rate": 0.0004756246204510886, "loss": 5.0074, "mean_token_accuracy": 0.20523636490106584, "num_tokens": 35978565.0, "step": 17335 }, { "entropy": 5.518031311035156, "epoch": 1.5729317851959361, "grad_norm": 1.0390625, "learning_rate": 0.00047560997075857253, "loss": 4.9782, "mean_token_accuracy": 0.2091346338391304, "num_tokens": 35987483.0, "step": 17340 }, { "entropy": 5.463924551010132, "epoch": 1.5733853410740202, "grad_norm": 1.0234375, "learning_rate": 0.0004755953169173913, "loss": 5.05, "mean_token_accuracy": 0.2015296921133995, "num_tokens": 35998355.0, "step": 17345 }, { "entropy": 5.430660200119019, "epoch": 1.5738388969521044, "grad_norm": 1.0234375, "learning_rate": 0.0004755806589278477, "loss": 5.0066, "mean_token_accuracy": 0.20899967551231385, "num_tokens": 36008365.0, "step": 17350 }, { "entropy": 5.555283308029175, "epoch": 1.5742924528301887, "grad_norm": 1.09375, "learning_rate": 0.00047556599679024497, "loss": 5.0972, "mean_token_accuracy": 0.1958293840289116, "num_tokens": 36018880.0, "step": 17355 }, { "entropy": 5.51357364654541, "epoch": 1.574746008708273, "grad_norm": 0.99609375, "learning_rate": 0.00047555133050488637, "loss": 5.0895, "mean_token_accuracy": 0.1966924175620079, "num_tokens": 36029335.0, "step": 17360 }, { "entropy": 5.453938341140747, "epoch": 1.575199564586357, "grad_norm": 1.015625, "learning_rate": 0.00047553666007207516, "loss": 5.0047, "mean_token_accuracy": 0.20600392371416093, "num_tokens": 36039774.0, "step": 17365 }, { "entropy": 5.546820974349975, "epoch": 1.575653120464441, "grad_norm": 1.0078125, "learning_rate": 0.00047552198549211463, "loss": 5.1191, "mean_token_accuracy": 0.2065078005194664, "num_tokens": 36049864.0, "step": 17370 }, { "entropy": 5.493776798248291, "epoch": 1.5761066763425253, "grad_norm": 1.0859375, "learning_rate": 0.0004755073067653084, "loss": 5.0559, "mean_token_accuracy": 0.201724611222744, "num_tokens": 36059224.0, "step": 17375 }, { "entropy": 5.396344470977783, "epoch": 1.5765602322206096, "grad_norm": 1.1328125, "learning_rate": 0.0004754926238919599, "loss": 4.9697, "mean_token_accuracy": 0.2090330973267555, "num_tokens": 36069243.0, "step": 17380 }, { "entropy": 5.4583470821380615, "epoch": 1.5770137880986939, "grad_norm": 0.90234375, "learning_rate": 0.0004754779368723729, "loss": 5.0194, "mean_token_accuracy": 0.19869593530893326, "num_tokens": 36079833.0, "step": 17385 }, { "entropy": 5.4581746578216555, "epoch": 1.577467343976778, "grad_norm": 0.9296875, "learning_rate": 0.0004754632457068511, "loss": 5.0142, "mean_token_accuracy": 0.20282623767852784, "num_tokens": 36090673.0, "step": 17390 }, { "entropy": 5.523070287704468, "epoch": 1.5779208998548622, "grad_norm": 1.0234375, "learning_rate": 0.0004754485503956982, "loss": 5.0479, "mean_token_accuracy": 0.20229505598545075, "num_tokens": 36101719.0, "step": 17395 }, { "entropy": 5.474701833724976, "epoch": 1.5783744557329462, "grad_norm": 1.03125, "learning_rate": 0.0004754338509392183, "loss": 5.0129, "mean_token_accuracy": 0.20093010663986205, "num_tokens": 36112352.0, "step": 17400 }, { "entropy": 5.390445518493652, "epoch": 1.5788280116110305, "grad_norm": 1.0859375, "learning_rate": 0.0004754191473377153, "loss": 4.8993, "mean_token_accuracy": 0.21064423024654388, "num_tokens": 36121797.0, "step": 17405 }, { "entropy": 5.509427547454834, "epoch": 1.5792815674891147, "grad_norm": 1.0625, "learning_rate": 0.00047540443959149316, "loss": 5.0366, "mean_token_accuracy": 0.2050464019179344, "num_tokens": 36132094.0, "step": 17410 }, { "entropy": 5.456129741668701, "epoch": 1.5797351233671988, "grad_norm": 0.96875, "learning_rate": 0.0004753897277008562, "loss": 5.0035, "mean_token_accuracy": 0.20656346082687377, "num_tokens": 36142860.0, "step": 17415 }, { "entropy": 5.454633522033691, "epoch": 1.580188679245283, "grad_norm": 1.015625, "learning_rate": 0.0004753750116661086, "loss": 5.0048, "mean_token_accuracy": 0.2003056824207306, "num_tokens": 36154555.0, "step": 17420 }, { "entropy": 5.552618885040284, "epoch": 1.580642235123367, "grad_norm": 1.0859375, "learning_rate": 0.00047536029148755477, "loss": 5.1381, "mean_token_accuracy": 0.19052140563726425, "num_tokens": 36165479.0, "step": 17425 }, { "entropy": 5.520594263076783, "epoch": 1.5810957910014514, "grad_norm": 0.9296875, "learning_rate": 0.00047534556716549893, "loss": 5.0481, "mean_token_accuracy": 0.19806084036827087, "num_tokens": 36175873.0, "step": 17430 }, { "entropy": 5.451658058166504, "epoch": 1.5815493468795356, "grad_norm": 1.1796875, "learning_rate": 0.00047533083870024575, "loss": 4.9963, "mean_token_accuracy": 0.20834531933069228, "num_tokens": 36186792.0, "step": 17435 }, { "entropy": 5.58074460029602, "epoch": 1.58200290275762, "grad_norm": 1.0546875, "learning_rate": 0.0004753161060920998, "loss": 5.1355, "mean_token_accuracy": 0.19570015370845795, "num_tokens": 36196691.0, "step": 17440 }, { "entropy": 5.543552112579346, "epoch": 1.582456458635704, "grad_norm": 1.0703125, "learning_rate": 0.0004753013693413657, "loss": 5.0239, "mean_token_accuracy": 0.20646632611751556, "num_tokens": 36207173.0, "step": 17445 }, { "entropy": 5.421489238739014, "epoch": 1.582910014513788, "grad_norm": 1.0390625, "learning_rate": 0.00047528662844834827, "loss": 5.0331, "mean_token_accuracy": 0.2075946345925331, "num_tokens": 36217912.0, "step": 17450 }, { "entropy": 5.398891305923462, "epoch": 1.5833635703918723, "grad_norm": 1.0859375, "learning_rate": 0.00047527188341335233, "loss": 4.9316, "mean_token_accuracy": 0.21199720352888107, "num_tokens": 36227714.0, "step": 17455 }, { "entropy": 5.445325946807861, "epoch": 1.5838171262699565, "grad_norm": 1.1953125, "learning_rate": 0.0004752571342366828, "loss": 5.0147, "mean_token_accuracy": 0.20611771643161775, "num_tokens": 36239114.0, "step": 17460 }, { "entropy": 5.477443838119507, "epoch": 1.5842706821480408, "grad_norm": 1.0546875, "learning_rate": 0.0004752423809186446, "loss": 5.0398, "mean_token_accuracy": 0.1966667056083679, "num_tokens": 36249436.0, "step": 17465 }, { "entropy": 5.484793281555175, "epoch": 1.5847242380261248, "grad_norm": 1.1484375, "learning_rate": 0.00047522762345954305, "loss": 4.9869, "mean_token_accuracy": 0.20474329739809036, "num_tokens": 36259541.0, "step": 17470 }, { "entropy": 5.50005259513855, "epoch": 1.5851777939042089, "grad_norm": 1.0078125, "learning_rate": 0.0004752128618596832, "loss": 5.0283, "mean_token_accuracy": 0.20062110126018523, "num_tokens": 36270689.0, "step": 17475 }, { "entropy": 5.544193458557129, "epoch": 1.5856313497822931, "grad_norm": 0.9609375, "learning_rate": 0.00047519809611937036, "loss": 5.0876, "mean_token_accuracy": 0.20171278715133667, "num_tokens": 36281191.0, "step": 17480 }, { "entropy": 5.404801845550537, "epoch": 1.5860849056603774, "grad_norm": 1.0234375, "learning_rate": 0.0004751833262389098, "loss": 4.977, "mean_token_accuracy": 0.20927282869815828, "num_tokens": 36291022.0, "step": 17485 }, { "entropy": 5.480946731567383, "epoch": 1.5865384615384617, "grad_norm": 1.03125, "learning_rate": 0.00047516855221860715, "loss": 5.0439, "mean_token_accuracy": 0.20702706277370453, "num_tokens": 36301237.0, "step": 17490 }, { "entropy": 5.524582624435425, "epoch": 1.5869920174165457, "grad_norm": 1.140625, "learning_rate": 0.00047515377405876774, "loss": 5.0159, "mean_token_accuracy": 0.2019112601876259, "num_tokens": 36311792.0, "step": 17495 }, { "entropy": 5.429810190200806, "epoch": 1.5874455732946298, "grad_norm": 1.0, "learning_rate": 0.0004751389917596973, "loss": 5.002, "mean_token_accuracy": 0.21173593252897263, "num_tokens": 36321847.0, "step": 17500 }, { "entropy": 5.47958607673645, "epoch": 1.587899129172714, "grad_norm": 1.0703125, "learning_rate": 0.00047512420532170154, "loss": 5.0899, "mean_token_accuracy": 0.19647079110145568, "num_tokens": 36332735.0, "step": 17505 }, { "entropy": 5.551001119613647, "epoch": 1.5883526850507983, "grad_norm": 1.0625, "learning_rate": 0.0004751094147450862, "loss": 5.0935, "mean_token_accuracy": 0.2003138318657875, "num_tokens": 36343149.0, "step": 17510 }, { "entropy": 5.507878112792969, "epoch": 1.5888062409288826, "grad_norm": 0.9609375, "learning_rate": 0.0004750946200301571, "loss": 4.993, "mean_token_accuracy": 0.20172460824251176, "num_tokens": 36353081.0, "step": 17515 }, { "entropy": 5.495229005813599, "epoch": 1.5892597968069666, "grad_norm": 0.9765625, "learning_rate": 0.00047507982117722035, "loss": 5.0591, "mean_token_accuracy": 0.19884295612573624, "num_tokens": 36363624.0, "step": 17520 }, { "entropy": 5.502510929107666, "epoch": 1.5897133526850507, "grad_norm": 1.0234375, "learning_rate": 0.000475065018186582, "loss": 5.0787, "mean_token_accuracy": 0.20070028454065322, "num_tokens": 36374081.0, "step": 17525 }, { "entropy": 5.531485462188721, "epoch": 1.590166908563135, "grad_norm": 1.0703125, "learning_rate": 0.00047505021105854794, "loss": 5.152, "mean_token_accuracy": 0.19617709517478943, "num_tokens": 36384360.0, "step": 17530 }, { "entropy": 5.496904516220093, "epoch": 1.5906204644412192, "grad_norm": 1.0390625, "learning_rate": 0.00047503539979342456, "loss": 5.0613, "mean_token_accuracy": 0.2044987738132477, "num_tokens": 36395924.0, "step": 17535 }, { "entropy": 5.415366888046265, "epoch": 1.5910740203193035, "grad_norm": 1.0546875, "learning_rate": 0.0004750205843915182, "loss": 4.9455, "mean_token_accuracy": 0.20962637960910796, "num_tokens": 36405246.0, "step": 17540 }, { "entropy": 5.430236911773681, "epoch": 1.5915275761973875, "grad_norm": 1.0859375, "learning_rate": 0.0004750057648531351, "loss": 4.9812, "mean_token_accuracy": 0.2136492133140564, "num_tokens": 36414964.0, "step": 17545 }, { "entropy": 5.446323585510254, "epoch": 1.5919811320754715, "grad_norm": 1.09375, "learning_rate": 0.0004749909411785819, "loss": 5.0588, "mean_token_accuracy": 0.20096035599708556, "num_tokens": 36425011.0, "step": 17550 }, { "entropy": 5.405447196960449, "epoch": 1.5924346879535558, "grad_norm": 1.0703125, "learning_rate": 0.000474976113368165, "loss": 4.9361, "mean_token_accuracy": 0.21336206048727036, "num_tokens": 36434734.0, "step": 17555 }, { "entropy": 5.499809455871582, "epoch": 1.59288824383164, "grad_norm": 1.0390625, "learning_rate": 0.0004749612814221912, "loss": 5.0522, "mean_token_accuracy": 0.20356599539518355, "num_tokens": 36444748.0, "step": 17560 }, { "entropy": 5.572061347961426, "epoch": 1.5933417997097243, "grad_norm": 1.0078125, "learning_rate": 0.00047494644534096703, "loss": 5.0557, "mean_token_accuracy": 0.19582525193691253, "num_tokens": 36455076.0, "step": 17565 }, { "entropy": 5.4799888134002686, "epoch": 1.5937953555878084, "grad_norm": 1.1328125, "learning_rate": 0.0004749316051247995, "loss": 4.9621, "mean_token_accuracy": 0.20652810633182525, "num_tokens": 36465302.0, "step": 17570 }, { "entropy": 5.472163486480713, "epoch": 1.5942489114658926, "grad_norm": 1.0390625, "learning_rate": 0.00047491676077399543, "loss": 5.082, "mean_token_accuracy": 0.1985471338033676, "num_tokens": 36476666.0, "step": 17575 }, { "entropy": 5.448248291015625, "epoch": 1.5947024673439767, "grad_norm": 0.94921875, "learning_rate": 0.0004749019122888618, "loss": 4.9232, "mean_token_accuracy": 0.20897077918052673, "num_tokens": 36487379.0, "step": 17580 }, { "entropy": 5.476648759841919, "epoch": 1.595156023222061, "grad_norm": 1.0625, "learning_rate": 0.00047488705966970565, "loss": 4.9412, "mean_token_accuracy": 0.2087975949048996, "num_tokens": 36497897.0, "step": 17585 }, { "entropy": 5.47394323348999, "epoch": 1.5956095791001452, "grad_norm": 1.265625, "learning_rate": 0.0004748722029168342, "loss": 5.0716, "mean_token_accuracy": 0.21110234707593917, "num_tokens": 36508528.0, "step": 17590 }, { "entropy": 5.546425628662109, "epoch": 1.5960631349782293, "grad_norm": 1.046875, "learning_rate": 0.0004748573420305546, "loss": 5.0717, "mean_token_accuracy": 0.19552092254161835, "num_tokens": 36519196.0, "step": 17595 }, { "entropy": 5.486793088912964, "epoch": 1.5965166908563135, "grad_norm": 0.9296875, "learning_rate": 0.00047484247701117427, "loss": 5.0324, "mean_token_accuracy": 0.20387091487646103, "num_tokens": 36529871.0, "step": 17600 }, { "entropy": 5.559619188308716, "epoch": 1.5969702467343976, "grad_norm": 1.015625, "learning_rate": 0.0004748276078590006, "loss": 5.1168, "mean_token_accuracy": 0.1933345079421997, "num_tokens": 36541188.0, "step": 17605 }, { "entropy": 5.570701646804809, "epoch": 1.5974238026124818, "grad_norm": 1.0390625, "learning_rate": 0.0004748127345743411, "loss": 5.0872, "mean_token_accuracy": 0.19958331286907197, "num_tokens": 36551968.0, "step": 17610 }, { "entropy": 5.499534845352173, "epoch": 1.5978773584905661, "grad_norm": 1.109375, "learning_rate": 0.0004747978571575033, "loss": 5.0261, "mean_token_accuracy": 0.20338878333568572, "num_tokens": 36562870.0, "step": 17615 }, { "entropy": 5.434991502761841, "epoch": 1.5983309143686504, "grad_norm": 0.9609375, "learning_rate": 0.0004747829756087949, "loss": 4.9735, "mean_token_accuracy": 0.20664169192314147, "num_tokens": 36573295.0, "step": 17620 }, { "entropy": 5.422763395309448, "epoch": 1.5987844702467344, "grad_norm": 0.94140625, "learning_rate": 0.00047476808992852364, "loss": 4.9687, "mean_token_accuracy": 0.20708438158035278, "num_tokens": 36583830.0, "step": 17625 }, { "entropy": 5.492862510681152, "epoch": 1.5992380261248185, "grad_norm": 1.03125, "learning_rate": 0.0004747532001169974, "loss": 5.0389, "mean_token_accuracy": 0.20989180207252503, "num_tokens": 36594052.0, "step": 17630 }, { "entropy": 5.492591047286988, "epoch": 1.5996915820029027, "grad_norm": 1.1796875, "learning_rate": 0.00047473830617452415, "loss": 5.0543, "mean_token_accuracy": 0.2044448286294937, "num_tokens": 36604378.0, "step": 17635 }, { "entropy": 5.549684762954712, "epoch": 1.600145137880987, "grad_norm": 0.953125, "learning_rate": 0.00047472340810141163, "loss": 5.1528, "mean_token_accuracy": 0.1934247389435768, "num_tokens": 36615588.0, "step": 17640 }, { "entropy": 5.529037714004517, "epoch": 1.6005986937590713, "grad_norm": 1.0625, "learning_rate": 0.00047470850589796833, "loss": 5.0221, "mean_token_accuracy": 0.2031117007136345, "num_tokens": 36626369.0, "step": 17645 }, { "entropy": 5.557148599624634, "epoch": 1.6010522496371553, "grad_norm": 0.984375, "learning_rate": 0.00047469359956450215, "loss": 5.0752, "mean_token_accuracy": 0.20016029179096223, "num_tokens": 36636565.0, "step": 17650 }, { "entropy": 5.576334810256958, "epoch": 1.6015058055152394, "grad_norm": 0.96875, "learning_rate": 0.00047467868910132144, "loss": 5.143, "mean_token_accuracy": 0.195332433283329, "num_tokens": 36647721.0, "step": 17655 }, { "entropy": 5.43845763206482, "epoch": 1.6019593613933236, "grad_norm": 1.03125, "learning_rate": 0.0004746637745087346, "loss": 4.9463, "mean_token_accuracy": 0.21079145073890687, "num_tokens": 36657887.0, "step": 17660 }, { "entropy": 5.54886908531189, "epoch": 1.6024129172714079, "grad_norm": 1.03125, "learning_rate": 0.00047464885578705, "loss": 5.0325, "mean_token_accuracy": 0.19845932424068452, "num_tokens": 36667918.0, "step": 17665 }, { "entropy": 5.412156295776367, "epoch": 1.6028664731494922, "grad_norm": 1.0234375, "learning_rate": 0.00047463393293657616, "loss": 4.997, "mean_token_accuracy": 0.20855554342269897, "num_tokens": 36678491.0, "step": 17670 }, { "entropy": 5.461192035675049, "epoch": 1.6033200290275762, "grad_norm": 0.98046875, "learning_rate": 0.0004746190059576217, "loss": 5.0682, "mean_token_accuracy": 0.20264270305633544, "num_tokens": 36688638.0, "step": 17675 }, { "entropy": 5.509416723251343, "epoch": 1.6037735849056602, "grad_norm": 1.15625, "learning_rate": 0.0004746040748504954, "loss": 5.0313, "mean_token_accuracy": 0.20608117133378984, "num_tokens": 36699344.0, "step": 17680 }, { "entropy": 5.536354207992554, "epoch": 1.6042271407837445, "grad_norm": 1.109375, "learning_rate": 0.00047458913961550593, "loss": 5.0066, "mean_token_accuracy": 0.20165850818157197, "num_tokens": 36709606.0, "step": 17685 }, { "entropy": 5.404119205474854, "epoch": 1.6046806966618288, "grad_norm": 1.1484375, "learning_rate": 0.0004745742002529622, "loss": 4.9664, "mean_token_accuracy": 0.20458258390426637, "num_tokens": 36718740.0, "step": 17690 }, { "entropy": 5.48478217124939, "epoch": 1.605134252539913, "grad_norm": 0.9921875, "learning_rate": 0.0004745592567631731, "loss": 5.0489, "mean_token_accuracy": 0.19957852363586426, "num_tokens": 36729960.0, "step": 17695 }, { "entropy": 5.447217512130737, "epoch": 1.605587808417997, "grad_norm": 1.03125, "learning_rate": 0.00047454430914644773, "loss": 4.9553, "mean_token_accuracy": 0.2100689634680748, "num_tokens": 36740221.0, "step": 17700 }, { "entropy": 5.379448938369751, "epoch": 1.6060413642960811, "grad_norm": 1.0546875, "learning_rate": 0.0004745293574030952, "loss": 4.9517, "mean_token_accuracy": 0.21736128628253937, "num_tokens": 36750841.0, "step": 17705 }, { "entropy": 5.435540294647216, "epoch": 1.6064949201741654, "grad_norm": 1.0234375, "learning_rate": 0.00047451440153342477, "loss": 5.0262, "mean_token_accuracy": 0.196967151761055, "num_tokens": 36760944.0, "step": 17710 }, { "entropy": 5.5174620151519775, "epoch": 1.6069484760522497, "grad_norm": 1.0703125, "learning_rate": 0.0004744994415377457, "loss": 4.9981, "mean_token_accuracy": 0.20317866504192353, "num_tokens": 36770922.0, "step": 17715 }, { "entropy": 5.5168322086334225, "epoch": 1.607402031930334, "grad_norm": 1.0390625, "learning_rate": 0.00047448447741636724, "loss": 5.0333, "mean_token_accuracy": 0.19724370688199996, "num_tokens": 36780702.0, "step": 17720 }, { "entropy": 5.512592697143555, "epoch": 1.607855587808418, "grad_norm": 1.03125, "learning_rate": 0.00047446950916959905, "loss": 5.0667, "mean_token_accuracy": 0.1964994862675667, "num_tokens": 36791868.0, "step": 17725 }, { "entropy": 5.527849912643433, "epoch": 1.608309143686502, "grad_norm": 1.09375, "learning_rate": 0.0004744545367977505, "loss": 5.0488, "mean_token_accuracy": 0.20466661155223848, "num_tokens": 36802330.0, "step": 17730 }, { "entropy": 5.483583068847656, "epoch": 1.6087626995645863, "grad_norm": 1.171875, "learning_rate": 0.00047443956030113134, "loss": 5.0719, "mean_token_accuracy": 0.19980328381061555, "num_tokens": 36812936.0, "step": 17735 }, { "entropy": 5.525945472717285, "epoch": 1.6092162554426706, "grad_norm": 1.0546875, "learning_rate": 0.00047442457968005123, "loss": 5.0338, "mean_token_accuracy": 0.20068635195493698, "num_tokens": 36823123.0, "step": 17740 }, { "entropy": 5.415410566329956, "epoch": 1.6096698113207548, "grad_norm": 1.1484375, "learning_rate": 0.00047440959493481996, "loss": 4.907, "mean_token_accuracy": 0.21537703424692153, "num_tokens": 36833050.0, "step": 17745 }, { "entropy": 5.484205007553101, "epoch": 1.6101233671988389, "grad_norm": 1.0703125, "learning_rate": 0.00047439460606574745, "loss": 5.0534, "mean_token_accuracy": 0.20483941286802293, "num_tokens": 36842520.0, "step": 17750 }, { "entropy": 5.514116859436035, "epoch": 1.6105769230769231, "grad_norm": 0.98828125, "learning_rate": 0.0004743796130731437, "loss": 5.0126, "mean_token_accuracy": 0.20166711509227753, "num_tokens": 36853024.0, "step": 17755 }, { "entropy": 5.528896522521973, "epoch": 1.6110304789550072, "grad_norm": 1.03125, "learning_rate": 0.0004743646159573188, "loss": 4.9752, "mean_token_accuracy": 0.20968101918697357, "num_tokens": 36862534.0, "step": 17760 }, { "entropy": 5.441176795959473, "epoch": 1.6114840348330914, "grad_norm": 1.140625, "learning_rate": 0.0004743496147185828, "loss": 4.9608, "mean_token_accuracy": 0.2123408406972885, "num_tokens": 36872356.0, "step": 17765 }, { "entropy": 5.438937854766846, "epoch": 1.6119375907111757, "grad_norm": 1.015625, "learning_rate": 0.00047433460935724595, "loss": 5.0246, "mean_token_accuracy": 0.20223264694213866, "num_tokens": 36882643.0, "step": 17770 }, { "entropy": 5.512832260131836, "epoch": 1.6123911465892597, "grad_norm": 1.015625, "learning_rate": 0.0004743195998736186, "loss": 5.0085, "mean_token_accuracy": 0.2032598689198494, "num_tokens": 36893349.0, "step": 17775 }, { "entropy": 5.539227628707886, "epoch": 1.612844702467344, "grad_norm": 1.0703125, "learning_rate": 0.00047430458626801107, "loss": 5.02, "mean_token_accuracy": 0.2073807030916214, "num_tokens": 36903713.0, "step": 17780 }, { "entropy": 5.456194686889648, "epoch": 1.613298258345428, "grad_norm": 1.109375, "learning_rate": 0.000474289568540734, "loss": 4.935, "mean_token_accuracy": 0.21000806093215943, "num_tokens": 36912999.0, "step": 17785 }, { "entropy": 5.504201412200928, "epoch": 1.6137518142235123, "grad_norm": 1.078125, "learning_rate": 0.00047427454669209785, "loss": 5.0568, "mean_token_accuracy": 0.20465178042650223, "num_tokens": 36923598.0, "step": 17790 }, { "entropy": 5.464404344558716, "epoch": 1.6142053701015966, "grad_norm": 0.96484375, "learning_rate": 0.00047425952072241326, "loss": 4.9777, "mean_token_accuracy": 0.20436245054006577, "num_tokens": 36933036.0, "step": 17795 }, { "entropy": 5.493456077575684, "epoch": 1.6146589259796809, "grad_norm": 1.0234375, "learning_rate": 0.000474244490631991, "loss": 5.0794, "mean_token_accuracy": 0.19855207800865174, "num_tokens": 36943137.0, "step": 17800 }, { "entropy": 5.6092346668243405, "epoch": 1.615112481857765, "grad_norm": 1.015625, "learning_rate": 0.0004742294564211419, "loss": 5.1892, "mean_token_accuracy": 0.19220228791236876, "num_tokens": 36955619.0, "step": 17805 }, { "entropy": 5.4836140155792235, "epoch": 1.615566037735849, "grad_norm": 1.078125, "learning_rate": 0.0004742144180901769, "loss": 4.9685, "mean_token_accuracy": 0.21661929041147232, "num_tokens": 36966377.0, "step": 17810 }, { "entropy": 5.483592319488525, "epoch": 1.6160195936139332, "grad_norm": 1.0546875, "learning_rate": 0.00047419937563940697, "loss": 5.0178, "mean_token_accuracy": 0.21046488732099533, "num_tokens": 36977100.0, "step": 17815 }, { "entropy": 5.4998737335205075, "epoch": 1.6164731494920175, "grad_norm": 1.078125, "learning_rate": 0.00047418432906914314, "loss": 5.1009, "mean_token_accuracy": 0.19394870847463608, "num_tokens": 36987120.0, "step": 17820 }, { "entropy": 5.5570456981658936, "epoch": 1.6169267053701017, "grad_norm": 1.0703125, "learning_rate": 0.0004741692783796967, "loss": 5.0517, "mean_token_accuracy": 0.20102904438972474, "num_tokens": 36996885.0, "step": 17825 }, { "entropy": 5.4943199634552, "epoch": 1.6173802612481858, "grad_norm": 1.0859375, "learning_rate": 0.00047415422357137876, "loss": 4.981, "mean_token_accuracy": 0.21046871095895767, "num_tokens": 37006570.0, "step": 17830 }, { "entropy": 5.528774309158325, "epoch": 1.6178338171262698, "grad_norm": 1.0390625, "learning_rate": 0.0004741391646445008, "loss": 5.0817, "mean_token_accuracy": 0.1988207072019577, "num_tokens": 37017185.0, "step": 17835 }, { "entropy": 5.501001405715942, "epoch": 1.618287373004354, "grad_norm": 0.99609375, "learning_rate": 0.0004741241015993741, "loss": 5.0479, "mean_token_accuracy": 0.20650382190942765, "num_tokens": 37028386.0, "step": 17840 }, { "entropy": 5.441536998748779, "epoch": 1.6187409288824384, "grad_norm": 1.0078125, "learning_rate": 0.00047410903443631026, "loss": 4.9536, "mean_token_accuracy": 0.20377426147460936, "num_tokens": 37038326.0, "step": 17845 }, { "entropy": 5.528948402404785, "epoch": 1.6191944847605226, "grad_norm": 1.0, "learning_rate": 0.0004740939631556209, "loss": 5.0402, "mean_token_accuracy": 0.2045020267367363, "num_tokens": 37048570.0, "step": 17850 }, { "entropy": 5.433118009567261, "epoch": 1.6196480406386067, "grad_norm": 1.1484375, "learning_rate": 0.0004740788877576176, "loss": 4.9191, "mean_token_accuracy": 0.2163080468773842, "num_tokens": 37058909.0, "step": 17855 }, { "entropy": 5.483098125457763, "epoch": 1.6201015965166907, "grad_norm": 1.0390625, "learning_rate": 0.0004740638082426121, "loss": 4.9928, "mean_token_accuracy": 0.2163893461227417, "num_tokens": 37068957.0, "step": 17860 }, { "entropy": 5.472447204589844, "epoch": 1.620555152394775, "grad_norm": 1.0, "learning_rate": 0.00047404872461091643, "loss": 4.9738, "mean_token_accuracy": 0.20412914603948593, "num_tokens": 37080187.0, "step": 17865 }, { "entropy": 5.518881130218506, "epoch": 1.6210087082728593, "grad_norm": 1.109375, "learning_rate": 0.00047403363686284236, "loss": 5.0354, "mean_token_accuracy": 0.20058336704969407, "num_tokens": 37090314.0, "step": 17870 }, { "entropy": 5.55664210319519, "epoch": 1.6214622641509435, "grad_norm": 1.0703125, "learning_rate": 0.00047401854499870197, "loss": 5.0831, "mean_token_accuracy": 0.2025315895676613, "num_tokens": 37099907.0, "step": 17875 }, { "entropy": 5.510245418548584, "epoch": 1.6219158200290276, "grad_norm": 1.078125, "learning_rate": 0.00047400344901880735, "loss": 5.0881, "mean_token_accuracy": 0.19591856598854065, "num_tokens": 37110495.0, "step": 17880 }, { "entropy": 5.491468000411987, "epoch": 1.6223693759071116, "grad_norm": 0.984375, "learning_rate": 0.0004739883489234707, "loss": 5.0595, "mean_token_accuracy": 0.20072028636932374, "num_tokens": 37121957.0, "step": 17885 }, { "entropy": 5.482203578948974, "epoch": 1.6228229317851959, "grad_norm": 1.0, "learning_rate": 0.00047397324471300424, "loss": 4.9761, "mean_token_accuracy": 0.20953701436519623, "num_tokens": 37132743.0, "step": 17890 }, { "entropy": 5.511427783966065, "epoch": 1.6232764876632801, "grad_norm": 1.0625, "learning_rate": 0.00047395813638772047, "loss": 5.0635, "mean_token_accuracy": 0.2001722663640976, "num_tokens": 37143947.0, "step": 17895 }, { "entropy": 5.624027299880981, "epoch": 1.6237300435413644, "grad_norm": 1.0859375, "learning_rate": 0.00047394302394793164, "loss": 5.1752, "mean_token_accuracy": 0.19035278409719467, "num_tokens": 37154316.0, "step": 17900 }, { "entropy": 5.544618606567383, "epoch": 1.6241835994194485, "grad_norm": 1.0, "learning_rate": 0.0004739279073939504, "loss": 5.0725, "mean_token_accuracy": 0.2005895271897316, "num_tokens": 37164999.0, "step": 17905 }, { "entropy": 5.517786598205566, "epoch": 1.6246371552975325, "grad_norm": 1.046875, "learning_rate": 0.0004739127867260894, "loss": 5.0635, "mean_token_accuracy": 0.20029191970825194, "num_tokens": 37174392.0, "step": 17910 }, { "entropy": 5.431928443908691, "epoch": 1.6250907111756168, "grad_norm": 1.03125, "learning_rate": 0.0004738976619446613, "loss": 5.0521, "mean_token_accuracy": 0.20038048475980758, "num_tokens": 37185341.0, "step": 17915 }, { "entropy": 5.522448110580444, "epoch": 1.625544267053701, "grad_norm": 0.88671875, "learning_rate": 0.00047388253304997874, "loss": 5.0613, "mean_token_accuracy": 0.19450522512197493, "num_tokens": 37196725.0, "step": 17920 }, { "entropy": 5.511097574234009, "epoch": 1.6259978229317853, "grad_norm": 1.0625, "learning_rate": 0.0004738674000423548, "loss": 4.9513, "mean_token_accuracy": 0.21172694861888885, "num_tokens": 37206877.0, "step": 17925 }, { "entropy": 5.4013652324676515, "epoch": 1.6264513788098693, "grad_norm": 1.0859375, "learning_rate": 0.0004738522629221023, "loss": 4.9395, "mean_token_accuracy": 0.20670881420373916, "num_tokens": 37217277.0, "step": 17930 }, { "entropy": 5.424076795578003, "epoch": 1.6269049346879536, "grad_norm": 1.1015625, "learning_rate": 0.0004738371216895344, "loss": 4.9386, "mean_token_accuracy": 0.20832673758268355, "num_tokens": 37227716.0, "step": 17935 }, { "entropy": 5.435279035568238, "epoch": 1.6273584905660377, "grad_norm": 1.078125, "learning_rate": 0.0004738219763449641, "loss": 5.0389, "mean_token_accuracy": 0.19950771182775498, "num_tokens": 37238178.0, "step": 17940 }, { "entropy": 5.485125970840454, "epoch": 1.627812046444122, "grad_norm": 1.046875, "learning_rate": 0.0004738068268887047, "loss": 5.0745, "mean_token_accuracy": 0.20506935119628905, "num_tokens": 37248408.0, "step": 17945 }, { "entropy": 5.490612411499024, "epoch": 1.6282656023222062, "grad_norm": 1.0234375, "learning_rate": 0.0004737916733210694, "loss": 5.1667, "mean_token_accuracy": 0.19898591786623002, "num_tokens": 37259176.0, "step": 17950 }, { "entropy": 5.517525768280029, "epoch": 1.6287191582002902, "grad_norm": 1.1640625, "learning_rate": 0.00047377651564237165, "loss": 4.931, "mean_token_accuracy": 0.20828703343868255, "num_tokens": 37269205.0, "step": 17955 }, { "entropy": 5.534256649017334, "epoch": 1.6291727140783745, "grad_norm": 1.015625, "learning_rate": 0.00047376135385292494, "loss": 5.0503, "mean_token_accuracy": 0.20858412683010102, "num_tokens": 37278841.0, "step": 17960 }, { "entropy": 5.498790836334228, "epoch": 1.6296262699564585, "grad_norm": 1.078125, "learning_rate": 0.0004737461879530428, "loss": 5.0783, "mean_token_accuracy": 0.1986847698688507, "num_tokens": 37288487.0, "step": 17965 }, { "entropy": 5.504429960250855, "epoch": 1.6300798258345428, "grad_norm": 1.03125, "learning_rate": 0.00047373101794303884, "loss": 5.0755, "mean_token_accuracy": 0.20283679962158202, "num_tokens": 37300086.0, "step": 17970 }, { "entropy": 5.500997257232666, "epoch": 1.630533381712627, "grad_norm": 1.0234375, "learning_rate": 0.0004737158438232267, "loss": 5.0817, "mean_token_accuracy": 0.1948433056473732, "num_tokens": 37310072.0, "step": 17975 }, { "entropy": 5.528009462356567, "epoch": 1.6309869375907113, "grad_norm": 0.96484375, "learning_rate": 0.00047370066559392033, "loss": 5.0087, "mean_token_accuracy": 0.213375024497509, "num_tokens": 37320278.0, "step": 17980 }, { "entropy": 5.514726829528809, "epoch": 1.6314404934687954, "grad_norm": 1.0390625, "learning_rate": 0.00047368548325543366, "loss": 4.9738, "mean_token_accuracy": 0.19879747331142425, "num_tokens": 37330741.0, "step": 17985 }, { "entropy": 5.4943592071533205, "epoch": 1.6318940493468794, "grad_norm": 1.078125, "learning_rate": 0.0004736702968080804, "loss": 5.0616, "mean_token_accuracy": 0.19932493865489959, "num_tokens": 37341213.0, "step": 17990 }, { "entropy": 5.419654178619385, "epoch": 1.6323476052249637, "grad_norm": 1.03125, "learning_rate": 0.00047365510625217483, "loss": 4.9234, "mean_token_accuracy": 0.2059243679046631, "num_tokens": 37350528.0, "step": 17995 }, { "entropy": 5.4861565113067625, "epoch": 1.632801161103048, "grad_norm": 1.015625, "learning_rate": 0.00047363991158803117, "loss": 5.0122, "mean_token_accuracy": 0.203314208984375, "num_tokens": 37359938.0, "step": 18000 }, { "epoch": 1.632801161103048, "eval_entropy": 5.260263482585752, "eval_loss": 5.059215068817139, "eval_mean_token_accuracy": 0.21069170047963098, "eval_num_tokens": 37359938.0, "eval_runtime": 20.762, "eval_samples_per_second": 1703.112, "eval_steps_per_second": 212.889, "step": 18000 }, { "entropy": 5.504788255691528, "epoch": 1.6332547169811322, "grad_norm": 1.0546875, "learning_rate": 0.00047362471281596334, "loss": 5.0285, "mean_token_accuracy": 0.2054093912243843, "num_tokens": 37369744.0, "step": 18005 }, { "entropy": 5.53725905418396, "epoch": 1.6337082728592163, "grad_norm": 1.1171875, "learning_rate": 0.00047360950993628585, "loss": 5.1098, "mean_token_accuracy": 0.19825389236211777, "num_tokens": 37380578.0, "step": 18010 }, { "entropy": 5.488230991363525, "epoch": 1.6341618287373003, "grad_norm": 1.1171875, "learning_rate": 0.0004735943029493132, "loss": 5.0264, "mean_token_accuracy": 0.19835548251867294, "num_tokens": 37390237.0, "step": 18015 }, { "entropy": 5.49710602760315, "epoch": 1.6346153846153846, "grad_norm": 1.015625, "learning_rate": 0.00047357909185535965, "loss": 5.0715, "mean_token_accuracy": 0.1987991601228714, "num_tokens": 37400261.0, "step": 18020 }, { "entropy": 5.4864672183990475, "epoch": 1.6350689404934688, "grad_norm": 1.0390625, "learning_rate": 0.0004735638766547399, "loss": 5.0066, "mean_token_accuracy": 0.20591530203819275, "num_tokens": 37410012.0, "step": 18025 }, { "entropy": 5.531466436386109, "epoch": 1.6355224963715531, "grad_norm": 1.09375, "learning_rate": 0.00047354865734776857, "loss": 5.1278, "mean_token_accuracy": 0.18817878067493438, "num_tokens": 37420530.0, "step": 18030 }, { "entropy": 5.503242444992066, "epoch": 1.6359760522496372, "grad_norm": 1.0234375, "learning_rate": 0.0004735334339347605, "loss": 4.9842, "mean_token_accuracy": 0.21525170058012008, "num_tokens": 37431146.0, "step": 18035 }, { "entropy": 5.489639949798584, "epoch": 1.6364296081277212, "grad_norm": 1.0859375, "learning_rate": 0.00047351820641603035, "loss": 4.9571, "mean_token_accuracy": 0.20719221830368043, "num_tokens": 37441253.0, "step": 18040 }, { "entropy": 5.406484794616699, "epoch": 1.6368831640058055, "grad_norm": 0.9609375, "learning_rate": 0.0004735029747918931, "loss": 5.0266, "mean_token_accuracy": 0.19968244284391404, "num_tokens": 37451326.0, "step": 18045 }, { "entropy": 5.427188110351563, "epoch": 1.6373367198838897, "grad_norm": 0.93359375, "learning_rate": 0.00047348773906266374, "loss": 4.9676, "mean_token_accuracy": 0.2051646888256073, "num_tokens": 37462462.0, "step": 18050 }, { "entropy": 5.4523402690887455, "epoch": 1.637790275761974, "grad_norm": 1.1015625, "learning_rate": 0.0004734724992286574, "loss": 4.9716, "mean_token_accuracy": 0.20920010507106782, "num_tokens": 37473016.0, "step": 18055 }, { "entropy": 5.520586776733398, "epoch": 1.638243831640058, "grad_norm": 1.0390625, "learning_rate": 0.0004734572552901892, "loss": 5.1017, "mean_token_accuracy": 0.20339616537094116, "num_tokens": 37483737.0, "step": 18060 }, { "entropy": 5.467749977111817, "epoch": 1.638697387518142, "grad_norm": 1.0703125, "learning_rate": 0.0004734420072475743, "loss": 4.9777, "mean_token_accuracy": 0.2044924795627594, "num_tokens": 37493070.0, "step": 18065 }, { "entropy": 5.478689813613892, "epoch": 1.6391509433962264, "grad_norm": 1.0234375, "learning_rate": 0.0004734267551011282, "loss": 4.9813, "mean_token_accuracy": 0.2088460236787796, "num_tokens": 37503696.0, "step": 18070 }, { "entropy": 5.438482141494751, "epoch": 1.6396044992743106, "grad_norm": 1.078125, "learning_rate": 0.0004734114988511662, "loss": 5.0102, "mean_token_accuracy": 0.20678571611642838, "num_tokens": 37513468.0, "step": 18075 }, { "entropy": 5.3958323955535885, "epoch": 1.640058055152395, "grad_norm": 1.0859375, "learning_rate": 0.0004733962384980039, "loss": 4.8767, "mean_token_accuracy": 0.21020763814449311, "num_tokens": 37523631.0, "step": 18080 }, { "entropy": 5.505127477645874, "epoch": 1.640511611030479, "grad_norm": 1.0078125, "learning_rate": 0.0004733809740419568, "loss": 5.0625, "mean_token_accuracy": 0.2120346814393997, "num_tokens": 37534602.0, "step": 18085 }, { "entropy": 5.4306511878967285, "epoch": 1.640965166908563, "grad_norm": 1.046875, "learning_rate": 0.00047336570548334053, "loss": 4.9883, "mean_token_accuracy": 0.2057059645652771, "num_tokens": 37544547.0, "step": 18090 }, { "entropy": 5.508368301391601, "epoch": 1.6414187227866472, "grad_norm": 1.0, "learning_rate": 0.00047335043282247105, "loss": 5.0177, "mean_token_accuracy": 0.2000522419810295, "num_tokens": 37554903.0, "step": 18095 }, { "entropy": 5.484733724594117, "epoch": 1.6418722786647315, "grad_norm": 0.99609375, "learning_rate": 0.00047333515605966396, "loss": 4.9458, "mean_token_accuracy": 0.20402987599372863, "num_tokens": 37565586.0, "step": 18100 }, { "entropy": 5.493042945861816, "epoch": 1.6423258345428158, "grad_norm": 0.96875, "learning_rate": 0.00047331987519523533, "loss": 5.0246, "mean_token_accuracy": 0.2090039610862732, "num_tokens": 37575996.0, "step": 18105 }, { "entropy": 5.419713401794434, "epoch": 1.6427793904208998, "grad_norm": 0.9375, "learning_rate": 0.0004733045902295012, "loss": 4.9442, "mean_token_accuracy": 0.1986428067088127, "num_tokens": 37586441.0, "step": 18110 }, { "entropy": 5.495657444000244, "epoch": 1.643232946298984, "grad_norm": 1.046875, "learning_rate": 0.00047328930116277755, "loss": 5.0393, "mean_token_accuracy": 0.20472251176834105, "num_tokens": 37598226.0, "step": 18115 }, { "entropy": 5.479895353317261, "epoch": 1.6436865021770681, "grad_norm": 1.046875, "learning_rate": 0.0004732740079953806, "loss": 5.0536, "mean_token_accuracy": 0.2034666508436203, "num_tokens": 37609102.0, "step": 18120 }, { "entropy": 5.482530164718628, "epoch": 1.6441400580551524, "grad_norm": 1.0, "learning_rate": 0.0004732587107276267, "loss": 5.0476, "mean_token_accuracy": 0.20244789868593216, "num_tokens": 37619349.0, "step": 18125 }, { "entropy": 5.483021640777588, "epoch": 1.6445936139332367, "grad_norm": 0.9609375, "learning_rate": 0.00047324340935983225, "loss": 5.0362, "mean_token_accuracy": 0.21043339371681213, "num_tokens": 37629844.0, "step": 18130 }, { "entropy": 5.4109281539917, "epoch": 1.6450471698113207, "grad_norm": 1.0390625, "learning_rate": 0.00047322810389231333, "loss": 4.945, "mean_token_accuracy": 0.2070995345711708, "num_tokens": 37639339.0, "step": 18135 }, { "entropy": 5.4147608280181885, "epoch": 1.645500725689405, "grad_norm": 1.140625, "learning_rate": 0.0004732127943253868, "loss": 4.9757, "mean_token_accuracy": 0.21008183807134628, "num_tokens": 37648836.0, "step": 18140 }, { "entropy": 5.49785008430481, "epoch": 1.645954281567489, "grad_norm": 1.0546875, "learning_rate": 0.0004731974806593693, "loss": 4.9854, "mean_token_accuracy": 0.20498585402965547, "num_tokens": 37658424.0, "step": 18145 }, { "entropy": 5.483016633987427, "epoch": 1.6464078374455733, "grad_norm": 1.078125, "learning_rate": 0.00047318216289457727, "loss": 4.99, "mean_token_accuracy": 0.20634360313415528, "num_tokens": 37669849.0, "step": 18150 }, { "entropy": 5.461455488204956, "epoch": 1.6468613933236576, "grad_norm": 1.0234375, "learning_rate": 0.00047316684103132766, "loss": 4.999, "mean_token_accuracy": 0.2050923764705658, "num_tokens": 37678987.0, "step": 18155 }, { "entropy": 5.512372159957886, "epoch": 1.6473149492017418, "grad_norm": 1.0, "learning_rate": 0.0004731515150699372, "loss": 5.0146, "mean_token_accuracy": 0.20386629551649094, "num_tokens": 37689692.0, "step": 18160 }, { "entropy": 5.5446165084838865, "epoch": 1.6477685050798259, "grad_norm": 0.9921875, "learning_rate": 0.00047313618501072303, "loss": 5.1572, "mean_token_accuracy": 0.19308646470308305, "num_tokens": 37700092.0, "step": 18165 }, { "entropy": 5.49167947769165, "epoch": 1.64822206095791, "grad_norm": 1.09375, "learning_rate": 0.00047312085085400194, "loss": 5.0483, "mean_token_accuracy": 0.20333592146635054, "num_tokens": 37710305.0, "step": 18170 }, { "entropy": 5.602780675888061, "epoch": 1.6486756168359942, "grad_norm": 1.046875, "learning_rate": 0.00047310551260009126, "loss": 5.1349, "mean_token_accuracy": 0.19278147369623183, "num_tokens": 37720451.0, "step": 18175 }, { "entropy": 5.512181091308594, "epoch": 1.6491291727140784, "grad_norm": 1.0390625, "learning_rate": 0.000473090170249308, "loss": 5.0226, "mean_token_accuracy": 0.20533677637577058, "num_tokens": 37731952.0, "step": 18180 }, { "entropy": 5.4516700267791744, "epoch": 1.6495827285921627, "grad_norm": 1.0, "learning_rate": 0.0004730748238019696, "loss": 4.9713, "mean_token_accuracy": 0.203942608833313, "num_tokens": 37742201.0, "step": 18185 }, { "entropy": 5.4428267002105715, "epoch": 1.6500362844702468, "grad_norm": 0.9765625, "learning_rate": 0.00047305947325839337, "loss": 4.9803, "mean_token_accuracy": 0.20398137122392654, "num_tokens": 37753317.0, "step": 18190 }, { "entropy": 5.5094935417175295, "epoch": 1.6504898403483308, "grad_norm": 1.109375, "learning_rate": 0.0004730441186188968, "loss": 5.0462, "mean_token_accuracy": 0.20391041785478592, "num_tokens": 37763452.0, "step": 18195 }, { "entropy": 5.481544160842896, "epoch": 1.650943396226415, "grad_norm": 1.2265625, "learning_rate": 0.00047302875988379734, "loss": 4.9627, "mean_token_accuracy": 0.20198788344860077, "num_tokens": 37772804.0, "step": 18200 }, { "entropy": 5.504287528991699, "epoch": 1.6513969521044993, "grad_norm": 1.0625, "learning_rate": 0.00047301339705341266, "loss": 5.0393, "mean_token_accuracy": 0.19558282643556596, "num_tokens": 37784441.0, "step": 18205 }, { "entropy": 5.483072805404663, "epoch": 1.6518505079825836, "grad_norm": 0.953125, "learning_rate": 0.00047299803012806056, "loss": 5.0297, "mean_token_accuracy": 0.20530251711606978, "num_tokens": 37795103.0, "step": 18210 }, { "entropy": 5.471498250961304, "epoch": 1.6523040638606676, "grad_norm": 1.046875, "learning_rate": 0.0004729826591080586, "loss": 5.0386, "mean_token_accuracy": 0.20357936173677443, "num_tokens": 37806654.0, "step": 18215 }, { "entropy": 5.503791809082031, "epoch": 1.6527576197387517, "grad_norm": 1.125, "learning_rate": 0.00047296728399372483, "loss": 5.013, "mean_token_accuracy": 0.20491640120744706, "num_tokens": 37816673.0, "step": 18220 }, { "entropy": 5.537406301498413, "epoch": 1.653211175616836, "grad_norm": 1.03125, "learning_rate": 0.00047295190478537725, "loss": 5.0507, "mean_token_accuracy": 0.19826985746622086, "num_tokens": 37827389.0, "step": 18225 }, { "entropy": 5.5817930698394775, "epoch": 1.6536647314949202, "grad_norm": 1.0625, "learning_rate": 0.00047293652148333376, "loss": 5.0497, "mean_token_accuracy": 0.20327634662389754, "num_tokens": 37838087.0, "step": 18230 }, { "entropy": 5.4010388374328615, "epoch": 1.6541182873730045, "grad_norm": 1.0390625, "learning_rate": 0.00047292113408791266, "loss": 4.9429, "mean_token_accuracy": 0.20644395798444748, "num_tokens": 37848630.0, "step": 18235 }, { "entropy": 5.408254671096802, "epoch": 1.6545718432510885, "grad_norm": 1.1328125, "learning_rate": 0.00047290574259943195, "loss": 4.9166, "mean_token_accuracy": 0.2214161679148674, "num_tokens": 37858689.0, "step": 18240 }, { "entropy": 5.506332588195801, "epoch": 1.6550253991291726, "grad_norm": 1.0, "learning_rate": 0.00047289034701821013, "loss": 5.0772, "mean_token_accuracy": 0.2026723563671112, "num_tokens": 37869049.0, "step": 18245 }, { "entropy": 5.449204921722412, "epoch": 1.6554789550072568, "grad_norm": 1.1015625, "learning_rate": 0.00047287494734456545, "loss": 4.9878, "mean_token_accuracy": 0.2054959073662758, "num_tokens": 37879495.0, "step": 18250 }, { "entropy": 5.492386531829834, "epoch": 1.655932510885341, "grad_norm": 1.0546875, "learning_rate": 0.00047285954357881646, "loss": 5.0258, "mean_token_accuracy": 0.2014095425605774, "num_tokens": 37889442.0, "step": 18255 }, { "entropy": 5.556931495666504, "epoch": 1.6563860667634254, "grad_norm": 0.9375, "learning_rate": 0.0004728441357212817, "loss": 5.1634, "mean_token_accuracy": 0.18957946300506592, "num_tokens": 37900147.0, "step": 18260 }, { "entropy": 5.518980598449707, "epoch": 1.6568396226415094, "grad_norm": 1.078125, "learning_rate": 0.0004728287237722798, "loss": 4.987, "mean_token_accuracy": 0.1999994158744812, "num_tokens": 37910307.0, "step": 18265 }, { "entropy": 5.425207281112671, "epoch": 1.6572931785195935, "grad_norm": 0.99609375, "learning_rate": 0.0004728133077321295, "loss": 4.9517, "mean_token_accuracy": 0.2038370817899704, "num_tokens": 37920838.0, "step": 18270 }, { "entropy": 5.534366941452026, "epoch": 1.6577467343976777, "grad_norm": 1.015625, "learning_rate": 0.00047279788760114954, "loss": 5.0484, "mean_token_accuracy": 0.20199616104364396, "num_tokens": 37930717.0, "step": 18275 }, { "entropy": 5.535144472122193, "epoch": 1.658200290275762, "grad_norm": 1.0234375, "learning_rate": 0.0004727824633796589, "loss": 5.0346, "mean_token_accuracy": 0.20121545791625978, "num_tokens": 37941254.0, "step": 18280 }, { "entropy": 5.4626060962677006, "epoch": 1.6586538461538463, "grad_norm": 0.95703125, "learning_rate": 0.0004727670350679765, "loss": 5.0311, "mean_token_accuracy": 0.20613199472427368, "num_tokens": 37952132.0, "step": 18285 }, { "entropy": 5.4736772060394285, "epoch": 1.6591074020319303, "grad_norm": 1.1015625, "learning_rate": 0.0004727516026664214, "loss": 5.0412, "mean_token_accuracy": 0.2066334918141365, "num_tokens": 37962026.0, "step": 18290 }, { "entropy": 5.497957229614258, "epoch": 1.6595609579100146, "grad_norm": 0.91796875, "learning_rate": 0.0004727361661753128, "loss": 4.9407, "mean_token_accuracy": 0.2055540695786476, "num_tokens": 37972911.0, "step": 18295 }, { "entropy": 5.507284355163574, "epoch": 1.6600145137880986, "grad_norm": 0.98046875, "learning_rate": 0.0004727207255949699, "loss": 4.983, "mean_token_accuracy": 0.20701647102832793, "num_tokens": 37983577.0, "step": 18300 }, { "entropy": 5.512321901321411, "epoch": 1.6604680696661829, "grad_norm": 0.9375, "learning_rate": 0.00047270528092571197, "loss": 5.0664, "mean_token_accuracy": 0.20108760744333268, "num_tokens": 37994294.0, "step": 18305 }, { "entropy": 5.492896032333374, "epoch": 1.6609216255442671, "grad_norm": 1.0859375, "learning_rate": 0.0004726898321678584, "loss": 5.0247, "mean_token_accuracy": 0.20610663294792175, "num_tokens": 38005144.0, "step": 18310 }, { "entropy": 5.460435152053833, "epoch": 1.6613751814223512, "grad_norm": 1.078125, "learning_rate": 0.0004726743793217288, "loss": 5.048, "mean_token_accuracy": 0.1973502218723297, "num_tokens": 38015277.0, "step": 18315 }, { "entropy": 5.4694592475891115, "epoch": 1.6618287373004355, "grad_norm": 1.21875, "learning_rate": 0.00047265892238764265, "loss": 4.965, "mean_token_accuracy": 0.20670148283243178, "num_tokens": 38027530.0, "step": 18320 }, { "entropy": 5.5590980529785154, "epoch": 1.6622822931785195, "grad_norm": 1.1796875, "learning_rate": 0.0004726434613659196, "loss": 5.0815, "mean_token_accuracy": 0.20439765751361846, "num_tokens": 38036895.0, "step": 18325 }, { "entropy": 5.5358936309814455, "epoch": 1.6627358490566038, "grad_norm": 1.0390625, "learning_rate": 0.0004726279962568794, "loss": 5.0965, "mean_token_accuracy": 0.2030717298388481, "num_tokens": 38047001.0, "step": 18330 }, { "entropy": 5.482818841934204, "epoch": 1.663189404934688, "grad_norm": 1.1171875, "learning_rate": 0.0004726125270608419, "loss": 4.9701, "mean_token_accuracy": 0.20969488322734833, "num_tokens": 38056815.0, "step": 18335 }, { "entropy": 5.534871244430542, "epoch": 1.6636429608127723, "grad_norm": 1.1015625, "learning_rate": 0.00047259705377812703, "loss": 5.0773, "mean_token_accuracy": 0.20374379605054854, "num_tokens": 38067139.0, "step": 18340 }, { "entropy": 5.5016638278961185, "epoch": 1.6640965166908563, "grad_norm": 1.046875, "learning_rate": 0.0004725815764090546, "loss": 4.987, "mean_token_accuracy": 0.2108481466770172, "num_tokens": 38076824.0, "step": 18345 }, { "entropy": 5.484319543838501, "epoch": 1.6645500725689404, "grad_norm": 1.0390625, "learning_rate": 0.00047256609495394494, "loss": 5.0305, "mean_token_accuracy": 0.20714865922927855, "num_tokens": 38087517.0, "step": 18350 }, { "entropy": 5.517207193374634, "epoch": 1.6650036284470247, "grad_norm": 1.0390625, "learning_rate": 0.000472550609413118, "loss": 5.0212, "mean_token_accuracy": 0.20530910193920135, "num_tokens": 38098499.0, "step": 18355 }, { "entropy": 5.451664876937866, "epoch": 1.665457184325109, "grad_norm": 1.3359375, "learning_rate": 0.0004725351197868942, "loss": 5.0123, "mean_token_accuracy": 0.2072666198015213, "num_tokens": 38108327.0, "step": 18360 }, { "entropy": 5.5305112361907955, "epoch": 1.6659107402031932, "grad_norm": 1.0703125, "learning_rate": 0.00047251962607559373, "loss": 5.0264, "mean_token_accuracy": 0.19983526468276977, "num_tokens": 38118667.0, "step": 18365 }, { "entropy": 5.434758472442627, "epoch": 1.6663642960812772, "grad_norm": 1.078125, "learning_rate": 0.00047250412827953717, "loss": 4.9861, "mean_token_accuracy": 0.20379660427570342, "num_tokens": 38128571.0, "step": 18370 }, { "entropy": 5.534202909469604, "epoch": 1.6668178519593613, "grad_norm": 1.03125, "learning_rate": 0.0004724886263990448, "loss": 5.1095, "mean_token_accuracy": 0.19703283607959748, "num_tokens": 38138921.0, "step": 18375 }, { "entropy": 5.555098199844361, "epoch": 1.6672714078374455, "grad_norm": 1.140625, "learning_rate": 0.0004724731204344372, "loss": 5.0278, "mean_token_accuracy": 0.20281906872987748, "num_tokens": 38148858.0, "step": 18380 }, { "entropy": 5.404624509811401, "epoch": 1.6677249637155298, "grad_norm": 1.0859375, "learning_rate": 0.00047245761038603536, "loss": 4.9503, "mean_token_accuracy": 0.2107952728867531, "num_tokens": 38159107.0, "step": 18385 }, { "entropy": 5.535781669616699, "epoch": 1.668178519593614, "grad_norm": 1.0546875, "learning_rate": 0.00047244209625415975, "loss": 5.0863, "mean_token_accuracy": 0.19797467142343522, "num_tokens": 38169228.0, "step": 18390 }, { "entropy": 5.540907859802246, "epoch": 1.6686320754716981, "grad_norm": 1.1640625, "learning_rate": 0.0004724265780391312, "loss": 5.0062, "mean_token_accuracy": 0.2063402235507965, "num_tokens": 38179175.0, "step": 18395 }, { "entropy": 5.48925633430481, "epoch": 1.6690856313497822, "grad_norm": 1.046875, "learning_rate": 0.0004724110557412708, "loss": 5.0559, "mean_token_accuracy": 0.20149583369493484, "num_tokens": 38188537.0, "step": 18400 }, { "entropy": 5.4690220832824705, "epoch": 1.6695391872278664, "grad_norm": 1.0546875, "learning_rate": 0.00047239552936089943, "loss": 5.0554, "mean_token_accuracy": 0.19593087881803511, "num_tokens": 38198972.0, "step": 18405 }, { "entropy": 5.479906463623047, "epoch": 1.6699927431059507, "grad_norm": 1.1484375, "learning_rate": 0.00047237999889833816, "loss": 4.9343, "mean_token_accuracy": 0.20837448686361312, "num_tokens": 38209472.0, "step": 18410 }, { "entropy": 5.374909400939941, "epoch": 1.670446298984035, "grad_norm": 1.0078125, "learning_rate": 0.00047236446435390826, "loss": 4.9252, "mean_token_accuracy": 0.2070350855588913, "num_tokens": 38219977.0, "step": 18415 }, { "entropy": 5.455624008178711, "epoch": 1.670899854862119, "grad_norm": 1.046875, "learning_rate": 0.00047234892572793093, "loss": 5.0477, "mean_token_accuracy": 0.20311958193778992, "num_tokens": 38230492.0, "step": 18420 }, { "entropy": 5.491666412353515, "epoch": 1.671353410740203, "grad_norm": 1.0390625, "learning_rate": 0.0004723333830207275, "loss": 5.006, "mean_token_accuracy": 0.19737563282251358, "num_tokens": 38240799.0, "step": 18425 }, { "entropy": 5.4675342559814455, "epoch": 1.6718069666182873, "grad_norm": 1.0078125, "learning_rate": 0.00047231783623261954, "loss": 4.967, "mean_token_accuracy": 0.20395370274782182, "num_tokens": 38251439.0, "step": 18430 }, { "entropy": 5.52753529548645, "epoch": 1.6722605224963716, "grad_norm": 1.0546875, "learning_rate": 0.0004723022853639283, "loss": 5.1033, "mean_token_accuracy": 0.2033165216445923, "num_tokens": 38261795.0, "step": 18435 }, { "entropy": 5.436008405685425, "epoch": 1.6727140783744558, "grad_norm": 1.015625, "learning_rate": 0.0004722867304149756, "loss": 4.9758, "mean_token_accuracy": 0.2048972725868225, "num_tokens": 38272172.0, "step": 18440 }, { "entropy": 5.515102338790894, "epoch": 1.67316763425254, "grad_norm": 0.98828125, "learning_rate": 0.0004722711713860831, "loss": 5.0766, "mean_token_accuracy": 0.1952103555202484, "num_tokens": 38282829.0, "step": 18445 }, { "entropy": 5.513536834716797, "epoch": 1.673621190130624, "grad_norm": 1.109375, "learning_rate": 0.0004722556082775724, "loss": 5.0701, "mean_token_accuracy": 0.20707326233386994, "num_tokens": 38293793.0, "step": 18450 }, { "entropy": 5.5105146884918215, "epoch": 1.6740747460087082, "grad_norm": 1.078125, "learning_rate": 0.0004722400410897655, "loss": 5.0751, "mean_token_accuracy": 0.2046295389533043, "num_tokens": 38302577.0, "step": 18455 }, { "entropy": 5.515171194076538, "epoch": 1.6745283018867925, "grad_norm": 1.0390625, "learning_rate": 0.0004722244698229842, "loss": 5.0152, "mean_token_accuracy": 0.20464314967393876, "num_tokens": 38312571.0, "step": 18460 }, { "entropy": 5.473025941848755, "epoch": 1.6749818577648767, "grad_norm": 1.0, "learning_rate": 0.00047220889447755073, "loss": 4.9542, "mean_token_accuracy": 0.2091301903128624, "num_tokens": 38323544.0, "step": 18465 }, { "entropy": 5.518221282958985, "epoch": 1.6754354136429608, "grad_norm": 1.078125, "learning_rate": 0.0004721933150537869, "loss": 5.0338, "mean_token_accuracy": 0.20110619217157363, "num_tokens": 38334509.0, "step": 18470 }, { "entropy": 5.412545156478882, "epoch": 1.675888969521045, "grad_norm": 1.0859375, "learning_rate": 0.00047217773155201526, "loss": 4.9571, "mean_token_accuracy": 0.203582501411438, "num_tokens": 38344747.0, "step": 18475 }, { "entropy": 5.507736158370972, "epoch": 1.676342525399129, "grad_norm": 1.03125, "learning_rate": 0.00047216214397255776, "loss": 5.0614, "mean_token_accuracy": 0.19674084335565567, "num_tokens": 38355671.0, "step": 18480 }, { "entropy": 5.5069090843200685, "epoch": 1.6767960812772134, "grad_norm": 1.0390625, "learning_rate": 0.00047214655231573693, "loss": 5.035, "mean_token_accuracy": 0.20265609323978423, "num_tokens": 38366368.0, "step": 18485 }, { "entropy": 5.499286317825318, "epoch": 1.6772496371552976, "grad_norm": 1.0703125, "learning_rate": 0.0004721309565818752, "loss": 5.0981, "mean_token_accuracy": 0.20174516886472701, "num_tokens": 38377322.0, "step": 18490 }, { "entropy": 5.563813877105713, "epoch": 1.6777031930333817, "grad_norm": 1.0234375, "learning_rate": 0.00047211535677129496, "loss": 5.0962, "mean_token_accuracy": 0.19940244406461716, "num_tokens": 38389204.0, "step": 18495 }, { "entropy": 5.508306884765625, "epoch": 1.678156748911466, "grad_norm": 1.03125, "learning_rate": 0.00047209975288431893, "loss": 5.0448, "mean_token_accuracy": 0.20390467196702958, "num_tokens": 38399117.0, "step": 18500 }, { "entropy": 5.4711321830749515, "epoch": 1.67861030478955, "grad_norm": 1.0625, "learning_rate": 0.00047208414492126986, "loss": 5.0082, "mean_token_accuracy": 0.2012804701924324, "num_tokens": 38410341.0, "step": 18505 }, { "entropy": 5.547240686416626, "epoch": 1.6790638606676342, "grad_norm": 1.1015625, "learning_rate": 0.00047206853288247043, "loss": 5.0798, "mean_token_accuracy": 0.1975940242409706, "num_tokens": 38422742.0, "step": 18510 }, { "entropy": 5.499547147750855, "epoch": 1.6795174165457185, "grad_norm": 1.1015625, "learning_rate": 0.00047205291676824345, "loss": 5.0729, "mean_token_accuracy": 0.1988615036010742, "num_tokens": 38433022.0, "step": 18515 }, { "entropy": 5.520501708984375, "epoch": 1.6799709724238028, "grad_norm": 0.98828125, "learning_rate": 0.000472037296578912, "loss": 5.0524, "mean_token_accuracy": 0.20151687860488893, "num_tokens": 38444325.0, "step": 18520 }, { "entropy": 5.492207193374634, "epoch": 1.6804245283018868, "grad_norm": 1.125, "learning_rate": 0.000472021672314799, "loss": 4.9626, "mean_token_accuracy": 0.20981447249650956, "num_tokens": 38454576.0, "step": 18525 }, { "entropy": 5.473684406280517, "epoch": 1.6808780841799709, "grad_norm": 1.046875, "learning_rate": 0.00047200604397622763, "loss": 4.9761, "mean_token_accuracy": 0.20934527814388276, "num_tokens": 38465090.0, "step": 18530 }, { "entropy": 5.548080396652222, "epoch": 1.6813316400580551, "grad_norm": 1.0234375, "learning_rate": 0.0004719904115635211, "loss": 5.2014, "mean_token_accuracy": 0.19276446849107742, "num_tokens": 38477253.0, "step": 18535 }, { "entropy": 5.548889064788819, "epoch": 1.6817851959361394, "grad_norm": 1.1171875, "learning_rate": 0.0004719747750770026, "loss": 5.108, "mean_token_accuracy": 0.19910923689603804, "num_tokens": 38488040.0, "step": 18540 }, { "entropy": 5.48395676612854, "epoch": 1.6822387518142237, "grad_norm": 1.0234375, "learning_rate": 0.0004719591345169956, "loss": 5.0274, "mean_token_accuracy": 0.20620906800031663, "num_tokens": 38498016.0, "step": 18545 }, { "entropy": 5.555508136749268, "epoch": 1.6826923076923077, "grad_norm": 1.046875, "learning_rate": 0.00047194348988382345, "loss": 5.1085, "mean_token_accuracy": 0.19993061870336531, "num_tokens": 38508996.0, "step": 18550 }, { "entropy": 5.479267978668213, "epoch": 1.6831458635703918, "grad_norm": 1.015625, "learning_rate": 0.0004719278411778097, "loss": 5.0547, "mean_token_accuracy": 0.2078235015273094, "num_tokens": 38519608.0, "step": 18555 }, { "entropy": 5.482069873809815, "epoch": 1.683599419448476, "grad_norm": 1.0859375, "learning_rate": 0.00047191218839927817, "loss": 5.0009, "mean_token_accuracy": 0.2001231387257576, "num_tokens": 38530737.0, "step": 18560 }, { "entropy": 5.477081966400147, "epoch": 1.6840529753265603, "grad_norm": 1.0859375, "learning_rate": 0.0004718965315485523, "loss": 4.9912, "mean_token_accuracy": 0.20080161988735198, "num_tokens": 38540925.0, "step": 18565 }, { "entropy": 5.496979665756226, "epoch": 1.6845065312046446, "grad_norm": 0.96875, "learning_rate": 0.0004718808706259561, "loss": 5.057, "mean_token_accuracy": 0.19720547795295715, "num_tokens": 38553176.0, "step": 18570 }, { "entropy": 5.550701713562011, "epoch": 1.6849600870827286, "grad_norm": 1.0, "learning_rate": 0.00047186520563181325, "loss": 5.0858, "mean_token_accuracy": 0.1965736374258995, "num_tokens": 38563394.0, "step": 18575 }, { "entropy": 5.578579998016357, "epoch": 1.6854136429608126, "grad_norm": 1.0390625, "learning_rate": 0.0004718495365664477, "loss": 5.0417, "mean_token_accuracy": 0.20721545964479446, "num_tokens": 38573243.0, "step": 18580 }, { "entropy": 5.509956169128418, "epoch": 1.685867198838897, "grad_norm": 1.0859375, "learning_rate": 0.00047183386343018364, "loss": 5.0474, "mean_token_accuracy": 0.19944120943546295, "num_tokens": 38584014.0, "step": 18585 }, { "entropy": 5.4849968433380125, "epoch": 1.6863207547169812, "grad_norm": 1.0625, "learning_rate": 0.0004718181862233451, "loss": 4.986, "mean_token_accuracy": 0.20743076503276825, "num_tokens": 38594467.0, "step": 18590 }, { "entropy": 5.546944284439087, "epoch": 1.6867743105950654, "grad_norm": 1.0234375, "learning_rate": 0.0004718025049462563, "loss": 5.0573, "mean_token_accuracy": 0.19999323934316635, "num_tokens": 38604407.0, "step": 18595 }, { "entropy": 5.553864574432373, "epoch": 1.6872278664731495, "grad_norm": 1.1328125, "learning_rate": 0.0004717868195992416, "loss": 5.0564, "mean_token_accuracy": 0.2070892110466957, "num_tokens": 38614508.0, "step": 18600 }, { "entropy": 5.563734436035157, "epoch": 1.6876814223512335, "grad_norm": 1.0234375, "learning_rate": 0.0004717711301826253, "loss": 5.0579, "mean_token_accuracy": 0.2006372556090355, "num_tokens": 38626244.0, "step": 18605 }, { "entropy": 5.454728603363037, "epoch": 1.6881349782293178, "grad_norm": 1.0078125, "learning_rate": 0.00047175543669673186, "loss": 5.0024, "mean_token_accuracy": 0.20256820917129517, "num_tokens": 38636694.0, "step": 18610 }, { "entropy": 5.588367605209351, "epoch": 1.688588534107402, "grad_norm": 1.03125, "learning_rate": 0.00047173973914188587, "loss": 5.1174, "mean_token_accuracy": 0.19444027543067932, "num_tokens": 38647414.0, "step": 18615 }, { "entropy": 5.50858736038208, "epoch": 1.6890420899854863, "grad_norm": 1.015625, "learning_rate": 0.00047172403751841196, "loss": 5.0247, "mean_token_accuracy": 0.20138438045978546, "num_tokens": 38657425.0, "step": 18620 }, { "entropy": 5.52455883026123, "epoch": 1.6894956458635704, "grad_norm": 1.03125, "learning_rate": 0.00047170833182663485, "loss": 5.0397, "mean_token_accuracy": 0.2063281774520874, "num_tokens": 38667751.0, "step": 18625 }, { "entropy": 5.431008005142212, "epoch": 1.6899492017416544, "grad_norm": 1.078125, "learning_rate": 0.0004716926220668793, "loss": 4.9392, "mean_token_accuracy": 0.2107343167066574, "num_tokens": 38676918.0, "step": 18630 }, { "entropy": 5.420585203170776, "epoch": 1.6904027576197387, "grad_norm": 1.1171875, "learning_rate": 0.00047167690823947015, "loss": 5.0151, "mean_token_accuracy": 0.20803968012332916, "num_tokens": 38685887.0, "step": 18635 }, { "entropy": 5.460736083984375, "epoch": 1.690856313497823, "grad_norm": 1.0859375, "learning_rate": 0.0004716611903447325, "loss": 5.0114, "mean_token_accuracy": 0.21264311224222182, "num_tokens": 38696179.0, "step": 18640 }, { "entropy": 5.507325601577759, "epoch": 1.6913098693759072, "grad_norm": 1.0625, "learning_rate": 0.0004716454683829912, "loss": 5.001, "mean_token_accuracy": 0.20156118422746658, "num_tokens": 38705777.0, "step": 18645 }, { "entropy": 5.476040840148926, "epoch": 1.6917634252539913, "grad_norm": 1.0234375, "learning_rate": 0.00047162974235457163, "loss": 5.0136, "mean_token_accuracy": 0.20877761244773865, "num_tokens": 38717709.0, "step": 18650 }, { "entropy": 5.500707626342773, "epoch": 1.6922169811320755, "grad_norm": 1.0546875, "learning_rate": 0.0004716140122597988, "loss": 4.9741, "mean_token_accuracy": 0.20815141648054122, "num_tokens": 38729517.0, "step": 18655 }, { "entropy": 5.505517816543579, "epoch": 1.6926705370101596, "grad_norm": 0.99609375, "learning_rate": 0.0004715982780989981, "loss": 5.0166, "mean_token_accuracy": 0.204551038146019, "num_tokens": 38740878.0, "step": 18660 }, { "entropy": 5.4452697277069095, "epoch": 1.6931240928882438, "grad_norm": 1.109375, "learning_rate": 0.00047158253987249487, "loss": 4.9623, "mean_token_accuracy": 0.2077188938856125, "num_tokens": 38751291.0, "step": 18665 }, { "entropy": 5.434791088104248, "epoch": 1.693577648766328, "grad_norm": 1.125, "learning_rate": 0.00047156679758061465, "loss": 4.962, "mean_token_accuracy": 0.2114056169986725, "num_tokens": 38760940.0, "step": 18670 }, { "entropy": 5.487574815750122, "epoch": 1.6940312046444121, "grad_norm": 1.0859375, "learning_rate": 0.00047155105122368297, "loss": 4.9557, "mean_token_accuracy": 0.20877281725406646, "num_tokens": 38770240.0, "step": 18675 }, { "entropy": 5.405946826934814, "epoch": 1.6944847605224964, "grad_norm": 1.0859375, "learning_rate": 0.0004715353008020255, "loss": 4.9699, "mean_token_accuracy": 0.20899415612220765, "num_tokens": 38780452.0, "step": 18680 }, { "entropy": 5.4908122539520265, "epoch": 1.6949383164005805, "grad_norm": 1.078125, "learning_rate": 0.00047151954631596794, "loss": 5.0653, "mean_token_accuracy": 0.2054619684815407, "num_tokens": 38790763.0, "step": 18685 }, { "entropy": 5.4548359394073485, "epoch": 1.6953918722786647, "grad_norm": 1.0234375, "learning_rate": 0.00047150378776583603, "loss": 4.9146, "mean_token_accuracy": 0.2129041150212288, "num_tokens": 38802164.0, "step": 18690 }, { "entropy": 5.485100030899048, "epoch": 1.695845428156749, "grad_norm": 1.0390625, "learning_rate": 0.0004714880251519557, "loss": 4.9987, "mean_token_accuracy": 0.2020278677344322, "num_tokens": 38812901.0, "step": 18695 }, { "entropy": 5.45844874382019, "epoch": 1.6962989840348333, "grad_norm": 0.9296875, "learning_rate": 0.000471472258474653, "loss": 4.972, "mean_token_accuracy": 0.20479967594146728, "num_tokens": 38823305.0, "step": 18700 }, { "entropy": 5.481187152862549, "epoch": 1.6967525399129173, "grad_norm": 1.1953125, "learning_rate": 0.00047145648773425384, "loss": 4.9664, "mean_token_accuracy": 0.20233571976423265, "num_tokens": 38833602.0, "step": 18705 }, { "entropy": 5.509334135055542, "epoch": 1.6972060957910013, "grad_norm": 0.99609375, "learning_rate": 0.00047144071293108456, "loss": 5.0689, "mean_token_accuracy": 0.20224757939577104, "num_tokens": 38843950.0, "step": 18710 }, { "entropy": 5.469134950637818, "epoch": 1.6976596516690856, "grad_norm": 1.1796875, "learning_rate": 0.0004714249340654712, "loss": 4.9848, "mean_token_accuracy": 0.2077180936932564, "num_tokens": 38853753.0, "step": 18715 }, { "entropy": 5.431052494049072, "epoch": 1.6981132075471699, "grad_norm": 1.0859375, "learning_rate": 0.0004714091511377402, "loss": 4.9257, "mean_token_accuracy": 0.2057625710964203, "num_tokens": 38863394.0, "step": 18720 }, { "entropy": 5.4556787490844725, "epoch": 1.6985667634252541, "grad_norm": 1.1171875, "learning_rate": 0.00047139336414821784, "loss": 5.0116, "mean_token_accuracy": 0.20279431343078613, "num_tokens": 38872972.0, "step": 18725 }, { "entropy": 5.4457580089569095, "epoch": 1.6990203193033382, "grad_norm": 1.03125, "learning_rate": 0.00047137757309723073, "loss": 4.9883, "mean_token_accuracy": 0.21284911036491394, "num_tokens": 38883251.0, "step": 18730 }, { "entropy": 5.4460916996002195, "epoch": 1.6994738751814222, "grad_norm": 1.0625, "learning_rate": 0.0004713617779851053, "loss": 5.0124, "mean_token_accuracy": 0.2037664383649826, "num_tokens": 38893274.0, "step": 18735 }, { "entropy": 5.554559230804443, "epoch": 1.6999274310595065, "grad_norm": 1.1015625, "learning_rate": 0.0004713459788121683, "loss": 5.1013, "mean_token_accuracy": 0.19608234465122223, "num_tokens": 38903870.0, "step": 18740 }, { "entropy": 5.526161575317383, "epoch": 1.7003809869375908, "grad_norm": 0.9609375, "learning_rate": 0.0004713301755787464, "loss": 5.0392, "mean_token_accuracy": 0.203370663523674, "num_tokens": 38914921.0, "step": 18745 }, { "entropy": 5.492236137390137, "epoch": 1.700834542815675, "grad_norm": 1.03125, "learning_rate": 0.0004713143682851665, "loss": 5.0089, "mean_token_accuracy": 0.21087078750133514, "num_tokens": 38924630.0, "step": 18750 }, { "entropy": 5.429457378387451, "epoch": 1.701288098693759, "grad_norm": 1.0703125, "learning_rate": 0.0004712985569317553, "loss": 4.985, "mean_token_accuracy": 0.20480854213237762, "num_tokens": 38934926.0, "step": 18755 }, { "entropy": 5.541030025482177, "epoch": 1.7017416545718431, "grad_norm": 1.1953125, "learning_rate": 0.0004712827415188401, "loss": 5.1384, "mean_token_accuracy": 0.19464268088340758, "num_tokens": 38944513.0, "step": 18760 }, { "entropy": 5.5305335521698, "epoch": 1.7021952104499274, "grad_norm": 0.984375, "learning_rate": 0.0004712669220467476, "loss": 4.9975, "mean_token_accuracy": 0.20468886196613312, "num_tokens": 38955918.0, "step": 18765 }, { "entropy": 5.5056816101074215, "epoch": 1.7026487663280117, "grad_norm": 1.046875, "learning_rate": 0.00047125109851580533, "loss": 5.0207, "mean_token_accuracy": 0.20369864255189896, "num_tokens": 38966221.0, "step": 18770 }, { "entropy": 5.468465137481689, "epoch": 1.703102322206096, "grad_norm": 1.078125, "learning_rate": 0.00047123527092634025, "loss": 4.9671, "mean_token_accuracy": 0.20372759103775023, "num_tokens": 38976463.0, "step": 18775 }, { "entropy": 5.415204572677612, "epoch": 1.70355587808418, "grad_norm": 1.0859375, "learning_rate": 0.0004712194392786797, "loss": 4.9124, "mean_token_accuracy": 0.2066280022263527, "num_tokens": 38986375.0, "step": 18780 }, { "entropy": 5.568876600265503, "epoch": 1.704009433962264, "grad_norm": 1.046875, "learning_rate": 0.00047120360357315127, "loss": 5.0576, "mean_token_accuracy": 0.20506335645914078, "num_tokens": 38996116.0, "step": 18785 }, { "entropy": 5.44083342552185, "epoch": 1.7044629898403483, "grad_norm": 1.0625, "learning_rate": 0.00047118776381008216, "loss": 5.0075, "mean_token_accuracy": 0.20426292568445206, "num_tokens": 39005846.0, "step": 18790 }, { "entropy": 5.50305027961731, "epoch": 1.7049165457184325, "grad_norm": 1.140625, "learning_rate": 0.00047117191998980026, "loss": 5.0209, "mean_token_accuracy": 0.1990242898464203, "num_tokens": 39016744.0, "step": 18795 }, { "entropy": 5.503367137908936, "epoch": 1.7053701015965168, "grad_norm": 1.0625, "learning_rate": 0.00047115607211263295, "loss": 5.0696, "mean_token_accuracy": 0.19460780322551727, "num_tokens": 39026725.0, "step": 18800 }, { "entropy": 5.5182078838348385, "epoch": 1.7058236574746009, "grad_norm": 1.015625, "learning_rate": 0.00047114022017890814, "loss": 5.0352, "mean_token_accuracy": 0.20314220190048218, "num_tokens": 39036851.0, "step": 18805 }, { "entropy": 5.460090637207031, "epoch": 1.706277213352685, "grad_norm": 1.078125, "learning_rate": 0.0004711243641889536, "loss": 4.964, "mean_token_accuracy": 0.20226655155420303, "num_tokens": 39047179.0, "step": 18810 }, { "entropy": 5.423959970474243, "epoch": 1.7067307692307692, "grad_norm": 1.0390625, "learning_rate": 0.00047110850414309714, "loss": 4.8583, "mean_token_accuracy": 0.21936832517385482, "num_tokens": 39057758.0, "step": 18815 }, { "entropy": 5.481882333755493, "epoch": 1.7071843251088534, "grad_norm": 1.125, "learning_rate": 0.00047109264004166696, "loss": 5.0756, "mean_token_accuracy": 0.19900205433368684, "num_tokens": 39068142.0, "step": 18820 }, { "entropy": 5.466638708114624, "epoch": 1.7076378809869377, "grad_norm": 1.0390625, "learning_rate": 0.0004710767718849909, "loss": 4.9717, "mean_token_accuracy": 0.19948351234197617, "num_tokens": 39078157.0, "step": 18825 }, { "entropy": 5.439548063278198, "epoch": 1.7080914368650217, "grad_norm": 1.0703125, "learning_rate": 0.0004710608996733973, "loss": 5.009, "mean_token_accuracy": 0.20742802023887635, "num_tokens": 39089090.0, "step": 18830 }, { "entropy": 5.492271900177002, "epoch": 1.708544992743106, "grad_norm": 1.0390625, "learning_rate": 0.00047104502340721433, "loss": 5.0605, "mean_token_accuracy": 0.19618065804243087, "num_tokens": 39099079.0, "step": 18835 }, { "entropy": 5.467269468307495, "epoch": 1.70899854862119, "grad_norm": 0.98828125, "learning_rate": 0.00047102914308677033, "loss": 4.9891, "mean_token_accuracy": 0.20357683300971985, "num_tokens": 39109927.0, "step": 18840 }, { "entropy": 5.506478881835937, "epoch": 1.7094521044992743, "grad_norm": 1.0703125, "learning_rate": 0.00047101325871239363, "loss": 5.0059, "mean_token_accuracy": 0.20357514470815657, "num_tokens": 39119806.0, "step": 18845 }, { "entropy": 5.539082431793213, "epoch": 1.7099056603773586, "grad_norm": 1.0859375, "learning_rate": 0.0004709973702844128, "loss": 5.093, "mean_token_accuracy": 0.19915326982736586, "num_tokens": 39130147.0, "step": 18850 }, { "entropy": 5.424869155883789, "epoch": 1.7103592162554426, "grad_norm": 1.140625, "learning_rate": 0.00047098147780315645, "loss": 4.8969, "mean_token_accuracy": 0.21334052979946136, "num_tokens": 39139937.0, "step": 18855 }, { "entropy": 5.456284618377685, "epoch": 1.710812772133527, "grad_norm": 1.625, "learning_rate": 0.0004709655812689532, "loss": 5.0189, "mean_token_accuracy": 0.2109014242887497, "num_tokens": 39149977.0, "step": 18860 }, { "entropy": 5.443518829345703, "epoch": 1.711266328011611, "grad_norm": 0.953125, "learning_rate": 0.0004709496806821318, "loss": 5.0368, "mean_token_accuracy": 0.20697655975818635, "num_tokens": 39161076.0, "step": 18865 }, { "entropy": 5.534329795837403, "epoch": 1.7117198838896952, "grad_norm": 1.140625, "learning_rate": 0.00047093377604302106, "loss": 5.0853, "mean_token_accuracy": 0.195909982919693, "num_tokens": 39170776.0, "step": 18870 }, { "entropy": 5.534866428375244, "epoch": 1.7121734397677795, "grad_norm": 0.9609375, "learning_rate": 0.0004709178673519499, "loss": 5.0304, "mean_token_accuracy": 0.1954835370182991, "num_tokens": 39181134.0, "step": 18875 }, { "entropy": 5.490071582794189, "epoch": 1.7126269956458637, "grad_norm": 0.94140625, "learning_rate": 0.0004709019546092473, "loss": 5.114, "mean_token_accuracy": 0.19726359695196152, "num_tokens": 39193331.0, "step": 18880 }, { "entropy": 5.5813719749450685, "epoch": 1.7130805515239478, "grad_norm": 1.0625, "learning_rate": 0.00047088603781524237, "loss": 5.0799, "mean_token_accuracy": 0.19530190974473954, "num_tokens": 39204372.0, "step": 18885 }, { "entropy": 5.506999826431274, "epoch": 1.7135341074020318, "grad_norm": 1.1171875, "learning_rate": 0.0004708701169702642, "loss": 4.9908, "mean_token_accuracy": 0.20710833072662355, "num_tokens": 39214725.0, "step": 18890 }, { "entropy": 5.408149671554566, "epoch": 1.713987663280116, "grad_norm": 1.0703125, "learning_rate": 0.0004708541920746422, "loss": 4.9776, "mean_token_accuracy": 0.20177210867404938, "num_tokens": 39225119.0, "step": 18895 }, { "entropy": 5.452188968658447, "epoch": 1.7144412191582004, "grad_norm": 1.078125, "learning_rate": 0.0004708382631287055, "loss": 4.9587, "mean_token_accuracy": 0.20001497566699983, "num_tokens": 39235021.0, "step": 18900 }, { "entropy": 5.496608829498291, "epoch": 1.7148947750362846, "grad_norm": 0.984375, "learning_rate": 0.0004708223301327837, "loss": 5.1335, "mean_token_accuracy": 0.19637949019670486, "num_tokens": 39245830.0, "step": 18905 }, { "entropy": 5.543840312957764, "epoch": 1.7153483309143687, "grad_norm": 1.078125, "learning_rate": 0.00047080639308720617, "loss": 5.1015, "mean_token_accuracy": 0.20476004779338836, "num_tokens": 39255264.0, "step": 18910 }, { "entropy": 5.470672464370727, "epoch": 1.7158018867924527, "grad_norm": 1.1015625, "learning_rate": 0.00047079045199230254, "loss": 4.9904, "mean_token_accuracy": 0.20544988065958023, "num_tokens": 39264966.0, "step": 18915 }, { "entropy": 5.477617597579956, "epoch": 1.716255442670537, "grad_norm": 1.1015625, "learning_rate": 0.00047077450684840247, "loss": 5.0934, "mean_token_accuracy": 0.1990952104330063, "num_tokens": 39275082.0, "step": 18920 }, { "entropy": 5.565166902542114, "epoch": 1.7167089985486212, "grad_norm": 1.1640625, "learning_rate": 0.0004707585576558357, "loss": 5.1601, "mean_token_accuracy": 0.1952443391084671, "num_tokens": 39285426.0, "step": 18925 }, { "entropy": 5.57421875, "epoch": 1.7171625544267055, "grad_norm": 1.0625, "learning_rate": 0.0004707426044149321, "loss": 5.0929, "mean_token_accuracy": 0.19887081980705262, "num_tokens": 39296633.0, "step": 18930 }, { "entropy": 5.487073659896851, "epoch": 1.7176161103047896, "grad_norm": 1.046875, "learning_rate": 0.00047072664712602153, "loss": 4.9187, "mean_token_accuracy": 0.21383173018693924, "num_tokens": 39306775.0, "step": 18935 }, { "entropy": 5.49683313369751, "epoch": 1.7180696661828736, "grad_norm": 1.046875, "learning_rate": 0.000470710685789434, "loss": 5.0301, "mean_token_accuracy": 0.1975339636206627, "num_tokens": 39317917.0, "step": 18940 }, { "entropy": 5.5069968700408936, "epoch": 1.7185232220609579, "grad_norm": 0.99609375, "learning_rate": 0.00047069472040549965, "loss": 5.0417, "mean_token_accuracy": 0.20173940807580948, "num_tokens": 39328387.0, "step": 18945 }, { "entropy": 5.403943729400635, "epoch": 1.7189767779390421, "grad_norm": 1.09375, "learning_rate": 0.0004706787509745486, "loss": 4.8847, "mean_token_accuracy": 0.21390847563743592, "num_tokens": 39337639.0, "step": 18950 }, { "entropy": 5.490783739089966, "epoch": 1.7194303338171264, "grad_norm": 1.1328125, "learning_rate": 0.00047066277749691115, "loss": 5.0159, "mean_token_accuracy": 0.20759454667568206, "num_tokens": 39347971.0, "step": 18955 }, { "entropy": 5.536470937728882, "epoch": 1.7198838896952104, "grad_norm": 1.0, "learning_rate": 0.0004706467999729175, "loss": 5.0615, "mean_token_accuracy": 0.19836702644824983, "num_tokens": 39358038.0, "step": 18960 }, { "entropy": 5.528147506713867, "epoch": 1.7203374455732945, "grad_norm": 1.1015625, "learning_rate": 0.0004706308184028983, "loss": 5.0495, "mean_token_accuracy": 0.20155510157346726, "num_tokens": 39367834.0, "step": 18965 }, { "entropy": 5.522714042663575, "epoch": 1.7207910014513788, "grad_norm": 0.9609375, "learning_rate": 0.0004706148327871839, "loss": 5.041, "mean_token_accuracy": 0.2054267257452011, "num_tokens": 39378924.0, "step": 18970 }, { "entropy": 5.569248008728027, "epoch": 1.721244557329463, "grad_norm": 1.0390625, "learning_rate": 0.00047059884312610487, "loss": 5.1299, "mean_token_accuracy": 0.19488806575536727, "num_tokens": 39390082.0, "step": 18975 }, { "entropy": 5.506864213943482, "epoch": 1.7216981132075473, "grad_norm": 1.0390625, "learning_rate": 0.00047058284941999185, "loss": 5.0525, "mean_token_accuracy": 0.20530381947755813, "num_tokens": 39400485.0, "step": 18980 }, { "entropy": 5.4896307468414305, "epoch": 1.7221516690856313, "grad_norm": 0.97265625, "learning_rate": 0.0004705668516691758, "loss": 5.0437, "mean_token_accuracy": 0.20410714745521547, "num_tokens": 39411601.0, "step": 18985 }, { "entropy": 5.483820247650146, "epoch": 1.7226052249637154, "grad_norm": 0.95703125, "learning_rate": 0.00047055084987398735, "loss": 4.9675, "mean_token_accuracy": 0.20924535095691682, "num_tokens": 39421625.0, "step": 18990 }, { "entropy": 5.473049306869507, "epoch": 1.7230587808417996, "grad_norm": 1.0625, "learning_rate": 0.0004705348440347575, "loss": 5.006, "mean_token_accuracy": 0.20160515159368514, "num_tokens": 39432033.0, "step": 18995 }, { "entropy": 5.4737790584564205, "epoch": 1.723512336719884, "grad_norm": 1.1015625, "learning_rate": 0.00047051883415181724, "loss": 4.9867, "mean_token_accuracy": 0.20564049929380418, "num_tokens": 39442514.0, "step": 19000 }, { "entropy": 5.48325548171997, "epoch": 1.7239658925979682, "grad_norm": 1.0390625, "learning_rate": 0.0004705028202254977, "loss": 4.8999, "mean_token_accuracy": 0.21157418042421341, "num_tokens": 39452497.0, "step": 19005 }, { "entropy": 5.4872393131256105, "epoch": 1.7244194484760522, "grad_norm": 1.0390625, "learning_rate": 0.00047048680225612996, "loss": 5.0284, "mean_token_accuracy": 0.20488055944442748, "num_tokens": 39462173.0, "step": 19010 }, { "entropy": 5.5290426254272464, "epoch": 1.7248730043541363, "grad_norm": 1.1015625, "learning_rate": 0.0004704707802440454, "loss": 5.0531, "mean_token_accuracy": 0.20708537846803665, "num_tokens": 39473123.0, "step": 19015 }, { "entropy": 5.503283500671387, "epoch": 1.7253265602322205, "grad_norm": 1.109375, "learning_rate": 0.00047045475418957524, "loss": 5.0346, "mean_token_accuracy": 0.19464755058288574, "num_tokens": 39484142.0, "step": 19020 }, { "entropy": 5.49665675163269, "epoch": 1.7257801161103048, "grad_norm": 1.0546875, "learning_rate": 0.0004704387240930509, "loss": 5.0475, "mean_token_accuracy": 0.1961239457130432, "num_tokens": 39494926.0, "step": 19025 }, { "entropy": 5.444309186935425, "epoch": 1.726233671988389, "grad_norm": 1.0859375, "learning_rate": 0.0004704226899548041, "loss": 4.9765, "mean_token_accuracy": 0.20878380239009858, "num_tokens": 39505153.0, "step": 19030 }, { "entropy": 5.456864356994629, "epoch": 1.726687227866473, "grad_norm": 1.0546875, "learning_rate": 0.00047040665177516616, "loss": 4.9609, "mean_token_accuracy": 0.20865223854780196, "num_tokens": 39515905.0, "step": 19035 }, { "entropy": 5.4507979393005375, "epoch": 1.7271407837445574, "grad_norm": 1.0625, "learning_rate": 0.00047039060955446886, "loss": 4.9777, "mean_token_accuracy": 0.20940704494714737, "num_tokens": 39526762.0, "step": 19040 }, { "entropy": 5.45876727104187, "epoch": 1.7275943396226414, "grad_norm": 1.0546875, "learning_rate": 0.000470374563293044, "loss": 4.9807, "mean_token_accuracy": 0.2033142626285553, "num_tokens": 39537340.0, "step": 19045 }, { "entropy": 5.497812652587891, "epoch": 1.7280478955007257, "grad_norm": 1.1171875, "learning_rate": 0.0004703585129912234, "loss": 4.9969, "mean_token_accuracy": 0.20277515202760696, "num_tokens": 39547144.0, "step": 19050 }, { "entropy": 5.5948323726654055, "epoch": 1.72850145137881, "grad_norm": 1.0546875, "learning_rate": 0.00047034245864933894, "loss": 5.1148, "mean_token_accuracy": 0.19469091147184373, "num_tokens": 39557707.0, "step": 19055 }, { "entropy": 5.551272392272949, "epoch": 1.728955007256894, "grad_norm": 1.1328125, "learning_rate": 0.00047032640026772274, "loss": 5.0938, "mean_token_accuracy": 0.1990850269794464, "num_tokens": 39567629.0, "step": 19060 }, { "entropy": 5.494695329666138, "epoch": 1.7294085631349783, "grad_norm": 1.046875, "learning_rate": 0.0004703103378467067, "loss": 4.9914, "mean_token_accuracy": 0.2044454872608185, "num_tokens": 39577918.0, "step": 19065 }, { "entropy": 5.516372489929199, "epoch": 1.7298621190130623, "grad_norm": 1.1015625, "learning_rate": 0.00047029427138662314, "loss": 5.0232, "mean_token_accuracy": 0.21252963989973067, "num_tokens": 39587838.0, "step": 19070 }, { "entropy": 5.459414339065551, "epoch": 1.7303156748911466, "grad_norm": 1.0078125, "learning_rate": 0.0004702782008878042, "loss": 4.9262, "mean_token_accuracy": 0.20903893411159516, "num_tokens": 39597353.0, "step": 19075 }, { "entropy": 5.454975748062134, "epoch": 1.7307692307692308, "grad_norm": 0.95703125, "learning_rate": 0.0004702621263505824, "loss": 4.9788, "mean_token_accuracy": 0.20501814484596254, "num_tokens": 39607349.0, "step": 19080 }, { "entropy": 5.472273063659668, "epoch": 1.731222786647315, "grad_norm": 1.03125, "learning_rate": 0.0004702460477752901, "loss": 5.0443, "mean_token_accuracy": 0.20289291739463805, "num_tokens": 39617810.0, "step": 19085 }, { "entropy": 5.476509857177734, "epoch": 1.7316763425253991, "grad_norm": 1.0234375, "learning_rate": 0.0004702299651622597, "loss": 4.9375, "mean_token_accuracy": 0.21759312748908996, "num_tokens": 39626805.0, "step": 19090 }, { "entropy": 5.442428302764893, "epoch": 1.7321298984034832, "grad_norm": 1.0, "learning_rate": 0.0004702138785118239, "loss": 4.9584, "mean_token_accuracy": 0.21143175065517425, "num_tokens": 39637839.0, "step": 19095 }, { "entropy": 5.429023170471192, "epoch": 1.7325834542815675, "grad_norm": 0.97265625, "learning_rate": 0.0004701977878243153, "loss": 4.953, "mean_token_accuracy": 0.20404670387506485, "num_tokens": 39648697.0, "step": 19100 }, { "entropy": 5.453158378601074, "epoch": 1.7330370101596517, "grad_norm": 1.078125, "learning_rate": 0.0004701816931000668, "loss": 4.9899, "mean_token_accuracy": 0.2053990915417671, "num_tokens": 39658154.0, "step": 19105 }, { "entropy": 5.4667986869812015, "epoch": 1.733490566037736, "grad_norm": 1.0859375, "learning_rate": 0.00047016559433941106, "loss": 4.9967, "mean_token_accuracy": 0.2058219015598297, "num_tokens": 39667939.0, "step": 19110 }, { "entropy": 5.437241506576538, "epoch": 1.73394412191582, "grad_norm": 1.0859375, "learning_rate": 0.0004701494915426812, "loss": 4.9485, "mean_token_accuracy": 0.2034673810005188, "num_tokens": 39678289.0, "step": 19115 }, { "entropy": 5.50600380897522, "epoch": 1.734397677793904, "grad_norm": 1.125, "learning_rate": 0.00047013338471021, "loss": 4.9929, "mean_token_accuracy": 0.2037924885749817, "num_tokens": 39689901.0, "step": 19120 }, { "entropy": 5.5021851539611815, "epoch": 1.7348512336719883, "grad_norm": 1.0546875, "learning_rate": 0.00047011727384233074, "loss": 5.0331, "mean_token_accuracy": 0.2013510659337044, "num_tokens": 39700831.0, "step": 19125 }, { "entropy": 5.5257683277130125, "epoch": 1.7353047895500726, "grad_norm": 0.99609375, "learning_rate": 0.0004701011589393765, "loss": 5.0453, "mean_token_accuracy": 0.20323415845632553, "num_tokens": 39711794.0, "step": 19130 }, { "entropy": 5.475721979141236, "epoch": 1.7357583454281569, "grad_norm": 1.1171875, "learning_rate": 0.00047008504000168054, "loss": 4.9858, "mean_token_accuracy": 0.2066682130098343, "num_tokens": 39721889.0, "step": 19135 }, { "entropy": 5.442572212219238, "epoch": 1.736211901306241, "grad_norm": 0.9921875, "learning_rate": 0.0004700689170295763, "loss": 5.0607, "mean_token_accuracy": 0.20893426686525346, "num_tokens": 39732562.0, "step": 19140 }, { "entropy": 5.567757034301758, "epoch": 1.736665457184325, "grad_norm": 1.09375, "learning_rate": 0.00047005279002339717, "loss": 5.0136, "mean_token_accuracy": 0.2066911593079567, "num_tokens": 39742286.0, "step": 19145 }, { "entropy": 5.522202491760254, "epoch": 1.7371190130624092, "grad_norm": 1.0390625, "learning_rate": 0.00047003665898347663, "loss": 5.0416, "mean_token_accuracy": 0.20541482120752336, "num_tokens": 39754336.0, "step": 19150 }, { "entropy": 5.449558210372925, "epoch": 1.7375725689404935, "grad_norm": 1.140625, "learning_rate": 0.0004700205239101483, "loss": 4.9149, "mean_token_accuracy": 0.21176816672086715, "num_tokens": 39763545.0, "step": 19155 }, { "entropy": 5.518767642974853, "epoch": 1.7380261248185778, "grad_norm": 0.9375, "learning_rate": 0.0004700043848037458, "loss": 5.083, "mean_token_accuracy": 0.19528307467699052, "num_tokens": 39774536.0, "step": 19160 }, { "entropy": 5.4985637187957765, "epoch": 1.7384796806966618, "grad_norm": 1.0546875, "learning_rate": 0.0004699882416646029, "loss": 4.9783, "mean_token_accuracy": 0.20992634445428848, "num_tokens": 39785377.0, "step": 19165 }, { "entropy": 5.498961877822876, "epoch": 1.7389332365747459, "grad_norm": 1.0546875, "learning_rate": 0.0004699720944930535, "loss": 5.1028, "mean_token_accuracy": 0.18861977607011796, "num_tokens": 39796692.0, "step": 19170 }, { "entropy": 5.429786586761475, "epoch": 1.7393867924528301, "grad_norm": 0.96875, "learning_rate": 0.00046995594328943147, "loss": 4.9894, "mean_token_accuracy": 0.20851065516471862, "num_tokens": 39807927.0, "step": 19175 }, { "entropy": 5.600195407867432, "epoch": 1.7398403483309144, "grad_norm": 1.125, "learning_rate": 0.0004699397880540709, "loss": 5.1774, "mean_token_accuracy": 0.19841932952404023, "num_tokens": 39817617.0, "step": 19180 }, { "entropy": 5.512768173217774, "epoch": 1.7402939042089987, "grad_norm": 1.078125, "learning_rate": 0.0004699236287873058, "loss": 4.8961, "mean_token_accuracy": 0.2104815885424614, "num_tokens": 39827092.0, "step": 19185 }, { "entropy": 5.498181104660034, "epoch": 1.7407474600870827, "grad_norm": 1.0546875, "learning_rate": 0.0004699074654894705, "loss": 4.966, "mean_token_accuracy": 0.20659948736429215, "num_tokens": 39837378.0, "step": 19190 }, { "entropy": 5.481163215637207, "epoch": 1.7412010159651667, "grad_norm": 1.0390625, "learning_rate": 0.000469891298160899, "loss": 4.972, "mean_token_accuracy": 0.20108917057514192, "num_tokens": 39848191.0, "step": 19195 }, { "entropy": 5.426167154312134, "epoch": 1.741654571843251, "grad_norm": 1.03125, "learning_rate": 0.00046987512680192586, "loss": 4.9915, "mean_token_accuracy": 0.2045610874891281, "num_tokens": 39857886.0, "step": 19200 }, { "entropy": 5.5520631790161135, "epoch": 1.7421081277213353, "grad_norm": 0.98828125, "learning_rate": 0.00046985895141288546, "loss": 5.0735, "mean_token_accuracy": 0.19812504202127457, "num_tokens": 39868348.0, "step": 19205 }, { "entropy": 5.5643822193145756, "epoch": 1.7425616835994195, "grad_norm": 1.171875, "learning_rate": 0.00046984277199411224, "loss": 5.0773, "mean_token_accuracy": 0.20363999903202057, "num_tokens": 39879129.0, "step": 19210 }, { "entropy": 5.445794534683228, "epoch": 1.7430152394775036, "grad_norm": 1.15625, "learning_rate": 0.00046982658854594083, "loss": 4.9688, "mean_token_accuracy": 0.20444275438785553, "num_tokens": 39890239.0, "step": 19215 }, { "entropy": 5.40272331237793, "epoch": 1.7434687953555879, "grad_norm": 1.0703125, "learning_rate": 0.00046981040106870595, "loss": 4.895, "mean_token_accuracy": 0.2079245164990425, "num_tokens": 39900907.0, "step": 19220 }, { "entropy": 5.508737373352051, "epoch": 1.743922351233672, "grad_norm": 1.1171875, "learning_rate": 0.0004697942095627423, "loss": 5.0069, "mean_token_accuracy": 0.20607868880033492, "num_tokens": 39911564.0, "step": 19225 }, { "entropy": 5.492405939102173, "epoch": 1.7443759071117562, "grad_norm": 1.1484375, "learning_rate": 0.0004697780140283848, "loss": 4.9498, "mean_token_accuracy": 0.2060716688632965, "num_tokens": 39922168.0, "step": 19230 }, { "entropy": 5.473089551925659, "epoch": 1.7448294629898404, "grad_norm": 1.0703125, "learning_rate": 0.0004697618144659683, "loss": 4.9894, "mean_token_accuracy": 0.20918959975242615, "num_tokens": 39932690.0, "step": 19235 }, { "entropy": 5.578668594360352, "epoch": 1.7452830188679245, "grad_norm": 1.046875, "learning_rate": 0.0004697456108758278, "loss": 5.1499, "mean_token_accuracy": 0.19803129583597184, "num_tokens": 39942970.0, "step": 19240 }, { "entropy": 5.495582628250122, "epoch": 1.7457365747460087, "grad_norm": 1.0234375, "learning_rate": 0.0004697294032582986, "loss": 4.9704, "mean_token_accuracy": 0.20389143228530884, "num_tokens": 39953255.0, "step": 19245 }, { "entropy": 5.463984870910645, "epoch": 1.7461901306240928, "grad_norm": 1.0078125, "learning_rate": 0.00046971319161371564, "loss": 4.9207, "mean_token_accuracy": 0.21246978640556335, "num_tokens": 39963521.0, "step": 19250 }, { "entropy": 5.493888282775879, "epoch": 1.746643686502177, "grad_norm": 1.078125, "learning_rate": 0.00046969697594241426, "loss": 4.9755, "mean_token_accuracy": 0.20456201434135438, "num_tokens": 39973494.0, "step": 19255 }, { "entropy": 5.478393030166626, "epoch": 1.7470972423802613, "grad_norm": 1.0, "learning_rate": 0.0004696807562447298, "loss": 5.1048, "mean_token_accuracy": 0.19585141241550447, "num_tokens": 39984652.0, "step": 19260 }, { "entropy": 5.50634355545044, "epoch": 1.7475507982583456, "grad_norm": 1.0859375, "learning_rate": 0.00046966453252099763, "loss": 5.0461, "mean_token_accuracy": 0.20787999927997589, "num_tokens": 39995490.0, "step": 19265 }, { "entropy": 5.401324892044068, "epoch": 1.7480043541364296, "grad_norm": 1.09375, "learning_rate": 0.00046964830477155335, "loss": 4.8095, "mean_token_accuracy": 0.22924857586622238, "num_tokens": 40006447.0, "step": 19270 }, { "entropy": 5.537764167785644, "epoch": 1.7484579100145137, "grad_norm": 1.0625, "learning_rate": 0.00046963207299673257, "loss": 5.0852, "mean_token_accuracy": 0.1998353958129883, "num_tokens": 40015733.0, "step": 19275 }, { "entropy": 5.560251331329345, "epoch": 1.748911465892598, "grad_norm": 1.09375, "learning_rate": 0.00046961583719687085, "loss": 4.9493, "mean_token_accuracy": 0.20954487472772598, "num_tokens": 40025844.0, "step": 19280 }, { "entropy": 5.46172685623169, "epoch": 1.7493650217706822, "grad_norm": 1.2265625, "learning_rate": 0.00046959959737230414, "loss": 4.9813, "mean_token_accuracy": 0.21447892785072326, "num_tokens": 40035942.0, "step": 19285 }, { "entropy": 5.392023992538452, "epoch": 1.7498185776487665, "grad_norm": 1.125, "learning_rate": 0.00046958335352336806, "loss": 4.8873, "mean_token_accuracy": 0.21472759693861007, "num_tokens": 40045551.0, "step": 19290 }, { "entropy": 5.505699729919433, "epoch": 1.7502721335268505, "grad_norm": 1.03125, "learning_rate": 0.0004695671056503987, "loss": 5.0128, "mean_token_accuracy": 0.20877962857484816, "num_tokens": 40055803.0, "step": 19295 }, { "entropy": 5.466961812973023, "epoch": 1.7507256894049346, "grad_norm": 1.0546875, "learning_rate": 0.000469550853753732, "loss": 5.0047, "mean_token_accuracy": 0.1995977506041527, "num_tokens": 40066004.0, "step": 19300 }, { "entropy": 5.479906797409058, "epoch": 1.7511792452830188, "grad_norm": 1.109375, "learning_rate": 0.000469534597833704, "loss": 4.9984, "mean_token_accuracy": 0.21072949320077897, "num_tokens": 40075522.0, "step": 19305 }, { "entropy": 5.466987228393554, "epoch": 1.751632801161103, "grad_norm": 1.0546875, "learning_rate": 0.000469518337890651, "loss": 5.0047, "mean_token_accuracy": 0.21147502809762955, "num_tokens": 40084839.0, "step": 19310 }, { "entropy": 5.492431545257569, "epoch": 1.7520863570391874, "grad_norm": 1.0, "learning_rate": 0.00046950207392490917, "loss": 5.0308, "mean_token_accuracy": 0.2053804352879524, "num_tokens": 40094392.0, "step": 19315 }, { "entropy": 5.445017576217651, "epoch": 1.7525399129172714, "grad_norm": 0.93359375, "learning_rate": 0.00046948580593681496, "loss": 4.9614, "mean_token_accuracy": 0.20911876112222672, "num_tokens": 40105990.0, "step": 19320 }, { "entropy": 5.430374050140381, "epoch": 1.7529934687953554, "grad_norm": 1.0546875, "learning_rate": 0.0004694695339267047, "loss": 4.8983, "mean_token_accuracy": 0.21301756352186202, "num_tokens": 40116143.0, "step": 19325 }, { "entropy": 5.574617528915406, "epoch": 1.7534470246734397, "grad_norm": 1.0234375, "learning_rate": 0.00046945325789491483, "loss": 5.0767, "mean_token_accuracy": 0.20233528912067414, "num_tokens": 40126849.0, "step": 19330 }, { "entropy": 5.478389644622803, "epoch": 1.753900580551524, "grad_norm": 1.0703125, "learning_rate": 0.0004694369778417822, "loss": 5.0199, "mean_token_accuracy": 0.2064966917037964, "num_tokens": 40137259.0, "step": 19335 }, { "entropy": 5.394656181335449, "epoch": 1.7543541364296082, "grad_norm": 1.0234375, "learning_rate": 0.0004694206937676431, "loss": 4.8915, "mean_token_accuracy": 0.21250836700201034, "num_tokens": 40148578.0, "step": 19340 }, { "entropy": 5.519765138626099, "epoch": 1.7548076923076923, "grad_norm": 1.0, "learning_rate": 0.0004694044056728347, "loss": 5.0723, "mean_token_accuracy": 0.19564414769411087, "num_tokens": 40159754.0, "step": 19345 }, { "entropy": 5.521185493469238, "epoch": 1.7552612481857763, "grad_norm": 1.125, "learning_rate": 0.00046938811355769363, "loss": 5.005, "mean_token_accuracy": 0.20478369146585465, "num_tokens": 40169388.0, "step": 19350 }, { "entropy": 5.477996444702148, "epoch": 1.7557148040638606, "grad_norm": 1.078125, "learning_rate": 0.00046937181742255673, "loss": 5.0091, "mean_token_accuracy": 0.2044983148574829, "num_tokens": 40179271.0, "step": 19355 }, { "entropy": 5.5135838985443115, "epoch": 1.7561683599419449, "grad_norm": 1.0703125, "learning_rate": 0.0004693555172677612, "loss": 5.0557, "mean_token_accuracy": 0.2031428873538971, "num_tokens": 40189292.0, "step": 19360 }, { "entropy": 5.485254383087158, "epoch": 1.7566219158200291, "grad_norm": 1.0546875, "learning_rate": 0.000469339213093644, "loss": 5.0107, "mean_token_accuracy": 0.20674334615468978, "num_tokens": 40199271.0, "step": 19365 }, { "entropy": 5.485046863555908, "epoch": 1.7570754716981132, "grad_norm": 1.046875, "learning_rate": 0.00046932290490054235, "loss": 5.0304, "mean_token_accuracy": 0.20664295554161072, "num_tokens": 40210386.0, "step": 19370 }, { "entropy": 5.514654541015625, "epoch": 1.7575290275761972, "grad_norm": 1.109375, "learning_rate": 0.0004693065926887936, "loss": 5.0042, "mean_token_accuracy": 0.20283467024564744, "num_tokens": 40220892.0, "step": 19375 }, { "entropy": 5.534471464157105, "epoch": 1.7579825834542815, "grad_norm": 1.0078125, "learning_rate": 0.00046929027645873484, "loss": 4.9941, "mean_token_accuracy": 0.2017950177192688, "num_tokens": 40231737.0, "step": 19380 }, { "entropy": 5.502135562896728, "epoch": 1.7584361393323658, "grad_norm": 0.9765625, "learning_rate": 0.0004692739562107038, "loss": 5.0441, "mean_token_accuracy": 0.20254693329334258, "num_tokens": 40242218.0, "step": 19385 }, { "entropy": 5.468260288238525, "epoch": 1.75888969521045, "grad_norm": 1.0078125, "learning_rate": 0.00046925763194503775, "loss": 4.9723, "mean_token_accuracy": 0.20756390541791916, "num_tokens": 40253659.0, "step": 19390 }, { "entropy": 5.397907686233521, "epoch": 1.759343251088534, "grad_norm": 0.984375, "learning_rate": 0.0004692413036620744, "loss": 4.8436, "mean_token_accuracy": 0.21793943494558335, "num_tokens": 40264328.0, "step": 19395 }, { "entropy": 5.451465272903443, "epoch": 1.7597968069666183, "grad_norm": 0.98828125, "learning_rate": 0.0004692249713621514, "loss": 4.9522, "mean_token_accuracy": 0.20580762326717378, "num_tokens": 40275188.0, "step": 19400 }, { "entropy": 5.558916187286377, "epoch": 1.7602503628447024, "grad_norm": 1.0546875, "learning_rate": 0.00046920863504560647, "loss": 5.1234, "mean_token_accuracy": 0.19936256259679794, "num_tokens": 40287094.0, "step": 19405 }, { "entropy": 5.499798583984375, "epoch": 1.7607039187227866, "grad_norm": 1.1640625, "learning_rate": 0.0004691922947127775, "loss": 4.9755, "mean_token_accuracy": 0.20331257134675979, "num_tokens": 40296551.0, "step": 19410 }, { "entropy": 5.467429494857788, "epoch": 1.761157474600871, "grad_norm": 0.9921875, "learning_rate": 0.0004691759503640024, "loss": 4.9796, "mean_token_accuracy": 0.2025754451751709, "num_tokens": 40306920.0, "step": 19415 }, { "entropy": 5.441870784759521, "epoch": 1.761611030478955, "grad_norm": 1.0546875, "learning_rate": 0.0004691596019996191, "loss": 4.8822, "mean_token_accuracy": 0.21416640728712083, "num_tokens": 40316797.0, "step": 19420 }, { "entropy": 5.396556568145752, "epoch": 1.7620645863570392, "grad_norm": 1.046875, "learning_rate": 0.0004691432496199658, "loss": 4.9538, "mean_token_accuracy": 0.20391108095645905, "num_tokens": 40327002.0, "step": 19425 }, { "entropy": 5.573301506042481, "epoch": 1.7625181422351233, "grad_norm": 1.046875, "learning_rate": 0.00046912689322538064, "loss": 5.0905, "mean_token_accuracy": 0.2061540275812149, "num_tokens": 40337247.0, "step": 19430 }, { "entropy": 5.5015565872192385, "epoch": 1.7629716981132075, "grad_norm": 1.140625, "learning_rate": 0.00046911053281620187, "loss": 5.0379, "mean_token_accuracy": 0.20459424555301667, "num_tokens": 40346960.0, "step": 19435 }, { "entropy": 5.539232969284058, "epoch": 1.7634252539912918, "grad_norm": 1.0625, "learning_rate": 0.00046909416839276775, "loss": 5.0489, "mean_token_accuracy": 0.2052585870027542, "num_tokens": 40357169.0, "step": 19440 }, { "entropy": 5.4448387145996096, "epoch": 1.763878809869376, "grad_norm": 1.3125, "learning_rate": 0.0004690777999554168, "loss": 4.8883, "mean_token_accuracy": 0.21226165145635606, "num_tokens": 40367660.0, "step": 19445 }, { "entropy": 5.447745370864868, "epoch": 1.76433236574746, "grad_norm": 1.0859375, "learning_rate": 0.0004690614275044875, "loss": 4.9031, "mean_token_accuracy": 0.20838938057422637, "num_tokens": 40378217.0, "step": 19450 }, { "entropy": 5.483260631561279, "epoch": 1.7647859216255442, "grad_norm": 1.2734375, "learning_rate": 0.0004690450510403184, "loss": 5.002, "mean_token_accuracy": 0.20388685613870622, "num_tokens": 40388249.0, "step": 19455 }, { "entropy": 5.528651094436645, "epoch": 1.7652394775036284, "grad_norm": 1.078125, "learning_rate": 0.0004690286705632483, "loss": 5.0581, "mean_token_accuracy": 0.20168517678976058, "num_tokens": 40398239.0, "step": 19460 }, { "entropy": 5.510349464416504, "epoch": 1.7656930333817127, "grad_norm": 1.0625, "learning_rate": 0.0004690122860736157, "loss": 5.0552, "mean_token_accuracy": 0.20132900178432464, "num_tokens": 40408473.0, "step": 19465 }, { "entropy": 5.616847658157349, "epoch": 1.766146589259797, "grad_norm": 1.09375, "learning_rate": 0.00046899589757175964, "loss": 5.1401, "mean_token_accuracy": 0.19569293558597564, "num_tokens": 40418674.0, "step": 19470 }, { "entropy": 5.47779483795166, "epoch": 1.766600145137881, "grad_norm": 1.0234375, "learning_rate": 0.000468979505058019, "loss": 4.9657, "mean_token_accuracy": 0.20367812365293503, "num_tokens": 40429815.0, "step": 19475 }, { "entropy": 5.557933712005616, "epoch": 1.767053701015965, "grad_norm": 1.1171875, "learning_rate": 0.00046896310853273274, "loss": 5.083, "mean_token_accuracy": 0.19921138435602187, "num_tokens": 40439809.0, "step": 19480 }, { "entropy": 5.580274629592895, "epoch": 1.7675072568940493, "grad_norm": 1.203125, "learning_rate": 0.00046894670799624, "loss": 5.0558, "mean_token_accuracy": 0.20024756342172623, "num_tokens": 40449503.0, "step": 19485 }, { "entropy": 5.49308066368103, "epoch": 1.7679608127721336, "grad_norm": 1.03125, "learning_rate": 0.00046893030344887995, "loss": 5.0814, "mean_token_accuracy": 0.19226822406053543, "num_tokens": 40459794.0, "step": 19490 }, { "entropy": 5.464216518402099, "epoch": 1.7684143686502178, "grad_norm": 1.1796875, "learning_rate": 0.00046891389489099166, "loss": 4.9301, "mean_token_accuracy": 0.21299748867750168, "num_tokens": 40470044.0, "step": 19495 }, { "entropy": 5.464532041549683, "epoch": 1.7688679245283019, "grad_norm": 1.0, "learning_rate": 0.00046889748232291476, "loss": 4.9852, "mean_token_accuracy": 0.20078731328248978, "num_tokens": 40480709.0, "step": 19500 }, { "entropy": 5.430858850479126, "epoch": 1.769321480406386, "grad_norm": 1.0859375, "learning_rate": 0.00046888106574498843, "loss": 4.8269, "mean_token_accuracy": 0.21487310528755188, "num_tokens": 40490906.0, "step": 19505 }, { "entropy": 5.425414514541626, "epoch": 1.7697750362844702, "grad_norm": 1.03125, "learning_rate": 0.0004688646451575522, "loss": 4.942, "mean_token_accuracy": 0.21000200062990187, "num_tokens": 40501971.0, "step": 19510 }, { "entropy": 5.456477117538452, "epoch": 1.7702285921625545, "grad_norm": 1.046875, "learning_rate": 0.00046884822056094587, "loss": 5.0428, "mean_token_accuracy": 0.19533804655075074, "num_tokens": 40512685.0, "step": 19515 }, { "entropy": 5.475785541534424, "epoch": 1.7706821480406387, "grad_norm": 0.9921875, "learning_rate": 0.00046883179195550883, "loss": 4.9737, "mean_token_accuracy": 0.20894474387168885, "num_tokens": 40523460.0, "step": 19520 }, { "entropy": 5.521895551681519, "epoch": 1.7711357039187228, "grad_norm": 1.109375, "learning_rate": 0.00046881535934158094, "loss": 4.964, "mean_token_accuracy": 0.2081453248858452, "num_tokens": 40533594.0, "step": 19525 }, { "entropy": 5.472539567947388, "epoch": 1.7715892597968068, "grad_norm": 1.1796875, "learning_rate": 0.0004687989227195021, "loss": 4.9983, "mean_token_accuracy": 0.2078337699174881, "num_tokens": 40543504.0, "step": 19530 }, { "entropy": 5.493492698669433, "epoch": 1.772042815674891, "grad_norm": 1.1015625, "learning_rate": 0.00046878248208961204, "loss": 4.9785, "mean_token_accuracy": 0.20091839283704757, "num_tokens": 40553711.0, "step": 19535 }, { "entropy": 5.486490678787232, "epoch": 1.7724963715529753, "grad_norm": 1.0859375, "learning_rate": 0.000468766037452251, "loss": 5.0194, "mean_token_accuracy": 0.20321821868419648, "num_tokens": 40563731.0, "step": 19540 }, { "entropy": 5.515470361709594, "epoch": 1.7729499274310596, "grad_norm": 1.1640625, "learning_rate": 0.00046874958880775886, "loss": 5.0192, "mean_token_accuracy": 0.20378756523132324, "num_tokens": 40574235.0, "step": 19545 }, { "entropy": 5.476559495925903, "epoch": 1.7734034833091437, "grad_norm": 1.0234375, "learning_rate": 0.0004687331361564758, "loss": 4.9443, "mean_token_accuracy": 0.21053395420312881, "num_tokens": 40584459.0, "step": 19550 }, { "entropy": 5.4867815494537355, "epoch": 1.7738570391872277, "grad_norm": 1.140625, "learning_rate": 0.0004687166794987422, "loss": 4.9979, "mean_token_accuracy": 0.20661632269620894, "num_tokens": 40594268.0, "step": 19555 }, { "entropy": 5.46446123123169, "epoch": 1.774310595065312, "grad_norm": 1.046875, "learning_rate": 0.0004687002188348983, "loss": 4.9606, "mean_token_accuracy": 0.21058797538280488, "num_tokens": 40604673.0, "step": 19560 }, { "entropy": 5.406919240951538, "epoch": 1.7747641509433962, "grad_norm": 1.09375, "learning_rate": 0.00046868375416528443, "loss": 4.9581, "mean_token_accuracy": 0.20515688955783845, "num_tokens": 40614998.0, "step": 19565 }, { "entropy": 5.477487850189209, "epoch": 1.7752177068214805, "grad_norm": 1.15625, "learning_rate": 0.00046866728549024123, "loss": 5.0315, "mean_token_accuracy": 0.20351595878601075, "num_tokens": 40624729.0, "step": 19570 }, { "entropy": 5.4780138492584225, "epoch": 1.7756712626995645, "grad_norm": 1.015625, "learning_rate": 0.0004686508128101092, "loss": 5.0915, "mean_token_accuracy": 0.2033676564693451, "num_tokens": 40635673.0, "step": 19575 }, { "entropy": 5.537872552871704, "epoch": 1.7761248185776488, "grad_norm": 1.015625, "learning_rate": 0.000468634336125229, "loss": 5.0543, "mean_token_accuracy": 0.19503015875816346, "num_tokens": 40645990.0, "step": 19580 }, { "entropy": 5.535602378845215, "epoch": 1.7765783744557329, "grad_norm": 1.1171875, "learning_rate": 0.00046861785543594143, "loss": 4.9927, "mean_token_accuracy": 0.2150138199329376, "num_tokens": 40656339.0, "step": 19585 }, { "entropy": 5.473038530349731, "epoch": 1.7770319303338171, "grad_norm": 1.1484375, "learning_rate": 0.0004686013707425873, "loss": 4.9083, "mean_token_accuracy": 0.2127785563468933, "num_tokens": 40666371.0, "step": 19590 }, { "entropy": 5.507061529159546, "epoch": 1.7774854862119014, "grad_norm": 1.078125, "learning_rate": 0.00046858488204550735, "loss": 4.9721, "mean_token_accuracy": 0.20457061380147934, "num_tokens": 40676423.0, "step": 19595 }, { "entropy": 5.474527072906494, "epoch": 1.7779390420899854, "grad_norm": 1.0234375, "learning_rate": 0.0004685683893450428, "loss": 4.9323, "mean_token_accuracy": 0.21180423796176912, "num_tokens": 40686331.0, "step": 19600 }, { "entropy": 5.409183311462402, "epoch": 1.7783925979680697, "grad_norm": 1.015625, "learning_rate": 0.0004685518926415346, "loss": 4.9811, "mean_token_accuracy": 0.21339729726314544, "num_tokens": 40697408.0, "step": 19605 }, { "entropy": 5.38602614402771, "epoch": 1.7788461538461537, "grad_norm": 1.1484375, "learning_rate": 0.000468535391935324, "loss": 4.8721, "mean_token_accuracy": 0.21699881553649902, "num_tokens": 40707078.0, "step": 19610 }, { "entropy": 5.482337093353271, "epoch": 1.779299709724238, "grad_norm": 1.0625, "learning_rate": 0.0004685188872267521, "loss": 4.9779, "mean_token_accuracy": 0.20937298089265824, "num_tokens": 40718116.0, "step": 19615 }, { "entropy": 5.490728092193604, "epoch": 1.7797532656023223, "grad_norm": 1.0234375, "learning_rate": 0.0004685023785161603, "loss": 5.0048, "mean_token_accuracy": 0.20560814142227174, "num_tokens": 40727737.0, "step": 19620 }, { "entropy": 5.514803743362426, "epoch": 1.7802068214804065, "grad_norm": 1.046875, "learning_rate": 0.0004684858658038901, "loss": 4.9709, "mean_token_accuracy": 0.20210180282592774, "num_tokens": 40737455.0, "step": 19625 }, { "entropy": 5.570596647262573, "epoch": 1.7806603773584906, "grad_norm": 1.109375, "learning_rate": 0.0004684693490902828, "loss": 5.0073, "mean_token_accuracy": 0.20343903005123137, "num_tokens": 40746715.0, "step": 19630 }, { "entropy": 5.435371255874633, "epoch": 1.7811139332365746, "grad_norm": 0.98828125, "learning_rate": 0.00046845282837568, "loss": 4.8913, "mean_token_accuracy": 0.21110435873270034, "num_tokens": 40756432.0, "step": 19635 }, { "entropy": 5.3773823261260985, "epoch": 1.781567489114659, "grad_norm": 1.0390625, "learning_rate": 0.00046843630366042355, "loss": 4.9445, "mean_token_accuracy": 0.20851500928401948, "num_tokens": 40766629.0, "step": 19640 }, { "entropy": 5.5339432716369625, "epoch": 1.7820210449927432, "grad_norm": 1.15625, "learning_rate": 0.00046841977494485506, "loss": 5.0804, "mean_token_accuracy": 0.19790629148483277, "num_tokens": 40776650.0, "step": 19645 }, { "entropy": 5.5536092758178714, "epoch": 1.7824746008708274, "grad_norm": 1.1015625, "learning_rate": 0.0004684032422293162, "loss": 4.9873, "mean_token_accuracy": 0.2108376607298851, "num_tokens": 40786722.0, "step": 19650 }, { "entropy": 5.382116651535034, "epoch": 1.7829281567489115, "grad_norm": 1.015625, "learning_rate": 0.000468386705514149, "loss": 4.8357, "mean_token_accuracy": 0.22145829796791078, "num_tokens": 40797058.0, "step": 19655 }, { "entropy": 5.413093757629395, "epoch": 1.7833817126269955, "grad_norm": 1.09375, "learning_rate": 0.0004683701647996956, "loss": 5.0216, "mean_token_accuracy": 0.20678603053092956, "num_tokens": 40808207.0, "step": 19660 }, { "entropy": 5.547549057006836, "epoch": 1.7838352685050798, "grad_norm": 1.1484375, "learning_rate": 0.0004683536200862978, "loss": 5.0834, "mean_token_accuracy": 0.20411568135023117, "num_tokens": 40819655.0, "step": 19665 }, { "entropy": 5.5205058574676515, "epoch": 1.784288824383164, "grad_norm": 1.1171875, "learning_rate": 0.0004683370713742979, "loss": 5.0702, "mean_token_accuracy": 0.202297905087471, "num_tokens": 40831015.0, "step": 19670 }, { "entropy": 5.456383419036865, "epoch": 1.7847423802612483, "grad_norm": 0.94921875, "learning_rate": 0.00046832051866403814, "loss": 4.9442, "mean_token_accuracy": 0.2121114194393158, "num_tokens": 40841763.0, "step": 19675 }, { "entropy": 5.440851402282715, "epoch": 1.7851959361393324, "grad_norm": 1.0625, "learning_rate": 0.0004683039619558607, "loss": 4.978, "mean_token_accuracy": 0.2044297695159912, "num_tokens": 40852479.0, "step": 19680 }, { "entropy": 5.504888010025025, "epoch": 1.7856494920174164, "grad_norm": 1.09375, "learning_rate": 0.00046828740125010813, "loss": 5.0076, "mean_token_accuracy": 0.20793140083551406, "num_tokens": 40862486.0, "step": 19685 }, { "entropy": 5.558384370803833, "epoch": 1.7861030478955007, "grad_norm": 1.1640625, "learning_rate": 0.0004682708365471228, "loss": 5.0683, "mean_token_accuracy": 0.20163077712059022, "num_tokens": 40872182.0, "step": 19690 }, { "entropy": 5.506349802017212, "epoch": 1.786556603773585, "grad_norm": 1.09375, "learning_rate": 0.00046825426784724734, "loss": 5.0457, "mean_token_accuracy": 0.20396464169025422, "num_tokens": 40883036.0, "step": 19695 }, { "entropy": 5.561575031280517, "epoch": 1.7870101596516692, "grad_norm": 1.0859375, "learning_rate": 0.0004682376951508244, "loss": 5.091, "mean_token_accuracy": 0.19055148363113403, "num_tokens": 40893684.0, "step": 19700 }, { "entropy": 5.541323900222778, "epoch": 1.7874637155297532, "grad_norm": 1.0625, "learning_rate": 0.00046822111845819665, "loss": 5.0622, "mean_token_accuracy": 0.20494856238365172, "num_tokens": 40904540.0, "step": 19705 }, { "entropy": 5.537597799301148, "epoch": 1.7879172714078373, "grad_norm": 0.984375, "learning_rate": 0.00046820453776970697, "loss": 5.0529, "mean_token_accuracy": 0.20565734505653382, "num_tokens": 40915269.0, "step": 19710 }, { "entropy": 5.5129152774810795, "epoch": 1.7883708272859216, "grad_norm": 1.0625, "learning_rate": 0.00046818795308569815, "loss": 5.0516, "mean_token_accuracy": 0.20370717644691466, "num_tokens": 40925987.0, "step": 19715 }, { "entropy": 5.433760643005371, "epoch": 1.7888243831640058, "grad_norm": 1.015625, "learning_rate": 0.0004681713644065133, "loss": 4.9684, "mean_token_accuracy": 0.21342145949602126, "num_tokens": 40936130.0, "step": 19720 }, { "entropy": 5.4213385581970215, "epoch": 1.78927793904209, "grad_norm": 1.0390625, "learning_rate": 0.0004681547717324954, "loss": 4.8764, "mean_token_accuracy": 0.21682085692882538, "num_tokens": 40945476.0, "step": 19725 }, { "entropy": 5.392783832550049, "epoch": 1.7897314949201741, "grad_norm": 1.0625, "learning_rate": 0.00046813817506398755, "loss": 4.8584, "mean_token_accuracy": 0.21738901883363723, "num_tokens": 40956492.0, "step": 19730 }, { "entropy": 5.5081888198852536, "epoch": 1.7901850507982582, "grad_norm": 1.03125, "learning_rate": 0.00046812157440133303, "loss": 5.0794, "mean_token_accuracy": 0.20247095227241516, "num_tokens": 40966990.0, "step": 19735 }, { "entropy": 5.509311485290527, "epoch": 1.7906386066763424, "grad_norm": 0.99609375, "learning_rate": 0.0004681049697448752, "loss": 4.9557, "mean_token_accuracy": 0.20979665368795394, "num_tokens": 40977065.0, "step": 19740 }, { "entropy": 5.445501327514648, "epoch": 1.7910921625544267, "grad_norm": 1.0625, "learning_rate": 0.00046808836109495734, "loss": 5.0008, "mean_token_accuracy": 0.20353686213493347, "num_tokens": 40987207.0, "step": 19745 }, { "entropy": 5.463134384155273, "epoch": 1.791545718432511, "grad_norm": 0.96484375, "learning_rate": 0.0004680717484519229, "loss": 4.9515, "mean_token_accuracy": 0.20822951644659043, "num_tokens": 40997541.0, "step": 19750 }, { "entropy": 5.452787780761719, "epoch": 1.791999274310595, "grad_norm": 1.015625, "learning_rate": 0.0004680551318161156, "loss": 4.9753, "mean_token_accuracy": 0.2096974954009056, "num_tokens": 41009044.0, "step": 19755 }, { "entropy": 5.4872293949127195, "epoch": 1.7924528301886793, "grad_norm": 1.015625, "learning_rate": 0.00046803851118787897, "loss": 4.9981, "mean_token_accuracy": 0.21013010740280152, "num_tokens": 41018165.0, "step": 19760 }, { "entropy": 5.418614387512207, "epoch": 1.7929063860667633, "grad_norm": 1.109375, "learning_rate": 0.0004680218865675567, "loss": 4.9464, "mean_token_accuracy": 0.20754242390394212, "num_tokens": 41028972.0, "step": 19765 }, { "entropy": 5.456475925445557, "epoch": 1.7933599419448476, "grad_norm": 1.0, "learning_rate": 0.0004680052579554926, "loss": 4.9764, "mean_token_accuracy": 0.2124166816473007, "num_tokens": 41039552.0, "step": 19770 }, { "entropy": 5.578098201751709, "epoch": 1.7938134978229319, "grad_norm": 1.0234375, "learning_rate": 0.0004679886253520307, "loss": 5.0507, "mean_token_accuracy": 0.19782216101884842, "num_tokens": 41049808.0, "step": 19775 }, { "entropy": 5.502855920791626, "epoch": 1.794267053701016, "grad_norm": 1.15625, "learning_rate": 0.00046797198875751474, "loss": 4.9388, "mean_token_accuracy": 0.20240353643894196, "num_tokens": 41060574.0, "step": 19780 }, { "entropy": 5.557843923568726, "epoch": 1.7947206095791002, "grad_norm": 1.109375, "learning_rate": 0.0004679553481722889, "loss": 5.114, "mean_token_accuracy": 0.19920523911714555, "num_tokens": 41071239.0, "step": 19785 }, { "entropy": 5.560058546066284, "epoch": 1.7951741654571842, "grad_norm": 0.98046875, "learning_rate": 0.00046793870359669733, "loss": 5.1328, "mean_token_accuracy": 0.2041477620601654, "num_tokens": 41080819.0, "step": 19790 }, { "entropy": 5.527128267288208, "epoch": 1.7956277213352685, "grad_norm": 1.2421875, "learning_rate": 0.0004679220550310842, "loss": 4.927, "mean_token_accuracy": 0.21851669251918793, "num_tokens": 41090457.0, "step": 19795 }, { "entropy": 5.4643487453460695, "epoch": 1.7960812772133528, "grad_norm": 1.0703125, "learning_rate": 0.0004679054024757937, "loss": 4.9849, "mean_token_accuracy": 0.2091774135828018, "num_tokens": 41101210.0, "step": 19800 }, { "entropy": 5.431383275985718, "epoch": 1.796534833091437, "grad_norm": 1.0546875, "learning_rate": 0.0004678887459311704, "loss": 4.9888, "mean_token_accuracy": 0.2089541047811508, "num_tokens": 41110566.0, "step": 19805 }, { "entropy": 5.413889169692993, "epoch": 1.796988388969521, "grad_norm": 1.1953125, "learning_rate": 0.0004678720853975587, "loss": 4.9528, "mean_token_accuracy": 0.21217461824417114, "num_tokens": 41120000.0, "step": 19810 }, { "entropy": 5.414611577987671, "epoch": 1.797441944847605, "grad_norm": 1.0625, "learning_rate": 0.00046785542087530307, "loss": 4.9112, "mean_token_accuracy": 0.2142721250653267, "num_tokens": 41129944.0, "step": 19815 }, { "entropy": 5.445405101776123, "epoch": 1.7978955007256894, "grad_norm": 1.0546875, "learning_rate": 0.0004678387523647483, "loss": 4.9775, "mean_token_accuracy": 0.2055494248867035, "num_tokens": 41138803.0, "step": 19820 }, { "entropy": 5.493655824661255, "epoch": 1.7983490566037736, "grad_norm": 0.95703125, "learning_rate": 0.00046782207986623885, "loss": 5.0722, "mean_token_accuracy": 0.1955258533358574, "num_tokens": 41150365.0, "step": 19825 }, { "entropy": 5.62580189704895, "epoch": 1.798802612481858, "grad_norm": 1.046875, "learning_rate": 0.00046780540338011974, "loss": 5.0287, "mean_token_accuracy": 0.20109088867902755, "num_tokens": 41160310.0, "step": 19830 }, { "entropy": 5.464039134979248, "epoch": 1.799256168359942, "grad_norm": 1.1328125, "learning_rate": 0.0004677887229067358, "loss": 4.894, "mean_token_accuracy": 0.21150053292512894, "num_tokens": 41170506.0, "step": 19835 }, { "entropy": 5.487150049209594, "epoch": 1.799709724238026, "grad_norm": 1.0703125, "learning_rate": 0.00046777203844643184, "loss": 5.0238, "mean_token_accuracy": 0.19993437677621842, "num_tokens": 41181293.0, "step": 19840 }, { "entropy": 5.455536556243897, "epoch": 1.8001632801161103, "grad_norm": 1.03125, "learning_rate": 0.00046775534999955303, "loss": 4.9545, "mean_token_accuracy": 0.20341767817735673, "num_tokens": 41191637.0, "step": 19845 }, { "entropy": 5.460039043426514, "epoch": 1.8006168359941945, "grad_norm": 1.0546875, "learning_rate": 0.0004677386575664445, "loss": 4.9582, "mean_token_accuracy": 0.2183227390050888, "num_tokens": 41201833.0, "step": 19850 }, { "entropy": 5.522752523422241, "epoch": 1.8010703918722788, "grad_norm": 1.15625, "learning_rate": 0.00046772196114745133, "loss": 5.0139, "mean_token_accuracy": 0.20963264256715775, "num_tokens": 41211243.0, "step": 19855 }, { "entropy": 5.501462697982788, "epoch": 1.8015239477503628, "grad_norm": 1.0390625, "learning_rate": 0.0004677052607429189, "loss": 4.9689, "mean_token_accuracy": 0.2089851349592209, "num_tokens": 41221111.0, "step": 19860 }, { "entropy": 5.443460083007812, "epoch": 1.8019775036284469, "grad_norm": 1.0390625, "learning_rate": 0.0004676885563531927, "loss": 4.9964, "mean_token_accuracy": 0.20403359532356263, "num_tokens": 41231578.0, "step": 19865 }, { "entropy": 5.4814146041870115, "epoch": 1.8024310595065312, "grad_norm": 0.97265625, "learning_rate": 0.00046767184797861795, "loss": 5.0396, "mean_token_accuracy": 0.20797489285469056, "num_tokens": 41242130.0, "step": 19870 }, { "entropy": 5.517671585083008, "epoch": 1.8028846153846154, "grad_norm": 1.0859375, "learning_rate": 0.00046765513561954026, "loss": 5.0069, "mean_token_accuracy": 0.20290981829166413, "num_tokens": 41252885.0, "step": 19875 }, { "entropy": 5.534820604324341, "epoch": 1.8033381712626997, "grad_norm": 1.1015625, "learning_rate": 0.00046763841927630534, "loss": 5.0623, "mean_token_accuracy": 0.20083272457122803, "num_tokens": 41263532.0, "step": 19880 }, { "entropy": 5.542397499084473, "epoch": 1.8037917271407837, "grad_norm": 1.171875, "learning_rate": 0.00046762169894925876, "loss": 4.9931, "mean_token_accuracy": 0.20428968071937562, "num_tokens": 41273469.0, "step": 19885 }, { "entropy": 5.500296211242675, "epoch": 1.8042452830188678, "grad_norm": 1.171875, "learning_rate": 0.0004676049746387464, "loss": 4.9903, "mean_token_accuracy": 0.20310233831405639, "num_tokens": 41283663.0, "step": 19890 }, { "entropy": 5.447289371490479, "epoch": 1.804698838896952, "grad_norm": 1.0234375, "learning_rate": 0.0004675882463451141, "loss": 4.9195, "mean_token_accuracy": 0.21334871649742126, "num_tokens": 41294657.0, "step": 19895 }, { "entropy": 5.526976108551025, "epoch": 1.8051523947750363, "grad_norm": 1.1484375, "learning_rate": 0.0004675715140687078, "loss": 5.0107, "mean_token_accuracy": 0.20500462055206298, "num_tokens": 41305124.0, "step": 19900 }, { "entropy": 5.407881498336792, "epoch": 1.8056059506531206, "grad_norm": 1.0625, "learning_rate": 0.00046755477780987344, "loss": 4.9383, "mean_token_accuracy": 0.20866432934999465, "num_tokens": 41315839.0, "step": 19905 }, { "entropy": 5.51832537651062, "epoch": 1.8060595065312046, "grad_norm": 1.0546875, "learning_rate": 0.00046753803756895726, "loss": 5.0215, "mean_token_accuracy": 0.20364923328161239, "num_tokens": 41326388.0, "step": 19910 }, { "entropy": 5.486484050750732, "epoch": 1.8065130624092887, "grad_norm": 1.0625, "learning_rate": 0.0004675212933463054, "loss": 5.0667, "mean_token_accuracy": 0.1960567370057106, "num_tokens": 41337333.0, "step": 19915 }, { "entropy": 5.580039548873901, "epoch": 1.806966618287373, "grad_norm": 1.015625, "learning_rate": 0.0004675045451422641, "loss": 5.0613, "mean_token_accuracy": 0.19424721002578735, "num_tokens": 41348353.0, "step": 19920 }, { "entropy": 5.54701042175293, "epoch": 1.8074201741654572, "grad_norm": 1.015625, "learning_rate": 0.00046748779295717973, "loss": 5.0226, "mean_token_accuracy": 0.21309632658958436, "num_tokens": 41358797.0, "step": 19925 }, { "entropy": 5.512184047698975, "epoch": 1.8078737300435415, "grad_norm": 1.1015625, "learning_rate": 0.0004674710367913989, "loss": 5.0224, "mean_token_accuracy": 0.20770838856697083, "num_tokens": 41368818.0, "step": 19930 }, { "entropy": 5.526298379898071, "epoch": 1.8083272859216255, "grad_norm": 1.0703125, "learning_rate": 0.0004674542766452678, "loss": 5.0055, "mean_token_accuracy": 0.20612242072820663, "num_tokens": 41378949.0, "step": 19935 }, { "entropy": 5.501234817504883, "epoch": 1.8087808417997098, "grad_norm": 1.515625, "learning_rate": 0.00046743751251913327, "loss": 4.9652, "mean_token_accuracy": 0.2014146015048027, "num_tokens": 41388892.0, "step": 19940 }, { "entropy": 5.545752954483032, "epoch": 1.8092343976777938, "grad_norm": 1.0703125, "learning_rate": 0.00046742074441334197, "loss": 5.0004, "mean_token_accuracy": 0.20861671566963197, "num_tokens": 41399197.0, "step": 19945 }, { "entropy": 5.510498189926148, "epoch": 1.809687953555878, "grad_norm": 1.1171875, "learning_rate": 0.0004674039723282406, "loss": 5.0272, "mean_token_accuracy": 0.19636441618204117, "num_tokens": 41409551.0, "step": 19950 }, { "entropy": 5.468385839462281, "epoch": 1.8101415094339623, "grad_norm": 1.125, "learning_rate": 0.00046738719626417607, "loss": 4.9337, "mean_token_accuracy": 0.20791163742542268, "num_tokens": 41418900.0, "step": 19955 }, { "entropy": 5.435397815704346, "epoch": 1.8105950653120464, "grad_norm": 1.015625, "learning_rate": 0.00046737041622149536, "loss": 4.9441, "mean_token_accuracy": 0.2077833577990532, "num_tokens": 41428204.0, "step": 19960 }, { "entropy": 5.475276470184326, "epoch": 1.8110486211901307, "grad_norm": 1.15625, "learning_rate": 0.0004673536322005454, "loss": 5.0091, "mean_token_accuracy": 0.20147773921489714, "num_tokens": 41437922.0, "step": 19965 }, { "entropy": 5.540088272094726, "epoch": 1.8115021770682147, "grad_norm": 1.015625, "learning_rate": 0.0004673368442016732, "loss": 5.0115, "mean_token_accuracy": 0.19927300810813903, "num_tokens": 41447411.0, "step": 19970 }, { "entropy": 5.578990268707275, "epoch": 1.811955732946299, "grad_norm": 1.0390625, "learning_rate": 0.0004673200522252261, "loss": 5.0881, "mean_token_accuracy": 0.20416804701089858, "num_tokens": 41458756.0, "step": 19975 }, { "entropy": 5.508602094650269, "epoch": 1.8124092888243832, "grad_norm": 1.1171875, "learning_rate": 0.0004673032562715514, "loss": 4.9947, "mean_token_accuracy": 0.20580196678638457, "num_tokens": 41468610.0, "step": 19980 }, { "entropy": 5.503843450546265, "epoch": 1.8128628447024675, "grad_norm": 1.078125, "learning_rate": 0.00046728645634099627, "loss": 5.0911, "mean_token_accuracy": 0.20053563714027406, "num_tokens": 41479849.0, "step": 19985 }, { "entropy": 5.4787674903869625, "epoch": 1.8133164005805515, "grad_norm": 1.15625, "learning_rate": 0.00046726965243390825, "loss": 4.9891, "mean_token_accuracy": 0.2042739525437355, "num_tokens": 41490945.0, "step": 19990 }, { "entropy": 5.451112937927246, "epoch": 1.8137699564586356, "grad_norm": 0.98046875, "learning_rate": 0.0004672528445506348, "loss": 4.9564, "mean_token_accuracy": 0.19990914165973664, "num_tokens": 41501479.0, "step": 19995 }, { "entropy": 5.494516277313233, "epoch": 1.8142235123367199, "grad_norm": 1.125, "learning_rate": 0.0004672360326915236, "loss": 4.9512, "mean_token_accuracy": 0.2147782877087593, "num_tokens": 41512447.0, "step": 20000 }, { "entropy": 5.467796421051025, "epoch": 1.8146770682148041, "grad_norm": 1.171875, "learning_rate": 0.0004672192168569222, "loss": 4.9009, "mean_token_accuracy": 0.2156030833721161, "num_tokens": 41521905.0, "step": 20005 }, { "entropy": 5.481906700134277, "epoch": 1.8151306240928884, "grad_norm": 1.0, "learning_rate": 0.00046720239704717845, "loss": 5.0098, "mean_token_accuracy": 0.20792933702468872, "num_tokens": 41533143.0, "step": 20010 }, { "entropy": 5.4936775207519535, "epoch": 1.8155841799709724, "grad_norm": 1.09375, "learning_rate": 0.00046718557326264, "loss": 4.956, "mean_token_accuracy": 0.20631704181432725, "num_tokens": 41542234.0, "step": 20015 }, { "entropy": 5.532553005218506, "epoch": 1.8160377358490565, "grad_norm": 1.1328125, "learning_rate": 0.0004671687455036551, "loss": 5.0664, "mean_token_accuracy": 0.20308319926261903, "num_tokens": 41552632.0, "step": 20020 }, { "entropy": 5.479432058334351, "epoch": 1.8164912917271407, "grad_norm": 1.0234375, "learning_rate": 0.0004671519137705715, "loss": 5.0078, "mean_token_accuracy": 0.20832333713769913, "num_tokens": 41563723.0, "step": 20025 }, { "entropy": 5.475570821762085, "epoch": 1.816944847605225, "grad_norm": 1.15625, "learning_rate": 0.00046713507806373736, "loss": 4.9629, "mean_token_accuracy": 0.20661877393722533, "num_tokens": 41573680.0, "step": 20030 }, { "entropy": 5.518227291107178, "epoch": 1.8173984034833093, "grad_norm": 1.0546875, "learning_rate": 0.00046711823838350086, "loss": 5.0291, "mean_token_accuracy": 0.20710206627845765, "num_tokens": 41584722.0, "step": 20035 }, { "entropy": 5.508468818664551, "epoch": 1.8178519593613933, "grad_norm": 0.99609375, "learning_rate": 0.00046710139473021025, "loss": 5.0779, "mean_token_accuracy": 0.1963120073080063, "num_tokens": 41595785.0, "step": 20040 }, { "entropy": 5.507241678237915, "epoch": 1.8183055152394774, "grad_norm": 1.0703125, "learning_rate": 0.00046708454710421376, "loss": 5.0907, "mean_token_accuracy": 0.19826340824365615, "num_tokens": 41606023.0, "step": 20045 }, { "entropy": 5.491629981994629, "epoch": 1.8187590711175616, "grad_norm": 1.1328125, "learning_rate": 0.00046706769550586, "loss": 5.0032, "mean_token_accuracy": 0.20706136375665665, "num_tokens": 41616010.0, "step": 20050 }, { "entropy": 5.489751577377319, "epoch": 1.819212626995646, "grad_norm": 1.0625, "learning_rate": 0.00046705083993549723, "loss": 4.9767, "mean_token_accuracy": 0.20925389379262924, "num_tokens": 41625105.0, "step": 20055 }, { "entropy": 5.483782625198364, "epoch": 1.8196661828737302, "grad_norm": 1.1171875, "learning_rate": 0.0004670339803934743, "loss": 5.0101, "mean_token_accuracy": 0.20866930335760117, "num_tokens": 41634989.0, "step": 20060 }, { "entropy": 5.477025508880615, "epoch": 1.8201197387518142, "grad_norm": 0.98046875, "learning_rate": 0.0004670171168801396, "loss": 4.9939, "mean_token_accuracy": 0.20496300458908082, "num_tokens": 41645736.0, "step": 20065 }, { "entropy": 5.5498247146606445, "epoch": 1.8205732946298983, "grad_norm": 1.0703125, "learning_rate": 0.000467000249395842, "loss": 4.9827, "mean_token_accuracy": 0.2136788547039032, "num_tokens": 41655505.0, "step": 20070 }, { "entropy": 5.474360561370849, "epoch": 1.8210268505079825, "grad_norm": 1.046875, "learning_rate": 0.0004669833779409303, "loss": 4.9804, "mean_token_accuracy": 0.21159180998802185, "num_tokens": 41665732.0, "step": 20075 }, { "entropy": 5.469687223434448, "epoch": 1.8214804063860668, "grad_norm": 1.0703125, "learning_rate": 0.0004669665025157535, "loss": 4.9623, "mean_token_accuracy": 0.2019777148962021, "num_tokens": 41676050.0, "step": 20080 }, { "entropy": 5.546350574493408, "epoch": 1.821933962264151, "grad_norm": 1.1484375, "learning_rate": 0.00046694962312066046, "loss": 5.1338, "mean_token_accuracy": 0.19883247166872026, "num_tokens": 41686787.0, "step": 20085 }, { "entropy": 5.478995037078858, "epoch": 1.822387518142235, "grad_norm": 1.0234375, "learning_rate": 0.00046693273975600036, "loss": 4.9338, "mean_token_accuracy": 0.21162950843572617, "num_tokens": 41697168.0, "step": 20090 }, { "entropy": 5.469726848602295, "epoch": 1.8228410740203191, "grad_norm": 0.96484375, "learning_rate": 0.0004669158524221222, "loss": 5.0125, "mean_token_accuracy": 0.20439180731773376, "num_tokens": 41707524.0, "step": 20095 }, { "entropy": 5.531174993515014, "epoch": 1.8232946298984034, "grad_norm": 0.9921875, "learning_rate": 0.00046689896111937537, "loss": 5.0566, "mean_token_accuracy": 0.2075119212269783, "num_tokens": 41718109.0, "step": 20100 }, { "entropy": 5.569089317321778, "epoch": 1.8237481857764877, "grad_norm": 1.0703125, "learning_rate": 0.0004668820658481091, "loss": 5.0191, "mean_token_accuracy": 0.2051020994782448, "num_tokens": 41728862.0, "step": 20105 }, { "entropy": 5.577348279953003, "epoch": 1.824201741654572, "grad_norm": 0.94140625, "learning_rate": 0.00046686516660867283, "loss": 5.0825, "mean_token_accuracy": 0.20027903616428375, "num_tokens": 41739024.0, "step": 20110 }, { "entropy": 5.505842971801758, "epoch": 1.824655297532656, "grad_norm": 1.171875, "learning_rate": 0.0004668482634014159, "loss": 5.0253, "mean_token_accuracy": 0.20351107120513917, "num_tokens": 41748979.0, "step": 20115 }, { "entropy": 5.486580085754395, "epoch": 1.8251088534107403, "grad_norm": 1.0546875, "learning_rate": 0.0004668313562266882, "loss": 5.0337, "mean_token_accuracy": 0.20621970891952515, "num_tokens": 41759972.0, "step": 20120 }, { "entropy": 5.456143379211426, "epoch": 1.8255624092888243, "grad_norm": 1.078125, "learning_rate": 0.000466814445084839, "loss": 4.8901, "mean_token_accuracy": 0.21461684107780457, "num_tokens": 41770150.0, "step": 20125 }, { "entropy": 5.478838014602661, "epoch": 1.8260159651669086, "grad_norm": 1.125, "learning_rate": 0.0004667975299762183, "loss": 4.9686, "mean_token_accuracy": 0.20933082401752473, "num_tokens": 41780405.0, "step": 20130 }, { "entropy": 5.472921085357666, "epoch": 1.8264695210449928, "grad_norm": 1.09375, "learning_rate": 0.00046678061090117576, "loss": 4.897, "mean_token_accuracy": 0.21493014693260193, "num_tokens": 41791269.0, "step": 20135 }, { "entropy": 5.416600275039673, "epoch": 1.8269230769230769, "grad_norm": 1.0234375, "learning_rate": 0.0004667636878600613, "loss": 4.91, "mean_token_accuracy": 0.20953293442726134, "num_tokens": 41802513.0, "step": 20140 }, { "entropy": 5.494254446029663, "epoch": 1.8273766328011611, "grad_norm": 0.94921875, "learning_rate": 0.0004667467608532249, "loss": 5.0374, "mean_token_accuracy": 0.19939105957746506, "num_tokens": 41814149.0, "step": 20145 }, { "entropy": 5.5285478115081785, "epoch": 1.8278301886792452, "grad_norm": 1.03125, "learning_rate": 0.0004667298298810167, "loss": 5.0231, "mean_token_accuracy": 0.20312486886978148, "num_tokens": 41825763.0, "step": 20150 }, { "entropy": 5.472637367248535, "epoch": 1.8282837445573294, "grad_norm": 1.2109375, "learning_rate": 0.0004667128949437867, "loss": 5.0019, "mean_token_accuracy": 0.20898271799087526, "num_tokens": 41834543.0, "step": 20155 }, { "entropy": 5.44488296508789, "epoch": 1.8287373004354137, "grad_norm": 1.09375, "learning_rate": 0.0004666959560418852, "loss": 4.9, "mean_token_accuracy": 0.2235007792711258, "num_tokens": 41844940.0, "step": 20160 }, { "entropy": 5.422686767578125, "epoch": 1.829190856313498, "grad_norm": 1.0390625, "learning_rate": 0.00046667901317566245, "loss": 4.9298, "mean_token_accuracy": 0.21362340897321702, "num_tokens": 41855532.0, "step": 20165 }, { "entropy": 5.5042558193206785, "epoch": 1.829644412191582, "grad_norm": 1.03125, "learning_rate": 0.0004666620663454689, "loss": 5.0277, "mean_token_accuracy": 0.20293494015932084, "num_tokens": 41865661.0, "step": 20170 }, { "entropy": 5.498259353637695, "epoch": 1.830097968069666, "grad_norm": 1.0703125, "learning_rate": 0.00046664511555165496, "loss": 5.0239, "mean_token_accuracy": 0.20515236705541612, "num_tokens": 41875662.0, "step": 20175 }, { "entropy": 5.469655990600586, "epoch": 1.8305515239477503, "grad_norm": 1.0390625, "learning_rate": 0.00046662816079457114, "loss": 4.9605, "mean_token_accuracy": 0.21497792154550552, "num_tokens": 41886211.0, "step": 20180 }, { "entropy": 5.566941928863526, "epoch": 1.8310050798258346, "grad_norm": 1.078125, "learning_rate": 0.0004666112020745682, "loss": 5.0905, "mean_token_accuracy": 0.1984022229909897, "num_tokens": 41896737.0, "step": 20185 }, { "entropy": 5.490166807174683, "epoch": 1.8314586357039189, "grad_norm": 1.1171875, "learning_rate": 0.0004665942393919967, "loss": 4.9767, "mean_token_accuracy": 0.20530310571193694, "num_tokens": 41907768.0, "step": 20190 }, { "entropy": 5.489934015274048, "epoch": 1.831912191582003, "grad_norm": 1.0859375, "learning_rate": 0.00046657727274720755, "loss": 4.9329, "mean_token_accuracy": 0.20314387530088424, "num_tokens": 41917587.0, "step": 20195 }, { "entropy": 5.4147562980651855, "epoch": 1.832365747460087, "grad_norm": 1.171875, "learning_rate": 0.0004665603021405516, "loss": 4.9097, "mean_token_accuracy": 0.21483613103628157, "num_tokens": 41927842.0, "step": 20200 }, { "entropy": 5.438058376312256, "epoch": 1.8328193033381712, "grad_norm": 0.99609375, "learning_rate": 0.0004665433275723798, "loss": 4.9513, "mean_token_accuracy": 0.2155444696545601, "num_tokens": 41939899.0, "step": 20205 }, { "entropy": 5.460914945602417, "epoch": 1.8332728592162555, "grad_norm": 1.03125, "learning_rate": 0.0004665263490430431, "loss": 4.9553, "mean_token_accuracy": 0.20326370745897293, "num_tokens": 41950932.0, "step": 20210 }, { "entropy": 5.532335186004639, "epoch": 1.8337264150943398, "grad_norm": 0.9765625, "learning_rate": 0.0004665093665528928, "loss": 5.0254, "mean_token_accuracy": 0.20834872424602507, "num_tokens": 41963512.0, "step": 20215 }, { "entropy": 5.545543670654297, "epoch": 1.8341799709724238, "grad_norm": 1.046875, "learning_rate": 0.00046649238010227983, "loss": 5.0077, "mean_token_accuracy": 0.2091602176427841, "num_tokens": 41974677.0, "step": 20220 }, { "entropy": 5.390093803405762, "epoch": 1.8346335268505078, "grad_norm": 1.0, "learning_rate": 0.0004664753896915558, "loss": 4.9429, "mean_token_accuracy": 0.2121974930167198, "num_tokens": 41984582.0, "step": 20225 }, { "entropy": 5.461968660354614, "epoch": 1.8350870827285921, "grad_norm": 1.046875, "learning_rate": 0.0004664583953210719, "loss": 4.943, "mean_token_accuracy": 0.20632002502679825, "num_tokens": 41994624.0, "step": 20230 }, { "entropy": 5.4864002704620365, "epoch": 1.8355406386066764, "grad_norm": 1.1484375, "learning_rate": 0.0004664413969911795, "loss": 4.9192, "mean_token_accuracy": 0.21286633610725403, "num_tokens": 42004835.0, "step": 20235 }, { "entropy": 5.426284551620483, "epoch": 1.8359941944847606, "grad_norm": 1.0390625, "learning_rate": 0.0004664243947022303, "loss": 4.9597, "mean_token_accuracy": 0.2085785835981369, "num_tokens": 42014727.0, "step": 20240 }, { "entropy": 5.475789403915405, "epoch": 1.8364477503628447, "grad_norm": 1.078125, "learning_rate": 0.00046640738845457586, "loss": 5.0185, "mean_token_accuracy": 0.20792288333177567, "num_tokens": 42023628.0, "step": 20245 }, { "entropy": 5.553183269500733, "epoch": 1.8369013062409287, "grad_norm": 1.109375, "learning_rate": 0.0004663903782485678, "loss": 5.0523, "mean_token_accuracy": 0.19967232644557953, "num_tokens": 42033587.0, "step": 20250 }, { "entropy": 5.560832595825195, "epoch": 1.837354862119013, "grad_norm": 1.0234375, "learning_rate": 0.00046637336408455793, "loss": 5.021, "mean_token_accuracy": 0.20333033055067062, "num_tokens": 42043765.0, "step": 20255 }, { "entropy": 5.563081312179565, "epoch": 1.8378084179970973, "grad_norm": 1.09375, "learning_rate": 0.00046635634596289816, "loss": 5.0832, "mean_token_accuracy": 0.2054321736097336, "num_tokens": 42054205.0, "step": 20260 }, { "entropy": 5.401016807556152, "epoch": 1.8382619738751815, "grad_norm": 1.0234375, "learning_rate": 0.0004663393238839404, "loss": 4.8949, "mean_token_accuracy": 0.2077532708644867, "num_tokens": 42064512.0, "step": 20265 }, { "entropy": 5.4527510643005375, "epoch": 1.8387155297532656, "grad_norm": 1.046875, "learning_rate": 0.0004663222978480366, "loss": 4.9961, "mean_token_accuracy": 0.202800253033638, "num_tokens": 42074954.0, "step": 20270 }, { "entropy": 5.539501094818116, "epoch": 1.8391690856313496, "grad_norm": 1.0234375, "learning_rate": 0.000466305267855539, "loss": 5.0011, "mean_token_accuracy": 0.20585793405771255, "num_tokens": 42084914.0, "step": 20275 }, { "entropy": 5.524646329879761, "epoch": 1.8396226415094339, "grad_norm": 1.078125, "learning_rate": 0.0004662882339067996, "loss": 5.0194, "mean_token_accuracy": 0.20999543070793153, "num_tokens": 42095454.0, "step": 20280 }, { "entropy": 5.478907346725464, "epoch": 1.8400761973875182, "grad_norm": 0.97265625, "learning_rate": 0.0004662711960021709, "loss": 5.0565, "mean_token_accuracy": 0.20169686377048493, "num_tokens": 42106960.0, "step": 20285 }, { "entropy": 5.497449636459351, "epoch": 1.8405297532656024, "grad_norm": 1.125, "learning_rate": 0.00046625415414200513, "loss": 4.9615, "mean_token_accuracy": 0.20768564641475679, "num_tokens": 42117009.0, "step": 20290 }, { "entropy": 5.526269197463989, "epoch": 1.8409833091436865, "grad_norm": 1.046875, "learning_rate": 0.0004662371083266546, "loss": 4.9976, "mean_token_accuracy": 0.211554653942585, "num_tokens": 42126371.0, "step": 20295 }, { "entropy": 5.51113486289978, "epoch": 1.8414368650217707, "grad_norm": 1.1015625, "learning_rate": 0.000466220058556472, "loss": 5.0096, "mean_token_accuracy": 0.20377402901649475, "num_tokens": 42135890.0, "step": 20300 }, { "entropy": 5.552067518234253, "epoch": 1.8418904208998548, "grad_norm": 1.2265625, "learning_rate": 0.00046620300483180986, "loss": 5.1245, "mean_token_accuracy": 0.19851610958576202, "num_tokens": 42145696.0, "step": 20305 }, { "entropy": 5.514868354797363, "epoch": 1.842343976777939, "grad_norm": 1.03125, "learning_rate": 0.0004661859471530209, "loss": 5.0314, "mean_token_accuracy": 0.21122143566608428, "num_tokens": 42156236.0, "step": 20310 }, { "entropy": 5.5421325206756595, "epoch": 1.8427975326560233, "grad_norm": 1.2265625, "learning_rate": 0.0004661688855204578, "loss": 5.041, "mean_token_accuracy": 0.20424984842538835, "num_tokens": 42166179.0, "step": 20315 }, { "entropy": 5.45050687789917, "epoch": 1.8432510885341074, "grad_norm": 1.0625, "learning_rate": 0.00046615181993447344, "loss": 4.9217, "mean_token_accuracy": 0.20572050362825395, "num_tokens": 42176643.0, "step": 20320 }, { "entropy": 5.550262832641602, "epoch": 1.8437046444121916, "grad_norm": 0.99609375, "learning_rate": 0.0004661347503954207, "loss": 5.19, "mean_token_accuracy": 0.19296130239963533, "num_tokens": 42188328.0, "step": 20325 }, { "entropy": 5.56198468208313, "epoch": 1.8441582002902757, "grad_norm": 1.0859375, "learning_rate": 0.00046611767690365265, "loss": 5.0033, "mean_token_accuracy": 0.20894695967435836, "num_tokens": 42198110.0, "step": 20330 }, { "entropy": 5.44454779624939, "epoch": 1.84461175616836, "grad_norm": 1.125, "learning_rate": 0.0004661005994595223, "loss": 4.9803, "mean_token_accuracy": 0.20088055431842805, "num_tokens": 42208438.0, "step": 20335 }, { "entropy": 5.473340320587158, "epoch": 1.8450653120464442, "grad_norm": 1.1328125, "learning_rate": 0.0004660835180633829, "loss": 4.9621, "mean_token_accuracy": 0.2040846347808838, "num_tokens": 42220052.0, "step": 20340 }, { "entropy": 5.47958402633667, "epoch": 1.8455188679245285, "grad_norm": 1.125, "learning_rate": 0.0004660664327155876, "loss": 4.967, "mean_token_accuracy": 0.21261545717716218, "num_tokens": 42229497.0, "step": 20345 }, { "entropy": 5.46050238609314, "epoch": 1.8459724238026125, "grad_norm": 1.0078125, "learning_rate": 0.0004660493434164898, "loss": 5.0286, "mean_token_accuracy": 0.1993781164288521, "num_tokens": 42240725.0, "step": 20350 }, { "entropy": 5.543264579772949, "epoch": 1.8464259796806965, "grad_norm": 0.99609375, "learning_rate": 0.0004660322501664429, "loss": 5.0373, "mean_token_accuracy": 0.20247761607170106, "num_tokens": 42251114.0, "step": 20355 }, { "entropy": 5.580515146255493, "epoch": 1.8468795355587808, "grad_norm": 1.015625, "learning_rate": 0.0004660151529658004, "loss": 5.1806, "mean_token_accuracy": 0.19662023484706878, "num_tokens": 42262825.0, "step": 20360 }, { "entropy": 5.54121413230896, "epoch": 1.847333091436865, "grad_norm": 1.125, "learning_rate": 0.0004659980518149158, "loss": 5.0012, "mean_token_accuracy": 0.21283550858497619, "num_tokens": 42272176.0, "step": 20365 }, { "entropy": 5.5341148853302, "epoch": 1.8477866473149493, "grad_norm": 1.1875, "learning_rate": 0.00046598094671414285, "loss": 5.0617, "mean_token_accuracy": 0.20483849495649337, "num_tokens": 42281934.0, "step": 20370 }, { "entropy": 5.507667827606201, "epoch": 1.8482402031930334, "grad_norm": 1.0703125, "learning_rate": 0.00046596383766383533, "loss": 4.948, "mean_token_accuracy": 0.20928735733032228, "num_tokens": 42291927.0, "step": 20375 }, { "entropy": 5.46729621887207, "epoch": 1.8486937590711174, "grad_norm": 1.1015625, "learning_rate": 0.0004659467246643469, "loss": 4.9419, "mean_token_accuracy": 0.2095313012599945, "num_tokens": 42301407.0, "step": 20380 }, { "entropy": 5.39543194770813, "epoch": 1.8491473149492017, "grad_norm": 1.0546875, "learning_rate": 0.00046592960771603154, "loss": 4.8996, "mean_token_accuracy": 0.21575131714344026, "num_tokens": 42311199.0, "step": 20385 }, { "entropy": 5.490356159210205, "epoch": 1.849600870827286, "grad_norm": 1.0859375, "learning_rate": 0.0004659124868192433, "loss": 4.9938, "mean_token_accuracy": 0.2058865636587143, "num_tokens": 42320725.0, "step": 20390 }, { "entropy": 5.550732135772705, "epoch": 1.8500544267053702, "grad_norm": 1.0703125, "learning_rate": 0.0004658953619743361, "loss": 5.0822, "mean_token_accuracy": 0.20801912099123002, "num_tokens": 42330857.0, "step": 20395 }, { "entropy": 5.472535848617554, "epoch": 1.8505079825834543, "grad_norm": 1.0078125, "learning_rate": 0.00046587823318166427, "loss": 4.8952, "mean_token_accuracy": 0.20971542596817017, "num_tokens": 42340241.0, "step": 20400 }, { "entropy": 5.531248378753662, "epoch": 1.8509615384615383, "grad_norm": 1.0, "learning_rate": 0.00046586110044158184, "loss": 5.1049, "mean_token_accuracy": 0.19616152048110963, "num_tokens": 42351756.0, "step": 20405 }, { "entropy": 5.493772363662719, "epoch": 1.8514150943396226, "grad_norm": 1.046875, "learning_rate": 0.00046584396375444335, "loss": 4.946, "mean_token_accuracy": 0.21230319291353225, "num_tokens": 42361649.0, "step": 20410 }, { "entropy": 5.492153215408325, "epoch": 1.8518686502177069, "grad_norm": 1.09375, "learning_rate": 0.00046582682312060295, "loss": 4.9838, "mean_token_accuracy": 0.2071332037448883, "num_tokens": 42371273.0, "step": 20415 }, { "entropy": 5.422970247268677, "epoch": 1.8523222060957911, "grad_norm": 1.03125, "learning_rate": 0.0004658096785404152, "loss": 4.9569, "mean_token_accuracy": 0.20888074934482576, "num_tokens": 42382275.0, "step": 20420 }, { "entropy": 5.555678844451904, "epoch": 1.8527757619738752, "grad_norm": 1.1328125, "learning_rate": 0.00046579253001423473, "loss": 5.0086, "mean_token_accuracy": 0.2013235032558441, "num_tokens": 42392360.0, "step": 20425 }, { "entropy": 5.509761190414428, "epoch": 1.8532293178519592, "grad_norm": 0.95703125, "learning_rate": 0.00046577537754241604, "loss": 5.0019, "mean_token_accuracy": 0.1991646781563759, "num_tokens": 42403695.0, "step": 20430 }, { "entropy": 5.48563666343689, "epoch": 1.8536828737300435, "grad_norm": 0.96875, "learning_rate": 0.000465758221125314, "loss": 4.941, "mean_token_accuracy": 0.20885043293237687, "num_tokens": 42414199.0, "step": 20435 }, { "entropy": 5.505152606964112, "epoch": 1.8541364296081277, "grad_norm": 1.15625, "learning_rate": 0.00046574106076328333, "loss": 5.0589, "mean_token_accuracy": 0.20741629600524902, "num_tokens": 42423655.0, "step": 20440 }, { "entropy": 5.484323310852051, "epoch": 1.854589985486212, "grad_norm": 1.2578125, "learning_rate": 0.0004657238964566789, "loss": 4.9652, "mean_token_accuracy": 0.21008907109498978, "num_tokens": 42434235.0, "step": 20445 }, { "entropy": 5.441372680664062, "epoch": 1.855043541364296, "grad_norm": 0.9921875, "learning_rate": 0.0004657067282058557, "loss": 5.0002, "mean_token_accuracy": 0.20948562026023865, "num_tokens": 42444701.0, "step": 20450 }, { "entropy": 5.419203615188598, "epoch": 1.85549709724238, "grad_norm": 1.1015625, "learning_rate": 0.0004656895560111687, "loss": 4.9762, "mean_token_accuracy": 0.20637976378202438, "num_tokens": 42454499.0, "step": 20455 }, { "entropy": 5.532791233062744, "epoch": 1.8559506531204644, "grad_norm": 1.078125, "learning_rate": 0.00046567237987297323, "loss": 4.9561, "mean_token_accuracy": 0.19987907409667968, "num_tokens": 42465391.0, "step": 20460 }, { "entropy": 5.55144419670105, "epoch": 1.8564042089985486, "grad_norm": 1.1171875, "learning_rate": 0.0004656551997916243, "loss": 4.961, "mean_token_accuracy": 0.19955171942710875, "num_tokens": 42476126.0, "step": 20465 }, { "entropy": 5.52060604095459, "epoch": 1.856857764876633, "grad_norm": 0.984375, "learning_rate": 0.00046563801576747716, "loss": 5.0302, "mean_token_accuracy": 0.20867771059274673, "num_tokens": 42486833.0, "step": 20470 }, { "entropy": 5.593228769302368, "epoch": 1.857311320754717, "grad_norm": 1.0625, "learning_rate": 0.00046562082780088733, "loss": 5.0775, "mean_token_accuracy": 0.2004850447177887, "num_tokens": 42496986.0, "step": 20475 }, { "entropy": 5.513063526153564, "epoch": 1.8577648766328012, "grad_norm": 1.0859375, "learning_rate": 0.0004656036358922103, "loss": 4.9818, "mean_token_accuracy": 0.2030161887407303, "num_tokens": 42507352.0, "step": 20480 }, { "entropy": 5.512900876998901, "epoch": 1.8582184325108853, "grad_norm": 1.0625, "learning_rate": 0.0004655864400418014, "loss": 4.9785, "mean_token_accuracy": 0.21155350506305695, "num_tokens": 42517655.0, "step": 20485 }, { "entropy": 5.454225349426269, "epoch": 1.8586719883889695, "grad_norm": 1.1171875, "learning_rate": 0.0004655692402500163, "loss": 4.9209, "mean_token_accuracy": 0.21709479838609697, "num_tokens": 42527502.0, "step": 20490 }, { "entropy": 5.460311651229858, "epoch": 1.8591255442670538, "grad_norm": 1.0703125, "learning_rate": 0.00046555203651721085, "loss": 4.9621, "mean_token_accuracy": 0.20758305490016937, "num_tokens": 42538893.0, "step": 20495 }, { "entropy": 5.373780870437622, "epoch": 1.8595791001451378, "grad_norm": 1.0234375, "learning_rate": 0.0004655348288437407, "loss": 4.8608, "mean_token_accuracy": 0.21704194992780684, "num_tokens": 42550372.0, "step": 20500 }, { "entropy": 5.526129817962646, "epoch": 1.860032656023222, "grad_norm": 1.0625, "learning_rate": 0.0004655176172299618, "loss": 5.0732, "mean_token_accuracy": 0.20077297538518907, "num_tokens": 42560814.0, "step": 20505 }, { "entropy": 5.5809577941894535, "epoch": 1.8604862119013061, "grad_norm": 1.40625, "learning_rate": 0.00046550040167622986, "loss": 5.0866, "mean_token_accuracy": 0.1971066802740097, "num_tokens": 42570993.0, "step": 20510 }, { "entropy": 5.517111206054688, "epoch": 1.8609397677793904, "grad_norm": 1.03125, "learning_rate": 0.00046548318218290124, "loss": 4.9355, "mean_token_accuracy": 0.21109461635351182, "num_tokens": 42581357.0, "step": 20515 }, { "entropy": 5.476054048538208, "epoch": 1.8613933236574747, "grad_norm": 0.9921875, "learning_rate": 0.0004654659587503318, "loss": 5.0456, "mean_token_accuracy": 0.19604293555021285, "num_tokens": 42591653.0, "step": 20520 }, { "entropy": 5.563223028182984, "epoch": 1.861846879535559, "grad_norm": 1.09375, "learning_rate": 0.0004654487313788778, "loss": 5.0968, "mean_token_accuracy": 0.19883365482091903, "num_tokens": 42602232.0, "step": 20525 }, { "entropy": 5.5313554286956785, "epoch": 1.862300435413643, "grad_norm": 1.046875, "learning_rate": 0.00046543150006889546, "loss": 4.9922, "mean_token_accuracy": 0.21429141610860825, "num_tokens": 42613283.0, "step": 20530 }, { "entropy": 5.474745416641236, "epoch": 1.862753991291727, "grad_norm": 1.09375, "learning_rate": 0.0004654142648207412, "loss": 4.9336, "mean_token_accuracy": 0.209904220700264, "num_tokens": 42623594.0, "step": 20535 }, { "entropy": 5.5373499393463135, "epoch": 1.8632075471698113, "grad_norm": 1.0078125, "learning_rate": 0.0004653970256347715, "loss": 5.0483, "mean_token_accuracy": 0.2047143191099167, "num_tokens": 42633587.0, "step": 20540 }, { "entropy": 5.542779874801636, "epoch": 1.8636611030478956, "grad_norm": 1.0390625, "learning_rate": 0.00046537978251134265, "loss": 4.9779, "mean_token_accuracy": 0.20232055485248565, "num_tokens": 42643426.0, "step": 20545 }, { "entropy": 5.42120099067688, "epoch": 1.8641146589259798, "grad_norm": 1.03125, "learning_rate": 0.0004653625354508115, "loss": 4.9864, "mean_token_accuracy": 0.20807553082704544, "num_tokens": 42653521.0, "step": 20550 }, { "entropy": 5.505074691772461, "epoch": 1.8645682148040639, "grad_norm": 1.0234375, "learning_rate": 0.0004653452844535346, "loss": 5.025, "mean_token_accuracy": 0.20993955433368683, "num_tokens": 42664818.0, "step": 20555 }, { "entropy": 5.59228253364563, "epoch": 1.865021770682148, "grad_norm": 1.1328125, "learning_rate": 0.00046532802951986863, "loss": 5.0577, "mean_token_accuracy": 0.2088144451379776, "num_tokens": 42674738.0, "step": 20560 }, { "entropy": 5.500059461593628, "epoch": 1.8654753265602322, "grad_norm": 1.0546875, "learning_rate": 0.0004653107706501705, "loss": 4.9561, "mean_token_accuracy": 0.2192043334245682, "num_tokens": 42685003.0, "step": 20565 }, { "entropy": 5.44640154838562, "epoch": 1.8659288824383164, "grad_norm": 1.0625, "learning_rate": 0.0004652935078447973, "loss": 5.0064, "mean_token_accuracy": 0.20773745477199554, "num_tokens": 42695428.0, "step": 20570 }, { "entropy": 5.500756025314331, "epoch": 1.8663824383164007, "grad_norm": 1.109375, "learning_rate": 0.00046527624110410574, "loss": 4.9579, "mean_token_accuracy": 0.21193516999483109, "num_tokens": 42704901.0, "step": 20575 }, { "entropy": 5.521413898468017, "epoch": 1.8668359941944848, "grad_norm": 1.109375, "learning_rate": 0.000465258970428453, "loss": 5.0423, "mean_token_accuracy": 0.20478675365447999, "num_tokens": 42714379.0, "step": 20580 }, { "entropy": 5.577829313278198, "epoch": 1.8672895500725688, "grad_norm": 1.1328125, "learning_rate": 0.00046524169581819633, "loss": 5.1601, "mean_token_accuracy": 0.1995236471295357, "num_tokens": 42724813.0, "step": 20585 }, { "entropy": 5.455184555053711, "epoch": 1.867743105950653, "grad_norm": 0.96484375, "learning_rate": 0.0004652244172736929, "loss": 4.9993, "mean_token_accuracy": 0.2048965722322464, "num_tokens": 42736590.0, "step": 20590 }, { "entropy": 5.5260978698730465, "epoch": 1.8681966618287373, "grad_norm": 1.109375, "learning_rate": 0.0004652071347953, "loss": 5.0807, "mean_token_accuracy": 0.1991588518023491, "num_tokens": 42746718.0, "step": 20595 }, { "entropy": 5.511317920684815, "epoch": 1.8686502177068216, "grad_norm": 1.0703125, "learning_rate": 0.00046518984838337513, "loss": 4.9682, "mean_token_accuracy": 0.2041142016649246, "num_tokens": 42756484.0, "step": 20600 }, { "entropy": 5.532030200958252, "epoch": 1.8691037735849056, "grad_norm": 1.0703125, "learning_rate": 0.0004651725580382757, "loss": 5.0555, "mean_token_accuracy": 0.20200948566198348, "num_tokens": 42768512.0, "step": 20605 }, { "entropy": 5.473254299163818, "epoch": 1.8695573294629897, "grad_norm": 1.0859375, "learning_rate": 0.00046515526376035934, "loss": 4.9198, "mean_token_accuracy": 0.20792983025312423, "num_tokens": 42779812.0, "step": 20610 }, { "entropy": 5.382527160644531, "epoch": 1.870010885341074, "grad_norm": 0.9921875, "learning_rate": 0.0004651379655499837, "loss": 4.9126, "mean_token_accuracy": 0.2151414394378662, "num_tokens": 42791163.0, "step": 20615 }, { "entropy": 5.455286312103271, "epoch": 1.8704644412191582, "grad_norm": 1.0390625, "learning_rate": 0.00046512066340750636, "loss": 4.9883, "mean_token_accuracy": 0.20826934427022933, "num_tokens": 42801810.0, "step": 20620 }, { "entropy": 5.532750940322876, "epoch": 1.8709179970972425, "grad_norm": 1.0234375, "learning_rate": 0.0004651033573332853, "loss": 4.9875, "mean_token_accuracy": 0.2087985247373581, "num_tokens": 42813358.0, "step": 20625 }, { "entropy": 5.396786737442016, "epoch": 1.8713715529753265, "grad_norm": 1.03125, "learning_rate": 0.0004650860473276784, "loss": 4.8341, "mean_token_accuracy": 0.21987762600183486, "num_tokens": 42823519.0, "step": 20630 }, { "entropy": 5.506504392623901, "epoch": 1.8718251088534106, "grad_norm": 1.1640625, "learning_rate": 0.0004650687333910436, "loss": 5.0033, "mean_token_accuracy": 0.20566814988851548, "num_tokens": 42833257.0, "step": 20635 }, { "entropy": 5.558252477645874, "epoch": 1.8722786647314948, "grad_norm": 1.09375, "learning_rate": 0.00046505141552373897, "loss": 5.0104, "mean_token_accuracy": 0.21207219064235688, "num_tokens": 42843536.0, "step": 20640 }, { "entropy": 5.460723066329956, "epoch": 1.8727322206095791, "grad_norm": 0.96484375, "learning_rate": 0.0004650340937261226, "loss": 4.9834, "mean_token_accuracy": 0.204876309633255, "num_tokens": 42853911.0, "step": 20645 }, { "entropy": 5.533601236343384, "epoch": 1.8731857764876634, "grad_norm": 1.09375, "learning_rate": 0.0004650167679985528, "loss": 5.1035, "mean_token_accuracy": 0.19457658678293227, "num_tokens": 42864173.0, "step": 20650 }, { "entropy": 5.497031116485596, "epoch": 1.8736393323657474, "grad_norm": 0.9921875, "learning_rate": 0.0004649994383413877, "loss": 4.9506, "mean_token_accuracy": 0.2092764064669609, "num_tokens": 42873470.0, "step": 20655 }, { "entropy": 5.494451093673706, "epoch": 1.8740928882438317, "grad_norm": 1.140625, "learning_rate": 0.00046498210475498595, "loss": 4.9389, "mean_token_accuracy": 0.21581810265779494, "num_tokens": 42882496.0, "step": 20660 }, { "entropy": 5.450921154022216, "epoch": 1.8745464441219157, "grad_norm": 0.9921875, "learning_rate": 0.00046496476723970574, "loss": 4.9397, "mean_token_accuracy": 0.20707394033670426, "num_tokens": 42893163.0, "step": 20665 }, { "entropy": 5.463796806335449, "epoch": 1.875, "grad_norm": 1.109375, "learning_rate": 0.0004649474257959058, "loss": 4.9654, "mean_token_accuracy": 0.20770224928855896, "num_tokens": 42903406.0, "step": 20670 }, { "entropy": 5.494471883773803, "epoch": 1.8754535558780843, "grad_norm": 1.0390625, "learning_rate": 0.0004649300804239447, "loss": 4.9655, "mean_token_accuracy": 0.20818703174591063, "num_tokens": 42913702.0, "step": 20675 }, { "entropy": 5.424079513549804, "epoch": 1.8759071117561683, "grad_norm": 1.0703125, "learning_rate": 0.00046491273112418105, "loss": 4.9213, "mean_token_accuracy": 0.21260336339473723, "num_tokens": 42923877.0, "step": 20680 }, { "entropy": 5.4752942562103275, "epoch": 1.8763606676342526, "grad_norm": 1.0625, "learning_rate": 0.00046489537789697386, "loss": 4.9529, "mean_token_accuracy": 0.20910740345716478, "num_tokens": 42934393.0, "step": 20685 }, { "entropy": 5.485442686080932, "epoch": 1.8768142235123366, "grad_norm": 1.03125, "learning_rate": 0.00046487802074268177, "loss": 5.0226, "mean_token_accuracy": 0.21294792741537094, "num_tokens": 42945803.0, "step": 20690 }, { "entropy": 5.455105447769165, "epoch": 1.8772677793904209, "grad_norm": 1.1328125, "learning_rate": 0.00046486065966166377, "loss": 4.9673, "mean_token_accuracy": 0.21094850897789003, "num_tokens": 42955829.0, "step": 20695 }, { "entropy": 5.510855436325073, "epoch": 1.8777213352685052, "grad_norm": 1.0234375, "learning_rate": 0.0004648432946542791, "loss": 5.0054, "mean_token_accuracy": 0.201736980676651, "num_tokens": 42967080.0, "step": 20700 }, { "entropy": 5.45847520828247, "epoch": 1.8781748911465894, "grad_norm": 1.015625, "learning_rate": 0.00046482592572088654, "loss": 4.9678, "mean_token_accuracy": 0.19793493598699569, "num_tokens": 42978082.0, "step": 20705 }, { "entropy": 5.5167255878448485, "epoch": 1.8786284470246735, "grad_norm": 1.09375, "learning_rate": 0.00046480855286184565, "loss": 5.0411, "mean_token_accuracy": 0.20442744046449662, "num_tokens": 42988982.0, "step": 20710 }, { "entropy": 5.52120566368103, "epoch": 1.8790820029027575, "grad_norm": 1.09375, "learning_rate": 0.00046479117607751535, "loss": 4.9687, "mean_token_accuracy": 0.19724340736865997, "num_tokens": 42998982.0, "step": 20715 }, { "entropy": 5.482936239242553, "epoch": 1.8795355587808418, "grad_norm": 1.078125, "learning_rate": 0.00046477379536825534, "loss": 4.9316, "mean_token_accuracy": 0.21133214384317398, "num_tokens": 43009574.0, "step": 20720 }, { "entropy": 5.489485073089599, "epoch": 1.879989114658926, "grad_norm": 1.1953125, "learning_rate": 0.0004647564107344247, "loss": 4.9815, "mean_token_accuracy": 0.20238498002290725, "num_tokens": 43019335.0, "step": 20725 }, { "entropy": 5.413117980957031, "epoch": 1.8804426705370103, "grad_norm": 1.078125, "learning_rate": 0.00046473902217638327, "loss": 5.0229, "mean_token_accuracy": 0.2092140480875969, "num_tokens": 43029264.0, "step": 20730 }, { "entropy": 5.45079345703125, "epoch": 1.8808962264150944, "grad_norm": 1.0078125, "learning_rate": 0.00046472162969449037, "loss": 4.976, "mean_token_accuracy": 0.21093496084213256, "num_tokens": 43040519.0, "step": 20735 }, { "entropy": 5.5293262004852295, "epoch": 1.8813497822931784, "grad_norm": 1.046875, "learning_rate": 0.00046470423328910594, "loss": 4.9915, "mean_token_accuracy": 0.21045207381248474, "num_tokens": 43051146.0, "step": 20740 }, { "entropy": 5.5510368824005125, "epoch": 1.8818033381712627, "grad_norm": 1.0390625, "learning_rate": 0.00046468683296058957, "loss": 5.0815, "mean_token_accuracy": 0.20232977569103242, "num_tokens": 43061339.0, "step": 20745 }, { "entropy": 5.464311504364014, "epoch": 1.882256894049347, "grad_norm": 1.0390625, "learning_rate": 0.00046466942870930126, "loss": 4.9873, "mean_token_accuracy": 0.21198181957006454, "num_tokens": 43072624.0, "step": 20750 }, { "entropy": 5.481714487075806, "epoch": 1.8827104499274312, "grad_norm": 1.1796875, "learning_rate": 0.0004646520205356007, "loss": 4.9341, "mean_token_accuracy": 0.21154951304197311, "num_tokens": 43082120.0, "step": 20755 }, { "entropy": 5.555873250961303, "epoch": 1.8831640058055152, "grad_norm": 1.2109375, "learning_rate": 0.00046463460843984805, "loss": 5.0787, "mean_token_accuracy": 0.20004474520683288, "num_tokens": 43093202.0, "step": 20760 }, { "entropy": 5.653390550613404, "epoch": 1.8836175616835993, "grad_norm": 1.0625, "learning_rate": 0.0004646171924224034, "loss": 5.158, "mean_token_accuracy": 0.20311066061258315, "num_tokens": 43104801.0, "step": 20765 }, { "entropy": 5.528464365005493, "epoch": 1.8840711175616836, "grad_norm": 1.078125, "learning_rate": 0.00046459977248362687, "loss": 4.9567, "mean_token_accuracy": 0.21161752939224243, "num_tokens": 43114855.0, "step": 20770 }, { "entropy": 5.470214557647705, "epoch": 1.8845246734397678, "grad_norm": 1.1171875, "learning_rate": 0.0004645823486238788, "loss": 4.9773, "mean_token_accuracy": 0.20377101004123688, "num_tokens": 43124759.0, "step": 20775 }, { "entropy": 5.412673711776733, "epoch": 1.884978229317852, "grad_norm": 1.0546875, "learning_rate": 0.0004645649208435193, "loss": 4.954, "mean_token_accuracy": 0.21378117203712463, "num_tokens": 43135526.0, "step": 20780 }, { "entropy": 5.500769424438476, "epoch": 1.8854317851959361, "grad_norm": 1.078125, "learning_rate": 0.00046454748914290906, "loss": 5.0654, "mean_token_accuracy": 0.20297730416059495, "num_tokens": 43145605.0, "step": 20785 }, { "entropy": 5.567600202560425, "epoch": 1.8858853410740202, "grad_norm": 1.046875, "learning_rate": 0.00046453005352240835, "loss": 5.1158, "mean_token_accuracy": 0.20047670155763625, "num_tokens": 43156578.0, "step": 20790 }, { "entropy": 5.536592960357666, "epoch": 1.8863388969521044, "grad_norm": 1.0859375, "learning_rate": 0.000464512613982378, "loss": 4.9965, "mean_token_accuracy": 0.20926790535449982, "num_tokens": 43166870.0, "step": 20795 }, { "entropy": 5.484249591827393, "epoch": 1.8867924528301887, "grad_norm": 1.125, "learning_rate": 0.0004644951705231783, "loss": 4.9585, "mean_token_accuracy": 0.21397003382444382, "num_tokens": 43176406.0, "step": 20800 }, { "entropy": 5.597718524932861, "epoch": 1.887246008708273, "grad_norm": 1.015625, "learning_rate": 0.00046447772314517024, "loss": 5.1387, "mean_token_accuracy": 0.20166807174682616, "num_tokens": 43187502.0, "step": 20805 }, { "entropy": 5.442931222915649, "epoch": 1.887699564586357, "grad_norm": 1.109375, "learning_rate": 0.00046446027184871464, "loss": 4.9098, "mean_token_accuracy": 0.2146605759859085, "num_tokens": 43197928.0, "step": 20810 }, { "entropy": 5.443324756622315, "epoch": 1.888153120464441, "grad_norm": 1.0546875, "learning_rate": 0.00046444281663417236, "loss": 4.9694, "mean_token_accuracy": 0.21431098133325577, "num_tokens": 43209083.0, "step": 20815 }, { "entropy": 5.493828392028808, "epoch": 1.8886066763425253, "grad_norm": 1.046875, "learning_rate": 0.0004644253575019043, "loss": 4.9712, "mean_token_accuracy": 0.2034241959452629, "num_tokens": 43219089.0, "step": 20820 }, { "entropy": 5.556142091751099, "epoch": 1.8890602322206096, "grad_norm": 1.1953125, "learning_rate": 0.0004644078944522716, "loss": 5.0425, "mean_token_accuracy": 0.20326305776834488, "num_tokens": 43229440.0, "step": 20825 }, { "entropy": 5.511632108688355, "epoch": 1.8895137880986939, "grad_norm": 1.1640625, "learning_rate": 0.0004643904274856353, "loss": 4.9635, "mean_token_accuracy": 0.20982567220926285, "num_tokens": 43239995.0, "step": 20830 }, { "entropy": 5.459226465225219, "epoch": 1.889967343976778, "grad_norm": 1.1015625, "learning_rate": 0.00046437295660235674, "loss": 4.95, "mean_token_accuracy": 0.21392186135053634, "num_tokens": 43249722.0, "step": 20835 }, { "entropy": 5.435919952392578, "epoch": 1.8904208998548622, "grad_norm": 1.0703125, "learning_rate": 0.0004643554818027972, "loss": 5.0206, "mean_token_accuracy": 0.20488353222608566, "num_tokens": 43260029.0, "step": 20840 }, { "entropy": 5.513094043731689, "epoch": 1.8908744557329462, "grad_norm": 1.0546875, "learning_rate": 0.0004643380030873181, "loss": 4.9711, "mean_token_accuracy": 0.21063131392002105, "num_tokens": 43270571.0, "step": 20845 }, { "entropy": 5.51750373840332, "epoch": 1.8913280116110305, "grad_norm": 1.140625, "learning_rate": 0.0004643205204562808, "loss": 4.9286, "mean_token_accuracy": 0.21767070293426513, "num_tokens": 43281310.0, "step": 20850 }, { "entropy": 5.454575872421264, "epoch": 1.8917815674891147, "grad_norm": 1.0234375, "learning_rate": 0.00046430303391004687, "loss": 4.958, "mean_token_accuracy": 0.21215643137693405, "num_tokens": 43292904.0, "step": 20855 }, { "entropy": 5.480486917495727, "epoch": 1.8922351233671988, "grad_norm": 1.03125, "learning_rate": 0.0004642855434489779, "loss": 4.9809, "mean_token_accuracy": 0.2019377127289772, "num_tokens": 43303745.0, "step": 20860 }, { "entropy": 5.498012447357178, "epoch": 1.892688679245283, "grad_norm": 1.0859375, "learning_rate": 0.00046426804907343574, "loss": 5.0032, "mean_token_accuracy": 0.20734751522541045, "num_tokens": 43314652.0, "step": 20865 }, { "entropy": 5.460072231292725, "epoch": 1.893142235123367, "grad_norm": 1.09375, "learning_rate": 0.00046425055078378206, "loss": 4.8754, "mean_token_accuracy": 0.2202502280473709, "num_tokens": 43324242.0, "step": 20870 }, { "entropy": 5.444532680511474, "epoch": 1.8935957910014514, "grad_norm": 1.0703125, "learning_rate": 0.00046423304858037885, "loss": 4.9844, "mean_token_accuracy": 0.2136056199669838, "num_tokens": 43334054.0, "step": 20875 }, { "entropy": 5.396278333663941, "epoch": 1.8940493468795356, "grad_norm": 1.1796875, "learning_rate": 0.0004642155424635878, "loss": 4.8594, "mean_token_accuracy": 0.22408942878246307, "num_tokens": 43343389.0, "step": 20880 }, { "entropy": 5.434442472457886, "epoch": 1.89450290275762, "grad_norm": 1.1015625, "learning_rate": 0.00046419803243377125, "loss": 4.9209, "mean_token_accuracy": 0.21852685362100602, "num_tokens": 43353892.0, "step": 20885 }, { "entropy": 5.411701440811157, "epoch": 1.894956458635704, "grad_norm": 1.109375, "learning_rate": 0.00046418051849129115, "loss": 4.9645, "mean_token_accuracy": 0.21896405071020125, "num_tokens": 43363912.0, "step": 20890 }, { "entropy": 5.470510387420655, "epoch": 1.895410014513788, "grad_norm": 1.015625, "learning_rate": 0.0004641630006365097, "loss": 5.0373, "mean_token_accuracy": 0.20144977122545243, "num_tokens": 43374719.0, "step": 20895 }, { "entropy": 5.526678800582886, "epoch": 1.8958635703918723, "grad_norm": 1.046875, "learning_rate": 0.00046414547886978926, "loss": 5.0059, "mean_token_accuracy": 0.2012788951396942, "num_tokens": 43385549.0, "step": 20900 }, { "entropy": 5.502257776260376, "epoch": 1.8963171262699565, "grad_norm": 1.0625, "learning_rate": 0.00046412795319149204, "loss": 5.0197, "mean_token_accuracy": 0.21317504495382308, "num_tokens": 43395503.0, "step": 20905 }, { "entropy": 5.458832597732544, "epoch": 1.8967706821480408, "grad_norm": 1.1171875, "learning_rate": 0.00046411042360198053, "loss": 5.0212, "mean_token_accuracy": 0.20107796043157578, "num_tokens": 43406913.0, "step": 20910 }, { "entropy": 5.510247039794922, "epoch": 1.8972242380261248, "grad_norm": 1.078125, "learning_rate": 0.0004640928901016173, "loss": 4.9305, "mean_token_accuracy": 0.20687611997127534, "num_tokens": 43416459.0, "step": 20915 }, { "entropy": 5.472636413574219, "epoch": 1.8976777939042089, "grad_norm": 1.0390625, "learning_rate": 0.00046407535269076493, "loss": 5.0021, "mean_token_accuracy": 0.20746291279792786, "num_tokens": 43426280.0, "step": 20920 }, { "entropy": 5.510209083557129, "epoch": 1.8981313497822931, "grad_norm": 1.140625, "learning_rate": 0.00046405781136978606, "loss": 5.0168, "mean_token_accuracy": 0.2058311492204666, "num_tokens": 43436676.0, "step": 20925 }, { "entropy": 5.591404819488526, "epoch": 1.8985849056603774, "grad_norm": 1.0703125, "learning_rate": 0.00046404026613904357, "loss": 5.0245, "mean_token_accuracy": 0.19956643730401993, "num_tokens": 43447019.0, "step": 20930 }, { "entropy": 5.5263426303863525, "epoch": 1.8990384615384617, "grad_norm": 1.1015625, "learning_rate": 0.0004640227169989001, "loss": 4.9968, "mean_token_accuracy": 0.20376960039138795, "num_tokens": 43456609.0, "step": 20935 }, { "entropy": 5.4787603378295895, "epoch": 1.8994920174165457, "grad_norm": 1.0703125, "learning_rate": 0.0004640051639497187, "loss": 5.0387, "mean_token_accuracy": 0.20301377028226852, "num_tokens": 43467616.0, "step": 20940 }, { "entropy": 5.422423601150513, "epoch": 1.8999455732946298, "grad_norm": 1.0546875, "learning_rate": 0.0004639876069918624, "loss": 5.0073, "mean_token_accuracy": 0.20585259795188904, "num_tokens": 43478209.0, "step": 20945 }, { "entropy": 5.449855709075928, "epoch": 1.900399129172714, "grad_norm": 1.1875, "learning_rate": 0.00046397004612569416, "loss": 4.9031, "mean_token_accuracy": 0.20877286344766616, "num_tokens": 43487278.0, "step": 20950 }, { "entropy": 5.452475738525391, "epoch": 1.9008526850507983, "grad_norm": 1.0078125, "learning_rate": 0.00046395248135157715, "loss": 4.928, "mean_token_accuracy": 0.21707647144794465, "num_tokens": 43497457.0, "step": 20955 }, { "entropy": 5.5127417087554935, "epoch": 1.9013062409288826, "grad_norm": 1.0625, "learning_rate": 0.00046393491266987484, "loss": 5.0479, "mean_token_accuracy": 0.20186402797698974, "num_tokens": 43507761.0, "step": 20960 }, { "entropy": 5.423038196563721, "epoch": 1.9017597968069666, "grad_norm": 1.015625, "learning_rate": 0.0004639173400809502, "loss": 4.962, "mean_token_accuracy": 0.20437643080949783, "num_tokens": 43517198.0, "step": 20965 }, { "entropy": 5.498367214202881, "epoch": 1.9022133526850507, "grad_norm": 1.0703125, "learning_rate": 0.0004638997635851669, "loss": 5.0475, "mean_token_accuracy": 0.20256541669368744, "num_tokens": 43527429.0, "step": 20970 }, { "entropy": 5.557362747192383, "epoch": 1.902666908563135, "grad_norm": 1.0703125, "learning_rate": 0.00046388218318288844, "loss": 5.0469, "mean_token_accuracy": 0.21011619716882707, "num_tokens": 43537867.0, "step": 20975 }, { "entropy": 5.4825639724731445, "epoch": 1.9031204644412192, "grad_norm": 1.046875, "learning_rate": 0.0004638645988744782, "loss": 4.9794, "mean_token_accuracy": 0.207144296169281, "num_tokens": 43547284.0, "step": 20980 }, { "entropy": 5.484060525894165, "epoch": 1.9035740203193035, "grad_norm": 1.0390625, "learning_rate": 0.0004638470106603, "loss": 5.0276, "mean_token_accuracy": 0.20703898668289183, "num_tokens": 43557693.0, "step": 20985 }, { "entropy": 5.538303470611572, "epoch": 1.9040275761973875, "grad_norm": 1.0859375, "learning_rate": 0.0004638294185407174, "loss": 4.9851, "mean_token_accuracy": 0.21754462271928787, "num_tokens": 43566909.0, "step": 20990 }, { "entropy": 5.51477017402649, "epoch": 1.9044811320754715, "grad_norm": 1.046875, "learning_rate": 0.0004638118225160944, "loss": 5.0466, "mean_token_accuracy": 0.212554831802845, "num_tokens": 43576963.0, "step": 20995 }, { "entropy": 5.396061134338379, "epoch": 1.9049346879535558, "grad_norm": 1.15625, "learning_rate": 0.00046379422258679477, "loss": 4.9639, "mean_token_accuracy": 0.20660515278577804, "num_tokens": 43586649.0, "step": 21000 }, { "epoch": 1.9049346879535558, "eval_entropy": 5.208128798493433, "eval_loss": 5.0293426513671875, "eval_mean_token_accuracy": 0.2137755580752144, "eval_num_tokens": 43586649.0, "eval_runtime": 20.7081, "eval_samples_per_second": 1707.542, "eval_steps_per_second": 213.443, "step": 21000 }, { "entropy": 5.429493808746338, "epoch": 1.90538824383164, "grad_norm": 1.046875, "learning_rate": 0.0004637766187531825, "loss": 4.9498, "mean_token_accuracy": 0.208621047437191, "num_tokens": 43596506.0, "step": 21005 }, { "entropy": 5.4850757122039795, "epoch": 1.9058417997097243, "grad_norm": 1.09375, "learning_rate": 0.00046375901101562163, "loss": 5.0317, "mean_token_accuracy": 0.20423005819320678, "num_tokens": 43607188.0, "step": 21010 }, { "entropy": 5.525533723831177, "epoch": 1.9062953555878084, "grad_norm": 0.99609375, "learning_rate": 0.0004637413993744763, "loss": 4.9415, "mean_token_accuracy": 0.21625768393278122, "num_tokens": 43617465.0, "step": 21015 }, { "entropy": 5.480540561676025, "epoch": 1.9067489114658926, "grad_norm": 1.1015625, "learning_rate": 0.00046372378383011077, "loss": 4.9378, "mean_token_accuracy": 0.21178802102804184, "num_tokens": 43627692.0, "step": 21020 }, { "entropy": 5.497624731063842, "epoch": 1.9072024673439767, "grad_norm": 1.0546875, "learning_rate": 0.00046370616438288933, "loss": 5.0238, "mean_token_accuracy": 0.2034093677997589, "num_tokens": 43637350.0, "step": 21025 }, { "entropy": 5.536014795303345, "epoch": 1.907656023222061, "grad_norm": 1.046875, "learning_rate": 0.00046368854103317624, "loss": 5.0111, "mean_token_accuracy": 0.200029593706131, "num_tokens": 43647092.0, "step": 21030 }, { "entropy": 5.49554295539856, "epoch": 1.9081095791001452, "grad_norm": 0.9765625, "learning_rate": 0.00046367091378133615, "loss": 4.9774, "mean_token_accuracy": 0.21101588904857635, "num_tokens": 43657237.0, "step": 21035 }, { "entropy": 5.50356969833374, "epoch": 1.9085631349782293, "grad_norm": 1.1171875, "learning_rate": 0.0004636532826277333, "loss": 4.9698, "mean_token_accuracy": 0.2119905561208725, "num_tokens": 43667966.0, "step": 21040 }, { "entropy": 5.468063116073608, "epoch": 1.9090166908563135, "grad_norm": 1.1171875, "learning_rate": 0.00046363564757273264, "loss": 4.9764, "mean_token_accuracy": 0.20919253230094909, "num_tokens": 43678059.0, "step": 21045 }, { "entropy": 5.43682074546814, "epoch": 1.9094702467343976, "grad_norm": 1.078125, "learning_rate": 0.00046361800861669867, "loss": 4.985, "mean_token_accuracy": 0.21779242306947708, "num_tokens": 43687556.0, "step": 21050 }, { "entropy": 5.530478382110596, "epoch": 1.9099238026124818, "grad_norm": 1.0234375, "learning_rate": 0.00046360036575999623, "loss": 5.0113, "mean_token_accuracy": 0.20452617555856706, "num_tokens": 43697791.0, "step": 21055 }, { "entropy": 5.473403692245483, "epoch": 1.9103773584905661, "grad_norm": 1.0703125, "learning_rate": 0.0004635827190029902, "loss": 4.9316, "mean_token_accuracy": 0.20062480568885804, "num_tokens": 43707390.0, "step": 21060 }, { "entropy": 5.557409620285034, "epoch": 1.9108309143686504, "grad_norm": 1.1015625, "learning_rate": 0.0004635650683460454, "loss": 5.0584, "mean_token_accuracy": 0.20512668639421464, "num_tokens": 43716842.0, "step": 21065 }, { "entropy": 5.451348209381104, "epoch": 1.9112844702467344, "grad_norm": 1.0625, "learning_rate": 0.000463547413789527, "loss": 4.97, "mean_token_accuracy": 0.20878010243177414, "num_tokens": 43726967.0, "step": 21070 }, { "entropy": 5.519096517562867, "epoch": 1.9117380261248185, "grad_norm": 1.0234375, "learning_rate": 0.00046352975533379997, "loss": 4.9736, "mean_token_accuracy": 0.20838417559862138, "num_tokens": 43737425.0, "step": 21075 }, { "entropy": 5.388634204864502, "epoch": 1.9121915820029027, "grad_norm": 1.1171875, "learning_rate": 0.00046351209297922964, "loss": 4.9192, "mean_token_accuracy": 0.21248041540384294, "num_tokens": 43747395.0, "step": 21080 }, { "entropy": 5.479843807220459, "epoch": 1.912645137880987, "grad_norm": 1.15625, "learning_rate": 0.00046349442672618114, "loss": 5.0236, "mean_token_accuracy": 0.20361318290233613, "num_tokens": 43756348.0, "step": 21085 }, { "entropy": 5.524621629714966, "epoch": 1.9130986937590713, "grad_norm": 1.0703125, "learning_rate": 0.00046347675657501986, "loss": 4.967, "mean_token_accuracy": 0.20842225849628448, "num_tokens": 43767629.0, "step": 21090 }, { "entropy": 5.49835844039917, "epoch": 1.9135522496371553, "grad_norm": 1.0625, "learning_rate": 0.0004634590825261113, "loss": 4.8908, "mean_token_accuracy": 0.21746014207601547, "num_tokens": 43777398.0, "step": 21095 }, { "entropy": 5.4525140762329105, "epoch": 1.9140058055152394, "grad_norm": 1.1484375, "learning_rate": 0.00046344140457982075, "loss": 5.0143, "mean_token_accuracy": 0.20511661767959594, "num_tokens": 43787605.0, "step": 21100 }, { "entropy": 5.451720666885376, "epoch": 1.9144593613933236, "grad_norm": 1.09375, "learning_rate": 0.000463423722736514, "loss": 4.9996, "mean_token_accuracy": 0.20990871042013168, "num_tokens": 43796989.0, "step": 21105 }, { "entropy": 5.515697860717774, "epoch": 1.9149129172714079, "grad_norm": 1.0703125, "learning_rate": 0.0004634060369965567, "loss": 5.001, "mean_token_accuracy": 0.21095823645591735, "num_tokens": 43806653.0, "step": 21110 }, { "entropy": 5.456710863113403, "epoch": 1.9153664731494922, "grad_norm": 0.9609375, "learning_rate": 0.00046338834736031446, "loss": 4.9373, "mean_token_accuracy": 0.2085887983441353, "num_tokens": 43817152.0, "step": 21115 }, { "entropy": 5.451695442199707, "epoch": 1.9158200290275762, "grad_norm": 1.0234375, "learning_rate": 0.00046337065382815324, "loss": 4.9466, "mean_token_accuracy": 0.20445048809051514, "num_tokens": 43827341.0, "step": 21120 }, { "entropy": 5.422119998931885, "epoch": 1.9162735849056602, "grad_norm": 1.0390625, "learning_rate": 0.00046335295640043887, "loss": 4.9415, "mean_token_accuracy": 0.21808240562677383, "num_tokens": 43837195.0, "step": 21125 }, { "entropy": 5.4731855392456055, "epoch": 1.9167271407837445, "grad_norm": 1.046875, "learning_rate": 0.00046333525507753743, "loss": 4.9267, "mean_token_accuracy": 0.21081597805023194, "num_tokens": 43847473.0, "step": 21130 }, { "entropy": 5.4429951190948485, "epoch": 1.9171806966618288, "grad_norm": 1.125, "learning_rate": 0.0004633175498598148, "loss": 4.9517, "mean_token_accuracy": 0.21239457428455352, "num_tokens": 43857590.0, "step": 21135 }, { "entropy": 5.478535318374634, "epoch": 1.917634252539913, "grad_norm": 1.1484375, "learning_rate": 0.00046329984074763733, "loss": 5.1073, "mean_token_accuracy": 0.19819005131721495, "num_tokens": 43867085.0, "step": 21140 }, { "entropy": 5.523321866989136, "epoch": 1.918087808417997, "grad_norm": 1.1328125, "learning_rate": 0.0004632821277413711, "loss": 4.9392, "mean_token_accuracy": 0.20900174081325532, "num_tokens": 43877153.0, "step": 21145 }, { "entropy": 5.550936269760132, "epoch": 1.9185413642960811, "grad_norm": 1.0546875, "learning_rate": 0.0004632644108413825, "loss": 5.0638, "mean_token_accuracy": 0.18979740887880325, "num_tokens": 43887977.0, "step": 21150 }, { "entropy": 5.410569953918457, "epoch": 1.9189949201741654, "grad_norm": 0.984375, "learning_rate": 0.00046324669004803803, "loss": 4.9713, "mean_token_accuracy": 0.2081144392490387, "num_tokens": 43898649.0, "step": 21155 }, { "entropy": 5.577789545059204, "epoch": 1.9194484760522497, "grad_norm": 1.1015625, "learning_rate": 0.000463228965361704, "loss": 5.0785, "mean_token_accuracy": 0.20410786122083663, "num_tokens": 43909369.0, "step": 21160 }, { "entropy": 5.526481056213379, "epoch": 1.919902031930334, "grad_norm": 1.125, "learning_rate": 0.0004632112367827469, "loss": 4.9789, "mean_token_accuracy": 0.20510622560977937, "num_tokens": 43919941.0, "step": 21165 }, { "entropy": 5.548752641677856, "epoch": 1.920355587808418, "grad_norm": 1.140625, "learning_rate": 0.0004631935043115335, "loss": 5.0311, "mean_token_accuracy": 0.20475824177265167, "num_tokens": 43929710.0, "step": 21170 }, { "entropy": 5.493607759475708, "epoch": 1.920809143686502, "grad_norm": 1.125, "learning_rate": 0.00046317576794843056, "loss": 4.9805, "mean_token_accuracy": 0.20738983750343323, "num_tokens": 43939850.0, "step": 21175 }, { "entropy": 5.476680755615234, "epoch": 1.9212626995645863, "grad_norm": 1.0625, "learning_rate": 0.00046315802769380474, "loss": 4.8924, "mean_token_accuracy": 0.21504528671503068, "num_tokens": 43950067.0, "step": 21180 }, { "entropy": 5.48453049659729, "epoch": 1.9217162554426706, "grad_norm": 1.046875, "learning_rate": 0.0004631402835480229, "loss": 4.9713, "mean_token_accuracy": 0.211235174536705, "num_tokens": 43960029.0, "step": 21185 }, { "entropy": 5.503409719467163, "epoch": 1.9221698113207548, "grad_norm": 1.0625, "learning_rate": 0.00046312253551145213, "loss": 5.0057, "mean_token_accuracy": 0.20770203322172165, "num_tokens": 43971221.0, "step": 21190 }, { "entropy": 5.50986795425415, "epoch": 1.9226233671988389, "grad_norm": 0.98046875, "learning_rate": 0.00046310478358445935, "loss": 5.0254, "mean_token_accuracy": 0.2000241219997406, "num_tokens": 43981579.0, "step": 21195 }, { "entropy": 5.547817897796631, "epoch": 1.9230769230769231, "grad_norm": 1.1171875, "learning_rate": 0.0004630870277674117, "loss": 5.1223, "mean_token_accuracy": 0.19511819779872894, "num_tokens": 43991132.0, "step": 21200 }, { "entropy": 5.463128709793091, "epoch": 1.9235304789550072, "grad_norm": 1.078125, "learning_rate": 0.0004630692680606764, "loss": 4.9039, "mean_token_accuracy": 0.21112724393606186, "num_tokens": 44001255.0, "step": 21205 }, { "entropy": 5.431452322006225, "epoch": 1.9239840348330914, "grad_norm": 1.1875, "learning_rate": 0.0004630515044646207, "loss": 4.8268, "mean_token_accuracy": 0.21773632168769835, "num_tokens": 44011275.0, "step": 21210 }, { "entropy": 5.476786661148071, "epoch": 1.9244375907111757, "grad_norm": 1.0546875, "learning_rate": 0.000463033736979612, "loss": 4.9964, "mean_token_accuracy": 0.20560188591480255, "num_tokens": 44022524.0, "step": 21215 }, { "entropy": 5.462142992019653, "epoch": 1.9248911465892597, "grad_norm": 1.0546875, "learning_rate": 0.00046301596560601767, "loss": 4.9093, "mean_token_accuracy": 0.2084485411643982, "num_tokens": 44033955.0, "step": 21220 }, { "entropy": 5.490705776214599, "epoch": 1.925344702467344, "grad_norm": 1.0859375, "learning_rate": 0.0004629981903442052, "loss": 5.0108, "mean_token_accuracy": 0.20409136563539504, "num_tokens": 44045149.0, "step": 21225 }, { "entropy": 5.542683744430542, "epoch": 1.925798258345428, "grad_norm": 1.1484375, "learning_rate": 0.0004629804111945424, "loss": 5.0165, "mean_token_accuracy": 0.21039204746484758, "num_tokens": 44055280.0, "step": 21230 }, { "entropy": 5.478211784362793, "epoch": 1.9262518142235123, "grad_norm": 1.1484375, "learning_rate": 0.0004629626281573966, "loss": 4.948, "mean_token_accuracy": 0.21064088344573975, "num_tokens": 44065578.0, "step": 21235 }, { "entropy": 5.4070117473602295, "epoch": 1.9267053701015966, "grad_norm": 1.1015625, "learning_rate": 0.0004629448412331359, "loss": 4.9108, "mean_token_accuracy": 0.21519255191087722, "num_tokens": 44075454.0, "step": 21240 }, { "entropy": 5.463044929504394, "epoch": 1.9271589259796809, "grad_norm": 1.1796875, "learning_rate": 0.0004629270504221279, "loss": 5.0107, "mean_token_accuracy": 0.20468932688236235, "num_tokens": 44085680.0, "step": 21245 }, { "entropy": 5.4293310165405275, "epoch": 1.927612481857765, "grad_norm": 0.9765625, "learning_rate": 0.0004629092557247407, "loss": 4.93, "mean_token_accuracy": 0.20808823704719542, "num_tokens": 44097177.0, "step": 21250 }, { "entropy": 5.508694648742676, "epoch": 1.928066037735849, "grad_norm": 1.15625, "learning_rate": 0.0004628914571413422, "loss": 5.0371, "mean_token_accuracy": 0.2045628771185875, "num_tokens": 44107251.0, "step": 21255 }, { "entropy": 5.473277282714844, "epoch": 1.9285195936139332, "grad_norm": 1.09375, "learning_rate": 0.00046287365467230035, "loss": 5.0145, "mean_token_accuracy": 0.20199953764677048, "num_tokens": 44117943.0, "step": 21260 }, { "entropy": 5.545036268234253, "epoch": 1.9289731494920175, "grad_norm": 1.1796875, "learning_rate": 0.00046285584831798354, "loss": 5.0241, "mean_token_accuracy": 0.20755217522382735, "num_tokens": 44128608.0, "step": 21265 }, { "entropy": 5.515242004394532, "epoch": 1.9294267053701017, "grad_norm": 1.1484375, "learning_rate": 0.00046283803807875996, "loss": 4.9676, "mean_token_accuracy": 0.2142454758286476, "num_tokens": 44138809.0, "step": 21270 }, { "entropy": 5.485807943344116, "epoch": 1.9298802612481858, "grad_norm": 1.0390625, "learning_rate": 0.00046282022395499785, "loss": 5.0033, "mean_token_accuracy": 0.20848530381917954, "num_tokens": 44148532.0, "step": 21275 }, { "entropy": 5.50192813873291, "epoch": 1.9303338171262698, "grad_norm": 1.0625, "learning_rate": 0.0004628024059470656, "loss": 5.0091, "mean_token_accuracy": 0.20679432451725005, "num_tokens": 44158628.0, "step": 21280 }, { "entropy": 5.485290431976319, "epoch": 1.930787373004354, "grad_norm": 1.03125, "learning_rate": 0.0004627845840553318, "loss": 4.8865, "mean_token_accuracy": 0.21345238983631135, "num_tokens": 44168574.0, "step": 21285 }, { "entropy": 5.54254903793335, "epoch": 1.9312409288824384, "grad_norm": 1.0390625, "learning_rate": 0.00046276675828016493, "loss": 5.0435, "mean_token_accuracy": 0.20906085819005965, "num_tokens": 44180207.0, "step": 21290 }, { "entropy": 5.53311505317688, "epoch": 1.9316944847605226, "grad_norm": 1.1171875, "learning_rate": 0.0004627489286219336, "loss": 5.0867, "mean_token_accuracy": 0.19624409228563308, "num_tokens": 44190473.0, "step": 21295 }, { "entropy": 5.569922637939453, "epoch": 1.9321480406386067, "grad_norm": 1.0078125, "learning_rate": 0.0004627310950810066, "loss": 5.0354, "mean_token_accuracy": 0.20721171349287032, "num_tokens": 44201150.0, "step": 21300 }, { "entropy": 5.487321233749389, "epoch": 1.9326015965166907, "grad_norm": 1.0625, "learning_rate": 0.0004627132576577528, "loss": 4.9858, "mean_token_accuracy": 0.20068553239107131, "num_tokens": 44211272.0, "step": 21305 }, { "entropy": 5.535678052902222, "epoch": 1.933055152394775, "grad_norm": 0.9609375, "learning_rate": 0.000462695416352541, "loss": 5.0627, "mean_token_accuracy": 0.20610422343015672, "num_tokens": 44223556.0, "step": 21310 }, { "entropy": 5.493580770492554, "epoch": 1.9335087082728593, "grad_norm": 1.0234375, "learning_rate": 0.00046267757116574, "loss": 4.9548, "mean_token_accuracy": 0.21254609525203705, "num_tokens": 44233911.0, "step": 21315 }, { "entropy": 5.538025426864624, "epoch": 1.9339622641509435, "grad_norm": 1.125, "learning_rate": 0.0004626597220977191, "loss": 5.0341, "mean_token_accuracy": 0.2088310554623604, "num_tokens": 44244108.0, "step": 21320 }, { "entropy": 5.451167440414428, "epoch": 1.9344158200290276, "grad_norm": 1.1484375, "learning_rate": 0.00046264186914884737, "loss": 4.9381, "mean_token_accuracy": 0.21035722494125367, "num_tokens": 44253604.0, "step": 21325 }, { "entropy": 5.480927276611328, "epoch": 1.9348693759071116, "grad_norm": 1.0703125, "learning_rate": 0.00046262401231949386, "loss": 5.0467, "mean_token_accuracy": 0.1987640842795372, "num_tokens": 44263573.0, "step": 21330 }, { "entropy": 5.4717604637146, "epoch": 1.9353229317851959, "grad_norm": 1.0390625, "learning_rate": 0.00046260615161002803, "loss": 4.9625, "mean_token_accuracy": 0.2070356383919716, "num_tokens": 44274071.0, "step": 21335 }, { "entropy": 5.581668424606323, "epoch": 1.9357764876632801, "grad_norm": 1.03125, "learning_rate": 0.0004625882870208192, "loss": 5.0091, "mean_token_accuracy": 0.2075563758611679, "num_tokens": 44283997.0, "step": 21340 }, { "entropy": 5.538790607452393, "epoch": 1.9362300435413644, "grad_norm": 0.98828125, "learning_rate": 0.00046257041855223674, "loss": 4.983, "mean_token_accuracy": 0.20960690528154374, "num_tokens": 44295024.0, "step": 21345 }, { "entropy": 5.435490417480469, "epoch": 1.9366835994194485, "grad_norm": 1.0703125, "learning_rate": 0.00046255254620465033, "loss": 4.9418, "mean_token_accuracy": 0.21106469631195068, "num_tokens": 44305476.0, "step": 21350 }, { "entropy": 5.450983095169067, "epoch": 1.9371371552975325, "grad_norm": 1.109375, "learning_rate": 0.00046253466997842936, "loss": 4.9067, "mean_token_accuracy": 0.21374634206295012, "num_tokens": 44316101.0, "step": 21355 }, { "entropy": 5.451597499847412, "epoch": 1.9375907111756168, "grad_norm": 1.21875, "learning_rate": 0.0004625167898739436, "loss": 4.8705, "mean_token_accuracy": 0.2147537052631378, "num_tokens": 44325058.0, "step": 21360 }, { "entropy": 5.616130304336548, "epoch": 1.938044267053701, "grad_norm": 0.9921875, "learning_rate": 0.000462498905891563, "loss": 5.1526, "mean_token_accuracy": 0.19316584020853042, "num_tokens": 44336585.0, "step": 21365 }, { "entropy": 5.499198532104492, "epoch": 1.9384978229317853, "grad_norm": 1.1796875, "learning_rate": 0.0004624810180316571, "loss": 4.9699, "mean_token_accuracy": 0.20698606818914414, "num_tokens": 44346911.0, "step": 21370 }, { "entropy": 5.42497410774231, "epoch": 1.9389513788098693, "grad_norm": 1.078125, "learning_rate": 0.00046246312629459596, "loss": 4.9466, "mean_token_accuracy": 0.20535250157117843, "num_tokens": 44358040.0, "step": 21375 }, { "entropy": 5.487753295898438, "epoch": 1.9394049346879536, "grad_norm": 1.0546875, "learning_rate": 0.0004624452306807497, "loss": 4.9606, "mean_token_accuracy": 0.2171310856938362, "num_tokens": 44368781.0, "step": 21380 }, { "entropy": 5.430509090423584, "epoch": 1.9398584905660377, "grad_norm": 1.015625, "learning_rate": 0.0004624273311904882, "loss": 4.9113, "mean_token_accuracy": 0.20898612439632416, "num_tokens": 44378809.0, "step": 21385 }, { "entropy": 5.545567846298217, "epoch": 1.940312046444122, "grad_norm": 1.171875, "learning_rate": 0.00046240942782418184, "loss": 5.0658, "mean_token_accuracy": 0.2038144513964653, "num_tokens": 44388517.0, "step": 21390 }, { "entropy": 5.586041116714478, "epoch": 1.9407656023222062, "grad_norm": 1.0234375, "learning_rate": 0.0004623915205822007, "loss": 5.0184, "mean_token_accuracy": 0.20314415246248246, "num_tokens": 44399364.0, "step": 21395 }, { "entropy": 5.482648944854736, "epoch": 1.9412191582002902, "grad_norm": 1.1171875, "learning_rate": 0.00046237360946491514, "loss": 4.9268, "mean_token_accuracy": 0.20687646716833114, "num_tokens": 44409506.0, "step": 21400 }, { "entropy": 5.529890346527099, "epoch": 1.9416727140783745, "grad_norm": 1.1015625, "learning_rate": 0.0004623556944726956, "loss": 5.0125, "mean_token_accuracy": 0.207782182097435, "num_tokens": 44419446.0, "step": 21405 }, { "entropy": 5.464230966567993, "epoch": 1.9421262699564585, "grad_norm": 1.1875, "learning_rate": 0.00046233777560591256, "loss": 4.9596, "mean_token_accuracy": 0.2046886771917343, "num_tokens": 44429560.0, "step": 21410 }, { "entropy": 5.484513521194458, "epoch": 1.9425798258345428, "grad_norm": 1.09375, "learning_rate": 0.00046231985286493654, "loss": 4.9631, "mean_token_accuracy": 0.2046727254986763, "num_tokens": 44439640.0, "step": 21415 }, { "entropy": 5.5007791996002195, "epoch": 1.943033381712627, "grad_norm": 1.125, "learning_rate": 0.00046230192625013836, "loss": 4.9775, "mean_token_accuracy": 0.20616423338651657, "num_tokens": 44450480.0, "step": 21420 }, { "entropy": 5.431567001342773, "epoch": 1.9434869375907113, "grad_norm": 1.0390625, "learning_rate": 0.00046228399576188844, "loss": 4.8867, "mean_token_accuracy": 0.21243804693222046, "num_tokens": 44460633.0, "step": 21425 }, { "entropy": 5.489944505691528, "epoch": 1.9439404934687954, "grad_norm": 1.1484375, "learning_rate": 0.00046226606140055784, "loss": 4.9388, "mean_token_accuracy": 0.2186029702425003, "num_tokens": 44470917.0, "step": 21430 }, { "entropy": 5.513890886306763, "epoch": 1.9443940493468794, "grad_norm": 0.9921875, "learning_rate": 0.00046224812316651736, "loss": 5.0031, "mean_token_accuracy": 0.2036394014954567, "num_tokens": 44482538.0, "step": 21435 }, { "entropy": 5.5470575332641605, "epoch": 1.9448476052249637, "grad_norm": 1.03125, "learning_rate": 0.000462230181060138, "loss": 5.0298, "mean_token_accuracy": 0.20244336426258086, "num_tokens": 44493518.0, "step": 21440 }, { "entropy": 5.505383920669556, "epoch": 1.945301161103048, "grad_norm": 1.03125, "learning_rate": 0.00046221223508179077, "loss": 5.0038, "mean_token_accuracy": 0.20661171525716782, "num_tokens": 44503685.0, "step": 21445 }, { "entropy": 5.43728928565979, "epoch": 1.9457547169811322, "grad_norm": 1.0078125, "learning_rate": 0.00046219428523184685, "loss": 4.959, "mean_token_accuracy": 0.21058472990989685, "num_tokens": 44514015.0, "step": 21450 }, { "entropy": 5.464501571655274, "epoch": 1.9462082728592163, "grad_norm": 0.98046875, "learning_rate": 0.0004621763315106774, "loss": 4.9716, "mean_token_accuracy": 0.20697275698184966, "num_tokens": 44525187.0, "step": 21455 }, { "entropy": 5.418845224380493, "epoch": 1.9466618287373003, "grad_norm": 1.1171875, "learning_rate": 0.00046215837391865364, "loss": 4.9499, "mean_token_accuracy": 0.21209617406129838, "num_tokens": 44535964.0, "step": 21460 }, { "entropy": 5.44310040473938, "epoch": 1.9471153846153846, "grad_norm": 0.99609375, "learning_rate": 0.00046214041245614713, "loss": 4.9412, "mean_token_accuracy": 0.2061736151576042, "num_tokens": 44546985.0, "step": 21465 }, { "entropy": 5.521988582611084, "epoch": 1.9475689404934688, "grad_norm": 1.171875, "learning_rate": 0.0004621224471235291, "loss": 5.0181, "mean_token_accuracy": 0.19978773444890977, "num_tokens": 44556888.0, "step": 21470 }, { "entropy": 5.499261426925659, "epoch": 1.9480224963715531, "grad_norm": 1.0546875, "learning_rate": 0.00046210447792117114, "loss": 4.9447, "mean_token_accuracy": 0.2085475966334343, "num_tokens": 44566857.0, "step": 21475 }, { "entropy": 5.510692119598389, "epoch": 1.9484760522496372, "grad_norm": 1.0, "learning_rate": 0.000462086504849445, "loss": 4.9893, "mean_token_accuracy": 0.2052849531173706, "num_tokens": 44578152.0, "step": 21480 }, { "entropy": 5.487776136398315, "epoch": 1.9489296081277212, "grad_norm": 1.0546875, "learning_rate": 0.0004620685279087222, "loss": 4.9498, "mean_token_accuracy": 0.21359857469797133, "num_tokens": 44588814.0, "step": 21485 }, { "entropy": 5.470897579193116, "epoch": 1.9493831640058055, "grad_norm": 1.046875, "learning_rate": 0.00046205054709937474, "loss": 4.9479, "mean_token_accuracy": 0.20818614214658737, "num_tokens": 44599366.0, "step": 21490 }, { "entropy": 5.586637926101685, "epoch": 1.9498367198838897, "grad_norm": 1.0546875, "learning_rate": 0.0004620325624217741, "loss": 5.067, "mean_token_accuracy": 0.19677798599004745, "num_tokens": 44609962.0, "step": 21495 }, { "entropy": 5.561524391174316, "epoch": 1.950290275761974, "grad_norm": 1.1171875, "learning_rate": 0.0004620145738762925, "loss": 5.0237, "mean_token_accuracy": 0.20589086413383484, "num_tokens": 44619917.0, "step": 21500 }, { "entropy": 5.476059675216675, "epoch": 1.950743831640058, "grad_norm": 1.09375, "learning_rate": 0.0004619965814633019, "loss": 4.9851, "mean_token_accuracy": 0.20783425718545914, "num_tokens": 44629723.0, "step": 21505 }, { "entropy": 5.4737201690673825, "epoch": 1.951197387518142, "grad_norm": 1.0703125, "learning_rate": 0.0004619785851831742, "loss": 5.0159, "mean_token_accuracy": 0.20820776671171187, "num_tokens": 44641011.0, "step": 21510 }, { "entropy": 5.519546842575073, "epoch": 1.9516509433962264, "grad_norm": 1.140625, "learning_rate": 0.00046196058503628176, "loss": 4.9442, "mean_token_accuracy": 0.20904525220394135, "num_tokens": 44651154.0, "step": 21515 }, { "entropy": 5.518677663803101, "epoch": 1.9521044992743106, "grad_norm": 1.0859375, "learning_rate": 0.0004619425810229968, "loss": 5.0607, "mean_token_accuracy": 0.20177183747291566, "num_tokens": 44661672.0, "step": 21520 }, { "entropy": 5.45524230003357, "epoch": 1.952558055152395, "grad_norm": 1.09375, "learning_rate": 0.0004619245731436917, "loss": 4.9401, "mean_token_accuracy": 0.21084539890289306, "num_tokens": 44671449.0, "step": 21525 }, { "entropy": 5.505606937408447, "epoch": 1.953011611030479, "grad_norm": 1.1015625, "learning_rate": 0.00046190656139873863, "loss": 4.9464, "mean_token_accuracy": 0.2141725167632103, "num_tokens": 44681977.0, "step": 21530 }, { "entropy": 5.494058895111084, "epoch": 1.953465166908563, "grad_norm": 1.1015625, "learning_rate": 0.0004618885457885103, "loss": 4.9465, "mean_token_accuracy": 0.20989644527435303, "num_tokens": 44691946.0, "step": 21535 }, { "entropy": 5.48291506767273, "epoch": 1.9539187227866472, "grad_norm": 1.0703125, "learning_rate": 0.0004618705263133793, "loss": 4.9977, "mean_token_accuracy": 0.2076904892921448, "num_tokens": 44702012.0, "step": 21540 }, { "entropy": 5.4927314758300785, "epoch": 1.9543722786647315, "grad_norm": 1.1015625, "learning_rate": 0.0004618525029737182, "loss": 4.9186, "mean_token_accuracy": 0.21195246875286103, "num_tokens": 44711605.0, "step": 21545 }, { "entropy": 5.545970249176025, "epoch": 1.9548258345428158, "grad_norm": 1.09375, "learning_rate": 0.00046183447576989966, "loss": 5.0284, "mean_token_accuracy": 0.20986457616090776, "num_tokens": 44722765.0, "step": 21550 }, { "entropy": 5.507702732086182, "epoch": 1.9552793904208998, "grad_norm": 1.109375, "learning_rate": 0.00046181644470229656, "loss": 4.96, "mean_token_accuracy": 0.20797914117574692, "num_tokens": 44732082.0, "step": 21555 }, { "entropy": 5.42052583694458, "epoch": 1.955732946298984, "grad_norm": 1.171875, "learning_rate": 0.0004617984097712817, "loss": 4.8974, "mean_token_accuracy": 0.21292117089033127, "num_tokens": 44742054.0, "step": 21560 }, { "entropy": 5.437080812454224, "epoch": 1.9561865021770681, "grad_norm": 1.09375, "learning_rate": 0.0004617803709772282, "loss": 4.9948, "mean_token_accuracy": 0.21103788465261458, "num_tokens": 44752954.0, "step": 21565 }, { "entropy": 5.504434204101562, "epoch": 1.9566400580551524, "grad_norm": 0.98828125, "learning_rate": 0.0004617623283205091, "loss": 5.0143, "mean_token_accuracy": 0.20853299796581268, "num_tokens": 44764277.0, "step": 21570 }, { "entropy": 5.542857456207275, "epoch": 1.9570936139332367, "grad_norm": 1.1015625, "learning_rate": 0.00046174428180149733, "loss": 5.0555, "mean_token_accuracy": 0.20178077220916749, "num_tokens": 44775429.0, "step": 21575 }, { "entropy": 5.529280710220337, "epoch": 1.9575471698113207, "grad_norm": 1.1328125, "learning_rate": 0.0004617262314205663, "loss": 5.0213, "mean_token_accuracy": 0.20454297661781312, "num_tokens": 44786390.0, "step": 21580 }, { "entropy": 5.524914407730103, "epoch": 1.958000725689405, "grad_norm": 1.03125, "learning_rate": 0.0004617081771780893, "loss": 4.9919, "mean_token_accuracy": 0.2072996199131012, "num_tokens": 44796473.0, "step": 21585 }, { "entropy": 5.467043685913086, "epoch": 1.958454281567489, "grad_norm": 1.0, "learning_rate": 0.00046169011907443944, "loss": 4.9389, "mean_token_accuracy": 0.2105545297265053, "num_tokens": 44806379.0, "step": 21590 }, { "entropy": 5.480042934417725, "epoch": 1.9589078374455733, "grad_norm": 1.0390625, "learning_rate": 0.0004616720571099904, "loss": 5.007, "mean_token_accuracy": 0.20666434466838837, "num_tokens": 44817659.0, "step": 21595 }, { "entropy": 5.5198516845703125, "epoch": 1.9593613933236576, "grad_norm": 1.1171875, "learning_rate": 0.0004616539912851157, "loss": 4.9348, "mean_token_accuracy": 0.2071309357881546, "num_tokens": 44827073.0, "step": 21600 }, { "entropy": 5.482797718048095, "epoch": 1.9598149492017418, "grad_norm": 1.078125, "learning_rate": 0.00046163592160018886, "loss": 4.9542, "mean_token_accuracy": 0.21293228268623351, "num_tokens": 44837019.0, "step": 21605 }, { "entropy": 5.511962890625, "epoch": 1.9602685050798259, "grad_norm": 1.0859375, "learning_rate": 0.0004616178480555836, "loss": 4.9576, "mean_token_accuracy": 0.2088865652680397, "num_tokens": 44846670.0, "step": 21610 }, { "entropy": 5.403671073913574, "epoch": 1.96072206095791, "grad_norm": 1.1328125, "learning_rate": 0.0004615997706516737, "loss": 4.8893, "mean_token_accuracy": 0.21173563748598098, "num_tokens": 44857016.0, "step": 21615 }, { "entropy": 5.539744758605957, "epoch": 1.9611756168359942, "grad_norm": 1.078125, "learning_rate": 0.000461581689388833, "loss": 5.0615, "mean_token_accuracy": 0.19902532547712326, "num_tokens": 44868180.0, "step": 21620 }, { "entropy": 5.4574614524841305, "epoch": 1.9616291727140784, "grad_norm": 1.03125, "learning_rate": 0.00046156360426743536, "loss": 4.9022, "mean_token_accuracy": 0.21507873386144638, "num_tokens": 44877864.0, "step": 21625 }, { "entropy": 5.506433629989624, "epoch": 1.9620827285921627, "grad_norm": 1.140625, "learning_rate": 0.0004615455152878549, "loss": 4.9831, "mean_token_accuracy": 0.217892561852932, "num_tokens": 44887737.0, "step": 21630 }, { "entropy": 5.44438533782959, "epoch": 1.9625362844702468, "grad_norm": 1.09375, "learning_rate": 0.0004615274224504657, "loss": 4.9789, "mean_token_accuracy": 0.2048384889960289, "num_tokens": 44898669.0, "step": 21635 }, { "entropy": 5.5493402004241945, "epoch": 1.9629898403483308, "grad_norm": 1.125, "learning_rate": 0.00046150932575564173, "loss": 5.0392, "mean_token_accuracy": 0.20997308194637299, "num_tokens": 44909074.0, "step": 21640 }, { "entropy": 5.482325506210327, "epoch": 1.963443396226415, "grad_norm": 1.125, "learning_rate": 0.00046149122520375746, "loss": 4.945, "mean_token_accuracy": 0.20922146886587142, "num_tokens": 44919468.0, "step": 21645 }, { "entropy": 5.524408769607544, "epoch": 1.9638969521044993, "grad_norm": 1.03125, "learning_rate": 0.0004614731207951871, "loss": 5.052, "mean_token_accuracy": 0.19886288195848464, "num_tokens": 44930470.0, "step": 21650 }, { "entropy": 5.482134580612183, "epoch": 1.9643505079825836, "grad_norm": 1.21875, "learning_rate": 0.0004614550125303051, "loss": 5.0491, "mean_token_accuracy": 0.20468457341194152, "num_tokens": 44940611.0, "step": 21655 }, { "entropy": 5.507540035247803, "epoch": 1.9648040638606676, "grad_norm": 1.0546875, "learning_rate": 0.0004614369004094859, "loss": 4.9692, "mean_token_accuracy": 0.21159935146570205, "num_tokens": 44950985.0, "step": 21660 }, { "entropy": 5.530377340316773, "epoch": 1.9652576197387517, "grad_norm": 1.109375, "learning_rate": 0.00046141878443310415, "loss": 5.0119, "mean_token_accuracy": 0.20684940814971925, "num_tokens": 44961858.0, "step": 21665 }, { "entropy": 5.516536521911621, "epoch": 1.965711175616836, "grad_norm": 1.03125, "learning_rate": 0.00046140066460153444, "loss": 4.9694, "mean_token_accuracy": 0.21126515418291092, "num_tokens": 44972048.0, "step": 21670 }, { "entropy": 5.464878225326538, "epoch": 1.9661647314949202, "grad_norm": 1.03125, "learning_rate": 0.00046138254091515136, "loss": 4.913, "mean_token_accuracy": 0.21505399644374848, "num_tokens": 44981835.0, "step": 21675 }, { "entropy": 5.454610919952392, "epoch": 1.9666182873730045, "grad_norm": 1.1171875, "learning_rate": 0.00046136441337432996, "loss": 4.8908, "mean_token_accuracy": 0.21620130985975267, "num_tokens": 44992108.0, "step": 21680 }, { "entropy": 5.577081823348999, "epoch": 1.9670718432510885, "grad_norm": 1.1015625, "learning_rate": 0.00046134628197944496, "loss": 5.0521, "mean_token_accuracy": 0.19921357035636902, "num_tokens": 45002105.0, "step": 21685 }, { "entropy": 5.489145088195801, "epoch": 1.9675253991291726, "grad_norm": 0.9609375, "learning_rate": 0.00046132814673087143, "loss": 4.9771, "mean_token_accuracy": 0.20368688106536864, "num_tokens": 45013934.0, "step": 21690 }, { "entropy": 5.4539268016815186, "epoch": 1.9679789550072568, "grad_norm": 1.0390625, "learning_rate": 0.0004613100076289842, "loss": 4.9662, "mean_token_accuracy": 0.20767173618078233, "num_tokens": 45023851.0, "step": 21695 }, { "entropy": 5.436827516555786, "epoch": 1.968432510885341, "grad_norm": 1.078125, "learning_rate": 0.0004612918646741586, "loss": 4.9038, "mean_token_accuracy": 0.21096698343753814, "num_tokens": 45034140.0, "step": 21700 }, { "entropy": 5.495441913604736, "epoch": 1.9688860667634254, "grad_norm": 1.09375, "learning_rate": 0.0004612737178667698, "loss": 4.9608, "mean_token_accuracy": 0.20554138571023942, "num_tokens": 45044452.0, "step": 21705 }, { "entropy": 5.447922229766846, "epoch": 1.9693396226415094, "grad_norm": 1.2578125, "learning_rate": 0.00046125556720719304, "loss": 4.993, "mean_token_accuracy": 0.20312803685665132, "num_tokens": 45053845.0, "step": 21710 }, { "entropy": 5.443632173538208, "epoch": 1.9697931785195935, "grad_norm": 1.09375, "learning_rate": 0.0004612374126958037, "loss": 4.9225, "mean_token_accuracy": 0.20919681638479232, "num_tokens": 45063973.0, "step": 21715 }, { "entropy": 5.529424810409546, "epoch": 1.9702467343976777, "grad_norm": 1.1171875, "learning_rate": 0.0004612192543329771, "loss": 5.0763, "mean_token_accuracy": 0.20683616846799852, "num_tokens": 45074879.0, "step": 21720 }, { "entropy": 5.473941850662231, "epoch": 1.970700290275762, "grad_norm": 1.0625, "learning_rate": 0.000461201092119089, "loss": 4.9159, "mean_token_accuracy": 0.21797876358032225, "num_tokens": 45085161.0, "step": 21725 }, { "entropy": 5.530436086654663, "epoch": 1.9711538461538463, "grad_norm": 1.0625, "learning_rate": 0.0004611829260545148, "loss": 5.0459, "mean_token_accuracy": 0.19993252158164979, "num_tokens": 45095862.0, "step": 21730 }, { "entropy": 5.536198997497559, "epoch": 1.9716074020319303, "grad_norm": 1.0546875, "learning_rate": 0.00046116475613963026, "loss": 4.9761, "mean_token_accuracy": 0.20735560208559037, "num_tokens": 45106396.0, "step": 21735 }, { "entropy": 5.4965776920318605, "epoch": 1.9720609579100146, "grad_norm": 1.109375, "learning_rate": 0.00046114658237481114, "loss": 4.8973, "mean_token_accuracy": 0.21421259194612502, "num_tokens": 45117178.0, "step": 21740 }, { "entropy": 5.40320782661438, "epoch": 1.9725145137880986, "grad_norm": 1.21875, "learning_rate": 0.0004611284047604332, "loss": 4.9178, "mean_token_accuracy": 0.21373512893915175, "num_tokens": 45126571.0, "step": 21745 }, { "entropy": 5.46913743019104, "epoch": 1.9729680696661829, "grad_norm": 1.125, "learning_rate": 0.00046111022329687246, "loss": 5.0184, "mean_token_accuracy": 0.20797273367643357, "num_tokens": 45137247.0, "step": 21750 }, { "entropy": 5.562497091293335, "epoch": 1.9734216255442671, "grad_norm": 1.21875, "learning_rate": 0.00046109203798450483, "loss": 4.978, "mean_token_accuracy": 0.20356351286172866, "num_tokens": 45147531.0, "step": 21755 }, { "entropy": 5.500815486907959, "epoch": 1.9738751814223512, "grad_norm": 1.0234375, "learning_rate": 0.0004610738488237065, "loss": 4.9566, "mean_token_accuracy": 0.20879297703504562, "num_tokens": 45158312.0, "step": 21760 }, { "entropy": 5.43378963470459, "epoch": 1.9743287373004355, "grad_norm": 1.015625, "learning_rate": 0.0004610556558148535, "loss": 4.9926, "mean_token_accuracy": 0.209259033203125, "num_tokens": 45169754.0, "step": 21765 }, { "entropy": 5.516285419464111, "epoch": 1.9747822931785195, "grad_norm": 1.078125, "learning_rate": 0.0004610374589583222, "loss": 5.0213, "mean_token_accuracy": 0.2030855596065521, "num_tokens": 45180428.0, "step": 21770 }, { "entropy": 5.519256258010865, "epoch": 1.9752358490566038, "grad_norm": 1.1171875, "learning_rate": 0.0004610192582544888, "loss": 4.9254, "mean_token_accuracy": 0.20888968408107758, "num_tokens": 45191558.0, "step": 21775 }, { "entropy": 5.449000215530395, "epoch": 1.975689404934688, "grad_norm": 1.0625, "learning_rate": 0.0004610010537037297, "loss": 4.9244, "mean_token_accuracy": 0.21123051643371582, "num_tokens": 45201567.0, "step": 21780 }, { "entropy": 5.528047323226929, "epoch": 1.9761429608127723, "grad_norm": 1.078125, "learning_rate": 0.0004609828453064214, "loss": 5.0507, "mean_token_accuracy": 0.19533353298902512, "num_tokens": 45211359.0, "step": 21785 }, { "entropy": 5.532426500320435, "epoch": 1.9765965166908563, "grad_norm": 1.1875, "learning_rate": 0.00046096463306294057, "loss": 4.9687, "mean_token_accuracy": 0.20437736958265304, "num_tokens": 45222106.0, "step": 21790 }, { "entropy": 5.440474176406861, "epoch": 1.9770500725689404, "grad_norm": 1.109375, "learning_rate": 0.00046094641697366366, "loss": 4.9912, "mean_token_accuracy": 0.2081102818250656, "num_tokens": 45233169.0, "step": 21795 }, { "entropy": 5.549408197402954, "epoch": 1.9775036284470247, "grad_norm": 1.0625, "learning_rate": 0.0004609281970389675, "loss": 5.0608, "mean_token_accuracy": 0.19811852574348449, "num_tokens": 45243627.0, "step": 21800 }, { "entropy": 5.5237767696380615, "epoch": 1.977957184325109, "grad_norm": 1.0078125, "learning_rate": 0.00046090997325922887, "loss": 4.9206, "mean_token_accuracy": 0.21338146477937697, "num_tokens": 45253730.0, "step": 21805 }, { "entropy": 5.460017251968384, "epoch": 1.9784107402031932, "grad_norm": 1.0390625, "learning_rate": 0.00046089174563482456, "loss": 5.036, "mean_token_accuracy": 0.2059587851166725, "num_tokens": 45263443.0, "step": 21810 }, { "entropy": 5.438510465621948, "epoch": 1.9788642960812772, "grad_norm": 0.98046875, "learning_rate": 0.0004608735141661316, "loss": 4.9348, "mean_token_accuracy": 0.21124192029237748, "num_tokens": 45275298.0, "step": 21815 }, { "entropy": 5.509208106994629, "epoch": 1.9793178519593613, "grad_norm": 1.109375, "learning_rate": 0.00046085527885352694, "loss": 5.0271, "mean_token_accuracy": 0.206145940721035, "num_tokens": 45285628.0, "step": 21820 }, { "entropy": 5.471783781051636, "epoch": 1.9797714078374455, "grad_norm": 1.0703125, "learning_rate": 0.0004608370396973878, "loss": 4.8864, "mean_token_accuracy": 0.2130176916718483, "num_tokens": 45295559.0, "step": 21825 }, { "entropy": 5.472705936431884, "epoch": 1.9802249637155298, "grad_norm": 1.0234375, "learning_rate": 0.00046081879669809133, "loss": 4.922, "mean_token_accuracy": 0.2102159634232521, "num_tokens": 45305395.0, "step": 21830 }, { "entropy": 5.47149510383606, "epoch": 1.980678519593614, "grad_norm": 1.0, "learning_rate": 0.0004608005498560148, "loss": 4.9451, "mean_token_accuracy": 0.21422380656003953, "num_tokens": 45316763.0, "step": 21835 }, { "entropy": 5.531671667098999, "epoch": 1.9811320754716981, "grad_norm": 1.1328125, "learning_rate": 0.0004607822991715356, "loss": 5.0751, "mean_token_accuracy": 0.20736559629440307, "num_tokens": 45326484.0, "step": 21840 }, { "entropy": 5.558336400985718, "epoch": 1.9815856313497822, "grad_norm": 1.2421875, "learning_rate": 0.000460764044645031, "loss": 5.0056, "mean_token_accuracy": 0.20397043079137803, "num_tokens": 45335792.0, "step": 21845 }, { "entropy": 5.484403228759765, "epoch": 1.9820391872278664, "grad_norm": 1.0703125, "learning_rate": 0.0004607457862768787, "loss": 4.9441, "mean_token_accuracy": 0.20361879467964172, "num_tokens": 45347247.0, "step": 21850 }, { "entropy": 5.518598508834839, "epoch": 1.9824927431059507, "grad_norm": 1.1015625, "learning_rate": 0.0004607275240674562, "loss": 5.0526, "mean_token_accuracy": 0.20043198615312577, "num_tokens": 45357994.0, "step": 21855 }, { "entropy": 5.414259338378907, "epoch": 1.982946298984035, "grad_norm": 1.0703125, "learning_rate": 0.0004607092580171411, "loss": 5.0025, "mean_token_accuracy": 0.20804253220558167, "num_tokens": 45368170.0, "step": 21860 }, { "entropy": 5.5120526313781735, "epoch": 1.983399854862119, "grad_norm": 1.09375, "learning_rate": 0.0004606909881263113, "loss": 5.0296, "mean_token_accuracy": 0.20648445785045624, "num_tokens": 45378696.0, "step": 21865 }, { "entropy": 5.560987710952759, "epoch": 1.983853410740203, "grad_norm": 1.09375, "learning_rate": 0.00046067271439534445, "loss": 5.0703, "mean_token_accuracy": 0.20440033376216887, "num_tokens": 45388578.0, "step": 21870 }, { "entropy": 5.5059057712554935, "epoch": 1.9843069666182873, "grad_norm": 1.109375, "learning_rate": 0.00046065443682461864, "loss": 5.0435, "mean_token_accuracy": 0.20822376161813735, "num_tokens": 45398835.0, "step": 21875 }, { "entropy": 5.504858016967773, "epoch": 1.9847605224963716, "grad_norm": 1.15625, "learning_rate": 0.00046063615541451177, "loss": 5.0181, "mean_token_accuracy": 0.20658082515001297, "num_tokens": 45409032.0, "step": 21880 }, { "entropy": 5.561472606658936, "epoch": 1.9852140783744558, "grad_norm": 1.03125, "learning_rate": 0.00046061787016540184, "loss": 5.1047, "mean_token_accuracy": 0.19895123094320297, "num_tokens": 45420661.0, "step": 21885 }, { "entropy": 5.490915203094483, "epoch": 1.98566763425254, "grad_norm": 1.2109375, "learning_rate": 0.00046059958107766706, "loss": 4.8524, "mean_token_accuracy": 0.2225732073187828, "num_tokens": 45429751.0, "step": 21890 }, { "entropy": 5.520289754867553, "epoch": 1.986121190130624, "grad_norm": 1.0859375, "learning_rate": 0.0004605812881516857, "loss": 4.987, "mean_token_accuracy": 0.2120147854089737, "num_tokens": 45439551.0, "step": 21895 }, { "entropy": 5.385705280303955, "epoch": 1.9865747460087082, "grad_norm": 1.1015625, "learning_rate": 0.00046056299138783595, "loss": 4.8789, "mean_token_accuracy": 0.22473577111959459, "num_tokens": 45449543.0, "step": 21900 }, { "entropy": 5.496645212173462, "epoch": 1.9870283018867925, "grad_norm": 1.1171875, "learning_rate": 0.0004605446907864963, "loss": 4.9825, "mean_token_accuracy": 0.21451092809438704, "num_tokens": 45459069.0, "step": 21905 }, { "entropy": 5.5340653419494625, "epoch": 1.9874818577648767, "grad_norm": 1.0, "learning_rate": 0.0004605263863480452, "loss": 5.0747, "mean_token_accuracy": 0.19922302067279815, "num_tokens": 45468987.0, "step": 21910 }, { "entropy": 5.538180208206176, "epoch": 1.9879354136429608, "grad_norm": 1.046875, "learning_rate": 0.00046050807807286105, "loss": 4.9851, "mean_token_accuracy": 0.2133519634604454, "num_tokens": 45479781.0, "step": 21915 }, { "entropy": 5.585193681716919, "epoch": 1.988388969521045, "grad_norm": 1.140625, "learning_rate": 0.00046048976596132265, "loss": 5.1169, "mean_token_accuracy": 0.19086560755968093, "num_tokens": 45490318.0, "step": 21920 }, { "entropy": 5.483713531494141, "epoch": 1.988842525399129, "grad_norm": 1.015625, "learning_rate": 0.00046047145001380856, "loss": 4.9361, "mean_token_accuracy": 0.2105340212583542, "num_tokens": 45501514.0, "step": 21925 }, { "entropy": 5.4879233837127686, "epoch": 1.9892960812772134, "grad_norm": 1.078125, "learning_rate": 0.00046045313023069764, "loss": 4.9676, "mean_token_accuracy": 0.21038736253976822, "num_tokens": 45511727.0, "step": 21930 }, { "entropy": 5.528943061828613, "epoch": 1.9897496371552976, "grad_norm": 1.0390625, "learning_rate": 0.0004604348066123688, "loss": 5.0453, "mean_token_accuracy": 0.20235438793897628, "num_tokens": 45521807.0, "step": 21935 }, { "entropy": 5.58302583694458, "epoch": 1.9902031930333817, "grad_norm": 1.03125, "learning_rate": 0.0004604164791592008, "loss": 5.0968, "mean_token_accuracy": 0.19826555103063584, "num_tokens": 45532033.0, "step": 21940 }, { "entropy": 5.517005348205567, "epoch": 1.990656748911466, "grad_norm": 1.0625, "learning_rate": 0.00046039814787157283, "loss": 5.0021, "mean_token_accuracy": 0.2091621235013008, "num_tokens": 45542806.0, "step": 21945 }, { "entropy": 5.467431116104126, "epoch": 1.99111030478955, "grad_norm": 1.1953125, "learning_rate": 0.0004603798127498639, "loss": 4.8896, "mean_token_accuracy": 0.22371553480625153, "num_tokens": 45551982.0, "step": 21950 }, { "entropy": 5.500916004180908, "epoch": 1.9915638606676342, "grad_norm": 1.0390625, "learning_rate": 0.0004603614737944532, "loss": 4.9889, "mean_token_accuracy": 0.20723975896835328, "num_tokens": 45561998.0, "step": 21955 }, { "entropy": 5.4483404636383055, "epoch": 1.9920174165457185, "grad_norm": 1.078125, "learning_rate": 0.00046034313100571994, "loss": 4.9793, "mean_token_accuracy": 0.20845555067062377, "num_tokens": 45572246.0, "step": 21960 }, { "entropy": 5.557849979400634, "epoch": 1.9924709724238028, "grad_norm": 0.99609375, "learning_rate": 0.0004603247843840436, "loss": 5.0065, "mean_token_accuracy": 0.20728835314512253, "num_tokens": 45582251.0, "step": 21965 }, { "entropy": 5.5004191398620605, "epoch": 1.9929245283018868, "grad_norm": 1.0625, "learning_rate": 0.0004603064339298034, "loss": 4.8992, "mean_token_accuracy": 0.2093706488609314, "num_tokens": 45592749.0, "step": 21970 }, { "entropy": 5.464179182052613, "epoch": 1.9933780841799709, "grad_norm": 1.078125, "learning_rate": 0.0004602880796433789, "loss": 4.9358, "mean_token_accuracy": 0.21098134964704512, "num_tokens": 45602412.0, "step": 21975 }, { "entropy": 5.523681259155273, "epoch": 1.9938316400580551, "grad_norm": 1.0625, "learning_rate": 0.00046026972152514976, "loss": 5.0041, "mean_token_accuracy": 0.20651887357234955, "num_tokens": 45612736.0, "step": 21980 }, { "entropy": 5.508471536636352, "epoch": 1.9942851959361394, "grad_norm": 1.046875, "learning_rate": 0.0004602513595754956, "loss": 4.995, "mean_token_accuracy": 0.20767152905464173, "num_tokens": 45622952.0, "step": 21985 }, { "entropy": 5.549241304397583, "epoch": 1.9947387518142237, "grad_norm": 1.1640625, "learning_rate": 0.00046023299379479606, "loss": 4.9995, "mean_token_accuracy": 0.20532257854938507, "num_tokens": 45633569.0, "step": 21990 }, { "entropy": 5.458420610427856, "epoch": 1.9951923076923077, "grad_norm": 1.125, "learning_rate": 0.00046021462418343104, "loss": 4.9562, "mean_token_accuracy": 0.21177952736616135, "num_tokens": 45644347.0, "step": 21995 }, { "entropy": 5.515032339096069, "epoch": 1.9956458635703918, "grad_norm": 1.1484375, "learning_rate": 0.0004601962507417804, "loss": 5.018, "mean_token_accuracy": 0.20814317166805268, "num_tokens": 45655268.0, "step": 22000 }, { "entropy": 5.488854789733887, "epoch": 1.996099419448476, "grad_norm": 1.109375, "learning_rate": 0.00046017787347022403, "loss": 4.9444, "mean_token_accuracy": 0.20772619992494584, "num_tokens": 45664900.0, "step": 22005 }, { "entropy": 5.526731061935425, "epoch": 1.9965529753265603, "grad_norm": 1.1171875, "learning_rate": 0.00046015949236914217, "loss": 5.0407, "mean_token_accuracy": 0.21357100754976271, "num_tokens": 45675252.0, "step": 22010 }, { "entropy": 5.5692308902740475, "epoch": 1.9970065312046446, "grad_norm": 1.109375, "learning_rate": 0.0004601411074389147, "loss": 4.9376, "mean_token_accuracy": 0.21583616733551025, "num_tokens": 45686027.0, "step": 22015 }, { "entropy": 5.4841132164001465, "epoch": 1.9974600870827286, "grad_norm": 1.1171875, "learning_rate": 0.000460122718679922, "loss": 4.9521, "mean_token_accuracy": 0.20540669709444045, "num_tokens": 45696436.0, "step": 22020 }, { "entropy": 5.511106491088867, "epoch": 1.9979136429608126, "grad_norm": 1.0546875, "learning_rate": 0.0004601043260925443, "loss": 5.0534, "mean_token_accuracy": 0.21106892377138137, "num_tokens": 45706509.0, "step": 22025 }, { "entropy": 5.539281511306763, "epoch": 1.998367198838897, "grad_norm": 1.03125, "learning_rate": 0.00046008592967716197, "loss": 5.0826, "mean_token_accuracy": 0.19876661598682405, "num_tokens": 45717933.0, "step": 22030 }, { "entropy": 5.515984582901001, "epoch": 1.9988207547169812, "grad_norm": 1.0078125, "learning_rate": 0.0004600675294341554, "loss": 5.0323, "mean_token_accuracy": 0.19881228655576705, "num_tokens": 45727966.0, "step": 22035 }, { "entropy": 5.528542995452881, "epoch": 1.9992743105950654, "grad_norm": 1.0625, "learning_rate": 0.00046004912536390526, "loss": 5.0017, "mean_token_accuracy": 0.20533232837915422, "num_tokens": 45737649.0, "step": 22040 }, { "entropy": 5.514850234985351, "epoch": 1.9997278664731495, "grad_norm": 1.125, "learning_rate": 0.000460030717466792, "loss": 4.9446, "mean_token_accuracy": 0.20659542232751846, "num_tokens": 45747561.0, "step": 22045 }, { "entropy": 5.46459813117981, "epoch": 2.0001814223512335, "grad_norm": 1.1015625, "learning_rate": 0.0004600123057431963, "loss": 4.9053, "mean_token_accuracy": 0.21400094628334046, "num_tokens": 45758183.0, "step": 22050 }, { "entropy": 5.480481052398682, "epoch": 2.000634978229318, "grad_norm": 1.1796875, "learning_rate": 0.000459993890193499, "loss": 4.8734, "mean_token_accuracy": 0.22108574956655502, "num_tokens": 45768006.0, "step": 22055 }, { "entropy": 5.55034327507019, "epoch": 2.001088534107402, "grad_norm": 1.0625, "learning_rate": 0.0004599754708180809, "loss": 5.0132, "mean_token_accuracy": 0.20299693793058396, "num_tokens": 45777981.0, "step": 22060 }, { "entropy": 5.518570852279663, "epoch": 2.0015420899854863, "grad_norm": 1.0234375, "learning_rate": 0.000459957047617323, "loss": 4.9216, "mean_token_accuracy": 0.20742516666650773, "num_tokens": 45789083.0, "step": 22065 }, { "entropy": 5.509594202041626, "epoch": 2.0019956458635706, "grad_norm": 1.171875, "learning_rate": 0.00045993862059160617, "loss": 4.8743, "mean_token_accuracy": 0.21316053420305253, "num_tokens": 45799750.0, "step": 22070 }, { "entropy": 5.464544439315796, "epoch": 2.0024492017416544, "grad_norm": 1.0625, "learning_rate": 0.0004599201897413116, "loss": 4.881, "mean_token_accuracy": 0.21451300084590913, "num_tokens": 45810321.0, "step": 22075 }, { "entropy": 5.412771844863892, "epoch": 2.0029027576197387, "grad_norm": 1.109375, "learning_rate": 0.00045990175506682024, "loss": 4.8571, "mean_token_accuracy": 0.2219959482550621, "num_tokens": 45820581.0, "step": 22080 }, { "entropy": 5.459510803222656, "epoch": 2.003356313497823, "grad_norm": 1.0, "learning_rate": 0.00045988331656851355, "loss": 4.9495, "mean_token_accuracy": 0.21032775193452835, "num_tokens": 45831504.0, "step": 22085 }, { "entropy": 5.509075069427491, "epoch": 2.003809869375907, "grad_norm": 1.0625, "learning_rate": 0.00045986487424677284, "loss": 4.9744, "mean_token_accuracy": 0.20583331286907197, "num_tokens": 45841100.0, "step": 22090 }, { "entropy": 5.528689241409301, "epoch": 2.0042634252539915, "grad_norm": 1.03125, "learning_rate": 0.0004598464281019793, "loss": 4.9468, "mean_token_accuracy": 0.21508843302726746, "num_tokens": 45851647.0, "step": 22095 }, { "entropy": 5.456178092956543, "epoch": 2.0047169811320753, "grad_norm": 1.0859375, "learning_rate": 0.00045982797813451463, "loss": 4.8579, "mean_token_accuracy": 0.21951217353343963, "num_tokens": 45862995.0, "step": 22100 }, { "entropy": 5.411767911911011, "epoch": 2.0051705370101596, "grad_norm": 1.125, "learning_rate": 0.00045980952434476014, "loss": 4.8822, "mean_token_accuracy": 0.20999489426612855, "num_tokens": 45872360.0, "step": 22105 }, { "entropy": 5.462488794326783, "epoch": 2.005624092888244, "grad_norm": 1.0, "learning_rate": 0.00045979106673309765, "loss": 4.959, "mean_token_accuracy": 0.20704466104507446, "num_tokens": 45883440.0, "step": 22110 }, { "entropy": 5.45153169631958, "epoch": 2.006077648766328, "grad_norm": 1.109375, "learning_rate": 0.00045977260529990883, "loss": 4.9214, "mean_token_accuracy": 0.2062060907483101, "num_tokens": 45894323.0, "step": 22115 }, { "entropy": 5.480880451202393, "epoch": 2.0065312046444124, "grad_norm": 1.0859375, "learning_rate": 0.0004597541400455755, "loss": 4.9627, "mean_token_accuracy": 0.20593496710062026, "num_tokens": 45904544.0, "step": 22120 }, { "entropy": 5.526825284957885, "epoch": 2.006984760522496, "grad_norm": 1.28125, "learning_rate": 0.00045973567097047933, "loss": 4.8468, "mean_token_accuracy": 0.23071294724941255, "num_tokens": 45913225.0, "step": 22125 }, { "entropy": 5.4859724044799805, "epoch": 2.0074383164005805, "grad_norm": 1.1484375, "learning_rate": 0.00045971719807500253, "loss": 4.9271, "mean_token_accuracy": 0.21513185799121856, "num_tokens": 45923306.0, "step": 22130 }, { "entropy": 5.442527914047242, "epoch": 2.0078918722786647, "grad_norm": 1.0703125, "learning_rate": 0.000459698721359527, "loss": 4.9092, "mean_token_accuracy": 0.21128465235233307, "num_tokens": 45933243.0, "step": 22135 }, { "entropy": 5.437540817260742, "epoch": 2.008345428156749, "grad_norm": 1.046875, "learning_rate": 0.0004596802408244348, "loss": 4.9696, "mean_token_accuracy": 0.21018754690885544, "num_tokens": 45944498.0, "step": 22140 }, { "entropy": 5.4187340259552, "epoch": 2.0087989840348333, "grad_norm": 1.0703125, "learning_rate": 0.0004596617564701081, "loss": 4.805, "mean_token_accuracy": 0.21613098531961442, "num_tokens": 45954550.0, "step": 22145 }, { "entropy": 5.540858745574951, "epoch": 2.009252539912917, "grad_norm": 1.0078125, "learning_rate": 0.00045964326829692925, "loss": 4.9747, "mean_token_accuracy": 0.20606791526079177, "num_tokens": 45965425.0, "step": 22150 }, { "entropy": 5.443374872207642, "epoch": 2.0097060957910013, "grad_norm": 1.0625, "learning_rate": 0.00045962477630528064, "loss": 4.8565, "mean_token_accuracy": 0.22071807086467743, "num_tokens": 45975637.0, "step": 22155 }, { "entropy": 5.432153749465942, "epoch": 2.0101596516690856, "grad_norm": 1.0546875, "learning_rate": 0.00045960628049554453, "loss": 4.9597, "mean_token_accuracy": 0.20494724810123444, "num_tokens": 45985268.0, "step": 22160 }, { "entropy": 5.440721940994263, "epoch": 2.01061320754717, "grad_norm": 1.1875, "learning_rate": 0.00045958778086810354, "loss": 4.8465, "mean_token_accuracy": 0.21323048025369645, "num_tokens": 45995335.0, "step": 22165 }, { "entropy": 5.484790372848511, "epoch": 2.011066763425254, "grad_norm": 1.125, "learning_rate": 0.0004595692774233402, "loss": 4.9267, "mean_token_accuracy": 0.20849782526493071, "num_tokens": 46006037.0, "step": 22170 }, { "entropy": 5.51012864112854, "epoch": 2.011520319303338, "grad_norm": 1.1171875, "learning_rate": 0.00045955077016163713, "loss": 4.8565, "mean_token_accuracy": 0.21440623104572296, "num_tokens": 46017016.0, "step": 22175 }, { "entropy": 5.553492593765259, "epoch": 2.0119738751814222, "grad_norm": 1.171875, "learning_rate": 0.00045953225908337717, "loss": 5.0193, "mean_token_accuracy": 0.20529192835092544, "num_tokens": 46026797.0, "step": 22180 }, { "entropy": 5.427034521102906, "epoch": 2.0124274310595065, "grad_norm": 1.015625, "learning_rate": 0.00045951374418894304, "loss": 4.8309, "mean_token_accuracy": 0.2171259731054306, "num_tokens": 46037799.0, "step": 22185 }, { "entropy": 5.457459783554077, "epoch": 2.0128809869375908, "grad_norm": 1.0390625, "learning_rate": 0.00045949522547871765, "loss": 4.8577, "mean_token_accuracy": 0.21180443912744523, "num_tokens": 46048617.0, "step": 22190 }, { "entropy": 5.501497077941894, "epoch": 2.013334542815675, "grad_norm": 1.0390625, "learning_rate": 0.000459476702953084, "loss": 4.921, "mean_token_accuracy": 0.21469594538211823, "num_tokens": 46060122.0, "step": 22195 }, { "entropy": 5.472378444671631, "epoch": 2.013788098693759, "grad_norm": 1.0859375, "learning_rate": 0.000459458176612425, "loss": 4.928, "mean_token_accuracy": 0.2141127973794937, "num_tokens": 46071488.0, "step": 22200 }, { "entropy": 5.553925323486328, "epoch": 2.014241654571843, "grad_norm": 0.984375, "learning_rate": 0.00045943964645712407, "loss": 4.9665, "mean_token_accuracy": 0.20472838580608368, "num_tokens": 46081954.0, "step": 22205 }, { "entropy": 5.5036547660827635, "epoch": 2.0146952104499274, "grad_norm": 1.09375, "learning_rate": 0.0004594211124875642, "loss": 4.8835, "mean_token_accuracy": 0.2147393763065338, "num_tokens": 46092488.0, "step": 22210 }, { "entropy": 5.413253545761108, "epoch": 2.0151487663280117, "grad_norm": 1.046875, "learning_rate": 0.0004594025747041287, "loss": 4.8861, "mean_token_accuracy": 0.21815194934606552, "num_tokens": 46102451.0, "step": 22215 }, { "entropy": 5.441384744644165, "epoch": 2.015602322206096, "grad_norm": 1.0625, "learning_rate": 0.000459384033107201, "loss": 4.9187, "mean_token_accuracy": 0.21631981134414674, "num_tokens": 46113862.0, "step": 22220 }, { "entropy": 5.5733143329620365, "epoch": 2.01605587808418, "grad_norm": 1.109375, "learning_rate": 0.0004593654876971645, "loss": 4.9842, "mean_token_accuracy": 0.20906862616539001, "num_tokens": 46124517.0, "step": 22225 }, { "entropy": 5.4340015888214115, "epoch": 2.016509433962264, "grad_norm": 1.1015625, "learning_rate": 0.0004593469384744027, "loss": 4.912, "mean_token_accuracy": 0.21289127171039582, "num_tokens": 46134221.0, "step": 22230 }, { "entropy": 5.480803680419922, "epoch": 2.0169629898403483, "grad_norm": 1.1484375, "learning_rate": 0.00045932838543929924, "loss": 4.9915, "mean_token_accuracy": 0.20713029205799102, "num_tokens": 46144512.0, "step": 22235 }, { "entropy": 5.501719570159912, "epoch": 2.0174165457184325, "grad_norm": 0.98828125, "learning_rate": 0.0004593098285922378, "loss": 4.9021, "mean_token_accuracy": 0.2086881324648857, "num_tokens": 46154373.0, "step": 22240 }, { "entropy": 5.558524036407471, "epoch": 2.017870101596517, "grad_norm": 1.1015625, "learning_rate": 0.0004592912679336021, "loss": 5.0166, "mean_token_accuracy": 0.2064037799835205, "num_tokens": 46164834.0, "step": 22245 }, { "entropy": 5.475487947463989, "epoch": 2.018323657474601, "grad_norm": 1.015625, "learning_rate": 0.0004592727034637761, "loss": 4.8636, "mean_token_accuracy": 0.21568524986505508, "num_tokens": 46174815.0, "step": 22250 }, { "entropy": 5.454462671279908, "epoch": 2.018777213352685, "grad_norm": 1.2421875, "learning_rate": 0.00045925413518314363, "loss": 4.9069, "mean_token_accuracy": 0.21128300875425338, "num_tokens": 46185155.0, "step": 22255 }, { "entropy": 5.4956889152526855, "epoch": 2.019230769230769, "grad_norm": 1.21875, "learning_rate": 0.0004592355630920886, "loss": 4.94, "mean_token_accuracy": 0.2127099871635437, "num_tokens": 46194537.0, "step": 22260 }, { "entropy": 5.5741795063018795, "epoch": 2.0196843251088534, "grad_norm": 1.125, "learning_rate": 0.00045921698719099527, "loss": 4.9714, "mean_token_accuracy": 0.21196166425943375, "num_tokens": 46205494.0, "step": 22265 }, { "entropy": 5.429159784317017, "epoch": 2.0201378809869377, "grad_norm": 1.015625, "learning_rate": 0.00045919840748024764, "loss": 4.8946, "mean_token_accuracy": 0.2178618535399437, "num_tokens": 46216399.0, "step": 22270 }, { "entropy": 5.426583003997803, "epoch": 2.020591436865022, "grad_norm": 1.109375, "learning_rate": 0.00045917982396023, "loss": 4.8725, "mean_token_accuracy": 0.21391150802373887, "num_tokens": 46226515.0, "step": 22275 }, { "entropy": 5.542899942398071, "epoch": 2.021044992743106, "grad_norm": 1.0703125, "learning_rate": 0.00045916123663132676, "loss": 4.964, "mean_token_accuracy": 0.20689981877803804, "num_tokens": 46236688.0, "step": 22280 }, { "entropy": 5.470803308486938, "epoch": 2.02149854862119, "grad_norm": 1.1015625, "learning_rate": 0.00045914264549392215, "loss": 4.8932, "mean_token_accuracy": 0.21992812007665635, "num_tokens": 46247166.0, "step": 22285 }, { "entropy": 5.492167997360229, "epoch": 2.0219521044992743, "grad_norm": 1.125, "learning_rate": 0.0004591240505484007, "loss": 4.9107, "mean_token_accuracy": 0.21752907186746598, "num_tokens": 46258902.0, "step": 22290 }, { "entropy": 5.525707244873047, "epoch": 2.0224056603773586, "grad_norm": 1.140625, "learning_rate": 0.00045910545179514694, "loss": 5.0053, "mean_token_accuracy": 0.20512161701917647, "num_tokens": 46269819.0, "step": 22295 }, { "entropy": 5.5949952602386475, "epoch": 2.022859216255443, "grad_norm": 0.94140625, "learning_rate": 0.0004590868492345455, "loss": 4.9816, "mean_token_accuracy": 0.21553308814764022, "num_tokens": 46280715.0, "step": 22300 }, { "entropy": 5.533560085296631, "epoch": 2.0233127721335267, "grad_norm": 1.140625, "learning_rate": 0.0004590682428669813, "loss": 4.9915, "mean_token_accuracy": 0.20288393795490264, "num_tokens": 46291079.0, "step": 22305 }, { "entropy": 5.500043725967407, "epoch": 2.023766328011611, "grad_norm": 1.140625, "learning_rate": 0.0004590496326928387, "loss": 4.9173, "mean_token_accuracy": 0.213050240278244, "num_tokens": 46301362.0, "step": 22310 }, { "entropy": 5.493936061859131, "epoch": 2.024219883889695, "grad_norm": 1.078125, "learning_rate": 0.00045903101871250295, "loss": 4.9088, "mean_token_accuracy": 0.21889467239379884, "num_tokens": 46311820.0, "step": 22315 }, { "entropy": 5.557138156890869, "epoch": 2.0246734397677795, "grad_norm": 1.09375, "learning_rate": 0.0004590124009263587, "loss": 4.9575, "mean_token_accuracy": 0.21402305066585542, "num_tokens": 46321992.0, "step": 22320 }, { "entropy": 5.493464040756225, "epoch": 2.0251269956458637, "grad_norm": 1.1171875, "learning_rate": 0.0004589937793347912, "loss": 4.9588, "mean_token_accuracy": 0.21023651510477065, "num_tokens": 46331537.0, "step": 22325 }, { "entropy": 5.493724393844604, "epoch": 2.0255805515239476, "grad_norm": 1.078125, "learning_rate": 0.00045897515393818547, "loss": 4.9146, "mean_token_accuracy": 0.20679419338703156, "num_tokens": 46342214.0, "step": 22330 }, { "entropy": 5.468299293518067, "epoch": 2.026034107402032, "grad_norm": 1.078125, "learning_rate": 0.0004589565247369266, "loss": 4.9112, "mean_token_accuracy": 0.2111467257142067, "num_tokens": 46352471.0, "step": 22335 }, { "entropy": 5.460948801040649, "epoch": 2.026487663280116, "grad_norm": 1.0859375, "learning_rate": 0.0004589378917314, "loss": 4.94, "mean_token_accuracy": 0.21209260672330857, "num_tokens": 46363221.0, "step": 22340 }, { "entropy": 5.4629148006439205, "epoch": 2.0269412191582004, "grad_norm": 1.0546875, "learning_rate": 0.00045891925492199087, "loss": 4.8072, "mean_token_accuracy": 0.22391250729560852, "num_tokens": 46373454.0, "step": 22345 }, { "entropy": 5.595673894882202, "epoch": 2.0273947750362846, "grad_norm": 1.1328125, "learning_rate": 0.0004589006143090847, "loss": 5.0733, "mean_token_accuracy": 0.20614026188850404, "num_tokens": 46384403.0, "step": 22350 }, { "entropy": 5.432787895202637, "epoch": 2.0278483309143684, "grad_norm": 1.2734375, "learning_rate": 0.00045888196989306697, "loss": 4.7967, "mean_token_accuracy": 0.22252882421016693, "num_tokens": 46393362.0, "step": 22355 }, { "entropy": 5.538713645935059, "epoch": 2.0283018867924527, "grad_norm": 1.0546875, "learning_rate": 0.0004588633216743232, "loss": 5.0104, "mean_token_accuracy": 0.2108989030122757, "num_tokens": 46405100.0, "step": 22360 }, { "entropy": 5.455027770996094, "epoch": 2.028755442670537, "grad_norm": 1.09375, "learning_rate": 0.00045884466965323914, "loss": 4.8502, "mean_token_accuracy": 0.21202486008405685, "num_tokens": 46415058.0, "step": 22365 }, { "entropy": 5.486629438400269, "epoch": 2.0292089985486212, "grad_norm": 1.0625, "learning_rate": 0.00045882601383020045, "loss": 4.9178, "mean_token_accuracy": 0.21323165893554688, "num_tokens": 46425863.0, "step": 22370 }, { "entropy": 5.498825359344482, "epoch": 2.0296625544267055, "grad_norm": 1.0234375, "learning_rate": 0.0004588073542055929, "loss": 4.9143, "mean_token_accuracy": 0.21583594381809235, "num_tokens": 46436172.0, "step": 22375 }, { "entropy": 5.526539707183838, "epoch": 2.0301161103047893, "grad_norm": 1.0859375, "learning_rate": 0.00045878869077980246, "loss": 4.9373, "mean_token_accuracy": 0.2084222838282585, "num_tokens": 46446717.0, "step": 22380 }, { "entropy": 5.527638721466064, "epoch": 2.0305696661828736, "grad_norm": 1.0703125, "learning_rate": 0.00045877002355321504, "loss": 4.9569, "mean_token_accuracy": 0.20316054821014404, "num_tokens": 46456944.0, "step": 22385 }, { "entropy": 5.521604347229004, "epoch": 2.031023222060958, "grad_norm": 1.140625, "learning_rate": 0.0004587513525262168, "loss": 5.0137, "mean_token_accuracy": 0.2060095727443695, "num_tokens": 46467231.0, "step": 22390 }, { "entropy": 5.458830881118774, "epoch": 2.031476777939042, "grad_norm": 1.1015625, "learning_rate": 0.00045873267769919364, "loss": 4.8622, "mean_token_accuracy": 0.21016845852136612, "num_tokens": 46477107.0, "step": 22395 }, { "entropy": 5.474247550964355, "epoch": 2.0319303338171264, "grad_norm": 1.0078125, "learning_rate": 0.0004587139990725319, "loss": 4.9137, "mean_token_accuracy": 0.21607415080070497, "num_tokens": 46487351.0, "step": 22400 }, { "entropy": 5.502768325805664, "epoch": 2.0323838896952107, "grad_norm": 1.0703125, "learning_rate": 0.0004586953166466179, "loss": 4.9377, "mean_token_accuracy": 0.21330981850624084, "num_tokens": 46497685.0, "step": 22405 }, { "entropy": 5.487029075622559, "epoch": 2.0328374455732945, "grad_norm": 1.1171875, "learning_rate": 0.0004586766304218379, "loss": 4.9355, "mean_token_accuracy": 0.20457724779844283, "num_tokens": 46507866.0, "step": 22410 }, { "entropy": 5.401696968078613, "epoch": 2.0332910014513788, "grad_norm": 1.046875, "learning_rate": 0.00045865794039857846, "loss": 4.8282, "mean_token_accuracy": 0.21892595440149307, "num_tokens": 46518797.0, "step": 22415 }, { "entropy": 5.48150782585144, "epoch": 2.033744557329463, "grad_norm": 1.15625, "learning_rate": 0.0004586392465772259, "loss": 4.9002, "mean_token_accuracy": 0.21555282175540924, "num_tokens": 46528759.0, "step": 22420 }, { "entropy": 5.560601282119751, "epoch": 2.0341981132075473, "grad_norm": 1.109375, "learning_rate": 0.00045862054895816703, "loss": 5.0347, "mean_token_accuracy": 0.19790460765361786, "num_tokens": 46539014.0, "step": 22425 }, { "entropy": 5.483238792419433, "epoch": 2.0346516690856316, "grad_norm": 1.125, "learning_rate": 0.0004586018475417884, "loss": 4.8892, "mean_token_accuracy": 0.2139499917626381, "num_tokens": 46548856.0, "step": 22430 }, { "entropy": 5.473536729812622, "epoch": 2.0351052249637154, "grad_norm": 1.015625, "learning_rate": 0.0004585831423284766, "loss": 4.8672, "mean_token_accuracy": 0.21415794640779495, "num_tokens": 46559164.0, "step": 22435 }, { "entropy": 5.486605215072632, "epoch": 2.0355587808417996, "grad_norm": 1.1171875, "learning_rate": 0.0004585644333186188, "loss": 4.9777, "mean_token_accuracy": 0.2078063130378723, "num_tokens": 46569793.0, "step": 22440 }, { "entropy": 5.477545547485351, "epoch": 2.036012336719884, "grad_norm": 1.1484375, "learning_rate": 0.00045854572051260166, "loss": 4.9349, "mean_token_accuracy": 0.20827910751104356, "num_tokens": 46580257.0, "step": 22445 }, { "entropy": 5.468678188323975, "epoch": 2.036465892597968, "grad_norm": 1.1171875, "learning_rate": 0.00045852700391081234, "loss": 4.9183, "mean_token_accuracy": 0.20818666964769364, "num_tokens": 46590297.0, "step": 22450 }, { "entropy": 5.461681509017945, "epoch": 2.0369194484760524, "grad_norm": 1.09375, "learning_rate": 0.0004585082835136378, "loss": 4.8845, "mean_token_accuracy": 0.2167753607034683, "num_tokens": 46600647.0, "step": 22455 }, { "entropy": 5.49242467880249, "epoch": 2.0373730043541363, "grad_norm": 1.1171875, "learning_rate": 0.0004584895593214652, "loss": 4.8943, "mean_token_accuracy": 0.21101376116275788, "num_tokens": 46610478.0, "step": 22460 }, { "entropy": 5.492039585113526, "epoch": 2.0378265602322205, "grad_norm": 1.0546875, "learning_rate": 0.00045847083133468164, "loss": 4.964, "mean_token_accuracy": 0.21080789268016814, "num_tokens": 46620159.0, "step": 22465 }, { "entropy": 5.493364334106445, "epoch": 2.038280116110305, "grad_norm": 1.140625, "learning_rate": 0.00045845209955367464, "loss": 4.9083, "mean_token_accuracy": 0.2189805641770363, "num_tokens": 46630555.0, "step": 22470 }, { "entropy": 5.516729116439819, "epoch": 2.038733671988389, "grad_norm": 1.1171875, "learning_rate": 0.00045843336397883146, "loss": 4.9849, "mean_token_accuracy": 0.20775813162326812, "num_tokens": 46640188.0, "step": 22475 }, { "entropy": 5.479578590393066, "epoch": 2.0391872278664733, "grad_norm": 1.125, "learning_rate": 0.0004584146246105396, "loss": 4.8869, "mean_token_accuracy": 0.21095136553049088, "num_tokens": 46650284.0, "step": 22480 }, { "entropy": 5.526302719116211, "epoch": 2.039640783744557, "grad_norm": 1.0859375, "learning_rate": 0.00045839588144918643, "loss": 4.9168, "mean_token_accuracy": 0.21497301161289215, "num_tokens": 46661466.0, "step": 22485 }, { "entropy": 5.508177757263184, "epoch": 2.0400943396226414, "grad_norm": 1.2578125, "learning_rate": 0.0004583771344951598, "loss": 4.9175, "mean_token_accuracy": 0.20957376956939697, "num_tokens": 46671683.0, "step": 22490 }, { "entropy": 5.469556903839111, "epoch": 2.0405478955007257, "grad_norm": 1.15625, "learning_rate": 0.00045835838374884733, "loss": 4.9621, "mean_token_accuracy": 0.20684552937746048, "num_tokens": 46681787.0, "step": 22495 }, { "entropy": 5.48986234664917, "epoch": 2.04100145137881, "grad_norm": 1.046875, "learning_rate": 0.00045833962921063665, "loss": 4.8977, "mean_token_accuracy": 0.2110169693827629, "num_tokens": 46692752.0, "step": 22500 }, { "entropy": 5.506281328201294, "epoch": 2.041455007256894, "grad_norm": 1.109375, "learning_rate": 0.00045832087088091574, "loss": 4.9304, "mean_token_accuracy": 0.2128895863890648, "num_tokens": 46702980.0, "step": 22505 }, { "entropy": 5.4788877964019775, "epoch": 2.041908563134978, "grad_norm": 1.15625, "learning_rate": 0.00045830210876007257, "loss": 4.8461, "mean_token_accuracy": 0.2124609351158142, "num_tokens": 46712281.0, "step": 22510 }, { "entropy": 5.463829183578492, "epoch": 2.0423621190130623, "grad_norm": 1.1640625, "learning_rate": 0.000458283342848495, "loss": 4.8865, "mean_token_accuracy": 0.21514485031366348, "num_tokens": 46722097.0, "step": 22515 }, { "entropy": 5.388540363311767, "epoch": 2.0428156748911466, "grad_norm": 1.203125, "learning_rate": 0.0004582645731465713, "loss": 4.8145, "mean_token_accuracy": 0.22377265691757203, "num_tokens": 46733056.0, "step": 22520 }, { "entropy": 5.39781084060669, "epoch": 2.043269230769231, "grad_norm": 1.03125, "learning_rate": 0.00045824579965468944, "loss": 4.8773, "mean_token_accuracy": 0.2160139337182045, "num_tokens": 46742608.0, "step": 22525 }, { "entropy": 5.436618804931641, "epoch": 2.043722786647315, "grad_norm": 1.15625, "learning_rate": 0.00045822702237323777, "loss": 4.8504, "mean_token_accuracy": 0.22209740430116653, "num_tokens": 46751762.0, "step": 22530 }, { "entropy": 5.444215440750122, "epoch": 2.044176342525399, "grad_norm": 1.7890625, "learning_rate": 0.00045820824130260457, "loss": 4.8622, "mean_token_accuracy": 0.2185160905122757, "num_tokens": 46762252.0, "step": 22535 }, { "entropy": 5.471076488494873, "epoch": 2.044629898403483, "grad_norm": 1.1875, "learning_rate": 0.0004581894564431783, "loss": 4.9378, "mean_token_accuracy": 0.20716733634471893, "num_tokens": 46772172.0, "step": 22540 }, { "entropy": 5.489015817642212, "epoch": 2.0450834542815675, "grad_norm": 1.0546875, "learning_rate": 0.0004581706677953473, "loss": 4.923, "mean_token_accuracy": 0.21070101708173752, "num_tokens": 46782894.0, "step": 22545 }, { "entropy": 5.472652006149292, "epoch": 2.0455370101596517, "grad_norm": 1.0234375, "learning_rate": 0.00045815187535950034, "loss": 4.9301, "mean_token_accuracy": 0.21281129419803618, "num_tokens": 46793097.0, "step": 22550 }, { "entropy": 5.5373883724212645, "epoch": 2.045990566037736, "grad_norm": 1.03125, "learning_rate": 0.00045813307913602586, "loss": 5.027, "mean_token_accuracy": 0.1990057036280632, "num_tokens": 46804196.0, "step": 22555 }, { "entropy": 5.524840545654297, "epoch": 2.04644412191582, "grad_norm": 1.09375, "learning_rate": 0.0004581142791253126, "loss": 4.9132, "mean_token_accuracy": 0.20842732787132262, "num_tokens": 46813985.0, "step": 22560 }, { "entropy": 5.425367116928101, "epoch": 2.046897677793904, "grad_norm": 1.0625, "learning_rate": 0.00045809547532774943, "loss": 4.8283, "mean_token_accuracy": 0.20991829484701158, "num_tokens": 46824125.0, "step": 22565 }, { "entropy": 5.442494964599609, "epoch": 2.0473512336719883, "grad_norm": 1.109375, "learning_rate": 0.00045807666774372514, "loss": 4.8712, "mean_token_accuracy": 0.21538679748773576, "num_tokens": 46834982.0, "step": 22570 }, { "entropy": 5.47568154335022, "epoch": 2.0478047895500726, "grad_norm": 1.0703125, "learning_rate": 0.00045805785637362874, "loss": 4.8393, "mean_token_accuracy": 0.22492958307266236, "num_tokens": 46844669.0, "step": 22575 }, { "entropy": 5.484006261825561, "epoch": 2.048258345428157, "grad_norm": 1.046875, "learning_rate": 0.0004580390412178492, "loss": 4.9515, "mean_token_accuracy": 0.21772030889987945, "num_tokens": 46855108.0, "step": 22580 }, { "entropy": 5.465361642837524, "epoch": 2.048711901306241, "grad_norm": 1.125, "learning_rate": 0.00045802022227677566, "loss": 4.8518, "mean_token_accuracy": 0.21798664778470994, "num_tokens": 46864878.0, "step": 22585 }, { "entropy": 5.4708630561828615, "epoch": 2.049165457184325, "grad_norm": 1.125, "learning_rate": 0.00045800139955079727, "loss": 4.942, "mean_token_accuracy": 0.21026579439640045, "num_tokens": 46874916.0, "step": 22590 }, { "entropy": 5.517731666564941, "epoch": 2.0496190130624092, "grad_norm": 1.0859375, "learning_rate": 0.0004579825730403033, "loss": 4.9957, "mean_token_accuracy": 0.20373817533254623, "num_tokens": 46885167.0, "step": 22595 }, { "entropy": 5.548223352432251, "epoch": 2.0500725689404935, "grad_norm": 1.0625, "learning_rate": 0.0004579637427456831, "loss": 4.9352, "mean_token_accuracy": 0.20912650376558303, "num_tokens": 46895526.0, "step": 22600 }, { "entropy": 5.44613356590271, "epoch": 2.0505261248185778, "grad_norm": 1.171875, "learning_rate": 0.00045794490866732607, "loss": 4.9069, "mean_token_accuracy": 0.2139369800686836, "num_tokens": 46905426.0, "step": 22605 }, { "entropy": 5.452028369903564, "epoch": 2.050979680696662, "grad_norm": 1.078125, "learning_rate": 0.0004579260708056217, "loss": 4.9353, "mean_token_accuracy": 0.20866733342409133, "num_tokens": 46915728.0, "step": 22610 }, { "entropy": 5.445578145980835, "epoch": 2.051433236574746, "grad_norm": 1.125, "learning_rate": 0.0004579072291609596, "loss": 4.8802, "mean_token_accuracy": 0.21575091928243637, "num_tokens": 46925972.0, "step": 22615 }, { "entropy": 5.48175277709961, "epoch": 2.05188679245283, "grad_norm": 1.1640625, "learning_rate": 0.00045788838373372935, "loss": 4.9045, "mean_token_accuracy": 0.21737487614154816, "num_tokens": 46937108.0, "step": 22620 }, { "entropy": 5.448115539550781, "epoch": 2.0523403483309144, "grad_norm": 1.1328125, "learning_rate": 0.00045786953452432076, "loss": 4.8713, "mean_token_accuracy": 0.2131539911031723, "num_tokens": 46947684.0, "step": 22625 }, { "entropy": 5.543088340759278, "epoch": 2.0527939042089987, "grad_norm": 1.078125, "learning_rate": 0.0004578506815331236, "loss": 4.9803, "mean_token_accuracy": 0.208010733127594, "num_tokens": 46958089.0, "step": 22630 }, { "entropy": 5.48493013381958, "epoch": 2.053247460087083, "grad_norm": 1.1015625, "learning_rate": 0.0004578318247605277, "loss": 4.8793, "mean_token_accuracy": 0.2187783345580101, "num_tokens": 46968618.0, "step": 22635 }, { "entropy": 5.49419641494751, "epoch": 2.0537010159651667, "grad_norm": 1.0234375, "learning_rate": 0.0004578129642069231, "loss": 4.9073, "mean_token_accuracy": 0.21490394771099092, "num_tokens": 46978791.0, "step": 22640 }, { "entropy": 5.460851430892944, "epoch": 2.054154571843251, "grad_norm": 1.0859375, "learning_rate": 0.0004577940998726998, "loss": 4.8519, "mean_token_accuracy": 0.21549999266862868, "num_tokens": 46988706.0, "step": 22645 }, { "entropy": 5.566716861724854, "epoch": 2.0546081277213353, "grad_norm": 1.0078125, "learning_rate": 0.00045777523175824796, "loss": 5.0376, "mean_token_accuracy": 0.19761423468589784, "num_tokens": 47000140.0, "step": 22650 }, { "entropy": 5.49652214050293, "epoch": 2.0550616835994195, "grad_norm": 1.03125, "learning_rate": 0.0004577563598639577, "loss": 4.8768, "mean_token_accuracy": 0.21478489637374878, "num_tokens": 47009773.0, "step": 22655 }, { "entropy": 5.541280889511109, "epoch": 2.055515239477504, "grad_norm": 1.0859375, "learning_rate": 0.00045773748419021944, "loss": 4.9528, "mean_token_accuracy": 0.20578388422727584, "num_tokens": 47020326.0, "step": 22660 }, { "entropy": 5.4121160984039305, "epoch": 2.0559687953555876, "grad_norm": 1.0390625, "learning_rate": 0.00045771860473742347, "loss": 4.8971, "mean_token_accuracy": 0.20739168226718901, "num_tokens": 47030410.0, "step": 22665 }, { "entropy": 5.486596632003784, "epoch": 2.056422351233672, "grad_norm": 1.171875, "learning_rate": 0.00045769972150596006, "loss": 4.9247, "mean_token_accuracy": 0.21051902920007706, "num_tokens": 47040546.0, "step": 22670 }, { "entropy": 5.490625810623169, "epoch": 2.056875907111756, "grad_norm": 1.203125, "learning_rate": 0.00045768083449621987, "loss": 4.8826, "mean_token_accuracy": 0.2249297946691513, "num_tokens": 47050210.0, "step": 22675 }, { "entropy": 5.571322011947632, "epoch": 2.0573294629898404, "grad_norm": 1.125, "learning_rate": 0.00045766194370859347, "loss": 5.0459, "mean_token_accuracy": 0.20076712518930434, "num_tokens": 47060641.0, "step": 22680 }, { "entropy": 5.506687164306641, "epoch": 2.0577830188679247, "grad_norm": 1.0703125, "learning_rate": 0.0004576430491434716, "loss": 4.9662, "mean_token_accuracy": 0.21023054271936417, "num_tokens": 47070737.0, "step": 22685 }, { "entropy": 5.535109186172486, "epoch": 2.0582365747460085, "grad_norm": 1.09375, "learning_rate": 0.00045762415080124487, "loss": 4.9395, "mean_token_accuracy": 0.211958584189415, "num_tokens": 47080884.0, "step": 22690 }, { "entropy": 5.453709077835083, "epoch": 2.058690130624093, "grad_norm": 1.125, "learning_rate": 0.00045760524868230417, "loss": 4.9797, "mean_token_accuracy": 0.2075933963060379, "num_tokens": 47090865.0, "step": 22695 }, { "entropy": 5.488585186004639, "epoch": 2.059143686502177, "grad_norm": 1.109375, "learning_rate": 0.0004575863427870404, "loss": 4.9202, "mean_token_accuracy": 0.21432511061429976, "num_tokens": 47100570.0, "step": 22700 }, { "entropy": 5.477503395080566, "epoch": 2.0595972423802613, "grad_norm": 1.078125, "learning_rate": 0.0004575674331158446, "loss": 4.9105, "mean_token_accuracy": 0.2190001592040062, "num_tokens": 47111199.0, "step": 22705 }, { "entropy": 5.463322114944458, "epoch": 2.0600507982583456, "grad_norm": 1.125, "learning_rate": 0.0004575485196691076, "loss": 4.9078, "mean_token_accuracy": 0.21376549303531647, "num_tokens": 47121191.0, "step": 22710 }, { "entropy": 5.524882221221924, "epoch": 2.0605043541364294, "grad_norm": 1.0234375, "learning_rate": 0.0004575296024472209, "loss": 4.9501, "mean_token_accuracy": 0.21664262413978577, "num_tokens": 47131608.0, "step": 22715 }, { "entropy": 5.566353893280029, "epoch": 2.0609579100145137, "grad_norm": 1.1328125, "learning_rate": 0.0004575106814505753, "loss": 4.9454, "mean_token_accuracy": 0.20247257351875306, "num_tokens": 47141492.0, "step": 22720 }, { "entropy": 5.465687274932861, "epoch": 2.061411465892598, "grad_norm": 1.0390625, "learning_rate": 0.0004574917566795624, "loss": 4.8077, "mean_token_accuracy": 0.2244683638215065, "num_tokens": 47152576.0, "step": 22725 }, { "entropy": 5.508010625839233, "epoch": 2.061865021770682, "grad_norm": 1.1484375, "learning_rate": 0.00045747282813457345, "loss": 4.9477, "mean_token_accuracy": 0.2109052613377571, "num_tokens": 47163863.0, "step": 22730 }, { "entropy": 5.472030591964722, "epoch": 2.0623185776487665, "grad_norm": 1.171875, "learning_rate": 0.000457453895816, "loss": 4.8826, "mean_token_accuracy": 0.21333328485488892, "num_tokens": 47174140.0, "step": 22735 }, { "entropy": 5.50460844039917, "epoch": 2.0627721335268503, "grad_norm": 1.0703125, "learning_rate": 0.00045743495972423346, "loss": 4.9525, "mean_token_accuracy": 0.209660504758358, "num_tokens": 47184708.0, "step": 22740 }, { "entropy": 5.4794152736663815, "epoch": 2.0632256894049346, "grad_norm": 1.015625, "learning_rate": 0.0004574160198596653, "loss": 4.9111, "mean_token_accuracy": 0.21145080626010895, "num_tokens": 47196286.0, "step": 22745 }, { "entropy": 5.394988393783569, "epoch": 2.063679245283019, "grad_norm": 1.125, "learning_rate": 0.00045739707622268757, "loss": 4.8529, "mean_token_accuracy": 0.2230606883764267, "num_tokens": 47206774.0, "step": 22750 }, { "entropy": 5.435655879974365, "epoch": 2.064132801161103, "grad_norm": 1.046875, "learning_rate": 0.0004573781288136917, "loss": 4.7897, "mean_token_accuracy": 0.22175561040639877, "num_tokens": 47217009.0, "step": 22755 }, { "entropy": 5.491229295730591, "epoch": 2.0645863570391874, "grad_norm": 1.1484375, "learning_rate": 0.00045735917763306967, "loss": 4.9302, "mean_token_accuracy": 0.20813517570495604, "num_tokens": 47226718.0, "step": 22760 }, { "entropy": 5.442124891281128, "epoch": 2.065039912917271, "grad_norm": 1.0625, "learning_rate": 0.0004573402226812134, "loss": 4.8108, "mean_token_accuracy": 0.21806750148534776, "num_tokens": 47237666.0, "step": 22765 }, { "entropy": 5.477184247970581, "epoch": 2.0654934687953554, "grad_norm": 1.0390625, "learning_rate": 0.00045732126395851483, "loss": 4.9487, "mean_token_accuracy": 0.20914516746997833, "num_tokens": 47249230.0, "step": 22770 }, { "entropy": 5.457957029342651, "epoch": 2.0659470246734397, "grad_norm": 1.1328125, "learning_rate": 0.0004573023014653661, "loss": 4.8747, "mean_token_accuracy": 0.22038664072751998, "num_tokens": 47259232.0, "step": 22775 }, { "entropy": 5.473471641540527, "epoch": 2.066400580551524, "grad_norm": 1.09375, "learning_rate": 0.00045728333520215933, "loss": 4.9232, "mean_token_accuracy": 0.20911433398723603, "num_tokens": 47269006.0, "step": 22780 }, { "entropy": 5.531424236297608, "epoch": 2.0668541364296082, "grad_norm": 1.0625, "learning_rate": 0.0004572643651692867, "loss": 5.016, "mean_token_accuracy": 0.20064657181501389, "num_tokens": 47280048.0, "step": 22785 }, { "entropy": 5.4775042057037355, "epoch": 2.0673076923076925, "grad_norm": 1.1953125, "learning_rate": 0.00045724539136714063, "loss": 4.8474, "mean_token_accuracy": 0.21167343258857726, "num_tokens": 47290019.0, "step": 22790 }, { "entropy": 5.484529304504394, "epoch": 2.0677612481857763, "grad_norm": 1.0859375, "learning_rate": 0.0004572264137961133, "loss": 4.8878, "mean_token_accuracy": 0.21879397034645082, "num_tokens": 47300573.0, "step": 22795 }, { "entropy": 5.461075973510742, "epoch": 2.0682148040638606, "grad_norm": 1.046875, "learning_rate": 0.00045720743245659734, "loss": 4.9032, "mean_token_accuracy": 0.21219272762537003, "num_tokens": 47311795.0, "step": 22800 }, { "entropy": 5.426529455184936, "epoch": 2.068668359941945, "grad_norm": 1.140625, "learning_rate": 0.0004571884473489853, "loss": 4.8025, "mean_token_accuracy": 0.22498297840356826, "num_tokens": 47321768.0, "step": 22805 }, { "entropy": 5.491577863693237, "epoch": 2.069121915820029, "grad_norm": 1.1171875, "learning_rate": 0.0004571694584736696, "loss": 4.9718, "mean_token_accuracy": 0.2167012944817543, "num_tokens": 47332662.0, "step": 22810 }, { "entropy": 5.483455753326416, "epoch": 2.0695754716981134, "grad_norm": 1.0390625, "learning_rate": 0.0004571504658310432, "loss": 4.8846, "mean_token_accuracy": 0.21651652455329895, "num_tokens": 47344355.0, "step": 22815 }, { "entropy": 5.48982720375061, "epoch": 2.0700290275761972, "grad_norm": 1.1171875, "learning_rate": 0.0004571314694214987, "loss": 4.8651, "mean_token_accuracy": 0.21297242790460585, "num_tokens": 47354228.0, "step": 22820 }, { "entropy": 5.463857889175415, "epoch": 2.0704825834542815, "grad_norm": 1.1015625, "learning_rate": 0.0004571124692454291, "loss": 4.8969, "mean_token_accuracy": 0.22278206348419188, "num_tokens": 47364477.0, "step": 22825 }, { "entropy": 5.5134130954742435, "epoch": 2.0709361393323658, "grad_norm": 1.046875, "learning_rate": 0.00045709346530322715, "loss": 4.9685, "mean_token_accuracy": 0.2120780035853386, "num_tokens": 47375745.0, "step": 22830 }, { "entropy": 5.497640466690063, "epoch": 2.07138969521045, "grad_norm": 1.0390625, "learning_rate": 0.0004570744575952859, "loss": 4.9926, "mean_token_accuracy": 0.2155940890312195, "num_tokens": 47385341.0, "step": 22835 }, { "entropy": 5.474624919891357, "epoch": 2.0718432510885343, "grad_norm": 1.125, "learning_rate": 0.0004570554461219985, "loss": 4.905, "mean_token_accuracy": 0.21767914444208145, "num_tokens": 47396266.0, "step": 22840 }, { "entropy": 5.512789726257324, "epoch": 2.072296806966618, "grad_norm": 1.1171875, "learning_rate": 0.00045703643088375806, "loss": 4.9226, "mean_token_accuracy": 0.21131039559841155, "num_tokens": 47406772.0, "step": 22845 }, { "entropy": 5.516601085662842, "epoch": 2.0727503628447024, "grad_norm": 1.0546875, "learning_rate": 0.00045701741188095793, "loss": 5.0015, "mean_token_accuracy": 0.20497196167707443, "num_tokens": 47416833.0, "step": 22850 }, { "entropy": 5.445116949081421, "epoch": 2.0732039187227866, "grad_norm": 1.078125, "learning_rate": 0.0004569983891139912, "loss": 4.8818, "mean_token_accuracy": 0.2162475824356079, "num_tokens": 47426954.0, "step": 22855 }, { "entropy": 5.447731828689575, "epoch": 2.073657474600871, "grad_norm": 1.0546875, "learning_rate": 0.00045697936258325155, "loss": 4.8508, "mean_token_accuracy": 0.22146638333797455, "num_tokens": 47437520.0, "step": 22860 }, { "entropy": 5.453663635253906, "epoch": 2.074111030478955, "grad_norm": 1.1484375, "learning_rate": 0.00045696033228913226, "loss": 4.8731, "mean_token_accuracy": 0.2159669116139412, "num_tokens": 47447977.0, "step": 22865 }, { "entropy": 5.5334813594818115, "epoch": 2.074564586357039, "grad_norm": 1.1015625, "learning_rate": 0.00045694129823202684, "loss": 4.9676, "mean_token_accuracy": 0.2063072517514229, "num_tokens": 47458458.0, "step": 22870 }, { "entropy": 5.5341509819030765, "epoch": 2.0750181422351233, "grad_norm": 1.1171875, "learning_rate": 0.0004569222604123291, "loss": 4.9467, "mean_token_accuracy": 0.21012024879455565, "num_tokens": 47469048.0, "step": 22875 }, { "entropy": 5.516000175476075, "epoch": 2.0754716981132075, "grad_norm": 1.0625, "learning_rate": 0.0004569032188304326, "loss": 4.9619, "mean_token_accuracy": 0.20815815329551696, "num_tokens": 47480353.0, "step": 22880 }, { "entropy": 5.423048639297486, "epoch": 2.075925253991292, "grad_norm": 1.1875, "learning_rate": 0.0004568841734867313, "loss": 4.8067, "mean_token_accuracy": 0.21712733060121536, "num_tokens": 47489951.0, "step": 22885 }, { "entropy": 5.431924533843994, "epoch": 2.076378809869376, "grad_norm": 1.171875, "learning_rate": 0.0004568651243816188, "loss": 4.8809, "mean_token_accuracy": 0.21959687322378157, "num_tokens": 47499015.0, "step": 22890 }, { "entropy": 5.487962532043457, "epoch": 2.07683236574746, "grad_norm": 1.171875, "learning_rate": 0.00045684607151548923, "loss": 4.9124, "mean_token_accuracy": 0.21256985366344452, "num_tokens": 47508694.0, "step": 22895 }, { "entropy": 5.645472764968872, "epoch": 2.077285921625544, "grad_norm": 0.98828125, "learning_rate": 0.00045682701488873655, "loss": 5.0518, "mean_token_accuracy": 0.20268099755048752, "num_tokens": 47521336.0, "step": 22900 }, { "entropy": 5.54237585067749, "epoch": 2.0777394775036284, "grad_norm": 1.0703125, "learning_rate": 0.0004568079545017549, "loss": 5.0525, "mean_token_accuracy": 0.20089402943849563, "num_tokens": 47531857.0, "step": 22905 }, { "entropy": 5.5057131290435795, "epoch": 2.0781930333817127, "grad_norm": 1.2734375, "learning_rate": 0.0004567888903549385, "loss": 4.9271, "mean_token_accuracy": 0.2058774784207344, "num_tokens": 47542224.0, "step": 22910 }, { "entropy": 5.49770302772522, "epoch": 2.078646589259797, "grad_norm": 1.171875, "learning_rate": 0.0004567698224486813, "loss": 4.9459, "mean_token_accuracy": 0.21274778246879578, "num_tokens": 47552370.0, "step": 22915 }, { "entropy": 5.597073554992676, "epoch": 2.0791001451378808, "grad_norm": 1.125, "learning_rate": 0.00045675075078337803, "loss": 4.9093, "mean_token_accuracy": 0.21762989908456803, "num_tokens": 47561997.0, "step": 22920 }, { "entropy": 5.521228837966919, "epoch": 2.079553701015965, "grad_norm": 1.0546875, "learning_rate": 0.0004567316753594229, "loss": 4.9305, "mean_token_accuracy": 0.21692138016223908, "num_tokens": 47571968.0, "step": 22925 }, { "entropy": 5.503274202346802, "epoch": 2.0800072568940493, "grad_norm": 1.0859375, "learning_rate": 0.00045671259617721037, "loss": 4.9512, "mean_token_accuracy": 0.20989677608013152, "num_tokens": 47583459.0, "step": 22930 }, { "entropy": 5.4500175476074215, "epoch": 2.0804608127721336, "grad_norm": 1.0859375, "learning_rate": 0.000456693513237135, "loss": 4.8654, "mean_token_accuracy": 0.21740245819091797, "num_tokens": 47594026.0, "step": 22935 }, { "entropy": 5.546015691757202, "epoch": 2.080914368650218, "grad_norm": 1.1171875, "learning_rate": 0.0004566744265395916, "loss": 4.9343, "mean_token_accuracy": 0.2143869146704674, "num_tokens": 47605246.0, "step": 22940 }, { "entropy": 5.513857746124268, "epoch": 2.081367924528302, "grad_norm": 1.0625, "learning_rate": 0.00045665533608497467, "loss": 4.9908, "mean_token_accuracy": 0.20220822542905809, "num_tokens": 47616702.0, "step": 22945 }, { "entropy": 5.541510677337646, "epoch": 2.081821480406386, "grad_norm": 1.0703125, "learning_rate": 0.00045663624187367914, "loss": 4.9729, "mean_token_accuracy": 0.2058124527335167, "num_tokens": 47627616.0, "step": 22950 }, { "entropy": 5.491442155838013, "epoch": 2.08227503628447, "grad_norm": 1.09375, "learning_rate": 0.0004566171439060998, "loss": 4.8934, "mean_token_accuracy": 0.21114227920770645, "num_tokens": 47637287.0, "step": 22955 }, { "entropy": 5.446555089950562, "epoch": 2.0827285921625545, "grad_norm": 1.03125, "learning_rate": 0.0004565980421826317, "loss": 4.9271, "mean_token_accuracy": 0.20941709578037263, "num_tokens": 47647474.0, "step": 22960 }, { "entropy": 5.5255317211151125, "epoch": 2.0831821480406387, "grad_norm": 1.1640625, "learning_rate": 0.0004565789367036697, "loss": 4.9568, "mean_token_accuracy": 0.2142787531018257, "num_tokens": 47657036.0, "step": 22965 }, { "entropy": 5.480075216293335, "epoch": 2.083635703918723, "grad_norm": 1.09375, "learning_rate": 0.0004565598274696091, "loss": 4.8425, "mean_token_accuracy": 0.21526095867156983, "num_tokens": 47668026.0, "step": 22970 }, { "entropy": 5.564390563964844, "epoch": 2.084089259796807, "grad_norm": 1.0546875, "learning_rate": 0.00045654071448084506, "loss": 5.0032, "mean_token_accuracy": 0.20536720901727676, "num_tokens": 47679508.0, "step": 22975 }, { "entropy": 5.525553560256958, "epoch": 2.084542815674891, "grad_norm": 1.140625, "learning_rate": 0.00045652159773777273, "loss": 4.9464, "mean_token_accuracy": 0.21098029166460036, "num_tokens": 47688474.0, "step": 22980 }, { "entropy": 5.596520280838012, "epoch": 2.0849963715529753, "grad_norm": 1.0625, "learning_rate": 0.0004565024772407875, "loss": 5.0933, "mean_token_accuracy": 0.19464746564626695, "num_tokens": 47698675.0, "step": 22985 }, { "entropy": 5.4251062870025635, "epoch": 2.0854499274310596, "grad_norm": 1.203125, "learning_rate": 0.0004564833529902848, "loss": 4.8456, "mean_token_accuracy": 0.22778284996747972, "num_tokens": 47709214.0, "step": 22990 }, { "entropy": 5.52123646736145, "epoch": 2.085903483309144, "grad_norm": 1.140625, "learning_rate": 0.00045646422498666, "loss": 4.9863, "mean_token_accuracy": 0.2125869482755661, "num_tokens": 47721000.0, "step": 22995 }, { "entropy": 5.458207416534424, "epoch": 2.0863570391872277, "grad_norm": 1.140625, "learning_rate": 0.00045644509323030893, "loss": 4.9124, "mean_token_accuracy": 0.2120954141020775, "num_tokens": 47731218.0, "step": 23000 }, { "entropy": 5.515310430526734, "epoch": 2.086810595065312, "grad_norm": 1.0859375, "learning_rate": 0.00045642595772162704, "loss": 4.9059, "mean_token_accuracy": 0.2121683418750763, "num_tokens": 47742339.0, "step": 23005 }, { "entropy": 5.528716516494751, "epoch": 2.0872641509433962, "grad_norm": 1.109375, "learning_rate": 0.00045640681846101014, "loss": 4.9717, "mean_token_accuracy": 0.213791923224926, "num_tokens": 47752858.0, "step": 23010 }, { "entropy": 5.393567991256714, "epoch": 2.0877177068214805, "grad_norm": 1.09375, "learning_rate": 0.0004563876754488539, "loss": 4.8539, "mean_token_accuracy": 0.21912543922662736, "num_tokens": 47763303.0, "step": 23015 }, { "entropy": 5.465265083312988, "epoch": 2.0881712626995648, "grad_norm": 1.078125, "learning_rate": 0.0004563685286855544, "loss": 4.8967, "mean_token_accuracy": 0.2120954841375351, "num_tokens": 47773212.0, "step": 23020 }, { "entropy": 5.570278692245483, "epoch": 2.0886248185776486, "grad_norm": 1.1875, "learning_rate": 0.0004563493781715075, "loss": 5.0212, "mean_token_accuracy": 0.21023815274238586, "num_tokens": 47783376.0, "step": 23025 }, { "entropy": 5.452899408340454, "epoch": 2.089078374455733, "grad_norm": 1.0859375, "learning_rate": 0.0004563302239071093, "loss": 4.9216, "mean_token_accuracy": 0.214186891913414, "num_tokens": 47794859.0, "step": 23030 }, { "entropy": 5.523024034500122, "epoch": 2.089531930333817, "grad_norm": 1.15625, "learning_rate": 0.00045631106589275576, "loss": 4.9326, "mean_token_accuracy": 0.2159760430455208, "num_tokens": 47804721.0, "step": 23035 }, { "entropy": 5.471039724349976, "epoch": 2.0899854862119014, "grad_norm": 1.09375, "learning_rate": 0.00045629190412884324, "loss": 4.8192, "mean_token_accuracy": 0.21751789152622222, "num_tokens": 47814701.0, "step": 23040 }, { "entropy": 5.470632553100586, "epoch": 2.0904390420899857, "grad_norm": 1.0859375, "learning_rate": 0.00045627273861576786, "loss": 4.8759, "mean_token_accuracy": 0.21244453638792038, "num_tokens": 47823941.0, "step": 23045 }, { "entropy": 5.482703065872192, "epoch": 2.0908925979680695, "grad_norm": 1.078125, "learning_rate": 0.00045625356935392614, "loss": 4.9149, "mean_token_accuracy": 0.21367649734020233, "num_tokens": 47835793.0, "step": 23050 }, { "entropy": 5.536644554138183, "epoch": 2.0913461538461537, "grad_norm": 1.1171875, "learning_rate": 0.0004562343963437144, "loss": 4.975, "mean_token_accuracy": 0.2123349905014038, "num_tokens": 47845677.0, "step": 23055 }, { "entropy": 5.510829067230224, "epoch": 2.091799709724238, "grad_norm": 1.109375, "learning_rate": 0.0004562152195855291, "loss": 4.8832, "mean_token_accuracy": 0.22265082895755767, "num_tokens": 47855611.0, "step": 23060 }, { "entropy": 5.4408656597137455, "epoch": 2.0922532656023223, "grad_norm": 1.125, "learning_rate": 0.0004561960390797669, "loss": 4.9331, "mean_token_accuracy": 0.21240527480840682, "num_tokens": 47865115.0, "step": 23065 }, { "entropy": 5.5532386302948, "epoch": 2.0927068214804065, "grad_norm": 1.0546875, "learning_rate": 0.00045617685482682454, "loss": 4.9937, "mean_token_accuracy": 0.21412605941295623, "num_tokens": 47876690.0, "step": 23070 }, { "entropy": 5.487460374832153, "epoch": 2.0931603773584904, "grad_norm": 1.1015625, "learning_rate": 0.0004561576668270986, "loss": 4.9401, "mean_token_accuracy": 0.21145294606685638, "num_tokens": 47887709.0, "step": 23075 }, { "entropy": 5.485498762130737, "epoch": 2.0936139332365746, "grad_norm": 1.1640625, "learning_rate": 0.00045613847508098587, "loss": 4.9158, "mean_token_accuracy": 0.21514301300048827, "num_tokens": 47898209.0, "step": 23080 }, { "entropy": 5.472861003875733, "epoch": 2.094067489114659, "grad_norm": 1.109375, "learning_rate": 0.00045611927958888335, "loss": 4.8214, "mean_token_accuracy": 0.22030145972967147, "num_tokens": 47907494.0, "step": 23085 }, { "entropy": 5.521265316009521, "epoch": 2.094521044992743, "grad_norm": 1.125, "learning_rate": 0.00045610008035118797, "loss": 4.9642, "mean_token_accuracy": 0.21299418807029724, "num_tokens": 47916923.0, "step": 23090 }, { "entropy": 5.413331365585327, "epoch": 2.0949746008708274, "grad_norm": 1.1015625, "learning_rate": 0.00045608087736829687, "loss": 4.8406, "mean_token_accuracy": 0.22052141726017, "num_tokens": 47927043.0, "step": 23095 }, { "entropy": 5.485216951370239, "epoch": 2.0954281567489113, "grad_norm": 1.0859375, "learning_rate": 0.000456061670640607, "loss": 4.8981, "mean_token_accuracy": 0.21329971253871918, "num_tokens": 47937296.0, "step": 23100 }, { "entropy": 5.4986968517303465, "epoch": 2.0958817126269955, "grad_norm": 0.97265625, "learning_rate": 0.0004560424601685157, "loss": 4.9543, "mean_token_accuracy": 0.2136102080345154, "num_tokens": 47948268.0, "step": 23105 }, { "entropy": 5.514401912689209, "epoch": 2.09633526850508, "grad_norm": 1.0546875, "learning_rate": 0.0004560232459524201, "loss": 4.8707, "mean_token_accuracy": 0.20965292304754257, "num_tokens": 47958375.0, "step": 23110 }, { "entropy": 5.521043300628662, "epoch": 2.096788824383164, "grad_norm": 1.0390625, "learning_rate": 0.00045600402799271766, "loss": 4.9751, "mean_token_accuracy": 0.2117014080286026, "num_tokens": 47968469.0, "step": 23115 }, { "entropy": 5.463395023345948, "epoch": 2.0972423802612483, "grad_norm": 1.1953125, "learning_rate": 0.0004559848062898058, "loss": 4.8447, "mean_token_accuracy": 0.22461419105529784, "num_tokens": 47979630.0, "step": 23120 }, { "entropy": 5.465185546875, "epoch": 2.097695936139332, "grad_norm": 1.078125, "learning_rate": 0.0004559655808440821, "loss": 4.9238, "mean_token_accuracy": 0.2127090126276016, "num_tokens": 47989828.0, "step": 23125 }, { "entropy": 5.54462947845459, "epoch": 2.0981494920174164, "grad_norm": 1.078125, "learning_rate": 0.00045594635165594404, "loss": 5.0356, "mean_token_accuracy": 0.2026979297399521, "num_tokens": 47999219.0, "step": 23130 }, { "entropy": 5.493430423736572, "epoch": 2.0986030478955007, "grad_norm": 1.0234375, "learning_rate": 0.00045592711872578925, "loss": 4.9107, "mean_token_accuracy": 0.2234855994582176, "num_tokens": 48009244.0, "step": 23135 }, { "entropy": 5.51678056716919, "epoch": 2.099056603773585, "grad_norm": 1.0859375, "learning_rate": 0.00045590788205401557, "loss": 4.8705, "mean_token_accuracy": 0.21752927750349044, "num_tokens": 48019066.0, "step": 23140 }, { "entropy": 5.433136987686157, "epoch": 2.099510159651669, "grad_norm": 1.0625, "learning_rate": 0.00045588864164102086, "loss": 4.8752, "mean_token_accuracy": 0.2143240123987198, "num_tokens": 48028704.0, "step": 23145 }, { "entropy": 5.447130155563355, "epoch": 2.0999637155297535, "grad_norm": 1.125, "learning_rate": 0.00045586939748720284, "loss": 4.8949, "mean_token_accuracy": 0.21494856029748916, "num_tokens": 48039210.0, "step": 23150 }, { "entropy": 5.559927654266358, "epoch": 2.1004172714078373, "grad_norm": 1.1171875, "learning_rate": 0.00045585014959295965, "loss": 5.0238, "mean_token_accuracy": 0.20766939222812653, "num_tokens": 48048446.0, "step": 23155 }, { "entropy": 5.490615320205689, "epoch": 2.1008708272859216, "grad_norm": 1.265625, "learning_rate": 0.00045583089795868934, "loss": 4.9195, "mean_token_accuracy": 0.2178313046693802, "num_tokens": 48058880.0, "step": 23160 }, { "entropy": 5.503872108459473, "epoch": 2.101324383164006, "grad_norm": 1.1484375, "learning_rate": 0.0004558116425847899, "loss": 4.9507, "mean_token_accuracy": 0.21973822861909867, "num_tokens": 48070224.0, "step": 23165 }, { "entropy": 5.501051902770996, "epoch": 2.10177793904209, "grad_norm": 1.1484375, "learning_rate": 0.0004557923834716596, "loss": 4.9698, "mean_token_accuracy": 0.20269555747509002, "num_tokens": 48080914.0, "step": 23170 }, { "entropy": 5.48310923576355, "epoch": 2.1022314949201744, "grad_norm": 1.1171875, "learning_rate": 0.00045577312061969677, "loss": 4.9457, "mean_token_accuracy": 0.2059015601873398, "num_tokens": 48090873.0, "step": 23175 }, { "entropy": 5.587416172027588, "epoch": 2.102685050798258, "grad_norm": 1.1484375, "learning_rate": 0.0004557538540292997, "loss": 4.9521, "mean_token_accuracy": 0.21020243167877198, "num_tokens": 48101885.0, "step": 23180 }, { "entropy": 5.5352270126342775, "epoch": 2.1031386066763424, "grad_norm": 1.296875, "learning_rate": 0.0004557345837008669, "loss": 4.9814, "mean_token_accuracy": 0.2115281343460083, "num_tokens": 48111472.0, "step": 23185 }, { "entropy": 5.417670631408692, "epoch": 2.1035921625544267, "grad_norm": 1.0390625, "learning_rate": 0.00045571530963479684, "loss": 4.8359, "mean_token_accuracy": 0.21877902746200562, "num_tokens": 48121351.0, "step": 23190 }, { "entropy": 5.520017051696778, "epoch": 2.104045718432511, "grad_norm": 1.2109375, "learning_rate": 0.00045569603183148814, "loss": 4.9059, "mean_token_accuracy": 0.2263432264328003, "num_tokens": 48131104.0, "step": 23195 }, { "entropy": 5.542947053909302, "epoch": 2.1044992743105952, "grad_norm": 1.046875, "learning_rate": 0.0004556767502913395, "loss": 4.9783, "mean_token_accuracy": 0.2107452467083931, "num_tokens": 48142895.0, "step": 23200 }, { "entropy": 5.437056636810302, "epoch": 2.104952830188679, "grad_norm": 1.1328125, "learning_rate": 0.00045565746501474946, "loss": 4.7981, "mean_token_accuracy": 0.2176461786031723, "num_tokens": 48153294.0, "step": 23205 }, { "entropy": 5.514990711212159, "epoch": 2.1054063860667633, "grad_norm": 1.15625, "learning_rate": 0.00045563817600211714, "loss": 4.9894, "mean_token_accuracy": 0.20512441992759706, "num_tokens": 48164319.0, "step": 23210 }, { "entropy": 5.490831184387207, "epoch": 2.1058599419448476, "grad_norm": 1.0390625, "learning_rate": 0.00045561888325384124, "loss": 4.9374, "mean_token_accuracy": 0.21474379450082778, "num_tokens": 48173918.0, "step": 23215 }, { "entropy": 5.557566690444946, "epoch": 2.106313497822932, "grad_norm": 1.0234375, "learning_rate": 0.0004555995867703209, "loss": 4.9307, "mean_token_accuracy": 0.2102363407611847, "num_tokens": 48184127.0, "step": 23220 }, { "entropy": 5.445851564407349, "epoch": 2.106767053701016, "grad_norm": 1.09375, "learning_rate": 0.00045558028655195504, "loss": 4.8803, "mean_token_accuracy": 0.21301581859588622, "num_tokens": 48194198.0, "step": 23225 }, { "entropy": 5.419101428985596, "epoch": 2.1072206095791, "grad_norm": 1.09375, "learning_rate": 0.00045556098259914293, "loss": 4.8899, "mean_token_accuracy": 0.21379010528326034, "num_tokens": 48204654.0, "step": 23230 }, { "entropy": 5.495003175735474, "epoch": 2.1076741654571842, "grad_norm": 1.0546875, "learning_rate": 0.00045554167491228357, "loss": 5.0373, "mean_token_accuracy": 0.19996090978384018, "num_tokens": 48215322.0, "step": 23235 }, { "entropy": 5.508116340637207, "epoch": 2.1081277213352685, "grad_norm": 1.0390625, "learning_rate": 0.00045552236349177637, "loss": 4.8195, "mean_token_accuracy": 0.2218370571732521, "num_tokens": 48226142.0, "step": 23240 }, { "entropy": 5.443790626525879, "epoch": 2.1085812772133528, "grad_norm": 1.125, "learning_rate": 0.00045550304833802066, "loss": 4.8548, "mean_token_accuracy": 0.21408893316984176, "num_tokens": 48236896.0, "step": 23245 }, { "entropy": 5.401785564422608, "epoch": 2.109034833091437, "grad_norm": 1.078125, "learning_rate": 0.000455483729451416, "loss": 4.8876, "mean_token_accuracy": 0.21324791759252548, "num_tokens": 48247425.0, "step": 23250 }, { "entropy": 5.5107598304748535, "epoch": 2.109488388969521, "grad_norm": 1.171875, "learning_rate": 0.00045546440683236173, "loss": 4.9849, "mean_token_accuracy": 0.2117615222930908, "num_tokens": 48258560.0, "step": 23255 }, { "entropy": 5.616119909286499, "epoch": 2.109941944847605, "grad_norm": 1.0625, "learning_rate": 0.00045544508048125763, "loss": 5.0255, "mean_token_accuracy": 0.2058547705411911, "num_tokens": 48269469.0, "step": 23260 }, { "entropy": 5.5094382762908936, "epoch": 2.1103955007256894, "grad_norm": 1.0390625, "learning_rate": 0.0004554257503985032, "loss": 4.9216, "mean_token_accuracy": 0.21174388527870178, "num_tokens": 48278847.0, "step": 23265 }, { "entropy": 5.389681243896485, "epoch": 2.1108490566037736, "grad_norm": 1.0390625, "learning_rate": 0.00045540641658449834, "loss": 4.858, "mean_token_accuracy": 0.21684678196907042, "num_tokens": 48288091.0, "step": 23270 }, { "entropy": 5.444777774810791, "epoch": 2.111302612481858, "grad_norm": 1.109375, "learning_rate": 0.00045538707903964275, "loss": 4.8556, "mean_token_accuracy": 0.20940592736005784, "num_tokens": 48297946.0, "step": 23275 }, { "entropy": 5.469247627258301, "epoch": 2.1117561683599417, "grad_norm": 1.0546875, "learning_rate": 0.00045536773776433647, "loss": 4.9167, "mean_token_accuracy": 0.2152735933661461, "num_tokens": 48307650.0, "step": 23280 }, { "entropy": 5.50627703666687, "epoch": 2.112209724238026, "grad_norm": 1.140625, "learning_rate": 0.00045534839275897937, "loss": 5.0169, "mean_token_accuracy": 0.19798472821712493, "num_tokens": 48318824.0, "step": 23285 }, { "entropy": 5.483741569519043, "epoch": 2.1126632801161103, "grad_norm": 1.09375, "learning_rate": 0.00045532904402397157, "loss": 4.8767, "mean_token_accuracy": 0.21293772011995316, "num_tokens": 48329909.0, "step": 23290 }, { "entropy": 5.510102319717407, "epoch": 2.1131168359941945, "grad_norm": 1.09375, "learning_rate": 0.0004553096915597132, "loss": 5.0469, "mean_token_accuracy": 0.20591017305850984, "num_tokens": 48340142.0, "step": 23295 }, { "entropy": 5.480522680282593, "epoch": 2.113570391872279, "grad_norm": 1.125, "learning_rate": 0.0004552903353666044, "loss": 4.8929, "mean_token_accuracy": 0.21731432378292084, "num_tokens": 48350540.0, "step": 23300 }, { "entropy": 5.4842475891113285, "epoch": 2.114023947750363, "grad_norm": 1.078125, "learning_rate": 0.00045527097544504556, "loss": 4.8671, "mean_token_accuracy": 0.21836074441671371, "num_tokens": 48360153.0, "step": 23305 }, { "entropy": 5.451916790008545, "epoch": 2.114477503628447, "grad_norm": 1.2265625, "learning_rate": 0.000455251611795437, "loss": 4.9128, "mean_token_accuracy": 0.21206988990306855, "num_tokens": 48370088.0, "step": 23310 }, { "entropy": 5.500127172470092, "epoch": 2.114931059506531, "grad_norm": 1.140625, "learning_rate": 0.0004552322444181792, "loss": 4.9351, "mean_token_accuracy": 0.20827945470809936, "num_tokens": 48381325.0, "step": 23315 }, { "entropy": 5.499481821060181, "epoch": 2.1153846153846154, "grad_norm": 1.0, "learning_rate": 0.0004552128733136726, "loss": 4.9151, "mean_token_accuracy": 0.20841754078865052, "num_tokens": 48393077.0, "step": 23320 }, { "entropy": 5.478001642227173, "epoch": 2.1158381712626997, "grad_norm": 1.140625, "learning_rate": 0.0004551934984823179, "loss": 4.9106, "mean_token_accuracy": 0.2194019839167595, "num_tokens": 48403260.0, "step": 23325 }, { "entropy": 5.448865509033203, "epoch": 2.116291727140784, "grad_norm": 1.1640625, "learning_rate": 0.0004551741199245157, "loss": 4.8686, "mean_token_accuracy": 0.2162272408604622, "num_tokens": 48413616.0, "step": 23330 }, { "entropy": 5.490435171127319, "epoch": 2.1167452830188678, "grad_norm": 1.1015625, "learning_rate": 0.00045515473764066685, "loss": 4.916, "mean_token_accuracy": 0.214474119246006, "num_tokens": 48424189.0, "step": 23335 }, { "entropy": 5.494106197357178, "epoch": 2.117198838896952, "grad_norm": 1.09375, "learning_rate": 0.00045513535163117205, "loss": 4.9786, "mean_token_accuracy": 0.2117234781384468, "num_tokens": 48433603.0, "step": 23340 }, { "entropy": 5.529455280303955, "epoch": 2.1176523947750363, "grad_norm": 1.09375, "learning_rate": 0.0004551159618964323, "loss": 4.9491, "mean_token_accuracy": 0.21157184541225432, "num_tokens": 48443043.0, "step": 23345 }, { "entropy": 5.436767148971557, "epoch": 2.1181059506531206, "grad_norm": 1.109375, "learning_rate": 0.0004550965684368486, "loss": 4.8117, "mean_token_accuracy": 0.22824996560811997, "num_tokens": 48452765.0, "step": 23350 }, { "entropy": 5.461091947555542, "epoch": 2.118559506531205, "grad_norm": 1.078125, "learning_rate": 0.0004550771712528219, "loss": 4.8515, "mean_token_accuracy": 0.21886809915304184, "num_tokens": 48463191.0, "step": 23355 }, { "entropy": 5.473910236358643, "epoch": 2.1190130624092887, "grad_norm": 1.171875, "learning_rate": 0.0004550577703447534, "loss": 4.8738, "mean_token_accuracy": 0.21538019329309463, "num_tokens": 48473280.0, "step": 23360 }, { "entropy": 5.454883003234864, "epoch": 2.119466618287373, "grad_norm": 1.0859375, "learning_rate": 0.00045503836571304443, "loss": 4.8248, "mean_token_accuracy": 0.22145962417125703, "num_tokens": 48483465.0, "step": 23365 }, { "entropy": 5.428310871124268, "epoch": 2.119920174165457, "grad_norm": 1.0859375, "learning_rate": 0.0004550189573580961, "loss": 4.8365, "mean_token_accuracy": 0.2230508640408516, "num_tokens": 48494497.0, "step": 23370 }, { "entropy": 5.466896724700928, "epoch": 2.1203737300435415, "grad_norm": 1.1171875, "learning_rate": 0.0004549995452803098, "loss": 4.9356, "mean_token_accuracy": 0.21349977850914, "num_tokens": 48504106.0, "step": 23375 }, { "entropy": 5.521496438980103, "epoch": 2.1208272859216257, "grad_norm": 1.125, "learning_rate": 0.0004549801294800872, "loss": 4.933, "mean_token_accuracy": 0.2103397622704506, "num_tokens": 48515729.0, "step": 23380 }, { "entropy": 5.541421270370483, "epoch": 2.1212808417997095, "grad_norm": 1.1015625, "learning_rate": 0.0004549607099578295, "loss": 4.9795, "mean_token_accuracy": 0.20378561019897462, "num_tokens": 48526611.0, "step": 23385 }, { "entropy": 5.455163621902466, "epoch": 2.121734397677794, "grad_norm": 1.0625, "learning_rate": 0.0004549412867139386, "loss": 4.8612, "mean_token_accuracy": 0.2138544961810112, "num_tokens": 48537016.0, "step": 23390 }, { "entropy": 5.508710718154907, "epoch": 2.122187953555878, "grad_norm": 1.15625, "learning_rate": 0.00045492185974881587, "loss": 4.9502, "mean_token_accuracy": 0.21076148003339767, "num_tokens": 48546786.0, "step": 23395 }, { "entropy": 5.521090030670166, "epoch": 2.1226415094339623, "grad_norm": 1.0234375, "learning_rate": 0.0004549024290628634, "loss": 4.9372, "mean_token_accuracy": 0.21057303696870805, "num_tokens": 48556306.0, "step": 23400 }, { "entropy": 5.51818265914917, "epoch": 2.1230950653120466, "grad_norm": 1.09375, "learning_rate": 0.0004548829946564827, "loss": 4.9609, "mean_token_accuracy": 0.214289091527462, "num_tokens": 48566303.0, "step": 23405 }, { "entropy": 5.510607194900513, "epoch": 2.1235486211901304, "grad_norm": 1.15625, "learning_rate": 0.0004548635565300759, "loss": 4.9174, "mean_token_accuracy": 0.21444592922925948, "num_tokens": 48576313.0, "step": 23410 }, { "entropy": 5.446835279464722, "epoch": 2.1240021770682147, "grad_norm": 1.1953125, "learning_rate": 0.0004548441146840449, "loss": 4.9222, "mean_token_accuracy": 0.21519480645656586, "num_tokens": 48587133.0, "step": 23415 }, { "entropy": 5.5302201271057125, "epoch": 2.124455732946299, "grad_norm": 1.0546875, "learning_rate": 0.00045482466911879184, "loss": 5.0401, "mean_token_accuracy": 0.207182577252388, "num_tokens": 48598524.0, "step": 23420 }, { "entropy": 5.471316528320313, "epoch": 2.1249092888243832, "grad_norm": 1.0859375, "learning_rate": 0.00045480521983471875, "loss": 4.8855, "mean_token_accuracy": 0.21422095894813536, "num_tokens": 48609870.0, "step": 23425 }, { "entropy": 5.4870758056640625, "epoch": 2.1253628447024675, "grad_norm": 1.1484375, "learning_rate": 0.0004547857668322279, "loss": 4.9479, "mean_token_accuracy": 0.21868045181035994, "num_tokens": 48619828.0, "step": 23430 }, { "entropy": 5.471749591827392, "epoch": 2.1258164005805513, "grad_norm": 1.1171875, "learning_rate": 0.0004547663101117215, "loss": 4.8741, "mean_token_accuracy": 0.21767976582050325, "num_tokens": 48630361.0, "step": 23435 }, { "entropy": 5.477697134017944, "epoch": 2.1262699564586356, "grad_norm": 1.015625, "learning_rate": 0.00045474684967360216, "loss": 4.9188, "mean_token_accuracy": 0.20345781445503236, "num_tokens": 48641113.0, "step": 23440 }, { "entropy": 5.525275135040284, "epoch": 2.12672351233672, "grad_norm": 1.0625, "learning_rate": 0.000454727385518272, "loss": 5.0034, "mean_token_accuracy": 0.20239971280097963, "num_tokens": 48651777.0, "step": 23445 }, { "entropy": 5.577066802978516, "epoch": 2.127177068214804, "grad_norm": 1.046875, "learning_rate": 0.0004547079176461338, "loss": 5.0018, "mean_token_accuracy": 0.20499918311834336, "num_tokens": 48663237.0, "step": 23450 }, { "entropy": 5.474946737289429, "epoch": 2.1276306240928884, "grad_norm": 1.1015625, "learning_rate": 0.0004546884460575901, "loss": 4.9186, "mean_token_accuracy": 0.2172031208872795, "num_tokens": 48673932.0, "step": 23455 }, { "entropy": 5.437037086486816, "epoch": 2.1280841799709727, "grad_norm": 1.125, "learning_rate": 0.0004546689707530434, "loss": 4.853, "mean_token_accuracy": 0.21925485283136367, "num_tokens": 48684304.0, "step": 23460 }, { "entropy": 5.439531660079956, "epoch": 2.1285377358490565, "grad_norm": 0.96875, "learning_rate": 0.00045464949173289676, "loss": 4.8164, "mean_token_accuracy": 0.2139076918363571, "num_tokens": 48695569.0, "step": 23465 }, { "entropy": 5.412794542312622, "epoch": 2.1289912917271407, "grad_norm": 1.0546875, "learning_rate": 0.0004546300089975528, "loss": 4.8958, "mean_token_accuracy": 0.21566626578569412, "num_tokens": 48706550.0, "step": 23470 }, { "entropy": 5.524947643280029, "epoch": 2.129444847605225, "grad_norm": 1.0625, "learning_rate": 0.00045461052254741445, "loss": 4.9783, "mean_token_accuracy": 0.20545850098133087, "num_tokens": 48716852.0, "step": 23475 }, { "entropy": 5.450227499008179, "epoch": 2.1298984034833093, "grad_norm": 1.109375, "learning_rate": 0.00045459103238288474, "loss": 4.8514, "mean_token_accuracy": 0.21342543959617616, "num_tokens": 48726607.0, "step": 23480 }, { "entropy": 5.509646558761597, "epoch": 2.130351959361393, "grad_norm": 1.0390625, "learning_rate": 0.0004545715385043667, "loss": 5.0529, "mean_token_accuracy": 0.20278929620981218, "num_tokens": 48738011.0, "step": 23485 }, { "entropy": 5.488582706451416, "epoch": 2.1308055152394774, "grad_norm": 1.09375, "learning_rate": 0.0004545520409122635, "loss": 4.9358, "mean_token_accuracy": 0.20685756504535674, "num_tokens": 48747899.0, "step": 23490 }, { "entropy": 5.549203586578369, "epoch": 2.1312590711175616, "grad_norm": 0.96484375, "learning_rate": 0.0004545325396069783, "loss": 4.9573, "mean_token_accuracy": 0.21067034006118773, "num_tokens": 48758719.0, "step": 23495 }, { "entropy": 5.53995418548584, "epoch": 2.131712626995646, "grad_norm": 1.15625, "learning_rate": 0.0004545130345889145, "loss": 4.969, "mean_token_accuracy": 0.21649544388055803, "num_tokens": 48769677.0, "step": 23500 }, { "entropy": 5.541886806488037, "epoch": 2.13216618287373, "grad_norm": 1.375, "learning_rate": 0.0004544935258584754, "loss": 4.9261, "mean_token_accuracy": 0.21052988171577453, "num_tokens": 48778440.0, "step": 23505 }, { "entropy": 5.552027034759521, "epoch": 2.1326197387518144, "grad_norm": 1.15625, "learning_rate": 0.0004544740134160644, "loss": 5.0146, "mean_token_accuracy": 0.20672980844974517, "num_tokens": 48788328.0, "step": 23510 }, { "entropy": 5.54856309890747, "epoch": 2.1330732946298983, "grad_norm": 0.96875, "learning_rate": 0.0004544544972620851, "loss": 4.9706, "mean_token_accuracy": 0.2093269035220146, "num_tokens": 48799218.0, "step": 23515 }, { "entropy": 5.554470872879028, "epoch": 2.1335268505079825, "grad_norm": 1.0703125, "learning_rate": 0.0004544349773969411, "loss": 4.9396, "mean_token_accuracy": 0.2045355036854744, "num_tokens": 48809648.0, "step": 23520 }, { "entropy": 5.530418586730957, "epoch": 2.133980406386067, "grad_norm": 1.1875, "learning_rate": 0.0004544154538210359, "loss": 4.9471, "mean_token_accuracy": 0.20711568892002105, "num_tokens": 48819965.0, "step": 23525 }, { "entropy": 5.586858081817627, "epoch": 2.134433962264151, "grad_norm": 1.15625, "learning_rate": 0.0004543959265347735, "loss": 5.0039, "mean_token_accuracy": 0.21295797675848008, "num_tokens": 48829862.0, "step": 23530 }, { "entropy": 5.5078051567077635, "epoch": 2.1348875181422353, "grad_norm": 1.15625, "learning_rate": 0.00045437639553855757, "loss": 4.9089, "mean_token_accuracy": 0.21560557335615158, "num_tokens": 48840551.0, "step": 23535 }, { "entropy": 5.44795503616333, "epoch": 2.135341074020319, "grad_norm": 1.109375, "learning_rate": 0.0004543568608327921, "loss": 4.9316, "mean_token_accuracy": 0.22059373408555985, "num_tokens": 48851032.0, "step": 23540 }, { "entropy": 5.473871088027954, "epoch": 2.1357946298984034, "grad_norm": 1.15625, "learning_rate": 0.00045433732241788105, "loss": 4.9799, "mean_token_accuracy": 0.20635011792182922, "num_tokens": 48861773.0, "step": 23545 }, { "entropy": 5.550565385818482, "epoch": 2.1362481857764877, "grad_norm": 1.140625, "learning_rate": 0.00045431778029422846, "loss": 5.04, "mean_token_accuracy": 0.20750613361597062, "num_tokens": 48872430.0, "step": 23550 }, { "entropy": 5.51609959602356, "epoch": 2.136701741654572, "grad_norm": 1.1015625, "learning_rate": 0.0004542982344622385, "loss": 4.8288, "mean_token_accuracy": 0.21848976463079453, "num_tokens": 48882575.0, "step": 23555 }, { "entropy": 5.476479244232178, "epoch": 2.137155297532656, "grad_norm": 1.0859375, "learning_rate": 0.00045427868492231533, "loss": 4.9191, "mean_token_accuracy": 0.2100328490138054, "num_tokens": 48893337.0, "step": 23560 }, { "entropy": 5.574572038650513, "epoch": 2.13760885341074, "grad_norm": 1.046875, "learning_rate": 0.00045425913167486333, "loss": 5.0623, "mean_token_accuracy": 0.20403328388929368, "num_tokens": 48904675.0, "step": 23565 }, { "entropy": 5.464079999923706, "epoch": 2.1380624092888243, "grad_norm": 1.15625, "learning_rate": 0.00045423957472028677, "loss": 4.8678, "mean_token_accuracy": 0.22486539483070372, "num_tokens": 48914831.0, "step": 23570 }, { "entropy": 5.417195558547974, "epoch": 2.1385159651669086, "grad_norm": 1.1484375, "learning_rate": 0.0004542200140589901, "loss": 4.8339, "mean_token_accuracy": 0.21685407757759095, "num_tokens": 48924574.0, "step": 23575 }, { "entropy": 5.524708843231201, "epoch": 2.138969521044993, "grad_norm": 1.21875, "learning_rate": 0.00045420044969137787, "loss": 4.9849, "mean_token_accuracy": 0.2117667317390442, "num_tokens": 48933921.0, "step": 23580 }, { "entropy": 5.47751293182373, "epoch": 2.139423076923077, "grad_norm": 1.0859375, "learning_rate": 0.0004541808816178547, "loss": 4.9342, "mean_token_accuracy": 0.21422084122896196, "num_tokens": 48944571.0, "step": 23585 }, { "entropy": 5.484706926345825, "epoch": 2.139876632801161, "grad_norm": 1.046875, "learning_rate": 0.00045416130983882524, "loss": 4.9719, "mean_token_accuracy": 0.21103066205978394, "num_tokens": 48954569.0, "step": 23590 }, { "entropy": 5.497363519668579, "epoch": 2.140330188679245, "grad_norm": 1.0546875, "learning_rate": 0.00045414173435469427, "loss": 4.9163, "mean_token_accuracy": 0.21008778512477874, "num_tokens": 48965886.0, "step": 23595 }, { "entropy": 5.53784966468811, "epoch": 2.1407837445573294, "grad_norm": 1.0859375, "learning_rate": 0.00045412215516586654, "loss": 4.9377, "mean_token_accuracy": 0.20866110622882844, "num_tokens": 48976219.0, "step": 23600 }, { "entropy": 5.45023102760315, "epoch": 2.1412373004354137, "grad_norm": 1.1171875, "learning_rate": 0.000454102572272747, "loss": 4.9159, "mean_token_accuracy": 0.2103630483150482, "num_tokens": 48986322.0, "step": 23605 }, { "entropy": 5.492270517349243, "epoch": 2.141690856313498, "grad_norm": 1.203125, "learning_rate": 0.0004540829856757406, "loss": 4.8627, "mean_token_accuracy": 0.21788825392723082, "num_tokens": 48996297.0, "step": 23610 }, { "entropy": 5.483014345169067, "epoch": 2.142144412191582, "grad_norm": 1.1953125, "learning_rate": 0.0004540633953752525, "loss": 4.9386, "mean_token_accuracy": 0.21615786999464034, "num_tokens": 49006165.0, "step": 23615 }, { "entropy": 5.469926595687866, "epoch": 2.142597968069666, "grad_norm": 1.0703125, "learning_rate": 0.0004540438013716876, "loss": 4.8874, "mean_token_accuracy": 0.20500117987394334, "num_tokens": 49017278.0, "step": 23620 }, { "entropy": 5.42211012840271, "epoch": 2.1430515239477503, "grad_norm": 1.109375, "learning_rate": 0.0004540242036654514, "loss": 4.847, "mean_token_accuracy": 0.21552079766988755, "num_tokens": 49027088.0, "step": 23625 }, { "entropy": 5.4985424995422365, "epoch": 2.1435050798258346, "grad_norm": 1.0, "learning_rate": 0.000454004602256949, "loss": 4.8575, "mean_token_accuracy": 0.21263304799795152, "num_tokens": 49038156.0, "step": 23630 }, { "entropy": 5.556272077560425, "epoch": 2.143958635703919, "grad_norm": 1.109375, "learning_rate": 0.0004539849971465858, "loss": 4.9598, "mean_token_accuracy": 0.20618132054805755, "num_tokens": 49047480.0, "step": 23635 }, { "entropy": 5.541137933731079, "epoch": 2.1444121915820027, "grad_norm": 1.125, "learning_rate": 0.00045396538833476725, "loss": 4.9666, "mean_token_accuracy": 0.2112905576825142, "num_tokens": 49057373.0, "step": 23640 }, { "entropy": 5.4651641845703125, "epoch": 2.144865747460087, "grad_norm": 1.0546875, "learning_rate": 0.0004539457758218989, "loss": 4.9631, "mean_token_accuracy": 0.2085328996181488, "num_tokens": 49068380.0, "step": 23645 }, { "entropy": 5.452646493911743, "epoch": 2.1453193033381712, "grad_norm": 1.0390625, "learning_rate": 0.0004539261596083863, "loss": 4.9221, "mean_token_accuracy": 0.21304250061511992, "num_tokens": 49078646.0, "step": 23650 }, { "entropy": 5.5052141666412355, "epoch": 2.1457728592162555, "grad_norm": 1.015625, "learning_rate": 0.0004539065396946351, "loss": 4.8538, "mean_token_accuracy": 0.22275823056697847, "num_tokens": 49089281.0, "step": 23655 }, { "entropy": 5.523444175720215, "epoch": 2.1462264150943398, "grad_norm": 1.125, "learning_rate": 0.0004538869160810511, "loss": 4.9519, "mean_token_accuracy": 0.2068428725004196, "num_tokens": 49099514.0, "step": 23660 }, { "entropy": 5.516108751296997, "epoch": 2.146679970972424, "grad_norm": 1.1875, "learning_rate": 0.00045386728876804, "loss": 4.9644, "mean_token_accuracy": 0.20855603218078614, "num_tokens": 49110247.0, "step": 23665 }, { "entropy": 5.522738456726074, "epoch": 2.147133526850508, "grad_norm": 1.0390625, "learning_rate": 0.00045384765775600787, "loss": 5.0119, "mean_token_accuracy": 0.20599158853292465, "num_tokens": 49122492.0, "step": 23670 }, { "entropy": 5.504331350326538, "epoch": 2.147587082728592, "grad_norm": 1.1484375, "learning_rate": 0.0004538280230453606, "loss": 4.9391, "mean_token_accuracy": 0.21072427928447723, "num_tokens": 49132395.0, "step": 23675 }, { "entropy": 5.546470785140992, "epoch": 2.1480406386066764, "grad_norm": 1.09375, "learning_rate": 0.0004538083846365042, "loss": 4.9703, "mean_token_accuracy": 0.21081093102693557, "num_tokens": 49142909.0, "step": 23680 }, { "entropy": 5.46927399635315, "epoch": 2.1484941944847606, "grad_norm": 1.0859375, "learning_rate": 0.0004537887425298448, "loss": 4.9156, "mean_token_accuracy": 0.20832701176404952, "num_tokens": 49152933.0, "step": 23685 }, { "entropy": 5.455355453491211, "epoch": 2.1489477503628445, "grad_norm": 1.0546875, "learning_rate": 0.00045376909672578875, "loss": 4.9215, "mean_token_accuracy": 0.21210006177425383, "num_tokens": 49163595.0, "step": 23690 }, { "entropy": 5.4438024997711185, "epoch": 2.1494013062409287, "grad_norm": 0.99609375, "learning_rate": 0.0004537494472247422, "loss": 4.8838, "mean_token_accuracy": 0.21796485781669617, "num_tokens": 49174664.0, "step": 23695 }, { "entropy": 5.539899635314941, "epoch": 2.149854862119013, "grad_norm": 1.171875, "learning_rate": 0.0004537297940271115, "loss": 4.9753, "mean_token_accuracy": 0.21209616959095, "num_tokens": 49185105.0, "step": 23700 }, { "entropy": 5.454533100128174, "epoch": 2.1503084179970973, "grad_norm": 1.140625, "learning_rate": 0.0004537101371333031, "loss": 4.8728, "mean_token_accuracy": 0.21711899489164352, "num_tokens": 49194679.0, "step": 23705 }, { "entropy": 5.44823055267334, "epoch": 2.1507619738751815, "grad_norm": 1.078125, "learning_rate": 0.00045369047654372356, "loss": 4.8317, "mean_token_accuracy": 0.21542900204658508, "num_tokens": 49204563.0, "step": 23710 }, { "entropy": 5.5081446170806885, "epoch": 2.151215529753266, "grad_norm": 1.125, "learning_rate": 0.0004536708122587795, "loss": 4.9202, "mean_token_accuracy": 0.21585543751716613, "num_tokens": 49213759.0, "step": 23715 }, { "entropy": 5.450832748413086, "epoch": 2.1516690856313496, "grad_norm": 1.1640625, "learning_rate": 0.0004536511442788774, "loss": 4.8247, "mean_token_accuracy": 0.2188010811805725, "num_tokens": 49223604.0, "step": 23720 }, { "entropy": 5.444315719604492, "epoch": 2.152122641509434, "grad_norm": 1.09375, "learning_rate": 0.0004536314726044241, "loss": 4.9208, "mean_token_accuracy": 0.21494246274232864, "num_tokens": 49234000.0, "step": 23725 }, { "entropy": 5.480324411392212, "epoch": 2.152576197387518, "grad_norm": 1.1953125, "learning_rate": 0.00045361179723582654, "loss": 4.9216, "mean_token_accuracy": 0.21288597881793975, "num_tokens": 49244874.0, "step": 23730 }, { "entropy": 5.606625080108643, "epoch": 2.1530297532656024, "grad_norm": 1.1796875, "learning_rate": 0.0004535921181734914, "loss": 5.078, "mean_token_accuracy": 0.20926969796419143, "num_tokens": 49255495.0, "step": 23735 }, { "entropy": 5.508075857162476, "epoch": 2.1534833091436867, "grad_norm": 1.0859375, "learning_rate": 0.0004535724354178257, "loss": 4.8806, "mean_token_accuracy": 0.20972933918237685, "num_tokens": 49265357.0, "step": 23740 }, { "entropy": 5.516286039352417, "epoch": 2.1539368650217705, "grad_norm": 1.078125, "learning_rate": 0.00045355274896923664, "loss": 4.9816, "mean_token_accuracy": 0.2041096121072769, "num_tokens": 49276396.0, "step": 23745 }, { "entropy": 5.494228839874268, "epoch": 2.1543904208998548, "grad_norm": 1.125, "learning_rate": 0.0004535330588281312, "loss": 4.8502, "mean_token_accuracy": 0.21652241349220275, "num_tokens": 49285925.0, "step": 23750 }, { "entropy": 5.450982713699341, "epoch": 2.154843976777939, "grad_norm": 1.09375, "learning_rate": 0.0004535133649949166, "loss": 4.8866, "mean_token_accuracy": 0.21966630816459656, "num_tokens": 49296493.0, "step": 23755 }, { "entropy": 5.451837348937988, "epoch": 2.1552975326560233, "grad_norm": 1.1484375, "learning_rate": 0.0004534936674700001, "loss": 4.8677, "mean_token_accuracy": 0.21596649587154387, "num_tokens": 49307273.0, "step": 23760 }, { "entropy": 5.4932938575744625, "epoch": 2.1557510885341076, "grad_norm": 1.109375, "learning_rate": 0.00045347396625378914, "loss": 4.8981, "mean_token_accuracy": 0.21853408664464952, "num_tokens": 49317055.0, "step": 23765 }, { "entropy": 5.5065773010253904, "epoch": 2.1562046444121914, "grad_norm": 1.109375, "learning_rate": 0.00045345426134669103, "loss": 4.9316, "mean_token_accuracy": 0.2129323661327362, "num_tokens": 49327420.0, "step": 23770 }, { "entropy": 5.512909412384033, "epoch": 2.1566582002902757, "grad_norm": 1.109375, "learning_rate": 0.00045343455274911325, "loss": 4.9898, "mean_token_accuracy": 0.2095880091190338, "num_tokens": 49338323.0, "step": 23775 }, { "entropy": 5.509288549423218, "epoch": 2.15711175616836, "grad_norm": 1.2109375, "learning_rate": 0.0004534148404614635, "loss": 4.9591, "mean_token_accuracy": 0.21000067591667176, "num_tokens": 49348364.0, "step": 23780 }, { "entropy": 5.561091899871826, "epoch": 2.157565312046444, "grad_norm": 1.203125, "learning_rate": 0.00045339512448414943, "loss": 4.9814, "mean_token_accuracy": 0.2130022242665291, "num_tokens": 49358274.0, "step": 23785 }, { "entropy": 5.4732283592224125, "epoch": 2.1580188679245285, "grad_norm": 1.0625, "learning_rate": 0.0004533754048175787, "loss": 4.85, "mean_token_accuracy": 0.20857401341199874, "num_tokens": 49368651.0, "step": 23790 }, { "entropy": 5.449948358535766, "epoch": 2.1584724238026123, "grad_norm": 1.1953125, "learning_rate": 0.0004533556814621591, "loss": 4.8791, "mean_token_accuracy": 0.20844231992959977, "num_tokens": 49378363.0, "step": 23795 }, { "entropy": 5.492123746871949, "epoch": 2.1589259796806965, "grad_norm": 1.0625, "learning_rate": 0.00045333595441829865, "loss": 4.8992, "mean_token_accuracy": 0.21369218677282334, "num_tokens": 49388241.0, "step": 23800 }, { "entropy": 5.482124328613281, "epoch": 2.159379535558781, "grad_norm": 1.078125, "learning_rate": 0.0004533162236864051, "loss": 4.9129, "mean_token_accuracy": 0.208723221719265, "num_tokens": 49397678.0, "step": 23805 }, { "entropy": 5.523954916000366, "epoch": 2.159833091436865, "grad_norm": 1.15625, "learning_rate": 0.0004532964892668867, "loss": 4.9854, "mean_token_accuracy": 0.2093636840581894, "num_tokens": 49407368.0, "step": 23810 }, { "entropy": 5.46703314781189, "epoch": 2.1602866473149493, "grad_norm": 1.0703125, "learning_rate": 0.00045327675116015146, "loss": 4.8889, "mean_token_accuracy": 0.21758810430765152, "num_tokens": 49417926.0, "step": 23815 }, { "entropy": 5.590454483032227, "epoch": 2.1607402031930336, "grad_norm": 1.1015625, "learning_rate": 0.0004532570093666075, "loss": 5.0371, "mean_token_accuracy": 0.19904615134000778, "num_tokens": 49427899.0, "step": 23820 }, { "entropy": 5.500293254852295, "epoch": 2.1611937590711174, "grad_norm": 0.96875, "learning_rate": 0.0004532372638866633, "loss": 4.8705, "mean_token_accuracy": 0.22029965817928315, "num_tokens": 49439102.0, "step": 23825 }, { "entropy": 5.4722662448883055, "epoch": 2.1616473149492017, "grad_norm": 1.2421875, "learning_rate": 0.00045321751472072693, "loss": 4.8218, "mean_token_accuracy": 0.22426599264144897, "num_tokens": 49448013.0, "step": 23830 }, { "entropy": 5.390433073043823, "epoch": 2.162100870827286, "grad_norm": 1.171875, "learning_rate": 0.00045319776186920695, "loss": 4.8873, "mean_token_accuracy": 0.2208450898528099, "num_tokens": 49457620.0, "step": 23835 }, { "entropy": 5.416310024261475, "epoch": 2.1625544267053702, "grad_norm": 1.1328125, "learning_rate": 0.00045317800533251193, "loss": 4.9335, "mean_token_accuracy": 0.2055414006114006, "num_tokens": 49468038.0, "step": 23840 }, { "entropy": 5.451368904113769, "epoch": 2.163007982583454, "grad_norm": 1.109375, "learning_rate": 0.00045315824511105027, "loss": 4.8597, "mean_token_accuracy": 0.21456691473722458, "num_tokens": 49477714.0, "step": 23845 }, { "entropy": 5.534938669204712, "epoch": 2.1634615384615383, "grad_norm": 1.0625, "learning_rate": 0.00045313848120523073, "loss": 4.847, "mean_token_accuracy": 0.21914579570293427, "num_tokens": 49488214.0, "step": 23850 }, { "entropy": 5.507592058181762, "epoch": 2.1639150943396226, "grad_norm": 1.0859375, "learning_rate": 0.00045311871361546205, "loss": 4.977, "mean_token_accuracy": 0.2114535838365555, "num_tokens": 49498444.0, "step": 23855 }, { "entropy": 5.389393854141235, "epoch": 2.164368650217707, "grad_norm": 1.046875, "learning_rate": 0.0004530989423421529, "loss": 4.8297, "mean_token_accuracy": 0.22005860656499862, "num_tokens": 49508759.0, "step": 23860 }, { "entropy": 5.376272201538086, "epoch": 2.164822206095791, "grad_norm": 1.078125, "learning_rate": 0.00045307916738571223, "loss": 4.7955, "mean_token_accuracy": 0.22844140976667404, "num_tokens": 49518787.0, "step": 23865 }, { "entropy": 5.463872623443604, "epoch": 2.1652757619738754, "grad_norm": 1.09375, "learning_rate": 0.0004530593887465491, "loss": 4.9019, "mean_token_accuracy": 0.2188235953450203, "num_tokens": 49528130.0, "step": 23870 }, { "entropy": 5.561067152023315, "epoch": 2.165729317851959, "grad_norm": 1.171875, "learning_rate": 0.00045303960642507235, "loss": 5.0574, "mean_token_accuracy": 0.20429391413927078, "num_tokens": 49539128.0, "step": 23875 }, { "entropy": 5.427201843261718, "epoch": 2.1661828737300435, "grad_norm": 1.125, "learning_rate": 0.00045301982042169123, "loss": 4.8802, "mean_token_accuracy": 0.21698668450117112, "num_tokens": 49550571.0, "step": 23880 }, { "entropy": 5.470988368988037, "epoch": 2.1666364296081277, "grad_norm": 1.0625, "learning_rate": 0.00045300003073681485, "loss": 4.917, "mean_token_accuracy": 0.2148282289505005, "num_tokens": 49561106.0, "step": 23885 }, { "entropy": 5.430626773834229, "epoch": 2.167089985486212, "grad_norm": 1.0625, "learning_rate": 0.00045298023737085243, "loss": 4.8116, "mean_token_accuracy": 0.2152087152004242, "num_tokens": 49571389.0, "step": 23890 }, { "entropy": 5.473476266860962, "epoch": 2.1675435413642963, "grad_norm": 1.15625, "learning_rate": 0.0004529604403242134, "loss": 4.9365, "mean_token_accuracy": 0.21314407587051393, "num_tokens": 49582224.0, "step": 23895 }, { "entropy": 5.4875846862792965, "epoch": 2.16799709724238, "grad_norm": 1.1953125, "learning_rate": 0.00045294063959730707, "loss": 4.932, "mean_token_accuracy": 0.2137991487979889, "num_tokens": 49592413.0, "step": 23900 }, { "entropy": 5.529356527328491, "epoch": 2.1684506531204644, "grad_norm": 1.109375, "learning_rate": 0.00045292083519054297, "loss": 4.9991, "mean_token_accuracy": 0.19885564893484114, "num_tokens": 49602796.0, "step": 23905 }, { "entropy": 5.490967655181885, "epoch": 2.1689042089985486, "grad_norm": 1.1640625, "learning_rate": 0.0004529010271043307, "loss": 4.8815, "mean_token_accuracy": 0.21977989077568055, "num_tokens": 49613625.0, "step": 23910 }, { "entropy": 5.615268516540527, "epoch": 2.169357764876633, "grad_norm": 1.0859375, "learning_rate": 0.00045288121533907977, "loss": 5.0128, "mean_token_accuracy": 0.21041471213102342, "num_tokens": 49624719.0, "step": 23915 }, { "entropy": 5.540744781494141, "epoch": 2.169811320754717, "grad_norm": 1.109375, "learning_rate": 0.00045286139989520006, "loss": 4.9897, "mean_token_accuracy": 0.20469337552785874, "num_tokens": 49634916.0, "step": 23920 }, { "entropy": 5.4966377258300785, "epoch": 2.170264876632801, "grad_norm": 1.171875, "learning_rate": 0.0004528415807731012, "loss": 4.8628, "mean_token_accuracy": 0.21104287207126618, "num_tokens": 49645215.0, "step": 23925 }, { "entropy": 5.473695898056031, "epoch": 2.1707184325108853, "grad_norm": 1.1015625, "learning_rate": 0.00045282175797319317, "loss": 4.9277, "mean_token_accuracy": 0.21484462171792984, "num_tokens": 49655805.0, "step": 23930 }, { "entropy": 5.523554372787475, "epoch": 2.1711719883889695, "grad_norm": 1.0859375, "learning_rate": 0.0004528019314958859, "loss": 4.9164, "mean_token_accuracy": 0.21340756714344025, "num_tokens": 49665264.0, "step": 23935 }, { "entropy": 5.509702348709107, "epoch": 2.171625544267054, "grad_norm": 1.0625, "learning_rate": 0.00045278210134158935, "loss": 4.9769, "mean_token_accuracy": 0.20975067764520644, "num_tokens": 49676152.0, "step": 23940 }, { "entropy": 5.537830018997193, "epoch": 2.172079100145138, "grad_norm": 1.2109375, "learning_rate": 0.0004527622675107137, "loss": 4.9256, "mean_token_accuracy": 0.2114069014787674, "num_tokens": 49686762.0, "step": 23945 }, { "entropy": 5.544857978820801, "epoch": 2.172532656023222, "grad_norm": 1.1640625, "learning_rate": 0.00045274243000366897, "loss": 4.9499, "mean_token_accuracy": 0.21516836285591126, "num_tokens": 49697504.0, "step": 23950 }, { "entropy": 5.501814126968384, "epoch": 2.172986211901306, "grad_norm": 1.0625, "learning_rate": 0.0004527225888208655, "loss": 4.9861, "mean_token_accuracy": 0.20459358394145966, "num_tokens": 49709197.0, "step": 23955 }, { "entropy": 5.536350059509277, "epoch": 2.1734397677793904, "grad_norm": 1.1484375, "learning_rate": 0.0004527027439627137, "loss": 4.9377, "mean_token_accuracy": 0.20753052830696106, "num_tokens": 49719764.0, "step": 23960 }, { "entropy": 5.493772077560425, "epoch": 2.1738933236574747, "grad_norm": 1.109375, "learning_rate": 0.00045268289542962377, "loss": 4.9155, "mean_token_accuracy": 0.21154548674821855, "num_tokens": 49730363.0, "step": 23965 }, { "entropy": 5.5016883373260494, "epoch": 2.174346879535559, "grad_norm": 1.109375, "learning_rate": 0.0004526630432220063, "loss": 4.9593, "mean_token_accuracy": 0.20137335658073424, "num_tokens": 49741037.0, "step": 23970 }, { "entropy": 5.447806072235108, "epoch": 2.1748004354136428, "grad_norm": 1.1328125, "learning_rate": 0.0004526431873402719, "loss": 4.8481, "mean_token_accuracy": 0.21980459094047547, "num_tokens": 49750127.0, "step": 23975 }, { "entropy": 5.549685001373291, "epoch": 2.175253991291727, "grad_norm": 1.078125, "learning_rate": 0.000452623327784831, "loss": 5.0268, "mean_token_accuracy": 0.20665594637393953, "num_tokens": 49760298.0, "step": 23980 }, { "entropy": 5.512126779556274, "epoch": 2.1757075471698113, "grad_norm": 1.0546875, "learning_rate": 0.0004526034645560945, "loss": 4.9396, "mean_token_accuracy": 0.20661046355962753, "num_tokens": 49770841.0, "step": 23985 }, { "entropy": 5.448244667053222, "epoch": 2.1761611030478956, "grad_norm": 1.1796875, "learning_rate": 0.00045258359765447306, "loss": 4.9091, "mean_token_accuracy": 0.21660372018814086, "num_tokens": 49781000.0, "step": 23990 }, { "entropy": 5.474337244033814, "epoch": 2.17661465892598, "grad_norm": 1.1640625, "learning_rate": 0.0004525637270803776, "loss": 4.8965, "mean_token_accuracy": 0.21679802983999252, "num_tokens": 49790886.0, "step": 23995 }, { "entropy": 5.470546007156372, "epoch": 2.1770682148040637, "grad_norm": 1.09375, "learning_rate": 0.00045254385283421896, "loss": 4.9054, "mean_token_accuracy": 0.22061644047498702, "num_tokens": 49801477.0, "step": 24000 }, { "epoch": 2.1770682148040637, "eval_entropy": 5.246431207225333, "eval_loss": 5.00707483291626, "eval_mean_token_accuracy": 0.21752887504402868, "eval_num_tokens": 49801477.0, "eval_runtime": 20.8461, "eval_samples_per_second": 1696.242, "eval_steps_per_second": 212.03, "step": 24000 }, { "entropy": 5.5039448738098145, "epoch": 2.177521770682148, "grad_norm": 1.109375, "learning_rate": 0.0004525239749164082, "loss": 4.9446, "mean_token_accuracy": 0.21380907148122788, "num_tokens": 49812044.0, "step": 24005 }, { "entropy": 5.444004058837891, "epoch": 2.177975326560232, "grad_norm": 1.234375, "learning_rate": 0.0004525040933273564, "loss": 4.8487, "mean_token_accuracy": 0.21202043443918228, "num_tokens": 49821559.0, "step": 24010 }, { "entropy": 5.545518302917481, "epoch": 2.1784288824383164, "grad_norm": 1.0625, "learning_rate": 0.00045248420806747483, "loss": 5.0237, "mean_token_accuracy": 0.1998417243361473, "num_tokens": 49832937.0, "step": 24015 }, { "entropy": 5.560429906845092, "epoch": 2.1788824383164007, "grad_norm": 1.078125, "learning_rate": 0.0004524643191371745, "loss": 4.9404, "mean_token_accuracy": 0.21355916261672975, "num_tokens": 49843176.0, "step": 24020 }, { "entropy": 5.4942545890808105, "epoch": 2.179335994194485, "grad_norm": 1.1484375, "learning_rate": 0.00045244442653686684, "loss": 4.8584, "mean_token_accuracy": 0.2214878559112549, "num_tokens": 49852522.0, "step": 24025 }, { "entropy": 5.402928876876831, "epoch": 2.179789550072569, "grad_norm": 1.125, "learning_rate": 0.00045242453026696325, "loss": 4.8522, "mean_token_accuracy": 0.2213190272450447, "num_tokens": 49863143.0, "step": 24030 }, { "entropy": 5.514883184432984, "epoch": 2.180243105950653, "grad_norm": 1.1484375, "learning_rate": 0.0004524046303278752, "loss": 4.959, "mean_token_accuracy": 0.21164660155773163, "num_tokens": 49873465.0, "step": 24035 }, { "entropy": 5.591395378112793, "epoch": 2.1806966618287373, "grad_norm": 1.09375, "learning_rate": 0.0004523847267200141, "loss": 5.0459, "mean_token_accuracy": 0.19992619007825851, "num_tokens": 49883690.0, "step": 24040 }, { "entropy": 5.557153129577637, "epoch": 2.1811502177068216, "grad_norm": 1.1328125, "learning_rate": 0.00045236481944379165, "loss": 4.9954, "mean_token_accuracy": 0.20721260458230972, "num_tokens": 49894418.0, "step": 24045 }, { "entropy": 5.529432725906372, "epoch": 2.1816037735849054, "grad_norm": 1.1328125, "learning_rate": 0.0004523449084996196, "loss": 4.8747, "mean_token_accuracy": 0.21668112576007842, "num_tokens": 49903927.0, "step": 24050 }, { "entropy": 5.5112556457519535, "epoch": 2.1820573294629897, "grad_norm": 1.1015625, "learning_rate": 0.0004523249938879096, "loss": 4.933, "mean_token_accuracy": 0.2119065046310425, "num_tokens": 49914203.0, "step": 24055 }, { "entropy": 5.489736843109131, "epoch": 2.182510885341074, "grad_norm": 1.1796875, "learning_rate": 0.00045230507560907354, "loss": 4.9032, "mean_token_accuracy": 0.21616462022066116, "num_tokens": 49924320.0, "step": 24060 }, { "entropy": 5.453796148300171, "epoch": 2.1829644412191582, "grad_norm": 1.0078125, "learning_rate": 0.00045228515366352334, "loss": 4.8859, "mean_token_accuracy": 0.21154101938009262, "num_tokens": 49934634.0, "step": 24065 }, { "entropy": 5.563674783706665, "epoch": 2.1834179970972425, "grad_norm": 1.078125, "learning_rate": 0.00045226522805167095, "loss": 4.9411, "mean_token_accuracy": 0.21521165519952773, "num_tokens": 49944586.0, "step": 24070 }, { "entropy": 5.5198675155639645, "epoch": 2.1838715529753268, "grad_norm": 1.0390625, "learning_rate": 0.0004522452987739286, "loss": 4.9288, "mean_token_accuracy": 0.21574558466672897, "num_tokens": 49955441.0, "step": 24075 }, { "entropy": 5.568985033035278, "epoch": 2.1843251088534106, "grad_norm": 1.0234375, "learning_rate": 0.00045222536583070823, "loss": 5.0343, "mean_token_accuracy": 0.21131619364023208, "num_tokens": 49966718.0, "step": 24080 }, { "entropy": 5.581003475189209, "epoch": 2.184778664731495, "grad_norm": 0.96875, "learning_rate": 0.00045220542922242205, "loss": 5.0085, "mean_token_accuracy": 0.206375452876091, "num_tokens": 49979483.0, "step": 24085 }, { "entropy": 5.492413759231567, "epoch": 2.185232220609579, "grad_norm": 1.15625, "learning_rate": 0.00045218548894948254, "loss": 4.907, "mean_token_accuracy": 0.21802786439657212, "num_tokens": 49989976.0, "step": 24090 }, { "entropy": 5.46004090309143, "epoch": 2.1856857764876634, "grad_norm": 1.1015625, "learning_rate": 0.00045216554501230187, "loss": 4.7954, "mean_token_accuracy": 0.21937553137540816, "num_tokens": 50000069.0, "step": 24095 }, { "entropy": 5.5020547866821286, "epoch": 2.1861393323657476, "grad_norm": 1.1015625, "learning_rate": 0.0004521455974112927, "loss": 4.9317, "mean_token_accuracy": 0.21807566285133362, "num_tokens": 50009970.0, "step": 24100 }, { "entropy": 5.520513486862183, "epoch": 2.1865928882438315, "grad_norm": 1.2265625, "learning_rate": 0.00045212564614686735, "loss": 4.9342, "mean_token_accuracy": 0.2135014295578003, "num_tokens": 50019590.0, "step": 24105 }, { "entropy": 5.483197832107544, "epoch": 2.1870464441219157, "grad_norm": 1.109375, "learning_rate": 0.0004521056912194386, "loss": 4.9384, "mean_token_accuracy": 0.20277114510536193, "num_tokens": 50030092.0, "step": 24110 }, { "entropy": 5.46104679107666, "epoch": 2.1875, "grad_norm": 1.09375, "learning_rate": 0.0004520857326294189, "loss": 4.9222, "mean_token_accuracy": 0.20964971631765367, "num_tokens": 50040318.0, "step": 24115 }, { "entropy": 5.556581783294678, "epoch": 2.1879535558780843, "grad_norm": 1.203125, "learning_rate": 0.00045206577037722114, "loss": 5.0575, "mean_token_accuracy": 0.19703535437583924, "num_tokens": 50050507.0, "step": 24120 }, { "entropy": 5.642433214187622, "epoch": 2.1884071117561685, "grad_norm": 1.1015625, "learning_rate": 0.0004520458044632582, "loss": 5.003, "mean_token_accuracy": 0.20688743889331818, "num_tokens": 50059727.0, "step": 24125 }, { "entropy": 5.518909168243408, "epoch": 2.1888606676342524, "grad_norm": 1.03125, "learning_rate": 0.00045202583488794285, "loss": 4.9227, "mean_token_accuracy": 0.21375075578689576, "num_tokens": 50070812.0, "step": 24130 }, { "entropy": 5.5386049270629885, "epoch": 2.1893142235123366, "grad_norm": 1.1953125, "learning_rate": 0.0004520058616516881, "loss": 5.0148, "mean_token_accuracy": 0.20394109636545182, "num_tokens": 50081175.0, "step": 24135 }, { "entropy": 5.521824359893799, "epoch": 2.189767779390421, "grad_norm": 1.0625, "learning_rate": 0.00045198588475490716, "loss": 4.9229, "mean_token_accuracy": 0.21007878631353377, "num_tokens": 50092246.0, "step": 24140 }, { "entropy": 5.560021018981933, "epoch": 2.190221335268505, "grad_norm": 1.15625, "learning_rate": 0.0004519659041980129, "loss": 4.9657, "mean_token_accuracy": 0.21317261159420015, "num_tokens": 50101934.0, "step": 24145 }, { "entropy": 5.504631280899048, "epoch": 2.1906748911465894, "grad_norm": 1.25, "learning_rate": 0.0004519459199814187, "loss": 4.9851, "mean_token_accuracy": 0.21087743639945983, "num_tokens": 50112159.0, "step": 24150 }, { "entropy": 5.471140956878662, "epoch": 2.1911284470246732, "grad_norm": 1.09375, "learning_rate": 0.0004519259321055377, "loss": 4.9576, "mean_token_accuracy": 0.20728392601013185, "num_tokens": 50123079.0, "step": 24155 }, { "entropy": 5.505477809906006, "epoch": 2.1915820029027575, "grad_norm": 1.0546875, "learning_rate": 0.0004519059405707834, "loss": 4.9275, "mean_token_accuracy": 0.20931319892406464, "num_tokens": 50133097.0, "step": 24160 }, { "entropy": 5.577991390228272, "epoch": 2.1920355587808418, "grad_norm": 1.109375, "learning_rate": 0.00045188594537756916, "loss": 5.0056, "mean_token_accuracy": 0.2101932629942894, "num_tokens": 50143062.0, "step": 24165 }, { "entropy": 5.566372299194336, "epoch": 2.192489114658926, "grad_norm": 1.046875, "learning_rate": 0.00045186594652630853, "loss": 4.9257, "mean_token_accuracy": 0.21754238605499268, "num_tokens": 50154482.0, "step": 24170 }, { "entropy": 5.528503942489624, "epoch": 2.1929426705370103, "grad_norm": 1.171875, "learning_rate": 0.000451845944017415, "loss": 4.8899, "mean_token_accuracy": 0.21995092779397965, "num_tokens": 50164880.0, "step": 24175 }, { "entropy": 5.466913318634033, "epoch": 2.1933962264150946, "grad_norm": 1.21875, "learning_rate": 0.00045182593785130225, "loss": 4.8699, "mean_token_accuracy": 0.2187932923436165, "num_tokens": 50173896.0, "step": 24180 }, { "entropy": 5.504962921142578, "epoch": 2.1938497822931784, "grad_norm": 1.109375, "learning_rate": 0.0004518059280283842, "loss": 4.9704, "mean_token_accuracy": 0.2107956662774086, "num_tokens": 50185078.0, "step": 24185 }, { "entropy": 5.547479677200317, "epoch": 2.1943033381712627, "grad_norm": 1.1015625, "learning_rate": 0.00045178591454907434, "loss": 4.9407, "mean_token_accuracy": 0.21438332051038742, "num_tokens": 50195500.0, "step": 24190 }, { "entropy": 5.469525337219238, "epoch": 2.194756894049347, "grad_norm": 1.09375, "learning_rate": 0.00045176589741378675, "loss": 4.8764, "mean_token_accuracy": 0.21044387370347978, "num_tokens": 50206103.0, "step": 24195 }, { "entropy": 5.429343175888062, "epoch": 2.195210449927431, "grad_norm": 1.21875, "learning_rate": 0.0004517458766229354, "loss": 4.8764, "mean_token_accuracy": 0.21101847887039185, "num_tokens": 50216522.0, "step": 24200 }, { "entropy": 5.541996335983276, "epoch": 2.195664005805515, "grad_norm": 1.15625, "learning_rate": 0.00045172585217693426, "loss": 4.9297, "mean_token_accuracy": 0.2189615085721016, "num_tokens": 50226721.0, "step": 24205 }, { "entropy": 5.591645336151123, "epoch": 2.1961175616835993, "grad_norm": 1.1484375, "learning_rate": 0.00045170582407619747, "loss": 4.9977, "mean_token_accuracy": 0.20701381117105483, "num_tokens": 50236327.0, "step": 24210 }, { "entropy": 5.44909987449646, "epoch": 2.1965711175616836, "grad_norm": 1.1484375, "learning_rate": 0.0004516857923211392, "loss": 4.8717, "mean_token_accuracy": 0.2169783368706703, "num_tokens": 50245729.0, "step": 24215 }, { "entropy": 5.515542888641358, "epoch": 2.197024673439768, "grad_norm": 1.1484375, "learning_rate": 0.00045166575691217375, "loss": 5.0042, "mean_token_accuracy": 0.2025711104273796, "num_tokens": 50257024.0, "step": 24220 }, { "entropy": 5.526003837585449, "epoch": 2.197478229317852, "grad_norm": 1.21875, "learning_rate": 0.00045164571784971536, "loss": 4.8705, "mean_token_accuracy": 0.217717806994915, "num_tokens": 50266910.0, "step": 24225 }, { "entropy": 5.501551961898803, "epoch": 2.1979317851959363, "grad_norm": 1.078125, "learning_rate": 0.00045162567513417864, "loss": 4.9089, "mean_token_accuracy": 0.21626132875680923, "num_tokens": 50278233.0, "step": 24230 }, { "entropy": 5.4796960830688475, "epoch": 2.19838534107402, "grad_norm": 1.1015625, "learning_rate": 0.00045160562876597776, "loss": 4.8978, "mean_token_accuracy": 0.20843525528907775, "num_tokens": 50289276.0, "step": 24235 }, { "entropy": 5.493786001205445, "epoch": 2.1988388969521044, "grad_norm": 1.125, "learning_rate": 0.0004515855787455276, "loss": 4.921, "mean_token_accuracy": 0.2138884648680687, "num_tokens": 50299336.0, "step": 24240 }, { "entropy": 5.5388110160827635, "epoch": 2.1992924528301887, "grad_norm": 1.1328125, "learning_rate": 0.0004515655250732426, "loss": 4.8757, "mean_token_accuracy": 0.21270934790372847, "num_tokens": 50308308.0, "step": 24245 }, { "entropy": 5.471859073638916, "epoch": 2.199746008708273, "grad_norm": 1.1171875, "learning_rate": 0.00045154546774953764, "loss": 4.9412, "mean_token_accuracy": 0.21223640888929368, "num_tokens": 50318295.0, "step": 24250 }, { "entropy": 5.425398683547973, "epoch": 2.2001995645863572, "grad_norm": 1.0390625, "learning_rate": 0.0004515254067748274, "loss": 4.9141, "mean_token_accuracy": 0.21996940523386002, "num_tokens": 50329296.0, "step": 24255 }, { "entropy": 5.465482568740844, "epoch": 2.200653120464441, "grad_norm": 1.109375, "learning_rate": 0.0004515053421495267, "loss": 4.987, "mean_token_accuracy": 0.20182658731937408, "num_tokens": 50339389.0, "step": 24260 }, { "entropy": 5.567392778396607, "epoch": 2.2011066763425253, "grad_norm": 1.1640625, "learning_rate": 0.00045148527387405056, "loss": 5.0094, "mean_token_accuracy": 0.20201555639505386, "num_tokens": 50349647.0, "step": 24265 }, { "entropy": 5.580852079391479, "epoch": 2.2015602322206096, "grad_norm": 1.0234375, "learning_rate": 0.0004514652019488141, "loss": 4.9875, "mean_token_accuracy": 0.20866041481494904, "num_tokens": 50361292.0, "step": 24270 }, { "entropy": 5.500916814804077, "epoch": 2.202013788098694, "grad_norm": 1.1875, "learning_rate": 0.0004514451263742321, "loss": 4.9289, "mean_token_accuracy": 0.2093900680541992, "num_tokens": 50372293.0, "step": 24275 }, { "entropy": 5.445493888854981, "epoch": 2.202467343976778, "grad_norm": 1.09375, "learning_rate": 0.0004514250471507201, "loss": 4.8766, "mean_token_accuracy": 0.2177124574780464, "num_tokens": 50382462.0, "step": 24280 }, { "entropy": 5.515185117721558, "epoch": 2.202920899854862, "grad_norm": 1.046875, "learning_rate": 0.00045140496427869306, "loss": 4.9561, "mean_token_accuracy": 0.22146715372800826, "num_tokens": 50393157.0, "step": 24285 }, { "entropy": 5.430197286605835, "epoch": 2.203374455732946, "grad_norm": 1.03125, "learning_rate": 0.0004513848777585664, "loss": 4.84, "mean_token_accuracy": 0.2179591417312622, "num_tokens": 50403474.0, "step": 24290 }, { "entropy": 5.483253717422485, "epoch": 2.2038280116110305, "grad_norm": 1.0390625, "learning_rate": 0.0004513647875907556, "loss": 4.918, "mean_token_accuracy": 0.21016072779893874, "num_tokens": 50414337.0, "step": 24295 }, { "entropy": 5.552049350738526, "epoch": 2.2042815674891147, "grad_norm": 1.09375, "learning_rate": 0.00045134469377567597, "loss": 5.0558, "mean_token_accuracy": 0.20477916300296783, "num_tokens": 50424863.0, "step": 24300 }, { "entropy": 5.54852032661438, "epoch": 2.204735123367199, "grad_norm": 1.0703125, "learning_rate": 0.0004513245963137432, "loss": 5.0038, "mean_token_accuracy": 0.2095029190182686, "num_tokens": 50435982.0, "step": 24305 }, { "entropy": 5.505387687683106, "epoch": 2.205188679245283, "grad_norm": 1.15625, "learning_rate": 0.0004513044952053728, "loss": 4.9096, "mean_token_accuracy": 0.21179662346839906, "num_tokens": 50445112.0, "step": 24310 }, { "entropy": 5.416015768051148, "epoch": 2.205642235123367, "grad_norm": 1.15625, "learning_rate": 0.00045128439045098045, "loss": 4.8787, "mean_token_accuracy": 0.22095187455415727, "num_tokens": 50455266.0, "step": 24315 }, { "entropy": 5.5569178581237795, "epoch": 2.2060957910014514, "grad_norm": 1.0234375, "learning_rate": 0.00045126428205098207, "loss": 5.0117, "mean_token_accuracy": 0.20119641721248627, "num_tokens": 50466930.0, "step": 24320 }, { "entropy": 5.521805667877198, "epoch": 2.2065493468795356, "grad_norm": 1.140625, "learning_rate": 0.0004512441700057934, "loss": 4.9322, "mean_token_accuracy": 0.21509936451911926, "num_tokens": 50477534.0, "step": 24325 }, { "entropy": 5.479548025131225, "epoch": 2.20700290275762, "grad_norm": 1.2578125, "learning_rate": 0.0004512240543158305, "loss": 4.9068, "mean_token_accuracy": 0.21623065322637558, "num_tokens": 50487352.0, "step": 24330 }, { "entropy": 5.440809631347657, "epoch": 2.2074564586357037, "grad_norm": 1.21875, "learning_rate": 0.00045120393498150905, "loss": 4.8274, "mean_token_accuracy": 0.2224089980125427, "num_tokens": 50496227.0, "step": 24335 }, { "entropy": 5.518359899520874, "epoch": 2.207910014513788, "grad_norm": 1.203125, "learning_rate": 0.00045118381200324537, "loss": 4.9586, "mean_token_accuracy": 0.20798122137784958, "num_tokens": 50507536.0, "step": 24340 }, { "entropy": 5.553762292861938, "epoch": 2.2083635703918723, "grad_norm": 1.0859375, "learning_rate": 0.0004511636853814556, "loss": 4.9271, "mean_token_accuracy": 0.21207121163606643, "num_tokens": 50517659.0, "step": 24345 }, { "entropy": 5.500620412826538, "epoch": 2.2088171262699565, "grad_norm": 1.09375, "learning_rate": 0.00045114355511655595, "loss": 4.9222, "mean_token_accuracy": 0.2070940151810646, "num_tokens": 50528717.0, "step": 24350 }, { "entropy": 5.451986169815063, "epoch": 2.209270682148041, "grad_norm": 1.1796875, "learning_rate": 0.00045112342120896267, "loss": 4.8326, "mean_token_accuracy": 0.21786334961652756, "num_tokens": 50538449.0, "step": 24355 }, { "entropy": 5.561678552627564, "epoch": 2.2097242380261246, "grad_norm": 1.1328125, "learning_rate": 0.00045110328365909215, "loss": 4.9984, "mean_token_accuracy": 0.2076120674610138, "num_tokens": 50549098.0, "step": 24360 }, { "entropy": 5.5467907905578615, "epoch": 2.210177793904209, "grad_norm": 1.03125, "learning_rate": 0.0004510831424673609, "loss": 4.9513, "mean_token_accuracy": 0.21326931565999985, "num_tokens": 50560047.0, "step": 24365 }, { "entropy": 5.519158411026001, "epoch": 2.210631349782293, "grad_norm": 1.0859375, "learning_rate": 0.0004510629976341853, "loss": 4.9082, "mean_token_accuracy": 0.20999544262886047, "num_tokens": 50569704.0, "step": 24370 }, { "entropy": 5.488677644729615, "epoch": 2.2110849056603774, "grad_norm": 1.1171875, "learning_rate": 0.00045104284915998215, "loss": 4.9697, "mean_token_accuracy": 0.20823805332183837, "num_tokens": 50580006.0, "step": 24375 }, { "entropy": 5.445297813415527, "epoch": 2.2115384615384617, "grad_norm": 1.1953125, "learning_rate": 0.00045102269704516793, "loss": 4.9098, "mean_token_accuracy": 0.2198157787322998, "num_tokens": 50589593.0, "step": 24380 }, { "entropy": 5.513132762908936, "epoch": 2.211992017416546, "grad_norm": 1.1875, "learning_rate": 0.0004510025412901595, "loss": 4.8992, "mean_token_accuracy": 0.21415512561798095, "num_tokens": 50598774.0, "step": 24385 }, { "entropy": 5.439147520065307, "epoch": 2.2124455732946298, "grad_norm": 1.1953125, "learning_rate": 0.00045098238189537367, "loss": 4.8599, "mean_token_accuracy": 0.21891965121030807, "num_tokens": 50608815.0, "step": 24390 }, { "entropy": 5.4105188846588135, "epoch": 2.212899129172714, "grad_norm": 1.2265625, "learning_rate": 0.00045096221886122733, "loss": 5.0031, "mean_token_accuracy": 0.22026191800832748, "num_tokens": 50619255.0, "step": 24395 }, { "entropy": 5.497635412216186, "epoch": 2.2133526850507983, "grad_norm": 1.125, "learning_rate": 0.0004509420521881375, "loss": 4.9136, "mean_token_accuracy": 0.21755017936229706, "num_tokens": 50629483.0, "step": 24400 }, { "entropy": 5.462251853942871, "epoch": 2.2138062409288826, "grad_norm": 1.2109375, "learning_rate": 0.0004509218818765211, "loss": 4.867, "mean_token_accuracy": 0.2167743816971779, "num_tokens": 50638552.0, "step": 24405 }, { "entropy": 5.530922937393188, "epoch": 2.2142597968069664, "grad_norm": 1.1875, "learning_rate": 0.00045090170792679544, "loss": 4.8606, "mean_token_accuracy": 0.2127256065607071, "num_tokens": 50648752.0, "step": 24410 }, { "entropy": 5.538662338256836, "epoch": 2.2147133526850507, "grad_norm": 1.1953125, "learning_rate": 0.00045088153033937765, "loss": 4.9269, "mean_token_accuracy": 0.21609770506620407, "num_tokens": 50658373.0, "step": 24415 }, { "entropy": 5.476626062393189, "epoch": 2.215166908563135, "grad_norm": 1.1875, "learning_rate": 0.00045086134911468496, "loss": 4.9492, "mean_token_accuracy": 0.21640825569629668, "num_tokens": 50668529.0, "step": 24420 }, { "entropy": 5.530965518951416, "epoch": 2.215620464441219, "grad_norm": 1.2734375, "learning_rate": 0.0004508411642531347, "loss": 4.8712, "mean_token_accuracy": 0.21209428906440736, "num_tokens": 50678038.0, "step": 24425 }, { "entropy": 5.491864633560181, "epoch": 2.2160740203193035, "grad_norm": 1.140625, "learning_rate": 0.0004508209757551445, "loss": 4.9304, "mean_token_accuracy": 0.21791955679655076, "num_tokens": 50687788.0, "step": 24430 }, { "entropy": 5.521287965774536, "epoch": 2.2165275761973877, "grad_norm": 1.171875, "learning_rate": 0.00045080078362113153, "loss": 4.9291, "mean_token_accuracy": 0.21067391335964203, "num_tokens": 50697748.0, "step": 24435 }, { "entropy": 5.426697444915772, "epoch": 2.2169811320754715, "grad_norm": 1.1796875, "learning_rate": 0.00045078058785151363, "loss": 4.8277, "mean_token_accuracy": 0.22197608649730682, "num_tokens": 50707776.0, "step": 24440 }, { "entropy": 5.461878871917724, "epoch": 2.217434687953556, "grad_norm": 1.1328125, "learning_rate": 0.0004507603884467085, "loss": 4.9745, "mean_token_accuracy": 0.20863485783338548, "num_tokens": 50717547.0, "step": 24445 }, { "entropy": 5.44483323097229, "epoch": 2.21788824383164, "grad_norm": 1.1171875, "learning_rate": 0.0004507401854071336, "loss": 4.8648, "mean_token_accuracy": 0.21784850358963012, "num_tokens": 50728446.0, "step": 24450 }, { "entropy": 5.480695533752441, "epoch": 2.2183417997097243, "grad_norm": 1.328125, "learning_rate": 0.00045071997873320687, "loss": 4.8573, "mean_token_accuracy": 0.2089684024453163, "num_tokens": 50737909.0, "step": 24455 }, { "entropy": 5.455913972854614, "epoch": 2.2187953555878086, "grad_norm": 1.0, "learning_rate": 0.00045069976842534635, "loss": 4.9195, "mean_token_accuracy": 0.21954180002212526, "num_tokens": 50749745.0, "step": 24460 }, { "entropy": 5.5276398181915285, "epoch": 2.2192489114658924, "grad_norm": 1.0078125, "learning_rate": 0.0004506795544839697, "loss": 4.9117, "mean_token_accuracy": 0.20980933755636216, "num_tokens": 50760073.0, "step": 24465 }, { "entropy": 5.540490531921387, "epoch": 2.2197024673439767, "grad_norm": 1.1796875, "learning_rate": 0.0004506593369094951, "loss": 4.8976, "mean_token_accuracy": 0.20876749753952026, "num_tokens": 50769261.0, "step": 24470 }, { "entropy": 5.577752923965454, "epoch": 2.220156023222061, "grad_norm": 1.1171875, "learning_rate": 0.00045063911570234074, "loss": 4.9904, "mean_token_accuracy": 0.20549732595682144, "num_tokens": 50779572.0, "step": 24475 }, { "entropy": 5.443750715255737, "epoch": 2.2206095791001452, "grad_norm": 1.09375, "learning_rate": 0.0004506188908629247, "loss": 4.8732, "mean_token_accuracy": 0.2161690041422844, "num_tokens": 50789893.0, "step": 24480 }, { "entropy": 5.41756763458252, "epoch": 2.2210631349782295, "grad_norm": 1.0859375, "learning_rate": 0.0004505986623916652, "loss": 4.8274, "mean_token_accuracy": 0.2138019859790802, "num_tokens": 50799177.0, "step": 24485 }, { "entropy": 5.441324996948242, "epoch": 2.2215166908563133, "grad_norm": 1.09375, "learning_rate": 0.0004505784302889806, "loss": 4.887, "mean_token_accuracy": 0.21745399832725526, "num_tokens": 50810093.0, "step": 24490 }, { "entropy": 5.57575159072876, "epoch": 2.2219702467343976, "grad_norm": 1.21875, "learning_rate": 0.00045055819455528935, "loss": 5.04, "mean_token_accuracy": 0.20586762428283692, "num_tokens": 50820272.0, "step": 24495 }, { "entropy": 5.526523685455322, "epoch": 2.222423802612482, "grad_norm": 1.0390625, "learning_rate": 0.0004505379551910099, "loss": 4.9912, "mean_token_accuracy": 0.20946702659130095, "num_tokens": 50830301.0, "step": 24500 }, { "entropy": 5.592215633392334, "epoch": 2.222877358490566, "grad_norm": 1.203125, "learning_rate": 0.0004505177121965608, "loss": 4.9769, "mean_token_accuracy": 0.2144727036356926, "num_tokens": 50839937.0, "step": 24505 }, { "entropy": 5.4974335670471195, "epoch": 2.2233309143686504, "grad_norm": 1.1796875, "learning_rate": 0.00045049746557236067, "loss": 4.8869, "mean_token_accuracy": 0.22041078358888627, "num_tokens": 50850295.0, "step": 24510 }, { "entropy": 5.534443330764771, "epoch": 2.223784470246734, "grad_norm": 1.015625, "learning_rate": 0.00045047721531882827, "loss": 4.9692, "mean_token_accuracy": 0.20637685507535936, "num_tokens": 50861889.0, "step": 24515 }, { "entropy": 5.501532459259034, "epoch": 2.2242380261248185, "grad_norm": 1.0703125, "learning_rate": 0.0004504569614363823, "loss": 4.9072, "mean_token_accuracy": 0.21105297207832335, "num_tokens": 50872011.0, "step": 24520 }, { "entropy": 5.554976177215576, "epoch": 2.2246915820029027, "grad_norm": 1.1484375, "learning_rate": 0.0004504367039254416, "loss": 4.9437, "mean_token_accuracy": 0.20835031270980836, "num_tokens": 50882559.0, "step": 24525 }, { "entropy": 5.508613061904907, "epoch": 2.225145137880987, "grad_norm": 1.140625, "learning_rate": 0.00045041644278642523, "loss": 5.0047, "mean_token_accuracy": 0.20145211070775987, "num_tokens": 50894132.0, "step": 24530 }, { "entropy": 5.544841957092285, "epoch": 2.2255986937590713, "grad_norm": 1.28125, "learning_rate": 0.00045039617801975214, "loss": 4.9267, "mean_token_accuracy": 0.21191783845424653, "num_tokens": 50904337.0, "step": 24535 }, { "entropy": 5.54058198928833, "epoch": 2.2260522496371555, "grad_norm": 1.1875, "learning_rate": 0.00045037590962584143, "loss": 4.9746, "mean_token_accuracy": 0.20757041722536088, "num_tokens": 50914961.0, "step": 24540 }, { "entropy": 5.549249887466431, "epoch": 2.2265058055152394, "grad_norm": 1.125, "learning_rate": 0.0004503556376051121, "loss": 4.9291, "mean_token_accuracy": 0.21164951473474503, "num_tokens": 50925682.0, "step": 24545 }, { "entropy": 5.475205898284912, "epoch": 2.2269593613933236, "grad_norm": 1.1484375, "learning_rate": 0.00045033536195798355, "loss": 4.8447, "mean_token_accuracy": 0.2260774403810501, "num_tokens": 50935809.0, "step": 24550 }, { "entropy": 5.5669139385223385, "epoch": 2.227412917271408, "grad_norm": 1.1171875, "learning_rate": 0.000450315082684875, "loss": 5.035, "mean_token_accuracy": 0.20063673108816146, "num_tokens": 50946098.0, "step": 24555 }, { "entropy": 5.542860651016236, "epoch": 2.227866473149492, "grad_norm": 1.15625, "learning_rate": 0.0004502947997862059, "loss": 4.9947, "mean_token_accuracy": 0.20911372303962708, "num_tokens": 50956240.0, "step": 24560 }, { "entropy": 5.523819303512573, "epoch": 2.228320029027576, "grad_norm": 1.109375, "learning_rate": 0.0004502745132623957, "loss": 4.896, "mean_token_accuracy": 0.2186339095234871, "num_tokens": 50966870.0, "step": 24565 }, { "entropy": 5.498482418060303, "epoch": 2.2287735849056602, "grad_norm": 1.0859375, "learning_rate": 0.0004502542231138639, "loss": 4.8986, "mean_token_accuracy": 0.20982664078474045, "num_tokens": 50977528.0, "step": 24570 }, { "entropy": 5.484511232376098, "epoch": 2.2292271407837445, "grad_norm": 1.0, "learning_rate": 0.00045023392934103005, "loss": 4.9283, "mean_token_accuracy": 0.2067478433251381, "num_tokens": 50988565.0, "step": 24575 }, { "entropy": 5.493417549133301, "epoch": 2.2296806966618288, "grad_norm": 1.2578125, "learning_rate": 0.00045021363194431397, "loss": 4.9695, "mean_token_accuracy": 0.21599013358354568, "num_tokens": 50998410.0, "step": 24580 }, { "entropy": 5.561251401901245, "epoch": 2.230134252539913, "grad_norm": 1.15625, "learning_rate": 0.0004501933309241352, "loss": 4.9639, "mean_token_accuracy": 0.20599304735660554, "num_tokens": 51008890.0, "step": 24585 }, { "entropy": 5.499842500686645, "epoch": 2.2305878084179973, "grad_norm": 1.0859375, "learning_rate": 0.0004501730262809138, "loss": 4.8884, "mean_token_accuracy": 0.21749539524316788, "num_tokens": 51020264.0, "step": 24590 }, { "entropy": 5.457573461532593, "epoch": 2.231041364296081, "grad_norm": 1.125, "learning_rate": 0.0004501527180150696, "loss": 4.8393, "mean_token_accuracy": 0.21981181353330612, "num_tokens": 51029892.0, "step": 24595 }, { "entropy": 5.578875160217285, "epoch": 2.2314949201741654, "grad_norm": 1.125, "learning_rate": 0.0004501324061270224, "loss": 5.0499, "mean_token_accuracy": 0.20302218496799468, "num_tokens": 51040499.0, "step": 24600 }, { "entropy": 5.398529386520385, "epoch": 2.2319484760522497, "grad_norm": 1.140625, "learning_rate": 0.0004501120906171926, "loss": 4.8409, "mean_token_accuracy": 0.2168241873383522, "num_tokens": 51050395.0, "step": 24605 }, { "entropy": 5.443792819976807, "epoch": 2.232402031930334, "grad_norm": 1.1796875, "learning_rate": 0.00045009177148600004, "loss": 4.8417, "mean_token_accuracy": 0.22068117260932923, "num_tokens": 51060316.0, "step": 24610 }, { "entropy": 5.413550853729248, "epoch": 2.232855587808418, "grad_norm": 1.1328125, "learning_rate": 0.00045007144873386514, "loss": 4.9084, "mean_token_accuracy": 0.21476766020059584, "num_tokens": 51070032.0, "step": 24615 }, { "entropy": 5.576509952545166, "epoch": 2.233309143686502, "grad_norm": 1.078125, "learning_rate": 0.00045005112236120795, "loss": 5.0515, "mean_token_accuracy": 0.20426271706819535, "num_tokens": 51080738.0, "step": 24620 }, { "entropy": 5.522678804397583, "epoch": 2.2337626995645863, "grad_norm": 1.21875, "learning_rate": 0.000450030792368449, "loss": 4.8765, "mean_token_accuracy": 0.21783071607351304, "num_tokens": 51090287.0, "step": 24625 }, { "entropy": 5.470934820175171, "epoch": 2.2342162554426706, "grad_norm": 1.0546875, "learning_rate": 0.0004500104587560086, "loss": 4.9395, "mean_token_accuracy": 0.20700586438179017, "num_tokens": 51101188.0, "step": 24630 }, { "entropy": 5.459479570388794, "epoch": 2.234669811320755, "grad_norm": 1.1171875, "learning_rate": 0.0004499901215243074, "loss": 4.8459, "mean_token_accuracy": 0.2162790447473526, "num_tokens": 51112310.0, "step": 24635 }, { "entropy": 5.501789855957031, "epoch": 2.235123367198839, "grad_norm": 1.28125, "learning_rate": 0.00044996978067376575, "loss": 4.9434, "mean_token_accuracy": 0.2125258967280388, "num_tokens": 51122481.0, "step": 24640 }, { "entropy": 5.466570663452148, "epoch": 2.235576923076923, "grad_norm": 1.2265625, "learning_rate": 0.00044994943620480453, "loss": 4.9114, "mean_token_accuracy": 0.2072527751326561, "num_tokens": 51131918.0, "step": 24645 }, { "entropy": 5.517190742492676, "epoch": 2.236030478955007, "grad_norm": 1.0, "learning_rate": 0.00044992908811784446, "loss": 5.0, "mean_token_accuracy": 0.20055712312459945, "num_tokens": 51142861.0, "step": 24650 }, { "entropy": 5.535826683044434, "epoch": 2.2364840348330914, "grad_norm": 1.125, "learning_rate": 0.00044990873641330615, "loss": 4.9718, "mean_token_accuracy": 0.21103595048189164, "num_tokens": 51153956.0, "step": 24655 }, { "entropy": 5.535042858123779, "epoch": 2.2369375907111757, "grad_norm": 1.109375, "learning_rate": 0.0004498883810916107, "loss": 4.8427, "mean_token_accuracy": 0.21812597513198853, "num_tokens": 51164499.0, "step": 24660 }, { "entropy": 5.539503908157348, "epoch": 2.23739114658926, "grad_norm": 1.015625, "learning_rate": 0.0004498680221531789, "loss": 4.9795, "mean_token_accuracy": 0.21072584837675096, "num_tokens": 51175722.0, "step": 24665 }, { "entropy": 5.486478090286255, "epoch": 2.237844702467344, "grad_norm": 1.1875, "learning_rate": 0.0004498476595984319, "loss": 4.905, "mean_token_accuracy": 0.21377230137586595, "num_tokens": 51184597.0, "step": 24670 }, { "entropy": 5.4386683940887455, "epoch": 2.238298258345428, "grad_norm": 1.125, "learning_rate": 0.0004498272934277906, "loss": 4.9485, "mean_token_accuracy": 0.21161817759275436, "num_tokens": 51194751.0, "step": 24675 }, { "entropy": 5.496107482910157, "epoch": 2.2387518142235123, "grad_norm": 1.1796875, "learning_rate": 0.00044980692364167646, "loss": 4.8969, "mean_token_accuracy": 0.2190478965640068, "num_tokens": 51204184.0, "step": 24680 }, { "entropy": 5.507309103012085, "epoch": 2.2392053701015966, "grad_norm": 1.265625, "learning_rate": 0.0004497865502405105, "loss": 4.9703, "mean_token_accuracy": 0.21511485278606415, "num_tokens": 51213761.0, "step": 24685 }, { "entropy": 5.513066959381104, "epoch": 2.239658925979681, "grad_norm": 1.0546875, "learning_rate": 0.00044976617322471424, "loss": 4.9026, "mean_token_accuracy": 0.21550100892782212, "num_tokens": 51224150.0, "step": 24690 }, { "entropy": 5.535574197769165, "epoch": 2.2401124818577647, "grad_norm": 1.1796875, "learning_rate": 0.000449745792594709, "loss": 4.9985, "mean_token_accuracy": 0.21105946898460387, "num_tokens": 51235133.0, "step": 24695 }, { "entropy": 5.533110189437866, "epoch": 2.240566037735849, "grad_norm": 1.1171875, "learning_rate": 0.00044972540835091617, "loss": 4.9269, "mean_token_accuracy": 0.21311247795820237, "num_tokens": 51245632.0, "step": 24700 }, { "entropy": 5.535616540908814, "epoch": 2.241019593613933, "grad_norm": 1.1796875, "learning_rate": 0.00044970502049375736, "loss": 4.9614, "mean_token_accuracy": 0.21472794711589813, "num_tokens": 51255747.0, "step": 24705 }, { "entropy": 5.491992998123169, "epoch": 2.2414731494920175, "grad_norm": 1.15625, "learning_rate": 0.0004496846290236542, "loss": 4.8889, "mean_token_accuracy": 0.21574348211288452, "num_tokens": 51265531.0, "step": 24710 }, { "entropy": 5.459112119674683, "epoch": 2.2419267053701017, "grad_norm": 1.1328125, "learning_rate": 0.00044966423394102845, "loss": 4.9491, "mean_token_accuracy": 0.21495272368192672, "num_tokens": 51275319.0, "step": 24715 }, { "entropy": 5.506104612350464, "epoch": 2.2423802612481856, "grad_norm": 1.1328125, "learning_rate": 0.00044964383524630176, "loss": 4.9538, "mean_token_accuracy": 0.2196805328130722, "num_tokens": 51285655.0, "step": 24720 }, { "entropy": 5.446424865722657, "epoch": 2.24283381712627, "grad_norm": 1.109375, "learning_rate": 0.0004496234329398961, "loss": 4.8898, "mean_token_accuracy": 0.20930022299289702, "num_tokens": 51295938.0, "step": 24725 }, { "entropy": 5.499974632263184, "epoch": 2.243287373004354, "grad_norm": 1.1796875, "learning_rate": 0.0004496030270222333, "loss": 4.8924, "mean_token_accuracy": 0.21732360869646072, "num_tokens": 51306483.0, "step": 24730 }, { "entropy": 5.501000499725341, "epoch": 2.2437409288824384, "grad_norm": 1.1484375, "learning_rate": 0.00044958261749373547, "loss": 4.9137, "mean_token_accuracy": 0.2183854639530182, "num_tokens": 51316446.0, "step": 24735 }, { "entropy": 5.460595941543579, "epoch": 2.2441944847605226, "grad_norm": 1.40625, "learning_rate": 0.00044956220435482465, "loss": 4.9399, "mean_token_accuracy": 0.212315334379673, "num_tokens": 51326840.0, "step": 24740 }, { "entropy": 5.4905448913574215, "epoch": 2.244648040638607, "grad_norm": 1.1328125, "learning_rate": 0.00044954178760592283, "loss": 4.9861, "mean_token_accuracy": 0.20576706528663635, "num_tokens": 51337573.0, "step": 24745 }, { "entropy": 5.548055505752563, "epoch": 2.2451015965166907, "grad_norm": 1.1796875, "learning_rate": 0.00044952136724745254, "loss": 4.9512, "mean_token_accuracy": 0.21130934804677964, "num_tokens": 51347827.0, "step": 24750 }, { "entropy": 5.493374490737915, "epoch": 2.245555152394775, "grad_norm": 1.140625, "learning_rate": 0.0004495009432798358, "loss": 4.8979, "mean_token_accuracy": 0.21528324037790297, "num_tokens": 51358396.0, "step": 24755 }, { "entropy": 5.529035186767578, "epoch": 2.2460087082728593, "grad_norm": 1.140625, "learning_rate": 0.00044948051570349503, "loss": 4.9437, "mean_token_accuracy": 0.20652328729629515, "num_tokens": 51368882.0, "step": 24760 }, { "entropy": 5.496187686920166, "epoch": 2.2464622641509435, "grad_norm": 1.1484375, "learning_rate": 0.0004494600845188528, "loss": 4.983, "mean_token_accuracy": 0.21016175150871277, "num_tokens": 51378717.0, "step": 24765 }, { "entropy": 5.5063189506530765, "epoch": 2.2469158200290273, "grad_norm": 1.0390625, "learning_rate": 0.00044943964972633154, "loss": 4.9309, "mean_token_accuracy": 0.20500435829162597, "num_tokens": 51389270.0, "step": 24770 }, { "entropy": 5.497609996795655, "epoch": 2.2473693759071116, "grad_norm": 1.171875, "learning_rate": 0.0004494192113263539, "loss": 4.9505, "mean_token_accuracy": 0.2126495897769928, "num_tokens": 51400025.0, "step": 24775 }, { "entropy": 5.520210933685303, "epoch": 2.247822931785196, "grad_norm": 0.99609375, "learning_rate": 0.00044939876931934255, "loss": 4.9259, "mean_token_accuracy": 0.21629325896501542, "num_tokens": 51410903.0, "step": 24780 }, { "entropy": 5.47692551612854, "epoch": 2.24827648766328, "grad_norm": 1.140625, "learning_rate": 0.0004493783237057201, "loss": 4.8886, "mean_token_accuracy": 0.2160784959793091, "num_tokens": 51420246.0, "step": 24785 }, { "entropy": 5.5707673072814945, "epoch": 2.2487300435413644, "grad_norm": 1.078125, "learning_rate": 0.0004493578744859095, "loss": 5.0458, "mean_token_accuracy": 0.20975974947214127, "num_tokens": 51431309.0, "step": 24790 }, { "entropy": 5.544101285934448, "epoch": 2.2491835994194487, "grad_norm": 1.0859375, "learning_rate": 0.0004493374216603338, "loss": 4.9816, "mean_token_accuracy": 0.20526008754968644, "num_tokens": 51443142.0, "step": 24795 }, { "entropy": 5.637153005599975, "epoch": 2.2496371552975325, "grad_norm": 1.0546875, "learning_rate": 0.0004493169652294156, "loss": 5.1427, "mean_token_accuracy": 0.20157742798328399, "num_tokens": 51454499.0, "step": 24800 }, { "entropy": 5.506328010559082, "epoch": 2.2500907111756168, "grad_norm": 1.21875, "learning_rate": 0.00044929650519357823, "loss": 4.9326, "mean_token_accuracy": 0.21498187780380248, "num_tokens": 51464667.0, "step": 24805 }, { "entropy": 5.545187854766846, "epoch": 2.250544267053701, "grad_norm": 1.234375, "learning_rate": 0.0004492760415532447, "loss": 4.9471, "mean_token_accuracy": 0.2146904483437538, "num_tokens": 51473627.0, "step": 24810 }, { "entropy": 5.484700441360474, "epoch": 2.2509978229317853, "grad_norm": 1.1328125, "learning_rate": 0.0004492555743088382, "loss": 4.8097, "mean_token_accuracy": 0.2185356765985489, "num_tokens": 51483052.0, "step": 24815 }, { "entropy": 5.46072359085083, "epoch": 2.2514513788098696, "grad_norm": 1.140625, "learning_rate": 0.000449235103460782, "loss": 4.9448, "mean_token_accuracy": 0.21084153056144714, "num_tokens": 51492422.0, "step": 24820 }, { "entropy": 5.419351291656494, "epoch": 2.2519049346879534, "grad_norm": 1.1640625, "learning_rate": 0.0004492146290094995, "loss": 4.8775, "mean_token_accuracy": 0.21834704428911209, "num_tokens": 51503566.0, "step": 24825 }, { "entropy": 5.483908700942993, "epoch": 2.2523584905660377, "grad_norm": 1.125, "learning_rate": 0.00044919415095541406, "loss": 4.9057, "mean_token_accuracy": 0.21446417272090912, "num_tokens": 51513699.0, "step": 24830 }, { "entropy": 5.525264263153076, "epoch": 2.252812046444122, "grad_norm": 1.125, "learning_rate": 0.00044917366929894914, "loss": 4.924, "mean_token_accuracy": 0.21129962801933289, "num_tokens": 51524745.0, "step": 24835 }, { "entropy": 5.497190380096436, "epoch": 2.253265602322206, "grad_norm": 1.1171875, "learning_rate": 0.00044915318404052846, "loss": 4.8706, "mean_token_accuracy": 0.20967897027730942, "num_tokens": 51536516.0, "step": 24840 }, { "entropy": 5.5260673522949215, "epoch": 2.2537191582002905, "grad_norm": 1.1953125, "learning_rate": 0.00044913269518057547, "loss": 4.9652, "mean_token_accuracy": 0.2036701887845993, "num_tokens": 51547063.0, "step": 24845 }, { "entropy": 5.485346078872681, "epoch": 2.2541727140783743, "grad_norm": 1.125, "learning_rate": 0.000449112202719514, "loss": 4.9187, "mean_token_accuracy": 0.21127251535654068, "num_tokens": 51557244.0, "step": 24850 }, { "entropy": 5.544744873046875, "epoch": 2.2546262699564585, "grad_norm": 1.1484375, "learning_rate": 0.0004490917066577678, "loss": 4.9685, "mean_token_accuracy": 0.2155696615576744, "num_tokens": 51567630.0, "step": 24855 }, { "entropy": 5.4772899627685545, "epoch": 2.255079825834543, "grad_norm": 1.125, "learning_rate": 0.00044907120699576075, "loss": 4.9698, "mean_token_accuracy": 0.21144208461046218, "num_tokens": 51577951.0, "step": 24860 }, { "entropy": 5.516797971725464, "epoch": 2.255533381712627, "grad_norm": 1.0625, "learning_rate": 0.00044905070373391684, "loss": 4.9276, "mean_token_accuracy": 0.2137904241681099, "num_tokens": 51587533.0, "step": 24865 }, { "entropy": 5.581253719329834, "epoch": 2.2559869375907113, "grad_norm": 1.1171875, "learning_rate": 0.0004490301968726599, "loss": 4.9112, "mean_token_accuracy": 0.2248891219496727, "num_tokens": 51597212.0, "step": 24870 }, { "entropy": 5.520354604721069, "epoch": 2.256440493468795, "grad_norm": 1.0859375, "learning_rate": 0.00044900968641241426, "loss": 4.9403, "mean_token_accuracy": 0.22100985795259476, "num_tokens": 51608520.0, "step": 24875 }, { "entropy": 5.514130020141602, "epoch": 2.2568940493468794, "grad_norm": 1.109375, "learning_rate": 0.0004489891723536039, "loss": 5.012, "mean_token_accuracy": 0.20341854840517043, "num_tokens": 51619651.0, "step": 24880 }, { "entropy": 5.442519950866699, "epoch": 2.2573476052249637, "grad_norm": 1.171875, "learning_rate": 0.0004489686546966531, "loss": 4.838, "mean_token_accuracy": 0.21501216739416124, "num_tokens": 51630184.0, "step": 24885 }, { "entropy": 5.414009380340576, "epoch": 2.257801161103048, "grad_norm": 1.0859375, "learning_rate": 0.00044894813344198626, "loss": 4.8403, "mean_token_accuracy": 0.22066620141267776, "num_tokens": 51641293.0, "step": 24890 }, { "entropy": 5.4918395519256595, "epoch": 2.2582547169811322, "grad_norm": 1.2265625, "learning_rate": 0.0004489276085900276, "loss": 4.9356, "mean_token_accuracy": 0.2189863309264183, "num_tokens": 51652002.0, "step": 24895 }, { "entropy": 5.407748174667359, "epoch": 2.2587082728592165, "grad_norm": 1.1171875, "learning_rate": 0.00044890708014120174, "loss": 4.8033, "mean_token_accuracy": 0.2253187268972397, "num_tokens": 51661668.0, "step": 24900 }, { "entropy": 5.58123369216919, "epoch": 2.2591618287373003, "grad_norm": 1.1796875, "learning_rate": 0.0004488865480959331, "loss": 4.9786, "mean_token_accuracy": 0.20617177039384843, "num_tokens": 51672879.0, "step": 24905 }, { "entropy": 5.50647087097168, "epoch": 2.2596153846153846, "grad_norm": 1.0234375, "learning_rate": 0.0004488660124546464, "loss": 4.9293, "mean_token_accuracy": 0.2115379422903061, "num_tokens": 51683878.0, "step": 24910 }, { "entropy": 5.456657075881958, "epoch": 2.260068940493469, "grad_norm": 1.0625, "learning_rate": 0.0004488454732177662, "loss": 4.9378, "mean_token_accuracy": 0.21216744929552078, "num_tokens": 51693971.0, "step": 24915 }, { "entropy": 5.485080003738403, "epoch": 2.260522496371553, "grad_norm": 1.078125, "learning_rate": 0.00044882493038571737, "loss": 4.8495, "mean_token_accuracy": 0.22081977277994155, "num_tokens": 51703685.0, "step": 24920 }, { "entropy": 5.5374064445495605, "epoch": 2.260976052249637, "grad_norm": 1.0859375, "learning_rate": 0.00044880438395892457, "loss": 4.9533, "mean_token_accuracy": 0.20925583839416503, "num_tokens": 51714469.0, "step": 24925 }, { "entropy": 5.521102619171143, "epoch": 2.261429608127721, "grad_norm": 1.1953125, "learning_rate": 0.0004487838339378129, "loss": 5.0056, "mean_token_accuracy": 0.20159583836793898, "num_tokens": 51725283.0, "step": 24930 }, { "entropy": 5.502027416229248, "epoch": 2.2618831640058055, "grad_norm": 1.1171875, "learning_rate": 0.0004487632803228072, "loss": 4.9348, "mean_token_accuracy": 0.2101256638765335, "num_tokens": 51735628.0, "step": 24935 }, { "entropy": 5.439960670471192, "epoch": 2.2623367198838897, "grad_norm": 1.1328125, "learning_rate": 0.00044874272311433265, "loss": 4.798, "mean_token_accuracy": 0.22405184656381608, "num_tokens": 51745991.0, "step": 24940 }, { "entropy": 5.469972610473633, "epoch": 2.262790275761974, "grad_norm": 1.03125, "learning_rate": 0.0004487221623128143, "loss": 4.8452, "mean_token_accuracy": 0.22149375677108765, "num_tokens": 51756306.0, "step": 24945 }, { "entropy": 5.490349435806275, "epoch": 2.2632438316400583, "grad_norm": 1.15625, "learning_rate": 0.00044870159791867743, "loss": 4.9746, "mean_token_accuracy": 0.21372815519571303, "num_tokens": 51765466.0, "step": 24950 }, { "entropy": 5.513730669021607, "epoch": 2.263697387518142, "grad_norm": 1.1328125, "learning_rate": 0.00044868102993234716, "loss": 4.9424, "mean_token_accuracy": 0.2100026860833168, "num_tokens": 51775526.0, "step": 24955 }, { "entropy": 5.528044748306274, "epoch": 2.2641509433962264, "grad_norm": 1.140625, "learning_rate": 0.00044866045835424896, "loss": 4.9259, "mean_token_accuracy": 0.20677538514137267, "num_tokens": 51785434.0, "step": 24960 }, { "entropy": 5.518482732772827, "epoch": 2.2646044992743106, "grad_norm": 1.1484375, "learning_rate": 0.0004486398831848082, "loss": 4.9966, "mean_token_accuracy": 0.20300792455673217, "num_tokens": 51796047.0, "step": 24965 }, { "entropy": 5.512976408004761, "epoch": 2.265058055152395, "grad_norm": 1.15625, "learning_rate": 0.00044861930442445037, "loss": 4.9261, "mean_token_accuracy": 0.2072262153029442, "num_tokens": 51806173.0, "step": 24970 }, { "entropy": 5.594843912124634, "epoch": 2.2655116110304787, "grad_norm": 1.078125, "learning_rate": 0.0004485987220736012, "loss": 5.0909, "mean_token_accuracy": 0.20474183261394502, "num_tokens": 51817644.0, "step": 24975 }, { "entropy": 5.5645793914794925, "epoch": 2.265965166908563, "grad_norm": 1.15625, "learning_rate": 0.0004485781361326861, "loss": 5.0502, "mean_token_accuracy": 0.20522074550390243, "num_tokens": 51829746.0, "step": 24980 }, { "entropy": 5.516353368759155, "epoch": 2.2664187227866472, "grad_norm": 1.15625, "learning_rate": 0.000448557546602131, "loss": 4.9911, "mean_token_accuracy": 0.20501539409160613, "num_tokens": 51840868.0, "step": 24985 }, { "entropy": 5.501433801651001, "epoch": 2.2668722786647315, "grad_norm": 1.109375, "learning_rate": 0.00044853695348236156, "loss": 4.8673, "mean_token_accuracy": 0.21613098978996276, "num_tokens": 51851385.0, "step": 24990 }, { "entropy": 5.5069276809692385, "epoch": 2.2673258345428158, "grad_norm": 1.09375, "learning_rate": 0.00044851635677380374, "loss": 4.9106, "mean_token_accuracy": 0.20622318536043166, "num_tokens": 51861021.0, "step": 24995 }, { "entropy": 5.499903392791748, "epoch": 2.2677793904209, "grad_norm": 1.234375, "learning_rate": 0.0004484957564768834, "loss": 4.9941, "mean_token_accuracy": 0.20895010679960252, "num_tokens": 51870688.0, "step": 25000 }, { "entropy": 5.483315944671631, "epoch": 2.268232946298984, "grad_norm": 1.1875, "learning_rate": 0.00044847515259202657, "loss": 4.9425, "mean_token_accuracy": 0.20906522125005722, "num_tokens": 51880439.0, "step": 25005 }, { "entropy": 5.443620491027832, "epoch": 2.268686502177068, "grad_norm": 1.171875, "learning_rate": 0.00044845454511965947, "loss": 4.9134, "mean_token_accuracy": 0.21530711203813552, "num_tokens": 51890861.0, "step": 25010 }, { "entropy": 5.5371160984039305, "epoch": 2.2691400580551524, "grad_norm": 1.1171875, "learning_rate": 0.00044843393406020823, "loss": 4.9298, "mean_token_accuracy": 0.21241849660873413, "num_tokens": 51900687.0, "step": 25015 }, { "entropy": 5.5482300281524655, "epoch": 2.2695936139332367, "grad_norm": 1.015625, "learning_rate": 0.00044841331941409884, "loss": 5.0843, "mean_token_accuracy": 0.19882063269615174, "num_tokens": 51911805.0, "step": 25020 }, { "entropy": 5.477043485641479, "epoch": 2.270047169811321, "grad_norm": 1.0234375, "learning_rate": 0.00044839270118175793, "loss": 4.8435, "mean_token_accuracy": 0.2224956512451172, "num_tokens": 51922520.0, "step": 25025 }, { "entropy": 5.568369674682617, "epoch": 2.2705007256894048, "grad_norm": 0.953125, "learning_rate": 0.0004483720793636118, "loss": 4.9998, "mean_token_accuracy": 0.20784735381603242, "num_tokens": 51934056.0, "step": 25030 }, { "entropy": 5.528074073791504, "epoch": 2.270954281567489, "grad_norm": 1.0859375, "learning_rate": 0.00044835145396008685, "loss": 4.9774, "mean_token_accuracy": 0.2076761394739151, "num_tokens": 51944696.0, "step": 25035 }, { "entropy": 5.551304531097412, "epoch": 2.2714078374455733, "grad_norm": 1.1015625, "learning_rate": 0.0004483308249716097, "loss": 4.9764, "mean_token_accuracy": 0.21023217290639878, "num_tokens": 51955111.0, "step": 25040 }, { "entropy": 5.491563367843628, "epoch": 2.2718613933236576, "grad_norm": 1.1484375, "learning_rate": 0.0004483101923986068, "loss": 4.9277, "mean_token_accuracy": 0.21420104503631593, "num_tokens": 51966036.0, "step": 25045 }, { "entropy": 5.456214714050293, "epoch": 2.272314949201742, "grad_norm": 1.1484375, "learning_rate": 0.00044828955624150505, "loss": 4.9381, "mean_token_accuracy": 0.21493476033210754, "num_tokens": 51976060.0, "step": 25050 }, { "entropy": 5.522627496719361, "epoch": 2.2727685050798256, "grad_norm": 1.0625, "learning_rate": 0.0004482689165007311, "loss": 4.9288, "mean_token_accuracy": 0.20994595885276796, "num_tokens": 51986016.0, "step": 25055 }, { "entropy": 5.475983476638794, "epoch": 2.27322206095791, "grad_norm": 1.1640625, "learning_rate": 0.00044824827317671177, "loss": 4.8662, "mean_token_accuracy": 0.22039448767900466, "num_tokens": 51994794.0, "step": 25060 }, { "entropy": 5.390714311599732, "epoch": 2.273675616835994, "grad_norm": 1.140625, "learning_rate": 0.000448227626269874, "loss": 4.8617, "mean_token_accuracy": 0.2154348686337471, "num_tokens": 52004976.0, "step": 25065 }, { "entropy": 5.523627901077271, "epoch": 2.2741291727140784, "grad_norm": 1.0546875, "learning_rate": 0.00044820697578064485, "loss": 4.9506, "mean_token_accuracy": 0.20627030432224275, "num_tokens": 52016380.0, "step": 25070 }, { "entropy": 5.553480815887451, "epoch": 2.2745827285921627, "grad_norm": 1.15625, "learning_rate": 0.0004481863217094513, "loss": 4.9062, "mean_token_accuracy": 0.2135339841246605, "num_tokens": 52026439.0, "step": 25075 }, { "entropy": 5.48488039970398, "epoch": 2.2750362844702465, "grad_norm": 1.109375, "learning_rate": 0.0004481656640567204, "loss": 4.8799, "mean_token_accuracy": 0.21348977833986282, "num_tokens": 52037111.0, "step": 25080 }, { "entropy": 5.458954763412476, "epoch": 2.275489840348331, "grad_norm": 1.0390625, "learning_rate": 0.0004481450028228795, "loss": 4.9367, "mean_token_accuracy": 0.20922750979661942, "num_tokens": 52047463.0, "step": 25085 }, { "entropy": 5.503176927566528, "epoch": 2.275943396226415, "grad_norm": 1.0625, "learning_rate": 0.0004481243380083558, "loss": 4.9507, "mean_token_accuracy": 0.2129725322127342, "num_tokens": 52058081.0, "step": 25090 }, { "entropy": 5.500329685211182, "epoch": 2.2763969521044993, "grad_norm": 1.078125, "learning_rate": 0.0004481036696135767, "loss": 4.9487, "mean_token_accuracy": 0.21019009202718736, "num_tokens": 52069367.0, "step": 25095 }, { "entropy": 5.553674745559692, "epoch": 2.2768505079825836, "grad_norm": 1.171875, "learning_rate": 0.0004480829976389695, "loss": 4.9019, "mean_token_accuracy": 0.21269881278276442, "num_tokens": 52080023.0, "step": 25100 }, { "entropy": 5.464703989028931, "epoch": 2.277304063860668, "grad_norm": 1.15625, "learning_rate": 0.00044806232208496194, "loss": 4.9342, "mean_token_accuracy": 0.2161496415734291, "num_tokens": 52089184.0, "step": 25105 }, { "entropy": 5.532656240463257, "epoch": 2.2777576197387517, "grad_norm": 1.0390625, "learning_rate": 0.0004480416429519814, "loss": 5.0014, "mean_token_accuracy": 0.21149049550294877, "num_tokens": 52098711.0, "step": 25110 }, { "entropy": 5.541463422775268, "epoch": 2.278211175616836, "grad_norm": 1.0703125, "learning_rate": 0.0004480209602404556, "loss": 4.911, "mean_token_accuracy": 0.22044273167848588, "num_tokens": 52108826.0, "step": 25115 }, { "entropy": 5.508780145645142, "epoch": 2.27866473149492, "grad_norm": 1.140625, "learning_rate": 0.0004480002739508122, "loss": 4.8892, "mean_token_accuracy": 0.21802321821451187, "num_tokens": 52118934.0, "step": 25120 }, { "entropy": 5.449331474304199, "epoch": 2.2791182873730045, "grad_norm": 1.0703125, "learning_rate": 0.0004479795840834791, "loss": 4.8689, "mean_token_accuracy": 0.2189303532242775, "num_tokens": 52129803.0, "step": 25125 }, { "entropy": 5.408039951324463, "epoch": 2.2795718432510883, "grad_norm": 1.0703125, "learning_rate": 0.00044795889063888413, "loss": 4.8086, "mean_token_accuracy": 0.21691848635673522, "num_tokens": 52140070.0, "step": 25130 }, { "entropy": 5.638384771347046, "epoch": 2.2800253991291726, "grad_norm": 1.1640625, "learning_rate": 0.0004479381936174552, "loss": 5.0906, "mean_token_accuracy": 0.2016774982213974, "num_tokens": 52150462.0, "step": 25135 }, { "entropy": 5.5687517642974855, "epoch": 2.280478955007257, "grad_norm": 1.1875, "learning_rate": 0.0004479174930196204, "loss": 4.9468, "mean_token_accuracy": 0.2137855738401413, "num_tokens": 52160552.0, "step": 25140 }, { "entropy": 5.416904401779175, "epoch": 2.280932510885341, "grad_norm": 1.21875, "learning_rate": 0.00044789678884580767, "loss": 4.8516, "mean_token_accuracy": 0.219556987285614, "num_tokens": 52169780.0, "step": 25145 }, { "entropy": 5.4925432205200195, "epoch": 2.2813860667634254, "grad_norm": 1.1015625, "learning_rate": 0.00044787608109644536, "loss": 4.9419, "mean_token_accuracy": 0.21881770640611647, "num_tokens": 52180055.0, "step": 25150 }, { "entropy": 5.473763942718506, "epoch": 2.2818396226415096, "grad_norm": 1.171875, "learning_rate": 0.0004478553697719616, "loss": 4.8813, "mean_token_accuracy": 0.21632434725761412, "num_tokens": 52189772.0, "step": 25155 }, { "entropy": 5.50630750656128, "epoch": 2.2822931785195935, "grad_norm": 1.125, "learning_rate": 0.0004478346548727848, "loss": 4.8524, "mean_token_accuracy": 0.22450515031814575, "num_tokens": 52199608.0, "step": 25160 }, { "entropy": 5.4512614727020265, "epoch": 2.2827467343976777, "grad_norm": 1.1640625, "learning_rate": 0.0004478139363993433, "loss": 4.9469, "mean_token_accuracy": 0.20535383224487305, "num_tokens": 52208236.0, "step": 25165 }, { "entropy": 5.508632230758667, "epoch": 2.283200290275762, "grad_norm": 1.0859375, "learning_rate": 0.0004477932143520655, "loss": 4.9544, "mean_token_accuracy": 0.21591737121343613, "num_tokens": 52218403.0, "step": 25170 }, { "entropy": 5.532778644561768, "epoch": 2.2836538461538463, "grad_norm": 1.171875, "learning_rate": 0.00044777248873138005, "loss": 4.927, "mean_token_accuracy": 0.21506611555814742, "num_tokens": 52228255.0, "step": 25175 }, { "entropy": 5.5219035148620605, "epoch": 2.2841074020319305, "grad_norm": 1.3359375, "learning_rate": 0.00044775175953771547, "loss": 4.9505, "mean_token_accuracy": 0.20973069220781326, "num_tokens": 52237732.0, "step": 25180 }, { "entropy": 5.5970922946929935, "epoch": 2.2845609579100143, "grad_norm": 1.0234375, "learning_rate": 0.0004477310267715005, "loss": 5.0869, "mean_token_accuracy": 0.20052250623703002, "num_tokens": 52249226.0, "step": 25185 }, { "entropy": 5.538551330566406, "epoch": 2.2850145137880986, "grad_norm": 1.09375, "learning_rate": 0.0004477102904331639, "loss": 4.9262, "mean_token_accuracy": 0.21238505840301514, "num_tokens": 52259550.0, "step": 25190 }, { "entropy": 5.562503480911255, "epoch": 2.285468069666183, "grad_norm": 1.1328125, "learning_rate": 0.00044768955052313443, "loss": 4.9582, "mean_token_accuracy": 0.21429784148931502, "num_tokens": 52269670.0, "step": 25195 }, { "entropy": 5.541666793823242, "epoch": 2.285921625544267, "grad_norm": 1.078125, "learning_rate": 0.00044766880704184104, "loss": 4.9318, "mean_token_accuracy": 0.2136317938566208, "num_tokens": 52280135.0, "step": 25200 }, { "entropy": 5.486477565765381, "epoch": 2.2863751814223514, "grad_norm": 1.125, "learning_rate": 0.0004476480599897128, "loss": 4.8544, "mean_token_accuracy": 0.2182181343436241, "num_tokens": 52291806.0, "step": 25205 }, { "entropy": 5.415923261642456, "epoch": 2.2868287373004352, "grad_norm": 1.109375, "learning_rate": 0.0004476273093671786, "loss": 4.8887, "mean_token_accuracy": 0.21271032840013504, "num_tokens": 52302118.0, "step": 25210 }, { "entropy": 5.515542936325073, "epoch": 2.2872822931785195, "grad_norm": 1.1875, "learning_rate": 0.00044760655517466766, "loss": 4.9889, "mean_token_accuracy": 0.21006736159324646, "num_tokens": 52312762.0, "step": 25215 }, { "entropy": 5.562449169158936, "epoch": 2.2877358490566038, "grad_norm": 1.125, "learning_rate": 0.00044758579741260916, "loss": 4.9628, "mean_token_accuracy": 0.2087487295269966, "num_tokens": 52323367.0, "step": 25220 }, { "entropy": 5.58119568824768, "epoch": 2.288189404934688, "grad_norm": 1.1015625, "learning_rate": 0.00044756503608143247, "loss": 5.0059, "mean_token_accuracy": 0.20538643300533294, "num_tokens": 52335231.0, "step": 25225 }, { "entropy": 5.571872615814209, "epoch": 2.2886429608127723, "grad_norm": 1.234375, "learning_rate": 0.00044754427118156675, "loss": 4.8911, "mean_token_accuracy": 0.21371162235736846, "num_tokens": 52345066.0, "step": 25230 }, { "entropy": 5.50447678565979, "epoch": 2.289096516690856, "grad_norm": 1.1171875, "learning_rate": 0.0004475235027134416, "loss": 4.944, "mean_token_accuracy": 0.21927476525306702, "num_tokens": 52356383.0, "step": 25235 }, { "entropy": 5.5222252368927, "epoch": 2.2895500725689404, "grad_norm": 1.2109375, "learning_rate": 0.0004475027306774865, "loss": 5.0446, "mean_token_accuracy": 0.21130027621984482, "num_tokens": 52366013.0, "step": 25240 }, { "entropy": 5.538517093658447, "epoch": 2.2900036284470247, "grad_norm": 1.140625, "learning_rate": 0.00044748195507413095, "loss": 4.9599, "mean_token_accuracy": 0.21573576182127, "num_tokens": 52376298.0, "step": 25245 }, { "entropy": 5.42292046546936, "epoch": 2.290457184325109, "grad_norm": 1.25, "learning_rate": 0.00044746117590380456, "loss": 4.8472, "mean_token_accuracy": 0.21487735509872435, "num_tokens": 52387134.0, "step": 25250 }, { "entropy": 5.483355140686035, "epoch": 2.290910740203193, "grad_norm": 1.0859375, "learning_rate": 0.0004474403931669371, "loss": 4.8337, "mean_token_accuracy": 0.21606738716363907, "num_tokens": 52397389.0, "step": 25255 }, { "entropy": 5.48673095703125, "epoch": 2.2913642960812775, "grad_norm": 1.1640625, "learning_rate": 0.0004474196068639584, "loss": 4.8697, "mean_token_accuracy": 0.22078489065170287, "num_tokens": 52407456.0, "step": 25260 }, { "entropy": 5.45056037902832, "epoch": 2.2918178519593613, "grad_norm": 1.1953125, "learning_rate": 0.0004473988169952983, "loss": 4.9459, "mean_token_accuracy": 0.20922325998544694, "num_tokens": 52417967.0, "step": 25265 }, { "entropy": 5.555845069885254, "epoch": 2.2922714078374455, "grad_norm": 1.2265625, "learning_rate": 0.00044737802356138674, "loss": 5.01, "mean_token_accuracy": 0.21173913776874542, "num_tokens": 52428757.0, "step": 25270 }, { "entropy": 5.496116065979004, "epoch": 2.29272496371553, "grad_norm": 1.1640625, "learning_rate": 0.0004473572265626537, "loss": 4.9151, "mean_token_accuracy": 0.22192395925521852, "num_tokens": 52438973.0, "step": 25275 }, { "entropy": 5.474850368499756, "epoch": 2.293178519593614, "grad_norm": 1.140625, "learning_rate": 0.0004473364259995293, "loss": 4.8996, "mean_token_accuracy": 0.2105103150010109, "num_tokens": 52449323.0, "step": 25280 }, { "entropy": 5.522763013839722, "epoch": 2.293632075471698, "grad_norm": 1.2421875, "learning_rate": 0.0004473156218724436, "loss": 4.8962, "mean_token_accuracy": 0.21868317276239396, "num_tokens": 52459299.0, "step": 25285 }, { "entropy": 5.440842151641846, "epoch": 2.294085631349782, "grad_norm": 1.1015625, "learning_rate": 0.00044729481418182704, "loss": 4.8834, "mean_token_accuracy": 0.20932069122791291, "num_tokens": 52470026.0, "step": 25290 }, { "entropy": 5.507685327529908, "epoch": 2.2945391872278664, "grad_norm": 1.0859375, "learning_rate": 0.00044727400292810985, "loss": 4.872, "mean_token_accuracy": 0.2175827980041504, "num_tokens": 52479975.0, "step": 25295 }, { "entropy": 5.565283632278442, "epoch": 2.2949927431059507, "grad_norm": 1.1015625, "learning_rate": 0.00044725318811172227, "loss": 5.009, "mean_token_accuracy": 0.2099424719810486, "num_tokens": 52491067.0, "step": 25300 }, { "entropy": 5.48869833946228, "epoch": 2.295446298984035, "grad_norm": 1.0859375, "learning_rate": 0.000447232369733095, "loss": 4.9163, "mean_token_accuracy": 0.21529011130332948, "num_tokens": 52500671.0, "step": 25305 }, { "entropy": 5.4945282459259035, "epoch": 2.2958998548621192, "grad_norm": 1.1875, "learning_rate": 0.0004472115477926583, "loss": 4.8705, "mean_token_accuracy": 0.2124891072511673, "num_tokens": 52509910.0, "step": 25310 }, { "entropy": 5.475480651855468, "epoch": 2.296353410740203, "grad_norm": 1.1015625, "learning_rate": 0.00044719072229084295, "loss": 4.8956, "mean_token_accuracy": 0.21980800479650497, "num_tokens": 52520517.0, "step": 25315 }, { "entropy": 5.5273809909820555, "epoch": 2.2968069666182873, "grad_norm": 1.1953125, "learning_rate": 0.0004471698932280796, "loss": 4.9742, "mean_token_accuracy": 0.217047218978405, "num_tokens": 52530760.0, "step": 25320 }, { "entropy": 5.581479692459107, "epoch": 2.2972605224963716, "grad_norm": 1.15625, "learning_rate": 0.000447149060604799, "loss": 5.0084, "mean_token_accuracy": 0.206503826379776, "num_tokens": 52541791.0, "step": 25325 }, { "entropy": 5.587798547744751, "epoch": 2.297714078374456, "grad_norm": 1.1484375, "learning_rate": 0.00044712822442143194, "loss": 4.9752, "mean_token_accuracy": 0.21387242674827575, "num_tokens": 52551885.0, "step": 25330 }, { "entropy": 5.514059209823609, "epoch": 2.2981676342525397, "grad_norm": 1.09375, "learning_rate": 0.00044710738467840927, "loss": 4.8724, "mean_token_accuracy": 0.2184450551867485, "num_tokens": 52563080.0, "step": 25335 }, { "entropy": 5.476502323150635, "epoch": 2.298621190130624, "grad_norm": 1.109375, "learning_rate": 0.0004470865413761621, "loss": 4.8514, "mean_token_accuracy": 0.2222488522529602, "num_tokens": 52573564.0, "step": 25340 }, { "entropy": 5.49130220413208, "epoch": 2.299074746008708, "grad_norm": 1.140625, "learning_rate": 0.00044706569451512143, "loss": 4.9086, "mean_token_accuracy": 0.2145822301506996, "num_tokens": 52583801.0, "step": 25345 }, { "entropy": 5.506036710739136, "epoch": 2.2995283018867925, "grad_norm": 1.1640625, "learning_rate": 0.00044704484409571825, "loss": 4.9539, "mean_token_accuracy": 0.21144819706678392, "num_tokens": 52594908.0, "step": 25350 }, { "entropy": 5.4511350154876705, "epoch": 2.2999818577648767, "grad_norm": 1.1171875, "learning_rate": 0.00044702399011838393, "loss": 4.8744, "mean_token_accuracy": 0.20743487179279327, "num_tokens": 52604861.0, "step": 25355 }, { "entropy": 5.510947561264038, "epoch": 2.300435413642961, "grad_norm": 1.0234375, "learning_rate": 0.0004470031325835497, "loss": 4.9142, "mean_token_accuracy": 0.2156983032822609, "num_tokens": 52616203.0, "step": 25360 }, { "entropy": 5.50053768157959, "epoch": 2.300888969521045, "grad_norm": 1.046875, "learning_rate": 0.0004469822714916468, "loss": 4.8596, "mean_token_accuracy": 0.2153087228536606, "num_tokens": 52625838.0, "step": 25365 }, { "entropy": 5.4293008804321286, "epoch": 2.301342525399129, "grad_norm": 1.0625, "learning_rate": 0.0004469614068431067, "loss": 4.9076, "mean_token_accuracy": 0.21574092507362366, "num_tokens": 52635741.0, "step": 25370 }, { "entropy": 5.4517176151275635, "epoch": 2.3017960812772134, "grad_norm": 1.125, "learning_rate": 0.0004469405386383608, "loss": 4.8454, "mean_token_accuracy": 0.21863141804933547, "num_tokens": 52645948.0, "step": 25375 }, { "entropy": 5.529945135116577, "epoch": 2.3022496371552976, "grad_norm": 1.21875, "learning_rate": 0.00044691966687784087, "loss": 4.9136, "mean_token_accuracy": 0.2179325446486473, "num_tokens": 52655073.0, "step": 25380 }, { "entropy": 5.45610933303833, "epoch": 2.302703193033382, "grad_norm": 1.125, "learning_rate": 0.00044689879156197833, "loss": 4.8825, "mean_token_accuracy": 0.2225338786840439, "num_tokens": 52664429.0, "step": 25385 }, { "entropy": 5.548095703125, "epoch": 2.3031567489114657, "grad_norm": 1.0703125, "learning_rate": 0.00044687791269120504, "loss": 5.0084, "mean_token_accuracy": 0.20901824980974198, "num_tokens": 52674890.0, "step": 25390 }, { "entropy": 5.589496660232544, "epoch": 2.30361030478955, "grad_norm": 1.1875, "learning_rate": 0.00044685703026595266, "loss": 5.0105, "mean_token_accuracy": 0.21246989965438842, "num_tokens": 52685673.0, "step": 25395 }, { "entropy": 5.60549578666687, "epoch": 2.3040638606676342, "grad_norm": 1.1875, "learning_rate": 0.00044683614428665314, "loss": 5.022, "mean_token_accuracy": 0.2052040383219719, "num_tokens": 52696696.0, "step": 25400 }, { "entropy": 5.513788414001465, "epoch": 2.3045174165457185, "grad_norm": 1.1875, "learning_rate": 0.00044681525475373843, "loss": 4.9533, "mean_token_accuracy": 0.21050163805484773, "num_tokens": 52707662.0, "step": 25405 }, { "entropy": 5.476322889328003, "epoch": 2.3049709724238028, "grad_norm": 1.1328125, "learning_rate": 0.0004467943616676403, "loss": 4.9014, "mean_token_accuracy": 0.21685788333415984, "num_tokens": 52718438.0, "step": 25410 }, { "entropy": 5.4688409805297855, "epoch": 2.3054245283018866, "grad_norm": 1.15625, "learning_rate": 0.0004467734650287911, "loss": 4.8951, "mean_token_accuracy": 0.2187250018119812, "num_tokens": 52729267.0, "step": 25415 }, { "entropy": 5.442692613601684, "epoch": 2.305878084179971, "grad_norm": 1.1328125, "learning_rate": 0.0004467525648376229, "loss": 4.8686, "mean_token_accuracy": 0.22430212795734406, "num_tokens": 52738754.0, "step": 25420 }, { "entropy": 5.446636390686035, "epoch": 2.306331640058055, "grad_norm": 1.078125, "learning_rate": 0.0004467316610945679, "loss": 4.8925, "mean_token_accuracy": 0.22109164148569108, "num_tokens": 52749086.0, "step": 25425 }, { "entropy": 5.554483032226562, "epoch": 2.3067851959361394, "grad_norm": 1.40625, "learning_rate": 0.00044671075380005825, "loss": 4.9935, "mean_token_accuracy": 0.21061239242553711, "num_tokens": 52758961.0, "step": 25430 }, { "entropy": 5.557551670074463, "epoch": 2.3072387518142237, "grad_norm": 1.2578125, "learning_rate": 0.0004466898429545266, "loss": 4.9499, "mean_token_accuracy": 0.21503866463899612, "num_tokens": 52769447.0, "step": 25435 }, { "entropy": 5.56520643234253, "epoch": 2.3076923076923075, "grad_norm": 1.1953125, "learning_rate": 0.00044666892855840513, "loss": 4.9989, "mean_token_accuracy": 0.20663607865571976, "num_tokens": 52780306.0, "step": 25440 }, { "entropy": 5.495461368560791, "epoch": 2.3081458635703918, "grad_norm": 1.0390625, "learning_rate": 0.0004466480106121266, "loss": 4.8985, "mean_token_accuracy": 0.21171589344739913, "num_tokens": 52791263.0, "step": 25445 }, { "entropy": 5.50752534866333, "epoch": 2.308599419448476, "grad_norm": 1.0859375, "learning_rate": 0.0004466270891161234, "loss": 4.9319, "mean_token_accuracy": 0.2074984833598137, "num_tokens": 52802194.0, "step": 25450 }, { "entropy": 5.508196926116943, "epoch": 2.3090529753265603, "grad_norm": 1.171875, "learning_rate": 0.00044660616407082827, "loss": 4.9144, "mean_token_accuracy": 0.22165672481060028, "num_tokens": 52812391.0, "step": 25455 }, { "entropy": 5.5353086471557615, "epoch": 2.3095065312046446, "grad_norm": 1.1484375, "learning_rate": 0.00044658523547667385, "loss": 4.8943, "mean_token_accuracy": 0.21094203740358353, "num_tokens": 52823540.0, "step": 25460 }, { "entropy": 5.435025548934936, "epoch": 2.309960087082729, "grad_norm": 1.1328125, "learning_rate": 0.0004465643033340931, "loss": 4.8534, "mean_token_accuracy": 0.22150187492370604, "num_tokens": 52833238.0, "step": 25465 }, { "entropy": 5.5223917961120605, "epoch": 2.3104136429608126, "grad_norm": 1.0390625, "learning_rate": 0.00044654336764351886, "loss": 4.9945, "mean_token_accuracy": 0.20679476410150527, "num_tokens": 52844510.0, "step": 25470 }, { "entropy": 5.524321269989014, "epoch": 2.310867198838897, "grad_norm": 1.0078125, "learning_rate": 0.00044652242840538406, "loss": 4.9795, "mean_token_accuracy": 0.21345377564430237, "num_tokens": 52856311.0, "step": 25475 }, { "entropy": 5.480737590789795, "epoch": 2.311320754716981, "grad_norm": 1.203125, "learning_rate": 0.0004465014856201218, "loss": 4.8707, "mean_token_accuracy": 0.21930532306432723, "num_tokens": 52866295.0, "step": 25480 }, { "entropy": 5.487839794158935, "epoch": 2.3117743105950654, "grad_norm": 1.15625, "learning_rate": 0.000446480539288165, "loss": 4.95, "mean_token_accuracy": 0.21395142525434493, "num_tokens": 52876818.0, "step": 25485 }, { "entropy": 5.490958166122437, "epoch": 2.3122278664731493, "grad_norm": 1.1640625, "learning_rate": 0.0004464595894099469, "loss": 4.8855, "mean_token_accuracy": 0.21433917433023453, "num_tokens": 52886173.0, "step": 25490 }, { "entropy": 5.469081974029541, "epoch": 2.3126814223512335, "grad_norm": 1.1171875, "learning_rate": 0.00044643863598590094, "loss": 4.8973, "mean_token_accuracy": 0.20922717601060867, "num_tokens": 52895875.0, "step": 25495 }, { "entropy": 5.533479261398315, "epoch": 2.313134978229318, "grad_norm": 1.046875, "learning_rate": 0.00044641767901646025, "loss": 5.0104, "mean_token_accuracy": 0.20614977180957794, "num_tokens": 52906465.0, "step": 25500 }, { "entropy": 5.549294328689575, "epoch": 2.313588534107402, "grad_norm": 1.234375, "learning_rate": 0.0004463967185020583, "loss": 4.9176, "mean_token_accuracy": 0.2115151360630989, "num_tokens": 52916378.0, "step": 25505 }, { "entropy": 5.508175182342529, "epoch": 2.3140420899854863, "grad_norm": 1.1796875, "learning_rate": 0.0004463757544431285, "loss": 4.9749, "mean_token_accuracy": 0.21898386925458907, "num_tokens": 52926698.0, "step": 25510 }, { "entropy": 5.548330211639405, "epoch": 2.3144956458635706, "grad_norm": 1.1953125, "learning_rate": 0.0004463547868401044, "loss": 4.9231, "mean_token_accuracy": 0.2118153303861618, "num_tokens": 52936469.0, "step": 25515 }, { "entropy": 5.530008459091187, "epoch": 2.3149492017416544, "grad_norm": 1.140625, "learning_rate": 0.00044633381569341964, "loss": 4.9441, "mean_token_accuracy": 0.21313218623399735, "num_tokens": 52947006.0, "step": 25520 }, { "entropy": 5.379259014129639, "epoch": 2.3154027576197387, "grad_norm": 1.1015625, "learning_rate": 0.0004463128410035079, "loss": 4.8118, "mean_token_accuracy": 0.2164311572909355, "num_tokens": 52956663.0, "step": 25525 }, { "entropy": 5.456977510452271, "epoch": 2.315856313497823, "grad_norm": 1.1796875, "learning_rate": 0.00044629186277080307, "loss": 4.8576, "mean_token_accuracy": 0.2170025020837784, "num_tokens": 52967383.0, "step": 25530 }, { "entropy": 5.479689693450927, "epoch": 2.316309869375907, "grad_norm": 1.09375, "learning_rate": 0.00044627088099573884, "loss": 4.8514, "mean_token_accuracy": 0.22086726874113083, "num_tokens": 52976567.0, "step": 25535 }, { "entropy": 5.462152719497681, "epoch": 2.3167634252539915, "grad_norm": 1.078125, "learning_rate": 0.00044624989567874907, "loss": 4.9266, "mean_token_accuracy": 0.21869005858898163, "num_tokens": 52986159.0, "step": 25540 }, { "entropy": 5.507683944702149, "epoch": 2.3172169811320753, "grad_norm": 1.0546875, "learning_rate": 0.00044622890682026787, "loss": 4.9763, "mean_token_accuracy": 0.20400695949792863, "num_tokens": 52996028.0, "step": 25545 }, { "entropy": 5.556287670135498, "epoch": 2.3176705370101596, "grad_norm": 1.1796875, "learning_rate": 0.0004462079144207292, "loss": 4.9328, "mean_token_accuracy": 0.2133473575115204, "num_tokens": 53006446.0, "step": 25550 }, { "entropy": 5.5622576713562015, "epoch": 2.318124092888244, "grad_norm": 1.140625, "learning_rate": 0.00044618691848056726, "loss": 4.8883, "mean_token_accuracy": 0.21131509095430373, "num_tokens": 53016497.0, "step": 25555 }, { "entropy": 5.541997241973877, "epoch": 2.318577648766328, "grad_norm": 1.1484375, "learning_rate": 0.0004461659190002162, "loss": 4.9761, "mean_token_accuracy": 0.22148124426603316, "num_tokens": 53027811.0, "step": 25560 }, { "entropy": 5.512529754638672, "epoch": 2.3190312046444124, "grad_norm": 1.1875, "learning_rate": 0.00044614491598011027, "loss": 4.9356, "mean_token_accuracy": 0.20826315879821777, "num_tokens": 53038206.0, "step": 25565 }, { "entropy": 5.546404886245727, "epoch": 2.319484760522496, "grad_norm": 1.125, "learning_rate": 0.0004461239094206839, "loss": 4.9763, "mean_token_accuracy": 0.21190930157899857, "num_tokens": 53047974.0, "step": 25570 }, { "entropy": 5.54844446182251, "epoch": 2.3199383164005805, "grad_norm": 1.09375, "learning_rate": 0.00044610289932237154, "loss": 4.9512, "mean_token_accuracy": 0.2132696807384491, "num_tokens": 53057904.0, "step": 25575 }, { "entropy": 5.4844156265258786, "epoch": 2.3203918722786647, "grad_norm": 1.0546875, "learning_rate": 0.00044608188568560756, "loss": 4.9107, "mean_token_accuracy": 0.2118034243583679, "num_tokens": 53068447.0, "step": 25580 }, { "entropy": 5.484172201156616, "epoch": 2.320845428156749, "grad_norm": 1.0703125, "learning_rate": 0.0004460608685108266, "loss": 4.9735, "mean_token_accuracy": 0.20456577688455582, "num_tokens": 53079369.0, "step": 25585 }, { "entropy": 5.568174362182617, "epoch": 2.3212989840348333, "grad_norm": 1.078125, "learning_rate": 0.00044603984779846334, "loss": 4.9773, "mean_token_accuracy": 0.20579463690519334, "num_tokens": 53090794.0, "step": 25590 }, { "entropy": 5.534527587890625, "epoch": 2.321752539912917, "grad_norm": 1.1875, "learning_rate": 0.0004460188235489524, "loss": 4.8589, "mean_token_accuracy": 0.2139367565512657, "num_tokens": 53100802.0, "step": 25595 }, { "entropy": 5.459441089630127, "epoch": 2.3222060957910013, "grad_norm": 1.140625, "learning_rate": 0.0004459977957627285, "loss": 4.946, "mean_token_accuracy": 0.21548793464899063, "num_tokens": 53111950.0, "step": 25600 }, { "entropy": 5.396631717681885, "epoch": 2.3226596516690856, "grad_norm": 1.171875, "learning_rate": 0.00044597676444022683, "loss": 4.7942, "mean_token_accuracy": 0.21895018368959426, "num_tokens": 53121908.0, "step": 25605 }, { "entropy": 5.481389951705933, "epoch": 2.32311320754717, "grad_norm": 1.1171875, "learning_rate": 0.00044595572958188194, "loss": 4.9351, "mean_token_accuracy": 0.20947088152170182, "num_tokens": 53133065.0, "step": 25610 }, { "entropy": 5.4266551494598385, "epoch": 2.323566763425254, "grad_norm": 1.109375, "learning_rate": 0.0004459346911881291, "loss": 4.8774, "mean_token_accuracy": 0.2153947174549103, "num_tokens": 53144135.0, "step": 25615 }, { "entropy": 5.5237603187561035, "epoch": 2.3240203193033384, "grad_norm": 1.1640625, "learning_rate": 0.0004459136492594032, "loss": 4.8597, "mean_token_accuracy": 0.22346723824739456, "num_tokens": 53153916.0, "step": 25620 }, { "entropy": 5.4423905372619625, "epoch": 2.3244738751814222, "grad_norm": 1.15625, "learning_rate": 0.0004458926037961394, "loss": 4.8389, "mean_token_accuracy": 0.2224319487810135, "num_tokens": 53163937.0, "step": 25625 }, { "entropy": 5.533673858642578, "epoch": 2.3249274310595065, "grad_norm": 1.140625, "learning_rate": 0.0004458715547987732, "loss": 4.9998, "mean_token_accuracy": 0.20808079242706298, "num_tokens": 53174327.0, "step": 25630 }, { "entropy": 5.5080187797546385, "epoch": 2.3253809869375908, "grad_norm": 1.046875, "learning_rate": 0.0004458505022677396, "loss": 4.9267, "mean_token_accuracy": 0.21214041560888292, "num_tokens": 53185946.0, "step": 25635 }, { "entropy": 5.513505268096924, "epoch": 2.325834542815675, "grad_norm": 1.1328125, "learning_rate": 0.0004458294462034741, "loss": 4.8921, "mean_token_accuracy": 0.2171740263700485, "num_tokens": 53195944.0, "step": 25640 }, { "entropy": 5.467567300796508, "epoch": 2.326288098693759, "grad_norm": 1.2109375, "learning_rate": 0.0004458083866064121, "loss": 4.9281, "mean_token_accuracy": 0.21866397559642792, "num_tokens": 53206054.0, "step": 25645 }, { "entropy": 5.481159400939942, "epoch": 2.326741654571843, "grad_norm": 1.15625, "learning_rate": 0.0004457873234769891, "loss": 4.9245, "mean_token_accuracy": 0.2143828585743904, "num_tokens": 53216923.0, "step": 25650 }, { "entropy": 5.468651008605957, "epoch": 2.3271952104499274, "grad_norm": 1.140625, "learning_rate": 0.00044576625681564086, "loss": 4.9121, "mean_token_accuracy": 0.21062431782484053, "num_tokens": 53226788.0, "step": 25655 }, { "entropy": 5.522043228149414, "epoch": 2.3276487663280117, "grad_norm": 1.03125, "learning_rate": 0.00044574518662280276, "loss": 4.9657, "mean_token_accuracy": 0.21107705533504487, "num_tokens": 53237573.0, "step": 25660 }, { "entropy": 5.550842905044556, "epoch": 2.328102322206096, "grad_norm": 1.125, "learning_rate": 0.0004457241128989108, "loss": 4.974, "mean_token_accuracy": 0.20487329214811326, "num_tokens": 53247724.0, "step": 25665 }, { "entropy": 5.532074975967407, "epoch": 2.32855587808418, "grad_norm": 1.046875, "learning_rate": 0.0004457030356444006, "loss": 4.9039, "mean_token_accuracy": 0.21214183270931244, "num_tokens": 53258774.0, "step": 25670 }, { "entropy": 5.471618604660034, "epoch": 2.329009433962264, "grad_norm": 1.234375, "learning_rate": 0.0004456819548597082, "loss": 4.8936, "mean_token_accuracy": 0.21844785660505295, "num_tokens": 53268550.0, "step": 25675 }, { "entropy": 5.393625116348266, "epoch": 2.3294629898403483, "grad_norm": 1.140625, "learning_rate": 0.00044566087054526946, "loss": 4.8667, "mean_token_accuracy": 0.21955114752054214, "num_tokens": 53277975.0, "step": 25680 }, { "entropy": 5.568359804153443, "epoch": 2.3299165457184325, "grad_norm": 1.046875, "learning_rate": 0.0004456397827015204, "loss": 5.0075, "mean_token_accuracy": 0.21184577643871308, "num_tokens": 53287939.0, "step": 25685 }, { "entropy": 5.560759496688843, "epoch": 2.330370101596517, "grad_norm": 1.140625, "learning_rate": 0.0004456186913288971, "loss": 4.9251, "mean_token_accuracy": 0.21400628089904786, "num_tokens": 53298355.0, "step": 25690 }, { "entropy": 5.583919286727905, "epoch": 2.3308236574746006, "grad_norm": 1.1328125, "learning_rate": 0.0004455975964278359, "loss": 5.0282, "mean_token_accuracy": 0.21015584617853164, "num_tokens": 53308513.0, "step": 25695 }, { "entropy": 5.55291781425476, "epoch": 2.331277213352685, "grad_norm": 1.1796875, "learning_rate": 0.00044557649799877285, "loss": 4.9726, "mean_token_accuracy": 0.2102041095495224, "num_tokens": 53318249.0, "step": 25700 }, { "entropy": 5.467944049835205, "epoch": 2.331730769230769, "grad_norm": 1.171875, "learning_rate": 0.0004455553960421443, "loss": 4.8472, "mean_token_accuracy": 0.21671323627233505, "num_tokens": 53328460.0, "step": 25705 }, { "entropy": 5.483862495422363, "epoch": 2.3321843251088534, "grad_norm": 1.1484375, "learning_rate": 0.00044553429055838685, "loss": 4.9131, "mean_token_accuracy": 0.2191723644733429, "num_tokens": 53338984.0, "step": 25710 }, { "entropy": 5.550682020187378, "epoch": 2.3326378809869377, "grad_norm": 1.15625, "learning_rate": 0.00044551318154793676, "loss": 4.972, "mean_token_accuracy": 0.2095512792468071, "num_tokens": 53348092.0, "step": 25715 }, { "entropy": 5.47348198890686, "epoch": 2.333091436865022, "grad_norm": 1.1640625, "learning_rate": 0.00044549206901123056, "loss": 4.8782, "mean_token_accuracy": 0.2167353004217148, "num_tokens": 53357343.0, "step": 25720 }, { "entropy": 5.468302297592163, "epoch": 2.333544992743106, "grad_norm": 1.0625, "learning_rate": 0.000445470952948705, "loss": 4.8351, "mean_token_accuracy": 0.21819607317447662, "num_tokens": 53367343.0, "step": 25725 }, { "entropy": 5.569767570495605, "epoch": 2.33399854862119, "grad_norm": 1.0859375, "learning_rate": 0.00044544983336079665, "loss": 5.0161, "mean_token_accuracy": 0.2124939501285553, "num_tokens": 53379093.0, "step": 25730 }, { "entropy": 5.490252065658569, "epoch": 2.3344521044992743, "grad_norm": 1.140625, "learning_rate": 0.0004454287102479423, "loss": 4.8819, "mean_token_accuracy": 0.21499982327222825, "num_tokens": 53388883.0, "step": 25735 }, { "entropy": 5.523770952224732, "epoch": 2.3349056603773586, "grad_norm": 1.1484375, "learning_rate": 0.0004454075836105788, "loss": 4.898, "mean_token_accuracy": 0.2194881409406662, "num_tokens": 53399393.0, "step": 25740 }, { "entropy": 5.4959920883178714, "epoch": 2.335359216255443, "grad_norm": 1.140625, "learning_rate": 0.00044538645344914307, "loss": 4.855, "mean_token_accuracy": 0.21944254487752915, "num_tokens": 53408545.0, "step": 25745 }, { "entropy": 5.484006595611572, "epoch": 2.3358127721335267, "grad_norm": 1.140625, "learning_rate": 0.0004453653197640721, "loss": 4.9554, "mean_token_accuracy": 0.20721954256296157, "num_tokens": 53418325.0, "step": 25750 }, { "entropy": 5.512723398208618, "epoch": 2.336266328011611, "grad_norm": 1.1953125, "learning_rate": 0.00044534418255580286, "loss": 4.937, "mean_token_accuracy": 0.20314341336488723, "num_tokens": 53427984.0, "step": 25755 }, { "entropy": 5.544159555435181, "epoch": 2.336719883889695, "grad_norm": 1.203125, "learning_rate": 0.00044532304182477245, "loss": 5.0251, "mean_token_accuracy": 0.20258364975452423, "num_tokens": 53438765.0, "step": 25760 }, { "entropy": 5.535161638259888, "epoch": 2.3371734397677795, "grad_norm": 1.1484375, "learning_rate": 0.0004453018975714182, "loss": 4.9258, "mean_token_accuracy": 0.21545352190732955, "num_tokens": 53448792.0, "step": 25765 }, { "entropy": 5.568411731719971, "epoch": 2.3376269956458637, "grad_norm": 1.15625, "learning_rate": 0.0004452807497961773, "loss": 4.988, "mean_token_accuracy": 0.21059752851724625, "num_tokens": 53459334.0, "step": 25770 }, { "entropy": 5.5368695735931395, "epoch": 2.3380805515239476, "grad_norm": 1.171875, "learning_rate": 0.00044525959849948704, "loss": 4.991, "mean_token_accuracy": 0.21514967530965806, "num_tokens": 53469841.0, "step": 25775 }, { "entropy": 5.489812278747559, "epoch": 2.338534107402032, "grad_norm": 1.15625, "learning_rate": 0.00044523844368178503, "loss": 4.9396, "mean_token_accuracy": 0.2160777449607849, "num_tokens": 53480660.0, "step": 25780 }, { "entropy": 5.5110344886779785, "epoch": 2.338987663280116, "grad_norm": 1.1484375, "learning_rate": 0.0004452172853435085, "loss": 4.8624, "mean_token_accuracy": 0.2163378193974495, "num_tokens": 53490276.0, "step": 25785 }, { "entropy": 5.404148864746094, "epoch": 2.3394412191582004, "grad_norm": 1.2265625, "learning_rate": 0.0004451961234850953, "loss": 4.8419, "mean_token_accuracy": 0.2290509432554245, "num_tokens": 53501100.0, "step": 25790 }, { "entropy": 5.450394058227539, "epoch": 2.3398947750362846, "grad_norm": 1.015625, "learning_rate": 0.0004451749581069827, "loss": 4.9193, "mean_token_accuracy": 0.21793881058692932, "num_tokens": 53511680.0, "step": 25795 }, { "entropy": 5.532208204269409, "epoch": 2.3403483309143684, "grad_norm": 1.1015625, "learning_rate": 0.0004451537892096087, "loss": 4.995, "mean_token_accuracy": 0.2163803219795227, "num_tokens": 53521298.0, "step": 25800 }, { "entropy": 5.488109350204468, "epoch": 2.3408018867924527, "grad_norm": 1.2421875, "learning_rate": 0.00044513261679341094, "loss": 4.8246, "mean_token_accuracy": 0.22513474076986312, "num_tokens": 53530413.0, "step": 25805 }, { "entropy": 5.457996082305908, "epoch": 2.341255442670537, "grad_norm": 1.0390625, "learning_rate": 0.0004451114408588273, "loss": 4.9363, "mean_token_accuracy": 0.21366408765316008, "num_tokens": 53540959.0, "step": 25810 }, { "entropy": 5.519728374481201, "epoch": 2.3417089985486212, "grad_norm": 1.171875, "learning_rate": 0.00044509026140629584, "loss": 4.924, "mean_token_accuracy": 0.21457249969244002, "num_tokens": 53551265.0, "step": 25815 }, { "entropy": 5.5442688941955565, "epoch": 2.3421625544267055, "grad_norm": 1.078125, "learning_rate": 0.00044506907843625427, "loss": 4.9339, "mean_token_accuracy": 0.21055022180080413, "num_tokens": 53562666.0, "step": 25820 }, { "entropy": 5.478188943862915, "epoch": 2.34261611030479, "grad_norm": 1.09375, "learning_rate": 0.00044504789194914086, "loss": 5.0162, "mean_token_accuracy": 0.20967674404382705, "num_tokens": 53573688.0, "step": 25825 }, { "entropy": 5.565692472457886, "epoch": 2.3430696661828736, "grad_norm": 1.109375, "learning_rate": 0.00044502670194539374, "loss": 4.8968, "mean_token_accuracy": 0.21761015355587005, "num_tokens": 53584055.0, "step": 25830 }, { "entropy": 5.444281530380249, "epoch": 2.343523222060958, "grad_norm": 1.1484375, "learning_rate": 0.00044500550842545104, "loss": 4.7926, "mean_token_accuracy": 0.22537012845277787, "num_tokens": 53593765.0, "step": 25835 }, { "entropy": 5.417661714553833, "epoch": 2.343976777939042, "grad_norm": 1.2265625, "learning_rate": 0.0004449843113897512, "loss": 4.8567, "mean_token_accuracy": 0.22143977731466294, "num_tokens": 53603480.0, "step": 25840 }, { "entropy": 5.477065086364746, "epoch": 2.3444303338171264, "grad_norm": 1.109375, "learning_rate": 0.0004449631108387325, "loss": 4.9025, "mean_token_accuracy": 0.22046411037445068, "num_tokens": 53613797.0, "step": 25845 }, { "entropy": 5.445242309570313, "epoch": 2.34488388969521, "grad_norm": 1.203125, "learning_rate": 0.0004449419067728333, "loss": 4.8732, "mean_token_accuracy": 0.21652236133813857, "num_tokens": 53623646.0, "step": 25850 }, { "entropy": 5.459939336776733, "epoch": 2.3453374455732945, "grad_norm": 1.140625, "learning_rate": 0.00044492069919249206, "loss": 4.9055, "mean_token_accuracy": 0.21198905408382415, "num_tokens": 53634118.0, "step": 25855 }, { "entropy": 5.520653486251831, "epoch": 2.3457910014513788, "grad_norm": 1.234375, "learning_rate": 0.0004448994880981476, "loss": 4.8977, "mean_token_accuracy": 0.21317032873630523, "num_tokens": 53644370.0, "step": 25860 }, { "entropy": 5.529612970352173, "epoch": 2.346244557329463, "grad_norm": 1.03125, "learning_rate": 0.00044487827349023833, "loss": 4.9651, "mean_token_accuracy": 0.20310250967741011, "num_tokens": 53655560.0, "step": 25865 }, { "entropy": 5.515697336196899, "epoch": 2.3466981132075473, "grad_norm": 1.2890625, "learning_rate": 0.00044485705536920315, "loss": 4.9792, "mean_token_accuracy": 0.2099432587623596, "num_tokens": 53666401.0, "step": 25870 }, { "entropy": 5.562315988540649, "epoch": 2.3471516690856316, "grad_norm": 1.2265625, "learning_rate": 0.00044483583373548075, "loss": 4.9629, "mean_token_accuracy": 0.22292011529207229, "num_tokens": 53676133.0, "step": 25875 }, { "entropy": 5.482073259353638, "epoch": 2.3476052249637154, "grad_norm": 0.94921875, "learning_rate": 0.0004448146085895101, "loss": 4.933, "mean_token_accuracy": 0.20581683963537217, "num_tokens": 53687683.0, "step": 25880 }, { "entropy": 5.464105224609375, "epoch": 2.3480587808417996, "grad_norm": 0.9921875, "learning_rate": 0.0004447933799317299, "loss": 4.9946, "mean_token_accuracy": 0.21131130307912827, "num_tokens": 53698343.0, "step": 25885 }, { "entropy": 5.527396249771118, "epoch": 2.348512336719884, "grad_norm": 1.125, "learning_rate": 0.0004447721477625795, "loss": 4.9, "mean_token_accuracy": 0.21536218971014023, "num_tokens": 53709014.0, "step": 25890 }, { "entropy": 5.485438013076783, "epoch": 2.348965892597968, "grad_norm": 1.203125, "learning_rate": 0.00044475091208249774, "loss": 4.9244, "mean_token_accuracy": 0.2127739116549492, "num_tokens": 53718838.0, "step": 25895 }, { "entropy": 5.433662223815918, "epoch": 2.3494194484760524, "grad_norm": 1.28125, "learning_rate": 0.0004447296728919239, "loss": 4.8893, "mean_token_accuracy": 0.21522442400455474, "num_tokens": 53728526.0, "step": 25900 }, { "entropy": 5.528424024581909, "epoch": 2.3498730043541363, "grad_norm": 1.15625, "learning_rate": 0.0004447084301912972, "loss": 4.9945, "mean_token_accuracy": 0.21140301525592803, "num_tokens": 53739261.0, "step": 25905 }, { "entropy": 5.5276045322418215, "epoch": 2.3503265602322205, "grad_norm": 1.2109375, "learning_rate": 0.0004446871839810568, "loss": 4.9733, "mean_token_accuracy": 0.2137870192527771, "num_tokens": 53749599.0, "step": 25910 }, { "entropy": 5.527643632888794, "epoch": 2.350780116110305, "grad_norm": 1.171875, "learning_rate": 0.00044466593426164224, "loss": 4.9452, "mean_token_accuracy": 0.2095325067639351, "num_tokens": 53759898.0, "step": 25915 }, { "entropy": 5.498171854019165, "epoch": 2.351233671988389, "grad_norm": 1.046875, "learning_rate": 0.000444644681033493, "loss": 4.8974, "mean_token_accuracy": 0.20869439095258713, "num_tokens": 53770561.0, "step": 25920 }, { "entropy": 5.4753681182861325, "epoch": 2.3516872278664733, "grad_norm": 1.0859375, "learning_rate": 0.00044462342429704845, "loss": 4.9123, "mean_token_accuracy": 0.21487085074186324, "num_tokens": 53780408.0, "step": 25925 }, { "entropy": 5.407979679107666, "epoch": 2.352140783744557, "grad_norm": 1.234375, "learning_rate": 0.00044460216405274827, "loss": 4.8391, "mean_token_accuracy": 0.22644920349121095, "num_tokens": 53789125.0, "step": 25930 }, { "entropy": 5.458460998535156, "epoch": 2.3525943396226414, "grad_norm": 1.171875, "learning_rate": 0.00044458090030103216, "loss": 4.8567, "mean_token_accuracy": 0.22322857975959778, "num_tokens": 53799164.0, "step": 25935 }, { "entropy": 5.493204164505005, "epoch": 2.3530478955007257, "grad_norm": 1.1171875, "learning_rate": 0.00044455963304233976, "loss": 4.8525, "mean_token_accuracy": 0.22303333431482314, "num_tokens": 53810710.0, "step": 25940 }, { "entropy": 5.420898866653443, "epoch": 2.35350145137881, "grad_norm": 1.1484375, "learning_rate": 0.000444538362277111, "loss": 4.9084, "mean_token_accuracy": 0.2077305406332016, "num_tokens": 53820692.0, "step": 25945 }, { "entropy": 5.5188360691070555, "epoch": 2.353955007256894, "grad_norm": 1.15625, "learning_rate": 0.0004445170880057857, "loss": 4.9631, "mean_token_accuracy": 0.21033201664686202, "num_tokens": 53831082.0, "step": 25950 }, { "entropy": 5.5739295959472654, "epoch": 2.354408563134978, "grad_norm": 1.1484375, "learning_rate": 0.00044449581022880375, "loss": 5.0053, "mean_token_accuracy": 0.19920249432325363, "num_tokens": 53842602.0, "step": 25955 }, { "entropy": 5.499769926071167, "epoch": 2.3548621190130623, "grad_norm": 1.109375, "learning_rate": 0.0004444745289466053, "loss": 4.9382, "mean_token_accuracy": 0.21018957048654557, "num_tokens": 53853784.0, "step": 25960 }, { "entropy": 5.416641759872436, "epoch": 2.3553156748911466, "grad_norm": 1.09375, "learning_rate": 0.00044445324415963043, "loss": 4.8122, "mean_token_accuracy": 0.22084206938743592, "num_tokens": 53863526.0, "step": 25965 }, { "entropy": 5.424200487136841, "epoch": 2.355769230769231, "grad_norm": 1.125, "learning_rate": 0.0004444319558683192, "loss": 4.9397, "mean_token_accuracy": 0.21259866505861283, "num_tokens": 53874594.0, "step": 25970 }, { "entropy": 5.5079224586486815, "epoch": 2.356222786647315, "grad_norm": 1.234375, "learning_rate": 0.00044441066407311205, "loss": 4.9069, "mean_token_accuracy": 0.21742993742227554, "num_tokens": 53884771.0, "step": 25975 }, { "entropy": 5.52966456413269, "epoch": 2.3566763425253994, "grad_norm": 1.0703125, "learning_rate": 0.0004443893687744492, "loss": 4.9162, "mean_token_accuracy": 0.2155672937631607, "num_tokens": 53895181.0, "step": 25980 }, { "entropy": 5.432828760147094, "epoch": 2.357129898403483, "grad_norm": 1.203125, "learning_rate": 0.00044436806997277096, "loss": 4.7982, "mean_token_accuracy": 0.22504699379205703, "num_tokens": 53904153.0, "step": 25985 }, { "entropy": 5.425666093826294, "epoch": 2.3575834542815675, "grad_norm": 1.1953125, "learning_rate": 0.00044434676766851787, "loss": 4.8836, "mean_token_accuracy": 0.21994280815124512, "num_tokens": 53914064.0, "step": 25990 }, { "entropy": 5.499133539199829, "epoch": 2.3580370101596517, "grad_norm": 1.2265625, "learning_rate": 0.00044432546186213054, "loss": 4.9249, "mean_token_accuracy": 0.21021739542484283, "num_tokens": 53924240.0, "step": 25995 }, { "entropy": 5.551114273071289, "epoch": 2.358490566037736, "grad_norm": 1.0546875, "learning_rate": 0.00044430415255404944, "loss": 4.9591, "mean_token_accuracy": 0.21483293026685715, "num_tokens": 53935395.0, "step": 26000 }, { "entropy": 5.522525310516357, "epoch": 2.35894412191582, "grad_norm": 1.078125, "learning_rate": 0.00044428283974471533, "loss": 4.9026, "mean_token_accuracy": 0.21348591297864913, "num_tokens": 53945768.0, "step": 26005 }, { "entropy": 5.429514694213867, "epoch": 2.359397677793904, "grad_norm": 1.15625, "learning_rate": 0.000444261523434569, "loss": 4.8906, "mean_token_accuracy": 0.21914070546627046, "num_tokens": 53956467.0, "step": 26010 }, { "entropy": 5.420666313171386, "epoch": 2.3598512336719883, "grad_norm": 1.09375, "learning_rate": 0.00044424020362405126, "loss": 4.8448, "mean_token_accuracy": 0.21922084242105483, "num_tokens": 53967587.0, "step": 26015 }, { "entropy": 5.4528296947479244, "epoch": 2.3603047895500726, "grad_norm": 1.171875, "learning_rate": 0.0004442188803136029, "loss": 4.8843, "mean_token_accuracy": 0.21346233785152435, "num_tokens": 53977691.0, "step": 26020 }, { "entropy": 5.474106359481811, "epoch": 2.360758345428157, "grad_norm": 1.1875, "learning_rate": 0.000444197553503665, "loss": 4.9716, "mean_token_accuracy": 0.20730575323104858, "num_tokens": 53987608.0, "step": 26025 }, { "entropy": 5.5305156230926515, "epoch": 2.361211901306241, "grad_norm": 1.109375, "learning_rate": 0.00044417622319467857, "loss": 5.0297, "mean_token_accuracy": 0.20671143680810927, "num_tokens": 53998010.0, "step": 26030 }, { "entropy": 5.461687660217285, "epoch": 2.361665457184325, "grad_norm": 1.3125, "learning_rate": 0.00044415488938708475, "loss": 4.9161, "mean_token_accuracy": 0.21553837209939958, "num_tokens": 54009852.0, "step": 26035 }, { "entropy": 5.487236881256104, "epoch": 2.3621190130624092, "grad_norm": 1.1015625, "learning_rate": 0.0004441335520813247, "loss": 4.8689, "mean_token_accuracy": 0.21619959622621537, "num_tokens": 54019635.0, "step": 26040 }, { "entropy": 5.490652942657471, "epoch": 2.3625725689404935, "grad_norm": 1.0546875, "learning_rate": 0.00044411221127783966, "loss": 4.9084, "mean_token_accuracy": 0.2171410545706749, "num_tokens": 54030046.0, "step": 26045 }, { "entropy": 5.493072986602783, "epoch": 2.3630261248185778, "grad_norm": 1.0546875, "learning_rate": 0.0004440908669770711, "loss": 4.9006, "mean_token_accuracy": 0.2116263523697853, "num_tokens": 54041197.0, "step": 26050 }, { "entropy": 5.496097707748413, "epoch": 2.3634796806966616, "grad_norm": 1.1328125, "learning_rate": 0.0004440695191794602, "loss": 4.892, "mean_token_accuracy": 0.2177186354994774, "num_tokens": 54051592.0, "step": 26055 }, { "entropy": 5.5228636264801025, "epoch": 2.363933236574746, "grad_norm": 1.09375, "learning_rate": 0.0004440481678854487, "loss": 4.971, "mean_token_accuracy": 0.20590161830186843, "num_tokens": 54062893.0, "step": 26060 }, { "entropy": 5.540108299255371, "epoch": 2.36438679245283, "grad_norm": 1.2109375, "learning_rate": 0.00044402681309547786, "loss": 4.9837, "mean_token_accuracy": 0.20974503606557846, "num_tokens": 54073651.0, "step": 26065 }, { "entropy": 5.472658491134643, "epoch": 2.3648403483309144, "grad_norm": 1.1171875, "learning_rate": 0.00044400545480998956, "loss": 4.9041, "mean_token_accuracy": 0.21841016560792922, "num_tokens": 54084889.0, "step": 26070 }, { "entropy": 5.446832990646362, "epoch": 2.3652939042089987, "grad_norm": 1.15625, "learning_rate": 0.00044398409302942533, "loss": 4.9114, "mean_token_accuracy": 0.2129442349076271, "num_tokens": 54095724.0, "step": 26075 }, { "entropy": 5.469037294387817, "epoch": 2.365747460087083, "grad_norm": 1.171875, "learning_rate": 0.000443962727754227, "loss": 4.8798, "mean_token_accuracy": 0.2137051820755005, "num_tokens": 54106581.0, "step": 26080 }, { "entropy": 5.522040557861328, "epoch": 2.3662010159651667, "grad_norm": 1.1953125, "learning_rate": 0.0004439413589848364, "loss": 4.9319, "mean_token_accuracy": 0.21595065742731095, "num_tokens": 54116074.0, "step": 26085 }, { "entropy": 5.498589754104614, "epoch": 2.366654571843251, "grad_norm": 1.0234375, "learning_rate": 0.0004439199867216955, "loss": 4.9498, "mean_token_accuracy": 0.21261702626943588, "num_tokens": 54126902.0, "step": 26090 }, { "entropy": 5.495638275146485, "epoch": 2.3671081277213353, "grad_norm": 1.125, "learning_rate": 0.0004438986109652462, "loss": 4.8815, "mean_token_accuracy": 0.2148958757519722, "num_tokens": 54137554.0, "step": 26095 }, { "entropy": 5.486440753936767, "epoch": 2.3675616835994195, "grad_norm": 1.1171875, "learning_rate": 0.0004438772317159306, "loss": 4.8937, "mean_token_accuracy": 0.2148678183555603, "num_tokens": 54148035.0, "step": 26100 }, { "entropy": 5.456903886795044, "epoch": 2.368015239477504, "grad_norm": 1.1953125, "learning_rate": 0.00044385584897419075, "loss": 4.9078, "mean_token_accuracy": 0.22034476548433304, "num_tokens": 54157417.0, "step": 26105 }, { "entropy": 5.511321973800659, "epoch": 2.3684687953555876, "grad_norm": 1.1171875, "learning_rate": 0.000443834462740469, "loss": 4.9502, "mean_token_accuracy": 0.2103291317820549, "num_tokens": 54168353.0, "step": 26110 }, { "entropy": 5.471779298782349, "epoch": 2.368922351233672, "grad_norm": 1.1015625, "learning_rate": 0.0004438130730152074, "loss": 4.9854, "mean_token_accuracy": 0.2033338651061058, "num_tokens": 54180182.0, "step": 26115 }, { "entropy": 5.530212879180908, "epoch": 2.369375907111756, "grad_norm": 1.0703125, "learning_rate": 0.00044379167979884847, "loss": 4.9377, "mean_token_accuracy": 0.21144528388977052, "num_tokens": 54190973.0, "step": 26120 }, { "entropy": 5.562690353393554, "epoch": 2.3698294629898404, "grad_norm": 1.234375, "learning_rate": 0.0004437702830918347, "loss": 5.03, "mean_token_accuracy": 0.2066943496465683, "num_tokens": 54202077.0, "step": 26125 }, { "entropy": 5.502487277984619, "epoch": 2.3702830188679247, "grad_norm": 1.1796875, "learning_rate": 0.0004437488828946084, "loss": 4.9197, "mean_token_accuracy": 0.21228874623775482, "num_tokens": 54211778.0, "step": 26130 }, { "entropy": 5.44524655342102, "epoch": 2.3707365747460085, "grad_norm": 1.1484375, "learning_rate": 0.0004437274792076122, "loss": 4.7989, "mean_token_accuracy": 0.22863289564847947, "num_tokens": 54220941.0, "step": 26135 }, { "entropy": 5.482705020904541, "epoch": 2.371190130624093, "grad_norm": 1.171875, "learning_rate": 0.00044370607203128874, "loss": 5.0203, "mean_token_accuracy": 0.21129117906093597, "num_tokens": 54231602.0, "step": 26140 }, { "entropy": 5.491693687438965, "epoch": 2.371643686502177, "grad_norm": 1.1328125, "learning_rate": 0.0004436846613660807, "loss": 4.9258, "mean_token_accuracy": 0.21241433024406434, "num_tokens": 54241797.0, "step": 26145 }, { "entropy": 5.547004127502442, "epoch": 2.3720972423802613, "grad_norm": 1.03125, "learning_rate": 0.0004436632472124308, "loss": 4.9727, "mean_token_accuracy": 0.20779201984405518, "num_tokens": 54253085.0, "step": 26150 }, { "entropy": 5.567381143569946, "epoch": 2.3725507982583456, "grad_norm": 1.1796875, "learning_rate": 0.0004436418295707821, "loss": 4.9529, "mean_token_accuracy": 0.21601478159427642, "num_tokens": 54262164.0, "step": 26155 }, { "entropy": 5.498871231079102, "epoch": 2.3730043541364294, "grad_norm": 1.1796875, "learning_rate": 0.0004436204084415774, "loss": 4.9499, "mean_token_accuracy": 0.20918332785367966, "num_tokens": 54271922.0, "step": 26160 }, { "entropy": 5.469789838790893, "epoch": 2.3734579100145137, "grad_norm": 1.1015625, "learning_rate": 0.0004435989838252596, "loss": 4.8801, "mean_token_accuracy": 0.22025145292282106, "num_tokens": 54281738.0, "step": 26165 }, { "entropy": 5.4567787647247314, "epoch": 2.373911465892598, "grad_norm": 1.1015625, "learning_rate": 0.0004435775557222719, "loss": 4.9249, "mean_token_accuracy": 0.2132453814148903, "num_tokens": 54292252.0, "step": 26170 }, { "entropy": 5.496927547454834, "epoch": 2.374365021770682, "grad_norm": 1.109375, "learning_rate": 0.00044355612413305736, "loss": 4.965, "mean_token_accuracy": 0.21742047667503356, "num_tokens": 54302518.0, "step": 26175 }, { "entropy": 5.512274074554443, "epoch": 2.3748185776487665, "grad_norm": 1.1640625, "learning_rate": 0.0004435346890580593, "loss": 4.9411, "mean_token_accuracy": 0.21677685528993607, "num_tokens": 54312917.0, "step": 26180 }, { "entropy": 5.516729784011841, "epoch": 2.3752721335268507, "grad_norm": 1.2265625, "learning_rate": 0.00044351325049772085, "loss": 4.8813, "mean_token_accuracy": 0.2186713546514511, "num_tokens": 54322552.0, "step": 26185 }, { "entropy": 5.515956211090088, "epoch": 2.3757256894049346, "grad_norm": 1.1015625, "learning_rate": 0.00044349180845248536, "loss": 4.9184, "mean_token_accuracy": 0.2173202946782112, "num_tokens": 54332917.0, "step": 26190 }, { "entropy": 5.437029409408569, "epoch": 2.376179245283019, "grad_norm": 1.21875, "learning_rate": 0.0004434703629227964, "loss": 4.8551, "mean_token_accuracy": 0.22058886289596558, "num_tokens": 54342791.0, "step": 26195 }, { "entropy": 5.387643671035766, "epoch": 2.376632801161103, "grad_norm": 1.1796875, "learning_rate": 0.0004434489139090975, "loss": 4.7979, "mean_token_accuracy": 0.22771116346120834, "num_tokens": 54352821.0, "step": 26200 }, { "entropy": 5.5476642608642575, "epoch": 2.3770863570391874, "grad_norm": 1.1171875, "learning_rate": 0.00044342746141183206, "loss": 4.9804, "mean_token_accuracy": 0.20798380225896834, "num_tokens": 54363095.0, "step": 26205 }, { "entropy": 5.477079010009765, "epoch": 2.377539912917271, "grad_norm": 1.0546875, "learning_rate": 0.0004434060054314438, "loss": 4.8901, "mean_token_accuracy": 0.20930180102586746, "num_tokens": 54373841.0, "step": 26210 }, { "entropy": 5.434181213378906, "epoch": 2.3779934687953554, "grad_norm": 1.078125, "learning_rate": 0.00044338454596837637, "loss": 4.8723, "mean_token_accuracy": 0.2124147817492485, "num_tokens": 54385012.0, "step": 26215 }, { "entropy": 5.492944765090942, "epoch": 2.3784470246734397, "grad_norm": 1.1640625, "learning_rate": 0.0004433630830230737, "loss": 4.9198, "mean_token_accuracy": 0.21250682771205903, "num_tokens": 54395298.0, "step": 26220 }, { "entropy": 5.4894873142242435, "epoch": 2.378900580551524, "grad_norm": 1.0859375, "learning_rate": 0.0004433416165959795, "loss": 4.9116, "mean_token_accuracy": 0.2137940987944603, "num_tokens": 54405752.0, "step": 26225 }, { "entropy": 5.495602798461914, "epoch": 2.3793541364296082, "grad_norm": 1.046875, "learning_rate": 0.0004433201466875378, "loss": 4.9264, "mean_token_accuracy": 0.2129967987537384, "num_tokens": 54416607.0, "step": 26230 }, { "entropy": 5.474749183654785, "epoch": 2.3798076923076925, "grad_norm": 1.125, "learning_rate": 0.0004432986732981926, "loss": 4.895, "mean_token_accuracy": 0.22310136258602142, "num_tokens": 54426873.0, "step": 26235 }, { "entropy": 5.434404277801514, "epoch": 2.3802612481857763, "grad_norm": 1.0546875, "learning_rate": 0.000443277196428388, "loss": 4.8331, "mean_token_accuracy": 0.2220876157283783, "num_tokens": 54437611.0, "step": 26240 }, { "entropy": 5.542353963851928, "epoch": 2.3807148040638606, "grad_norm": 1.078125, "learning_rate": 0.000443255716078568, "loss": 4.9139, "mean_token_accuracy": 0.2206832766532898, "num_tokens": 54448992.0, "step": 26245 }, { "entropy": 5.47555890083313, "epoch": 2.381168359941945, "grad_norm": 1.0859375, "learning_rate": 0.0004432342322491769, "loss": 4.8943, "mean_token_accuracy": 0.21989913582801818, "num_tokens": 54459172.0, "step": 26250 }, { "entropy": 5.4420390129089355, "epoch": 2.381621915820029, "grad_norm": 1.0703125, "learning_rate": 0.00044321274494065903, "loss": 4.8739, "mean_token_accuracy": 0.21507968306541442, "num_tokens": 54469660.0, "step": 26255 }, { "entropy": 5.536232662200928, "epoch": 2.3820754716981134, "grad_norm": 1.0390625, "learning_rate": 0.00044319125415345886, "loss": 5.0204, "mean_token_accuracy": 0.2102372020483017, "num_tokens": 54479567.0, "step": 26260 }, { "entropy": 5.486782455444336, "epoch": 2.3825290275761972, "grad_norm": 1.109375, "learning_rate": 0.0004431697598880205, "loss": 4.963, "mean_token_accuracy": 0.21284139454364776, "num_tokens": 54489690.0, "step": 26265 }, { "entropy": 5.489284896850586, "epoch": 2.3829825834542815, "grad_norm": 1.203125, "learning_rate": 0.00044314826214478877, "loss": 4.9157, "mean_token_accuracy": 0.21616387367248535, "num_tokens": 54500876.0, "step": 26270 }, { "entropy": 5.502010679244995, "epoch": 2.3834361393323658, "grad_norm": 1.015625, "learning_rate": 0.00044312676092420804, "loss": 4.9783, "mean_token_accuracy": 0.2057827368378639, "num_tokens": 54510988.0, "step": 26275 }, { "entropy": 5.509961318969727, "epoch": 2.38388969521045, "grad_norm": 1.046875, "learning_rate": 0.0004431052562267231, "loss": 4.8846, "mean_token_accuracy": 0.22014069557189941, "num_tokens": 54522149.0, "step": 26280 }, { "entropy": 5.582751083374023, "epoch": 2.3843432510885343, "grad_norm": 1.15625, "learning_rate": 0.00044308374805277867, "loss": 5.0365, "mean_token_accuracy": 0.20298152565956115, "num_tokens": 54533482.0, "step": 26285 }, { "entropy": 5.472028589248657, "epoch": 2.384796806966618, "grad_norm": 1.1953125, "learning_rate": 0.0004430622364028194, "loss": 4.98, "mean_token_accuracy": 0.20509568005800247, "num_tokens": 54543058.0, "step": 26290 }, { "entropy": 5.510845375061035, "epoch": 2.3852503628447024, "grad_norm": 1.1171875, "learning_rate": 0.00044304072127729035, "loss": 4.9237, "mean_token_accuracy": 0.21259500980377197, "num_tokens": 54552655.0, "step": 26295 }, { "entropy": 5.4802491664886475, "epoch": 2.3857039187227866, "grad_norm": 1.1328125, "learning_rate": 0.00044301920267663633, "loss": 4.8688, "mean_token_accuracy": 0.20867816507816314, "num_tokens": 54562696.0, "step": 26300 }, { "entropy": 5.503185701370239, "epoch": 2.386157474600871, "grad_norm": 1.1328125, "learning_rate": 0.0004429976806013024, "loss": 4.9008, "mean_token_accuracy": 0.2215511053800583, "num_tokens": 54572803.0, "step": 26305 }, { "entropy": 5.469847917556763, "epoch": 2.386611030478955, "grad_norm": 1.1875, "learning_rate": 0.0004429761550517336, "loss": 4.9629, "mean_token_accuracy": 0.21451132893562316, "num_tokens": 54582450.0, "step": 26310 }, { "entropy": 5.40881462097168, "epoch": 2.387064586357039, "grad_norm": 1.0625, "learning_rate": 0.00044295462602837504, "loss": 4.8847, "mean_token_accuracy": 0.21612351536750793, "num_tokens": 54591868.0, "step": 26315 }, { "entropy": 5.483367490768432, "epoch": 2.3875181422351233, "grad_norm": 1.09375, "learning_rate": 0.0004429330935316721, "loss": 4.9014, "mean_token_accuracy": 0.21119055896997452, "num_tokens": 54601858.0, "step": 26320 }, { "entropy": 5.493379211425781, "epoch": 2.3879716981132075, "grad_norm": 1.1015625, "learning_rate": 0.00044291155756206996, "loss": 4.945, "mean_token_accuracy": 0.2118200033903122, "num_tokens": 54612243.0, "step": 26325 }, { "entropy": 5.489482116699219, "epoch": 2.388425253991292, "grad_norm": 1.1171875, "learning_rate": 0.00044289001812001404, "loss": 4.8372, "mean_token_accuracy": 0.21867071837186813, "num_tokens": 54622365.0, "step": 26330 }, { "entropy": 5.478691244125367, "epoch": 2.388878809869376, "grad_norm": 1.09375, "learning_rate": 0.0004428684752059497, "loss": 4.8365, "mean_token_accuracy": 0.2181360512971878, "num_tokens": 54632356.0, "step": 26335 }, { "entropy": 5.5544685363769535, "epoch": 2.3893323657474603, "grad_norm": 1.1171875, "learning_rate": 0.0004428469288203226, "loss": 4.9463, "mean_token_accuracy": 0.20535167008638383, "num_tokens": 54642976.0, "step": 26340 }, { "entropy": 5.578728580474854, "epoch": 2.389785921625544, "grad_norm": 1.2109375, "learning_rate": 0.0004428253789635783, "loss": 4.9537, "mean_token_accuracy": 0.21630270928144454, "num_tokens": 54652597.0, "step": 26345 }, { "entropy": 5.464432954788208, "epoch": 2.3902394775036284, "grad_norm": 1.0859375, "learning_rate": 0.0004428038256361622, "loss": 5.0459, "mean_token_accuracy": 0.20704686939716338, "num_tokens": 54662930.0, "step": 26350 }, { "entropy": 5.591292905807495, "epoch": 2.3906930333817127, "grad_norm": 1.0859375, "learning_rate": 0.0004427822688385203, "loss": 5.1322, "mean_token_accuracy": 0.2049167960882187, "num_tokens": 54674562.0, "step": 26355 }, { "entropy": 5.583617067337036, "epoch": 2.391146589259797, "grad_norm": 1.1484375, "learning_rate": 0.0004427607085710984, "loss": 4.9478, "mean_token_accuracy": 0.21285902559757233, "num_tokens": 54684432.0, "step": 26360 }, { "entropy": 5.574669933319091, "epoch": 2.3916001451378808, "grad_norm": 1.2734375, "learning_rate": 0.00044273914483434226, "loss": 4.9665, "mean_token_accuracy": 0.21097928732633592, "num_tokens": 54694060.0, "step": 26365 }, { "entropy": 5.462815141677856, "epoch": 2.392053701015965, "grad_norm": 1.1484375, "learning_rate": 0.00044271757762869777, "loss": 4.9426, "mean_token_accuracy": 0.20573419481515884, "num_tokens": 54704411.0, "step": 26370 }, { "entropy": 5.470274353027344, "epoch": 2.3925072568940493, "grad_norm": 1.09375, "learning_rate": 0.0004426960069546112, "loss": 4.9595, "mean_token_accuracy": 0.21424695253372192, "num_tokens": 54715185.0, "step": 26375 }, { "entropy": 5.51666488647461, "epoch": 2.3929608127721336, "grad_norm": 1.1328125, "learning_rate": 0.0004426744328125284, "loss": 4.8388, "mean_token_accuracy": 0.22204079627990722, "num_tokens": 54725529.0, "step": 26380 }, { "entropy": 5.599893188476562, "epoch": 2.393414368650218, "grad_norm": 1.0703125, "learning_rate": 0.0004426528552028955, "loss": 4.9884, "mean_token_accuracy": 0.21393145322799684, "num_tokens": 54736992.0, "step": 26385 }, { "entropy": 5.482192087173462, "epoch": 2.393867924528302, "grad_norm": 1.0703125, "learning_rate": 0.00044263127412615897, "loss": 4.8802, "mean_token_accuracy": 0.21235992312431334, "num_tokens": 54746951.0, "step": 26390 }, { "entropy": 5.426538944244385, "epoch": 2.394321480406386, "grad_norm": 1.25, "learning_rate": 0.0004426096895827649, "loss": 4.8282, "mean_token_accuracy": 0.22736789733171464, "num_tokens": 54757272.0, "step": 26395 }, { "entropy": 5.49282431602478, "epoch": 2.39477503628447, "grad_norm": 1.1171875, "learning_rate": 0.00044258810157315977, "loss": 4.9839, "mean_token_accuracy": 0.20758346021175383, "num_tokens": 54767835.0, "step": 26400 }, { "entropy": 5.5019268035888675, "epoch": 2.3952285921625545, "grad_norm": 1.1953125, "learning_rate": 0.00044256651009779, "loss": 4.9332, "mean_token_accuracy": 0.21451252698898315, "num_tokens": 54778432.0, "step": 26405 }, { "entropy": 5.519278287887573, "epoch": 2.3956821480406387, "grad_norm": 1.15625, "learning_rate": 0.00044254491515710213, "loss": 4.9762, "mean_token_accuracy": 0.20820215940475464, "num_tokens": 54788582.0, "step": 26410 }, { "entropy": 5.551551818847656, "epoch": 2.3961357039187225, "grad_norm": 1.1640625, "learning_rate": 0.0004425233167515426, "loss": 4.9543, "mean_token_accuracy": 0.21647589653730392, "num_tokens": 54798848.0, "step": 26415 }, { "entropy": 5.463963603973388, "epoch": 2.396589259796807, "grad_norm": 1.09375, "learning_rate": 0.0004425017148815583, "loss": 4.8417, "mean_token_accuracy": 0.21646227240562438, "num_tokens": 54809867.0, "step": 26420 }, { "entropy": 5.475587987899781, "epoch": 2.397042815674891, "grad_norm": 1.2265625, "learning_rate": 0.00044248010954759575, "loss": 4.9152, "mean_token_accuracy": 0.21429212540388107, "num_tokens": 54819905.0, "step": 26425 }, { "entropy": 5.525354862213135, "epoch": 2.3974963715529753, "grad_norm": 1.1875, "learning_rate": 0.00044245850075010193, "loss": 4.9353, "mean_token_accuracy": 0.2138149157166481, "num_tokens": 54829723.0, "step": 26430 }, { "entropy": 5.503822326660156, "epoch": 2.3979499274310596, "grad_norm": 1.09375, "learning_rate": 0.00044243688848952364, "loss": 4.8599, "mean_token_accuracy": 0.21812826097011567, "num_tokens": 54840008.0, "step": 26435 }, { "entropy": 5.5065418720245365, "epoch": 2.398403483309144, "grad_norm": 1.1171875, "learning_rate": 0.0004424152727663078, "loss": 4.9255, "mean_token_accuracy": 0.20818552374839783, "num_tokens": 54851693.0, "step": 26440 }, { "entropy": 5.524015617370606, "epoch": 2.3988570391872277, "grad_norm": 1.109375, "learning_rate": 0.0004423936535809015, "loss": 4.8881, "mean_token_accuracy": 0.2128281906247139, "num_tokens": 54862086.0, "step": 26445 }, { "entropy": 5.583481884002685, "epoch": 2.399310595065312, "grad_norm": 1.1171875, "learning_rate": 0.0004423720309337517, "loss": 5.0033, "mean_token_accuracy": 0.2111051380634308, "num_tokens": 54872883.0, "step": 26450 }, { "entropy": 5.533581829071045, "epoch": 2.3997641509433962, "grad_norm": 1.1953125, "learning_rate": 0.00044235040482530576, "loss": 4.9417, "mean_token_accuracy": 0.21077869534492494, "num_tokens": 54882815.0, "step": 26455 }, { "entropy": 5.363004207611084, "epoch": 2.4002177068214805, "grad_norm": 1.0625, "learning_rate": 0.0004423287752560108, "loss": 4.7454, "mean_token_accuracy": 0.2299979418516159, "num_tokens": 54892480.0, "step": 26460 }, { "entropy": 5.398974895477295, "epoch": 2.4006712626995648, "grad_norm": 1.328125, "learning_rate": 0.00044230714222631397, "loss": 4.8198, "mean_token_accuracy": 0.22443083971738814, "num_tokens": 54901607.0, "step": 26465 }, { "entropy": 5.588579559326172, "epoch": 2.4011248185776486, "grad_norm": 1.0, "learning_rate": 0.00044228550573666294, "loss": 5.0479, "mean_token_accuracy": 0.21278466135263444, "num_tokens": 54913545.0, "step": 26470 }, { "entropy": 5.575187492370605, "epoch": 2.401578374455733, "grad_norm": 1.1875, "learning_rate": 0.000442263865787505, "loss": 4.9637, "mean_token_accuracy": 0.21193353682756425, "num_tokens": 54924392.0, "step": 26475 }, { "entropy": 5.533935022354126, "epoch": 2.402031930333817, "grad_norm": 1.234375, "learning_rate": 0.0004422422223792877, "loss": 4.9065, "mean_token_accuracy": 0.21484020948410035, "num_tokens": 54934114.0, "step": 26480 }, { "entropy": 5.5698761463165285, "epoch": 2.4024854862119014, "grad_norm": 1.203125, "learning_rate": 0.0004422205755124586, "loss": 4.9454, "mean_token_accuracy": 0.2120340183377266, "num_tokens": 54944268.0, "step": 26485 }, { "entropy": 5.532761526107788, "epoch": 2.4029390420899857, "grad_norm": 1.3359375, "learning_rate": 0.00044219892518746536, "loss": 4.9253, "mean_token_accuracy": 0.2159234493970871, "num_tokens": 54954877.0, "step": 26490 }, { "entropy": 5.4670099258422855, "epoch": 2.4033925979680695, "grad_norm": 1.1171875, "learning_rate": 0.00044217727140475585, "loss": 4.8846, "mean_token_accuracy": 0.21790484786033631, "num_tokens": 54964745.0, "step": 26495 }, { "entropy": 5.4789206981658936, "epoch": 2.4038461538461537, "grad_norm": 1.1015625, "learning_rate": 0.00044215561416477764, "loss": 4.8278, "mean_token_accuracy": 0.21640582829713823, "num_tokens": 54975256.0, "step": 26500 }, { "entropy": 5.545788240432739, "epoch": 2.404299709724238, "grad_norm": 1.15625, "learning_rate": 0.0004421339534679788, "loss": 4.9506, "mean_token_accuracy": 0.20957930088043214, "num_tokens": 54986226.0, "step": 26505 }, { "entropy": 5.529408550262451, "epoch": 2.4047532656023223, "grad_norm": 1.046875, "learning_rate": 0.0004421122893148072, "loss": 4.9515, "mean_token_accuracy": 0.20250663310289382, "num_tokens": 54997350.0, "step": 26510 }, { "entropy": 5.539572477340698, "epoch": 2.4052068214804065, "grad_norm": 1.25, "learning_rate": 0.00044209062170571086, "loss": 4.9048, "mean_token_accuracy": 0.21496990621089934, "num_tokens": 55007947.0, "step": 26515 }, { "entropy": 5.522122144699097, "epoch": 2.4056603773584904, "grad_norm": 1.109375, "learning_rate": 0.0004420689506411379, "loss": 4.9466, "mean_token_accuracy": 0.2112934932112694, "num_tokens": 55018789.0, "step": 26520 }, { "entropy": 5.48811354637146, "epoch": 2.4061139332365746, "grad_norm": 1.1875, "learning_rate": 0.00044204727612153643, "loss": 4.8648, "mean_token_accuracy": 0.21057552248239517, "num_tokens": 55028934.0, "step": 26525 }, { "entropy": 5.485390281677246, "epoch": 2.406567489114659, "grad_norm": 1.1640625, "learning_rate": 0.00044202559814735475, "loss": 4.9003, "mean_token_accuracy": 0.22090499848127365, "num_tokens": 55039395.0, "step": 26530 }, { "entropy": 5.465528583526611, "epoch": 2.407021044992743, "grad_norm": 1.09375, "learning_rate": 0.0004420039167190411, "loss": 4.8381, "mean_token_accuracy": 0.21799101084470748, "num_tokens": 55049932.0, "step": 26535 }, { "entropy": 5.523106670379638, "epoch": 2.4074746008708274, "grad_norm": 1.296875, "learning_rate": 0.000441982231837044, "loss": 4.953, "mean_token_accuracy": 0.20853873044252397, "num_tokens": 55061532.0, "step": 26540 }, { "entropy": 5.525784063339233, "epoch": 2.4079281567489117, "grad_norm": 1.1328125, "learning_rate": 0.0004419605435018117, "loss": 4.9726, "mean_token_accuracy": 0.2074953332543373, "num_tokens": 55072368.0, "step": 26545 }, { "entropy": 5.515232896804809, "epoch": 2.4083817126269955, "grad_norm": 1.0703125, "learning_rate": 0.0004419388517137928, "loss": 4.9312, "mean_token_accuracy": 0.21289550215005876, "num_tokens": 55083128.0, "step": 26550 }, { "entropy": 5.528514385223389, "epoch": 2.40883526850508, "grad_norm": 1.1328125, "learning_rate": 0.00044191715647343594, "loss": 4.92, "mean_token_accuracy": 0.21328637152910232, "num_tokens": 55094071.0, "step": 26555 }, { "entropy": 5.516706895828247, "epoch": 2.409288824383164, "grad_norm": 1.1328125, "learning_rate": 0.00044189545778118973, "loss": 4.8906, "mean_token_accuracy": 0.2104053720831871, "num_tokens": 55104504.0, "step": 26560 }, { "entropy": 5.514849138259888, "epoch": 2.4097423802612483, "grad_norm": 1.0390625, "learning_rate": 0.000441873755637503, "loss": 4.9301, "mean_token_accuracy": 0.21149232983589172, "num_tokens": 55115722.0, "step": 26565 }, { "entropy": 5.457224941253662, "epoch": 2.410195936139332, "grad_norm": 1.1171875, "learning_rate": 0.0004418520500428244, "loss": 4.876, "mean_token_accuracy": 0.21758212447166442, "num_tokens": 55126628.0, "step": 26570 }, { "entropy": 5.486545515060425, "epoch": 2.4106494920174164, "grad_norm": 1.09375, "learning_rate": 0.00044183034099760287, "loss": 4.9273, "mean_token_accuracy": 0.2114276796579361, "num_tokens": 55137352.0, "step": 26575 }, { "entropy": 5.530210208892822, "epoch": 2.4111030478955007, "grad_norm": 1.1484375, "learning_rate": 0.0004418086285022874, "loss": 4.9066, "mean_token_accuracy": 0.22247123569250107, "num_tokens": 55147145.0, "step": 26580 }, { "entropy": 5.5359681129455565, "epoch": 2.411556603773585, "grad_norm": 1.1796875, "learning_rate": 0.00044178691255732707, "loss": 4.9348, "mean_token_accuracy": 0.20887413918972014, "num_tokens": 55157386.0, "step": 26585 }, { "entropy": 5.522435903549194, "epoch": 2.412010159651669, "grad_norm": 1.0546875, "learning_rate": 0.0004417651931631708, "loss": 5.0006, "mean_token_accuracy": 0.20828535556793212, "num_tokens": 55168969.0, "step": 26590 }, { "entropy": 5.475583791732788, "epoch": 2.4124637155297535, "grad_norm": 1.1015625, "learning_rate": 0.0004417434703202678, "loss": 4.9251, "mean_token_accuracy": 0.20538465529680253, "num_tokens": 55180123.0, "step": 26595 }, { "entropy": 5.499003887176514, "epoch": 2.4129172714078373, "grad_norm": 1.140625, "learning_rate": 0.0004417217440290673, "loss": 4.8898, "mean_token_accuracy": 0.21401241421699524, "num_tokens": 55190668.0, "step": 26600 }, { "entropy": 5.464096736907959, "epoch": 2.4133708272859216, "grad_norm": 1.1171875, "learning_rate": 0.0004417000142900188, "loss": 4.8517, "mean_token_accuracy": 0.21448955982923507, "num_tokens": 55200852.0, "step": 26605 }, { "entropy": 5.594669008255005, "epoch": 2.413824383164006, "grad_norm": 1.109375, "learning_rate": 0.0004416782811035715, "loss": 5.0665, "mean_token_accuracy": 0.20347885936498641, "num_tokens": 55211174.0, "step": 26610 }, { "entropy": 5.439728689193726, "epoch": 2.41427793904209, "grad_norm": 1.0859375, "learning_rate": 0.00044165654447017485, "loss": 4.8107, "mean_token_accuracy": 0.22405715733766557, "num_tokens": 55222042.0, "step": 26615 }, { "entropy": 5.491124248504638, "epoch": 2.4147314949201744, "grad_norm": 1.28125, "learning_rate": 0.00044163480439027845, "loss": 4.9459, "mean_token_accuracy": 0.20825361013412474, "num_tokens": 55231688.0, "step": 26620 }, { "entropy": 5.498802423477173, "epoch": 2.415185050798258, "grad_norm": 1.15625, "learning_rate": 0.0004416130608643317, "loss": 4.9557, "mean_token_accuracy": 0.21603261679410934, "num_tokens": 55241089.0, "step": 26625 }, { "entropy": 5.518965387344361, "epoch": 2.4156386066763424, "grad_norm": 1.1796875, "learning_rate": 0.0004415913138927844, "loss": 4.8963, "mean_token_accuracy": 0.21926067322492598, "num_tokens": 55251511.0, "step": 26630 }, { "entropy": 5.457004117965698, "epoch": 2.4160921625544267, "grad_norm": 1.0703125, "learning_rate": 0.0004415695634760864, "loss": 4.8998, "mean_token_accuracy": 0.2099840298295021, "num_tokens": 55262855.0, "step": 26635 }, { "entropy": 5.436475849151611, "epoch": 2.416545718432511, "grad_norm": 1.109375, "learning_rate": 0.0004415478096146873, "loss": 4.8114, "mean_token_accuracy": 0.21919535398483275, "num_tokens": 55273035.0, "step": 26640 }, { "entropy": 5.490250062942505, "epoch": 2.4169992743105952, "grad_norm": 1.0859375, "learning_rate": 0.000441526052309037, "loss": 4.8971, "mean_token_accuracy": 0.22140019834041597, "num_tokens": 55284033.0, "step": 26645 }, { "entropy": 5.4840551853179935, "epoch": 2.417452830188679, "grad_norm": 1.1328125, "learning_rate": 0.0004415042915595856, "loss": 4.9038, "mean_token_accuracy": 0.22105709612369537, "num_tokens": 55294290.0, "step": 26650 }, { "entropy": 5.53508939743042, "epoch": 2.4179063860667633, "grad_norm": 1.0859375, "learning_rate": 0.000441482527366783, "loss": 4.9284, "mean_token_accuracy": 0.21372416615486145, "num_tokens": 55305681.0, "step": 26655 }, { "entropy": 5.456181335449219, "epoch": 2.4183599419448476, "grad_norm": 1.0625, "learning_rate": 0.0004414607597310793, "loss": 4.8946, "mean_token_accuracy": 0.21563009321689605, "num_tokens": 55316647.0, "step": 26660 }, { "entropy": 5.550612688064575, "epoch": 2.418813497822932, "grad_norm": 1.2109375, "learning_rate": 0.0004414389886529247, "loss": 5.0257, "mean_token_accuracy": 0.20627919286489488, "num_tokens": 55328318.0, "step": 26665 }, { "entropy": 5.540642976760864, "epoch": 2.419267053701016, "grad_norm": 1.3828125, "learning_rate": 0.0004414172141327693, "loss": 4.9187, "mean_token_accuracy": 0.21341045796871186, "num_tokens": 55338483.0, "step": 26670 }, { "entropy": 5.528587532043457, "epoch": 2.4197206095791, "grad_norm": 1.15625, "learning_rate": 0.0004413954361710636, "loss": 5.0132, "mean_token_accuracy": 0.20577431619167327, "num_tokens": 55348648.0, "step": 26675 }, { "entropy": 5.47016658782959, "epoch": 2.4201741654571842, "grad_norm": 1.0859375, "learning_rate": 0.00044137365476825785, "loss": 4.8974, "mean_token_accuracy": 0.21380711644887923, "num_tokens": 55358599.0, "step": 26680 }, { "entropy": 5.572705888748169, "epoch": 2.4206277213352685, "grad_norm": 1.078125, "learning_rate": 0.00044135186992480253, "loss": 4.9449, "mean_token_accuracy": 0.21307087540626526, "num_tokens": 55369847.0, "step": 26685 }, { "entropy": 5.479419469833374, "epoch": 2.4210812772133528, "grad_norm": 1.109375, "learning_rate": 0.00044133008164114814, "loss": 4.9208, "mean_token_accuracy": 0.21522193998098374, "num_tokens": 55381235.0, "step": 26690 }, { "entropy": 5.490272092819214, "epoch": 2.421534833091437, "grad_norm": 1.1328125, "learning_rate": 0.00044130828991774526, "loss": 4.9629, "mean_token_accuracy": 0.2074080303311348, "num_tokens": 55391527.0, "step": 26695 }, { "entropy": 5.56069974899292, "epoch": 2.4219883889695213, "grad_norm": 1.125, "learning_rate": 0.00044128649475504454, "loss": 4.9951, "mean_token_accuracy": 0.21089034229516984, "num_tokens": 55401528.0, "step": 26700 }, { "entropy": 5.573121118545532, "epoch": 2.422441944847605, "grad_norm": 1.1953125, "learning_rate": 0.0004412646961534968, "loss": 4.9999, "mean_token_accuracy": 0.20303410291671753, "num_tokens": 55411411.0, "step": 26705 }, { "entropy": 5.424116611480713, "epoch": 2.4228955007256894, "grad_norm": 1.078125, "learning_rate": 0.0004412428941135528, "loss": 4.7837, "mean_token_accuracy": 0.22403921484947203, "num_tokens": 55423164.0, "step": 26710 }, { "entropy": 5.495169687271118, "epoch": 2.4233490566037736, "grad_norm": 1.1484375, "learning_rate": 0.0004412210886356633, "loss": 4.8546, "mean_token_accuracy": 0.2217934936285019, "num_tokens": 55433397.0, "step": 26715 }, { "entropy": 5.469728660583496, "epoch": 2.423802612481858, "grad_norm": 1.140625, "learning_rate": 0.00044119927972027936, "loss": 4.9068, "mean_token_accuracy": 0.2103663921356201, "num_tokens": 55442898.0, "step": 26720 }, { "entropy": 5.484694719314575, "epoch": 2.4242561683599417, "grad_norm": 1.15625, "learning_rate": 0.00044117746736785195, "loss": 4.916, "mean_token_accuracy": 0.22058435082435607, "num_tokens": 55452226.0, "step": 26725 }, { "entropy": 5.530117416381836, "epoch": 2.424709724238026, "grad_norm": 1.1015625, "learning_rate": 0.0004411556515788322, "loss": 4.9204, "mean_token_accuracy": 0.21022847294807434, "num_tokens": 55462503.0, "step": 26730 }, { "entropy": 5.561010503768921, "epoch": 2.4251632801161103, "grad_norm": 1.2109375, "learning_rate": 0.0004411338323536712, "loss": 5.0356, "mean_token_accuracy": 0.20880862474441528, "num_tokens": 55472789.0, "step": 26735 }, { "entropy": 5.434799861907959, "epoch": 2.4256168359941945, "grad_norm": 1.21875, "learning_rate": 0.0004411120096928203, "loss": 4.8447, "mean_token_accuracy": 0.21778091490268708, "num_tokens": 55482572.0, "step": 26740 }, { "entropy": 5.52170844078064, "epoch": 2.426070391872279, "grad_norm": 0.99609375, "learning_rate": 0.0004410901835967306, "loss": 4.8911, "mean_token_accuracy": 0.22017523795366287, "num_tokens": 55493033.0, "step": 26745 }, { "entropy": 5.529430389404297, "epoch": 2.426523947750363, "grad_norm": 1.0625, "learning_rate": 0.00044106835406585354, "loss": 4.8716, "mean_token_accuracy": 0.21206064373254777, "num_tokens": 55503574.0, "step": 26750 }, { "entropy": 5.544883966445923, "epoch": 2.426977503628447, "grad_norm": 1.0234375, "learning_rate": 0.00044104652110064067, "loss": 4.952, "mean_token_accuracy": 0.21000666171312332, "num_tokens": 55514119.0, "step": 26755 }, { "entropy": 5.496326208114624, "epoch": 2.427431059506531, "grad_norm": 1.0390625, "learning_rate": 0.0004410246847015435, "loss": 4.8759, "mean_token_accuracy": 0.21246764957904815, "num_tokens": 55524973.0, "step": 26760 }, { "entropy": 5.4857885360717775, "epoch": 2.4278846153846154, "grad_norm": 1.125, "learning_rate": 0.0004410028448690134, "loss": 4.9661, "mean_token_accuracy": 0.2148415982723236, "num_tokens": 55534847.0, "step": 26765 }, { "entropy": 5.536700296401977, "epoch": 2.4283381712626997, "grad_norm": 1.234375, "learning_rate": 0.0004409810016035023, "loss": 4.9402, "mean_token_accuracy": 0.20440245270729065, "num_tokens": 55544886.0, "step": 26770 }, { "entropy": 5.509374284744263, "epoch": 2.4287917271407835, "grad_norm": 1.1953125, "learning_rate": 0.0004409591549054617, "loss": 5.0101, "mean_token_accuracy": 0.20709252059459687, "num_tokens": 55554534.0, "step": 26775 }, { "entropy": 5.527661991119385, "epoch": 2.4292452830188678, "grad_norm": 1.109375, "learning_rate": 0.00044093730477534355, "loss": 4.9647, "mean_token_accuracy": 0.20093503445386887, "num_tokens": 55564302.0, "step": 26780 }, { "entropy": 5.4597742557525635, "epoch": 2.429698838896952, "grad_norm": 1.109375, "learning_rate": 0.0004409154512135996, "loss": 4.8863, "mean_token_accuracy": 0.21747547686100005, "num_tokens": 55574543.0, "step": 26785 }, { "entropy": 5.46315336227417, "epoch": 2.4301523947750363, "grad_norm": 1.2265625, "learning_rate": 0.0004408935942206818, "loss": 4.884, "mean_token_accuracy": 0.21548329740762712, "num_tokens": 55583849.0, "step": 26790 }, { "entropy": 5.461973476409912, "epoch": 2.4306059506531206, "grad_norm": 1.1484375, "learning_rate": 0.0004408717337970423, "loss": 4.9438, "mean_token_accuracy": 0.21405625641345977, "num_tokens": 55594294.0, "step": 26795 }, { "entropy": 5.5222148418426515, "epoch": 2.431059506531205, "grad_norm": 1.1328125, "learning_rate": 0.00044084986994313304, "loss": 4.9593, "mean_token_accuracy": 0.20487088561058045, "num_tokens": 55604185.0, "step": 26800 }, { "entropy": 5.4942230701446535, "epoch": 2.4315130624092887, "grad_norm": 1.0234375, "learning_rate": 0.0004408280026594062, "loss": 4.8899, "mean_token_accuracy": 0.2136186718940735, "num_tokens": 55615203.0, "step": 26805 }, { "entropy": 5.454693746566773, "epoch": 2.431966618287373, "grad_norm": 1.203125, "learning_rate": 0.000440806131946314, "loss": 4.9742, "mean_token_accuracy": 0.21074686646461488, "num_tokens": 55626157.0, "step": 26810 }, { "entropy": 5.570779085159302, "epoch": 2.432420174165457, "grad_norm": 1.234375, "learning_rate": 0.00044078425780430877, "loss": 4.9412, "mean_token_accuracy": 0.20626144260168075, "num_tokens": 55636862.0, "step": 26815 }, { "entropy": 5.513393831253052, "epoch": 2.4328737300435415, "grad_norm": 1.125, "learning_rate": 0.0004407623802338428, "loss": 4.8414, "mean_token_accuracy": 0.21836733520030976, "num_tokens": 55647646.0, "step": 26820 }, { "entropy": 5.483344316482544, "epoch": 2.4333272859216257, "grad_norm": 1.125, "learning_rate": 0.00044074049923536855, "loss": 4.9061, "mean_token_accuracy": 0.21991498917341232, "num_tokens": 55659847.0, "step": 26825 }, { "entropy": 5.445178079605102, "epoch": 2.4337808417997095, "grad_norm": 1.1328125, "learning_rate": 0.0004407186148093386, "loss": 4.9205, "mean_token_accuracy": 0.21364904344081878, "num_tokens": 55670626.0, "step": 26830 }, { "entropy": 5.512595319747925, "epoch": 2.434234397677794, "grad_norm": 1.109375, "learning_rate": 0.00044069672695620543, "loss": 4.9776, "mean_token_accuracy": 0.20941813439130783, "num_tokens": 55681368.0, "step": 26835 }, { "entropy": 5.479383230209351, "epoch": 2.434687953555878, "grad_norm": 1.1015625, "learning_rate": 0.0004406748356764217, "loss": 4.8415, "mean_token_accuracy": 0.2141915038228035, "num_tokens": 55691606.0, "step": 26840 }, { "entropy": 5.528767919540405, "epoch": 2.4351415094339623, "grad_norm": 1.1640625, "learning_rate": 0.00044065294097044017, "loss": 5.0295, "mean_token_accuracy": 0.20866839438676835, "num_tokens": 55702223.0, "step": 26845 }, { "entropy": 5.440175533294678, "epoch": 2.4355950653120466, "grad_norm": 1.1171875, "learning_rate": 0.0004406310428387136, "loss": 4.8277, "mean_token_accuracy": 0.21594141274690629, "num_tokens": 55712729.0, "step": 26850 }, { "entropy": 5.532445621490479, "epoch": 2.4360486211901304, "grad_norm": 1.2265625, "learning_rate": 0.0004406091412816949, "loss": 4.9472, "mean_token_accuracy": 0.21529546231031418, "num_tokens": 55722863.0, "step": 26855 }, { "entropy": 5.549607372283935, "epoch": 2.4365021770682147, "grad_norm": 1.140625, "learning_rate": 0.00044058723629983694, "loss": 5.0032, "mean_token_accuracy": 0.21473173648118973, "num_tokens": 55733124.0, "step": 26860 }, { "entropy": 5.547212982177735, "epoch": 2.436955732946299, "grad_norm": 1.1171875, "learning_rate": 0.0004405653278935927, "loss": 4.9363, "mean_token_accuracy": 0.2171642452478409, "num_tokens": 55743438.0, "step": 26865 }, { "entropy": 5.443336105346679, "epoch": 2.4374092888243832, "grad_norm": 1.1875, "learning_rate": 0.00044054341606341533, "loss": 4.8177, "mean_token_accuracy": 0.2146530881524086, "num_tokens": 55753602.0, "step": 26870 }, { "entropy": 5.43633017539978, "epoch": 2.4378628447024675, "grad_norm": 1.140625, "learning_rate": 0.0004405215008097579, "loss": 4.8711, "mean_token_accuracy": 0.22178202122449875, "num_tokens": 55763473.0, "step": 26875 }, { "entropy": 5.462363290786743, "epoch": 2.4383164005805513, "grad_norm": 1.2109375, "learning_rate": 0.00044049958213307364, "loss": 4.8827, "mean_token_accuracy": 0.21548015773296356, "num_tokens": 55772848.0, "step": 26880 }, { "entropy": 5.459492158889771, "epoch": 2.4387699564586356, "grad_norm": 1.171875, "learning_rate": 0.00044047766003381584, "loss": 4.8588, "mean_token_accuracy": 0.22162742614746095, "num_tokens": 55783468.0, "step": 26885 }, { "entropy": 5.486462831497192, "epoch": 2.43922351233672, "grad_norm": 1.1015625, "learning_rate": 0.00044045573451243793, "loss": 4.9567, "mean_token_accuracy": 0.21840264052152633, "num_tokens": 55793619.0, "step": 26890 }, { "entropy": 5.479871797561645, "epoch": 2.439677068214804, "grad_norm": 1.1796875, "learning_rate": 0.00044043380556939326, "loss": 4.9286, "mean_token_accuracy": 0.2143921285867691, "num_tokens": 55803869.0, "step": 26895 }, { "entropy": 5.542277097702026, "epoch": 2.4401306240928884, "grad_norm": 1.125, "learning_rate": 0.0004404118732051353, "loss": 4.9407, "mean_token_accuracy": 0.21084595769643782, "num_tokens": 55814754.0, "step": 26900 }, { "entropy": 5.479099321365356, "epoch": 2.4405841799709727, "grad_norm": 1.2109375, "learning_rate": 0.0004403899374201176, "loss": 4.871, "mean_token_accuracy": 0.21173604875802993, "num_tokens": 55824862.0, "step": 26905 }, { "entropy": 5.440395927429199, "epoch": 2.4410377358490565, "grad_norm": 1.203125, "learning_rate": 0.00044036799821479397, "loss": 4.8796, "mean_token_accuracy": 0.21630153506994249, "num_tokens": 55835506.0, "step": 26910 }, { "entropy": 5.518917751312256, "epoch": 2.4414912917271407, "grad_norm": 1.140625, "learning_rate": 0.00044034605558961786, "loss": 4.9654, "mean_token_accuracy": 0.2110930159687996, "num_tokens": 55846244.0, "step": 26915 }, { "entropy": 5.440672254562378, "epoch": 2.441944847605225, "grad_norm": 1.125, "learning_rate": 0.00044032410954504325, "loss": 4.8744, "mean_token_accuracy": 0.22054927796125412, "num_tokens": 55856192.0, "step": 26920 }, { "entropy": 5.488173961639404, "epoch": 2.4423984034833093, "grad_norm": 1.171875, "learning_rate": 0.00044030216008152394, "loss": 4.9322, "mean_token_accuracy": 0.21053328961133957, "num_tokens": 55866509.0, "step": 26925 }, { "entropy": 5.522663545608521, "epoch": 2.442851959361393, "grad_norm": 1.1953125, "learning_rate": 0.00044028020719951376, "loss": 4.9553, "mean_token_accuracy": 0.21562650799751282, "num_tokens": 55877321.0, "step": 26930 }, { "entropy": 5.503424739837646, "epoch": 2.4433055152394774, "grad_norm": 1.1484375, "learning_rate": 0.0004402582508994669, "loss": 4.9154, "mean_token_accuracy": 0.2158783942461014, "num_tokens": 55887933.0, "step": 26935 }, { "entropy": 5.439522743225098, "epoch": 2.4437590711175616, "grad_norm": 1.078125, "learning_rate": 0.00044023629118183726, "loss": 4.8613, "mean_token_accuracy": 0.21243632286787034, "num_tokens": 55897274.0, "step": 26940 }, { "entropy": 5.525461149215698, "epoch": 2.444212626995646, "grad_norm": 1.109375, "learning_rate": 0.00044021432804707895, "loss": 5.0031, "mean_token_accuracy": 0.20866023898124694, "num_tokens": 55907393.0, "step": 26945 }, { "entropy": 5.460586357116699, "epoch": 2.44466618287373, "grad_norm": 1.09375, "learning_rate": 0.0004401923614956463, "loss": 4.9091, "mean_token_accuracy": 0.2113513767719269, "num_tokens": 55918429.0, "step": 26950 }, { "entropy": 5.490865707397461, "epoch": 2.4451197387518144, "grad_norm": 1.0859375, "learning_rate": 0.0004401703915279935, "loss": 4.874, "mean_token_accuracy": 0.2138999193906784, "num_tokens": 55928733.0, "step": 26955 }, { "entropy": 5.535603857040405, "epoch": 2.4455732946298983, "grad_norm": 1.1328125, "learning_rate": 0.00044014841814457486, "loss": 4.8843, "mean_token_accuracy": 0.21638813316822053, "num_tokens": 55939128.0, "step": 26960 }, { "entropy": 5.55042519569397, "epoch": 2.4460268505079825, "grad_norm": 1.09375, "learning_rate": 0.0004401264413458449, "loss": 5.0305, "mean_token_accuracy": 0.20636268258094786, "num_tokens": 55950237.0, "step": 26965 }, { "entropy": 5.504288530349731, "epoch": 2.446480406386067, "grad_norm": 1.0859375, "learning_rate": 0.0004401044611322581, "loss": 4.8384, "mean_token_accuracy": 0.22138212323188783, "num_tokens": 55960436.0, "step": 26970 }, { "entropy": 5.4609678268432615, "epoch": 2.446933962264151, "grad_norm": 1.171875, "learning_rate": 0.0004400824775042689, "loss": 4.8277, "mean_token_accuracy": 0.21638987064361573, "num_tokens": 55970446.0, "step": 26975 }, { "entropy": 5.505931377410889, "epoch": 2.447387518142235, "grad_norm": 1.1171875, "learning_rate": 0.000440060490462332, "loss": 4.9474, "mean_token_accuracy": 0.21207243502140044, "num_tokens": 55980706.0, "step": 26980 }, { "entropy": 5.510345697402954, "epoch": 2.447841074020319, "grad_norm": 1.1171875, "learning_rate": 0.0004400385000069021, "loss": 5.0034, "mean_token_accuracy": 0.20478834807872773, "num_tokens": 55990669.0, "step": 26985 }, { "entropy": 5.585621404647827, "epoch": 2.4482946298984034, "grad_norm": 1.234375, "learning_rate": 0.00044001650613843395, "loss": 5.0013, "mean_token_accuracy": 0.20946276932954788, "num_tokens": 56000709.0, "step": 26990 }, { "entropy": 5.5095092296600345, "epoch": 2.4487481857764877, "grad_norm": 1.1328125, "learning_rate": 0.0004399945088573824, "loss": 4.8999, "mean_token_accuracy": 0.2201507106423378, "num_tokens": 56011435.0, "step": 26995 }, { "entropy": 5.482499456405639, "epoch": 2.449201741654572, "grad_norm": 1.2421875, "learning_rate": 0.00043997250816420246, "loss": 4.9055, "mean_token_accuracy": 0.21885482519865035, "num_tokens": 56021264.0, "step": 27000 }, { "epoch": 2.449201741654572, "eval_entropy": 5.2357296030985285, "eval_loss": 4.991609573364258, "eval_mean_token_accuracy": 0.21966902533908506, "eval_num_tokens": 56021264.0, "eval_runtime": 20.6142, "eval_samples_per_second": 1715.321, "eval_steps_per_second": 214.415, "step": 27000 }, { "entropy": 5.494916391372681, "epoch": 2.449655297532656, "grad_norm": 1.078125, "learning_rate": 0.0004399505040593489, "loss": 4.9391, "mean_token_accuracy": 0.20938896685838698, "num_tokens": 56031463.0, "step": 27005 }, { "entropy": 5.469224977493286, "epoch": 2.45010885341074, "grad_norm": 1.1484375, "learning_rate": 0.00043992849654327695, "loss": 4.8225, "mean_token_accuracy": 0.21603455990552903, "num_tokens": 56041195.0, "step": 27010 }, { "entropy": 5.4915258407592775, "epoch": 2.4505624092888243, "grad_norm": 1.09375, "learning_rate": 0.0004399064856164416, "loss": 4.9465, "mean_token_accuracy": 0.21389532536268235, "num_tokens": 56051840.0, "step": 27015 }, { "entropy": 5.520238780975342, "epoch": 2.4510159651669086, "grad_norm": 1.15625, "learning_rate": 0.00043988447127929817, "loss": 4.971, "mean_token_accuracy": 0.21247733235359192, "num_tokens": 56062535.0, "step": 27020 }, { "entropy": 5.504625940322876, "epoch": 2.451469521044993, "grad_norm": 1.2265625, "learning_rate": 0.00043986245353230173, "loss": 4.8758, "mean_token_accuracy": 0.2248425841331482, "num_tokens": 56072177.0, "step": 27025 }, { "entropy": 5.4725605010986325, "epoch": 2.451923076923077, "grad_norm": 1.1875, "learning_rate": 0.00043984043237590785, "loss": 4.9511, "mean_token_accuracy": 0.2161737784743309, "num_tokens": 56081607.0, "step": 27030 }, { "entropy": 5.478176212310791, "epoch": 2.452376632801161, "grad_norm": 1.109375, "learning_rate": 0.00043981840781057185, "loss": 4.9241, "mean_token_accuracy": 0.21207477599382402, "num_tokens": 56093371.0, "step": 27035 }, { "entropy": 5.503431224822998, "epoch": 2.452830188679245, "grad_norm": 1.140625, "learning_rate": 0.00043979637983674913, "loss": 4.9259, "mean_token_accuracy": 0.2126280650496483, "num_tokens": 56103973.0, "step": 27040 }, { "entropy": 5.501952362060547, "epoch": 2.4532837445573294, "grad_norm": 1.0078125, "learning_rate": 0.0004397743484548953, "loss": 4.9149, "mean_token_accuracy": 0.21286799609661103, "num_tokens": 56113906.0, "step": 27045 }, { "entropy": 5.48510513305664, "epoch": 2.4537373004354137, "grad_norm": 1.1171875, "learning_rate": 0.0004397523136654659, "loss": 4.8889, "mean_token_accuracy": 0.21415451616048814, "num_tokens": 56124172.0, "step": 27050 }, { "entropy": 5.464991283416748, "epoch": 2.454190856313498, "grad_norm": 1.2109375, "learning_rate": 0.00043973027546891677, "loss": 4.7674, "mean_token_accuracy": 0.2282601222395897, "num_tokens": 56133088.0, "step": 27055 }, { "entropy": 5.464124155044556, "epoch": 2.4546444121915822, "grad_norm": 1.203125, "learning_rate": 0.0004397082338657034, "loss": 4.8948, "mean_token_accuracy": 0.21559770852327348, "num_tokens": 56143098.0, "step": 27060 }, { "entropy": 5.47809739112854, "epoch": 2.455097968069666, "grad_norm": 1.0859375, "learning_rate": 0.00043968618885628185, "loss": 4.8908, "mean_token_accuracy": 0.21945605874061586, "num_tokens": 56153889.0, "step": 27065 }, { "entropy": 5.458990097045898, "epoch": 2.4555515239477503, "grad_norm": 1.1953125, "learning_rate": 0.00043966414044110805, "loss": 4.8367, "mean_token_accuracy": 0.21992984116077424, "num_tokens": 56164164.0, "step": 27070 }, { "entropy": 5.522607040405274, "epoch": 2.4560050798258346, "grad_norm": 1.2109375, "learning_rate": 0.00043964208862063775, "loss": 4.9627, "mean_token_accuracy": 0.21104868799448012, "num_tokens": 56173172.0, "step": 27075 }, { "entropy": 5.5256640911102295, "epoch": 2.456458635703919, "grad_norm": 1.21875, "learning_rate": 0.00043962003339532714, "loss": 4.9052, "mean_token_accuracy": 0.2197902038693428, "num_tokens": 56183127.0, "step": 27080 }, { "entropy": 5.526291561126709, "epoch": 2.4569121915820027, "grad_norm": 1.1171875, "learning_rate": 0.00043959797476563226, "loss": 4.9546, "mean_token_accuracy": 0.21260267347097397, "num_tokens": 56192528.0, "step": 27085 }, { "entropy": 5.483093118667602, "epoch": 2.457365747460087, "grad_norm": 1.09375, "learning_rate": 0.00043957591273200943, "loss": 4.8952, "mean_token_accuracy": 0.21251945197582245, "num_tokens": 56203239.0, "step": 27090 }, { "entropy": 5.524399089813232, "epoch": 2.4578193033381712, "grad_norm": 1.0625, "learning_rate": 0.0004395538472949146, "loss": 4.9565, "mean_token_accuracy": 0.21127965450286865, "num_tokens": 56214068.0, "step": 27095 }, { "entropy": 5.557310247421265, "epoch": 2.4582728592162555, "grad_norm": 1.1171875, "learning_rate": 0.0004395317784548045, "loss": 4.969, "mean_token_accuracy": 0.202183036506176, "num_tokens": 56224829.0, "step": 27100 }, { "entropy": 5.593783712387085, "epoch": 2.4587264150943398, "grad_norm": 1.125, "learning_rate": 0.0004395097062121351, "loss": 4.9746, "mean_token_accuracy": 0.21175989508628845, "num_tokens": 56235412.0, "step": 27105 }, { "entropy": 5.5662078857421875, "epoch": 2.459179970972424, "grad_norm": 1.0390625, "learning_rate": 0.00043948763056736315, "loss": 4.9991, "mean_token_accuracy": 0.20703294575214387, "num_tokens": 56246785.0, "step": 27110 }, { "entropy": 5.538149070739746, "epoch": 2.459633526850508, "grad_norm": 1.1171875, "learning_rate": 0.000439465551520945, "loss": 4.9795, "mean_token_accuracy": 0.2101506069302559, "num_tokens": 56256701.0, "step": 27115 }, { "entropy": 5.479132223129272, "epoch": 2.460087082728592, "grad_norm": 1.09375, "learning_rate": 0.00043944346907333744, "loss": 4.9308, "mean_token_accuracy": 0.2113966926932335, "num_tokens": 56267418.0, "step": 27120 }, { "entropy": 5.443803930282593, "epoch": 2.4605406386066764, "grad_norm": 1.0234375, "learning_rate": 0.000439421383224997, "loss": 4.8529, "mean_token_accuracy": 0.21567052602767944, "num_tokens": 56278232.0, "step": 27125 }, { "entropy": 5.552145719528198, "epoch": 2.4609941944847606, "grad_norm": 1.1015625, "learning_rate": 0.0004393992939763804, "loss": 4.9377, "mean_token_accuracy": 0.2112806424498558, "num_tokens": 56289866.0, "step": 27130 }, { "entropy": 5.510740137100219, "epoch": 2.4614477503628445, "grad_norm": 1.1875, "learning_rate": 0.00043937720132794457, "loss": 4.8961, "mean_token_accuracy": 0.2172268807888031, "num_tokens": 56299595.0, "step": 27135 }, { "entropy": 5.548333692550659, "epoch": 2.4619013062409287, "grad_norm": 1.21875, "learning_rate": 0.00043935510528014625, "loss": 4.9591, "mean_token_accuracy": 0.2175906166434288, "num_tokens": 56310152.0, "step": 27140 }, { "entropy": 5.519309711456299, "epoch": 2.462354862119013, "grad_norm": 1.1640625, "learning_rate": 0.0004393330058334426, "loss": 5.0309, "mean_token_accuracy": 0.20516949892044067, "num_tokens": 56320288.0, "step": 27145 }, { "entropy": 5.547877645492553, "epoch": 2.4628084179970973, "grad_norm": 1.0625, "learning_rate": 0.00043931090298829047, "loss": 4.9333, "mean_token_accuracy": 0.20865002274513245, "num_tokens": 56330345.0, "step": 27150 }, { "entropy": 5.614681196212769, "epoch": 2.4632619738751815, "grad_norm": 1.0546875, "learning_rate": 0.00043928879674514694, "loss": 5.0675, "mean_token_accuracy": 0.2119154930114746, "num_tokens": 56340996.0, "step": 27155 }, { "entropy": 5.434743213653564, "epoch": 2.463715529753266, "grad_norm": 1.1796875, "learning_rate": 0.0004392666871044692, "loss": 4.7862, "mean_token_accuracy": 0.22223087400197983, "num_tokens": 56350326.0, "step": 27160 }, { "entropy": 5.47396445274353, "epoch": 2.4641690856313496, "grad_norm": 1.1484375, "learning_rate": 0.00043924457406671456, "loss": 4.9204, "mean_token_accuracy": 0.2186198577284813, "num_tokens": 56360556.0, "step": 27165 }, { "entropy": 5.541845321655273, "epoch": 2.464622641509434, "grad_norm": 1.15625, "learning_rate": 0.0004392224576323403, "loss": 4.8881, "mean_token_accuracy": 0.21551176756620408, "num_tokens": 56369980.0, "step": 27170 }, { "entropy": 5.525144863128662, "epoch": 2.465076197387518, "grad_norm": 1.1953125, "learning_rate": 0.00043920033780180367, "loss": 4.9344, "mean_token_accuracy": 0.2072213813662529, "num_tokens": 56379974.0, "step": 27175 }, { "entropy": 5.481790161132812, "epoch": 2.4655297532656024, "grad_norm": 1.1484375, "learning_rate": 0.0004391782145755623, "loss": 4.8552, "mean_token_accuracy": 0.21741439700126647, "num_tokens": 56390542.0, "step": 27180 }, { "entropy": 5.570679426193237, "epoch": 2.4659833091436867, "grad_norm": 1.1015625, "learning_rate": 0.0004391560879540736, "loss": 5.0243, "mean_token_accuracy": 0.20456839799880983, "num_tokens": 56401755.0, "step": 27185 }, { "entropy": 5.500103330612182, "epoch": 2.4664368650217705, "grad_norm": 1.171875, "learning_rate": 0.0004391339579377952, "loss": 4.9238, "mean_token_accuracy": 0.2165648266673088, "num_tokens": 56412223.0, "step": 27190 }, { "entropy": 5.539244604110718, "epoch": 2.4668904208998548, "grad_norm": 1.171875, "learning_rate": 0.00043911182452718476, "loss": 4.9602, "mean_token_accuracy": 0.2088968962430954, "num_tokens": 56422947.0, "step": 27195 }, { "entropy": 5.489877223968506, "epoch": 2.467343976777939, "grad_norm": 1.1015625, "learning_rate": 0.00043908968772269984, "loss": 4.9132, "mean_token_accuracy": 0.21561992019414902, "num_tokens": 56433189.0, "step": 27200 }, { "entropy": 5.527774047851563, "epoch": 2.4677975326560233, "grad_norm": 1.0703125, "learning_rate": 0.00043906754752479836, "loss": 4.934, "mean_token_accuracy": 0.2143586054444313, "num_tokens": 56444460.0, "step": 27205 }, { "entropy": 5.54619402885437, "epoch": 2.4682510885341076, "grad_norm": 1.1640625, "learning_rate": 0.0004390454039339383, "loss": 4.9671, "mean_token_accuracy": 0.20837389826774597, "num_tokens": 56454368.0, "step": 27210 }, { "entropy": 5.451146364212036, "epoch": 2.4687046444121914, "grad_norm": 1.1328125, "learning_rate": 0.00043902325695057743, "loss": 4.8696, "mean_token_accuracy": 0.2145874246954918, "num_tokens": 56464153.0, "step": 27215 }, { "entropy": 5.484639883041382, "epoch": 2.4691582002902757, "grad_norm": 1.1875, "learning_rate": 0.00043900110657517377, "loss": 4.8779, "mean_token_accuracy": 0.21641258150339127, "num_tokens": 56473627.0, "step": 27220 }, { "entropy": 5.479943943023682, "epoch": 2.46961175616836, "grad_norm": 1.1328125, "learning_rate": 0.0004389789528081855, "loss": 4.8884, "mean_token_accuracy": 0.21771203875541686, "num_tokens": 56483660.0, "step": 27225 }, { "entropy": 5.5281702995300295, "epoch": 2.470065312046444, "grad_norm": 1.21875, "learning_rate": 0.0004389567956500707, "loss": 4.8954, "mean_token_accuracy": 0.21584168076515198, "num_tokens": 56492653.0, "step": 27230 }, { "entropy": 5.578667068481446, "epoch": 2.4705188679245285, "grad_norm": 1.140625, "learning_rate": 0.0004389346351012876, "loss": 5.0335, "mean_token_accuracy": 0.20452366322278975, "num_tokens": 56503289.0, "step": 27235 }, { "entropy": 5.570003795623779, "epoch": 2.4709724238026123, "grad_norm": 1.0703125, "learning_rate": 0.00043891247116229436, "loss": 4.9983, "mean_token_accuracy": 0.2053408905863762, "num_tokens": 56513843.0, "step": 27240 }, { "entropy": 5.558351325988769, "epoch": 2.4714259796806965, "grad_norm": 1.171875, "learning_rate": 0.00043889030383354957, "loss": 4.9622, "mean_token_accuracy": 0.2121433585882187, "num_tokens": 56524175.0, "step": 27245 }, { "entropy": 5.480007219314575, "epoch": 2.471879535558781, "grad_norm": 1.0625, "learning_rate": 0.0004388681331155114, "loss": 4.8745, "mean_token_accuracy": 0.2238924190402031, "num_tokens": 56534976.0, "step": 27250 }, { "entropy": 5.557298278808593, "epoch": 2.472333091436865, "grad_norm": 1.1484375, "learning_rate": 0.0004388459590086386, "loss": 4.9308, "mean_token_accuracy": 0.21302677690982819, "num_tokens": 56545967.0, "step": 27255 }, { "entropy": 5.5358631134033205, "epoch": 2.4727866473149493, "grad_norm": 1.2109375, "learning_rate": 0.00043882378151338956, "loss": 4.9775, "mean_token_accuracy": 0.20955596268177032, "num_tokens": 56555527.0, "step": 27260 }, { "entropy": 5.535481262207031, "epoch": 2.4732402031930336, "grad_norm": 1.1640625, "learning_rate": 0.000438801600630223, "loss": 4.9473, "mean_token_accuracy": 0.20499177724123002, "num_tokens": 56565874.0, "step": 27265 }, { "entropy": 5.496514415740966, "epoch": 2.4736937590711174, "grad_norm": 1.1796875, "learning_rate": 0.00043877941635959755, "loss": 4.8711, "mean_token_accuracy": 0.2151979088783264, "num_tokens": 56575452.0, "step": 27270 }, { "entropy": 5.407858562469483, "epoch": 2.4741473149492017, "grad_norm": 1.125, "learning_rate": 0.00043875722870197214, "loss": 4.8586, "mean_token_accuracy": 0.22353904992341994, "num_tokens": 56586176.0, "step": 27275 }, { "entropy": 5.517267560958862, "epoch": 2.474600870827286, "grad_norm": 1.2421875, "learning_rate": 0.0004387350376578054, "loss": 4.9049, "mean_token_accuracy": 0.21410378515720369, "num_tokens": 56595473.0, "step": 27280 }, { "entropy": 5.5282081127166744, "epoch": 2.4750544267053702, "grad_norm": 1.1328125, "learning_rate": 0.0004387128432275563, "loss": 4.9325, "mean_token_accuracy": 0.21571965664625167, "num_tokens": 56606016.0, "step": 27285 }, { "entropy": 5.48876314163208, "epoch": 2.475507982583454, "grad_norm": 1.1796875, "learning_rate": 0.000438690645411684, "loss": 4.9268, "mean_token_accuracy": 0.21178403496742249, "num_tokens": 56617674.0, "step": 27290 }, { "entropy": 5.536155033111572, "epoch": 2.4759615384615383, "grad_norm": 1.203125, "learning_rate": 0.00043866844421064745, "loss": 4.9141, "mean_token_accuracy": 0.21504662036895753, "num_tokens": 56628077.0, "step": 27295 }, { "entropy": 5.541977024078369, "epoch": 2.4764150943396226, "grad_norm": 1.0625, "learning_rate": 0.00043864623962490575, "loss": 4.8735, "mean_token_accuracy": 0.2176972433924675, "num_tokens": 56638691.0, "step": 27300 }, { "entropy": 5.518357276916504, "epoch": 2.476868650217707, "grad_norm": 1.1328125, "learning_rate": 0.0004386240316549181, "loss": 4.9042, "mean_token_accuracy": 0.21259113103151323, "num_tokens": 56650338.0, "step": 27305 }, { "entropy": 5.478986406326294, "epoch": 2.477322206095791, "grad_norm": 1.1171875, "learning_rate": 0.00043860182030114374, "loss": 4.8501, "mean_token_accuracy": 0.2234350174665451, "num_tokens": 56660328.0, "step": 27310 }, { "entropy": 5.573250818252563, "epoch": 2.4777757619738754, "grad_norm": 1.171875, "learning_rate": 0.00043857960556404214, "loss": 4.9926, "mean_token_accuracy": 0.21366402953863145, "num_tokens": 56670674.0, "step": 27315 }, { "entropy": 5.506168985366822, "epoch": 2.478229317851959, "grad_norm": 1.0859375, "learning_rate": 0.0004385573874440725, "loss": 4.917, "mean_token_accuracy": 0.21611077785491944, "num_tokens": 56680656.0, "step": 27320 }, { "entropy": 5.4909961223602295, "epoch": 2.4786828737300435, "grad_norm": 1.1640625, "learning_rate": 0.00043853516594169446, "loss": 4.8412, "mean_token_accuracy": 0.22142103910446168, "num_tokens": 56691039.0, "step": 27325 }, { "entropy": 5.502261638641357, "epoch": 2.4791364296081277, "grad_norm": 1.0703125, "learning_rate": 0.0004385129410573675, "loss": 4.9012, "mean_token_accuracy": 0.21016360223293304, "num_tokens": 56703101.0, "step": 27330 }, { "entropy": 5.517206430435181, "epoch": 2.479589985486212, "grad_norm": 1.203125, "learning_rate": 0.00043849071279155124, "loss": 4.9749, "mean_token_accuracy": 0.22036022543907166, "num_tokens": 56712351.0, "step": 27335 }, { "entropy": 5.495806884765625, "epoch": 2.480043541364296, "grad_norm": 1.1171875, "learning_rate": 0.00043846848114470537, "loss": 4.9273, "mean_token_accuracy": 0.21987007558345795, "num_tokens": 56722836.0, "step": 27340 }, { "entropy": 5.527901601791382, "epoch": 2.48049709724238, "grad_norm": 1.03125, "learning_rate": 0.00043844624611728974, "loss": 4.9156, "mean_token_accuracy": 0.21343635469675065, "num_tokens": 56734032.0, "step": 27345 }, { "entropy": 5.525054550170898, "epoch": 2.4809506531204644, "grad_norm": 1.125, "learning_rate": 0.00043842400770976406, "loss": 4.8958, "mean_token_accuracy": 0.21624885499477386, "num_tokens": 56743536.0, "step": 27350 }, { "entropy": 5.476931762695313, "epoch": 2.4814042089985486, "grad_norm": 1.2109375, "learning_rate": 0.0004384017659225882, "loss": 4.9126, "mean_token_accuracy": 0.21204424202442168, "num_tokens": 56753475.0, "step": 27355 }, { "entropy": 5.458152723312378, "epoch": 2.481857764876633, "grad_norm": 1.125, "learning_rate": 0.00043837952075622224, "loss": 4.8401, "mean_token_accuracy": 0.22411585301160813, "num_tokens": 56763602.0, "step": 27360 }, { "entropy": 5.517909812927246, "epoch": 2.482311320754717, "grad_norm": 1.1328125, "learning_rate": 0.0004383572722111261, "loss": 4.8494, "mean_token_accuracy": 0.2242525562644005, "num_tokens": 56773859.0, "step": 27365 }, { "entropy": 5.498459386825561, "epoch": 2.482764876632801, "grad_norm": 1.1796875, "learning_rate": 0.00043833502028775995, "loss": 4.9059, "mean_token_accuracy": 0.21762668043375016, "num_tokens": 56783810.0, "step": 27370 }, { "entropy": 5.510944843292236, "epoch": 2.4832184325108853, "grad_norm": 1.2421875, "learning_rate": 0.00043831276498658395, "loss": 5.0046, "mean_token_accuracy": 0.21070886254310608, "num_tokens": 56794088.0, "step": 27375 }, { "entropy": 5.437960433959961, "epoch": 2.4836719883889695, "grad_norm": 1.0703125, "learning_rate": 0.0004382905063080584, "loss": 4.8507, "mean_token_accuracy": 0.21804012060165406, "num_tokens": 56804623.0, "step": 27380 }, { "entropy": 5.47583794593811, "epoch": 2.484125544267054, "grad_norm": 1.1875, "learning_rate": 0.00043826824425264357, "loss": 4.9306, "mean_token_accuracy": 0.21052938997745513, "num_tokens": 56813842.0, "step": 27385 }, { "entropy": 5.538039636611939, "epoch": 2.484579100145138, "grad_norm": 1.125, "learning_rate": 0.0004382459788207997, "loss": 4.9134, "mean_token_accuracy": 0.21324970722198486, "num_tokens": 56823501.0, "step": 27390 }, { "entropy": 5.545355939865113, "epoch": 2.485032656023222, "grad_norm": 1.1328125, "learning_rate": 0.00043822371001298754, "loss": 4.9427, "mean_token_accuracy": 0.211967134475708, "num_tokens": 56834601.0, "step": 27395 }, { "entropy": 5.460286712646484, "epoch": 2.485486211901306, "grad_norm": 1.2265625, "learning_rate": 0.0004382014378296674, "loss": 4.9414, "mean_token_accuracy": 0.20564347356557847, "num_tokens": 56844701.0, "step": 27400 }, { "entropy": 5.466500902175904, "epoch": 2.4859397677793904, "grad_norm": 1.109375, "learning_rate": 0.0004381791622713, "loss": 4.9124, "mean_token_accuracy": 0.21440732032060622, "num_tokens": 56854867.0, "step": 27405 }, { "entropy": 5.556684875488282, "epoch": 2.4863933236574747, "grad_norm": 1.0390625, "learning_rate": 0.000438156883338346, "loss": 4.944, "mean_token_accuracy": 0.21684509813785552, "num_tokens": 56865688.0, "step": 27410 }, { "entropy": 5.5753742218017575, "epoch": 2.486846879535559, "grad_norm": 1.1953125, "learning_rate": 0.00043813460103126595, "loss": 4.9468, "mean_token_accuracy": 0.21565346121788026, "num_tokens": 56876504.0, "step": 27415 }, { "entropy": 5.50859580039978, "epoch": 2.487300435413643, "grad_norm": 1.171875, "learning_rate": 0.00043811231535052076, "loss": 4.8916, "mean_token_accuracy": 0.21681600362062453, "num_tokens": 56886083.0, "step": 27420 }, { "entropy": 5.466057634353637, "epoch": 2.487753991291727, "grad_norm": 1.1953125, "learning_rate": 0.0004380900262965714, "loss": 4.949, "mean_token_accuracy": 0.21614607572555541, "num_tokens": 56897079.0, "step": 27425 }, { "entropy": 5.48646650314331, "epoch": 2.4882075471698113, "grad_norm": 1.2734375, "learning_rate": 0.0004380677338698787, "loss": 4.8877, "mean_token_accuracy": 0.21964190006256104, "num_tokens": 56906962.0, "step": 27430 }, { "entropy": 5.566875267028808, "epoch": 2.4886611030478956, "grad_norm": 1.1328125, "learning_rate": 0.00043804543807090374, "loss": 4.9861, "mean_token_accuracy": 0.20811552107334136, "num_tokens": 56918156.0, "step": 27435 }, { "entropy": 5.483881998062134, "epoch": 2.48911465892598, "grad_norm": 1.1328125, "learning_rate": 0.00043802313890010757, "loss": 4.9143, "mean_token_accuracy": 0.2126583307981491, "num_tokens": 56928888.0, "step": 27440 }, { "entropy": 5.518128824234009, "epoch": 2.4895682148040637, "grad_norm": 1.125, "learning_rate": 0.0004380008363579513, "loss": 4.8992, "mean_token_accuracy": 0.21166997402906418, "num_tokens": 56939929.0, "step": 27445 }, { "entropy": 5.539379644393921, "epoch": 2.490021770682148, "grad_norm": 1.09375, "learning_rate": 0.00043797853044489623, "loss": 4.8384, "mean_token_accuracy": 0.21962590962648393, "num_tokens": 56950992.0, "step": 27450 }, { "entropy": 5.56898717880249, "epoch": 2.490475326560232, "grad_norm": 1.0859375, "learning_rate": 0.0004379562211614036, "loss": 5.0048, "mean_token_accuracy": 0.21231268495321273, "num_tokens": 56962118.0, "step": 27455 }, { "entropy": 5.524201726913452, "epoch": 2.4909288824383164, "grad_norm": 1.0234375, "learning_rate": 0.0004379339085079348, "loss": 4.9232, "mean_token_accuracy": 0.21393794566392899, "num_tokens": 56972837.0, "step": 27460 }, { "entropy": 5.532465982437134, "epoch": 2.4913824383164007, "grad_norm": 1.265625, "learning_rate": 0.0004379115924849512, "loss": 4.9239, "mean_token_accuracy": 0.2131011039018631, "num_tokens": 56982794.0, "step": 27465 }, { "entropy": 5.596230411529541, "epoch": 2.491835994194485, "grad_norm": 1.140625, "learning_rate": 0.0004378892730929145, "loss": 5.0567, "mean_token_accuracy": 0.215960992872715, "num_tokens": 56993979.0, "step": 27470 }, { "entropy": 5.52348952293396, "epoch": 2.492289550072569, "grad_norm": 1.1171875, "learning_rate": 0.00043786695033228604, "loss": 4.9267, "mean_token_accuracy": 0.21323892921209336, "num_tokens": 57004505.0, "step": 27475 }, { "entropy": 5.532655858993531, "epoch": 2.492743105950653, "grad_norm": 1.203125, "learning_rate": 0.00043784462420352747, "loss": 4.9488, "mean_token_accuracy": 0.21141747534275054, "num_tokens": 57014121.0, "step": 27480 }, { "entropy": 5.569469881057739, "epoch": 2.4931966618287373, "grad_norm": 1.171875, "learning_rate": 0.00043782229470710067, "loss": 4.9324, "mean_token_accuracy": 0.2121428593993187, "num_tokens": 57023748.0, "step": 27485 }, { "entropy": 5.478572797775269, "epoch": 2.4936502177068216, "grad_norm": 1.1484375, "learning_rate": 0.0004377999618434673, "loss": 4.9023, "mean_token_accuracy": 0.21529392749071122, "num_tokens": 57034782.0, "step": 27490 }, { "entropy": 5.451092100143432, "epoch": 2.4941037735849054, "grad_norm": 1.1328125, "learning_rate": 0.0004377776256130892, "loss": 4.848, "mean_token_accuracy": 0.21864885240793228, "num_tokens": 57045136.0, "step": 27495 }, { "entropy": 5.526750230789185, "epoch": 2.4945573294629897, "grad_norm": 1.171875, "learning_rate": 0.00043775528601642833, "loss": 5.0655, "mean_token_accuracy": 0.2005676433444023, "num_tokens": 57055893.0, "step": 27500 }, { "entropy": 5.523357105255127, "epoch": 2.495010885341074, "grad_norm": 1.0703125, "learning_rate": 0.00043773294305394665, "loss": 4.9415, "mean_token_accuracy": 0.21413020193576812, "num_tokens": 57067189.0, "step": 27505 }, { "entropy": 5.554200935363769, "epoch": 2.4954644412191582, "grad_norm": 1.2421875, "learning_rate": 0.00043771059672610636, "loss": 4.9224, "mean_token_accuracy": 0.2193602055311203, "num_tokens": 57077374.0, "step": 27510 }, { "entropy": 5.50458345413208, "epoch": 2.4959179970972425, "grad_norm": 1.1484375, "learning_rate": 0.00043768824703336933, "loss": 4.8874, "mean_token_accuracy": 0.21179157197475434, "num_tokens": 57088168.0, "step": 27515 }, { "entropy": 5.497486877441406, "epoch": 2.4963715529753268, "grad_norm": 1.1640625, "learning_rate": 0.0004376658939761979, "loss": 4.8765, "mean_token_accuracy": 0.2154663622379303, "num_tokens": 57098743.0, "step": 27520 }, { "entropy": 5.512390184402466, "epoch": 2.4968251088534106, "grad_norm": 1.1328125, "learning_rate": 0.0004376435375550544, "loss": 5.0045, "mean_token_accuracy": 0.20618267208337784, "num_tokens": 57109854.0, "step": 27525 }, { "entropy": 5.468565130233765, "epoch": 2.497278664731495, "grad_norm": 1.140625, "learning_rate": 0.00043762117777040106, "loss": 4.8607, "mean_token_accuracy": 0.22250816524028777, "num_tokens": 57120296.0, "step": 27530 }, { "entropy": 5.480441570281982, "epoch": 2.497732220609579, "grad_norm": 1.1015625, "learning_rate": 0.0004375988146227003, "loss": 4.8894, "mean_token_accuracy": 0.21591870933771135, "num_tokens": 57131295.0, "step": 27535 }, { "entropy": 5.5250892162323, "epoch": 2.4981857764876634, "grad_norm": 1.1640625, "learning_rate": 0.0004375764481124147, "loss": 4.9439, "mean_token_accuracy": 0.21266426891088486, "num_tokens": 57141936.0, "step": 27540 }, { "entropy": 5.472104263305664, "epoch": 2.4986393323657476, "grad_norm": 1.1328125, "learning_rate": 0.00043755407824000664, "loss": 4.8698, "mean_token_accuracy": 0.22408146113157273, "num_tokens": 57152510.0, "step": 27545 }, { "entropy": 5.488446235656738, "epoch": 2.4990928882438315, "grad_norm": 1.1875, "learning_rate": 0.00043753170500593884, "loss": 4.9249, "mean_token_accuracy": 0.2145903527736664, "num_tokens": 57162546.0, "step": 27550 }, { "entropy": 5.431600761413574, "epoch": 2.4995464441219157, "grad_norm": 1.0703125, "learning_rate": 0.00043750932841067397, "loss": 4.822, "mean_token_accuracy": 0.2214560925960541, "num_tokens": 57174658.0, "step": 27555 }, { "entropy": 5.585208129882813, "epoch": 2.5, "grad_norm": 1.078125, "learning_rate": 0.00043748694845467483, "loss": 5.0665, "mean_token_accuracy": 0.20471915155649184, "num_tokens": 57185157.0, "step": 27560 }, { "entropy": 5.506630182266235, "epoch": 2.5004535558780843, "grad_norm": 1.109375, "learning_rate": 0.00043746456513840405, "loss": 4.8495, "mean_token_accuracy": 0.2161380410194397, "num_tokens": 57195277.0, "step": 27565 }, { "entropy": 5.546444845199585, "epoch": 2.5009071117561685, "grad_norm": 1.1875, "learning_rate": 0.0004374421784623248, "loss": 4.9298, "mean_token_accuracy": 0.21481461822986603, "num_tokens": 57205374.0, "step": 27570 }, { "entropy": 5.48497462272644, "epoch": 2.501360667634253, "grad_norm": 1.25, "learning_rate": 0.00043741978842689987, "loss": 4.9205, "mean_token_accuracy": 0.2142408162355423, "num_tokens": 57215700.0, "step": 27575 }, { "entropy": 5.502138757705689, "epoch": 2.5018142235123366, "grad_norm": 1.1875, "learning_rate": 0.0004373973950325923, "loss": 4.939, "mean_token_accuracy": 0.21474092006683348, "num_tokens": 57225765.0, "step": 27580 }, { "entropy": 5.515675735473633, "epoch": 2.502267779390421, "grad_norm": 1.2265625, "learning_rate": 0.00043737499827986527, "loss": 4.9228, "mean_token_accuracy": 0.21452175974845886, "num_tokens": 57235913.0, "step": 27585 }, { "entropy": 5.475171518325806, "epoch": 2.502721335268505, "grad_norm": 1.0625, "learning_rate": 0.00043735259816918184, "loss": 4.8576, "mean_token_accuracy": 0.21677391976118088, "num_tokens": 57246204.0, "step": 27590 }, { "entropy": 5.480260229110717, "epoch": 2.5031748911465894, "grad_norm": 1.15625, "learning_rate": 0.0004373301947010053, "loss": 4.9619, "mean_token_accuracy": 0.20743590593338013, "num_tokens": 57256167.0, "step": 27595 }, { "entropy": 5.44982876777649, "epoch": 2.5036284470246732, "grad_norm": 1.1484375, "learning_rate": 0.00043730778787579895, "loss": 4.8889, "mean_token_accuracy": 0.21928549706935882, "num_tokens": 57266621.0, "step": 27600 }, { "entropy": 5.481981897354126, "epoch": 2.5040820029027575, "grad_norm": 1.2421875, "learning_rate": 0.00043728537769402627, "loss": 4.9095, "mean_token_accuracy": 0.21795809417963027, "num_tokens": 57277282.0, "step": 27605 }, { "entropy": 5.542119979858398, "epoch": 2.5045355587808418, "grad_norm": 1.0703125, "learning_rate": 0.0004372629641561506, "loss": 4.9862, "mean_token_accuracy": 0.21075396090745926, "num_tokens": 57287541.0, "step": 27610 }, { "entropy": 5.5087456703186035, "epoch": 2.504989114658926, "grad_norm": 1.09375, "learning_rate": 0.00043724054726263547, "loss": 4.9292, "mean_token_accuracy": 0.21412270218133928, "num_tokens": 57298158.0, "step": 27615 }, { "entropy": 5.558322334289551, "epoch": 2.5054426705370103, "grad_norm": 1.1640625, "learning_rate": 0.0004372181270139444, "loss": 4.9569, "mean_token_accuracy": 0.2086131066083908, "num_tokens": 57308356.0, "step": 27620 }, { "entropy": 5.528935384750366, "epoch": 2.5058962264150946, "grad_norm": 1.1640625, "learning_rate": 0.00043719570341054127, "loss": 4.8587, "mean_token_accuracy": 0.2186117261648178, "num_tokens": 57317905.0, "step": 27625 }, { "entropy": 5.524879407882691, "epoch": 2.5063497822931784, "grad_norm": 1.2109375, "learning_rate": 0.00043717327645288956, "loss": 4.9581, "mean_token_accuracy": 0.21665917634963988, "num_tokens": 57328277.0, "step": 27630 }, { "entropy": 5.56379246711731, "epoch": 2.5068033381712627, "grad_norm": 1.1484375, "learning_rate": 0.00043715084614145316, "loss": 4.9901, "mean_token_accuracy": 0.20803385972976685, "num_tokens": 57338975.0, "step": 27635 }, { "entropy": 5.518955421447754, "epoch": 2.507256894049347, "grad_norm": 1.1015625, "learning_rate": 0.000437128412476696, "loss": 4.9151, "mean_token_accuracy": 0.21916110217571258, "num_tokens": 57349439.0, "step": 27640 }, { "entropy": 5.530729007720947, "epoch": 2.507710449927431, "grad_norm": 1.203125, "learning_rate": 0.0004371059754590819, "loss": 4.9675, "mean_token_accuracy": 0.20922602862119674, "num_tokens": 57359414.0, "step": 27645 }, { "entropy": 5.573251533508301, "epoch": 2.508164005805515, "grad_norm": 1.28125, "learning_rate": 0.00043708353508907494, "loss": 4.9832, "mean_token_accuracy": 0.2157943442463875, "num_tokens": 57369711.0, "step": 27650 }, { "entropy": 5.512748908996582, "epoch": 2.5086175616835993, "grad_norm": 1.0859375, "learning_rate": 0.0004370610913671392, "loss": 4.8633, "mean_token_accuracy": 0.22621740847826005, "num_tokens": 57380001.0, "step": 27655 }, { "entropy": 5.548326921463013, "epoch": 2.5090711175616836, "grad_norm": 1.203125, "learning_rate": 0.00043703864429373875, "loss": 5.0392, "mean_token_accuracy": 0.20096748769283296, "num_tokens": 57390794.0, "step": 27660 }, { "entropy": 5.525460958480835, "epoch": 2.509524673439768, "grad_norm": 1.0234375, "learning_rate": 0.00043701619386933793, "loss": 4.9615, "mean_token_accuracy": 0.2023957073688507, "num_tokens": 57401975.0, "step": 27665 }, { "entropy": 5.447001123428345, "epoch": 2.509978229317852, "grad_norm": 1.1484375, "learning_rate": 0.00043699374009440085, "loss": 4.8221, "mean_token_accuracy": 0.2262996554374695, "num_tokens": 57411249.0, "step": 27670 }, { "entropy": 5.442929029464722, "epoch": 2.5104317851959363, "grad_norm": 1.1875, "learning_rate": 0.0004369712829693919, "loss": 4.8587, "mean_token_accuracy": 0.22130753546953202, "num_tokens": 57422679.0, "step": 27675 }, { "entropy": 5.503858947753907, "epoch": 2.51088534107402, "grad_norm": 1.1171875, "learning_rate": 0.0004369488224947757, "loss": 4.9302, "mean_token_accuracy": 0.21813174039125444, "num_tokens": 57433265.0, "step": 27680 }, { "entropy": 5.5370386123657225, "epoch": 2.5113388969521044, "grad_norm": 1.0546875, "learning_rate": 0.0004369263586710164, "loss": 4.9511, "mean_token_accuracy": 0.2111544355750084, "num_tokens": 57444095.0, "step": 27685 }, { "entropy": 5.5152997970581055, "epoch": 2.5117924528301887, "grad_norm": 1.25, "learning_rate": 0.0004369038914985789, "loss": 4.903, "mean_token_accuracy": 0.21714168339967727, "num_tokens": 57454059.0, "step": 27690 }, { "entropy": 5.508581829071045, "epoch": 2.512246008708273, "grad_norm": 1.125, "learning_rate": 0.0004368814209779276, "loss": 4.8739, "mean_token_accuracy": 0.21691862493753433, "num_tokens": 57463940.0, "step": 27695 }, { "entropy": 5.464889240264893, "epoch": 2.512699564586357, "grad_norm": 1.0859375, "learning_rate": 0.00043685894710952724, "loss": 4.9357, "mean_token_accuracy": 0.21298775374889373, "num_tokens": 57474731.0, "step": 27700 }, { "entropy": 5.495354223251343, "epoch": 2.513153120464441, "grad_norm": 1.203125, "learning_rate": 0.0004368364698938426, "loss": 4.8644, "mean_token_accuracy": 0.2191845789551735, "num_tokens": 57485096.0, "step": 27705 }, { "entropy": 5.496347284317016, "epoch": 2.5136066763425253, "grad_norm": 1.09375, "learning_rate": 0.0004368139893313385, "loss": 4.9277, "mean_token_accuracy": 0.21534126698970796, "num_tokens": 57496371.0, "step": 27710 }, { "entropy": 5.520041561126709, "epoch": 2.5140602322206096, "grad_norm": 1.3515625, "learning_rate": 0.00043679150542248, "loss": 4.9044, "mean_token_accuracy": 0.21714208275079727, "num_tokens": 57506012.0, "step": 27715 }, { "entropy": 5.515847158432007, "epoch": 2.514513788098694, "grad_norm": 1.234375, "learning_rate": 0.00043676901816773174, "loss": 4.9771, "mean_token_accuracy": 0.20679448992013932, "num_tokens": 57516536.0, "step": 27720 }, { "entropy": 5.480475521087646, "epoch": 2.514967343976778, "grad_norm": 1.0546875, "learning_rate": 0.0004367465275675591, "loss": 4.848, "mean_token_accuracy": 0.2189696326851845, "num_tokens": 57527450.0, "step": 27725 }, { "entropy": 5.533561182022095, "epoch": 2.5154208998548624, "grad_norm": 1.1015625, "learning_rate": 0.00043672403362242704, "loss": 4.9699, "mean_token_accuracy": 0.21798517256975175, "num_tokens": 57538234.0, "step": 27730 }, { "entropy": 5.49214882850647, "epoch": 2.515874455732946, "grad_norm": 1.09375, "learning_rate": 0.00043670153633280066, "loss": 4.8941, "mean_token_accuracy": 0.2198481634259224, "num_tokens": 57547938.0, "step": 27735 }, { "entropy": 5.52827820777893, "epoch": 2.5163280116110305, "grad_norm": 1.046875, "learning_rate": 0.0004366790356991454, "loss": 4.926, "mean_token_accuracy": 0.21719639599323273, "num_tokens": 57560553.0, "step": 27740 }, { "entropy": 5.481798982620239, "epoch": 2.5167815674891147, "grad_norm": 1.1796875, "learning_rate": 0.0004366565317219265, "loss": 4.8893, "mean_token_accuracy": 0.21737712174654006, "num_tokens": 57570670.0, "step": 27745 }, { "entropy": 5.592238998413086, "epoch": 2.5172351233671986, "grad_norm": 0.96875, "learning_rate": 0.00043663402440160924, "loss": 5.0984, "mean_token_accuracy": 0.2019535407423973, "num_tokens": 57582377.0, "step": 27750 }, { "entropy": 5.483578014373779, "epoch": 2.517688679245283, "grad_norm": 1.109375, "learning_rate": 0.0004366115137386592, "loss": 4.8157, "mean_token_accuracy": 0.2220057025551796, "num_tokens": 57592764.0, "step": 27755 }, { "entropy": 5.473769426345825, "epoch": 2.518142235123367, "grad_norm": 1.1640625, "learning_rate": 0.0004365889997335419, "loss": 4.9354, "mean_token_accuracy": 0.2066652238368988, "num_tokens": 57603768.0, "step": 27760 }, { "entropy": 5.475136041641235, "epoch": 2.5185957910014514, "grad_norm": 1.1328125, "learning_rate": 0.00043656648238672285, "loss": 4.9099, "mean_token_accuracy": 0.21326394081115724, "num_tokens": 57614346.0, "step": 27765 }, { "entropy": 5.622374725341797, "epoch": 2.5190493468795356, "grad_norm": 1.109375, "learning_rate": 0.0004365439616986678, "loss": 5.0318, "mean_token_accuracy": 0.2063527747988701, "num_tokens": 57625015.0, "step": 27770 }, { "entropy": 5.543213605880737, "epoch": 2.51950290275762, "grad_norm": 1.1953125, "learning_rate": 0.00043652143766984247, "loss": 4.9906, "mean_token_accuracy": 0.2083511084318161, "num_tokens": 57635476.0, "step": 27775 }, { "entropy": 5.449545574188233, "epoch": 2.519956458635704, "grad_norm": 1.1640625, "learning_rate": 0.00043649891030071264, "loss": 4.8924, "mean_token_accuracy": 0.21324318945407866, "num_tokens": 57645512.0, "step": 27780 }, { "entropy": 5.486173915863037, "epoch": 2.520410014513788, "grad_norm": 1.1328125, "learning_rate": 0.00043647637959174425, "loss": 4.8922, "mean_token_accuracy": 0.21642659604549408, "num_tokens": 57655766.0, "step": 27785 }, { "entropy": 5.546034097671509, "epoch": 2.5208635703918723, "grad_norm": 1.1484375, "learning_rate": 0.00043645384554340315, "loss": 4.8871, "mean_token_accuracy": 0.21995265036821365, "num_tokens": 57667325.0, "step": 27790 }, { "entropy": 5.471993350982666, "epoch": 2.5213171262699565, "grad_norm": 1.140625, "learning_rate": 0.00043643130815615536, "loss": 4.9151, "mean_token_accuracy": 0.20932620018720627, "num_tokens": 57677884.0, "step": 27795 }, { "entropy": 5.523683404922485, "epoch": 2.521770682148041, "grad_norm": 1.171875, "learning_rate": 0.00043640876743046694, "loss": 4.9178, "mean_token_accuracy": 0.2210479885339737, "num_tokens": 57687765.0, "step": 27800 }, { "entropy": 5.517579984664917, "epoch": 2.5222242380261246, "grad_norm": 1.15625, "learning_rate": 0.0004363862233668041, "loss": 4.9036, "mean_token_accuracy": 0.2118662565946579, "num_tokens": 57697777.0, "step": 27805 }, { "entropy": 5.482229995727539, "epoch": 2.522677793904209, "grad_norm": 1.078125, "learning_rate": 0.000436363675965633, "loss": 4.9183, "mean_token_accuracy": 0.21222163438796998, "num_tokens": 57708765.0, "step": 27810 }, { "entropy": 5.537875556945801, "epoch": 2.523131349782293, "grad_norm": 1.109375, "learning_rate": 0.0004363411252274201, "loss": 4.9353, "mean_token_accuracy": 0.21945043951272963, "num_tokens": 57719658.0, "step": 27815 }, { "entropy": 5.5319188117980955, "epoch": 2.5235849056603774, "grad_norm": 1.078125, "learning_rate": 0.00043631857115263153, "loss": 4.9029, "mean_token_accuracy": 0.2217099353671074, "num_tokens": 57730018.0, "step": 27820 }, { "entropy": 5.43439998626709, "epoch": 2.5240384615384617, "grad_norm": 1.109375, "learning_rate": 0.0004362960137417338, "loss": 4.8598, "mean_token_accuracy": 0.2194720461964607, "num_tokens": 57741251.0, "step": 27825 }, { "entropy": 5.484037065505982, "epoch": 2.524492017416546, "grad_norm": 1.0859375, "learning_rate": 0.0004362734529951933, "loss": 4.9483, "mean_token_accuracy": 0.21405988782644272, "num_tokens": 57751020.0, "step": 27830 }, { "entropy": 5.521639633178711, "epoch": 2.5249455732946298, "grad_norm": 1.34375, "learning_rate": 0.00043625088891347685, "loss": 4.8932, "mean_token_accuracy": 0.21852710098028183, "num_tokens": 57760989.0, "step": 27835 }, { "entropy": 5.58126745223999, "epoch": 2.525399129172714, "grad_norm": 1.2109375, "learning_rate": 0.00043622832149705086, "loss": 4.973, "mean_token_accuracy": 0.21619820296764375, "num_tokens": 57770882.0, "step": 27840 }, { "entropy": 5.571942377090454, "epoch": 2.5258526850507983, "grad_norm": 1.0859375, "learning_rate": 0.00043620575074638206, "loss": 4.9857, "mean_token_accuracy": 0.21061291098594664, "num_tokens": 57781812.0, "step": 27845 }, { "entropy": 5.471639490127563, "epoch": 2.5263062409288826, "grad_norm": 1.109375, "learning_rate": 0.00043618317666193734, "loss": 4.8762, "mean_token_accuracy": 0.2247692108154297, "num_tokens": 57792009.0, "step": 27850 }, { "entropy": 5.486639881134034, "epoch": 2.5267597968069664, "grad_norm": 1.078125, "learning_rate": 0.00043616059924418346, "loss": 4.8727, "mean_token_accuracy": 0.2197083905339241, "num_tokens": 57802109.0, "step": 27855 }, { "entropy": 5.5288773536682125, "epoch": 2.5272133526850507, "grad_norm": 1.21875, "learning_rate": 0.0004361380184935872, "loss": 4.9418, "mean_token_accuracy": 0.2158348485827446, "num_tokens": 57812374.0, "step": 27860 }, { "entropy": 5.480235528945923, "epoch": 2.527666908563135, "grad_norm": 1.125, "learning_rate": 0.0004361154344106158, "loss": 4.8488, "mean_token_accuracy": 0.21825022101402283, "num_tokens": 57822936.0, "step": 27865 }, { "entropy": 5.5933677673339846, "epoch": 2.528120464441219, "grad_norm": 1.1328125, "learning_rate": 0.00043609284699573604, "loss": 5.0821, "mean_token_accuracy": 0.2073484629392624, "num_tokens": 57832693.0, "step": 27870 }, { "entropy": 5.578198051452636, "epoch": 2.5285740203193035, "grad_norm": 1.15625, "learning_rate": 0.00043607025624941523, "loss": 4.9538, "mean_token_accuracy": 0.21290663331747056, "num_tokens": 57843161.0, "step": 27875 }, { "entropy": 5.5319836139678955, "epoch": 2.5290275761973877, "grad_norm": 1.234375, "learning_rate": 0.0004360476621721204, "loss": 4.8799, "mean_token_accuracy": 0.2210705816745758, "num_tokens": 57853027.0, "step": 27880 }, { "entropy": 5.534374761581421, "epoch": 2.5294811320754715, "grad_norm": 1.1171875, "learning_rate": 0.0004360250647643189, "loss": 4.92, "mean_token_accuracy": 0.2234542638063431, "num_tokens": 57862821.0, "step": 27885 }, { "entropy": 5.509299898147583, "epoch": 2.529934687953556, "grad_norm": 1.15625, "learning_rate": 0.00043600246402647805, "loss": 4.8824, "mean_token_accuracy": 0.2223489135503769, "num_tokens": 57874065.0, "step": 27890 }, { "entropy": 5.509321451187134, "epoch": 2.53038824383164, "grad_norm": 1.1015625, "learning_rate": 0.0004359798599590652, "loss": 4.9543, "mean_token_accuracy": 0.20906148701906205, "num_tokens": 57885190.0, "step": 27895 }, { "entropy": 5.490346431732178, "epoch": 2.5308417997097243, "grad_norm": 1.1796875, "learning_rate": 0.00043595725256254786, "loss": 4.8881, "mean_token_accuracy": 0.2137491524219513, "num_tokens": 57894234.0, "step": 27900 }, { "entropy": 5.556329917907715, "epoch": 2.531295355587808, "grad_norm": 1.09375, "learning_rate": 0.0004359346418373935, "loss": 5.0586, "mean_token_accuracy": 0.20328215807676314, "num_tokens": 57905401.0, "step": 27905 }, { "entropy": 5.490631580352783, "epoch": 2.5317489114658924, "grad_norm": 1.1171875, "learning_rate": 0.00043591202778406975, "loss": 4.8875, "mean_token_accuracy": 0.21316498816013335, "num_tokens": 57916097.0, "step": 27910 }, { "entropy": 5.432488012313843, "epoch": 2.5322024673439767, "grad_norm": 1.09375, "learning_rate": 0.0004358894104030442, "loss": 4.8073, "mean_token_accuracy": 0.21938321590423585, "num_tokens": 57926871.0, "step": 27915 }, { "entropy": 5.482897758483887, "epoch": 2.532656023222061, "grad_norm": 1.171875, "learning_rate": 0.00043586678969478464, "loss": 4.8584, "mean_token_accuracy": 0.2240841031074524, "num_tokens": 57937344.0, "step": 27920 }, { "entropy": 5.560228490829468, "epoch": 2.5331095791001452, "grad_norm": 1.2109375, "learning_rate": 0.000435844165659759, "loss": 4.9406, "mean_token_accuracy": 0.21373773068189622, "num_tokens": 57947633.0, "step": 27925 }, { "entropy": 5.477146863937378, "epoch": 2.5335631349782295, "grad_norm": 1.1015625, "learning_rate": 0.00043582153829843493, "loss": 4.8545, "mean_token_accuracy": 0.2168970748782158, "num_tokens": 57957948.0, "step": 27930 }, { "entropy": 5.527875328063965, "epoch": 2.5340166908563138, "grad_norm": 1.125, "learning_rate": 0.0004357989076112805, "loss": 4.8931, "mean_token_accuracy": 0.21876860707998275, "num_tokens": 57967719.0, "step": 27935 }, { "entropy": 5.519929981231689, "epoch": 2.5344702467343976, "grad_norm": 1.1640625, "learning_rate": 0.0004357762735987637, "loss": 4.9713, "mean_token_accuracy": 0.20958924293518066, "num_tokens": 57978218.0, "step": 27940 }, { "entropy": 5.518215227127075, "epoch": 2.534923802612482, "grad_norm": 1.15625, "learning_rate": 0.0004357536362613525, "loss": 4.8456, "mean_token_accuracy": 0.21913884729146957, "num_tokens": 57987860.0, "step": 27945 }, { "entropy": 5.4863457679748535, "epoch": 2.535377358490566, "grad_norm": 1.28125, "learning_rate": 0.00043573099559951516, "loss": 4.9124, "mean_token_accuracy": 0.21714988797903062, "num_tokens": 57997872.0, "step": 27950 }, { "entropy": 5.555253553390503, "epoch": 2.5358309143686504, "grad_norm": 1.15625, "learning_rate": 0.0004357083516137199, "loss": 4.994, "mean_token_accuracy": 0.2131021276116371, "num_tokens": 58007771.0, "step": 27955 }, { "entropy": 5.534782934188843, "epoch": 2.536284470246734, "grad_norm": 1.1328125, "learning_rate": 0.000435685704304435, "loss": 4.9137, "mean_token_accuracy": 0.21169153451919556, "num_tokens": 58018972.0, "step": 27960 }, { "entropy": 5.490043210983276, "epoch": 2.5367380261248185, "grad_norm": 1.15625, "learning_rate": 0.00043566305367212884, "loss": 4.8119, "mean_token_accuracy": 0.2191553846001625, "num_tokens": 58028581.0, "step": 27965 }, { "entropy": 5.490304803848266, "epoch": 2.5371915820029027, "grad_norm": 1.1328125, "learning_rate": 0.00043564039971726964, "loss": 4.9617, "mean_token_accuracy": 0.2148470625281334, "num_tokens": 58038877.0, "step": 27970 }, { "entropy": 5.476082897186279, "epoch": 2.537645137880987, "grad_norm": 1.1015625, "learning_rate": 0.00043561774244032614, "loss": 4.8941, "mean_token_accuracy": 0.220500348508358, "num_tokens": 58048777.0, "step": 27975 }, { "entropy": 5.540262508392334, "epoch": 2.5380986937590713, "grad_norm": 1.03125, "learning_rate": 0.00043559508184176675, "loss": 4.981, "mean_token_accuracy": 0.21174225062131882, "num_tokens": 58060270.0, "step": 27980 }, { "entropy": 5.496583461761475, "epoch": 2.5385522496371555, "grad_norm": 1.15625, "learning_rate": 0.00043557241792206014, "loss": 4.9152, "mean_token_accuracy": 0.21867234706878663, "num_tokens": 58070838.0, "step": 27985 }, { "entropy": 5.565356206893921, "epoch": 2.5390058055152394, "grad_norm": 1.109375, "learning_rate": 0.00043554975068167505, "loss": 5.0037, "mean_token_accuracy": 0.21263106614351274, "num_tokens": 58079933.0, "step": 27990 }, { "entropy": 5.501317167282105, "epoch": 2.5394593613933236, "grad_norm": 1.09375, "learning_rate": 0.0004355270801210802, "loss": 4.9319, "mean_token_accuracy": 0.21623146831989287, "num_tokens": 58090673.0, "step": 27995 }, { "entropy": 5.448718786239624, "epoch": 2.539912917271408, "grad_norm": 1.2109375, "learning_rate": 0.0004355044062407444, "loss": 4.7646, "mean_token_accuracy": 0.23167373687028886, "num_tokens": 58100172.0, "step": 28000 }, { "entropy": 5.487764596939087, "epoch": 2.540366473149492, "grad_norm": 1.1875, "learning_rate": 0.0004354817290411366, "loss": 4.9239, "mean_token_accuracy": 0.21400413513183594, "num_tokens": 58108965.0, "step": 28005 }, { "entropy": 5.495748853683471, "epoch": 2.540820029027576, "grad_norm": 1.15625, "learning_rate": 0.00043545904852272573, "loss": 4.8271, "mean_token_accuracy": 0.22209217250347138, "num_tokens": 58120094.0, "step": 28010 }, { "entropy": 5.5234373092651365, "epoch": 2.5412735849056602, "grad_norm": 1.0859375, "learning_rate": 0.00043543636468598083, "loss": 4.9642, "mean_token_accuracy": 0.20915620774030685, "num_tokens": 58131525.0, "step": 28015 }, { "entropy": 5.510516691207886, "epoch": 2.5417271407837445, "grad_norm": 1.1640625, "learning_rate": 0.00043541367753137107, "loss": 4.8726, "mean_token_accuracy": 0.21721156388521196, "num_tokens": 58141986.0, "step": 28020 }, { "entropy": 5.5301285743713375, "epoch": 2.5421806966618288, "grad_norm": 1.078125, "learning_rate": 0.0004353909870593656, "loss": 4.9401, "mean_token_accuracy": 0.21358744651079178, "num_tokens": 58154122.0, "step": 28025 }, { "entropy": 5.53275842666626, "epoch": 2.542634252539913, "grad_norm": 1.2265625, "learning_rate": 0.0004353682932704336, "loss": 4.8572, "mean_token_accuracy": 0.23040631413459778, "num_tokens": 58164148.0, "step": 28030 }, { "entropy": 5.479786968231201, "epoch": 2.5430878084179973, "grad_norm": 1.15625, "learning_rate": 0.0004353455961650444, "loss": 4.8578, "mean_token_accuracy": 0.21293506771326065, "num_tokens": 58173836.0, "step": 28035 }, { "entropy": 5.471020174026489, "epoch": 2.543541364296081, "grad_norm": 1.0859375, "learning_rate": 0.0004353228957436675, "loss": 4.9046, "mean_token_accuracy": 0.21567854583263396, "num_tokens": 58184598.0, "step": 28040 }, { "entropy": 5.457410430908203, "epoch": 2.5439949201741654, "grad_norm": 1.09375, "learning_rate": 0.00043530019200677215, "loss": 4.8787, "mean_token_accuracy": 0.21554286479949952, "num_tokens": 58194820.0, "step": 28045 }, { "entropy": 5.505194187164307, "epoch": 2.5444484760522497, "grad_norm": 1.0703125, "learning_rate": 0.00043527748495482806, "loss": 4.9824, "mean_token_accuracy": 0.2107910394668579, "num_tokens": 58206589.0, "step": 28050 }, { "entropy": 5.587746953964233, "epoch": 2.544902031930334, "grad_norm": 1.109375, "learning_rate": 0.00043525477458830473, "loss": 4.928, "mean_token_accuracy": 0.21810096651315689, "num_tokens": 58216750.0, "step": 28055 }, { "entropy": 5.465854978561401, "epoch": 2.5453555878084178, "grad_norm": 1.03125, "learning_rate": 0.0004352320609076718, "loss": 4.8972, "mean_token_accuracy": 0.21865989714860917, "num_tokens": 58228496.0, "step": 28060 }, { "entropy": 5.479026365280151, "epoch": 2.545809143686502, "grad_norm": 1.1171875, "learning_rate": 0.00043520934391339894, "loss": 4.8729, "mean_token_accuracy": 0.21455207616090774, "num_tokens": 58237844.0, "step": 28065 }, { "entropy": 5.464645624160767, "epoch": 2.5462626995645863, "grad_norm": 1.1171875, "learning_rate": 0.0004351866236059561, "loss": 4.8585, "mean_token_accuracy": 0.21462422609329224, "num_tokens": 58248522.0, "step": 28070 }, { "entropy": 5.499445104598999, "epoch": 2.5467162554426706, "grad_norm": 1.2421875, "learning_rate": 0.00043516389998581305, "loss": 4.8719, "mean_token_accuracy": 0.21963100582361222, "num_tokens": 58258492.0, "step": 28075 }, { "entropy": 5.4501711368560795, "epoch": 2.547169811320755, "grad_norm": 1.125, "learning_rate": 0.0004351411730534398, "loss": 4.8933, "mean_token_accuracy": 0.21421114653348922, "num_tokens": 58268683.0, "step": 28080 }, { "entropy": 5.5106712818145756, "epoch": 2.547623367198839, "grad_norm": 1.1640625, "learning_rate": 0.0004351184428093062, "loss": 4.957, "mean_token_accuracy": 0.20706234276294708, "num_tokens": 58279479.0, "step": 28085 }, { "entropy": 5.5375994682312015, "epoch": 2.5480769230769234, "grad_norm": 1.2578125, "learning_rate": 0.0004350957092538825, "loss": 4.985, "mean_token_accuracy": 0.21224521547555925, "num_tokens": 58290751.0, "step": 28090 }, { "entropy": 5.559394073486328, "epoch": 2.548530478955007, "grad_norm": 1.0625, "learning_rate": 0.0004350729723876386, "loss": 4.9948, "mean_token_accuracy": 0.20879129320383072, "num_tokens": 58302163.0, "step": 28095 }, { "entropy": 5.499516201019287, "epoch": 2.5489840348330914, "grad_norm": 1.15625, "learning_rate": 0.00043505023221104497, "loss": 4.9194, "mean_token_accuracy": 0.2061060681939125, "num_tokens": 58311488.0, "step": 28100 }, { "entropy": 5.487242889404297, "epoch": 2.5494375907111757, "grad_norm": 1.2109375, "learning_rate": 0.00043502748872457166, "loss": 4.8962, "mean_token_accuracy": 0.21689498722553252, "num_tokens": 58321599.0, "step": 28105 }, { "entropy": 5.509772253036499, "epoch": 2.5498911465892595, "grad_norm": 1.3828125, "learning_rate": 0.0004350047419286892, "loss": 4.8838, "mean_token_accuracy": 0.21568981409072877, "num_tokens": 58330696.0, "step": 28110 }, { "entropy": 5.4617715835571286, "epoch": 2.550344702467344, "grad_norm": 1.09375, "learning_rate": 0.00043498199182386775, "loss": 4.9165, "mean_token_accuracy": 0.2220580592751503, "num_tokens": 58341793.0, "step": 28115 }, { "entropy": 5.507754516601563, "epoch": 2.550798258345428, "grad_norm": 1.2421875, "learning_rate": 0.00043495923841057807, "loss": 4.9981, "mean_token_accuracy": 0.21068783104419708, "num_tokens": 58352260.0, "step": 28120 }, { "entropy": 5.614972496032715, "epoch": 2.5512518142235123, "grad_norm": 1.109375, "learning_rate": 0.00043493648168929053, "loss": 5.0498, "mean_token_accuracy": 0.2003721445798874, "num_tokens": 58363052.0, "step": 28125 }, { "entropy": 5.57716965675354, "epoch": 2.5517053701015966, "grad_norm": 1.1484375, "learning_rate": 0.0004349137216604758, "loss": 4.9365, "mean_token_accuracy": 0.21506949365139008, "num_tokens": 58374039.0, "step": 28130 }, { "entropy": 5.4511034965515135, "epoch": 2.552158925979681, "grad_norm": 1.1640625, "learning_rate": 0.0004348909583246045, "loss": 4.7831, "mean_token_accuracy": 0.22838286757469178, "num_tokens": 58383441.0, "step": 28135 }, { "entropy": 5.450941038131714, "epoch": 2.552612481857765, "grad_norm": 1.1171875, "learning_rate": 0.0004348681916821475, "loss": 4.898, "mean_token_accuracy": 0.21414742171764373, "num_tokens": 58394164.0, "step": 28140 }, { "entropy": 5.461052894592285, "epoch": 2.553066037735849, "grad_norm": 1.0859375, "learning_rate": 0.0004348454217335755, "loss": 4.9184, "mean_token_accuracy": 0.2184153378009796, "num_tokens": 58404610.0, "step": 28145 }, { "entropy": 5.495025110244751, "epoch": 2.553519593613933, "grad_norm": 1.125, "learning_rate": 0.00043482264847935953, "loss": 4.8591, "mean_token_accuracy": 0.21553471088409423, "num_tokens": 58414512.0, "step": 28150 }, { "entropy": 5.539588260650635, "epoch": 2.5539731494920175, "grad_norm": 1.21875, "learning_rate": 0.00043479987191997045, "loss": 5.0046, "mean_token_accuracy": 0.21369443237781524, "num_tokens": 58424669.0, "step": 28155 }, { "entropy": 5.4342506408691404, "epoch": 2.5544267053701017, "grad_norm": 1.078125, "learning_rate": 0.0004347770920558792, "loss": 4.8092, "mean_token_accuracy": 0.2217569351196289, "num_tokens": 58435348.0, "step": 28160 }, { "entropy": 5.531671857833862, "epoch": 2.5548802612481856, "grad_norm": 1.125, "learning_rate": 0.00043475430888755706, "loss": 4.8979, "mean_token_accuracy": 0.21354020833969117, "num_tokens": 58445534.0, "step": 28165 }, { "entropy": 5.513222885131836, "epoch": 2.55533381712627, "grad_norm": 1.0703125, "learning_rate": 0.0004347315224154751, "loss": 4.9409, "mean_token_accuracy": 0.2151782065629959, "num_tokens": 58456718.0, "step": 28170 }, { "entropy": 5.596724510192871, "epoch": 2.555787373004354, "grad_norm": 1.140625, "learning_rate": 0.0004347087326401045, "loss": 4.9661, "mean_token_accuracy": 0.2181641563773155, "num_tokens": 58467176.0, "step": 28175 }, { "entropy": 5.493879985809326, "epoch": 2.5562409288824384, "grad_norm": 1.1484375, "learning_rate": 0.00043468593956191663, "loss": 4.8567, "mean_token_accuracy": 0.21785433143377303, "num_tokens": 58477642.0, "step": 28180 }, { "entropy": 5.4853198528289795, "epoch": 2.5566944847605226, "grad_norm": 1.140625, "learning_rate": 0.0004346631431813829, "loss": 4.9142, "mean_token_accuracy": 0.20857097059488297, "num_tokens": 58489055.0, "step": 28185 }, { "entropy": 5.551945543289184, "epoch": 2.557148040638607, "grad_norm": 1.0234375, "learning_rate": 0.0004346403434989746, "loss": 4.9309, "mean_token_accuracy": 0.21246396750211716, "num_tokens": 58499062.0, "step": 28190 }, { "entropy": 5.521152067184448, "epoch": 2.5576015965166907, "grad_norm": 1.1328125, "learning_rate": 0.0004346175405151633, "loss": 4.9346, "mean_token_accuracy": 0.20794905126094818, "num_tokens": 58509154.0, "step": 28195 }, { "entropy": 5.479930782318116, "epoch": 2.558055152394775, "grad_norm": 1.078125, "learning_rate": 0.0004345947342304207, "loss": 4.832, "mean_token_accuracy": 0.22104021906852722, "num_tokens": 58520056.0, "step": 28200 }, { "entropy": 5.508643674850464, "epoch": 2.5585087082728593, "grad_norm": 1.1796875, "learning_rate": 0.00043457192464521827, "loss": 4.9144, "mean_token_accuracy": 0.21632963865995408, "num_tokens": 58529934.0, "step": 28205 }, { "entropy": 5.437611389160156, "epoch": 2.5589622641509435, "grad_norm": 1.109375, "learning_rate": 0.0004345491117600278, "loss": 4.8315, "mean_token_accuracy": 0.21674349904060364, "num_tokens": 58540013.0, "step": 28210 }, { "entropy": 5.574136686325073, "epoch": 2.5594158200290273, "grad_norm": 1.2265625, "learning_rate": 0.00043452629557532097, "loss": 4.9282, "mean_token_accuracy": 0.21669500917196274, "num_tokens": 58550282.0, "step": 28215 }, { "entropy": 5.574855661392212, "epoch": 2.5598693759071116, "grad_norm": 1.1484375, "learning_rate": 0.00043450347609156974, "loss": 4.9497, "mean_token_accuracy": 0.20531440675258636, "num_tokens": 58560490.0, "step": 28220 }, { "entropy": 5.465995025634766, "epoch": 2.560322931785196, "grad_norm": 1.203125, "learning_rate": 0.00043448065330924595, "loss": 4.9178, "mean_token_accuracy": 0.213985837996006, "num_tokens": 58570371.0, "step": 28225 }, { "entropy": 5.53932752609253, "epoch": 2.56077648766328, "grad_norm": 1.1171875, "learning_rate": 0.0004344578272288216, "loss": 4.8787, "mean_token_accuracy": 0.2195175141096115, "num_tokens": 58580701.0, "step": 28230 }, { "entropy": 5.580049800872803, "epoch": 2.5612300435413644, "grad_norm": 1.2421875, "learning_rate": 0.00043443499785076885, "loss": 4.9249, "mean_token_accuracy": 0.21302091777324678, "num_tokens": 58590903.0, "step": 28235 }, { "entropy": 5.543482112884521, "epoch": 2.5616835994194487, "grad_norm": 1.1015625, "learning_rate": 0.0004344121651755596, "loss": 4.8993, "mean_token_accuracy": 0.21193549782037735, "num_tokens": 58600924.0, "step": 28240 }, { "entropy": 5.542697143554688, "epoch": 2.5621371552975325, "grad_norm": 1.03125, "learning_rate": 0.00043438932920366615, "loss": 4.9925, "mean_token_accuracy": 0.21586293131113052, "num_tokens": 58611369.0, "step": 28245 }, { "entropy": 5.568830966949463, "epoch": 2.5625907111756168, "grad_norm": 1.1171875, "learning_rate": 0.0004343664899355608, "loss": 4.9847, "mean_token_accuracy": 0.21262579113245011, "num_tokens": 58622725.0, "step": 28250 }, { "entropy": 5.5199089527130125, "epoch": 2.563044267053701, "grad_norm": 1.140625, "learning_rate": 0.00043434364737171587, "loss": 4.9003, "mean_token_accuracy": 0.21693652421236037, "num_tokens": 58634157.0, "step": 28255 }, { "entropy": 5.5146430969238285, "epoch": 2.5634978229317853, "grad_norm": 1.265625, "learning_rate": 0.00043432080151260366, "loss": 4.8353, "mean_token_accuracy": 0.21184777468442917, "num_tokens": 58643384.0, "step": 28260 }, { "entropy": 5.504140567779541, "epoch": 2.563951378809869, "grad_norm": 1.125, "learning_rate": 0.00043429795235869667, "loss": 4.8782, "mean_token_accuracy": 0.21168771833181382, "num_tokens": 58653748.0, "step": 28265 }, { "entropy": 5.506859397888183, "epoch": 2.5644049346879534, "grad_norm": 1.1484375, "learning_rate": 0.00043427509991046746, "loss": 4.9218, "mean_token_accuracy": 0.20965004116296768, "num_tokens": 58664619.0, "step": 28270 }, { "entropy": 5.469032430648804, "epoch": 2.5648584905660377, "grad_norm": 1.125, "learning_rate": 0.00043425224416838857, "loss": 4.8366, "mean_token_accuracy": 0.22153815478086472, "num_tokens": 58674506.0, "step": 28275 }, { "entropy": 5.53009443283081, "epoch": 2.565312046444122, "grad_norm": 1.0859375, "learning_rate": 0.0004342293851329327, "loss": 4.9684, "mean_token_accuracy": 0.21152455657720565, "num_tokens": 58686252.0, "step": 28280 }, { "entropy": 5.523956346511841, "epoch": 2.565765602322206, "grad_norm": 1.140625, "learning_rate": 0.00043420652280457255, "loss": 4.905, "mean_token_accuracy": 0.21134098321199418, "num_tokens": 58696477.0, "step": 28285 }, { "entropy": 5.4551633358001705, "epoch": 2.5662191582002905, "grad_norm": 1.1875, "learning_rate": 0.00043418365718378096, "loss": 4.7977, "mean_token_accuracy": 0.22520421743392943, "num_tokens": 58706664.0, "step": 28290 }, { "entropy": 5.430073881149292, "epoch": 2.5666727140783747, "grad_norm": 1.21875, "learning_rate": 0.0004341607882710307, "loss": 4.8879, "mean_token_accuracy": 0.21757084578275682, "num_tokens": 58716950.0, "step": 28295 }, { "entropy": 5.501533651351929, "epoch": 2.5671262699564585, "grad_norm": 1.15625, "learning_rate": 0.0004341379160667949, "loss": 4.9036, "mean_token_accuracy": 0.21849264800548554, "num_tokens": 58727723.0, "step": 28300 }, { "entropy": 5.520059823989868, "epoch": 2.567579825834543, "grad_norm": 1.1953125, "learning_rate": 0.0004341150405715464, "loss": 4.9848, "mean_token_accuracy": 0.20906808823347092, "num_tokens": 58737956.0, "step": 28305 }, { "entropy": 5.521510410308838, "epoch": 2.568033381712627, "grad_norm": 1.109375, "learning_rate": 0.00043409216178575826, "loss": 4.843, "mean_token_accuracy": 0.22448870837688445, "num_tokens": 58748476.0, "step": 28310 }, { "entropy": 5.542687273025512, "epoch": 2.5684869375907113, "grad_norm": 1.1484375, "learning_rate": 0.0004340692797099037, "loss": 4.9448, "mean_token_accuracy": 0.2177031382918358, "num_tokens": 58759604.0, "step": 28315 }, { "entropy": 5.513464832305909, "epoch": 2.568940493468795, "grad_norm": 1.1953125, "learning_rate": 0.0004340463943444559, "loss": 4.89, "mean_token_accuracy": 0.21834378838539123, "num_tokens": 58769781.0, "step": 28320 }, { "entropy": 5.491867876052856, "epoch": 2.5693940493468794, "grad_norm": 1.2421875, "learning_rate": 0.0004340235056898882, "loss": 4.9115, "mean_token_accuracy": 0.2135869473218918, "num_tokens": 58779384.0, "step": 28325 }, { "entropy": 5.597129678726196, "epoch": 2.5698476052249637, "grad_norm": 1.140625, "learning_rate": 0.00043400061374667374, "loss": 4.9875, "mean_token_accuracy": 0.20939935892820358, "num_tokens": 58791953.0, "step": 28330 }, { "entropy": 5.466710376739502, "epoch": 2.570301161103048, "grad_norm": 1.3984375, "learning_rate": 0.0004339777185152862, "loss": 4.8825, "mean_token_accuracy": 0.22059821784496308, "num_tokens": 58802415.0, "step": 28335 }, { "entropy": 5.564668750762939, "epoch": 2.5707547169811322, "grad_norm": 1.1796875, "learning_rate": 0.0004339548199961989, "loss": 4.9192, "mean_token_accuracy": 0.21577564179897307, "num_tokens": 58812582.0, "step": 28340 }, { "entropy": 5.516291713714599, "epoch": 2.5712082728592165, "grad_norm": 1.21875, "learning_rate": 0.00043393191818988543, "loss": 4.9511, "mean_token_accuracy": 0.21318424195051194, "num_tokens": 58822987.0, "step": 28345 }, { "entropy": 5.498049926757813, "epoch": 2.5716618287373003, "grad_norm": 1.25, "learning_rate": 0.0004339090130968193, "loss": 4.8697, "mean_token_accuracy": 0.2186885729432106, "num_tokens": 58832651.0, "step": 28350 }, { "entropy": 5.527301597595215, "epoch": 2.5721153846153846, "grad_norm": 1.1015625, "learning_rate": 0.0004338861047174743, "loss": 4.928, "mean_token_accuracy": 0.21318465918302537, "num_tokens": 58842493.0, "step": 28355 }, { "entropy": 5.474476671218872, "epoch": 2.572568940493469, "grad_norm": 1.1640625, "learning_rate": 0.0004338631930523242, "loss": 4.8305, "mean_token_accuracy": 0.22572716027498246, "num_tokens": 58852428.0, "step": 28360 }, { "entropy": 5.450385618209839, "epoch": 2.573022496371553, "grad_norm": 1.203125, "learning_rate": 0.0004338402781018429, "loss": 4.8373, "mean_token_accuracy": 0.22232268899679183, "num_tokens": 58863234.0, "step": 28365 }, { "entropy": 5.455707788467407, "epoch": 2.573476052249637, "grad_norm": 1.21875, "learning_rate": 0.000433817359866504, "loss": 4.8979, "mean_token_accuracy": 0.21828245669603347, "num_tokens": 58872632.0, "step": 28370 }, { "entropy": 5.614319562911987, "epoch": 2.573929608127721, "grad_norm": 1.1171875, "learning_rate": 0.0004337944383467817, "loss": 5.0751, "mean_token_accuracy": 0.20388540923595427, "num_tokens": 58882774.0, "step": 28375 }, { "entropy": 5.455606698989868, "epoch": 2.5743831640058055, "grad_norm": 1.1640625, "learning_rate": 0.00043377151354314996, "loss": 4.849, "mean_token_accuracy": 0.22130952775478363, "num_tokens": 58892380.0, "step": 28380 }, { "entropy": 5.553823232650757, "epoch": 2.5748367198838897, "grad_norm": 1.1953125, "learning_rate": 0.0004337485854560829, "loss": 4.9255, "mean_token_accuracy": 0.21346257627010345, "num_tokens": 58902659.0, "step": 28385 }, { "entropy": 5.475580501556396, "epoch": 2.575290275761974, "grad_norm": 1.125, "learning_rate": 0.0004337256540860545, "loss": 4.8858, "mean_token_accuracy": 0.2171442523598671, "num_tokens": 58913979.0, "step": 28390 }, { "entropy": 5.527932119369507, "epoch": 2.5757438316400583, "grad_norm": 1.1875, "learning_rate": 0.0004337027194335393, "loss": 4.9533, "mean_token_accuracy": 0.22058646380901337, "num_tokens": 58924481.0, "step": 28395 }, { "entropy": 5.511540269851684, "epoch": 2.576197387518142, "grad_norm": 1.0390625, "learning_rate": 0.00043367978149901125, "loss": 4.9423, "mean_token_accuracy": 0.20822691172361374, "num_tokens": 58936287.0, "step": 28400 }, { "entropy": 5.56310338973999, "epoch": 2.5766509433962264, "grad_norm": 1.203125, "learning_rate": 0.00043365684028294493, "loss": 4.9421, "mean_token_accuracy": 0.21415733844041823, "num_tokens": 58946070.0, "step": 28405 }, { "entropy": 5.59272027015686, "epoch": 2.5771044992743106, "grad_norm": 1.2265625, "learning_rate": 0.00043363389578581483, "loss": 5.0031, "mean_token_accuracy": 0.2040593296289444, "num_tokens": 58956083.0, "step": 28410 }, { "entropy": 5.539585447311401, "epoch": 2.577558055152395, "grad_norm": 1.1328125, "learning_rate": 0.0004336109480080953, "loss": 4.9119, "mean_token_accuracy": 0.2091962590813637, "num_tokens": 58967557.0, "step": 28415 }, { "entropy": 5.497257471084595, "epoch": 2.5780116110304787, "grad_norm": 1.1796875, "learning_rate": 0.0004335879969502608, "loss": 4.8803, "mean_token_accuracy": 0.21549337208271027, "num_tokens": 58977509.0, "step": 28420 }, { "entropy": 5.416629695892334, "epoch": 2.578465166908563, "grad_norm": 1.1875, "learning_rate": 0.00043356504261278625, "loss": 4.7521, "mean_token_accuracy": 0.23429533541202546, "num_tokens": 58987498.0, "step": 28425 }, { "entropy": 5.561904621124268, "epoch": 2.5789187227866472, "grad_norm": 1.390625, "learning_rate": 0.0004335420849961462, "loss": 5.0268, "mean_token_accuracy": 0.20248255729675294, "num_tokens": 58998503.0, "step": 28430 }, { "entropy": 5.493903875350952, "epoch": 2.5793722786647315, "grad_norm": 1.203125, "learning_rate": 0.0004335191241008154, "loss": 4.9091, "mean_token_accuracy": 0.2124171495437622, "num_tokens": 59007384.0, "step": 28435 }, { "entropy": 5.5975525856018065, "epoch": 2.5798258345428158, "grad_norm": 1.0859375, "learning_rate": 0.0004334961599272687, "loss": 4.9952, "mean_token_accuracy": 0.21256424188613893, "num_tokens": 59017739.0, "step": 28440 }, { "entropy": 5.573173475265503, "epoch": 2.5802793904209, "grad_norm": 1.2734375, "learning_rate": 0.0004334731924759811, "loss": 4.9247, "mean_token_accuracy": 0.21728047877550125, "num_tokens": 59028439.0, "step": 28445 }, { "entropy": 5.498218822479248, "epoch": 2.5807329462989843, "grad_norm": 1.21875, "learning_rate": 0.0004334502217474274, "loss": 4.8891, "mean_token_accuracy": 0.21522742360830308, "num_tokens": 59039250.0, "step": 28450 }, { "entropy": 5.546133613586425, "epoch": 2.581186502177068, "grad_norm": 1.09375, "learning_rate": 0.00043342724774208277, "loss": 5.0014, "mean_token_accuracy": 0.216753788292408, "num_tokens": 59049375.0, "step": 28455 }, { "entropy": 5.590890216827392, "epoch": 2.5816400580551524, "grad_norm": 1.1328125, "learning_rate": 0.00043340427046042237, "loss": 5.007, "mean_token_accuracy": 0.21226588040590286, "num_tokens": 59059873.0, "step": 28460 }, { "entropy": 5.528668165206909, "epoch": 2.5820936139332367, "grad_norm": 1.203125, "learning_rate": 0.0004333812899029212, "loss": 4.8982, "mean_token_accuracy": 0.21904878318309784, "num_tokens": 59069288.0, "step": 28465 }, { "entropy": 5.511293172836304, "epoch": 2.5825471698113205, "grad_norm": 1.1796875, "learning_rate": 0.00043335830607005456, "loss": 4.9338, "mean_token_accuracy": 0.21105093210935594, "num_tokens": 59079339.0, "step": 28470 }, { "entropy": 5.527543449401856, "epoch": 2.5830007256894048, "grad_norm": 1.125, "learning_rate": 0.0004333353189622979, "loss": 4.9231, "mean_token_accuracy": 0.2143719896674156, "num_tokens": 59089883.0, "step": 28475 }, { "entropy": 5.524476003646851, "epoch": 2.583454281567489, "grad_norm": 2.75, "learning_rate": 0.0004333123285801264, "loss": 4.9964, "mean_token_accuracy": 0.21947799623012543, "num_tokens": 59100532.0, "step": 28480 }, { "entropy": 5.518876600265503, "epoch": 2.5839078374455733, "grad_norm": 1.2109375, "learning_rate": 0.0004332893349240156, "loss": 4.9174, "mean_token_accuracy": 0.21807062029838561, "num_tokens": 59111295.0, "step": 28485 }, { "entropy": 5.551098585128784, "epoch": 2.5843613933236576, "grad_norm": 1.1796875, "learning_rate": 0.0004332663379944411, "loss": 4.9441, "mean_token_accuracy": 0.21073273718357086, "num_tokens": 59120808.0, "step": 28490 }, { "entropy": 5.574889707565307, "epoch": 2.584814949201742, "grad_norm": 1.28125, "learning_rate": 0.00043324333779187844, "loss": 4.9826, "mean_token_accuracy": 0.21958013474941254, "num_tokens": 59131438.0, "step": 28495 }, { "entropy": 5.459694766998291, "epoch": 2.585268505079826, "grad_norm": 1.2734375, "learning_rate": 0.00043322033431680314, "loss": 4.9188, "mean_token_accuracy": 0.22098694890737533, "num_tokens": 59141701.0, "step": 28500 }, { "entropy": 5.474941873550415, "epoch": 2.58572206095791, "grad_norm": 1.1875, "learning_rate": 0.000433197327569691, "loss": 4.8847, "mean_token_accuracy": 0.2176327422261238, "num_tokens": 59152184.0, "step": 28505 }, { "entropy": 5.511813402175903, "epoch": 2.586175616835994, "grad_norm": 1.15625, "learning_rate": 0.00043317431755101785, "loss": 4.8497, "mean_token_accuracy": 0.22375211864709854, "num_tokens": 59162177.0, "step": 28510 }, { "entropy": 5.584166860580444, "epoch": 2.5866291727140784, "grad_norm": 1.171875, "learning_rate": 0.0004331513042612594, "loss": 5.0085, "mean_token_accuracy": 0.21243423968553543, "num_tokens": 59171964.0, "step": 28515 }, { "entropy": 5.511908102035522, "epoch": 2.5870827285921627, "grad_norm": 1.234375, "learning_rate": 0.0004331282877008918, "loss": 4.8976, "mean_token_accuracy": 0.22004627734422683, "num_tokens": 59182224.0, "step": 28520 }, { "entropy": 5.521733045578003, "epoch": 2.5875362844702465, "grad_norm": 1.078125, "learning_rate": 0.0004331052678703909, "loss": 4.913, "mean_token_accuracy": 0.21449595540761948, "num_tokens": 59191912.0, "step": 28525 }, { "entropy": 5.507656049728394, "epoch": 2.587989840348331, "grad_norm": 1.234375, "learning_rate": 0.0004330822447702327, "loss": 4.8947, "mean_token_accuracy": 0.20993456691503526, "num_tokens": 59200984.0, "step": 28530 }, { "entropy": 5.555482196807861, "epoch": 2.588443396226415, "grad_norm": 1.1640625, "learning_rate": 0.00043305921840089347, "loss": 4.95, "mean_token_accuracy": 0.21745003759860992, "num_tokens": 59210672.0, "step": 28535 }, { "entropy": 5.530939960479737, "epoch": 2.5888969521044993, "grad_norm": 1.2734375, "learning_rate": 0.00043303618876284935, "loss": 4.9551, "mean_token_accuracy": 0.2157348409295082, "num_tokens": 59220230.0, "step": 28540 }, { "entropy": 5.4644629001617435, "epoch": 2.5893505079825836, "grad_norm": 1.140625, "learning_rate": 0.00043301315585657645, "loss": 4.8597, "mean_token_accuracy": 0.21800754368305206, "num_tokens": 59230615.0, "step": 28545 }, { "entropy": 5.546888399124145, "epoch": 2.589804063860668, "grad_norm": 1.0078125, "learning_rate": 0.0004329901196825513, "loss": 4.9692, "mean_token_accuracy": 0.21738160848617555, "num_tokens": 59241717.0, "step": 28550 }, { "entropy": 5.584340286254883, "epoch": 2.5902576197387517, "grad_norm": 1.1015625, "learning_rate": 0.00043296708024125025, "loss": 4.9836, "mean_token_accuracy": 0.2095291867852211, "num_tokens": 59251791.0, "step": 28555 }, { "entropy": 5.485751914978027, "epoch": 2.590711175616836, "grad_norm": 1.1875, "learning_rate": 0.00043294403753314965, "loss": 4.8092, "mean_token_accuracy": 0.22592369914054872, "num_tokens": 59262434.0, "step": 28560 }, { "entropy": 5.503426218032837, "epoch": 2.59116473149492, "grad_norm": 1.140625, "learning_rate": 0.0004329209915587261, "loss": 4.988, "mean_token_accuracy": 0.20915014594793319, "num_tokens": 59272138.0, "step": 28565 }, { "entropy": 5.486407661437989, "epoch": 2.5916182873730045, "grad_norm": 1.1171875, "learning_rate": 0.00043289794231845624, "loss": 4.9365, "mean_token_accuracy": 0.2142576038837433, "num_tokens": 59283470.0, "step": 28570 }, { "entropy": 5.468969535827637, "epoch": 2.5920718432510883, "grad_norm": 1.171875, "learning_rate": 0.0004328748898128168, "loss": 4.9353, "mean_token_accuracy": 0.21285001188516617, "num_tokens": 59293670.0, "step": 28575 }, { "entropy": 5.54750247001648, "epoch": 2.5925253991291726, "grad_norm": 1.15625, "learning_rate": 0.0004328518340422842, "loss": 4.9282, "mean_token_accuracy": 0.21523593217134476, "num_tokens": 59303728.0, "step": 28580 }, { "entropy": 5.519813013076782, "epoch": 2.592978955007257, "grad_norm": 1.0703125, "learning_rate": 0.00043282877500733555, "loss": 4.8827, "mean_token_accuracy": 0.2209109589457512, "num_tokens": 59314271.0, "step": 28585 }, { "entropy": 5.518555116653443, "epoch": 2.593432510885341, "grad_norm": 1.15625, "learning_rate": 0.0004328057127084476, "loss": 4.9133, "mean_token_accuracy": 0.21364410519599913, "num_tokens": 59324581.0, "step": 28590 }, { "entropy": 5.5035045623779295, "epoch": 2.5938860667634254, "grad_norm": 1.2109375, "learning_rate": 0.00043278264714609733, "loss": 4.9121, "mean_token_accuracy": 0.21637875139713286, "num_tokens": 59333912.0, "step": 28595 }, { "entropy": 5.4700884342193605, "epoch": 2.5943396226415096, "grad_norm": 1.1015625, "learning_rate": 0.00043275957832076173, "loss": 4.8647, "mean_token_accuracy": 0.21697210371494294, "num_tokens": 59344245.0, "step": 28600 }, { "entropy": 5.518507385253907, "epoch": 2.5947931785195935, "grad_norm": 1.2734375, "learning_rate": 0.00043273650623291775, "loss": 5.0021, "mean_token_accuracy": 0.21529100984334945, "num_tokens": 59353825.0, "step": 28605 }, { "entropy": 5.515340566635132, "epoch": 2.5952467343976777, "grad_norm": 1.078125, "learning_rate": 0.0004327134308830427, "loss": 4.9448, "mean_token_accuracy": 0.21119250506162643, "num_tokens": 59364901.0, "step": 28610 }, { "entropy": 5.496701049804687, "epoch": 2.595700290275762, "grad_norm": 1.078125, "learning_rate": 0.0004326903522716137, "loss": 4.8937, "mean_token_accuracy": 0.21021356880664827, "num_tokens": 59374772.0, "step": 28615 }, { "entropy": 5.450021409988404, "epoch": 2.5961538461538463, "grad_norm": 1.234375, "learning_rate": 0.000432667270399108, "loss": 4.8192, "mean_token_accuracy": 0.22559859454631806, "num_tokens": 59383640.0, "step": 28620 }, { "entropy": 5.523759126663208, "epoch": 2.59660740203193, "grad_norm": 1.2265625, "learning_rate": 0.00043264418526600305, "loss": 4.8811, "mean_token_accuracy": 0.21806788295507432, "num_tokens": 59392928.0, "step": 28625 }, { "entropy": 5.565279388427735, "epoch": 2.5970609579100143, "grad_norm": 1.0859375, "learning_rate": 0.0004326210968727761, "loss": 4.9966, "mean_token_accuracy": 0.2071376398205757, "num_tokens": 59402969.0, "step": 28630 }, { "entropy": 5.5832356929779055, "epoch": 2.5975145137880986, "grad_norm": 1.1171875, "learning_rate": 0.0004325980052199047, "loss": 4.99, "mean_token_accuracy": 0.20268357396125794, "num_tokens": 59413439.0, "step": 28635 }, { "entropy": 5.58742847442627, "epoch": 2.597968069666183, "grad_norm": 1.1640625, "learning_rate": 0.00043257491030786644, "loss": 4.9418, "mean_token_accuracy": 0.21679740846157075, "num_tokens": 59423403.0, "step": 28640 }, { "entropy": 5.525634813308716, "epoch": 2.598421625544267, "grad_norm": 1.1640625, "learning_rate": 0.00043255181213713883, "loss": 4.9983, "mean_token_accuracy": 0.20762742608785628, "num_tokens": 59434519.0, "step": 28645 }, { "entropy": 5.53591136932373, "epoch": 2.5988751814223514, "grad_norm": 1.1328125, "learning_rate": 0.0004325287107081996, "loss": 4.9319, "mean_token_accuracy": 0.2096611425280571, "num_tokens": 59445056.0, "step": 28650 }, { "entropy": 5.508650445938111, "epoch": 2.5993287373004357, "grad_norm": 1.2265625, "learning_rate": 0.0004325056060215265, "loss": 4.8973, "mean_token_accuracy": 0.2145665094256401, "num_tokens": 59455037.0, "step": 28655 }, { "entropy": 5.50084171295166, "epoch": 2.5997822931785195, "grad_norm": 1.2265625, "learning_rate": 0.0004324824980775973, "loss": 4.9411, "mean_token_accuracy": 0.21044404655694962, "num_tokens": 59465093.0, "step": 28660 }, { "entropy": 5.503364515304566, "epoch": 2.6002358490566038, "grad_norm": 1.171875, "learning_rate": 0.00043245938687688995, "loss": 5.0014, "mean_token_accuracy": 0.21246374398469925, "num_tokens": 59475449.0, "step": 28665 }, { "entropy": 5.560793256759643, "epoch": 2.600689404934688, "grad_norm": 1.078125, "learning_rate": 0.00043243627241988235, "loss": 4.9288, "mean_token_accuracy": 0.2096658915281296, "num_tokens": 59484990.0, "step": 28670 }, { "entropy": 5.5800196647644045, "epoch": 2.6011429608127723, "grad_norm": 1.1015625, "learning_rate": 0.00043241315470705254, "loss": 4.9304, "mean_token_accuracy": 0.2114672601222992, "num_tokens": 59495739.0, "step": 28675 }, { "entropy": 5.531115531921387, "epoch": 2.601596516690856, "grad_norm": 1.046875, "learning_rate": 0.00043239003373887855, "loss": 4.9145, "mean_token_accuracy": 0.21694314032793044, "num_tokens": 59506432.0, "step": 28680 }, { "entropy": 5.530005359649659, "epoch": 2.6020500725689404, "grad_norm": 1.1015625, "learning_rate": 0.0004323669095158385, "loss": 4.9226, "mean_token_accuracy": 0.21335145831108093, "num_tokens": 59516585.0, "step": 28685 }, { "entropy": 5.497039127349853, "epoch": 2.6025036284470247, "grad_norm": 1.3125, "learning_rate": 0.0004323437820384107, "loss": 4.9145, "mean_token_accuracy": 0.21011703163385392, "num_tokens": 59526824.0, "step": 28690 }, { "entropy": 5.561870002746582, "epoch": 2.602957184325109, "grad_norm": 1.1796875, "learning_rate": 0.0004323206513070734, "loss": 4.9573, "mean_token_accuracy": 0.2124274656176567, "num_tokens": 59537749.0, "step": 28695 }, { "entropy": 5.579768800735474, "epoch": 2.603410740203193, "grad_norm": 1.171875, "learning_rate": 0.000432297517322305, "loss": 4.919, "mean_token_accuracy": 0.2060007095336914, "num_tokens": 59548310.0, "step": 28700 }, { "entropy": 5.543799543380738, "epoch": 2.6038642960812775, "grad_norm": 1.078125, "learning_rate": 0.0004322743800845838, "loss": 4.9909, "mean_token_accuracy": 0.21550447791814803, "num_tokens": 59558191.0, "step": 28705 }, { "entropy": 5.5542418479919435, "epoch": 2.6043178519593613, "grad_norm": 1.125, "learning_rate": 0.00043225123959438836, "loss": 4.9889, "mean_token_accuracy": 0.19904627799987792, "num_tokens": 59568961.0, "step": 28710 }, { "entropy": 5.537586832046509, "epoch": 2.6047714078374455, "grad_norm": 1.1640625, "learning_rate": 0.00043222809585219716, "loss": 4.9231, "mean_token_accuracy": 0.21050258874893188, "num_tokens": 59579137.0, "step": 28715 }, { "entropy": 5.388093757629394, "epoch": 2.60522496371553, "grad_norm": 1.109375, "learning_rate": 0.00043220494885848896, "loss": 4.727, "mean_token_accuracy": 0.22887020707130432, "num_tokens": 59589612.0, "step": 28720 }, { "entropy": 5.545928144454956, "epoch": 2.605678519593614, "grad_norm": 1.140625, "learning_rate": 0.0004321817986137423, "loss": 4.9611, "mean_token_accuracy": 0.2099051907658577, "num_tokens": 59600332.0, "step": 28725 }, { "entropy": 5.445740222930908, "epoch": 2.606132075471698, "grad_norm": 1.21875, "learning_rate": 0.000432158645118436, "loss": 4.8353, "mean_token_accuracy": 0.2302090272307396, "num_tokens": 59610491.0, "step": 28730 }, { "entropy": 5.63829550743103, "epoch": 2.606585631349782, "grad_norm": 1.1640625, "learning_rate": 0.0004321354883730488, "loss": 5.0801, "mean_token_accuracy": 0.20283650159835814, "num_tokens": 59620729.0, "step": 28735 }, { "entropy": 5.502729272842407, "epoch": 2.6070391872278664, "grad_norm": 1.2109375, "learning_rate": 0.00043211232837805973, "loss": 4.8741, "mean_token_accuracy": 0.22019591480493544, "num_tokens": 59631243.0, "step": 28740 }, { "entropy": 5.529031705856323, "epoch": 2.6074927431059507, "grad_norm": 1.3515625, "learning_rate": 0.00043208916513394767, "loss": 4.9044, "mean_token_accuracy": 0.22065686881542207, "num_tokens": 59642055.0, "step": 28745 }, { "entropy": 5.562448740005493, "epoch": 2.607946298984035, "grad_norm": 1.1875, "learning_rate": 0.00043206599864119164, "loss": 4.9884, "mean_token_accuracy": 0.2103422462940216, "num_tokens": 59652144.0, "step": 28750 }, { "entropy": 5.508689260482788, "epoch": 2.6083998548621192, "grad_norm": 1.1171875, "learning_rate": 0.00043204282890027074, "loss": 4.8834, "mean_token_accuracy": 0.22429406493902207, "num_tokens": 59662367.0, "step": 28755 }, { "entropy": 5.552458477020264, "epoch": 2.608853410740203, "grad_norm": 1.125, "learning_rate": 0.00043201965591166413, "loss": 4.9352, "mean_token_accuracy": 0.21458108425140382, "num_tokens": 59672729.0, "step": 28760 }, { "entropy": 5.578047609329223, "epoch": 2.6093069666182873, "grad_norm": 1.140625, "learning_rate": 0.000431996479675851, "loss": 4.9779, "mean_token_accuracy": 0.22175480425357819, "num_tokens": 59683282.0, "step": 28765 }, { "entropy": 5.585192537307739, "epoch": 2.6097605224963716, "grad_norm": 1.1484375, "learning_rate": 0.00043197330019331074, "loss": 5.0277, "mean_token_accuracy": 0.2032526522874832, "num_tokens": 59694297.0, "step": 28770 }, { "entropy": 5.460672426223755, "epoch": 2.610214078374456, "grad_norm": 1.09375, "learning_rate": 0.00043195011746452244, "loss": 4.8568, "mean_token_accuracy": 0.21983457654714583, "num_tokens": 59704149.0, "step": 28775 }, { "entropy": 5.5555281162261965, "epoch": 2.6106676342525397, "grad_norm": 1.203125, "learning_rate": 0.00043192693148996585, "loss": 4.9667, "mean_token_accuracy": 0.2182912364602089, "num_tokens": 59714811.0, "step": 28780 }, { "entropy": 5.49904613494873, "epoch": 2.611121190130624, "grad_norm": 1.1640625, "learning_rate": 0.0004319037422701203, "loss": 4.8845, "mean_token_accuracy": 0.22046362310647966, "num_tokens": 59724950.0, "step": 28785 }, { "entropy": 5.549964046478271, "epoch": 2.611574746008708, "grad_norm": 1.0546875, "learning_rate": 0.0004318805498054654, "loss": 5.0348, "mean_token_accuracy": 0.19872065633535385, "num_tokens": 59735905.0, "step": 28790 }, { "entropy": 5.6039002418518065, "epoch": 2.6120283018867925, "grad_norm": 1.0390625, "learning_rate": 0.00043185735409648077, "loss": 4.9835, "mean_token_accuracy": 0.21075978577136995, "num_tokens": 59746743.0, "step": 28795 }, { "entropy": 5.56124210357666, "epoch": 2.6124818577648767, "grad_norm": 1.203125, "learning_rate": 0.00043183415514364606, "loss": 4.9184, "mean_token_accuracy": 0.21381641924381256, "num_tokens": 59757205.0, "step": 28800 }, { "entropy": 5.454240703582764, "epoch": 2.612935413642961, "grad_norm": 1.15625, "learning_rate": 0.0004318109529474411, "loss": 4.9192, "mean_token_accuracy": 0.21552783101797104, "num_tokens": 59767691.0, "step": 28805 }, { "entropy": 5.476266956329345, "epoch": 2.6133889695210453, "grad_norm": 1.125, "learning_rate": 0.0004317877475083456, "loss": 4.942, "mean_token_accuracy": 0.21620311439037324, "num_tokens": 59778618.0, "step": 28810 }, { "entropy": 5.560245561599731, "epoch": 2.613842525399129, "grad_norm": 1.15625, "learning_rate": 0.00043176453882683955, "loss": 4.9671, "mean_token_accuracy": 0.20953458994627, "num_tokens": 59789423.0, "step": 28815 }, { "entropy": 5.594815969467163, "epoch": 2.6142960812772134, "grad_norm": 1.1328125, "learning_rate": 0.00043174132690340287, "loss": 5.0203, "mean_token_accuracy": 0.20201612561941146, "num_tokens": 59800021.0, "step": 28820 }, { "entropy": 5.4969874858856205, "epoch": 2.6147496371552976, "grad_norm": 1.0625, "learning_rate": 0.0004317181117385156, "loss": 4.8919, "mean_token_accuracy": 0.20912107974290847, "num_tokens": 59810006.0, "step": 28825 }, { "entropy": 5.534179019927978, "epoch": 2.6152031930333814, "grad_norm": 1.2109375, "learning_rate": 0.00043169489333265795, "loss": 4.951, "mean_token_accuracy": 0.2081662893295288, "num_tokens": 59819505.0, "step": 28830 }, { "entropy": 5.555849361419678, "epoch": 2.6156567489114657, "grad_norm": 1.1875, "learning_rate": 0.00043167167168630977, "loss": 4.9604, "mean_token_accuracy": 0.2156184807419777, "num_tokens": 59830439.0, "step": 28835 }, { "entropy": 5.525593614578247, "epoch": 2.61611030478955, "grad_norm": 1.1328125, "learning_rate": 0.0004316484467999516, "loss": 4.9383, "mean_token_accuracy": 0.21081707626581192, "num_tokens": 59841281.0, "step": 28840 }, { "entropy": 5.518883752822876, "epoch": 2.6165638606676342, "grad_norm": 1.03125, "learning_rate": 0.00043162521867406376, "loss": 4.9714, "mean_token_accuracy": 0.20398472100496293, "num_tokens": 59853581.0, "step": 28845 }, { "entropy": 5.605485153198242, "epoch": 2.6170174165457185, "grad_norm": 1.1796875, "learning_rate": 0.0004316019873091263, "loss": 4.9973, "mean_token_accuracy": 0.21135033071041107, "num_tokens": 59864787.0, "step": 28850 }, { "entropy": 5.576481533050537, "epoch": 2.6174709724238028, "grad_norm": 1.1640625, "learning_rate": 0.0004315787527056199, "loss": 4.951, "mean_token_accuracy": 0.21697171330451964, "num_tokens": 59875244.0, "step": 28855 }, { "entropy": 5.497420310974121, "epoch": 2.617924528301887, "grad_norm": 0.984375, "learning_rate": 0.0004315555148640251, "loss": 4.9102, "mean_token_accuracy": 0.2159500852227211, "num_tokens": 59886535.0, "step": 28860 }, { "entropy": 5.5382331848144535, "epoch": 2.618378084179971, "grad_norm": 1.125, "learning_rate": 0.0004315322737848222, "loss": 4.9227, "mean_token_accuracy": 0.2105987548828125, "num_tokens": 59896298.0, "step": 28865 }, { "entropy": 5.440474510192871, "epoch": 2.618831640058055, "grad_norm": 1.1875, "learning_rate": 0.000431509029468492, "loss": 4.8911, "mean_token_accuracy": 0.22039612680673598, "num_tokens": 59907010.0, "step": 28870 }, { "entropy": 5.559852600097656, "epoch": 2.6192851959361394, "grad_norm": 1.1796875, "learning_rate": 0.0004314857819155153, "loss": 4.9013, "mean_token_accuracy": 0.21951362490653992, "num_tokens": 59916247.0, "step": 28875 }, { "entropy": 5.45871376991272, "epoch": 2.6197387518142237, "grad_norm": 1.0703125, "learning_rate": 0.00043146253112637267, "loss": 4.8314, "mean_token_accuracy": 0.22198484390974044, "num_tokens": 59926680.0, "step": 28880 }, { "entropy": 5.4570149898529055, "epoch": 2.6201923076923075, "grad_norm": 1.203125, "learning_rate": 0.00043143927710154504, "loss": 4.8521, "mean_token_accuracy": 0.22045730501413346, "num_tokens": 59936346.0, "step": 28885 }, { "entropy": 5.505706834793091, "epoch": 2.6206458635703918, "grad_norm": 1.140625, "learning_rate": 0.0004314160198415133, "loss": 4.9226, "mean_token_accuracy": 0.22199222296476365, "num_tokens": 59947007.0, "step": 28890 }, { "entropy": 5.543805456161499, "epoch": 2.621099419448476, "grad_norm": 1.09375, "learning_rate": 0.00043139275934675844, "loss": 4.9708, "mean_token_accuracy": 0.21432872712612153, "num_tokens": 59957123.0, "step": 28895 }, { "entropy": 5.51826434135437, "epoch": 2.6215529753265603, "grad_norm": 1.109375, "learning_rate": 0.0004313694956177613, "loss": 4.9404, "mean_token_accuracy": 0.21661525517702102, "num_tokens": 59966566.0, "step": 28900 }, { "entropy": 5.534532976150513, "epoch": 2.6220065312046446, "grad_norm": 1.203125, "learning_rate": 0.00043134622865500334, "loss": 4.9244, "mean_token_accuracy": 0.20877003967761992, "num_tokens": 59976065.0, "step": 28905 }, { "entropy": 5.585506200790405, "epoch": 2.622460087082729, "grad_norm": 1.25, "learning_rate": 0.0004313229584589655, "loss": 4.933, "mean_token_accuracy": 0.2137759655714035, "num_tokens": 59986201.0, "step": 28910 }, { "entropy": 5.505525302886963, "epoch": 2.6229136429608126, "grad_norm": 1.0390625, "learning_rate": 0.000431299685030129, "loss": 4.9443, "mean_token_accuracy": 0.21248521506786347, "num_tokens": 59996574.0, "step": 28915 }, { "entropy": 5.512580919265747, "epoch": 2.623367198838897, "grad_norm": 1.1171875, "learning_rate": 0.00043127640836897516, "loss": 4.9609, "mean_token_accuracy": 0.21798425763845444, "num_tokens": 60006082.0, "step": 28920 }, { "entropy": 5.528341341018677, "epoch": 2.623820754716981, "grad_norm": 1.21875, "learning_rate": 0.0004312531284759854, "loss": 4.9324, "mean_token_accuracy": 0.20959401428699492, "num_tokens": 60015483.0, "step": 28925 }, { "entropy": 5.512495851516723, "epoch": 2.6242743105950654, "grad_norm": 1.421875, "learning_rate": 0.00043122984535164116, "loss": 4.8457, "mean_token_accuracy": 0.22911366820335388, "num_tokens": 60025984.0, "step": 28930 }, { "entropy": 5.55941071510315, "epoch": 2.6247278664731493, "grad_norm": 1.0546875, "learning_rate": 0.00043120655899642386, "loss": 4.93, "mean_token_accuracy": 0.2076868385076523, "num_tokens": 60036109.0, "step": 28935 }, { "entropy": 5.615510129928589, "epoch": 2.6251814223512335, "grad_norm": 1.21875, "learning_rate": 0.00043118326941081513, "loss": 4.9935, "mean_token_accuracy": 0.20689695328474045, "num_tokens": 60046546.0, "step": 28940 }, { "entropy": 5.583363437652588, "epoch": 2.625634978229318, "grad_norm": 1.2578125, "learning_rate": 0.0004311599765952966, "loss": 4.9923, "mean_token_accuracy": 0.2163356751203537, "num_tokens": 60056768.0, "step": 28945 }, { "entropy": 5.552965116500855, "epoch": 2.626088534107402, "grad_norm": 1.1328125, "learning_rate": 0.00043113668055034995, "loss": 5.0395, "mean_token_accuracy": 0.20677520781755448, "num_tokens": 60066962.0, "step": 28950 }, { "entropy": 5.526785373687744, "epoch": 2.6265420899854863, "grad_norm": 1.234375, "learning_rate": 0.0004311133812764569, "loss": 4.9243, "mean_token_accuracy": 0.21789804995059966, "num_tokens": 60076477.0, "step": 28955 }, { "entropy": 5.4595733165740965, "epoch": 2.6269956458635706, "grad_norm": 1.0859375, "learning_rate": 0.00043109007877409946, "loss": 4.8094, "mean_token_accuracy": 0.22258938997983932, "num_tokens": 60088060.0, "step": 28960 }, { "entropy": 5.510951566696167, "epoch": 2.6274492017416544, "grad_norm": 1.2109375, "learning_rate": 0.00043106677304375935, "loss": 4.909, "mean_token_accuracy": 0.2175913155078888, "num_tokens": 60098677.0, "step": 28965 }, { "entropy": 5.5853455543518065, "epoch": 2.6279027576197387, "grad_norm": 1.1640625, "learning_rate": 0.0004310434640859186, "loss": 5.0059, "mean_token_accuracy": 0.20754190981388093, "num_tokens": 60109054.0, "step": 28970 }, { "entropy": 5.515770101547242, "epoch": 2.628356313497823, "grad_norm": 1.171875, "learning_rate": 0.0004310201519010592, "loss": 4.8409, "mean_token_accuracy": 0.22024760991334916, "num_tokens": 60119951.0, "step": 28975 }, { "entropy": 5.432485294342041, "epoch": 2.628809869375907, "grad_norm": 1.203125, "learning_rate": 0.00043099683648966335, "loss": 4.8251, "mean_token_accuracy": 0.21306003630161285, "num_tokens": 60130026.0, "step": 28980 }, { "entropy": 5.4275596141815186, "epoch": 2.629263425253991, "grad_norm": 1.140625, "learning_rate": 0.0004309735178522132, "loss": 4.8504, "mean_token_accuracy": 0.22112511247396469, "num_tokens": 60140748.0, "step": 28985 }, { "entropy": 5.504708671569825, "epoch": 2.6297169811320753, "grad_norm": 1.1875, "learning_rate": 0.0004309501959891909, "loss": 4.8942, "mean_token_accuracy": 0.21946708112955093, "num_tokens": 60151042.0, "step": 28990 }, { "entropy": 5.561709356307984, "epoch": 2.6301705370101596, "grad_norm": 1.203125, "learning_rate": 0.00043092687090107883, "loss": 4.93, "mean_token_accuracy": 0.20676448494195937, "num_tokens": 60160758.0, "step": 28995 }, { "entropy": 5.490038824081421, "epoch": 2.630624092888244, "grad_norm": 1.2421875, "learning_rate": 0.00043090354258835934, "loss": 4.934, "mean_token_accuracy": 0.21050809174776078, "num_tokens": 60170249.0, "step": 29000 }, { "entropy": 5.459096765518188, "epoch": 2.631077648766328, "grad_norm": 1.15625, "learning_rate": 0.00043088021105151483, "loss": 4.9325, "mean_token_accuracy": 0.21335221976041793, "num_tokens": 60181216.0, "step": 29005 }, { "entropy": 5.498613595962524, "epoch": 2.6315312046444124, "grad_norm": 1.1328125, "learning_rate": 0.0004308568762910279, "loss": 4.8848, "mean_token_accuracy": 0.21757752150297166, "num_tokens": 60190559.0, "step": 29010 }, { "entropy": 5.61933217048645, "epoch": 2.6319847605224966, "grad_norm": 1.0859375, "learning_rate": 0.00043083353830738097, "loss": 5.0207, "mean_token_accuracy": 0.2060284808278084, "num_tokens": 60201268.0, "step": 29015 }, { "entropy": 5.4622515678405765, "epoch": 2.6324383164005805, "grad_norm": 1.109375, "learning_rate": 0.00043081019710105683, "loss": 4.7889, "mean_token_accuracy": 0.21759428679943085, "num_tokens": 60210907.0, "step": 29020 }, { "entropy": 5.4503264904022215, "epoch": 2.6328918722786647, "grad_norm": 1.203125, "learning_rate": 0.0004307868526725381, "loss": 4.8364, "mean_token_accuracy": 0.22276439815759658, "num_tokens": 60220298.0, "step": 29025 }, { "entropy": 5.434282636642456, "epoch": 2.633345428156749, "grad_norm": 1.1796875, "learning_rate": 0.0004307635050223075, "loss": 4.8711, "mean_token_accuracy": 0.22295601814985275, "num_tokens": 60230811.0, "step": 29030 }, { "entropy": 5.509660768508911, "epoch": 2.6337989840348333, "grad_norm": 1.2265625, "learning_rate": 0.000430740154150848, "loss": 4.8397, "mean_token_accuracy": 0.21989746689796447, "num_tokens": 60241211.0, "step": 29035 }, { "entropy": 5.471844291687011, "epoch": 2.634252539912917, "grad_norm": 1.0703125, "learning_rate": 0.0004307168000586423, "loss": 4.8794, "mean_token_accuracy": 0.22211599498987197, "num_tokens": 60251506.0, "step": 29040 }, { "entropy": 5.451631021499634, "epoch": 2.6347060957910013, "grad_norm": 1.4375, "learning_rate": 0.0004306934427461736, "loss": 4.8371, "mean_token_accuracy": 0.23554385900497438, "num_tokens": 60261416.0, "step": 29045 }, { "entropy": 5.5329022884368895, "epoch": 2.6351596516690856, "grad_norm": 1.2578125, "learning_rate": 0.0004306700822139248, "loss": 4.9153, "mean_token_accuracy": 0.21408605128526687, "num_tokens": 60272315.0, "step": 29050 }, { "entropy": 5.51502103805542, "epoch": 2.63561320754717, "grad_norm": 1.15625, "learning_rate": 0.000430646718462379, "loss": 4.9833, "mean_token_accuracy": 0.21138989329338073, "num_tokens": 60282722.0, "step": 29055 }, { "entropy": 5.495158720016479, "epoch": 2.636066763425254, "grad_norm": 1.1796875, "learning_rate": 0.0004306233514920194, "loss": 4.9091, "mean_token_accuracy": 0.2150113493204117, "num_tokens": 60292636.0, "step": 29060 }, { "entropy": 5.510214757919312, "epoch": 2.6365203193033384, "grad_norm": 1.09375, "learning_rate": 0.00043059998130332933, "loss": 4.9023, "mean_token_accuracy": 0.2177960082888603, "num_tokens": 60302979.0, "step": 29065 }, { "entropy": 5.518082761764527, "epoch": 2.6369738751814222, "grad_norm": 1.1484375, "learning_rate": 0.00043057660789679194, "loss": 4.9271, "mean_token_accuracy": 0.21595758944749832, "num_tokens": 60313181.0, "step": 29070 }, { "entropy": 5.572794961929321, "epoch": 2.6374274310595065, "grad_norm": 1.1875, "learning_rate": 0.0004305532312728906, "loss": 4.893, "mean_token_accuracy": 0.21098823547363282, "num_tokens": 60323401.0, "step": 29075 }, { "entropy": 5.5677135467529295, "epoch": 2.6378809869375908, "grad_norm": 1.2265625, "learning_rate": 0.0004305298514321088, "loss": 4.9969, "mean_token_accuracy": 0.20664920061826705, "num_tokens": 60333478.0, "step": 29080 }, { "entropy": 5.496002149581909, "epoch": 2.638334542815675, "grad_norm": 1.171875, "learning_rate": 0.00043050646837493014, "loss": 4.876, "mean_token_accuracy": 0.2160879999399185, "num_tokens": 60343980.0, "step": 29085 }, { "entropy": 5.5128497123718265, "epoch": 2.638788098693759, "grad_norm": 1.0703125, "learning_rate": 0.0004304830821018381, "loss": 4.888, "mean_token_accuracy": 0.2214886099100113, "num_tokens": 60354262.0, "step": 29090 }, { "entropy": 5.551802730560302, "epoch": 2.639241654571843, "grad_norm": 1.171875, "learning_rate": 0.0004304596926133162, "loss": 4.9821, "mean_token_accuracy": 0.213053897023201, "num_tokens": 60364137.0, "step": 29095 }, { "entropy": 5.5155517578125, "epoch": 2.6396952104499274, "grad_norm": 1.046875, "learning_rate": 0.00043043629990984823, "loss": 4.9561, "mean_token_accuracy": 0.20881974697113037, "num_tokens": 60374528.0, "step": 29100 }, { "entropy": 5.484981679916382, "epoch": 2.6401487663280117, "grad_norm": 1.25, "learning_rate": 0.00043041290399191797, "loss": 4.945, "mean_token_accuracy": 0.2179246127605438, "num_tokens": 60384880.0, "step": 29105 }, { "entropy": 5.503172445297241, "epoch": 2.640602322206096, "grad_norm": 1.1484375, "learning_rate": 0.0004303895048600093, "loss": 4.901, "mean_token_accuracy": 0.21249927282333375, "num_tokens": 60395543.0, "step": 29110 }, { "entropy": 5.564700317382813, "epoch": 2.64105587808418, "grad_norm": 1.078125, "learning_rate": 0.0004303661025146061, "loss": 4.9109, "mean_token_accuracy": 0.22175834476947784, "num_tokens": 60405432.0, "step": 29115 }, { "entropy": 5.581679821014404, "epoch": 2.641509433962264, "grad_norm": 1.125, "learning_rate": 0.0004303426969561922, "loss": 4.976, "mean_token_accuracy": 0.20390943735837935, "num_tokens": 60416360.0, "step": 29120 }, { "entropy": 5.552780103683472, "epoch": 2.6419629898403483, "grad_norm": 1.1640625, "learning_rate": 0.0004303192881852518, "loss": 4.9448, "mean_token_accuracy": 0.21306895911693574, "num_tokens": 60426371.0, "step": 29125 }, { "entropy": 5.555319452285767, "epoch": 2.6424165457184325, "grad_norm": 1.109375, "learning_rate": 0.00043029587620226897, "loss": 4.933, "mean_token_accuracy": 0.2140775963664055, "num_tokens": 60437505.0, "step": 29130 }, { "entropy": 5.538500690460205, "epoch": 2.642870101596517, "grad_norm": 1.09375, "learning_rate": 0.0004302724610077278, "loss": 4.9149, "mean_token_accuracy": 0.21363855004310608, "num_tokens": 60448170.0, "step": 29135 }, { "entropy": 5.577473974227905, "epoch": 2.6433236574746006, "grad_norm": 1.109375, "learning_rate": 0.0004302490426021126, "loss": 5.003, "mean_token_accuracy": 0.20730844289064407, "num_tokens": 60458776.0, "step": 29140 }, { "entropy": 5.532087993621826, "epoch": 2.643777213352685, "grad_norm": 1.2265625, "learning_rate": 0.0004302256209859076, "loss": 4.8988, "mean_token_accuracy": 0.2262054592370987, "num_tokens": 60468279.0, "step": 29145 }, { "entropy": 5.532051610946655, "epoch": 2.644230769230769, "grad_norm": 1.15625, "learning_rate": 0.00043020219615959727, "loss": 4.984, "mean_token_accuracy": 0.20770479142665862, "num_tokens": 60478507.0, "step": 29150 }, { "entropy": 5.578500699996948, "epoch": 2.6446843251088534, "grad_norm": 1.1171875, "learning_rate": 0.0004301787681236659, "loss": 5.0348, "mean_token_accuracy": 0.20529094487428665, "num_tokens": 60489016.0, "step": 29155 }, { "entropy": 5.592386770248413, "epoch": 2.6451378809869377, "grad_norm": 1.0546875, "learning_rate": 0.0004301553368785981, "loss": 4.9833, "mean_token_accuracy": 0.2058970332145691, "num_tokens": 60500169.0, "step": 29160 }, { "entropy": 5.533572435379028, "epoch": 2.645591436865022, "grad_norm": 1.1953125, "learning_rate": 0.0004301319024248784, "loss": 4.883, "mean_token_accuracy": 0.21767321676015855, "num_tokens": 60511109.0, "step": 29165 }, { "entropy": 5.523146057128907, "epoch": 2.6460449927431062, "grad_norm": 1.1640625, "learning_rate": 0.00043010846476299145, "loss": 4.8955, "mean_token_accuracy": 0.22105156779289245, "num_tokens": 60521735.0, "step": 29170 }, { "entropy": 5.569445180892944, "epoch": 2.64649854862119, "grad_norm": 1.1953125, "learning_rate": 0.0004300850238934219, "loss": 4.9631, "mean_token_accuracy": 0.20607843846082688, "num_tokens": 60532071.0, "step": 29175 }, { "entropy": 5.5547194480896, "epoch": 2.6469521044992743, "grad_norm": 1.1875, "learning_rate": 0.00043006157981665446, "loss": 4.9112, "mean_token_accuracy": 0.21811448633670807, "num_tokens": 60541909.0, "step": 29180 }, { "entropy": 5.469224452972412, "epoch": 2.6474056603773586, "grad_norm": 1.1171875, "learning_rate": 0.00043003813253317415, "loss": 4.8626, "mean_token_accuracy": 0.22079289555549622, "num_tokens": 60551361.0, "step": 29185 }, { "entropy": 5.48556661605835, "epoch": 2.6478592162554424, "grad_norm": 1.1328125, "learning_rate": 0.00043001468204346564, "loss": 4.9393, "mean_token_accuracy": 0.21266020685434342, "num_tokens": 60562112.0, "step": 29190 }, { "entropy": 5.556151866912842, "epoch": 2.6483127721335267, "grad_norm": 1.2421875, "learning_rate": 0.00042999122834801406, "loss": 4.9618, "mean_token_accuracy": 0.20834096819162368, "num_tokens": 60572827.0, "step": 29195 }, { "entropy": 5.462076997756958, "epoch": 2.648766328011611, "grad_norm": 1.2109375, "learning_rate": 0.0004299677714473044, "loss": 4.8733, "mean_token_accuracy": 0.22373484820127487, "num_tokens": 60582222.0, "step": 29200 }, { "entropy": 5.522726345062256, "epoch": 2.649219883889695, "grad_norm": 1.140625, "learning_rate": 0.0004299443113418217, "loss": 4.9514, "mean_token_accuracy": 0.21997703164815902, "num_tokens": 60592943.0, "step": 29205 }, { "entropy": 5.53337926864624, "epoch": 2.6496734397677795, "grad_norm": 1.078125, "learning_rate": 0.00042992084803205124, "loss": 4.9318, "mean_token_accuracy": 0.21421058177948, "num_tokens": 60603206.0, "step": 29210 }, { "entropy": 5.5014848709106445, "epoch": 2.6501269956458637, "grad_norm": 1.234375, "learning_rate": 0.000429897381518478, "loss": 4.8622, "mean_token_accuracy": 0.22122532576322557, "num_tokens": 60614776.0, "step": 29215 }, { "entropy": 5.5081761360168455, "epoch": 2.650580551523948, "grad_norm": 1.0703125, "learning_rate": 0.00042987391180158757, "loss": 4.9003, "mean_token_accuracy": 0.2124914437532425, "num_tokens": 60625914.0, "step": 29220 }, { "entropy": 5.51166844367981, "epoch": 2.651034107402032, "grad_norm": 1.171875, "learning_rate": 0.00042985043888186516, "loss": 4.9119, "mean_token_accuracy": 0.22042528688907623, "num_tokens": 60636934.0, "step": 29225 }, { "entropy": 5.494295215606689, "epoch": 2.651487663280116, "grad_norm": 1.1328125, "learning_rate": 0.0004298269627597962, "loss": 4.9459, "mean_token_accuracy": 0.21049118787050247, "num_tokens": 60647707.0, "step": 29230 }, { "entropy": 5.462206268310547, "epoch": 2.6519412191582004, "grad_norm": 1.15625, "learning_rate": 0.00042980348343586624, "loss": 4.8639, "mean_token_accuracy": 0.21600887179374695, "num_tokens": 60658691.0, "step": 29235 }, { "entropy": 5.520254993438721, "epoch": 2.6523947750362846, "grad_norm": 1.1953125, "learning_rate": 0.00042978000091056074, "loss": 4.9658, "mean_token_accuracy": 0.2106821730732918, "num_tokens": 60668479.0, "step": 29240 }, { "entropy": 5.505654907226562, "epoch": 2.6528483309143684, "grad_norm": 1.1796875, "learning_rate": 0.0004297565151843653, "loss": 4.8278, "mean_token_accuracy": 0.21815417110919952, "num_tokens": 60679158.0, "step": 29245 }, { "entropy": 5.558917665481568, "epoch": 2.6533018867924527, "grad_norm": 1.1796875, "learning_rate": 0.0004297330262577659, "loss": 5.0417, "mean_token_accuracy": 0.20906615108251572, "num_tokens": 60689363.0, "step": 29250 }, { "entropy": 5.475180435180664, "epoch": 2.653755442670537, "grad_norm": 1.0625, "learning_rate": 0.0004297095341312479, "loss": 4.8121, "mean_token_accuracy": 0.22131693065166474, "num_tokens": 60699650.0, "step": 29255 }, { "entropy": 5.496839427947998, "epoch": 2.6542089985486212, "grad_norm": 1.2109375, "learning_rate": 0.0004296860388052974, "loss": 4.8889, "mean_token_accuracy": 0.21212936639785768, "num_tokens": 60709921.0, "step": 29260 }, { "entropy": 5.528440237045288, "epoch": 2.6546625544267055, "grad_norm": 1.078125, "learning_rate": 0.00042966254028040015, "loss": 4.8758, "mean_token_accuracy": 0.22641344219446183, "num_tokens": 60720112.0, "step": 29265 }, { "entropy": 5.483203601837158, "epoch": 2.65511611030479, "grad_norm": 1.2265625, "learning_rate": 0.00042963903855704216, "loss": 4.8446, "mean_token_accuracy": 0.211634162068367, "num_tokens": 60730604.0, "step": 29270 }, { "entropy": 5.45366358757019, "epoch": 2.6555696661828736, "grad_norm": 1.1484375, "learning_rate": 0.00042961553363570946, "loss": 4.8908, "mean_token_accuracy": 0.22004604935646058, "num_tokens": 60740896.0, "step": 29275 }, { "entropy": 5.551656723022461, "epoch": 2.656023222060958, "grad_norm": 1.2421875, "learning_rate": 0.0004295920255168881, "loss": 4.883, "mean_token_accuracy": 0.21988172382116317, "num_tokens": 60751771.0, "step": 29280 }, { "entropy": 5.566930103302002, "epoch": 2.656476777939042, "grad_norm": 1.1171875, "learning_rate": 0.00042956851420106423, "loss": 4.9581, "mean_token_accuracy": 0.2093845561146736, "num_tokens": 60762802.0, "step": 29285 }, { "entropy": 5.439630126953125, "epoch": 2.6569303338171264, "grad_norm": 1.15625, "learning_rate": 0.0004295449996887242, "loss": 4.8455, "mean_token_accuracy": 0.21708481758832932, "num_tokens": 60774102.0, "step": 29290 }, { "entropy": 5.499790906906128, "epoch": 2.65738388969521, "grad_norm": 1.1484375, "learning_rate": 0.0004295214819803541, "loss": 4.9405, "mean_token_accuracy": 0.2099471166729927, "num_tokens": 60785383.0, "step": 29295 }, { "entropy": 5.494332122802734, "epoch": 2.6578374455732945, "grad_norm": 1.1328125, "learning_rate": 0.00042949796107644053, "loss": 4.914, "mean_token_accuracy": 0.22100272476673127, "num_tokens": 60795173.0, "step": 29300 }, { "entropy": 5.522036218643189, "epoch": 2.6582910014513788, "grad_norm": 1.1015625, "learning_rate": 0.00042947443697746956, "loss": 4.894, "mean_token_accuracy": 0.21763916462659835, "num_tokens": 60805621.0, "step": 29305 }, { "entropy": 5.574655294418335, "epoch": 2.658744557329463, "grad_norm": 1.1953125, "learning_rate": 0.0004294509096839279, "loss": 5.0274, "mean_token_accuracy": 0.20500217974185944, "num_tokens": 60816799.0, "step": 29310 }, { "entropy": 5.445596599578858, "epoch": 2.6591981132075473, "grad_norm": 1.09375, "learning_rate": 0.00042942737919630215, "loss": 4.8604, "mean_token_accuracy": 0.217450875043869, "num_tokens": 60826827.0, "step": 29315 }, { "entropy": 5.509045076370239, "epoch": 2.6596516690856316, "grad_norm": 1.1640625, "learning_rate": 0.00042940384551507876, "loss": 4.9472, "mean_token_accuracy": 0.21547484397888184, "num_tokens": 60836567.0, "step": 29320 }, { "entropy": 5.538186740875244, "epoch": 2.6601052249637154, "grad_norm": 1.1640625, "learning_rate": 0.0004293803086407447, "loss": 4.9165, "mean_token_accuracy": 0.21494536697864533, "num_tokens": 60846723.0, "step": 29325 }, { "entropy": 5.5920497417449955, "epoch": 2.6605587808417996, "grad_norm": 1.2265625, "learning_rate": 0.0004293567685737863, "loss": 5.018, "mean_token_accuracy": 0.2082287684082985, "num_tokens": 60857434.0, "step": 29330 }, { "entropy": 5.564563655853272, "epoch": 2.661012336719884, "grad_norm": 1.2109375, "learning_rate": 0.00042933322531469074, "loss": 4.9636, "mean_token_accuracy": 0.21093194633722306, "num_tokens": 60868780.0, "step": 29335 }, { "entropy": 5.602622222900391, "epoch": 2.661465892597968, "grad_norm": 1.265625, "learning_rate": 0.00042930967886394456, "loss": 4.9582, "mean_token_accuracy": 0.21860561966896058, "num_tokens": 60879037.0, "step": 29340 }, { "entropy": 5.450182771682739, "epoch": 2.661919448476052, "grad_norm": 1.046875, "learning_rate": 0.000429286129222035, "loss": 4.9103, "mean_token_accuracy": 0.21577067524194718, "num_tokens": 60889543.0, "step": 29345 }, { "entropy": 5.4811704635620115, "epoch": 2.6623730043541363, "grad_norm": 1.0390625, "learning_rate": 0.000429262576389449, "loss": 4.904, "mean_token_accuracy": 0.21057627052068711, "num_tokens": 60900141.0, "step": 29350 }, { "entropy": 5.557174205780029, "epoch": 2.6628265602322205, "grad_norm": 1.203125, "learning_rate": 0.0004292390203666736, "loss": 4.9791, "mean_token_accuracy": 0.2155096486210823, "num_tokens": 60910244.0, "step": 29355 }, { "entropy": 5.484345149993897, "epoch": 2.663280116110305, "grad_norm": 1.1796875, "learning_rate": 0.000429215461154196, "loss": 4.8756, "mean_token_accuracy": 0.2236874520778656, "num_tokens": 60919908.0, "step": 29360 }, { "entropy": 5.5377521991729735, "epoch": 2.663733671988389, "grad_norm": 1.2578125, "learning_rate": 0.00042919189875250324, "loss": 4.916, "mean_token_accuracy": 0.21647603064775467, "num_tokens": 60929096.0, "step": 29365 }, { "entropy": 5.517966842651367, "epoch": 2.6641872278664733, "grad_norm": 1.046875, "learning_rate": 0.00042916833316208284, "loss": 4.9246, "mean_token_accuracy": 0.21016127467155457, "num_tokens": 60939346.0, "step": 29370 }, { "entropy": 5.524883985519409, "epoch": 2.6646407837445576, "grad_norm": 1.203125, "learning_rate": 0.0004291447643834219, "loss": 4.927, "mean_token_accuracy": 0.20598089843988418, "num_tokens": 60950364.0, "step": 29375 }, { "entropy": 5.523609447479248, "epoch": 2.6650943396226414, "grad_norm": 1.1953125, "learning_rate": 0.000429121192417008, "loss": 4.8652, "mean_token_accuracy": 0.22504774183034898, "num_tokens": 60960905.0, "step": 29380 }, { "entropy": 5.568932151794433, "epoch": 2.6655478955007257, "grad_norm": 1.1171875, "learning_rate": 0.00042909761726332864, "loss": 4.9353, "mean_token_accuracy": 0.2208971157670021, "num_tokens": 60971281.0, "step": 29385 }, { "entropy": 5.504688310623169, "epoch": 2.66600145137881, "grad_norm": 1.1484375, "learning_rate": 0.0004290740389228712, "loss": 4.8912, "mean_token_accuracy": 0.21884311884641647, "num_tokens": 60982522.0, "step": 29390 }, { "entropy": 5.47869553565979, "epoch": 2.6664550072568938, "grad_norm": 1.09375, "learning_rate": 0.00042905045739612347, "loss": 4.9432, "mean_token_accuracy": 0.21246335953474044, "num_tokens": 60992738.0, "step": 29395 }, { "entropy": 5.577544403076172, "epoch": 2.666908563134978, "grad_norm": 1.171875, "learning_rate": 0.00042902687268357297, "loss": 5.0463, "mean_token_accuracy": 0.21005794554948806, "num_tokens": 61003665.0, "step": 29400 }, { "entropy": 5.6628200054168705, "epoch": 2.6673621190130623, "grad_norm": 1.1640625, "learning_rate": 0.00042900328478570745, "loss": 5.0274, "mean_token_accuracy": 0.2140689492225647, "num_tokens": 61014663.0, "step": 29405 }, { "entropy": 5.556534337997436, "epoch": 2.6678156748911466, "grad_norm": 1.21875, "learning_rate": 0.0004289796937030148, "loss": 4.8529, "mean_token_accuracy": 0.21854888051748275, "num_tokens": 61024916.0, "step": 29410 }, { "entropy": 5.451074457168579, "epoch": 2.668269230769231, "grad_norm": 1.203125, "learning_rate": 0.00042895609943598286, "loss": 4.8574, "mean_token_accuracy": 0.21569318622350692, "num_tokens": 61035043.0, "step": 29415 }, { "entropy": 5.4901340961456295, "epoch": 2.668722786647315, "grad_norm": 1.203125, "learning_rate": 0.0004289325019850995, "loss": 4.9729, "mean_token_accuracy": 0.21336960047483444, "num_tokens": 61046153.0, "step": 29420 }, { "entropy": 5.576411485671997, "epoch": 2.6691763425253994, "grad_norm": 1.140625, "learning_rate": 0.0004289089013508528, "loss": 4.8944, "mean_token_accuracy": 0.2169823244214058, "num_tokens": 61057009.0, "step": 29425 }, { "entropy": 5.614254379272461, "epoch": 2.669629898403483, "grad_norm": 1.15625, "learning_rate": 0.0004288852975337308, "loss": 5.0404, "mean_token_accuracy": 0.2043972358107567, "num_tokens": 61068514.0, "step": 29430 }, { "entropy": 5.562333679199218, "epoch": 2.6700834542815675, "grad_norm": 1.171875, "learning_rate": 0.00042886169053422165, "loss": 4.9326, "mean_token_accuracy": 0.21562980115413666, "num_tokens": 61078902.0, "step": 29435 }, { "entropy": 5.517271566390991, "epoch": 2.6705370101596517, "grad_norm": 1.2265625, "learning_rate": 0.0004288380803528135, "loss": 4.9556, "mean_token_accuracy": 0.21599119454622268, "num_tokens": 61089216.0, "step": 29440 }, { "entropy": 5.464359855651855, "epoch": 2.670990566037736, "grad_norm": 1.1484375, "learning_rate": 0.00042881446698999465, "loss": 4.8516, "mean_token_accuracy": 0.2214545950293541, "num_tokens": 61098470.0, "step": 29445 }, { "entropy": 5.635874605178833, "epoch": 2.67144412191582, "grad_norm": 1.171875, "learning_rate": 0.0004287908504462534, "loss": 5.0225, "mean_token_accuracy": 0.22053878307342528, "num_tokens": 61108694.0, "step": 29450 }, { "entropy": 5.4864819049835205, "epoch": 2.671897677793904, "grad_norm": 1.15625, "learning_rate": 0.00042876723072207825, "loss": 4.9128, "mean_token_accuracy": 0.21818741112947465, "num_tokens": 61119389.0, "step": 29455 }, { "entropy": 5.5896800518035885, "epoch": 2.6723512336719883, "grad_norm": 1.21875, "learning_rate": 0.00042874360781795757, "loss": 4.9856, "mean_token_accuracy": 0.20870788842439653, "num_tokens": 61130491.0, "step": 29460 }, { "entropy": 5.5717939853668215, "epoch": 2.6728047895500726, "grad_norm": 1.1796875, "learning_rate": 0.00042871998173437987, "loss": 4.9344, "mean_token_accuracy": 0.218288154900074, "num_tokens": 61140404.0, "step": 29465 }, { "entropy": 5.59447603225708, "epoch": 2.673258345428157, "grad_norm": 1.171875, "learning_rate": 0.00042869635247183373, "loss": 4.9971, "mean_token_accuracy": 0.21020450294017792, "num_tokens": 61150777.0, "step": 29470 }, { "entropy": 5.499708938598633, "epoch": 2.673711901306241, "grad_norm": 1.2265625, "learning_rate": 0.00042867272003080793, "loss": 4.9243, "mean_token_accuracy": 0.21499894857406615, "num_tokens": 61160685.0, "step": 29475 }, { "entropy": 5.554017543792725, "epoch": 2.674165457184325, "grad_norm": 1.171875, "learning_rate": 0.0004286490844117911, "loss": 4.9433, "mean_token_accuracy": 0.21183238476514815, "num_tokens": 61170553.0, "step": 29480 }, { "entropy": 5.596896743774414, "epoch": 2.6746190130624092, "grad_norm": 1.125, "learning_rate": 0.00042862544561527203, "loss": 4.9662, "mean_token_accuracy": 0.21244041323661805, "num_tokens": 61181396.0, "step": 29485 }, { "entropy": 5.547948932647705, "epoch": 2.6750725689404935, "grad_norm": 1.171875, "learning_rate": 0.0004286018036417396, "loss": 4.9479, "mean_token_accuracy": 0.2158227324485779, "num_tokens": 61192315.0, "step": 29490 }, { "entropy": 5.5333428382873535, "epoch": 2.6755261248185778, "grad_norm": 1.1484375, "learning_rate": 0.00042857815849168277, "loss": 4.9123, "mean_token_accuracy": 0.2198034092783928, "num_tokens": 61202719.0, "step": 29495 }, { "entropy": 5.429728698730469, "epoch": 2.6759796806966616, "grad_norm": 1.28125, "learning_rate": 0.0004285545101655904, "loss": 4.8207, "mean_token_accuracy": 0.22307713627815245, "num_tokens": 61212703.0, "step": 29500 }, { "entropy": 5.4103169441223145, "epoch": 2.676433236574746, "grad_norm": 1.09375, "learning_rate": 0.0004285308586639517, "loss": 4.7825, "mean_token_accuracy": 0.2283257484436035, "num_tokens": 61222406.0, "step": 29505 }, { "entropy": 5.518270969390869, "epoch": 2.67688679245283, "grad_norm": 1.203125, "learning_rate": 0.00042850720398725575, "loss": 4.995, "mean_token_accuracy": 0.2073739618062973, "num_tokens": 61232758.0, "step": 29510 }, { "entropy": 5.518177556991577, "epoch": 2.6773403483309144, "grad_norm": 1.1875, "learning_rate": 0.00042848354613599164, "loss": 4.8975, "mean_token_accuracy": 0.21801682710647582, "num_tokens": 61243715.0, "step": 29515 }, { "entropy": 5.573863220214844, "epoch": 2.6777939042089987, "grad_norm": 1.0390625, "learning_rate": 0.00042845988511064863, "loss": 4.9161, "mean_token_accuracy": 0.2211415484547615, "num_tokens": 61254669.0, "step": 29520 }, { "entropy": 5.512311601638794, "epoch": 2.678247460087083, "grad_norm": 1.1484375, "learning_rate": 0.00042843622091171625, "loss": 4.9131, "mean_token_accuracy": 0.21606892943382264, "num_tokens": 61264377.0, "step": 29525 }, { "entropy": 5.44507794380188, "epoch": 2.6787010159651667, "grad_norm": 1.1015625, "learning_rate": 0.0004284125535396836, "loss": 4.9129, "mean_token_accuracy": 0.21446050703525543, "num_tokens": 61275348.0, "step": 29530 }, { "entropy": 5.472241497039795, "epoch": 2.679154571843251, "grad_norm": 1.2109375, "learning_rate": 0.00042838888299504024, "loss": 4.8036, "mean_token_accuracy": 0.2257521390914917, "num_tokens": 61285579.0, "step": 29535 }, { "entropy": 5.507660722732544, "epoch": 2.6796081277213353, "grad_norm": 1.109375, "learning_rate": 0.00042836520927827575, "loss": 4.8648, "mean_token_accuracy": 0.21811010986566542, "num_tokens": 61296037.0, "step": 29540 }, { "entropy": 5.498992300033569, "epoch": 2.6800616835994195, "grad_norm": 1.2421875, "learning_rate": 0.0004283415323898797, "loss": 4.8609, "mean_token_accuracy": 0.22554197311401367, "num_tokens": 61305882.0, "step": 29545 }, { "entropy": 5.4819655418396, "epoch": 2.6805152394775034, "grad_norm": 1.0859375, "learning_rate": 0.00042831785233034156, "loss": 4.8475, "mean_token_accuracy": 0.2201354831457138, "num_tokens": 61317117.0, "step": 29550 }, { "entropy": 5.56939115524292, "epoch": 2.6809687953555876, "grad_norm": 1.203125, "learning_rate": 0.00042829416910015116, "loss": 4.9409, "mean_token_accuracy": 0.21144878417253493, "num_tokens": 61328190.0, "step": 29555 }, { "entropy": 5.476047325134277, "epoch": 2.681422351233672, "grad_norm": 1.171875, "learning_rate": 0.00042827048269979834, "loss": 4.9291, "mean_token_accuracy": 0.21556256860494613, "num_tokens": 61337978.0, "step": 29560 }, { "entropy": 5.57666425704956, "epoch": 2.681875907111756, "grad_norm": 1.1328125, "learning_rate": 0.0004282467931297729, "loss": 4.9764, "mean_token_accuracy": 0.21204071193933488, "num_tokens": 61348523.0, "step": 29565 }, { "entropy": 5.495347881317139, "epoch": 2.6823294629898404, "grad_norm": 1.0859375, "learning_rate": 0.0004282231003905647, "loss": 4.8087, "mean_token_accuracy": 0.22539813816547394, "num_tokens": 61359250.0, "step": 29570 }, { "entropy": 5.457917070388794, "epoch": 2.6827830188679247, "grad_norm": 1.1640625, "learning_rate": 0.00042819940448266376, "loss": 4.8283, "mean_token_accuracy": 0.22017841637134553, "num_tokens": 61369999.0, "step": 29575 }, { "entropy": 5.571237277984619, "epoch": 2.683236574746009, "grad_norm": 1.1328125, "learning_rate": 0.00042817570540656003, "loss": 4.9665, "mean_token_accuracy": 0.2068251058459282, "num_tokens": 61380279.0, "step": 29580 }, { "entropy": 5.486316204071045, "epoch": 2.683690130624093, "grad_norm": 1.328125, "learning_rate": 0.0004281520031627438, "loss": 4.9157, "mean_token_accuracy": 0.22008431553840638, "num_tokens": 61389794.0, "step": 29585 }, { "entropy": 5.570743894577026, "epoch": 2.684143686502177, "grad_norm": 1.140625, "learning_rate": 0.00042812829775170497, "loss": 5.0338, "mean_token_accuracy": 0.2086791440844536, "num_tokens": 61401136.0, "step": 29590 }, { "entropy": 5.533440780639649, "epoch": 2.6845972423802613, "grad_norm": 1.2421875, "learning_rate": 0.00042810458917393404, "loss": 4.9644, "mean_token_accuracy": 0.2123529940843582, "num_tokens": 61412830.0, "step": 29595 }, { "entropy": 5.526773595809937, "epoch": 2.6850507982583456, "grad_norm": 1.203125, "learning_rate": 0.0004280808774299211, "loss": 4.8528, "mean_token_accuracy": 0.22239815294742585, "num_tokens": 61422168.0, "step": 29600 }, { "entropy": 5.497328233718872, "epoch": 2.6855043541364294, "grad_norm": 1.2421875, "learning_rate": 0.00042805716252015665, "loss": 4.8812, "mean_token_accuracy": 0.21743890643119812, "num_tokens": 61432471.0, "step": 29605 }, { "entropy": 5.522314262390137, "epoch": 2.6859579100145137, "grad_norm": 1.296875, "learning_rate": 0.00042803344444513106, "loss": 4.9081, "mean_token_accuracy": 0.21788983941078185, "num_tokens": 61443402.0, "step": 29610 }, { "entropy": 5.573214197158814, "epoch": 2.686411465892598, "grad_norm": 1.1484375, "learning_rate": 0.0004280097232053349, "loss": 4.8957, "mean_token_accuracy": 0.21274835020303726, "num_tokens": 61454465.0, "step": 29615 }, { "entropy": 5.5291448593139645, "epoch": 2.686865021770682, "grad_norm": 1.078125, "learning_rate": 0.0004279859988012586, "loss": 4.9406, "mean_token_accuracy": 0.21383485645055772, "num_tokens": 61464671.0, "step": 29620 }, { "entropy": 5.489496088027954, "epoch": 2.6873185776487665, "grad_norm": 1.125, "learning_rate": 0.0004279622712333929, "loss": 4.8972, "mean_token_accuracy": 0.22458026856184005, "num_tokens": 61474940.0, "step": 29625 }, { "entropy": 5.547333765029907, "epoch": 2.6877721335268507, "grad_norm": 1.140625, "learning_rate": 0.0004279385405022284, "loss": 4.9479, "mean_token_accuracy": 0.21095149964094162, "num_tokens": 61485240.0, "step": 29630 }, { "entropy": 5.52120008468628, "epoch": 2.6882256894049346, "grad_norm": 1.109375, "learning_rate": 0.000427914806608256, "loss": 4.8878, "mean_token_accuracy": 0.21645450443029404, "num_tokens": 61495382.0, "step": 29635 }, { "entropy": 5.500570821762085, "epoch": 2.688679245283019, "grad_norm": 1.140625, "learning_rate": 0.0004278910695519663, "loss": 4.8472, "mean_token_accuracy": 0.22481829822063445, "num_tokens": 61505372.0, "step": 29640 }, { "entropy": 5.522217464447022, "epoch": 2.689132801161103, "grad_norm": 1.171875, "learning_rate": 0.00042786732933385046, "loss": 4.9048, "mean_token_accuracy": 0.2189964845776558, "num_tokens": 61516039.0, "step": 29645 }, { "entropy": 5.5330604076385494, "epoch": 2.6895863570391874, "grad_norm": 1.1953125, "learning_rate": 0.0004278435859543992, "loss": 4.9809, "mean_token_accuracy": 0.21166449785232544, "num_tokens": 61525435.0, "step": 29650 }, { "entropy": 5.574708366394043, "epoch": 2.690039912917271, "grad_norm": 1.1640625, "learning_rate": 0.0004278198394141037, "loss": 4.9164, "mean_token_accuracy": 0.20987374633550643, "num_tokens": 61534714.0, "step": 29655 }, { "entropy": 5.593967437744141, "epoch": 2.6904934687953554, "grad_norm": 1.140625, "learning_rate": 0.00042779608971345496, "loss": 5.0514, "mean_token_accuracy": 0.20717464089393617, "num_tokens": 61545841.0, "step": 29660 }, { "entropy": 5.476044416427612, "epoch": 2.6909470246734397, "grad_norm": 1.1953125, "learning_rate": 0.00042777233685294407, "loss": 4.8315, "mean_token_accuracy": 0.22667205035686494, "num_tokens": 61555355.0, "step": 29665 }, { "entropy": 5.532976293563843, "epoch": 2.691400580551524, "grad_norm": 1.296875, "learning_rate": 0.00042774858083306246, "loss": 4.9394, "mean_token_accuracy": 0.21693466305732728, "num_tokens": 61565474.0, "step": 29670 }, { "entropy": 5.542480993270874, "epoch": 2.6918541364296082, "grad_norm": 1.140625, "learning_rate": 0.00042772482165430117, "loss": 4.8599, "mean_token_accuracy": 0.22625344693660737, "num_tokens": 61575631.0, "step": 29675 }, { "entropy": 5.493725061416626, "epoch": 2.6923076923076925, "grad_norm": 1.1328125, "learning_rate": 0.00042770105931715167, "loss": 4.9065, "mean_token_accuracy": 0.216996268928051, "num_tokens": 61586398.0, "step": 29680 }, { "entropy": 5.501855659484863, "epoch": 2.6927612481857763, "grad_norm": 1.1328125, "learning_rate": 0.0004276772938221054, "loss": 4.8021, "mean_token_accuracy": 0.22439393103122712, "num_tokens": 61596630.0, "step": 29685 }, { "entropy": 5.536890649795533, "epoch": 2.6932148040638606, "grad_norm": 1.203125, "learning_rate": 0.0004276535251696537, "loss": 4.9537, "mean_token_accuracy": 0.21917167603969573, "num_tokens": 61605965.0, "step": 29690 }, { "entropy": 5.5594219207763675, "epoch": 2.693668359941945, "grad_norm": 1.125, "learning_rate": 0.0004276297533602883, "loss": 4.9788, "mean_token_accuracy": 0.21620827466249465, "num_tokens": 61616973.0, "step": 29695 }, { "entropy": 5.590553903579712, "epoch": 2.694121915820029, "grad_norm": 1.21875, "learning_rate": 0.00042760597839450057, "loss": 4.9452, "mean_token_accuracy": 0.21248731911182403, "num_tokens": 61627420.0, "step": 29700 }, { "entropy": 5.542947006225586, "epoch": 2.694575471698113, "grad_norm": 1.171875, "learning_rate": 0.0004275822002727824, "loss": 4.9014, "mean_token_accuracy": 0.2199798196554184, "num_tokens": 61638315.0, "step": 29705 }, { "entropy": 5.486486625671387, "epoch": 2.6950290275761972, "grad_norm": 1.140625, "learning_rate": 0.00042755841899562544, "loss": 4.919, "mean_token_accuracy": 0.2210564434528351, "num_tokens": 61649294.0, "step": 29710 }, { "entropy": 5.570138597488404, "epoch": 2.6954825834542815, "grad_norm": 1.171875, "learning_rate": 0.00042753463456352155, "loss": 4.9577, "mean_token_accuracy": 0.20820011645555497, "num_tokens": 61660312.0, "step": 29715 }, { "entropy": 5.529924964904785, "epoch": 2.6959361393323658, "grad_norm": 1.15625, "learning_rate": 0.0004275108469769625, "loss": 4.9169, "mean_token_accuracy": 0.21851568520069123, "num_tokens": 61670539.0, "step": 29720 }, { "entropy": 5.526054048538208, "epoch": 2.69638969521045, "grad_norm": 1.1796875, "learning_rate": 0.00042748705623644025, "loss": 4.8577, "mean_token_accuracy": 0.22114203870296478, "num_tokens": 61679613.0, "step": 29725 }, { "entropy": 5.582476472854614, "epoch": 2.6968432510885343, "grad_norm": 1.28125, "learning_rate": 0.0004274632623424468, "loss": 4.9211, "mean_token_accuracy": 0.21281811445951462, "num_tokens": 61689714.0, "step": 29730 }, { "entropy": 5.610582447052002, "epoch": 2.6972968069666186, "grad_norm": 1.1875, "learning_rate": 0.00042743946529547435, "loss": 4.9911, "mean_token_accuracy": 0.21272632777690886, "num_tokens": 61700701.0, "step": 29735 }, { "entropy": 5.568483972549439, "epoch": 2.6977503628447024, "grad_norm": 1.1171875, "learning_rate": 0.0004274156650960148, "loss": 4.9582, "mean_token_accuracy": 0.21539850383996964, "num_tokens": 61711403.0, "step": 29740 }, { "entropy": 5.4400615215301515, "epoch": 2.6982039187227866, "grad_norm": 1.125, "learning_rate": 0.0004273918617445605, "loss": 4.7753, "mean_token_accuracy": 0.21845744401216508, "num_tokens": 61721787.0, "step": 29745 }, { "entropy": 5.622704935073853, "epoch": 2.698657474600871, "grad_norm": 1.09375, "learning_rate": 0.00042736805524160363, "loss": 5.0056, "mean_token_accuracy": 0.21351802498102188, "num_tokens": 61732702.0, "step": 29750 }, { "entropy": 5.507934045791626, "epoch": 2.6991110304789547, "grad_norm": 1.1796875, "learning_rate": 0.00042734424558763656, "loss": 4.9116, "mean_token_accuracy": 0.21935366243124008, "num_tokens": 61743477.0, "step": 29755 }, { "entropy": 5.561422109603882, "epoch": 2.699564586357039, "grad_norm": 1.2421875, "learning_rate": 0.0004273204327831516, "loss": 4.9494, "mean_token_accuracy": 0.21048598736524582, "num_tokens": 61753620.0, "step": 29760 }, { "entropy": 5.554521656036377, "epoch": 2.7000181422351233, "grad_norm": 1.1484375, "learning_rate": 0.0004272966168286414, "loss": 4.8618, "mean_token_accuracy": 0.22496049851179123, "num_tokens": 61763678.0, "step": 29765 }, { "entropy": 5.558667373657227, "epoch": 2.7004716981132075, "grad_norm": 1.0234375, "learning_rate": 0.00042727279772459837, "loss": 4.9387, "mean_token_accuracy": 0.22454155385494232, "num_tokens": 61774419.0, "step": 29770 }, { "entropy": 5.567608070373535, "epoch": 2.700925253991292, "grad_norm": 1.21875, "learning_rate": 0.000427248975471515, "loss": 4.9722, "mean_token_accuracy": 0.20972986817359923, "num_tokens": 61785546.0, "step": 29775 }, { "entropy": 5.5971606254577635, "epoch": 2.701378809869376, "grad_norm": 1.109375, "learning_rate": 0.00042722515006988397, "loss": 4.8781, "mean_token_accuracy": 0.21897144764661788, "num_tokens": 61795846.0, "step": 29780 }, { "entropy": 5.560446834564209, "epoch": 2.7018323657474603, "grad_norm": 1.15625, "learning_rate": 0.0004272013215201982, "loss": 4.9513, "mean_token_accuracy": 0.21278668493032454, "num_tokens": 61806440.0, "step": 29785 }, { "entropy": 5.4758460521698, "epoch": 2.702285921625544, "grad_norm": 1.234375, "learning_rate": 0.00042717748982295015, "loss": 4.9121, "mean_token_accuracy": 0.21631584465503692, "num_tokens": 61815371.0, "step": 29790 }, { "entropy": 5.554646062850952, "epoch": 2.7027394775036284, "grad_norm": 1.15625, "learning_rate": 0.0004271536549786329, "loss": 4.8875, "mean_token_accuracy": 0.21848005950450897, "num_tokens": 61825225.0, "step": 29795 }, { "entropy": 5.545880651473999, "epoch": 2.7031930333817127, "grad_norm": 1.1640625, "learning_rate": 0.0004271298169877393, "loss": 4.9453, "mean_token_accuracy": 0.21982549279928207, "num_tokens": 61836705.0, "step": 29800 }, { "entropy": 5.5258073806762695, "epoch": 2.703646589259797, "grad_norm": 1.078125, "learning_rate": 0.0004271059758507624, "loss": 4.8926, "mean_token_accuracy": 0.21772266626358033, "num_tokens": 61847082.0, "step": 29805 }, { "entropy": 5.519984912872315, "epoch": 2.7041001451378808, "grad_norm": 1.1640625, "learning_rate": 0.00042708213156819505, "loss": 4.9233, "mean_token_accuracy": 0.21363881081342698, "num_tokens": 61857130.0, "step": 29810 }, { "entropy": 5.591157913208008, "epoch": 2.704553701015965, "grad_norm": 1.2265625, "learning_rate": 0.0004270582841405305, "loss": 4.9925, "mean_token_accuracy": 0.21570713967084884, "num_tokens": 61866796.0, "step": 29815 }, { "entropy": 5.580596446990967, "epoch": 2.7050072568940493, "grad_norm": 1.2109375, "learning_rate": 0.0004270344335682618, "loss": 4.9438, "mean_token_accuracy": 0.20958711504936217, "num_tokens": 61876356.0, "step": 29820 }, { "entropy": 5.5217150211334225, "epoch": 2.7054608127721336, "grad_norm": 1.09375, "learning_rate": 0.00042701057985188235, "loss": 4.9662, "mean_token_accuracy": 0.20681913793087006, "num_tokens": 61887374.0, "step": 29825 }, { "entropy": 5.577119207382202, "epoch": 2.705914368650218, "grad_norm": 1.21875, "learning_rate": 0.0004269867229918854, "loss": 4.9864, "mean_token_accuracy": 0.21167127788066864, "num_tokens": 61897376.0, "step": 29830 }, { "entropy": 5.587528562545776, "epoch": 2.706367924528302, "grad_norm": 1.1484375, "learning_rate": 0.00042696286298876424, "loss": 4.9986, "mean_token_accuracy": 0.20952281653881072, "num_tokens": 61908212.0, "step": 29835 }, { "entropy": 5.569792318344116, "epoch": 2.706821480406386, "grad_norm": 1.125, "learning_rate": 0.0004269389998430124, "loss": 5.0325, "mean_token_accuracy": 0.19804124683141708, "num_tokens": 61920699.0, "step": 29840 }, { "entropy": 5.557897853851318, "epoch": 2.70727503628447, "grad_norm": 1.1796875, "learning_rate": 0.0004269151335551233, "loss": 4.9516, "mean_token_accuracy": 0.2117043063044548, "num_tokens": 61931556.0, "step": 29845 }, { "entropy": 5.653575086593628, "epoch": 2.7077285921625545, "grad_norm": 1.1171875, "learning_rate": 0.0004268912641255905, "loss": 5.0665, "mean_token_accuracy": 0.21260046660900117, "num_tokens": 61941483.0, "step": 29850 }, { "entropy": 5.564683485031128, "epoch": 2.7081821480406387, "grad_norm": 1.1953125, "learning_rate": 0.00042686739155490763, "loss": 4.8947, "mean_token_accuracy": 0.21681239902973176, "num_tokens": 61951262.0, "step": 29855 }, { "entropy": 5.5906154155731205, "epoch": 2.7086357039187225, "grad_norm": 1.171875, "learning_rate": 0.0004268435158435684, "loss": 4.978, "mean_token_accuracy": 0.2153024196624756, "num_tokens": 61962423.0, "step": 29860 }, { "entropy": 5.631505870819092, "epoch": 2.709089259796807, "grad_norm": 1.1484375, "learning_rate": 0.00042681963699206667, "loss": 5.0371, "mean_token_accuracy": 0.2059436097741127, "num_tokens": 61973276.0, "step": 29865 }, { "entropy": 5.515093469619751, "epoch": 2.709542815674891, "grad_norm": 1.140625, "learning_rate": 0.00042679575500089605, "loss": 4.8773, "mean_token_accuracy": 0.2180198147892952, "num_tokens": 61984369.0, "step": 29870 }, { "entropy": 5.506880426406861, "epoch": 2.7099963715529753, "grad_norm": 1.171875, "learning_rate": 0.0004267718698705506, "loss": 4.8558, "mean_token_accuracy": 0.21804390102624893, "num_tokens": 61994224.0, "step": 29875 }, { "entropy": 5.507638835906983, "epoch": 2.7104499274310596, "grad_norm": 1.1796875, "learning_rate": 0.0004267479816015242, "loss": 4.9346, "mean_token_accuracy": 0.2174692288041115, "num_tokens": 62004546.0, "step": 29880 }, { "entropy": 5.556619548797608, "epoch": 2.710903483309144, "grad_norm": 1.2890625, "learning_rate": 0.0004267240901943109, "loss": 4.9519, "mean_token_accuracy": 0.2190815657377243, "num_tokens": 62013924.0, "step": 29885 }, { "entropy": 5.539492416381836, "epoch": 2.7113570391872277, "grad_norm": 1.1484375, "learning_rate": 0.00042670019564940474, "loss": 4.9137, "mean_token_accuracy": 0.2149542674422264, "num_tokens": 62026150.0, "step": 29890 }, { "entropy": 5.576632261276245, "epoch": 2.711810595065312, "grad_norm": 1.3671875, "learning_rate": 0.0004266762979672998, "loss": 4.9346, "mean_token_accuracy": 0.2127609819173813, "num_tokens": 62036203.0, "step": 29895 }, { "entropy": 5.55012149810791, "epoch": 2.7122641509433962, "grad_norm": 1.1484375, "learning_rate": 0.00042665239714849044, "loss": 4.9283, "mean_token_accuracy": 0.21250315010547638, "num_tokens": 62046961.0, "step": 29900 }, { "entropy": 5.476844024658203, "epoch": 2.7127177068214805, "grad_norm": 1.03125, "learning_rate": 0.00042662849319347073, "loss": 4.8786, "mean_token_accuracy": 0.21491149961948394, "num_tokens": 62057365.0, "step": 29905 }, { "entropy": 5.493049144744873, "epoch": 2.7131712626995643, "grad_norm": 1.2265625, "learning_rate": 0.00042660458610273527, "loss": 4.888, "mean_token_accuracy": 0.21077376008033752, "num_tokens": 62067934.0, "step": 29910 }, { "entropy": 5.611263656616211, "epoch": 2.7136248185776486, "grad_norm": 1.2109375, "learning_rate": 0.0004265806758767783, "loss": 4.9911, "mean_token_accuracy": 0.20873421281576157, "num_tokens": 62077203.0, "step": 29915 }, { "entropy": 5.59975037574768, "epoch": 2.714078374455733, "grad_norm": 1.2734375, "learning_rate": 0.00042655676251609435, "loss": 4.924, "mean_token_accuracy": 0.21966552436351777, "num_tokens": 62087262.0, "step": 29920 }, { "entropy": 5.53824143409729, "epoch": 2.714531930333817, "grad_norm": 1.1953125, "learning_rate": 0.00042653284602117795, "loss": 4.9138, "mean_token_accuracy": 0.21824792325496672, "num_tokens": 62097931.0, "step": 29925 }, { "entropy": 5.53220419883728, "epoch": 2.7149854862119014, "grad_norm": 1.09375, "learning_rate": 0.0004265089263925236, "loss": 4.9908, "mean_token_accuracy": 0.21161436885595322, "num_tokens": 62109478.0, "step": 29930 }, { "entropy": 5.589300346374512, "epoch": 2.7154390420899857, "grad_norm": 1.078125, "learning_rate": 0.000426485003630626, "loss": 4.9974, "mean_token_accuracy": 0.21019331067800523, "num_tokens": 62120735.0, "step": 29935 }, { "entropy": 5.574778127670288, "epoch": 2.71589259796807, "grad_norm": 1.203125, "learning_rate": 0.0004264610777359801, "loss": 4.9333, "mean_token_accuracy": 0.2108905553817749, "num_tokens": 62130950.0, "step": 29940 }, { "entropy": 5.575260782241822, "epoch": 2.7163461538461537, "grad_norm": 1.1796875, "learning_rate": 0.0004264371487090804, "loss": 4.9283, "mean_token_accuracy": 0.21393319964408875, "num_tokens": 62141351.0, "step": 29945 }, { "entropy": 5.44889874458313, "epoch": 2.716799709724238, "grad_norm": 1.1640625, "learning_rate": 0.00042641321655042185, "loss": 4.8725, "mean_token_accuracy": 0.21684699207544328, "num_tokens": 62151388.0, "step": 29950 }, { "entropy": 5.568221807479858, "epoch": 2.7172532656023223, "grad_norm": 0.9921875, "learning_rate": 0.0004263892812604995, "loss": 5.0562, "mean_token_accuracy": 0.20715204775333404, "num_tokens": 62162809.0, "step": 29955 }, { "entropy": 5.513254261016845, "epoch": 2.7177068214804065, "grad_norm": 1.1953125, "learning_rate": 0.00042636534283980814, "loss": 4.9356, "mean_token_accuracy": 0.21289895176887513, "num_tokens": 62172738.0, "step": 29960 }, { "entropy": 5.632068824768067, "epoch": 2.7181603773584904, "grad_norm": 1.171875, "learning_rate": 0.000426341401288843, "loss": 5.0572, "mean_token_accuracy": 0.20962415337562562, "num_tokens": 62182508.0, "step": 29965 }, { "entropy": 5.57133412361145, "epoch": 2.7186139332365746, "grad_norm": 1.046875, "learning_rate": 0.00042631745660809905, "loss": 5.0319, "mean_token_accuracy": 0.20589052587747575, "num_tokens": 62192873.0, "step": 29970 }, { "entropy": 5.5889201164245605, "epoch": 2.719067489114659, "grad_norm": 1.0703125, "learning_rate": 0.00042629350879807155, "loss": 5.0338, "mean_token_accuracy": 0.2085902824997902, "num_tokens": 62204727.0, "step": 29975 }, { "entropy": 5.56460976600647, "epoch": 2.719521044992743, "grad_norm": 1.171875, "learning_rate": 0.00042626955785925576, "loss": 4.9357, "mean_token_accuracy": 0.21326752454042436, "num_tokens": 62214268.0, "step": 29980 }, { "entropy": 5.594280147552491, "epoch": 2.7199746008708274, "grad_norm": 1.15625, "learning_rate": 0.00042624560379214693, "loss": 4.9888, "mean_token_accuracy": 0.20895089358091354, "num_tokens": 62224756.0, "step": 29985 }, { "entropy": 5.602207279205322, "epoch": 2.7204281567489117, "grad_norm": 1.2734375, "learning_rate": 0.0004262216465972405, "loss": 4.9199, "mean_token_accuracy": 0.2133926346898079, "num_tokens": 62234065.0, "step": 29990 }, { "entropy": 5.558912038803101, "epoch": 2.7208817126269955, "grad_norm": 1.171875, "learning_rate": 0.0004261976862750318, "loss": 4.929, "mean_token_accuracy": 0.22078927904367446, "num_tokens": 62243732.0, "step": 29995 }, { "entropy": 5.564157962799072, "epoch": 2.72133526850508, "grad_norm": 1.2890625, "learning_rate": 0.0004261737228260165, "loss": 4.9313, "mean_token_accuracy": 0.2240482360124588, "num_tokens": 62253461.0, "step": 30000 }, { "epoch": 2.72133526850508, "eval_entropy": 5.240016961205599, "eval_loss": 4.978549957275391, "eval_mean_token_accuracy": 0.22184979436219548, "eval_num_tokens": 62253461.0, "eval_runtime": 20.303, "eval_samples_per_second": 1741.615, "eval_steps_per_second": 217.702, "step": 30000 }, { "entropy": 5.566419315338135, "epoch": 2.721788824383164, "grad_norm": 1.171875, "learning_rate": 0.0004261497562506901, "loss": 4.9649, "mean_token_accuracy": 0.21412499994039536, "num_tokens": 62263830.0, "step": 30005 }, { "entropy": 5.478595304489136, "epoch": 2.7222423802612483, "grad_norm": 1.2265625, "learning_rate": 0.0004261257865495483, "loss": 4.8865, "mean_token_accuracy": 0.2191891446709633, "num_tokens": 62274383.0, "step": 30010 }, { "entropy": 5.643680810928345, "epoch": 2.722695936139332, "grad_norm": 1.1015625, "learning_rate": 0.0004261018137230865, "loss": 5.0865, "mean_token_accuracy": 0.19756740033626558, "num_tokens": 62286476.0, "step": 30015 }, { "entropy": 5.665280103683472, "epoch": 2.7231494920174164, "grad_norm": 1.125, "learning_rate": 0.00042607783777180085, "loss": 4.9884, "mean_token_accuracy": 0.2095344066619873, "num_tokens": 62296192.0, "step": 30020 }, { "entropy": 5.520650100708008, "epoch": 2.7236030478955007, "grad_norm": 1.2265625, "learning_rate": 0.00042605385869618693, "loss": 4.8991, "mean_token_accuracy": 0.22464792877435685, "num_tokens": 62305300.0, "step": 30025 }, { "entropy": 5.546018743515015, "epoch": 2.724056603773585, "grad_norm": 1.21875, "learning_rate": 0.0004260298764967408, "loss": 4.903, "mean_token_accuracy": 0.21652857214212418, "num_tokens": 62316802.0, "step": 30030 }, { "entropy": 5.467512941360473, "epoch": 2.724510159651669, "grad_norm": 1.1875, "learning_rate": 0.0004260058911739583, "loss": 4.9162, "mean_token_accuracy": 0.21453212946653366, "num_tokens": 62326444.0, "step": 30035 }, { "entropy": 5.532042646408081, "epoch": 2.7249637155297535, "grad_norm": 1.0859375, "learning_rate": 0.00042598190272833547, "loss": 4.8548, "mean_token_accuracy": 0.21847527623176574, "num_tokens": 62336872.0, "step": 30040 }, { "entropy": 5.478587579727173, "epoch": 2.7254172714078373, "grad_norm": 1.0703125, "learning_rate": 0.0004259579111603685, "loss": 4.8263, "mean_token_accuracy": 0.21862645894289018, "num_tokens": 62346771.0, "step": 30045 }, { "entropy": 5.543378257751465, "epoch": 2.7258708272859216, "grad_norm": 1.1484375, "learning_rate": 0.00042593391647055334, "loss": 4.9419, "mean_token_accuracy": 0.21706598103046418, "num_tokens": 62357503.0, "step": 30050 }, { "entropy": 5.442430257797241, "epoch": 2.726324383164006, "grad_norm": 1.21875, "learning_rate": 0.0004259099186593864, "loss": 4.8347, "mean_token_accuracy": 0.22069754898548127, "num_tokens": 62367664.0, "step": 30055 }, { "entropy": 5.570179510116577, "epoch": 2.72677793904209, "grad_norm": 1.203125, "learning_rate": 0.0004258859177273639, "loss": 4.9074, "mean_token_accuracy": 0.21304928362369538, "num_tokens": 62376924.0, "step": 30060 }, { "entropy": 5.5092486381530765, "epoch": 2.727231494920174, "grad_norm": 1.125, "learning_rate": 0.0004258619136749821, "loss": 4.825, "mean_token_accuracy": 0.22234923988580704, "num_tokens": 62387529.0, "step": 30065 }, { "entropy": 5.494977331161499, "epoch": 2.727685050798258, "grad_norm": 1.1640625, "learning_rate": 0.0004258379065027375, "loss": 4.8933, "mean_token_accuracy": 0.2205989897251129, "num_tokens": 62397833.0, "step": 30070 }, { "entropy": 5.570089197158813, "epoch": 2.7281386066763424, "grad_norm": 1.1953125, "learning_rate": 0.0004258138962111266, "loss": 4.9613, "mean_token_accuracy": 0.20982608199119568, "num_tokens": 62409022.0, "step": 30075 }, { "entropy": 5.552255058288575, "epoch": 2.7285921625544267, "grad_norm": 1.1953125, "learning_rate": 0.0004257898828006459, "loss": 4.9545, "mean_token_accuracy": 0.2039222925901413, "num_tokens": 62419105.0, "step": 30080 }, { "entropy": 5.5453815937042235, "epoch": 2.729045718432511, "grad_norm": 1.203125, "learning_rate": 0.0004257658662717919, "loss": 4.924, "mean_token_accuracy": 0.22040488123893737, "num_tokens": 62428371.0, "step": 30085 }, { "entropy": 5.533915662765503, "epoch": 2.7294992743105952, "grad_norm": 1.15625, "learning_rate": 0.0004257418466250615, "loss": 4.8964, "mean_token_accuracy": 0.21438532173633576, "num_tokens": 62439301.0, "step": 30090 }, { "entropy": 5.5338358879089355, "epoch": 2.7299528301886795, "grad_norm": 1.1328125, "learning_rate": 0.00042571782386095124, "loss": 4.8888, "mean_token_accuracy": 0.21243853271007537, "num_tokens": 62449450.0, "step": 30095 }, { "entropy": 5.5330808639526365, "epoch": 2.7304063860667633, "grad_norm": 1.421875, "learning_rate": 0.00042569379797995793, "loss": 4.9022, "mean_token_accuracy": 0.21238136291503906, "num_tokens": 62461051.0, "step": 30100 }, { "entropy": 5.5157959938049315, "epoch": 2.7308599419448476, "grad_norm": 1.2109375, "learning_rate": 0.0004256697689825785, "loss": 4.8721, "mean_token_accuracy": 0.21956984251737593, "num_tokens": 62471755.0, "step": 30105 }, { "entropy": 5.516527462005615, "epoch": 2.731313497822932, "grad_norm": 1.1953125, "learning_rate": 0.00042564573686930987, "loss": 4.8948, "mean_token_accuracy": 0.217100889980793, "num_tokens": 62482060.0, "step": 30110 }, { "entropy": 5.555571222305298, "epoch": 2.7317670537010157, "grad_norm": 1.09375, "learning_rate": 0.000425621701640649, "loss": 4.9483, "mean_token_accuracy": 0.21580011546611785, "num_tokens": 62493735.0, "step": 30115 }, { "entropy": 5.553857326507568, "epoch": 2.7322206095791, "grad_norm": 1.1015625, "learning_rate": 0.000425597663297093, "loss": 4.9611, "mean_token_accuracy": 0.21320728808641434, "num_tokens": 62504582.0, "step": 30120 }, { "entropy": 5.464041900634766, "epoch": 2.7326741654571842, "grad_norm": 1.125, "learning_rate": 0.0004255736218391389, "loss": 4.886, "mean_token_accuracy": 0.21035362780094147, "num_tokens": 62516665.0, "step": 30125 }, { "entropy": 5.546331739425659, "epoch": 2.7331277213352685, "grad_norm": 1.1640625, "learning_rate": 0.00042554957726728394, "loss": 4.9241, "mean_token_accuracy": 0.21485030353069307, "num_tokens": 62527745.0, "step": 30130 }, { "entropy": 5.546920204162598, "epoch": 2.7335812772133528, "grad_norm": 1.1015625, "learning_rate": 0.0004255255295820253, "loss": 4.9041, "mean_token_accuracy": 0.21797107309103012, "num_tokens": 62538622.0, "step": 30135 }, { "entropy": 5.524048519134522, "epoch": 2.734034833091437, "grad_norm": 1.2421875, "learning_rate": 0.00042550147878386044, "loss": 4.9073, "mean_token_accuracy": 0.217749984562397, "num_tokens": 62548302.0, "step": 30140 }, { "entropy": 5.467053365707398, "epoch": 2.7344883889695213, "grad_norm": 1.1796875, "learning_rate": 0.0004254774248732867, "loss": 4.8315, "mean_token_accuracy": 0.2245108738541603, "num_tokens": 62557150.0, "step": 30145 }, { "entropy": 5.684099578857422, "epoch": 2.734941944847605, "grad_norm": 1.1796875, "learning_rate": 0.00042545336785080126, "loss": 5.1213, "mean_token_accuracy": 0.20072893053293228, "num_tokens": 62568291.0, "step": 30150 }, { "entropy": 5.550385618209839, "epoch": 2.7353955007256894, "grad_norm": 1.34375, "learning_rate": 0.000425429307716902, "loss": 4.9251, "mean_token_accuracy": 0.21782101988792418, "num_tokens": 62579351.0, "step": 30155 }, { "entropy": 5.454301166534424, "epoch": 2.7358490566037736, "grad_norm": 1.1484375, "learning_rate": 0.00042540524447208625, "loss": 4.7901, "mean_token_accuracy": 0.22473580837249757, "num_tokens": 62588614.0, "step": 30160 }, { "entropy": 5.551528406143189, "epoch": 2.736302612481858, "grad_norm": 1.1953125, "learning_rate": 0.00042538117811685174, "loss": 4.9173, "mean_token_accuracy": 0.21639949083328247, "num_tokens": 62598844.0, "step": 30165 }, { "entropy": 5.562780809402466, "epoch": 2.7367561683599417, "grad_norm": 1.2109375, "learning_rate": 0.00042535710865169616, "loss": 4.9592, "mean_token_accuracy": 0.20663230270147323, "num_tokens": 62608722.0, "step": 30170 }, { "entropy": 5.493654251098633, "epoch": 2.737209724238026, "grad_norm": 1.3828125, "learning_rate": 0.0004253330360771173, "loss": 4.8539, "mean_token_accuracy": 0.21182840168476105, "num_tokens": 62618712.0, "step": 30175 }, { "entropy": 5.565095281600952, "epoch": 2.7376632801161103, "grad_norm": 1.140625, "learning_rate": 0.00042530896039361284, "loss": 5.0466, "mean_token_accuracy": 0.20055664628744124, "num_tokens": 62629329.0, "step": 30180 }, { "entropy": 5.5933506965637205, "epoch": 2.7381168359941945, "grad_norm": 1.171875, "learning_rate": 0.00042528488160168077, "loss": 4.9593, "mean_token_accuracy": 0.20959201008081435, "num_tokens": 62639644.0, "step": 30185 }, { "entropy": 5.575213050842285, "epoch": 2.738570391872279, "grad_norm": 1.1875, "learning_rate": 0.00042526079970181915, "loss": 4.9907, "mean_token_accuracy": 0.2056760534644127, "num_tokens": 62650979.0, "step": 30190 }, { "entropy": 5.571151208877564, "epoch": 2.739023947750363, "grad_norm": 1.2109375, "learning_rate": 0.0004252367146945259, "loss": 5.0076, "mean_token_accuracy": 0.20874431729316711, "num_tokens": 62661163.0, "step": 30195 }, { "entropy": 5.550344657897949, "epoch": 2.739477503628447, "grad_norm": 1.0234375, "learning_rate": 0.00042521262658029905, "loss": 5.0236, "mean_token_accuracy": 0.20526358485221863, "num_tokens": 62672371.0, "step": 30200 }, { "entropy": 5.553168153762817, "epoch": 2.739931059506531, "grad_norm": 1.1640625, "learning_rate": 0.00042518853535963673, "loss": 4.88, "mean_token_accuracy": 0.21575011759996415, "num_tokens": 62682521.0, "step": 30205 }, { "entropy": 5.525324964523316, "epoch": 2.7403846153846154, "grad_norm": 2.140625, "learning_rate": 0.00042516444103303736, "loss": 4.8192, "mean_token_accuracy": 0.22690353095531463, "num_tokens": 62692420.0, "step": 30210 }, { "entropy": 5.4934889793396, "epoch": 2.7408381712626997, "grad_norm": 1.1171875, "learning_rate": 0.00042514034360099907, "loss": 4.897, "mean_token_accuracy": 0.21617562919855118, "num_tokens": 62702686.0, "step": 30215 }, { "entropy": 5.556487083435059, "epoch": 2.7412917271407835, "grad_norm": 1.0859375, "learning_rate": 0.00042511624306402015, "loss": 4.9466, "mean_token_accuracy": 0.21402305215597153, "num_tokens": 62713262.0, "step": 30220 }, { "entropy": 5.552816247940063, "epoch": 2.7417452830188678, "grad_norm": 1.078125, "learning_rate": 0.0004250921394225992, "loss": 4.8883, "mean_token_accuracy": 0.21969353705644606, "num_tokens": 62724460.0, "step": 30225 }, { "entropy": 5.53007698059082, "epoch": 2.742198838896952, "grad_norm": 1.1640625, "learning_rate": 0.0004250680326772343, "loss": 4.9766, "mean_token_accuracy": 0.20912925153970718, "num_tokens": 62734190.0, "step": 30230 }, { "entropy": 5.541458940505981, "epoch": 2.7426523947750363, "grad_norm": 1.1953125, "learning_rate": 0.0004250439228284244, "loss": 4.9015, "mean_token_accuracy": 0.21260523200035095, "num_tokens": 62744323.0, "step": 30235 }, { "entropy": 5.5656445026397705, "epoch": 2.7431059506531206, "grad_norm": 1.1328125, "learning_rate": 0.00042501980987666807, "loss": 4.9242, "mean_token_accuracy": 0.2125800520181656, "num_tokens": 62753868.0, "step": 30240 }, { "entropy": 5.563860511779785, "epoch": 2.743559506531205, "grad_norm": 1.1484375, "learning_rate": 0.0004249956938224636, "loss": 5.0154, "mean_token_accuracy": 0.21010760962963104, "num_tokens": 62763954.0, "step": 30245 }, { "entropy": 5.526519346237182, "epoch": 2.7440130624092887, "grad_norm": 1.09375, "learning_rate": 0.00042497157466631015, "loss": 4.9028, "mean_token_accuracy": 0.22240310907363892, "num_tokens": 62774116.0, "step": 30250 }, { "entropy": 5.610444450378418, "epoch": 2.744466618287373, "grad_norm": 1.03125, "learning_rate": 0.00042494745240870626, "loss": 4.9849, "mean_token_accuracy": 0.204432912170887, "num_tokens": 62784939.0, "step": 30255 }, { "entropy": 5.535037660598755, "epoch": 2.744920174165457, "grad_norm": 1.125, "learning_rate": 0.00042492332705015075, "loss": 4.9394, "mean_token_accuracy": 0.21138351261615754, "num_tokens": 62794988.0, "step": 30260 }, { "entropy": 5.56043815612793, "epoch": 2.7453737300435415, "grad_norm": 1.1484375, "learning_rate": 0.00042489919859114273, "loss": 4.9401, "mean_token_accuracy": 0.21653874963521957, "num_tokens": 62804984.0, "step": 30265 }, { "entropy": 5.571105337142944, "epoch": 2.7458272859216253, "grad_norm": 1.2578125, "learning_rate": 0.00042487506703218104, "loss": 4.895, "mean_token_accuracy": 0.21171075403690337, "num_tokens": 62816401.0, "step": 30270 }, { "entropy": 5.511363458633423, "epoch": 2.7462808417997095, "grad_norm": 1.1640625, "learning_rate": 0.0004248509323737648, "loss": 4.8601, "mean_token_accuracy": 0.21492574214935303, "num_tokens": 62826411.0, "step": 30275 }, { "entropy": 5.572367000579834, "epoch": 2.746734397677794, "grad_norm": 1.21875, "learning_rate": 0.0004248267946163931, "loss": 4.9653, "mean_token_accuracy": 0.21042945235967636, "num_tokens": 62837228.0, "step": 30280 }, { "entropy": 5.502644634246826, "epoch": 2.747187953555878, "grad_norm": 1.0859375, "learning_rate": 0.00042480265376056506, "loss": 4.8542, "mean_token_accuracy": 0.22120752930641174, "num_tokens": 62847852.0, "step": 30285 }, { "entropy": 5.526437520980835, "epoch": 2.7476415094339623, "grad_norm": 1.1484375, "learning_rate": 0.00042477850980678, "loss": 4.972, "mean_token_accuracy": 0.20401092767715454, "num_tokens": 62859516.0, "step": 30290 }, { "entropy": 5.54732666015625, "epoch": 2.7480950653120466, "grad_norm": 1.125, "learning_rate": 0.0004247543627555372, "loss": 4.9328, "mean_token_accuracy": 0.21135311722755432, "num_tokens": 62869757.0, "step": 30295 }, { "entropy": 5.539496231079101, "epoch": 2.748548621190131, "grad_norm": 1.2890625, "learning_rate": 0.000424730212607336, "loss": 5.0011, "mean_token_accuracy": 0.21248133927583696, "num_tokens": 62879618.0, "step": 30300 }, { "entropy": 5.541743183135987, "epoch": 2.7490021770682147, "grad_norm": 1.0859375, "learning_rate": 0.0004247060593626758, "loss": 4.952, "mean_token_accuracy": 0.2070973351597786, "num_tokens": 62890491.0, "step": 30305 }, { "entropy": 5.618363523483277, "epoch": 2.749455732946299, "grad_norm": 1.1640625, "learning_rate": 0.0004246819030220562, "loss": 4.9626, "mean_token_accuracy": 0.22238344252109526, "num_tokens": 62899954.0, "step": 30310 }, { "entropy": 5.5683800220489506, "epoch": 2.7499092888243832, "grad_norm": 1.125, "learning_rate": 0.0004246577435859767, "loss": 4.9654, "mean_token_accuracy": 0.2128121241927147, "num_tokens": 62911857.0, "step": 30315 }, { "entropy": 5.523028326034546, "epoch": 2.7503628447024675, "grad_norm": 1.140625, "learning_rate": 0.0004246335810549369, "loss": 4.9061, "mean_token_accuracy": 0.21678196787834167, "num_tokens": 62922023.0, "step": 30320 }, { "entropy": 5.562381362915039, "epoch": 2.7508164005805513, "grad_norm": 1.171875, "learning_rate": 0.00042460941542943656, "loss": 4.9633, "mean_token_accuracy": 0.2209171712398529, "num_tokens": 62932845.0, "step": 30325 }, { "entropy": 5.541231632232666, "epoch": 2.7512699564586356, "grad_norm": 1.1015625, "learning_rate": 0.0004245852467099753, "loss": 4.9247, "mean_token_accuracy": 0.2103466272354126, "num_tokens": 62942881.0, "step": 30330 }, { "entropy": 5.500460386276245, "epoch": 2.75172351233672, "grad_norm": 1.1171875, "learning_rate": 0.0004245610748970531, "loss": 4.8643, "mean_token_accuracy": 0.21816278994083405, "num_tokens": 62953957.0, "step": 30335 }, { "entropy": 5.473409223556518, "epoch": 2.752177068214804, "grad_norm": 1.2421875, "learning_rate": 0.00042453689999116974, "loss": 4.8863, "mean_token_accuracy": 0.21897784769535064, "num_tokens": 62964803.0, "step": 30340 }, { "entropy": 5.517470407485962, "epoch": 2.7526306240928884, "grad_norm": 1.140625, "learning_rate": 0.0004245127219928252, "loss": 4.8847, "mean_token_accuracy": 0.21829183846712114, "num_tokens": 62975477.0, "step": 30345 }, { "entropy": 5.5250951766967775, "epoch": 2.7530841799709727, "grad_norm": 1.2578125, "learning_rate": 0.00042448854090251944, "loss": 4.9413, "mean_token_accuracy": 0.2134728580713272, "num_tokens": 62985430.0, "step": 30350 }, { "entropy": 5.511751508712768, "epoch": 2.7535377358490565, "grad_norm": 1.2265625, "learning_rate": 0.00042446435672075254, "loss": 4.9227, "mean_token_accuracy": 0.21664171665906906, "num_tokens": 62997493.0, "step": 30355 }, { "entropy": 5.600302267074585, "epoch": 2.7539912917271407, "grad_norm": 1.4453125, "learning_rate": 0.00042444016944802467, "loss": 5.0024, "mean_token_accuracy": 0.21506956368684768, "num_tokens": 63007573.0, "step": 30360 }, { "entropy": 5.571696424484253, "epoch": 2.754444847605225, "grad_norm": 1.2578125, "learning_rate": 0.00042441597908483603, "loss": 4.9588, "mean_token_accuracy": 0.21918165385723115, "num_tokens": 63018372.0, "step": 30365 }, { "entropy": 5.536999750137329, "epoch": 2.7548984034833093, "grad_norm": 1.125, "learning_rate": 0.0004243917856316869, "loss": 4.9039, "mean_token_accuracy": 0.21993626654148102, "num_tokens": 63028632.0, "step": 30370 }, { "entropy": 5.540465831756592, "epoch": 2.755351959361393, "grad_norm": 1.140625, "learning_rate": 0.00042436758908907747, "loss": 4.9455, "mean_token_accuracy": 0.2103507936000824, "num_tokens": 63038510.0, "step": 30375 }, { "entropy": 5.650352716445923, "epoch": 2.7558055152394774, "grad_norm": 1.28125, "learning_rate": 0.00042434338945750833, "loss": 5.0875, "mean_token_accuracy": 0.19803033471107484, "num_tokens": 63049375.0, "step": 30380 }, { "entropy": 5.579443025588989, "epoch": 2.7562590711175616, "grad_norm": 1.28125, "learning_rate": 0.00042431918673747974, "loss": 4.921, "mean_token_accuracy": 0.2144318550825119, "num_tokens": 63059422.0, "step": 30385 }, { "entropy": 5.586562728881836, "epoch": 2.756712626995646, "grad_norm": 1.171875, "learning_rate": 0.00042429498092949245, "loss": 4.9971, "mean_token_accuracy": 0.20266233384609222, "num_tokens": 63071101.0, "step": 30390 }, { "entropy": 5.507417058944702, "epoch": 2.75716618287373, "grad_norm": 1.1796875, "learning_rate": 0.0004242707720340468, "loss": 4.861, "mean_token_accuracy": 0.2204086571931839, "num_tokens": 63081104.0, "step": 30395 }, { "entropy": 5.5523826599121096, "epoch": 2.7576197387518144, "grad_norm": 1.2734375, "learning_rate": 0.0004242465600516436, "loss": 4.9579, "mean_token_accuracy": 0.21363636702299119, "num_tokens": 63091123.0, "step": 30400 }, { "entropy": 5.492327117919922, "epoch": 2.7580732946298983, "grad_norm": 1.078125, "learning_rate": 0.00042422234498278353, "loss": 4.9163, "mean_token_accuracy": 0.219136281311512, "num_tokens": 63101541.0, "step": 30405 }, { "entropy": 5.575545358657837, "epoch": 2.7585268505079825, "grad_norm": 1.109375, "learning_rate": 0.00042419812682796727, "loss": 5.0076, "mean_token_accuracy": 0.20531836450099944, "num_tokens": 63112012.0, "step": 30410 }, { "entropy": 5.580181217193603, "epoch": 2.758980406386067, "grad_norm": 1.15625, "learning_rate": 0.0004241739055876957, "loss": 4.9157, "mean_token_accuracy": 0.2149147555232048, "num_tokens": 63122021.0, "step": 30415 }, { "entropy": 5.637083959579468, "epoch": 2.759433962264151, "grad_norm": 1.125, "learning_rate": 0.00042414968126246985, "loss": 5.0196, "mean_token_accuracy": 0.21200834661722184, "num_tokens": 63132286.0, "step": 30420 }, { "entropy": 5.521076107025147, "epoch": 2.759887518142235, "grad_norm": 1.203125, "learning_rate": 0.00042412545385279055, "loss": 4.9039, "mean_token_accuracy": 0.22026446610689163, "num_tokens": 63142159.0, "step": 30425 }, { "entropy": 5.490342807769776, "epoch": 2.760341074020319, "grad_norm": 1.171875, "learning_rate": 0.00042410122335915883, "loss": 4.8572, "mean_token_accuracy": 0.21545362770557402, "num_tokens": 63152225.0, "step": 30430 }, { "entropy": 5.536431932449341, "epoch": 2.7607946298984034, "grad_norm": 1.171875, "learning_rate": 0.0004240769897820758, "loss": 4.9273, "mean_token_accuracy": 0.21610554903745652, "num_tokens": 63162522.0, "step": 30435 }, { "entropy": 5.565923070907592, "epoch": 2.7612481857764877, "grad_norm": 1.203125, "learning_rate": 0.00042405275312204266, "loss": 4.8671, "mean_token_accuracy": 0.22013120204210282, "num_tokens": 63172094.0, "step": 30440 }, { "entropy": 5.556920385360717, "epoch": 2.761701741654572, "grad_norm": 1.140625, "learning_rate": 0.00042402851337956066, "loss": 4.9461, "mean_token_accuracy": 0.21307509541511535, "num_tokens": 63182122.0, "step": 30445 }, { "entropy": 5.498685550689697, "epoch": 2.762155297532656, "grad_norm": 1.0625, "learning_rate": 0.00042400427055513094, "loss": 4.9122, "mean_token_accuracy": 0.2125438541173935, "num_tokens": 63193174.0, "step": 30450 }, { "entropy": 5.532286310195923, "epoch": 2.7626088534107405, "grad_norm": 1.140625, "learning_rate": 0.000423980024649255, "loss": 4.87, "mean_token_accuracy": 0.2257883921265602, "num_tokens": 63203698.0, "step": 30455 }, { "entropy": 5.466397762298584, "epoch": 2.7630624092888243, "grad_norm": 1.1953125, "learning_rate": 0.0004239557756624342, "loss": 4.8277, "mean_token_accuracy": 0.21761790663003922, "num_tokens": 63213343.0, "step": 30460 }, { "entropy": 5.603932666778564, "epoch": 2.7635159651669086, "grad_norm": 1.125, "learning_rate": 0.00042393152359516994, "loss": 5.0038, "mean_token_accuracy": 0.2097679555416107, "num_tokens": 63223962.0, "step": 30465 }, { "entropy": 5.526310825347901, "epoch": 2.763969521044993, "grad_norm": 1.1171875, "learning_rate": 0.00042390726844796384, "loss": 4.8926, "mean_token_accuracy": 0.21778165251016618, "num_tokens": 63234279.0, "step": 30470 }, { "entropy": 5.592938423156738, "epoch": 2.7644230769230766, "grad_norm": 1.1796875, "learning_rate": 0.0004238830102213174, "loss": 4.9794, "mean_token_accuracy": 0.21780745238065718, "num_tokens": 63245567.0, "step": 30475 }, { "entropy": 5.525066709518432, "epoch": 2.764876632801161, "grad_norm": 1.1796875, "learning_rate": 0.0004238587489157325, "loss": 4.8922, "mean_token_accuracy": 0.2200300484895706, "num_tokens": 63256227.0, "step": 30480 }, { "entropy": 5.509989643096924, "epoch": 2.765330188679245, "grad_norm": 1.125, "learning_rate": 0.0004238344845317107, "loss": 4.8257, "mean_token_accuracy": 0.22090769708156585, "num_tokens": 63266618.0, "step": 30485 }, { "entropy": 5.498007917404175, "epoch": 2.7657837445573294, "grad_norm": 1.1796875, "learning_rate": 0.0004238102170697539, "loss": 4.8653, "mean_token_accuracy": 0.22233632653951646, "num_tokens": 63277130.0, "step": 30490 }, { "entropy": 5.460305118560791, "epoch": 2.7662373004354137, "grad_norm": 1.234375, "learning_rate": 0.0004237859465303637, "loss": 4.8029, "mean_token_accuracy": 0.2217716932296753, "num_tokens": 63287351.0, "step": 30495 }, { "entropy": 5.460341453552246, "epoch": 2.766690856313498, "grad_norm": 1.1328125, "learning_rate": 0.00042376167291404234, "loss": 4.8828, "mean_token_accuracy": 0.2162327215075493, "num_tokens": 63298573.0, "step": 30500 }, { "entropy": 5.550261068344116, "epoch": 2.7671444121915822, "grad_norm": 1.1953125, "learning_rate": 0.00042373739622129166, "loss": 4.9241, "mean_token_accuracy": 0.21402664333581925, "num_tokens": 63310740.0, "step": 30505 }, { "entropy": 5.530867242813111, "epoch": 2.767597968069666, "grad_norm": 1.296875, "learning_rate": 0.00042371311645261376, "loss": 4.922, "mean_token_accuracy": 0.2176116332411766, "num_tokens": 63321323.0, "step": 30510 }, { "entropy": 5.544354677200317, "epoch": 2.7680515239477503, "grad_norm": 1.234375, "learning_rate": 0.0004236888336085107, "loss": 4.8928, "mean_token_accuracy": 0.21989640295505525, "num_tokens": 63332322.0, "step": 30515 }, { "entropy": 5.523030090332031, "epoch": 2.7685050798258346, "grad_norm": 1.2578125, "learning_rate": 0.0004236645476894846, "loss": 4.8245, "mean_token_accuracy": 0.222117879986763, "num_tokens": 63342204.0, "step": 30520 }, { "entropy": 5.444663763046265, "epoch": 2.768958635703919, "grad_norm": 1.1953125, "learning_rate": 0.0004236402586960378, "loss": 4.8935, "mean_token_accuracy": 0.22342048734426498, "num_tokens": 63352460.0, "step": 30525 }, { "entropy": 5.4670610427856445, "epoch": 2.7694121915820027, "grad_norm": 1.09375, "learning_rate": 0.0004236159666286726, "loss": 4.8638, "mean_token_accuracy": 0.22196444720029831, "num_tokens": 63362474.0, "step": 30530 }, { "entropy": 5.596309423446655, "epoch": 2.769865747460087, "grad_norm": 1.2109375, "learning_rate": 0.00042359167148789135, "loss": 4.8982, "mean_token_accuracy": 0.22139718979597092, "num_tokens": 63372537.0, "step": 30535 }, { "entropy": 5.506354713439942, "epoch": 2.7703193033381712, "grad_norm": 1.0625, "learning_rate": 0.0004235673732741964, "loss": 4.8238, "mean_token_accuracy": 0.22366830855607986, "num_tokens": 63382985.0, "step": 30540 }, { "entropy": 5.484205627441407, "epoch": 2.7707728592162555, "grad_norm": 1.109375, "learning_rate": 0.00042354307198809037, "loss": 4.8834, "mean_token_accuracy": 0.21712336093187332, "num_tokens": 63393424.0, "step": 30545 }, { "entropy": 5.4567066669464115, "epoch": 2.7712264150943398, "grad_norm": 1.1484375, "learning_rate": 0.0004235187676300757, "loss": 4.8305, "mean_token_accuracy": 0.2220056802034378, "num_tokens": 63403160.0, "step": 30550 }, { "entropy": 5.5553553104400635, "epoch": 2.771679970972424, "grad_norm": 1.1328125, "learning_rate": 0.0004234944602006552, "loss": 4.9437, "mean_token_accuracy": 0.21894798725843428, "num_tokens": 63413001.0, "step": 30555 }, { "entropy": 5.561584758758545, "epoch": 2.772133526850508, "grad_norm": 1.2421875, "learning_rate": 0.00042347014970033124, "loss": 4.9033, "mean_token_accuracy": 0.22200512886047363, "num_tokens": 63422735.0, "step": 30560 }, { "entropy": 5.469807195663452, "epoch": 2.772587082728592, "grad_norm": 1.140625, "learning_rate": 0.0004234458361296069, "loss": 4.8894, "mean_token_accuracy": 0.21574612855911254, "num_tokens": 63432566.0, "step": 30565 }, { "entropy": 5.5209135055542, "epoch": 2.7730406386066764, "grad_norm": 1.1015625, "learning_rate": 0.00042342151948898476, "loss": 4.8991, "mean_token_accuracy": 0.21468929350376129, "num_tokens": 63442412.0, "step": 30570 }, { "entropy": 5.517923212051391, "epoch": 2.7734941944847606, "grad_norm": 1.1015625, "learning_rate": 0.00042339719977896784, "loss": 4.9106, "mean_token_accuracy": 0.21989350616931916, "num_tokens": 63453018.0, "step": 30575 }, { "entropy": 5.594983959197998, "epoch": 2.7739477503628445, "grad_norm": 1.2109375, "learning_rate": 0.000423372877000059, "loss": 4.9594, "mean_token_accuracy": 0.20720903873443602, "num_tokens": 63464286.0, "step": 30580 }, { "entropy": 5.527478504180908, "epoch": 2.7744013062409287, "grad_norm": 1.1328125, "learning_rate": 0.00042334855115276117, "loss": 4.9229, "mean_token_accuracy": 0.21502056270837783, "num_tokens": 63475138.0, "step": 30585 }, { "entropy": 5.595297527313233, "epoch": 2.774854862119013, "grad_norm": 1.0703125, "learning_rate": 0.00042332422223757756, "loss": 4.9881, "mean_token_accuracy": 0.21430517137050628, "num_tokens": 63486104.0, "step": 30590 }, { "entropy": 5.47593502998352, "epoch": 2.7753084179970973, "grad_norm": 1.1484375, "learning_rate": 0.00042329989025501123, "loss": 4.8925, "mean_token_accuracy": 0.2147979035973549, "num_tokens": 63496490.0, "step": 30595 }, { "entropy": 5.491402626037598, "epoch": 2.7757619738751815, "grad_norm": 1.140625, "learning_rate": 0.00042327555520556536, "loss": 4.8727, "mean_token_accuracy": 0.21748384684324265, "num_tokens": 63506562.0, "step": 30600 }, { "entropy": 5.5572162628173825, "epoch": 2.776215529753266, "grad_norm": 1.15625, "learning_rate": 0.00042325121708974324, "loss": 4.9179, "mean_token_accuracy": 0.22070915549993514, "num_tokens": 63516641.0, "step": 30605 }, { "entropy": 5.567569398880005, "epoch": 2.7766690856313496, "grad_norm": 1.140625, "learning_rate": 0.0004232268759080482, "loss": 4.9105, "mean_token_accuracy": 0.21740418374538423, "num_tokens": 63526864.0, "step": 30610 }, { "entropy": 5.531572675704956, "epoch": 2.777122641509434, "grad_norm": 1.1796875, "learning_rate": 0.00042320253166098354, "loss": 4.9962, "mean_token_accuracy": 0.2093336135149002, "num_tokens": 63537160.0, "step": 30615 }, { "entropy": 5.572648048400879, "epoch": 2.777576197387518, "grad_norm": 1.1875, "learning_rate": 0.00042317818434905275, "loss": 4.8826, "mean_token_accuracy": 0.21674850583076477, "num_tokens": 63547485.0, "step": 30620 }, { "entropy": 5.555351829528808, "epoch": 2.7780297532656024, "grad_norm": 1.0390625, "learning_rate": 0.0004231538339727594, "loss": 4.8848, "mean_token_accuracy": 0.21273261606693267, "num_tokens": 63559369.0, "step": 30625 }, { "entropy": 5.628942346572876, "epoch": 2.7784833091436862, "grad_norm": 1.2265625, "learning_rate": 0.00042312948053260704, "loss": 5.0616, "mean_token_accuracy": 0.20401397198438645, "num_tokens": 63570033.0, "step": 30630 }, { "entropy": 5.533664608001709, "epoch": 2.7789368650217705, "grad_norm": 1.0078125, "learning_rate": 0.0004231051240290992, "loss": 4.8871, "mean_token_accuracy": 0.2176375150680542, "num_tokens": 63581274.0, "step": 30635 }, { "entropy": 5.575471591949463, "epoch": 2.7793904208998548, "grad_norm": 1.1875, "learning_rate": 0.00042308076446273963, "loss": 4.926, "mean_token_accuracy": 0.21599977016448973, "num_tokens": 63590903.0, "step": 30640 }, { "entropy": 5.510876941680908, "epoch": 2.779843976777939, "grad_norm": 1.1875, "learning_rate": 0.00042305640183403214, "loss": 4.9069, "mean_token_accuracy": 0.2141154080629349, "num_tokens": 63600982.0, "step": 30645 }, { "entropy": 5.452576398849487, "epoch": 2.7802975326560233, "grad_norm": 1.140625, "learning_rate": 0.00042303203614348057, "loss": 4.8137, "mean_token_accuracy": 0.22087979465723037, "num_tokens": 63612411.0, "step": 30650 }, { "entropy": 5.523834943771362, "epoch": 2.7807510885341076, "grad_norm": 1.265625, "learning_rate": 0.0004230076673915888, "loss": 4.8893, "mean_token_accuracy": 0.22421470582485198, "num_tokens": 63622128.0, "step": 30655 }, { "entropy": 5.5620626449584964, "epoch": 2.781204644412192, "grad_norm": 1.1875, "learning_rate": 0.00042298329557886074, "loss": 4.9394, "mean_token_accuracy": 0.21709243059158326, "num_tokens": 63632047.0, "step": 30660 }, { "entropy": 5.557314729690551, "epoch": 2.7816582002902757, "grad_norm": 1.2578125, "learning_rate": 0.0004229589207058003, "loss": 4.9671, "mean_token_accuracy": 0.21210708767175673, "num_tokens": 63642490.0, "step": 30665 }, { "entropy": 5.504116725921631, "epoch": 2.78211175616836, "grad_norm": 1.1171875, "learning_rate": 0.00042293454277291177, "loss": 4.8996, "mean_token_accuracy": 0.21591146290302277, "num_tokens": 63653206.0, "step": 30670 }, { "entropy": 5.4893557071685795, "epoch": 2.782565312046444, "grad_norm": 1.2421875, "learning_rate": 0.00042291016178069916, "loss": 4.9012, "mean_token_accuracy": 0.2182347446680069, "num_tokens": 63663427.0, "step": 30675 }, { "entropy": 5.458497762680054, "epoch": 2.7830188679245285, "grad_norm": 1.140625, "learning_rate": 0.0004228857777296668, "loss": 4.8822, "mean_token_accuracy": 0.219146491587162, "num_tokens": 63674269.0, "step": 30680 }, { "entropy": 5.535872936248779, "epoch": 2.7834724238026123, "grad_norm": 1.1328125, "learning_rate": 0.0004228613906203188, "loss": 4.8846, "mean_token_accuracy": 0.21309252232313156, "num_tokens": 63683989.0, "step": 30685 }, { "entropy": 5.527919578552246, "epoch": 2.7839259796806965, "grad_norm": 1.1640625, "learning_rate": 0.00042283700045315955, "loss": 4.9041, "mean_token_accuracy": 0.2108805075287819, "num_tokens": 63694540.0, "step": 30690 }, { "entropy": 5.531034660339356, "epoch": 2.784379535558781, "grad_norm": 1.1171875, "learning_rate": 0.00042281260722869355, "loss": 4.8851, "mean_token_accuracy": 0.2139385774731636, "num_tokens": 63705149.0, "step": 30695 }, { "entropy": 5.521725273132324, "epoch": 2.784833091436865, "grad_norm": 1.28125, "learning_rate": 0.00042278821094742495, "loss": 4.8575, "mean_token_accuracy": 0.21866624653339387, "num_tokens": 63714061.0, "step": 30700 }, { "entropy": 5.552300548553466, "epoch": 2.7852866473149493, "grad_norm": 1.1171875, "learning_rate": 0.00042276381160985874, "loss": 4.9523, "mean_token_accuracy": 0.21544505655765533, "num_tokens": 63724732.0, "step": 30705 }, { "entropy": 5.532246065139771, "epoch": 2.7857402031930336, "grad_norm": 1.1484375, "learning_rate": 0.0004227394092164991, "loss": 4.946, "mean_token_accuracy": 0.21359337568283082, "num_tokens": 63734942.0, "step": 30710 }, { "entropy": 5.607596731185913, "epoch": 2.7861937590711174, "grad_norm": 1.2109375, "learning_rate": 0.0004227150037678509, "loss": 5.026, "mean_token_accuracy": 0.21817888766527177, "num_tokens": 63745326.0, "step": 30715 }, { "entropy": 5.539146471023559, "epoch": 2.7866473149492017, "grad_norm": 1.234375, "learning_rate": 0.0004226905952644188, "loss": 4.9179, "mean_token_accuracy": 0.21137509793043135, "num_tokens": 63755355.0, "step": 30720 }, { "entropy": 5.524612092971802, "epoch": 2.787100870827286, "grad_norm": 1.1328125, "learning_rate": 0.00042266618370670743, "loss": 4.9045, "mean_token_accuracy": 0.2129056289792061, "num_tokens": 63765112.0, "step": 30725 }, { "entropy": 5.506501150131226, "epoch": 2.7875544267053702, "grad_norm": 1.1875, "learning_rate": 0.00042264176909522183, "loss": 4.856, "mean_token_accuracy": 0.22156573534011842, "num_tokens": 63774680.0, "step": 30730 }, { "entropy": 5.574916410446167, "epoch": 2.788007982583454, "grad_norm": 1.2578125, "learning_rate": 0.0004226173514304669, "loss": 4.9793, "mean_token_accuracy": 0.21419061422348024, "num_tokens": 63784939.0, "step": 30735 }, { "entropy": 5.5736040592193605, "epoch": 2.7884615384615383, "grad_norm": 1.1484375, "learning_rate": 0.0004225929307129474, "loss": 4.997, "mean_token_accuracy": 0.2051139935851097, "num_tokens": 63795836.0, "step": 30740 }, { "entropy": 5.524158906936646, "epoch": 2.7889150943396226, "grad_norm": 1.3046875, "learning_rate": 0.00042256850694316844, "loss": 4.8616, "mean_token_accuracy": 0.21171969324350357, "num_tokens": 63805607.0, "step": 30745 }, { "entropy": 5.496328830718994, "epoch": 2.789368650217707, "grad_norm": 1.2265625, "learning_rate": 0.0004225440801216353, "loss": 4.8775, "mean_token_accuracy": 0.21394830495119094, "num_tokens": 63815081.0, "step": 30750 }, { "entropy": 5.4668434143066404, "epoch": 2.789822206095791, "grad_norm": 1.1640625, "learning_rate": 0.0004225196502488529, "loss": 4.8864, "mean_token_accuracy": 0.21572887152433395, "num_tokens": 63825932.0, "step": 30755 }, { "entropy": 5.4969518184661865, "epoch": 2.7902757619738754, "grad_norm": 1.09375, "learning_rate": 0.00042249521732532657, "loss": 4.844, "mean_token_accuracy": 0.219173763692379, "num_tokens": 63835653.0, "step": 30760 }, { "entropy": 5.633457279205322, "epoch": 2.790729317851959, "grad_norm": 1.125, "learning_rate": 0.0004224707813515615, "loss": 5.0419, "mean_token_accuracy": 0.20953703671693802, "num_tokens": 63847657.0, "step": 30765 }, { "entropy": 5.6358260154724125, "epoch": 2.7911828737300435, "grad_norm": 1.1640625, "learning_rate": 0.00042244634232806324, "loss": 4.9472, "mean_token_accuracy": 0.2163883164525032, "num_tokens": 63858476.0, "step": 30770 }, { "entropy": 5.488044548034668, "epoch": 2.7916364296081277, "grad_norm": 1.2578125, "learning_rate": 0.00042242190025533694, "loss": 4.8164, "mean_token_accuracy": 0.2192759931087494, "num_tokens": 63867970.0, "step": 30775 }, { "entropy": 5.542297458648681, "epoch": 2.792089985486212, "grad_norm": 1.09375, "learning_rate": 0.0004223974551338881, "loss": 4.8861, "mean_token_accuracy": 0.22458372563123702, "num_tokens": 63878294.0, "step": 30780 }, { "entropy": 5.5060694217681885, "epoch": 2.792543541364296, "grad_norm": 1.109375, "learning_rate": 0.0004223730069642224, "loss": 4.8991, "mean_token_accuracy": 0.2111222416162491, "num_tokens": 63889315.0, "step": 30785 }, { "entropy": 5.470957612991333, "epoch": 2.79299709724238, "grad_norm": 1.109375, "learning_rate": 0.0004223485557468454, "loss": 4.8696, "mean_token_accuracy": 0.21330437809228897, "num_tokens": 63899923.0, "step": 30790 }, { "entropy": 5.484261560440063, "epoch": 2.7934506531204644, "grad_norm": 1.1171875, "learning_rate": 0.00042232410148226277, "loss": 4.868, "mean_token_accuracy": 0.2193808600306511, "num_tokens": 63909813.0, "step": 30795 }, { "entropy": 5.547342586517334, "epoch": 2.7939042089985486, "grad_norm": 1.2109375, "learning_rate": 0.00042229964417098007, "loss": 4.9035, "mean_token_accuracy": 0.21508964598178865, "num_tokens": 63920931.0, "step": 30800 }, { "entropy": 5.509487819671631, "epoch": 2.794357764876633, "grad_norm": 1.140625, "learning_rate": 0.00042227518381350316, "loss": 4.8478, "mean_token_accuracy": 0.22297311425209046, "num_tokens": 63930799.0, "step": 30805 }, { "entropy": 5.620544481277466, "epoch": 2.794811320754717, "grad_norm": 1.2109375, "learning_rate": 0.00042225072041033804, "loss": 5.019, "mean_token_accuracy": 0.2113138258457184, "num_tokens": 63941763.0, "step": 30810 }, { "entropy": 5.603292083740234, "epoch": 2.7952648766328014, "grad_norm": 1.15625, "learning_rate": 0.00042222625396199043, "loss": 4.9765, "mean_token_accuracy": 0.20460831820964814, "num_tokens": 63952775.0, "step": 30815 }, { "entropy": 5.559855699539185, "epoch": 2.7957184325108853, "grad_norm": 1.125, "learning_rate": 0.0004222017844689663, "loss": 4.9478, "mean_token_accuracy": 0.21407727152109146, "num_tokens": 63964223.0, "step": 30820 }, { "entropy": 5.576049184799194, "epoch": 2.7961719883889695, "grad_norm": 1.1875, "learning_rate": 0.0004221773119317719, "loss": 4.9722, "mean_token_accuracy": 0.21223429590463638, "num_tokens": 63976413.0, "step": 30825 }, { "entropy": 5.638586139678955, "epoch": 2.796625544267054, "grad_norm": 1.3125, "learning_rate": 0.00042215283635091313, "loss": 4.955, "mean_token_accuracy": 0.21725727915763854, "num_tokens": 63986578.0, "step": 30830 }, { "entropy": 5.567459535598755, "epoch": 2.7970791001451376, "grad_norm": 1.171875, "learning_rate": 0.0004221283577268962, "loss": 4.9259, "mean_token_accuracy": 0.21995437890291214, "num_tokens": 63996856.0, "step": 30835 }, { "entropy": 5.484815454483032, "epoch": 2.797532656023222, "grad_norm": 1.0859375, "learning_rate": 0.00042210387606022724, "loss": 4.874, "mean_token_accuracy": 0.22053915858268738, "num_tokens": 64007700.0, "step": 30840 }, { "entropy": 5.593621444702149, "epoch": 2.797986211901306, "grad_norm": 1.2578125, "learning_rate": 0.0004220793913514128, "loss": 5.0274, "mean_token_accuracy": 0.20663743019104003, "num_tokens": 64018771.0, "step": 30845 }, { "entropy": 5.562261533737183, "epoch": 2.7984397677793904, "grad_norm": 1.09375, "learning_rate": 0.0004220549036009589, "loss": 4.9386, "mean_token_accuracy": 0.2145187094807625, "num_tokens": 64029381.0, "step": 30850 }, { "entropy": 5.455021715164184, "epoch": 2.7988933236574747, "grad_norm": 1.25, "learning_rate": 0.00042203041280937224, "loss": 4.8575, "mean_token_accuracy": 0.2154773622751236, "num_tokens": 64039596.0, "step": 30855 }, { "entropy": 5.583695697784424, "epoch": 2.799346879535559, "grad_norm": 1.1640625, "learning_rate": 0.0004220059189771592, "loss": 4.9431, "mean_token_accuracy": 0.22600321918725969, "num_tokens": 64049123.0, "step": 30860 }, { "entropy": 5.539047765731811, "epoch": 2.799800435413643, "grad_norm": 1.21875, "learning_rate": 0.00042198142210482623, "loss": 4.9686, "mean_token_accuracy": 0.2102591410279274, "num_tokens": 64059426.0, "step": 30865 }, { "entropy": 5.506822872161865, "epoch": 2.800253991291727, "grad_norm": 1.1953125, "learning_rate": 0.00042195692219287997, "loss": 4.8393, "mean_token_accuracy": 0.22850680947303773, "num_tokens": 64069227.0, "step": 30870 }, { "entropy": 5.550188207626343, "epoch": 2.8007075471698113, "grad_norm": 1.2265625, "learning_rate": 0.0004219324192418272, "loss": 4.9217, "mean_token_accuracy": 0.21839002519845963, "num_tokens": 64078482.0, "step": 30875 }, { "entropy": 5.536701250076294, "epoch": 2.8011611030478956, "grad_norm": 1.15625, "learning_rate": 0.00042190791325217447, "loss": 4.8882, "mean_token_accuracy": 0.2170430138707161, "num_tokens": 64088664.0, "step": 30880 }, { "entropy": 5.508675050735474, "epoch": 2.80161465892598, "grad_norm": 1.1796875, "learning_rate": 0.0004218834042244287, "loss": 4.8394, "mean_token_accuracy": 0.221296264231205, "num_tokens": 64099316.0, "step": 30885 }, { "entropy": 5.482932806015015, "epoch": 2.8020682148040637, "grad_norm": 1.171875, "learning_rate": 0.00042185889215909665, "loss": 4.8846, "mean_token_accuracy": 0.21833451837301254, "num_tokens": 64109786.0, "step": 30890 }, { "entropy": 5.540563488006592, "epoch": 2.802521770682148, "grad_norm": 1.1484375, "learning_rate": 0.00042183437705668535, "loss": 4.9045, "mean_token_accuracy": 0.21909187585115433, "num_tokens": 64120771.0, "step": 30895 }, { "entropy": 5.581007051467895, "epoch": 2.802975326560232, "grad_norm": 1.125, "learning_rate": 0.00042180985891770176, "loss": 4.9483, "mean_token_accuracy": 0.21043097525835036, "num_tokens": 64130833.0, "step": 30900 }, { "entropy": 5.505196952819825, "epoch": 2.8034288824383164, "grad_norm": 1.1875, "learning_rate": 0.0004217853377426528, "loss": 4.8772, "mean_token_accuracy": 0.21740821301937102, "num_tokens": 64139672.0, "step": 30905 }, { "entropy": 5.619898319244385, "epoch": 2.8038824383164007, "grad_norm": 1.1484375, "learning_rate": 0.0004217608135320456, "loss": 5.0441, "mean_token_accuracy": 0.21198188960552217, "num_tokens": 64150383.0, "step": 30910 }, { "entropy": 5.488873100280761, "epoch": 2.804335994194485, "grad_norm": 1.1953125, "learning_rate": 0.0004217362862863875, "loss": 4.8629, "mean_token_accuracy": 0.22111288607120513, "num_tokens": 64160786.0, "step": 30915 }, { "entropy": 5.589868783950806, "epoch": 2.804789550072569, "grad_norm": 1.1015625, "learning_rate": 0.00042171175600618546, "loss": 4.9661, "mean_token_accuracy": 0.2092306911945343, "num_tokens": 64172057.0, "step": 30920 }, { "entropy": 5.543269205093384, "epoch": 2.805243105950653, "grad_norm": 1.2734375, "learning_rate": 0.00042168722269194704, "loss": 4.9364, "mean_token_accuracy": 0.2217864692211151, "num_tokens": 64182599.0, "step": 30925 }, { "entropy": 5.5318528175354, "epoch": 2.8056966618287373, "grad_norm": 1.1328125, "learning_rate": 0.0004216626863441794, "loss": 4.9553, "mean_token_accuracy": 0.21121252030134202, "num_tokens": 64193356.0, "step": 30930 }, { "entropy": 5.586373376846313, "epoch": 2.8061502177068216, "grad_norm": 1.2265625, "learning_rate": 0.00042163814696339014, "loss": 5.0334, "mean_token_accuracy": 0.20548325926065444, "num_tokens": 64203625.0, "step": 30935 }, { "entropy": 5.563460111618042, "epoch": 2.8066037735849054, "grad_norm": 1.1484375, "learning_rate": 0.0004216136045500866, "loss": 5.0292, "mean_token_accuracy": 0.21040269136428832, "num_tokens": 64214742.0, "step": 30940 }, { "entropy": 5.611554336547852, "epoch": 2.8070573294629897, "grad_norm": 1.234375, "learning_rate": 0.0004215890591047763, "loss": 4.934, "mean_token_accuracy": 0.21399957835674285, "num_tokens": 64223811.0, "step": 30945 }, { "entropy": 5.5755163669586185, "epoch": 2.807510885341074, "grad_norm": 1.1640625, "learning_rate": 0.00042156451062796686, "loss": 4.8368, "mean_token_accuracy": 0.225464129447937, "num_tokens": 64234854.0, "step": 30950 }, { "entropy": 5.530154371261597, "epoch": 2.8079644412191582, "grad_norm": 1.1953125, "learning_rate": 0.00042153995912016606, "loss": 4.9477, "mean_token_accuracy": 0.21348231732845308, "num_tokens": 64245914.0, "step": 30955 }, { "entropy": 5.537575960159302, "epoch": 2.8084179970972425, "grad_norm": 1.203125, "learning_rate": 0.0004215154045818816, "loss": 4.9862, "mean_token_accuracy": 0.2114098533987999, "num_tokens": 64256217.0, "step": 30960 }, { "entropy": 5.575512027740478, "epoch": 2.8088715529753268, "grad_norm": 1.1796875, "learning_rate": 0.0004214908470136212, "loss": 4.9862, "mean_token_accuracy": 0.2037487134337425, "num_tokens": 64267211.0, "step": 30965 }, { "entropy": 5.61586627960205, "epoch": 2.8093251088534106, "grad_norm": 1.09375, "learning_rate": 0.0004214662864158927, "loss": 4.9618, "mean_token_accuracy": 0.2164837673306465, "num_tokens": 64277770.0, "step": 30970 }, { "entropy": 5.51845965385437, "epoch": 2.809778664731495, "grad_norm": 1.2265625, "learning_rate": 0.00042144172278920413, "loss": 4.8413, "mean_token_accuracy": 0.22367362529039383, "num_tokens": 64287973.0, "step": 30975 }, { "entropy": 5.490904235839844, "epoch": 2.810232220609579, "grad_norm": 1.140625, "learning_rate": 0.0004214171561340634, "loss": 4.9305, "mean_token_accuracy": 0.20926944613456727, "num_tokens": 64297898.0, "step": 30980 }, { "entropy": 5.496457910537719, "epoch": 2.8106857764876634, "grad_norm": 1.171875, "learning_rate": 0.00042139258645097863, "loss": 4.8051, "mean_token_accuracy": 0.22897038161754607, "num_tokens": 64308114.0, "step": 30985 }, { "entropy": 5.531622076034546, "epoch": 2.811139332365747, "grad_norm": 1.1328125, "learning_rate": 0.00042136801374045775, "loss": 4.8895, "mean_token_accuracy": 0.21641914546489716, "num_tokens": 64319586.0, "step": 30990 }, { "entropy": 5.556856679916382, "epoch": 2.8115928882438315, "grad_norm": 1.09375, "learning_rate": 0.0004213434380030091, "loss": 4.9767, "mean_token_accuracy": 0.2129749149084091, "num_tokens": 64330612.0, "step": 30995 }, { "entropy": 5.581273460388184, "epoch": 2.8120464441219157, "grad_norm": 1.09375, "learning_rate": 0.0004213188592391409, "loss": 5.0095, "mean_token_accuracy": 0.21192465126514434, "num_tokens": 64341934.0, "step": 31000 }, { "entropy": 5.557264375686645, "epoch": 2.8125, "grad_norm": 1.1484375, "learning_rate": 0.0004212942774493614, "loss": 4.9065, "mean_token_accuracy": 0.212347112596035, "num_tokens": 64352166.0, "step": 31005 }, { "entropy": 5.558771371841431, "epoch": 2.8129535558780843, "grad_norm": 1.125, "learning_rate": 0.00042126969263417885, "loss": 4.9471, "mean_token_accuracy": 0.21027209162712096, "num_tokens": 64361995.0, "step": 31010 }, { "entropy": 5.511719560623169, "epoch": 2.8134071117561685, "grad_norm": 1.15625, "learning_rate": 0.00042124510479410183, "loss": 4.8937, "mean_token_accuracy": 0.20847588330507277, "num_tokens": 64372336.0, "step": 31015 }, { "entropy": 5.5432158470153805, "epoch": 2.813860667634253, "grad_norm": 1.2109375, "learning_rate": 0.00042122051392963885, "loss": 4.9287, "mean_token_accuracy": 0.22187695056200027, "num_tokens": 64382309.0, "step": 31020 }, { "entropy": 5.555031156539917, "epoch": 2.8143142235123366, "grad_norm": 1.1171875, "learning_rate": 0.0004211959200412984, "loss": 4.9594, "mean_token_accuracy": 0.21324883550405502, "num_tokens": 64393205.0, "step": 31025 }, { "entropy": 5.50804386138916, "epoch": 2.814767779390421, "grad_norm": 1.1171875, "learning_rate": 0.0004211713231295889, "loss": 4.9407, "mean_token_accuracy": 0.21478293985128402, "num_tokens": 64403068.0, "step": 31030 }, { "entropy": 5.566445684432983, "epoch": 2.815221335268505, "grad_norm": 1.1796875, "learning_rate": 0.0004211467231950194, "loss": 4.9343, "mean_token_accuracy": 0.2172972872853279, "num_tokens": 64414296.0, "step": 31035 }, { "entropy": 5.527777481079101, "epoch": 2.8156748911465894, "grad_norm": 1.203125, "learning_rate": 0.00042112212023809824, "loss": 4.9439, "mean_token_accuracy": 0.20978185534477234, "num_tokens": 64424748.0, "step": 31040 }, { "entropy": 5.530280590057373, "epoch": 2.8161284470246732, "grad_norm": 1.1328125, "learning_rate": 0.0004210975142593345, "loss": 4.88, "mean_token_accuracy": 0.2162256196141243, "num_tokens": 64434723.0, "step": 31045 }, { "entropy": 5.6028824806213375, "epoch": 2.8165820029027575, "grad_norm": 1.140625, "learning_rate": 0.0004210729052592369, "loss": 5.0032, "mean_token_accuracy": 0.21000772565603257, "num_tokens": 64445864.0, "step": 31050 }, { "entropy": 5.511378288269043, "epoch": 2.8170355587808418, "grad_norm": 1.1328125, "learning_rate": 0.0004210482932383144, "loss": 4.8566, "mean_token_accuracy": 0.21516052931547164, "num_tokens": 64456704.0, "step": 31055 }, { "entropy": 5.458221054077148, "epoch": 2.817489114658926, "grad_norm": 1.2578125, "learning_rate": 0.000421023678197076, "loss": 4.9278, "mean_token_accuracy": 0.22078704535961152, "num_tokens": 64466870.0, "step": 31060 }, { "entropy": 5.554971504211426, "epoch": 2.8179426705370103, "grad_norm": 1.09375, "learning_rate": 0.0004209990601360307, "loss": 4.9401, "mean_token_accuracy": 0.21220726221799852, "num_tokens": 64477069.0, "step": 31065 }, { "entropy": 5.601056718826294, "epoch": 2.8183962264150946, "grad_norm": 1.203125, "learning_rate": 0.00042097443905568765, "loss": 4.9435, "mean_token_accuracy": 0.20832460820674897, "num_tokens": 64487165.0, "step": 31070 }, { "entropy": 5.500105142593384, "epoch": 2.8188497822931784, "grad_norm": 1.0625, "learning_rate": 0.00042094981495655596, "loss": 4.8116, "mean_token_accuracy": 0.2192513808608055, "num_tokens": 64497977.0, "step": 31075 }, { "entropy": 5.550768661499023, "epoch": 2.8193033381712627, "grad_norm": 1.1484375, "learning_rate": 0.000420925187839145, "loss": 4.9608, "mean_token_accuracy": 0.21169591397047044, "num_tokens": 64508767.0, "step": 31080 }, { "entropy": 5.496765518188477, "epoch": 2.819756894049347, "grad_norm": 1.2890625, "learning_rate": 0.00042090055770396383, "loss": 4.8408, "mean_token_accuracy": 0.2166010171175003, "num_tokens": 64519040.0, "step": 31085 }, { "entropy": 5.523709487915039, "epoch": 2.820210449927431, "grad_norm": 1.21875, "learning_rate": 0.00042087592455152206, "loss": 4.8829, "mean_token_accuracy": 0.22410670518875123, "num_tokens": 64529721.0, "step": 31090 }, { "entropy": 5.542969274520874, "epoch": 2.820664005805515, "grad_norm": 1.046875, "learning_rate": 0.000420851288382329, "loss": 5.0251, "mean_token_accuracy": 0.19784930050373079, "num_tokens": 64541299.0, "step": 31095 }, { "entropy": 5.567285108566284, "epoch": 2.8211175616835993, "grad_norm": 1.1640625, "learning_rate": 0.00042082664919689406, "loss": 4.8815, "mean_token_accuracy": 0.21351644843816758, "num_tokens": 64550831.0, "step": 31100 }, { "entropy": 5.544571781158448, "epoch": 2.8215711175616836, "grad_norm": 1.15625, "learning_rate": 0.0004208020069957269, "loss": 4.9118, "mean_token_accuracy": 0.21320996731519698, "num_tokens": 64562076.0, "step": 31105 }, { "entropy": 5.4988298416137695, "epoch": 2.822024673439768, "grad_norm": 1.1171875, "learning_rate": 0.000420777361779337, "loss": 4.9065, "mean_token_accuracy": 0.2141510710120201, "num_tokens": 64572955.0, "step": 31110 }, { "entropy": 5.577213478088379, "epoch": 2.822478229317852, "grad_norm": 1.1171875, "learning_rate": 0.00042075271354823427, "loss": 4.9184, "mean_token_accuracy": 0.22119008898735046, "num_tokens": 64584376.0, "step": 31115 }, { "entropy": 5.61672568321228, "epoch": 2.8229317851959363, "grad_norm": 1.21875, "learning_rate": 0.0004207280623029281, "loss": 4.9617, "mean_token_accuracy": 0.2101093515753746, "num_tokens": 64594522.0, "step": 31120 }, { "entropy": 5.5586175441741945, "epoch": 2.82338534107402, "grad_norm": 1.2578125, "learning_rate": 0.00042070340804392853, "loss": 4.9641, "mean_token_accuracy": 0.21815845966339112, "num_tokens": 64604625.0, "step": 31125 }, { "entropy": 5.548998212814331, "epoch": 2.8238388969521044, "grad_norm": 1.2109375, "learning_rate": 0.0004206787507717454, "loss": 4.927, "mean_token_accuracy": 0.21258337795734406, "num_tokens": 64614184.0, "step": 31130 }, { "entropy": 5.633258056640625, "epoch": 2.8242924528301887, "grad_norm": 1.3359375, "learning_rate": 0.00042065409048688856, "loss": 4.9839, "mean_token_accuracy": 0.20751901119947433, "num_tokens": 64623019.0, "step": 31135 }, { "entropy": 5.550436067581177, "epoch": 2.824746008708273, "grad_norm": 1.2421875, "learning_rate": 0.000420629427189868, "loss": 4.9274, "mean_token_accuracy": 0.2100003182888031, "num_tokens": 64634017.0, "step": 31140 }, { "entropy": 5.516027450561523, "epoch": 2.825199564586357, "grad_norm": 1.234375, "learning_rate": 0.00042060476088119376, "loss": 4.9095, "mean_token_accuracy": 0.223791466653347, "num_tokens": 64645007.0, "step": 31145 }, { "entropy": 5.621215581893921, "epoch": 2.825653120464441, "grad_norm": 1.1484375, "learning_rate": 0.000420580091561376, "loss": 4.9673, "mean_token_accuracy": 0.20933672934770584, "num_tokens": 64655705.0, "step": 31150 }, { "entropy": 5.634806108474732, "epoch": 2.8261066763425253, "grad_norm": 1.140625, "learning_rate": 0.00042055541923092485, "loss": 5.0193, "mean_token_accuracy": 0.21371605694293977, "num_tokens": 64666094.0, "step": 31155 }, { "entropy": 5.590093755722046, "epoch": 2.8265602322206096, "grad_norm": 1.1640625, "learning_rate": 0.0004205307438903505, "loss": 4.9892, "mean_token_accuracy": 0.2107161909341812, "num_tokens": 64676107.0, "step": 31160 }, { "entropy": 5.536475038528442, "epoch": 2.827013788098694, "grad_norm": 1.1484375, "learning_rate": 0.0004205060655401633, "loss": 4.8826, "mean_token_accuracy": 0.21870268136262894, "num_tokens": 64685846.0, "step": 31165 }, { "entropy": 5.527658843994141, "epoch": 2.827467343976778, "grad_norm": 1.1328125, "learning_rate": 0.0004204813841808736, "loss": 4.8739, "mean_token_accuracy": 0.2178611069917679, "num_tokens": 64695959.0, "step": 31170 }, { "entropy": 5.539642810821533, "epoch": 2.8279208998548624, "grad_norm": 1.171875, "learning_rate": 0.0004204566998129917, "loss": 4.8769, "mean_token_accuracy": 0.2217714875936508, "num_tokens": 64705594.0, "step": 31175 }, { "entropy": 5.5490350246429445, "epoch": 2.828374455732946, "grad_norm": 1.1171875, "learning_rate": 0.00042043201243702834, "loss": 4.9405, "mean_token_accuracy": 0.21713307201862336, "num_tokens": 64715974.0, "step": 31180 }, { "entropy": 5.484439325332642, "epoch": 2.8288280116110305, "grad_norm": 1.2109375, "learning_rate": 0.0004204073220534938, "loss": 4.8987, "mean_token_accuracy": 0.21724633872509003, "num_tokens": 64725846.0, "step": 31185 }, { "entropy": 5.513561248779297, "epoch": 2.8292815674891147, "grad_norm": 1.125, "learning_rate": 0.0004203826286628988, "loss": 4.8662, "mean_token_accuracy": 0.22389216125011444, "num_tokens": 64735789.0, "step": 31190 }, { "entropy": 5.513552951812744, "epoch": 2.8297351233671986, "grad_norm": 1.1875, "learning_rate": 0.000420357932265754, "loss": 4.8303, "mean_token_accuracy": 0.22930199801921844, "num_tokens": 64745738.0, "step": 31195 }, { "entropy": 5.5790260314941404, "epoch": 2.830188679245283, "grad_norm": 1.0625, "learning_rate": 0.0004203332328625701, "loss": 4.9182, "mean_token_accuracy": 0.21140057891607283, "num_tokens": 64756523.0, "step": 31200 }, { "entropy": 5.615804433822632, "epoch": 2.830642235123367, "grad_norm": 1.125, "learning_rate": 0.00042030853045385796, "loss": 4.9975, "mean_token_accuracy": 0.20886973887681962, "num_tokens": 64767367.0, "step": 31205 }, { "entropy": 5.559985256195068, "epoch": 2.8310957910014514, "grad_norm": 1.203125, "learning_rate": 0.00042028382504012837, "loss": 4.9365, "mean_token_accuracy": 0.2171519175171852, "num_tokens": 64777729.0, "step": 31210 }, { "entropy": 5.618748760223388, "epoch": 2.8315493468795356, "grad_norm": 1.1640625, "learning_rate": 0.00042025911662189224, "loss": 4.9545, "mean_token_accuracy": 0.21584361046552658, "num_tokens": 64788223.0, "step": 31215 }, { "entropy": 5.524864530563354, "epoch": 2.83200290275762, "grad_norm": 1.3125, "learning_rate": 0.00042023440519966057, "loss": 4.931, "mean_token_accuracy": 0.21378059685230255, "num_tokens": 64797367.0, "step": 31220 }, { "entropy": 5.568392181396485, "epoch": 2.832456458635704, "grad_norm": 1.2265625, "learning_rate": 0.00042020969077394434, "loss": 4.932, "mean_token_accuracy": 0.2151729241013527, "num_tokens": 64807179.0, "step": 31225 }, { "entropy": 5.597186040878296, "epoch": 2.832910014513788, "grad_norm": 1.125, "learning_rate": 0.00042018497334525475, "loss": 4.8408, "mean_token_accuracy": 0.21051837801933287, "num_tokens": 64817276.0, "step": 31230 }, { "entropy": 5.534233093261719, "epoch": 2.8333635703918723, "grad_norm": 1.0703125, "learning_rate": 0.0004201602529141029, "loss": 4.928, "mean_token_accuracy": 0.21452396661043166, "num_tokens": 64827509.0, "step": 31235 }, { "entropy": 5.53713207244873, "epoch": 2.8338171262699565, "grad_norm": 1.1484375, "learning_rate": 0.00042013552948100003, "loss": 4.9159, "mean_token_accuracy": 0.21845897287130356, "num_tokens": 64836578.0, "step": 31240 }, { "entropy": 5.46690001487732, "epoch": 2.834270682148041, "grad_norm": 1.171875, "learning_rate": 0.0004201108030464574, "loss": 4.8413, "mean_token_accuracy": 0.2260923132300377, "num_tokens": 64846518.0, "step": 31245 }, { "entropy": 5.5815574645996096, "epoch": 2.8347242380261246, "grad_norm": 1.3125, "learning_rate": 0.00042008607361098646, "loss": 4.9181, "mean_token_accuracy": 0.2170808047056198, "num_tokens": 64856304.0, "step": 31250 }, { "entropy": 5.541314220428466, "epoch": 2.835177793904209, "grad_norm": 1.1328125, "learning_rate": 0.0004200613411750985, "loss": 4.8353, "mean_token_accuracy": 0.2260214149951935, "num_tokens": 64867381.0, "step": 31255 }, { "entropy": 5.531509590148926, "epoch": 2.835631349782293, "grad_norm": 1.2265625, "learning_rate": 0.000420036605739305, "loss": 4.9633, "mean_token_accuracy": 0.21288643628358841, "num_tokens": 64877306.0, "step": 31260 }, { "entropy": 5.440706348419189, "epoch": 2.8360849056603774, "grad_norm": 1.4921875, "learning_rate": 0.0004200118673041176, "loss": 4.8773, "mean_token_accuracy": 0.21655137687921525, "num_tokens": 64886932.0, "step": 31265 }, { "entropy": 5.577686405181884, "epoch": 2.8365384615384617, "grad_norm": 1.2734375, "learning_rate": 0.00041998712587004776, "loss": 4.9547, "mean_token_accuracy": 0.21200074553489684, "num_tokens": 64897387.0, "step": 31270 }, { "entropy": 5.5929523468017575, "epoch": 2.836992017416546, "grad_norm": 1.03125, "learning_rate": 0.00041996238143760726, "loss": 4.9619, "mean_token_accuracy": 0.21789601892232896, "num_tokens": 64907251.0, "step": 31275 }, { "entropy": 5.517402791976929, "epoch": 2.8374455732946298, "grad_norm": 1.1796875, "learning_rate": 0.00041993763400730776, "loss": 4.9105, "mean_token_accuracy": 0.2156141385436058, "num_tokens": 64917300.0, "step": 31280 }, { "entropy": 5.493494844436645, "epoch": 2.837899129172714, "grad_norm": 1.2578125, "learning_rate": 0.0004199128835796611, "loss": 4.8729, "mean_token_accuracy": 0.22205340266227722, "num_tokens": 64927133.0, "step": 31285 }, { "entropy": 5.525535583496094, "epoch": 2.8383526850507983, "grad_norm": 1.1953125, "learning_rate": 0.000419888130155179, "loss": 4.9064, "mean_token_accuracy": 0.21540738195180892, "num_tokens": 64937789.0, "step": 31290 }, { "entropy": 5.617279815673828, "epoch": 2.8388062409288826, "grad_norm": 1.2578125, "learning_rate": 0.0004198633737343735, "loss": 4.9359, "mean_token_accuracy": 0.2179100066423416, "num_tokens": 64948127.0, "step": 31295 }, { "entropy": 5.6134850025177006, "epoch": 2.8392597968069664, "grad_norm": 1.09375, "learning_rate": 0.0004198386143177565, "loss": 4.9704, "mean_token_accuracy": 0.2190896451473236, "num_tokens": 64959632.0, "step": 31300 }, { "entropy": 5.402682638168335, "epoch": 2.8397133526850507, "grad_norm": 1.125, "learning_rate": 0.00041981385190584003, "loss": 4.7589, "mean_token_accuracy": 0.22537483721971513, "num_tokens": 64970411.0, "step": 31305 }, { "entropy": 5.4788289070129395, "epoch": 2.840166908563135, "grad_norm": 1.2109375, "learning_rate": 0.0004197890864991362, "loss": 4.8839, "mean_token_accuracy": 0.21666204631328584, "num_tokens": 64980748.0, "step": 31310 }, { "entropy": 5.50677080154419, "epoch": 2.840620464441219, "grad_norm": 1.1875, "learning_rate": 0.0004197643180981572, "loss": 4.8483, "mean_token_accuracy": 0.21664761900901794, "num_tokens": 64990818.0, "step": 31315 }, { "entropy": 5.566329097747802, "epoch": 2.8410740203193035, "grad_norm": 1.21875, "learning_rate": 0.0004197395467034152, "loss": 4.9038, "mean_token_accuracy": 0.22178769409656524, "num_tokens": 65001993.0, "step": 31320 }, { "entropy": 5.486306428909302, "epoch": 2.8415275761973877, "grad_norm": 1.15625, "learning_rate": 0.0004197147723154225, "loss": 4.8763, "mean_token_accuracy": 0.221916626393795, "num_tokens": 65013007.0, "step": 31325 }, { "entropy": 5.563535594940186, "epoch": 2.8419811320754715, "grad_norm": 1.1171875, "learning_rate": 0.0004196899949346914, "loss": 4.8785, "mean_token_accuracy": 0.2166494458913803, "num_tokens": 65023595.0, "step": 31330 }, { "entropy": 5.521514558792115, "epoch": 2.842434687953556, "grad_norm": 1.1015625, "learning_rate": 0.0004196652145617343, "loss": 4.9025, "mean_token_accuracy": 0.21616182178258897, "num_tokens": 65033631.0, "step": 31335 }, { "entropy": 5.590752363204956, "epoch": 2.84288824383164, "grad_norm": 1.1640625, "learning_rate": 0.0004196404311970638, "loss": 4.934, "mean_token_accuracy": 0.21498224139213562, "num_tokens": 65044059.0, "step": 31340 }, { "entropy": 5.550260591506958, "epoch": 2.8433417997097243, "grad_norm": 1.2109375, "learning_rate": 0.0004196156448411922, "loss": 4.9167, "mean_token_accuracy": 0.21222257763147354, "num_tokens": 65053931.0, "step": 31345 }, { "entropy": 5.5581341743469235, "epoch": 2.843795355587808, "grad_norm": 1.1796875, "learning_rate": 0.00041959085549463234, "loss": 4.9134, "mean_token_accuracy": 0.21883310675621032, "num_tokens": 65064011.0, "step": 31350 }, { "entropy": 5.600523853302002, "epoch": 2.8442489114658924, "grad_norm": 1.2421875, "learning_rate": 0.0004195660631578966, "loss": 4.9677, "mean_token_accuracy": 0.21627790182828904, "num_tokens": 65074417.0, "step": 31355 }, { "entropy": 5.527333450317383, "epoch": 2.8447024673439767, "grad_norm": 1.2578125, "learning_rate": 0.000419541267831498, "loss": 4.9012, "mean_token_accuracy": 0.2167319431900978, "num_tokens": 65084593.0, "step": 31360 }, { "entropy": 5.513705587387085, "epoch": 2.845156023222061, "grad_norm": 1.171875, "learning_rate": 0.000419516469515949, "loss": 4.896, "mean_token_accuracy": 0.21882117092609404, "num_tokens": 65095047.0, "step": 31365 }, { "entropy": 5.58816123008728, "epoch": 2.8456095791001452, "grad_norm": 1.25, "learning_rate": 0.00041949166821176264, "loss": 4.9821, "mean_token_accuracy": 0.21852320581674575, "num_tokens": 65104434.0, "step": 31370 }, { "entropy": 5.598996543884278, "epoch": 2.8460631349782295, "grad_norm": 1.2421875, "learning_rate": 0.00041946686391945183, "loss": 4.9753, "mean_token_accuracy": 0.21633891761302948, "num_tokens": 65114039.0, "step": 31375 }, { "entropy": 5.646165800094605, "epoch": 2.8465166908563138, "grad_norm": 1.1875, "learning_rate": 0.0004194420566395294, "loss": 5.036, "mean_token_accuracy": 0.2072843462228775, "num_tokens": 65125387.0, "step": 31380 }, { "entropy": 5.587533044815063, "epoch": 2.8469702467343976, "grad_norm": 1.1171875, "learning_rate": 0.0004194172463725084, "loss": 4.9555, "mean_token_accuracy": 0.21542913615703582, "num_tokens": 65136351.0, "step": 31385 }, { "entropy": 5.528819561004639, "epoch": 2.847423802612482, "grad_norm": 1.1796875, "learning_rate": 0.00041939243311890195, "loss": 4.9242, "mean_token_accuracy": 0.2140688717365265, "num_tokens": 65147343.0, "step": 31390 }, { "entropy": 5.468143606185913, "epoch": 2.847877358490566, "grad_norm": 1.21875, "learning_rate": 0.00041936761687922324, "loss": 4.8693, "mean_token_accuracy": 0.22103351056575776, "num_tokens": 65157097.0, "step": 31395 }, { "entropy": 5.5240765571594235, "epoch": 2.8483309143686504, "grad_norm": 1.171875, "learning_rate": 0.00041934279765398535, "loss": 4.9337, "mean_token_accuracy": 0.21291904598474504, "num_tokens": 65167546.0, "step": 31400 }, { "entropy": 5.59366250038147, "epoch": 2.848784470246734, "grad_norm": 1.1953125, "learning_rate": 0.0004193179754437017, "loss": 4.9427, "mean_token_accuracy": 0.20671755075454712, "num_tokens": 65178497.0, "step": 31405 }, { "entropy": 5.527767992019653, "epoch": 2.8492380261248185, "grad_norm": 1.09375, "learning_rate": 0.0004192931502488855, "loss": 4.841, "mean_token_accuracy": 0.22376588135957717, "num_tokens": 65189530.0, "step": 31410 }, { "entropy": 5.551055192947388, "epoch": 2.8496915820029027, "grad_norm": 1.125, "learning_rate": 0.00041926832207005025, "loss": 4.9056, "mean_token_accuracy": 0.21482572555541993, "num_tokens": 65199836.0, "step": 31415 }, { "entropy": 5.455656909942627, "epoch": 2.850145137880987, "grad_norm": 1.15625, "learning_rate": 0.0004192434909077092, "loss": 4.7617, "mean_token_accuracy": 0.2233502060174942, "num_tokens": 65210208.0, "step": 31420 }, { "entropy": 5.549488115310669, "epoch": 2.8505986937590713, "grad_norm": 1.1171875, "learning_rate": 0.00041921865676237605, "loss": 4.913, "mean_token_accuracy": 0.21836962252855302, "num_tokens": 65220954.0, "step": 31425 }, { "entropy": 5.588891124725341, "epoch": 2.8510522496371555, "grad_norm": 1.2109375, "learning_rate": 0.00041919381963456437, "loss": 4.9141, "mean_token_accuracy": 0.21905021965503693, "num_tokens": 65230870.0, "step": 31430 }, { "entropy": 5.54392557144165, "epoch": 2.8515058055152394, "grad_norm": 1.25, "learning_rate": 0.0004191689795247877, "loss": 4.9146, "mean_token_accuracy": 0.22279935479164123, "num_tokens": 65241913.0, "step": 31435 }, { "entropy": 5.588877773284912, "epoch": 2.8519593613933236, "grad_norm": 1.2578125, "learning_rate": 0.0004191441364335598, "loss": 4.9207, "mean_token_accuracy": 0.2176218494772911, "num_tokens": 65252513.0, "step": 31440 }, { "entropy": 5.489598035812378, "epoch": 2.852412917271408, "grad_norm": 1.1796875, "learning_rate": 0.00041911929036139457, "loss": 4.9028, "mean_token_accuracy": 0.2195203870534897, "num_tokens": 65262695.0, "step": 31445 }, { "entropy": 5.581487417221069, "epoch": 2.852866473149492, "grad_norm": 1.140625, "learning_rate": 0.00041909444130880553, "loss": 4.9879, "mean_token_accuracy": 0.21721937358379365, "num_tokens": 65274131.0, "step": 31450 }, { "entropy": 5.552785587310791, "epoch": 2.853320029027576, "grad_norm": 1.2109375, "learning_rate": 0.00041906958927630673, "loss": 4.9178, "mean_token_accuracy": 0.21341437697410584, "num_tokens": 65285080.0, "step": 31455 }, { "entropy": 5.67452974319458, "epoch": 2.8537735849056602, "grad_norm": 1.15625, "learning_rate": 0.0004190447342644122, "loss": 5.0955, "mean_token_accuracy": 0.21516249179840088, "num_tokens": 65296512.0, "step": 31460 }, { "entropy": 5.5065295696258545, "epoch": 2.8542271407837445, "grad_norm": 1.2578125, "learning_rate": 0.0004190198762736358, "loss": 4.8489, "mean_token_accuracy": 0.22480050176382066, "num_tokens": 65306054.0, "step": 31465 }, { "entropy": 5.436642837524414, "epoch": 2.8546806966618288, "grad_norm": 1.1875, "learning_rate": 0.0004189950153044917, "loss": 4.9136, "mean_token_accuracy": 0.21854021549224853, "num_tokens": 65315046.0, "step": 31470 }, { "entropy": 5.498241710662842, "epoch": 2.855134252539913, "grad_norm": 1.1171875, "learning_rate": 0.0004189701513574939, "loss": 4.8722, "mean_token_accuracy": 0.2167905956506729, "num_tokens": 65325482.0, "step": 31475 }, { "entropy": 5.51598162651062, "epoch": 2.8555878084179973, "grad_norm": 1.2265625, "learning_rate": 0.0004189452844331567, "loss": 4.8527, "mean_token_accuracy": 0.21807391345500945, "num_tokens": 65335518.0, "step": 31480 }, { "entropy": 5.544434928894043, "epoch": 2.856041364296081, "grad_norm": 1.1484375, "learning_rate": 0.00041892041453199443, "loss": 4.9701, "mean_token_accuracy": 0.21861279010772705, "num_tokens": 65346079.0, "step": 31485 }, { "entropy": 5.504207706451416, "epoch": 2.8564949201741654, "grad_norm": 1.234375, "learning_rate": 0.0004188955416545212, "loss": 4.8813, "mean_token_accuracy": 0.21876951307058334, "num_tokens": 65356719.0, "step": 31490 }, { "entropy": 5.554988718032837, "epoch": 2.8569484760522497, "grad_norm": 1.0859375, "learning_rate": 0.0004188706658012516, "loss": 4.9409, "mean_token_accuracy": 0.21187306195497513, "num_tokens": 65367877.0, "step": 31495 }, { "entropy": 5.57737922668457, "epoch": 2.857402031930334, "grad_norm": 1.0390625, "learning_rate": 0.00041884578697269994, "loss": 4.9765, "mean_token_accuracy": 0.20789577662944794, "num_tokens": 65379624.0, "step": 31500 }, { "entropy": 5.576460647583008, "epoch": 2.8578555878084178, "grad_norm": 1.1484375, "learning_rate": 0.0004188209051693807, "loss": 4.9871, "mean_token_accuracy": 0.21411170363426207, "num_tokens": 65390417.0, "step": 31505 }, { "entropy": 5.459558582305908, "epoch": 2.858309143686502, "grad_norm": 1.0703125, "learning_rate": 0.00041879602039180856, "loss": 4.751, "mean_token_accuracy": 0.22666174471378325, "num_tokens": 65401681.0, "step": 31510 }, { "entropy": 5.515451097488404, "epoch": 2.8587626995645863, "grad_norm": 1.2109375, "learning_rate": 0.00041877113264049805, "loss": 4.8612, "mean_token_accuracy": 0.22111100405454637, "num_tokens": 65412520.0, "step": 31515 }, { "entropy": 5.550540208816528, "epoch": 2.8592162554426706, "grad_norm": 1.25, "learning_rate": 0.00041874624191596383, "loss": 4.9297, "mean_token_accuracy": 0.21934369802474976, "num_tokens": 65423201.0, "step": 31520 }, { "entropy": 5.50769362449646, "epoch": 2.859669811320755, "grad_norm": 1.1640625, "learning_rate": 0.0004187213482187207, "loss": 4.934, "mean_token_accuracy": 0.2097564771771431, "num_tokens": 65432778.0, "step": 31525 }, { "entropy": 5.60222544670105, "epoch": 2.860123367198839, "grad_norm": 1.1953125, "learning_rate": 0.0004186964515492835, "loss": 4.9354, "mean_token_accuracy": 0.2192388266324997, "num_tokens": 65442323.0, "step": 31530 }, { "entropy": 5.540174341201782, "epoch": 2.8605769230769234, "grad_norm": 1.203125, "learning_rate": 0.0004186715519081671, "loss": 4.927, "mean_token_accuracy": 0.2159638896584511, "num_tokens": 65451980.0, "step": 31535 }, { "entropy": 5.441647148132324, "epoch": 2.861030478955007, "grad_norm": 1.140625, "learning_rate": 0.0004186466492958864, "loss": 4.867, "mean_token_accuracy": 0.2177277013659477, "num_tokens": 65463359.0, "step": 31540 }, { "entropy": 5.552570915222168, "epoch": 2.8614840348330914, "grad_norm": 1.1171875, "learning_rate": 0.0004186217437129562, "loss": 4.9074, "mean_token_accuracy": 0.21424112766981124, "num_tokens": 65474155.0, "step": 31545 }, { "entropy": 5.585643911361695, "epoch": 2.8619375907111757, "grad_norm": 1.1875, "learning_rate": 0.00041859683515989196, "loss": 4.8557, "mean_token_accuracy": 0.21864478588104247, "num_tokens": 65484884.0, "step": 31550 }, { "entropy": 5.567428016662598, "epoch": 2.8623911465892595, "grad_norm": 1.1328125, "learning_rate": 0.00041857192363720845, "loss": 4.9404, "mean_token_accuracy": 0.2179499313235283, "num_tokens": 65494380.0, "step": 31555 }, { "entropy": 5.518616390228272, "epoch": 2.862844702467344, "grad_norm": 1.09375, "learning_rate": 0.0004185470091454211, "loss": 4.9111, "mean_token_accuracy": 0.21639350354671477, "num_tokens": 65505735.0, "step": 31560 }, { "entropy": 5.567360496520996, "epoch": 2.863298258345428, "grad_norm": 1.1171875, "learning_rate": 0.0004185220916850449, "loss": 4.8684, "mean_token_accuracy": 0.21369979977607728, "num_tokens": 65515956.0, "step": 31565 }, { "entropy": 5.5191755294799805, "epoch": 2.8637518142235123, "grad_norm": 1.1484375, "learning_rate": 0.00041849717125659537, "loss": 4.8524, "mean_token_accuracy": 0.2151741310954094, "num_tokens": 65526369.0, "step": 31570 }, { "entropy": 5.5277210712432865, "epoch": 2.8642053701015966, "grad_norm": 1.1796875, "learning_rate": 0.0004184722478605877, "loss": 4.8802, "mean_token_accuracy": 0.22305546402931214, "num_tokens": 65536032.0, "step": 31575 }, { "entropy": 5.495082521438599, "epoch": 2.864658925979681, "grad_norm": 1.171875, "learning_rate": 0.0004184473214975374, "loss": 4.9521, "mean_token_accuracy": 0.2094807043671608, "num_tokens": 65546121.0, "step": 31580 }, { "entropy": 5.507816171646118, "epoch": 2.865112481857765, "grad_norm": 1.125, "learning_rate": 0.00041842239216795994, "loss": 4.8926, "mean_token_accuracy": 0.2115117311477661, "num_tokens": 65555915.0, "step": 31585 }, { "entropy": 5.507788801193238, "epoch": 2.865566037735849, "grad_norm": 1.125, "learning_rate": 0.00041839745987237086, "loss": 4.9149, "mean_token_accuracy": 0.20928386896848677, "num_tokens": 65566267.0, "step": 31590 }, { "entropy": 5.553118371963501, "epoch": 2.866019593613933, "grad_norm": 1.1171875, "learning_rate": 0.0004183725246112857, "loss": 4.8908, "mean_token_accuracy": 0.2217654287815094, "num_tokens": 65577126.0, "step": 31595 }, { "entropy": 5.595052194595337, "epoch": 2.8664731494920175, "grad_norm": 1.2421875, "learning_rate": 0.00041834758638522034, "loss": 5.0191, "mean_token_accuracy": 0.20554105341434478, "num_tokens": 65587158.0, "step": 31600 }, { "entropy": 5.544302606582642, "epoch": 2.8669267053701017, "grad_norm": 1.21875, "learning_rate": 0.00041832264519469026, "loss": 4.8892, "mean_token_accuracy": 0.2119647666811943, "num_tokens": 65597720.0, "step": 31605 }, { "entropy": 5.612184286117554, "epoch": 2.8673802612481856, "grad_norm": 1.234375, "learning_rate": 0.00041829770104021143, "loss": 4.9344, "mean_token_accuracy": 0.21834521889686584, "num_tokens": 65607409.0, "step": 31610 }, { "entropy": 5.575307130813599, "epoch": 2.86783381712627, "grad_norm": 1.2109375, "learning_rate": 0.00041827275392229956, "loss": 4.871, "mean_token_accuracy": 0.22842340767383576, "num_tokens": 65616785.0, "step": 31615 }, { "entropy": 5.544488906860352, "epoch": 2.868287373004354, "grad_norm": 1.203125, "learning_rate": 0.0004182478038414706, "loss": 4.9649, "mean_token_accuracy": 0.21097181737422943, "num_tokens": 65625794.0, "step": 31620 }, { "entropy": 5.447157526016236, "epoch": 2.8687409288824384, "grad_norm": 1.1171875, "learning_rate": 0.00041822285079824056, "loss": 4.7927, "mean_token_accuracy": 0.2222556620836258, "num_tokens": 65635789.0, "step": 31625 }, { "entropy": 5.579034233093262, "epoch": 2.8691944847605226, "grad_norm": 1.1171875, "learning_rate": 0.0004181978947931256, "loss": 5.026, "mean_token_accuracy": 0.21067075580358505, "num_tokens": 65646266.0, "step": 31630 }, { "entropy": 5.585314702987671, "epoch": 2.869648040638607, "grad_norm": 1.1484375, "learning_rate": 0.0004181729358266415, "loss": 4.9166, "mean_token_accuracy": 0.21557358354330064, "num_tokens": 65656538.0, "step": 31635 }, { "entropy": 5.596712923049926, "epoch": 2.8701015965166907, "grad_norm": 1.1640625, "learning_rate": 0.00041814797389930474, "loss": 4.9317, "mean_token_accuracy": 0.21700470745563508, "num_tokens": 65666926.0, "step": 31640 }, { "entropy": 5.551916790008545, "epoch": 2.870555152394775, "grad_norm": 1.2421875, "learning_rate": 0.0004181230090116313, "loss": 4.9065, "mean_token_accuracy": 0.21022246927022933, "num_tokens": 65677219.0, "step": 31645 }, { "entropy": 5.5526855945587155, "epoch": 2.8710087082728593, "grad_norm": 1.109375, "learning_rate": 0.00041809804116413763, "loss": 4.9471, "mean_token_accuracy": 0.21329140663146973, "num_tokens": 65688281.0, "step": 31650 }, { "entropy": 5.661717510223388, "epoch": 2.8714622641509435, "grad_norm": 1.1875, "learning_rate": 0.00041807307035734, "loss": 5.0232, "mean_token_accuracy": 0.20881217569112778, "num_tokens": 65698815.0, "step": 31655 }, { "entropy": 5.567882919311524, "epoch": 2.8719158200290273, "grad_norm": 1.2421875, "learning_rate": 0.0004180480965917548, "loss": 4.9382, "mean_token_accuracy": 0.217138934135437, "num_tokens": 65709481.0, "step": 31660 }, { "entropy": 5.608654451370239, "epoch": 2.8723693759071116, "grad_norm": 1.109375, "learning_rate": 0.00041802311986789854, "loss": 4.9175, "mean_token_accuracy": 0.20534139275550842, "num_tokens": 65720561.0, "step": 31665 }, { "entropy": 5.581717586517334, "epoch": 2.872822931785196, "grad_norm": 1.1484375, "learning_rate": 0.00041799814018628765, "loss": 4.9593, "mean_token_accuracy": 0.20782429426908494, "num_tokens": 65730384.0, "step": 31670 }, { "entropy": 5.556689929962158, "epoch": 2.87327648766328, "grad_norm": 1.2265625, "learning_rate": 0.00041797315754743883, "loss": 4.9215, "mean_token_accuracy": 0.21964192986488343, "num_tokens": 65740711.0, "step": 31675 }, { "entropy": 5.659464502334595, "epoch": 2.8737300435413644, "grad_norm": 1.21875, "learning_rate": 0.00041794817195186867, "loss": 5.0292, "mean_token_accuracy": 0.21126116961240768, "num_tokens": 65751033.0, "step": 31680 }, { "entropy": 5.611872816085816, "epoch": 2.8741835994194487, "grad_norm": 1.25, "learning_rate": 0.0004179231834000939, "loss": 5.0021, "mean_token_accuracy": 0.20993344038724898, "num_tokens": 65761500.0, "step": 31685 }, { "entropy": 5.458570289611816, "epoch": 2.8746371552975325, "grad_norm": 1.1640625, "learning_rate": 0.00041789819189263117, "loss": 4.8487, "mean_token_accuracy": 0.21971217691898345, "num_tokens": 65771095.0, "step": 31690 }, { "entropy": 5.523027086257935, "epoch": 2.8750907111756168, "grad_norm": 1.15625, "learning_rate": 0.00041787319742999756, "loss": 4.9202, "mean_token_accuracy": 0.21993601620197295, "num_tokens": 65782058.0, "step": 31695 }, { "entropy": 5.558678436279297, "epoch": 2.875544267053701, "grad_norm": 1.2109375, "learning_rate": 0.0004178482000127098, "loss": 4.9462, "mean_token_accuracy": 0.21851180493831635, "num_tokens": 65791710.0, "step": 31700 }, { "entropy": 5.586021614074707, "epoch": 2.8759978229317853, "grad_norm": 1.1171875, "learning_rate": 0.0004178231996412848, "loss": 4.9867, "mean_token_accuracy": 0.20874281823635102, "num_tokens": 65802180.0, "step": 31705 }, { "entropy": 5.5061994075775145, "epoch": 2.876451378809869, "grad_norm": 1.1171875, "learning_rate": 0.0004177981963162396, "loss": 4.8533, "mean_token_accuracy": 0.2269972786307335, "num_tokens": 65812998.0, "step": 31710 }, { "entropy": 5.558642053604126, "epoch": 2.8769049346879534, "grad_norm": 1.2421875, "learning_rate": 0.0004177731900380914, "loss": 4.9307, "mean_token_accuracy": 0.2155836045742035, "num_tokens": 65824210.0, "step": 31715 }, { "entropy": 5.501532411575317, "epoch": 2.8773584905660377, "grad_norm": 1.140625, "learning_rate": 0.0004177481808073572, "loss": 4.8796, "mean_token_accuracy": 0.21981393694877624, "num_tokens": 65834322.0, "step": 31720 }, { "entropy": 5.526997041702271, "epoch": 2.877812046444122, "grad_norm": 1.1171875, "learning_rate": 0.00041772316862455426, "loss": 4.8358, "mean_token_accuracy": 0.22797203958034515, "num_tokens": 65845347.0, "step": 31725 }, { "entropy": 5.578409194946289, "epoch": 2.878265602322206, "grad_norm": 1.2421875, "learning_rate": 0.00041769815349019986, "loss": 4.9498, "mean_token_accuracy": 0.2114505410194397, "num_tokens": 65855616.0, "step": 31730 }, { "entropy": 5.575336074829101, "epoch": 2.8787191582002905, "grad_norm": 1.59375, "learning_rate": 0.00041767313540481125, "loss": 4.9195, "mean_token_accuracy": 0.21302270293235778, "num_tokens": 65865542.0, "step": 31735 }, { "entropy": 5.498986530303955, "epoch": 2.8791727140783747, "grad_norm": 1.2109375, "learning_rate": 0.0004176481143689058, "loss": 4.8995, "mean_token_accuracy": 0.21235269755125047, "num_tokens": 65874478.0, "step": 31740 }, { "entropy": 5.580822515487671, "epoch": 2.8796262699564585, "grad_norm": 1.15625, "learning_rate": 0.0004176230903830011, "loss": 4.9368, "mean_token_accuracy": 0.2134009853005409, "num_tokens": 65884609.0, "step": 31745 }, { "entropy": 5.552547597885132, "epoch": 2.880079825834543, "grad_norm": 1.359375, "learning_rate": 0.0004175980634476145, "loss": 4.9083, "mean_token_accuracy": 0.2203726813197136, "num_tokens": 65894486.0, "step": 31750 }, { "entropy": 5.498010540008545, "epoch": 2.880533381712627, "grad_norm": 1.234375, "learning_rate": 0.0004175730335632635, "loss": 4.8733, "mean_token_accuracy": 0.2206169530749321, "num_tokens": 65904643.0, "step": 31755 }, { "entropy": 5.41986837387085, "epoch": 2.8809869375907113, "grad_norm": 1.1796875, "learning_rate": 0.00041754800073046593, "loss": 4.882, "mean_token_accuracy": 0.22199921011924745, "num_tokens": 65914107.0, "step": 31760 }, { "entropy": 5.489398670196533, "epoch": 2.881440493468795, "grad_norm": 1.171875, "learning_rate": 0.0004175229649497394, "loss": 4.8405, "mean_token_accuracy": 0.21779906004667282, "num_tokens": 65925112.0, "step": 31765 }, { "entropy": 5.589184904098511, "epoch": 2.8818940493468794, "grad_norm": 1.1640625, "learning_rate": 0.0004174979262216016, "loss": 4.9311, "mean_token_accuracy": 0.21531084328889846, "num_tokens": 65934624.0, "step": 31770 }, { "entropy": 5.605479621887207, "epoch": 2.8823476052249637, "grad_norm": 1.1328125, "learning_rate": 0.0004174728845465704, "loss": 4.9073, "mean_token_accuracy": 0.21430217921733857, "num_tokens": 65945951.0, "step": 31775 }, { "entropy": 5.473323726654053, "epoch": 2.882801161103048, "grad_norm": 1.1953125, "learning_rate": 0.0004174478399251636, "loss": 4.8261, "mean_token_accuracy": 0.22606817930936812, "num_tokens": 65956871.0, "step": 31780 }, { "entropy": 5.61882586479187, "epoch": 2.8832547169811322, "grad_norm": 1.140625, "learning_rate": 0.0004174227923578992, "loss": 5.0278, "mean_token_accuracy": 0.2055545151233673, "num_tokens": 65967814.0, "step": 31785 }, { "entropy": 5.548902416229248, "epoch": 2.8837082728592165, "grad_norm": 1.1328125, "learning_rate": 0.0004173977418452952, "loss": 4.9166, "mean_token_accuracy": 0.21030566245317459, "num_tokens": 65978118.0, "step": 31790 }, { "entropy": 5.522923994064331, "epoch": 2.8841618287373003, "grad_norm": 1.234375, "learning_rate": 0.00041737268838786955, "loss": 4.8787, "mean_token_accuracy": 0.22173561304807662, "num_tokens": 65988240.0, "step": 31795 }, { "entropy": 5.540399980545044, "epoch": 2.8846153846153846, "grad_norm": 1.1875, "learning_rate": 0.0004173476319861404, "loss": 4.8775, "mean_token_accuracy": 0.2168329820036888, "num_tokens": 65998126.0, "step": 31800 }, { "entropy": 5.5352075576782225, "epoch": 2.885068940493469, "grad_norm": 1.2109375, "learning_rate": 0.0004173225726406261, "loss": 4.9096, "mean_token_accuracy": 0.22301522344350816, "num_tokens": 66009118.0, "step": 31805 }, { "entropy": 5.594109153747558, "epoch": 2.885522496371553, "grad_norm": 1.2265625, "learning_rate": 0.00041729751035184457, "loss": 4.9719, "mean_token_accuracy": 0.21014766842126847, "num_tokens": 66019340.0, "step": 31810 }, { "entropy": 5.542562007904053, "epoch": 2.885976052249637, "grad_norm": 1.078125, "learning_rate": 0.00041727244512031425, "loss": 4.8907, "mean_token_accuracy": 0.21946422308683394, "num_tokens": 66029784.0, "step": 31815 }, { "entropy": 5.606982946395874, "epoch": 2.886429608127721, "grad_norm": 1.296875, "learning_rate": 0.0004172473769465536, "loss": 5.0363, "mean_token_accuracy": 0.2029428318142891, "num_tokens": 66039987.0, "step": 31820 }, { "entropy": 5.562028884887695, "epoch": 2.8868831640058055, "grad_norm": 1.234375, "learning_rate": 0.00041722230583108097, "loss": 4.9588, "mean_token_accuracy": 0.21664694994688033, "num_tokens": 66049150.0, "step": 31825 }, { "entropy": 5.608209753036499, "epoch": 2.8873367198838897, "grad_norm": 1.1328125, "learning_rate": 0.00041719723177441467, "loss": 4.9503, "mean_token_accuracy": 0.21542547941207885, "num_tokens": 66060719.0, "step": 31830 }, { "entropy": 5.620509481430053, "epoch": 2.887790275761974, "grad_norm": 1.21875, "learning_rate": 0.0004171721547770735, "loss": 4.96, "mean_token_accuracy": 0.2112122505903244, "num_tokens": 66071126.0, "step": 31835 }, { "entropy": 5.571649789810181, "epoch": 2.8882438316400583, "grad_norm": 1.15625, "learning_rate": 0.0004171470748395759, "loss": 4.8703, "mean_token_accuracy": 0.22009020149707795, "num_tokens": 66080928.0, "step": 31840 }, { "entropy": 5.571517753601074, "epoch": 2.888697387518142, "grad_norm": 1.078125, "learning_rate": 0.0004171219919624406, "loss": 4.9196, "mean_token_accuracy": 0.2110880881547928, "num_tokens": 66090900.0, "step": 31845 }, { "entropy": 5.545731449127198, "epoch": 2.8891509433962264, "grad_norm": 1.328125, "learning_rate": 0.00041709690614618624, "loss": 4.9474, "mean_token_accuracy": 0.21194626092910768, "num_tokens": 66100720.0, "step": 31850 }, { "entropy": 5.527884149551392, "epoch": 2.8896044992743106, "grad_norm": 1.3359375, "learning_rate": 0.00041707181739133163, "loss": 4.9455, "mean_token_accuracy": 0.21062547862529754, "num_tokens": 66110780.0, "step": 31855 }, { "entropy": 5.550134372711182, "epoch": 2.890058055152395, "grad_norm": 1.1640625, "learning_rate": 0.0004170467256983957, "loss": 4.8903, "mean_token_accuracy": 0.22698114067316055, "num_tokens": 66120976.0, "step": 31860 }, { "entropy": 5.587691593170166, "epoch": 2.8905116110304787, "grad_norm": 1.15625, "learning_rate": 0.0004170216310678973, "loss": 4.9034, "mean_token_accuracy": 0.2190371111035347, "num_tokens": 66130221.0, "step": 31865 }, { "entropy": 5.518986940383911, "epoch": 2.890965166908563, "grad_norm": 1.1796875, "learning_rate": 0.00041699653350035527, "loss": 4.8479, "mean_token_accuracy": 0.22471992820501327, "num_tokens": 66140060.0, "step": 31870 }, { "entropy": 5.514130544662476, "epoch": 2.8914187227866472, "grad_norm": 1.1875, "learning_rate": 0.00041697143299628886, "loss": 4.9104, "mean_token_accuracy": 0.22354376763105394, "num_tokens": 66151640.0, "step": 31875 }, { "entropy": 5.499039268493652, "epoch": 2.8918722786647315, "grad_norm": 1.15625, "learning_rate": 0.00041694632955621697, "loss": 4.8781, "mean_token_accuracy": 0.2253771498799324, "num_tokens": 66162923.0, "step": 31880 }, { "entropy": 5.570623445510864, "epoch": 2.8923258345428158, "grad_norm": 1.2421875, "learning_rate": 0.00041692122318065885, "loss": 4.9536, "mean_token_accuracy": 0.21463344246149063, "num_tokens": 66173108.0, "step": 31885 }, { "entropy": 5.540338802337646, "epoch": 2.8927793904209, "grad_norm": 1.234375, "learning_rate": 0.00041689611387013363, "loss": 4.8565, "mean_token_accuracy": 0.2213662877678871, "num_tokens": 66185280.0, "step": 31890 }, { "entropy": 5.526933431625366, "epoch": 2.8932329462989843, "grad_norm": 1.1640625, "learning_rate": 0.0004168710016251606, "loss": 4.883, "mean_token_accuracy": 0.21428462117910385, "num_tokens": 66196020.0, "step": 31895 }, { "entropy": 5.51864185333252, "epoch": 2.893686502177068, "grad_norm": 1.140625, "learning_rate": 0.0004168458864462592, "loss": 4.8344, "mean_token_accuracy": 0.2194029688835144, "num_tokens": 66205753.0, "step": 31900 }, { "entropy": 5.576111841201782, "epoch": 2.8941400580551524, "grad_norm": 1.109375, "learning_rate": 0.00041682076833394864, "loss": 4.9837, "mean_token_accuracy": 0.21293427795171738, "num_tokens": 66218415.0, "step": 31905 }, { "entropy": 5.567892026901245, "epoch": 2.8945936139332367, "grad_norm": 1.3046875, "learning_rate": 0.00041679564728874845, "loss": 5.0005, "mean_token_accuracy": 0.21444406658411025, "num_tokens": 66228090.0, "step": 31910 }, { "entropy": 5.486314344406128, "epoch": 2.8950471698113205, "grad_norm": 1.1875, "learning_rate": 0.0004167705233111782, "loss": 4.8478, "mean_token_accuracy": 0.22523657977581024, "num_tokens": 66237587.0, "step": 31915 }, { "entropy": 5.532775974273681, "epoch": 2.8955007256894048, "grad_norm": 1.1640625, "learning_rate": 0.00041674539640175733, "loss": 4.8715, "mean_token_accuracy": 0.21704545468091965, "num_tokens": 66248162.0, "step": 31920 }, { "entropy": 5.501201152801514, "epoch": 2.895954281567489, "grad_norm": 1.1015625, "learning_rate": 0.0004167202665610055, "loss": 4.8625, "mean_token_accuracy": 0.22793399542570114, "num_tokens": 66258370.0, "step": 31925 }, { "entropy": 5.524153852462769, "epoch": 2.8964078374455733, "grad_norm": 1.0859375, "learning_rate": 0.00041669513378944254, "loss": 4.9384, "mean_token_accuracy": 0.2114126369357109, "num_tokens": 66269267.0, "step": 31930 }, { "entropy": 5.5975542068481445, "epoch": 2.8968613933236576, "grad_norm": 1.1171875, "learning_rate": 0.00041666999808758815, "loss": 4.9172, "mean_token_accuracy": 0.21983028948307037, "num_tokens": 66280077.0, "step": 31935 }, { "entropy": 5.549991130828857, "epoch": 2.897314949201742, "grad_norm": 1.1328125, "learning_rate": 0.000416644859455962, "loss": 4.8562, "mean_token_accuracy": 0.21780994087457656, "num_tokens": 66291678.0, "step": 31940 }, { "entropy": 5.516115808486939, "epoch": 2.897768505079826, "grad_norm": 1.171875, "learning_rate": 0.0004166197178950841, "loss": 4.9174, "mean_token_accuracy": 0.21561197340488433, "num_tokens": 66302046.0, "step": 31945 }, { "entropy": 5.521388673782349, "epoch": 2.89822206095791, "grad_norm": 1.265625, "learning_rate": 0.00041659457340547436, "loss": 4.9001, "mean_token_accuracy": 0.2168835759162903, "num_tokens": 66311888.0, "step": 31950 }, { "entropy": 5.487433338165284, "epoch": 2.898675616835994, "grad_norm": 1.1953125, "learning_rate": 0.00041656942598765275, "loss": 4.8676, "mean_token_accuracy": 0.21865642815828323, "num_tokens": 66321507.0, "step": 31955 }, { "entropy": 5.490264463424682, "epoch": 2.8991291727140784, "grad_norm": 1.1796875, "learning_rate": 0.00041654427564213924, "loss": 4.8435, "mean_token_accuracy": 0.22566469460725785, "num_tokens": 66331458.0, "step": 31960 }, { "entropy": 5.539827585220337, "epoch": 2.8995827285921627, "grad_norm": 1.2421875, "learning_rate": 0.00041651912236945416, "loss": 4.8912, "mean_token_accuracy": 0.21899575144052505, "num_tokens": 66340875.0, "step": 31965 }, { "entropy": 5.559274101257325, "epoch": 2.9000362844702465, "grad_norm": 1.2734375, "learning_rate": 0.00041649396617011753, "loss": 4.9702, "mean_token_accuracy": 0.2099599704146385, "num_tokens": 66350784.0, "step": 31970 }, { "entropy": 5.576534700393677, "epoch": 2.900489840348331, "grad_norm": 1.15625, "learning_rate": 0.0004164688070446496, "loss": 4.9746, "mean_token_accuracy": 0.21176678091287612, "num_tokens": 66361591.0, "step": 31975 }, { "entropy": 5.533900165557862, "epoch": 2.900943396226415, "grad_norm": 1.1796875, "learning_rate": 0.0004164436449935707, "loss": 4.8646, "mean_token_accuracy": 0.21987906396389006, "num_tokens": 66371540.0, "step": 31980 }, { "entropy": 5.542740297317505, "epoch": 2.9013969521044993, "grad_norm": 1.203125, "learning_rate": 0.00041641848001740126, "loss": 4.9201, "mean_token_accuracy": 0.21813347637653352, "num_tokens": 66382053.0, "step": 31985 }, { "entropy": 5.54427695274353, "epoch": 2.9018505079825836, "grad_norm": 1.171875, "learning_rate": 0.0004163933121166615, "loss": 4.8913, "mean_token_accuracy": 0.22122047394514083, "num_tokens": 66392563.0, "step": 31990 }, { "entropy": 5.543047714233398, "epoch": 2.902304063860668, "grad_norm": 1.078125, "learning_rate": 0.000416368141291872, "loss": 4.85, "mean_token_accuracy": 0.22260381579399108, "num_tokens": 66403582.0, "step": 31995 }, { "entropy": 5.493227434158325, "epoch": 2.9027576197387517, "grad_norm": 1.1796875, "learning_rate": 0.00041634296754355346, "loss": 4.8329, "mean_token_accuracy": 0.21896252930164337, "num_tokens": 66413713.0, "step": 32000 }, { "entropy": 5.5138264179229735, "epoch": 2.903211175616836, "grad_norm": 1.1953125, "learning_rate": 0.0004163177908722262, "loss": 4.9026, "mean_token_accuracy": 0.2192167341709137, "num_tokens": 66424802.0, "step": 32005 }, { "entropy": 5.52631368637085, "epoch": 2.90366473149492, "grad_norm": 1.3359375, "learning_rate": 0.00041629261127841105, "loss": 4.8615, "mean_token_accuracy": 0.2189914897084236, "num_tokens": 66434716.0, "step": 32010 }, { "entropy": 5.531491470336914, "epoch": 2.9041182873730045, "grad_norm": 1.1875, "learning_rate": 0.00041626742876262876, "loss": 4.9163, "mean_token_accuracy": 0.21337605267763138, "num_tokens": 66445725.0, "step": 32015 }, { "entropy": 5.556710815429687, "epoch": 2.9045718432510883, "grad_norm": 1.1796875, "learning_rate": 0.00041624224332539997, "loss": 4.9532, "mean_token_accuracy": 0.2088825985789299, "num_tokens": 66457492.0, "step": 32020 }, { "entropy": 5.558711385726928, "epoch": 2.9050253991291726, "grad_norm": 1.15625, "learning_rate": 0.0004162170549672455, "loss": 4.8769, "mean_token_accuracy": 0.21862435042858125, "num_tokens": 66467490.0, "step": 32025 }, { "entropy": 5.57815260887146, "epoch": 2.905478955007257, "grad_norm": 1.15625, "learning_rate": 0.0004161918636886865, "loss": 4.987, "mean_token_accuracy": 0.21289435178041458, "num_tokens": 66478160.0, "step": 32030 }, { "entropy": 5.559884071350098, "epoch": 2.905932510885341, "grad_norm": 1.203125, "learning_rate": 0.0004161666694902437, "loss": 4.8997, "mean_token_accuracy": 0.21486809551715852, "num_tokens": 66488181.0, "step": 32035 }, { "entropy": 5.556135940551758, "epoch": 2.9063860667634254, "grad_norm": 1.203125, "learning_rate": 0.0004161414723724383, "loss": 4.9512, "mean_token_accuracy": 0.21877287179231644, "num_tokens": 66498507.0, "step": 32040 }, { "entropy": 5.476687574386597, "epoch": 2.9068396226415096, "grad_norm": 1.1328125, "learning_rate": 0.0004161162723357912, "loss": 4.8398, "mean_token_accuracy": 0.22045327425003053, "num_tokens": 66507752.0, "step": 32045 }, { "entropy": 5.497104358673096, "epoch": 2.9072931785195935, "grad_norm": 1.140625, "learning_rate": 0.0004160910693808236, "loss": 4.9184, "mean_token_accuracy": 0.208297298848629, "num_tokens": 66519360.0, "step": 32050 }, { "entropy": 5.579237079620361, "epoch": 2.9077467343976777, "grad_norm": 1.171875, "learning_rate": 0.00041606586350805686, "loss": 4.9828, "mean_token_accuracy": 0.21351252645254135, "num_tokens": 66529790.0, "step": 32055 }, { "entropy": 5.530319452285767, "epoch": 2.908200290275762, "grad_norm": 1.15625, "learning_rate": 0.000416040654718012, "loss": 4.8531, "mean_token_accuracy": 0.2273558884859085, "num_tokens": 66539617.0, "step": 32060 }, { "entropy": 5.5499505519866945, "epoch": 2.9086538461538463, "grad_norm": 1.1171875, "learning_rate": 0.00041601544301121045, "loss": 4.8714, "mean_token_accuracy": 0.22175043672323227, "num_tokens": 66549861.0, "step": 32065 }, { "entropy": 5.614412021636963, "epoch": 2.90910740203193, "grad_norm": 1.21875, "learning_rate": 0.0004159902283881737, "loss": 5.0051, "mean_token_accuracy": 0.21870703995227814, "num_tokens": 66560388.0, "step": 32070 }, { "entropy": 5.601671934127808, "epoch": 2.9095609579100143, "grad_norm": 1.1484375, "learning_rate": 0.000415965010849423, "loss": 4.97, "mean_token_accuracy": 0.2153163507580757, "num_tokens": 66570795.0, "step": 32075 }, { "entropy": 5.594749069213867, "epoch": 2.9100145137880986, "grad_norm": 1.203125, "learning_rate": 0.00041593979039548, "loss": 4.9374, "mean_token_accuracy": 0.21092817485332488, "num_tokens": 66580268.0, "step": 32080 }, { "entropy": 5.58156909942627, "epoch": 2.910468069666183, "grad_norm": 1.0390625, "learning_rate": 0.0004159145670268662, "loss": 4.9676, "mean_token_accuracy": 0.21238549798727036, "num_tokens": 66591192.0, "step": 32085 }, { "entropy": 5.568034076690674, "epoch": 2.910921625544267, "grad_norm": 1.21875, "learning_rate": 0.0004158893407441033, "loss": 4.9856, "mean_token_accuracy": 0.2187513068318367, "num_tokens": 66600768.0, "step": 32090 }, { "entropy": 5.647961902618408, "epoch": 2.9113751814223514, "grad_norm": 1.171875, "learning_rate": 0.00041586411154771285, "loss": 4.9441, "mean_token_accuracy": 0.21644292175769805, "num_tokens": 66612207.0, "step": 32095 }, { "entropy": 5.521655416488647, "epoch": 2.9118287373004357, "grad_norm": 1.1796875, "learning_rate": 0.00041583887943821667, "loss": 4.8482, "mean_token_accuracy": 0.2201209157705307, "num_tokens": 66622175.0, "step": 32100 }, { "entropy": 5.505579662322998, "epoch": 2.9122822931785195, "grad_norm": 1.0625, "learning_rate": 0.0004158136444161367, "loss": 4.8862, "mean_token_accuracy": 0.21468835473060607, "num_tokens": 66633936.0, "step": 32105 }, { "entropy": 5.569595241546631, "epoch": 2.9127358490566038, "grad_norm": 1.28125, "learning_rate": 0.00041578840648199455, "loss": 4.9568, "mean_token_accuracy": 0.20726978331804274, "num_tokens": 66643502.0, "step": 32110 }, { "entropy": 5.544066095352173, "epoch": 2.913189404934688, "grad_norm": 1.21875, "learning_rate": 0.0004157631656363124, "loss": 4.9036, "mean_token_accuracy": 0.21949195265769958, "num_tokens": 66654890.0, "step": 32115 }, { "entropy": 5.589392137527466, "epoch": 2.9136429608127723, "grad_norm": 1.0625, "learning_rate": 0.000415737921879612, "loss": 5.0128, "mean_token_accuracy": 0.20125688314437867, "num_tokens": 66667037.0, "step": 32120 }, { "entropy": 5.5436938285827635, "epoch": 2.914096516690856, "grad_norm": 1.171875, "learning_rate": 0.00041571267521241554, "loss": 4.879, "mean_token_accuracy": 0.2174460083246231, "num_tokens": 66677291.0, "step": 32125 }, { "entropy": 5.486691331863403, "epoch": 2.9145500725689404, "grad_norm": 1.1875, "learning_rate": 0.0004156874256352451, "loss": 4.8622, "mean_token_accuracy": 0.21483613252639772, "num_tokens": 66687421.0, "step": 32130 }, { "entropy": 5.600220966339111, "epoch": 2.9150036284470247, "grad_norm": 1.265625, "learning_rate": 0.0004156621731486228, "loss": 4.9989, "mean_token_accuracy": 0.2091139778494835, "num_tokens": 66697190.0, "step": 32135 }, { "entropy": 5.586568164825439, "epoch": 2.915457184325109, "grad_norm": 1.0703125, "learning_rate": 0.000415636917753071, "loss": 4.983, "mean_token_accuracy": 0.21069155186414718, "num_tokens": 66707255.0, "step": 32140 }, { "entropy": 5.488911867141724, "epoch": 2.915910740203193, "grad_norm": 1.2734375, "learning_rate": 0.0004156116594491119, "loss": 4.8321, "mean_token_accuracy": 0.21835922300815583, "num_tokens": 66716451.0, "step": 32145 }, { "entropy": 5.501500654220581, "epoch": 2.9163642960812775, "grad_norm": 1.4375, "learning_rate": 0.0004155863982372678, "loss": 4.9285, "mean_token_accuracy": 0.22173197120428084, "num_tokens": 66727157.0, "step": 32150 }, { "entropy": 5.598024225234985, "epoch": 2.9168178519593613, "grad_norm": 1.140625, "learning_rate": 0.00041556113411806117, "loss": 4.9235, "mean_token_accuracy": 0.2129424676299095, "num_tokens": 66737523.0, "step": 32155 }, { "entropy": 5.591394519805908, "epoch": 2.9172714078374455, "grad_norm": 1.1328125, "learning_rate": 0.00041553586709201453, "loss": 4.9311, "mean_token_accuracy": 0.2162012815475464, "num_tokens": 66748183.0, "step": 32160 }, { "entropy": 5.570503282546997, "epoch": 2.91772496371553, "grad_norm": 1.1953125, "learning_rate": 0.0004155105971596503, "loss": 4.8881, "mean_token_accuracy": 0.22067442536354065, "num_tokens": 66758794.0, "step": 32165 }, { "entropy": 5.592117547988892, "epoch": 2.918178519593614, "grad_norm": 1.1328125, "learning_rate": 0.00041548532432149105, "loss": 4.9992, "mean_token_accuracy": 0.21960476487874986, "num_tokens": 66769916.0, "step": 32170 }, { "entropy": 5.57194037437439, "epoch": 2.918632075471698, "grad_norm": 1.2734375, "learning_rate": 0.0004154600485780595, "loss": 4.9198, "mean_token_accuracy": 0.22378370761871338, "num_tokens": 66779658.0, "step": 32175 }, { "entropy": 5.501144027709961, "epoch": 2.919085631349782, "grad_norm": 1.28125, "learning_rate": 0.00041543476992987843, "loss": 4.8797, "mean_token_accuracy": 0.22131458371877671, "num_tokens": 66788909.0, "step": 32180 }, { "entropy": 5.590155696868896, "epoch": 2.9195391872278664, "grad_norm": 1.109375, "learning_rate": 0.00041540948837747056, "loss": 4.9665, "mean_token_accuracy": 0.21467978060245513, "num_tokens": 66799519.0, "step": 32185 }, { "entropy": 5.501236915588379, "epoch": 2.9199927431059507, "grad_norm": 1.2265625, "learning_rate": 0.0004153842039213586, "loss": 4.8608, "mean_token_accuracy": 0.22042181938886643, "num_tokens": 66808915.0, "step": 32190 }, { "entropy": 5.564164686203003, "epoch": 2.920446298984035, "grad_norm": 1.296875, "learning_rate": 0.0004153589165620656, "loss": 4.967, "mean_token_accuracy": 0.21259564757347107, "num_tokens": 66818819.0, "step": 32195 }, { "entropy": 5.4631490230560305, "epoch": 2.9208998548621192, "grad_norm": 1.1796875, "learning_rate": 0.00041533362630011435, "loss": 4.8019, "mean_token_accuracy": 0.22978342175483704, "num_tokens": 66829274.0, "step": 32200 }, { "entropy": 5.618209600448608, "epoch": 2.921353410740203, "grad_norm": 1.2265625, "learning_rate": 0.000415308333136028, "loss": 4.9531, "mean_token_accuracy": 0.22303779125213624, "num_tokens": 66839659.0, "step": 32205 }, { "entropy": 5.574804258346558, "epoch": 2.9218069666182873, "grad_norm": 1.4765625, "learning_rate": 0.00041528303707032957, "loss": 4.9702, "mean_token_accuracy": 0.21683358550071716, "num_tokens": 66850415.0, "step": 32210 }, { "entropy": 5.541540813446045, "epoch": 2.9222605224963716, "grad_norm": 1.265625, "learning_rate": 0.0004152577381035422, "loss": 4.8689, "mean_token_accuracy": 0.2276713564991951, "num_tokens": 66860663.0, "step": 32215 }, { "entropy": 5.609417819976807, "epoch": 2.922714078374456, "grad_norm": 1.171875, "learning_rate": 0.00041523243623618907, "loss": 4.9114, "mean_token_accuracy": 0.2171732172369957, "num_tokens": 66871473.0, "step": 32220 }, { "entropy": 5.50028657913208, "epoch": 2.9231676342525397, "grad_norm": 1.265625, "learning_rate": 0.00041520713146879333, "loss": 4.8722, "mean_token_accuracy": 0.2147811993956566, "num_tokens": 66881609.0, "step": 32225 }, { "entropy": 5.546068620681763, "epoch": 2.923621190130624, "grad_norm": 1.1328125, "learning_rate": 0.00041518182380187853, "loss": 4.9226, "mean_token_accuracy": 0.2135738417506218, "num_tokens": 66891780.0, "step": 32230 }, { "entropy": 5.606244850158691, "epoch": 2.924074746008708, "grad_norm": 1.2265625, "learning_rate": 0.00041515651323596774, "loss": 5.0152, "mean_token_accuracy": 0.2069510981440544, "num_tokens": 66902251.0, "step": 32235 }, { "entropy": 5.585474920272827, "epoch": 2.9245283018867925, "grad_norm": 1.109375, "learning_rate": 0.00041513119977158464, "loss": 4.9414, "mean_token_accuracy": 0.2141524687409401, "num_tokens": 66912538.0, "step": 32240 }, { "entropy": 5.544709396362305, "epoch": 2.9249818577648767, "grad_norm": 1.1796875, "learning_rate": 0.0004151058834092526, "loss": 4.9026, "mean_token_accuracy": 0.2185381069779396, "num_tokens": 66922648.0, "step": 32245 }, { "entropy": 5.512761020660401, "epoch": 2.925435413642961, "grad_norm": 1.140625, "learning_rate": 0.00041508056414949515, "loss": 4.8318, "mean_token_accuracy": 0.2172267198562622, "num_tokens": 66933115.0, "step": 32250 }, { "entropy": 5.582364511489868, "epoch": 2.9258889695210453, "grad_norm": 1.1328125, "learning_rate": 0.000415055241992836, "loss": 5.0544, "mean_token_accuracy": 0.20653746724128724, "num_tokens": 66943727.0, "step": 32255 }, { "entropy": 5.557615661621094, "epoch": 2.926342525399129, "grad_norm": 1.2578125, "learning_rate": 0.0004150299169397987, "loss": 4.8749, "mean_token_accuracy": 0.21730950027704238, "num_tokens": 66953488.0, "step": 32260 }, { "entropy": 5.624796056747437, "epoch": 2.9267960812772134, "grad_norm": 1.15625, "learning_rate": 0.0004150045889909071, "loss": 5.0212, "mean_token_accuracy": 0.2051413595676422, "num_tokens": 66964586.0, "step": 32265 }, { "entropy": 5.552080202102661, "epoch": 2.9272496371552976, "grad_norm": 1.2890625, "learning_rate": 0.0004149792581466848, "loss": 4.9608, "mean_token_accuracy": 0.20885419845581055, "num_tokens": 66975032.0, "step": 32270 }, { "entropy": 5.574852657318115, "epoch": 2.9277031930333814, "grad_norm": 1.3125, "learning_rate": 0.00041495392440765586, "loss": 4.8919, "mean_token_accuracy": 0.2216252401471138, "num_tokens": 66984910.0, "step": 32275 }, { "entropy": 5.541440820693969, "epoch": 2.9281567489114657, "grad_norm": 1.28125, "learning_rate": 0.00041492858777434407, "loss": 4.7116, "mean_token_accuracy": 0.23320505321025847, "num_tokens": 66995238.0, "step": 32280 }, { "entropy": 5.520256280899048, "epoch": 2.92861030478955, "grad_norm": 1.09375, "learning_rate": 0.0004149032482472734, "loss": 4.8694, "mean_token_accuracy": 0.22672948837280274, "num_tokens": 67005596.0, "step": 32285 }, { "entropy": 5.632413101196289, "epoch": 2.9290638606676342, "grad_norm": 1.2734375, "learning_rate": 0.00041487790582696803, "loss": 5.0736, "mean_token_accuracy": 0.20305684208869934, "num_tokens": 67017312.0, "step": 32290 }, { "entropy": 5.5625011920928955, "epoch": 2.9295174165457185, "grad_norm": 1.1875, "learning_rate": 0.0004148525605139518, "loss": 4.8707, "mean_token_accuracy": 0.2237891972064972, "num_tokens": 67026692.0, "step": 32295 }, { "entropy": 5.503364038467407, "epoch": 2.9299709724238028, "grad_norm": 1.1328125, "learning_rate": 0.00041482721230874897, "loss": 4.8973, "mean_token_accuracy": 0.2196035847067833, "num_tokens": 67036801.0, "step": 32300 }, { "entropy": 5.498670291900635, "epoch": 2.930424528301887, "grad_norm": 1.1875, "learning_rate": 0.00041480186121188383, "loss": 4.8665, "mean_token_accuracy": 0.22340067923069, "num_tokens": 67047262.0, "step": 32305 }, { "entropy": 5.555596113204956, "epoch": 2.930878084179971, "grad_norm": 1.1015625, "learning_rate": 0.0004147765072238806, "loss": 4.9604, "mean_token_accuracy": 0.20992930382490158, "num_tokens": 67058019.0, "step": 32310 }, { "entropy": 5.608548498153686, "epoch": 2.931331640058055, "grad_norm": 1.1171875, "learning_rate": 0.0004147511503452635, "loss": 4.9919, "mean_token_accuracy": 0.21123094558715821, "num_tokens": 67068844.0, "step": 32315 }, { "entropy": 5.578943872451783, "epoch": 2.9317851959361394, "grad_norm": 1.328125, "learning_rate": 0.00041472579057655703, "loss": 4.8616, "mean_token_accuracy": 0.22444686740636827, "num_tokens": 67077400.0, "step": 32320 }, { "entropy": 5.554438591003418, "epoch": 2.9322387518142237, "grad_norm": 1.2109375, "learning_rate": 0.0004147004279182856, "loss": 5.033, "mean_token_accuracy": 0.20300233364105225, "num_tokens": 67088352.0, "step": 32325 }, { "entropy": 5.617301321029663, "epoch": 2.9326923076923075, "grad_norm": 1.3203125, "learning_rate": 0.0004146750623709737, "loss": 4.9696, "mean_token_accuracy": 0.21767656952142717, "num_tokens": 67097879.0, "step": 32330 }, { "entropy": 5.561146640777588, "epoch": 2.9331458635703918, "grad_norm": 1.328125, "learning_rate": 0.00041464969393514595, "loss": 4.879, "mean_token_accuracy": 0.2222677767276764, "num_tokens": 67108355.0, "step": 32335 }, { "entropy": 5.536419105529785, "epoch": 2.933599419448476, "grad_norm": 1.34375, "learning_rate": 0.0004146243226113269, "loss": 4.9404, "mean_token_accuracy": 0.21575187593698503, "num_tokens": 67118348.0, "step": 32340 }, { "entropy": 5.469606494903564, "epoch": 2.9340529753265603, "grad_norm": 1.1796875, "learning_rate": 0.00041459894840004135, "loss": 4.8433, "mean_token_accuracy": 0.226780304312706, "num_tokens": 67128944.0, "step": 32345 }, { "entropy": 5.578501033782959, "epoch": 2.9345065312046446, "grad_norm": 1.21875, "learning_rate": 0.00041457357130181396, "loss": 4.9468, "mean_token_accuracy": 0.21428166031837464, "num_tokens": 67139365.0, "step": 32350 }, { "entropy": 5.5610785484313965, "epoch": 2.934960087082729, "grad_norm": 1.1484375, "learning_rate": 0.00041454819131716945, "loss": 4.9143, "mean_token_accuracy": 0.21414373070001602, "num_tokens": 67150406.0, "step": 32355 }, { "entropy": 5.639899253845215, "epoch": 2.9354136429608126, "grad_norm": 1.265625, "learning_rate": 0.00041452280844663295, "loss": 5.0692, "mean_token_accuracy": 0.21201469302177428, "num_tokens": 67161631.0, "step": 32360 }, { "entropy": 5.535846757888794, "epoch": 2.935867198838897, "grad_norm": 1.140625, "learning_rate": 0.0004144974226907291, "loss": 4.9222, "mean_token_accuracy": 0.2199413761496544, "num_tokens": 67171735.0, "step": 32365 }, { "entropy": 5.564001512527466, "epoch": 2.936320754716981, "grad_norm": 1.2109375, "learning_rate": 0.000414472034049983, "loss": 4.9527, "mean_token_accuracy": 0.2133524790406227, "num_tokens": 67181616.0, "step": 32370 }, { "entropy": 5.559957885742188, "epoch": 2.9367743105950654, "grad_norm": 1.1875, "learning_rate": 0.0004144466425249197, "loss": 4.8937, "mean_token_accuracy": 0.2192874878644943, "num_tokens": 67192519.0, "step": 32375 }, { "entropy": 5.579954433441162, "epoch": 2.9372278664731493, "grad_norm": 1.2421875, "learning_rate": 0.0004144212481160643, "loss": 4.9103, "mean_token_accuracy": 0.2143664538860321, "num_tokens": 67202805.0, "step": 32380 }, { "entropy": 5.551706457138062, "epoch": 2.9376814223512335, "grad_norm": 1.171875, "learning_rate": 0.0004143958508239419, "loss": 4.8921, "mean_token_accuracy": 0.21774810552597046, "num_tokens": 67212778.0, "step": 32385 }, { "entropy": 5.511287355422974, "epoch": 2.938134978229318, "grad_norm": 1.1484375, "learning_rate": 0.0004143704506490779, "loss": 4.9779, "mean_token_accuracy": 0.21707876175642013, "num_tokens": 67222588.0, "step": 32390 }, { "entropy": 5.605085372924805, "epoch": 2.938588534107402, "grad_norm": 1.203125, "learning_rate": 0.0004143450475919975, "loss": 4.918, "mean_token_accuracy": 0.21651542633771897, "num_tokens": 67233022.0, "step": 32395 }, { "entropy": 5.538739109039307, "epoch": 2.9390420899854863, "grad_norm": 1.171875, "learning_rate": 0.0004143196416532259, "loss": 4.9244, "mean_token_accuracy": 0.21880135536193848, "num_tokens": 67242631.0, "step": 32400 }, { "entropy": 5.507452583312988, "epoch": 2.9394956458635706, "grad_norm": 1.1484375, "learning_rate": 0.0004142942328332887, "loss": 4.8688, "mean_token_accuracy": 0.2221100449562073, "num_tokens": 67252376.0, "step": 32405 }, { "entropy": 5.54774432182312, "epoch": 2.9399492017416544, "grad_norm": 1.21875, "learning_rate": 0.0004142688211327111, "loss": 4.8567, "mean_token_accuracy": 0.21777940392494202, "num_tokens": 67262209.0, "step": 32410 }, { "entropy": 5.587184095382691, "epoch": 2.9404027576197387, "grad_norm": 1.125, "learning_rate": 0.0004142434065520189, "loss": 4.9336, "mean_token_accuracy": 0.21069523096084594, "num_tokens": 67272893.0, "step": 32415 }, { "entropy": 5.536428737640381, "epoch": 2.940856313497823, "grad_norm": 1.15625, "learning_rate": 0.0004142179890917376, "loss": 4.9213, "mean_token_accuracy": 0.2123550593852997, "num_tokens": 67284017.0, "step": 32420 }, { "entropy": 5.4997986316680905, "epoch": 2.941309869375907, "grad_norm": 1.1953125, "learning_rate": 0.00041419256875239275, "loss": 4.8936, "mean_token_accuracy": 0.21920786052942276, "num_tokens": 67293674.0, "step": 32425 }, { "entropy": 5.479498195648193, "epoch": 2.941763425253991, "grad_norm": 1.1953125, "learning_rate": 0.0004141671455345101, "loss": 4.9311, "mean_token_accuracy": 0.21710473001003266, "num_tokens": 67303759.0, "step": 32430 }, { "entropy": 5.592838859558105, "epoch": 2.9422169811320753, "grad_norm": 1.1484375, "learning_rate": 0.00041414171943861543, "loss": 4.9618, "mean_token_accuracy": 0.21648956835269928, "num_tokens": 67314962.0, "step": 32435 }, { "entropy": 5.604931354522705, "epoch": 2.9426705370101596, "grad_norm": 1.1875, "learning_rate": 0.0004141162904652346, "loss": 5.0519, "mean_token_accuracy": 0.207221382856369, "num_tokens": 67325210.0, "step": 32440 }, { "entropy": 5.567899179458618, "epoch": 2.943124092888244, "grad_norm": 1.2109375, "learning_rate": 0.0004140908586148934, "loss": 4.9633, "mean_token_accuracy": 0.2108098417520523, "num_tokens": 67335110.0, "step": 32445 }, { "entropy": 5.571517467498779, "epoch": 2.943577648766328, "grad_norm": 1.1328125, "learning_rate": 0.0004140654238881178, "loss": 5.0166, "mean_token_accuracy": 0.21228591054677964, "num_tokens": 67345872.0, "step": 32450 }, { "entropy": 5.55539755821228, "epoch": 2.9440312046444124, "grad_norm": 1.1796875, "learning_rate": 0.00041403998628543375, "loss": 4.9271, "mean_token_accuracy": 0.210849791765213, "num_tokens": 67356532.0, "step": 32455 }, { "entropy": 5.534859561920166, "epoch": 2.9444847605224966, "grad_norm": 1.2421875, "learning_rate": 0.00041401454580736744, "loss": 4.9285, "mean_token_accuracy": 0.21846393197774888, "num_tokens": 67366603.0, "step": 32460 }, { "entropy": 5.650631237030029, "epoch": 2.9449383164005805, "grad_norm": 1.15625, "learning_rate": 0.0004139891024544448, "loss": 5.0455, "mean_token_accuracy": 0.2128206416964531, "num_tokens": 67377487.0, "step": 32465 }, { "entropy": 5.631402111053466, "epoch": 2.9453918722786647, "grad_norm": 1.203125, "learning_rate": 0.0004139636562271921, "loss": 5.0053, "mean_token_accuracy": 0.21029378920793534, "num_tokens": 67387704.0, "step": 32470 }, { "entropy": 5.592033004760742, "epoch": 2.945845428156749, "grad_norm": 1.1953125, "learning_rate": 0.00041393820712613567, "loss": 4.9925, "mean_token_accuracy": 0.2059996634721756, "num_tokens": 67398409.0, "step": 32475 }, { "entropy": 5.581689071655274, "epoch": 2.9462989840348333, "grad_norm": 1.140625, "learning_rate": 0.00041391275515180166, "loss": 4.8787, "mean_token_accuracy": 0.21427714675664902, "num_tokens": 67408905.0, "step": 32480 }, { "entropy": 5.567756795883179, "epoch": 2.946752539912917, "grad_norm": 1.171875, "learning_rate": 0.0004138873003047165, "loss": 4.8791, "mean_token_accuracy": 0.2292168289422989, "num_tokens": 67418466.0, "step": 32485 }, { "entropy": 5.459932041168213, "epoch": 2.9472060957910013, "grad_norm": 1.296875, "learning_rate": 0.0004138618425854066, "loss": 4.9121, "mean_token_accuracy": 0.2191898614168167, "num_tokens": 67428597.0, "step": 32490 }, { "entropy": 5.536923360824585, "epoch": 2.9476596516690856, "grad_norm": 1.265625, "learning_rate": 0.00041383638199439824, "loss": 4.8899, "mean_token_accuracy": 0.21513280868530274, "num_tokens": 67439158.0, "step": 32495 }, { "entropy": 5.606556940078735, "epoch": 2.94811320754717, "grad_norm": 1.1640625, "learning_rate": 0.00041381091853221835, "loss": 4.9369, "mean_token_accuracy": 0.212184838950634, "num_tokens": 67449540.0, "step": 32500 }, { "entropy": 5.567067193984985, "epoch": 2.948566763425254, "grad_norm": 1.171875, "learning_rate": 0.0004137854521993932, "loss": 4.8875, "mean_token_accuracy": 0.21786169558763505, "num_tokens": 67459385.0, "step": 32505 }, { "entropy": 5.557390785217285, "epoch": 2.9490203193033384, "grad_norm": 1.2578125, "learning_rate": 0.00041375998299644946, "loss": 4.9712, "mean_token_accuracy": 0.2185183957219124, "num_tokens": 67469597.0, "step": 32510 }, { "entropy": 5.5290497779846195, "epoch": 2.9494738751814222, "grad_norm": 1.2421875, "learning_rate": 0.000413734510923914, "loss": 4.8605, "mean_token_accuracy": 0.21801808774471282, "num_tokens": 67479271.0, "step": 32515 }, { "entropy": 5.51042914390564, "epoch": 2.9499274310595065, "grad_norm": 1.1484375, "learning_rate": 0.0004137090359823135, "loss": 4.859, "mean_token_accuracy": 0.22150608897209167, "num_tokens": 67488997.0, "step": 32520 }, { "entropy": 5.508020210266113, "epoch": 2.9503809869375908, "grad_norm": 1.203125, "learning_rate": 0.00041368355817217474, "loss": 4.901, "mean_token_accuracy": 0.21757570952177047, "num_tokens": 67499507.0, "step": 32525 }, { "entropy": 5.546919870376587, "epoch": 2.950834542815675, "grad_norm": 1.203125, "learning_rate": 0.00041365807749402467, "loss": 4.8665, "mean_token_accuracy": 0.21749072074890136, "num_tokens": 67509916.0, "step": 32530 }, { "entropy": 5.537541437149048, "epoch": 2.951288098693759, "grad_norm": 1.3125, "learning_rate": 0.0004136325939483902, "loss": 4.8968, "mean_token_accuracy": 0.21004502475261688, "num_tokens": 67519759.0, "step": 32535 }, { "entropy": 5.524202632904053, "epoch": 2.951741654571843, "grad_norm": 1.1796875, "learning_rate": 0.0004136071075357984, "loss": 4.9328, "mean_token_accuracy": 0.21901537626981735, "num_tokens": 67529261.0, "step": 32540 }, { "entropy": 5.548251295089722, "epoch": 2.9521952104499274, "grad_norm": 1.1875, "learning_rate": 0.0004135816182567763, "loss": 4.8944, "mean_token_accuracy": 0.21697842478752136, "num_tokens": 67539084.0, "step": 32545 }, { "entropy": 5.592967367172241, "epoch": 2.9526487663280117, "grad_norm": 1.2421875, "learning_rate": 0.000413556126111851, "loss": 4.9582, "mean_token_accuracy": 0.21511635780334473, "num_tokens": 67548551.0, "step": 32550 }, { "entropy": 5.560702085494995, "epoch": 2.953102322206096, "grad_norm": 1.1484375, "learning_rate": 0.0004135306311015497, "loss": 4.8968, "mean_token_accuracy": 0.21317071318626404, "num_tokens": 67558364.0, "step": 32555 }, { "entropy": 5.577459716796875, "epoch": 2.95355587808418, "grad_norm": 1.1640625, "learning_rate": 0.0004135051332263996, "loss": 4.9263, "mean_token_accuracy": 0.22179224640130996, "num_tokens": 67569257.0, "step": 32560 }, { "entropy": 5.543733167648315, "epoch": 2.954009433962264, "grad_norm": 1.21875, "learning_rate": 0.00041347963248692814, "loss": 4.9982, "mean_token_accuracy": 0.21047332286834716, "num_tokens": 67580135.0, "step": 32565 }, { "entropy": 5.509096574783325, "epoch": 2.9544629898403483, "grad_norm": 1.1796875, "learning_rate": 0.0004134541288836626, "loss": 4.9176, "mean_token_accuracy": 0.21457071453332902, "num_tokens": 67589705.0, "step": 32570 }, { "entropy": 5.546480274200439, "epoch": 2.9549165457184325, "grad_norm": 1.21875, "learning_rate": 0.00041342862241713034, "loss": 4.8824, "mean_token_accuracy": 0.2144412264227867, "num_tokens": 67599648.0, "step": 32575 }, { "entropy": 5.5888511657714846, "epoch": 2.955370101596517, "grad_norm": 1.234375, "learning_rate": 0.00041340311308785886, "loss": 4.882, "mean_token_accuracy": 0.21569282561540604, "num_tokens": 67609624.0, "step": 32580 }, { "entropy": 5.5008931159973145, "epoch": 2.9558236574746006, "grad_norm": 1.3046875, "learning_rate": 0.00041337760089637577, "loss": 4.9101, "mean_token_accuracy": 0.2176475018262863, "num_tokens": 67619596.0, "step": 32585 }, { "entropy": 5.543699264526367, "epoch": 2.956277213352685, "grad_norm": 1.171875, "learning_rate": 0.00041335208584320865, "loss": 4.9582, "mean_token_accuracy": 0.2097705915570259, "num_tokens": 67629667.0, "step": 32590 }, { "entropy": 5.6078942775726315, "epoch": 2.956730769230769, "grad_norm": 1.1875, "learning_rate": 0.0004133265679288851, "loss": 4.9271, "mean_token_accuracy": 0.2139340043067932, "num_tokens": 67640048.0, "step": 32595 }, { "entropy": 5.614735889434814, "epoch": 2.9571843251088534, "grad_norm": 1.0703125, "learning_rate": 0.0004133010471539329, "loss": 4.9786, "mean_token_accuracy": 0.20843395292758943, "num_tokens": 67650731.0, "step": 32600 }, { "entropy": 5.519395875930786, "epoch": 2.9576378809869377, "grad_norm": 1.1015625, "learning_rate": 0.00041327552351887983, "loss": 4.9102, "mean_token_accuracy": 0.21610843986272812, "num_tokens": 67661696.0, "step": 32605 }, { "entropy": 5.5737104415893555, "epoch": 2.958091436865022, "grad_norm": 1.1796875, "learning_rate": 0.00041324999702425366, "loss": 4.9419, "mean_token_accuracy": 0.21364403516054153, "num_tokens": 67671758.0, "step": 32610 }, { "entropy": 5.528751516342163, "epoch": 2.9585449927431062, "grad_norm": 1.1953125, "learning_rate": 0.0004132244676705823, "loss": 4.916, "mean_token_accuracy": 0.21375818699598312, "num_tokens": 67682488.0, "step": 32615 }, { "entropy": 5.581802225112915, "epoch": 2.95899854862119, "grad_norm": 1.109375, "learning_rate": 0.0004131989354583938, "loss": 4.9272, "mean_token_accuracy": 0.21794793605804444, "num_tokens": 67692945.0, "step": 32620 }, { "entropy": 5.5473089694976805, "epoch": 2.9594521044992743, "grad_norm": 1.15625, "learning_rate": 0.000413173400388216, "loss": 4.853, "mean_token_accuracy": 0.21994850039482117, "num_tokens": 67702924.0, "step": 32625 }, { "entropy": 5.5517168045043945, "epoch": 2.9599056603773586, "grad_norm": 1.109375, "learning_rate": 0.0004131478624605771, "loss": 4.9406, "mean_token_accuracy": 0.216270712018013, "num_tokens": 67714284.0, "step": 32630 }, { "entropy": 5.5863282680511475, "epoch": 2.9603592162554424, "grad_norm": 1.125, "learning_rate": 0.0004131223216760052, "loss": 4.9775, "mean_token_accuracy": 0.20805287063121797, "num_tokens": 67725902.0, "step": 32635 }, { "entropy": 5.571265602111817, "epoch": 2.9608127721335267, "grad_norm": 1.09375, "learning_rate": 0.0004130967780350286, "loss": 4.901, "mean_token_accuracy": 0.21466223895549774, "num_tokens": 67736268.0, "step": 32640 }, { "entropy": 5.614508199691772, "epoch": 2.961266328011611, "grad_norm": 1.2578125, "learning_rate": 0.0004130712315381753, "loss": 4.9298, "mean_token_accuracy": 0.22287954688072203, "num_tokens": 67745709.0, "step": 32645 }, { "entropy": 5.5743358612060545, "epoch": 2.961719883889695, "grad_norm": 1.140625, "learning_rate": 0.00041304568218597385, "loss": 4.9124, "mean_token_accuracy": 0.21217063516378404, "num_tokens": 67756092.0, "step": 32650 }, { "entropy": 5.591142416000366, "epoch": 2.9621734397677795, "grad_norm": 1.21875, "learning_rate": 0.00041302012997895246, "loss": 4.954, "mean_token_accuracy": 0.2143070727586746, "num_tokens": 67766224.0, "step": 32655 }, { "entropy": 5.677934980392456, "epoch": 2.9626269956458637, "grad_norm": 1.1171875, "learning_rate": 0.0004129945749176395, "loss": 5.0637, "mean_token_accuracy": 0.2124010443687439, "num_tokens": 67776787.0, "step": 32660 }, { "entropy": 5.552021551132202, "epoch": 2.963080551523948, "grad_norm": 1.265625, "learning_rate": 0.00041296901700256375, "loss": 4.9161, "mean_token_accuracy": 0.2166893571615219, "num_tokens": 67787924.0, "step": 32665 }, { "entropy": 5.553544044494629, "epoch": 2.963534107402032, "grad_norm": 1.109375, "learning_rate": 0.0004129434562342535, "loss": 4.9214, "mean_token_accuracy": 0.20735210031270981, "num_tokens": 67798544.0, "step": 32670 }, { "entropy": 5.530894565582275, "epoch": 2.963987663280116, "grad_norm": 1.03125, "learning_rate": 0.00041291789261323734, "loss": 4.9064, "mean_token_accuracy": 0.21655816733837127, "num_tokens": 67809528.0, "step": 32675 }, { "entropy": 5.459666967391968, "epoch": 2.9644412191582004, "grad_norm": 1.125, "learning_rate": 0.00041289232614004416, "loss": 4.7963, "mean_token_accuracy": 0.23257045298814774, "num_tokens": 67820263.0, "step": 32680 }, { "entropy": 5.628181838989258, "epoch": 2.9648947750362846, "grad_norm": 1.3359375, "learning_rate": 0.0004128667568152024, "loss": 4.9863, "mean_token_accuracy": 0.21517910063266754, "num_tokens": 67830687.0, "step": 32685 }, { "entropy": 5.644575548171997, "epoch": 2.9653483309143684, "grad_norm": 1.125, "learning_rate": 0.00041284118463924107, "loss": 4.9832, "mean_token_accuracy": 0.21090296506881714, "num_tokens": 67841714.0, "step": 32690 }, { "entropy": 5.523320627212525, "epoch": 2.9658018867924527, "grad_norm": 1.25, "learning_rate": 0.0004128156096126889, "loss": 4.9081, "mean_token_accuracy": 0.21795988082885742, "num_tokens": 67851952.0, "step": 32695 }, { "entropy": 5.476687383651734, "epoch": 2.966255442670537, "grad_norm": 1.140625, "learning_rate": 0.00041279003173607477, "loss": 4.8065, "mean_token_accuracy": 0.22004805654287338, "num_tokens": 67861958.0, "step": 32700 }, { "entropy": 5.494622421264649, "epoch": 2.9667089985486212, "grad_norm": 1.21875, "learning_rate": 0.0004127644510099278, "loss": 4.7933, "mean_token_accuracy": 0.2230198323726654, "num_tokens": 67871654.0, "step": 32705 }, { "entropy": 5.495678520202636, "epoch": 2.9671625544267055, "grad_norm": 1.171875, "learning_rate": 0.0004127388674347767, "loss": 4.8901, "mean_token_accuracy": 0.22344845831394194, "num_tokens": 67881678.0, "step": 32710 }, { "entropy": 5.525390672683716, "epoch": 2.96761611030479, "grad_norm": 1.125, "learning_rate": 0.00041271328101115075, "loss": 4.9323, "mean_token_accuracy": 0.2161878004670143, "num_tokens": 67892663.0, "step": 32715 }, { "entropy": 5.667909574508667, "epoch": 2.9680696661828736, "grad_norm": 1.3359375, "learning_rate": 0.00041268769173957915, "loss": 5.0726, "mean_token_accuracy": 0.20655827969312668, "num_tokens": 67903308.0, "step": 32720 }, { "entropy": 5.570732927322387, "epoch": 2.968523222060958, "grad_norm": 1.2734375, "learning_rate": 0.00041266209962059097, "loss": 4.9148, "mean_token_accuracy": 0.2176555275917053, "num_tokens": 67913092.0, "step": 32725 }, { "entropy": 5.540024709701538, "epoch": 2.968976777939042, "grad_norm": 1.15625, "learning_rate": 0.0004126365046547154, "loss": 4.9034, "mean_token_accuracy": 0.22821951061487197, "num_tokens": 67923708.0, "step": 32730 }, { "entropy": 5.4940650939941404, "epoch": 2.9694303338171264, "grad_norm": 1.125, "learning_rate": 0.0004126109068424819, "loss": 4.9046, "mean_token_accuracy": 0.21351844668388367, "num_tokens": 67934164.0, "step": 32735 }, { "entropy": 5.624765014648437, "epoch": 2.96988388969521, "grad_norm": 1.3125, "learning_rate": 0.0004125853061844198, "loss": 5.0018, "mean_token_accuracy": 0.20874401777982712, "num_tokens": 67943162.0, "step": 32740 }, { "entropy": 5.597575759887695, "epoch": 2.9703374455732945, "grad_norm": 1.1328125, "learning_rate": 0.0004125597026810585, "loss": 4.984, "mean_token_accuracy": 0.2133081629872322, "num_tokens": 67953943.0, "step": 32745 }, { "entropy": 5.508371829986572, "epoch": 2.9707910014513788, "grad_norm": 1.203125, "learning_rate": 0.00041253409633292747, "loss": 4.8849, "mean_token_accuracy": 0.2165821373462677, "num_tokens": 67964603.0, "step": 32750 }, { "entropy": 5.573017215728759, "epoch": 2.971244557329463, "grad_norm": 1.2109375, "learning_rate": 0.00041250848714055626, "loss": 4.9704, "mean_token_accuracy": 0.21357410699129104, "num_tokens": 67974541.0, "step": 32755 }, { "entropy": 5.597278022766114, "epoch": 2.9716981132075473, "grad_norm": 1.0859375, "learning_rate": 0.0004124828751044746, "loss": 4.9376, "mean_token_accuracy": 0.20984164625406265, "num_tokens": 67984968.0, "step": 32760 }, { "entropy": 5.54750804901123, "epoch": 2.9721516690856316, "grad_norm": 1.234375, "learning_rate": 0.0004124572602252119, "loss": 4.8755, "mean_token_accuracy": 0.22026091665029526, "num_tokens": 67995567.0, "step": 32765 }, { "entropy": 5.620554685592651, "epoch": 2.9726052249637154, "grad_norm": 1.1328125, "learning_rate": 0.0004124316425032981, "loss": 5.0341, "mean_token_accuracy": 0.20670343041419983, "num_tokens": 68008530.0, "step": 32770 }, { "entropy": 5.640254974365234, "epoch": 2.9730587808417996, "grad_norm": 1.171875, "learning_rate": 0.00041240602193926294, "loss": 5.0069, "mean_token_accuracy": 0.2080129712820053, "num_tokens": 68018393.0, "step": 32775 }, { "entropy": 5.5888418674469, "epoch": 2.973512336719884, "grad_norm": 1.28125, "learning_rate": 0.0004123803985336362, "loss": 4.941, "mean_token_accuracy": 0.21129584014415742, "num_tokens": 68027677.0, "step": 32780 }, { "entropy": 5.524590635299683, "epoch": 2.973965892597968, "grad_norm": 1.2578125, "learning_rate": 0.00041235477228694786, "loss": 4.8169, "mean_token_accuracy": 0.227382592856884, "num_tokens": 68037157.0, "step": 32785 }, { "entropy": 5.547086095809936, "epoch": 2.974419448476052, "grad_norm": 1.140625, "learning_rate": 0.00041232914319972775, "loss": 4.9031, "mean_token_accuracy": 0.22174557745456697, "num_tokens": 68047793.0, "step": 32790 }, { "entropy": 5.549725818634033, "epoch": 2.9748730043541363, "grad_norm": 1.25, "learning_rate": 0.00041230351127250603, "loss": 4.9568, "mean_token_accuracy": 0.2223878026008606, "num_tokens": 68058155.0, "step": 32795 }, { "entropy": 5.617917060852051, "epoch": 2.9753265602322205, "grad_norm": 1.1953125, "learning_rate": 0.00041227787650581266, "loss": 4.8619, "mean_token_accuracy": 0.21902658194303512, "num_tokens": 68067440.0, "step": 32800 }, { "entropy": 5.5729207515716555, "epoch": 2.975780116110305, "grad_norm": 1.1328125, "learning_rate": 0.00041225223890017785, "loss": 4.9472, "mean_token_accuracy": 0.2187219515442848, "num_tokens": 68077815.0, "step": 32805 }, { "entropy": 5.536134243011475, "epoch": 2.976233671988389, "grad_norm": 1.1875, "learning_rate": 0.00041222659845613173, "loss": 4.8792, "mean_token_accuracy": 0.2223426803946495, "num_tokens": 68087692.0, "step": 32810 }, { "entropy": 5.492402791976929, "epoch": 2.9766872278664733, "grad_norm": 1.2890625, "learning_rate": 0.00041220095517420464, "loss": 4.891, "mean_token_accuracy": 0.2175753191113472, "num_tokens": 68097774.0, "step": 32815 }, { "entropy": 5.550098276138305, "epoch": 2.9771407837445576, "grad_norm": 1.1796875, "learning_rate": 0.0004121753090549268, "loss": 4.9431, "mean_token_accuracy": 0.21566751450300217, "num_tokens": 68107992.0, "step": 32820 }, { "entropy": 5.521971845626831, "epoch": 2.9775943396226414, "grad_norm": 1.3046875, "learning_rate": 0.00041214966009882857, "loss": 4.8712, "mean_token_accuracy": 0.22559628635644913, "num_tokens": 68117103.0, "step": 32825 }, { "entropy": 5.597184371948242, "epoch": 2.9780478955007257, "grad_norm": 1.1328125, "learning_rate": 0.0004121240083064405, "loss": 4.9801, "mean_token_accuracy": 0.21236259043216704, "num_tokens": 68127951.0, "step": 32830 }, { "entropy": 5.610168504714966, "epoch": 2.97850145137881, "grad_norm": 1.1875, "learning_rate": 0.00041209835367829293, "loss": 4.9843, "mean_token_accuracy": 0.2209950089454651, "num_tokens": 68138229.0, "step": 32835 }, { "entropy": 5.468213129043579, "epoch": 2.9789550072568938, "grad_norm": 1.2421875, "learning_rate": 0.00041207269621491654, "loss": 4.8873, "mean_token_accuracy": 0.22095452547073363, "num_tokens": 68148019.0, "step": 32840 }, { "entropy": 5.4690577507019045, "epoch": 2.979408563134978, "grad_norm": 1.203125, "learning_rate": 0.0004120470359168418, "loss": 4.9315, "mean_token_accuracy": 0.2088165193796158, "num_tokens": 68158704.0, "step": 32845 }, { "entropy": 5.591777992248535, "epoch": 2.9798621190130623, "grad_norm": 1.2265625, "learning_rate": 0.00041202137278459946, "loss": 4.9375, "mean_token_accuracy": 0.21985854655504228, "num_tokens": 68169105.0, "step": 32850 }, { "entropy": 5.586925745010376, "epoch": 2.9803156748911466, "grad_norm": 1.1171875, "learning_rate": 0.0004119957068187202, "loss": 4.8575, "mean_token_accuracy": 0.22090157270431518, "num_tokens": 68179778.0, "step": 32855 }, { "entropy": 5.5218699932098385, "epoch": 2.980769230769231, "grad_norm": 1.21875, "learning_rate": 0.0004119700380197348, "loss": 4.8926, "mean_token_accuracy": 0.21476766616106033, "num_tokens": 68189405.0, "step": 32860 }, { "entropy": 5.4587029933929445, "epoch": 2.981222786647315, "grad_norm": 1.1796875, "learning_rate": 0.00041194436638817417, "loss": 4.8441, "mean_token_accuracy": 0.22606901079416275, "num_tokens": 68199351.0, "step": 32865 }, { "entropy": 5.598010873794555, "epoch": 2.9816763425253994, "grad_norm": 1.2265625, "learning_rate": 0.00041191869192456907, "loss": 5.0021, "mean_token_accuracy": 0.21060204654932022, "num_tokens": 68209904.0, "step": 32870 }, { "entropy": 5.615426874160766, "epoch": 2.982129898403483, "grad_norm": 1.140625, "learning_rate": 0.0004118930146294506, "loss": 5.0004, "mean_token_accuracy": 0.20826841443777083, "num_tokens": 68221754.0, "step": 32875 }, { "entropy": 5.564703559875488, "epoch": 2.9825834542815675, "grad_norm": 1.2734375, "learning_rate": 0.0004118673345033496, "loss": 4.9205, "mean_token_accuracy": 0.2094820261001587, "num_tokens": 68232328.0, "step": 32880 }, { "entropy": 5.492561292648316, "epoch": 2.9830370101596517, "grad_norm": 1.15625, "learning_rate": 0.0004118416515467974, "loss": 4.8533, "mean_token_accuracy": 0.217547769844532, "num_tokens": 68242812.0, "step": 32885 }, { "entropy": 5.636599349975586, "epoch": 2.983490566037736, "grad_norm": 1.046875, "learning_rate": 0.0004118159657603248, "loss": 5.0021, "mean_token_accuracy": 0.2141905352473259, "num_tokens": 68253888.0, "step": 32890 }, { "entropy": 5.6142597675323485, "epoch": 2.98394412191582, "grad_norm": 1.25, "learning_rate": 0.0004117902771444633, "loss": 4.9227, "mean_token_accuracy": 0.2176228553056717, "num_tokens": 68264877.0, "step": 32895 }, { "entropy": 5.657246208190918, "epoch": 2.984397677793904, "grad_norm": 1.125, "learning_rate": 0.000411764585699744, "loss": 5.0165, "mean_token_accuracy": 0.20741144567728043, "num_tokens": 68275863.0, "step": 32900 }, { "entropy": 5.573932266235351, "epoch": 2.9848512336719883, "grad_norm": 1.1328125, "learning_rate": 0.00041173889142669806, "loss": 4.93, "mean_token_accuracy": 0.21535502523183822, "num_tokens": 68286768.0, "step": 32905 }, { "entropy": 5.54905219078064, "epoch": 2.9853047895500726, "grad_norm": 1.15625, "learning_rate": 0.0004117131943258572, "loss": 4.8689, "mean_token_accuracy": 0.2205004498362541, "num_tokens": 68296990.0, "step": 32910 }, { "entropy": 5.480344486236572, "epoch": 2.985758345428157, "grad_norm": 1.109375, "learning_rate": 0.00041168749439775255, "loss": 4.8718, "mean_token_accuracy": 0.2165363386273384, "num_tokens": 68307646.0, "step": 32915 }, { "entropy": 5.596737194061279, "epoch": 2.986211901306241, "grad_norm": 1.171875, "learning_rate": 0.0004116617916429156, "loss": 5.0082, "mean_token_accuracy": 0.20310408025979995, "num_tokens": 68319586.0, "step": 32920 }, { "entropy": 5.645182704925537, "epoch": 2.986665457184325, "grad_norm": 1.1640625, "learning_rate": 0.0004116360860618781, "loss": 4.9835, "mean_token_accuracy": 0.21313963681459427, "num_tokens": 68329692.0, "step": 32925 }, { "entropy": 5.6401551246643065, "epoch": 2.9871190130624092, "grad_norm": 1.1328125, "learning_rate": 0.0004116103776551715, "loss": 4.9338, "mean_token_accuracy": 0.21233301907777785, "num_tokens": 68339589.0, "step": 32930 }, { "entropy": 5.595186614990235, "epoch": 2.9875725689404935, "grad_norm": 1.125, "learning_rate": 0.00041158466642332743, "loss": 5.0005, "mean_token_accuracy": 0.2034110650420189, "num_tokens": 68349485.0, "step": 32935 }, { "entropy": 5.589399147033691, "epoch": 2.9880261248185778, "grad_norm": 1.2421875, "learning_rate": 0.0004115589523668777, "loss": 4.9, "mean_token_accuracy": 0.22183861583471298, "num_tokens": 68359695.0, "step": 32940 }, { "entropy": 5.5047607421875, "epoch": 2.9884796806966616, "grad_norm": 1.140625, "learning_rate": 0.000411533235486354, "loss": 4.8119, "mean_token_accuracy": 0.22178723961114882, "num_tokens": 68369591.0, "step": 32945 }, { "entropy": 5.586577844619751, "epoch": 2.988933236574746, "grad_norm": 1.1640625, "learning_rate": 0.0004115075157822883, "loss": 4.9371, "mean_token_accuracy": 0.22116850614547728, "num_tokens": 68380382.0, "step": 32950 }, { "entropy": 5.453122091293335, "epoch": 2.98938679245283, "grad_norm": 1.265625, "learning_rate": 0.0004114817932552122, "loss": 4.8156, "mean_token_accuracy": 0.21976580321788788, "num_tokens": 68389865.0, "step": 32955 }, { "entropy": 5.498558187484742, "epoch": 2.9898403483309144, "grad_norm": 1.171875, "learning_rate": 0.00041145606790565797, "loss": 4.8479, "mean_token_accuracy": 0.2309402585029602, "num_tokens": 68399267.0, "step": 32960 }, { "entropy": 5.5747607231140135, "epoch": 2.9902939042089987, "grad_norm": 1.484375, "learning_rate": 0.0004114303397341575, "loss": 4.942, "mean_token_accuracy": 0.22618331760168076, "num_tokens": 68409480.0, "step": 32965 }, { "entropy": 5.6772459030151365, "epoch": 2.990747460087083, "grad_norm": 1.1328125, "learning_rate": 0.0004114046087412427, "loss": 5.0389, "mean_token_accuracy": 0.2100787028670311, "num_tokens": 68420019.0, "step": 32970 }, { "entropy": 5.490229701995849, "epoch": 2.9912010159651667, "grad_norm": 1.234375, "learning_rate": 0.000411378874927446, "loss": 4.882, "mean_token_accuracy": 0.2197356641292572, "num_tokens": 68429967.0, "step": 32975 }, { "entropy": 5.4569525718688965, "epoch": 2.991654571843251, "grad_norm": 1.078125, "learning_rate": 0.0004113531382932993, "loss": 4.882, "mean_token_accuracy": 0.21734683513641356, "num_tokens": 68441639.0, "step": 32980 }, { "entropy": 5.564846992492676, "epoch": 2.9921081277213353, "grad_norm": 1.1171875, "learning_rate": 0.000411327398839335, "loss": 4.94, "mean_token_accuracy": 0.21031366735696794, "num_tokens": 68452781.0, "step": 32985 }, { "entropy": 5.561367416381836, "epoch": 2.9925616835994195, "grad_norm": 1.15625, "learning_rate": 0.0004113016565660854, "loss": 4.8775, "mean_token_accuracy": 0.21896420568227767, "num_tokens": 68463353.0, "step": 32990 }, { "entropy": 5.539358901977539, "epoch": 2.9930152394775034, "grad_norm": 1.0546875, "learning_rate": 0.00041127591147408274, "loss": 4.8932, "mean_token_accuracy": 0.20935145020484924, "num_tokens": 68473507.0, "step": 32995 }, { "entropy": 5.554093742370606, "epoch": 2.9934687953555876, "grad_norm": 1.1953125, "learning_rate": 0.00041125016356385945, "loss": 4.9162, "mean_token_accuracy": 0.22207578420639038, "num_tokens": 68483737.0, "step": 33000 }, { "epoch": 2.9934687953555876, "eval_entropy": 5.290873151343333, "eval_loss": 4.967285633087158, "eval_mean_token_accuracy": 0.22357556195550374, "eval_num_tokens": 68483737.0, "eval_runtime": 20.5868, "eval_samples_per_second": 1717.608, "eval_steps_per_second": 214.701, "step": 33000 }, { "entropy": 5.558495664596558, "epoch": 2.993922351233672, "grad_norm": 1.140625, "learning_rate": 0.00041122441283594817, "loss": 4.9349, "mean_token_accuracy": 0.21845910847187042, "num_tokens": 68494013.0, "step": 33005 }, { "entropy": 5.490463590621948, "epoch": 2.994375907111756, "grad_norm": 1.3125, "learning_rate": 0.0004111986592908813, "loss": 4.8585, "mean_token_accuracy": 0.22673794031143188, "num_tokens": 68504361.0, "step": 33010 }, { "entropy": 5.502665758132935, "epoch": 2.9948294629898404, "grad_norm": 1.375, "learning_rate": 0.00041117290292919134, "loss": 4.8446, "mean_token_accuracy": 0.2210651308298111, "num_tokens": 68514825.0, "step": 33015 }, { "entropy": 5.548485660552979, "epoch": 2.9952830188679247, "grad_norm": 1.109375, "learning_rate": 0.0004111471437514111, "loss": 4.8597, "mean_token_accuracy": 0.21454495191574097, "num_tokens": 68524858.0, "step": 33020 }, { "entropy": 5.535737037658691, "epoch": 2.995736574746009, "grad_norm": 1.1875, "learning_rate": 0.0004111213817580733, "loss": 4.8347, "mean_token_accuracy": 0.2262229725718498, "num_tokens": 68534481.0, "step": 33025 }, { "entropy": 5.508427286148072, "epoch": 2.996190130624093, "grad_norm": 1.1953125, "learning_rate": 0.0004110956169497106, "loss": 4.9086, "mean_token_accuracy": 0.21640910804271699, "num_tokens": 68545436.0, "step": 33030 }, { "entropy": 5.53284215927124, "epoch": 2.996643686502177, "grad_norm": 1.2578125, "learning_rate": 0.0004110698493268558, "loss": 4.9073, "mean_token_accuracy": 0.22356501817703248, "num_tokens": 68555434.0, "step": 33035 }, { "entropy": 5.564860868453979, "epoch": 2.9970972423802613, "grad_norm": 1.1875, "learning_rate": 0.0004110440788900419, "loss": 5.0303, "mean_token_accuracy": 0.21122870445251465, "num_tokens": 68566295.0, "step": 33040 }, { "entropy": 5.526291751861573, "epoch": 2.9975507982583456, "grad_norm": 1.21875, "learning_rate": 0.00041101830563980174, "loss": 4.8402, "mean_token_accuracy": 0.22296057045459747, "num_tokens": 68575927.0, "step": 33045 }, { "entropy": 5.6168183326721195, "epoch": 2.9980043541364294, "grad_norm": 1.140625, "learning_rate": 0.00041099252957666843, "loss": 4.9479, "mean_token_accuracy": 0.2188567265868187, "num_tokens": 68586254.0, "step": 33050 }, { "entropy": 5.502985429763794, "epoch": 2.9984579100145137, "grad_norm": 1.1171875, "learning_rate": 0.00041096675070117496, "loss": 4.9314, "mean_token_accuracy": 0.21814779937267303, "num_tokens": 68596881.0, "step": 33055 }, { "entropy": 5.475627183914185, "epoch": 2.998911465892598, "grad_norm": 1.2265625, "learning_rate": 0.00041094096901385434, "loss": 4.8276, "mean_token_accuracy": 0.2229520007967949, "num_tokens": 68606875.0, "step": 33060 }, { "entropy": 5.601109743118286, "epoch": 2.999365021770682, "grad_norm": 1.296875, "learning_rate": 0.0004109151845152399, "loss": 4.9338, "mean_token_accuracy": 0.21973366290330887, "num_tokens": 68617011.0, "step": 33065 }, { "entropy": 5.608200120925903, "epoch": 2.9998185776487665, "grad_norm": 1.234375, "learning_rate": 0.0004108893972058649, "loss": 4.9551, "mean_token_accuracy": 0.21498948335647583, "num_tokens": 68627764.0, "step": 33070 }, { "entropy": 5.589737606048584, "epoch": 3.0002721335268503, "grad_norm": 1.1484375, "learning_rate": 0.00041086360708626236, "loss": 4.9193, "mean_token_accuracy": 0.21905701756477355, "num_tokens": 68637272.0, "step": 33075 }, { "entropy": 5.4978930950164795, "epoch": 3.0007256894049346, "grad_norm": 1.203125, "learning_rate": 0.00041083781415696585, "loss": 4.8717, "mean_token_accuracy": 0.21449463069438934, "num_tokens": 68648058.0, "step": 33080 }, { "entropy": 5.4735297679901125, "epoch": 3.001179245283019, "grad_norm": 1.1875, "learning_rate": 0.0004108120184185088, "loss": 4.7903, "mean_token_accuracy": 0.22719339579343795, "num_tokens": 68658174.0, "step": 33085 }, { "entropy": 5.5593860149383545, "epoch": 3.001632801161103, "grad_norm": 1.1796875, "learning_rate": 0.00041078621987142457, "loss": 4.8244, "mean_token_accuracy": 0.23413125574588775, "num_tokens": 68669281.0, "step": 33090 }, { "entropy": 5.534533882141114, "epoch": 3.0020863570391874, "grad_norm": 1.1953125, "learning_rate": 0.0004107604185162467, "loss": 4.8951, "mean_token_accuracy": 0.21341838091611862, "num_tokens": 68679879.0, "step": 33095 }, { "entropy": 5.478369951248169, "epoch": 3.0025399129172716, "grad_norm": 1.1328125, "learning_rate": 0.00041073461435350877, "loss": 4.7921, "mean_token_accuracy": 0.22448095083236694, "num_tokens": 68689852.0, "step": 33100 }, { "entropy": 5.472542095184326, "epoch": 3.0029934687953554, "grad_norm": 1.203125, "learning_rate": 0.00041070880738374447, "loss": 4.8769, "mean_token_accuracy": 0.22312019318342208, "num_tokens": 68700149.0, "step": 33105 }, { "entropy": 5.509248447418213, "epoch": 3.0034470246734397, "grad_norm": 1.2734375, "learning_rate": 0.00041068299760748734, "loss": 4.8517, "mean_token_accuracy": 0.2193642243742943, "num_tokens": 68710837.0, "step": 33110 }, { "entropy": 5.552023124694824, "epoch": 3.003900580551524, "grad_norm": 1.1171875, "learning_rate": 0.00041065718502527134, "loss": 4.9038, "mean_token_accuracy": 0.21803360432386398, "num_tokens": 68721451.0, "step": 33115 }, { "entropy": 5.506927442550659, "epoch": 3.0043541364296082, "grad_norm": 1.2578125, "learning_rate": 0.00041063136963763013, "loss": 4.8469, "mean_token_accuracy": 0.22254530042409898, "num_tokens": 68732911.0, "step": 33120 }, { "entropy": 5.520870733261108, "epoch": 3.0048076923076925, "grad_norm": 1.2265625, "learning_rate": 0.0004106055514450977, "loss": 4.8136, "mean_token_accuracy": 0.22911326885223388, "num_tokens": 68742650.0, "step": 33125 }, { "entropy": 5.496462965011597, "epoch": 3.0052612481857763, "grad_norm": 1.1796875, "learning_rate": 0.0004105797304482079, "loss": 4.8263, "mean_token_accuracy": 0.22387445569038392, "num_tokens": 68753660.0, "step": 33130 }, { "entropy": 5.467442417144776, "epoch": 3.0057148040638606, "grad_norm": 1.21875, "learning_rate": 0.0004105539066474947, "loss": 4.7386, "mean_token_accuracy": 0.22541164308786393, "num_tokens": 68763868.0, "step": 33135 }, { "entropy": 5.5195940971374515, "epoch": 3.006168359941945, "grad_norm": 1.1875, "learning_rate": 0.00041052808004349214, "loss": 4.8533, "mean_token_accuracy": 0.2229118600487709, "num_tokens": 68773911.0, "step": 33140 }, { "entropy": 5.550774717330933, "epoch": 3.006621915820029, "grad_norm": 1.171875, "learning_rate": 0.0004105022506367344, "loss": 4.9398, "mean_token_accuracy": 0.21408320367336273, "num_tokens": 68786423.0, "step": 33145 }, { "entropy": 5.523630094528198, "epoch": 3.0070754716981134, "grad_norm": 1.203125, "learning_rate": 0.0004104764184277555, "loss": 4.9035, "mean_token_accuracy": 0.21312060505151748, "num_tokens": 68797329.0, "step": 33150 }, { "entropy": 5.59370265007019, "epoch": 3.0075290275761972, "grad_norm": 1.078125, "learning_rate": 0.0004104505834170898, "loss": 4.9361, "mean_token_accuracy": 0.2170417219400406, "num_tokens": 68808447.0, "step": 33155 }, { "entropy": 5.565026903152466, "epoch": 3.0079825834542815, "grad_norm": 1.1875, "learning_rate": 0.00041042474560527153, "loss": 4.869, "mean_token_accuracy": 0.22275021374225618, "num_tokens": 68819381.0, "step": 33160 }, { "entropy": 5.467403173446655, "epoch": 3.0084361393323658, "grad_norm": 1.15625, "learning_rate": 0.000410398904992835, "loss": 4.8084, "mean_token_accuracy": 0.22707327157258989, "num_tokens": 68829319.0, "step": 33165 }, { "entropy": 5.497539520263672, "epoch": 3.00888969521045, "grad_norm": 1.1796875, "learning_rate": 0.00041037306158031464, "loss": 4.9171, "mean_token_accuracy": 0.2244374379515648, "num_tokens": 68838640.0, "step": 33170 }, { "entropy": 5.5500000476837155, "epoch": 3.0093432510885343, "grad_norm": 1.109375, "learning_rate": 0.0004103472153682448, "loss": 4.8494, "mean_token_accuracy": 0.21816093772649764, "num_tokens": 68847960.0, "step": 33175 }, { "entropy": 5.543204116821289, "epoch": 3.009796806966618, "grad_norm": 1.1484375, "learning_rate": 0.00041032136635716016, "loss": 4.8747, "mean_token_accuracy": 0.22023076564073563, "num_tokens": 68858851.0, "step": 33180 }, { "entropy": 5.494747877120972, "epoch": 3.0102503628447024, "grad_norm": 1.2109375, "learning_rate": 0.0004102955145475951, "loss": 4.8383, "mean_token_accuracy": 0.21889970153570176, "num_tokens": 68869006.0, "step": 33185 }, { "entropy": 5.614867734909057, "epoch": 3.0107039187227866, "grad_norm": 1.296875, "learning_rate": 0.00041026965994008435, "loss": 4.9392, "mean_token_accuracy": 0.21492185145616532, "num_tokens": 68879606.0, "step": 33190 }, { "entropy": 5.490984010696411, "epoch": 3.011157474600871, "grad_norm": 1.15625, "learning_rate": 0.00041024380253516253, "loss": 4.8224, "mean_token_accuracy": 0.22771223187446593, "num_tokens": 68889862.0, "step": 33195 }, { "entropy": 5.624411869049072, "epoch": 3.011611030478955, "grad_norm": 1.1484375, "learning_rate": 0.00041021794233336444, "loss": 4.9458, "mean_token_accuracy": 0.2189653217792511, "num_tokens": 68900512.0, "step": 33200 }, { "entropy": 5.538083600997925, "epoch": 3.012064586357039, "grad_norm": 1.2734375, "learning_rate": 0.0004101920793352249, "loss": 4.884, "mean_token_accuracy": 0.2161460280418396, "num_tokens": 68910475.0, "step": 33205 }, { "entropy": 5.578966331481934, "epoch": 3.0125181422351233, "grad_norm": 1.265625, "learning_rate": 0.0004101662135412786, "loss": 4.9127, "mean_token_accuracy": 0.21984424591064453, "num_tokens": 68920583.0, "step": 33210 }, { "entropy": 5.450491619110108, "epoch": 3.0129716981132075, "grad_norm": 1.296875, "learning_rate": 0.0004101403449520606, "loss": 4.8085, "mean_token_accuracy": 0.21742058545351028, "num_tokens": 68931016.0, "step": 33215 }, { "entropy": 5.503797245025635, "epoch": 3.013425253991292, "grad_norm": 1.1875, "learning_rate": 0.00041011447356810584, "loss": 4.8251, "mean_token_accuracy": 0.22179421037435532, "num_tokens": 68941489.0, "step": 33220 }, { "entropy": 5.570745182037354, "epoch": 3.013878809869376, "grad_norm": 1.15625, "learning_rate": 0.0004100885993899493, "loss": 4.906, "mean_token_accuracy": 0.21582674980163574, "num_tokens": 68952322.0, "step": 33225 }, { "entropy": 5.567753028869629, "epoch": 3.01433236574746, "grad_norm": 1.15625, "learning_rate": 0.0004100627224181261, "loss": 4.8918, "mean_token_accuracy": 0.22080958038568496, "num_tokens": 68962570.0, "step": 33230 }, { "entropy": 5.582212638854981, "epoch": 3.014785921625544, "grad_norm": 1.1640625, "learning_rate": 0.00041003684265317143, "loss": 4.8265, "mean_token_accuracy": 0.22261277437210084, "num_tokens": 68973733.0, "step": 33235 }, { "entropy": 5.52776026725769, "epoch": 3.0152394775036284, "grad_norm": 1.203125, "learning_rate": 0.00041001096009562045, "loss": 4.8661, "mean_token_accuracy": 0.22449675053358079, "num_tokens": 68983526.0, "step": 33240 }, { "entropy": 5.612430381774902, "epoch": 3.0156930333817127, "grad_norm": 1.1171875, "learning_rate": 0.0004099850747460084, "loss": 4.9584, "mean_token_accuracy": 0.22062678933143615, "num_tokens": 68993968.0, "step": 33245 }, { "entropy": 5.551955318450927, "epoch": 3.016146589259797, "grad_norm": 1.28125, "learning_rate": 0.00040995918660487055, "loss": 4.833, "mean_token_accuracy": 0.2303554356098175, "num_tokens": 69003599.0, "step": 33250 }, { "entropy": 5.521548748016357, "epoch": 3.0166001451378808, "grad_norm": 1.265625, "learning_rate": 0.0004099332956727424, "loss": 4.8481, "mean_token_accuracy": 0.21906791031360626, "num_tokens": 69013686.0, "step": 33255 }, { "entropy": 5.543167400360107, "epoch": 3.017053701015965, "grad_norm": 1.140625, "learning_rate": 0.0004099074019501593, "loss": 4.8772, "mean_token_accuracy": 0.22182500660419463, "num_tokens": 69023803.0, "step": 33260 }, { "entropy": 5.49210033416748, "epoch": 3.0175072568940493, "grad_norm": 1.1953125, "learning_rate": 0.0004098815054376567, "loss": 4.776, "mean_token_accuracy": 0.2271982342004776, "num_tokens": 69033885.0, "step": 33265 }, { "entropy": 5.513218784332276, "epoch": 3.0179608127721336, "grad_norm": 1.21875, "learning_rate": 0.0004098556061357702, "loss": 4.8308, "mean_token_accuracy": 0.22322162687778474, "num_tokens": 69044471.0, "step": 33270 }, { "entropy": 5.462755012512207, "epoch": 3.018414368650218, "grad_norm": 1.140625, "learning_rate": 0.00040982970404503544, "loss": 4.7563, "mean_token_accuracy": 0.2294916346669197, "num_tokens": 69055109.0, "step": 33275 }, { "entropy": 5.488037633895874, "epoch": 3.018867924528302, "grad_norm": 1.1640625, "learning_rate": 0.00040980379916598803, "loss": 4.8628, "mean_token_accuracy": 0.22305349707603456, "num_tokens": 69064692.0, "step": 33280 }, { "entropy": 5.543799877166748, "epoch": 3.019321480406386, "grad_norm": 1.1875, "learning_rate": 0.0004097778914991637, "loss": 4.8356, "mean_token_accuracy": 0.22339656054973603, "num_tokens": 69075331.0, "step": 33285 }, { "entropy": 5.517863368988037, "epoch": 3.01977503628447, "grad_norm": 1.1328125, "learning_rate": 0.00040975198104509827, "loss": 4.8312, "mean_token_accuracy": 0.22567791789770125, "num_tokens": 69085017.0, "step": 33290 }, { "entropy": 5.476214218139648, "epoch": 3.0202285921625545, "grad_norm": 1.25, "learning_rate": 0.0004097260678043275, "loss": 4.8498, "mean_token_accuracy": 0.21534609347581862, "num_tokens": 69096128.0, "step": 33295 }, { "entropy": 5.567341756820679, "epoch": 3.0206821480406387, "grad_norm": 1.21875, "learning_rate": 0.00040970015177738725, "loss": 4.96, "mean_token_accuracy": 0.21352556198835373, "num_tokens": 69106479.0, "step": 33300 }, { "entropy": 5.613250112533569, "epoch": 3.021135703918723, "grad_norm": 1.234375, "learning_rate": 0.0004096742329648136, "loss": 4.8939, "mean_token_accuracy": 0.21715326011180877, "num_tokens": 69116346.0, "step": 33305 }, { "entropy": 5.544456720352173, "epoch": 3.021589259796807, "grad_norm": 1.15625, "learning_rate": 0.0004096483113671425, "loss": 4.9034, "mean_token_accuracy": 0.21691830903291703, "num_tokens": 69126489.0, "step": 33310 }, { "entropy": 5.523610544204712, "epoch": 3.022042815674891, "grad_norm": 1.234375, "learning_rate": 0.00040962238698490994, "loss": 4.8581, "mean_token_accuracy": 0.22266105115413665, "num_tokens": 69136618.0, "step": 33315 }, { "entropy": 5.571689081192017, "epoch": 3.0224963715529753, "grad_norm": 1.109375, "learning_rate": 0.0004095964598186522, "loss": 4.9262, "mean_token_accuracy": 0.21185413002967834, "num_tokens": 69146242.0, "step": 33320 }, { "entropy": 5.530975580215454, "epoch": 3.0229499274310596, "grad_norm": 1.1953125, "learning_rate": 0.0004095705298689053, "loss": 4.8318, "mean_token_accuracy": 0.22369010895490646, "num_tokens": 69157269.0, "step": 33325 }, { "entropy": 5.621033000946045, "epoch": 3.023403483309144, "grad_norm": 1.1171875, "learning_rate": 0.00040954459713620563, "loss": 4.9375, "mean_token_accuracy": 0.2155551165342331, "num_tokens": 69169260.0, "step": 33330 }, { "entropy": 5.642344331741333, "epoch": 3.0238570391872277, "grad_norm": 1.2421875, "learning_rate": 0.0004095186616210893, "loss": 4.9905, "mean_token_accuracy": 0.20207439363002777, "num_tokens": 69179815.0, "step": 33335 }, { "entropy": 5.601299142837524, "epoch": 3.024310595065312, "grad_norm": 1.1484375, "learning_rate": 0.0004094927233240928, "loss": 4.9587, "mean_token_accuracy": 0.2140293002128601, "num_tokens": 69189959.0, "step": 33340 }, { "entropy": 5.512681531906128, "epoch": 3.0247641509433962, "grad_norm": 1.1484375, "learning_rate": 0.00040946678224575264, "loss": 4.8532, "mean_token_accuracy": 0.22089072614908217, "num_tokens": 69199485.0, "step": 33345 }, { "entropy": 5.4578361988067625, "epoch": 3.0252177068214805, "grad_norm": 1.296875, "learning_rate": 0.000409440838386605, "loss": 4.8716, "mean_token_accuracy": 0.21979523599147796, "num_tokens": 69209180.0, "step": 33350 }, { "entropy": 5.5685145378112795, "epoch": 3.0256712626995648, "grad_norm": 1.21875, "learning_rate": 0.0004094148917471866, "loss": 4.9108, "mean_token_accuracy": 0.217694553732872, "num_tokens": 69220648.0, "step": 33355 }, { "entropy": 5.500479030609131, "epoch": 3.0261248185776486, "grad_norm": 1.2890625, "learning_rate": 0.000409388942328034, "loss": 4.7516, "mean_token_accuracy": 0.22733724117279053, "num_tokens": 69230685.0, "step": 33360 }, { "entropy": 5.499433183670044, "epoch": 3.026578374455733, "grad_norm": 1.2890625, "learning_rate": 0.0004093629901296838, "loss": 4.9042, "mean_token_accuracy": 0.21350348442792894, "num_tokens": 69240407.0, "step": 33365 }, { "entropy": 5.614395618438721, "epoch": 3.027031930333817, "grad_norm": 1.234375, "learning_rate": 0.0004093370351526727, "loss": 4.9233, "mean_token_accuracy": 0.2155456319451332, "num_tokens": 69250624.0, "step": 33370 }, { "entropy": 5.603523063659668, "epoch": 3.0274854862119014, "grad_norm": 1.5, "learning_rate": 0.0004093110773975376, "loss": 4.9408, "mean_token_accuracy": 0.20913257598876953, "num_tokens": 69261131.0, "step": 33375 }, { "entropy": 5.503702163696289, "epoch": 3.0279390420899857, "grad_norm": 1.2734375, "learning_rate": 0.0004092851168648152, "loss": 4.8917, "mean_token_accuracy": 0.2144733726978302, "num_tokens": 69270668.0, "step": 33380 }, { "entropy": 5.528714561462403, "epoch": 3.0283925979680695, "grad_norm": 1.1953125, "learning_rate": 0.0004092591535550422, "loss": 4.824, "mean_token_accuracy": 0.22638099938631057, "num_tokens": 69280528.0, "step": 33385 }, { "entropy": 5.513356113433838, "epoch": 3.0288461538461537, "grad_norm": 1.25, "learning_rate": 0.0004092331874687558, "loss": 4.8455, "mean_token_accuracy": 0.22600357234477997, "num_tokens": 69290376.0, "step": 33390 }, { "entropy": 5.539975214004516, "epoch": 3.029299709724238, "grad_norm": 1.078125, "learning_rate": 0.00040920721860649285, "loss": 4.8744, "mean_token_accuracy": 0.22962289154529572, "num_tokens": 69301766.0, "step": 33395 }, { "entropy": 5.576062345504761, "epoch": 3.0297532656023223, "grad_norm": 1.125, "learning_rate": 0.0004091812469687904, "loss": 4.8445, "mean_token_accuracy": 0.217105495929718, "num_tokens": 69312668.0, "step": 33400 }, { "entropy": 5.562944650650024, "epoch": 3.0302068214804065, "grad_norm": 1.125, "learning_rate": 0.0004091552725561856, "loss": 4.8966, "mean_token_accuracy": 0.21654330790042878, "num_tokens": 69323195.0, "step": 33405 }, { "entropy": 5.488876152038574, "epoch": 3.0306603773584904, "grad_norm": 1.1875, "learning_rate": 0.0004091292953692156, "loss": 4.8624, "mean_token_accuracy": 0.22053744196891784, "num_tokens": 69333812.0, "step": 33410 }, { "entropy": 5.54521164894104, "epoch": 3.0311139332365746, "grad_norm": 1.125, "learning_rate": 0.00040910331540841755, "loss": 4.8751, "mean_token_accuracy": 0.2262769639492035, "num_tokens": 69344378.0, "step": 33415 }, { "entropy": 5.513668727874756, "epoch": 3.031567489114659, "grad_norm": 1.1484375, "learning_rate": 0.00040907733267432877, "loss": 4.8773, "mean_token_accuracy": 0.22027383297681807, "num_tokens": 69354592.0, "step": 33420 }, { "entropy": 5.550172901153564, "epoch": 3.032021044992743, "grad_norm": 1.2734375, "learning_rate": 0.00040905134716748656, "loss": 4.8693, "mean_token_accuracy": 0.21954271346330642, "num_tokens": 69365011.0, "step": 33425 }, { "entropy": 5.505629968643189, "epoch": 3.0324746008708274, "grad_norm": 1.21875, "learning_rate": 0.0004090253588884284, "loss": 4.8609, "mean_token_accuracy": 0.2127205953001976, "num_tokens": 69377010.0, "step": 33430 }, { "entropy": 5.55498194694519, "epoch": 3.0329281567489113, "grad_norm": 1.25, "learning_rate": 0.00040899936783769157, "loss": 4.8769, "mean_token_accuracy": 0.22480493634939194, "num_tokens": 69387263.0, "step": 33435 }, { "entropy": 5.562593650817871, "epoch": 3.0333817126269955, "grad_norm": 1.1484375, "learning_rate": 0.00040897337401581374, "loss": 4.8923, "mean_token_accuracy": 0.2265462100505829, "num_tokens": 69399188.0, "step": 33440 }, { "entropy": 5.525684547424317, "epoch": 3.03383526850508, "grad_norm": 1.265625, "learning_rate": 0.00040894737742333244, "loss": 4.8749, "mean_token_accuracy": 0.21651416420936584, "num_tokens": 69408271.0, "step": 33445 }, { "entropy": 5.5857994556427, "epoch": 3.034288824383164, "grad_norm": 1.203125, "learning_rate": 0.0004089213780607851, "loss": 4.9922, "mean_token_accuracy": 0.20722945630550385, "num_tokens": 69418424.0, "step": 33450 }, { "entropy": 5.592473268508911, "epoch": 3.0347423802612483, "grad_norm": 1.1953125, "learning_rate": 0.0004088953759287096, "loss": 4.8857, "mean_token_accuracy": 0.22269641906023024, "num_tokens": 69427802.0, "step": 33455 }, { "entropy": 5.588563442230225, "epoch": 3.0351959361393326, "grad_norm": 1.2421875, "learning_rate": 0.0004088693710276436, "loss": 4.9046, "mean_token_accuracy": 0.22252792119979858, "num_tokens": 69437581.0, "step": 33460 }, { "entropy": 5.546655941009521, "epoch": 3.0356494920174164, "grad_norm": 1.21875, "learning_rate": 0.00040884336335812494, "loss": 4.8271, "mean_token_accuracy": 0.22554265558719636, "num_tokens": 69447711.0, "step": 33465 }, { "entropy": 5.590954446792603, "epoch": 3.0361030478955007, "grad_norm": 1.21875, "learning_rate": 0.0004088173529206914, "loss": 4.8159, "mean_token_accuracy": 0.2266578882932663, "num_tokens": 69457692.0, "step": 33470 }, { "entropy": 5.548431253433227, "epoch": 3.036556603773585, "grad_norm": 1.2265625, "learning_rate": 0.0004087913397158809, "loss": 4.8145, "mean_token_accuracy": 0.21738813817501068, "num_tokens": 69468034.0, "step": 33475 }, { "entropy": 5.490089559555054, "epoch": 3.037010159651669, "grad_norm": 1.328125, "learning_rate": 0.00040876532374423135, "loss": 4.8477, "mean_token_accuracy": 0.22133027613162995, "num_tokens": 69477719.0, "step": 33480 }, { "entropy": 5.546320056915283, "epoch": 3.0374637155297535, "grad_norm": 1.25, "learning_rate": 0.0004087393050062809, "loss": 4.871, "mean_token_accuracy": 0.21676785349845887, "num_tokens": 69487261.0, "step": 33485 }, { "entropy": 5.570474863052368, "epoch": 3.0379172714078373, "grad_norm": 1.2109375, "learning_rate": 0.00040871328350256745, "loss": 4.8471, "mean_token_accuracy": 0.2211972251534462, "num_tokens": 69496658.0, "step": 33490 }, { "entropy": 5.6306154251098635, "epoch": 3.0383708272859216, "grad_norm": 1.1640625, "learning_rate": 0.00040868725923362927, "loss": 5.0096, "mean_token_accuracy": 0.21236396580934525, "num_tokens": 69507197.0, "step": 33495 }, { "entropy": 5.542728614807129, "epoch": 3.038824383164006, "grad_norm": 1.3203125, "learning_rate": 0.00040866123220000455, "loss": 4.9201, "mean_token_accuracy": 0.21712354123592376, "num_tokens": 69516905.0, "step": 33500 }, { "entropy": 5.579092884063721, "epoch": 3.03927793904209, "grad_norm": 1.328125, "learning_rate": 0.00040863520240223144, "loss": 4.8165, "mean_token_accuracy": 0.22702620178461075, "num_tokens": 69526869.0, "step": 33505 }, { "entropy": 5.5965564250946045, "epoch": 3.0397314949201744, "grad_norm": 1.140625, "learning_rate": 0.0004086091698408483, "loss": 4.8997, "mean_token_accuracy": 0.21850751489400863, "num_tokens": 69537058.0, "step": 33510 }, { "entropy": 5.616084337234497, "epoch": 3.040185050798258, "grad_norm": 1.1953125, "learning_rate": 0.00040858313451639343, "loss": 4.9736, "mean_token_accuracy": 0.20910998731851577, "num_tokens": 69547617.0, "step": 33515 }, { "entropy": 5.594964599609375, "epoch": 3.0406386066763424, "grad_norm": 1.1328125, "learning_rate": 0.0004085570964294053, "loss": 4.9061, "mean_token_accuracy": 0.2093049630522728, "num_tokens": 69558733.0, "step": 33520 }, { "entropy": 5.641829538345337, "epoch": 3.0410921625544267, "grad_norm": 1.125, "learning_rate": 0.0004085310555804225, "loss": 4.9778, "mean_token_accuracy": 0.21158185601234436, "num_tokens": 69570011.0, "step": 33525 }, { "entropy": 5.6617076873779295, "epoch": 3.041545718432511, "grad_norm": 1.234375, "learning_rate": 0.00040850501196998336, "loss": 4.9952, "mean_token_accuracy": 0.20798504650592803, "num_tokens": 69580894.0, "step": 33530 }, { "entropy": 5.587724399566651, "epoch": 3.0419992743105952, "grad_norm": 1.1796875, "learning_rate": 0.00040847896559862654, "loss": 4.8848, "mean_token_accuracy": 0.2174672544002533, "num_tokens": 69591438.0, "step": 33535 }, { "entropy": 5.569055795669556, "epoch": 3.042452830188679, "grad_norm": 1.2265625, "learning_rate": 0.0004084529164668907, "loss": 4.9076, "mean_token_accuracy": 0.2176385700702667, "num_tokens": 69601745.0, "step": 33540 }, { "entropy": 5.589884185791016, "epoch": 3.0429063860667633, "grad_norm": 1.2421875, "learning_rate": 0.00040842686457531453, "loss": 4.873, "mean_token_accuracy": 0.21928049474954606, "num_tokens": 69611872.0, "step": 33545 }, { "entropy": 5.5757533550262455, "epoch": 3.0433599419448476, "grad_norm": 1.2265625, "learning_rate": 0.0004084008099244368, "loss": 4.8527, "mean_token_accuracy": 0.21931985020637512, "num_tokens": 69621673.0, "step": 33550 }, { "entropy": 5.508589172363282, "epoch": 3.043813497822932, "grad_norm": 1.1875, "learning_rate": 0.00040837475251479633, "loss": 4.8094, "mean_token_accuracy": 0.21971536576747894, "num_tokens": 69632090.0, "step": 33555 }, { "entropy": 5.5114587306976315, "epoch": 3.044267053701016, "grad_norm": 1.171875, "learning_rate": 0.000408348692346932, "loss": 4.8425, "mean_token_accuracy": 0.22412486523389816, "num_tokens": 69642920.0, "step": 33560 }, { "entropy": 5.563113641738892, "epoch": 3.0447206095791, "grad_norm": 1.0625, "learning_rate": 0.00040832262942138277, "loss": 4.9466, "mean_token_accuracy": 0.2107337847352028, "num_tokens": 69653936.0, "step": 33565 }, { "entropy": 5.521078824996948, "epoch": 3.0451741654571842, "grad_norm": 1.3046875, "learning_rate": 0.0004082965637386875, "loss": 4.8154, "mean_token_accuracy": 0.22167031317949296, "num_tokens": 69663362.0, "step": 33570 }, { "entropy": 5.5225889682769775, "epoch": 3.0456277213352685, "grad_norm": 1.2890625, "learning_rate": 0.0004082704952993854, "loss": 4.8278, "mean_token_accuracy": 0.22145363092422485, "num_tokens": 69673178.0, "step": 33575 }, { "entropy": 5.606073045730591, "epoch": 3.0460812772133528, "grad_norm": 1.1328125, "learning_rate": 0.0004082444241040155, "loss": 4.9225, "mean_token_accuracy": 0.22147749960422516, "num_tokens": 69683627.0, "step": 33580 }, { "entropy": 5.534637928009033, "epoch": 3.046534833091437, "grad_norm": 1.296875, "learning_rate": 0.0004082183501531169, "loss": 4.9004, "mean_token_accuracy": 0.21796853691339493, "num_tokens": 69694010.0, "step": 33585 }, { "entropy": 5.551808309555054, "epoch": 3.046988388969521, "grad_norm": 1.1796875, "learning_rate": 0.00040819227344722893, "loss": 4.8957, "mean_token_accuracy": 0.21642842292785644, "num_tokens": 69704888.0, "step": 33590 }, { "entropy": 5.510912322998047, "epoch": 3.047441944847605, "grad_norm": 1.3671875, "learning_rate": 0.00040816619398689074, "loss": 4.847, "mean_token_accuracy": 0.22189804762601853, "num_tokens": 69714718.0, "step": 33595 }, { "entropy": 5.535586261749268, "epoch": 3.0478955007256894, "grad_norm": 1.171875, "learning_rate": 0.00040814011177264174, "loss": 4.8509, "mean_token_accuracy": 0.21921432465314866, "num_tokens": 69726076.0, "step": 33600 }, { "entropy": 5.514611434936524, "epoch": 3.0483490566037736, "grad_norm": 1.203125, "learning_rate": 0.00040811402680502137, "loss": 4.8248, "mean_token_accuracy": 0.22057845145463945, "num_tokens": 69736507.0, "step": 33605 }, { "entropy": 5.470878219604492, "epoch": 3.048802612481858, "grad_norm": 1.390625, "learning_rate": 0.00040808793908456885, "loss": 4.8419, "mean_token_accuracy": 0.22356429547071457, "num_tokens": 69746061.0, "step": 33610 }, { "entropy": 5.528071117401123, "epoch": 3.0492561683599417, "grad_norm": 1.2421875, "learning_rate": 0.0004080618486118241, "loss": 4.9114, "mean_token_accuracy": 0.2178589478135109, "num_tokens": 69756493.0, "step": 33615 }, { "entropy": 5.564393997192383, "epoch": 3.049709724238026, "grad_norm": 1.265625, "learning_rate": 0.0004080357553873261, "loss": 4.8423, "mean_token_accuracy": 0.2219926416873932, "num_tokens": 69766937.0, "step": 33620 }, { "entropy": 5.519056034088135, "epoch": 3.0501632801161103, "grad_norm": 1.2109375, "learning_rate": 0.000408009659411615, "loss": 4.8591, "mean_token_accuracy": 0.21903112828731536, "num_tokens": 69776872.0, "step": 33625 }, { "entropy": 5.541478109359741, "epoch": 3.0506168359941945, "grad_norm": 1.078125, "learning_rate": 0.0004079835606852301, "loss": 4.8732, "mean_token_accuracy": 0.2190685823559761, "num_tokens": 69788145.0, "step": 33630 }, { "entropy": 5.541377258300781, "epoch": 3.051070391872279, "grad_norm": 1.203125, "learning_rate": 0.0004079574592087114, "loss": 4.8723, "mean_token_accuracy": 0.21633816212415696, "num_tokens": 69797353.0, "step": 33635 }, { "entropy": 5.518158769607544, "epoch": 3.051523947750363, "grad_norm": 1.2109375, "learning_rate": 0.00040793135498259854, "loss": 4.8569, "mean_token_accuracy": 0.22336736917495728, "num_tokens": 69806915.0, "step": 33640 }, { "entropy": 5.510580539703369, "epoch": 3.051977503628447, "grad_norm": 1.1171875, "learning_rate": 0.00040790524800743134, "loss": 4.866, "mean_token_accuracy": 0.21869227439165115, "num_tokens": 69817695.0, "step": 33645 }, { "entropy": 5.464036750793457, "epoch": 3.052431059506531, "grad_norm": 1.203125, "learning_rate": 0.0004078791382837498, "loss": 4.7868, "mean_token_accuracy": 0.237777242064476, "num_tokens": 69827451.0, "step": 33650 }, { "entropy": 5.584479284286499, "epoch": 3.0528846153846154, "grad_norm": 1.1484375, "learning_rate": 0.00040785302581209374, "loss": 4.8741, "mean_token_accuracy": 0.21909368634223939, "num_tokens": 69837897.0, "step": 33655 }, { "entropy": 5.543436717987061, "epoch": 3.0533381712626997, "grad_norm": 1.1953125, "learning_rate": 0.00040782691059300326, "loss": 4.8462, "mean_token_accuracy": 0.22179660201072693, "num_tokens": 69847378.0, "step": 33660 }, { "entropy": 5.549053001403808, "epoch": 3.053791727140784, "grad_norm": 1.2265625, "learning_rate": 0.0004078007926270185, "loss": 4.9173, "mean_token_accuracy": 0.21969237327575683, "num_tokens": 69857522.0, "step": 33665 }, { "entropy": 5.581828260421753, "epoch": 3.0542452830188678, "grad_norm": 1.1171875, "learning_rate": 0.00040777467191467946, "loss": 4.8559, "mean_token_accuracy": 0.22366366982460023, "num_tokens": 69868384.0, "step": 33670 }, { "entropy": 5.543659687042236, "epoch": 3.054698838896952, "grad_norm": 1.1953125, "learning_rate": 0.0004077485484565264, "loss": 4.8812, "mean_token_accuracy": 0.2202191635966301, "num_tokens": 69878761.0, "step": 33675 }, { "entropy": 5.592347192764282, "epoch": 3.0551523947750363, "grad_norm": 1.25, "learning_rate": 0.0004077224222530994, "loss": 4.8445, "mean_token_accuracy": 0.22071305960416793, "num_tokens": 69888366.0, "step": 33680 }, { "entropy": 5.5675581932067875, "epoch": 3.0556059506531206, "grad_norm": 1.1171875, "learning_rate": 0.000407696293304939, "loss": 4.8891, "mean_token_accuracy": 0.21480489671230316, "num_tokens": 69898489.0, "step": 33685 }, { "entropy": 5.512990140914917, "epoch": 3.056059506531205, "grad_norm": 1.140625, "learning_rate": 0.0004076701616125854, "loss": 4.8463, "mean_token_accuracy": 0.21698013246059417, "num_tokens": 69908425.0, "step": 33690 }, { "entropy": 5.601546669006348, "epoch": 3.0565130624092887, "grad_norm": 1.2734375, "learning_rate": 0.0004076440271765791, "loss": 4.9023, "mean_token_accuracy": 0.22019850462675095, "num_tokens": 69918488.0, "step": 33695 }, { "entropy": 5.483079195022583, "epoch": 3.056966618287373, "grad_norm": 1.2109375, "learning_rate": 0.0004076178899974605, "loss": 4.7854, "mean_token_accuracy": 0.23036219477653502, "num_tokens": 69928831.0, "step": 33700 }, { "entropy": 5.548114585876465, "epoch": 3.057420174165457, "grad_norm": 1.125, "learning_rate": 0.00040759175007577017, "loss": 4.8992, "mean_token_accuracy": 0.2161843404173851, "num_tokens": 69938974.0, "step": 33705 }, { "entropy": 5.537838315963745, "epoch": 3.0578737300435415, "grad_norm": 1.2421875, "learning_rate": 0.0004075656074120486, "loss": 4.8125, "mean_token_accuracy": 0.22158703953027725, "num_tokens": 69948804.0, "step": 33710 }, { "entropy": 5.578821754455566, "epoch": 3.0583272859216257, "grad_norm": 1.2109375, "learning_rate": 0.0004075394620068365, "loss": 4.8548, "mean_token_accuracy": 0.2204371601343155, "num_tokens": 69958945.0, "step": 33715 }, { "entropy": 5.530725574493408, "epoch": 3.0587808417997095, "grad_norm": 1.2734375, "learning_rate": 0.00040751331386067456, "loss": 4.8401, "mean_token_accuracy": 0.2199044868350029, "num_tokens": 69968826.0, "step": 33720 }, { "entropy": 5.576429843902588, "epoch": 3.059234397677794, "grad_norm": 1.25, "learning_rate": 0.0004074871629741035, "loss": 4.9131, "mean_token_accuracy": 0.21878617107868195, "num_tokens": 69978961.0, "step": 33725 }, { "entropy": 5.5038923740386965, "epoch": 3.059687953555878, "grad_norm": 1.1875, "learning_rate": 0.0004074610093476641, "loss": 4.888, "mean_token_accuracy": 0.22178491055965424, "num_tokens": 69989848.0, "step": 33730 }, { "entropy": 5.532172203063965, "epoch": 3.0601415094339623, "grad_norm": 1.25, "learning_rate": 0.00040743485298189744, "loss": 4.8434, "mean_token_accuracy": 0.22129712402820587, "num_tokens": 69999607.0, "step": 33735 }, { "entropy": 5.554972457885742, "epoch": 3.0605950653120466, "grad_norm": 1.1875, "learning_rate": 0.00040740869387734415, "loss": 4.8962, "mean_token_accuracy": 0.21320026516914367, "num_tokens": 70010446.0, "step": 33740 }, { "entropy": 5.503174209594727, "epoch": 3.0610486211901304, "grad_norm": 1.328125, "learning_rate": 0.0004073825320345453, "loss": 4.8083, "mean_token_accuracy": 0.2243623897433281, "num_tokens": 70021148.0, "step": 33745 }, { "entropy": 5.595740747451782, "epoch": 3.0615021770682147, "grad_norm": 1.2890625, "learning_rate": 0.00040735636745404196, "loss": 4.9412, "mean_token_accuracy": 0.2131958231329918, "num_tokens": 70030765.0, "step": 33750 }, { "entropy": 5.578330039978027, "epoch": 3.061955732946299, "grad_norm": 1.25, "learning_rate": 0.00040733020013637526, "loss": 4.8914, "mean_token_accuracy": 0.21820108592510223, "num_tokens": 70041717.0, "step": 33755 }, { "entropy": 5.592785024642945, "epoch": 3.0624092888243832, "grad_norm": 1.1640625, "learning_rate": 0.00040730403008208633, "loss": 4.9287, "mean_token_accuracy": 0.2181514471769333, "num_tokens": 70052178.0, "step": 33760 }, { "entropy": 5.539941358566284, "epoch": 3.0628628447024675, "grad_norm": 1.2734375, "learning_rate": 0.0004072778572917163, "loss": 4.8887, "mean_token_accuracy": 0.21673464179039, "num_tokens": 70062819.0, "step": 33765 }, { "entropy": 5.485319137573242, "epoch": 3.0633164005805513, "grad_norm": 1.171875, "learning_rate": 0.0004072516817658065, "loss": 4.88, "mean_token_accuracy": 0.21750646084547043, "num_tokens": 70073966.0, "step": 33770 }, { "entropy": 5.564143800735474, "epoch": 3.0637699564586356, "grad_norm": 1.109375, "learning_rate": 0.00040722550350489825, "loss": 4.874, "mean_token_accuracy": 0.21885902285575867, "num_tokens": 70083884.0, "step": 33775 }, { "entropy": 5.605109310150146, "epoch": 3.06422351233672, "grad_norm": 1.21875, "learning_rate": 0.0004071993225095327, "loss": 4.8672, "mean_token_accuracy": 0.21771135032176972, "num_tokens": 70094910.0, "step": 33780 }, { "entropy": 5.50017614364624, "epoch": 3.064677068214804, "grad_norm": 1.3828125, "learning_rate": 0.0004071731387802517, "loss": 4.7133, "mean_token_accuracy": 0.237326018512249, "num_tokens": 70104480.0, "step": 33785 }, { "entropy": 5.501518249511719, "epoch": 3.0651306240928884, "grad_norm": 1.2890625, "learning_rate": 0.0004071469523175964, "loss": 4.8429, "mean_token_accuracy": 0.2214748591184616, "num_tokens": 70114003.0, "step": 33790 }, { "entropy": 5.564014291763305, "epoch": 3.065584179970972, "grad_norm": 1.234375, "learning_rate": 0.00040712076312210844, "loss": 4.9248, "mean_token_accuracy": 0.2124596655368805, "num_tokens": 70123604.0, "step": 33795 }, { "entropy": 5.549854183197022, "epoch": 3.0660377358490565, "grad_norm": 1.1640625, "learning_rate": 0.00040709457119432945, "loss": 4.9099, "mean_token_accuracy": 0.21756191700696945, "num_tokens": 70133895.0, "step": 33800 }, { "entropy": 5.56729941368103, "epoch": 3.0664912917271407, "grad_norm": 1.1796875, "learning_rate": 0.00040706837653480113, "loss": 4.853, "mean_token_accuracy": 0.22682829052209855, "num_tokens": 70145063.0, "step": 33805 }, { "entropy": 5.543490362167359, "epoch": 3.066944847605225, "grad_norm": 1.296875, "learning_rate": 0.000407042179144065, "loss": 4.941, "mean_token_accuracy": 0.2149817779660225, "num_tokens": 70155456.0, "step": 33810 }, { "entropy": 5.449727344512939, "epoch": 3.0673984034833093, "grad_norm": 1.21875, "learning_rate": 0.00040701597902266306, "loss": 4.8017, "mean_token_accuracy": 0.22480495423078536, "num_tokens": 70165427.0, "step": 33815 }, { "entropy": 5.6175901889801025, "epoch": 3.067851959361393, "grad_norm": 1.2421875, "learning_rate": 0.000406989776171137, "loss": 4.94, "mean_token_accuracy": 0.21473718732595443, "num_tokens": 70175161.0, "step": 33820 }, { "entropy": 5.545640325546264, "epoch": 3.0683055152394774, "grad_norm": 1.296875, "learning_rate": 0.00040696357059002877, "loss": 4.8775, "mean_token_accuracy": 0.22670613527297973, "num_tokens": 70185026.0, "step": 33825 }, { "entropy": 5.554097318649292, "epoch": 3.0687590711175616, "grad_norm": 1.3046875, "learning_rate": 0.0004069373622798802, "loss": 4.856, "mean_token_accuracy": 0.23433369398117065, "num_tokens": 70195645.0, "step": 33830 }, { "entropy": 5.573609066009522, "epoch": 3.069212626995646, "grad_norm": 1.3046875, "learning_rate": 0.0004069111512412334, "loss": 4.9432, "mean_token_accuracy": 0.21601267606019975, "num_tokens": 70206591.0, "step": 33835 }, { "entropy": 5.611148357391357, "epoch": 3.06966618287373, "grad_norm": 1.109375, "learning_rate": 0.00040688493747463036, "loss": 4.8872, "mean_token_accuracy": 0.22039080113172532, "num_tokens": 70216945.0, "step": 33840 }, { "entropy": 5.5124369144439695, "epoch": 3.0701197387518144, "grad_norm": 1.2734375, "learning_rate": 0.0004068587209806132, "loss": 4.7727, "mean_token_accuracy": 0.23457358479499818, "num_tokens": 70226983.0, "step": 33845 }, { "entropy": 5.505220508575439, "epoch": 3.0705732946298983, "grad_norm": 1.109375, "learning_rate": 0.00040683250175972414, "loss": 4.8513, "mean_token_accuracy": 0.21699624508619308, "num_tokens": 70237730.0, "step": 33850 }, { "entropy": 5.559257316589355, "epoch": 3.0710268505079825, "grad_norm": 1.2734375, "learning_rate": 0.0004068062798125053, "loss": 4.9215, "mean_token_accuracy": 0.21530958712100984, "num_tokens": 70248499.0, "step": 33855 }, { "entropy": 5.529851388931275, "epoch": 3.071480406386067, "grad_norm": 1.234375, "learning_rate": 0.000406780055139499, "loss": 4.8599, "mean_token_accuracy": 0.2240528181195259, "num_tokens": 70259294.0, "step": 33860 }, { "entropy": 5.590238332748413, "epoch": 3.071933962264151, "grad_norm": 1.2578125, "learning_rate": 0.0004067538277412476, "loss": 4.9245, "mean_token_accuracy": 0.21715408861637114, "num_tokens": 70269400.0, "step": 33865 }, { "entropy": 5.624511766433716, "epoch": 3.0723875181422353, "grad_norm": 1.296875, "learning_rate": 0.0004067275976182935, "loss": 4.9584, "mean_token_accuracy": 0.2177477076649666, "num_tokens": 70279380.0, "step": 33870 }, { "entropy": 5.561013269424438, "epoch": 3.072841074020319, "grad_norm": 1.078125, "learning_rate": 0.00040670136477117906, "loss": 4.872, "mean_token_accuracy": 0.2224866196513176, "num_tokens": 70289919.0, "step": 33875 }, { "entropy": 5.613761615753174, "epoch": 3.0732946298984034, "grad_norm": 1.3203125, "learning_rate": 0.00040667512920044684, "loss": 4.9686, "mean_token_accuracy": 0.21821146905422212, "num_tokens": 70300136.0, "step": 33880 }, { "entropy": 5.47821159362793, "epoch": 3.0737481857764877, "grad_norm": 1.2421875, "learning_rate": 0.00040664889090663944, "loss": 4.7717, "mean_token_accuracy": 0.23293721973896026, "num_tokens": 70310072.0, "step": 33885 }, { "entropy": 5.581581115722656, "epoch": 3.074201741654572, "grad_norm": 1.2578125, "learning_rate": 0.00040662264989029933, "loss": 4.877, "mean_token_accuracy": 0.22536811530590056, "num_tokens": 70320185.0, "step": 33890 }, { "entropy": 5.562211799621582, "epoch": 3.074655297532656, "grad_norm": 1.21875, "learning_rate": 0.0004065964061519694, "loss": 4.8632, "mean_token_accuracy": 0.22142807245254517, "num_tokens": 70330211.0, "step": 33895 }, { "entropy": 5.570418024063111, "epoch": 3.07510885341074, "grad_norm": 1.1875, "learning_rate": 0.0004065701596921922, "loss": 4.9513, "mean_token_accuracy": 0.2103681430220604, "num_tokens": 70341044.0, "step": 33900 }, { "entropy": 5.60465636253357, "epoch": 3.0755624092888243, "grad_norm": 1.1953125, "learning_rate": 0.0004065439105115106, "loss": 4.8984, "mean_token_accuracy": 0.2235433742403984, "num_tokens": 70351320.0, "step": 33905 }, { "entropy": 5.533235883712768, "epoch": 3.0760159651669086, "grad_norm": 1.171875, "learning_rate": 0.00040651765861046734, "loss": 4.8098, "mean_token_accuracy": 0.23035095036029815, "num_tokens": 70361214.0, "step": 33910 }, { "entropy": 5.600605106353759, "epoch": 3.076469521044993, "grad_norm": 1.3203125, "learning_rate": 0.00040649140398960537, "loss": 4.9174, "mean_token_accuracy": 0.22376378774642944, "num_tokens": 70371083.0, "step": 33915 }, { "entropy": 5.5534913539886475, "epoch": 3.076923076923077, "grad_norm": 1.25, "learning_rate": 0.00040646514664946775, "loss": 5.0036, "mean_token_accuracy": 0.2149829313158989, "num_tokens": 70381987.0, "step": 33920 }, { "entropy": 5.514731121063233, "epoch": 3.077376632801161, "grad_norm": 1.21875, "learning_rate": 0.0004064388865905974, "loss": 4.8234, "mean_token_accuracy": 0.22246827632188798, "num_tokens": 70393462.0, "step": 33925 }, { "entropy": 5.523762893676758, "epoch": 3.077830188679245, "grad_norm": 1.140625, "learning_rate": 0.0004064126238135373, "loss": 4.7414, "mean_token_accuracy": 0.23506968915462495, "num_tokens": 70403664.0, "step": 33930 }, { "entropy": 5.530210018157959, "epoch": 3.0782837445573294, "grad_norm": 1.125, "learning_rate": 0.0004063863583188308, "loss": 4.8762, "mean_token_accuracy": 0.2177021622657776, "num_tokens": 70414588.0, "step": 33935 }, { "entropy": 5.513446283340454, "epoch": 3.0787373004354137, "grad_norm": 1.2578125, "learning_rate": 0.0004063600901070207, "loss": 4.928, "mean_token_accuracy": 0.21794008761644362, "num_tokens": 70425572.0, "step": 33940 }, { "entropy": 5.526793909072876, "epoch": 3.079190856313498, "grad_norm": 1.15625, "learning_rate": 0.00040633381917865057, "loss": 4.846, "mean_token_accuracy": 0.20999166667461394, "num_tokens": 70436140.0, "step": 33945 }, { "entropy": 5.526464128494263, "epoch": 3.079644412191582, "grad_norm": 1.1875, "learning_rate": 0.0004063075455342636, "loss": 4.841, "mean_token_accuracy": 0.22553852796554566, "num_tokens": 70447117.0, "step": 33950 }, { "entropy": 5.563627099990844, "epoch": 3.080097968069666, "grad_norm": 1.15625, "learning_rate": 0.0004062812691744032, "loss": 4.8647, "mean_token_accuracy": 0.22334660440683365, "num_tokens": 70457756.0, "step": 33955 }, { "entropy": 5.555367088317871, "epoch": 3.0805515239477503, "grad_norm": 1.234375, "learning_rate": 0.0004062549900996126, "loss": 4.9285, "mean_token_accuracy": 0.21666637659072877, "num_tokens": 70468671.0, "step": 33960 }, { "entropy": 5.560975027084351, "epoch": 3.0810050798258346, "grad_norm": 1.2421875, "learning_rate": 0.0004062287083104354, "loss": 4.8246, "mean_token_accuracy": 0.22531879991292952, "num_tokens": 70478212.0, "step": 33965 }, { "entropy": 5.5024810314178465, "epoch": 3.081458635703919, "grad_norm": 1.1953125, "learning_rate": 0.00040620242380741504, "loss": 4.8461, "mean_token_accuracy": 0.2202053412795067, "num_tokens": 70489062.0, "step": 33970 }, { "entropy": 5.564344358444214, "epoch": 3.0819121915820027, "grad_norm": 1.2734375, "learning_rate": 0.0004061761365910951, "loss": 4.912, "mean_token_accuracy": 0.2230479747056961, "num_tokens": 70499732.0, "step": 33975 }, { "entropy": 5.574536561965942, "epoch": 3.082365747460087, "grad_norm": 1.203125, "learning_rate": 0.00040614984666201927, "loss": 4.8858, "mean_token_accuracy": 0.21846262514591216, "num_tokens": 70509777.0, "step": 33980 }, { "entropy": 5.5796490669250485, "epoch": 3.0828193033381712, "grad_norm": 1.1796875, "learning_rate": 0.0004061235540207312, "loss": 4.8998, "mean_token_accuracy": 0.21855698823928832, "num_tokens": 70520674.0, "step": 33985 }, { "entropy": 5.545018815994263, "epoch": 3.0832728592162555, "grad_norm": 1.21875, "learning_rate": 0.0004060972586677746, "loss": 4.8683, "mean_token_accuracy": 0.21895248293876649, "num_tokens": 70531115.0, "step": 33990 }, { "entropy": 5.510321140289307, "epoch": 3.0837264150943398, "grad_norm": 1.21875, "learning_rate": 0.0004060709606036933, "loss": 4.8539, "mean_token_accuracy": 0.22225042879581453, "num_tokens": 70540726.0, "step": 33995 }, { "entropy": 5.555085849761963, "epoch": 3.084179970972424, "grad_norm": 1.1328125, "learning_rate": 0.0004060446598290311, "loss": 4.8387, "mean_token_accuracy": 0.22498957216739654, "num_tokens": 70551227.0, "step": 34000 }, { "entropy": 5.488412189483642, "epoch": 3.084633526850508, "grad_norm": 1.21875, "learning_rate": 0.000406018356344332, "loss": 4.8546, "mean_token_accuracy": 0.21756804138422012, "num_tokens": 70560815.0, "step": 34005 }, { "entropy": 5.596951484680176, "epoch": 3.085087082728592, "grad_norm": 1.2265625, "learning_rate": 0.0004059920501501398, "loss": 4.9468, "mean_token_accuracy": 0.2134745627641678, "num_tokens": 70570247.0, "step": 34010 }, { "entropy": 5.570509958267212, "epoch": 3.0855406386066764, "grad_norm": 1.1875, "learning_rate": 0.0004059657412469987, "loss": 4.9042, "mean_token_accuracy": 0.21469805091619493, "num_tokens": 70581497.0, "step": 34015 }, { "entropy": 5.533399534225464, "epoch": 3.0859941944847606, "grad_norm": 1.203125, "learning_rate": 0.0004059394296354527, "loss": 4.8813, "mean_token_accuracy": 0.213567852973938, "num_tokens": 70593133.0, "step": 34020 }, { "entropy": 5.558902072906494, "epoch": 3.086447750362845, "grad_norm": 1.203125, "learning_rate": 0.0004059131153160459, "loss": 4.8732, "mean_token_accuracy": 0.223296095430851, "num_tokens": 70603953.0, "step": 34025 }, { "entropy": 5.495404624938965, "epoch": 3.0869013062409287, "grad_norm": 1.1484375, "learning_rate": 0.0004058867982893225, "loss": 4.8344, "mean_token_accuracy": 0.22647749185562133, "num_tokens": 70615292.0, "step": 34030 }, { "entropy": 5.614220380783081, "epoch": 3.087354862119013, "grad_norm": 1.1796875, "learning_rate": 0.0004058604785558268, "loss": 5.0003, "mean_token_accuracy": 0.20786291360855103, "num_tokens": 70626681.0, "step": 34035 }, { "entropy": 5.607170057296753, "epoch": 3.0878084179970973, "grad_norm": 1.1640625, "learning_rate": 0.00040583415611610305, "loss": 4.9138, "mean_token_accuracy": 0.21122521609067918, "num_tokens": 70637339.0, "step": 34040 }, { "entropy": 5.624288415908813, "epoch": 3.0882619738751815, "grad_norm": 1.1875, "learning_rate": 0.0004058078309706956, "loss": 4.8648, "mean_token_accuracy": 0.22347125560045242, "num_tokens": 70647980.0, "step": 34045 }, { "entropy": 5.523255395889282, "epoch": 3.088715529753266, "grad_norm": 1.2578125, "learning_rate": 0.0004057815031201488, "loss": 4.7241, "mean_token_accuracy": 0.23689903020858766, "num_tokens": 70657042.0, "step": 34050 }, { "entropy": 5.545471906661987, "epoch": 3.0891690856313496, "grad_norm": 1.1484375, "learning_rate": 0.0004057551725650073, "loss": 4.9121, "mean_token_accuracy": 0.2176677480340004, "num_tokens": 70668542.0, "step": 34055 }, { "entropy": 5.547145795822144, "epoch": 3.089622641509434, "grad_norm": 1.2578125, "learning_rate": 0.00040572883930581544, "loss": 4.9509, "mean_token_accuracy": 0.21912151277065278, "num_tokens": 70679332.0, "step": 34060 }, { "entropy": 5.667421293258667, "epoch": 3.090076197387518, "grad_norm": 1.2734375, "learning_rate": 0.0004057025033431179, "loss": 5.0171, "mean_token_accuracy": 0.21360383033752442, "num_tokens": 70689897.0, "step": 34065 }, { "entropy": 5.547329998016357, "epoch": 3.0905297532656024, "grad_norm": 1.15625, "learning_rate": 0.00040567616467745933, "loss": 4.8228, "mean_token_accuracy": 0.22579584419727325, "num_tokens": 70699965.0, "step": 34070 }, { "entropy": 5.591562366485595, "epoch": 3.0909833091436867, "grad_norm": 1.234375, "learning_rate": 0.0004056498233093843, "loss": 4.943, "mean_token_accuracy": 0.22123480290174485, "num_tokens": 70710583.0, "step": 34075 }, { "entropy": 5.529441928863525, "epoch": 3.0914368650217705, "grad_norm": 1.2109375, "learning_rate": 0.00040562347923943766, "loss": 4.8096, "mean_token_accuracy": 0.2367551863193512, "num_tokens": 70721800.0, "step": 34080 }, { "entropy": 5.539307308197022, "epoch": 3.0918904208998548, "grad_norm": 1.1796875, "learning_rate": 0.0004055971324681642, "loss": 4.8971, "mean_token_accuracy": 0.2146783247590065, "num_tokens": 70731527.0, "step": 34085 }, { "entropy": 5.589014148712158, "epoch": 3.092343976777939, "grad_norm": 1.3828125, "learning_rate": 0.0004055707829961087, "loss": 4.8882, "mean_token_accuracy": 0.21945282816886902, "num_tokens": 70740821.0, "step": 34090 }, { "entropy": 5.517031908035278, "epoch": 3.0927975326560233, "grad_norm": 1.2265625, "learning_rate": 0.00040554443082381627, "loss": 4.8406, "mean_token_accuracy": 0.22421352714300155, "num_tokens": 70750506.0, "step": 34095 }, { "entropy": 5.529907512664795, "epoch": 3.0932510885341076, "grad_norm": 1.1640625, "learning_rate": 0.0004055180759518315, "loss": 4.8782, "mean_token_accuracy": 0.22267231792211534, "num_tokens": 70762009.0, "step": 34100 }, { "entropy": 5.501133632659912, "epoch": 3.0937046444121914, "grad_norm": 1.265625, "learning_rate": 0.0004054917183806999, "loss": 4.8491, "mean_token_accuracy": 0.22369867712259292, "num_tokens": 70772030.0, "step": 34105 }, { "entropy": 5.596992444992066, "epoch": 3.0941582002902757, "grad_norm": 1.203125, "learning_rate": 0.00040546535811096626, "loss": 4.9032, "mean_token_accuracy": 0.21585000604391097, "num_tokens": 70782539.0, "step": 34110 }, { "entropy": 5.709330654144287, "epoch": 3.09461175616836, "grad_norm": 1.2421875, "learning_rate": 0.00040543899514317564, "loss": 5.0271, "mean_token_accuracy": 0.20582645535469055, "num_tokens": 70793433.0, "step": 34115 }, { "entropy": 5.561357498168945, "epoch": 3.095065312046444, "grad_norm": 1.265625, "learning_rate": 0.0004054126294778735, "loss": 4.9145, "mean_token_accuracy": 0.21783615052700042, "num_tokens": 70802919.0, "step": 34120 }, { "entropy": 5.498158979415893, "epoch": 3.0955188679245285, "grad_norm": 1.1328125, "learning_rate": 0.00040538626111560487, "loss": 4.838, "mean_token_accuracy": 0.22393683940172196, "num_tokens": 70813827.0, "step": 34125 }, { "entropy": 5.588648128509521, "epoch": 3.0959724238026123, "grad_norm": 1.2890625, "learning_rate": 0.00040535989005691515, "loss": 4.928, "mean_token_accuracy": 0.21952465921640396, "num_tokens": 70824117.0, "step": 34130 }, { "entropy": 5.460154390335083, "epoch": 3.0964259796806965, "grad_norm": 1.296875, "learning_rate": 0.00040533351630234985, "loss": 4.818, "mean_token_accuracy": 0.22205373644828796, "num_tokens": 70833387.0, "step": 34135 }, { "entropy": 5.523236274719238, "epoch": 3.096879535558781, "grad_norm": 1.1796875, "learning_rate": 0.000405307139852454, "loss": 4.8506, "mean_token_accuracy": 0.22127053439617156, "num_tokens": 70844363.0, "step": 34140 }, { "entropy": 5.598881673812866, "epoch": 3.097333091436865, "grad_norm": 1.2109375, "learning_rate": 0.00040528076070777335, "loss": 4.9151, "mean_token_accuracy": 0.2141459196805954, "num_tokens": 70854759.0, "step": 34145 }, { "entropy": 5.48958101272583, "epoch": 3.0977866473149493, "grad_norm": 1.1328125, "learning_rate": 0.0004052543788688534, "loss": 4.9028, "mean_token_accuracy": 0.22366365492343904, "num_tokens": 70865682.0, "step": 34150 }, { "entropy": 5.626471710205078, "epoch": 3.098240203193033, "grad_norm": 1.296875, "learning_rate": 0.0004052279943362396, "loss": 4.9161, "mean_token_accuracy": 0.217058165371418, "num_tokens": 70875449.0, "step": 34155 }, { "entropy": 5.600069332122803, "epoch": 3.0986937590711174, "grad_norm": 1.171875, "learning_rate": 0.0004052016071104779, "loss": 4.8648, "mean_token_accuracy": 0.22467945665121078, "num_tokens": 70885885.0, "step": 34160 }, { "entropy": 5.552690601348877, "epoch": 3.0991473149492017, "grad_norm": 1.3515625, "learning_rate": 0.0004051752171921136, "loss": 4.8404, "mean_token_accuracy": 0.2204853817820549, "num_tokens": 70896320.0, "step": 34165 }, { "entropy": 5.489721441268921, "epoch": 3.099600870827286, "grad_norm": 1.15625, "learning_rate": 0.00040514882458169267, "loss": 4.7955, "mean_token_accuracy": 0.22706378847360612, "num_tokens": 70907074.0, "step": 34170 }, { "entropy": 5.521933650970459, "epoch": 3.1000544267053702, "grad_norm": 1.2265625, "learning_rate": 0.0004051224292797609, "loss": 4.9012, "mean_token_accuracy": 0.21267931759357453, "num_tokens": 70916567.0, "step": 34175 }, { "entropy": 5.559085655212402, "epoch": 3.100507982583454, "grad_norm": 1.3203125, "learning_rate": 0.00040509603128686413, "loss": 4.8504, "mean_token_accuracy": 0.22927618473768235, "num_tokens": 70926163.0, "step": 34180 }, { "entropy": 5.604204940795898, "epoch": 3.1009615384615383, "grad_norm": 1.109375, "learning_rate": 0.0004050696306035483, "loss": 4.8676, "mean_token_accuracy": 0.21646308451890944, "num_tokens": 70937358.0, "step": 34185 }, { "entropy": 5.502066898345947, "epoch": 3.1014150943396226, "grad_norm": 1.078125, "learning_rate": 0.00040504322723035937, "loss": 4.8571, "mean_token_accuracy": 0.21675165891647338, "num_tokens": 70949305.0, "step": 34190 }, { "entropy": 5.477740621566772, "epoch": 3.101868650217707, "grad_norm": 1.2421875, "learning_rate": 0.00040501682116784326, "loss": 4.8337, "mean_token_accuracy": 0.2275699719786644, "num_tokens": 70959146.0, "step": 34195 }, { "entropy": 5.481984090805054, "epoch": 3.102322206095791, "grad_norm": 1.21875, "learning_rate": 0.00040499041241654626, "loss": 4.903, "mean_token_accuracy": 0.21833328902721405, "num_tokens": 70968828.0, "step": 34200 }, { "entropy": 5.5220703125, "epoch": 3.1027757619738754, "grad_norm": 1.109375, "learning_rate": 0.0004049640009770144, "loss": 4.8589, "mean_token_accuracy": 0.22461532503366471, "num_tokens": 70979733.0, "step": 34205 }, { "entropy": 5.6102495193481445, "epoch": 3.103229317851959, "grad_norm": 1.3125, "learning_rate": 0.0004049375868497939, "loss": 4.9198, "mean_token_accuracy": 0.22263315469026565, "num_tokens": 70989726.0, "step": 34210 }, { "entropy": 5.564761304855347, "epoch": 3.1036828737300435, "grad_norm": 1.296875, "learning_rate": 0.00040491117003543087, "loss": 4.9395, "mean_token_accuracy": 0.21389199495315553, "num_tokens": 71000715.0, "step": 34215 }, { "entropy": 5.49772539138794, "epoch": 3.1041364296081277, "grad_norm": 1.2109375, "learning_rate": 0.00040488475053447186, "loss": 4.7253, "mean_token_accuracy": 0.23314786702394485, "num_tokens": 71011453.0, "step": 34220 }, { "entropy": 5.569862747192383, "epoch": 3.104589985486212, "grad_norm": 1.2265625, "learning_rate": 0.00040485832834746306, "loss": 4.9112, "mean_token_accuracy": 0.21896491795778275, "num_tokens": 71021477.0, "step": 34225 }, { "entropy": 5.496838235855103, "epoch": 3.1050435413642963, "grad_norm": 1.1953125, "learning_rate": 0.00040483190347495097, "loss": 4.8439, "mean_token_accuracy": 0.21613687574863433, "num_tokens": 71031706.0, "step": 34230 }, { "entropy": 5.5622227668762205, "epoch": 3.10549709724238, "grad_norm": 1.21875, "learning_rate": 0.000404805475917482, "loss": 4.8595, "mean_token_accuracy": 0.22462908327579498, "num_tokens": 71042882.0, "step": 34235 }, { "entropy": 5.550917625427246, "epoch": 3.1059506531204644, "grad_norm": 1.1953125, "learning_rate": 0.00040477904567560275, "loss": 4.8402, "mean_token_accuracy": 0.22683164328336716, "num_tokens": 71052804.0, "step": 34240 }, { "entropy": 5.613945436477661, "epoch": 3.1064042089985486, "grad_norm": 1.078125, "learning_rate": 0.0004047526127498597, "loss": 4.9809, "mean_token_accuracy": 0.21108725070953369, "num_tokens": 71064349.0, "step": 34245 }, { "entropy": 5.547394847869873, "epoch": 3.106857764876633, "grad_norm": 1.1796875, "learning_rate": 0.00040472617714079964, "loss": 4.8962, "mean_token_accuracy": 0.21982925683259963, "num_tokens": 71075754.0, "step": 34250 }, { "entropy": 5.5435456275939945, "epoch": 3.107311320754717, "grad_norm": 1.1484375, "learning_rate": 0.0004046997388489691, "loss": 4.8344, "mean_token_accuracy": 0.2221750020980835, "num_tokens": 71085338.0, "step": 34255 }, { "entropy": 5.462207984924317, "epoch": 3.107764876632801, "grad_norm": 1.234375, "learning_rate": 0.0004046732978749149, "loss": 4.827, "mean_token_accuracy": 0.22284100353717803, "num_tokens": 71097089.0, "step": 34260 }, { "entropy": 5.477288770675659, "epoch": 3.1082184325108853, "grad_norm": 1.1171875, "learning_rate": 0.000404646854219184, "loss": 4.7953, "mean_token_accuracy": 0.22552372366189957, "num_tokens": 71106990.0, "step": 34265 }, { "entropy": 5.5535900592803955, "epoch": 3.1086719883889695, "grad_norm": 1.125, "learning_rate": 0.000404620407882323, "loss": 4.8319, "mean_token_accuracy": 0.2222897782921791, "num_tokens": 71117634.0, "step": 34270 }, { "entropy": 5.500090551376343, "epoch": 3.109125544267054, "grad_norm": 1.2890625, "learning_rate": 0.00040459395886487885, "loss": 4.7861, "mean_token_accuracy": 0.22173462957143783, "num_tokens": 71127717.0, "step": 34275 }, { "entropy": 5.535745096206665, "epoch": 3.109579100145138, "grad_norm": 1.2734375, "learning_rate": 0.0004045675071673988, "loss": 4.8015, "mean_token_accuracy": 0.2289023369550705, "num_tokens": 71137172.0, "step": 34280 }, { "entropy": 5.596367311477661, "epoch": 3.110032656023222, "grad_norm": 1.2734375, "learning_rate": 0.0004045410527904296, "loss": 4.9134, "mean_token_accuracy": 0.21055590063333512, "num_tokens": 71146843.0, "step": 34285 }, { "entropy": 5.488558721542359, "epoch": 3.110486211901306, "grad_norm": 1.2265625, "learning_rate": 0.0004045145957345184, "loss": 4.7596, "mean_token_accuracy": 0.23404090106487274, "num_tokens": 71156619.0, "step": 34290 }, { "entropy": 5.551185750961304, "epoch": 3.1109397677793904, "grad_norm": 1.28125, "learning_rate": 0.0004044881360002123, "loss": 4.8667, "mean_token_accuracy": 0.21848648637533188, "num_tokens": 71167234.0, "step": 34295 }, { "entropy": 5.5674694061279295, "epoch": 3.1113933236574747, "grad_norm": 1.1484375, "learning_rate": 0.0004044616735880586, "loss": 4.8526, "mean_token_accuracy": 0.22306906878948213, "num_tokens": 71178049.0, "step": 34300 }, { "entropy": 5.526227235794067, "epoch": 3.111846879535559, "grad_norm": 1.2265625, "learning_rate": 0.00040443520849860453, "loss": 4.7868, "mean_token_accuracy": 0.2195261836051941, "num_tokens": 71188568.0, "step": 34305 }, { "entropy": 5.550675106048584, "epoch": 3.1123004354136428, "grad_norm": 1.1875, "learning_rate": 0.00040440874073239733, "loss": 4.8907, "mean_token_accuracy": 0.21608961671590804, "num_tokens": 71199004.0, "step": 34310 }, { "entropy": 5.489264965057373, "epoch": 3.112753991291727, "grad_norm": 1.3046875, "learning_rate": 0.00040438227028998436, "loss": 4.8462, "mean_token_accuracy": 0.22214228808879852, "num_tokens": 71209239.0, "step": 34315 }, { "entropy": 5.546603393554688, "epoch": 3.1132075471698113, "grad_norm": 1.265625, "learning_rate": 0.00040435579717191313, "loss": 4.9078, "mean_token_accuracy": 0.22109529823064805, "num_tokens": 71219469.0, "step": 34320 }, { "entropy": 5.577359628677368, "epoch": 3.1136611030478956, "grad_norm": 1.21875, "learning_rate": 0.00040432932137873107, "loss": 4.9351, "mean_token_accuracy": 0.2169351115822792, "num_tokens": 71230670.0, "step": 34325 }, { "entropy": 5.632251405715943, "epoch": 3.11411465892598, "grad_norm": 1.25, "learning_rate": 0.0004043028429109857, "loss": 4.968, "mean_token_accuracy": 0.21826846450567244, "num_tokens": 71241512.0, "step": 34330 }, { "entropy": 5.568650150299073, "epoch": 3.1145682148040637, "grad_norm": 1.234375, "learning_rate": 0.0004042763617692245, "loss": 4.8253, "mean_token_accuracy": 0.2204554110765457, "num_tokens": 71250869.0, "step": 34335 }, { "entropy": 5.532284212112427, "epoch": 3.115021770682148, "grad_norm": 1.1796875, "learning_rate": 0.00040424987795399523, "loss": 4.8231, "mean_token_accuracy": 0.2191571369767189, "num_tokens": 71260577.0, "step": 34340 }, { "entropy": 5.553238725662231, "epoch": 3.115475326560232, "grad_norm": 1.390625, "learning_rate": 0.0004042233914658455, "loss": 4.9034, "mean_token_accuracy": 0.2218807727098465, "num_tokens": 71270185.0, "step": 34345 }, { "entropy": 5.505624008178711, "epoch": 3.1159288824383164, "grad_norm": 1.2109375, "learning_rate": 0.00040419690230532324, "loss": 4.828, "mean_token_accuracy": 0.2262366756796837, "num_tokens": 71279427.0, "step": 34350 }, { "entropy": 5.522997760772705, "epoch": 3.1163824383164007, "grad_norm": 1.0859375, "learning_rate": 0.00040417041047297606, "loss": 4.8188, "mean_token_accuracy": 0.22212269455194472, "num_tokens": 71290857.0, "step": 34355 }, { "entropy": 5.599454879760742, "epoch": 3.116835994194485, "grad_norm": 1.25, "learning_rate": 0.0004041439159693518, "loss": 4.9036, "mean_token_accuracy": 0.2227695569396019, "num_tokens": 71300971.0, "step": 34360 }, { "entropy": 5.582221794128418, "epoch": 3.117289550072569, "grad_norm": 1.2265625, "learning_rate": 0.0004041174187949985, "loss": 4.9768, "mean_token_accuracy": 0.2091573342680931, "num_tokens": 71311017.0, "step": 34365 }, { "entropy": 5.604055595397949, "epoch": 3.117743105950653, "grad_norm": 1.2265625, "learning_rate": 0.00040409091895046413, "loss": 4.959, "mean_token_accuracy": 0.21323770582675933, "num_tokens": 71321546.0, "step": 34370 }, { "entropy": 5.541482162475586, "epoch": 3.1181966618287373, "grad_norm": 1.1484375, "learning_rate": 0.00040406441643629656, "loss": 4.8942, "mean_token_accuracy": 0.21633637249469756, "num_tokens": 71332345.0, "step": 34375 }, { "entropy": 5.609480524063111, "epoch": 3.1186502177068216, "grad_norm": 1.1328125, "learning_rate": 0.00040403791125304405, "loss": 4.9658, "mean_token_accuracy": 0.2216763287782669, "num_tokens": 71342670.0, "step": 34380 }, { "entropy": 5.539908599853516, "epoch": 3.119103773584906, "grad_norm": 1.3359375, "learning_rate": 0.0004040114034012546, "loss": 4.807, "mean_token_accuracy": 0.22060341387987137, "num_tokens": 71353440.0, "step": 34385 }, { "entropy": 5.549414873123169, "epoch": 3.1195573294629897, "grad_norm": 1.15625, "learning_rate": 0.00040398489288147646, "loss": 4.933, "mean_token_accuracy": 0.22389867901802063, "num_tokens": 71363199.0, "step": 34390 }, { "entropy": 5.554641771316528, "epoch": 3.120010885341074, "grad_norm": 1.25, "learning_rate": 0.00040395837969425786, "loss": 4.8838, "mean_token_accuracy": 0.21970954686403274, "num_tokens": 71372925.0, "step": 34395 }, { "entropy": 5.581045722961425, "epoch": 3.1204644412191582, "grad_norm": 1.2265625, "learning_rate": 0.0004039318638401471, "loss": 4.8993, "mean_token_accuracy": 0.21976799964904786, "num_tokens": 71383350.0, "step": 34400 }, { "entropy": 5.5178351402282715, "epoch": 3.1209179970972425, "grad_norm": 1.25, "learning_rate": 0.0004039053453196926, "loss": 4.8109, "mean_token_accuracy": 0.22881397604942322, "num_tokens": 71394006.0, "step": 34405 }, { "entropy": 5.496097803115845, "epoch": 3.1213715529753268, "grad_norm": 1.375, "learning_rate": 0.0004038788241334427, "loss": 4.8837, "mean_token_accuracy": 0.21768177598714827, "num_tokens": 71403945.0, "step": 34410 }, { "entropy": 5.594575262069702, "epoch": 3.1218251088534106, "grad_norm": 1.1953125, "learning_rate": 0.0004038523002819458, "loss": 4.9009, "mean_token_accuracy": 0.21371961683034896, "num_tokens": 71414238.0, "step": 34415 }, { "entropy": 5.528382253646851, "epoch": 3.122278664731495, "grad_norm": 1.1953125, "learning_rate": 0.00040382577376575055, "loss": 4.9197, "mean_token_accuracy": 0.21522002220153807, "num_tokens": 71423586.0, "step": 34420 }, { "entropy": 5.527049160003662, "epoch": 3.122732220609579, "grad_norm": 1.0703125, "learning_rate": 0.0004037992445854054, "loss": 4.847, "mean_token_accuracy": 0.22468358725309373, "num_tokens": 71434261.0, "step": 34425 }, { "entropy": 5.5256880760192875, "epoch": 3.1231857764876634, "grad_norm": 1.2109375, "learning_rate": 0.00040377271274145916, "loss": 4.8648, "mean_token_accuracy": 0.22078035324811934, "num_tokens": 71443952.0, "step": 34430 }, { "entropy": 5.575451517105103, "epoch": 3.1236393323657476, "grad_norm": 1.390625, "learning_rate": 0.0004037461782344603, "loss": 4.8606, "mean_token_accuracy": 0.2240452364087105, "num_tokens": 71454051.0, "step": 34435 }, { "entropy": 5.538706588745117, "epoch": 3.1240928882438315, "grad_norm": 1.265625, "learning_rate": 0.00040371964106495777, "loss": 4.8725, "mean_token_accuracy": 0.22862416952848436, "num_tokens": 71464579.0, "step": 34440 }, { "entropy": 5.533867692947387, "epoch": 3.1245464441219157, "grad_norm": 1.21875, "learning_rate": 0.00040369310123350015, "loss": 4.8741, "mean_token_accuracy": 0.219801427423954, "num_tokens": 71474631.0, "step": 34445 }, { "entropy": 5.634460496902466, "epoch": 3.125, "grad_norm": 1.1953125, "learning_rate": 0.00040366655874063645, "loss": 4.9138, "mean_token_accuracy": 0.22250818461179733, "num_tokens": 71485266.0, "step": 34450 }, { "entropy": 5.495659637451172, "epoch": 3.1254535558780843, "grad_norm": 1.1796875, "learning_rate": 0.0004036400135869156, "loss": 4.7511, "mean_token_accuracy": 0.22743380814790726, "num_tokens": 71495248.0, "step": 34455 }, { "entropy": 5.519757986068726, "epoch": 3.1259071117561685, "grad_norm": 1.2265625, "learning_rate": 0.00040361346577288645, "loss": 4.8453, "mean_token_accuracy": 0.22273631989955903, "num_tokens": 71505600.0, "step": 34460 }, { "entropy": 5.555629396438599, "epoch": 3.1263606676342524, "grad_norm": 1.21875, "learning_rate": 0.00040358691529909796, "loss": 4.8689, "mean_token_accuracy": 0.22039875090122224, "num_tokens": 71516634.0, "step": 34465 }, { "entropy": 5.611446332931519, "epoch": 3.1268142235123366, "grad_norm": 1.2421875, "learning_rate": 0.00040356036216609943, "loss": 4.8695, "mean_token_accuracy": 0.2178143084049225, "num_tokens": 71526745.0, "step": 34470 }, { "entropy": 5.596765422821045, "epoch": 3.127267779390421, "grad_norm": 1.1875, "learning_rate": 0.00040353380637443974, "loss": 4.9903, "mean_token_accuracy": 0.20675043016672134, "num_tokens": 71537015.0, "step": 34475 }, { "entropy": 5.488035058975219, "epoch": 3.127721335268505, "grad_norm": 1.296875, "learning_rate": 0.00040350724792466826, "loss": 4.7438, "mean_token_accuracy": 0.22461557388305664, "num_tokens": 71546660.0, "step": 34480 }, { "entropy": 5.542403507232666, "epoch": 3.1281748911465894, "grad_norm": 1.1875, "learning_rate": 0.0004034806868173341, "loss": 4.895, "mean_token_accuracy": 0.21752571761608125, "num_tokens": 71557309.0, "step": 34485 }, { "entropy": 5.522272300720215, "epoch": 3.1286284470246732, "grad_norm": 1.2578125, "learning_rate": 0.0004034541230529866, "loss": 4.7718, "mean_token_accuracy": 0.2207999050617218, "num_tokens": 71567651.0, "step": 34490 }, { "entropy": 5.510285711288452, "epoch": 3.1290820029027575, "grad_norm": 1.2578125, "learning_rate": 0.00040342755663217507, "loss": 4.8118, "mean_token_accuracy": 0.23012871146202088, "num_tokens": 71577538.0, "step": 34495 }, { "entropy": 5.4960369110107425, "epoch": 3.1295355587808418, "grad_norm": 1.1640625, "learning_rate": 0.000403400987555449, "loss": 4.8214, "mean_token_accuracy": 0.2278378963470459, "num_tokens": 71588299.0, "step": 34500 }, { "entropy": 5.524139738082885, "epoch": 3.129989114658926, "grad_norm": 1.1640625, "learning_rate": 0.0004033744158233577, "loss": 4.9203, "mean_token_accuracy": 0.21831177324056625, "num_tokens": 71598989.0, "step": 34505 }, { "entropy": 5.564099311828613, "epoch": 3.1304426705370103, "grad_norm": 1.3359375, "learning_rate": 0.00040334784143645087, "loss": 4.8675, "mean_token_accuracy": 0.2162409245967865, "num_tokens": 71608596.0, "step": 34510 }, { "entropy": 5.475565099716187, "epoch": 3.1308962264150946, "grad_norm": 1.21875, "learning_rate": 0.0004033212643952779, "loss": 4.8158, "mean_token_accuracy": 0.22638071924448014, "num_tokens": 71619182.0, "step": 34515 }, { "entropy": 5.53093695640564, "epoch": 3.1313497822931784, "grad_norm": 1.3203125, "learning_rate": 0.00040329468470038857, "loss": 4.895, "mean_token_accuracy": 0.2178827315568924, "num_tokens": 71629526.0, "step": 34520 }, { "entropy": 5.583569431304932, "epoch": 3.1318033381712627, "grad_norm": 1.3046875, "learning_rate": 0.0004032681023523324, "loss": 4.94, "mean_token_accuracy": 0.2171468123793602, "num_tokens": 71640146.0, "step": 34525 }, { "entropy": 5.541940546035766, "epoch": 3.132256894049347, "grad_norm": 1.140625, "learning_rate": 0.0004032415173516592, "loss": 4.7691, "mean_token_accuracy": 0.22338294088840485, "num_tokens": 71649652.0, "step": 34530 }, { "entropy": 5.536274814605713, "epoch": 3.132710449927431, "grad_norm": 1.1953125, "learning_rate": 0.0004032149296989187, "loss": 4.8643, "mean_token_accuracy": 0.22438554465770721, "num_tokens": 71659264.0, "step": 34535 }, { "entropy": 5.5584269046783445, "epoch": 3.133164005805515, "grad_norm": 1.25, "learning_rate": 0.00040318833939466083, "loss": 4.8638, "mean_token_accuracy": 0.22244865149259568, "num_tokens": 71669175.0, "step": 34540 }, { "entropy": 5.520556020736694, "epoch": 3.1336175616835993, "grad_norm": 1.3046875, "learning_rate": 0.0004031617464394354, "loss": 4.8807, "mean_token_accuracy": 0.21735884249210358, "num_tokens": 71679537.0, "step": 34545 }, { "entropy": 5.568161821365356, "epoch": 3.1340711175616836, "grad_norm": 1.28125, "learning_rate": 0.0004031351508337925, "loss": 4.9208, "mean_token_accuracy": 0.22201237380504607, "num_tokens": 71690024.0, "step": 34550 }, { "entropy": 5.609154605865479, "epoch": 3.134524673439768, "grad_norm": 1.1953125, "learning_rate": 0.0004031085525782819, "loss": 4.8738, "mean_token_accuracy": 0.2237461119890213, "num_tokens": 71700019.0, "step": 34555 }, { "entropy": 5.6059965133667, "epoch": 3.134978229317852, "grad_norm": 1.2109375, "learning_rate": 0.0004030819516734539, "loss": 4.9135, "mean_token_accuracy": 0.2089861661195755, "num_tokens": 71710570.0, "step": 34560 }, { "entropy": 5.558532810211181, "epoch": 3.1354317851959363, "grad_norm": 1.21875, "learning_rate": 0.00040305534811985844, "loss": 4.9119, "mean_token_accuracy": 0.2248402014374733, "num_tokens": 71720619.0, "step": 34565 }, { "entropy": 5.512317943572998, "epoch": 3.13588534107402, "grad_norm": 1.234375, "learning_rate": 0.0004030287419180457, "loss": 4.8488, "mean_token_accuracy": 0.2248748481273651, "num_tokens": 71730201.0, "step": 34570 }, { "entropy": 5.557100057601929, "epoch": 3.1363388969521044, "grad_norm": 1.15625, "learning_rate": 0.00040300213306856606, "loss": 4.8986, "mean_token_accuracy": 0.22717063128948212, "num_tokens": 71741368.0, "step": 34575 }, { "entropy": 5.5056891441345215, "epoch": 3.1367924528301887, "grad_norm": 1.1953125, "learning_rate": 0.0004029755215719696, "loss": 4.802, "mean_token_accuracy": 0.22738597840070723, "num_tokens": 71751361.0, "step": 34580 }, { "entropy": 5.585212469100952, "epoch": 3.137246008708273, "grad_norm": 1.3046875, "learning_rate": 0.00040294890742880677, "loss": 4.8548, "mean_token_accuracy": 0.2245437756180763, "num_tokens": 71761164.0, "step": 34585 }, { "entropy": 5.521195125579834, "epoch": 3.1376995645863572, "grad_norm": 1.2109375, "learning_rate": 0.00040292229063962787, "loss": 4.8433, "mean_token_accuracy": 0.2285145953297615, "num_tokens": 71770726.0, "step": 34590 }, { "entropy": 5.59365439414978, "epoch": 3.138153120464441, "grad_norm": 1.25, "learning_rate": 0.0004028956712049834, "loss": 4.9192, "mean_token_accuracy": 0.2242444321513176, "num_tokens": 71781124.0, "step": 34595 }, { "entropy": 5.529942369461059, "epoch": 3.1386066763425253, "grad_norm": 1.1875, "learning_rate": 0.000402869049125424, "loss": 4.8583, "mean_token_accuracy": 0.21993466317653657, "num_tokens": 71791218.0, "step": 34600 }, { "entropy": 5.575375318527222, "epoch": 3.1390602322206096, "grad_norm": 1.296875, "learning_rate": 0.0004028424244015, "loss": 4.8719, "mean_token_accuracy": 0.22249774038791656, "num_tokens": 71801013.0, "step": 34605 }, { "entropy": 5.585590505599976, "epoch": 3.139513788098694, "grad_norm": 1.171875, "learning_rate": 0.000402815797033762, "loss": 4.9447, "mean_token_accuracy": 0.2149223878979683, "num_tokens": 71811742.0, "step": 34610 }, { "entropy": 5.510783624649048, "epoch": 3.139967343976778, "grad_norm": 1.2265625, "learning_rate": 0.0004027891670227609, "loss": 4.853, "mean_token_accuracy": 0.21937250941991807, "num_tokens": 71822265.0, "step": 34615 }, { "entropy": 5.537871313095093, "epoch": 3.140420899854862, "grad_norm": 1.234375, "learning_rate": 0.0004027625343690472, "loss": 4.8268, "mean_token_accuracy": 0.2208012416958809, "num_tokens": 71832090.0, "step": 34620 }, { "entropy": 5.5265788555145265, "epoch": 3.140874455732946, "grad_norm": 1.171875, "learning_rate": 0.0004027358990731717, "loss": 4.8575, "mean_token_accuracy": 0.22246159017086028, "num_tokens": 71841381.0, "step": 34625 }, { "entropy": 5.5233588218688965, "epoch": 3.1413280116110305, "grad_norm": 1.2109375, "learning_rate": 0.00040270926113568524, "loss": 4.8743, "mean_token_accuracy": 0.21706269979476928, "num_tokens": 71851383.0, "step": 34630 }, { "entropy": 5.51249680519104, "epoch": 3.1417815674891147, "grad_norm": 1.2109375, "learning_rate": 0.00040268262055713873, "loss": 4.8401, "mean_token_accuracy": 0.2236299678683281, "num_tokens": 71862588.0, "step": 34635 }, { "entropy": 5.523455667495727, "epoch": 3.142235123367199, "grad_norm": 1.109375, "learning_rate": 0.0004026559773380831, "loss": 4.8305, "mean_token_accuracy": 0.22294923067092895, "num_tokens": 71873975.0, "step": 34640 }, { "entropy": 5.612429761886597, "epoch": 3.142688679245283, "grad_norm": 1.3671875, "learning_rate": 0.0004026293314790694, "loss": 4.9239, "mean_token_accuracy": 0.21310394257307053, "num_tokens": 71884084.0, "step": 34645 }, { "entropy": 5.52652587890625, "epoch": 3.143142235123367, "grad_norm": 1.3046875, "learning_rate": 0.0004026026829806485, "loss": 4.8794, "mean_token_accuracy": 0.2140487551689148, "num_tokens": 71894643.0, "step": 34650 }, { "entropy": 5.4806227684021, "epoch": 3.1435957910014514, "grad_norm": 1.2578125, "learning_rate": 0.00040257603184337167, "loss": 4.8008, "mean_token_accuracy": 0.22399496287107468, "num_tokens": 71905245.0, "step": 34655 }, { "entropy": 5.57176513671875, "epoch": 3.1440493468795356, "grad_norm": 1.1796875, "learning_rate": 0.00040254937806778995, "loss": 4.9211, "mean_token_accuracy": 0.21435303688049318, "num_tokens": 71916473.0, "step": 34660 }, { "entropy": 5.535465908050537, "epoch": 3.14450290275762, "grad_norm": 1.125, "learning_rate": 0.00040252272165445456, "loss": 4.8809, "mean_token_accuracy": 0.2214602917432785, "num_tokens": 71927465.0, "step": 34665 }, { "entropy": 5.556954669952392, "epoch": 3.1449564586357037, "grad_norm": 1.2265625, "learning_rate": 0.0004024960626039168, "loss": 4.8793, "mean_token_accuracy": 0.2214064672589302, "num_tokens": 71937380.0, "step": 34670 }, { "entropy": 5.568004941940307, "epoch": 3.145410014513788, "grad_norm": 1.2734375, "learning_rate": 0.00040246940091672806, "loss": 4.9015, "mean_token_accuracy": 0.22360762357711791, "num_tokens": 71948088.0, "step": 34675 }, { "entropy": 5.552810096740723, "epoch": 3.1458635703918723, "grad_norm": 1.2265625, "learning_rate": 0.0004024427365934395, "loss": 4.8308, "mean_token_accuracy": 0.22851835787296296, "num_tokens": 71958284.0, "step": 34680 }, { "entropy": 5.54061541557312, "epoch": 3.1463171262699565, "grad_norm": 1.34375, "learning_rate": 0.00040241606963460283, "loss": 4.9347, "mean_token_accuracy": 0.21367644071578978, "num_tokens": 71968138.0, "step": 34685 }, { "entropy": 5.5956042289733885, "epoch": 3.146770682148041, "grad_norm": 1.140625, "learning_rate": 0.00040238940004076924, "loss": 4.9334, "mean_token_accuracy": 0.22157119810581208, "num_tokens": 71978275.0, "step": 34690 }, { "entropy": 5.510547256469726, "epoch": 3.1472242380261246, "grad_norm": 1.234375, "learning_rate": 0.00040236272781249047, "loss": 4.8777, "mean_token_accuracy": 0.22388822585344315, "num_tokens": 71988875.0, "step": 34695 }, { "entropy": 5.541162109375, "epoch": 3.147677793904209, "grad_norm": 1.140625, "learning_rate": 0.00040233605295031795, "loss": 4.8468, "mean_token_accuracy": 0.22453829199075698, "num_tokens": 71999560.0, "step": 34700 }, { "entropy": 5.56273627281189, "epoch": 3.148131349782293, "grad_norm": 1.2265625, "learning_rate": 0.0004023093754548034, "loss": 4.8696, "mean_token_accuracy": 0.22605786770582198, "num_tokens": 72009970.0, "step": 34705 }, { "entropy": 5.564571189880371, "epoch": 3.1485849056603774, "grad_norm": 1.265625, "learning_rate": 0.0004022826953264986, "loss": 4.8921, "mean_token_accuracy": 0.2246354714035988, "num_tokens": 72020196.0, "step": 34710 }, { "entropy": 5.526821184158325, "epoch": 3.1490384615384617, "grad_norm": 1.21875, "learning_rate": 0.00040225601256595525, "loss": 4.7992, "mean_token_accuracy": 0.21854398995637894, "num_tokens": 72031456.0, "step": 34715 }, { "entropy": 5.581139945983887, "epoch": 3.149492017416546, "grad_norm": 1.21875, "learning_rate": 0.000402229327173725, "loss": 4.9331, "mean_token_accuracy": 0.21744608581066133, "num_tokens": 72042260.0, "step": 34720 }, { "entropy": 5.618552589416504, "epoch": 3.1499455732946298, "grad_norm": 1.171875, "learning_rate": 0.00040220263915035997, "loss": 4.9924, "mean_token_accuracy": 0.20093594789505004, "num_tokens": 72053463.0, "step": 34725 }, { "entropy": 5.6715727806091305, "epoch": 3.150399129172714, "grad_norm": 1.2578125, "learning_rate": 0.00040217594849641195, "loss": 4.9982, "mean_token_accuracy": 0.2126060262322426, "num_tokens": 72064508.0, "step": 34730 }, { "entropy": 5.497507047653198, "epoch": 3.1508526850507983, "grad_norm": 1.265625, "learning_rate": 0.00040214925521243287, "loss": 4.883, "mean_token_accuracy": 0.213919235765934, "num_tokens": 72074758.0, "step": 34735 }, { "entropy": 5.538395071029663, "epoch": 3.1513062409288826, "grad_norm": 1.21875, "learning_rate": 0.00040212255929897474, "loss": 4.8564, "mean_token_accuracy": 0.22325537204742432, "num_tokens": 72085548.0, "step": 34740 }, { "entropy": 5.58392562866211, "epoch": 3.1517597968069664, "grad_norm": 1.1484375, "learning_rate": 0.0004020958607565897, "loss": 4.9529, "mean_token_accuracy": 0.2131912738084793, "num_tokens": 72096773.0, "step": 34745 }, { "entropy": 5.565107345581055, "epoch": 3.1522133526850507, "grad_norm": 1.2109375, "learning_rate": 0.0004020691595858299, "loss": 4.9248, "mean_token_accuracy": 0.218213951587677, "num_tokens": 72106832.0, "step": 34750 }, { "entropy": 5.568673610687256, "epoch": 3.152666908563135, "grad_norm": 1.1953125, "learning_rate": 0.00040204245578724754, "loss": 4.9233, "mean_token_accuracy": 0.2204669386148453, "num_tokens": 72117758.0, "step": 34755 }, { "entropy": 5.5883142948150635, "epoch": 3.153120464441219, "grad_norm": 1.171875, "learning_rate": 0.00040201574936139475, "loss": 4.8347, "mean_token_accuracy": 0.21859075129032135, "num_tokens": 72127522.0, "step": 34760 }, { "entropy": 5.510472536087036, "epoch": 3.1535740203193035, "grad_norm": 1.2265625, "learning_rate": 0.0004019890403088239, "loss": 4.8889, "mean_token_accuracy": 0.22430847436189652, "num_tokens": 72138310.0, "step": 34765 }, { "entropy": 5.5198845863342285, "epoch": 3.1540275761973877, "grad_norm": 1.2578125, "learning_rate": 0.00040196232863008735, "loss": 4.9091, "mean_token_accuracy": 0.22783053815364837, "num_tokens": 72148958.0, "step": 34770 }, { "entropy": 5.590095138549804, "epoch": 3.1544811320754715, "grad_norm": 1.3203125, "learning_rate": 0.00040193561432573754, "loss": 4.8642, "mean_token_accuracy": 0.2260219097137451, "num_tokens": 72158594.0, "step": 34775 }, { "entropy": 5.635335397720337, "epoch": 3.154934687953556, "grad_norm": 1.2109375, "learning_rate": 0.0004019088973963268, "loss": 4.9575, "mean_token_accuracy": 0.21859782487154006, "num_tokens": 72168552.0, "step": 34780 }, { "entropy": 5.549925327301025, "epoch": 3.15538824383164, "grad_norm": 1.2265625, "learning_rate": 0.00040188217784240785, "loss": 4.8395, "mean_token_accuracy": 0.22059770673513412, "num_tokens": 72178584.0, "step": 34785 }, { "entropy": 5.5287374496459964, "epoch": 3.1558417997097243, "grad_norm": 1.1640625, "learning_rate": 0.000401855455664533, "loss": 4.8611, "mean_token_accuracy": 0.22517748773097992, "num_tokens": 72189144.0, "step": 34790 }, { "entropy": 5.5797717571258545, "epoch": 3.1562953555878086, "grad_norm": 1.265625, "learning_rate": 0.0004018287308632551, "loss": 4.9058, "mean_token_accuracy": 0.22065042853355407, "num_tokens": 72198326.0, "step": 34795 }, { "entropy": 5.556631326675415, "epoch": 3.1567489114658924, "grad_norm": 1.375, "learning_rate": 0.0004018020034391266, "loss": 4.8569, "mean_token_accuracy": 0.2223059594631195, "num_tokens": 72207916.0, "step": 34800 }, { "entropy": 5.608988618850708, "epoch": 3.1572024673439767, "grad_norm": 1.21875, "learning_rate": 0.0004017752733927004, "loss": 4.8857, "mean_token_accuracy": 0.22504230886697768, "num_tokens": 72219111.0, "step": 34805 }, { "entropy": 5.552172231674194, "epoch": 3.157656023222061, "grad_norm": 1.140625, "learning_rate": 0.0004017485407245293, "loss": 4.8947, "mean_token_accuracy": 0.22499859929084778, "num_tokens": 72230081.0, "step": 34810 }, { "entropy": 5.468620777130127, "epoch": 3.1581095791001452, "grad_norm": 1.2734375, "learning_rate": 0.000401721805435166, "loss": 4.8326, "mean_token_accuracy": 0.22468551397323608, "num_tokens": 72240693.0, "step": 34815 }, { "entropy": 5.481899642944336, "epoch": 3.1585631349782295, "grad_norm": 1.2890625, "learning_rate": 0.00040169506752516356, "loss": 4.7929, "mean_token_accuracy": 0.23367743641138078, "num_tokens": 72250925.0, "step": 34820 }, { "entropy": 5.511834764480591, "epoch": 3.1590166908563133, "grad_norm": 1.25, "learning_rate": 0.0004016683269950748, "loss": 4.8046, "mean_token_accuracy": 0.2326040670275688, "num_tokens": 72261027.0, "step": 34825 }, { "entropy": 5.576647710800171, "epoch": 3.1594702467343976, "grad_norm": 1.2421875, "learning_rate": 0.00040164158384545267, "loss": 4.7654, "mean_token_accuracy": 0.23506312668323517, "num_tokens": 72269430.0, "step": 34830 }, { "entropy": 5.461353731155396, "epoch": 3.159923802612482, "grad_norm": 1.0859375, "learning_rate": 0.0004016148380768504, "loss": 4.8047, "mean_token_accuracy": 0.22523862719535828, "num_tokens": 72280207.0, "step": 34835 }, { "entropy": 5.5288159370422365, "epoch": 3.160377358490566, "grad_norm": 1.203125, "learning_rate": 0.00040158808968982103, "loss": 4.9767, "mean_token_accuracy": 0.2219698116183281, "num_tokens": 72290093.0, "step": 34840 }, { "entropy": 5.525186681747437, "epoch": 3.1608309143686504, "grad_norm": 1.1484375, "learning_rate": 0.00040156133868491766, "loss": 4.8053, "mean_token_accuracy": 0.22647631168365479, "num_tokens": 72300203.0, "step": 34845 }, { "entropy": 5.545291566848755, "epoch": 3.161284470246734, "grad_norm": 1.2265625, "learning_rate": 0.00040153458506269365, "loss": 4.8663, "mean_token_accuracy": 0.21986546218395234, "num_tokens": 72311778.0, "step": 34850 }, { "entropy": 5.5552538394927975, "epoch": 3.1617380261248185, "grad_norm": 1.2890625, "learning_rate": 0.000401507828823702, "loss": 4.8572, "mean_token_accuracy": 0.2222330629825592, "num_tokens": 72322142.0, "step": 34855 }, { "entropy": 5.615859699249268, "epoch": 3.1621915820029027, "grad_norm": 1.3515625, "learning_rate": 0.00040148106996849636, "loss": 4.9246, "mean_token_accuracy": 0.21920069307088852, "num_tokens": 72332312.0, "step": 34860 }, { "entropy": 5.464946699142456, "epoch": 3.162645137880987, "grad_norm": 1.2109375, "learning_rate": 0.00040145430849762993, "loss": 4.8077, "mean_token_accuracy": 0.2248086154460907, "num_tokens": 72342157.0, "step": 34865 }, { "entropy": 5.584286880493164, "epoch": 3.1630986937590713, "grad_norm": 1.109375, "learning_rate": 0.00040142754441165615, "loss": 4.889, "mean_token_accuracy": 0.22141101956367493, "num_tokens": 72353417.0, "step": 34870 }, { "entropy": 5.596046209335327, "epoch": 3.1635522496371555, "grad_norm": 1.1953125, "learning_rate": 0.0004014007777111285, "loss": 4.8509, "mean_token_accuracy": 0.22268968522548677, "num_tokens": 72363744.0, "step": 34875 }, { "entropy": 5.555856084823608, "epoch": 3.1640058055152394, "grad_norm": 1.328125, "learning_rate": 0.00040137400839660066, "loss": 4.9213, "mean_token_accuracy": 0.21781760305166245, "num_tokens": 72375241.0, "step": 34880 }, { "entropy": 5.559301280975342, "epoch": 3.1644593613933236, "grad_norm": 1.28125, "learning_rate": 0.00040134723646862607, "loss": 4.9123, "mean_token_accuracy": 0.21870714873075486, "num_tokens": 72385475.0, "step": 34885 }, { "entropy": 5.555531167984009, "epoch": 3.164912917271408, "grad_norm": 1.125, "learning_rate": 0.00040132046192775835, "loss": 4.9615, "mean_token_accuracy": 0.21874299943447112, "num_tokens": 72396417.0, "step": 34890 }, { "entropy": 5.577684831619263, "epoch": 3.165366473149492, "grad_norm": 1.171875, "learning_rate": 0.0004012936847745514, "loss": 4.9112, "mean_token_accuracy": 0.22032735049724578, "num_tokens": 72406169.0, "step": 34895 }, { "entropy": 5.558085775375366, "epoch": 3.165820029027576, "grad_norm": 1.2421875, "learning_rate": 0.0004012669050095589, "loss": 4.8986, "mean_token_accuracy": 0.2150781363248825, "num_tokens": 72416522.0, "step": 34900 }, { "entropy": 5.5857851028442385, "epoch": 3.1662735849056602, "grad_norm": 1.203125, "learning_rate": 0.0004012401226333345, "loss": 4.9261, "mean_token_accuracy": 0.21964346170425414, "num_tokens": 72426000.0, "step": 34905 }, { "entropy": 5.6045068264007565, "epoch": 3.1667271407837445, "grad_norm": 1.2734375, "learning_rate": 0.0004012133376464322, "loss": 4.9705, "mean_token_accuracy": 0.2172339752316475, "num_tokens": 72435952.0, "step": 34910 }, { "entropy": 5.589573383331299, "epoch": 3.1671806966618288, "grad_norm": 1.0234375, "learning_rate": 0.00040118655004940597, "loss": 4.9122, "mean_token_accuracy": 0.22168498188257219, "num_tokens": 72449957.0, "step": 34915 }, { "entropy": 5.557134580612183, "epoch": 3.167634252539913, "grad_norm": 1.1640625, "learning_rate": 0.0004011597598428097, "loss": 4.889, "mean_token_accuracy": 0.22602726072072982, "num_tokens": 72459956.0, "step": 34920 }, { "entropy": 5.533215761184692, "epoch": 3.1680878084179973, "grad_norm": 1.0390625, "learning_rate": 0.0004011329670271975, "loss": 4.8189, "mean_token_accuracy": 0.22595339119434357, "num_tokens": 72471107.0, "step": 34925 }, { "entropy": 5.502209091186524, "epoch": 3.168541364296081, "grad_norm": 1.078125, "learning_rate": 0.00040110617160312334, "loss": 4.8421, "mean_token_accuracy": 0.22599032670259475, "num_tokens": 72481428.0, "step": 34930 }, { "entropy": 5.5806890487670895, "epoch": 3.1689949201741654, "grad_norm": 1.234375, "learning_rate": 0.0004010793735711415, "loss": 4.9226, "mean_token_accuracy": 0.2110712170600891, "num_tokens": 72491133.0, "step": 34935 }, { "entropy": 5.500141620635986, "epoch": 3.1694484760522497, "grad_norm": 1.1796875, "learning_rate": 0.00040105257293180605, "loss": 4.8131, "mean_token_accuracy": 0.22647165805101394, "num_tokens": 72502047.0, "step": 34940 }, { "entropy": 5.593183851242065, "epoch": 3.169902031930334, "grad_norm": 1.1796875, "learning_rate": 0.0004010257696856712, "loss": 4.867, "mean_token_accuracy": 0.21808237284421922, "num_tokens": 72513120.0, "step": 34945 }, { "entropy": 5.627342224121094, "epoch": 3.170355587808418, "grad_norm": 1.2734375, "learning_rate": 0.00040099896383329135, "loss": 4.971, "mean_token_accuracy": 0.22320060580968856, "num_tokens": 72523118.0, "step": 34950 }, { "entropy": 5.602311086654663, "epoch": 3.170809143686502, "grad_norm": 1.1796875, "learning_rate": 0.00040097215537522086, "loss": 4.9709, "mean_token_accuracy": 0.2184840112924576, "num_tokens": 72533697.0, "step": 34955 }, { "entropy": 5.526277256011963, "epoch": 3.1712626995645863, "grad_norm": 1.3046875, "learning_rate": 0.00040094534431201406, "loss": 4.8297, "mean_token_accuracy": 0.2328079089522362, "num_tokens": 72543661.0, "step": 34960 }, { "entropy": 5.588747167587281, "epoch": 3.1717162554426706, "grad_norm": 1.2421875, "learning_rate": 0.0004009185306442255, "loss": 4.9508, "mean_token_accuracy": 0.2202364131808281, "num_tokens": 72554551.0, "step": 34965 }, { "entropy": 5.574983739852906, "epoch": 3.172169811320755, "grad_norm": 1.1484375, "learning_rate": 0.00040089171437240954, "loss": 4.9843, "mean_token_accuracy": 0.21238282471895217, "num_tokens": 72565134.0, "step": 34970 }, { "entropy": 5.552337646484375, "epoch": 3.172623367198839, "grad_norm": 1.3515625, "learning_rate": 0.00040086489549712097, "loss": 4.8817, "mean_token_accuracy": 0.22483900785446168, "num_tokens": 72574981.0, "step": 34975 }, { "entropy": 5.595092535018921, "epoch": 3.173076923076923, "grad_norm": 1.3046875, "learning_rate": 0.0004008380740189142, "loss": 4.8822, "mean_token_accuracy": 0.2197675108909607, "num_tokens": 72585073.0, "step": 34980 }, { "entropy": 5.586976146697998, "epoch": 3.173530478955007, "grad_norm": 1.2265625, "learning_rate": 0.000400811249938344, "loss": 4.8852, "mean_token_accuracy": 0.22212421596050264, "num_tokens": 72595719.0, "step": 34985 }, { "entropy": 5.599682950973511, "epoch": 3.1739840348330914, "grad_norm": 1.21875, "learning_rate": 0.0004007844232559652, "loss": 4.8595, "mean_token_accuracy": 0.22111351191997528, "num_tokens": 72605276.0, "step": 34990 }, { "entropy": 5.581099367141723, "epoch": 3.1744375907111757, "grad_norm": 1.21875, "learning_rate": 0.0004007575939723324, "loss": 4.9138, "mean_token_accuracy": 0.2199219286441803, "num_tokens": 72614964.0, "step": 34995 }, { "entropy": 5.5865983963012695, "epoch": 3.17489114658926, "grad_norm": 1.203125, "learning_rate": 0.0004007307620880004, "loss": 4.9043, "mean_token_accuracy": 0.22133212089538573, "num_tokens": 72625461.0, "step": 35000 }, { "entropy": 5.574169397354126, "epoch": 3.175344702467344, "grad_norm": 1.125, "learning_rate": 0.00040070392760352424, "loss": 4.9139, "mean_token_accuracy": 0.22211068272590637, "num_tokens": 72636192.0, "step": 35005 }, { "entropy": 5.597622108459473, "epoch": 3.175798258345428, "grad_norm": 1.09375, "learning_rate": 0.00040067709051945895, "loss": 4.9018, "mean_token_accuracy": 0.22018223404884338, "num_tokens": 72648432.0, "step": 35010 }, { "entropy": 5.597772455215454, "epoch": 3.1762518142235123, "grad_norm": 1.296875, "learning_rate": 0.0004006502508363593, "loss": 4.8458, "mean_token_accuracy": 0.2180676653981209, "num_tokens": 72658678.0, "step": 35015 }, { "entropy": 5.661026191711426, "epoch": 3.1767053701015966, "grad_norm": 1.2421875, "learning_rate": 0.00040062340855478046, "loss": 5.0347, "mean_token_accuracy": 0.21105266511440277, "num_tokens": 72669191.0, "step": 35020 }, { "entropy": 5.5895562171936035, "epoch": 3.177158925979681, "grad_norm": 1.25, "learning_rate": 0.00040059656367527754, "loss": 4.8501, "mean_token_accuracy": 0.22149389684200288, "num_tokens": 72679327.0, "step": 35025 }, { "entropy": 5.593973016738891, "epoch": 3.1776124818577647, "grad_norm": 1.1640625, "learning_rate": 0.0004005697161984056, "loss": 4.9232, "mean_token_accuracy": 0.22123364061117173, "num_tokens": 72689673.0, "step": 35030 }, { "entropy": 5.556650829315186, "epoch": 3.178066037735849, "grad_norm": 1.25, "learning_rate": 0.00040054286612472006, "loss": 4.9445, "mean_token_accuracy": 0.20845353752374648, "num_tokens": 72700606.0, "step": 35035 }, { "entropy": 5.61268835067749, "epoch": 3.178519593613933, "grad_norm": 1.15625, "learning_rate": 0.00040051601345477593, "loss": 4.8927, "mean_token_accuracy": 0.2196554571390152, "num_tokens": 72711195.0, "step": 35040 }, { "entropy": 5.605026912689209, "epoch": 3.1789731494920175, "grad_norm": 1.234375, "learning_rate": 0.00040048915818912875, "loss": 4.9081, "mean_token_accuracy": 0.2199632927775383, "num_tokens": 72721160.0, "step": 35045 }, { "entropy": 5.535356855392456, "epoch": 3.1794267053701017, "grad_norm": 1.328125, "learning_rate": 0.00040046230032833374, "loss": 4.9071, "mean_token_accuracy": 0.21814224869012833, "num_tokens": 72730867.0, "step": 35050 }, { "entropy": 5.536412715911865, "epoch": 3.1798802612481856, "grad_norm": 1.234375, "learning_rate": 0.0004004354398729464, "loss": 4.9149, "mean_token_accuracy": 0.21642815321683884, "num_tokens": 72740453.0, "step": 35055 }, { "entropy": 5.616608333587647, "epoch": 3.18033381712627, "grad_norm": 1.234375, "learning_rate": 0.0004004085768235222, "loss": 4.9281, "mean_token_accuracy": 0.2130058228969574, "num_tokens": 72751395.0, "step": 35060 }, { "entropy": 5.584973859786987, "epoch": 3.180787373004354, "grad_norm": 1.3046875, "learning_rate": 0.00040038171118061673, "loss": 4.8728, "mean_token_accuracy": 0.22164758592844008, "num_tokens": 72761300.0, "step": 35065 }, { "entropy": 5.557423400878906, "epoch": 3.1812409288824384, "grad_norm": 1.1484375, "learning_rate": 0.0004003548429447855, "loss": 4.8692, "mean_token_accuracy": 0.2269958645105362, "num_tokens": 72772011.0, "step": 35070 }, { "entropy": 5.5699926853179935, "epoch": 3.1816944847605226, "grad_norm": 1.1953125, "learning_rate": 0.0004003279721165841, "loss": 4.9029, "mean_token_accuracy": 0.21509736329317092, "num_tokens": 72782521.0, "step": 35075 }, { "entropy": 5.5035923480987545, "epoch": 3.182148040638607, "grad_norm": 1.1484375, "learning_rate": 0.0004003010986965683, "loss": 4.7867, "mean_token_accuracy": 0.22660263478755951, "num_tokens": 72793125.0, "step": 35080 }, { "entropy": 5.62787766456604, "epoch": 3.1826015965166907, "grad_norm": 1.1953125, "learning_rate": 0.000400274222685294, "loss": 4.9194, "mean_token_accuracy": 0.2203624278306961, "num_tokens": 72804541.0, "step": 35085 }, { "entropy": 5.698417901992798, "epoch": 3.183055152394775, "grad_norm": 1.1796875, "learning_rate": 0.00040024734408331664, "loss": 4.9792, "mean_token_accuracy": 0.21887696385383607, "num_tokens": 72814447.0, "step": 35090 }, { "entropy": 5.594095611572266, "epoch": 3.1835087082728593, "grad_norm": 1.3203125, "learning_rate": 0.00040022046289119246, "loss": 4.9096, "mean_token_accuracy": 0.22660548239946365, "num_tokens": 72823545.0, "step": 35095 }, { "entropy": 5.524208736419678, "epoch": 3.1839622641509435, "grad_norm": 1.15625, "learning_rate": 0.00040019357910947714, "loss": 4.7707, "mean_token_accuracy": 0.22666800320148467, "num_tokens": 72833803.0, "step": 35100 }, { "entropy": 5.617096900939941, "epoch": 3.1844158200290273, "grad_norm": 1.28125, "learning_rate": 0.00040016669273872666, "loss": 4.9099, "mean_token_accuracy": 0.22041612565517427, "num_tokens": 72843383.0, "step": 35105 }, { "entropy": 5.631731224060059, "epoch": 3.1848693759071116, "grad_norm": 1.203125, "learning_rate": 0.00040013980377949716, "loss": 4.9652, "mean_token_accuracy": 0.21513321101665497, "num_tokens": 72853285.0, "step": 35110 }, { "entropy": 5.569305658340454, "epoch": 3.185322931785196, "grad_norm": 1.265625, "learning_rate": 0.00040011291223234456, "loss": 4.947, "mean_token_accuracy": 0.21698566675186157, "num_tokens": 72863556.0, "step": 35115 }, { "entropy": 5.59058723449707, "epoch": 3.18577648766328, "grad_norm": 1.2109375, "learning_rate": 0.00040008601809782507, "loss": 4.8243, "mean_token_accuracy": 0.2241978883743286, "num_tokens": 72873296.0, "step": 35120 }, { "entropy": 5.611737680435181, "epoch": 3.1862300435413644, "grad_norm": 1.359375, "learning_rate": 0.0004000591213764948, "loss": 4.9585, "mean_token_accuracy": 0.2104458764195442, "num_tokens": 72884738.0, "step": 35125 }, { "entropy": 5.646515226364135, "epoch": 3.1866835994194487, "grad_norm": 1.3203125, "learning_rate": 0.00040003222206891017, "loss": 4.9445, "mean_token_accuracy": 0.2151230528950691, "num_tokens": 72894573.0, "step": 35130 }, { "entropy": 5.506661128997803, "epoch": 3.1871371552975325, "grad_norm": 1.21875, "learning_rate": 0.0004000053201756272, "loss": 4.8577, "mean_token_accuracy": 0.2242366909980774, "num_tokens": 72904976.0, "step": 35135 }, { "entropy": 5.580720853805542, "epoch": 3.1875907111756168, "grad_norm": 1.28125, "learning_rate": 0.0003999784156972024, "loss": 4.9033, "mean_token_accuracy": 0.21811815053224565, "num_tokens": 72915152.0, "step": 35140 }, { "entropy": 5.604629564285278, "epoch": 3.188044267053701, "grad_norm": 1.1640625, "learning_rate": 0.0003999515086341921, "loss": 4.98, "mean_token_accuracy": 0.20945134311914443, "num_tokens": 72925450.0, "step": 35145 }, { "entropy": 5.526330614089966, "epoch": 3.1884978229317853, "grad_norm": 1.109375, "learning_rate": 0.0003999245989871527, "loss": 4.8354, "mean_token_accuracy": 0.21800946295261384, "num_tokens": 72935990.0, "step": 35150 }, { "entropy": 5.523207330703736, "epoch": 3.1889513788098696, "grad_norm": 1.3359375, "learning_rate": 0.00039989768675664084, "loss": 4.7583, "mean_token_accuracy": 0.2233793780207634, "num_tokens": 72945662.0, "step": 35155 }, { "entropy": 5.510714197158814, "epoch": 3.1894049346879534, "grad_norm": 1.2421875, "learning_rate": 0.00039987077194321305, "loss": 4.7422, "mean_token_accuracy": 0.2282448634505272, "num_tokens": 72955313.0, "step": 35160 }, { "entropy": 5.627778434753418, "epoch": 3.1898584905660377, "grad_norm": 1.3046875, "learning_rate": 0.00039984385454742576, "loss": 4.995, "mean_token_accuracy": 0.21152457743883132, "num_tokens": 72965347.0, "step": 35165 }, { "entropy": 5.538826370239258, "epoch": 3.190312046444122, "grad_norm": 1.1953125, "learning_rate": 0.00039981693456983574, "loss": 4.8136, "mean_token_accuracy": 0.2261049672961235, "num_tokens": 72976794.0, "step": 35170 }, { "entropy": 5.541289377212524, "epoch": 3.190765602322206, "grad_norm": 1.171875, "learning_rate": 0.0003997900120109998, "loss": 4.8993, "mean_token_accuracy": 0.2250302866101265, "num_tokens": 72986837.0, "step": 35175 }, { "entropy": 5.561410236358642, "epoch": 3.1912191582002905, "grad_norm": 1.1171875, "learning_rate": 0.0003997630868714745, "loss": 4.8838, "mean_token_accuracy": 0.21482582688331603, "num_tokens": 72996819.0, "step": 35180 }, { "entropy": 5.507845735549926, "epoch": 3.1916727140783743, "grad_norm": 1.203125, "learning_rate": 0.00039973615915181687, "loss": 4.7727, "mean_token_accuracy": 0.2298409655690193, "num_tokens": 73005963.0, "step": 35185 }, { "entropy": 5.546430444717407, "epoch": 3.1921262699564585, "grad_norm": 1.25, "learning_rate": 0.00039970922885258363, "loss": 4.9277, "mean_token_accuracy": 0.2144476979970932, "num_tokens": 73015912.0, "step": 35190 }, { "entropy": 5.512864255905152, "epoch": 3.192579825834543, "grad_norm": 1.2109375, "learning_rate": 0.0003996822959743318, "loss": 4.7937, "mean_token_accuracy": 0.2349949970841408, "num_tokens": 73026528.0, "step": 35195 }, { "entropy": 5.582260179519653, "epoch": 3.193033381712627, "grad_norm": 1.3515625, "learning_rate": 0.0003996553605176183, "loss": 4.9326, "mean_token_accuracy": 0.2152012676000595, "num_tokens": 73036255.0, "step": 35200 }, { "entropy": 5.585186386108399, "epoch": 3.1934869375907113, "grad_norm": 1.109375, "learning_rate": 0.0003996284224830002, "loss": 4.9827, "mean_token_accuracy": 0.22125737369060516, "num_tokens": 73046686.0, "step": 35205 }, { "entropy": 5.540912342071533, "epoch": 3.193940493468795, "grad_norm": 1.171875, "learning_rate": 0.00039960148187103453, "loss": 4.793, "mean_token_accuracy": 0.22285069078207015, "num_tokens": 73056070.0, "step": 35210 }, { "entropy": 5.616141605377197, "epoch": 3.1943940493468794, "grad_norm": 1.2109375, "learning_rate": 0.00039957453868227845, "loss": 4.9183, "mean_token_accuracy": 0.22896254807710648, "num_tokens": 73066288.0, "step": 35215 }, { "entropy": 5.580283546447754, "epoch": 3.1948476052249637, "grad_norm": 1.2734375, "learning_rate": 0.00039954759291728915, "loss": 4.887, "mean_token_accuracy": 0.22154993265867234, "num_tokens": 73076297.0, "step": 35220 }, { "entropy": 5.597363519668579, "epoch": 3.195301161103048, "grad_norm": 1.2109375, "learning_rate": 0.00039952064457662395, "loss": 4.9563, "mean_token_accuracy": 0.21727415919303894, "num_tokens": 73086249.0, "step": 35225 }, { "entropy": 5.557369899749756, "epoch": 3.1957547169811322, "grad_norm": 1.234375, "learning_rate": 0.00039949369366084, "loss": 4.85, "mean_token_accuracy": 0.22280970215797424, "num_tokens": 73096358.0, "step": 35230 }, { "entropy": 5.503918266296386, "epoch": 3.196208272859216, "grad_norm": 1.2109375, "learning_rate": 0.00039946674017049484, "loss": 4.8134, "mean_token_accuracy": 0.2199138045310974, "num_tokens": 73106891.0, "step": 35235 }, { "entropy": 5.46235466003418, "epoch": 3.1966618287373003, "grad_norm": 1.1796875, "learning_rate": 0.00039943978410614565, "loss": 4.8454, "mean_token_accuracy": 0.2196485459804535, "num_tokens": 73117106.0, "step": 35240 }, { "entropy": 5.563179969787598, "epoch": 3.1971153846153846, "grad_norm": 1.265625, "learning_rate": 0.00039941282546835017, "loss": 4.9149, "mean_token_accuracy": 0.21892719566822053, "num_tokens": 73127112.0, "step": 35245 }, { "entropy": 5.5766366481781, "epoch": 3.197568940493469, "grad_norm": 1.28125, "learning_rate": 0.00039938586425766564, "loss": 4.8855, "mean_token_accuracy": 0.22278990149497985, "num_tokens": 73137751.0, "step": 35250 }, { "entropy": 5.601244354248047, "epoch": 3.198022496371553, "grad_norm": 1.21875, "learning_rate": 0.0003993589004746498, "loss": 4.8519, "mean_token_accuracy": 0.22690341174602507, "num_tokens": 73149303.0, "step": 35255 }, { "entropy": 5.522311544418335, "epoch": 3.198476052249637, "grad_norm": 1.234375, "learning_rate": 0.00039933193411986024, "loss": 4.8713, "mean_token_accuracy": 0.22230055034160615, "num_tokens": 73160025.0, "step": 35260 }, { "entropy": 5.535379838943482, "epoch": 3.198929608127721, "grad_norm": 1.125, "learning_rate": 0.00039930496519385454, "loss": 4.8667, "mean_token_accuracy": 0.22209324687719345, "num_tokens": 73170721.0, "step": 35265 }, { "entropy": 5.594349145889282, "epoch": 3.1993831640058055, "grad_norm": 1.1640625, "learning_rate": 0.00039927799369719047, "loss": 4.9125, "mean_token_accuracy": 0.21740833222866057, "num_tokens": 73180902.0, "step": 35270 }, { "entropy": 5.490474081039428, "epoch": 3.1998367198838897, "grad_norm": 1.203125, "learning_rate": 0.0003992510196304258, "loss": 4.746, "mean_token_accuracy": 0.22814437597990037, "num_tokens": 73191259.0, "step": 35275 }, { "entropy": 5.5359045505523685, "epoch": 3.200290275761974, "grad_norm": 1.1796875, "learning_rate": 0.00039922404299411846, "loss": 4.8694, "mean_token_accuracy": 0.22672757655382156, "num_tokens": 73201654.0, "step": 35280 }, { "entropy": 5.5473448753356935, "epoch": 3.2007438316400583, "grad_norm": 1.265625, "learning_rate": 0.0003991970637888262, "loss": 4.906, "mean_token_accuracy": 0.21040115654468536, "num_tokens": 73212658.0, "step": 35285 }, { "entropy": 5.606217527389527, "epoch": 3.201197387518142, "grad_norm": 1.3515625, "learning_rate": 0.000399170082015107, "loss": 4.896, "mean_token_accuracy": 0.21643820106983186, "num_tokens": 73222883.0, "step": 35290 }, { "entropy": 5.54066801071167, "epoch": 3.2016509433962264, "grad_norm": 1.1953125, "learning_rate": 0.000399143097673519, "loss": 4.8511, "mean_token_accuracy": 0.21891450583934785, "num_tokens": 73233731.0, "step": 35295 }, { "entropy": 5.5221171379089355, "epoch": 3.2021044992743106, "grad_norm": 1.2890625, "learning_rate": 0.00039911611076461995, "loss": 4.7939, "mean_token_accuracy": 0.2306176319718361, "num_tokens": 73243794.0, "step": 35300 }, { "entropy": 5.560508871078492, "epoch": 3.202558055152395, "grad_norm": 1.3046875, "learning_rate": 0.00039908912128896817, "loss": 4.8502, "mean_token_accuracy": 0.21862610131502153, "num_tokens": 73254708.0, "step": 35305 }, { "entropy": 5.500275564193726, "epoch": 3.203011611030479, "grad_norm": 1.3046875, "learning_rate": 0.0003990621292471217, "loss": 4.8713, "mean_token_accuracy": 0.21953899413347244, "num_tokens": 73265311.0, "step": 35310 }, { "entropy": 5.660466861724854, "epoch": 3.203465166908563, "grad_norm": 1.1875, "learning_rate": 0.00039903513463963874, "loss": 5.0493, "mean_token_accuracy": 0.21423365026712418, "num_tokens": 73275886.0, "step": 35315 }, { "entropy": 5.6322455406188965, "epoch": 3.2039187227866472, "grad_norm": 1.2265625, "learning_rate": 0.0003990081374670777, "loss": 4.8947, "mean_token_accuracy": 0.22120142430067063, "num_tokens": 73285903.0, "step": 35320 }, { "entropy": 5.5270287036895756, "epoch": 3.2043722786647315, "grad_norm": 1.265625, "learning_rate": 0.00039898113772999665, "loss": 4.8642, "mean_token_accuracy": 0.21886866092681884, "num_tokens": 73296571.0, "step": 35325 }, { "entropy": 5.545783853530883, "epoch": 3.2048258345428158, "grad_norm": 1.1640625, "learning_rate": 0.00039895413542895427, "loss": 4.9261, "mean_token_accuracy": 0.2103846400976181, "num_tokens": 73307105.0, "step": 35330 }, { "entropy": 5.523897981643676, "epoch": 3.2052793904209, "grad_norm": 1.3828125, "learning_rate": 0.0003989271305645086, "loss": 4.8316, "mean_token_accuracy": 0.22511658817529678, "num_tokens": 73316664.0, "step": 35335 }, { "entropy": 5.579960346221924, "epoch": 3.205732946298984, "grad_norm": 1.1640625, "learning_rate": 0.00039890012313721835, "loss": 4.9102, "mean_token_accuracy": 0.22622746527194976, "num_tokens": 73327438.0, "step": 35340 }, { "entropy": 5.581797552108765, "epoch": 3.206186502177068, "grad_norm": 1.2890625, "learning_rate": 0.000398873113147642, "loss": 4.8756, "mean_token_accuracy": 0.22193843573331834, "num_tokens": 73337635.0, "step": 35345 }, { "entropy": 5.532924604415894, "epoch": 3.2066400580551524, "grad_norm": 1.296875, "learning_rate": 0.00039884610059633807, "loss": 4.8719, "mean_token_accuracy": 0.22390449792146683, "num_tokens": 73347032.0, "step": 35350 }, { "entropy": 5.635136127471924, "epoch": 3.2070936139332367, "grad_norm": 1.2109375, "learning_rate": 0.0003988190854838652, "loss": 4.9681, "mean_token_accuracy": 0.21327707320451736, "num_tokens": 73357780.0, "step": 35355 }, { "entropy": 5.6298424243927006, "epoch": 3.207547169811321, "grad_norm": 1.2421875, "learning_rate": 0.00039879206781078214, "loss": 4.9249, "mean_token_accuracy": 0.21806975901126863, "num_tokens": 73367831.0, "step": 35360 }, { "entropy": 5.5899327278137205, "epoch": 3.2080007256894048, "grad_norm": 1.0703125, "learning_rate": 0.0003987650475776476, "loss": 4.8785, "mean_token_accuracy": 0.22172315269708634, "num_tokens": 73378588.0, "step": 35365 }, { "entropy": 5.545698404312134, "epoch": 3.208454281567489, "grad_norm": 1.2890625, "learning_rate": 0.00039873802478502027, "loss": 4.8692, "mean_token_accuracy": 0.22284936904907227, "num_tokens": 73388414.0, "step": 35370 }, { "entropy": 5.557383966445923, "epoch": 3.2089078374455733, "grad_norm": 1.203125, "learning_rate": 0.0003987109994334591, "loss": 4.862, "mean_token_accuracy": 0.22220928519964217, "num_tokens": 73398891.0, "step": 35375 }, { "entropy": 5.593102025985718, "epoch": 3.2093613933236576, "grad_norm": 1.234375, "learning_rate": 0.0003986839715235229, "loss": 4.9329, "mean_token_accuracy": 0.2166339486837387, "num_tokens": 73409605.0, "step": 35380 }, { "entropy": 5.636483192443848, "epoch": 3.209814949201742, "grad_norm": 1.3203125, "learning_rate": 0.00039865694105577063, "loss": 4.9496, "mean_token_accuracy": 0.21568632423877715, "num_tokens": 73419103.0, "step": 35385 }, { "entropy": 5.499610090255738, "epoch": 3.2102685050798256, "grad_norm": 1.2890625, "learning_rate": 0.0003986299080307614, "loss": 4.873, "mean_token_accuracy": 0.21650802195072175, "num_tokens": 73429134.0, "step": 35390 }, { "entropy": 5.554768323898315, "epoch": 3.21072206095791, "grad_norm": 1.140625, "learning_rate": 0.0003986028724490541, "loss": 4.9555, "mean_token_accuracy": 0.21035676151514054, "num_tokens": 73440382.0, "step": 35395 }, { "entropy": 5.615599536895752, "epoch": 3.211175616835994, "grad_norm": 1.25, "learning_rate": 0.0003985758343112079, "loss": 4.8787, "mean_token_accuracy": 0.22766050994396209, "num_tokens": 73451300.0, "step": 35400 }, { "entropy": 5.53894453048706, "epoch": 3.2116291727140784, "grad_norm": 1.296875, "learning_rate": 0.00039854879361778193, "loss": 4.7933, "mean_token_accuracy": 0.21921161711215972, "num_tokens": 73461339.0, "step": 35405 }, { "entropy": 5.56909213066101, "epoch": 3.2120827285921627, "grad_norm": 1.1484375, "learning_rate": 0.00039852175036933545, "loss": 4.899, "mean_token_accuracy": 0.2208245202898979, "num_tokens": 73470961.0, "step": 35410 }, { "entropy": 5.6495246410369875, "epoch": 3.2125362844702465, "grad_norm": 1.140625, "learning_rate": 0.00039849470456642777, "loss": 4.9689, "mean_token_accuracy": 0.21246253103017806, "num_tokens": 73481492.0, "step": 35415 }, { "entropy": 5.529250001907348, "epoch": 3.212989840348331, "grad_norm": 1.2109375, "learning_rate": 0.00039846765620961806, "loss": 4.8382, "mean_token_accuracy": 0.21976940035820008, "num_tokens": 73492351.0, "step": 35420 }, { "entropy": 5.572080278396607, "epoch": 3.213443396226415, "grad_norm": 1.2578125, "learning_rate": 0.0003984406052994658, "loss": 4.9225, "mean_token_accuracy": 0.21864311546087264, "num_tokens": 73503265.0, "step": 35425 }, { "entropy": 5.5797278881073, "epoch": 3.2138969521044993, "grad_norm": 1.21875, "learning_rate": 0.0003984135518365303, "loss": 4.9154, "mean_token_accuracy": 0.21512652486562728, "num_tokens": 73513804.0, "step": 35430 }, { "entropy": 5.639270925521851, "epoch": 3.2143505079825836, "grad_norm": 1.3515625, "learning_rate": 0.00039838649582137113, "loss": 4.9339, "mean_token_accuracy": 0.21635469943284988, "num_tokens": 73523453.0, "step": 35435 }, { "entropy": 5.644436550140381, "epoch": 3.214804063860668, "grad_norm": 1.1796875, "learning_rate": 0.00039835943725454777, "loss": 5.0051, "mean_token_accuracy": 0.20617130547761917, "num_tokens": 73533931.0, "step": 35440 }, { "entropy": 5.628381061553955, "epoch": 3.2152576197387517, "grad_norm": 1.3125, "learning_rate": 0.00039833237613661984, "loss": 4.951, "mean_token_accuracy": 0.21855593621730804, "num_tokens": 73544562.0, "step": 35445 }, { "entropy": 5.595402526855469, "epoch": 3.215711175616836, "grad_norm": 1.1796875, "learning_rate": 0.0003983053124681469, "loss": 4.8933, "mean_token_accuracy": 0.2220338687300682, "num_tokens": 73555149.0, "step": 35450 }, { "entropy": 5.505956172943115, "epoch": 3.21616473149492, "grad_norm": 1.171875, "learning_rate": 0.00039827824624968873, "loss": 4.8236, "mean_token_accuracy": 0.21488001346588134, "num_tokens": 73565131.0, "step": 35455 }, { "entropy": 5.5565910816192625, "epoch": 3.2166182873730045, "grad_norm": 1.234375, "learning_rate": 0.00039825117748180493, "loss": 4.8568, "mean_token_accuracy": 0.2261882930994034, "num_tokens": 73574185.0, "step": 35460 }, { "entropy": 5.602627468109131, "epoch": 3.2170718432510883, "grad_norm": 1.2890625, "learning_rate": 0.00039822410616505545, "loss": 4.958, "mean_token_accuracy": 0.21362265795469285, "num_tokens": 73585733.0, "step": 35465 }, { "entropy": 5.66994161605835, "epoch": 3.2175253991291726, "grad_norm": 1.3359375, "learning_rate": 0.00039819703230000006, "loss": 4.9821, "mean_token_accuracy": 0.21711804419755937, "num_tokens": 73597077.0, "step": 35470 }, { "entropy": 5.538753366470337, "epoch": 3.217978955007257, "grad_norm": 1.140625, "learning_rate": 0.0003981699558871986, "loss": 4.9373, "mean_token_accuracy": 0.22189857065677643, "num_tokens": 73607885.0, "step": 35475 }, { "entropy": 5.584167861938477, "epoch": 3.218432510885341, "grad_norm": 1.296875, "learning_rate": 0.000398142876927211, "loss": 4.8859, "mean_token_accuracy": 0.21857452094554902, "num_tokens": 73618769.0, "step": 35480 }, { "entropy": 5.65290904045105, "epoch": 3.2188860667634254, "grad_norm": 1.140625, "learning_rate": 0.00039811579542059744, "loss": 4.9957, "mean_token_accuracy": 0.21279487609863282, "num_tokens": 73629345.0, "step": 35485 }, { "entropy": 5.549328279495239, "epoch": 3.2193396226415096, "grad_norm": 1.3203125, "learning_rate": 0.00039808871136791786, "loss": 4.8577, "mean_token_accuracy": 0.2175550267100334, "num_tokens": 73639698.0, "step": 35490 }, { "entropy": 5.526072835922241, "epoch": 3.2197931785195935, "grad_norm": 1.3125, "learning_rate": 0.00039806162476973227, "loss": 4.8794, "mean_token_accuracy": 0.22099649757146836, "num_tokens": 73650954.0, "step": 35495 }, { "entropy": 5.646353721618652, "epoch": 3.2202467343976777, "grad_norm": 1.1328125, "learning_rate": 0.000398034535626601, "loss": 4.9779, "mean_token_accuracy": 0.2157284840941429, "num_tokens": 73661195.0, "step": 35500 }, { "entropy": 5.664518737792969, "epoch": 3.220700290275762, "grad_norm": 1.3125, "learning_rate": 0.00039800744393908414, "loss": 5.0066, "mean_token_accuracy": 0.21799689084291457, "num_tokens": 73670512.0, "step": 35505 }, { "entropy": 5.603823232650757, "epoch": 3.2211538461538463, "grad_norm": 1.171875, "learning_rate": 0.000397980349707742, "loss": 4.9186, "mean_token_accuracy": 0.21542716771364212, "num_tokens": 73681927.0, "step": 35510 }, { "entropy": 5.610978698730468, "epoch": 3.2216074020319305, "grad_norm": 1.2109375, "learning_rate": 0.00039795325293313493, "loss": 4.9399, "mean_token_accuracy": 0.21248573511838914, "num_tokens": 73692025.0, "step": 35515 }, { "entropy": 5.571760845184326, "epoch": 3.2220609579100143, "grad_norm": 1.3046875, "learning_rate": 0.00039792615361582324, "loss": 4.9012, "mean_token_accuracy": 0.2161061093211174, "num_tokens": 73702278.0, "step": 35520 }, { "entropy": 5.660702657699585, "epoch": 3.2225145137880986, "grad_norm": 1.2265625, "learning_rate": 0.00039789905175636726, "loss": 4.9915, "mean_token_accuracy": 0.20843842774629592, "num_tokens": 73713511.0, "step": 35525 }, { "entropy": 5.494663047790527, "epoch": 3.222968069666183, "grad_norm": 1.2890625, "learning_rate": 0.00039787194735532765, "loss": 4.7952, "mean_token_accuracy": 0.22784166038036346, "num_tokens": 73723683.0, "step": 35530 }, { "entropy": 5.586947727203369, "epoch": 3.223421625544267, "grad_norm": 1.2578125, "learning_rate": 0.0003978448404132649, "loss": 4.859, "mean_token_accuracy": 0.22581427842378615, "num_tokens": 73734191.0, "step": 35535 }, { "entropy": 5.602861738204956, "epoch": 3.2238751814223514, "grad_norm": 1.2734375, "learning_rate": 0.00039781773093073956, "loss": 4.8958, "mean_token_accuracy": 0.21986245214939118, "num_tokens": 73743747.0, "step": 35540 }, { "entropy": 5.507540369033814, "epoch": 3.2243287373004352, "grad_norm": 1.2265625, "learning_rate": 0.0003977906189083122, "loss": 4.8599, "mean_token_accuracy": 0.2210827574133873, "num_tokens": 73754466.0, "step": 35545 }, { "entropy": 5.550479555130005, "epoch": 3.2247822931785195, "grad_norm": 1.2265625, "learning_rate": 0.0003977635043465435, "loss": 4.8453, "mean_token_accuracy": 0.2201464742422104, "num_tokens": 73765948.0, "step": 35550 }, { "entropy": 5.456330347061157, "epoch": 3.2252358490566038, "grad_norm": 1.1484375, "learning_rate": 0.0003977363872459943, "loss": 4.8352, "mean_token_accuracy": 0.22234871089458466, "num_tokens": 73776003.0, "step": 35555 }, { "entropy": 5.62430591583252, "epoch": 3.225689404934688, "grad_norm": 1.2421875, "learning_rate": 0.0003977092676072254, "loss": 5.0418, "mean_token_accuracy": 0.21233248114585876, "num_tokens": 73787821.0, "step": 35560 }, { "entropy": 5.596877241134644, "epoch": 3.2261429608127723, "grad_norm": 1.1484375, "learning_rate": 0.00039768214543079746, "loss": 4.8876, "mean_token_accuracy": 0.21422988474369048, "num_tokens": 73799207.0, "step": 35565 }, { "entropy": 5.585151243209839, "epoch": 3.226596516690856, "grad_norm": 1.2578125, "learning_rate": 0.0003976550207172716, "loss": 4.8306, "mean_token_accuracy": 0.22435288578271867, "num_tokens": 73809987.0, "step": 35570 }, { "entropy": 5.5061040878295895, "epoch": 3.2270500725689404, "grad_norm": 1.2265625, "learning_rate": 0.00039762789346720854, "loss": 4.8628, "mean_token_accuracy": 0.21346703618764878, "num_tokens": 73819075.0, "step": 35575 }, { "entropy": 5.555589962005615, "epoch": 3.2275036284470247, "grad_norm": 1.25, "learning_rate": 0.0003976007636811694, "loss": 4.9096, "mean_token_accuracy": 0.2242543578147888, "num_tokens": 73829831.0, "step": 35580 }, { "entropy": 5.586147880554199, "epoch": 3.227957184325109, "grad_norm": 1.1484375, "learning_rate": 0.0003975736313597153, "loss": 4.9163, "mean_token_accuracy": 0.2226834088563919, "num_tokens": 73839826.0, "step": 35585 }, { "entropy": 5.557337903976441, "epoch": 3.228410740203193, "grad_norm": 1.265625, "learning_rate": 0.0003975464965034072, "loss": 4.8167, "mean_token_accuracy": 0.2251250058412552, "num_tokens": 73850006.0, "step": 35590 }, { "entropy": 5.589664888381958, "epoch": 3.228864296081277, "grad_norm": 1.1875, "learning_rate": 0.0003975193591128064, "loss": 4.8745, "mean_token_accuracy": 0.2181267336010933, "num_tokens": 73860309.0, "step": 35595 }, { "entropy": 5.587058258056641, "epoch": 3.2293178519593613, "grad_norm": 1.1640625, "learning_rate": 0.00039749221918847406, "loss": 4.9745, "mean_token_accuracy": 0.2111610248684883, "num_tokens": 73871613.0, "step": 35600 }, { "entropy": 5.483116292953492, "epoch": 3.2297714078374455, "grad_norm": 1.203125, "learning_rate": 0.0003974650767309713, "loss": 4.7968, "mean_token_accuracy": 0.2235073983669281, "num_tokens": 73882303.0, "step": 35605 }, { "entropy": 5.627234029769897, "epoch": 3.23022496371553, "grad_norm": 1.1875, "learning_rate": 0.00039743793174085965, "loss": 4.9329, "mean_token_accuracy": 0.2055797502398491, "num_tokens": 73893548.0, "step": 35610 }, { "entropy": 5.621247720718384, "epoch": 3.230678519593614, "grad_norm": 1.1484375, "learning_rate": 0.00039741078421870024, "loss": 4.8861, "mean_token_accuracy": 0.2164752170443535, "num_tokens": 73903934.0, "step": 35615 }, { "entropy": 5.6132568359375, "epoch": 3.231132075471698, "grad_norm": 1.265625, "learning_rate": 0.00039738363416505474, "loss": 4.9952, "mean_token_accuracy": 0.2117013528943062, "num_tokens": 73913813.0, "step": 35620 }, { "entropy": 5.598922395706177, "epoch": 3.231585631349782, "grad_norm": 1.1953125, "learning_rate": 0.00039735648158048444, "loss": 4.9228, "mean_token_accuracy": 0.21685894429683686, "num_tokens": 73924339.0, "step": 35625 }, { "entropy": 5.602565336227417, "epoch": 3.2320391872278664, "grad_norm": 1.2265625, "learning_rate": 0.0003973293264655509, "loss": 4.8991, "mean_token_accuracy": 0.21107783168554306, "num_tokens": 73935318.0, "step": 35630 }, { "entropy": 5.571333742141723, "epoch": 3.2324927431059507, "grad_norm": 1.2265625, "learning_rate": 0.0003973021688208158, "loss": 4.8664, "mean_token_accuracy": 0.22020641416311265, "num_tokens": 73945547.0, "step": 35635 }, { "entropy": 5.570557308197022, "epoch": 3.232946298984035, "grad_norm": 1.328125, "learning_rate": 0.0003972750086468406, "loss": 4.902, "mean_token_accuracy": 0.2132236674427986, "num_tokens": 73956195.0, "step": 35640 }, { "entropy": 5.591267347335815, "epoch": 3.2333998548621192, "grad_norm": 1.265625, "learning_rate": 0.00039724784594418714, "loss": 4.8283, "mean_token_accuracy": 0.23204536885023117, "num_tokens": 73966843.0, "step": 35645 }, { "entropy": 5.584470987319946, "epoch": 3.233853410740203, "grad_norm": 1.1796875, "learning_rate": 0.000397220680713417, "loss": 4.8666, "mean_token_accuracy": 0.2210089534521103, "num_tokens": 73978516.0, "step": 35650 }, { "entropy": 5.505542135238647, "epoch": 3.2343069666182873, "grad_norm": 1.1953125, "learning_rate": 0.00039719351295509203, "loss": 4.8304, "mean_token_accuracy": 0.22288220077753068, "num_tokens": 73988376.0, "step": 35655 }, { "entropy": 5.547857475280762, "epoch": 3.2347605224963716, "grad_norm": 1.21875, "learning_rate": 0.00039716634266977413, "loss": 4.8515, "mean_token_accuracy": 0.2306395560503006, "num_tokens": 73998232.0, "step": 35660 }, { "entropy": 5.528950357437134, "epoch": 3.235214078374456, "grad_norm": 1.125, "learning_rate": 0.0003971391698580252, "loss": 4.8965, "mean_token_accuracy": 0.2167160004377365, "num_tokens": 74008726.0, "step": 35665 }, { "entropy": 5.565345001220703, "epoch": 3.23566763425254, "grad_norm": 1.2109375, "learning_rate": 0.00039711199452040696, "loss": 4.8768, "mean_token_accuracy": 0.2212584510445595, "num_tokens": 74018746.0, "step": 35670 }, { "entropy": 5.586586141586304, "epoch": 3.236121190130624, "grad_norm": 1.2421875, "learning_rate": 0.00039708481665748157, "loss": 4.8595, "mean_token_accuracy": 0.2201661378145218, "num_tokens": 74028615.0, "step": 35675 }, { "entropy": 5.5900920867919925, "epoch": 3.236574746008708, "grad_norm": 1.125, "learning_rate": 0.0003970576362698111, "loss": 4.9435, "mean_token_accuracy": 0.2127767339348793, "num_tokens": 74039219.0, "step": 35680 }, { "entropy": 5.579528951644898, "epoch": 3.2370283018867925, "grad_norm": 1.296875, "learning_rate": 0.00039703045335795766, "loss": 4.8545, "mean_token_accuracy": 0.22033316344022752, "num_tokens": 74049385.0, "step": 35685 }, { "entropy": 5.642141103744507, "epoch": 3.2374818577648767, "grad_norm": 1.21875, "learning_rate": 0.0003970032679224833, "loss": 5.0336, "mean_token_accuracy": 0.20535451024770737, "num_tokens": 74059437.0, "step": 35690 }, { "entropy": 5.620270919799805, "epoch": 3.237935413642961, "grad_norm": 1.265625, "learning_rate": 0.00039697607996395023, "loss": 4.9605, "mean_token_accuracy": 0.21353611946105958, "num_tokens": 74068834.0, "step": 35695 }, { "entropy": 5.640044689178467, "epoch": 3.238388969521045, "grad_norm": 1.15625, "learning_rate": 0.0003969488894829208, "loss": 4.926, "mean_token_accuracy": 0.2143849790096283, "num_tokens": 74079757.0, "step": 35700 }, { "entropy": 5.599082136154175, "epoch": 3.238842525399129, "grad_norm": 1.1640625, "learning_rate": 0.0003969216964799573, "loss": 4.8534, "mean_token_accuracy": 0.22597562074661254, "num_tokens": 74091092.0, "step": 35705 }, { "entropy": 5.517797565460205, "epoch": 3.2392960812772134, "grad_norm": 1.2734375, "learning_rate": 0.0003968945009556219, "loss": 4.8526, "mean_token_accuracy": 0.22344509661197662, "num_tokens": 74102272.0, "step": 35710 }, { "entropy": 5.51051435470581, "epoch": 3.2397496371552976, "grad_norm": 1.234375, "learning_rate": 0.0003968673029104773, "loss": 4.8363, "mean_token_accuracy": 0.22607310861349106, "num_tokens": 74113101.0, "step": 35715 }, { "entropy": 5.623663711547851, "epoch": 3.240203193033382, "grad_norm": 1.265625, "learning_rate": 0.0003968401023450858, "loss": 4.9046, "mean_token_accuracy": 0.22196249812841415, "num_tokens": 74123180.0, "step": 35720 }, { "entropy": 5.5582293510437015, "epoch": 3.2406567489114657, "grad_norm": 1.1328125, "learning_rate": 0.00039681289926000985, "loss": 4.8765, "mean_token_accuracy": 0.22209576070308684, "num_tokens": 74133675.0, "step": 35725 }, { "entropy": 5.498506546020508, "epoch": 3.24111030478955, "grad_norm": 1.3046875, "learning_rate": 0.0003967856936558122, "loss": 4.811, "mean_token_accuracy": 0.22030034065246581, "num_tokens": 74143472.0, "step": 35730 }, { "entropy": 5.574520301818848, "epoch": 3.2415638606676342, "grad_norm": 1.1875, "learning_rate": 0.00039675848553305526, "loss": 4.8702, "mean_token_accuracy": 0.2159616157412529, "num_tokens": 74154682.0, "step": 35735 }, { "entropy": 5.553822183609009, "epoch": 3.2420174165457185, "grad_norm": 1.21875, "learning_rate": 0.0003967312748923019, "loss": 4.8744, "mean_token_accuracy": 0.22248150110244752, "num_tokens": 74164745.0, "step": 35740 }, { "entropy": 5.538847160339356, "epoch": 3.2424709724238028, "grad_norm": 1.2265625, "learning_rate": 0.00039670406173411473, "loss": 4.8044, "mean_token_accuracy": 0.22437722384929656, "num_tokens": 74175388.0, "step": 35745 }, { "entropy": 5.553724193572998, "epoch": 3.2429245283018866, "grad_norm": 1.1484375, "learning_rate": 0.0003966768460590566, "loss": 4.8448, "mean_token_accuracy": 0.21892396807670594, "num_tokens": 74185929.0, "step": 35750 }, { "entropy": 5.583537960052491, "epoch": 3.243378084179971, "grad_norm": 1.3359375, "learning_rate": 0.00039664962786769013, "loss": 4.8554, "mean_token_accuracy": 0.22650326788425446, "num_tokens": 74196165.0, "step": 35755 }, { "entropy": 5.591218519210815, "epoch": 3.243831640058055, "grad_norm": 1.2734375, "learning_rate": 0.00039662240716057854, "loss": 4.8685, "mean_token_accuracy": 0.22238103151321412, "num_tokens": 74206843.0, "step": 35760 }, { "entropy": 5.578534984588623, "epoch": 3.2442851959361394, "grad_norm": 1.34375, "learning_rate": 0.0003965951839382845, "loss": 4.8522, "mean_token_accuracy": 0.22483187317848205, "num_tokens": 74216854.0, "step": 35765 }, { "entropy": 5.526900148391723, "epoch": 3.2447387518142237, "grad_norm": 1.1875, "learning_rate": 0.000396567958201371, "loss": 4.8563, "mean_token_accuracy": 0.22132735103368759, "num_tokens": 74226158.0, "step": 35770 }, { "entropy": 5.557786369323731, "epoch": 3.2451923076923075, "grad_norm": 1.2734375, "learning_rate": 0.0003965407299504013, "loss": 4.9032, "mean_token_accuracy": 0.2221299722790718, "num_tokens": 74236860.0, "step": 35775 }, { "entropy": 5.575841856002808, "epoch": 3.2456458635703918, "grad_norm": 1.171875, "learning_rate": 0.0003965134991859382, "loss": 4.8582, "mean_token_accuracy": 0.22420749366283416, "num_tokens": 74247706.0, "step": 35780 }, { "entropy": 5.614956045150757, "epoch": 3.246099419448476, "grad_norm": 1.2109375, "learning_rate": 0.000396486265908545, "loss": 4.9241, "mean_token_accuracy": 0.21840111613273622, "num_tokens": 74259479.0, "step": 35785 }, { "entropy": 5.5454388618469235, "epoch": 3.2465529753265603, "grad_norm": 1.171875, "learning_rate": 0.0003964590301187849, "loss": 4.926, "mean_token_accuracy": 0.21754302680492402, "num_tokens": 74270371.0, "step": 35790 }, { "entropy": 5.5508137226104735, "epoch": 3.2470065312046446, "grad_norm": 1.359375, "learning_rate": 0.0003964317918172211, "loss": 4.8443, "mean_token_accuracy": 0.23269229978322983, "num_tokens": 74279637.0, "step": 35795 }, { "entropy": 5.610334205627441, "epoch": 3.247460087082729, "grad_norm": 1.1953125, "learning_rate": 0.00039640455100441684, "loss": 4.9797, "mean_token_accuracy": 0.21622756272554397, "num_tokens": 74289889.0, "step": 35800 }, { "entropy": 5.619816017150879, "epoch": 3.2479136429608126, "grad_norm": 1.1328125, "learning_rate": 0.00039637730768093564, "loss": 4.8974, "mean_token_accuracy": 0.22813587486743928, "num_tokens": 74300949.0, "step": 35805 }, { "entropy": 5.589548063278198, "epoch": 3.248367198838897, "grad_norm": 1.3046875, "learning_rate": 0.0003963500618473407, "loss": 4.8624, "mean_token_accuracy": 0.2223416820168495, "num_tokens": 74312077.0, "step": 35810 }, { "entropy": 5.525066328048706, "epoch": 3.248820754716981, "grad_norm": 1.1640625, "learning_rate": 0.0003963228135041956, "loss": 4.9324, "mean_token_accuracy": 0.21726930439472197, "num_tokens": 74322610.0, "step": 35815 }, { "entropy": 5.506282472610474, "epoch": 3.2492743105950654, "grad_norm": 1.2734375, "learning_rate": 0.00039629556265206373, "loss": 4.8052, "mean_token_accuracy": 0.219085294008255, "num_tokens": 74331970.0, "step": 35820 }, { "entropy": 5.566981792449951, "epoch": 3.2497278664731493, "grad_norm": 1.234375, "learning_rate": 0.0003962683092915088, "loss": 4.8422, "mean_token_accuracy": 0.2264290913939476, "num_tokens": 74342812.0, "step": 35825 }, { "entropy": 5.552651643753052, "epoch": 3.2501814223512335, "grad_norm": 1.171875, "learning_rate": 0.0003962410534230943, "loss": 4.8182, "mean_token_accuracy": 0.22734687179327012, "num_tokens": 74353786.0, "step": 35830 }, { "entropy": 5.610492944717407, "epoch": 3.250634978229318, "grad_norm": 1.28125, "learning_rate": 0.00039621379504738385, "loss": 4.9284, "mean_token_accuracy": 0.21962619870901107, "num_tokens": 74363732.0, "step": 35835 }, { "entropy": 5.588639497756958, "epoch": 3.251088534107402, "grad_norm": 1.2109375, "learning_rate": 0.00039618653416494137, "loss": 4.9121, "mean_token_accuracy": 0.21881858110427857, "num_tokens": 74374077.0, "step": 35840 }, { "entropy": 5.581950712203979, "epoch": 3.2515420899854863, "grad_norm": 1.1875, "learning_rate": 0.00039615927077633043, "loss": 4.9248, "mean_token_accuracy": 0.2169348731637001, "num_tokens": 74384758.0, "step": 35845 }, { "entropy": 5.629990768432617, "epoch": 3.2519956458635706, "grad_norm": 1.265625, "learning_rate": 0.00039613200488211483, "loss": 4.9373, "mean_token_accuracy": 0.2218780294060707, "num_tokens": 74395811.0, "step": 35850 }, { "entropy": 5.605717182159424, "epoch": 3.2524492017416544, "grad_norm": 1.2578125, "learning_rate": 0.00039610473648285857, "loss": 4.9198, "mean_token_accuracy": 0.2174245223402977, "num_tokens": 74407830.0, "step": 35855 }, { "entropy": 5.543435859680176, "epoch": 3.2529027576197387, "grad_norm": 1.2734375, "learning_rate": 0.0003960774655791255, "loss": 4.8405, "mean_token_accuracy": 0.2171020582318306, "num_tokens": 74417565.0, "step": 35860 }, { "entropy": 5.59379734992981, "epoch": 3.253356313497823, "grad_norm": 1.25, "learning_rate": 0.00039605019217147947, "loss": 4.907, "mean_token_accuracy": 0.2193870797753334, "num_tokens": 74428015.0, "step": 35865 }, { "entropy": 5.521070432662964, "epoch": 3.253809869375907, "grad_norm": 1.3359375, "learning_rate": 0.00039602291626048475, "loss": 4.8975, "mean_token_accuracy": 0.22335321456193924, "num_tokens": 74439523.0, "step": 35870 }, { "entropy": 5.624947452545166, "epoch": 3.2542634252539915, "grad_norm": 1.21875, "learning_rate": 0.00039599563784670526, "loss": 4.9724, "mean_token_accuracy": 0.21045320481061935, "num_tokens": 74449897.0, "step": 35875 }, { "entropy": 5.538494396209717, "epoch": 3.2547169811320753, "grad_norm": 1.265625, "learning_rate": 0.0003959683569307051, "loss": 4.8152, "mean_token_accuracy": 0.2272212862968445, "num_tokens": 74459888.0, "step": 35880 }, { "entropy": 5.527754449844361, "epoch": 3.2551705370101596, "grad_norm": 1.3359375, "learning_rate": 0.0003959410735130485, "loss": 4.7919, "mean_token_accuracy": 0.22100142985582352, "num_tokens": 74470894.0, "step": 35885 }, { "entropy": 5.5353187084197994, "epoch": 3.255624092888244, "grad_norm": 1.1796875, "learning_rate": 0.00039591378759429974, "loss": 4.7955, "mean_token_accuracy": 0.23311396241188048, "num_tokens": 74481306.0, "step": 35890 }, { "entropy": 5.606129121780396, "epoch": 3.256077648766328, "grad_norm": 1.21875, "learning_rate": 0.000395886499175023, "loss": 4.8798, "mean_token_accuracy": 0.22075065970420837, "num_tokens": 74491048.0, "step": 35895 }, { "entropy": 5.539161014556885, "epoch": 3.2565312046444124, "grad_norm": 1.109375, "learning_rate": 0.00039585920825578266, "loss": 4.8311, "mean_token_accuracy": 0.22583355754613876, "num_tokens": 74501656.0, "step": 35900 }, { "entropy": 5.595508670806884, "epoch": 3.256984760522496, "grad_norm": 1.1015625, "learning_rate": 0.0003958319148371431, "loss": 4.9119, "mean_token_accuracy": 0.21966097503900528, "num_tokens": 74513280.0, "step": 35905 }, { "entropy": 5.542800855636597, "epoch": 3.2574383164005805, "grad_norm": 1.2734375, "learning_rate": 0.0003958046189196687, "loss": 4.9112, "mean_token_accuracy": 0.2159629926085472, "num_tokens": 74522898.0, "step": 35910 }, { "entropy": 5.654973268508911, "epoch": 3.2578918722786647, "grad_norm": 1.28125, "learning_rate": 0.00039577732050392395, "loss": 4.9306, "mean_token_accuracy": 0.21430440098047257, "num_tokens": 74532551.0, "step": 35915 }, { "entropy": 5.633441543579101, "epoch": 3.258345428156749, "grad_norm": 1.359375, "learning_rate": 0.0003957500195904735, "loss": 4.8957, "mean_token_accuracy": 0.22329531461000443, "num_tokens": 74542285.0, "step": 35920 }, { "entropy": 5.632100439071655, "epoch": 3.2587989840348333, "grad_norm": 1.296875, "learning_rate": 0.000395722716179882, "loss": 4.9426, "mean_token_accuracy": 0.22196954637765884, "num_tokens": 74551982.0, "step": 35925 }, { "entropy": 5.589123392105103, "epoch": 3.259252539912917, "grad_norm": 1.234375, "learning_rate": 0.0003956954102727138, "loss": 4.9129, "mean_token_accuracy": 0.22074819952249528, "num_tokens": 74562190.0, "step": 35930 }, { "entropy": 5.50792236328125, "epoch": 3.2597060957910013, "grad_norm": 1.2421875, "learning_rate": 0.00039566810186953376, "loss": 4.8201, "mean_token_accuracy": 0.22470529675483703, "num_tokens": 74572673.0, "step": 35935 }, { "entropy": 5.481866073608399, "epoch": 3.2601596516690856, "grad_norm": 1.234375, "learning_rate": 0.0003956407909709068, "loss": 4.8457, "mean_token_accuracy": 0.22701329439878465, "num_tokens": 74582686.0, "step": 35940 }, { "entropy": 5.598630380630493, "epoch": 3.26061320754717, "grad_norm": 1.1484375, "learning_rate": 0.00039561347757739734, "loss": 4.9671, "mean_token_accuracy": 0.21836612671613692, "num_tokens": 74593658.0, "step": 35945 }, { "entropy": 5.663361930847168, "epoch": 3.261066763425254, "grad_norm": 1.3359375, "learning_rate": 0.00039558616168957044, "loss": 4.9697, "mean_token_accuracy": 0.222406043112278, "num_tokens": 74603585.0, "step": 35950 }, { "entropy": 5.566291379928589, "epoch": 3.2615203193033384, "grad_norm": 1.2734375, "learning_rate": 0.0003955588433079911, "loss": 4.8512, "mean_token_accuracy": 0.22361500263214112, "num_tokens": 74612806.0, "step": 35955 }, { "entropy": 5.583341789245606, "epoch": 3.2619738751814222, "grad_norm": 1.375, "learning_rate": 0.00039553152243322414, "loss": 4.884, "mean_token_accuracy": 0.22757286280393602, "num_tokens": 74623252.0, "step": 35960 }, { "entropy": 5.5419103622436525, "epoch": 3.2624274310595065, "grad_norm": 1.296875, "learning_rate": 0.0003955041990658346, "loss": 4.8537, "mean_token_accuracy": 0.22339923828840255, "num_tokens": 74633555.0, "step": 35965 }, { "entropy": 5.554964160919189, "epoch": 3.2628809869375908, "grad_norm": 1.1796875, "learning_rate": 0.0003954768732063874, "loss": 4.8857, "mean_token_accuracy": 0.22323688715696335, "num_tokens": 74643322.0, "step": 35970 }, { "entropy": 5.564716768264771, "epoch": 3.263334542815675, "grad_norm": 1.171875, "learning_rate": 0.0003954495448554478, "loss": 4.8632, "mean_token_accuracy": 0.22901166677474977, "num_tokens": 74653461.0, "step": 35975 }, { "entropy": 5.599018526077271, "epoch": 3.263788098693759, "grad_norm": 1.328125, "learning_rate": 0.00039542221401358104, "loss": 4.9067, "mean_token_accuracy": 0.21747326850891113, "num_tokens": 74663470.0, "step": 35980 }, { "entropy": 5.541120004653931, "epoch": 3.264241654571843, "grad_norm": 1.21875, "learning_rate": 0.000395394880681352, "loss": 4.8306, "mean_token_accuracy": 0.23152374625205993, "num_tokens": 74674074.0, "step": 35985 }, { "entropy": 5.634343576431275, "epoch": 3.2646952104499274, "grad_norm": 1.25, "learning_rate": 0.00039536754485932626, "loss": 4.9848, "mean_token_accuracy": 0.21333698481321334, "num_tokens": 74684968.0, "step": 35990 }, { "entropy": 5.5366740226745605, "epoch": 3.2651487663280117, "grad_norm": 1.234375, "learning_rate": 0.00039534020654806906, "loss": 4.7995, "mean_token_accuracy": 0.23547699451446533, "num_tokens": 74694776.0, "step": 35995 }, { "entropy": 5.548335313796997, "epoch": 3.265602322206096, "grad_norm": 1.25, "learning_rate": 0.00039531286574814563, "loss": 4.8296, "mean_token_accuracy": 0.21822982877492905, "num_tokens": 74705506.0, "step": 36000 }, { "epoch": 3.265602322206096, "eval_entropy": 5.294058892198278, "eval_loss": 4.964892387390137, "eval_mean_token_accuracy": 0.2248716133347464, "eval_num_tokens": 74705506.0, "eval_runtime": 20.5595, "eval_samples_per_second": 1719.884, "eval_steps_per_second": 214.985, "step": 36000 }, { "entropy": 5.545662355422974, "epoch": 3.26605587808418, "grad_norm": 1.3203125, "learning_rate": 0.0003952855224601215, "loss": 4.8595, "mean_token_accuracy": 0.2197272762656212, "num_tokens": 74715677.0, "step": 36005 }, { "entropy": 5.605515623092652, "epoch": 3.266509433962264, "grad_norm": 1.296875, "learning_rate": 0.0003952581766845622, "loss": 4.8598, "mean_token_accuracy": 0.22720492631196976, "num_tokens": 74725296.0, "step": 36010 }, { "entropy": 5.533355236053467, "epoch": 3.2669629898403483, "grad_norm": 1.25, "learning_rate": 0.0003952308284220331, "loss": 4.8335, "mean_token_accuracy": 0.22886460721492768, "num_tokens": 74736124.0, "step": 36015 }, { "entropy": 5.4804911613464355, "epoch": 3.2674165457184325, "grad_norm": 1.21875, "learning_rate": 0.00039520347767309975, "loss": 4.8977, "mean_token_accuracy": 0.21759670376777648, "num_tokens": 74746447.0, "step": 36020 }, { "entropy": 5.561615467071533, "epoch": 3.267870101596517, "grad_norm": 1.21875, "learning_rate": 0.000395176124438328, "loss": 4.8985, "mean_token_accuracy": 0.2165571227669716, "num_tokens": 74756947.0, "step": 36025 }, { "entropy": 5.584126806259155, "epoch": 3.2683236574746006, "grad_norm": 1.4375, "learning_rate": 0.00039514876871828326, "loss": 4.8082, "mean_token_accuracy": 0.23073782920837402, "num_tokens": 74767856.0, "step": 36030 }, { "entropy": 5.533388328552246, "epoch": 3.268777213352685, "grad_norm": 1.1484375, "learning_rate": 0.00039512141051353144, "loss": 4.857, "mean_token_accuracy": 0.22511068284511565, "num_tokens": 74778335.0, "step": 36035 }, { "entropy": 5.578894472122192, "epoch": 3.269230769230769, "grad_norm": 1.328125, "learning_rate": 0.0003950940498246382, "loss": 4.8674, "mean_token_accuracy": 0.22317657470703126, "num_tokens": 74788430.0, "step": 36040 }, { "entropy": 5.61752667427063, "epoch": 3.2696843251088534, "grad_norm": 1.2109375, "learning_rate": 0.00039506668665216944, "loss": 4.9738, "mean_token_accuracy": 0.21870671659708024, "num_tokens": 74800193.0, "step": 36045 }, { "entropy": 5.6183687210083, "epoch": 3.2701378809869377, "grad_norm": 1.25, "learning_rate": 0.000395039320996691, "loss": 4.922, "mean_token_accuracy": 0.2128383621573448, "num_tokens": 74810368.0, "step": 36050 }, { "entropy": 5.616834545135498, "epoch": 3.270591436865022, "grad_norm": 1.3046875, "learning_rate": 0.00039501195285876874, "loss": 4.8515, "mean_token_accuracy": 0.22767363339662552, "num_tokens": 74820687.0, "step": 36055 }, { "entropy": 5.53968620300293, "epoch": 3.271044992743106, "grad_norm": 1.28125, "learning_rate": 0.0003949845822389688, "loss": 4.8249, "mean_token_accuracy": 0.23022043704986572, "num_tokens": 74830489.0, "step": 36060 }, { "entropy": 5.484873628616333, "epoch": 3.27149854862119, "grad_norm": 1.1015625, "learning_rate": 0.000394957209137857, "loss": 4.8091, "mean_token_accuracy": 0.2222230151295662, "num_tokens": 74840638.0, "step": 36065 }, { "entropy": 5.628452253341675, "epoch": 3.2719521044992743, "grad_norm": 1.296875, "learning_rate": 0.0003949298335559997, "loss": 5.0232, "mean_token_accuracy": 0.20446978360414506, "num_tokens": 74850600.0, "step": 36070 }, { "entropy": 5.601524400711059, "epoch": 3.2724056603773586, "grad_norm": 1.3046875, "learning_rate": 0.0003949024554939628, "loss": 4.889, "mean_token_accuracy": 0.22400035709142685, "num_tokens": 74861177.0, "step": 36075 }, { "entropy": 5.618128061294556, "epoch": 3.272859216255443, "grad_norm": 1.1796875, "learning_rate": 0.00039487507495231263, "loss": 4.9276, "mean_token_accuracy": 0.21720543503761292, "num_tokens": 74871747.0, "step": 36080 }, { "entropy": 5.529277706146241, "epoch": 3.2733127721335267, "grad_norm": 1.2109375, "learning_rate": 0.0003948476919316153, "loss": 4.9058, "mean_token_accuracy": 0.21479418575763704, "num_tokens": 74882796.0, "step": 36085 }, { "entropy": 5.612152099609375, "epoch": 3.273766328011611, "grad_norm": 1.2421875, "learning_rate": 0.0003948203064324371, "loss": 4.8905, "mean_token_accuracy": 0.21775318384170533, "num_tokens": 74894123.0, "step": 36090 }, { "entropy": 5.611866807937622, "epoch": 3.274219883889695, "grad_norm": 1.2734375, "learning_rate": 0.00039479291845534453, "loss": 4.9275, "mean_token_accuracy": 0.21352228969335557, "num_tokens": 74904787.0, "step": 36095 }, { "entropy": 5.617761182785034, "epoch": 3.2746734397677795, "grad_norm": 1.296875, "learning_rate": 0.00039476552800090384, "loss": 4.9578, "mean_token_accuracy": 0.21021807938814163, "num_tokens": 74915041.0, "step": 36100 }, { "entropy": 5.598668193817138, "epoch": 3.2751269956458637, "grad_norm": 1.203125, "learning_rate": 0.00039473813506968146, "loss": 4.8506, "mean_token_accuracy": 0.21639005690813065, "num_tokens": 74926217.0, "step": 36105 }, { "entropy": 5.6326018333435055, "epoch": 3.2755805515239476, "grad_norm": 1.203125, "learning_rate": 0.00039471073966224404, "loss": 4.9419, "mean_token_accuracy": 0.21554133296012878, "num_tokens": 74936616.0, "step": 36110 }, { "entropy": 5.6091225147247314, "epoch": 3.276034107402032, "grad_norm": 1.171875, "learning_rate": 0.000394683341779158, "loss": 4.9302, "mean_token_accuracy": 0.2122535675764084, "num_tokens": 74947443.0, "step": 36115 }, { "entropy": 5.56631326675415, "epoch": 3.276487663280116, "grad_norm": 1.265625, "learning_rate": 0.0003946559414209899, "loss": 4.8646, "mean_token_accuracy": 0.2218962073326111, "num_tokens": 74957618.0, "step": 36120 }, { "entropy": 5.572535037994385, "epoch": 3.2769412191582004, "grad_norm": 1.234375, "learning_rate": 0.0003946285385883065, "loss": 4.8142, "mean_token_accuracy": 0.22155697792768478, "num_tokens": 74967982.0, "step": 36125 }, { "entropy": 5.526893091201782, "epoch": 3.2773947750362846, "grad_norm": 1.3359375, "learning_rate": 0.00039460113328167434, "loss": 4.8646, "mean_token_accuracy": 0.22548264712095262, "num_tokens": 74978801.0, "step": 36130 }, { "entropy": 5.519194650650024, "epoch": 3.2778483309143684, "grad_norm": 1.2421875, "learning_rate": 0.0003945737255016603, "loss": 4.8255, "mean_token_accuracy": 0.22515552788972854, "num_tokens": 74989000.0, "step": 36135 }, { "entropy": 5.594220447540283, "epoch": 3.2783018867924527, "grad_norm": 1.1171875, "learning_rate": 0.00039454631524883123, "loss": 4.9349, "mean_token_accuracy": 0.21769806295633315, "num_tokens": 74999664.0, "step": 36140 }, { "entropy": 5.603321361541748, "epoch": 3.278755442670537, "grad_norm": 1.296875, "learning_rate": 0.0003945189025237538, "loss": 4.8905, "mean_token_accuracy": 0.22431514263153077, "num_tokens": 75010187.0, "step": 36145 }, { "entropy": 5.657714939117431, "epoch": 3.2792089985486212, "grad_norm": 1.15625, "learning_rate": 0.000394491487326995, "loss": 4.9439, "mean_token_accuracy": 0.21483942866325378, "num_tokens": 75021222.0, "step": 36150 }, { "entropy": 5.521349811553955, "epoch": 3.2796625544267055, "grad_norm": 1.484375, "learning_rate": 0.0003944640696591219, "loss": 4.8928, "mean_token_accuracy": 0.22486232817173005, "num_tokens": 75031136.0, "step": 36155 }, { "entropy": 5.492633533477783, "epoch": 3.28011611030479, "grad_norm": 1.234375, "learning_rate": 0.00039443664952070135, "loss": 4.8591, "mean_token_accuracy": 0.22387594729661942, "num_tokens": 75041545.0, "step": 36160 }, { "entropy": 5.558061599731445, "epoch": 3.2805696661828736, "grad_norm": 1.2265625, "learning_rate": 0.00039440922691230044, "loss": 4.8869, "mean_token_accuracy": 0.22227349877357483, "num_tokens": 75051805.0, "step": 36165 }, { "entropy": 5.565986251831054, "epoch": 3.281023222060958, "grad_norm": 1.125, "learning_rate": 0.00039438180183448625, "loss": 4.863, "mean_token_accuracy": 0.2212325632572174, "num_tokens": 75062551.0, "step": 36170 }, { "entropy": 5.546606826782226, "epoch": 3.281476777939042, "grad_norm": 1.21875, "learning_rate": 0.000394354374287826, "loss": 4.8691, "mean_token_accuracy": 0.22117944061756134, "num_tokens": 75073040.0, "step": 36175 }, { "entropy": 5.6007702350616455, "epoch": 3.2819303338171264, "grad_norm": 1.203125, "learning_rate": 0.00039432694427288695, "loss": 4.8692, "mean_token_accuracy": 0.22687319964170455, "num_tokens": 75082543.0, "step": 36180 }, { "entropy": 5.632669925689697, "epoch": 3.28238388969521, "grad_norm": 1.1796875, "learning_rate": 0.00039429951179023614, "loss": 4.9439, "mean_token_accuracy": 0.21692252904176712, "num_tokens": 75092480.0, "step": 36185 }, { "entropy": 5.522711324691772, "epoch": 3.2828374455732945, "grad_norm": 1.3046875, "learning_rate": 0.00039427207684044116, "loss": 4.7865, "mean_token_accuracy": 0.2230077087879181, "num_tokens": 75102445.0, "step": 36190 }, { "entropy": 5.566614389419556, "epoch": 3.2832910014513788, "grad_norm": 1.3359375, "learning_rate": 0.00039424463942406917, "loss": 4.96, "mean_token_accuracy": 0.21516534090042114, "num_tokens": 75112793.0, "step": 36195 }, { "entropy": 5.653137159347534, "epoch": 3.283744557329463, "grad_norm": 1.171875, "learning_rate": 0.0003942171995416877, "loss": 4.95, "mean_token_accuracy": 0.21202856600284575, "num_tokens": 75123312.0, "step": 36200 }, { "entropy": 5.573168420791626, "epoch": 3.2841981132075473, "grad_norm": 1.1171875, "learning_rate": 0.00039418975719386406, "loss": 4.8442, "mean_token_accuracy": 0.2201594054698944, "num_tokens": 75133584.0, "step": 36205 }, { "entropy": 5.559657096862793, "epoch": 3.2846516690856316, "grad_norm": 1.2109375, "learning_rate": 0.0003941623123811659, "loss": 4.876, "mean_token_accuracy": 0.21634067595005035, "num_tokens": 75144344.0, "step": 36210 }, { "entropy": 5.645954036712647, "epoch": 3.2851052249637154, "grad_norm": 1.21875, "learning_rate": 0.00039413486510416087, "loss": 4.9081, "mean_token_accuracy": 0.21361046135425568, "num_tokens": 75155086.0, "step": 36215 }, { "entropy": 5.597145652770996, "epoch": 3.2855587808417996, "grad_norm": 1.1328125, "learning_rate": 0.00039410741536341634, "loss": 4.8496, "mean_token_accuracy": 0.2237755089998245, "num_tokens": 75166046.0, "step": 36220 }, { "entropy": 5.528163146972656, "epoch": 3.286012336719884, "grad_norm": 1.1875, "learning_rate": 0.00039407996315950016, "loss": 4.8248, "mean_token_accuracy": 0.2245148479938507, "num_tokens": 75175388.0, "step": 36225 }, { "entropy": 5.547383975982666, "epoch": 3.286465892597968, "grad_norm": 1.1484375, "learning_rate": 0.00039405250849297997, "loss": 4.9207, "mean_token_accuracy": 0.2212709292769432, "num_tokens": 75186213.0, "step": 36230 }, { "entropy": 5.5306977272033695, "epoch": 3.2869194484760524, "grad_norm": 1.2734375, "learning_rate": 0.0003940250513644236, "loss": 4.851, "mean_token_accuracy": 0.2243834227323532, "num_tokens": 75196141.0, "step": 36235 }, { "entropy": 5.492659187316894, "epoch": 3.2873730043541363, "grad_norm": 1.1875, "learning_rate": 0.0003939975917743988, "loss": 4.7385, "mean_token_accuracy": 0.23586864322423934, "num_tokens": 75205414.0, "step": 36240 }, { "entropy": 5.611056852340698, "epoch": 3.2878265602322205, "grad_norm": 1.25, "learning_rate": 0.0003939701297234735, "loss": 4.9377, "mean_token_accuracy": 0.21699569076299668, "num_tokens": 75215860.0, "step": 36245 }, { "entropy": 5.58050799369812, "epoch": 3.288280116110305, "grad_norm": 1.40625, "learning_rate": 0.00039394266521221565, "loss": 4.9023, "mean_token_accuracy": 0.2166503205895424, "num_tokens": 75226358.0, "step": 36250 }, { "entropy": 5.482949304580688, "epoch": 3.288733671988389, "grad_norm": 1.328125, "learning_rate": 0.00039391519824119315, "loss": 4.748, "mean_token_accuracy": 0.23686134517192842, "num_tokens": 75235779.0, "step": 36255 }, { "entropy": 5.596523284912109, "epoch": 3.2891872278664733, "grad_norm": 1.265625, "learning_rate": 0.00039388772881097396, "loss": 4.9955, "mean_token_accuracy": 0.2118769958615303, "num_tokens": 75246417.0, "step": 36260 }, { "entropy": 5.567182731628418, "epoch": 3.289640783744557, "grad_norm": 1.2578125, "learning_rate": 0.00039386025692212637, "loss": 4.843, "mean_token_accuracy": 0.22138625234365464, "num_tokens": 75257094.0, "step": 36265 }, { "entropy": 5.5510725498199465, "epoch": 3.2900943396226414, "grad_norm": 1.125, "learning_rate": 0.0003938327825752183, "loss": 4.8466, "mean_token_accuracy": 0.22223186641931533, "num_tokens": 75267374.0, "step": 36270 }, { "entropy": 5.526826810836792, "epoch": 3.2905478955007257, "grad_norm": 1.328125, "learning_rate": 0.000393805305770818, "loss": 4.875, "mean_token_accuracy": 0.2252560630440712, "num_tokens": 75276936.0, "step": 36275 }, { "entropy": 5.513179969787598, "epoch": 3.29100145137881, "grad_norm": 1.3125, "learning_rate": 0.0003937778265094937, "loss": 4.8341, "mean_token_accuracy": 0.22409375607967377, "num_tokens": 75286403.0, "step": 36280 }, { "entropy": 5.567946243286133, "epoch": 3.291455007256894, "grad_norm": 1.140625, "learning_rate": 0.0003937503447918137, "loss": 4.9036, "mean_token_accuracy": 0.21889721900224685, "num_tokens": 75297421.0, "step": 36285 }, { "entropy": 5.6119222164154055, "epoch": 3.291908563134978, "grad_norm": 1.21875, "learning_rate": 0.00039372286061834633, "loss": 4.9126, "mean_token_accuracy": 0.2186017408967018, "num_tokens": 75307955.0, "step": 36290 }, { "entropy": 5.609750032424927, "epoch": 3.2923621190130623, "grad_norm": 1.21875, "learning_rate": 0.00039369537398966, "loss": 4.9205, "mean_token_accuracy": 0.2186901390552521, "num_tokens": 75318739.0, "step": 36295 }, { "entropy": 5.505655431747437, "epoch": 3.2928156748911466, "grad_norm": 1.2109375, "learning_rate": 0.00039366788490632286, "loss": 4.7663, "mean_token_accuracy": 0.2291013315320015, "num_tokens": 75328629.0, "step": 36300 }, { "entropy": 5.512588357925415, "epoch": 3.293269230769231, "grad_norm": 1.28125, "learning_rate": 0.00039364039336890386, "loss": 4.8365, "mean_token_accuracy": 0.2279593378305435, "num_tokens": 75337986.0, "step": 36305 }, { "entropy": 5.513869857788086, "epoch": 3.293722786647315, "grad_norm": 1.3359375, "learning_rate": 0.0003936128993779712, "loss": 4.8078, "mean_token_accuracy": 0.22542369812726976, "num_tokens": 75346169.0, "step": 36310 }, { "entropy": 5.599983024597168, "epoch": 3.2941763425253994, "grad_norm": 1.2421875, "learning_rate": 0.0003935854029340936, "loss": 4.8721, "mean_token_accuracy": 0.2276986613869667, "num_tokens": 75356111.0, "step": 36315 }, { "entropy": 5.5595966339111325, "epoch": 3.294629898403483, "grad_norm": 1.1328125, "learning_rate": 0.00039355790403783954, "loss": 4.8481, "mean_token_accuracy": 0.22865329384803773, "num_tokens": 75366679.0, "step": 36320 }, { "entropy": 5.476230144500732, "epoch": 3.2950834542815675, "grad_norm": 1.2734375, "learning_rate": 0.00039353040268977785, "loss": 4.7493, "mean_token_accuracy": 0.2314259961247444, "num_tokens": 75377500.0, "step": 36325 }, { "entropy": 5.534752273559571, "epoch": 3.2955370101596517, "grad_norm": 1.2890625, "learning_rate": 0.0003935028988904773, "loss": 4.8365, "mean_token_accuracy": 0.22389221787452698, "num_tokens": 75387115.0, "step": 36330 }, { "entropy": 5.563125705718994, "epoch": 3.295990566037736, "grad_norm": 1.40625, "learning_rate": 0.00039347539264050654, "loss": 4.9465, "mean_token_accuracy": 0.216111621260643, "num_tokens": 75396330.0, "step": 36335 }, { "entropy": 5.541569328308105, "epoch": 3.29644412191582, "grad_norm": 1.234375, "learning_rate": 0.0003934478839404345, "loss": 4.8667, "mean_token_accuracy": 0.22661789655685424, "num_tokens": 75407168.0, "step": 36340 }, { "entropy": 5.620918655395508, "epoch": 3.296897677793904, "grad_norm": 1.203125, "learning_rate": 0.00039342037279083006, "loss": 4.9111, "mean_token_accuracy": 0.21865038573741913, "num_tokens": 75418117.0, "step": 36345 }, { "entropy": 5.650157403945923, "epoch": 3.2973512336719883, "grad_norm": 1.1640625, "learning_rate": 0.0003933928591922621, "loss": 4.9869, "mean_token_accuracy": 0.21132252216339112, "num_tokens": 75429026.0, "step": 36350 }, { "entropy": 5.584028482437134, "epoch": 3.2978047895500726, "grad_norm": 1.2109375, "learning_rate": 0.0003933653431452996, "loss": 4.8288, "mean_token_accuracy": 0.22415409237146378, "num_tokens": 75439710.0, "step": 36355 }, { "entropy": 5.567065095901489, "epoch": 3.298258345428157, "grad_norm": 1.2890625, "learning_rate": 0.00039333782465051173, "loss": 4.8624, "mean_token_accuracy": 0.22537643760442733, "num_tokens": 75450086.0, "step": 36360 }, { "entropy": 5.56113109588623, "epoch": 3.298711901306241, "grad_norm": 1.234375, "learning_rate": 0.0003933103037084674, "loss": 4.8647, "mean_token_accuracy": 0.2129943624138832, "num_tokens": 75460988.0, "step": 36365 }, { "entropy": 5.6151158809661865, "epoch": 3.299165457184325, "grad_norm": 1.296875, "learning_rate": 0.00039328278031973586, "loss": 4.9213, "mean_token_accuracy": 0.21281445771455765, "num_tokens": 75471560.0, "step": 36370 }, { "entropy": 5.579126453399658, "epoch": 3.2996190130624092, "grad_norm": 1.2109375, "learning_rate": 0.0003932552544848863, "loss": 4.9149, "mean_token_accuracy": 0.2168205514550209, "num_tokens": 75482124.0, "step": 36375 }, { "entropy": 5.561543703079224, "epoch": 3.3000725689404935, "grad_norm": 1.328125, "learning_rate": 0.000393227726204488, "loss": 4.8703, "mean_token_accuracy": 0.222262841463089, "num_tokens": 75492351.0, "step": 36380 }, { "entropy": 5.553583574295044, "epoch": 3.3005261248185778, "grad_norm": 1.1171875, "learning_rate": 0.00039320019547911013, "loss": 4.7943, "mean_token_accuracy": 0.22528759837150575, "num_tokens": 75502475.0, "step": 36385 }, { "entropy": 5.509480381011963, "epoch": 3.3009796806966616, "grad_norm": 1.3203125, "learning_rate": 0.0003931726623093221, "loss": 4.8013, "mean_token_accuracy": 0.23014139086008073, "num_tokens": 75512345.0, "step": 36390 }, { "entropy": 5.509067153930664, "epoch": 3.301433236574746, "grad_norm": 1.21875, "learning_rate": 0.00039314512669569323, "loss": 4.7646, "mean_token_accuracy": 0.23132060170173646, "num_tokens": 75523011.0, "step": 36395 }, { "entropy": 5.576844024658203, "epoch": 3.30188679245283, "grad_norm": 1.2734375, "learning_rate": 0.00039311758863879316, "loss": 4.8676, "mean_token_accuracy": 0.2184252232313156, "num_tokens": 75533775.0, "step": 36400 }, { "entropy": 5.577095985412598, "epoch": 3.3023403483309144, "grad_norm": 1.25, "learning_rate": 0.00039309004813919117, "loss": 4.9543, "mean_token_accuracy": 0.21013036817312242, "num_tokens": 75544558.0, "step": 36405 }, { "entropy": 5.653550481796264, "epoch": 3.3027939042089987, "grad_norm": 1.234375, "learning_rate": 0.00039306250519745696, "loss": 4.9739, "mean_token_accuracy": 0.21368105262517928, "num_tokens": 75555599.0, "step": 36410 }, { "entropy": 5.562288999557495, "epoch": 3.303247460087083, "grad_norm": 1.390625, "learning_rate": 0.00039303495981416007, "loss": 4.8679, "mean_token_accuracy": 0.2204214245080948, "num_tokens": 75566320.0, "step": 36415 }, { "entropy": 5.582990884780884, "epoch": 3.3037010159651667, "grad_norm": 1.1953125, "learning_rate": 0.0003930074119898701, "loss": 4.896, "mean_token_accuracy": 0.2257215768098831, "num_tokens": 75576069.0, "step": 36420 }, { "entropy": 5.572000122070312, "epoch": 3.304154571843251, "grad_norm": 1.2421875, "learning_rate": 0.0003929798617251567, "loss": 4.8986, "mean_token_accuracy": 0.2184012070298195, "num_tokens": 75586012.0, "step": 36425 }, { "entropy": 5.585925436019897, "epoch": 3.3046081277213353, "grad_norm": 1.1796875, "learning_rate": 0.0003929523090205898, "loss": 4.9511, "mean_token_accuracy": 0.2137787252664566, "num_tokens": 75596499.0, "step": 36430 }, { "entropy": 5.538427686691284, "epoch": 3.3050616835994195, "grad_norm": 1.2578125, "learning_rate": 0.000392924753876739, "loss": 4.8078, "mean_token_accuracy": 0.22474002987146377, "num_tokens": 75606329.0, "step": 36435 }, { "entropy": 5.582177686691284, "epoch": 3.305515239477504, "grad_norm": 1.2109375, "learning_rate": 0.0003928971962941743, "loss": 4.884, "mean_token_accuracy": 0.21986208707094193, "num_tokens": 75617371.0, "step": 36440 }, { "entropy": 5.6060436248779295, "epoch": 3.3059687953555876, "grad_norm": 1.28125, "learning_rate": 0.0003928696362734655, "loss": 4.8683, "mean_token_accuracy": 0.21940613240003587, "num_tokens": 75627949.0, "step": 36445 }, { "entropy": 5.578892755508423, "epoch": 3.306422351233672, "grad_norm": 1.2578125, "learning_rate": 0.00039284207381518266, "loss": 4.9317, "mean_token_accuracy": 0.2178596407175064, "num_tokens": 75638642.0, "step": 36450 }, { "entropy": 5.501861190795898, "epoch": 3.306875907111756, "grad_norm": 1.203125, "learning_rate": 0.00039281450891989555, "loss": 4.872, "mean_token_accuracy": 0.22131170481443405, "num_tokens": 75649997.0, "step": 36455 }, { "entropy": 5.522936153411865, "epoch": 3.3073294629898404, "grad_norm": 1.15625, "learning_rate": 0.0003927869415881745, "loss": 4.8624, "mean_token_accuracy": 0.22792258560657502, "num_tokens": 75660223.0, "step": 36460 }, { "entropy": 5.566356515884399, "epoch": 3.3077830188679247, "grad_norm": 1.2421875, "learning_rate": 0.0003927593718205895, "loss": 4.824, "mean_token_accuracy": 0.2315408930182457, "num_tokens": 75670550.0, "step": 36465 }, { "entropy": 5.618841648101807, "epoch": 3.3082365747460085, "grad_norm": 1.1953125, "learning_rate": 0.00039273179961771065, "loss": 4.9905, "mean_token_accuracy": 0.20904747098684312, "num_tokens": 75681631.0, "step": 36470 }, { "entropy": 5.553884983062744, "epoch": 3.308690130624093, "grad_norm": 1.171875, "learning_rate": 0.0003927042249801082, "loss": 4.8455, "mean_token_accuracy": 0.2253678634762764, "num_tokens": 75691561.0, "step": 36475 }, { "entropy": 5.57857346534729, "epoch": 3.309143686502177, "grad_norm": 1.2109375, "learning_rate": 0.00039267664790835235, "loss": 4.8732, "mean_token_accuracy": 0.22244116812944412, "num_tokens": 75701639.0, "step": 36480 }, { "entropy": 5.582505178451538, "epoch": 3.3095972423802613, "grad_norm": 1.078125, "learning_rate": 0.0003926490684030134, "loss": 4.8831, "mean_token_accuracy": 0.22268700152635573, "num_tokens": 75712823.0, "step": 36485 }, { "entropy": 5.554870986938477, "epoch": 3.3100507982583456, "grad_norm": 1.1484375, "learning_rate": 0.00039262148646466185, "loss": 4.9116, "mean_token_accuracy": 0.21693439781665802, "num_tokens": 75723221.0, "step": 36490 }, { "entropy": 5.559944295883179, "epoch": 3.3105043541364294, "grad_norm": 1.125, "learning_rate": 0.0003925939020938679, "loss": 4.8785, "mean_token_accuracy": 0.22327907532453536, "num_tokens": 75733565.0, "step": 36495 }, { "entropy": 5.62131290435791, "epoch": 3.3109579100145137, "grad_norm": 1.15625, "learning_rate": 0.00039256631529120206, "loss": 4.8602, "mean_token_accuracy": 0.22839851081371307, "num_tokens": 75743511.0, "step": 36500 }, { "entropy": 5.661493110656738, "epoch": 3.311411465892598, "grad_norm": 1.2421875, "learning_rate": 0.0003925387260572349, "loss": 4.9354, "mean_token_accuracy": 0.22204354554414749, "num_tokens": 75754593.0, "step": 36505 }, { "entropy": 5.475900268554687, "epoch": 3.311865021770682, "grad_norm": 1.3125, "learning_rate": 0.00039251113439253693, "loss": 4.8162, "mean_token_accuracy": 0.2310926303267479, "num_tokens": 75764534.0, "step": 36510 }, { "entropy": 5.506560754776001, "epoch": 3.3123185776487665, "grad_norm": 1.2265625, "learning_rate": 0.0003924835402976788, "loss": 4.8197, "mean_token_accuracy": 0.22540393173694612, "num_tokens": 75774707.0, "step": 36515 }, { "entropy": 5.496322822570801, "epoch": 3.3127721335268507, "grad_norm": 1.1796875, "learning_rate": 0.00039245594377323106, "loss": 4.7811, "mean_token_accuracy": 0.22616538554430007, "num_tokens": 75784900.0, "step": 36520 }, { "entropy": 5.635550165176392, "epoch": 3.3132256894049346, "grad_norm": 1.21875, "learning_rate": 0.0003924283448197645, "loss": 4.9683, "mean_token_accuracy": 0.21307288706302643, "num_tokens": 75795711.0, "step": 36525 }, { "entropy": 5.5833546161651615, "epoch": 3.313679245283019, "grad_norm": 1.21875, "learning_rate": 0.0003924007434378498, "loss": 4.8679, "mean_token_accuracy": 0.22391290217638016, "num_tokens": 75805951.0, "step": 36530 }, { "entropy": 5.555324459075928, "epoch": 3.314132801161103, "grad_norm": 1.2734375, "learning_rate": 0.0003923731396280579, "loss": 4.8761, "mean_token_accuracy": 0.22122474610805512, "num_tokens": 75816023.0, "step": 36535 }, { "entropy": 5.584045553207398, "epoch": 3.3145863570391874, "grad_norm": 1.1484375, "learning_rate": 0.00039234553339095944, "loss": 4.9385, "mean_token_accuracy": 0.21870590448379518, "num_tokens": 75827395.0, "step": 36540 }, { "entropy": 5.626761245727539, "epoch": 3.315039912917271, "grad_norm": 1.3203125, "learning_rate": 0.00039231792472712554, "loss": 4.8523, "mean_token_accuracy": 0.2258223608136177, "num_tokens": 75836663.0, "step": 36545 }, { "entropy": 5.5829822540283205, "epoch": 3.3154934687953554, "grad_norm": 1.1796875, "learning_rate": 0.000392290313637127, "loss": 4.8918, "mean_token_accuracy": 0.22135494500398636, "num_tokens": 75846686.0, "step": 36550 }, { "entropy": 5.507472801208496, "epoch": 3.3159470246734397, "grad_norm": 1.1875, "learning_rate": 0.00039226270012153485, "loss": 4.9167, "mean_token_accuracy": 0.22080935388803483, "num_tokens": 75857386.0, "step": 36555 }, { "entropy": 5.544924020767212, "epoch": 3.316400580551524, "grad_norm": 1.2265625, "learning_rate": 0.0003922350841809203, "loss": 4.8964, "mean_token_accuracy": 0.21730443388223647, "num_tokens": 75867003.0, "step": 36560 }, { "entropy": 5.565072917938233, "epoch": 3.3168541364296082, "grad_norm": 1.09375, "learning_rate": 0.0003922074658158543, "loss": 4.9367, "mean_token_accuracy": 0.22167457193136214, "num_tokens": 75878155.0, "step": 36565 }, { "entropy": 5.529049491882324, "epoch": 3.3173076923076925, "grad_norm": 1.265625, "learning_rate": 0.00039217984502690797, "loss": 4.884, "mean_token_accuracy": 0.22216019332408904, "num_tokens": 75888478.0, "step": 36570 }, { "entropy": 5.522053623199463, "epoch": 3.3177612481857763, "grad_norm": 1.15625, "learning_rate": 0.00039215222181465263, "loss": 4.8204, "mean_token_accuracy": 0.22702420949935914, "num_tokens": 75899541.0, "step": 36575 }, { "entropy": 5.570736217498779, "epoch": 3.3182148040638606, "grad_norm": 1.1171875, "learning_rate": 0.00039212459617965956, "loss": 4.8756, "mean_token_accuracy": 0.22341932952404023, "num_tokens": 75910175.0, "step": 36580 }, { "entropy": 5.52685399055481, "epoch": 3.318668359941945, "grad_norm": 1.28125, "learning_rate": 0.0003920969681224999, "loss": 4.8792, "mean_token_accuracy": 0.22080364376306533, "num_tokens": 75919713.0, "step": 36585 }, { "entropy": 5.561062049865723, "epoch": 3.319121915820029, "grad_norm": 1.171875, "learning_rate": 0.00039206933764374515, "loss": 4.9522, "mean_token_accuracy": 0.21347711235284805, "num_tokens": 75929366.0, "step": 36590 }, { "entropy": 5.670263338088989, "epoch": 3.3195754716981134, "grad_norm": 1.1953125, "learning_rate": 0.00039204170474396656, "loss": 4.9833, "mean_token_accuracy": 0.21077465862035752, "num_tokens": 75940284.0, "step": 36595 }, { "entropy": 5.561238574981689, "epoch": 3.3200290275761972, "grad_norm": 1.21875, "learning_rate": 0.0003920140694237358, "loss": 4.8437, "mean_token_accuracy": 0.22407121658325196, "num_tokens": 75950752.0, "step": 36600 }, { "entropy": 5.625689601898193, "epoch": 3.3204825834542815, "grad_norm": 1.203125, "learning_rate": 0.0003919864316836242, "loss": 4.9755, "mean_token_accuracy": 0.20774998664855956, "num_tokens": 75961308.0, "step": 36605 }, { "entropy": 5.598316478729248, "epoch": 3.3209361393323658, "grad_norm": 1.234375, "learning_rate": 0.0003919587915242034, "loss": 4.8676, "mean_token_accuracy": 0.2274664595723152, "num_tokens": 75972317.0, "step": 36610 }, { "entropy": 5.554518938064575, "epoch": 3.32138969521045, "grad_norm": 1.21875, "learning_rate": 0.00039193114894604504, "loss": 4.8625, "mean_token_accuracy": 0.23019461780786515, "num_tokens": 75982769.0, "step": 36615 }, { "entropy": 5.525543165206909, "epoch": 3.3218432510885343, "grad_norm": 1.2109375, "learning_rate": 0.00039190350394972074, "loss": 4.8459, "mean_token_accuracy": 0.22585543543100356, "num_tokens": 75992209.0, "step": 36620 }, { "entropy": 5.609144878387451, "epoch": 3.322296806966618, "grad_norm": 1.3125, "learning_rate": 0.0003918758565358021, "loss": 4.9525, "mean_token_accuracy": 0.2239365667104721, "num_tokens": 76001749.0, "step": 36625 }, { "entropy": 5.636905336380005, "epoch": 3.3227503628447024, "grad_norm": 1.2265625, "learning_rate": 0.000391848206704861, "loss": 4.8643, "mean_token_accuracy": 0.2198459357023239, "num_tokens": 76011326.0, "step": 36630 }, { "entropy": 5.518182706832886, "epoch": 3.3232039187227866, "grad_norm": 1.2265625, "learning_rate": 0.00039182055445746917, "loss": 4.8097, "mean_token_accuracy": 0.2273189216852188, "num_tokens": 76021527.0, "step": 36635 }, { "entropy": 5.537480068206787, "epoch": 3.323657474600871, "grad_norm": 1.2421875, "learning_rate": 0.00039179289979419853, "loss": 4.7498, "mean_token_accuracy": 0.22769413143396378, "num_tokens": 76031217.0, "step": 36640 }, { "entropy": 5.601564073562622, "epoch": 3.324111030478955, "grad_norm": 1.109375, "learning_rate": 0.00039176524271562096, "loss": 4.9934, "mean_token_accuracy": 0.21185964047908784, "num_tokens": 76041936.0, "step": 36645 }, { "entropy": 5.560208988189697, "epoch": 3.324564586357039, "grad_norm": 1.1796875, "learning_rate": 0.00039173758322230847, "loss": 4.9384, "mean_token_accuracy": 0.21843719631433486, "num_tokens": 76052431.0, "step": 36650 }, { "entropy": 5.569587516784668, "epoch": 3.3250181422351233, "grad_norm": 1.3125, "learning_rate": 0.0003917099213148329, "loss": 4.7963, "mean_token_accuracy": 0.23374972343444825, "num_tokens": 76061589.0, "step": 36655 }, { "entropy": 5.638384580612183, "epoch": 3.3254716981132075, "grad_norm": 1.3125, "learning_rate": 0.00039168225699376646, "loss": 4.9226, "mean_token_accuracy": 0.22585769444704057, "num_tokens": 76071642.0, "step": 36660 }, { "entropy": 5.544366264343262, "epoch": 3.325925253991292, "grad_norm": 1.2734375, "learning_rate": 0.00039165459025968126, "loss": 4.8263, "mean_token_accuracy": 0.22551517188549042, "num_tokens": 76081084.0, "step": 36665 }, { "entropy": 5.567027473449707, "epoch": 3.326378809869376, "grad_norm": 1.2890625, "learning_rate": 0.0003916269211131494, "loss": 4.8668, "mean_token_accuracy": 0.21986715644598007, "num_tokens": 76091125.0, "step": 36670 }, { "entropy": 5.6285316944122314, "epoch": 3.3268323657474603, "grad_norm": 1.2734375, "learning_rate": 0.0003915992495547431, "loss": 4.9257, "mean_token_accuracy": 0.2209387257695198, "num_tokens": 76101452.0, "step": 36675 }, { "entropy": 5.531765937805176, "epoch": 3.327285921625544, "grad_norm": 1.2734375, "learning_rate": 0.00039157157558503456, "loss": 4.8898, "mean_token_accuracy": 0.21396030187606813, "num_tokens": 76112034.0, "step": 36680 }, { "entropy": 5.558709287643433, "epoch": 3.3277394775036284, "grad_norm": 1.3515625, "learning_rate": 0.00039154389920459615, "loss": 4.8637, "mean_token_accuracy": 0.2231830358505249, "num_tokens": 76122395.0, "step": 36685 }, { "entropy": 5.626301193237305, "epoch": 3.3281930333817127, "grad_norm": 1.25, "learning_rate": 0.0003915162204140002, "loss": 4.8669, "mean_token_accuracy": 0.22527687549591063, "num_tokens": 76133622.0, "step": 36690 }, { "entropy": 5.6073386669158936, "epoch": 3.328646589259797, "grad_norm": 1.25, "learning_rate": 0.00039148853921381916, "loss": 4.8576, "mean_token_accuracy": 0.2241377428174019, "num_tokens": 76143757.0, "step": 36695 }, { "entropy": 5.725376176834106, "epoch": 3.3291001451378808, "grad_norm": 1.1328125, "learning_rate": 0.0003914608556046254, "loss": 5.1208, "mean_token_accuracy": 0.20432931929826736, "num_tokens": 76154943.0, "step": 36700 }, { "entropy": 5.549917221069336, "epoch": 3.329553701015965, "grad_norm": 1.2734375, "learning_rate": 0.0003914331695869914, "loss": 4.8892, "mean_token_accuracy": 0.21629741042852402, "num_tokens": 76165227.0, "step": 36705 }, { "entropy": 5.599585247039795, "epoch": 3.3300072568940493, "grad_norm": 1.2109375, "learning_rate": 0.0003914054811614899, "loss": 4.9084, "mean_token_accuracy": 0.2204759508371353, "num_tokens": 76174127.0, "step": 36710 }, { "entropy": 5.654601526260376, "epoch": 3.3304608127721336, "grad_norm": 1.265625, "learning_rate": 0.0003913777903286934, "loss": 4.9909, "mean_token_accuracy": 0.21576366871595382, "num_tokens": 76183518.0, "step": 36715 }, { "entropy": 5.593705701828003, "epoch": 3.330914368650218, "grad_norm": 1.2265625, "learning_rate": 0.0003913500970891745, "loss": 4.918, "mean_token_accuracy": 0.21149157285690307, "num_tokens": 76193865.0, "step": 36720 }, { "entropy": 5.627123641967773, "epoch": 3.331367924528302, "grad_norm": 1.2421875, "learning_rate": 0.0003913224014435058, "loss": 4.9375, "mean_token_accuracy": 0.21997116953134538, "num_tokens": 76204273.0, "step": 36725 }, { "entropy": 5.528572845458984, "epoch": 3.331821480406386, "grad_norm": 1.2578125, "learning_rate": 0.00039129470339226044, "loss": 4.793, "mean_token_accuracy": 0.22748868614435197, "num_tokens": 76213706.0, "step": 36730 }, { "entropy": 5.590824222564697, "epoch": 3.33227503628447, "grad_norm": 1.34375, "learning_rate": 0.00039126700293601086, "loss": 4.9517, "mean_token_accuracy": 0.22295429706573486, "num_tokens": 76224484.0, "step": 36735 }, { "entropy": 5.584521627426147, "epoch": 3.3327285921625545, "grad_norm": 1.1796875, "learning_rate": 0.0003912393000753299, "loss": 4.9519, "mean_token_accuracy": 0.2123736023902893, "num_tokens": 76236004.0, "step": 36740 }, { "entropy": 5.634949445724487, "epoch": 3.3331821480406387, "grad_norm": 1.375, "learning_rate": 0.00039121159481079077, "loss": 4.8443, "mean_token_accuracy": 0.2249806135892868, "num_tokens": 76245109.0, "step": 36745 }, { "entropy": 5.6107385635375975, "epoch": 3.3336357039187225, "grad_norm": 1.28125, "learning_rate": 0.00039118388714296626, "loss": 4.8649, "mean_token_accuracy": 0.22179746478796006, "num_tokens": 76255154.0, "step": 36750 }, { "entropy": 5.5614673614501955, "epoch": 3.334089259796807, "grad_norm": 1.0625, "learning_rate": 0.0003911561770724292, "loss": 4.8241, "mean_token_accuracy": 0.22113037109375, "num_tokens": 76266014.0, "step": 36755 }, { "entropy": 5.4840186595916744, "epoch": 3.334542815674891, "grad_norm": 1.1328125, "learning_rate": 0.000391128464599753, "loss": 4.8195, "mean_token_accuracy": 0.22680775672197342, "num_tokens": 76277593.0, "step": 36760 }, { "entropy": 5.496492004394531, "epoch": 3.3349963715529753, "grad_norm": 1.234375, "learning_rate": 0.0003911007497255104, "loss": 4.8004, "mean_token_accuracy": 0.23136518001556397, "num_tokens": 76287816.0, "step": 36765 }, { "entropy": 5.591173219680786, "epoch": 3.3354499274310596, "grad_norm": 1.2265625, "learning_rate": 0.0003910730324502748, "loss": 4.9332, "mean_token_accuracy": 0.21267748028039932, "num_tokens": 76298299.0, "step": 36770 }, { "entropy": 5.588947868347168, "epoch": 3.335903483309144, "grad_norm": 1.21875, "learning_rate": 0.0003910453127746192, "loss": 4.923, "mean_token_accuracy": 0.21363819241523743, "num_tokens": 76308747.0, "step": 36775 }, { "entropy": 5.561166143417358, "epoch": 3.3363570391872277, "grad_norm": 1.2109375, "learning_rate": 0.0003910175906991171, "loss": 4.828, "mean_token_accuracy": 0.22078896164894105, "num_tokens": 76318923.0, "step": 36780 }, { "entropy": 5.6138872623443605, "epoch": 3.336810595065312, "grad_norm": 1.25, "learning_rate": 0.0003909898662243415, "loss": 4.9305, "mean_token_accuracy": 0.21744290143251419, "num_tokens": 76327985.0, "step": 36785 }, { "entropy": 5.609305334091187, "epoch": 3.3372641509433962, "grad_norm": 1.1015625, "learning_rate": 0.00039096213935086604, "loss": 4.9899, "mean_token_accuracy": 0.211505426466465, "num_tokens": 76338933.0, "step": 36790 }, { "entropy": 5.700739622116089, "epoch": 3.3377177068214805, "grad_norm": 1.1796875, "learning_rate": 0.00039093441007926396, "loss": 4.9897, "mean_token_accuracy": 0.2164185866713524, "num_tokens": 76349601.0, "step": 36795 }, { "entropy": 5.583732032775879, "epoch": 3.3381712626995648, "grad_norm": 1.2421875, "learning_rate": 0.00039090667841010874, "loss": 4.8548, "mean_token_accuracy": 0.2239080548286438, "num_tokens": 76359968.0, "step": 36800 }, { "entropy": 5.485671520233154, "epoch": 3.3386248185776486, "grad_norm": 1.3046875, "learning_rate": 0.0003908789443439737, "loss": 4.7716, "mean_token_accuracy": 0.229628586769104, "num_tokens": 76369864.0, "step": 36805 }, { "entropy": 5.517950010299683, "epoch": 3.339078374455733, "grad_norm": 1.234375, "learning_rate": 0.0003908512078814329, "loss": 4.7962, "mean_token_accuracy": 0.2274636834859848, "num_tokens": 76379158.0, "step": 36810 }, { "entropy": 5.566267681121826, "epoch": 3.339531930333817, "grad_norm": 1.359375, "learning_rate": 0.00039082346902305937, "loss": 4.8349, "mean_token_accuracy": 0.22249929010868072, "num_tokens": 76388798.0, "step": 36815 }, { "entropy": 5.519220685958862, "epoch": 3.3399854862119014, "grad_norm": 1.15625, "learning_rate": 0.000390795727769427, "loss": 4.8324, "mean_token_accuracy": 0.22755888998508453, "num_tokens": 76399315.0, "step": 36820 }, { "entropy": 5.56700029373169, "epoch": 3.3404390420899857, "grad_norm": 1.3828125, "learning_rate": 0.0003907679841211095, "loss": 4.8919, "mean_token_accuracy": 0.219604754447937, "num_tokens": 76408841.0, "step": 36825 }, { "entropy": 5.614740324020386, "epoch": 3.3408925979680695, "grad_norm": 1.203125, "learning_rate": 0.0003907402380786806, "loss": 4.9376, "mean_token_accuracy": 0.2144710823893547, "num_tokens": 76420055.0, "step": 36830 }, { "entropy": 5.553021955490112, "epoch": 3.3413461538461537, "grad_norm": 1.125, "learning_rate": 0.0003907124896427141, "loss": 4.825, "mean_token_accuracy": 0.22464940696954727, "num_tokens": 76430921.0, "step": 36835 }, { "entropy": 5.572552585601807, "epoch": 3.341799709724238, "grad_norm": 1.171875, "learning_rate": 0.0003906847388137837, "loss": 4.8551, "mean_token_accuracy": 0.22144886255264282, "num_tokens": 76441216.0, "step": 36840 }, { "entropy": 5.55699462890625, "epoch": 3.3422532656023223, "grad_norm": 1.4453125, "learning_rate": 0.0003906569855924636, "loss": 4.9042, "mean_token_accuracy": 0.2220016449689865, "num_tokens": 76451940.0, "step": 36845 }, { "entropy": 5.588142538070679, "epoch": 3.3427068214804065, "grad_norm": 1.265625, "learning_rate": 0.0003906292299793275, "loss": 4.9087, "mean_token_accuracy": 0.22202715575695037, "num_tokens": 76461701.0, "step": 36850 }, { "entropy": 5.617266893386841, "epoch": 3.3431603773584904, "grad_norm": 1.234375, "learning_rate": 0.00039060147197494943, "loss": 4.9808, "mean_token_accuracy": 0.21108526289463042, "num_tokens": 76473658.0, "step": 36855 }, { "entropy": 5.567918682098389, "epoch": 3.3436139332365746, "grad_norm": 1.2109375, "learning_rate": 0.00039057371157990347, "loss": 4.8757, "mean_token_accuracy": 0.22024325728416444, "num_tokens": 76483821.0, "step": 36860 }, { "entropy": 5.5942771434783936, "epoch": 3.344067489114659, "grad_norm": 1.1640625, "learning_rate": 0.00039054594879476374, "loss": 4.8989, "mean_token_accuracy": 0.21405478417873383, "num_tokens": 76494699.0, "step": 36865 }, { "entropy": 5.587513637542725, "epoch": 3.344521044992743, "grad_norm": 1.328125, "learning_rate": 0.00039051818362010433, "loss": 4.8677, "mean_token_accuracy": 0.22719480991363525, "num_tokens": 76504299.0, "step": 36870 }, { "entropy": 5.610410261154175, "epoch": 3.3449746008708274, "grad_norm": 1.2421875, "learning_rate": 0.0003904904160564994, "loss": 4.9209, "mean_token_accuracy": 0.2180797502398491, "num_tokens": 76514469.0, "step": 36875 }, { "entropy": 5.584064865112305, "epoch": 3.3454281567489117, "grad_norm": 1.4296875, "learning_rate": 0.0003904626461045232, "loss": 4.9172, "mean_token_accuracy": 0.21947478801012038, "num_tokens": 76524666.0, "step": 36880 }, { "entropy": 5.519516897201538, "epoch": 3.3458817126269955, "grad_norm": 1.2890625, "learning_rate": 0.00039043487376475017, "loss": 4.8577, "mean_token_accuracy": 0.21699734032154083, "num_tokens": 76534787.0, "step": 36885 }, { "entropy": 5.585465717315674, "epoch": 3.34633526850508, "grad_norm": 1.4453125, "learning_rate": 0.00039040709903775446, "loss": 4.8875, "mean_token_accuracy": 0.21751937568187713, "num_tokens": 76545055.0, "step": 36890 }, { "entropy": 5.514423894882202, "epoch": 3.346788824383164, "grad_norm": 1.2734375, "learning_rate": 0.0003903793219241106, "loss": 4.8598, "mean_token_accuracy": 0.22558341473340987, "num_tokens": 76555458.0, "step": 36895 }, { "entropy": 5.516722965240478, "epoch": 3.3472423802612483, "grad_norm": 1.21875, "learning_rate": 0.00039035154242439294, "loss": 4.8329, "mean_token_accuracy": 0.22858362048864364, "num_tokens": 76566272.0, "step": 36900 }, { "entropy": 5.630861759185791, "epoch": 3.347695936139332, "grad_norm": 1.171875, "learning_rate": 0.0003903237605391759, "loss": 4.8946, "mean_token_accuracy": 0.2212006688117981, "num_tokens": 76575656.0, "step": 36905 }, { "entropy": 5.677237319946289, "epoch": 3.3481494920174164, "grad_norm": 1.3203125, "learning_rate": 0.0003902959762690342, "loss": 4.8406, "mean_token_accuracy": 0.22116517871618271, "num_tokens": 76586481.0, "step": 36910 }, { "entropy": 5.547810173034668, "epoch": 3.3486030478955007, "grad_norm": 1.359375, "learning_rate": 0.0003902681896145423, "loss": 4.827, "mean_token_accuracy": 0.23021179884672166, "num_tokens": 76596023.0, "step": 36915 }, { "entropy": 5.462574100494384, "epoch": 3.349056603773585, "grad_norm": 1.125, "learning_rate": 0.00039024040057627487, "loss": 4.783, "mean_token_accuracy": 0.2278587743639946, "num_tokens": 76605887.0, "step": 36920 }, { "entropy": 5.5292778491973875, "epoch": 3.349510159651669, "grad_norm": 1.2265625, "learning_rate": 0.0003902126091548066, "loss": 4.7922, "mean_token_accuracy": 0.232846137881279, "num_tokens": 76616007.0, "step": 36925 }, { "entropy": 5.620429754257202, "epoch": 3.3499637155297535, "grad_norm": 1.203125, "learning_rate": 0.00039018481535071215, "loss": 4.9444, "mean_token_accuracy": 0.21589034795761108, "num_tokens": 76626253.0, "step": 36930 }, { "entropy": 5.577888822555542, "epoch": 3.3504172714078373, "grad_norm": 1.2578125, "learning_rate": 0.0003901570191645665, "loss": 4.82, "mean_token_accuracy": 0.22529965490102768, "num_tokens": 76636341.0, "step": 36935 }, { "entropy": 5.571004104614258, "epoch": 3.3508708272859216, "grad_norm": 1.1484375, "learning_rate": 0.00039012922059694416, "loss": 4.8375, "mean_token_accuracy": 0.22479562759399413, "num_tokens": 76647616.0, "step": 36940 }, { "entropy": 5.559922218322754, "epoch": 3.351324383164006, "grad_norm": 1.265625, "learning_rate": 0.0003901014196484203, "loss": 4.8645, "mean_token_accuracy": 0.22256214320659637, "num_tokens": 76658261.0, "step": 36945 }, { "entropy": 5.547712659835815, "epoch": 3.35177793904209, "grad_norm": 1.2890625, "learning_rate": 0.00039007361631956976, "loss": 4.8784, "mean_token_accuracy": 0.216556616127491, "num_tokens": 76667985.0, "step": 36950 }, { "entropy": 5.540558481216431, "epoch": 3.3522314949201744, "grad_norm": 1.203125, "learning_rate": 0.00039004581061096745, "loss": 4.8361, "mean_token_accuracy": 0.22946188896894454, "num_tokens": 76678538.0, "step": 36955 }, { "entropy": 5.572626066207886, "epoch": 3.352685050798258, "grad_norm": 1.265625, "learning_rate": 0.0003900180025231886, "loss": 4.7921, "mean_token_accuracy": 0.2263064280152321, "num_tokens": 76688052.0, "step": 36960 }, { "entropy": 5.527972936630249, "epoch": 3.3531386066763424, "grad_norm": 1.2265625, "learning_rate": 0.00038999019205680796, "loss": 4.8317, "mean_token_accuracy": 0.22590949088335038, "num_tokens": 76699241.0, "step": 36965 }, { "entropy": 5.5455437183380125, "epoch": 3.3535921625544267, "grad_norm": 1.2734375, "learning_rate": 0.000389962379212401, "loss": 4.8667, "mean_token_accuracy": 0.22348733097314835, "num_tokens": 76708979.0, "step": 36970 }, { "entropy": 5.581981229782104, "epoch": 3.354045718432511, "grad_norm": 1.234375, "learning_rate": 0.0003899345639905426, "loss": 4.8388, "mean_token_accuracy": 0.22403321266174317, "num_tokens": 76719330.0, "step": 36975 }, { "entropy": 5.609098482131958, "epoch": 3.3544992743105952, "grad_norm": 1.2421875, "learning_rate": 0.0003899067463918083, "loss": 4.9911, "mean_token_accuracy": 0.21030414700508118, "num_tokens": 76730210.0, "step": 36980 }, { "entropy": 5.671187496185302, "epoch": 3.354952830188679, "grad_norm": 1.3203125, "learning_rate": 0.00038987892641677307, "loss": 4.9579, "mean_token_accuracy": 0.21665871888399124, "num_tokens": 76739977.0, "step": 36985 }, { "entropy": 5.564933967590332, "epoch": 3.3554063860667633, "grad_norm": 1.1484375, "learning_rate": 0.0003898511040660124, "loss": 4.8562, "mean_token_accuracy": 0.22152408957481384, "num_tokens": 76750200.0, "step": 36990 }, { "entropy": 5.633210897445679, "epoch": 3.3558599419448476, "grad_norm": 1.2265625, "learning_rate": 0.0003898232793401017, "loss": 4.9593, "mean_token_accuracy": 0.21016151756048201, "num_tokens": 76761420.0, "step": 36995 }, { "entropy": 5.542958927154541, "epoch": 3.356313497822932, "grad_norm": 1.1796875, "learning_rate": 0.00038979545223961627, "loss": 4.8384, "mean_token_accuracy": 0.2248327448964119, "num_tokens": 76771872.0, "step": 37000 }, { "entropy": 5.495049667358399, "epoch": 3.356767053701016, "grad_norm": 1.15625, "learning_rate": 0.00038976762276513163, "loss": 4.8188, "mean_token_accuracy": 0.22955177426338197, "num_tokens": 76782303.0, "step": 37005 }, { "entropy": 5.605542516708374, "epoch": 3.3572206095791, "grad_norm": 1.1953125, "learning_rate": 0.0003897397909172232, "loss": 4.9562, "mean_token_accuracy": 0.2155901610851288, "num_tokens": 76792595.0, "step": 37010 }, { "entropy": 5.610218715667725, "epoch": 3.3576741654571842, "grad_norm": 1.234375, "learning_rate": 0.0003897119566964669, "loss": 4.9095, "mean_token_accuracy": 0.22005278021097183, "num_tokens": 76802577.0, "step": 37015 }, { "entropy": 5.588788795471191, "epoch": 3.3581277213352685, "grad_norm": 1.28125, "learning_rate": 0.0003896841201034379, "loss": 4.8325, "mean_token_accuracy": 0.23271469920873641, "num_tokens": 76812686.0, "step": 37020 }, { "entropy": 5.4986647605896, "epoch": 3.3585812772133528, "grad_norm": 1.3828125, "learning_rate": 0.0003896562811387121, "loss": 4.7644, "mean_token_accuracy": 0.23151354640722274, "num_tokens": 76823641.0, "step": 37025 }, { "entropy": 5.588286972045898, "epoch": 3.359034833091437, "grad_norm": 1.328125, "learning_rate": 0.00038962843980286523, "loss": 4.8945, "mean_token_accuracy": 0.2219184711575508, "num_tokens": 76834060.0, "step": 37030 }, { "entropy": 5.636357259750366, "epoch": 3.3594883889695213, "grad_norm": 1.1953125, "learning_rate": 0.00038960059609647306, "loss": 4.9641, "mean_token_accuracy": 0.22237439602613449, "num_tokens": 76845078.0, "step": 37035 }, { "entropy": 5.627853488922119, "epoch": 3.359941944847605, "grad_norm": 1.109375, "learning_rate": 0.0003895727500201113, "loss": 4.9765, "mean_token_accuracy": 0.21625707447528839, "num_tokens": 76856539.0, "step": 37040 }, { "entropy": 5.647389984130859, "epoch": 3.3603955007256894, "grad_norm": 1.296875, "learning_rate": 0.00038954490157435583, "loss": 4.9739, "mean_token_accuracy": 0.2166483446955681, "num_tokens": 76866941.0, "step": 37045 }, { "entropy": 5.57813606262207, "epoch": 3.3608490566037736, "grad_norm": 1.1953125, "learning_rate": 0.00038951705075978264, "loss": 4.8758, "mean_token_accuracy": 0.21708226799964905, "num_tokens": 76878205.0, "step": 37050 }, { "entropy": 5.622052574157715, "epoch": 3.361302612481858, "grad_norm": 1.2578125, "learning_rate": 0.0003894891975769677, "loss": 4.9278, "mean_token_accuracy": 0.2097334548830986, "num_tokens": 76888609.0, "step": 37055 }, { "entropy": 5.550989961624145, "epoch": 3.3617561683599417, "grad_norm": 1.1640625, "learning_rate": 0.0003894613420264869, "loss": 4.8841, "mean_token_accuracy": 0.2170402243733406, "num_tokens": 76899637.0, "step": 37060 }, { "entropy": 5.566029644012451, "epoch": 3.362209724238026, "grad_norm": 1.109375, "learning_rate": 0.00038943348410891643, "loss": 4.903, "mean_token_accuracy": 0.21379348188638686, "num_tokens": 76911186.0, "step": 37065 }, { "entropy": 5.566127109527588, "epoch": 3.3626632801161103, "grad_norm": 1.2109375, "learning_rate": 0.0003894056238248324, "loss": 4.8604, "mean_token_accuracy": 0.22173467725515367, "num_tokens": 76921704.0, "step": 37070 }, { "entropy": 5.513340711593628, "epoch": 3.3631168359941945, "grad_norm": 1.1015625, "learning_rate": 0.0003893777611748108, "loss": 4.8511, "mean_token_accuracy": 0.2271147832274437, "num_tokens": 76932362.0, "step": 37075 }, { "entropy": 5.588864374160766, "epoch": 3.363570391872279, "grad_norm": 1.1484375, "learning_rate": 0.00038934989615942807, "loss": 5.0007, "mean_token_accuracy": 0.21515003591775894, "num_tokens": 76942581.0, "step": 37080 }, { "entropy": 5.573402023315429, "epoch": 3.364023947750363, "grad_norm": 1.1953125, "learning_rate": 0.0003893220287792603, "loss": 4.873, "mean_token_accuracy": 0.21924083828926086, "num_tokens": 76952912.0, "step": 37085 }, { "entropy": 5.587262439727783, "epoch": 3.364477503628447, "grad_norm": 1.2890625, "learning_rate": 0.00038929415903488383, "loss": 4.9073, "mean_token_accuracy": 0.22035903930664064, "num_tokens": 76963320.0, "step": 37090 }, { "entropy": 5.525803327560425, "epoch": 3.364931059506531, "grad_norm": 1.2734375, "learning_rate": 0.000389266286926875, "loss": 4.7735, "mean_token_accuracy": 0.22972386330366135, "num_tokens": 76973448.0, "step": 37095 }, { "entropy": 5.508778810501099, "epoch": 3.3653846153846154, "grad_norm": 1.25, "learning_rate": 0.00038923841245581026, "loss": 4.8388, "mean_token_accuracy": 0.22881875783205033, "num_tokens": 76983671.0, "step": 37100 }, { "entropy": 5.608328771591187, "epoch": 3.3658381712626997, "grad_norm": 1.15625, "learning_rate": 0.00038921053562226607, "loss": 4.9928, "mean_token_accuracy": 0.2089029684662819, "num_tokens": 76994345.0, "step": 37105 }, { "entropy": 5.556074380874634, "epoch": 3.3662917271407835, "grad_norm": 1.0859375, "learning_rate": 0.00038918265642681884, "loss": 4.7902, "mean_token_accuracy": 0.2277903288602829, "num_tokens": 77004809.0, "step": 37110 }, { "entropy": 5.539338636398315, "epoch": 3.3667452830188678, "grad_norm": 1.2265625, "learning_rate": 0.00038915477487004525, "loss": 4.8746, "mean_token_accuracy": 0.22206738740205764, "num_tokens": 77015505.0, "step": 37115 }, { "entropy": 5.460027122497559, "epoch": 3.367198838896952, "grad_norm": 1.2421875, "learning_rate": 0.00038912689095252183, "loss": 4.7075, "mean_token_accuracy": 0.2344900131225586, "num_tokens": 77025572.0, "step": 37120 }, { "entropy": 5.62530665397644, "epoch": 3.3676523947750363, "grad_norm": 1.234375, "learning_rate": 0.0003890990046748251, "loss": 5.0211, "mean_token_accuracy": 0.20564277172088624, "num_tokens": 77037273.0, "step": 37125 }, { "entropy": 5.658636903762817, "epoch": 3.3681059506531206, "grad_norm": 1.2890625, "learning_rate": 0.00038907111603753196, "loss": 4.944, "mean_token_accuracy": 0.21606577783823014, "num_tokens": 77047724.0, "step": 37130 }, { "entropy": 5.591211891174316, "epoch": 3.368559506531205, "grad_norm": 1.1484375, "learning_rate": 0.00038904322504121916, "loss": 4.8772, "mean_token_accuracy": 0.22384998053312302, "num_tokens": 77057839.0, "step": 37135 }, { "entropy": 5.544419145584106, "epoch": 3.3690130624092887, "grad_norm": 1.203125, "learning_rate": 0.0003890153316864632, "loss": 4.8383, "mean_token_accuracy": 0.215443979203701, "num_tokens": 77068505.0, "step": 37140 }, { "entropy": 5.627410793304444, "epoch": 3.369466618287373, "grad_norm": 1.265625, "learning_rate": 0.00038898743597384126, "loss": 4.966, "mean_token_accuracy": 0.21652162373065947, "num_tokens": 77078126.0, "step": 37145 }, { "entropy": 5.56817855834961, "epoch": 3.369920174165457, "grad_norm": 1.1953125, "learning_rate": 0.00038895953790393014, "loss": 4.8885, "mean_token_accuracy": 0.22385476231575013, "num_tokens": 77087802.0, "step": 37150 }, { "entropy": 5.575368213653564, "epoch": 3.3703737300435415, "grad_norm": 1.203125, "learning_rate": 0.00038893163747730664, "loss": 4.9039, "mean_token_accuracy": 0.22743118554353714, "num_tokens": 77097901.0, "step": 37155 }, { "entropy": 5.5749739646911625, "epoch": 3.3708272859216257, "grad_norm": 1.203125, "learning_rate": 0.00038890373469454794, "loss": 4.8361, "mean_token_accuracy": 0.22008615732192993, "num_tokens": 77107604.0, "step": 37160 }, { "entropy": 5.567868566513061, "epoch": 3.3712808417997095, "grad_norm": 1.15625, "learning_rate": 0.00038887582955623084, "loss": 4.8187, "mean_token_accuracy": 0.2270792990922928, "num_tokens": 77117410.0, "step": 37165 }, { "entropy": 5.61644606590271, "epoch": 3.371734397677794, "grad_norm": 1.140625, "learning_rate": 0.0003888479220629326, "loss": 4.8779, "mean_token_accuracy": 0.21819025576114653, "num_tokens": 77129546.0, "step": 37170 }, { "entropy": 5.567762422561645, "epoch": 3.372187953555878, "grad_norm": 1.1484375, "learning_rate": 0.0003888200122152304, "loss": 4.8269, "mean_token_accuracy": 0.22551273554563522, "num_tokens": 77139217.0, "step": 37175 }, { "entropy": 5.653349304199219, "epoch": 3.3726415094339623, "grad_norm": 1.203125, "learning_rate": 0.0003887921000137013, "loss": 4.9838, "mean_token_accuracy": 0.21518248915672303, "num_tokens": 77149694.0, "step": 37180 }, { "entropy": 5.521298360824585, "epoch": 3.3730950653120466, "grad_norm": 1.2734375, "learning_rate": 0.0003887641854589226, "loss": 4.8627, "mean_token_accuracy": 0.2236031711101532, "num_tokens": 77159291.0, "step": 37185 }, { "entropy": 5.524296236038208, "epoch": 3.3735486211901304, "grad_norm": 1.203125, "learning_rate": 0.0003887362685514716, "loss": 4.8592, "mean_token_accuracy": 0.22009043246507645, "num_tokens": 77170507.0, "step": 37190 }, { "entropy": 5.586553239822388, "epoch": 3.3740021770682147, "grad_norm": 1.3046875, "learning_rate": 0.0003887083492919254, "loss": 4.8881, "mean_token_accuracy": 0.22325950413942336, "num_tokens": 77179673.0, "step": 37195 }, { "entropy": 5.651239681243896, "epoch": 3.374455732946299, "grad_norm": 1.1171875, "learning_rate": 0.0003886804276808617, "loss": 4.8616, "mean_token_accuracy": 0.22717688083648682, "num_tokens": 77190163.0, "step": 37200 }, { "entropy": 5.6128607273101805, "epoch": 3.3749092888243832, "grad_norm": 1.2265625, "learning_rate": 0.0003886525037188578, "loss": 4.8876, "mean_token_accuracy": 0.22132845371961593, "num_tokens": 77201498.0, "step": 37205 }, { "entropy": 5.54303674697876, "epoch": 3.3753628447024675, "grad_norm": 1.2734375, "learning_rate": 0.0003886245774064911, "loss": 4.8319, "mean_token_accuracy": 0.22729023098945617, "num_tokens": 77211475.0, "step": 37210 }, { "entropy": 5.559172677993774, "epoch": 3.3758164005805513, "grad_norm": 1.234375, "learning_rate": 0.00038859664874433923, "loss": 4.8816, "mean_token_accuracy": 0.22628084868192672, "num_tokens": 77221972.0, "step": 37215 }, { "entropy": 5.567298364639282, "epoch": 3.3762699564586356, "grad_norm": 1.2890625, "learning_rate": 0.00038856871773297965, "loss": 4.9126, "mean_token_accuracy": 0.2166341558098793, "num_tokens": 77232701.0, "step": 37220 }, { "entropy": 5.588164043426514, "epoch": 3.37672351233672, "grad_norm": 1.2265625, "learning_rate": 0.00038854078437299005, "loss": 4.8478, "mean_token_accuracy": 0.2275938242673874, "num_tokens": 77243242.0, "step": 37225 }, { "entropy": 5.547331428527832, "epoch": 3.377177068214804, "grad_norm": 1.09375, "learning_rate": 0.0003885128486649482, "loss": 4.8232, "mean_token_accuracy": 0.22338929027318954, "num_tokens": 77254279.0, "step": 37230 }, { "entropy": 5.550972175598145, "epoch": 3.3776306240928884, "grad_norm": 1.21875, "learning_rate": 0.00038848491060943164, "loss": 4.8353, "mean_token_accuracy": 0.21936096101999283, "num_tokens": 77265483.0, "step": 37235 }, { "entropy": 5.509790325164795, "epoch": 3.3780841799709727, "grad_norm": 1.1875, "learning_rate": 0.0003884569702070182, "loss": 4.8214, "mean_token_accuracy": 0.21751652359962464, "num_tokens": 77275848.0, "step": 37240 }, { "entropy": 5.527715969085693, "epoch": 3.3785377358490565, "grad_norm": 1.234375, "learning_rate": 0.00038842902745828573, "loss": 4.8527, "mean_token_accuracy": 0.21773028522729873, "num_tokens": 77285943.0, "step": 37245 }, { "entropy": 5.537000751495361, "epoch": 3.3789912917271407, "grad_norm": 1.2734375, "learning_rate": 0.0003884010823638121, "loss": 4.8661, "mean_token_accuracy": 0.22167652547359468, "num_tokens": 77295276.0, "step": 37250 }, { "entropy": 5.603711748123169, "epoch": 3.379444847605225, "grad_norm": 1.2265625, "learning_rate": 0.0003883731349241751, "loss": 4.8635, "mean_token_accuracy": 0.21951636672019958, "num_tokens": 77305713.0, "step": 37255 }, { "entropy": 5.581877946853638, "epoch": 3.3798984034833093, "grad_norm": 1.1796875, "learning_rate": 0.0003883451851399528, "loss": 4.9411, "mean_token_accuracy": 0.22515012621879577, "num_tokens": 77316717.0, "step": 37260 }, { "entropy": 5.529958248138428, "epoch": 3.380351959361393, "grad_norm": 1.21875, "learning_rate": 0.00038831723301172325, "loss": 4.8095, "mean_token_accuracy": 0.22012078911066055, "num_tokens": 77327763.0, "step": 37265 }, { "entropy": 5.617612075805664, "epoch": 3.3808055152394774, "grad_norm": 1.3203125, "learning_rate": 0.0003882892785400644, "loss": 4.9505, "mean_token_accuracy": 0.2180537611246109, "num_tokens": 77337495.0, "step": 37270 }, { "entropy": 5.636267423629761, "epoch": 3.3812590711175616, "grad_norm": 1.09375, "learning_rate": 0.00038826132172555444, "loss": 4.9459, "mean_token_accuracy": 0.21607993096113204, "num_tokens": 77348849.0, "step": 37275 }, { "entropy": 5.568083429336548, "epoch": 3.381712626995646, "grad_norm": 1.25, "learning_rate": 0.0003882333625687714, "loss": 4.9215, "mean_token_accuracy": 0.2179555982351303, "num_tokens": 77359634.0, "step": 37280 }, { "entropy": 5.5771341800689695, "epoch": 3.38216618287373, "grad_norm": 1.3046875, "learning_rate": 0.00038820540107029365, "loss": 4.8534, "mean_token_accuracy": 0.2242253914475441, "num_tokens": 77369342.0, "step": 37285 }, { "entropy": 5.594110345840454, "epoch": 3.3826197387518144, "grad_norm": 1.2109375, "learning_rate": 0.0003881774372306993, "loss": 4.8826, "mean_token_accuracy": 0.22842645794153213, "num_tokens": 77379963.0, "step": 37290 }, { "entropy": 5.521760320663452, "epoch": 3.3830732946298983, "grad_norm": 1.3984375, "learning_rate": 0.0003881494710505667, "loss": 4.8219, "mean_token_accuracy": 0.22620476186275482, "num_tokens": 77390135.0, "step": 37295 }, { "entropy": 5.61454586982727, "epoch": 3.3835268505079825, "grad_norm": 1.3046875, "learning_rate": 0.00038812150253047427, "loss": 4.9528, "mean_token_accuracy": 0.22026821821928025, "num_tokens": 77400151.0, "step": 37300 }, { "entropy": 5.536823892593384, "epoch": 3.383980406386067, "grad_norm": 1.1640625, "learning_rate": 0.0003880935316710003, "loss": 4.8578, "mean_token_accuracy": 0.23001347184181214, "num_tokens": 77410723.0, "step": 37305 }, { "entropy": 5.5244384765625, "epoch": 3.384433962264151, "grad_norm": 1.2578125, "learning_rate": 0.0003880655584727233, "loss": 4.8174, "mean_token_accuracy": 0.22677410691976546, "num_tokens": 77421213.0, "step": 37310 }, { "entropy": 5.598486852645874, "epoch": 3.384887518142235, "grad_norm": 1.1953125, "learning_rate": 0.0003880375829362217, "loss": 4.9148, "mean_token_accuracy": 0.22285457849502563, "num_tokens": 77431705.0, "step": 37315 }, { "entropy": 5.552673292160034, "epoch": 3.385341074020319, "grad_norm": 1.25, "learning_rate": 0.0003880096050620741, "loss": 4.8572, "mean_token_accuracy": 0.22337566912174225, "num_tokens": 77442120.0, "step": 37320 }, { "entropy": 5.578946208953857, "epoch": 3.3857946298984034, "grad_norm": 1.3984375, "learning_rate": 0.0003879816248508591, "loss": 4.8739, "mean_token_accuracy": 0.21787858307361602, "num_tokens": 77451992.0, "step": 37325 }, { "entropy": 5.626970291137695, "epoch": 3.3862481857764877, "grad_norm": 1.296875, "learning_rate": 0.00038795364230315523, "loss": 5.0576, "mean_token_accuracy": 0.20458158999681472, "num_tokens": 77462830.0, "step": 37330 }, { "entropy": 5.621602964401245, "epoch": 3.386701741654572, "grad_norm": 1.1875, "learning_rate": 0.0003879256574195414, "loss": 4.9114, "mean_token_accuracy": 0.2266684129834175, "num_tokens": 77472617.0, "step": 37335 }, { "entropy": 5.530554246902466, "epoch": 3.387155297532656, "grad_norm": 1.1953125, "learning_rate": 0.00038789767020059614, "loss": 4.8031, "mean_token_accuracy": 0.2304278790950775, "num_tokens": 77483430.0, "step": 37340 }, { "entropy": 5.4940722465515135, "epoch": 3.38760885341074, "grad_norm": 1.3046875, "learning_rate": 0.00038786968064689816, "loss": 4.8007, "mean_token_accuracy": 0.22678707987070085, "num_tokens": 77493038.0, "step": 37345 }, { "entropy": 5.574372911453247, "epoch": 3.3880624092888243, "grad_norm": 1.390625, "learning_rate": 0.0003878416887590265, "loss": 4.9242, "mean_token_accuracy": 0.21327053904533386, "num_tokens": 77502816.0, "step": 37350 }, { "entropy": 5.506357955932617, "epoch": 3.3885159651669086, "grad_norm": 1.25, "learning_rate": 0.00038781369453756004, "loss": 4.8206, "mean_token_accuracy": 0.2308778613805771, "num_tokens": 77513026.0, "step": 37355 }, { "entropy": 5.593189525604248, "epoch": 3.388969521044993, "grad_norm": 1.21875, "learning_rate": 0.0003877856979830775, "loss": 4.8979, "mean_token_accuracy": 0.2154422014951706, "num_tokens": 77523217.0, "step": 37360 }, { "entropy": 5.553214979171753, "epoch": 3.389423076923077, "grad_norm": 1.3515625, "learning_rate": 0.00038775769909615805, "loss": 4.9561, "mean_token_accuracy": 0.22305671274662017, "num_tokens": 77533339.0, "step": 37365 }, { "entropy": 5.570053577423096, "epoch": 3.389876632801161, "grad_norm": 1.2734375, "learning_rate": 0.00038772969787738074, "loss": 4.8561, "mean_token_accuracy": 0.22445495277643204, "num_tokens": 77543438.0, "step": 37370 }, { "entropy": 5.593005704879761, "epoch": 3.390330188679245, "grad_norm": 1.28125, "learning_rate": 0.0003877016943273244, "loss": 4.9398, "mean_token_accuracy": 0.21611054837703705, "num_tokens": 77552825.0, "step": 37375 }, { "entropy": 5.574637222290039, "epoch": 3.3907837445573294, "grad_norm": 1.21875, "learning_rate": 0.00038767368844656836, "loss": 4.9159, "mean_token_accuracy": 0.21429501920938493, "num_tokens": 77563107.0, "step": 37380 }, { "entropy": 5.631849670410157, "epoch": 3.3912373004354137, "grad_norm": 1.296875, "learning_rate": 0.00038764568023569177, "loss": 4.9427, "mean_token_accuracy": 0.20987144708633423, "num_tokens": 77573312.0, "step": 37385 }, { "entropy": 5.559608697891235, "epoch": 3.391690856313498, "grad_norm": 1.234375, "learning_rate": 0.0003876176696952737, "loss": 4.8929, "mean_token_accuracy": 0.214712230861187, "num_tokens": 77583742.0, "step": 37390 }, { "entropy": 5.6415328025817875, "epoch": 3.3921444121915822, "grad_norm": 1.2734375, "learning_rate": 0.00038758965682589357, "loss": 4.919, "mean_token_accuracy": 0.21015006750822068, "num_tokens": 77593667.0, "step": 37395 }, { "entropy": 5.563626670837403, "epoch": 3.392597968069666, "grad_norm": 1.0703125, "learning_rate": 0.0003875616416281307, "loss": 4.8212, "mean_token_accuracy": 0.22304535061120986, "num_tokens": 77604249.0, "step": 37400 }, { "entropy": 5.562035799026489, "epoch": 3.3930515239477503, "grad_norm": 1.171875, "learning_rate": 0.00038753362410256435, "loss": 4.848, "mean_token_accuracy": 0.2229387417435646, "num_tokens": 77615095.0, "step": 37405 }, { "entropy": 5.54753680229187, "epoch": 3.3935050798258346, "grad_norm": 1.3671875, "learning_rate": 0.0003875056042497739, "loss": 4.8423, "mean_token_accuracy": 0.22631120979785918, "num_tokens": 77625182.0, "step": 37410 }, { "entropy": 5.575972557067871, "epoch": 3.393958635703919, "grad_norm": 1.2421875, "learning_rate": 0.00038747758207033903, "loss": 4.8486, "mean_token_accuracy": 0.22275305837392806, "num_tokens": 77635423.0, "step": 37415 }, { "entropy": 5.482124757766724, "epoch": 3.3944121915820027, "grad_norm": 1.28125, "learning_rate": 0.0003874495575648391, "loss": 4.7737, "mean_token_accuracy": 0.22512744069099427, "num_tokens": 77645262.0, "step": 37420 }, { "entropy": 5.535907411575318, "epoch": 3.394865747460087, "grad_norm": 1.1953125, "learning_rate": 0.00038742153073385356, "loss": 4.9244, "mean_token_accuracy": 0.21343840211629866, "num_tokens": 77657647.0, "step": 37425 }, { "entropy": 5.5897904396057125, "epoch": 3.3953193033381712, "grad_norm": 1.15625, "learning_rate": 0.00038739350157796214, "loss": 4.8759, "mean_token_accuracy": 0.2206784799695015, "num_tokens": 77668074.0, "step": 37430 }, { "entropy": 5.605467653274536, "epoch": 3.3957728592162555, "grad_norm": 1.15625, "learning_rate": 0.00038736547009774445, "loss": 4.8326, "mean_token_accuracy": 0.22134194672107696, "num_tokens": 77678661.0, "step": 37435 }, { "entropy": 5.581776714324951, "epoch": 3.3962264150943398, "grad_norm": 1.25, "learning_rate": 0.0003873374362937803, "loss": 4.9551, "mean_token_accuracy": 0.2159433051943779, "num_tokens": 77689206.0, "step": 37440 }, { "entropy": 5.591617918014526, "epoch": 3.396679970972424, "grad_norm": 1.1796875, "learning_rate": 0.0003873094001666493, "loss": 4.9617, "mean_token_accuracy": 0.2202355980873108, "num_tokens": 77699254.0, "step": 37445 }, { "entropy": 5.5721673488616945, "epoch": 3.397133526850508, "grad_norm": 1.2734375, "learning_rate": 0.0003872813617169312, "loss": 4.8365, "mean_token_accuracy": 0.22925124317407608, "num_tokens": 77709595.0, "step": 37450 }, { "entropy": 5.51563835144043, "epoch": 3.397587082728592, "grad_norm": 1.15625, "learning_rate": 0.00038725332094520607, "loss": 4.8167, "mean_token_accuracy": 0.22312337756156922, "num_tokens": 77719446.0, "step": 37455 }, { "entropy": 5.5081305503845215, "epoch": 3.3980406386066764, "grad_norm": 1.4140625, "learning_rate": 0.0003872252778520536, "loss": 4.8306, "mean_token_accuracy": 0.232090000808239, "num_tokens": 77729723.0, "step": 37460 }, { "entropy": 5.552455759048462, "epoch": 3.3984941944847606, "grad_norm": 1.265625, "learning_rate": 0.0003871972324380537, "loss": 4.8464, "mean_token_accuracy": 0.21916398853063584, "num_tokens": 77739380.0, "step": 37465 }, { "entropy": 5.579446315765381, "epoch": 3.3989477503628445, "grad_norm": 1.2421875, "learning_rate": 0.0003871691847037865, "loss": 4.8909, "mean_token_accuracy": 0.2260361507534981, "num_tokens": 77750683.0, "step": 37470 }, { "entropy": 5.56347074508667, "epoch": 3.3994013062409287, "grad_norm": 1.1328125, "learning_rate": 0.00038714113464983205, "loss": 4.9467, "mean_token_accuracy": 0.20855045765638353, "num_tokens": 77761951.0, "step": 37475 }, { "entropy": 5.617277908325195, "epoch": 3.399854862119013, "grad_norm": 1.265625, "learning_rate": 0.0003871130822767702, "loss": 4.9206, "mean_token_accuracy": 0.220148266851902, "num_tokens": 77772165.0, "step": 37480 }, { "entropy": 5.624896669387818, "epoch": 3.4003084179970973, "grad_norm": 1.2578125, "learning_rate": 0.0003870850275851814, "loss": 4.9578, "mean_token_accuracy": 0.21392548829317093, "num_tokens": 77781916.0, "step": 37485 }, { "entropy": 5.565075254440307, "epoch": 3.4007619738751815, "grad_norm": 1.2890625, "learning_rate": 0.00038705697057564556, "loss": 4.8643, "mean_token_accuracy": 0.21626005470752716, "num_tokens": 77791397.0, "step": 37490 }, { "entropy": 5.505886840820312, "epoch": 3.401215529753266, "grad_norm": 1.265625, "learning_rate": 0.000387028911248743, "loss": 4.8249, "mean_token_accuracy": 0.2207539975643158, "num_tokens": 77801694.0, "step": 37495 }, { "entropy": 5.598957157135009, "epoch": 3.4016690856313496, "grad_norm": 1.3203125, "learning_rate": 0.00038700084960505414, "loss": 4.9293, "mean_token_accuracy": 0.2225702553987503, "num_tokens": 77813199.0, "step": 37500 }, { "entropy": 5.617013311386108, "epoch": 3.402122641509434, "grad_norm": 1.2578125, "learning_rate": 0.0003869727856451591, "loss": 4.9948, "mean_token_accuracy": 0.2159516230225563, "num_tokens": 77823689.0, "step": 37505 }, { "entropy": 5.574537229537964, "epoch": 3.402576197387518, "grad_norm": 1.1875, "learning_rate": 0.00038694471936963825, "loss": 4.8556, "mean_token_accuracy": 0.22915137112140654, "num_tokens": 77834331.0, "step": 37510 }, { "entropy": 5.563747930526733, "epoch": 3.4030297532656024, "grad_norm": 1.2890625, "learning_rate": 0.00038691665077907213, "loss": 4.8125, "mean_token_accuracy": 0.2187774121761322, "num_tokens": 77843988.0, "step": 37515 }, { "entropy": 5.526642894744873, "epoch": 3.4034833091436867, "grad_norm": 1.1953125, "learning_rate": 0.0003868885798740412, "loss": 4.8554, "mean_token_accuracy": 0.22213855087757112, "num_tokens": 77854553.0, "step": 37520 }, { "entropy": 5.5393883228302006, "epoch": 3.4039368650217705, "grad_norm": 1.234375, "learning_rate": 0.00038686050665512583, "loss": 4.8468, "mean_token_accuracy": 0.22345863580703734, "num_tokens": 77864629.0, "step": 37525 }, { "entropy": 5.581824684143067, "epoch": 3.4043904208998548, "grad_norm": 1.296875, "learning_rate": 0.00038683243112290673, "loss": 4.9579, "mean_token_accuracy": 0.21039967387914657, "num_tokens": 77875465.0, "step": 37530 }, { "entropy": 5.6146400451660154, "epoch": 3.404843976777939, "grad_norm": 1.1875, "learning_rate": 0.0003868043532779645, "loss": 4.8976, "mean_token_accuracy": 0.21607093662023544, "num_tokens": 77885337.0, "step": 37535 }, { "entropy": 5.581432151794433, "epoch": 3.4052975326560233, "grad_norm": 1.203125, "learning_rate": 0.00038677627312087967, "loss": 4.8594, "mean_token_accuracy": 0.22215999215841292, "num_tokens": 77896465.0, "step": 37540 }, { "entropy": 5.558106184005737, "epoch": 3.4057510885341076, "grad_norm": 1.296875, "learning_rate": 0.0003867481906522331, "loss": 4.9078, "mean_token_accuracy": 0.21435817033052446, "num_tokens": 77906214.0, "step": 37545 }, { "entropy": 5.594953823089599, "epoch": 3.4062046444121914, "grad_norm": 1.3046875, "learning_rate": 0.0003867201058726054, "loss": 5.0311, "mean_token_accuracy": 0.20812302827835083, "num_tokens": 77917466.0, "step": 37550 }, { "entropy": 5.659019613265992, "epoch": 3.4066582002902757, "grad_norm": 1.4296875, "learning_rate": 0.0003866920187825775, "loss": 4.9348, "mean_token_accuracy": 0.22146466225385666, "num_tokens": 77927648.0, "step": 37555 }, { "entropy": 5.524556493759155, "epoch": 3.40711175616836, "grad_norm": 1.203125, "learning_rate": 0.00038666392938273015, "loss": 4.798, "mean_token_accuracy": 0.22683977335691452, "num_tokens": 77938028.0, "step": 37560 }, { "entropy": 5.536692428588867, "epoch": 3.407565312046444, "grad_norm": 1.3203125, "learning_rate": 0.0003866358376736443, "loss": 4.8452, "mean_token_accuracy": 0.22351489663124086, "num_tokens": 77947276.0, "step": 37565 }, { "entropy": 5.610159635543823, "epoch": 3.4080188679245285, "grad_norm": 1.25, "learning_rate": 0.0003866077436559009, "loss": 4.9076, "mean_token_accuracy": 0.21851395964622497, "num_tokens": 77956791.0, "step": 37570 }, { "entropy": 5.611198234558105, "epoch": 3.4084724238026123, "grad_norm": 1.1328125, "learning_rate": 0.0003865796473300809, "loss": 4.899, "mean_token_accuracy": 0.21521719694137573, "num_tokens": 77967402.0, "step": 37575 }, { "entropy": 5.666193580627441, "epoch": 3.4089259796806965, "grad_norm": 1.21875, "learning_rate": 0.0003865515486967653, "loss": 4.9769, "mean_token_accuracy": 0.21833535730838777, "num_tokens": 77978000.0, "step": 37580 }, { "entropy": 5.547773170471191, "epoch": 3.409379535558781, "grad_norm": 1.3359375, "learning_rate": 0.00038652344775653535, "loss": 4.8153, "mean_token_accuracy": 0.22897100299596787, "num_tokens": 77987959.0, "step": 37585 }, { "entropy": 5.555764675140381, "epoch": 3.409833091436865, "grad_norm": 1.3359375, "learning_rate": 0.0003864953445099721, "loss": 4.8469, "mean_token_accuracy": 0.22847384512424468, "num_tokens": 77997990.0, "step": 37590 }, { "entropy": 5.566091299057007, "epoch": 3.4102866473149493, "grad_norm": 1.234375, "learning_rate": 0.00038646723895765654, "loss": 4.8923, "mean_token_accuracy": 0.21740319281816484, "num_tokens": 78008831.0, "step": 37595 }, { "entropy": 5.644970703125, "epoch": 3.4107402031930336, "grad_norm": 1.3515625, "learning_rate": 0.0003864391311001702, "loss": 4.9635, "mean_token_accuracy": 0.21596316248178482, "num_tokens": 78019338.0, "step": 37600 }, { "entropy": 5.652904987335205, "epoch": 3.4111937590711174, "grad_norm": 1.34375, "learning_rate": 0.0003864110209380942, "loss": 4.9514, "mean_token_accuracy": 0.2117679625749588, "num_tokens": 78030700.0, "step": 37605 }, { "entropy": 5.594487237930298, "epoch": 3.4116473149492017, "grad_norm": 1.296875, "learning_rate": 0.00038638290847200997, "loss": 4.8486, "mean_token_accuracy": 0.22827038317918777, "num_tokens": 78040190.0, "step": 37610 }, { "entropy": 5.549529981613159, "epoch": 3.412100870827286, "grad_norm": 1.234375, "learning_rate": 0.0003863547937024987, "loss": 4.8512, "mean_token_accuracy": 0.22790148705244065, "num_tokens": 78050847.0, "step": 37615 }, { "entropy": 5.634043979644775, "epoch": 3.4125544267053702, "grad_norm": 1.390625, "learning_rate": 0.000386326676630142, "loss": 4.8807, "mean_token_accuracy": 0.2265731394290924, "num_tokens": 78060584.0, "step": 37620 }, { "entropy": 5.517734384536743, "epoch": 3.413007982583454, "grad_norm": 1.2734375, "learning_rate": 0.0003862985572555212, "loss": 4.7832, "mean_token_accuracy": 0.22339124232530594, "num_tokens": 78071189.0, "step": 37625 }, { "entropy": 5.563355159759522, "epoch": 3.4134615384615383, "grad_norm": 1.1875, "learning_rate": 0.00038627043557921785, "loss": 4.8695, "mean_token_accuracy": 0.22120943665504456, "num_tokens": 78082054.0, "step": 37630 }, { "entropy": 5.517155981063842, "epoch": 3.4139150943396226, "grad_norm": 1.25, "learning_rate": 0.0003862423116018136, "loss": 4.836, "mean_token_accuracy": 0.21968642473220826, "num_tokens": 78094032.0, "step": 37635 }, { "entropy": 5.575125360488892, "epoch": 3.414368650217707, "grad_norm": 1.3359375, "learning_rate": 0.00038621418532389004, "loss": 4.8989, "mean_token_accuracy": 0.2173152193427086, "num_tokens": 78104724.0, "step": 37640 }, { "entropy": 5.623721122741699, "epoch": 3.414822206095791, "grad_norm": 1.3046875, "learning_rate": 0.00038618605674602867, "loss": 4.9593, "mean_token_accuracy": 0.21335508078336715, "num_tokens": 78115927.0, "step": 37645 }, { "entropy": 5.621487474441528, "epoch": 3.4152757619738754, "grad_norm": 1.3203125, "learning_rate": 0.00038615792586881145, "loss": 4.9217, "mean_token_accuracy": 0.22204871028661727, "num_tokens": 78126744.0, "step": 37650 }, { "entropy": 5.572717380523682, "epoch": 3.415729317851959, "grad_norm": 1.1640625, "learning_rate": 0.0003861297926928199, "loss": 4.8883, "mean_token_accuracy": 0.21774442195892335, "num_tokens": 78137625.0, "step": 37655 }, { "entropy": 5.48847131729126, "epoch": 3.4161828737300435, "grad_norm": 1.359375, "learning_rate": 0.0003861016572186359, "loss": 4.8222, "mean_token_accuracy": 0.22572675794363023, "num_tokens": 78147709.0, "step": 37660 }, { "entropy": 5.632107448577881, "epoch": 3.4166364296081277, "grad_norm": 1.265625, "learning_rate": 0.00038607351944684135, "loss": 5.0138, "mean_token_accuracy": 0.21770864874124526, "num_tokens": 78158634.0, "step": 37665 }, { "entropy": 5.679557657241821, "epoch": 3.417089985486212, "grad_norm": 1.203125, "learning_rate": 0.0003860453793780181, "loss": 4.9737, "mean_token_accuracy": 0.2137502446770668, "num_tokens": 78170279.0, "step": 37670 }, { "entropy": 5.640170001983643, "epoch": 3.417543541364296, "grad_norm": 1.3828125, "learning_rate": 0.00038601723701274813, "loss": 4.8931, "mean_token_accuracy": 0.22085128873586654, "num_tokens": 78180209.0, "step": 37675 }, { "entropy": 5.586086893081665, "epoch": 3.41799709724238, "grad_norm": 1.3125, "learning_rate": 0.0003859890923516134, "loss": 4.9259, "mean_token_accuracy": 0.21939034909009933, "num_tokens": 78189937.0, "step": 37680 }, { "entropy": 5.58044810295105, "epoch": 3.4184506531204644, "grad_norm": 1.3125, "learning_rate": 0.000385960945395196, "loss": 4.8735, "mean_token_accuracy": 0.221746926009655, "num_tokens": 78199224.0, "step": 37685 }, { "entropy": 5.585460042953491, "epoch": 3.4189042089985486, "grad_norm": 1.21875, "learning_rate": 0.0003859327961440779, "loss": 4.8215, "mean_token_accuracy": 0.22606613785028457, "num_tokens": 78209912.0, "step": 37690 }, { "entropy": 5.590497446060181, "epoch": 3.419357764876633, "grad_norm": 1.203125, "learning_rate": 0.00038590464459884133, "loss": 4.9191, "mean_token_accuracy": 0.2193215548992157, "num_tokens": 78220388.0, "step": 37695 }, { "entropy": 5.560060644149781, "epoch": 3.419811320754717, "grad_norm": 1.21875, "learning_rate": 0.00038587649076006844, "loss": 5.011, "mean_token_accuracy": 0.21287312507629394, "num_tokens": 78231094.0, "step": 37700 }, { "entropy": 5.577611637115479, "epoch": 3.420264876632801, "grad_norm": 1.296875, "learning_rate": 0.0003858483346283415, "loss": 4.8665, "mean_token_accuracy": 0.21670253574848175, "num_tokens": 78241111.0, "step": 37705 }, { "entropy": 5.659032154083252, "epoch": 3.4207184325108853, "grad_norm": 1.34375, "learning_rate": 0.0003858201762042428, "loss": 4.8699, "mean_token_accuracy": 0.22290827333927155, "num_tokens": 78251036.0, "step": 37710 }, { "entropy": 5.571799230575562, "epoch": 3.4211719883889695, "grad_norm": 1.1328125, "learning_rate": 0.0003857920154883545, "loss": 4.9061, "mean_token_accuracy": 0.21621798127889633, "num_tokens": 78261840.0, "step": 37715 }, { "entropy": 5.578745698928833, "epoch": 3.421625544267054, "grad_norm": 1.3203125, "learning_rate": 0.0003857638524812591, "loss": 4.8518, "mean_token_accuracy": 0.21958670914173126, "num_tokens": 78272539.0, "step": 37720 }, { "entropy": 5.627433252334595, "epoch": 3.422079100145138, "grad_norm": 1.046875, "learning_rate": 0.00038573568718353914, "loss": 4.8677, "mean_token_accuracy": 0.21954717636108398, "num_tokens": 78283849.0, "step": 37725 }, { "entropy": 5.612842702865601, "epoch": 3.422532656023222, "grad_norm": 1.25, "learning_rate": 0.0003857075195957768, "loss": 4.9045, "mean_token_accuracy": 0.22082866877317428, "num_tokens": 78293640.0, "step": 37730 }, { "entropy": 5.553917503356933, "epoch": 3.422986211901306, "grad_norm": 1.234375, "learning_rate": 0.0003856793497185548, "loss": 4.8784, "mean_token_accuracy": 0.22568700313568116, "num_tokens": 78303980.0, "step": 37735 }, { "entropy": 5.579537773132325, "epoch": 3.4234397677793904, "grad_norm": 1.140625, "learning_rate": 0.0003856511775524556, "loss": 4.8542, "mean_token_accuracy": 0.22009177207946778, "num_tokens": 78314233.0, "step": 37740 }, { "entropy": 5.616269063949585, "epoch": 3.4238933236574747, "grad_norm": 1.28125, "learning_rate": 0.00038562300309806193, "loss": 4.8836, "mean_token_accuracy": 0.22699591666460037, "num_tokens": 78324449.0, "step": 37745 }, { "entropy": 5.626227521896363, "epoch": 3.424346879535559, "grad_norm": 1.5234375, "learning_rate": 0.0003855948263559563, "loss": 4.873, "mean_token_accuracy": 0.22185973972082138, "num_tokens": 78334357.0, "step": 37750 }, { "entropy": 5.58059606552124, "epoch": 3.424800435413643, "grad_norm": 1.2890625, "learning_rate": 0.00038556664732672147, "loss": 4.8608, "mean_token_accuracy": 0.22304437309503555, "num_tokens": 78344221.0, "step": 37755 }, { "entropy": 5.553372812271118, "epoch": 3.425253991291727, "grad_norm": 1.2109375, "learning_rate": 0.00038553846601094033, "loss": 4.8233, "mean_token_accuracy": 0.2300659239292145, "num_tokens": 78354097.0, "step": 37760 }, { "entropy": 5.706850385665893, "epoch": 3.4257075471698113, "grad_norm": 1.3125, "learning_rate": 0.0003855102824091954, "loss": 4.9343, "mean_token_accuracy": 0.21903660297393798, "num_tokens": 78363797.0, "step": 37765 }, { "entropy": 5.607125377655029, "epoch": 3.4261611030478956, "grad_norm": 1.2890625, "learning_rate": 0.0003854820965220697, "loss": 4.871, "mean_token_accuracy": 0.21720145791769027, "num_tokens": 78374084.0, "step": 37770 }, { "entropy": 5.6068727493286135, "epoch": 3.42661465892598, "grad_norm": 1.171875, "learning_rate": 0.00038545390835014614, "loss": 4.8663, "mean_token_accuracy": 0.21819179654121398, "num_tokens": 78385346.0, "step": 37775 }, { "entropy": 5.547117233276367, "epoch": 3.4270682148040637, "grad_norm": 1.25, "learning_rate": 0.00038542571789400754, "loss": 4.8541, "mean_token_accuracy": 0.22410322427749635, "num_tokens": 78395498.0, "step": 37780 }, { "entropy": 5.533360290527344, "epoch": 3.427521770682148, "grad_norm": 1.2421875, "learning_rate": 0.00038539752515423704, "loss": 4.8444, "mean_token_accuracy": 0.2157760202884674, "num_tokens": 78405792.0, "step": 37785 }, { "entropy": 5.624130773544311, "epoch": 3.427975326560232, "grad_norm": 1.2890625, "learning_rate": 0.0003853693301314175, "loss": 4.928, "mean_token_accuracy": 0.21824511140584946, "num_tokens": 78415672.0, "step": 37790 }, { "entropy": 5.5702355861663815, "epoch": 3.4284288824383164, "grad_norm": 1.25, "learning_rate": 0.0003853411328261321, "loss": 4.8087, "mean_token_accuracy": 0.22396182864904404, "num_tokens": 78426937.0, "step": 37795 }, { "entropy": 5.566282939910889, "epoch": 3.4288824383164007, "grad_norm": 1.2734375, "learning_rate": 0.000385312933238964, "loss": 4.9088, "mean_token_accuracy": 0.22220931351184844, "num_tokens": 78436817.0, "step": 37800 }, { "entropy": 5.6230556011199955, "epoch": 3.429335994194485, "grad_norm": 1.3515625, "learning_rate": 0.0003852847313704963, "loss": 4.9587, "mean_token_accuracy": 0.22057377249002458, "num_tokens": 78447348.0, "step": 37805 }, { "entropy": 5.6190252780914305, "epoch": 3.429789550072569, "grad_norm": 1.2734375, "learning_rate": 0.0003852565272213123, "loss": 4.9195, "mean_token_accuracy": 0.22141849100589753, "num_tokens": 78457631.0, "step": 37810 }, { "entropy": 5.530671262741089, "epoch": 3.430243105950653, "grad_norm": 1.2578125, "learning_rate": 0.0003852283207919951, "loss": 4.8168, "mean_token_accuracy": 0.23200076669454575, "num_tokens": 78468542.0, "step": 37815 }, { "entropy": 5.620871829986572, "epoch": 3.4306966618287373, "grad_norm": 1.296875, "learning_rate": 0.0003852001120831282, "loss": 4.918, "mean_token_accuracy": 0.22305482029914855, "num_tokens": 78478580.0, "step": 37820 }, { "entropy": 5.631638479232788, "epoch": 3.4311502177068216, "grad_norm": 1.1953125, "learning_rate": 0.00038517190109529497, "loss": 4.8825, "mean_token_accuracy": 0.21819714605808258, "num_tokens": 78488477.0, "step": 37825 }, { "entropy": 5.624925756454468, "epoch": 3.4316037735849054, "grad_norm": 1.234375, "learning_rate": 0.00038514368782907864, "loss": 4.917, "mean_token_accuracy": 0.221673646569252, "num_tokens": 78498887.0, "step": 37830 }, { "entropy": 5.56370325088501, "epoch": 3.4320573294629897, "grad_norm": 1.1796875, "learning_rate": 0.00038511547228506284, "loss": 4.8358, "mean_token_accuracy": 0.2232913166284561, "num_tokens": 78509030.0, "step": 37835 }, { "entropy": 5.461496353149414, "epoch": 3.432510885341074, "grad_norm": 1.28125, "learning_rate": 0.00038508725446383097, "loss": 4.775, "mean_token_accuracy": 0.23104398101568221, "num_tokens": 78518254.0, "step": 37840 }, { "entropy": 5.59017596244812, "epoch": 3.4329644412191582, "grad_norm": 1.28125, "learning_rate": 0.0003850590343659667, "loss": 4.8637, "mean_token_accuracy": 0.22207069844007493, "num_tokens": 78527966.0, "step": 37845 }, { "entropy": 5.630570125579834, "epoch": 3.4334179970972425, "grad_norm": 1.265625, "learning_rate": 0.00038503081199205353, "loss": 4.9442, "mean_token_accuracy": 0.21948488056659698, "num_tokens": 78537932.0, "step": 37850 }, { "entropy": 5.642708730697632, "epoch": 3.4338715529753268, "grad_norm": 1.2109375, "learning_rate": 0.00038500258734267505, "loss": 4.9807, "mean_token_accuracy": 0.21760938465595245, "num_tokens": 78549213.0, "step": 37855 }, { "entropy": 5.543390798568725, "epoch": 3.4343251088534106, "grad_norm": 1.2109375, "learning_rate": 0.00038497436041841517, "loss": 4.8209, "mean_token_accuracy": 0.21856172382831573, "num_tokens": 78558990.0, "step": 37860 }, { "entropy": 5.5828773975372314, "epoch": 3.434778664731495, "grad_norm": 1.2265625, "learning_rate": 0.00038494613121985735, "loss": 4.9247, "mean_token_accuracy": 0.21493295431137086, "num_tokens": 78568496.0, "step": 37865 }, { "entropy": 5.588915109634399, "epoch": 3.435232220609579, "grad_norm": 1.3984375, "learning_rate": 0.0003849178997475856, "loss": 4.7844, "mean_token_accuracy": 0.23063721060752868, "num_tokens": 78578386.0, "step": 37870 }, { "entropy": 5.509966039657593, "epoch": 3.4356857764876634, "grad_norm": 1.34375, "learning_rate": 0.00038488966600218365, "loss": 4.8125, "mean_token_accuracy": 0.22878154516220092, "num_tokens": 78588855.0, "step": 37875 }, { "entropy": 5.495119667053222, "epoch": 3.4361393323657476, "grad_norm": 1.34375, "learning_rate": 0.00038486142998423535, "loss": 4.7574, "mean_token_accuracy": 0.2312979981303215, "num_tokens": 78599573.0, "step": 37880 }, { "entropy": 5.617792463302612, "epoch": 3.4365928882438315, "grad_norm": 1.2421875, "learning_rate": 0.0003848331916943248, "loss": 4.9111, "mean_token_accuracy": 0.22138137370347977, "num_tokens": 78609793.0, "step": 37885 }, { "entropy": 5.5148101329803465, "epoch": 3.4370464441219157, "grad_norm": 1.234375, "learning_rate": 0.0003848049511330358, "loss": 4.8346, "mean_token_accuracy": 0.22339835911989211, "num_tokens": 78619637.0, "step": 37890 }, { "entropy": 5.638696765899658, "epoch": 3.4375, "grad_norm": 1.328125, "learning_rate": 0.0003847767083009525, "loss": 4.907, "mean_token_accuracy": 0.229443359375, "num_tokens": 78629889.0, "step": 37895 }, { "entropy": 5.546358728408814, "epoch": 3.4379535558780843, "grad_norm": 1.2578125, "learning_rate": 0.00038474846319865876, "loss": 4.8367, "mean_token_accuracy": 0.22491746693849562, "num_tokens": 78639853.0, "step": 37900 }, { "entropy": 5.579529285430908, "epoch": 3.4384071117561685, "grad_norm": 1.2734375, "learning_rate": 0.0003847202158267389, "loss": 4.8172, "mean_token_accuracy": 0.22443247586488724, "num_tokens": 78649732.0, "step": 37905 }, { "entropy": 5.473654317855835, "epoch": 3.4388606676342524, "grad_norm": 1.296875, "learning_rate": 0.00038469196618577694, "loss": 4.7827, "mean_token_accuracy": 0.22584399282932283, "num_tokens": 78659794.0, "step": 37910 }, { "entropy": 5.644205713272095, "epoch": 3.4393142235123366, "grad_norm": 1.296875, "learning_rate": 0.0003846637142763573, "loss": 4.9685, "mean_token_accuracy": 0.21565909683704376, "num_tokens": 78670526.0, "step": 37915 }, { "entropy": 5.602915811538696, "epoch": 3.439767779390421, "grad_norm": 1.21875, "learning_rate": 0.000384635460099064, "loss": 4.8687, "mean_token_accuracy": 0.22212835103273393, "num_tokens": 78680177.0, "step": 37920 }, { "entropy": 5.634299993515015, "epoch": 3.440221335268505, "grad_norm": 1.1796875, "learning_rate": 0.00038460720365448154, "loss": 5.029, "mean_token_accuracy": 0.20938150733709335, "num_tokens": 78690958.0, "step": 37925 }, { "entropy": 5.625418996810913, "epoch": 3.4406748911465894, "grad_norm": 1.3046875, "learning_rate": 0.0003845789449431941, "loss": 4.9012, "mean_token_accuracy": 0.2142394870519638, "num_tokens": 78700904.0, "step": 37930 }, { "entropy": 5.6607897758483885, "epoch": 3.4411284470246732, "grad_norm": 1.1953125, "learning_rate": 0.0003845506839657862, "loss": 4.9577, "mean_token_accuracy": 0.21944146156311034, "num_tokens": 78712085.0, "step": 37935 }, { "entropy": 5.528128385543823, "epoch": 3.4415820029027575, "grad_norm": 1.296875, "learning_rate": 0.0003845224207228422, "loss": 4.8492, "mean_token_accuracy": 0.22611829787492752, "num_tokens": 78722161.0, "step": 37940 }, { "entropy": 5.650383949279785, "epoch": 3.4420355587808418, "grad_norm": 1.203125, "learning_rate": 0.00038449415521494667, "loss": 4.8764, "mean_token_accuracy": 0.21643019914627076, "num_tokens": 78732485.0, "step": 37945 }, { "entropy": 5.557985591888428, "epoch": 3.442489114658926, "grad_norm": 1.265625, "learning_rate": 0.0003844658874426841, "loss": 4.8922, "mean_token_accuracy": 0.2184637576341629, "num_tokens": 78744564.0, "step": 37950 }, { "entropy": 5.566000080108642, "epoch": 3.4429426705370103, "grad_norm": 1.2109375, "learning_rate": 0.000384437617406639, "loss": 4.8755, "mean_token_accuracy": 0.2239830657839775, "num_tokens": 78755227.0, "step": 37955 }, { "entropy": 5.573590230941773, "epoch": 3.4433962264150946, "grad_norm": 1.2578125, "learning_rate": 0.0003844093451073962, "loss": 4.8653, "mean_token_accuracy": 0.21312370002269745, "num_tokens": 78765393.0, "step": 37960 }, { "entropy": 5.600601005554199, "epoch": 3.4438497822931784, "grad_norm": 1.265625, "learning_rate": 0.00038438107054554027, "loss": 4.8505, "mean_token_accuracy": 0.22546310871839523, "num_tokens": 78775587.0, "step": 37965 }, { "entropy": 5.567040491104126, "epoch": 3.4443033381712627, "grad_norm": 1.34375, "learning_rate": 0.0003843527937216558, "loss": 4.7975, "mean_token_accuracy": 0.23344036787748337, "num_tokens": 78785098.0, "step": 37970 }, { "entropy": 5.537916278839111, "epoch": 3.444756894049347, "grad_norm": 1.2890625, "learning_rate": 0.0003843245146363278, "loss": 4.8274, "mean_token_accuracy": 0.22525506168603898, "num_tokens": 78795348.0, "step": 37975 }, { "entropy": 5.6354875564575195, "epoch": 3.445210449927431, "grad_norm": 1.2890625, "learning_rate": 0.00038429623329014096, "loss": 4.9728, "mean_token_accuracy": 0.2171437367796898, "num_tokens": 78805348.0, "step": 37980 }, { "entropy": 5.49457483291626, "epoch": 3.445664005805515, "grad_norm": 1.21875, "learning_rate": 0.00038426794968368015, "loss": 4.8069, "mean_token_accuracy": 0.2231268599629402, "num_tokens": 78814765.0, "step": 37985 }, { "entropy": 5.604942321777344, "epoch": 3.4461175616835993, "grad_norm": 1.359375, "learning_rate": 0.0003842396638175303, "loss": 4.8483, "mean_token_accuracy": 0.2237356498837471, "num_tokens": 78824745.0, "step": 37990 }, { "entropy": 5.5691405773162845, "epoch": 3.4465711175616836, "grad_norm": 1.2578125, "learning_rate": 0.0003842113756922763, "loss": 4.9247, "mean_token_accuracy": 0.2210797533392906, "num_tokens": 78835101.0, "step": 37995 }, { "entropy": 5.642512321472168, "epoch": 3.447024673439768, "grad_norm": 1.1875, "learning_rate": 0.00038418308530850333, "loss": 4.963, "mean_token_accuracy": 0.2100715458393097, "num_tokens": 78845881.0, "step": 38000 }, { "entropy": 5.605302476882935, "epoch": 3.447478229317852, "grad_norm": 1.1640625, "learning_rate": 0.00038415479266679624, "loss": 4.8999, "mean_token_accuracy": 0.21887559890747071, "num_tokens": 78856536.0, "step": 38005 }, { "entropy": 5.593984651565552, "epoch": 3.4479317851959363, "grad_norm": 1.2578125, "learning_rate": 0.0003841264977677403, "loss": 4.8706, "mean_token_accuracy": 0.22260956913232804, "num_tokens": 78866887.0, "step": 38010 }, { "entropy": 5.566642379760742, "epoch": 3.44838534107402, "grad_norm": 1.1484375, "learning_rate": 0.00038409820061192045, "loss": 4.894, "mean_token_accuracy": 0.22510103285312652, "num_tokens": 78877032.0, "step": 38015 }, { "entropy": 5.542991304397583, "epoch": 3.4488388969521044, "grad_norm": 1.3203125, "learning_rate": 0.00038406990119992215, "loss": 4.8431, "mean_token_accuracy": 0.23045724034309387, "num_tokens": 78887237.0, "step": 38020 }, { "entropy": 5.474837970733643, "epoch": 3.4492924528301887, "grad_norm": 1.21875, "learning_rate": 0.00038404159953233047, "loss": 4.7955, "mean_token_accuracy": 0.23510887622833251, "num_tokens": 78897436.0, "step": 38025 }, { "entropy": 5.587875747680664, "epoch": 3.449746008708273, "grad_norm": 1.1875, "learning_rate": 0.0003840132956097307, "loss": 4.8777, "mean_token_accuracy": 0.21943197250366211, "num_tokens": 78907691.0, "step": 38030 }, { "entropy": 5.586595821380615, "epoch": 3.450199564586357, "grad_norm": 1.2890625, "learning_rate": 0.00038398498943270816, "loss": 4.9103, "mean_token_accuracy": 0.22054661363363265, "num_tokens": 78917517.0, "step": 38035 }, { "entropy": 5.662408018112183, "epoch": 3.450653120464441, "grad_norm": 1.1953125, "learning_rate": 0.0003839566810018483, "loss": 4.8682, "mean_token_accuracy": 0.22155400663614272, "num_tokens": 78927835.0, "step": 38040 }, { "entropy": 5.560951900482178, "epoch": 3.4511066763425253, "grad_norm": 1.265625, "learning_rate": 0.00038392837031773656, "loss": 4.7987, "mean_token_accuracy": 0.225715933740139, "num_tokens": 78938853.0, "step": 38045 }, { "entropy": 5.555013132095337, "epoch": 3.4515602322206096, "grad_norm": 1.2109375, "learning_rate": 0.0003839000573809583, "loss": 4.8486, "mean_token_accuracy": 0.233382685482502, "num_tokens": 78948508.0, "step": 38050 }, { "entropy": 5.595494604110717, "epoch": 3.452013788098694, "grad_norm": 1.3515625, "learning_rate": 0.00038387174219209916, "loss": 4.8602, "mean_token_accuracy": 0.22643874287605287, "num_tokens": 78959002.0, "step": 38055 }, { "entropy": 5.587902450561524, "epoch": 3.452467343976778, "grad_norm": 1.234375, "learning_rate": 0.0003838434247517446, "loss": 4.8572, "mean_token_accuracy": 0.2246174231171608, "num_tokens": 78970358.0, "step": 38060 }, { "entropy": 5.578626871109009, "epoch": 3.452920899854862, "grad_norm": 1.3671875, "learning_rate": 0.0003838151050604803, "loss": 4.8033, "mean_token_accuracy": 0.2319348856806755, "num_tokens": 78979408.0, "step": 38065 }, { "entropy": 5.477584505081177, "epoch": 3.453374455732946, "grad_norm": 1.1328125, "learning_rate": 0.00038378678311889184, "loss": 4.8176, "mean_token_accuracy": 0.2304510295391083, "num_tokens": 78990411.0, "step": 38070 }, { "entropy": 5.5676275253295895, "epoch": 3.4538280116110305, "grad_norm": 1.2421875, "learning_rate": 0.000383758458927565, "loss": 4.9396, "mean_token_accuracy": 0.22198909223079683, "num_tokens": 79001734.0, "step": 38075 }, { "entropy": 5.6270896911621096, "epoch": 3.4542815674891147, "grad_norm": 1.359375, "learning_rate": 0.0003837301324870856, "loss": 4.8034, "mean_token_accuracy": 0.22631442546844482, "num_tokens": 79011381.0, "step": 38080 }, { "entropy": 5.635945129394531, "epoch": 3.454735123367199, "grad_norm": 1.2109375, "learning_rate": 0.00038370180379803927, "loss": 4.9312, "mean_token_accuracy": 0.22044396996498108, "num_tokens": 79021124.0, "step": 38085 }, { "entropy": 5.6172760963439945, "epoch": 3.455188679245283, "grad_norm": 1.21875, "learning_rate": 0.00038367347286101197, "loss": 4.9936, "mean_token_accuracy": 0.20363245159387589, "num_tokens": 79033105.0, "step": 38090 }, { "entropy": 5.578976345062256, "epoch": 3.455642235123367, "grad_norm": 1.21875, "learning_rate": 0.0003836451396765896, "loss": 4.909, "mean_token_accuracy": 0.21669618487358094, "num_tokens": 79043458.0, "step": 38095 }, { "entropy": 5.59036922454834, "epoch": 3.4560957910014514, "grad_norm": 1.109375, "learning_rate": 0.00038361680424535795, "loss": 4.8833, "mean_token_accuracy": 0.22429827153682708, "num_tokens": 79055186.0, "step": 38100 }, { "entropy": 5.606384181976319, "epoch": 3.4565493468795356, "grad_norm": 1.1953125, "learning_rate": 0.0003835884665679032, "loss": 4.9104, "mean_token_accuracy": 0.2200383499264717, "num_tokens": 79065743.0, "step": 38105 }, { "entropy": 5.603261709213257, "epoch": 3.45700290275762, "grad_norm": 1.15625, "learning_rate": 0.0003835601266448112, "loss": 4.9641, "mean_token_accuracy": 0.2131814643740654, "num_tokens": 79077285.0, "step": 38110 }, { "entropy": 5.606313705444336, "epoch": 3.457456458635704, "grad_norm": 1.203125, "learning_rate": 0.0003835317844766682, "loss": 4.8867, "mean_token_accuracy": 0.22218118011951446, "num_tokens": 79087885.0, "step": 38115 }, { "entropy": 5.627710962295533, "epoch": 3.457910014513788, "grad_norm": 1.1875, "learning_rate": 0.00038350344006406016, "loss": 4.9273, "mean_token_accuracy": 0.22139535546302797, "num_tokens": 79097907.0, "step": 38120 }, { "entropy": 5.654132223129272, "epoch": 3.4583635703918723, "grad_norm": 1.2890625, "learning_rate": 0.00038347509340757343, "loss": 4.9798, "mean_token_accuracy": 0.2136502295732498, "num_tokens": 79108478.0, "step": 38125 }, { "entropy": 5.628736686706543, "epoch": 3.4588171262699565, "grad_norm": 1.28125, "learning_rate": 0.0003834467445077941, "loss": 4.9057, "mean_token_accuracy": 0.21378462463617326, "num_tokens": 79117988.0, "step": 38130 }, { "entropy": 5.669226789474488, "epoch": 3.459270682148041, "grad_norm": 1.1953125, "learning_rate": 0.0003834183933653084, "loss": 4.916, "mean_token_accuracy": 0.22349207997322082, "num_tokens": 79127786.0, "step": 38135 }, { "entropy": 5.593431615829468, "epoch": 3.4597242380261246, "grad_norm": 1.1875, "learning_rate": 0.0003833900399807027, "loss": 4.842, "mean_token_accuracy": 0.22651919573545456, "num_tokens": 79137775.0, "step": 38140 }, { "entropy": 5.505549335479737, "epoch": 3.460177793904209, "grad_norm": 1.5703125, "learning_rate": 0.00038336168435456345, "loss": 4.8109, "mean_token_accuracy": 0.22458068430423736, "num_tokens": 79147803.0, "step": 38145 }, { "entropy": 5.47860369682312, "epoch": 3.460631349782293, "grad_norm": 1.1796875, "learning_rate": 0.00038333332648747684, "loss": 4.8012, "mean_token_accuracy": 0.22418748885393142, "num_tokens": 79158377.0, "step": 38150 }, { "entropy": 5.548859930038452, "epoch": 3.4610849056603774, "grad_norm": 1.171875, "learning_rate": 0.0003833049663800295, "loss": 4.8818, "mean_token_accuracy": 0.22145052552223204, "num_tokens": 79168514.0, "step": 38155 }, { "entropy": 5.617284965515137, "epoch": 3.4615384615384617, "grad_norm": 1.3515625, "learning_rate": 0.0003832766040328078, "loss": 4.985, "mean_token_accuracy": 0.21048517376184464, "num_tokens": 79177588.0, "step": 38160 }, { "entropy": 5.56250376701355, "epoch": 3.461992017416546, "grad_norm": 1.3203125, "learning_rate": 0.0003832482394463984, "loss": 4.8482, "mean_token_accuracy": 0.22323570251464844, "num_tokens": 79188128.0, "step": 38165 }, { "entropy": 5.518023681640625, "epoch": 3.4624455732946298, "grad_norm": 1.1875, "learning_rate": 0.0003832198726213878, "loss": 4.8279, "mean_token_accuracy": 0.2263498768210411, "num_tokens": 79198928.0, "step": 38170 }, { "entropy": 5.503010988235474, "epoch": 3.462899129172714, "grad_norm": 1.1875, "learning_rate": 0.00038319150355836266, "loss": 4.8024, "mean_token_accuracy": 0.23240560442209243, "num_tokens": 79209751.0, "step": 38175 }, { "entropy": 5.583473825454712, "epoch": 3.4633526850507983, "grad_norm": 1.203125, "learning_rate": 0.00038316313225790965, "loss": 4.9263, "mean_token_accuracy": 0.21401432901620865, "num_tokens": 79220210.0, "step": 38180 }, { "entropy": 5.5621545791625975, "epoch": 3.4638062409288826, "grad_norm": 1.1875, "learning_rate": 0.0003831347587206155, "loss": 4.909, "mean_token_accuracy": 0.22388985455036164, "num_tokens": 79231530.0, "step": 38185 }, { "entropy": 5.545995473861694, "epoch": 3.4642597968069664, "grad_norm": 1.1875, "learning_rate": 0.000383106382947067, "loss": 4.8364, "mean_token_accuracy": 0.22009781002998352, "num_tokens": 79242771.0, "step": 38190 }, { "entropy": 5.57250075340271, "epoch": 3.4647133526850507, "grad_norm": 1.1875, "learning_rate": 0.00038307800493785093, "loss": 4.8263, "mean_token_accuracy": 0.22681186348199844, "num_tokens": 79253713.0, "step": 38195 }, { "entropy": 5.59170560836792, "epoch": 3.465166908563135, "grad_norm": 1.1875, "learning_rate": 0.00038304962469355415, "loss": 4.9206, "mean_token_accuracy": 0.2186089351773262, "num_tokens": 79264087.0, "step": 38200 }, { "entropy": 5.5950604438781735, "epoch": 3.465620464441219, "grad_norm": 1.265625, "learning_rate": 0.0003830212422147637, "loss": 4.8867, "mean_token_accuracy": 0.22162627726793288, "num_tokens": 79274859.0, "step": 38205 }, { "entropy": 5.571768474578858, "epoch": 3.4660740203193035, "grad_norm": 1.2578125, "learning_rate": 0.0003829928575020663, "loss": 4.9171, "mean_token_accuracy": 0.22423165142536164, "num_tokens": 79284778.0, "step": 38210 }, { "entropy": 5.580922985076905, "epoch": 3.4665275761973877, "grad_norm": 1.21875, "learning_rate": 0.00038296447055604916, "loss": 4.9162, "mean_token_accuracy": 0.21261829733848572, "num_tokens": 79295034.0, "step": 38215 }, { "entropy": 5.540123224258423, "epoch": 3.4669811320754715, "grad_norm": 1.2109375, "learning_rate": 0.0003829360813772992, "loss": 4.8184, "mean_token_accuracy": 0.22912162095308303, "num_tokens": 79306013.0, "step": 38220 }, { "entropy": 5.597008752822876, "epoch": 3.467434687953556, "grad_norm": 1.125, "learning_rate": 0.00038290768996640366, "loss": 4.9667, "mean_token_accuracy": 0.21307953745126723, "num_tokens": 79317590.0, "step": 38225 }, { "entropy": 5.631895065307617, "epoch": 3.46788824383164, "grad_norm": 1.140625, "learning_rate": 0.00038287929632394957, "loss": 4.9136, "mean_token_accuracy": 0.21645509749650954, "num_tokens": 79328669.0, "step": 38230 }, { "entropy": 5.48932991027832, "epoch": 3.4683417997097243, "grad_norm": 1.2265625, "learning_rate": 0.0003828509004505241, "loss": 4.8101, "mean_token_accuracy": 0.23281917572021485, "num_tokens": 79339336.0, "step": 38235 }, { "entropy": 5.617661046981811, "epoch": 3.4687953555878086, "grad_norm": 1.296875, "learning_rate": 0.0003828225023467146, "loss": 4.9225, "mean_token_accuracy": 0.2166643723845482, "num_tokens": 79350199.0, "step": 38240 }, { "entropy": 5.589135026931762, "epoch": 3.4692489114658924, "grad_norm": 1.2265625, "learning_rate": 0.0003827941020131082, "loss": 4.8541, "mean_token_accuracy": 0.2314881831407547, "num_tokens": 79359906.0, "step": 38245 }, { "entropy": 5.531719541549682, "epoch": 3.4697024673439767, "grad_norm": 1.2265625, "learning_rate": 0.00038276569945029225, "loss": 4.8051, "mean_token_accuracy": 0.22069131433963776, "num_tokens": 79371395.0, "step": 38250 }, { "entropy": 5.5622820377349855, "epoch": 3.470156023222061, "grad_norm": 1.2265625, "learning_rate": 0.0003827372946588543, "loss": 4.8714, "mean_token_accuracy": 0.22540852427482605, "num_tokens": 79381808.0, "step": 38255 }, { "entropy": 5.547688817977905, "epoch": 3.4706095791001452, "grad_norm": 1.1953125, "learning_rate": 0.0003827088876393816, "loss": 4.8763, "mean_token_accuracy": 0.22239598482847214, "num_tokens": 79391906.0, "step": 38260 }, { "entropy": 5.544122982025146, "epoch": 3.4710631349782295, "grad_norm": 1.34375, "learning_rate": 0.00038268047839246165, "loss": 4.8222, "mean_token_accuracy": 0.22709712386131287, "num_tokens": 79402522.0, "step": 38265 }, { "entropy": 5.492143249511718, "epoch": 3.4715166908563133, "grad_norm": 1.265625, "learning_rate": 0.00038265206691868195, "loss": 4.7942, "mean_token_accuracy": 0.22038724273443222, "num_tokens": 79412751.0, "step": 38270 }, { "entropy": 5.6408251285552975, "epoch": 3.4719702467343976, "grad_norm": 1.2421875, "learning_rate": 0.0003826236532186301, "loss": 4.9675, "mean_token_accuracy": 0.2184956356883049, "num_tokens": 79424512.0, "step": 38275 }, { "entropy": 5.740165424346924, "epoch": 3.472423802612482, "grad_norm": 1.3671875, "learning_rate": 0.0003825952372928936, "loss": 5.0491, "mean_token_accuracy": 0.2086956486105919, "num_tokens": 79434082.0, "step": 38280 }, { "entropy": 5.620924043655395, "epoch": 3.472877358490566, "grad_norm": 1.234375, "learning_rate": 0.00038256681914206026, "loss": 4.8698, "mean_token_accuracy": 0.22047431915998458, "num_tokens": 79444469.0, "step": 38285 }, { "entropy": 5.5147374153137205, "epoch": 3.4733309143686504, "grad_norm": 1.3359375, "learning_rate": 0.00038253839876671765, "loss": 4.8797, "mean_token_accuracy": 0.2194928213953972, "num_tokens": 79455036.0, "step": 38290 }, { "entropy": 5.583739233016968, "epoch": 3.473784470246734, "grad_norm": 1.1953125, "learning_rate": 0.0003825099761674535, "loss": 4.8637, "mean_token_accuracy": 0.21832606494426726, "num_tokens": 79464600.0, "step": 38295 }, { "entropy": 5.601495456695557, "epoch": 3.4742380261248185, "grad_norm": 1.15625, "learning_rate": 0.0003824815513448558, "loss": 4.9103, "mean_token_accuracy": 0.22018514424562455, "num_tokens": 79474912.0, "step": 38300 }, { "entropy": 5.488470649719238, "epoch": 3.4746915820029027, "grad_norm": 1.3046875, "learning_rate": 0.00038245312429951214, "loss": 4.7555, "mean_token_accuracy": 0.22767754793167114, "num_tokens": 79485283.0, "step": 38305 }, { "entropy": 5.462492227554321, "epoch": 3.475145137880987, "grad_norm": 1.3359375, "learning_rate": 0.0003824246950320105, "loss": 4.7493, "mean_token_accuracy": 0.2249643862247467, "num_tokens": 79495323.0, "step": 38310 }, { "entropy": 5.563406753540039, "epoch": 3.4755986937590713, "grad_norm": 1.296875, "learning_rate": 0.0003823962635429388, "loss": 4.9122, "mean_token_accuracy": 0.22347124814987182, "num_tokens": 79505144.0, "step": 38315 }, { "entropy": 5.606898546218872, "epoch": 3.4760522496371555, "grad_norm": 1.203125, "learning_rate": 0.0003823678298328849, "loss": 4.934, "mean_token_accuracy": 0.21643825769424438, "num_tokens": 79515402.0, "step": 38320 }, { "entropy": 5.572846460342407, "epoch": 3.4765058055152394, "grad_norm": 1.3359375, "learning_rate": 0.00038233939390243697, "loss": 4.8099, "mean_token_accuracy": 0.23493856489658355, "num_tokens": 79525528.0, "step": 38325 }, { "entropy": 5.606199645996094, "epoch": 3.4769593613933236, "grad_norm": 1.296875, "learning_rate": 0.00038231095575218303, "loss": 4.9019, "mean_token_accuracy": 0.22247189283370972, "num_tokens": 79535991.0, "step": 38330 }, { "entropy": 5.621145486831665, "epoch": 3.477412917271408, "grad_norm": 1.2578125, "learning_rate": 0.0003822825153827112, "loss": 4.9254, "mean_token_accuracy": 0.2143198609352112, "num_tokens": 79545890.0, "step": 38335 }, { "entropy": 5.595956087112427, "epoch": 3.477866473149492, "grad_norm": 1.2578125, "learning_rate": 0.00038225407279460964, "loss": 4.9213, "mean_token_accuracy": 0.22014188021421432, "num_tokens": 79556363.0, "step": 38340 }, { "entropy": 5.583060693740845, "epoch": 3.478320029027576, "grad_norm": 1.3125, "learning_rate": 0.0003822256279884665, "loss": 4.888, "mean_token_accuracy": 0.2177642896771431, "num_tokens": 79566924.0, "step": 38345 }, { "entropy": 5.548189449310303, "epoch": 3.4787735849056602, "grad_norm": 1.296875, "learning_rate": 0.00038219718096487007, "loss": 4.8731, "mean_token_accuracy": 0.21998017728328706, "num_tokens": 79577322.0, "step": 38350 }, { "entropy": 5.674130153656006, "epoch": 3.4792271407837445, "grad_norm": 1.25, "learning_rate": 0.00038216873172440855, "loss": 4.9874, "mean_token_accuracy": 0.2106102079153061, "num_tokens": 79588436.0, "step": 38355 }, { "entropy": 5.647344350814819, "epoch": 3.4796806966618288, "grad_norm": 1.140625, "learning_rate": 0.0003821402802676704, "loss": 4.9099, "mean_token_accuracy": 0.2200780153274536, "num_tokens": 79599015.0, "step": 38360 }, { "entropy": 5.555490970611572, "epoch": 3.480134252539913, "grad_norm": 1.375, "learning_rate": 0.0003821118265952439, "loss": 4.8513, "mean_token_accuracy": 0.2311486467719078, "num_tokens": 79608443.0, "step": 38365 }, { "entropy": 5.504388904571533, "epoch": 3.4805878084179973, "grad_norm": 1.4375, "learning_rate": 0.0003820833707077176, "loss": 4.856, "mean_token_accuracy": 0.218905708193779, "num_tokens": 79619010.0, "step": 38370 }, { "entropy": 5.624173259735107, "epoch": 3.481041364296081, "grad_norm": 1.265625, "learning_rate": 0.0003820549126056799, "loss": 4.8992, "mean_token_accuracy": 0.21930173933506011, "num_tokens": 79629665.0, "step": 38375 }, { "entropy": 5.5009589195251465, "epoch": 3.4814949201741654, "grad_norm": 1.1875, "learning_rate": 0.0003820264522897193, "loss": 4.7606, "mean_token_accuracy": 0.23094146847724914, "num_tokens": 79640578.0, "step": 38380 }, { "entropy": 5.60428524017334, "epoch": 3.4819484760522497, "grad_norm": 1.2890625, "learning_rate": 0.0003819979897604243, "loss": 4.8633, "mean_token_accuracy": 0.21523242592811584, "num_tokens": 79649576.0, "step": 38385 }, { "entropy": 5.584999370574951, "epoch": 3.482402031930334, "grad_norm": 1.25, "learning_rate": 0.00038196952501838376, "loss": 4.898, "mean_token_accuracy": 0.21202096790075303, "num_tokens": 79659926.0, "step": 38390 }, { "entropy": 5.650516319274902, "epoch": 3.4828555878084178, "grad_norm": 1.3671875, "learning_rate": 0.00038194105806418617, "loss": 5.0133, "mean_token_accuracy": 0.21183135658502578, "num_tokens": 79669969.0, "step": 38395 }, { "entropy": 5.572910785675049, "epoch": 3.483309143686502, "grad_norm": 1.3515625, "learning_rate": 0.0003819125888984202, "loss": 4.82, "mean_token_accuracy": 0.22524684220552443, "num_tokens": 79679706.0, "step": 38400 }, { "entropy": 5.535404014587402, "epoch": 3.4837626995645863, "grad_norm": 1.1484375, "learning_rate": 0.00038188411752167466, "loss": 4.8578, "mean_token_accuracy": 0.22157871276140212, "num_tokens": 79691543.0, "step": 38405 }, { "entropy": 5.579240036010742, "epoch": 3.4842162554426706, "grad_norm": 1.1484375, "learning_rate": 0.0003818556439345383, "loss": 4.8904, "mean_token_accuracy": 0.22293858379125595, "num_tokens": 79701657.0, "step": 38410 }, { "entropy": 5.557514190673828, "epoch": 3.484669811320755, "grad_norm": 1.1640625, "learning_rate": 0.00038182716813760004, "loss": 4.8943, "mean_token_accuracy": 0.22366421520709992, "num_tokens": 79711615.0, "step": 38415 }, { "entropy": 5.608257389068603, "epoch": 3.485123367198839, "grad_norm": 1.2421875, "learning_rate": 0.0003817986901314487, "loss": 4.9095, "mean_token_accuracy": 0.22644211798906327, "num_tokens": 79721427.0, "step": 38420 }, { "entropy": 5.589441585540771, "epoch": 3.485576923076923, "grad_norm": 1.203125, "learning_rate": 0.0003817702099166732, "loss": 4.9085, "mean_token_accuracy": 0.22616522908210754, "num_tokens": 79732565.0, "step": 38425 }, { "entropy": 5.515077304840088, "epoch": 3.486030478955007, "grad_norm": 1.078125, "learning_rate": 0.0003817417274938626, "loss": 4.7445, "mean_token_accuracy": 0.23268060982227326, "num_tokens": 79744496.0, "step": 38430 }, { "entropy": 5.572480154037476, "epoch": 3.4864840348330914, "grad_norm": 1.2578125, "learning_rate": 0.0003817132428636058, "loss": 4.9527, "mean_token_accuracy": 0.21835279315710068, "num_tokens": 79755626.0, "step": 38435 }, { "entropy": 5.575641202926636, "epoch": 3.4869375907111757, "grad_norm": 1.1875, "learning_rate": 0.00038168475602649203, "loss": 4.8979, "mean_token_accuracy": 0.22059637755155564, "num_tokens": 79765447.0, "step": 38440 }, { "entropy": 5.58689250946045, "epoch": 3.48739114658926, "grad_norm": 1.203125, "learning_rate": 0.0003816562669831103, "loss": 4.881, "mean_token_accuracy": 0.21754232048988342, "num_tokens": 79776047.0, "step": 38445 }, { "entropy": 5.567230367660523, "epoch": 3.487844702467344, "grad_norm": 1.1796875, "learning_rate": 0.00038162777573404975, "loss": 4.849, "mean_token_accuracy": 0.22663322687149048, "num_tokens": 79786061.0, "step": 38450 }, { "entropy": 5.538536500930786, "epoch": 3.488298258345428, "grad_norm": 1.3125, "learning_rate": 0.00038159928227989964, "loss": 4.9018, "mean_token_accuracy": 0.21942832171916962, "num_tokens": 79796844.0, "step": 38455 }, { "entropy": 5.562500858306885, "epoch": 3.4887518142235123, "grad_norm": 1.203125, "learning_rate": 0.0003815707866212493, "loss": 4.854, "mean_token_accuracy": 0.2302628129720688, "num_tokens": 79808120.0, "step": 38460 }, { "entropy": 5.59022798538208, "epoch": 3.4892053701015966, "grad_norm": 1.2578125, "learning_rate": 0.0003815422887586878, "loss": 4.8751, "mean_token_accuracy": 0.22848547846078873, "num_tokens": 79818901.0, "step": 38465 }, { "entropy": 5.639407777786255, "epoch": 3.489658925979681, "grad_norm": 1.21875, "learning_rate": 0.0003815137886928047, "loss": 4.9141, "mean_token_accuracy": 0.21581187844276428, "num_tokens": 79829090.0, "step": 38470 }, { "entropy": 5.669987392425537, "epoch": 3.490112481857765, "grad_norm": 1.3125, "learning_rate": 0.0003814852864241892, "loss": 4.9094, "mean_token_accuracy": 0.22077712863683702, "num_tokens": 79838751.0, "step": 38475 }, { "entropy": 5.528832674026489, "epoch": 3.490566037735849, "grad_norm": 1.2421875, "learning_rate": 0.00038145678195343095, "loss": 4.9728, "mean_token_accuracy": 0.2150067061185837, "num_tokens": 79849410.0, "step": 38480 }, { "entropy": 5.652285194396972, "epoch": 3.491019593613933, "grad_norm": 1.1796875, "learning_rate": 0.0003814282752811193, "loss": 4.9172, "mean_token_accuracy": 0.21702227145433425, "num_tokens": 79859279.0, "step": 38485 }, { "entropy": 5.651129150390625, "epoch": 3.4914731494920175, "grad_norm": 1.109375, "learning_rate": 0.0003813997664078438, "loss": 4.8424, "mean_token_accuracy": 0.22598513662815095, "num_tokens": 79869535.0, "step": 38490 }, { "entropy": 5.6297143459320065, "epoch": 3.4919267053701017, "grad_norm": 1.25, "learning_rate": 0.00038137125533419403, "loss": 5.0174, "mean_token_accuracy": 0.20284934639930724, "num_tokens": 79881396.0, "step": 38495 }, { "entropy": 5.556525993347168, "epoch": 3.4923802612481856, "grad_norm": 1.21875, "learning_rate": 0.0003813427420607596, "loss": 4.836, "mean_token_accuracy": 0.21439954936504363, "num_tokens": 79891250.0, "step": 38500 }, { "entropy": 5.5284528732299805, "epoch": 3.49283381712627, "grad_norm": 1.1796875, "learning_rate": 0.00038131422658813004, "loss": 4.8212, "mean_token_accuracy": 0.22004528045654298, "num_tokens": 79901982.0, "step": 38505 }, { "entropy": 5.554597616195679, "epoch": 3.493287373004354, "grad_norm": 1.234375, "learning_rate": 0.00038128570891689527, "loss": 4.9435, "mean_token_accuracy": 0.21771818548440933, "num_tokens": 79912480.0, "step": 38510 }, { "entropy": 5.586081266403198, "epoch": 3.4937409288824384, "grad_norm": 1.1484375, "learning_rate": 0.000381257189047645, "loss": 4.8948, "mean_token_accuracy": 0.22716558426618577, "num_tokens": 79923793.0, "step": 38515 }, { "entropy": 5.605240392684936, "epoch": 3.4941944847605226, "grad_norm": 1.296875, "learning_rate": 0.00038122866698096894, "loss": 4.903, "mean_token_accuracy": 0.21741262972354888, "num_tokens": 79933858.0, "step": 38520 }, { "entropy": 5.649842691421509, "epoch": 3.494648040638607, "grad_norm": 1.21875, "learning_rate": 0.00038120014271745693, "loss": 4.9285, "mean_token_accuracy": 0.22017600536346435, "num_tokens": 79944093.0, "step": 38525 }, { "entropy": 5.610756826400757, "epoch": 3.4951015965166907, "grad_norm": 1.2890625, "learning_rate": 0.000381171616257699, "loss": 4.9093, "mean_token_accuracy": 0.21904992163181305, "num_tokens": 79955072.0, "step": 38530 }, { "entropy": 5.607961654663086, "epoch": 3.495555152394775, "grad_norm": 1.15625, "learning_rate": 0.00038114308760228493, "loss": 4.8936, "mean_token_accuracy": 0.2190464735031128, "num_tokens": 79966949.0, "step": 38535 }, { "entropy": 5.5506988048553465, "epoch": 3.4960087082728593, "grad_norm": 1.171875, "learning_rate": 0.0003811145567518048, "loss": 4.8524, "mean_token_accuracy": 0.2186318576335907, "num_tokens": 79977109.0, "step": 38540 }, { "entropy": 5.638629341125489, "epoch": 3.4964622641509435, "grad_norm": 1.21875, "learning_rate": 0.00038108602370684854, "loss": 4.913, "mean_token_accuracy": 0.21931980401277543, "num_tokens": 79987094.0, "step": 38545 }, { "entropy": 5.606905603408814, "epoch": 3.4969158200290273, "grad_norm": 1.34375, "learning_rate": 0.0003810574884680063, "loss": 4.9805, "mean_token_accuracy": 0.2213740736246109, "num_tokens": 79997503.0, "step": 38550 }, { "entropy": 5.5754317283630375, "epoch": 3.4973693759071116, "grad_norm": 1.34375, "learning_rate": 0.00038102895103586817, "loss": 4.8975, "mean_token_accuracy": 0.21907483041286469, "num_tokens": 80007745.0, "step": 38555 }, { "entropy": 5.6276535987854, "epoch": 3.497822931785196, "grad_norm": 1.1015625, "learning_rate": 0.0003810004114110243, "loss": 4.9086, "mean_token_accuracy": 0.21386051028966904, "num_tokens": 80019330.0, "step": 38560 }, { "entropy": 5.585355663299561, "epoch": 3.49827648766328, "grad_norm": 1.265625, "learning_rate": 0.0003809718695940649, "loss": 4.9279, "mean_token_accuracy": 0.2204200565814972, "num_tokens": 80029732.0, "step": 38565 }, { "entropy": 5.547657489776611, "epoch": 3.4987300435413644, "grad_norm": 1.21875, "learning_rate": 0.0003809433255855803, "loss": 4.79, "mean_token_accuracy": 0.22486642450094224, "num_tokens": 80041052.0, "step": 38570 }, { "entropy": 5.590043783187866, "epoch": 3.4991835994194487, "grad_norm": 1.2109375, "learning_rate": 0.00038091477938616075, "loss": 4.9117, "mean_token_accuracy": 0.222893887758255, "num_tokens": 80051929.0, "step": 38575 }, { "entropy": 5.625316953659057, "epoch": 3.4996371552975325, "grad_norm": 1.3203125, "learning_rate": 0.00038088623099639653, "loss": 4.96, "mean_token_accuracy": 0.21340042352676392, "num_tokens": 80061153.0, "step": 38580 }, { "entropy": 5.570801448822022, "epoch": 3.5000907111756168, "grad_norm": 1.2265625, "learning_rate": 0.000380857680416878, "loss": 4.8728, "mean_token_accuracy": 0.22102087140083312, "num_tokens": 80070560.0, "step": 38585 }, { "entropy": 5.713388442993164, "epoch": 3.500544267053701, "grad_norm": 1.234375, "learning_rate": 0.0003808291276481957, "loss": 4.9223, "mean_token_accuracy": 0.21835293024778366, "num_tokens": 80081141.0, "step": 38590 }, { "entropy": 5.5361510753631595, "epoch": 3.5009978229317853, "grad_norm": 1.1640625, "learning_rate": 0.0003808005726909401, "loss": 4.8051, "mean_token_accuracy": 0.2279229462146759, "num_tokens": 80092114.0, "step": 38595 }, { "entropy": 5.521596431732178, "epoch": 3.501451378809869, "grad_norm": 1.203125, "learning_rate": 0.00038077201554570175, "loss": 4.8306, "mean_token_accuracy": 0.23021965771913527, "num_tokens": 80101966.0, "step": 38600 }, { "entropy": 5.650166177749634, "epoch": 3.5019049346879534, "grad_norm": 1.109375, "learning_rate": 0.0003807434562130711, "loss": 4.984, "mean_token_accuracy": 0.2238600254058838, "num_tokens": 80113420.0, "step": 38605 }, { "entropy": 5.573134088516236, "epoch": 3.5023584905660377, "grad_norm": 1.21875, "learning_rate": 0.0003807148946936387, "loss": 4.911, "mean_token_accuracy": 0.21818079203367233, "num_tokens": 80123398.0, "step": 38610 }, { "entropy": 5.580202293395996, "epoch": 3.502812046444122, "grad_norm": 1.1875, "learning_rate": 0.0003806863309879956, "loss": 4.8495, "mean_token_accuracy": 0.22924806773662568, "num_tokens": 80133885.0, "step": 38615 }, { "entropy": 5.535071659088135, "epoch": 3.503265602322206, "grad_norm": 1.15625, "learning_rate": 0.0003806577650967321, "loss": 4.7868, "mean_token_accuracy": 0.24213505983352662, "num_tokens": 80144168.0, "step": 38620 }, { "entropy": 5.5498871326446535, "epoch": 3.5037191582002905, "grad_norm": 1.203125, "learning_rate": 0.0003806291970204391, "loss": 4.8644, "mean_token_accuracy": 0.22394380271434783, "num_tokens": 80153956.0, "step": 38625 }, { "entropy": 5.630527353286743, "epoch": 3.5041727140783747, "grad_norm": 1.2734375, "learning_rate": 0.00038060062675970743, "loss": 4.926, "mean_token_accuracy": 0.21100822538137437, "num_tokens": 80163617.0, "step": 38630 }, { "entropy": 5.567703485488892, "epoch": 3.5046262699564585, "grad_norm": 1.1953125, "learning_rate": 0.0003805720543151278, "loss": 4.823, "mean_token_accuracy": 0.22542985081672667, "num_tokens": 80174049.0, "step": 38635 }, { "entropy": 5.629847574234009, "epoch": 3.505079825834543, "grad_norm": 1.234375, "learning_rate": 0.0003805434796872912, "loss": 4.9133, "mean_token_accuracy": 0.219144606590271, "num_tokens": 80185043.0, "step": 38640 }, { "entropy": 5.529052495956421, "epoch": 3.505533381712627, "grad_norm": 1.3203125, "learning_rate": 0.00038051490287678856, "loss": 4.8618, "mean_token_accuracy": 0.22410847395658492, "num_tokens": 80194810.0, "step": 38645 }, { "entropy": 5.533047246932983, "epoch": 3.5059869375907113, "grad_norm": 1.453125, "learning_rate": 0.0003804863238842109, "loss": 4.854, "mean_token_accuracy": 0.227314855158329, "num_tokens": 80204861.0, "step": 38650 }, { "entropy": 5.582651567459107, "epoch": 3.506440493468795, "grad_norm": 1.328125, "learning_rate": 0.0003804577427101491, "loss": 4.7835, "mean_token_accuracy": 0.22975051999092103, "num_tokens": 80214447.0, "step": 38655 }, { "entropy": 5.545746326446533, "epoch": 3.5068940493468794, "grad_norm": 1.2578125, "learning_rate": 0.0003804291593551944, "loss": 4.8125, "mean_token_accuracy": 0.2260776773095131, "num_tokens": 80224213.0, "step": 38660 }, { "entropy": 5.594546556472778, "epoch": 3.5073476052249637, "grad_norm": 1.234375, "learning_rate": 0.0003804005738199377, "loss": 4.8837, "mean_token_accuracy": 0.22270173728466033, "num_tokens": 80234161.0, "step": 38665 }, { "entropy": 5.5904776096344, "epoch": 3.507801161103048, "grad_norm": 1.3828125, "learning_rate": 0.00038037198610497037, "loss": 4.8638, "mean_token_accuracy": 0.21857569068670274, "num_tokens": 80243788.0, "step": 38670 }, { "entropy": 5.599396705627441, "epoch": 3.5082547169811322, "grad_norm": 1.234375, "learning_rate": 0.0003803433962108835, "loss": 4.8851, "mean_token_accuracy": 0.22369408905506133, "num_tokens": 80254658.0, "step": 38675 }, { "entropy": 5.618504190444947, "epoch": 3.5087082728592165, "grad_norm": 1.265625, "learning_rate": 0.0003803148041382683, "loss": 4.8907, "mean_token_accuracy": 0.22115891426801682, "num_tokens": 80264820.0, "step": 38680 }, { "entropy": 5.49139552116394, "epoch": 3.5091618287373003, "grad_norm": 1.1484375, "learning_rate": 0.00038028620988771617, "loss": 4.7995, "mean_token_accuracy": 0.22857493460178374, "num_tokens": 80274639.0, "step": 38685 }, { "entropy": 5.528353595733643, "epoch": 3.5096153846153846, "grad_norm": 1.2734375, "learning_rate": 0.0003802576134598183, "loss": 4.843, "mean_token_accuracy": 0.22858888506889344, "num_tokens": 80284542.0, "step": 38690 }, { "entropy": 5.539374780654907, "epoch": 3.510068940493469, "grad_norm": 1.3515625, "learning_rate": 0.00038022901485516625, "loss": 4.8213, "mean_token_accuracy": 0.22647523880004883, "num_tokens": 80294405.0, "step": 38695 }, { "entropy": 5.583394145965576, "epoch": 3.510522496371553, "grad_norm": 1.1328125, "learning_rate": 0.00038020041407435133, "loss": 4.8393, "mean_token_accuracy": 0.22299689203500747, "num_tokens": 80305326.0, "step": 38700 }, { "entropy": 5.544467449188232, "epoch": 3.510976052249637, "grad_norm": 1.328125, "learning_rate": 0.00038017181111796506, "loss": 4.874, "mean_token_accuracy": 0.22173336148262024, "num_tokens": 80315423.0, "step": 38705 }, { "entropy": 5.5622800350189205, "epoch": 3.511429608127721, "grad_norm": 1.3203125, "learning_rate": 0.0003801432059865989, "loss": 4.9065, "mean_token_accuracy": 0.21991646587848662, "num_tokens": 80325372.0, "step": 38710 }, { "entropy": 5.579424285888672, "epoch": 3.5118831640058055, "grad_norm": 1.15625, "learning_rate": 0.00038011459868084446, "loss": 4.7864, "mean_token_accuracy": 0.22271990329027175, "num_tokens": 80335467.0, "step": 38715 }, { "entropy": 5.5865997791290285, "epoch": 3.5123367198838897, "grad_norm": 1.3125, "learning_rate": 0.0003800859892012933, "loss": 4.9068, "mean_token_accuracy": 0.21876744776964188, "num_tokens": 80345420.0, "step": 38720 }, { "entropy": 5.557285737991333, "epoch": 3.512790275761974, "grad_norm": 1.375, "learning_rate": 0.0003800573775485372, "loss": 4.8784, "mean_token_accuracy": 0.22895897030830384, "num_tokens": 80354369.0, "step": 38725 }, { "entropy": 5.59940357208252, "epoch": 3.5132438316400583, "grad_norm": 1.3828125, "learning_rate": 0.00038002876372316774, "loss": 4.9435, "mean_token_accuracy": 0.21917159706354142, "num_tokens": 80365292.0, "step": 38730 }, { "entropy": 5.601279973983765, "epoch": 3.513697387518142, "grad_norm": 1.265625, "learning_rate": 0.00038000014772577657, "loss": 4.891, "mean_token_accuracy": 0.22118531316518783, "num_tokens": 80376340.0, "step": 38735 }, { "entropy": 5.519328165054321, "epoch": 3.5141509433962264, "grad_norm": 1.2109375, "learning_rate": 0.0003799715295569557, "loss": 4.8404, "mean_token_accuracy": 0.22184036076068878, "num_tokens": 80386193.0, "step": 38740 }, { "entropy": 5.70469913482666, "epoch": 3.5146044992743106, "grad_norm": 1.3359375, "learning_rate": 0.0003799429092172968, "loss": 5.0415, "mean_token_accuracy": 0.21426361948251724, "num_tokens": 80397055.0, "step": 38745 }, { "entropy": 5.626441287994385, "epoch": 3.515058055152395, "grad_norm": 1.265625, "learning_rate": 0.0003799142867073918, "loss": 4.9411, "mean_token_accuracy": 0.2166975885629654, "num_tokens": 80407375.0, "step": 38750 }, { "entropy": 5.624079942703247, "epoch": 3.5155116110304787, "grad_norm": 1.2578125, "learning_rate": 0.00037988566202783256, "loss": 4.9447, "mean_token_accuracy": 0.21558694094419478, "num_tokens": 80417942.0, "step": 38755 }, { "entropy": 5.529418563842773, "epoch": 3.515965166908563, "grad_norm": 1.1796875, "learning_rate": 0.0003798570351792112, "loss": 4.786, "mean_token_accuracy": 0.22493006587028502, "num_tokens": 80428716.0, "step": 38760 }, { "entropy": 5.569956970214844, "epoch": 3.5164187227866472, "grad_norm": 1.265625, "learning_rate": 0.00037982840616211964, "loss": 4.9273, "mean_token_accuracy": 0.22145590782165528, "num_tokens": 80439688.0, "step": 38765 }, { "entropy": 5.647992324829102, "epoch": 3.5168722786647315, "grad_norm": 1.3203125, "learning_rate": 0.00037979977497714984, "loss": 4.9259, "mean_token_accuracy": 0.21624843180179595, "num_tokens": 80450434.0, "step": 38770 }, { "entropy": 5.605155372619629, "epoch": 3.5173258345428158, "grad_norm": 1.1796875, "learning_rate": 0.00037977114162489404, "loss": 4.9522, "mean_token_accuracy": 0.21331779211759566, "num_tokens": 80462187.0, "step": 38775 }, { "entropy": 5.56873083114624, "epoch": 3.5177793904209, "grad_norm": 1.1328125, "learning_rate": 0.0003797425061059443, "loss": 4.8403, "mean_token_accuracy": 0.22241857796907424, "num_tokens": 80473049.0, "step": 38780 }, { "entropy": 5.542993831634521, "epoch": 3.5182329462989843, "grad_norm": 1.1953125, "learning_rate": 0.00037971386842089287, "loss": 4.8375, "mean_token_accuracy": 0.2269691303372383, "num_tokens": 80484119.0, "step": 38785 }, { "entropy": 5.531101179122925, "epoch": 3.518686502177068, "grad_norm": 1.1796875, "learning_rate": 0.0003796852285703319, "loss": 4.7749, "mean_token_accuracy": 0.2306852385401726, "num_tokens": 80494882.0, "step": 38790 }, { "entropy": 5.594499921798706, "epoch": 3.5191400580551524, "grad_norm": 1.203125, "learning_rate": 0.0003796565865548538, "loss": 4.9096, "mean_token_accuracy": 0.22860032469034194, "num_tokens": 80505362.0, "step": 38795 }, { "entropy": 5.595897674560547, "epoch": 3.5195936139332367, "grad_norm": 1.2265625, "learning_rate": 0.0003796279423750508, "loss": 4.9287, "mean_token_accuracy": 0.2137245550751686, "num_tokens": 80516027.0, "step": 38800 }, { "entropy": 5.645077514648437, "epoch": 3.5200471698113205, "grad_norm": 1.4296875, "learning_rate": 0.0003795992960315153, "loss": 4.9271, "mean_token_accuracy": 0.21933257281780244, "num_tokens": 80527045.0, "step": 38805 }, { "entropy": 5.566857433319091, "epoch": 3.5205007256894048, "grad_norm": 1.1953125, "learning_rate": 0.00037957064752483966, "loss": 4.7917, "mean_token_accuracy": 0.23683036267757415, "num_tokens": 80537373.0, "step": 38810 }, { "entropy": 5.517697381973266, "epoch": 3.520954281567489, "grad_norm": 1.359375, "learning_rate": 0.0003795419968556164, "loss": 4.8649, "mean_token_accuracy": 0.21873768419027328, "num_tokens": 80546632.0, "step": 38815 }, { "entropy": 5.542700242996216, "epoch": 3.5214078374455733, "grad_norm": 1.171875, "learning_rate": 0.0003795133440244381, "loss": 4.8273, "mean_token_accuracy": 0.22546139508485794, "num_tokens": 80556694.0, "step": 38820 }, { "entropy": 5.609101724624634, "epoch": 3.5218613933236576, "grad_norm": 1.3046875, "learning_rate": 0.0003794846890318971, "loss": 4.9366, "mean_token_accuracy": 0.21590420454740525, "num_tokens": 80567834.0, "step": 38825 }, { "entropy": 5.606833124160767, "epoch": 3.522314949201742, "grad_norm": 1.2734375, "learning_rate": 0.0003794560318785861, "loss": 4.8702, "mean_token_accuracy": 0.22537576854228974, "num_tokens": 80578299.0, "step": 38830 }, { "entropy": 5.5998069763183596, "epoch": 3.522768505079826, "grad_norm": 1.2265625, "learning_rate": 0.00037942737256509786, "loss": 4.9018, "mean_token_accuracy": 0.21864100247621537, "num_tokens": 80588620.0, "step": 38835 }, { "entropy": 5.705990600585937, "epoch": 3.52322206095791, "grad_norm": 1.265625, "learning_rate": 0.0003793987110920248, "loss": 5.0556, "mean_token_accuracy": 0.21080234199762343, "num_tokens": 80599076.0, "step": 38840 }, { "entropy": 5.649797105789185, "epoch": 3.523675616835994, "grad_norm": 1.25, "learning_rate": 0.00037937004745995987, "loss": 4.9863, "mean_token_accuracy": 0.21303995996713637, "num_tokens": 80609440.0, "step": 38845 }, { "entropy": 5.705781888961792, "epoch": 3.5241291727140784, "grad_norm": 1.2578125, "learning_rate": 0.0003793413816694957, "loss": 4.9674, "mean_token_accuracy": 0.21472978889942168, "num_tokens": 80619169.0, "step": 38850 }, { "entropy": 5.56747407913208, "epoch": 3.5245827285921627, "grad_norm": 1.3125, "learning_rate": 0.0003793127137212252, "loss": 4.8225, "mean_token_accuracy": 0.22456487119197846, "num_tokens": 80628719.0, "step": 38855 }, { "entropy": 5.6235559463500975, "epoch": 3.5250362844702465, "grad_norm": 1.3828125, "learning_rate": 0.00037928404361574125, "loss": 4.862, "mean_token_accuracy": 0.2197541505098343, "num_tokens": 80638391.0, "step": 38860 }, { "entropy": 5.602475166320801, "epoch": 3.525489840348331, "grad_norm": 1.3515625, "learning_rate": 0.0003792553713536367, "loss": 4.941, "mean_token_accuracy": 0.21766994744539261, "num_tokens": 80647720.0, "step": 38865 }, { "entropy": 5.518101644515991, "epoch": 3.525943396226415, "grad_norm": 1.1640625, "learning_rate": 0.0003792266969355044, "loss": 4.8493, "mean_token_accuracy": 0.22654558718204498, "num_tokens": 80658841.0, "step": 38870 }, { "entropy": 5.581154870986938, "epoch": 3.5263969521044993, "grad_norm": 1.3828125, "learning_rate": 0.00037919802036193753, "loss": 4.8894, "mean_token_accuracy": 0.22155964225530625, "num_tokens": 80668735.0, "step": 38875 }, { "entropy": 5.609885358810425, "epoch": 3.5268505079825836, "grad_norm": 1.2578125, "learning_rate": 0.00037916934163352903, "loss": 4.8486, "mean_token_accuracy": 0.22482971101999283, "num_tokens": 80680757.0, "step": 38880 }, { "entropy": 5.559836530685425, "epoch": 3.527304063860668, "grad_norm": 1.3515625, "learning_rate": 0.000379140660750872, "loss": 4.8316, "mean_token_accuracy": 0.224076047539711, "num_tokens": 80689833.0, "step": 38885 }, { "entropy": 5.536722183227539, "epoch": 3.5277576197387517, "grad_norm": 1.203125, "learning_rate": 0.0003791119777145595, "loss": 4.8161, "mean_token_accuracy": 0.22633997052907945, "num_tokens": 80700347.0, "step": 38890 }, { "entropy": 5.498111248016357, "epoch": 3.528211175616836, "grad_norm": 1.1875, "learning_rate": 0.0003790832925251849, "loss": 4.7287, "mean_token_accuracy": 0.23608938604593277, "num_tokens": 80710559.0, "step": 38895 }, { "entropy": 5.591253995895386, "epoch": 3.52866473149492, "grad_norm": 1.3828125, "learning_rate": 0.0003790546051833412, "loss": 4.9263, "mean_token_accuracy": 0.22009024471044542, "num_tokens": 80720805.0, "step": 38900 }, { "entropy": 5.608805704116821, "epoch": 3.5291182873730045, "grad_norm": 1.234375, "learning_rate": 0.0003790259156896217, "loss": 4.9426, "mean_token_accuracy": 0.2055571362376213, "num_tokens": 80730937.0, "step": 38905 }, { "entropy": 5.579081678390503, "epoch": 3.5295718432510883, "grad_norm": 1.3515625, "learning_rate": 0.00037899722404461983, "loss": 4.9071, "mean_token_accuracy": 0.22347204983234406, "num_tokens": 80741597.0, "step": 38910 }, { "entropy": 5.600455713272095, "epoch": 3.5300253991291726, "grad_norm": 1.1796875, "learning_rate": 0.0003789685302489289, "loss": 4.894, "mean_token_accuracy": 0.21452593952417373, "num_tokens": 80752496.0, "step": 38915 }, { "entropy": 5.629484367370606, "epoch": 3.530478955007257, "grad_norm": 1.21875, "learning_rate": 0.00037893983430314226, "loss": 4.868, "mean_token_accuracy": 0.21937715113162995, "num_tokens": 80762329.0, "step": 38920 }, { "entropy": 5.5722349166870115, "epoch": 3.530932510885341, "grad_norm": 1.2578125, "learning_rate": 0.00037891113620785327, "loss": 4.9618, "mean_token_accuracy": 0.21556684374809265, "num_tokens": 80773152.0, "step": 38925 }, { "entropy": 5.5604596614837645, "epoch": 3.5313860667634254, "grad_norm": 1.203125, "learning_rate": 0.00037888243596365557, "loss": 4.8833, "mean_token_accuracy": 0.22231341004371644, "num_tokens": 80783502.0, "step": 38930 }, { "entropy": 5.610735130310059, "epoch": 3.5318396226415096, "grad_norm": 1.28125, "learning_rate": 0.00037885373357114265, "loss": 4.8062, "mean_token_accuracy": 0.2228667914867401, "num_tokens": 80792644.0, "step": 38935 }, { "entropy": 5.5927187442779545, "epoch": 3.5322931785195935, "grad_norm": 1.2109375, "learning_rate": 0.000378825029030908, "loss": 4.9348, "mean_token_accuracy": 0.2176352322101593, "num_tokens": 80803184.0, "step": 38940 }, { "entropy": 5.563448762893676, "epoch": 3.5327467343976777, "grad_norm": 1.25, "learning_rate": 0.0003787963223435453, "loss": 4.8809, "mean_token_accuracy": 0.21825526654720306, "num_tokens": 80813353.0, "step": 38945 }, { "entropy": 5.592575979232788, "epoch": 3.533200290275762, "grad_norm": 1.3671875, "learning_rate": 0.0003787676135096482, "loss": 4.9485, "mean_token_accuracy": 0.21718582212924958, "num_tokens": 80824663.0, "step": 38950 }, { "entropy": 5.6945765018463135, "epoch": 3.5336538461538463, "grad_norm": 1.1484375, "learning_rate": 0.0003787389025298104, "loss": 5.0028, "mean_token_accuracy": 0.212713360786438, "num_tokens": 80835507.0, "step": 38955 }, { "entropy": 5.622861766815186, "epoch": 3.53410740203193, "grad_norm": 1.25, "learning_rate": 0.0003787101894046257, "loss": 4.8147, "mean_token_accuracy": 0.23465158492326738, "num_tokens": 80845035.0, "step": 38960 }, { "entropy": 5.579658031463623, "epoch": 3.5345609579100143, "grad_norm": 1.2734375, "learning_rate": 0.00037868147413468785, "loss": 4.8532, "mean_token_accuracy": 0.21917715966701506, "num_tokens": 80854992.0, "step": 38965 }, { "entropy": 5.630315256118775, "epoch": 3.5350145137880986, "grad_norm": 1.3515625, "learning_rate": 0.0003786527567205907, "loss": 4.9847, "mean_token_accuracy": 0.20633552521467208, "num_tokens": 80864658.0, "step": 38970 }, { "entropy": 5.642623662948608, "epoch": 3.535468069666183, "grad_norm": 1.2734375, "learning_rate": 0.00037862403716292805, "loss": 4.8635, "mean_token_accuracy": 0.22229874581098558, "num_tokens": 80873964.0, "step": 38975 }, { "entropy": 5.61938099861145, "epoch": 3.535921625544267, "grad_norm": 1.2265625, "learning_rate": 0.00037859531546229405, "loss": 4.9224, "mean_token_accuracy": 0.21652499437332154, "num_tokens": 80883752.0, "step": 38980 }, { "entropy": 5.620621061325073, "epoch": 3.5363751814223514, "grad_norm": 1.171875, "learning_rate": 0.0003785665916192824, "loss": 4.9021, "mean_token_accuracy": 0.2172365143895149, "num_tokens": 80894265.0, "step": 38985 }, { "entropy": 5.532026481628418, "epoch": 3.5368287373004357, "grad_norm": 1.28125, "learning_rate": 0.00037853786563448724, "loss": 4.8248, "mean_token_accuracy": 0.22571807652711867, "num_tokens": 80904246.0, "step": 38990 }, { "entropy": 5.590527009963989, "epoch": 3.5372822931785195, "grad_norm": 1.296875, "learning_rate": 0.0003785091375085027, "loss": 4.8956, "mean_token_accuracy": 0.2155577853322029, "num_tokens": 80913595.0, "step": 38995 }, { "entropy": 5.562059497833252, "epoch": 3.5377358490566038, "grad_norm": 1.15625, "learning_rate": 0.0003784804072419228, "loss": 4.876, "mean_token_accuracy": 0.2178777351975441, "num_tokens": 80924754.0, "step": 39000 }, { "epoch": 3.5377358490566038, "eval_entropy": 5.314401951958152, "eval_loss": 4.957967281341553, "eval_mean_token_accuracy": 0.22618731720819732, "eval_num_tokens": 80924754.0, "eval_runtime": 20.8055, "eval_samples_per_second": 1699.549, "eval_steps_per_second": 212.444, "step": 39000 }, { "entropy": 5.548458003997803, "epoch": 3.538189404934688, "grad_norm": 1.25, "learning_rate": 0.0003784516748353417, "loss": 4.8232, "mean_token_accuracy": 0.22716688066720964, "num_tokens": 80935318.0, "step": 39005 }, { "entropy": 5.582900905609131, "epoch": 3.5386429608127723, "grad_norm": 1.3203125, "learning_rate": 0.0003784229402893536, "loss": 4.9401, "mean_token_accuracy": 0.21798910349607467, "num_tokens": 80944886.0, "step": 39010 }, { "entropy": 5.59848313331604, "epoch": 3.539096516690856, "grad_norm": 1.28125, "learning_rate": 0.0003783942036045528, "loss": 4.9025, "mean_token_accuracy": 0.2172340616583824, "num_tokens": 80955566.0, "step": 39015 }, { "entropy": 5.625179147720337, "epoch": 3.5395500725689404, "grad_norm": 1.2578125, "learning_rate": 0.00037836546478153344, "loss": 4.9483, "mean_token_accuracy": 0.21408702731132506, "num_tokens": 80965285.0, "step": 39020 }, { "entropy": 5.51876015663147, "epoch": 3.5400036284470247, "grad_norm": 1.203125, "learning_rate": 0.0003783367238208899, "loss": 4.8526, "mean_token_accuracy": 0.2283048927783966, "num_tokens": 80976402.0, "step": 39025 }, { "entropy": 5.615394449234008, "epoch": 3.540457184325109, "grad_norm": 1.2890625, "learning_rate": 0.00037830798072321665, "loss": 4.9536, "mean_token_accuracy": 0.21808362007141113, "num_tokens": 80988408.0, "step": 39030 }, { "entropy": 5.641329431533814, "epoch": 3.540910740203193, "grad_norm": 1.28125, "learning_rate": 0.00037827923548910806, "loss": 4.8834, "mean_token_accuracy": 0.2174405038356781, "num_tokens": 80999099.0, "step": 39035 }, { "entropy": 5.579897785186768, "epoch": 3.5413642960812775, "grad_norm": 1.3359375, "learning_rate": 0.00037825048811915854, "loss": 4.783, "mean_token_accuracy": 0.23029969185590743, "num_tokens": 81009350.0, "step": 39040 }, { "entropy": 5.514993667602539, "epoch": 3.5418178519593613, "grad_norm": 1.2421875, "learning_rate": 0.00037822173861396256, "loss": 4.783, "mean_token_accuracy": 0.22419554591178895, "num_tokens": 81019851.0, "step": 39045 }, { "entropy": 5.558784103393554, "epoch": 3.5422714078374455, "grad_norm": 1.25, "learning_rate": 0.00037819298697411475, "loss": 4.9211, "mean_token_accuracy": 0.21869858205318451, "num_tokens": 81028987.0, "step": 39050 }, { "entropy": 5.5637351989746096, "epoch": 3.54272496371553, "grad_norm": 1.3046875, "learning_rate": 0.00037816423320020964, "loss": 4.8324, "mean_token_accuracy": 0.22129010707139968, "num_tokens": 81038081.0, "step": 39055 }, { "entropy": 5.602155065536499, "epoch": 3.543178519593614, "grad_norm": 1.1875, "learning_rate": 0.00037813547729284195, "loss": 4.8551, "mean_token_accuracy": 0.21958280801773072, "num_tokens": 81048066.0, "step": 39060 }, { "entropy": 5.452717924118042, "epoch": 3.543632075471698, "grad_norm": 1.3515625, "learning_rate": 0.00037810671925260633, "loss": 4.7193, "mean_token_accuracy": 0.23591026812791824, "num_tokens": 81057421.0, "step": 39065 }, { "entropy": 5.512541723251343, "epoch": 3.544085631349782, "grad_norm": 1.15625, "learning_rate": 0.00037807795908009745, "loss": 4.8785, "mean_token_accuracy": 0.21922834664583207, "num_tokens": 81068435.0, "step": 39070 }, { "entropy": 5.596990013122559, "epoch": 3.5445391872278664, "grad_norm": 1.2578125, "learning_rate": 0.00037804919677591006, "loss": 4.9068, "mean_token_accuracy": 0.22014454305171965, "num_tokens": 81079378.0, "step": 39075 }, { "entropy": 5.563273239135742, "epoch": 3.5449927431059507, "grad_norm": 1.1796875, "learning_rate": 0.0003780204323406391, "loss": 4.8776, "mean_token_accuracy": 0.2193951666355133, "num_tokens": 81089872.0, "step": 39080 }, { "entropy": 5.548710298538208, "epoch": 3.545446298984035, "grad_norm": 1.2734375, "learning_rate": 0.0003779916657748793, "loss": 4.8121, "mean_token_accuracy": 0.22848846465349198, "num_tokens": 81099653.0, "step": 39085 }, { "entropy": 5.5385668754577635, "epoch": 3.5458998548621192, "grad_norm": 1.3046875, "learning_rate": 0.0003779628970792256, "loss": 4.8905, "mean_token_accuracy": 0.22012288123369217, "num_tokens": 81109840.0, "step": 39090 }, { "entropy": 5.520224618911743, "epoch": 3.546353410740203, "grad_norm": 1.2578125, "learning_rate": 0.000377934126254273, "loss": 4.8102, "mean_token_accuracy": 0.22792165726423264, "num_tokens": 81120991.0, "step": 39095 }, { "entropy": 5.637347269058227, "epoch": 3.5468069666182873, "grad_norm": 1.28125, "learning_rate": 0.00037790535330061635, "loss": 4.8986, "mean_token_accuracy": 0.2206135407090187, "num_tokens": 81129831.0, "step": 39100 }, { "entropy": 5.6217021465301515, "epoch": 3.5472605224963716, "grad_norm": 1.2578125, "learning_rate": 0.0003778765782188508, "loss": 4.8644, "mean_token_accuracy": 0.22815175354480743, "num_tokens": 81140604.0, "step": 39105 }, { "entropy": 5.580640268325806, "epoch": 3.547714078374456, "grad_norm": 1.375, "learning_rate": 0.00037784780100957145, "loss": 4.8737, "mean_token_accuracy": 0.22785049229860305, "num_tokens": 81150591.0, "step": 39110 }, { "entropy": 5.631751489639282, "epoch": 3.5481676342525397, "grad_norm": 1.1875, "learning_rate": 0.0003778190216733733, "loss": 4.9546, "mean_token_accuracy": 0.21697317510843278, "num_tokens": 81161444.0, "step": 39115 }, { "entropy": 5.582563257217407, "epoch": 3.548621190130624, "grad_norm": 1.2578125, "learning_rate": 0.00037779024021085167, "loss": 4.8206, "mean_token_accuracy": 0.23244941532611846, "num_tokens": 81171216.0, "step": 39120 }, { "entropy": 5.561651229858398, "epoch": 3.549074746008708, "grad_norm": 1.296875, "learning_rate": 0.0003777614566226016, "loss": 4.8972, "mean_token_accuracy": 0.22428617626428604, "num_tokens": 81181665.0, "step": 39125 }, { "entropy": 5.477673816680908, "epoch": 3.5495283018867925, "grad_norm": 1.2890625, "learning_rate": 0.0003777326709092184, "loss": 4.8342, "mean_token_accuracy": 0.22457398623228073, "num_tokens": 81191683.0, "step": 39130 }, { "entropy": 5.566465044021607, "epoch": 3.5499818577648767, "grad_norm": 1.28125, "learning_rate": 0.00037770388307129747, "loss": 4.8333, "mean_token_accuracy": 0.22929604798555375, "num_tokens": 81201211.0, "step": 39135 }, { "entropy": 5.5779046535491945, "epoch": 3.550435413642961, "grad_norm": 1.2109375, "learning_rate": 0.00037767509310943407, "loss": 4.8486, "mean_token_accuracy": 0.22412375509738922, "num_tokens": 81210668.0, "step": 39140 }, { "entropy": 5.538126468658447, "epoch": 3.5508889695210453, "grad_norm": 1.1796875, "learning_rate": 0.0003776463010242235, "loss": 4.7378, "mean_token_accuracy": 0.23208339065313338, "num_tokens": 81221073.0, "step": 39145 }, { "entropy": 5.56144871711731, "epoch": 3.551342525399129, "grad_norm": 1.171875, "learning_rate": 0.00037761750681626134, "loss": 4.9055, "mean_token_accuracy": 0.21407207995653152, "num_tokens": 81231687.0, "step": 39150 }, { "entropy": 5.628942441940308, "epoch": 3.5517960812772134, "grad_norm": 1.1953125, "learning_rate": 0.00037758871048614295, "loss": 4.9245, "mean_token_accuracy": 0.21539255678653718, "num_tokens": 81242323.0, "step": 39155 }, { "entropy": 5.550937652587891, "epoch": 3.5522496371552976, "grad_norm": 1.2734375, "learning_rate": 0.0003775599120344638, "loss": 4.7329, "mean_token_accuracy": 0.23486093282699586, "num_tokens": 81252543.0, "step": 39160 }, { "entropy": 5.575171566009521, "epoch": 3.5527031930333814, "grad_norm": 1.2734375, "learning_rate": 0.00037753111146181966, "loss": 4.8686, "mean_token_accuracy": 0.21733078956604004, "num_tokens": 81262180.0, "step": 39165 }, { "entropy": 5.691906547546386, "epoch": 3.5531567489114657, "grad_norm": 1.2578125, "learning_rate": 0.000377502308768806, "loss": 5.0743, "mean_token_accuracy": 0.20363983660936355, "num_tokens": 81272088.0, "step": 39170 }, { "entropy": 5.593766403198242, "epoch": 3.55361030478955, "grad_norm": 1.2578125, "learning_rate": 0.0003774735039560184, "loss": 4.8664, "mean_token_accuracy": 0.2227915495634079, "num_tokens": 81281723.0, "step": 39175 }, { "entropy": 5.628231525421143, "epoch": 3.5540638606676342, "grad_norm": 1.203125, "learning_rate": 0.00037744469702405273, "loss": 4.9302, "mean_token_accuracy": 0.2187478795647621, "num_tokens": 81292030.0, "step": 39180 }, { "entropy": 5.539047050476074, "epoch": 3.5545174165457185, "grad_norm": 1.1796875, "learning_rate": 0.0003774158879735045, "loss": 4.84, "mean_token_accuracy": 0.22979723960161208, "num_tokens": 81302283.0, "step": 39185 }, { "entropy": 5.619292736053467, "epoch": 3.5549709724238028, "grad_norm": 1.3046875, "learning_rate": 0.0003773870768049697, "loss": 4.9407, "mean_token_accuracy": 0.21409715563058854, "num_tokens": 81313058.0, "step": 39190 }, { "entropy": 5.59077296257019, "epoch": 3.555424528301887, "grad_norm": 1.234375, "learning_rate": 0.000377358263519044, "loss": 4.8665, "mean_token_accuracy": 0.22295138984918594, "num_tokens": 81323827.0, "step": 39195 }, { "entropy": 5.624802875518799, "epoch": 3.555878084179971, "grad_norm": 1.3125, "learning_rate": 0.0003773294481163234, "loss": 4.9146, "mean_token_accuracy": 0.21668390035629273, "num_tokens": 81333106.0, "step": 39200 }, { "entropy": 5.565656471252441, "epoch": 3.556331640058055, "grad_norm": 1.203125, "learning_rate": 0.0003773006305974037, "loss": 4.8663, "mean_token_accuracy": 0.22297347337007523, "num_tokens": 81343245.0, "step": 39205 }, { "entropy": 5.5489387035369875, "epoch": 3.5567851959361394, "grad_norm": 1.2890625, "learning_rate": 0.00037727181096288077, "loss": 4.8777, "mean_token_accuracy": 0.22889523357152938, "num_tokens": 81352917.0, "step": 39210 }, { "entropy": 5.502739810943604, "epoch": 3.5572387518142237, "grad_norm": 1.203125, "learning_rate": 0.0003772429892133509, "loss": 4.818, "mean_token_accuracy": 0.22434785068035126, "num_tokens": 81362838.0, "step": 39215 }, { "entropy": 5.548039102554322, "epoch": 3.5576923076923075, "grad_norm": 1.2734375, "learning_rate": 0.0003772141653494099, "loss": 4.799, "mean_token_accuracy": 0.2289262130856514, "num_tokens": 81373395.0, "step": 39220 }, { "entropy": 5.548663806915283, "epoch": 3.5581458635703918, "grad_norm": 1.1953125, "learning_rate": 0.0003771853393716538, "loss": 4.8526, "mean_token_accuracy": 0.22017838358879088, "num_tokens": 81383976.0, "step": 39225 }, { "entropy": 5.5360664367675785, "epoch": 3.558599419448476, "grad_norm": 1.2578125, "learning_rate": 0.000377156511280679, "loss": 4.8609, "mean_token_accuracy": 0.21764481961727142, "num_tokens": 81394328.0, "step": 39230 }, { "entropy": 5.569854307174682, "epoch": 3.5590529753265603, "grad_norm": 1.15625, "learning_rate": 0.0003771276810770815, "loss": 4.8911, "mean_token_accuracy": 0.2207305207848549, "num_tokens": 81405451.0, "step": 39235 }, { "entropy": 5.616385126113892, "epoch": 3.5595065312046446, "grad_norm": 1.203125, "learning_rate": 0.0003770988487614575, "loss": 4.9704, "mean_token_accuracy": 0.21415517926216127, "num_tokens": 81416589.0, "step": 39240 }, { "entropy": 5.525298595428467, "epoch": 3.559960087082729, "grad_norm": 1.1953125, "learning_rate": 0.0003770700143344033, "loss": 4.8298, "mean_token_accuracy": 0.22174085527658463, "num_tokens": 81428553.0, "step": 39245 }, { "entropy": 5.68926887512207, "epoch": 3.5604136429608126, "grad_norm": 1.234375, "learning_rate": 0.00037704117779651514, "loss": 4.9722, "mean_token_accuracy": 0.2174268126487732, "num_tokens": 81438720.0, "step": 39250 }, { "entropy": 5.543157339096069, "epoch": 3.560867198838897, "grad_norm": 1.546875, "learning_rate": 0.00037701233914838947, "loss": 4.9233, "mean_token_accuracy": 0.21926826536655425, "num_tokens": 81448142.0, "step": 39255 }, { "entropy": 5.590852546691894, "epoch": 3.561320754716981, "grad_norm": 1.1640625, "learning_rate": 0.0003769834983906226, "loss": 4.9429, "mean_token_accuracy": 0.2185932844877243, "num_tokens": 81459448.0, "step": 39260 }, { "entropy": 5.584807968139648, "epoch": 3.5617743105950654, "grad_norm": 1.1796875, "learning_rate": 0.00037695465552381105, "loss": 4.8553, "mean_token_accuracy": 0.22540136575698852, "num_tokens": 81470356.0, "step": 39265 }, { "entropy": 5.567627000808716, "epoch": 3.5622278664731493, "grad_norm": 1.2109375, "learning_rate": 0.00037692581054855125, "loss": 4.8432, "mean_token_accuracy": 0.2222718060016632, "num_tokens": 81480472.0, "step": 39270 }, { "entropy": 5.5348879337310795, "epoch": 3.5626814223512335, "grad_norm": 1.28125, "learning_rate": 0.00037689696346543964, "loss": 4.8256, "mean_token_accuracy": 0.22938759624958038, "num_tokens": 81489949.0, "step": 39275 }, { "entropy": 5.500655794143677, "epoch": 3.563134978229318, "grad_norm": 1.2421875, "learning_rate": 0.00037686811427507284, "loss": 4.7786, "mean_token_accuracy": 0.22332041561603547, "num_tokens": 81500276.0, "step": 39280 }, { "entropy": 5.55662841796875, "epoch": 3.563588534107402, "grad_norm": 1.296875, "learning_rate": 0.00037683926297804756, "loss": 4.7778, "mean_token_accuracy": 0.22417154163122177, "num_tokens": 81510431.0, "step": 39285 }, { "entropy": 5.545302104949951, "epoch": 3.5640420899854863, "grad_norm": 1.28125, "learning_rate": 0.0003768104095749603, "loss": 4.8752, "mean_token_accuracy": 0.2211029350757599, "num_tokens": 81520718.0, "step": 39290 }, { "entropy": 5.5862468719482425, "epoch": 3.5644956458635706, "grad_norm": 1.25, "learning_rate": 0.0003767815540664079, "loss": 4.9491, "mean_token_accuracy": 0.21822448968887329, "num_tokens": 81531904.0, "step": 39295 }, { "entropy": 5.572169351577759, "epoch": 3.5649492017416544, "grad_norm": 1.1640625, "learning_rate": 0.00037675269645298697, "loss": 4.908, "mean_token_accuracy": 0.21582047045230865, "num_tokens": 81542093.0, "step": 39300 }, { "entropy": 5.575176668167114, "epoch": 3.5654027576197387, "grad_norm": 1.21875, "learning_rate": 0.0003767238367352944, "loss": 4.8093, "mean_token_accuracy": 0.228555391728878, "num_tokens": 81552020.0, "step": 39305 }, { "entropy": 5.54360032081604, "epoch": 3.565856313497823, "grad_norm": 1.28125, "learning_rate": 0.00037669497491392683, "loss": 4.773, "mean_token_accuracy": 0.231776687502861, "num_tokens": 81561644.0, "step": 39310 }, { "entropy": 5.584216547012329, "epoch": 3.566309869375907, "grad_norm": 1.4140625, "learning_rate": 0.00037666611098948144, "loss": 4.8961, "mean_token_accuracy": 0.22431233078241347, "num_tokens": 81572158.0, "step": 39315 }, { "entropy": 5.6988341331481935, "epoch": 3.566763425253991, "grad_norm": 1.3828125, "learning_rate": 0.0003766372449625549, "loss": 4.97, "mean_token_accuracy": 0.21029850095510483, "num_tokens": 81582335.0, "step": 39320 }, { "entropy": 5.681170415878296, "epoch": 3.5672169811320753, "grad_norm": 1.2265625, "learning_rate": 0.0003766083768337442, "loss": 4.9565, "mean_token_accuracy": 0.21388877034187317, "num_tokens": 81593004.0, "step": 39325 }, { "entropy": 5.610628080368042, "epoch": 3.5676705370101596, "grad_norm": 1.21875, "learning_rate": 0.0003765795066036464, "loss": 4.8824, "mean_token_accuracy": 0.2195033147931099, "num_tokens": 81603656.0, "step": 39330 }, { "entropy": 5.582458925247193, "epoch": 3.568124092888244, "grad_norm": 1.2890625, "learning_rate": 0.00037655063427285854, "loss": 4.9058, "mean_token_accuracy": 0.22062468975782396, "num_tokens": 81613039.0, "step": 39335 }, { "entropy": 5.538067817687988, "epoch": 3.568577648766328, "grad_norm": 1.2421875, "learning_rate": 0.00037652175984197764, "loss": 4.8417, "mean_token_accuracy": 0.2230832263827324, "num_tokens": 81624410.0, "step": 39340 }, { "entropy": 5.597209882736206, "epoch": 3.5690312046444124, "grad_norm": 1.265625, "learning_rate": 0.00037649288331160086, "loss": 4.8738, "mean_token_accuracy": 0.22319785356521607, "num_tokens": 81635160.0, "step": 39345 }, { "entropy": 5.5896398544311525, "epoch": 3.5694847605224966, "grad_norm": 1.171875, "learning_rate": 0.00037646400468232546, "loss": 4.8414, "mean_token_accuracy": 0.22187502384185792, "num_tokens": 81645686.0, "step": 39350 }, { "entropy": 5.574426174163818, "epoch": 3.5699383164005805, "grad_norm": 1.203125, "learning_rate": 0.00037643512395474853, "loss": 4.81, "mean_token_accuracy": 0.22558621019124986, "num_tokens": 81656330.0, "step": 39355 }, { "entropy": 5.534422111511231, "epoch": 3.5703918722786647, "grad_norm": 1.328125, "learning_rate": 0.0003764062411294674, "loss": 4.8752, "mean_token_accuracy": 0.2156221479177475, "num_tokens": 81665895.0, "step": 39360 }, { "entropy": 5.633473873138428, "epoch": 3.570845428156749, "grad_norm": 1.140625, "learning_rate": 0.00037637735620707935, "loss": 4.9182, "mean_token_accuracy": 0.2181766837835312, "num_tokens": 81676616.0, "step": 39365 }, { "entropy": 5.615085554122925, "epoch": 3.5712989840348333, "grad_norm": 1.2890625, "learning_rate": 0.0003763484691881818, "loss": 4.8947, "mean_token_accuracy": 0.2162467807531357, "num_tokens": 81687169.0, "step": 39370 }, { "entropy": 5.609271001815796, "epoch": 3.571752539912917, "grad_norm": 1.25, "learning_rate": 0.00037631958007337195, "loss": 4.8622, "mean_token_accuracy": 0.22232787311077118, "num_tokens": 81698291.0, "step": 39375 }, { "entropy": 5.593199348449707, "epoch": 3.5722060957910013, "grad_norm": 1.25, "learning_rate": 0.0003762906888632475, "loss": 4.8852, "mean_token_accuracy": 0.21934384107589722, "num_tokens": 81708750.0, "step": 39380 }, { "entropy": 5.5114984035491945, "epoch": 3.5726596516690856, "grad_norm": 1.28125, "learning_rate": 0.0003762617955584058, "loss": 4.8642, "mean_token_accuracy": 0.22185833752155304, "num_tokens": 81719474.0, "step": 39385 }, { "entropy": 5.670875549316406, "epoch": 3.57311320754717, "grad_norm": 1.25, "learning_rate": 0.0003762329001594443, "loss": 4.9544, "mean_token_accuracy": 0.21744270771741867, "num_tokens": 81730092.0, "step": 39390 }, { "entropy": 5.620110034942627, "epoch": 3.573566763425254, "grad_norm": 1.1875, "learning_rate": 0.0003762040026669606, "loss": 4.8762, "mean_token_accuracy": 0.21583929657936096, "num_tokens": 81741235.0, "step": 39395 }, { "entropy": 5.542365312576294, "epoch": 3.5740203193033384, "grad_norm": 1.21875, "learning_rate": 0.0003761751030815524, "loss": 4.8451, "mean_token_accuracy": 0.22471666634082793, "num_tokens": 81751434.0, "step": 39400 }, { "entropy": 5.568959188461304, "epoch": 3.5744738751814222, "grad_norm": 1.296875, "learning_rate": 0.0003761462014038173, "loss": 4.885, "mean_token_accuracy": 0.21340702772140502, "num_tokens": 81763935.0, "step": 39405 }, { "entropy": 5.547994232177734, "epoch": 3.5749274310595065, "grad_norm": 1.1953125, "learning_rate": 0.0003761172976343528, "loss": 4.8626, "mean_token_accuracy": 0.22052109986543655, "num_tokens": 81775007.0, "step": 39410 }, { "entropy": 5.599076938629151, "epoch": 3.5753809869375908, "grad_norm": 1.1328125, "learning_rate": 0.00037608839177375705, "loss": 4.9097, "mean_token_accuracy": 0.22316237092018126, "num_tokens": 81785690.0, "step": 39415 }, { "entropy": 5.551195669174194, "epoch": 3.575834542815675, "grad_norm": 1.1640625, "learning_rate": 0.0003760594838226275, "loss": 4.8773, "mean_token_accuracy": 0.22254292964935302, "num_tokens": 81796143.0, "step": 39420 }, { "entropy": 5.677768850326538, "epoch": 3.576288098693759, "grad_norm": 1.21875, "learning_rate": 0.0003760305737815621, "loss": 4.9789, "mean_token_accuracy": 0.21999324560165406, "num_tokens": 81806607.0, "step": 39425 }, { "entropy": 5.5444282531738285, "epoch": 3.576741654571843, "grad_norm": 1.1953125, "learning_rate": 0.0003760016616511586, "loss": 4.811, "mean_token_accuracy": 0.22482334226369857, "num_tokens": 81817216.0, "step": 39430 }, { "entropy": 5.5515465259552, "epoch": 3.5771952104499274, "grad_norm": 1.2421875, "learning_rate": 0.00037597274743201507, "loss": 4.8729, "mean_token_accuracy": 0.22070506513118743, "num_tokens": 81827211.0, "step": 39435 }, { "entropy": 5.575213432312012, "epoch": 3.5776487663280117, "grad_norm": 1.3046875, "learning_rate": 0.0003759438311247294, "loss": 4.8157, "mean_token_accuracy": 0.2306778147816658, "num_tokens": 81837365.0, "step": 39440 }, { "entropy": 5.557666778564453, "epoch": 3.578102322206096, "grad_norm": 1.28125, "learning_rate": 0.0003759149127298995, "loss": 4.8297, "mean_token_accuracy": 0.2288535326719284, "num_tokens": 81847803.0, "step": 39445 }, { "entropy": 5.528546380996704, "epoch": 3.57855587808418, "grad_norm": 1.1875, "learning_rate": 0.00037588599224812363, "loss": 4.8161, "mean_token_accuracy": 0.22581283301115035, "num_tokens": 81858123.0, "step": 39450 }, { "entropy": 5.501288938522339, "epoch": 3.579009433962264, "grad_norm": 1.4296875, "learning_rate": 0.0003758570696799997, "loss": 4.8253, "mean_token_accuracy": 0.23119283765554427, "num_tokens": 81868668.0, "step": 39455 }, { "entropy": 5.546344947814942, "epoch": 3.5794629898403483, "grad_norm": 1.359375, "learning_rate": 0.00037582814502612575, "loss": 4.7989, "mean_token_accuracy": 0.2365462988615036, "num_tokens": 81877482.0, "step": 39460 }, { "entropy": 5.493146228790283, "epoch": 3.5799165457184325, "grad_norm": 1.375, "learning_rate": 0.0003757992182871001, "loss": 4.7216, "mean_token_accuracy": 0.23373111486434936, "num_tokens": 81886700.0, "step": 39465 }, { "entropy": 5.5622992515563965, "epoch": 3.580370101596517, "grad_norm": 1.2890625, "learning_rate": 0.00037577028946352107, "loss": 4.8467, "mean_token_accuracy": 0.22651808708906174, "num_tokens": 81896446.0, "step": 39470 }, { "entropy": 5.595756244659424, "epoch": 3.5808236574746006, "grad_norm": 1.234375, "learning_rate": 0.0003757413585559866, "loss": 4.8659, "mean_token_accuracy": 0.2276629701256752, "num_tokens": 81907418.0, "step": 39475 }, { "entropy": 5.608978509902954, "epoch": 3.581277213352685, "grad_norm": 1.25, "learning_rate": 0.00037571242556509526, "loss": 4.8391, "mean_token_accuracy": 0.225987708568573, "num_tokens": 81917940.0, "step": 39480 }, { "entropy": 5.521082782745362, "epoch": 3.581730769230769, "grad_norm": 1.28125, "learning_rate": 0.0003756834904914453, "loss": 4.8314, "mean_token_accuracy": 0.223852701485157, "num_tokens": 81928158.0, "step": 39485 }, { "entropy": 5.614514350891113, "epoch": 3.5821843251088534, "grad_norm": 1.3125, "learning_rate": 0.0003756545533356351, "loss": 4.9022, "mean_token_accuracy": 0.2230327919125557, "num_tokens": 81938111.0, "step": 39490 }, { "entropy": 5.6086221694946286, "epoch": 3.5826378809869377, "grad_norm": 1.2109375, "learning_rate": 0.000375625614098263, "loss": 4.8501, "mean_token_accuracy": 0.22814274132251738, "num_tokens": 81948798.0, "step": 39495 }, { "entropy": 5.605922365188599, "epoch": 3.583091436865022, "grad_norm": 1.2578125, "learning_rate": 0.00037559667277992765, "loss": 4.8941, "mean_token_accuracy": 0.2272637203335762, "num_tokens": 81959240.0, "step": 39500 }, { "entropy": 5.561976337432862, "epoch": 3.5835449927431062, "grad_norm": 1.1796875, "learning_rate": 0.0003755677293812274, "loss": 4.8505, "mean_token_accuracy": 0.22572755962610244, "num_tokens": 81969929.0, "step": 39505 }, { "entropy": 5.638457345962524, "epoch": 3.58399854862119, "grad_norm": 1.21875, "learning_rate": 0.0003755387839027609, "loss": 4.932, "mean_token_accuracy": 0.21088100522756575, "num_tokens": 81981007.0, "step": 39510 }, { "entropy": 5.674823331832886, "epoch": 3.5844521044992743, "grad_norm": 1.3046875, "learning_rate": 0.00037550983634512683, "loss": 4.9887, "mean_token_accuracy": 0.21432940363883973, "num_tokens": 81991172.0, "step": 39515 }, { "entropy": 5.5497047901153564, "epoch": 3.5849056603773586, "grad_norm": 1.2734375, "learning_rate": 0.0003754808867089236, "loss": 4.7852, "mean_token_accuracy": 0.23025105744600297, "num_tokens": 82001282.0, "step": 39520 }, { "entropy": 5.567294120788574, "epoch": 3.5853592162554424, "grad_norm": 1.2265625, "learning_rate": 0.00037545193499475003, "loss": 4.8831, "mean_token_accuracy": 0.22077575027942659, "num_tokens": 82011929.0, "step": 39525 }, { "entropy": 5.652157878875732, "epoch": 3.5858127721335267, "grad_norm": 1.34375, "learning_rate": 0.0003754229812032049, "loss": 4.9082, "mean_token_accuracy": 0.22406138628721237, "num_tokens": 82021663.0, "step": 39530 }, { "entropy": 5.6033374786376955, "epoch": 3.586266328011611, "grad_norm": 1.3125, "learning_rate": 0.00037539402533488694, "loss": 4.9546, "mean_token_accuracy": 0.21336558759212493, "num_tokens": 82031547.0, "step": 39535 }, { "entropy": 5.64754090309143, "epoch": 3.586719883889695, "grad_norm": 1.1796875, "learning_rate": 0.0003753650673903949, "loss": 4.9149, "mean_token_accuracy": 0.21823500841856003, "num_tokens": 82041722.0, "step": 39540 }, { "entropy": 5.59665813446045, "epoch": 3.5871734397677795, "grad_norm": 1.2265625, "learning_rate": 0.00037533610737032773, "loss": 4.8858, "mean_token_accuracy": 0.22547902315855026, "num_tokens": 82052715.0, "step": 39545 }, { "entropy": 5.549384260177613, "epoch": 3.5876269956458637, "grad_norm": 1.234375, "learning_rate": 0.00037530714527528433, "loss": 4.8398, "mean_token_accuracy": 0.2286929801106453, "num_tokens": 82062709.0, "step": 39550 }, { "entropy": 5.596023178100586, "epoch": 3.588080551523948, "grad_norm": 1.2421875, "learning_rate": 0.00037527818110586354, "loss": 4.9022, "mean_token_accuracy": 0.2219044268131256, "num_tokens": 82072731.0, "step": 39555 }, { "entropy": 5.595376825332641, "epoch": 3.588534107402032, "grad_norm": 1.328125, "learning_rate": 0.0003752492148626644, "loss": 4.8066, "mean_token_accuracy": 0.22683290690183638, "num_tokens": 82083216.0, "step": 39560 }, { "entropy": 5.594009208679199, "epoch": 3.588987663280116, "grad_norm": 1.1640625, "learning_rate": 0.000375220246546286, "loss": 4.9155, "mean_token_accuracy": 0.21765778958797455, "num_tokens": 82094482.0, "step": 39565 }, { "entropy": 5.583010053634643, "epoch": 3.5894412191582004, "grad_norm": 1.2109375, "learning_rate": 0.0003751912761573273, "loss": 4.8378, "mean_token_accuracy": 0.22457533180713654, "num_tokens": 82104988.0, "step": 39570 }, { "entropy": 5.603489589691162, "epoch": 3.5898947750362846, "grad_norm": 1.296875, "learning_rate": 0.00037516230369638755, "loss": 4.8995, "mean_token_accuracy": 0.21480146050453186, "num_tokens": 82114455.0, "step": 39575 }, { "entropy": 5.600613832473755, "epoch": 3.5903483309143684, "grad_norm": 1.2109375, "learning_rate": 0.0003751333291640658, "loss": 4.8843, "mean_token_accuracy": 0.22257035672664643, "num_tokens": 82125001.0, "step": 39580 }, { "entropy": 5.5865860939025875, "epoch": 3.5908018867924527, "grad_norm": 1.296875, "learning_rate": 0.00037510435256096124, "loss": 4.8542, "mean_token_accuracy": 0.2213310644030571, "num_tokens": 82134586.0, "step": 39585 }, { "entropy": 5.537910461425781, "epoch": 3.591255442670537, "grad_norm": 1.28125, "learning_rate": 0.00037507537388767326, "loss": 4.8309, "mean_token_accuracy": 0.22830667495727539, "num_tokens": 82144612.0, "step": 39590 }, { "entropy": 5.5490772247314455, "epoch": 3.5917089985486212, "grad_norm": 1.3125, "learning_rate": 0.000375046393144801, "loss": 4.8456, "mean_token_accuracy": 0.22967538088560105, "num_tokens": 82154913.0, "step": 39595 }, { "entropy": 5.601358556747437, "epoch": 3.5921625544267055, "grad_norm": 1.28125, "learning_rate": 0.0003750174103329438, "loss": 4.9285, "mean_token_accuracy": 0.21824212074279786, "num_tokens": 82164469.0, "step": 39600 }, { "entropy": 5.621843481063843, "epoch": 3.59261611030479, "grad_norm": 1.2578125, "learning_rate": 0.00037498842545270105, "loss": 4.897, "mean_token_accuracy": 0.22346892207860947, "num_tokens": 82174575.0, "step": 39605 }, { "entropy": 5.627682876586914, "epoch": 3.5930696661828736, "grad_norm": 1.2265625, "learning_rate": 0.00037495943850467226, "loss": 4.8686, "mean_token_accuracy": 0.2256598725914955, "num_tokens": 82184661.0, "step": 39610 }, { "entropy": 5.659826612472534, "epoch": 3.593523222060958, "grad_norm": 1.1875, "learning_rate": 0.00037493044948945677, "loss": 4.8917, "mean_token_accuracy": 0.2209211990237236, "num_tokens": 82194877.0, "step": 39615 }, { "entropy": 5.604482173919678, "epoch": 3.593976777939042, "grad_norm": 1.109375, "learning_rate": 0.00037490145840765414, "loss": 4.8804, "mean_token_accuracy": 0.22413596659898757, "num_tokens": 82206278.0, "step": 39620 }, { "entropy": 5.592150545120239, "epoch": 3.5944303338171264, "grad_norm": 1.234375, "learning_rate": 0.00037487246525986384, "loss": 4.8925, "mean_token_accuracy": 0.2219835937023163, "num_tokens": 82216140.0, "step": 39625 }, { "entropy": 5.6267670631408695, "epoch": 3.59488388969521, "grad_norm": 1.390625, "learning_rate": 0.0003748434700466856, "loss": 4.9245, "mean_token_accuracy": 0.22556490004062651, "num_tokens": 82226239.0, "step": 39630 }, { "entropy": 5.581395816802979, "epoch": 3.5953374455732945, "grad_norm": 1.3359375, "learning_rate": 0.0003748144727687188, "loss": 4.8673, "mean_token_accuracy": 0.22574800699949266, "num_tokens": 82235795.0, "step": 39635 }, { "entropy": 5.524588584899902, "epoch": 3.5957910014513788, "grad_norm": 1.21875, "learning_rate": 0.00037478547342656345, "loss": 4.811, "mean_token_accuracy": 0.22947650402784348, "num_tokens": 82245644.0, "step": 39640 }, { "entropy": 5.562024545669556, "epoch": 3.596244557329463, "grad_norm": 1.1953125, "learning_rate": 0.000374756472020819, "loss": 4.8584, "mean_token_accuracy": 0.22304305285215378, "num_tokens": 82255608.0, "step": 39645 }, { "entropy": 5.5828674793243405, "epoch": 3.5966981132075473, "grad_norm": 1.3046875, "learning_rate": 0.00037472746855208525, "loss": 4.8452, "mean_token_accuracy": 0.2244326055049896, "num_tokens": 82265488.0, "step": 39650 }, { "entropy": 5.608457946777344, "epoch": 3.5971516690856316, "grad_norm": 1.203125, "learning_rate": 0.0003746984630209621, "loss": 4.8877, "mean_token_accuracy": 0.2146323651075363, "num_tokens": 82276866.0, "step": 39655 }, { "entropy": 5.587748098373413, "epoch": 3.5976052249637154, "grad_norm": 1.359375, "learning_rate": 0.00037466945542804933, "loss": 4.8537, "mean_token_accuracy": 0.22724784761667252, "num_tokens": 82287125.0, "step": 39660 }, { "entropy": 5.620104074478149, "epoch": 3.5980587808417996, "grad_norm": 1.2578125, "learning_rate": 0.00037464044577394676, "loss": 4.908, "mean_token_accuracy": 0.2170126736164093, "num_tokens": 82296887.0, "step": 39665 }, { "entropy": 5.6313426971435545, "epoch": 3.598512336719884, "grad_norm": 1.34375, "learning_rate": 0.0003746114340592544, "loss": 4.9631, "mean_token_accuracy": 0.21381559371948242, "num_tokens": 82306928.0, "step": 39670 }, { "entropy": 5.5836591720581055, "epoch": 3.598965892597968, "grad_norm": 1.1484375, "learning_rate": 0.00037458242028457216, "loss": 4.9002, "mean_token_accuracy": 0.2217973828315735, "num_tokens": 82317873.0, "step": 39675 }, { "entropy": 5.5234252452850345, "epoch": 3.599419448476052, "grad_norm": 1.1015625, "learning_rate": 0.00037455340445050023, "loss": 4.7642, "mean_token_accuracy": 0.22885881811380387, "num_tokens": 82328184.0, "step": 39680 }, { "entropy": 5.523097705841065, "epoch": 3.5998730043541363, "grad_norm": 1.34375, "learning_rate": 0.00037452438655763843, "loss": 4.8829, "mean_token_accuracy": 0.22360922247171403, "num_tokens": 82338191.0, "step": 39685 }, { "entropy": 5.5666886329650875, "epoch": 3.6003265602322205, "grad_norm": 1.2265625, "learning_rate": 0.00037449536660658696, "loss": 4.9551, "mean_token_accuracy": 0.21854311972856522, "num_tokens": 82348095.0, "step": 39690 }, { "entropy": 5.575230693817138, "epoch": 3.600780116110305, "grad_norm": 1.2578125, "learning_rate": 0.000374466344597946, "loss": 4.7863, "mean_token_accuracy": 0.2260938763618469, "num_tokens": 82358216.0, "step": 39695 }, { "entropy": 5.542170906066895, "epoch": 3.601233671988389, "grad_norm": 1.2421875, "learning_rate": 0.0003744373205323157, "loss": 4.8326, "mean_token_accuracy": 0.2243800014257431, "num_tokens": 82368581.0, "step": 39700 }, { "entropy": 5.551475381851196, "epoch": 3.6016872278664733, "grad_norm": 1.1953125, "learning_rate": 0.0003744082944102962, "loss": 4.8803, "mean_token_accuracy": 0.21467635184526443, "num_tokens": 82379609.0, "step": 39705 }, { "entropy": 5.628689384460449, "epoch": 3.6021407837445576, "grad_norm": 1.140625, "learning_rate": 0.0003743792662324878, "loss": 4.9044, "mean_token_accuracy": 0.22144703567028046, "num_tokens": 82390589.0, "step": 39710 }, { "entropy": 5.552912616729737, "epoch": 3.6025943396226414, "grad_norm": 1.265625, "learning_rate": 0.00037435023599949086, "loss": 4.8554, "mean_token_accuracy": 0.22040871828794478, "num_tokens": 82400915.0, "step": 39715 }, { "entropy": 5.563165950775146, "epoch": 3.6030478955007257, "grad_norm": 1.2421875, "learning_rate": 0.00037432120371190585, "loss": 4.8561, "mean_token_accuracy": 0.22860354781150818, "num_tokens": 82411544.0, "step": 39720 }, { "entropy": 5.55045337677002, "epoch": 3.60350145137881, "grad_norm": 1.21875, "learning_rate": 0.00037429216937033294, "loss": 4.8228, "mean_token_accuracy": 0.228674952685833, "num_tokens": 82422391.0, "step": 39725 }, { "entropy": 5.536394834518433, "epoch": 3.6039550072568938, "grad_norm": 1.234375, "learning_rate": 0.00037426313297537263, "loss": 4.861, "mean_token_accuracy": 0.224294613301754, "num_tokens": 82433564.0, "step": 39730 }, { "entropy": 5.5612335205078125, "epoch": 3.604408563134978, "grad_norm": 1.2421875, "learning_rate": 0.0003742340945276255, "loss": 4.8914, "mean_token_accuracy": 0.22343081682920457, "num_tokens": 82445005.0, "step": 39735 }, { "entropy": 5.566359996795654, "epoch": 3.6048621190130623, "grad_norm": 1.3046875, "learning_rate": 0.000374205054027692, "loss": 4.9195, "mean_token_accuracy": 0.21974200904369354, "num_tokens": 82455998.0, "step": 39740 }, { "entropy": 5.563248348236084, "epoch": 3.6053156748911466, "grad_norm": 1.2578125, "learning_rate": 0.00037417601147617265, "loss": 4.8323, "mean_token_accuracy": 0.22561975121498107, "num_tokens": 82466789.0, "step": 39745 }, { "entropy": 5.630987739562988, "epoch": 3.605769230769231, "grad_norm": 1.109375, "learning_rate": 0.00037414696687366816, "loss": 4.9904, "mean_token_accuracy": 0.21442769169807435, "num_tokens": 82478181.0, "step": 39750 }, { "entropy": 5.594155979156494, "epoch": 3.606222786647315, "grad_norm": 1.2890625, "learning_rate": 0.00037411792022077917, "loss": 4.8245, "mean_token_accuracy": 0.2188940703868866, "num_tokens": 82488452.0, "step": 39755 }, { "entropy": 5.612184762954712, "epoch": 3.6066763425253994, "grad_norm": 1.3046875, "learning_rate": 0.0003740888715181063, "loss": 4.8854, "mean_token_accuracy": 0.2234674036502838, "num_tokens": 82498179.0, "step": 39760 }, { "entropy": 5.556216192245484, "epoch": 3.607129898403483, "grad_norm": 1.296875, "learning_rate": 0.00037405982076625026, "loss": 4.9259, "mean_token_accuracy": 0.22625814378261566, "num_tokens": 82508242.0, "step": 39765 }, { "entropy": 5.6044919967651365, "epoch": 3.6075834542815675, "grad_norm": 1.140625, "learning_rate": 0.00037403076796581195, "loss": 4.8986, "mean_token_accuracy": 0.21506549119949342, "num_tokens": 82519363.0, "step": 39770 }, { "entropy": 5.6317511081695555, "epoch": 3.6080370101596517, "grad_norm": 1.1875, "learning_rate": 0.0003740017131173921, "loss": 4.9083, "mean_token_accuracy": 0.2176603466272354, "num_tokens": 82529745.0, "step": 39775 }, { "entropy": 5.652537202835083, "epoch": 3.608490566037736, "grad_norm": 1.25, "learning_rate": 0.0003739726562215916, "loss": 4.9435, "mean_token_accuracy": 0.21786196827888488, "num_tokens": 82539573.0, "step": 39780 }, { "entropy": 5.634916973114014, "epoch": 3.60894412191582, "grad_norm": 1.2109375, "learning_rate": 0.00037394359727901136, "loss": 4.9345, "mean_token_accuracy": 0.22218762338161469, "num_tokens": 82551313.0, "step": 39785 }, { "entropy": 5.560735130310059, "epoch": 3.609397677793904, "grad_norm": 1.2734375, "learning_rate": 0.0003739145362902523, "loss": 4.8673, "mean_token_accuracy": 0.22180914282798767, "num_tokens": 82561283.0, "step": 39790 }, { "entropy": 5.529203462600708, "epoch": 3.6098512336719883, "grad_norm": 1.3359375, "learning_rate": 0.0003738854732559153, "loss": 4.7904, "mean_token_accuracy": 0.22714564055204392, "num_tokens": 82571118.0, "step": 39795 }, { "entropy": 5.5521503448486325, "epoch": 3.6103047895500726, "grad_norm": 1.1796875, "learning_rate": 0.0003738564081766017, "loss": 4.8575, "mean_token_accuracy": 0.22489626407623292, "num_tokens": 82581663.0, "step": 39800 }, { "entropy": 5.528533458709717, "epoch": 3.610758345428157, "grad_norm": 1.28125, "learning_rate": 0.00037382734105291234, "loss": 4.8367, "mean_token_accuracy": 0.22135457247495652, "num_tokens": 82592593.0, "step": 39805 }, { "entropy": 5.568611001968383, "epoch": 3.611211901306241, "grad_norm": 1.1640625, "learning_rate": 0.00037379827188544835, "loss": 4.9459, "mean_token_accuracy": 0.21753670126199723, "num_tokens": 82603047.0, "step": 39810 }, { "entropy": 5.647225999832154, "epoch": 3.611665457184325, "grad_norm": 1.21875, "learning_rate": 0.00037376920067481095, "loss": 4.9274, "mean_token_accuracy": 0.22242050021886825, "num_tokens": 82612789.0, "step": 39815 }, { "entropy": 5.579960584640503, "epoch": 3.6121190130624092, "grad_norm": 1.1953125, "learning_rate": 0.0003737401274216012, "loss": 4.8454, "mean_token_accuracy": 0.22030610889196395, "num_tokens": 82622881.0, "step": 39820 }, { "entropy": 5.5353028774261475, "epoch": 3.6125725689404935, "grad_norm": 1.328125, "learning_rate": 0.0003737110521264206, "loss": 4.8037, "mean_token_accuracy": 0.22181320935487747, "num_tokens": 82633933.0, "step": 39825 }, { "entropy": 5.5855536460876465, "epoch": 3.6130261248185778, "grad_norm": 1.3125, "learning_rate": 0.0003736819747898702, "loss": 4.8849, "mean_token_accuracy": 0.2231051057577133, "num_tokens": 82645069.0, "step": 39830 }, { "entropy": 5.669990015029907, "epoch": 3.6134796806966616, "grad_norm": 1.234375, "learning_rate": 0.00037365289541255154, "loss": 4.8988, "mean_token_accuracy": 0.22316997200250627, "num_tokens": 82655152.0, "step": 39835 }, { "entropy": 5.54179892539978, "epoch": 3.613933236574746, "grad_norm": 1.1640625, "learning_rate": 0.00037362381399506575, "loss": 4.8441, "mean_token_accuracy": 0.2198281854391098, "num_tokens": 82665260.0, "step": 39840 }, { "entropy": 5.551840686798096, "epoch": 3.61438679245283, "grad_norm": 1.1953125, "learning_rate": 0.00037359473053801435, "loss": 4.8463, "mean_token_accuracy": 0.2278337746858597, "num_tokens": 82676287.0, "step": 39845 }, { "entropy": 5.582655715942383, "epoch": 3.6148403483309144, "grad_norm": 1.2734375, "learning_rate": 0.0003735656450419988, "loss": 4.9597, "mean_token_accuracy": 0.21073424965143203, "num_tokens": 82686958.0, "step": 39850 }, { "entropy": 5.616000747680664, "epoch": 3.6152939042089987, "grad_norm": 1.2578125, "learning_rate": 0.00037353655750762063, "loss": 5.004, "mean_token_accuracy": 0.20761482566595077, "num_tokens": 82698623.0, "step": 39855 }, { "entropy": 5.675088262557983, "epoch": 3.615747460087083, "grad_norm": 1.2265625, "learning_rate": 0.00037350746793548135, "loss": 4.9531, "mean_token_accuracy": 0.21714994609355925, "num_tokens": 82709146.0, "step": 39860 }, { "entropy": 5.605067300796509, "epoch": 3.6162010159651667, "grad_norm": 1.328125, "learning_rate": 0.00037347837632618246, "loss": 4.8258, "mean_token_accuracy": 0.22284420430660248, "num_tokens": 82719323.0, "step": 39865 }, { "entropy": 5.6138804912567135, "epoch": 3.616654571843251, "grad_norm": 1.421875, "learning_rate": 0.00037344928268032574, "loss": 4.9271, "mean_token_accuracy": 0.21643898636102676, "num_tokens": 82730068.0, "step": 39870 }, { "entropy": 5.568813514709473, "epoch": 3.6171081277213353, "grad_norm": 1.3046875, "learning_rate": 0.0003734201869985127, "loss": 4.9244, "mean_token_accuracy": 0.2208503380417824, "num_tokens": 82740460.0, "step": 39875 }, { "entropy": 5.5625104904174805, "epoch": 3.6175616835994195, "grad_norm": 1.2578125, "learning_rate": 0.0003733910892813451, "loss": 4.8382, "mean_token_accuracy": 0.21515371948480605, "num_tokens": 82751488.0, "step": 39880 }, { "entropy": 5.494701814651489, "epoch": 3.6180152394775034, "grad_norm": 1.203125, "learning_rate": 0.00037336198952942477, "loss": 4.768, "mean_token_accuracy": 0.23381744027137757, "num_tokens": 82762061.0, "step": 39885 }, { "entropy": 5.543667030334473, "epoch": 3.6184687953555876, "grad_norm": 1.1796875, "learning_rate": 0.0003733328877433534, "loss": 4.8239, "mean_token_accuracy": 0.22706289291381837, "num_tokens": 82773421.0, "step": 39890 }, { "entropy": 5.5062695980072025, "epoch": 3.618922351233672, "grad_norm": 1.2265625, "learning_rate": 0.00037330378392373285, "loss": 4.7367, "mean_token_accuracy": 0.22476134449243546, "num_tokens": 82783342.0, "step": 39895 }, { "entropy": 5.564427900314331, "epoch": 3.619375907111756, "grad_norm": 1.2265625, "learning_rate": 0.00037327467807116507, "loss": 4.8863, "mean_token_accuracy": 0.21438806056976317, "num_tokens": 82793885.0, "step": 39900 }, { "entropy": 5.630543661117554, "epoch": 3.6198294629898404, "grad_norm": 1.3125, "learning_rate": 0.00037324557018625186, "loss": 4.9258, "mean_token_accuracy": 0.21958522051572799, "num_tokens": 82803746.0, "step": 39905 }, { "entropy": 5.594546794891357, "epoch": 3.6202830188679247, "grad_norm": 1.3671875, "learning_rate": 0.0003732164602695952, "loss": 4.864, "mean_token_accuracy": 0.22522586435079575, "num_tokens": 82813858.0, "step": 39910 }, { "entropy": 5.6029878616333, "epoch": 3.620736574746009, "grad_norm": 1.3203125, "learning_rate": 0.00037318734832179705, "loss": 4.9109, "mean_token_accuracy": 0.22916320860385894, "num_tokens": 82824358.0, "step": 39915 }, { "entropy": 5.536659240722656, "epoch": 3.621190130624093, "grad_norm": 1.2109375, "learning_rate": 0.00037315823434345963, "loss": 4.8891, "mean_token_accuracy": 0.2316565543413162, "num_tokens": 82835801.0, "step": 39920 }, { "entropy": 5.493958568572998, "epoch": 3.621643686502177, "grad_norm": 1.2734375, "learning_rate": 0.0003731291183351848, "loss": 4.7965, "mean_token_accuracy": 0.23135312646627426, "num_tokens": 82845818.0, "step": 39925 }, { "entropy": 5.5462545394897464, "epoch": 3.6220972423802613, "grad_norm": 1.15625, "learning_rate": 0.00037310000029757486, "loss": 4.847, "mean_token_accuracy": 0.2225813940167427, "num_tokens": 82856920.0, "step": 39930 }, { "entropy": 5.649670124053955, "epoch": 3.6225507982583456, "grad_norm": 1.2734375, "learning_rate": 0.0003730708802312319, "loss": 4.9436, "mean_token_accuracy": 0.21842000186443328, "num_tokens": 82867220.0, "step": 39935 }, { "entropy": 5.564120817184448, "epoch": 3.6230043541364294, "grad_norm": 1.2890625, "learning_rate": 0.0003730417581367582, "loss": 4.8452, "mean_token_accuracy": 0.2275705099105835, "num_tokens": 82877541.0, "step": 39940 }, { "entropy": 5.602983903884888, "epoch": 3.6234579100145137, "grad_norm": 1.3046875, "learning_rate": 0.0003730126340147559, "loss": 4.9198, "mean_token_accuracy": 0.22266925722360612, "num_tokens": 82888346.0, "step": 39945 }, { "entropy": 5.655581283569336, "epoch": 3.623911465892598, "grad_norm": 1.1796875, "learning_rate": 0.0003729835078658273, "loss": 4.9603, "mean_token_accuracy": 0.22218163758516313, "num_tokens": 82899721.0, "step": 39950 }, { "entropy": 5.587097883224487, "epoch": 3.624365021770682, "grad_norm": 1.234375, "learning_rate": 0.00037295437969057493, "loss": 4.8697, "mean_token_accuracy": 0.22589590698480605, "num_tokens": 82910149.0, "step": 39955 }, { "entropy": 5.598569631576538, "epoch": 3.6248185776487665, "grad_norm": 1.234375, "learning_rate": 0.00037292524948960093, "loss": 4.8994, "mean_token_accuracy": 0.22186598926782608, "num_tokens": 82920883.0, "step": 39960 }, { "entropy": 5.59524245262146, "epoch": 3.6252721335268507, "grad_norm": 1.359375, "learning_rate": 0.0003728961172635078, "loss": 4.923, "mean_token_accuracy": 0.22082389891147614, "num_tokens": 82931091.0, "step": 39965 }, { "entropy": 5.566177225112915, "epoch": 3.6257256894049346, "grad_norm": 1.3046875, "learning_rate": 0.00037286698301289804, "loss": 4.7764, "mean_token_accuracy": 0.2263589769601822, "num_tokens": 82941108.0, "step": 39970 }, { "entropy": 5.556240177154541, "epoch": 3.626179245283019, "grad_norm": 1.03125, "learning_rate": 0.0003728378467383742, "loss": 4.8738, "mean_token_accuracy": 0.22205670028924943, "num_tokens": 82951943.0, "step": 39975 }, { "entropy": 5.650640916824341, "epoch": 3.626632801161103, "grad_norm": 1.3125, "learning_rate": 0.0003728087084405387, "loss": 4.9256, "mean_token_accuracy": 0.22331616878509522, "num_tokens": 82961495.0, "step": 39980 }, { "entropy": 5.672296333312988, "epoch": 3.6270863570391874, "grad_norm": 1.2890625, "learning_rate": 0.00037277956811999414, "loss": 4.8963, "mean_token_accuracy": 0.22200254797935487, "num_tokens": 82971858.0, "step": 39985 }, { "entropy": 5.616363096237182, "epoch": 3.627539912917271, "grad_norm": 1.1875, "learning_rate": 0.0003727504257773433, "loss": 4.8718, "mean_token_accuracy": 0.2186845749616623, "num_tokens": 82982805.0, "step": 39990 }, { "entropy": 5.5951322555542, "epoch": 3.6279934687953554, "grad_norm": 1.21875, "learning_rate": 0.00037272128141318866, "loss": 4.9172, "mean_token_accuracy": 0.2165425941348076, "num_tokens": 82993446.0, "step": 39995 }, { "entropy": 5.533211183547974, "epoch": 3.6284470246734397, "grad_norm": 1.34375, "learning_rate": 0.000372692135028133, "loss": 4.8052, "mean_token_accuracy": 0.22380539029836655, "num_tokens": 83003378.0, "step": 40000 }, { "entropy": 5.586108732223511, "epoch": 3.628900580551524, "grad_norm": 1.2265625, "learning_rate": 0.00037266298662277914, "loss": 4.8209, "mean_token_accuracy": 0.22107890248298645, "num_tokens": 83014223.0, "step": 40005 }, { "entropy": 5.576086044311523, "epoch": 3.6293541364296082, "grad_norm": 1.2421875, "learning_rate": 0.00037263383619772986, "loss": 4.9149, "mean_token_accuracy": 0.21756452620029448, "num_tokens": 83024691.0, "step": 40010 }, { "entropy": 5.608897304534912, "epoch": 3.6298076923076925, "grad_norm": 1.140625, "learning_rate": 0.00037260468375358794, "loss": 4.881, "mean_token_accuracy": 0.21757373511791228, "num_tokens": 83035704.0, "step": 40015 }, { "entropy": 5.638431787490845, "epoch": 3.6302612481857763, "grad_norm": 1.3359375, "learning_rate": 0.0003725755292909562, "loss": 4.9692, "mean_token_accuracy": 0.2153886079788208, "num_tokens": 83047173.0, "step": 40020 }, { "entropy": 5.641260099411011, "epoch": 3.6307148040638606, "grad_norm": 1.34375, "learning_rate": 0.0003725463728104378, "loss": 4.9238, "mean_token_accuracy": 0.21805346012115479, "num_tokens": 83056399.0, "step": 40025 }, { "entropy": 5.571602010726929, "epoch": 3.631168359941945, "grad_norm": 1.2109375, "learning_rate": 0.0003725172143126354, "loss": 4.8305, "mean_token_accuracy": 0.21817951500415803, "num_tokens": 83066413.0, "step": 40030 }, { "entropy": 5.582342195510864, "epoch": 3.631621915820029, "grad_norm": 1.1796875, "learning_rate": 0.00037248805379815227, "loss": 4.8966, "mean_token_accuracy": 0.21812659054994582, "num_tokens": 83077843.0, "step": 40035 }, { "entropy": 5.628216361999511, "epoch": 3.632075471698113, "grad_norm": 1.1953125, "learning_rate": 0.0003724588912675913, "loss": 4.9704, "mean_token_accuracy": 0.21749621033668518, "num_tokens": 83088585.0, "step": 40040 }, { "entropy": 5.670231628417969, "epoch": 3.6325290275761972, "grad_norm": 1.234375, "learning_rate": 0.0003724297267215557, "loss": 4.9997, "mean_token_accuracy": 0.21903275847434997, "num_tokens": 83099295.0, "step": 40045 }, { "entropy": 5.562008905410766, "epoch": 3.6329825834542815, "grad_norm": 1.3515625, "learning_rate": 0.00037240056016064844, "loss": 4.7939, "mean_token_accuracy": 0.23146501928567886, "num_tokens": 83108530.0, "step": 40050 }, { "entropy": 5.563482046127319, "epoch": 3.6334361393323658, "grad_norm": 1.3515625, "learning_rate": 0.0003723713915854728, "loss": 4.8824, "mean_token_accuracy": 0.22078048139810563, "num_tokens": 83119703.0, "step": 40055 }, { "entropy": 5.606525039672851, "epoch": 3.63388969521045, "grad_norm": 1.1953125, "learning_rate": 0.0003723422209966319, "loss": 4.8613, "mean_token_accuracy": 0.22562302201986312, "num_tokens": 83129323.0, "step": 40060 }, { "entropy": 5.58606071472168, "epoch": 3.6343432510885343, "grad_norm": 1.1875, "learning_rate": 0.0003723130483947292, "loss": 4.8128, "mean_token_accuracy": 0.22730310559272765, "num_tokens": 83139339.0, "step": 40065 }, { "entropy": 5.546669578552246, "epoch": 3.6347968069666186, "grad_norm": 1.2265625, "learning_rate": 0.0003722838737803678, "loss": 4.863, "mean_token_accuracy": 0.22367920428514482, "num_tokens": 83149845.0, "step": 40070 }, { "entropy": 5.603301191329956, "epoch": 3.6352503628447024, "grad_norm": 1.2734375, "learning_rate": 0.00037225469715415106, "loss": 4.8964, "mean_token_accuracy": 0.21535771042108537, "num_tokens": 83160332.0, "step": 40075 }, { "entropy": 5.610947322845459, "epoch": 3.6357039187227866, "grad_norm": 1.3515625, "learning_rate": 0.00037222551851668245, "loss": 4.902, "mean_token_accuracy": 0.2161208689212799, "num_tokens": 83170892.0, "step": 40080 }, { "entropy": 5.567786836624146, "epoch": 3.636157474600871, "grad_norm": 1.359375, "learning_rate": 0.0003721963378685652, "loss": 4.8504, "mean_token_accuracy": 0.22651458382606507, "num_tokens": 83181035.0, "step": 40085 }, { "entropy": 5.546350383758545, "epoch": 3.6366110304789547, "grad_norm": 1.1953125, "learning_rate": 0.00037216715521040314, "loss": 4.8456, "mean_token_accuracy": 0.23031052500009536, "num_tokens": 83191886.0, "step": 40090 }, { "entropy": 5.5786596775054935, "epoch": 3.637064586357039, "grad_norm": 1.28125, "learning_rate": 0.0003721379705427994, "loss": 4.8555, "mean_token_accuracy": 0.2228209063410759, "num_tokens": 83202356.0, "step": 40095 }, { "entropy": 5.588511323928833, "epoch": 3.6375181422351233, "grad_norm": 1.359375, "learning_rate": 0.00037210878386635774, "loss": 4.9022, "mean_token_accuracy": 0.2290998339653015, "num_tokens": 83212909.0, "step": 40100 }, { "entropy": 5.614213991165161, "epoch": 3.6379716981132075, "grad_norm": 1.1328125, "learning_rate": 0.00037207959518168165, "loss": 4.8945, "mean_token_accuracy": 0.21607406586408615, "num_tokens": 83223523.0, "step": 40105 }, { "entropy": 5.720131683349609, "epoch": 3.638425253991292, "grad_norm": 1.234375, "learning_rate": 0.00037205040448937485, "loss": 5.0014, "mean_token_accuracy": 0.2137068212032318, "num_tokens": 83233665.0, "step": 40110 }, { "entropy": 5.582072639465332, "epoch": 3.638878809869376, "grad_norm": 1.296875, "learning_rate": 0.0003720212117900409, "loss": 4.7939, "mean_token_accuracy": 0.23158206194639205, "num_tokens": 83243563.0, "step": 40115 }, { "entropy": 5.591418981552124, "epoch": 3.6393323657474603, "grad_norm": 1.265625, "learning_rate": 0.00037199201708428356, "loss": 4.924, "mean_token_accuracy": 0.2201562389731407, "num_tokens": 83254246.0, "step": 40120 }, { "entropy": 5.602092361450195, "epoch": 3.639785921625544, "grad_norm": 1.296875, "learning_rate": 0.0003719628203727066, "loss": 4.8988, "mean_token_accuracy": 0.22000578045845032, "num_tokens": 83264361.0, "step": 40125 }, { "entropy": 5.625526285171508, "epoch": 3.6402394775036284, "grad_norm": 1.2890625, "learning_rate": 0.0003719336216559138, "loss": 4.9022, "mean_token_accuracy": 0.22219188064336776, "num_tokens": 83274193.0, "step": 40130 }, { "entropy": 5.590416049957275, "epoch": 3.6406930333817127, "grad_norm": 1.3671875, "learning_rate": 0.000371904420934509, "loss": 4.8511, "mean_token_accuracy": 0.22752234786748887, "num_tokens": 83284593.0, "step": 40135 }, { "entropy": 5.535084199905396, "epoch": 3.641146589259797, "grad_norm": 1.1953125, "learning_rate": 0.0003718752182090961, "loss": 4.8392, "mean_token_accuracy": 0.22235280573368071, "num_tokens": 83294602.0, "step": 40140 }, { "entropy": 5.563156509399414, "epoch": 3.6416001451378808, "grad_norm": 1.234375, "learning_rate": 0.000371846013480279, "loss": 4.8591, "mean_token_accuracy": 0.22184473574161528, "num_tokens": 83305399.0, "step": 40145 }, { "entropy": 5.512012386322022, "epoch": 3.642053701015965, "grad_norm": 1.2265625, "learning_rate": 0.00037181680674866165, "loss": 4.8322, "mean_token_accuracy": 0.21899324059486389, "num_tokens": 83315696.0, "step": 40150 }, { "entropy": 5.659463214874267, "epoch": 3.6425072568940493, "grad_norm": 1.25, "learning_rate": 0.0003717875980148481, "loss": 5.0079, "mean_token_accuracy": 0.21547501236200334, "num_tokens": 83326686.0, "step": 40155 }, { "entropy": 5.587709951400757, "epoch": 3.6429608127721336, "grad_norm": 1.2578125, "learning_rate": 0.0003717583872794423, "loss": 4.8518, "mean_token_accuracy": 0.23250453621149064, "num_tokens": 83336902.0, "step": 40160 }, { "entropy": 5.576013231277466, "epoch": 3.643414368650218, "grad_norm": 1.3125, "learning_rate": 0.0003717291745430484, "loss": 4.8575, "mean_token_accuracy": 0.22342123836278915, "num_tokens": 83347324.0, "step": 40165 }, { "entropy": 5.516481637954712, "epoch": 3.643867924528302, "grad_norm": 1.2578125, "learning_rate": 0.00037169995980627056, "loss": 4.8337, "mean_token_accuracy": 0.22125705778598787, "num_tokens": 83358458.0, "step": 40170 }, { "entropy": 5.533251857757568, "epoch": 3.644321480406386, "grad_norm": 1.1875, "learning_rate": 0.00037167074306971285, "loss": 4.9075, "mean_token_accuracy": 0.2192295253276825, "num_tokens": 83369047.0, "step": 40175 }, { "entropy": 5.598499536514282, "epoch": 3.64477503628447, "grad_norm": 1.171875, "learning_rate": 0.00037164152433397964, "loss": 4.8663, "mean_token_accuracy": 0.21933342069387435, "num_tokens": 83378891.0, "step": 40180 }, { "entropy": 5.582867956161499, "epoch": 3.6452285921625545, "grad_norm": 1.3359375, "learning_rate": 0.000371612303599675, "loss": 4.9296, "mean_token_accuracy": 0.22062188982963563, "num_tokens": 83389289.0, "step": 40185 }, { "entropy": 5.671322393417358, "epoch": 3.6456821480406387, "grad_norm": 1.25, "learning_rate": 0.00037158308086740336, "loss": 4.9564, "mean_token_accuracy": 0.21880175769329072, "num_tokens": 83399316.0, "step": 40190 }, { "entropy": 5.586907243728637, "epoch": 3.6461357039187225, "grad_norm": 1.2578125, "learning_rate": 0.0003715538561377689, "loss": 4.8887, "mean_token_accuracy": 0.22841109782457353, "num_tokens": 83409507.0, "step": 40195 }, { "entropy": 5.6554450511932375, "epoch": 3.646589259796807, "grad_norm": 1.2421875, "learning_rate": 0.0003715246294113762, "loss": 4.9862, "mean_token_accuracy": 0.2105707585811615, "num_tokens": 83419687.0, "step": 40200 }, { "entropy": 5.688238096237183, "epoch": 3.647042815674891, "grad_norm": 1.265625, "learning_rate": 0.00037149540068882945, "loss": 4.9758, "mean_token_accuracy": 0.21756171584129333, "num_tokens": 83429711.0, "step": 40205 }, { "entropy": 5.570241928100586, "epoch": 3.6474963715529753, "grad_norm": 1.296875, "learning_rate": 0.00037146616997073327, "loss": 4.8434, "mean_token_accuracy": 0.21197809725999833, "num_tokens": 83440116.0, "step": 40210 }, { "entropy": 5.57893443107605, "epoch": 3.6479499274310596, "grad_norm": 1.28125, "learning_rate": 0.00037143693725769214, "loss": 4.8522, "mean_token_accuracy": 0.22238032817840575, "num_tokens": 83450877.0, "step": 40215 }, { "entropy": 5.524405193328858, "epoch": 3.648403483309144, "grad_norm": 1.265625, "learning_rate": 0.00037140770255031066, "loss": 4.77, "mean_token_accuracy": 0.2300071597099304, "num_tokens": 83460080.0, "step": 40220 }, { "entropy": 5.5808837890625, "epoch": 3.6488570391872277, "grad_norm": 1.1953125, "learning_rate": 0.00037137846584919316, "loss": 4.934, "mean_token_accuracy": 0.2192599281668663, "num_tokens": 83469933.0, "step": 40225 }, { "entropy": 5.552589797973633, "epoch": 3.649310595065312, "grad_norm": 1.1171875, "learning_rate": 0.0003713492271549445, "loss": 4.8278, "mean_token_accuracy": 0.22599529922008516, "num_tokens": 83480477.0, "step": 40230 }, { "entropy": 5.562912702560425, "epoch": 3.6497641509433962, "grad_norm": 1.3203125, "learning_rate": 0.0003713199864681693, "loss": 4.8687, "mean_token_accuracy": 0.22306572645902634, "num_tokens": 83491022.0, "step": 40235 }, { "entropy": 5.633314943313598, "epoch": 3.6502177068214805, "grad_norm": 1.2734375, "learning_rate": 0.00037129074378947216, "loss": 4.9366, "mean_token_accuracy": 0.21957073658704757, "num_tokens": 83501643.0, "step": 40240 }, { "entropy": 5.642423486709594, "epoch": 3.6506712626995643, "grad_norm": 1.28125, "learning_rate": 0.00037126149911945796, "loss": 4.9165, "mean_token_accuracy": 0.21100935637950896, "num_tokens": 83511948.0, "step": 40245 }, { "entropy": 5.5929368019104, "epoch": 3.6511248185776486, "grad_norm": 1.265625, "learning_rate": 0.00037123225245873137, "loss": 4.9189, "mean_token_accuracy": 0.22216069996356963, "num_tokens": 83521939.0, "step": 40250 }, { "entropy": 5.677875185012818, "epoch": 3.651578374455733, "grad_norm": 1.2578125, "learning_rate": 0.00037120300380789727, "loss": 4.9161, "mean_token_accuracy": 0.221902734041214, "num_tokens": 83532098.0, "step": 40255 }, { "entropy": 5.617684268951416, "epoch": 3.652031930333817, "grad_norm": 1.203125, "learning_rate": 0.00037117375316756063, "loss": 4.9028, "mean_token_accuracy": 0.2231852427124977, "num_tokens": 83543238.0, "step": 40260 }, { "entropy": 5.612978982925415, "epoch": 3.6524854862119014, "grad_norm": 1.3671875, "learning_rate": 0.0003711445005383263, "loss": 4.9027, "mean_token_accuracy": 0.22354606091976165, "num_tokens": 83552969.0, "step": 40265 }, { "entropy": 5.633970308303833, "epoch": 3.6529390420899857, "grad_norm": 1.2734375, "learning_rate": 0.00037111524592079896, "loss": 4.9434, "mean_token_accuracy": 0.20890241712331772, "num_tokens": 83564569.0, "step": 40270 }, { "entropy": 5.618559503555298, "epoch": 3.65339259796807, "grad_norm": 1.2421875, "learning_rate": 0.000371085989315584, "loss": 4.9628, "mean_token_accuracy": 0.22019869089126587, "num_tokens": 83575613.0, "step": 40275 }, { "entropy": 5.6460196018219, "epoch": 3.6538461538461537, "grad_norm": 1.2265625, "learning_rate": 0.0003710567307232864, "loss": 4.927, "mean_token_accuracy": 0.21827946603298187, "num_tokens": 83586311.0, "step": 40280 }, { "entropy": 5.640784692764282, "epoch": 3.654299709724238, "grad_norm": 1.296875, "learning_rate": 0.00037102747014451095, "loss": 4.9356, "mean_token_accuracy": 0.21777148246765138, "num_tokens": 83596660.0, "step": 40285 }, { "entropy": 5.63956937789917, "epoch": 3.6547532656023223, "grad_norm": 1.3671875, "learning_rate": 0.000370998207579863, "loss": 4.9278, "mean_token_accuracy": 0.22158859074115753, "num_tokens": 83606882.0, "step": 40290 }, { "entropy": 5.6697368144989015, "epoch": 3.6552068214804065, "grad_norm": 1.421875, "learning_rate": 0.0003709689430299477, "loss": 4.9307, "mean_token_accuracy": 0.22426167130470276, "num_tokens": 83617380.0, "step": 40295 }, { "entropy": 5.635519790649414, "epoch": 3.6556603773584904, "grad_norm": 1.2734375, "learning_rate": 0.0003709396764953701, "loss": 4.9071, "mean_token_accuracy": 0.22047493755817413, "num_tokens": 83627961.0, "step": 40300 }, { "entropy": 5.460635232925415, "epoch": 3.6561139332365746, "grad_norm": 1.265625, "learning_rate": 0.0003709104079767357, "loss": 4.7874, "mean_token_accuracy": 0.23177144974470137, "num_tokens": 83637646.0, "step": 40305 }, { "entropy": 5.571348476409912, "epoch": 3.656567489114659, "grad_norm": 1.2421875, "learning_rate": 0.00037088113747464955, "loss": 4.8871, "mean_token_accuracy": 0.22469684183597566, "num_tokens": 83647807.0, "step": 40310 }, { "entropy": 5.568463754653931, "epoch": 3.657021044992743, "grad_norm": 1.3515625, "learning_rate": 0.000370851864989717, "loss": 4.9114, "mean_token_accuracy": 0.21802911311388015, "num_tokens": 83658002.0, "step": 40315 }, { "entropy": 5.535338544845581, "epoch": 3.6574746008708274, "grad_norm": 1.1953125, "learning_rate": 0.0003708225905225435, "loss": 4.856, "mean_token_accuracy": 0.2304181396961212, "num_tokens": 83667875.0, "step": 40320 }, { "entropy": 5.571807622909546, "epoch": 3.6579281567489117, "grad_norm": 1.171875, "learning_rate": 0.0003707933140737345, "loss": 4.8686, "mean_token_accuracy": 0.2227008119225502, "num_tokens": 83678376.0, "step": 40325 }, { "entropy": 5.62206802368164, "epoch": 3.6583817126269955, "grad_norm": 1.2734375, "learning_rate": 0.00037076403564389516, "loss": 4.9726, "mean_token_accuracy": 0.20957673490047454, "num_tokens": 83688318.0, "step": 40330 }, { "entropy": 5.606731748580932, "epoch": 3.65883526850508, "grad_norm": 1.2890625, "learning_rate": 0.0003707347552336313, "loss": 4.9072, "mean_token_accuracy": 0.21604602932929992, "num_tokens": 83698935.0, "step": 40335 }, { "entropy": 5.6294807434082035, "epoch": 3.659288824383164, "grad_norm": 1.2734375, "learning_rate": 0.0003707054728435482, "loss": 4.9682, "mean_token_accuracy": 0.22047323882579803, "num_tokens": 83709382.0, "step": 40340 }, { "entropy": 5.588862323760987, "epoch": 3.6597423802612483, "grad_norm": 1.2109375, "learning_rate": 0.0003706761884742516, "loss": 4.7945, "mean_token_accuracy": 0.2298911526799202, "num_tokens": 83719661.0, "step": 40345 }, { "entropy": 5.668063068389893, "epoch": 3.660195936139332, "grad_norm": 1.328125, "learning_rate": 0.00037064690212634707, "loss": 4.9446, "mean_token_accuracy": 0.2175290808081627, "num_tokens": 83730679.0, "step": 40350 }, { "entropy": 5.542167043685913, "epoch": 3.6606494920174164, "grad_norm": 1.25, "learning_rate": 0.0003706176138004401, "loss": 4.8039, "mean_token_accuracy": 0.22326629906892775, "num_tokens": 83740595.0, "step": 40355 }, { "entropy": 5.584343957901001, "epoch": 3.6611030478955007, "grad_norm": 1.25, "learning_rate": 0.00037058832349713667, "loss": 4.92, "mean_token_accuracy": 0.22128765732049943, "num_tokens": 83751605.0, "step": 40360 }, { "entropy": 5.651593971252441, "epoch": 3.661556603773585, "grad_norm": 1.375, "learning_rate": 0.0003705590312170422, "loss": 4.9971, "mean_token_accuracy": 0.21514691263437272, "num_tokens": 83763780.0, "step": 40365 }, { "entropy": 5.585455083847046, "epoch": 3.662010159651669, "grad_norm": 1.265625, "learning_rate": 0.00037052973696076274, "loss": 4.8323, "mean_token_accuracy": 0.23000090271234513, "num_tokens": 83773800.0, "step": 40370 }, { "entropy": 5.657545375823974, "epoch": 3.6624637155297535, "grad_norm": 1.171875, "learning_rate": 0.00037050044072890395, "loss": 4.9408, "mean_token_accuracy": 0.20326773226261138, "num_tokens": 83784402.0, "step": 40375 }, { "entropy": 5.556073427200317, "epoch": 3.6629172714078373, "grad_norm": 1.09375, "learning_rate": 0.0003704711425220717, "loss": 4.8505, "mean_token_accuracy": 0.21633521169424058, "num_tokens": 83794852.0, "step": 40380 }, { "entropy": 5.607731485366822, "epoch": 3.6633708272859216, "grad_norm": 1.2421875, "learning_rate": 0.0003704418423408718, "loss": 4.9083, "mean_token_accuracy": 0.2201412469148636, "num_tokens": 83805673.0, "step": 40385 }, { "entropy": 5.591914367675781, "epoch": 3.663824383164006, "grad_norm": 1.375, "learning_rate": 0.0003704125401859104, "loss": 4.8923, "mean_token_accuracy": 0.21845129430294036, "num_tokens": 83815779.0, "step": 40390 }, { "entropy": 5.634136152267456, "epoch": 3.66427793904209, "grad_norm": 1.359375, "learning_rate": 0.00037038323605779333, "loss": 4.8943, "mean_token_accuracy": 0.2250106915831566, "num_tokens": 83826804.0, "step": 40395 }, { "entropy": 5.6084047794342045, "epoch": 3.664731494920174, "grad_norm": 1.328125, "learning_rate": 0.0003703539299571266, "loss": 4.8932, "mean_token_accuracy": 0.21886310875415801, "num_tokens": 83836500.0, "step": 40400 }, { "entropy": 5.610776138305664, "epoch": 3.665185050798258, "grad_norm": 1.4375, "learning_rate": 0.0003703246218845163, "loss": 4.8697, "mean_token_accuracy": 0.22471242249011994, "num_tokens": 83846647.0, "step": 40405 }, { "entropy": 5.513819313049316, "epoch": 3.6656386066763424, "grad_norm": 1.2109375, "learning_rate": 0.0003702953118405686, "loss": 4.8431, "mean_token_accuracy": 0.22977578192949294, "num_tokens": 83858088.0, "step": 40410 }, { "entropy": 5.617538833618164, "epoch": 3.6660921625544267, "grad_norm": 1.203125, "learning_rate": 0.0003702659998258895, "loss": 4.887, "mean_token_accuracy": 0.21979725807905198, "num_tokens": 83868936.0, "step": 40415 }, { "entropy": 5.683864593505859, "epoch": 3.666545718432511, "grad_norm": 1.1953125, "learning_rate": 0.00037023668584108523, "loss": 5.0054, "mean_token_accuracy": 0.21251712441444398, "num_tokens": 83879813.0, "step": 40420 }, { "entropy": 5.568056678771972, "epoch": 3.6669992743105952, "grad_norm": 1.2578125, "learning_rate": 0.00037020736988676206, "loss": 4.8516, "mean_token_accuracy": 0.2191893130540848, "num_tokens": 83891619.0, "step": 40425 }, { "entropy": 5.643178462982178, "epoch": 3.6674528301886795, "grad_norm": 1.3203125, "learning_rate": 0.00037017805196352623, "loss": 4.9819, "mean_token_accuracy": 0.2209170177578926, "num_tokens": 83901905.0, "step": 40430 }, { "entropy": 5.541421842575073, "epoch": 3.6679063860667633, "grad_norm": 1.3125, "learning_rate": 0.000370148732071984, "loss": 4.8154, "mean_token_accuracy": 0.22036763280630112, "num_tokens": 83912827.0, "step": 40435 }, { "entropy": 5.536515235900879, "epoch": 3.6683599419448476, "grad_norm": 1.25, "learning_rate": 0.0003701194102127418, "loss": 4.7822, "mean_token_accuracy": 0.23038166910409927, "num_tokens": 83923719.0, "step": 40440 }, { "entropy": 5.499744510650634, "epoch": 3.668813497822932, "grad_norm": 1.2578125, "learning_rate": 0.0003700900863864059, "loss": 4.8613, "mean_token_accuracy": 0.22733352929353715, "num_tokens": 83933715.0, "step": 40445 }, { "entropy": 5.632646131515503, "epoch": 3.6692670537010157, "grad_norm": 1.265625, "learning_rate": 0.0003700607605935828, "loss": 4.9387, "mean_token_accuracy": 0.2187739446759224, "num_tokens": 83943946.0, "step": 40450 }, { "entropy": 5.627836227416992, "epoch": 3.6697206095791, "grad_norm": 1.4140625, "learning_rate": 0.0003700314328348789, "loss": 4.9303, "mean_token_accuracy": 0.22024703472852708, "num_tokens": 83953414.0, "step": 40455 }, { "entropy": 5.579219913482666, "epoch": 3.6701741654571842, "grad_norm": 1.1484375, "learning_rate": 0.0003700021031109008, "loss": 4.8468, "mean_token_accuracy": 0.22096900939941405, "num_tokens": 83963717.0, "step": 40460 }, { "entropy": 5.569381856918335, "epoch": 3.6706277213352685, "grad_norm": 1.328125, "learning_rate": 0.00036997277142225506, "loss": 4.8739, "mean_token_accuracy": 0.2230770096182823, "num_tokens": 83973467.0, "step": 40465 }, { "entropy": 5.573579883575439, "epoch": 3.6710812772133528, "grad_norm": 1.2109375, "learning_rate": 0.00036994343776954806, "loss": 4.9128, "mean_token_accuracy": 0.21792598068714142, "num_tokens": 83984013.0, "step": 40470 }, { "entropy": 5.6065747261047365, "epoch": 3.671534833091437, "grad_norm": 1.25, "learning_rate": 0.0003699141021533867, "loss": 4.791, "mean_token_accuracy": 0.2270532637834549, "num_tokens": 83994349.0, "step": 40475 }, { "entropy": 5.579814481735229, "epoch": 3.6719883889695213, "grad_norm": 1.484375, "learning_rate": 0.0003698847645743775, "loss": 4.7921, "mean_token_accuracy": 0.22049401104450225, "num_tokens": 84004525.0, "step": 40480 }, { "entropy": 5.567108869552612, "epoch": 3.672441944847605, "grad_norm": 1.3046875, "learning_rate": 0.0003698554250331271, "loss": 4.886, "mean_token_accuracy": 0.2230028837919235, "num_tokens": 84014286.0, "step": 40485 }, { "entropy": 5.548601055145264, "epoch": 3.6728955007256894, "grad_norm": 1.171875, "learning_rate": 0.0003698260835302424, "loss": 4.8475, "mean_token_accuracy": 0.22993536442518234, "num_tokens": 84024826.0, "step": 40490 }, { "entropy": 5.613683223724365, "epoch": 3.6733490566037736, "grad_norm": 1.1875, "learning_rate": 0.0003697967400663302, "loss": 4.9042, "mean_token_accuracy": 0.21963182538747789, "num_tokens": 84035726.0, "step": 40495 }, { "entropy": 5.558452701568603, "epoch": 3.673802612481858, "grad_norm": 1.203125, "learning_rate": 0.00036976739464199715, "loss": 4.7885, "mean_token_accuracy": 0.22456915080547332, "num_tokens": 84045573.0, "step": 40500 }, { "entropy": 5.625650644302368, "epoch": 3.6742561683599417, "grad_norm": 1.359375, "learning_rate": 0.00036973804725785024, "loss": 4.8926, "mean_token_accuracy": 0.21655002236366272, "num_tokens": 84055983.0, "step": 40505 }, { "entropy": 5.670609855651856, "epoch": 3.674709724238026, "grad_norm": 1.2265625, "learning_rate": 0.00036970869791449644, "loss": 4.9697, "mean_token_accuracy": 0.21881693750619888, "num_tokens": 84066905.0, "step": 40510 }, { "entropy": 5.586445426940918, "epoch": 3.6751632801161103, "grad_norm": 1.1875, "learning_rate": 0.00036967934661254263, "loss": 4.7938, "mean_token_accuracy": 0.23213589936494827, "num_tokens": 84076861.0, "step": 40515 }, { "entropy": 5.621592712402344, "epoch": 3.6756168359941945, "grad_norm": 1.21875, "learning_rate": 0.0003696499933525957, "loss": 4.8709, "mean_token_accuracy": 0.22316233217716216, "num_tokens": 84086167.0, "step": 40520 }, { "entropy": 5.5445457935333256, "epoch": 3.676070391872279, "grad_norm": 1.3671875, "learning_rate": 0.00036962063813526287, "loss": 4.86, "mean_token_accuracy": 0.22470114082098008, "num_tokens": 84095306.0, "step": 40525 }, { "entropy": 5.540723180770874, "epoch": 3.676523947750363, "grad_norm": 1.28125, "learning_rate": 0.0003695912809611511, "loss": 4.885, "mean_token_accuracy": 0.21967659145593643, "num_tokens": 84106505.0, "step": 40530 }, { "entropy": 5.639750051498413, "epoch": 3.676977503628447, "grad_norm": 1.28125, "learning_rate": 0.0003695619218308676, "loss": 4.8344, "mean_token_accuracy": 0.22541401386260987, "num_tokens": 84116393.0, "step": 40535 }, { "entropy": 5.6461762428283695, "epoch": 3.677431059506531, "grad_norm": 1.34375, "learning_rate": 0.00036953256074501937, "loss": 4.9071, "mean_token_accuracy": 0.22074188143014908, "num_tokens": 84125890.0, "step": 40540 }, { "entropy": 5.642495012283325, "epoch": 3.6778846153846154, "grad_norm": 1.171875, "learning_rate": 0.0003695031977042138, "loss": 4.8917, "mean_token_accuracy": 0.2238151878118515, "num_tokens": 84137736.0, "step": 40545 }, { "entropy": 5.588791608810425, "epoch": 3.6783381712626997, "grad_norm": 1.375, "learning_rate": 0.00036947383270905795, "loss": 4.9191, "mean_token_accuracy": 0.22469405084848404, "num_tokens": 84148974.0, "step": 40550 }, { "entropy": 5.591322612762451, "epoch": 3.6787917271407835, "grad_norm": 1.2421875, "learning_rate": 0.00036944446576015914, "loss": 4.9429, "mean_token_accuracy": 0.22222004234790801, "num_tokens": 84159041.0, "step": 40555 }, { "entropy": 5.5700091361999515, "epoch": 3.6792452830188678, "grad_norm": 1.2890625, "learning_rate": 0.00036941509685812476, "loss": 4.7992, "mean_token_accuracy": 0.22876355350017546, "num_tokens": 84169432.0, "step": 40560 }, { "entropy": 5.579265022277832, "epoch": 3.679698838896952, "grad_norm": 1.2734375, "learning_rate": 0.00036938572600356213, "loss": 4.8512, "mean_token_accuracy": 0.2202232375741005, "num_tokens": 84179964.0, "step": 40565 }, { "entropy": 5.5722352981567385, "epoch": 3.6801523947750363, "grad_norm": 1.3203125, "learning_rate": 0.00036935635319707856, "loss": 4.9168, "mean_token_accuracy": 0.21534696221351624, "num_tokens": 84189496.0, "step": 40570 }, { "entropy": 5.581364393234253, "epoch": 3.6806059506531206, "grad_norm": 1.265625, "learning_rate": 0.0003693269784392816, "loss": 4.8492, "mean_token_accuracy": 0.23357266634702684, "num_tokens": 84200396.0, "step": 40575 }, { "entropy": 5.544690084457398, "epoch": 3.681059506531205, "grad_norm": 1.4765625, "learning_rate": 0.00036929760173077863, "loss": 4.8182, "mean_token_accuracy": 0.22782830595970155, "num_tokens": 84210114.0, "step": 40580 }, { "entropy": 5.5797666072845455, "epoch": 3.6815130624092887, "grad_norm": 1.28125, "learning_rate": 0.0003692682230721773, "loss": 4.8536, "mean_token_accuracy": 0.2247671291232109, "num_tokens": 84220472.0, "step": 40585 }, { "entropy": 5.604016971588135, "epoch": 3.681966618287373, "grad_norm": 1.296875, "learning_rate": 0.0003692388424640851, "loss": 4.9013, "mean_token_accuracy": 0.21643133610486984, "num_tokens": 84230718.0, "step": 40590 }, { "entropy": 5.6349588394165036, "epoch": 3.682420174165457, "grad_norm": 1.3125, "learning_rate": 0.00036920945990710964, "loss": 4.8863, "mean_token_accuracy": 0.22070770114660263, "num_tokens": 84241736.0, "step": 40595 }, { "entropy": 5.527383279800415, "epoch": 3.6828737300435415, "grad_norm": 1.2734375, "learning_rate": 0.00036918007540185846, "loss": 4.8109, "mean_token_accuracy": 0.22870029509067535, "num_tokens": 84251770.0, "step": 40600 }, { "entropy": 5.584906721115113, "epoch": 3.6833272859216253, "grad_norm": 1.1640625, "learning_rate": 0.0003691506889489394, "loss": 4.9194, "mean_token_accuracy": 0.21823448687791824, "num_tokens": 84263355.0, "step": 40605 }, { "entropy": 5.59528341293335, "epoch": 3.6837808417997095, "grad_norm": 1.1953125, "learning_rate": 0.00036912130054896005, "loss": 4.9426, "mean_token_accuracy": 0.21586682349443437, "num_tokens": 84274835.0, "step": 40610 }, { "entropy": 5.686047029495239, "epoch": 3.684234397677794, "grad_norm": 1.1875, "learning_rate": 0.00036909191020252825, "loss": 4.99, "mean_token_accuracy": 0.20589088499546052, "num_tokens": 84286099.0, "step": 40615 }, { "entropy": 5.654107522964478, "epoch": 3.684687953555878, "grad_norm": 1.2890625, "learning_rate": 0.0003690625179102517, "loss": 4.9435, "mean_token_accuracy": 0.22320015281438826, "num_tokens": 84296168.0, "step": 40620 }, { "entropy": 5.69366192817688, "epoch": 3.6851415094339623, "grad_norm": 1.1953125, "learning_rate": 0.0003690331236727384, "loss": 4.9978, "mean_token_accuracy": 0.21234170496463775, "num_tokens": 84307352.0, "step": 40625 }, { "entropy": 5.598083782196045, "epoch": 3.6855950653120466, "grad_norm": 1.1953125, "learning_rate": 0.0003690037274905961, "loss": 4.9229, "mean_token_accuracy": 0.21975927352905272, "num_tokens": 84318496.0, "step": 40630 }, { "entropy": 5.544028568267822, "epoch": 3.686048621190131, "grad_norm": 1.1953125, "learning_rate": 0.0003689743293644327, "loss": 4.8453, "mean_token_accuracy": 0.22161079794168473, "num_tokens": 84329101.0, "step": 40635 }, { "entropy": 5.554684019088745, "epoch": 3.6865021770682147, "grad_norm": 1.2578125, "learning_rate": 0.0003689449292948563, "loss": 4.8635, "mean_token_accuracy": 0.22812528014183045, "num_tokens": 84339143.0, "step": 40640 }, { "entropy": 5.654756116867065, "epoch": 3.686955732946299, "grad_norm": 1.2421875, "learning_rate": 0.00036891552728247483, "loss": 4.8786, "mean_token_accuracy": 0.22400348335504533, "num_tokens": 84349693.0, "step": 40645 }, { "entropy": 5.63770751953125, "epoch": 3.6874092888243832, "grad_norm": 1.3203125, "learning_rate": 0.00036888612332789636, "loss": 4.8966, "mean_token_accuracy": 0.21775434613227845, "num_tokens": 84359799.0, "step": 40650 }, { "entropy": 5.5892339706420895, "epoch": 3.6878628447024675, "grad_norm": 1.1328125, "learning_rate": 0.00036885671743172875, "loss": 4.8977, "mean_token_accuracy": 0.22512342631816865, "num_tokens": 84370695.0, "step": 40655 }, { "entropy": 5.6030360698699955, "epoch": 3.6883164005805513, "grad_norm": 1.25, "learning_rate": 0.0003688273095945805, "loss": 4.9228, "mean_token_accuracy": 0.21315661668777466, "num_tokens": 84380205.0, "step": 40660 }, { "entropy": 5.648444652557373, "epoch": 3.6887699564586356, "grad_norm": 1.1328125, "learning_rate": 0.00036879789981705954, "loss": 4.884, "mean_token_accuracy": 0.2327017068862915, "num_tokens": 84391034.0, "step": 40665 }, { "entropy": 5.663483715057373, "epoch": 3.68922351233672, "grad_norm": 1.1796875, "learning_rate": 0.00036876848809977404, "loss": 4.9597, "mean_token_accuracy": 0.2124026194214821, "num_tokens": 84401452.0, "step": 40670 }, { "entropy": 5.553037786483765, "epoch": 3.689677068214804, "grad_norm": 1.2578125, "learning_rate": 0.00036873907444333234, "loss": 4.8233, "mean_token_accuracy": 0.2222222939133644, "num_tokens": 84411126.0, "step": 40675 }, { "entropy": 5.577631330490112, "epoch": 3.6901306240928884, "grad_norm": 1.140625, "learning_rate": 0.00036870965884834274, "loss": 4.876, "mean_token_accuracy": 0.22277166098356246, "num_tokens": 84422740.0, "step": 40680 }, { "entropy": 5.591572284698486, "epoch": 3.6905841799709727, "grad_norm": 1.4296875, "learning_rate": 0.00036868024131541337, "loss": 4.908, "mean_token_accuracy": 0.2163054034113884, "num_tokens": 84432831.0, "step": 40685 }, { "entropy": 5.65256814956665, "epoch": 3.6910377358490565, "grad_norm": 1.2890625, "learning_rate": 0.00036865082184515296, "loss": 4.9063, "mean_token_accuracy": 0.22705880254507066, "num_tokens": 84443176.0, "step": 40690 }, { "entropy": 5.660401153564453, "epoch": 3.6914912917271407, "grad_norm": 1.390625, "learning_rate": 0.00036862140043816957, "loss": 4.9654, "mean_token_accuracy": 0.21292325109243393, "num_tokens": 84453185.0, "step": 40695 }, { "entropy": 5.6245016098022464, "epoch": 3.691944847605225, "grad_norm": 1.21875, "learning_rate": 0.0003685919770950718, "loss": 4.8793, "mean_token_accuracy": 0.22527073919773102, "num_tokens": 84464303.0, "step": 40700 }, { "entropy": 5.615199756622315, "epoch": 3.6923984034833093, "grad_norm": 1.3359375, "learning_rate": 0.00036856255181646797, "loss": 4.9091, "mean_token_accuracy": 0.21953359246253967, "num_tokens": 84474463.0, "step": 40705 }, { "entropy": 5.5809777736663815, "epoch": 3.692851959361393, "grad_norm": 1.2734375, "learning_rate": 0.0003685331246029668, "loss": 4.8759, "mean_token_accuracy": 0.21850893944501876, "num_tokens": 84484682.0, "step": 40710 }, { "entropy": 5.6068253993988035, "epoch": 3.6933055152394774, "grad_norm": 1.3203125, "learning_rate": 0.00036850369545517685, "loss": 4.8552, "mean_token_accuracy": 0.22223106324672698, "num_tokens": 84494830.0, "step": 40715 }, { "entropy": 5.557840204238891, "epoch": 3.6937590711175616, "grad_norm": 1.2109375, "learning_rate": 0.0003684742643737065, "loss": 4.8395, "mean_token_accuracy": 0.22403172701597213, "num_tokens": 84505449.0, "step": 40720 }, { "entropy": 5.653700113296509, "epoch": 3.694212626995646, "grad_norm": 1.2421875, "learning_rate": 0.00036844483135916467, "loss": 4.9335, "mean_token_accuracy": 0.21957908123731612, "num_tokens": 84515833.0, "step": 40725 }, { "entropy": 5.6320253849029545, "epoch": 3.69466618287373, "grad_norm": 1.25, "learning_rate": 0.0003684153964121599, "loss": 4.9368, "mean_token_accuracy": 0.21804351806640626, "num_tokens": 84526677.0, "step": 40730 }, { "entropy": 5.591643905639648, "epoch": 3.6951197387518144, "grad_norm": 1.3671875, "learning_rate": 0.00036838595953330095, "loss": 4.8594, "mean_token_accuracy": 0.22896821796894073, "num_tokens": 84536656.0, "step": 40735 }, { "entropy": 5.6335373878479, "epoch": 3.6955732946298983, "grad_norm": 1.3125, "learning_rate": 0.00036835652072319646, "loss": 4.8216, "mean_token_accuracy": 0.22985567897558212, "num_tokens": 84546506.0, "step": 40740 }, { "entropy": 5.633129644393921, "epoch": 3.6960268505079825, "grad_norm": 1.2109375, "learning_rate": 0.0003683270799824554, "loss": 4.9454, "mean_token_accuracy": 0.2214898645877838, "num_tokens": 84556921.0, "step": 40745 }, { "entropy": 5.63296070098877, "epoch": 3.696480406386067, "grad_norm": 1.25, "learning_rate": 0.0003682976373116865, "loss": 4.8831, "mean_token_accuracy": 0.2270765036344528, "num_tokens": 84566325.0, "step": 40750 }, { "entropy": 5.5508081912994385, "epoch": 3.696933962264151, "grad_norm": 1.140625, "learning_rate": 0.00036826819271149877, "loss": 4.8423, "mean_token_accuracy": 0.21793505251407624, "num_tokens": 84577167.0, "step": 40755 }, { "entropy": 5.5803662776947025, "epoch": 3.697387518142235, "grad_norm": 1.3984375, "learning_rate": 0.00036823874618250105, "loss": 4.8549, "mean_token_accuracy": 0.22092701345682145, "num_tokens": 84586764.0, "step": 40760 }, { "entropy": 5.549526786804199, "epoch": 3.697841074020319, "grad_norm": 1.2421875, "learning_rate": 0.00036820929772530224, "loss": 4.8193, "mean_token_accuracy": 0.22408065795898438, "num_tokens": 84598903.0, "step": 40765 }, { "entropy": 5.548995923995972, "epoch": 3.6982946298984034, "grad_norm": 1.265625, "learning_rate": 0.0003681798473405114, "loss": 4.8251, "mean_token_accuracy": 0.2342318758368492, "num_tokens": 84608695.0, "step": 40770 }, { "entropy": 5.534334802627564, "epoch": 3.6987481857764877, "grad_norm": 1.28125, "learning_rate": 0.00036815039502873756, "loss": 4.8386, "mean_token_accuracy": 0.22162525057792665, "num_tokens": 84619377.0, "step": 40775 }, { "entropy": 5.542198753356933, "epoch": 3.699201741654572, "grad_norm": 1.15625, "learning_rate": 0.00036812094079058985, "loss": 4.8288, "mean_token_accuracy": 0.2200347140431404, "num_tokens": 84629716.0, "step": 40780 }, { "entropy": 5.508095455169678, "epoch": 3.699655297532656, "grad_norm": 1.265625, "learning_rate": 0.0003680914846266773, "loss": 4.7496, "mean_token_accuracy": 0.2336232766509056, "num_tokens": 84640214.0, "step": 40785 }, { "entropy": 5.599783134460449, "epoch": 3.7001088534107405, "grad_norm": 1.328125, "learning_rate": 0.0003680620265376092, "loss": 4.9542, "mean_token_accuracy": 0.22074273973703384, "num_tokens": 84650403.0, "step": 40790 }, { "entropy": 5.627480411529541, "epoch": 3.7005624092888243, "grad_norm": 1.2578125, "learning_rate": 0.00036803256652399456, "loss": 4.8247, "mean_token_accuracy": 0.22606240063905716, "num_tokens": 84660912.0, "step": 40795 }, { "entropy": 5.625306177139282, "epoch": 3.7010159651669086, "grad_norm": 1.3203125, "learning_rate": 0.00036800310458644285, "loss": 4.9071, "mean_token_accuracy": 0.21461918205022812, "num_tokens": 84672194.0, "step": 40800 }, { "entropy": 5.614631938934326, "epoch": 3.701469521044993, "grad_norm": 1.3359375, "learning_rate": 0.00036797364072556316, "loss": 4.9908, "mean_token_accuracy": 0.2116982087492943, "num_tokens": 84681850.0, "step": 40805 }, { "entropy": 5.65272536277771, "epoch": 3.7019230769230766, "grad_norm": 1.2890625, "learning_rate": 0.000367944174941965, "loss": 4.8874, "mean_token_accuracy": 0.2261722967028618, "num_tokens": 84691271.0, "step": 40810 }, { "entropy": 5.553043413162231, "epoch": 3.702376632801161, "grad_norm": 1.3203125, "learning_rate": 0.00036791470723625746, "loss": 4.8746, "mean_token_accuracy": 0.2184649884700775, "num_tokens": 84702189.0, "step": 40815 }, { "entropy": 5.589780235290528, "epoch": 3.702830188679245, "grad_norm": 1.1796875, "learning_rate": 0.0003678852376090502, "loss": 4.7905, "mean_token_accuracy": 0.23754313141107558, "num_tokens": 84712399.0, "step": 40820 }, { "entropy": 5.629763269424439, "epoch": 3.7032837445573294, "grad_norm": 1.2890625, "learning_rate": 0.0003678557660609525, "loss": 5.0125, "mean_token_accuracy": 0.21353862136602403, "num_tokens": 84723174.0, "step": 40825 }, { "entropy": 5.609356689453125, "epoch": 3.7037373004354137, "grad_norm": 1.265625, "learning_rate": 0.000367826292592574, "loss": 4.8693, "mean_token_accuracy": 0.23255186676979064, "num_tokens": 84732498.0, "step": 40830 }, { "entropy": 5.632840919494629, "epoch": 3.704190856313498, "grad_norm": 1.2734375, "learning_rate": 0.0003677968172045241, "loss": 4.905, "mean_token_accuracy": 0.21941236555576324, "num_tokens": 84742362.0, "step": 40835 }, { "entropy": 5.547799777984619, "epoch": 3.7046444121915822, "grad_norm": 1.3046875, "learning_rate": 0.0003677673398974122, "loss": 4.8827, "mean_token_accuracy": 0.22006913870573044, "num_tokens": 84753379.0, "step": 40840 }, { "entropy": 5.632326984405518, "epoch": 3.705097968069666, "grad_norm": 1.2734375, "learning_rate": 0.0003677378606718482, "loss": 4.9792, "mean_token_accuracy": 0.21458609998226166, "num_tokens": 84763245.0, "step": 40845 }, { "entropy": 5.62682991027832, "epoch": 3.7055515239477503, "grad_norm": 1.234375, "learning_rate": 0.0003677083795284416, "loss": 4.9174, "mean_token_accuracy": 0.2148534044623375, "num_tokens": 84773929.0, "step": 40850 }, { "entropy": 5.661520957946777, "epoch": 3.7060050798258346, "grad_norm": 1.21875, "learning_rate": 0.00036767889646780204, "loss": 4.9263, "mean_token_accuracy": 0.21308955252170564, "num_tokens": 84784733.0, "step": 40855 }, { "entropy": 5.595984411239624, "epoch": 3.706458635703919, "grad_norm": 1.171875, "learning_rate": 0.0003676494114905394, "loss": 4.8916, "mean_token_accuracy": 0.21934501230716705, "num_tokens": 84794254.0, "step": 40860 }, { "entropy": 5.61206283569336, "epoch": 3.7069121915820027, "grad_norm": 1.21875, "learning_rate": 0.00036761992459726325, "loss": 4.8828, "mean_token_accuracy": 0.21068903356790541, "num_tokens": 84804361.0, "step": 40865 }, { "entropy": 5.622202396392822, "epoch": 3.707365747460087, "grad_norm": 1.265625, "learning_rate": 0.00036759043578858344, "loss": 4.8836, "mean_token_accuracy": 0.22559751868247985, "num_tokens": 84814497.0, "step": 40870 }, { "entropy": 5.615522575378418, "epoch": 3.7078193033381712, "grad_norm": 1.140625, "learning_rate": 0.00036756094506510984, "loss": 4.8614, "mean_token_accuracy": 0.22450143992900848, "num_tokens": 84826871.0, "step": 40875 }, { "entropy": 5.606543302536011, "epoch": 3.7082728592162555, "grad_norm": 1.3671875, "learning_rate": 0.00036753145242745226, "loss": 4.8893, "mean_token_accuracy": 0.22307068556547166, "num_tokens": 84837053.0, "step": 40880 }, { "entropy": 5.5344452381134035, "epoch": 3.7087264150943398, "grad_norm": 1.3046875, "learning_rate": 0.0003675019578762208, "loss": 4.8277, "mean_token_accuracy": 0.229698546230793, "num_tokens": 84846681.0, "step": 40885 }, { "entropy": 5.547759103775024, "epoch": 3.709179970972424, "grad_norm": 1.3125, "learning_rate": 0.0003674724614120251, "loss": 4.8033, "mean_token_accuracy": 0.22371743470430375, "num_tokens": 84856651.0, "step": 40890 }, { "entropy": 5.582463359832763, "epoch": 3.709633526850508, "grad_norm": 1.1484375, "learning_rate": 0.00036744296303547547, "loss": 4.9663, "mean_token_accuracy": 0.21309611052274705, "num_tokens": 84867531.0, "step": 40895 }, { "entropy": 5.544451951980591, "epoch": 3.710087082728592, "grad_norm": 1.1875, "learning_rate": 0.0003674134627471818, "loss": 4.8513, "mean_token_accuracy": 0.228191015124321, "num_tokens": 84879132.0, "step": 40900 }, { "entropy": 5.617182207107544, "epoch": 3.7105406386066764, "grad_norm": 1.3203125, "learning_rate": 0.000367383960547754, "loss": 4.8898, "mean_token_accuracy": 0.2310369625687599, "num_tokens": 84888873.0, "step": 40905 }, { "entropy": 5.610183572769165, "epoch": 3.7109941944847606, "grad_norm": 1.375, "learning_rate": 0.00036735445643780256, "loss": 4.912, "mean_token_accuracy": 0.21800245046615602, "num_tokens": 84898926.0, "step": 40910 }, { "entropy": 5.5954345703125, "epoch": 3.7114477503628445, "grad_norm": 1.3515625, "learning_rate": 0.0003673249504179374, "loss": 4.8882, "mean_token_accuracy": 0.22153220772743226, "num_tokens": 84908502.0, "step": 40915 }, { "entropy": 5.597489547729492, "epoch": 3.7119013062409287, "grad_norm": 1.1484375, "learning_rate": 0.0003672954424887687, "loss": 4.8927, "mean_token_accuracy": 0.21910693496465683, "num_tokens": 84919681.0, "step": 40920 }, { "entropy": 5.509079360961914, "epoch": 3.712354862119013, "grad_norm": 1.1875, "learning_rate": 0.0003672659326509066, "loss": 4.7974, "mean_token_accuracy": 0.22543679177761078, "num_tokens": 84930149.0, "step": 40925 }, { "entropy": 5.541243362426758, "epoch": 3.7128084179970973, "grad_norm": 1.203125, "learning_rate": 0.00036723642090496166, "loss": 4.851, "mean_token_accuracy": 0.221881964802742, "num_tokens": 84940086.0, "step": 40930 }, { "entropy": 5.631255722045898, "epoch": 3.7132619738751815, "grad_norm": 1.40625, "learning_rate": 0.00036720690725154404, "loss": 4.9277, "mean_token_accuracy": 0.22272559404373168, "num_tokens": 84949248.0, "step": 40935 }, { "entropy": 5.568168640136719, "epoch": 3.713715529753266, "grad_norm": 1.203125, "learning_rate": 0.00036717739169126395, "loss": 4.8365, "mean_token_accuracy": 0.2264125943183899, "num_tokens": 84960892.0, "step": 40940 }, { "entropy": 5.5828814029693605, "epoch": 3.7141690856313496, "grad_norm": 1.2890625, "learning_rate": 0.00036714787422473206, "loss": 4.871, "mean_token_accuracy": 0.21667643636465073, "num_tokens": 84971024.0, "step": 40945 }, { "entropy": 5.526698207855224, "epoch": 3.714622641509434, "grad_norm": 1.1875, "learning_rate": 0.0003671183548525586, "loss": 4.7954, "mean_token_accuracy": 0.2248763158917427, "num_tokens": 84980945.0, "step": 40950 }, { "entropy": 5.60327000617981, "epoch": 3.715076197387518, "grad_norm": 1.234375, "learning_rate": 0.000367088833575354, "loss": 4.9402, "mean_token_accuracy": 0.21621231585741044, "num_tokens": 84992055.0, "step": 40955 }, { "entropy": 5.602426671981812, "epoch": 3.7155297532656024, "grad_norm": 1.265625, "learning_rate": 0.00036705931039372904, "loss": 4.9047, "mean_token_accuracy": 0.22144952267408372, "num_tokens": 85002619.0, "step": 40960 }, { "entropy": 5.6058001041412355, "epoch": 3.7159833091436862, "grad_norm": 1.3671875, "learning_rate": 0.0003670297853082939, "loss": 4.8789, "mean_token_accuracy": 0.22271185368299484, "num_tokens": 85013317.0, "step": 40965 }, { "entropy": 5.60260238647461, "epoch": 3.7164368650217705, "grad_norm": 1.234375, "learning_rate": 0.00036700025831965937, "loss": 4.8557, "mean_token_accuracy": 0.22290650755167007, "num_tokens": 85023457.0, "step": 40970 }, { "entropy": 5.591012859344483, "epoch": 3.7168904208998548, "grad_norm": 1.265625, "learning_rate": 0.00036697072942843616, "loss": 4.8519, "mean_token_accuracy": 0.21889072507619858, "num_tokens": 85033498.0, "step": 40975 }, { "entropy": 5.718241167068482, "epoch": 3.717343976777939, "grad_norm": 1.2421875, "learning_rate": 0.0003669411986352348, "loss": 5.0748, "mean_token_accuracy": 0.21237341016530992, "num_tokens": 85043687.0, "step": 40980 }, { "entropy": 5.645121812820435, "epoch": 3.7177975326560233, "grad_norm": 1.0703125, "learning_rate": 0.000366911665940666, "loss": 4.9301, "mean_token_accuracy": 0.22174159288406373, "num_tokens": 85055045.0, "step": 40985 }, { "entropy": 5.598646831512451, "epoch": 3.7182510885341076, "grad_norm": 1.265625, "learning_rate": 0.00036688213134534044, "loss": 4.812, "mean_token_accuracy": 0.23610011339187623, "num_tokens": 85064625.0, "step": 40990 }, { "entropy": 5.700275182723999, "epoch": 3.718704644412192, "grad_norm": 1.2890625, "learning_rate": 0.0003668525948498691, "loss": 5.0392, "mean_token_accuracy": 0.2058858245611191, "num_tokens": 85075249.0, "step": 40995 }, { "entropy": 5.59577374458313, "epoch": 3.7191582002902757, "grad_norm": 1.1875, "learning_rate": 0.00036682305645486266, "loss": 4.8885, "mean_token_accuracy": 0.22311525642871857, "num_tokens": 85085900.0, "step": 41000 }, { "entropy": 5.603970909118653, "epoch": 3.71961175616836, "grad_norm": 1.2265625, "learning_rate": 0.00036679351616093194, "loss": 4.9202, "mean_token_accuracy": 0.22257013618946075, "num_tokens": 85095772.0, "step": 41005 }, { "entropy": 5.557195234298706, "epoch": 3.720065312046444, "grad_norm": 1.359375, "learning_rate": 0.00036676397396868797, "loss": 4.8347, "mean_token_accuracy": 0.22497595250606536, "num_tokens": 85105653.0, "step": 41010 }, { "entropy": 5.6220947265625, "epoch": 3.7205188679245285, "grad_norm": 1.28125, "learning_rate": 0.0003667344298787417, "loss": 4.9634, "mean_token_accuracy": 0.21566734611988067, "num_tokens": 85115432.0, "step": 41015 }, { "entropy": 5.69744758605957, "epoch": 3.7209724238026123, "grad_norm": 1.25, "learning_rate": 0.00036670488389170395, "loss": 5.0565, "mean_token_accuracy": 0.20855958312749862, "num_tokens": 85126572.0, "step": 41020 }, { "entropy": 5.544163751602173, "epoch": 3.7214259796806965, "grad_norm": 1.3671875, "learning_rate": 0.00036667533600818586, "loss": 4.8246, "mean_token_accuracy": 0.22635802775621414, "num_tokens": 85136809.0, "step": 41025 }, { "entropy": 5.763647508621216, "epoch": 3.721879535558781, "grad_norm": 1.2578125, "learning_rate": 0.0003666457862287985, "loss": 5.0487, "mean_token_accuracy": 0.20916630029678346, "num_tokens": 85148346.0, "step": 41030 }, { "entropy": 5.5963341236114506, "epoch": 3.722333091436865, "grad_norm": 1.171875, "learning_rate": 0.00036661623455415296, "loss": 4.8949, "mean_token_accuracy": 0.21946420073509215, "num_tokens": 85158807.0, "step": 41035 }, { "entropy": 5.659514570236206, "epoch": 3.7227866473149493, "grad_norm": 1.234375, "learning_rate": 0.0003665866809848602, "loss": 4.9871, "mean_token_accuracy": 0.20989061743021012, "num_tokens": 85170752.0, "step": 41040 }, { "entropy": 5.614282131195068, "epoch": 3.7232402031930336, "grad_norm": 1.3515625, "learning_rate": 0.00036655712552153164, "loss": 4.8869, "mean_token_accuracy": 0.22241588532924653, "num_tokens": 85180779.0, "step": 41045 }, { "entropy": 5.623584985733032, "epoch": 3.7236937590711174, "grad_norm": 1.1640625, "learning_rate": 0.0003665275681647784, "loss": 4.8698, "mean_token_accuracy": 0.22459035813808442, "num_tokens": 85191391.0, "step": 41050 }, { "entropy": 5.610738611221313, "epoch": 3.7241473149492017, "grad_norm": 1.09375, "learning_rate": 0.0003664980089152116, "loss": 4.863, "mean_token_accuracy": 0.22108899652957917, "num_tokens": 85201357.0, "step": 41055 }, { "entropy": 5.587913513183594, "epoch": 3.724600870827286, "grad_norm": 1.359375, "learning_rate": 0.00036646844777344284, "loss": 4.8902, "mean_token_accuracy": 0.22266859263181688, "num_tokens": 85212193.0, "step": 41060 }, { "entropy": 5.615016460418701, "epoch": 3.7250544267053702, "grad_norm": 1.21875, "learning_rate": 0.00036643888474008313, "loss": 4.9174, "mean_token_accuracy": 0.21867918223142624, "num_tokens": 85223809.0, "step": 41065 }, { "entropy": 5.601362895965576, "epoch": 3.725507982583454, "grad_norm": 1.3203125, "learning_rate": 0.0003664093198157441, "loss": 4.88, "mean_token_accuracy": 0.22628283500671387, "num_tokens": 85234992.0, "step": 41070 }, { "entropy": 5.660713815689087, "epoch": 3.7259615384615383, "grad_norm": 1.2890625, "learning_rate": 0.0003663797530010369, "loss": 4.9297, "mean_token_accuracy": 0.21391869336366653, "num_tokens": 85244157.0, "step": 41075 }, { "entropy": 5.583652782440185, "epoch": 3.7264150943396226, "grad_norm": 1.15625, "learning_rate": 0.0003663501842965732, "loss": 4.8582, "mean_token_accuracy": 0.22759334444999696, "num_tokens": 85255946.0, "step": 41080 }, { "entropy": 5.556160831451416, "epoch": 3.726868650217707, "grad_norm": 1.34375, "learning_rate": 0.0003663206137029645, "loss": 4.8473, "mean_token_accuracy": 0.22499336004257203, "num_tokens": 85265273.0, "step": 41085 }, { "entropy": 5.48696665763855, "epoch": 3.727322206095791, "grad_norm": 1.25, "learning_rate": 0.00036629104122082215, "loss": 4.7173, "mean_token_accuracy": 0.2295747622847557, "num_tokens": 85275794.0, "step": 41090 }, { "entropy": 5.577328300476074, "epoch": 3.7277757619738754, "grad_norm": 1.25, "learning_rate": 0.00036626146685075775, "loss": 4.9822, "mean_token_accuracy": 0.2084342882037163, "num_tokens": 85287334.0, "step": 41095 }, { "entropy": 5.612257575988769, "epoch": 3.728229317851959, "grad_norm": 1.3203125, "learning_rate": 0.000366231890593383, "loss": 4.9002, "mean_token_accuracy": 0.22396960407495498, "num_tokens": 85297320.0, "step": 41100 }, { "entropy": 5.553638029098511, "epoch": 3.7286828737300435, "grad_norm": 1.28125, "learning_rate": 0.0003662023124493095, "loss": 4.7923, "mean_token_accuracy": 0.22827279567718506, "num_tokens": 85308071.0, "step": 41105 }, { "entropy": 5.593637084960937, "epoch": 3.7291364296081277, "grad_norm": 1.2109375, "learning_rate": 0.000366172732419149, "loss": 4.908, "mean_token_accuracy": 0.21741290986537934, "num_tokens": 85317790.0, "step": 41110 }, { "entropy": 5.621043968200683, "epoch": 3.729589985486212, "grad_norm": 1.171875, "learning_rate": 0.00036614315050351317, "loss": 4.9721, "mean_token_accuracy": 0.21697428822517395, "num_tokens": 85329008.0, "step": 41115 }, { "entropy": 5.719133090972901, "epoch": 3.730043541364296, "grad_norm": 1.2265625, "learning_rate": 0.0003661135667030137, "loss": 4.9921, "mean_token_accuracy": 0.21347654163837432, "num_tokens": 85339095.0, "step": 41120 }, { "entropy": 5.656979417800903, "epoch": 3.73049709724238, "grad_norm": 1.3046875, "learning_rate": 0.0003660839810182624, "loss": 4.9177, "mean_token_accuracy": 0.21583237648010253, "num_tokens": 85349833.0, "step": 41125 }, { "entropy": 5.642375040054321, "epoch": 3.7309506531204644, "grad_norm": 1.1875, "learning_rate": 0.00036605439344987125, "loss": 4.9588, "mean_token_accuracy": 0.2127848371863365, "num_tokens": 85359512.0, "step": 41130 }, { "entropy": 5.5954430103302, "epoch": 3.7314042089985486, "grad_norm": 1.3203125, "learning_rate": 0.000366024803998452, "loss": 4.9285, "mean_token_accuracy": 0.22528755962848662, "num_tokens": 85370053.0, "step": 41135 }, { "entropy": 5.6010528087615965, "epoch": 3.731857764876633, "grad_norm": 1.2265625, "learning_rate": 0.00036599521266461653, "loss": 4.8947, "mean_token_accuracy": 0.2228283017873764, "num_tokens": 85380020.0, "step": 41140 }, { "entropy": 5.624449300765991, "epoch": 3.732311320754717, "grad_norm": 1.3671875, "learning_rate": 0.00036596561944897703, "loss": 4.8999, "mean_token_accuracy": 0.22425800412893296, "num_tokens": 85390232.0, "step": 41145 }, { "entropy": 5.536047077178955, "epoch": 3.7327648766328014, "grad_norm": 1.3828125, "learning_rate": 0.0003659360243521453, "loss": 4.8097, "mean_token_accuracy": 0.2284854993224144, "num_tokens": 85400401.0, "step": 41150 }, { "entropy": 5.606580114364624, "epoch": 3.7332184325108853, "grad_norm": 1.234375, "learning_rate": 0.0003659064273747334, "loss": 4.917, "mean_token_accuracy": 0.21334304958581923, "num_tokens": 85411749.0, "step": 41155 }, { "entropy": 5.663390398025513, "epoch": 3.7336719883889695, "grad_norm": 1.171875, "learning_rate": 0.00036587682851735336, "loss": 4.9735, "mean_token_accuracy": 0.21453898549079894, "num_tokens": 85424065.0, "step": 41160 }, { "entropy": 5.632834243774414, "epoch": 3.734125544267054, "grad_norm": 1.21875, "learning_rate": 0.00036584722778061743, "loss": 4.9147, "mean_token_accuracy": 0.21882192492485047, "num_tokens": 85434412.0, "step": 41165 }, { "entropy": 5.617663812637329, "epoch": 3.7345791001451376, "grad_norm": 1.2890625, "learning_rate": 0.0003658176251651376, "loss": 4.8997, "mean_token_accuracy": 0.22405829578638076, "num_tokens": 85444489.0, "step": 41170 }, { "entropy": 5.638788795471191, "epoch": 3.735032656023222, "grad_norm": 1.3046875, "learning_rate": 0.00036578802067152615, "loss": 4.8872, "mean_token_accuracy": 0.22335279434919358, "num_tokens": 85454556.0, "step": 41175 }, { "entropy": 5.5778968334198, "epoch": 3.735486211901306, "grad_norm": 1.3046875, "learning_rate": 0.0003657584143003954, "loss": 4.8174, "mean_token_accuracy": 0.22520850449800492, "num_tokens": 85464701.0, "step": 41180 }, { "entropy": 5.616639232635498, "epoch": 3.7359397677793904, "grad_norm": 1.1796875, "learning_rate": 0.0003657288060523574, "loss": 4.9437, "mean_token_accuracy": 0.22143598794937133, "num_tokens": 85475657.0, "step": 41185 }, { "entropy": 5.609533166885376, "epoch": 3.7363933236574747, "grad_norm": 1.265625, "learning_rate": 0.00036569919592802466, "loss": 4.8719, "mean_token_accuracy": 0.22944324612617492, "num_tokens": 85486358.0, "step": 41190 }, { "entropy": 5.630937242507935, "epoch": 3.736846879535559, "grad_norm": 1.21875, "learning_rate": 0.0003656695839280093, "loss": 4.8928, "mean_token_accuracy": 0.2160073608160019, "num_tokens": 85497913.0, "step": 41195 }, { "entropy": 5.606608200073242, "epoch": 3.737300435413643, "grad_norm": 1.8828125, "learning_rate": 0.00036563997005292396, "loss": 4.8943, "mean_token_accuracy": 0.22670585811138153, "num_tokens": 85508314.0, "step": 41200 }, { "entropy": 5.583343982696533, "epoch": 3.737753991291727, "grad_norm": 1.25, "learning_rate": 0.00036561035430338084, "loss": 4.8983, "mean_token_accuracy": 0.2173798844218254, "num_tokens": 85518142.0, "step": 41205 }, { "entropy": 5.590759515762329, "epoch": 3.7382075471698113, "grad_norm": 1.2890625, "learning_rate": 0.00036558073667999257, "loss": 4.7717, "mean_token_accuracy": 0.22751502841711044, "num_tokens": 85526854.0, "step": 41210 }, { "entropy": 5.52944507598877, "epoch": 3.7386611030478956, "grad_norm": 1.25, "learning_rate": 0.00036555111718337166, "loss": 4.7815, "mean_token_accuracy": 0.231533545255661, "num_tokens": 85537153.0, "step": 41215 }, { "entropy": 5.643707227706909, "epoch": 3.73911465892598, "grad_norm": 1.203125, "learning_rate": 0.0003655214958141305, "loss": 4.9817, "mean_token_accuracy": 0.20915819555521012, "num_tokens": 85548583.0, "step": 41220 }, { "entropy": 5.635319185256958, "epoch": 3.7395682148040637, "grad_norm": 1.359375, "learning_rate": 0.00036549187257288164, "loss": 4.9336, "mean_token_accuracy": 0.23079233914613723, "num_tokens": 85559228.0, "step": 41225 }, { "entropy": 5.664715909957886, "epoch": 3.740021770682148, "grad_norm": 1.2421875, "learning_rate": 0.00036546224746023795, "loss": 4.8516, "mean_token_accuracy": 0.22583277374505997, "num_tokens": 85569757.0, "step": 41230 }, { "entropy": 5.582386016845703, "epoch": 3.740475326560232, "grad_norm": 1.109375, "learning_rate": 0.00036543262047681186, "loss": 4.8827, "mean_token_accuracy": 0.22723791897296905, "num_tokens": 85582013.0, "step": 41235 }, { "entropy": 5.600093841552734, "epoch": 3.7409288824383164, "grad_norm": 1.2265625, "learning_rate": 0.0003654029916232161, "loss": 4.8691, "mean_token_accuracy": 0.2359455034136772, "num_tokens": 85594049.0, "step": 41240 }, { "entropy": 5.612578725814819, "epoch": 3.7413824383164007, "grad_norm": 1.4921875, "learning_rate": 0.00036537336090006347, "loss": 4.9041, "mean_token_accuracy": 0.2179932862520218, "num_tokens": 85605253.0, "step": 41245 }, { "entropy": 5.597386074066162, "epoch": 3.741835994194485, "grad_norm": 1.359375, "learning_rate": 0.00036534372830796674, "loss": 4.8405, "mean_token_accuracy": 0.22601506114006042, "num_tokens": 85615032.0, "step": 41250 }, { "entropy": 5.59451150894165, "epoch": 3.742289550072569, "grad_norm": 1.265625, "learning_rate": 0.0003653140938475386, "loss": 4.868, "mean_token_accuracy": 0.2282341718673706, "num_tokens": 85625497.0, "step": 41255 }, { "entropy": 5.621959257125854, "epoch": 3.742743105950653, "grad_norm": 1.125, "learning_rate": 0.00036528445751939206, "loss": 4.9214, "mean_token_accuracy": 0.22247463017702102, "num_tokens": 85636058.0, "step": 41260 }, { "entropy": 5.5920909404754635, "epoch": 3.7431966618287373, "grad_norm": 1.34375, "learning_rate": 0.00036525481932413997, "loss": 4.9067, "mean_token_accuracy": 0.22008536010980606, "num_tokens": 85646505.0, "step": 41265 }, { "entropy": 5.6329492092132565, "epoch": 3.7436502177068216, "grad_norm": 1.2109375, "learning_rate": 0.00036522517926239513, "loss": 4.8832, "mean_token_accuracy": 0.2221252754330635, "num_tokens": 85656864.0, "step": 41270 }, { "entropy": 5.547658443450928, "epoch": 3.7441037735849054, "grad_norm": 1.234375, "learning_rate": 0.00036519553733477055, "loss": 4.8174, "mean_token_accuracy": 0.2276010200381279, "num_tokens": 85666783.0, "step": 41275 }, { "entropy": 5.49616322517395, "epoch": 3.7445573294629897, "grad_norm": 1.3203125, "learning_rate": 0.0003651658935418794, "loss": 4.7677, "mean_token_accuracy": 0.2311669573187828, "num_tokens": 85677102.0, "step": 41280 }, { "entropy": 5.536429309844971, "epoch": 3.745010885341074, "grad_norm": 1.21875, "learning_rate": 0.00036513624788433454, "loss": 4.8137, "mean_token_accuracy": 0.23184246569871902, "num_tokens": 85687048.0, "step": 41285 }, { "entropy": 5.565611505508423, "epoch": 3.7454644412191582, "grad_norm": 1.2578125, "learning_rate": 0.0003651066003627491, "loss": 4.8782, "mean_token_accuracy": 0.21524805575609207, "num_tokens": 85698314.0, "step": 41290 }, { "entropy": 5.6669567108154295, "epoch": 3.7459179970972425, "grad_norm": 1.3359375, "learning_rate": 0.0003650769509777362, "loss": 4.945, "mean_token_accuracy": 0.2164806380867958, "num_tokens": 85708039.0, "step": 41295 }, { "entropy": 5.601735973358155, "epoch": 3.7463715529753268, "grad_norm": 1.5, "learning_rate": 0.00036504729972990904, "loss": 4.8028, "mean_token_accuracy": 0.23303242027759552, "num_tokens": 85717741.0, "step": 41300 }, { "entropy": 5.613136911392212, "epoch": 3.7468251088534106, "grad_norm": 1.2421875, "learning_rate": 0.0003650176466198807, "loss": 4.8794, "mean_token_accuracy": 0.2254712015390396, "num_tokens": 85728286.0, "step": 41305 }, { "entropy": 5.569131183624267, "epoch": 3.747278664731495, "grad_norm": 1.3359375, "learning_rate": 0.00036498799164826453, "loss": 4.863, "mean_token_accuracy": 0.22300679981708527, "num_tokens": 85738970.0, "step": 41310 }, { "entropy": 5.543033075332642, "epoch": 3.747732220609579, "grad_norm": 1.359375, "learning_rate": 0.00036495833481567375, "loss": 4.8252, "mean_token_accuracy": 0.22323786318302155, "num_tokens": 85749284.0, "step": 41315 }, { "entropy": 5.646782684326172, "epoch": 3.7481857764876634, "grad_norm": 1.2734375, "learning_rate": 0.00036492867612272176, "loss": 4.929, "mean_token_accuracy": 0.21498074531555175, "num_tokens": 85759595.0, "step": 41320 }, { "entropy": 5.688265657424926, "epoch": 3.748639332365747, "grad_norm": 1.28125, "learning_rate": 0.0003648990155700217, "loss": 4.976, "mean_token_accuracy": 0.21302862763404845, "num_tokens": 85771049.0, "step": 41325 }, { "entropy": 5.629099130630493, "epoch": 3.7490928882438315, "grad_norm": 1.296875, "learning_rate": 0.00036486935315818713, "loss": 4.8803, "mean_token_accuracy": 0.21610768288373947, "num_tokens": 85781656.0, "step": 41330 }, { "entropy": 5.5362084865570065, "epoch": 3.7495464441219157, "grad_norm": 1.1640625, "learning_rate": 0.00036483968888783154, "loss": 4.7499, "mean_token_accuracy": 0.22503260970115663, "num_tokens": 85790922.0, "step": 41335 }, { "entropy": 5.564342403411866, "epoch": 3.75, "grad_norm": 1.359375, "learning_rate": 0.00036481002275956813, "loss": 4.8265, "mean_token_accuracy": 0.22990502566099166, "num_tokens": 85799928.0, "step": 41340 }, { "entropy": 5.589816522598267, "epoch": 3.7504535558780843, "grad_norm": 1.2265625, "learning_rate": 0.0003647803547740106, "loss": 4.9142, "mean_token_accuracy": 0.2163300946354866, "num_tokens": 85810594.0, "step": 41345 }, { "entropy": 5.574264621734619, "epoch": 3.7509071117561685, "grad_norm": 1.3125, "learning_rate": 0.00036475068493177254, "loss": 4.8984, "mean_token_accuracy": 0.21630749255418777, "num_tokens": 85820690.0, "step": 41350 }, { "entropy": 5.577137517929077, "epoch": 3.751360667634253, "grad_norm": 1.2421875, "learning_rate": 0.0003647210132334674, "loss": 4.8409, "mean_token_accuracy": 0.22375607639551162, "num_tokens": 85830314.0, "step": 41355 }, { "entropy": 5.5901806354522705, "epoch": 3.7518142235123366, "grad_norm": 1.3125, "learning_rate": 0.0003646913396797088, "loss": 4.9485, "mean_token_accuracy": 0.2082374632358551, "num_tokens": 85841099.0, "step": 41360 }, { "entropy": 5.651024913787841, "epoch": 3.752267779390421, "grad_norm": 1.1328125, "learning_rate": 0.00036466166427111046, "loss": 4.8705, "mean_token_accuracy": 0.22038891017436982, "num_tokens": 85852813.0, "step": 41365 }, { "entropy": 5.607216024398804, "epoch": 3.752721335268505, "grad_norm": 1.3359375, "learning_rate": 0.00036463198700828616, "loss": 4.8257, "mean_token_accuracy": 0.22262684255838394, "num_tokens": 85862778.0, "step": 41370 }, { "entropy": 5.571303033828736, "epoch": 3.7531748911465894, "grad_norm": 1.1875, "learning_rate": 0.0003646023078918494, "loss": 4.9037, "mean_token_accuracy": 0.21781998723745347, "num_tokens": 85872729.0, "step": 41375 }, { "entropy": 5.60386028289795, "epoch": 3.7536284470246732, "grad_norm": 1.2109375, "learning_rate": 0.0003645726269224141, "loss": 4.8656, "mean_token_accuracy": 0.22781819850206375, "num_tokens": 85883289.0, "step": 41380 }, { "entropy": 5.535169172286987, "epoch": 3.7540820029027575, "grad_norm": 1.265625, "learning_rate": 0.00036454294410059407, "loss": 4.8025, "mean_token_accuracy": 0.23517142683267594, "num_tokens": 85892318.0, "step": 41385 }, { "entropy": 5.547143268585205, "epoch": 3.7545355587808418, "grad_norm": 1.21875, "learning_rate": 0.0003645132594270032, "loss": 4.8623, "mean_token_accuracy": 0.2212044984102249, "num_tokens": 85902719.0, "step": 41390 }, { "entropy": 5.563756227493286, "epoch": 3.754989114658926, "grad_norm": 1.21875, "learning_rate": 0.00036448357290225523, "loss": 4.8392, "mean_token_accuracy": 0.2256179392337799, "num_tokens": 85913271.0, "step": 41395 }, { "entropy": 5.550149583816529, "epoch": 3.7554426705370103, "grad_norm": 1.2890625, "learning_rate": 0.0003644538845269642, "loss": 4.7868, "mean_token_accuracy": 0.2275686427950859, "num_tokens": 85922397.0, "step": 41400 }, { "entropy": 5.639441061019897, "epoch": 3.7558962264150946, "grad_norm": 1.2265625, "learning_rate": 0.000364424194301744, "loss": 4.9013, "mean_token_accuracy": 0.22138051986694335, "num_tokens": 85933261.0, "step": 41405 }, { "entropy": 5.669304132461548, "epoch": 3.7563497822931784, "grad_norm": 1.265625, "learning_rate": 0.0003643945022272087, "loss": 4.954, "mean_token_accuracy": 0.22452425211668015, "num_tokens": 85943860.0, "step": 41410 }, { "entropy": 5.656178712844849, "epoch": 3.7568033381712627, "grad_norm": 1.3203125, "learning_rate": 0.0003643648083039724, "loss": 4.9515, "mean_token_accuracy": 0.21566831767559053, "num_tokens": 85953984.0, "step": 41415 }, { "entropy": 5.608934211730957, "epoch": 3.757256894049347, "grad_norm": 1.3046875, "learning_rate": 0.000364335112532649, "loss": 4.8853, "mean_token_accuracy": 0.22674254924058915, "num_tokens": 85964771.0, "step": 41420 }, { "entropy": 5.598434019088745, "epoch": 3.757710449927431, "grad_norm": 1.1953125, "learning_rate": 0.0003643054149138527, "loss": 4.925, "mean_token_accuracy": 0.2164538323879242, "num_tokens": 85975859.0, "step": 41425 }, { "entropy": 5.680511379241944, "epoch": 3.758164005805515, "grad_norm": 1.1875, "learning_rate": 0.00036427571544819765, "loss": 4.9526, "mean_token_accuracy": 0.2212819054722786, "num_tokens": 85987022.0, "step": 41430 }, { "entropy": 5.573312187194825, "epoch": 3.7586175616835993, "grad_norm": 1.328125, "learning_rate": 0.0003642460141362981, "loss": 4.8312, "mean_token_accuracy": 0.2280511274933815, "num_tokens": 85997056.0, "step": 41435 }, { "entropy": 5.6508503437042235, "epoch": 3.7590711175616836, "grad_norm": 1.234375, "learning_rate": 0.00036421631097876823, "loss": 4.947, "mean_token_accuracy": 0.21813933849334716, "num_tokens": 86008853.0, "step": 41440 }, { "entropy": 5.5742310047149655, "epoch": 3.759524673439768, "grad_norm": 1.2421875, "learning_rate": 0.0003641866059762223, "loss": 4.9, "mean_token_accuracy": 0.21943695843219757, "num_tokens": 86020358.0, "step": 41445 }, { "entropy": 5.610048627853393, "epoch": 3.759978229317852, "grad_norm": 1.1484375, "learning_rate": 0.0003641568991292747, "loss": 4.9094, "mean_token_accuracy": 0.21778797805309297, "num_tokens": 86030706.0, "step": 41450 }, { "entropy": 5.681662559509277, "epoch": 3.7604317851959363, "grad_norm": 1.1953125, "learning_rate": 0.00036412719043853956, "loss": 4.9622, "mean_token_accuracy": 0.216257506608963, "num_tokens": 86041964.0, "step": 41455 }, { "entropy": 5.657385921478271, "epoch": 3.76088534107402, "grad_norm": 1.3203125, "learning_rate": 0.00036409747990463146, "loss": 4.9074, "mean_token_accuracy": 0.22602810114622116, "num_tokens": 86052213.0, "step": 41460 }, { "entropy": 5.554709625244141, "epoch": 3.7613388969521044, "grad_norm": 1.3203125, "learning_rate": 0.0003640677675281649, "loss": 4.8898, "mean_token_accuracy": 0.2167268455028534, "num_tokens": 86061419.0, "step": 41465 }, { "entropy": 5.6276383876800535, "epoch": 3.7617924528301887, "grad_norm": 1.359375, "learning_rate": 0.0003640380533097541, "loss": 4.8947, "mean_token_accuracy": 0.22321978062391282, "num_tokens": 86071585.0, "step": 41470 }, { "entropy": 5.6155191421508786, "epoch": 3.762246008708273, "grad_norm": 1.2734375, "learning_rate": 0.00036400833725001364, "loss": 4.8817, "mean_token_accuracy": 0.22024742513895035, "num_tokens": 86081175.0, "step": 41475 }, { "entropy": 5.626105546951294, "epoch": 3.762699564586357, "grad_norm": 1.1640625, "learning_rate": 0.0003639786193495581, "loss": 4.9268, "mean_token_accuracy": 0.2163862630724907, "num_tokens": 86092407.0, "step": 41480 }, { "entropy": 5.689416694641113, "epoch": 3.763153120464441, "grad_norm": 1.25, "learning_rate": 0.00036394889960900215, "loss": 4.9217, "mean_token_accuracy": 0.22176722139120103, "num_tokens": 86102218.0, "step": 41485 }, { "entropy": 5.670872545242309, "epoch": 3.7636066763425253, "grad_norm": 1.203125, "learning_rate": 0.0003639191780289602, "loss": 4.9119, "mean_token_accuracy": 0.22324185371398925, "num_tokens": 86112631.0, "step": 41490 }, { "entropy": 5.625333642959594, "epoch": 3.7640602322206096, "grad_norm": 1.1796875, "learning_rate": 0.0003638894546100469, "loss": 4.9527, "mean_token_accuracy": 0.21200647652149202, "num_tokens": 86123675.0, "step": 41495 }, { "entropy": 5.553248262405395, "epoch": 3.764513788098694, "grad_norm": 1.3125, "learning_rate": 0.00036385972935287715, "loss": 4.8318, "mean_token_accuracy": 0.22540275752544403, "num_tokens": 86133909.0, "step": 41500 }, { "entropy": 5.62788987159729, "epoch": 3.764967343976778, "grad_norm": 1.25, "learning_rate": 0.0003638300022580656, "loss": 4.907, "mean_token_accuracy": 0.22037242203950883, "num_tokens": 86144560.0, "step": 41505 }, { "entropy": 5.704502773284912, "epoch": 3.7654208998548624, "grad_norm": 1.28125, "learning_rate": 0.00036380027332622684, "loss": 4.9471, "mean_token_accuracy": 0.21510438472032548, "num_tokens": 86155140.0, "step": 41510 }, { "entropy": 5.684950113296509, "epoch": 3.765874455732946, "grad_norm": 1.40625, "learning_rate": 0.00036377054255797584, "loss": 4.9283, "mean_token_accuracy": 0.2167373463511467, "num_tokens": 86165555.0, "step": 41515 }, { "entropy": 5.618059492111206, "epoch": 3.7663280116110305, "grad_norm": 1.2109375, "learning_rate": 0.00036374080995392737, "loss": 4.881, "mean_token_accuracy": 0.22100454270839692, "num_tokens": 86176204.0, "step": 41520 }, { "entropy": 5.633462381362915, "epoch": 3.7667815674891147, "grad_norm": 1.2109375, "learning_rate": 0.0003637110755146964, "loss": 4.9629, "mean_token_accuracy": 0.21545106470584868, "num_tokens": 86186888.0, "step": 41525 }, { "entropy": 5.6192621231079105, "epoch": 3.7672351233671986, "grad_norm": 1.2421875, "learning_rate": 0.00036368133924089766, "loss": 4.8518, "mean_token_accuracy": 0.22867828607559204, "num_tokens": 86196654.0, "step": 41530 }, { "entropy": 5.594656562805175, "epoch": 3.767688679245283, "grad_norm": 1.203125, "learning_rate": 0.0003636516011331464, "loss": 4.8594, "mean_token_accuracy": 0.22529308795928954, "num_tokens": 86207045.0, "step": 41535 }, { "entropy": 5.666325998306275, "epoch": 3.768142235123367, "grad_norm": 1.2109375, "learning_rate": 0.00036362186119205734, "loss": 4.9465, "mean_token_accuracy": 0.21006513386964798, "num_tokens": 86216906.0, "step": 41540 }, { "entropy": 5.570976591110229, "epoch": 3.7685957910014514, "grad_norm": 1.3046875, "learning_rate": 0.0003635921194182457, "loss": 4.8813, "mean_token_accuracy": 0.2234368920326233, "num_tokens": 86227380.0, "step": 41545 }, { "entropy": 5.647460842132569, "epoch": 3.7690493468795356, "grad_norm": 1.2265625, "learning_rate": 0.0003635623758123263, "loss": 5.0061, "mean_token_accuracy": 0.22267422527074815, "num_tokens": 86236948.0, "step": 41550 }, { "entropy": 5.616719341278076, "epoch": 3.76950290275762, "grad_norm": 1.203125, "learning_rate": 0.00036353263037491445, "loss": 4.9599, "mean_token_accuracy": 0.21824501901865007, "num_tokens": 86246784.0, "step": 41555 }, { "entropy": 5.5459810256958, "epoch": 3.769956458635704, "grad_norm": 1.2890625, "learning_rate": 0.0003635028831066253, "loss": 4.8281, "mean_token_accuracy": 0.22633751332759858, "num_tokens": 86257381.0, "step": 41560 }, { "entropy": 5.549964570999146, "epoch": 3.770410014513788, "grad_norm": 1.203125, "learning_rate": 0.0003634731340080739, "loss": 4.8325, "mean_token_accuracy": 0.2245854392647743, "num_tokens": 86268117.0, "step": 41565 }, { "entropy": 5.739038562774658, "epoch": 3.7708635703918723, "grad_norm": 1.2421875, "learning_rate": 0.0003634433830798756, "loss": 5.0312, "mean_token_accuracy": 0.21311648935079575, "num_tokens": 86279195.0, "step": 41570 }, { "entropy": 5.553050518035889, "epoch": 3.7713171262699565, "grad_norm": 1.265625, "learning_rate": 0.0003634136303226457, "loss": 4.7345, "mean_token_accuracy": 0.23312177509069443, "num_tokens": 86288154.0, "step": 41575 }, { "entropy": 5.605372524261474, "epoch": 3.771770682148041, "grad_norm": 1.15625, "learning_rate": 0.0003633838757369992, "loss": 4.8931, "mean_token_accuracy": 0.21574170440435408, "num_tokens": 86297524.0, "step": 41580 }, { "entropy": 5.591262769699097, "epoch": 3.7722242380261246, "grad_norm": 1.28125, "learning_rate": 0.0003633541193235517, "loss": 4.9543, "mean_token_accuracy": 0.21798088252544404, "num_tokens": 86307031.0, "step": 41585 }, { "entropy": 5.597372198104859, "epoch": 3.772677793904209, "grad_norm": 1.234375, "learning_rate": 0.0003633243610829185, "loss": 4.9191, "mean_token_accuracy": 0.22384639978408813, "num_tokens": 86317629.0, "step": 41590 }, { "entropy": 5.647684097290039, "epoch": 3.773131349782293, "grad_norm": 1.2265625, "learning_rate": 0.00036329460101571496, "loss": 4.9563, "mean_token_accuracy": 0.21849690973758698, "num_tokens": 86328243.0, "step": 41595 }, { "entropy": 5.707601404190063, "epoch": 3.7735849056603774, "grad_norm": 1.28125, "learning_rate": 0.0003632648391225568, "loss": 4.9868, "mean_token_accuracy": 0.2123067244887352, "num_tokens": 86338905.0, "step": 41600 }, { "entropy": 5.664737367630005, "epoch": 3.7740384615384617, "grad_norm": 1.21875, "learning_rate": 0.00036323507540405903, "loss": 4.9327, "mean_token_accuracy": 0.2215026304125786, "num_tokens": 86350433.0, "step": 41605 }, { "entropy": 5.654308700561524, "epoch": 3.774492017416546, "grad_norm": 1.359375, "learning_rate": 0.0003632053098608374, "loss": 4.9294, "mean_token_accuracy": 0.21244916915893555, "num_tokens": 86360664.0, "step": 41610 }, { "entropy": 5.6497961521148685, "epoch": 3.7749455732946298, "grad_norm": 1.21875, "learning_rate": 0.00036317554249350767, "loss": 4.9665, "mean_token_accuracy": 0.21997612714767456, "num_tokens": 86372101.0, "step": 41615 }, { "entropy": 5.619952440261841, "epoch": 3.775399129172714, "grad_norm": 1.140625, "learning_rate": 0.0003631457733026851, "loss": 4.8059, "mean_token_accuracy": 0.22608379274606705, "num_tokens": 86382494.0, "step": 41620 }, { "entropy": 5.709770059585571, "epoch": 3.7758526850507983, "grad_norm": 1.28125, "learning_rate": 0.00036311600228898554, "loss": 5.047, "mean_token_accuracy": 0.20622465312480925, "num_tokens": 86393292.0, "step": 41625 }, { "entropy": 5.5456939220428465, "epoch": 3.7763062409288826, "grad_norm": 1.328125, "learning_rate": 0.00036308622945302455, "loss": 4.8329, "mean_token_accuracy": 0.22456151843070984, "num_tokens": 86402940.0, "step": 41630 }, { "entropy": 5.56774411201477, "epoch": 3.7767597968069664, "grad_norm": 1.3515625, "learning_rate": 0.000363056454795418, "loss": 4.8628, "mean_token_accuracy": 0.2190259128808975, "num_tokens": 86413382.0, "step": 41635 }, { "entropy": 5.671607112884521, "epoch": 3.7772133526850507, "grad_norm": 1.3671875, "learning_rate": 0.0003630266783167814, "loss": 4.9419, "mean_token_accuracy": 0.21687548905611037, "num_tokens": 86423866.0, "step": 41640 }, { "entropy": 5.694989013671875, "epoch": 3.777666908563135, "grad_norm": 1.421875, "learning_rate": 0.0003629969000177307, "loss": 4.9868, "mean_token_accuracy": 0.2119221195578575, "num_tokens": 86434908.0, "step": 41645 }, { "entropy": 5.531735038757324, "epoch": 3.778120464441219, "grad_norm": 1.3203125, "learning_rate": 0.0003629671198988817, "loss": 4.8215, "mean_token_accuracy": 0.2278204768896103, "num_tokens": 86445604.0, "step": 41650 }, { "entropy": 5.51928448677063, "epoch": 3.7785740203193035, "grad_norm": 1.421875, "learning_rate": 0.0003629373379608502, "loss": 4.7648, "mean_token_accuracy": 0.2316206708550453, "num_tokens": 86455813.0, "step": 41655 }, { "entropy": 5.491696166992187, "epoch": 3.7790275761973877, "grad_norm": 1.2734375, "learning_rate": 0.00036290755420425214, "loss": 4.7358, "mean_token_accuracy": 0.23947824984788896, "num_tokens": 86465256.0, "step": 41660 }, { "entropy": 5.573163175582886, "epoch": 3.7794811320754715, "grad_norm": 1.3359375, "learning_rate": 0.00036287776862970356, "loss": 4.8656, "mean_token_accuracy": 0.22518586218357087, "num_tokens": 86474605.0, "step": 41665 }, { "entropy": 5.625118589401245, "epoch": 3.779934687953556, "grad_norm": 1.296875, "learning_rate": 0.00036284798123782024, "loss": 4.8867, "mean_token_accuracy": 0.2187691405415535, "num_tokens": 86484886.0, "step": 41670 }, { "entropy": 5.593328475952148, "epoch": 3.78038824383164, "grad_norm": 1.1875, "learning_rate": 0.0003628181920292182, "loss": 4.9561, "mean_token_accuracy": 0.213165220618248, "num_tokens": 86495816.0, "step": 41675 }, { "entropy": 5.617562866210937, "epoch": 3.7808417997097243, "grad_norm": 1.2421875, "learning_rate": 0.0003627884010045138, "loss": 4.8571, "mean_token_accuracy": 0.221609865128994, "num_tokens": 86506319.0, "step": 41680 }, { "entropy": 5.680721759796143, "epoch": 3.781295355587808, "grad_norm": 1.2890625, "learning_rate": 0.0003627586081643227, "loss": 4.8925, "mean_token_accuracy": 0.2204956293106079, "num_tokens": 86516952.0, "step": 41685 }, { "entropy": 5.664397478103638, "epoch": 3.7817489114658924, "grad_norm": 1.3125, "learning_rate": 0.00036272881350926135, "loss": 4.9935, "mean_token_accuracy": 0.21619092673063278, "num_tokens": 86527327.0, "step": 41690 }, { "entropy": 5.610509920120239, "epoch": 3.7822024673439767, "grad_norm": 1.2734375, "learning_rate": 0.0003626990170399457, "loss": 4.8389, "mean_token_accuracy": 0.22601523697376252, "num_tokens": 86538281.0, "step": 41695 }, { "entropy": 5.613770961761475, "epoch": 3.782656023222061, "grad_norm": 1.328125, "learning_rate": 0.00036266921875699205, "loss": 4.9494, "mean_token_accuracy": 0.21222818195819854, "num_tokens": 86549034.0, "step": 41700 }, { "entropy": 5.616689920425415, "epoch": 3.7831095791001452, "grad_norm": 1.2265625, "learning_rate": 0.0003626394186610166, "loss": 4.9259, "mean_token_accuracy": 0.2178095191717148, "num_tokens": 86559306.0, "step": 41705 }, { "entropy": 5.672933721542359, "epoch": 3.7835631349782295, "grad_norm": 1.1875, "learning_rate": 0.0003626096167526356, "loss": 4.9288, "mean_token_accuracy": 0.2207697793841362, "num_tokens": 86569414.0, "step": 41710 }, { "entropy": 5.525878763198852, "epoch": 3.7840166908563138, "grad_norm": 1.15625, "learning_rate": 0.0003625798130324655, "loss": 4.7753, "mean_token_accuracy": 0.2287873148918152, "num_tokens": 86578554.0, "step": 41715 }, { "entropy": 5.64386396408081, "epoch": 3.7844702467343976, "grad_norm": 1.453125, "learning_rate": 0.00036255000750112256, "loss": 4.8927, "mean_token_accuracy": 0.22212022095918654, "num_tokens": 86588624.0, "step": 41720 }, { "entropy": 5.629253625869751, "epoch": 3.784923802612482, "grad_norm": 1.3125, "learning_rate": 0.00036252020015922304, "loss": 4.9058, "mean_token_accuracy": 0.2229263499379158, "num_tokens": 86599266.0, "step": 41725 }, { "entropy": 5.642392110824585, "epoch": 3.785377358490566, "grad_norm": 1.140625, "learning_rate": 0.00036249039100738357, "loss": 4.9468, "mean_token_accuracy": 0.21143231093883513, "num_tokens": 86609853.0, "step": 41730 }, { "entropy": 5.550648355484009, "epoch": 3.7858309143686504, "grad_norm": 1.25, "learning_rate": 0.0003624605800462205, "loss": 4.8479, "mean_token_accuracy": 0.22352551221847533, "num_tokens": 86619927.0, "step": 41735 }, { "entropy": 5.6466514587402346, "epoch": 3.786284470246734, "grad_norm": 1.328125, "learning_rate": 0.00036243076727635027, "loss": 4.9066, "mean_token_accuracy": 0.2233829215168953, "num_tokens": 86630079.0, "step": 41740 }, { "entropy": 5.610857915878296, "epoch": 3.7867380261248185, "grad_norm": 1.1953125, "learning_rate": 0.00036240095269838955, "loss": 4.8717, "mean_token_accuracy": 0.22407594323158264, "num_tokens": 86639744.0, "step": 41745 }, { "entropy": 5.5412956237792965, "epoch": 3.7871915820029027, "grad_norm": 1.2109375, "learning_rate": 0.00036237113631295485, "loss": 4.9416, "mean_token_accuracy": 0.2198496863245964, "num_tokens": 86650866.0, "step": 41750 }, { "entropy": 5.583549928665161, "epoch": 3.787645137880987, "grad_norm": 1.234375, "learning_rate": 0.00036234131812066286, "loss": 4.7977, "mean_token_accuracy": 0.22846141308546067, "num_tokens": 86659864.0, "step": 41755 }, { "entropy": 5.566881942749023, "epoch": 3.7880986937590713, "grad_norm": 1.28125, "learning_rate": 0.00036231149812213006, "loss": 4.8138, "mean_token_accuracy": 0.22403739988803864, "num_tokens": 86670039.0, "step": 41760 }, { "entropy": 5.586530494689941, "epoch": 3.7885522496371555, "grad_norm": 1.296875, "learning_rate": 0.0003622816763179732, "loss": 4.8616, "mean_token_accuracy": 0.22727217376232148, "num_tokens": 86680434.0, "step": 41765 }, { "entropy": 5.625749588012695, "epoch": 3.7890058055152394, "grad_norm": 1.203125, "learning_rate": 0.0003622518527088091, "loss": 4.9194, "mean_token_accuracy": 0.21443816274404526, "num_tokens": 86691026.0, "step": 41770 }, { "entropy": 5.656641674041748, "epoch": 3.7894593613933236, "grad_norm": 1.3203125, "learning_rate": 0.00036222202729525453, "loss": 4.9573, "mean_token_accuracy": 0.21857694387435914, "num_tokens": 86701323.0, "step": 41775 }, { "entropy": 5.592256879806518, "epoch": 3.789912917271408, "grad_norm": 1.234375, "learning_rate": 0.000362192200077926, "loss": 4.8391, "mean_token_accuracy": 0.23345235884189605, "num_tokens": 86711152.0, "step": 41780 }, { "entropy": 5.656635856628418, "epoch": 3.790366473149492, "grad_norm": 1.28125, "learning_rate": 0.00036216237105744076, "loss": 4.9882, "mean_token_accuracy": 0.22142889201641083, "num_tokens": 86720814.0, "step": 41785 }, { "entropy": 5.622056865692139, "epoch": 3.790820029027576, "grad_norm": 1.2578125, "learning_rate": 0.0003621325402344154, "loss": 4.8665, "mean_token_accuracy": 0.22930116802453995, "num_tokens": 86731229.0, "step": 41790 }, { "entropy": 5.598729991912842, "epoch": 3.7912735849056602, "grad_norm": 1.3359375, "learning_rate": 0.00036210270760946684, "loss": 4.869, "mean_token_accuracy": 0.21661020666360856, "num_tokens": 86741440.0, "step": 41795 }, { "entropy": 5.6839375495910645, "epoch": 3.7917271407837445, "grad_norm": 1.25, "learning_rate": 0.0003620728731832122, "loss": 4.968, "mean_token_accuracy": 0.21746186017990113, "num_tokens": 86752022.0, "step": 41800 }, { "entropy": 5.636864900588989, "epoch": 3.7921806966618288, "grad_norm": 1.359375, "learning_rate": 0.0003620430369562683, "loss": 4.8604, "mean_token_accuracy": 0.22020047754049302, "num_tokens": 86763090.0, "step": 41805 }, { "entropy": 5.5830785751342775, "epoch": 3.792634252539913, "grad_norm": 1.3203125, "learning_rate": 0.00036201319892925214, "loss": 4.8574, "mean_token_accuracy": 0.22351621389389037, "num_tokens": 86773357.0, "step": 41810 }, { "entropy": 5.552571392059326, "epoch": 3.7930878084179973, "grad_norm": 1.3984375, "learning_rate": 0.000361983359102781, "loss": 4.8261, "mean_token_accuracy": 0.2198467567563057, "num_tokens": 86784402.0, "step": 41815 }, { "entropy": 5.612296438217163, "epoch": 3.793541364296081, "grad_norm": 1.2109375, "learning_rate": 0.00036195351747747177, "loss": 4.9221, "mean_token_accuracy": 0.22276830524206162, "num_tokens": 86794945.0, "step": 41820 }, { "entropy": 5.604290246963501, "epoch": 3.7939949201741654, "grad_norm": 1.1953125, "learning_rate": 0.00036192367405394157, "loss": 4.8892, "mean_token_accuracy": 0.22098950743675233, "num_tokens": 86806936.0, "step": 41825 }, { "entropy": 5.688607788085937, "epoch": 3.7944484760522497, "grad_norm": 1.1640625, "learning_rate": 0.0003618938288328077, "loss": 4.9837, "mean_token_accuracy": 0.21362111270427703, "num_tokens": 86817776.0, "step": 41830 }, { "entropy": 5.538198375701905, "epoch": 3.794902031930334, "grad_norm": 1.171875, "learning_rate": 0.0003618639818146873, "loss": 4.7681, "mean_token_accuracy": 0.22893187254667283, "num_tokens": 86828054.0, "step": 41835 }, { "entropy": 5.578504753112793, "epoch": 3.7953555878084178, "grad_norm": 1.203125, "learning_rate": 0.00036183413300019767, "loss": 4.8372, "mean_token_accuracy": 0.22775990068912505, "num_tokens": 86838132.0, "step": 41840 }, { "entropy": 5.565424203872681, "epoch": 3.795809143686502, "grad_norm": 1.2890625, "learning_rate": 0.00036180428238995595, "loss": 4.9036, "mean_token_accuracy": 0.21613416969776153, "num_tokens": 86848219.0, "step": 41845 }, { "entropy": 5.53728985786438, "epoch": 3.7962626995645863, "grad_norm": 1.1796875, "learning_rate": 0.0003617744299845796, "loss": 4.8115, "mean_token_accuracy": 0.22700901478528976, "num_tokens": 86858559.0, "step": 41850 }, { "entropy": 5.556297063827515, "epoch": 3.7967162554426706, "grad_norm": 1.2421875, "learning_rate": 0.0003617445757846859, "loss": 4.9213, "mean_token_accuracy": 0.22252996563911437, "num_tokens": 86868573.0, "step": 41855 }, { "entropy": 5.682421875, "epoch": 3.797169811320755, "grad_norm": 1.265625, "learning_rate": 0.00036171471979089227, "loss": 4.8899, "mean_token_accuracy": 0.2246537908911705, "num_tokens": 86878641.0, "step": 41860 }, { "entropy": 5.632895517349243, "epoch": 3.797623367198839, "grad_norm": 1.375, "learning_rate": 0.0003616848620038162, "loss": 4.9357, "mean_token_accuracy": 0.21448186039924622, "num_tokens": 86888644.0, "step": 41865 }, { "entropy": 5.66579532623291, "epoch": 3.7980769230769234, "grad_norm": 1.2890625, "learning_rate": 0.000361655002424075, "loss": 5.0344, "mean_token_accuracy": 0.20469139218330384, "num_tokens": 86899428.0, "step": 41870 }, { "entropy": 5.666243648529052, "epoch": 3.798530478955007, "grad_norm": 1.203125, "learning_rate": 0.00036162514105228635, "loss": 4.9126, "mean_token_accuracy": 0.22285107523202896, "num_tokens": 86910155.0, "step": 41875 }, { "entropy": 5.588804864883423, "epoch": 3.7989840348330914, "grad_norm": 1.328125, "learning_rate": 0.0003615952778890676, "loss": 4.8722, "mean_token_accuracy": 0.22400906383991243, "num_tokens": 86919783.0, "step": 41880 }, { "entropy": 5.592104291915893, "epoch": 3.7994375907111757, "grad_norm": 1.265625, "learning_rate": 0.00036156541293503653, "loss": 4.9142, "mean_token_accuracy": 0.2187621384859085, "num_tokens": 86929647.0, "step": 41885 }, { "entropy": 5.6078362464904785, "epoch": 3.7998911465892595, "grad_norm": 1.203125, "learning_rate": 0.00036153554619081064, "loss": 4.8589, "mean_token_accuracy": 0.2204468935728073, "num_tokens": 86940113.0, "step": 41890 }, { "entropy": 5.641484308242798, "epoch": 3.800344702467344, "grad_norm": 1.28125, "learning_rate": 0.0003615056776570076, "loss": 4.9527, "mean_token_accuracy": 0.2210904464125633, "num_tokens": 86949950.0, "step": 41895 }, { "entropy": 5.573281574249267, "epoch": 3.800798258345428, "grad_norm": 1.328125, "learning_rate": 0.00036147580733424513, "loss": 4.8035, "mean_token_accuracy": 0.23234857767820358, "num_tokens": 86959286.0, "step": 41900 }, { "entropy": 5.572811555862427, "epoch": 3.8012518142235123, "grad_norm": 1.265625, "learning_rate": 0.0003614459352231409, "loss": 4.8892, "mean_token_accuracy": 0.22602326720952987, "num_tokens": 86970165.0, "step": 41905 }, { "entropy": 5.557807970046997, "epoch": 3.8017053701015966, "grad_norm": 1.28125, "learning_rate": 0.0003614160613243127, "loss": 4.8658, "mean_token_accuracy": 0.21917305439710616, "num_tokens": 86980331.0, "step": 41910 }, { "entropy": 5.663860750198364, "epoch": 3.802158925979681, "grad_norm": 1.140625, "learning_rate": 0.0003613861856383783, "loss": 4.9394, "mean_token_accuracy": 0.2141605168581009, "num_tokens": 86991790.0, "step": 41915 }, { "entropy": 5.647479629516601, "epoch": 3.802612481857765, "grad_norm": 1.453125, "learning_rate": 0.0003613563081659556, "loss": 5.0078, "mean_token_accuracy": 0.22258283346891403, "num_tokens": 87001220.0, "step": 41920 }, { "entropy": 5.649091958999634, "epoch": 3.803066037735849, "grad_norm": 1.2421875, "learning_rate": 0.0003613264289076625, "loss": 4.8792, "mean_token_accuracy": 0.22127438336610794, "num_tokens": 87012720.0, "step": 41925 }, { "entropy": 5.628114414215088, "epoch": 3.803519593613933, "grad_norm": 1.296875, "learning_rate": 0.0003612965478641167, "loss": 4.9364, "mean_token_accuracy": 0.2181042566895485, "num_tokens": 87021891.0, "step": 41930 }, { "entropy": 5.670102119445801, "epoch": 3.8039731494920175, "grad_norm": 1.1484375, "learning_rate": 0.00036126666503593643, "loss": 5.0148, "mean_token_accuracy": 0.21555988043546676, "num_tokens": 87032546.0, "step": 41935 }, { "entropy": 5.596625947952271, "epoch": 3.8044267053701017, "grad_norm": 1.2578125, "learning_rate": 0.0003612367804237395, "loss": 4.8524, "mean_token_accuracy": 0.21960129141807555, "num_tokens": 87042173.0, "step": 41940 }, { "entropy": 5.633037757873535, "epoch": 3.8048802612481856, "grad_norm": 1.2578125, "learning_rate": 0.0003612068940281439, "loss": 4.9471, "mean_token_accuracy": 0.22041576355695724, "num_tokens": 87052475.0, "step": 41945 }, { "entropy": 5.606350660324097, "epoch": 3.80533381712627, "grad_norm": 1.2265625, "learning_rate": 0.0003611770058497679, "loss": 4.8835, "mean_token_accuracy": 0.2164686515927315, "num_tokens": 87062698.0, "step": 41950 }, { "entropy": 5.584737634658813, "epoch": 3.805787373004354, "grad_norm": 1.1953125, "learning_rate": 0.00036114711588922945, "loss": 4.8606, "mean_token_accuracy": 0.21688618808984755, "num_tokens": 87073168.0, "step": 41955 }, { "entropy": 5.666655540466309, "epoch": 3.8062409288824384, "grad_norm": 1.1796875, "learning_rate": 0.0003611172241471466, "loss": 4.9757, "mean_token_accuracy": 0.2102243885397911, "num_tokens": 87084270.0, "step": 41960 }, { "entropy": 5.58031587600708, "epoch": 3.8066944847605226, "grad_norm": 1.2109375, "learning_rate": 0.0003610873306241376, "loss": 4.9033, "mean_token_accuracy": 0.2205825537443161, "num_tokens": 87093869.0, "step": 41965 }, { "entropy": 5.577521228790284, "epoch": 3.807148040638607, "grad_norm": 1.2578125, "learning_rate": 0.00036105743532082075, "loss": 4.8544, "mean_token_accuracy": 0.22242291420698165, "num_tokens": 87103371.0, "step": 41970 }, { "entropy": 5.623032855987549, "epoch": 3.8076015965166907, "grad_norm": 1.3515625, "learning_rate": 0.0003610275382378142, "loss": 4.8627, "mean_token_accuracy": 0.22170430272817612, "num_tokens": 87113384.0, "step": 41975 }, { "entropy": 5.661807250976563, "epoch": 3.808055152394775, "grad_norm": 1.2109375, "learning_rate": 0.0003609976393757362, "loss": 4.9313, "mean_token_accuracy": 0.22047605812549592, "num_tokens": 87123925.0, "step": 41980 }, { "entropy": 5.576672172546386, "epoch": 3.8085087082728593, "grad_norm": 1.1875, "learning_rate": 0.00036096773873520513, "loss": 4.8598, "mean_token_accuracy": 0.21996969878673553, "num_tokens": 87134608.0, "step": 41985 }, { "entropy": 5.598281478881836, "epoch": 3.8089622641509435, "grad_norm": 1.28125, "learning_rate": 0.00036093783631683927, "loss": 4.8745, "mean_token_accuracy": 0.22203450947999953, "num_tokens": 87145184.0, "step": 41990 }, { "entropy": 5.55139741897583, "epoch": 3.8094158200290273, "grad_norm": 1.2734375, "learning_rate": 0.0003609079321212571, "loss": 4.787, "mean_token_accuracy": 0.22273022383451463, "num_tokens": 87155483.0, "step": 41995 }, { "entropy": 5.607876491546631, "epoch": 3.8098693759071116, "grad_norm": 1.2421875, "learning_rate": 0.00036087802614907696, "loss": 4.979, "mean_token_accuracy": 0.2144949719309807, "num_tokens": 87166615.0, "step": 42000 }, { "epoch": 3.8098693759071116, "eval_entropy": 5.346203438081353, "eval_loss": 4.952507972717285, "eval_mean_token_accuracy": 0.22764768383351927, "eval_num_tokens": 87166615.0, "eval_runtime": 20.6758, "eval_samples_per_second": 1710.213, "eval_steps_per_second": 213.777, "step": 42000 }, { "entropy": 5.634857940673828, "epoch": 3.810322931785196, "grad_norm": 1.1875, "learning_rate": 0.00036084811840091736, "loss": 4.8736, "mean_token_accuracy": 0.2212119996547699, "num_tokens": 87177151.0, "step": 42005 }, { "entropy": 5.584418439865113, "epoch": 3.81077648766328, "grad_norm": 1.2421875, "learning_rate": 0.0003608182088773969, "loss": 4.8778, "mean_token_accuracy": 0.22364019155502318, "num_tokens": 87188085.0, "step": 42010 }, { "entropy": 5.588363838195801, "epoch": 3.8112300435413644, "grad_norm": 1.40625, "learning_rate": 0.0003607882975791338, "loss": 4.9354, "mean_token_accuracy": 0.21974351853132248, "num_tokens": 87197240.0, "step": 42015 }, { "entropy": 5.598347997665405, "epoch": 3.8116835994194487, "grad_norm": 1.1796875, "learning_rate": 0.000360758384506747, "loss": 4.8729, "mean_token_accuracy": 0.2303866043686867, "num_tokens": 87208064.0, "step": 42020 }, { "entropy": 5.596074771881104, "epoch": 3.8121371552975325, "grad_norm": 1.234375, "learning_rate": 0.00036072846966085496, "loss": 4.8006, "mean_token_accuracy": 0.22313464432954788, "num_tokens": 87218386.0, "step": 42025 }, { "entropy": 5.579715347290039, "epoch": 3.8125907111756168, "grad_norm": 1.34375, "learning_rate": 0.00036069855304207634, "loss": 4.7776, "mean_token_accuracy": 0.2290860891342163, "num_tokens": 87228459.0, "step": 42030 }, { "entropy": 5.61886830329895, "epoch": 3.813044267053701, "grad_norm": 1.3671875, "learning_rate": 0.0003606686346510297, "loss": 4.9719, "mean_token_accuracy": 0.21134898513555528, "num_tokens": 87240317.0, "step": 42035 }, { "entropy": 5.523982286453247, "epoch": 3.8134978229317853, "grad_norm": 1.2578125, "learning_rate": 0.000360638714488334, "loss": 4.789, "mean_token_accuracy": 0.22310695350170134, "num_tokens": 87250197.0, "step": 42040 }, { "entropy": 5.551533365249634, "epoch": 3.813951378809869, "grad_norm": 1.2578125, "learning_rate": 0.00036060879255460766, "loss": 4.8621, "mean_token_accuracy": 0.22053295224905015, "num_tokens": 87261266.0, "step": 42045 }, { "entropy": 5.530144309997558, "epoch": 3.8144049346879534, "grad_norm": 1.375, "learning_rate": 0.0003605788688504699, "loss": 4.7593, "mean_token_accuracy": 0.23171026557683944, "num_tokens": 87270490.0, "step": 42050 }, { "entropy": 5.625289344787598, "epoch": 3.8148584905660377, "grad_norm": 1.3046875, "learning_rate": 0.0003605489433765392, "loss": 4.9368, "mean_token_accuracy": 0.22309321761131287, "num_tokens": 87281260.0, "step": 42055 }, { "entropy": 5.584912395477295, "epoch": 3.815312046444122, "grad_norm": 1.28125, "learning_rate": 0.0003605190161334345, "loss": 4.8134, "mean_token_accuracy": 0.23128933757543563, "num_tokens": 87290577.0, "step": 42060 }, { "entropy": 5.535187673568726, "epoch": 3.815765602322206, "grad_norm": 1.3046875, "learning_rate": 0.0003604890871217748, "loss": 4.7415, "mean_token_accuracy": 0.23366574198007584, "num_tokens": 87300185.0, "step": 42065 }, { "entropy": 5.625460577011109, "epoch": 3.8162191582002905, "grad_norm": 1.3046875, "learning_rate": 0.0003604591563421791, "loss": 4.9756, "mean_token_accuracy": 0.22205374389886856, "num_tokens": 87310088.0, "step": 42070 }, { "entropy": 5.612613296508789, "epoch": 3.8166727140783747, "grad_norm": 1.1875, "learning_rate": 0.0003604292237952662, "loss": 4.896, "mean_token_accuracy": 0.21813660860061646, "num_tokens": 87319942.0, "step": 42075 }, { "entropy": 5.635054016113282, "epoch": 3.8171262699564585, "grad_norm": 1.3125, "learning_rate": 0.0003603992894816551, "loss": 4.8672, "mean_token_accuracy": 0.21989766508340836, "num_tokens": 87329175.0, "step": 42080 }, { "entropy": 5.5353446960449215, "epoch": 3.817579825834543, "grad_norm": 1.40625, "learning_rate": 0.000360369353401965, "loss": 4.7841, "mean_token_accuracy": 0.22539449185132981, "num_tokens": 87338555.0, "step": 42085 }, { "entropy": 5.573533773422241, "epoch": 3.818033381712627, "grad_norm": 1.3359375, "learning_rate": 0.00036033941555681486, "loss": 4.8476, "mean_token_accuracy": 0.22953293919563295, "num_tokens": 87348424.0, "step": 42090 }, { "entropy": 5.584469223022461, "epoch": 3.8184869375907113, "grad_norm": 1.2890625, "learning_rate": 0.00036030947594682395, "loss": 4.7945, "mean_token_accuracy": 0.22611795663833617, "num_tokens": 87359724.0, "step": 42095 }, { "entropy": 5.604579305648803, "epoch": 3.818940493468795, "grad_norm": 1.2578125, "learning_rate": 0.0003602795345726113, "loss": 4.9486, "mean_token_accuracy": 0.22013984769582748, "num_tokens": 87371324.0, "step": 42100 }, { "entropy": 5.614258718490601, "epoch": 3.8193940493468794, "grad_norm": 1.4140625, "learning_rate": 0.0003602495914347962, "loss": 4.7892, "mean_token_accuracy": 0.2261779174208641, "num_tokens": 87380770.0, "step": 42105 }, { "entropy": 5.556986856460571, "epoch": 3.8198476052249637, "grad_norm": 1.2109375, "learning_rate": 0.00036021964653399773, "loss": 4.9121, "mean_token_accuracy": 0.22143764197826385, "num_tokens": 87391123.0, "step": 42110 }, { "entropy": 5.616132926940918, "epoch": 3.820301161103048, "grad_norm": 1.28125, "learning_rate": 0.00036018969987083524, "loss": 4.923, "mean_token_accuracy": 0.22146390974521638, "num_tokens": 87401357.0, "step": 42115 }, { "entropy": 5.616885948181152, "epoch": 3.8207547169811322, "grad_norm": 1.3671875, "learning_rate": 0.0003601597514459281, "loss": 4.8627, "mean_token_accuracy": 0.22252754718065262, "num_tokens": 87411373.0, "step": 42120 }, { "entropy": 5.560558414459228, "epoch": 3.8212082728592165, "grad_norm": 1.3125, "learning_rate": 0.00036012980125989567, "loss": 4.8456, "mean_token_accuracy": 0.230593766272068, "num_tokens": 87421915.0, "step": 42125 }, { "entropy": 5.585498666763305, "epoch": 3.8216618287373003, "grad_norm": 1.296875, "learning_rate": 0.0003600998493133571, "loss": 4.8833, "mean_token_accuracy": 0.2263690635561943, "num_tokens": 87432148.0, "step": 42130 }, { "entropy": 5.585041570663452, "epoch": 3.8221153846153846, "grad_norm": 1.28125, "learning_rate": 0.0003600698956069321, "loss": 4.9194, "mean_token_accuracy": 0.21915029883384704, "num_tokens": 87442605.0, "step": 42135 }, { "entropy": 5.627900886535644, "epoch": 3.822568940493469, "grad_norm": 1.3125, "learning_rate": 0.0003600399401412399, "loss": 4.8533, "mean_token_accuracy": 0.2261598750948906, "num_tokens": 87452482.0, "step": 42140 }, { "entropy": 5.51025619506836, "epoch": 3.823022496371553, "grad_norm": 1.2265625, "learning_rate": 0.00036000998291690005, "loss": 4.7473, "mean_token_accuracy": 0.22577544003725053, "num_tokens": 87462074.0, "step": 42145 }, { "entropy": 5.617627239227295, "epoch": 3.823476052249637, "grad_norm": 1.3671875, "learning_rate": 0.0003599800239345321, "loss": 4.8855, "mean_token_accuracy": 0.22161577194929122, "num_tokens": 87472377.0, "step": 42150 }, { "entropy": 5.569552326202393, "epoch": 3.823929608127721, "grad_norm": 1.2421875, "learning_rate": 0.0003599500631947557, "loss": 4.8823, "mean_token_accuracy": 0.22076617181301117, "num_tokens": 87483436.0, "step": 42155 }, { "entropy": 5.6514184951782225, "epoch": 3.8243831640058055, "grad_norm": 1.359375, "learning_rate": 0.00035992010069819025, "loss": 4.8555, "mean_token_accuracy": 0.2278494119644165, "num_tokens": 87492231.0, "step": 42160 }, { "entropy": 5.73201904296875, "epoch": 3.8248367198838897, "grad_norm": 1.234375, "learning_rate": 0.00035989013644545555, "loss": 4.9549, "mean_token_accuracy": 0.22374685406684874, "num_tokens": 87503416.0, "step": 42165 }, { "entropy": 5.58912296295166, "epoch": 3.825290275761974, "grad_norm": 1.2265625, "learning_rate": 0.00035986017043717114, "loss": 4.8504, "mean_token_accuracy": 0.226153764128685, "num_tokens": 87513737.0, "step": 42170 }, { "entropy": 5.605336904525757, "epoch": 3.8257438316400583, "grad_norm": 1.3203125, "learning_rate": 0.0003598302026739568, "loss": 4.9195, "mean_token_accuracy": 0.21784147918224334, "num_tokens": 87523532.0, "step": 42175 }, { "entropy": 5.557153987884521, "epoch": 3.826197387518142, "grad_norm": 1.1484375, "learning_rate": 0.00035980023315643217, "loss": 4.7681, "mean_token_accuracy": 0.2319904774427414, "num_tokens": 87534066.0, "step": 42180 }, { "entropy": 5.6845635890960695, "epoch": 3.8266509433962264, "grad_norm": 1.3046875, "learning_rate": 0.0003597702618852172, "loss": 4.9957, "mean_token_accuracy": 0.2124808356165886, "num_tokens": 87544520.0, "step": 42185 }, { "entropy": 5.640701150894165, "epoch": 3.8271044992743106, "grad_norm": 1.25, "learning_rate": 0.0003597402888609316, "loss": 4.903, "mean_token_accuracy": 0.22138697952032088, "num_tokens": 87553913.0, "step": 42190 }, { "entropy": 5.626333475112915, "epoch": 3.827558055152395, "grad_norm": 1.1953125, "learning_rate": 0.00035971031408419524, "loss": 4.8907, "mean_token_accuracy": 0.21907430440187453, "num_tokens": 87563434.0, "step": 42195 }, { "entropy": 5.5932670593261715, "epoch": 3.8280116110304787, "grad_norm": 1.234375, "learning_rate": 0.00035968033755562795, "loss": 4.8936, "mean_token_accuracy": 0.22602132558822632, "num_tokens": 87573137.0, "step": 42200 }, { "entropy": 5.663025760650635, "epoch": 3.828465166908563, "grad_norm": 1.46875, "learning_rate": 0.0003596503592758497, "loss": 4.8894, "mean_token_accuracy": 0.22563652992248534, "num_tokens": 87582610.0, "step": 42205 }, { "entropy": 5.5894327640533445, "epoch": 3.8289187227866472, "grad_norm": 1.2734375, "learning_rate": 0.0003596203792454805, "loss": 4.8502, "mean_token_accuracy": 0.2237766295671463, "num_tokens": 87593062.0, "step": 42210 }, { "entropy": 5.595774793624878, "epoch": 3.8293722786647315, "grad_norm": 1.15625, "learning_rate": 0.0003595903974651403, "loss": 4.9359, "mean_token_accuracy": 0.21620270162820815, "num_tokens": 87604250.0, "step": 42215 }, { "entropy": 5.656678199768066, "epoch": 3.8298258345428158, "grad_norm": 1.2265625, "learning_rate": 0.0003595604139354491, "loss": 4.9225, "mean_token_accuracy": 0.2179296463727951, "num_tokens": 87615434.0, "step": 42220 }, { "entropy": 5.6424988269805905, "epoch": 3.8302793904209, "grad_norm": 1.328125, "learning_rate": 0.000359530428657027, "loss": 4.8676, "mean_token_accuracy": 0.22537012696266173, "num_tokens": 87625005.0, "step": 42225 }, { "entropy": 5.560103893280029, "epoch": 3.8307329462989843, "grad_norm": 1.2421875, "learning_rate": 0.0003595004416304941, "loss": 4.8385, "mean_token_accuracy": 0.22304467260837554, "num_tokens": 87635486.0, "step": 42230 }, { "entropy": 5.58238525390625, "epoch": 3.831186502177068, "grad_norm": 1.3515625, "learning_rate": 0.00035947045285647045, "loss": 4.858, "mean_token_accuracy": 0.230358025431633, "num_tokens": 87645771.0, "step": 42235 }, { "entropy": 5.687296152114868, "epoch": 3.8316400580551524, "grad_norm": 1.2578125, "learning_rate": 0.0003594404623355765, "loss": 4.9382, "mean_token_accuracy": 0.22328181862831115, "num_tokens": 87656116.0, "step": 42240 }, { "entropy": 5.795941877365112, "epoch": 3.8320936139332367, "grad_norm": 1.296875, "learning_rate": 0.0003594104700684321, "loss": 5.0791, "mean_token_accuracy": 0.2093728557229042, "num_tokens": 87666476.0, "step": 42245 }, { "entropy": 5.611774349212647, "epoch": 3.8325471698113205, "grad_norm": 1.234375, "learning_rate": 0.00035938047605565764, "loss": 4.8897, "mean_token_accuracy": 0.23027875125408173, "num_tokens": 87677406.0, "step": 42250 }, { "entropy": 5.543580770492554, "epoch": 3.8330007256894048, "grad_norm": 1.2109375, "learning_rate": 0.00035935048029787356, "loss": 4.8133, "mean_token_accuracy": 0.2273533046245575, "num_tokens": 87687461.0, "step": 42255 }, { "entropy": 5.577033376693725, "epoch": 3.833454281567489, "grad_norm": 1.390625, "learning_rate": 0.0003593204827957, "loss": 4.839, "mean_token_accuracy": 0.21658724248409272, "num_tokens": 87696470.0, "step": 42260 }, { "entropy": 5.603527355194092, "epoch": 3.8339078374455733, "grad_norm": 1.421875, "learning_rate": 0.0003592904835497574, "loss": 4.9169, "mean_token_accuracy": 0.2153046727180481, "num_tokens": 87706598.0, "step": 42265 }, { "entropy": 5.726874208450317, "epoch": 3.8343613933236576, "grad_norm": 1.1953125, "learning_rate": 0.0003592604825606661, "loss": 4.9941, "mean_token_accuracy": 0.21628989577293395, "num_tokens": 87717749.0, "step": 42270 }, { "entropy": 5.596792888641358, "epoch": 3.834814949201742, "grad_norm": 1.3359375, "learning_rate": 0.0003592304798290465, "loss": 4.8275, "mean_token_accuracy": 0.23229033052921294, "num_tokens": 87727893.0, "step": 42275 }, { "entropy": 5.527669095993042, "epoch": 3.835268505079826, "grad_norm": 1.2421875, "learning_rate": 0.0003592004753555191, "loss": 4.923, "mean_token_accuracy": 0.2199908211827278, "num_tokens": 87737980.0, "step": 42280 }, { "entropy": 5.604449844360351, "epoch": 3.83572206095791, "grad_norm": 1.265625, "learning_rate": 0.0003591704691407045, "loss": 4.8961, "mean_token_accuracy": 0.2235417366027832, "num_tokens": 87749271.0, "step": 42285 }, { "entropy": 5.605932092666626, "epoch": 3.836175616835994, "grad_norm": 1.3046875, "learning_rate": 0.00035914046118522313, "loss": 4.8893, "mean_token_accuracy": 0.22407016307115554, "num_tokens": 87760523.0, "step": 42290 }, { "entropy": 5.550204610824585, "epoch": 3.8366291727140784, "grad_norm": 1.390625, "learning_rate": 0.00035911045148969556, "loss": 4.8497, "mean_token_accuracy": 0.2258607879281044, "num_tokens": 87770084.0, "step": 42295 }, { "entropy": 5.676536130905151, "epoch": 3.8370827285921627, "grad_norm": 1.2578125, "learning_rate": 0.00035908044005474244, "loss": 4.9586, "mean_token_accuracy": 0.2140437588095665, "num_tokens": 87780163.0, "step": 42300 }, { "entropy": 5.551030397415161, "epoch": 3.8375362844702465, "grad_norm": 1.1953125, "learning_rate": 0.0003590504268809843, "loss": 4.8266, "mean_token_accuracy": 0.22786989510059358, "num_tokens": 87791382.0, "step": 42305 }, { "entropy": 5.489073753356934, "epoch": 3.837989840348331, "grad_norm": 1.1796875, "learning_rate": 0.00035902041196904204, "loss": 4.8434, "mean_token_accuracy": 0.21914518624544144, "num_tokens": 87802143.0, "step": 42310 }, { "entropy": 5.599003648757934, "epoch": 3.838443396226415, "grad_norm": 1.375, "learning_rate": 0.0003589903953195362, "loss": 4.8953, "mean_token_accuracy": 0.21948555558919908, "num_tokens": 87812255.0, "step": 42315 }, { "entropy": 5.648344659805298, "epoch": 3.8388969521044993, "grad_norm": 1.2734375, "learning_rate": 0.00035896037693308757, "loss": 4.8991, "mean_token_accuracy": 0.2194198936223984, "num_tokens": 87822744.0, "step": 42320 }, { "entropy": 5.715447425842285, "epoch": 3.8393505079825836, "grad_norm": 1.34375, "learning_rate": 0.000358930356810317, "loss": 4.9623, "mean_token_accuracy": 0.21412782967090607, "num_tokens": 87833701.0, "step": 42325 }, { "entropy": 5.644897508621216, "epoch": 3.839804063860668, "grad_norm": 1.203125, "learning_rate": 0.0003589003349518452, "loss": 4.9321, "mean_token_accuracy": 0.22096876353025435, "num_tokens": 87844215.0, "step": 42330 }, { "entropy": 5.67422251701355, "epoch": 3.8402576197387517, "grad_norm": 1.234375, "learning_rate": 0.00035887031135829305, "loss": 4.9286, "mean_token_accuracy": 0.21518833935260773, "num_tokens": 87854281.0, "step": 42335 }, { "entropy": 5.652591276168823, "epoch": 3.840711175616836, "grad_norm": 1.1640625, "learning_rate": 0.0003588402860302816, "loss": 4.9506, "mean_token_accuracy": 0.21988693177700042, "num_tokens": 87866003.0, "step": 42340 }, { "entropy": 5.616757011413574, "epoch": 3.84116473149492, "grad_norm": 1.328125, "learning_rate": 0.00035881025896843165, "loss": 4.8525, "mean_token_accuracy": 0.2238581120967865, "num_tokens": 87875854.0, "step": 42345 }, { "entropy": 5.679847669601441, "epoch": 3.8416182873730045, "grad_norm": 1.265625, "learning_rate": 0.00035878023017336415, "loss": 5.0027, "mean_token_accuracy": 0.21685487478971482, "num_tokens": 87887242.0, "step": 42350 }, { "entropy": 5.658097791671753, "epoch": 3.8420718432510883, "grad_norm": 1.265625, "learning_rate": 0.0003587501996457001, "loss": 4.8859, "mean_token_accuracy": 0.22040608674287795, "num_tokens": 87897859.0, "step": 42355 }, { "entropy": 5.607671070098877, "epoch": 3.8425253991291726, "grad_norm": 1.2890625, "learning_rate": 0.00035872016738606067, "loss": 4.8571, "mean_token_accuracy": 0.22060235142707824, "num_tokens": 87908945.0, "step": 42360 }, { "entropy": 5.603793907165527, "epoch": 3.842978955007257, "grad_norm": 1.40625, "learning_rate": 0.00035869013339506674, "loss": 4.8586, "mean_token_accuracy": 0.22771041691303254, "num_tokens": 87919572.0, "step": 42365 }, { "entropy": 5.633954954147339, "epoch": 3.843432510885341, "grad_norm": 1.484375, "learning_rate": 0.00035866009767333964, "loss": 4.9335, "mean_token_accuracy": 0.2216442972421646, "num_tokens": 87929337.0, "step": 42370 }, { "entropy": 5.671731328964233, "epoch": 3.8438860667634254, "grad_norm": 1.265625, "learning_rate": 0.00035863006022150034, "loss": 4.9754, "mean_token_accuracy": 0.214978164434433, "num_tokens": 87940513.0, "step": 42375 }, { "entropy": 5.585833549499512, "epoch": 3.8443396226415096, "grad_norm": 1.3828125, "learning_rate": 0.00035860002104017014, "loss": 4.821, "mean_token_accuracy": 0.2299963966012001, "num_tokens": 87951181.0, "step": 42380 }, { "entropy": 5.624216175079345, "epoch": 3.8447931785195935, "grad_norm": 1.265625, "learning_rate": 0.0003585699801299701, "loss": 4.8819, "mean_token_accuracy": 0.22295817881822586, "num_tokens": 87961925.0, "step": 42385 }, { "entropy": 5.618380832672119, "epoch": 3.8452467343976777, "grad_norm": 1.328125, "learning_rate": 0.00035853993749152165, "loss": 4.8592, "mean_token_accuracy": 0.22466915994882583, "num_tokens": 87972233.0, "step": 42390 }, { "entropy": 5.619912910461426, "epoch": 3.845700290275762, "grad_norm": 1.2734375, "learning_rate": 0.00035850989312544596, "loss": 4.9278, "mean_token_accuracy": 0.2176641121506691, "num_tokens": 87983131.0, "step": 42395 }, { "entropy": 5.586140537261963, "epoch": 3.8461538461538463, "grad_norm": 1.3984375, "learning_rate": 0.0003584798470323644, "loss": 4.8411, "mean_token_accuracy": 0.22479360699653625, "num_tokens": 87993926.0, "step": 42400 }, { "entropy": 5.684434318542481, "epoch": 3.84660740203193, "grad_norm": 1.3125, "learning_rate": 0.0003584497992128984, "loss": 5.0125, "mean_token_accuracy": 0.21059598326683043, "num_tokens": 88004403.0, "step": 42405 }, { "entropy": 5.605659770965576, "epoch": 3.8470609579100143, "grad_norm": 1.25, "learning_rate": 0.0003584197496676692, "loss": 4.8373, "mean_token_accuracy": 0.22597959637641907, "num_tokens": 88015289.0, "step": 42410 }, { "entropy": 5.56340274810791, "epoch": 3.8475145137880986, "grad_norm": 1.25, "learning_rate": 0.00035838969839729846, "loss": 4.8294, "mean_token_accuracy": 0.2276433750987053, "num_tokens": 88025724.0, "step": 42415 }, { "entropy": 5.577134847640991, "epoch": 3.847968069666183, "grad_norm": 1.2578125, "learning_rate": 0.0003583596454024073, "loss": 4.9318, "mean_token_accuracy": 0.21406975239515305, "num_tokens": 88036444.0, "step": 42420 }, { "entropy": 5.650828456878662, "epoch": 3.848421625544267, "grad_norm": 1.3671875, "learning_rate": 0.0003583295906836176, "loss": 4.9129, "mean_token_accuracy": 0.2251036211848259, "num_tokens": 88047334.0, "step": 42425 }, { "entropy": 5.623916578292847, "epoch": 3.8488751814223514, "grad_norm": 1.203125, "learning_rate": 0.00035829953424155065, "loss": 4.8689, "mean_token_accuracy": 0.21903757452964784, "num_tokens": 88057268.0, "step": 42430 }, { "entropy": 5.573695802688599, "epoch": 3.8493287373004357, "grad_norm": 1.1796875, "learning_rate": 0.0003582694760768281, "loss": 4.846, "mean_token_accuracy": 0.22270508706569672, "num_tokens": 88067615.0, "step": 42435 }, { "entropy": 5.645818090438842, "epoch": 3.8497822931785195, "grad_norm": 1.2890625, "learning_rate": 0.00035823941619007155, "loss": 4.9704, "mean_token_accuracy": 0.217561174929142, "num_tokens": 88077754.0, "step": 42440 }, { "entropy": 5.588379621505737, "epoch": 3.8502358490566038, "grad_norm": 1.40625, "learning_rate": 0.00035820935458190275, "loss": 4.8614, "mean_token_accuracy": 0.21765046566724777, "num_tokens": 88088346.0, "step": 42445 }, { "entropy": 5.544213390350341, "epoch": 3.850689404934688, "grad_norm": 1.3359375, "learning_rate": 0.00035817929125294323, "loss": 4.8296, "mean_token_accuracy": 0.2274036228656769, "num_tokens": 88098534.0, "step": 42450 }, { "entropy": 5.563419008255005, "epoch": 3.8511429608127723, "grad_norm": 1.2890625, "learning_rate": 0.0003581492262038148, "loss": 4.9101, "mean_token_accuracy": 0.2232576996088028, "num_tokens": 88109264.0, "step": 42455 }, { "entropy": 5.633353281021118, "epoch": 3.851596516690856, "grad_norm": 1.3125, "learning_rate": 0.0003581191594351392, "loss": 4.9146, "mean_token_accuracy": 0.2245269924402237, "num_tokens": 88120407.0, "step": 42460 }, { "entropy": 5.640510177612304, "epoch": 3.8520500725689404, "grad_norm": 1.2421875, "learning_rate": 0.0003580890909475381, "loss": 4.8684, "mean_token_accuracy": 0.217959201335907, "num_tokens": 88131908.0, "step": 42465 }, { "entropy": 5.549888801574707, "epoch": 3.8525036284470247, "grad_norm": 1.25, "learning_rate": 0.00035805902074163354, "loss": 4.8422, "mean_token_accuracy": 0.2214904472231865, "num_tokens": 88142559.0, "step": 42470 }, { "entropy": 5.587997722625732, "epoch": 3.852957184325109, "grad_norm": 1.40625, "learning_rate": 0.0003580289488180472, "loss": 4.9101, "mean_token_accuracy": 0.22519796192646027, "num_tokens": 88153441.0, "step": 42475 }, { "entropy": 5.607268524169922, "epoch": 3.853410740203193, "grad_norm": 1.828125, "learning_rate": 0.00035799887517740103, "loss": 4.8806, "mean_token_accuracy": 0.22467581629753114, "num_tokens": 88164153.0, "step": 42480 }, { "entropy": 5.675697660446167, "epoch": 3.8538642960812775, "grad_norm": 1.375, "learning_rate": 0.000357968799820317, "loss": 4.9102, "mean_token_accuracy": 0.21547329127788545, "num_tokens": 88174138.0, "step": 42485 }, { "entropy": 5.620659351348877, "epoch": 3.8543178519593613, "grad_norm": 1.328125, "learning_rate": 0.0003579387227474171, "loss": 4.8975, "mean_token_accuracy": 0.21933926939964293, "num_tokens": 88184704.0, "step": 42490 }, { "entropy": 5.7066975116729735, "epoch": 3.8547714078374455, "grad_norm": 1.28125, "learning_rate": 0.0003579086439593232, "loss": 4.9347, "mean_token_accuracy": 0.21374958902597427, "num_tokens": 88194225.0, "step": 42495 }, { "entropy": 5.623697280883789, "epoch": 3.85522496371553, "grad_norm": 1.21875, "learning_rate": 0.0003578785634566574, "loss": 4.906, "mean_token_accuracy": 0.2221931904554367, "num_tokens": 88206125.0, "step": 42500 }, { "entropy": 5.568353939056396, "epoch": 3.855678519593614, "grad_norm": 1.1171875, "learning_rate": 0.00035784848124004187, "loss": 4.7815, "mean_token_accuracy": 0.23359186500310897, "num_tokens": 88217085.0, "step": 42505 }, { "entropy": 5.607264709472656, "epoch": 3.856132075471698, "grad_norm": 1.2734375, "learning_rate": 0.0003578183973100986, "loss": 4.8882, "mean_token_accuracy": 0.21627986580133438, "num_tokens": 88228126.0, "step": 42510 }, { "entropy": 5.624561405181884, "epoch": 3.856585631349782, "grad_norm": 1.265625, "learning_rate": 0.00035778831166744966, "loss": 4.9859, "mean_token_accuracy": 0.21362484842538834, "num_tokens": 88238829.0, "step": 42515 }, { "entropy": 5.630802345275879, "epoch": 3.8570391872278664, "grad_norm": 1.5234375, "learning_rate": 0.0003577582243127175, "loss": 4.8998, "mean_token_accuracy": 0.21610333323478698, "num_tokens": 88249821.0, "step": 42520 }, { "entropy": 5.595686197280884, "epoch": 3.8574927431059507, "grad_norm": 1.2578125, "learning_rate": 0.0003577281352465241, "loss": 4.8581, "mean_token_accuracy": 0.22959115207195283, "num_tokens": 88260126.0, "step": 42525 }, { "entropy": 5.572345542907715, "epoch": 3.857946298984035, "grad_norm": 1.203125, "learning_rate": 0.00035769804446949177, "loss": 4.8948, "mean_token_accuracy": 0.22181571125984192, "num_tokens": 88271492.0, "step": 42530 }, { "entropy": 5.691086673736573, "epoch": 3.8583998548621192, "grad_norm": 1.3046875, "learning_rate": 0.0003576679519822428, "loss": 4.969, "mean_token_accuracy": 0.21242373585700988, "num_tokens": 88281966.0, "step": 42535 }, { "entropy": 5.581513977050781, "epoch": 3.858853410740203, "grad_norm": 1.2421875, "learning_rate": 0.00035763785778539963, "loss": 4.7902, "mean_token_accuracy": 0.23529008626937867, "num_tokens": 88292805.0, "step": 42540 }, { "entropy": 5.567488479614258, "epoch": 3.8593069666182873, "grad_norm": 1.3515625, "learning_rate": 0.0003576077618795844, "loss": 4.8324, "mean_token_accuracy": 0.2294877603650093, "num_tokens": 88302727.0, "step": 42545 }, { "entropy": 5.4796217918396, "epoch": 3.8597605224963716, "grad_norm": 1.2890625, "learning_rate": 0.0003575776642654196, "loss": 4.8388, "mean_token_accuracy": 0.22537384182214737, "num_tokens": 88313150.0, "step": 42550 }, { "entropy": 5.578943204879761, "epoch": 3.860214078374456, "grad_norm": 1.3984375, "learning_rate": 0.00035754756494352767, "loss": 4.8207, "mean_token_accuracy": 0.2296580821275711, "num_tokens": 88323060.0, "step": 42555 }, { "entropy": 5.683638620376587, "epoch": 3.8606676342525397, "grad_norm": 1.390625, "learning_rate": 0.0003575174639145311, "loss": 4.882, "mean_token_accuracy": 0.22596658617258072, "num_tokens": 88332641.0, "step": 42560 }, { "entropy": 5.577805376052856, "epoch": 3.861121190130624, "grad_norm": 1.3203125, "learning_rate": 0.0003574873611790523, "loss": 4.8913, "mean_token_accuracy": 0.22531621903181076, "num_tokens": 88342807.0, "step": 42565 }, { "entropy": 5.518455886840821, "epoch": 3.861574746008708, "grad_norm": 1.234375, "learning_rate": 0.00035745725673771387, "loss": 4.7744, "mean_token_accuracy": 0.22867559641599655, "num_tokens": 88352958.0, "step": 42570 }, { "entropy": 5.647450113296509, "epoch": 3.8620283018867925, "grad_norm": 1.25, "learning_rate": 0.00035742715059113836, "loss": 4.9269, "mean_token_accuracy": 0.2163737565279007, "num_tokens": 88363184.0, "step": 42575 }, { "entropy": 5.539021968841553, "epoch": 3.8624818577648767, "grad_norm": 1.2421875, "learning_rate": 0.0003573970427399484, "loss": 4.8186, "mean_token_accuracy": 0.23205912560224534, "num_tokens": 88373991.0, "step": 42580 }, { "entropy": 5.643276977539062, "epoch": 3.862935413642961, "grad_norm": 1.34375, "learning_rate": 0.00035736693318476646, "loss": 4.8984, "mean_token_accuracy": 0.21713860630989074, "num_tokens": 88384518.0, "step": 42585 }, { "entropy": 5.520178174972534, "epoch": 3.8633889695210453, "grad_norm": 1.3125, "learning_rate": 0.00035733682192621555, "loss": 4.7745, "mean_token_accuracy": 0.22728700935840607, "num_tokens": 88394506.0, "step": 42590 }, { "entropy": 5.602962684631348, "epoch": 3.863842525399129, "grad_norm": 1.3203125, "learning_rate": 0.0003573067089649181, "loss": 4.8815, "mean_token_accuracy": 0.22077593356370925, "num_tokens": 88404625.0, "step": 42595 }, { "entropy": 5.618331527709961, "epoch": 3.8642960812772134, "grad_norm": 1.4140625, "learning_rate": 0.00035727659430149686, "loss": 4.8727, "mean_token_accuracy": 0.2227043554186821, "num_tokens": 88413754.0, "step": 42600 }, { "entropy": 5.689132881164551, "epoch": 3.8647496371552976, "grad_norm": 1.296875, "learning_rate": 0.0003572464779365748, "loss": 4.9839, "mean_token_accuracy": 0.21008697301149368, "num_tokens": 88424613.0, "step": 42605 }, { "entropy": 5.630249786376953, "epoch": 3.8652031930333814, "grad_norm": 1.265625, "learning_rate": 0.00035721635987077455, "loss": 4.8798, "mean_token_accuracy": 0.22755245864391327, "num_tokens": 88435248.0, "step": 42610 }, { "entropy": 5.574333429336548, "epoch": 3.8656567489114657, "grad_norm": 1.359375, "learning_rate": 0.00035718624010471904, "loss": 4.7617, "mean_token_accuracy": 0.23457664400339126, "num_tokens": 88444802.0, "step": 42615 }, { "entropy": 5.616395473480225, "epoch": 3.86611030478955, "grad_norm": 1.328125, "learning_rate": 0.0003571561186390311, "loss": 4.9329, "mean_token_accuracy": 0.21520706862211228, "num_tokens": 88455335.0, "step": 42620 }, { "entropy": 5.671471786499024, "epoch": 3.8665638606676342, "grad_norm": 1.25, "learning_rate": 0.0003571259954743338, "loss": 4.9188, "mean_token_accuracy": 0.2242258682847023, "num_tokens": 88465857.0, "step": 42625 }, { "entropy": 5.633995532989502, "epoch": 3.8670174165457185, "grad_norm": 1.21875, "learning_rate": 0.00035709587061124985, "loss": 4.9471, "mean_token_accuracy": 0.21358892172574998, "num_tokens": 88475930.0, "step": 42630 }, { "entropy": 5.6251749992370605, "epoch": 3.8674709724238028, "grad_norm": 1.1328125, "learning_rate": 0.00035706574405040245, "loss": 4.8879, "mean_token_accuracy": 0.225510673224926, "num_tokens": 88486732.0, "step": 42635 }, { "entropy": 5.623756456375122, "epoch": 3.867924528301887, "grad_norm": 1.2734375, "learning_rate": 0.0003570356157924145, "loss": 4.8858, "mean_token_accuracy": 0.22028617560863495, "num_tokens": 88497017.0, "step": 42640 }, { "entropy": 5.591638708114624, "epoch": 3.868378084179971, "grad_norm": 1.3359375, "learning_rate": 0.0003570054858379092, "loss": 4.7742, "mean_token_accuracy": 0.2406635031104088, "num_tokens": 88507423.0, "step": 42645 }, { "entropy": 5.601606988906861, "epoch": 3.868831640058055, "grad_norm": 1.2421875, "learning_rate": 0.00035697535418750955, "loss": 4.8709, "mean_token_accuracy": 0.2259859561920166, "num_tokens": 88517795.0, "step": 42650 }, { "entropy": 5.49961256980896, "epoch": 3.8692851959361394, "grad_norm": 1.2578125, "learning_rate": 0.00035694522084183864, "loss": 4.7821, "mean_token_accuracy": 0.22595662176609038, "num_tokens": 88527641.0, "step": 42655 }, { "entropy": 5.601541566848755, "epoch": 3.8697387518142237, "grad_norm": 1.4453125, "learning_rate": 0.00035691508580151966, "loss": 4.9153, "mean_token_accuracy": 0.21696866750717164, "num_tokens": 88537874.0, "step": 42660 }, { "entropy": 5.632071924209595, "epoch": 3.8701923076923075, "grad_norm": 1.296875, "learning_rate": 0.0003568849490671759, "loss": 4.9091, "mean_token_accuracy": 0.21993334740400314, "num_tokens": 88548108.0, "step": 42665 }, { "entropy": 5.547215557098388, "epoch": 3.8706458635703918, "grad_norm": 1.3359375, "learning_rate": 0.0003568548106394305, "loss": 4.7737, "mean_token_accuracy": 0.22869363576173782, "num_tokens": 88558284.0, "step": 42670 }, { "entropy": 5.596485996246338, "epoch": 3.871099419448476, "grad_norm": 1.28125, "learning_rate": 0.0003568246705189067, "loss": 4.902, "mean_token_accuracy": 0.21695830523967743, "num_tokens": 88568635.0, "step": 42675 }, { "entropy": 5.612693834304809, "epoch": 3.8715529753265603, "grad_norm": 1.265625, "learning_rate": 0.0003567945287062279, "loss": 4.8928, "mean_token_accuracy": 0.22160447984933854, "num_tokens": 88577968.0, "step": 42680 }, { "entropy": 5.68268346786499, "epoch": 3.8720065312046446, "grad_norm": 1.1328125, "learning_rate": 0.00035676438520201745, "loss": 4.9256, "mean_token_accuracy": 0.21818131506443023, "num_tokens": 88590562.0, "step": 42685 }, { "entropy": 5.59676947593689, "epoch": 3.872460087082729, "grad_norm": 1.1796875, "learning_rate": 0.00035673424000689857, "loss": 4.907, "mean_token_accuracy": 0.21371458768844603, "num_tokens": 88601187.0, "step": 42690 }, { "entropy": 5.54228458404541, "epoch": 3.8729136429608126, "grad_norm": 1.1640625, "learning_rate": 0.00035670409312149495, "loss": 4.7973, "mean_token_accuracy": 0.22271920442581178, "num_tokens": 88611459.0, "step": 42695 }, { "entropy": 5.61933388710022, "epoch": 3.873367198838897, "grad_norm": 1.3515625, "learning_rate": 0.00035667394454642963, "loss": 4.9011, "mean_token_accuracy": 0.2229720264673233, "num_tokens": 88621652.0, "step": 42700 }, { "entropy": 5.608958053588867, "epoch": 3.873820754716981, "grad_norm": 1.25, "learning_rate": 0.0003566437942823265, "loss": 4.7675, "mean_token_accuracy": 0.22596181631088258, "num_tokens": 88632425.0, "step": 42705 }, { "entropy": 5.549476957321167, "epoch": 3.8742743105950654, "grad_norm": 1.390625, "learning_rate": 0.00035661364232980884, "loss": 4.8, "mean_token_accuracy": 0.2315898969769478, "num_tokens": 88641263.0, "step": 42710 }, { "entropy": 5.544644546508789, "epoch": 3.8747278664731493, "grad_norm": 1.3359375, "learning_rate": 0.00035658348868950027, "loss": 4.8727, "mean_token_accuracy": 0.2201856940984726, "num_tokens": 88651665.0, "step": 42715 }, { "entropy": 5.582266569137573, "epoch": 3.8751814223512335, "grad_norm": 1.3828125, "learning_rate": 0.00035655333336202436, "loss": 4.819, "mean_token_accuracy": 0.22780657410621644, "num_tokens": 88660791.0, "step": 42720 }, { "entropy": 5.523458242416382, "epoch": 3.875634978229318, "grad_norm": 1.359375, "learning_rate": 0.0003565231763480047, "loss": 4.8035, "mean_token_accuracy": 0.23371667712926864, "num_tokens": 88671341.0, "step": 42725 }, { "entropy": 5.58234486579895, "epoch": 3.876088534107402, "grad_norm": 1.1640625, "learning_rate": 0.0003564930176480651, "loss": 4.8736, "mean_token_accuracy": 0.21932352483272552, "num_tokens": 88682500.0, "step": 42730 }, { "entropy": 5.628639030456543, "epoch": 3.8765420899854863, "grad_norm": 1.21875, "learning_rate": 0.00035646285726282896, "loss": 4.885, "mean_token_accuracy": 0.21412044316530227, "num_tokens": 88693513.0, "step": 42735 }, { "entropy": 5.654679775238037, "epoch": 3.8769956458635706, "grad_norm": 1.3515625, "learning_rate": 0.00035643269519292027, "loss": 4.9538, "mean_token_accuracy": 0.21985863596200944, "num_tokens": 88703498.0, "step": 42740 }, { "entropy": 5.5956048488616945, "epoch": 3.8774492017416544, "grad_norm": 1.25, "learning_rate": 0.0003564025314389627, "loss": 4.8616, "mean_token_accuracy": 0.2211844354867935, "num_tokens": 88714217.0, "step": 42745 }, { "entropy": 5.601555681228637, "epoch": 3.8779027576197387, "grad_norm": 1.1953125, "learning_rate": 0.00035637236600157994, "loss": 4.9149, "mean_token_accuracy": 0.2154860958456993, "num_tokens": 88725006.0, "step": 42750 }, { "entropy": 5.568734645843506, "epoch": 3.878356313497823, "grad_norm": 1.2890625, "learning_rate": 0.000356342198881396, "loss": 4.8159, "mean_token_accuracy": 0.2271187946200371, "num_tokens": 88735253.0, "step": 42755 }, { "entropy": 5.623343515396118, "epoch": 3.878809869375907, "grad_norm": 1.21875, "learning_rate": 0.00035631203007903465, "loss": 4.9292, "mean_token_accuracy": 0.22137145102024078, "num_tokens": 88746313.0, "step": 42760 }, { "entropy": 5.581971788406372, "epoch": 3.879263425253991, "grad_norm": 1.1875, "learning_rate": 0.0003562818595951198, "loss": 4.8289, "mean_token_accuracy": 0.23292960375547409, "num_tokens": 88757448.0, "step": 42765 }, { "entropy": 5.611841106414795, "epoch": 3.8797169811320753, "grad_norm": 1.3984375, "learning_rate": 0.0003562516874302754, "loss": 4.8804, "mean_token_accuracy": 0.22864297330379485, "num_tokens": 88767426.0, "step": 42770 }, { "entropy": 5.600691318511963, "epoch": 3.8801705370101596, "grad_norm": 1.2265625, "learning_rate": 0.0003562215135851253, "loss": 4.9137, "mean_token_accuracy": 0.2213900551199913, "num_tokens": 88778188.0, "step": 42775 }, { "entropy": 5.686941814422608, "epoch": 3.880624092888244, "grad_norm": 1.3359375, "learning_rate": 0.00035619133806029374, "loss": 4.9315, "mean_token_accuracy": 0.22943966537714006, "num_tokens": 88788927.0, "step": 42780 }, { "entropy": 5.673157167434693, "epoch": 3.881077648766328, "grad_norm": 1.2421875, "learning_rate": 0.00035616116085640455, "loss": 4.9282, "mean_token_accuracy": 0.21913135945796966, "num_tokens": 88798809.0, "step": 42785 }, { "entropy": 5.476976585388184, "epoch": 3.8815312046444124, "grad_norm": 1.21875, "learning_rate": 0.0003561309819740819, "loss": 4.7728, "mean_token_accuracy": 0.23172022849321366, "num_tokens": 88808688.0, "step": 42790 }, { "entropy": 5.565728044509887, "epoch": 3.8819847605224966, "grad_norm": 1.3046875, "learning_rate": 0.00035610080141394983, "loss": 4.8659, "mean_token_accuracy": 0.22325649112462997, "num_tokens": 88818400.0, "step": 42795 }, { "entropy": 5.569725275039673, "epoch": 3.8824383164005805, "grad_norm": 1.2265625, "learning_rate": 0.00035607061917663254, "loss": 4.8806, "mean_token_accuracy": 0.22431000024080278, "num_tokens": 88828032.0, "step": 42800 }, { "entropy": 5.621572113037109, "epoch": 3.8828918722786647, "grad_norm": 1.28125, "learning_rate": 0.00035604043526275413, "loss": 4.9433, "mean_token_accuracy": 0.22619543671607972, "num_tokens": 88839856.0, "step": 42805 }, { "entropy": 5.619917345046997, "epoch": 3.883345428156749, "grad_norm": 1.2578125, "learning_rate": 0.000356010249672939, "loss": 4.8634, "mean_token_accuracy": 0.2292220786213875, "num_tokens": 88851016.0, "step": 42810 }, { "entropy": 5.585749530792237, "epoch": 3.8837989840348333, "grad_norm": 1.3359375, "learning_rate": 0.0003559800624078111, "loss": 4.9095, "mean_token_accuracy": 0.22026924043893814, "num_tokens": 88859795.0, "step": 42815 }, { "entropy": 5.582521104812622, "epoch": 3.884252539912917, "grad_norm": 1.28125, "learning_rate": 0.0003559498734679949, "loss": 4.9169, "mean_token_accuracy": 0.22029165923595428, "num_tokens": 88869595.0, "step": 42820 }, { "entropy": 5.6647968769073485, "epoch": 3.8847060957910013, "grad_norm": 1.140625, "learning_rate": 0.0003559196828541148, "loss": 4.9234, "mean_token_accuracy": 0.21099997609853743, "num_tokens": 88880857.0, "step": 42825 }, { "entropy": 5.575960636138916, "epoch": 3.8851596516690856, "grad_norm": 1.2421875, "learning_rate": 0.000355889490566795, "loss": 4.8235, "mean_token_accuracy": 0.22916074842214584, "num_tokens": 88890687.0, "step": 42830 }, { "entropy": 5.610993528366089, "epoch": 3.88561320754717, "grad_norm": 1.28125, "learning_rate": 0.00035585929660665984, "loss": 4.8522, "mean_token_accuracy": 0.22015308290719987, "num_tokens": 88899600.0, "step": 42835 }, { "entropy": 5.622123050689697, "epoch": 3.886066763425254, "grad_norm": 1.390625, "learning_rate": 0.0003558291009743339, "loss": 4.8503, "mean_token_accuracy": 0.22689017057418823, "num_tokens": 88909521.0, "step": 42840 }, { "entropy": 5.6108520984649655, "epoch": 3.8865203193033384, "grad_norm": 1.4921875, "learning_rate": 0.00035579890367044153, "loss": 4.9308, "mean_token_accuracy": 0.2173363208770752, "num_tokens": 88920061.0, "step": 42845 }, { "entropy": 5.547650098800659, "epoch": 3.8869738751814222, "grad_norm": 1.296875, "learning_rate": 0.0003557687046956073, "loss": 4.7846, "mean_token_accuracy": 0.22666936963796616, "num_tokens": 88929504.0, "step": 42850 }, { "entropy": 5.693078422546387, "epoch": 3.8874274310595065, "grad_norm": 1.203125, "learning_rate": 0.00035573850405045554, "loss": 5.0101, "mean_token_accuracy": 0.20609140247106553, "num_tokens": 88940653.0, "step": 42855 }, { "entropy": 5.657821607589722, "epoch": 3.8878809869375908, "grad_norm": 1.3671875, "learning_rate": 0.0003557083017356111, "loss": 4.951, "mean_token_accuracy": 0.22172697633504868, "num_tokens": 88952133.0, "step": 42860 }, { "entropy": 5.539954137802124, "epoch": 3.888334542815675, "grad_norm": 1.15625, "learning_rate": 0.0003556780977516983, "loss": 4.8303, "mean_token_accuracy": 0.2256540283560753, "num_tokens": 88963190.0, "step": 42865 }, { "entropy": 5.483289194107056, "epoch": 3.888788098693759, "grad_norm": 1.328125, "learning_rate": 0.00035564789209934183, "loss": 4.7792, "mean_token_accuracy": 0.2274247869849205, "num_tokens": 88973034.0, "step": 42870 }, { "entropy": 5.570822381973267, "epoch": 3.889241654571843, "grad_norm": 1.2890625, "learning_rate": 0.00035561768477916655, "loss": 4.7845, "mean_token_accuracy": 0.23778816014528276, "num_tokens": 88982809.0, "step": 42875 }, { "entropy": 5.594953203201294, "epoch": 3.8896952104499274, "grad_norm": 1.1875, "learning_rate": 0.000355587475791797, "loss": 4.8642, "mean_token_accuracy": 0.21591373682022094, "num_tokens": 88993563.0, "step": 42880 }, { "entropy": 5.526847839355469, "epoch": 3.8901487663280117, "grad_norm": 1.3671875, "learning_rate": 0.00035555726513785785, "loss": 4.7875, "mean_token_accuracy": 0.22998472154140473, "num_tokens": 89002408.0, "step": 42885 }, { "entropy": 5.555732107162475, "epoch": 3.890602322206096, "grad_norm": 1.2421875, "learning_rate": 0.0003555270528179739, "loss": 4.8611, "mean_token_accuracy": 0.22390047013759612, "num_tokens": 89013060.0, "step": 42890 }, { "entropy": 5.658052062988281, "epoch": 3.89105587808418, "grad_norm": 1.2109375, "learning_rate": 0.00035549683883277, "loss": 4.9069, "mean_token_accuracy": 0.22229683250188828, "num_tokens": 89023406.0, "step": 42895 }, { "entropy": 5.638285827636719, "epoch": 3.891509433962264, "grad_norm": 1.296875, "learning_rate": 0.000355466623182871, "loss": 4.9185, "mean_token_accuracy": 0.2270367130637169, "num_tokens": 89033800.0, "step": 42900 }, { "entropy": 5.686974906921387, "epoch": 3.8919629898403483, "grad_norm": 1.171875, "learning_rate": 0.0003554364058689017, "loss": 4.8898, "mean_token_accuracy": 0.21828233152627946, "num_tokens": 89044601.0, "step": 42905 }, { "entropy": 5.666297817230225, "epoch": 3.8924165457184325, "grad_norm": 1.2109375, "learning_rate": 0.000355406186891487, "loss": 4.9275, "mean_token_accuracy": 0.21877190917730333, "num_tokens": 89056138.0, "step": 42910 }, { "entropy": 5.594916248321534, "epoch": 3.892870101596517, "grad_norm": 1.2734375, "learning_rate": 0.0003553759662512519, "loss": 4.8506, "mean_token_accuracy": 0.22407578825950622, "num_tokens": 89065776.0, "step": 42915 }, { "entropy": 5.749632835388184, "epoch": 3.8933236574746006, "grad_norm": 1.21875, "learning_rate": 0.00035534574394882135, "loss": 4.9834, "mean_token_accuracy": 0.20963463932275772, "num_tokens": 89076926.0, "step": 42920 }, { "entropy": 5.625717687606811, "epoch": 3.893777213352685, "grad_norm": 1.40625, "learning_rate": 0.0003553155199848203, "loss": 4.8919, "mean_token_accuracy": 0.21228738278150558, "num_tokens": 89088036.0, "step": 42925 }, { "entropy": 5.573708152770996, "epoch": 3.894230769230769, "grad_norm": 1.2578125, "learning_rate": 0.0003552852943598739, "loss": 4.8444, "mean_token_accuracy": 0.22454096823930741, "num_tokens": 89098606.0, "step": 42930 }, { "entropy": 5.560185337066651, "epoch": 3.8946843251088534, "grad_norm": 1.3359375, "learning_rate": 0.000355255067074607, "loss": 4.812, "mean_token_accuracy": 0.2280314013361931, "num_tokens": 89107733.0, "step": 42935 }, { "entropy": 5.562902212142944, "epoch": 3.8951378809869377, "grad_norm": 1.2578125, "learning_rate": 0.00035522483812964496, "loss": 4.8337, "mean_token_accuracy": 0.22810633778572081, "num_tokens": 89119094.0, "step": 42940 }, { "entropy": 5.572535228729248, "epoch": 3.895591436865022, "grad_norm": 1.390625, "learning_rate": 0.00035519460752561285, "loss": 4.7463, "mean_token_accuracy": 0.22831853181123735, "num_tokens": 89129254.0, "step": 42945 }, { "entropy": 5.6140917301177975, "epoch": 3.8960449927431062, "grad_norm": 1.2109375, "learning_rate": 0.0003551643752631358, "loss": 4.8151, "mean_token_accuracy": 0.2297599047422409, "num_tokens": 89139609.0, "step": 42950 }, { "entropy": 5.611825609207154, "epoch": 3.89649854862119, "grad_norm": 1.2890625, "learning_rate": 0.0003551341413428391, "loss": 4.8528, "mean_token_accuracy": 0.2127300500869751, "num_tokens": 89149504.0, "step": 42955 }, { "entropy": 5.58812403678894, "epoch": 3.8969521044992743, "grad_norm": 1.234375, "learning_rate": 0.0003551039057653478, "loss": 4.8525, "mean_token_accuracy": 0.22652725428342818, "num_tokens": 89160036.0, "step": 42960 }, { "entropy": 5.605102396011352, "epoch": 3.8974056603773586, "grad_norm": 1.265625, "learning_rate": 0.0003550736685312874, "loss": 4.9061, "mean_token_accuracy": 0.21726494580507277, "num_tokens": 89170960.0, "step": 42965 }, { "entropy": 5.591526651382447, "epoch": 3.8978592162554424, "grad_norm": 1.3671875, "learning_rate": 0.0003550434296412831, "loss": 4.8343, "mean_token_accuracy": 0.2309944897890091, "num_tokens": 89179630.0, "step": 42970 }, { "entropy": 5.619865083694458, "epoch": 3.8983127721335267, "grad_norm": 1.2265625, "learning_rate": 0.0003550131890959603, "loss": 4.8794, "mean_token_accuracy": 0.22770145535469055, "num_tokens": 89188880.0, "step": 42975 }, { "entropy": 5.657916927337647, "epoch": 3.898766328011611, "grad_norm": 1.2734375, "learning_rate": 0.00035498294689594435, "loss": 4.8896, "mean_token_accuracy": 0.22078754156827926, "num_tokens": 89199585.0, "step": 42980 }, { "entropy": 5.610892724990845, "epoch": 3.899219883889695, "grad_norm": 1.28125, "learning_rate": 0.00035495270304186074, "loss": 4.8557, "mean_token_accuracy": 0.21994916200637818, "num_tokens": 89209812.0, "step": 42985 }, { "entropy": 5.582829093933105, "epoch": 3.8996734397677795, "grad_norm": 1.203125, "learning_rate": 0.0003549224575343347, "loss": 4.8712, "mean_token_accuracy": 0.22428322434425355, "num_tokens": 89220244.0, "step": 42990 }, { "entropy": 5.575133275985718, "epoch": 3.9001269956458637, "grad_norm": 1.359375, "learning_rate": 0.00035489221037399203, "loss": 4.9105, "mean_token_accuracy": 0.2173730969429016, "num_tokens": 89230618.0, "step": 42995 }, { "entropy": 5.6275060176849365, "epoch": 3.900580551523948, "grad_norm": 1.2421875, "learning_rate": 0.00035486196156145805, "loss": 4.8484, "mean_token_accuracy": 0.22284162044525146, "num_tokens": 89242041.0, "step": 43000 }, { "entropy": 5.6372627258300785, "epoch": 3.901034107402032, "grad_norm": 1.21875, "learning_rate": 0.0003548317110973583, "loss": 4.8987, "mean_token_accuracy": 0.2224171355366707, "num_tokens": 89252817.0, "step": 43005 }, { "entropy": 5.6234947681427006, "epoch": 3.901487663280116, "grad_norm": 1.2109375, "learning_rate": 0.0003548014589823185, "loss": 4.9162, "mean_token_accuracy": 0.22318633198738097, "num_tokens": 89263702.0, "step": 43010 }, { "entropy": 5.589557647705078, "epoch": 3.9019412191582004, "grad_norm": 1.2734375, "learning_rate": 0.00035477120521696417, "loss": 4.8277, "mean_token_accuracy": 0.2276522174477577, "num_tokens": 89273822.0, "step": 43015 }, { "entropy": 5.666953277587891, "epoch": 3.9023947750362846, "grad_norm": 1.234375, "learning_rate": 0.0003547409498019209, "loss": 4.9919, "mean_token_accuracy": 0.2130616530776024, "num_tokens": 89283973.0, "step": 43020 }, { "entropy": 5.644901943206787, "epoch": 3.9028483309143684, "grad_norm": 1.359375, "learning_rate": 0.00035471069273781454, "loss": 4.9087, "mean_token_accuracy": 0.22813804000616072, "num_tokens": 89294059.0, "step": 43025 }, { "entropy": 5.612426280975342, "epoch": 3.9033018867924527, "grad_norm": 1.3828125, "learning_rate": 0.0003546804340252707, "loss": 4.8281, "mean_token_accuracy": 0.22520266473293304, "num_tokens": 89304049.0, "step": 43030 }, { "entropy": 5.539799785614013, "epoch": 3.903755442670537, "grad_norm": 1.375, "learning_rate": 0.00035465017366491527, "loss": 4.7644, "mean_token_accuracy": 0.23296934813261033, "num_tokens": 89314468.0, "step": 43035 }, { "entropy": 5.536766910552979, "epoch": 3.9042089985486212, "grad_norm": 1.265625, "learning_rate": 0.00035461991165737386, "loss": 4.8428, "mean_token_accuracy": 0.22753619253635407, "num_tokens": 89324580.0, "step": 43040 }, { "entropy": 5.684184741973877, "epoch": 3.9046625544267055, "grad_norm": 1.203125, "learning_rate": 0.00035458964800327245, "loss": 4.9416, "mean_token_accuracy": 0.2114985004067421, "num_tokens": 89334976.0, "step": 43045 }, { "entropy": 5.650997495651245, "epoch": 3.90511611030479, "grad_norm": 1.1953125, "learning_rate": 0.00035455938270323684, "loss": 4.8903, "mean_token_accuracy": 0.22097509503364562, "num_tokens": 89345210.0, "step": 43050 }, { "entropy": 5.56312198638916, "epoch": 3.9055696661828736, "grad_norm": 1.2890625, "learning_rate": 0.0003545291157578928, "loss": 4.7676, "mean_token_accuracy": 0.2340549498796463, "num_tokens": 89354623.0, "step": 43055 }, { "entropy": 5.564368391036988, "epoch": 3.906023222060958, "grad_norm": 1.21875, "learning_rate": 0.00035449884716786653, "loss": 4.8374, "mean_token_accuracy": 0.22510685473680497, "num_tokens": 89364684.0, "step": 43060 }, { "entropy": 5.591606330871582, "epoch": 3.906476777939042, "grad_norm": 1.21875, "learning_rate": 0.00035446857693378377, "loss": 4.9041, "mean_token_accuracy": 0.21740567088127136, "num_tokens": 89375415.0, "step": 43065 }, { "entropy": 5.642599248886109, "epoch": 3.9069303338171264, "grad_norm": 1.265625, "learning_rate": 0.0003544383050562706, "loss": 4.9515, "mean_token_accuracy": 0.22354326099157334, "num_tokens": 89385791.0, "step": 43070 }, { "entropy": 5.660962057113648, "epoch": 3.90738388969521, "grad_norm": 1.296875, "learning_rate": 0.000354408031535953, "loss": 4.9888, "mean_token_accuracy": 0.21786124259233475, "num_tokens": 89395345.0, "step": 43075 }, { "entropy": 5.597086715698242, "epoch": 3.9078374455732945, "grad_norm": 1.1796875, "learning_rate": 0.00035437775637345715, "loss": 4.8315, "mean_token_accuracy": 0.22820939719676972, "num_tokens": 89405413.0, "step": 43080 }, { "entropy": 5.61079158782959, "epoch": 3.9082910014513788, "grad_norm": 1.421875, "learning_rate": 0.00035434747956940906, "loss": 4.8588, "mean_token_accuracy": 0.22560741007328033, "num_tokens": 89415168.0, "step": 43085 }, { "entropy": 5.5550049304962155, "epoch": 3.908744557329463, "grad_norm": 1.203125, "learning_rate": 0.00035431720112443475, "loss": 4.8548, "mean_token_accuracy": 0.22644688338041305, "num_tokens": 89426438.0, "step": 43090 }, { "entropy": 5.56920862197876, "epoch": 3.9091981132075473, "grad_norm": 1.1953125, "learning_rate": 0.00035428692103916067, "loss": 4.7966, "mean_token_accuracy": 0.22562383860349655, "num_tokens": 89437454.0, "step": 43095 }, { "entropy": 5.634692764282226, "epoch": 3.9096516690856316, "grad_norm": 1.1484375, "learning_rate": 0.0003542566393142128, "loss": 4.8437, "mean_token_accuracy": 0.22463493496179582, "num_tokens": 89448082.0, "step": 43100 }, { "entropy": 5.540117311477661, "epoch": 3.9101052249637154, "grad_norm": 1.3203125, "learning_rate": 0.00035422635595021745, "loss": 4.8047, "mean_token_accuracy": 0.22532156109809875, "num_tokens": 89458227.0, "step": 43105 }, { "entropy": 5.570941543579101, "epoch": 3.9105587808417996, "grad_norm": 1.28125, "learning_rate": 0.00035419607094780084, "loss": 4.8766, "mean_token_accuracy": 0.21982712745666505, "num_tokens": 89468374.0, "step": 43110 }, { "entropy": 5.603132629394532, "epoch": 3.911012336719884, "grad_norm": 1.421875, "learning_rate": 0.00035416578430758934, "loss": 4.9146, "mean_token_accuracy": 0.22127149403095245, "num_tokens": 89477728.0, "step": 43115 }, { "entropy": 5.648571634292603, "epoch": 3.911465892597968, "grad_norm": 1.203125, "learning_rate": 0.00035413549603020915, "loss": 4.9008, "mean_token_accuracy": 0.22545821815729142, "num_tokens": 89487107.0, "step": 43120 }, { "entropy": 5.643214702606201, "epoch": 3.911919448476052, "grad_norm": 1.40625, "learning_rate": 0.00035410520611628676, "loss": 4.8865, "mean_token_accuracy": 0.2316722571849823, "num_tokens": 89497075.0, "step": 43125 }, { "entropy": 5.498446226119995, "epoch": 3.9123730043541363, "grad_norm": 1.171875, "learning_rate": 0.0003540749145664486, "loss": 4.8233, "mean_token_accuracy": 0.22406744360923767, "num_tokens": 89508068.0, "step": 43130 }, { "entropy": 5.584011602401733, "epoch": 3.9128265602322205, "grad_norm": 1.2578125, "learning_rate": 0.0003540446213813211, "loss": 4.8085, "mean_token_accuracy": 0.23416467607021332, "num_tokens": 89518371.0, "step": 43135 }, { "entropy": 5.592210197448731, "epoch": 3.913280116110305, "grad_norm": 1.2890625, "learning_rate": 0.00035401432656153057, "loss": 4.8775, "mean_token_accuracy": 0.22430134266614915, "num_tokens": 89529024.0, "step": 43140 }, { "entropy": 5.5411238193511965, "epoch": 3.913733671988389, "grad_norm": 1.3046875, "learning_rate": 0.00035398403010770377, "loss": 4.761, "mean_token_accuracy": 0.2330788031220436, "num_tokens": 89540331.0, "step": 43145 }, { "entropy": 5.501801633834839, "epoch": 3.9141872278664733, "grad_norm": 1.34375, "learning_rate": 0.000353953732020467, "loss": 4.7783, "mean_token_accuracy": 0.23395952433347703, "num_tokens": 89550385.0, "step": 43150 }, { "entropy": 5.620708036422729, "epoch": 3.9146407837445576, "grad_norm": 1.34375, "learning_rate": 0.00035392343230044687, "loss": 4.9305, "mean_token_accuracy": 0.2191256195306778, "num_tokens": 89561480.0, "step": 43155 }, { "entropy": 5.612206840515137, "epoch": 3.9150943396226414, "grad_norm": 1.1953125, "learning_rate": 0.00035389313094827017, "loss": 4.8586, "mean_token_accuracy": 0.21825949102640152, "num_tokens": 89571897.0, "step": 43160 }, { "entropy": 5.62544960975647, "epoch": 3.9155478955007257, "grad_norm": 1.3046875, "learning_rate": 0.00035386282796456343, "loss": 4.8826, "mean_token_accuracy": 0.22333759516477586, "num_tokens": 89582019.0, "step": 43165 }, { "entropy": 5.599987411499024, "epoch": 3.91600145137881, "grad_norm": 1.375, "learning_rate": 0.0003538325233499532, "loss": 4.8672, "mean_token_accuracy": 0.22556322813034058, "num_tokens": 89591806.0, "step": 43170 }, { "entropy": 5.566720676422119, "epoch": 3.9164550072568938, "grad_norm": 1.2578125, "learning_rate": 0.00035380221710506636, "loss": 4.8526, "mean_token_accuracy": 0.22628452032804489, "num_tokens": 89601845.0, "step": 43175 }, { "entropy": 5.627076959609985, "epoch": 3.916908563134978, "grad_norm": 1.2265625, "learning_rate": 0.00035377190923052964, "loss": 4.9453, "mean_token_accuracy": 0.22301062643527986, "num_tokens": 89612331.0, "step": 43180 }, { "entropy": 5.6248725891113285, "epoch": 3.9173621190130623, "grad_norm": 1.3828125, "learning_rate": 0.00035374159972696966, "loss": 4.9231, "mean_token_accuracy": 0.22055679112672805, "num_tokens": 89622631.0, "step": 43185 }, { "entropy": 5.614597463607788, "epoch": 3.9178156748911466, "grad_norm": 1.2421875, "learning_rate": 0.0003537112885950133, "loss": 4.9329, "mean_token_accuracy": 0.21597190350294113, "num_tokens": 89633065.0, "step": 43190 }, { "entropy": 5.6464110851287845, "epoch": 3.918269230769231, "grad_norm": 1.375, "learning_rate": 0.00035368097583528756, "loss": 4.901, "mean_token_accuracy": 0.22663470059633256, "num_tokens": 89643451.0, "step": 43195 }, { "entropy": 5.7089378356933596, "epoch": 3.918722786647315, "grad_norm": 1.171875, "learning_rate": 0.0003536506614484192, "loss": 4.9347, "mean_token_accuracy": 0.2236470028758049, "num_tokens": 89654786.0, "step": 43200 }, { "entropy": 5.659652137756348, "epoch": 3.9191763425253994, "grad_norm": 1.2109375, "learning_rate": 0.0003536203454350351, "loss": 4.9325, "mean_token_accuracy": 0.2184249758720398, "num_tokens": 89665459.0, "step": 43205 }, { "entropy": 5.573454332351685, "epoch": 3.919629898403483, "grad_norm": 1.2734375, "learning_rate": 0.0003535900277957621, "loss": 4.8664, "mean_token_accuracy": 0.22049006521701814, "num_tokens": 89675149.0, "step": 43210 }, { "entropy": 5.593321323394775, "epoch": 3.9200834542815675, "grad_norm": 1.328125, "learning_rate": 0.00035355970853122743, "loss": 4.8938, "mean_token_accuracy": 0.22758912444114685, "num_tokens": 89684994.0, "step": 43215 }, { "entropy": 5.693453598022461, "epoch": 3.9205370101596517, "grad_norm": 1.2265625, "learning_rate": 0.00035352938764205793, "loss": 5.0035, "mean_token_accuracy": 0.20932717621326447, "num_tokens": 89694751.0, "step": 43220 }, { "entropy": 5.626496887207031, "epoch": 3.920990566037736, "grad_norm": 1.3125, "learning_rate": 0.0003534990651288807, "loss": 4.8484, "mean_token_accuracy": 0.22037066370248795, "num_tokens": 89704976.0, "step": 43225 }, { "entropy": 5.643860149383545, "epoch": 3.92144412191582, "grad_norm": 1.3359375, "learning_rate": 0.00035346874099232274, "loss": 4.9573, "mean_token_accuracy": 0.2149613082408905, "num_tokens": 89715863.0, "step": 43230 }, { "entropy": 5.603780126571655, "epoch": 3.921897677793904, "grad_norm": 1.3671875, "learning_rate": 0.00035343841523301125, "loss": 4.9045, "mean_token_accuracy": 0.2233002558350563, "num_tokens": 89725856.0, "step": 43235 }, { "entropy": 5.630465793609619, "epoch": 3.9223512336719883, "grad_norm": 1.2421875, "learning_rate": 0.0003534080878515733, "loss": 4.9236, "mean_token_accuracy": 0.211833655834198, "num_tokens": 89736345.0, "step": 43240 }, { "entropy": 5.666217374801636, "epoch": 3.9228047895500726, "grad_norm": 1.3671875, "learning_rate": 0.0003533777588486362, "loss": 4.9242, "mean_token_accuracy": 0.22685311287641524, "num_tokens": 89746960.0, "step": 43245 }, { "entropy": 5.605423307418823, "epoch": 3.923258345428157, "grad_norm": 1.265625, "learning_rate": 0.000353347428224827, "loss": 4.9196, "mean_token_accuracy": 0.2177856221795082, "num_tokens": 89757373.0, "step": 43250 }, { "entropy": 5.629535055160522, "epoch": 3.923711901306241, "grad_norm": 1.1875, "learning_rate": 0.00035331709598077304, "loss": 4.891, "mean_token_accuracy": 0.22138093113899232, "num_tokens": 89767895.0, "step": 43255 }, { "entropy": 5.629093265533447, "epoch": 3.924165457184325, "grad_norm": 1.265625, "learning_rate": 0.0003532867621171016, "loss": 4.8588, "mean_token_accuracy": 0.2249281495809555, "num_tokens": 89777512.0, "step": 43260 }, { "entropy": 5.617240476608276, "epoch": 3.9246190130624092, "grad_norm": 1.3125, "learning_rate": 0.00035325642663443994, "loss": 4.8926, "mean_token_accuracy": 0.2241021066904068, "num_tokens": 89787308.0, "step": 43265 }, { "entropy": 5.626300096511841, "epoch": 3.9250725689404935, "grad_norm": 1.40625, "learning_rate": 0.0003532260895334155, "loss": 4.9148, "mean_token_accuracy": 0.2241753175854683, "num_tokens": 89798384.0, "step": 43270 }, { "entropy": 5.663939094543457, "epoch": 3.9255261248185778, "grad_norm": 1.2265625, "learning_rate": 0.00035319575081465556, "loss": 4.9387, "mean_token_accuracy": 0.22019025534391404, "num_tokens": 89808757.0, "step": 43275 }, { "entropy": 5.652631711959839, "epoch": 3.9259796806966616, "grad_norm": 1.3203125, "learning_rate": 0.00035316541047878753, "loss": 4.9014, "mean_token_accuracy": 0.21873293519020082, "num_tokens": 89818925.0, "step": 43280 }, { "entropy": 5.674756193161011, "epoch": 3.926433236574746, "grad_norm": 1.3984375, "learning_rate": 0.0003531350685264389, "loss": 4.9429, "mean_token_accuracy": 0.223711359500885, "num_tokens": 89828647.0, "step": 43285 }, { "entropy": 5.71081509590149, "epoch": 3.92688679245283, "grad_norm": 1.25, "learning_rate": 0.00035310472495823713, "loss": 4.9823, "mean_token_accuracy": 0.21380311399698257, "num_tokens": 89838784.0, "step": 43290 }, { "entropy": 5.616066265106201, "epoch": 3.9273403483309144, "grad_norm": 1.2578125, "learning_rate": 0.0003530743797748098, "loss": 4.8833, "mean_token_accuracy": 0.22013625949621202, "num_tokens": 89848464.0, "step": 43295 }, { "entropy": 5.553391647338867, "epoch": 3.9277939042089987, "grad_norm": 1.2265625, "learning_rate": 0.0003530440329767844, "loss": 4.852, "mean_token_accuracy": 0.21535703986883165, "num_tokens": 89859594.0, "step": 43300 }, { "entropy": 5.585629415512085, "epoch": 3.928247460087083, "grad_norm": 1.25, "learning_rate": 0.0003530136845647885, "loss": 4.8314, "mean_token_accuracy": 0.22574584782123566, "num_tokens": 89869869.0, "step": 43305 }, { "entropy": 5.662320613861084, "epoch": 3.9287010159651667, "grad_norm": 1.3359375, "learning_rate": 0.00035298333453944976, "loss": 4.935, "mean_token_accuracy": 0.22433721423149108, "num_tokens": 89879604.0, "step": 43310 }, { "entropy": 5.520637559890747, "epoch": 3.929154571843251, "grad_norm": 1.3515625, "learning_rate": 0.0003529529829013957, "loss": 4.752, "mean_token_accuracy": 0.22736752331256865, "num_tokens": 89889200.0, "step": 43315 }, { "entropy": 5.616128206253052, "epoch": 3.9296081277213353, "grad_norm": 1.25, "learning_rate": 0.0003529226296512541, "loss": 4.8919, "mean_token_accuracy": 0.2294008955359459, "num_tokens": 89898525.0, "step": 43320 }, { "entropy": 5.56722674369812, "epoch": 3.9300616835994195, "grad_norm": 1.3828125, "learning_rate": 0.00035289227478965267, "loss": 4.9241, "mean_token_accuracy": 0.21578328162431717, "num_tokens": 89909053.0, "step": 43325 }, { "entropy": 5.534801054000854, "epoch": 3.9305152394775034, "grad_norm": 1.28125, "learning_rate": 0.0003528619183172192, "loss": 4.8041, "mean_token_accuracy": 0.23143748342990875, "num_tokens": 89918375.0, "step": 43330 }, { "entropy": 5.692203330993652, "epoch": 3.9309687953555876, "grad_norm": 1.390625, "learning_rate": 0.0003528315602345814, "loss": 4.9413, "mean_token_accuracy": 0.22652362287044525, "num_tokens": 89928252.0, "step": 43335 }, { "entropy": 5.590328788757324, "epoch": 3.931422351233672, "grad_norm": 1.2109375, "learning_rate": 0.0003528012005423671, "loss": 4.8659, "mean_token_accuracy": 0.21630339622497557, "num_tokens": 89938613.0, "step": 43340 }, { "entropy": 5.671624946594238, "epoch": 3.931875907111756, "grad_norm": 1.3671875, "learning_rate": 0.00035277083924120406, "loss": 4.9144, "mean_token_accuracy": 0.22579684406518935, "num_tokens": 89948781.0, "step": 43345 }, { "entropy": 5.597576761245728, "epoch": 3.9323294629898404, "grad_norm": 1.3046875, "learning_rate": 0.00035274047633172037, "loss": 4.9097, "mean_token_accuracy": 0.21653368771076204, "num_tokens": 89959928.0, "step": 43350 }, { "entropy": 5.660564517974853, "epoch": 3.9327830188679247, "grad_norm": 1.203125, "learning_rate": 0.0003527101118145437, "loss": 4.9434, "mean_token_accuracy": 0.21858150213956834, "num_tokens": 89970756.0, "step": 43355 }, { "entropy": 5.648901176452637, "epoch": 3.933236574746009, "grad_norm": 1.4453125, "learning_rate": 0.0003526797456903022, "loss": 4.9171, "mean_token_accuracy": 0.220272496342659, "num_tokens": 89981332.0, "step": 43360 }, { "entropy": 5.574952888488769, "epoch": 3.933690130624093, "grad_norm": 1.1640625, "learning_rate": 0.00035264937795962374, "loss": 4.8494, "mean_token_accuracy": 0.23076258301734925, "num_tokens": 89991427.0, "step": 43365 }, { "entropy": 5.6070410251617435, "epoch": 3.934143686502177, "grad_norm": 1.2734375, "learning_rate": 0.0003526190086231364, "loss": 4.8503, "mean_token_accuracy": 0.22866371273994446, "num_tokens": 90001599.0, "step": 43370 }, { "entropy": 5.64363956451416, "epoch": 3.9345972423802613, "grad_norm": 1.3203125, "learning_rate": 0.00035258863768146816, "loss": 4.8888, "mean_token_accuracy": 0.22396067082881926, "num_tokens": 90011932.0, "step": 43375 }, { "entropy": 5.650518226623535, "epoch": 3.9350507982583456, "grad_norm": 1.359375, "learning_rate": 0.0003525582651352471, "loss": 4.9651, "mean_token_accuracy": 0.22305236607789994, "num_tokens": 90022123.0, "step": 43380 }, { "entropy": 5.555824899673462, "epoch": 3.9355043541364294, "grad_norm": 1.28125, "learning_rate": 0.0003525278909851013, "loss": 4.8177, "mean_token_accuracy": 0.22943018078804017, "num_tokens": 90033024.0, "step": 43385 }, { "entropy": 5.595191574096679, "epoch": 3.9359579100145137, "grad_norm": 1.25, "learning_rate": 0.000352497515231659, "loss": 4.8511, "mean_token_accuracy": 0.22776588946580886, "num_tokens": 90043742.0, "step": 43390 }, { "entropy": 5.565085983276367, "epoch": 3.936411465892598, "grad_norm": 1.1796875, "learning_rate": 0.0003524671378755484, "loss": 4.8433, "mean_token_accuracy": 0.22127674371004105, "num_tokens": 90054508.0, "step": 43395 }, { "entropy": 5.605257177352906, "epoch": 3.936865021770682, "grad_norm": 1.2421875, "learning_rate": 0.0003524367589173976, "loss": 4.8888, "mean_token_accuracy": 0.2281677857041359, "num_tokens": 90065058.0, "step": 43400 }, { "entropy": 5.578793859481811, "epoch": 3.9373185776487665, "grad_norm": 1.453125, "learning_rate": 0.00035240637835783485, "loss": 4.9054, "mean_token_accuracy": 0.22612740099430084, "num_tokens": 90075813.0, "step": 43405 }, { "entropy": 5.642021417617798, "epoch": 3.9377721335268507, "grad_norm": 1.1875, "learning_rate": 0.00035237599619748853, "loss": 4.9342, "mean_token_accuracy": 0.2187727153301239, "num_tokens": 90087064.0, "step": 43410 }, { "entropy": 5.599623918533325, "epoch": 3.9382256894049346, "grad_norm": 1.453125, "learning_rate": 0.0003523456124369868, "loss": 4.8188, "mean_token_accuracy": 0.2304860919713974, "num_tokens": 90096668.0, "step": 43415 }, { "entropy": 5.5289144039154055, "epoch": 3.938679245283019, "grad_norm": 1.2734375, "learning_rate": 0.0003523152270769582, "loss": 4.7487, "mean_token_accuracy": 0.23337374329566957, "num_tokens": 90105569.0, "step": 43420 }, { "entropy": 5.593250465393067, "epoch": 3.939132801161103, "grad_norm": 1.2890625, "learning_rate": 0.000352284840118031, "loss": 4.9402, "mean_token_accuracy": 0.21771066933870314, "num_tokens": 90116040.0, "step": 43425 }, { "entropy": 5.646475744247437, "epoch": 3.9395863570391874, "grad_norm": 1.2890625, "learning_rate": 0.0003522544515608335, "loss": 4.9025, "mean_token_accuracy": 0.22183049470186234, "num_tokens": 90125929.0, "step": 43430 }, { "entropy": 5.740047788619995, "epoch": 3.940039912917271, "grad_norm": 1.3359375, "learning_rate": 0.0003522240614059944, "loss": 4.9562, "mean_token_accuracy": 0.21673423200845718, "num_tokens": 90136251.0, "step": 43435 }, { "entropy": 5.603198289871216, "epoch": 3.9404934687953554, "grad_norm": 1.28125, "learning_rate": 0.000352193669654142, "loss": 4.8475, "mean_token_accuracy": 0.22729016989469528, "num_tokens": 90146480.0, "step": 43440 }, { "entropy": 5.598655843734742, "epoch": 3.9409470246734397, "grad_norm": 1.2890625, "learning_rate": 0.00035216327630590476, "loss": 4.8839, "mean_token_accuracy": 0.22182249575853347, "num_tokens": 90157192.0, "step": 43445 }, { "entropy": 5.636499357223511, "epoch": 3.941400580551524, "grad_norm": 1.2734375, "learning_rate": 0.00035213288136191136, "loss": 4.8841, "mean_token_accuracy": 0.221979621052742, "num_tokens": 90167120.0, "step": 43450 }, { "entropy": 5.607434034347534, "epoch": 3.9418541364296082, "grad_norm": 1.34375, "learning_rate": 0.00035210248482279034, "loss": 4.9292, "mean_token_accuracy": 0.2237686723470688, "num_tokens": 90176276.0, "step": 43455 }, { "entropy": 5.585240411758423, "epoch": 3.9423076923076925, "grad_norm": 1.265625, "learning_rate": 0.00035207208668917026, "loss": 4.8743, "mean_token_accuracy": 0.22544508725404738, "num_tokens": 90187150.0, "step": 43460 }, { "entropy": 5.543673086166382, "epoch": 3.9427612481857763, "grad_norm": 1.2578125, "learning_rate": 0.00035204168696167975, "loss": 4.8106, "mean_token_accuracy": 0.21664329320192338, "num_tokens": 90198112.0, "step": 43465 }, { "entropy": 5.625420093536377, "epoch": 3.9432148040638606, "grad_norm": 1.3046875, "learning_rate": 0.00035201128564094753, "loss": 4.937, "mean_token_accuracy": 0.2220859482884407, "num_tokens": 90208940.0, "step": 43470 }, { "entropy": 5.62300295829773, "epoch": 3.943668359941945, "grad_norm": 1.1484375, "learning_rate": 0.0003519808827276023, "loss": 4.8817, "mean_token_accuracy": 0.22518924474716187, "num_tokens": 90220073.0, "step": 43475 }, { "entropy": 5.6139250755310055, "epoch": 3.944121915820029, "grad_norm": 1.21875, "learning_rate": 0.00035195047822227283, "loss": 4.9315, "mean_token_accuracy": 0.21644351184368132, "num_tokens": 90230059.0, "step": 43480 }, { "entropy": 5.562581777572632, "epoch": 3.944575471698113, "grad_norm": 1.2421875, "learning_rate": 0.00035192007212558787, "loss": 4.8511, "mean_token_accuracy": 0.22481199204921723, "num_tokens": 90240486.0, "step": 43485 }, { "entropy": 5.6876708507537845, "epoch": 3.9450290275761972, "grad_norm": 1.15625, "learning_rate": 0.0003518896644381762, "loss": 4.9541, "mean_token_accuracy": 0.21668176651000975, "num_tokens": 90250014.0, "step": 43490 }, { "entropy": 5.610002088546753, "epoch": 3.9454825834542815, "grad_norm": 1.2109375, "learning_rate": 0.0003518592551606666, "loss": 4.8716, "mean_token_accuracy": 0.2138165980577469, "num_tokens": 90261040.0, "step": 43495 }, { "entropy": 5.649934434890747, "epoch": 3.9459361393323658, "grad_norm": 1.21875, "learning_rate": 0.0003518288442936881, "loss": 4.926, "mean_token_accuracy": 0.22308849394321442, "num_tokens": 90271243.0, "step": 43500 }, { "entropy": 5.58831000328064, "epoch": 3.94638969521045, "grad_norm": 1.3671875, "learning_rate": 0.0003517984318378695, "loss": 4.8798, "mean_token_accuracy": 0.2233734294772148, "num_tokens": 90281176.0, "step": 43505 }, { "entropy": 5.69565896987915, "epoch": 3.9468432510885343, "grad_norm": 1.375, "learning_rate": 0.0003517680177938398, "loss": 4.9646, "mean_token_accuracy": 0.22264595776796342, "num_tokens": 90292465.0, "step": 43510 }, { "entropy": 5.627174997329712, "epoch": 3.9472968069666186, "grad_norm": 1.3515625, "learning_rate": 0.0003517376021622279, "loss": 4.8007, "mean_token_accuracy": 0.2277838781476021, "num_tokens": 90303482.0, "step": 43515 }, { "entropy": 5.613353633880616, "epoch": 3.9477503628447024, "grad_norm": 1.234375, "learning_rate": 0.0003517071849436629, "loss": 4.9181, "mean_token_accuracy": 0.22391087412834168, "num_tokens": 90313696.0, "step": 43520 }, { "entropy": 5.635232210159302, "epoch": 3.9482039187227866, "grad_norm": 1.28125, "learning_rate": 0.00035167676613877366, "loss": 4.917, "mean_token_accuracy": 0.21487147212028504, "num_tokens": 90324564.0, "step": 43525 }, { "entropy": 5.59060640335083, "epoch": 3.948657474600871, "grad_norm": 1.3125, "learning_rate": 0.0003516463457481894, "loss": 4.7768, "mean_token_accuracy": 0.23128025680780412, "num_tokens": 90334440.0, "step": 43530 }, { "entropy": 5.630839014053345, "epoch": 3.9491110304789547, "grad_norm": 1.453125, "learning_rate": 0.0003516159237725392, "loss": 4.9091, "mean_token_accuracy": 0.22471659034490585, "num_tokens": 90344029.0, "step": 43535 }, { "entropy": 5.655629587173462, "epoch": 3.949564586357039, "grad_norm": 1.2890625, "learning_rate": 0.0003515855002124521, "loss": 4.9236, "mean_token_accuracy": 0.22030624598264695, "num_tokens": 90354628.0, "step": 43540 }, { "entropy": 5.632492780685425, "epoch": 3.9500181422351233, "grad_norm": 1.25, "learning_rate": 0.0003515550750685573, "loss": 4.793, "mean_token_accuracy": 0.23002799898386, "num_tokens": 90365091.0, "step": 43545 }, { "entropy": 5.620274877548217, "epoch": 3.9504716981132075, "grad_norm": 1.328125, "learning_rate": 0.0003515246483414842, "loss": 4.9123, "mean_token_accuracy": 0.22337178885936737, "num_tokens": 90374197.0, "step": 43550 }, { "entropy": 5.639148283004761, "epoch": 3.950925253991292, "grad_norm": 1.2265625, "learning_rate": 0.00035149422003186176, "loss": 4.9261, "mean_token_accuracy": 0.22177066057920455, "num_tokens": 90384686.0, "step": 43555 }, { "entropy": 5.666125106811523, "epoch": 3.951378809869376, "grad_norm": 1.1171875, "learning_rate": 0.00035146379014031943, "loss": 4.957, "mean_token_accuracy": 0.22066957950592042, "num_tokens": 90396329.0, "step": 43560 }, { "entropy": 5.674965333938599, "epoch": 3.9518323657474603, "grad_norm": 1.1875, "learning_rate": 0.0003514333586674864, "loss": 4.9353, "mean_token_accuracy": 0.22092576026916505, "num_tokens": 90408957.0, "step": 43565 }, { "entropy": 5.564086246490478, "epoch": 3.952285921625544, "grad_norm": 1.2265625, "learning_rate": 0.000351402925613992, "loss": 4.8415, "mean_token_accuracy": 0.22564305514097213, "num_tokens": 90420194.0, "step": 43570 }, { "entropy": 5.55805721282959, "epoch": 3.9527394775036284, "grad_norm": 1.265625, "learning_rate": 0.0003513724909804656, "loss": 4.809, "mean_token_accuracy": 0.22613648176193238, "num_tokens": 90430881.0, "step": 43575 }, { "entropy": 5.617742824554443, "epoch": 3.9531930333817127, "grad_norm": 1.421875, "learning_rate": 0.00035134205476753674, "loss": 4.8712, "mean_token_accuracy": 0.21894871592521667, "num_tokens": 90440713.0, "step": 43580 }, { "entropy": 5.631799030303955, "epoch": 3.953646589259797, "grad_norm": 1.25, "learning_rate": 0.0003513116169758347, "loss": 4.952, "mean_token_accuracy": 0.21696564108133315, "num_tokens": 90451274.0, "step": 43585 }, { "entropy": 5.663276195526123, "epoch": 3.9541001451378808, "grad_norm": 1.28125, "learning_rate": 0.0003512811776059889, "loss": 4.9807, "mean_token_accuracy": 0.21524891257286072, "num_tokens": 90461503.0, "step": 43590 }, { "entropy": 5.613519525527954, "epoch": 3.954553701015965, "grad_norm": 1.3515625, "learning_rate": 0.000351250736658629, "loss": 4.8126, "mean_token_accuracy": 0.23150897920131683, "num_tokens": 90471178.0, "step": 43595 }, { "entropy": 5.599734497070313, "epoch": 3.9550072568940493, "grad_norm": 1.1953125, "learning_rate": 0.0003512202941343844, "loss": 4.8378, "mean_token_accuracy": 0.22066653966903688, "num_tokens": 90481573.0, "step": 43600 }, { "entropy": 5.627104997634888, "epoch": 3.9554608127721336, "grad_norm": 1.2578125, "learning_rate": 0.0003511898500338847, "loss": 4.9517, "mean_token_accuracy": 0.21594603806734086, "num_tokens": 90491853.0, "step": 43605 }, { "entropy": 5.621861267089844, "epoch": 3.955914368650218, "grad_norm": 1.25, "learning_rate": 0.0003511594043577594, "loss": 4.9176, "mean_token_accuracy": 0.216946080327034, "num_tokens": 90502958.0, "step": 43610 }, { "entropy": 5.5644608497619625, "epoch": 3.956367924528302, "grad_norm": 1.328125, "learning_rate": 0.00035112895710663833, "loss": 4.8658, "mean_token_accuracy": 0.22364986836910247, "num_tokens": 90512555.0, "step": 43615 }, { "entropy": 5.618684196472168, "epoch": 3.956821480406386, "grad_norm": 1.25, "learning_rate": 0.00035109850828115105, "loss": 4.917, "mean_token_accuracy": 0.22495315223932266, "num_tokens": 90522722.0, "step": 43620 }, { "entropy": 5.617133665084839, "epoch": 3.95727503628447, "grad_norm": 1.25, "learning_rate": 0.00035106805788192707, "loss": 4.9255, "mean_token_accuracy": 0.22280225306749343, "num_tokens": 90533182.0, "step": 43625 }, { "entropy": 5.64388222694397, "epoch": 3.9577285921625545, "grad_norm": 1.203125, "learning_rate": 0.0003510376059095963, "loss": 4.9409, "mean_token_accuracy": 0.21308707296848298, "num_tokens": 90543495.0, "step": 43630 }, { "entropy": 5.537411499023437, "epoch": 3.9581821480406387, "grad_norm": 1.2265625, "learning_rate": 0.0003510071523647886, "loss": 4.8161, "mean_token_accuracy": 0.22778836339712144, "num_tokens": 90553680.0, "step": 43635 }, { "entropy": 5.564325761795044, "epoch": 3.9586357039187225, "grad_norm": 1.3046875, "learning_rate": 0.0003509766972481336, "loss": 4.7937, "mean_token_accuracy": 0.2248803362250328, "num_tokens": 90563513.0, "step": 43640 }, { "entropy": 5.716092538833618, "epoch": 3.959089259796807, "grad_norm": 1.3046875, "learning_rate": 0.000350946240560261, "loss": 4.9327, "mean_token_accuracy": 0.22279592007398605, "num_tokens": 90573337.0, "step": 43645 }, { "entropy": 5.585870885848999, "epoch": 3.959542815674891, "grad_norm": 1.3046875, "learning_rate": 0.0003509157823018009, "loss": 4.8612, "mean_token_accuracy": 0.2253480836749077, "num_tokens": 90582979.0, "step": 43650 }, { "entropy": 5.651793909072876, "epoch": 3.9599963715529753, "grad_norm": 1.296875, "learning_rate": 0.00035088532247338306, "loss": 4.9726, "mean_token_accuracy": 0.2131386250257492, "num_tokens": 90593552.0, "step": 43655 }, { "entropy": 5.642519187927246, "epoch": 3.9604499274310596, "grad_norm": 1.296875, "learning_rate": 0.00035085486107563733, "loss": 4.9152, "mean_token_accuracy": 0.2189141944050789, "num_tokens": 90603813.0, "step": 43660 }, { "entropy": 5.630860424041748, "epoch": 3.960903483309144, "grad_norm": 1.296875, "learning_rate": 0.00035082439810919385, "loss": 4.8384, "mean_token_accuracy": 0.23279846757650374, "num_tokens": 90613885.0, "step": 43665 }, { "entropy": 5.609619855880737, "epoch": 3.9613570391872277, "grad_norm": 1.2109375, "learning_rate": 0.0003507939335746824, "loss": 4.7896, "mean_token_accuracy": 0.22308997809886932, "num_tokens": 90624665.0, "step": 43670 }, { "entropy": 5.5984782695770265, "epoch": 3.961810595065312, "grad_norm": 1.265625, "learning_rate": 0.0003507634674727332, "loss": 4.8625, "mean_token_accuracy": 0.228514201939106, "num_tokens": 90635496.0, "step": 43675 }, { "entropy": 5.627188634872437, "epoch": 3.9622641509433962, "grad_norm": 1.3203125, "learning_rate": 0.0003507329998039762, "loss": 4.8567, "mean_token_accuracy": 0.22334334254264832, "num_tokens": 90645502.0, "step": 43680 }, { "entropy": 5.528412914276123, "epoch": 3.9627177068214805, "grad_norm": 1.328125, "learning_rate": 0.00035070253056904133, "loss": 4.7945, "mean_token_accuracy": 0.2294122874736786, "num_tokens": 90654724.0, "step": 43685 }, { "entropy": 5.556365966796875, "epoch": 3.9631712626995643, "grad_norm": 1.2890625, "learning_rate": 0.0003506720597685589, "loss": 4.8657, "mean_token_accuracy": 0.2272373169660568, "num_tokens": 90665280.0, "step": 43690 }, { "entropy": 5.593201398849487, "epoch": 3.9636248185776486, "grad_norm": 1.265625, "learning_rate": 0.00035064158740315894, "loss": 4.9124, "mean_token_accuracy": 0.22146636843681336, "num_tokens": 90675804.0, "step": 43695 }, { "entropy": 5.5918159008026125, "epoch": 3.964078374455733, "grad_norm": 1.2265625, "learning_rate": 0.00035061111347347174, "loss": 4.8398, "mean_token_accuracy": 0.22862047404050828, "num_tokens": 90686636.0, "step": 43700 }, { "entropy": 5.549758052825927, "epoch": 3.964531930333817, "grad_norm": 1.2578125, "learning_rate": 0.00035058063798012746, "loss": 4.869, "mean_token_accuracy": 0.22825548350811004, "num_tokens": 90697666.0, "step": 43705 }, { "entropy": 5.662643098831177, "epoch": 3.9649854862119014, "grad_norm": 1.625, "learning_rate": 0.0003505501609237563, "loss": 4.9682, "mean_token_accuracy": 0.22011823654174806, "num_tokens": 90708111.0, "step": 43710 }, { "entropy": 5.609377479553222, "epoch": 3.9654390420899857, "grad_norm": 1.296875, "learning_rate": 0.00035051968230498853, "loss": 4.8207, "mean_token_accuracy": 0.2346563994884491, "num_tokens": 90718711.0, "step": 43715 }, { "entropy": 5.534402322769165, "epoch": 3.96589259796807, "grad_norm": 1.3671875, "learning_rate": 0.00035048920212445454, "loss": 4.8126, "mean_token_accuracy": 0.2302231967449188, "num_tokens": 90729585.0, "step": 43720 }, { "entropy": 5.51228404045105, "epoch": 3.9663461538461537, "grad_norm": 1.3359375, "learning_rate": 0.00035045872038278467, "loss": 4.7503, "mean_token_accuracy": 0.233260902762413, "num_tokens": 90739654.0, "step": 43725 }, { "entropy": 5.585073328018188, "epoch": 3.966799709724238, "grad_norm": 1.3671875, "learning_rate": 0.0003504282370806091, "loss": 4.8141, "mean_token_accuracy": 0.22703779637813568, "num_tokens": 90749456.0, "step": 43730 }, { "entropy": 5.567838859558106, "epoch": 3.9672532656023223, "grad_norm": 1.3203125, "learning_rate": 0.00035039775221855845, "loss": 4.8333, "mean_token_accuracy": 0.22745248377323152, "num_tokens": 90760051.0, "step": 43735 }, { "entropy": 5.556958723068237, "epoch": 3.9677068214804065, "grad_norm": 1.2421875, "learning_rate": 0.000350367265797263, "loss": 4.8055, "mean_token_accuracy": 0.22849767208099364, "num_tokens": 90770452.0, "step": 43740 }, { "entropy": 5.621649742126465, "epoch": 3.9681603773584904, "grad_norm": 1.234375, "learning_rate": 0.00035033677781735336, "loss": 4.89, "mean_token_accuracy": 0.22210618555545808, "num_tokens": 90780150.0, "step": 43745 }, { "entropy": 5.615019655227661, "epoch": 3.9686139332365746, "grad_norm": 1.328125, "learning_rate": 0.0003503062882794599, "loss": 4.8035, "mean_token_accuracy": 0.23081523776054383, "num_tokens": 90790338.0, "step": 43750 }, { "entropy": 5.560942983627319, "epoch": 3.969067489114659, "grad_norm": 1.28125, "learning_rate": 0.00035027579718421327, "loss": 4.8521, "mean_token_accuracy": 0.22717443555593492, "num_tokens": 90800195.0, "step": 43755 }, { "entropy": 5.606147575378418, "epoch": 3.969521044992743, "grad_norm": 1.15625, "learning_rate": 0.0003502453045322439, "loss": 4.9428, "mean_token_accuracy": 0.21842382699251175, "num_tokens": 90810872.0, "step": 43760 }, { "entropy": 5.641963720321655, "epoch": 3.9699746008708274, "grad_norm": 1.2890625, "learning_rate": 0.00035021481032418254, "loss": 4.8509, "mean_token_accuracy": 0.22185555398464202, "num_tokens": 90821018.0, "step": 43765 }, { "entropy": 5.622490787506104, "epoch": 3.9704281567489117, "grad_norm": 1.3125, "learning_rate": 0.0003501843145606597, "loss": 4.8855, "mean_token_accuracy": 0.21883311867713928, "num_tokens": 90830274.0, "step": 43770 }, { "entropy": 5.5336771488189695, "epoch": 3.9708817126269955, "grad_norm": 1.2734375, "learning_rate": 0.000350153817242306, "loss": 4.7872, "mean_token_accuracy": 0.23493994623422623, "num_tokens": 90839926.0, "step": 43775 }, { "entropy": 5.505676937103272, "epoch": 3.97133526850508, "grad_norm": 1.2734375, "learning_rate": 0.0003501233183697523, "loss": 4.7734, "mean_token_accuracy": 0.2265172004699707, "num_tokens": 90850263.0, "step": 43780 }, { "entropy": 5.618466997146607, "epoch": 3.971788824383164, "grad_norm": 1.2734375, "learning_rate": 0.00035009281794362926, "loss": 4.8948, "mean_token_accuracy": 0.21449514329433442, "num_tokens": 90861747.0, "step": 43785 }, { "entropy": 5.631987762451172, "epoch": 3.9722423802612483, "grad_norm": 1.21875, "learning_rate": 0.00035006231596456755, "loss": 4.9566, "mean_token_accuracy": 0.214010851085186, "num_tokens": 90872186.0, "step": 43790 }, { "entropy": 5.639399576187134, "epoch": 3.972695936139332, "grad_norm": 1.296875, "learning_rate": 0.00035003181243319797, "loss": 4.8572, "mean_token_accuracy": 0.2287888765335083, "num_tokens": 90881088.0, "step": 43795 }, { "entropy": 5.534959077835083, "epoch": 3.9731494920174164, "grad_norm": 1.296875, "learning_rate": 0.0003500013073501514, "loss": 4.8357, "mean_token_accuracy": 0.21795334666967392, "num_tokens": 90890589.0, "step": 43800 }, { "entropy": 5.587713146209717, "epoch": 3.9736030478955007, "grad_norm": 1.171875, "learning_rate": 0.0003499708007160588, "loss": 4.8973, "mean_token_accuracy": 0.2233035922050476, "num_tokens": 90901692.0, "step": 43805 }, { "entropy": 5.6533256530761715, "epoch": 3.974056603773585, "grad_norm": 1.2578125, "learning_rate": 0.0003499402925315509, "loss": 4.9425, "mean_token_accuracy": 0.22145114243030548, "num_tokens": 90911811.0, "step": 43810 }, { "entropy": 5.628856372833252, "epoch": 3.974510159651669, "grad_norm": 1.2578125, "learning_rate": 0.00034990978279725846, "loss": 4.7872, "mean_token_accuracy": 0.23011803925037383, "num_tokens": 90922323.0, "step": 43815 }, { "entropy": 5.713240766525269, "epoch": 3.9749637155297535, "grad_norm": 1.265625, "learning_rate": 0.00034987927151381283, "loss": 5.0259, "mean_token_accuracy": 0.21182865351438523, "num_tokens": 90932834.0, "step": 43820 }, { "entropy": 5.61557903289795, "epoch": 3.9754172714078373, "grad_norm": 1.390625, "learning_rate": 0.00034984875868184466, "loss": 4.8831, "mean_token_accuracy": 0.22673559933900833, "num_tokens": 90943616.0, "step": 43825 }, { "entropy": 5.638593292236328, "epoch": 3.9758708272859216, "grad_norm": 1.203125, "learning_rate": 0.00034981824430198517, "loss": 4.9493, "mean_token_accuracy": 0.2186393156647682, "num_tokens": 90954468.0, "step": 43830 }, { "entropy": 5.6248821258544925, "epoch": 3.976324383164006, "grad_norm": 1.265625, "learning_rate": 0.00034978772837486536, "loss": 4.8069, "mean_token_accuracy": 0.22970810830593108, "num_tokens": 90965109.0, "step": 43835 }, { "entropy": 5.629035425186157, "epoch": 3.97677793904209, "grad_norm": 1.4765625, "learning_rate": 0.00034975721090111625, "loss": 4.8839, "mean_token_accuracy": 0.21781204789876937, "num_tokens": 90974789.0, "step": 43840 }, { "entropy": 5.625867033004761, "epoch": 3.977231494920174, "grad_norm": 1.234375, "learning_rate": 0.0003497266918813689, "loss": 4.9615, "mean_token_accuracy": 0.2187602326273918, "num_tokens": 90985154.0, "step": 43845 }, { "entropy": 5.6458518505096436, "epoch": 3.977685050798258, "grad_norm": 1.2265625, "learning_rate": 0.0003496961713162545, "loss": 4.9162, "mean_token_accuracy": 0.22161955535411834, "num_tokens": 90996007.0, "step": 43850 }, { "entropy": 5.682658338546753, "epoch": 3.9781386066763424, "grad_norm": 1.2890625, "learning_rate": 0.0003496656492064043, "loss": 4.9453, "mean_token_accuracy": 0.21685384064912797, "num_tokens": 91006253.0, "step": 43855 }, { "entropy": 5.67601203918457, "epoch": 3.9785921625544267, "grad_norm": 1.3359375, "learning_rate": 0.0003496351255524494, "loss": 5.0122, "mean_token_accuracy": 0.21520382910966873, "num_tokens": 91017169.0, "step": 43860 }, { "entropy": 5.604124069213867, "epoch": 3.979045718432511, "grad_norm": 1.3359375, "learning_rate": 0.00034960460035502117, "loss": 4.8655, "mean_token_accuracy": 0.21704234778881074, "num_tokens": 91026684.0, "step": 43865 }, { "entropy": 5.592619466781616, "epoch": 3.9794992743105952, "grad_norm": 1.140625, "learning_rate": 0.0003495740736147508, "loss": 4.8255, "mean_token_accuracy": 0.22522745430469512, "num_tokens": 91037462.0, "step": 43870 }, { "entropy": 5.65322093963623, "epoch": 3.9799528301886795, "grad_norm": 1.1328125, "learning_rate": 0.00034954354533226953, "loss": 4.9498, "mean_token_accuracy": 0.21626212000846862, "num_tokens": 91049418.0, "step": 43875 }, { "entropy": 5.601533889770508, "epoch": 3.9804063860667633, "grad_norm": 1.25, "learning_rate": 0.0003495130155082087, "loss": 4.8336, "mean_token_accuracy": 0.22192179411649704, "num_tokens": 91061013.0, "step": 43880 }, { "entropy": 5.604547071456909, "epoch": 3.9808599419448476, "grad_norm": 1.1796875, "learning_rate": 0.0003494824841431998, "loss": 4.8633, "mean_token_accuracy": 0.22662772834300995, "num_tokens": 91070974.0, "step": 43885 }, { "entropy": 5.643239450454712, "epoch": 3.981313497822932, "grad_norm": 1.21875, "learning_rate": 0.0003494519512378741, "loss": 4.9304, "mean_token_accuracy": 0.2264939308166504, "num_tokens": 91082681.0, "step": 43890 }, { "entropy": 5.616656112670898, "epoch": 3.9817670537010157, "grad_norm": 1.2109375, "learning_rate": 0.00034942141679286307, "loss": 4.8636, "mean_token_accuracy": 0.23242186903953552, "num_tokens": 91093552.0, "step": 43895 }, { "entropy": 5.6163019180297855, "epoch": 3.9822206095791, "grad_norm": 1.1796875, "learning_rate": 0.0003493908808087982, "loss": 4.9083, "mean_token_accuracy": 0.21618666648864746, "num_tokens": 91105470.0, "step": 43900 }, { "entropy": 5.5929603099823, "epoch": 3.9826741654571842, "grad_norm": 1.1328125, "learning_rate": 0.000349360343286311, "loss": 4.8757, "mean_token_accuracy": 0.2280385360121727, "num_tokens": 91115822.0, "step": 43905 }, { "entropy": 5.586233758926392, "epoch": 3.9831277213352685, "grad_norm": 1.4296875, "learning_rate": 0.00034932980422603283, "loss": 4.8282, "mean_token_accuracy": 0.23132265210151673, "num_tokens": 91125722.0, "step": 43910 }, { "entropy": 5.731109285354615, "epoch": 3.9835812772133528, "grad_norm": 1.328125, "learning_rate": 0.0003492992636285955, "loss": 4.9977, "mean_token_accuracy": 0.22006487846374512, "num_tokens": 91135783.0, "step": 43915 }, { "entropy": 5.635255813598633, "epoch": 3.984034833091437, "grad_norm": 1.1328125, "learning_rate": 0.0003492687214946304, "loss": 4.8606, "mean_token_accuracy": 0.22833815068006516, "num_tokens": 91146151.0, "step": 43920 }, { "entropy": 5.610350942611694, "epoch": 3.9844883889695213, "grad_norm": 1.203125, "learning_rate": 0.00034923817782476927, "loss": 4.8829, "mean_token_accuracy": 0.21957208812236786, "num_tokens": 91156711.0, "step": 43925 }, { "entropy": 5.601725435256958, "epoch": 3.984941944847605, "grad_norm": 1.25, "learning_rate": 0.0003492076326196436, "loss": 4.9165, "mean_token_accuracy": 0.21859576553106308, "num_tokens": 91166601.0, "step": 43930 }, { "entropy": 5.695220947265625, "epoch": 3.9853955007256894, "grad_norm": 1.3203125, "learning_rate": 0.00034917708587988523, "loss": 4.9556, "mean_token_accuracy": 0.20916615724563598, "num_tokens": 91176556.0, "step": 43935 }, { "entropy": 5.638649225234985, "epoch": 3.9858490566037736, "grad_norm": 1.3671875, "learning_rate": 0.00034914653760612584, "loss": 4.8586, "mean_token_accuracy": 0.22388535290956496, "num_tokens": 91186499.0, "step": 43940 }, { "entropy": 5.600866508483887, "epoch": 3.986302612481858, "grad_norm": 1.2421875, "learning_rate": 0.0003491159877989971, "loss": 4.8493, "mean_token_accuracy": 0.21494744569063187, "num_tokens": 91197088.0, "step": 43945 }, { "entropy": 5.588364124298096, "epoch": 3.9867561683599417, "grad_norm": 1.2578125, "learning_rate": 0.000349085436459131, "loss": 4.891, "mean_token_accuracy": 0.2266418904066086, "num_tokens": 91207188.0, "step": 43950 }, { "entropy": 5.591065263748169, "epoch": 3.987209724238026, "grad_norm": 1.296875, "learning_rate": 0.00034905488358715907, "loss": 4.8451, "mean_token_accuracy": 0.22398226857185363, "num_tokens": 91217349.0, "step": 43955 }, { "entropy": 5.618248128890992, "epoch": 3.9876632801161103, "grad_norm": 1.3046875, "learning_rate": 0.0003490243291837133, "loss": 4.9292, "mean_token_accuracy": 0.21863684207201003, "num_tokens": 91227775.0, "step": 43960 }, { "entropy": 5.582199478149414, "epoch": 3.9881168359941945, "grad_norm": 1.1796875, "learning_rate": 0.00034899377324942556, "loss": 4.7826, "mean_token_accuracy": 0.23247582018375396, "num_tokens": 91238315.0, "step": 43965 }, { "entropy": 5.63126769065857, "epoch": 3.988570391872279, "grad_norm": 1.1953125, "learning_rate": 0.00034896321578492767, "loss": 4.9903, "mean_token_accuracy": 0.2124732404947281, "num_tokens": 91249178.0, "step": 43970 }, { "entropy": 5.5965455055236815, "epoch": 3.989023947750363, "grad_norm": 1.4609375, "learning_rate": 0.0003489326567908516, "loss": 4.8568, "mean_token_accuracy": 0.22392703890800475, "num_tokens": 91257911.0, "step": 43975 }, { "entropy": 5.600323295593261, "epoch": 3.989477503628447, "grad_norm": 1.2109375, "learning_rate": 0.00034890209626782943, "loss": 4.8769, "mean_token_accuracy": 0.22421206682920455, "num_tokens": 91267491.0, "step": 43980 }, { "entropy": 5.609611511230469, "epoch": 3.989931059506531, "grad_norm": 1.3515625, "learning_rate": 0.0003488715342164931, "loss": 4.8827, "mean_token_accuracy": 0.22713396400213243, "num_tokens": 91278292.0, "step": 43985 }, { "entropy": 5.659009599685669, "epoch": 3.9903846153846154, "grad_norm": 1.515625, "learning_rate": 0.00034884097063747453, "loss": 4.9855, "mean_token_accuracy": 0.2096550226211548, "num_tokens": 91287871.0, "step": 43990 }, { "entropy": 5.5706806659698485, "epoch": 3.9908381712626997, "grad_norm": 1.390625, "learning_rate": 0.0003488104055314059, "loss": 4.8183, "mean_token_accuracy": 0.22714080810546874, "num_tokens": 91297201.0, "step": 43995 }, { "entropy": 5.556038570404053, "epoch": 3.9912917271407835, "grad_norm": 1.4453125, "learning_rate": 0.0003487798388989193, "loss": 4.768, "mean_token_accuracy": 0.23064112663269043, "num_tokens": 91306449.0, "step": 44000 }, { "entropy": 5.528042125701904, "epoch": 3.9917452830188678, "grad_norm": 1.2890625, "learning_rate": 0.00034874927074064684, "loss": 4.7893, "mean_token_accuracy": 0.22544007301330565, "num_tokens": 91317516.0, "step": 44005 }, { "entropy": 5.604190683364868, "epoch": 3.992198838896952, "grad_norm": 1.34375, "learning_rate": 0.0003487187010572206, "loss": 4.9345, "mean_token_accuracy": 0.22188632786273957, "num_tokens": 91326850.0, "step": 44010 }, { "entropy": 5.619228744506836, "epoch": 3.9926523947750363, "grad_norm": 1.2890625, "learning_rate": 0.0003486881298492729, "loss": 4.8915, "mean_token_accuracy": 0.2217486783862114, "num_tokens": 91338068.0, "step": 44015 }, { "entropy": 5.70633544921875, "epoch": 3.9931059506531206, "grad_norm": 1.3125, "learning_rate": 0.0003486575571174359, "loss": 4.866, "mean_token_accuracy": 0.22041468173265458, "num_tokens": 91349627.0, "step": 44020 }, { "entropy": 5.641649675369263, "epoch": 3.993559506531205, "grad_norm": 1.15625, "learning_rate": 0.00034862698286234185, "loss": 4.9345, "mean_token_accuracy": 0.2111356645822525, "num_tokens": 91361229.0, "step": 44025 }, { "entropy": 5.634420776367188, "epoch": 3.9940130624092887, "grad_norm": 1.21875, "learning_rate": 0.0003485964070846229, "loss": 4.9714, "mean_token_accuracy": 0.2139379173517227, "num_tokens": 91372348.0, "step": 44030 }, { "entropy": 5.579347276687622, "epoch": 3.994466618287373, "grad_norm": 1.40625, "learning_rate": 0.0003485658297849117, "loss": 4.805, "mean_token_accuracy": 0.2221580997109413, "num_tokens": 91383028.0, "step": 44035 }, { "entropy": 5.642390203475952, "epoch": 3.994920174165457, "grad_norm": 1.3984375, "learning_rate": 0.00034853525096384034, "loss": 4.9282, "mean_token_accuracy": 0.22041716277599335, "num_tokens": 91393263.0, "step": 44040 }, { "entropy": 5.646244668960572, "epoch": 3.9953737300435415, "grad_norm": 1.34375, "learning_rate": 0.0003485046706220411, "loss": 4.9053, "mean_token_accuracy": 0.22217684537172316, "num_tokens": 91403881.0, "step": 44045 }, { "entropy": 5.627064895629883, "epoch": 3.9958272859216253, "grad_norm": 1.2578125, "learning_rate": 0.0003484740887601467, "loss": 4.8868, "mean_token_accuracy": 0.2178072839975357, "num_tokens": 91413723.0, "step": 44050 }, { "entropy": 5.6279621601104735, "epoch": 3.9962808417997095, "grad_norm": 1.328125, "learning_rate": 0.00034844350537878937, "loss": 4.8559, "mean_token_accuracy": 0.2247815638780594, "num_tokens": 91424168.0, "step": 44055 }, { "entropy": 5.70906138420105, "epoch": 3.996734397677794, "grad_norm": 1.390625, "learning_rate": 0.00034841292047860164, "loss": 4.9668, "mean_token_accuracy": 0.211597840487957, "num_tokens": 91433133.0, "step": 44060 }, { "entropy": 5.647665500640869, "epoch": 3.997187953555878, "grad_norm": 1.3359375, "learning_rate": 0.000348382334060216, "loss": 4.9827, "mean_token_accuracy": 0.2101356267929077, "num_tokens": 91444521.0, "step": 44065 }, { "entropy": 5.554708433151245, "epoch": 3.9976415094339623, "grad_norm": 1.453125, "learning_rate": 0.000348351746124265, "loss": 4.8556, "mean_token_accuracy": 0.22607757449150084, "num_tokens": 91454870.0, "step": 44070 }, { "entropy": 5.604092788696289, "epoch": 3.9980950653120466, "grad_norm": 1.2265625, "learning_rate": 0.0003483211566713812, "loss": 4.8715, "mean_token_accuracy": 0.22667310535907745, "num_tokens": 91465472.0, "step": 44075 }, { "entropy": 5.649698495864868, "epoch": 3.998548621190131, "grad_norm": 1.25, "learning_rate": 0.0003482905657021971, "loss": 4.8855, "mean_token_accuracy": 0.22566566467285157, "num_tokens": 91475467.0, "step": 44080 }, { "entropy": 5.64481897354126, "epoch": 3.9990021770682147, "grad_norm": 1.25, "learning_rate": 0.0003482599732173456, "loss": 4.8937, "mean_token_accuracy": 0.22375485002994538, "num_tokens": 91485615.0, "step": 44085 }, { "entropy": 5.614963483810425, "epoch": 3.999455732946299, "grad_norm": 1.25, "learning_rate": 0.0003482293792174591, "loss": 4.8549, "mean_token_accuracy": 0.2235678941011429, "num_tokens": 91495790.0, "step": 44090 }, { "entropy": 5.609225845336914, "epoch": 3.9999092888243832, "grad_norm": 1.234375, "learning_rate": 0.0003481987837031703, "loss": 4.9275, "mean_token_accuracy": 0.2185494065284729, "num_tokens": 91507164.0, "step": 44095 }, { "entropy": 5.582514142990112, "epoch": 4.000362844702467, "grad_norm": 1.3359375, "learning_rate": 0.0003481681866751121, "loss": 4.8098, "mean_token_accuracy": 0.2285863161087036, "num_tokens": 91516732.0, "step": 44100 }, { "entropy": 5.543740081787109, "epoch": 4.000816400580551, "grad_norm": 1.2578125, "learning_rate": 0.00034813758813391716, "loss": 4.7628, "mean_token_accuracy": 0.23362062573432923, "num_tokens": 91527073.0, "step": 44105 }, { "entropy": 5.572063875198364, "epoch": 4.001269956458636, "grad_norm": 1.3125, "learning_rate": 0.0003481069880802183, "loss": 4.8244, "mean_token_accuracy": 0.2260878473520279, "num_tokens": 91538314.0, "step": 44110 }, { "entropy": 5.617223691940308, "epoch": 4.00172351233672, "grad_norm": 1.140625, "learning_rate": 0.00034807638651464815, "loss": 4.8636, "mean_token_accuracy": 0.22718000262975693, "num_tokens": 91549159.0, "step": 44115 }, { "entropy": 5.580330181121826, "epoch": 4.002177068214804, "grad_norm": 1.2421875, "learning_rate": 0.0003480457834378398, "loss": 4.854, "mean_token_accuracy": 0.2230929210782051, "num_tokens": 91560901.0, "step": 44120 }, { "entropy": 5.57982988357544, "epoch": 4.002630624092888, "grad_norm": 1.25, "learning_rate": 0.00034801517885042597, "loss": 4.8124, "mean_token_accuracy": 0.2222102627158165, "num_tokens": 91570797.0, "step": 44125 }, { "entropy": 5.699436950683594, "epoch": 4.003084179970973, "grad_norm": 1.296875, "learning_rate": 0.0003479845727530397, "loss": 4.8978, "mean_token_accuracy": 0.216018408536911, "num_tokens": 91580971.0, "step": 44130 }, { "entropy": 5.624577331542969, "epoch": 4.003537735849057, "grad_norm": 1.40625, "learning_rate": 0.00034795396514631386, "loss": 4.8633, "mean_token_accuracy": 0.227254319190979, "num_tokens": 91590834.0, "step": 44135 }, { "entropy": 5.582599925994873, "epoch": 4.003991291727141, "grad_norm": 1.125, "learning_rate": 0.00034792335603088135, "loss": 4.8733, "mean_token_accuracy": 0.2203483372926712, "num_tokens": 91602099.0, "step": 44140 }, { "entropy": 5.551930618286133, "epoch": 4.004444847605225, "grad_norm": 1.2578125, "learning_rate": 0.00034789274540737535, "loss": 4.7796, "mean_token_accuracy": 0.23713664412498475, "num_tokens": 91612269.0, "step": 44145 }, { "entropy": 5.619314098358155, "epoch": 4.004898403483309, "grad_norm": 1.2421875, "learning_rate": 0.00034786213327642874, "loss": 4.8438, "mean_token_accuracy": 0.22387367635965347, "num_tokens": 91623644.0, "step": 44150 }, { "entropy": 5.621955919265747, "epoch": 4.005351959361393, "grad_norm": 1.375, "learning_rate": 0.0003478315196386747, "loss": 4.8265, "mean_token_accuracy": 0.23409025818109513, "num_tokens": 91633563.0, "step": 44155 }, { "entropy": 5.571321296691894, "epoch": 4.005805515239477, "grad_norm": 1.2265625, "learning_rate": 0.0003478009044947463, "loss": 4.7949, "mean_token_accuracy": 0.23007688969373702, "num_tokens": 91644648.0, "step": 44160 }, { "entropy": 5.563946771621704, "epoch": 4.006259071117562, "grad_norm": 1.2421875, "learning_rate": 0.0003477702878452766, "loss": 4.6941, "mean_token_accuracy": 0.24915118217468263, "num_tokens": 91655366.0, "step": 44165 }, { "entropy": 5.575225687026977, "epoch": 4.006712626995646, "grad_norm": 1.3203125, "learning_rate": 0.0003477396696908988, "loss": 4.815, "mean_token_accuracy": 0.22737202942371368, "num_tokens": 91665474.0, "step": 44170 }, { "entropy": 5.612418365478516, "epoch": 4.00716618287373, "grad_norm": 1.2421875, "learning_rate": 0.00034770905003224606, "loss": 4.8344, "mean_token_accuracy": 0.22141342163085936, "num_tokens": 91675291.0, "step": 44175 }, { "entropy": 5.51589879989624, "epoch": 4.007619738751814, "grad_norm": 1.21875, "learning_rate": 0.0003476784288699517, "loss": 4.7581, "mean_token_accuracy": 0.2309844359755516, "num_tokens": 91686472.0, "step": 44180 }, { "entropy": 5.618040609359741, "epoch": 4.008073294629899, "grad_norm": 1.3515625, "learning_rate": 0.00034764780620464886, "loss": 4.8799, "mean_token_accuracy": 0.22249191403388976, "num_tokens": 91696347.0, "step": 44185 }, { "entropy": 5.587293434143066, "epoch": 4.008526850507983, "grad_norm": 1.4296875, "learning_rate": 0.0003476171820369709, "loss": 4.8657, "mean_token_accuracy": 0.22103931456804277, "num_tokens": 91706504.0, "step": 44190 }, { "entropy": 5.57837142944336, "epoch": 4.008980406386066, "grad_norm": 1.234375, "learning_rate": 0.00034758655636755103, "loss": 4.7817, "mean_token_accuracy": 0.2345270812511444, "num_tokens": 91716559.0, "step": 44195 }, { "entropy": 5.6016185760498045, "epoch": 4.009433962264151, "grad_norm": 1.3828125, "learning_rate": 0.00034755592919702275, "loss": 4.8205, "mean_token_accuracy": 0.22436016350984572, "num_tokens": 91726312.0, "step": 44200 }, { "entropy": 5.559885931015015, "epoch": 4.009887518142235, "grad_norm": 1.2109375, "learning_rate": 0.00034752530052601944, "loss": 4.7849, "mean_token_accuracy": 0.22821685373783113, "num_tokens": 91736882.0, "step": 44205 }, { "entropy": 5.601106786727906, "epoch": 4.010341074020319, "grad_norm": 1.28125, "learning_rate": 0.00034749467035517437, "loss": 4.8686, "mean_token_accuracy": 0.220924474298954, "num_tokens": 91746905.0, "step": 44210 }, { "entropy": 5.5938637256622314, "epoch": 4.010794629898403, "grad_norm": 1.25, "learning_rate": 0.00034746403868512094, "loss": 4.877, "mean_token_accuracy": 0.2210596099495888, "num_tokens": 91757609.0, "step": 44215 }, { "entropy": 5.613859844207764, "epoch": 4.011248185776488, "grad_norm": 1.3359375, "learning_rate": 0.00034743340551649285, "loss": 4.7877, "mean_token_accuracy": 0.23170709758996963, "num_tokens": 91768017.0, "step": 44220 }, { "entropy": 5.549668645858764, "epoch": 4.011701741654572, "grad_norm": 1.34375, "learning_rate": 0.00034740277084992346, "loss": 4.7206, "mean_token_accuracy": 0.23830063939094542, "num_tokens": 91777820.0, "step": 44225 }, { "entropy": 5.545172929763794, "epoch": 4.012155297532656, "grad_norm": 1.1484375, "learning_rate": 0.00034737213468604626, "loss": 4.836, "mean_token_accuracy": 0.22365311682224273, "num_tokens": 91789011.0, "step": 44230 }, { "entropy": 5.6277398586273195, "epoch": 4.0126088534107405, "grad_norm": 1.3828125, "learning_rate": 0.0003473414970254949, "loss": 4.8968, "mean_token_accuracy": 0.2198638513684273, "num_tokens": 91799165.0, "step": 44235 }, { "entropy": 5.5939546585083, "epoch": 4.013062409288825, "grad_norm": 1.359375, "learning_rate": 0.00034731085786890306, "loss": 4.8534, "mean_token_accuracy": 0.22711962312459946, "num_tokens": 91809602.0, "step": 44240 }, { "entropy": 5.636578607559204, "epoch": 4.013515965166909, "grad_norm": 1.1953125, "learning_rate": 0.00034728021721690407, "loss": 4.9012, "mean_token_accuracy": 0.22376101613044738, "num_tokens": 91820092.0, "step": 44245 }, { "entropy": 5.566355657577515, "epoch": 4.013969521044992, "grad_norm": 1.3046875, "learning_rate": 0.0003472495750701318, "loss": 4.8429, "mean_token_accuracy": 0.2324467420578003, "num_tokens": 91829730.0, "step": 44250 }, { "entropy": 5.582024049758911, "epoch": 4.014423076923077, "grad_norm": 1.296875, "learning_rate": 0.00034721893142922, "loss": 4.8655, "mean_token_accuracy": 0.21847952157258987, "num_tokens": 91840697.0, "step": 44255 }, { "entropy": 5.621986532211304, "epoch": 4.014876632801161, "grad_norm": 1.21875, "learning_rate": 0.0003471882862948023, "loss": 4.8544, "mean_token_accuracy": 0.22468733191490173, "num_tokens": 91852145.0, "step": 44260 }, { "entropy": 5.625450325012207, "epoch": 4.015330188679245, "grad_norm": 1.28125, "learning_rate": 0.00034715763966751233, "loss": 4.8055, "mean_token_accuracy": 0.2212170660495758, "num_tokens": 91861940.0, "step": 44265 }, { "entropy": 5.652124118804932, "epoch": 4.0157837445573294, "grad_norm": 1.3359375, "learning_rate": 0.00034712699154798403, "loss": 4.8696, "mean_token_accuracy": 0.2269722878932953, "num_tokens": 91872179.0, "step": 44270 }, { "entropy": 5.623732948303223, "epoch": 4.016237300435414, "grad_norm": 1.2734375, "learning_rate": 0.00034709634193685126, "loss": 4.7919, "mean_token_accuracy": 0.2293704628944397, "num_tokens": 91882051.0, "step": 44275 }, { "entropy": 5.582018136978149, "epoch": 4.016690856313498, "grad_norm": 1.4296875, "learning_rate": 0.0003470656908347476, "loss": 4.8581, "mean_token_accuracy": 0.22427183240652085, "num_tokens": 91892672.0, "step": 44280 }, { "entropy": 5.5499889850616455, "epoch": 4.017144412191582, "grad_norm": 1.328125, "learning_rate": 0.0003470350382423072, "loss": 4.7432, "mean_token_accuracy": 0.23241445869207383, "num_tokens": 91903418.0, "step": 44285 }, { "entropy": 5.5989936828613285, "epoch": 4.0175979680696665, "grad_norm": 1.296875, "learning_rate": 0.0003470043841601639, "loss": 4.835, "mean_token_accuracy": 0.22673787474632262, "num_tokens": 91913076.0, "step": 44290 }, { "entropy": 5.575576210021973, "epoch": 4.018051523947751, "grad_norm": 1.234375, "learning_rate": 0.00034697372858895147, "loss": 4.8282, "mean_token_accuracy": 0.23406293541193007, "num_tokens": 91923464.0, "step": 44295 }, { "entropy": 5.636105346679687, "epoch": 4.018505079825834, "grad_norm": 1.28125, "learning_rate": 0.000346943071529304, "loss": 4.8879, "mean_token_accuracy": 0.22333446890115738, "num_tokens": 91934399.0, "step": 44300 }, { "entropy": 5.643493175506592, "epoch": 4.018958635703918, "grad_norm": 1.421875, "learning_rate": 0.00034691241298185553, "loss": 4.8653, "mean_token_accuracy": 0.23206893652677535, "num_tokens": 91945330.0, "step": 44305 }, { "entropy": 5.616344308853149, "epoch": 4.019412191582003, "grad_norm": 1.15625, "learning_rate": 0.00034688175294724004, "loss": 4.8694, "mean_token_accuracy": 0.21859676986932755, "num_tokens": 91956379.0, "step": 44310 }, { "entropy": 5.492795801162719, "epoch": 4.019865747460087, "grad_norm": 1.2578125, "learning_rate": 0.00034685109142609154, "loss": 4.7131, "mean_token_accuracy": 0.2326076954603195, "num_tokens": 91965969.0, "step": 44315 }, { "entropy": 5.6541228771209715, "epoch": 4.020319303338171, "grad_norm": 1.2578125, "learning_rate": 0.0003468204284190442, "loss": 4.9645, "mean_token_accuracy": 0.2119796097278595, "num_tokens": 91977005.0, "step": 44320 }, { "entropy": 5.628622007369995, "epoch": 4.0207728592162555, "grad_norm": 1.2265625, "learning_rate": 0.00034678976392673206, "loss": 4.8303, "mean_token_accuracy": 0.22776288986206056, "num_tokens": 91988735.0, "step": 44325 }, { "entropy": 5.637476634979248, "epoch": 4.02122641509434, "grad_norm": 1.328125, "learning_rate": 0.00034675909794978926, "loss": 4.8426, "mean_token_accuracy": 0.2270573452115059, "num_tokens": 91998743.0, "step": 44330 }, { "entropy": 5.626567125320435, "epoch": 4.021679970972424, "grad_norm": 1.1953125, "learning_rate": 0.00034672843048885017, "loss": 4.8666, "mean_token_accuracy": 0.22716895639896392, "num_tokens": 92009465.0, "step": 44335 }, { "entropy": 5.552109956741333, "epoch": 4.022133526850508, "grad_norm": 1.2890625, "learning_rate": 0.00034669776154454875, "loss": 4.7965, "mean_token_accuracy": 0.2357358902692795, "num_tokens": 92020818.0, "step": 44340 }, { "entropy": 5.636726760864258, "epoch": 4.0225870827285926, "grad_norm": 1.1875, "learning_rate": 0.00034666709111751945, "loss": 4.9121, "mean_token_accuracy": 0.21912719905376435, "num_tokens": 92031528.0, "step": 44345 }, { "entropy": 5.6711774349212645, "epoch": 4.023040638606676, "grad_norm": 1.3203125, "learning_rate": 0.0003466364192083963, "loss": 4.8983, "mean_token_accuracy": 0.22255193442106247, "num_tokens": 92041856.0, "step": 44350 }, { "entropy": 5.607060337066651, "epoch": 4.02349419448476, "grad_norm": 1.40625, "learning_rate": 0.00034660574581781386, "loss": 4.8211, "mean_token_accuracy": 0.23123977333307266, "num_tokens": 92052117.0, "step": 44355 }, { "entropy": 5.630417537689209, "epoch": 4.0239477503628445, "grad_norm": 1.3359375, "learning_rate": 0.0003465750709464063, "loss": 4.8584, "mean_token_accuracy": 0.22280800193548203, "num_tokens": 92062405.0, "step": 44360 }, { "entropy": 5.642234516143799, "epoch": 4.024401306240929, "grad_norm": 1.25, "learning_rate": 0.000346544394594808, "loss": 4.8742, "mean_token_accuracy": 0.233217491209507, "num_tokens": 92073269.0, "step": 44365 }, { "entropy": 5.5918628692626955, "epoch": 4.024854862119013, "grad_norm": 1.34375, "learning_rate": 0.00034651371676365343, "loss": 4.7818, "mean_token_accuracy": 0.23179157078266144, "num_tokens": 92083645.0, "step": 44370 }, { "entropy": 5.697069072723389, "epoch": 4.025308417997097, "grad_norm": 1.2109375, "learning_rate": 0.00034648303745357705, "loss": 4.843, "mean_token_accuracy": 0.22801963686943055, "num_tokens": 92093696.0, "step": 44375 }, { "entropy": 5.589551019668579, "epoch": 4.0257619738751815, "grad_norm": 1.3671875, "learning_rate": 0.0003464523566652131, "loss": 4.8853, "mean_token_accuracy": 0.21721942275762557, "num_tokens": 92103217.0, "step": 44380 }, { "entropy": 5.560887670516967, "epoch": 4.026215529753266, "grad_norm": 1.234375, "learning_rate": 0.00034642167439919634, "loss": 4.7791, "mean_token_accuracy": 0.2266951397061348, "num_tokens": 92112934.0, "step": 44385 }, { "entropy": 5.580127954483032, "epoch": 4.02666908563135, "grad_norm": 1.2734375, "learning_rate": 0.0003463909906561611, "loss": 4.8336, "mean_token_accuracy": 0.23183880001306534, "num_tokens": 92123066.0, "step": 44390 }, { "entropy": 5.598183727264404, "epoch": 4.027122641509434, "grad_norm": 1.2578125, "learning_rate": 0.0003463603054367419, "loss": 4.8225, "mean_token_accuracy": 0.2302472174167633, "num_tokens": 92133911.0, "step": 44395 }, { "entropy": 5.528662443161011, "epoch": 4.027576197387518, "grad_norm": 1.2734375, "learning_rate": 0.0003463296187415735, "loss": 4.7644, "mean_token_accuracy": 0.23149650394916535, "num_tokens": 92143941.0, "step": 44400 }, { "entropy": 5.542422437667847, "epoch": 4.028029753265602, "grad_norm": 1.3203125, "learning_rate": 0.0003462989305712904, "loss": 4.7833, "mean_token_accuracy": 0.22673832774162292, "num_tokens": 92153934.0, "step": 44405 }, { "entropy": 5.578616762161255, "epoch": 4.028483309143686, "grad_norm": 1.5234375, "learning_rate": 0.0003462682409265272, "loss": 4.7807, "mean_token_accuracy": 0.23435907661914826, "num_tokens": 92163642.0, "step": 44410 }, { "entropy": 5.5748560428619385, "epoch": 4.0289368650217705, "grad_norm": 1.234375, "learning_rate": 0.0003462375498079186, "loss": 4.8461, "mean_token_accuracy": 0.22381222248077393, "num_tokens": 92174034.0, "step": 44415 }, { "entropy": 5.613165950775146, "epoch": 4.029390420899855, "grad_norm": 1.34375, "learning_rate": 0.00034620685721609937, "loss": 4.8459, "mean_token_accuracy": 0.2274747982621193, "num_tokens": 92183714.0, "step": 44420 }, { "entropy": 5.590362501144409, "epoch": 4.029843976777939, "grad_norm": 1.1640625, "learning_rate": 0.00034617616315170413, "loss": 4.8878, "mean_token_accuracy": 0.21772707849740983, "num_tokens": 92195291.0, "step": 44425 }, { "entropy": 5.592410326004028, "epoch": 4.030297532656023, "grad_norm": 1.359375, "learning_rate": 0.0003461454676153678, "loss": 4.8611, "mean_token_accuracy": 0.22856836169958114, "num_tokens": 92206159.0, "step": 44430 }, { "entropy": 5.641799545288086, "epoch": 4.030751088534108, "grad_norm": 1.296875, "learning_rate": 0.000346114770607725, "loss": 4.8709, "mean_token_accuracy": 0.2268071249127388, "num_tokens": 92216928.0, "step": 44435 }, { "entropy": 5.547517538070679, "epoch": 4.031204644412192, "grad_norm": 1.2265625, "learning_rate": 0.0003460840721294106, "loss": 4.8071, "mean_token_accuracy": 0.2300657734274864, "num_tokens": 92227029.0, "step": 44440 }, { "entropy": 5.594676828384399, "epoch": 4.031658200290276, "grad_norm": 1.21875, "learning_rate": 0.00034605337218105955, "loss": 4.866, "mean_token_accuracy": 0.22630172669887544, "num_tokens": 92237310.0, "step": 44445 }, { "entropy": 5.556257152557373, "epoch": 4.03211175616836, "grad_norm": 1.34375, "learning_rate": 0.0003460226707633066, "loss": 4.8093, "mean_token_accuracy": 0.23246752470731735, "num_tokens": 92247841.0, "step": 44450 }, { "entropy": 5.634732961654663, "epoch": 4.032565312046444, "grad_norm": 1.171875, "learning_rate": 0.00034599196787678667, "loss": 4.8508, "mean_token_accuracy": 0.22523575723171235, "num_tokens": 92258513.0, "step": 44455 }, { "entropy": 5.5847461223602295, "epoch": 4.033018867924528, "grad_norm": 1.4609375, "learning_rate": 0.0003459612635221349, "loss": 4.848, "mean_token_accuracy": 0.224467670917511, "num_tokens": 92268659.0, "step": 44460 }, { "entropy": 5.564281558990478, "epoch": 4.033472423802612, "grad_norm": 1.2265625, "learning_rate": 0.00034593055769998595, "loss": 4.8349, "mean_token_accuracy": 0.2213011547923088, "num_tokens": 92279810.0, "step": 44465 }, { "entropy": 5.588127374649048, "epoch": 4.0339259796806965, "grad_norm": 1.296875, "learning_rate": 0.0003458998504109751, "loss": 4.8365, "mean_token_accuracy": 0.22737037390470505, "num_tokens": 92289625.0, "step": 44470 }, { "entropy": 5.552697372436524, "epoch": 4.034379535558781, "grad_norm": 1.359375, "learning_rate": 0.0003458691416557372, "loss": 4.8091, "mean_token_accuracy": 0.22761324793100357, "num_tokens": 92300669.0, "step": 44475 }, { "entropy": 5.56818642616272, "epoch": 4.034833091436865, "grad_norm": 1.2109375, "learning_rate": 0.00034583843143490744, "loss": 4.8626, "mean_token_accuracy": 0.22722165137529374, "num_tokens": 92312160.0, "step": 44480 }, { "entropy": 5.636919116973877, "epoch": 4.035286647314949, "grad_norm": 1.25, "learning_rate": 0.0003458077197491208, "loss": 4.9302, "mean_token_accuracy": 0.2149924010038376, "num_tokens": 92322677.0, "step": 44485 }, { "entropy": 5.592791986465454, "epoch": 4.035740203193034, "grad_norm": 1.203125, "learning_rate": 0.0003457770065990126, "loss": 4.7668, "mean_token_accuracy": 0.23507199883461, "num_tokens": 92333148.0, "step": 44490 }, { "entropy": 5.636591196060181, "epoch": 4.036193759071118, "grad_norm": 1.3046875, "learning_rate": 0.0003457462919852178, "loss": 4.8648, "mean_token_accuracy": 0.22432505190372468, "num_tokens": 92344189.0, "step": 44495 }, { "entropy": 5.619293260574341, "epoch": 4.036647314949202, "grad_norm": 1.28125, "learning_rate": 0.0003457155759083717, "loss": 4.8265, "mean_token_accuracy": 0.23194621950387956, "num_tokens": 92356136.0, "step": 44500 }, { "entropy": 5.564880847930908, "epoch": 4.0371008708272855, "grad_norm": 1.2890625, "learning_rate": 0.0003456848583691094, "loss": 4.7302, "mean_token_accuracy": 0.23218549489974977, "num_tokens": 92366393.0, "step": 44505 }, { "entropy": 5.578526401519776, "epoch": 4.03755442670537, "grad_norm": 1.2578125, "learning_rate": 0.0003456541393680662, "loss": 4.7763, "mean_token_accuracy": 0.2345937356352806, "num_tokens": 92376819.0, "step": 44510 }, { "entropy": 5.5824384689331055, "epoch": 4.038007982583454, "grad_norm": 1.3046875, "learning_rate": 0.00034562341890587747, "loss": 4.8716, "mean_token_accuracy": 0.22493281066417695, "num_tokens": 92386704.0, "step": 44515 }, { "entropy": 5.567879343032837, "epoch": 4.038461538461538, "grad_norm": 1.28125, "learning_rate": 0.0003455926969831784, "loss": 4.8954, "mean_token_accuracy": 0.22270402163267136, "num_tokens": 92397412.0, "step": 44520 }, { "entropy": 5.690203094482422, "epoch": 4.038915094339623, "grad_norm": 1.265625, "learning_rate": 0.00034556197360060436, "loss": 4.9295, "mean_token_accuracy": 0.21730535477399826, "num_tokens": 92408641.0, "step": 44525 }, { "entropy": 5.5965500831604, "epoch": 4.039368650217707, "grad_norm": 1.203125, "learning_rate": 0.0003455312487587908, "loss": 4.8303, "mean_token_accuracy": 0.22844212800264357, "num_tokens": 92419341.0, "step": 44530 }, { "entropy": 5.59076623916626, "epoch": 4.039822206095791, "grad_norm": 1.265625, "learning_rate": 0.0003455005224583729, "loss": 4.8428, "mean_token_accuracy": 0.2282400280237198, "num_tokens": 92429297.0, "step": 44535 }, { "entropy": 5.656727695465088, "epoch": 4.040275761973875, "grad_norm": 1.265625, "learning_rate": 0.00034546979469998637, "loss": 4.8971, "mean_token_accuracy": 0.22270358800888063, "num_tokens": 92439851.0, "step": 44540 }, { "entropy": 5.524363327026367, "epoch": 4.04072931785196, "grad_norm": 1.25, "learning_rate": 0.00034543906548426646, "loss": 4.7875, "mean_token_accuracy": 0.23762448728084565, "num_tokens": 92451096.0, "step": 44545 }, { "entropy": 5.58683295249939, "epoch": 4.041182873730044, "grad_norm": 1.3515625, "learning_rate": 0.00034540833481184867, "loss": 4.81, "mean_token_accuracy": 0.2267359808087349, "num_tokens": 92460516.0, "step": 44550 }, { "entropy": 5.683700799942017, "epoch": 4.041636429608127, "grad_norm": 1.1328125, "learning_rate": 0.00034537760268336866, "loss": 4.8921, "mean_token_accuracy": 0.21936065107584, "num_tokens": 92471429.0, "step": 44555 }, { "entropy": 5.634250497817993, "epoch": 4.042089985486212, "grad_norm": 1.1953125, "learning_rate": 0.0003453468690994619, "loss": 4.8491, "mean_token_accuracy": 0.22756273597478865, "num_tokens": 92482047.0, "step": 44560 }, { "entropy": 5.549635553359986, "epoch": 4.042543541364296, "grad_norm": 1.390625, "learning_rate": 0.00034531613406076387, "loss": 4.7829, "mean_token_accuracy": 0.23348269164562224, "num_tokens": 92492206.0, "step": 44565 }, { "entropy": 5.520943689346313, "epoch": 4.04299709724238, "grad_norm": 1.2734375, "learning_rate": 0.0003452853975679103, "loss": 4.7487, "mean_token_accuracy": 0.2299257054924965, "num_tokens": 92501979.0, "step": 44570 }, { "entropy": 5.703576183319091, "epoch": 4.043450653120464, "grad_norm": 1.265625, "learning_rate": 0.00034525465962153683, "loss": 4.9083, "mean_token_accuracy": 0.22335177659988403, "num_tokens": 92512388.0, "step": 44575 }, { "entropy": 5.6362231254577635, "epoch": 4.043904208998549, "grad_norm": 1.3359375, "learning_rate": 0.00034522392022227915, "loss": 4.8882, "mean_token_accuracy": 0.21817947626113893, "num_tokens": 92522805.0, "step": 44580 }, { "entropy": 5.559390687942505, "epoch": 4.044357764876633, "grad_norm": 1.28125, "learning_rate": 0.00034519317937077283, "loss": 4.8378, "mean_token_accuracy": 0.22282641977071763, "num_tokens": 92532957.0, "step": 44585 }, { "entropy": 5.5748978614807125, "epoch": 4.044811320754717, "grad_norm": 1.3515625, "learning_rate": 0.0003451624370676537, "loss": 4.8579, "mean_token_accuracy": 0.22243332117795944, "num_tokens": 92543451.0, "step": 44590 }, { "entropy": 5.67425012588501, "epoch": 4.045264876632801, "grad_norm": 1.28125, "learning_rate": 0.00034513169331355754, "loss": 4.8421, "mean_token_accuracy": 0.22604949921369552, "num_tokens": 92553856.0, "step": 44595 }, { "entropy": 5.565695333480835, "epoch": 4.045718432510886, "grad_norm": 1.3203125, "learning_rate": 0.00034510094810911995, "loss": 4.7656, "mean_token_accuracy": 0.2331593319773674, "num_tokens": 92563816.0, "step": 44600 }, { "entropy": 5.567518901824951, "epoch": 4.04617198838897, "grad_norm": 1.3125, "learning_rate": 0.00034507020145497705, "loss": 4.8461, "mean_token_accuracy": 0.23186744302511214, "num_tokens": 92574062.0, "step": 44605 }, { "entropy": 5.563264179229736, "epoch": 4.046625544267053, "grad_norm": 1.3515625, "learning_rate": 0.00034503945335176444, "loss": 4.7909, "mean_token_accuracy": 0.23605702221393585, "num_tokens": 92583935.0, "step": 44610 }, { "entropy": 5.6631800651550295, "epoch": 4.047079100145138, "grad_norm": 1.2578125, "learning_rate": 0.00034500870380011807, "loss": 4.849, "mean_token_accuracy": 0.23103433698415757, "num_tokens": 92594037.0, "step": 44615 }, { "entropy": 5.601016330718994, "epoch": 4.047532656023222, "grad_norm": 1.25, "learning_rate": 0.00034497795280067386, "loss": 4.809, "mean_token_accuracy": 0.22476974576711656, "num_tokens": 92603336.0, "step": 44620 }, { "entropy": 5.511468505859375, "epoch": 4.047986211901306, "grad_norm": 1.28125, "learning_rate": 0.00034494720035406777, "loss": 4.7471, "mean_token_accuracy": 0.23324310928583145, "num_tokens": 92614210.0, "step": 44625 }, { "entropy": 5.60916223526001, "epoch": 4.04843976777939, "grad_norm": 1.2578125, "learning_rate": 0.0003449164464609358, "loss": 4.859, "mean_token_accuracy": 0.22311047911643983, "num_tokens": 92624036.0, "step": 44630 }, { "entropy": 5.618900632858276, "epoch": 4.048893323657475, "grad_norm": 1.28125, "learning_rate": 0.0003448856911219139, "loss": 4.917, "mean_token_accuracy": 0.217339688539505, "num_tokens": 92634588.0, "step": 44635 }, { "entropy": 5.587625026702881, "epoch": 4.049346879535559, "grad_norm": 1.328125, "learning_rate": 0.00034485493433763804, "loss": 4.797, "mean_token_accuracy": 0.22843301445245742, "num_tokens": 92645027.0, "step": 44640 }, { "entropy": 5.68034029006958, "epoch": 4.049800435413643, "grad_norm": 1.2890625, "learning_rate": 0.00034482417610874437, "loss": 4.8771, "mean_token_accuracy": 0.22312044501304626, "num_tokens": 92656669.0, "step": 44645 }, { "entropy": 5.618550252914429, "epoch": 4.0502539912917275, "grad_norm": 1.2734375, "learning_rate": 0.0003447934164358689, "loss": 4.9292, "mean_token_accuracy": 0.21590907126665115, "num_tokens": 92666558.0, "step": 44650 }, { "entropy": 5.585630559921265, "epoch": 4.050707547169812, "grad_norm": 1.2578125, "learning_rate": 0.00034476265531964786, "loss": 4.86, "mean_token_accuracy": 0.22730345726013185, "num_tokens": 92677384.0, "step": 44655 }, { "entropy": 5.540721607208252, "epoch": 4.051161103047895, "grad_norm": 1.4765625, "learning_rate": 0.0003447318927607173, "loss": 4.782, "mean_token_accuracy": 0.23331023901700973, "num_tokens": 92687619.0, "step": 44660 }, { "entropy": 5.562377786636352, "epoch": 4.051614658925979, "grad_norm": 1.3125, "learning_rate": 0.0003447011287597134, "loss": 4.7177, "mean_token_accuracy": 0.2337102934718132, "num_tokens": 92697784.0, "step": 44665 }, { "entropy": 5.625196075439453, "epoch": 4.052068214804064, "grad_norm": 1.28125, "learning_rate": 0.0003446703633172724, "loss": 4.9048, "mean_token_accuracy": 0.21917217522859572, "num_tokens": 92709255.0, "step": 44670 }, { "entropy": 5.54682035446167, "epoch": 4.052521770682148, "grad_norm": 1.34375, "learning_rate": 0.0003446395964340305, "loss": 4.7761, "mean_token_accuracy": 0.2355020135641098, "num_tokens": 92720714.0, "step": 44675 }, { "entropy": 5.58401517868042, "epoch": 4.052975326560232, "grad_norm": 1.328125, "learning_rate": 0.00034460882811062417, "loss": 4.818, "mean_token_accuracy": 0.22225105464458467, "num_tokens": 92730783.0, "step": 44680 }, { "entropy": 5.645687866210937, "epoch": 4.0534288824383164, "grad_norm": 1.296875, "learning_rate": 0.00034457805834768937, "loss": 4.8946, "mean_token_accuracy": 0.21911788135766982, "num_tokens": 92741943.0, "step": 44685 }, { "entropy": 5.591673183441162, "epoch": 4.053882438316401, "grad_norm": 1.1875, "learning_rate": 0.0003445472871458627, "loss": 4.8384, "mean_token_accuracy": 0.22499633580446243, "num_tokens": 92753510.0, "step": 44690 }, { "entropy": 5.610969400405883, "epoch": 4.054335994194485, "grad_norm": 1.4453125, "learning_rate": 0.0003445165145057803, "loss": 4.7921, "mean_token_accuracy": 0.22890833914279937, "num_tokens": 92763655.0, "step": 44695 }, { "entropy": 5.608323335647583, "epoch": 4.054789550072569, "grad_norm": 1.3125, "learning_rate": 0.00034448574042807866, "loss": 4.8574, "mean_token_accuracy": 0.22084259241819382, "num_tokens": 92773732.0, "step": 44700 }, { "entropy": 5.595209646224975, "epoch": 4.0552431059506535, "grad_norm": 1.28125, "learning_rate": 0.0003444549649133943, "loss": 4.7939, "mean_token_accuracy": 0.22537048757076264, "num_tokens": 92784822.0, "step": 44705 }, { "entropy": 5.660883045196533, "epoch": 4.055696661828737, "grad_norm": 1.359375, "learning_rate": 0.0003444241879623636, "loss": 4.9435, "mean_token_accuracy": 0.21364960074424744, "num_tokens": 92795270.0, "step": 44710 }, { "entropy": 5.616207551956177, "epoch": 4.056150217706821, "grad_norm": 1.2265625, "learning_rate": 0.0003443934095756229, "loss": 4.815, "mean_token_accuracy": 0.2324299544095993, "num_tokens": 92806578.0, "step": 44715 }, { "entropy": 5.643567323684692, "epoch": 4.056603773584905, "grad_norm": 1.34375, "learning_rate": 0.0003443626297538088, "loss": 4.8371, "mean_token_accuracy": 0.22598257958889006, "num_tokens": 92815932.0, "step": 44720 }, { "entropy": 5.570905971527099, "epoch": 4.05705732946299, "grad_norm": 1.3984375, "learning_rate": 0.0003443318484975579, "loss": 4.8185, "mean_token_accuracy": 0.2312711015343666, "num_tokens": 92825536.0, "step": 44725 }, { "entropy": 5.587768459320069, "epoch": 4.057510885341074, "grad_norm": 1.2109375, "learning_rate": 0.0003443010658075066, "loss": 4.8029, "mean_token_accuracy": 0.2293898046016693, "num_tokens": 92836451.0, "step": 44730 }, { "entropy": 5.645005178451538, "epoch": 4.057964441219158, "grad_norm": 1.3125, "learning_rate": 0.0003442702816842917, "loss": 4.9429, "mean_token_accuracy": 0.22377101629972457, "num_tokens": 92846923.0, "step": 44735 }, { "entropy": 5.606642961502075, "epoch": 4.0584179970972425, "grad_norm": 1.2265625, "learning_rate": 0.00034423949612854974, "loss": 4.7842, "mean_token_accuracy": 0.22843304574489592, "num_tokens": 92857549.0, "step": 44740 }, { "entropy": 5.64547815322876, "epoch": 4.058871552975327, "grad_norm": 1.4140625, "learning_rate": 0.0003442087091409173, "loss": 4.9048, "mean_token_accuracy": 0.22554138749837876, "num_tokens": 92867059.0, "step": 44745 }, { "entropy": 5.592003726959229, "epoch": 4.059325108853411, "grad_norm": 1.25, "learning_rate": 0.0003441779207220311, "loss": 4.8499, "mean_token_accuracy": 0.21685340851545334, "num_tokens": 92878138.0, "step": 44750 }, { "entropy": 5.614434385299683, "epoch": 4.059778664731495, "grad_norm": 1.2265625, "learning_rate": 0.0003441471308725279, "loss": 4.8751, "mean_token_accuracy": 0.22340454906225204, "num_tokens": 92888931.0, "step": 44755 }, { "entropy": 5.648858308792114, "epoch": 4.060232220609579, "grad_norm": 1.3046875, "learning_rate": 0.00034411633959304444, "loss": 4.9127, "mean_token_accuracy": 0.21605476438999177, "num_tokens": 92899718.0, "step": 44760 }, { "entropy": 5.642678594589233, "epoch": 4.060685776487663, "grad_norm": 1.1875, "learning_rate": 0.00034408554688421743, "loss": 4.8025, "mean_token_accuracy": 0.2328519642353058, "num_tokens": 92910381.0, "step": 44765 }, { "entropy": 5.556215381622314, "epoch": 4.061139332365747, "grad_norm": 1.453125, "learning_rate": 0.0003440547527466837, "loss": 4.8009, "mean_token_accuracy": 0.23354393392801284, "num_tokens": 92919905.0, "step": 44770 }, { "entropy": 5.516737604141236, "epoch": 4.0615928882438315, "grad_norm": 1.4140625, "learning_rate": 0.00034402395718108016, "loss": 4.7908, "mean_token_accuracy": 0.23669462502002717, "num_tokens": 92930210.0, "step": 44775 }, { "entropy": 5.574579095840454, "epoch": 4.062046444121916, "grad_norm": 1.2578125, "learning_rate": 0.00034399316018804356, "loss": 4.8216, "mean_token_accuracy": 0.22903160154819488, "num_tokens": 92940832.0, "step": 44780 }, { "entropy": 5.694894027709961, "epoch": 4.0625, "grad_norm": 1.375, "learning_rate": 0.0003439623617682107, "loss": 4.94, "mean_token_accuracy": 0.21604613065719605, "num_tokens": 92951349.0, "step": 44785 }, { "entropy": 5.618463516235352, "epoch": 4.062953555878084, "grad_norm": 1.3359375, "learning_rate": 0.0003439315619222188, "loss": 4.8246, "mean_token_accuracy": 0.22501133382320404, "num_tokens": 92961642.0, "step": 44790 }, { "entropy": 5.584527444839478, "epoch": 4.0634071117561685, "grad_norm": 1.3125, "learning_rate": 0.0003439007606507046, "loss": 4.8515, "mean_token_accuracy": 0.23371994644403457, "num_tokens": 92971061.0, "step": 44795 }, { "entropy": 5.682553768157959, "epoch": 4.063860667634253, "grad_norm": 1.3671875, "learning_rate": 0.0003438699579543051, "loss": 4.948, "mean_token_accuracy": 0.21575381308794023, "num_tokens": 92981732.0, "step": 44800 }, { "entropy": 5.651588821411133, "epoch": 4.064314223512337, "grad_norm": 1.5390625, "learning_rate": 0.00034383915383365726, "loss": 4.9186, "mean_token_accuracy": 0.22133039832115173, "num_tokens": 92991570.0, "step": 44805 }, { "entropy": 5.574545621871948, "epoch": 4.064767779390421, "grad_norm": 1.40625, "learning_rate": 0.0003438083482893982, "loss": 4.8497, "mean_token_accuracy": 0.22949228435754776, "num_tokens": 93001623.0, "step": 44810 }, { "entropy": 5.62262716293335, "epoch": 4.065221335268505, "grad_norm": 1.359375, "learning_rate": 0.00034377754132216496, "loss": 4.8669, "mean_token_accuracy": 0.2263652801513672, "num_tokens": 93012167.0, "step": 44815 }, { "entropy": 5.565275096893311, "epoch": 4.065674891146589, "grad_norm": 1.3671875, "learning_rate": 0.0003437467329325947, "loss": 4.7806, "mean_token_accuracy": 0.23684606254100798, "num_tokens": 93022090.0, "step": 44820 }, { "entropy": 5.594990682601929, "epoch": 4.066128447024673, "grad_norm": 1.28125, "learning_rate": 0.0003437159231213244, "loss": 4.7163, "mean_token_accuracy": 0.23756403774023055, "num_tokens": 93030917.0, "step": 44825 }, { "entropy": 5.604778718948364, "epoch": 4.0665820029027575, "grad_norm": 1.375, "learning_rate": 0.0003436851118889914, "loss": 4.818, "mean_token_accuracy": 0.22406309992074966, "num_tokens": 93040113.0, "step": 44830 }, { "entropy": 5.606387186050415, "epoch": 4.067035558780842, "grad_norm": 1.328125, "learning_rate": 0.0003436542992362326, "loss": 4.8625, "mean_token_accuracy": 0.22789676636457443, "num_tokens": 93050053.0, "step": 44835 }, { "entropy": 5.662514591217041, "epoch": 4.067489114658926, "grad_norm": 1.40625, "learning_rate": 0.0003436234851636856, "loss": 4.9171, "mean_token_accuracy": 0.21070526242256166, "num_tokens": 93060581.0, "step": 44840 }, { "entropy": 5.676267814636231, "epoch": 4.06794267053701, "grad_norm": 1.4296875, "learning_rate": 0.00034359266967198734, "loss": 4.9056, "mean_token_accuracy": 0.2218409851193428, "num_tokens": 93070158.0, "step": 44845 }, { "entropy": 5.544855451583862, "epoch": 4.068396226415095, "grad_norm": 1.2421875, "learning_rate": 0.0003435618527617752, "loss": 4.7987, "mean_token_accuracy": 0.22716328352689744, "num_tokens": 93080804.0, "step": 44850 }, { "entropy": 5.623077774047852, "epoch": 4.068849782293179, "grad_norm": 1.15625, "learning_rate": 0.0003435310344336865, "loss": 4.8208, "mean_token_accuracy": 0.2248335748910904, "num_tokens": 93091346.0, "step": 44855 }, { "entropy": 5.574751853942871, "epoch": 4.069303338171263, "grad_norm": 1.3984375, "learning_rate": 0.0003435002146883585, "loss": 4.7939, "mean_token_accuracy": 0.2331780195236206, "num_tokens": 93100931.0, "step": 44860 }, { "entropy": 5.57326979637146, "epoch": 4.0697568940493465, "grad_norm": 1.375, "learning_rate": 0.0003434693935264286, "loss": 4.8226, "mean_token_accuracy": 0.22805947810411453, "num_tokens": 93110181.0, "step": 44865 }, { "entropy": 5.639777803421021, "epoch": 4.070210449927431, "grad_norm": 1.3359375, "learning_rate": 0.0003434385709485343, "loss": 4.8003, "mean_token_accuracy": 0.22709694057703017, "num_tokens": 93120140.0, "step": 44870 }, { "entropy": 5.657888698577881, "epoch": 4.070664005805515, "grad_norm": 1.265625, "learning_rate": 0.0003434077469553128, "loss": 4.8809, "mean_token_accuracy": 0.2222645714879036, "num_tokens": 93130853.0, "step": 44875 }, { "entropy": 5.595185089111328, "epoch": 4.071117561683599, "grad_norm": 1.34375, "learning_rate": 0.0003433769215474017, "loss": 4.82, "mean_token_accuracy": 0.2288125991821289, "num_tokens": 93141430.0, "step": 44880 }, { "entropy": 5.681582641601563, "epoch": 4.0715711175616836, "grad_norm": 1.234375, "learning_rate": 0.00034334609472543845, "loss": 4.937, "mean_token_accuracy": 0.21889784783124924, "num_tokens": 93152270.0, "step": 44885 }, { "entropy": 5.67920503616333, "epoch": 4.072024673439768, "grad_norm": 1.3359375, "learning_rate": 0.0003433152664900605, "loss": 4.8939, "mean_token_accuracy": 0.2194622799754143, "num_tokens": 93162850.0, "step": 44890 }, { "entropy": 5.597731351852417, "epoch": 4.072478229317852, "grad_norm": 1.3203125, "learning_rate": 0.0003432844368419055, "loss": 4.7315, "mean_token_accuracy": 0.23338056951761246, "num_tokens": 93172265.0, "step": 44895 }, { "entropy": 5.566187191009521, "epoch": 4.072931785195936, "grad_norm": 1.34375, "learning_rate": 0.0003432536057816108, "loss": 4.7823, "mean_token_accuracy": 0.23623788952827454, "num_tokens": 93182756.0, "step": 44900 }, { "entropy": 5.600265026092529, "epoch": 4.073385341074021, "grad_norm": 1.375, "learning_rate": 0.00034322277330981426, "loss": 4.8544, "mean_token_accuracy": 0.2216146245598793, "num_tokens": 93192710.0, "step": 44905 }, { "entropy": 5.594810914993286, "epoch": 4.073838896952105, "grad_norm": 1.3671875, "learning_rate": 0.00034319193942715343, "loss": 4.8061, "mean_token_accuracy": 0.23140716254711152, "num_tokens": 93202531.0, "step": 44910 }, { "entropy": 5.670984601974487, "epoch": 4.074292452830188, "grad_norm": 1.3125, "learning_rate": 0.00034316110413426586, "loss": 4.9261, "mean_token_accuracy": 0.22163503617048264, "num_tokens": 93212208.0, "step": 44915 }, { "entropy": 5.701069784164429, "epoch": 4.0747460087082725, "grad_norm": 1.2890625, "learning_rate": 0.0003431302674317892, "loss": 4.906, "mean_token_accuracy": 0.22078319042921066, "num_tokens": 93222932.0, "step": 44920 }, { "entropy": 5.602761936187744, "epoch": 4.075199564586357, "grad_norm": 1.40625, "learning_rate": 0.00034309942932036136, "loss": 4.7429, "mean_token_accuracy": 0.23693148493766786, "num_tokens": 93232049.0, "step": 44925 }, { "entropy": 5.5965917110443115, "epoch": 4.075653120464441, "grad_norm": 1.3203125, "learning_rate": 0.00034306858980061994, "loss": 4.8676, "mean_token_accuracy": 0.22742598056793212, "num_tokens": 93244230.0, "step": 44930 }, { "entropy": 5.574835777282715, "epoch": 4.076106676342525, "grad_norm": 1.3828125, "learning_rate": 0.00034303774887320274, "loss": 4.8634, "mean_token_accuracy": 0.22267157435417176, "num_tokens": 93254159.0, "step": 44935 }, { "entropy": 5.602105331420899, "epoch": 4.07656023222061, "grad_norm": 1.390625, "learning_rate": 0.00034300690653874753, "loss": 4.7669, "mean_token_accuracy": 0.2311967983841896, "num_tokens": 93263742.0, "step": 44940 }, { "entropy": 5.607001781463623, "epoch": 4.077013788098694, "grad_norm": 1.1796875, "learning_rate": 0.00034297606279789215, "loss": 4.9495, "mean_token_accuracy": 0.2125396728515625, "num_tokens": 93274446.0, "step": 44945 }, { "entropy": 5.619918727874756, "epoch": 4.077467343976778, "grad_norm": 1.2578125, "learning_rate": 0.0003429452176512745, "loss": 4.922, "mean_token_accuracy": 0.22096005082130432, "num_tokens": 93284102.0, "step": 44950 }, { "entropy": 5.5941229343414305, "epoch": 4.077920899854862, "grad_norm": 1.359375, "learning_rate": 0.00034291437109953244, "loss": 4.7977, "mean_token_accuracy": 0.23862214982509614, "num_tokens": 93295096.0, "step": 44955 }, { "entropy": 5.588586807250977, "epoch": 4.078374455732947, "grad_norm": 1.3125, "learning_rate": 0.0003428835231433039, "loss": 4.8624, "mean_token_accuracy": 0.22536150068044664, "num_tokens": 93305377.0, "step": 44960 }, { "entropy": 5.707796287536621, "epoch": 4.07882801161103, "grad_norm": 1.296875, "learning_rate": 0.00034285267378322674, "loss": 4.9054, "mean_token_accuracy": 0.2246744900941849, "num_tokens": 93315859.0, "step": 44965 }, { "entropy": 5.621111679077148, "epoch": 4.079281567489114, "grad_norm": 1.234375, "learning_rate": 0.00034282182301993903, "loss": 4.8052, "mean_token_accuracy": 0.23054684996604918, "num_tokens": 93326519.0, "step": 44970 }, { "entropy": 5.615607500076294, "epoch": 4.079735123367199, "grad_norm": 1.25, "learning_rate": 0.0003427909708540787, "loss": 4.8266, "mean_token_accuracy": 0.22684440165758132, "num_tokens": 93337055.0, "step": 44975 }, { "entropy": 5.615185117721557, "epoch": 4.080188679245283, "grad_norm": 1.25, "learning_rate": 0.00034276011728628393, "loss": 4.8833, "mean_token_accuracy": 0.22140184044837952, "num_tokens": 93346565.0, "step": 44980 }, { "entropy": 5.597073793411255, "epoch": 4.080642235123367, "grad_norm": 1.3671875, "learning_rate": 0.00034272926231719255, "loss": 4.8439, "mean_token_accuracy": 0.22581083923578263, "num_tokens": 93356366.0, "step": 44985 }, { "entropy": 5.63536901473999, "epoch": 4.081095791001451, "grad_norm": 1.34375, "learning_rate": 0.0003426984059474428, "loss": 4.8401, "mean_token_accuracy": 0.2221727505326271, "num_tokens": 93367317.0, "step": 44990 }, { "entropy": 5.579619979858398, "epoch": 4.081549346879536, "grad_norm": 1.2890625, "learning_rate": 0.0003426675481776728, "loss": 4.8531, "mean_token_accuracy": 0.22672135084867479, "num_tokens": 93379601.0, "step": 44995 }, { "entropy": 5.598932266235352, "epoch": 4.08200290275762, "grad_norm": 1.3125, "learning_rate": 0.00034263668900852065, "loss": 4.8177, "mean_token_accuracy": 0.23660581856966018, "num_tokens": 93389740.0, "step": 45000 }, { "epoch": 4.08200290275762, "eval_entropy": 5.36609978341409, "eval_loss": 4.948644161224365, "eval_mean_token_accuracy": 0.22913637396403297, "eval_num_tokens": 93389740.0, "eval_runtime": 21.2153, "eval_samples_per_second": 1666.726, "eval_steps_per_second": 208.341, "step": 45000 }, { "entropy": 5.710444498062134, "epoch": 4.082456458635704, "grad_norm": 1.34375, "learning_rate": 0.0003426058284406244, "loss": 4.9773, "mean_token_accuracy": 0.2175597682595253, "num_tokens": 93400232.0, "step": 45005 }, { "entropy": 5.644765424728393, "epoch": 4.082910014513788, "grad_norm": 1.3046875, "learning_rate": 0.0003425749664746226, "loss": 4.8779, "mean_token_accuracy": 0.2313398540019989, "num_tokens": 93410662.0, "step": 45010 }, { "entropy": 5.593817806243896, "epoch": 4.083363570391873, "grad_norm": 1.265625, "learning_rate": 0.0003425441031111532, "loss": 4.7336, "mean_token_accuracy": 0.2376194566488266, "num_tokens": 93420328.0, "step": 45015 }, { "entropy": 5.637911415100097, "epoch": 4.083817126269956, "grad_norm": 1.28125, "learning_rate": 0.00034251323835085453, "loss": 4.8823, "mean_token_accuracy": 0.21632947772741318, "num_tokens": 93430878.0, "step": 45020 }, { "entropy": 5.7028522968292235, "epoch": 4.08427068214804, "grad_norm": 1.3203125, "learning_rate": 0.0003424823721943649, "loss": 4.9609, "mean_token_accuracy": 0.22205618917942047, "num_tokens": 93441784.0, "step": 45025 }, { "entropy": 5.586560821533203, "epoch": 4.084724238026125, "grad_norm": 1.2734375, "learning_rate": 0.0003424515046423226, "loss": 4.8826, "mean_token_accuracy": 0.2274570271372795, "num_tokens": 93453058.0, "step": 45030 }, { "entropy": 5.647066354751587, "epoch": 4.085177793904209, "grad_norm": 1.34375, "learning_rate": 0.0003424206356953659, "loss": 4.8937, "mean_token_accuracy": 0.2251850873231888, "num_tokens": 93463089.0, "step": 45035 }, { "entropy": 5.644313907623291, "epoch": 4.085631349782293, "grad_norm": 1.2890625, "learning_rate": 0.00034238976535413333, "loss": 4.854, "mean_token_accuracy": 0.22697433680295945, "num_tokens": 93473315.0, "step": 45040 }, { "entropy": 5.695970964431763, "epoch": 4.086084905660377, "grad_norm": 1.2578125, "learning_rate": 0.0003423588936192633, "loss": 4.9513, "mean_token_accuracy": 0.21366531848907472, "num_tokens": 93485113.0, "step": 45045 }, { "entropy": 5.586354827880859, "epoch": 4.086538461538462, "grad_norm": 1.375, "learning_rate": 0.0003423280204913941, "loss": 4.7959, "mean_token_accuracy": 0.22895257622003556, "num_tokens": 93494269.0, "step": 45050 }, { "entropy": 5.5170365333557125, "epoch": 4.086992017416546, "grad_norm": 1.265625, "learning_rate": 0.0003422971459711644, "loss": 4.7712, "mean_token_accuracy": 0.23256022930145265, "num_tokens": 93505052.0, "step": 45055 }, { "entropy": 5.584046220779419, "epoch": 4.08744557329463, "grad_norm": 1.3359375, "learning_rate": 0.00034226627005921244, "loss": 4.8455, "mean_token_accuracy": 0.22312091588973998, "num_tokens": 93514986.0, "step": 45060 }, { "entropy": 5.612998580932617, "epoch": 4.0878991291727145, "grad_norm": 1.359375, "learning_rate": 0.000342235392756177, "loss": 4.8336, "mean_token_accuracy": 0.22653710842132568, "num_tokens": 93525286.0, "step": 45065 }, { "entropy": 5.6412458419799805, "epoch": 4.088352685050798, "grad_norm": 1.265625, "learning_rate": 0.00034220451406269636, "loss": 4.8933, "mean_token_accuracy": 0.22484995275735856, "num_tokens": 93536034.0, "step": 45070 }, { "entropy": 5.556498432159424, "epoch": 4.088806240928882, "grad_norm": 1.3515625, "learning_rate": 0.00034217363397940937, "loss": 4.8231, "mean_token_accuracy": 0.2260088637471199, "num_tokens": 93546283.0, "step": 45075 }, { "entropy": 5.550257349014283, "epoch": 4.089259796806966, "grad_norm": 1.3046875, "learning_rate": 0.00034214275250695446, "loss": 4.8594, "mean_token_accuracy": 0.22520696073770524, "num_tokens": 93555811.0, "step": 45080 }, { "entropy": 5.652612257003784, "epoch": 4.089713352685051, "grad_norm": 1.21875, "learning_rate": 0.0003421118696459703, "loss": 4.9168, "mean_token_accuracy": 0.22132974714040757, "num_tokens": 93567154.0, "step": 45085 }, { "entropy": 5.576481866836548, "epoch": 4.090166908563135, "grad_norm": 1.2421875, "learning_rate": 0.00034208098539709566, "loss": 4.8081, "mean_token_accuracy": 0.2351209968328476, "num_tokens": 93577654.0, "step": 45090 }, { "entropy": 5.597405958175659, "epoch": 4.090620464441219, "grad_norm": 1.2890625, "learning_rate": 0.00034205009976096906, "loss": 4.8494, "mean_token_accuracy": 0.22180677056312562, "num_tokens": 93588712.0, "step": 45095 }, { "entropy": 5.607003450393677, "epoch": 4.0910740203193035, "grad_norm": 1.2890625, "learning_rate": 0.0003420192127382293, "loss": 4.8795, "mean_token_accuracy": 0.22677280157804489, "num_tokens": 93599186.0, "step": 45100 }, { "entropy": 5.566450786590576, "epoch": 4.091527576197388, "grad_norm": 1.2109375, "learning_rate": 0.00034198832432951517, "loss": 4.7618, "mean_token_accuracy": 0.23677219897508622, "num_tokens": 93609439.0, "step": 45105 }, { "entropy": 5.61141357421875, "epoch": 4.091981132075472, "grad_norm": 1.3359375, "learning_rate": 0.0003419574345354654, "loss": 4.8394, "mean_token_accuracy": 0.22290150970220565, "num_tokens": 93619903.0, "step": 45110 }, { "entropy": 5.593566179275513, "epoch": 4.092434687953556, "grad_norm": 1.3359375, "learning_rate": 0.00034192654335671893, "loss": 4.7891, "mean_token_accuracy": 0.23174709379673003, "num_tokens": 93629895.0, "step": 45115 }, { "entropy": 5.62216010093689, "epoch": 4.09288824383164, "grad_norm": 1.390625, "learning_rate": 0.00034189565079391436, "loss": 4.9324, "mean_token_accuracy": 0.21850364357233049, "num_tokens": 93640677.0, "step": 45120 }, { "entropy": 5.639234447479248, "epoch": 4.093341799709724, "grad_norm": 1.3359375, "learning_rate": 0.0003418647568476907, "loss": 4.9316, "mean_token_accuracy": 0.22498167008161546, "num_tokens": 93651541.0, "step": 45125 }, { "entropy": 5.6587926864624025, "epoch": 4.093795355587808, "grad_norm": 1.4375, "learning_rate": 0.0003418338615186869, "loss": 4.8767, "mean_token_accuracy": 0.22495889961719512, "num_tokens": 93661901.0, "step": 45130 }, { "entropy": 5.607352924346924, "epoch": 4.094248911465892, "grad_norm": 1.1875, "learning_rate": 0.00034180296480754174, "loss": 4.8266, "mean_token_accuracy": 0.22662619203329087, "num_tokens": 93672307.0, "step": 45135 }, { "entropy": 5.593094539642334, "epoch": 4.094702467343977, "grad_norm": 1.359375, "learning_rate": 0.0003417720667148943, "loss": 4.808, "mean_token_accuracy": 0.2198405683040619, "num_tokens": 93683802.0, "step": 45140 }, { "entropy": 5.651087665557862, "epoch": 4.095156023222061, "grad_norm": 1.421875, "learning_rate": 0.0003417411672413835, "loss": 4.9179, "mean_token_accuracy": 0.21566251814365386, "num_tokens": 93693467.0, "step": 45145 }, { "entropy": 5.596789216995239, "epoch": 4.095609579100145, "grad_norm": 1.3359375, "learning_rate": 0.00034171026638764833, "loss": 4.8371, "mean_token_accuracy": 0.233934685587883, "num_tokens": 93703858.0, "step": 45150 }, { "entropy": 5.607862901687622, "epoch": 4.0960631349782295, "grad_norm": 1.1484375, "learning_rate": 0.00034167936415432785, "loss": 4.8331, "mean_token_accuracy": 0.23498803824186326, "num_tokens": 93714457.0, "step": 45155 }, { "entropy": 5.629857301712036, "epoch": 4.096516690856314, "grad_norm": 1.1875, "learning_rate": 0.0003416484605420611, "loss": 4.8718, "mean_token_accuracy": 0.22573629766702652, "num_tokens": 93725009.0, "step": 45160 }, { "entropy": 5.656674814224243, "epoch": 4.096970246734398, "grad_norm": 1.234375, "learning_rate": 0.00034161755555148725, "loss": 4.8889, "mean_token_accuracy": 0.21739200502634048, "num_tokens": 93736357.0, "step": 45165 }, { "entropy": 5.569134664535523, "epoch": 4.097423802612482, "grad_norm": 1.2265625, "learning_rate": 0.00034158664918324536, "loss": 4.8135, "mean_token_accuracy": 0.22434503734111785, "num_tokens": 93746711.0, "step": 45170 }, { "entropy": 5.63999662399292, "epoch": 4.097877358490566, "grad_norm": 1.2109375, "learning_rate": 0.00034155574143797455, "loss": 4.9177, "mean_token_accuracy": 0.22342435866594315, "num_tokens": 93757732.0, "step": 45175 }, { "entropy": 5.607414245605469, "epoch": 4.09833091436865, "grad_norm": 1.3828125, "learning_rate": 0.00034152483231631413, "loss": 4.8217, "mean_token_accuracy": 0.22524635195732118, "num_tokens": 93767048.0, "step": 45180 }, { "entropy": 5.734642267227173, "epoch": 4.098784470246734, "grad_norm": 1.359375, "learning_rate": 0.0003414939218189032, "loss": 5.0457, "mean_token_accuracy": 0.21261272132396697, "num_tokens": 93778283.0, "step": 45185 }, { "entropy": 5.678839778900146, "epoch": 4.0992380261248185, "grad_norm": 1.3046875, "learning_rate": 0.000341463009946381, "loss": 4.9472, "mean_token_accuracy": 0.22047129273414612, "num_tokens": 93788776.0, "step": 45190 }, { "entropy": 5.647962331771851, "epoch": 4.099691582002903, "grad_norm": 1.4375, "learning_rate": 0.00034143209669938685, "loss": 4.8564, "mean_token_accuracy": 0.22222113460302353, "num_tokens": 93798695.0, "step": 45195 }, { "entropy": 5.706395959854126, "epoch": 4.100145137880987, "grad_norm": 1.28125, "learning_rate": 0.00034140118207856, "loss": 4.9604, "mean_token_accuracy": 0.2230614736676216, "num_tokens": 93808993.0, "step": 45200 }, { "entropy": 5.695864343643189, "epoch": 4.100598693759071, "grad_norm": 1.3359375, "learning_rate": 0.00034137026608453973, "loss": 4.9702, "mean_token_accuracy": 0.21833188235759735, "num_tokens": 93818361.0, "step": 45205 }, { "entropy": 5.686879348754883, "epoch": 4.1010522496371555, "grad_norm": 1.25, "learning_rate": 0.0003413393487179655, "loss": 4.8672, "mean_token_accuracy": 0.23343277275562285, "num_tokens": 93828988.0, "step": 45210 }, { "entropy": 5.71076135635376, "epoch": 4.10150580551524, "grad_norm": 1.21875, "learning_rate": 0.0003413084299794767, "loss": 4.9333, "mean_token_accuracy": 0.21829482316970825, "num_tokens": 93839350.0, "step": 45215 }, { "entropy": 5.649133825302124, "epoch": 4.101959361393324, "grad_norm": 1.2734375, "learning_rate": 0.00034127750986971255, "loss": 4.8254, "mean_token_accuracy": 0.22525520175695418, "num_tokens": 93849939.0, "step": 45220 }, { "entropy": 5.634019613265991, "epoch": 4.1024129172714074, "grad_norm": 1.25, "learning_rate": 0.0003412465883893126, "loss": 4.8816, "mean_token_accuracy": 0.22501737475395203, "num_tokens": 93861278.0, "step": 45225 }, { "entropy": 5.656541252136231, "epoch": 4.102866473149492, "grad_norm": 1.21875, "learning_rate": 0.0003412156655389164, "loss": 4.9016, "mean_token_accuracy": 0.22136138528585433, "num_tokens": 93871693.0, "step": 45230 }, { "entropy": 5.619652318954468, "epoch": 4.103320029027576, "grad_norm": 1.2578125, "learning_rate": 0.0003411847413191633, "loss": 4.8714, "mean_token_accuracy": 0.22605828195810318, "num_tokens": 93883098.0, "step": 45235 }, { "entropy": 5.5858306884765625, "epoch": 4.10377358490566, "grad_norm": 1.2421875, "learning_rate": 0.00034115381573069297, "loss": 4.7786, "mean_token_accuracy": 0.22957106977701186, "num_tokens": 93893347.0, "step": 45240 }, { "entropy": 5.666557168960571, "epoch": 4.1042271407837445, "grad_norm": 1.28125, "learning_rate": 0.00034112288877414485, "loss": 4.9143, "mean_token_accuracy": 0.2185812160372734, "num_tokens": 93903964.0, "step": 45245 }, { "entropy": 5.638802194595337, "epoch": 4.104680696661829, "grad_norm": 1.3203125, "learning_rate": 0.0003410919604501585, "loss": 4.8894, "mean_token_accuracy": 0.2264538064599037, "num_tokens": 93914526.0, "step": 45250 }, { "entropy": 5.680412769317627, "epoch": 4.105134252539913, "grad_norm": 1.515625, "learning_rate": 0.0003410610307593735, "loss": 4.9528, "mean_token_accuracy": 0.22640000581741332, "num_tokens": 93924430.0, "step": 45255 }, { "entropy": 5.664857053756714, "epoch": 4.105587808417997, "grad_norm": 1.3515625, "learning_rate": 0.0003410300997024297, "loss": 4.8457, "mean_token_accuracy": 0.2309491828083992, "num_tokens": 93935150.0, "step": 45260 }, { "entropy": 5.577393102645874, "epoch": 4.106041364296082, "grad_norm": 1.4453125, "learning_rate": 0.0003409991672799665, "loss": 4.8122, "mean_token_accuracy": 0.23433299362659454, "num_tokens": 93944496.0, "step": 45265 }, { "entropy": 5.626067447662353, "epoch": 4.106494920174166, "grad_norm": 1.3203125, "learning_rate": 0.00034096823349262376, "loss": 4.8876, "mean_token_accuracy": 0.21984762996435164, "num_tokens": 93955745.0, "step": 45270 }, { "entropy": 5.588831377029419, "epoch": 4.106948476052249, "grad_norm": 1.2421875, "learning_rate": 0.0003409372983410411, "loss": 4.7869, "mean_token_accuracy": 0.22538850903511048, "num_tokens": 93965930.0, "step": 45275 }, { "entropy": 5.58941764831543, "epoch": 4.1074020319303335, "grad_norm": 1.3203125, "learning_rate": 0.0003409063618258583, "loss": 4.7725, "mean_token_accuracy": 0.23182172179222107, "num_tokens": 93976435.0, "step": 45280 }, { "entropy": 5.490685892105103, "epoch": 4.107855587808418, "grad_norm": 1.28125, "learning_rate": 0.00034087542394771524, "loss": 4.7205, "mean_token_accuracy": 0.23362548649311066, "num_tokens": 93987294.0, "step": 45285 }, { "entropy": 5.602276277542114, "epoch": 4.108309143686502, "grad_norm": 1.421875, "learning_rate": 0.00034084448470725147, "loss": 4.8624, "mean_token_accuracy": 0.22531571686267854, "num_tokens": 93997177.0, "step": 45290 }, { "entropy": 5.717010641098023, "epoch": 4.108762699564586, "grad_norm": 1.34375, "learning_rate": 0.0003408135441051071, "loss": 4.9393, "mean_token_accuracy": 0.21590640246868134, "num_tokens": 94007663.0, "step": 45295 }, { "entropy": 5.642841053009033, "epoch": 4.1092162554426706, "grad_norm": 1.34375, "learning_rate": 0.0003407826021419218, "loss": 4.7962, "mean_token_accuracy": 0.22395060509443282, "num_tokens": 94016899.0, "step": 45300 }, { "entropy": 5.6121316909790036, "epoch": 4.109669811320755, "grad_norm": 1.3515625, "learning_rate": 0.0003407516588183356, "loss": 4.9065, "mean_token_accuracy": 0.2247838243842125, "num_tokens": 94027696.0, "step": 45305 }, { "entropy": 5.559666490554809, "epoch": 4.110123367198839, "grad_norm": 1.2421875, "learning_rate": 0.0003407207141349882, "loss": 4.8617, "mean_token_accuracy": 0.22182020545005798, "num_tokens": 94038075.0, "step": 45310 }, { "entropy": 5.650737190246582, "epoch": 4.110576923076923, "grad_norm": 1.3359375, "learning_rate": 0.0003406897680925199, "loss": 4.8893, "mean_token_accuracy": 0.21868476420640945, "num_tokens": 94049082.0, "step": 45315 }, { "entropy": 5.63407564163208, "epoch": 4.111030478955008, "grad_norm": 1.3203125, "learning_rate": 0.00034065882069157023, "loss": 4.8827, "mean_token_accuracy": 0.21910038143396376, "num_tokens": 94060367.0, "step": 45320 }, { "entropy": 5.593263769149781, "epoch": 4.111484034833092, "grad_norm": 1.2265625, "learning_rate": 0.00034062787193277954, "loss": 4.8198, "mean_token_accuracy": 0.22931315004825592, "num_tokens": 94069415.0, "step": 45325 }, { "entropy": 5.646347761154175, "epoch": 4.111937590711175, "grad_norm": 1.2265625, "learning_rate": 0.00034059692181678775, "loss": 4.8752, "mean_token_accuracy": 0.21984780877828597, "num_tokens": 94079047.0, "step": 45330 }, { "entropy": 5.586153554916382, "epoch": 4.1123911465892595, "grad_norm": 1.2734375, "learning_rate": 0.00034056597034423484, "loss": 4.8025, "mean_token_accuracy": 0.23010508567094803, "num_tokens": 94089631.0, "step": 45335 }, { "entropy": 5.592344141006469, "epoch": 4.112844702467344, "grad_norm": 1.3046875, "learning_rate": 0.00034053501751576097, "loss": 4.8093, "mean_token_accuracy": 0.23061895370483398, "num_tokens": 94099265.0, "step": 45340 }, { "entropy": 5.5652707576751705, "epoch": 4.113298258345428, "grad_norm": 1.2421875, "learning_rate": 0.0003405040633320063, "loss": 4.8397, "mean_token_accuracy": 0.21754233986139299, "num_tokens": 94109673.0, "step": 45345 }, { "entropy": 5.582605218887329, "epoch": 4.113751814223512, "grad_norm": 1.2734375, "learning_rate": 0.0003404731077936108, "loss": 4.7602, "mean_token_accuracy": 0.23436962068080902, "num_tokens": 94120004.0, "step": 45350 }, { "entropy": 5.579771518707275, "epoch": 4.114205370101597, "grad_norm": 1.3515625, "learning_rate": 0.0003404421509012148, "loss": 4.8614, "mean_token_accuracy": 0.22182814478874208, "num_tokens": 94129935.0, "step": 45355 }, { "entropy": 5.639489364624024, "epoch": 4.114658925979681, "grad_norm": 1.4453125, "learning_rate": 0.00034041119265545847, "loss": 4.8941, "mean_token_accuracy": 0.22056747674942018, "num_tokens": 94139035.0, "step": 45360 }, { "entropy": 5.640705394744873, "epoch": 4.115112481857765, "grad_norm": 1.34375, "learning_rate": 0.00034038023305698196, "loss": 4.8299, "mean_token_accuracy": 0.222282837331295, "num_tokens": 94149281.0, "step": 45365 }, { "entropy": 5.585346937179565, "epoch": 4.115566037735849, "grad_norm": 1.296875, "learning_rate": 0.0003403492721064256, "loss": 4.841, "mean_token_accuracy": 0.2291246846318245, "num_tokens": 94160455.0, "step": 45370 }, { "entropy": 5.635524654388428, "epoch": 4.116019593613934, "grad_norm": 1.375, "learning_rate": 0.00034031830980442955, "loss": 4.8853, "mean_token_accuracy": 0.22047477215528488, "num_tokens": 94170334.0, "step": 45375 }, { "entropy": 5.588205337524414, "epoch": 4.116473149492017, "grad_norm": 1.296875, "learning_rate": 0.00034028734615163436, "loss": 4.8022, "mean_token_accuracy": 0.22666919082403184, "num_tokens": 94181055.0, "step": 45380 }, { "entropy": 5.61060848236084, "epoch": 4.116926705370101, "grad_norm": 1.3828125, "learning_rate": 0.0003402563811486802, "loss": 4.8168, "mean_token_accuracy": 0.23083567917346953, "num_tokens": 94191182.0, "step": 45385 }, { "entropy": 5.630852937698364, "epoch": 4.117380261248186, "grad_norm": 1.2890625, "learning_rate": 0.0003402254147962073, "loss": 4.892, "mean_token_accuracy": 0.2232121467590332, "num_tokens": 94201229.0, "step": 45390 }, { "entropy": 5.5671977519989015, "epoch": 4.11783381712627, "grad_norm": 1.3125, "learning_rate": 0.0003401944470948563, "loss": 4.8266, "mean_token_accuracy": 0.22683941274881364, "num_tokens": 94210956.0, "step": 45395 }, { "entropy": 5.615626382827759, "epoch": 4.118287373004354, "grad_norm": 1.2890625, "learning_rate": 0.00034016347804526753, "loss": 4.8915, "mean_token_accuracy": 0.21808965504169464, "num_tokens": 94220740.0, "step": 45400 }, { "entropy": 5.545680952072144, "epoch": 4.118740928882438, "grad_norm": 1.125, "learning_rate": 0.00034013250764808133, "loss": 4.7386, "mean_token_accuracy": 0.24268535226583482, "num_tokens": 94231497.0, "step": 45405 }, { "entropy": 5.6001890182495115, "epoch": 4.119194484760523, "grad_norm": 1.421875, "learning_rate": 0.0003401015359039384, "loss": 4.8733, "mean_token_accuracy": 0.22684278935194016, "num_tokens": 94240492.0, "step": 45410 }, { "entropy": 5.573484802246094, "epoch": 4.119648040638607, "grad_norm": 1.296875, "learning_rate": 0.0003400705628134791, "loss": 4.8168, "mean_token_accuracy": 0.23307552188634872, "num_tokens": 94251586.0, "step": 45415 }, { "entropy": 5.596332550048828, "epoch": 4.120101596516691, "grad_norm": 1.3359375, "learning_rate": 0.000340039588377344, "loss": 4.8503, "mean_token_accuracy": 0.22828202247619628, "num_tokens": 94261635.0, "step": 45420 }, { "entropy": 5.654912996292114, "epoch": 4.120555152394775, "grad_norm": 1.421875, "learning_rate": 0.0003400086125961735, "loss": 4.8793, "mean_token_accuracy": 0.2236225724220276, "num_tokens": 94269881.0, "step": 45425 }, { "entropy": 5.603367567062378, "epoch": 4.121008708272859, "grad_norm": 1.484375, "learning_rate": 0.00033997763547060847, "loss": 4.7995, "mean_token_accuracy": 0.22961757332086563, "num_tokens": 94279412.0, "step": 45430 }, { "entropy": 5.591487407684326, "epoch": 4.121462264150943, "grad_norm": 1.265625, "learning_rate": 0.0003399466570012893, "loss": 4.8872, "mean_token_accuracy": 0.22344161719083785, "num_tokens": 94290157.0, "step": 45435 }, { "entropy": 5.644675588607788, "epoch": 4.121915820029027, "grad_norm": 1.421875, "learning_rate": 0.00033991567718885674, "loss": 4.8805, "mean_token_accuracy": 0.22159571647644044, "num_tokens": 94299693.0, "step": 45440 }, { "entropy": 5.718258047103882, "epoch": 4.122369375907112, "grad_norm": 1.296875, "learning_rate": 0.0003398846960339515, "loss": 4.9888, "mean_token_accuracy": 0.21719103902578354, "num_tokens": 94310245.0, "step": 45445 }, { "entropy": 5.635201644897461, "epoch": 4.122822931785196, "grad_norm": 1.2109375, "learning_rate": 0.0003398537135372141, "loss": 4.8571, "mean_token_accuracy": 0.22374897450208664, "num_tokens": 94321190.0, "step": 45450 }, { "entropy": 5.662248420715332, "epoch": 4.12327648766328, "grad_norm": 1.40625, "learning_rate": 0.0003398227296992854, "loss": 4.9142, "mean_token_accuracy": 0.22854887694120407, "num_tokens": 94330273.0, "step": 45455 }, { "entropy": 5.691571760177612, "epoch": 4.123730043541364, "grad_norm": 1.265625, "learning_rate": 0.00033979174452080616, "loss": 4.9643, "mean_token_accuracy": 0.214274799823761, "num_tokens": 94341097.0, "step": 45460 }, { "entropy": 5.617294502258301, "epoch": 4.124183599419449, "grad_norm": 1.25, "learning_rate": 0.0003397607580024171, "loss": 4.8362, "mean_token_accuracy": 0.22768158465623856, "num_tokens": 94352329.0, "step": 45465 }, { "entropy": 5.60767970085144, "epoch": 4.124637155297533, "grad_norm": 1.2265625, "learning_rate": 0.0003397297701447591, "loss": 4.8171, "mean_token_accuracy": 0.2288493424654007, "num_tokens": 94362551.0, "step": 45470 }, { "entropy": 5.612308597564697, "epoch": 4.125090711175617, "grad_norm": 1.3515625, "learning_rate": 0.000339698780948473, "loss": 4.9024, "mean_token_accuracy": 0.2220309406518936, "num_tokens": 94372405.0, "step": 45475 }, { "entropy": 5.639502143859863, "epoch": 4.125544267053701, "grad_norm": 1.265625, "learning_rate": 0.0003396677904141995, "loss": 4.8262, "mean_token_accuracy": 0.23347653299570084, "num_tokens": 94382347.0, "step": 45480 }, { "entropy": 5.585342025756836, "epoch": 4.125997822931785, "grad_norm": 1.2421875, "learning_rate": 0.00033963679854257965, "loss": 4.8715, "mean_token_accuracy": 0.22623097896575928, "num_tokens": 94393428.0, "step": 45485 }, { "entropy": 5.619420003890991, "epoch": 4.126451378809869, "grad_norm": 1.3125, "learning_rate": 0.0003396058053342544, "loss": 4.8741, "mean_token_accuracy": 0.23079249262809753, "num_tokens": 94403941.0, "step": 45490 }, { "entropy": 5.626084327697754, "epoch": 4.126904934687953, "grad_norm": 1.28125, "learning_rate": 0.00033957481078986465, "loss": 4.8628, "mean_token_accuracy": 0.2249835506081581, "num_tokens": 94414206.0, "step": 45495 }, { "entropy": 5.637312936782837, "epoch": 4.127358490566038, "grad_norm": 1.3671875, "learning_rate": 0.00033954381491005126, "loss": 4.842, "mean_token_accuracy": 0.23241206705570222, "num_tokens": 94424481.0, "step": 45500 }, { "entropy": 5.599806642532348, "epoch": 4.127812046444122, "grad_norm": 1.234375, "learning_rate": 0.0003395128176954554, "loss": 4.8179, "mean_token_accuracy": 0.23077050000429153, "num_tokens": 94434714.0, "step": 45505 }, { "entropy": 5.646073293685913, "epoch": 4.128265602322206, "grad_norm": 1.3515625, "learning_rate": 0.000339481819146718, "loss": 4.9024, "mean_token_accuracy": 0.22023053616285324, "num_tokens": 94445267.0, "step": 45510 }, { "entropy": 5.662341642379761, "epoch": 4.1287191582002905, "grad_norm": 1.3671875, "learning_rate": 0.00033945081926448013, "loss": 4.8633, "mean_token_accuracy": 0.2238749921321869, "num_tokens": 94455724.0, "step": 45515 }, { "entropy": 5.65594630241394, "epoch": 4.129172714078375, "grad_norm": 1.2890625, "learning_rate": 0.00033941981804938294, "loss": 4.922, "mean_token_accuracy": 0.21989777833223342, "num_tokens": 94466655.0, "step": 45520 }, { "entropy": 5.571654033660889, "epoch": 4.129626269956459, "grad_norm": 1.3046875, "learning_rate": 0.00033938881550206744, "loss": 4.8064, "mean_token_accuracy": 0.23060028553009032, "num_tokens": 94477699.0, "step": 45525 }, { "entropy": 5.639128065109253, "epoch": 4.130079825834542, "grad_norm": 1.34375, "learning_rate": 0.00033935781162317485, "loss": 4.8531, "mean_token_accuracy": 0.22494232058525085, "num_tokens": 94487639.0, "step": 45530 }, { "entropy": 5.742417192459106, "epoch": 4.130533381712627, "grad_norm": 1.3046875, "learning_rate": 0.00033932680641334635, "loss": 5.0012, "mean_token_accuracy": 0.21176039427518845, "num_tokens": 94498687.0, "step": 45535 }, { "entropy": 5.652783441543579, "epoch": 4.130986937590711, "grad_norm": 1.3046875, "learning_rate": 0.0003392957998732231, "loss": 4.8257, "mean_token_accuracy": 0.22805264890193938, "num_tokens": 94508706.0, "step": 45540 }, { "entropy": 5.5647481918334964, "epoch": 4.131440493468795, "grad_norm": 1.3359375, "learning_rate": 0.00033926479200344626, "loss": 4.7688, "mean_token_accuracy": 0.23213642388582229, "num_tokens": 94517246.0, "step": 45545 }, { "entropy": 5.564794063568115, "epoch": 4.131894049346879, "grad_norm": 1.21875, "learning_rate": 0.0003392337828046572, "loss": 4.7715, "mean_token_accuracy": 0.23055853545665742, "num_tokens": 94527956.0, "step": 45550 }, { "entropy": 5.643964004516602, "epoch": 4.132347605224964, "grad_norm": 1.3203125, "learning_rate": 0.0003392027722774971, "loss": 4.9285, "mean_token_accuracy": 0.21730686128139495, "num_tokens": 94539101.0, "step": 45555 }, { "entropy": 5.575935745239258, "epoch": 4.132801161103048, "grad_norm": 1.3203125, "learning_rate": 0.00033917176042260735, "loss": 4.8055, "mean_token_accuracy": 0.2231568768620491, "num_tokens": 94549597.0, "step": 45560 }, { "entropy": 5.658811426162719, "epoch": 4.133254716981132, "grad_norm": 1.3359375, "learning_rate": 0.0003391407472406292, "loss": 4.9242, "mean_token_accuracy": 0.22433864921331406, "num_tokens": 94559911.0, "step": 45565 }, { "entropy": 5.580729246139526, "epoch": 4.1337082728592165, "grad_norm": 1.3046875, "learning_rate": 0.00033910973273220416, "loss": 4.794, "mean_token_accuracy": 0.22668695896863938, "num_tokens": 94569396.0, "step": 45570 }, { "entropy": 5.595262908935547, "epoch": 4.134161828737301, "grad_norm": 1.4296875, "learning_rate": 0.00033907871689797337, "loss": 4.8972, "mean_token_accuracy": 0.23455162942409516, "num_tokens": 94579817.0, "step": 45575 }, { "entropy": 5.528309059143067, "epoch": 4.134615384615385, "grad_norm": 1.359375, "learning_rate": 0.0003390476997385785, "loss": 4.8145, "mean_token_accuracy": 0.22697588801383972, "num_tokens": 94590398.0, "step": 45580 }, { "entropy": 5.582088613510132, "epoch": 4.135068940493468, "grad_norm": 1.40625, "learning_rate": 0.0003390166812546608, "loss": 4.8406, "mean_token_accuracy": 0.2227940618991852, "num_tokens": 94600528.0, "step": 45585 }, { "entropy": 5.622423362731934, "epoch": 4.135522496371553, "grad_norm": 1.25, "learning_rate": 0.00033898566144686184, "loss": 4.8677, "mean_token_accuracy": 0.22018461376428605, "num_tokens": 94611107.0, "step": 45590 }, { "entropy": 5.671023368835449, "epoch": 4.135976052249637, "grad_norm": 1.28125, "learning_rate": 0.0003389546403158231, "loss": 4.9198, "mean_token_accuracy": 0.21760229468345643, "num_tokens": 94620932.0, "step": 45595 }, { "entropy": 5.670893430709839, "epoch": 4.136429608127721, "grad_norm": 1.3125, "learning_rate": 0.00033892361786218604, "loss": 4.937, "mean_token_accuracy": 0.21279033422470092, "num_tokens": 94630476.0, "step": 45600 }, { "entropy": 5.578131294250488, "epoch": 4.1368831640058055, "grad_norm": 1.234375, "learning_rate": 0.0003388925940865924, "loss": 4.8534, "mean_token_accuracy": 0.2264867141842842, "num_tokens": 94641487.0, "step": 45605 }, { "entropy": 5.642728519439697, "epoch": 4.13733671988389, "grad_norm": 1.2421875, "learning_rate": 0.00033886156898968353, "loss": 4.7656, "mean_token_accuracy": 0.2355020150542259, "num_tokens": 94651668.0, "step": 45610 }, { "entropy": 5.608333396911621, "epoch": 4.137790275761974, "grad_norm": 1.34375, "learning_rate": 0.00033883054257210116, "loss": 4.8836, "mean_token_accuracy": 0.21826896965503692, "num_tokens": 94661218.0, "step": 45615 }, { "entropy": 5.54527096748352, "epoch": 4.138243831640058, "grad_norm": 1.265625, "learning_rate": 0.000338799514834487, "loss": 4.8159, "mean_token_accuracy": 0.2202413335442543, "num_tokens": 94672412.0, "step": 45620 }, { "entropy": 5.632928800582886, "epoch": 4.1386973875181425, "grad_norm": 1.2109375, "learning_rate": 0.0003387684857774824, "loss": 4.9152, "mean_token_accuracy": 0.21495541036128998, "num_tokens": 94683102.0, "step": 45625 }, { "entropy": 5.6283186912536625, "epoch": 4.139150943396227, "grad_norm": 1.328125, "learning_rate": 0.0003387374554017294, "loss": 4.8423, "mean_token_accuracy": 0.22799694091081618, "num_tokens": 94692869.0, "step": 45630 }, { "entropy": 5.622475051879883, "epoch": 4.13960449927431, "grad_norm": 1.375, "learning_rate": 0.00033870642370786966, "loss": 4.8067, "mean_token_accuracy": 0.22699427753686904, "num_tokens": 94702437.0, "step": 45635 }, { "entropy": 5.577946043014526, "epoch": 4.1400580551523944, "grad_norm": 1.3125, "learning_rate": 0.00033867539069654476, "loss": 4.8881, "mean_token_accuracy": 0.22075816243886948, "num_tokens": 94713130.0, "step": 45640 }, { "entropy": 5.660130596160888, "epoch": 4.140511611030479, "grad_norm": 1.375, "learning_rate": 0.00033864435636839647, "loss": 4.9643, "mean_token_accuracy": 0.2173692613840103, "num_tokens": 94723251.0, "step": 45645 }, { "entropy": 5.639151096343994, "epoch": 4.140965166908563, "grad_norm": 1.421875, "learning_rate": 0.0003386133207240668, "loss": 4.8597, "mean_token_accuracy": 0.22838103622198105, "num_tokens": 94733805.0, "step": 45650 }, { "entropy": 5.593966388702393, "epoch": 4.141418722786647, "grad_norm": 1.375, "learning_rate": 0.0003385822837641974, "loss": 4.7803, "mean_token_accuracy": 0.22447696328163147, "num_tokens": 94743654.0, "step": 45655 }, { "entropy": 5.562912321090698, "epoch": 4.1418722786647315, "grad_norm": 1.390625, "learning_rate": 0.00033855124548943025, "loss": 4.8225, "mean_token_accuracy": 0.22763589322566985, "num_tokens": 94754635.0, "step": 45660 }, { "entropy": 5.610265064239502, "epoch": 4.142325834542816, "grad_norm": 1.4765625, "learning_rate": 0.00033852020590040705, "loss": 4.8846, "mean_token_accuracy": 0.22455063164234162, "num_tokens": 94765371.0, "step": 45665 }, { "entropy": 5.573143053054809, "epoch": 4.1427793904209, "grad_norm": 1.3359375, "learning_rate": 0.0003384891649977698, "loss": 4.7858, "mean_token_accuracy": 0.23540292233228682, "num_tokens": 94775780.0, "step": 45670 }, { "entropy": 5.632145833969116, "epoch": 4.143232946298984, "grad_norm": 1.3359375, "learning_rate": 0.00033845812278216045, "loss": 4.9031, "mean_token_accuracy": 0.21835450679063798, "num_tokens": 94785345.0, "step": 45675 }, { "entropy": 5.563596296310425, "epoch": 4.143686502177069, "grad_norm": 1.21875, "learning_rate": 0.00033842707925422095, "loss": 4.8151, "mean_token_accuracy": 0.22559059262275696, "num_tokens": 94796059.0, "step": 45680 }, { "entropy": 5.601997995376587, "epoch": 4.144140058055152, "grad_norm": 1.265625, "learning_rate": 0.00033839603441459333, "loss": 4.8307, "mean_token_accuracy": 0.22807716727256774, "num_tokens": 94805867.0, "step": 45685 }, { "entropy": 5.57486138343811, "epoch": 4.144593613933236, "grad_norm": 1.171875, "learning_rate": 0.0003383649882639195, "loss": 4.8358, "mean_token_accuracy": 0.22382062673568726, "num_tokens": 94817172.0, "step": 45690 }, { "entropy": 5.598248434066773, "epoch": 4.1450471698113205, "grad_norm": 1.25, "learning_rate": 0.0003383339408028416, "loss": 4.8493, "mean_token_accuracy": 0.22410875409841538, "num_tokens": 94828748.0, "step": 45695 }, { "entropy": 5.608453464508057, "epoch": 4.145500725689405, "grad_norm": 1.2890625, "learning_rate": 0.0003383028920320017, "loss": 4.8452, "mean_token_accuracy": 0.2250341072678566, "num_tokens": 94838704.0, "step": 45700 }, { "entropy": 5.6524840831756595, "epoch": 4.145954281567489, "grad_norm": 1.25, "learning_rate": 0.00033827184195204174, "loss": 4.92, "mean_token_accuracy": 0.2193364068865776, "num_tokens": 94849555.0, "step": 45705 }, { "entropy": 5.66926383972168, "epoch": 4.146407837445573, "grad_norm": 1.1953125, "learning_rate": 0.0003382407905636041, "loss": 4.9306, "mean_token_accuracy": 0.2217804491519928, "num_tokens": 94862238.0, "step": 45710 }, { "entropy": 5.519079160690308, "epoch": 4.1468613933236576, "grad_norm": 1.40625, "learning_rate": 0.0003382097378673308, "loss": 4.7381, "mean_token_accuracy": 0.23946598172187805, "num_tokens": 94872960.0, "step": 45715 }, { "entropy": 5.5377778053283695, "epoch": 4.147314949201742, "grad_norm": 1.2265625, "learning_rate": 0.000338178683863864, "loss": 4.8245, "mean_token_accuracy": 0.22847038209438325, "num_tokens": 94883612.0, "step": 45720 }, { "entropy": 5.558489465713501, "epoch": 4.147768505079826, "grad_norm": 1.265625, "learning_rate": 0.0003381476285538458, "loss": 4.8092, "mean_token_accuracy": 0.23069373965263368, "num_tokens": 94893176.0, "step": 45725 }, { "entropy": 5.599456262588501, "epoch": 4.14822206095791, "grad_norm": 1.2109375, "learning_rate": 0.0003381165719379187, "loss": 4.7911, "mean_token_accuracy": 0.2260712653398514, "num_tokens": 94903860.0, "step": 45730 }, { "entropy": 5.585466527938843, "epoch": 4.148675616835995, "grad_norm": 1.2265625, "learning_rate": 0.0003380855140167247, "loss": 4.7905, "mean_token_accuracy": 0.23095814883708954, "num_tokens": 94915681.0, "step": 45735 }, { "entropy": 5.581074523925781, "epoch": 4.149129172714078, "grad_norm": 1.21875, "learning_rate": 0.0003380544547909061, "loss": 4.8418, "mean_token_accuracy": 0.22475317120552063, "num_tokens": 94927062.0, "step": 45740 }, { "entropy": 5.578788137435913, "epoch": 4.149582728592162, "grad_norm": 1.109375, "learning_rate": 0.0003380233942611055, "loss": 4.842, "mean_token_accuracy": 0.23134032934904097, "num_tokens": 94938838.0, "step": 45745 }, { "entropy": 5.543794631958008, "epoch": 4.1500362844702465, "grad_norm": 1.265625, "learning_rate": 0.000337992332427965, "loss": 4.7998, "mean_token_accuracy": 0.2270699843764305, "num_tokens": 94949678.0, "step": 45750 }, { "entropy": 5.620090818405151, "epoch": 4.150489840348331, "grad_norm": 1.359375, "learning_rate": 0.000337961269292127, "loss": 4.8957, "mean_token_accuracy": 0.22675600796937942, "num_tokens": 94960314.0, "step": 45755 }, { "entropy": 5.637551307678223, "epoch": 4.150943396226415, "grad_norm": 1.3984375, "learning_rate": 0.00033793020485423385, "loss": 4.8835, "mean_token_accuracy": 0.2249660849571228, "num_tokens": 94969831.0, "step": 45760 }, { "entropy": 5.611756801605225, "epoch": 4.151396952104499, "grad_norm": 1.21875, "learning_rate": 0.00033789913911492814, "loss": 4.8422, "mean_token_accuracy": 0.22016721814870835, "num_tokens": 94980046.0, "step": 45765 }, { "entropy": 5.5561370849609375, "epoch": 4.151850507982584, "grad_norm": 1.2578125, "learning_rate": 0.0003378680720748522, "loss": 4.8709, "mean_token_accuracy": 0.2225993365049362, "num_tokens": 94990850.0, "step": 45770 }, { "entropy": 5.640976905822754, "epoch": 4.152304063860668, "grad_norm": 1.3046875, "learning_rate": 0.0003378370037346484, "loss": 4.9026, "mean_token_accuracy": 0.218935127556324, "num_tokens": 95001658.0, "step": 45775 }, { "entropy": 5.609769248962403, "epoch": 4.152757619738752, "grad_norm": 1.4453125, "learning_rate": 0.00033780593409495936, "loss": 4.8185, "mean_token_accuracy": 0.22747478783130645, "num_tokens": 95011912.0, "step": 45780 }, { "entropy": 5.602326822280884, "epoch": 4.153211175616836, "grad_norm": 1.390625, "learning_rate": 0.0003377748631564276, "loss": 4.8285, "mean_token_accuracy": 0.22545932829380036, "num_tokens": 95021299.0, "step": 45785 }, { "entropy": 5.595681524276733, "epoch": 4.15366473149492, "grad_norm": 1.328125, "learning_rate": 0.00033774379091969583, "loss": 4.8461, "mean_token_accuracy": 0.23171577453613282, "num_tokens": 95031520.0, "step": 45790 }, { "entropy": 5.524148607254029, "epoch": 4.154118287373004, "grad_norm": 1.2734375, "learning_rate": 0.00033771271738540634, "loss": 4.7754, "mean_token_accuracy": 0.23335529267787933, "num_tokens": 95042127.0, "step": 45795 }, { "entropy": 5.603129100799561, "epoch": 4.154571843251088, "grad_norm": 1.3203125, "learning_rate": 0.00033768164255420184, "loss": 4.8357, "mean_token_accuracy": 0.22408168911933898, "num_tokens": 95052181.0, "step": 45800 }, { "entropy": 5.644991445541382, "epoch": 4.155025399129173, "grad_norm": 1.4609375, "learning_rate": 0.00033765056642672507, "loss": 4.8793, "mean_token_accuracy": 0.2261883482336998, "num_tokens": 95062583.0, "step": 45805 }, { "entropy": 5.634037876129151, "epoch": 4.155478955007257, "grad_norm": 1.2265625, "learning_rate": 0.00033761948900361857, "loss": 4.8718, "mean_token_accuracy": 0.2233712390065193, "num_tokens": 95073250.0, "step": 45810 }, { "entropy": 5.648438405990601, "epoch": 4.155932510885341, "grad_norm": 1.1953125, "learning_rate": 0.0003375884102855251, "loss": 4.8478, "mean_token_accuracy": 0.22480896413326262, "num_tokens": 95083544.0, "step": 45815 }, { "entropy": 5.569507360458374, "epoch": 4.156386066763425, "grad_norm": 1.3828125, "learning_rate": 0.00033755733027308746, "loss": 4.8458, "mean_token_accuracy": 0.23124369531869887, "num_tokens": 95093933.0, "step": 45820 }, { "entropy": 5.582110977172851, "epoch": 4.15683962264151, "grad_norm": 1.3671875, "learning_rate": 0.0003375262489669481, "loss": 4.8932, "mean_token_accuracy": 0.22808850556612015, "num_tokens": 95104468.0, "step": 45825 }, { "entropy": 5.671491861343384, "epoch": 4.157293178519594, "grad_norm": 1.3203125, "learning_rate": 0.00033749516636775014, "loss": 4.8697, "mean_token_accuracy": 0.2247892677783966, "num_tokens": 95114285.0, "step": 45830 }, { "entropy": 5.672903919219971, "epoch": 4.157746734397678, "grad_norm": 1.265625, "learning_rate": 0.00033746408247613616, "loss": 4.9055, "mean_token_accuracy": 0.22037472873926162, "num_tokens": 95123984.0, "step": 45835 }, { "entropy": 5.657049703598022, "epoch": 4.1582002902757615, "grad_norm": 1.2421875, "learning_rate": 0.000337432997292749, "loss": 4.9032, "mean_token_accuracy": 0.2229042574763298, "num_tokens": 95135466.0, "step": 45840 }, { "entropy": 5.560149383544922, "epoch": 4.158653846153846, "grad_norm": 1.3203125, "learning_rate": 0.0003374019108182315, "loss": 4.7636, "mean_token_accuracy": 0.22950555980205536, "num_tokens": 95145223.0, "step": 45845 }, { "entropy": 5.675199937820435, "epoch": 4.15910740203193, "grad_norm": 1.4296875, "learning_rate": 0.0003373708230532267, "loss": 4.8993, "mean_token_accuracy": 0.2283041924238205, "num_tokens": 95154916.0, "step": 45850 }, { "entropy": 5.594363594055176, "epoch": 4.159560957910014, "grad_norm": 1.390625, "learning_rate": 0.00033733973399837735, "loss": 4.7886, "mean_token_accuracy": 0.22393823862075807, "num_tokens": 95164717.0, "step": 45855 }, { "entropy": 5.685700798034668, "epoch": 4.160014513788099, "grad_norm": 1.3046875, "learning_rate": 0.0003373086436543263, "loss": 4.8918, "mean_token_accuracy": 0.21790481805801393, "num_tokens": 95175544.0, "step": 45860 }, { "entropy": 5.59934253692627, "epoch": 4.160468069666183, "grad_norm": 1.1953125, "learning_rate": 0.0003372775520217168, "loss": 4.916, "mean_token_accuracy": 0.2247701659798622, "num_tokens": 95185997.0, "step": 45865 }, { "entropy": 5.584728765487671, "epoch": 4.160921625544267, "grad_norm": 1.21875, "learning_rate": 0.0003372464591011916, "loss": 4.858, "mean_token_accuracy": 0.21790525317192078, "num_tokens": 95196967.0, "step": 45870 }, { "entropy": 5.612652730941773, "epoch": 4.161375181422351, "grad_norm": 1.234375, "learning_rate": 0.00033721536489339374, "loss": 4.7876, "mean_token_accuracy": 0.2336038902401924, "num_tokens": 95206788.0, "step": 45875 }, { "entropy": 5.697801208496093, "epoch": 4.161828737300436, "grad_norm": 1.2578125, "learning_rate": 0.00033718426939896627, "loss": 4.8865, "mean_token_accuracy": 0.2253885641694069, "num_tokens": 95217806.0, "step": 45880 }, { "entropy": 5.598578548431396, "epoch": 4.16228229317852, "grad_norm": 1.2890625, "learning_rate": 0.00033715317261855235, "loss": 4.8075, "mean_token_accuracy": 0.23400939255952835, "num_tokens": 95228311.0, "step": 45885 }, { "entropy": 5.5558905601501465, "epoch": 4.162735849056604, "grad_norm": 1.2578125, "learning_rate": 0.00033712207455279485, "loss": 4.828, "mean_token_accuracy": 0.22068298906087874, "num_tokens": 95238872.0, "step": 45890 }, { "entropy": 5.541109371185303, "epoch": 4.163189404934688, "grad_norm": 1.3359375, "learning_rate": 0.0003370909752023371, "loss": 4.7887, "mean_token_accuracy": 0.24139557629823685, "num_tokens": 95248575.0, "step": 45895 }, { "entropy": 5.6295863628387455, "epoch": 4.163642960812772, "grad_norm": 1.3046875, "learning_rate": 0.0003370598745678221, "loss": 4.875, "mean_token_accuracy": 0.22322934120893478, "num_tokens": 95259323.0, "step": 45900 }, { "entropy": 5.64022126197815, "epoch": 4.164096516690856, "grad_norm": 1.2578125, "learning_rate": 0.0003370287726498932, "loss": 4.8171, "mean_token_accuracy": 0.22574844658374787, "num_tokens": 95270018.0, "step": 45905 }, { "entropy": 5.616472387313843, "epoch": 4.16455007256894, "grad_norm": 1.3203125, "learning_rate": 0.00033699766944919325, "loss": 4.8156, "mean_token_accuracy": 0.22607270181179046, "num_tokens": 95279783.0, "step": 45910 }, { "entropy": 5.637238597869873, "epoch": 4.165003628447025, "grad_norm": 1.1953125, "learning_rate": 0.00033696656496636586, "loss": 4.8663, "mean_token_accuracy": 0.22588370740413666, "num_tokens": 95291200.0, "step": 45915 }, { "entropy": 5.637813568115234, "epoch": 4.165457184325109, "grad_norm": 1.3984375, "learning_rate": 0.00033693545920205416, "loss": 4.9013, "mean_token_accuracy": 0.21645888388156892, "num_tokens": 95301641.0, "step": 45920 }, { "entropy": 5.558434963226318, "epoch": 4.165910740203193, "grad_norm": 1.3203125, "learning_rate": 0.00033690435215690125, "loss": 4.7665, "mean_token_accuracy": 0.22870970368385315, "num_tokens": 95312636.0, "step": 45925 }, { "entropy": 5.554112434387207, "epoch": 4.1663642960812775, "grad_norm": 1.359375, "learning_rate": 0.0003368732438315506, "loss": 4.8131, "mean_token_accuracy": 0.23078914880752563, "num_tokens": 95322168.0, "step": 45930 }, { "entropy": 5.543451738357544, "epoch": 4.166817851959362, "grad_norm": 1.2109375, "learning_rate": 0.00033684213422664554, "loss": 4.79, "mean_token_accuracy": 0.22979618608951569, "num_tokens": 95333162.0, "step": 45935 }, { "entropy": 5.5841187000274655, "epoch": 4.167271407837446, "grad_norm": 1.3203125, "learning_rate": 0.0003368110233428294, "loss": 4.8167, "mean_token_accuracy": 0.22716125398874282, "num_tokens": 95343806.0, "step": 45940 }, { "entropy": 5.594476699829102, "epoch": 4.167724963715529, "grad_norm": 1.25, "learning_rate": 0.00033677991118074554, "loss": 4.7724, "mean_token_accuracy": 0.23300998508930207, "num_tokens": 95353906.0, "step": 45945 }, { "entropy": 5.688653516769409, "epoch": 4.168178519593614, "grad_norm": 1.484375, "learning_rate": 0.0003367487977410373, "loss": 4.9607, "mean_token_accuracy": 0.2176999792456627, "num_tokens": 95363801.0, "step": 45950 }, { "entropy": 5.643514347076416, "epoch": 4.168632075471698, "grad_norm": 1.3203125, "learning_rate": 0.00033671768302434823, "loss": 4.8635, "mean_token_accuracy": 0.2222139984369278, "num_tokens": 95375012.0, "step": 45955 }, { "entropy": 5.641274452209473, "epoch": 4.169085631349782, "grad_norm": 1.3046875, "learning_rate": 0.00033668656703132174, "loss": 4.8736, "mean_token_accuracy": 0.22985648214817048, "num_tokens": 95386429.0, "step": 45960 }, { "entropy": 5.576644325256348, "epoch": 4.169539187227866, "grad_norm": 1.234375, "learning_rate": 0.0003366554497626014, "loss": 4.8455, "mean_token_accuracy": 0.2208377465605736, "num_tokens": 95396534.0, "step": 45965 }, { "entropy": 5.609455728530884, "epoch": 4.169992743105951, "grad_norm": 1.2734375, "learning_rate": 0.00033662433121883057, "loss": 4.8672, "mean_token_accuracy": 0.2271244779229164, "num_tokens": 95406621.0, "step": 45970 }, { "entropy": 5.612331533432007, "epoch": 4.170446298984035, "grad_norm": 1.3125, "learning_rate": 0.0003365932114006528, "loss": 4.8584, "mean_token_accuracy": 0.22392307072877884, "num_tokens": 95417587.0, "step": 45975 }, { "entropy": 5.531369972229004, "epoch": 4.170899854862119, "grad_norm": 1.1640625, "learning_rate": 0.00033656209030871184, "loss": 4.7398, "mean_token_accuracy": 0.23544736802577973, "num_tokens": 95428288.0, "step": 45980 }, { "entropy": 5.607578229904175, "epoch": 4.1713534107402035, "grad_norm": 1.3359375, "learning_rate": 0.00033653096794365115, "loss": 4.8306, "mean_token_accuracy": 0.22697918564081193, "num_tokens": 95438093.0, "step": 45985 }, { "entropy": 5.532621574401856, "epoch": 4.171806966618288, "grad_norm": 1.296875, "learning_rate": 0.00033649984430611437, "loss": 4.765, "mean_token_accuracy": 0.23091351389884948, "num_tokens": 95448397.0, "step": 45990 }, { "entropy": 5.677552223205566, "epoch": 4.172260522496371, "grad_norm": 1.25, "learning_rate": 0.00033646871939674506, "loss": 4.9784, "mean_token_accuracy": 0.21065406799316405, "num_tokens": 95459533.0, "step": 45995 }, { "entropy": 5.616369962692261, "epoch": 4.172714078374455, "grad_norm": 1.3828125, "learning_rate": 0.000336437593216187, "loss": 4.8815, "mean_token_accuracy": 0.2241342380642891, "num_tokens": 95469507.0, "step": 46000 }, { "entropy": 5.700064706802368, "epoch": 4.17316763425254, "grad_norm": 1.2421875, "learning_rate": 0.0003364064657650839, "loss": 4.9062, "mean_token_accuracy": 0.22164378464221954, "num_tokens": 95479742.0, "step": 46005 }, { "entropy": 5.546701383590698, "epoch": 4.173621190130624, "grad_norm": 1.34375, "learning_rate": 0.00033637533704407936, "loss": 4.7883, "mean_token_accuracy": 0.23581935614347457, "num_tokens": 95489751.0, "step": 46010 }, { "entropy": 5.65342082977295, "epoch": 4.174074746008708, "grad_norm": 1.3046875, "learning_rate": 0.0003363442070538173, "loss": 4.8951, "mean_token_accuracy": 0.2164279818534851, "num_tokens": 95500580.0, "step": 46015 }, { "entropy": 5.684735584259033, "epoch": 4.1745283018867925, "grad_norm": 1.3046875, "learning_rate": 0.00033631307579494137, "loss": 4.9385, "mean_token_accuracy": 0.22643557339906692, "num_tokens": 95511018.0, "step": 46020 }, { "entropy": 5.660071516036988, "epoch": 4.174981857764877, "grad_norm": 1.3359375, "learning_rate": 0.00033628194326809543, "loss": 4.8462, "mean_token_accuracy": 0.22902738004922868, "num_tokens": 95521220.0, "step": 46025 }, { "entropy": 5.595278072357178, "epoch": 4.175435413642961, "grad_norm": 1.2421875, "learning_rate": 0.00033625080947392324, "loss": 4.8485, "mean_token_accuracy": 0.221150678396225, "num_tokens": 95531426.0, "step": 46030 }, { "entropy": 5.6453203678131105, "epoch": 4.175888969521045, "grad_norm": 1.28125, "learning_rate": 0.0003362196744130687, "loss": 4.8696, "mean_token_accuracy": 0.23197310864925386, "num_tokens": 95542698.0, "step": 46035 }, { "entropy": 5.65197491645813, "epoch": 4.1763425253991295, "grad_norm": 1.2734375, "learning_rate": 0.00033618853808617573, "loss": 4.7847, "mean_token_accuracy": 0.23697241991758347, "num_tokens": 95553545.0, "step": 46040 }, { "entropy": 5.683568334579467, "epoch": 4.176796081277214, "grad_norm": 1.34375, "learning_rate": 0.0003361574004938882, "loss": 4.8853, "mean_token_accuracy": 0.22699520736932755, "num_tokens": 95564452.0, "step": 46045 }, { "entropy": 5.603371286392212, "epoch": 4.177249637155297, "grad_norm": 1.2421875, "learning_rate": 0.00033612626163685, "loss": 4.8784, "mean_token_accuracy": 0.2335369810461998, "num_tokens": 95574756.0, "step": 46050 }, { "entropy": 5.707676362991333, "epoch": 4.1777031930333814, "grad_norm": 1.1796875, "learning_rate": 0.00033609512151570517, "loss": 4.9553, "mean_token_accuracy": 0.2178369402885437, "num_tokens": 95585147.0, "step": 46055 }, { "entropy": 5.664637660980224, "epoch": 4.178156748911466, "grad_norm": 1.328125, "learning_rate": 0.00033606398013109765, "loss": 4.9486, "mean_token_accuracy": 0.22499686926603318, "num_tokens": 95596025.0, "step": 46060 }, { "entropy": 5.605254125595093, "epoch": 4.17861030478955, "grad_norm": 1.234375, "learning_rate": 0.0003360328374836715, "loss": 4.8474, "mean_token_accuracy": 0.2207189157605171, "num_tokens": 95607191.0, "step": 46065 }, { "entropy": 5.6414680004119875, "epoch": 4.179063860667634, "grad_norm": 1.375, "learning_rate": 0.0003360016935740706, "loss": 4.8601, "mean_token_accuracy": 0.22180553376674653, "num_tokens": 95617256.0, "step": 46070 }, { "entropy": 5.650389909744263, "epoch": 4.1795174165457185, "grad_norm": 1.390625, "learning_rate": 0.00033597054840293927, "loss": 4.895, "mean_token_accuracy": 0.2214730605483055, "num_tokens": 95627638.0, "step": 46075 }, { "entropy": 5.617570304870606, "epoch": 4.179970972423803, "grad_norm": 1.2734375, "learning_rate": 0.0003359394019709214, "loss": 4.8009, "mean_token_accuracy": 0.23019987791776658, "num_tokens": 95637662.0, "step": 46080 }, { "entropy": 5.606051015853882, "epoch": 4.180424528301887, "grad_norm": 1.3203125, "learning_rate": 0.00033590825427866117, "loss": 4.8229, "mean_token_accuracy": 0.22204454690217973, "num_tokens": 95647505.0, "step": 46085 }, { "entropy": 5.584885215759277, "epoch": 4.180878084179971, "grad_norm": 1.3515625, "learning_rate": 0.0003358771053268027, "loss": 4.7797, "mean_token_accuracy": 0.21810621470212938, "num_tokens": 95657810.0, "step": 46090 }, { "entropy": 5.5727630138397215, "epoch": 4.181331640058056, "grad_norm": 1.3203125, "learning_rate": 0.00033584595511599024, "loss": 4.8052, "mean_token_accuracy": 0.2289726361632347, "num_tokens": 95667838.0, "step": 46095 }, { "entropy": 5.6028602600097654, "epoch": 4.181785195936139, "grad_norm": 1.234375, "learning_rate": 0.0003358148036468679, "loss": 4.8372, "mean_token_accuracy": 0.22938428670167924, "num_tokens": 95678497.0, "step": 46100 }, { "entropy": 5.565297842025757, "epoch": 4.182238751814223, "grad_norm": 1.375, "learning_rate": 0.00033578365092007986, "loss": 4.7651, "mean_token_accuracy": 0.22888371497392654, "num_tokens": 95688656.0, "step": 46105 }, { "entropy": 5.6484519958496096, "epoch": 4.1826923076923075, "grad_norm": 1.2890625, "learning_rate": 0.0003357524969362705, "loss": 4.9339, "mean_token_accuracy": 0.21997195184230806, "num_tokens": 95699156.0, "step": 46110 }, { "entropy": 5.636931991577148, "epoch": 4.183145863570392, "grad_norm": 1.2734375, "learning_rate": 0.00033572134169608395, "loss": 4.8628, "mean_token_accuracy": 0.23053984493017196, "num_tokens": 95709680.0, "step": 46115 }, { "entropy": 5.726464891433716, "epoch": 4.183599419448476, "grad_norm": 1.359375, "learning_rate": 0.00033569018520016465, "loss": 4.878, "mean_token_accuracy": 0.22551177442073822, "num_tokens": 95719142.0, "step": 46120 }, { "entropy": 5.669403219223023, "epoch": 4.18405297532656, "grad_norm": 1.21875, "learning_rate": 0.0003356590274491568, "loss": 4.9066, "mean_token_accuracy": 0.21749901920557022, "num_tokens": 95729415.0, "step": 46125 }, { "entropy": 5.560628461837768, "epoch": 4.1845065312046446, "grad_norm": 1.4140625, "learning_rate": 0.0003356278684437049, "loss": 4.8496, "mean_token_accuracy": 0.22188816219568253, "num_tokens": 95739775.0, "step": 46130 }, { "entropy": 5.631206464767456, "epoch": 4.184960087082729, "grad_norm": 1.21875, "learning_rate": 0.00033559670818445315, "loss": 4.9135, "mean_token_accuracy": 0.22157105952501296, "num_tokens": 95751540.0, "step": 46135 }, { "entropy": 5.723659801483154, "epoch": 4.185413642960813, "grad_norm": 1.3203125, "learning_rate": 0.000335565546672046, "loss": 5.0343, "mean_token_accuracy": 0.22000080496072769, "num_tokens": 95761885.0, "step": 46140 }, { "entropy": 5.688881492614746, "epoch": 4.185867198838897, "grad_norm": 1.1796875, "learning_rate": 0.000335534383907128, "loss": 4.8697, "mean_token_accuracy": 0.22621696889400483, "num_tokens": 95772284.0, "step": 46145 }, { "entropy": 5.615299892425537, "epoch": 4.186320754716981, "grad_norm": 1.1953125, "learning_rate": 0.0003355032198903434, "loss": 4.7933, "mean_token_accuracy": 0.22674741894006728, "num_tokens": 95783373.0, "step": 46150 }, { "entropy": 5.53031325340271, "epoch": 4.186774310595065, "grad_norm": 1.3671875, "learning_rate": 0.00033547205462233694, "loss": 4.7451, "mean_token_accuracy": 0.23516739308834075, "num_tokens": 95793226.0, "step": 46155 }, { "entropy": 5.478276348114013, "epoch": 4.187227866473149, "grad_norm": 1.2421875, "learning_rate": 0.00033544088810375287, "loss": 4.7657, "mean_token_accuracy": 0.22290200740098953, "num_tokens": 95803559.0, "step": 46160 }, { "entropy": 5.567489528656006, "epoch": 4.1876814223512335, "grad_norm": 1.2890625, "learning_rate": 0.0003354097203352358, "loss": 4.8381, "mean_token_accuracy": 0.2199566587805748, "num_tokens": 95814620.0, "step": 46165 }, { "entropy": 5.565248250961304, "epoch": 4.188134978229318, "grad_norm": 1.296875, "learning_rate": 0.0003353785513174305, "loss": 4.8271, "mean_token_accuracy": 0.23366139829158783, "num_tokens": 95825024.0, "step": 46170 }, { "entropy": 5.650697135925293, "epoch": 4.188588534107402, "grad_norm": 1.1953125, "learning_rate": 0.00033534738105098124, "loss": 4.8769, "mean_token_accuracy": 0.23154536187648772, "num_tokens": 95837373.0, "step": 46175 }, { "entropy": 5.651026916503906, "epoch": 4.189042089985486, "grad_norm": 1.3828125, "learning_rate": 0.00033531620953653276, "loss": 4.8613, "mean_token_accuracy": 0.2234511435031891, "num_tokens": 95846962.0, "step": 46180 }, { "entropy": 5.64197883605957, "epoch": 4.189495645863571, "grad_norm": 1.34375, "learning_rate": 0.0003352850367747297, "loss": 4.85, "mean_token_accuracy": 0.22786208838224412, "num_tokens": 95857492.0, "step": 46185 }, { "entropy": 5.584845352172851, "epoch": 4.189949201741655, "grad_norm": 1.265625, "learning_rate": 0.0003352538627662168, "loss": 4.7973, "mean_token_accuracy": 0.22742410004138947, "num_tokens": 95867903.0, "step": 46190 }, { "entropy": 5.680199432373047, "epoch": 4.190402757619739, "grad_norm": 1.234375, "learning_rate": 0.0003352226875116386, "loss": 4.9611, "mean_token_accuracy": 0.22232498824596406, "num_tokens": 95878720.0, "step": 46195 }, { "entropy": 5.628942489624023, "epoch": 4.1908563134978225, "grad_norm": 1.3203125, "learning_rate": 0.0003351915110116399, "loss": 4.8851, "mean_token_accuracy": 0.2179182857275009, "num_tokens": 95888406.0, "step": 46200 }, { "entropy": 5.619317293167114, "epoch": 4.191309869375907, "grad_norm": 1.3046875, "learning_rate": 0.00033516033326686537, "loss": 4.875, "mean_token_accuracy": 0.2120461568236351, "num_tokens": 95898431.0, "step": 46205 }, { "entropy": 5.645869255065918, "epoch": 4.191763425253991, "grad_norm": 1.328125, "learning_rate": 0.00033512915427795975, "loss": 4.8291, "mean_token_accuracy": 0.23380981236696244, "num_tokens": 95909089.0, "step": 46210 }, { "entropy": 5.5506126403808596, "epoch": 4.192216981132075, "grad_norm": 1.3046875, "learning_rate": 0.000335097974045568, "loss": 4.8197, "mean_token_accuracy": 0.23206972181797028, "num_tokens": 95919787.0, "step": 46215 }, { "entropy": 5.644887828826905, "epoch": 4.19267053701016, "grad_norm": 1.4453125, "learning_rate": 0.00033506679257033485, "loss": 4.9064, "mean_token_accuracy": 0.22265405356884002, "num_tokens": 95930620.0, "step": 46220 }, { "entropy": 5.647461748123169, "epoch": 4.193124092888244, "grad_norm": 1.328125, "learning_rate": 0.0003350356098529051, "loss": 4.8166, "mean_token_accuracy": 0.2285475715994835, "num_tokens": 95940258.0, "step": 46225 }, { "entropy": 5.618821620941162, "epoch": 4.193577648766328, "grad_norm": 1.390625, "learning_rate": 0.0003350044258939236, "loss": 4.917, "mean_token_accuracy": 0.22301074415445327, "num_tokens": 95950062.0, "step": 46230 }, { "entropy": 5.578625726699829, "epoch": 4.194031204644412, "grad_norm": 1.375, "learning_rate": 0.00033497324069403536, "loss": 4.7613, "mean_token_accuracy": 0.23030263781547547, "num_tokens": 95960658.0, "step": 46235 }, { "entropy": 5.6136847019195555, "epoch": 4.194484760522497, "grad_norm": 1.40625, "learning_rate": 0.0003349420542538851, "loss": 4.8164, "mean_token_accuracy": 0.2284703478217125, "num_tokens": 95970497.0, "step": 46240 }, { "entropy": 5.627645826339721, "epoch": 4.194938316400581, "grad_norm": 1.3125, "learning_rate": 0.00033491086657411797, "loss": 4.9409, "mean_token_accuracy": 0.2201028972864151, "num_tokens": 95980405.0, "step": 46245 }, { "entropy": 5.681105709075927, "epoch": 4.195391872278664, "grad_norm": 1.2109375, "learning_rate": 0.0003348796776553788, "loss": 4.9631, "mean_token_accuracy": 0.21626714020967483, "num_tokens": 95991111.0, "step": 46250 }, { "entropy": 5.69240436553955, "epoch": 4.1958454281567485, "grad_norm": 1.3828125, "learning_rate": 0.0003348484874983127, "loss": 4.8855, "mean_token_accuracy": 0.2281465694308281, "num_tokens": 96001962.0, "step": 46255 }, { "entropy": 5.628242635726929, "epoch": 4.196298984034833, "grad_norm": 1.25, "learning_rate": 0.0003348172961035646, "loss": 4.8423, "mean_token_accuracy": 0.22331026941537857, "num_tokens": 96011774.0, "step": 46260 }, { "entropy": 5.594936656951904, "epoch": 4.196752539912917, "grad_norm": 1.3828125, "learning_rate": 0.0003347861034717795, "loss": 4.8738, "mean_token_accuracy": 0.21719496697187424, "num_tokens": 96021915.0, "step": 46265 }, { "entropy": 5.572141695022583, "epoch": 4.197206095791001, "grad_norm": 1.3046875, "learning_rate": 0.00033475490960360266, "loss": 4.8479, "mean_token_accuracy": 0.22516145408153534, "num_tokens": 96032851.0, "step": 46270 }, { "entropy": 5.572245931625366, "epoch": 4.197659651669086, "grad_norm": 1.2734375, "learning_rate": 0.000334723714499679, "loss": 4.8446, "mean_token_accuracy": 0.2316009894013405, "num_tokens": 96042630.0, "step": 46275 }, { "entropy": 5.586907863616943, "epoch": 4.19811320754717, "grad_norm": 1.5, "learning_rate": 0.00033469251816065375, "loss": 4.7752, "mean_token_accuracy": 0.23266879022121428, "num_tokens": 96052154.0, "step": 46280 }, { "entropy": 5.62572979927063, "epoch": 4.198566763425254, "grad_norm": 1.3984375, "learning_rate": 0.000334661320587172, "loss": 4.8426, "mean_token_accuracy": 0.22974378019571304, "num_tokens": 96062301.0, "step": 46285 }, { "entropy": 5.636858224868774, "epoch": 4.199020319303338, "grad_norm": 1.4296875, "learning_rate": 0.000334630121779879, "loss": 4.9179, "mean_token_accuracy": 0.22020387947559356, "num_tokens": 96072792.0, "step": 46290 }, { "entropy": 5.672989988327027, "epoch": 4.199473875181423, "grad_norm": 1.3359375, "learning_rate": 0.00033459892173941973, "loss": 4.9191, "mean_token_accuracy": 0.22287983149290086, "num_tokens": 96082610.0, "step": 46295 }, { "entropy": 5.711738729476929, "epoch": 4.199927431059507, "grad_norm": 1.21875, "learning_rate": 0.0003345677204664397, "loss": 4.9351, "mean_token_accuracy": 0.22334103435277938, "num_tokens": 96093095.0, "step": 46300 }, { "entropy": 5.599697780609131, "epoch": 4.20038098693759, "grad_norm": 1.296875, "learning_rate": 0.00033453651796158397, "loss": 4.8281, "mean_token_accuracy": 0.22855852246284486, "num_tokens": 96103218.0, "step": 46305 }, { "entropy": 5.59517469406128, "epoch": 4.200834542815675, "grad_norm": 1.2421875, "learning_rate": 0.00033450531422549786, "loss": 4.8197, "mean_token_accuracy": 0.23066069334745407, "num_tokens": 96113937.0, "step": 46310 }, { "entropy": 5.704042100906372, "epoch": 4.201288098693759, "grad_norm": 1.5234375, "learning_rate": 0.00033447410925882673, "loss": 4.9983, "mean_token_accuracy": 0.21831278502941132, "num_tokens": 96124378.0, "step": 46315 }, { "entropy": 5.546307516098023, "epoch": 4.201741654571843, "grad_norm": 1.28125, "learning_rate": 0.0003344429030622159, "loss": 4.7423, "mean_token_accuracy": 0.23220301270484925, "num_tokens": 96133657.0, "step": 46320 }, { "entropy": 5.572737169265747, "epoch": 4.202195210449927, "grad_norm": 1.421875, "learning_rate": 0.00033441169563631055, "loss": 4.8569, "mean_token_accuracy": 0.22928023487329482, "num_tokens": 96143669.0, "step": 46325 }, { "entropy": 5.593768835067749, "epoch": 4.202648766328012, "grad_norm": 1.2734375, "learning_rate": 0.00033438048698175625, "loss": 4.8454, "mean_token_accuracy": 0.2256556198000908, "num_tokens": 96154782.0, "step": 46330 }, { "entropy": 5.628937530517578, "epoch": 4.203102322206096, "grad_norm": 1.21875, "learning_rate": 0.0003343492770991984, "loss": 4.8978, "mean_token_accuracy": 0.22844437658786773, "num_tokens": 96165128.0, "step": 46335 }, { "entropy": 5.605251693725586, "epoch": 4.20355587808418, "grad_norm": 1.3671875, "learning_rate": 0.0003343180659892824, "loss": 4.8712, "mean_token_accuracy": 0.22459150850772858, "num_tokens": 96176909.0, "step": 46340 }, { "entropy": 5.595322895050049, "epoch": 4.2040094339622645, "grad_norm": 1.328125, "learning_rate": 0.0003342868536526536, "loss": 4.8292, "mean_token_accuracy": 0.2325044170022011, "num_tokens": 96188287.0, "step": 46345 }, { "entropy": 5.5453588485717775, "epoch": 4.204462989840349, "grad_norm": 1.40625, "learning_rate": 0.00033425564008995764, "loss": 4.8218, "mean_token_accuracy": 0.22864848524332046, "num_tokens": 96198852.0, "step": 46350 }, { "entropy": 5.5845318794250485, "epoch": 4.204916545718432, "grad_norm": 1.2265625, "learning_rate": 0.0003342244253018399, "loss": 4.8497, "mean_token_accuracy": 0.22177359759807586, "num_tokens": 96208111.0, "step": 46355 }, { "entropy": 5.603541517257691, "epoch": 4.205370101596516, "grad_norm": 1.2890625, "learning_rate": 0.0003341932092889459, "loss": 4.832, "mean_token_accuracy": 0.23271377831697465, "num_tokens": 96218925.0, "step": 46360 }, { "entropy": 5.65958423614502, "epoch": 4.205823657474601, "grad_norm": 1.375, "learning_rate": 0.0003341619920519213, "loss": 4.8932, "mean_token_accuracy": 0.2287338137626648, "num_tokens": 96228573.0, "step": 46365 }, { "entropy": 5.6383861064910885, "epoch": 4.206277213352685, "grad_norm": 1.390625, "learning_rate": 0.00033413077359141166, "loss": 4.8791, "mean_token_accuracy": 0.22606369554996492, "num_tokens": 96239109.0, "step": 46370 }, { "entropy": 5.636392259597779, "epoch": 4.206730769230769, "grad_norm": 1.390625, "learning_rate": 0.0003340995539080625, "loss": 4.9087, "mean_token_accuracy": 0.21735179871320726, "num_tokens": 96249286.0, "step": 46375 }, { "entropy": 5.573814249038696, "epoch": 4.207184325108853, "grad_norm": 1.2890625, "learning_rate": 0.00033406833300251947, "loss": 4.8427, "mean_token_accuracy": 0.2256662905216217, "num_tokens": 96259515.0, "step": 46380 }, { "entropy": 5.587550258636474, "epoch": 4.207637880986938, "grad_norm": 1.4453125, "learning_rate": 0.0003340371108754284, "loss": 4.787, "mean_token_accuracy": 0.23248307406902313, "num_tokens": 96269136.0, "step": 46385 }, { "entropy": 5.633391857147217, "epoch": 4.208091436865022, "grad_norm": 1.25, "learning_rate": 0.0003340058875274347, "loss": 4.906, "mean_token_accuracy": 0.22721685022115706, "num_tokens": 96279792.0, "step": 46390 }, { "entropy": 5.626743793487549, "epoch": 4.208544992743106, "grad_norm": 1.390625, "learning_rate": 0.0003339746629591842, "loss": 4.8968, "mean_token_accuracy": 0.2232711672782898, "num_tokens": 96289606.0, "step": 46395 }, { "entropy": 5.575702571868897, "epoch": 4.2089985486211905, "grad_norm": 1.1953125, "learning_rate": 0.00033394343717132275, "loss": 4.8864, "mean_token_accuracy": 0.2215135470032692, "num_tokens": 96299903.0, "step": 46400 }, { "entropy": 5.67324743270874, "epoch": 4.209452104499274, "grad_norm": 1.265625, "learning_rate": 0.00033391221016449595, "loss": 4.9421, "mean_token_accuracy": 0.21800197660923004, "num_tokens": 96310179.0, "step": 46405 }, { "entropy": 5.6481225967407225, "epoch": 4.209905660377358, "grad_norm": 1.3046875, "learning_rate": 0.00033388098193934965, "loss": 4.8974, "mean_token_accuracy": 0.2240140601992607, "num_tokens": 96320948.0, "step": 46410 }, { "entropy": 5.599363946914673, "epoch": 4.210359216255442, "grad_norm": 1.296875, "learning_rate": 0.0003338497524965296, "loss": 4.8162, "mean_token_accuracy": 0.2256555289030075, "num_tokens": 96332046.0, "step": 46415 }, { "entropy": 5.595290660858154, "epoch": 4.210812772133527, "grad_norm": 1.40625, "learning_rate": 0.00033381852183668166, "loss": 4.7854, "mean_token_accuracy": 0.23457978665828705, "num_tokens": 96342327.0, "step": 46420 }, { "entropy": 5.577626752853393, "epoch": 4.211266328011611, "grad_norm": 1.4921875, "learning_rate": 0.0003337872899604517, "loss": 4.8581, "mean_token_accuracy": 0.22184203565120697, "num_tokens": 96352048.0, "step": 46425 }, { "entropy": 5.581136846542359, "epoch": 4.211719883889695, "grad_norm": 1.1796875, "learning_rate": 0.00033375605686848566, "loss": 4.7774, "mean_token_accuracy": 0.2347755402326584, "num_tokens": 96362917.0, "step": 46430 }, { "entropy": 5.596902561187744, "epoch": 4.2121734397677795, "grad_norm": 1.3984375, "learning_rate": 0.0003337248225614293, "loss": 4.8669, "mean_token_accuracy": 0.22739448696374892, "num_tokens": 96373261.0, "step": 46435 }, { "entropy": 5.649684619903565, "epoch": 4.212626995645864, "grad_norm": 1.3671875, "learning_rate": 0.0003336935870399288, "loss": 4.8937, "mean_token_accuracy": 0.21745210289955139, "num_tokens": 96384279.0, "step": 46440 }, { "entropy": 5.686035633087158, "epoch": 4.213080551523948, "grad_norm": 1.3671875, "learning_rate": 0.0003336623503046299, "loss": 4.8988, "mean_token_accuracy": 0.21928188502788543, "num_tokens": 96394071.0, "step": 46445 }, { "entropy": 5.6166078567504885, "epoch": 4.213534107402032, "grad_norm": 1.4453125, "learning_rate": 0.00033363111235617854, "loss": 4.8575, "mean_token_accuracy": 0.23086592108011245, "num_tokens": 96404233.0, "step": 46450 }, { "entropy": 5.641084957122803, "epoch": 4.2139876632801165, "grad_norm": 1.2734375, "learning_rate": 0.00033359987319522095, "loss": 4.8597, "mean_token_accuracy": 0.23304994851350785, "num_tokens": 96415388.0, "step": 46455 }, { "entropy": 5.667003488540649, "epoch": 4.2144412191582, "grad_norm": 1.2578125, "learning_rate": 0.00033356863282240295, "loss": 4.8586, "mean_token_accuracy": 0.22276459038257598, "num_tokens": 96425744.0, "step": 46460 }, { "entropy": 5.649685525894165, "epoch": 4.214894775036284, "grad_norm": 1.4453125, "learning_rate": 0.0003335373912383707, "loss": 4.8338, "mean_token_accuracy": 0.23602993339300155, "num_tokens": 96436340.0, "step": 46465 }, { "entropy": 5.6969311237335205, "epoch": 4.2153483309143684, "grad_norm": 1.28125, "learning_rate": 0.0003335061484437704, "loss": 4.9761, "mean_token_accuracy": 0.21371111273765564, "num_tokens": 96447384.0, "step": 46470 }, { "entropy": 5.588261890411377, "epoch": 4.215801886792453, "grad_norm": 1.3359375, "learning_rate": 0.000333474904439248, "loss": 4.8349, "mean_token_accuracy": 0.23110016584396362, "num_tokens": 96456938.0, "step": 46475 }, { "entropy": 5.579414510726929, "epoch": 4.216255442670537, "grad_norm": 1.25, "learning_rate": 0.0003334436592254496, "loss": 4.8755, "mean_token_accuracy": 0.22365673929452895, "num_tokens": 96467343.0, "step": 46480 }, { "entropy": 5.614346218109131, "epoch": 4.216708998548621, "grad_norm": 1.4140625, "learning_rate": 0.00033341241280302153, "loss": 4.8622, "mean_token_accuracy": 0.22690063267946242, "num_tokens": 96477443.0, "step": 46485 }, { "entropy": 5.614342451095581, "epoch": 4.2171625544267055, "grad_norm": 1.3203125, "learning_rate": 0.00033338116517260985, "loss": 4.8966, "mean_token_accuracy": 0.21869966834783555, "num_tokens": 96487711.0, "step": 46490 }, { "entropy": 5.715102195739746, "epoch": 4.21761611030479, "grad_norm": 1.296875, "learning_rate": 0.0003333499163348608, "loss": 4.989, "mean_token_accuracy": 0.21690969914197922, "num_tokens": 96497839.0, "step": 46495 }, { "entropy": 5.674069929122925, "epoch": 4.218069666182874, "grad_norm": 1.2890625, "learning_rate": 0.00033331866629042055, "loss": 4.9167, "mean_token_accuracy": 0.22335280627012252, "num_tokens": 96508237.0, "step": 46500 }, { "entropy": 5.599286413192749, "epoch": 4.218523222060958, "grad_norm": 1.265625, "learning_rate": 0.0003332874150399355, "loss": 4.7658, "mean_token_accuracy": 0.22440260350704194, "num_tokens": 96518877.0, "step": 46505 }, { "entropy": 5.582112836837768, "epoch": 4.218976777939042, "grad_norm": 1.203125, "learning_rate": 0.0003332561625840519, "loss": 4.8301, "mean_token_accuracy": 0.22762729376554489, "num_tokens": 96530734.0, "step": 46510 }, { "entropy": 5.650498723983764, "epoch": 4.219430333817126, "grad_norm": 1.4921875, "learning_rate": 0.0003332249089234159, "loss": 4.9224, "mean_token_accuracy": 0.22359474897384643, "num_tokens": 96540983.0, "step": 46515 }, { "entropy": 5.65999174118042, "epoch": 4.21988388969521, "grad_norm": 1.40625, "learning_rate": 0.00033319365405867394, "loss": 4.9381, "mean_token_accuracy": 0.2213198259472847, "num_tokens": 96551866.0, "step": 46520 }, { "entropy": 5.63258695602417, "epoch": 4.2203374455732945, "grad_norm": 1.375, "learning_rate": 0.00033316239799047247, "loss": 4.8438, "mean_token_accuracy": 0.224632066488266, "num_tokens": 96562515.0, "step": 46525 }, { "entropy": 5.585324811935425, "epoch": 4.220791001451379, "grad_norm": 1.2890625, "learning_rate": 0.00033313114071945764, "loss": 4.8294, "mean_token_accuracy": 0.22754328548908234, "num_tokens": 96573266.0, "step": 46530 }, { "entropy": 5.581152009963989, "epoch": 4.221244557329463, "grad_norm": 1.296875, "learning_rate": 0.0003330998822462762, "loss": 4.8078, "mean_token_accuracy": 0.2302495464682579, "num_tokens": 96583070.0, "step": 46535 }, { "entropy": 5.592003917694091, "epoch": 4.221698113207547, "grad_norm": 1.3046875, "learning_rate": 0.00033306862257157427, "loss": 4.8005, "mean_token_accuracy": 0.23104698359966278, "num_tokens": 96593582.0, "step": 46540 }, { "entropy": 5.632849550247192, "epoch": 4.2221516690856316, "grad_norm": 1.3359375, "learning_rate": 0.0003330373616959984, "loss": 4.8461, "mean_token_accuracy": 0.23188619017601014, "num_tokens": 96603233.0, "step": 46545 }, { "entropy": 5.595374917984008, "epoch": 4.222605224963716, "grad_norm": 1.3046875, "learning_rate": 0.00033300609962019523, "loss": 4.8079, "mean_token_accuracy": 0.22700596153736113, "num_tokens": 96614361.0, "step": 46550 }, { "entropy": 5.631172037124633, "epoch": 4.2230587808418, "grad_norm": 1.359375, "learning_rate": 0.000332974836344811, "loss": 4.8889, "mean_token_accuracy": 0.22467966377735138, "num_tokens": 96624161.0, "step": 46555 }, { "entropy": 5.667362403869629, "epoch": 4.2235123367198835, "grad_norm": 1.34375, "learning_rate": 0.00033294357187049246, "loss": 4.8918, "mean_token_accuracy": 0.2176077112555504, "num_tokens": 96634329.0, "step": 46560 }, { "entropy": 5.684721851348877, "epoch": 4.223965892597968, "grad_norm": 1.25, "learning_rate": 0.00033291230619788604, "loss": 4.9259, "mean_token_accuracy": 0.22551367580890655, "num_tokens": 96645575.0, "step": 46565 }, { "entropy": 5.622018527984619, "epoch": 4.224419448476052, "grad_norm": 1.3828125, "learning_rate": 0.00033288103932763846, "loss": 4.8777, "mean_token_accuracy": 0.21770126670598983, "num_tokens": 96656224.0, "step": 46570 }, { "entropy": 5.649169206619263, "epoch": 4.224873004354136, "grad_norm": 1.46875, "learning_rate": 0.0003328497712603962, "loss": 4.8357, "mean_token_accuracy": 0.23603827953338624, "num_tokens": 96665950.0, "step": 46575 }, { "entropy": 5.548826503753662, "epoch": 4.2253265602322205, "grad_norm": 1.234375, "learning_rate": 0.00033281850199680586, "loss": 4.7317, "mean_token_accuracy": 0.23584811836481095, "num_tokens": 96676916.0, "step": 46580 }, { "entropy": 5.633476829528808, "epoch": 4.225780116110305, "grad_norm": 1.3125, "learning_rate": 0.0003327872315375142, "loss": 4.9482, "mean_token_accuracy": 0.216978257894516, "num_tokens": 96687289.0, "step": 46585 }, { "entropy": 5.635323095321655, "epoch": 4.226233671988389, "grad_norm": 1.390625, "learning_rate": 0.0003327559598831679, "loss": 4.884, "mean_token_accuracy": 0.232246695458889, "num_tokens": 96698149.0, "step": 46590 }, { "entropy": 5.617386722564698, "epoch": 4.226687227866473, "grad_norm": 1.296875, "learning_rate": 0.00033272468703441363, "loss": 4.8393, "mean_token_accuracy": 0.2260541468858719, "num_tokens": 96709466.0, "step": 46595 }, { "entropy": 5.636447095870972, "epoch": 4.227140783744558, "grad_norm": 1.328125, "learning_rate": 0.000332693412991898, "loss": 4.8918, "mean_token_accuracy": 0.22354019433259964, "num_tokens": 96720179.0, "step": 46600 }, { "entropy": 5.667103099822998, "epoch": 4.227594339622642, "grad_norm": 1.34375, "learning_rate": 0.0003326621377562681, "loss": 4.915, "mean_token_accuracy": 0.21815070062875747, "num_tokens": 96730783.0, "step": 46605 }, { "entropy": 5.667810440063477, "epoch": 4.228047895500726, "grad_norm": 1.234375, "learning_rate": 0.00033263086132817035, "loss": 4.9731, "mean_token_accuracy": 0.21745525449514388, "num_tokens": 96740903.0, "step": 46610 }, { "entropy": 5.6163427352905275, "epoch": 4.2285014513788095, "grad_norm": 1.15625, "learning_rate": 0.00033259958370825165, "loss": 4.8408, "mean_token_accuracy": 0.2320155084133148, "num_tokens": 96750600.0, "step": 46615 }, { "entropy": 5.607594966888428, "epoch": 4.228955007256894, "grad_norm": 1.3359375, "learning_rate": 0.00033256830489715905, "loss": 4.7968, "mean_token_accuracy": 0.23158927261829376, "num_tokens": 96760550.0, "step": 46620 }, { "entropy": 5.64610743522644, "epoch": 4.229408563134978, "grad_norm": 1.2890625, "learning_rate": 0.0003325370248955392, "loss": 4.8486, "mean_token_accuracy": 0.22881616801023483, "num_tokens": 96770784.0, "step": 46625 }, { "entropy": 5.592218637466431, "epoch": 4.229862119013062, "grad_norm": 1.328125, "learning_rate": 0.0003325057437040389, "loss": 4.779, "mean_token_accuracy": 0.23100534975528716, "num_tokens": 96780572.0, "step": 46630 }, { "entropy": 5.558398485183716, "epoch": 4.230315674891147, "grad_norm": 1.265625, "learning_rate": 0.0003324744613233052, "loss": 4.7839, "mean_token_accuracy": 0.22809428721666336, "num_tokens": 96790504.0, "step": 46635 }, { "entropy": 5.607027769088745, "epoch": 4.230769230769231, "grad_norm": 1.3359375, "learning_rate": 0.00033244317775398506, "loss": 4.8517, "mean_token_accuracy": 0.2235510990023613, "num_tokens": 96800856.0, "step": 46640 }, { "entropy": 5.607737350463867, "epoch": 4.231222786647315, "grad_norm": 1.3125, "learning_rate": 0.0003324118929967253, "loss": 4.8413, "mean_token_accuracy": 0.22567494809627534, "num_tokens": 96811293.0, "step": 46645 }, { "entropy": 5.545803785324097, "epoch": 4.231676342525399, "grad_norm": 1.2890625, "learning_rate": 0.000332380607052173, "loss": 4.7748, "mean_token_accuracy": 0.23581669628620147, "num_tokens": 96821844.0, "step": 46650 }, { "entropy": 5.617425441741943, "epoch": 4.232129898403484, "grad_norm": 1.296875, "learning_rate": 0.0003323493199209751, "loss": 4.9302, "mean_token_accuracy": 0.22280262261629105, "num_tokens": 96833438.0, "step": 46655 }, { "entropy": 5.566705417633057, "epoch": 4.232583454281568, "grad_norm": 1.4140625, "learning_rate": 0.0003323180316037787, "loss": 4.7965, "mean_token_accuracy": 0.23031732738018035, "num_tokens": 96843086.0, "step": 46660 }, { "entropy": 5.622716808319092, "epoch": 4.233037010159651, "grad_norm": 1.34375, "learning_rate": 0.0003322867421012308, "loss": 4.8382, "mean_token_accuracy": 0.225467449426651, "num_tokens": 96853064.0, "step": 46665 }, { "entropy": 5.722280883789063, "epoch": 4.2334905660377355, "grad_norm": 1.203125, "learning_rate": 0.0003322554514139784, "loss": 4.9174, "mean_token_accuracy": 0.22267532348632812, "num_tokens": 96864213.0, "step": 46670 }, { "entropy": 5.716294384002685, "epoch": 4.23394412191582, "grad_norm": 1.1953125, "learning_rate": 0.00033222415954266873, "loss": 4.9826, "mean_token_accuracy": 0.21526502072811127, "num_tokens": 96875344.0, "step": 46675 }, { "entropy": 5.651243209838867, "epoch": 4.234397677793904, "grad_norm": 1.375, "learning_rate": 0.00033219286648794886, "loss": 4.9192, "mean_token_accuracy": 0.22914940118789673, "num_tokens": 96885985.0, "step": 46680 }, { "entropy": 5.575485610961914, "epoch": 4.234851233671988, "grad_norm": 1.2421875, "learning_rate": 0.0003321615722504659, "loss": 4.7791, "mean_token_accuracy": 0.23782141208648683, "num_tokens": 96897512.0, "step": 46685 }, { "entropy": 5.632569694519043, "epoch": 4.235304789550073, "grad_norm": 1.203125, "learning_rate": 0.0003321302768308671, "loss": 4.9268, "mean_token_accuracy": 0.21563323736190795, "num_tokens": 96907630.0, "step": 46690 }, { "entropy": 5.567236518859863, "epoch": 4.235758345428157, "grad_norm": 1.515625, "learning_rate": 0.00033209898022979964, "loss": 4.7823, "mean_token_accuracy": 0.23321677446365358, "num_tokens": 96917400.0, "step": 46695 }, { "entropy": 5.7093218803405765, "epoch": 4.236211901306241, "grad_norm": 1.375, "learning_rate": 0.0003320676824479106, "loss": 4.9763, "mean_token_accuracy": 0.21596077382564544, "num_tokens": 96927700.0, "step": 46700 }, { "entropy": 5.681747579574585, "epoch": 4.236665457184325, "grad_norm": 1.2578125, "learning_rate": 0.0003320363834858474, "loss": 4.8215, "mean_token_accuracy": 0.2279474437236786, "num_tokens": 96938925.0, "step": 46705 }, { "entropy": 5.596373081207275, "epoch": 4.23711901306241, "grad_norm": 1.4140625, "learning_rate": 0.0003320050833442573, "loss": 4.7918, "mean_token_accuracy": 0.23098774403333663, "num_tokens": 96948956.0, "step": 46710 }, { "entropy": 5.572036790847778, "epoch": 4.237572568940493, "grad_norm": 1.4375, "learning_rate": 0.0003319737820237875, "loss": 4.9059, "mean_token_accuracy": 0.22173832058906556, "num_tokens": 96958565.0, "step": 46715 }, { "entropy": 5.584075260162353, "epoch": 4.238026124818577, "grad_norm": 1.3359375, "learning_rate": 0.00033194247952508544, "loss": 4.8734, "mean_token_accuracy": 0.22097350358963014, "num_tokens": 96968261.0, "step": 46720 }, { "entropy": 5.65211706161499, "epoch": 4.238479680696662, "grad_norm": 1.4296875, "learning_rate": 0.00033191117584879836, "loss": 4.8478, "mean_token_accuracy": 0.22369531393051148, "num_tokens": 96978621.0, "step": 46725 }, { "entropy": 5.609901428222656, "epoch": 4.238933236574746, "grad_norm": 1.3671875, "learning_rate": 0.0003318798709955736, "loss": 4.8318, "mean_token_accuracy": 0.22153929322957994, "num_tokens": 96989081.0, "step": 46730 }, { "entropy": 5.7107829570770265, "epoch": 4.23938679245283, "grad_norm": 1.3046875, "learning_rate": 0.0003318485649660586, "loss": 4.9896, "mean_token_accuracy": 0.2107331097126007, "num_tokens": 97000518.0, "step": 46735 }, { "entropy": 5.610215139389038, "epoch": 4.239840348330914, "grad_norm": 1.375, "learning_rate": 0.00033181725776090093, "loss": 4.8426, "mean_token_accuracy": 0.2301383525133133, "num_tokens": 97012038.0, "step": 46740 }, { "entropy": 5.646110248565674, "epoch": 4.240293904208999, "grad_norm": 1.234375, "learning_rate": 0.00033178594938074787, "loss": 4.8378, "mean_token_accuracy": 0.2226180449128151, "num_tokens": 97022256.0, "step": 46745 }, { "entropy": 5.6544441223144535, "epoch": 4.240747460087083, "grad_norm": 1.2578125, "learning_rate": 0.0003317546398262468, "loss": 4.9455, "mean_token_accuracy": 0.21915076971054076, "num_tokens": 97033063.0, "step": 46750 }, { "entropy": 5.590554904937744, "epoch": 4.241201015965167, "grad_norm": 1.2734375, "learning_rate": 0.0003317233290980454, "loss": 4.8874, "mean_token_accuracy": 0.22357482016086577, "num_tokens": 97043711.0, "step": 46755 }, { "entropy": 5.62206335067749, "epoch": 4.2416545718432515, "grad_norm": 1.4453125, "learning_rate": 0.00033169201719679105, "loss": 4.8251, "mean_token_accuracy": 0.2312798485159874, "num_tokens": 97053582.0, "step": 46760 }, { "entropy": 5.6606837749481205, "epoch": 4.242108127721336, "grad_norm": 1.2578125, "learning_rate": 0.00033166070412313133, "loss": 4.881, "mean_token_accuracy": 0.22771119624376296, "num_tokens": 97064535.0, "step": 46765 }, { "entropy": 5.622524118423462, "epoch": 4.242561683599419, "grad_norm": 1.3984375, "learning_rate": 0.0003316293898777138, "loss": 4.886, "mean_token_accuracy": 0.2198437586426735, "num_tokens": 97074295.0, "step": 46770 }, { "entropy": 5.583196592330933, "epoch": 4.243015239477503, "grad_norm": 1.2734375, "learning_rate": 0.00033159807446118614, "loss": 4.8723, "mean_token_accuracy": 0.2204604908823967, "num_tokens": 97084781.0, "step": 46775 }, { "entropy": 5.6988152980804445, "epoch": 4.243468795355588, "grad_norm": 1.3828125, "learning_rate": 0.0003315667578741958, "loss": 4.9175, "mean_token_accuracy": 0.21672960370779037, "num_tokens": 97094848.0, "step": 46780 }, { "entropy": 5.639906501770019, "epoch": 4.243922351233672, "grad_norm": 1.28125, "learning_rate": 0.0003315354401173905, "loss": 4.8578, "mean_token_accuracy": 0.22393720597028732, "num_tokens": 97104747.0, "step": 46785 }, { "entropy": 5.5903740406036375, "epoch": 4.244375907111756, "grad_norm": 1.3203125, "learning_rate": 0.0003315041211914179, "loss": 4.8171, "mean_token_accuracy": 0.22050128281116485, "num_tokens": 97115599.0, "step": 46790 }, { "entropy": 5.628864336013794, "epoch": 4.24482946298984, "grad_norm": 1.265625, "learning_rate": 0.0003314728010969257, "loss": 4.9657, "mean_token_accuracy": 0.22254079431295395, "num_tokens": 97127492.0, "step": 46795 }, { "entropy": 5.621570634841919, "epoch": 4.245283018867925, "grad_norm": 1.375, "learning_rate": 0.00033144147983456154, "loss": 4.8922, "mean_token_accuracy": 0.21863047182559966, "num_tokens": 97138336.0, "step": 46800 }, { "entropy": 5.606234979629517, "epoch": 4.245736574746009, "grad_norm": 1.3828125, "learning_rate": 0.0003314101574049732, "loss": 4.819, "mean_token_accuracy": 0.22951818108558655, "num_tokens": 97149196.0, "step": 46805 }, { "entropy": 5.669437599182129, "epoch": 4.246190130624093, "grad_norm": 1.4765625, "learning_rate": 0.00033137883380880847, "loss": 4.911, "mean_token_accuracy": 0.22391146868467332, "num_tokens": 97159622.0, "step": 46810 }, { "entropy": 5.655715608596802, "epoch": 4.2466436865021775, "grad_norm": 1.28125, "learning_rate": 0.000331347509046715, "loss": 4.9519, "mean_token_accuracy": 0.21366937160491944, "num_tokens": 97170149.0, "step": 46815 }, { "entropy": 5.67915711402893, "epoch": 4.247097242380261, "grad_norm": 1.359375, "learning_rate": 0.0003313161831193408, "loss": 4.8783, "mean_token_accuracy": 0.22023363113403321, "num_tokens": 97180409.0, "step": 46820 }, { "entropy": 5.647928762435913, "epoch": 4.247550798258345, "grad_norm": 1.3125, "learning_rate": 0.00033128485602733354, "loss": 4.9133, "mean_token_accuracy": 0.2233542025089264, "num_tokens": 97190899.0, "step": 46825 }, { "entropy": 5.652402639389038, "epoch": 4.248004354136429, "grad_norm": 1.3984375, "learning_rate": 0.0003312535277713411, "loss": 4.8936, "mean_token_accuracy": 0.23104675859212875, "num_tokens": 97200759.0, "step": 46830 }, { "entropy": 5.636211824417114, "epoch": 4.248457910014514, "grad_norm": 1.28125, "learning_rate": 0.00033122219835201135, "loss": 4.8167, "mean_token_accuracy": 0.23237361907958984, "num_tokens": 97211476.0, "step": 46835 }, { "entropy": 5.684138679504395, "epoch": 4.248911465892598, "grad_norm": 1.2734375, "learning_rate": 0.0003311908677699923, "loss": 4.9261, "mean_token_accuracy": 0.2201432392001152, "num_tokens": 97222374.0, "step": 46840 }, { "entropy": 5.630644226074219, "epoch": 4.249365021770682, "grad_norm": 1.375, "learning_rate": 0.0003311595360259317, "loss": 4.884, "mean_token_accuracy": 0.2238625779747963, "num_tokens": 97233079.0, "step": 46845 }, { "entropy": 5.526723623275757, "epoch": 4.2498185776487665, "grad_norm": 1.3671875, "learning_rate": 0.00033112820312047756, "loss": 4.7935, "mean_token_accuracy": 0.23256900012493134, "num_tokens": 97243796.0, "step": 46850 }, { "entropy": 5.591722869873047, "epoch": 4.250272133526851, "grad_norm": 1.3359375, "learning_rate": 0.00033109686905427794, "loss": 4.7516, "mean_token_accuracy": 0.23437889218330382, "num_tokens": 97253341.0, "step": 46855 }, { "entropy": 5.685336875915527, "epoch": 4.250725689404935, "grad_norm": 1.2109375, "learning_rate": 0.00033106553382798075, "loss": 4.9407, "mean_token_accuracy": 0.21711051762104033, "num_tokens": 97264244.0, "step": 46860 }, { "entropy": 5.584280347824096, "epoch": 4.251179245283019, "grad_norm": 1.390625, "learning_rate": 0.00033103419744223413, "loss": 4.8377, "mean_token_accuracy": 0.22694845050573348, "num_tokens": 97274239.0, "step": 46865 }, { "entropy": 5.557263422012329, "epoch": 4.251632801161103, "grad_norm": 1.3203125, "learning_rate": 0.0003310028598976859, "loss": 4.7531, "mean_token_accuracy": 0.2406819999217987, "num_tokens": 97284709.0, "step": 46870 }, { "entropy": 5.583110523223877, "epoch": 4.252086357039187, "grad_norm": 1.2734375, "learning_rate": 0.00033097152119498425, "loss": 4.794, "mean_token_accuracy": 0.22957405894994737, "num_tokens": 97295262.0, "step": 46875 }, { "entropy": 5.620219612121582, "epoch": 4.252539912917271, "grad_norm": 1.2734375, "learning_rate": 0.0003309401813347774, "loss": 4.8837, "mean_token_accuracy": 0.22242826074361802, "num_tokens": 97306143.0, "step": 46880 }, { "entropy": 5.647772598266601, "epoch": 4.2529934687953554, "grad_norm": 1.328125, "learning_rate": 0.0003309088403177132, "loss": 4.7979, "mean_token_accuracy": 0.23372879922389983, "num_tokens": 97316248.0, "step": 46885 }, { "entropy": 5.699823570251465, "epoch": 4.25344702467344, "grad_norm": 1.2734375, "learning_rate": 0.00033087749814444, "loss": 4.9534, "mean_token_accuracy": 0.22064039260149002, "num_tokens": 97327704.0, "step": 46890 }, { "entropy": 5.683367729187012, "epoch": 4.253900580551524, "grad_norm": 1.2890625, "learning_rate": 0.00033084615481560585, "loss": 4.9516, "mean_token_accuracy": 0.2149379163980484, "num_tokens": 97337817.0, "step": 46895 }, { "entropy": 5.701856851577759, "epoch": 4.254354136429608, "grad_norm": 1.328125, "learning_rate": 0.00033081481033185903, "loss": 4.9357, "mean_token_accuracy": 0.22350728064775466, "num_tokens": 97348315.0, "step": 46900 }, { "entropy": 5.631969785690307, "epoch": 4.2548076923076925, "grad_norm": 1.28125, "learning_rate": 0.0003307834646938477, "loss": 4.8709, "mean_token_accuracy": 0.22382384538650513, "num_tokens": 97358842.0, "step": 46905 }, { "entropy": 5.721827650070191, "epoch": 4.255261248185777, "grad_norm": 1.1796875, "learning_rate": 0.0003307521179022201, "loss": 4.9614, "mean_token_accuracy": 0.2211735412478447, "num_tokens": 97369247.0, "step": 46910 }, { "entropy": 5.618614673614502, "epoch": 4.255714804063861, "grad_norm": 1.4375, "learning_rate": 0.0003307207699576246, "loss": 4.8405, "mean_token_accuracy": 0.22973832935094834, "num_tokens": 97379668.0, "step": 46915 }, { "entropy": 5.610636806488037, "epoch": 4.256168359941945, "grad_norm": 1.3359375, "learning_rate": 0.00033068942086070924, "loss": 4.8271, "mean_token_accuracy": 0.22910839766263963, "num_tokens": 97389131.0, "step": 46920 }, { "entropy": 5.678656578063965, "epoch": 4.256621915820029, "grad_norm": 1.2578125, "learning_rate": 0.00033065807061212254, "loss": 4.9708, "mean_token_accuracy": 0.21673500537872314, "num_tokens": 97400583.0, "step": 46925 }, { "entropy": 5.6806488037109375, "epoch": 4.257075471698113, "grad_norm": 1.3203125, "learning_rate": 0.0003306267192125128, "loss": 4.8488, "mean_token_accuracy": 0.22242211252450944, "num_tokens": 97410828.0, "step": 46930 }, { "entropy": 5.672375011444092, "epoch": 4.257529027576197, "grad_norm": 1.296875, "learning_rate": 0.0003305953666625283, "loss": 4.9077, "mean_token_accuracy": 0.2207650989294052, "num_tokens": 97421190.0, "step": 46935 }, { "entropy": 5.632593011856079, "epoch": 4.2579825834542815, "grad_norm": 1.234375, "learning_rate": 0.00033056401296281733, "loss": 4.9356, "mean_token_accuracy": 0.21688589751720427, "num_tokens": 97432257.0, "step": 46940 }, { "entropy": 5.632818651199341, "epoch": 4.258436139332366, "grad_norm": 1.3125, "learning_rate": 0.0003305326581140286, "loss": 4.9149, "mean_token_accuracy": 0.22278669029474257, "num_tokens": 97442272.0, "step": 46945 }, { "entropy": 5.630366802215576, "epoch": 4.25888969521045, "grad_norm": 1.265625, "learning_rate": 0.00033050130211681017, "loss": 4.8423, "mean_token_accuracy": 0.2283510223031044, "num_tokens": 97451462.0, "step": 46950 }, { "entropy": 5.596278810501099, "epoch": 4.259343251088534, "grad_norm": 1.3515625, "learning_rate": 0.00033046994497181077, "loss": 4.7661, "mean_token_accuracy": 0.2302933692932129, "num_tokens": 97461579.0, "step": 46955 }, { "entropy": 5.6997950077056885, "epoch": 4.2597968069666186, "grad_norm": 1.296875, "learning_rate": 0.00033043858667967875, "loss": 4.9389, "mean_token_accuracy": 0.22260741591453553, "num_tokens": 97472892.0, "step": 46960 }, { "entropy": 5.577630805969238, "epoch": 4.260250362844703, "grad_norm": 1.265625, "learning_rate": 0.00033040722724106257, "loss": 4.8248, "mean_token_accuracy": 0.2254362776875496, "num_tokens": 97484278.0, "step": 46965 }, { "entropy": 5.607456016540527, "epoch": 4.260703918722786, "grad_norm": 1.3125, "learning_rate": 0.00033037586665661094, "loss": 4.8939, "mean_token_accuracy": 0.2226048082113266, "num_tokens": 97494127.0, "step": 46970 }, { "entropy": 5.574779033660889, "epoch": 4.2611574746008705, "grad_norm": 1.28125, "learning_rate": 0.0003303445049269722, "loss": 4.7991, "mean_token_accuracy": 0.22869897037744522, "num_tokens": 97504213.0, "step": 46975 }, { "entropy": 5.681661367416382, "epoch": 4.261611030478955, "grad_norm": 1.453125, "learning_rate": 0.00033031314205279503, "loss": 4.9201, "mean_token_accuracy": 0.22021500915288925, "num_tokens": 97515242.0, "step": 46980 }, { "entropy": 5.712862491607666, "epoch": 4.262064586357039, "grad_norm": 1.2734375, "learning_rate": 0.00033028177803472793, "loss": 4.8674, "mean_token_accuracy": 0.22420736104249955, "num_tokens": 97525956.0, "step": 46985 }, { "entropy": 5.608055257797242, "epoch": 4.262518142235123, "grad_norm": 1.375, "learning_rate": 0.0003302504128734196, "loss": 4.7928, "mean_token_accuracy": 0.23298343420028686, "num_tokens": 97535973.0, "step": 46990 }, { "entropy": 5.560281419754029, "epoch": 4.2629716981132075, "grad_norm": 1.3359375, "learning_rate": 0.00033021904656951867, "loss": 4.8566, "mean_token_accuracy": 0.22866786122322083, "num_tokens": 97547580.0, "step": 46995 }, { "entropy": 5.601482152938843, "epoch": 4.263425253991292, "grad_norm": 1.15625, "learning_rate": 0.00033018767912367376, "loss": 4.817, "mean_token_accuracy": 0.2252979412674904, "num_tokens": 97558050.0, "step": 47000 }, { "entropy": 5.6489685535430905, "epoch": 4.263878809869376, "grad_norm": 1.3359375, "learning_rate": 0.00033015631053653357, "loss": 4.8191, "mean_token_accuracy": 0.2322539657354355, "num_tokens": 97567997.0, "step": 47005 }, { "entropy": 5.5774085521698, "epoch": 4.26433236574746, "grad_norm": 1.5, "learning_rate": 0.0003301249408087469, "loss": 4.8228, "mean_token_accuracy": 0.23039344251155852, "num_tokens": 97577220.0, "step": 47010 }, { "entropy": 5.6266707420349125, "epoch": 4.264785921625545, "grad_norm": 1.328125, "learning_rate": 0.00033009356994096237, "loss": 4.8535, "mean_token_accuracy": 0.2310619294643402, "num_tokens": 97588421.0, "step": 47015 }, { "entropy": 5.571185636520386, "epoch": 4.265239477503629, "grad_norm": 1.2578125, "learning_rate": 0.00033006219793382867, "loss": 4.7781, "mean_token_accuracy": 0.23053307384252547, "num_tokens": 97598624.0, "step": 47020 }, { "entropy": 5.632955598831177, "epoch": 4.265693033381712, "grad_norm": 1.3984375, "learning_rate": 0.0003300308247879948, "loss": 4.8631, "mean_token_accuracy": 0.22222653329372405, "num_tokens": 97609128.0, "step": 47025 }, { "entropy": 5.614797782897949, "epoch": 4.2661465892597965, "grad_norm": 1.359375, "learning_rate": 0.0003299994505041094, "loss": 4.8756, "mean_token_accuracy": 0.22944799065589905, "num_tokens": 97619549.0, "step": 47030 }, { "entropy": 5.608154439926148, "epoch": 4.266600145137881, "grad_norm": 1.203125, "learning_rate": 0.00032996807508282134, "loss": 4.8764, "mean_token_accuracy": 0.22114461660385132, "num_tokens": 97630184.0, "step": 47035 }, { "entropy": 5.61085877418518, "epoch": 4.267053701015965, "grad_norm": 1.296875, "learning_rate": 0.00032993669852477954, "loss": 4.8414, "mean_token_accuracy": 0.2295462816953659, "num_tokens": 97640569.0, "step": 47040 }, { "entropy": 5.601362705230713, "epoch": 4.267507256894049, "grad_norm": 1.3203125, "learning_rate": 0.0003299053208306328, "loss": 4.8117, "mean_token_accuracy": 0.22550351023674012, "num_tokens": 97651006.0, "step": 47045 }, { "entropy": 5.5818705558776855, "epoch": 4.267960812772134, "grad_norm": 1.2578125, "learning_rate": 0.0003298739420010299, "loss": 4.8663, "mean_token_accuracy": 0.22643264681100844, "num_tokens": 97661567.0, "step": 47050 }, { "entropy": 5.611021089553833, "epoch": 4.268414368650218, "grad_norm": 1.265625, "learning_rate": 0.0003298425620366201, "loss": 4.8544, "mean_token_accuracy": 0.23071752786636351, "num_tokens": 97673058.0, "step": 47055 }, { "entropy": 5.763935279846192, "epoch": 4.268867924528302, "grad_norm": 1.3125, "learning_rate": 0.0003298111809380521, "loss": 4.9774, "mean_token_accuracy": 0.21452312022447587, "num_tokens": 97684509.0, "step": 47060 }, { "entropy": 5.715897846221924, "epoch": 4.269321480406386, "grad_norm": 1.34375, "learning_rate": 0.00032977979870597477, "loss": 4.878, "mean_token_accuracy": 0.22203823029994965, "num_tokens": 97693954.0, "step": 47065 }, { "entropy": 5.618963384628296, "epoch": 4.269775036284471, "grad_norm": 1.3515625, "learning_rate": 0.0003297484153410374, "loss": 4.8155, "mean_token_accuracy": 0.23069721907377244, "num_tokens": 97704345.0, "step": 47070 }, { "entropy": 5.523329162597657, "epoch": 4.270228592162554, "grad_norm": 1.3828125, "learning_rate": 0.00032971703084388885, "loss": 4.7321, "mean_token_accuracy": 0.24109630584716796, "num_tokens": 97714857.0, "step": 47075 }, { "entropy": 5.629623126983643, "epoch": 4.270682148040638, "grad_norm": 1.2265625, "learning_rate": 0.000329685645215178, "loss": 4.8823, "mean_token_accuracy": 0.221777980029583, "num_tokens": 97725921.0, "step": 47080 }, { "entropy": 5.6375984191894535, "epoch": 4.2711357039187225, "grad_norm": 1.28125, "learning_rate": 0.00032965425845555413, "loss": 4.8406, "mean_token_accuracy": 0.23915466219186782, "num_tokens": 97735361.0, "step": 47085 }, { "entropy": 5.6213250160217285, "epoch": 4.271589259796807, "grad_norm": 1.3046875, "learning_rate": 0.00032962287056566633, "loss": 4.8657, "mean_token_accuracy": 0.22300980389118194, "num_tokens": 97745915.0, "step": 47090 }, { "entropy": 5.651946210861206, "epoch": 4.272042815674891, "grad_norm": 1.4296875, "learning_rate": 0.0003295914815461637, "loss": 4.8481, "mean_token_accuracy": 0.2349666476249695, "num_tokens": 97755663.0, "step": 47095 }, { "entropy": 5.667207431793213, "epoch": 4.272496371552975, "grad_norm": 1.25, "learning_rate": 0.00032956009139769514, "loss": 4.9407, "mean_token_accuracy": 0.21652076840400697, "num_tokens": 97766300.0, "step": 47100 }, { "entropy": 5.641920900344848, "epoch": 4.27294992743106, "grad_norm": 1.3671875, "learning_rate": 0.00032952870012091013, "loss": 4.8668, "mean_token_accuracy": 0.22219767421483994, "num_tokens": 97776584.0, "step": 47105 }, { "entropy": 5.577944898605347, "epoch": 4.273403483309144, "grad_norm": 1.2890625, "learning_rate": 0.00032949730771645767, "loss": 4.8095, "mean_token_accuracy": 0.2248141884803772, "num_tokens": 97786230.0, "step": 47110 }, { "entropy": 5.6517528057098385, "epoch": 4.273857039187228, "grad_norm": 1.3203125, "learning_rate": 0.000329465914184987, "loss": 4.9155, "mean_token_accuracy": 0.2197134718298912, "num_tokens": 97796671.0, "step": 47115 }, { "entropy": 5.561695194244384, "epoch": 4.274310595065312, "grad_norm": 1.25, "learning_rate": 0.0003294345195271473, "loss": 4.8376, "mean_token_accuracy": 0.22531707137823104, "num_tokens": 97807569.0, "step": 47120 }, { "entropy": 5.699811267852783, "epoch": 4.274764150943396, "grad_norm": 1.2578125, "learning_rate": 0.00032940312374358794, "loss": 4.9888, "mean_token_accuracy": 0.21824986934661866, "num_tokens": 97818680.0, "step": 47125 }, { "entropy": 5.643488836288452, "epoch": 4.27521770682148, "grad_norm": 1.453125, "learning_rate": 0.000329371726834958, "loss": 4.8849, "mean_token_accuracy": 0.2279416427016258, "num_tokens": 97828955.0, "step": 47130 }, { "entropy": 5.619002914428711, "epoch": 4.275671262699564, "grad_norm": 1.28125, "learning_rate": 0.000329340328801907, "loss": 4.8586, "mean_token_accuracy": 0.230656997859478, "num_tokens": 97839000.0, "step": 47135 }, { "entropy": 5.612377119064331, "epoch": 4.276124818577649, "grad_norm": 1.3203125, "learning_rate": 0.0003293089296450841, "loss": 4.905, "mean_token_accuracy": 0.21601884812116623, "num_tokens": 97850140.0, "step": 47140 }, { "entropy": 5.584545993804932, "epoch": 4.276578374455733, "grad_norm": 1.359375, "learning_rate": 0.0003292775293651388, "loss": 4.7768, "mean_token_accuracy": 0.22782012969255447, "num_tokens": 97860887.0, "step": 47145 }, { "entropy": 5.638222980499267, "epoch": 4.277031930333817, "grad_norm": 1.484375, "learning_rate": 0.0003292461279627203, "loss": 4.8321, "mean_token_accuracy": 0.22459143847227098, "num_tokens": 97871190.0, "step": 47150 }, { "entropy": 5.612672281265259, "epoch": 4.277485486211901, "grad_norm": 1.375, "learning_rate": 0.00032921472543847804, "loss": 4.7907, "mean_token_accuracy": 0.2291889727115631, "num_tokens": 97881479.0, "step": 47155 }, { "entropy": 5.583629131317139, "epoch": 4.277939042089986, "grad_norm": 1.390625, "learning_rate": 0.0003291833217930614, "loss": 4.8696, "mean_token_accuracy": 0.22547540366649627, "num_tokens": 97892340.0, "step": 47160 }, { "entropy": 5.6450413227081295, "epoch": 4.27839259796807, "grad_norm": 1.3125, "learning_rate": 0.00032915191702711995, "loss": 4.8969, "mean_token_accuracy": 0.22380622178316117, "num_tokens": 97902882.0, "step": 47165 }, { "entropy": 5.578026628494262, "epoch": 4.278846153846154, "grad_norm": 1.2578125, "learning_rate": 0.00032912051114130297, "loss": 4.7808, "mean_token_accuracy": 0.2286839008331299, "num_tokens": 97913187.0, "step": 47170 }, { "entropy": 5.593288612365723, "epoch": 4.2792997097242385, "grad_norm": 1.5546875, "learning_rate": 0.00032908910413626, "loss": 4.8155, "mean_token_accuracy": 0.23624345958232879, "num_tokens": 97922434.0, "step": 47175 }, { "entropy": 5.520088052749633, "epoch": 4.279753265602322, "grad_norm": 1.234375, "learning_rate": 0.0003290576960126407, "loss": 4.7372, "mean_token_accuracy": 0.23658651113510132, "num_tokens": 97933020.0, "step": 47180 }, { "entropy": 5.563190746307373, "epoch": 4.280206821480406, "grad_norm": 1.2734375, "learning_rate": 0.00032902628677109434, "loss": 4.831, "mean_token_accuracy": 0.2287142440676689, "num_tokens": 97944103.0, "step": 47185 }, { "entropy": 5.643956089019776, "epoch": 4.28066037735849, "grad_norm": 1.234375, "learning_rate": 0.0003289948764122707, "loss": 4.8405, "mean_token_accuracy": 0.233802430331707, "num_tokens": 97953692.0, "step": 47190 }, { "entropy": 5.667386245727539, "epoch": 4.281113933236575, "grad_norm": 1.296875, "learning_rate": 0.0003289634649368193, "loss": 4.8634, "mean_token_accuracy": 0.22631232738494872, "num_tokens": 97963592.0, "step": 47195 }, { "entropy": 5.701091527938843, "epoch": 4.281567489114659, "grad_norm": 1.28125, "learning_rate": 0.0003289320523453895, "loss": 5.0211, "mean_token_accuracy": 0.22137184143066407, "num_tokens": 97974092.0, "step": 47200 }, { "entropy": 5.547875785827637, "epoch": 4.282021044992743, "grad_norm": 1.2734375, "learning_rate": 0.00032890063863863126, "loss": 4.7527, "mean_token_accuracy": 0.23776146918535232, "num_tokens": 97984175.0, "step": 47205 }, { "entropy": 5.574573183059693, "epoch": 4.282474600870827, "grad_norm": 1.3828125, "learning_rate": 0.0003288692238171941, "loss": 4.8731, "mean_token_accuracy": 0.23747948408126832, "num_tokens": 97994993.0, "step": 47210 }, { "entropy": 5.609606742858887, "epoch": 4.282928156748912, "grad_norm": 1.203125, "learning_rate": 0.00032883780788172756, "loss": 4.8757, "mean_token_accuracy": 0.22149042934179305, "num_tokens": 98005892.0, "step": 47215 }, { "entropy": 5.590387296676636, "epoch": 4.283381712626996, "grad_norm": 1.2265625, "learning_rate": 0.0003288063908328814, "loss": 4.7835, "mean_token_accuracy": 0.2324290931224823, "num_tokens": 98016726.0, "step": 47220 }, { "entropy": 5.6688902378082275, "epoch": 4.28383526850508, "grad_norm": 1.390625, "learning_rate": 0.0003287749726713055, "loss": 4.8803, "mean_token_accuracy": 0.2265734165906906, "num_tokens": 98028500.0, "step": 47225 }, { "entropy": 5.69581937789917, "epoch": 4.284288824383164, "grad_norm": 1.375, "learning_rate": 0.0003287435533976494, "loss": 4.9695, "mean_token_accuracy": 0.2148450180888176, "num_tokens": 98039304.0, "step": 47230 }, { "entropy": 5.616467523574829, "epoch": 4.284742380261248, "grad_norm": 1.3125, "learning_rate": 0.0003287121330125629, "loss": 4.8462, "mean_token_accuracy": 0.22336160987615586, "num_tokens": 98049448.0, "step": 47235 }, { "entropy": 5.620266008377075, "epoch": 4.285195936139332, "grad_norm": 1.328125, "learning_rate": 0.00032868071151669585, "loss": 4.861, "mean_token_accuracy": 0.23323998153209685, "num_tokens": 98059532.0, "step": 47240 }, { "entropy": 5.555338048934937, "epoch": 4.285649492017416, "grad_norm": 1.59375, "learning_rate": 0.000328649288910698, "loss": 4.7716, "mean_token_accuracy": 0.22919470071792603, "num_tokens": 98069385.0, "step": 47245 }, { "entropy": 5.6446723461151125, "epoch": 4.286103047895501, "grad_norm": 1.3359375, "learning_rate": 0.0003286178651952192, "loss": 4.8401, "mean_token_accuracy": 0.23199428468942643, "num_tokens": 98079354.0, "step": 47250 }, { "entropy": 5.665226650238037, "epoch": 4.286556603773585, "grad_norm": 1.265625, "learning_rate": 0.00032858644037090924, "loss": 4.9654, "mean_token_accuracy": 0.2168981611728668, "num_tokens": 98090864.0, "step": 47255 }, { "entropy": 5.592876720428467, "epoch": 4.287010159651669, "grad_norm": 1.328125, "learning_rate": 0.0003285550144384181, "loss": 4.8211, "mean_token_accuracy": 0.22947462797164916, "num_tokens": 98101515.0, "step": 47260 }, { "entropy": 5.642464303970337, "epoch": 4.2874637155297535, "grad_norm": 1.4609375, "learning_rate": 0.00032852358739839555, "loss": 4.8456, "mean_token_accuracy": 0.22512095868587495, "num_tokens": 98111786.0, "step": 47265 }, { "entropy": 5.624148607254028, "epoch": 4.287917271407838, "grad_norm": 1.28125, "learning_rate": 0.00032849215925149155, "loss": 4.8045, "mean_token_accuracy": 0.23568045645952224, "num_tokens": 98121732.0, "step": 47270 }, { "entropy": 5.66390061378479, "epoch": 4.288370827285922, "grad_norm": 1.3046875, "learning_rate": 0.0003284607299983561, "loss": 4.9706, "mean_token_accuracy": 0.21933106780052186, "num_tokens": 98131417.0, "step": 47275 }, { "entropy": 5.6697639465332035, "epoch": 4.288824383164005, "grad_norm": 1.3046875, "learning_rate": 0.00032842929963963915, "loss": 4.8369, "mean_token_accuracy": 0.22621381729841233, "num_tokens": 98141664.0, "step": 47280 }, { "entropy": 5.639224195480347, "epoch": 4.28927793904209, "grad_norm": 1.34375, "learning_rate": 0.00032839786817599065, "loss": 4.8144, "mean_token_accuracy": 0.22321742326021193, "num_tokens": 98150959.0, "step": 47285 }, { "entropy": 5.633822250366211, "epoch": 4.289731494920174, "grad_norm": 1.1953125, "learning_rate": 0.0003283664356080606, "loss": 4.9463, "mean_token_accuracy": 0.2225288286805153, "num_tokens": 98161957.0, "step": 47290 }, { "entropy": 5.563166761398316, "epoch": 4.290185050798258, "grad_norm": 1.2578125, "learning_rate": 0.00032833500193649916, "loss": 4.7925, "mean_token_accuracy": 0.2278713896870613, "num_tokens": 98172053.0, "step": 47295 }, { "entropy": 5.6144476413726805, "epoch": 4.2906386066763424, "grad_norm": 1.3828125, "learning_rate": 0.00032830356716195624, "loss": 4.8124, "mean_token_accuracy": 0.2267252117395401, "num_tokens": 98182074.0, "step": 47300 }, { "entropy": 5.666690111160278, "epoch": 4.291092162554427, "grad_norm": 1.296875, "learning_rate": 0.0003282721312850819, "loss": 4.8644, "mean_token_accuracy": 0.22365194857120513, "num_tokens": 98192591.0, "step": 47305 }, { "entropy": 5.579317474365235, "epoch": 4.291545718432511, "grad_norm": 1.296875, "learning_rate": 0.0003282406943065264, "loss": 4.7609, "mean_token_accuracy": 0.23524457961320877, "num_tokens": 98203426.0, "step": 47310 }, { "entropy": 5.577765941619873, "epoch": 4.291999274310595, "grad_norm": 1.2734375, "learning_rate": 0.00032820925622693977, "loss": 4.8241, "mean_token_accuracy": 0.2242076277732849, "num_tokens": 98214342.0, "step": 47315 }, { "entropy": 5.621197652816773, "epoch": 4.2924528301886795, "grad_norm": 1.296875, "learning_rate": 0.00032817781704697204, "loss": 4.8302, "mean_token_accuracy": 0.22377626299858094, "num_tokens": 98224155.0, "step": 47320 }, { "entropy": 5.613556289672852, "epoch": 4.292906386066764, "grad_norm": 1.3984375, "learning_rate": 0.0003281463767672736, "loss": 4.8224, "mean_token_accuracy": 0.23124950379133224, "num_tokens": 98233613.0, "step": 47325 }, { "entropy": 5.63717794418335, "epoch": 4.293359941944848, "grad_norm": 1.3125, "learning_rate": 0.0003281149353884946, "loss": 4.8414, "mean_token_accuracy": 0.23010460138320923, "num_tokens": 98243117.0, "step": 47330 }, { "entropy": 5.607906103134155, "epoch": 4.293813497822931, "grad_norm": 1.2578125, "learning_rate": 0.0003280834929112851, "loss": 4.8214, "mean_token_accuracy": 0.23018937557935715, "num_tokens": 98253619.0, "step": 47335 }, { "entropy": 5.614600086212159, "epoch": 4.294267053701016, "grad_norm": 1.296875, "learning_rate": 0.0003280520493362955, "loss": 4.8523, "mean_token_accuracy": 0.22821273803710937, "num_tokens": 98264221.0, "step": 47340 }, { "entropy": 5.583437299728393, "epoch": 4.2947206095791, "grad_norm": 1.2109375, "learning_rate": 0.0003280206046641759, "loss": 4.7972, "mean_token_accuracy": 0.22635616660118102, "num_tokens": 98275530.0, "step": 47345 }, { "entropy": 5.701711416244507, "epoch": 4.295174165457184, "grad_norm": 1.2265625, "learning_rate": 0.00032798915889557687, "loss": 4.9378, "mean_token_accuracy": 0.22117282599210739, "num_tokens": 98285937.0, "step": 47350 }, { "entropy": 5.661172199249267, "epoch": 4.2956277213352685, "grad_norm": 1.3359375, "learning_rate": 0.0003279577120311483, "loss": 4.8962, "mean_token_accuracy": 0.22456271946430206, "num_tokens": 98295690.0, "step": 47355 }, { "entropy": 5.596270227432251, "epoch": 4.296081277213353, "grad_norm": 1.3984375, "learning_rate": 0.000327926264071541, "loss": 4.8471, "mean_token_accuracy": 0.22586225718259811, "num_tokens": 98305073.0, "step": 47360 }, { "entropy": 5.622945833206177, "epoch": 4.296534833091437, "grad_norm": 1.3125, "learning_rate": 0.0003278948150174049, "loss": 4.9346, "mean_token_accuracy": 0.22098020613193511, "num_tokens": 98316008.0, "step": 47365 }, { "entropy": 5.596741580963135, "epoch": 4.296988388969521, "grad_norm": 1.28125, "learning_rate": 0.0003278633648693906, "loss": 4.8177, "mean_token_accuracy": 0.22668539583683014, "num_tokens": 98327032.0, "step": 47370 }, { "entropy": 5.658023023605347, "epoch": 4.2974419448476056, "grad_norm": 1.328125, "learning_rate": 0.0003278319136281484, "loss": 4.8726, "mean_token_accuracy": 0.22983046025037765, "num_tokens": 98336085.0, "step": 47375 }, { "entropy": 5.631104278564453, "epoch": 4.297895500725689, "grad_norm": 1.453125, "learning_rate": 0.00032780046129432885, "loss": 4.8717, "mean_token_accuracy": 0.23373648524284363, "num_tokens": 98346180.0, "step": 47380 }, { "entropy": 5.616884231567383, "epoch": 4.298349056603773, "grad_norm": 1.3984375, "learning_rate": 0.00032776900786858214, "loss": 4.7993, "mean_token_accuracy": 0.22891128063201904, "num_tokens": 98356001.0, "step": 47385 }, { "entropy": 5.690781450271606, "epoch": 4.2988026124818575, "grad_norm": 1.3359375, "learning_rate": 0.000327737553351559, "loss": 4.9331, "mean_token_accuracy": 0.22270919382572174, "num_tokens": 98366744.0, "step": 47390 }, { "entropy": 5.577809047698975, "epoch": 4.299256168359942, "grad_norm": 1.328125, "learning_rate": 0.00032770609774390985, "loss": 4.7953, "mean_token_accuracy": 0.22995573729276658, "num_tokens": 98377350.0, "step": 47395 }, { "entropy": 5.563135385513306, "epoch": 4.299709724238026, "grad_norm": 1.296875, "learning_rate": 0.0003276746410462852, "loss": 4.8349, "mean_token_accuracy": 0.2301477536559105, "num_tokens": 98387926.0, "step": 47400 }, { "entropy": 5.642178678512574, "epoch": 4.30016328011611, "grad_norm": 1.4140625, "learning_rate": 0.00032764318325933546, "loss": 4.9247, "mean_token_accuracy": 0.2242929980158806, "num_tokens": 98397117.0, "step": 47405 }, { "entropy": 5.663260269165039, "epoch": 4.3006168359941945, "grad_norm": 1.25, "learning_rate": 0.0003276117243837113, "loss": 4.887, "mean_token_accuracy": 0.22340668588876725, "num_tokens": 98407983.0, "step": 47410 }, { "entropy": 5.636649036407471, "epoch": 4.301070391872279, "grad_norm": 1.359375, "learning_rate": 0.0003275802644200633, "loss": 4.8942, "mean_token_accuracy": 0.22215288430452346, "num_tokens": 98419940.0, "step": 47415 }, { "entropy": 5.577565765380859, "epoch": 4.301523947750363, "grad_norm": 1.4765625, "learning_rate": 0.000327548803369042, "loss": 4.8067, "mean_token_accuracy": 0.23608071208000184, "num_tokens": 98430487.0, "step": 47420 }, { "entropy": 5.61991605758667, "epoch": 4.301977503628447, "grad_norm": 1.4296875, "learning_rate": 0.00032751734123129814, "loss": 4.8428, "mean_token_accuracy": 0.2345798820257187, "num_tokens": 98440231.0, "step": 47425 }, { "entropy": 5.654092407226562, "epoch": 4.302431059506532, "grad_norm": 1.3125, "learning_rate": 0.0003274858780074822, "loss": 4.8919, "mean_token_accuracy": 0.22632853090763091, "num_tokens": 98449741.0, "step": 47430 }, { "entropy": 5.631859397888183, "epoch": 4.302884615384615, "grad_norm": 1.28125, "learning_rate": 0.00032745441369824485, "loss": 4.7825, "mean_token_accuracy": 0.24184008538722992, "num_tokens": 98461068.0, "step": 47435 }, { "entropy": 5.628634214401245, "epoch": 4.303338171262699, "grad_norm": 1.2734375, "learning_rate": 0.00032742294830423696, "loss": 4.8759, "mean_token_accuracy": 0.23079689741134643, "num_tokens": 98472585.0, "step": 47440 }, { "entropy": 5.635098791122436, "epoch": 4.3037917271407835, "grad_norm": 1.2421875, "learning_rate": 0.0003273914818261092, "loss": 4.8757, "mean_token_accuracy": 0.22806455940008163, "num_tokens": 98482874.0, "step": 47445 }, { "entropy": 5.622268915176392, "epoch": 4.304245283018868, "grad_norm": 1.2421875, "learning_rate": 0.00032736001426451216, "loss": 4.8474, "mean_token_accuracy": 0.2275979846715927, "num_tokens": 98492995.0, "step": 47450 }, { "entropy": 5.689875555038452, "epoch": 4.304698838896952, "grad_norm": 1.40625, "learning_rate": 0.0003273285456200966, "loss": 4.9287, "mean_token_accuracy": 0.2230018436908722, "num_tokens": 98503965.0, "step": 47455 }, { "entropy": 5.615868616104126, "epoch": 4.305152394775036, "grad_norm": 1.140625, "learning_rate": 0.0003272970758935135, "loss": 4.8539, "mean_token_accuracy": 0.22644599825143813, "num_tokens": 98515584.0, "step": 47460 }, { "entropy": 5.662915802001953, "epoch": 4.305605950653121, "grad_norm": 1.375, "learning_rate": 0.00032726560508541356, "loss": 4.8907, "mean_token_accuracy": 0.22782246321439742, "num_tokens": 98527134.0, "step": 47465 }, { "entropy": 5.660779619216919, "epoch": 4.306059506531205, "grad_norm": 1.4140625, "learning_rate": 0.00032723413319644756, "loss": 4.8944, "mean_token_accuracy": 0.2248922899365425, "num_tokens": 98537189.0, "step": 47470 }, { "entropy": 5.623597192764282, "epoch": 4.306513062409289, "grad_norm": 1.265625, "learning_rate": 0.0003272026602272663, "loss": 4.8582, "mean_token_accuracy": 0.22595262974500657, "num_tokens": 98547803.0, "step": 47475 }, { "entropy": 5.588962078094482, "epoch": 4.306966618287373, "grad_norm": 1.2734375, "learning_rate": 0.00032717118617852086, "loss": 4.8584, "mean_token_accuracy": 0.22469249963760377, "num_tokens": 98558332.0, "step": 47480 }, { "entropy": 5.693544149398804, "epoch": 4.307420174165458, "grad_norm": 1.2890625, "learning_rate": 0.0003271397110508619, "loss": 4.9721, "mean_token_accuracy": 0.22422416061162947, "num_tokens": 98569046.0, "step": 47485 }, { "entropy": 5.611083698272705, "epoch": 4.307873730043541, "grad_norm": 1.4296875, "learning_rate": 0.0003271082348449405, "loss": 4.8658, "mean_token_accuracy": 0.22270580530166625, "num_tokens": 98579358.0, "step": 47490 }, { "entropy": 5.606311464309693, "epoch": 4.308327285921625, "grad_norm": 1.234375, "learning_rate": 0.0003270767575614074, "loss": 4.8832, "mean_token_accuracy": 0.22420376241207124, "num_tokens": 98589224.0, "step": 47495 }, { "entropy": 5.683764123916626, "epoch": 4.3087808417997095, "grad_norm": 1.265625, "learning_rate": 0.0003270452792009138, "loss": 4.9389, "mean_token_accuracy": 0.2254382088780403, "num_tokens": 98598954.0, "step": 47500 }, { "entropy": 5.607494497299195, "epoch": 4.309234397677794, "grad_norm": 1.328125, "learning_rate": 0.00032701379976411043, "loss": 4.7893, "mean_token_accuracy": 0.22426560819149016, "num_tokens": 98608813.0, "step": 47505 }, { "entropy": 5.590865993499756, "epoch": 4.309687953555878, "grad_norm": 1.2734375, "learning_rate": 0.0003269823192516486, "loss": 4.8367, "mean_token_accuracy": 0.2300844520330429, "num_tokens": 98618746.0, "step": 47510 }, { "entropy": 5.645672464370728, "epoch": 4.310141509433962, "grad_norm": 1.3359375, "learning_rate": 0.00032695083766417913, "loss": 4.851, "mean_token_accuracy": 0.23096059411764144, "num_tokens": 98628804.0, "step": 47515 }, { "entropy": 5.6246910572052, "epoch": 4.310595065312047, "grad_norm": 1.3359375, "learning_rate": 0.000326919355002353, "loss": 4.8475, "mean_token_accuracy": 0.22641227543354034, "num_tokens": 98640056.0, "step": 47520 }, { "entropy": 5.5767802715301515, "epoch": 4.311048621190131, "grad_norm": 1.375, "learning_rate": 0.00032688787126682143, "loss": 4.8077, "mean_token_accuracy": 0.2302025318145752, "num_tokens": 98651042.0, "step": 47525 }, { "entropy": 5.624698495864868, "epoch": 4.311502177068215, "grad_norm": 1.2578125, "learning_rate": 0.0003268563864582354, "loss": 4.8416, "mean_token_accuracy": 0.22820381671190262, "num_tokens": 98661405.0, "step": 47530 }, { "entropy": 5.684638738632202, "epoch": 4.3119557329462985, "grad_norm": 1.234375, "learning_rate": 0.00032682490057724616, "loss": 4.9288, "mean_token_accuracy": 0.21758223623037337, "num_tokens": 98672323.0, "step": 47535 }, { "entropy": 5.685717296600342, "epoch": 4.312409288824383, "grad_norm": 1.4921875, "learning_rate": 0.0003267934136245047, "loss": 4.8873, "mean_token_accuracy": 0.22413784265518188, "num_tokens": 98681431.0, "step": 47540 }, { "entropy": 5.542545032501221, "epoch": 4.312862844702467, "grad_norm": 1.4375, "learning_rate": 0.0003267619256006623, "loss": 4.7825, "mean_token_accuracy": 0.24008105844259262, "num_tokens": 98692345.0, "step": 47545 }, { "entropy": 5.616249036788941, "epoch": 4.313316400580551, "grad_norm": 1.2578125, "learning_rate": 0.0003267304365063701, "loss": 4.9241, "mean_token_accuracy": 0.22397732138633727, "num_tokens": 98703425.0, "step": 47550 }, { "entropy": 5.645273351669312, "epoch": 4.313769956458636, "grad_norm": 1.2578125, "learning_rate": 0.0003266989463422793, "loss": 4.8688, "mean_token_accuracy": 0.2304901361465454, "num_tokens": 98714193.0, "step": 47555 }, { "entropy": 5.6491199970245365, "epoch": 4.31422351233672, "grad_norm": 1.4921875, "learning_rate": 0.00032666745510904105, "loss": 4.839, "mean_token_accuracy": 0.23138196915388107, "num_tokens": 98723550.0, "step": 47560 }, { "entropy": 5.604430389404297, "epoch": 4.314677068214804, "grad_norm": 1.375, "learning_rate": 0.00032663596280730673, "loss": 4.8606, "mean_token_accuracy": 0.2220545455813408, "num_tokens": 98734075.0, "step": 47565 }, { "entropy": 5.6208476543426515, "epoch": 4.315130624092888, "grad_norm": 1.1640625, "learning_rate": 0.00032660446943772755, "loss": 4.8606, "mean_token_accuracy": 0.22627621740102768, "num_tokens": 98745447.0, "step": 47570 }, { "entropy": 5.654650783538818, "epoch": 4.315584179970973, "grad_norm": 1.328125, "learning_rate": 0.0003265729750009547, "loss": 4.9259, "mean_token_accuracy": 0.22317731082439424, "num_tokens": 98756169.0, "step": 47575 }, { "entropy": 5.642724514007568, "epoch": 4.316037735849057, "grad_norm": 1.1875, "learning_rate": 0.0003265414794976397, "loss": 4.9096, "mean_token_accuracy": 0.21905523538589478, "num_tokens": 98767112.0, "step": 47580 }, { "entropy": 5.667980194091797, "epoch": 4.316491291727141, "grad_norm": 1.171875, "learning_rate": 0.0003265099829284337, "loss": 4.917, "mean_token_accuracy": 0.22542796283960342, "num_tokens": 98777533.0, "step": 47585 }, { "entropy": 5.6909300804138185, "epoch": 4.316944847605225, "grad_norm": 1.2578125, "learning_rate": 0.0003264784852939881, "loss": 4.926, "mean_token_accuracy": 0.21785698384046553, "num_tokens": 98788101.0, "step": 47590 }, { "entropy": 5.72018575668335, "epoch": 4.317398403483309, "grad_norm": 1.2578125, "learning_rate": 0.00032644698659495437, "loss": 4.8969, "mean_token_accuracy": 0.22534625381231307, "num_tokens": 98799438.0, "step": 47595 }, { "entropy": 5.60253529548645, "epoch": 4.317851959361393, "grad_norm": 1.3359375, "learning_rate": 0.00032641548683198384, "loss": 4.8303, "mean_token_accuracy": 0.223910416662693, "num_tokens": 98810325.0, "step": 47600 }, { "entropy": 5.565122652053833, "epoch": 4.318305515239477, "grad_norm": 1.25, "learning_rate": 0.0003263839860057279, "loss": 4.8446, "mean_token_accuracy": 0.2276192158460617, "num_tokens": 98821897.0, "step": 47605 }, { "entropy": 5.631326532363891, "epoch": 4.318759071117562, "grad_norm": 1.4140625, "learning_rate": 0.000326352484116838, "loss": 4.8591, "mean_token_accuracy": 0.22253056466579438, "num_tokens": 98833338.0, "step": 47610 }, { "entropy": 5.671670246124267, "epoch": 4.319212626995646, "grad_norm": 1.28125, "learning_rate": 0.00032632098116596576, "loss": 4.8626, "mean_token_accuracy": 0.22501097321510316, "num_tokens": 98844308.0, "step": 47615 }, { "entropy": 5.645916938781738, "epoch": 4.31966618287373, "grad_norm": 1.3046875, "learning_rate": 0.00032628947715376247, "loss": 4.8735, "mean_token_accuracy": 0.22481424510478973, "num_tokens": 98854491.0, "step": 47620 }, { "entropy": 5.641106796264649, "epoch": 4.320119738751814, "grad_norm": 1.2890625, "learning_rate": 0.0003262579720808797, "loss": 4.9093, "mean_token_accuracy": 0.21963253766298294, "num_tokens": 98864702.0, "step": 47625 }, { "entropy": 5.614544343948364, "epoch": 4.320573294629899, "grad_norm": 1.2890625, "learning_rate": 0.00032622646594796905, "loss": 4.8557, "mean_token_accuracy": 0.23078173100948335, "num_tokens": 98874682.0, "step": 47630 }, { "entropy": 5.679851627349853, "epoch": 4.321026850507983, "grad_norm": 1.3515625, "learning_rate": 0.0003261949587556821, "loss": 4.9536, "mean_token_accuracy": 0.21658227145671843, "num_tokens": 98885130.0, "step": 47635 }, { "entropy": 5.649454355239868, "epoch": 4.321480406386067, "grad_norm": 1.3046875, "learning_rate": 0.00032616345050467016, "loss": 4.8731, "mean_token_accuracy": 0.22533013224601744, "num_tokens": 98896398.0, "step": 47640 }, { "entropy": 5.610025882720947, "epoch": 4.321933962264151, "grad_norm": 1.4140625, "learning_rate": 0.0003261319411955852, "loss": 4.8259, "mean_token_accuracy": 0.231671604514122, "num_tokens": 98906571.0, "step": 47645 }, { "entropy": 5.600841045379639, "epoch": 4.322387518142235, "grad_norm": 1.3046875, "learning_rate": 0.0003261004308290786, "loss": 4.8145, "mean_token_accuracy": 0.2319784477353096, "num_tokens": 98916666.0, "step": 47650 }, { "entropy": 5.6467290878295895, "epoch": 4.322841074020319, "grad_norm": 1.2421875, "learning_rate": 0.0003260689194058021, "loss": 4.8683, "mean_token_accuracy": 0.22290383726358415, "num_tokens": 98926599.0, "step": 47655 }, { "entropy": 5.583265256881714, "epoch": 4.323294629898403, "grad_norm": 1.390625, "learning_rate": 0.00032603740692640733, "loss": 4.7869, "mean_token_accuracy": 0.2283250778913498, "num_tokens": 98936512.0, "step": 47660 }, { "entropy": 5.662972354888916, "epoch": 4.323748185776488, "grad_norm": 1.34375, "learning_rate": 0.0003260058933915459, "loss": 4.9778, "mean_token_accuracy": 0.20911809653043748, "num_tokens": 98946604.0, "step": 47665 }, { "entropy": 5.690374565124512, "epoch": 4.324201741654572, "grad_norm": 1.4609375, "learning_rate": 0.0003259743788018697, "loss": 4.8784, "mean_token_accuracy": 0.22004904448986054, "num_tokens": 98956257.0, "step": 47670 }, { "entropy": 5.6734363555908205, "epoch": 4.324655297532656, "grad_norm": 1.2890625, "learning_rate": 0.00032594286315803026, "loss": 4.9213, "mean_token_accuracy": 0.21805552989244462, "num_tokens": 98966346.0, "step": 47675 }, { "entropy": 5.603524446487427, "epoch": 4.3251088534107405, "grad_norm": 1.2421875, "learning_rate": 0.0003259113464606795, "loss": 4.8226, "mean_token_accuracy": 0.22663767635822296, "num_tokens": 98977410.0, "step": 47680 }, { "entropy": 5.682003498077393, "epoch": 4.325562409288825, "grad_norm": 1.3046875, "learning_rate": 0.0003258798287104691, "loss": 4.914, "mean_token_accuracy": 0.22437324076890947, "num_tokens": 98987488.0, "step": 47685 }, { "entropy": 5.648275899887085, "epoch": 4.326015965166908, "grad_norm": 1.328125, "learning_rate": 0.00032584830990805094, "loss": 4.8011, "mean_token_accuracy": 0.2328224390745163, "num_tokens": 98996792.0, "step": 47690 }, { "entropy": 5.62788577079773, "epoch": 4.326469521044992, "grad_norm": 1.28125, "learning_rate": 0.00032581679005407667, "loss": 4.7842, "mean_token_accuracy": 0.23430884182453154, "num_tokens": 99007425.0, "step": 47695 }, { "entropy": 5.588452243804932, "epoch": 4.326923076923077, "grad_norm": 1.3125, "learning_rate": 0.0003257852691491983, "loss": 4.8227, "mean_token_accuracy": 0.22192427515983582, "num_tokens": 99018275.0, "step": 47700 }, { "entropy": 5.630432653427124, "epoch": 4.327376632801161, "grad_norm": 1.390625, "learning_rate": 0.00032575374719406755, "loss": 4.9075, "mean_token_accuracy": 0.22239874303340912, "num_tokens": 99028853.0, "step": 47705 }, { "entropy": 5.645051670074463, "epoch": 4.327830188679245, "grad_norm": 1.1796875, "learning_rate": 0.00032572222418933644, "loss": 4.9034, "mean_token_accuracy": 0.2207654371857643, "num_tokens": 99039423.0, "step": 47710 }, { "entropy": 5.6546203136444095, "epoch": 4.3282837445573294, "grad_norm": 1.2421875, "learning_rate": 0.0003256907001356568, "loss": 4.9077, "mean_token_accuracy": 0.21334689408540725, "num_tokens": 99050041.0, "step": 47715 }, { "entropy": 5.638952016830444, "epoch": 4.328737300435414, "grad_norm": 1.15625, "learning_rate": 0.0003256591750336806, "loss": 4.9055, "mean_token_accuracy": 0.21801101118326188, "num_tokens": 99062050.0, "step": 47720 }, { "entropy": 5.5602985382080075, "epoch": 4.329190856313498, "grad_norm": 1.2890625, "learning_rate": 0.0003256276488840596, "loss": 4.7685, "mean_token_accuracy": 0.22365766912698745, "num_tokens": 99072337.0, "step": 47725 }, { "entropy": 5.53347692489624, "epoch": 4.329644412191582, "grad_norm": 1.3671875, "learning_rate": 0.00032559612168744613, "loss": 4.7715, "mean_token_accuracy": 0.22890606969594957, "num_tokens": 99082468.0, "step": 47730 }, { "entropy": 5.61519455909729, "epoch": 4.3300979680696665, "grad_norm": 1.5, "learning_rate": 0.0003255645934444918, "loss": 4.8685, "mean_token_accuracy": 0.22253265976905823, "num_tokens": 99091757.0, "step": 47735 }, { "entropy": 5.673792457580566, "epoch": 4.330551523947751, "grad_norm": 1.2734375, "learning_rate": 0.0003255330641558489, "loss": 4.9282, "mean_token_accuracy": 0.2171151965856552, "num_tokens": 99103192.0, "step": 47740 }, { "entropy": 5.58910026550293, "epoch": 4.331005079825834, "grad_norm": 1.359375, "learning_rate": 0.0003255015338221693, "loss": 4.7745, "mean_token_accuracy": 0.23132523596286775, "num_tokens": 99112660.0, "step": 47745 }, { "entropy": 5.679754590988159, "epoch": 4.331458635703918, "grad_norm": 1.25, "learning_rate": 0.00032547000244410515, "loss": 4.8907, "mean_token_accuracy": 0.22515864670276642, "num_tokens": 99123867.0, "step": 47750 }, { "entropy": 5.605358648300171, "epoch": 4.331912191582003, "grad_norm": 1.28125, "learning_rate": 0.00032543847002230845, "loss": 4.8588, "mean_token_accuracy": 0.22274049520492553, "num_tokens": 99134445.0, "step": 47755 }, { "entropy": 5.586302995681763, "epoch": 4.332365747460087, "grad_norm": 1.40625, "learning_rate": 0.0003254069365574313, "loss": 4.8214, "mean_token_accuracy": 0.22941377460956575, "num_tokens": 99143483.0, "step": 47760 }, { "entropy": 5.5938245296478275, "epoch": 4.332819303338171, "grad_norm": 1.546875, "learning_rate": 0.0003253754020501259, "loss": 4.8405, "mean_token_accuracy": 0.23127358108758928, "num_tokens": 99154514.0, "step": 47765 }, { "entropy": 5.6041340827941895, "epoch": 4.3332728592162555, "grad_norm": 1.2265625, "learning_rate": 0.00032534386650104444, "loss": 4.8902, "mean_token_accuracy": 0.21638872474431992, "num_tokens": 99165969.0, "step": 47770 }, { "entropy": 5.569817352294922, "epoch": 4.33372641509434, "grad_norm": 1.3515625, "learning_rate": 0.0003253123299108388, "loss": 4.7691, "mean_token_accuracy": 0.23499057590961456, "num_tokens": 99176595.0, "step": 47775 }, { "entropy": 5.667035531997681, "epoch": 4.334179970972424, "grad_norm": 1.234375, "learning_rate": 0.0003252807922801615, "loss": 4.8853, "mean_token_accuracy": 0.22287643253803252, "num_tokens": 99186916.0, "step": 47780 }, { "entropy": 5.676402997970581, "epoch": 4.334633526850508, "grad_norm": 1.3046875, "learning_rate": 0.0003252492536096646, "loss": 4.9862, "mean_token_accuracy": 0.21792744249105453, "num_tokens": 99197892.0, "step": 47785 }, { "entropy": 5.662909650802613, "epoch": 4.3350870827285926, "grad_norm": 1.4453125, "learning_rate": 0.0003252177139000003, "loss": 4.8981, "mean_token_accuracy": 0.22544106543064119, "num_tokens": 99208373.0, "step": 47790 }, { "entropy": 5.678479528427124, "epoch": 4.335540638606676, "grad_norm": 1.1953125, "learning_rate": 0.0003251861731518209, "loss": 4.8863, "mean_token_accuracy": 0.22625533640384674, "num_tokens": 99218788.0, "step": 47795 }, { "entropy": 5.726149368286133, "epoch": 4.33599419448476, "grad_norm": 1.4609375, "learning_rate": 0.00032515463136577864, "loss": 4.9289, "mean_token_accuracy": 0.22453456073999406, "num_tokens": 99228653.0, "step": 47800 }, { "entropy": 5.603572177886963, "epoch": 4.3364477503628445, "grad_norm": 1.296875, "learning_rate": 0.00032512308854252577, "loss": 4.7935, "mean_token_accuracy": 0.23357176780700684, "num_tokens": 99239925.0, "step": 47805 }, { "entropy": 5.5493011474609375, "epoch": 4.336901306240929, "grad_norm": 1.3515625, "learning_rate": 0.0003250915446827147, "loss": 4.75, "mean_token_accuracy": 0.2331490099430084, "num_tokens": 99250091.0, "step": 47810 }, { "entropy": 5.590400695800781, "epoch": 4.337354862119013, "grad_norm": 1.203125, "learning_rate": 0.0003250599997869977, "loss": 4.8831, "mean_token_accuracy": 0.21178607344627381, "num_tokens": 99260799.0, "step": 47815 }, { "entropy": 5.582299137115479, "epoch": 4.337808417997097, "grad_norm": 1.3828125, "learning_rate": 0.0003250284538560272, "loss": 4.8092, "mean_token_accuracy": 0.23411945402622222, "num_tokens": 99270338.0, "step": 47820 }, { "entropy": 5.596254873275757, "epoch": 4.3382619738751815, "grad_norm": 1.2734375, "learning_rate": 0.0003249969068904554, "loss": 4.84, "mean_token_accuracy": 0.2245519995689392, "num_tokens": 99280419.0, "step": 47825 }, { "entropy": 5.681427955627441, "epoch": 4.338715529753266, "grad_norm": 1.203125, "learning_rate": 0.00032496535889093496, "loss": 4.9376, "mean_token_accuracy": 0.22201812416315078, "num_tokens": 99291590.0, "step": 47830 }, { "entropy": 5.658459854125977, "epoch": 4.33916908563135, "grad_norm": 1.3359375, "learning_rate": 0.00032493380985811814, "loss": 4.923, "mean_token_accuracy": 0.2200256645679474, "num_tokens": 99301987.0, "step": 47835 }, { "entropy": 5.669340324401856, "epoch": 4.339622641509434, "grad_norm": 1.484375, "learning_rate": 0.00032490225979265734, "loss": 4.8797, "mean_token_accuracy": 0.2253356993198395, "num_tokens": 99312231.0, "step": 47840 }, { "entropy": 5.664461231231689, "epoch": 4.340076197387518, "grad_norm": 1.265625, "learning_rate": 0.00032487070869520517, "loss": 4.8157, "mean_token_accuracy": 0.22471612840890884, "num_tokens": 99322784.0, "step": 47845 }, { "entropy": 5.6572594165802, "epoch": 4.340529753265602, "grad_norm": 1.2890625, "learning_rate": 0.000324839156566414, "loss": 4.9282, "mean_token_accuracy": 0.22448582351207733, "num_tokens": 99333989.0, "step": 47850 }, { "entropy": 5.561170625686645, "epoch": 4.340983309143686, "grad_norm": 1.3203125, "learning_rate": 0.0003248076034069364, "loss": 4.8384, "mean_token_accuracy": 0.2304004117846489, "num_tokens": 99345034.0, "step": 47855 }, { "entropy": 5.585924291610718, "epoch": 4.3414368650217705, "grad_norm": 1.328125, "learning_rate": 0.0003247760492174248, "loss": 4.7924, "mean_token_accuracy": 0.22956569194793702, "num_tokens": 99356062.0, "step": 47860 }, { "entropy": 5.632416915893555, "epoch": 4.341890420899855, "grad_norm": 1.3515625, "learning_rate": 0.0003247444939985319, "loss": 4.823, "mean_token_accuracy": 0.2353198766708374, "num_tokens": 99365315.0, "step": 47865 }, { "entropy": 5.703348827362061, "epoch": 4.342343976777939, "grad_norm": 1.4453125, "learning_rate": 0.00032471293775091013, "loss": 4.8731, "mean_token_accuracy": 0.22791737020015718, "num_tokens": 99374897.0, "step": 47870 }, { "entropy": 5.608999347686767, "epoch": 4.342797532656023, "grad_norm": 1.453125, "learning_rate": 0.00032468138047521216, "loss": 4.8179, "mean_token_accuracy": 0.23082666099071503, "num_tokens": 99383624.0, "step": 47875 }, { "entropy": 5.569965076446533, "epoch": 4.343251088534108, "grad_norm": 1.25, "learning_rate": 0.0003246498221720906, "loss": 4.8494, "mean_token_accuracy": 0.22204968631267546, "num_tokens": 99393791.0, "step": 47880 }, { "entropy": 5.612374258041382, "epoch": 4.343704644412192, "grad_norm": 1.328125, "learning_rate": 0.000324618262842198, "loss": 4.8944, "mean_token_accuracy": 0.22458772957324982, "num_tokens": 99403687.0, "step": 47885 }, { "entropy": 5.640883684158325, "epoch": 4.344158200290276, "grad_norm": 1.34375, "learning_rate": 0.00032458670248618714, "loss": 4.8325, "mean_token_accuracy": 0.22591176480054856, "num_tokens": 99413411.0, "step": 47890 }, { "entropy": 5.655157232284546, "epoch": 4.34461175616836, "grad_norm": 1.3046875, "learning_rate": 0.0003245551411047106, "loss": 4.8977, "mean_token_accuracy": 0.22235150933265685, "num_tokens": 99425563.0, "step": 47895 }, { "entropy": 5.627981042861938, "epoch": 4.345065312046444, "grad_norm": 1.171875, "learning_rate": 0.00032452357869842117, "loss": 4.8445, "mean_token_accuracy": 0.23448598086833955, "num_tokens": 99436297.0, "step": 47900 }, { "entropy": 5.6689050674438475, "epoch": 4.345518867924528, "grad_norm": 1.359375, "learning_rate": 0.0003244920152679715, "loss": 4.8553, "mean_token_accuracy": 0.22996119260787964, "num_tokens": 99445745.0, "step": 47905 }, { "entropy": 5.600391578674317, "epoch": 4.345972423802612, "grad_norm": 1.359375, "learning_rate": 0.00032446045081401426, "loss": 4.8793, "mean_token_accuracy": 0.22004247456789017, "num_tokens": 99456915.0, "step": 47910 }, { "entropy": 5.675147581100464, "epoch": 4.3464259796806965, "grad_norm": 1.3515625, "learning_rate": 0.0003244288853372024, "loss": 4.8823, "mean_token_accuracy": 0.2235233649611473, "num_tokens": 99466778.0, "step": 47915 }, { "entropy": 5.653891849517822, "epoch": 4.346879535558781, "grad_norm": 1.3828125, "learning_rate": 0.0003243973188381885, "loss": 4.8367, "mean_token_accuracy": 0.22305303663015366, "num_tokens": 99475984.0, "step": 47920 }, { "entropy": 5.539736604690551, "epoch": 4.347333091436865, "grad_norm": 1.25, "learning_rate": 0.00032436575131762553, "loss": 4.8357, "mean_token_accuracy": 0.220150326192379, "num_tokens": 99486238.0, "step": 47925 }, { "entropy": 5.7392138004302975, "epoch": 4.347786647314949, "grad_norm": 1.4765625, "learning_rate": 0.00032433418277616623, "loss": 4.9157, "mean_token_accuracy": 0.2254258319735527, "num_tokens": 99497806.0, "step": 47930 }, { "entropy": 5.635987758636475, "epoch": 4.348240203193034, "grad_norm": 1.3828125, "learning_rate": 0.0003243026132144635, "loss": 4.8654, "mean_token_accuracy": 0.22160115987062454, "num_tokens": 99507214.0, "step": 47935 }, { "entropy": 5.640987300872803, "epoch": 4.348693759071118, "grad_norm": 1.296875, "learning_rate": 0.0003242710426331701, "loss": 4.9046, "mean_token_accuracy": 0.2243996098637581, "num_tokens": 99517025.0, "step": 47940 }, { "entropy": 5.667987871170044, "epoch": 4.349147314949202, "grad_norm": 1.328125, "learning_rate": 0.00032423947103293893, "loss": 4.9017, "mean_token_accuracy": 0.22466300427913666, "num_tokens": 99526972.0, "step": 47945 }, { "entropy": 5.664741563796997, "epoch": 4.3496008708272855, "grad_norm": 1.28125, "learning_rate": 0.00032420789841442306, "loss": 4.9113, "mean_token_accuracy": 0.21778185069561004, "num_tokens": 99538583.0, "step": 47950 }, { "entropy": 5.582291889190674, "epoch": 4.35005442670537, "grad_norm": 1.375, "learning_rate": 0.00032417632477827526, "loss": 4.7995, "mean_token_accuracy": 0.23142951130867004, "num_tokens": 99549178.0, "step": 47955 }, { "entropy": 5.615753269195556, "epoch": 4.350507982583454, "grad_norm": 1.3046875, "learning_rate": 0.00032414475012514847, "loss": 4.8412, "mean_token_accuracy": 0.2285893440246582, "num_tokens": 99558491.0, "step": 47960 }, { "entropy": 5.6170494556427, "epoch": 4.350961538461538, "grad_norm": 1.2421875, "learning_rate": 0.0003241131744556958, "loss": 4.8917, "mean_token_accuracy": 0.22427558600902558, "num_tokens": 99568711.0, "step": 47965 }, { "entropy": 5.59133734703064, "epoch": 4.351415094339623, "grad_norm": 1.3359375, "learning_rate": 0.0003240815977705702, "loss": 4.868, "mean_token_accuracy": 0.22320684492588044, "num_tokens": 99578329.0, "step": 47970 }, { "entropy": 5.5686053276062015, "epoch": 4.351868650217707, "grad_norm": 1.3203125, "learning_rate": 0.00032405002007042453, "loss": 4.7353, "mean_token_accuracy": 0.2318221852183342, "num_tokens": 99588646.0, "step": 47975 }, { "entropy": 5.669190549850464, "epoch": 4.352322206095791, "grad_norm": 1.3203125, "learning_rate": 0.00032401844135591213, "loss": 4.9034, "mean_token_accuracy": 0.21720054745674133, "num_tokens": 99598780.0, "step": 47980 }, { "entropy": 5.647005319595337, "epoch": 4.352775761973875, "grad_norm": 1.28125, "learning_rate": 0.0003239868616276857, "loss": 4.8516, "mean_token_accuracy": 0.22623246908187866, "num_tokens": 99609528.0, "step": 47985 }, { "entropy": 5.583690595626831, "epoch": 4.35322931785196, "grad_norm": 1.28125, "learning_rate": 0.0003239552808863986, "loss": 4.7842, "mean_token_accuracy": 0.23177415877580643, "num_tokens": 99619928.0, "step": 47990 }, { "entropy": 5.569075393676758, "epoch": 4.353682873730044, "grad_norm": 1.3046875, "learning_rate": 0.00032392369913270376, "loss": 4.7651, "mean_token_accuracy": 0.22978690415620803, "num_tokens": 99630135.0, "step": 47995 }, { "entropy": 5.651469612121582, "epoch": 4.354136429608127, "grad_norm": 1.1953125, "learning_rate": 0.0003238921163672544, "loss": 4.9806, "mean_token_accuracy": 0.2099696949124336, "num_tokens": 99641557.0, "step": 48000 }, { "epoch": 4.354136429608127, "eval_entropy": 5.325137837224417, "eval_loss": 4.948969841003418, "eval_mean_token_accuracy": 0.22987959253605944, "eval_num_tokens": 99641557.0, "eval_runtime": 20.6212, "eval_samples_per_second": 1714.743, "eval_steps_per_second": 214.343, "step": 48000 }, { "entropy": 5.640565633773804, "epoch": 4.354589985486212, "grad_norm": 1.2734375, "learning_rate": 0.0003238605325907035, "loss": 4.8686, "mean_token_accuracy": 0.22544457018375397, "num_tokens": 99651244.0, "step": 48005 }, { "entropy": 5.641449737548828, "epoch": 4.355043541364296, "grad_norm": 1.3046875, "learning_rate": 0.00032382894780370446, "loss": 4.8361, "mean_token_accuracy": 0.221346116065979, "num_tokens": 99662317.0, "step": 48010 }, { "entropy": 5.622298240661621, "epoch": 4.35549709724238, "grad_norm": 1.4296875, "learning_rate": 0.00032379736200691036, "loss": 4.8179, "mean_token_accuracy": 0.22855726927518843, "num_tokens": 99671624.0, "step": 48015 }, { "entropy": 5.6669697761535645, "epoch": 4.355950653120464, "grad_norm": 1.34375, "learning_rate": 0.00032376577520097427, "loss": 4.9677, "mean_token_accuracy": 0.21547969430685043, "num_tokens": 99682076.0, "step": 48020 }, { "entropy": 5.590432596206665, "epoch": 4.356404208998549, "grad_norm": 1.3515625, "learning_rate": 0.00032373418738654953, "loss": 4.8631, "mean_token_accuracy": 0.22628352642059327, "num_tokens": 99692076.0, "step": 48025 }, { "entropy": 5.6119671821594235, "epoch": 4.356857764876633, "grad_norm": 1.34375, "learning_rate": 0.0003237025985642895, "loss": 4.8407, "mean_token_accuracy": 0.22803518921136856, "num_tokens": 99701455.0, "step": 48030 }, { "entropy": 5.666763830184936, "epoch": 4.357311320754717, "grad_norm": 1.3671875, "learning_rate": 0.00032367100873484725, "loss": 4.8806, "mean_token_accuracy": 0.22491520047187805, "num_tokens": 99712034.0, "step": 48035 }, { "entropy": 5.665150785446167, "epoch": 4.357764876632801, "grad_norm": 1.25, "learning_rate": 0.000323639417898876, "loss": 4.8873, "mean_token_accuracy": 0.22376833111047745, "num_tokens": 99722965.0, "step": 48040 }, { "entropy": 5.55571665763855, "epoch": 4.358218432510886, "grad_norm": 1.2890625, "learning_rate": 0.0003236078260570293, "loss": 4.7836, "mean_token_accuracy": 0.22473234236240386, "num_tokens": 99732847.0, "step": 48045 }, { "entropy": 5.576132440567017, "epoch": 4.35867198838897, "grad_norm": 1.328125, "learning_rate": 0.0003235762332099604, "loss": 4.7986, "mean_token_accuracy": 0.23672358095645904, "num_tokens": 99743639.0, "step": 48050 }, { "entropy": 5.617038106918335, "epoch": 4.359125544267053, "grad_norm": 1.328125, "learning_rate": 0.0003235446393583227, "loss": 4.775, "mean_token_accuracy": 0.23903438150882722, "num_tokens": 99753374.0, "step": 48055 }, { "entropy": 5.62092695236206, "epoch": 4.359579100145138, "grad_norm": 1.4453125, "learning_rate": 0.0003235130445027693, "loss": 4.8089, "mean_token_accuracy": 0.23170243352651596, "num_tokens": 99763361.0, "step": 48060 }, { "entropy": 5.679444265365601, "epoch": 4.360032656023222, "grad_norm": 1.4140625, "learning_rate": 0.00032348144864395383, "loss": 4.9354, "mean_token_accuracy": 0.22190809696912767, "num_tokens": 99773813.0, "step": 48065 }, { "entropy": 5.625652742385864, "epoch": 4.360486211901306, "grad_norm": 1.296875, "learning_rate": 0.0003234498517825297, "loss": 4.8479, "mean_token_accuracy": 0.22292246371507646, "num_tokens": 99784812.0, "step": 48070 }, { "entropy": 5.630132246017456, "epoch": 4.36093976777939, "grad_norm": 1.328125, "learning_rate": 0.00032341825391915026, "loss": 4.8308, "mean_token_accuracy": 0.23031337261199952, "num_tokens": 99795197.0, "step": 48075 }, { "entropy": 5.553213262557984, "epoch": 4.361393323657475, "grad_norm": 1.3125, "learning_rate": 0.000323386655054469, "loss": 4.8785, "mean_token_accuracy": 0.22989968955516815, "num_tokens": 99805883.0, "step": 48080 }, { "entropy": 5.625237941741943, "epoch": 4.361846879535559, "grad_norm": 1.2421875, "learning_rate": 0.0003233550551891394, "loss": 4.8582, "mean_token_accuracy": 0.2221593976020813, "num_tokens": 99816940.0, "step": 48085 }, { "entropy": 5.608311748504638, "epoch": 4.362300435413643, "grad_norm": 1.2890625, "learning_rate": 0.00032332345432381493, "loss": 4.8283, "mean_token_accuracy": 0.22529232650995254, "num_tokens": 99827926.0, "step": 48090 }, { "entropy": 5.570586490631103, "epoch": 4.3627539912917275, "grad_norm": 1.2578125, "learning_rate": 0.0003232918524591491, "loss": 4.8178, "mean_token_accuracy": 0.23092973232269287, "num_tokens": 99837900.0, "step": 48095 }, { "entropy": 5.670150232315064, "epoch": 4.363207547169811, "grad_norm": 1.34375, "learning_rate": 0.0003232602495957955, "loss": 4.9058, "mean_token_accuracy": 0.21870438009500504, "num_tokens": 99848655.0, "step": 48100 }, { "entropy": 5.597477293014526, "epoch": 4.363661103047895, "grad_norm": 1.2265625, "learning_rate": 0.00032322864573440757, "loss": 4.8162, "mean_token_accuracy": 0.22718170136213303, "num_tokens": 99859715.0, "step": 48105 }, { "entropy": 5.598419189453125, "epoch": 4.364114658925979, "grad_norm": 1.3515625, "learning_rate": 0.0003231970408756389, "loss": 4.806, "mean_token_accuracy": 0.23490022271871566, "num_tokens": 99870175.0, "step": 48110 }, { "entropy": 5.666688537597656, "epoch": 4.364568214804064, "grad_norm": 1.3984375, "learning_rate": 0.0003231654350201432, "loss": 4.8853, "mean_token_accuracy": 0.22053509801626206, "num_tokens": 99879794.0, "step": 48115 }, { "entropy": 5.642016839981079, "epoch": 4.365021770682148, "grad_norm": 1.2578125, "learning_rate": 0.0003231338281685741, "loss": 4.8487, "mean_token_accuracy": 0.23228411227464676, "num_tokens": 99889418.0, "step": 48120 }, { "entropy": 5.670563364028931, "epoch": 4.365475326560232, "grad_norm": 1.5859375, "learning_rate": 0.0003231022203215851, "loss": 4.8932, "mean_token_accuracy": 0.22479935437440873, "num_tokens": 99898741.0, "step": 48125 }, { "entropy": 5.580864524841308, "epoch": 4.3659288824383164, "grad_norm": 1.3515625, "learning_rate": 0.00032307061147982994, "loss": 4.809, "mean_token_accuracy": 0.2266858011484146, "num_tokens": 99909167.0, "step": 48130 }, { "entropy": 5.601598405838013, "epoch": 4.366382438316401, "grad_norm": 1.3828125, "learning_rate": 0.0003230390016439623, "loss": 4.8428, "mean_token_accuracy": 0.2315944418311119, "num_tokens": 99918786.0, "step": 48135 }, { "entropy": 5.6030748844146725, "epoch": 4.366835994194485, "grad_norm": 1.359375, "learning_rate": 0.0003230073908146359, "loss": 4.9053, "mean_token_accuracy": 0.22128552496433257, "num_tokens": 99928758.0, "step": 48140 }, { "entropy": 5.604924726486206, "epoch": 4.367289550072569, "grad_norm": 1.3046875, "learning_rate": 0.0003229757789925044, "loss": 4.8243, "mean_token_accuracy": 0.22608945071697234, "num_tokens": 99939721.0, "step": 48145 }, { "entropy": 5.573545455932617, "epoch": 4.3677431059506535, "grad_norm": 1.3125, "learning_rate": 0.0003229441661782215, "loss": 4.7936, "mean_token_accuracy": 0.228642600774765, "num_tokens": 99949308.0, "step": 48150 }, { "entropy": 5.606756067276001, "epoch": 4.368196661828737, "grad_norm": 1.359375, "learning_rate": 0.00032291255237244104, "loss": 4.8631, "mean_token_accuracy": 0.22624740302562713, "num_tokens": 99960284.0, "step": 48155 }, { "entropy": 5.563920307159424, "epoch": 4.368650217706821, "grad_norm": 1.515625, "learning_rate": 0.00032288093757581684, "loss": 4.7561, "mean_token_accuracy": 0.23164529204368592, "num_tokens": 99970701.0, "step": 48160 }, { "entropy": 5.634937143325805, "epoch": 4.369103773584905, "grad_norm": 1.2265625, "learning_rate": 0.0003228493217890026, "loss": 4.826, "mean_token_accuracy": 0.22586302906274797, "num_tokens": 99981362.0, "step": 48165 }, { "entropy": 5.651753520965576, "epoch": 4.36955732946299, "grad_norm": 1.265625, "learning_rate": 0.0003228177050126523, "loss": 4.8626, "mean_token_accuracy": 0.2321810856461525, "num_tokens": 99991383.0, "step": 48170 }, { "entropy": 5.6074323654174805, "epoch": 4.370010885341074, "grad_norm": 1.1953125, "learning_rate": 0.00032278608724741956, "loss": 4.8668, "mean_token_accuracy": 0.22491192668676377, "num_tokens": 100001176.0, "step": 48175 }, { "entropy": 5.602209663391113, "epoch": 4.370464441219158, "grad_norm": 1.3203125, "learning_rate": 0.0003227544684939584, "loss": 4.8113, "mean_token_accuracy": 0.23598344027996063, "num_tokens": 100011467.0, "step": 48180 }, { "entropy": 5.6369462490081785, "epoch": 4.3709179970972425, "grad_norm": 1.28125, "learning_rate": 0.0003227228487529226, "loss": 4.8329, "mean_token_accuracy": 0.2289295732975006, "num_tokens": 100020976.0, "step": 48185 }, { "entropy": 5.586886930465698, "epoch": 4.371371552975327, "grad_norm": 1.2421875, "learning_rate": 0.0003226912280249662, "loss": 4.8476, "mean_token_accuracy": 0.2286357969045639, "num_tokens": 100032250.0, "step": 48190 }, { "entropy": 5.636065053939819, "epoch": 4.371825108853411, "grad_norm": 1.328125, "learning_rate": 0.000322659606310743, "loss": 4.8457, "mean_token_accuracy": 0.22684965431690216, "num_tokens": 100043383.0, "step": 48195 }, { "entropy": 5.58125524520874, "epoch": 4.372278664731495, "grad_norm": 1.265625, "learning_rate": 0.00032262798361090705, "loss": 4.7675, "mean_token_accuracy": 0.23555166125297547, "num_tokens": 100053396.0, "step": 48200 }, { "entropy": 5.605345296859741, "epoch": 4.37273222060958, "grad_norm": 1.359375, "learning_rate": 0.0003225963599261123, "loss": 4.8466, "mean_token_accuracy": 0.2257437750697136, "num_tokens": 100064159.0, "step": 48205 }, { "entropy": 5.5784539699554445, "epoch": 4.373185776487663, "grad_norm": 1.3828125, "learning_rate": 0.00032256473525701257, "loss": 4.7913, "mean_token_accuracy": 0.2432887449860573, "num_tokens": 100074722.0, "step": 48210 }, { "entropy": 5.565586423873901, "epoch": 4.373639332365747, "grad_norm": 1.390625, "learning_rate": 0.00032253310960426215, "loss": 4.8129, "mean_token_accuracy": 0.23467101156711578, "num_tokens": 100085067.0, "step": 48215 }, { "entropy": 5.620814037322998, "epoch": 4.3740928882438315, "grad_norm": 1.3515625, "learning_rate": 0.00032250148296851484, "loss": 4.8712, "mean_token_accuracy": 0.22941384464502335, "num_tokens": 100095806.0, "step": 48220 }, { "entropy": 5.7151954650878904, "epoch": 4.374546444121916, "grad_norm": 1.2421875, "learning_rate": 0.0003224698553504247, "loss": 4.9356, "mean_token_accuracy": 0.21616954654455184, "num_tokens": 100106069.0, "step": 48225 }, { "entropy": 5.68791880607605, "epoch": 4.375, "grad_norm": 1.28125, "learning_rate": 0.00032243822675064585, "loss": 4.9077, "mean_token_accuracy": 0.21458782106637955, "num_tokens": 100117136.0, "step": 48230 }, { "entropy": 5.684746265411377, "epoch": 4.375453555878084, "grad_norm": 1.4765625, "learning_rate": 0.0003224065971698324, "loss": 4.8903, "mean_token_accuracy": 0.211772383749485, "num_tokens": 100126757.0, "step": 48235 }, { "entropy": 5.774072074890137, "epoch": 4.3759071117561685, "grad_norm": 1.296875, "learning_rate": 0.0003223749666086385, "loss": 4.9884, "mean_token_accuracy": 0.21950967162847518, "num_tokens": 100138431.0, "step": 48240 }, { "entropy": 5.654997777938843, "epoch": 4.376360667634253, "grad_norm": 1.28125, "learning_rate": 0.0003223433350677182, "loss": 4.8716, "mean_token_accuracy": 0.22089108526706697, "num_tokens": 100148919.0, "step": 48245 }, { "entropy": 5.688544416427613, "epoch": 4.376814223512337, "grad_norm": 1.3984375, "learning_rate": 0.0003223117025477256, "loss": 4.9795, "mean_token_accuracy": 0.2220478057861328, "num_tokens": 100159175.0, "step": 48250 }, { "entropy": 5.616968393325806, "epoch": 4.37726777939042, "grad_norm": 1.296875, "learning_rate": 0.0003222800690493151, "loss": 4.8261, "mean_token_accuracy": 0.22433843165636064, "num_tokens": 100169451.0, "step": 48255 }, { "entropy": 5.649549961090088, "epoch": 4.377721335268505, "grad_norm": 1.3828125, "learning_rate": 0.0003222484345731405, "loss": 4.8607, "mean_token_accuracy": 0.21963613480329514, "num_tokens": 100180077.0, "step": 48260 }, { "entropy": 5.629762649536133, "epoch": 4.378174891146589, "grad_norm": 1.34375, "learning_rate": 0.00032221679911985634, "loss": 4.8515, "mean_token_accuracy": 0.22469949424266816, "num_tokens": 100190175.0, "step": 48265 }, { "entropy": 5.5940595149993895, "epoch": 4.378628447024673, "grad_norm": 1.2734375, "learning_rate": 0.00032218516269011676, "loss": 4.7848, "mean_token_accuracy": 0.2327679067850113, "num_tokens": 100200285.0, "step": 48270 }, { "entropy": 5.471023225784302, "epoch": 4.3790820029027575, "grad_norm": 1.3203125, "learning_rate": 0.00032215352528457597, "loss": 4.6874, "mean_token_accuracy": 0.23192292749881743, "num_tokens": 100210685.0, "step": 48275 }, { "entropy": 5.593541526794434, "epoch": 4.379535558780842, "grad_norm": 1.328125, "learning_rate": 0.00032212188690388825, "loss": 4.8065, "mean_token_accuracy": 0.2345779076218605, "num_tokens": 100220486.0, "step": 48280 }, { "entropy": 5.596224594116211, "epoch": 4.379989114658926, "grad_norm": 1.4375, "learning_rate": 0.00032209024754870796, "loss": 4.7713, "mean_token_accuracy": 0.22448755353689193, "num_tokens": 100229007.0, "step": 48285 }, { "entropy": 5.603769111633301, "epoch": 4.38044267053701, "grad_norm": 1.2265625, "learning_rate": 0.0003220586072196893, "loss": 4.7928, "mean_token_accuracy": 0.22924472391605377, "num_tokens": 100240363.0, "step": 48290 }, { "entropy": 5.555106067657471, "epoch": 4.380896226415095, "grad_norm": 1.453125, "learning_rate": 0.00032202696591748667, "loss": 4.8133, "mean_token_accuracy": 0.22545038312673568, "num_tokens": 100251193.0, "step": 48295 }, { "entropy": 5.593208265304566, "epoch": 4.381349782293179, "grad_norm": 1.328125, "learning_rate": 0.00032199532364275436, "loss": 4.8372, "mean_token_accuracy": 0.2314404234290123, "num_tokens": 100261248.0, "step": 48300 }, { "entropy": 5.630082082748413, "epoch": 4.381803338171263, "grad_norm": 1.28125, "learning_rate": 0.0003219636803961468, "loss": 4.8222, "mean_token_accuracy": 0.2231413394212723, "num_tokens": 100271174.0, "step": 48305 }, { "entropy": 5.6366759777069095, "epoch": 4.3822568940493465, "grad_norm": 1.1640625, "learning_rate": 0.00032193203617831835, "loss": 4.8905, "mean_token_accuracy": 0.22499779909849166, "num_tokens": 100282428.0, "step": 48310 }, { "entropy": 5.639781951904297, "epoch": 4.382710449927431, "grad_norm": 1.2734375, "learning_rate": 0.00032190039098992345, "loss": 4.8884, "mean_token_accuracy": 0.2247499167919159, "num_tokens": 100292559.0, "step": 48315 }, { "entropy": 5.567109680175781, "epoch": 4.383164005805515, "grad_norm": 1.234375, "learning_rate": 0.0003218687448316166, "loss": 4.7679, "mean_token_accuracy": 0.23415702134370803, "num_tokens": 100303956.0, "step": 48320 }, { "entropy": 5.557625818252563, "epoch": 4.383617561683599, "grad_norm": 1.140625, "learning_rate": 0.00032183709770405204, "loss": 4.8472, "mean_token_accuracy": 0.22660403400659562, "num_tokens": 100315281.0, "step": 48325 }, { "entropy": 5.647139406204223, "epoch": 4.3840711175616836, "grad_norm": 1.21875, "learning_rate": 0.0003218054496078844, "loss": 4.8875, "mean_token_accuracy": 0.2235768496990204, "num_tokens": 100326761.0, "step": 48330 }, { "entropy": 5.664307975769043, "epoch": 4.384524673439768, "grad_norm": 1.3046875, "learning_rate": 0.00032177380054376813, "loss": 4.914, "mean_token_accuracy": 0.22473444789648056, "num_tokens": 100337219.0, "step": 48335 }, { "entropy": 5.655197381973267, "epoch": 4.384978229317852, "grad_norm": 1.3671875, "learning_rate": 0.00032174215051235776, "loss": 4.8446, "mean_token_accuracy": 0.2313897728919983, "num_tokens": 100347135.0, "step": 48340 }, { "entropy": 5.535141563415527, "epoch": 4.385431785195936, "grad_norm": 1.3359375, "learning_rate": 0.00032171049951430775, "loss": 4.7254, "mean_token_accuracy": 0.24118565171957015, "num_tokens": 100357476.0, "step": 48345 }, { "entropy": 5.618880414962769, "epoch": 4.385885341074021, "grad_norm": 1.3203125, "learning_rate": 0.00032167884755027285, "loss": 4.8117, "mean_token_accuracy": 0.22324383705854417, "num_tokens": 100367860.0, "step": 48350 }, { "entropy": 5.626428651809692, "epoch": 4.386338896952105, "grad_norm": 1.296875, "learning_rate": 0.0003216471946209074, "loss": 4.8189, "mean_token_accuracy": 0.2282093808054924, "num_tokens": 100378613.0, "step": 48355 }, { "entropy": 5.607592153549194, "epoch": 4.386792452830189, "grad_norm": 1.296875, "learning_rate": 0.000321615540726866, "loss": 4.8773, "mean_token_accuracy": 0.2256610095500946, "num_tokens": 100389499.0, "step": 48360 }, { "entropy": 5.673888397216797, "epoch": 4.3872460087082725, "grad_norm": 1.234375, "learning_rate": 0.00032158388586880346, "loss": 4.889, "mean_token_accuracy": 0.2260989099740982, "num_tokens": 100400538.0, "step": 48365 }, { "entropy": 5.6334020614624025, "epoch": 4.387699564586357, "grad_norm": 1.3046875, "learning_rate": 0.00032155223004737423, "loss": 4.8809, "mean_token_accuracy": 0.23078583031892777, "num_tokens": 100411528.0, "step": 48370 }, { "entropy": 5.612975835800171, "epoch": 4.388153120464441, "grad_norm": 1.3671875, "learning_rate": 0.00032152057326323305, "loss": 4.861, "mean_token_accuracy": 0.21818068921566008, "num_tokens": 100421349.0, "step": 48375 }, { "entropy": 5.582864046096802, "epoch": 4.388606676342525, "grad_norm": 1.328125, "learning_rate": 0.00032148891551703445, "loss": 4.7939, "mean_token_accuracy": 0.22781539112329482, "num_tokens": 100431132.0, "step": 48380 }, { "entropy": 5.573835468292236, "epoch": 4.38906023222061, "grad_norm": 1.375, "learning_rate": 0.0003214572568094334, "loss": 4.8524, "mean_token_accuracy": 0.231012025475502, "num_tokens": 100441436.0, "step": 48385 }, { "entropy": 5.561656141281128, "epoch": 4.389513788098694, "grad_norm": 1.234375, "learning_rate": 0.0003214255971410843, "loss": 4.716, "mean_token_accuracy": 0.23499952703714372, "num_tokens": 100451711.0, "step": 48390 }, { "entropy": 5.75250096321106, "epoch": 4.389967343976778, "grad_norm": 1.3359375, "learning_rate": 0.000321393936512642, "loss": 4.9653, "mean_token_accuracy": 0.21917416900396347, "num_tokens": 100461177.0, "step": 48395 }, { "entropy": 5.627883100509644, "epoch": 4.390420899854862, "grad_norm": 1.3359375, "learning_rate": 0.00032136227492476145, "loss": 4.8678, "mean_token_accuracy": 0.22619658708572388, "num_tokens": 100471391.0, "step": 48400 }, { "entropy": 5.669579935073853, "epoch": 4.390874455732947, "grad_norm": 1.2578125, "learning_rate": 0.0003213306123780971, "loss": 4.8398, "mean_token_accuracy": 0.2283684179186821, "num_tokens": 100480747.0, "step": 48405 }, { "entropy": 5.640640926361084, "epoch": 4.39132801161103, "grad_norm": 1.40625, "learning_rate": 0.00032129894887330396, "loss": 4.8686, "mean_token_accuracy": 0.23353632390499116, "num_tokens": 100491451.0, "step": 48410 }, { "entropy": 5.686919069290161, "epoch": 4.391781567489114, "grad_norm": 1.28125, "learning_rate": 0.0003212672844110367, "loss": 4.8732, "mean_token_accuracy": 0.2256743222475052, "num_tokens": 100501801.0, "step": 48415 }, { "entropy": 5.588483047485352, "epoch": 4.392235123367199, "grad_norm": 1.4296875, "learning_rate": 0.00032123561899195026, "loss": 4.8533, "mean_token_accuracy": 0.2326078712940216, "num_tokens": 100511857.0, "step": 48420 }, { "entropy": 5.662438011169433, "epoch": 4.392688679245283, "grad_norm": 1.34375, "learning_rate": 0.0003212039526166994, "loss": 4.8449, "mean_token_accuracy": 0.22411953359842302, "num_tokens": 100523654.0, "step": 48425 }, { "entropy": 5.734838819503784, "epoch": 4.393142235123367, "grad_norm": 1.359375, "learning_rate": 0.00032117228528593907, "loss": 4.9327, "mean_token_accuracy": 0.2273124173283577, "num_tokens": 100533030.0, "step": 48430 }, { "entropy": 5.675047111511231, "epoch": 4.393595791001451, "grad_norm": 1.3203125, "learning_rate": 0.000321140617000324, "loss": 4.8835, "mean_token_accuracy": 0.21827754825353624, "num_tokens": 100543414.0, "step": 48435 }, { "entropy": 5.617260217666626, "epoch": 4.394049346879536, "grad_norm": 1.3359375, "learning_rate": 0.00032110894776050936, "loss": 4.8376, "mean_token_accuracy": 0.22989493012428283, "num_tokens": 100553303.0, "step": 48440 }, { "entropy": 5.556719779968262, "epoch": 4.39450290275762, "grad_norm": 1.40625, "learning_rate": 0.00032107727756714984, "loss": 4.8243, "mean_token_accuracy": 0.22862074226140977, "num_tokens": 100563030.0, "step": 48445 }, { "entropy": 5.6923400402069095, "epoch": 4.394956458635704, "grad_norm": 1.3046875, "learning_rate": 0.0003210456064209005, "loss": 4.9124, "mean_token_accuracy": 0.22064014822244643, "num_tokens": 100573216.0, "step": 48450 }, { "entropy": 5.606204080581665, "epoch": 4.395410014513788, "grad_norm": 1.265625, "learning_rate": 0.00032101393432241635, "loss": 4.7836, "mean_token_accuracy": 0.2295920431613922, "num_tokens": 100582646.0, "step": 48455 }, { "entropy": 5.625340700149536, "epoch": 4.395863570391873, "grad_norm": 1.2734375, "learning_rate": 0.00032098226127235215, "loss": 4.8925, "mean_token_accuracy": 0.21771706640720367, "num_tokens": 100593689.0, "step": 48460 }, { "entropy": 5.629131698608399, "epoch": 4.396317126269956, "grad_norm": 1.203125, "learning_rate": 0.0003209505872713632, "loss": 4.9278, "mean_token_accuracy": 0.2198092445731163, "num_tokens": 100604721.0, "step": 48465 }, { "entropy": 5.6555229187011715, "epoch": 4.39677068214804, "grad_norm": 1.2109375, "learning_rate": 0.00032091891232010434, "loss": 4.9178, "mean_token_accuracy": 0.2258932814002037, "num_tokens": 100614684.0, "step": 48470 }, { "entropy": 5.651744222640991, "epoch": 4.397224238026125, "grad_norm": 1.2734375, "learning_rate": 0.00032088723641923066, "loss": 4.8304, "mean_token_accuracy": 0.23021347522735597, "num_tokens": 100624434.0, "step": 48475 }, { "entropy": 5.723307943344116, "epoch": 4.397677793904209, "grad_norm": 1.3046875, "learning_rate": 0.00032085555956939726, "loss": 4.9884, "mean_token_accuracy": 0.21019589602947236, "num_tokens": 100635656.0, "step": 48480 }, { "entropy": 5.53769326210022, "epoch": 4.398131349782293, "grad_norm": 1.3046875, "learning_rate": 0.0003208238817712593, "loss": 4.7237, "mean_token_accuracy": 0.23821058869361877, "num_tokens": 100645749.0, "step": 48485 }, { "entropy": 5.54173264503479, "epoch": 4.398584905660377, "grad_norm": 1.265625, "learning_rate": 0.0003207922030254717, "loss": 4.8195, "mean_token_accuracy": 0.22556515634059907, "num_tokens": 100655814.0, "step": 48490 }, { "entropy": 5.586210060119629, "epoch": 4.399038461538462, "grad_norm": 1.2890625, "learning_rate": 0.00032076052333268964, "loss": 4.8164, "mean_token_accuracy": 0.2310555875301361, "num_tokens": 100665579.0, "step": 48495 }, { "entropy": 5.72037353515625, "epoch": 4.399492017416546, "grad_norm": 1.1796875, "learning_rate": 0.0003207288426935683, "loss": 4.9981, "mean_token_accuracy": 0.21578879058361053, "num_tokens": 100676421.0, "step": 48500 }, { "entropy": 5.623065233230591, "epoch": 4.39994557329463, "grad_norm": 1.3359375, "learning_rate": 0.0003206971611087629, "loss": 4.8135, "mean_token_accuracy": 0.23469114899635315, "num_tokens": 100686689.0, "step": 48505 }, { "entropy": 5.720742797851562, "epoch": 4.4003991291727145, "grad_norm": 1.3359375, "learning_rate": 0.0003206654785789285, "loss": 4.9397, "mean_token_accuracy": 0.22444673776626586, "num_tokens": 100697324.0, "step": 48510 }, { "entropy": 5.561285924911499, "epoch": 4.400852685050798, "grad_norm": 1.453125, "learning_rate": 0.00032063379510472036, "loss": 4.7743, "mean_token_accuracy": 0.23481216579675673, "num_tokens": 100706003.0, "step": 48515 }, { "entropy": 5.662320470809936, "epoch": 4.401306240928882, "grad_norm": 1.2890625, "learning_rate": 0.0003206021106867938, "loss": 4.898, "mean_token_accuracy": 0.23185317516326903, "num_tokens": 100716755.0, "step": 48520 }, { "entropy": 5.63327169418335, "epoch": 4.401759796806966, "grad_norm": 1.2890625, "learning_rate": 0.0003205704253258039, "loss": 4.896, "mean_token_accuracy": 0.22048550546169282, "num_tokens": 100727846.0, "step": 48525 }, { "entropy": 5.641690111160278, "epoch": 4.402213352685051, "grad_norm": 1.3671875, "learning_rate": 0.000320538739022406, "loss": 4.8402, "mean_token_accuracy": 0.22127152979373932, "num_tokens": 100738293.0, "step": 48530 }, { "entropy": 5.623243618011474, "epoch": 4.402666908563135, "grad_norm": 1.328125, "learning_rate": 0.0003205070517772554, "loss": 4.7829, "mean_token_accuracy": 0.23062654286623002, "num_tokens": 100748031.0, "step": 48535 }, { "entropy": 5.581604242324829, "epoch": 4.403120464441219, "grad_norm": 1.234375, "learning_rate": 0.0003204753635910073, "loss": 4.8023, "mean_token_accuracy": 0.2342190071940422, "num_tokens": 100758825.0, "step": 48540 }, { "entropy": 5.630904817581177, "epoch": 4.4035740203193035, "grad_norm": 1.359375, "learning_rate": 0.00032044367446431714, "loss": 4.827, "mean_token_accuracy": 0.23125179708003998, "num_tokens": 100768226.0, "step": 48545 }, { "entropy": 5.584793138504028, "epoch": 4.404027576197388, "grad_norm": 1.390625, "learning_rate": 0.00032041198439784025, "loss": 4.7871, "mean_token_accuracy": 0.2283258855342865, "num_tokens": 100778125.0, "step": 48550 }, { "entropy": 5.6403961181640625, "epoch": 4.404481132075472, "grad_norm": 1.359375, "learning_rate": 0.0003203802933922319, "loss": 4.8371, "mean_token_accuracy": 0.23356873244047166, "num_tokens": 100788670.0, "step": 48555 }, { "entropy": 5.636342239379883, "epoch": 4.404934687953556, "grad_norm": 1.265625, "learning_rate": 0.00032034860144814756, "loss": 4.8784, "mean_token_accuracy": 0.22310814261436462, "num_tokens": 100800077.0, "step": 48560 }, { "entropy": 5.631391000747681, "epoch": 4.40538824383164, "grad_norm": 1.3515625, "learning_rate": 0.0003203169085662425, "loss": 4.849, "mean_token_accuracy": 0.2280895307660103, "num_tokens": 100809432.0, "step": 48565 }, { "entropy": 5.612020587921142, "epoch": 4.405841799709724, "grad_norm": 1.34375, "learning_rate": 0.0003202852147471723, "loss": 4.8318, "mean_token_accuracy": 0.23678984493017197, "num_tokens": 100819675.0, "step": 48570 }, { "entropy": 5.653158473968506, "epoch": 4.406295355587808, "grad_norm": 1.421875, "learning_rate": 0.00032025351999159237, "loss": 4.8598, "mean_token_accuracy": 0.22723868042230605, "num_tokens": 100829779.0, "step": 48575 }, { "entropy": 5.624128246307373, "epoch": 4.406748911465892, "grad_norm": 1.234375, "learning_rate": 0.00032022182430015795, "loss": 4.9132, "mean_token_accuracy": 0.21592796295881272, "num_tokens": 100839840.0, "step": 48580 }, { "entropy": 5.60003342628479, "epoch": 4.407202467343977, "grad_norm": 1.3515625, "learning_rate": 0.0003201901276735248, "loss": 4.8904, "mean_token_accuracy": 0.2246597155928612, "num_tokens": 100849495.0, "step": 48585 }, { "entropy": 5.600904083251953, "epoch": 4.407656023222061, "grad_norm": 1.375, "learning_rate": 0.00032015843011234826, "loss": 4.843, "mean_token_accuracy": 0.22320834249258042, "num_tokens": 100860214.0, "step": 48590 }, { "entropy": 5.736521768569946, "epoch": 4.408109579100145, "grad_norm": 1.3203125, "learning_rate": 0.00032012673161728396, "loss": 4.9735, "mean_token_accuracy": 0.20974743068218232, "num_tokens": 100870773.0, "step": 48595 }, { "entropy": 5.676349830627442, "epoch": 4.4085631349782295, "grad_norm": 1.375, "learning_rate": 0.00032009503218898716, "loss": 4.8599, "mean_token_accuracy": 0.23422354012727736, "num_tokens": 100880654.0, "step": 48600 }, { "entropy": 5.573979330062866, "epoch": 4.409016690856314, "grad_norm": 1.34375, "learning_rate": 0.0003200633318281138, "loss": 4.827, "mean_token_accuracy": 0.22613150775432586, "num_tokens": 100891217.0, "step": 48605 }, { "entropy": 5.600195121765137, "epoch": 4.409470246734398, "grad_norm": 1.5, "learning_rate": 0.00032003163053531913, "loss": 4.7571, "mean_token_accuracy": 0.23134440630674363, "num_tokens": 100901424.0, "step": 48610 }, { "entropy": 5.663672685623169, "epoch": 4.409923802612482, "grad_norm": 1.3515625, "learning_rate": 0.00031999992831125893, "loss": 4.9312, "mean_token_accuracy": 0.22636909037828445, "num_tokens": 100912069.0, "step": 48615 }, { "entropy": 5.597124862670898, "epoch": 4.410377358490566, "grad_norm": 1.3671875, "learning_rate": 0.0003199682251565887, "loss": 4.8514, "mean_token_accuracy": 0.21679269075393676, "num_tokens": 100922750.0, "step": 48620 }, { "entropy": 5.66830530166626, "epoch": 4.41083091436865, "grad_norm": 1.3515625, "learning_rate": 0.00031993652107196416, "loss": 4.8926, "mean_token_accuracy": 0.22561971694231034, "num_tokens": 100933052.0, "step": 48625 }, { "entropy": 5.667844963073731, "epoch": 4.411284470246734, "grad_norm": 1.21875, "learning_rate": 0.00031990481605804084, "loss": 4.8513, "mean_token_accuracy": 0.22934581339359283, "num_tokens": 100944519.0, "step": 48630 }, { "entropy": 5.597740507125854, "epoch": 4.4117380261248185, "grad_norm": 1.3046875, "learning_rate": 0.00031987311011547455, "loss": 4.8908, "mean_token_accuracy": 0.21607525944709777, "num_tokens": 100954901.0, "step": 48635 }, { "entropy": 5.611607837677002, "epoch": 4.412191582002903, "grad_norm": 1.25, "learning_rate": 0.0003198414032449209, "loss": 4.829, "mean_token_accuracy": 0.22785748392343522, "num_tokens": 100964931.0, "step": 48640 }, { "entropy": 5.671269702911377, "epoch": 4.412645137880987, "grad_norm": 1.34375, "learning_rate": 0.0003198096954470356, "loss": 4.8379, "mean_token_accuracy": 0.23043961226940154, "num_tokens": 100974877.0, "step": 48645 }, { "entropy": 5.6868133544921875, "epoch": 4.413098693759071, "grad_norm": 1.390625, "learning_rate": 0.00031977798672247444, "loss": 4.9431, "mean_token_accuracy": 0.2288626477122307, "num_tokens": 100986122.0, "step": 48650 }, { "entropy": 5.669177055358887, "epoch": 4.4135522496371555, "grad_norm": 1.2265625, "learning_rate": 0.00031974627707189303, "loss": 4.8532, "mean_token_accuracy": 0.22193720042705536, "num_tokens": 100996489.0, "step": 48655 }, { "entropy": 5.616918563842773, "epoch": 4.41400580551524, "grad_norm": 1.3125, "learning_rate": 0.00031971456649594723, "loss": 4.9068, "mean_token_accuracy": 0.22649308443069457, "num_tokens": 101006453.0, "step": 48660 }, { "entropy": 5.669553613662719, "epoch": 4.414459361393324, "grad_norm": 1.515625, "learning_rate": 0.0003196828549952927, "loss": 4.8972, "mean_token_accuracy": 0.2235180765390396, "num_tokens": 101015609.0, "step": 48665 }, { "entropy": 5.659882640838623, "epoch": 4.4149129172714074, "grad_norm": 1.40625, "learning_rate": 0.0003196511425705855, "loss": 4.8945, "mean_token_accuracy": 0.2221067875623703, "num_tokens": 101027406.0, "step": 48670 }, { "entropy": 5.593004560470581, "epoch": 4.415366473149492, "grad_norm": 1.3203125, "learning_rate": 0.0003196194292224812, "loss": 4.8528, "mean_token_accuracy": 0.2239632248878479, "num_tokens": 101038255.0, "step": 48675 }, { "entropy": 5.602800512313843, "epoch": 4.415820029027576, "grad_norm": 1.3828125, "learning_rate": 0.00031958771495163574, "loss": 4.8444, "mean_token_accuracy": 0.22615189254283904, "num_tokens": 101048857.0, "step": 48680 }, { "entropy": 5.675091505050659, "epoch": 4.41627358490566, "grad_norm": 1.359375, "learning_rate": 0.000319555999758705, "loss": 4.9248, "mean_token_accuracy": 0.22014941275119781, "num_tokens": 101058640.0, "step": 48685 }, { "entropy": 5.681172180175781, "epoch": 4.4167271407837445, "grad_norm": 1.34375, "learning_rate": 0.00031952428364434484, "loss": 5.0102, "mean_token_accuracy": 0.21964388638734816, "num_tokens": 101069537.0, "step": 48690 }, { "entropy": 5.660367965698242, "epoch": 4.417180696661829, "grad_norm": 1.2578125, "learning_rate": 0.00031949256660921104, "loss": 4.9034, "mean_token_accuracy": 0.2220981553196907, "num_tokens": 101080202.0, "step": 48695 }, { "entropy": 5.637272119522095, "epoch": 4.417634252539913, "grad_norm": 1.421875, "learning_rate": 0.00031946084865395975, "loss": 4.8585, "mean_token_accuracy": 0.22784958630800248, "num_tokens": 101089500.0, "step": 48700 }, { "entropy": 5.727157306671143, "epoch": 4.418087808417997, "grad_norm": 1.4296875, "learning_rate": 0.00031942912977924674, "loss": 4.9798, "mean_token_accuracy": 0.2177243188023567, "num_tokens": 101099858.0, "step": 48705 }, { "entropy": 5.644932270050049, "epoch": 4.418541364296082, "grad_norm": 1.3125, "learning_rate": 0.00031939740998572806, "loss": 4.9233, "mean_token_accuracy": 0.2193149819970131, "num_tokens": 101110834.0, "step": 48710 }, { "entropy": 5.660656452178955, "epoch": 4.418994920174166, "grad_norm": 1.3203125, "learning_rate": 0.0003193656892740595, "loss": 4.9084, "mean_token_accuracy": 0.2229199677705765, "num_tokens": 101121003.0, "step": 48715 }, { "entropy": 5.686791944503784, "epoch": 4.419448476052249, "grad_norm": 1.2734375, "learning_rate": 0.0003193339676448973, "loss": 4.897, "mean_token_accuracy": 0.21884216070175172, "num_tokens": 101131925.0, "step": 48720 }, { "entropy": 5.611762952804566, "epoch": 4.4199020319303335, "grad_norm": 1.375, "learning_rate": 0.0003193022450988973, "loss": 4.796, "mean_token_accuracy": 0.23181460350751876, "num_tokens": 101143130.0, "step": 48725 }, { "entropy": 5.5750497341156, "epoch": 4.420355587808418, "grad_norm": 1.2578125, "learning_rate": 0.0003192705216367156, "loss": 4.8359, "mean_token_accuracy": 0.2320162758231163, "num_tokens": 101155524.0, "step": 48730 }, { "entropy": 5.571474218368531, "epoch": 4.420809143686502, "grad_norm": 1.3203125, "learning_rate": 0.00031923879725900817, "loss": 4.8557, "mean_token_accuracy": 0.22663215100765227, "num_tokens": 101164815.0, "step": 48735 }, { "entropy": 5.652619743347168, "epoch": 4.421262699564586, "grad_norm": 1.328125, "learning_rate": 0.00031920707196643125, "loss": 4.9529, "mean_token_accuracy": 0.21900852769613266, "num_tokens": 101174910.0, "step": 48740 }, { "entropy": 5.55000147819519, "epoch": 4.4217162554426706, "grad_norm": 1.2890625, "learning_rate": 0.0003191753457596407, "loss": 4.7272, "mean_token_accuracy": 0.22915629744529725, "num_tokens": 101185698.0, "step": 48745 }, { "entropy": 5.594257402420044, "epoch": 4.422169811320755, "grad_norm": 1.2109375, "learning_rate": 0.00031914361863929276, "loss": 4.8415, "mean_token_accuracy": 0.22395770251750946, "num_tokens": 101197001.0, "step": 48750 }, { "entropy": 5.574169874191284, "epoch": 4.422623367198839, "grad_norm": 1.4609375, "learning_rate": 0.0003191118906060436, "loss": 4.8246, "mean_token_accuracy": 0.22597149461507798, "num_tokens": 101206705.0, "step": 48755 }, { "entropy": 5.633812665939331, "epoch": 4.423076923076923, "grad_norm": 1.2890625, "learning_rate": 0.00031908016166054933, "loss": 4.8825, "mean_token_accuracy": 0.22382844239473343, "num_tokens": 101216484.0, "step": 48760 }, { "entropy": 5.622669839859009, "epoch": 4.423530478955008, "grad_norm": 1.359375, "learning_rate": 0.0003190484318034659, "loss": 4.8508, "mean_token_accuracy": 0.22478090971708298, "num_tokens": 101227169.0, "step": 48765 }, { "entropy": 5.647678089141846, "epoch": 4.423984034833092, "grad_norm": 1.3515625, "learning_rate": 0.0003190167010354499, "loss": 4.8307, "mean_token_accuracy": 0.2298034504055977, "num_tokens": 101236956.0, "step": 48770 }, { "entropy": 5.619843292236328, "epoch": 4.424437590711175, "grad_norm": 1.3359375, "learning_rate": 0.0003189849693571572, "loss": 4.8792, "mean_token_accuracy": 0.2212349757552147, "num_tokens": 101248681.0, "step": 48775 }, { "entropy": 5.657643365859985, "epoch": 4.4248911465892595, "grad_norm": 1.3203125, "learning_rate": 0.0003189532367692441, "loss": 4.8981, "mean_token_accuracy": 0.2212299734354019, "num_tokens": 101258375.0, "step": 48780 }, { "entropy": 5.5852197170257565, "epoch": 4.425344702467344, "grad_norm": 1.328125, "learning_rate": 0.00031892150327236693, "loss": 4.8486, "mean_token_accuracy": 0.22789230197668076, "num_tokens": 101268513.0, "step": 48785 }, { "entropy": 5.657761764526367, "epoch": 4.425798258345428, "grad_norm": 1.28125, "learning_rate": 0.0003188897688671818, "loss": 4.9113, "mean_token_accuracy": 0.21678464412689208, "num_tokens": 101278998.0, "step": 48790 }, { "entropy": 5.725422000885009, "epoch": 4.426251814223512, "grad_norm": 1.1796875, "learning_rate": 0.00031885803355434516, "loss": 4.9164, "mean_token_accuracy": 0.2221237987279892, "num_tokens": 101289090.0, "step": 48795 }, { "entropy": 5.651026725769043, "epoch": 4.426705370101597, "grad_norm": 1.3515625, "learning_rate": 0.0003188262973345131, "loss": 4.8678, "mean_token_accuracy": 0.22505754232406616, "num_tokens": 101299697.0, "step": 48800 }, { "entropy": 5.648601436614991, "epoch": 4.427158925979681, "grad_norm": 1.2734375, "learning_rate": 0.00031879456020834213, "loss": 4.9418, "mean_token_accuracy": 0.21541815996170044, "num_tokens": 101310470.0, "step": 48805 }, { "entropy": 5.655812358856201, "epoch": 4.427612481857765, "grad_norm": 1.3359375, "learning_rate": 0.00031876282217648845, "loss": 4.8478, "mean_token_accuracy": 0.22268507033586502, "num_tokens": 101321864.0, "step": 48810 }, { "entropy": 5.646479701995849, "epoch": 4.428066037735849, "grad_norm": 1.3671875, "learning_rate": 0.00031873108323960845, "loss": 4.8525, "mean_token_accuracy": 0.225327168405056, "num_tokens": 101331302.0, "step": 48815 }, { "entropy": 5.667787790298462, "epoch": 4.428519593613933, "grad_norm": 1.234375, "learning_rate": 0.00031869934339835856, "loss": 4.9285, "mean_token_accuracy": 0.2220663234591484, "num_tokens": 101341387.0, "step": 48820 }, { "entropy": 5.652537775039673, "epoch": 4.428973149492017, "grad_norm": 1.2890625, "learning_rate": 0.00031866760265339514, "loss": 4.8276, "mean_token_accuracy": 0.22939931303262712, "num_tokens": 101351235.0, "step": 48825 }, { "entropy": 5.658036518096924, "epoch": 4.429426705370101, "grad_norm": 1.359375, "learning_rate": 0.00031863586100537453, "loss": 4.891, "mean_token_accuracy": 0.22458130419254302, "num_tokens": 101361289.0, "step": 48830 }, { "entropy": 5.603162002563477, "epoch": 4.429880261248186, "grad_norm": 1.296875, "learning_rate": 0.0003186041184549531, "loss": 4.8626, "mean_token_accuracy": 0.229951174557209, "num_tokens": 101371666.0, "step": 48835 }, { "entropy": 5.606611347198486, "epoch": 4.43033381712627, "grad_norm": 1.390625, "learning_rate": 0.0003185723750027875, "loss": 4.8467, "mean_token_accuracy": 0.23008151054382325, "num_tokens": 101381195.0, "step": 48840 }, { "entropy": 5.698768281936646, "epoch": 4.430787373004354, "grad_norm": 1.3828125, "learning_rate": 0.00031854063064953403, "loss": 4.9273, "mean_token_accuracy": 0.22436307817697526, "num_tokens": 101392478.0, "step": 48845 }, { "entropy": 5.67167329788208, "epoch": 4.431240928882438, "grad_norm": 1.2890625, "learning_rate": 0.0003185088853958492, "loss": 4.9418, "mean_token_accuracy": 0.2198147550225258, "num_tokens": 101405005.0, "step": 48850 }, { "entropy": 5.592788219451904, "epoch": 4.431694484760523, "grad_norm": 1.2890625, "learning_rate": 0.00031847713924238965, "loss": 4.862, "mean_token_accuracy": 0.22108488380908967, "num_tokens": 101416588.0, "step": 48855 }, { "entropy": 5.6366715908050535, "epoch": 4.432148040638607, "grad_norm": 1.265625, "learning_rate": 0.00031844539218981165, "loss": 4.8705, "mean_token_accuracy": 0.22000187039375305, "num_tokens": 101426784.0, "step": 48860 }, { "entropy": 5.615900897979737, "epoch": 4.432601596516691, "grad_norm": 1.21875, "learning_rate": 0.0003184136442387719, "loss": 4.8164, "mean_token_accuracy": 0.22730119675397872, "num_tokens": 101437919.0, "step": 48865 }, { "entropy": 5.627296447753906, "epoch": 4.433055152394775, "grad_norm": 1.265625, "learning_rate": 0.00031838189538992693, "loss": 4.8947, "mean_token_accuracy": 0.2275494933128357, "num_tokens": 101448654.0, "step": 48870 }, { "entropy": 5.633132028579712, "epoch": 4.433508708272859, "grad_norm": 1.34375, "learning_rate": 0.0003183501456439334, "loss": 4.8008, "mean_token_accuracy": 0.2259764090180397, "num_tokens": 101458648.0, "step": 48875 }, { "entropy": 5.589241456985474, "epoch": 4.433962264150943, "grad_norm": 1.296875, "learning_rate": 0.00031831839500144767, "loss": 4.8193, "mean_token_accuracy": 0.22275903970003127, "num_tokens": 101469339.0, "step": 48880 }, { "entropy": 5.649479675292969, "epoch": 4.434415820029027, "grad_norm": 1.4375, "learning_rate": 0.00031828664346312657, "loss": 4.8607, "mean_token_accuracy": 0.23030509799718857, "num_tokens": 101479452.0, "step": 48885 }, { "entropy": 5.638439702987671, "epoch": 4.434869375907112, "grad_norm": 1.2578125, "learning_rate": 0.0003182548910296267, "loss": 4.8299, "mean_token_accuracy": 0.2271818533539772, "num_tokens": 101489147.0, "step": 48890 }, { "entropy": 5.565455913543701, "epoch": 4.435322931785196, "grad_norm": 1.390625, "learning_rate": 0.0003182231377016046, "loss": 4.7551, "mean_token_accuracy": 0.23633746653795243, "num_tokens": 101498958.0, "step": 48895 }, { "entropy": 5.670753431320191, "epoch": 4.43577648766328, "grad_norm": 1.34375, "learning_rate": 0.000318191383479717, "loss": 4.9368, "mean_token_accuracy": 0.21781085878610612, "num_tokens": 101509197.0, "step": 48900 }, { "entropy": 5.655673694610596, "epoch": 4.436230043541364, "grad_norm": 1.3828125, "learning_rate": 0.0003181596283646205, "loss": 4.8764, "mean_token_accuracy": 0.2277288943529129, "num_tokens": 101520018.0, "step": 48905 }, { "entropy": 5.654379034042359, "epoch": 4.436683599419449, "grad_norm": 1.234375, "learning_rate": 0.00031812787235697206, "loss": 4.8859, "mean_token_accuracy": 0.22256461381912232, "num_tokens": 101530755.0, "step": 48910 }, { "entropy": 5.6234485626220705, "epoch": 4.437137155297533, "grad_norm": 1.3125, "learning_rate": 0.00031809611545742804, "loss": 4.9165, "mean_token_accuracy": 0.2171500876545906, "num_tokens": 101541028.0, "step": 48915 }, { "entropy": 5.651374053955078, "epoch": 4.437590711175617, "grad_norm": 1.3203125, "learning_rate": 0.0003180643576666455, "loss": 4.8321, "mean_token_accuracy": 0.226201656460762, "num_tokens": 101550826.0, "step": 48920 }, { "entropy": 5.647074222564697, "epoch": 4.4380442670537015, "grad_norm": 1.3515625, "learning_rate": 0.0003180325989852811, "loss": 4.8725, "mean_token_accuracy": 0.22674667984247207, "num_tokens": 101560657.0, "step": 48925 }, { "entropy": 5.578207206726074, "epoch": 4.438497822931785, "grad_norm": 1.28125, "learning_rate": 0.0003180008394139914, "loss": 4.837, "mean_token_accuracy": 0.23128877580165863, "num_tokens": 101570504.0, "step": 48930 }, { "entropy": 5.678635597229004, "epoch": 4.438951378809869, "grad_norm": 1.453125, "learning_rate": 0.00031796907895343356, "loss": 4.9828, "mean_token_accuracy": 0.21462297290563584, "num_tokens": 101581729.0, "step": 48935 }, { "entropy": 5.721919441223145, "epoch": 4.439404934687953, "grad_norm": 1.21875, "learning_rate": 0.00031793731760426414, "loss": 4.9364, "mean_token_accuracy": 0.2192406252026558, "num_tokens": 101592649.0, "step": 48940 }, { "entropy": 5.7387183666229244, "epoch": 4.439858490566038, "grad_norm": 1.328125, "learning_rate": 0.00031790555536714013, "loss": 4.9929, "mean_token_accuracy": 0.22132169008255004, "num_tokens": 101603824.0, "step": 48945 }, { "entropy": 5.660867166519165, "epoch": 4.440312046444122, "grad_norm": 1.3828125, "learning_rate": 0.0003178737922427182, "loss": 4.9039, "mean_token_accuracy": 0.23030058443546295, "num_tokens": 101615659.0, "step": 48950 }, { "entropy": 5.729944133758545, "epoch": 4.440765602322206, "grad_norm": 1.4140625, "learning_rate": 0.0003178420282316554, "loss": 4.9629, "mean_token_accuracy": 0.22028013616800307, "num_tokens": 101625937.0, "step": 48955 }, { "entropy": 5.648879146575927, "epoch": 4.4412191582002905, "grad_norm": 1.34375, "learning_rate": 0.0003178102633346085, "loss": 4.8356, "mean_token_accuracy": 0.2290242061018944, "num_tokens": 101637352.0, "step": 48960 }, { "entropy": 5.6489893913269045, "epoch": 4.441672714078375, "grad_norm": 1.4140625, "learning_rate": 0.0003177784975522344, "loss": 4.8032, "mean_token_accuracy": 0.23597368597984314, "num_tokens": 101647939.0, "step": 48965 }, { "entropy": 5.688599014282227, "epoch": 4.442126269956459, "grad_norm": 1.4765625, "learning_rate": 0.00031774673088519014, "loss": 4.9312, "mean_token_accuracy": 0.2230267271399498, "num_tokens": 101658200.0, "step": 48970 }, { "entropy": 5.644593620300293, "epoch": 4.442579825834542, "grad_norm": 1.3515625, "learning_rate": 0.0003177149633341326, "loss": 4.8842, "mean_token_accuracy": 0.2232554480433464, "num_tokens": 101668624.0, "step": 48975 }, { "entropy": 5.705611896514893, "epoch": 4.443033381712627, "grad_norm": 1.3046875, "learning_rate": 0.0003176831948997187, "loss": 4.9936, "mean_token_accuracy": 0.2138810083270073, "num_tokens": 101678939.0, "step": 48980 }, { "entropy": 5.621998834609985, "epoch": 4.443486937590711, "grad_norm": 1.3046875, "learning_rate": 0.0003176514255826054, "loss": 4.9044, "mean_token_accuracy": 0.22602296024560928, "num_tokens": 101689365.0, "step": 48985 }, { "entropy": 5.61886625289917, "epoch": 4.443940493468795, "grad_norm": 1.359375, "learning_rate": 0.0003176196553834498, "loss": 4.8516, "mean_token_accuracy": 0.21929872632026673, "num_tokens": 101699429.0, "step": 48990 }, { "entropy": 5.633785915374756, "epoch": 4.444394049346879, "grad_norm": 1.328125, "learning_rate": 0.00031758788430290893, "loss": 4.906, "mean_token_accuracy": 0.2211710035800934, "num_tokens": 101709452.0, "step": 48995 }, { "entropy": 5.617898654937744, "epoch": 4.444847605224964, "grad_norm": 1.3671875, "learning_rate": 0.00031755611234163966, "loss": 4.8257, "mean_token_accuracy": 0.23007694482803345, "num_tokens": 101719783.0, "step": 49000 }, { "entropy": 5.615143823623657, "epoch": 4.445301161103048, "grad_norm": 1.3671875, "learning_rate": 0.0003175243395002992, "loss": 4.8238, "mean_token_accuracy": 0.23166000097990036, "num_tokens": 101729100.0, "step": 49005 }, { "entropy": 5.610653877258301, "epoch": 4.445754716981132, "grad_norm": 1.2890625, "learning_rate": 0.00031749256577954453, "loss": 4.8712, "mean_token_accuracy": 0.2270632952451706, "num_tokens": 101738711.0, "step": 49010 }, { "entropy": 5.61120023727417, "epoch": 4.4462082728592165, "grad_norm": 1.3515625, "learning_rate": 0.0003174607911800328, "loss": 4.8592, "mean_token_accuracy": 0.2248609408736229, "num_tokens": 101749624.0, "step": 49015 }, { "entropy": 5.615170574188232, "epoch": 4.446661828737301, "grad_norm": 1.4140625, "learning_rate": 0.00031742901570242107, "loss": 4.8207, "mean_token_accuracy": 0.22903938889503478, "num_tokens": 101760951.0, "step": 49020 }, { "entropy": 5.630980491638184, "epoch": 4.447115384615385, "grad_norm": 1.390625, "learning_rate": 0.00031739723934736655, "loss": 4.8086, "mean_token_accuracy": 0.2319727584719658, "num_tokens": 101770773.0, "step": 49025 }, { "entropy": 5.645061874389649, "epoch": 4.447568940493468, "grad_norm": 1.3671875, "learning_rate": 0.0003173654621155262, "loss": 4.8942, "mean_token_accuracy": 0.22596594095230102, "num_tokens": 101781566.0, "step": 49030 }, { "entropy": 5.59080319404602, "epoch": 4.448022496371553, "grad_norm": 1.3671875, "learning_rate": 0.00031733368400755735, "loss": 4.8697, "mean_token_accuracy": 0.23380719423294066, "num_tokens": 101792268.0, "step": 49035 }, { "entropy": 5.683953714370728, "epoch": 4.448476052249637, "grad_norm": 1.3359375, "learning_rate": 0.00031730190502411715, "loss": 4.927, "mean_token_accuracy": 0.22095780223608016, "num_tokens": 101802500.0, "step": 49040 }, { "entropy": 5.675297451019287, "epoch": 4.448929608127721, "grad_norm": 1.25, "learning_rate": 0.0003172701251658628, "loss": 4.8476, "mean_token_accuracy": 0.22274777442216873, "num_tokens": 101813851.0, "step": 49045 }, { "entropy": 5.708823013305664, "epoch": 4.4493831640058055, "grad_norm": 1.28125, "learning_rate": 0.00031723834443345134, "loss": 4.8995, "mean_token_accuracy": 0.2196418285369873, "num_tokens": 101824774.0, "step": 49050 }, { "entropy": 5.590535831451416, "epoch": 4.44983671988389, "grad_norm": 1.5703125, "learning_rate": 0.00031720656282754027, "loss": 4.7472, "mean_token_accuracy": 0.2464963510632515, "num_tokens": 101835975.0, "step": 49055 }, { "entropy": 5.597509336471558, "epoch": 4.450290275761974, "grad_norm": 1.3671875, "learning_rate": 0.00031717478034878676, "loss": 4.8215, "mean_token_accuracy": 0.2300755113363266, "num_tokens": 101846764.0, "step": 49060 }, { "entropy": 5.602775716781617, "epoch": 4.450743831640058, "grad_norm": 1.4140625, "learning_rate": 0.00031714299699784796, "loss": 4.8592, "mean_token_accuracy": 0.22558782398700714, "num_tokens": 101857968.0, "step": 49065 }, { "entropy": 5.631313753128052, "epoch": 4.4511973875181425, "grad_norm": 1.2890625, "learning_rate": 0.0003171112127753813, "loss": 4.848, "mean_token_accuracy": 0.2340001717209816, "num_tokens": 101868484.0, "step": 49070 }, { "entropy": 5.667361736297607, "epoch": 4.451650943396227, "grad_norm": 1.4140625, "learning_rate": 0.0003170794276820441, "loss": 4.8766, "mean_token_accuracy": 0.22456134557724, "num_tokens": 101877969.0, "step": 49075 }, { "entropy": 5.5901871681213375, "epoch": 4.452104499274311, "grad_norm": 1.3203125, "learning_rate": 0.00031704764171849344, "loss": 4.8479, "mean_token_accuracy": 0.2274169236421585, "num_tokens": 101888635.0, "step": 49080 }, { "entropy": 5.620852613449097, "epoch": 4.4525580551523944, "grad_norm": 1.3515625, "learning_rate": 0.00031701585488538695, "loss": 4.8135, "mean_token_accuracy": 0.22826258093118668, "num_tokens": 101898340.0, "step": 49085 }, { "entropy": 5.688434362411499, "epoch": 4.453011611030479, "grad_norm": 1.2890625, "learning_rate": 0.0003169840671833819, "loss": 4.9391, "mean_token_accuracy": 0.21651571244001389, "num_tokens": 101908993.0, "step": 49090 }, { "entropy": 5.582010126113891, "epoch": 4.453465166908563, "grad_norm": 1.4296875, "learning_rate": 0.0003169522786131355, "loss": 4.7992, "mean_token_accuracy": 0.22893144190311432, "num_tokens": 101919675.0, "step": 49095 }, { "entropy": 5.680526208877564, "epoch": 4.453918722786647, "grad_norm": 1.46875, "learning_rate": 0.00031692048917530535, "loss": 4.9329, "mean_token_accuracy": 0.2221715658903122, "num_tokens": 101929949.0, "step": 49100 }, { "entropy": 5.628272008895874, "epoch": 4.4543722786647315, "grad_norm": 1.4375, "learning_rate": 0.00031688869887054887, "loss": 4.7412, "mean_token_accuracy": 0.23930002003908157, "num_tokens": 101940025.0, "step": 49105 }, { "entropy": 5.6292273044586185, "epoch": 4.454825834542816, "grad_norm": 1.265625, "learning_rate": 0.00031685690769952336, "loss": 4.815, "mean_token_accuracy": 0.23405244201421738, "num_tokens": 101950344.0, "step": 49110 }, { "entropy": 5.677900505065918, "epoch": 4.4552793904209, "grad_norm": 1.34375, "learning_rate": 0.0003168251156628863, "loss": 4.8874, "mean_token_accuracy": 0.22621249109506608, "num_tokens": 101961405.0, "step": 49115 }, { "entropy": 5.570927143096924, "epoch": 4.455732946298984, "grad_norm": 1.390625, "learning_rate": 0.00031679332276129523, "loss": 4.7409, "mean_token_accuracy": 0.23360927402973175, "num_tokens": 101972164.0, "step": 49120 }, { "entropy": 5.599050092697143, "epoch": 4.456186502177069, "grad_norm": 1.4453125, "learning_rate": 0.00031676152899540763, "loss": 4.8432, "mean_token_accuracy": 0.2223188355565071, "num_tokens": 101981573.0, "step": 49125 }, { "entropy": 5.5814799785614015, "epoch": 4.456640058055152, "grad_norm": 1.40625, "learning_rate": 0.000316729734365881, "loss": 4.8287, "mean_token_accuracy": 0.2263931378722191, "num_tokens": 101991051.0, "step": 49130 }, { "entropy": 5.601623439788819, "epoch": 4.457093613933236, "grad_norm": 1.3203125, "learning_rate": 0.0003166979388733727, "loss": 4.8302, "mean_token_accuracy": 0.23287868201732637, "num_tokens": 102000003.0, "step": 49135 }, { "entropy": 5.647953748703003, "epoch": 4.4575471698113205, "grad_norm": 1.2734375, "learning_rate": 0.0003166661425185405, "loss": 4.9166, "mean_token_accuracy": 0.2145568162202835, "num_tokens": 102010489.0, "step": 49140 }, { "entropy": 5.630386590957642, "epoch": 4.458000725689405, "grad_norm": 1.3046875, "learning_rate": 0.00031663434530204183, "loss": 4.9181, "mean_token_accuracy": 0.21789473444223403, "num_tokens": 102020486.0, "step": 49145 }, { "entropy": 5.665774726867676, "epoch": 4.458454281567489, "grad_norm": 1.2421875, "learning_rate": 0.0003166025472245342, "loss": 4.8541, "mean_token_accuracy": 0.23006440103054046, "num_tokens": 102030098.0, "step": 49150 }, { "entropy": 5.693413496017456, "epoch": 4.458907837445573, "grad_norm": 1.3203125, "learning_rate": 0.0003165707482866754, "loss": 4.8791, "mean_token_accuracy": 0.2243760734796524, "num_tokens": 102040850.0, "step": 49155 }, { "entropy": 5.605059003829956, "epoch": 4.4593613933236576, "grad_norm": 1.328125, "learning_rate": 0.00031653894848912296, "loss": 4.7881, "mean_token_accuracy": 0.22748537957668305, "num_tokens": 102051056.0, "step": 49160 }, { "entropy": 5.659085988998413, "epoch": 4.459814949201742, "grad_norm": 1.234375, "learning_rate": 0.0003165071478325344, "loss": 4.8588, "mean_token_accuracy": 0.22048922926187514, "num_tokens": 102061727.0, "step": 49165 }, { "entropy": 5.617341613769531, "epoch": 4.460268505079826, "grad_norm": 1.390625, "learning_rate": 0.0003164753463175675, "loss": 4.911, "mean_token_accuracy": 0.22240567058324814, "num_tokens": 102071501.0, "step": 49170 }, { "entropy": 5.624067211151123, "epoch": 4.46072206095791, "grad_norm": 1.34375, "learning_rate": 0.00031644354394487977, "loss": 4.789, "mean_token_accuracy": 0.2374361515045166, "num_tokens": 102082511.0, "step": 49175 }, { "entropy": 5.680125379562378, "epoch": 4.461175616835995, "grad_norm": 1.3828125, "learning_rate": 0.00031641174071512905, "loss": 4.8582, "mean_token_accuracy": 0.23295336812734604, "num_tokens": 102093010.0, "step": 49180 }, { "entropy": 5.596185827255249, "epoch": 4.461629172714078, "grad_norm": 1.4453125, "learning_rate": 0.000316379936628973, "loss": 4.8479, "mean_token_accuracy": 0.22490974217653276, "num_tokens": 102102691.0, "step": 49185 }, { "entropy": 5.623129749298096, "epoch": 4.462082728592162, "grad_norm": 1.3515625, "learning_rate": 0.00031634813168706933, "loss": 4.828, "mean_token_accuracy": 0.23011025190353393, "num_tokens": 102112726.0, "step": 49190 }, { "entropy": 5.613856220245362, "epoch": 4.4625362844702465, "grad_norm": 1.359375, "learning_rate": 0.00031631632589007575, "loss": 4.8665, "mean_token_accuracy": 0.2294480696320534, "num_tokens": 102122879.0, "step": 49195 }, { "entropy": 5.670864009857178, "epoch": 4.462989840348331, "grad_norm": 1.265625, "learning_rate": 0.00031628451923864997, "loss": 4.8764, "mean_token_accuracy": 0.22382826507091522, "num_tokens": 102133485.0, "step": 49200 }, { "entropy": 5.685948038101197, "epoch": 4.463443396226415, "grad_norm": 1.359375, "learning_rate": 0.00031625271173344984, "loss": 4.9558, "mean_token_accuracy": 0.22063474357128143, "num_tokens": 102143439.0, "step": 49205 }, { "entropy": 5.599951553344726, "epoch": 4.463896952104499, "grad_norm": 1.2578125, "learning_rate": 0.00031622090337513314, "loss": 4.8128, "mean_token_accuracy": 0.23295689672231673, "num_tokens": 102153808.0, "step": 49210 }, { "entropy": 5.707747554779052, "epoch": 4.464350507982584, "grad_norm": 1.3828125, "learning_rate": 0.00031618909416435766, "loss": 4.9486, "mean_token_accuracy": 0.21678301095962524, "num_tokens": 102163375.0, "step": 49215 }, { "entropy": 5.644668865203857, "epoch": 4.464804063860668, "grad_norm": 1.328125, "learning_rate": 0.0003161572841017811, "loss": 4.8824, "mean_token_accuracy": 0.2234131932258606, "num_tokens": 102174402.0, "step": 49220 }, { "entropy": 5.554730939865112, "epoch": 4.465257619738752, "grad_norm": 1.3046875, "learning_rate": 0.00031612547318806154, "loss": 4.7507, "mean_token_accuracy": 0.23497088253498077, "num_tokens": 102184446.0, "step": 49225 }, { "entropy": 5.63445553779602, "epoch": 4.465711175616836, "grad_norm": 1.3828125, "learning_rate": 0.00031609366142385675, "loss": 4.855, "mean_token_accuracy": 0.22719788253307344, "num_tokens": 102194398.0, "step": 49230 }, { "entropy": 5.575746154785156, "epoch": 4.46616473149492, "grad_norm": 1.2734375, "learning_rate": 0.0003160618488098245, "loss": 4.8245, "mean_token_accuracy": 0.23080240488052367, "num_tokens": 102205953.0, "step": 49235 }, { "entropy": 5.59887204170227, "epoch": 4.466618287373004, "grad_norm": 1.40625, "learning_rate": 0.00031603003534662273, "loss": 4.7981, "mean_token_accuracy": 0.23858145326375962, "num_tokens": 102215815.0, "step": 49240 }, { "entropy": 5.645167064666748, "epoch": 4.467071843251088, "grad_norm": 1.2578125, "learning_rate": 0.00031599822103490946, "loss": 4.8025, "mean_token_accuracy": 0.22809929847717286, "num_tokens": 102225703.0, "step": 49245 }, { "entropy": 5.690086841583252, "epoch": 4.467525399129173, "grad_norm": 1.3046875, "learning_rate": 0.0003159664058753425, "loss": 4.9897, "mean_token_accuracy": 0.2100346252322197, "num_tokens": 102236627.0, "step": 49250 }, { "entropy": 5.60487847328186, "epoch": 4.467978955007257, "grad_norm": 1.390625, "learning_rate": 0.0003159345898685797, "loss": 4.8846, "mean_token_accuracy": 0.22969655096530914, "num_tokens": 102246539.0, "step": 49255 }, { "entropy": 5.640522813796997, "epoch": 4.468432510885341, "grad_norm": 1.34375, "learning_rate": 0.0003159027730152793, "loss": 4.8851, "mean_token_accuracy": 0.22354926466941832, "num_tokens": 102256734.0, "step": 49260 }, { "entropy": 5.699540758132935, "epoch": 4.468886066763425, "grad_norm": 1.2890625, "learning_rate": 0.0003158709553160991, "loss": 4.9858, "mean_token_accuracy": 0.21694791465997695, "num_tokens": 102267469.0, "step": 49265 }, { "entropy": 5.66622142791748, "epoch": 4.46933962264151, "grad_norm": 1.28125, "learning_rate": 0.00031583913677169705, "loss": 4.8857, "mean_token_accuracy": 0.22464902997016906, "num_tokens": 102278435.0, "step": 49270 }, { "entropy": 5.68406834602356, "epoch": 4.469793178519594, "grad_norm": 1.3671875, "learning_rate": 0.00031580731738273135, "loss": 4.8983, "mean_token_accuracy": 0.22519890069961548, "num_tokens": 102289171.0, "step": 49275 }, { "entropy": 5.635126352310181, "epoch": 4.470246734397678, "grad_norm": 1.234375, "learning_rate": 0.0003157754971498599, "loss": 4.8132, "mean_token_accuracy": 0.2342111811041832, "num_tokens": 102299254.0, "step": 49280 }, { "entropy": 5.675919866561889, "epoch": 4.4707002902757615, "grad_norm": 1.296875, "learning_rate": 0.0003157436760737408, "loss": 4.8881, "mean_token_accuracy": 0.22464556097984315, "num_tokens": 102308471.0, "step": 49285 }, { "entropy": 5.6680444240570065, "epoch": 4.471153846153846, "grad_norm": 1.375, "learning_rate": 0.000315711854155032, "loss": 4.8688, "mean_token_accuracy": 0.22468231320381166, "num_tokens": 102319005.0, "step": 49290 }, { "entropy": 5.656484651565552, "epoch": 4.47160740203193, "grad_norm": 1.359375, "learning_rate": 0.00031568003139439185, "loss": 4.8522, "mean_token_accuracy": 0.23002826273441315, "num_tokens": 102329568.0, "step": 49295 }, { "entropy": 5.712450790405273, "epoch": 4.472060957910014, "grad_norm": 1.265625, "learning_rate": 0.0003156482077924781, "loss": 4.9879, "mean_token_accuracy": 0.2175341084599495, "num_tokens": 102340810.0, "step": 49300 }, { "entropy": 5.591939115524292, "epoch": 4.472514513788099, "grad_norm": 1.2421875, "learning_rate": 0.0003156163833499491, "loss": 4.8569, "mean_token_accuracy": 0.2177632838487625, "num_tokens": 102351305.0, "step": 49305 }, { "entropy": 5.6574924945831295, "epoch": 4.472968069666183, "grad_norm": 1.296875, "learning_rate": 0.00031558455806746306, "loss": 4.8702, "mean_token_accuracy": 0.22235261052846908, "num_tokens": 102362057.0, "step": 49310 }, { "entropy": 5.718958139419556, "epoch": 4.473421625544267, "grad_norm": 1.359375, "learning_rate": 0.0003155527319456779, "loss": 4.9747, "mean_token_accuracy": 0.21234172731637954, "num_tokens": 102372612.0, "step": 49315 }, { "entropy": 5.604626178741455, "epoch": 4.473875181422351, "grad_norm": 1.2421875, "learning_rate": 0.00031552090498525195, "loss": 4.8286, "mean_token_accuracy": 0.22858582735061644, "num_tokens": 102383337.0, "step": 49320 }, { "entropy": 5.644073534011841, "epoch": 4.474328737300436, "grad_norm": 1.328125, "learning_rate": 0.0003154890771868433, "loss": 4.8705, "mean_token_accuracy": 0.221617491543293, "num_tokens": 102394196.0, "step": 49325 }, { "entropy": 5.694830465316772, "epoch": 4.47478229317852, "grad_norm": 1.3984375, "learning_rate": 0.00031545724855111025, "loss": 4.8972, "mean_token_accuracy": 0.23030000925064087, "num_tokens": 102404677.0, "step": 49330 }, { "entropy": 5.659955978393555, "epoch": 4.475235849056604, "grad_norm": 1.3671875, "learning_rate": 0.00031542541907871095, "loss": 4.8113, "mean_token_accuracy": 0.23593172878026963, "num_tokens": 102413445.0, "step": 49335 }, { "entropy": 5.605733919143677, "epoch": 4.475689404934688, "grad_norm": 1.3125, "learning_rate": 0.0003153935887703038, "loss": 4.8546, "mean_token_accuracy": 0.22654233127832413, "num_tokens": 102424527.0, "step": 49340 }, { "entropy": 5.644651460647583, "epoch": 4.476142960812772, "grad_norm": 1.3046875, "learning_rate": 0.0003153617576265469, "loss": 4.8434, "mean_token_accuracy": 0.2225853055715561, "num_tokens": 102434940.0, "step": 49345 }, { "entropy": 5.713822889328003, "epoch": 4.476596516690856, "grad_norm": 1.546875, "learning_rate": 0.00031532992564809847, "loss": 4.946, "mean_token_accuracy": 0.22491227984428405, "num_tokens": 102446678.0, "step": 49350 }, { "entropy": 5.625935125350952, "epoch": 4.47705007256894, "grad_norm": 1.1953125, "learning_rate": 0.000315298092835617, "loss": 4.837, "mean_token_accuracy": 0.23035448789596558, "num_tokens": 102457255.0, "step": 49355 }, { "entropy": 5.704388761520386, "epoch": 4.477503628447025, "grad_norm": 1.3203125, "learning_rate": 0.00031526625918976066, "loss": 4.9994, "mean_token_accuracy": 0.22258975505828857, "num_tokens": 102468385.0, "step": 49360 }, { "entropy": 5.642435932159424, "epoch": 4.477957184325109, "grad_norm": 1.3203125, "learning_rate": 0.00031523442471118783, "loss": 4.8271, "mean_token_accuracy": 0.22323777824640273, "num_tokens": 102478204.0, "step": 49365 }, { "entropy": 5.683664608001709, "epoch": 4.478410740203193, "grad_norm": 1.2734375, "learning_rate": 0.00031520258940055684, "loss": 4.8866, "mean_token_accuracy": 0.22842807918787003, "num_tokens": 102488492.0, "step": 49370 }, { "entropy": 5.612175607681275, "epoch": 4.4788642960812775, "grad_norm": 1.2421875, "learning_rate": 0.00031517075325852606, "loss": 4.8548, "mean_token_accuracy": 0.22520501911640167, "num_tokens": 102500309.0, "step": 49375 }, { "entropy": 5.581572723388672, "epoch": 4.479317851959362, "grad_norm": 1.2734375, "learning_rate": 0.0003151389162857539, "loss": 4.8606, "mean_token_accuracy": 0.2259416624903679, "num_tokens": 102511196.0, "step": 49380 }, { "entropy": 5.625988721847534, "epoch": 4.479771407837446, "grad_norm": 1.21875, "learning_rate": 0.00031510707848289864, "loss": 4.8306, "mean_token_accuracy": 0.2278372675180435, "num_tokens": 102522100.0, "step": 49385 }, { "entropy": 5.601570415496826, "epoch": 4.480224963715529, "grad_norm": 1.375, "learning_rate": 0.00031507523985061886, "loss": 4.8243, "mean_token_accuracy": 0.23635229766368865, "num_tokens": 102531677.0, "step": 49390 }, { "entropy": 5.576582527160644, "epoch": 4.480678519593614, "grad_norm": 1.359375, "learning_rate": 0.00031504340038957294, "loss": 4.7561, "mean_token_accuracy": 0.2405527040362358, "num_tokens": 102541854.0, "step": 49395 }, { "entropy": 5.635606670379639, "epoch": 4.481132075471698, "grad_norm": 1.453125, "learning_rate": 0.0003150115601004192, "loss": 4.8901, "mean_token_accuracy": 0.22413284480571746, "num_tokens": 102551187.0, "step": 49400 }, { "entropy": 5.677726697921753, "epoch": 4.481585631349782, "grad_norm": 1.3203125, "learning_rate": 0.0003149797189838162, "loss": 4.8832, "mean_token_accuracy": 0.2218853160738945, "num_tokens": 102562568.0, "step": 49405 }, { "entropy": 5.649278974533081, "epoch": 4.482039187227866, "grad_norm": 1.3046875, "learning_rate": 0.00031494787704042243, "loss": 4.9121, "mean_token_accuracy": 0.22124607861042023, "num_tokens": 102573170.0, "step": 49410 }, { "entropy": 5.554230117797852, "epoch": 4.482492743105951, "grad_norm": 1.359375, "learning_rate": 0.00031491603427089644, "loss": 4.7148, "mean_token_accuracy": 0.23635787069797515, "num_tokens": 102583950.0, "step": 49415 }, { "entropy": 5.628840160369873, "epoch": 4.482946298984035, "grad_norm": 1.359375, "learning_rate": 0.00031488419067589665, "loss": 4.8661, "mean_token_accuracy": 0.22833748757839203, "num_tokens": 102594370.0, "step": 49420 }, { "entropy": 5.638507461547851, "epoch": 4.483399854862119, "grad_norm": 1.4453125, "learning_rate": 0.0003148523462560816, "loss": 4.8328, "mean_token_accuracy": 0.2318490266799927, "num_tokens": 102604837.0, "step": 49425 }, { "entropy": 5.680521154403687, "epoch": 4.4838534107402035, "grad_norm": 1.3828125, "learning_rate": 0.0003148205010121099, "loss": 4.9254, "mean_token_accuracy": 0.22288707345724107, "num_tokens": 102616170.0, "step": 49430 }, { "entropy": 5.62971076965332, "epoch": 4.484306966618288, "grad_norm": 1.203125, "learning_rate": 0.0003147886549446401, "loss": 4.8662, "mean_token_accuracy": 0.22801705449819565, "num_tokens": 102627283.0, "step": 49435 }, { "entropy": 5.692225599288941, "epoch": 4.484760522496371, "grad_norm": 1.3125, "learning_rate": 0.0003147568080543308, "loss": 4.896, "mean_token_accuracy": 0.223686183989048, "num_tokens": 102637087.0, "step": 49440 }, { "entropy": 5.645506477355957, "epoch": 4.485214078374455, "grad_norm": 1.3203125, "learning_rate": 0.0003147249603418406, "loss": 4.8945, "mean_token_accuracy": 0.22555406391620636, "num_tokens": 102646818.0, "step": 49445 }, { "entropy": 5.580931901931763, "epoch": 4.48566763425254, "grad_norm": 1.34375, "learning_rate": 0.0003146931118078281, "loss": 4.7905, "mean_token_accuracy": 0.2350690558552742, "num_tokens": 102656940.0, "step": 49450 }, { "entropy": 5.596077346801758, "epoch": 4.486121190130624, "grad_norm": 1.3359375, "learning_rate": 0.0003146612624529518, "loss": 4.8691, "mean_token_accuracy": 0.22616479992866517, "num_tokens": 102666841.0, "step": 49455 }, { "entropy": 5.658067512512207, "epoch": 4.486574746008708, "grad_norm": 1.3046875, "learning_rate": 0.00031462941227787056, "loss": 4.8663, "mean_token_accuracy": 0.22293926775455475, "num_tokens": 102676821.0, "step": 49460 }, { "entropy": 5.750235271453858, "epoch": 4.4870283018867925, "grad_norm": 1.3671875, "learning_rate": 0.0003145975612832431, "loss": 4.9707, "mean_token_accuracy": 0.2208462417125702, "num_tokens": 102687340.0, "step": 49465 }, { "entropy": 5.6162749290466305, "epoch": 4.487481857764877, "grad_norm": 1.390625, "learning_rate": 0.0003145657094697278, "loss": 4.8779, "mean_token_accuracy": 0.2263274222612381, "num_tokens": 102698320.0, "step": 49470 }, { "entropy": 5.654202461242676, "epoch": 4.487935413642961, "grad_norm": 1.3359375, "learning_rate": 0.0003145338568379836, "loss": 4.8964, "mean_token_accuracy": 0.2264561250805855, "num_tokens": 102708685.0, "step": 49475 }, { "entropy": 5.609914350509643, "epoch": 4.488388969521045, "grad_norm": 1.28125, "learning_rate": 0.0003145020033886692, "loss": 4.8445, "mean_token_accuracy": 0.21920885145664215, "num_tokens": 102719680.0, "step": 49480 }, { "entropy": 5.587669897079468, "epoch": 4.4888425253991295, "grad_norm": 1.234375, "learning_rate": 0.00031447014912244325, "loss": 4.8158, "mean_token_accuracy": 0.2316541463136673, "num_tokens": 102731156.0, "step": 49485 }, { "entropy": 5.629397773742676, "epoch": 4.489296081277214, "grad_norm": 1.421875, "learning_rate": 0.0003144382940399646, "loss": 4.7971, "mean_token_accuracy": 0.23393794596195222, "num_tokens": 102740790.0, "step": 49490 }, { "entropy": 5.637163686752319, "epoch": 4.489749637155297, "grad_norm": 1.3828125, "learning_rate": 0.000314406438141892, "loss": 4.8562, "mean_token_accuracy": 0.23081200271844865, "num_tokens": 102750672.0, "step": 49495 }, { "entropy": 5.592739486694336, "epoch": 4.4902031930333814, "grad_norm": 1.4140625, "learning_rate": 0.0003143745814288842, "loss": 4.8989, "mean_token_accuracy": 0.21943145841360093, "num_tokens": 102760364.0, "step": 49500 }, { "entropy": 5.728304004669189, "epoch": 4.490656748911466, "grad_norm": 1.3046875, "learning_rate": 0.0003143427239016001, "loss": 4.949, "mean_token_accuracy": 0.2228900372982025, "num_tokens": 102770415.0, "step": 49505 }, { "entropy": 5.655384111404419, "epoch": 4.49111030478955, "grad_norm": 1.2734375, "learning_rate": 0.0003143108655606983, "loss": 4.8355, "mean_token_accuracy": 0.2335874170064926, "num_tokens": 102781203.0, "step": 49510 }, { "entropy": 5.63679141998291, "epoch": 4.491563860667634, "grad_norm": 1.3671875, "learning_rate": 0.00031427900640683783, "loss": 4.8081, "mean_token_accuracy": 0.22937019914388657, "num_tokens": 102791071.0, "step": 49515 }, { "entropy": 5.684739351272583, "epoch": 4.4920174165457185, "grad_norm": 1.4140625, "learning_rate": 0.00031424714644067754, "loss": 4.9223, "mean_token_accuracy": 0.22481405287981032, "num_tokens": 102801755.0, "step": 49520 }, { "entropy": 5.635535001754761, "epoch": 4.492470972423803, "grad_norm": 1.296875, "learning_rate": 0.00031421528566287623, "loss": 4.8982, "mean_token_accuracy": 0.22298934906721116, "num_tokens": 102812947.0, "step": 49525 }, { "entropy": 5.610058689117432, "epoch": 4.492924528301887, "grad_norm": 1.3984375, "learning_rate": 0.0003141834240740928, "loss": 4.8558, "mean_token_accuracy": 0.22876159697771073, "num_tokens": 102822917.0, "step": 49530 }, { "entropy": 5.652454137802124, "epoch": 4.493378084179971, "grad_norm": 1.421875, "learning_rate": 0.0003141515616749862, "loss": 4.8553, "mean_token_accuracy": 0.2267722964286804, "num_tokens": 102833102.0, "step": 49535 }, { "entropy": 5.694706106185913, "epoch": 4.493831640058055, "grad_norm": 1.359375, "learning_rate": 0.0003141196984662153, "loss": 4.8958, "mean_token_accuracy": 0.23061597794294358, "num_tokens": 102843888.0, "step": 49540 }, { "entropy": 5.646428012847901, "epoch": 4.494285195936139, "grad_norm": 1.2421875, "learning_rate": 0.0003140878344484391, "loss": 4.9251, "mean_token_accuracy": 0.22708246111869812, "num_tokens": 102854417.0, "step": 49545 }, { "entropy": 5.618627071380615, "epoch": 4.494738751814223, "grad_norm": 1.4140625, "learning_rate": 0.0003140559696223165, "loss": 4.8516, "mean_token_accuracy": 0.22899708449840545, "num_tokens": 102865206.0, "step": 49550 }, { "entropy": 5.674997758865357, "epoch": 4.4951923076923075, "grad_norm": 1.375, "learning_rate": 0.0003140241039885065, "loss": 4.8268, "mean_token_accuracy": 0.23099810779094695, "num_tokens": 102874967.0, "step": 49555 }, { "entropy": 5.6058753490447994, "epoch": 4.495645863570392, "grad_norm": 1.25, "learning_rate": 0.0003139922375476681, "loss": 4.8259, "mean_token_accuracy": 0.2290083423256874, "num_tokens": 102884808.0, "step": 49560 }, { "entropy": 5.555175876617431, "epoch": 4.496099419448476, "grad_norm": 1.359375, "learning_rate": 0.0003139603703004603, "loss": 4.7562, "mean_token_accuracy": 0.2335077315568924, "num_tokens": 102895206.0, "step": 49565 }, { "entropy": 5.690444755554199, "epoch": 4.49655297532656, "grad_norm": 1.3984375, "learning_rate": 0.0003139285022475421, "loss": 4.9048, "mean_token_accuracy": 0.22447886019945146, "num_tokens": 102906658.0, "step": 49570 }, { "entropy": 5.63068265914917, "epoch": 4.4970065312046446, "grad_norm": 1.34375, "learning_rate": 0.00031389663338957254, "loss": 4.856, "mean_token_accuracy": 0.22486236840486526, "num_tokens": 102917071.0, "step": 49575 }, { "entropy": 5.625520706176758, "epoch": 4.497460087082729, "grad_norm": 1.2265625, "learning_rate": 0.00031386476372721067, "loss": 4.813, "mean_token_accuracy": 0.22809524834156036, "num_tokens": 102927280.0, "step": 49580 }, { "entropy": 5.639458465576172, "epoch": 4.497913642960813, "grad_norm": 1.4375, "learning_rate": 0.0003138328932611156, "loss": 4.9336, "mean_token_accuracy": 0.2187660366296768, "num_tokens": 102937670.0, "step": 49585 }, { "entropy": 5.6291083812713625, "epoch": 4.498367198838897, "grad_norm": 1.296875, "learning_rate": 0.00031380102199194646, "loss": 4.8932, "mean_token_accuracy": 0.21949890106916428, "num_tokens": 102947874.0, "step": 49590 }, { "entropy": 5.686755800247193, "epoch": 4.498820754716981, "grad_norm": 1.3671875, "learning_rate": 0.0003137691499203622, "loss": 4.9054, "mean_token_accuracy": 0.2216712489724159, "num_tokens": 102959311.0, "step": 49595 }, { "entropy": 5.60427303314209, "epoch": 4.499274310595065, "grad_norm": 1.328125, "learning_rate": 0.00031373727704702217, "loss": 4.8266, "mean_token_accuracy": 0.22990832924842836, "num_tokens": 102969866.0, "step": 49600 }, { "entropy": 5.611121797561646, "epoch": 4.499727866473149, "grad_norm": 1.234375, "learning_rate": 0.00031370540337258523, "loss": 4.787, "mean_token_accuracy": 0.23213734924793245, "num_tokens": 102979672.0, "step": 49605 }, { "entropy": 5.598658466339112, "epoch": 4.5001814223512335, "grad_norm": 1.2265625, "learning_rate": 0.0003136735288977108, "loss": 4.8597, "mean_token_accuracy": 0.22234815508127212, "num_tokens": 102991050.0, "step": 49610 }, { "entropy": 5.628060626983642, "epoch": 4.500634978229318, "grad_norm": 1.3671875, "learning_rate": 0.00031364165362305783, "loss": 4.9037, "mean_token_accuracy": 0.22139324247837067, "num_tokens": 103001700.0, "step": 49615 }, { "entropy": 5.663005304336548, "epoch": 4.501088534107402, "grad_norm": 1.3046875, "learning_rate": 0.0003136097775492857, "loss": 4.8897, "mean_token_accuracy": 0.220831236243248, "num_tokens": 103013013.0, "step": 49620 }, { "entropy": 5.626133155822754, "epoch": 4.501542089985486, "grad_norm": 1.2265625, "learning_rate": 0.0003135779006770535, "loss": 4.8849, "mean_token_accuracy": 0.22515156716108323, "num_tokens": 103024110.0, "step": 49625 }, { "entropy": 5.700735235214234, "epoch": 4.501995645863571, "grad_norm": 1.296875, "learning_rate": 0.0003135460230070205, "loss": 4.9123, "mean_token_accuracy": 0.22093861550092697, "num_tokens": 103034991.0, "step": 49630 }, { "entropy": 5.684466886520386, "epoch": 4.502449201741655, "grad_norm": 1.3046875, "learning_rate": 0.00031351414453984595, "loss": 4.8804, "mean_token_accuracy": 0.22591807693243027, "num_tokens": 103045634.0, "step": 49635 }, { "entropy": 5.600563383102417, "epoch": 4.502902757619739, "grad_norm": 1.3359375, "learning_rate": 0.000313482265276189, "loss": 4.8623, "mean_token_accuracy": 0.2290247216820717, "num_tokens": 103054999.0, "step": 49640 }, { "entropy": 5.622740888595581, "epoch": 4.503356313497823, "grad_norm": 1.296875, "learning_rate": 0.00031345038521670907, "loss": 4.8967, "mean_token_accuracy": 0.21916372925043107, "num_tokens": 103065163.0, "step": 49645 }, { "entropy": 5.695866346359253, "epoch": 4.503809869375907, "grad_norm": 1.3203125, "learning_rate": 0.0003134185043620654, "loss": 4.8515, "mean_token_accuracy": 0.23310244232416152, "num_tokens": 103075979.0, "step": 49650 }, { "entropy": 5.591418838500976, "epoch": 4.504263425253991, "grad_norm": 1.484375, "learning_rate": 0.0003133866227129171, "loss": 4.7729, "mean_token_accuracy": 0.23156407624483108, "num_tokens": 103086124.0, "step": 49655 }, { "entropy": 5.583737373352051, "epoch": 4.504716981132075, "grad_norm": 1.296875, "learning_rate": 0.00031335474026992377, "loss": 4.8357, "mean_token_accuracy": 0.2247992992401123, "num_tokens": 103095330.0, "step": 49660 }, { "entropy": 5.6357416152954105, "epoch": 4.50517053701016, "grad_norm": 1.28125, "learning_rate": 0.0003133228570337447, "loss": 4.9086, "mean_token_accuracy": 0.22448360025882722, "num_tokens": 103106863.0, "step": 49665 }, { "entropy": 5.7022209644317625, "epoch": 4.505624092888244, "grad_norm": 1.2421875, "learning_rate": 0.0003132909730050391, "loss": 4.9092, "mean_token_accuracy": 0.22539257854223252, "num_tokens": 103117256.0, "step": 49670 }, { "entropy": 5.669220733642578, "epoch": 4.506077648766328, "grad_norm": 1.2265625, "learning_rate": 0.00031325908818446643, "loss": 4.866, "mean_token_accuracy": 0.22613943964242936, "num_tokens": 103127601.0, "step": 49675 }, { "entropy": 5.62586145401001, "epoch": 4.506531204644412, "grad_norm": 1.5078125, "learning_rate": 0.00031322720257268607, "loss": 4.804, "mean_token_accuracy": 0.22655246257781983, "num_tokens": 103136868.0, "step": 49680 }, { "entropy": 5.610585689544678, "epoch": 4.506984760522497, "grad_norm": 1.375, "learning_rate": 0.00031319531617035747, "loss": 4.8382, "mean_token_accuracy": 0.22649689316749572, "num_tokens": 103146908.0, "step": 49685 }, { "entropy": 5.585486793518067, "epoch": 4.507438316400581, "grad_norm": 1.21875, "learning_rate": 0.00031316342897813994, "loss": 4.8268, "mean_token_accuracy": 0.22273413985967636, "num_tokens": 103157244.0, "step": 49690 }, { "entropy": 5.591665554046631, "epoch": 4.507891872278664, "grad_norm": 1.2890625, "learning_rate": 0.00031313154099669294, "loss": 4.8233, "mean_token_accuracy": 0.22315495014190673, "num_tokens": 103168502.0, "step": 49695 }, { "entropy": 5.618940162658691, "epoch": 4.5083454281567485, "grad_norm": 1.2890625, "learning_rate": 0.0003130996522266761, "loss": 4.8866, "mean_token_accuracy": 0.21917984038591384, "num_tokens": 103179015.0, "step": 49700 }, { "entropy": 5.6941381931304935, "epoch": 4.508798984034833, "grad_norm": 1.3203125, "learning_rate": 0.0003130677626687485, "loss": 4.8598, "mean_token_accuracy": 0.23338279128074646, "num_tokens": 103189200.0, "step": 49705 }, { "entropy": 5.717541599273682, "epoch": 4.509252539912917, "grad_norm": 1.203125, "learning_rate": 0.0003130358723235702, "loss": 5.0001, "mean_token_accuracy": 0.21582192182540894, "num_tokens": 103200683.0, "step": 49710 }, { "entropy": 5.694086122512817, "epoch": 4.509706095791001, "grad_norm": 1.2734375, "learning_rate": 0.00031300398119180013, "loss": 4.8874, "mean_token_accuracy": 0.23135345727205275, "num_tokens": 103210992.0, "step": 49715 }, { "entropy": 5.619565343856811, "epoch": 4.510159651669086, "grad_norm": 1.3046875, "learning_rate": 0.0003129720892740981, "loss": 4.811, "mean_token_accuracy": 0.2283020481467247, "num_tokens": 103220783.0, "step": 49720 }, { "entropy": 5.580638074874878, "epoch": 4.51061320754717, "grad_norm": 1.234375, "learning_rate": 0.0003129401965711236, "loss": 4.8205, "mean_token_accuracy": 0.2291475862264633, "num_tokens": 103231593.0, "step": 49725 }, { "entropy": 5.640674829483032, "epoch": 4.511066763425254, "grad_norm": 1.3203125, "learning_rate": 0.0003129083030835361, "loss": 4.9037, "mean_token_accuracy": 0.22020932137966157, "num_tokens": 103242416.0, "step": 49730 }, { "entropy": 5.580939674377442, "epoch": 4.511520319303338, "grad_norm": 1.5, "learning_rate": 0.00031287640881199534, "loss": 4.7938, "mean_token_accuracy": 0.23655528724193572, "num_tokens": 103252535.0, "step": 49735 }, { "entropy": 5.688248538970948, "epoch": 4.511973875181423, "grad_norm": 1.1640625, "learning_rate": 0.0003128445137571607, "loss": 4.9557, "mean_token_accuracy": 0.21797917038202286, "num_tokens": 103263039.0, "step": 49740 }, { "entropy": 5.6719725131988525, "epoch": 4.512427431059507, "grad_norm": 1.2421875, "learning_rate": 0.00031281261791969196, "loss": 4.8322, "mean_token_accuracy": 0.2270725890994072, "num_tokens": 103273304.0, "step": 49745 }, { "entropy": 5.695727968215943, "epoch": 4.51288098693759, "grad_norm": 1.25, "learning_rate": 0.00031278072130024856, "loss": 4.967, "mean_token_accuracy": 0.22278642058372497, "num_tokens": 103283688.0, "step": 49750 }, { "entropy": 5.70925235748291, "epoch": 4.513334542815675, "grad_norm": 1.265625, "learning_rate": 0.0003127488238994902, "loss": 4.9112, "mean_token_accuracy": 0.2273602768778801, "num_tokens": 103293572.0, "step": 49755 }, { "entropy": 5.63466739654541, "epoch": 4.513788098693759, "grad_norm": 1.4453125, "learning_rate": 0.0003127169257180766, "loss": 4.8929, "mean_token_accuracy": 0.22488928735256195, "num_tokens": 103303474.0, "step": 49760 }, { "entropy": 5.742396974563599, "epoch": 4.514241654571843, "grad_norm": 1.3671875, "learning_rate": 0.0003126850267566674, "loss": 4.988, "mean_token_accuracy": 0.21695507764816285, "num_tokens": 103314343.0, "step": 49765 }, { "entropy": 5.656146144866943, "epoch": 4.514695210449927, "grad_norm": 1.3203125, "learning_rate": 0.0003126531270159221, "loss": 4.8449, "mean_token_accuracy": 0.23239742666482927, "num_tokens": 103323942.0, "step": 49770 }, { "entropy": 5.68074107170105, "epoch": 4.515148766328012, "grad_norm": 1.3203125, "learning_rate": 0.0003126212264965007, "loss": 4.8868, "mean_token_accuracy": 0.2215219870209694, "num_tokens": 103333785.0, "step": 49775 }, { "entropy": 5.585204124450684, "epoch": 4.515602322206096, "grad_norm": 1.3515625, "learning_rate": 0.00031258932519906266, "loss": 4.7918, "mean_token_accuracy": 0.23268220573663712, "num_tokens": 103344184.0, "step": 49780 }, { "entropy": 5.66937026977539, "epoch": 4.51605587808418, "grad_norm": 1.1875, "learning_rate": 0.00031255742312426786, "loss": 4.937, "mean_token_accuracy": 0.21990395188331605, "num_tokens": 103355085.0, "step": 49785 }, { "entropy": 5.599531793594361, "epoch": 4.5165094339622645, "grad_norm": 1.390625, "learning_rate": 0.00031252552027277595, "loss": 4.8183, "mean_token_accuracy": 0.22387731373310088, "num_tokens": 103365942.0, "step": 49790 }, { "entropy": 5.601382255554199, "epoch": 4.516962989840349, "grad_norm": 1.2578125, "learning_rate": 0.0003124936166452467, "loss": 4.7904, "mean_token_accuracy": 0.2368833526968956, "num_tokens": 103375844.0, "step": 49795 }, { "entropy": 5.6356090068817135, "epoch": 4.517416545718433, "grad_norm": 1.3125, "learning_rate": 0.0003124617122423399, "loss": 4.8892, "mean_token_accuracy": 0.23091549575328826, "num_tokens": 103385871.0, "step": 49800 }, { "entropy": 5.629478406906128, "epoch": 4.517870101596516, "grad_norm": 1.390625, "learning_rate": 0.0003124298070647154, "loss": 4.8776, "mean_token_accuracy": 0.22487613409757615, "num_tokens": 103396888.0, "step": 49805 }, { "entropy": 5.637585067749024, "epoch": 4.518323657474601, "grad_norm": 1.4296875, "learning_rate": 0.0003123979011130329, "loss": 4.8644, "mean_token_accuracy": 0.22664490342140198, "num_tokens": 103406913.0, "step": 49810 }, { "entropy": 5.637938594818115, "epoch": 4.518777213352685, "grad_norm": 1.234375, "learning_rate": 0.0003123659943879523, "loss": 4.8151, "mean_token_accuracy": 0.23366693258285523, "num_tokens": 103416485.0, "step": 49815 }, { "entropy": 5.569645833969116, "epoch": 4.519230769230769, "grad_norm": 1.2890625, "learning_rate": 0.0003123340868901334, "loss": 4.7754, "mean_token_accuracy": 0.23003117740154266, "num_tokens": 103427476.0, "step": 49820 }, { "entropy": 5.574479389190674, "epoch": 4.519684325108853, "grad_norm": 1.3984375, "learning_rate": 0.00031230217862023604, "loss": 4.8542, "mean_token_accuracy": 0.22834824174642562, "num_tokens": 103437500.0, "step": 49825 }, { "entropy": 5.60947322845459, "epoch": 4.520137880986938, "grad_norm": 1.3046875, "learning_rate": 0.00031227026957892013, "loss": 4.7929, "mean_token_accuracy": 0.23218510150909424, "num_tokens": 103447646.0, "step": 49830 }, { "entropy": 5.601420116424561, "epoch": 4.520591436865022, "grad_norm": 1.28125, "learning_rate": 0.00031223835976684555, "loss": 4.8183, "mean_token_accuracy": 0.22533762454986572, "num_tokens": 103457698.0, "step": 49835 }, { "entropy": 5.6715521812438965, "epoch": 4.521044992743106, "grad_norm": 1.296875, "learning_rate": 0.00031220644918467224, "loss": 4.8898, "mean_token_accuracy": 0.22608720511198044, "num_tokens": 103467566.0, "step": 49840 }, { "entropy": 5.644864559173584, "epoch": 4.5214985486211905, "grad_norm": 1.5, "learning_rate": 0.00031217453783306007, "loss": 4.8748, "mean_token_accuracy": 0.22261758148670197, "num_tokens": 103477724.0, "step": 49845 }, { "entropy": 5.638568878173828, "epoch": 4.521952104499274, "grad_norm": 1.4921875, "learning_rate": 0.0003121426257126689, "loss": 4.8743, "mean_token_accuracy": 0.22927780747413634, "num_tokens": 103487864.0, "step": 49850 }, { "entropy": 5.585676527023315, "epoch": 4.522405660377358, "grad_norm": 1.40625, "learning_rate": 0.00031211071282415885, "loss": 4.8137, "mean_token_accuracy": 0.23295720666646957, "num_tokens": 103497229.0, "step": 49855 }, { "entropy": 5.5994843482971195, "epoch": 4.522859216255442, "grad_norm": 1.3046875, "learning_rate": 0.0003120787991681898, "loss": 4.7835, "mean_token_accuracy": 0.23967131227254868, "num_tokens": 103506984.0, "step": 49860 }, { "entropy": 5.579676389694214, "epoch": 4.523312772133527, "grad_norm": 1.390625, "learning_rate": 0.0003120468847454217, "loss": 4.8178, "mean_token_accuracy": 0.22419394552707672, "num_tokens": 103517287.0, "step": 49865 }, { "entropy": 5.592616367340088, "epoch": 4.523766328011611, "grad_norm": 1.359375, "learning_rate": 0.00031201496955651466, "loss": 4.8432, "mean_token_accuracy": 0.22904193699359893, "num_tokens": 103528575.0, "step": 49870 }, { "entropy": 5.696830129623413, "epoch": 4.524219883889695, "grad_norm": 1.34375, "learning_rate": 0.00031198305360212854, "loss": 4.9724, "mean_token_accuracy": 0.21811314672231674, "num_tokens": 103538406.0, "step": 49875 }, { "entropy": 5.683716821670532, "epoch": 4.5246734397677795, "grad_norm": 1.390625, "learning_rate": 0.0003119511368829235, "loss": 4.921, "mean_token_accuracy": 0.22130908071994781, "num_tokens": 103548738.0, "step": 49880 }, { "entropy": 5.566265296936035, "epoch": 4.525126995645864, "grad_norm": 1.3203125, "learning_rate": 0.00031191921939955947, "loss": 4.8034, "mean_token_accuracy": 0.23026317954063416, "num_tokens": 103558755.0, "step": 49885 }, { "entropy": 5.665856456756591, "epoch": 4.525580551523948, "grad_norm": 1.390625, "learning_rate": 0.0003118873011526966, "loss": 4.8607, "mean_token_accuracy": 0.22525896281003951, "num_tokens": 103569115.0, "step": 49890 }, { "entropy": 5.73694109916687, "epoch": 4.526034107402032, "grad_norm": 1.4296875, "learning_rate": 0.0003118553821429949, "loss": 4.9089, "mean_token_accuracy": 0.22743822485208512, "num_tokens": 103580453.0, "step": 49895 }, { "entropy": 5.6315490245819095, "epoch": 4.5264876632801165, "grad_norm": 1.28125, "learning_rate": 0.0003118234623711146, "loss": 4.9079, "mean_token_accuracy": 0.2268270879983902, "num_tokens": 103592995.0, "step": 49900 }, { "entropy": 5.558250665664673, "epoch": 4.5269412191582, "grad_norm": 1.4296875, "learning_rate": 0.00031179154183771576, "loss": 4.7673, "mean_token_accuracy": 0.23652720153331758, "num_tokens": 103603496.0, "step": 49905 }, { "entropy": 5.6663806438446045, "epoch": 4.527394775036284, "grad_norm": 1.640625, "learning_rate": 0.0003117596205434583, "loss": 4.8893, "mean_token_accuracy": 0.22872476130723954, "num_tokens": 103615028.0, "step": 49910 }, { "entropy": 5.623172378540039, "epoch": 4.5278483309143684, "grad_norm": 1.3125, "learning_rate": 0.00031172769848900256, "loss": 4.8726, "mean_token_accuracy": 0.22549275904893876, "num_tokens": 103625430.0, "step": 49915 }, { "entropy": 5.70122332572937, "epoch": 4.528301886792453, "grad_norm": 1.234375, "learning_rate": 0.0003116957756750087, "loss": 4.8852, "mean_token_accuracy": 0.22823155224323272, "num_tokens": 103636409.0, "step": 49920 }, { "entropy": 5.663666248321533, "epoch": 4.528755442670537, "grad_norm": 1.4140625, "learning_rate": 0.00031166385210213684, "loss": 4.9219, "mean_token_accuracy": 0.2307484656572342, "num_tokens": 103646869.0, "step": 49925 }, { "entropy": 5.594880676269531, "epoch": 4.529208998548621, "grad_norm": 1.3125, "learning_rate": 0.00031163192777104715, "loss": 4.7476, "mean_token_accuracy": 0.23180926740169525, "num_tokens": 103657098.0, "step": 49930 }, { "entropy": 5.684582281112671, "epoch": 4.5296625544267055, "grad_norm": 1.328125, "learning_rate": 0.0003116000026823999, "loss": 4.9215, "mean_token_accuracy": 0.2240087404847145, "num_tokens": 103667331.0, "step": 49935 }, { "entropy": 5.601498985290528, "epoch": 4.53011611030479, "grad_norm": 1.2734375, "learning_rate": 0.0003115680768368552, "loss": 4.8078, "mean_token_accuracy": 0.22878775000572205, "num_tokens": 103676755.0, "step": 49940 }, { "entropy": 5.587102651596069, "epoch": 4.530569666182874, "grad_norm": 1.3359375, "learning_rate": 0.0003115361502350734, "loss": 4.8025, "mean_token_accuracy": 0.22458022087812424, "num_tokens": 103686334.0, "step": 49945 }, { "entropy": 5.626953935623169, "epoch": 4.531023222060957, "grad_norm": 1.390625, "learning_rate": 0.0003115042228777148, "loss": 4.9118, "mean_token_accuracy": 0.2226430743932724, "num_tokens": 103697127.0, "step": 49950 }, { "entropy": 5.576815462112426, "epoch": 4.531476777939043, "grad_norm": 1.3828125, "learning_rate": 0.00031147229476543935, "loss": 4.8299, "mean_token_accuracy": 0.21763428002595903, "num_tokens": 103707860.0, "step": 49955 }, { "entropy": 5.68440580368042, "epoch": 4.531930333817126, "grad_norm": 1.28125, "learning_rate": 0.00031144036589890765, "loss": 4.9287, "mean_token_accuracy": 0.22012140303850175, "num_tokens": 103718816.0, "step": 49960 }, { "entropy": 5.571541881561279, "epoch": 4.53238388969521, "grad_norm": 1.3046875, "learning_rate": 0.00031140843627878003, "loss": 4.7915, "mean_token_accuracy": 0.23026351630687714, "num_tokens": 103729203.0, "step": 49965 }, { "entropy": 5.695663595199585, "epoch": 4.5328374455732945, "grad_norm": 1.3515625, "learning_rate": 0.00031137650590571655, "loss": 4.9108, "mean_token_accuracy": 0.22381720095872878, "num_tokens": 103740830.0, "step": 49970 }, { "entropy": 5.626502752304077, "epoch": 4.533291001451379, "grad_norm": 1.28125, "learning_rate": 0.0003113445747803776, "loss": 4.8745, "mean_token_accuracy": 0.2242555558681488, "num_tokens": 103752881.0, "step": 49975 }, { "entropy": 5.634502363204956, "epoch": 4.533744557329463, "grad_norm": 1.296875, "learning_rate": 0.0003113126429034237, "loss": 4.8858, "mean_token_accuracy": 0.2244726300239563, "num_tokens": 103762875.0, "step": 49980 }, { "entropy": 5.653916740417481, "epoch": 4.534198113207547, "grad_norm": 1.375, "learning_rate": 0.00031128071027551504, "loss": 4.8666, "mean_token_accuracy": 0.2260408416390419, "num_tokens": 103772147.0, "step": 49985 }, { "entropy": 5.588986253738403, "epoch": 4.5346516690856316, "grad_norm": 1.2578125, "learning_rate": 0.000311248776897312, "loss": 4.7996, "mean_token_accuracy": 0.22437098175287246, "num_tokens": 103782904.0, "step": 49990 }, { "entropy": 5.55466890335083, "epoch": 4.535105224963716, "grad_norm": 1.328125, "learning_rate": 0.00031121684276947504, "loss": 4.8401, "mean_token_accuracy": 0.22920847684144974, "num_tokens": 103793202.0, "step": 49995 }, { "entropy": 5.725629711151123, "epoch": 4.5355587808418, "grad_norm": 1.5390625, "learning_rate": 0.0003111849078926646, "loss": 5.0622, "mean_token_accuracy": 0.21530501395463944, "num_tokens": 103805796.0, "step": 50000 }, { "entropy": 5.695513439178467, "epoch": 4.5360123367198835, "grad_norm": 1.296875, "learning_rate": 0.000311152972267541, "loss": 4.9028, "mean_token_accuracy": 0.2160744145512581, "num_tokens": 103816622.0, "step": 50005 }, { "entropy": 5.622814130783081, "epoch": 4.536465892597968, "grad_norm": 1.421875, "learning_rate": 0.0003111210358947647, "loss": 4.7889, "mean_token_accuracy": 0.23170362114906312, "num_tokens": 103826174.0, "step": 50010 }, { "entropy": 5.689163017272949, "epoch": 4.536919448476052, "grad_norm": 1.3984375, "learning_rate": 0.0003110890987749962, "loss": 4.9207, "mean_token_accuracy": 0.22693859934806823, "num_tokens": 103836217.0, "step": 50015 }, { "entropy": 5.599464750289917, "epoch": 4.537373004354136, "grad_norm": 1.4140625, "learning_rate": 0.0003110571609088959, "loss": 4.7556, "mean_token_accuracy": 0.23380465507507325, "num_tokens": 103846661.0, "step": 50020 }, { "entropy": 5.624052667617798, "epoch": 4.5378265602322205, "grad_norm": 1.296875, "learning_rate": 0.0003110252222971244, "loss": 4.9134, "mean_token_accuracy": 0.22045110613107682, "num_tokens": 103857323.0, "step": 50025 }, { "entropy": 5.679291677474976, "epoch": 4.538280116110305, "grad_norm": 1.4296875, "learning_rate": 0.0003109932829403421, "loss": 4.9426, "mean_token_accuracy": 0.21745751202106475, "num_tokens": 103867409.0, "step": 50030 }, { "entropy": 5.694183301925659, "epoch": 4.538733671988389, "grad_norm": 1.2578125, "learning_rate": 0.0003109613428392095, "loss": 4.8896, "mean_token_accuracy": 0.22579509019851685, "num_tokens": 103877603.0, "step": 50035 }, { "entropy": 5.635189580917358, "epoch": 4.539187227866473, "grad_norm": 1.3359375, "learning_rate": 0.00031092940199438715, "loss": 4.9088, "mean_token_accuracy": 0.22360528707504274, "num_tokens": 103888236.0, "step": 50040 }, { "entropy": 5.614944314956665, "epoch": 4.539640783744558, "grad_norm": 1.3046875, "learning_rate": 0.0003108974604065357, "loss": 4.8604, "mean_token_accuracy": 0.23066894710063934, "num_tokens": 103898474.0, "step": 50045 }, { "entropy": 5.59013352394104, "epoch": 4.540094339622642, "grad_norm": 1.15625, "learning_rate": 0.00031086551807631553, "loss": 4.8483, "mean_token_accuracy": 0.2291017308831215, "num_tokens": 103909854.0, "step": 50050 }, { "entropy": 5.614906072616577, "epoch": 4.540547895500726, "grad_norm": 1.328125, "learning_rate": 0.00031083357500438736, "loss": 4.8613, "mean_token_accuracy": 0.22067913562059402, "num_tokens": 103919227.0, "step": 50055 }, { "entropy": 5.596865224838257, "epoch": 4.5410014513788095, "grad_norm": 1.3046875, "learning_rate": 0.00031080163119141167, "loss": 4.8235, "mean_token_accuracy": 0.23617361783981322, "num_tokens": 103929022.0, "step": 50060 }, { "entropy": 5.678083848953247, "epoch": 4.541455007256894, "grad_norm": 1.3984375, "learning_rate": 0.00031076968663804917, "loss": 4.8818, "mean_token_accuracy": 0.22406742870807647, "num_tokens": 103939441.0, "step": 50065 }, { "entropy": 5.613299608230591, "epoch": 4.541908563134978, "grad_norm": 1.265625, "learning_rate": 0.00031073774134496047, "loss": 4.8371, "mean_token_accuracy": 0.22294163703918457, "num_tokens": 103950312.0, "step": 50070 }, { "entropy": 5.654742097854614, "epoch": 4.542362119013062, "grad_norm": 1.3671875, "learning_rate": 0.0003107057953128061, "loss": 4.891, "mean_token_accuracy": 0.2182607188820839, "num_tokens": 103960415.0, "step": 50075 }, { "entropy": 5.590717744827271, "epoch": 4.542815674891147, "grad_norm": 1.3515625, "learning_rate": 0.0003106738485422468, "loss": 4.8273, "mean_token_accuracy": 0.23070331811904907, "num_tokens": 103971183.0, "step": 50080 }, { "entropy": 5.689915752410888, "epoch": 4.543269230769231, "grad_norm": 1.3046875, "learning_rate": 0.0003106419010339433, "loss": 4.9434, "mean_token_accuracy": 0.21720528304576875, "num_tokens": 103982120.0, "step": 50085 }, { "entropy": 5.618250799179077, "epoch": 4.543722786647315, "grad_norm": 1.328125, "learning_rate": 0.00031060995278855616, "loss": 4.7858, "mean_token_accuracy": 0.23471929579973222, "num_tokens": 103992116.0, "step": 50090 }, { "entropy": 5.595202493667602, "epoch": 4.544176342525399, "grad_norm": 1.421875, "learning_rate": 0.00031057800380674604, "loss": 4.8755, "mean_token_accuracy": 0.22609275728464126, "num_tokens": 104002646.0, "step": 50095 }, { "entropy": 5.652548551559448, "epoch": 4.544629898403484, "grad_norm": 1.421875, "learning_rate": 0.0003105460540891738, "loss": 4.9338, "mean_token_accuracy": 0.2199845403432846, "num_tokens": 104013158.0, "step": 50100 }, { "entropy": 5.617697525024414, "epoch": 4.545083454281567, "grad_norm": 1.2265625, "learning_rate": 0.0003105141036365001, "loss": 4.8631, "mean_token_accuracy": 0.22477666288614273, "num_tokens": 104023485.0, "step": 50105 }, { "entropy": 5.638106393814087, "epoch": 4.545537010159651, "grad_norm": 1.3828125, "learning_rate": 0.0003104821524493857, "loss": 4.8713, "mean_token_accuracy": 0.2265024185180664, "num_tokens": 104034588.0, "step": 50110 }, { "entropy": 5.650418949127197, "epoch": 4.5459905660377355, "grad_norm": 1.296875, "learning_rate": 0.0003104502005284913, "loss": 4.8638, "mean_token_accuracy": 0.2245439887046814, "num_tokens": 104045081.0, "step": 50115 }, { "entropy": 5.663956785202027, "epoch": 4.54644412191582, "grad_norm": 1.3671875, "learning_rate": 0.0003104182478744778, "loss": 4.8442, "mean_token_accuracy": 0.2238982453942299, "num_tokens": 104056166.0, "step": 50120 }, { "entropy": 5.651707506179809, "epoch": 4.546897677793904, "grad_norm": 1.296875, "learning_rate": 0.0003103862944880058, "loss": 4.8424, "mean_token_accuracy": 0.23217601031064988, "num_tokens": 104066699.0, "step": 50125 }, { "entropy": 5.642619228363037, "epoch": 4.547351233671988, "grad_norm": 1.2890625, "learning_rate": 0.0003103543403697363, "loss": 4.8646, "mean_token_accuracy": 0.2291841760277748, "num_tokens": 104077061.0, "step": 50130 }, { "entropy": 5.642163801193237, "epoch": 4.547804789550073, "grad_norm": 1.2421875, "learning_rate": 0.0003103223855203301, "loss": 4.9044, "mean_token_accuracy": 0.22244041115045549, "num_tokens": 104087877.0, "step": 50135 }, { "entropy": 5.730192852020264, "epoch": 4.548258345428157, "grad_norm": 1.4453125, "learning_rate": 0.00031029042994044784, "loss": 4.9545, "mean_token_accuracy": 0.21927947402000428, "num_tokens": 104099483.0, "step": 50140 }, { "entropy": 5.643180799484253, "epoch": 4.548711901306241, "grad_norm": 1.2421875, "learning_rate": 0.00031025847363075056, "loss": 4.845, "mean_token_accuracy": 0.219778211414814, "num_tokens": 104109530.0, "step": 50145 }, { "entropy": 5.63972659111023, "epoch": 4.549165457184325, "grad_norm": 1.34375, "learning_rate": 0.00031022651659189907, "loss": 4.8712, "mean_token_accuracy": 0.22663553506135942, "num_tokens": 104119610.0, "step": 50150 }, { "entropy": 5.666290330886841, "epoch": 4.54961901306241, "grad_norm": 1.40625, "learning_rate": 0.0003101945588245541, "loss": 4.9101, "mean_token_accuracy": 0.22288836985826493, "num_tokens": 104130337.0, "step": 50155 }, { "entropy": 5.710297584533691, "epoch": 4.550072568940493, "grad_norm": 1.359375, "learning_rate": 0.0003101626003293768, "loss": 4.8995, "mean_token_accuracy": 0.22102049738168716, "num_tokens": 104139462.0, "step": 50160 }, { "entropy": 5.6157739639282225, "epoch": 4.550526124818577, "grad_norm": 1.4921875, "learning_rate": 0.0003101306411070279, "loss": 4.7781, "mean_token_accuracy": 0.23931246846914292, "num_tokens": 104148640.0, "step": 50165 }, { "entropy": 5.6210558891296385, "epoch": 4.550979680696662, "grad_norm": 1.2890625, "learning_rate": 0.00031009868115816847, "loss": 4.9013, "mean_token_accuracy": 0.22993152290582658, "num_tokens": 104159400.0, "step": 50170 }, { "entropy": 5.587764930725098, "epoch": 4.551433236574746, "grad_norm": 1.328125, "learning_rate": 0.00031006672048345936, "loss": 4.835, "mean_token_accuracy": 0.22996535450220107, "num_tokens": 104170149.0, "step": 50175 }, { "entropy": 5.5866437435150145, "epoch": 4.55188679245283, "grad_norm": 1.28125, "learning_rate": 0.0003100347590835615, "loss": 4.8109, "mean_token_accuracy": 0.23505755215883256, "num_tokens": 104180787.0, "step": 50180 }, { "entropy": 5.697358322143555, "epoch": 4.552340348330914, "grad_norm": 1.3515625, "learning_rate": 0.0003100027969591359, "loss": 4.893, "mean_token_accuracy": 0.22432547211647033, "num_tokens": 104190961.0, "step": 50185 }, { "entropy": 5.6299303531646725, "epoch": 4.552793904208999, "grad_norm": 1.2578125, "learning_rate": 0.00030997083411084356, "loss": 4.83, "mean_token_accuracy": 0.2322741612792015, "num_tokens": 104201886.0, "step": 50190 }, { "entropy": 5.67264347076416, "epoch": 4.553247460087083, "grad_norm": 1.3515625, "learning_rate": 0.0003099388705393454, "loss": 4.8649, "mean_token_accuracy": 0.23176738023757934, "num_tokens": 104212834.0, "step": 50195 }, { "entropy": 5.656153774261474, "epoch": 4.553701015965167, "grad_norm": 1.4296875, "learning_rate": 0.0003099069062453025, "loss": 4.8813, "mean_token_accuracy": 0.22573157548904418, "num_tokens": 104222384.0, "step": 50200 }, { "entropy": 5.604507780075073, "epoch": 4.5541545718432515, "grad_norm": 1.3125, "learning_rate": 0.00030987494122937604, "loss": 4.8342, "mean_token_accuracy": 0.23019215017557143, "num_tokens": 104232971.0, "step": 50205 }, { "entropy": 5.640227365493774, "epoch": 4.554608127721336, "grad_norm": 1.203125, "learning_rate": 0.0003098429754922267, "loss": 4.7692, "mean_token_accuracy": 0.22722506225109101, "num_tokens": 104245239.0, "step": 50210 }, { "entropy": 5.655685997009277, "epoch": 4.555061683599419, "grad_norm": 1.390625, "learning_rate": 0.00030981100903451587, "loss": 4.893, "mean_token_accuracy": 0.22190751731395722, "num_tokens": 104256323.0, "step": 50215 }, { "entropy": 5.65981388092041, "epoch": 4.555515239477503, "grad_norm": 1.3828125, "learning_rate": 0.0003097790418569045, "loss": 4.88, "mean_token_accuracy": 0.22497054189443588, "num_tokens": 104267106.0, "step": 50220 }, { "entropy": 5.637773275375366, "epoch": 4.555968795355588, "grad_norm": 1.3828125, "learning_rate": 0.0003097470739600536, "loss": 4.8742, "mean_token_accuracy": 0.2281886577606201, "num_tokens": 104277336.0, "step": 50225 }, { "entropy": 5.629691505432129, "epoch": 4.556422351233672, "grad_norm": 1.2109375, "learning_rate": 0.0003097151053446244, "loss": 4.8452, "mean_token_accuracy": 0.232522414624691, "num_tokens": 104288809.0, "step": 50230 }, { "entropy": 5.621202754974365, "epoch": 4.556875907111756, "grad_norm": 1.2734375, "learning_rate": 0.0003096831360112781, "loss": 4.8798, "mean_token_accuracy": 0.22104736417531967, "num_tokens": 104299434.0, "step": 50235 }, { "entropy": 5.586041593551636, "epoch": 4.55732946298984, "grad_norm": 1.3515625, "learning_rate": 0.0003096511659606756, "loss": 4.8075, "mean_token_accuracy": 0.22792518883943558, "num_tokens": 104309426.0, "step": 50240 }, { "entropy": 5.567373275756836, "epoch": 4.557783018867925, "grad_norm": 1.28125, "learning_rate": 0.0003096191951934781, "loss": 4.8113, "mean_token_accuracy": 0.230711629986763, "num_tokens": 104319530.0, "step": 50245 }, { "entropy": 5.598849821090698, "epoch": 4.558236574746009, "grad_norm": 1.3828125, "learning_rate": 0.0003095872237103468, "loss": 4.7843, "mean_token_accuracy": 0.23187736570835113, "num_tokens": 104329198.0, "step": 50250 }, { "entropy": 5.706061220169067, "epoch": 4.558690130624093, "grad_norm": 1.3359375, "learning_rate": 0.00030955525151194304, "loss": 4.9519, "mean_token_accuracy": 0.22357378751039506, "num_tokens": 104340481.0, "step": 50255 }, { "entropy": 5.689530372619629, "epoch": 4.559143686502177, "grad_norm": 1.34375, "learning_rate": 0.0003095232785989277, "loss": 4.8532, "mean_token_accuracy": 0.2265137791633606, "num_tokens": 104350382.0, "step": 50260 }, { "entropy": 5.632962656021118, "epoch": 4.559597242380261, "grad_norm": 1.4140625, "learning_rate": 0.0003094913049719623, "loss": 4.7713, "mean_token_accuracy": 0.23010687679052352, "num_tokens": 104360967.0, "step": 50265 }, { "entropy": 5.639765930175781, "epoch": 4.560050798258345, "grad_norm": 1.34375, "learning_rate": 0.00030945933063170793, "loss": 4.8798, "mean_token_accuracy": 0.22832264602184296, "num_tokens": 104371283.0, "step": 50270 }, { "entropy": 5.644532346725464, "epoch": 4.560504354136429, "grad_norm": 1.2578125, "learning_rate": 0.00030942735557882575, "loss": 4.8416, "mean_token_accuracy": 0.23075293451547624, "num_tokens": 104381545.0, "step": 50275 }, { "entropy": 5.6883077144622805, "epoch": 4.560957910014514, "grad_norm": 1.328125, "learning_rate": 0.00030939537981397716, "loss": 4.9621, "mean_token_accuracy": 0.21853375434875488, "num_tokens": 104392533.0, "step": 50280 }, { "entropy": 5.658603715896606, "epoch": 4.561411465892598, "grad_norm": 1.4609375, "learning_rate": 0.00030936340333782326, "loss": 4.9104, "mean_token_accuracy": 0.2233912840485573, "num_tokens": 104402230.0, "step": 50285 }, { "entropy": 5.678667974472046, "epoch": 4.561865021770682, "grad_norm": 1.3515625, "learning_rate": 0.0003093314261510254, "loss": 4.8569, "mean_token_accuracy": 0.22987056970596315, "num_tokens": 104412029.0, "step": 50290 }, { "entropy": 5.613131093978882, "epoch": 4.5623185776487665, "grad_norm": 1.3671875, "learning_rate": 0.000309299448254245, "loss": 4.8344, "mean_token_accuracy": 0.2229466825723648, "num_tokens": 104422107.0, "step": 50295 }, { "entropy": 5.6594932079315186, "epoch": 4.562772133526851, "grad_norm": 1.46875, "learning_rate": 0.00030926746964814324, "loss": 4.8725, "mean_token_accuracy": 0.22183825224637985, "num_tokens": 104432073.0, "step": 50300 }, { "entropy": 5.62965202331543, "epoch": 4.563225689404935, "grad_norm": 1.390625, "learning_rate": 0.00030923549033338147, "loss": 4.8555, "mean_token_accuracy": 0.22795804291963578, "num_tokens": 104441998.0, "step": 50305 }, { "entropy": 5.541490364074707, "epoch": 4.563679245283019, "grad_norm": 1.3203125, "learning_rate": 0.000309203510310621, "loss": 4.7359, "mean_token_accuracy": 0.23800933063030244, "num_tokens": 104451474.0, "step": 50310 }, { "entropy": 5.596472311019897, "epoch": 4.564132801161103, "grad_norm": 1.2734375, "learning_rate": 0.0003091715295805233, "loss": 4.7884, "mean_token_accuracy": 0.23936792016029357, "num_tokens": 104461351.0, "step": 50315 }, { "entropy": 5.6548563003540036, "epoch": 4.564586357039187, "grad_norm": 1.3125, "learning_rate": 0.0003091395481437496, "loss": 4.8555, "mean_token_accuracy": 0.2317029356956482, "num_tokens": 104471013.0, "step": 50320 }, { "entropy": 5.650713777542114, "epoch": 4.565039912917271, "grad_norm": 1.2265625, "learning_rate": 0.0003091075660009614, "loss": 4.8975, "mean_token_accuracy": 0.22257944345474243, "num_tokens": 104481863.0, "step": 50325 }, { "entropy": 5.6875556945800785, "epoch": 4.5654934687953554, "grad_norm": 1.2265625, "learning_rate": 0.00030907558315282, "loss": 4.8692, "mean_token_accuracy": 0.2235629677772522, "num_tokens": 104492718.0, "step": 50330 }, { "entropy": 5.656477260589599, "epoch": 4.56594702467344, "grad_norm": 1.3828125, "learning_rate": 0.00030904359959998685, "loss": 4.8381, "mean_token_accuracy": 0.2265316739678383, "num_tokens": 104502837.0, "step": 50335 }, { "entropy": 5.655040979385376, "epoch": 4.566400580551524, "grad_norm": 1.390625, "learning_rate": 0.0003090116153431234, "loss": 4.9127, "mean_token_accuracy": 0.2287306621670723, "num_tokens": 104514202.0, "step": 50340 }, { "entropy": 5.6685301780700685, "epoch": 4.566854136429608, "grad_norm": 1.46875, "learning_rate": 0.000308979630382891, "loss": 4.8566, "mean_token_accuracy": 0.22518843412399292, "num_tokens": 104525037.0, "step": 50345 }, { "entropy": 5.594941473007202, "epoch": 4.5673076923076925, "grad_norm": 1.375, "learning_rate": 0.00030894764471995137, "loss": 4.8136, "mean_token_accuracy": 0.2302778795361519, "num_tokens": 104534883.0, "step": 50350 }, { "entropy": 5.61194429397583, "epoch": 4.567761248185777, "grad_norm": 1.3828125, "learning_rate": 0.0003089156583549657, "loss": 4.8525, "mean_token_accuracy": 0.22601610124111177, "num_tokens": 104544845.0, "step": 50355 }, { "entropy": 5.673996114730835, "epoch": 4.568214804063861, "grad_norm": 1.3203125, "learning_rate": 0.0003088836712885955, "loss": 4.8769, "mean_token_accuracy": 0.22464786171913148, "num_tokens": 104555654.0, "step": 50360 }, { "entropy": 5.622860527038574, "epoch": 4.568668359941945, "grad_norm": 1.296875, "learning_rate": 0.00030885168352150243, "loss": 4.894, "mean_token_accuracy": 0.21621053516864777, "num_tokens": 104565015.0, "step": 50365 }, { "entropy": 5.542737817764282, "epoch": 4.569121915820029, "grad_norm": 1.296875, "learning_rate": 0.00030881969505434795, "loss": 4.8087, "mean_token_accuracy": 0.23138071596622467, "num_tokens": 104575934.0, "step": 50370 }, { "entropy": 5.5371763706207275, "epoch": 4.569575471698113, "grad_norm": 1.40625, "learning_rate": 0.00030878770588779335, "loss": 4.7698, "mean_token_accuracy": 0.2305763065814972, "num_tokens": 104585915.0, "step": 50375 }, { "entropy": 5.687968730926514, "epoch": 4.570029027576197, "grad_norm": 1.3984375, "learning_rate": 0.00030875571602250064, "loss": 4.9019, "mean_token_accuracy": 0.2215704843401909, "num_tokens": 104595605.0, "step": 50380 }, { "entropy": 5.669393491744995, "epoch": 4.5704825834542815, "grad_norm": 1.203125, "learning_rate": 0.000308723725459131, "loss": 4.9569, "mean_token_accuracy": 0.21701785624027253, "num_tokens": 104608251.0, "step": 50385 }, { "entropy": 5.697407293319702, "epoch": 4.570936139332366, "grad_norm": 1.359375, "learning_rate": 0.0003086917341983461, "loss": 4.8366, "mean_token_accuracy": 0.23312151581048965, "num_tokens": 104618586.0, "step": 50390 }, { "entropy": 5.632842588424682, "epoch": 4.57138969521045, "grad_norm": 1.453125, "learning_rate": 0.0003086597422408076, "loss": 4.858, "mean_token_accuracy": 0.23026376962661743, "num_tokens": 104629718.0, "step": 50395 }, { "entropy": 5.607403087615967, "epoch": 4.571843251088534, "grad_norm": 1.2578125, "learning_rate": 0.000308627749587177, "loss": 4.8305, "mean_token_accuracy": 0.22479713708162308, "num_tokens": 104639923.0, "step": 50400 }, { "entropy": 5.643717241287232, "epoch": 4.5722968069666186, "grad_norm": 1.3515625, "learning_rate": 0.000308595756238116, "loss": 4.876, "mean_token_accuracy": 0.22416977286338807, "num_tokens": 104650890.0, "step": 50405 }, { "entropy": 5.618989181518555, "epoch": 4.572750362844703, "grad_norm": 1.4765625, "learning_rate": 0.0003085637621942862, "loss": 4.8349, "mean_token_accuracy": 0.2296306625008583, "num_tokens": 104661231.0, "step": 50410 }, { "entropy": 5.599440956115723, "epoch": 4.573203918722786, "grad_norm": 1.203125, "learning_rate": 0.00030853176745634925, "loss": 4.798, "mean_token_accuracy": 0.22579531222581864, "num_tokens": 104671641.0, "step": 50415 }, { "entropy": 5.6189836978912355, "epoch": 4.5736574746008705, "grad_norm": 1.3515625, "learning_rate": 0.0003084997720249668, "loss": 4.8426, "mean_token_accuracy": 0.22637235671281813, "num_tokens": 104682310.0, "step": 50420 }, { "entropy": 5.694850969314575, "epoch": 4.574111030478955, "grad_norm": 1.4140625, "learning_rate": 0.00030846777590080057, "loss": 4.9249, "mean_token_accuracy": 0.2208185538649559, "num_tokens": 104692414.0, "step": 50425 }, { "entropy": 5.628934669494629, "epoch": 4.574564586357039, "grad_norm": 1.2734375, "learning_rate": 0.00030843577908451215, "loss": 4.9161, "mean_token_accuracy": 0.215856671333313, "num_tokens": 104703617.0, "step": 50430 }, { "entropy": 5.578206396102905, "epoch": 4.575018142235123, "grad_norm": 1.3984375, "learning_rate": 0.0003084037815767633, "loss": 4.8448, "mean_token_accuracy": 0.22974322140216827, "num_tokens": 104713494.0, "step": 50435 }, { "entropy": 5.628090286254883, "epoch": 4.5754716981132075, "grad_norm": 1.3671875, "learning_rate": 0.0003083717833782158, "loss": 4.8264, "mean_token_accuracy": 0.2248722121119499, "num_tokens": 104723349.0, "step": 50440 }, { "entropy": 5.599398183822632, "epoch": 4.575925253991292, "grad_norm": 1.4453125, "learning_rate": 0.0003083397844895312, "loss": 4.7865, "mean_token_accuracy": 0.24185170233249664, "num_tokens": 104732903.0, "step": 50445 }, { "entropy": 5.559778690338135, "epoch": 4.576378809869376, "grad_norm": 1.4453125, "learning_rate": 0.0003083077849113715, "loss": 4.8229, "mean_token_accuracy": 0.22757029086351394, "num_tokens": 104742533.0, "step": 50450 }, { "entropy": 5.561368942260742, "epoch": 4.57683236574746, "grad_norm": 1.28125, "learning_rate": 0.00030827578464439823, "loss": 4.7459, "mean_token_accuracy": 0.2268357753753662, "num_tokens": 104752161.0, "step": 50455 }, { "entropy": 5.586967658996582, "epoch": 4.577285921625545, "grad_norm": 1.359375, "learning_rate": 0.00030824378368927324, "loss": 4.8154, "mean_token_accuracy": 0.23313124030828475, "num_tokens": 104762630.0, "step": 50460 }, { "entropy": 5.586753797531128, "epoch": 4.577739477503629, "grad_norm": 1.375, "learning_rate": 0.00030821178204665836, "loss": 4.8096, "mean_token_accuracy": 0.23075274378061295, "num_tokens": 104773529.0, "step": 50465 }, { "entropy": 5.589892578125, "epoch": 4.578193033381712, "grad_norm": 1.265625, "learning_rate": 0.0003081797797172154, "loss": 4.7911, "mean_token_accuracy": 0.22131619453430176, "num_tokens": 104783386.0, "step": 50470 }, { "entropy": 5.650656270980835, "epoch": 4.5786465892597965, "grad_norm": 1.4296875, "learning_rate": 0.0003081477767016061, "loss": 4.8832, "mean_token_accuracy": 0.2253374382853508, "num_tokens": 104793254.0, "step": 50475 }, { "entropy": 5.618346500396728, "epoch": 4.579100145137881, "grad_norm": 1.2578125, "learning_rate": 0.00030811577300049226, "loss": 4.881, "mean_token_accuracy": 0.2295272544026375, "num_tokens": 104804345.0, "step": 50480 }, { "entropy": 5.623326349258423, "epoch": 4.579553701015965, "grad_norm": 1.3046875, "learning_rate": 0.0003080837686145359, "loss": 4.8374, "mean_token_accuracy": 0.2219862625002861, "num_tokens": 104814891.0, "step": 50485 }, { "entropy": 5.59203577041626, "epoch": 4.580007256894049, "grad_norm": 1.328125, "learning_rate": 0.0003080517635443987, "loss": 4.8135, "mean_token_accuracy": 0.22337402701377868, "num_tokens": 104825015.0, "step": 50490 }, { "entropy": 5.640541505813599, "epoch": 4.580460812772134, "grad_norm": 1.3203125, "learning_rate": 0.0003080197577907427, "loss": 4.8804, "mean_token_accuracy": 0.21845125257968903, "num_tokens": 104835735.0, "step": 50495 }, { "entropy": 5.6017937660217285, "epoch": 4.580914368650218, "grad_norm": 1.2890625, "learning_rate": 0.00030798775135422966, "loss": 4.8729, "mean_token_accuracy": 0.22304065078496932, "num_tokens": 104847484.0, "step": 50500 }, { "entropy": 5.621297693252563, "epoch": 4.581367924528302, "grad_norm": 1.296875, "learning_rate": 0.0003079557442355215, "loss": 4.8757, "mean_token_accuracy": 0.23170382380485535, "num_tokens": 104857783.0, "step": 50505 }, { "entropy": 5.580574655532837, "epoch": 4.581821480406386, "grad_norm": 1.375, "learning_rate": 0.0003079237364352801, "loss": 4.7989, "mean_token_accuracy": 0.24066220968961716, "num_tokens": 104867498.0, "step": 50510 }, { "entropy": 5.662361574172974, "epoch": 4.58227503628447, "grad_norm": 1.3515625, "learning_rate": 0.0003078917279541675, "loss": 4.8719, "mean_token_accuracy": 0.22711084485054017, "num_tokens": 104876505.0, "step": 50515 }, { "entropy": 5.649198818206787, "epoch": 4.582728592162555, "grad_norm": 1.2890625, "learning_rate": 0.0003078597187928456, "loss": 4.9033, "mean_token_accuracy": 0.21648503839969635, "num_tokens": 104886932.0, "step": 50520 }, { "entropy": 5.677640056610107, "epoch": 4.583182148040638, "grad_norm": 1.484375, "learning_rate": 0.0003078277089519764, "loss": 4.8453, "mean_token_accuracy": 0.23290291279554368, "num_tokens": 104896733.0, "step": 50525 }, { "entropy": 5.649524068832397, "epoch": 4.5836357039187225, "grad_norm": 1.3828125, "learning_rate": 0.00030779569843222165, "loss": 4.9014, "mean_token_accuracy": 0.21404143124818803, "num_tokens": 104906846.0, "step": 50530 }, { "entropy": 5.53101544380188, "epoch": 4.584089259796807, "grad_norm": 1.3984375, "learning_rate": 0.00030776368723424365, "loss": 4.6734, "mean_token_accuracy": 0.24461723864078522, "num_tokens": 104916136.0, "step": 50535 }, { "entropy": 5.6068034172058105, "epoch": 4.584542815674891, "grad_norm": 1.2890625, "learning_rate": 0.0003077316753587042, "loss": 4.819, "mean_token_accuracy": 0.2325960412621498, "num_tokens": 104926145.0, "step": 50540 }, { "entropy": 5.660551738739014, "epoch": 4.584996371552975, "grad_norm": 1.46875, "learning_rate": 0.00030769966280626526, "loss": 4.9312, "mean_token_accuracy": 0.21992480754852295, "num_tokens": 104935576.0, "step": 50545 }, { "entropy": 5.595847082138062, "epoch": 4.58544992743106, "grad_norm": 1.2890625, "learning_rate": 0.00030766764957758906, "loss": 4.7507, "mean_token_accuracy": 0.23778180181980133, "num_tokens": 104944846.0, "step": 50550 }, { "entropy": 5.5945477962493895, "epoch": 4.585903483309144, "grad_norm": 1.34375, "learning_rate": 0.00030763563567333754, "loss": 4.7951, "mean_token_accuracy": 0.23055403381586076, "num_tokens": 104954604.0, "step": 50555 }, { "entropy": 5.601663875579834, "epoch": 4.586357039187228, "grad_norm": 1.3046875, "learning_rate": 0.00030760362109417277, "loss": 4.8355, "mean_token_accuracy": 0.22555627822875976, "num_tokens": 104964858.0, "step": 50560 }, { "entropy": 5.664407968521118, "epoch": 4.586810595065312, "grad_norm": 1.2734375, "learning_rate": 0.0003075716058407568, "loss": 4.8979, "mean_token_accuracy": 0.219611294567585, "num_tokens": 104974997.0, "step": 50565 }, { "entropy": 5.619162082672119, "epoch": 4.587264150943396, "grad_norm": 1.40625, "learning_rate": 0.00030753958991375176, "loss": 4.8066, "mean_token_accuracy": 0.2315882548689842, "num_tokens": 104984585.0, "step": 50570 }, { "entropy": 5.599903774261475, "epoch": 4.58771770682148, "grad_norm": 1.28125, "learning_rate": 0.00030750757331381964, "loss": 4.8143, "mean_token_accuracy": 0.2357783392071724, "num_tokens": 104994843.0, "step": 50575 }, { "entropy": 5.598966503143311, "epoch": 4.588171262699564, "grad_norm": 1.3046875, "learning_rate": 0.0003074755560416226, "loss": 4.884, "mean_token_accuracy": 0.22850777506828307, "num_tokens": 105006082.0, "step": 50580 }, { "entropy": 5.606411933898926, "epoch": 4.588624818577649, "grad_norm": 1.2578125, "learning_rate": 0.00030744353809782283, "loss": 4.8404, "mean_token_accuracy": 0.22787705063819885, "num_tokens": 105016704.0, "step": 50585 }, { "entropy": 5.6820660591125485, "epoch": 4.589078374455733, "grad_norm": 1.234375, "learning_rate": 0.00030741151948308237, "loss": 4.9283, "mean_token_accuracy": 0.22554327845573424, "num_tokens": 105027810.0, "step": 50590 }, { "entropy": 5.599266195297242, "epoch": 4.589531930333817, "grad_norm": 1.375, "learning_rate": 0.0003073795001980635, "loss": 4.8174, "mean_token_accuracy": 0.23282620906829835, "num_tokens": 105037488.0, "step": 50595 }, { "entropy": 5.639221477508545, "epoch": 4.589985486211901, "grad_norm": 1.5, "learning_rate": 0.0003073474802434282, "loss": 4.8748, "mean_token_accuracy": 0.2260706529021263, "num_tokens": 105047461.0, "step": 50600 }, { "entropy": 5.656062459945678, "epoch": 4.590439042089986, "grad_norm": 1.3359375, "learning_rate": 0.000307315459619839, "loss": 4.8886, "mean_token_accuracy": 0.2277732253074646, "num_tokens": 105058020.0, "step": 50605 }, { "entropy": 5.729408550262451, "epoch": 4.59089259796807, "grad_norm": 1.375, "learning_rate": 0.0003072834383279576, "loss": 4.9001, "mean_token_accuracy": 0.2208922639489174, "num_tokens": 105069638.0, "step": 50610 }, { "entropy": 5.664794111251831, "epoch": 4.591346153846154, "grad_norm": 1.453125, "learning_rate": 0.0003072514163684466, "loss": 4.8588, "mean_token_accuracy": 0.22586833834648132, "num_tokens": 105078686.0, "step": 50615 }, { "entropy": 5.637793970108032, "epoch": 4.5917997097242385, "grad_norm": 1.25, "learning_rate": 0.0003072193937419681, "loss": 4.851, "mean_token_accuracy": 0.22906333208084106, "num_tokens": 105089739.0, "step": 50620 }, { "entropy": 5.62109146118164, "epoch": 4.592253265602322, "grad_norm": 1.25, "learning_rate": 0.00030718737044918435, "loss": 4.8442, "mean_token_accuracy": 0.22694653570652007, "num_tokens": 105100673.0, "step": 50625 }, { "entropy": 5.621618318557739, "epoch": 4.592706821480406, "grad_norm": 1.3515625, "learning_rate": 0.00030715534649075745, "loss": 4.8432, "mean_token_accuracy": 0.22862128168344498, "num_tokens": 105110750.0, "step": 50630 }, { "entropy": 5.562719249725342, "epoch": 4.59316037735849, "grad_norm": 1.375, "learning_rate": 0.00030712332186734985, "loss": 4.7615, "mean_token_accuracy": 0.2326630249619484, "num_tokens": 105120809.0, "step": 50635 }, { "entropy": 5.637806558609009, "epoch": 4.593613933236575, "grad_norm": 1.2421875, "learning_rate": 0.0003070912965796238, "loss": 4.8658, "mean_token_accuracy": 0.22420564144849778, "num_tokens": 105131106.0, "step": 50640 }, { "entropy": 5.66543025970459, "epoch": 4.594067489114659, "grad_norm": 1.296875, "learning_rate": 0.00030705927062824154, "loss": 4.8983, "mean_token_accuracy": 0.22100044339895247, "num_tokens": 105140970.0, "step": 50645 }, { "entropy": 5.667979335784912, "epoch": 4.594521044992743, "grad_norm": 1.2734375, "learning_rate": 0.0003070272440138654, "loss": 4.8911, "mean_token_accuracy": 0.22011010050773622, "num_tokens": 105152429.0, "step": 50650 }, { "entropy": 5.692554950714111, "epoch": 4.594974600870827, "grad_norm": 1.28125, "learning_rate": 0.0003069952167371577, "loss": 4.931, "mean_token_accuracy": 0.22218783050775529, "num_tokens": 105163534.0, "step": 50655 }, { "entropy": 5.590262937545776, "epoch": 4.595428156748912, "grad_norm": 1.3125, "learning_rate": 0.00030696318879878064, "loss": 4.782, "mean_token_accuracy": 0.2283254384994507, "num_tokens": 105172798.0, "step": 50660 }, { "entropy": 5.657283449172974, "epoch": 4.595881712626996, "grad_norm": 1.40625, "learning_rate": 0.00030693116019939686, "loss": 4.8805, "mean_token_accuracy": 0.22765248119831086, "num_tokens": 105182576.0, "step": 50665 }, { "entropy": 5.653711795806885, "epoch": 4.596335268505079, "grad_norm": 1.59375, "learning_rate": 0.00030689913093966847, "loss": 4.8666, "mean_token_accuracy": 0.23224549293518065, "num_tokens": 105192070.0, "step": 50670 }, { "entropy": 5.656721878051758, "epoch": 4.5967888243831645, "grad_norm": 1.296875, "learning_rate": 0.000306867101020258, "loss": 4.8532, "mean_token_accuracy": 0.23058617860078812, "num_tokens": 105203151.0, "step": 50675 }, { "entropy": 5.658195447921753, "epoch": 4.597242380261248, "grad_norm": 1.3828125, "learning_rate": 0.0003068350704418277, "loss": 4.9317, "mean_token_accuracy": 0.2186349704861641, "num_tokens": 105213217.0, "step": 50680 }, { "entropy": 5.5655436515808105, "epoch": 4.597695936139332, "grad_norm": 1.375, "learning_rate": 0.00030680303920504006, "loss": 4.7665, "mean_token_accuracy": 0.23543991148471832, "num_tokens": 105223450.0, "step": 50685 }, { "entropy": 5.671842050552368, "epoch": 4.598149492017416, "grad_norm": 1.3359375, "learning_rate": 0.0003067710073105574, "loss": 4.9297, "mean_token_accuracy": 0.2234810084104538, "num_tokens": 105234705.0, "step": 50690 }, { "entropy": 5.7554931640625, "epoch": 4.598603047895501, "grad_norm": 1.3671875, "learning_rate": 0.00030673897475904223, "loss": 5.0656, "mean_token_accuracy": 0.20581818521022796, "num_tokens": 105245042.0, "step": 50695 }, { "entropy": 5.695953893661499, "epoch": 4.599056603773585, "grad_norm": 1.265625, "learning_rate": 0.00030670694155115704, "loss": 4.8653, "mean_token_accuracy": 0.21814588457345963, "num_tokens": 105255830.0, "step": 50700 }, { "entropy": 5.627609300613403, "epoch": 4.599510159651669, "grad_norm": 1.390625, "learning_rate": 0.00030667490768756416, "loss": 4.8542, "mean_token_accuracy": 0.22714640945196152, "num_tokens": 105265844.0, "step": 50705 }, { "entropy": 5.583739233016968, "epoch": 4.5999637155297535, "grad_norm": 1.40625, "learning_rate": 0.0003066428731689262, "loss": 4.8732, "mean_token_accuracy": 0.2303543657064438, "num_tokens": 105276846.0, "step": 50710 }, { "entropy": 5.686843967437744, "epoch": 4.600417271407838, "grad_norm": 1.2421875, "learning_rate": 0.00030661083799590544, "loss": 4.9136, "mean_token_accuracy": 0.22183436304330825, "num_tokens": 105286740.0, "step": 50715 }, { "entropy": 5.616544103622436, "epoch": 4.600870827285922, "grad_norm": 1.3125, "learning_rate": 0.00030657880216916454, "loss": 4.8342, "mean_token_accuracy": 0.2319315105676651, "num_tokens": 105296710.0, "step": 50720 }, { "entropy": 5.65447359085083, "epoch": 4.601324383164005, "grad_norm": 1.3203125, "learning_rate": 0.000306546765689366, "loss": 4.8954, "mean_token_accuracy": 0.2313593491911888, "num_tokens": 105307076.0, "step": 50725 }, { "entropy": 5.641586399078369, "epoch": 4.60177793904209, "grad_norm": 1.484375, "learning_rate": 0.0003065147285571722, "loss": 4.8199, "mean_token_accuracy": 0.2286187544465065, "num_tokens": 105317486.0, "step": 50730 }, { "entropy": 5.608083820343017, "epoch": 4.602231494920174, "grad_norm": 1.3515625, "learning_rate": 0.0003064826907732459, "loss": 4.8444, "mean_token_accuracy": 0.22638851255178452, "num_tokens": 105327771.0, "step": 50735 }, { "entropy": 5.630862045288086, "epoch": 4.602685050798258, "grad_norm": 1.2890625, "learning_rate": 0.00030645065233824955, "loss": 4.8947, "mean_token_accuracy": 0.21975306868553163, "num_tokens": 105339191.0, "step": 50740 }, { "entropy": 5.657925939559936, "epoch": 4.6031386066763424, "grad_norm": 1.328125, "learning_rate": 0.00030641861325284557, "loss": 4.8748, "mean_token_accuracy": 0.2318240746855736, "num_tokens": 105349949.0, "step": 50745 }, { "entropy": 5.584345293045044, "epoch": 4.603592162554427, "grad_norm": 1.25, "learning_rate": 0.00030638657351769673, "loss": 4.8463, "mean_token_accuracy": 0.21807619482278823, "num_tokens": 105360357.0, "step": 50750 }, { "entropy": 5.709790229797363, "epoch": 4.604045718432511, "grad_norm": 1.296875, "learning_rate": 0.00030635453313346554, "loss": 4.8914, "mean_token_accuracy": 0.22389622330665587, "num_tokens": 105370765.0, "step": 50755 }, { "entropy": 5.690171098709106, "epoch": 4.604499274310595, "grad_norm": 1.34375, "learning_rate": 0.0003063224921008146, "loss": 4.8821, "mean_token_accuracy": 0.2295605272054672, "num_tokens": 105380797.0, "step": 50760 }, { "entropy": 5.661124229431152, "epoch": 4.6049528301886795, "grad_norm": 1.46875, "learning_rate": 0.0003062904504204066, "loss": 4.8622, "mean_token_accuracy": 0.22322365939617156, "num_tokens": 105390653.0, "step": 50765 }, { "entropy": 5.747948074340821, "epoch": 4.605406386066764, "grad_norm": 1.3828125, "learning_rate": 0.00030625840809290404, "loss": 4.9964, "mean_token_accuracy": 0.22046414017677307, "num_tokens": 105401308.0, "step": 50770 }, { "entropy": 5.618389749526978, "epoch": 4.605859941944848, "grad_norm": 1.2734375, "learning_rate": 0.00030622636511896977, "loss": 4.8647, "mean_token_accuracy": 0.2199568271636963, "num_tokens": 105412412.0, "step": 50775 }, { "entropy": 5.686307191848755, "epoch": 4.606313497822931, "grad_norm": 1.2734375, "learning_rate": 0.0003061943214992662, "loss": 4.9366, "mean_token_accuracy": 0.216050323843956, "num_tokens": 105424789.0, "step": 50780 }, { "entropy": 5.640134382247925, "epoch": 4.606767053701016, "grad_norm": 1.3359375, "learning_rate": 0.0003061622772344561, "loss": 4.9423, "mean_token_accuracy": 0.22565828561782836, "num_tokens": 105434380.0, "step": 50785 }, { "entropy": 5.647423553466797, "epoch": 4.6072206095791, "grad_norm": 1.2734375, "learning_rate": 0.0003061302323252022, "loss": 4.8343, "mean_token_accuracy": 0.2336523249745369, "num_tokens": 105443889.0, "step": 50790 }, { "entropy": 5.681927680969238, "epoch": 4.607674165457184, "grad_norm": 1.3203125, "learning_rate": 0.0003060981867721671, "loss": 4.8466, "mean_token_accuracy": 0.22723437249660491, "num_tokens": 105454336.0, "step": 50795 }, { "entropy": 5.714066362380981, "epoch": 4.6081277213352685, "grad_norm": 1.34375, "learning_rate": 0.00030606614057601374, "loss": 4.9633, "mean_token_accuracy": 0.21961478143930435, "num_tokens": 105464601.0, "step": 50800 }, { "entropy": 5.698313045501709, "epoch": 4.608581277213353, "grad_norm": 1.3515625, "learning_rate": 0.00030603409373740456, "loss": 4.8885, "mean_token_accuracy": 0.21760042011737823, "num_tokens": 105475265.0, "step": 50805 }, { "entropy": 5.569851303100586, "epoch": 4.609034833091437, "grad_norm": 1.3984375, "learning_rate": 0.00030600204625700234, "loss": 4.7688, "mean_token_accuracy": 0.23256535083055496, "num_tokens": 105485491.0, "step": 50810 }, { "entropy": 5.617128133773804, "epoch": 4.609488388969521, "grad_norm": 1.3359375, "learning_rate": 0.00030596999813547007, "loss": 4.8314, "mean_token_accuracy": 0.2247454509139061, "num_tokens": 105495859.0, "step": 50815 }, { "entropy": 5.57914924621582, "epoch": 4.6099419448476056, "grad_norm": 1.328125, "learning_rate": 0.0003059379493734702, "loss": 4.7879, "mean_token_accuracy": 0.23186047971248627, "num_tokens": 105506385.0, "step": 50820 }, { "entropy": 5.629433870315552, "epoch": 4.610395500725689, "grad_norm": 1.4296875, "learning_rate": 0.00030590589997166575, "loss": 4.7819, "mean_token_accuracy": 0.23234861940145493, "num_tokens": 105515829.0, "step": 50825 }, { "entropy": 5.612813234329224, "epoch": 4.610849056603773, "grad_norm": 1.40625, "learning_rate": 0.0003058738499307193, "loss": 4.7791, "mean_token_accuracy": 0.24024191349744797, "num_tokens": 105525950.0, "step": 50830 }, { "entropy": 5.621317148208618, "epoch": 4.6113026124818575, "grad_norm": 1.3046875, "learning_rate": 0.00030584179925129384, "loss": 4.8598, "mean_token_accuracy": 0.22495245486497878, "num_tokens": 105536536.0, "step": 50835 }, { "entropy": 5.555648565292358, "epoch": 4.611756168359942, "grad_norm": 1.328125, "learning_rate": 0.00030580974793405213, "loss": 4.7801, "mean_token_accuracy": 0.23644742518663406, "num_tokens": 105546069.0, "step": 50840 }, { "entropy": 5.582544040679932, "epoch": 4.612209724238026, "grad_norm": 1.3203125, "learning_rate": 0.00030577769597965696, "loss": 4.8426, "mean_token_accuracy": 0.226922869682312, "num_tokens": 105556522.0, "step": 50845 }, { "entropy": 5.595562171936035, "epoch": 4.61266328011611, "grad_norm": 1.328125, "learning_rate": 0.0003057456433887712, "loss": 4.7835, "mean_token_accuracy": 0.2273197665810585, "num_tokens": 105566431.0, "step": 50850 }, { "entropy": 5.600449514389038, "epoch": 4.6131168359941945, "grad_norm": 1.2734375, "learning_rate": 0.00030571359016205767, "loss": 4.812, "mean_token_accuracy": 0.2331511363387108, "num_tokens": 105576270.0, "step": 50855 }, { "entropy": 5.608708238601684, "epoch": 4.613570391872279, "grad_norm": 1.3984375, "learning_rate": 0.0003056815363001793, "loss": 4.8767, "mean_token_accuracy": 0.22699575275182723, "num_tokens": 105587144.0, "step": 50860 }, { "entropy": 5.59222993850708, "epoch": 4.614023947750363, "grad_norm": 1.3359375, "learning_rate": 0.00030564948180379897, "loss": 4.8332, "mean_token_accuracy": 0.22785727977752684, "num_tokens": 105596636.0, "step": 50865 }, { "entropy": 5.638585472106934, "epoch": 4.614477503628447, "grad_norm": 1.28125, "learning_rate": 0.0003056174266735795, "loss": 4.8591, "mean_token_accuracy": 0.2252470225095749, "num_tokens": 105605825.0, "step": 50870 }, { "entropy": 5.735712242126465, "epoch": 4.614931059506532, "grad_norm": 1.3203125, "learning_rate": 0.0003055853709101839, "loss": 4.9415, "mean_token_accuracy": 0.22258786410093306, "num_tokens": 105615990.0, "step": 50875 }, { "entropy": 5.643759775161743, "epoch": 4.615384615384615, "grad_norm": 1.3203125, "learning_rate": 0.00030555331451427494, "loss": 4.8783, "mean_token_accuracy": 0.22072271555662154, "num_tokens": 105626673.0, "step": 50880 }, { "entropy": 5.653816652297974, "epoch": 4.615838171262699, "grad_norm": 1.3984375, "learning_rate": 0.00030552125748651573, "loss": 4.9466, "mean_token_accuracy": 0.21463381201028825, "num_tokens": 105636752.0, "step": 50885 }, { "entropy": 5.709087991714478, "epoch": 4.6162917271407835, "grad_norm": 1.2421875, "learning_rate": 0.00030548919982756914, "loss": 4.9336, "mean_token_accuracy": 0.21918269097805024, "num_tokens": 105647476.0, "step": 50890 }, { "entropy": 5.666573143005371, "epoch": 4.616745283018868, "grad_norm": 1.28125, "learning_rate": 0.00030545714153809805, "loss": 4.8625, "mean_token_accuracy": 0.22858808785676957, "num_tokens": 105658135.0, "step": 50895 }, { "entropy": 5.595974922180176, "epoch": 4.617198838896952, "grad_norm": 1.375, "learning_rate": 0.0003054250826187655, "loss": 4.7757, "mean_token_accuracy": 0.23189259320497513, "num_tokens": 105667802.0, "step": 50900 }, { "entropy": 5.671021270751953, "epoch": 4.617652394775036, "grad_norm": 1.4765625, "learning_rate": 0.0003053930230702346, "loss": 4.9068, "mean_token_accuracy": 0.228813798725605, "num_tokens": 105679161.0, "step": 50905 }, { "entropy": 5.656111526489258, "epoch": 4.618105950653121, "grad_norm": 1.5859375, "learning_rate": 0.0003053609628931682, "loss": 4.9542, "mean_token_accuracy": 0.21804093569517136, "num_tokens": 105688093.0, "step": 50910 }, { "entropy": 5.678687047958374, "epoch": 4.618559506531205, "grad_norm": 1.3515625, "learning_rate": 0.0003053289020882293, "loss": 4.9203, "mean_token_accuracy": 0.22115679532289506, "num_tokens": 105697982.0, "step": 50915 }, { "entropy": 5.667180919647217, "epoch": 4.619013062409289, "grad_norm": 1.390625, "learning_rate": 0.00030529684065608103, "loss": 4.7907, "mean_token_accuracy": 0.230059252679348, "num_tokens": 105708729.0, "step": 50920 }, { "entropy": 5.581840705871582, "epoch": 4.619466618287373, "grad_norm": 1.328125, "learning_rate": 0.00030526477859738635, "loss": 4.7864, "mean_token_accuracy": 0.22572413980960845, "num_tokens": 105718919.0, "step": 50925 }, { "entropy": 5.60128345489502, "epoch": 4.619920174165458, "grad_norm": 1.390625, "learning_rate": 0.0003052327159128083, "loss": 4.7875, "mean_token_accuracy": 0.23378977328538894, "num_tokens": 105727787.0, "step": 50930 }, { "entropy": 5.555875396728515, "epoch": 4.620373730043541, "grad_norm": 1.3203125, "learning_rate": 0.00030520065260301003, "loss": 4.8092, "mean_token_accuracy": 0.22311647236347198, "num_tokens": 105738282.0, "step": 50935 }, { "entropy": 5.624907159805298, "epoch": 4.620827285921625, "grad_norm": 1.375, "learning_rate": 0.0003051685886686546, "loss": 4.8059, "mean_token_accuracy": 0.22512520998716354, "num_tokens": 105748786.0, "step": 50940 }, { "entropy": 5.6374183177948, "epoch": 4.6212808417997095, "grad_norm": 1.296875, "learning_rate": 0.000305136524110405, "loss": 4.8499, "mean_token_accuracy": 0.22338816821575164, "num_tokens": 105759156.0, "step": 50945 }, { "entropy": 5.617321157455445, "epoch": 4.621734397677794, "grad_norm": 1.3828125, "learning_rate": 0.0003051044589289245, "loss": 4.9121, "mean_token_accuracy": 0.219149149954319, "num_tokens": 105769434.0, "step": 50950 }, { "entropy": 5.680973052978516, "epoch": 4.622187953555878, "grad_norm": 1.5390625, "learning_rate": 0.00030507239312487595, "loss": 4.995, "mean_token_accuracy": 0.21889229416847228, "num_tokens": 105779408.0, "step": 50955 }, { "entropy": 5.6847470760345455, "epoch": 4.622641509433962, "grad_norm": 1.375, "learning_rate": 0.00030504032669892276, "loss": 4.9127, "mean_token_accuracy": 0.21904740184545518, "num_tokens": 105789517.0, "step": 50960 }, { "entropy": 5.668029403686523, "epoch": 4.623095065312047, "grad_norm": 1.2890625, "learning_rate": 0.00030500825965172797, "loss": 4.8435, "mean_token_accuracy": 0.2260068491101265, "num_tokens": 105799823.0, "step": 50965 }, { "entropy": 5.6476218700408936, "epoch": 4.623548621190131, "grad_norm": 1.2578125, "learning_rate": 0.00030497619198395466, "loss": 4.8724, "mean_token_accuracy": 0.22505230605602264, "num_tokens": 105810038.0, "step": 50970 }, { "entropy": 5.645989513397216, "epoch": 4.624002177068215, "grad_norm": 1.375, "learning_rate": 0.00030494412369626615, "loss": 4.9185, "mean_token_accuracy": 0.2184138759970665, "num_tokens": 105819940.0, "step": 50975 }, { "entropy": 5.619664335250855, "epoch": 4.6244557329462985, "grad_norm": 1.4453125, "learning_rate": 0.0003049120547893255, "loss": 4.8377, "mean_token_accuracy": 0.2263239488005638, "num_tokens": 105829829.0, "step": 50980 }, { "entropy": 5.628520584106445, "epoch": 4.624909288824383, "grad_norm": 1.4609375, "learning_rate": 0.0003048799852637958, "loss": 4.8201, "mean_token_accuracy": 0.23618641793727874, "num_tokens": 105839463.0, "step": 50985 }, { "entropy": 5.722886323928833, "epoch": 4.625362844702467, "grad_norm": 1.2421875, "learning_rate": 0.00030484791512034063, "loss": 5.0337, "mean_token_accuracy": 0.21005859822034836, "num_tokens": 105849916.0, "step": 50990 }, { "entropy": 5.611998462677002, "epoch": 4.625816400580551, "grad_norm": 1.3203125, "learning_rate": 0.0003048158443596228, "loss": 4.8298, "mean_token_accuracy": 0.2257625624537468, "num_tokens": 105860699.0, "step": 50995 }, { "entropy": 5.658289623260498, "epoch": 4.626269956458636, "grad_norm": 1.4921875, "learning_rate": 0.0003047837729823058, "loss": 4.8218, "mean_token_accuracy": 0.22070784419775008, "num_tokens": 105870332.0, "step": 51000 }, { "epoch": 4.626269956458636, "eval_entropy": 5.314673195813037, "eval_loss": 4.943879127502441, "eval_mean_token_accuracy": 0.23091070976327446, "eval_num_tokens": 105870332.0, "eval_runtime": 20.5109, "eval_samples_per_second": 1723.961, "eval_steps_per_second": 215.495, "step": 51000 }, { "entropy": 5.5747912406921385, "epoch": 4.62672351233672, "grad_norm": 1.46875, "learning_rate": 0.0003047517009890527, "loss": 4.8402, "mean_token_accuracy": 0.23035148084163665, "num_tokens": 105879364.0, "step": 51005 }, { "entropy": 5.654276990890503, "epoch": 4.627177068214804, "grad_norm": 1.34375, "learning_rate": 0.00030471962838052693, "loss": 4.9661, "mean_token_accuracy": 0.21786375790834428, "num_tokens": 105889554.0, "step": 51010 }, { "entropy": 5.637483835220337, "epoch": 4.627630624092888, "grad_norm": 1.4140625, "learning_rate": 0.0003046875551573916, "loss": 4.7727, "mean_token_accuracy": 0.2379957765340805, "num_tokens": 105900426.0, "step": 51015 }, { "entropy": 5.530906009674072, "epoch": 4.628084179970973, "grad_norm": 1.3203125, "learning_rate": 0.0003046554813203101, "loss": 4.6728, "mean_token_accuracy": 0.23877642303705215, "num_tokens": 105909541.0, "step": 51020 }, { "entropy": 5.646114540100098, "epoch": 4.628537735849057, "grad_norm": 1.5390625, "learning_rate": 0.0003046234068699457, "loss": 4.8988, "mean_token_accuracy": 0.22120093554258347, "num_tokens": 105919951.0, "step": 51025 }, { "entropy": 5.574805164337159, "epoch": 4.628991291727141, "grad_norm": 1.3671875, "learning_rate": 0.0003045913318069616, "loss": 4.7788, "mean_token_accuracy": 0.2319977819919586, "num_tokens": 105929048.0, "step": 51030 }, { "entropy": 5.6524749279022215, "epoch": 4.629444847605225, "grad_norm": 1.390625, "learning_rate": 0.0003045592561320213, "loss": 4.7947, "mean_token_accuracy": 0.23470182120800018, "num_tokens": 105938105.0, "step": 51035 }, { "entropy": 5.650112152099609, "epoch": 4.629898403483309, "grad_norm": 1.4375, "learning_rate": 0.000304527179845788, "loss": 4.8671, "mean_token_accuracy": 0.22331915199756622, "num_tokens": 105948167.0, "step": 51040 }, { "entropy": 5.68101396560669, "epoch": 4.630351959361393, "grad_norm": 1.4140625, "learning_rate": 0.0003044951029489252, "loss": 4.889, "mean_token_accuracy": 0.2294978141784668, "num_tokens": 105959387.0, "step": 51045 }, { "entropy": 5.567787599563599, "epoch": 4.630805515239477, "grad_norm": 1.375, "learning_rate": 0.000304463025442096, "loss": 4.7713, "mean_token_accuracy": 0.2325567200779915, "num_tokens": 105969436.0, "step": 51050 }, { "entropy": 5.6713114261627195, "epoch": 4.631259071117562, "grad_norm": 1.4375, "learning_rate": 0.0003044309473259641, "loss": 4.8774, "mean_token_accuracy": 0.2301829233765602, "num_tokens": 105979102.0, "step": 51055 }, { "entropy": 5.568918037414551, "epoch": 4.631712626995646, "grad_norm": 1.3203125, "learning_rate": 0.00030439886860119265, "loss": 4.779, "mean_token_accuracy": 0.23363327533006667, "num_tokens": 105989796.0, "step": 51060 }, { "entropy": 5.647738695144653, "epoch": 4.63216618287373, "grad_norm": 1.2734375, "learning_rate": 0.000304366789268445, "loss": 4.8662, "mean_token_accuracy": 0.22614934146404267, "num_tokens": 106000194.0, "step": 51065 }, { "entropy": 5.656801319122314, "epoch": 4.632619738751814, "grad_norm": 1.4765625, "learning_rate": 0.0003043347093283848, "loss": 4.8455, "mean_token_accuracy": 0.22746677100658416, "num_tokens": 106009108.0, "step": 51070 }, { "entropy": 5.601779508590698, "epoch": 4.633073294629899, "grad_norm": 1.4453125, "learning_rate": 0.00030430262878167533, "loss": 4.8111, "mean_token_accuracy": 0.2262859523296356, "num_tokens": 106019342.0, "step": 51075 }, { "entropy": 5.689200305938721, "epoch": 4.633526850507983, "grad_norm": 1.328125, "learning_rate": 0.0003042705476289799, "loss": 4.9175, "mean_token_accuracy": 0.21309079527854918, "num_tokens": 106029079.0, "step": 51080 }, { "entropy": 5.5901631832122805, "epoch": 4.633980406386067, "grad_norm": 1.34375, "learning_rate": 0.0003042384658709622, "loss": 4.8004, "mean_token_accuracy": 0.23674729317426682, "num_tokens": 106039406.0, "step": 51085 }, { "entropy": 5.640896844863891, "epoch": 4.634433962264151, "grad_norm": 1.359375, "learning_rate": 0.0003042063835082856, "loss": 4.873, "mean_token_accuracy": 0.2213134765625, "num_tokens": 106049603.0, "step": 51090 }, { "entropy": 5.630808973312378, "epoch": 4.634887518142235, "grad_norm": 1.3125, "learning_rate": 0.0003041743005416135, "loss": 4.8253, "mean_token_accuracy": 0.2368577390909195, "num_tokens": 106058692.0, "step": 51095 }, { "entropy": 5.585863924026489, "epoch": 4.635341074020319, "grad_norm": 1.3671875, "learning_rate": 0.0003041422169716094, "loss": 4.8192, "mean_token_accuracy": 0.2365136831998825, "num_tokens": 106069307.0, "step": 51100 }, { "entropy": 5.667902517318725, "epoch": 4.635794629898403, "grad_norm": 1.40625, "learning_rate": 0.0003041101327989368, "loss": 4.8613, "mean_token_accuracy": 0.2321127638220787, "num_tokens": 106080831.0, "step": 51105 }, { "entropy": 5.644593000411987, "epoch": 4.636248185776488, "grad_norm": 1.359375, "learning_rate": 0.0003040780480242593, "loss": 4.8853, "mean_token_accuracy": 0.22098470181226731, "num_tokens": 106090007.0, "step": 51110 }, { "entropy": 5.662961959838867, "epoch": 4.636701741654572, "grad_norm": 1.421875, "learning_rate": 0.00030404596264824033, "loss": 4.8621, "mean_token_accuracy": 0.22854455113410949, "num_tokens": 106099790.0, "step": 51115 }, { "entropy": 5.63086256980896, "epoch": 4.637155297532656, "grad_norm": 1.234375, "learning_rate": 0.00030401387667154347, "loss": 4.797, "mean_token_accuracy": 0.23479324728250503, "num_tokens": 106110364.0, "step": 51120 }, { "entropy": 5.543121385574341, "epoch": 4.6376088534107405, "grad_norm": 1.2734375, "learning_rate": 0.0003039817900948322, "loss": 4.7613, "mean_token_accuracy": 0.23455163985490798, "num_tokens": 106121353.0, "step": 51125 }, { "entropy": 5.60977725982666, "epoch": 4.638062409288825, "grad_norm": 1.5078125, "learning_rate": 0.0003039497029187702, "loss": 4.8482, "mean_token_accuracy": 0.22174757421016694, "num_tokens": 106130750.0, "step": 51130 }, { "entropy": 5.628994560241699, "epoch": 4.638515965166908, "grad_norm": 1.2734375, "learning_rate": 0.00030391761514402096, "loss": 4.8244, "mean_token_accuracy": 0.23218538612127304, "num_tokens": 106142014.0, "step": 51135 }, { "entropy": 5.636723756790161, "epoch": 4.638969521044992, "grad_norm": 1.28125, "learning_rate": 0.00030388552677124804, "loss": 4.8404, "mean_token_accuracy": 0.2345106691122055, "num_tokens": 106152419.0, "step": 51140 }, { "entropy": 5.611972284317017, "epoch": 4.639423076923077, "grad_norm": 1.3515625, "learning_rate": 0.000303853437801115, "loss": 4.7852, "mean_token_accuracy": 0.22788599133491516, "num_tokens": 106163365.0, "step": 51145 }, { "entropy": 5.590104341506958, "epoch": 4.639876632801161, "grad_norm": 1.4375, "learning_rate": 0.0003038213482342856, "loss": 4.7932, "mean_token_accuracy": 0.23682606667280198, "num_tokens": 106173324.0, "step": 51150 }, { "entropy": 5.71228404045105, "epoch": 4.640330188679245, "grad_norm": 1.3203125, "learning_rate": 0.00030378925807142334, "loss": 4.9332, "mean_token_accuracy": 0.22683367133140564, "num_tokens": 106183427.0, "step": 51155 }, { "entropy": 5.668336677551269, "epoch": 4.6407837445573294, "grad_norm": 1.328125, "learning_rate": 0.00030375716731319193, "loss": 4.9095, "mean_token_accuracy": 0.21664217710494996, "num_tokens": 106192894.0, "step": 51160 }, { "entropy": 5.622656917572021, "epoch": 4.641237300435414, "grad_norm": 1.3125, "learning_rate": 0.00030372507596025493, "loss": 4.8237, "mean_token_accuracy": 0.2273292899131775, "num_tokens": 106203185.0, "step": 51165 }, { "entropy": 5.736173963546753, "epoch": 4.641690856313498, "grad_norm": 1.4453125, "learning_rate": 0.000303692984013276, "loss": 4.965, "mean_token_accuracy": 0.21472627073526382, "num_tokens": 106213817.0, "step": 51170 }, { "entropy": 5.59650616645813, "epoch": 4.642144412191582, "grad_norm": 1.3515625, "learning_rate": 0.0003036608914729189, "loss": 4.8098, "mean_token_accuracy": 0.23001222610473632, "num_tokens": 106224367.0, "step": 51175 }, { "entropy": 5.516629028320312, "epoch": 4.6425979680696665, "grad_norm": 1.3984375, "learning_rate": 0.0003036287983398473, "loss": 4.7681, "mean_token_accuracy": 0.2355932265520096, "num_tokens": 106234146.0, "step": 51180 }, { "entropy": 5.654841756820678, "epoch": 4.643051523947751, "grad_norm": 1.3984375, "learning_rate": 0.00030359670461472475, "loss": 4.9077, "mean_token_accuracy": 0.22010868638753892, "num_tokens": 106244910.0, "step": 51185 }, { "entropy": 5.71726245880127, "epoch": 4.643505079825834, "grad_norm": 1.3515625, "learning_rate": 0.00030356461029821516, "loss": 4.9527, "mean_token_accuracy": 0.21086065471172333, "num_tokens": 106254267.0, "step": 51190 }, { "entropy": 5.688195371627808, "epoch": 4.643958635703918, "grad_norm": 1.2890625, "learning_rate": 0.0003035325153909821, "loss": 4.9042, "mean_token_accuracy": 0.22264937609434127, "num_tokens": 106264755.0, "step": 51195 }, { "entropy": 5.587097215652466, "epoch": 4.644412191582003, "grad_norm": 1.3203125, "learning_rate": 0.0003035004198936894, "loss": 4.8377, "mean_token_accuracy": 0.2265124186873436, "num_tokens": 106273964.0, "step": 51200 }, { "entropy": 5.652390336990356, "epoch": 4.644865747460087, "grad_norm": 1.3203125, "learning_rate": 0.0003034683238070008, "loss": 4.8997, "mean_token_accuracy": 0.22290389537811278, "num_tokens": 106283933.0, "step": 51205 }, { "entropy": 5.675181293487549, "epoch": 4.645319303338171, "grad_norm": 1.296875, "learning_rate": 0.00030343622713157985, "loss": 4.8377, "mean_token_accuracy": 0.23244220912456512, "num_tokens": 106294075.0, "step": 51210 }, { "entropy": 5.637624263763428, "epoch": 4.6457728592162555, "grad_norm": 1.3359375, "learning_rate": 0.0003034041298680906, "loss": 4.814, "mean_token_accuracy": 0.230797703564167, "num_tokens": 106304970.0, "step": 51215 }, { "entropy": 5.629592323303223, "epoch": 4.64622641509434, "grad_norm": 1.265625, "learning_rate": 0.0003033720320171966, "loss": 4.8345, "mean_token_accuracy": 0.22397781312465667, "num_tokens": 106315610.0, "step": 51220 }, { "entropy": 5.670551395416259, "epoch": 4.646679970972424, "grad_norm": 1.421875, "learning_rate": 0.0003033399335795619, "loss": 4.8843, "mean_token_accuracy": 0.2246227502822876, "num_tokens": 106326302.0, "step": 51225 }, { "entropy": 5.612484550476074, "epoch": 4.647133526850508, "grad_norm": 1.3828125, "learning_rate": 0.00030330783455585, "loss": 4.8228, "mean_token_accuracy": 0.22766892313957215, "num_tokens": 106336350.0, "step": 51230 }, { "entropy": 5.5970076560974125, "epoch": 4.647587082728592, "grad_norm": 1.265625, "learning_rate": 0.0003032757349467249, "loss": 4.8983, "mean_token_accuracy": 0.2233673706650734, "num_tokens": 106348233.0, "step": 51235 }, { "entropy": 5.582151556015015, "epoch": 4.648040638606677, "grad_norm": 1.4375, "learning_rate": 0.00030324363475285046, "loss": 4.779, "mean_token_accuracy": 0.23166831135749816, "num_tokens": 106357992.0, "step": 51240 }, { "entropy": 5.645804071426392, "epoch": 4.64849419448476, "grad_norm": 1.4296875, "learning_rate": 0.0003032115339748904, "loss": 4.7545, "mean_token_accuracy": 0.2370196595788002, "num_tokens": 106367683.0, "step": 51245 }, { "entropy": 5.655009746551514, "epoch": 4.6489477503628445, "grad_norm": 1.3828125, "learning_rate": 0.0003031794326135086, "loss": 4.8324, "mean_token_accuracy": 0.23029607087373732, "num_tokens": 106378275.0, "step": 51250 }, { "entropy": 5.642401790618896, "epoch": 4.649401306240929, "grad_norm": 1.34375, "learning_rate": 0.00030314733066936903, "loss": 4.8423, "mean_token_accuracy": 0.23249487429857255, "num_tokens": 106387811.0, "step": 51255 }, { "entropy": 5.60443959236145, "epoch": 4.649854862119013, "grad_norm": 1.3125, "learning_rate": 0.0003031152281431355, "loss": 4.879, "mean_token_accuracy": 0.224543035030365, "num_tokens": 106398327.0, "step": 51260 }, { "entropy": 5.569450092315674, "epoch": 4.650308417997097, "grad_norm": 1.3125, "learning_rate": 0.00030308312503547183, "loss": 4.8244, "mean_token_accuracy": 0.2261110723018646, "num_tokens": 106408602.0, "step": 51265 }, { "entropy": 5.5927026748657225, "epoch": 4.6507619738751815, "grad_norm": 1.28125, "learning_rate": 0.000303051021347042, "loss": 4.7968, "mean_token_accuracy": 0.2282913878560066, "num_tokens": 106418717.0, "step": 51270 }, { "entropy": 5.585525941848755, "epoch": 4.651215529753266, "grad_norm": 1.515625, "learning_rate": 0.00030301891707850987, "loss": 4.7392, "mean_token_accuracy": 0.23537057787179946, "num_tokens": 106428311.0, "step": 51275 }, { "entropy": 5.630226087570191, "epoch": 4.65166908563135, "grad_norm": 1.3671875, "learning_rate": 0.0003029868122305395, "loss": 4.8502, "mean_token_accuracy": 0.22298333346843718, "num_tokens": 106438772.0, "step": 51280 }, { "entropy": 5.631834506988525, "epoch": 4.652122641509434, "grad_norm": 1.359375, "learning_rate": 0.00030295470680379456, "loss": 4.8358, "mean_token_accuracy": 0.23331484645605088, "num_tokens": 106448895.0, "step": 51285 }, { "entropy": 5.60748438835144, "epoch": 4.652576197387518, "grad_norm": 1.3359375, "learning_rate": 0.0003029226007989393, "loss": 4.913, "mean_token_accuracy": 0.22834351062774658, "num_tokens": 106459711.0, "step": 51290 }, { "entropy": 5.642921686172485, "epoch": 4.653029753265602, "grad_norm": 1.34375, "learning_rate": 0.00030289049421663744, "loss": 4.8264, "mean_token_accuracy": 0.23212611228227614, "num_tokens": 106469691.0, "step": 51295 }, { "entropy": 5.647533226013183, "epoch": 4.653483309143686, "grad_norm": 1.375, "learning_rate": 0.0003028583870575531, "loss": 4.8457, "mean_token_accuracy": 0.22049656510353088, "num_tokens": 106479894.0, "step": 51300 }, { "entropy": 5.634368848800659, "epoch": 4.6539368650217705, "grad_norm": 1.2890625, "learning_rate": 0.0003028262793223502, "loss": 4.7924, "mean_token_accuracy": 0.23526830077171326, "num_tokens": 106491444.0, "step": 51305 }, { "entropy": 5.638995265960693, "epoch": 4.654390420899855, "grad_norm": 1.40625, "learning_rate": 0.00030279417101169276, "loss": 4.8552, "mean_token_accuracy": 0.23144645392894744, "num_tokens": 106501633.0, "step": 51310 }, { "entropy": 5.5927633285522464, "epoch": 4.654843976777939, "grad_norm": 1.4609375, "learning_rate": 0.0003027620621262448, "loss": 4.8099, "mean_token_accuracy": 0.23860193490982057, "num_tokens": 106511272.0, "step": 51315 }, { "entropy": 5.614375925064087, "epoch": 4.655297532656023, "grad_norm": 1.3828125, "learning_rate": 0.0003027299526666703, "loss": 4.9381, "mean_token_accuracy": 0.2255490705370903, "num_tokens": 106521977.0, "step": 51320 }, { "entropy": 5.65538911819458, "epoch": 4.655751088534108, "grad_norm": 1.3671875, "learning_rate": 0.00030269784263363327, "loss": 4.8744, "mean_token_accuracy": 0.2264071598649025, "num_tokens": 106532802.0, "step": 51325 }, { "entropy": 5.617374420166016, "epoch": 4.656204644412192, "grad_norm": 1.453125, "learning_rate": 0.00030266573202779784, "loss": 4.8519, "mean_token_accuracy": 0.22736508399248123, "num_tokens": 106542249.0, "step": 51330 }, { "entropy": 5.615729951858521, "epoch": 4.656658200290276, "grad_norm": 1.2734375, "learning_rate": 0.00030263362084982805, "loss": 4.8583, "mean_token_accuracy": 0.2309017613530159, "num_tokens": 106552501.0, "step": 51335 }, { "entropy": 5.60629186630249, "epoch": 4.65711175616836, "grad_norm": 1.34375, "learning_rate": 0.00030260150910038793, "loss": 4.8084, "mean_token_accuracy": 0.23878553062677382, "num_tokens": 106561901.0, "step": 51340 }, { "entropy": 5.602769184112549, "epoch": 4.657565312046444, "grad_norm": 1.3203125, "learning_rate": 0.00030256939678014155, "loss": 4.8552, "mean_token_accuracy": 0.22884787172079085, "num_tokens": 106572104.0, "step": 51345 }, { "entropy": 5.616610479354859, "epoch": 4.658018867924528, "grad_norm": 1.265625, "learning_rate": 0.0003025372838897529, "loss": 4.8568, "mean_token_accuracy": 0.22390409111976622, "num_tokens": 106583436.0, "step": 51350 }, { "entropy": 5.6590341091156, "epoch": 4.658472423802612, "grad_norm": 1.296875, "learning_rate": 0.0003025051704298864, "loss": 4.9427, "mean_token_accuracy": 0.22177911251783372, "num_tokens": 106593879.0, "step": 51355 }, { "entropy": 5.649652194976807, "epoch": 4.6589259796806965, "grad_norm": 1.2578125, "learning_rate": 0.00030247305640120585, "loss": 4.8607, "mean_token_accuracy": 0.22046148627996445, "num_tokens": 106604774.0, "step": 51360 }, { "entropy": 5.700344800949097, "epoch": 4.659379535558781, "grad_norm": 1.3046875, "learning_rate": 0.0003024409418043756, "loss": 4.9325, "mean_token_accuracy": 0.21837965101003648, "num_tokens": 106616125.0, "step": 51365 }, { "entropy": 5.657768249511719, "epoch": 4.659833091436865, "grad_norm": 1.3671875, "learning_rate": 0.0003024088266400595, "loss": 4.9131, "mean_token_accuracy": 0.22354645431041717, "num_tokens": 106625171.0, "step": 51370 }, { "entropy": 5.609553813934326, "epoch": 4.660286647314949, "grad_norm": 1.3125, "learning_rate": 0.00030237671090892204, "loss": 4.8394, "mean_token_accuracy": 0.2277699053287506, "num_tokens": 106636455.0, "step": 51375 }, { "entropy": 5.618097639083862, "epoch": 4.660740203193034, "grad_norm": 1.3828125, "learning_rate": 0.0003023445946116272, "loss": 4.825, "mean_token_accuracy": 0.22416653037071227, "num_tokens": 106645956.0, "step": 51380 }, { "entropy": 5.649156665802002, "epoch": 4.661193759071118, "grad_norm": 1.296875, "learning_rate": 0.00030231247774883913, "loss": 4.902, "mean_token_accuracy": 0.2244000717997551, "num_tokens": 106655562.0, "step": 51385 }, { "entropy": 5.661860227584839, "epoch": 4.661647314949201, "grad_norm": 1.234375, "learning_rate": 0.0003022803603212221, "loss": 4.8577, "mean_token_accuracy": 0.2173143208026886, "num_tokens": 106666620.0, "step": 51390 }, { "entropy": 5.654275894165039, "epoch": 4.662100870827286, "grad_norm": 1.3671875, "learning_rate": 0.0003022482423294403, "loss": 4.8656, "mean_token_accuracy": 0.2250022143125534, "num_tokens": 106676881.0, "step": 51395 }, { "entropy": 5.619033575057983, "epoch": 4.66255442670537, "grad_norm": 1.328125, "learning_rate": 0.0003022161237741578, "loss": 4.7935, "mean_token_accuracy": 0.22898587584495544, "num_tokens": 106687765.0, "step": 51400 }, { "entropy": 5.599718284606934, "epoch": 4.663007982583454, "grad_norm": 1.3125, "learning_rate": 0.00030218400465603895, "loss": 4.8292, "mean_token_accuracy": 0.22485257238149642, "num_tokens": 106698796.0, "step": 51405 }, { "entropy": 5.624629354476928, "epoch": 4.663461538461538, "grad_norm": 1.46875, "learning_rate": 0.000302151884975748, "loss": 4.827, "mean_token_accuracy": 0.23007217049598694, "num_tokens": 106709439.0, "step": 51410 }, { "entropy": 5.678779888153076, "epoch": 4.663915094339623, "grad_norm": 1.3203125, "learning_rate": 0.0003021197647339492, "loss": 4.9372, "mean_token_accuracy": 0.21878890693187714, "num_tokens": 106720325.0, "step": 51415 }, { "entropy": 5.640367412567139, "epoch": 4.664368650217707, "grad_norm": 1.390625, "learning_rate": 0.0003020876439313066, "loss": 4.8586, "mean_token_accuracy": 0.22896699160337447, "num_tokens": 106730526.0, "step": 51420 }, { "entropy": 5.620300006866455, "epoch": 4.664822206095791, "grad_norm": 1.3515625, "learning_rate": 0.00030205552256848476, "loss": 4.834, "mean_token_accuracy": 0.2285284236073494, "num_tokens": 106741142.0, "step": 51425 }, { "entropy": 5.717283916473389, "epoch": 4.665275761973875, "grad_norm": 1.3125, "learning_rate": 0.00030202340064614783, "loss": 4.9506, "mean_token_accuracy": 0.21465857923030854, "num_tokens": 106751843.0, "step": 51430 }, { "entropy": 5.580708694458008, "epoch": 4.66572931785196, "grad_norm": 1.28125, "learning_rate": 0.0003019912781649599, "loss": 4.7107, "mean_token_accuracy": 0.23825723975896834, "num_tokens": 106761726.0, "step": 51435 }, { "entropy": 5.613479375839233, "epoch": 4.666182873730044, "grad_norm": 1.3203125, "learning_rate": 0.00030195915512558564, "loss": 4.8235, "mean_token_accuracy": 0.22970918864011763, "num_tokens": 106771829.0, "step": 51440 }, { "entropy": 5.567964363098144, "epoch": 4.666636429608127, "grad_norm": 1.2890625, "learning_rate": 0.0003019270315286892, "loss": 4.7633, "mean_token_accuracy": 0.23079639673233032, "num_tokens": 106783457.0, "step": 51445 }, { "entropy": 5.623996210098267, "epoch": 4.667089985486212, "grad_norm": 1.421875, "learning_rate": 0.00030189490737493477, "loss": 4.834, "mean_token_accuracy": 0.2352101758122444, "num_tokens": 106793290.0, "step": 51450 }, { "entropy": 5.639394664764405, "epoch": 4.667543541364296, "grad_norm": 1.296875, "learning_rate": 0.00030186278266498677, "loss": 4.8147, "mean_token_accuracy": 0.22420746982097625, "num_tokens": 106804412.0, "step": 51455 }, { "entropy": 5.701258373260498, "epoch": 4.66799709724238, "grad_norm": 1.203125, "learning_rate": 0.0003018306573995097, "loss": 4.9477, "mean_token_accuracy": 0.22613338828086854, "num_tokens": 106815353.0, "step": 51460 }, { "entropy": 5.642526912689209, "epoch": 4.668450653120464, "grad_norm": 1.3828125, "learning_rate": 0.00030179853157916777, "loss": 4.8515, "mean_token_accuracy": 0.2293083295226097, "num_tokens": 106826350.0, "step": 51465 }, { "entropy": 5.664902782440185, "epoch": 4.668904208998549, "grad_norm": 1.34375, "learning_rate": 0.0003017664052046253, "loss": 4.8703, "mean_token_accuracy": 0.22597613632678987, "num_tokens": 106837434.0, "step": 51470 }, { "entropy": 5.6065673828125, "epoch": 4.669357764876633, "grad_norm": 1.2890625, "learning_rate": 0.00030173427827654683, "loss": 4.8813, "mean_token_accuracy": 0.22734495848417283, "num_tokens": 106847829.0, "step": 51475 }, { "entropy": 5.718232297897339, "epoch": 4.669811320754717, "grad_norm": 1.359375, "learning_rate": 0.0003017021507955967, "loss": 4.969, "mean_token_accuracy": 0.21826019883155823, "num_tokens": 106858519.0, "step": 51480 }, { "entropy": 5.668228054046631, "epoch": 4.670264876632801, "grad_norm": 1.375, "learning_rate": 0.00030167002276243915, "loss": 4.8374, "mean_token_accuracy": 0.2310011550784111, "num_tokens": 106868614.0, "step": 51485 }, { "entropy": 5.670083093643188, "epoch": 4.670718432510886, "grad_norm": 1.359375, "learning_rate": 0.00030163789417773885, "loss": 4.9839, "mean_token_accuracy": 0.21401710510253907, "num_tokens": 106879592.0, "step": 51490 }, { "entropy": 5.62853102684021, "epoch": 4.67117198838897, "grad_norm": 1.21875, "learning_rate": 0.0003016057650421601, "loss": 4.8559, "mean_token_accuracy": 0.22642157822847367, "num_tokens": 106890083.0, "step": 51495 }, { "entropy": 5.682906818389893, "epoch": 4.671625544267053, "grad_norm": 1.4375, "learning_rate": 0.00030157363535636726, "loss": 4.9272, "mean_token_accuracy": 0.22532157599925995, "num_tokens": 106900672.0, "step": 51500 }, { "entropy": 5.646746587753296, "epoch": 4.672079100145138, "grad_norm": 1.4453125, "learning_rate": 0.000301541505121025, "loss": 4.8084, "mean_token_accuracy": 0.23173405081033707, "num_tokens": 106910396.0, "step": 51505 }, { "entropy": 5.683377122879028, "epoch": 4.672532656023222, "grad_norm": 1.3203125, "learning_rate": 0.0003015093743367976, "loss": 4.8956, "mean_token_accuracy": 0.22286300212144852, "num_tokens": 106919742.0, "step": 51510 }, { "entropy": 5.58050537109375, "epoch": 4.672986211901306, "grad_norm": 1.2578125, "learning_rate": 0.0003014772430043495, "loss": 4.7813, "mean_token_accuracy": 0.2332137331366539, "num_tokens": 106930837.0, "step": 51515 }, { "entropy": 5.594314289093018, "epoch": 4.67343976777939, "grad_norm": 1.359375, "learning_rate": 0.00030144511112434536, "loss": 4.8212, "mean_token_accuracy": 0.22822803556919097, "num_tokens": 106942023.0, "step": 51520 }, { "entropy": 5.657700920104981, "epoch": 4.673893323657475, "grad_norm": 1.328125, "learning_rate": 0.00030141297869744956, "loss": 4.9152, "mean_token_accuracy": 0.22226927429437637, "num_tokens": 106951374.0, "step": 51525 }, { "entropy": 5.726312208175659, "epoch": 4.674346879535559, "grad_norm": 1.40625, "learning_rate": 0.00030138084572432663, "loss": 4.9392, "mean_token_accuracy": 0.21815831661224366, "num_tokens": 106961714.0, "step": 51530 }, { "entropy": 5.664337968826294, "epoch": 4.674800435413643, "grad_norm": 1.3203125, "learning_rate": 0.0003013487122056411, "loss": 4.8502, "mean_token_accuracy": 0.2296933963894844, "num_tokens": 106971783.0, "step": 51535 }, { "entropy": 5.606761455535889, "epoch": 4.6752539912917275, "grad_norm": 1.421875, "learning_rate": 0.0003013165781420575, "loss": 4.8038, "mean_token_accuracy": 0.2361462250351906, "num_tokens": 106982047.0, "step": 51540 }, { "entropy": 5.62720046043396, "epoch": 4.675707547169811, "grad_norm": 1.3828125, "learning_rate": 0.00030128444353424034, "loss": 4.8473, "mean_token_accuracy": 0.2292511984705925, "num_tokens": 106993063.0, "step": 51545 }, { "entropy": 5.661016845703125, "epoch": 4.676161103047895, "grad_norm": 1.3359375, "learning_rate": 0.00030125230838285415, "loss": 4.8635, "mean_token_accuracy": 0.2229092761874199, "num_tokens": 107002865.0, "step": 51550 }, { "entropy": 5.679088735580445, "epoch": 4.676614658925979, "grad_norm": 1.25, "learning_rate": 0.00030122017268856353, "loss": 4.8237, "mean_token_accuracy": 0.23492152839899064, "num_tokens": 107013007.0, "step": 51555 }, { "entropy": 5.681649780273437, "epoch": 4.677068214804064, "grad_norm": 1.3671875, "learning_rate": 0.00030118803645203315, "loss": 4.9071, "mean_token_accuracy": 0.22368464469909669, "num_tokens": 107023109.0, "step": 51560 }, { "entropy": 5.611205339431763, "epoch": 4.677521770682148, "grad_norm": 1.2109375, "learning_rate": 0.0003011558996739274, "loss": 4.8341, "mean_token_accuracy": 0.2304351270198822, "num_tokens": 107033824.0, "step": 51565 }, { "entropy": 5.634835815429687, "epoch": 4.677975326560232, "grad_norm": 1.359375, "learning_rate": 0.000301123762354911, "loss": 4.879, "mean_token_accuracy": 0.224780935049057, "num_tokens": 107043529.0, "step": 51570 }, { "entropy": 5.651682662963867, "epoch": 4.6784288824383164, "grad_norm": 1.25, "learning_rate": 0.0003010916244956486, "loss": 4.8935, "mean_token_accuracy": 0.2331716611981392, "num_tokens": 107054378.0, "step": 51575 }, { "entropy": 5.619350814819336, "epoch": 4.678882438316401, "grad_norm": 1.3515625, "learning_rate": 0.0003010594860968048, "loss": 4.776, "mean_token_accuracy": 0.22617520838975907, "num_tokens": 107064300.0, "step": 51580 }, { "entropy": 5.706398916244507, "epoch": 4.679335994194485, "grad_norm": 1.375, "learning_rate": 0.000301027347159044, "loss": 4.9268, "mean_token_accuracy": 0.2200508400797844, "num_tokens": 107074560.0, "step": 51585 }, { "entropy": 5.645678901672364, "epoch": 4.679789550072569, "grad_norm": 1.1640625, "learning_rate": 0.0003009952076830312, "loss": 4.8285, "mean_token_accuracy": 0.22575079798698425, "num_tokens": 107084574.0, "step": 51590 }, { "entropy": 5.611685180664063, "epoch": 4.6802431059506535, "grad_norm": 1.21875, "learning_rate": 0.0003009630676694308, "loss": 4.8555, "mean_token_accuracy": 0.21997918635606767, "num_tokens": 107095207.0, "step": 51595 }, { "entropy": 5.603780698776245, "epoch": 4.680696661828737, "grad_norm": 1.359375, "learning_rate": 0.00030093092711890756, "loss": 4.8443, "mean_token_accuracy": 0.2265464410185814, "num_tokens": 107106091.0, "step": 51600 }, { "entropy": 5.641469144821167, "epoch": 4.681150217706821, "grad_norm": 1.1953125, "learning_rate": 0.0003008987860321261, "loss": 4.8975, "mean_token_accuracy": 0.22050147503614426, "num_tokens": 107117753.0, "step": 51605 }, { "entropy": 5.575567531585693, "epoch": 4.681603773584905, "grad_norm": 1.3671875, "learning_rate": 0.0003008666444097512, "loss": 4.7769, "mean_token_accuracy": 0.2383032351732254, "num_tokens": 107128131.0, "step": 51610 }, { "entropy": 5.665344142913819, "epoch": 4.68205732946299, "grad_norm": 1.421875, "learning_rate": 0.0003008345022524475, "loss": 4.9984, "mean_token_accuracy": 0.21450660675764083, "num_tokens": 107139447.0, "step": 51615 }, { "entropy": 5.652925729751587, "epoch": 4.682510885341074, "grad_norm": 1.296875, "learning_rate": 0.00030080235956087963, "loss": 4.8764, "mean_token_accuracy": 0.22520839273929597, "num_tokens": 107149721.0, "step": 51620 }, { "entropy": 5.65245680809021, "epoch": 4.682964441219158, "grad_norm": 1.40625, "learning_rate": 0.0003007702163357125, "loss": 4.9215, "mean_token_accuracy": 0.22065943628549575, "num_tokens": 107159814.0, "step": 51625 }, { "entropy": 5.6026547908782955, "epoch": 4.6834179970972425, "grad_norm": 1.40625, "learning_rate": 0.00030073807257761074, "loss": 4.8702, "mean_token_accuracy": 0.2243686869740486, "num_tokens": 107169012.0, "step": 51630 }, { "entropy": 5.6826526641845705, "epoch": 4.683871552975327, "grad_norm": 1.375, "learning_rate": 0.00030070592828723903, "loss": 4.8937, "mean_token_accuracy": 0.22034205198287965, "num_tokens": 107179571.0, "step": 51635 }, { "entropy": 5.6335468769073485, "epoch": 4.684325108853411, "grad_norm": 1.2734375, "learning_rate": 0.0003006737834652621, "loss": 4.8554, "mean_token_accuracy": 0.22734544724225997, "num_tokens": 107190535.0, "step": 51640 }, { "entropy": 5.680628442764283, "epoch": 4.684778664731495, "grad_norm": 1.3671875, "learning_rate": 0.0003006416381123449, "loss": 4.8684, "mean_token_accuracy": 0.23113794773817062, "num_tokens": 107200361.0, "step": 51645 }, { "entropy": 5.650760126113892, "epoch": 4.68523222060958, "grad_norm": 1.3203125, "learning_rate": 0.00030060949222915205, "loss": 4.8736, "mean_token_accuracy": 0.2257312372326851, "num_tokens": 107211080.0, "step": 51650 }, { "entropy": 5.662133693695068, "epoch": 4.685685776487663, "grad_norm": 1.375, "learning_rate": 0.0003005773458163484, "loss": 4.9025, "mean_token_accuracy": 0.22987064868211746, "num_tokens": 107220556.0, "step": 51655 }, { "entropy": 5.620728015899658, "epoch": 4.686139332365747, "grad_norm": 1.3828125, "learning_rate": 0.00030054519887459864, "loss": 4.8388, "mean_token_accuracy": 0.22177089601755143, "num_tokens": 107230693.0, "step": 51660 }, { "entropy": 5.674018096923828, "epoch": 4.6865928882438315, "grad_norm": 1.3984375, "learning_rate": 0.00030051305140456775, "loss": 4.9288, "mean_token_accuracy": 0.21869321167469025, "num_tokens": 107240926.0, "step": 51665 }, { "entropy": 5.658247566223144, "epoch": 4.687046444121916, "grad_norm": 1.265625, "learning_rate": 0.00030048090340692034, "loss": 4.9041, "mean_token_accuracy": 0.22213871777057648, "num_tokens": 107251425.0, "step": 51670 }, { "entropy": 5.667091035842896, "epoch": 4.6875, "grad_norm": 1.3359375, "learning_rate": 0.00030044875488232145, "loss": 4.863, "mean_token_accuracy": 0.23359666019678116, "num_tokens": 107262046.0, "step": 51675 }, { "entropy": 5.566891098022461, "epoch": 4.687953555878084, "grad_norm": 1.296875, "learning_rate": 0.0003004166058314358, "loss": 4.8042, "mean_token_accuracy": 0.232314233481884, "num_tokens": 107273141.0, "step": 51680 }, { "entropy": 5.659048557281494, "epoch": 4.6884071117561685, "grad_norm": 1.3203125, "learning_rate": 0.0003003844562549282, "loss": 4.8976, "mean_token_accuracy": 0.22723358273506164, "num_tokens": 107282497.0, "step": 51685 }, { "entropy": 5.608068990707397, "epoch": 4.688860667634253, "grad_norm": 1.3125, "learning_rate": 0.00030035230615346373, "loss": 4.7954, "mean_token_accuracy": 0.2298545867204666, "num_tokens": 107292710.0, "step": 51690 }, { "entropy": 5.599319124221802, "epoch": 4.689314223512337, "grad_norm": 1.421875, "learning_rate": 0.00030032015552770695, "loss": 4.7207, "mean_token_accuracy": 0.2362816259264946, "num_tokens": 107303157.0, "step": 51695 }, { "entropy": 5.613744306564331, "epoch": 4.68976777939042, "grad_norm": 1.40625, "learning_rate": 0.00030028800437832296, "loss": 4.8575, "mean_token_accuracy": 0.22394119650125505, "num_tokens": 107313503.0, "step": 51700 }, { "entropy": 5.585458850860595, "epoch": 4.690221335268505, "grad_norm": 1.3828125, "learning_rate": 0.0003002558527059766, "loss": 4.8314, "mean_token_accuracy": 0.23098168671131133, "num_tokens": 107322276.0, "step": 51705 }, { "entropy": 5.629023647308349, "epoch": 4.690674891146589, "grad_norm": 1.2265625, "learning_rate": 0.0003002237005113328, "loss": 4.9101, "mean_token_accuracy": 0.22017191350460052, "num_tokens": 107332876.0, "step": 51710 }, { "entropy": 5.620489931106567, "epoch": 4.691128447024673, "grad_norm": 1.4375, "learning_rate": 0.00030019154779505644, "loss": 4.8479, "mean_token_accuracy": 0.22940749675035477, "num_tokens": 107343262.0, "step": 51715 }, { "entropy": 5.563034105300903, "epoch": 4.6915820029027575, "grad_norm": 1.3828125, "learning_rate": 0.0003001593945578124, "loss": 4.8301, "mean_token_accuracy": 0.22212015390396117, "num_tokens": 107354281.0, "step": 51720 }, { "entropy": 5.5351745128631595, "epoch": 4.692035558780842, "grad_norm": 1.2890625, "learning_rate": 0.0003001272408002657, "loss": 4.8087, "mean_token_accuracy": 0.23216308504343033, "num_tokens": 107364011.0, "step": 51725 }, { "entropy": 5.610294485092163, "epoch": 4.692489114658926, "grad_norm": 1.359375, "learning_rate": 0.00030009508652308124, "loss": 4.8117, "mean_token_accuracy": 0.2267228439450264, "num_tokens": 107372943.0, "step": 51730 }, { "entropy": 5.631402111053466, "epoch": 4.69294267053701, "grad_norm": 1.375, "learning_rate": 0.00030006293172692405, "loss": 4.888, "mean_token_accuracy": 0.22653815746307374, "num_tokens": 107382838.0, "step": 51735 }, { "entropy": 5.685107564926147, "epoch": 4.693396226415095, "grad_norm": 1.2421875, "learning_rate": 0.00030003077641245897, "loss": 4.8827, "mean_token_accuracy": 0.22574774026870728, "num_tokens": 107393250.0, "step": 51740 }, { "entropy": 5.656757497787476, "epoch": 4.693849782293179, "grad_norm": 1.2578125, "learning_rate": 0.00029999862058035116, "loss": 4.758, "mean_token_accuracy": 0.2325229451060295, "num_tokens": 107403153.0, "step": 51745 }, { "entropy": 5.644321346282959, "epoch": 4.694303338171263, "grad_norm": 1.3359375, "learning_rate": 0.00029996646423126544, "loss": 4.849, "mean_token_accuracy": 0.22409629076719284, "num_tokens": 107413092.0, "step": 51750 }, { "entropy": 5.641963911056519, "epoch": 4.6947568940493465, "grad_norm": 1.3125, "learning_rate": 0.0002999343073658669, "loss": 4.8698, "mean_token_accuracy": 0.2267318844795227, "num_tokens": 107423561.0, "step": 51755 }, { "entropy": 5.6783990383148195, "epoch": 4.695210449927431, "grad_norm": 1.40625, "learning_rate": 0.00029990214998482046, "loss": 4.8856, "mean_token_accuracy": 0.22900304794311524, "num_tokens": 107433954.0, "step": 51760 }, { "entropy": 5.666752862930298, "epoch": 4.695664005805515, "grad_norm": 1.3515625, "learning_rate": 0.0002998699920887913, "loss": 4.8088, "mean_token_accuracy": 0.23007324635982512, "num_tokens": 107443150.0, "step": 51765 }, { "entropy": 5.603961086273193, "epoch": 4.696117561683599, "grad_norm": 1.3359375, "learning_rate": 0.0002998378336784443, "loss": 4.7993, "mean_token_accuracy": 0.2279962792992592, "num_tokens": 107454250.0, "step": 51770 }, { "entropy": 5.529533720016479, "epoch": 4.6965711175616836, "grad_norm": 1.3203125, "learning_rate": 0.0002998056747544446, "loss": 4.7849, "mean_token_accuracy": 0.23800675421953202, "num_tokens": 107465058.0, "step": 51775 }, { "entropy": 5.555084848403931, "epoch": 4.697024673439768, "grad_norm": 1.34375, "learning_rate": 0.0002997735153174572, "loss": 4.793, "mean_token_accuracy": 0.2332381308078766, "num_tokens": 107475449.0, "step": 51780 }, { "entropy": 5.741664552688599, "epoch": 4.697478229317852, "grad_norm": 1.3828125, "learning_rate": 0.00029974135536814725, "loss": 5.0299, "mean_token_accuracy": 0.21843865215778352, "num_tokens": 107486645.0, "step": 51785 }, { "entropy": 5.641718864440918, "epoch": 4.697931785195936, "grad_norm": 1.34375, "learning_rate": 0.0002997091949071797, "loss": 4.8598, "mean_token_accuracy": 0.2276191607117653, "num_tokens": 107497242.0, "step": 51790 }, { "entropy": 5.704970455169677, "epoch": 4.698385341074021, "grad_norm": 1.34375, "learning_rate": 0.0002996770339352197, "loss": 4.8813, "mean_token_accuracy": 0.22413975298404692, "num_tokens": 107507596.0, "step": 51795 }, { "entropy": 5.702626132965088, "epoch": 4.698838896952105, "grad_norm": 1.4609375, "learning_rate": 0.0002996448724529324, "loss": 4.9421, "mean_token_accuracy": 0.2197820097208023, "num_tokens": 107517795.0, "step": 51800 }, { "entropy": 5.651201486587524, "epoch": 4.699292452830189, "grad_norm": 1.3125, "learning_rate": 0.00029961271046098284, "loss": 4.835, "mean_token_accuracy": 0.22721916139125825, "num_tokens": 107527805.0, "step": 51805 }, { "entropy": 5.650051498413086, "epoch": 4.6997460087082725, "grad_norm": 1.328125, "learning_rate": 0.00029958054796003615, "loss": 4.8694, "mean_token_accuracy": 0.22574893683195113, "num_tokens": 107537396.0, "step": 51810 }, { "entropy": 5.622155714035034, "epoch": 4.700199564586357, "grad_norm": 1.34375, "learning_rate": 0.0002995483849507575, "loss": 4.8446, "mean_token_accuracy": 0.22888796478509904, "num_tokens": 107546876.0, "step": 51815 }, { "entropy": 5.637112808227539, "epoch": 4.700653120464441, "grad_norm": 1.5, "learning_rate": 0.000299516221433812, "loss": 4.8056, "mean_token_accuracy": 0.23163412660360336, "num_tokens": 107556865.0, "step": 51820 }, { "entropy": 5.624751329421997, "epoch": 4.701106676342525, "grad_norm": 1.3671875, "learning_rate": 0.00029948405740986466, "loss": 4.8444, "mean_token_accuracy": 0.22313083708286285, "num_tokens": 107566305.0, "step": 51825 }, { "entropy": 5.691544008255005, "epoch": 4.70156023222061, "grad_norm": 1.40625, "learning_rate": 0.0002994518928795809, "loss": 4.9094, "mean_token_accuracy": 0.22502174973487854, "num_tokens": 107575640.0, "step": 51830 }, { "entropy": 5.668277931213379, "epoch": 4.702013788098694, "grad_norm": 1.4296875, "learning_rate": 0.00029941972784362574, "loss": 4.936, "mean_token_accuracy": 0.2319621965289116, "num_tokens": 107585955.0, "step": 51835 }, { "entropy": 5.672263479232788, "epoch": 4.702467343976778, "grad_norm": 1.421875, "learning_rate": 0.00029938756230266436, "loss": 4.8753, "mean_token_accuracy": 0.22293990701436997, "num_tokens": 107596911.0, "step": 51840 }, { "entropy": 5.607419157028199, "epoch": 4.702920899854862, "grad_norm": 1.4375, "learning_rate": 0.000299355396257362, "loss": 4.8033, "mean_token_accuracy": 0.23086132407188414, "num_tokens": 107606117.0, "step": 51845 }, { "entropy": 5.583935165405274, "epoch": 4.703374455732947, "grad_norm": 1.4140625, "learning_rate": 0.0002993232297083838, "loss": 4.7101, "mean_token_accuracy": 0.245095694065094, "num_tokens": 107616363.0, "step": 51850 }, { "entropy": 5.581477355957031, "epoch": 4.70382801161103, "grad_norm": 1.4296875, "learning_rate": 0.0002992910626563951, "loss": 4.7819, "mean_token_accuracy": 0.2300983339548111, "num_tokens": 107627402.0, "step": 51855 }, { "entropy": 5.5818596363067625, "epoch": 4.704281567489114, "grad_norm": 1.34375, "learning_rate": 0.00029925889510206094, "loss": 4.8472, "mean_token_accuracy": 0.2269759252667427, "num_tokens": 107637446.0, "step": 51860 }, { "entropy": 5.59421820640564, "epoch": 4.704735123367199, "grad_norm": 1.40625, "learning_rate": 0.0002992267270460467, "loss": 4.8227, "mean_token_accuracy": 0.22895709723234176, "num_tokens": 107647386.0, "step": 51865 }, { "entropy": 5.653500080108643, "epoch": 4.705188679245283, "grad_norm": 1.515625, "learning_rate": 0.0002991945584890175, "loss": 4.9016, "mean_token_accuracy": 0.2291799858212471, "num_tokens": 107657881.0, "step": 51870 }, { "entropy": 5.662353372573852, "epoch": 4.705642235123367, "grad_norm": 1.3359375, "learning_rate": 0.00029916238943163874, "loss": 4.8513, "mean_token_accuracy": 0.2335037425160408, "num_tokens": 107668478.0, "step": 51875 }, { "entropy": 5.7356596946716305, "epoch": 4.706095791001451, "grad_norm": 1.2109375, "learning_rate": 0.0002991302198745756, "loss": 4.9793, "mean_token_accuracy": 0.22458555400371552, "num_tokens": 107679149.0, "step": 51880 }, { "entropy": 5.643193197250366, "epoch": 4.706549346879536, "grad_norm": 1.3828125, "learning_rate": 0.0002990980498184934, "loss": 4.8728, "mean_token_accuracy": 0.21858871430158616, "num_tokens": 107689471.0, "step": 51885 }, { "entropy": 5.626543474197388, "epoch": 4.70700290275762, "grad_norm": 1.3828125, "learning_rate": 0.00029906587926405734, "loss": 4.8394, "mean_token_accuracy": 0.2364283725619316, "num_tokens": 107700604.0, "step": 51890 }, { "entropy": 5.548242378234863, "epoch": 4.707456458635704, "grad_norm": 1.375, "learning_rate": 0.0002990337082119327, "loss": 4.7879, "mean_token_accuracy": 0.23130279928445815, "num_tokens": 107710268.0, "step": 51895 }, { "entropy": 5.67280330657959, "epoch": 4.707910014513788, "grad_norm": 1.21875, "learning_rate": 0.00029900153666278503, "loss": 4.8559, "mean_token_accuracy": 0.22368043959140776, "num_tokens": 107720328.0, "step": 51900 }, { "entropy": 5.634679508209229, "epoch": 4.708363570391873, "grad_norm": 1.375, "learning_rate": 0.00029896936461727924, "loss": 4.8433, "mean_token_accuracy": 0.22590590864419938, "num_tokens": 107730295.0, "step": 51905 }, { "entropy": 5.620717620849609, "epoch": 4.708817126269956, "grad_norm": 1.484375, "learning_rate": 0.00029893719207608105, "loss": 4.8385, "mean_token_accuracy": 0.22394608110189437, "num_tokens": 107741334.0, "step": 51910 }, { "entropy": 5.647150039672852, "epoch": 4.70927068214804, "grad_norm": 1.1796875, "learning_rate": 0.00029890501903985555, "loss": 4.8459, "mean_token_accuracy": 0.22673273235559463, "num_tokens": 107752060.0, "step": 51915 }, { "entropy": 5.636652040481567, "epoch": 4.709724238026125, "grad_norm": 1.40625, "learning_rate": 0.00029887284550926817, "loss": 4.8357, "mean_token_accuracy": 0.22352114021778108, "num_tokens": 107762188.0, "step": 51920 }, { "entropy": 5.6312517642974855, "epoch": 4.710177793904209, "grad_norm": 1.4609375, "learning_rate": 0.0002988406714849843, "loss": 4.8843, "mean_token_accuracy": 0.22537585645914077, "num_tokens": 107771670.0, "step": 51925 }, { "entropy": 5.603356742858887, "epoch": 4.710631349782293, "grad_norm": 1.4609375, "learning_rate": 0.0002988084969676692, "loss": 4.8196, "mean_token_accuracy": 0.22919293344020844, "num_tokens": 107781734.0, "step": 51930 }, { "entropy": 5.68241286277771, "epoch": 4.711084905660377, "grad_norm": 1.3203125, "learning_rate": 0.00029877632195798843, "loss": 4.867, "mean_token_accuracy": 0.21960362941026687, "num_tokens": 107792159.0, "step": 51935 }, { "entropy": 5.645976877212524, "epoch": 4.711538461538462, "grad_norm": 1.375, "learning_rate": 0.00029874414645660713, "loss": 4.85, "mean_token_accuracy": 0.22973107248544694, "num_tokens": 107803153.0, "step": 51940 }, { "entropy": 5.609997415542603, "epoch": 4.711992017416546, "grad_norm": 1.421875, "learning_rate": 0.0002987119704641909, "loss": 4.8271, "mean_token_accuracy": 0.2304958611726761, "num_tokens": 107813214.0, "step": 51945 }, { "entropy": 5.618137407302856, "epoch": 4.71244557329463, "grad_norm": 1.328125, "learning_rate": 0.0002986797939814051, "loss": 4.8632, "mean_token_accuracy": 0.2296712353825569, "num_tokens": 107823976.0, "step": 51950 }, { "entropy": 5.630889177322388, "epoch": 4.712899129172714, "grad_norm": 1.4296875, "learning_rate": 0.00029864761700891507, "loss": 4.8704, "mean_token_accuracy": 0.23087739795446396, "num_tokens": 107834127.0, "step": 51955 }, { "entropy": 5.688243627548218, "epoch": 4.713352685050799, "grad_norm": 1.3515625, "learning_rate": 0.00029861543954738635, "loss": 4.9729, "mean_token_accuracy": 0.21547903567552568, "num_tokens": 107843753.0, "step": 51960 }, { "entropy": 5.696873903274536, "epoch": 4.713806240928882, "grad_norm": 1.1875, "learning_rate": 0.00029858326159748434, "loss": 4.857, "mean_token_accuracy": 0.2304224044084549, "num_tokens": 107854690.0, "step": 51965 }, { "entropy": 5.6429298400878904, "epoch": 4.714259796806966, "grad_norm": 1.3125, "learning_rate": 0.00029855108315987437, "loss": 4.8296, "mean_token_accuracy": 0.23052936941385269, "num_tokens": 107865235.0, "step": 51970 }, { "entropy": 5.636487579345703, "epoch": 4.714713352685051, "grad_norm": 1.1875, "learning_rate": 0.000298518904235222, "loss": 4.8261, "mean_token_accuracy": 0.23074483424425124, "num_tokens": 107876052.0, "step": 51975 }, { "entropy": 5.5969034194946286, "epoch": 4.715166908563135, "grad_norm": 1.5234375, "learning_rate": 0.0002984867248241928, "loss": 4.863, "mean_token_accuracy": 0.23013104647397994, "num_tokens": 107886187.0, "step": 51980 }, { "entropy": 5.635718250274659, "epoch": 4.715620464441219, "grad_norm": 1.3125, "learning_rate": 0.0002984545449274521, "loss": 4.8766, "mean_token_accuracy": 0.22768629491329193, "num_tokens": 107896995.0, "step": 51985 }, { "entropy": 5.681853103637695, "epoch": 4.7160740203193035, "grad_norm": 1.375, "learning_rate": 0.0002984223645456655, "loss": 4.9033, "mean_token_accuracy": 0.2227205827832222, "num_tokens": 107907868.0, "step": 51990 }, { "entropy": 5.669187068939209, "epoch": 4.716527576197388, "grad_norm": 1.3671875, "learning_rate": 0.00029839018367949825, "loss": 4.877, "mean_token_accuracy": 0.22584448754787445, "num_tokens": 107917564.0, "step": 51995 }, { "entropy": 5.639579010009766, "epoch": 4.716981132075472, "grad_norm": 1.3125, "learning_rate": 0.0002983580023296162, "loss": 4.812, "mean_token_accuracy": 0.2401526689529419, "num_tokens": 107926853.0, "step": 52000 }, { "entropy": 5.58984408378601, "epoch": 4.717434687953556, "grad_norm": 1.25, "learning_rate": 0.00029832582049668465, "loss": 4.8709, "mean_token_accuracy": 0.2184126004576683, "num_tokens": 107937440.0, "step": 52005 }, { "entropy": 5.632284355163574, "epoch": 4.71788824383164, "grad_norm": 1.3046875, "learning_rate": 0.00029829363818136917, "loss": 4.8826, "mean_token_accuracy": 0.2248371109366417, "num_tokens": 107947750.0, "step": 52010 }, { "entropy": 5.681309700012207, "epoch": 4.718341799709724, "grad_norm": 1.2109375, "learning_rate": 0.0002982614553843354, "loss": 4.8911, "mean_token_accuracy": 0.22780147194862366, "num_tokens": 107959646.0, "step": 52015 }, { "entropy": 5.660957336425781, "epoch": 4.718795355587808, "grad_norm": 1.3828125, "learning_rate": 0.00029822927210624873, "loss": 4.9032, "mean_token_accuracy": 0.2240862786769867, "num_tokens": 107969678.0, "step": 52020 }, { "entropy": 5.67547492980957, "epoch": 4.719248911465892, "grad_norm": 1.421875, "learning_rate": 0.00029819708834777483, "loss": 4.8943, "mean_token_accuracy": 0.22985138297080993, "num_tokens": 107979589.0, "step": 52025 }, { "entropy": 5.5802422046661375, "epoch": 4.719702467343977, "grad_norm": 1.2265625, "learning_rate": 0.0002981649041095792, "loss": 4.8161, "mean_token_accuracy": 0.23040609657764435, "num_tokens": 107990682.0, "step": 52030 }, { "entropy": 5.649995183944702, "epoch": 4.720156023222061, "grad_norm": 1.3203125, "learning_rate": 0.0002981327193923275, "loss": 4.8105, "mean_token_accuracy": 0.22992743104696273, "num_tokens": 108000999.0, "step": 52035 }, { "entropy": 5.59195613861084, "epoch": 4.720609579100145, "grad_norm": 1.3046875, "learning_rate": 0.0002981005341966852, "loss": 4.771, "mean_token_accuracy": 0.2258443132042885, "num_tokens": 108010709.0, "step": 52040 }, { "entropy": 5.573256778717041, "epoch": 4.7210631349782295, "grad_norm": 1.3125, "learning_rate": 0.000298068348523318, "loss": 4.806, "mean_token_accuracy": 0.2329244941473007, "num_tokens": 108020522.0, "step": 52045 }, { "entropy": 5.561178493499756, "epoch": 4.721516690856314, "grad_norm": 1.234375, "learning_rate": 0.0002980361623728915, "loss": 4.8041, "mean_token_accuracy": 0.23204840272665023, "num_tokens": 108031387.0, "step": 52050 }, { "entropy": 5.634180974960327, "epoch": 4.721970246734398, "grad_norm": 1.421875, "learning_rate": 0.0002980039757460713, "loss": 4.848, "mean_token_accuracy": 0.22833117842674255, "num_tokens": 108041653.0, "step": 52055 }, { "entropy": 5.7578123092651365, "epoch": 4.722423802612482, "grad_norm": 1.3984375, "learning_rate": 0.00029797178864352306, "loss": 4.9881, "mean_token_accuracy": 0.22197122275829315, "num_tokens": 108051969.0, "step": 52060 }, { "entropy": 5.66195330619812, "epoch": 4.722877358490566, "grad_norm": 1.375, "learning_rate": 0.00029793960106591226, "loss": 4.8605, "mean_token_accuracy": 0.22459030598402024, "num_tokens": 108061364.0, "step": 52065 }, { "entropy": 5.621276426315307, "epoch": 4.72333091436865, "grad_norm": 1.3671875, "learning_rate": 0.0002979074130139047, "loss": 4.9101, "mean_token_accuracy": 0.22405014783143998, "num_tokens": 108071140.0, "step": 52070 }, { "entropy": 5.633353614807129, "epoch": 4.723784470246734, "grad_norm": 1.296875, "learning_rate": 0.00029787522448816603, "loss": 4.9415, "mean_token_accuracy": 0.22373841404914857, "num_tokens": 108082599.0, "step": 52075 }, { "entropy": 5.694049119949341, "epoch": 4.7242380261248185, "grad_norm": 1.390625, "learning_rate": 0.00029784303548936183, "loss": 4.8819, "mean_token_accuracy": 0.2292081505060196, "num_tokens": 108092017.0, "step": 52080 }, { "entropy": 5.713012647628784, "epoch": 4.724691582002903, "grad_norm": 1.3046875, "learning_rate": 0.0002978108460181579, "loss": 4.9283, "mean_token_accuracy": 0.22288725078105925, "num_tokens": 108103853.0, "step": 52085 }, { "entropy": 5.634487247467041, "epoch": 4.725145137880987, "grad_norm": 1.328125, "learning_rate": 0.0002977786560752198, "loss": 4.8629, "mean_token_accuracy": 0.2305181309580803, "num_tokens": 108114727.0, "step": 52090 }, { "entropy": 5.647755765914917, "epoch": 4.725598693759071, "grad_norm": 1.3359375, "learning_rate": 0.0002977464656612133, "loss": 4.8238, "mean_token_accuracy": 0.23937030583620073, "num_tokens": 108125653.0, "step": 52095 }, { "entropy": 5.664167785644532, "epoch": 4.7260522496371555, "grad_norm": 1.3515625, "learning_rate": 0.00029771427477680415, "loss": 4.8556, "mean_token_accuracy": 0.22824369817972184, "num_tokens": 108135281.0, "step": 52100 }, { "entropy": 5.680458498001099, "epoch": 4.72650580551524, "grad_norm": 1.3125, "learning_rate": 0.00029768208342265796, "loss": 4.8736, "mean_token_accuracy": 0.2255040317773819, "num_tokens": 108145005.0, "step": 52105 }, { "entropy": 5.7186840057373045, "epoch": 4.726959361393323, "grad_norm": 1.21875, "learning_rate": 0.0002976498915994406, "loss": 4.9441, "mean_token_accuracy": 0.21808644831180574, "num_tokens": 108156477.0, "step": 52110 }, { "entropy": 5.657406044006348, "epoch": 4.727412917271408, "grad_norm": 1.5859375, "learning_rate": 0.00029761769930781757, "loss": 4.8906, "mean_token_accuracy": 0.22826910018920898, "num_tokens": 108166947.0, "step": 52115 }, { "entropy": 5.601456117630005, "epoch": 4.727866473149492, "grad_norm": 1.640625, "learning_rate": 0.0002975855065484548, "loss": 4.7483, "mean_token_accuracy": 0.2431057244539261, "num_tokens": 108175889.0, "step": 52120 }, { "entropy": 5.720250129699707, "epoch": 4.728320029027576, "grad_norm": 1.34375, "learning_rate": 0.000297553313322018, "loss": 4.9468, "mean_token_accuracy": 0.21897458732128144, "num_tokens": 108186276.0, "step": 52125 }, { "entropy": 5.61057858467102, "epoch": 4.72877358490566, "grad_norm": 1.421875, "learning_rate": 0.00029752111962917297, "loss": 4.8715, "mean_token_accuracy": 0.2258746713399887, "num_tokens": 108196960.0, "step": 52130 }, { "entropy": 5.69613299369812, "epoch": 4.7292271407837445, "grad_norm": 1.3515625, "learning_rate": 0.0002974889254705854, "loss": 4.8574, "mean_token_accuracy": 0.22844289988279343, "num_tokens": 108207442.0, "step": 52135 }, { "entropy": 5.700296211242676, "epoch": 4.729680696661829, "grad_norm": 1.3203125, "learning_rate": 0.00029745673084692116, "loss": 4.8245, "mean_token_accuracy": 0.23810974061489104, "num_tokens": 108217919.0, "step": 52140 }, { "entropy": 5.61967396736145, "epoch": 4.730134252539913, "grad_norm": 1.40625, "learning_rate": 0.000297424535758846, "loss": 4.8101, "mean_token_accuracy": 0.2320191130042076, "num_tokens": 108228106.0, "step": 52145 }, { "entropy": 5.594845867156982, "epoch": 4.730587808417997, "grad_norm": 1.2890625, "learning_rate": 0.00029739234020702564, "loss": 4.8599, "mean_token_accuracy": 0.22701286077499389, "num_tokens": 108238398.0, "step": 52150 }, { "entropy": 5.6471456527709964, "epoch": 4.731041364296082, "grad_norm": 1.3828125, "learning_rate": 0.00029736014419212605, "loss": 4.8978, "mean_token_accuracy": 0.22432231456041335, "num_tokens": 108248825.0, "step": 52155 }, { "entropy": 5.5855762481689455, "epoch": 4.731494920174166, "grad_norm": 1.2890625, "learning_rate": 0.00029732794771481305, "loss": 4.8161, "mean_token_accuracy": 0.22723645567893982, "num_tokens": 108258989.0, "step": 52160 }, { "entropy": 5.558561038970947, "epoch": 4.731948476052249, "grad_norm": 1.3359375, "learning_rate": 0.0002972957507757523, "loss": 4.8145, "mean_token_accuracy": 0.2274627685546875, "num_tokens": 108268251.0, "step": 52165 }, { "entropy": 5.636238050460816, "epoch": 4.7324020319303335, "grad_norm": 1.34375, "learning_rate": 0.00029726355337560985, "loss": 4.8642, "mean_token_accuracy": 0.2265596345067024, "num_tokens": 108278290.0, "step": 52170 }, { "entropy": 5.6630393981933596, "epoch": 4.732855587808418, "grad_norm": 1.3671875, "learning_rate": 0.00029723135551505133, "loss": 4.8787, "mean_token_accuracy": 0.2266159325838089, "num_tokens": 108288727.0, "step": 52175 }, { "entropy": 5.624604034423828, "epoch": 4.733309143686502, "grad_norm": 1.25, "learning_rate": 0.00029719915719474274, "loss": 4.8458, "mean_token_accuracy": 0.22840378284454346, "num_tokens": 108299781.0, "step": 52180 }, { "entropy": 5.68928017616272, "epoch": 4.733762699564586, "grad_norm": 1.328125, "learning_rate": 0.0002971669584153499, "loss": 4.8758, "mean_token_accuracy": 0.2257700800895691, "num_tokens": 108310703.0, "step": 52185 }, { "entropy": 5.603392601013184, "epoch": 4.7342162554426706, "grad_norm": 1.328125, "learning_rate": 0.0002971347591775388, "loss": 4.8128, "mean_token_accuracy": 0.22706200778484345, "num_tokens": 108321096.0, "step": 52190 }, { "entropy": 5.629251527786255, "epoch": 4.734669811320755, "grad_norm": 1.3203125, "learning_rate": 0.0002971025594819751, "loss": 4.8896, "mean_token_accuracy": 0.22437026351690292, "num_tokens": 108331899.0, "step": 52195 }, { "entropy": 5.556859636306763, "epoch": 4.735123367198839, "grad_norm": 1.3828125, "learning_rate": 0.00029707035932932495, "loss": 4.7325, "mean_token_accuracy": 0.2379524141550064, "num_tokens": 108342248.0, "step": 52200 }, { "entropy": 5.663289356231689, "epoch": 4.735576923076923, "grad_norm": 1.421875, "learning_rate": 0.00029703815872025413, "loss": 4.9034, "mean_token_accuracy": 0.22665054947137833, "num_tokens": 108355264.0, "step": 52205 }, { "entropy": 5.613776206970215, "epoch": 4.736030478955008, "grad_norm": 1.328125, "learning_rate": 0.0002970059576554285, "loss": 4.8454, "mean_token_accuracy": 0.222385972738266, "num_tokens": 108365929.0, "step": 52210 }, { "entropy": 5.606583547592163, "epoch": 4.736484034833092, "grad_norm": 1.296875, "learning_rate": 0.0002969737561355142, "loss": 4.8316, "mean_token_accuracy": 0.22769063711166382, "num_tokens": 108376874.0, "step": 52215 }, { "entropy": 5.604950714111328, "epoch": 4.736937590711175, "grad_norm": 1.34375, "learning_rate": 0.0002969415541611769, "loss": 4.8122, "mean_token_accuracy": 0.22499992102384567, "num_tokens": 108387277.0, "step": 52220 }, { "entropy": 5.689796257019043, "epoch": 4.7373911465892595, "grad_norm": 1.2578125, "learning_rate": 0.0002969093517330827, "loss": 4.9744, "mean_token_accuracy": 0.22008468508720397, "num_tokens": 108399088.0, "step": 52225 }, { "entropy": 5.709333419799805, "epoch": 4.737844702467344, "grad_norm": 1.3125, "learning_rate": 0.0002968771488518975, "loss": 4.9516, "mean_token_accuracy": 0.21810991764068605, "num_tokens": 108409875.0, "step": 52230 }, { "entropy": 5.67483811378479, "epoch": 4.738298258345428, "grad_norm": 1.21875, "learning_rate": 0.0002968449455182874, "loss": 4.8923, "mean_token_accuracy": 0.22787051945924758, "num_tokens": 108421133.0, "step": 52235 }, { "entropy": 5.771256923675537, "epoch": 4.738751814223512, "grad_norm": 1.3515625, "learning_rate": 0.00029681274173291817, "loss": 5.0528, "mean_token_accuracy": 0.21301034241914749, "num_tokens": 108433408.0, "step": 52240 }, { "entropy": 5.606645488739014, "epoch": 4.739205370101597, "grad_norm": 1.375, "learning_rate": 0.00029678053749645583, "loss": 4.7893, "mean_token_accuracy": 0.2333521917462349, "num_tokens": 108443783.0, "step": 52245 }, { "entropy": 5.521975469589234, "epoch": 4.739658925979681, "grad_norm": 1.328125, "learning_rate": 0.0002967483328095665, "loss": 4.7319, "mean_token_accuracy": 0.23259187489748, "num_tokens": 108454770.0, "step": 52250 }, { "entropy": 5.612837791442871, "epoch": 4.740112481857765, "grad_norm": 1.265625, "learning_rate": 0.0002967161276729161, "loss": 4.828, "mean_token_accuracy": 0.23543968796730042, "num_tokens": 108464812.0, "step": 52255 }, { "entropy": 5.6790975570678714, "epoch": 4.740566037735849, "grad_norm": 1.265625, "learning_rate": 0.0002966839220871707, "loss": 4.8768, "mean_token_accuracy": 0.22128035873174667, "num_tokens": 108474642.0, "step": 52260 }, { "entropy": 5.605567121505738, "epoch": 4.741019593613933, "grad_norm": 1.3203125, "learning_rate": 0.0002966517160529962, "loss": 4.8317, "mean_token_accuracy": 0.23071384578943252, "num_tokens": 108484143.0, "step": 52265 }, { "entropy": 5.715630578994751, "epoch": 4.741473149492017, "grad_norm": 1.4765625, "learning_rate": 0.0002966195095710587, "loss": 4.9785, "mean_token_accuracy": 0.2218109369277954, "num_tokens": 108494850.0, "step": 52270 }, { "entropy": 5.671351766586303, "epoch": 4.741926705370101, "grad_norm": 1.3046875, "learning_rate": 0.0002965873026420242, "loss": 4.9, "mean_token_accuracy": 0.2212483450770378, "num_tokens": 108505441.0, "step": 52275 }, { "entropy": 5.691192626953125, "epoch": 4.742380261248186, "grad_norm": 1.3203125, "learning_rate": 0.00029655509526655885, "loss": 4.9483, "mean_token_accuracy": 0.21869966238737107, "num_tokens": 108517350.0, "step": 52280 }, { "entropy": 5.620677804946899, "epoch": 4.74283381712627, "grad_norm": 1.25, "learning_rate": 0.00029652288744532856, "loss": 4.8345, "mean_token_accuracy": 0.23160264492034913, "num_tokens": 108528472.0, "step": 52285 }, { "entropy": 5.66132698059082, "epoch": 4.743287373004354, "grad_norm": 1.3125, "learning_rate": 0.0002964906791789995, "loss": 4.9342, "mean_token_accuracy": 0.22255614250898362, "num_tokens": 108539834.0, "step": 52290 }, { "entropy": 5.682744455337525, "epoch": 4.743740928882438, "grad_norm": 1.2578125, "learning_rate": 0.0002964584704682377, "loss": 4.9549, "mean_token_accuracy": 0.2275290846824646, "num_tokens": 108551478.0, "step": 52295 }, { "entropy": 5.575284194946289, "epoch": 4.744194484760523, "grad_norm": 1.28125, "learning_rate": 0.00029642626131370936, "loss": 4.718, "mean_token_accuracy": 0.24244055896997452, "num_tokens": 108560957.0, "step": 52300 }, { "entropy": 5.658299398422241, "epoch": 4.744648040638607, "grad_norm": 1.4140625, "learning_rate": 0.0002963940517160804, "loss": 4.8928, "mean_token_accuracy": 0.2236693888902664, "num_tokens": 108571146.0, "step": 52305 }, { "entropy": 5.631214618682861, "epoch": 4.745101596516691, "grad_norm": 1.4296875, "learning_rate": 0.00029636184167601695, "loss": 4.8298, "mean_token_accuracy": 0.231575645506382, "num_tokens": 108581085.0, "step": 52310 }, { "entropy": 5.5773498058319095, "epoch": 4.745555152394775, "grad_norm": 1.5703125, "learning_rate": 0.00029632963119418526, "loss": 4.8301, "mean_token_accuracy": 0.22852738946676254, "num_tokens": 108591103.0, "step": 52315 }, { "entropy": 5.639823913574219, "epoch": 4.746008708272859, "grad_norm": 1.3515625, "learning_rate": 0.00029629742027125134, "loss": 4.8417, "mean_token_accuracy": 0.2250826671719551, "num_tokens": 108601433.0, "step": 52320 }, { "entropy": 5.618091058731079, "epoch": 4.746462264150943, "grad_norm": 1.46875, "learning_rate": 0.00029626520890788127, "loss": 4.8722, "mean_token_accuracy": 0.22619408816099168, "num_tokens": 108611728.0, "step": 52325 }, { "entropy": 5.633877992630005, "epoch": 4.746915820029027, "grad_norm": 1.3671875, "learning_rate": 0.00029623299710474134, "loss": 4.8713, "mean_token_accuracy": 0.22156716287136077, "num_tokens": 108621521.0, "step": 52330 }, { "entropy": 5.60551905632019, "epoch": 4.747369375907112, "grad_norm": 1.34375, "learning_rate": 0.00029620078486249763, "loss": 4.9015, "mean_token_accuracy": 0.21905920654535294, "num_tokens": 108632921.0, "step": 52335 }, { "entropy": 5.638763523101806, "epoch": 4.747822931785196, "grad_norm": 1.3359375, "learning_rate": 0.0002961685721818163, "loss": 4.8775, "mean_token_accuracy": 0.23296921104192733, "num_tokens": 108643244.0, "step": 52340 }, { "entropy": 5.6242602348327635, "epoch": 4.74827648766328, "grad_norm": 1.3828125, "learning_rate": 0.0002961363590633634, "loss": 4.8552, "mean_token_accuracy": 0.22921345382928848, "num_tokens": 108653036.0, "step": 52345 }, { "entropy": 5.717230272293091, "epoch": 4.748730043541364, "grad_norm": 1.28125, "learning_rate": 0.0002961041455078053, "loss": 4.9, "mean_token_accuracy": 0.22478835582733153, "num_tokens": 108663317.0, "step": 52350 }, { "entropy": 5.615634965896606, "epoch": 4.749183599419449, "grad_norm": 1.3828125, "learning_rate": 0.0002960719315158081, "loss": 4.7987, "mean_token_accuracy": 0.23187349438667298, "num_tokens": 108673657.0, "step": 52355 }, { "entropy": 5.597364902496338, "epoch": 4.749637155297533, "grad_norm": 1.3515625, "learning_rate": 0.0002960397170880378, "loss": 4.8257, "mean_token_accuracy": 0.2216600552201271, "num_tokens": 108683831.0, "step": 52360 }, { "entropy": 5.591486215591431, "epoch": 4.750090711175617, "grad_norm": 1.2890625, "learning_rate": 0.00029600750222516097, "loss": 4.8151, "mean_token_accuracy": 0.2277290180325508, "num_tokens": 108694062.0, "step": 52365 }, { "entropy": 5.6233659267425535, "epoch": 4.7505442670537015, "grad_norm": 1.25, "learning_rate": 0.00029597528692784365, "loss": 4.8318, "mean_token_accuracy": 0.2283254459500313, "num_tokens": 108704712.0, "step": 52370 }, { "entropy": 5.621436262130738, "epoch": 4.750997822931785, "grad_norm": 1.296875, "learning_rate": 0.00029594307119675195, "loss": 4.833, "mean_token_accuracy": 0.22577468901872635, "num_tokens": 108714741.0, "step": 52375 }, { "entropy": 5.6719067096710205, "epoch": 4.751451378809869, "grad_norm": 1.2734375, "learning_rate": 0.0002959108550325523, "loss": 4.9443, "mean_token_accuracy": 0.22586423009634018, "num_tokens": 108724860.0, "step": 52380 }, { "entropy": 5.614187955856323, "epoch": 4.751904934687953, "grad_norm": 1.3359375, "learning_rate": 0.00029587863843591076, "loss": 4.7853, "mean_token_accuracy": 0.2436222866177559, "num_tokens": 108735527.0, "step": 52385 }, { "entropy": 5.655112266540527, "epoch": 4.752358490566038, "grad_norm": 1.4140625, "learning_rate": 0.00029584642140749375, "loss": 4.9187, "mean_token_accuracy": 0.21367600709199905, "num_tokens": 108745748.0, "step": 52390 }, { "entropy": 5.658301782608032, "epoch": 4.752812046444122, "grad_norm": 1.359375, "learning_rate": 0.00029581420394796733, "loss": 4.8843, "mean_token_accuracy": 0.2323250263929367, "num_tokens": 108756635.0, "step": 52395 }, { "entropy": 5.618615913391113, "epoch": 4.753265602322206, "grad_norm": 1.3984375, "learning_rate": 0.00029578198605799796, "loss": 4.8197, "mean_token_accuracy": 0.22975172847509384, "num_tokens": 108765912.0, "step": 52400 }, { "entropy": 5.688010931015015, "epoch": 4.7537191582002905, "grad_norm": 1.3203125, "learning_rate": 0.00029574976773825176, "loss": 4.8405, "mean_token_accuracy": 0.22769033014774323, "num_tokens": 108775831.0, "step": 52405 }, { "entropy": 5.652090215682984, "epoch": 4.754172714078375, "grad_norm": 1.4375, "learning_rate": 0.000295717548989395, "loss": 4.825, "mean_token_accuracy": 0.2263962894678116, "num_tokens": 108785937.0, "step": 52410 }, { "entropy": 5.584827613830567, "epoch": 4.754626269956459, "grad_norm": 1.34375, "learning_rate": 0.0002956853298120942, "loss": 4.8236, "mean_token_accuracy": 0.2291240692138672, "num_tokens": 108796289.0, "step": 52415 }, { "entropy": 5.6686793804168705, "epoch": 4.755079825834542, "grad_norm": 1.4296875, "learning_rate": 0.00029565311020701544, "loss": 4.9041, "mean_token_accuracy": 0.2231221467256546, "num_tokens": 108806040.0, "step": 52420 }, { "entropy": 5.6595433235168455, "epoch": 4.755533381712627, "grad_norm": 1.3359375, "learning_rate": 0.00029562089017482515, "loss": 4.9185, "mean_token_accuracy": 0.22468622922897338, "num_tokens": 108815440.0, "step": 52425 }, { "entropy": 5.715126371383667, "epoch": 4.755986937590711, "grad_norm": 1.2265625, "learning_rate": 0.0002955886697161895, "loss": 4.9302, "mean_token_accuracy": 0.22231387495994567, "num_tokens": 108826059.0, "step": 52430 }, { "entropy": 5.678690433502197, "epoch": 4.756440493468795, "grad_norm": 1.46875, "learning_rate": 0.00029555644883177496, "loss": 4.834, "mean_token_accuracy": 0.23017715513706208, "num_tokens": 108836373.0, "step": 52435 }, { "entropy": 5.571122503280639, "epoch": 4.756894049346879, "grad_norm": 1.359375, "learning_rate": 0.00029552422752224787, "loss": 4.7736, "mean_token_accuracy": 0.23998536467552184, "num_tokens": 108847364.0, "step": 52440 }, { "entropy": 5.599294233322143, "epoch": 4.757347605224964, "grad_norm": 1.359375, "learning_rate": 0.00029549200578827444, "loss": 4.8611, "mean_token_accuracy": 0.22038956582546235, "num_tokens": 108856893.0, "step": 52445 }, { "entropy": 5.665643215179443, "epoch": 4.757801161103048, "grad_norm": 1.34375, "learning_rate": 0.0002954597836305212, "loss": 4.7963, "mean_token_accuracy": 0.23858331143856049, "num_tokens": 108867218.0, "step": 52450 }, { "entropy": 5.636919736862183, "epoch": 4.758254716981132, "grad_norm": 1.265625, "learning_rate": 0.00029542756104965434, "loss": 4.8448, "mean_token_accuracy": 0.22345684319734574, "num_tokens": 108876938.0, "step": 52455 }, { "entropy": 5.6562642574310305, "epoch": 4.7587082728592165, "grad_norm": 1.421875, "learning_rate": 0.00029539533804634027, "loss": 4.8352, "mean_token_accuracy": 0.2263913244009018, "num_tokens": 108887831.0, "step": 52460 }, { "entropy": 5.617428112030029, "epoch": 4.759161828737301, "grad_norm": 1.3828125, "learning_rate": 0.00029536311462124553, "loss": 4.8209, "mean_token_accuracy": 0.23740432411432266, "num_tokens": 108897634.0, "step": 52465 }, { "entropy": 5.603098392486572, "epoch": 4.759615384615385, "grad_norm": 1.390625, "learning_rate": 0.0002953308907750363, "loss": 4.8138, "mean_token_accuracy": 0.22858071625232695, "num_tokens": 108907976.0, "step": 52470 }, { "entropy": 5.609667205810547, "epoch": 4.760068940493468, "grad_norm": 1.28125, "learning_rate": 0.0002952986665083792, "loss": 4.8627, "mean_token_accuracy": 0.22344138771295546, "num_tokens": 108918755.0, "step": 52475 }, { "entropy": 5.630168914794922, "epoch": 4.760522496371553, "grad_norm": 1.4296875, "learning_rate": 0.0002952664418219404, "loss": 4.86, "mean_token_accuracy": 0.23377442061901094, "num_tokens": 108928349.0, "step": 52480 }, { "entropy": 5.64237642288208, "epoch": 4.760976052249637, "grad_norm": 1.25, "learning_rate": 0.00029523421671638644, "loss": 4.9178, "mean_token_accuracy": 0.21967661678791045, "num_tokens": 108938429.0, "step": 52485 }, { "entropy": 5.680794095993042, "epoch": 4.761429608127721, "grad_norm": 1.3359375, "learning_rate": 0.0002952019911923837, "loss": 4.861, "mean_token_accuracy": 0.22872537970542908, "num_tokens": 108948378.0, "step": 52490 }, { "entropy": 5.604490852355957, "epoch": 4.7618831640058055, "grad_norm": 1.4296875, "learning_rate": 0.00029516976525059864, "loss": 4.8009, "mean_token_accuracy": 0.23161621242761612, "num_tokens": 108958667.0, "step": 52495 }, { "entropy": 5.708456802368164, "epoch": 4.76233671988389, "grad_norm": 1.328125, "learning_rate": 0.0002951375388916977, "loss": 4.9266, "mean_token_accuracy": 0.21775925159454346, "num_tokens": 108968955.0, "step": 52500 }, { "entropy": 5.672987747192383, "epoch": 4.762790275761974, "grad_norm": 1.3828125, "learning_rate": 0.0002951053121163474, "loss": 4.808, "mean_token_accuracy": 0.2305819123983383, "num_tokens": 108979565.0, "step": 52505 }, { "entropy": 5.645192050933838, "epoch": 4.763243831640058, "grad_norm": 1.359375, "learning_rate": 0.000295073084925214, "loss": 4.8913, "mean_token_accuracy": 0.2242574080824852, "num_tokens": 108989547.0, "step": 52510 }, { "entropy": 5.612680530548095, "epoch": 4.7636973875181425, "grad_norm": 1.3671875, "learning_rate": 0.00029504085731896413, "loss": 4.8449, "mean_token_accuracy": 0.22904817759990692, "num_tokens": 109000286.0, "step": 52515 }, { "entropy": 5.664691066741943, "epoch": 4.764150943396227, "grad_norm": 1.328125, "learning_rate": 0.0002950086292982642, "loss": 4.8014, "mean_token_accuracy": 0.23575116395950318, "num_tokens": 109010676.0, "step": 52520 }, { "entropy": 5.710342931747436, "epoch": 4.764604499274311, "grad_norm": 1.453125, "learning_rate": 0.00029497640086378077, "loss": 4.939, "mean_token_accuracy": 0.21703298836946489, "num_tokens": 109020800.0, "step": 52525 }, { "entropy": 5.676192808151245, "epoch": 4.7650580551523944, "grad_norm": 1.3515625, "learning_rate": 0.00029494417201618027, "loss": 4.9623, "mean_token_accuracy": 0.2198370188474655, "num_tokens": 109031158.0, "step": 52530 }, { "entropy": 5.596923875808716, "epoch": 4.765511611030479, "grad_norm": 1.3515625, "learning_rate": 0.0002949119427561292, "loss": 4.8142, "mean_token_accuracy": 0.23129542469978331, "num_tokens": 109041664.0, "step": 52535 }, { "entropy": 5.633503389358521, "epoch": 4.765965166908563, "grad_norm": 1.3984375, "learning_rate": 0.00029487971308429415, "loss": 4.8596, "mean_token_accuracy": 0.23392236083745957, "num_tokens": 109052633.0, "step": 52540 }, { "entropy": 5.6323254108428955, "epoch": 4.766418722786647, "grad_norm": 1.3515625, "learning_rate": 0.0002948474830013414, "loss": 4.8541, "mean_token_accuracy": 0.22733922451734542, "num_tokens": 109062687.0, "step": 52545 }, { "entropy": 5.6883176326751705, "epoch": 4.7668722786647315, "grad_norm": 1.4296875, "learning_rate": 0.00029481525250793777, "loss": 4.8864, "mean_token_accuracy": 0.23309983760118486, "num_tokens": 109073348.0, "step": 52550 }, { "entropy": 5.5975922584533695, "epoch": 4.767325834542816, "grad_norm": 1.3046875, "learning_rate": 0.0002947830216047497, "loss": 4.8801, "mean_token_accuracy": 0.22087957561016083, "num_tokens": 109083276.0, "step": 52555 }, { "entropy": 5.594065952301025, "epoch": 4.7677793904209, "grad_norm": 1.34375, "learning_rate": 0.00029475079029244356, "loss": 4.8675, "mean_token_accuracy": 0.2287531539797783, "num_tokens": 109094342.0, "step": 52560 }, { "entropy": 5.63740291595459, "epoch": 4.768232946298984, "grad_norm": 1.265625, "learning_rate": 0.00029471855857168616, "loss": 4.8944, "mean_token_accuracy": 0.22886939942836762, "num_tokens": 109105178.0, "step": 52565 }, { "entropy": 5.708528757095337, "epoch": 4.768686502177069, "grad_norm": 1.2890625, "learning_rate": 0.0002946863264431439, "loss": 4.96, "mean_token_accuracy": 0.2153998762369156, "num_tokens": 109116205.0, "step": 52570 }, { "entropy": 5.624877452850342, "epoch": 4.769140058055152, "grad_norm": 1.2890625, "learning_rate": 0.0002946540939074834, "loss": 4.8425, "mean_token_accuracy": 0.2220785692334175, "num_tokens": 109126299.0, "step": 52575 }, { "entropy": 5.661425447463989, "epoch": 4.769593613933236, "grad_norm": 1.2265625, "learning_rate": 0.00029462186096537116, "loss": 4.946, "mean_token_accuracy": 0.22503869235515594, "num_tokens": 109137675.0, "step": 52580 }, { "entropy": 5.661192083358765, "epoch": 4.7700471698113205, "grad_norm": 1.34375, "learning_rate": 0.00029458962761747394, "loss": 4.8313, "mean_token_accuracy": 0.22939475774765014, "num_tokens": 109147716.0, "step": 52585 }, { "entropy": 5.644068670272827, "epoch": 4.770500725689405, "grad_norm": 1.28125, "learning_rate": 0.0002945573938644582, "loss": 4.8441, "mean_token_accuracy": 0.22903202921152116, "num_tokens": 109159211.0, "step": 52590 }, { "entropy": 5.64030876159668, "epoch": 4.770954281567489, "grad_norm": 1.2421875, "learning_rate": 0.00029452515970699054, "loss": 4.9066, "mean_token_accuracy": 0.21943735033273698, "num_tokens": 109169490.0, "step": 52595 }, { "entropy": 5.687409257888794, "epoch": 4.771407837445573, "grad_norm": 1.375, "learning_rate": 0.00029449292514573767, "loss": 4.9288, "mean_token_accuracy": 0.21967633217573165, "num_tokens": 109179687.0, "step": 52600 }, { "entropy": 5.633784818649292, "epoch": 4.7718613933236576, "grad_norm": 1.5, "learning_rate": 0.00029446069018136613, "loss": 4.8385, "mean_token_accuracy": 0.22660400867462158, "num_tokens": 109189415.0, "step": 52605 }, { "entropy": 5.588267850875854, "epoch": 4.772314949201742, "grad_norm": 1.3984375, "learning_rate": 0.0002944284548145424, "loss": 4.7364, "mean_token_accuracy": 0.23210244178771972, "num_tokens": 109199281.0, "step": 52610 }, { "entropy": 5.615257644653321, "epoch": 4.772768505079826, "grad_norm": 1.34375, "learning_rate": 0.0002943962190459335, "loss": 4.8257, "mean_token_accuracy": 0.22793096899986268, "num_tokens": 109208347.0, "step": 52615 }, { "entropy": 5.587856960296631, "epoch": 4.77322206095791, "grad_norm": 1.34375, "learning_rate": 0.00029436398287620573, "loss": 4.8547, "mean_token_accuracy": 0.22335030734539033, "num_tokens": 109218026.0, "step": 52620 }, { "entropy": 5.588596200942993, "epoch": 4.773675616835995, "grad_norm": 1.3203125, "learning_rate": 0.0002943317463060259, "loss": 4.8293, "mean_token_accuracy": 0.22319174259901048, "num_tokens": 109229457.0, "step": 52625 }, { "entropy": 5.63396520614624, "epoch": 4.774129172714078, "grad_norm": 1.4453125, "learning_rate": 0.0002942995093360606, "loss": 4.8164, "mean_token_accuracy": 0.22723015993833542, "num_tokens": 109239504.0, "step": 52630 }, { "entropy": 5.576156854629517, "epoch": 4.774582728592162, "grad_norm": 1.390625, "learning_rate": 0.0002942672719669765, "loss": 4.7457, "mean_token_accuracy": 0.23487858921289445, "num_tokens": 109249745.0, "step": 52635 }, { "entropy": 5.589773654937744, "epoch": 4.7750362844702465, "grad_norm": 1.28125, "learning_rate": 0.0002942350341994404, "loss": 4.8135, "mean_token_accuracy": 0.2322341486811638, "num_tokens": 109259767.0, "step": 52640 }, { "entropy": 5.754535484313965, "epoch": 4.775489840348331, "grad_norm": 1.359375, "learning_rate": 0.00029420279603411875, "loss": 5.0165, "mean_token_accuracy": 0.22071036398410798, "num_tokens": 109269611.0, "step": 52645 }, { "entropy": 5.758963298797608, "epoch": 4.775943396226415, "grad_norm": 1.328125, "learning_rate": 0.0002941705574716785, "loss": 4.9527, "mean_token_accuracy": 0.2198594555258751, "num_tokens": 109281396.0, "step": 52650 }, { "entropy": 5.69974193572998, "epoch": 4.776396952104499, "grad_norm": 1.3359375, "learning_rate": 0.0002941383185127862, "loss": 4.8143, "mean_token_accuracy": 0.22679316252470016, "num_tokens": 109292346.0, "step": 52655 }, { "entropy": 5.730378246307373, "epoch": 4.776850507982584, "grad_norm": 1.484375, "learning_rate": 0.00029410607915810854, "loss": 4.9228, "mean_token_accuracy": 0.21880850195884705, "num_tokens": 109302966.0, "step": 52660 }, { "entropy": 5.557135391235351, "epoch": 4.777304063860668, "grad_norm": 1.296875, "learning_rate": 0.0002940738394083124, "loss": 4.8042, "mean_token_accuracy": 0.22933248430490494, "num_tokens": 109312558.0, "step": 52665 }, { "entropy": 5.661647653579712, "epoch": 4.777757619738752, "grad_norm": 1.4765625, "learning_rate": 0.00029404159926406436, "loss": 4.9256, "mean_token_accuracy": 0.22697875052690505, "num_tokens": 109322364.0, "step": 52670 }, { "entropy": 5.722963619232178, "epoch": 4.7782111756168355, "grad_norm": 1.484375, "learning_rate": 0.0002940093587260312, "loss": 4.9415, "mean_token_accuracy": 0.2255360946059227, "num_tokens": 109332449.0, "step": 52675 }, { "entropy": 5.692411041259765, "epoch": 4.778664731494921, "grad_norm": 1.34375, "learning_rate": 0.00029397711779487954, "loss": 4.822, "mean_token_accuracy": 0.22846415191888808, "num_tokens": 109343262.0, "step": 52680 }, { "entropy": 5.625509357452392, "epoch": 4.779118287373004, "grad_norm": 1.34375, "learning_rate": 0.00029394487647127645, "loss": 4.8185, "mean_token_accuracy": 0.22888773679733276, "num_tokens": 109352951.0, "step": 52685 }, { "entropy": 5.586233711242675, "epoch": 4.779571843251088, "grad_norm": 1.359375, "learning_rate": 0.00029391263475588844, "loss": 4.9491, "mean_token_accuracy": 0.2228041797876358, "num_tokens": 109363913.0, "step": 52690 }, { "entropy": 5.616233587265015, "epoch": 4.780025399129173, "grad_norm": 1.34375, "learning_rate": 0.00029388039264938224, "loss": 4.8362, "mean_token_accuracy": 0.2242326870560646, "num_tokens": 109374405.0, "step": 52695 }, { "entropy": 5.726517915725708, "epoch": 4.780478955007257, "grad_norm": 1.3828125, "learning_rate": 0.0002938481501524247, "loss": 4.9271, "mean_token_accuracy": 0.2200401321053505, "num_tokens": 109385696.0, "step": 52700 }, { "entropy": 5.6907796382904055, "epoch": 4.780932510885341, "grad_norm": 1.4609375, "learning_rate": 0.00029381590726568267, "loss": 4.8914, "mean_token_accuracy": 0.22477795630693437, "num_tokens": 109395061.0, "step": 52705 }, { "entropy": 5.647987651824951, "epoch": 4.781386066763425, "grad_norm": 1.2578125, "learning_rate": 0.00029378366398982286, "loss": 4.8668, "mean_token_accuracy": 0.2233182057738304, "num_tokens": 109406152.0, "step": 52710 }, { "entropy": 5.7147167205810545, "epoch": 4.78183962264151, "grad_norm": 1.28125, "learning_rate": 0.00029375142032551216, "loss": 4.9191, "mean_token_accuracy": 0.22091188728809358, "num_tokens": 109416596.0, "step": 52715 }, { "entropy": 5.740494871139527, "epoch": 4.782293178519594, "grad_norm": 1.328125, "learning_rate": 0.00029371917627341726, "loss": 4.927, "mean_token_accuracy": 0.2245527222752571, "num_tokens": 109426169.0, "step": 52720 }, { "entropy": 5.68250412940979, "epoch": 4.782746734397678, "grad_norm": 1.3515625, "learning_rate": 0.000293686931834205, "loss": 4.8917, "mean_token_accuracy": 0.2283185362815857, "num_tokens": 109436359.0, "step": 52725 }, { "entropy": 5.646133947372436, "epoch": 4.7832002902757615, "grad_norm": 1.40625, "learning_rate": 0.0002936546870085422, "loss": 4.8744, "mean_token_accuracy": 0.22126978784799575, "num_tokens": 109446050.0, "step": 52730 }, { "entropy": 5.678741693496704, "epoch": 4.783653846153846, "grad_norm": 1.46875, "learning_rate": 0.00029362244179709576, "loss": 4.9065, "mean_token_accuracy": 0.23047959059476852, "num_tokens": 109457124.0, "step": 52735 }, { "entropy": 5.586958599090576, "epoch": 4.78410740203193, "grad_norm": 1.3359375, "learning_rate": 0.00029359019620053253, "loss": 4.7762, "mean_token_accuracy": 0.23238855004310607, "num_tokens": 109467642.0, "step": 52740 }, { "entropy": 5.686911344528198, "epoch": 4.784560957910014, "grad_norm": 1.2109375, "learning_rate": 0.0002935579502195192, "loss": 4.8981, "mean_token_accuracy": 0.21863505989313126, "num_tokens": 109477877.0, "step": 52745 }, { "entropy": 5.657322072982788, "epoch": 4.785014513788099, "grad_norm": 1.2265625, "learning_rate": 0.00029352570385472276, "loss": 4.8389, "mean_token_accuracy": 0.22490146309137343, "num_tokens": 109489302.0, "step": 52750 }, { "entropy": 5.644135427474976, "epoch": 4.785468069666183, "grad_norm": 1.2734375, "learning_rate": 0.0002934934571068101, "loss": 4.8396, "mean_token_accuracy": 0.22730441838502885, "num_tokens": 109500023.0, "step": 52755 }, { "entropy": 5.60171365737915, "epoch": 4.785921625544267, "grad_norm": 1.28125, "learning_rate": 0.000293461209976448, "loss": 4.8723, "mean_token_accuracy": 0.22833799421787263, "num_tokens": 109510588.0, "step": 52760 }, { "entropy": 5.701880645751953, "epoch": 4.786375181422351, "grad_norm": 1.5078125, "learning_rate": 0.0002934289624643034, "loss": 4.8959, "mean_token_accuracy": 0.22276590019464493, "num_tokens": 109520162.0, "step": 52765 }, { "entropy": 5.662490940093994, "epoch": 4.786828737300436, "grad_norm": 1.296875, "learning_rate": 0.0002933967145710431, "loss": 4.851, "mean_token_accuracy": 0.22318645268678666, "num_tokens": 109530155.0, "step": 52770 }, { "entropy": 5.621389865875244, "epoch": 4.78728229317852, "grad_norm": 1.3515625, "learning_rate": 0.0002933644662973341, "loss": 4.8987, "mean_token_accuracy": 0.2277026280760765, "num_tokens": 109539897.0, "step": 52775 }, { "entropy": 5.595298528671265, "epoch": 4.787735849056604, "grad_norm": 1.3984375, "learning_rate": 0.00029333221764384326, "loss": 4.849, "mean_token_accuracy": 0.2212102323770523, "num_tokens": 109549995.0, "step": 52780 }, { "entropy": 5.654567289352417, "epoch": 4.788189404934688, "grad_norm": 1.34375, "learning_rate": 0.00029329996861123745, "loss": 4.8862, "mean_token_accuracy": 0.22533482313156128, "num_tokens": 109560446.0, "step": 52785 }, { "entropy": 5.607658958435058, "epoch": 4.788642960812772, "grad_norm": 1.2109375, "learning_rate": 0.00029326771920018367, "loss": 4.8325, "mean_token_accuracy": 0.22632743269205094, "num_tokens": 109570864.0, "step": 52790 }, { "entropy": 5.735541725158692, "epoch": 4.789096516690856, "grad_norm": 1.484375, "learning_rate": 0.00029323546941134875, "loss": 4.8891, "mean_token_accuracy": 0.22914797216653823, "num_tokens": 109581015.0, "step": 52795 }, { "entropy": 5.6438463687896725, "epoch": 4.78955007256894, "grad_norm": 1.390625, "learning_rate": 0.00029320321924539974, "loss": 4.865, "mean_token_accuracy": 0.22209956496953964, "num_tokens": 109591695.0, "step": 52800 }, { "entropy": 5.578674936294556, "epoch": 4.790003628447025, "grad_norm": 1.2890625, "learning_rate": 0.0002931709687030035, "loss": 4.8151, "mean_token_accuracy": 0.23232684284448624, "num_tokens": 109602274.0, "step": 52805 }, { "entropy": 5.688881921768188, "epoch": 4.790457184325109, "grad_norm": 1.46875, "learning_rate": 0.00029313871778482693, "loss": 4.871, "mean_token_accuracy": 0.23010208308696747, "num_tokens": 109612995.0, "step": 52810 }, { "entropy": 5.6651569366455075, "epoch": 4.790910740203193, "grad_norm": 1.4140625, "learning_rate": 0.0002931064664915371, "loss": 4.8192, "mean_token_accuracy": 0.22488640993833542, "num_tokens": 109623133.0, "step": 52815 }, { "entropy": 5.584497308731079, "epoch": 4.7913642960812775, "grad_norm": 1.2421875, "learning_rate": 0.000293074214823801, "loss": 4.8159, "mean_token_accuracy": 0.22636962532997132, "num_tokens": 109634312.0, "step": 52820 }, { "entropy": 5.6789247512817385, "epoch": 4.791817851959362, "grad_norm": 1.3828125, "learning_rate": 0.00029304196278228544, "loss": 4.8794, "mean_token_accuracy": 0.21459644585847854, "num_tokens": 109644333.0, "step": 52825 }, { "entropy": 5.616401338577271, "epoch": 4.792271407837445, "grad_norm": 1.4453125, "learning_rate": 0.0002930097103676575, "loss": 4.7708, "mean_token_accuracy": 0.23262296319007875, "num_tokens": 109654730.0, "step": 52830 }, { "entropy": 5.589736461639404, "epoch": 4.79272496371553, "grad_norm": 1.3046875, "learning_rate": 0.00029297745758058414, "loss": 4.8119, "mean_token_accuracy": 0.22892464250326156, "num_tokens": 109664867.0, "step": 52835 }, { "entropy": 5.6731462478637695, "epoch": 4.793178519593614, "grad_norm": 1.390625, "learning_rate": 0.00029294520442173244, "loss": 4.9106, "mean_token_accuracy": 0.22929418236017227, "num_tokens": 109675090.0, "step": 52840 }, { "entropy": 5.610694503784179, "epoch": 4.793632075471698, "grad_norm": 1.421875, "learning_rate": 0.0002929129508917693, "loss": 4.8027, "mean_token_accuracy": 0.23342251628637314, "num_tokens": 109685046.0, "step": 52845 }, { "entropy": 5.749180030822754, "epoch": 4.794085631349782, "grad_norm": 1.390625, "learning_rate": 0.0002928806969913618, "loss": 4.9143, "mean_token_accuracy": 0.22772050648927689, "num_tokens": 109696240.0, "step": 52850 }, { "entropy": 5.643613719940186, "epoch": 4.794539187227866, "grad_norm": 1.375, "learning_rate": 0.0002928484427211769, "loss": 4.8658, "mean_token_accuracy": 0.2210042417049408, "num_tokens": 109707676.0, "step": 52855 }, { "entropy": 5.719730567932129, "epoch": 4.794992743105951, "grad_norm": 1.3671875, "learning_rate": 0.0002928161880818817, "loss": 4.9234, "mean_token_accuracy": 0.22191641926765443, "num_tokens": 109718168.0, "step": 52860 }, { "entropy": 5.606037950515747, "epoch": 4.795446298984035, "grad_norm": 1.40625, "learning_rate": 0.0002927839330741431, "loss": 4.8023, "mean_token_accuracy": 0.228772135078907, "num_tokens": 109728624.0, "step": 52865 }, { "entropy": 5.739957571029663, "epoch": 4.795899854862119, "grad_norm": 1.4453125, "learning_rate": 0.00029275167769862834, "loss": 4.9481, "mean_token_accuracy": 0.21613523811101915, "num_tokens": 109738301.0, "step": 52870 }, { "entropy": 5.684234857559204, "epoch": 4.7963534107402035, "grad_norm": 1.296875, "learning_rate": 0.0002927194219560043, "loss": 4.9675, "mean_token_accuracy": 0.21721005588769912, "num_tokens": 109749269.0, "step": 52875 }, { "entropy": 5.6338677406311035, "epoch": 4.796806966618288, "grad_norm": 1.3671875, "learning_rate": 0.00029268716584693804, "loss": 4.8271, "mean_token_accuracy": 0.22504261285066604, "num_tokens": 109758335.0, "step": 52880 }, { "entropy": 5.642784070968628, "epoch": 4.797260522496371, "grad_norm": 1.3515625, "learning_rate": 0.0002926549093720968, "loss": 4.803, "mean_token_accuracy": 0.23389253318309783, "num_tokens": 109768848.0, "step": 52885 }, { "entropy": 5.611158227920532, "epoch": 4.797714078374455, "grad_norm": 1.2734375, "learning_rate": 0.00029262265253214754, "loss": 4.8611, "mean_token_accuracy": 0.22540179640054703, "num_tokens": 109779331.0, "step": 52890 }, { "entropy": 5.672042322158814, "epoch": 4.79816763425254, "grad_norm": 1.4140625, "learning_rate": 0.00029259039532775725, "loss": 4.8444, "mean_token_accuracy": 0.22843475341796876, "num_tokens": 109789331.0, "step": 52895 }, { "entropy": 5.6949248790740965, "epoch": 4.798621190130624, "grad_norm": 1.3515625, "learning_rate": 0.0002925581377595931, "loss": 4.8273, "mean_token_accuracy": 0.2307179570198059, "num_tokens": 109798630.0, "step": 52900 }, { "entropy": 5.636219453811646, "epoch": 4.799074746008708, "grad_norm": 1.3359375, "learning_rate": 0.00029252587982832225, "loss": 4.8567, "mean_token_accuracy": 0.23180412948131562, "num_tokens": 109808501.0, "step": 52905 }, { "entropy": 5.624536037445068, "epoch": 4.7995283018867925, "grad_norm": 1.4609375, "learning_rate": 0.0002924936215346117, "loss": 4.8406, "mean_token_accuracy": 0.23255689591169357, "num_tokens": 109818847.0, "step": 52910 }, { "entropy": 5.6615558624267575, "epoch": 4.799981857764877, "grad_norm": 1.3671875, "learning_rate": 0.00029246136287912865, "loss": 4.9187, "mean_token_accuracy": 0.22287191152572633, "num_tokens": 109830017.0, "step": 52915 }, { "entropy": 5.6327965259552, "epoch": 4.800435413642961, "grad_norm": 1.359375, "learning_rate": 0.0002924291038625402, "loss": 4.8718, "mean_token_accuracy": 0.22852483689785003, "num_tokens": 109839795.0, "step": 52920 }, { "entropy": 5.659586000442505, "epoch": 4.800888969521045, "grad_norm": 1.328125, "learning_rate": 0.00029239684448551336, "loss": 4.82, "mean_token_accuracy": 0.23215188831090927, "num_tokens": 109850202.0, "step": 52925 }, { "entropy": 5.627269077301025, "epoch": 4.8013425253991295, "grad_norm": 1.4375, "learning_rate": 0.0002923645847487153, "loss": 4.8792, "mean_token_accuracy": 0.22786654978990556, "num_tokens": 109860625.0, "step": 52930 }, { "entropy": 5.652566432952881, "epoch": 4.801796081277214, "grad_norm": 1.28125, "learning_rate": 0.0002923323246528133, "loss": 4.8424, "mean_token_accuracy": 0.23703712821006775, "num_tokens": 109871241.0, "step": 52935 }, { "entropy": 5.67678804397583, "epoch": 4.802249637155297, "grad_norm": 1.34375, "learning_rate": 0.00029230006419847434, "loss": 4.9048, "mean_token_accuracy": 0.22326949387788772, "num_tokens": 109881627.0, "step": 52940 }, { "entropy": 5.680752754211426, "epoch": 4.8027031930333814, "grad_norm": 1.28125, "learning_rate": 0.0002922678033863656, "loss": 4.9111, "mean_token_accuracy": 0.22708907276391982, "num_tokens": 109893247.0, "step": 52945 }, { "entropy": 5.6523042678833, "epoch": 4.803156748911466, "grad_norm": 1.1953125, "learning_rate": 0.0002922355422171544, "loss": 4.8802, "mean_token_accuracy": 0.22537523806095122, "num_tokens": 109904112.0, "step": 52950 }, { "entropy": 5.628271102905273, "epoch": 4.80361030478955, "grad_norm": 1.4296875, "learning_rate": 0.00029220328069150774, "loss": 4.7525, "mean_token_accuracy": 0.23634327650070192, "num_tokens": 109913854.0, "step": 52955 }, { "entropy": 5.724130582809448, "epoch": 4.804063860667634, "grad_norm": 1.4140625, "learning_rate": 0.00029217101881009284, "loss": 4.9162, "mean_token_accuracy": 0.2245335251092911, "num_tokens": 109923947.0, "step": 52960 }, { "entropy": 5.647067928314209, "epoch": 4.8045174165457185, "grad_norm": 1.3515625, "learning_rate": 0.0002921387565735769, "loss": 4.8456, "mean_token_accuracy": 0.22952244579792022, "num_tokens": 109934590.0, "step": 52965 }, { "entropy": 5.656402206420898, "epoch": 4.804970972423803, "grad_norm": 1.3203125, "learning_rate": 0.0002921064939826272, "loss": 4.8853, "mean_token_accuracy": 0.2241079479455948, "num_tokens": 109944224.0, "step": 52970 }, { "entropy": 5.651070690155029, "epoch": 4.805424528301887, "grad_norm": 1.3125, "learning_rate": 0.0002920742310379108, "loss": 4.8995, "mean_token_accuracy": 0.22470937222242354, "num_tokens": 109954414.0, "step": 52975 }, { "entropy": 5.716910934448242, "epoch": 4.805878084179971, "grad_norm": 1.3359375, "learning_rate": 0.00029204196774009476, "loss": 4.9036, "mean_token_accuracy": 0.22939649522304534, "num_tokens": 109964304.0, "step": 52980 }, { "entropy": 5.694309234619141, "epoch": 4.806331640058055, "grad_norm": 1.296875, "learning_rate": 0.00029200970408984673, "loss": 4.9587, "mean_token_accuracy": 0.21731321960687638, "num_tokens": 109975401.0, "step": 52985 }, { "entropy": 5.710887670516968, "epoch": 4.806785195936139, "grad_norm": 1.3515625, "learning_rate": 0.0002919774400878336, "loss": 4.9189, "mean_token_accuracy": 0.22552456557750702, "num_tokens": 109985964.0, "step": 52990 }, { "entropy": 5.718891954421997, "epoch": 4.807238751814223, "grad_norm": 1.3515625, "learning_rate": 0.0002919451757347226, "loss": 4.9139, "mean_token_accuracy": 0.22393586188554765, "num_tokens": 109995476.0, "step": 52995 }, { "entropy": 5.668258762359619, "epoch": 4.8076923076923075, "grad_norm": 1.46875, "learning_rate": 0.0002919129110311812, "loss": 4.7986, "mean_token_accuracy": 0.23034249395132064, "num_tokens": 110005238.0, "step": 53000 }, { "entropy": 5.672264099121094, "epoch": 4.808145863570392, "grad_norm": 1.3671875, "learning_rate": 0.0002918806459778764, "loss": 4.954, "mean_token_accuracy": 0.2096040815114975, "num_tokens": 110016120.0, "step": 53005 }, { "entropy": 5.653968715667725, "epoch": 4.808599419448476, "grad_norm": 1.3515625, "learning_rate": 0.0002918483805754756, "loss": 4.8566, "mean_token_accuracy": 0.22260472625494004, "num_tokens": 110026739.0, "step": 53010 }, { "entropy": 5.735321283340454, "epoch": 4.80905297532656, "grad_norm": 1.4921875, "learning_rate": 0.0002918161148246459, "loss": 4.9588, "mean_token_accuracy": 0.22493019551038743, "num_tokens": 110037491.0, "step": 53015 }, { "entropy": 5.677459287643432, "epoch": 4.8095065312046446, "grad_norm": 1.421875, "learning_rate": 0.00029178384872605465, "loss": 4.8944, "mean_token_accuracy": 0.22524028420448303, "num_tokens": 110048550.0, "step": 53020 }, { "entropy": 5.659679794311524, "epoch": 4.809960087082729, "grad_norm": 1.390625, "learning_rate": 0.00029175158228036924, "loss": 4.875, "mean_token_accuracy": 0.2251047223806381, "num_tokens": 110058472.0, "step": 53025 }, { "entropy": 5.635154581069946, "epoch": 4.810413642960813, "grad_norm": 1.2578125, "learning_rate": 0.0002917193154882568, "loss": 4.8098, "mean_token_accuracy": 0.23143436163663864, "num_tokens": 110070766.0, "step": 53030 }, { "entropy": 5.690961742401123, "epoch": 4.810867198838897, "grad_norm": 1.265625, "learning_rate": 0.0002916870483503847, "loss": 4.8872, "mean_token_accuracy": 0.22758369892835617, "num_tokens": 110081739.0, "step": 53035 }, { "entropy": 5.661534929275513, "epoch": 4.811320754716981, "grad_norm": 1.3359375, "learning_rate": 0.00029165478086742006, "loss": 4.8568, "mean_token_accuracy": 0.22312567979097367, "num_tokens": 110091075.0, "step": 53040 }, { "entropy": 5.64955472946167, "epoch": 4.811774310595065, "grad_norm": 1.3046875, "learning_rate": 0.00029162251304003044, "loss": 4.8298, "mean_token_accuracy": 0.23109465837478638, "num_tokens": 110100530.0, "step": 53045 }, { "entropy": 5.575726413726807, "epoch": 4.812227866473149, "grad_norm": 1.3828125, "learning_rate": 0.0002915902448688829, "loss": 4.8317, "mean_token_accuracy": 0.22661267220973969, "num_tokens": 110110866.0, "step": 53050 }, { "entropy": 5.620332527160644, "epoch": 4.8126814223512335, "grad_norm": 1.328125, "learning_rate": 0.00029155797635464493, "loss": 4.8945, "mean_token_accuracy": 0.2304461568593979, "num_tokens": 110121344.0, "step": 53055 }, { "entropy": 5.579096889495849, "epoch": 4.813134978229318, "grad_norm": 1.328125, "learning_rate": 0.0002915257074979838, "loss": 4.7919, "mean_token_accuracy": 0.22958470582962037, "num_tokens": 110130529.0, "step": 53060 }, { "entropy": 5.629188013076782, "epoch": 4.813588534107402, "grad_norm": 1.328125, "learning_rate": 0.0002914934382995668, "loss": 4.8154, "mean_token_accuracy": 0.2263242557644844, "num_tokens": 110141536.0, "step": 53065 }, { "entropy": 5.69946141242981, "epoch": 4.814042089985486, "grad_norm": 1.3359375, "learning_rate": 0.0002914611687600613, "loss": 4.9144, "mean_token_accuracy": 0.22829544842243193, "num_tokens": 110152364.0, "step": 53070 }, { "entropy": 5.641432285308838, "epoch": 4.814495645863571, "grad_norm": 1.265625, "learning_rate": 0.0002914288988801347, "loss": 4.8794, "mean_token_accuracy": 0.23028891533613205, "num_tokens": 110163800.0, "step": 53075 }, { "entropy": 5.5953834533691404, "epoch": 4.814949201741655, "grad_norm": 1.453125, "learning_rate": 0.0002913966286604541, "loss": 4.7856, "mean_token_accuracy": 0.22586278468370438, "num_tokens": 110174590.0, "step": 53080 }, { "entropy": 5.676026296615601, "epoch": 4.815402757619739, "grad_norm": 1.359375, "learning_rate": 0.00029136435810168726, "loss": 4.9173, "mean_token_accuracy": 0.2233936756849289, "num_tokens": 110185142.0, "step": 53085 }, { "entropy": 5.5707542419433596, "epoch": 4.815856313497823, "grad_norm": 1.390625, "learning_rate": 0.0002913320872045012, "loss": 4.7358, "mean_token_accuracy": 0.24365141838788987, "num_tokens": 110194013.0, "step": 53090 }, { "entropy": 5.630069255828857, "epoch": 4.816309869375907, "grad_norm": 1.390625, "learning_rate": 0.00029129981596956353, "loss": 4.8225, "mean_token_accuracy": 0.23806393891572952, "num_tokens": 110204087.0, "step": 53095 }, { "entropy": 5.6932535648345945, "epoch": 4.816763425253991, "grad_norm": 1.390625, "learning_rate": 0.00029126754439754137, "loss": 4.871, "mean_token_accuracy": 0.22689005732536316, "num_tokens": 110214066.0, "step": 53100 }, { "entropy": 5.64039249420166, "epoch": 4.817216981132075, "grad_norm": 1.3828125, "learning_rate": 0.0002912352724891023, "loss": 4.8547, "mean_token_accuracy": 0.23029600977897643, "num_tokens": 110224378.0, "step": 53105 }, { "entropy": 5.601255083084107, "epoch": 4.81767053701016, "grad_norm": 1.375, "learning_rate": 0.0002912030002449137, "loss": 4.7646, "mean_token_accuracy": 0.23258891254663466, "num_tokens": 110235493.0, "step": 53110 }, { "entropy": 5.632140111923218, "epoch": 4.818124092888244, "grad_norm": 1.328125, "learning_rate": 0.00029117072766564285, "loss": 4.9245, "mean_token_accuracy": 0.21587228924036025, "num_tokens": 110246953.0, "step": 53115 }, { "entropy": 5.606414318084717, "epoch": 4.818577648766328, "grad_norm": 1.3828125, "learning_rate": 0.0002911384547519573, "loss": 4.7601, "mean_token_accuracy": 0.23433198034763336, "num_tokens": 110257387.0, "step": 53120 }, { "entropy": 5.647055053710938, "epoch": 4.819031204644412, "grad_norm": 1.359375, "learning_rate": 0.00029110618150452437, "loss": 4.8864, "mean_token_accuracy": 0.22693479657173157, "num_tokens": 110268152.0, "step": 53125 }, { "entropy": 5.675388526916504, "epoch": 4.819484760522497, "grad_norm": 1.5078125, "learning_rate": 0.00029107390792401145, "loss": 4.8796, "mean_token_accuracy": 0.22676258981227876, "num_tokens": 110277933.0, "step": 53130 }, { "entropy": 5.59682936668396, "epoch": 4.819938316400581, "grad_norm": 1.1953125, "learning_rate": 0.0002910416340110861, "loss": 4.7749, "mean_token_accuracy": 0.23103955239057541, "num_tokens": 110288219.0, "step": 53135 }, { "entropy": 5.64211254119873, "epoch": 4.820391872278664, "grad_norm": 1.3515625, "learning_rate": 0.0002910093597664156, "loss": 4.8665, "mean_token_accuracy": 0.2302780494093895, "num_tokens": 110299209.0, "step": 53140 }, { "entropy": 5.615989542007446, "epoch": 4.8208454281567485, "grad_norm": 1.3203125, "learning_rate": 0.0002909770851906675, "loss": 4.8562, "mean_token_accuracy": 0.2281659036874771, "num_tokens": 110309482.0, "step": 53145 }, { "entropy": 5.6454430103302, "epoch": 4.821298984034833, "grad_norm": 1.328125, "learning_rate": 0.00029094481028450926, "loss": 4.8266, "mean_token_accuracy": 0.22884132713079453, "num_tokens": 110319499.0, "step": 53150 }, { "entropy": 5.629137086868286, "epoch": 4.821752539912917, "grad_norm": 1.3984375, "learning_rate": 0.0002909125350486082, "loss": 4.7801, "mean_token_accuracy": 0.2349223241209984, "num_tokens": 110329453.0, "step": 53155 }, { "entropy": 5.605965089797974, "epoch": 4.822206095791001, "grad_norm": 1.3046875, "learning_rate": 0.0002908802594836319, "loss": 4.8969, "mean_token_accuracy": 0.22566077560186387, "num_tokens": 110339343.0, "step": 53160 }, { "entropy": 5.658988904953003, "epoch": 4.822659651669086, "grad_norm": 1.3671875, "learning_rate": 0.0002908479835902477, "loss": 4.9364, "mean_token_accuracy": 0.22918891459703444, "num_tokens": 110349101.0, "step": 53165 }, { "entropy": 5.6077546119689945, "epoch": 4.82311320754717, "grad_norm": 1.3671875, "learning_rate": 0.0002908157073691233, "loss": 4.8382, "mean_token_accuracy": 0.22752186357975007, "num_tokens": 110359377.0, "step": 53170 }, { "entropy": 5.632033443450927, "epoch": 4.823566763425254, "grad_norm": 1.3671875, "learning_rate": 0.00029078343082092594, "loss": 4.8228, "mean_token_accuracy": 0.23501441478729249, "num_tokens": 110370132.0, "step": 53175 }, { "entropy": 5.629738712310791, "epoch": 4.824020319303338, "grad_norm": 1.390625, "learning_rate": 0.00029075115394632325, "loss": 4.8531, "mean_token_accuracy": 0.22202265858650208, "num_tokens": 110381046.0, "step": 53180 }, { "entropy": 5.707213115692139, "epoch": 4.824473875181423, "grad_norm": 1.3203125, "learning_rate": 0.00029071887674598265, "loss": 4.9187, "mean_token_accuracy": 0.22030968070030213, "num_tokens": 110392309.0, "step": 53185 }, { "entropy": 5.739593172073365, "epoch": 4.824927431059507, "grad_norm": 1.2734375, "learning_rate": 0.0002906865992205717, "loss": 4.9803, "mean_token_accuracy": 0.2210324689745903, "num_tokens": 110402464.0, "step": 53190 }, { "entropy": 5.5837983131408695, "epoch": 4.82538098693759, "grad_norm": 1.3125, "learning_rate": 0.0002906543213707579, "loss": 4.7567, "mean_token_accuracy": 0.23068068027496338, "num_tokens": 110412272.0, "step": 53195 }, { "entropy": 5.62268443107605, "epoch": 4.825834542815675, "grad_norm": 1.21875, "learning_rate": 0.00029062204319720865, "loss": 4.8498, "mean_token_accuracy": 0.2244965136051178, "num_tokens": 110423425.0, "step": 53200 }, { "entropy": 5.624871110916137, "epoch": 4.826288098693759, "grad_norm": 1.296875, "learning_rate": 0.0002905897647005917, "loss": 4.8744, "mean_token_accuracy": 0.2204594284296036, "num_tokens": 110434469.0, "step": 53205 }, { "entropy": 5.633252859115601, "epoch": 4.826741654571843, "grad_norm": 1.3984375, "learning_rate": 0.0002905574858815744, "loss": 4.8281, "mean_token_accuracy": 0.23326743841171266, "num_tokens": 110443777.0, "step": 53210 }, { "entropy": 5.653081798553467, "epoch": 4.827195210449927, "grad_norm": 1.265625, "learning_rate": 0.0002905252067408242, "loss": 4.8876, "mean_token_accuracy": 0.214824116230011, "num_tokens": 110454481.0, "step": 53215 }, { "entropy": 5.662503099441528, "epoch": 4.827648766328012, "grad_norm": 1.40625, "learning_rate": 0.0002904929272790089, "loss": 4.9456, "mean_token_accuracy": 0.22359896898269654, "num_tokens": 110464789.0, "step": 53220 }, { "entropy": 5.578028202056885, "epoch": 4.828102322206096, "grad_norm": 1.3984375, "learning_rate": 0.0002904606474967959, "loss": 4.7404, "mean_token_accuracy": 0.2374787762761116, "num_tokens": 110474276.0, "step": 53225 }, { "entropy": 5.672610330581665, "epoch": 4.82855587808418, "grad_norm": 1.28125, "learning_rate": 0.00029042836739485273, "loss": 4.9467, "mean_token_accuracy": 0.225629061460495, "num_tokens": 110486193.0, "step": 53230 }, { "entropy": 5.68757586479187, "epoch": 4.8290094339622645, "grad_norm": 1.234375, "learning_rate": 0.000290396086973847, "loss": 4.8749, "mean_token_accuracy": 0.23025979697704316, "num_tokens": 110496619.0, "step": 53235 }, { "entropy": 5.650324487686158, "epoch": 4.829462989840349, "grad_norm": 1.203125, "learning_rate": 0.00029036380623444636, "loss": 4.8735, "mean_token_accuracy": 0.22178814560174942, "num_tokens": 110507103.0, "step": 53240 }, { "entropy": 5.668415975570679, "epoch": 4.829916545718433, "grad_norm": 1.3046875, "learning_rate": 0.0002903315251773182, "loss": 4.8656, "mean_token_accuracy": 0.22661312222480773, "num_tokens": 110516855.0, "step": 53245 }, { "entropy": 5.644951009750367, "epoch": 4.830370101596516, "grad_norm": 1.4296875, "learning_rate": 0.00029029924380313024, "loss": 4.8484, "mean_token_accuracy": 0.23292219787836074, "num_tokens": 110526220.0, "step": 53250 }, { "entropy": 5.662230443954468, "epoch": 4.830823657474601, "grad_norm": 1.3125, "learning_rate": 0.00029026696211255, "loss": 4.9159, "mean_token_accuracy": 0.2226686730980873, "num_tokens": 110537029.0, "step": 53255 }, { "entropy": 5.680279779434204, "epoch": 4.831277213352685, "grad_norm": 1.421875, "learning_rate": 0.00029023468010624503, "loss": 4.8457, "mean_token_accuracy": 0.22495268583297728, "num_tokens": 110548334.0, "step": 53260 }, { "entropy": 5.670314931869507, "epoch": 4.831730769230769, "grad_norm": 1.4453125, "learning_rate": 0.00029020239778488303, "loss": 4.8948, "mean_token_accuracy": 0.23200928568840026, "num_tokens": 110557999.0, "step": 53265 }, { "entropy": 5.634663105010986, "epoch": 4.832184325108853, "grad_norm": 1.4375, "learning_rate": 0.0002901701151491316, "loss": 4.9828, "mean_token_accuracy": 0.21856084913015367, "num_tokens": 110568743.0, "step": 53270 }, { "entropy": 5.664666318893433, "epoch": 4.832637880986938, "grad_norm": 1.453125, "learning_rate": 0.00029013783219965835, "loss": 4.8804, "mean_token_accuracy": 0.2312145173549652, "num_tokens": 110578961.0, "step": 53275 }, { "entropy": 5.705579662322998, "epoch": 4.833091436865022, "grad_norm": 1.3515625, "learning_rate": 0.00029010554893713086, "loss": 4.9235, "mean_token_accuracy": 0.2212559312582016, "num_tokens": 110590496.0, "step": 53280 }, { "entropy": 5.736619758605957, "epoch": 4.833544992743106, "grad_norm": 1.4375, "learning_rate": 0.0002900732653622167, "loss": 4.8561, "mean_token_accuracy": 0.23212044835090637, "num_tokens": 110601018.0, "step": 53285 }, { "entropy": 5.631805896759033, "epoch": 4.8339985486211905, "grad_norm": 1.2578125, "learning_rate": 0.0002900409814755836, "loss": 4.854, "mean_token_accuracy": 0.22247184067964554, "num_tokens": 110611369.0, "step": 53290 }, { "entropy": 5.643290996551514, "epoch": 4.834452104499274, "grad_norm": 1.34375, "learning_rate": 0.00029000869727789923, "loss": 4.8855, "mean_token_accuracy": 0.22937071174383164, "num_tokens": 110621223.0, "step": 53295 }, { "entropy": 5.578810214996338, "epoch": 4.834905660377358, "grad_norm": 1.4296875, "learning_rate": 0.00028997641276983107, "loss": 4.7975, "mean_token_accuracy": 0.23001529574394225, "num_tokens": 110631033.0, "step": 53300 }, { "entropy": 5.6046302318573, "epoch": 4.835359216255442, "grad_norm": 1.28125, "learning_rate": 0.00028994412795204695, "loss": 4.8408, "mean_token_accuracy": 0.22722357511520386, "num_tokens": 110642368.0, "step": 53305 }, { "entropy": 5.6320836544036865, "epoch": 4.835812772133527, "grad_norm": 1.28125, "learning_rate": 0.0002899118428252144, "loss": 4.8912, "mean_token_accuracy": 0.22379519492387773, "num_tokens": 110653317.0, "step": 53310 }, { "entropy": 5.6341780662536625, "epoch": 4.836266328011611, "grad_norm": 1.515625, "learning_rate": 0.00028987955739000123, "loss": 4.8637, "mean_token_accuracy": 0.22359674721956252, "num_tokens": 110663143.0, "step": 53315 }, { "entropy": 5.6660521030426025, "epoch": 4.836719883889695, "grad_norm": 1.296875, "learning_rate": 0.000289847271647075, "loss": 4.8869, "mean_token_accuracy": 0.23104428499937057, "num_tokens": 110673383.0, "step": 53320 }, { "entropy": 5.654747581481933, "epoch": 4.8371734397677795, "grad_norm": 1.3671875, "learning_rate": 0.0002898149855971034, "loss": 4.8092, "mean_token_accuracy": 0.22666301280260087, "num_tokens": 110683576.0, "step": 53325 }, { "entropy": 5.622866678237915, "epoch": 4.837626995645864, "grad_norm": 1.1484375, "learning_rate": 0.00028978269924075404, "loss": 4.8106, "mean_token_accuracy": 0.23146373629570008, "num_tokens": 110693986.0, "step": 53330 }, { "entropy": 5.608734178543091, "epoch": 4.838080551523948, "grad_norm": 1.390625, "learning_rate": 0.0002897504125786948, "loss": 4.8161, "mean_token_accuracy": 0.2283170700073242, "num_tokens": 110703724.0, "step": 53335 }, { "entropy": 5.605955123901367, "epoch": 4.838534107402032, "grad_norm": 1.3359375, "learning_rate": 0.00028971812561159324, "loss": 4.8861, "mean_token_accuracy": 0.22396186292171477, "num_tokens": 110714251.0, "step": 53340 }, { "entropy": 5.654089164733887, "epoch": 4.8389876632801165, "grad_norm": 1.4921875, "learning_rate": 0.00028968583834011714, "loss": 4.9075, "mean_token_accuracy": 0.21755824238061905, "num_tokens": 110724011.0, "step": 53345 }, { "entropy": 5.68786301612854, "epoch": 4.8394412191582, "grad_norm": 1.3984375, "learning_rate": 0.00028965355076493405, "loss": 4.8739, "mean_token_accuracy": 0.22417781949043275, "num_tokens": 110733627.0, "step": 53350 }, { "entropy": 5.690388917922974, "epoch": 4.839894775036284, "grad_norm": 1.3046875, "learning_rate": 0.0002896212628867118, "loss": 4.8746, "mean_token_accuracy": 0.221796652674675, "num_tokens": 110744514.0, "step": 53355 }, { "entropy": 5.744256544113159, "epoch": 4.8403483309143684, "grad_norm": 1.28125, "learning_rate": 0.00028958897470611825, "loss": 4.9247, "mean_token_accuracy": 0.2280839651823044, "num_tokens": 110754257.0, "step": 53360 }, { "entropy": 5.6345189094543455, "epoch": 4.840801886792453, "grad_norm": 1.34375, "learning_rate": 0.0002895566862238208, "loss": 4.831, "mean_token_accuracy": 0.22824896425008773, "num_tokens": 110764383.0, "step": 53365 }, { "entropy": 5.709937667846679, "epoch": 4.841255442670537, "grad_norm": 1.3828125, "learning_rate": 0.0002895243974404875, "loss": 4.9223, "mean_token_accuracy": 0.2222899913787842, "num_tokens": 110775006.0, "step": 53370 }, { "entropy": 5.695196342468262, "epoch": 4.841708998548621, "grad_norm": 1.328125, "learning_rate": 0.0002894921083567859, "loss": 4.8837, "mean_token_accuracy": 0.2254146322607994, "num_tokens": 110784764.0, "step": 53375 }, { "entropy": 5.669567394256592, "epoch": 4.8421625544267055, "grad_norm": 1.3046875, "learning_rate": 0.0002894598189733838, "loss": 4.8555, "mean_token_accuracy": 0.23375797569751738, "num_tokens": 110794942.0, "step": 53380 }, { "entropy": 5.611394691467285, "epoch": 4.84261611030479, "grad_norm": 1.3203125, "learning_rate": 0.000289427529290949, "loss": 4.7969, "mean_token_accuracy": 0.23847442865371704, "num_tokens": 110804696.0, "step": 53385 }, { "entropy": 5.56563138961792, "epoch": 4.843069666182874, "grad_norm": 1.4296875, "learning_rate": 0.00028939523931014924, "loss": 4.766, "mean_token_accuracy": 0.23961413353681565, "num_tokens": 110814867.0, "step": 53390 }, { "entropy": 5.6385478496551515, "epoch": 4.843523222060957, "grad_norm": 1.296875, "learning_rate": 0.00028936294903165224, "loss": 4.8406, "mean_token_accuracy": 0.22437868118286133, "num_tokens": 110824738.0, "step": 53395 }, { "entropy": 5.668552875518799, "epoch": 4.843976777939043, "grad_norm": 1.375, "learning_rate": 0.0002893306584561257, "loss": 4.9159, "mean_token_accuracy": 0.2252178356051445, "num_tokens": 110834646.0, "step": 53400 }, { "entropy": 5.683118200302124, "epoch": 4.844430333817126, "grad_norm": 1.4609375, "learning_rate": 0.00028929836758423763, "loss": 4.9294, "mean_token_accuracy": 0.22451551258563995, "num_tokens": 110843907.0, "step": 53405 }, { "entropy": 5.645402336120606, "epoch": 4.84488388969521, "grad_norm": 1.359375, "learning_rate": 0.0002892660764166556, "loss": 4.8903, "mean_token_accuracy": 0.22451913207769394, "num_tokens": 110854930.0, "step": 53410 }, { "entropy": 5.597357892990113, "epoch": 4.8453374455732945, "grad_norm": 1.328125, "learning_rate": 0.00028923378495404747, "loss": 4.819, "mean_token_accuracy": 0.22951989322900773, "num_tokens": 110865256.0, "step": 53415 }, { "entropy": 5.70387716293335, "epoch": 4.845791001451379, "grad_norm": 1.3359375, "learning_rate": 0.00028920149319708105, "loss": 4.9338, "mean_token_accuracy": 0.22250669747591018, "num_tokens": 110875600.0, "step": 53420 }, { "entropy": 5.739201879501342, "epoch": 4.846244557329463, "grad_norm": 1.3125, "learning_rate": 0.00028916920114642415, "loss": 4.9847, "mean_token_accuracy": 0.22582444697618484, "num_tokens": 110886856.0, "step": 53425 }, { "entropy": 5.69910306930542, "epoch": 4.846698113207547, "grad_norm": 1.3125, "learning_rate": 0.00028913690880274454, "loss": 4.8854, "mean_token_accuracy": 0.23255734145641327, "num_tokens": 110896908.0, "step": 53430 }, { "entropy": 5.662793827056885, "epoch": 4.8471516690856316, "grad_norm": 1.234375, "learning_rate": 0.00028910461616671004, "loss": 4.8434, "mean_token_accuracy": 0.23335074186325072, "num_tokens": 110908987.0, "step": 53435 }, { "entropy": 5.6475951194763185, "epoch": 4.847605224963716, "grad_norm": 1.359375, "learning_rate": 0.00028907232323898855, "loss": 4.8137, "mean_token_accuracy": 0.23138083666563034, "num_tokens": 110920036.0, "step": 53440 }, { "entropy": 5.674916696548462, "epoch": 4.8480587808418, "grad_norm": 1.3828125, "learning_rate": 0.00028904003002024775, "loss": 4.9264, "mean_token_accuracy": 0.22258280813694, "num_tokens": 110931170.0, "step": 53445 }, { "entropy": 5.698870468139648, "epoch": 4.8485123367198835, "grad_norm": 1.2421875, "learning_rate": 0.0002890077365111556, "loss": 4.9011, "mean_token_accuracy": 0.2184234470129013, "num_tokens": 110942698.0, "step": 53450 }, { "entropy": 5.693228721618652, "epoch": 4.848965892597968, "grad_norm": 1.265625, "learning_rate": 0.00028897544271237985, "loss": 4.8929, "mean_token_accuracy": 0.22374559938907623, "num_tokens": 110953400.0, "step": 53455 }, { "entropy": 5.699455738067627, "epoch": 4.849419448476052, "grad_norm": 1.3984375, "learning_rate": 0.00028894314862458844, "loss": 4.8808, "mean_token_accuracy": 0.2258833661675453, "num_tokens": 110963792.0, "step": 53460 }, { "entropy": 5.681771612167358, "epoch": 4.849873004354136, "grad_norm": 1.3828125, "learning_rate": 0.00028891085424844913, "loss": 4.8587, "mean_token_accuracy": 0.22460289746522905, "num_tokens": 110973636.0, "step": 53465 }, { "entropy": 5.630780982971191, "epoch": 4.8503265602322205, "grad_norm": 1.46875, "learning_rate": 0.0002888785595846298, "loss": 4.8782, "mean_token_accuracy": 0.23026085495948792, "num_tokens": 110983163.0, "step": 53470 }, { "entropy": 5.642491054534912, "epoch": 4.850780116110305, "grad_norm": 1.296875, "learning_rate": 0.0002888462646337983, "loss": 4.8386, "mean_token_accuracy": 0.22442800998687745, "num_tokens": 110993344.0, "step": 53475 }, { "entropy": 5.685483407974243, "epoch": 4.851233671988389, "grad_norm": 1.328125, "learning_rate": 0.00028881396939662256, "loss": 4.8829, "mean_token_accuracy": 0.2227097272872925, "num_tokens": 111004380.0, "step": 53480 }, { "entropy": 5.679120683670044, "epoch": 4.851687227866473, "grad_norm": 1.3828125, "learning_rate": 0.0002887816738737704, "loss": 4.8254, "mean_token_accuracy": 0.23204307109117508, "num_tokens": 111015661.0, "step": 53485 }, { "entropy": 5.6261943817138675, "epoch": 4.852140783744558, "grad_norm": 1.25, "learning_rate": 0.0002887493780659097, "loss": 4.8347, "mean_token_accuracy": 0.2298179194331169, "num_tokens": 111026496.0, "step": 53490 }, { "entropy": 5.590049123764038, "epoch": 4.852594339622642, "grad_norm": 1.3203125, "learning_rate": 0.00028871708197370844, "loss": 4.7986, "mean_token_accuracy": 0.22922968715429307, "num_tokens": 111036356.0, "step": 53495 }, { "entropy": 5.650780582427979, "epoch": 4.853047895500726, "grad_norm": 1.4140625, "learning_rate": 0.00028868478559783433, "loss": 4.9462, "mean_token_accuracy": 0.2245974138379097, "num_tokens": 111045967.0, "step": 53500 }, { "entropy": 5.665289688110351, "epoch": 4.8535014513788095, "grad_norm": 1.4140625, "learning_rate": 0.00028865248893895543, "loss": 4.862, "mean_token_accuracy": 0.22514557093381882, "num_tokens": 111056459.0, "step": 53505 }, { "entropy": 5.640075063705444, "epoch": 4.853955007256894, "grad_norm": 1.46875, "learning_rate": 0.00028862019199773955, "loss": 4.8011, "mean_token_accuracy": 0.22611933648586274, "num_tokens": 111065901.0, "step": 53510 }, { "entropy": 5.612060165405273, "epoch": 4.854408563134978, "grad_norm": 1.359375, "learning_rate": 0.0002885878947748546, "loss": 4.8423, "mean_token_accuracy": 0.22793640494346618, "num_tokens": 111075721.0, "step": 53515 }, { "entropy": 5.608594131469727, "epoch": 4.854862119013062, "grad_norm": 1.1953125, "learning_rate": 0.00028855559727096854, "loss": 4.8365, "mean_token_accuracy": 0.23345322608947755, "num_tokens": 111086453.0, "step": 53520 }, { "entropy": 5.657582759857178, "epoch": 4.855315674891147, "grad_norm": 1.21875, "learning_rate": 0.00028852329948674926, "loss": 4.9322, "mean_token_accuracy": 0.21954546570777894, "num_tokens": 111099130.0, "step": 53525 }, { "entropy": 5.619465255737305, "epoch": 4.855769230769231, "grad_norm": 1.515625, "learning_rate": 0.0002884910014228648, "loss": 4.8237, "mean_token_accuracy": 0.23293367177248, "num_tokens": 111108304.0, "step": 53530 }, { "entropy": 5.685942316055298, "epoch": 4.856222786647315, "grad_norm": 1.2890625, "learning_rate": 0.0002884587030799829, "loss": 4.817, "mean_token_accuracy": 0.22885674387216567, "num_tokens": 111118369.0, "step": 53535 }, { "entropy": 5.609336519241333, "epoch": 4.856676342525399, "grad_norm": 1.5703125, "learning_rate": 0.00028842640445877153, "loss": 4.8673, "mean_token_accuracy": 0.2258546084165573, "num_tokens": 111128550.0, "step": 53540 }, { "entropy": 5.712727737426758, "epoch": 4.857129898403484, "grad_norm": 1.2578125, "learning_rate": 0.00028839410555989885, "loss": 4.961, "mean_token_accuracy": 0.215118145942688, "num_tokens": 111140824.0, "step": 53545 }, { "entropy": 5.641538810729981, "epoch": 4.857583454281567, "grad_norm": 1.3046875, "learning_rate": 0.00028836180638403257, "loss": 4.8538, "mean_token_accuracy": 0.21999497413635255, "num_tokens": 111152241.0, "step": 53550 }, { "entropy": 5.675179672241211, "epoch": 4.858037010159651, "grad_norm": 1.3359375, "learning_rate": 0.0002883295069318407, "loss": 4.92, "mean_token_accuracy": 0.22193428874015808, "num_tokens": 111161897.0, "step": 53555 }, { "entropy": 5.676577758789063, "epoch": 4.8584905660377355, "grad_norm": 1.359375, "learning_rate": 0.0002882972072039914, "loss": 4.856, "mean_token_accuracy": 0.22808670848608018, "num_tokens": 111172586.0, "step": 53560 }, { "entropy": 5.69434962272644, "epoch": 4.85894412191582, "grad_norm": 1.3359375, "learning_rate": 0.00028826490720115224, "loss": 4.9773, "mean_token_accuracy": 0.21963163912296296, "num_tokens": 111182734.0, "step": 53565 }, { "entropy": 5.586197423934936, "epoch": 4.859397677793904, "grad_norm": 1.3515625, "learning_rate": 0.00028823260692399156, "loss": 4.7656, "mean_token_accuracy": 0.2346462905406952, "num_tokens": 111193551.0, "step": 53570 }, { "entropy": 5.629780721664429, "epoch": 4.859851233671988, "grad_norm": 1.3828125, "learning_rate": 0.0002882003063731771, "loss": 4.8455, "mean_token_accuracy": 0.23312482982873917, "num_tokens": 111202604.0, "step": 53575 }, { "entropy": 5.60758867263794, "epoch": 4.860304789550073, "grad_norm": 1.2734375, "learning_rate": 0.00028816800554937703, "loss": 4.8317, "mean_token_accuracy": 0.23280305713415145, "num_tokens": 111213675.0, "step": 53580 }, { "entropy": 5.7010571479797365, "epoch": 4.860758345428157, "grad_norm": 1.4296875, "learning_rate": 0.00028813570445325915, "loss": 4.8162, "mean_token_accuracy": 0.23637080788612366, "num_tokens": 111223354.0, "step": 53585 }, { "entropy": 5.664448404312134, "epoch": 4.861211901306241, "grad_norm": 1.359375, "learning_rate": 0.00028810340308549164, "loss": 4.7789, "mean_token_accuracy": 0.23842962086200714, "num_tokens": 111232865.0, "step": 53590 }, { "entropy": 5.580556964874267, "epoch": 4.861665457184325, "grad_norm": 1.3515625, "learning_rate": 0.00028807110144674243, "loss": 4.8342, "mean_token_accuracy": 0.2297973409295082, "num_tokens": 111242924.0, "step": 53595 }, { "entropy": 5.619889211654663, "epoch": 4.86211901306241, "grad_norm": 1.3203125, "learning_rate": 0.0002880387995376794, "loss": 4.79, "mean_token_accuracy": 0.23052696734666825, "num_tokens": 111252921.0, "step": 53600 }, { "entropy": 5.664149570465088, "epoch": 4.862572568940493, "grad_norm": 1.3984375, "learning_rate": 0.0002880064973589708, "loss": 4.8987, "mean_token_accuracy": 0.22271490693092347, "num_tokens": 111263176.0, "step": 53605 }, { "entropy": 5.661705493927002, "epoch": 4.863026124818577, "grad_norm": 1.3125, "learning_rate": 0.00028797419491128446, "loss": 4.8803, "mean_token_accuracy": 0.22154775261878967, "num_tokens": 111273043.0, "step": 53610 }, { "entropy": 5.66186752319336, "epoch": 4.863479680696662, "grad_norm": 1.4296875, "learning_rate": 0.00028794189219528846, "loss": 4.8243, "mean_token_accuracy": 0.22848019003868103, "num_tokens": 111282720.0, "step": 53615 }, { "entropy": 5.560529899597168, "epoch": 4.863933236574746, "grad_norm": 1.3125, "learning_rate": 0.00028790958921165086, "loss": 4.8601, "mean_token_accuracy": 0.21905989348888397, "num_tokens": 111293946.0, "step": 53620 }, { "entropy": 5.6806902408599855, "epoch": 4.86438679245283, "grad_norm": 1.25, "learning_rate": 0.0002878772859610396, "loss": 4.9235, "mean_token_accuracy": 0.21922473907470702, "num_tokens": 111305052.0, "step": 53625 }, { "entropy": 5.7242518901824955, "epoch": 4.864840348330914, "grad_norm": 1.421875, "learning_rate": 0.00028784498244412284, "loss": 4.8511, "mean_token_accuracy": 0.22676833868026733, "num_tokens": 111314216.0, "step": 53630 }, { "entropy": 5.644245386123657, "epoch": 4.865293904208999, "grad_norm": 1.3046875, "learning_rate": 0.00028781267866156854, "loss": 4.8221, "mean_token_accuracy": 0.2293958067893982, "num_tokens": 111324939.0, "step": 53635 }, { "entropy": 5.676898956298828, "epoch": 4.865747460087083, "grad_norm": 1.390625, "learning_rate": 0.00028778037461404477, "loss": 4.8591, "mean_token_accuracy": 0.2203165650367737, "num_tokens": 111334908.0, "step": 53640 }, { "entropy": 5.595578622817993, "epoch": 4.866201015965167, "grad_norm": 1.359375, "learning_rate": 0.00028774807030221966, "loss": 4.8654, "mean_token_accuracy": 0.22695845514535903, "num_tokens": 111345560.0, "step": 53645 }, { "entropy": 5.609410619735717, "epoch": 4.8666545718432515, "grad_norm": 1.2734375, "learning_rate": 0.0002877157657267611, "loss": 4.8004, "mean_token_accuracy": 0.23474580496549607, "num_tokens": 111355955.0, "step": 53650 }, { "entropy": 5.7086262702941895, "epoch": 4.867108127721336, "grad_norm": 1.359375, "learning_rate": 0.00028768346088833737, "loss": 4.943, "mean_token_accuracy": 0.22919799238443375, "num_tokens": 111365567.0, "step": 53655 }, { "entropy": 5.5942497730255125, "epoch": 4.867561683599419, "grad_norm": 1.4140625, "learning_rate": 0.0002876511557876164, "loss": 4.7982, "mean_token_accuracy": 0.23076252192258834, "num_tokens": 111375740.0, "step": 53660 }, { "entropy": 5.624006175994873, "epoch": 4.868015239477503, "grad_norm": 1.3359375, "learning_rate": 0.00028761885042526635, "loss": 4.8565, "mean_token_accuracy": 0.22788144201040267, "num_tokens": 111385593.0, "step": 53665 }, { "entropy": 5.691855001449585, "epoch": 4.868468795355588, "grad_norm": 1.46875, "learning_rate": 0.00028758654480195517, "loss": 4.9312, "mean_token_accuracy": 0.21506067365407944, "num_tokens": 111395731.0, "step": 53670 }, { "entropy": 5.70223708152771, "epoch": 4.868922351233672, "grad_norm": 1.3828125, "learning_rate": 0.0002875542389183511, "loss": 4.8385, "mean_token_accuracy": 0.23649916648864747, "num_tokens": 111406140.0, "step": 53675 }, { "entropy": 5.67141375541687, "epoch": 4.869375907111756, "grad_norm": 1.375, "learning_rate": 0.00028752193277512217, "loss": 4.8837, "mean_token_accuracy": 0.22787901312112807, "num_tokens": 111416853.0, "step": 53680 }, { "entropy": 5.623068809509277, "epoch": 4.86982946298984, "grad_norm": 1.3359375, "learning_rate": 0.0002874896263729364, "loss": 4.8326, "mean_token_accuracy": 0.22982754409313202, "num_tokens": 111427043.0, "step": 53685 }, { "entropy": 5.734610271453858, "epoch": 4.870283018867925, "grad_norm": 1.4921875, "learning_rate": 0.0002874573197124621, "loss": 4.9145, "mean_token_accuracy": 0.22058325558900832, "num_tokens": 111436791.0, "step": 53690 }, { "entropy": 5.615300846099854, "epoch": 4.870736574746009, "grad_norm": 1.3984375, "learning_rate": 0.0002874250127943672, "loss": 4.7994, "mean_token_accuracy": 0.23612288236618043, "num_tokens": 111446603.0, "step": 53695 }, { "entropy": 5.6245026111602785, "epoch": 4.871190130624093, "grad_norm": 1.40625, "learning_rate": 0.00028739270561931984, "loss": 4.7723, "mean_token_accuracy": 0.24160352796316148, "num_tokens": 111456942.0, "step": 53700 }, { "entropy": 5.633362865447998, "epoch": 4.871643686502177, "grad_norm": 1.34375, "learning_rate": 0.00028736039818798813, "loss": 4.863, "mean_token_accuracy": 0.22618399560451508, "num_tokens": 111467671.0, "step": 53705 }, { "entropy": 5.6662682056427, "epoch": 4.872097242380261, "grad_norm": 1.578125, "learning_rate": 0.0002873280905010403, "loss": 4.9423, "mean_token_accuracy": 0.22038195580244063, "num_tokens": 111476495.0, "step": 53710 }, { "entropy": 5.606502056121826, "epoch": 4.872550798258345, "grad_norm": 1.375, "learning_rate": 0.00028729578255914446, "loss": 4.7263, "mean_token_accuracy": 0.24102134853601456, "num_tokens": 111487491.0, "step": 53715 }, { "entropy": 5.629835605621338, "epoch": 4.873004354136429, "grad_norm": 1.296875, "learning_rate": 0.0002872634743629686, "loss": 4.7942, "mean_token_accuracy": 0.22751702219247819, "num_tokens": 111497970.0, "step": 53720 }, { "entropy": 5.653442001342773, "epoch": 4.873457910014514, "grad_norm": 1.25, "learning_rate": 0.000287231165913181, "loss": 4.878, "mean_token_accuracy": 0.22399977147579192, "num_tokens": 111507635.0, "step": 53725 }, { "entropy": 5.607708263397217, "epoch": 4.873911465892598, "grad_norm": 1.40625, "learning_rate": 0.0002871988572104498, "loss": 4.8338, "mean_token_accuracy": 0.2302190124988556, "num_tokens": 111516751.0, "step": 53730 }, { "entropy": 5.629733562469482, "epoch": 4.874365021770682, "grad_norm": 1.28125, "learning_rate": 0.00028716654825544316, "loss": 4.8667, "mean_token_accuracy": 0.22682311087846757, "num_tokens": 111527748.0, "step": 53735 }, { "entropy": 5.671847105026245, "epoch": 4.8748185776487665, "grad_norm": 1.2890625, "learning_rate": 0.0002871342390488291, "loss": 4.8635, "mean_token_accuracy": 0.22485494762659072, "num_tokens": 111537718.0, "step": 53740 }, { "entropy": 5.574645090103149, "epoch": 4.875272133526851, "grad_norm": 1.375, "learning_rate": 0.00028710192959127597, "loss": 4.738, "mean_token_accuracy": 0.2382654994726181, "num_tokens": 111546631.0, "step": 53745 }, { "entropy": 5.654329633712768, "epoch": 4.875725689404935, "grad_norm": 1.3828125, "learning_rate": 0.0002870696198834518, "loss": 4.836, "mean_token_accuracy": 0.2285819411277771, "num_tokens": 111557276.0, "step": 53750 }, { "entropy": 5.643083333969116, "epoch": 4.876179245283019, "grad_norm": 1.2265625, "learning_rate": 0.00028703730992602486, "loss": 4.8454, "mean_token_accuracy": 0.23144342750310898, "num_tokens": 111567146.0, "step": 53755 }, { "entropy": 5.668443632125855, "epoch": 4.876632801161103, "grad_norm": 1.3359375, "learning_rate": 0.00028700499971966327, "loss": 4.9491, "mean_token_accuracy": 0.2191551461815834, "num_tokens": 111576887.0, "step": 53760 }, { "entropy": 5.678356742858886, "epoch": 4.877086357039187, "grad_norm": 1.4609375, "learning_rate": 0.00028697268926503527, "loss": 4.8889, "mean_token_accuracy": 0.22250308394432067, "num_tokens": 111588212.0, "step": 53765 }, { "entropy": 5.66697325706482, "epoch": 4.877539912917271, "grad_norm": 1.40625, "learning_rate": 0.00028694037856280894, "loss": 4.8627, "mean_token_accuracy": 0.22134220898151397, "num_tokens": 111598308.0, "step": 53770 }, { "entropy": 5.704410457611084, "epoch": 4.8779934687953554, "grad_norm": 1.3515625, "learning_rate": 0.0002869080676136525, "loss": 4.9024, "mean_token_accuracy": 0.22673436105251313, "num_tokens": 111608252.0, "step": 53775 }, { "entropy": 5.655329608917237, "epoch": 4.87844702467344, "grad_norm": 1.34375, "learning_rate": 0.0002868757564182343, "loss": 4.8864, "mean_token_accuracy": 0.22151461094617844, "num_tokens": 111619555.0, "step": 53780 }, { "entropy": 5.5927958488464355, "epoch": 4.878900580551524, "grad_norm": 1.3515625, "learning_rate": 0.0002868434449772223, "loss": 4.814, "mean_token_accuracy": 0.2296259507536888, "num_tokens": 111629578.0, "step": 53785 }, { "entropy": 5.664986181259155, "epoch": 4.879354136429608, "grad_norm": 1.359375, "learning_rate": 0.0002868111332912849, "loss": 4.8682, "mean_token_accuracy": 0.22563903629779816, "num_tokens": 111639389.0, "step": 53790 }, { "entropy": 5.737447500228882, "epoch": 4.8798076923076925, "grad_norm": 1.375, "learning_rate": 0.0002867788213610903, "loss": 4.9323, "mean_token_accuracy": 0.22411651760339737, "num_tokens": 111649855.0, "step": 53795 }, { "entropy": 5.733330297470093, "epoch": 4.880261248185777, "grad_norm": 1.40625, "learning_rate": 0.0002867465091873066, "loss": 4.9426, "mean_token_accuracy": 0.2224299877882004, "num_tokens": 111660315.0, "step": 53800 }, { "entropy": 5.644560289382935, "epoch": 4.880714804063861, "grad_norm": 1.4296875, "learning_rate": 0.0002867141967706021, "loss": 4.901, "mean_token_accuracy": 0.22353803962469102, "num_tokens": 111669883.0, "step": 53805 }, { "entropy": 5.598710584640503, "epoch": 4.881168359941945, "grad_norm": 1.296875, "learning_rate": 0.00028668188411164506, "loss": 4.8999, "mean_token_accuracy": 0.21956893503665925, "num_tokens": 111680598.0, "step": 53810 }, { "entropy": 5.684199619293213, "epoch": 4.881621915820029, "grad_norm": 1.34375, "learning_rate": 0.00028664957121110374, "loss": 4.8619, "mean_token_accuracy": 0.2267229065299034, "num_tokens": 111689805.0, "step": 53815 }, { "entropy": 5.688586664199829, "epoch": 4.882075471698113, "grad_norm": 1.21875, "learning_rate": 0.00028661725806964624, "loss": 4.8165, "mean_token_accuracy": 0.23283295184373856, "num_tokens": 111700313.0, "step": 53820 }, { "entropy": 5.702735757827758, "epoch": 4.882529027576197, "grad_norm": 1.2578125, "learning_rate": 0.0002865849446879409, "loss": 4.8985, "mean_token_accuracy": 0.2273788720369339, "num_tokens": 111711301.0, "step": 53825 }, { "entropy": 5.629639577865601, "epoch": 4.8829825834542815, "grad_norm": 1.328125, "learning_rate": 0.0002865526310666559, "loss": 4.8226, "mean_token_accuracy": 0.2293864443898201, "num_tokens": 111720800.0, "step": 53830 }, { "entropy": 5.610587787628174, "epoch": 4.883436139332366, "grad_norm": 1.3203125, "learning_rate": 0.00028652031720645963, "loss": 4.8015, "mean_token_accuracy": 0.2298102542757988, "num_tokens": 111731665.0, "step": 53835 }, { "entropy": 5.6298058986663815, "epoch": 4.88388969521045, "grad_norm": 1.3515625, "learning_rate": 0.0002864880031080202, "loss": 4.8952, "mean_token_accuracy": 0.22697973102331162, "num_tokens": 111742149.0, "step": 53840 }, { "entropy": 5.664055109024048, "epoch": 4.884343251088534, "grad_norm": 1.25, "learning_rate": 0.00028645568877200603, "loss": 4.8289, "mean_token_accuracy": 0.23299773782491684, "num_tokens": 111753089.0, "step": 53845 }, { "entropy": 5.602269268035888, "epoch": 4.8847968069666186, "grad_norm": 1.4453125, "learning_rate": 0.0002864233741990852, "loss": 4.8088, "mean_token_accuracy": 0.23182955682277678, "num_tokens": 111762937.0, "step": 53850 }, { "entropy": 5.593773221969604, "epoch": 4.885250362844703, "grad_norm": 1.4609375, "learning_rate": 0.0002863910593899261, "loss": 4.7835, "mean_token_accuracy": 0.23938246071338654, "num_tokens": 111772920.0, "step": 53855 }, { "entropy": 5.619352960586548, "epoch": 4.885703918722786, "grad_norm": 1.3671875, "learning_rate": 0.000286358744345197, "loss": 4.8304, "mean_token_accuracy": 0.23044109493494033, "num_tokens": 111783117.0, "step": 53860 }, { "entropy": 5.6672797203063965, "epoch": 4.8861574746008705, "grad_norm": 1.2109375, "learning_rate": 0.0002863264290655662, "loss": 4.8912, "mean_token_accuracy": 0.2186119884252548, "num_tokens": 111795033.0, "step": 53865 }, { "entropy": 5.643439626693725, "epoch": 4.886611030478955, "grad_norm": 1.28125, "learning_rate": 0.00028629411355170193, "loss": 4.8455, "mean_token_accuracy": 0.22066473364830017, "num_tokens": 111805156.0, "step": 53870 }, { "entropy": 5.675177097320557, "epoch": 4.887064586357039, "grad_norm": 1.2890625, "learning_rate": 0.00028626179780427246, "loss": 4.9245, "mean_token_accuracy": 0.2216375082731247, "num_tokens": 111815363.0, "step": 53875 }, { "entropy": 5.678713941574097, "epoch": 4.887518142235123, "grad_norm": 1.71875, "learning_rate": 0.00028622948182394623, "loss": 4.9005, "mean_token_accuracy": 0.2297086462378502, "num_tokens": 111824983.0, "step": 53880 }, { "entropy": 5.6028724193573, "epoch": 4.8879716981132075, "grad_norm": 1.296875, "learning_rate": 0.00028619716561139143, "loss": 4.8609, "mean_token_accuracy": 0.22374506294727325, "num_tokens": 111836468.0, "step": 53885 }, { "entropy": 5.670812129974365, "epoch": 4.888425253991292, "grad_norm": 1.2421875, "learning_rate": 0.0002861648491672764, "loss": 4.8954, "mean_token_accuracy": 0.22587817162275314, "num_tokens": 111847659.0, "step": 53890 }, { "entropy": 5.694909477233887, "epoch": 4.888878809869376, "grad_norm": 1.34375, "learning_rate": 0.00028613253249226944, "loss": 4.9433, "mean_token_accuracy": 0.2182258978486061, "num_tokens": 111858742.0, "step": 53895 }, { "entropy": 5.675878095626831, "epoch": 4.88933236574746, "grad_norm": 1.265625, "learning_rate": 0.00028610021558703885, "loss": 4.8993, "mean_token_accuracy": 0.225470133125782, "num_tokens": 111869692.0, "step": 53900 }, { "entropy": 5.649547863006592, "epoch": 4.889785921625545, "grad_norm": 1.296875, "learning_rate": 0.00028606789845225295, "loss": 4.8567, "mean_token_accuracy": 0.2254531130194664, "num_tokens": 111880532.0, "step": 53905 }, { "entropy": 5.7409216403961185, "epoch": 4.890239477503629, "grad_norm": 1.4140625, "learning_rate": 0.00028603558108858016, "loss": 4.9356, "mean_token_accuracy": 0.22071272879838943, "num_tokens": 111891178.0, "step": 53910 }, { "entropy": 5.698775577545166, "epoch": 4.890693033381712, "grad_norm": 1.3203125, "learning_rate": 0.0002860032634966887, "loss": 4.9109, "mean_token_accuracy": 0.22841224670410157, "num_tokens": 111902043.0, "step": 53915 }, { "entropy": 5.665069675445556, "epoch": 4.8911465892597965, "grad_norm": 1.4453125, "learning_rate": 0.000285970945677247, "loss": 4.8285, "mean_token_accuracy": 0.2294325515627861, "num_tokens": 111912170.0, "step": 53920 }, { "entropy": 5.584176445007325, "epoch": 4.891600145137881, "grad_norm": 1.34375, "learning_rate": 0.00028593862763092327, "loss": 4.8474, "mean_token_accuracy": 0.22930973768234253, "num_tokens": 111922415.0, "step": 53925 }, { "entropy": 5.684861183166504, "epoch": 4.892053701015965, "grad_norm": 1.2734375, "learning_rate": 0.00028590630935838596, "loss": 4.9173, "mean_token_accuracy": 0.2220746174454689, "num_tokens": 111933338.0, "step": 53930 }, { "entropy": 5.628093194961548, "epoch": 4.892507256894049, "grad_norm": 1.5234375, "learning_rate": 0.0002858739908603034, "loss": 4.8354, "mean_token_accuracy": 0.23648880124092103, "num_tokens": 111942225.0, "step": 53935 }, { "entropy": 5.622928619384766, "epoch": 4.892960812772134, "grad_norm": 1.375, "learning_rate": 0.0002858416721373439, "loss": 4.8303, "mean_token_accuracy": 0.23444282114505768, "num_tokens": 111953356.0, "step": 53940 }, { "entropy": 5.607836151123047, "epoch": 4.893414368650218, "grad_norm": 1.265625, "learning_rate": 0.00028580935319017593, "loss": 4.7744, "mean_token_accuracy": 0.22941247671842574, "num_tokens": 111964275.0, "step": 53945 }, { "entropy": 5.642651796340942, "epoch": 4.893867924528302, "grad_norm": 1.40625, "learning_rate": 0.00028577703401946777, "loss": 4.854, "mean_token_accuracy": 0.2289108619093895, "num_tokens": 111974006.0, "step": 53950 }, { "entropy": 5.700316572189331, "epoch": 4.894321480406386, "grad_norm": 1.3125, "learning_rate": 0.00028574471462588776, "loss": 4.9643, "mean_token_accuracy": 0.21803802847862244, "num_tokens": 111985085.0, "step": 53955 }, { "entropy": 5.69154839515686, "epoch": 4.89477503628447, "grad_norm": 1.3125, "learning_rate": 0.0002857123950101043, "loss": 4.9575, "mean_token_accuracy": 0.21635894030332564, "num_tokens": 111995162.0, "step": 53960 }, { "entropy": 5.702213287353516, "epoch": 4.895228592162555, "grad_norm": 1.3359375, "learning_rate": 0.0002856800751727858, "loss": 4.8814, "mean_token_accuracy": 0.2226106643676758, "num_tokens": 112005625.0, "step": 53965 }, { "entropy": 5.644302225112915, "epoch": 4.895682148040638, "grad_norm": 1.3203125, "learning_rate": 0.00028564775511460066, "loss": 4.851, "mean_token_accuracy": 0.22957917749881745, "num_tokens": 112015977.0, "step": 53970 }, { "entropy": 5.625647401809692, "epoch": 4.8961357039187225, "grad_norm": 1.515625, "learning_rate": 0.0002856154348362173, "loss": 4.8423, "mean_token_accuracy": 0.229736790060997, "num_tokens": 112025655.0, "step": 53975 }, { "entropy": 5.596014165878296, "epoch": 4.896589259796807, "grad_norm": 1.453125, "learning_rate": 0.00028558311433830386, "loss": 4.8221, "mean_token_accuracy": 0.23546603620052337, "num_tokens": 112036986.0, "step": 53980 }, { "entropy": 5.649260568618774, "epoch": 4.897042815674891, "grad_norm": 1.2578125, "learning_rate": 0.000285550793621529, "loss": 4.8779, "mean_token_accuracy": 0.22766707241535186, "num_tokens": 112047541.0, "step": 53985 }, { "entropy": 5.653165197372436, "epoch": 4.897496371552975, "grad_norm": 1.328125, "learning_rate": 0.0002855184726865611, "loss": 4.8301, "mean_token_accuracy": 0.2266516476869583, "num_tokens": 112058125.0, "step": 53990 }, { "entropy": 5.724337196350097, "epoch": 4.89794992743106, "grad_norm": 1.3125, "learning_rate": 0.00028548615153406844, "loss": 4.8968, "mean_token_accuracy": 0.2241588830947876, "num_tokens": 112068712.0, "step": 53995 }, { "entropy": 5.612188911437988, "epoch": 4.898403483309144, "grad_norm": 1.265625, "learning_rate": 0.00028545383016471954, "loss": 4.8512, "mean_token_accuracy": 0.22237393856048585, "num_tokens": 112078529.0, "step": 54000 }, { "epoch": 4.898403483309144, "eval_entropy": 5.365193633472218, "eval_loss": 4.938462734222412, "eval_mean_token_accuracy": 0.23199300347612453, "eval_num_tokens": 112078529.0, "eval_runtime": 20.659, "eval_samples_per_second": 1711.6, "eval_steps_per_second": 213.95, "step": 54000 } ], "logging_steps": 5, "max_steps": 110230, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 3000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 2.431833283436544e+16, "train_batch_size": 16, "trial_name": null, "trial_params": null }