{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 2.9848535102266447, "eval_steps": 500, "global_step": 13500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 2.0859375, "epoch": 0.0002211166390270868, "grad_norm": 13.491881370544434, "learning_rate": 0.0, "loss": 3.364, "mean_token_accuracy": 0.42396533489227295, "num_tokens": 3991.0, "step": 1 }, { "entropy": 2.1475694444444446, "epoch": 0.002211166390270868, "grad_norm": 15.421286582946777, "learning_rate": 9e-08, "loss": 3.4868, "mean_token_accuracy": 0.4146432313654158, "num_tokens": 35423.0, "step": 10 }, { "entropy": 2.103515625, "epoch": 0.004422332780541736, "grad_norm": 13.73885726928711, "learning_rate": 1.9e-07, "loss": 3.4521, "mean_token_accuracy": 0.4223955884575844, "num_tokens": 70035.0, "step": 20 }, { "entropy": 2.14140625, "epoch": 0.006633499170812604, "grad_norm": 11.23896312713623, "learning_rate": 2.9000000000000003e-07, "loss": 3.3955, "mean_token_accuracy": 0.4187392756342888, "num_tokens": 107394.0, "step": 30 }, { "entropy": 2.1359375, "epoch": 0.008844665561083471, "grad_norm": 10.99072265625, "learning_rate": 3.9e-07, "loss": 3.3239, "mean_token_accuracy": 0.422987724840641, "num_tokens": 146215.0, "step": 40 }, { "entropy": 2.14140625, "epoch": 0.01105583195135434, "grad_norm": 12.723716735839844, "learning_rate": 4.900000000000001e-07, "loss": 3.2944, "mean_token_accuracy": 0.4271391898393631, "num_tokens": 179461.0, "step": 50 }, { "entropy": 2.21953125, "epoch": 0.013266998341625208, "grad_norm": 9.92940616607666, "learning_rate": 5.900000000000001e-07, "loss": 3.1561, "mean_token_accuracy": 0.42118664383888244, "num_tokens": 214588.0, "step": 60 }, { "entropy": 2.21796875, "epoch": 0.015478164731896076, "grad_norm": 9.654187202453613, "learning_rate": 6.900000000000001e-07, "loss": 2.8464, "mean_token_accuracy": 0.43979292213916776, "num_tokens": 252797.0, "step": 70 }, { "entropy": 2.32265625, "epoch": 0.017689331122166942, "grad_norm": 6.960601329803467, "learning_rate": 7.900000000000001e-07, "loss": 2.7819, "mean_token_accuracy": 0.44136977642774583, "num_tokens": 289082.0, "step": 80 }, { "entropy": 2.38125, "epoch": 0.01990049751243781, "grad_norm": 6.603098392486572, "learning_rate": 8.900000000000001e-07, "loss": 2.6354, "mean_token_accuracy": 0.4472609981894493, "num_tokens": 324599.0, "step": 90 }, { "entropy": 2.38203125, "epoch": 0.02211166390270868, "grad_norm": 6.4688239097595215, "learning_rate": 9.9e-07, "loss": 2.4429, "mean_token_accuracy": 0.4658281743526459, "num_tokens": 360597.0, "step": 100 }, { "entropy": 2.3984375, "epoch": 0.024322830292979547, "grad_norm": 5.344963073730469, "learning_rate": 1.0900000000000002e-06, "loss": 2.4422, "mean_token_accuracy": 0.4678023889660835, "num_tokens": 395801.0, "step": 110 }, { "entropy": 2.33359375, "epoch": 0.026533996683250415, "grad_norm": 5.074892520904541, "learning_rate": 1.19e-06, "loss": 2.383, "mean_token_accuracy": 0.47881196439266205, "num_tokens": 432428.0, "step": 120 }, { "entropy": 2.3171875, "epoch": 0.028745163073521283, "grad_norm": 4.863015651702881, "learning_rate": 1.2900000000000001e-06, "loss": 2.3649, "mean_token_accuracy": 0.4759433209896088, "num_tokens": 469596.0, "step": 130 }, { "entropy": 2.321484375, "epoch": 0.03095632946379215, "grad_norm": 5.090569972991943, "learning_rate": 1.3900000000000002e-06, "loss": 2.3273, "mean_token_accuracy": 0.48223552107810974, "num_tokens": 504776.0, "step": 140 }, { "entropy": 2.28359375, "epoch": 0.03316749585406302, "grad_norm": 4.892899990081787, "learning_rate": 1.4900000000000001e-06, "loss": 2.2889, "mean_token_accuracy": 0.4861461818218231, "num_tokens": 542525.0, "step": 150 }, { "entropy": 2.30703125, "epoch": 0.035378662244333885, "grad_norm": 4.994112968444824, "learning_rate": 1.5900000000000002e-06, "loss": 2.2815, "mean_token_accuracy": 0.4921098127961159, "num_tokens": 578036.0, "step": 160 }, { "entropy": 2.340625, "epoch": 0.037589828634604756, "grad_norm": 4.949061393737793, "learning_rate": 1.6900000000000003e-06, "loss": 2.3154, "mean_token_accuracy": 0.4910279303789139, "num_tokens": 614171.0, "step": 170 }, { "entropy": 2.29296875, "epoch": 0.03980099502487562, "grad_norm": 4.922420501708984, "learning_rate": 1.79e-06, "loss": 2.2607, "mean_token_accuracy": 0.4972550317645073, "num_tokens": 649938.0, "step": 180 }, { "entropy": 2.28359375, "epoch": 0.04201216141514649, "grad_norm": 5.138777732849121, "learning_rate": 1.8900000000000001e-06, "loss": 2.2391, "mean_token_accuracy": 0.4931071326136589, "num_tokens": 686377.0, "step": 190 }, { "entropy": 2.28203125, "epoch": 0.04422332780541736, "grad_norm": 4.027737617492676, "learning_rate": 1.9900000000000004e-06, "loss": 2.2285, "mean_token_accuracy": 0.5010080248117447, "num_tokens": 724085.0, "step": 200 }, { "entropy": 2.16796875, "epoch": 0.04643449419568822, "grad_norm": 4.081982612609863, "learning_rate": 2.09e-06, "loss": 2.1872, "mean_token_accuracy": 0.49938761740922927, "num_tokens": 758852.0, "step": 210 }, { "entropy": 2.121484375, "epoch": 0.048645660585959094, "grad_norm": 3.8146069049835205, "learning_rate": 2.19e-06, "loss": 2.1273, "mean_token_accuracy": 0.5086612522602081, "num_tokens": 796249.0, "step": 220 }, { "entropy": 2.17734375, "epoch": 0.05085682697622996, "grad_norm": 3.8457095623016357, "learning_rate": 2.29e-06, "loss": 2.2071, "mean_token_accuracy": 0.49974310100078584, "num_tokens": 831917.0, "step": 230 }, { "entropy": 2.14375, "epoch": 0.05306799336650083, "grad_norm": 3.408496141433716, "learning_rate": 2.39e-06, "loss": 2.1607, "mean_token_accuracy": 0.5061767563223839, "num_tokens": 865571.0, "step": 240 }, { "entropy": 2.20078125, "epoch": 0.055279159756771695, "grad_norm": 3.8531494140625, "learning_rate": 2.4900000000000003e-06, "loss": 2.2087, "mean_token_accuracy": 0.4973599374294281, "num_tokens": 901225.0, "step": 250 }, { "entropy": 2.128515625, "epoch": 0.05749032614704257, "grad_norm": 3.7157583236694336, "learning_rate": 2.59e-06, "loss": 2.1356, "mean_token_accuracy": 0.5112481728196144, "num_tokens": 937815.0, "step": 260 }, { "entropy": 2.138671875, "epoch": 0.05970149253731343, "grad_norm": 3.6800172328948975, "learning_rate": 2.6900000000000005e-06, "loss": 2.1553, "mean_token_accuracy": 0.5024145051836968, "num_tokens": 974667.0, "step": 270 }, { "entropy": 2.18046875, "epoch": 0.0619126589275843, "grad_norm": 2.8408560752868652, "learning_rate": 2.7900000000000004e-06, "loss": 2.1953, "mean_token_accuracy": 0.5002159148454666, "num_tokens": 1014523.0, "step": 280 }, { "entropy": 2.105859375, "epoch": 0.06412382531785517, "grad_norm": 3.5996458530426025, "learning_rate": 2.89e-06, "loss": 2.134, "mean_token_accuracy": 0.5081727758049965, "num_tokens": 1048973.0, "step": 290 }, { "entropy": 2.14921875, "epoch": 0.06633499170812604, "grad_norm": 3.262476921081543, "learning_rate": 2.99e-06, "loss": 2.158, "mean_token_accuracy": 0.5075192973017693, "num_tokens": 1084258.0, "step": 300 }, { "entropy": 2.11015625, "epoch": 0.0685461580983969, "grad_norm": 4.357229709625244, "learning_rate": 3.09e-06, "loss": 2.1037, "mean_token_accuracy": 0.5091981217265129, "num_tokens": 1120381.0, "step": 310 }, { "entropy": 2.15859375, "epoch": 0.07075732448866777, "grad_norm": 4.424260139465332, "learning_rate": 3.1900000000000004e-06, "loss": 2.1651, "mean_token_accuracy": 0.507042008638382, "num_tokens": 1158282.0, "step": 320 }, { "entropy": 2.11796875, "epoch": 0.07296849087893864, "grad_norm": 4.158038139343262, "learning_rate": 3.2900000000000003e-06, "loss": 2.1306, "mean_token_accuracy": 0.5126419425010681, "num_tokens": 1193272.0, "step": 330 }, { "entropy": 2.105078125, "epoch": 0.07517965726920951, "grad_norm": 3.590698480606079, "learning_rate": 3.3900000000000006e-06, "loss": 2.1156, "mean_token_accuracy": 0.5069046452641487, "num_tokens": 1227236.0, "step": 340 }, { "entropy": 2.13828125, "epoch": 0.07739082365948037, "grad_norm": 3.479738473892212, "learning_rate": 3.49e-06, "loss": 2.155, "mean_token_accuracy": 0.5023644655942917, "num_tokens": 1266841.0, "step": 350 }, { "entropy": 2.123828125, "epoch": 0.07960199004975124, "grad_norm": 3.2290194034576416, "learning_rate": 3.5900000000000004e-06, "loss": 2.155, "mean_token_accuracy": 0.5044166415929794, "num_tokens": 1302141.0, "step": 360 }, { "entropy": 2.187109375, "epoch": 0.08181315644002211, "grad_norm": 3.9645466804504395, "learning_rate": 3.6900000000000002e-06, "loss": 2.2007, "mean_token_accuracy": 0.5027717053890228, "num_tokens": 1339324.0, "step": 370 }, { "entropy": 2.116796875, "epoch": 0.08402432283029299, "grad_norm": 3.3966081142425537, "learning_rate": 3.79e-06, "loss": 2.1439, "mean_token_accuracy": 0.514509916305542, "num_tokens": 1373308.0, "step": 380 }, { "entropy": 2.087890625, "epoch": 0.08623548922056384, "grad_norm": 3.7397348880767822, "learning_rate": 3.89e-06, "loss": 2.1182, "mean_token_accuracy": 0.5127018868923188, "num_tokens": 1413621.0, "step": 390 }, { "entropy": 2.084765625, "epoch": 0.08844665561083472, "grad_norm": 4.161512851715088, "learning_rate": 3.990000000000001e-06, "loss": 2.0916, "mean_token_accuracy": 0.510770146548748, "num_tokens": 1449093.0, "step": 400 }, { "entropy": 2.11953125, "epoch": 0.09065782200110559, "grad_norm": 4.093839645385742, "learning_rate": 4.09e-06, "loss": 2.1202, "mean_token_accuracy": 0.5110749483108521, "num_tokens": 1484013.0, "step": 410 }, { "entropy": 2.0671875, "epoch": 0.09286898839137644, "grad_norm": 2.7546298503875732, "learning_rate": 4.1900000000000005e-06, "loss": 2.0955, "mean_token_accuracy": 0.5149266749620438, "num_tokens": 1519801.0, "step": 420 }, { "entropy": 2.1546875, "epoch": 0.09508015478164732, "grad_norm": 3.5816216468811035, "learning_rate": 4.2900000000000004e-06, "loss": 2.132, "mean_token_accuracy": 0.5095141559839249, "num_tokens": 1557313.0, "step": 430 }, { "entropy": 2.08671875, "epoch": 0.09729132117191819, "grad_norm": 3.6089766025543213, "learning_rate": 4.39e-06, "loss": 2.0994, "mean_token_accuracy": 0.5114065691828728, "num_tokens": 1592544.0, "step": 440 }, { "entropy": 2.042578125, "epoch": 0.09950248756218906, "grad_norm": 4.00061559677124, "learning_rate": 4.49e-06, "loss": 2.0928, "mean_token_accuracy": 0.5145848706364632, "num_tokens": 1630046.0, "step": 450 }, { "entropy": 2.111328125, "epoch": 0.10171365395245992, "grad_norm": 3.1204726696014404, "learning_rate": 4.590000000000001e-06, "loss": 2.1092, "mean_token_accuracy": 0.5067434504628181, "num_tokens": 1664597.0, "step": 460 }, { "entropy": 2.0828125, "epoch": 0.10392482034273079, "grad_norm": 3.627305269241333, "learning_rate": 4.69e-06, "loss": 2.0478, "mean_token_accuracy": 0.5200336396694183, "num_tokens": 1698996.0, "step": 470 }, { "entropy": 2.013671875, "epoch": 0.10613598673300166, "grad_norm": 3.278118848800659, "learning_rate": 4.79e-06, "loss": 2.0681, "mean_token_accuracy": 0.5208383575081825, "num_tokens": 1733652.0, "step": 480 }, { "entropy": 2.100390625, "epoch": 0.10834715312327253, "grad_norm": 3.5335357189178467, "learning_rate": 4.890000000000001e-06, "loss": 2.1416, "mean_token_accuracy": 0.5040016114711762, "num_tokens": 1769058.0, "step": 490 }, { "entropy": 2.15078125, "epoch": 0.11055831951354339, "grad_norm": 3.244101047515869, "learning_rate": 4.9900000000000005e-06, "loss": 2.1144, "mean_token_accuracy": 0.515406896173954, "num_tokens": 1804126.0, "step": 500 }, { "epoch": 0.11055831951354339, "eval_entropy": 2.1323305348258708, "eval_loss": 2.1050989627838135, "eval_mean_token_accuracy": 0.5125636699187814, "eval_num_tokens": 1804126.0, "eval_runtime": 112.0154, "eval_samples_per_second": 143.552, "eval_steps_per_second": 8.972, "step": 500 }, { "entropy": 2.086328125, "epoch": 0.11276948590381426, "grad_norm": 3.1509811878204346, "learning_rate": 4.9999941492722206e-06, "loss": 2.0918, "mean_token_accuracy": 0.5177638530731201, "num_tokens": 1841492.0, "step": 510 }, { "entropy": 2.05625, "epoch": 0.11498065229408513, "grad_norm": 2.7028956413269043, "learning_rate": 4.9999739245693716e-06, "loss": 2.0952, "mean_token_accuracy": 0.5098208919167518, "num_tokens": 1879410.0, "step": 520 }, { "entropy": 2.1265625, "epoch": 0.11719181868435599, "grad_norm": 3.4666130542755127, "learning_rate": 4.999939253777089e-06, "loss": 2.1109, "mean_token_accuracy": 0.5116298273205757, "num_tokens": 1914529.0, "step": 530 }, { "entropy": 2.044921875, "epoch": 0.11940298507462686, "grad_norm": 3.2309253215789795, "learning_rate": 4.999890137095717e-06, "loss": 2.0612, "mean_token_accuracy": 0.5192536026239395, "num_tokens": 1950364.0, "step": 540 }, { "entropy": 2.062890625, "epoch": 0.12161415146489774, "grad_norm": 3.670274496078491, "learning_rate": 4.999826574809076e-06, "loss": 2.0973, "mean_token_accuracy": 0.5143837660551072, "num_tokens": 1985936.0, "step": 550 }, { "entropy": 2.1140625, "epoch": 0.1238253178551686, "grad_norm": 3.7882168292999268, "learning_rate": 4.99974856728446e-06, "loss": 2.1332, "mean_token_accuracy": 0.5078542321920395, "num_tokens": 2019487.0, "step": 560 }, { "entropy": 2.078515625, "epoch": 0.12603648424543948, "grad_norm": 3.7122929096221924, "learning_rate": 4.999656114972636e-06, "loss": 2.1039, "mean_token_accuracy": 0.5080955445766449, "num_tokens": 2054357.0, "step": 570 }, { "entropy": 2.071875, "epoch": 0.12824765063571034, "grad_norm": 2.4576525688171387, "learning_rate": 4.9995492184078385e-06, "loss": 2.0919, "mean_token_accuracy": 0.5124289333820343, "num_tokens": 2089121.0, "step": 580 }, { "entropy": 2.030078125, "epoch": 0.1304588170259812, "grad_norm": 3.3369228839874268, "learning_rate": 4.99942787820777e-06, "loss": 2.0626, "mean_token_accuracy": 0.5206080719828605, "num_tokens": 2124911.0, "step": 590 }, { "entropy": 2.1, "epoch": 0.13266998341625208, "grad_norm": 3.4969582557678223, "learning_rate": 4.999292095073593e-06, "loss": 2.1047, "mean_token_accuracy": 0.5153959050774575, "num_tokens": 2161423.0, "step": 600 }, { "entropy": 2.105859375, "epoch": 0.13488114980652294, "grad_norm": 3.1263840198516846, "learning_rate": 4.999141869789932e-06, "loss": 2.0978, "mean_token_accuracy": 0.5143096804618835, "num_tokens": 2196883.0, "step": 610 }, { "entropy": 2.069140625, "epoch": 0.1370923161967938, "grad_norm": 3.248612642288208, "learning_rate": 4.9989772032248605e-06, "loss": 2.0664, "mean_token_accuracy": 0.518137164413929, "num_tokens": 2234713.0, "step": 620 }, { "entropy": 2.098828125, "epoch": 0.13930348258706468, "grad_norm": 3.164656162261963, "learning_rate": 4.998798096329905e-06, "loss": 2.1027, "mean_token_accuracy": 0.5106432005763054, "num_tokens": 2269869.0, "step": 630 }, { "entropy": 2.054296875, "epoch": 0.14151464897733554, "grad_norm": 3.4724669456481934, "learning_rate": 4.998604550140034e-06, "loss": 2.0666, "mean_token_accuracy": 0.519081138074398, "num_tokens": 2305154.0, "step": 640 }, { "entropy": 2.100390625, "epoch": 0.14372581536760642, "grad_norm": 2.1056556701660156, "learning_rate": 4.998396565773653e-06, "loss": 2.1098, "mean_token_accuracy": 0.511474198102951, "num_tokens": 2342409.0, "step": 650 }, { "entropy": 2.074609375, "epoch": 0.14593698175787728, "grad_norm": 3.526925563812256, "learning_rate": 4.998174144432599e-06, "loss": 2.0813, "mean_token_accuracy": 0.5129822865128517, "num_tokens": 2377939.0, "step": 660 }, { "entropy": 2.047265625, "epoch": 0.14814814814814814, "grad_norm": 3.6618149280548096, "learning_rate": 4.9979372874021334e-06, "loss": 2.0617, "mean_token_accuracy": 0.512530866265297, "num_tokens": 2412344.0, "step": 670 }, { "entropy": 2.084375, "epoch": 0.15035931453841903, "grad_norm": 3.130889892578125, "learning_rate": 4.997685996050933e-06, "loss": 2.0848, "mean_token_accuracy": 0.5145954489707947, "num_tokens": 2446755.0, "step": 680 }, { "entropy": 2.0640625, "epoch": 0.15257048092868988, "grad_norm": 3.012781858444214, "learning_rate": 4.9974202718310835e-06, "loss": 2.0358, "mean_token_accuracy": 0.5226449191570282, "num_tokens": 2487104.0, "step": 690 }, { "entropy": 2.1140625, "epoch": 0.15478164731896074, "grad_norm": 3.1782774925231934, "learning_rate": 4.997140116278072e-06, "loss": 2.0994, "mean_token_accuracy": 0.5159388601779937, "num_tokens": 2522787.0, "step": 700 }, { "entropy": 2.05546875, "epoch": 0.15699281370923163, "grad_norm": 3.2635788917541504, "learning_rate": 4.996845531010776e-06, "loss": 2.0946, "mean_token_accuracy": 0.5172607436776161, "num_tokens": 2559917.0, "step": 710 }, { "entropy": 2.1078125, "epoch": 0.15920398009950248, "grad_norm": 2.3570048809051514, "learning_rate": 4.996536517731456e-06, "loss": 2.1824, "mean_token_accuracy": 0.5059584200382232, "num_tokens": 2598082.0, "step": 720 }, { "entropy": 2.09453125, "epoch": 0.16141514648977334, "grad_norm": 3.011674165725708, "learning_rate": 4.996213078225743e-06, "loss": 2.1104, "mean_token_accuracy": 0.5101976647973061, "num_tokens": 2634330.0, "step": 730 }, { "entropy": 2.104296875, "epoch": 0.16362631288004423, "grad_norm": 3.1082472801208496, "learning_rate": 4.99587521436263e-06, "loss": 2.1152, "mean_token_accuracy": 0.5096311271190643, "num_tokens": 2671436.0, "step": 740 }, { "entropy": 2.02890625, "epoch": 0.16583747927031509, "grad_norm": 3.394878625869751, "learning_rate": 4.995522928094464e-06, "loss": 2.0491, "mean_token_accuracy": 0.5202280208468437, "num_tokens": 2705362.0, "step": 750 }, { "entropy": 2.08046875, "epoch": 0.16804864566058597, "grad_norm": 3.5359127521514893, "learning_rate": 4.99515622145693e-06, "loss": 2.1182, "mean_token_accuracy": 0.5109568238258362, "num_tokens": 2742358.0, "step": 760 }, { "entropy": 2.052734375, "epoch": 0.17025981205085683, "grad_norm": 3.516289710998535, "learning_rate": 4.994775096569038e-06, "loss": 2.0446, "mean_token_accuracy": 0.5238539129495621, "num_tokens": 2777961.0, "step": 770 }, { "entropy": 2.10625, "epoch": 0.1724709784411277, "grad_norm": 3.0492849349975586, "learning_rate": 4.9943795556331195e-06, "loss": 2.1082, "mean_token_accuracy": 0.5114821001887322, "num_tokens": 2816127.0, "step": 780 }, { "entropy": 2.1, "epoch": 0.17468214483139857, "grad_norm": 3.256518840789795, "learning_rate": 4.993969600934805e-06, "loss": 2.0871, "mean_token_accuracy": 0.5167936980724335, "num_tokens": 2852821.0, "step": 790 }, { "entropy": 2.0453125, "epoch": 0.17689331122166943, "grad_norm": 3.638335704803467, "learning_rate": 4.993545234843016e-06, "loss": 2.0887, "mean_token_accuracy": 0.5134402886033058, "num_tokens": 2886733.0, "step": 800 }, { "entropy": 2.048046875, "epoch": 0.1791044776119403, "grad_norm": 3.737710475921631, "learning_rate": 4.993106459809952e-06, "loss": 2.0394, "mean_token_accuracy": 0.520734640955925, "num_tokens": 2921471.0, "step": 810 }, { "entropy": 2.093359375, "epoch": 0.18131564400221117, "grad_norm": 3.340587854385376, "learning_rate": 4.9926532783710705e-06, "loss": 2.0687, "mean_token_accuracy": 0.5202266246080398, "num_tokens": 2957636.0, "step": 820 }, { "entropy": 2.10078125, "epoch": 0.18352681039248203, "grad_norm": 3.947770595550537, "learning_rate": 4.99218569314508e-06, "loss": 2.1402, "mean_token_accuracy": 0.5113625213503837, "num_tokens": 2993908.0, "step": 830 }, { "entropy": 2.094140625, "epoch": 0.1857379767827529, "grad_norm": 3.3025078773498535, "learning_rate": 4.991703706833919e-06, "loss": 2.0904, "mean_token_accuracy": 0.5102549090981483, "num_tokens": 3028882.0, "step": 840 }, { "entropy": 2.085546875, "epoch": 0.18794914317302377, "grad_norm": 2.902519464492798, "learning_rate": 4.991207322222743e-06, "loss": 2.113, "mean_token_accuracy": 0.509818272292614, "num_tokens": 3065276.0, "step": 850 }, { "entropy": 2.05625, "epoch": 0.19016030956329463, "grad_norm": 3.3408896923065186, "learning_rate": 4.990696542179911e-06, "loss": 2.0813, "mean_token_accuracy": 0.5192014425992966, "num_tokens": 3102022.0, "step": 860 }, { "entropy": 2.0578125, "epoch": 0.19237147595356552, "grad_norm": 2.8319661617279053, "learning_rate": 4.990171369656962e-06, "loss": 2.0742, "mean_token_accuracy": 0.5178813964128495, "num_tokens": 3137476.0, "step": 870 }, { "entropy": 2.034765625, "epoch": 0.19458264234383638, "grad_norm": 3.714707374572754, "learning_rate": 4.9896318076886026e-06, "loss": 2.036, "mean_token_accuracy": 0.51841921210289, "num_tokens": 3173205.0, "step": 880 }, { "entropy": 2.032421875, "epoch": 0.19679380873410723, "grad_norm": 2.956759214401245, "learning_rate": 4.98907785939269e-06, "loss": 2.0408, "mean_token_accuracy": 0.5258077561855317, "num_tokens": 3212741.0, "step": 890 }, { "entropy": 2.065234375, "epoch": 0.19900497512437812, "grad_norm": 3.065991163253784, "learning_rate": 4.988509527970213e-06, "loss": 2.0589, "mean_token_accuracy": 0.5204547926783561, "num_tokens": 3247053.0, "step": 900 }, { "entropy": 2.05, "epoch": 0.20121614151464898, "grad_norm": 3.4980456829071045, "learning_rate": 4.987926816705272e-06, "loss": 2.0629, "mean_token_accuracy": 0.518908366560936, "num_tokens": 3281829.0, "step": 910 }, { "entropy": 2.001953125, "epoch": 0.20342730790491984, "grad_norm": 2.832669496536255, "learning_rate": 4.987329728965061e-06, "loss": 2.034, "mean_token_accuracy": 0.5249859780073166, "num_tokens": 3318448.0, "step": 920 }, { "entropy": 2.055859375, "epoch": 0.20563847429519072, "grad_norm": 3.2094218730926514, "learning_rate": 4.98671826819985e-06, "loss": 2.0547, "mean_token_accuracy": 0.5203769773244857, "num_tokens": 3355448.0, "step": 930 }, { "entropy": 2.0609375, "epoch": 0.20784964068546158, "grad_norm": 3.0192489624023438, "learning_rate": 4.986092437942962e-06, "loss": 2.0751, "mean_token_accuracy": 0.5177171722054481, "num_tokens": 3393311.0, "step": 940 }, { "entropy": 2.05859375, "epoch": 0.21006080707573244, "grad_norm": 2.692469358444214, "learning_rate": 4.985452241810755e-06, "loss": 2.0637, "mean_token_accuracy": 0.5169694602489472, "num_tokens": 3431150.0, "step": 950 }, { "entropy": 2.048046875, "epoch": 0.21227197346600332, "grad_norm": 2.79972767829895, "learning_rate": 4.984797683502602e-06, "loss": 2.0489, "mean_token_accuracy": 0.5185723170638085, "num_tokens": 3467047.0, "step": 960 }, { "entropy": 2.042578125, "epoch": 0.21448313985627418, "grad_norm": 3.4971227645874023, "learning_rate": 4.984128766800861e-06, "loss": 2.0587, "mean_token_accuracy": 0.5191132619976997, "num_tokens": 3501749.0, "step": 970 }, { "entropy": 2.0703125, "epoch": 0.21669430624654507, "grad_norm": 3.202972888946533, "learning_rate": 4.983445495570868e-06, "loss": 2.0677, "mean_token_accuracy": 0.5176109686493874, "num_tokens": 3537837.0, "step": 980 }, { "entropy": 2.00703125, "epoch": 0.21890547263681592, "grad_norm": 2.777912139892578, "learning_rate": 4.982747873760902e-06, "loss": 2.0259, "mean_token_accuracy": 0.5225431248545647, "num_tokens": 3573738.0, "step": 990 }, { "entropy": 2.047265625, "epoch": 0.22111663902708678, "grad_norm": 2.596719264984131, "learning_rate": 4.982035905402167e-06, "loss": 2.083, "mean_token_accuracy": 0.5185031279921531, "num_tokens": 3610126.0, "step": 1000 }, { "epoch": 0.22111663902708678, "eval_entropy": 2.076710199004975, "eval_loss": 2.0526020526885986, "eval_mean_token_accuracy": 0.520084024661809, "eval_num_tokens": 3610126.0, "eval_runtime": 111.8048, "eval_samples_per_second": 143.822, "eval_steps_per_second": 8.989, "step": 1000 }, { "entropy": 2.114453125, "epoch": 0.22332780541735767, "grad_norm": 3.875258684158325, "learning_rate": 4.981309594608771e-06, "loss": 2.0871, "mean_token_accuracy": 0.5167941331863404, "num_tokens": 3643167.0, "step": 1010 }, { "entropy": 2.0484375, "epoch": 0.22553897180762852, "grad_norm": 3.5693397521972656, "learning_rate": 4.980568945577697e-06, "loss": 2.0479, "mean_token_accuracy": 0.5224012836813927, "num_tokens": 3679207.0, "step": 1020 }, { "entropy": 2.03203125, "epoch": 0.22775013819789938, "grad_norm": 3.2723288536071777, "learning_rate": 4.979813962588784e-06, "loss": 2.0538, "mean_token_accuracy": 0.5196092277765274, "num_tokens": 3713829.0, "step": 1030 }, { "entropy": 2.08203125, "epoch": 0.22996130458817027, "grad_norm": 3.1510467529296875, "learning_rate": 4.979044650004696e-06, "loss": 2.0934, "mean_token_accuracy": 0.5114318132400513, "num_tokens": 3750202.0, "step": 1040 }, { "entropy": 2.049609375, "epoch": 0.23217247097844113, "grad_norm": 3.2102668285369873, "learning_rate": 4.978261012270904e-06, "loss": 2.058, "mean_token_accuracy": 0.5233743146061898, "num_tokens": 3784512.0, "step": 1050 }, { "entropy": 2.087890625, "epoch": 0.23438363736871198, "grad_norm": 3.133835554122925, "learning_rate": 4.977463053915655e-06, "loss": 2.0815, "mean_token_accuracy": 0.5125426039099693, "num_tokens": 3822905.0, "step": 1060 }, { "entropy": 2.06171875, "epoch": 0.23659480375898287, "grad_norm": 3.03928279876709, "learning_rate": 4.976650779549949e-06, "loss": 2.055, "mean_token_accuracy": 0.5166697531938553, "num_tokens": 3860464.0, "step": 1070 }, { "entropy": 1.99140625, "epoch": 0.23880597014925373, "grad_norm": 2.9765543937683105, "learning_rate": 4.97582419386751e-06, "loss": 2.0203, "mean_token_accuracy": 0.5222927004098892, "num_tokens": 3894344.0, "step": 1080 }, { "entropy": 2.066796875, "epoch": 0.2410171365395246, "grad_norm": 3.5072827339172363, "learning_rate": 4.97498330164476e-06, "loss": 2.0972, "mean_token_accuracy": 0.5140745937824249, "num_tokens": 3930143.0, "step": 1090 }, { "entropy": 2.065234375, "epoch": 0.24322830292979547, "grad_norm": 3.496581792831421, "learning_rate": 4.9741281077407895e-06, "loss": 2.0693, "mean_token_accuracy": 0.5172520309686661, "num_tokens": 3964008.0, "step": 1100 }, { "entropy": 2.08515625, "epoch": 0.24543946932006633, "grad_norm": 3.3615691661834717, "learning_rate": 4.973258617097336e-06, "loss": 2.0912, "mean_token_accuracy": 0.5135252505540848, "num_tokens": 3998895.0, "step": 1110 }, { "entropy": 2.042578125, "epoch": 0.2476506357103372, "grad_norm": 4.020509243011475, "learning_rate": 4.9723748347387466e-06, "loss": 2.0231, "mean_token_accuracy": 0.5249299377202987, "num_tokens": 4034995.0, "step": 1120 }, { "entropy": 2.024609375, "epoch": 0.24986180210060807, "grad_norm": 3.453850746154785, "learning_rate": 4.9714767657719546e-06, "loss": 2.0477, "mean_token_accuracy": 0.5195066630840302, "num_tokens": 4070784.0, "step": 1130 }, { "entropy": 2.019921875, "epoch": 0.25207296849087896, "grad_norm": 2.781249761581421, "learning_rate": 4.970564415386447e-06, "loss": 2.0072, "mean_token_accuracy": 0.5254052251577377, "num_tokens": 4106077.0, "step": 1140 }, { "entropy": 2.09921875, "epoch": 0.2542841348811498, "grad_norm": 3.1547138690948486, "learning_rate": 4.969637788854237e-06, "loss": 2.0874, "mean_token_accuracy": 0.5099081441760063, "num_tokens": 4142406.0, "step": 1150 }, { "entropy": 2.055859375, "epoch": 0.2564953012714207, "grad_norm": 3.136136531829834, "learning_rate": 4.968696891529833e-06, "loss": 2.0482, "mean_token_accuracy": 0.5239317551255226, "num_tokens": 4177363.0, "step": 1160 }, { "entropy": 2.024609375, "epoch": 0.25870646766169153, "grad_norm": 3.2736003398895264, "learning_rate": 4.967741728850206e-06, "loss": 2.0359, "mean_token_accuracy": 0.5175553143024445, "num_tokens": 4213599.0, "step": 1170 }, { "entropy": 2.0078125, "epoch": 0.2609176340519624, "grad_norm": 3.7074875831604004, "learning_rate": 4.966772306334761e-06, "loss": 2.0224, "mean_token_accuracy": 0.5266255125403404, "num_tokens": 4252752.0, "step": 1180 }, { "entropy": 2.045703125, "epoch": 0.2631288004422333, "grad_norm": 3.133660078048706, "learning_rate": 4.9657886295853e-06, "loss": 2.0331, "mean_token_accuracy": 0.5198695093393326, "num_tokens": 4289454.0, "step": 1190 }, { "entropy": 2.070703125, "epoch": 0.26533996683250416, "grad_norm": 2.8777458667755127, "learning_rate": 4.964790704285996e-06, "loss": 2.0692, "mean_token_accuracy": 0.5144023418426513, "num_tokens": 4325442.0, "step": 1200 }, { "entropy": 2.055078125, "epoch": 0.267551133222775, "grad_norm": 3.7900989055633545, "learning_rate": 4.963778536203357e-06, "loss": 2.0761, "mean_token_accuracy": 0.5142589136958122, "num_tokens": 4361168.0, "step": 1210 }, { "entropy": 2.0734375, "epoch": 0.2697622996130459, "grad_norm": 3.1633262634277344, "learning_rate": 4.9627521311861925e-06, "loss": 2.0677, "mean_token_accuracy": 0.5143312171101571, "num_tokens": 4395758.0, "step": 1220 }, { "entropy": 2.092578125, "epoch": 0.27197346600331673, "grad_norm": 3.301394462585449, "learning_rate": 4.961711495165579e-06, "loss": 2.1126, "mean_token_accuracy": 0.5116095244884491, "num_tokens": 4429271.0, "step": 1230 }, { "entropy": 1.989453125, "epoch": 0.2741846323935876, "grad_norm": 3.0996313095092773, "learning_rate": 4.960656634154828e-06, "loss": 1.9959, "mean_token_accuracy": 0.5351725295186043, "num_tokens": 4466603.0, "step": 1240 }, { "entropy": 2.025, "epoch": 0.2763957987838585, "grad_norm": 3.8732588291168213, "learning_rate": 4.95958755424945e-06, "loss": 2.0488, "mean_token_accuracy": 0.5226330637931824, "num_tokens": 4503326.0, "step": 1250 }, { "entropy": 2.062109375, "epoch": 0.27860696517412936, "grad_norm": 3.2532734870910645, "learning_rate": 4.958504261627119e-06, "loss": 2.0681, "mean_token_accuracy": 0.5155357450246811, "num_tokens": 4539140.0, "step": 1260 }, { "entropy": 2.0421875, "epoch": 0.2808181315644002, "grad_norm": 3.2847983837127686, "learning_rate": 4.9574067625476355e-06, "loss": 2.042, "mean_token_accuracy": 0.5190395534038543, "num_tokens": 4575706.0, "step": 1270 }, { "entropy": 2.008984375, "epoch": 0.2830292979546711, "grad_norm": 3.526211977005005, "learning_rate": 4.956295063352895e-06, "loss": 2.0388, "mean_token_accuracy": 0.5281762689352035, "num_tokens": 4612909.0, "step": 1280 }, { "entropy": 2.089453125, "epoch": 0.28524046434494194, "grad_norm": 3.5005431175231934, "learning_rate": 4.955169170466847e-06, "loss": 2.066, "mean_token_accuracy": 0.5185081407427787, "num_tokens": 4649837.0, "step": 1290 }, { "entropy": 2.076953125, "epoch": 0.28745163073521285, "grad_norm": 3.4639599323272705, "learning_rate": 4.954029090395459e-06, "loss": 2.0816, "mean_token_accuracy": 0.5106042638421059, "num_tokens": 4683417.0, "step": 1300 }, { "entropy": 2.04609375, "epoch": 0.2896627971254837, "grad_norm": 3.0740296840667725, "learning_rate": 4.952874829726679e-06, "loss": 2.0301, "mean_token_accuracy": 0.5250205516815185, "num_tokens": 4718803.0, "step": 1310 }, { "entropy": 1.996484375, "epoch": 0.29187396351575456, "grad_norm": 3.3780007362365723, "learning_rate": 4.951706395130398e-06, "loss": 2.0583, "mean_token_accuracy": 0.5185863241553307, "num_tokens": 4755118.0, "step": 1320 }, { "entropy": 1.9734375, "epoch": 0.2940851299060254, "grad_norm": 3.4502792358398438, "learning_rate": 4.950523793358411e-06, "loss": 1.987, "mean_token_accuracy": 0.5277883052825928, "num_tokens": 4791611.0, "step": 1330 }, { "entropy": 1.998828125, "epoch": 0.2962962962962963, "grad_norm": 3.038604497909546, "learning_rate": 4.9493270312443755e-06, "loss": 2.0056, "mean_token_accuracy": 0.529706421494484, "num_tokens": 4830994.0, "step": 1340 }, { "entropy": 2.0359375, "epoch": 0.29850746268656714, "grad_norm": 3.100778579711914, "learning_rate": 4.9481161157037796e-06, "loss": 2.0698, "mean_token_accuracy": 0.5177467226982116, "num_tokens": 4866747.0, "step": 1350 }, { "entropy": 2.045703125, "epoch": 0.30071862907683805, "grad_norm": 3.9446866512298584, "learning_rate": 4.946891053733892e-06, "loss": 2.0683, "mean_token_accuracy": 0.5160597786307335, "num_tokens": 4902490.0, "step": 1360 }, { "entropy": 2.00625, "epoch": 0.3029297954671089, "grad_norm": 3.167123556137085, "learning_rate": 4.945651852413728e-06, "loss": 2.0378, "mean_token_accuracy": 0.524365185201168, "num_tokens": 4937384.0, "step": 1370 }, { "entropy": 2.00703125, "epoch": 0.30514096185737977, "grad_norm": 2.4206273555755615, "learning_rate": 4.94439851890401e-06, "loss": 1.9942, "mean_token_accuracy": 0.528535221517086, "num_tokens": 4973442.0, "step": 1380 }, { "entropy": 2.053515625, "epoch": 0.3073521282476506, "grad_norm": 3.1989834308624268, "learning_rate": 4.94313106044712e-06, "loss": 2.0545, "mean_token_accuracy": 0.5201150357723237, "num_tokens": 5009008.0, "step": 1390 }, { "entropy": 2.026171875, "epoch": 0.3095632946379215, "grad_norm": 3.1637074947357178, "learning_rate": 4.9418494843670585e-06, "loss": 2.0658, "mean_token_accuracy": 0.5158878669142724, "num_tokens": 5047814.0, "step": 1400 }, { "entropy": 2.022265625, "epoch": 0.3117744610281924, "grad_norm": 3.2978219985961914, "learning_rate": 4.940553798069412e-06, "loss": 2.0314, "mean_token_accuracy": 0.5247649118304253, "num_tokens": 5081837.0, "step": 1410 }, { "entropy": 2.05859375, "epoch": 0.31398562741846325, "grad_norm": 2.8718130588531494, "learning_rate": 4.939244009041297e-06, "loss": 2.0524, "mean_token_accuracy": 0.5260623335838318, "num_tokens": 5122184.0, "step": 1420 }, { "entropy": 2.0546875, "epoch": 0.3161967938087341, "grad_norm": 3.2099649906158447, "learning_rate": 4.9379201248513235e-06, "loss": 2.0654, "mean_token_accuracy": 0.5193627223372459, "num_tokens": 5157638.0, "step": 1430 }, { "entropy": 2.055859375, "epoch": 0.31840796019900497, "grad_norm": 2.2885003089904785, "learning_rate": 4.9365821531495515e-06, "loss": 2.0415, "mean_token_accuracy": 0.5157875746488572, "num_tokens": 5196661.0, "step": 1440 }, { "entropy": 2.018359375, "epoch": 0.3206191265892758, "grad_norm": 2.864169120788574, "learning_rate": 4.935230101667446e-06, "loss": 2.0094, "mean_token_accuracy": 0.5312970861792564, "num_tokens": 5232726.0, "step": 1450 }, { "entropy": 2.02109375, "epoch": 0.3228302929795467, "grad_norm": 3.0841586589813232, "learning_rate": 4.933863978217831e-06, "loss": 2.021, "mean_token_accuracy": 0.5244891539216041, "num_tokens": 5268949.0, "step": 1460 }, { "entropy": 1.981640625, "epoch": 0.3250414593698176, "grad_norm": 3.211052417755127, "learning_rate": 4.9324837906948445e-06, "loss": 1.9792, "mean_token_accuracy": 0.5358170449733735, "num_tokens": 5304978.0, "step": 1470 }, { "entropy": 2.04921875, "epoch": 0.32725262576008846, "grad_norm": 3.485799551010132, "learning_rate": 4.931089547073895e-06, "loss": 2.0925, "mean_token_accuracy": 0.516342180967331, "num_tokens": 5341064.0, "step": 1480 }, { "entropy": 2.083203125, "epoch": 0.3294637921503593, "grad_norm": 3.1947202682495117, "learning_rate": 4.929681255411614e-06, "loss": 2.0789, "mean_token_accuracy": 0.515719099342823, "num_tokens": 5377405.0, "step": 1490 }, { "entropy": 2.006640625, "epoch": 0.33167495854063017, "grad_norm": 3.4811670780181885, "learning_rate": 4.928258923845808e-06, "loss": 1.9908, "mean_token_accuracy": 0.5227188125252724, "num_tokens": 5412308.0, "step": 1500 }, { "epoch": 0.33167495854063017, "eval_entropy": 2.0015469527363186, "eval_loss": 2.020139455795288, "eval_mean_token_accuracy": 0.5245392740069337, "eval_num_tokens": 5412308.0, "eval_runtime": 111.642, "eval_samples_per_second": 144.032, "eval_steps_per_second": 9.002, "step": 1500 }, { "entropy": 1.97734375, "epoch": 0.33388612493090103, "grad_norm": 3.286555528640747, "learning_rate": 4.926822560595416e-06, "loss": 1.9979, "mean_token_accuracy": 0.5268404155969619, "num_tokens": 5445439.0, "step": 1510 }, { "entropy": 1.988671875, "epoch": 0.33609729132117194, "grad_norm": 3.4769322872161865, "learning_rate": 4.925372173960458e-06, "loss": 2.0348, "mean_token_accuracy": 0.5200627565383911, "num_tokens": 5483959.0, "step": 1520 }, { "entropy": 2.06875, "epoch": 0.3383084577114428, "grad_norm": 3.410193920135498, "learning_rate": 4.923907772321986e-06, "loss": 2.0513, "mean_token_accuracy": 0.5150986418128014, "num_tokens": 5520121.0, "step": 1530 }, { "entropy": 2.051171875, "epoch": 0.34051962410171366, "grad_norm": 3.275287628173828, "learning_rate": 4.922429364142039e-06, "loss": 2.0289, "mean_token_accuracy": 0.5222316756844521, "num_tokens": 5556091.0, "step": 1540 }, { "entropy": 1.96015625, "epoch": 0.3427307904919845, "grad_norm": 3.107334852218628, "learning_rate": 4.920936957963594e-06, "loss": 1.9953, "mean_token_accuracy": 0.5287952840328216, "num_tokens": 5591761.0, "step": 1550 }, { "entropy": 2.051171875, "epoch": 0.3449419568822554, "grad_norm": 2.963439464569092, "learning_rate": 4.919430562410512e-06, "loss": 2.0444, "mean_token_accuracy": 0.515690267086029, "num_tokens": 5626047.0, "step": 1560 }, { "entropy": 2.0703125, "epoch": 0.34715312327252623, "grad_norm": 3.074941873550415, "learning_rate": 4.917910186187495e-06, "loss": 2.095, "mean_token_accuracy": 0.5144581392407417, "num_tokens": 5663058.0, "step": 1570 }, { "entropy": 2.011328125, "epoch": 0.34936428966279715, "grad_norm": 2.9343066215515137, "learning_rate": 4.916375838080033e-06, "loss": 2.0013, "mean_token_accuracy": 0.527287694811821, "num_tokens": 5699281.0, "step": 1580 }, { "entropy": 1.990625, "epoch": 0.351575456053068, "grad_norm": 3.0326335430145264, "learning_rate": 4.914827526954347e-06, "loss": 2.009, "mean_token_accuracy": 0.5286151185631752, "num_tokens": 5735611.0, "step": 1590 }, { "entropy": 1.97890625, "epoch": 0.35378662244333886, "grad_norm": 3.16322922706604, "learning_rate": 4.913265261757348e-06, "loss": 1.9667, "mean_token_accuracy": 0.5288407698273658, "num_tokens": 5768995.0, "step": 1600 }, { "entropy": 2.0234375, "epoch": 0.3559977888336097, "grad_norm": 3.2227258682250977, "learning_rate": 4.911689051516581e-06, "loss": 2.0097, "mean_token_accuracy": 0.5236464008688927, "num_tokens": 5802584.0, "step": 1610 }, { "entropy": 2.034375, "epoch": 0.3582089552238806, "grad_norm": 3.4065120220184326, "learning_rate": 4.910098905340169e-06, "loss": 2.0176, "mean_token_accuracy": 0.5262903615832328, "num_tokens": 5839648.0, "step": 1620 }, { "entropy": 2.01484375, "epoch": 0.3604201216141515, "grad_norm": 3.445894956588745, "learning_rate": 4.908494832416764e-06, "loss": 2.014, "mean_token_accuracy": 0.5278646647930145, "num_tokens": 5875102.0, "step": 1630 }, { "entropy": 2.00390625, "epoch": 0.36263128800442235, "grad_norm": 2.894221544265747, "learning_rate": 4.906876842015499e-06, "loss": 2.0651, "mean_token_accuracy": 0.5241049721837043, "num_tokens": 5912593.0, "step": 1640 }, { "entropy": 2.0296875, "epoch": 0.3648424543946932, "grad_norm": 3.1065828800201416, "learning_rate": 4.905244943485921e-06, "loss": 2.039, "mean_token_accuracy": 0.5218931689858437, "num_tokens": 5950975.0, "step": 1650 }, { "entropy": 2.02265625, "epoch": 0.36705362078496406, "grad_norm": 2.857823371887207, "learning_rate": 4.903599146257952e-06, "loss": 2.0308, "mean_token_accuracy": 0.5198357656598092, "num_tokens": 5987316.0, "step": 1660 }, { "entropy": 2.00546875, "epoch": 0.3692647871752349, "grad_norm": 3.0297486782073975, "learning_rate": 4.9019394598418225e-06, "loss": 2.0157, "mean_token_accuracy": 0.5213582336902618, "num_tokens": 6022113.0, "step": 1670 }, { "entropy": 2.01875, "epoch": 0.3714759535655058, "grad_norm": 3.2613017559051514, "learning_rate": 4.9002658938280265e-06, "loss": 2.0366, "mean_token_accuracy": 0.5199184194207191, "num_tokens": 6059707.0, "step": 1680 }, { "entropy": 2.01015625, "epoch": 0.3736871199557767, "grad_norm": 2.819084882736206, "learning_rate": 4.898578457887256e-06, "loss": 2.0391, "mean_token_accuracy": 0.5251257419586182, "num_tokens": 6099280.0, "step": 1690 }, { "entropy": 2.018359375, "epoch": 0.37589828634604755, "grad_norm": 3.639329433441162, "learning_rate": 4.896877161770356e-06, "loss": 2.002, "mean_token_accuracy": 0.5279067263007164, "num_tokens": 6133394.0, "step": 1700 }, { "entropy": 2.01171875, "epoch": 0.3781094527363184, "grad_norm": 3.7768845558166504, "learning_rate": 4.895162015308256e-06, "loss": 2.0063, "mean_token_accuracy": 0.5246257245540619, "num_tokens": 6170401.0, "step": 1710 }, { "entropy": 1.965234375, "epoch": 0.38032061912658927, "grad_norm": 3.422788143157959, "learning_rate": 4.893433028411924e-06, "loss": 1.9681, "mean_token_accuracy": 0.5322629019618035, "num_tokens": 6206773.0, "step": 1720 }, { "entropy": 2.013671875, "epoch": 0.3825317855168601, "grad_norm": 2.9707889556884766, "learning_rate": 4.891690211072306e-06, "loss": 2.0266, "mean_token_accuracy": 0.5252422988414764, "num_tokens": 6242756.0, "step": 1730 }, { "entropy": 2.02265625, "epoch": 0.38474295190713104, "grad_norm": 3.2246110439300537, "learning_rate": 4.8899335733602635e-06, "loss": 2.02, "mean_token_accuracy": 0.5224257856607437, "num_tokens": 6279484.0, "step": 1740 }, { "entropy": 1.96875, "epoch": 0.3869541182974019, "grad_norm": 2.7384414672851562, "learning_rate": 4.88816312542652e-06, "loss": 1.9764, "mean_token_accuracy": 0.5283252835273743, "num_tokens": 6317492.0, "step": 1750 }, { "entropy": 1.99453125, "epoch": 0.38916528468767275, "grad_norm": 4.392463207244873, "learning_rate": 4.886378877501603e-06, "loss": 2.0513, "mean_token_accuracy": 0.5172360330820084, "num_tokens": 6353436.0, "step": 1760 }, { "entropy": 2.0875, "epoch": 0.3913764510779436, "grad_norm": 3.436783790588379, "learning_rate": 4.884580839895781e-06, "loss": 2.0735, "mean_token_accuracy": 0.5116148293018341, "num_tokens": 6390976.0, "step": 1770 }, { "entropy": 2.0265625, "epoch": 0.39358761746821447, "grad_norm": 3.3862481117248535, "learning_rate": 4.882769022999009e-06, "loss": 2.0148, "mean_token_accuracy": 0.5261307835578919, "num_tokens": 6426736.0, "step": 1780 }, { "entropy": 2.006640625, "epoch": 0.3957987838584853, "grad_norm": 2.5017852783203125, "learning_rate": 4.880943437280861e-06, "loss": 2.0449, "mean_token_accuracy": 0.5277575939893723, "num_tokens": 6463902.0, "step": 1790 }, { "entropy": 1.98359375, "epoch": 0.39800995024875624, "grad_norm": 2.7924301624298096, "learning_rate": 4.87910409329048e-06, "loss": 1.9795, "mean_token_accuracy": 0.530899016559124, "num_tokens": 6499738.0, "step": 1800 }, { "entropy": 1.964453125, "epoch": 0.4002211166390271, "grad_norm": 3.3680801391601562, "learning_rate": 4.877251001656506e-06, "loss": 1.9509, "mean_token_accuracy": 0.5317232936620713, "num_tokens": 6534129.0, "step": 1810 }, { "entropy": 1.990625, "epoch": 0.40243228302929795, "grad_norm": 2.4256699085235596, "learning_rate": 4.875384173087021e-06, "loss": 2.0282, "mean_token_accuracy": 0.5240411281585693, "num_tokens": 6571287.0, "step": 1820 }, { "entropy": 2.05625, "epoch": 0.4046434494195688, "grad_norm": 2.913134813308716, "learning_rate": 4.873503618369489e-06, "loss": 2.0856, "mean_token_accuracy": 0.5163218721747398, "num_tokens": 6610703.0, "step": 1830 }, { "entropy": 2.006640625, "epoch": 0.40685461580983967, "grad_norm": 3.4239633083343506, "learning_rate": 4.871609348370686e-06, "loss": 1.999, "mean_token_accuracy": 0.5269322291016578, "num_tokens": 6647395.0, "step": 1840 }, { "entropy": 1.98046875, "epoch": 0.4090657822001106, "grad_norm": 2.9546079635620117, "learning_rate": 4.869701374036644e-06, "loss": 2.0095, "mean_token_accuracy": 0.5220134198665619, "num_tokens": 6683942.0, "step": 1850 }, { "entropy": 1.94375, "epoch": 0.41127694859038144, "grad_norm": 3.476383686065674, "learning_rate": 4.8677797063925855e-06, "loss": 1.9621, "mean_token_accuracy": 0.5390887811779976, "num_tokens": 6721469.0, "step": 1860 }, { "entropy": 1.971875, "epoch": 0.4134881149806523, "grad_norm": 3.4428083896636963, "learning_rate": 4.8658443565428605e-06, "loss": 2.0089, "mean_token_accuracy": 0.5274516686797142, "num_tokens": 6758813.0, "step": 1870 }, { "entropy": 2.00234375, "epoch": 0.41569928137092316, "grad_norm": 2.8875725269317627, "learning_rate": 4.863895335670879e-06, "loss": 2.0001, "mean_token_accuracy": 0.5276427209377289, "num_tokens": 6793691.0, "step": 1880 }, { "entropy": 2.012109375, "epoch": 0.417910447761194, "grad_norm": 3.414984941482544, "learning_rate": 4.8619326550390495e-06, "loss": 1.9848, "mean_token_accuracy": 0.5272266566753387, "num_tokens": 6832113.0, "step": 1890 }, { "entropy": 1.9609375, "epoch": 0.4201216141514649, "grad_norm": 3.075002670288086, "learning_rate": 4.859956325988716e-06, "loss": 1.9864, "mean_token_accuracy": 0.5318835929036141, "num_tokens": 6868949.0, "step": 1900 }, { "entropy": 1.976953125, "epoch": 0.4223327805417358, "grad_norm": 2.8310725688934326, "learning_rate": 4.8579663599400875e-06, "loss": 1.9668, "mean_token_accuracy": 0.5309950023889541, "num_tokens": 6905049.0, "step": 1910 }, { "entropy": 1.994921875, "epoch": 0.42454394693200664, "grad_norm": 2.7676169872283936, "learning_rate": 4.855962768392175e-06, "loss": 1.9493, "mean_token_accuracy": 0.5334994912147522, "num_tokens": 6941480.0, "step": 1920 }, { "entropy": 1.9234375, "epoch": 0.4267551133222775, "grad_norm": 4.15484619140625, "learning_rate": 4.853945562922725e-06, "loss": 1.9413, "mean_token_accuracy": 0.5358347952365875, "num_tokens": 6975371.0, "step": 1930 }, { "entropy": 1.98359375, "epoch": 0.42896627971254836, "grad_norm": 3.328986883163452, "learning_rate": 4.851914755188149e-06, "loss": 1.9963, "mean_token_accuracy": 0.5291261881589889, "num_tokens": 7012473.0, "step": 1940 }, { "entropy": 1.992578125, "epoch": 0.4311774461028192, "grad_norm": 3.605990171432495, "learning_rate": 4.849870356923465e-06, "loss": 1.9949, "mean_token_accuracy": 0.5312375798821449, "num_tokens": 7047117.0, "step": 1950 }, { "entropy": 1.98828125, "epoch": 0.43338861249309013, "grad_norm": 3.2588589191436768, "learning_rate": 4.847812379942217e-06, "loss": 2.0122, "mean_token_accuracy": 0.5246651962399482, "num_tokens": 7082697.0, "step": 1960 }, { "entropy": 1.95546875, "epoch": 0.435599778883361, "grad_norm": 3.2713136672973633, "learning_rate": 4.845740836136419e-06, "loss": 1.9502, "mean_token_accuracy": 0.535953414440155, "num_tokens": 7119748.0, "step": 1970 }, { "entropy": 1.982421875, "epoch": 0.43781094527363185, "grad_norm": 3.7937722206115723, "learning_rate": 4.843655737476478e-06, "loss": 1.9975, "mean_token_accuracy": 0.5286378636956215, "num_tokens": 7154907.0, "step": 1980 }, { "entropy": 2.01953125, "epoch": 0.4400221116639027, "grad_norm": 3.515338182449341, "learning_rate": 4.841557096011128e-06, "loss": 2.0227, "mean_token_accuracy": 0.5251514956355094, "num_tokens": 7193118.0, "step": 1990 }, { "entropy": 1.98984375, "epoch": 0.44223327805417356, "grad_norm": 3.7926671504974365, "learning_rate": 4.839444923867361e-06, "loss": 2.0032, "mean_token_accuracy": 0.5273692816495895, "num_tokens": 7229210.0, "step": 2000 }, { "epoch": 0.44223327805417356, "eval_entropy": 1.9872590174129354, "eval_loss": 1.9946436882019043, "eval_mean_token_accuracy": 0.5280916218733906, "eval_num_tokens": 7229210.0, "eval_runtime": 111.8723, "eval_samples_per_second": 143.735, "eval_steps_per_second": 8.983, "step": 2000 }, { "entropy": 1.983984375, "epoch": 0.4444444444444444, "grad_norm": 3.584087371826172, "learning_rate": 4.837319233250355e-06, "loss": 1.9848, "mean_token_accuracy": 0.528825818002224, "num_tokens": 7266601.0, "step": 2010 }, { "entropy": 1.94296875, "epoch": 0.44665561083471533, "grad_norm": 2.794679880142212, "learning_rate": 4.835180036443405e-06, "loss": 1.9537, "mean_token_accuracy": 0.532137893140316, "num_tokens": 7301710.0, "step": 2020 }, { "entropy": 1.97890625, "epoch": 0.4488667772249862, "grad_norm": 3.4439918994903564, "learning_rate": 4.833027345807851e-06, "loss": 2.0035, "mean_token_accuracy": 0.5284280598163604, "num_tokens": 7337896.0, "step": 2030 }, { "entropy": 2.000390625, "epoch": 0.45107794361525705, "grad_norm": 2.858286142349243, "learning_rate": 4.830861173783007e-06, "loss": 2.013, "mean_token_accuracy": 0.531543330848217, "num_tokens": 7376444.0, "step": 2040 }, { "entropy": 1.984765625, "epoch": 0.4532891100055279, "grad_norm": 2.9520671367645264, "learning_rate": 4.82868153288609e-06, "loss": 1.9783, "mean_token_accuracy": 0.5301756590604783, "num_tokens": 7413600.0, "step": 2050 }, { "entropy": 2.026171875, "epoch": 0.45550027639579876, "grad_norm": 3.400359869003296, "learning_rate": 4.826488435712146e-06, "loss": 2.0126, "mean_token_accuracy": 0.5227610245347023, "num_tokens": 7450416.0, "step": 2060 }, { "entropy": 1.98984375, "epoch": 0.4577114427860697, "grad_norm": 3.1152267456054688, "learning_rate": 4.8242818949339795e-06, "loss": 1.9815, "mean_token_accuracy": 0.5310664609074592, "num_tokens": 7490517.0, "step": 2070 }, { "entropy": 1.99375, "epoch": 0.45992260917634054, "grad_norm": 3.58620023727417, "learning_rate": 4.822061923302077e-06, "loss": 2.0008, "mean_token_accuracy": 0.5222583279013634, "num_tokens": 7526522.0, "step": 2080 }, { "entropy": 1.98671875, "epoch": 0.4621337755666114, "grad_norm": 3.3485400676727295, "learning_rate": 4.8198285336445345e-06, "loss": 1.9971, "mean_token_accuracy": 0.527626684308052, "num_tokens": 7561247.0, "step": 2090 }, { "entropy": 1.960546875, "epoch": 0.46434494195688225, "grad_norm": 3.2537410259246826, "learning_rate": 4.817581738866988e-06, "loss": 1.9854, "mean_token_accuracy": 0.52382532954216, "num_tokens": 7598123.0, "step": 2100 }, { "entropy": 1.980859375, "epoch": 0.4665561083471531, "grad_norm": 3.2869839668273926, "learning_rate": 4.8153215519525294e-06, "loss": 1.9762, "mean_token_accuracy": 0.5292315185070038, "num_tokens": 7633809.0, "step": 2110 }, { "entropy": 1.99765625, "epoch": 0.46876727473742397, "grad_norm": 2.608034372329712, "learning_rate": 4.813047985961641e-06, "loss": 2.0076, "mean_token_accuracy": 0.5262059271335602, "num_tokens": 7673415.0, "step": 2120 }, { "entropy": 1.951953125, "epoch": 0.4709784411276949, "grad_norm": 3.475959300994873, "learning_rate": 4.810761054032115e-06, "loss": 1.9906, "mean_token_accuracy": 0.5288190424442292, "num_tokens": 7707130.0, "step": 2130 }, { "entropy": 1.99609375, "epoch": 0.47318960751796574, "grad_norm": 3.474595785140991, "learning_rate": 4.8084607693789796e-06, "loss": 1.9953, "mean_token_accuracy": 0.5295667469501495, "num_tokens": 7739702.0, "step": 2140 }, { "entropy": 2.020703125, "epoch": 0.4754007739082366, "grad_norm": 3.2300822734832764, "learning_rate": 4.806147145294418e-06, "loss": 2.0104, "mean_token_accuracy": 0.5236712947487832, "num_tokens": 7774323.0, "step": 2150 }, { "entropy": 2.00859375, "epoch": 0.47761194029850745, "grad_norm": 3.140997886657715, "learning_rate": 4.8038201951477e-06, "loss": 2.0193, "mean_token_accuracy": 0.5262003257870674, "num_tokens": 7813410.0, "step": 2160 }, { "entropy": 1.93828125, "epoch": 0.4798231066887783, "grad_norm": 3.0355441570281982, "learning_rate": 4.801479932385097e-06, "loss": 1.9525, "mean_token_accuracy": 0.5373364612460136, "num_tokens": 7850044.0, "step": 2170 }, { "entropy": 1.9640625, "epoch": 0.4820342730790492, "grad_norm": 3.3321173191070557, "learning_rate": 4.799126370529807e-06, "loss": 1.9549, "mean_token_accuracy": 0.5367608845233918, "num_tokens": 7885208.0, "step": 2180 }, { "entropy": 1.924609375, "epoch": 0.4842454394693201, "grad_norm": 3.8043746948242188, "learning_rate": 4.796759523181881e-06, "loss": 1.9077, "mean_token_accuracy": 0.5465276122093201, "num_tokens": 7919612.0, "step": 2190 }, { "entropy": 1.978125, "epoch": 0.48645660585959094, "grad_norm": 3.251349449157715, "learning_rate": 4.794379404018134e-06, "loss": 1.9966, "mean_token_accuracy": 0.5266179665923119, "num_tokens": 7952907.0, "step": 2200 }, { "entropy": 1.976171875, "epoch": 0.4886677722498618, "grad_norm": 3.3656363487243652, "learning_rate": 4.7919860267920766e-06, "loss": 2.0095, "mean_token_accuracy": 0.5276166632771492, "num_tokens": 7988354.0, "step": 2210 }, { "entropy": 2.015234375, "epoch": 0.49087893864013266, "grad_norm": 3.0376927852630615, "learning_rate": 4.789579405333829e-06, "loss": 2.0095, "mean_token_accuracy": 0.5284107387065887, "num_tokens": 8025464.0, "step": 2220 }, { "entropy": 1.958203125, "epoch": 0.4930901050304035, "grad_norm": 3.3354475498199463, "learning_rate": 4.787159553550044e-06, "loss": 1.9554, "mean_token_accuracy": 0.5324451982975006, "num_tokens": 8059773.0, "step": 2230 }, { "entropy": 1.946484375, "epoch": 0.4953012714206744, "grad_norm": 3.2195026874542236, "learning_rate": 4.784726485423826e-06, "loss": 1.9755, "mean_token_accuracy": 0.5312342554330826, "num_tokens": 8095824.0, "step": 2240 }, { "entropy": 1.943359375, "epoch": 0.4975124378109453, "grad_norm": 3.6470742225646973, "learning_rate": 4.782280215014649e-06, "loss": 1.949, "mean_token_accuracy": 0.5355236887931824, "num_tokens": 8127561.0, "step": 2250 }, { "entropy": 1.994921875, "epoch": 0.49972360420121614, "grad_norm": 2.461458683013916, "learning_rate": 4.779820756458277e-06, "loss": 2.0066, "mean_token_accuracy": 0.5283254072070122, "num_tokens": 8162809.0, "step": 2260 }, { "entropy": 1.948046875, "epoch": 0.5019347705914871, "grad_norm": 3.2263569831848145, "learning_rate": 4.777348123966682e-06, "loss": 1.9558, "mean_token_accuracy": 0.5369130149483681, "num_tokens": 8196851.0, "step": 2270 }, { "entropy": 1.953515625, "epoch": 0.5041459369817579, "grad_norm": 3.399358034133911, "learning_rate": 4.77486233182796e-06, "loss": 1.9817, "mean_token_accuracy": 0.5317654237151146, "num_tokens": 8234282.0, "step": 2280 }, { "entropy": 1.987109375, "epoch": 0.5063571033720288, "grad_norm": 3.4737977981567383, "learning_rate": 4.772363394406252e-06, "loss": 2.0086, "mean_token_accuracy": 0.526680725812912, "num_tokens": 8270520.0, "step": 2290 }, { "entropy": 1.948046875, "epoch": 0.5085682697622996, "grad_norm": 2.7183966636657715, "learning_rate": 4.769851326141658e-06, "loss": 1.9656, "mean_token_accuracy": 0.5319627165794373, "num_tokens": 8304910.0, "step": 2300 }, { "entropy": 1.99921875, "epoch": 0.5107794361525705, "grad_norm": 2.9910993576049805, "learning_rate": 4.767326141550155e-06, "loss": 2.0497, "mean_token_accuracy": 0.5210982084274292, "num_tokens": 8343674.0, "step": 2310 }, { "entropy": 1.99609375, "epoch": 0.5129906025428413, "grad_norm": 3.245457172393799, "learning_rate": 4.764787855223509e-06, "loss": 1.9975, "mean_token_accuracy": 0.5253664508461953, "num_tokens": 8376757.0, "step": 2320 }, { "entropy": 1.94921875, "epoch": 0.5152017689331122, "grad_norm": 3.09206223487854, "learning_rate": 4.7622364818292025e-06, "loss": 1.9532, "mean_token_accuracy": 0.5335244342684746, "num_tokens": 8410129.0, "step": 2330 }, { "entropy": 1.980078125, "epoch": 0.5174129353233831, "grad_norm": 3.0276973247528076, "learning_rate": 4.759672036110332e-06, "loss": 1.9572, "mean_token_accuracy": 0.5330440893769264, "num_tokens": 8446472.0, "step": 2340 }, { "entropy": 2.012890625, "epoch": 0.5196241017136539, "grad_norm": 3.503645658493042, "learning_rate": 4.75709453288554e-06, "loss": 2.0094, "mean_token_accuracy": 0.5294659733772278, "num_tokens": 8485139.0, "step": 2350 }, { "entropy": 1.96328125, "epoch": 0.5218352681039248, "grad_norm": 2.74729323387146, "learning_rate": 4.754503987048918e-06, "loss": 1.9551, "mean_token_accuracy": 0.5381256014108657, "num_tokens": 8523225.0, "step": 2360 }, { "entropy": 1.962109375, "epoch": 0.5240464344941956, "grad_norm": 3.1583802700042725, "learning_rate": 4.751900413569924e-06, "loss": 1.9806, "mean_token_accuracy": 0.5270368605852127, "num_tokens": 8557403.0, "step": 2370 }, { "entropy": 1.980078125, "epoch": 0.5262576008844666, "grad_norm": 3.5454792976379395, "learning_rate": 4.749283827493297e-06, "loss": 2.0092, "mean_token_accuracy": 0.5232952460646629, "num_tokens": 8592216.0, "step": 2380 }, { "entropy": 1.973046875, "epoch": 0.5284687672747375, "grad_norm": 3.267307758331299, "learning_rate": 4.746654243938971e-06, "loss": 1.9954, "mean_token_accuracy": 0.5297577306628227, "num_tokens": 8628427.0, "step": 2390 }, { "entropy": 1.970703125, "epoch": 0.5306799336650083, "grad_norm": 3.108689308166504, "learning_rate": 4.744011678101982e-06, "loss": 1.9858, "mean_token_accuracy": 0.5295312121510506, "num_tokens": 8663057.0, "step": 2400 }, { "entropy": 1.95234375, "epoch": 0.5328911000552792, "grad_norm": 3.545428991317749, "learning_rate": 4.7413561452523875e-06, "loss": 1.9886, "mean_token_accuracy": 0.5298693463206291, "num_tokens": 8697637.0, "step": 2410 }, { "entropy": 1.99765625, "epoch": 0.53510226644555, "grad_norm": 3.096508741378784, "learning_rate": 4.7386876607351735e-06, "loss": 1.9999, "mean_token_accuracy": 0.5239310264587402, "num_tokens": 8737513.0, "step": 2420 }, { "entropy": 1.973828125, "epoch": 0.5373134328358209, "grad_norm": 3.313612222671509, "learning_rate": 4.7360062399701665e-06, "loss": 1.9599, "mean_token_accuracy": 0.534371504187584, "num_tokens": 8774475.0, "step": 2430 }, { "entropy": 1.97421875, "epoch": 0.5395245992260918, "grad_norm": 2.5942392349243164, "learning_rate": 4.733311898451947e-06, "loss": 1.9701, "mean_token_accuracy": 0.5348088696599007, "num_tokens": 8811186.0, "step": 2440 }, { "entropy": 2.0, "epoch": 0.5417357656163626, "grad_norm": 3.3712050914764404, "learning_rate": 4.730604651749756e-06, "loss": 2.0208, "mean_token_accuracy": 0.520662447810173, "num_tokens": 8847638.0, "step": 2450 }, { "entropy": 1.941796875, "epoch": 0.5439469320066335, "grad_norm": 4.207601070404053, "learning_rate": 4.727884515507408e-06, "loss": 1.9293, "mean_token_accuracy": 0.5403480961918831, "num_tokens": 8881185.0, "step": 2460 }, { "entropy": 1.980859375, "epoch": 0.5461580983969043, "grad_norm": 2.924936532974243, "learning_rate": 4.7251515054432e-06, "loss": 1.9963, "mean_token_accuracy": 0.5296011701226234, "num_tokens": 8919018.0, "step": 2470 }, { "entropy": 1.98203125, "epoch": 0.5483692647871752, "grad_norm": 3.207223892211914, "learning_rate": 4.7224056373498186e-06, "loss": 1.9833, "mean_token_accuracy": 0.5308783873915672, "num_tokens": 8954854.0, "step": 2480 }, { "entropy": 2.0046875, "epoch": 0.5505804311774462, "grad_norm": 3.3104751110076904, "learning_rate": 4.719646927094252e-06, "loss": 1.9986, "mean_token_accuracy": 0.5207533955574035, "num_tokens": 8991276.0, "step": 2490 }, { "entropy": 2.006640625, "epoch": 0.552791597567717, "grad_norm": 3.401648998260498, "learning_rate": 4.7168753906176975e-06, "loss": 2.0062, "mean_token_accuracy": 0.5235192358493805, "num_tokens": 9027642.0, "step": 2500 }, { "epoch": 0.552791597567717, "eval_entropy": 1.9466184701492537, "eval_loss": 1.9719250202178955, "eval_mean_token_accuracy": 0.5324211383933452, "eval_num_tokens": 9027642.0, "eval_runtime": 111.7908, "eval_samples_per_second": 143.84, "eval_steps_per_second": 8.99, "step": 2500 }, { "entropy": 1.926171875, "epoch": 0.5550027639579879, "grad_norm": 3.34617018699646, "learning_rate": 4.714091043935467e-06, "loss": 1.9613, "mean_token_accuracy": 0.5319983184337616, "num_tokens": 9062123.0, "step": 2510 }, { "entropy": 1.94453125, "epoch": 0.5572139303482587, "grad_norm": 3.2840592861175537, "learning_rate": 4.711293903136898e-06, "loss": 1.9765, "mean_token_accuracy": 0.5307324916124344, "num_tokens": 9097000.0, "step": 2520 }, { "entropy": 1.951953125, "epoch": 0.5594250967385296, "grad_norm": 3.3803882598876953, "learning_rate": 4.7084839843852545e-06, "loss": 1.9291, "mean_token_accuracy": 0.5374570921063423, "num_tokens": 9135105.0, "step": 2530 }, { "entropy": 1.96953125, "epoch": 0.5616362631288004, "grad_norm": 3.2837789058685303, "learning_rate": 4.705661303917645e-06, "loss": 1.955, "mean_token_accuracy": 0.5328634202480316, "num_tokens": 9171242.0, "step": 2540 }, { "entropy": 1.96484375, "epoch": 0.5638474295190713, "grad_norm": 2.92405104637146, "learning_rate": 4.702825878044914e-06, "loss": 1.9763, "mean_token_accuracy": 0.5340756550431252, "num_tokens": 9207883.0, "step": 2550 }, { "entropy": 1.921875, "epoch": 0.5660585959093422, "grad_norm": 3.626108407974243, "learning_rate": 4.69997772315156e-06, "loss": 1.9277, "mean_token_accuracy": 0.543017354607582, "num_tokens": 9244133.0, "step": 2560 }, { "entropy": 1.923046875, "epoch": 0.568269762299613, "grad_norm": 3.578974723815918, "learning_rate": 4.6971168556956344e-06, "loss": 1.9463, "mean_token_accuracy": 0.532431548833847, "num_tokens": 9277380.0, "step": 2570 }, { "entropy": 1.95859375, "epoch": 0.5704809286898839, "grad_norm": 2.7316198348999023, "learning_rate": 4.69424329220865e-06, "loss": 1.9567, "mean_token_accuracy": 0.5378687530755997, "num_tokens": 9313099.0, "step": 2580 }, { "entropy": 1.9796875, "epoch": 0.5726920950801547, "grad_norm": 3.063166379928589, "learning_rate": 4.69135704929548e-06, "loss": 1.9925, "mean_token_accuracy": 0.5290182754397392, "num_tokens": 9350440.0, "step": 2590 }, { "entropy": 1.999609375, "epoch": 0.5749032614704257, "grad_norm": 3.381293296813965, "learning_rate": 4.688458143634269e-06, "loss": 1.9803, "mean_token_accuracy": 0.5303419068455696, "num_tokens": 9387127.0, "step": 2600 }, { "entropy": 2.02109375, "epoch": 0.5771144278606966, "grad_norm": 3.1944916248321533, "learning_rate": 4.685546591976331e-06, "loss": 2.0231, "mean_token_accuracy": 0.5250900968909263, "num_tokens": 9422981.0, "step": 2610 }, { "entropy": 2.004296875, "epoch": 0.5793255942509674, "grad_norm": 3.9806878566741943, "learning_rate": 4.682622411146056e-06, "loss": 1.9871, "mean_token_accuracy": 0.5325405180454255, "num_tokens": 9458541.0, "step": 2620 }, { "entropy": 2.00859375, "epoch": 0.5815367606412383, "grad_norm": 3.2026121616363525, "learning_rate": 4.679685618040812e-06, "loss": 2.0316, "mean_token_accuracy": 0.5258310928940773, "num_tokens": 9495365.0, "step": 2630 }, { "entropy": 1.93046875, "epoch": 0.5837479270315091, "grad_norm": 3.081270933151245, "learning_rate": 4.676736229630846e-06, "loss": 1.9394, "mean_token_accuracy": 0.5424817472696304, "num_tokens": 9533330.0, "step": 2640 }, { "entropy": 1.966015625, "epoch": 0.58595909342178, "grad_norm": 3.2268669605255127, "learning_rate": 4.673774262959186e-06, "loss": 1.9853, "mean_token_accuracy": 0.5290401428937912, "num_tokens": 9567016.0, "step": 2650 }, { "entropy": 1.987890625, "epoch": 0.5881702598120508, "grad_norm": 3.1565258502960205, "learning_rate": 4.6707997351415475e-06, "loss": 1.9969, "mean_token_accuracy": 0.5264357924461365, "num_tokens": 9602519.0, "step": 2660 }, { "entropy": 1.965234375, "epoch": 0.5903814262023217, "grad_norm": 2.6177172660827637, "learning_rate": 4.667812663366225e-06, "loss": 1.9691, "mean_token_accuracy": 0.5364043325185776, "num_tokens": 9639494.0, "step": 2670 }, { "entropy": 1.948046875, "epoch": 0.5925925925925926, "grad_norm": 3.227576494216919, "learning_rate": 4.664813064894002e-06, "loss": 1.9758, "mean_token_accuracy": 0.5293244972825051, "num_tokens": 9675354.0, "step": 2680 }, { "entropy": 1.989453125, "epoch": 0.5948037589828634, "grad_norm": 2.9756932258605957, "learning_rate": 4.661800957058047e-06, "loss": 1.975, "mean_token_accuracy": 0.5286542773246765, "num_tokens": 9711868.0, "step": 2690 }, { "entropy": 1.958203125, "epoch": 0.5970149253731343, "grad_norm": 3.256072998046875, "learning_rate": 4.6587763572638125e-06, "loss": 1.9724, "mean_token_accuracy": 0.5347406268119812, "num_tokens": 9747423.0, "step": 2700 }, { "entropy": 1.95234375, "epoch": 0.5992260917634052, "grad_norm": 2.700119733810425, "learning_rate": 4.655739282988936e-06, "loss": 1.988, "mean_token_accuracy": 0.5346204385161399, "num_tokens": 9782834.0, "step": 2710 }, { "entropy": 1.970703125, "epoch": 0.6014372581536761, "grad_norm": 2.6439340114593506, "learning_rate": 4.65268975178314e-06, "loss": 1.9822, "mean_token_accuracy": 0.5348147198557853, "num_tokens": 9818521.0, "step": 2720 }, { "entropy": 1.955078125, "epoch": 0.603648424543947, "grad_norm": 3.3310129642486572, "learning_rate": 4.649627781268128e-06, "loss": 1.9452, "mean_token_accuracy": 0.5295668348670006, "num_tokens": 9854380.0, "step": 2730 }, { "entropy": 1.9234375, "epoch": 0.6058595909342178, "grad_norm": 2.8515071868896484, "learning_rate": 4.646553389137485e-06, "loss": 1.9506, "mean_token_accuracy": 0.5384080529212951, "num_tokens": 9889161.0, "step": 2740 }, { "entropy": 1.961328125, "epoch": 0.6080707573244887, "grad_norm": 3.505270004272461, "learning_rate": 4.643466593156574e-06, "loss": 1.9647, "mean_token_accuracy": 0.5331409767270088, "num_tokens": 9924964.0, "step": 2750 }, { "entropy": 1.96484375, "epoch": 0.6102819237147595, "grad_norm": 3.046457529067993, "learning_rate": 4.640367411162432e-06, "loss": 1.9464, "mean_token_accuracy": 0.5367121875286103, "num_tokens": 9961067.0, "step": 2760 }, { "entropy": 1.969921875, "epoch": 0.6124930901050304, "grad_norm": 3.0849227905273438, "learning_rate": 4.637255861063672e-06, "loss": 1.9546, "mean_token_accuracy": 0.5341137796640396, "num_tokens": 9999608.0, "step": 2770 }, { "entropy": 1.961328125, "epoch": 0.6147042564953012, "grad_norm": 3.042711019515991, "learning_rate": 4.634131960840371e-06, "loss": 1.965, "mean_token_accuracy": 0.5323047161102294, "num_tokens": 10034892.0, "step": 2780 }, { "entropy": 1.966796875, "epoch": 0.6169154228855721, "grad_norm": 3.3474748134613037, "learning_rate": 4.630995728543977e-06, "loss": 1.9494, "mean_token_accuracy": 0.5387876823544502, "num_tokens": 10068777.0, "step": 2790 }, { "entropy": 1.951953125, "epoch": 0.619126589275843, "grad_norm": 2.858520984649658, "learning_rate": 4.6278471822971945e-06, "loss": 1.9723, "mean_token_accuracy": 0.5322260513901711, "num_tokens": 10104236.0, "step": 2800 }, { "entropy": 1.90859375, "epoch": 0.6213377556661138, "grad_norm": 3.2176084518432617, "learning_rate": 4.624686340293886e-06, "loss": 1.9147, "mean_token_accuracy": 0.539067667722702, "num_tokens": 10142142.0, "step": 2810 }, { "entropy": 1.953515625, "epoch": 0.6235489220563848, "grad_norm": 2.986359119415283, "learning_rate": 4.6215132207989645e-06, "loss": 1.96, "mean_token_accuracy": 0.5324950978159905, "num_tokens": 10179082.0, "step": 2820 }, { "entropy": 1.975390625, "epoch": 0.6257600884466556, "grad_norm": 2.772944211959839, "learning_rate": 4.618327842148288e-06, "loss": 1.9624, "mean_token_accuracy": 0.533715794980526, "num_tokens": 10215443.0, "step": 2830 }, { "entropy": 1.95625, "epoch": 0.6279712548369265, "grad_norm": 2.8045969009399414, "learning_rate": 4.615130222748554e-06, "loss": 1.9412, "mean_token_accuracy": 0.5376159489154816, "num_tokens": 10249725.0, "step": 2840 }, { "entropy": 1.916796875, "epoch": 0.6301824212271974, "grad_norm": 3.2690083980560303, "learning_rate": 4.611920381077194e-06, "loss": 1.9125, "mean_token_accuracy": 0.5433236837387085, "num_tokens": 10285889.0, "step": 2850 }, { "entropy": 1.980859375, "epoch": 0.6323935876174682, "grad_norm": 3.448453664779663, "learning_rate": 4.608698335682266e-06, "loss": 2.0185, "mean_token_accuracy": 0.5267414793372154, "num_tokens": 10321597.0, "step": 2860 }, { "entropy": 1.95703125, "epoch": 0.6346047540077391, "grad_norm": 3.2905313968658447, "learning_rate": 4.6054641051823475e-06, "loss": 1.918, "mean_token_accuracy": 0.5403017580509186, "num_tokens": 10358916.0, "step": 2870 }, { "entropy": 1.89921875, "epoch": 0.6368159203980099, "grad_norm": 3.1981401443481445, "learning_rate": 4.602217708266424e-06, "loss": 1.9213, "mean_token_accuracy": 0.5386829376220703, "num_tokens": 10393262.0, "step": 2880 }, { "entropy": 1.878515625, "epoch": 0.6390270867882808, "grad_norm": 3.406118631362915, "learning_rate": 4.598959163693789e-06, "loss": 1.9213, "mean_token_accuracy": 0.5412570327520371, "num_tokens": 10427612.0, "step": 2890 }, { "entropy": 1.929296875, "epoch": 0.6412382531785517, "grad_norm": 2.9147799015045166, "learning_rate": 4.595688490293929e-06, "loss": 1.938, "mean_token_accuracy": 0.5343619927763938, "num_tokens": 10464389.0, "step": 2900 }, { "entropy": 1.981640625, "epoch": 0.6434494195688225, "grad_norm": 2.7654571533203125, "learning_rate": 4.592405706966417e-06, "loss": 1.9866, "mean_token_accuracy": 0.5300002068281173, "num_tokens": 10503109.0, "step": 2910 }, { "entropy": 1.975390625, "epoch": 0.6456605859590934, "grad_norm": 3.0418496131896973, "learning_rate": 4.5891108326808046e-06, "loss": 1.996, "mean_token_accuracy": 0.5277341455221176, "num_tokens": 10539856.0, "step": 2920 }, { "entropy": 1.933203125, "epoch": 0.6478717523493643, "grad_norm": 3.482114315032959, "learning_rate": 4.585803886476508e-06, "loss": 1.9409, "mean_token_accuracy": 0.5337098792195321, "num_tokens": 10574486.0, "step": 2930 }, { "entropy": 1.929296875, "epoch": 0.6500829187396352, "grad_norm": 3.4069488048553467, "learning_rate": 4.582484887462704e-06, "loss": 1.9188, "mean_token_accuracy": 0.5414301753044128, "num_tokens": 10609416.0, "step": 2940 }, { "entropy": 1.9421875, "epoch": 0.652294085129906, "grad_norm": 3.3480241298675537, "learning_rate": 4.579153854818215e-06, "loss": 1.9566, "mean_token_accuracy": 0.5342737689614296, "num_tokens": 10645800.0, "step": 2950 }, { "entropy": 1.92890625, "epoch": 0.6545052515201769, "grad_norm": 3.1822264194488525, "learning_rate": 4.5758108077914e-06, "loss": 1.9536, "mean_token_accuracy": 0.5342486649751663, "num_tokens": 10682374.0, "step": 2960 }, { "entropy": 1.91640625, "epoch": 0.6567164179104478, "grad_norm": 3.1464545726776123, "learning_rate": 4.572455765700043e-06, "loss": 1.9046, "mean_token_accuracy": 0.5395681723952294, "num_tokens": 10719231.0, "step": 2970 }, { "entropy": 1.8984375, "epoch": 0.6589275843007186, "grad_norm": 3.3488457202911377, "learning_rate": 4.5690887479312415e-06, "loss": 1.923, "mean_token_accuracy": 0.5402853652834892, "num_tokens": 10753444.0, "step": 2980 }, { "entropy": 1.90625, "epoch": 0.6611387506909895, "grad_norm": 2.9410223960876465, "learning_rate": 4.565709773941295e-06, "loss": 1.934, "mean_token_accuracy": 0.5421337768435478, "num_tokens": 10789433.0, "step": 2990 }, { "entropy": 1.994140625, "epoch": 0.6633499170812603, "grad_norm": 3.083699941635132, "learning_rate": 4.5623188632555895e-06, "loss": 1.9807, "mean_token_accuracy": 0.5336082071065903, "num_tokens": 10825994.0, "step": 3000 }, { "epoch": 0.6633499170812603, "eval_entropy": 1.9587919776119402, "eval_loss": 1.95093834400177, "eval_mean_token_accuracy": 0.5356559536646848, "eval_num_tokens": 10825994.0, "eval_runtime": 111.6228, "eval_samples_per_second": 144.057, "eval_steps_per_second": 9.004, "step": 3000 }, { "entropy": 1.923828125, "epoch": 0.6655610834715312, "grad_norm": 3.66687273979187, "learning_rate": 4.558916035468492e-06, "loss": 1.9437, "mean_token_accuracy": 0.5405759528279305, "num_tokens": 10860794.0, "step": 3010 }, { "entropy": 1.927734375, "epoch": 0.6677722498618021, "grad_norm": 3.2094507217407227, "learning_rate": 4.555501310243225e-06, "loss": 1.9873, "mean_token_accuracy": 0.5294178947806358, "num_tokens": 10899057.0, "step": 3020 }, { "entropy": 1.956640625, "epoch": 0.6699834162520729, "grad_norm": 3.5061943531036377, "learning_rate": 4.552074707311769e-06, "loss": 1.9453, "mean_token_accuracy": 0.5383028030395508, "num_tokens": 10935790.0, "step": 3030 }, { "entropy": 1.987109375, "epoch": 0.6721945826423439, "grad_norm": 2.8061094284057617, "learning_rate": 4.5486362464747335e-06, "loss": 1.9924, "mean_token_accuracy": 0.5299150764942169, "num_tokens": 10973298.0, "step": 3040 }, { "entropy": 1.97421875, "epoch": 0.6744057490326147, "grad_norm": 3.6874330043792725, "learning_rate": 4.54518594760125e-06, "loss": 1.9578, "mean_token_accuracy": 0.5319989040493965, "num_tokens": 11009753.0, "step": 3050 }, { "entropy": 1.96328125, "epoch": 0.6766169154228856, "grad_norm": 3.0986382961273193, "learning_rate": 4.541723830628859e-06, "loss": 1.9535, "mean_token_accuracy": 0.5299851894378662, "num_tokens": 11045967.0, "step": 3060 }, { "entropy": 1.940625, "epoch": 0.6788280818131565, "grad_norm": 3.353624105453491, "learning_rate": 4.5382499155633895e-06, "loss": 1.96, "mean_token_accuracy": 0.530767297744751, "num_tokens": 11082080.0, "step": 3070 }, { "entropy": 2.008984375, "epoch": 0.6810392482034273, "grad_norm": 3.0978360176086426, "learning_rate": 4.534764222478844e-06, "loss": 2.0142, "mean_token_accuracy": 0.5247927069664001, "num_tokens": 11119010.0, "step": 3080 }, { "entropy": 1.93828125, "epoch": 0.6832504145936982, "grad_norm": 3.3659987449645996, "learning_rate": 4.531266771517287e-06, "loss": 1.9362, "mean_token_accuracy": 0.5402613162994385, "num_tokens": 11155539.0, "step": 3090 }, { "entropy": 1.922265625, "epoch": 0.685461580983969, "grad_norm": 4.269067287445068, "learning_rate": 4.527757582888726e-06, "loss": 1.9395, "mean_token_accuracy": 0.5363096848130227, "num_tokens": 11191454.0, "step": 3100 }, { "entropy": 1.903125, "epoch": 0.6876727473742399, "grad_norm": 2.4798460006713867, "learning_rate": 4.524236676870994e-06, "loss": 1.892, "mean_token_accuracy": 0.545521354675293, "num_tokens": 11227263.0, "step": 3110 }, { "entropy": 1.926953125, "epoch": 0.6898839137645107, "grad_norm": 3.0905323028564453, "learning_rate": 4.520704073809631e-06, "loss": 1.9539, "mean_token_accuracy": 0.5366878464818001, "num_tokens": 11264236.0, "step": 3120 }, { "entropy": 1.905859375, "epoch": 0.6920950801547816, "grad_norm": 2.794585704803467, "learning_rate": 4.51715979411777e-06, "loss": 1.8946, "mean_token_accuracy": 0.5380493372678756, "num_tokens": 11300318.0, "step": 3130 }, { "entropy": 1.9765625, "epoch": 0.6943062465450525, "grad_norm": 2.948543071746826, "learning_rate": 4.513603858276018e-06, "loss": 2.0098, "mean_token_accuracy": 0.5298963755369186, "num_tokens": 11337328.0, "step": 3140 }, { "entropy": 1.9578125, "epoch": 0.6965174129353234, "grad_norm": 3.3547677993774414, "learning_rate": 4.510036286832335e-06, "loss": 1.9596, "mean_token_accuracy": 0.53755624294281, "num_tokens": 11373949.0, "step": 3150 }, { "entropy": 1.959765625, "epoch": 0.6987285793255943, "grad_norm": 3.0166943073272705, "learning_rate": 4.5064571004019195e-06, "loss": 1.9246, "mean_token_accuracy": 0.5420637220144272, "num_tokens": 11408443.0, "step": 3160 }, { "entropy": 1.9796875, "epoch": 0.7009397457158651, "grad_norm": 3.277949094772339, "learning_rate": 4.502866319667086e-06, "loss": 1.9714, "mean_token_accuracy": 0.5322265028953552, "num_tokens": 11445473.0, "step": 3170 }, { "entropy": 1.915625, "epoch": 0.703150912106136, "grad_norm": 3.3797526359558105, "learning_rate": 4.499263965377146e-06, "loss": 1.9236, "mean_token_accuracy": 0.5380560234189034, "num_tokens": 11480259.0, "step": 3180 }, { "entropy": 1.914453125, "epoch": 0.7053620784964069, "grad_norm": 3.5612270832061768, "learning_rate": 4.4956500583482905e-06, "loss": 1.9558, "mean_token_accuracy": 0.5386397585272789, "num_tokens": 11514003.0, "step": 3190 }, { "entropy": 1.888671875, "epoch": 0.7075732448866777, "grad_norm": 3.2914936542510986, "learning_rate": 4.492024619463467e-06, "loss": 1.9138, "mean_token_accuracy": 0.5368052333593368, "num_tokens": 11548624.0, "step": 3200 }, { "entropy": 1.954296875, "epoch": 0.7097844112769486, "grad_norm": 3.3482491970062256, "learning_rate": 4.48838766967226e-06, "loss": 1.9551, "mean_token_accuracy": 0.5341341644525528, "num_tokens": 11584216.0, "step": 3210 }, { "entropy": 1.992578125, "epoch": 0.7119955776672194, "grad_norm": 3.52199125289917, "learning_rate": 4.484739229990766e-06, "loss": 2.0123, "mean_token_accuracy": 0.5259271785616875, "num_tokens": 11621330.0, "step": 3220 }, { "entropy": 1.926171875, "epoch": 0.7142067440574903, "grad_norm": 3.8549458980560303, "learning_rate": 4.481079321501485e-06, "loss": 1.9445, "mean_token_accuracy": 0.5349083244800568, "num_tokens": 11656464.0, "step": 3230 }, { "entropy": 1.91640625, "epoch": 0.7164179104477612, "grad_norm": 3.172024726867676, "learning_rate": 4.47740796535318e-06, "loss": 1.9086, "mean_token_accuracy": 0.5436216592788696, "num_tokens": 11692035.0, "step": 3240 }, { "entropy": 1.941796875, "epoch": 0.718629076838032, "grad_norm": 3.3799118995666504, "learning_rate": 4.473725182760769e-06, "loss": 1.9111, "mean_token_accuracy": 0.5431932747364044, "num_tokens": 11728107.0, "step": 3250 }, { "entropy": 1.968359375, "epoch": 0.720840243228303, "grad_norm": 3.2504072189331055, "learning_rate": 4.470030995005196e-06, "loss": 1.9767, "mean_token_accuracy": 0.5296573370695115, "num_tokens": 11765845.0, "step": 3260 }, { "entropy": 1.967578125, "epoch": 0.7230514096185738, "grad_norm": 3.507723093032837, "learning_rate": 4.466325423433311e-06, "loss": 1.9903, "mean_token_accuracy": 0.5313287481665612, "num_tokens": 11802844.0, "step": 3270 }, { "entropy": 1.958203125, "epoch": 0.7252625760088447, "grad_norm": 2.964226484298706, "learning_rate": 4.462608489457743e-06, "loss": 1.9621, "mean_token_accuracy": 0.5350794792175293, "num_tokens": 11840340.0, "step": 3280 }, { "entropy": 1.90546875, "epoch": 0.7274737423991156, "grad_norm": 3.484192371368408, "learning_rate": 4.458880214556785e-06, "loss": 1.9395, "mean_token_accuracy": 0.5354994118213654, "num_tokens": 11874049.0, "step": 3290 }, { "entropy": 1.880078125, "epoch": 0.7296849087893864, "grad_norm": 3.1520373821258545, "learning_rate": 4.4551406202742535e-06, "loss": 1.9135, "mean_token_accuracy": 0.5401819556951523, "num_tokens": 11909617.0, "step": 3300 }, { "entropy": 1.933203125, "epoch": 0.7318960751796573, "grad_norm": 3.6023361682891846, "learning_rate": 4.451389728219381e-06, "loss": 1.9398, "mean_token_accuracy": 0.5388837993144989, "num_tokens": 11945348.0, "step": 3310 }, { "entropy": 1.940234375, "epoch": 0.7341072415699281, "grad_norm": 3.2926368713378906, "learning_rate": 4.447627560066683e-06, "loss": 1.9126, "mean_token_accuracy": 0.5391048103570938, "num_tokens": 11978508.0, "step": 3320 }, { "entropy": 1.979296875, "epoch": 0.736318407960199, "grad_norm": 3.710659980773926, "learning_rate": 4.443854137555833e-06, "loss": 1.9863, "mean_token_accuracy": 0.5324991881847382, "num_tokens": 12017113.0, "step": 3330 }, { "entropy": 1.895703125, "epoch": 0.7385295743504698, "grad_norm": 3.240388870239258, "learning_rate": 4.440069482491538e-06, "loss": 1.9236, "mean_token_accuracy": 0.5393800973892212, "num_tokens": 12053457.0, "step": 3340 }, { "entropy": 1.930859375, "epoch": 0.7407407407407407, "grad_norm": 2.951979875564575, "learning_rate": 4.436273616743412e-06, "loss": 1.9308, "mean_token_accuracy": 0.5348971873521805, "num_tokens": 12090714.0, "step": 3350 }, { "entropy": 1.916015625, "epoch": 0.7429519071310116, "grad_norm": 3.0989770889282227, "learning_rate": 4.432466562245851e-06, "loss": 1.9411, "mean_token_accuracy": 0.5346557691693306, "num_tokens": 12127624.0, "step": 3360 }, { "entropy": 1.916796875, "epoch": 0.7451630735212825, "grad_norm": 2.943408727645874, "learning_rate": 4.428648340997905e-06, "loss": 1.908, "mean_token_accuracy": 0.5415560081601143, "num_tokens": 12163280.0, "step": 3370 }, { "entropy": 1.94140625, "epoch": 0.7473742399115534, "grad_norm": 3.1663312911987305, "learning_rate": 4.4248189750631475e-06, "loss": 1.987, "mean_token_accuracy": 0.5312561333179474, "num_tokens": 12200609.0, "step": 3380 }, { "entropy": 1.95390625, "epoch": 0.7495854063018242, "grad_norm": 3.5459885597229004, "learning_rate": 4.420978486569557e-06, "loss": 1.952, "mean_token_accuracy": 0.5332310974597931, "num_tokens": 12235337.0, "step": 3390 }, { "entropy": 1.96484375, "epoch": 0.7517965726920951, "grad_norm": 3.4921398162841797, "learning_rate": 4.417126897709379e-06, "loss": 1.9421, "mean_token_accuracy": 0.5312773406505584, "num_tokens": 12271409.0, "step": 3400 }, { "entropy": 1.975390625, "epoch": 0.754007739082366, "grad_norm": 3.4567480087280273, "learning_rate": 4.413264230739007e-06, "loss": 1.9968, "mean_token_accuracy": 0.526788805425167, "num_tokens": 12306986.0, "step": 3410 }, { "entropy": 1.935546875, "epoch": 0.7562189054726368, "grad_norm": 3.529651403427124, "learning_rate": 4.409390507978846e-06, "loss": 1.9246, "mean_token_accuracy": 0.5403603315353394, "num_tokens": 12341721.0, "step": 3420 }, { "entropy": 1.89921875, "epoch": 0.7584300718629077, "grad_norm": 3.5528626441955566, "learning_rate": 4.405505751813186e-06, "loss": 1.9017, "mean_token_accuracy": 0.5436147466301918, "num_tokens": 12376862.0, "step": 3430 }, { "entropy": 1.939453125, "epoch": 0.7606412382531785, "grad_norm": 3.1853108406066895, "learning_rate": 4.401609984690077e-06, "loss": 1.9574, "mean_token_accuracy": 0.5320401027798652, "num_tokens": 12413448.0, "step": 3440 }, { "entropy": 1.914453125, "epoch": 0.7628524046434494, "grad_norm": 3.595334529876709, "learning_rate": 4.3977032291211935e-06, "loss": 1.9286, "mean_token_accuracy": 0.5395437106490135, "num_tokens": 12448425.0, "step": 3450 }, { "entropy": 1.923046875, "epoch": 0.7650635710337202, "grad_norm": 3.1512863636016846, "learning_rate": 4.393785507681707e-06, "loss": 1.9097, "mean_token_accuracy": 0.5434191063046455, "num_tokens": 12483050.0, "step": 3460 }, { "entropy": 1.95234375, "epoch": 0.7672747374239911, "grad_norm": 3.246129035949707, "learning_rate": 4.389856843010154e-06, "loss": 1.9747, "mean_token_accuracy": 0.5359687626361846, "num_tokens": 12519332.0, "step": 3470 }, { "entropy": 1.982421875, "epoch": 0.7694859038142621, "grad_norm": 3.3705050945281982, "learning_rate": 4.38591725780831e-06, "loss": 1.984, "mean_token_accuracy": 0.5291391164064407, "num_tokens": 12557424.0, "step": 3480 }, { "entropy": 1.9296875, "epoch": 0.7716970702045329, "grad_norm": 3.7661564350128174, "learning_rate": 4.381966774841051e-06, "loss": 1.9229, "mean_token_accuracy": 0.5386329710483551, "num_tokens": 12593348.0, "step": 3490 }, { "entropy": 1.90703125, "epoch": 0.7739082365948038, "grad_norm": 3.2870442867279053, "learning_rate": 4.3780054169362285e-06, "loss": 1.9325, "mean_token_accuracy": 0.5367092192173004, "num_tokens": 12629313.0, "step": 3500 }, { "epoch": 0.7739082365948038, "eval_entropy": 1.9186178482587064, "eval_loss": 1.931942105293274, "eval_mean_token_accuracy": 0.538700125021721, "eval_num_tokens": 12629313.0, "eval_runtime": 111.7968, "eval_samples_per_second": 143.832, "eval_steps_per_second": 8.99, "step": 3500 }, { "entropy": 1.972265625, "epoch": 0.7761194029850746, "grad_norm": 2.6008334159851074, "learning_rate": 4.374033206984531e-06, "loss": 1.9724, "mean_token_accuracy": 0.5319897070527076, "num_tokens": 12664088.0, "step": 3510 }, { "entropy": 1.9421875, "epoch": 0.7783305693753455, "grad_norm": 2.7723631858825684, "learning_rate": 4.370050167939361e-06, "loss": 1.9197, "mean_token_accuracy": 0.5419470056891441, "num_tokens": 12697507.0, "step": 3520 }, { "entropy": 1.919921875, "epoch": 0.7805417357656164, "grad_norm": 3.474357843399048, "learning_rate": 4.366056322816692e-06, "loss": 1.9082, "mean_token_accuracy": 0.5425771564245224, "num_tokens": 12732612.0, "step": 3530 }, { "entropy": 1.913671875, "epoch": 0.7827529021558872, "grad_norm": 2.5832314491271973, "learning_rate": 4.3620516946949435e-06, "loss": 1.948, "mean_token_accuracy": 0.5381650015711784, "num_tokens": 12769575.0, "step": 3540 }, { "entropy": 1.959765625, "epoch": 0.7849640685461581, "grad_norm": 3.4367220401763916, "learning_rate": 4.358036306714842e-06, "loss": 1.9681, "mean_token_accuracy": 0.5334075421094895, "num_tokens": 12806084.0, "step": 3550 }, { "entropy": 1.897265625, "epoch": 0.7871752349364289, "grad_norm": 3.8769137859344482, "learning_rate": 4.354010182079292e-06, "loss": 1.9146, "mean_token_accuracy": 0.544142709672451, "num_tokens": 12842272.0, "step": 3560 }, { "entropy": 1.908203125, "epoch": 0.7893864013266998, "grad_norm": 2.88879132270813, "learning_rate": 4.3499733440532374e-06, "loss": 1.942, "mean_token_accuracy": 0.5378496155142785, "num_tokens": 12877516.0, "step": 3570 }, { "entropy": 1.9125, "epoch": 0.7915975677169707, "grad_norm": 2.8685011863708496, "learning_rate": 4.3459258159635325e-06, "loss": 1.9031, "mean_token_accuracy": 0.5425672397017479, "num_tokens": 12912744.0, "step": 3580 }, { "entropy": 1.96328125, "epoch": 0.7938087341072416, "grad_norm": 3.245892286300659, "learning_rate": 4.341867621198801e-06, "loss": 1.9487, "mean_token_accuracy": 0.5353641182184219, "num_tokens": 12949814.0, "step": 3590 }, { "entropy": 1.911328125, "epoch": 0.7960199004975125, "grad_norm": 2.8265836238861084, "learning_rate": 4.337798783209307e-06, "loss": 1.9322, "mean_token_accuracy": 0.5360799193382263, "num_tokens": 12985461.0, "step": 3600 }, { "entropy": 1.882421875, "epoch": 0.7982310668877833, "grad_norm": 3.0406415462493896, "learning_rate": 4.333719325506812e-06, "loss": 1.8884, "mean_token_accuracy": 0.544411626458168, "num_tokens": 13020421.0, "step": 3610 }, { "entropy": 1.883203125, "epoch": 0.8004422332780542, "grad_norm": 3.2346084117889404, "learning_rate": 4.329629271664449e-06, "loss": 1.8916, "mean_token_accuracy": 0.5445612698793412, "num_tokens": 13055923.0, "step": 3620 }, { "entropy": 1.880859375, "epoch": 0.802653399668325, "grad_norm": 3.5634877681732178, "learning_rate": 4.325528645316577e-06, "loss": 1.893, "mean_token_accuracy": 0.5408861741423607, "num_tokens": 13088047.0, "step": 3630 }, { "entropy": 1.9953125, "epoch": 0.8048645660585959, "grad_norm": 4.091281414031982, "learning_rate": 4.3214174701586475e-06, "loss": 1.9872, "mean_token_accuracy": 0.5278794556856156, "num_tokens": 13125181.0, "step": 3640 }, { "entropy": 1.8796875, "epoch": 0.8070757324488668, "grad_norm": 3.1842451095581055, "learning_rate": 4.317295769947072e-06, "loss": 1.8735, "mean_token_accuracy": 0.5462472170591355, "num_tokens": 13160783.0, "step": 3650 }, { "entropy": 1.913671875, "epoch": 0.8092868988391376, "grad_norm": 3.0181612968444824, "learning_rate": 4.313163568499078e-06, "loss": 1.9256, "mean_token_accuracy": 0.538513295352459, "num_tokens": 13197813.0, "step": 3660 }, { "entropy": 1.9671875, "epoch": 0.8114980652294085, "grad_norm": 3.2187881469726562, "learning_rate": 4.309020889692576e-06, "loss": 1.9489, "mean_token_accuracy": 0.5362419620156288, "num_tokens": 13232602.0, "step": 3670 }, { "entropy": 1.948828125, "epoch": 0.8137092316196793, "grad_norm": 3.2021963596343994, "learning_rate": 4.304867757466018e-06, "loss": 1.9391, "mean_token_accuracy": 0.5342616707086563, "num_tokens": 13270385.0, "step": 3680 }, { "entropy": 1.90546875, "epoch": 0.8159203980099502, "grad_norm": 3.773561716079712, "learning_rate": 4.300704195818263e-06, "loss": 1.9559, "mean_token_accuracy": 0.534406827390194, "num_tokens": 13308977.0, "step": 3690 }, { "entropy": 1.941015625, "epoch": 0.8181315644002212, "grad_norm": 3.372133493423462, "learning_rate": 4.296530228808436e-06, "loss": 1.9726, "mean_token_accuracy": 0.5299327090382576, "num_tokens": 13347269.0, "step": 3700 }, { "entropy": 1.896875, "epoch": 0.820342730790492, "grad_norm": 3.5388503074645996, "learning_rate": 4.292345880555786e-06, "loss": 1.9105, "mean_token_accuracy": 0.544195145368576, "num_tokens": 13383440.0, "step": 3710 }, { "entropy": 1.955078125, "epoch": 0.8225538971807629, "grad_norm": 3.185600757598877, "learning_rate": 4.288151175239556e-06, "loss": 1.9566, "mean_token_accuracy": 0.5397349417209625, "num_tokens": 13422954.0, "step": 3720 }, { "entropy": 1.95703125, "epoch": 0.8247650635710337, "grad_norm": 3.4206392765045166, "learning_rate": 4.2839461370988315e-06, "loss": 1.9675, "mean_token_accuracy": 0.5330950111150742, "num_tokens": 13458339.0, "step": 3730 }, { "entropy": 1.946484375, "epoch": 0.8269762299613046, "grad_norm": 3.7486207485198975, "learning_rate": 4.279730790432411e-06, "loss": 1.9541, "mean_token_accuracy": 0.5361742466688156, "num_tokens": 13491865.0, "step": 3740 }, { "entropy": 1.932421875, "epoch": 0.8291873963515755, "grad_norm": 2.8904426097869873, "learning_rate": 4.275505159598658e-06, "loss": 1.9215, "mean_token_accuracy": 0.53859623670578, "num_tokens": 13526516.0, "step": 3750 }, { "entropy": 1.884765625, "epoch": 0.8313985627418463, "grad_norm": 3.151921272277832, "learning_rate": 4.271269269015364e-06, "loss": 1.8831, "mean_token_accuracy": 0.5485805451869965, "num_tokens": 13560498.0, "step": 3760 }, { "entropy": 1.940234375, "epoch": 0.8336097291321172, "grad_norm": 3.5728070735931396, "learning_rate": 4.267023143159603e-06, "loss": 1.953, "mean_token_accuracy": 0.5409418523311615, "num_tokens": 13600254.0, "step": 3770 }, { "entropy": 1.940234375, "epoch": 0.835820895522388, "grad_norm": 2.794917106628418, "learning_rate": 4.262766806567601e-06, "loss": 1.9375, "mean_token_accuracy": 0.5386961862444878, "num_tokens": 13637854.0, "step": 3780 }, { "entropy": 1.928515625, "epoch": 0.8380320619126589, "grad_norm": 3.859802007675171, "learning_rate": 4.258500283834578e-06, "loss": 1.9547, "mean_token_accuracy": 0.5362945303320885, "num_tokens": 13674265.0, "step": 3790 }, { "entropy": 1.9703125, "epoch": 0.8402432283029297, "grad_norm": 3.2604432106018066, "learning_rate": 4.254223599614622e-06, "loss": 1.9593, "mean_token_accuracy": 0.5336057275533677, "num_tokens": 13709773.0, "step": 3800 }, { "entropy": 1.96640625, "epoch": 0.8424543946932007, "grad_norm": 3.8005752563476562, "learning_rate": 4.249936778620534e-06, "loss": 1.9661, "mean_token_accuracy": 0.5298973023891449, "num_tokens": 13747984.0, "step": 3810 }, { "entropy": 1.9453125, "epoch": 0.8446655610834716, "grad_norm": 2.9430394172668457, "learning_rate": 4.245639845623692e-06, "loss": 1.9317, "mean_token_accuracy": 0.5358313575387001, "num_tokens": 13784946.0, "step": 3820 }, { "entropy": 1.915234375, "epoch": 0.8468767274737424, "grad_norm": 3.000013589859009, "learning_rate": 4.2413328254539075e-06, "loss": 1.9129, "mean_token_accuracy": 0.5399297952651978, "num_tokens": 13822086.0, "step": 3830 }, { "entropy": 1.87421875, "epoch": 0.8490878938640133, "grad_norm": 3.1604533195495605, "learning_rate": 4.237015742999279e-06, "loss": 1.9055, "mean_token_accuracy": 0.5383271276950836, "num_tokens": 13857226.0, "step": 3840 }, { "entropy": 1.948828125, "epoch": 0.8512990602542841, "grad_norm": 2.962773084640503, "learning_rate": 4.232688623206049e-06, "loss": 1.9493, "mean_token_accuracy": 0.5346002340316772, "num_tokens": 13892604.0, "step": 3850 }, { "entropy": 1.980859375, "epoch": 0.853510226644555, "grad_norm": 3.5025715827941895, "learning_rate": 4.228351491078465e-06, "loss": 1.9653, "mean_token_accuracy": 0.5344145551323891, "num_tokens": 13929221.0, "step": 3860 }, { "entropy": 1.91484375, "epoch": 0.8557213930348259, "grad_norm": 3.1019279956817627, "learning_rate": 4.224004371678626e-06, "loss": 1.9284, "mean_token_accuracy": 0.5401875883340835, "num_tokens": 13964673.0, "step": 3870 }, { "entropy": 1.86875, "epoch": 0.8579325594250967, "grad_norm": 2.4966201782226562, "learning_rate": 4.219647290126344e-06, "loss": 1.8904, "mean_token_accuracy": 0.5469870507717133, "num_tokens": 13998794.0, "step": 3880 }, { "entropy": 1.93359375, "epoch": 0.8601437258153676, "grad_norm": 3.3688573837280273, "learning_rate": 4.215280271598998e-06, "loss": 1.9416, "mean_token_accuracy": 0.5335712164640427, "num_tokens": 14035101.0, "step": 3890 }, { "entropy": 1.926953125, "epoch": 0.8623548922056384, "grad_norm": 3.4508743286132812, "learning_rate": 4.210903341331388e-06, "loss": 1.9311, "mean_token_accuracy": 0.5424894750118255, "num_tokens": 14074359.0, "step": 3900 }, { "entropy": 1.96640625, "epoch": 0.8645660585959093, "grad_norm": 3.0193846225738525, "learning_rate": 4.206516524615587e-06, "loss": 2.0008, "mean_token_accuracy": 0.5271704345941544, "num_tokens": 14113385.0, "step": 3910 }, { "entropy": 1.880859375, "epoch": 0.8667772249861803, "grad_norm": 2.665515899658203, "learning_rate": 4.2021198468007995e-06, "loss": 1.8905, "mean_token_accuracy": 0.5444725215435028, "num_tokens": 14146408.0, "step": 3920 }, { "entropy": 1.89765625, "epoch": 0.8689883913764511, "grad_norm": 2.620870590209961, "learning_rate": 4.1977133332932085e-06, "loss": 1.9079, "mean_token_accuracy": 0.5405832916498184, "num_tokens": 14183631.0, "step": 3930 }, { "entropy": 1.875, "epoch": 0.871199557766722, "grad_norm": 3.5019686222076416, "learning_rate": 4.193297009555838e-06, "loss": 1.9105, "mean_token_accuracy": 0.5461666271090507, "num_tokens": 14217874.0, "step": 3940 }, { "entropy": 1.91796875, "epoch": 0.8734107241569928, "grad_norm": 3.248090982437134, "learning_rate": 4.188870901108395e-06, "loss": 1.9667, "mean_token_accuracy": 0.5356802776455879, "num_tokens": 14255585.0, "step": 3950 }, { "entropy": 1.9375, "epoch": 0.8756218905472637, "grad_norm": 3.220170021057129, "learning_rate": 4.184435033527129e-06, "loss": 1.9515, "mean_token_accuracy": 0.5346527516841888, "num_tokens": 14294042.0, "step": 3960 }, { "entropy": 1.925, "epoch": 0.8778330569375346, "grad_norm": 3.438251256942749, "learning_rate": 4.179989432444686e-06, "loss": 1.9107, "mean_token_accuracy": 0.5394331067800522, "num_tokens": 14331327.0, "step": 3970 }, { "entropy": 1.878125, "epoch": 0.8800442233278054, "grad_norm": 2.9318506717681885, "learning_rate": 4.1755341235499525e-06, "loss": 1.8914, "mean_token_accuracy": 0.5450169116258621, "num_tokens": 14368396.0, "step": 3980 }, { "entropy": 1.86640625, "epoch": 0.8822553897180763, "grad_norm": 3.39992094039917, "learning_rate": 4.171069132587913e-06, "loss": 1.8875, "mean_token_accuracy": 0.5458775490522385, "num_tokens": 14402900.0, "step": 3990 }, { "entropy": 1.90703125, "epoch": 0.8844665561083471, "grad_norm": 2.5475125312805176, "learning_rate": 4.166594485359502e-06, "loss": 1.9237, "mean_token_accuracy": 0.5404252767562866, "num_tokens": 14438729.0, "step": 4000 }, { "epoch": 0.8844665561083471, "eval_entropy": 1.9188510572139303, "eval_loss": 1.9126449823379517, "eval_mean_token_accuracy": 0.5416562696594504, "eval_num_tokens": 14438729.0, "eval_runtime": 113.3363, "eval_samples_per_second": 141.879, "eval_steps_per_second": 8.867, "step": 4000 }, { "entropy": 1.955859375, "epoch": 0.886677722498618, "grad_norm": 3.684173107147217, "learning_rate": 4.162110207721448e-06, "loss": 1.9558, "mean_token_accuracy": 0.535205788910389, "num_tokens": 14474574.0, "step": 4010 }, { "entropy": 1.86328125, "epoch": 0.8888888888888888, "grad_norm": 4.06991720199585, "learning_rate": 4.157616325586134e-06, "loss": 1.8534, "mean_token_accuracy": 0.5511356204748153, "num_tokens": 14509862.0, "step": 4020 }, { "entropy": 1.87578125, "epoch": 0.8911000552791598, "grad_norm": 3.0546224117279053, "learning_rate": 4.153112864921439e-06, "loss": 1.8977, "mean_token_accuracy": 0.5420440047979355, "num_tokens": 14546096.0, "step": 4030 }, { "entropy": 1.889453125, "epoch": 0.8933112216694307, "grad_norm": 3.049771785736084, "learning_rate": 4.148599851750593e-06, "loss": 1.9036, "mean_token_accuracy": 0.5387859135866165, "num_tokens": 14583145.0, "step": 4040 }, { "entropy": 1.87265625, "epoch": 0.8955223880597015, "grad_norm": 3.1174356937408447, "learning_rate": 4.144077312152025e-06, "loss": 1.8736, "mean_token_accuracy": 0.5475644856691361, "num_tokens": 14617201.0, "step": 4050 }, { "entropy": 1.8953125, "epoch": 0.8977335544499724, "grad_norm": 3.402278423309326, "learning_rate": 4.139545272259211e-06, "loss": 1.9215, "mean_token_accuracy": 0.5450775384902954, "num_tokens": 14654928.0, "step": 4060 }, { "entropy": 1.919921875, "epoch": 0.8999447208402432, "grad_norm": 2.925335645675659, "learning_rate": 4.1350037582605275e-06, "loss": 1.9161, "mean_token_accuracy": 0.5423222750425338, "num_tokens": 14692049.0, "step": 4070 }, { "entropy": 1.904296875, "epoch": 0.9021558872305141, "grad_norm": 2.824946641921997, "learning_rate": 4.130452796399094e-06, "loss": 1.9228, "mean_token_accuracy": 0.5353797942399978, "num_tokens": 14727602.0, "step": 4080 }, { "entropy": 1.911328125, "epoch": 0.904367053620785, "grad_norm": 3.9287309646606445, "learning_rate": 4.125892412972625e-06, "loss": 1.9236, "mean_token_accuracy": 0.5360626980662346, "num_tokens": 14763216.0, "step": 4090 }, { "entropy": 1.97890625, "epoch": 0.9065782200110558, "grad_norm": 3.4621336460113525, "learning_rate": 4.121322634333279e-06, "loss": 1.9513, "mean_token_accuracy": 0.5344884380698204, "num_tokens": 14799187.0, "step": 4100 }, { "entropy": 1.946875, "epoch": 0.9087893864013267, "grad_norm": 3.50201678276062, "learning_rate": 4.1167434868875045e-06, "loss": 1.9309, "mean_token_accuracy": 0.5461748734116554, "num_tokens": 14837393.0, "step": 4110 }, { "entropy": 1.92265625, "epoch": 0.9110005527915975, "grad_norm": 3.3906443119049072, "learning_rate": 4.112154997095885e-06, "loss": 1.9323, "mean_token_accuracy": 0.5365500524640083, "num_tokens": 14874490.0, "step": 4120 }, { "entropy": 1.860546875, "epoch": 0.9132117191818684, "grad_norm": 3.8525633811950684, "learning_rate": 4.107557191472991e-06, "loss": 1.9, "mean_token_accuracy": 0.5453802317380905, "num_tokens": 14908274.0, "step": 4130 }, { "entropy": 1.880859375, "epoch": 0.9154228855721394, "grad_norm": 3.2404062747955322, "learning_rate": 4.1029500965872265e-06, "loss": 1.89, "mean_token_accuracy": 0.550041849911213, "num_tokens": 14943724.0, "step": 4140 }, { "entropy": 1.91640625, "epoch": 0.9176340519624102, "grad_norm": 3.3359262943267822, "learning_rate": 4.098333739060668e-06, "loss": 1.9272, "mean_token_accuracy": 0.5448615044355393, "num_tokens": 14982306.0, "step": 4150 }, { "entropy": 1.853515625, "epoch": 0.9198452183526811, "grad_norm": 3.827122926712036, "learning_rate": 4.093708145568922e-06, "loss": 1.8539, "mean_token_accuracy": 0.5497287213802338, "num_tokens": 15017396.0, "step": 4160 }, { "entropy": 1.9171875, "epoch": 0.9220563847429519, "grad_norm": 3.218873977661133, "learning_rate": 4.089073342840959e-06, "loss": 1.9487, "mean_token_accuracy": 0.5369037941098214, "num_tokens": 15051623.0, "step": 4170 }, { "entropy": 1.93359375, "epoch": 0.9242675511332228, "grad_norm": 3.875128984451294, "learning_rate": 4.084429357658971e-06, "loss": 1.9212, "mean_token_accuracy": 0.53728848695755, "num_tokens": 15087359.0, "step": 4180 }, { "entropy": 1.931640625, "epoch": 0.9264787175234936, "grad_norm": 3.1470813751220703, "learning_rate": 4.079776216858207e-06, "loss": 1.9217, "mean_token_accuracy": 0.5414172351360321, "num_tokens": 15122844.0, "step": 4190 }, { "entropy": 1.915234375, "epoch": 0.9286898839137645, "grad_norm": 3.252145528793335, "learning_rate": 4.075113947326822e-06, "loss": 1.9089, "mean_token_accuracy": 0.5462937578558922, "num_tokens": 15161239.0, "step": 4200 }, { "entropy": 1.87890625, "epoch": 0.9309010503040354, "grad_norm": 3.8397457599639893, "learning_rate": 4.070442576005723e-06, "loss": 1.9349, "mean_token_accuracy": 0.5433342188596726, "num_tokens": 15197805.0, "step": 4210 }, { "entropy": 1.927734375, "epoch": 0.9331122166943062, "grad_norm": 3.6428112983703613, "learning_rate": 4.065762129888411e-06, "loss": 1.9286, "mean_token_accuracy": 0.5316698774695396, "num_tokens": 15233320.0, "step": 4220 }, { "entropy": 1.9375, "epoch": 0.9353233830845771, "grad_norm": 3.38865327835083, "learning_rate": 4.0610726360208245e-06, "loss": 1.9358, "mean_token_accuracy": 0.5407742202281952, "num_tokens": 15269570.0, "step": 4230 }, { "entropy": 1.91015625, "epoch": 0.9375345494748479, "grad_norm": 2.5511257648468018, "learning_rate": 4.056374121501185e-06, "loss": 1.8913, "mean_token_accuracy": 0.5450213491916657, "num_tokens": 15304083.0, "step": 4240 }, { "entropy": 1.904296875, "epoch": 0.9397457158651189, "grad_norm": 3.068298578262329, "learning_rate": 4.051666613479841e-06, "loss": 1.9512, "mean_token_accuracy": 0.5351329863071441, "num_tokens": 15340576.0, "step": 4250 }, { "entropy": 1.932421875, "epoch": 0.9419568822553898, "grad_norm": 2.827686309814453, "learning_rate": 4.046950139159108e-06, "loss": 1.9484, "mean_token_accuracy": 0.5355295330286026, "num_tokens": 15376857.0, "step": 4260 }, { "entropy": 1.9546875, "epoch": 0.9441680486456606, "grad_norm": 3.0990796089172363, "learning_rate": 4.042224725793116e-06, "loss": 1.9464, "mean_token_accuracy": 0.5348751246929169, "num_tokens": 15414720.0, "step": 4270 }, { "entropy": 1.9421875, "epoch": 0.9463792150359315, "grad_norm": 3.662965774536133, "learning_rate": 4.037490400687646e-06, "loss": 1.9251, "mean_token_accuracy": 0.5382256016135216, "num_tokens": 15450528.0, "step": 4280 }, { "entropy": 1.874609375, "epoch": 0.9485903814262023, "grad_norm": 3.9825875759124756, "learning_rate": 4.032747191199976e-06, "loss": 1.8888, "mean_token_accuracy": 0.5442078769207, "num_tokens": 15487280.0, "step": 4290 }, { "entropy": 1.88125, "epoch": 0.9508015478164732, "grad_norm": 3.268082857131958, "learning_rate": 4.027995124738725e-06, "loss": 1.8871, "mean_token_accuracy": 0.5460310637950897, "num_tokens": 15524367.0, "step": 4300 }, { "entropy": 1.875390625, "epoch": 0.953012714206744, "grad_norm": 3.111990451812744, "learning_rate": 4.023234228763691e-06, "loss": 1.8814, "mean_token_accuracy": 0.5478014558553695, "num_tokens": 15559528.0, "step": 4310 }, { "entropy": 1.8921875, "epoch": 0.9552238805970149, "grad_norm": 3.305328845977783, "learning_rate": 4.018464530785689e-06, "loss": 1.908, "mean_token_accuracy": 0.5411547064781189, "num_tokens": 15596135.0, "step": 4320 }, { "entropy": 1.932421875, "epoch": 0.9574350469872858, "grad_norm": 3.4154648780822754, "learning_rate": 4.013686058366403e-06, "loss": 1.9549, "mean_token_accuracy": 0.5352584987878799, "num_tokens": 15633949.0, "step": 4330 }, { "entropy": 1.9, "epoch": 0.9596462133775566, "grad_norm": 3.2575430870056152, "learning_rate": 4.0088988391182166e-06, "loss": 1.9057, "mean_token_accuracy": 0.5455828040838242, "num_tokens": 15670509.0, "step": 4340 }, { "entropy": 1.89453125, "epoch": 0.9618573797678275, "grad_norm": 3.0902981758117676, "learning_rate": 4.004102900704057e-06, "loss": 1.8611, "mean_token_accuracy": 0.546709680557251, "num_tokens": 15703401.0, "step": 4350 }, { "entropy": 1.935546875, "epoch": 0.9640685461580984, "grad_norm": 3.510676383972168, "learning_rate": 3.999298270837234e-06, "loss": 1.9203, "mean_token_accuracy": 0.5407052993774414, "num_tokens": 15741563.0, "step": 4360 }, { "entropy": 1.87890625, "epoch": 0.9662797125483693, "grad_norm": 3.798187017440796, "learning_rate": 3.994484977281284e-06, "loss": 1.8968, "mean_token_accuracy": 0.543719370663166, "num_tokens": 15776376.0, "step": 4370 }, { "entropy": 1.934375, "epoch": 0.9684908789386402, "grad_norm": 3.677476644515991, "learning_rate": 3.989663047849804e-06, "loss": 1.9398, "mean_token_accuracy": 0.5404128700494766, "num_tokens": 15809463.0, "step": 4380 }, { "entropy": 1.885546875, "epoch": 0.970702045328911, "grad_norm": 3.044034957885742, "learning_rate": 3.9848325104062945e-06, "loss": 1.858, "mean_token_accuracy": 0.5474234521389008, "num_tokens": 15844117.0, "step": 4390 }, { "entropy": 1.879296875, "epoch": 0.9729132117191819, "grad_norm": 3.2886359691619873, "learning_rate": 3.979993392863997e-06, "loss": 1.9034, "mean_token_accuracy": 0.5416353791952133, "num_tokens": 15880493.0, "step": 4400 }, { "entropy": 1.891015625, "epoch": 0.9751243781094527, "grad_norm": 2.7740585803985596, "learning_rate": 3.9751457231857325e-06, "loss": 1.8861, "mean_token_accuracy": 0.5488071829080582, "num_tokens": 15915900.0, "step": 4410 }, { "entropy": 1.91640625, "epoch": 0.9773355444997236, "grad_norm": 3.2476296424865723, "learning_rate": 3.970289529383743e-06, "loss": 1.916, "mean_token_accuracy": 0.5365955427289009, "num_tokens": 15951323.0, "step": 4420 }, { "entropy": 1.889453125, "epoch": 0.9795467108899945, "grad_norm": 3.1823527812957764, "learning_rate": 3.965424839519522e-06, "loss": 1.9215, "mean_token_accuracy": 0.5389618843793869, "num_tokens": 15989555.0, "step": 4430 }, { "entropy": 1.925, "epoch": 0.9817578772802653, "grad_norm": 3.0395121574401855, "learning_rate": 3.960551681703663e-06, "loss": 1.9138, "mean_token_accuracy": 0.5402269750833512, "num_tokens": 16027047.0, "step": 4440 }, { "entropy": 1.915625, "epoch": 0.9839690436705362, "grad_norm": 3.556783676147461, "learning_rate": 3.955670084095687e-06, "loss": 1.9283, "mean_token_accuracy": 0.5380309224128723, "num_tokens": 16062486.0, "step": 4450 }, { "entropy": 1.903515625, "epoch": 0.986180210060807, "grad_norm": 3.5073933601379395, "learning_rate": 3.950780074903889e-06, "loss": 1.8993, "mean_token_accuracy": 0.5455669865012169, "num_tokens": 16096883.0, "step": 4460 }, { "entropy": 1.9203125, "epoch": 0.988391376451078, "grad_norm": 3.406268835067749, "learning_rate": 3.945881682385168e-06, "loss": 1.909, "mean_token_accuracy": 0.5403860121965408, "num_tokens": 16132257.0, "step": 4470 }, { "entropy": 1.864453125, "epoch": 0.9906025428413489, "grad_norm": 2.83659291267395, "learning_rate": 3.940974934844863e-06, "loss": 1.8706, "mean_token_accuracy": 0.5472238451242447, "num_tokens": 16166111.0, "step": 4480 }, { "entropy": 1.8734375, "epoch": 0.9928137092316197, "grad_norm": 3.039048433303833, "learning_rate": 3.936059860636598e-06, "loss": 1.8658, "mean_token_accuracy": 0.5526719331741333, "num_tokens": 16201706.0, "step": 4490 }, { "entropy": 1.92578125, "epoch": 0.9950248756218906, "grad_norm": 3.3237369060516357, "learning_rate": 3.931136488162107e-06, "loss": 1.9303, "mean_token_accuracy": 0.5338204294443131, "num_tokens": 16238439.0, "step": 4500 }, { "epoch": 0.9950248756218906, "eval_entropy": 1.8889536691542288, "eval_loss": 1.8963500261306763, "eval_mean_token_accuracy": 0.5442636843937546, "eval_num_tokens": 16238439.0, "eval_runtime": 111.8926, "eval_samples_per_second": 143.709, "eval_steps_per_second": 8.982, "step": 4500 }, { "entropy": 1.896875, "epoch": 0.9972360420121614, "grad_norm": 3.566272258758545, "learning_rate": 3.9262048458710805e-06, "loss": 1.9143, "mean_token_accuracy": 0.5406926721334457, "num_tokens": 16273430.0, "step": 4510 }, { "entropy": 1.876953125, "epoch": 0.9994472084024323, "grad_norm": 3.7358896732330322, "learning_rate": 3.9212649622609935e-06, "loss": 1.8669, "mean_token_accuracy": 0.5468032449483872, "num_tokens": 16309228.0, "step": 4520 }, { "entropy": 1.8511513157894737, "epoch": 1.0015478164731897, "grad_norm": 3.6489620208740234, "learning_rate": 3.916316865876945e-06, "loss": 1.8198, "mean_token_accuracy": 0.5546513827223527, "num_tokens": 16342632.0, "step": 4530 }, { "entropy": 1.79609375, "epoch": 1.0037589828634605, "grad_norm": 2.5735867023468018, "learning_rate": 3.911360585311488e-06, "loss": 1.8063, "mean_token_accuracy": 0.5635162651538849, "num_tokens": 16377784.0, "step": 4540 }, { "entropy": 1.7953125, "epoch": 1.0059701492537314, "grad_norm": 3.058192729949951, "learning_rate": 3.906396149204472e-06, "loss": 1.7979, "mean_token_accuracy": 0.5593321830034256, "num_tokens": 16413036.0, "step": 4550 }, { "entropy": 1.81484375, "epoch": 1.0081813156440023, "grad_norm": 2.951831102371216, "learning_rate": 3.901423586242869e-06, "loss": 1.807, "mean_token_accuracy": 0.5591068655252457, "num_tokens": 16447818.0, "step": 4560 }, { "entropy": 1.78125, "epoch": 1.0103924820342731, "grad_norm": 3.391406297683716, "learning_rate": 3.896442925160618e-06, "loss": 1.7729, "mean_token_accuracy": 0.5678528934717179, "num_tokens": 16480405.0, "step": 4570 }, { "entropy": 1.84609375, "epoch": 1.012603648424544, "grad_norm": 3.469679594039917, "learning_rate": 3.891454194738448e-06, "loss": 1.8775, "mean_token_accuracy": 0.5478696256875992, "num_tokens": 16518289.0, "step": 4580 }, { "entropy": 1.8125, "epoch": 1.0148148148148148, "grad_norm": 3.23343563079834, "learning_rate": 3.886457423803717e-06, "loss": 1.8041, "mean_token_accuracy": 0.5634237855672837, "num_tokens": 16553972.0, "step": 4590 }, { "entropy": 1.8421875, "epoch": 1.0170259812050857, "grad_norm": 3.8759403228759766, "learning_rate": 3.881452641230247e-06, "loss": 1.8302, "mean_token_accuracy": 0.5579734325408936, "num_tokens": 16590488.0, "step": 4600 }, { "entropy": 1.78671875, "epoch": 1.0192371475953566, "grad_norm": 4.138722896575928, "learning_rate": 3.876439875938153e-06, "loss": 1.8136, "mean_token_accuracy": 0.5557315021753311, "num_tokens": 16626299.0, "step": 4610 }, { "entropy": 1.82734375, "epoch": 1.0214483139856274, "grad_norm": 3.8862240314483643, "learning_rate": 3.871419156893681e-06, "loss": 1.8279, "mean_token_accuracy": 0.5565461277961731, "num_tokens": 16660563.0, "step": 4620 }, { "entropy": 1.83125, "epoch": 1.0236594803758983, "grad_norm": 3.6678528785705566, "learning_rate": 3.866390513109035e-06, "loss": 1.8117, "mean_token_accuracy": 0.5574209183454514, "num_tokens": 16697572.0, "step": 4630 }, { "entropy": 1.7890625, "epoch": 1.0258706467661691, "grad_norm": 3.5637757778167725, "learning_rate": 3.861353973642214e-06, "loss": 1.7763, "mean_token_accuracy": 0.5672460049390793, "num_tokens": 16729747.0, "step": 4640 }, { "entropy": 1.821875, "epoch": 1.02808181315644, "grad_norm": 3.6049387454986572, "learning_rate": 3.856309567596842e-06, "loss": 1.8432, "mean_token_accuracy": 0.5531365409493446, "num_tokens": 16768485.0, "step": 4650 }, { "entropy": 1.8109375, "epoch": 1.0302929795467108, "grad_norm": 3.0019540786743164, "learning_rate": 3.851257324121998e-06, "loss": 1.7905, "mean_token_accuracy": 0.5601180583238602, "num_tokens": 16801101.0, "step": 4660 }, { "entropy": 1.860546875, "epoch": 1.0325041459369817, "grad_norm": 3.290112257003784, "learning_rate": 3.84619727241205e-06, "loss": 1.8377, "mean_token_accuracy": 0.556305718421936, "num_tokens": 16837927.0, "step": 4670 }, { "entropy": 1.84375, "epoch": 1.0347153123272526, "grad_norm": 3.5095109939575195, "learning_rate": 3.84112944170649e-06, "loss": 1.8221, "mean_token_accuracy": 0.5608943462371826, "num_tokens": 16877255.0, "step": 4680 }, { "entropy": 1.84296875, "epoch": 1.0369264787175234, "grad_norm": 3.063561201095581, "learning_rate": 3.8360538612897545e-06, "loss": 1.8523, "mean_token_accuracy": 0.5544700175523758, "num_tokens": 16912558.0, "step": 4690 }, { "entropy": 1.7890625, "epoch": 1.0391376451077943, "grad_norm": 3.295924663543701, "learning_rate": 3.830970560491068e-06, "loss": 1.809, "mean_token_accuracy": 0.560962800681591, "num_tokens": 16947956.0, "step": 4700 }, { "entropy": 1.805078125, "epoch": 1.0413488114980651, "grad_norm": 3.2698428630828857, "learning_rate": 3.825879568684261e-06, "loss": 1.8197, "mean_token_accuracy": 0.5555193990468978, "num_tokens": 16982086.0, "step": 4710 }, { "entropy": 1.8015625, "epoch": 1.0435599778883362, "grad_norm": 3.2953996658325195, "learning_rate": 3.820780915287612e-06, "loss": 1.7783, "mean_token_accuracy": 0.5682111203670501, "num_tokens": 17017420.0, "step": 4720 }, { "entropy": 1.80546875, "epoch": 1.045771144278607, "grad_norm": 3.2186648845672607, "learning_rate": 3.815674629763668e-06, "loss": 1.8167, "mean_token_accuracy": 0.5638742208480835, "num_tokens": 17053650.0, "step": 4730 }, { "entropy": 1.801953125, "epoch": 1.047982310668878, "grad_norm": 3.229968547821045, "learning_rate": 3.8105607416190792e-06, "loss": 1.8104, "mean_token_accuracy": 0.5603099703788758, "num_tokens": 17088920.0, "step": 4740 }, { "entropy": 1.78046875, "epoch": 1.0501934770591488, "grad_norm": 3.861144542694092, "learning_rate": 3.8054392804044292e-06, "loss": 1.8121, "mean_token_accuracy": 0.5570038884878159, "num_tokens": 17124495.0, "step": 4750 }, { "entropy": 1.7875, "epoch": 1.0524046434494196, "grad_norm": 3.1243979930877686, "learning_rate": 3.800310275714061e-06, "loss": 1.806, "mean_token_accuracy": 0.5590326100587845, "num_tokens": 17160061.0, "step": 4760 }, { "entropy": 1.82109375, "epoch": 1.0546158098396905, "grad_norm": 3.517993688583374, "learning_rate": 3.795173757185908e-06, "loss": 1.8111, "mean_token_accuracy": 0.5631527751684189, "num_tokens": 17198517.0, "step": 4770 }, { "entropy": 1.79375, "epoch": 1.0568269762299614, "grad_norm": 3.146130084991455, "learning_rate": 3.7900297545013227e-06, "loss": 1.7701, "mean_token_accuracy": 0.5665472269058227, "num_tokens": 17235157.0, "step": 4780 }, { "entropy": 1.7984375, "epoch": 1.0590381426202322, "grad_norm": 3.4495346546173096, "learning_rate": 3.784878297384903e-06, "loss": 1.8207, "mean_token_accuracy": 0.5569171607494354, "num_tokens": 17271144.0, "step": 4790 }, { "entropy": 1.79921875, "epoch": 1.061249309010503, "grad_norm": 3.2662720680236816, "learning_rate": 3.7797194156043248e-06, "loss": 1.8235, "mean_token_accuracy": 0.5576835155487061, "num_tokens": 17308688.0, "step": 4800 }, { "entropy": 1.855859375, "epoch": 1.063460475400774, "grad_norm": 3.2390568256378174, "learning_rate": 3.7745531389701643e-06, "loss": 1.8548, "mean_token_accuracy": 0.5510483264923096, "num_tokens": 17344325.0, "step": 4810 }, { "entropy": 1.83515625, "epoch": 1.0656716417910448, "grad_norm": 3.697944402694702, "learning_rate": 3.7693794973357333e-06, "loss": 1.8209, "mean_token_accuracy": 0.5602743715047837, "num_tokens": 17381118.0, "step": 4820 }, { "entropy": 1.79375, "epoch": 1.0678828081813156, "grad_norm": 4.086962699890137, "learning_rate": 3.7641985205968965e-06, "loss": 1.829, "mean_token_accuracy": 0.55612932741642, "num_tokens": 17415842.0, "step": 4830 }, { "entropy": 1.84609375, "epoch": 1.0700939745715865, "grad_norm": 3.413696050643921, "learning_rate": 3.7590102386919103e-06, "loss": 1.8197, "mean_token_accuracy": 0.5570108830928803, "num_tokens": 17450577.0, "step": 4840 }, { "entropy": 1.81015625, "epoch": 1.0723051409618574, "grad_norm": 4.149393081665039, "learning_rate": 3.753814681601239e-06, "loss": 1.7964, "mean_token_accuracy": 0.5602624654769898, "num_tokens": 17485873.0, "step": 4850 }, { "entropy": 1.81875, "epoch": 1.0745163073521282, "grad_norm": 3.8652758598327637, "learning_rate": 3.74861187934739e-06, "loss": 1.8229, "mean_token_accuracy": 0.5579535394906998, "num_tokens": 17521632.0, "step": 4860 }, { "entropy": 1.762890625, "epoch": 1.076727473742399, "grad_norm": 3.8266611099243164, "learning_rate": 3.743401861994734e-06, "loss": 1.772, "mean_token_accuracy": 0.5699301362037659, "num_tokens": 17555730.0, "step": 4870 }, { "entropy": 1.820703125, "epoch": 1.07893864013267, "grad_norm": 3.515138626098633, "learning_rate": 3.7381846596493376e-06, "loss": 1.8096, "mean_token_accuracy": 0.5621564239263535, "num_tokens": 17588290.0, "step": 4880 }, { "entropy": 1.83984375, "epoch": 1.0811498065229408, "grad_norm": 3.184519052505493, "learning_rate": 3.732960302458783e-06, "loss": 1.8267, "mean_token_accuracy": 0.5541789025068283, "num_tokens": 17623215.0, "step": 4890 }, { "entropy": 1.784375, "epoch": 1.0833609729132117, "grad_norm": 3.543375253677368, "learning_rate": 3.7277288206119972e-06, "loss": 1.7937, "mean_token_accuracy": 0.5672435730695724, "num_tokens": 17661442.0, "step": 4900 }, { "entropy": 1.777734375, "epoch": 1.0855721393034825, "grad_norm": 2.400563955307007, "learning_rate": 3.722490244339078e-06, "loss": 1.7696, "mean_token_accuracy": 0.5693740874528885, "num_tokens": 17695539.0, "step": 4910 }, { "entropy": 1.82109375, "epoch": 1.0877833056937534, "grad_norm": 3.5872690677642822, "learning_rate": 3.7172446039111176e-06, "loss": 1.8464, "mean_token_accuracy": 0.5561143085360527, "num_tokens": 17732548.0, "step": 4920 }, { "entropy": 1.841796875, "epoch": 1.0899944720840242, "grad_norm": 3.5267386436462402, "learning_rate": 3.711991929640028e-06, "loss": 1.8415, "mean_token_accuracy": 0.557052418589592, "num_tokens": 17770185.0, "step": 4930 }, { "entropy": 1.85078125, "epoch": 1.092205638474295, "grad_norm": 3.6018447875976562, "learning_rate": 3.706732251878367e-06, "loss": 1.8577, "mean_token_accuracy": 0.5492183089256286, "num_tokens": 17806898.0, "step": 4940 }, { "entropy": 1.84609375, "epoch": 1.0944168048645662, "grad_norm": 3.5661914348602295, "learning_rate": 3.7014656010191625e-06, "loss": 1.8332, "mean_token_accuracy": 0.5575710266828537, "num_tokens": 17842928.0, "step": 4950 }, { "entropy": 1.832421875, "epoch": 1.096627971254837, "grad_norm": 3.5708367824554443, "learning_rate": 3.6961920074957334e-06, "loss": 1.8348, "mean_token_accuracy": 0.5552757412195206, "num_tokens": 17879708.0, "step": 4960 }, { "entropy": 1.820703125, "epoch": 1.0988391376451079, "grad_norm": 3.893779993057251, "learning_rate": 3.6909115017815224e-06, "loss": 1.8328, "mean_token_accuracy": 0.5542289972305298, "num_tokens": 17917046.0, "step": 4970 }, { "entropy": 1.8421875, "epoch": 1.1010503040353787, "grad_norm": 4.008321762084961, "learning_rate": 3.685624114389908e-06, "loss": 1.8503, "mean_token_accuracy": 0.5507669001817703, "num_tokens": 17954231.0, "step": 4980 }, { "entropy": 1.834765625, "epoch": 1.1032614704256496, "grad_norm": 3.752816915512085, "learning_rate": 3.680329875874038e-06, "loss": 1.8375, "mean_token_accuracy": 0.5589002639055252, "num_tokens": 17990901.0, "step": 4990 }, { "entropy": 1.8140625, "epoch": 1.1054726368159205, "grad_norm": 3.5049827098846436, "learning_rate": 3.6750288168266494e-06, "loss": 1.8097, "mean_token_accuracy": 0.5603310585021972, "num_tokens": 18025966.0, "step": 5000 }, { "epoch": 1.1054726368159205, "eval_entropy": 1.830682524875622, "eval_loss": 1.883301019668579, "eval_mean_token_accuracy": 0.5469028416854232, "eval_num_tokens": 18025966.0, "eval_runtime": 112.5014, "eval_samples_per_second": 142.932, "eval_steps_per_second": 8.933, "step": 5000 }, { "entropy": 1.823828125, "epoch": 1.1076838032061913, "grad_norm": 2.9052512645721436, "learning_rate": 3.6697209678798908e-06, "loss": 1.832, "mean_token_accuracy": 0.5533883243799209, "num_tokens": 18061500.0, "step": 5010 }, { "entropy": 1.802734375, "epoch": 1.1098949695964622, "grad_norm": 2.655911922454834, "learning_rate": 3.6644063597051455e-06, "loss": 1.8053, "mean_token_accuracy": 0.5638729199767113, "num_tokens": 18099631.0, "step": 5020 }, { "entropy": 1.80078125, "epoch": 1.112106135986733, "grad_norm": 2.943432331085205, "learning_rate": 3.6590850230128565e-06, "loss": 1.7872, "mean_token_accuracy": 0.5625256687402725, "num_tokens": 18136870.0, "step": 5030 }, { "entropy": 1.83046875, "epoch": 1.1143173023770039, "grad_norm": 3.210944890975952, "learning_rate": 3.653756988552347e-06, "loss": 1.8497, "mean_token_accuracy": 0.5534161686897278, "num_tokens": 18174917.0, "step": 5040 }, { "entropy": 1.8046875, "epoch": 1.1165284687672747, "grad_norm": 4.036181926727295, "learning_rate": 3.6484222871116425e-06, "loss": 1.8216, "mean_token_accuracy": 0.5570145905017853, "num_tokens": 18208148.0, "step": 5050 }, { "entropy": 1.79921875, "epoch": 1.1187396351575456, "grad_norm": 3.5327327251434326, "learning_rate": 3.643080949517296e-06, "loss": 1.8097, "mean_token_accuracy": 0.5566195756196975, "num_tokens": 18244007.0, "step": 5060 }, { "entropy": 1.769140625, "epoch": 1.1209508015478165, "grad_norm": 2.9146604537963867, "learning_rate": 3.637733006634202e-06, "loss": 1.779, "mean_token_accuracy": 0.5662169039249421, "num_tokens": 18279592.0, "step": 5070 }, { "entropy": 1.798046875, "epoch": 1.1231619679380873, "grad_norm": 3.600449562072754, "learning_rate": 3.632378489365431e-06, "loss": 1.8051, "mean_token_accuracy": 0.5553045645356178, "num_tokens": 18313490.0, "step": 5080 }, { "entropy": 1.846484375, "epoch": 1.1253731343283582, "grad_norm": 3.454976797103882, "learning_rate": 3.6270174286520378e-06, "loss": 1.8527, "mean_token_accuracy": 0.5464070841670037, "num_tokens": 18348814.0, "step": 5090 }, { "entropy": 1.82890625, "epoch": 1.127584300718629, "grad_norm": 3.306880235671997, "learning_rate": 3.6216498554728908e-06, "loss": 1.8145, "mean_token_accuracy": 0.5551435083150864, "num_tokens": 18384052.0, "step": 5100 }, { "entropy": 1.824609375, "epoch": 1.1297954671088999, "grad_norm": 3.2064096927642822, "learning_rate": 3.616275800844491e-06, "loss": 1.803, "mean_token_accuracy": 0.5590496510267258, "num_tokens": 18422781.0, "step": 5110 }, { "entropy": 1.831640625, "epoch": 1.1320066334991707, "grad_norm": 4.38361120223999, "learning_rate": 3.6108952958207906e-06, "loss": 1.827, "mean_token_accuracy": 0.5605113938450813, "num_tokens": 18458289.0, "step": 5120 }, { "entropy": 1.787109375, "epoch": 1.1342177998894416, "grad_norm": 3.2545828819274902, "learning_rate": 3.6055083714930185e-06, "loss": 1.8133, "mean_token_accuracy": 0.5603759199380874, "num_tokens": 18496102.0, "step": 5130 }, { "entropy": 1.757421875, "epoch": 1.1364289662797125, "grad_norm": 2.9343931674957275, "learning_rate": 3.600115058989494e-06, "loss": 1.7483, "mean_token_accuracy": 0.5704005062580109, "num_tokens": 18531370.0, "step": 5140 }, { "entropy": 1.808984375, "epoch": 1.1386401326699835, "grad_norm": 3.281367063522339, "learning_rate": 3.5947153894754526e-06, "loss": 1.7986, "mean_token_accuracy": 0.5598361402750015, "num_tokens": 18566106.0, "step": 5150 }, { "entropy": 1.780859375, "epoch": 1.1408512990602544, "grad_norm": 3.154594898223877, "learning_rate": 3.5893093941528633e-06, "loss": 1.8011, "mean_token_accuracy": 0.5642092615365982, "num_tokens": 18600911.0, "step": 5160 }, { "entropy": 1.8234375, "epoch": 1.1430624654505253, "grad_norm": 3.894033193588257, "learning_rate": 3.583897104260249e-06, "loss": 1.8459, "mean_token_accuracy": 0.5521841764450073, "num_tokens": 18637530.0, "step": 5170 }, { "entropy": 1.81328125, "epoch": 1.1452736318407961, "grad_norm": 3.9591643810272217, "learning_rate": 3.5784785510725047e-06, "loss": 1.8159, "mean_token_accuracy": 0.559244054555893, "num_tokens": 18673599.0, "step": 5180 }, { "entropy": 1.72578125, "epoch": 1.147484798231067, "grad_norm": 3.444801092147827, "learning_rate": 3.573053765900719e-06, "loss": 1.7214, "mean_token_accuracy": 0.5725833803415299, "num_tokens": 18707410.0, "step": 5190 }, { "entropy": 1.752734375, "epoch": 1.1496959646213378, "grad_norm": 3.5314764976501465, "learning_rate": 3.567622780091991e-06, "loss": 1.7893, "mean_token_accuracy": 0.5637159794569016, "num_tokens": 18743511.0, "step": 5200 }, { "entropy": 1.788671875, "epoch": 1.1519071310116087, "grad_norm": 3.3316822052001953, "learning_rate": 3.562185625029252e-06, "loss": 1.7938, "mean_token_accuracy": 0.561698392033577, "num_tokens": 18780182.0, "step": 5210 }, { "entropy": 1.79609375, "epoch": 1.1541182974018795, "grad_norm": 3.647265672683716, "learning_rate": 3.55674233213108e-06, "loss": 1.801, "mean_token_accuracy": 0.5657747179269791, "num_tokens": 18814586.0, "step": 5220 }, { "entropy": 1.77734375, "epoch": 1.1563294637921504, "grad_norm": 3.555049180984497, "learning_rate": 3.5512929328515218e-06, "loss": 1.8016, "mean_token_accuracy": 0.5614618912339211, "num_tokens": 18850829.0, "step": 5230 }, { "entropy": 1.818359375, "epoch": 1.1585406301824213, "grad_norm": 3.3881125450134277, "learning_rate": 3.545837458679909e-06, "loss": 1.8181, "mean_token_accuracy": 0.5577396064996719, "num_tokens": 18887329.0, "step": 5240 }, { "entropy": 1.845703125, "epoch": 1.1607517965726921, "grad_norm": 3.5618348121643066, "learning_rate": 3.5403759411406785e-06, "loss": 1.869, "mean_token_accuracy": 0.5539507746696473, "num_tokens": 18923489.0, "step": 5250 }, { "entropy": 1.7921875, "epoch": 1.162962962962963, "grad_norm": 4.485518455505371, "learning_rate": 3.5349084117931874e-06, "loss": 1.8019, "mean_token_accuracy": 0.5633798271417618, "num_tokens": 18960295.0, "step": 5260 }, { "entropy": 1.79921875, "epoch": 1.1651741293532338, "grad_norm": 3.2539970874786377, "learning_rate": 3.529434902231532e-06, "loss": 1.7961, "mean_token_accuracy": 0.5625804305076599, "num_tokens": 18998298.0, "step": 5270 }, { "entropy": 1.8640625, "epoch": 1.1673852957435047, "grad_norm": 2.906817674636841, "learning_rate": 3.523955444084366e-06, "loss": 1.859, "mean_token_accuracy": 0.5573142901062965, "num_tokens": 19038155.0, "step": 5280 }, { "entropy": 1.841796875, "epoch": 1.1695964621337755, "grad_norm": 3.7016377449035645, "learning_rate": 3.518470069014717e-06, "loss": 1.8137, "mean_token_accuracy": 0.5588720053434372, "num_tokens": 19074231.0, "step": 5290 }, { "entropy": 1.803515625, "epoch": 1.1718076285240464, "grad_norm": 3.9876022338867188, "learning_rate": 3.5129788087198025e-06, "loss": 1.81, "mean_token_accuracy": 0.5592465251684189, "num_tokens": 19107823.0, "step": 5300 }, { "entropy": 1.8046875, "epoch": 1.1740187949143173, "grad_norm": 3.647291660308838, "learning_rate": 3.507481694930848e-06, "loss": 1.8432, "mean_token_accuracy": 0.553630281984806, "num_tokens": 19142032.0, "step": 5310 }, { "entropy": 1.79140625, "epoch": 1.1762299613045881, "grad_norm": 3.6309502124786377, "learning_rate": 3.501978759412905e-06, "loss": 1.7851, "mean_token_accuracy": 0.5666571229696273, "num_tokens": 19178386.0, "step": 5320 }, { "entropy": 1.780859375, "epoch": 1.178441127694859, "grad_norm": 3.1592068672180176, "learning_rate": 3.496470033964664e-06, "loss": 1.784, "mean_token_accuracy": 0.5650387316942215, "num_tokens": 19213272.0, "step": 5330 }, { "entropy": 1.76171875, "epoch": 1.1806522940851298, "grad_norm": 3.9811642169952393, "learning_rate": 3.490955550418273e-06, "loss": 1.7796, "mean_token_accuracy": 0.5650362581014633, "num_tokens": 19251027.0, "step": 5340 }, { "entropy": 1.78359375, "epoch": 1.1828634604754007, "grad_norm": 2.9762301445007324, "learning_rate": 3.4854353406391537e-06, "loss": 1.8024, "mean_token_accuracy": 0.5604519486427307, "num_tokens": 19288319.0, "step": 5350 }, { "entropy": 1.823828125, "epoch": 1.1850746268656716, "grad_norm": 4.1221442222595215, "learning_rate": 3.4799094365258167e-06, "loss": 1.8169, "mean_token_accuracy": 0.5621909618377685, "num_tokens": 19324331.0, "step": 5360 }, { "entropy": 1.808984375, "epoch": 1.1872857932559424, "grad_norm": 3.697798728942871, "learning_rate": 3.474377870009677e-06, "loss": 1.7966, "mean_token_accuracy": 0.5626327961683273, "num_tokens": 19360976.0, "step": 5370 }, { "entropy": 1.8359375, "epoch": 1.1894969596462133, "grad_norm": 3.584628105163574, "learning_rate": 3.4688406730548684e-06, "loss": 1.8198, "mean_token_accuracy": 0.5556138277053833, "num_tokens": 19397361.0, "step": 5380 }, { "entropy": 1.805859375, "epoch": 1.1917081260364841, "grad_norm": 3.491758108139038, "learning_rate": 3.463297877658064e-06, "loss": 1.828, "mean_token_accuracy": 0.5600568175315856, "num_tokens": 19432274.0, "step": 5390 }, { "entropy": 1.77421875, "epoch": 1.1939192924267552, "grad_norm": 3.0235788822174072, "learning_rate": 3.4577495158482833e-06, "loss": 1.7774, "mean_token_accuracy": 0.5672204285860062, "num_tokens": 19468071.0, "step": 5400 }, { "entropy": 1.81484375, "epoch": 1.196130458817026, "grad_norm": 3.516422748565674, "learning_rate": 3.4521956196867142e-06, "loss": 1.8107, "mean_token_accuracy": 0.555186653137207, "num_tokens": 19504784.0, "step": 5410 }, { "entropy": 1.780078125, "epoch": 1.198341625207297, "grad_norm": 3.161365270614624, "learning_rate": 3.446636221266522e-06, "loss": 1.727, "mean_token_accuracy": 0.5710610717535018, "num_tokens": 19542273.0, "step": 5420 }, { "entropy": 1.771484375, "epoch": 1.2005527915975678, "grad_norm": 3.771331548690796, "learning_rate": 3.441071352712671e-06, "loss": 1.8075, "mean_token_accuracy": 0.5596056699752807, "num_tokens": 19579922.0, "step": 5430 }, { "entropy": 1.778515625, "epoch": 1.2027639579878386, "grad_norm": 3.280606985092163, "learning_rate": 3.4355010461817294e-06, "loss": 1.782, "mean_token_accuracy": 0.5591793596744538, "num_tokens": 19612440.0, "step": 5440 }, { "entropy": 1.773046875, "epoch": 1.2049751243781095, "grad_norm": 4.4035964012146, "learning_rate": 3.429925333861694e-06, "loss": 1.7861, "mean_token_accuracy": 0.5663846373558045, "num_tokens": 19647112.0, "step": 5450 }, { "entropy": 1.808984375, "epoch": 1.2071862907683804, "grad_norm": 3.805811882019043, "learning_rate": 3.4243442479717946e-06, "loss": 1.8182, "mean_token_accuracy": 0.5621969848871231, "num_tokens": 19682780.0, "step": 5460 }, { "entropy": 1.80234375, "epoch": 1.2093974571586512, "grad_norm": 3.3051345348358154, "learning_rate": 3.418757820762314e-06, "loss": 1.7893, "mean_token_accuracy": 0.5610921829938889, "num_tokens": 19718444.0, "step": 5470 }, { "entropy": 1.771484375, "epoch": 1.211608623548922, "grad_norm": 3.6130034923553467, "learning_rate": 3.413166084514401e-06, "loss": 1.7735, "mean_token_accuracy": 0.5692863404750824, "num_tokens": 19752855.0, "step": 5480 }, { "entropy": 1.830859375, "epoch": 1.213819789939193, "grad_norm": 3.5256946086883545, "learning_rate": 3.4075690715398805e-06, "loss": 1.8405, "mean_token_accuracy": 0.5547150656580925, "num_tokens": 19790002.0, "step": 5490 }, { "entropy": 1.8203125, "epoch": 1.2160309563294638, "grad_norm": 3.3252151012420654, "learning_rate": 3.40196681418107e-06, "loss": 1.8203, "mean_token_accuracy": 0.5584905654191971, "num_tokens": 19825980.0, "step": 5500 }, { "epoch": 1.2160309563294638, "eval_entropy": 1.8066231343283583, "eval_loss": 1.869123101234436, "eval_mean_token_accuracy": 0.5496349883316761, "eval_num_tokens": 19825980.0, "eval_runtime": 111.7076, "eval_samples_per_second": 143.947, "eval_steps_per_second": 8.997, "step": 5500 }, { "entropy": 1.76015625, "epoch": 1.2182421227197346, "grad_norm": 3.64263916015625, "learning_rate": 3.396359344810592e-06, "loss": 1.7585, "mean_token_accuracy": 0.5672214716672898, "num_tokens": 19861453.0, "step": 5510 }, { "entropy": 1.76953125, "epoch": 1.2204532891100055, "grad_norm": 3.128525495529175, "learning_rate": 3.3907466958311846e-06, "loss": 1.7931, "mean_token_accuracy": 0.566547179222107, "num_tokens": 19896058.0, "step": 5520 }, { "entropy": 1.850390625, "epoch": 1.2226644555002764, "grad_norm": 3.4977822303771973, "learning_rate": 3.3851288996755193e-06, "loss": 1.8366, "mean_token_accuracy": 0.5531932085752487, "num_tokens": 19936661.0, "step": 5530 }, { "entropy": 1.800390625, "epoch": 1.2248756218905472, "grad_norm": 3.7290360927581787, "learning_rate": 3.379505988806008e-06, "loss": 1.7962, "mean_token_accuracy": 0.5639491826295853, "num_tokens": 19972406.0, "step": 5540 }, { "entropy": 1.756640625, "epoch": 1.227086788280818, "grad_norm": 3.9299118518829346, "learning_rate": 3.3738779957146196e-06, "loss": 1.7905, "mean_token_accuracy": 0.5627733021974564, "num_tokens": 20007813.0, "step": 5550 }, { "entropy": 1.812890625, "epoch": 1.229297954671089, "grad_norm": 4.079070568084717, "learning_rate": 3.3682449529226897e-06, "loss": 1.8171, "mean_token_accuracy": 0.554118487238884, "num_tokens": 20042753.0, "step": 5560 }, { "entropy": 1.809765625, "epoch": 1.2315091210613598, "grad_norm": 3.5342938899993896, "learning_rate": 3.362606892980733e-06, "loss": 1.8012, "mean_token_accuracy": 0.5551428779959678, "num_tokens": 20080692.0, "step": 5570 }, { "entropy": 1.749609375, "epoch": 1.2337202874516306, "grad_norm": 3.0421226024627686, "learning_rate": 3.356963848468257e-06, "loss": 1.7314, "mean_token_accuracy": 0.572898530960083, "num_tokens": 20115150.0, "step": 5580 }, { "entropy": 1.803515625, "epoch": 1.2359314538419015, "grad_norm": 3.638065814971924, "learning_rate": 3.3513158519935735e-06, "loss": 1.8239, "mean_token_accuracy": 0.5563164204359055, "num_tokens": 20149279.0, "step": 5590 }, { "entropy": 1.788671875, "epoch": 1.2381426202321726, "grad_norm": 3.0333824157714844, "learning_rate": 3.3456629361936057e-06, "loss": 1.8222, "mean_token_accuracy": 0.5578877419233322, "num_tokens": 20183175.0, "step": 5600 }, { "entropy": 1.802734375, "epoch": 1.2403537866224434, "grad_norm": 3.4787251949310303, "learning_rate": 3.3400051337337064e-06, "loss": 1.7951, "mean_token_accuracy": 0.5597830682992935, "num_tokens": 20221094.0, "step": 5610 }, { "entropy": 1.801171875, "epoch": 1.2425649530127143, "grad_norm": 3.272167205810547, "learning_rate": 3.3343424773074647e-06, "loss": 1.7667, "mean_token_accuracy": 0.5651083737611771, "num_tokens": 20257020.0, "step": 5620 }, { "entropy": 1.723046875, "epoch": 1.2447761194029852, "grad_norm": 3.5526514053344727, "learning_rate": 3.3286749996365174e-06, "loss": 1.7662, "mean_token_accuracy": 0.5635533422231674, "num_tokens": 20294081.0, "step": 5630 }, { "entropy": 1.804296875, "epoch": 1.246987285793256, "grad_norm": 3.399162530899048, "learning_rate": 3.3230027334703627e-06, "loss": 1.8339, "mean_token_accuracy": 0.5531530886888504, "num_tokens": 20329917.0, "step": 5640 }, { "entropy": 1.803515625, "epoch": 1.2491984521835269, "grad_norm": 3.286513328552246, "learning_rate": 3.317325711586169e-06, "loss": 1.7907, "mean_token_accuracy": 0.5630396157503128, "num_tokens": 20365963.0, "step": 5650 }, { "entropy": 1.78984375, "epoch": 1.2514096185737977, "grad_norm": 3.615518808364868, "learning_rate": 3.3116439667885824e-06, "loss": 1.8202, "mean_token_accuracy": 0.5621116042137146, "num_tokens": 20400775.0, "step": 5660 }, { "entropy": 1.805859375, "epoch": 1.2536207849640686, "grad_norm": 4.013845443725586, "learning_rate": 3.3059575319095457e-06, "loss": 1.8051, "mean_token_accuracy": 0.555592519044876, "num_tokens": 20436053.0, "step": 5670 }, { "entropy": 1.81484375, "epoch": 1.2558319513543394, "grad_norm": 3.2020750045776367, "learning_rate": 3.3002664398080973e-06, "loss": 1.7957, "mean_token_accuracy": 0.5647481322288513, "num_tokens": 20472992.0, "step": 5680 }, { "entropy": 1.7765625, "epoch": 1.2580431177446103, "grad_norm": 3.5436997413635254, "learning_rate": 3.2945707233701928e-06, "loss": 1.7963, "mean_token_accuracy": 0.5634588420391082, "num_tokens": 20511290.0, "step": 5690 }, { "entropy": 1.77734375, "epoch": 1.2602542841348812, "grad_norm": 2.98034930229187, "learning_rate": 3.288870415508506e-06, "loss": 1.7743, "mean_token_accuracy": 0.5676083490252495, "num_tokens": 20546413.0, "step": 5700 }, { "entropy": 1.77421875, "epoch": 1.262465450525152, "grad_norm": 2.8382561206817627, "learning_rate": 3.2831655491622433e-06, "loss": 1.7743, "mean_token_accuracy": 0.5654417097568512, "num_tokens": 20580819.0, "step": 5710 }, { "entropy": 1.786328125, "epoch": 1.2646766169154229, "grad_norm": 3.536799669265747, "learning_rate": 3.2774561572969533e-06, "loss": 1.7819, "mean_token_accuracy": 0.5645060062408447, "num_tokens": 20618012.0, "step": 5720 }, { "entropy": 1.81171875, "epoch": 1.2668877833056937, "grad_norm": 3.211913585662842, "learning_rate": 3.2717422729043326e-06, "loss": 1.7804, "mean_token_accuracy": 0.5650122970342636, "num_tokens": 20654813.0, "step": 5730 }, { "entropy": 1.774609375, "epoch": 1.2690989496959646, "grad_norm": 3.6548187732696533, "learning_rate": 3.2660239290020414e-06, "loss": 1.7591, "mean_token_accuracy": 0.5687688261270523, "num_tokens": 20691862.0, "step": 5740 }, { "entropy": 1.816015625, "epoch": 1.2713101160862355, "grad_norm": 3.761094331741333, "learning_rate": 3.260301158633506e-06, "loss": 1.8209, "mean_token_accuracy": 0.5604167640209198, "num_tokens": 20729050.0, "step": 5750 }, { "entropy": 1.7953125, "epoch": 1.2735212824765063, "grad_norm": 3.6631155014038086, "learning_rate": 3.2545739948677328e-06, "loss": 1.8152, "mean_token_accuracy": 0.5569219946861267, "num_tokens": 20765868.0, "step": 5760 }, { "entropy": 1.8265625, "epoch": 1.2757324488667772, "grad_norm": 3.5497615337371826, "learning_rate": 3.2488424707991153e-06, "loss": 1.8175, "mean_token_accuracy": 0.5578499391674996, "num_tokens": 20800811.0, "step": 5770 }, { "entropy": 1.827734375, "epoch": 1.277943615257048, "grad_norm": 3.3413047790527344, "learning_rate": 3.243106619547242e-06, "loss": 1.7848, "mean_token_accuracy": 0.5605043083429336, "num_tokens": 20839108.0, "step": 5780 }, { "entropy": 1.81484375, "epoch": 1.2801547816473189, "grad_norm": 3.638014793395996, "learning_rate": 3.2373664742567067e-06, "loss": 1.7985, "mean_token_accuracy": 0.5557990193367004, "num_tokens": 20875954.0, "step": 5790 }, { "entropy": 1.780078125, "epoch": 1.2823659480375897, "grad_norm": 4.250361442565918, "learning_rate": 3.231622068096917e-06, "loss": 1.7959, "mean_token_accuracy": 0.5575650364160538, "num_tokens": 20910398.0, "step": 5800 }, { "entropy": 1.808984375, "epoch": 1.2845771144278606, "grad_norm": 3.240628480911255, "learning_rate": 3.225873434261901e-06, "loss": 1.8446, "mean_token_accuracy": 0.5537953585386276, "num_tokens": 20946967.0, "step": 5810 }, { "entropy": 1.783984375, "epoch": 1.2867882808181315, "grad_norm": 2.703902006149292, "learning_rate": 3.220120605970116e-06, "loss": 1.7654, "mean_token_accuracy": 0.5665196567773819, "num_tokens": 20985321.0, "step": 5820 }, { "entropy": 1.812890625, "epoch": 1.2889994472084023, "grad_norm": 3.472301959991455, "learning_rate": 3.2143636164642577e-06, "loss": 1.801, "mean_token_accuracy": 0.560531222820282, "num_tokens": 21021526.0, "step": 5830 }, { "entropy": 1.79765625, "epoch": 1.2912106135986732, "grad_norm": 3.3239078521728516, "learning_rate": 3.2086024990110677e-06, "loss": 1.8352, "mean_token_accuracy": 0.5581744194030762, "num_tokens": 21058076.0, "step": 5840 }, { "entropy": 1.785546875, "epoch": 1.293421779988944, "grad_norm": 3.357722282409668, "learning_rate": 3.2028372869011397e-06, "loss": 1.7433, "mean_token_accuracy": 0.5705197423696518, "num_tokens": 21091714.0, "step": 5850 }, { "entropy": 1.774609375, "epoch": 1.2956329463792151, "grad_norm": 3.7626278400421143, "learning_rate": 3.197068013448729e-06, "loss": 1.7829, "mean_token_accuracy": 0.5648401558399201, "num_tokens": 21126210.0, "step": 5860 }, { "entropy": 1.834765625, "epoch": 1.297844112769486, "grad_norm": 4.342770099639893, "learning_rate": 3.1912947119915603e-06, "loss": 1.8543, "mean_token_accuracy": 0.5537184774875641, "num_tokens": 21164060.0, "step": 5870 }, { "entropy": 1.78515625, "epoch": 1.3000552791597568, "grad_norm": 3.123088836669922, "learning_rate": 3.1855174158906327e-06, "loss": 1.7443, "mean_token_accuracy": 0.5699366807937623, "num_tokens": 21200004.0, "step": 5880 }, { "entropy": 1.74765625, "epoch": 1.3022664455500277, "grad_norm": 3.5616226196289062, "learning_rate": 3.179736158530029e-06, "loss": 1.7238, "mean_token_accuracy": 0.5746718764305114, "num_tokens": 21236493.0, "step": 5890 }, { "entropy": 1.766796875, "epoch": 1.3044776119402985, "grad_norm": 4.311583995819092, "learning_rate": 3.1739509733167217e-06, "loss": 1.7797, "mean_token_accuracy": 0.5613225072622299, "num_tokens": 21273292.0, "step": 5900 }, { "entropy": 1.813671875, "epoch": 1.3066887783305694, "grad_norm": 3.814483404159546, "learning_rate": 3.168161893680381e-06, "loss": 1.7913, "mean_token_accuracy": 0.561202609539032, "num_tokens": 21309115.0, "step": 5910 }, { "entropy": 1.81796875, "epoch": 1.3088999447208403, "grad_norm": 3.6585819721221924, "learning_rate": 3.162368953073181e-06, "loss": 1.7914, "mean_token_accuracy": 0.5669221550226211, "num_tokens": 21345584.0, "step": 5920 }, { "entropy": 1.775, "epoch": 1.3111111111111111, "grad_norm": 3.0892252922058105, "learning_rate": 3.1565721849696053e-06, "loss": 1.7678, "mean_token_accuracy": 0.5694296389818192, "num_tokens": 21381305.0, "step": 5930 }, { "entropy": 1.76171875, "epoch": 1.313322277501382, "grad_norm": 3.468299627304077, "learning_rate": 3.1507716228662557e-06, "loss": 1.7799, "mean_token_accuracy": 0.5634338557720184, "num_tokens": 21415632.0, "step": 5940 }, { "entropy": 1.773828125, "epoch": 1.3155334438916528, "grad_norm": 3.9129812717437744, "learning_rate": 3.144967300281657e-06, "loss": 1.7608, "mean_token_accuracy": 0.5738358110189438, "num_tokens": 21452071.0, "step": 5950 }, { "entropy": 1.798828125, "epoch": 1.3177446102819237, "grad_norm": 4.279623985290527, "learning_rate": 3.139159250756066e-06, "loss": 1.8359, "mean_token_accuracy": 0.5571326866745949, "num_tokens": 21487682.0, "step": 5960 }, { "entropy": 1.864453125, "epoch": 1.3199557766721945, "grad_norm": 3.366504192352295, "learning_rate": 3.133347507851272e-06, "loss": 1.8475, "mean_token_accuracy": 0.5572561532258987, "num_tokens": 21526918.0, "step": 5970 }, { "entropy": 1.812109375, "epoch": 1.3221669430624654, "grad_norm": 3.256833076477051, "learning_rate": 3.1275321051504093e-06, "loss": 1.8074, "mean_token_accuracy": 0.5580455496907234, "num_tokens": 21565231.0, "step": 5980 }, { "entropy": 1.821484375, "epoch": 1.3243781094527363, "grad_norm": 3.6120660305023193, "learning_rate": 3.1217130762577586e-06, "loss": 1.8362, "mean_token_accuracy": 0.5574668347835541, "num_tokens": 21602996.0, "step": 5990 }, { "entropy": 1.75234375, "epoch": 1.3265892758430071, "grad_norm": 3.6986913681030273, "learning_rate": 3.115890454798557e-06, "loss": 1.777, "mean_token_accuracy": 0.5652501463890076, "num_tokens": 21641120.0, "step": 6000 }, { "epoch": 1.3265892758430071, "eval_entropy": 1.7850124378109453, "eval_loss": 1.8571977615356445, "eval_mean_token_accuracy": 0.552127306467265, "eval_num_tokens": 21641120.0, "eval_runtime": 112.1069, "eval_samples_per_second": 143.434, "eval_steps_per_second": 8.965, "step": 6000 }, { "entropy": 1.767578125, "epoch": 1.328800442233278, "grad_norm": 3.820396900177002, "learning_rate": 3.110064274418797e-06, "loss": 1.776, "mean_token_accuracy": 0.5668271213769913, "num_tokens": 21677626.0, "step": 6010 }, { "entropy": 1.793359375, "epoch": 1.331011608623549, "grad_norm": 3.534780263900757, "learning_rate": 3.104234568785041e-06, "loss": 1.8039, "mean_token_accuracy": 0.558014976978302, "num_tokens": 21713279.0, "step": 6020 }, { "entropy": 1.785546875, "epoch": 1.33322277501382, "grad_norm": 3.8351495265960693, "learning_rate": 3.0984013715842196e-06, "loss": 1.7894, "mean_token_accuracy": 0.5611502975225449, "num_tokens": 21749396.0, "step": 6030 }, { "entropy": 1.775390625, "epoch": 1.3354339414040908, "grad_norm": 3.727304220199585, "learning_rate": 3.0925647165234394e-06, "loss": 1.7961, "mean_token_accuracy": 0.5596056342124939, "num_tokens": 21784454.0, "step": 6040 }, { "entropy": 1.746484375, "epoch": 1.3376451077943616, "grad_norm": 3.3840034008026123, "learning_rate": 3.086724637329789e-06, "loss": 1.7458, "mean_token_accuracy": 0.5678827106952667, "num_tokens": 21820242.0, "step": 6050 }, { "entropy": 1.78984375, "epoch": 1.3398562741846325, "grad_norm": 3.678936719894409, "learning_rate": 3.0808811677501425e-06, "loss": 1.8207, "mean_token_accuracy": 0.5588392555713654, "num_tokens": 21858520.0, "step": 6060 }, { "entropy": 1.787890625, "epoch": 1.3420674405749033, "grad_norm": 3.6143128871917725, "learning_rate": 3.0750343415509654e-06, "loss": 1.8109, "mean_token_accuracy": 0.5628083169460296, "num_tokens": 21895073.0, "step": 6070 }, { "entropy": 1.82890625, "epoch": 1.3442786069651742, "grad_norm": 3.7559196949005127, "learning_rate": 3.0691841925181203e-06, "loss": 1.8282, "mean_token_accuracy": 0.5517563879489898, "num_tokens": 21930064.0, "step": 6080 }, { "entropy": 1.794140625, "epoch": 1.346489773355445, "grad_norm": 3.136530876159668, "learning_rate": 3.0633307544566705e-06, "loss": 1.7965, "mean_token_accuracy": 0.5639650210738182, "num_tokens": 21965403.0, "step": 6090 }, { "entropy": 1.79140625, "epoch": 1.348700939745716, "grad_norm": 3.8732857704162598, "learning_rate": 3.057474061190684e-06, "loss": 1.8043, "mean_token_accuracy": 0.5628103628754616, "num_tokens": 22001121.0, "step": 6100 }, { "entropy": 1.723828125, "epoch": 1.3509121061359868, "grad_norm": 3.044196844100952, "learning_rate": 3.05161414656304e-06, "loss": 1.7104, "mean_token_accuracy": 0.5743643552064895, "num_tokens": 22035675.0, "step": 6110 }, { "entropy": 1.753125, "epoch": 1.3531232725262576, "grad_norm": 3.3551251888275146, "learning_rate": 3.0457510444352318e-06, "loss": 1.7749, "mean_token_accuracy": 0.5593810588121414, "num_tokens": 22069035.0, "step": 6120 }, { "entropy": 1.7609375, "epoch": 1.3553344389165285, "grad_norm": 3.3142549991607666, "learning_rate": 3.0398847886871718e-06, "loss": 1.7877, "mean_token_accuracy": 0.5619940429925918, "num_tokens": 22104297.0, "step": 6130 }, { "entropy": 1.78046875, "epoch": 1.3575456053067994, "grad_norm": 3.6372194290161133, "learning_rate": 3.0340154132169963e-06, "loss": 1.7534, "mean_token_accuracy": 0.5727092772722244, "num_tokens": 22140878.0, "step": 6140 }, { "entropy": 1.8109375, "epoch": 1.3597567716970702, "grad_norm": 3.323709726333618, "learning_rate": 3.028142951940868e-06, "loss": 1.8059, "mean_token_accuracy": 0.5585047423839569, "num_tokens": 22176807.0, "step": 6150 }, { "entropy": 1.769921875, "epoch": 1.361967938087341, "grad_norm": 3.404179573059082, "learning_rate": 3.022267438792781e-06, "loss": 1.7555, "mean_token_accuracy": 0.5680437862873078, "num_tokens": 22213766.0, "step": 6160 }, { "entropy": 1.785546875, "epoch": 1.364179104477612, "grad_norm": 3.52239990234375, "learning_rate": 3.016388907724364e-06, "loss": 1.7937, "mean_token_accuracy": 0.5593192428350449, "num_tokens": 22250602.0, "step": 6170 }, { "entropy": 1.7609375, "epoch": 1.3663902708678828, "grad_norm": 3.9132049083709717, "learning_rate": 3.010507392704687e-06, "loss": 1.7849, "mean_token_accuracy": 0.5654122918844223, "num_tokens": 22285446.0, "step": 6180 }, { "entropy": 1.762890625, "epoch": 1.3686014372581536, "grad_norm": 3.373643398284912, "learning_rate": 3.00462292772006e-06, "loss": 1.7742, "mean_token_accuracy": 0.5645978271961212, "num_tokens": 22320129.0, "step": 6190 }, { "entropy": 1.82265625, "epoch": 1.3708126036484245, "grad_norm": 2.6540253162384033, "learning_rate": 2.9987355467738423e-06, "loss": 1.8108, "mean_token_accuracy": 0.5569920986890793, "num_tokens": 22356357.0, "step": 6200 }, { "entropy": 1.816015625, "epoch": 1.3730237700386954, "grad_norm": 3.918698787689209, "learning_rate": 2.9928452838862387e-06, "loss": 1.7933, "mean_token_accuracy": 0.5639100223779678, "num_tokens": 22391047.0, "step": 6210 }, { "entropy": 1.762890625, "epoch": 1.3752349364289662, "grad_norm": 3.1953556537628174, "learning_rate": 2.986952173094113e-06, "loss": 1.7848, "mean_token_accuracy": 0.5650658786296845, "num_tokens": 22426348.0, "step": 6220 }, { "entropy": 1.809765625, "epoch": 1.377446102819237, "grad_norm": 3.59268856048584, "learning_rate": 2.9810562484507806e-06, "loss": 1.8065, "mean_token_accuracy": 0.5616378337144852, "num_tokens": 22462821.0, "step": 6230 }, { "entropy": 1.771484375, "epoch": 1.379657269209508, "grad_norm": 4.052269458770752, "learning_rate": 2.975157544025819e-06, "loss": 1.7795, "mean_token_accuracy": 0.5660430938005447, "num_tokens": 22498917.0, "step": 6240 }, { "entropy": 1.769921875, "epoch": 1.3818684355997788, "grad_norm": 3.9682633876800537, "learning_rate": 2.969256093904869e-06, "loss": 1.7709, "mean_token_accuracy": 0.5626526653766633, "num_tokens": 22533705.0, "step": 6250 }, { "entropy": 1.784375, "epoch": 1.3840796019900496, "grad_norm": 2.326179265975952, "learning_rate": 2.963351932189437e-06, "loss": 1.7813, "mean_token_accuracy": 0.5670030087232589, "num_tokens": 22569599.0, "step": 6260 }, { "entropy": 1.82734375, "epoch": 1.3862907683803205, "grad_norm": 3.4143896102905273, "learning_rate": 2.9574450929966977e-06, "loss": 1.8424, "mean_token_accuracy": 0.5509164839982986, "num_tokens": 22604988.0, "step": 6270 }, { "entropy": 1.8265625, "epoch": 1.3885019347705914, "grad_norm": 3.34903883934021, "learning_rate": 2.9515356104592967e-06, "loss": 1.8018, "mean_token_accuracy": 0.5605247437953949, "num_tokens": 22642550.0, "step": 6280 }, { "entropy": 1.816015625, "epoch": 1.3907131011608622, "grad_norm": 3.6885504722595215, "learning_rate": 2.9456235187251582e-06, "loss": 1.802, "mean_token_accuracy": 0.5593595266342163, "num_tokens": 22678756.0, "step": 6290 }, { "entropy": 1.77109375, "epoch": 1.3929242675511333, "grad_norm": 3.866255283355713, "learning_rate": 2.939708851957278e-06, "loss": 1.7531, "mean_token_accuracy": 0.5701113522052765, "num_tokens": 22714987.0, "step": 6300 }, { "entropy": 1.8140625, "epoch": 1.3951354339414042, "grad_norm": 3.5575506687164307, "learning_rate": 2.9337916443335374e-06, "loss": 1.8239, "mean_token_accuracy": 0.5536852985620498, "num_tokens": 22750731.0, "step": 6310 }, { "entropy": 1.753515625, "epoch": 1.397346600331675, "grad_norm": 3.3051750659942627, "learning_rate": 2.927871930046495e-06, "loss": 1.7172, "mean_token_accuracy": 0.5749614030122757, "num_tokens": 22786150.0, "step": 6320 }, { "entropy": 1.758203125, "epoch": 1.3995577667219459, "grad_norm": 3.677420139312744, "learning_rate": 2.921949743303197e-06, "loss": 1.7685, "mean_token_accuracy": 0.5683232516050338, "num_tokens": 22821915.0, "step": 6330 }, { "entropy": 1.765234375, "epoch": 1.4017689331122167, "grad_norm": 3.6115567684173584, "learning_rate": 2.9160251183249777e-06, "loss": 1.7562, "mean_token_accuracy": 0.5710659384727478, "num_tokens": 22860388.0, "step": 6340 }, { "entropy": 1.7359375, "epoch": 1.4039800995024876, "grad_norm": 3.852043867111206, "learning_rate": 2.9100980893472565e-06, "loss": 1.7283, "mean_token_accuracy": 0.5753805041313171, "num_tokens": 22893371.0, "step": 6350 }, { "entropy": 1.7578125, "epoch": 1.4061912658927584, "grad_norm": 3.275733232498169, "learning_rate": 2.904168690619349e-06, "loss": 1.7776, "mean_token_accuracy": 0.563394570350647, "num_tokens": 22930592.0, "step": 6360 }, { "entropy": 1.794921875, "epoch": 1.4084024322830293, "grad_norm": 3.9969217777252197, "learning_rate": 2.8982369564042607e-06, "loss": 1.7988, "mean_token_accuracy": 0.560490146279335, "num_tokens": 22966072.0, "step": 6370 }, { "entropy": 1.766796875, "epoch": 1.4106135986733002, "grad_norm": 3.636631727218628, "learning_rate": 2.8923029209784952e-06, "loss": 1.7481, "mean_token_accuracy": 0.5732327073812484, "num_tokens": 23000611.0, "step": 6380 }, { "entropy": 1.76953125, "epoch": 1.412824765063571, "grad_norm": 3.46740460395813, "learning_rate": 2.886366618631852e-06, "loss": 1.7815, "mean_token_accuracy": 0.563927635550499, "num_tokens": 23037361.0, "step": 6390 }, { "entropy": 1.78125, "epoch": 1.4150359314538419, "grad_norm": 3.56950044631958, "learning_rate": 2.8804280836672327e-06, "loss": 1.7819, "mean_token_accuracy": 0.5618812888860703, "num_tokens": 23073773.0, "step": 6400 }, { "entropy": 1.762109375, "epoch": 1.4172470978441127, "grad_norm": 3.3874595165252686, "learning_rate": 2.8744873504004355e-06, "loss": 1.7651, "mean_token_accuracy": 0.5682212561368942, "num_tokens": 23110495.0, "step": 6410 }, { "entropy": 1.789453125, "epoch": 1.4194582642343836, "grad_norm": 3.414144515991211, "learning_rate": 2.868544453159966e-06, "loss": 1.7663, "mean_token_accuracy": 0.5659948736429214, "num_tokens": 23144602.0, "step": 6420 }, { "entropy": 1.730078125, "epoch": 1.4216694306246545, "grad_norm": 2.2560346126556396, "learning_rate": 2.8625994262868314e-06, "loss": 1.7384, "mean_token_accuracy": 0.5730728596448899, "num_tokens": 23181109.0, "step": 6430 }, { "entropy": 1.737890625, "epoch": 1.4238805970149253, "grad_norm": 3.801737070083618, "learning_rate": 2.8566523041343465e-06, "loss": 1.7636, "mean_token_accuracy": 0.567984202504158, "num_tokens": 23218980.0, "step": 6440 }, { "entropy": 1.7703125, "epoch": 1.4260917634051962, "grad_norm": 4.60996150970459, "learning_rate": 2.8507031210679328e-06, "loss": 1.8034, "mean_token_accuracy": 0.5598806262016296, "num_tokens": 23253856.0, "step": 6450 }, { "entropy": 1.815625, "epoch": 1.4283029297954672, "grad_norm": 3.7916951179504395, "learning_rate": 2.8447519114649203e-06, "loss": 1.8191, "mean_token_accuracy": 0.5626054763793945, "num_tokens": 23293089.0, "step": 6460 }, { "entropy": 1.75859375, "epoch": 1.430514096185738, "grad_norm": 4.215456962585449, "learning_rate": 2.838798709714352e-06, "loss": 1.7364, "mean_token_accuracy": 0.5671977251768112, "num_tokens": 23327059.0, "step": 6470 }, { "entropy": 1.79765625, "epoch": 1.432725262576009, "grad_norm": 2.7653579711914062, "learning_rate": 2.8328435502167795e-06, "loss": 1.799, "mean_token_accuracy": 0.5632517874240875, "num_tokens": 23362006.0, "step": 6480 }, { "entropy": 1.80234375, "epoch": 1.4349364289662798, "grad_norm": 3.4138288497924805, "learning_rate": 2.826886467384069e-06, "loss": 1.7829, "mean_token_accuracy": 0.5621898084878921, "num_tokens": 23398263.0, "step": 6490 }, { "entropy": 1.792578125, "epoch": 1.4371475953565507, "grad_norm": 2.771493434906006, "learning_rate": 2.8209274956391993e-06, "loss": 1.8076, "mean_token_accuracy": 0.5588776767253876, "num_tokens": 23435712.0, "step": 6500 }, { "epoch": 1.4371475953565507, "eval_entropy": 1.7771766169154228, "eval_loss": 1.844801902770996, "eval_mean_token_accuracy": 0.5543095984565678, "eval_num_tokens": 23435712.0, "eval_runtime": 111.7954, "eval_samples_per_second": 143.834, "eval_steps_per_second": 8.99, "step": 6500 }, { "entropy": 1.776171875, "epoch": 1.4393587617468215, "grad_norm": 3.992645502090454, "learning_rate": 2.814966669416066e-06, "loss": 1.7933, "mean_token_accuracy": 0.5660274803638459, "num_tokens": 23471456.0, "step": 6510 }, { "entropy": 1.800390625, "epoch": 1.4415699281370924, "grad_norm": 3.3418450355529785, "learning_rate": 2.8090040231592786e-06, "loss": 1.7774, "mean_token_accuracy": 0.5672044098377228, "num_tokens": 23508887.0, "step": 6520 }, { "entropy": 1.788671875, "epoch": 1.4437810945273633, "grad_norm": 3.965697765350342, "learning_rate": 2.803039591323966e-06, "loss": 1.7812, "mean_token_accuracy": 0.5604627668857575, "num_tokens": 23542761.0, "step": 6530 }, { "entropy": 1.7984375, "epoch": 1.445992260917634, "grad_norm": 4.169949054718018, "learning_rate": 2.7970734083755735e-06, "loss": 1.7958, "mean_token_accuracy": 0.566362076997757, "num_tokens": 23578134.0, "step": 6540 }, { "entropy": 1.75703125, "epoch": 1.448203427307905, "grad_norm": 3.827418088912964, "learning_rate": 2.791105508789666e-06, "loss": 1.7646, "mean_token_accuracy": 0.566959148645401, "num_tokens": 23613526.0, "step": 6550 }, { "entropy": 1.734375, "epoch": 1.4504145936981758, "grad_norm": 3.7612462043762207, "learning_rate": 2.785135927051727e-06, "loss": 1.7344, "mean_token_accuracy": 0.5662859410047532, "num_tokens": 23646661.0, "step": 6560 }, { "entropy": 1.776953125, "epoch": 1.4526257600884467, "grad_norm": 3.3953490257263184, "learning_rate": 2.7791646976569615e-06, "loss": 1.7634, "mean_token_accuracy": 0.5674682110548019, "num_tokens": 23680315.0, "step": 6570 }, { "entropy": 1.75390625, "epoch": 1.4548369264787175, "grad_norm": 4.478320598602295, "learning_rate": 2.773191855110095e-06, "loss": 1.7572, "mean_token_accuracy": 0.564544004201889, "num_tokens": 23714323.0, "step": 6580 }, { "entropy": 1.748046875, "epoch": 1.4570480928689884, "grad_norm": 3.6026175022125244, "learning_rate": 2.7672174339251747e-06, "loss": 1.7884, "mean_token_accuracy": 0.5681850671768188, "num_tokens": 23749273.0, "step": 6590 }, { "entropy": 1.76953125, "epoch": 1.4592592592592593, "grad_norm": 3.054741859436035, "learning_rate": 2.761241468625369e-06, "loss": 1.7546, "mean_token_accuracy": 0.5717523038387299, "num_tokens": 23786399.0, "step": 6600 }, { "entropy": 1.780078125, "epoch": 1.4614704256495301, "grad_norm": 3.4545223712921143, "learning_rate": 2.7552639937427707e-06, "loss": 1.8001, "mean_token_accuracy": 0.5618358820676803, "num_tokens": 23821430.0, "step": 6610 }, { "entropy": 1.815234375, "epoch": 1.463681592039801, "grad_norm": 3.6075918674468994, "learning_rate": 2.7492850438181933e-06, "loss": 1.8047, "mean_token_accuracy": 0.5616067349910736, "num_tokens": 23857271.0, "step": 6620 }, { "entropy": 1.8109375, "epoch": 1.4658927584300718, "grad_norm": 3.6836564540863037, "learning_rate": 2.7433046534009772e-06, "loss": 1.7804, "mean_token_accuracy": 0.5608997613191604, "num_tokens": 23892188.0, "step": 6630 }, { "entropy": 1.815234375, "epoch": 1.4681039248203427, "grad_norm": 3.167994976043701, "learning_rate": 2.737322857048784e-06, "loss": 1.8074, "mean_token_accuracy": 0.559985825419426, "num_tokens": 23929360.0, "step": 6640 }, { "entropy": 1.798046875, "epoch": 1.4703150912106135, "grad_norm": 3.9118082523345947, "learning_rate": 2.7313396893273984e-06, "loss": 1.801, "mean_token_accuracy": 0.5545473724603653, "num_tokens": 23964820.0, "step": 6650 }, { "entropy": 1.758984375, "epoch": 1.4725262576008844, "grad_norm": 3.614159345626831, "learning_rate": 2.7253551848105346e-06, "loss": 1.7417, "mean_token_accuracy": 0.572695043683052, "num_tokens": 23997914.0, "step": 6660 }, { "entropy": 1.775390625, "epoch": 1.4747374239911553, "grad_norm": 3.576554298400879, "learning_rate": 2.719369378079626e-06, "loss": 1.794, "mean_token_accuracy": 0.5605390518903732, "num_tokens": 24032184.0, "step": 6670 }, { "entropy": 1.7859375, "epoch": 1.4769485903814261, "grad_norm": 3.463318347930908, "learning_rate": 2.713382303723634e-06, "loss": 1.7616, "mean_token_accuracy": 0.5717710316181183, "num_tokens": 24069356.0, "step": 6680 }, { "entropy": 1.719921875, "epoch": 1.479159756771697, "grad_norm": 4.016140937805176, "learning_rate": 2.707393996338844e-06, "loss": 1.7185, "mean_token_accuracy": 0.5830074578523636, "num_tokens": 24106517.0, "step": 6690 }, { "entropy": 1.753515625, "epoch": 1.4813709231619678, "grad_norm": 3.9528045654296875, "learning_rate": 2.7014044905286664e-06, "loss": 1.7788, "mean_token_accuracy": 0.5631624072790146, "num_tokens": 24142877.0, "step": 6700 }, { "entropy": 1.78828125, "epoch": 1.4835820895522387, "grad_norm": 3.84322452545166, "learning_rate": 2.6954138209034375e-06, "loss": 1.7908, "mean_token_accuracy": 0.5673695862293243, "num_tokens": 24182191.0, "step": 6710 }, { "entropy": 1.79296875, "epoch": 1.4857932559425095, "grad_norm": 3.6799237728118896, "learning_rate": 2.689422022080217e-06, "loss": 1.8051, "mean_token_accuracy": 0.562924399971962, "num_tokens": 24216604.0, "step": 6720 }, { "entropy": 1.753515625, "epoch": 1.4880044223327804, "grad_norm": 3.308382034301758, "learning_rate": 2.6834291286825915e-06, "loss": 1.7457, "mean_token_accuracy": 0.5736207246780396, "num_tokens": 24252217.0, "step": 6730 }, { "entropy": 1.79453125, "epoch": 1.4902155887230515, "grad_norm": 3.043153762817383, "learning_rate": 2.677435175340471e-06, "loss": 1.7787, "mean_token_accuracy": 0.5649339318275451, "num_tokens": 24288704.0, "step": 6740 }, { "entropy": 1.75078125, "epoch": 1.4924267551133223, "grad_norm": 3.3482656478881836, "learning_rate": 2.671440196689892e-06, "loss": 1.7364, "mean_token_accuracy": 0.5702936947345734, "num_tokens": 24322249.0, "step": 6750 }, { "entropy": 1.766796875, "epoch": 1.4946379215035932, "grad_norm": 3.874194383621216, "learning_rate": 2.6654442273728143e-06, "loss": 1.7835, "mean_token_accuracy": 0.5604252785444259, "num_tokens": 24358139.0, "step": 6760 }, { "entropy": 1.74765625, "epoch": 1.496849087893864, "grad_norm": 3.7722084522247314, "learning_rate": 2.659447302036923e-06, "loss": 1.7524, "mean_token_accuracy": 0.5671618014574051, "num_tokens": 24395101.0, "step": 6770 }, { "entropy": 1.755078125, "epoch": 1.499060254284135, "grad_norm": 3.672588586807251, "learning_rate": 2.653449455335428e-06, "loss": 1.7485, "mean_token_accuracy": 0.5709905534982681, "num_tokens": 24430135.0, "step": 6780 }, { "entropy": 1.76015625, "epoch": 1.5012714206744058, "grad_norm": 3.6790823936462402, "learning_rate": 2.647450721926862e-06, "loss": 1.7696, "mean_token_accuracy": 0.5680080950260162, "num_tokens": 24464763.0, "step": 6790 }, { "entropy": 1.77890625, "epoch": 1.5034825870646766, "grad_norm": 3.462122917175293, "learning_rate": 2.641451136474883e-06, "loss": 1.7798, "mean_token_accuracy": 0.5666156440973282, "num_tokens": 24501316.0, "step": 6800 }, { "entropy": 1.77734375, "epoch": 1.5056937534549475, "grad_norm": 4.919149398803711, "learning_rate": 2.6354507336480707e-06, "loss": 1.7767, "mean_token_accuracy": 0.5715942829847336, "num_tokens": 24536367.0, "step": 6810 }, { "entropy": 1.758984375, "epoch": 1.5079049198452184, "grad_norm": 3.2147161960601807, "learning_rate": 2.62944954811973e-06, "loss": 1.7939, "mean_token_accuracy": 0.5674211353063583, "num_tokens": 24573055.0, "step": 6820 }, { "entropy": 1.78671875, "epoch": 1.5101160862354892, "grad_norm": 3.72737455368042, "learning_rate": 2.623447614567688e-06, "loss": 1.7903, "mean_token_accuracy": 0.5639339953660965, "num_tokens": 24611131.0, "step": 6830 }, { "entropy": 1.74765625, "epoch": 1.51232725262576, "grad_norm": 4.152836799621582, "learning_rate": 2.6174449676740933e-06, "loss": 1.7072, "mean_token_accuracy": 0.5771721541881562, "num_tokens": 24646840.0, "step": 6840 }, { "entropy": 1.805078125, "epoch": 1.514538419016031, "grad_norm": 3.0797042846679688, "learning_rate": 2.611441642125217e-06, "loss": 1.819, "mean_token_accuracy": 0.555337205529213, "num_tokens": 24684793.0, "step": 6850 }, { "entropy": 1.76328125, "epoch": 1.5167495854063018, "grad_norm": 3.4738271236419678, "learning_rate": 2.6054376726112536e-06, "loss": 1.7626, "mean_token_accuracy": 0.5688392043113708, "num_tokens": 24723545.0, "step": 6860 }, { "entropy": 1.77265625, "epoch": 1.5189607517965726, "grad_norm": 3.5689122676849365, "learning_rate": 2.5994330938261148e-06, "loss": 1.7646, "mean_token_accuracy": 0.5735682964324951, "num_tokens": 24761697.0, "step": 6870 }, { "entropy": 1.82578125, "epoch": 1.5211719181868437, "grad_norm": 2.730982542037964, "learning_rate": 2.5934279404672375e-06, "loss": 1.8302, "mean_token_accuracy": 0.5567848086357117, "num_tokens": 24800175.0, "step": 6880 }, { "entropy": 1.7765625, "epoch": 1.5233830845771146, "grad_norm": 3.563002586364746, "learning_rate": 2.5874222472353755e-06, "loss": 1.8108, "mean_token_accuracy": 0.5600845083594322, "num_tokens": 24836604.0, "step": 6890 }, { "entropy": 1.741015625, "epoch": 1.5255942509673854, "grad_norm": 3.0959527492523193, "learning_rate": 2.581416048834404e-06, "loss": 1.7627, "mean_token_accuracy": 0.5675601989030838, "num_tokens": 24873196.0, "step": 6900 }, { "entropy": 1.76171875, "epoch": 1.5278054173576563, "grad_norm": 3.692702531814575, "learning_rate": 2.5754093799711163e-06, "loss": 1.7541, "mean_token_accuracy": 0.5672732532024384, "num_tokens": 24910747.0, "step": 6910 }, { "entropy": 1.787109375, "epoch": 1.5300165837479272, "grad_norm": 3.9912259578704834, "learning_rate": 2.5694022753550235e-06, "loss": 1.7792, "mean_token_accuracy": 0.5604482442140579, "num_tokens": 24947180.0, "step": 6920 }, { "entropy": 1.74765625, "epoch": 1.532227750138198, "grad_norm": 3.743095874786377, "learning_rate": 2.5633947696981583e-06, "loss": 1.7545, "mean_token_accuracy": 0.568946024775505, "num_tokens": 24983326.0, "step": 6930 }, { "entropy": 1.725390625, "epoch": 1.5344389165284689, "grad_norm": 3.4966163635253906, "learning_rate": 2.5573868977148662e-06, "loss": 1.6999, "mean_token_accuracy": 0.5783929646015167, "num_tokens": 25018538.0, "step": 6940 }, { "entropy": 1.716015625, "epoch": 1.5366500829187397, "grad_norm": 4.541505813598633, "learning_rate": 2.551378694121614e-06, "loss": 1.7362, "mean_token_accuracy": 0.5765231758356094, "num_tokens": 25052862.0, "step": 6950 }, { "entropy": 1.69609375, "epoch": 1.5388612493090106, "grad_norm": 3.38029146194458, "learning_rate": 2.54537019363678e-06, "loss": 1.6861, "mean_token_accuracy": 0.5840657472610473, "num_tokens": 25088216.0, "step": 6960 }, { "entropy": 1.781640625, "epoch": 1.5410724156992814, "grad_norm": 3.097414255142212, "learning_rate": 2.539361430980462e-06, "loss": 1.7993, "mean_token_accuracy": 0.5590603083372117, "num_tokens": 25126093.0, "step": 6970 }, { "entropy": 1.73515625, "epoch": 1.5432835820895523, "grad_norm": 3.4769742488861084, "learning_rate": 2.5333524408742706e-06, "loss": 1.7433, "mean_token_accuracy": 0.567692956328392, "num_tokens": 25162044.0, "step": 6980 }, { "entropy": 1.74375, "epoch": 1.5454947484798232, "grad_norm": 4.057430267333984, "learning_rate": 2.527343258041132e-06, "loss": 1.7578, "mean_token_accuracy": 0.5708003491163254, "num_tokens": 25196386.0, "step": 6990 }, { "entropy": 1.7859375, "epoch": 1.547705914870094, "grad_norm": 3.487654685974121, "learning_rate": 2.5213339172050836e-06, "loss": 1.7859, "mean_token_accuracy": 0.5639381110668182, "num_tokens": 25231907.0, "step": 7000 }, { "epoch": 1.547705914870094, "eval_entropy": 1.7844760572139304, "eval_loss": 1.8325761556625366, "eval_mean_token_accuracy": 0.5560018426150232, "eval_num_tokens": 25231907.0, "eval_runtime": 112.1363, "eval_samples_per_second": 143.397, "eval_steps_per_second": 8.962, "step": 7000 }, { "entropy": 1.774609375, "epoch": 1.5499170812603649, "grad_norm": 3.2935473918914795, "learning_rate": 2.5153244530910797e-06, "loss": 1.8069, "mean_token_accuracy": 0.5632348790764808, "num_tokens": 25266768.0, "step": 7010 }, { "entropy": 1.708984375, "epoch": 1.5521282476506357, "grad_norm": 4.052131175994873, "learning_rate": 2.5093149004247846e-06, "loss": 1.7369, "mean_token_accuracy": 0.5778332084417344, "num_tokens": 25305494.0, "step": 7020 }, { "entropy": 1.733203125, "epoch": 1.5543394140409066, "grad_norm": 3.9324333667755127, "learning_rate": 2.503305293932374e-06, "loss": 1.7329, "mean_token_accuracy": 0.5739285767078399, "num_tokens": 25341552.0, "step": 7030 }, { "entropy": 1.7015625, "epoch": 1.5565505804311774, "grad_norm": 3.629425525665283, "learning_rate": 2.497295668340336e-06, "loss": 1.7228, "mean_token_accuracy": 0.5711603134870529, "num_tokens": 25376773.0, "step": 7040 }, { "entropy": 1.798828125, "epoch": 1.5587617468214483, "grad_norm": 3.912900924682617, "learning_rate": 2.4912860583752676e-06, "loss": 1.8125, "mean_token_accuracy": 0.5630194246768951, "num_tokens": 25414473.0, "step": 7050 }, { "entropy": 1.76484375, "epoch": 1.5609729132117192, "grad_norm": 3.241807699203491, "learning_rate": 2.485276498763675e-06, "loss": 1.7565, "mean_token_accuracy": 0.5685221642255783, "num_tokens": 25451541.0, "step": 7060 }, { "entropy": 1.755078125, "epoch": 1.56318407960199, "grad_norm": 3.9236767292022705, "learning_rate": 2.479267024231778e-06, "loss": 1.7371, "mean_token_accuracy": 0.5698756158351899, "num_tokens": 25488035.0, "step": 7070 }, { "entropy": 1.783984375, "epoch": 1.5653952459922609, "grad_norm": 3.288602113723755, "learning_rate": 2.4732576695052985e-06, "loss": 1.7842, "mean_token_accuracy": 0.5657739579677582, "num_tokens": 25526334.0, "step": 7080 }, { "entropy": 1.833203125, "epoch": 1.5676064123825317, "grad_norm": 3.8555123805999756, "learning_rate": 2.4672484693092706e-06, "loss": 1.8197, "mean_token_accuracy": 0.5579866766929626, "num_tokens": 25563191.0, "step": 7090 }, { "entropy": 1.783984375, "epoch": 1.5698175787728026, "grad_norm": 3.596827745437622, "learning_rate": 2.461239458367832e-06, "loss": 1.7894, "mean_token_accuracy": 0.564463523030281, "num_tokens": 25600146.0, "step": 7100 }, { "entropy": 1.773828125, "epoch": 1.5720287451630734, "grad_norm": 3.784573554992676, "learning_rate": 2.455230671404031e-06, "loss": 1.7925, "mean_token_accuracy": 0.5639462798833847, "num_tokens": 25637307.0, "step": 7110 }, { "entropy": 1.782421875, "epoch": 1.5742399115533443, "grad_norm": 2.2928454875946045, "learning_rate": 2.4492221431396183e-06, "loss": 1.8091, "mean_token_accuracy": 0.5643916323781013, "num_tokens": 25674757.0, "step": 7120 }, { "entropy": 1.776171875, "epoch": 1.5764510779436152, "grad_norm": 4.0011091232299805, "learning_rate": 2.44321390829485e-06, "loss": 1.7815, "mean_token_accuracy": 0.5631216481328011, "num_tokens": 25711968.0, "step": 7130 }, { "entropy": 1.781640625, "epoch": 1.578662244333886, "grad_norm": 2.9508564472198486, "learning_rate": 2.4372060015882883e-06, "loss": 1.7604, "mean_token_accuracy": 0.570650315284729, "num_tokens": 25748490.0, "step": 7140 }, { "entropy": 1.772265625, "epoch": 1.5808734107241569, "grad_norm": 3.5423355102539062, "learning_rate": 2.431198457736598e-06, "loss": 1.8116, "mean_token_accuracy": 0.5605478376150131, "num_tokens": 25787322.0, "step": 7150 }, { "entropy": 1.7671875, "epoch": 1.5830845771144277, "grad_norm": 3.6493072509765625, "learning_rate": 2.4251913114543476e-06, "loss": 1.7745, "mean_token_accuracy": 0.5665105938911438, "num_tokens": 25823767.0, "step": 7160 }, { "entropy": 1.770703125, "epoch": 1.5852957435046986, "grad_norm": 2.9376003742218018, "learning_rate": 2.4191845974538076e-06, "loss": 1.7899, "mean_token_accuracy": 0.5623317450284958, "num_tokens": 25861736.0, "step": 7170 }, { "entropy": 1.751171875, "epoch": 1.5875069098949695, "grad_norm": 3.5045368671417236, "learning_rate": 2.4131783504447525e-06, "loss": 1.7288, "mean_token_accuracy": 0.5731777131557465, "num_tokens": 25898466.0, "step": 7180 }, { "entropy": 1.6984375, "epoch": 1.5897180762852403, "grad_norm": 3.567500114440918, "learning_rate": 2.4071726051342556e-06, "loss": 1.6779, "mean_token_accuracy": 0.5847471922636032, "num_tokens": 25932753.0, "step": 7190 }, { "entropy": 1.751171875, "epoch": 1.5919292426755112, "grad_norm": 3.6937148571014404, "learning_rate": 2.4011673962264922e-06, "loss": 1.7786, "mean_token_accuracy": 0.5640725582838059, "num_tokens": 25970798.0, "step": 7200 }, { "entropy": 1.763671875, "epoch": 1.5941404090657822, "grad_norm": 3.899021863937378, "learning_rate": 2.395162758422539e-06, "loss": 1.7695, "mean_token_accuracy": 0.5626502573490143, "num_tokens": 26007723.0, "step": 7210 }, { "entropy": 1.7546875, "epoch": 1.596351575456053, "grad_norm": 3.431830883026123, "learning_rate": 2.389158726420172e-06, "loss": 1.7786, "mean_token_accuracy": 0.5626732289791108, "num_tokens": 26045473.0, "step": 7220 }, { "entropy": 1.7328125, "epoch": 1.598562741846324, "grad_norm": 3.717010498046875, "learning_rate": 2.383155334913666e-06, "loss": 1.7261, "mean_token_accuracy": 0.5754173040390015, "num_tokens": 26081785.0, "step": 7230 }, { "entropy": 1.7546875, "epoch": 1.6007739082365948, "grad_norm": 4.240694522857666, "learning_rate": 2.3771526185935932e-06, "loss": 1.7886, "mean_token_accuracy": 0.569563165307045, "num_tokens": 26115163.0, "step": 7240 }, { "entropy": 1.753125, "epoch": 1.6029850746268657, "grad_norm": 3.8336782455444336, "learning_rate": 2.3711506121466297e-06, "loss": 1.7484, "mean_token_accuracy": 0.5711957097053528, "num_tokens": 26151399.0, "step": 7250 }, { "entropy": 1.772265625, "epoch": 1.6051962410171365, "grad_norm": 3.8589277267456055, "learning_rate": 2.3651493502553445e-06, "loss": 1.7582, "mean_token_accuracy": 0.5644830495119095, "num_tokens": 26187032.0, "step": 7260 }, { "entropy": 1.76953125, "epoch": 1.6074074074074074, "grad_norm": 3.483405828475952, "learning_rate": 2.359148867598005e-06, "loss": 1.7644, "mean_token_accuracy": 0.5712861210107804, "num_tokens": 26223626.0, "step": 7270 }, { "entropy": 1.75078125, "epoch": 1.6096185737976783, "grad_norm": 4.582447052001953, "learning_rate": 2.3531491988483763e-06, "loss": 1.7588, "mean_token_accuracy": 0.5709590166807175, "num_tokens": 26257913.0, "step": 7280 }, { "entropy": 1.762109375, "epoch": 1.6118297401879491, "grad_norm": 3.6897058486938477, "learning_rate": 2.347150378675522e-06, "loss": 1.7842, "mean_token_accuracy": 0.5664550840854645, "num_tokens": 26293905.0, "step": 7290 }, { "entropy": 1.80859375, "epoch": 1.61404090657822, "grad_norm": 3.458678960800171, "learning_rate": 2.3411524417435995e-06, "loss": 1.8238, "mean_token_accuracy": 0.5591387033462525, "num_tokens": 26330788.0, "step": 7300 }, { "entropy": 1.788671875, "epoch": 1.6162520729684908, "grad_norm": 4.170225143432617, "learning_rate": 2.3351554227116648e-06, "loss": 1.7579, "mean_token_accuracy": 0.570235300064087, "num_tokens": 26369704.0, "step": 7310 }, { "entropy": 1.759765625, "epoch": 1.618463239358762, "grad_norm": 4.74111270904541, "learning_rate": 2.3291593562334664e-06, "loss": 1.7773, "mean_token_accuracy": 0.5653113335371017, "num_tokens": 26405618.0, "step": 7320 }, { "entropy": 1.76875, "epoch": 1.6206744057490328, "grad_norm": 3.2384071350097656, "learning_rate": 2.3231642769572536e-06, "loss": 1.7815, "mean_token_accuracy": 0.5630915135145187, "num_tokens": 26445322.0, "step": 7330 }, { "entropy": 1.75859375, "epoch": 1.6228855721393036, "grad_norm": 4.125173568725586, "learning_rate": 2.3171702195255667e-06, "loss": 1.7312, "mean_token_accuracy": 0.5690771192312241, "num_tokens": 26482737.0, "step": 7340 }, { "entropy": 1.76640625, "epoch": 1.6250967385295745, "grad_norm": 4.30896520614624, "learning_rate": 2.311177218575042e-06, "loss": 1.7611, "mean_token_accuracy": 0.568313717842102, "num_tokens": 26521987.0, "step": 7350 }, { "entropy": 1.749609375, "epoch": 1.6273079049198453, "grad_norm": 3.631840705871582, "learning_rate": 2.305185308736214e-06, "loss": 1.753, "mean_token_accuracy": 0.5710633844137192, "num_tokens": 26558933.0, "step": 7360 }, { "entropy": 1.726171875, "epoch": 1.6295190713101162, "grad_norm": 3.4106040000915527, "learning_rate": 2.299194524633309e-06, "loss": 1.725, "mean_token_accuracy": 0.5737834721803665, "num_tokens": 26591260.0, "step": 7370 }, { "entropy": 1.766015625, "epoch": 1.631730237700387, "grad_norm": 4.189522743225098, "learning_rate": 2.293204900884049e-06, "loss": 1.7826, "mean_token_accuracy": 0.566990676522255, "num_tokens": 26628364.0, "step": 7380 }, { "entropy": 1.755078125, "epoch": 1.633941404090658, "grad_norm": 3.4339346885681152, "learning_rate": 2.287216472099451e-06, "loss": 1.7434, "mean_token_accuracy": 0.5712514191865921, "num_tokens": 26664522.0, "step": 7390 }, { "entropy": 1.804296875, "epoch": 1.6361525704809288, "grad_norm": 3.3980278968811035, "learning_rate": 2.281229272883627e-06, "loss": 1.7756, "mean_token_accuracy": 0.5677028208971023, "num_tokens": 26702454.0, "step": 7400 }, { "entropy": 1.771484375, "epoch": 1.6383637368711996, "grad_norm": 3.8581361770629883, "learning_rate": 2.275243337833585e-06, "loss": 1.7985, "mean_token_accuracy": 0.5594134509563446, "num_tokens": 26739431.0, "step": 7410 }, { "entropy": 1.7515625, "epoch": 1.6405749032614705, "grad_norm": 3.435934543609619, "learning_rate": 2.269258701539026e-06, "loss": 1.7703, "mean_token_accuracy": 0.568172162771225, "num_tokens": 26776724.0, "step": 7420 }, { "entropy": 1.734765625, "epoch": 1.6427860696517413, "grad_norm": 3.4337878227233887, "learning_rate": 2.2632753985821474e-06, "loss": 1.7192, "mean_token_accuracy": 0.5746338725090027, "num_tokens": 26812370.0, "step": 7430 }, { "entropy": 1.7078125, "epoch": 1.6449972360420122, "grad_norm": 3.4302914142608643, "learning_rate": 2.257293463537442e-06, "loss": 1.7571, "mean_token_accuracy": 0.5703925579786301, "num_tokens": 26848541.0, "step": 7440 }, { "entropy": 1.75390625, "epoch": 1.647208402432283, "grad_norm": 4.981202602386475, "learning_rate": 2.251312930971497e-06, "loss": 1.791, "mean_token_accuracy": 0.5687300458550453, "num_tokens": 26885650.0, "step": 7450 }, { "entropy": 1.785546875, "epoch": 1.649419568822554, "grad_norm": 2.636835813522339, "learning_rate": 2.2453338354427966e-06, "loss": 1.7378, "mean_token_accuracy": 0.5772638648748398, "num_tokens": 26921482.0, "step": 7460 }, { "entropy": 1.783984375, "epoch": 1.6516307352128248, "grad_norm": 3.299297332763672, "learning_rate": 2.2393562115015216e-06, "loss": 1.7454, "mean_token_accuracy": 0.5685813903808594, "num_tokens": 26957539.0, "step": 7470 }, { "entropy": 1.723828125, "epoch": 1.6538419016030956, "grad_norm": 3.5639665126800537, "learning_rate": 2.233380093689347e-06, "loss": 1.7303, "mean_token_accuracy": 0.570636248588562, "num_tokens": 26994040.0, "step": 7480 }, { "entropy": 1.72265625, "epoch": 1.6560530679933665, "grad_norm": 4.027807712554932, "learning_rate": 2.2274055165392467e-06, "loss": 1.7398, "mean_token_accuracy": 0.5701359272003174, "num_tokens": 27029109.0, "step": 7490 }, { "entropy": 1.7546875, "epoch": 1.6582642343836373, "grad_norm": 3.6100778579711914, "learning_rate": 2.22143251457529e-06, "loss": 1.737, "mean_token_accuracy": 0.5729959607124329, "num_tokens": 27062671.0, "step": 7500 }, { "epoch": 1.6582642343836373, "eval_entropy": 1.7909981343283583, "eval_loss": 1.820815086364746, "eval_mean_token_accuracy": 0.5585399604258846, "eval_num_tokens": 27062671.0, "eval_runtime": 112.0715, "eval_samples_per_second": 143.48, "eval_steps_per_second": 8.967, "step": 7500 }, { "entropy": 1.791796875, "epoch": 1.6604754007739082, "grad_norm": 3.7595696449279785, "learning_rate": 2.2154611223124467e-06, "loss": 1.7695, "mean_token_accuracy": 0.5697845876216888, "num_tokens": 27099881.0, "step": 7510 }, { "entropy": 1.762109375, "epoch": 1.662686567164179, "grad_norm": 3.423952102661133, "learning_rate": 2.209491374256383e-06, "loss": 1.7715, "mean_token_accuracy": 0.5635389596223831, "num_tokens": 27134969.0, "step": 7520 }, { "entropy": 1.775, "epoch": 1.66489773355445, "grad_norm": 3.4782917499542236, "learning_rate": 2.2035233049032636e-06, "loss": 1.7704, "mean_token_accuracy": 0.5671257078647614, "num_tokens": 27171033.0, "step": 7530 }, { "entropy": 1.774609375, "epoch": 1.6671088999447208, "grad_norm": 3.6433393955230713, "learning_rate": 2.197556948739553e-06, "loss": 1.7727, "mean_token_accuracy": 0.5640848904848099, "num_tokens": 27207610.0, "step": 7540 }, { "entropy": 1.761328125, "epoch": 1.6693200663349916, "grad_norm": 3.8429110050201416, "learning_rate": 2.1915923402418195e-06, "loss": 1.738, "mean_token_accuracy": 0.5756726711988449, "num_tokens": 27245892.0, "step": 7550 }, { "entropy": 1.757421875, "epoch": 1.6715312327252625, "grad_norm": 4.01326847076416, "learning_rate": 2.1856295138765276e-06, "loss": 1.7536, "mean_token_accuracy": 0.5707933187484742, "num_tokens": 27285398.0, "step": 7560 }, { "entropy": 1.751953125, "epoch": 1.6737423991155334, "grad_norm": 2.605844259262085, "learning_rate": 2.179668504099845e-06, "loss": 1.7537, "mean_token_accuracy": 0.5705649733543396, "num_tokens": 27323068.0, "step": 7570 }, { "entropy": 1.768359375, "epoch": 1.6759535655058042, "grad_norm": 3.699206829071045, "learning_rate": 2.1737093453574457e-06, "loss": 1.7744, "mean_token_accuracy": 0.5677089363336563, "num_tokens": 27358752.0, "step": 7580 }, { "entropy": 1.774609375, "epoch": 1.678164731896075, "grad_norm": 3.646165370941162, "learning_rate": 2.1677520720843035e-06, "loss": 1.7541, "mean_token_accuracy": 0.5704272836446762, "num_tokens": 27396399.0, "step": 7590 }, { "entropy": 1.763671875, "epoch": 1.680375898286346, "grad_norm": 3.5304229259490967, "learning_rate": 2.1617967187044984e-06, "loss": 1.7404, "mean_token_accuracy": 0.5702267676591873, "num_tokens": 27429593.0, "step": 7600 }, { "entropy": 1.7390625, "epoch": 1.6825870646766168, "grad_norm": 3.3857970237731934, "learning_rate": 2.1558433196310157e-06, "loss": 1.7467, "mean_token_accuracy": 0.5700134605169296, "num_tokens": 27465260.0, "step": 7610 }, { "entropy": 1.73203125, "epoch": 1.6847982310668876, "grad_norm": 4.115582466125488, "learning_rate": 2.1498919092655505e-06, "loss": 1.7759, "mean_token_accuracy": 0.569431459903717, "num_tokens": 27501020.0, "step": 7620 }, { "entropy": 1.723046875, "epoch": 1.6870093974571585, "grad_norm": 3.6850368976593018, "learning_rate": 2.1439425219983023e-06, "loss": 1.746, "mean_token_accuracy": 0.5700583934783936, "num_tokens": 27538314.0, "step": 7630 }, { "entropy": 1.786328125, "epoch": 1.6892205638474294, "grad_norm": 4.318277835845947, "learning_rate": 2.1379951922077827e-06, "loss": 1.7814, "mean_token_accuracy": 0.5615612238645553, "num_tokens": 27572777.0, "step": 7640 }, { "entropy": 1.75390625, "epoch": 1.6914317302377004, "grad_norm": 3.791924476623535, "learning_rate": 2.132049954260612e-06, "loss": 1.7259, "mean_token_accuracy": 0.5715990096330643, "num_tokens": 27607045.0, "step": 7650 }, { "entropy": 1.7625, "epoch": 1.6936428966279713, "grad_norm": 4.01589822769165, "learning_rate": 2.1261068425113257e-06, "loss": 1.7631, "mean_token_accuracy": 0.5656978905200958, "num_tokens": 27643619.0, "step": 7660 }, { "entropy": 1.73671875, "epoch": 1.6958540630182422, "grad_norm": 3.9449081420898438, "learning_rate": 2.1201658913021715e-06, "loss": 1.7469, "mean_token_accuracy": 0.5706801593303681, "num_tokens": 27680442.0, "step": 7670 }, { "entropy": 1.741796875, "epoch": 1.698065229408513, "grad_norm": 3.6826679706573486, "learning_rate": 2.1142271349629113e-06, "loss": 1.7404, "mean_token_accuracy": 0.5725519210100174, "num_tokens": 27716531.0, "step": 7680 }, { "entropy": 1.73828125, "epoch": 1.7002763957987839, "grad_norm": 4.526356220245361, "learning_rate": 2.1082906078106263e-06, "loss": 1.7499, "mean_token_accuracy": 0.570724093914032, "num_tokens": 27751964.0, "step": 7690 }, { "entropy": 1.723828125, "epoch": 1.7024875621890547, "grad_norm": 3.5279245376586914, "learning_rate": 2.1023563441495145e-06, "loss": 1.7314, "mean_token_accuracy": 0.5758717566728592, "num_tokens": 27788687.0, "step": 7700 }, { "entropy": 1.725390625, "epoch": 1.7046987285793256, "grad_norm": 4.081562042236328, "learning_rate": 2.0964243782706953e-06, "loss": 1.7292, "mean_token_accuracy": 0.5762430936098099, "num_tokens": 27823669.0, "step": 7710 }, { "entropy": 1.759765625, "epoch": 1.7069098949695964, "grad_norm": 3.913522958755493, "learning_rate": 2.0904947444520095e-06, "loss": 1.7804, "mean_token_accuracy": 0.5663032159209251, "num_tokens": 27858826.0, "step": 7720 }, { "entropy": 1.803125, "epoch": 1.7091210613598673, "grad_norm": 3.434763193130493, "learning_rate": 2.0845674769578233e-06, "loss": 1.7993, "mean_token_accuracy": 0.5611698776483536, "num_tokens": 27894637.0, "step": 7730 }, { "entropy": 1.778515625, "epoch": 1.7113322277501382, "grad_norm": 4.175652980804443, "learning_rate": 2.078642610038829e-06, "loss": 1.7717, "mean_token_accuracy": 0.5616742044687271, "num_tokens": 27929790.0, "step": 7740 }, { "entropy": 1.746875, "epoch": 1.713543394140409, "grad_norm": 3.8664772510528564, "learning_rate": 2.072720177931845e-06, "loss": 1.7439, "mean_token_accuracy": 0.5729645609855651, "num_tokens": 27966519.0, "step": 7750 }, { "entropy": 1.733984375, "epoch": 1.71575456053068, "grad_norm": 4.563918590545654, "learning_rate": 2.0668002148596224e-06, "loss": 1.7328, "mean_token_accuracy": 0.5739035993814469, "num_tokens": 27999552.0, "step": 7760 }, { "entropy": 1.7390625, "epoch": 1.717965726920951, "grad_norm": 3.527977228164673, "learning_rate": 2.0608827550306455e-06, "loss": 1.7132, "mean_token_accuracy": 0.5799436926841736, "num_tokens": 28034986.0, "step": 7770 }, { "entropy": 1.7515625, "epoch": 1.7201768933112218, "grad_norm": 4.23599100112915, "learning_rate": 2.0549678326389318e-06, "loss": 1.7288, "mean_token_accuracy": 0.572889119386673, "num_tokens": 28070351.0, "step": 7780 }, { "entropy": 1.72265625, "epoch": 1.7223880597014927, "grad_norm": 2.9946486949920654, "learning_rate": 2.0490554818638357e-06, "loss": 1.7396, "mean_token_accuracy": 0.5700162887573242, "num_tokens": 28108232.0, "step": 7790 }, { "entropy": 1.7015625, "epoch": 1.7245992260917635, "grad_norm": 3.2284834384918213, "learning_rate": 2.0431457368698553e-06, "loss": 1.7322, "mean_token_accuracy": 0.574472913146019, "num_tokens": 28145432.0, "step": 7800 }, { "entropy": 1.710546875, "epoch": 1.7268103924820344, "grad_norm": 3.0827646255493164, "learning_rate": 2.037238631806427e-06, "loss": 1.6804, "mean_token_accuracy": 0.582582426071167, "num_tokens": 28182693.0, "step": 7810 }, { "entropy": 1.7828125, "epoch": 1.7290215588723052, "grad_norm": 3.5181822776794434, "learning_rate": 2.0313342008077343e-06, "loss": 1.7855, "mean_token_accuracy": 0.5651570498943329, "num_tokens": 28217956.0, "step": 7820 }, { "entropy": 1.777734375, "epoch": 1.731232725262576, "grad_norm": 2.82606840133667, "learning_rate": 2.0254324779925076e-06, "loss": 1.7598, "mean_token_accuracy": 0.5681768357753754, "num_tokens": 28255794.0, "step": 7830 }, { "entropy": 1.751953125, "epoch": 1.733443891652847, "grad_norm": 4.586568832397461, "learning_rate": 2.0195334974638308e-06, "loss": 1.761, "mean_token_accuracy": 0.5662160098552704, "num_tokens": 28288371.0, "step": 7840 }, { "entropy": 1.790234375, "epoch": 1.7356550580431178, "grad_norm": 3.811717987060547, "learning_rate": 2.013637293308938e-06, "loss": 1.8135, "mean_token_accuracy": 0.5562566369771957, "num_tokens": 28325742.0, "step": 7850 }, { "entropy": 1.7484375, "epoch": 1.7378662244333887, "grad_norm": 3.411470890045166, "learning_rate": 2.0077438995990225e-06, "loss": 1.7209, "mean_token_accuracy": 0.5750664860010147, "num_tokens": 28358620.0, "step": 7860 }, { "entropy": 1.78515625, "epoch": 1.7400773908236595, "grad_norm": 3.5559356212615967, "learning_rate": 2.001853350389035e-06, "loss": 1.7753, "mean_token_accuracy": 0.565812686085701, "num_tokens": 28397403.0, "step": 7870 }, { "entropy": 1.738671875, "epoch": 1.7422885572139304, "grad_norm": 3.3087964057922363, "learning_rate": 1.9959656797174925e-06, "loss": 1.7353, "mean_token_accuracy": 0.5672001123428345, "num_tokens": 28431658.0, "step": 7880 }, { "entropy": 1.69296875, "epoch": 1.7444997236042012, "grad_norm": 3.081078052520752, "learning_rate": 1.9900809216062765e-06, "loss": 1.722, "mean_token_accuracy": 0.5780637085437774, "num_tokens": 28467568.0, "step": 7890 }, { "entropy": 1.750390625, "epoch": 1.746710889994472, "grad_norm": 3.4102554321289062, "learning_rate": 1.9841991100604366e-06, "loss": 1.7596, "mean_token_accuracy": 0.5691831529140472, "num_tokens": 28503904.0, "step": 7900 }, { "entropy": 1.759375, "epoch": 1.748922056384743, "grad_norm": 4.3687872886657715, "learning_rate": 1.978320279068e-06, "loss": 1.7903, "mean_token_accuracy": 0.5672489494085312, "num_tokens": 28542784.0, "step": 7910 }, { "entropy": 1.741796875, "epoch": 1.7511332227750138, "grad_norm": 4.317598819732666, "learning_rate": 1.9724444625997676e-06, "loss": 1.734, "mean_token_accuracy": 0.5699514597654343, "num_tokens": 28577634.0, "step": 7920 }, { "entropy": 1.720703125, "epoch": 1.7533443891652847, "grad_norm": 4.00547981262207, "learning_rate": 1.9665716946091213e-06, "loss": 1.7611, "mean_token_accuracy": 0.5745073556900024, "num_tokens": 28616124.0, "step": 7930 }, { "entropy": 1.742578125, "epoch": 1.7555555555555555, "grad_norm": 3.915745258331299, "learning_rate": 1.960702009031827e-06, "loss": 1.7267, "mean_token_accuracy": 0.5761003434658051, "num_tokens": 28650383.0, "step": 7940 }, { "entropy": 1.73828125, "epoch": 1.7577667219458264, "grad_norm": 3.7228305339813232, "learning_rate": 1.9548354397858406e-06, "loss": 1.7451, "mean_token_accuracy": 0.5721576631069183, "num_tokens": 28684524.0, "step": 7950 }, { "entropy": 1.784375, "epoch": 1.7599778883360973, "grad_norm": 3.9681882858276367, "learning_rate": 1.948972020771109e-06, "loss": 1.7946, "mean_token_accuracy": 0.5612717270851135, "num_tokens": 28720087.0, "step": 7960 }, { "entropy": 1.74765625, "epoch": 1.762189054726368, "grad_norm": 3.758746862411499, "learning_rate": 1.9431117858693764e-06, "loss": 1.7385, "mean_token_accuracy": 0.5739440441131591, "num_tokens": 28756343.0, "step": 7970 }, { "entropy": 1.76875, "epoch": 1.764400221116639, "grad_norm": 4.041624546051025, "learning_rate": 1.937254768943986e-06, "loss": 1.7601, "mean_token_accuracy": 0.5669008567929268, "num_tokens": 28793192.0, "step": 7980 }, { "entropy": 1.70078125, "epoch": 1.7666113875069098, "grad_norm": 3.514730930328369, "learning_rate": 1.9314010038396872e-06, "loss": 1.7243, "mean_token_accuracy": 0.5738515079021453, "num_tokens": 28830690.0, "step": 7990 }, { "entropy": 1.72109375, "epoch": 1.7688225538971807, "grad_norm": 3.3707940578460693, "learning_rate": 1.9255505243824387e-06, "loss": 1.7275, "mean_token_accuracy": 0.5717095464468003, "num_tokens": 28866320.0, "step": 8000 }, { "epoch": 1.7688225538971807, "eval_entropy": 1.7527985074626866, "eval_loss": 1.8116077184677124, "eval_mean_token_accuracy": 0.5600321406748757, "eval_num_tokens": 28866320.0, "eval_runtime": 112.3694, "eval_samples_per_second": 143.099, "eval_steps_per_second": 8.944, "step": 8000 }, { "entropy": 1.695703125, "epoch": 1.7710337202874515, "grad_norm": 3.481527805328369, "learning_rate": 1.9197033643792124e-06, "loss": 1.6943, "mean_token_accuracy": 0.5820229351520538, "num_tokens": 28901213.0, "step": 8010 }, { "entropy": 1.69296875, "epoch": 1.7732448866777224, "grad_norm": 3.673452138900757, "learning_rate": 1.9138595576178e-06, "loss": 1.6959, "mean_token_accuracy": 0.5805958807468414, "num_tokens": 28935630.0, "step": 8020 }, { "entropy": 1.71171875, "epoch": 1.7754560530679933, "grad_norm": 3.4650521278381348, "learning_rate": 1.908019137866616e-06, "loss": 1.7152, "mean_token_accuracy": 0.5756863653659821, "num_tokens": 28973740.0, "step": 8030 }, { "entropy": 1.79609375, "epoch": 1.7776672194582641, "grad_norm": 3.155453681945801, "learning_rate": 1.902182138874502e-06, "loss": 1.786, "mean_token_accuracy": 0.5642720311880112, "num_tokens": 29012165.0, "step": 8040 }, { "entropy": 1.746484375, "epoch": 1.779878385848535, "grad_norm": 3.613926887512207, "learning_rate": 1.896348594370533e-06, "loss": 1.7538, "mean_token_accuracy": 0.5782447338104248, "num_tokens": 29049685.0, "step": 8050 }, { "entropy": 1.701953125, "epoch": 1.7820895522388058, "grad_norm": 3.7910702228546143, "learning_rate": 1.8905185380638244e-06, "loss": 1.671, "mean_token_accuracy": 0.5876582473516464, "num_tokens": 29084806.0, "step": 8060 }, { "entropy": 1.729296875, "epoch": 1.7843007186290767, "grad_norm": 3.83339262008667, "learning_rate": 1.884692003643333e-06, "loss": 1.7231, "mean_token_accuracy": 0.5751573115587234, "num_tokens": 29119211.0, "step": 8070 }, { "entropy": 1.7546875, "epoch": 1.7865118850193475, "grad_norm": 3.8487260341644287, "learning_rate": 1.8788690247776648e-06, "loss": 1.7558, "mean_token_accuracy": 0.5674388974905014, "num_tokens": 29153177.0, "step": 8080 }, { "entropy": 1.75546875, "epoch": 1.7887230514096186, "grad_norm": 3.1663689613342285, "learning_rate": 1.8730496351148785e-06, "loss": 1.7585, "mean_token_accuracy": 0.5690556049346924, "num_tokens": 29190018.0, "step": 8090 }, { "entropy": 1.7171875, "epoch": 1.7909342177998895, "grad_norm": 3.591547966003418, "learning_rate": 1.8672338682822974e-06, "loss": 1.7004, "mean_token_accuracy": 0.5772475987672806, "num_tokens": 29225792.0, "step": 8100 }, { "entropy": 1.73203125, "epoch": 1.7931453841901603, "grad_norm": 4.373234272003174, "learning_rate": 1.8614217578863053e-06, "loss": 1.7316, "mean_token_accuracy": 0.5656394362449646, "num_tokens": 29261067.0, "step": 8110 }, { "entropy": 1.755078125, "epoch": 1.7953565505804312, "grad_norm": 3.215458631515503, "learning_rate": 1.8556133375121585e-06, "loss": 1.7374, "mean_token_accuracy": 0.5738924205303192, "num_tokens": 29298442.0, "step": 8120 }, { "entropy": 1.758203125, "epoch": 1.797567716970702, "grad_norm": 3.753331184387207, "learning_rate": 1.849808640723793e-06, "loss": 1.7564, "mean_token_accuracy": 0.5726885080337525, "num_tokens": 29335921.0, "step": 8130 }, { "entropy": 1.7703125, "epoch": 1.799778883360973, "grad_norm": 3.0127716064453125, "learning_rate": 1.8440077010636254e-06, "loss": 1.7572, "mean_token_accuracy": 0.5741880804300308, "num_tokens": 29370675.0, "step": 8140 }, { "entropy": 1.726171875, "epoch": 1.8019900497512438, "grad_norm": 4.160800933837891, "learning_rate": 1.8382105520523619e-06, "loss": 1.7321, "mean_token_accuracy": 0.5715920597314834, "num_tokens": 29407781.0, "step": 8150 }, { "entropy": 1.75078125, "epoch": 1.8042012161415146, "grad_norm": 3.4418046474456787, "learning_rate": 1.8324172271888053e-06, "loss": 1.7375, "mean_token_accuracy": 0.5746371477842331, "num_tokens": 29448176.0, "step": 8160 }, { "entropy": 1.743359375, "epoch": 1.8064123825317855, "grad_norm": 3.2298433780670166, "learning_rate": 1.8266277599496612e-06, "loss": 1.7545, "mean_token_accuracy": 0.5719492465257645, "num_tokens": 29484387.0, "step": 8170 }, { "entropy": 1.73671875, "epoch": 1.8086235489220563, "grad_norm": 3.3115484714508057, "learning_rate": 1.820842183789343e-06, "loss": 1.7536, "mean_token_accuracy": 0.5727066189050675, "num_tokens": 29522170.0, "step": 8180 }, { "entropy": 1.7703125, "epoch": 1.8108347153123272, "grad_norm": 3.204620122909546, "learning_rate": 1.8150605321397797e-06, "loss": 1.7552, "mean_token_accuracy": 0.5682245850563049, "num_tokens": 29558595.0, "step": 8190 }, { "entropy": 1.73125, "epoch": 1.8130458817025983, "grad_norm": 3.874518632888794, "learning_rate": 1.8092828384102206e-06, "loss": 1.7167, "mean_token_accuracy": 0.5744330048561096, "num_tokens": 29592925.0, "step": 8200 }, { "entropy": 1.7328125, "epoch": 1.8152570480928691, "grad_norm": 3.6139872074127197, "learning_rate": 1.8035091359870487e-06, "loss": 1.7512, "mean_token_accuracy": 0.569906759262085, "num_tokens": 29627461.0, "step": 8210 }, { "entropy": 1.7765625, "epoch": 1.81746821448314, "grad_norm": 2.622617244720459, "learning_rate": 1.79773945823358e-06, "loss": 1.7991, "mean_token_accuracy": 0.5663322985172272, "num_tokens": 29664661.0, "step": 8220 }, { "entropy": 1.746484375, "epoch": 1.8196793808734109, "grad_norm": 3.4388933181762695, "learning_rate": 1.7919738384898738e-06, "loss": 1.7462, "mean_token_accuracy": 0.5731872946023941, "num_tokens": 29701634.0, "step": 8230 }, { "entropy": 1.742578125, "epoch": 1.8218905472636817, "grad_norm": 3.3022141456604004, "learning_rate": 1.7862123100725407e-06, "loss": 1.7382, "mean_token_accuracy": 0.5729328274726868, "num_tokens": 29737527.0, "step": 8240 }, { "entropy": 1.733984375, "epoch": 1.8241017136539526, "grad_norm": 3.491898775100708, "learning_rate": 1.7804549062745505e-06, "loss": 1.7091, "mean_token_accuracy": 0.5717461258172989, "num_tokens": 29770674.0, "step": 8250 }, { "entropy": 1.765625, "epoch": 1.8263128800442234, "grad_norm": 4.191249847412109, "learning_rate": 1.7747016603650388e-06, "loss": 1.7792, "mean_token_accuracy": 0.561087554693222, "num_tokens": 29807063.0, "step": 8260 }, { "entropy": 1.773046875, "epoch": 1.8285240464344943, "grad_norm": 3.579638957977295, "learning_rate": 1.7689526055891132e-06, "loss": 1.7735, "mean_token_accuracy": 0.564491230249405, "num_tokens": 29842098.0, "step": 8270 }, { "entropy": 1.732421875, "epoch": 1.8307352128247651, "grad_norm": 3.7996206283569336, "learning_rate": 1.7632077751676651e-06, "loss": 1.6988, "mean_token_accuracy": 0.5789406001567841, "num_tokens": 29876933.0, "step": 8280 }, { "entropy": 1.7421875, "epoch": 1.832946379215036, "grad_norm": 4.05126428604126, "learning_rate": 1.757467202297174e-06, "loss": 1.7442, "mean_token_accuracy": 0.5745589852333068, "num_tokens": 29912814.0, "step": 8290 }, { "entropy": 1.728515625, "epoch": 1.8351575456053069, "grad_norm": 4.31002140045166, "learning_rate": 1.7517309201495174e-06, "loss": 1.7584, "mean_token_accuracy": 0.5702622473239899, "num_tokens": 29949570.0, "step": 8300 }, { "entropy": 1.749609375, "epoch": 1.8373687119955777, "grad_norm": 3.5952541828155518, "learning_rate": 1.7459989618717776e-06, "loss": 1.7473, "mean_token_accuracy": 0.5745158642530441, "num_tokens": 29989000.0, "step": 8310 }, { "entropy": 1.78125, "epoch": 1.8395798783858486, "grad_norm": 2.8128936290740967, "learning_rate": 1.7402713605860555e-06, "loss": 1.7589, "mean_token_accuracy": 0.5652533769607544, "num_tokens": 30025020.0, "step": 8320 }, { "entropy": 1.738671875, "epoch": 1.8417910447761194, "grad_norm": 3.7733871936798096, "learning_rate": 1.734548149389271e-06, "loss": 1.7434, "mean_token_accuracy": 0.5714739739894867, "num_tokens": 30061202.0, "step": 8330 }, { "entropy": 1.69375, "epoch": 1.8440022111663903, "grad_norm": 3.79392147064209, "learning_rate": 1.7288293613529774e-06, "loss": 1.7055, "mean_token_accuracy": 0.5750734001398087, "num_tokens": 30096752.0, "step": 8340 }, { "entropy": 1.7734375, "epoch": 1.8462133775566612, "grad_norm": 3.157735824584961, "learning_rate": 1.723115029523168e-06, "loss": 1.7789, "mean_token_accuracy": 0.5671907365322113, "num_tokens": 30130459.0, "step": 8350 }, { "entropy": 1.73359375, "epoch": 1.848424543946932, "grad_norm": 3.359495162963867, "learning_rate": 1.7174051869200887e-06, "loss": 1.6788, "mean_token_accuracy": 0.581543755531311, "num_tokens": 30165150.0, "step": 8360 }, { "entropy": 1.744140625, "epoch": 1.8506357103372029, "grad_norm": 3.7475826740264893, "learning_rate": 1.711699866538041e-06, "loss": 1.7498, "mean_token_accuracy": 0.5735862344503403, "num_tokens": 30200732.0, "step": 8370 }, { "entropy": 1.746484375, "epoch": 1.8528468767274737, "grad_norm": 3.309199333190918, "learning_rate": 1.7059991013451954e-06, "loss": 1.7277, "mean_token_accuracy": 0.5712708473205567, "num_tokens": 30238890.0, "step": 8380 }, { "entropy": 1.698046875, "epoch": 1.8550580431177446, "grad_norm": 3.6902072429656982, "learning_rate": 1.7003029242834031e-06, "loss": 1.7018, "mean_token_accuracy": 0.5787638515233994, "num_tokens": 30272044.0, "step": 8390 }, { "entropy": 1.759765625, "epoch": 1.8572692095080154, "grad_norm": 3.4713850021362305, "learning_rate": 1.694611368268e-06, "loss": 1.766, "mean_token_accuracy": 0.5663641974329948, "num_tokens": 30310881.0, "step": 8400 }, { "entropy": 1.72421875, "epoch": 1.8594803758982863, "grad_norm": 3.426764965057373, "learning_rate": 1.6889244661876191e-06, "loss": 1.7464, "mean_token_accuracy": 0.5717824459075928, "num_tokens": 30346318.0, "step": 8410 }, { "entropy": 1.787109375, "epoch": 1.8616915422885572, "grad_norm": 3.535482406616211, "learning_rate": 1.6832422509040014e-06, "loss": 1.8229, "mean_token_accuracy": 0.5620052516460419, "num_tokens": 30383522.0, "step": 8420 }, { "entropy": 1.70078125, "epoch": 1.863902708678828, "grad_norm": 4.048870086669922, "learning_rate": 1.677564755251807e-06, "loss": 1.6861, "mean_token_accuracy": 0.5872763484716416, "num_tokens": 30419199.0, "step": 8430 }, { "entropy": 1.70546875, "epoch": 1.8661138750690989, "grad_norm": 3.500356435775757, "learning_rate": 1.6718920120384213e-06, "loss": 1.7283, "mean_token_accuracy": 0.5689642608165741, "num_tokens": 30456837.0, "step": 8440 }, { "entropy": 1.745703125, "epoch": 1.8683250414593697, "grad_norm": 3.2823715209960938, "learning_rate": 1.6662240540437686e-06, "loss": 1.748, "mean_token_accuracy": 0.5728102922439575, "num_tokens": 30496203.0, "step": 8450 }, { "entropy": 1.75546875, "epoch": 1.8705362078496406, "grad_norm": 4.411621570587158, "learning_rate": 1.6605609140201205e-06, "loss": 1.7518, "mean_token_accuracy": 0.5735918387770653, "num_tokens": 30532423.0, "step": 8460 }, { "entropy": 1.76328125, "epoch": 1.8727473742399114, "grad_norm": 3.37626051902771, "learning_rate": 1.6549026246919114e-06, "loss": 1.7493, "mean_token_accuracy": 0.5716759324073791, "num_tokens": 30567500.0, "step": 8470 }, { "entropy": 1.732421875, "epoch": 1.8749585406301823, "grad_norm": 3.8107094764709473, "learning_rate": 1.6492492187555429e-06, "loss": 1.6939, "mean_token_accuracy": 0.5784647166728973, "num_tokens": 30602362.0, "step": 8480 }, { "entropy": 1.719921875, "epoch": 1.8771697070204532, "grad_norm": 3.459578514099121, "learning_rate": 1.643600728879198e-06, "loss": 1.7421, "mean_token_accuracy": 0.574610584974289, "num_tokens": 30639719.0, "step": 8490 }, { "entropy": 1.712109375, "epoch": 1.879380873410724, "grad_norm": 3.9836461544036865, "learning_rate": 1.637957187702654e-06, "loss": 1.7251, "mean_token_accuracy": 0.577015432715416, "num_tokens": 30675424.0, "step": 8500 }, { "epoch": 1.879380873410724, "eval_entropy": 1.754158893034826, "eval_loss": 1.8024015426635742, "eval_mean_token_accuracy": 0.5620353238796121, "eval_num_tokens": 30675424.0, "eval_runtime": 112.0371, "eval_samples_per_second": 143.524, "eval_steps_per_second": 8.97, "step": 8500 }, { "entropy": 1.727734375, "epoch": 1.8815920398009949, "grad_norm": 3.5092110633850098, "learning_rate": 1.6323186278370913e-06, "loss": 1.711, "mean_token_accuracy": 0.577846622467041, "num_tokens": 30712297.0, "step": 8510 }, { "entropy": 1.75, "epoch": 1.8838032061912657, "grad_norm": 4.088970184326172, "learning_rate": 1.6266850818649056e-06, "loss": 1.7581, "mean_token_accuracy": 0.567107206583023, "num_tokens": 30746543.0, "step": 8520 }, { "entropy": 1.711328125, "epoch": 1.8860143725815368, "grad_norm": 3.663259744644165, "learning_rate": 1.6210565823395195e-06, "loss": 1.7078, "mean_token_accuracy": 0.574769452214241, "num_tokens": 30780720.0, "step": 8530 }, { "entropy": 1.6984375, "epoch": 1.8882255389718077, "grad_norm": 3.715101957321167, "learning_rate": 1.6154331617851963e-06, "loss": 1.6996, "mean_token_accuracy": 0.582516434788704, "num_tokens": 30816751.0, "step": 8540 }, { "entropy": 1.7, "epoch": 1.8904367053620785, "grad_norm": 3.5320138931274414, "learning_rate": 1.6098148526968488e-06, "loss": 1.7055, "mean_token_accuracy": 0.5797714412212371, "num_tokens": 30852172.0, "step": 8550 }, { "entropy": 1.709765625, "epoch": 1.8926478717523494, "grad_norm": 3.5932626724243164, "learning_rate": 1.604201687539853e-06, "loss": 1.7335, "mean_token_accuracy": 0.5764575719833374, "num_tokens": 30887850.0, "step": 8560 }, { "entropy": 1.726953125, "epoch": 1.8948590381426202, "grad_norm": 3.6895172595977783, "learning_rate": 1.5985936987498629e-06, "loss": 1.752, "mean_token_accuracy": 0.5675917476415634, "num_tokens": 30925112.0, "step": 8570 }, { "entropy": 1.729296875, "epoch": 1.897070204532891, "grad_norm": 2.9210522174835205, "learning_rate": 1.5929909187326193e-06, "loss": 1.7398, "mean_token_accuracy": 0.5717852294445038, "num_tokens": 30962376.0, "step": 8580 }, { "entropy": 1.7328125, "epoch": 1.899281370923162, "grad_norm": 3.673238754272461, "learning_rate": 1.5873933798637642e-06, "loss": 1.7095, "mean_token_accuracy": 0.5786424428224564, "num_tokens": 30999352.0, "step": 8590 }, { "entropy": 1.73046875, "epoch": 1.9014925373134328, "grad_norm": 4.024681091308594, "learning_rate": 1.581801114488653e-06, "loss": 1.7034, "mean_token_accuracy": 0.5814568758010864, "num_tokens": 31037428.0, "step": 8600 }, { "entropy": 1.742578125, "epoch": 1.9037037037037037, "grad_norm": 3.858382225036621, "learning_rate": 1.5762141549221704e-06, "loss": 1.7278, "mean_token_accuracy": 0.5759885489940644, "num_tokens": 31074806.0, "step": 8610 }, { "entropy": 1.7078125, "epoch": 1.9059148700939745, "grad_norm": 4.027462005615234, "learning_rate": 1.57063253344854e-06, "loss": 1.7053, "mean_token_accuracy": 0.5763076961040496, "num_tokens": 31111013.0, "step": 8620 }, { "entropy": 1.732421875, "epoch": 1.9081260364842454, "grad_norm": 4.843277454376221, "learning_rate": 1.5650562823211389e-06, "loss": 1.7096, "mean_token_accuracy": 0.5769873410463333, "num_tokens": 31148152.0, "step": 8630 }, { "entropy": 1.728125, "epoch": 1.9103372028745165, "grad_norm": 3.5383851528167725, "learning_rate": 1.559485433762311e-06, "loss": 1.7287, "mean_token_accuracy": 0.574589541554451, "num_tokens": 31184565.0, "step": 8640 }, { "entropy": 1.704296875, "epoch": 1.9125483692647873, "grad_norm": 3.0316293239593506, "learning_rate": 1.5539200199631848e-06, "loss": 1.7022, "mean_token_accuracy": 0.5772084563970565, "num_tokens": 31221517.0, "step": 8650 }, { "entropy": 1.7046875, "epoch": 1.9147595356550582, "grad_norm": 4.197947025299072, "learning_rate": 1.5483600730834814e-06, "loss": 1.7201, "mean_token_accuracy": 0.5785938739776612, "num_tokens": 31256175.0, "step": 8660 }, { "entropy": 1.71875, "epoch": 1.916970702045329, "grad_norm": 4.4617533683776855, "learning_rate": 1.5428056252513312e-06, "loss": 1.7234, "mean_token_accuracy": 0.5795243799686431, "num_tokens": 31291196.0, "step": 8670 }, { "entropy": 1.772265625, "epoch": 1.9191818684356, "grad_norm": 3.776618480682373, "learning_rate": 1.5372567085630884e-06, "loss": 1.7784, "mean_token_accuracy": 0.5642356276512146, "num_tokens": 31327035.0, "step": 8680 }, { "entropy": 1.7734375, "epoch": 1.9213930348258708, "grad_norm": 3.324803590774536, "learning_rate": 1.5317133550831483e-06, "loss": 1.7519, "mean_token_accuracy": 0.5677950263023377, "num_tokens": 31365373.0, "step": 8690 }, { "entropy": 1.776953125, "epoch": 1.9236042012161416, "grad_norm": 3.644521474838257, "learning_rate": 1.5261755968437559e-06, "loss": 1.7645, "mean_token_accuracy": 0.5704007536172867, "num_tokens": 31403797.0, "step": 8700 }, { "entropy": 1.67578125, "epoch": 1.9258153676064125, "grad_norm": 3.257751703262329, "learning_rate": 1.5206434658448238e-06, "loss": 1.6633, "mean_token_accuracy": 0.5842669188976288, "num_tokens": 31439274.0, "step": 8710 }, { "entropy": 1.723046875, "epoch": 1.9280265339966833, "grad_norm": 3.7180957794189453, "learning_rate": 1.5151169940537514e-06, "loss": 1.7295, "mean_token_accuracy": 0.5727511942386627, "num_tokens": 31475689.0, "step": 8720 }, { "entropy": 1.719140625, "epoch": 1.9302377003869542, "grad_norm": 3.536086320877075, "learning_rate": 1.5095962134052333e-06, "loss": 1.7275, "mean_token_accuracy": 0.5742514729499817, "num_tokens": 31510604.0, "step": 8730 }, { "entropy": 1.724609375, "epoch": 1.932448866777225, "grad_norm": 4.31387186050415, "learning_rate": 1.5040811558010787e-06, "loss": 1.7355, "mean_token_accuracy": 0.5727599918842315, "num_tokens": 31547277.0, "step": 8740 }, { "entropy": 1.723828125, "epoch": 1.934660033167496, "grad_norm": 3.6574904918670654, "learning_rate": 1.498571853110025e-06, "loss": 1.7067, "mean_token_accuracy": 0.5768580168485642, "num_tokens": 31584038.0, "step": 8750 }, { "entropy": 1.7296875, "epoch": 1.9368711995577668, "grad_norm": 3.688235282897949, "learning_rate": 1.4930683371675575e-06, "loss": 1.7012, "mean_token_accuracy": 0.5770545303821564, "num_tokens": 31619026.0, "step": 8760 }, { "entropy": 1.73359375, "epoch": 1.9390823659480376, "grad_norm": 4.745366096496582, "learning_rate": 1.487570639775721e-06, "loss": 1.7541, "mean_token_accuracy": 0.5715758055448532, "num_tokens": 31653086.0, "step": 8770 }, { "entropy": 1.763671875, "epoch": 1.9412935323383085, "grad_norm": 3.193467378616333, "learning_rate": 1.4820787927029384e-06, "loss": 1.7454, "mean_token_accuracy": 0.5660520881414414, "num_tokens": 31690069.0, "step": 8780 }, { "entropy": 1.759765625, "epoch": 1.9435046987285793, "grad_norm": 3.7091901302337646, "learning_rate": 1.4765928276838248e-06, "loss": 1.7729, "mean_token_accuracy": 0.5686738759279251, "num_tokens": 31727852.0, "step": 8790 }, { "entropy": 1.744140625, "epoch": 1.9457158651188502, "grad_norm": 3.406608819961548, "learning_rate": 1.471112776419009e-06, "loss": 1.7205, "mean_token_accuracy": 0.5765075117349625, "num_tokens": 31768040.0, "step": 8800 }, { "entropy": 1.744921875, "epoch": 1.947927031509121, "grad_norm": 3.5158963203430176, "learning_rate": 1.4656386705749442e-06, "loss": 1.7367, "mean_token_accuracy": 0.572776859998703, "num_tokens": 31805251.0, "step": 8810 }, { "entropy": 1.74140625, "epoch": 1.950138197899392, "grad_norm": 3.740358352661133, "learning_rate": 1.4601705417837303e-06, "loss": 1.7487, "mean_token_accuracy": 0.5731150895357132, "num_tokens": 31842903.0, "step": 8820 }, { "entropy": 1.712890625, "epoch": 1.9523493642896628, "grad_norm": 3.9042723178863525, "learning_rate": 1.4547084216429274e-06, "loss": 1.704, "mean_token_accuracy": 0.5799987941980362, "num_tokens": 31877123.0, "step": 8830 }, { "entropy": 1.7671875, "epoch": 1.9545605306799336, "grad_norm": 3.9414663314819336, "learning_rate": 1.449252341715377e-06, "loss": 1.7486, "mean_token_accuracy": 0.5716243773698807, "num_tokens": 31911943.0, "step": 8840 }, { "entropy": 1.739453125, "epoch": 1.9567716970702045, "grad_norm": 4.049784183502197, "learning_rate": 1.4438023335290122e-06, "loss": 1.7518, "mean_token_accuracy": 0.5717391669750214, "num_tokens": 31945561.0, "step": 8850 }, { "entropy": 1.7296875, "epoch": 1.9589828634604753, "grad_norm": 2.76662540435791, "learning_rate": 1.4383584285766855e-06, "loss": 1.722, "mean_token_accuracy": 0.5767583161592483, "num_tokens": 31982712.0, "step": 8860 }, { "entropy": 1.743359375, "epoch": 1.9611940298507462, "grad_norm": 3.2501332759857178, "learning_rate": 1.43292065831598e-06, "loss": 1.7537, "mean_token_accuracy": 0.570072415471077, "num_tokens": 32017119.0, "step": 8870 }, { "entropy": 1.73359375, "epoch": 1.963405196241017, "grad_norm": 4.228973865509033, "learning_rate": 1.4274890541690307e-06, "loss": 1.6778, "mean_token_accuracy": 0.5832488298416137, "num_tokens": 32050453.0, "step": 8880 }, { "entropy": 1.687890625, "epoch": 1.965616362631288, "grad_norm": 4.217631816864014, "learning_rate": 1.4220636475223384e-06, "loss": 1.6976, "mean_token_accuracy": 0.5768374413251877, "num_tokens": 32083423.0, "step": 8890 }, { "entropy": 1.6828125, "epoch": 1.9678275290215588, "grad_norm": 4.2789788246154785, "learning_rate": 1.4166444697265952e-06, "loss": 1.6797, "mean_token_accuracy": 0.582291665673256, "num_tokens": 32118709.0, "step": 8900 }, { "entropy": 1.7515625, "epoch": 1.9700386954118296, "grad_norm": 3.519991397857666, "learning_rate": 1.4112315520964987e-06, "loss": 1.7709, "mean_token_accuracy": 0.5668433830142021, "num_tokens": 32152968.0, "step": 8910 }, { "entropy": 1.716796875, "epoch": 1.9722498618021005, "grad_norm": 3.9140188694000244, "learning_rate": 1.4058249259105721e-06, "loss": 1.745, "mean_token_accuracy": 0.5708180367946625, "num_tokens": 32190347.0, "step": 8920 }, { "entropy": 1.724609375, "epoch": 1.9744610281923713, "grad_norm": 3.1383965015411377, "learning_rate": 1.400424622410983e-06, "loss": 1.697, "mean_token_accuracy": 0.5784273475408555, "num_tokens": 32224681.0, "step": 8930 }, { "entropy": 1.738671875, "epoch": 1.9766721945826422, "grad_norm": 3.5489258766174316, "learning_rate": 1.3950306728033636e-06, "loss": 1.7333, "mean_token_accuracy": 0.5714338600635529, "num_tokens": 32261946.0, "step": 8940 }, { "entropy": 1.735546875, "epoch": 1.978883360972913, "grad_norm": 3.947706460952759, "learning_rate": 1.3896431082566314e-06, "loss": 1.7196, "mean_token_accuracy": 0.5734545469284058, "num_tokens": 32296628.0, "step": 8950 }, { "entropy": 1.787890625, "epoch": 1.981094527363184, "grad_norm": 3.701552391052246, "learning_rate": 1.3842619599028056e-06, "loss": 1.7658, "mean_token_accuracy": 0.5658468186855317, "num_tokens": 32331752.0, "step": 8960 }, { "entropy": 1.74609375, "epoch": 1.983305693753455, "grad_norm": 3.781827688217163, "learning_rate": 1.378887258836831e-06, "loss": 1.7355, "mean_token_accuracy": 0.5761446237564087, "num_tokens": 32369893.0, "step": 8970 }, { "entropy": 1.68046875, "epoch": 1.9855168601437259, "grad_norm": 3.480821132659912, "learning_rate": 1.373519036116397e-06, "loss": 1.6979, "mean_token_accuracy": 0.5798484325408936, "num_tokens": 32404439.0, "step": 8980 }, { "entropy": 1.698046875, "epoch": 1.9877280265339967, "grad_norm": 3.5216033458709717, "learning_rate": 1.3681573227617573e-06, "loss": 1.6951, "mean_token_accuracy": 0.579479169845581, "num_tokens": 32438536.0, "step": 8990 }, { "entropy": 1.744921875, "epoch": 1.9899391929242676, "grad_norm": 3.6973209381103516, "learning_rate": 1.3628021497555504e-06, "loss": 1.7515, "mean_token_accuracy": 0.5687436163425446, "num_tokens": 32473979.0, "step": 9000 }, { "epoch": 1.9899391929242676, "eval_entropy": 1.7468827736318409, "eval_loss": 1.7950092554092407, "eval_mean_token_accuracy": 0.5633634380736754, "eval_num_tokens": 32473979.0, "eval_runtime": 112.4305, "eval_samples_per_second": 143.022, "eval_steps_per_second": 8.939, "step": 9000 }, { "entropy": 1.719140625, "epoch": 1.9921503593145384, "grad_norm": 3.362218141555786, "learning_rate": 1.357453548042623e-06, "loss": 1.719, "mean_token_accuracy": 0.5770722329616547, "num_tokens": 32508177.0, "step": 9010 }, { "entropy": 1.7375, "epoch": 1.9943615257048093, "grad_norm": 3.4757819175720215, "learning_rate": 1.352111548529849e-06, "loss": 1.7105, "mean_token_accuracy": 0.5790396720170975, "num_tokens": 32544462.0, "step": 9020 }, { "entropy": 1.746875, "epoch": 1.9965726920950801, "grad_norm": 3.72638201713562, "learning_rate": 1.3467761820859526e-06, "loss": 1.7579, "mean_token_accuracy": 0.5691894888877869, "num_tokens": 32580253.0, "step": 9030 }, { "entropy": 1.69296875, "epoch": 1.998783858485351, "grad_norm": 3.9151062965393066, "learning_rate": 1.341447479541324e-06, "loss": 1.6919, "mean_token_accuracy": 0.5805132389068604, "num_tokens": 32616545.0, "step": 9040 }, { "entropy": 1.6854440789473684, "epoch": 2.0008844665561085, "grad_norm": 3.7604727745056152, "learning_rate": 1.3361254716878547e-06, "loss": 1.6984, "mean_token_accuracy": 0.5820427725189611, "num_tokens": 32651893.0, "step": 9050 }, { "entropy": 1.706640625, "epoch": 2.0030956329463794, "grad_norm": 3.6576740741729736, "learning_rate": 1.3308101892787423e-06, "loss": 1.6937, "mean_token_accuracy": 0.586036927998066, "num_tokens": 32692096.0, "step": 9060 }, { "entropy": 1.6703125, "epoch": 2.0053067993366502, "grad_norm": 4.634953498840332, "learning_rate": 1.3255016630283272e-06, "loss": 1.6611, "mean_token_accuracy": 0.5873037904500962, "num_tokens": 32729548.0, "step": 9070 }, { "entropy": 1.67265625, "epoch": 2.007517965726921, "grad_norm": 3.818631172180176, "learning_rate": 1.3201999236119048e-06, "loss": 1.665, "mean_token_accuracy": 0.5847580909729004, "num_tokens": 32764088.0, "step": 9080 }, { "entropy": 1.66875, "epoch": 2.009729132117192, "grad_norm": 3.3340251445770264, "learning_rate": 1.314905001665559e-06, "loss": 1.6899, "mean_token_accuracy": 0.5834394335746765, "num_tokens": 32800074.0, "step": 9090 }, { "entropy": 1.628125, "epoch": 2.011940298507463, "grad_norm": 3.9723172187805176, "learning_rate": 1.3096169277859727e-06, "loss": 1.6102, "mean_token_accuracy": 0.5987802535295487, "num_tokens": 32834438.0, "step": 9100 }, { "entropy": 1.6390625, "epoch": 2.0141514648977337, "grad_norm": 4.273256301879883, "learning_rate": 1.3043357325302614e-06, "loss": 1.6157, "mean_token_accuracy": 0.6003403097391129, "num_tokens": 32870881.0, "step": 9110 }, { "entropy": 1.68125, "epoch": 2.0163626312880045, "grad_norm": 3.3602006435394287, "learning_rate": 1.2990614464157887e-06, "loss": 1.6781, "mean_token_accuracy": 0.5872556120157242, "num_tokens": 32906217.0, "step": 9120 }, { "entropy": 1.6734375, "epoch": 2.0185737976782754, "grad_norm": 2.7324209213256836, "learning_rate": 1.2937940999199988e-06, "loss": 1.6755, "mean_token_accuracy": 0.5851371377706528, "num_tokens": 32941802.0, "step": 9130 }, { "entropy": 1.647265625, "epoch": 2.0207849640685462, "grad_norm": 3.4412288665771484, "learning_rate": 1.288533723480231e-06, "loss": 1.6387, "mean_token_accuracy": 0.5925711005926132, "num_tokens": 32978651.0, "step": 9140 }, { "entropy": 1.644140625, "epoch": 2.022996130458817, "grad_norm": 4.807136058807373, "learning_rate": 1.28328034749355e-06, "loss": 1.6217, "mean_token_accuracy": 0.597022607922554, "num_tokens": 33012178.0, "step": 9150 }, { "entropy": 1.68203125, "epoch": 2.025207296849088, "grad_norm": 3.934673547744751, "learning_rate": 1.2780340023165682e-06, "loss": 1.7026, "mean_token_accuracy": 0.5778836280107498, "num_tokens": 33049224.0, "step": 9160 }, { "entropy": 1.666015625, "epoch": 2.027418463239359, "grad_norm": 3.4702706336975098, "learning_rate": 1.2727947182652717e-06, "loss": 1.6669, "mean_token_accuracy": 0.5885435223579407, "num_tokens": 33087205.0, "step": 9170 }, { "entropy": 1.7015625, "epoch": 2.0296296296296297, "grad_norm": 3.811098337173462, "learning_rate": 1.2675625256148403e-06, "loss": 1.672, "mean_token_accuracy": 0.5831019759178162, "num_tokens": 33124275.0, "step": 9180 }, { "entropy": 1.687890625, "epoch": 2.0318407960199005, "grad_norm": 4.947207450866699, "learning_rate": 1.2623374545994798e-06, "loss": 1.6639, "mean_token_accuracy": 0.5862949162721633, "num_tokens": 33161985.0, "step": 9190 }, { "entropy": 1.676171875, "epoch": 2.0340519624101714, "grad_norm": 3.775390148162842, "learning_rate": 1.2571195354122433e-06, "loss": 1.6495, "mean_token_accuracy": 0.5907007902860641, "num_tokens": 33200505.0, "step": 9200 }, { "entropy": 1.69921875, "epoch": 2.0362631288004422, "grad_norm": 4.2508864402771, "learning_rate": 1.2519087982048545e-06, "loss": 1.6948, "mean_token_accuracy": 0.5842921555042266, "num_tokens": 33233548.0, "step": 9210 }, { "entropy": 1.65546875, "epoch": 2.038474295190713, "grad_norm": 4.247050762176514, "learning_rate": 1.2467052730875381e-06, "loss": 1.6761, "mean_token_accuracy": 0.5898781210184098, "num_tokens": 33270877.0, "step": 9220 }, { "entropy": 1.662109375, "epoch": 2.040685461580984, "grad_norm": 3.307677745819092, "learning_rate": 1.241508990128844e-06, "loss": 1.6648, "mean_token_accuracy": 0.5906867325305939, "num_tokens": 33305640.0, "step": 9230 }, { "entropy": 1.68515625, "epoch": 2.042896627971255, "grad_norm": 4.581154823303223, "learning_rate": 1.2363199793554735e-06, "loss": 1.6575, "mean_token_accuracy": 0.5892653465270996, "num_tokens": 33343663.0, "step": 9240 }, { "entropy": 1.6671875, "epoch": 2.0451077943615257, "grad_norm": 3.278214454650879, "learning_rate": 1.2311382707521027e-06, "loss": 1.6664, "mean_token_accuracy": 0.5821044594049454, "num_tokens": 33378846.0, "step": 9250 }, { "entropy": 1.662109375, "epoch": 2.0473189607517965, "grad_norm": 3.9423975944519043, "learning_rate": 1.2259638942612157e-06, "loss": 1.6489, "mean_token_accuracy": 0.5910352289676666, "num_tokens": 33413307.0, "step": 9260 }, { "entropy": 1.647265625, "epoch": 2.0495301271420674, "grad_norm": 4.124790191650391, "learning_rate": 1.220796879782926e-06, "loss": 1.6085, "mean_token_accuracy": 0.5974036246538162, "num_tokens": 33447510.0, "step": 9270 }, { "entropy": 1.700390625, "epoch": 2.0517412935323383, "grad_norm": 3.829763889312744, "learning_rate": 1.2156372571748077e-06, "loss": 1.6916, "mean_token_accuracy": 0.5794416457414627, "num_tokens": 33486530.0, "step": 9280 }, { "entropy": 1.666015625, "epoch": 2.053952459922609, "grad_norm": 4.0884809494018555, "learning_rate": 1.2104850562517175e-06, "loss": 1.6504, "mean_token_accuracy": 0.5896530210971832, "num_tokens": 33525692.0, "step": 9290 }, { "entropy": 1.6484375, "epoch": 2.05616362631288, "grad_norm": 3.627532958984375, "learning_rate": 1.205340306785629e-06, "loss": 1.5957, "mean_token_accuracy": 0.603008696436882, "num_tokens": 33560908.0, "step": 9300 }, { "entropy": 1.6390625, "epoch": 2.058374792703151, "grad_norm": 3.4198801517486572, "learning_rate": 1.200203038505457e-06, "loss": 1.5846, "mean_token_accuracy": 0.5999058246612549, "num_tokens": 33595859.0, "step": 9310 }, { "entropy": 1.667578125, "epoch": 2.0605859590934217, "grad_norm": 3.7610087394714355, "learning_rate": 1.1950732810968863e-06, "loss": 1.6615, "mean_token_accuracy": 0.5829620629549026, "num_tokens": 33632001.0, "step": 9320 }, { "entropy": 1.634765625, "epoch": 2.0627971254836925, "grad_norm": 3.5851423740386963, "learning_rate": 1.1899510642021986e-06, "loss": 1.6411, "mean_token_accuracy": 0.5868986129760743, "num_tokens": 33665548.0, "step": 9330 }, { "entropy": 1.662890625, "epoch": 2.0650082918739634, "grad_norm": 3.9838619232177734, "learning_rate": 1.1848364174201041e-06, "loss": 1.6524, "mean_token_accuracy": 0.5904654026031494, "num_tokens": 33700187.0, "step": 9340 }, { "entropy": 1.674609375, "epoch": 2.0672194582642343, "grad_norm": 4.710204601287842, "learning_rate": 1.1797293703055696e-06, "loss": 1.6826, "mean_token_accuracy": 0.5840006828308105, "num_tokens": 33736668.0, "step": 9350 }, { "entropy": 1.694140625, "epoch": 2.069430624654505, "grad_norm": 2.8968753814697266, "learning_rate": 1.1746299523696475e-06, "loss": 1.7038, "mean_token_accuracy": 0.5801070272922516, "num_tokens": 33773384.0, "step": 9360 }, { "entropy": 1.6578125, "epoch": 2.071641791044776, "grad_norm": 4.808715343475342, "learning_rate": 1.1695381930793013e-06, "loss": 1.6775, "mean_token_accuracy": 0.5874375969171524, "num_tokens": 33810139.0, "step": 9370 }, { "entropy": 1.655078125, "epoch": 2.073852957435047, "grad_norm": 4.600178241729736, "learning_rate": 1.1644541218572456e-06, "loss": 1.6369, "mean_token_accuracy": 0.5893501251935959, "num_tokens": 33846155.0, "step": 9380 }, { "entropy": 1.63046875, "epoch": 2.0760641238253177, "grad_norm": 3.091615915298462, "learning_rate": 1.1593777680817631e-06, "loss": 1.6271, "mean_token_accuracy": 0.5923317819833755, "num_tokens": 33879832.0, "step": 9390 }, { "entropy": 1.657421875, "epoch": 2.0782752902155885, "grad_norm": 3.9050323963165283, "learning_rate": 1.1543091610865456e-06, "loss": 1.6507, "mean_token_accuracy": 0.58967727124691, "num_tokens": 33916383.0, "step": 9400 }, { "entropy": 1.709375, "epoch": 2.0804864566058594, "grad_norm": 3.872868299484253, "learning_rate": 1.1492483301605165e-06, "loss": 1.7136, "mean_token_accuracy": 0.5769048154354095, "num_tokens": 33955692.0, "step": 9410 }, { "entropy": 1.6625, "epoch": 2.0826976229961303, "grad_norm": 4.43612003326416, "learning_rate": 1.14419530454767e-06, "loss": 1.6505, "mean_token_accuracy": 0.5944570094347, "num_tokens": 33993251.0, "step": 9420 }, { "entropy": 1.587890625, "epoch": 2.084908789386401, "grad_norm": 3.896233081817627, "learning_rate": 1.1391501134468927e-06, "loss": 1.5743, "mean_token_accuracy": 0.6039249539375305, "num_tokens": 34030918.0, "step": 9430 }, { "entropy": 1.654296875, "epoch": 2.0871199557766724, "grad_norm": 4.2811713218688965, "learning_rate": 1.134112786011803e-06, "loss": 1.691, "mean_token_accuracy": 0.5805846691131592, "num_tokens": 34065965.0, "step": 9440 }, { "entropy": 1.6609375, "epoch": 2.0893311221669433, "grad_norm": 3.495391368865967, "learning_rate": 1.1290833513505755e-06, "loss": 1.6578, "mean_token_accuracy": 0.5863269746303559, "num_tokens": 34100689.0, "step": 9450 }, { "entropy": 1.66328125, "epoch": 2.091542288557214, "grad_norm": 4.109462738037109, "learning_rate": 1.1240618385257798e-06, "loss": 1.6511, "mean_token_accuracy": 0.588376647233963, "num_tokens": 34133110.0, "step": 9460 }, { "entropy": 1.714453125, "epoch": 2.093753454947485, "grad_norm": 4.109835147857666, "learning_rate": 1.1190482765542077e-06, "loss": 1.6929, "mean_token_accuracy": 0.5806125104427338, "num_tokens": 34169509.0, "step": 9470 }, { "entropy": 1.6484375, "epoch": 2.095964621337756, "grad_norm": 4.12890625, "learning_rate": 1.1140426944067068e-06, "loss": 1.6203, "mean_token_accuracy": 0.5960247188806533, "num_tokens": 34205258.0, "step": 9480 }, { "entropy": 1.665625, "epoch": 2.0981757877280267, "grad_norm": 3.5141777992248535, "learning_rate": 1.1090451210080155e-06, "loss": 1.6882, "mean_token_accuracy": 0.5870868861675262, "num_tokens": 34242051.0, "step": 9490 }, { "entropy": 1.633984375, "epoch": 2.1003869541182976, "grad_norm": 3.7343881130218506, "learning_rate": 1.1040555852365895e-06, "loss": 1.6259, "mean_token_accuracy": 0.5932332783937454, "num_tokens": 34276423.0, "step": 9500 }, { "epoch": 2.1003869541182976, "eval_entropy": 1.6913557213930348, "eval_loss": 1.794851303100586, "eval_mean_token_accuracy": 0.5645787341677727, "eval_num_tokens": 34276423.0, "eval_runtime": 112.1343, "eval_samples_per_second": 143.399, "eval_steps_per_second": 8.962, "step": 9500 }, { "entropy": 1.6625, "epoch": 2.1025981205085684, "grad_norm": 4.0971479415893555, "learning_rate": 1.0990741159244422e-06, "loss": 1.6547, "mean_token_accuracy": 0.5878496408462525, "num_tokens": 34311916.0, "step": 9510 }, { "entropy": 1.644921875, "epoch": 2.1048092868988393, "grad_norm": 4.2546491622924805, "learning_rate": 1.094100741856975e-06, "loss": 1.6313, "mean_token_accuracy": 0.589262244105339, "num_tokens": 34347782.0, "step": 9520 }, { "entropy": 1.6046875, "epoch": 2.10702045328911, "grad_norm": 4.321098804473877, "learning_rate": 1.0891354917728112e-06, "loss": 1.5975, "mean_token_accuracy": 0.5994806945323944, "num_tokens": 34382958.0, "step": 9530 }, { "entropy": 1.666015625, "epoch": 2.109231619679381, "grad_norm": 3.9937922954559326, "learning_rate": 1.084178394363626e-06, "loss": 1.696, "mean_token_accuracy": 0.5875179678201675, "num_tokens": 34420054.0, "step": 9540 }, { "entropy": 1.681640625, "epoch": 2.111442786069652, "grad_norm": 3.289050340652466, "learning_rate": 1.0792294782739901e-06, "loss": 1.7125, "mean_token_accuracy": 0.5799039959907532, "num_tokens": 34457966.0, "step": 9550 }, { "entropy": 1.6546875, "epoch": 2.1136539524599227, "grad_norm": 3.9801626205444336, "learning_rate": 1.0742887721011922e-06, "loss": 1.6299, "mean_token_accuracy": 0.5924351423978805, "num_tokens": 34493335.0, "step": 9560 }, { "entropy": 1.66640625, "epoch": 2.1158651188501936, "grad_norm": 3.0172829627990723, "learning_rate": 1.0693563043950868e-06, "loss": 1.6354, "mean_token_accuracy": 0.5975950539112092, "num_tokens": 34529596.0, "step": 9570 }, { "entropy": 1.658203125, "epoch": 2.1180762852404644, "grad_norm": 4.129273891448975, "learning_rate": 1.0644321036579172e-06, "loss": 1.6304, "mean_token_accuracy": 0.5922056257724762, "num_tokens": 34564428.0, "step": 9580 }, { "entropy": 1.634765625, "epoch": 2.1202874516307353, "grad_norm": 3.903503656387329, "learning_rate": 1.0595161983441578e-06, "loss": 1.6045, "mean_token_accuracy": 0.5974501520395279, "num_tokens": 34600308.0, "step": 9590 }, { "entropy": 1.64140625, "epoch": 2.122498618021006, "grad_norm": 4.2293267250061035, "learning_rate": 1.0546086168603489e-06, "loss": 1.6482, "mean_token_accuracy": 0.5904124855995179, "num_tokens": 34639921.0, "step": 9600 }, { "entropy": 1.633203125, "epoch": 2.124709784411277, "grad_norm": 3.7998239994049072, "learning_rate": 1.049709387564931e-06, "loss": 1.6332, "mean_token_accuracy": 0.5945297390222549, "num_tokens": 34677255.0, "step": 9610 }, { "entropy": 1.64375, "epoch": 2.126920950801548, "grad_norm": 4.141975402832031, "learning_rate": 1.0448185387680794e-06, "loss": 1.6362, "mean_token_accuracy": 0.5945258915424347, "num_tokens": 34711984.0, "step": 9620 }, { "entropy": 1.674609375, "epoch": 2.1291321171918187, "grad_norm": 4.005610942840576, "learning_rate": 1.0399360987315458e-06, "loss": 1.6725, "mean_token_accuracy": 0.5868113815784455, "num_tokens": 34752083.0, "step": 9630 }, { "entropy": 1.6421875, "epoch": 2.1313432835820896, "grad_norm": 3.113109588623047, "learning_rate": 1.0350620956684901e-06, "loss": 1.6237, "mean_token_accuracy": 0.5969673097133636, "num_tokens": 34789788.0, "step": 9640 }, { "entropy": 1.63671875, "epoch": 2.1335544499723604, "grad_norm": 3.8784596920013428, "learning_rate": 1.030196557743321e-06, "loss": 1.6215, "mean_token_accuracy": 0.5964713245630264, "num_tokens": 34826219.0, "step": 9650 }, { "entropy": 1.677734375, "epoch": 2.1357656163626313, "grad_norm": 3.9165449142456055, "learning_rate": 1.0253395130715286e-06, "loss": 1.6741, "mean_token_accuracy": 0.58501897752285, "num_tokens": 34861851.0, "step": 9660 }, { "entropy": 1.684375, "epoch": 2.137976782752902, "grad_norm": 4.459188938140869, "learning_rate": 1.0204909897195268e-06, "loss": 1.6688, "mean_token_accuracy": 0.5869225353002548, "num_tokens": 34898245.0, "step": 9670 }, { "entropy": 1.662890625, "epoch": 2.140187949143173, "grad_norm": 4.163595676422119, "learning_rate": 1.0156510157044885e-06, "loss": 1.6669, "mean_token_accuracy": 0.5829361081123352, "num_tokens": 34933855.0, "step": 9680 }, { "entropy": 1.653125, "epoch": 2.142399115533444, "grad_norm": 4.216367244720459, "learning_rate": 1.0108196189941858e-06, "loss": 1.6632, "mean_token_accuracy": 0.5864406168460846, "num_tokens": 34969878.0, "step": 9690 }, { "entropy": 1.707421875, "epoch": 2.1446102819237147, "grad_norm": 3.61181378364563, "learning_rate": 1.005996827506823e-06, "loss": 1.7254, "mean_token_accuracy": 0.5790015578269958, "num_tokens": 35007042.0, "step": 9700 }, { "entropy": 1.6828125, "epoch": 2.1468214483139856, "grad_norm": 3.6967859268188477, "learning_rate": 1.0011826691108834e-06, "loss": 1.6486, "mean_token_accuracy": 0.5885917782783509, "num_tokens": 35042550.0, "step": 9710 }, { "entropy": 1.671484375, "epoch": 2.1490326147042564, "grad_norm": 4.0739006996154785, "learning_rate": 9.963771716249614e-07, "loss": 1.6486, "mean_token_accuracy": 0.5914486140012741, "num_tokens": 35077758.0, "step": 9720 }, { "entropy": 1.616796875, "epoch": 2.1512437810945273, "grad_norm": 3.8693509101867676, "learning_rate": 9.91580362817607e-07, "loss": 1.5905, "mean_token_accuracy": 0.6057449907064438, "num_tokens": 35114756.0, "step": 9730 }, { "entropy": 1.657421875, "epoch": 2.153454947484798, "grad_norm": 4.244692325592041, "learning_rate": 9.867922704071583e-07, "loss": 1.6454, "mean_token_accuracy": 0.594467768073082, "num_tokens": 35148977.0, "step": 9740 }, { "entropy": 1.65, "epoch": 2.155666113875069, "grad_norm": 3.924206495285034, "learning_rate": 9.820129220615896e-07, "loss": 1.6676, "mean_token_accuracy": 0.5851344615221024, "num_tokens": 35184040.0, "step": 9750 }, { "entropy": 1.6625, "epoch": 2.15787728026534, "grad_norm": 3.689344644546509, "learning_rate": 9.772423453983466e-07, "loss": 1.6678, "mean_token_accuracy": 0.5863826185464859, "num_tokens": 35221491.0, "step": 9760 }, { "entropy": 1.698046875, "epoch": 2.1600884466556107, "grad_norm": 3.783862590789795, "learning_rate": 9.72480567984188e-07, "loss": 1.7159, "mean_token_accuracy": 0.5796569019556046, "num_tokens": 35259732.0, "step": 9770 }, { "entropy": 1.616015625, "epoch": 2.1622996130458816, "grad_norm": 3.214698076248169, "learning_rate": 9.677276173350248e-07, "loss": 1.6039, "mean_token_accuracy": 0.601754567027092, "num_tokens": 35295716.0, "step": 9780 }, { "entropy": 1.6703125, "epoch": 2.1645107794361524, "grad_norm": 3.0740807056427, "learning_rate": 9.629835209157634e-07, "loss": 1.6665, "mean_token_accuracy": 0.5883079558610916, "num_tokens": 35332139.0, "step": 9790 }, { "entropy": 1.66875, "epoch": 2.1667219458264233, "grad_norm": 3.392265796661377, "learning_rate": 9.582483061401478e-07, "loss": 1.6367, "mean_token_accuracy": 0.5929653942584991, "num_tokens": 35367639.0, "step": 9800 }, { "entropy": 1.64140625, "epoch": 2.168933112216694, "grad_norm": 3.8785974979400635, "learning_rate": 9.535220003705953e-07, "loss": 1.6411, "mean_token_accuracy": 0.5909535974264145, "num_tokens": 35402288.0, "step": 9810 }, { "entropy": 1.665625, "epoch": 2.171144278606965, "grad_norm": 4.227286338806152, "learning_rate": 9.488046309180482e-07, "loss": 1.6816, "mean_token_accuracy": 0.5812132567167282, "num_tokens": 35437739.0, "step": 9820 }, { "entropy": 1.66328125, "epoch": 2.173355444997236, "grad_norm": 3.2717180252075195, "learning_rate": 9.440962250418048e-07, "loss": 1.6463, "mean_token_accuracy": 0.593735134601593, "num_tokens": 35472974.0, "step": 9830 }, { "entropy": 1.676953125, "epoch": 2.1755666113875067, "grad_norm": 3.9498894214630127, "learning_rate": 9.393968099493714e-07, "loss": 1.6623, "mean_token_accuracy": 0.5901206344366073, "num_tokens": 35509352.0, "step": 9840 }, { "entropy": 1.69375, "epoch": 2.1777777777777776, "grad_norm": 3.717860698699951, "learning_rate": 9.34706412796297e-07, "loss": 1.6666, "mean_token_accuracy": 0.5834533333778381, "num_tokens": 35543274.0, "step": 9850 }, { "entropy": 1.662890625, "epoch": 2.1799889441680484, "grad_norm": 4.873961925506592, "learning_rate": 9.300250606860268e-07, "loss": 1.6608, "mean_token_accuracy": 0.5882317185401916, "num_tokens": 35579838.0, "step": 9860 }, { "entropy": 1.678125, "epoch": 2.1822001105583193, "grad_norm": 3.683516502380371, "learning_rate": 9.253527806697321e-07, "loss": 1.7087, "mean_token_accuracy": 0.5794265359640122, "num_tokens": 35618351.0, "step": 9870 }, { "entropy": 1.63515625, "epoch": 2.18441127694859, "grad_norm": 4.722360610961914, "learning_rate": 9.206895997461668e-07, "loss": 1.6369, "mean_token_accuracy": 0.5896208763122559, "num_tokens": 35653740.0, "step": 9880 }, { "entropy": 1.662890625, "epoch": 2.1866224433388615, "grad_norm": 4.031754493713379, "learning_rate": 9.160355448615008e-07, "loss": 1.6376, "mean_token_accuracy": 0.5892221212387085, "num_tokens": 35687463.0, "step": 9890 }, { "entropy": 1.703125, "epoch": 2.1888336097291323, "grad_norm": 3.8833189010620117, "learning_rate": 9.113906429091754e-07, "loss": 1.6719, "mean_token_accuracy": 0.5895426988601684, "num_tokens": 35725791.0, "step": 9900 }, { "entropy": 1.663671875, "epoch": 2.191044776119403, "grad_norm": 4.354165077209473, "learning_rate": 9.06754920729735e-07, "loss": 1.6416, "mean_token_accuracy": 0.5888224154710769, "num_tokens": 35761365.0, "step": 9910 }, { "entropy": 1.6421875, "epoch": 2.193255942509674, "grad_norm": 4.1222639083862305, "learning_rate": 9.021284051106832e-07, "loss": 1.6402, "mean_token_accuracy": 0.5917343676090241, "num_tokens": 35796572.0, "step": 9920 }, { "entropy": 1.633203125, "epoch": 2.195467108899945, "grad_norm": 3.9305975437164307, "learning_rate": 8.975111227863223e-07, "loss": 1.644, "mean_token_accuracy": 0.5896116942167282, "num_tokens": 35832785.0, "step": 9930 }, { "entropy": 1.643359375, "epoch": 2.1976782752902158, "grad_norm": 4.133862018585205, "learning_rate": 8.929031004376004e-07, "loss": 1.6376, "mean_token_accuracy": 0.5921714454889297, "num_tokens": 35869508.0, "step": 9940 }, { "entropy": 1.682421875, "epoch": 2.1998894416804866, "grad_norm": 4.324777126312256, "learning_rate": 8.883043646919551e-07, "loss": 1.6991, "mean_token_accuracy": 0.5864171355962753, "num_tokens": 35909075.0, "step": 9950 }, { "entropy": 1.640234375, "epoch": 2.2021006080707575, "grad_norm": 3.720689058303833, "learning_rate": 8.83714942123163e-07, "loss": 1.617, "mean_token_accuracy": 0.5940989196300507, "num_tokens": 35942928.0, "step": 9960 }, { "entropy": 1.68671875, "epoch": 2.2043117744610283, "grad_norm": 3.8230671882629395, "learning_rate": 8.79134859251185e-07, "loss": 1.6806, "mean_token_accuracy": 0.5844277948141098, "num_tokens": 35977541.0, "step": 9970 }, { "entropy": 1.669140625, "epoch": 2.206522940851299, "grad_norm": 4.613833904266357, "learning_rate": 8.745641425420124e-07, "loss": 1.6498, "mean_token_accuracy": 0.5863915592432022, "num_tokens": 36012867.0, "step": 9980 }, { "entropy": 1.646484375, "epoch": 2.20873410724157, "grad_norm": 4.28706169128418, "learning_rate": 8.700028184075119e-07, "loss": 1.6286, "mean_token_accuracy": 0.5974502593278885, "num_tokens": 36050003.0, "step": 9990 }, { "entropy": 1.67578125, "epoch": 2.210945273631841, "grad_norm": 4.122777938842773, "learning_rate": 8.654509132052774e-07, "loss": 1.662, "mean_token_accuracy": 0.5833598256111145, "num_tokens": 36086485.0, "step": 10000 }, { "epoch": 2.210945273631841, "eval_entropy": 1.680939054726368, "eval_loss": 1.7898541688919067, "eval_mean_token_accuracy": 0.5655909090196315, "eval_num_tokens": 36086485.0, "eval_runtime": 112.5324, "eval_samples_per_second": 142.892, "eval_steps_per_second": 8.931, "step": 10000 }, { "entropy": 1.635546875, "epoch": 2.2131564400221118, "grad_norm": 3.622375249862671, "learning_rate": 8.609084532384759e-07, "loss": 1.6093, "mean_token_accuracy": 0.59775630235672, "num_tokens": 36126191.0, "step": 10010 }, { "entropy": 1.6359375, "epoch": 2.2153676064123826, "grad_norm": 4.0857415199279785, "learning_rate": 8.563754647556946e-07, "loss": 1.6107, "mean_token_accuracy": 0.5934461295604706, "num_tokens": 36159445.0, "step": 10020 }, { "entropy": 1.635546875, "epoch": 2.2175787728026535, "grad_norm": 2.851653575897217, "learning_rate": 8.518519739507882e-07, "loss": 1.639, "mean_token_accuracy": 0.5913150012493134, "num_tokens": 36196739.0, "step": 10030 }, { "entropy": 1.63671875, "epoch": 2.2197899391929243, "grad_norm": 3.781244993209839, "learning_rate": 8.47338006962731e-07, "loss": 1.6461, "mean_token_accuracy": 0.5871370524168015, "num_tokens": 36232574.0, "step": 10040 }, { "entropy": 1.61875, "epoch": 2.222001105583195, "grad_norm": 3.7562243938446045, "learning_rate": 8.428335898754644e-07, "loss": 1.6152, "mean_token_accuracy": 0.5953419506549835, "num_tokens": 36269132.0, "step": 10050 }, { "entropy": 1.621875, "epoch": 2.224212271973466, "grad_norm": 4.491815090179443, "learning_rate": 8.38338748717743e-07, "loss": 1.6145, "mean_token_accuracy": 0.59502092897892, "num_tokens": 36304282.0, "step": 10060 }, { "entropy": 1.678125, "epoch": 2.226423438363737, "grad_norm": 3.691129446029663, "learning_rate": 8.338535094629894e-07, "loss": 1.6846, "mean_token_accuracy": 0.5799425959587097, "num_tokens": 36342300.0, "step": 10070 }, { "entropy": 1.61796875, "epoch": 2.2286346047540078, "grad_norm": 3.6524910926818848, "learning_rate": 8.293778980291408e-07, "loss": 1.6037, "mean_token_accuracy": 0.599416071176529, "num_tokens": 36376260.0, "step": 10080 }, { "entropy": 1.64375, "epoch": 2.2308457711442786, "grad_norm": 3.0791642665863037, "learning_rate": 8.249119402785014e-07, "loss": 1.6234, "mean_token_accuracy": 0.592498853802681, "num_tokens": 36414113.0, "step": 10090 }, { "entropy": 1.65625, "epoch": 2.2330569375345495, "grad_norm": 4.270403861999512, "learning_rate": 8.204556620175882e-07, "loss": 1.6191, "mean_token_accuracy": 0.5977440983057022, "num_tokens": 36451234.0, "step": 10100 }, { "entropy": 1.69609375, "epoch": 2.2352681039248203, "grad_norm": 3.685277223587036, "learning_rate": 8.160090889969887e-07, "loss": 1.6686, "mean_token_accuracy": 0.5867778480052948, "num_tokens": 36490205.0, "step": 10110 }, { "entropy": 1.630859375, "epoch": 2.237479270315091, "grad_norm": 3.2156941890716553, "learning_rate": 8.115722469112078e-07, "loss": 1.6168, "mean_token_accuracy": 0.5949454426765441, "num_tokens": 36526931.0, "step": 10120 }, { "entropy": 1.658984375, "epoch": 2.239690436705362, "grad_norm": 4.47505521774292, "learning_rate": 8.071451613985199e-07, "loss": 1.6613, "mean_token_accuracy": 0.5873622119426727, "num_tokens": 36561128.0, "step": 10130 }, { "entropy": 1.641796875, "epoch": 2.241901603095633, "grad_norm": 3.8162333965301514, "learning_rate": 8.027278580408194e-07, "loss": 1.6177, "mean_token_accuracy": 0.5959106415510178, "num_tokens": 36594792.0, "step": 10140 }, { "entropy": 1.690625, "epoch": 2.2441127694859038, "grad_norm": 3.5998377799987793, "learning_rate": 7.983203623634794e-07, "loss": 1.6803, "mean_token_accuracy": 0.588790038228035, "num_tokens": 36635052.0, "step": 10150 }, { "entropy": 1.665625, "epoch": 2.2463239358761746, "grad_norm": 4.129461765289307, "learning_rate": 7.939226998351934e-07, "loss": 1.6482, "mean_token_accuracy": 0.5881589829921723, "num_tokens": 36671561.0, "step": 10160 }, { "entropy": 1.671875, "epoch": 2.2485351022664455, "grad_norm": 3.663065195083618, "learning_rate": 7.895348958678392e-07, "loss": 1.6579, "mean_token_accuracy": 0.5880895465612411, "num_tokens": 36708621.0, "step": 10170 }, { "entropy": 1.6234375, "epoch": 2.2507462686567163, "grad_norm": 3.5403990745544434, "learning_rate": 7.851569758163217e-07, "loss": 1.6003, "mean_token_accuracy": 0.5959459006786346, "num_tokens": 36743451.0, "step": 10180 }, { "entropy": 1.64609375, "epoch": 2.252957435046987, "grad_norm": 3.9739184379577637, "learning_rate": 7.807889649784381e-07, "loss": 1.6404, "mean_token_accuracy": 0.590265879034996, "num_tokens": 36780513.0, "step": 10190 }, { "entropy": 1.66875, "epoch": 2.255168601437258, "grad_norm": 4.181736469268799, "learning_rate": 7.764308885947191e-07, "loss": 1.666, "mean_token_accuracy": 0.5878528714179992, "num_tokens": 36815328.0, "step": 10200 }, { "entropy": 1.644921875, "epoch": 2.257379767827529, "grad_norm": 3.944838285446167, "learning_rate": 7.720827718482937e-07, "loss": 1.6353, "mean_token_accuracy": 0.5911028474569321, "num_tokens": 36851301.0, "step": 10210 }, { "entropy": 1.667578125, "epoch": 2.2595909342177998, "grad_norm": 4.653888702392578, "learning_rate": 7.677446398647348e-07, "loss": 1.6914, "mean_token_accuracy": 0.584631872177124, "num_tokens": 36889784.0, "step": 10220 }, { "entropy": 1.652734375, "epoch": 2.2618021006080706, "grad_norm": 3.6742589473724365, "learning_rate": 7.63416517711924e-07, "loss": 1.6224, "mean_token_accuracy": 0.5906828016042709, "num_tokens": 36925544.0, "step": 10230 }, { "entropy": 1.67578125, "epoch": 2.2640132669983415, "grad_norm": 3.3667688369750977, "learning_rate": 7.590984303998961e-07, "loss": 1.6873, "mean_token_accuracy": 0.5787302792072296, "num_tokens": 36961836.0, "step": 10240 }, { "entropy": 1.629296875, "epoch": 2.2662244333886123, "grad_norm": 3.7188103199005127, "learning_rate": 7.547904028807018e-07, "loss": 1.6243, "mean_token_accuracy": 0.5905676364898682, "num_tokens": 36998707.0, "step": 10250 }, { "entropy": 1.617578125, "epoch": 2.268435599778883, "grad_norm": 3.8408377170562744, "learning_rate": 7.504924600482613e-07, "loss": 1.6017, "mean_token_accuracy": 0.5996009021997452, "num_tokens": 37033074.0, "step": 10260 }, { "entropy": 1.64609375, "epoch": 2.270646766169154, "grad_norm": 3.645970344543457, "learning_rate": 7.462046267382212e-07, "loss": 1.6337, "mean_token_accuracy": 0.59505954682827, "num_tokens": 37067366.0, "step": 10270 }, { "entropy": 1.65078125, "epoch": 2.272857932559425, "grad_norm": 2.9627480506896973, "learning_rate": 7.419269277278073e-07, "loss": 1.6671, "mean_token_accuracy": 0.5880758047103882, "num_tokens": 37104039.0, "step": 10280 }, { "entropy": 1.6265625, "epoch": 2.275069098949696, "grad_norm": 3.653026580810547, "learning_rate": 7.376593877356877e-07, "loss": 1.629, "mean_token_accuracy": 0.5970774859189987, "num_tokens": 37141842.0, "step": 10290 }, { "entropy": 1.642578125, "epoch": 2.277280265339967, "grad_norm": 3.448512554168701, "learning_rate": 7.33402031421826e-07, "loss": 1.6581, "mean_token_accuracy": 0.587392058968544, "num_tokens": 37175871.0, "step": 10300 }, { "entropy": 1.7, "epoch": 2.2794914317302375, "grad_norm": 3.149461030960083, "learning_rate": 7.291548833873371e-07, "loss": 1.6907, "mean_token_accuracy": 0.5861868977546691, "num_tokens": 37212259.0, "step": 10310 }, { "entropy": 1.66328125, "epoch": 2.281702598120509, "grad_norm": 3.343381881713867, "learning_rate": 7.249179681743501e-07, "loss": 1.6364, "mean_token_accuracy": 0.5925963282585144, "num_tokens": 37249439.0, "step": 10320 }, { "entropy": 1.663671875, "epoch": 2.283913764510779, "grad_norm": 3.8509092330932617, "learning_rate": 7.206913102658627e-07, "loss": 1.6588, "mean_token_accuracy": 0.5876330971717835, "num_tokens": 37287615.0, "step": 10330 }, { "entropy": 1.66484375, "epoch": 2.2861249309010505, "grad_norm": 4.006129264831543, "learning_rate": 7.164749340856014e-07, "loss": 1.657, "mean_token_accuracy": 0.5862541973590851, "num_tokens": 37324320.0, "step": 10340 }, { "entropy": 1.6453125, "epoch": 2.288336097291321, "grad_norm": 3.49574613571167, "learning_rate": 7.122688639978784e-07, "loss": 1.6123, "mean_token_accuracy": 0.5951761305332184, "num_tokens": 37359408.0, "step": 10350 }, { "entropy": 1.612890625, "epoch": 2.2905472636815922, "grad_norm": 3.669109344482422, "learning_rate": 7.080731243074531e-07, "loss": 1.587, "mean_token_accuracy": 0.5994881123304368, "num_tokens": 37391792.0, "step": 10360 }, { "entropy": 1.646875, "epoch": 2.292758430071863, "grad_norm": 3.4717578887939453, "learning_rate": 7.038877392593913e-07, "loss": 1.6496, "mean_token_accuracy": 0.5929923504590988, "num_tokens": 37428862.0, "step": 10370 }, { "entropy": 1.65703125, "epoch": 2.294969596462134, "grad_norm": 4.697922706604004, "learning_rate": 6.997127330389242e-07, "loss": 1.6583, "mean_token_accuracy": 0.5864217549562454, "num_tokens": 37465379.0, "step": 10380 }, { "entropy": 1.589453125, "epoch": 2.297180762852405, "grad_norm": 4.279449939727783, "learning_rate": 6.955481297713076e-07, "loss": 1.5721, "mean_token_accuracy": 0.6088831961154938, "num_tokens": 37501343.0, "step": 10390 }, { "entropy": 1.66953125, "epoch": 2.2993919292426757, "grad_norm": 4.148053169250488, "learning_rate": 6.913939535216857e-07, "loss": 1.6847, "mean_token_accuracy": 0.5842261284589767, "num_tokens": 37538598.0, "step": 10400 }, { "entropy": 1.63046875, "epoch": 2.3016030956329465, "grad_norm": 4.100341320037842, "learning_rate": 6.872502282949495e-07, "loss": 1.6174, "mean_token_accuracy": 0.5970572859048844, "num_tokens": 37573477.0, "step": 10410 }, { "entropy": 1.650390625, "epoch": 2.3038142620232174, "grad_norm": 4.222926139831543, "learning_rate": 6.831169780355995e-07, "loss": 1.6499, "mean_token_accuracy": 0.5906051814556121, "num_tokens": 37608542.0, "step": 10420 }, { "entropy": 1.61640625, "epoch": 2.3060254284134882, "grad_norm": 3.443911075592041, "learning_rate": 6.789942266276045e-07, "loss": 1.6147, "mean_token_accuracy": 0.5979989409446717, "num_tokens": 37645524.0, "step": 10430 }, { "entropy": 1.62265625, "epoch": 2.308236594803759, "grad_norm": 4.070090293884277, "learning_rate": 6.748819978942677e-07, "loss": 1.6382, "mean_token_accuracy": 0.590546327829361, "num_tokens": 37681349.0, "step": 10440 }, { "entropy": 1.6484375, "epoch": 2.31044776119403, "grad_norm": 4.308807373046875, "learning_rate": 6.707803155980872e-07, "loss": 1.6673, "mean_token_accuracy": 0.5826854348182678, "num_tokens": 37716852.0, "step": 10450 }, { "entropy": 1.667578125, "epoch": 2.312658927584301, "grad_norm": 3.232156276702881, "learning_rate": 6.666892034406183e-07, "loss": 1.6611, "mean_token_accuracy": 0.5924216598272324, "num_tokens": 37751490.0, "step": 10460 }, { "entropy": 1.669140625, "epoch": 2.3148700939745717, "grad_norm": 3.4908416271209717, "learning_rate": 6.62608685062334e-07, "loss": 1.6747, "mean_token_accuracy": 0.5884420543909072, "num_tokens": 37786868.0, "step": 10470 }, { "entropy": 1.649609375, "epoch": 2.3170812603648425, "grad_norm": 4.414630889892578, "learning_rate": 6.585387840424967e-07, "loss": 1.6462, "mean_token_accuracy": 0.5911196172237396, "num_tokens": 37820619.0, "step": 10480 }, { "entropy": 1.669921875, "epoch": 2.3192924267551134, "grad_norm": 3.9287071228027344, "learning_rate": 6.544795238990115e-07, "loss": 1.6451, "mean_token_accuracy": 0.586186683177948, "num_tokens": 37857350.0, "step": 10490 }, { "entropy": 1.659765625, "epoch": 2.3215035931453842, "grad_norm": 4.126605033874512, "learning_rate": 6.504309280882981e-07, "loss": 1.6359, "mean_token_accuracy": 0.5897322088479996, "num_tokens": 37893891.0, "step": 10500 }, { "epoch": 2.3215035931453842, "eval_entropy": 1.6942241915422886, "eval_loss": 1.785590410232544, "eval_mean_token_accuracy": 0.5662108426070331, "eval_num_tokens": 37893891.0, "eval_runtime": 113.3166, "eval_samples_per_second": 141.903, "eval_steps_per_second": 8.869, "step": 10500 }, { "entropy": 1.615234375, "epoch": 2.323714759535655, "grad_norm": 4.357997894287109, "learning_rate": 6.463930200051494e-07, "loss": 1.5731, "mean_token_accuracy": 0.6029756456613541, "num_tokens": 37929901.0, "step": 10510 }, { "entropy": 1.630078125, "epoch": 2.325925925925926, "grad_norm": 4.052964210510254, "learning_rate": 6.42365822982604e-07, "loss": 1.6082, "mean_token_accuracy": 0.5999705284833908, "num_tokens": 37968198.0, "step": 10520 }, { "entropy": 1.662890625, "epoch": 2.328137092316197, "grad_norm": 4.5125908851623535, "learning_rate": 6.38349360291802e-07, "loss": 1.6639, "mean_token_accuracy": 0.5870465397834778, "num_tokens": 38005072.0, "step": 10530 }, { "entropy": 1.6265625, "epoch": 2.3303482587064677, "grad_norm": 4.022906303405762, "learning_rate": 6.343436551418586e-07, "loss": 1.6122, "mean_token_accuracy": 0.5981589943170548, "num_tokens": 38038455.0, "step": 10540 }, { "entropy": 1.66875, "epoch": 2.3325594250967385, "grad_norm": 4.6861443519592285, "learning_rate": 6.303487306797237e-07, "loss": 1.6474, "mean_token_accuracy": 0.5891249388456344, "num_tokens": 38074616.0, "step": 10550 }, { "entropy": 1.63671875, "epoch": 2.3347705914870094, "grad_norm": 3.9527344703674316, "learning_rate": 6.263646099900531e-07, "loss": 1.6259, "mean_token_accuracy": 0.5952818065881729, "num_tokens": 38110929.0, "step": 10560 }, { "entropy": 1.646875, "epoch": 2.3369817578772802, "grad_norm": 4.391312122344971, "learning_rate": 6.223913160950726e-07, "loss": 1.628, "mean_token_accuracy": 0.5921220153570175, "num_tokens": 38149576.0, "step": 10570 }, { "entropy": 1.655859375, "epoch": 2.339192924267551, "grad_norm": 4.042408466339111, "learning_rate": 6.184288719544451e-07, "loss": 1.6228, "mean_token_accuracy": 0.5952717304229737, "num_tokens": 38185181.0, "step": 10580 }, { "entropy": 1.685546875, "epoch": 2.341404090657822, "grad_norm": 4.624055862426758, "learning_rate": 6.144773004651394e-07, "loss": 1.6795, "mean_token_accuracy": 0.5825979053974152, "num_tokens": 38219914.0, "step": 10590 }, { "entropy": 1.646484375, "epoch": 2.343615257048093, "grad_norm": 3.464829921722412, "learning_rate": 6.105366244612939e-07, "loss": 1.6397, "mean_token_accuracy": 0.5915174454450607, "num_tokens": 38253819.0, "step": 10600 }, { "entropy": 1.662109375, "epoch": 2.3458264234383637, "grad_norm": 4.028199195861816, "learning_rate": 6.066068667140909e-07, "loss": 1.6548, "mean_token_accuracy": 0.5891728222370147, "num_tokens": 38290928.0, "step": 10610 }, { "entropy": 1.646875, "epoch": 2.3480375898286345, "grad_norm": 2.417612075805664, "learning_rate": 6.026880499316179e-07, "loss": 1.6395, "mean_token_accuracy": 0.5925948709249497, "num_tokens": 38326906.0, "step": 10620 }, { "entropy": 1.648828125, "epoch": 2.3502487562189054, "grad_norm": 3.740410804748535, "learning_rate": 5.98780196758745e-07, "loss": 1.6254, "mean_token_accuracy": 0.5938886612653732, "num_tokens": 38361724.0, "step": 10630 }, { "entropy": 1.6625, "epoch": 2.3524599226091762, "grad_norm": 4.287269592285156, "learning_rate": 5.948833297769843e-07, "loss": 1.6733, "mean_token_accuracy": 0.5877776056528091, "num_tokens": 38399707.0, "step": 10640 }, { "entropy": 1.621484375, "epoch": 2.354671088999447, "grad_norm": 4.122889041900635, "learning_rate": 5.909974715043676e-07, "loss": 1.6029, "mean_token_accuracy": 0.598813870549202, "num_tokens": 38437196.0, "step": 10650 }, { "entropy": 1.67421875, "epoch": 2.356882255389718, "grad_norm": 4.526904106140137, "learning_rate": 5.87122644395309e-07, "loss": 1.6505, "mean_token_accuracy": 0.5907502412796021, "num_tokens": 38471316.0, "step": 10660 }, { "entropy": 1.66640625, "epoch": 2.359093421779989, "grad_norm": 4.458926200866699, "learning_rate": 5.832588708404851e-07, "loss": 1.676, "mean_token_accuracy": 0.5830943793058395, "num_tokens": 38505648.0, "step": 10670 }, { "entropy": 1.6828125, "epoch": 2.3613045881702597, "grad_norm": 3.751084566116333, "learning_rate": 5.794061731666936e-07, "loss": 1.6746, "mean_token_accuracy": 0.5852399677038193, "num_tokens": 38543739.0, "step": 10680 }, { "entropy": 1.675, "epoch": 2.3635157545605305, "grad_norm": 3.6415445804595947, "learning_rate": 5.755645736367338e-07, "loss": 1.6409, "mean_token_accuracy": 0.5872159093618393, "num_tokens": 38578087.0, "step": 10690 }, { "entropy": 1.683984375, "epoch": 2.3657269209508014, "grad_norm": 3.881847858428955, "learning_rate": 5.717340944492727e-07, "loss": 1.6689, "mean_token_accuracy": 0.5817341655492783, "num_tokens": 38612339.0, "step": 10700 }, { "entropy": 1.683203125, "epoch": 2.3679380873410723, "grad_norm": 4.006392955780029, "learning_rate": 5.679147577387206e-07, "loss": 1.6656, "mean_token_accuracy": 0.5869998097419739, "num_tokens": 38650965.0, "step": 10710 }, { "entropy": 1.653515625, "epoch": 2.370149253731343, "grad_norm": 3.6738076210021973, "learning_rate": 5.64106585575098e-07, "loss": 1.6204, "mean_token_accuracy": 0.5924384534358978, "num_tokens": 38686593.0, "step": 10720 }, { "entropy": 1.659375, "epoch": 2.372360420121614, "grad_norm": 3.932408332824707, "learning_rate": 5.60309599963913e-07, "loss": 1.6477, "mean_token_accuracy": 0.5905351161956787, "num_tokens": 38722229.0, "step": 10730 }, { "entropy": 1.6640625, "epoch": 2.374571586511885, "grad_norm": 3.4699652194976807, "learning_rate": 5.565238228460324e-07, "loss": 1.6284, "mean_token_accuracy": 0.5913682550191879, "num_tokens": 38757485.0, "step": 10740 }, { "entropy": 1.650390625, "epoch": 2.376782752902156, "grad_norm": 3.4888837337493896, "learning_rate": 5.527492760975547e-07, "loss": 1.6276, "mean_token_accuracy": 0.5937826752662658, "num_tokens": 38794335.0, "step": 10750 }, { "entropy": 1.624609375, "epoch": 2.3789939192924265, "grad_norm": 4.228898525238037, "learning_rate": 5.489859815296819e-07, "loss": 1.6229, "mean_token_accuracy": 0.5922769755125046, "num_tokens": 38829879.0, "step": 10760 }, { "entropy": 1.67265625, "epoch": 2.381205085682698, "grad_norm": 4.4233012199401855, "learning_rate": 5.452339608885978e-07, "loss": 1.6646, "mean_token_accuracy": 0.5852960675954819, "num_tokens": 38866394.0, "step": 10770 }, { "entropy": 1.645703125, "epoch": 2.3834162520729683, "grad_norm": 3.4468111991882324, "learning_rate": 5.414932358553388e-07, "loss": 1.6771, "mean_token_accuracy": 0.5843212157487869, "num_tokens": 38902928.0, "step": 10780 }, { "entropy": 1.61796875, "epoch": 2.3856274184632396, "grad_norm": 3.6829450130462646, "learning_rate": 5.377638280456701e-07, "loss": 1.6092, "mean_token_accuracy": 0.5973028689622879, "num_tokens": 38938536.0, "step": 10790 }, { "entropy": 1.68359375, "epoch": 2.3878385848535104, "grad_norm": 4.310695648193359, "learning_rate": 5.340457590099587e-07, "loss": 1.6551, "mean_token_accuracy": 0.5871124714612961, "num_tokens": 38972733.0, "step": 10800 }, { "entropy": 1.6875, "epoch": 2.3900497512437813, "grad_norm": 4.016414165496826, "learning_rate": 5.303390502330525e-07, "loss": 1.693, "mean_token_accuracy": 0.5798867374658585, "num_tokens": 39007685.0, "step": 10810 }, { "entropy": 1.63515625, "epoch": 2.392260917634052, "grad_norm": 3.880418300628662, "learning_rate": 5.266437231341537e-07, "loss": 1.6335, "mean_token_accuracy": 0.5903711318969727, "num_tokens": 39042124.0, "step": 10820 }, { "entropy": 1.691796875, "epoch": 2.394472084024323, "grad_norm": 3.4255521297454834, "learning_rate": 5.229597990666957e-07, "loss": 1.7028, "mean_token_accuracy": 0.5805467665195465, "num_tokens": 39079218.0, "step": 10830 }, { "entropy": 1.684765625, "epoch": 2.396683250414594, "grad_norm": 4.014716148376465, "learning_rate": 5.192872993182182e-07, "loss": 1.6658, "mean_token_accuracy": 0.5832873821258545, "num_tokens": 39115158.0, "step": 10840 }, { "entropy": 1.679296875, "epoch": 2.3988944168048647, "grad_norm": 4.473108768463135, "learning_rate": 5.156262451102467e-07, "loss": 1.6703, "mean_token_accuracy": 0.5828846603631973, "num_tokens": 39151839.0, "step": 10850 }, { "entropy": 1.655859375, "epoch": 2.4011055831951356, "grad_norm": 4.2684760093688965, "learning_rate": 5.119766575981688e-07, "loss": 1.6517, "mean_token_accuracy": 0.5864876806735992, "num_tokens": 39189825.0, "step": 10860 }, { "entropy": 1.653125, "epoch": 2.4033167495854064, "grad_norm": 2.9997897148132324, "learning_rate": 5.083385578711119e-07, "loss": 1.6116, "mean_token_accuracy": 0.5985949277877808, "num_tokens": 39226556.0, "step": 10870 }, { "entropy": 1.68359375, "epoch": 2.4055279159756773, "grad_norm": 4.303988456726074, "learning_rate": 5.047119669518199e-07, "loss": 1.6771, "mean_token_accuracy": 0.584500515460968, "num_tokens": 39263437.0, "step": 10880 }, { "entropy": 1.689453125, "epoch": 2.407739082365948, "grad_norm": 3.5498876571655273, "learning_rate": 5.010969057965345e-07, "loss": 1.6894, "mean_token_accuracy": 0.5823587834835052, "num_tokens": 39301329.0, "step": 10890 }, { "entropy": 1.673046875, "epoch": 2.409950248756219, "grad_norm": 3.913151979446411, "learning_rate": 4.97493395294873e-07, "loss": 1.6741, "mean_token_accuracy": 0.583511883020401, "num_tokens": 39336663.0, "step": 10900 }, { "entropy": 1.680078125, "epoch": 2.41216141514649, "grad_norm": 3.7701663970947266, "learning_rate": 4.939014562697044e-07, "loss": 1.6512, "mean_token_accuracy": 0.5862707227468491, "num_tokens": 39373724.0, "step": 10910 }, { "entropy": 1.696875, "epoch": 2.4143725815367607, "grad_norm": 4.002053737640381, "learning_rate": 4.903211094770371e-07, "loss": 1.7021, "mean_token_accuracy": 0.5828726023435593, "num_tokens": 39411475.0, "step": 10920 }, { "entropy": 1.64296875, "epoch": 2.4165837479270316, "grad_norm": 4.275795936584473, "learning_rate": 4.867523756058887e-07, "loss": 1.6565, "mean_token_accuracy": 0.5852976709604263, "num_tokens": 39446577.0, "step": 10930 }, { "entropy": 1.69375, "epoch": 2.4187949143173024, "grad_norm": 3.6176841259002686, "learning_rate": 4.831952752781751e-07, "loss": 1.7209, "mean_token_accuracy": 0.5795985788106919, "num_tokens": 39479749.0, "step": 10940 }, { "entropy": 1.62265625, "epoch": 2.4210060807075733, "grad_norm": 4.351016998291016, "learning_rate": 4.796498290485846e-07, "loss": 1.616, "mean_token_accuracy": 0.6004918307065964, "num_tokens": 39515645.0, "step": 10950 }, { "entropy": 1.644921875, "epoch": 2.423217247097844, "grad_norm": 4.595334529876709, "learning_rate": 4.7611605740446707e-07, "loss": 1.6236, "mean_token_accuracy": 0.5942845910787582, "num_tokens": 39551581.0, "step": 10960 }, { "entropy": 1.640234375, "epoch": 2.425428413488115, "grad_norm": 4.1810808181762695, "learning_rate": 4.725939807657054e-07, "loss": 1.6257, "mean_token_accuracy": 0.5940275967121125, "num_tokens": 39587731.0, "step": 10970 }, { "entropy": 1.688671875, "epoch": 2.427639579878386, "grad_norm": 3.4906792640686035, "learning_rate": 4.690836194846071e-07, "loss": 1.6692, "mean_token_accuracy": 0.5860633373260498, "num_tokens": 39627086.0, "step": 10980 }, { "entropy": 1.692578125, "epoch": 2.4298507462686567, "grad_norm": 4.0736083984375, "learning_rate": 4.655849938457793e-07, "loss": 1.6997, "mean_token_accuracy": 0.5831152558326721, "num_tokens": 39664628.0, "step": 10990 }, { "entropy": 1.68203125, "epoch": 2.4320619126589276, "grad_norm": 4.641111373901367, "learning_rate": 4.6209812406601855e-07, "loss": 1.6833, "mean_token_accuracy": 0.583993273973465, "num_tokens": 39701510.0, "step": 11000 }, { "epoch": 2.4320619126589276, "eval_entropy": 1.68662157960199, "eval_loss": 1.782144546508789, "eval_mean_token_accuracy": 0.5668732436142158, "eval_num_tokens": 39701510.0, "eval_runtime": 112.3071, "eval_samples_per_second": 143.179, "eval_steps_per_second": 8.949, "step": 11000 }, { "entropy": 1.673046875, "epoch": 2.4342730790491984, "grad_norm": 4.4318013191223145, "learning_rate": 4.586230302941866e-07, "loss": 1.6719, "mean_token_accuracy": 0.5887830674648284, "num_tokens": 39737622.0, "step": 11010 }, { "entropy": 1.654296875, "epoch": 2.4364842454394693, "grad_norm": 4.570435523986816, "learning_rate": 4.551597326110993e-07, "loss": 1.6249, "mean_token_accuracy": 0.5958606690168381, "num_tokens": 39773361.0, "step": 11020 }, { "entropy": 1.64765625, "epoch": 2.43869541182974, "grad_norm": 3.7941668033599854, "learning_rate": 4.517082510294088e-07, "loss": 1.6505, "mean_token_accuracy": 0.5901256650686264, "num_tokens": 39812525.0, "step": 11030 }, { "entropy": 1.657421875, "epoch": 2.440906578220011, "grad_norm": 3.4180266857147217, "learning_rate": 4.4826860549348843e-07, "loss": 1.6593, "mean_token_accuracy": 0.5855771720409393, "num_tokens": 39848879.0, "step": 11040 }, { "entropy": 1.642578125, "epoch": 2.443117744610282, "grad_norm": 3.9395036697387695, "learning_rate": 4.4484081587931496e-07, "loss": 1.6353, "mean_token_accuracy": 0.592729240655899, "num_tokens": 39885789.0, "step": 11050 }, { "entropy": 1.62109375, "epoch": 2.4453289110005527, "grad_norm": 3.884824275970459, "learning_rate": 4.414249019943576e-07, "loss": 1.624, "mean_token_accuracy": 0.5960972249507904, "num_tokens": 39919422.0, "step": 11060 }, { "entropy": 1.637109375, "epoch": 2.4475400773908236, "grad_norm": 3.91243052482605, "learning_rate": 4.3802088357746156e-07, "loss": 1.6122, "mean_token_accuracy": 0.6005002468824386, "num_tokens": 39955924.0, "step": 11070 }, { "entropy": 1.673828125, "epoch": 2.4497512437810944, "grad_norm": 3.5646939277648926, "learning_rate": 4.346287802987342e-07, "loss": 1.6758, "mean_token_accuracy": 0.5837758392095566, "num_tokens": 39990995.0, "step": 11080 }, { "entropy": 1.66171875, "epoch": 2.4519624101713653, "grad_norm": 4.234783172607422, "learning_rate": 4.312486117594297e-07, "loss": 1.6553, "mean_token_accuracy": 0.587647208571434, "num_tokens": 40026310.0, "step": 11090 }, { "entropy": 1.693359375, "epoch": 2.454173576561636, "grad_norm": 3.986737012863159, "learning_rate": 4.278803974918394e-07, "loss": 1.6842, "mean_token_accuracy": 0.5804200619459152, "num_tokens": 40063477.0, "step": 11100 }, { "entropy": 1.675, "epoch": 2.456384742951907, "grad_norm": 4.200352191925049, "learning_rate": 4.245241569591757e-07, "loss": 1.6457, "mean_token_accuracy": 0.5833163380622863, "num_tokens": 40099246.0, "step": 11110 }, { "entropy": 1.65390625, "epoch": 2.458595909342178, "grad_norm": 3.4477579593658447, "learning_rate": 4.211799095554625e-07, "loss": 1.6475, "mean_token_accuracy": 0.5924760580062867, "num_tokens": 40135802.0, "step": 11120 }, { "entropy": 1.631640625, "epoch": 2.4608070757324487, "grad_norm": 3.6972849369049072, "learning_rate": 4.178476746054183e-07, "loss": 1.6125, "mean_token_accuracy": 0.5977048069238663, "num_tokens": 40171195.0, "step": 11130 }, { "entropy": 1.61640625, "epoch": 2.4630182421227196, "grad_norm": 3.797767162322998, "learning_rate": 4.1452747136435046e-07, "loss": 1.5945, "mean_token_accuracy": 0.6000763028860092, "num_tokens": 40207987.0, "step": 11140 }, { "entropy": 1.61953125, "epoch": 2.4652294085129904, "grad_norm": 3.648907423019409, "learning_rate": 4.112193190180411e-07, "loss": 1.6253, "mean_token_accuracy": 0.5947603017091752, "num_tokens": 40245040.0, "step": 11150 }, { "entropy": 1.636328125, "epoch": 2.4674405749032613, "grad_norm": 3.84521746635437, "learning_rate": 4.0792323668263386e-07, "loss": 1.6204, "mean_token_accuracy": 0.5967138200998306, "num_tokens": 40284404.0, "step": 11160 }, { "entropy": 1.64609375, "epoch": 2.469651741293532, "grad_norm": 4.296773910522461, "learning_rate": 4.0463924340452823e-07, "loss": 1.6531, "mean_token_accuracy": 0.5871505975723267, "num_tokens": 40323282.0, "step": 11170 }, { "entropy": 1.65078125, "epoch": 2.471862907683803, "grad_norm": 4.122213363647461, "learning_rate": 4.0136735816026647e-07, "loss": 1.6599, "mean_token_accuracy": 0.5925206571817399, "num_tokens": 40359470.0, "step": 11180 }, { "entropy": 1.66015625, "epoch": 2.474074074074074, "grad_norm": 4.381568908691406, "learning_rate": 3.9810759985642515e-07, "loss": 1.6343, "mean_token_accuracy": 0.589119839668274, "num_tokens": 40392914.0, "step": 11190 }, { "entropy": 1.684765625, "epoch": 2.476285240464345, "grad_norm": 3.09333872795105, "learning_rate": 3.9485998732950337e-07, "loss": 1.6642, "mean_token_accuracy": 0.5876926869153977, "num_tokens": 40426475.0, "step": 11200 }, { "entropy": 1.63828125, "epoch": 2.4784964068546156, "grad_norm": 4.326834678649902, "learning_rate": 3.916245393458179e-07, "loss": 1.6549, "mean_token_accuracy": 0.5913239270448685, "num_tokens": 40462700.0, "step": 11210 }, { "entropy": 1.6328125, "epoch": 2.480707573244887, "grad_norm": 3.9191200733184814, "learning_rate": 3.8840127460139236e-07, "loss": 1.6188, "mean_token_accuracy": 0.6030291736125946, "num_tokens": 40498591.0, "step": 11220 }, { "entropy": 1.665625, "epoch": 2.4829187396351573, "grad_norm": 4.370935440063477, "learning_rate": 3.851902117218495e-07, "loss": 1.6966, "mean_token_accuracy": 0.5864339500665665, "num_tokens": 40534387.0, "step": 11230 }, { "entropy": 1.665625, "epoch": 2.4851299060254286, "grad_norm": 4.236398696899414, "learning_rate": 3.81991369262302e-07, "loss": 1.6336, "mean_token_accuracy": 0.5926491796970368, "num_tokens": 40571011.0, "step": 11240 }, { "entropy": 1.6359375, "epoch": 2.4873410724156995, "grad_norm": 4.349100589752197, "learning_rate": 3.7880476570725076e-07, "loss": 1.6002, "mean_token_accuracy": 0.5975788712501526, "num_tokens": 40604692.0, "step": 11250 }, { "entropy": 1.64375, "epoch": 2.4895522388059703, "grad_norm": 3.7533280849456787, "learning_rate": 3.756304194704699e-07, "loss": 1.6296, "mean_token_accuracy": 0.5908368676900864, "num_tokens": 40640167.0, "step": 11260 }, { "entropy": 1.653125, "epoch": 2.491763405196241, "grad_norm": 3.869410514831543, "learning_rate": 3.72468348894908e-07, "loss": 1.6329, "mean_token_accuracy": 0.5920696198940277, "num_tokens": 40678048.0, "step": 11270 }, { "entropy": 1.6625, "epoch": 2.493974571586512, "grad_norm": 3.747925281524658, "learning_rate": 3.6931857225257494e-07, "loss": 1.6725, "mean_token_accuracy": 0.5914702832698822, "num_tokens": 40715519.0, "step": 11280 }, { "entropy": 1.6515625, "epoch": 2.496185737976783, "grad_norm": 4.1814985275268555, "learning_rate": 3.661811077444458e-07, "loss": 1.6317, "mean_token_accuracy": 0.5937252074480057, "num_tokens": 40753136.0, "step": 11290 }, { "entropy": 1.653515625, "epoch": 2.4983969043670538, "grad_norm": 3.890594005584717, "learning_rate": 3.6305597350034445e-07, "loss": 1.6382, "mean_token_accuracy": 0.5907213807106018, "num_tokens": 40787825.0, "step": 11300 }, { "entropy": 1.66875, "epoch": 2.5006080707573246, "grad_norm": 3.665424346923828, "learning_rate": 3.599431875788484e-07, "loss": 1.6983, "mean_token_accuracy": 0.582234850525856, "num_tokens": 40821610.0, "step": 11310 }, { "entropy": 1.623046875, "epoch": 2.5028192371475955, "grad_norm": 4.094082832336426, "learning_rate": 3.568427679671765e-07, "loss": 1.6147, "mean_token_accuracy": 0.5944758832454682, "num_tokens": 40856556.0, "step": 11320 }, { "entropy": 1.644921875, "epoch": 2.5050304035378663, "grad_norm": 3.930649757385254, "learning_rate": 3.5375473258109416e-07, "loss": 1.6401, "mean_token_accuracy": 0.5941253125667572, "num_tokens": 40892125.0, "step": 11330 }, { "entropy": 1.6296875, "epoch": 2.507241569928137, "grad_norm": 3.513338327407837, "learning_rate": 3.506790992647993e-07, "loss": 1.6412, "mean_token_accuracy": 0.5925517469644547, "num_tokens": 40928504.0, "step": 11340 }, { "entropy": 1.629296875, "epoch": 2.509452736318408, "grad_norm": 2.7860162258148193, "learning_rate": 3.4761588579082796e-07, "loss": 1.6071, "mean_token_accuracy": 0.5959939241409302, "num_tokens": 40962009.0, "step": 11350 }, { "entropy": 1.608984375, "epoch": 2.511663902708679, "grad_norm": 4.404608249664307, "learning_rate": 3.445651098599467e-07, "loss": 1.6182, "mean_token_accuracy": 0.5953892201185227, "num_tokens": 40995856.0, "step": 11360 }, { "entropy": 1.643359375, "epoch": 2.5138750690989498, "grad_norm": 4.417123317718506, "learning_rate": 3.415267891010529e-07, "loss": 1.6105, "mean_token_accuracy": 0.6029132634401322, "num_tokens": 41031103.0, "step": 11370 }, { "entropy": 1.628515625, "epoch": 2.5160862354892206, "grad_norm": 3.855990171432495, "learning_rate": 3.385009410710699e-07, "loss": 1.6024, "mean_token_accuracy": 0.5980090707540512, "num_tokens": 41066473.0, "step": 11380 }, { "entropy": 1.655859375, "epoch": 2.5182974018794915, "grad_norm": 4.439486026763916, "learning_rate": 3.354875832548493e-07, "loss": 1.6794, "mean_token_accuracy": 0.584595263004303, "num_tokens": 41101878.0, "step": 11390 }, { "entropy": 1.60546875, "epoch": 2.5205085682697623, "grad_norm": 4.2726311683654785, "learning_rate": 3.3248673306506774e-07, "loss": 1.6035, "mean_token_accuracy": 0.5966331869363785, "num_tokens": 41138969.0, "step": 11400 }, { "entropy": 1.625390625, "epoch": 2.522719734660033, "grad_norm": 3.883124351501465, "learning_rate": 3.2949840784212484e-07, "loss": 1.6244, "mean_token_accuracy": 0.598982748389244, "num_tokens": 41174283.0, "step": 11410 }, { "entropy": 1.673046875, "epoch": 2.524930901050304, "grad_norm": 4.158418655395508, "learning_rate": 3.265226248540468e-07, "loss": 1.6679, "mean_token_accuracy": 0.58449387550354, "num_tokens": 41212002.0, "step": 11420 }, { "entropy": 1.659375, "epoch": 2.527142067440575, "grad_norm": 3.858161211013794, "learning_rate": 3.2355940129638415e-07, "loss": 1.643, "mean_token_accuracy": 0.5941768139600754, "num_tokens": 41252448.0, "step": 11430 }, { "entropy": 1.6140625, "epoch": 2.5293532338308458, "grad_norm": 4.309246063232422, "learning_rate": 3.206087542921127e-07, "loss": 1.5998, "mean_token_accuracy": 0.5998376339673996, "num_tokens": 41290559.0, "step": 11440 }, { "entropy": 1.633984375, "epoch": 2.5315644002211166, "grad_norm": 4.083694934844971, "learning_rate": 3.1767070089153337e-07, "loss": 1.5971, "mean_token_accuracy": 0.5980282872915268, "num_tokens": 41325509.0, "step": 11450 }, { "entropy": 1.694921875, "epoch": 2.5337755666113875, "grad_norm": 4.562839984893799, "learning_rate": 3.147452580721766e-07, "loss": 1.6945, "mean_token_accuracy": 0.5868044406175613, "num_tokens": 41365340.0, "step": 11460 }, { "entropy": 1.63671875, "epoch": 2.5359867330016583, "grad_norm": 3.7756259441375732, "learning_rate": 3.118324427387026e-07, "loss": 1.6357, "mean_token_accuracy": 0.590502867102623, "num_tokens": 41401290.0, "step": 11470 }, { "entropy": 1.665625, "epoch": 2.538197899391929, "grad_norm": 5.907230377197266, "learning_rate": 3.0893227172280353e-07, "loss": 1.686, "mean_token_accuracy": 0.5850258499383927, "num_tokens": 41437932.0, "step": 11480 }, { "entropy": 1.67421875, "epoch": 2.5404090657822, "grad_norm": 3.787842035293579, "learning_rate": 3.06044761783105e-07, "loss": 1.6637, "mean_token_accuracy": 0.5862620085477829, "num_tokens": 41474170.0, "step": 11490 }, { "entropy": 1.63984375, "epoch": 2.542620232172471, "grad_norm": 3.9197394847869873, "learning_rate": 3.031699296050722e-07, "loss": 1.6318, "mean_token_accuracy": 0.5988325715065003, "num_tokens": 41506136.0, "step": 11500 }, { "epoch": 2.542620232172471, "eval_entropy": 1.691876554726368, "eval_loss": 1.7791978120803833, "eval_mean_token_accuracy": 0.5673433519121426, "eval_num_tokens": 41506136.0, "eval_runtime": 112.058, "eval_samples_per_second": 143.497, "eval_steps_per_second": 8.969, "step": 11500 }, { "entropy": 1.64453125, "epoch": 2.5448313985627418, "grad_norm": 3.325420618057251, "learning_rate": 3.0030779180091174e-07, "loss": 1.6229, "mean_token_accuracy": 0.5960267364978791, "num_tokens": 41544572.0, "step": 11510 }, { "entropy": 1.6515625, "epoch": 2.5470425649530126, "grad_norm": 3.9773294925689697, "learning_rate": 2.9745836490947586e-07, "loss": 1.644, "mean_token_accuracy": 0.5893475592136384, "num_tokens": 41579364.0, "step": 11520 }, { "entropy": 1.676953125, "epoch": 2.5492537313432835, "grad_norm": 3.745245933532715, "learning_rate": 2.9462166539616586e-07, "loss": 1.6854, "mean_token_accuracy": 0.5900467276573181, "num_tokens": 41616295.0, "step": 11530 }, { "entropy": 1.66875, "epoch": 2.5514648977335543, "grad_norm": 3.358013153076172, "learning_rate": 2.9179770965283906e-07, "loss": 1.6337, "mean_token_accuracy": 0.5917086154222488, "num_tokens": 41652832.0, "step": 11540 }, { "entropy": 1.674609375, "epoch": 2.553676064123825, "grad_norm": 4.3461079597473145, "learning_rate": 2.889865139977127e-07, "loss": 1.6558, "mean_token_accuracy": 0.5890581399202347, "num_tokens": 41690388.0, "step": 11550 }, { "entropy": 1.6375, "epoch": 2.555887230514096, "grad_norm": 4.097951412200928, "learning_rate": 2.861880946752699e-07, "loss": 1.6259, "mean_token_accuracy": 0.5965524911880493, "num_tokens": 41727542.0, "step": 11560 }, { "entropy": 1.66796875, "epoch": 2.558098396904367, "grad_norm": 2.864159345626831, "learning_rate": 2.834024678561642e-07, "loss": 1.6937, "mean_token_accuracy": 0.5841955184936524, "num_tokens": 41765056.0, "step": 11570 }, { "entropy": 1.6625, "epoch": 2.5603095632946378, "grad_norm": 4.250892639160156, "learning_rate": 2.8062964963713134e-07, "loss": 1.6582, "mean_token_accuracy": 0.5865849316120147, "num_tokens": 41800725.0, "step": 11580 }, { "entropy": 1.65625, "epoch": 2.5625207296849086, "grad_norm": 3.8060455322265625, "learning_rate": 2.778696560408889e-07, "loss": 1.6512, "mean_token_accuracy": 0.5866000831127167, "num_tokens": 41835591.0, "step": 11590 }, { "entropy": 1.6609375, "epoch": 2.5647318960751795, "grad_norm": 3.922635555267334, "learning_rate": 2.751225030160501e-07, "loss": 1.6551, "mean_token_accuracy": 0.5843694716691971, "num_tokens": 41870454.0, "step": 11600 }, { "entropy": 1.61640625, "epoch": 2.566943062465451, "grad_norm": 4.644700050354004, "learning_rate": 2.723882064370259e-07, "loss": 1.5866, "mean_token_accuracy": 0.5961883842945099, "num_tokens": 41907396.0, "step": 11610 }, { "entropy": 1.60078125, "epoch": 2.569154228855721, "grad_norm": 4.0675554275512695, "learning_rate": 2.696667821039406e-07, "loss": 1.5822, "mean_token_accuracy": 0.6026701629161835, "num_tokens": 41942744.0, "step": 11620 }, { "entropy": 1.646875, "epoch": 2.5713653952459925, "grad_norm": 4.183914661407471, "learning_rate": 2.6695824574253236e-07, "loss": 1.6639, "mean_token_accuracy": 0.5853926092386246, "num_tokens": 41979041.0, "step": 11630 }, { "entropy": 1.708984375, "epoch": 2.573576561636263, "grad_norm": 3.463205337524414, "learning_rate": 2.6426261300406874e-07, "loss": 1.7118, "mean_token_accuracy": 0.578419703245163, "num_tokens": 42014573.0, "step": 11640 }, { "entropy": 1.657421875, "epoch": 2.575787728026534, "grad_norm": 4.563073635101318, "learning_rate": 2.6157989946525216e-07, "loss": 1.647, "mean_token_accuracy": 0.588895371556282, "num_tokens": 42051088.0, "step": 11650 }, { "entropy": 1.675390625, "epoch": 2.5779988944168046, "grad_norm": 4.019829750061035, "learning_rate": 2.589101206281322e-07, "loss": 1.6799, "mean_token_accuracy": 0.5837547391653061, "num_tokens": 42087009.0, "step": 11660 }, { "entropy": 1.66875, "epoch": 2.580210060807076, "grad_norm": 3.8760251998901367, "learning_rate": 2.5625329192001586e-07, "loss": 1.647, "mean_token_accuracy": 0.5894177109003067, "num_tokens": 42122802.0, "step": 11670 }, { "entropy": 1.66796875, "epoch": 2.5824212271973463, "grad_norm": 4.452449321746826, "learning_rate": 2.536094286933768e-07, "loss": 1.6701, "mean_token_accuracy": 0.5883320778608322, "num_tokens": 42156125.0, "step": 11680 }, { "entropy": 1.65, "epoch": 2.5846323935876176, "grad_norm": 3.0527849197387695, "learning_rate": 2.509785462257691e-07, "loss": 1.6198, "mean_token_accuracy": 0.5950593531131745, "num_tokens": 42193897.0, "step": 11690 }, { "entropy": 1.64609375, "epoch": 2.586843559977888, "grad_norm": 3.8048477172851562, "learning_rate": 2.483606597197358e-07, "loss": 1.644, "mean_token_accuracy": 0.5912558943033218, "num_tokens": 42228972.0, "step": 11700 }, { "entropy": 1.648046875, "epoch": 2.5890547263681594, "grad_norm": 4.222141742706299, "learning_rate": 2.457557843027242e-07, "loss": 1.6473, "mean_token_accuracy": 0.5910660088062286, "num_tokens": 42261947.0, "step": 11710 }, { "entropy": 1.64765625, "epoch": 2.5912658927584302, "grad_norm": 4.439295291900635, "learning_rate": 2.431639350269954e-07, "loss": 1.6806, "mean_token_accuracy": 0.5886007934808731, "num_tokens": 42298856.0, "step": 11720 }, { "entropy": 1.666796875, "epoch": 2.593477059148701, "grad_norm": 3.1303133964538574, "learning_rate": 2.405851268695422e-07, "loss": 1.682, "mean_token_accuracy": 0.5838881015777588, "num_tokens": 42334964.0, "step": 11730 }, { "entropy": 1.668359375, "epoch": 2.595688225538972, "grad_norm": 4.561310291290283, "learning_rate": 2.3801937473199588e-07, "loss": 1.6679, "mean_token_accuracy": 0.5893527656793595, "num_tokens": 42370850.0, "step": 11740 }, { "entropy": 1.6890625, "epoch": 2.597899391929243, "grad_norm": 3.672267198562622, "learning_rate": 2.3546669344054586e-07, "loss": 1.6722, "mean_token_accuracy": 0.5861592411994934, "num_tokens": 42406420.0, "step": 11750 }, { "entropy": 1.6421875, "epoch": 2.6001105583195137, "grad_norm": 5.630838394165039, "learning_rate": 2.3292709774584947e-07, "loss": 1.627, "mean_token_accuracy": 0.5915925651788712, "num_tokens": 42444718.0, "step": 11760 }, { "entropy": 1.629296875, "epoch": 2.6023217247097845, "grad_norm": 3.5556516647338867, "learning_rate": 2.3040060232295242e-07, "loss": 1.6158, "mean_token_accuracy": 0.6013228923082352, "num_tokens": 42483503.0, "step": 11770 }, { "entropy": 1.651171875, "epoch": 2.6045328911000554, "grad_norm": 4.276744365692139, "learning_rate": 2.2788722177119694e-07, "loss": 1.6212, "mean_token_accuracy": 0.5915576994419098, "num_tokens": 42517377.0, "step": 11780 }, { "entropy": 1.6328125, "epoch": 2.6067440574903262, "grad_norm": 3.7926578521728516, "learning_rate": 2.2538697061414373e-07, "loss": 1.6311, "mean_token_accuracy": 0.5958375990390777, "num_tokens": 42553745.0, "step": 11790 }, { "entropy": 1.632421875, "epoch": 2.608955223880597, "grad_norm": 4.424424171447754, "learning_rate": 2.228998632994825e-07, "loss": 1.6299, "mean_token_accuracy": 0.5930960088968277, "num_tokens": 42588314.0, "step": 11800 }, { "entropy": 1.64453125, "epoch": 2.611166390270868, "grad_norm": 4.069036960601807, "learning_rate": 2.204259141989551e-07, "loss": 1.6493, "mean_token_accuracy": 0.5903482645750046, "num_tokens": 42625986.0, "step": 11810 }, { "entropy": 1.642578125, "epoch": 2.613377556661139, "grad_norm": 3.855574131011963, "learning_rate": 2.1796513760826532e-07, "loss": 1.6475, "mean_token_accuracy": 0.590580627322197, "num_tokens": 42660107.0, "step": 11820 }, { "entropy": 1.662109375, "epoch": 2.6155887230514097, "grad_norm": 3.7044780254364014, "learning_rate": 2.1551754774700146e-07, "loss": 1.6544, "mean_token_accuracy": 0.5887376934289932, "num_tokens": 42695786.0, "step": 11830 }, { "entropy": 1.650390625, "epoch": 2.6177998894416805, "grad_norm": 4.269886493682861, "learning_rate": 2.1308315875855135e-07, "loss": 1.6041, "mean_token_accuracy": 0.5957382410764694, "num_tokens": 42731422.0, "step": 11840 }, { "entropy": 1.678125, "epoch": 2.6200110558319514, "grad_norm": 4.39829683303833, "learning_rate": 2.106619847100233e-07, "loss": 1.6529, "mean_token_accuracy": 0.5941168695688248, "num_tokens": 42766298.0, "step": 11850 }, { "entropy": 1.664453125, "epoch": 2.6222222222222222, "grad_norm": 3.6997694969177246, "learning_rate": 2.0825403959216062e-07, "loss": 1.6806, "mean_token_accuracy": 0.5814034909009933, "num_tokens": 42802729.0, "step": 11860 }, { "entropy": 1.654296875, "epoch": 2.624433388612493, "grad_norm": 3.664547920227051, "learning_rate": 2.0585933731926495e-07, "loss": 1.6179, "mean_token_accuracy": 0.590117484331131, "num_tokens": 42837464.0, "step": 11870 }, { "entropy": 1.63984375, "epoch": 2.626644555002764, "grad_norm": 4.441150188446045, "learning_rate": 2.034778917291144e-07, "loss": 1.6284, "mean_token_accuracy": 0.5936590760946274, "num_tokens": 42872291.0, "step": 11880 }, { "entropy": 1.694921875, "epoch": 2.628855721393035, "grad_norm": 4.441260814666748, "learning_rate": 2.0110971658288292e-07, "loss": 1.6821, "mean_token_accuracy": 0.5870131105184555, "num_tokens": 42910306.0, "step": 11890 }, { "entropy": 1.66953125, "epoch": 2.6310668877833057, "grad_norm": 4.090194225311279, "learning_rate": 1.9875482556506064e-07, "loss": 1.6702, "mean_token_accuracy": 0.5843910723924637, "num_tokens": 42946247.0, "step": 11900 }, { "entropy": 1.65234375, "epoch": 2.6332780541735765, "grad_norm": 3.7483279705047607, "learning_rate": 1.9641323228337616e-07, "loss": 1.6721, "mean_token_accuracy": 0.5857365489006042, "num_tokens": 42982125.0, "step": 11910 }, { "entropy": 1.6703125, "epoch": 2.6354892205638474, "grad_norm": 4.430009365081787, "learning_rate": 1.9408495026871727e-07, "loss": 1.6595, "mean_token_accuracy": 0.5897878587245942, "num_tokens": 43017680.0, "step": 11920 }, { "entropy": 1.668359375, "epoch": 2.6377003869541182, "grad_norm": 3.686194658279419, "learning_rate": 1.9176999297505245e-07, "loss": 1.6539, "mean_token_accuracy": 0.5866464406251908, "num_tokens": 43052287.0, "step": 11930 }, { "entropy": 1.709375, "epoch": 2.639911553344389, "grad_norm": 4.046802997589111, "learning_rate": 1.8946837377935289e-07, "loss": 1.7105, "mean_token_accuracy": 0.5801169723272324, "num_tokens": 43089289.0, "step": 11940 }, { "entropy": 1.684765625, "epoch": 2.64212271973466, "grad_norm": 4.522784233093262, "learning_rate": 1.8718010598151591e-07, "loss": 1.6857, "mean_token_accuracy": 0.5842505127191544, "num_tokens": 43125263.0, "step": 11950 }, { "entropy": 1.66015625, "epoch": 2.644333886124931, "grad_norm": 4.03385591506958, "learning_rate": 1.8490520280428885e-07, "loss": 1.6443, "mean_token_accuracy": 0.587689071893692, "num_tokens": 43163929.0, "step": 11960 }, { "entropy": 1.65, "epoch": 2.6465450525152017, "grad_norm": 3.3798513412475586, "learning_rate": 1.8264367739318944e-07, "loss": 1.6324, "mean_token_accuracy": 0.5898526251316071, "num_tokens": 43199581.0, "step": 11970 }, { "entropy": 1.658203125, "epoch": 2.6487562189054725, "grad_norm": 5.216836452484131, "learning_rate": 1.8039554281643418e-07, "loss": 1.6678, "mean_token_accuracy": 0.5914018273353576, "num_tokens": 43234985.0, "step": 11980 }, { "entropy": 1.626953125, "epoch": 2.6509673852957434, "grad_norm": 3.9133737087249756, "learning_rate": 1.7816081206485952e-07, "loss": 1.6176, "mean_token_accuracy": 0.5932684808969497, "num_tokens": 43270661.0, "step": 11990 }, { "entropy": 1.659765625, "epoch": 2.6531785516860142, "grad_norm": 4.12150239944458, "learning_rate": 1.759394980518486e-07, "loss": 1.6545, "mean_token_accuracy": 0.5922661572694778, "num_tokens": 43305600.0, "step": 12000 }, { "epoch": 2.6531785516860142, "eval_entropy": 1.6869869402985074, "eval_loss": 1.7773772478103638, "eval_mean_token_accuracy": 0.5677351055453665, "eval_num_tokens": 43305600.0, "eval_runtime": 112.1299, "eval_samples_per_second": 143.405, "eval_steps_per_second": 8.963, "step": 12000 }, { "entropy": 1.6625, "epoch": 2.655389718076285, "grad_norm": 4.613038063049316, "learning_rate": 1.7373161361325525e-07, "loss": 1.6587, "mean_token_accuracy": 0.591291531920433, "num_tokens": 43341378.0, "step": 12010 }, { "entropy": 1.6203125, "epoch": 2.657600884466556, "grad_norm": 3.7450149059295654, "learning_rate": 1.715371715073308e-07, "loss": 1.5999, "mean_token_accuracy": 0.5970103353261947, "num_tokens": 43375188.0, "step": 12020 }, { "entropy": 1.6546875, "epoch": 2.659812050856827, "grad_norm": 3.7469353675842285, "learning_rate": 1.6935618441465074e-07, "loss": 1.6575, "mean_token_accuracy": 0.593611353635788, "num_tokens": 43408612.0, "step": 12030 }, { "entropy": 1.6625, "epoch": 2.662023217247098, "grad_norm": 4.0776753425598145, "learning_rate": 1.6718866493804052e-07, "loss": 1.6665, "mean_token_accuracy": 0.5865698784589768, "num_tokens": 43443952.0, "step": 12040 }, { "entropy": 1.625, "epoch": 2.6642343836373685, "grad_norm": 4.496905326843262, "learning_rate": 1.6503462560250206e-07, "loss": 1.6184, "mean_token_accuracy": 0.5963836073875427, "num_tokens": 43478977.0, "step": 12050 }, { "entropy": 1.63828125, "epoch": 2.66644555002764, "grad_norm": 4.359302043914795, "learning_rate": 1.6289407885514418e-07, "loss": 1.5993, "mean_token_accuracy": 0.6028230935335159, "num_tokens": 43515079.0, "step": 12060 }, { "entropy": 1.666015625, "epoch": 2.6686567164179102, "grad_norm": 3.340536117553711, "learning_rate": 1.6076703706510682e-07, "loss": 1.6514, "mean_token_accuracy": 0.5904446899890899, "num_tokens": 43552693.0, "step": 12070 }, { "entropy": 1.65859375, "epoch": 2.6708678828081815, "grad_norm": 4.266609191894531, "learning_rate": 1.5865351252349364e-07, "loss": 1.6363, "mean_token_accuracy": 0.5866362571716308, "num_tokens": 43589095.0, "step": 12080 }, { "entropy": 1.679296875, "epoch": 2.673079049198452, "grad_norm": 4.269710540771484, "learning_rate": 1.565535174432961e-07, "loss": 1.6524, "mean_token_accuracy": 0.5864337176084519, "num_tokens": 43626696.0, "step": 12090 }, { "entropy": 1.655078125, "epoch": 2.6752902155887233, "grad_norm": 4.128224849700928, "learning_rate": 1.544670639593293e-07, "loss": 1.636, "mean_token_accuracy": 0.5914372265338897, "num_tokens": 43662894.0, "step": 12100 }, { "entropy": 1.66484375, "epoch": 2.6775013819789937, "grad_norm": 4.019471168518066, "learning_rate": 1.5239416412815566e-07, "loss": 1.6574, "mean_token_accuracy": 0.5923333764076233, "num_tokens": 43698340.0, "step": 12110 }, { "entropy": 1.670703125, "epoch": 2.679712548369265, "grad_norm": 5.685184955596924, "learning_rate": 1.5033482992801884e-07, "loss": 1.6642, "mean_token_accuracy": 0.5900224953889847, "num_tokens": 43735369.0, "step": 12120 }, { "entropy": 1.63984375, "epoch": 2.6819237147595354, "grad_norm": 4.553216934204102, "learning_rate": 1.4828907325877244e-07, "loss": 1.633, "mean_token_accuracy": 0.5952091723680496, "num_tokens": 43771193.0, "step": 12130 }, { "entropy": 1.63203125, "epoch": 2.6841348811498067, "grad_norm": 3.737790822982788, "learning_rate": 1.462569059418148e-07, "loss": 1.6201, "mean_token_accuracy": 0.5992921561002731, "num_tokens": 43807087.0, "step": 12140 }, { "entropy": 1.67109375, "epoch": 2.6863460475400776, "grad_norm": 2.9110357761383057, "learning_rate": 1.442383397200156e-07, "loss": 1.6859, "mean_token_accuracy": 0.5837462931871414, "num_tokens": 43843853.0, "step": 12150 }, { "entropy": 1.684765625, "epoch": 2.6885572139303484, "grad_norm": 3.5840563774108887, "learning_rate": 1.422333862576522e-07, "loss": 1.6783, "mean_token_accuracy": 0.5830057024955749, "num_tokens": 43881075.0, "step": 12160 }, { "entropy": 1.650390625, "epoch": 2.6907683803206193, "grad_norm": 4.5620198249816895, "learning_rate": 1.402420571403401e-07, "loss": 1.6555, "mean_token_accuracy": 0.5861944913864136, "num_tokens": 43916121.0, "step": 12170 }, { "entropy": 1.6703125, "epoch": 2.69297954671089, "grad_norm": 3.6704137325286865, "learning_rate": 1.3826436387496756e-07, "loss": 1.6682, "mean_token_accuracy": 0.5847749203443527, "num_tokens": 43954708.0, "step": 12180 }, { "entropy": 1.666796875, "epoch": 2.695190713101161, "grad_norm": 3.5926811695098877, "learning_rate": 1.3630031788962577e-07, "loss": 1.6345, "mean_token_accuracy": 0.5951758682727813, "num_tokens": 43992279.0, "step": 12190 }, { "entropy": 1.661328125, "epoch": 2.697401879491432, "grad_norm": 4.718471527099609, "learning_rate": 1.3434993053354771e-07, "loss": 1.6428, "mean_token_accuracy": 0.5958007544279098, "num_tokens": 44027255.0, "step": 12200 }, { "entropy": 1.654296875, "epoch": 2.6996130458817027, "grad_norm": 4.397036075592041, "learning_rate": 1.324132130770389e-07, "loss": 1.63, "mean_token_accuracy": 0.5884867519140243, "num_tokens": 44061642.0, "step": 12210 }, { "entropy": 1.6828125, "epoch": 2.7018242122719736, "grad_norm": 3.8298187255859375, "learning_rate": 1.3049017671141334e-07, "loss": 1.6749, "mean_token_accuracy": 0.5822920799255371, "num_tokens": 44097064.0, "step": 12220 }, { "entropy": 1.6375, "epoch": 2.7040353786622444, "grad_norm": 3.9657070636749268, "learning_rate": 1.2858083254892879e-07, "loss": 1.619, "mean_token_accuracy": 0.5879209458827972, "num_tokens": 44135222.0, "step": 12230 }, { "entropy": 1.673046875, "epoch": 2.7062465450525153, "grad_norm": 4.10100793838501, "learning_rate": 1.2668519162272325e-07, "loss": 1.6572, "mean_token_accuracy": 0.5863908469676972, "num_tokens": 44169998.0, "step": 12240 }, { "entropy": 1.658984375, "epoch": 2.708457711442786, "grad_norm": 4.201930046081543, "learning_rate": 1.2480326488675087e-07, "loss": 1.6298, "mean_token_accuracy": 0.5964894026517868, "num_tokens": 44206831.0, "step": 12250 }, { "entropy": 1.640625, "epoch": 2.710668877833057, "grad_norm": 3.0715036392211914, "learning_rate": 1.2293506321571698e-07, "loss": 1.6389, "mean_token_accuracy": 0.5923538848757743, "num_tokens": 44242222.0, "step": 12260 }, { "entropy": 1.668359375, "epoch": 2.712880044223328, "grad_norm": 3.6053807735443115, "learning_rate": 1.2108059740501748e-07, "loss": 1.6613, "mean_token_accuracy": 0.5896725952625275, "num_tokens": 44278481.0, "step": 12270 }, { "entropy": 1.648046875, "epoch": 2.7150912106135987, "grad_norm": 3.9035542011260986, "learning_rate": 1.1923987817067633e-07, "loss": 1.6444, "mean_token_accuracy": 0.5926850855350494, "num_tokens": 44313567.0, "step": 12280 }, { "entropy": 1.62109375, "epoch": 2.7173023770038696, "grad_norm": 4.356287479400635, "learning_rate": 1.1741291614928263e-07, "loss": 1.6009, "mean_token_accuracy": 0.5969807296991348, "num_tokens": 44348854.0, "step": 12290 }, { "entropy": 1.59375, "epoch": 2.7195135433941404, "grad_norm": 3.8566582202911377, "learning_rate": 1.1559972189792795e-07, "loss": 1.5892, "mean_token_accuracy": 0.6005391478538513, "num_tokens": 44383468.0, "step": 12300 }, { "entropy": 1.680859375, "epoch": 2.7217247097844113, "grad_norm": 3.542430877685547, "learning_rate": 1.138003058941492e-07, "loss": 1.6899, "mean_token_accuracy": 0.5803634554147721, "num_tokens": 44424579.0, "step": 12310 }, { "entropy": 1.653515625, "epoch": 2.723935876174682, "grad_norm": 4.312977313995361, "learning_rate": 1.1201467853586389e-07, "loss": 1.6469, "mean_token_accuracy": 0.5940011769533158, "num_tokens": 44460494.0, "step": 12320 }, { "entropy": 1.65703125, "epoch": 2.726147042564953, "grad_norm": 3.786905527114868, "learning_rate": 1.1024285014131358e-07, "loss": 1.642, "mean_token_accuracy": 0.5895095944404602, "num_tokens": 44498211.0, "step": 12330 }, { "entropy": 1.6921875, "epoch": 2.728358208955224, "grad_norm": 4.198472023010254, "learning_rate": 1.0848483094900081e-07, "loss": 1.6897, "mean_token_accuracy": 0.5855895668268204, "num_tokens": 44534684.0, "step": 12340 }, { "entropy": 1.64453125, "epoch": 2.7305693753454947, "grad_norm": 4.131270885467529, "learning_rate": 1.0674063111763277e-07, "loss": 1.636, "mean_token_accuracy": 0.5918486773967743, "num_tokens": 44573388.0, "step": 12350 }, { "entropy": 1.65859375, "epoch": 2.7327805417357656, "grad_norm": 4.199599742889404, "learning_rate": 1.0501026072606113e-07, "loss": 1.6373, "mean_token_accuracy": 0.5888915538787842, "num_tokens": 44611181.0, "step": 12360 }, { "entropy": 1.66328125, "epoch": 2.7349917081260364, "grad_norm": 4.371722221374512, "learning_rate": 1.0329372977322505e-07, "loss": 1.6435, "mean_token_accuracy": 0.5894839525222778, "num_tokens": 44646536.0, "step": 12370 }, { "entropy": 1.629296875, "epoch": 2.7372028745163073, "grad_norm": 4.242416858673096, "learning_rate": 1.0159104817809073e-07, "loss": 1.6121, "mean_token_accuracy": 0.5968893706798554, "num_tokens": 44681378.0, "step": 12380 }, { "entropy": 1.621875, "epoch": 2.739414040906578, "grad_norm": 3.8870904445648193, "learning_rate": 9.990222577959813e-08, "loss": 1.6308, "mean_token_accuracy": 0.5937034785747528, "num_tokens": 44716224.0, "step": 12390 }, { "entropy": 1.675, "epoch": 2.741625207296849, "grad_norm": 3.9863204956054688, "learning_rate": 9.822727233660012e-08, "loss": 1.657, "mean_token_accuracy": 0.589903125166893, "num_tokens": 44753046.0, "step": 12400 }, { "entropy": 1.669140625, "epoch": 2.74383637368712, "grad_norm": 3.3982460498809814, "learning_rate": 9.656619752780899e-08, "loss": 1.6379, "mean_token_accuracy": 0.5860684126615524, "num_tokens": 44788986.0, "step": 12410 }, { "entropy": 1.633984375, "epoch": 2.7460475400773907, "grad_norm": 4.260997295379639, "learning_rate": 9.491901095173783e-08, "loss": 1.6301, "mean_token_accuracy": 0.5988463997840882, "num_tokens": 44822464.0, "step": 12420 }, { "entropy": 1.668359375, "epoch": 2.7482587064676616, "grad_norm": 3.3983500003814697, "learning_rate": 9.32857221266495e-08, "loss": 1.6727, "mean_token_accuracy": 0.5848731249570847, "num_tokens": 44857621.0, "step": 12430 }, { "entropy": 1.594921875, "epoch": 2.7504698728579324, "grad_norm": 4.0810136795043945, "learning_rate": 9.166634049049577e-08, "loss": 1.5767, "mean_token_accuracy": 0.6069340735673905, "num_tokens": 44891626.0, "step": 12440 }, { "entropy": 1.673046875, "epoch": 2.7526810392482033, "grad_norm": 4.646790981292725, "learning_rate": 9.006087540086778e-08, "loss": 1.6866, "mean_token_accuracy": 0.5852156668901444, "num_tokens": 44926683.0, "step": 12450 }, { "entropy": 1.622265625, "epoch": 2.754892205638474, "grad_norm": 4.614007949829102, "learning_rate": 8.846933613493841e-08, "loss": 1.5798, "mean_token_accuracy": 0.6000434070825577, "num_tokens": 44963244.0, "step": 12460 }, { "entropy": 1.637890625, "epoch": 2.757103372028745, "grad_norm": 4.653644561767578, "learning_rate": 8.689173188941163e-08, "loss": 1.6402, "mean_token_accuracy": 0.5912492513656616, "num_tokens": 44998061.0, "step": 12470 }, { "entropy": 1.63671875, "epoch": 2.759314538419016, "grad_norm": 4.4553751945495605, "learning_rate": 8.532807178046693e-08, "loss": 1.6275, "mean_token_accuracy": 0.5926077753305435, "num_tokens": 45034852.0, "step": 12480 }, { "entropy": 1.6484375, "epoch": 2.761525704809287, "grad_norm": 4.357314109802246, "learning_rate": 8.377836484370822e-08, "loss": 1.6389, "mean_token_accuracy": 0.5900608241558075, "num_tokens": 45069533.0, "step": 12490 }, { "entropy": 1.63515625, "epoch": 2.7637368711995576, "grad_norm": 4.152191638946533, "learning_rate": 8.224262003411116e-08, "loss": 1.6137, "mean_token_accuracy": 0.5975213468074798, "num_tokens": 45106057.0, "step": 12500 }, { "epoch": 2.7637368711995576, "eval_entropy": 1.6856576492537314, "eval_loss": 1.7769663333892822, "eval_mean_token_accuracy": 0.5677829944968816, "eval_num_tokens": 45106057.0, "eval_runtime": 112.4855, "eval_samples_per_second": 142.952, "eval_steps_per_second": 8.934, "step": 12500 }, { "entropy": 1.65703125, "epoch": 2.765948037589829, "grad_norm": 4.203451633453369, "learning_rate": 8.072084622597065e-08, "loss": 1.6216, "mean_token_accuracy": 0.5933431446552276, "num_tokens": 45143717.0, "step": 12510 }, { "entropy": 1.651953125, "epoch": 2.7681592039800993, "grad_norm": 3.9696078300476074, "learning_rate": 7.921305221285092e-08, "loss": 1.6629, "mean_token_accuracy": 0.5916117161512375, "num_tokens": 45181204.0, "step": 12520 }, { "entropy": 1.6140625, "epoch": 2.7703703703703706, "grad_norm": 4.628373146057129, "learning_rate": 7.771924670753328e-08, "loss": 1.6001, "mean_token_accuracy": 0.598871698975563, "num_tokens": 45215357.0, "step": 12530 }, { "entropy": 1.66015625, "epoch": 2.772581536760641, "grad_norm": 3.5428171157836914, "learning_rate": 7.62394383419679e-08, "loss": 1.6613, "mean_token_accuracy": 0.5921337991952896, "num_tokens": 45253751.0, "step": 12540 }, { "entropy": 1.619921875, "epoch": 2.7747927031509123, "grad_norm": 3.8824331760406494, "learning_rate": 7.477363566722046e-08, "loss": 1.5975, "mean_token_accuracy": 0.5913000047206879, "num_tokens": 45288975.0, "step": 12550 }, { "entropy": 1.659375, "epoch": 2.7770038695411827, "grad_norm": 3.7930829524993896, "learning_rate": 7.332184715342666e-08, "loss": 1.6671, "mean_token_accuracy": 0.5886818289756774, "num_tokens": 45323496.0, "step": 12560 }, { "entropy": 1.65, "epoch": 2.779215035931454, "grad_norm": 4.109228134155273, "learning_rate": 7.188408118973977e-08, "loss": 1.6319, "mean_token_accuracy": 0.5961740702390671, "num_tokens": 45358903.0, "step": 12570 }, { "entropy": 1.694921875, "epoch": 2.7814262023217244, "grad_norm": 4.043583869934082, "learning_rate": 7.046034608428593e-08, "loss": 1.6807, "mean_token_accuracy": 0.5881491333246232, "num_tokens": 45394476.0, "step": 12580 }, { "entropy": 1.641796875, "epoch": 2.7836373687119957, "grad_norm": 3.6539359092712402, "learning_rate": 6.905065006411194e-08, "loss": 1.6261, "mean_token_accuracy": 0.5926414430141449, "num_tokens": 45432948.0, "step": 12590 }, { "entropy": 1.654296875, "epoch": 2.7858485351022666, "grad_norm": 3.8241515159606934, "learning_rate": 6.765500127514091e-08, "loss": 1.622, "mean_token_accuracy": 0.5961004018783569, "num_tokens": 45468177.0, "step": 12600 }, { "entropy": 1.6234375, "epoch": 2.7880597014925375, "grad_norm": 4.329864501953125, "learning_rate": 6.627340778212393e-08, "loss": 1.6026, "mean_token_accuracy": 0.5971056282520294, "num_tokens": 45502667.0, "step": 12610 }, { "entropy": 1.625, "epoch": 2.7902708678828083, "grad_norm": 3.576049327850342, "learning_rate": 6.490587756859402e-08, "loss": 1.6045, "mean_token_accuracy": 0.6016596853733063, "num_tokens": 45540258.0, "step": 12620 }, { "entropy": 1.6625, "epoch": 2.792482034273079, "grad_norm": 4.135618686676025, "learning_rate": 6.355241853681804e-08, "loss": 1.6468, "mean_token_accuracy": 0.5871924966573715, "num_tokens": 45575682.0, "step": 12630 }, { "entropy": 1.59921875, "epoch": 2.79469320066335, "grad_norm": 4.231292247772217, "learning_rate": 6.221303850775435e-08, "loss": 1.5712, "mean_token_accuracy": 0.6081149846315383, "num_tokens": 45608074.0, "step": 12640 }, { "entropy": 1.635546875, "epoch": 2.796904367053621, "grad_norm": 3.8389456272125244, "learning_rate": 6.088774522100521e-08, "loss": 1.6248, "mean_token_accuracy": 0.5953689396381379, "num_tokens": 45643449.0, "step": 12650 }, { "entropy": 1.684765625, "epoch": 2.7991155334438917, "grad_norm": 3.6036877632141113, "learning_rate": 5.957654633477222e-08, "loss": 1.6988, "mean_token_accuracy": 0.5867615669965744, "num_tokens": 45683711.0, "step": 12660 }, { "entropy": 1.62109375, "epoch": 2.8013266998341626, "grad_norm": 3.5430359840393066, "learning_rate": 5.8279449425813206e-08, "loss": 1.6053, "mean_token_accuracy": 0.6015674382448196, "num_tokens": 45718613.0, "step": 12670 }, { "entropy": 1.65078125, "epoch": 2.8035378662244335, "grad_norm": 4.283117294311523, "learning_rate": 5.699646198939757e-08, "loss": 1.6574, "mean_token_accuracy": 0.5940529137849808, "num_tokens": 45755200.0, "step": 12680 }, { "entropy": 1.6859375, "epoch": 2.8057490326147043, "grad_norm": 3.984330654144287, "learning_rate": 5.572759143926299e-08, "loss": 1.6803, "mean_token_accuracy": 0.5903393387794494, "num_tokens": 45791496.0, "step": 12690 }, { "entropy": 1.633203125, "epoch": 2.807960199004975, "grad_norm": 4.094389915466309, "learning_rate": 5.4472845107573225e-08, "loss": 1.591, "mean_token_accuracy": 0.6019279956817627, "num_tokens": 45826846.0, "step": 12700 }, { "entropy": 1.647265625, "epoch": 2.810171365395246, "grad_norm": 4.031773090362549, "learning_rate": 5.323223024487456e-08, "loss": 1.6308, "mean_token_accuracy": 0.5940986514091492, "num_tokens": 45863980.0, "step": 12710 }, { "entropy": 1.68515625, "epoch": 2.812382531785517, "grad_norm": 3.875953197479248, "learning_rate": 5.2005754020055256e-08, "loss": 1.6813, "mean_token_accuracy": 0.5845620095729828, "num_tokens": 45900029.0, "step": 12720 }, { "entropy": 1.645703125, "epoch": 2.8145936981757878, "grad_norm": 4.181349754333496, "learning_rate": 5.0793423520303364e-08, "loss": 1.6132, "mean_token_accuracy": 0.5952747106552124, "num_tokens": 45934398.0, "step": 12730 }, { "entropy": 1.664453125, "epoch": 2.8168048645660586, "grad_norm": 4.280387878417969, "learning_rate": 4.9595245751065944e-08, "loss": 1.6494, "mean_token_accuracy": 0.5947684556245804, "num_tokens": 45971261.0, "step": 12740 }, { "entropy": 1.678515625, "epoch": 2.8190160309563295, "grad_norm": 4.162785530090332, "learning_rate": 4.841122763600825e-08, "loss": 1.6805, "mean_token_accuracy": 0.5884193539619446, "num_tokens": 46009194.0, "step": 12750 }, { "entropy": 1.6578125, "epoch": 2.8212271973466003, "grad_norm": 3.525569438934326, "learning_rate": 4.724137601697459e-08, "loss": 1.6704, "mean_token_accuracy": 0.5859906315803528, "num_tokens": 46044770.0, "step": 12760 }, { "entropy": 1.662890625, "epoch": 2.823438363736871, "grad_norm": 3.9060959815979004, "learning_rate": 4.6085697653947544e-08, "loss": 1.6512, "mean_token_accuracy": 0.589400264620781, "num_tokens": 46080176.0, "step": 12770 }, { "entropy": 1.645703125, "epoch": 2.825649530127142, "grad_norm": 5.2108354568481445, "learning_rate": 4.4944199225010473e-08, "loss": 1.6165, "mean_token_accuracy": 0.5957522302865982, "num_tokens": 46117409.0, "step": 12780 }, { "entropy": 1.680078125, "epoch": 2.827860696517413, "grad_norm": 4.499181270599365, "learning_rate": 4.381688732630701e-08, "loss": 1.658, "mean_token_accuracy": 0.5859708815813065, "num_tokens": 46151685.0, "step": 12790 }, { "entropy": 1.653125, "epoch": 2.8300718629076838, "grad_norm": 3.033838987350464, "learning_rate": 4.270376847200497e-08, "loss": 1.6113, "mean_token_accuracy": 0.5985817581415176, "num_tokens": 46189800.0, "step": 12800 }, { "entropy": 1.662109375, "epoch": 2.8322830292979546, "grad_norm": 3.553948163986206, "learning_rate": 4.1604849094256935e-08, "loss": 1.6492, "mean_token_accuracy": 0.5918176114559174, "num_tokens": 46223833.0, "step": 12810 }, { "entropy": 1.666015625, "epoch": 2.8344941956882255, "grad_norm": 4.058619022369385, "learning_rate": 4.0520135543163916e-08, "loss": 1.6409, "mean_token_accuracy": 0.5876541346311569, "num_tokens": 46260962.0, "step": 12820 }, { "entropy": 1.665625, "epoch": 2.8367053620784963, "grad_norm": 3.9116175174713135, "learning_rate": 3.9449634086739795e-08, "loss": 1.6189, "mean_token_accuracy": 0.594248577952385, "num_tokens": 46296036.0, "step": 12830 }, { "entropy": 1.634375, "epoch": 2.838916528468767, "grad_norm": 3.964871644973755, "learning_rate": 3.839335091087193e-08, "loss": 1.6274, "mean_token_accuracy": 0.5952156543731689, "num_tokens": 46332958.0, "step": 12840 }, { "entropy": 1.635546875, "epoch": 2.841127694859038, "grad_norm": 3.974292755126953, "learning_rate": 3.7351292119289505e-08, "loss": 1.6088, "mean_token_accuracy": 0.5955435842275619, "num_tokens": 46369980.0, "step": 12850 }, { "entropy": 1.67265625, "epoch": 2.843338861249309, "grad_norm": 4.162252426147461, "learning_rate": 3.6323463733523854e-08, "loss": 1.669, "mean_token_accuracy": 0.5832523167133331, "num_tokens": 46404658.0, "step": 12860 }, { "entropy": 1.644921875, "epoch": 2.8455500276395798, "grad_norm": 3.658139705657959, "learning_rate": 3.530987169287875e-08, "loss": 1.6318, "mean_token_accuracy": 0.5934416443109513, "num_tokens": 46439904.0, "step": 12870 }, { "entropy": 1.630078125, "epoch": 2.8477611940298506, "grad_norm": 4.072232246398926, "learning_rate": 3.431052185439071e-08, "loss": 1.6175, "mean_token_accuracy": 0.5970421642065048, "num_tokens": 46475856.0, "step": 12880 }, { "entropy": 1.647265625, "epoch": 2.8499723604201215, "grad_norm": 3.689831495285034, "learning_rate": 3.332541999279903e-08, "loss": 1.6288, "mean_token_accuracy": 0.5953065752983093, "num_tokens": 46511724.0, "step": 12890 }, { "entropy": 1.677734375, "epoch": 2.8521835268103923, "grad_norm": 3.334261417388916, "learning_rate": 3.2354571800511105e-08, "loss": 1.6656, "mean_token_accuracy": 0.588189747929573, "num_tokens": 46549654.0, "step": 12900 }, { "entropy": 1.6578125, "epoch": 2.854394693200663, "grad_norm": 4.499913692474365, "learning_rate": 3.1397982887569345e-08, "loss": 1.6731, "mean_token_accuracy": 0.5912659883499145, "num_tokens": 46589370.0, "step": 12910 }, { "entropy": 1.680859375, "epoch": 2.8566058595909345, "grad_norm": 4.558979511260986, "learning_rate": 3.045565878161877e-08, "loss": 1.6681, "mean_token_accuracy": 0.5871021389961243, "num_tokens": 46623411.0, "step": 12920 }, { "entropy": 1.6875, "epoch": 2.858817025981205, "grad_norm": 3.9945380687713623, "learning_rate": 2.9527604927875874e-08, "loss": 1.6833, "mean_token_accuracy": 0.5869188904762268, "num_tokens": 46662660.0, "step": 12930 }, { "entropy": 1.67265625, "epoch": 2.861028192371476, "grad_norm": 3.823910713195801, "learning_rate": 2.8613826689095903e-08, "loss": 1.6813, "mean_token_accuracy": 0.5848930209875107, "num_tokens": 46697060.0, "step": 12940 }, { "entropy": 1.610546875, "epoch": 2.8632393587617466, "grad_norm": 4.502660274505615, "learning_rate": 2.7714329345543135e-08, "loss": 1.591, "mean_token_accuracy": 0.6016790419816971, "num_tokens": 46735253.0, "step": 12950 }, { "entropy": 1.67421875, "epoch": 2.865450525152018, "grad_norm": 4.100869655609131, "learning_rate": 2.6829118094958974e-08, "loss": 1.6891, "mean_token_accuracy": 0.5845727652311326, "num_tokens": 46772760.0, "step": 12960 }, { "entropy": 1.712109375, "epoch": 2.8676616915422883, "grad_norm": 3.298762559890747, "learning_rate": 2.595819805253308e-08, "loss": 1.7208, "mean_token_accuracy": 0.5794914022088051, "num_tokens": 46809456.0, "step": 12970 }, { "entropy": 1.646875, "epoch": 2.8698728579325596, "grad_norm": 3.8945202827453613, "learning_rate": 2.510157425087395e-08, "loss": 1.6472, "mean_token_accuracy": 0.5903005033731461, "num_tokens": 46847818.0, "step": 12980 }, { "entropy": 1.65390625, "epoch": 2.87208402432283, "grad_norm": 3.2822165489196777, "learning_rate": 2.4259251639978665e-08, "loss": 1.6206, "mean_token_accuracy": 0.6003502368927002, "num_tokens": 46884012.0, "step": 12990 }, { "entropy": 1.684765625, "epoch": 2.8742951907131014, "grad_norm": 4.310787200927734, "learning_rate": 2.343123508720485e-08, "loss": 1.6841, "mean_token_accuracy": 0.5834894686937332, "num_tokens": 46920861.0, "step": 13000 }, { "epoch": 2.8742951907131014, "eval_entropy": 1.6843672263681593, "eval_loss": 1.7765709161758423, "eval_mean_token_accuracy": 0.5678447590538518, "eval_num_tokens": 46920861.0, "eval_runtime": 112.1224, "eval_samples_per_second": 143.415, "eval_steps_per_second": 8.963, "step": 13000 }, { "entropy": 1.67109375, "epoch": 2.8765063571033718, "grad_norm": 4.378058910369873, "learning_rate": 2.261752937724293e-08, "loss": 1.6659, "mean_token_accuracy": 0.5859705537557602, "num_tokens": 46955649.0, "step": 13010 }, { "entropy": 1.6765625, "epoch": 2.878717523493643, "grad_norm": 3.5847487449645996, "learning_rate": 2.1818139212088363e-08, "loss": 1.6927, "mean_token_accuracy": 0.5852095454931259, "num_tokens": 46992581.0, "step": 13020 }, { "entropy": 1.63359375, "epoch": 2.880928689883914, "grad_norm": 2.975508689880371, "learning_rate": 2.1033069211014167e-08, "loss": 1.6257, "mean_token_accuracy": 0.5969172656536103, "num_tokens": 47027114.0, "step": 13030 }, { "entropy": 1.667578125, "epoch": 2.883139856274185, "grad_norm": 3.6523118019104004, "learning_rate": 2.0262323910543723e-08, "loss": 1.6704, "mean_token_accuracy": 0.583617091178894, "num_tokens": 47060846.0, "step": 13040 }, { "entropy": 1.6375, "epoch": 2.8853510226644556, "grad_norm": 3.7036027908325195, "learning_rate": 1.9505907764426347e-08, "loss": 1.6187, "mean_token_accuracy": 0.597618094086647, "num_tokens": 47095462.0, "step": 13050 }, { "entropy": 1.622265625, "epoch": 2.8875621890547265, "grad_norm": 4.448975563049316, "learning_rate": 1.876382514360925e-08, "loss": 1.6101, "mean_token_accuracy": 0.5962168037891388, "num_tokens": 47132901.0, "step": 13060 }, { "entropy": 1.6109375, "epoch": 2.8897733554449974, "grad_norm": 4.272410869598389, "learning_rate": 1.8036080336213958e-08, "loss": 1.5981, "mean_token_accuracy": 0.598596602678299, "num_tokens": 47166228.0, "step": 13070 }, { "entropy": 1.683203125, "epoch": 2.891984521835268, "grad_norm": 4.762310981750488, "learning_rate": 1.7322677547511048e-08, "loss": 1.6618, "mean_token_accuracy": 0.5840688228607178, "num_tokens": 47201284.0, "step": 13080 }, { "entropy": 1.65625, "epoch": 2.894195688225539, "grad_norm": 4.5530924797058105, "learning_rate": 1.662362089989572e-08, "loss": 1.6603, "mean_token_accuracy": 0.5887762665748596, "num_tokens": 47237129.0, "step": 13090 }, { "entropy": 1.614453125, "epoch": 2.89640685461581, "grad_norm": 3.9602699279785156, "learning_rate": 1.5938914432864217e-08, "loss": 1.6057, "mean_token_accuracy": 0.5984326213598251, "num_tokens": 47274329.0, "step": 13100 }, { "entropy": 1.68046875, "epoch": 2.898618021006081, "grad_norm": 3.732564687728882, "learning_rate": 1.5268562102989937e-08, "loss": 1.6534, "mean_token_accuracy": 0.5857302963733673, "num_tokens": 47309974.0, "step": 13110 }, { "entropy": 1.674609375, "epoch": 2.9008291873963516, "grad_norm": 3.4360592365264893, "learning_rate": 1.4612567783901243e-08, "loss": 1.6716, "mean_token_accuracy": 0.5841006636619568, "num_tokens": 47345006.0, "step": 13120 }, { "entropy": 1.673046875, "epoch": 2.9030403537866225, "grad_norm": 4.229859828948975, "learning_rate": 1.3970935266258701e-08, "loss": 1.6758, "mean_token_accuracy": 0.5876132071018219, "num_tokens": 47382049.0, "step": 13130 }, { "entropy": 1.674609375, "epoch": 2.9052515201768934, "grad_norm": 3.8717739582061768, "learning_rate": 1.3343668257733144e-08, "loss": 1.666, "mean_token_accuracy": 0.5852203458547592, "num_tokens": 47415140.0, "step": 13140 }, { "entropy": 1.67890625, "epoch": 2.9074626865671642, "grad_norm": 4.248335361480713, "learning_rate": 1.2730770382984592e-08, "loss": 1.6653, "mean_token_accuracy": 0.5911050468683243, "num_tokens": 47452187.0, "step": 13150 }, { "entropy": 1.660546875, "epoch": 2.909673852957435, "grad_norm": 3.9126954078674316, "learning_rate": 1.2132245183641145e-08, "loss": 1.6842, "mean_token_accuracy": 0.5871102064847946, "num_tokens": 47487579.0, "step": 13160 }, { "entropy": 1.653125, "epoch": 2.911885019347706, "grad_norm": 4.596493721008301, "learning_rate": 1.1548096118278173e-08, "loss": 1.6321, "mean_token_accuracy": 0.593408852815628, "num_tokens": 47523999.0, "step": 13170 }, { "entropy": 1.614453125, "epoch": 2.914096185737977, "grad_norm": 4.203975200653076, "learning_rate": 1.097832656239889e-08, "loss": 1.5864, "mean_token_accuracy": 0.600899514555931, "num_tokens": 47558332.0, "step": 13180 }, { "entropy": 1.703125, "epoch": 2.9163073521282477, "grad_norm": 4.119178771972656, "learning_rate": 1.0422939808414079e-08, "loss": 1.6952, "mean_token_accuracy": 0.5813955813646317, "num_tokens": 47595215.0, "step": 13190 }, { "entropy": 1.653125, "epoch": 2.9185185185185185, "grad_norm": 3.542818307876587, "learning_rate": 9.881939065624347e-09, "loss": 1.6426, "mean_token_accuracy": 0.5895743757486344, "num_tokens": 47632423.0, "step": 13200 }, { "entropy": 1.64375, "epoch": 2.9207296849087894, "grad_norm": 3.2984488010406494, "learning_rate": 9.355327460199848e-09, "loss": 1.6138, "mean_token_accuracy": 0.5945003718137741, "num_tokens": 47669542.0, "step": 13210 }, { "entropy": 1.701171875, "epoch": 2.9229408512990602, "grad_norm": 4.357846260070801, "learning_rate": 8.843108035163916e-09, "loss": 1.6728, "mean_token_accuracy": 0.5854611814022064, "num_tokens": 47704173.0, "step": 13220 }, { "entropy": 1.63046875, "epoch": 2.925152017689331, "grad_norm": 3.8289992809295654, "learning_rate": 8.345283750374466e-09, "loss": 1.6173, "mean_token_accuracy": 0.5989271193742752, "num_tokens": 47738266.0, "step": 13230 }, { "entropy": 1.65390625, "epoch": 2.927363184079602, "grad_norm": 3.626721143722534, "learning_rate": 7.86185748250734e-09, "loss": 1.6297, "mean_token_accuracy": 0.5958569079637528, "num_tokens": 47774057.0, "step": 13240 }, { "entropy": 1.644921875, "epoch": 2.929574350469873, "grad_norm": 3.820176601409912, "learning_rate": 7.3928320250390986e-09, "loss": 1.619, "mean_token_accuracy": 0.5977859228849411, "num_tokens": 47808903.0, "step": 13250 }, { "entropy": 1.659375, "epoch": 2.9317855168601437, "grad_norm": 3.627906322479248, "learning_rate": 6.938210088231479e-09, "loss": 1.6417, "mean_token_accuracy": 0.5899067997932435, "num_tokens": 47845121.0, "step": 13260 }, { "entropy": 1.6953125, "epoch": 2.9339966832504145, "grad_norm": 4.299013137817383, "learning_rate": 6.497994299115573e-09, "loss": 1.6822, "mean_token_accuracy": 0.5820305347442627, "num_tokens": 47882044.0, "step": 13270 }, { "entropy": 1.63984375, "epoch": 2.9362078496406854, "grad_norm": 3.3737595081329346, "learning_rate": 6.072187201476565e-09, "loss": 1.6175, "mean_token_accuracy": 0.5900583624839782, "num_tokens": 47915960.0, "step": 13280 }, { "entropy": 1.637890625, "epoch": 2.9384190160309562, "grad_norm": 3.6324002742767334, "learning_rate": 5.660791255839293e-09, "loss": 1.6248, "mean_token_accuracy": 0.5937619715929031, "num_tokens": 47953807.0, "step": 13290 }, { "entropy": 1.623828125, "epoch": 2.940630182421227, "grad_norm": 4.5471343994140625, "learning_rate": 5.263808839453266e-09, "loss": 1.6246, "mean_token_accuracy": 0.5999820619821549, "num_tokens": 47989562.0, "step": 13300 }, { "entropy": 1.626953125, "epoch": 2.942841348811498, "grad_norm": 3.731358051300049, "learning_rate": 4.881242246279894e-09, "loss": 1.5846, "mean_token_accuracy": 0.6023639440536499, "num_tokens": 48024924.0, "step": 13310 }, { "entropy": 1.669921875, "epoch": 2.945052515201769, "grad_norm": 4.596261501312256, "learning_rate": 4.5130936869788865e-09, "loss": 1.6598, "mean_token_accuracy": 0.5864508658647537, "num_tokens": 48058837.0, "step": 13320 }, { "entropy": 1.66875, "epoch": 2.9472636815920397, "grad_norm": 3.4455087184906006, "learning_rate": 4.159365288895212e-09, "loss": 1.6695, "mean_token_accuracy": 0.5888384789228439, "num_tokens": 48097411.0, "step": 13330 }, { "entropy": 1.67109375, "epoch": 2.9494748479823105, "grad_norm": 3.738842010498047, "learning_rate": 3.82005909604688e-09, "loss": 1.6704, "mean_token_accuracy": 0.5824524998664856, "num_tokens": 48134805.0, "step": 13340 }, { "entropy": 1.666796875, "epoch": 2.9516860143725814, "grad_norm": 4.094563007354736, "learning_rate": 3.4951770691135646e-09, "loss": 1.6782, "mean_token_accuracy": 0.5807325601577759, "num_tokens": 48171305.0, "step": 13350 }, { "entropy": 1.6546875, "epoch": 2.9538971807628522, "grad_norm": 3.8009655475616455, "learning_rate": 3.184721085424669e-09, "loss": 1.6529, "mean_token_accuracy": 0.5879477769136429, "num_tokens": 48206018.0, "step": 13360 }, { "entropy": 1.67265625, "epoch": 2.9561083471531235, "grad_norm": 4.675745487213135, "learning_rate": 2.8886929389487785e-09, "loss": 1.6819, "mean_token_accuracy": 0.5816639453172684, "num_tokens": 48241366.0, "step": 13370 }, { "entropy": 1.626953125, "epoch": 2.958319513543394, "grad_norm": 4.149998664855957, "learning_rate": 2.6070943402833894e-09, "loss": 1.6416, "mean_token_accuracy": 0.5860764056444168, "num_tokens": 48274825.0, "step": 13380 }, { "entropy": 1.67421875, "epoch": 2.9605306799336653, "grad_norm": 3.5707154273986816, "learning_rate": 2.339926916644919e-09, "loss": 1.6817, "mean_token_accuracy": 0.5837209329009057, "num_tokens": 48309435.0, "step": 13390 }, { "entropy": 1.65625, "epoch": 2.9627418463239357, "grad_norm": 3.853034257888794, "learning_rate": 2.0871922118595457e-09, "loss": 1.6458, "mean_token_accuracy": 0.5935676783323288, "num_tokens": 48345938.0, "step": 13400 }, { "entropy": 1.715625, "epoch": 2.964953012714207, "grad_norm": 4.895432472229004, "learning_rate": 1.8488916863532158e-09, "loss": 1.6985, "mean_token_accuracy": 0.5875573098659516, "num_tokens": 48385394.0, "step": 13410 }, { "entropy": 1.644140625, "epoch": 2.9671641791044774, "grad_norm": 4.060731410980225, "learning_rate": 1.6250267171452616e-09, "loss": 1.6466, "mean_token_accuracy": 0.5939691662788391, "num_tokens": 48422685.0, "step": 13420 }, { "entropy": 1.623828125, "epoch": 2.9693753454947487, "grad_norm": 4.185715675354004, "learning_rate": 1.4155985978378528e-09, "loss": 1.6221, "mean_token_accuracy": 0.5965218156576156, "num_tokens": 48458822.0, "step": 13430 }, { "entropy": 1.629296875, "epoch": 2.971586511885019, "grad_norm": 4.543457508087158, "learning_rate": 1.220608538611001e-09, "loss": 1.6192, "mean_token_accuracy": 0.590055701136589, "num_tokens": 48494480.0, "step": 13440 }, { "entropy": 1.62109375, "epoch": 2.9737976782752904, "grad_norm": 3.783036947250366, "learning_rate": 1.0400576662136785e-09, "loss": 1.6149, "mean_token_accuracy": 0.5959477007389069, "num_tokens": 48530581.0, "step": 13450 }, { "entropy": 1.632421875, "epoch": 2.976008844665561, "grad_norm": 3.462634325027466, "learning_rate": 8.739470239585435e-10, "loss": 1.6192, "mean_token_accuracy": 0.5971563220024109, "num_tokens": 48567743.0, "step": 13460 }, { "entropy": 1.6265625, "epoch": 2.978220011055832, "grad_norm": 3.638840675354004, "learning_rate": 7.222775717152797e-10, "loss": 1.6259, "mean_token_accuracy": 0.5975542217493057, "num_tokens": 48602732.0, "step": 13470 }, { "entropy": 1.62890625, "epoch": 2.980431177446103, "grad_norm": 3.9042389392852783, "learning_rate": 5.850501859053226e-10, "loss": 1.623, "mean_token_accuracy": 0.5939550846815109, "num_tokens": 48637869.0, "step": 13480 }, { "entropy": 1.65859375, "epoch": 2.982642343836374, "grad_norm": 4.407820224761963, "learning_rate": 4.622656594963082e-10, "loss": 1.6407, "mean_token_accuracy": 0.5933983951807023, "num_tokens": 48675870.0, "step": 13490 }, { "entropy": 1.686328125, "epoch": 2.9848535102266447, "grad_norm": 4.5784220695495605, "learning_rate": 3.5392470199846485e-10, "loss": 1.6782, "mean_token_accuracy": 0.586545991897583, "num_tokens": 48713006.0, "step": 13500 }, { "epoch": 2.9848535102266447, "eval_entropy": 1.6848491915422885, "eval_loss": 1.7765321731567383, "eval_mean_token_accuracy": 0.5679252127509805, "eval_num_tokens": 48713006.0, "eval_runtime": 112.2177, "eval_samples_per_second": 143.293, "eval_steps_per_second": 8.956, "step": 13500 } ], "logging_steps": 10, "max_steps": 13569, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 3.530587961022218e+17, "train_batch_size": 16, "trial_name": null, "trial_params": null }