{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.16786503651064544, "eval_steps": 500, "global_step": 3000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.691505527496338, "epoch": 0.0002797750608510757, "grad_norm": 12.375, "learning_rate": 2e-06, "loss": 10.7862, "mean_token_accuracy": 0.0, "num_tokens": 9833.0, "step": 5 }, { "entropy": 10.691538619995118, "epoch": 0.0005595501217021514, "grad_norm": 13.0, "learning_rate": 4.5e-06, "loss": 10.7246, "mean_token_accuracy": 0.0, "num_tokens": 19666.0, "step": 10 }, { "entropy": 10.691145992279052, "epoch": 0.0008393251825532272, "grad_norm": 9.3125, "learning_rate": 7e-06, "loss": 10.4747, "mean_token_accuracy": 0.019643833697773515, "num_tokens": 28771.0, "step": 15 }, { "entropy": 10.682477760314942, "epoch": 0.0011191002434043028, "grad_norm": 6.21875, "learning_rate": 9.5e-06, "loss": 10.1639, "mean_token_accuracy": 0.04193656481802464, "num_tokens": 38625.0, "step": 20 }, { "entropy": 10.617809772491455, "epoch": 0.0013988753042553786, "grad_norm": 4.09375, "learning_rate": 1.2e-05, "loss": 9.8606, "mean_token_accuracy": 0.04725950676947832, "num_tokens": 47864.0, "step": 25 }, { "entropy": 10.55274839401245, "epoch": 0.0016786503651064545, "grad_norm": 3.421875, "learning_rate": 1.4500000000000002e-05, "loss": 9.6963, "mean_token_accuracy": 0.04289307370781899, "num_tokens": 55926.0, "step": 30 }, { "entropy": 10.584246730804443, "epoch": 0.0019584254259575303, "grad_norm": 3.078125, "learning_rate": 1.7000000000000003e-05, "loss": 9.6414, "mean_token_accuracy": 0.044558577984571454, "num_tokens": 64915.0, "step": 35 }, { "entropy": 10.56161117553711, "epoch": 0.0022382004868086057, "grad_norm": 2.65625, "learning_rate": 1.95e-05, "loss": 9.6116, "mean_token_accuracy": 0.041977206617593764, "num_tokens": 73813.0, "step": 40 }, { "entropy": 10.549141788482666, "epoch": 0.0025179755476596815, "grad_norm": 2.421875, "learning_rate": 2.2e-05, "loss": 9.5772, "mean_token_accuracy": 0.04488353617489338, "num_tokens": 83706.0, "step": 45 }, { "entropy": 10.555339050292968, "epoch": 0.0027977506085107573, "grad_norm": 2.53125, "learning_rate": 2.4500000000000003e-05, "loss": 9.5206, "mean_token_accuracy": 0.041607250832021235, "num_tokens": 92739.0, "step": 50 }, { "entropy": 10.562696361541748, "epoch": 0.003077525669361833, "grad_norm": 2.65625, "learning_rate": 2.7e-05, "loss": 9.4731, "mean_token_accuracy": 0.04852877669036389, "num_tokens": 101880.0, "step": 55 }, { "entropy": 10.513782119750976, "epoch": 0.003357300730212909, "grad_norm": 2.59375, "learning_rate": 2.95e-05, "loss": 9.4135, "mean_token_accuracy": 0.05527102164924145, "num_tokens": 111303.0, "step": 60 }, { "entropy": 10.410881614685058, "epoch": 0.0036370757910639847, "grad_norm": 2.578125, "learning_rate": 3.2e-05, "loss": 9.2608, "mean_token_accuracy": 0.059278345108032225, "num_tokens": 121022.0, "step": 65 }, { "entropy": 10.35908842086792, "epoch": 0.0039168508519150606, "grad_norm": 2.3125, "learning_rate": 3.4500000000000005e-05, "loss": 9.1931, "mean_token_accuracy": 0.05288665182888508, "num_tokens": 129764.0, "step": 70 }, { "entropy": 10.414530277252197, "epoch": 0.004196625912766136, "grad_norm": 2.671875, "learning_rate": 3.7e-05, "loss": 9.12, "mean_token_accuracy": 0.05712716057896614, "num_tokens": 139543.0, "step": 75 }, { "entropy": 10.420390224456787, "epoch": 0.004476400973617211, "grad_norm": 2.453125, "learning_rate": 3.95e-05, "loss": 9.0894, "mean_token_accuracy": 0.055438223481178286, "num_tokens": 148772.0, "step": 80 }, { "entropy": 10.439853763580322, "epoch": 0.004756176034468288, "grad_norm": 2.53125, "learning_rate": 4.2000000000000004e-05, "loss": 8.8746, "mean_token_accuracy": 0.06480722092092037, "num_tokens": 158786.0, "step": 85 }, { "entropy": 10.333017063140868, "epoch": 0.005035951095319363, "grad_norm": 2.46875, "learning_rate": 4.45e-05, "loss": 8.7978, "mean_token_accuracy": 0.06817127540707588, "num_tokens": 166989.0, "step": 90 }, { "entropy": 10.257375049591065, "epoch": 0.005315726156170439, "grad_norm": 2.421875, "learning_rate": 4.7000000000000004e-05, "loss": 8.6945, "mean_token_accuracy": 0.06792460419237614, "num_tokens": 175840.0, "step": 95 }, { "entropy": 10.24816074371338, "epoch": 0.005595501217021515, "grad_norm": 2.484375, "learning_rate": 4.9500000000000004e-05, "loss": 8.6247, "mean_token_accuracy": 0.06662830822169781, "num_tokens": 185375.0, "step": 100 }, { "entropy": 10.16532497406006, "epoch": 0.005875276277872591, "grad_norm": 2.125, "learning_rate": 5.2e-05, "loss": 8.5206, "mean_token_accuracy": 0.07044463530182839, "num_tokens": 194647.0, "step": 105 }, { "entropy": 10.170048713684082, "epoch": 0.006155051338723666, "grad_norm": 2.421875, "learning_rate": 5.45e-05, "loss": 8.4143, "mean_token_accuracy": 0.07247264273464679, "num_tokens": 203882.0, "step": 110 }, { "entropy": 10.117275524139405, "epoch": 0.006434826399574742, "grad_norm": 2.796875, "learning_rate": 5.7e-05, "loss": 8.2929, "mean_token_accuracy": 0.06882111690938472, "num_tokens": 212641.0, "step": 115 }, { "entropy": 10.047082424163818, "epoch": 0.006714601460425818, "grad_norm": 2.125, "learning_rate": 5.9499999999999996e-05, "loss": 8.1784, "mean_token_accuracy": 0.07864802330732346, "num_tokens": 221668.0, "step": 120 }, { "entropy": 9.896892261505126, "epoch": 0.006994376521276893, "grad_norm": 2.390625, "learning_rate": 6.2e-05, "loss": 8.0655, "mean_token_accuracy": 0.07759866937994957, "num_tokens": 230277.0, "step": 125 }, { "entropy": 9.822550010681152, "epoch": 0.0072741515821279695, "grad_norm": 1.8125, "learning_rate": 6.450000000000001e-05, "loss": 7.9853, "mean_token_accuracy": 0.07847488112747669, "num_tokens": 240191.0, "step": 130 }, { "entropy": 9.653499507904053, "epoch": 0.007553926642979045, "grad_norm": 2.40625, "learning_rate": 6.7e-05, "loss": 7.8597, "mean_token_accuracy": 0.08022317960858345, "num_tokens": 249600.0, "step": 135 }, { "entropy": 9.487109375, "epoch": 0.007833701703830121, "grad_norm": 1.96875, "learning_rate": 6.950000000000001e-05, "loss": 7.7858, "mean_token_accuracy": 0.07919244170188904, "num_tokens": 258766.0, "step": 140 }, { "entropy": 9.301309394836426, "epoch": 0.008113476764681197, "grad_norm": 1.84375, "learning_rate": 7.2e-05, "loss": 7.5919, "mean_token_accuracy": 0.08380925506353379, "num_tokens": 268399.0, "step": 145 }, { "entropy": 9.010336112976074, "epoch": 0.008393251825532272, "grad_norm": 1.3359375, "learning_rate": 7.45e-05, "loss": 7.5475, "mean_token_accuracy": 0.08445582017302514, "num_tokens": 278348.0, "step": 150 }, { "entropy": 8.899579620361328, "epoch": 0.008673026886383347, "grad_norm": 1.7265625, "learning_rate": 7.7e-05, "loss": 7.5228, "mean_token_accuracy": 0.07803246155381202, "num_tokens": 288429.0, "step": 155 }, { "entropy": 8.617181396484375, "epoch": 0.008952801947234423, "grad_norm": 1.5078125, "learning_rate": 7.950000000000001e-05, "loss": 7.319, "mean_token_accuracy": 0.09034765139222145, "num_tokens": 297936.0, "step": 160 }, { "entropy": 8.410243892669678, "epoch": 0.0092325770080855, "grad_norm": 1.6640625, "learning_rate": 8.2e-05, "loss": 7.3897, "mean_token_accuracy": 0.08498694151639938, "num_tokens": 307390.0, "step": 165 }, { "entropy": 8.320203971862792, "epoch": 0.009512352068936575, "grad_norm": 1.4375, "learning_rate": 8.450000000000001e-05, "loss": 7.3416, "mean_token_accuracy": 0.07727829068899154, "num_tokens": 316381.0, "step": 170 }, { "entropy": 8.236638164520263, "epoch": 0.00979212712978765, "grad_norm": 1.96875, "learning_rate": 8.7e-05, "loss": 7.3116, "mean_token_accuracy": 0.07726738080382348, "num_tokens": 325086.0, "step": 175 }, { "entropy": 8.076795291900634, "epoch": 0.010071902190638726, "grad_norm": 1.5546875, "learning_rate": 8.95e-05, "loss": 7.1784, "mean_token_accuracy": 0.08438889384269714, "num_tokens": 334438.0, "step": 180 }, { "entropy": 7.889586877822876, "epoch": 0.010351677251489803, "grad_norm": 1.3515625, "learning_rate": 9.2e-05, "loss": 7.1976, "mean_token_accuracy": 0.0870728187263012, "num_tokens": 343169.0, "step": 185 }, { "entropy": 7.912118721008301, "epoch": 0.010631452312340878, "grad_norm": 1.734375, "learning_rate": 9.45e-05, "loss": 7.126, "mean_token_accuracy": 0.08688639178872108, "num_tokens": 352260.0, "step": 190 }, { "entropy": 7.820125246047974, "epoch": 0.010911227373191954, "grad_norm": 1.6796875, "learning_rate": 9.7e-05, "loss": 7.0827, "mean_token_accuracy": 0.08836827799677849, "num_tokens": 361436.0, "step": 195 }, { "entropy": 7.675041007995605, "epoch": 0.01119100243404303, "grad_norm": 1.3515625, "learning_rate": 9.95e-05, "loss": 7.1613, "mean_token_accuracy": 0.09058133289217948, "num_tokens": 370232.0, "step": 200 }, { "entropy": 7.803629922866821, "epoch": 0.011470777494894105, "grad_norm": 1.5234375, "learning_rate": 0.000102, "loss": 7.1257, "mean_token_accuracy": 0.0905453845858574, "num_tokens": 380211.0, "step": 205 }, { "entropy": 7.76220006942749, "epoch": 0.011750552555745182, "grad_norm": 1.390625, "learning_rate": 0.00010449999999999999, "loss": 7.1154, "mean_token_accuracy": 0.08261686339974403, "num_tokens": 390089.0, "step": 210 }, { "entropy": 7.6790376663208, "epoch": 0.012030327616596257, "grad_norm": 1.734375, "learning_rate": 0.000107, "loss": 7.0364, "mean_token_accuracy": 0.08655178025364876, "num_tokens": 398513.0, "step": 215 }, { "entropy": 7.6753379821777346, "epoch": 0.012310102677447332, "grad_norm": 1.484375, "learning_rate": 0.0001095, "loss": 7.1785, "mean_token_accuracy": 0.08271857276558876, "num_tokens": 408114.0, "step": 220 }, { "entropy": 7.658677101135254, "epoch": 0.012589877738298408, "grad_norm": 1.4296875, "learning_rate": 0.000112, "loss": 7.0324, "mean_token_accuracy": 0.08730659186840058, "num_tokens": 417680.0, "step": 225 }, { "entropy": 7.590711975097657, "epoch": 0.012869652799149483, "grad_norm": 1.2421875, "learning_rate": 0.0001145, "loss": 6.94, "mean_token_accuracy": 0.0981583096086979, "num_tokens": 426056.0, "step": 230 }, { "entropy": 7.538638401031494, "epoch": 0.01314942786000056, "grad_norm": 1.4296875, "learning_rate": 0.00011700000000000001, "loss": 6.8994, "mean_token_accuracy": 0.09497818350791931, "num_tokens": 435465.0, "step": 235 }, { "entropy": 7.547599267959595, "epoch": 0.013429202920851636, "grad_norm": 1.25, "learning_rate": 0.00011949999999999999, "loss": 6.9882, "mean_token_accuracy": 0.09514376819133759, "num_tokens": 444295.0, "step": 240 }, { "entropy": 7.532002258300781, "epoch": 0.013708977981702711, "grad_norm": 1.28125, "learning_rate": 0.000122, "loss": 6.9084, "mean_token_accuracy": 0.09089445620775223, "num_tokens": 453111.0, "step": 245 }, { "entropy": 7.416005039215088, "epoch": 0.013988753042553786, "grad_norm": 1.28125, "learning_rate": 0.0001245, "loss": 6.8671, "mean_token_accuracy": 0.09376973509788514, "num_tokens": 462438.0, "step": 250 }, { "entropy": 7.44201397895813, "epoch": 0.014268528103404862, "grad_norm": 1.5234375, "learning_rate": 0.000127, "loss": 6.8518, "mean_token_accuracy": 0.0919196330010891, "num_tokens": 471610.0, "step": 255 }, { "entropy": 7.486415004730224, "epoch": 0.014548303164255939, "grad_norm": 1.4140625, "learning_rate": 0.0001295, "loss": 6.9342, "mean_token_accuracy": 0.09321872368454934, "num_tokens": 480849.0, "step": 260 }, { "entropy": 7.40749454498291, "epoch": 0.014828078225107014, "grad_norm": 1.34375, "learning_rate": 0.000132, "loss": 6.9376, "mean_token_accuracy": 0.08951603546738625, "num_tokens": 489756.0, "step": 265 }, { "entropy": 7.461516523361206, "epoch": 0.01510785328595809, "grad_norm": 1.734375, "learning_rate": 0.00013450000000000002, "loss": 6.9217, "mean_token_accuracy": 0.09437951892614364, "num_tokens": 498818.0, "step": 270 }, { "entropy": 7.285744953155517, "epoch": 0.015387628346809165, "grad_norm": 1.25, "learning_rate": 0.00013700000000000002, "loss": 6.8458, "mean_token_accuracy": 0.09555465653538704, "num_tokens": 508508.0, "step": 275 }, { "entropy": 7.444489002227783, "epoch": 0.015667403407660242, "grad_norm": 1.5078125, "learning_rate": 0.0001395, "loss": 7.0025, "mean_token_accuracy": 0.09034469872713088, "num_tokens": 518257.0, "step": 280 }, { "entropy": 7.36638994216919, "epoch": 0.015947178468511316, "grad_norm": 1.328125, "learning_rate": 0.00014199999999999998, "loss": 6.9625, "mean_token_accuracy": 0.08916445821523666, "num_tokens": 527811.0, "step": 285 }, { "entropy": 7.358241605758667, "epoch": 0.016226953529362393, "grad_norm": 1.3671875, "learning_rate": 0.0001445, "loss": 6.8297, "mean_token_accuracy": 0.09337828531861306, "num_tokens": 536991.0, "step": 290 }, { "entropy": 7.320535326004029, "epoch": 0.016506728590213467, "grad_norm": 1.1484375, "learning_rate": 0.000147, "loss": 6.9245, "mean_token_accuracy": 0.0914350025355816, "num_tokens": 546498.0, "step": 295 }, { "entropy": 7.351836109161377, "epoch": 0.016786503651064544, "grad_norm": 1.2109375, "learning_rate": 0.0001495, "loss": 6.8809, "mean_token_accuracy": 0.09436944723129273, "num_tokens": 556022.0, "step": 300 }, { "entropy": 7.289101552963257, "epoch": 0.01706627871191562, "grad_norm": 1.40625, "learning_rate": 0.000152, "loss": 6.8212, "mean_token_accuracy": 0.09640712589025498, "num_tokens": 565392.0, "step": 305 }, { "entropy": 7.230247545242309, "epoch": 0.017346053772766695, "grad_norm": 1.46875, "learning_rate": 0.00015450000000000001, "loss": 6.8043, "mean_token_accuracy": 0.09431554824113846, "num_tokens": 574485.0, "step": 310 }, { "entropy": 7.3728536605834964, "epoch": 0.01762582883361777, "grad_norm": 1.375, "learning_rate": 0.000157, "loss": 6.8343, "mean_token_accuracy": 0.09452549517154693, "num_tokens": 583149.0, "step": 315 }, { "entropy": 7.280808210372925, "epoch": 0.017905603894468845, "grad_norm": 1.5234375, "learning_rate": 0.0001595, "loss": 6.8855, "mean_token_accuracy": 0.09358676373958588, "num_tokens": 592876.0, "step": 320 }, { "entropy": 7.064757013320923, "epoch": 0.018185378955319922, "grad_norm": 1.3203125, "learning_rate": 0.000162, "loss": 6.6685, "mean_token_accuracy": 0.09988230094313622, "num_tokens": 602001.0, "step": 325 }, { "entropy": 7.323857975006104, "epoch": 0.018465154016171, "grad_norm": 1.484375, "learning_rate": 0.00016450000000000001, "loss": 6.8667, "mean_token_accuracy": 0.09093789532780647, "num_tokens": 611602.0, "step": 330 }, { "entropy": 7.089147615432739, "epoch": 0.018744929077022073, "grad_norm": 1.34375, "learning_rate": 0.00016700000000000002, "loss": 6.7506, "mean_token_accuracy": 0.09642454162240029, "num_tokens": 620905.0, "step": 335 }, { "entropy": 7.273478889465332, "epoch": 0.01902470413787315, "grad_norm": 1.203125, "learning_rate": 0.00016950000000000003, "loss": 6.8279, "mean_token_accuracy": 0.0952286258339882, "num_tokens": 630151.0, "step": 340 }, { "entropy": 7.070547962188721, "epoch": 0.019304479198724227, "grad_norm": 1.1796875, "learning_rate": 0.00017199999999999998, "loss": 6.7905, "mean_token_accuracy": 0.09692409187555313, "num_tokens": 639864.0, "step": 345 }, { "entropy": 7.4187744140625, "epoch": 0.0195842542595753, "grad_norm": 1.3515625, "learning_rate": 0.00017449999999999999, "loss": 6.8707, "mean_token_accuracy": 0.09315617531538009, "num_tokens": 648819.0, "step": 350 }, { "entropy": 7.169836378097534, "epoch": 0.019864029320426378, "grad_norm": 1.4140625, "learning_rate": 0.000177, "loss": 6.8027, "mean_token_accuracy": 0.09456639736890793, "num_tokens": 658438.0, "step": 355 }, { "entropy": 7.143348264694214, "epoch": 0.020143804381277452, "grad_norm": 1.2109375, "learning_rate": 0.0001795, "loss": 6.7459, "mean_token_accuracy": 0.09843514785170555, "num_tokens": 668140.0, "step": 360 }, { "entropy": 7.207337665557861, "epoch": 0.02042357944212853, "grad_norm": 1.3203125, "learning_rate": 0.000182, "loss": 6.7733, "mean_token_accuracy": 0.09692016914486885, "num_tokens": 677505.0, "step": 365 }, { "entropy": 7.047050952911377, "epoch": 0.020703354502979606, "grad_norm": 1.0703125, "learning_rate": 0.0001845, "loss": 6.7596, "mean_token_accuracy": 0.09099765941500663, "num_tokens": 687911.0, "step": 370 }, { "entropy": 7.110365295410157, "epoch": 0.02098312956383068, "grad_norm": 1.40625, "learning_rate": 0.000187, "loss": 6.7002, "mean_token_accuracy": 0.10557077825069427, "num_tokens": 696565.0, "step": 375 }, { "entropy": 7.068933725357056, "epoch": 0.021262904624681757, "grad_norm": 1.2265625, "learning_rate": 0.0001895, "loss": 6.6321, "mean_token_accuracy": 0.09727629125118256, "num_tokens": 704918.0, "step": 380 }, { "entropy": 7.053268480300903, "epoch": 0.02154267968553283, "grad_norm": 1.28125, "learning_rate": 0.000192, "loss": 6.6612, "mean_token_accuracy": 0.1000488631427288, "num_tokens": 716172.0, "step": 385 }, { "entropy": 7.058245515823364, "epoch": 0.021822454746383908, "grad_norm": 1.46875, "learning_rate": 0.0001945, "loss": 6.6344, "mean_token_accuracy": 0.10481962487101555, "num_tokens": 725075.0, "step": 390 }, { "entropy": 7.085121202468872, "epoch": 0.022102229807234985, "grad_norm": 1.4765625, "learning_rate": 0.00019700000000000002, "loss": 6.7861, "mean_token_accuracy": 0.09666902050375939, "num_tokens": 733314.0, "step": 395 }, { "entropy": 7.137383270263672, "epoch": 0.02238200486808606, "grad_norm": 1.359375, "learning_rate": 0.00019950000000000002, "loss": 6.6717, "mean_token_accuracy": 0.10260491818189621, "num_tokens": 742390.0, "step": 400 }, { "entropy": 6.997572708129883, "epoch": 0.022661779928937135, "grad_norm": 1.2265625, "learning_rate": 0.000202, "loss": 6.7582, "mean_token_accuracy": 0.09590908735990525, "num_tokens": 751464.0, "step": 405 }, { "entropy": 7.058079195022583, "epoch": 0.02294155498978821, "grad_norm": 1.234375, "learning_rate": 0.00020449999999999998, "loss": 6.6488, "mean_token_accuracy": 0.10047566667199134, "num_tokens": 760746.0, "step": 410 }, { "entropy": 6.995281791687011, "epoch": 0.023221330050639286, "grad_norm": 1.25, "learning_rate": 0.000207, "loss": 6.5617, "mean_token_accuracy": 0.10464712381362914, "num_tokens": 769052.0, "step": 415 }, { "entropy": 6.989618110656738, "epoch": 0.023501105111490363, "grad_norm": 1.2265625, "learning_rate": 0.0002095, "loss": 6.7826, "mean_token_accuracy": 0.09742124751210213, "num_tokens": 778660.0, "step": 420 }, { "entropy": 7.074799585342407, "epoch": 0.023780880172341437, "grad_norm": 1.296875, "learning_rate": 0.000212, "loss": 6.6877, "mean_token_accuracy": 0.10435819402337074, "num_tokens": 787841.0, "step": 425 }, { "entropy": 6.878971099853516, "epoch": 0.024060655233192514, "grad_norm": 1.328125, "learning_rate": 0.0002145, "loss": 6.537, "mean_token_accuracy": 0.10397473350167274, "num_tokens": 796175.0, "step": 430 }, { "entropy": 6.980287361145019, "epoch": 0.024340430294043588, "grad_norm": 1.234375, "learning_rate": 0.00021700000000000002, "loss": 6.5959, "mean_token_accuracy": 0.10773405581712722, "num_tokens": 805941.0, "step": 435 }, { "entropy": 6.9006028175354, "epoch": 0.024620205354894665, "grad_norm": 1.1953125, "learning_rate": 0.0002195, "loss": 6.6389, "mean_token_accuracy": 0.09920870438218117, "num_tokens": 815058.0, "step": 440 }, { "entropy": 7.100294494628907, "epoch": 0.024899980415745742, "grad_norm": 1.2578125, "learning_rate": 0.000222, "loss": 6.6593, "mean_token_accuracy": 0.10117991864681244, "num_tokens": 824459.0, "step": 445 }, { "entropy": 6.872482252120972, "epoch": 0.025179755476596816, "grad_norm": 1.0859375, "learning_rate": 0.0002245, "loss": 6.656, "mean_token_accuracy": 0.10260392725467682, "num_tokens": 835250.0, "step": 450 }, { "entropy": 6.986909580230713, "epoch": 0.025459530537447893, "grad_norm": 1.03125, "learning_rate": 0.00022700000000000002, "loss": 6.6617, "mean_token_accuracy": 0.10458940342068672, "num_tokens": 844643.0, "step": 455 }, { "entropy": 6.96947169303894, "epoch": 0.025739305598298966, "grad_norm": 1.21875, "learning_rate": 0.00022950000000000002, "loss": 6.5977, "mean_token_accuracy": 0.10226123109459877, "num_tokens": 853375.0, "step": 460 }, { "entropy": 6.875414848327637, "epoch": 0.026019080659150044, "grad_norm": 1.1640625, "learning_rate": 0.00023200000000000003, "loss": 6.5253, "mean_token_accuracy": 0.11177821755409241, "num_tokens": 862244.0, "step": 465 }, { "entropy": 6.945923662185669, "epoch": 0.02629885572000112, "grad_norm": 1.34375, "learning_rate": 0.00023449999999999998, "loss": 6.6286, "mean_token_accuracy": 0.09996586814522743, "num_tokens": 871828.0, "step": 470 }, { "entropy": 6.8525604724884035, "epoch": 0.026578630780852194, "grad_norm": 1.3125, "learning_rate": 0.000237, "loss": 6.6076, "mean_token_accuracy": 0.10374173521995544, "num_tokens": 881087.0, "step": 475 }, { "entropy": 6.889187860488891, "epoch": 0.02685840584170327, "grad_norm": 1.234375, "learning_rate": 0.0002395, "loss": 6.6779, "mean_token_accuracy": 0.10589562878012657, "num_tokens": 890061.0, "step": 480 }, { "entropy": 7.009466075897217, "epoch": 0.027138180902554345, "grad_norm": 1.1328125, "learning_rate": 0.000242, "loss": 6.6192, "mean_token_accuracy": 0.10268636345863343, "num_tokens": 899388.0, "step": 485 }, { "entropy": 6.763098287582397, "epoch": 0.027417955963405422, "grad_norm": 1.3203125, "learning_rate": 0.0002445, "loss": 6.5255, "mean_token_accuracy": 0.10589060559868813, "num_tokens": 908295.0, "step": 490 }, { "entropy": 6.7688929557800295, "epoch": 0.0276977310242565, "grad_norm": 1.21875, "learning_rate": 0.000247, "loss": 6.4924, "mean_token_accuracy": 0.10882084742188454, "num_tokens": 917514.0, "step": 495 }, { "entropy": 6.904528284072876, "epoch": 0.027977506085107573, "grad_norm": 1.1328125, "learning_rate": 0.0002495, "loss": 6.5978, "mean_token_accuracy": 0.10768755748867989, "num_tokens": 927146.0, "step": 500 }, { "entropy": 6.758494710922241, "epoch": 0.02825728114595865, "grad_norm": 1.3828125, "learning_rate": 0.000252, "loss": 6.4884, "mean_token_accuracy": 0.10985259413719177, "num_tokens": 935278.0, "step": 505 }, { "entropy": 6.831978225708008, "epoch": 0.028537056206809724, "grad_norm": 1.3125, "learning_rate": 0.0002545, "loss": 6.5894, "mean_token_accuracy": 0.10266794636845589, "num_tokens": 945056.0, "step": 510 }, { "entropy": 6.827414417266846, "epoch": 0.0288168312676608, "grad_norm": 1.1953125, "learning_rate": 0.000257, "loss": 6.5527, "mean_token_accuracy": 0.10177932679653168, "num_tokens": 954187.0, "step": 515 }, { "entropy": 6.905342674255371, "epoch": 0.029096606328511878, "grad_norm": 1.140625, "learning_rate": 0.0002595, "loss": 6.5899, "mean_token_accuracy": 0.10657662600278854, "num_tokens": 963075.0, "step": 520 }, { "entropy": 6.886737442016601, "epoch": 0.02937638138936295, "grad_norm": 1.125, "learning_rate": 0.000262, "loss": 6.5683, "mean_token_accuracy": 0.10781930312514305, "num_tokens": 972110.0, "step": 525 }, { "entropy": 6.684601259231568, "epoch": 0.02965615645021403, "grad_norm": 1.3984375, "learning_rate": 0.00026450000000000003, "loss": 6.4582, "mean_token_accuracy": 0.11291620060801506, "num_tokens": 980231.0, "step": 530 }, { "entropy": 6.7892358779907225, "epoch": 0.029935931511065102, "grad_norm": 1.21875, "learning_rate": 0.00026700000000000004, "loss": 6.6105, "mean_token_accuracy": 0.10551066771149635, "num_tokens": 990018.0, "step": 535 }, { "entropy": 6.703322696685791, "epoch": 0.03021570657191618, "grad_norm": 1.3203125, "learning_rate": 0.00026950000000000005, "loss": 6.4987, "mean_token_accuracy": 0.10690677091479302, "num_tokens": 999243.0, "step": 540 }, { "entropy": 6.800885343551636, "epoch": 0.030495481632767257, "grad_norm": 1.1484375, "learning_rate": 0.00027200000000000005, "loss": 6.4947, "mean_token_accuracy": 0.1084700345993042, "num_tokens": 1008800.0, "step": 545 }, { "entropy": 6.75251727104187, "epoch": 0.03077525669361833, "grad_norm": 1.125, "learning_rate": 0.0002745, "loss": 6.5354, "mean_token_accuracy": 0.10884697884321212, "num_tokens": 1018880.0, "step": 550 }, { "entropy": 6.796888923645019, "epoch": 0.031055031754469407, "grad_norm": 1.15625, "learning_rate": 0.000277, "loss": 6.4822, "mean_token_accuracy": 0.10811220407485962, "num_tokens": 1028508.0, "step": 555 }, { "entropy": 6.65325436592102, "epoch": 0.031334806815320485, "grad_norm": 1.3671875, "learning_rate": 0.0002795, "loss": 6.4371, "mean_token_accuracy": 0.11171221733093262, "num_tokens": 1037626.0, "step": 560 }, { "entropy": 6.6531189441680905, "epoch": 0.031614581876171555, "grad_norm": 1.2734375, "learning_rate": 0.00028199999999999997, "loss": 6.4237, "mean_token_accuracy": 0.1133709043264389, "num_tokens": 1046814.0, "step": 565 }, { "entropy": 6.597415113449097, "epoch": 0.03189435693702263, "grad_norm": 1.09375, "learning_rate": 0.0002845, "loss": 6.4282, "mean_token_accuracy": 0.10929519906640053, "num_tokens": 1056620.0, "step": 570 }, { "entropy": 6.794770956039429, "epoch": 0.03217413199787371, "grad_norm": 1.234375, "learning_rate": 0.000287, "loss": 6.4834, "mean_token_accuracy": 0.11290100738406181, "num_tokens": 1064488.0, "step": 575 }, { "entropy": 6.786476469039917, "epoch": 0.032453907058724786, "grad_norm": 1.4375, "learning_rate": 0.0002895, "loss": 6.5179, "mean_token_accuracy": 0.11080160588026047, "num_tokens": 1074153.0, "step": 580 }, { "entropy": 6.673076820373535, "epoch": 0.03273368211957586, "grad_norm": 1.3125, "learning_rate": 0.000292, "loss": 6.452, "mean_token_accuracy": 0.10839907601475715, "num_tokens": 1083027.0, "step": 585 }, { "entropy": 6.628738451004028, "epoch": 0.03301345718042693, "grad_norm": 1.28125, "learning_rate": 0.0002945, "loss": 6.4465, "mean_token_accuracy": 0.10820735022425651, "num_tokens": 1092010.0, "step": 590 }, { "entropy": 6.731857395172119, "epoch": 0.03329323224127801, "grad_norm": 1.2265625, "learning_rate": 0.000297, "loss": 6.4946, "mean_token_accuracy": 0.10928055047988891, "num_tokens": 1101776.0, "step": 595 }, { "entropy": 6.651297473907471, "epoch": 0.03357300730212909, "grad_norm": 1.3828125, "learning_rate": 0.0002995, "loss": 6.4487, "mean_token_accuracy": 0.10809680670499802, "num_tokens": 1110894.0, "step": 600 }, { "entropy": 6.813410139083862, "epoch": 0.033852782362980165, "grad_norm": 1.203125, "learning_rate": 0.000302, "loss": 6.4318, "mean_token_accuracy": 0.10976689979434014, "num_tokens": 1119512.0, "step": 605 }, { "entropy": 6.574000358581543, "epoch": 0.03413255742383124, "grad_norm": 1.265625, "learning_rate": 0.0003045, "loss": 6.4217, "mean_token_accuracy": 0.10791075751185417, "num_tokens": 1129469.0, "step": 610 }, { "entropy": 6.738797283172607, "epoch": 0.03441233248468231, "grad_norm": 1.2578125, "learning_rate": 0.000307, "loss": 6.4586, "mean_token_accuracy": 0.10540183559060097, "num_tokens": 1137850.0, "step": 615 }, { "entropy": 6.7057750701904295, "epoch": 0.03469210754553339, "grad_norm": 1.15625, "learning_rate": 0.0003095, "loss": 6.5737, "mean_token_accuracy": 0.11240374073386192, "num_tokens": 1147405.0, "step": 620 }, { "entropy": 6.679307174682617, "epoch": 0.034971882606384466, "grad_norm": 1.2421875, "learning_rate": 0.000312, "loss": 6.4446, "mean_token_accuracy": 0.11059640496969222, "num_tokens": 1156457.0, "step": 625 }, { "entropy": 6.691693830490112, "epoch": 0.03525165766723554, "grad_norm": 1.125, "learning_rate": 0.0003145, "loss": 6.4141, "mean_token_accuracy": 0.11546503752470016, "num_tokens": 1165943.0, "step": 630 }, { "entropy": 6.4711555480957035, "epoch": 0.03553143272808662, "grad_norm": 1.2265625, "learning_rate": 0.000317, "loss": 6.3521, "mean_token_accuracy": 0.11288735195994377, "num_tokens": 1175030.0, "step": 635 }, { "entropy": 6.5566987037658695, "epoch": 0.03581120778893769, "grad_norm": 1.2421875, "learning_rate": 0.0003195, "loss": 6.4719, "mean_token_accuracy": 0.11424087956547738, "num_tokens": 1184988.0, "step": 640 }, { "entropy": 6.78665771484375, "epoch": 0.03609098284978877, "grad_norm": 1.234375, "learning_rate": 0.000322, "loss": 6.4706, "mean_token_accuracy": 0.11168640255928039, "num_tokens": 1194352.0, "step": 645 }, { "entropy": 6.566987657546997, "epoch": 0.036370757910639845, "grad_norm": 1.1171875, "learning_rate": 0.00032450000000000003, "loss": 6.3646, "mean_token_accuracy": 0.1151100791990757, "num_tokens": 1203744.0, "step": 650 }, { "entropy": 6.640985155105591, "epoch": 0.03665053297149092, "grad_norm": 1.1796875, "learning_rate": 0.00032700000000000003, "loss": 6.4265, "mean_token_accuracy": 0.11166704073548317, "num_tokens": 1212917.0, "step": 655 }, { "entropy": 6.689370393753052, "epoch": 0.036930308032342, "grad_norm": 1.328125, "learning_rate": 0.00032950000000000004, "loss": 6.4567, "mean_token_accuracy": 0.11746964305639267, "num_tokens": 1221669.0, "step": 660 }, { "entropy": 6.537262868881226, "epoch": 0.037210083093193076, "grad_norm": 1.328125, "learning_rate": 0.00033200000000000005, "loss": 6.3787, "mean_token_accuracy": 0.11580658480525016, "num_tokens": 1230925.0, "step": 665 }, { "entropy": 6.473914861679077, "epoch": 0.037489858154044146, "grad_norm": 1.1171875, "learning_rate": 0.00033450000000000005, "loss": 6.3872, "mean_token_accuracy": 0.12107581570744515, "num_tokens": 1240317.0, "step": 670 }, { "entropy": 6.532442855834961, "epoch": 0.037769633214895224, "grad_norm": 1.265625, "learning_rate": 0.000337, "loss": 6.3565, "mean_token_accuracy": 0.11721108332276345, "num_tokens": 1250285.0, "step": 675 }, { "entropy": 6.558922338485718, "epoch": 0.0380494082757463, "grad_norm": 1.125, "learning_rate": 0.0003395, "loss": 6.3691, "mean_token_accuracy": 0.11794314831495285, "num_tokens": 1259272.0, "step": 680 }, { "entropy": 6.556687736511231, "epoch": 0.03832918333659738, "grad_norm": 1.2109375, "learning_rate": 0.000342, "loss": 6.3467, "mean_token_accuracy": 0.11026200056076049, "num_tokens": 1269069.0, "step": 685 }, { "entropy": 6.544914388656617, "epoch": 0.038608958397448455, "grad_norm": 1.3515625, "learning_rate": 0.00034449999999999997, "loss": 6.3472, "mean_token_accuracy": 0.1141720823943615, "num_tokens": 1277942.0, "step": 690 }, { "entropy": 6.516038227081299, "epoch": 0.038888733458299525, "grad_norm": 1.421875, "learning_rate": 0.000347, "loss": 6.4464, "mean_token_accuracy": 0.11829971224069595, "num_tokens": 1286731.0, "step": 695 }, { "entropy": 6.491542816162109, "epoch": 0.0391685085191506, "grad_norm": 1.265625, "learning_rate": 0.0003495, "loss": 6.306, "mean_token_accuracy": 0.11953174397349357, "num_tokens": 1295685.0, "step": 700 }, { "entropy": 6.41384859085083, "epoch": 0.03944828358000168, "grad_norm": 1.3046875, "learning_rate": 0.000352, "loss": 6.2558, "mean_token_accuracy": 0.1239193856716156, "num_tokens": 1304375.0, "step": 705 }, { "entropy": 6.570674753189087, "epoch": 0.039728058640852756, "grad_norm": 1.1640625, "learning_rate": 0.0003545, "loss": 6.4673, "mean_token_accuracy": 0.11799883842468262, "num_tokens": 1313282.0, "step": 710 }, { "entropy": 6.577246189117432, "epoch": 0.040007833701703834, "grad_norm": 1.46875, "learning_rate": 0.000357, "loss": 6.3111, "mean_token_accuracy": 0.11679205074906349, "num_tokens": 1322035.0, "step": 715 }, { "entropy": 6.528969764709473, "epoch": 0.040287608762554904, "grad_norm": 1.359375, "learning_rate": 0.0003595, "loss": 6.4596, "mean_token_accuracy": 0.11984212100505828, "num_tokens": 1331553.0, "step": 720 }, { "entropy": 6.455485153198242, "epoch": 0.04056738382340598, "grad_norm": 1.3828125, "learning_rate": 0.000362, "loss": 6.3126, "mean_token_accuracy": 0.11634061336517335, "num_tokens": 1340577.0, "step": 725 }, { "entropy": 6.606705093383789, "epoch": 0.04084715888425706, "grad_norm": 1.1875, "learning_rate": 0.0003645, "loss": 6.3608, "mean_token_accuracy": 0.12028084397315979, "num_tokens": 1349635.0, "step": 730 }, { "entropy": 6.485494136810303, "epoch": 0.041126933945108135, "grad_norm": 1.125, "learning_rate": 0.000367, "loss": 6.2679, "mean_token_accuracy": 0.11617309153079987, "num_tokens": 1358628.0, "step": 735 }, { "entropy": 6.461924934387207, "epoch": 0.04140670900595921, "grad_norm": 1.3671875, "learning_rate": 0.0003695, "loss": 6.4619, "mean_token_accuracy": 0.1150215283036232, "num_tokens": 1368023.0, "step": 740 }, { "entropy": 6.4644389152526855, "epoch": 0.04168648406681028, "grad_norm": 1.2578125, "learning_rate": 0.000372, "loss": 6.338, "mean_token_accuracy": 0.12105848267674446, "num_tokens": 1377354.0, "step": 745 }, { "entropy": 6.552575492858887, "epoch": 0.04196625912766136, "grad_norm": 1.3046875, "learning_rate": 0.0003745, "loss": 6.4018, "mean_token_accuracy": 0.1141360804438591, "num_tokens": 1386428.0, "step": 750 }, { "entropy": 6.4100508213043215, "epoch": 0.04224603418851244, "grad_norm": 1.125, "learning_rate": 0.000377, "loss": 6.2951, "mean_token_accuracy": 0.11664086356759071, "num_tokens": 1395809.0, "step": 755 }, { "entropy": 6.542036771774292, "epoch": 0.042525809249363514, "grad_norm": 1.078125, "learning_rate": 0.0003795, "loss": 6.322, "mean_token_accuracy": 0.12149200588464737, "num_tokens": 1405440.0, "step": 760 }, { "entropy": 6.500925827026367, "epoch": 0.04280558431021459, "grad_norm": 1.25, "learning_rate": 0.000382, "loss": 6.4325, "mean_token_accuracy": 0.11671576723456382, "num_tokens": 1414018.0, "step": 765 }, { "entropy": 6.469825267791748, "epoch": 0.04308535937106566, "grad_norm": 1.1328125, "learning_rate": 0.0003845, "loss": 6.3286, "mean_token_accuracy": 0.1199316494166851, "num_tokens": 1422853.0, "step": 770 }, { "entropy": 6.4752647399902346, "epoch": 0.04336513443191674, "grad_norm": 1.21875, "learning_rate": 0.00038700000000000003, "loss": 6.3173, "mean_token_accuracy": 0.12002637311816215, "num_tokens": 1431647.0, "step": 775 }, { "entropy": 6.4410097122192385, "epoch": 0.043644909492767815, "grad_norm": 1.4140625, "learning_rate": 0.00038950000000000003, "loss": 6.3052, "mean_token_accuracy": 0.12325269281864167, "num_tokens": 1440547.0, "step": 780 }, { "entropy": 6.460622024536133, "epoch": 0.04392468455361889, "grad_norm": 1.046875, "learning_rate": 0.00039200000000000004, "loss": 6.2662, "mean_token_accuracy": 0.12282432466745377, "num_tokens": 1450310.0, "step": 785 }, { "entropy": 6.4368048191070555, "epoch": 0.04420445961446997, "grad_norm": 1.3125, "learning_rate": 0.00039450000000000005, "loss": 6.3488, "mean_token_accuracy": 0.11794603615999222, "num_tokens": 1458544.0, "step": 790 }, { "entropy": 6.315302181243896, "epoch": 0.04448423467532104, "grad_norm": 1.25, "learning_rate": 0.00039700000000000005, "loss": 6.3146, "mean_token_accuracy": 0.12033002376556397, "num_tokens": 1467699.0, "step": 795 }, { "entropy": 6.488300848007202, "epoch": 0.04476400973617212, "grad_norm": 1.109375, "learning_rate": 0.0003995, "loss": 6.2519, "mean_token_accuracy": 0.1236931897699833, "num_tokens": 1477386.0, "step": 800 }, { "entropy": 6.3928173065185545, "epoch": 0.045043784797023194, "grad_norm": 1.4140625, "learning_rate": 0.000402, "loss": 6.2968, "mean_token_accuracy": 0.11787274852395058, "num_tokens": 1486660.0, "step": 805 }, { "entropy": 6.316296100616455, "epoch": 0.04532355985787427, "grad_norm": 1.2734375, "learning_rate": 0.0004045, "loss": 6.2154, "mean_token_accuracy": 0.12369973957538605, "num_tokens": 1495408.0, "step": 810 }, { "entropy": 6.420361280441284, "epoch": 0.04560333491872535, "grad_norm": 1.15625, "learning_rate": 0.00040699999999999997, "loss": 6.2966, "mean_token_accuracy": 0.12109342366456985, "num_tokens": 1503822.0, "step": 815 }, { "entropy": 6.339131259918213, "epoch": 0.04588310997957642, "grad_norm": 1.3203125, "learning_rate": 0.0004095, "loss": 6.2543, "mean_token_accuracy": 0.11657608151435853, "num_tokens": 1512822.0, "step": 820 }, { "entropy": 6.436035680770874, "epoch": 0.046162885040427495, "grad_norm": 1.1953125, "learning_rate": 0.000412, "loss": 6.3429, "mean_token_accuracy": 0.11799641102552413, "num_tokens": 1522321.0, "step": 825 }, { "entropy": 6.388043451309204, "epoch": 0.04644266010127857, "grad_norm": 1.234375, "learning_rate": 0.0004145, "loss": 6.3332, "mean_token_accuracy": 0.11690129637718201, "num_tokens": 1532071.0, "step": 830 }, { "entropy": 6.446229124069214, "epoch": 0.04672243516212965, "grad_norm": 1.15625, "learning_rate": 0.000417, "loss": 6.2658, "mean_token_accuracy": 0.1248463362455368, "num_tokens": 1541204.0, "step": 835 }, { "entropy": 6.321492671966553, "epoch": 0.04700221022298073, "grad_norm": 1.2265625, "learning_rate": 0.0004195, "loss": 6.301, "mean_token_accuracy": 0.11873220205307007, "num_tokens": 1548994.0, "step": 840 }, { "entropy": 6.387647390365601, "epoch": 0.0472819852838318, "grad_norm": 1.390625, "learning_rate": 0.000422, "loss": 6.3317, "mean_token_accuracy": 0.11347933784127236, "num_tokens": 1558012.0, "step": 845 }, { "entropy": 6.33697543144226, "epoch": 0.047561760344682874, "grad_norm": 1.265625, "learning_rate": 0.0004245, "loss": 6.344, "mean_token_accuracy": 0.12062845751643181, "num_tokens": 1567183.0, "step": 850 }, { "entropy": 6.517240285873413, "epoch": 0.04784153540553395, "grad_norm": 1.203125, "learning_rate": 0.000427, "loss": 6.3582, "mean_token_accuracy": 0.12024350762367249, "num_tokens": 1577213.0, "step": 855 }, { "entropy": 6.327879953384399, "epoch": 0.04812131046638503, "grad_norm": 1.125, "learning_rate": 0.0004295, "loss": 6.2433, "mean_token_accuracy": 0.12363175675272942, "num_tokens": 1586814.0, "step": 860 }, { "entropy": 6.303459978103637, "epoch": 0.048401085527236105, "grad_norm": 1.1796875, "learning_rate": 0.000432, "loss": 6.2858, "mean_token_accuracy": 0.12493444457650185, "num_tokens": 1596140.0, "step": 865 }, { "entropy": 6.3528955459594725, "epoch": 0.048680860588087176, "grad_norm": 1.234375, "learning_rate": 0.0004345, "loss": 6.1884, "mean_token_accuracy": 0.12042548209428787, "num_tokens": 1604811.0, "step": 870 }, { "entropy": 6.2718658447265625, "epoch": 0.04896063564893825, "grad_norm": 1.0859375, "learning_rate": 0.000437, "loss": 6.1916, "mean_token_accuracy": 0.12246528714895248, "num_tokens": 1613975.0, "step": 875 }, { "entropy": 6.39298005104065, "epoch": 0.04924041070978933, "grad_norm": 1.0859375, "learning_rate": 0.0004395, "loss": 6.2383, "mean_token_accuracy": 0.12414250522851944, "num_tokens": 1622571.0, "step": 880 }, { "entropy": 6.373995971679688, "epoch": 0.04952018577064041, "grad_norm": 1.1875, "learning_rate": 0.000442, "loss": 6.3129, "mean_token_accuracy": 0.12346948832273483, "num_tokens": 1631203.0, "step": 885 }, { "entropy": 6.396008825302124, "epoch": 0.049799960831491484, "grad_norm": 1.1953125, "learning_rate": 0.0004445, "loss": 6.3239, "mean_token_accuracy": 0.1246532879769802, "num_tokens": 1640170.0, "step": 890 }, { "entropy": 6.244958019256591, "epoch": 0.050079735892342554, "grad_norm": 1.1171875, "learning_rate": 0.000447, "loss": 6.2958, "mean_token_accuracy": 0.12313124164938927, "num_tokens": 1649039.0, "step": 895 }, { "entropy": 6.412044620513916, "epoch": 0.05035951095319363, "grad_norm": 1.0625, "learning_rate": 0.00044950000000000003, "loss": 6.2599, "mean_token_accuracy": 0.1271291956305504, "num_tokens": 1658445.0, "step": 900 }, { "entropy": 6.195079517364502, "epoch": 0.05063928601404471, "grad_norm": 1.1484375, "learning_rate": 0.00045200000000000004, "loss": 6.1302, "mean_token_accuracy": 0.13331740349531174, "num_tokens": 1667097.0, "step": 905 }, { "entropy": 6.290958261489868, "epoch": 0.050919061074895786, "grad_norm": 1.234375, "learning_rate": 0.00045450000000000004, "loss": 6.2619, "mean_token_accuracy": 0.11674268618226051, "num_tokens": 1676874.0, "step": 910 }, { "entropy": 6.34834885597229, "epoch": 0.05119883613574686, "grad_norm": 1.203125, "learning_rate": 0.00045700000000000005, "loss": 6.2019, "mean_token_accuracy": 0.12399802803993225, "num_tokens": 1685547.0, "step": 915 }, { "entropy": 6.189801597595215, "epoch": 0.05147861119659793, "grad_norm": 1.2109375, "learning_rate": 0.00045950000000000006, "loss": 6.191, "mean_token_accuracy": 0.12718559354543685, "num_tokens": 1693753.0, "step": 920 }, { "entropy": 6.277320146560669, "epoch": 0.05175838625744901, "grad_norm": 1.1015625, "learning_rate": 0.000462, "loss": 6.1807, "mean_token_accuracy": 0.12505132406949998, "num_tokens": 1703747.0, "step": 925 }, { "entropy": 6.1411545753479, "epoch": 0.05203816131830009, "grad_norm": 1.2734375, "learning_rate": 0.0004645, "loss": 6.1278, "mean_token_accuracy": 0.12806382775306702, "num_tokens": 1712656.0, "step": 930 }, { "entropy": 6.263706398010254, "epoch": 0.052317936379151164, "grad_norm": 1.2109375, "learning_rate": 0.000467, "loss": 6.2035, "mean_token_accuracy": 0.12317869812250137, "num_tokens": 1722695.0, "step": 935 }, { "entropy": 6.419267845153809, "epoch": 0.05259771144000224, "grad_norm": 1.0625, "learning_rate": 0.0004695, "loss": 6.3361, "mean_token_accuracy": 0.1168564572930336, "num_tokens": 1733003.0, "step": 940 }, { "entropy": 6.101446342468262, "epoch": 0.05287748650085331, "grad_norm": 1.078125, "learning_rate": 0.000472, "loss": 6.1556, "mean_token_accuracy": 0.12313281893730163, "num_tokens": 1742393.0, "step": 945 }, { "entropy": 6.349677515029907, "epoch": 0.05315726156170439, "grad_norm": 1.21875, "learning_rate": 0.0004745, "loss": 6.2524, "mean_token_accuracy": 0.12328635305166244, "num_tokens": 1752098.0, "step": 950 }, { "entropy": 6.1572033882141115, "epoch": 0.053437036622555466, "grad_norm": 1.1953125, "learning_rate": 0.000477, "loss": 6.0447, "mean_token_accuracy": 0.12816244289278983, "num_tokens": 1760835.0, "step": 955 }, { "entropy": 6.283704566955566, "epoch": 0.05371681168340654, "grad_norm": 1.1171875, "learning_rate": 0.0004795, "loss": 6.2603, "mean_token_accuracy": 0.12562395483255387, "num_tokens": 1770084.0, "step": 960 }, { "entropy": 6.192875766754151, "epoch": 0.05399658674425762, "grad_norm": 1.0625, "learning_rate": 0.000482, "loss": 6.2888, "mean_token_accuracy": 0.11796638444066047, "num_tokens": 1779321.0, "step": 965 }, { "entropy": 6.382868099212646, "epoch": 0.05427636180510869, "grad_norm": 1.1015625, "learning_rate": 0.0004845, "loss": 6.2053, "mean_token_accuracy": 0.12535162419080734, "num_tokens": 1789268.0, "step": 970 }, { "entropy": 6.16242561340332, "epoch": 0.05455613686595977, "grad_norm": 1.078125, "learning_rate": 0.000487, "loss": 6.1851, "mean_token_accuracy": 0.12277970910072326, "num_tokens": 1797765.0, "step": 975 }, { "entropy": 6.156621074676513, "epoch": 0.054835911926810844, "grad_norm": 1.1171875, "learning_rate": 0.0004895, "loss": 6.1426, "mean_token_accuracy": 0.13391674682497978, "num_tokens": 1807110.0, "step": 980 }, { "entropy": 6.318566751480103, "epoch": 0.05511568698766192, "grad_norm": 1.1328125, "learning_rate": 0.000492, "loss": 6.2306, "mean_token_accuracy": 0.1218092642724514, "num_tokens": 1816767.0, "step": 985 }, { "entropy": 6.220181655883789, "epoch": 0.055395462048513, "grad_norm": 1.15625, "learning_rate": 0.0004945, "loss": 6.2397, "mean_token_accuracy": 0.12567930296063423, "num_tokens": 1826012.0, "step": 990 }, { "entropy": 6.257971334457397, "epoch": 0.05567523710936407, "grad_norm": 1.0234375, "learning_rate": 0.000497, "loss": 6.2, "mean_token_accuracy": 0.12385892570018768, "num_tokens": 1835355.0, "step": 995 }, { "entropy": 6.210480213165283, "epoch": 0.055955012170215146, "grad_norm": 1.078125, "learning_rate": 0.0004995, "loss": 6.1559, "mean_token_accuracy": 0.13025842383503913, "num_tokens": 1844998.0, "step": 1000 }, { "entropy": 6.130459451675415, "epoch": 0.05623478723106622, "grad_norm": 1.25, "learning_rate": 0.000499998026082006, "loss": 6.0702, "mean_token_accuracy": 0.13735647723078728, "num_tokens": 1854117.0, "step": 1005 }, { "entropy": 6.147902154922486, "epoch": 0.0565145622919173, "grad_norm": 1.0546875, "learning_rate": 0.0004999900070995136, "loss": 6.1333, "mean_token_accuracy": 0.12924585863947868, "num_tokens": 1863383.0, "step": 1010 }, { "entropy": 6.300161933898925, "epoch": 0.05679433735276838, "grad_norm": 1.0078125, "learning_rate": 0.0004999758199023239, "loss": 6.2331, "mean_token_accuracy": 0.11939030215144157, "num_tokens": 1872798.0, "step": 1015 }, { "entropy": 6.0971071243286135, "epoch": 0.05707411241361945, "grad_norm": 1.3515625, "learning_rate": 0.0004999554648793858, "loss": 6.1262, "mean_token_accuracy": 0.13786051496863366, "num_tokens": 1881698.0, "step": 1020 }, { "entropy": 6.258518314361572, "epoch": 0.057353887474470525, "grad_norm": 1.09375, "learning_rate": 0.0004999289425887425, "loss": 6.1755, "mean_token_accuracy": 0.1295467123389244, "num_tokens": 1890771.0, "step": 1025 }, { "entropy": 6.1218438148498535, "epoch": 0.0576336625353216, "grad_norm": 1.1484375, "learning_rate": 0.0004998962537575161, "loss": 6.146, "mean_token_accuracy": 0.12477104216814042, "num_tokens": 1900278.0, "step": 1030 }, { "entropy": 6.2131085872650145, "epoch": 0.05791343759617268, "grad_norm": 1.1953125, "learning_rate": 0.0004998573992818874, "loss": 6.2207, "mean_token_accuracy": 0.13374545723199843, "num_tokens": 1909374.0, "step": 1035 }, { "entropy": 6.18338713645935, "epoch": 0.058193212657023756, "grad_norm": 1.2109375, "learning_rate": 0.0004998123802270715, "loss": 6.2467, "mean_token_accuracy": 0.12723272889852524, "num_tokens": 1917854.0, "step": 1040 }, { "entropy": 6.129993343353272, "epoch": 0.058472987717874826, "grad_norm": 1.296875, "learning_rate": 0.0004997611978272886, "loss": 6.1216, "mean_token_accuracy": 0.13106875866651535, "num_tokens": 1926720.0, "step": 1045 }, { "entropy": 6.179345941543579, "epoch": 0.0587527627787259, "grad_norm": 1.1484375, "learning_rate": 0.0004997038534857298, "loss": 6.2008, "mean_token_accuracy": 0.1277387872338295, "num_tokens": 1936803.0, "step": 1050 }, { "entropy": 6.182669401168823, "epoch": 0.05903253783957698, "grad_norm": 1.0859375, "learning_rate": 0.0004996403487745194, "loss": 6.2595, "mean_token_accuracy": 0.12981212735176087, "num_tokens": 1946862.0, "step": 1055 }, { "entropy": 6.160896635055542, "epoch": 0.05931231290042806, "grad_norm": 1.09375, "learning_rate": 0.000499570685434671, "loss": 6.1245, "mean_token_accuracy": 0.1319658190011978, "num_tokens": 1956321.0, "step": 1060 }, { "entropy": 6.227955532073975, "epoch": 0.059592087961279135, "grad_norm": 1.25, "learning_rate": 0.0004994948653760405, "loss": 6.0571, "mean_token_accuracy": 0.13851428404450417, "num_tokens": 1964784.0, "step": 1065 }, { "entropy": 6.041449022293091, "epoch": 0.059871863022130205, "grad_norm": 1.078125, "learning_rate": 0.0004994128906772729, "loss": 6.0906, "mean_token_accuracy": 0.13081432059407233, "num_tokens": 1973918.0, "step": 1070 }, { "entropy": 6.093364238739014, "epoch": 0.06015163808298128, "grad_norm": 1.0703125, "learning_rate": 0.000499324763585746, "loss": 6.2021, "mean_token_accuracy": 0.13375769481062888, "num_tokens": 1983252.0, "step": 1075 }, { "entropy": 6.210244464874267, "epoch": 0.06043141314383236, "grad_norm": 1.171875, "learning_rate": 0.0004992304865175085, "loss": 6.0939, "mean_token_accuracy": 0.1372748613357544, "num_tokens": 1991780.0, "step": 1080 }, { "entropy": 6.143740892410278, "epoch": 0.060711188204683436, "grad_norm": 1.140625, "learning_rate": 0.0004991300620572138, "loss": 6.1979, "mean_token_accuracy": 0.12712325975298883, "num_tokens": 2000620.0, "step": 1085 }, { "entropy": 6.2204633235931395, "epoch": 0.06099096326553451, "grad_norm": 1.0859375, "learning_rate": 0.0004990234929580494, "loss": 6.1862, "mean_token_accuracy": 0.12817292883992196, "num_tokens": 2009193.0, "step": 1090 }, { "entropy": 6.248979568481445, "epoch": 0.06127073832638558, "grad_norm": 1.1015625, "learning_rate": 0.0004989107821416609, "loss": 6.2595, "mean_token_accuracy": 0.12865378484129905, "num_tokens": 2019205.0, "step": 1095 }, { "entropy": 6.089492607116699, "epoch": 0.06155051338723666, "grad_norm": 1.1328125, "learning_rate": 0.0004987919326980723, "loss": 6.1164, "mean_token_accuracy": 0.12822083830833436, "num_tokens": 2028613.0, "step": 1100 }, { "entropy": 6.210154104232788, "epoch": 0.06183028844808774, "grad_norm": 1.0703125, "learning_rate": 0.0004986669478856011, "loss": 6.1538, "mean_token_accuracy": 0.13177741691470146, "num_tokens": 2037056.0, "step": 1105 }, { "entropy": 6.141370105743408, "epoch": 0.062110063508938815, "grad_norm": 1.0234375, "learning_rate": 0.0004985358311307688, "loss": 6.0923, "mean_token_accuracy": 0.12338809072971343, "num_tokens": 2046192.0, "step": 1110 }, { "entropy": 6.162001132965088, "epoch": 0.06238983856978989, "grad_norm": 1.046875, "learning_rate": 0.0004983985860282081, "loss": 6.1807, "mean_token_accuracy": 0.1320735476911068, "num_tokens": 2055290.0, "step": 1115 }, { "entropy": 6.185983371734619, "epoch": 0.06266961363064097, "grad_norm": 1.1328125, "learning_rate": 0.0004982552163405623, "loss": 6.2181, "mean_token_accuracy": 0.1298999786376953, "num_tokens": 2064005.0, "step": 1120 }, { "entropy": 6.259249210357666, "epoch": 0.06294938869149204, "grad_norm": 0.99609375, "learning_rate": 0.0004981057259983839, "loss": 6.1792, "mean_token_accuracy": 0.13146117553114892, "num_tokens": 2073362.0, "step": 1125 }, { "entropy": 6.084898853302002, "epoch": 0.06322916375234311, "grad_norm": 0.96875, "learning_rate": 0.0004979501191000262, "loss": 6.1211, "mean_token_accuracy": 0.1346506245434284, "num_tokens": 2084147.0, "step": 1130 }, { "entropy": 6.200892496109009, "epoch": 0.0635089388131942, "grad_norm": 1.1953125, "learning_rate": 0.0004977883999115311, "loss": 6.1341, "mean_token_accuracy": 0.13276908472180365, "num_tokens": 2092935.0, "step": 1135 }, { "entropy": 6.094279527664185, "epoch": 0.06378871387404526, "grad_norm": 1.03125, "learning_rate": 0.0004976205728665113, "loss": 6.093, "mean_token_accuracy": 0.12623411193490028, "num_tokens": 2102171.0, "step": 1140 }, { "entropy": 6.0519288063049315, "epoch": 0.06406848893489635, "grad_norm": 1.0625, "learning_rate": 0.0004974466425660307, "loss": 6.0228, "mean_token_accuracy": 0.12940095067024232, "num_tokens": 2111058.0, "step": 1145 }, { "entropy": 6.045443391799926, "epoch": 0.06434826399574742, "grad_norm": 1.0, "learning_rate": 0.0004972666137784759, "loss": 6.1107, "mean_token_accuracy": 0.12719337344169618, "num_tokens": 2121625.0, "step": 1150 }, { "entropy": 6.138291120529175, "epoch": 0.06462803905659849, "grad_norm": 1.109375, "learning_rate": 0.0004970804914394271, "loss": 6.1483, "mean_token_accuracy": 0.13135300874710082, "num_tokens": 2130579.0, "step": 1155 }, { "entropy": 6.1703227996826175, "epoch": 0.06490781411744957, "grad_norm": 1.1015625, "learning_rate": 0.0004968882806515225, "loss": 6.1395, "mean_token_accuracy": 0.13054983094334602, "num_tokens": 2139740.0, "step": 1160 }, { "entropy": 6.054456043243408, "epoch": 0.06518758917830064, "grad_norm": 1.046875, "learning_rate": 0.0004966899866843177, "loss": 6.0175, "mean_token_accuracy": 0.1341743990778923, "num_tokens": 2148979.0, "step": 1165 }, { "entropy": 6.132187175750732, "epoch": 0.06546736423915173, "grad_norm": 1.0234375, "learning_rate": 0.000496485614974142, "loss": 6.0834, "mean_token_accuracy": 0.13612435460090638, "num_tokens": 2158763.0, "step": 1170 }, { "entropy": 5.968607091903687, "epoch": 0.0657471393000028, "grad_norm": 1.09375, "learning_rate": 0.0004962751711239492, "loss": 6.0562, "mean_token_accuracy": 0.13252341449260713, "num_tokens": 2167467.0, "step": 1175 }, { "entropy": 6.1014035701751705, "epoch": 0.06602691436085387, "grad_norm": 1.1015625, "learning_rate": 0.0004960586609031636, "loss": 6.0275, "mean_token_accuracy": 0.1407083511352539, "num_tokens": 2176301.0, "step": 1180 }, { "entropy": 6.166369771957397, "epoch": 0.06630668942170495, "grad_norm": 0.98046875, "learning_rate": 0.0004958360902475224, "loss": 6.1894, "mean_token_accuracy": 0.12619131281971932, "num_tokens": 2186573.0, "step": 1185 }, { "entropy": 6.072562885284424, "epoch": 0.06658646448255602, "grad_norm": 1.0625, "learning_rate": 0.0004956074652589125, "loss": 6.0853, "mean_token_accuracy": 0.13995079696178436, "num_tokens": 2196103.0, "step": 1190 }, { "entropy": 6.144318675994873, "epoch": 0.0668662395434071, "grad_norm": 1.0859375, "learning_rate": 0.0004953727922052035, "loss": 6.1884, "mean_token_accuracy": 0.1341054804623127, "num_tokens": 2205054.0, "step": 1195 }, { "entropy": 6.119494533538818, "epoch": 0.06714601460425818, "grad_norm": 1.1015625, "learning_rate": 0.0004951320775200756, "loss": 6.0807, "mean_token_accuracy": 0.13546809777617455, "num_tokens": 2214393.0, "step": 1200 }, { "entropy": 6.104378938674927, "epoch": 0.06742578966510925, "grad_norm": 1.09375, "learning_rate": 0.0004948853278028436, "loss": 6.0984, "mean_token_accuracy": 0.13463159203529357, "num_tokens": 2223156.0, "step": 1205 }, { "entropy": 5.997931098937988, "epoch": 0.06770556472596033, "grad_norm": 1.1015625, "learning_rate": 0.0004946325498182755, "loss": 5.9095, "mean_token_accuracy": 0.14642671197652818, "num_tokens": 2232615.0, "step": 1210 }, { "entropy": 5.989495754241943, "epoch": 0.0679853397868114, "grad_norm": 1.015625, "learning_rate": 0.0004943737504964076, "loss": 6.032, "mean_token_accuracy": 0.13626188561320304, "num_tokens": 2241861.0, "step": 1215 }, { "entropy": 6.171738052368164, "epoch": 0.06826511484766248, "grad_norm": 0.97265625, "learning_rate": 0.000494108936932354, "loss": 6.0784, "mean_token_accuracy": 0.13429959192872049, "num_tokens": 2250560.0, "step": 1220 }, { "entropy": 5.999643325805664, "epoch": 0.06854488990851355, "grad_norm": 1.015625, "learning_rate": 0.0004938381163861124, "loss": 6.0382, "mean_token_accuracy": 0.13456141278147699, "num_tokens": 2259886.0, "step": 1225 }, { "entropy": 6.037774181365966, "epoch": 0.06882466496936462, "grad_norm": 0.98828125, "learning_rate": 0.0004935612962823645, "loss": 6.0568, "mean_token_accuracy": 0.13611846044659615, "num_tokens": 2269164.0, "step": 1230 }, { "entropy": 6.075514221191407, "epoch": 0.06910444003021571, "grad_norm": 1.0859375, "learning_rate": 0.0004932784842102739, "loss": 6.0526, "mean_token_accuracy": 0.13547588810324668, "num_tokens": 2279249.0, "step": 1235 }, { "entropy": 5.919833517074585, "epoch": 0.06938421509106678, "grad_norm": 1.2109375, "learning_rate": 0.0004929896879232758, "loss": 5.9801, "mean_token_accuracy": 0.13657484874129294, "num_tokens": 2288718.0, "step": 1240 }, { "entropy": 6.145425939559937, "epoch": 0.06966399015191786, "grad_norm": 1.1015625, "learning_rate": 0.0004926949153388668, "loss": 6.0597, "mean_token_accuracy": 0.12783288657665254, "num_tokens": 2298229.0, "step": 1245 }, { "entropy": 5.909711217880249, "epoch": 0.06994376521276893, "grad_norm": 1.0703125, "learning_rate": 0.0004923941745383859, "loss": 5.8838, "mean_token_accuracy": 0.13935036435723305, "num_tokens": 2306653.0, "step": 1250 }, { "entropy": 5.887778854370117, "epoch": 0.07022354027362, "grad_norm": 1.0078125, "learning_rate": 0.000492087473766794, "loss": 5.9156, "mean_token_accuracy": 0.13955688923597337, "num_tokens": 2315208.0, "step": 1255 }, { "entropy": 6.065791368484497, "epoch": 0.07050331533447109, "grad_norm": 1.1171875, "learning_rate": 0.000491774821432448, "loss": 6.0315, "mean_token_accuracy": 0.130626330524683, "num_tokens": 2324961.0, "step": 1260 }, { "entropy": 6.033606243133545, "epoch": 0.07078309039532216, "grad_norm": 1.125, "learning_rate": 0.0004914562261068693, "loss": 6.0616, "mean_token_accuracy": 0.13088881224393845, "num_tokens": 2334256.0, "step": 1265 }, { "entropy": 6.069367837905884, "epoch": 0.07106286545617324, "grad_norm": 0.99609375, "learning_rate": 0.0004911316965245098, "loss": 6.0265, "mean_token_accuracy": 0.1418687731027603, "num_tokens": 2343492.0, "step": 1270 }, { "entropy": 6.121695137023925, "epoch": 0.07134264051702431, "grad_norm": 1.15625, "learning_rate": 0.000490801241582512, "loss": 6.0167, "mean_token_accuracy": 0.1412626601755619, "num_tokens": 2352727.0, "step": 1275 }, { "entropy": 5.919157314300537, "epoch": 0.07162241557787538, "grad_norm": 1.09375, "learning_rate": 0.000490464870340465, "loss": 5.9976, "mean_token_accuracy": 0.13838816434144974, "num_tokens": 2360636.0, "step": 1280 }, { "entropy": 5.9637549877166744, "epoch": 0.07190219063872647, "grad_norm": 1.03125, "learning_rate": 0.0004901225920201563, "loss": 5.9973, "mean_token_accuracy": 0.13623869940638542, "num_tokens": 2370125.0, "step": 1285 }, { "entropy": 6.089365005493164, "epoch": 0.07218196569957754, "grad_norm": 0.9921875, "learning_rate": 0.000489774416005319, "loss": 6.0691, "mean_token_accuracy": 0.1390392377972603, "num_tokens": 2379304.0, "step": 1290 }, { "entropy": 6.113597965240478, "epoch": 0.07246174076042862, "grad_norm": 1.0859375, "learning_rate": 0.0004894203518413742, "loss": 6.09, "mean_token_accuracy": 0.13678146675229072, "num_tokens": 2387675.0, "step": 1295 }, { "entropy": 5.936979913711548, "epoch": 0.07274151582127969, "grad_norm": 0.9765625, "learning_rate": 0.0004890604092351701, "loss": 5.8828, "mean_token_accuracy": 0.14058420360088347, "num_tokens": 2397864.0, "step": 1300 }, { "entropy": 6.052834844589233, "epoch": 0.07302129088213077, "grad_norm": 1.109375, "learning_rate": 0.000488694598054715, "loss": 6.0722, "mean_token_accuracy": 0.1325170412659645, "num_tokens": 2407331.0, "step": 1305 }, { "entropy": 6.074975156784058, "epoch": 0.07330106594298184, "grad_norm": 1.078125, "learning_rate": 0.0004883229283289071, "loss": 6.1352, "mean_token_accuracy": 0.13703541383147239, "num_tokens": 2416223.0, "step": 1310 }, { "entropy": 6.142674922943115, "epoch": 0.07358084100383291, "grad_norm": 0.9921875, "learning_rate": 0.00048794541024725993, "loss": 6.0507, "mean_token_accuracy": 0.13307311311364173, "num_tokens": 2425613.0, "step": 1315 }, { "entropy": 6.002810144424439, "epoch": 0.073860616064684, "grad_norm": 0.9921875, "learning_rate": 0.0004875620541596221, "loss": 5.9785, "mean_token_accuracy": 0.13989573642611502, "num_tokens": 2435113.0, "step": 1320 }, { "entropy": 6.066500616073609, "epoch": 0.07414039112553507, "grad_norm": 1.0390625, "learning_rate": 0.00048717287057589454, "loss": 6.0536, "mean_token_accuracy": 0.12933120951056482, "num_tokens": 2445220.0, "step": 1325 }, { "entropy": 6.000797414779663, "epoch": 0.07442016618638615, "grad_norm": 0.99609375, "learning_rate": 0.0004867778701657417, "loss": 5.9754, "mean_token_accuracy": 0.1440178468823433, "num_tokens": 2454018.0, "step": 1330 }, { "entropy": 5.96698956489563, "epoch": 0.07469994124723722, "grad_norm": 1.0859375, "learning_rate": 0.00048637706375829955, "loss": 6.0175, "mean_token_accuracy": 0.1343780502676964, "num_tokens": 2462697.0, "step": 1335 }, { "entropy": 5.981861972808838, "epoch": 0.07497971630808829, "grad_norm": 1.125, "learning_rate": 0.000485970462341878, "loss": 5.881, "mean_token_accuracy": 0.14209071397781373, "num_tokens": 2470955.0, "step": 1340 }, { "entropy": 5.978409051895142, "epoch": 0.07525949136893938, "grad_norm": 1.0, "learning_rate": 0.00048555807706366044, "loss": 6.0263, "mean_token_accuracy": 0.1370713584125042, "num_tokens": 2481289.0, "step": 1345 }, { "entropy": 6.006068325042724, "epoch": 0.07553926642979045, "grad_norm": 0.9609375, "learning_rate": 0.00048513991922939756, "loss": 5.9394, "mean_token_accuracy": 0.13935732543468476, "num_tokens": 2490211.0, "step": 1350 }, { "entropy": 5.96335654258728, "epoch": 0.07581904149064153, "grad_norm": 1.0390625, "learning_rate": 0.00048471600030309744, "loss": 5.9392, "mean_token_accuracy": 0.1420755535364151, "num_tokens": 2499427.0, "step": 1355 }, { "entropy": 5.9545855045318605, "epoch": 0.0760988165514926, "grad_norm": 1.125, "learning_rate": 0.00048428633190671186, "loss": 6.0577, "mean_token_accuracy": 0.14104050919413566, "num_tokens": 2508949.0, "step": 1360 }, { "entropy": 5.962803792953491, "epoch": 0.07637859161234367, "grad_norm": 1.0, "learning_rate": 0.0004838509258198167, "loss": 6.062, "mean_token_accuracy": 0.13880110532045364, "num_tokens": 2518095.0, "step": 1365 }, { "entropy": 6.13924994468689, "epoch": 0.07665836667319476, "grad_norm": 1.0625, "learning_rate": 0.00048340979397929, "loss": 6.0762, "mean_token_accuracy": 0.136734339594841, "num_tokens": 2527117.0, "step": 1370 }, { "entropy": 5.99510087966919, "epoch": 0.07693814173404583, "grad_norm": 1.09375, "learning_rate": 0.00048296294847898386, "loss": 5.9141, "mean_token_accuracy": 0.13932174667716027, "num_tokens": 2536279.0, "step": 1375 }, { "entropy": 5.921843957901001, "epoch": 0.07721791679489691, "grad_norm": 1.0390625, "learning_rate": 0.0004825104015693934, "loss": 5.9203, "mean_token_accuracy": 0.14011373966932297, "num_tokens": 2545626.0, "step": 1380 }, { "entropy": 5.997140789031983, "epoch": 0.07749769185574798, "grad_norm": 1.0390625, "learning_rate": 0.0004820521656573208, "loss": 5.9161, "mean_token_accuracy": 0.14312618374824523, "num_tokens": 2555344.0, "step": 1385 }, { "entropy": 5.960200071334839, "epoch": 0.07777746691659905, "grad_norm": 1.046875, "learning_rate": 0.00048158825330553505, "loss": 5.9875, "mean_token_accuracy": 0.13562597557902337, "num_tokens": 2563585.0, "step": 1390 }, { "entropy": 6.02376651763916, "epoch": 0.07805724197745013, "grad_norm": 1.03125, "learning_rate": 0.00048111867723242763, "loss": 5.9862, "mean_token_accuracy": 0.13781619295477868, "num_tokens": 2574271.0, "step": 1395 }, { "entropy": 5.9488640308380125, "epoch": 0.0783370170383012, "grad_norm": 1.1640625, "learning_rate": 0.0004806434503116637, "loss": 6.0179, "mean_token_accuracy": 0.14232801273465157, "num_tokens": 2583403.0, "step": 1400 }, { "entropy": 6.033678197860718, "epoch": 0.07861679209915229, "grad_norm": 1.046875, "learning_rate": 0.0004801625855718296, "loss": 5.9564, "mean_token_accuracy": 0.14341139122843743, "num_tokens": 2592821.0, "step": 1405 }, { "entropy": 5.933608961105347, "epoch": 0.07889656716000336, "grad_norm": 1.0859375, "learning_rate": 0.00047967609619607477, "loss": 5.9287, "mean_token_accuracy": 0.14294352680444716, "num_tokens": 2600722.0, "step": 1410 }, { "entropy": 5.951407432556152, "epoch": 0.07917634222085443, "grad_norm": 1.0234375, "learning_rate": 0.0004791839955217513, "loss": 5.9035, "mean_token_accuracy": 0.14061676412820817, "num_tokens": 2610247.0, "step": 1415 }, { "entropy": 5.868547248840332, "epoch": 0.07945611728170551, "grad_norm": 1.0234375, "learning_rate": 0.00047868629704004786, "loss": 5.8516, "mean_token_accuracy": 0.14847285747528077, "num_tokens": 2619910.0, "step": 1420 }, { "entropy": 6.010308027267456, "epoch": 0.07973589234255658, "grad_norm": 0.93359375, "learning_rate": 0.00047818301439561965, "loss": 5.8662, "mean_token_accuracy": 0.14154235720634462, "num_tokens": 2630305.0, "step": 1425 }, { "entropy": 5.946945381164551, "epoch": 0.08001566740340767, "grad_norm": 1.0078125, "learning_rate": 0.00047767416138621454, "loss": 5.9705, "mean_token_accuracy": 0.13330617398023606, "num_tokens": 2640384.0, "step": 1430 }, { "entropy": 5.914110374450684, "epoch": 0.08029544246425874, "grad_norm": 1.0234375, "learning_rate": 0.000477159751962295, "loss": 5.9532, "mean_token_accuracy": 0.14388398304581643, "num_tokens": 2649581.0, "step": 1435 }, { "entropy": 5.905755853652954, "epoch": 0.08057521752510981, "grad_norm": 1.0703125, "learning_rate": 0.00047663980022665507, "loss": 5.8799, "mean_token_accuracy": 0.14454542994499206, "num_tokens": 2657869.0, "step": 1440 }, { "entropy": 6.033972454071045, "epoch": 0.08085499258596089, "grad_norm": 0.97265625, "learning_rate": 0.00047611432043403437, "loss": 6.0423, "mean_token_accuracy": 0.14180536717176437, "num_tokens": 2668168.0, "step": 1445 }, { "entropy": 5.979730415344238, "epoch": 0.08113476764681196, "grad_norm": 1.1015625, "learning_rate": 0.0004755833269907267, "loss": 5.9536, "mean_token_accuracy": 0.13616828471422196, "num_tokens": 2677186.0, "step": 1450 }, { "entropy": 5.9653160572052, "epoch": 0.08141454270766305, "grad_norm": 1.15625, "learning_rate": 0.0004750468344541857, "loss": 5.9105, "mean_token_accuracy": 0.14514605104923248, "num_tokens": 2686190.0, "step": 1455 }, { "entropy": 5.8910928726196286, "epoch": 0.08169431776851412, "grad_norm": 1.09375, "learning_rate": 0.00047450485753262525, "loss": 5.8872, "mean_token_accuracy": 0.14269855469465256, "num_tokens": 2694934.0, "step": 1460 }, { "entropy": 5.835767793655395, "epoch": 0.08197409282936519, "grad_norm": 1.1171875, "learning_rate": 0.00047395741108461633, "loss": 5.8839, "mean_token_accuracy": 0.14919260144233704, "num_tokens": 2703279.0, "step": 1465 }, { "entropy": 5.912254762649536, "epoch": 0.08225386789021627, "grad_norm": 1.078125, "learning_rate": 0.00047340451011867985, "loss": 5.8656, "mean_token_accuracy": 0.1445097081363201, "num_tokens": 2712403.0, "step": 1470 }, { "entropy": 5.985236167907715, "epoch": 0.08253364295106734, "grad_norm": 1.0390625, "learning_rate": 0.00047284616979287515, "loss": 5.8784, "mean_token_accuracy": 0.14578445255756378, "num_tokens": 2721136.0, "step": 1475 }, { "entropy": 5.843273448944092, "epoch": 0.08281341801191842, "grad_norm": 1.0390625, "learning_rate": 0.00047228240541438433, "loss": 5.8445, "mean_token_accuracy": 0.1495327726006508, "num_tokens": 2730539.0, "step": 1480 }, { "entropy": 5.872775030136109, "epoch": 0.0830931930727695, "grad_norm": 0.98046875, "learning_rate": 0.00047171323243909257, "loss": 5.9154, "mean_token_accuracy": 0.14278722032904625, "num_tokens": 2740412.0, "step": 1485 }, { "entropy": 5.952418088912964, "epoch": 0.08337296813362056, "grad_norm": 1.078125, "learning_rate": 0.00047113866647116457, "loss": 5.878, "mean_token_accuracy": 0.14550314098596573, "num_tokens": 2749763.0, "step": 1490 }, { "entropy": 5.902268743515014, "epoch": 0.08365274319447165, "grad_norm": 1.1015625, "learning_rate": 0.0004705587232626164, "loss": 5.9027, "mean_token_accuracy": 0.14427887573838233, "num_tokens": 2758399.0, "step": 1495 }, { "entropy": 5.904958009719849, "epoch": 0.08393251825532272, "grad_norm": 1.015625, "learning_rate": 0.00046997341871288424, "loss": 5.8894, "mean_token_accuracy": 0.14721864312887192, "num_tokens": 2767806.0, "step": 1500 }, { "entropy": 5.940085363388062, "epoch": 0.0842122933161738, "grad_norm": 1.0, "learning_rate": 0.0004693827688683879, "loss": 5.8271, "mean_token_accuracy": 0.14912354052066804, "num_tokens": 2776697.0, "step": 1505 }, { "entropy": 5.986412858963012, "epoch": 0.08449206837702487, "grad_norm": 1.015625, "learning_rate": 0.0004687867899220914, "loss": 6.0513, "mean_token_accuracy": 0.1391066186130047, "num_tokens": 2786546.0, "step": 1510 }, { "entropy": 5.869002628326416, "epoch": 0.08477184343787594, "grad_norm": 1.0859375, "learning_rate": 0.00046818549821305846, "loss": 5.7888, "mean_token_accuracy": 0.15096474960446357, "num_tokens": 2794960.0, "step": 1515 }, { "entropy": 5.829828214645386, "epoch": 0.08505161849872703, "grad_norm": 1.1328125, "learning_rate": 0.00046757891022600494, "loss": 5.8434, "mean_token_accuracy": 0.14856993556022643, "num_tokens": 2804126.0, "step": 1520 }, { "entropy": 5.918961811065674, "epoch": 0.0853313935595781, "grad_norm": 1.125, "learning_rate": 0.0004669670425908471, "loss": 5.8175, "mean_token_accuracy": 0.14590021967887878, "num_tokens": 2812853.0, "step": 1525 }, { "entropy": 5.766618728637695, "epoch": 0.08561116862042918, "grad_norm": 1.0625, "learning_rate": 0.0004663499120822451, "loss": 5.728, "mean_token_accuracy": 0.1575191080570221, "num_tokens": 2821812.0, "step": 1530 }, { "entropy": 5.8912958145141605, "epoch": 0.08589094368128025, "grad_norm": 0.97265625, "learning_rate": 0.0004657275356191437, "loss": 5.9267, "mean_token_accuracy": 0.1414273500442505, "num_tokens": 2831657.0, "step": 1535 }, { "entropy": 5.941652011871338, "epoch": 0.08617071874213132, "grad_norm": 1.0546875, "learning_rate": 0.00046509993026430804, "loss": 5.9018, "mean_token_accuracy": 0.1418527767062187, "num_tokens": 2841496.0, "step": 1540 }, { "entropy": 5.967176198959351, "epoch": 0.0864504938029824, "grad_norm": 1.0234375, "learning_rate": 0.0004644671132238558, "loss": 5.8886, "mean_token_accuracy": 0.14426299482583999, "num_tokens": 2850984.0, "step": 1545 }, { "entropy": 5.774064016342163, "epoch": 0.08673026886383348, "grad_norm": 1.2578125, "learning_rate": 0.00046382910184678585, "loss": 5.8043, "mean_token_accuracy": 0.14789169430732726, "num_tokens": 2859682.0, "step": 1550 }, { "entropy": 5.936661148071289, "epoch": 0.08701004392468456, "grad_norm": 1.140625, "learning_rate": 0.0004631859136245025, "loss": 5.925, "mean_token_accuracy": 0.14146076440811156, "num_tokens": 2868652.0, "step": 1555 }, { "entropy": 5.8458904266357425, "epoch": 0.08728981898553563, "grad_norm": 1.0078125, "learning_rate": 0.0004625375661903357, "loss": 5.8257, "mean_token_accuracy": 0.1500212162733078, "num_tokens": 2878151.0, "step": 1560 }, { "entropy": 5.714489269256592, "epoch": 0.0875695940463867, "grad_norm": 1.0859375, "learning_rate": 0.00046188407731905787, "loss": 5.6634, "mean_token_accuracy": 0.1576072409749031, "num_tokens": 2887171.0, "step": 1565 }, { "entropy": 5.947921180725098, "epoch": 0.08784936910723778, "grad_norm": 1.0625, "learning_rate": 0.00046122546492639643, "loss": 5.9038, "mean_token_accuracy": 0.14779970645904542, "num_tokens": 2896217.0, "step": 1570 }, { "entropy": 5.8732991218566895, "epoch": 0.08812914416808885, "grad_norm": 1.03125, "learning_rate": 0.000460561747068543, "loss": 5.8941, "mean_token_accuracy": 0.14265499711036683, "num_tokens": 2905272.0, "step": 1575 }, { "entropy": 5.916759490966797, "epoch": 0.08840891922893994, "grad_norm": 1.1328125, "learning_rate": 0.0004598929419416578, "loss": 5.8228, "mean_token_accuracy": 0.14375049173831939, "num_tokens": 2914297.0, "step": 1580 }, { "entropy": 5.826504182815552, "epoch": 0.08868869428979101, "grad_norm": 0.95703125, "learning_rate": 0.00045921906788137123, "loss": 5.8364, "mean_token_accuracy": 0.147948782145977, "num_tokens": 2922872.0, "step": 1585 }, { "entropy": 5.880048561096191, "epoch": 0.08896846935064208, "grad_norm": 1.0703125, "learning_rate": 0.00045854014336228115, "loss": 5.7398, "mean_token_accuracy": 0.14824217110872268, "num_tokens": 2932316.0, "step": 1590 }, { "entropy": 5.904519987106323, "epoch": 0.08924824441149316, "grad_norm": 1.046875, "learning_rate": 0.00045785618699744615, "loss": 5.9456, "mean_token_accuracy": 0.14554950594902039, "num_tokens": 2942041.0, "step": 1595 }, { "entropy": 5.872646474838257, "epoch": 0.08952801947234423, "grad_norm": 0.98828125, "learning_rate": 0.00045716721753787543, "loss": 5.8871, "mean_token_accuracy": 0.14541386142373086, "num_tokens": 2951726.0, "step": 1600 }, { "entropy": 5.891257953643799, "epoch": 0.08980779453319532, "grad_norm": 1.03125, "learning_rate": 0.0004564732538720148, "loss": 5.8248, "mean_token_accuracy": 0.1563461571931839, "num_tokens": 2961008.0, "step": 1605 }, { "entropy": 5.745857095718383, "epoch": 0.09008756959404639, "grad_norm": 1.0234375, "learning_rate": 0.00045577431502522877, "loss": 5.7829, "mean_token_accuracy": 0.15594240054488182, "num_tokens": 2970007.0, "step": 1610 }, { "entropy": 5.933908319473266, "epoch": 0.09036734465489746, "grad_norm": 1.1796875, "learning_rate": 0.0004550704201592787, "loss": 5.9097, "mean_token_accuracy": 0.14012961015105246, "num_tokens": 2979060.0, "step": 1615 }, { "entropy": 5.837322330474853, "epoch": 0.09064711971574854, "grad_norm": 1.0078125, "learning_rate": 0.0004543615885717981, "loss": 5.8085, "mean_token_accuracy": 0.15124776661396028, "num_tokens": 2987902.0, "step": 1620 }, { "entropy": 5.794670820236206, "epoch": 0.09092689477659961, "grad_norm": 0.9921875, "learning_rate": 0.00045364783969576296, "loss": 5.7841, "mean_token_accuracy": 0.15281061828136444, "num_tokens": 2996427.0, "step": 1625 }, { "entropy": 5.938097763061523, "epoch": 0.0912066698374507, "grad_norm": 1.1015625, "learning_rate": 0.0004529291930989592, "loss": 5.9298, "mean_token_accuracy": 0.14550916701555253, "num_tokens": 3005579.0, "step": 1630 }, { "entropy": 5.839151525497437, "epoch": 0.09148644489830177, "grad_norm": 1.046875, "learning_rate": 0.0004522056684834464, "loss": 5.8458, "mean_token_accuracy": 0.14142662063241004, "num_tokens": 3014625.0, "step": 1635 }, { "entropy": 5.845537948608398, "epoch": 0.09176621995915284, "grad_norm": 1.125, "learning_rate": 0.0004514772856850173, "loss": 5.8346, "mean_token_accuracy": 0.15203074961900712, "num_tokens": 3023806.0, "step": 1640 }, { "entropy": 5.958638095855713, "epoch": 0.09204599502000392, "grad_norm": 1.0703125, "learning_rate": 0.0004507440646726542, "loss": 5.8805, "mean_token_accuracy": 0.14775419160723685, "num_tokens": 3033731.0, "step": 1645 }, { "entropy": 5.848289918899536, "epoch": 0.09232577008085499, "grad_norm": 1.078125, "learning_rate": 0.0004500060255479818, "loss": 5.8347, "mean_token_accuracy": 0.15215797871351242, "num_tokens": 3042264.0, "step": 1650 }, { "entropy": 5.851382160186768, "epoch": 0.09260554514170607, "grad_norm": 1.0390625, "learning_rate": 0.0004492631885447151, "loss": 5.7683, "mean_token_accuracy": 0.1552473321557045, "num_tokens": 3051400.0, "step": 1655 }, { "entropy": 5.8827508926391605, "epoch": 0.09288532020255715, "grad_norm": 1.046875, "learning_rate": 0.00044851557402810616, "loss": 5.8743, "mean_token_accuracy": 0.14523063153028487, "num_tokens": 3061509.0, "step": 1660 }, { "entropy": 5.831000280380249, "epoch": 0.09316509526340822, "grad_norm": 1.0390625, "learning_rate": 0.00044776320249438444, "loss": 5.7975, "mean_token_accuracy": 0.1502298593521118, "num_tokens": 3070318.0, "step": 1665 }, { "entropy": 5.940295314788818, "epoch": 0.0934448703242593, "grad_norm": 1.0078125, "learning_rate": 0.00044700609457019565, "loss": 5.8728, "mean_token_accuracy": 0.14855741560459138, "num_tokens": 3079429.0, "step": 1670 }, { "entropy": 5.8560706615448, "epoch": 0.09372464538511037, "grad_norm": 1.0625, "learning_rate": 0.0004462442710120359, "loss": 5.8562, "mean_token_accuracy": 0.14453537240624428, "num_tokens": 3088500.0, "step": 1675 }, { "entropy": 5.8202159881591795, "epoch": 0.09400442044596145, "grad_norm": 1.015625, "learning_rate": 0.000445477752705683, "loss": 5.6646, "mean_token_accuracy": 0.15873004794120787, "num_tokens": 3096773.0, "step": 1680 }, { "entropy": 5.865380382537841, "epoch": 0.09428419550681252, "grad_norm": 1.0546875, "learning_rate": 0.00044470656066562336, "loss": 5.9004, "mean_token_accuracy": 0.1546894833445549, "num_tokens": 3105790.0, "step": 1685 }, { "entropy": 5.847274351119995, "epoch": 0.0945639705676636, "grad_norm": 1.078125, "learning_rate": 0.0004439307160344765, "loss": 5.7629, "mean_token_accuracy": 0.14811273217201232, "num_tokens": 3114771.0, "step": 1690 }, { "entropy": 5.755411386489868, "epoch": 0.09484374562851468, "grad_norm": 1.1875, "learning_rate": 0.00044315024008241473, "loss": 5.7518, "mean_token_accuracy": 0.1524191528558731, "num_tokens": 3123910.0, "step": 1695 }, { "entropy": 5.929304456710815, "epoch": 0.09512352068936575, "grad_norm": 1.0625, "learning_rate": 0.0004423651542065806, "loss": 5.9395, "mean_token_accuracy": 0.14688817262649537, "num_tokens": 3132768.0, "step": 1700 }, { "entropy": 5.849935054779053, "epoch": 0.09540329575021683, "grad_norm": 0.984375, "learning_rate": 0.00044157547993050006, "loss": 5.9083, "mean_token_accuracy": 0.14470150023698808, "num_tokens": 3142756.0, "step": 1705 }, { "entropy": 5.984419918060302, "epoch": 0.0956830708110679, "grad_norm": 1.0390625, "learning_rate": 0.00044078123890349227, "loss": 5.8962, "mean_token_accuracy": 0.13943962305784224, "num_tokens": 3152669.0, "step": 1710 }, { "entropy": 5.865299320220947, "epoch": 0.09596284587191897, "grad_norm": 1.125, "learning_rate": 0.00043998245290007606, "loss": 5.8348, "mean_token_accuracy": 0.1498618744313717, "num_tokens": 3161543.0, "step": 1715 }, { "entropy": 5.7853340148925785, "epoch": 0.09624262093277006, "grad_norm": 1.078125, "learning_rate": 0.00043917914381937323, "loss": 5.7204, "mean_token_accuracy": 0.15875888466835023, "num_tokens": 3170005.0, "step": 1720 }, { "entropy": 5.8889477252960205, "epoch": 0.09652239599362113, "grad_norm": 1.0625, "learning_rate": 0.00043837133368450815, "loss": 5.765, "mean_token_accuracy": 0.15774014294147493, "num_tokens": 3178523.0, "step": 1725 }, { "entropy": 5.762332582473755, "epoch": 0.09680217105447221, "grad_norm": 1.078125, "learning_rate": 0.0004375590446420037, "loss": 5.7502, "mean_token_accuracy": 0.15568190366029738, "num_tokens": 3186862.0, "step": 1730 }, { "entropy": 5.808806610107422, "epoch": 0.09708194611532328, "grad_norm": 1.03125, "learning_rate": 0.0004367422989611743, "loss": 5.8177, "mean_token_accuracy": 0.14879435077309608, "num_tokens": 3195507.0, "step": 1735 }, { "entropy": 5.814892578125, "epoch": 0.09736172117617435, "grad_norm": 1.0546875, "learning_rate": 0.0004359211190335153, "loss": 5.7301, "mean_token_accuracy": 0.1576648697257042, "num_tokens": 3205063.0, "step": 1740 }, { "entropy": 5.857382678985596, "epoch": 0.09764149623702544, "grad_norm": 0.9765625, "learning_rate": 0.00043509552737208923, "loss": 5.8824, "mean_token_accuracy": 0.1520813412964344, "num_tokens": 3214797.0, "step": 1745 }, { "entropy": 5.891229486465454, "epoch": 0.0979212712978765, "grad_norm": 1.1015625, "learning_rate": 0.00043426554661090853, "loss": 5.8293, "mean_token_accuracy": 0.14855243861675263, "num_tokens": 3223923.0, "step": 1750 }, { "entropy": 5.783728313446045, "epoch": 0.09820104635872759, "grad_norm": 1.0546875, "learning_rate": 0.00043343119950431516, "loss": 5.7031, "mean_token_accuracy": 0.1542630076408386, "num_tokens": 3232975.0, "step": 1755 }, { "entropy": 5.7834454536437985, "epoch": 0.09848082141957866, "grad_norm": 1.0859375, "learning_rate": 0.00043259250892635644, "loss": 5.7533, "mean_token_accuracy": 0.15687773674726485, "num_tokens": 3242196.0, "step": 1760 }, { "entropy": 5.874407386779785, "epoch": 0.09876059648042973, "grad_norm": 1.0546875, "learning_rate": 0.0004317494978701582, "loss": 5.7765, "mean_token_accuracy": 0.15025516897439956, "num_tokens": 3251248.0, "step": 1765 }, { "entropy": 5.869711256027221, "epoch": 0.09904037154128081, "grad_norm": 1.0625, "learning_rate": 0.0004309021894472943, "loss": 5.8438, "mean_token_accuracy": 0.14714980125427246, "num_tokens": 3260195.0, "step": 1770 }, { "entropy": 5.891108465194702, "epoch": 0.09932014660213188, "grad_norm": 1.0390625, "learning_rate": 0.0004300506068871534, "loss": 5.9635, "mean_token_accuracy": 0.1442213699221611, "num_tokens": 3270222.0, "step": 1775 }, { "entropy": 5.77832818031311, "epoch": 0.09959992166298297, "grad_norm": 1.046875, "learning_rate": 0.00042919477353630135, "loss": 5.7354, "mean_token_accuracy": 0.15076944306492807, "num_tokens": 3278820.0, "step": 1780 }, { "entropy": 5.884161472320557, "epoch": 0.09987969672383404, "grad_norm": 0.9140625, "learning_rate": 0.000428334712857842, "loss": 5.7799, "mean_token_accuracy": 0.15692438632249833, "num_tokens": 3288100.0, "step": 1785 }, { "entropy": 5.828272151947021, "epoch": 0.10015947178468511, "grad_norm": 0.9609375, "learning_rate": 0.00042747044843077304, "loss": 5.8622, "mean_token_accuracy": 0.15525175929069518, "num_tokens": 3297072.0, "step": 1790 }, { "entropy": 5.886663436889648, "epoch": 0.10043924684553619, "grad_norm": 0.87890625, "learning_rate": 0.00042660200394934047, "loss": 5.814, "mean_token_accuracy": 0.15353555828332902, "num_tokens": 3307118.0, "step": 1795 }, { "entropy": 5.896843290328979, "epoch": 0.10071902190638726, "grad_norm": 1.03125, "learning_rate": 0.00042572940322238844, "loss": 5.8843, "mean_token_accuracy": 0.15529625564813615, "num_tokens": 3317168.0, "step": 1800 }, { "entropy": 5.82907190322876, "epoch": 0.10099879696723835, "grad_norm": 1.09375, "learning_rate": 0.00042485267017270664, "loss": 5.7186, "mean_token_accuracy": 0.15322525203227996, "num_tokens": 3325997.0, "step": 1805 }, { "entropy": 5.7322102069854735, "epoch": 0.10127857202808942, "grad_norm": 1.0234375, "learning_rate": 0.0004239718288363745, "loss": 5.7527, "mean_token_accuracy": 0.15010084211826324, "num_tokens": 3335911.0, "step": 1810 }, { "entropy": 5.804552745819092, "epoch": 0.10155834708894049, "grad_norm": 1.1875, "learning_rate": 0.0004230869033621023, "loss": 5.7819, "mean_token_accuracy": 0.14746056646108627, "num_tokens": 3345910.0, "step": 1815 }, { "entropy": 5.685170221328735, "epoch": 0.10183812214979157, "grad_norm": 1.015625, "learning_rate": 0.0004221979180105688, "loss": 5.7406, "mean_token_accuracy": 0.15606738328933717, "num_tokens": 3355076.0, "step": 1820 }, { "entropy": 5.978805017471314, "epoch": 0.10211789721064264, "grad_norm": 1.03125, "learning_rate": 0.00042130489715375645, "loss": 5.859, "mean_token_accuracy": 0.1493694469332695, "num_tokens": 3364029.0, "step": 1825 }, { "entropy": 5.904508972167969, "epoch": 0.10239767227149373, "grad_norm": 1.0703125, "learning_rate": 0.00042040786527428335, "loss": 5.9181, "mean_token_accuracy": 0.15003095120191573, "num_tokens": 3373010.0, "step": 1830 }, { "entropy": 5.8470189571380615, "epoch": 0.1026774473323448, "grad_norm": 1.0078125, "learning_rate": 0.0004195068469647315, "loss": 5.7774, "mean_token_accuracy": 0.15928260385990142, "num_tokens": 3381690.0, "step": 1835 }, { "entropy": 5.757124423980713, "epoch": 0.10295722239319587, "grad_norm": 0.95703125, "learning_rate": 0.00041860186692697297, "loss": 5.8669, "mean_token_accuracy": 0.14969682320952415, "num_tokens": 3392589.0, "step": 1840 }, { "entropy": 5.877426481246948, "epoch": 0.10323699745404695, "grad_norm": 1.0, "learning_rate": 0.00041769294997149264, "loss": 5.7542, "mean_token_accuracy": 0.1540641151368618, "num_tokens": 3401099.0, "step": 1845 }, { "entropy": 5.998667240142822, "epoch": 0.10351677251489802, "grad_norm": 1.0, "learning_rate": 0.0004167801210167081, "loss": 5.9095, "mean_token_accuracy": 0.14992498010396957, "num_tokens": 3409802.0, "step": 1850 }, { "entropy": 5.82662444114685, "epoch": 0.1037965475757491, "grad_norm": 1.0546875, "learning_rate": 0.0004158634050882861, "loss": 5.7291, "mean_token_accuracy": 0.15522693246603012, "num_tokens": 3419189.0, "step": 1855 }, { "entropy": 5.671156597137451, "epoch": 0.10407632263660017, "grad_norm": 0.96875, "learning_rate": 0.0004149428273184569, "loss": 5.6916, "mean_token_accuracy": 0.15602488368749617, "num_tokens": 3428867.0, "step": 1860 }, { "entropy": 5.9138130187988285, "epoch": 0.10435609769745124, "grad_norm": 1.1171875, "learning_rate": 0.0004140184129453253, "loss": 5.8238, "mean_token_accuracy": 0.15095819532871246, "num_tokens": 3437739.0, "step": 1865 }, { "entropy": 5.779176378250122, "epoch": 0.10463587275830233, "grad_norm": 1.015625, "learning_rate": 0.000413090187312178, "loss": 5.7608, "mean_token_accuracy": 0.1563764899969101, "num_tokens": 3446673.0, "step": 1870 }, { "entropy": 5.898364496231079, "epoch": 0.1049156478191534, "grad_norm": 1.0625, "learning_rate": 0.0004121581758667898, "loss": 5.8631, "mean_token_accuracy": 0.14789247065782546, "num_tokens": 3455877.0, "step": 1875 }, { "entropy": 5.761175918579101, "epoch": 0.10519542288000448, "grad_norm": 0.94921875, "learning_rate": 0.00041122240416072533, "loss": 5.7188, "mean_token_accuracy": 0.15582992881536484, "num_tokens": 3465306.0, "step": 1880 }, { "entropy": 5.758784818649292, "epoch": 0.10547519794085555, "grad_norm": 1.0859375, "learning_rate": 0.0004102828978486385, "loss": 5.7542, "mean_token_accuracy": 0.1611683338880539, "num_tokens": 3473784.0, "step": 1885 }, { "entropy": 5.922667503356934, "epoch": 0.10575497300170662, "grad_norm": 1.0078125, "learning_rate": 0.0004093396826875695, "loss": 5.7892, "mean_token_accuracy": 0.15390021204948426, "num_tokens": 3482843.0, "step": 1890 }, { "entropy": 5.8461333274841305, "epoch": 0.10603474806255771, "grad_norm": 1.03125, "learning_rate": 0.00040839278453623837, "loss": 5.7729, "mean_token_accuracy": 0.1522120788693428, "num_tokens": 3491881.0, "step": 1895 }, { "entropy": 5.850742673873901, "epoch": 0.10631452312340878, "grad_norm": 1.0234375, "learning_rate": 0.0004074422293543363, "loss": 5.8129, "mean_token_accuracy": 0.15194423794746398, "num_tokens": 3500968.0, "step": 1900 }, { "entropy": 5.891610479354858, "epoch": 0.10659429818425986, "grad_norm": 1.0, "learning_rate": 0.0004064880432018137, "loss": 5.8654, "mean_token_accuracy": 0.14877980351448059, "num_tokens": 3510248.0, "step": 1905 }, { "entropy": 5.786740350723266, "epoch": 0.10687407324511093, "grad_norm": 1.1796875, "learning_rate": 0.00040553025223816615, "loss": 5.7054, "mean_token_accuracy": 0.1558419570326805, "num_tokens": 3519750.0, "step": 1910 }, { "entropy": 5.762371587753296, "epoch": 0.107153848305962, "grad_norm": 1.03125, "learning_rate": 0.00040456888272171653, "loss": 5.6535, "mean_token_accuracy": 0.15853289812803267, "num_tokens": 3527626.0, "step": 1915 }, { "entropy": 5.803076457977295, "epoch": 0.10743362336681309, "grad_norm": 0.98828125, "learning_rate": 0.00040360396100889577, "loss": 5.8517, "mean_token_accuracy": 0.15330557376146317, "num_tokens": 3537574.0, "step": 1920 }, { "entropy": 5.85295467376709, "epoch": 0.10771339842766416, "grad_norm": 1.046875, "learning_rate": 0.0004026355135535202, "loss": 5.6874, "mean_token_accuracy": 0.1514697104692459, "num_tokens": 3546305.0, "step": 1925 }, { "entropy": 5.8903913497924805, "epoch": 0.10799317348851524, "grad_norm": 0.98828125, "learning_rate": 0.000401663566906066, "loss": 5.8687, "mean_token_accuracy": 0.14438902512192725, "num_tokens": 3556054.0, "step": 1930 }, { "entropy": 5.753151321411133, "epoch": 0.10827294854936631, "grad_norm": 1.0625, "learning_rate": 0.00040068814771294134, "loss": 5.6999, "mean_token_accuracy": 0.15991320312023163, "num_tokens": 3566156.0, "step": 1935 }, { "entropy": 5.640224361419678, "epoch": 0.10855272361021738, "grad_norm": 1.0234375, "learning_rate": 0.0003997092827157562, "loss": 5.6916, "mean_token_accuracy": 0.1592881053686142, "num_tokens": 3575176.0, "step": 1940 }, { "entropy": 5.9109299659729, "epoch": 0.10883249867106846, "grad_norm": 0.98046875, "learning_rate": 0.000398726998750589, "loss": 5.7892, "mean_token_accuracy": 0.14814456030726433, "num_tokens": 3585112.0, "step": 1945 }, { "entropy": 5.81527042388916, "epoch": 0.10911227373191953, "grad_norm": 1.140625, "learning_rate": 0.00039774132274725076, "loss": 5.7443, "mean_token_accuracy": 0.15033237636089325, "num_tokens": 3594468.0, "step": 1950 }, { "entropy": 5.7505429744720455, "epoch": 0.10939204879277062, "grad_norm": 1.0078125, "learning_rate": 0.00039675228172854707, "loss": 5.6092, "mean_token_accuracy": 0.15946809947490692, "num_tokens": 3603449.0, "step": 1955 }, { "entropy": 5.758810758590698, "epoch": 0.10967182385362169, "grad_norm": 1.1484375, "learning_rate": 0.0003957599028095371, "loss": 5.7638, "mean_token_accuracy": 0.1498391680419445, "num_tokens": 3612366.0, "step": 1960 }, { "entropy": 5.759896230697632, "epoch": 0.10995159891447276, "grad_norm": 1.140625, "learning_rate": 0.00039476421319679017, "loss": 5.6559, "mean_token_accuracy": 0.1582018181681633, "num_tokens": 3620466.0, "step": 1965 }, { "entropy": 5.775796556472779, "epoch": 0.11023137397532384, "grad_norm": 1.0859375, "learning_rate": 0.00039376524018764, "loss": 5.8059, "mean_token_accuracy": 0.15230363309383393, "num_tokens": 3629424.0, "step": 1970 }, { "entropy": 5.776160955429077, "epoch": 0.11051114903617491, "grad_norm": 1.046875, "learning_rate": 0.00039276301116943616, "loss": 5.6382, "mean_token_accuracy": 0.15213821083307266, "num_tokens": 3638044.0, "step": 1975 }, { "entropy": 5.706624269485474, "epoch": 0.110790924097026, "grad_norm": 1.0234375, "learning_rate": 0.0003917575536187936, "loss": 5.73, "mean_token_accuracy": 0.15515266135334968, "num_tokens": 3647239.0, "step": 1980 }, { "entropy": 5.923574304580688, "epoch": 0.11107069915787707, "grad_norm": 1.125, "learning_rate": 0.00039074889510083894, "loss": 5.7824, "mean_token_accuracy": 0.15231991186738014, "num_tokens": 3655729.0, "step": 1985 }, { "entropy": 5.84725513458252, "epoch": 0.11135047421872814, "grad_norm": 1.1015625, "learning_rate": 0.00038973706326845495, "loss": 5.7915, "mean_token_accuracy": 0.150700543820858, "num_tokens": 3665155.0, "step": 1990 }, { "entropy": 5.871934032440185, "epoch": 0.11163024927957922, "grad_norm": 1.0546875, "learning_rate": 0.0003887220858615225, "loss": 5.6854, "mean_token_accuracy": 0.16067851781845094, "num_tokens": 3673169.0, "step": 1995 }, { "entropy": 5.788043260574341, "epoch": 0.11191002434043029, "grad_norm": 1.046875, "learning_rate": 0.0003877039907061597, "loss": 5.814, "mean_token_accuracy": 0.15419328063726426, "num_tokens": 3683026.0, "step": 2000 }, { "entropy": 5.849886798858643, "epoch": 0.11218979940128138, "grad_norm": 0.95703125, "learning_rate": 0.0003866828057139598, "loss": 5.8205, "mean_token_accuracy": 0.1491822436451912, "num_tokens": 3692224.0, "step": 2005 }, { "entropy": 5.8027088165283205, "epoch": 0.11246957446213245, "grad_norm": 1.125, "learning_rate": 0.00038565855888122503, "loss": 5.7939, "mean_token_accuracy": 0.15009186267852784, "num_tokens": 3701326.0, "step": 2010 }, { "entropy": 5.8045741558074955, "epoch": 0.11274934952298352, "grad_norm": 1.1015625, "learning_rate": 0.00038463127828819975, "loss": 5.7037, "mean_token_accuracy": 0.15352987349033356, "num_tokens": 3710378.0, "step": 2015 }, { "entropy": 5.675677824020386, "epoch": 0.1130291245838346, "grad_norm": 1.0234375, "learning_rate": 0.00038360099209830043, "loss": 5.6014, "mean_token_accuracy": 0.16326209753751755, "num_tokens": 3719180.0, "step": 2020 }, { "entropy": 5.769056510925293, "epoch": 0.11330889964468567, "grad_norm": 1.0703125, "learning_rate": 0.0003825677285573433, "loss": 5.7522, "mean_token_accuracy": 0.15641107112169267, "num_tokens": 3728197.0, "step": 2025 }, { "entropy": 5.89308614730835, "epoch": 0.11358867470553675, "grad_norm": 1.109375, "learning_rate": 0.00038153151599277027, "loss": 5.711, "mean_token_accuracy": 0.15505644381046296, "num_tokens": 3737071.0, "step": 2030 }, { "entropy": 5.7944704532623295, "epoch": 0.11386844976638782, "grad_norm": 1.0625, "learning_rate": 0.0003804923828128723, "loss": 5.8085, "mean_token_accuracy": 0.1559743769466877, "num_tokens": 3746103.0, "step": 2035 }, { "entropy": 5.84677095413208, "epoch": 0.1141482248272389, "grad_norm": 1.0546875, "learning_rate": 0.0003794503575060104, "loss": 5.7457, "mean_token_accuracy": 0.15347915440797805, "num_tokens": 3755377.0, "step": 2040 }, { "entropy": 5.6923786163330075, "epoch": 0.11442799988808998, "grad_norm": 1.1328125, "learning_rate": 0.00037840546863983484, "loss": 5.6157, "mean_token_accuracy": 0.16136836856603623, "num_tokens": 3763377.0, "step": 2045 }, { "entropy": 5.765568780899048, "epoch": 0.11470777494894105, "grad_norm": 1.015625, "learning_rate": 0.0003773577448605015, "loss": 5.6878, "mean_token_accuracy": 0.1577932521700859, "num_tokens": 3772927.0, "step": 2050 }, { "entropy": 5.8939320087432865, "epoch": 0.11498755000979213, "grad_norm": 1.0546875, "learning_rate": 0.0003763072148918872, "loss": 5.7382, "mean_token_accuracy": 0.1535826176404953, "num_tokens": 3781809.0, "step": 2055 }, { "entropy": 5.765517473220825, "epoch": 0.1152673250706432, "grad_norm": 0.99609375, "learning_rate": 0.0003752539075348017, "loss": 5.747, "mean_token_accuracy": 0.14945023581385614, "num_tokens": 3791551.0, "step": 2060 }, { "entropy": 5.694364881515503, "epoch": 0.11554710013149427, "grad_norm": 1.0703125, "learning_rate": 0.00037419785166619817, "loss": 5.7053, "mean_token_accuracy": 0.15597922652959822, "num_tokens": 3799860.0, "step": 2065 }, { "entropy": 5.730410051345825, "epoch": 0.11582687519234536, "grad_norm": 1.1015625, "learning_rate": 0.0003731390762383818, "loss": 5.6196, "mean_token_accuracy": 0.15803190171718598, "num_tokens": 3808754.0, "step": 2070 }, { "entropy": 5.826288557052612, "epoch": 0.11610665025319643, "grad_norm": 1.1484375, "learning_rate": 0.0003720776102782158, "loss": 5.6166, "mean_token_accuracy": 0.16269149631261826, "num_tokens": 3817213.0, "step": 2075 }, { "entropy": 5.654380369186401, "epoch": 0.11638642531404751, "grad_norm": 1.03125, "learning_rate": 0.00037101348288632555, "loss": 5.67, "mean_token_accuracy": 0.16024026721715928, "num_tokens": 3826675.0, "step": 2080 }, { "entropy": 5.75474362373352, "epoch": 0.11666620037489858, "grad_norm": 1.0546875, "learning_rate": 0.0003699467232363012, "loss": 5.6135, "mean_token_accuracy": 0.15936376452445983, "num_tokens": 3835127.0, "step": 2085 }, { "entropy": 5.769831371307373, "epoch": 0.11694597543574965, "grad_norm": 1.1328125, "learning_rate": 0.0003688773605738973, "loss": 5.8009, "mean_token_accuracy": 0.14795432686805726, "num_tokens": 3844467.0, "step": 2090 }, { "entropy": 5.769893980026245, "epoch": 0.11722575049660074, "grad_norm": 0.97265625, "learning_rate": 0.00036780542421623134, "loss": 5.6323, "mean_token_accuracy": 0.16054756790399552, "num_tokens": 3853150.0, "step": 2095 }, { "entropy": 5.726003122329712, "epoch": 0.1175055255574518, "grad_norm": 1.1796875, "learning_rate": 0.0003667309435509802, "loss": 5.6035, "mean_token_accuracy": 0.1651451990008354, "num_tokens": 3861180.0, "step": 2100 }, { "entropy": 5.702756595611572, "epoch": 0.11778530061830289, "grad_norm": 1.0078125, "learning_rate": 0.0003656539480355741, "loss": 5.6943, "mean_token_accuracy": 0.15809597373008727, "num_tokens": 3870303.0, "step": 2105 }, { "entropy": 5.732271432876587, "epoch": 0.11806507567915396, "grad_norm": 0.98828125, "learning_rate": 0.0003645744671963891, "loss": 5.6395, "mean_token_accuracy": 0.16051075458526612, "num_tokens": 3879515.0, "step": 2110 }, { "entropy": 5.717753219604492, "epoch": 0.11834485074000503, "grad_norm": 1.125, "learning_rate": 0.0003634925306279376, "loss": 5.6592, "mean_token_accuracy": 0.16357103139162063, "num_tokens": 3887989.0, "step": 2115 }, { "entropy": 5.647048997879028, "epoch": 0.11862462580085611, "grad_norm": 1.015625, "learning_rate": 0.0003624081679920574, "loss": 5.5422, "mean_token_accuracy": 0.1672131136059761, "num_tokens": 3897071.0, "step": 2120 }, { "entropy": 5.666443967819214, "epoch": 0.11890440086170719, "grad_norm": 1.0546875, "learning_rate": 0.0003613214090170977, "loss": 5.5953, "mean_token_accuracy": 0.1648178890347481, "num_tokens": 3906058.0, "step": 2125 }, { "entropy": 5.802386808395386, "epoch": 0.11918417592255827, "grad_norm": 1.1015625, "learning_rate": 0.0003602322834971048, "loss": 5.6706, "mean_token_accuracy": 0.15836320966482162, "num_tokens": 3915027.0, "step": 2130 }, { "entropy": 5.6676342487335205, "epoch": 0.11946395098340934, "grad_norm": 1.078125, "learning_rate": 0.0003591408212910051, "loss": 5.6142, "mean_token_accuracy": 0.16593797653913497, "num_tokens": 3924357.0, "step": 2135 }, { "entropy": 5.754116821289062, "epoch": 0.11974372604426041, "grad_norm": 1.0546875, "learning_rate": 0.0003580470523217863, "loss": 5.6903, "mean_token_accuracy": 0.15829661935567857, "num_tokens": 3933823.0, "step": 2140 }, { "entropy": 5.814476156234742, "epoch": 0.1200235011051115, "grad_norm": 1.140625, "learning_rate": 0.0003569510065756771, "loss": 5.7773, "mean_token_accuracy": 0.15345691293478012, "num_tokens": 3942448.0, "step": 2145 }, { "entropy": 5.800265693664551, "epoch": 0.12030327616596256, "grad_norm": 1.0625, "learning_rate": 0.0003558527141013254, "loss": 5.6883, "mean_token_accuracy": 0.1527173787355423, "num_tokens": 3952026.0, "step": 2150 }, { "entropy": 5.791549158096314, "epoch": 0.12058305122681365, "grad_norm": 0.96484375, "learning_rate": 0.0003547522050089742, "loss": 5.7546, "mean_token_accuracy": 0.14622100368142127, "num_tokens": 3963502.0, "step": 2155 }, { "entropy": 5.695604372024536, "epoch": 0.12086282628766472, "grad_norm": 1.0390625, "learning_rate": 0.00035364950946963606, "loss": 5.5864, "mean_token_accuracy": 0.16379044502973555, "num_tokens": 3972080.0, "step": 2160 }, { "entropy": 5.683828544616699, "epoch": 0.12114260134851579, "grad_norm": 0.99609375, "learning_rate": 0.0003525446577142663, "loss": 5.6873, "mean_token_accuracy": 0.154899001121521, "num_tokens": 3981987.0, "step": 2165 }, { "entropy": 5.77276644706726, "epoch": 0.12142237640936687, "grad_norm": 0.98828125, "learning_rate": 0.00035143768003293395, "loss": 5.6798, "mean_token_accuracy": 0.15419003069400788, "num_tokens": 3991165.0, "step": 2170 }, { "entropy": 5.69476056098938, "epoch": 0.12170215147021794, "grad_norm": 1.046875, "learning_rate": 0.0003503286067739913, "loss": 5.5737, "mean_token_accuracy": 0.15938421711325645, "num_tokens": 4001237.0, "step": 2175 }, { "entropy": 5.732597780227661, "epoch": 0.12198192653106903, "grad_norm": 1.0078125, "learning_rate": 0.00034921746834324193, "loss": 5.6344, "mean_token_accuracy": 0.16024436950683593, "num_tokens": 4010457.0, "step": 2180 }, { "entropy": 5.731549692153931, "epoch": 0.1222617015919201, "grad_norm": 0.93359375, "learning_rate": 0.0003481042952031072, "loss": 5.6974, "mean_token_accuracy": 0.1596264883875847, "num_tokens": 4020211.0, "step": 2185 }, { "entropy": 5.731296968460083, "epoch": 0.12254147665277117, "grad_norm": 1.140625, "learning_rate": 0.0003469891178717911, "loss": 5.5995, "mean_token_accuracy": 0.16362568736076355, "num_tokens": 4028790.0, "step": 2190 }, { "entropy": 5.76063027381897, "epoch": 0.12282125171362225, "grad_norm": 1.0, "learning_rate": 0.0003458719669224436, "loss": 5.6796, "mean_token_accuracy": 0.15336375832557678, "num_tokens": 4038247.0, "step": 2195 }, { "entropy": 5.770486164093017, "epoch": 0.12310102677447332, "grad_norm": 1.1640625, "learning_rate": 0.0003447528729823221, "loss": 5.7409, "mean_token_accuracy": 0.15302572548389434, "num_tokens": 4047951.0, "step": 2200 }, { "entropy": 5.807470464706421, "epoch": 0.1233808018353244, "grad_norm": 1.0859375, "learning_rate": 0.0003436318667319525, "loss": 5.7572, "mean_token_accuracy": 0.1501487024128437, "num_tokens": 4056481.0, "step": 2205 }, { "entropy": 5.852072525024414, "epoch": 0.12366057689617548, "grad_norm": 1.0390625, "learning_rate": 0.00034250897890428716, "loss": 5.8096, "mean_token_accuracy": 0.14974186569452286, "num_tokens": 4066686.0, "step": 2210 }, { "entropy": 5.770815086364746, "epoch": 0.12394035195702655, "grad_norm": 1.0703125, "learning_rate": 0.0003413842402838633, "loss": 5.661, "mean_token_accuracy": 0.1623397082090378, "num_tokens": 4075606.0, "step": 2215 }, { "entropy": 5.671165132522583, "epoch": 0.12422012701787763, "grad_norm": 0.99609375, "learning_rate": 0.00034025768170595834, "loss": 5.5497, "mean_token_accuracy": 0.1648730143904686, "num_tokens": 4084659.0, "step": 2220 }, { "entropy": 5.734942007064819, "epoch": 0.1244999020787287, "grad_norm": 1.0546875, "learning_rate": 0.0003391293340557446, "loss": 5.6821, "mean_token_accuracy": 0.15850546956062317, "num_tokens": 4093253.0, "step": 2225 }, { "entropy": 5.746334218978882, "epoch": 0.12477967713957978, "grad_norm": 0.95703125, "learning_rate": 0.0003379992282674431, "loss": 5.6141, "mean_token_accuracy": 0.15441933870315552, "num_tokens": 4102448.0, "step": 2230 }, { "entropy": 5.706913709640503, "epoch": 0.12505945220043085, "grad_norm": 1.0703125, "learning_rate": 0.0003368673953234749, "loss": 5.6194, "mean_token_accuracy": 0.16242503076791764, "num_tokens": 4110879.0, "step": 2235 }, { "entropy": 5.684977293014526, "epoch": 0.12533922726128194, "grad_norm": 1.046875, "learning_rate": 0.00033573386625361176, "loss": 5.5521, "mean_token_accuracy": 0.1629284530878067, "num_tokens": 4119701.0, "step": 2240 }, { "entropy": 5.652591848373413, "epoch": 0.125619002322133, "grad_norm": 1.0703125, "learning_rate": 0.00033459867213412567, "loss": 5.5404, "mean_token_accuracy": 0.1669366255402565, "num_tokens": 4128479.0, "step": 2245 }, { "entropy": 5.686947345733643, "epoch": 0.12589877738298408, "grad_norm": 1.0859375, "learning_rate": 0.000333461844086937, "loss": 5.6691, "mean_token_accuracy": 0.15521465092897416, "num_tokens": 4137891.0, "step": 2250 }, { "entropy": 5.770881128311157, "epoch": 0.12617855244383516, "grad_norm": 1.1328125, "learning_rate": 0.00033232341327876097, "loss": 5.6619, "mean_token_accuracy": 0.16292612105607987, "num_tokens": 4146406.0, "step": 2255 }, { "entropy": 5.718049669265747, "epoch": 0.12645832750468622, "grad_norm": 1.1015625, "learning_rate": 0.0003311834109202531, "loss": 5.5926, "mean_token_accuracy": 0.16526059061288834, "num_tokens": 4154981.0, "step": 2260 }, { "entropy": 5.639597797393799, "epoch": 0.1267381025655373, "grad_norm": 1.0859375, "learning_rate": 0.00033004186826515416, "loss": 5.6191, "mean_token_accuracy": 0.1598067045211792, "num_tokens": 4164409.0, "step": 2265 }, { "entropy": 5.621099472045898, "epoch": 0.1270178776263884, "grad_norm": 1.125, "learning_rate": 0.0003288988166094324, "loss": 5.5969, "mean_token_accuracy": 0.1647018760442734, "num_tokens": 4173276.0, "step": 2270 }, { "entropy": 5.787548160552978, "epoch": 0.12729765268723947, "grad_norm": 1.0, "learning_rate": 0.00032775428729042656, "loss": 5.5964, "mean_token_accuracy": 0.16008727252483368, "num_tokens": 4183043.0, "step": 2275 }, { "entropy": 5.719858312606812, "epoch": 0.12757742774809053, "grad_norm": 1.0859375, "learning_rate": 0.000326608311685986, "loss": 5.6681, "mean_token_accuracy": 0.15825727283954621, "num_tokens": 4192129.0, "step": 2280 }, { "entropy": 5.743994855880738, "epoch": 0.1278572028089416, "grad_norm": 1.0, "learning_rate": 0.0003254609212136108, "loss": 5.5639, "mean_token_accuracy": 0.16527171134948732, "num_tokens": 4201834.0, "step": 2285 }, { "entropy": 5.649022054672241, "epoch": 0.1281369778697927, "grad_norm": 1.0546875, "learning_rate": 0.00032431214732959036, "loss": 5.6195, "mean_token_accuracy": 0.1635665476322174, "num_tokens": 4211265.0, "step": 2290 }, { "entropy": 5.624596405029297, "epoch": 0.12841675293064375, "grad_norm": 1.0234375, "learning_rate": 0.000323162021528141, "loss": 5.5524, "mean_token_accuracy": 0.16614623963832856, "num_tokens": 4220313.0, "step": 2295 }, { "entropy": 5.816921091079712, "epoch": 0.12869652799149484, "grad_norm": 1.0390625, "learning_rate": 0.00032201057534054264, "loss": 5.7655, "mean_token_accuracy": 0.14698631688952446, "num_tokens": 4229240.0, "step": 2300 }, { "entropy": 5.762573146820069, "epoch": 0.12897630305234592, "grad_norm": 0.94140625, "learning_rate": 0.00032085784033427414, "loss": 5.5681, "mean_token_accuracy": 0.16257505863904953, "num_tokens": 4238265.0, "step": 2305 }, { "entropy": 5.568354558944702, "epoch": 0.12925607811319698, "grad_norm": 1.03125, "learning_rate": 0.0003197038481121478, "loss": 5.539, "mean_token_accuracy": 0.16731962859630584, "num_tokens": 4246980.0, "step": 2310 }, { "entropy": 5.744292736053467, "epoch": 0.12953585317404806, "grad_norm": 1.09375, "learning_rate": 0.0003185486303114436, "loss": 5.6024, "mean_token_accuracy": 0.1658761516213417, "num_tokens": 4256314.0, "step": 2315 }, { "entropy": 5.784452104568482, "epoch": 0.12981562823489914, "grad_norm": 0.92578125, "learning_rate": 0.0003173922186030409, "loss": 5.7268, "mean_token_accuracy": 0.15804459825158118, "num_tokens": 4266830.0, "step": 2320 }, { "entropy": 5.655185604095459, "epoch": 0.13009540329575023, "grad_norm": 0.96875, "learning_rate": 0.000316234644690551, "loss": 5.6537, "mean_token_accuracy": 0.16506769955158235, "num_tokens": 4276234.0, "step": 2325 }, { "entropy": 5.7454390048980715, "epoch": 0.13037517835660128, "grad_norm": 1.03125, "learning_rate": 0.0003150759403094473, "loss": 5.5476, "mean_token_accuracy": 0.17277702689170837, "num_tokens": 4285911.0, "step": 2330 }, { "entropy": 5.573277139663697, "epoch": 0.13065495341745237, "grad_norm": 1.203125, "learning_rate": 0.00031391613722619587, "loss": 5.6363, "mean_token_accuracy": 0.1597856506705284, "num_tokens": 4295819.0, "step": 2335 }, { "entropy": 5.717997741699219, "epoch": 0.13093472847830345, "grad_norm": 1.1328125, "learning_rate": 0.000312755267237384, "loss": 5.6303, "mean_token_accuracy": 0.16458401158452035, "num_tokens": 4304586.0, "step": 2340 }, { "entropy": 5.666008996963501, "epoch": 0.1312145035391545, "grad_norm": 1.046875, "learning_rate": 0.0003115933621688488, "loss": 5.4786, "mean_token_accuracy": 0.16213113367557525, "num_tokens": 4314329.0, "step": 2345 }, { "entropy": 5.666855955123902, "epoch": 0.1314942786000056, "grad_norm": 1.0703125, "learning_rate": 0.00031043045387480487, "loss": 5.569, "mean_token_accuracy": 0.16828988641500472, "num_tokens": 4323754.0, "step": 2350 }, { "entropy": 5.728784847259521, "epoch": 0.13177405366085668, "grad_norm": 1.078125, "learning_rate": 0.0003092665742369703, "loss": 5.6433, "mean_token_accuracy": 0.1563496008515358, "num_tokens": 4332873.0, "step": 2355 }, { "entropy": 5.670199155807495, "epoch": 0.13205382872170773, "grad_norm": 0.9375, "learning_rate": 0.00030810175516369343, "loss": 5.6094, "mean_token_accuracy": 0.15662863254547119, "num_tokens": 4343046.0, "step": 2360 }, { "entropy": 5.74817271232605, "epoch": 0.13233360378255882, "grad_norm": 1.0234375, "learning_rate": 0.0003069360285890775, "loss": 5.6455, "mean_token_accuracy": 0.16077424287796022, "num_tokens": 4352562.0, "step": 2365 }, { "entropy": 5.742451953887939, "epoch": 0.1326133788434099, "grad_norm": 1.0703125, "learning_rate": 0.00030576942647210547, "loss": 5.6831, "mean_token_accuracy": 0.15817070752382278, "num_tokens": 4360958.0, "step": 2370 }, { "entropy": 5.7430100440979, "epoch": 0.13289315390426099, "grad_norm": 1.046875, "learning_rate": 0.00030460198079576355, "loss": 5.6065, "mean_token_accuracy": 0.1646000176668167, "num_tokens": 4370600.0, "step": 2375 }, { "entropy": 5.711065340042114, "epoch": 0.13317292896511204, "grad_norm": 0.9609375, "learning_rate": 0.0003034337235661648, "loss": 5.6738, "mean_token_accuracy": 0.1629451483488083, "num_tokens": 4380589.0, "step": 2380 }, { "entropy": 5.673133182525635, "epoch": 0.13345270402596313, "grad_norm": 1.09375, "learning_rate": 0.0003022646868116714, "loss": 5.5901, "mean_token_accuracy": 0.1685796022415161, "num_tokens": 4389862.0, "step": 2385 }, { "entropy": 5.680800151824951, "epoch": 0.1337324790868142, "grad_norm": 1.0546875, "learning_rate": 0.0003010949025820163, "loss": 5.6181, "mean_token_accuracy": 0.16437141895294188, "num_tokens": 4399034.0, "step": 2390 }, { "entropy": 5.610961675643921, "epoch": 0.13401225414766527, "grad_norm": 1.0234375, "learning_rate": 0.0002999244029474252, "loss": 5.5177, "mean_token_accuracy": 0.17609228193759918, "num_tokens": 4408181.0, "step": 2395 }, { "entropy": 5.606054639816284, "epoch": 0.13429202920851635, "grad_norm": 1.1484375, "learning_rate": 0.00029875321999773684, "loss": 5.4962, "mean_token_accuracy": 0.1683323085308075, "num_tokens": 4417003.0, "step": 2400 }, { "entropy": 5.652012586593628, "epoch": 0.13457180426936743, "grad_norm": 1.09375, "learning_rate": 0.00029758138584152333, "loss": 5.5741, "mean_token_accuracy": 0.1592344120144844, "num_tokens": 4426277.0, "step": 2405 }, { "entropy": 5.720648336410522, "epoch": 0.1348515793302185, "grad_norm": 0.921875, "learning_rate": 0.0002964089326052102, "loss": 5.5286, "mean_token_accuracy": 0.17380728870630263, "num_tokens": 4434737.0, "step": 2410 }, { "entropy": 5.576643753051758, "epoch": 0.13513135439106957, "grad_norm": 1.0546875, "learning_rate": 0.0002952358924321949, "loss": 5.4248, "mean_token_accuracy": 0.1740764170885086, "num_tokens": 4444133.0, "step": 2415 }, { "entropy": 5.620946931838989, "epoch": 0.13541112945192066, "grad_norm": 1.0859375, "learning_rate": 0.00029406229748196657, "loss": 5.5652, "mean_token_accuracy": 0.16586569845676422, "num_tokens": 4453012.0, "step": 2420 }, { "entropy": 5.720426464080811, "epoch": 0.13569090451277174, "grad_norm": 1.0625, "learning_rate": 0.0002928881799292235, "loss": 5.6802, "mean_token_accuracy": 0.1634717583656311, "num_tokens": 4461179.0, "step": 2425 }, { "entropy": 5.718172025680542, "epoch": 0.1359706795736228, "grad_norm": 1.109375, "learning_rate": 0.00029171357196299154, "loss": 5.6347, "mean_token_accuracy": 0.16303899735212327, "num_tokens": 4470329.0, "step": 2430 }, { "entropy": 5.655877113342285, "epoch": 0.13625045463447388, "grad_norm": 0.984375, "learning_rate": 0.0002905385057857414, "loss": 5.5933, "mean_token_accuracy": 0.157878540456295, "num_tokens": 4480943.0, "step": 2435 }, { "entropy": 5.7620521068573, "epoch": 0.13653022969532497, "grad_norm": 1.0390625, "learning_rate": 0.0002893630136125058, "loss": 5.6514, "mean_token_accuracy": 0.16541528105735778, "num_tokens": 4490795.0, "step": 2440 }, { "entropy": 5.69360466003418, "epoch": 0.13681000475617602, "grad_norm": 0.9765625, "learning_rate": 0.0002881871276699967, "loss": 5.5544, "mean_token_accuracy": 0.16737173348665238, "num_tokens": 4500377.0, "step": 2445 }, { "entropy": 5.615415239334107, "epoch": 0.1370897798170271, "grad_norm": 1.03125, "learning_rate": 0.00028701088019572114, "loss": 5.5443, "mean_token_accuracy": 0.16214984357357026, "num_tokens": 4509414.0, "step": 2450 }, { "entropy": 5.716953706741333, "epoch": 0.1373695548778782, "grad_norm": 1.03125, "learning_rate": 0.0002858343034370977, "loss": 5.5589, "mean_token_accuracy": 0.1594344422221184, "num_tokens": 4519222.0, "step": 2455 }, { "entropy": 5.6767223358154295, "epoch": 0.13764932993872925, "grad_norm": 1.046875, "learning_rate": 0.00028465742965057267, "loss": 5.4939, "mean_token_accuracy": 0.1654483899474144, "num_tokens": 4528115.0, "step": 2460 }, { "entropy": 5.617089366912841, "epoch": 0.13792910499958033, "grad_norm": 0.95703125, "learning_rate": 0.00028348029110073533, "loss": 5.5694, "mean_token_accuracy": 0.15843377113342286, "num_tokens": 4537330.0, "step": 2465 }, { "entropy": 5.6846363067626955, "epoch": 0.13820888006043142, "grad_norm": 1.0625, "learning_rate": 0.00028230292005943365, "loss": 5.6655, "mean_token_accuracy": 0.15484083145856858, "num_tokens": 4547427.0, "step": 2470 }, { "entropy": 5.620794153213501, "epoch": 0.1384886551212825, "grad_norm": 1.03125, "learning_rate": 0.00028112534880488945, "loss": 5.4819, "mean_token_accuracy": 0.16776254028081894, "num_tokens": 4556148.0, "step": 2475 }, { "entropy": 5.639376163482666, "epoch": 0.13876843018213356, "grad_norm": 1.0703125, "learning_rate": 0.0002799476096208137, "loss": 5.5299, "mean_token_accuracy": 0.16475914269685746, "num_tokens": 4565778.0, "step": 2480 }, { "entropy": 5.697155094146728, "epoch": 0.13904820524298464, "grad_norm": 1.015625, "learning_rate": 0.00027876973479552087, "loss": 5.4538, "mean_token_accuracy": 0.16957175135612487, "num_tokens": 4574851.0, "step": 2485 }, { "entropy": 5.594253158569336, "epoch": 0.13932798030383572, "grad_norm": 1.1171875, "learning_rate": 0.00027759175662104424, "loss": 5.6525, "mean_token_accuracy": 0.15839396119117738, "num_tokens": 4583664.0, "step": 2490 }, { "entropy": 5.7007721900939945, "epoch": 0.13960775536468678, "grad_norm": 1.09375, "learning_rate": 0.0002764137073922508, "loss": 5.472, "mean_token_accuracy": 0.1772173210978508, "num_tokens": 4592349.0, "step": 2495 }, { "entropy": 5.665040016174316, "epoch": 0.13988753042553786, "grad_norm": 1.171875, "learning_rate": 0.00027523561940595505, "loss": 5.572, "mean_token_accuracy": 0.16878434121608735, "num_tokens": 4601242.0, "step": 2500 }, { "entropy": 5.693995475769043, "epoch": 0.14016730548638895, "grad_norm": 1.015625, "learning_rate": 0.0002740575249600342, "loss": 5.5723, "mean_token_accuracy": 0.16639557778835296, "num_tokens": 4610358.0, "step": 2505 }, { "entropy": 5.656335067749024, "epoch": 0.14044708054724, "grad_norm": 1.0546875, "learning_rate": 0.00027287945635254263, "loss": 5.5688, "mean_token_accuracy": 0.15777888745069504, "num_tokens": 4619660.0, "step": 2510 }, { "entropy": 5.658308792114258, "epoch": 0.1407268556080911, "grad_norm": 1.046875, "learning_rate": 0.00027170144588082635, "loss": 5.4326, "mean_token_accuracy": 0.17469542175531388, "num_tokens": 4628347.0, "step": 2515 }, { "entropy": 5.649258041381836, "epoch": 0.14100663066894217, "grad_norm": 1.1015625, "learning_rate": 0.00027052352584063763, "loss": 5.4757, "mean_token_accuracy": 0.1646207630634308, "num_tokens": 4637160.0, "step": 2520 }, { "entropy": 5.64496340751648, "epoch": 0.14128640572979326, "grad_norm": 0.953125, "learning_rate": 0.00026934572852524907, "loss": 5.5857, "mean_token_accuracy": 0.1644057348370552, "num_tokens": 4646663.0, "step": 2525 }, { "entropy": 5.720569229125976, "epoch": 0.1415661807906443, "grad_norm": 0.9453125, "learning_rate": 0.00026816808622456937, "loss": 5.6817, "mean_token_accuracy": 0.15825680568814277, "num_tokens": 4656259.0, "step": 2530 }, { "entropy": 5.6876654624938965, "epoch": 0.1418459558514954, "grad_norm": 1.0234375, "learning_rate": 0.0002669906312242569, "loss": 5.5392, "mean_token_accuracy": 0.1619700610637665, "num_tokens": 4665867.0, "step": 2535 }, { "entropy": 5.709628009796143, "epoch": 0.14212573091234648, "grad_norm": 1.0625, "learning_rate": 0.00026581339580483525, "loss": 5.6004, "mean_token_accuracy": 0.16124948114156723, "num_tokens": 4674451.0, "step": 2540 }, { "entropy": 5.770373058319092, "epoch": 0.14240550597319754, "grad_norm": 1.015625, "learning_rate": 0.0002646364122408082, "loss": 5.6471, "mean_token_accuracy": 0.16295707672834397, "num_tokens": 4684810.0, "step": 2545 }, { "entropy": 5.612470006942749, "epoch": 0.14268528103404862, "grad_norm": 1.140625, "learning_rate": 0.0002634597127997749, "loss": 5.4776, "mean_token_accuracy": 0.16489555537700654, "num_tokens": 4693461.0, "step": 2550 }, { "entropy": 5.6553059101104735, "epoch": 0.1429650560948997, "grad_norm": 1.0546875, "learning_rate": 0.0002622833297415445, "loss": 5.5745, "mean_token_accuracy": 0.16462549418210984, "num_tokens": 4702147.0, "step": 2555 }, { "entropy": 5.719350719451905, "epoch": 0.14324483115575076, "grad_norm": 0.96875, "learning_rate": 0.0002611072953172531, "loss": 5.6223, "mean_token_accuracy": 0.1643210083246231, "num_tokens": 4711208.0, "step": 2560 }, { "entropy": 5.636368227005005, "epoch": 0.14352460621660185, "grad_norm": 1.046875, "learning_rate": 0.00025993164176847845, "loss": 5.5838, "mean_token_accuracy": 0.1598072439432144, "num_tokens": 4720798.0, "step": 2565 }, { "entropy": 5.674344539642334, "epoch": 0.14380438127745293, "grad_norm": 1.0078125, "learning_rate": 0.0002587564013263564, "loss": 5.5429, "mean_token_accuracy": 0.16537421494722365, "num_tokens": 4730119.0, "step": 2570 }, { "entropy": 5.676420974731445, "epoch": 0.14408415633830401, "grad_norm": 0.95703125, "learning_rate": 0.0002575816062106974, "loss": 5.4708, "mean_token_accuracy": 0.1693610355257988, "num_tokens": 4739615.0, "step": 2575 }, { "entropy": 5.661298561096191, "epoch": 0.14436393139915507, "grad_norm": 1.03125, "learning_rate": 0.00025640728862910293, "loss": 5.553, "mean_token_accuracy": 0.16640134602785112, "num_tokens": 4749398.0, "step": 2580 }, { "entropy": 5.529336833953858, "epoch": 0.14464370646000616, "grad_norm": 1.0625, "learning_rate": 0.00025523348077608285, "loss": 5.4624, "mean_token_accuracy": 0.1767786294221878, "num_tokens": 4757806.0, "step": 2585 }, { "entropy": 5.5426219463348385, "epoch": 0.14492348152085724, "grad_norm": 1.125, "learning_rate": 0.00025406021483217225, "loss": 5.5342, "mean_token_accuracy": 0.16719046831130982, "num_tokens": 4766484.0, "step": 2590 }, { "entropy": 5.6570676326751705, "epoch": 0.1452032565817083, "grad_norm": 1.15625, "learning_rate": 0.00025288752296304963, "loss": 5.4485, "mean_token_accuracy": 0.17492833435535432, "num_tokens": 4775143.0, "step": 2595 }, { "entropy": 5.601592588424682, "epoch": 0.14548303164255938, "grad_norm": 1.0703125, "learning_rate": 0.000251715437318655, "loss": 5.522, "mean_token_accuracy": 0.1674225300550461, "num_tokens": 4784225.0, "step": 2600 }, { "entropy": 5.626814222335815, "epoch": 0.14576280670341046, "grad_norm": 1.09375, "learning_rate": 0.0002505439900323084, "loss": 5.5551, "mean_token_accuracy": 0.16674421429634095, "num_tokens": 4793263.0, "step": 2605 }, { "entropy": 5.7088785648345945, "epoch": 0.14604258176426155, "grad_norm": 1.1171875, "learning_rate": 0.00024937321321982894, "loss": 5.4978, "mean_token_accuracy": 0.17084013521671296, "num_tokens": 4801981.0, "step": 2610 }, { "entropy": 5.657845497131348, "epoch": 0.1463223568251126, "grad_norm": 1.09375, "learning_rate": 0.00024820313897865433, "loss": 5.5192, "mean_token_accuracy": 0.17200833112001418, "num_tokens": 4809883.0, "step": 2615 }, { "entropy": 5.543992948532105, "epoch": 0.1466021318859637, "grad_norm": 1.0546875, "learning_rate": 0.00024703379938696105, "loss": 5.473, "mean_token_accuracy": 0.16232667565345765, "num_tokens": 4818368.0, "step": 2620 }, { "entropy": 5.675971984863281, "epoch": 0.14688190694681477, "grad_norm": 1.1484375, "learning_rate": 0.00024586522650278447, "loss": 5.5098, "mean_token_accuracy": 0.15936802327632904, "num_tokens": 4826955.0, "step": 2625 }, { "entropy": 5.705751276016235, "epoch": 0.14716168200766583, "grad_norm": 1.03125, "learning_rate": 0.00024469745236314064, "loss": 5.5656, "mean_token_accuracy": 0.16145253479480742, "num_tokens": 4836051.0, "step": 2630 }, { "entropy": 5.6294593334198, "epoch": 0.1474414570685169, "grad_norm": 0.9921875, "learning_rate": 0.00024353050898314767, "loss": 5.5203, "mean_token_accuracy": 0.16890684217214585, "num_tokens": 4845533.0, "step": 2635 }, { "entropy": 5.709641838073731, "epoch": 0.147721232129368, "grad_norm": 1.1640625, "learning_rate": 0.00024236442835514743, "loss": 5.7324, "mean_token_accuracy": 0.1559814289212227, "num_tokens": 4853984.0, "step": 2640 }, { "entropy": 5.6191041469573975, "epoch": 0.14800100719021905, "grad_norm": 1.09375, "learning_rate": 0.00024119924244782965, "loss": 5.4614, "mean_token_accuracy": 0.17112404853105545, "num_tokens": 4862305.0, "step": 2645 }, { "entropy": 5.643775177001953, "epoch": 0.14828078225107014, "grad_norm": 0.9921875, "learning_rate": 0.00024003498320535462, "loss": 5.5469, "mean_token_accuracy": 0.15911641716957092, "num_tokens": 4871273.0, "step": 2650 }, { "entropy": 5.69115948677063, "epoch": 0.14856055731192122, "grad_norm": 0.921875, "learning_rate": 0.00023887168254647727, "loss": 5.6072, "mean_token_accuracy": 0.15700725466012955, "num_tokens": 4880534.0, "step": 2655 }, { "entropy": 5.6965797424316404, "epoch": 0.1488403323727723, "grad_norm": 0.98828125, "learning_rate": 0.00023770937236367308, "loss": 5.6014, "mean_token_accuracy": 0.16675964295864104, "num_tokens": 4890022.0, "step": 2660 }, { "entropy": 5.756263971328735, "epoch": 0.14912010743362336, "grad_norm": 0.97265625, "learning_rate": 0.00023654808452226278, "loss": 5.5947, "mean_token_accuracy": 0.16924326568841935, "num_tokens": 4899736.0, "step": 2665 }, { "entropy": 5.713470554351806, "epoch": 0.14939988249447445, "grad_norm": 1.0859375, "learning_rate": 0.00023538785085953912, "loss": 5.4942, "mean_token_accuracy": 0.174069944024086, "num_tokens": 4908791.0, "step": 2670 }, { "entropy": 5.644090414047241, "epoch": 0.14967965755532553, "grad_norm": 1.0703125, "learning_rate": 0.00023422870318389404, "loss": 5.5424, "mean_token_accuracy": 0.16543931663036346, "num_tokens": 4917670.0, "step": 2675 }, { "entropy": 5.617251539230347, "epoch": 0.14995943261617659, "grad_norm": 0.96484375, "learning_rate": 0.0002330706732739468, "loss": 5.4779, "mean_token_accuracy": 0.16327330619096755, "num_tokens": 4926453.0, "step": 2680 }, { "entropy": 5.676700305938721, "epoch": 0.15023920767702767, "grad_norm": 1.09375, "learning_rate": 0.00023191379287767211, "loss": 5.5818, "mean_token_accuracy": 0.16559347808361052, "num_tokens": 4936558.0, "step": 2685 }, { "entropy": 5.709424543380737, "epoch": 0.15051898273787875, "grad_norm": 1.0234375, "learning_rate": 0.0002307580937115305, "loss": 5.4936, "mean_token_accuracy": 0.17332152873277665, "num_tokens": 4945210.0, "step": 2690 }, { "entropy": 5.687791967391968, "epoch": 0.1507987577987298, "grad_norm": 0.9921875, "learning_rate": 0.00022960360745959846, "loss": 5.6056, "mean_token_accuracy": 0.16581332087516784, "num_tokens": 4954579.0, "step": 2695 }, { "entropy": 5.596445465087891, "epoch": 0.1510785328595809, "grad_norm": 1.0390625, "learning_rate": 0.00022845036577269972, "loss": 5.55, "mean_token_accuracy": 0.16138702481985093, "num_tokens": 4964027.0, "step": 2700 }, { "entropy": 5.75875768661499, "epoch": 0.15135830792043198, "grad_norm": 0.9453125, "learning_rate": 0.00022729840026753777, "loss": 5.6038, "mean_token_accuracy": 0.15999999195337294, "num_tokens": 4973170.0, "step": 2705 }, { "entropy": 5.790727376937866, "epoch": 0.15163808298128306, "grad_norm": 0.94921875, "learning_rate": 0.0002261477425258287, "loss": 5.5198, "mean_token_accuracy": 0.1682533711194992, "num_tokens": 4982510.0, "step": 2710 }, { "entropy": 5.60293984413147, "epoch": 0.15191785804213412, "grad_norm": 1.09375, "learning_rate": 0.0002249984240934358, "loss": 5.3913, "mean_token_accuracy": 0.18127554506063462, "num_tokens": 4990992.0, "step": 2715 }, { "entropy": 5.539755964279175, "epoch": 0.1521976331029852, "grad_norm": 1.078125, "learning_rate": 0.00022385047647950464, "loss": 5.4588, "mean_token_accuracy": 0.17619442641735078, "num_tokens": 4999739.0, "step": 2720 }, { "entropy": 5.595760774612427, "epoch": 0.1524774081638363, "grad_norm": 1.046875, "learning_rate": 0.0002227039311555986, "loss": 5.4244, "mean_token_accuracy": 0.17555348128080367, "num_tokens": 5008957.0, "step": 2725 }, { "entropy": 5.665028190612793, "epoch": 0.15275718322468734, "grad_norm": 1.0546875, "learning_rate": 0.0002215588195548372, "loss": 5.5489, "mean_token_accuracy": 0.17178949415683747, "num_tokens": 5018109.0, "step": 2730 }, { "entropy": 5.657345628738403, "epoch": 0.15303695828553843, "grad_norm": 1.0625, "learning_rate": 0.00022041517307103337, "loss": 5.4532, "mean_token_accuracy": 0.1844388633966446, "num_tokens": 5026632.0, "step": 2735 }, { "entropy": 5.639189338684082, "epoch": 0.1533167333463895, "grad_norm": 1.109375, "learning_rate": 0.0002192730230578331, "loss": 5.4802, "mean_token_accuracy": 0.17115636616945268, "num_tokens": 5036007.0, "step": 2740 }, { "entropy": 5.564154767990113, "epoch": 0.15359650840724057, "grad_norm": 1.0390625, "learning_rate": 0.0002181324008278559, "loss": 5.4669, "mean_token_accuracy": 0.16585114151239394, "num_tokens": 5045295.0, "step": 2745 }, { "entropy": 5.579900121688842, "epoch": 0.15387628346809165, "grad_norm": 1.0703125, "learning_rate": 0.00021699333765183655, "loss": 5.4256, "mean_token_accuracy": 0.1637026086449623, "num_tokens": 5054359.0, "step": 2750 }, { "entropy": 5.649759721755982, "epoch": 0.15415605852894274, "grad_norm": 1.078125, "learning_rate": 0.0002158558647577673, "loss": 5.4517, "mean_token_accuracy": 0.1742785319685936, "num_tokens": 5063347.0, "step": 2755 }, { "entropy": 5.685994291305542, "epoch": 0.15443583358979382, "grad_norm": 1.0, "learning_rate": 0.00021472001333004215, "loss": 5.5506, "mean_token_accuracy": 0.16387508660554886, "num_tokens": 5073010.0, "step": 2760 }, { "entropy": 5.640519618988037, "epoch": 0.15471560865064488, "grad_norm": 0.99609375, "learning_rate": 0.00021358581450860186, "loss": 5.5805, "mean_token_accuracy": 0.16307867914438248, "num_tokens": 5082799.0, "step": 2765 }, { "entropy": 5.5817564010620115, "epoch": 0.15499538371149596, "grad_norm": 1.0546875, "learning_rate": 0.0002124532993880799, "loss": 5.4525, "mean_token_accuracy": 0.16812834441661834, "num_tokens": 5092351.0, "step": 2770 }, { "entropy": 5.630770540237426, "epoch": 0.15527515877234704, "grad_norm": 1.25, "learning_rate": 0.00021132249901695044, "loss": 5.5458, "mean_token_accuracy": 0.1700419917702675, "num_tokens": 5101007.0, "step": 2775 }, { "entropy": 5.682374477386475, "epoch": 0.1555549338331981, "grad_norm": 0.98828125, "learning_rate": 0.00021019344439667705, "loss": 5.4435, "mean_token_accuracy": 0.1712168663740158, "num_tokens": 5110786.0, "step": 2780 }, { "entropy": 5.665527725219727, "epoch": 0.15583470889404918, "grad_norm": 0.99609375, "learning_rate": 0.00020906616648086213, "loss": 5.5688, "mean_token_accuracy": 0.16651172041893006, "num_tokens": 5120724.0, "step": 2785 }, { "entropy": 5.566106081008911, "epoch": 0.15611448395490027, "grad_norm": 1.03125, "learning_rate": 0.00020794069617439942, "loss": 5.4454, "mean_token_accuracy": 0.17868822515010835, "num_tokens": 5129249.0, "step": 2790 }, { "entropy": 5.686600589752198, "epoch": 0.15639425901575132, "grad_norm": 1.0703125, "learning_rate": 0.00020681706433262593, "loss": 5.5979, "mean_token_accuracy": 0.16322513818740844, "num_tokens": 5138394.0, "step": 2795 }, { "entropy": 5.723010635375976, "epoch": 0.1566740340766024, "grad_norm": 1.03125, "learning_rate": 0.00020569530176047602, "loss": 5.5768, "mean_token_accuracy": 0.1688903585076332, "num_tokens": 5148017.0, "step": 2800 }, { "entropy": 5.623873329162597, "epoch": 0.1569538091374535, "grad_norm": 0.94140625, "learning_rate": 0.0002045754392116374, "loss": 5.363, "mean_token_accuracy": 0.1765143245458603, "num_tokens": 5156963.0, "step": 2805 }, { "entropy": 5.5810019969940186, "epoch": 0.15723358419830458, "grad_norm": 1.03125, "learning_rate": 0.00020345750738770757, "loss": 5.3985, "mean_token_accuracy": 0.17983626276254655, "num_tokens": 5165393.0, "step": 2810 }, { "entropy": 5.594178247451782, "epoch": 0.15751335925915563, "grad_norm": 1.1484375, "learning_rate": 0.00020234153693735214, "loss": 5.4628, "mean_token_accuracy": 0.1695509746670723, "num_tokens": 5174272.0, "step": 2815 }, { "entropy": 5.53258204460144, "epoch": 0.15779313432000672, "grad_norm": 1.0703125, "learning_rate": 0.0002012275584554647, "loss": 5.3516, "mean_token_accuracy": 0.1848943293094635, "num_tokens": 5182666.0, "step": 2820 }, { "entropy": 5.653265714645386, "epoch": 0.1580729093808578, "grad_norm": 1.0859375, "learning_rate": 0.00020011560248232803, "loss": 5.4932, "mean_token_accuracy": 0.17016485184431077, "num_tokens": 5191400.0, "step": 2825 }, { "entropy": 5.657591819763184, "epoch": 0.15835268444170886, "grad_norm": 0.96484375, "learning_rate": 0.00019900569950277692, "loss": 5.5038, "mean_token_accuracy": 0.16682781875133515, "num_tokens": 5201620.0, "step": 2830 }, { "entropy": 5.592450523376465, "epoch": 0.15863245950255994, "grad_norm": 1.0078125, "learning_rate": 0.00019789787994536228, "loss": 5.438, "mean_token_accuracy": 0.1685665413737297, "num_tokens": 5211180.0, "step": 2835 }, { "entropy": 5.6556089401245115, "epoch": 0.15891223456341103, "grad_norm": 1.0625, "learning_rate": 0.00019679217418151667, "loss": 5.573, "mean_token_accuracy": 0.17167882174253463, "num_tokens": 5220372.0, "step": 2840 }, { "entropy": 5.761126565933227, "epoch": 0.15919200962426208, "grad_norm": 1.03125, "learning_rate": 0.00019568861252472236, "loss": 5.6153, "mean_token_accuracy": 0.16754570603370667, "num_tokens": 5229525.0, "step": 2845 }, { "entropy": 5.6655580520629885, "epoch": 0.15947178468511317, "grad_norm": 1.109375, "learning_rate": 0.00019458722522967952, "loss": 5.4495, "mean_token_accuracy": 0.17624941766262053, "num_tokens": 5238373.0, "step": 2850 }, { "entropy": 5.625934648513794, "epoch": 0.15975155974596425, "grad_norm": 0.92578125, "learning_rate": 0.00019348804249147723, "loss": 5.601, "mean_token_accuracy": 0.15897643938660622, "num_tokens": 5247833.0, "step": 2855 }, { "entropy": 5.629451560974121, "epoch": 0.16003133480681533, "grad_norm": 1.125, "learning_rate": 0.0001923910944447655, "loss": 5.3429, "mean_token_accuracy": 0.18059510737657547, "num_tokens": 5256543.0, "step": 2860 }, { "entropy": 5.646956872940064, "epoch": 0.1603111098676664, "grad_norm": 1.0546875, "learning_rate": 0.00019129641116292928, "loss": 5.5752, "mean_token_accuracy": 0.17094308286905288, "num_tokens": 5265938.0, "step": 2865 }, { "entropy": 5.718534183502197, "epoch": 0.16059088492851747, "grad_norm": 0.9453125, "learning_rate": 0.00019020402265726343, "loss": 5.5376, "mean_token_accuracy": 0.16934689432382583, "num_tokens": 5275634.0, "step": 2870 }, { "entropy": 5.613666296005249, "epoch": 0.16087065998936856, "grad_norm": 1.1171875, "learning_rate": 0.0001891139588761509, "loss": 5.4559, "mean_token_accuracy": 0.17356483340263368, "num_tokens": 5284351.0, "step": 2875 }, { "entropy": 5.606722688674926, "epoch": 0.16115043505021961, "grad_norm": 1.046875, "learning_rate": 0.00018802624970424076, "loss": 5.4375, "mean_token_accuracy": 0.17815187126398085, "num_tokens": 5293320.0, "step": 2880 }, { "entropy": 5.702021741867066, "epoch": 0.1614302101110707, "grad_norm": 1.0390625, "learning_rate": 0.00018694092496162945, "loss": 5.6107, "mean_token_accuracy": 0.1652884900569916, "num_tokens": 5303479.0, "step": 2885 }, { "entropy": 5.580821561813354, "epoch": 0.16170998517192178, "grad_norm": 1.140625, "learning_rate": 0.00018585801440304306, "loss": 5.4452, "mean_token_accuracy": 0.174919730424881, "num_tokens": 5311827.0, "step": 2890 }, { "entropy": 5.628740119934082, "epoch": 0.16198976023277284, "grad_norm": 0.99609375, "learning_rate": 0.00018477754771702165, "loss": 5.5274, "mean_token_accuracy": 0.1688842460513115, "num_tokens": 5322024.0, "step": 2895 }, { "entropy": 5.567859077453614, "epoch": 0.16226953529362392, "grad_norm": 0.95703125, "learning_rate": 0.00018369955452510506, "loss": 5.451, "mean_token_accuracy": 0.16756015866994858, "num_tokens": 5331309.0, "step": 2900 }, { "entropy": 5.632315063476563, "epoch": 0.162549310354475, "grad_norm": 1.0859375, "learning_rate": 0.0001826240643810212, "loss": 5.5092, "mean_token_accuracy": 0.17050080597400666, "num_tokens": 5341366.0, "step": 2905 }, { "entropy": 5.663816690444946, "epoch": 0.1628290854153261, "grad_norm": 1.0234375, "learning_rate": 0.0001815511067698758, "loss": 5.4376, "mean_token_accuracy": 0.1785288631916046, "num_tokens": 5350382.0, "step": 2910 }, { "entropy": 5.703562545776367, "epoch": 0.16310886047617715, "grad_norm": 0.9609375, "learning_rate": 0.0001804807111073436, "loss": 5.5171, "mean_token_accuracy": 0.1669526293873787, "num_tokens": 5359899.0, "step": 2915 }, { "entropy": 5.634199142456055, "epoch": 0.16338863553702823, "grad_norm": 1.0625, "learning_rate": 0.0001794129067388625, "loss": 5.3894, "mean_token_accuracy": 0.17441888451576232, "num_tokens": 5368046.0, "step": 2920 }, { "entropy": 5.54944109916687, "epoch": 0.16366841059787932, "grad_norm": 1.0546875, "learning_rate": 0.00017834772293882868, "loss": 5.526, "mean_token_accuracy": 0.16879914849996566, "num_tokens": 5377511.0, "step": 2925 }, { "entropy": 5.519673824310303, "epoch": 0.16394818565873037, "grad_norm": 1.125, "learning_rate": 0.000177285188909794, "loss": 5.4583, "mean_token_accuracy": 0.16874182224273682, "num_tokens": 5385860.0, "step": 2930 }, { "entropy": 5.587186479568482, "epoch": 0.16422796071958146, "grad_norm": 1.140625, "learning_rate": 0.0001762253337816656, "loss": 5.4292, "mean_token_accuracy": 0.1739762544631958, "num_tokens": 5395021.0, "step": 2935 }, { "entropy": 5.7044665813446045, "epoch": 0.16450773578043254, "grad_norm": 1.1171875, "learning_rate": 0.00017516818661090738, "loss": 5.4994, "mean_token_accuracy": 0.17277314364910126, "num_tokens": 5404690.0, "step": 2940 }, { "entropy": 5.671811628341675, "epoch": 0.1647875108412836, "grad_norm": 1.0234375, "learning_rate": 0.0001741137763797428, "loss": 5.4939, "mean_token_accuracy": 0.16848109662532806, "num_tokens": 5413746.0, "step": 2945 }, { "entropy": 5.7029482364654545, "epoch": 0.16506728590213468, "grad_norm": 1.0703125, "learning_rate": 0.00017306213199536115, "loss": 5.4836, "mean_token_accuracy": 0.16972575336694717, "num_tokens": 5423713.0, "step": 2950 }, { "entropy": 5.571771669387817, "epoch": 0.16534706096298576, "grad_norm": 1.0625, "learning_rate": 0.0001720132822891243, "loss": 5.3864, "mean_token_accuracy": 0.17275784015655518, "num_tokens": 5432801.0, "step": 2955 }, { "entropy": 5.615698909759521, "epoch": 0.16562683602383685, "grad_norm": 0.96484375, "learning_rate": 0.0001709672560157769, "loss": 5.4795, "mean_token_accuracy": 0.17942357957363128, "num_tokens": 5441785.0, "step": 2960 }, { "entropy": 5.617120027542114, "epoch": 0.1659066110846879, "grad_norm": 1.015625, "learning_rate": 0.00016992408185265758, "loss": 5.4893, "mean_token_accuracy": 0.16800451427698135, "num_tokens": 5450829.0, "step": 2965 }, { "entropy": 5.6602719783782955, "epoch": 0.166186386145539, "grad_norm": 1.0078125, "learning_rate": 0.00016888378839891298, "loss": 5.5228, "mean_token_accuracy": 0.17843340784311296, "num_tokens": 5459142.0, "step": 2970 }, { "entropy": 5.6811339378356935, "epoch": 0.16646616120639007, "grad_norm": 1.0859375, "learning_rate": 0.0001678464041747137, "loss": 5.4876, "mean_token_accuracy": 0.17183150500059127, "num_tokens": 5468813.0, "step": 2975 }, { "entropy": 5.6007122039794925, "epoch": 0.16674593626724113, "grad_norm": 1.0703125, "learning_rate": 0.00016681195762047223, "loss": 5.4389, "mean_token_accuracy": 0.1756803125143051, "num_tokens": 5478048.0, "step": 2980 }, { "entropy": 5.656706428527832, "epoch": 0.1670257113280922, "grad_norm": 1.03125, "learning_rate": 0.00016578047709606337, "loss": 5.5034, "mean_token_accuracy": 0.16890244632959367, "num_tokens": 5488136.0, "step": 2985 }, { "entropy": 5.625456476211548, "epoch": 0.1673054863889433, "grad_norm": 1.1171875, "learning_rate": 0.00016475199088004678, "loss": 5.4759, "mean_token_accuracy": 0.17770687043666838, "num_tokens": 5497712.0, "step": 2990 }, { "entropy": 5.605235433578491, "epoch": 0.16758526144979435, "grad_norm": 1.0234375, "learning_rate": 0.00016372652716889163, "loss": 5.4462, "mean_token_accuracy": 0.17041922062635423, "num_tokens": 5506884.0, "step": 2995 }, { "entropy": 5.598785877227783, "epoch": 0.16786503651064544, "grad_norm": 1.0546875, "learning_rate": 0.0001627041140762035, "loss": 5.3115, "mean_token_accuracy": 0.18399081379175186, "num_tokens": 5515513.0, "step": 3000 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 8081378777088000.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }