{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.055955012170215146, "eval_steps": 500, "global_step": 1000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.691505527496338, "epoch": 0.0002797750608510757, "grad_norm": 12.375, "learning_rate": 2e-06, "loss": 10.7862, "mean_token_accuracy": 0.0, "num_tokens": 9833.0, "step": 5 }, { "entropy": 10.691538619995118, "epoch": 0.0005595501217021514, "grad_norm": 13.0, "learning_rate": 4.5e-06, "loss": 10.7246, "mean_token_accuracy": 0.0, "num_tokens": 19666.0, "step": 10 }, { "entropy": 10.691145992279052, "epoch": 0.0008393251825532272, "grad_norm": 9.3125, "learning_rate": 7e-06, "loss": 10.4747, "mean_token_accuracy": 0.019643833697773515, "num_tokens": 28771.0, "step": 15 }, { "entropy": 10.682477760314942, "epoch": 0.0011191002434043028, "grad_norm": 6.21875, "learning_rate": 9.5e-06, "loss": 10.1639, "mean_token_accuracy": 0.04193656481802464, "num_tokens": 38625.0, "step": 20 }, { "entropy": 10.617809772491455, "epoch": 0.0013988753042553786, "grad_norm": 4.09375, "learning_rate": 1.2e-05, "loss": 9.8606, "mean_token_accuracy": 0.04725950676947832, "num_tokens": 47864.0, "step": 25 }, { "entropy": 10.55274839401245, "epoch": 0.0016786503651064545, "grad_norm": 3.421875, "learning_rate": 1.4500000000000002e-05, "loss": 9.6963, "mean_token_accuracy": 0.04289307370781899, "num_tokens": 55926.0, "step": 30 }, { "entropy": 10.584246730804443, "epoch": 0.0019584254259575303, "grad_norm": 3.078125, "learning_rate": 1.7000000000000003e-05, "loss": 9.6414, "mean_token_accuracy": 0.044558577984571454, "num_tokens": 64915.0, "step": 35 }, { "entropy": 10.56161117553711, "epoch": 0.0022382004868086057, "grad_norm": 2.65625, "learning_rate": 1.95e-05, "loss": 9.6116, "mean_token_accuracy": 0.041977206617593764, "num_tokens": 73813.0, "step": 40 }, { "entropy": 10.549141788482666, "epoch": 0.0025179755476596815, "grad_norm": 2.421875, "learning_rate": 2.2e-05, "loss": 9.5772, "mean_token_accuracy": 0.04488353617489338, "num_tokens": 83706.0, "step": 45 }, { "entropy": 10.555339050292968, "epoch": 0.0027977506085107573, "grad_norm": 2.53125, "learning_rate": 2.4500000000000003e-05, "loss": 9.5206, "mean_token_accuracy": 0.041607250832021235, "num_tokens": 92739.0, "step": 50 }, { "entropy": 10.562696361541748, "epoch": 0.003077525669361833, "grad_norm": 2.65625, "learning_rate": 2.7e-05, "loss": 9.4731, "mean_token_accuracy": 0.04852877669036389, "num_tokens": 101880.0, "step": 55 }, { "entropy": 10.513782119750976, "epoch": 0.003357300730212909, "grad_norm": 2.59375, "learning_rate": 2.95e-05, "loss": 9.4135, "mean_token_accuracy": 0.05527102164924145, "num_tokens": 111303.0, "step": 60 }, { "entropy": 10.410881614685058, "epoch": 0.0036370757910639847, "grad_norm": 2.578125, "learning_rate": 3.2e-05, "loss": 9.2608, "mean_token_accuracy": 0.059278345108032225, "num_tokens": 121022.0, "step": 65 }, { "entropy": 10.35908842086792, "epoch": 0.0039168508519150606, "grad_norm": 2.3125, "learning_rate": 3.4500000000000005e-05, "loss": 9.1931, "mean_token_accuracy": 0.05288665182888508, "num_tokens": 129764.0, "step": 70 }, { "entropy": 10.414530277252197, "epoch": 0.004196625912766136, "grad_norm": 2.671875, "learning_rate": 3.7e-05, "loss": 9.12, "mean_token_accuracy": 0.05712716057896614, "num_tokens": 139543.0, "step": 75 }, { "entropy": 10.420390224456787, "epoch": 0.004476400973617211, "grad_norm": 2.453125, "learning_rate": 3.95e-05, "loss": 9.0894, "mean_token_accuracy": 0.055438223481178286, "num_tokens": 148772.0, "step": 80 }, { "entropy": 10.439853763580322, "epoch": 0.004756176034468288, "grad_norm": 2.53125, "learning_rate": 4.2000000000000004e-05, "loss": 8.8746, "mean_token_accuracy": 0.06480722092092037, "num_tokens": 158786.0, "step": 85 }, { "entropy": 10.333017063140868, "epoch": 0.005035951095319363, "grad_norm": 2.46875, "learning_rate": 4.45e-05, "loss": 8.7978, "mean_token_accuracy": 0.06817127540707588, "num_tokens": 166989.0, "step": 90 }, { "entropy": 10.257375049591065, "epoch": 0.005315726156170439, "grad_norm": 2.421875, "learning_rate": 4.7000000000000004e-05, "loss": 8.6945, "mean_token_accuracy": 0.06792460419237614, "num_tokens": 175840.0, "step": 95 }, { "entropy": 10.24816074371338, "epoch": 0.005595501217021515, "grad_norm": 2.484375, "learning_rate": 4.9500000000000004e-05, "loss": 8.6247, "mean_token_accuracy": 0.06662830822169781, "num_tokens": 185375.0, "step": 100 }, { "entropy": 10.16532497406006, "epoch": 0.005875276277872591, "grad_norm": 2.125, "learning_rate": 5.2e-05, "loss": 8.5206, "mean_token_accuracy": 0.07044463530182839, "num_tokens": 194647.0, "step": 105 }, { "entropy": 10.170048713684082, "epoch": 0.006155051338723666, "grad_norm": 2.421875, "learning_rate": 5.45e-05, "loss": 8.4143, "mean_token_accuracy": 0.07247264273464679, "num_tokens": 203882.0, "step": 110 }, { "entropy": 10.117275524139405, "epoch": 0.006434826399574742, "grad_norm": 2.796875, "learning_rate": 5.7e-05, "loss": 8.2929, "mean_token_accuracy": 0.06882111690938472, "num_tokens": 212641.0, "step": 115 }, { "entropy": 10.047082424163818, "epoch": 0.006714601460425818, "grad_norm": 2.125, "learning_rate": 5.9499999999999996e-05, "loss": 8.1784, "mean_token_accuracy": 0.07864802330732346, "num_tokens": 221668.0, "step": 120 }, { "entropy": 9.896892261505126, "epoch": 0.006994376521276893, "grad_norm": 2.390625, "learning_rate": 6.2e-05, "loss": 8.0655, "mean_token_accuracy": 0.07759866937994957, "num_tokens": 230277.0, "step": 125 }, { "entropy": 9.822550010681152, "epoch": 0.0072741515821279695, "grad_norm": 1.8125, "learning_rate": 6.450000000000001e-05, "loss": 7.9853, "mean_token_accuracy": 0.07847488112747669, "num_tokens": 240191.0, "step": 130 }, { "entropy": 9.653499507904053, "epoch": 0.007553926642979045, "grad_norm": 2.40625, "learning_rate": 6.7e-05, "loss": 7.8597, "mean_token_accuracy": 0.08022317960858345, "num_tokens": 249600.0, "step": 135 }, { "entropy": 9.487109375, "epoch": 0.007833701703830121, "grad_norm": 1.96875, "learning_rate": 6.950000000000001e-05, "loss": 7.7858, "mean_token_accuracy": 0.07919244170188904, "num_tokens": 258766.0, "step": 140 }, { "entropy": 9.301309394836426, "epoch": 0.008113476764681197, "grad_norm": 1.84375, "learning_rate": 7.2e-05, "loss": 7.5919, "mean_token_accuracy": 0.08380925506353379, "num_tokens": 268399.0, "step": 145 }, { "entropy": 9.010336112976074, "epoch": 0.008393251825532272, "grad_norm": 1.3359375, "learning_rate": 7.45e-05, "loss": 7.5475, "mean_token_accuracy": 0.08445582017302514, "num_tokens": 278348.0, "step": 150 }, { "entropy": 8.899579620361328, "epoch": 0.008673026886383347, "grad_norm": 1.7265625, "learning_rate": 7.7e-05, "loss": 7.5228, "mean_token_accuracy": 0.07803246155381202, "num_tokens": 288429.0, "step": 155 }, { "entropy": 8.617181396484375, "epoch": 0.008952801947234423, "grad_norm": 1.5078125, "learning_rate": 7.950000000000001e-05, "loss": 7.319, "mean_token_accuracy": 0.09034765139222145, "num_tokens": 297936.0, "step": 160 }, { "entropy": 8.410243892669678, "epoch": 0.0092325770080855, "grad_norm": 1.6640625, "learning_rate": 8.2e-05, "loss": 7.3897, "mean_token_accuracy": 0.08498694151639938, "num_tokens": 307390.0, "step": 165 }, { "entropy": 8.320203971862792, "epoch": 0.009512352068936575, "grad_norm": 1.4375, "learning_rate": 8.450000000000001e-05, "loss": 7.3416, "mean_token_accuracy": 0.07727829068899154, "num_tokens": 316381.0, "step": 170 }, { "entropy": 8.236638164520263, "epoch": 0.00979212712978765, "grad_norm": 1.96875, "learning_rate": 8.7e-05, "loss": 7.3116, "mean_token_accuracy": 0.07726738080382348, "num_tokens": 325086.0, "step": 175 }, { "entropy": 8.076795291900634, "epoch": 0.010071902190638726, "grad_norm": 1.5546875, "learning_rate": 8.95e-05, "loss": 7.1784, "mean_token_accuracy": 0.08438889384269714, "num_tokens": 334438.0, "step": 180 }, { "entropy": 7.889586877822876, "epoch": 0.010351677251489803, "grad_norm": 1.3515625, "learning_rate": 9.2e-05, "loss": 7.1976, "mean_token_accuracy": 0.0870728187263012, "num_tokens": 343169.0, "step": 185 }, { "entropy": 7.912118721008301, "epoch": 0.010631452312340878, "grad_norm": 1.734375, "learning_rate": 9.45e-05, "loss": 7.126, "mean_token_accuracy": 0.08688639178872108, "num_tokens": 352260.0, "step": 190 }, { "entropy": 7.820125246047974, "epoch": 0.010911227373191954, "grad_norm": 1.6796875, "learning_rate": 9.7e-05, "loss": 7.0827, "mean_token_accuracy": 0.08836827799677849, "num_tokens": 361436.0, "step": 195 }, { "entropy": 7.675041007995605, "epoch": 0.01119100243404303, "grad_norm": 1.3515625, "learning_rate": 9.95e-05, "loss": 7.1613, "mean_token_accuracy": 0.09058133289217948, "num_tokens": 370232.0, "step": 200 }, { "entropy": 7.803629922866821, "epoch": 0.011470777494894105, "grad_norm": 1.5234375, "learning_rate": 0.000102, "loss": 7.1257, "mean_token_accuracy": 0.0905453845858574, "num_tokens": 380211.0, "step": 205 }, { "entropy": 7.76220006942749, "epoch": 0.011750552555745182, "grad_norm": 1.390625, "learning_rate": 0.00010449999999999999, "loss": 7.1154, "mean_token_accuracy": 0.08261686339974403, "num_tokens": 390089.0, "step": 210 }, { "entropy": 7.6790376663208, "epoch": 0.012030327616596257, "grad_norm": 1.734375, "learning_rate": 0.000107, "loss": 7.0364, "mean_token_accuracy": 0.08655178025364876, "num_tokens": 398513.0, "step": 215 }, { "entropy": 7.6753379821777346, "epoch": 0.012310102677447332, "grad_norm": 1.484375, "learning_rate": 0.0001095, "loss": 7.1785, "mean_token_accuracy": 0.08271857276558876, "num_tokens": 408114.0, "step": 220 }, { "entropy": 7.658677101135254, "epoch": 0.012589877738298408, "grad_norm": 1.4296875, "learning_rate": 0.000112, "loss": 7.0324, "mean_token_accuracy": 0.08730659186840058, "num_tokens": 417680.0, "step": 225 }, { "entropy": 7.590711975097657, "epoch": 0.012869652799149483, "grad_norm": 1.2421875, "learning_rate": 0.0001145, "loss": 6.94, "mean_token_accuracy": 0.0981583096086979, "num_tokens": 426056.0, "step": 230 }, { "entropy": 7.538638401031494, "epoch": 0.01314942786000056, "grad_norm": 1.4296875, "learning_rate": 0.00011700000000000001, "loss": 6.8994, "mean_token_accuracy": 0.09497818350791931, "num_tokens": 435465.0, "step": 235 }, { "entropy": 7.547599267959595, "epoch": 0.013429202920851636, "grad_norm": 1.25, "learning_rate": 0.00011949999999999999, "loss": 6.9882, "mean_token_accuracy": 0.09514376819133759, "num_tokens": 444295.0, "step": 240 }, { "entropy": 7.532002258300781, "epoch": 0.013708977981702711, "grad_norm": 1.28125, "learning_rate": 0.000122, "loss": 6.9084, "mean_token_accuracy": 0.09089445620775223, "num_tokens": 453111.0, "step": 245 }, { "entropy": 7.416005039215088, "epoch": 0.013988753042553786, "grad_norm": 1.28125, "learning_rate": 0.0001245, "loss": 6.8671, "mean_token_accuracy": 0.09376973509788514, "num_tokens": 462438.0, "step": 250 }, { "entropy": 7.44201397895813, "epoch": 0.014268528103404862, "grad_norm": 1.5234375, "learning_rate": 0.000127, "loss": 6.8518, "mean_token_accuracy": 0.0919196330010891, "num_tokens": 471610.0, "step": 255 }, { "entropy": 7.486415004730224, "epoch": 0.014548303164255939, "grad_norm": 1.4140625, "learning_rate": 0.0001295, "loss": 6.9342, "mean_token_accuracy": 0.09321872368454934, "num_tokens": 480849.0, "step": 260 }, { "entropy": 7.40749454498291, "epoch": 0.014828078225107014, "grad_norm": 1.34375, "learning_rate": 0.000132, "loss": 6.9376, "mean_token_accuracy": 0.08951603546738625, "num_tokens": 489756.0, "step": 265 }, { "entropy": 7.461516523361206, "epoch": 0.01510785328595809, "grad_norm": 1.734375, "learning_rate": 0.00013450000000000002, "loss": 6.9217, "mean_token_accuracy": 0.09437951892614364, "num_tokens": 498818.0, "step": 270 }, { "entropy": 7.285744953155517, "epoch": 0.015387628346809165, "grad_norm": 1.25, "learning_rate": 0.00013700000000000002, "loss": 6.8458, "mean_token_accuracy": 0.09555465653538704, "num_tokens": 508508.0, "step": 275 }, { "entropy": 7.444489002227783, "epoch": 0.015667403407660242, "grad_norm": 1.5078125, "learning_rate": 0.0001395, "loss": 7.0025, "mean_token_accuracy": 0.09034469872713088, "num_tokens": 518257.0, "step": 280 }, { "entropy": 7.36638994216919, "epoch": 0.015947178468511316, "grad_norm": 1.328125, "learning_rate": 0.00014199999999999998, "loss": 6.9625, "mean_token_accuracy": 0.08916445821523666, "num_tokens": 527811.0, "step": 285 }, { "entropy": 7.358241605758667, "epoch": 0.016226953529362393, "grad_norm": 1.3671875, "learning_rate": 0.0001445, "loss": 6.8297, "mean_token_accuracy": 0.09337828531861306, "num_tokens": 536991.0, "step": 290 }, { "entropy": 7.320535326004029, "epoch": 0.016506728590213467, "grad_norm": 1.1484375, "learning_rate": 0.000147, "loss": 6.9245, "mean_token_accuracy": 0.0914350025355816, "num_tokens": 546498.0, "step": 295 }, { "entropy": 7.351836109161377, "epoch": 0.016786503651064544, "grad_norm": 1.2109375, "learning_rate": 0.0001495, "loss": 6.8809, "mean_token_accuracy": 0.09436944723129273, "num_tokens": 556022.0, "step": 300 }, { "entropy": 7.289101552963257, "epoch": 0.01706627871191562, "grad_norm": 1.40625, "learning_rate": 0.000152, "loss": 6.8212, "mean_token_accuracy": 0.09640712589025498, "num_tokens": 565392.0, "step": 305 }, { "entropy": 7.230247545242309, "epoch": 0.017346053772766695, "grad_norm": 1.46875, "learning_rate": 0.00015450000000000001, "loss": 6.8043, "mean_token_accuracy": 0.09431554824113846, "num_tokens": 574485.0, "step": 310 }, { "entropy": 7.3728536605834964, "epoch": 0.01762582883361777, "grad_norm": 1.375, "learning_rate": 0.000157, "loss": 6.8343, "mean_token_accuracy": 0.09452549517154693, "num_tokens": 583149.0, "step": 315 }, { "entropy": 7.280808210372925, "epoch": 0.017905603894468845, "grad_norm": 1.5234375, "learning_rate": 0.0001595, "loss": 6.8855, "mean_token_accuracy": 0.09358676373958588, "num_tokens": 592876.0, "step": 320 }, { "entropy": 7.064757013320923, "epoch": 0.018185378955319922, "grad_norm": 1.3203125, "learning_rate": 0.000162, "loss": 6.6685, "mean_token_accuracy": 0.09988230094313622, "num_tokens": 602001.0, "step": 325 }, { "entropy": 7.323857975006104, "epoch": 0.018465154016171, "grad_norm": 1.484375, "learning_rate": 0.00016450000000000001, "loss": 6.8667, "mean_token_accuracy": 0.09093789532780647, "num_tokens": 611602.0, "step": 330 }, { "entropy": 7.089147615432739, "epoch": 0.018744929077022073, "grad_norm": 1.34375, "learning_rate": 0.00016700000000000002, "loss": 6.7506, "mean_token_accuracy": 0.09642454162240029, "num_tokens": 620905.0, "step": 335 }, { "entropy": 7.273478889465332, "epoch": 0.01902470413787315, "grad_norm": 1.203125, "learning_rate": 0.00016950000000000003, "loss": 6.8279, "mean_token_accuracy": 0.0952286258339882, "num_tokens": 630151.0, "step": 340 }, { "entropy": 7.070547962188721, "epoch": 0.019304479198724227, "grad_norm": 1.1796875, "learning_rate": 0.00017199999999999998, "loss": 6.7905, "mean_token_accuracy": 0.09692409187555313, "num_tokens": 639864.0, "step": 345 }, { "entropy": 7.4187744140625, "epoch": 0.0195842542595753, "grad_norm": 1.3515625, "learning_rate": 0.00017449999999999999, "loss": 6.8707, "mean_token_accuracy": 0.09315617531538009, "num_tokens": 648819.0, "step": 350 }, { "entropy": 7.169836378097534, "epoch": 0.019864029320426378, "grad_norm": 1.4140625, "learning_rate": 0.000177, "loss": 6.8027, "mean_token_accuracy": 0.09456639736890793, "num_tokens": 658438.0, "step": 355 }, { "entropy": 7.143348264694214, "epoch": 0.020143804381277452, "grad_norm": 1.2109375, "learning_rate": 0.0001795, "loss": 6.7459, "mean_token_accuracy": 0.09843514785170555, "num_tokens": 668140.0, "step": 360 }, { "entropy": 7.207337665557861, "epoch": 0.02042357944212853, "grad_norm": 1.3203125, "learning_rate": 0.000182, "loss": 6.7733, "mean_token_accuracy": 0.09692016914486885, "num_tokens": 677505.0, "step": 365 }, { "entropy": 7.047050952911377, "epoch": 0.020703354502979606, "grad_norm": 1.0703125, "learning_rate": 0.0001845, "loss": 6.7596, "mean_token_accuracy": 0.09099765941500663, "num_tokens": 687911.0, "step": 370 }, { "entropy": 7.110365295410157, "epoch": 0.02098312956383068, "grad_norm": 1.40625, "learning_rate": 0.000187, "loss": 6.7002, "mean_token_accuracy": 0.10557077825069427, "num_tokens": 696565.0, "step": 375 }, { "entropy": 7.068933725357056, "epoch": 0.021262904624681757, "grad_norm": 1.2265625, "learning_rate": 0.0001895, "loss": 6.6321, "mean_token_accuracy": 0.09727629125118256, "num_tokens": 704918.0, "step": 380 }, { "entropy": 7.053268480300903, "epoch": 0.02154267968553283, "grad_norm": 1.28125, "learning_rate": 0.000192, "loss": 6.6612, "mean_token_accuracy": 0.1000488631427288, "num_tokens": 716172.0, "step": 385 }, { "entropy": 7.058245515823364, "epoch": 0.021822454746383908, "grad_norm": 1.46875, "learning_rate": 0.0001945, "loss": 6.6344, "mean_token_accuracy": 0.10481962487101555, "num_tokens": 725075.0, "step": 390 }, { "entropy": 7.085121202468872, "epoch": 0.022102229807234985, "grad_norm": 1.4765625, "learning_rate": 0.00019700000000000002, "loss": 6.7861, "mean_token_accuracy": 0.09666902050375939, "num_tokens": 733314.0, "step": 395 }, { "entropy": 7.137383270263672, "epoch": 0.02238200486808606, "grad_norm": 1.359375, "learning_rate": 0.00019950000000000002, "loss": 6.6717, "mean_token_accuracy": 0.10260491818189621, "num_tokens": 742390.0, "step": 400 }, { "entropy": 6.997572708129883, "epoch": 0.022661779928937135, "grad_norm": 1.2265625, "learning_rate": 0.000202, "loss": 6.7582, "mean_token_accuracy": 0.09590908735990525, "num_tokens": 751464.0, "step": 405 }, { "entropy": 7.058079195022583, "epoch": 0.02294155498978821, "grad_norm": 1.234375, "learning_rate": 0.00020449999999999998, "loss": 6.6488, "mean_token_accuracy": 0.10047566667199134, "num_tokens": 760746.0, "step": 410 }, { "entropy": 6.995281791687011, "epoch": 0.023221330050639286, "grad_norm": 1.25, "learning_rate": 0.000207, "loss": 6.5617, "mean_token_accuracy": 0.10464712381362914, "num_tokens": 769052.0, "step": 415 }, { "entropy": 6.989618110656738, "epoch": 0.023501105111490363, "grad_norm": 1.2265625, "learning_rate": 0.0002095, "loss": 6.7826, "mean_token_accuracy": 0.09742124751210213, "num_tokens": 778660.0, "step": 420 }, { "entropy": 7.074799585342407, "epoch": 0.023780880172341437, "grad_norm": 1.296875, "learning_rate": 0.000212, "loss": 6.6877, "mean_token_accuracy": 0.10435819402337074, "num_tokens": 787841.0, "step": 425 }, { "entropy": 6.878971099853516, "epoch": 0.024060655233192514, "grad_norm": 1.328125, "learning_rate": 0.0002145, "loss": 6.537, "mean_token_accuracy": 0.10397473350167274, "num_tokens": 796175.0, "step": 430 }, { "entropy": 6.980287361145019, "epoch": 0.024340430294043588, "grad_norm": 1.234375, "learning_rate": 0.00021700000000000002, "loss": 6.5959, "mean_token_accuracy": 0.10773405581712722, "num_tokens": 805941.0, "step": 435 }, { "entropy": 6.9006028175354, "epoch": 0.024620205354894665, "grad_norm": 1.1953125, "learning_rate": 0.0002195, "loss": 6.6389, "mean_token_accuracy": 0.09920870438218117, "num_tokens": 815058.0, "step": 440 }, { "entropy": 7.100294494628907, "epoch": 0.024899980415745742, "grad_norm": 1.2578125, "learning_rate": 0.000222, "loss": 6.6593, "mean_token_accuracy": 0.10117991864681244, "num_tokens": 824459.0, "step": 445 }, { "entropy": 6.872482252120972, "epoch": 0.025179755476596816, "grad_norm": 1.0859375, "learning_rate": 0.0002245, "loss": 6.656, "mean_token_accuracy": 0.10260392725467682, "num_tokens": 835250.0, "step": 450 }, { "entropy": 6.986909580230713, "epoch": 0.025459530537447893, "grad_norm": 1.03125, "learning_rate": 0.00022700000000000002, "loss": 6.6617, "mean_token_accuracy": 0.10458940342068672, "num_tokens": 844643.0, "step": 455 }, { "entropy": 6.96947169303894, "epoch": 0.025739305598298966, "grad_norm": 1.21875, "learning_rate": 0.00022950000000000002, "loss": 6.5977, "mean_token_accuracy": 0.10226123109459877, "num_tokens": 853375.0, "step": 460 }, { "entropy": 6.875414848327637, "epoch": 0.026019080659150044, "grad_norm": 1.1640625, "learning_rate": 0.00023200000000000003, "loss": 6.5253, "mean_token_accuracy": 0.11177821755409241, "num_tokens": 862244.0, "step": 465 }, { "entropy": 6.945923662185669, "epoch": 0.02629885572000112, "grad_norm": 1.34375, "learning_rate": 0.00023449999999999998, "loss": 6.6286, "mean_token_accuracy": 0.09996586814522743, "num_tokens": 871828.0, "step": 470 }, { "entropy": 6.8525604724884035, "epoch": 0.026578630780852194, "grad_norm": 1.3125, "learning_rate": 0.000237, "loss": 6.6076, "mean_token_accuracy": 0.10374173521995544, "num_tokens": 881087.0, "step": 475 }, { "entropy": 6.889187860488891, "epoch": 0.02685840584170327, "grad_norm": 1.234375, "learning_rate": 0.0002395, "loss": 6.6779, "mean_token_accuracy": 0.10589562878012657, "num_tokens": 890061.0, "step": 480 }, { "entropy": 7.009466075897217, "epoch": 0.027138180902554345, "grad_norm": 1.1328125, "learning_rate": 0.000242, "loss": 6.6192, "mean_token_accuracy": 0.10268636345863343, "num_tokens": 899388.0, "step": 485 }, { "entropy": 6.763098287582397, "epoch": 0.027417955963405422, "grad_norm": 1.3203125, "learning_rate": 0.0002445, "loss": 6.5255, "mean_token_accuracy": 0.10589060559868813, "num_tokens": 908295.0, "step": 490 }, { "entropy": 6.7688929557800295, "epoch": 0.0276977310242565, "grad_norm": 1.21875, "learning_rate": 0.000247, "loss": 6.4924, "mean_token_accuracy": 0.10882084742188454, "num_tokens": 917514.0, "step": 495 }, { "entropy": 6.904528284072876, "epoch": 0.027977506085107573, "grad_norm": 1.1328125, "learning_rate": 0.0002495, "loss": 6.5978, "mean_token_accuracy": 0.10768755748867989, "num_tokens": 927146.0, "step": 500 }, { "entropy": 6.758494710922241, "epoch": 0.02825728114595865, "grad_norm": 1.3828125, "learning_rate": 0.000252, "loss": 6.4884, "mean_token_accuracy": 0.10985259413719177, "num_tokens": 935278.0, "step": 505 }, { "entropy": 6.831978225708008, "epoch": 0.028537056206809724, "grad_norm": 1.3125, "learning_rate": 0.0002545, "loss": 6.5894, "mean_token_accuracy": 0.10266794636845589, "num_tokens": 945056.0, "step": 510 }, { "entropy": 6.827414417266846, "epoch": 0.0288168312676608, "grad_norm": 1.1953125, "learning_rate": 0.000257, "loss": 6.5527, "mean_token_accuracy": 0.10177932679653168, "num_tokens": 954187.0, "step": 515 }, { "entropy": 6.905342674255371, "epoch": 0.029096606328511878, "grad_norm": 1.140625, "learning_rate": 0.0002595, "loss": 6.5899, "mean_token_accuracy": 0.10657662600278854, "num_tokens": 963075.0, "step": 520 }, { "entropy": 6.886737442016601, "epoch": 0.02937638138936295, "grad_norm": 1.125, "learning_rate": 0.000262, "loss": 6.5683, "mean_token_accuracy": 0.10781930312514305, "num_tokens": 972110.0, "step": 525 }, { "entropy": 6.684601259231568, "epoch": 0.02965615645021403, "grad_norm": 1.3984375, "learning_rate": 0.00026450000000000003, "loss": 6.4582, "mean_token_accuracy": 0.11291620060801506, "num_tokens": 980231.0, "step": 530 }, { "entropy": 6.7892358779907225, "epoch": 0.029935931511065102, "grad_norm": 1.21875, "learning_rate": 0.00026700000000000004, "loss": 6.6105, "mean_token_accuracy": 0.10551066771149635, "num_tokens": 990018.0, "step": 535 }, { "entropy": 6.703322696685791, "epoch": 0.03021570657191618, "grad_norm": 1.3203125, "learning_rate": 0.00026950000000000005, "loss": 6.4987, "mean_token_accuracy": 0.10690677091479302, "num_tokens": 999243.0, "step": 540 }, { "entropy": 6.800885343551636, "epoch": 0.030495481632767257, "grad_norm": 1.1484375, "learning_rate": 0.00027200000000000005, "loss": 6.4947, "mean_token_accuracy": 0.1084700345993042, "num_tokens": 1008800.0, "step": 545 }, { "entropy": 6.75251727104187, "epoch": 0.03077525669361833, "grad_norm": 1.125, "learning_rate": 0.0002745, "loss": 6.5354, "mean_token_accuracy": 0.10884697884321212, "num_tokens": 1018880.0, "step": 550 }, { "entropy": 6.796888923645019, "epoch": 0.031055031754469407, "grad_norm": 1.15625, "learning_rate": 0.000277, "loss": 6.4822, "mean_token_accuracy": 0.10811220407485962, "num_tokens": 1028508.0, "step": 555 }, { "entropy": 6.65325436592102, "epoch": 0.031334806815320485, "grad_norm": 1.3671875, "learning_rate": 0.0002795, "loss": 6.4371, "mean_token_accuracy": 0.11171221733093262, "num_tokens": 1037626.0, "step": 560 }, { "entropy": 6.6531189441680905, "epoch": 0.031614581876171555, "grad_norm": 1.2734375, "learning_rate": 0.00028199999999999997, "loss": 6.4237, "mean_token_accuracy": 0.1133709043264389, "num_tokens": 1046814.0, "step": 565 }, { "entropy": 6.597415113449097, "epoch": 0.03189435693702263, "grad_norm": 1.09375, "learning_rate": 0.0002845, "loss": 6.4282, "mean_token_accuracy": 0.10929519906640053, "num_tokens": 1056620.0, "step": 570 }, { "entropy": 6.794770956039429, "epoch": 0.03217413199787371, "grad_norm": 1.234375, "learning_rate": 0.000287, "loss": 6.4834, "mean_token_accuracy": 0.11290100738406181, "num_tokens": 1064488.0, "step": 575 }, { "entropy": 6.786476469039917, "epoch": 0.032453907058724786, "grad_norm": 1.4375, "learning_rate": 0.0002895, "loss": 6.5179, "mean_token_accuracy": 0.11080160588026047, "num_tokens": 1074153.0, "step": 580 }, { "entropy": 6.673076820373535, "epoch": 0.03273368211957586, "grad_norm": 1.3125, "learning_rate": 0.000292, "loss": 6.452, "mean_token_accuracy": 0.10839907601475715, "num_tokens": 1083027.0, "step": 585 }, { "entropy": 6.628738451004028, "epoch": 0.03301345718042693, "grad_norm": 1.28125, "learning_rate": 0.0002945, "loss": 6.4465, "mean_token_accuracy": 0.10820735022425651, "num_tokens": 1092010.0, "step": 590 }, { "entropy": 6.731857395172119, "epoch": 0.03329323224127801, "grad_norm": 1.2265625, "learning_rate": 0.000297, "loss": 6.4946, "mean_token_accuracy": 0.10928055047988891, "num_tokens": 1101776.0, "step": 595 }, { "entropy": 6.651297473907471, "epoch": 0.03357300730212909, "grad_norm": 1.3828125, "learning_rate": 0.0002995, "loss": 6.4487, "mean_token_accuracy": 0.10809680670499802, "num_tokens": 1110894.0, "step": 600 }, { "entropy": 6.813410139083862, "epoch": 0.033852782362980165, "grad_norm": 1.203125, "learning_rate": 0.000302, "loss": 6.4318, "mean_token_accuracy": 0.10976689979434014, "num_tokens": 1119512.0, "step": 605 }, { "entropy": 6.574000358581543, "epoch": 0.03413255742383124, "grad_norm": 1.265625, "learning_rate": 0.0003045, "loss": 6.4217, "mean_token_accuracy": 0.10791075751185417, "num_tokens": 1129469.0, "step": 610 }, { "entropy": 6.738797283172607, "epoch": 0.03441233248468231, "grad_norm": 1.2578125, "learning_rate": 0.000307, "loss": 6.4586, "mean_token_accuracy": 0.10540183559060097, "num_tokens": 1137850.0, "step": 615 }, { "entropy": 6.7057750701904295, "epoch": 0.03469210754553339, "grad_norm": 1.15625, "learning_rate": 0.0003095, "loss": 6.5737, "mean_token_accuracy": 0.11240374073386192, "num_tokens": 1147405.0, "step": 620 }, { "entropy": 6.679307174682617, "epoch": 0.034971882606384466, "grad_norm": 1.2421875, "learning_rate": 0.000312, "loss": 6.4446, "mean_token_accuracy": 0.11059640496969222, "num_tokens": 1156457.0, "step": 625 }, { "entropy": 6.691693830490112, "epoch": 0.03525165766723554, "grad_norm": 1.125, "learning_rate": 0.0003145, "loss": 6.4141, "mean_token_accuracy": 0.11546503752470016, "num_tokens": 1165943.0, "step": 630 }, { "entropy": 6.4711555480957035, "epoch": 0.03553143272808662, "grad_norm": 1.2265625, "learning_rate": 0.000317, "loss": 6.3521, "mean_token_accuracy": 0.11288735195994377, "num_tokens": 1175030.0, "step": 635 }, { "entropy": 6.5566987037658695, "epoch": 0.03581120778893769, "grad_norm": 1.2421875, "learning_rate": 0.0003195, "loss": 6.4719, "mean_token_accuracy": 0.11424087956547738, "num_tokens": 1184988.0, "step": 640 }, { "entropy": 6.78665771484375, "epoch": 0.03609098284978877, "grad_norm": 1.234375, "learning_rate": 0.000322, "loss": 6.4706, "mean_token_accuracy": 0.11168640255928039, "num_tokens": 1194352.0, "step": 645 }, { "entropy": 6.566987657546997, "epoch": 0.036370757910639845, "grad_norm": 1.1171875, "learning_rate": 0.00032450000000000003, "loss": 6.3646, "mean_token_accuracy": 0.1151100791990757, "num_tokens": 1203744.0, "step": 650 }, { "entropy": 6.640985155105591, "epoch": 0.03665053297149092, "grad_norm": 1.1796875, "learning_rate": 0.00032700000000000003, "loss": 6.4265, "mean_token_accuracy": 0.11166704073548317, "num_tokens": 1212917.0, "step": 655 }, { "entropy": 6.689370393753052, "epoch": 0.036930308032342, "grad_norm": 1.328125, "learning_rate": 0.00032950000000000004, "loss": 6.4567, "mean_token_accuracy": 0.11746964305639267, "num_tokens": 1221669.0, "step": 660 }, { "entropy": 6.537262868881226, "epoch": 0.037210083093193076, "grad_norm": 1.328125, "learning_rate": 0.00033200000000000005, "loss": 6.3787, "mean_token_accuracy": 0.11580658480525016, "num_tokens": 1230925.0, "step": 665 }, { "entropy": 6.473914861679077, "epoch": 0.037489858154044146, "grad_norm": 1.1171875, "learning_rate": 0.00033450000000000005, "loss": 6.3872, "mean_token_accuracy": 0.12107581570744515, "num_tokens": 1240317.0, "step": 670 }, { "entropy": 6.532442855834961, "epoch": 0.037769633214895224, "grad_norm": 1.265625, "learning_rate": 0.000337, "loss": 6.3565, "mean_token_accuracy": 0.11721108332276345, "num_tokens": 1250285.0, "step": 675 }, { "entropy": 6.558922338485718, "epoch": 0.0380494082757463, "grad_norm": 1.125, "learning_rate": 0.0003395, "loss": 6.3691, "mean_token_accuracy": 0.11794314831495285, "num_tokens": 1259272.0, "step": 680 }, { "entropy": 6.556687736511231, "epoch": 0.03832918333659738, "grad_norm": 1.2109375, "learning_rate": 0.000342, "loss": 6.3467, "mean_token_accuracy": 0.11026200056076049, "num_tokens": 1269069.0, "step": 685 }, { "entropy": 6.544914388656617, "epoch": 0.038608958397448455, "grad_norm": 1.3515625, "learning_rate": 0.00034449999999999997, "loss": 6.3472, "mean_token_accuracy": 0.1141720823943615, "num_tokens": 1277942.0, "step": 690 }, { "entropy": 6.516038227081299, "epoch": 0.038888733458299525, "grad_norm": 1.421875, "learning_rate": 0.000347, "loss": 6.4464, "mean_token_accuracy": 0.11829971224069595, "num_tokens": 1286731.0, "step": 695 }, { "entropy": 6.491542816162109, "epoch": 0.0391685085191506, "grad_norm": 1.265625, "learning_rate": 0.0003495, "loss": 6.306, "mean_token_accuracy": 0.11953174397349357, "num_tokens": 1295685.0, "step": 700 }, { "entropy": 6.41384859085083, "epoch": 0.03944828358000168, "grad_norm": 1.3046875, "learning_rate": 0.000352, "loss": 6.2558, "mean_token_accuracy": 0.1239193856716156, "num_tokens": 1304375.0, "step": 705 }, { "entropy": 6.570674753189087, "epoch": 0.039728058640852756, "grad_norm": 1.1640625, "learning_rate": 0.0003545, "loss": 6.4673, "mean_token_accuracy": 0.11799883842468262, "num_tokens": 1313282.0, "step": 710 }, { "entropy": 6.577246189117432, "epoch": 0.040007833701703834, "grad_norm": 1.46875, "learning_rate": 0.000357, "loss": 6.3111, "mean_token_accuracy": 0.11679205074906349, "num_tokens": 1322035.0, "step": 715 }, { "entropy": 6.528969764709473, "epoch": 0.040287608762554904, "grad_norm": 1.359375, "learning_rate": 0.0003595, "loss": 6.4596, "mean_token_accuracy": 0.11984212100505828, "num_tokens": 1331553.0, "step": 720 }, { "entropy": 6.455485153198242, "epoch": 0.04056738382340598, "grad_norm": 1.3828125, "learning_rate": 0.000362, "loss": 6.3126, "mean_token_accuracy": 0.11634061336517335, "num_tokens": 1340577.0, "step": 725 }, { "entropy": 6.606705093383789, "epoch": 0.04084715888425706, "grad_norm": 1.1875, "learning_rate": 0.0003645, "loss": 6.3608, "mean_token_accuracy": 0.12028084397315979, "num_tokens": 1349635.0, "step": 730 }, { "entropy": 6.485494136810303, "epoch": 0.041126933945108135, "grad_norm": 1.125, "learning_rate": 0.000367, "loss": 6.2679, "mean_token_accuracy": 0.11617309153079987, "num_tokens": 1358628.0, "step": 735 }, { "entropy": 6.461924934387207, "epoch": 0.04140670900595921, "grad_norm": 1.3671875, "learning_rate": 0.0003695, "loss": 6.4619, "mean_token_accuracy": 0.1150215283036232, "num_tokens": 1368023.0, "step": 740 }, { "entropy": 6.4644389152526855, "epoch": 0.04168648406681028, "grad_norm": 1.2578125, "learning_rate": 0.000372, "loss": 6.338, "mean_token_accuracy": 0.12105848267674446, "num_tokens": 1377354.0, "step": 745 }, { "entropy": 6.552575492858887, "epoch": 0.04196625912766136, "grad_norm": 1.3046875, "learning_rate": 0.0003745, "loss": 6.4018, "mean_token_accuracy": 0.1141360804438591, "num_tokens": 1386428.0, "step": 750 }, { "entropy": 6.4100508213043215, "epoch": 0.04224603418851244, "grad_norm": 1.125, "learning_rate": 0.000377, "loss": 6.2951, "mean_token_accuracy": 0.11664086356759071, "num_tokens": 1395809.0, "step": 755 }, { "entropy": 6.542036771774292, "epoch": 0.042525809249363514, "grad_norm": 1.078125, "learning_rate": 0.0003795, "loss": 6.322, "mean_token_accuracy": 0.12149200588464737, "num_tokens": 1405440.0, "step": 760 }, { "entropy": 6.500925827026367, "epoch": 0.04280558431021459, "grad_norm": 1.25, "learning_rate": 0.000382, "loss": 6.4325, "mean_token_accuracy": 0.11671576723456382, "num_tokens": 1414018.0, "step": 765 }, { "entropy": 6.469825267791748, "epoch": 0.04308535937106566, "grad_norm": 1.1328125, "learning_rate": 0.0003845, "loss": 6.3286, "mean_token_accuracy": 0.1199316494166851, "num_tokens": 1422853.0, "step": 770 }, { "entropy": 6.4752647399902346, "epoch": 0.04336513443191674, "grad_norm": 1.21875, "learning_rate": 0.00038700000000000003, "loss": 6.3173, "mean_token_accuracy": 0.12002637311816215, "num_tokens": 1431647.0, "step": 775 }, { "entropy": 6.4410097122192385, "epoch": 0.043644909492767815, "grad_norm": 1.4140625, "learning_rate": 0.00038950000000000003, "loss": 6.3052, "mean_token_accuracy": 0.12325269281864167, "num_tokens": 1440547.0, "step": 780 }, { "entropy": 6.460622024536133, "epoch": 0.04392468455361889, "grad_norm": 1.046875, "learning_rate": 0.00039200000000000004, "loss": 6.2662, "mean_token_accuracy": 0.12282432466745377, "num_tokens": 1450310.0, "step": 785 }, { "entropy": 6.4368048191070555, "epoch": 0.04420445961446997, "grad_norm": 1.3125, "learning_rate": 0.00039450000000000005, "loss": 6.3488, "mean_token_accuracy": 0.11794603615999222, "num_tokens": 1458544.0, "step": 790 }, { "entropy": 6.315302181243896, "epoch": 0.04448423467532104, "grad_norm": 1.25, "learning_rate": 0.00039700000000000005, "loss": 6.3146, "mean_token_accuracy": 0.12033002376556397, "num_tokens": 1467699.0, "step": 795 }, { "entropy": 6.488300848007202, "epoch": 0.04476400973617212, "grad_norm": 1.109375, "learning_rate": 0.0003995, "loss": 6.2519, "mean_token_accuracy": 0.1236931897699833, "num_tokens": 1477386.0, "step": 800 }, { "entropy": 6.3928173065185545, "epoch": 0.045043784797023194, "grad_norm": 1.4140625, "learning_rate": 0.000402, "loss": 6.2968, "mean_token_accuracy": 0.11787274852395058, "num_tokens": 1486660.0, "step": 805 }, { "entropy": 6.316296100616455, "epoch": 0.04532355985787427, "grad_norm": 1.2734375, "learning_rate": 0.0004045, "loss": 6.2154, "mean_token_accuracy": 0.12369973957538605, "num_tokens": 1495408.0, "step": 810 }, { "entropy": 6.420361280441284, "epoch": 0.04560333491872535, "grad_norm": 1.15625, "learning_rate": 0.00040699999999999997, "loss": 6.2966, "mean_token_accuracy": 0.12109342366456985, "num_tokens": 1503822.0, "step": 815 }, { "entropy": 6.339131259918213, "epoch": 0.04588310997957642, "grad_norm": 1.3203125, "learning_rate": 0.0004095, "loss": 6.2543, "mean_token_accuracy": 0.11657608151435853, "num_tokens": 1512822.0, "step": 820 }, { "entropy": 6.436035680770874, "epoch": 0.046162885040427495, "grad_norm": 1.1953125, "learning_rate": 0.000412, "loss": 6.3429, "mean_token_accuracy": 0.11799641102552413, "num_tokens": 1522321.0, "step": 825 }, { "entropy": 6.388043451309204, "epoch": 0.04644266010127857, "grad_norm": 1.234375, "learning_rate": 0.0004145, "loss": 6.3332, "mean_token_accuracy": 0.11690129637718201, "num_tokens": 1532071.0, "step": 830 }, { "entropy": 6.446229124069214, "epoch": 0.04672243516212965, "grad_norm": 1.15625, "learning_rate": 0.000417, "loss": 6.2658, "mean_token_accuracy": 0.1248463362455368, "num_tokens": 1541204.0, "step": 835 }, { "entropy": 6.321492671966553, "epoch": 0.04700221022298073, "grad_norm": 1.2265625, "learning_rate": 0.0004195, "loss": 6.301, "mean_token_accuracy": 0.11873220205307007, "num_tokens": 1548994.0, "step": 840 }, { "entropy": 6.387647390365601, "epoch": 0.0472819852838318, "grad_norm": 1.390625, "learning_rate": 0.000422, "loss": 6.3317, "mean_token_accuracy": 0.11347933784127236, "num_tokens": 1558012.0, "step": 845 }, { "entropy": 6.33697543144226, "epoch": 0.047561760344682874, "grad_norm": 1.265625, "learning_rate": 0.0004245, "loss": 6.344, "mean_token_accuracy": 0.12062845751643181, "num_tokens": 1567183.0, "step": 850 }, { "entropy": 6.517240285873413, "epoch": 0.04784153540553395, "grad_norm": 1.203125, "learning_rate": 0.000427, "loss": 6.3582, "mean_token_accuracy": 0.12024350762367249, "num_tokens": 1577213.0, "step": 855 }, { "entropy": 6.327879953384399, "epoch": 0.04812131046638503, "grad_norm": 1.125, "learning_rate": 0.0004295, "loss": 6.2433, "mean_token_accuracy": 0.12363175675272942, "num_tokens": 1586814.0, "step": 860 }, { "entropy": 6.303459978103637, "epoch": 0.048401085527236105, "grad_norm": 1.1796875, "learning_rate": 0.000432, "loss": 6.2858, "mean_token_accuracy": 0.12493444457650185, "num_tokens": 1596140.0, "step": 865 }, { "entropy": 6.3528955459594725, "epoch": 0.048680860588087176, "grad_norm": 1.234375, "learning_rate": 0.0004345, "loss": 6.1884, "mean_token_accuracy": 0.12042548209428787, "num_tokens": 1604811.0, "step": 870 }, { "entropy": 6.2718658447265625, "epoch": 0.04896063564893825, "grad_norm": 1.0859375, "learning_rate": 0.000437, "loss": 6.1916, "mean_token_accuracy": 0.12246528714895248, "num_tokens": 1613975.0, "step": 875 }, { "entropy": 6.39298005104065, "epoch": 0.04924041070978933, "grad_norm": 1.0859375, "learning_rate": 0.0004395, "loss": 6.2383, "mean_token_accuracy": 0.12414250522851944, "num_tokens": 1622571.0, "step": 880 }, { "entropy": 6.373995971679688, "epoch": 0.04952018577064041, "grad_norm": 1.1875, "learning_rate": 0.000442, "loss": 6.3129, "mean_token_accuracy": 0.12346948832273483, "num_tokens": 1631203.0, "step": 885 }, { "entropy": 6.396008825302124, "epoch": 0.049799960831491484, "grad_norm": 1.1953125, "learning_rate": 0.0004445, "loss": 6.3239, "mean_token_accuracy": 0.1246532879769802, "num_tokens": 1640170.0, "step": 890 }, { "entropy": 6.244958019256591, "epoch": 0.050079735892342554, "grad_norm": 1.1171875, "learning_rate": 0.000447, "loss": 6.2958, "mean_token_accuracy": 0.12313124164938927, "num_tokens": 1649039.0, "step": 895 }, { "entropy": 6.412044620513916, "epoch": 0.05035951095319363, "grad_norm": 1.0625, "learning_rate": 0.00044950000000000003, "loss": 6.2599, "mean_token_accuracy": 0.1271291956305504, "num_tokens": 1658445.0, "step": 900 }, { "entropy": 6.195079517364502, "epoch": 0.05063928601404471, "grad_norm": 1.1484375, "learning_rate": 0.00045200000000000004, "loss": 6.1302, "mean_token_accuracy": 0.13331740349531174, "num_tokens": 1667097.0, "step": 905 }, { "entropy": 6.290958261489868, "epoch": 0.050919061074895786, "grad_norm": 1.234375, "learning_rate": 0.00045450000000000004, "loss": 6.2619, "mean_token_accuracy": 0.11674268618226051, "num_tokens": 1676874.0, "step": 910 }, { "entropy": 6.34834885597229, "epoch": 0.05119883613574686, "grad_norm": 1.203125, "learning_rate": 0.00045700000000000005, "loss": 6.2019, "mean_token_accuracy": 0.12399802803993225, "num_tokens": 1685547.0, "step": 915 }, { "entropy": 6.189801597595215, "epoch": 0.05147861119659793, "grad_norm": 1.2109375, "learning_rate": 0.00045950000000000006, "loss": 6.191, "mean_token_accuracy": 0.12718559354543685, "num_tokens": 1693753.0, "step": 920 }, { "entropy": 6.277320146560669, "epoch": 0.05175838625744901, "grad_norm": 1.1015625, "learning_rate": 0.000462, "loss": 6.1807, "mean_token_accuracy": 0.12505132406949998, "num_tokens": 1703747.0, "step": 925 }, { "entropy": 6.1411545753479, "epoch": 0.05203816131830009, "grad_norm": 1.2734375, "learning_rate": 0.0004645, "loss": 6.1278, "mean_token_accuracy": 0.12806382775306702, "num_tokens": 1712656.0, "step": 930 }, { "entropy": 6.263706398010254, "epoch": 0.052317936379151164, "grad_norm": 1.2109375, "learning_rate": 0.000467, "loss": 6.2035, "mean_token_accuracy": 0.12317869812250137, "num_tokens": 1722695.0, "step": 935 }, { "entropy": 6.419267845153809, "epoch": 0.05259771144000224, "grad_norm": 1.0625, "learning_rate": 0.0004695, "loss": 6.3361, "mean_token_accuracy": 0.1168564572930336, "num_tokens": 1733003.0, "step": 940 }, { "entropy": 6.101446342468262, "epoch": 0.05287748650085331, "grad_norm": 1.078125, "learning_rate": 0.000472, "loss": 6.1556, "mean_token_accuracy": 0.12313281893730163, "num_tokens": 1742393.0, "step": 945 }, { "entropy": 6.349677515029907, "epoch": 0.05315726156170439, "grad_norm": 1.21875, "learning_rate": 0.0004745, "loss": 6.2524, "mean_token_accuracy": 0.12328635305166244, "num_tokens": 1752098.0, "step": 950 }, { "entropy": 6.1572033882141115, "epoch": 0.053437036622555466, "grad_norm": 1.1953125, "learning_rate": 0.000477, "loss": 6.0447, "mean_token_accuracy": 0.12816244289278983, "num_tokens": 1760835.0, "step": 955 }, { "entropy": 6.283704566955566, "epoch": 0.05371681168340654, "grad_norm": 1.1171875, "learning_rate": 0.0004795, "loss": 6.2603, "mean_token_accuracy": 0.12562395483255387, "num_tokens": 1770084.0, "step": 960 }, { "entropy": 6.192875766754151, "epoch": 0.05399658674425762, "grad_norm": 1.0625, "learning_rate": 0.000482, "loss": 6.2888, "mean_token_accuracy": 0.11796638444066047, "num_tokens": 1779321.0, "step": 965 }, { "entropy": 6.382868099212646, "epoch": 0.05427636180510869, "grad_norm": 1.1015625, "learning_rate": 0.0004845, "loss": 6.2053, "mean_token_accuracy": 0.12535162419080734, "num_tokens": 1789268.0, "step": 970 }, { "entropy": 6.16242561340332, "epoch": 0.05455613686595977, "grad_norm": 1.078125, "learning_rate": 0.000487, "loss": 6.1851, "mean_token_accuracy": 0.12277970910072326, "num_tokens": 1797765.0, "step": 975 }, { "entropy": 6.156621074676513, "epoch": 0.054835911926810844, "grad_norm": 1.1171875, "learning_rate": 0.0004895, "loss": 6.1426, "mean_token_accuracy": 0.13391674682497978, "num_tokens": 1807110.0, "step": 980 }, { "entropy": 6.318566751480103, "epoch": 0.05511568698766192, "grad_norm": 1.1328125, "learning_rate": 0.000492, "loss": 6.2306, "mean_token_accuracy": 0.1218092642724514, "num_tokens": 1816767.0, "step": 985 }, { "entropy": 6.220181655883789, "epoch": 0.055395462048513, "grad_norm": 1.15625, "learning_rate": 0.0004945, "loss": 6.2397, "mean_token_accuracy": 0.12567930296063423, "num_tokens": 1826012.0, "step": 990 }, { "entropy": 6.257971334457397, "epoch": 0.05567523710936407, "grad_norm": 1.0234375, "learning_rate": 0.000497, "loss": 6.2, "mean_token_accuracy": 0.12385892570018768, "num_tokens": 1835355.0, "step": 995 }, { "entropy": 6.210480213165283, "epoch": 0.055955012170215146, "grad_norm": 1.078125, "learning_rate": 0.0004995, "loss": 6.1559, "mean_token_accuracy": 0.13025842383503913, "num_tokens": 1844998.0, "step": 1000 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 2700869584896000.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }