{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.027977506085107573, "eval_steps": 500, "global_step": 500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.691505527496338, "epoch": 0.0002797750608510757, "grad_norm": 12.375, "learning_rate": 2e-06, "loss": 10.7862, "mean_token_accuracy": 0.0, "num_tokens": 9833.0, "step": 5 }, { "entropy": 10.691538619995118, "epoch": 0.0005595501217021514, "grad_norm": 13.0, "learning_rate": 4.5e-06, "loss": 10.7246, "mean_token_accuracy": 0.0, "num_tokens": 19666.0, "step": 10 }, { "entropy": 10.691145992279052, "epoch": 0.0008393251825532272, "grad_norm": 9.3125, "learning_rate": 7e-06, "loss": 10.4747, "mean_token_accuracy": 0.019643833697773515, "num_tokens": 28771.0, "step": 15 }, { "entropy": 10.682477760314942, "epoch": 0.0011191002434043028, "grad_norm": 6.21875, "learning_rate": 9.5e-06, "loss": 10.1639, "mean_token_accuracy": 0.04193656481802464, "num_tokens": 38625.0, "step": 20 }, { "entropy": 10.617809772491455, "epoch": 0.0013988753042553786, "grad_norm": 4.09375, "learning_rate": 1.2e-05, "loss": 9.8606, "mean_token_accuracy": 0.04725950676947832, "num_tokens": 47864.0, "step": 25 }, { "entropy": 10.55274839401245, "epoch": 0.0016786503651064545, "grad_norm": 3.421875, "learning_rate": 1.4500000000000002e-05, "loss": 9.6963, "mean_token_accuracy": 0.04289307370781899, "num_tokens": 55926.0, "step": 30 }, { "entropy": 10.584246730804443, "epoch": 0.0019584254259575303, "grad_norm": 3.078125, "learning_rate": 1.7000000000000003e-05, "loss": 9.6414, "mean_token_accuracy": 0.044558577984571454, "num_tokens": 64915.0, "step": 35 }, { "entropy": 10.56161117553711, "epoch": 0.0022382004868086057, "grad_norm": 2.65625, "learning_rate": 1.95e-05, "loss": 9.6116, "mean_token_accuracy": 0.041977206617593764, "num_tokens": 73813.0, "step": 40 }, { "entropy": 10.549141788482666, "epoch": 0.0025179755476596815, "grad_norm": 2.421875, "learning_rate": 2.2e-05, "loss": 9.5772, "mean_token_accuracy": 0.04488353617489338, "num_tokens": 83706.0, "step": 45 }, { "entropy": 10.555339050292968, "epoch": 0.0027977506085107573, "grad_norm": 2.53125, "learning_rate": 2.4500000000000003e-05, "loss": 9.5206, "mean_token_accuracy": 0.041607250832021235, "num_tokens": 92739.0, "step": 50 }, { "entropy": 10.562696361541748, "epoch": 0.003077525669361833, "grad_norm": 2.65625, "learning_rate": 2.7e-05, "loss": 9.4731, "mean_token_accuracy": 0.04852877669036389, "num_tokens": 101880.0, "step": 55 }, { "entropy": 10.513782119750976, "epoch": 0.003357300730212909, "grad_norm": 2.59375, "learning_rate": 2.95e-05, "loss": 9.4135, "mean_token_accuracy": 0.05527102164924145, "num_tokens": 111303.0, "step": 60 }, { "entropy": 10.410881614685058, "epoch": 0.0036370757910639847, "grad_norm": 2.578125, "learning_rate": 3.2e-05, "loss": 9.2608, "mean_token_accuracy": 0.059278345108032225, "num_tokens": 121022.0, "step": 65 }, { "entropy": 10.35908842086792, "epoch": 0.0039168508519150606, "grad_norm": 2.3125, "learning_rate": 3.4500000000000005e-05, "loss": 9.1931, "mean_token_accuracy": 0.05288665182888508, "num_tokens": 129764.0, "step": 70 }, { "entropy": 10.414530277252197, "epoch": 0.004196625912766136, "grad_norm": 2.671875, "learning_rate": 3.7e-05, "loss": 9.12, "mean_token_accuracy": 0.05712716057896614, "num_tokens": 139543.0, "step": 75 }, { "entropy": 10.420390224456787, "epoch": 0.004476400973617211, "grad_norm": 2.453125, "learning_rate": 3.95e-05, "loss": 9.0894, "mean_token_accuracy": 0.055438223481178286, "num_tokens": 148772.0, "step": 80 }, { "entropy": 10.439853763580322, "epoch": 0.004756176034468288, "grad_norm": 2.53125, "learning_rate": 4.2000000000000004e-05, "loss": 8.8746, "mean_token_accuracy": 0.06480722092092037, "num_tokens": 158786.0, "step": 85 }, { "entropy": 10.333017063140868, "epoch": 0.005035951095319363, "grad_norm": 2.46875, "learning_rate": 4.45e-05, "loss": 8.7978, "mean_token_accuracy": 0.06817127540707588, "num_tokens": 166989.0, "step": 90 }, { "entropy": 10.257375049591065, "epoch": 0.005315726156170439, "grad_norm": 2.421875, "learning_rate": 4.7000000000000004e-05, "loss": 8.6945, "mean_token_accuracy": 0.06792460419237614, "num_tokens": 175840.0, "step": 95 }, { "entropy": 10.24816074371338, "epoch": 0.005595501217021515, "grad_norm": 2.484375, "learning_rate": 4.9500000000000004e-05, "loss": 8.6247, "mean_token_accuracy": 0.06662830822169781, "num_tokens": 185375.0, "step": 100 }, { "entropy": 10.16532497406006, "epoch": 0.005875276277872591, "grad_norm": 2.125, "learning_rate": 5.2e-05, "loss": 8.5206, "mean_token_accuracy": 0.07044463530182839, "num_tokens": 194647.0, "step": 105 }, { "entropy": 10.170048713684082, "epoch": 0.006155051338723666, "grad_norm": 2.421875, "learning_rate": 5.45e-05, "loss": 8.4143, "mean_token_accuracy": 0.07247264273464679, "num_tokens": 203882.0, "step": 110 }, { "entropy": 10.117275524139405, "epoch": 0.006434826399574742, "grad_norm": 2.796875, "learning_rate": 5.7e-05, "loss": 8.2929, "mean_token_accuracy": 0.06882111690938472, "num_tokens": 212641.0, "step": 115 }, { "entropy": 10.047082424163818, "epoch": 0.006714601460425818, "grad_norm": 2.125, "learning_rate": 5.9499999999999996e-05, "loss": 8.1784, "mean_token_accuracy": 0.07864802330732346, "num_tokens": 221668.0, "step": 120 }, { "entropy": 9.896892261505126, "epoch": 0.006994376521276893, "grad_norm": 2.390625, "learning_rate": 6.2e-05, "loss": 8.0655, "mean_token_accuracy": 0.07759866937994957, "num_tokens": 230277.0, "step": 125 }, { "entropy": 9.822550010681152, "epoch": 0.0072741515821279695, "grad_norm": 1.8125, "learning_rate": 6.450000000000001e-05, "loss": 7.9853, "mean_token_accuracy": 0.07847488112747669, "num_tokens": 240191.0, "step": 130 }, { "entropy": 9.653499507904053, "epoch": 0.007553926642979045, "grad_norm": 2.40625, "learning_rate": 6.7e-05, "loss": 7.8597, "mean_token_accuracy": 0.08022317960858345, "num_tokens": 249600.0, "step": 135 }, { "entropy": 9.487109375, "epoch": 0.007833701703830121, "grad_norm": 1.96875, "learning_rate": 6.950000000000001e-05, "loss": 7.7858, "mean_token_accuracy": 0.07919244170188904, "num_tokens": 258766.0, "step": 140 }, { "entropy": 9.301309394836426, "epoch": 0.008113476764681197, "grad_norm": 1.84375, "learning_rate": 7.2e-05, "loss": 7.5919, "mean_token_accuracy": 0.08380925506353379, "num_tokens": 268399.0, "step": 145 }, { "entropy": 9.010336112976074, "epoch": 0.008393251825532272, "grad_norm": 1.3359375, "learning_rate": 7.45e-05, "loss": 7.5475, "mean_token_accuracy": 0.08445582017302514, "num_tokens": 278348.0, "step": 150 }, { "entropy": 8.899579620361328, "epoch": 0.008673026886383347, "grad_norm": 1.7265625, "learning_rate": 7.7e-05, "loss": 7.5228, "mean_token_accuracy": 0.07803246155381202, "num_tokens": 288429.0, "step": 155 }, { "entropy": 8.617181396484375, "epoch": 0.008952801947234423, "grad_norm": 1.5078125, "learning_rate": 7.950000000000001e-05, "loss": 7.319, "mean_token_accuracy": 0.09034765139222145, "num_tokens": 297936.0, "step": 160 }, { "entropy": 8.410243892669678, "epoch": 0.0092325770080855, "grad_norm": 1.6640625, "learning_rate": 8.2e-05, "loss": 7.3897, "mean_token_accuracy": 0.08498694151639938, "num_tokens": 307390.0, "step": 165 }, { "entropy": 8.320203971862792, "epoch": 0.009512352068936575, "grad_norm": 1.4375, "learning_rate": 8.450000000000001e-05, "loss": 7.3416, "mean_token_accuracy": 0.07727829068899154, "num_tokens": 316381.0, "step": 170 }, { "entropy": 8.236638164520263, "epoch": 0.00979212712978765, "grad_norm": 1.96875, "learning_rate": 8.7e-05, "loss": 7.3116, "mean_token_accuracy": 0.07726738080382348, "num_tokens": 325086.0, "step": 175 }, { "entropy": 8.076795291900634, "epoch": 0.010071902190638726, "grad_norm": 1.5546875, "learning_rate": 8.95e-05, "loss": 7.1784, "mean_token_accuracy": 0.08438889384269714, "num_tokens": 334438.0, "step": 180 }, { "entropy": 7.889586877822876, "epoch": 0.010351677251489803, "grad_norm": 1.3515625, "learning_rate": 9.2e-05, "loss": 7.1976, "mean_token_accuracy": 0.0870728187263012, "num_tokens": 343169.0, "step": 185 }, { "entropy": 7.912118721008301, "epoch": 0.010631452312340878, "grad_norm": 1.734375, "learning_rate": 9.45e-05, "loss": 7.126, "mean_token_accuracy": 0.08688639178872108, "num_tokens": 352260.0, "step": 190 }, { "entropy": 7.820125246047974, "epoch": 0.010911227373191954, "grad_norm": 1.6796875, "learning_rate": 9.7e-05, "loss": 7.0827, "mean_token_accuracy": 0.08836827799677849, "num_tokens": 361436.0, "step": 195 }, { "entropy": 7.675041007995605, "epoch": 0.01119100243404303, "grad_norm": 1.3515625, "learning_rate": 9.95e-05, "loss": 7.1613, "mean_token_accuracy": 0.09058133289217948, "num_tokens": 370232.0, "step": 200 }, { "entropy": 7.803629922866821, "epoch": 0.011470777494894105, "grad_norm": 1.5234375, "learning_rate": 0.000102, "loss": 7.1257, "mean_token_accuracy": 0.0905453845858574, "num_tokens": 380211.0, "step": 205 }, { "entropy": 7.76220006942749, "epoch": 0.011750552555745182, "grad_norm": 1.390625, "learning_rate": 0.00010449999999999999, "loss": 7.1154, "mean_token_accuracy": 0.08261686339974403, "num_tokens": 390089.0, "step": 210 }, { "entropy": 7.6790376663208, "epoch": 0.012030327616596257, "grad_norm": 1.734375, "learning_rate": 0.000107, "loss": 7.0364, "mean_token_accuracy": 0.08655178025364876, "num_tokens": 398513.0, "step": 215 }, { "entropy": 7.6753379821777346, "epoch": 0.012310102677447332, "grad_norm": 1.484375, "learning_rate": 0.0001095, "loss": 7.1785, "mean_token_accuracy": 0.08271857276558876, "num_tokens": 408114.0, "step": 220 }, { "entropy": 7.658677101135254, "epoch": 0.012589877738298408, "grad_norm": 1.4296875, "learning_rate": 0.000112, "loss": 7.0324, "mean_token_accuracy": 0.08730659186840058, "num_tokens": 417680.0, "step": 225 }, { "entropy": 7.590711975097657, "epoch": 0.012869652799149483, "grad_norm": 1.2421875, "learning_rate": 0.0001145, "loss": 6.94, "mean_token_accuracy": 0.0981583096086979, "num_tokens": 426056.0, "step": 230 }, { "entropy": 7.538638401031494, "epoch": 0.01314942786000056, "grad_norm": 1.4296875, "learning_rate": 0.00011700000000000001, "loss": 6.8994, "mean_token_accuracy": 0.09497818350791931, "num_tokens": 435465.0, "step": 235 }, { "entropy": 7.547599267959595, "epoch": 0.013429202920851636, "grad_norm": 1.25, "learning_rate": 0.00011949999999999999, "loss": 6.9882, "mean_token_accuracy": 0.09514376819133759, "num_tokens": 444295.0, "step": 240 }, { "entropy": 7.532002258300781, "epoch": 0.013708977981702711, "grad_norm": 1.28125, "learning_rate": 0.000122, "loss": 6.9084, "mean_token_accuracy": 0.09089445620775223, "num_tokens": 453111.0, "step": 245 }, { "entropy": 7.416005039215088, "epoch": 0.013988753042553786, "grad_norm": 1.28125, "learning_rate": 0.0001245, "loss": 6.8671, "mean_token_accuracy": 0.09376973509788514, "num_tokens": 462438.0, "step": 250 }, { "entropy": 7.44201397895813, "epoch": 0.014268528103404862, "grad_norm": 1.5234375, "learning_rate": 0.000127, "loss": 6.8518, "mean_token_accuracy": 0.0919196330010891, "num_tokens": 471610.0, "step": 255 }, { "entropy": 7.486415004730224, "epoch": 0.014548303164255939, "grad_norm": 1.4140625, "learning_rate": 0.0001295, "loss": 6.9342, "mean_token_accuracy": 0.09321872368454934, "num_tokens": 480849.0, "step": 260 }, { "entropy": 7.40749454498291, "epoch": 0.014828078225107014, "grad_norm": 1.34375, "learning_rate": 0.000132, "loss": 6.9376, "mean_token_accuracy": 0.08951603546738625, "num_tokens": 489756.0, "step": 265 }, { "entropy": 7.461516523361206, "epoch": 0.01510785328595809, "grad_norm": 1.734375, "learning_rate": 0.00013450000000000002, "loss": 6.9217, "mean_token_accuracy": 0.09437951892614364, "num_tokens": 498818.0, "step": 270 }, { "entropy": 7.285744953155517, "epoch": 0.015387628346809165, "grad_norm": 1.25, "learning_rate": 0.00013700000000000002, "loss": 6.8458, "mean_token_accuracy": 0.09555465653538704, "num_tokens": 508508.0, "step": 275 }, { "entropy": 7.444489002227783, "epoch": 0.015667403407660242, "grad_norm": 1.5078125, "learning_rate": 0.0001395, "loss": 7.0025, "mean_token_accuracy": 0.09034469872713088, "num_tokens": 518257.0, "step": 280 }, { "entropy": 7.36638994216919, "epoch": 0.015947178468511316, "grad_norm": 1.328125, "learning_rate": 0.00014199999999999998, "loss": 6.9625, "mean_token_accuracy": 0.08916445821523666, "num_tokens": 527811.0, "step": 285 }, { "entropy": 7.358241605758667, "epoch": 0.016226953529362393, "grad_norm": 1.3671875, "learning_rate": 0.0001445, "loss": 6.8297, "mean_token_accuracy": 0.09337828531861306, "num_tokens": 536991.0, "step": 290 }, { "entropy": 7.320535326004029, "epoch": 0.016506728590213467, "grad_norm": 1.1484375, "learning_rate": 0.000147, "loss": 6.9245, "mean_token_accuracy": 0.0914350025355816, "num_tokens": 546498.0, "step": 295 }, { "entropy": 7.351836109161377, "epoch": 0.016786503651064544, "grad_norm": 1.2109375, "learning_rate": 0.0001495, "loss": 6.8809, "mean_token_accuracy": 0.09436944723129273, "num_tokens": 556022.0, "step": 300 }, { "entropy": 7.289101552963257, "epoch": 0.01706627871191562, "grad_norm": 1.40625, "learning_rate": 0.000152, "loss": 6.8212, "mean_token_accuracy": 0.09640712589025498, "num_tokens": 565392.0, "step": 305 }, { "entropy": 7.230247545242309, "epoch": 0.017346053772766695, "grad_norm": 1.46875, "learning_rate": 0.00015450000000000001, "loss": 6.8043, "mean_token_accuracy": 0.09431554824113846, "num_tokens": 574485.0, "step": 310 }, { "entropy": 7.3728536605834964, "epoch": 0.01762582883361777, "grad_norm": 1.375, "learning_rate": 0.000157, "loss": 6.8343, "mean_token_accuracy": 0.09452549517154693, "num_tokens": 583149.0, "step": 315 }, { "entropy": 7.280808210372925, "epoch": 0.017905603894468845, "grad_norm": 1.5234375, "learning_rate": 0.0001595, "loss": 6.8855, "mean_token_accuracy": 0.09358676373958588, "num_tokens": 592876.0, "step": 320 }, { "entropy": 7.064757013320923, "epoch": 0.018185378955319922, "grad_norm": 1.3203125, "learning_rate": 0.000162, "loss": 6.6685, "mean_token_accuracy": 0.09988230094313622, "num_tokens": 602001.0, "step": 325 }, { "entropy": 7.323857975006104, "epoch": 0.018465154016171, "grad_norm": 1.484375, "learning_rate": 0.00016450000000000001, "loss": 6.8667, "mean_token_accuracy": 0.09093789532780647, "num_tokens": 611602.0, "step": 330 }, { "entropy": 7.089147615432739, "epoch": 0.018744929077022073, "grad_norm": 1.34375, "learning_rate": 0.00016700000000000002, "loss": 6.7506, "mean_token_accuracy": 0.09642454162240029, "num_tokens": 620905.0, "step": 335 }, { "entropy": 7.273478889465332, "epoch": 0.01902470413787315, "grad_norm": 1.203125, "learning_rate": 0.00016950000000000003, "loss": 6.8279, "mean_token_accuracy": 0.0952286258339882, "num_tokens": 630151.0, "step": 340 }, { "entropy": 7.070547962188721, "epoch": 0.019304479198724227, "grad_norm": 1.1796875, "learning_rate": 0.00017199999999999998, "loss": 6.7905, "mean_token_accuracy": 0.09692409187555313, "num_tokens": 639864.0, "step": 345 }, { "entropy": 7.4187744140625, "epoch": 0.0195842542595753, "grad_norm": 1.3515625, "learning_rate": 0.00017449999999999999, "loss": 6.8707, "mean_token_accuracy": 0.09315617531538009, "num_tokens": 648819.0, "step": 350 }, { "entropy": 7.169836378097534, "epoch": 0.019864029320426378, "grad_norm": 1.4140625, "learning_rate": 0.000177, "loss": 6.8027, "mean_token_accuracy": 0.09456639736890793, "num_tokens": 658438.0, "step": 355 }, { "entropy": 7.143348264694214, "epoch": 0.020143804381277452, "grad_norm": 1.2109375, "learning_rate": 0.0001795, "loss": 6.7459, "mean_token_accuracy": 0.09843514785170555, "num_tokens": 668140.0, "step": 360 }, { "entropy": 7.207337665557861, "epoch": 0.02042357944212853, "grad_norm": 1.3203125, "learning_rate": 0.000182, "loss": 6.7733, "mean_token_accuracy": 0.09692016914486885, "num_tokens": 677505.0, "step": 365 }, { "entropy": 7.047050952911377, "epoch": 0.020703354502979606, "grad_norm": 1.0703125, "learning_rate": 0.0001845, "loss": 6.7596, "mean_token_accuracy": 0.09099765941500663, "num_tokens": 687911.0, "step": 370 }, { "entropy": 7.110365295410157, "epoch": 0.02098312956383068, "grad_norm": 1.40625, "learning_rate": 0.000187, "loss": 6.7002, "mean_token_accuracy": 0.10557077825069427, "num_tokens": 696565.0, "step": 375 }, { "entropy": 7.068933725357056, "epoch": 0.021262904624681757, "grad_norm": 1.2265625, "learning_rate": 0.0001895, "loss": 6.6321, "mean_token_accuracy": 0.09727629125118256, "num_tokens": 704918.0, "step": 380 }, { "entropy": 7.053268480300903, "epoch": 0.02154267968553283, "grad_norm": 1.28125, "learning_rate": 0.000192, "loss": 6.6612, "mean_token_accuracy": 0.1000488631427288, "num_tokens": 716172.0, "step": 385 }, { "entropy": 7.058245515823364, "epoch": 0.021822454746383908, "grad_norm": 1.46875, "learning_rate": 0.0001945, "loss": 6.6344, "mean_token_accuracy": 0.10481962487101555, "num_tokens": 725075.0, "step": 390 }, { "entropy": 7.085121202468872, "epoch": 0.022102229807234985, "grad_norm": 1.4765625, "learning_rate": 0.00019700000000000002, "loss": 6.7861, "mean_token_accuracy": 0.09666902050375939, "num_tokens": 733314.0, "step": 395 }, { "entropy": 7.137383270263672, "epoch": 0.02238200486808606, "grad_norm": 1.359375, "learning_rate": 0.00019950000000000002, "loss": 6.6717, "mean_token_accuracy": 0.10260491818189621, "num_tokens": 742390.0, "step": 400 }, { "entropy": 6.997572708129883, "epoch": 0.022661779928937135, "grad_norm": 1.2265625, "learning_rate": 0.000202, "loss": 6.7582, "mean_token_accuracy": 0.09590908735990525, "num_tokens": 751464.0, "step": 405 }, { "entropy": 7.058079195022583, "epoch": 0.02294155498978821, "grad_norm": 1.234375, "learning_rate": 0.00020449999999999998, "loss": 6.6488, "mean_token_accuracy": 0.10047566667199134, "num_tokens": 760746.0, "step": 410 }, { "entropy": 6.995281791687011, "epoch": 0.023221330050639286, "grad_norm": 1.25, "learning_rate": 0.000207, "loss": 6.5617, "mean_token_accuracy": 0.10464712381362914, "num_tokens": 769052.0, "step": 415 }, { "entropy": 6.989618110656738, "epoch": 0.023501105111490363, "grad_norm": 1.2265625, "learning_rate": 0.0002095, "loss": 6.7826, "mean_token_accuracy": 0.09742124751210213, "num_tokens": 778660.0, "step": 420 }, { "entropy": 7.074799585342407, "epoch": 0.023780880172341437, "grad_norm": 1.296875, "learning_rate": 0.000212, "loss": 6.6877, "mean_token_accuracy": 0.10435819402337074, "num_tokens": 787841.0, "step": 425 }, { "entropy": 6.878971099853516, "epoch": 0.024060655233192514, "grad_norm": 1.328125, "learning_rate": 0.0002145, "loss": 6.537, "mean_token_accuracy": 0.10397473350167274, "num_tokens": 796175.0, "step": 430 }, { "entropy": 6.980287361145019, "epoch": 0.024340430294043588, "grad_norm": 1.234375, "learning_rate": 0.00021700000000000002, "loss": 6.5959, "mean_token_accuracy": 0.10773405581712722, "num_tokens": 805941.0, "step": 435 }, { "entropy": 6.9006028175354, "epoch": 0.024620205354894665, "grad_norm": 1.1953125, "learning_rate": 0.0002195, "loss": 6.6389, "mean_token_accuracy": 0.09920870438218117, "num_tokens": 815058.0, "step": 440 }, { "entropy": 7.100294494628907, "epoch": 0.024899980415745742, "grad_norm": 1.2578125, "learning_rate": 0.000222, "loss": 6.6593, "mean_token_accuracy": 0.10117991864681244, "num_tokens": 824459.0, "step": 445 }, { "entropy": 6.872482252120972, "epoch": 0.025179755476596816, "grad_norm": 1.0859375, "learning_rate": 0.0002245, "loss": 6.656, "mean_token_accuracy": 0.10260392725467682, "num_tokens": 835250.0, "step": 450 }, { "entropy": 6.986909580230713, "epoch": 0.025459530537447893, "grad_norm": 1.03125, "learning_rate": 0.00022700000000000002, "loss": 6.6617, "mean_token_accuracy": 0.10458940342068672, "num_tokens": 844643.0, "step": 455 }, { "entropy": 6.96947169303894, "epoch": 0.025739305598298966, "grad_norm": 1.21875, "learning_rate": 0.00022950000000000002, "loss": 6.5977, "mean_token_accuracy": 0.10226123109459877, "num_tokens": 853375.0, "step": 460 }, { "entropy": 6.875414848327637, "epoch": 0.026019080659150044, "grad_norm": 1.1640625, "learning_rate": 0.00023200000000000003, "loss": 6.5253, "mean_token_accuracy": 0.11177821755409241, "num_tokens": 862244.0, "step": 465 }, { "entropy": 6.945923662185669, "epoch": 0.02629885572000112, "grad_norm": 1.34375, "learning_rate": 0.00023449999999999998, "loss": 6.6286, "mean_token_accuracy": 0.09996586814522743, "num_tokens": 871828.0, "step": 470 }, { "entropy": 6.8525604724884035, "epoch": 0.026578630780852194, "grad_norm": 1.3125, "learning_rate": 0.000237, "loss": 6.6076, "mean_token_accuracy": 0.10374173521995544, "num_tokens": 881087.0, "step": 475 }, { "entropy": 6.889187860488891, "epoch": 0.02685840584170327, "grad_norm": 1.234375, "learning_rate": 0.0002395, "loss": 6.6779, "mean_token_accuracy": 0.10589562878012657, "num_tokens": 890061.0, "step": 480 }, { "entropy": 7.009466075897217, "epoch": 0.027138180902554345, "grad_norm": 1.1328125, "learning_rate": 0.000242, "loss": 6.6192, "mean_token_accuracy": 0.10268636345863343, "num_tokens": 899388.0, "step": 485 }, { "entropy": 6.763098287582397, "epoch": 0.027417955963405422, "grad_norm": 1.3203125, "learning_rate": 0.0002445, "loss": 6.5255, "mean_token_accuracy": 0.10589060559868813, "num_tokens": 908295.0, "step": 490 }, { "entropy": 6.7688929557800295, "epoch": 0.0276977310242565, "grad_norm": 1.21875, "learning_rate": 0.000247, "loss": 6.4924, "mean_token_accuracy": 0.10882084742188454, "num_tokens": 917514.0, "step": 495 }, { "entropy": 6.904528284072876, "epoch": 0.027977506085107573, "grad_norm": 1.1328125, "learning_rate": 0.0002495, "loss": 6.5978, "mean_token_accuracy": 0.10768755748867989, "num_tokens": 927146.0, "step": 500 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1367316707328000.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }