{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.0653893938403191, "eval_steps": 500, "global_step": 1000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.691958713531495, "epoch": 0.0003269469692015955, "grad_norm": 11.125, "learning_rate": 2e-06, "loss": 10.8332, "mean_token_accuracy": 0.0, "num_tokens": 9940.0, "step": 5 }, { "entropy": 10.691952419281005, "epoch": 0.000653893938403191, "grad_norm": 11.125, "learning_rate": 4.5e-06, "loss": 10.7742, "mean_token_accuracy": 0.0001418439671397209, "num_tokens": 19783.0, "step": 10 }, { "entropy": 10.6908465385437, "epoch": 0.0009808409076047864, "grad_norm": 8.9375, "learning_rate": 7e-06, "loss": 10.5776, "mean_token_accuracy": 0.023957793507725, "num_tokens": 30189.0, "step": 15 }, { "entropy": 10.673107433319093, "epoch": 0.001307787876806382, "grad_norm": 5.5, "learning_rate": 9.5e-06, "loss": 10.3372, "mean_token_accuracy": 0.036642605997622014, "num_tokens": 40463.0, "step": 20 }, { "entropy": 10.544582939147949, "epoch": 0.0016347348460079775, "grad_norm": 3.90625, "learning_rate": 1.2e-05, "loss": 10.1584, "mean_token_accuracy": 0.03861969262361527, "num_tokens": 50919.0, "step": 25 }, { "entropy": 10.540802764892579, "epoch": 0.001961681815209573, "grad_norm": 3.078125, "learning_rate": 1.4500000000000002e-05, "loss": 10.0293, "mean_token_accuracy": 0.043454410135746004, "num_tokens": 61272.0, "step": 30 }, { "entropy": 10.524931526184082, "epoch": 0.0022886287844111684, "grad_norm": 2.796875, "learning_rate": 1.7000000000000003e-05, "loss": 9.989, "mean_token_accuracy": 0.040898256562650205, "num_tokens": 70877.0, "step": 35 }, { "entropy": 10.534891700744629, "epoch": 0.002615575753612764, "grad_norm": 2.625, "learning_rate": 1.95e-05, "loss": 9.9194, "mean_token_accuracy": 0.04178280588239432, "num_tokens": 80600.0, "step": 40 }, { "entropy": 10.505007362365722, "epoch": 0.0029425227228143595, "grad_norm": 2.171875, "learning_rate": 2.2e-05, "loss": 9.9154, "mean_token_accuracy": 0.042212999984622, "num_tokens": 91002.0, "step": 45 }, { "entropy": 10.510712146759033, "epoch": 0.003269469692015955, "grad_norm": 2.203125, "learning_rate": 2.4500000000000003e-05, "loss": 9.8381, "mean_token_accuracy": 0.04490188360214233, "num_tokens": 101156.0, "step": 50 }, { "entropy": 10.485781574249268, "epoch": 0.0035964166612175506, "grad_norm": 2.1875, "learning_rate": 2.7e-05, "loss": 9.7976, "mean_token_accuracy": 0.053155021369457246, "num_tokens": 111896.0, "step": 55 }, { "entropy": 10.422010612487792, "epoch": 0.003923363630419146, "grad_norm": 2.234375, "learning_rate": 2.95e-05, "loss": 9.6372, "mean_token_accuracy": 0.06276935711503029, "num_tokens": 120899.0, "step": 60 }, { "entropy": 10.29280891418457, "epoch": 0.004250310599620741, "grad_norm": 1.875, "learning_rate": 3.2e-05, "loss": 9.694, "mean_token_accuracy": 0.05080278925597668, "num_tokens": 131504.0, "step": 65 }, { "entropy": 10.418154048919678, "epoch": 0.004577257568822337, "grad_norm": 2.0625, "learning_rate": 3.4500000000000005e-05, "loss": 9.5967, "mean_token_accuracy": 0.0578270398080349, "num_tokens": 142365.0, "step": 70 }, { "entropy": 10.359278392791747, "epoch": 0.004904204538023932, "grad_norm": 1.6875, "learning_rate": 3.7e-05, "loss": 9.5648, "mean_token_accuracy": 0.05457159243524075, "num_tokens": 153481.0, "step": 75 }, { "entropy": 10.342585277557372, "epoch": 0.005231151507225528, "grad_norm": 1.7421875, "learning_rate": 3.95e-05, "loss": 9.4747, "mean_token_accuracy": 0.056017789617180826, "num_tokens": 163941.0, "step": 80 }, { "entropy": 10.287201023101806, "epoch": 0.0055580984764271235, "grad_norm": 1.65625, "learning_rate": 4.2000000000000004e-05, "loss": 9.3941, "mean_token_accuracy": 0.057008447125554085, "num_tokens": 173992.0, "step": 85 }, { "entropy": 10.303301525115966, "epoch": 0.005885045445628719, "grad_norm": 1.6484375, "learning_rate": 4.45e-05, "loss": 9.3741, "mean_token_accuracy": 0.05458107776939869, "num_tokens": 184474.0, "step": 90 }, { "entropy": 10.273002815246581, "epoch": 0.006211992414830315, "grad_norm": 1.4296875, "learning_rate": 4.7000000000000004e-05, "loss": 9.2908, "mean_token_accuracy": 0.055625283345580104, "num_tokens": 194998.0, "step": 95 }, { "entropy": 10.184755516052245, "epoch": 0.00653893938403191, "grad_norm": 1.6875, "learning_rate": 4.9500000000000004e-05, "loss": 9.1048, "mean_token_accuracy": 0.06638492792844772, "num_tokens": 203327.0, "step": 100 }, { "entropy": 10.124643421173095, "epoch": 0.006865886353233506, "grad_norm": 1.40625, "learning_rate": 5.2e-05, "loss": 9.0818, "mean_token_accuracy": 0.056092340126633645, "num_tokens": 213921.0, "step": 105 }, { "entropy": 10.116442012786866, "epoch": 0.007192833322435101, "grad_norm": 1.4296875, "learning_rate": 5.45e-05, "loss": 9.0058, "mean_token_accuracy": 0.06091702468693257, "num_tokens": 225790.0, "step": 110 }, { "entropy": 10.03341302871704, "epoch": 0.007519780291636697, "grad_norm": 1.484375, "learning_rate": 5.7e-05, "loss": 8.8789, "mean_token_accuracy": 0.057968761026859286, "num_tokens": 235689.0, "step": 115 }, { "entropy": 9.888718128204346, "epoch": 0.007846727260838291, "grad_norm": 1.2265625, "learning_rate": 5.9499999999999996e-05, "loss": 8.81, "mean_token_accuracy": 0.05678555406630039, "num_tokens": 246525.0, "step": 120 }, { "entropy": 9.8173038482666, "epoch": 0.008173674230039887, "grad_norm": 1.34375, "learning_rate": 6.2e-05, "loss": 8.7335, "mean_token_accuracy": 0.05988549403846264, "num_tokens": 256642.0, "step": 125 }, { "entropy": 9.75066261291504, "epoch": 0.008500621199241483, "grad_norm": 1.25, "learning_rate": 6.450000000000001e-05, "loss": 8.702, "mean_token_accuracy": 0.05682391189038753, "num_tokens": 268145.0, "step": 130 }, { "entropy": 9.635010147094727, "epoch": 0.008827568168443078, "grad_norm": 1.0703125, "learning_rate": 6.7e-05, "loss": 8.6022, "mean_token_accuracy": 0.06169581487774849, "num_tokens": 279783.0, "step": 135 }, { "entropy": 9.380872344970703, "epoch": 0.009154515137644674, "grad_norm": 1.453125, "learning_rate": 6.950000000000001e-05, "loss": 8.4967, "mean_token_accuracy": 0.059948813170194626, "num_tokens": 289723.0, "step": 140 }, { "entropy": 9.371010780334473, "epoch": 0.00948146210684627, "grad_norm": 1.359375, "learning_rate": 7.2e-05, "loss": 8.415, "mean_token_accuracy": 0.06255604662001132, "num_tokens": 300002.0, "step": 145 }, { "entropy": 9.191289615631103, "epoch": 0.009808409076047865, "grad_norm": 1.21875, "learning_rate": 7.45e-05, "loss": 8.4676, "mean_token_accuracy": 0.0592008963227272, "num_tokens": 310041.0, "step": 150 }, { "entropy": 9.172502422332764, "epoch": 0.01013535604524946, "grad_norm": 1.078125, "learning_rate": 7.7e-05, "loss": 8.3962, "mean_token_accuracy": 0.0683298297226429, "num_tokens": 321469.0, "step": 155 }, { "entropy": 9.02190465927124, "epoch": 0.010462303014451056, "grad_norm": 1.1875, "learning_rate": 7.950000000000001e-05, "loss": 8.3063, "mean_token_accuracy": 0.07015354111790657, "num_tokens": 330796.0, "step": 160 }, { "entropy": 8.985146427154541, "epoch": 0.010789249983652651, "grad_norm": 1.4296875, "learning_rate": 8.2e-05, "loss": 8.3555, "mean_token_accuracy": 0.065846299380064, "num_tokens": 341402.0, "step": 165 }, { "entropy": 8.864819717407226, "epoch": 0.011116196952854247, "grad_norm": 1.3125, "learning_rate": 8.450000000000001e-05, "loss": 8.394, "mean_token_accuracy": 0.06491452008485794, "num_tokens": 351717.0, "step": 170 }, { "entropy": 8.891894435882568, "epoch": 0.011443143922055843, "grad_norm": 1.1875, "learning_rate": 8.7e-05, "loss": 8.3088, "mean_token_accuracy": 0.062341967970132826, "num_tokens": 361787.0, "step": 175 }, { "entropy": 8.835786247253418, "epoch": 0.011770090891257438, "grad_norm": 1.2265625, "learning_rate": 8.95e-05, "loss": 8.2624, "mean_token_accuracy": 0.06518663801252841, "num_tokens": 371827.0, "step": 180 }, { "entropy": 8.719056224822998, "epoch": 0.012097037860459034, "grad_norm": 1.203125, "learning_rate": 9.2e-05, "loss": 8.2741, "mean_token_accuracy": 0.06445901691913605, "num_tokens": 382150.0, "step": 185 }, { "entropy": 8.604046440124511, "epoch": 0.01242398482966063, "grad_norm": 1.3515625, "learning_rate": 9.45e-05, "loss": 8.2087, "mean_token_accuracy": 0.06914092674851417, "num_tokens": 392151.0, "step": 190 }, { "entropy": 8.6498384475708, "epoch": 0.012750931798862225, "grad_norm": 1.140625, "learning_rate": 9.7e-05, "loss": 8.2286, "mean_token_accuracy": 0.06609960272908211, "num_tokens": 402779.0, "step": 195 }, { "entropy": 8.605819988250733, "epoch": 0.01307787876806382, "grad_norm": 1.234375, "learning_rate": 9.95e-05, "loss": 8.2307, "mean_token_accuracy": 0.07222314588725567, "num_tokens": 413500.0, "step": 200 }, { "entropy": 8.616723346710206, "epoch": 0.013404825737265416, "grad_norm": 1.0625, "learning_rate": 0.000102, "loss": 8.1735, "mean_token_accuracy": 0.06858775578439236, "num_tokens": 423054.0, "step": 205 }, { "entropy": 8.610979270935058, "epoch": 0.013731772706467011, "grad_norm": 1.1015625, "learning_rate": 0.00010449999999999999, "loss": 8.2071, "mean_token_accuracy": 0.06590324304997922, "num_tokens": 433002.0, "step": 210 }, { "entropy": 8.533074569702148, "epoch": 0.014058719675668607, "grad_norm": 1.0, "learning_rate": 0.000107, "loss": 8.1663, "mean_token_accuracy": 0.07016990669071674, "num_tokens": 443492.0, "step": 215 }, { "entropy": 8.550239372253419, "epoch": 0.014385666644870202, "grad_norm": 1.1640625, "learning_rate": 0.0001095, "loss": 8.2172, "mean_token_accuracy": 0.06546101979911327, "num_tokens": 453001.0, "step": 220 }, { "entropy": 8.485262393951416, "epoch": 0.014712613614071798, "grad_norm": 1.109375, "learning_rate": 0.000112, "loss": 8.1183, "mean_token_accuracy": 0.07102874703705311, "num_tokens": 462916.0, "step": 225 }, { "entropy": 8.503191184997558, "epoch": 0.015039560583273394, "grad_norm": 1.015625, "learning_rate": 0.0001145, "loss": 8.1605, "mean_token_accuracy": 0.06698749326169491, "num_tokens": 473549.0, "step": 230 }, { "entropy": 8.51591625213623, "epoch": 0.015366507552474989, "grad_norm": 1.0, "learning_rate": 0.00011700000000000001, "loss": 8.1877, "mean_token_accuracy": 0.0670891109853983, "num_tokens": 484472.0, "step": 235 }, { "entropy": 8.499968433380127, "epoch": 0.015693454521676583, "grad_norm": 1.1640625, "learning_rate": 0.00011949999999999999, "loss": 8.1136, "mean_token_accuracy": 0.07003521285951138, "num_tokens": 494202.0, "step": 240 }, { "entropy": 8.394450187683105, "epoch": 0.01602040149087818, "grad_norm": 1.0390625, "learning_rate": 0.000122, "loss": 8.0364, "mean_token_accuracy": 0.07509022057056428, "num_tokens": 504635.0, "step": 245 }, { "entropy": 8.355302047729491, "epoch": 0.016347348460079774, "grad_norm": 1.2109375, "learning_rate": 0.0001245, "loss": 8.0779, "mean_token_accuracy": 0.07193736173212528, "num_tokens": 514423.0, "step": 250 }, { "entropy": 8.388672256469727, "epoch": 0.01667429542928137, "grad_norm": 1.3125, "learning_rate": 0.000127, "loss": 8.1229, "mean_token_accuracy": 0.07487528696656227, "num_tokens": 525820.0, "step": 255 }, { "entropy": 8.406553173065186, "epoch": 0.017001242398482965, "grad_norm": 0.99609375, "learning_rate": 0.0001295, "loss": 8.0896, "mean_token_accuracy": 0.07299871928989887, "num_tokens": 536732.0, "step": 260 }, { "entropy": 8.397539806365966, "epoch": 0.01732818936768456, "grad_norm": 1.2578125, "learning_rate": 0.000132, "loss": 8.0803, "mean_token_accuracy": 0.07458276934921741, "num_tokens": 546230.0, "step": 265 }, { "entropy": 8.383978271484375, "epoch": 0.017655136336886156, "grad_norm": 1.2890625, "learning_rate": 0.00013450000000000002, "loss": 8.0957, "mean_token_accuracy": 0.07023126147687435, "num_tokens": 556078.0, "step": 270 }, { "entropy": 8.382139301300048, "epoch": 0.017982083306087752, "grad_norm": 1.078125, "learning_rate": 0.00013700000000000002, "loss": 8.0756, "mean_token_accuracy": 0.0762918971478939, "num_tokens": 565385.0, "step": 275 }, { "entropy": 8.379422664642334, "epoch": 0.018309030275289347, "grad_norm": 1.203125, "learning_rate": 0.0001395, "loss": 8.1261, "mean_token_accuracy": 0.0720827341079712, "num_tokens": 576066.0, "step": 280 }, { "entropy": 8.449523544311523, "epoch": 0.018635977244490943, "grad_norm": 1.1796875, "learning_rate": 0.00014199999999999998, "loss": 8.0576, "mean_token_accuracy": 0.06984641179442405, "num_tokens": 587472.0, "step": 285 }, { "entropy": 8.372716808319092, "epoch": 0.01896292421369254, "grad_norm": 1.1640625, "learning_rate": 0.0001445, "loss": 8.0499, "mean_token_accuracy": 0.07255740985274314, "num_tokens": 597400.0, "step": 290 }, { "entropy": 8.317928695678711, "epoch": 0.019289871182894134, "grad_norm": 1.2890625, "learning_rate": 0.000147, "loss": 8.1228, "mean_token_accuracy": 0.07397399172186851, "num_tokens": 606856.0, "step": 295 }, { "entropy": 8.43379259109497, "epoch": 0.01961681815209573, "grad_norm": 1.1484375, "learning_rate": 0.0001495, "loss": 8.0314, "mean_token_accuracy": 0.07692977488040924, "num_tokens": 617209.0, "step": 300 }, { "entropy": 8.34858226776123, "epoch": 0.019943765121297325, "grad_norm": 0.98828125, "learning_rate": 0.000152, "loss": 8.0346, "mean_token_accuracy": 0.0782922476530075, "num_tokens": 626826.0, "step": 305 }, { "entropy": 8.350518417358398, "epoch": 0.02027071209049892, "grad_norm": 1.375, "learning_rate": 0.00015450000000000001, "loss": 8.0169, "mean_token_accuracy": 0.08028958663344384, "num_tokens": 636836.0, "step": 310 }, { "entropy": 8.336189079284669, "epoch": 0.020597659059700516, "grad_norm": 1.125, "learning_rate": 0.000157, "loss": 8.0964, "mean_token_accuracy": 0.07140604555606841, "num_tokens": 648177.0, "step": 315 }, { "entropy": 8.35500545501709, "epoch": 0.02092460602890211, "grad_norm": 1.0625, "learning_rate": 0.0001595, "loss": 8.0817, "mean_token_accuracy": 0.07423182912170886, "num_tokens": 658365.0, "step": 320 }, { "entropy": 8.270884132385254, "epoch": 0.021251552998103707, "grad_norm": 2.171875, "learning_rate": 0.000162, "loss": 7.9958, "mean_token_accuracy": 0.07361883968114853, "num_tokens": 668980.0, "step": 325 }, { "entropy": 8.373892879486084, "epoch": 0.021578499967305303, "grad_norm": 1.171875, "learning_rate": 0.00016450000000000001, "loss": 8.0238, "mean_token_accuracy": 0.07899413257837296, "num_tokens": 679406.0, "step": 330 }, { "entropy": 8.297880268096923, "epoch": 0.0219054469365069, "grad_norm": 1.109375, "learning_rate": 0.00016700000000000002, "loss": 7.9837, "mean_token_accuracy": 0.07990795224905015, "num_tokens": 689871.0, "step": 335 }, { "entropy": 8.258869075775147, "epoch": 0.022232393905708494, "grad_norm": 1.2109375, "learning_rate": 0.00016950000000000003, "loss": 7.9343, "mean_token_accuracy": 0.08032900020480156, "num_tokens": 700969.0, "step": 340 }, { "entropy": 8.323282146453858, "epoch": 0.02255934087491009, "grad_norm": 1.1953125, "learning_rate": 0.00017199999999999998, "loss": 7.9559, "mean_token_accuracy": 0.07624984867870807, "num_tokens": 711153.0, "step": 345 }, { "entropy": 8.160166168212891, "epoch": 0.022886287844111685, "grad_norm": 1.09375, "learning_rate": 0.00017449999999999999, "loss": 7.9377, "mean_token_accuracy": 0.07862194329500198, "num_tokens": 721475.0, "step": 350 }, { "entropy": 8.269203758239746, "epoch": 0.02321323481331328, "grad_norm": 1.03125, "learning_rate": 0.000177, "loss": 7.9963, "mean_token_accuracy": 0.07536103650927543, "num_tokens": 732823.0, "step": 355 }, { "entropy": 8.250344467163085, "epoch": 0.023540181782514876, "grad_norm": 1.0546875, "learning_rate": 0.0001795, "loss": 7.9424, "mean_token_accuracy": 0.08161943927407264, "num_tokens": 743853.0, "step": 360 }, { "entropy": 8.223281860351562, "epoch": 0.02386712875171647, "grad_norm": 1.1953125, "learning_rate": 0.000182, "loss": 8.0159, "mean_token_accuracy": 0.0797721978276968, "num_tokens": 754579.0, "step": 365 }, { "entropy": 8.255972194671632, "epoch": 0.024194075720918067, "grad_norm": 1.2109375, "learning_rate": 0.0001845, "loss": 7.9773, "mean_token_accuracy": 0.07408010140061379, "num_tokens": 764836.0, "step": 370 }, { "entropy": 8.241560363769532, "epoch": 0.024521022690119663, "grad_norm": 1.0859375, "learning_rate": 0.000187, "loss": 7.9208, "mean_token_accuracy": 0.07477326951920986, "num_tokens": 773961.0, "step": 375 }, { "entropy": 8.172150325775146, "epoch": 0.02484796965932126, "grad_norm": 1.296875, "learning_rate": 0.0001895, "loss": 7.885, "mean_token_accuracy": 0.0803740806877613, "num_tokens": 784331.0, "step": 380 }, { "entropy": 8.211754417419433, "epoch": 0.025174916628522854, "grad_norm": 1.421875, "learning_rate": 0.000192, "loss": 7.8592, "mean_token_accuracy": 0.08332195580005645, "num_tokens": 794724.0, "step": 385 }, { "entropy": 8.202788066864013, "epoch": 0.02550186359772445, "grad_norm": 1.359375, "learning_rate": 0.0001945, "loss": 7.8739, "mean_token_accuracy": 0.08039483428001404, "num_tokens": 804680.0, "step": 390 }, { "entropy": 8.0855233669281, "epoch": 0.025828810566926045, "grad_norm": 1.234375, "learning_rate": 0.00019700000000000002, "loss": 7.8878, "mean_token_accuracy": 0.07802873328328133, "num_tokens": 815066.0, "step": 395 }, { "entropy": 8.215076637268066, "epoch": 0.02615575753612764, "grad_norm": 1.1328125, "learning_rate": 0.00019950000000000002, "loss": 7.8892, "mean_token_accuracy": 0.07889655604958534, "num_tokens": 824958.0, "step": 400 }, { "entropy": 8.19112491607666, "epoch": 0.026482704505329236, "grad_norm": 1.046875, "learning_rate": 0.000202, "loss": 7.938, "mean_token_accuracy": 0.08244092017412186, "num_tokens": 835128.0, "step": 405 }, { "entropy": 8.075815010070801, "epoch": 0.02680965147453083, "grad_norm": 0.98046875, "learning_rate": 0.00020449999999999998, "loss": 7.8864, "mean_token_accuracy": 0.07554915137588977, "num_tokens": 844590.0, "step": 410 }, { "entropy": 8.19192361831665, "epoch": 0.027136598443732427, "grad_norm": 1.09375, "learning_rate": 0.000207, "loss": 7.8498, "mean_token_accuracy": 0.08013993203639984, "num_tokens": 854914.0, "step": 415 }, { "entropy": 8.128836631774902, "epoch": 0.027463545412934023, "grad_norm": 1.125, "learning_rate": 0.0002095, "loss": 7.904, "mean_token_accuracy": 0.07867389619350433, "num_tokens": 866171.0, "step": 420 }, { "entropy": 8.131003665924073, "epoch": 0.027790492382135618, "grad_norm": 1.1171875, "learning_rate": 0.000212, "loss": 7.8898, "mean_token_accuracy": 0.07613531462848186, "num_tokens": 876603.0, "step": 425 }, { "entropy": 8.116858911514282, "epoch": 0.028117439351337214, "grad_norm": 1.0703125, "learning_rate": 0.0002145, "loss": 7.812, "mean_token_accuracy": 0.08004510477185249, "num_tokens": 887124.0, "step": 430 }, { "entropy": 8.1330491065979, "epoch": 0.02844438632053881, "grad_norm": 1.8515625, "learning_rate": 0.00021700000000000002, "loss": 7.8043, "mean_token_accuracy": 0.0826384425163269, "num_tokens": 897275.0, "step": 435 }, { "entropy": 8.032530117034913, "epoch": 0.028771333289740405, "grad_norm": 0.99609375, "learning_rate": 0.0002195, "loss": 7.7923, "mean_token_accuracy": 0.08558057546615601, "num_tokens": 907174.0, "step": 440 }, { "entropy": 8.115189123153687, "epoch": 0.029098280258942, "grad_norm": 1.125, "learning_rate": 0.000222, "loss": 7.7937, "mean_token_accuracy": 0.08341945856809616, "num_tokens": 917126.0, "step": 445 }, { "entropy": 8.031993722915649, "epoch": 0.029425227228143596, "grad_norm": 1.0546875, "learning_rate": 0.0002245, "loss": 7.816, "mean_token_accuracy": 0.0821719765663147, "num_tokens": 926758.0, "step": 450 }, { "entropy": 8.04862174987793, "epoch": 0.02975217419734519, "grad_norm": 1.015625, "learning_rate": 0.00022700000000000002, "loss": 7.8059, "mean_token_accuracy": 0.08259067237377167, "num_tokens": 936973.0, "step": 455 }, { "entropy": 8.002158880233765, "epoch": 0.030079121166546787, "grad_norm": 1.1171875, "learning_rate": 0.00022950000000000002, "loss": 7.7631, "mean_token_accuracy": 0.07943878024816513, "num_tokens": 946845.0, "step": 460 }, { "entropy": 8.083532094955444, "epoch": 0.030406068135748383, "grad_norm": 1.1328125, "learning_rate": 0.00023200000000000003, "loss": 7.7913, "mean_token_accuracy": 0.08536312282085419, "num_tokens": 956904.0, "step": 465 }, { "entropy": 7.990770101547241, "epoch": 0.030733015104949978, "grad_norm": 1.203125, "learning_rate": 0.00023449999999999998, "loss": 7.7994, "mean_token_accuracy": 0.07841084524989128, "num_tokens": 966133.0, "step": 470 }, { "entropy": 8.080002784729004, "epoch": 0.031059962074151574, "grad_norm": 1.3046875, "learning_rate": 0.000237, "loss": 7.8442, "mean_token_accuracy": 0.07818925343453884, "num_tokens": 976889.0, "step": 475 }, { "entropy": 8.10468544960022, "epoch": 0.031386909043353166, "grad_norm": 1.2265625, "learning_rate": 0.0002395, "loss": 7.8343, "mean_token_accuracy": 0.07947736643254757, "num_tokens": 987385.0, "step": 480 }, { "entropy": 8.022674083709717, "epoch": 0.03171385601255476, "grad_norm": 1.1015625, "learning_rate": 0.000242, "loss": 7.8081, "mean_token_accuracy": 0.08132115826010704, "num_tokens": 998116.0, "step": 485 }, { "entropy": 7.999949407577515, "epoch": 0.03204080298175636, "grad_norm": 1.0546875, "learning_rate": 0.0002445, "loss": 7.78, "mean_token_accuracy": 0.08014609068632125, "num_tokens": 1007412.0, "step": 490 }, { "entropy": 8.02022352218628, "epoch": 0.03236774995095795, "grad_norm": 1.140625, "learning_rate": 0.000247, "loss": 7.818, "mean_token_accuracy": 0.07570124790072441, "num_tokens": 1016843.0, "step": 495 }, { "entropy": 8.02644681930542, "epoch": 0.03269469692015955, "grad_norm": 1.265625, "learning_rate": 0.0002495, "loss": 7.8097, "mean_token_accuracy": 0.08114490360021591, "num_tokens": 1027285.0, "step": 500 }, { "entropy": 8.078714847564697, "epoch": 0.033021643889361144, "grad_norm": 0.95703125, "learning_rate": 0.000252, "loss": 7.8312, "mean_token_accuracy": 0.08023551031947136, "num_tokens": 1038229.0, "step": 505 }, { "entropy": 7.885030746459961, "epoch": 0.03334859085856274, "grad_norm": 1.15625, "learning_rate": 0.0002545, "loss": 7.7469, "mean_token_accuracy": 0.0864953190088272, "num_tokens": 1048588.0, "step": 510 }, { "entropy": 7.964816856384277, "epoch": 0.033675537827764335, "grad_norm": 1.046875, "learning_rate": 0.000257, "loss": 7.7321, "mean_token_accuracy": 0.08311207592487335, "num_tokens": 1058302.0, "step": 515 }, { "entropy": 7.96447720527649, "epoch": 0.03400248479696593, "grad_norm": 1.140625, "learning_rate": 0.0002595, "loss": 7.8124, "mean_token_accuracy": 0.07899703234434127, "num_tokens": 1068180.0, "step": 520 }, { "entropy": 8.03514347076416, "epoch": 0.034329431766167526, "grad_norm": 1.1484375, "learning_rate": 0.000262, "loss": 7.7348, "mean_token_accuracy": 0.08044598922133446, "num_tokens": 1078647.0, "step": 525 }, { "entropy": 7.896927261352539, "epoch": 0.03465637873536912, "grad_norm": 1.1640625, "learning_rate": 0.00026450000000000003, "loss": 7.6265, "mean_token_accuracy": 0.08826040029525757, "num_tokens": 1090037.0, "step": 530 }, { "entropy": 7.893774127960205, "epoch": 0.03498332570457072, "grad_norm": 1.2265625, "learning_rate": 0.00026700000000000004, "loss": 7.7376, "mean_token_accuracy": 0.08410070911049843, "num_tokens": 1099809.0, "step": 535 }, { "entropy": 7.967329835891723, "epoch": 0.03531027267377231, "grad_norm": 1.3828125, "learning_rate": 0.00026950000000000005, "loss": 7.6678, "mean_token_accuracy": 0.08720064125955104, "num_tokens": 1108856.0, "step": 540 }, { "entropy": 7.963892793655395, "epoch": 0.03563721964297391, "grad_norm": 1.140625, "learning_rate": 0.00027200000000000005, "loss": 7.6912, "mean_token_accuracy": 0.08317728266119957, "num_tokens": 1119164.0, "step": 545 }, { "entropy": 7.884589672088623, "epoch": 0.035964166612175504, "grad_norm": 1.078125, "learning_rate": 0.0002745, "loss": 7.735, "mean_token_accuracy": 0.08273053131997585, "num_tokens": 1128977.0, "step": 550 }, { "entropy": 7.9899842739105225, "epoch": 0.0362911135813771, "grad_norm": 1.0546875, "learning_rate": 0.000277, "loss": 7.729, "mean_token_accuracy": 0.0816885620355606, "num_tokens": 1140827.0, "step": 555 }, { "entropy": 7.747017574310303, "epoch": 0.036618060550578695, "grad_norm": 1.25, "learning_rate": 0.0002795, "loss": 7.618, "mean_token_accuracy": 0.08212211430072784, "num_tokens": 1151525.0, "step": 560 }, { "entropy": 7.993799638748169, "epoch": 0.03694500751978029, "grad_norm": 1.109375, "learning_rate": 0.00028199999999999997, "loss": 7.6881, "mean_token_accuracy": 0.07863894626498222, "num_tokens": 1162557.0, "step": 565 }, { "entropy": 7.985806083679199, "epoch": 0.037271954488981886, "grad_norm": 1.28125, "learning_rate": 0.0002845, "loss": 7.7942, "mean_token_accuracy": 0.07877567186951637, "num_tokens": 1173589.0, "step": 570 }, { "entropy": 7.735669565200806, "epoch": 0.03759890145818348, "grad_norm": 1.0859375, "learning_rate": 0.000287, "loss": 7.566, "mean_token_accuracy": 0.09481499344110489, "num_tokens": 1182068.0, "step": 575 }, { "entropy": 7.927742624282837, "epoch": 0.03792584842738508, "grad_norm": 1.0859375, "learning_rate": 0.0002895, "loss": 7.6531, "mean_token_accuracy": 0.08464730978012085, "num_tokens": 1191760.0, "step": 580 }, { "entropy": 7.829121017456055, "epoch": 0.03825279539658667, "grad_norm": 1.1484375, "learning_rate": 0.000292, "loss": 7.6357, "mean_token_accuracy": 0.09077754840254784, "num_tokens": 1201397.0, "step": 585 }, { "entropy": 7.933064126968384, "epoch": 0.03857974236578827, "grad_norm": 1.046875, "learning_rate": 0.0002945, "loss": 7.792, "mean_token_accuracy": 0.07558935880661011, "num_tokens": 1213112.0, "step": 590 }, { "entropy": 7.886399126052856, "epoch": 0.038906689334989863, "grad_norm": 1.1875, "learning_rate": 0.000297, "loss": 7.6429, "mean_token_accuracy": 0.08706863895058632, "num_tokens": 1223467.0, "step": 595 }, { "entropy": 7.827888822555542, "epoch": 0.03923363630419146, "grad_norm": 1.203125, "learning_rate": 0.0002995, "loss": 7.729, "mean_token_accuracy": 0.08387157320976257, "num_tokens": 1233608.0, "step": 600 }, { "entropy": 7.935065698623657, "epoch": 0.039560583273393055, "grad_norm": 1.21875, "learning_rate": 0.000302, "loss": 7.6841, "mean_token_accuracy": 0.0852059107273817, "num_tokens": 1244046.0, "step": 605 }, { "entropy": 7.8300574779510494, "epoch": 0.03988753024259465, "grad_norm": 1.078125, "learning_rate": 0.0003045, "loss": 7.6372, "mean_token_accuracy": 0.08836368545889854, "num_tokens": 1254695.0, "step": 610 }, { "entropy": 7.874053049087524, "epoch": 0.040214477211796246, "grad_norm": 0.97265625, "learning_rate": 0.000307, "loss": 7.7367, "mean_token_accuracy": 0.08260378688573837, "num_tokens": 1265154.0, "step": 615 }, { "entropy": 7.753242111206054, "epoch": 0.04054142418099784, "grad_norm": 1.21875, "learning_rate": 0.0003095, "loss": 7.4854, "mean_token_accuracy": 0.09328908920288086, "num_tokens": 1275886.0, "step": 620 }, { "entropy": 7.809550189971924, "epoch": 0.04086837115019944, "grad_norm": 1.0703125, "learning_rate": 0.000312, "loss": 7.5922, "mean_token_accuracy": 0.08326055184006691, "num_tokens": 1287480.0, "step": 625 }, { "entropy": 7.728694343566895, "epoch": 0.04119531811940103, "grad_norm": 1.4140625, "learning_rate": 0.0003145, "loss": 7.5715, "mean_token_accuracy": 0.08990240022540093, "num_tokens": 1298112.0, "step": 630 }, { "entropy": 7.824120092391968, "epoch": 0.04152226508860263, "grad_norm": 1.0703125, "learning_rate": 0.000317, "loss": 7.6116, "mean_token_accuracy": 0.08934769928455352, "num_tokens": 1307467.0, "step": 635 }, { "entropy": 7.816653728485107, "epoch": 0.04184921205780422, "grad_norm": 1.1171875, "learning_rate": 0.0003195, "loss": 7.6066, "mean_token_accuracy": 0.08667667284607887, "num_tokens": 1317672.0, "step": 640 }, { "entropy": 7.819509220123291, "epoch": 0.04217615902700582, "grad_norm": 1.1484375, "learning_rate": 0.000322, "loss": 7.5704, "mean_token_accuracy": 0.08539666458964348, "num_tokens": 1327356.0, "step": 645 }, { "entropy": 7.735612154006958, "epoch": 0.042503105996207415, "grad_norm": 1.1171875, "learning_rate": 0.00032450000000000003, "loss": 7.567, "mean_token_accuracy": 0.08691356107592582, "num_tokens": 1337102.0, "step": 650 }, { "entropy": 7.761639261245728, "epoch": 0.04283005296540901, "grad_norm": 1.2890625, "learning_rate": 0.00032700000000000003, "loss": 7.5327, "mean_token_accuracy": 0.09290309846401215, "num_tokens": 1347838.0, "step": 655 }, { "entropy": 7.718127250671387, "epoch": 0.043156999934610606, "grad_norm": 1.125, "learning_rate": 0.00032950000000000004, "loss": 7.518, "mean_token_accuracy": 0.08988637253642082, "num_tokens": 1358215.0, "step": 660 }, { "entropy": 7.629851818084717, "epoch": 0.0434839469038122, "grad_norm": 0.94921875, "learning_rate": 0.00033200000000000005, "loss": 7.5396, "mean_token_accuracy": 0.09100433364510536, "num_tokens": 1368600.0, "step": 665 }, { "entropy": 7.744331169128418, "epoch": 0.0438108938730138, "grad_norm": 1.0703125, "learning_rate": 0.00033450000000000005, "loss": 7.5419, "mean_token_accuracy": 0.08812416419386863, "num_tokens": 1379346.0, "step": 670 }, { "entropy": 7.6909706592559814, "epoch": 0.04413784084221539, "grad_norm": 1.6484375, "learning_rate": 0.000337, "loss": 7.5253, "mean_token_accuracy": 0.09396424815058708, "num_tokens": 1388576.0, "step": 675 }, { "entropy": 7.662409782409668, "epoch": 0.04446478781141699, "grad_norm": 1.21875, "learning_rate": 0.0003395, "loss": 7.441, "mean_token_accuracy": 0.09439576715230942, "num_tokens": 1397992.0, "step": 680 }, { "entropy": 7.5916296482086185, "epoch": 0.04479173478061858, "grad_norm": 1.09375, "learning_rate": 0.000342, "loss": 7.5253, "mean_token_accuracy": 0.09223191663622857, "num_tokens": 1408456.0, "step": 685 }, { "entropy": 7.7609130859375, "epoch": 0.04511868174982018, "grad_norm": 1.0859375, "learning_rate": 0.00034449999999999997, "loss": 7.5267, "mean_token_accuracy": 0.09087984338402748, "num_tokens": 1418993.0, "step": 690 }, { "entropy": 7.642154312133789, "epoch": 0.045445628719021774, "grad_norm": 1.578125, "learning_rate": 0.000347, "loss": 7.5391, "mean_token_accuracy": 0.08691065907478332, "num_tokens": 1429460.0, "step": 695 }, { "entropy": 7.597477817535401, "epoch": 0.04577257568822337, "grad_norm": 1.0078125, "learning_rate": 0.0003495, "loss": 7.4977, "mean_token_accuracy": 0.08851892724633217, "num_tokens": 1440192.0, "step": 700 }, { "entropy": 7.7847288131713865, "epoch": 0.046099522657424966, "grad_norm": 1.0546875, "learning_rate": 0.000352, "loss": 7.5856, "mean_token_accuracy": 0.08829929679632187, "num_tokens": 1450249.0, "step": 705 }, { "entropy": 7.622567558288575, "epoch": 0.04642646962662656, "grad_norm": 1.078125, "learning_rate": 0.0003545, "loss": 7.457, "mean_token_accuracy": 0.09405799433588982, "num_tokens": 1460206.0, "step": 710 }, { "entropy": 7.639090919494629, "epoch": 0.04675341659582816, "grad_norm": 1.0703125, "learning_rate": 0.000357, "loss": 7.5193, "mean_token_accuracy": 0.09094901978969575, "num_tokens": 1471286.0, "step": 715 }, { "entropy": 7.644714307785034, "epoch": 0.04708036356502975, "grad_norm": 1.1171875, "learning_rate": 0.0003595, "loss": 7.5432, "mean_token_accuracy": 0.09027124419808388, "num_tokens": 1481833.0, "step": 720 }, { "entropy": 7.645797395706177, "epoch": 0.04740731053423135, "grad_norm": 1.03125, "learning_rate": 0.000362, "loss": 7.4398, "mean_token_accuracy": 0.09458292424678802, "num_tokens": 1492146.0, "step": 725 }, { "entropy": 7.646700477600097, "epoch": 0.04773425750343294, "grad_norm": 0.95703125, "learning_rate": 0.0003645, "loss": 7.4943, "mean_token_accuracy": 0.092915727943182, "num_tokens": 1503115.0, "step": 730 }, { "entropy": 7.641965723037719, "epoch": 0.04806120447263454, "grad_norm": 0.9921875, "learning_rate": 0.000367, "loss": 7.4661, "mean_token_accuracy": 0.09425919353961945, "num_tokens": 1512262.0, "step": 735 }, { "entropy": 7.58311824798584, "epoch": 0.048388151441836134, "grad_norm": 1.1796875, "learning_rate": 0.0003695, "loss": 7.4133, "mean_token_accuracy": 0.09847794026136399, "num_tokens": 1522170.0, "step": 740 }, { "entropy": 7.678279685974121, "epoch": 0.04871509841103773, "grad_norm": 1.4140625, "learning_rate": 0.000372, "loss": 7.5892, "mean_token_accuracy": 0.08588746264576912, "num_tokens": 1533458.0, "step": 745 }, { "entropy": 7.60939655303955, "epoch": 0.049042045380239326, "grad_norm": 1.2265625, "learning_rate": 0.0003745, "loss": 7.5093, "mean_token_accuracy": 0.09647220522165298, "num_tokens": 1543835.0, "step": 750 }, { "entropy": 7.586400842666626, "epoch": 0.04936899234944092, "grad_norm": 1.0625, "learning_rate": 0.000377, "loss": 7.4396, "mean_token_accuracy": 0.09263752400875092, "num_tokens": 1554928.0, "step": 755 }, { "entropy": 7.5171217918396, "epoch": 0.04969593931864252, "grad_norm": 1.28125, "learning_rate": 0.0003795, "loss": 7.4243, "mean_token_accuracy": 0.08944250419735908, "num_tokens": 1564982.0, "step": 760 }, { "entropy": 7.628956365585327, "epoch": 0.05002288628784411, "grad_norm": 1.0078125, "learning_rate": 0.000382, "loss": 7.4411, "mean_token_accuracy": 0.09137816503643989, "num_tokens": 1575637.0, "step": 765 }, { "entropy": 7.6460768699646, "epoch": 0.05034983325704571, "grad_norm": 1.3203125, "learning_rate": 0.0003845, "loss": 7.5368, "mean_token_accuracy": 0.08920445963740349, "num_tokens": 1585759.0, "step": 770 }, { "entropy": 7.6024657726287845, "epoch": 0.0506767802262473, "grad_norm": 1.1015625, "learning_rate": 0.00038700000000000003, "loss": 7.4103, "mean_token_accuracy": 0.09467457756400108, "num_tokens": 1594608.0, "step": 775 }, { "entropy": 7.4974555492401125, "epoch": 0.0510037271954489, "grad_norm": 1.0859375, "learning_rate": 0.00038950000000000003, "loss": 7.3775, "mean_token_accuracy": 0.08214250430464745, "num_tokens": 1604956.0, "step": 780 }, { "entropy": 7.531370782852173, "epoch": 0.051330674164650494, "grad_norm": 1.109375, "learning_rate": 0.00039200000000000004, "loss": 7.4117, "mean_token_accuracy": 0.09429344385862351, "num_tokens": 1615408.0, "step": 785 }, { "entropy": 7.481987857818604, "epoch": 0.05165762113385209, "grad_norm": 1.1171875, "learning_rate": 0.00039450000000000005, "loss": 7.374, "mean_token_accuracy": 0.0990242563188076, "num_tokens": 1626543.0, "step": 790 }, { "entropy": 7.503841590881348, "epoch": 0.051984568103053685, "grad_norm": 1.125, "learning_rate": 0.00039700000000000005, "loss": 7.3723, "mean_token_accuracy": 0.0934281051158905, "num_tokens": 1636850.0, "step": 795 }, { "entropy": 7.552478551864624, "epoch": 0.05231151507225528, "grad_norm": 1.0234375, "learning_rate": 0.0003995, "loss": 7.4546, "mean_token_accuracy": 0.09325189143419266, "num_tokens": 1647375.0, "step": 800 }, { "entropy": 7.508175325393677, "epoch": 0.05263846204145688, "grad_norm": 1.15625, "learning_rate": 0.000402, "loss": 7.3956, "mean_token_accuracy": 0.09508362561464309, "num_tokens": 1657434.0, "step": 805 }, { "entropy": 7.525782871246338, "epoch": 0.05296540901065847, "grad_norm": 1.015625, "learning_rate": 0.0004045, "loss": 7.3759, "mean_token_accuracy": 0.09434041827917099, "num_tokens": 1668221.0, "step": 810 }, { "entropy": 7.4677405834198, "epoch": 0.05329235597986007, "grad_norm": 1.125, "learning_rate": 0.00040699999999999997, "loss": 7.4055, "mean_token_accuracy": 0.09813953042030335, "num_tokens": 1678721.0, "step": 815 }, { "entropy": 7.497503423690796, "epoch": 0.05361930294906166, "grad_norm": 1.0, "learning_rate": 0.0004095, "loss": 7.416, "mean_token_accuracy": 0.09286611676216125, "num_tokens": 1689039.0, "step": 820 }, { "entropy": 7.516896438598633, "epoch": 0.05394624991826326, "grad_norm": 1.1171875, "learning_rate": 0.000412, "loss": 7.4115, "mean_token_accuracy": 0.09643441066145897, "num_tokens": 1699256.0, "step": 825 }, { "entropy": 7.432146406173706, "epoch": 0.054273196887464854, "grad_norm": 0.953125, "learning_rate": 0.0004145, "loss": 7.3372, "mean_token_accuracy": 0.09998627007007599, "num_tokens": 1710016.0, "step": 830 }, { "entropy": 7.511775302886963, "epoch": 0.05460014385666645, "grad_norm": 1.1171875, "learning_rate": 0.000417, "loss": 7.3758, "mean_token_accuracy": 0.09355643093585968, "num_tokens": 1721182.0, "step": 835 }, { "entropy": 7.542740154266357, "epoch": 0.054927090825868045, "grad_norm": 1.078125, "learning_rate": 0.0004195, "loss": 7.3933, "mean_token_accuracy": 0.09180661812424659, "num_tokens": 1732103.0, "step": 840 }, { "entropy": 7.515568685531616, "epoch": 0.05525403779506964, "grad_norm": 1.078125, "learning_rate": 0.000422, "loss": 7.3877, "mean_token_accuracy": 0.09569102376699448, "num_tokens": 1742277.0, "step": 845 }, { "entropy": 7.499371337890625, "epoch": 0.055580984764271237, "grad_norm": 1.21875, "learning_rate": 0.0004245, "loss": 7.4082, "mean_token_accuracy": 0.0913012869656086, "num_tokens": 1754218.0, "step": 850 }, { "entropy": 7.416450786590576, "epoch": 0.05590793173347283, "grad_norm": 1.03125, "learning_rate": 0.000427, "loss": 7.3677, "mean_token_accuracy": 0.09422364756464958, "num_tokens": 1764923.0, "step": 855 }, { "entropy": 7.427515649795533, "epoch": 0.05623487870267443, "grad_norm": 1.2265625, "learning_rate": 0.0004295, "loss": 7.3562, "mean_token_accuracy": 0.09332785978913308, "num_tokens": 1775449.0, "step": 860 }, { "entropy": 7.416171264648438, "epoch": 0.05656182567187602, "grad_norm": 1.078125, "learning_rate": 0.000432, "loss": 7.3251, "mean_token_accuracy": 0.09550227224826813, "num_tokens": 1785953.0, "step": 865 }, { "entropy": 7.45971794128418, "epoch": 0.05688877264107762, "grad_norm": 0.94921875, "learning_rate": 0.0004345, "loss": 7.3897, "mean_token_accuracy": 0.09133484959602356, "num_tokens": 1797457.0, "step": 870 }, { "entropy": 7.47162561416626, "epoch": 0.057215719610279214, "grad_norm": 1.1484375, "learning_rate": 0.000437, "loss": 7.3432, "mean_token_accuracy": 0.1010080873966217, "num_tokens": 1807541.0, "step": 875 }, { "entropy": 7.406948661804199, "epoch": 0.05754266657948081, "grad_norm": 1.046875, "learning_rate": 0.0004395, "loss": 7.2571, "mean_token_accuracy": 0.10240738689899445, "num_tokens": 1816942.0, "step": 880 }, { "entropy": 7.332617282867432, "epoch": 0.057869613548682405, "grad_norm": 1.0703125, "learning_rate": 0.000442, "loss": 7.3166, "mean_token_accuracy": 0.09722614660859108, "num_tokens": 1828562.0, "step": 885 }, { "entropy": 7.317634105682373, "epoch": 0.058196560517884, "grad_norm": 1.109375, "learning_rate": 0.0004445, "loss": 7.2702, "mean_token_accuracy": 0.10308469980955123, "num_tokens": 1838574.0, "step": 890 }, { "entropy": 7.4581560611724855, "epoch": 0.058523507487085596, "grad_norm": 1.1171875, "learning_rate": 0.000447, "loss": 7.2847, "mean_token_accuracy": 0.10133275091648102, "num_tokens": 1848900.0, "step": 895 }, { "entropy": 7.27069730758667, "epoch": 0.05885045445628719, "grad_norm": 1.09375, "learning_rate": 0.00044950000000000003, "loss": 7.4122, "mean_token_accuracy": 0.09220485016703606, "num_tokens": 1859476.0, "step": 900 }, { "entropy": 7.503418350219727, "epoch": 0.05917740142548879, "grad_norm": 1.0546875, "learning_rate": 0.00045200000000000004, "loss": 7.2932, "mean_token_accuracy": 0.09607853069901466, "num_tokens": 1868619.0, "step": 905 }, { "entropy": 7.368823909759522, "epoch": 0.05950434839469038, "grad_norm": 1.2578125, "learning_rate": 0.00045450000000000004, "loss": 7.3494, "mean_token_accuracy": 0.10248463004827499, "num_tokens": 1879556.0, "step": 910 }, { "entropy": 7.442554616928101, "epoch": 0.05983129536389198, "grad_norm": 1.09375, "learning_rate": 0.00045700000000000005, "loss": 7.3196, "mean_token_accuracy": 0.09319584593176841, "num_tokens": 1889780.0, "step": 915 }, { "entropy": 7.444570159912109, "epoch": 0.060158242333093574, "grad_norm": 1.1015625, "learning_rate": 0.00045950000000000006, "loss": 7.3905, "mean_token_accuracy": 0.09182552620768547, "num_tokens": 1899718.0, "step": 920 }, { "entropy": 7.221747827529907, "epoch": 0.06048518930229517, "grad_norm": 1.2109375, "learning_rate": 0.000462, "loss": 7.1978, "mean_token_accuracy": 0.1042414702475071, "num_tokens": 1909438.0, "step": 925 }, { "entropy": 7.3001227378845215, "epoch": 0.060812136271496765, "grad_norm": 1.1171875, "learning_rate": 0.0004645, "loss": 7.2655, "mean_token_accuracy": 0.10486793145537376, "num_tokens": 1918760.0, "step": 930 }, { "entropy": 7.414737510681152, "epoch": 0.06113908324069836, "grad_norm": 1.09375, "learning_rate": 0.000467, "loss": 7.2916, "mean_token_accuracy": 0.09763090014457702, "num_tokens": 1928233.0, "step": 935 }, { "entropy": 7.325099134445191, "epoch": 0.061466030209899956, "grad_norm": 1.0625, "learning_rate": 0.0004695, "loss": 7.2743, "mean_token_accuracy": 0.09369279816746712, "num_tokens": 1938986.0, "step": 940 }, { "entropy": 7.3215149402618405, "epoch": 0.06179297717910155, "grad_norm": 1.0234375, "learning_rate": 0.000472, "loss": 7.2483, "mean_token_accuracy": 0.0932667076587677, "num_tokens": 1949641.0, "step": 945 }, { "entropy": 7.295780611038208, "epoch": 0.06211992414830315, "grad_norm": 0.984375, "learning_rate": 0.0004745, "loss": 7.3606, "mean_token_accuracy": 0.0916364073753357, "num_tokens": 1960353.0, "step": 950 }, { "entropy": 7.411403512954712, "epoch": 0.06244687111750474, "grad_norm": 1.1328125, "learning_rate": 0.000477, "loss": 7.3178, "mean_token_accuracy": 0.09297204315662384, "num_tokens": 1970130.0, "step": 955 }, { "entropy": 7.3609161376953125, "epoch": 0.06277381808670633, "grad_norm": 0.99609375, "learning_rate": 0.0004795, "loss": 7.3095, "mean_token_accuracy": 0.09885415062308311, "num_tokens": 1980719.0, "step": 960 }, { "entropy": 7.2318257808685305, "epoch": 0.06310076505590793, "grad_norm": 0.9765625, "learning_rate": 0.000482, "loss": 7.2588, "mean_token_accuracy": 0.09474370256066322, "num_tokens": 1991468.0, "step": 965 }, { "entropy": 7.409163141250611, "epoch": 0.06342771202510952, "grad_norm": 1.203125, "learning_rate": 0.0004845, "loss": 7.2596, "mean_token_accuracy": 0.09945956468582154, "num_tokens": 2001845.0, "step": 970 }, { "entropy": 7.187266206741333, "epoch": 0.06375465899431113, "grad_norm": 1.171875, "learning_rate": 0.000487, "loss": 7.2604, "mean_token_accuracy": 0.09942768141627312, "num_tokens": 2011312.0, "step": 975 }, { "entropy": 7.328668689727783, "epoch": 0.06408160596351271, "grad_norm": 1.0859375, "learning_rate": 0.0004895, "loss": 7.2559, "mean_token_accuracy": 0.10341975167393684, "num_tokens": 2020167.0, "step": 980 }, { "entropy": 7.281127023696899, "epoch": 0.06440855293271432, "grad_norm": 1.0625, "learning_rate": 0.000492, "loss": 7.2, "mean_token_accuracy": 0.10184870287775993, "num_tokens": 2030696.0, "step": 985 }, { "entropy": 7.364079809188842, "epoch": 0.0647354999019159, "grad_norm": 1.109375, "learning_rate": 0.0004945, "loss": 7.2621, "mean_token_accuracy": 0.09647839814424515, "num_tokens": 2040876.0, "step": 990 }, { "entropy": 7.221489000320434, "epoch": 0.06506244687111751, "grad_norm": 0.953125, "learning_rate": 0.000497, "loss": 7.2428, "mean_token_accuracy": 0.09806701317429542, "num_tokens": 2051671.0, "step": 995 }, { "entropy": 7.305253982543945, "epoch": 0.0653893938403191, "grad_norm": 1.0625, "learning_rate": 0.0004995, "loss": 7.0921, "mean_token_accuracy": 0.10917930230498314, "num_tokens": 2062662.0, "step": 1000 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 3256964352000000.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }