{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.07715454054471106, "eval_steps": 500, "global_step": 1500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.691593360900878, "epoch": 0.0002571818018157035, "grad_norm": 13.5625, "learning_rate": 2e-06, "loss": 10.761, "mean_token_accuracy": 0.00011363636003807187, "num_tokens": 8373.0, "step": 5 }, { "entropy": 10.691572093963623, "epoch": 0.000514363603631407, "grad_norm": 12.375, "learning_rate": 4.5e-06, "loss": 10.7039, "mean_token_accuracy": 0.0, "num_tokens": 17090.0, "step": 10 }, { "entropy": 10.691090297698974, "epoch": 0.0007715454054471106, "grad_norm": 9.875, "learning_rate": 7e-06, "loss": 10.5011, "mean_token_accuracy": 0.018853903049603105, "num_tokens": 26219.0, "step": 15 }, { "entropy": 10.680709075927734, "epoch": 0.001028727207262814, "grad_norm": 6.03125, "learning_rate": 9.5e-06, "loss": 10.2462, "mean_token_accuracy": 0.04484990499913692, "num_tokens": 36191.0, "step": 20 }, { "entropy": 10.582563495635986, "epoch": 0.0012859090090785177, "grad_norm": 3.9375, "learning_rate": 1.2e-05, "loss": 9.9749, "mean_token_accuracy": 0.040961484611034396, "num_tokens": 45318.0, "step": 25 }, { "entropy": 10.534116744995117, "epoch": 0.0015430908108942211, "grad_norm": 3.703125, "learning_rate": 1.4500000000000002e-05, "loss": 9.8021, "mean_token_accuracy": 0.04536043591797352, "num_tokens": 53102.0, "step": 30 }, { "entropy": 10.562399864196777, "epoch": 0.0018002726127099246, "grad_norm": 2.984375, "learning_rate": 1.7000000000000003e-05, "loss": 9.7539, "mean_token_accuracy": 0.042898242548108104, "num_tokens": 61808.0, "step": 35 }, { "entropy": 10.547216129302978, "epoch": 0.002057454414525628, "grad_norm": 2.8125, "learning_rate": 1.95e-05, "loss": 9.7136, "mean_token_accuracy": 0.044699297100305554, "num_tokens": 70708.0, "step": 40 }, { "entropy": 10.517444515228272, "epoch": 0.0023146362163413317, "grad_norm": 2.5, "learning_rate": 2.2e-05, "loss": 9.632, "mean_token_accuracy": 0.04661537855863571, "num_tokens": 79541.0, "step": 45 }, { "entropy": 10.505586051940918, "epoch": 0.0025718180181570354, "grad_norm": 2.40625, "learning_rate": 2.4500000000000003e-05, "loss": 9.5459, "mean_token_accuracy": 0.05164888352155685, "num_tokens": 87073.0, "step": 50 }, { "entropy": 10.474337196350097, "epoch": 0.0028289998199727386, "grad_norm": 2.25, "learning_rate": 2.7e-05, "loss": 9.5486, "mean_token_accuracy": 0.059509020671248435, "num_tokens": 96581.0, "step": 55 }, { "entropy": 10.405019569396973, "epoch": 0.0030861816217884423, "grad_norm": 2.359375, "learning_rate": 2.95e-05, "loss": 9.4782, "mean_token_accuracy": 0.060714465007185935, "num_tokens": 105741.0, "step": 60 }, { "entropy": 10.288742446899414, "epoch": 0.003343363423604146, "grad_norm": 2.125, "learning_rate": 3.2e-05, "loss": 9.385, "mean_token_accuracy": 0.061338124051690104, "num_tokens": 114609.0, "step": 65 }, { "entropy": 10.352596855163574, "epoch": 0.003600545225419849, "grad_norm": 2.125, "learning_rate": 3.4500000000000005e-05, "loss": 9.35, "mean_token_accuracy": 0.05903933756053448, "num_tokens": 123922.0, "step": 70 }, { "entropy": 10.332678699493409, "epoch": 0.003857727027235553, "grad_norm": 2.125, "learning_rate": 3.7e-05, "loss": 9.2218, "mean_token_accuracy": 0.06484894305467606, "num_tokens": 133213.0, "step": 75 }, { "entropy": 10.27952938079834, "epoch": 0.004114908829051256, "grad_norm": 1.96875, "learning_rate": 3.95e-05, "loss": 9.1737, "mean_token_accuracy": 0.06273005269467831, "num_tokens": 141582.0, "step": 80 }, { "entropy": 10.254050540924073, "epoch": 0.00437209063086696, "grad_norm": 2.0625, "learning_rate": 4.2000000000000004e-05, "loss": 8.9925, "mean_token_accuracy": 0.06865651868283748, "num_tokens": 149709.0, "step": 85 }, { "entropy": 10.210903453826905, "epoch": 0.004629272432682663, "grad_norm": 1.8203125, "learning_rate": 4.45e-05, "loss": 8.856, "mean_token_accuracy": 0.07082752697169781, "num_tokens": 158239.0, "step": 90 }, { "entropy": 10.24482765197754, "epoch": 0.004886454234498367, "grad_norm": 1.7578125, "learning_rate": 4.7000000000000004e-05, "loss": 8.9023, "mean_token_accuracy": 0.0604440800845623, "num_tokens": 168046.0, "step": 95 }, { "entropy": 10.135429000854492, "epoch": 0.005143636036314071, "grad_norm": 1.53125, "learning_rate": 4.9500000000000004e-05, "loss": 8.8077, "mean_token_accuracy": 0.06280115209519863, "num_tokens": 177797.0, "step": 100 }, { "entropy": 10.110702419281006, "epoch": 0.0054008178381297735, "grad_norm": 1.796875, "learning_rate": 5.2e-05, "loss": 8.6609, "mean_token_accuracy": 0.06286422722041607, "num_tokens": 186664.0, "step": 105 }, { "entropy": 10.024668121337891, "epoch": 0.005657999639945477, "grad_norm": 1.5546875, "learning_rate": 5.45e-05, "loss": 8.5449, "mean_token_accuracy": 0.06326077207922935, "num_tokens": 195404.0, "step": 110 }, { "entropy": 9.922544002532959, "epoch": 0.005915181441761181, "grad_norm": 1.5546875, "learning_rate": 5.7e-05, "loss": 8.4327, "mean_token_accuracy": 0.06552885584533215, "num_tokens": 204248.0, "step": 115 }, { "entropy": 9.780591869354248, "epoch": 0.0061723632435768845, "grad_norm": 1.515625, "learning_rate": 5.9499999999999996e-05, "loss": 8.2869, "mean_token_accuracy": 0.060110585764050484, "num_tokens": 214042.0, "step": 120 }, { "entropy": 9.649379444122314, "epoch": 0.006429545045392588, "grad_norm": 1.390625, "learning_rate": 6.2e-05, "loss": 8.189, "mean_token_accuracy": 0.06577248759567737, "num_tokens": 223194.0, "step": 125 }, { "entropy": 9.431284046173095, "epoch": 0.006686726847208292, "grad_norm": 1.484375, "learning_rate": 6.450000000000001e-05, "loss": 7.9307, "mean_token_accuracy": 0.07218964248895646, "num_tokens": 230929.0, "step": 130 }, { "entropy": 9.260346984863281, "epoch": 0.006943908649023995, "grad_norm": 1.734375, "learning_rate": 6.7e-05, "loss": 7.9081, "mean_token_accuracy": 0.07038265988230705, "num_tokens": 238687.0, "step": 135 }, { "entropy": 9.035238265991211, "epoch": 0.007201090450839698, "grad_norm": 1.4921875, "learning_rate": 6.950000000000001e-05, "loss": 7.8152, "mean_token_accuracy": 0.07054561264812946, "num_tokens": 247397.0, "step": 140 }, { "entropy": 8.894649696350097, "epoch": 0.007458272252655402, "grad_norm": 1.4453125, "learning_rate": 7.2e-05, "loss": 7.7444, "mean_token_accuracy": 0.07246604040265084, "num_tokens": 255924.0, "step": 145 }, { "entropy": 8.742353820800782, "epoch": 0.007715454054471106, "grad_norm": 1.2890625, "learning_rate": 7.45e-05, "loss": 7.6781, "mean_token_accuracy": 0.06747029088437557, "num_tokens": 264767.0, "step": 150 }, { "entropy": 8.636024761199952, "epoch": 0.00797263585628681, "grad_norm": 1.1640625, "learning_rate": 7.7e-05, "loss": 7.6787, "mean_token_accuracy": 0.07033539973199368, "num_tokens": 274250.0, "step": 155 }, { "entropy": 8.433564472198487, "epoch": 0.008229817658102512, "grad_norm": 1.3828125, "learning_rate": 7.950000000000001e-05, "loss": 7.5648, "mean_token_accuracy": 0.07707317210733891, "num_tokens": 282568.0, "step": 160 }, { "entropy": 8.366222667694093, "epoch": 0.008486999459918217, "grad_norm": 1.3671875, "learning_rate": 8.2e-05, "loss": 7.5969, "mean_token_accuracy": 0.06956044659018516, "num_tokens": 291126.0, "step": 165 }, { "entropy": 8.285852527618408, "epoch": 0.00874418126173392, "grad_norm": 1.1953125, "learning_rate": 8.450000000000001e-05, "loss": 7.5209, "mean_token_accuracy": 0.07576571702957154, "num_tokens": 299751.0, "step": 170 }, { "entropy": 8.235202884674072, "epoch": 0.009001363063549624, "grad_norm": 1.2734375, "learning_rate": 8.7e-05, "loss": 7.5119, "mean_token_accuracy": 0.07470664568245411, "num_tokens": 309560.0, "step": 175 }, { "entropy": 8.157529830932617, "epoch": 0.009258544865365327, "grad_norm": 1.296875, "learning_rate": 8.95e-05, "loss": 7.4928, "mean_token_accuracy": 0.06981925927102565, "num_tokens": 318613.0, "step": 180 }, { "entropy": 8.12168264389038, "epoch": 0.00951572666718103, "grad_norm": 1.328125, "learning_rate": 9.2e-05, "loss": 7.551, "mean_token_accuracy": 0.07186717689037322, "num_tokens": 327650.0, "step": 185 }, { "entropy": 8.121650791168213, "epoch": 0.009772908468996734, "grad_norm": 1.125, "learning_rate": 9.45e-05, "loss": 7.4394, "mean_token_accuracy": 0.07240154445171357, "num_tokens": 337198.0, "step": 190 }, { "entropy": 8.03664698600769, "epoch": 0.010030090270812437, "grad_norm": 1.34375, "learning_rate": 9.7e-05, "loss": 7.5301, "mean_token_accuracy": 0.07011710181832313, "num_tokens": 346179.0, "step": 195 }, { "entropy": 8.069316053390503, "epoch": 0.010287272072628141, "grad_norm": 1.6875, "learning_rate": 9.95e-05, "loss": 7.4276, "mean_token_accuracy": 0.07499495595693588, "num_tokens": 355972.0, "step": 200 }, { "entropy": 7.968952226638794, "epoch": 0.010544453874443844, "grad_norm": 1.4375, "learning_rate": 0.000102, "loss": 7.3626, "mean_token_accuracy": 0.077250687032938, "num_tokens": 364635.0, "step": 205 }, { "entropy": 7.948678016662598, "epoch": 0.010801635676259547, "grad_norm": 1.328125, "learning_rate": 0.00010449999999999999, "loss": 7.5125, "mean_token_accuracy": 0.07722728103399276, "num_tokens": 374161.0, "step": 210 }, { "entropy": 7.955185747146606, "epoch": 0.011058817478075252, "grad_norm": 1.1875, "learning_rate": 0.000107, "loss": 7.3673, "mean_token_accuracy": 0.0733168862760067, "num_tokens": 383641.0, "step": 215 }, { "entropy": 7.921580362319946, "epoch": 0.011315999279890954, "grad_norm": 1.3515625, "learning_rate": 0.0001095, "loss": 7.3171, "mean_token_accuracy": 0.0784445971250534, "num_tokens": 392300.0, "step": 220 }, { "entropy": 7.939724063873291, "epoch": 0.011573181081706659, "grad_norm": 1.3125, "learning_rate": 0.000112, "loss": 7.3486, "mean_token_accuracy": 0.07721329033374787, "num_tokens": 400721.0, "step": 225 }, { "entropy": 7.914973640441895, "epoch": 0.011830362883522362, "grad_norm": 1.265625, "learning_rate": 0.0001145, "loss": 7.3563, "mean_token_accuracy": 0.08054085932672024, "num_tokens": 410261.0, "step": 230 }, { "entropy": 7.840137624740601, "epoch": 0.012087544685338066, "grad_norm": 1.296875, "learning_rate": 0.00011700000000000001, "loss": 7.2993, "mean_token_accuracy": 0.08381507098674774, "num_tokens": 419006.0, "step": 235 }, { "entropy": 7.865709638595581, "epoch": 0.012344726487153769, "grad_norm": 1.1953125, "learning_rate": 0.00011949999999999999, "loss": 7.3679, "mean_token_accuracy": 0.07533743120729923, "num_tokens": 428773.0, "step": 240 }, { "entropy": 7.8893204689025875, "epoch": 0.012601908288969472, "grad_norm": 1.5390625, "learning_rate": 0.000122, "loss": 7.2843, "mean_token_accuracy": 0.08408410698175431, "num_tokens": 438111.0, "step": 245 }, { "entropy": 7.718148136138916, "epoch": 0.012859090090785176, "grad_norm": 1.3046875, "learning_rate": 0.0001245, "loss": 7.2826, "mean_token_accuracy": 0.07801055312156677, "num_tokens": 447352.0, "step": 250 }, { "entropy": 7.834936952590942, "epoch": 0.01311627189260088, "grad_norm": 1.2421875, "learning_rate": 0.000127, "loss": 7.2718, "mean_token_accuracy": 0.08380828946828842, "num_tokens": 456118.0, "step": 255 }, { "entropy": 7.78115496635437, "epoch": 0.013373453694416584, "grad_norm": 1.3359375, "learning_rate": 0.0001295, "loss": 7.3091, "mean_token_accuracy": 0.0782765805721283, "num_tokens": 465016.0, "step": 260 }, { "entropy": 7.746971464157104, "epoch": 0.013630635496232286, "grad_norm": 1.234375, "learning_rate": 0.000132, "loss": 7.2129, "mean_token_accuracy": 0.0813664972782135, "num_tokens": 473828.0, "step": 265 }, { "entropy": 7.73144416809082, "epoch": 0.01388781729804799, "grad_norm": 1.125, "learning_rate": 0.00013450000000000002, "loss": 7.1867, "mean_token_accuracy": 0.08951399773359299, "num_tokens": 482481.0, "step": 270 }, { "entropy": 7.821958923339844, "epoch": 0.014144999099863694, "grad_norm": 1.34375, "learning_rate": 0.00013700000000000002, "loss": 7.2565, "mean_token_accuracy": 0.08631709441542626, "num_tokens": 491784.0, "step": 275 }, { "entropy": 7.713495445251465, "epoch": 0.014402180901679397, "grad_norm": 1.421875, "learning_rate": 0.0001395, "loss": 7.3491, "mean_token_accuracy": 0.0803300604224205, "num_tokens": 501227.0, "step": 280 }, { "entropy": 7.609055280685425, "epoch": 0.014659362703495101, "grad_norm": 1.6640625, "learning_rate": 0.00014199999999999998, "loss": 7.1247, "mean_token_accuracy": 0.0826262541115284, "num_tokens": 509566.0, "step": 285 }, { "entropy": 7.692761611938477, "epoch": 0.014916544505310804, "grad_norm": 1.3984375, "learning_rate": 0.0001445, "loss": 7.1787, "mean_token_accuracy": 0.09211432188749313, "num_tokens": 517517.0, "step": 290 }, { "entropy": 7.6960266590118405, "epoch": 0.015173726307126508, "grad_norm": 1.21875, "learning_rate": 0.000147, "loss": 7.2176, "mean_token_accuracy": 0.0820289522409439, "num_tokens": 526279.0, "step": 295 }, { "entropy": 7.665759134292602, "epoch": 0.015430908108942211, "grad_norm": 1.171875, "learning_rate": 0.0001495, "loss": 7.1406, "mean_token_accuracy": 0.0928925946354866, "num_tokens": 534516.0, "step": 300 }, { "entropy": 7.661193418502807, "epoch": 0.015688089910757916, "grad_norm": 1.3671875, "learning_rate": 0.000152, "loss": 7.2216, "mean_token_accuracy": 0.08248281478881836, "num_tokens": 543828.0, "step": 305 }, { "entropy": 7.662406015396118, "epoch": 0.01594527171257362, "grad_norm": 1.2734375, "learning_rate": 0.00015450000000000001, "loss": 7.1559, "mean_token_accuracy": 0.08263281881809234, "num_tokens": 552530.0, "step": 310 }, { "entropy": 7.536833572387695, "epoch": 0.01620245351438932, "grad_norm": 1.359375, "learning_rate": 0.000157, "loss": 7.1062, "mean_token_accuracy": 0.08527780249714852, "num_tokens": 561475.0, "step": 315 }, { "entropy": 7.684497308731079, "epoch": 0.016459635316205024, "grad_norm": 1.4609375, "learning_rate": 0.0001595, "loss": 7.1742, "mean_token_accuracy": 0.08275718316435814, "num_tokens": 569852.0, "step": 320 }, { "entropy": 7.586278247833252, "epoch": 0.01671681711802073, "grad_norm": 1.203125, "learning_rate": 0.000162, "loss": 7.2073, "mean_token_accuracy": 0.08587946742773056, "num_tokens": 578326.0, "step": 325 }, { "entropy": 7.664967060089111, "epoch": 0.016973998919836433, "grad_norm": 1.1484375, "learning_rate": 0.00016450000000000001, "loss": 7.238, "mean_token_accuracy": 0.08378956839442253, "num_tokens": 587606.0, "step": 330 }, { "entropy": 7.510732364654541, "epoch": 0.017231180721652136, "grad_norm": 1.3828125, "learning_rate": 0.00016700000000000002, "loss": 6.9636, "mean_token_accuracy": 0.09541863054037095, "num_tokens": 595321.0, "step": 335 }, { "entropy": 7.525554895401001, "epoch": 0.01748836252346784, "grad_norm": 1.1875, "learning_rate": 0.00016950000000000003, "loss": 7.0757, "mean_token_accuracy": 0.08646541684865952, "num_tokens": 603836.0, "step": 340 }, { "entropy": 7.485527229309082, "epoch": 0.01774554432528354, "grad_norm": 1.359375, "learning_rate": 0.00017199999999999998, "loss": 7.0746, "mean_token_accuracy": 0.08882175087928772, "num_tokens": 612847.0, "step": 345 }, { "entropy": 7.5213652610778805, "epoch": 0.018002726127099248, "grad_norm": 1.2734375, "learning_rate": 0.00017449999999999999, "loss": 7.1177, "mean_token_accuracy": 0.08585901409387589, "num_tokens": 620840.0, "step": 350 }, { "entropy": 7.538561153411865, "epoch": 0.01825990792891495, "grad_norm": 1.4140625, "learning_rate": 0.000177, "loss": 7.0237, "mean_token_accuracy": 0.09108547568321228, "num_tokens": 629495.0, "step": 355 }, { "entropy": 7.50935378074646, "epoch": 0.018517089730730654, "grad_norm": 1.203125, "learning_rate": 0.0001795, "loss": 7.1784, "mean_token_accuracy": 0.08739718049764633, "num_tokens": 638589.0, "step": 360 }, { "entropy": 7.4144041538238525, "epoch": 0.018774271532546356, "grad_norm": 1.2890625, "learning_rate": 0.000182, "loss": 7.05, "mean_token_accuracy": 0.08531938642263412, "num_tokens": 647713.0, "step": 365 }, { "entropy": 7.665746688842773, "epoch": 0.01903145333436206, "grad_norm": 1.40625, "learning_rate": 0.0001845, "loss": 7.1511, "mean_token_accuracy": 0.08770897537469864, "num_tokens": 656472.0, "step": 370 }, { "entropy": 7.371031093597412, "epoch": 0.019288635136177765, "grad_norm": 1.5625, "learning_rate": 0.000187, "loss": 7.0004, "mean_token_accuracy": 0.09101735278964043, "num_tokens": 664858.0, "step": 375 }, { "entropy": 7.439912271499634, "epoch": 0.019545816937993468, "grad_norm": 1.1796875, "learning_rate": 0.0001895, "loss": 7.0322, "mean_token_accuracy": 0.09086323380470276, "num_tokens": 673675.0, "step": 380 }, { "entropy": 7.4977442741394045, "epoch": 0.01980299873980917, "grad_norm": 1.3046875, "learning_rate": 0.000192, "loss": 7.1526, "mean_token_accuracy": 0.0906866118311882, "num_tokens": 681968.0, "step": 385 }, { "entropy": 7.431271123886108, "epoch": 0.020060180541624874, "grad_norm": 1.1640625, "learning_rate": 0.0001945, "loss": 7.0089, "mean_token_accuracy": 0.09397086799144745, "num_tokens": 690447.0, "step": 390 }, { "entropy": 7.5096940994262695, "epoch": 0.020317362343440577, "grad_norm": 1.1953125, "learning_rate": 0.00019700000000000002, "loss": 7.0298, "mean_token_accuracy": 0.09151682630181313, "num_tokens": 699659.0, "step": 395 }, { "entropy": 7.40989465713501, "epoch": 0.020574544145256283, "grad_norm": 1.4921875, "learning_rate": 0.00019950000000000002, "loss": 7.0506, "mean_token_accuracy": 0.09182499945163727, "num_tokens": 708342.0, "step": 400 }, { "entropy": 7.437063407897949, "epoch": 0.020831725947071986, "grad_norm": 1.2421875, "learning_rate": 0.000202, "loss": 7.0589, "mean_token_accuracy": 0.08685924187302589, "num_tokens": 717986.0, "step": 405 }, { "entropy": 7.506326389312744, "epoch": 0.02108890774888769, "grad_norm": 1.1875, "learning_rate": 0.00020449999999999998, "loss": 7.0868, "mean_token_accuracy": 0.08464771658182144, "num_tokens": 727397.0, "step": 410 }, { "entropy": 7.389501142501831, "epoch": 0.02134608955070339, "grad_norm": 1.109375, "learning_rate": 0.000207, "loss": 7.0421, "mean_token_accuracy": 0.09134713932871819, "num_tokens": 736291.0, "step": 415 }, { "entropy": 7.398612976074219, "epoch": 0.021603271352519094, "grad_norm": 1.3046875, "learning_rate": 0.0002095, "loss": 7.0983, "mean_token_accuracy": 0.08749841973185539, "num_tokens": 745132.0, "step": 420 }, { "entropy": 7.387109804153442, "epoch": 0.0218604531543348, "grad_norm": 1.359375, "learning_rate": 0.000212, "loss": 6.9801, "mean_token_accuracy": 0.09526508301496506, "num_tokens": 753535.0, "step": 425 }, { "entropy": 7.287825727462769, "epoch": 0.022117634956150503, "grad_norm": 1.34375, "learning_rate": 0.0002145, "loss": 6.8881, "mean_token_accuracy": 0.09665613695979118, "num_tokens": 762626.0, "step": 430 }, { "entropy": 7.425317716598511, "epoch": 0.022374816757966206, "grad_norm": 1.265625, "learning_rate": 0.00021700000000000002, "loss": 7.0183, "mean_token_accuracy": 0.08952494263648987, "num_tokens": 771802.0, "step": 435 }, { "entropy": 7.3904194831848145, "epoch": 0.02263199855978191, "grad_norm": 1.109375, "learning_rate": 0.0002195, "loss": 7.055, "mean_token_accuracy": 0.09687120616436004, "num_tokens": 780444.0, "step": 440 }, { "entropy": 7.46030330657959, "epoch": 0.022889180361597615, "grad_norm": 1.28125, "learning_rate": 0.000222, "loss": 7.0891, "mean_token_accuracy": 0.08583850935101509, "num_tokens": 789335.0, "step": 445 }, { "entropy": 7.254354047775268, "epoch": 0.023146362163413318, "grad_norm": 1.3828125, "learning_rate": 0.0002245, "loss": 6.9291, "mean_token_accuracy": 0.09709356278181076, "num_tokens": 797891.0, "step": 450 }, { "entropy": 7.221427774429321, "epoch": 0.02340354396522902, "grad_norm": 1.328125, "learning_rate": 0.00022700000000000002, "loss": 6.9026, "mean_token_accuracy": 0.09430735632777214, "num_tokens": 806238.0, "step": 455 }, { "entropy": 7.3990577220916744, "epoch": 0.023660725767044723, "grad_norm": 1.4765625, "learning_rate": 0.00022950000000000002, "loss": 6.9081, "mean_token_accuracy": 0.09148178026080131, "num_tokens": 814430.0, "step": 460 }, { "entropy": 7.347194242477417, "epoch": 0.023917907568860426, "grad_norm": 1.140625, "learning_rate": 0.00023200000000000003, "loss": 7.0802, "mean_token_accuracy": 0.08918680474162102, "num_tokens": 823546.0, "step": 465 }, { "entropy": 7.322706604003907, "epoch": 0.024175089370676132, "grad_norm": 1.3203125, "learning_rate": 0.00023449999999999998, "loss": 6.8709, "mean_token_accuracy": 0.0952567420899868, "num_tokens": 832885.0, "step": 470 }, { "entropy": 7.260769939422607, "epoch": 0.024432271172491835, "grad_norm": 1.171875, "learning_rate": 0.000237, "loss": 6.8382, "mean_token_accuracy": 0.09813853800296783, "num_tokens": 841140.0, "step": 475 }, { "entropy": 7.244242477416992, "epoch": 0.024689452974307538, "grad_norm": 1.5703125, "learning_rate": 0.0002395, "loss": 6.9147, "mean_token_accuracy": 0.09300818815827369, "num_tokens": 849768.0, "step": 480 }, { "entropy": 7.25398006439209, "epoch": 0.02494663477612324, "grad_norm": 1.09375, "learning_rate": 0.000242, "loss": 6.8165, "mean_token_accuracy": 0.09476587101817131, "num_tokens": 859080.0, "step": 485 }, { "entropy": 7.220676612854004, "epoch": 0.025203816577938944, "grad_norm": 1.1328125, "learning_rate": 0.0002445, "loss": 6.9026, "mean_token_accuracy": 0.0947590596973896, "num_tokens": 868624.0, "step": 490 }, { "entropy": 7.27272310256958, "epoch": 0.02546099837975465, "grad_norm": 1.15625, "learning_rate": 0.000247, "loss": 6.893, "mean_token_accuracy": 0.09338614419102668, "num_tokens": 877592.0, "step": 495 }, { "entropy": 7.275995779037475, "epoch": 0.025718180181570353, "grad_norm": 1.2578125, "learning_rate": 0.0002495, "loss": 6.8668, "mean_token_accuracy": 0.09461153075098991, "num_tokens": 886470.0, "step": 500 }, { "entropy": 7.182675886154175, "epoch": 0.025975361983386056, "grad_norm": 1.203125, "learning_rate": 0.000252, "loss": 6.9033, "mean_token_accuracy": 0.09226062297821044, "num_tokens": 895940.0, "step": 505 }, { "entropy": 7.2134950160980225, "epoch": 0.02623254378520176, "grad_norm": 1.1328125, "learning_rate": 0.0002545, "loss": 6.9523, "mean_token_accuracy": 0.09598998427391052, "num_tokens": 905344.0, "step": 510 }, { "entropy": 7.144832706451416, "epoch": 0.02648972558701746, "grad_norm": 1.28125, "learning_rate": 0.000257, "loss": 6.8974, "mean_token_accuracy": 0.09212475568056107, "num_tokens": 914323.0, "step": 515 }, { "entropy": 7.195075178146363, "epoch": 0.026746907388833167, "grad_norm": 1.3515625, "learning_rate": 0.0002595, "loss": 6.8358, "mean_token_accuracy": 0.0931648664176464, "num_tokens": 922913.0, "step": 520 }, { "entropy": 7.201556158065796, "epoch": 0.02700408919064887, "grad_norm": 1.2109375, "learning_rate": 0.000262, "loss": 6.9151, "mean_token_accuracy": 0.08820494934916497, "num_tokens": 931487.0, "step": 525 }, { "entropy": 7.12173867225647, "epoch": 0.027261270992464573, "grad_norm": 1.25, "learning_rate": 0.00026450000000000003, "loss": 6.8622, "mean_token_accuracy": 0.09719429761171341, "num_tokens": 939694.0, "step": 530 }, { "entropy": 7.300619316101074, "epoch": 0.027518452794280276, "grad_norm": 1.3203125, "learning_rate": 0.00026700000000000004, "loss": 6.8258, "mean_token_accuracy": 0.1024305358529091, "num_tokens": 948437.0, "step": 535 }, { "entropy": 7.087061405181885, "epoch": 0.02777563459609598, "grad_norm": 1.359375, "learning_rate": 0.00026950000000000005, "loss": 6.7424, "mean_token_accuracy": 0.09930474832653999, "num_tokens": 957490.0, "step": 540 }, { "entropy": 6.975574159622193, "epoch": 0.028032816397911685, "grad_norm": 1.2109375, "learning_rate": 0.00027200000000000005, "loss": 6.6873, "mean_token_accuracy": 0.10134570002555847, "num_tokens": 966077.0, "step": 545 }, { "entropy": 7.103092670440674, "epoch": 0.028289998199727388, "grad_norm": 1.1875, "learning_rate": 0.0002745, "loss": 6.7758, "mean_token_accuracy": 0.09924016520380974, "num_tokens": 974788.0, "step": 550 }, { "entropy": 7.049304628372193, "epoch": 0.02854718000154309, "grad_norm": 1.453125, "learning_rate": 0.000277, "loss": 6.8437, "mean_token_accuracy": 0.09455109983682633, "num_tokens": 983645.0, "step": 555 }, { "entropy": 7.199927759170532, "epoch": 0.028804361803358793, "grad_norm": 1.3984375, "learning_rate": 0.0002795, "loss": 6.8972, "mean_token_accuracy": 0.09381847679615021, "num_tokens": 991795.0, "step": 560 }, { "entropy": 7.130536651611328, "epoch": 0.0290615436051745, "grad_norm": 1.234375, "learning_rate": 0.00028199999999999997, "loss": 6.8817, "mean_token_accuracy": 0.0921133041381836, "num_tokens": 1000732.0, "step": 565 }, { "entropy": 7.128713464736938, "epoch": 0.029318725406990202, "grad_norm": 1.2421875, "learning_rate": 0.0002845, "loss": 6.7298, "mean_token_accuracy": 0.10322466343641282, "num_tokens": 1009016.0, "step": 570 }, { "entropy": 7.071855258941651, "epoch": 0.029575907208805905, "grad_norm": 1.28125, "learning_rate": 0.000287, "loss": 6.8085, "mean_token_accuracy": 0.10027840360999107, "num_tokens": 1017497.0, "step": 575 }, { "entropy": 7.045392799377441, "epoch": 0.029833089010621608, "grad_norm": 1.390625, "learning_rate": 0.0002895, "loss": 6.7627, "mean_token_accuracy": 0.09184609279036522, "num_tokens": 1026437.0, "step": 580 }, { "entropy": 7.177649688720703, "epoch": 0.03009027081243731, "grad_norm": 1.4375, "learning_rate": 0.000292, "loss": 6.7745, "mean_token_accuracy": 0.10040023326873779, "num_tokens": 1034621.0, "step": 585 }, { "entropy": 7.030013942718506, "epoch": 0.030347452614253017, "grad_norm": 1.140625, "learning_rate": 0.0002945, "loss": 6.8522, "mean_token_accuracy": 0.09577706381678582, "num_tokens": 1043665.0, "step": 590 }, { "entropy": 7.080531978607178, "epoch": 0.03060463441606872, "grad_norm": 1.359375, "learning_rate": 0.000297, "loss": 6.8845, "mean_token_accuracy": 0.09267403185367584, "num_tokens": 1052891.0, "step": 595 }, { "entropy": 7.106464290618897, "epoch": 0.030861816217884423, "grad_norm": 1.3984375, "learning_rate": 0.0002995, "loss": 6.7591, "mean_token_accuracy": 0.10866603180766106, "num_tokens": 1060520.0, "step": 600 }, { "entropy": 7.065040636062622, "epoch": 0.031118998019700125, "grad_norm": 1.3671875, "learning_rate": 0.000302, "loss": 6.7758, "mean_token_accuracy": 0.09805820658802986, "num_tokens": 1069150.0, "step": 605 }, { "entropy": 6.90897569656372, "epoch": 0.03137617982151583, "grad_norm": 1.3203125, "learning_rate": 0.0003045, "loss": 6.6602, "mean_token_accuracy": 0.10792294815182686, "num_tokens": 1077015.0, "step": 610 }, { "entropy": 6.989263916015625, "epoch": 0.03163336162333153, "grad_norm": 1.2421875, "learning_rate": 0.000307, "loss": 6.732, "mean_token_accuracy": 0.09874670803546906, "num_tokens": 1085630.0, "step": 615 }, { "entropy": 7.091088914871216, "epoch": 0.03189054342514724, "grad_norm": 1.3125, "learning_rate": 0.0003095, "loss": 6.8404, "mean_token_accuracy": 0.093934640660882, "num_tokens": 1094423.0, "step": 620 }, { "entropy": 6.986142826080322, "epoch": 0.032147725226962943, "grad_norm": 1.1328125, "learning_rate": 0.000312, "loss": 6.7539, "mean_token_accuracy": 0.09798811599612237, "num_tokens": 1103049.0, "step": 625 }, { "entropy": 7.063631439208985, "epoch": 0.03240490702877864, "grad_norm": 1.375, "learning_rate": 0.0003145, "loss": 6.7592, "mean_token_accuracy": 0.09810860157012939, "num_tokens": 1111852.0, "step": 630 }, { "entropy": 6.935723733901978, "epoch": 0.03266208883059435, "grad_norm": 1.296875, "learning_rate": 0.000317, "loss": 6.6757, "mean_token_accuracy": 0.09773161709308624, "num_tokens": 1121545.0, "step": 635 }, { "entropy": 6.963910818099976, "epoch": 0.03291927063241005, "grad_norm": 1.140625, "learning_rate": 0.0003195, "loss": 6.6986, "mean_token_accuracy": 0.0950073927640915, "num_tokens": 1130639.0, "step": 640 }, { "entropy": 6.92723650932312, "epoch": 0.033176452434225755, "grad_norm": 1.171875, "learning_rate": 0.000322, "loss": 6.6173, "mean_token_accuracy": 0.10274656191468239, "num_tokens": 1138741.0, "step": 645 }, { "entropy": 6.957373142242432, "epoch": 0.03343363423604146, "grad_norm": 1.2578125, "learning_rate": 0.00032450000000000003, "loss": 6.7487, "mean_token_accuracy": 0.10246102660894393, "num_tokens": 1146985.0, "step": 650 }, { "entropy": 6.968684911727905, "epoch": 0.03369081603785716, "grad_norm": 1.2734375, "learning_rate": 0.00032700000000000003, "loss": 6.6421, "mean_token_accuracy": 0.10296816006302834, "num_tokens": 1155393.0, "step": 655 }, { "entropy": 7.074275159835816, "epoch": 0.03394799783967287, "grad_norm": 1.359375, "learning_rate": 0.00032950000000000004, "loss": 6.7709, "mean_token_accuracy": 0.09904137998819351, "num_tokens": 1164285.0, "step": 660 }, { "entropy": 6.8998229026794435, "epoch": 0.034205179641488566, "grad_norm": 1.1875, "learning_rate": 0.00033200000000000005, "loss": 6.7359, "mean_token_accuracy": 0.10153986811637879, "num_tokens": 1172997.0, "step": 665 }, { "entropy": 6.809995031356811, "epoch": 0.03446236144330427, "grad_norm": 1.3515625, "learning_rate": 0.00033450000000000005, "loss": 6.5043, "mean_token_accuracy": 0.10296982899308205, "num_tokens": 1182316.0, "step": 670 }, { "entropy": 6.95496187210083, "epoch": 0.03471954324511998, "grad_norm": 1.359375, "learning_rate": 0.000337, "loss": 6.7375, "mean_token_accuracy": 0.10285088196396827, "num_tokens": 1190660.0, "step": 675 }, { "entropy": 6.985808277130127, "epoch": 0.03497672504693568, "grad_norm": 1.25, "learning_rate": 0.0003395, "loss": 6.7359, "mean_token_accuracy": 0.10022683814167976, "num_tokens": 1199158.0, "step": 680 }, { "entropy": 6.826939868927002, "epoch": 0.035233906848751384, "grad_norm": 1.2734375, "learning_rate": 0.000342, "loss": 6.6363, "mean_token_accuracy": 0.10053048059344291, "num_tokens": 1208550.0, "step": 685 }, { "entropy": 6.928761577606201, "epoch": 0.03549108865056708, "grad_norm": 1.1875, "learning_rate": 0.00034449999999999997, "loss": 6.7171, "mean_token_accuracy": 0.09703745916485787, "num_tokens": 1218526.0, "step": 690 }, { "entropy": 6.970518112182617, "epoch": 0.03574827045238279, "grad_norm": 1.265625, "learning_rate": 0.000347, "loss": 6.8224, "mean_token_accuracy": 0.09267975017428398, "num_tokens": 1227247.0, "step": 695 }, { "entropy": 6.905700254440307, "epoch": 0.036005452254198496, "grad_norm": 1.21875, "learning_rate": 0.0003495, "loss": 6.7287, "mean_token_accuracy": 0.10465597808361053, "num_tokens": 1236146.0, "step": 700 }, { "entropy": 6.922169589996338, "epoch": 0.036262634056014195, "grad_norm": 1.234375, "learning_rate": 0.000352, "loss": 6.7667, "mean_token_accuracy": 0.1004488743841648, "num_tokens": 1244958.0, "step": 705 }, { "entropy": 6.962793493270874, "epoch": 0.0365198158578299, "grad_norm": 1.234375, "learning_rate": 0.0003545, "loss": 6.7626, "mean_token_accuracy": 0.09757086858153344, "num_tokens": 1254502.0, "step": 710 }, { "entropy": 6.917850494384766, "epoch": 0.0367769976596456, "grad_norm": 1.28125, "learning_rate": 0.000357, "loss": 6.691, "mean_token_accuracy": 0.10314588993787766, "num_tokens": 1263291.0, "step": 715 }, { "entropy": 6.852348566055298, "epoch": 0.03703417946146131, "grad_norm": 1.1875, "learning_rate": 0.0003595, "loss": 6.6744, "mean_token_accuracy": 0.10638380572199821, "num_tokens": 1272494.0, "step": 720 }, { "entropy": 6.917734289169312, "epoch": 0.03729136126327701, "grad_norm": 1.328125, "learning_rate": 0.000362, "loss": 6.8097, "mean_token_accuracy": 0.0955355480313301, "num_tokens": 1281611.0, "step": 725 }, { "entropy": 6.913245725631714, "epoch": 0.03754854306509271, "grad_norm": 1.125, "learning_rate": 0.0003645, "loss": 6.6715, "mean_token_accuracy": 0.09784635901451111, "num_tokens": 1291512.0, "step": 730 }, { "entropy": 6.8256752490997314, "epoch": 0.03780572486690842, "grad_norm": 1.2421875, "learning_rate": 0.000367, "loss": 6.5595, "mean_token_accuracy": 0.10571763291954994, "num_tokens": 1300413.0, "step": 735 }, { "entropy": 6.930764818191529, "epoch": 0.03806290666872412, "grad_norm": 1.2421875, "learning_rate": 0.0003695, "loss": 6.7698, "mean_token_accuracy": 0.09721217602491379, "num_tokens": 1309524.0, "step": 740 }, { "entropy": 6.896268653869629, "epoch": 0.038320088470539825, "grad_norm": 1.140625, "learning_rate": 0.000372, "loss": 6.6535, "mean_token_accuracy": 0.10513104945421219, "num_tokens": 1318128.0, "step": 745 }, { "entropy": 6.851891374588012, "epoch": 0.03857727027235553, "grad_norm": 1.2734375, "learning_rate": 0.0003745, "loss": 6.7028, "mean_token_accuracy": 0.09935224205255508, "num_tokens": 1326705.0, "step": 750 }, { "entropy": 6.729863882064819, "epoch": 0.03883445207417123, "grad_norm": 1.234375, "learning_rate": 0.000377, "loss": 6.5243, "mean_token_accuracy": 0.10701719000935554, "num_tokens": 1335271.0, "step": 755 }, { "entropy": 6.829174661636353, "epoch": 0.039091633875986936, "grad_norm": 1.359375, "learning_rate": 0.0003795, "loss": 6.5755, "mean_token_accuracy": 0.10041920840740204, "num_tokens": 1343944.0, "step": 760 }, { "entropy": 6.730857849121094, "epoch": 0.039348815677802636, "grad_norm": 1.1796875, "learning_rate": 0.000382, "loss": 6.5869, "mean_token_accuracy": 0.10631005689501763, "num_tokens": 1352294.0, "step": 765 }, { "entropy": 6.8131995677948, "epoch": 0.03960599747961834, "grad_norm": 1.359375, "learning_rate": 0.0003845, "loss": 6.6112, "mean_token_accuracy": 0.10081271678209305, "num_tokens": 1360533.0, "step": 770 }, { "entropy": 6.826685190200806, "epoch": 0.03986317928143405, "grad_norm": 1.28125, "learning_rate": 0.00038700000000000003, "loss": 6.5435, "mean_token_accuracy": 0.10690599977970124, "num_tokens": 1368880.0, "step": 775 }, { "entropy": 6.743242073059082, "epoch": 0.04012036108324975, "grad_norm": 1.203125, "learning_rate": 0.00038950000000000003, "loss": 6.568, "mean_token_accuracy": 0.10478584542870521, "num_tokens": 1377226.0, "step": 780 }, { "entropy": 6.831422472000122, "epoch": 0.040377542885065454, "grad_norm": 1.296875, "learning_rate": 0.00039200000000000004, "loss": 6.6902, "mean_token_accuracy": 0.1015243612229824, "num_tokens": 1386196.0, "step": 785 }, { "entropy": 6.745612382888794, "epoch": 0.04063472468688115, "grad_norm": 1.2109375, "learning_rate": 0.00039450000000000005, "loss": 6.6026, "mean_token_accuracy": 0.10642225667834282, "num_tokens": 1395019.0, "step": 790 }, { "entropy": 6.7675634860992435, "epoch": 0.04089190648869686, "grad_norm": 1.296875, "learning_rate": 0.00039700000000000005, "loss": 6.7062, "mean_token_accuracy": 0.10018283650279045, "num_tokens": 1404120.0, "step": 795 }, { "entropy": 6.898847818374634, "epoch": 0.041149088290512566, "grad_norm": 1.2421875, "learning_rate": 0.0003995, "loss": 6.5752, "mean_token_accuracy": 0.0967138335108757, "num_tokens": 1412812.0, "step": 800 }, { "entropy": 6.683012008666992, "epoch": 0.041406270092328265, "grad_norm": 1.0859375, "learning_rate": 0.000402, "loss": 6.5476, "mean_token_accuracy": 0.10471888035535812, "num_tokens": 1421439.0, "step": 805 }, { "entropy": 6.711639165878296, "epoch": 0.04166345189414397, "grad_norm": 1.1953125, "learning_rate": 0.0004045, "loss": 6.5496, "mean_token_accuracy": 0.10460042878985405, "num_tokens": 1429882.0, "step": 810 }, { "entropy": 6.719864559173584, "epoch": 0.04192063369595967, "grad_norm": 1.21875, "learning_rate": 0.00040699999999999997, "loss": 6.5972, "mean_token_accuracy": 0.10305096060037613, "num_tokens": 1438918.0, "step": 815 }, { "entropy": 6.770114183425903, "epoch": 0.04217781549777538, "grad_norm": 1.2578125, "learning_rate": 0.0004095, "loss": 6.7244, "mean_token_accuracy": 0.09797946363687515, "num_tokens": 1448337.0, "step": 820 }, { "entropy": 6.901697778701783, "epoch": 0.04243499729959108, "grad_norm": 1.28125, "learning_rate": 0.000412, "loss": 6.6691, "mean_token_accuracy": 0.10322674512863159, "num_tokens": 1457928.0, "step": 825 }, { "entropy": 6.765479469299317, "epoch": 0.04269217910140678, "grad_norm": 1.25, "learning_rate": 0.0004145, "loss": 6.6076, "mean_token_accuracy": 0.11027010977268219, "num_tokens": 1467022.0, "step": 830 }, { "entropy": 6.64197793006897, "epoch": 0.04294936090322249, "grad_norm": 1.09375, "learning_rate": 0.000417, "loss": 6.5992, "mean_token_accuracy": 0.10252309665083885, "num_tokens": 1476510.0, "step": 835 }, { "entropy": 6.800649499893188, "epoch": 0.04320654270503819, "grad_norm": 1.1484375, "learning_rate": 0.0004195, "loss": 6.5706, "mean_token_accuracy": 0.10807883217930794, "num_tokens": 1485141.0, "step": 840 }, { "entropy": 6.722679805755615, "epoch": 0.043463724506853894, "grad_norm": 1.3125, "learning_rate": 0.000422, "loss": 6.6423, "mean_token_accuracy": 0.10095877721905708, "num_tokens": 1494343.0, "step": 845 }, { "entropy": 6.649412488937378, "epoch": 0.0437209063086696, "grad_norm": 1.1171875, "learning_rate": 0.0004245, "loss": 6.5835, "mean_token_accuracy": 0.10432918965816498, "num_tokens": 1503753.0, "step": 850 }, { "entropy": 6.760374069213867, "epoch": 0.0439780881104853, "grad_norm": 1.1875, "learning_rate": 0.000427, "loss": 6.6178, "mean_token_accuracy": 0.09621104225516319, "num_tokens": 1512434.0, "step": 855 }, { "entropy": 6.713858127593994, "epoch": 0.044235269912301006, "grad_norm": 1.265625, "learning_rate": 0.0004295, "loss": 6.4808, "mean_token_accuracy": 0.10826214924454688, "num_tokens": 1521201.0, "step": 860 }, { "entropy": 6.593627119064331, "epoch": 0.04449245171411671, "grad_norm": 1.2734375, "learning_rate": 0.000432, "loss": 6.5988, "mean_token_accuracy": 0.10316284075379371, "num_tokens": 1529958.0, "step": 865 }, { "entropy": 6.778238105773926, "epoch": 0.04474963351593241, "grad_norm": 1.125, "learning_rate": 0.0004345, "loss": 6.5475, "mean_token_accuracy": 0.10538713037967681, "num_tokens": 1539524.0, "step": 870 }, { "entropy": 6.572915077209473, "epoch": 0.04500681531774812, "grad_norm": 1.140625, "learning_rate": 0.000437, "loss": 6.4783, "mean_token_accuracy": 0.10733042433857917, "num_tokens": 1547955.0, "step": 875 }, { "entropy": 6.661984968185425, "epoch": 0.04526399711956382, "grad_norm": 1.2578125, "learning_rate": 0.0004395, "loss": 6.5371, "mean_token_accuracy": 0.10633926317095757, "num_tokens": 1557401.0, "step": 880 }, { "entropy": 6.592761278152466, "epoch": 0.045521178921379524, "grad_norm": 1.265625, "learning_rate": 0.000442, "loss": 6.5084, "mean_token_accuracy": 0.10569668263196945, "num_tokens": 1566022.0, "step": 885 }, { "entropy": 6.636467218399048, "epoch": 0.04577836072319523, "grad_norm": 1.171875, "learning_rate": 0.0004445, "loss": 6.5551, "mean_token_accuracy": 0.10752687007188796, "num_tokens": 1575035.0, "step": 890 }, { "entropy": 6.695861721038819, "epoch": 0.04603554252501093, "grad_norm": 1.140625, "learning_rate": 0.000447, "loss": 6.5778, "mean_token_accuracy": 0.10746671482920647, "num_tokens": 1583357.0, "step": 895 }, { "entropy": 6.70294976234436, "epoch": 0.046292724326826636, "grad_norm": 1.1875, "learning_rate": 0.00044950000000000003, "loss": 6.3892, "mean_token_accuracy": 0.11069994270801545, "num_tokens": 1591702.0, "step": 900 }, { "entropy": 6.617056608200073, "epoch": 0.046549906128642335, "grad_norm": 1.1171875, "learning_rate": 0.00045200000000000004, "loss": 6.4792, "mean_token_accuracy": 0.11211444064974785, "num_tokens": 1600562.0, "step": 905 }, { "entropy": 6.684534406661987, "epoch": 0.04680708793045804, "grad_norm": 1.0625, "learning_rate": 0.00045450000000000004, "loss": 6.6204, "mean_token_accuracy": 0.10558928847312928, "num_tokens": 1610139.0, "step": 910 }, { "entropy": 6.765460586547851, "epoch": 0.04706426973227375, "grad_norm": 1.2734375, "learning_rate": 0.00045700000000000005, "loss": 6.6139, "mean_token_accuracy": 0.10323682352900505, "num_tokens": 1619464.0, "step": 915 }, { "entropy": 6.656091642379761, "epoch": 0.04732145153408945, "grad_norm": 1.1171875, "learning_rate": 0.00045950000000000006, "loss": 6.4596, "mean_token_accuracy": 0.1120453879237175, "num_tokens": 1628632.0, "step": 920 }, { "entropy": 6.445028781890869, "epoch": 0.04757863333590515, "grad_norm": 1.265625, "learning_rate": 0.000462, "loss": 6.4023, "mean_token_accuracy": 0.11046137437224388, "num_tokens": 1636855.0, "step": 925 }, { "entropy": 6.55358853340149, "epoch": 0.04783581513772085, "grad_norm": 1.1484375, "learning_rate": 0.0004645, "loss": 6.3969, "mean_token_accuracy": 0.11445706561207772, "num_tokens": 1645204.0, "step": 930 }, { "entropy": 6.668329048156738, "epoch": 0.04809299693953656, "grad_norm": 1.203125, "learning_rate": 0.000467, "loss": 6.5778, "mean_token_accuracy": 0.10868966206908226, "num_tokens": 1654231.0, "step": 935 }, { "entropy": 6.57129602432251, "epoch": 0.048350178741352265, "grad_norm": 1.1953125, "learning_rate": 0.0004695, "loss": 6.5478, "mean_token_accuracy": 0.1099221870303154, "num_tokens": 1663312.0, "step": 940 }, { "entropy": 6.630906820297241, "epoch": 0.048607360543167964, "grad_norm": 1.0859375, "learning_rate": 0.000472, "loss": 6.5729, "mean_token_accuracy": 0.10720053240656853, "num_tokens": 1672672.0, "step": 945 }, { "entropy": 6.701202535629273, "epoch": 0.04886454234498367, "grad_norm": 1.2421875, "learning_rate": 0.0004745, "loss": 6.6146, "mean_token_accuracy": 0.10442524701356888, "num_tokens": 1681497.0, "step": 950 }, { "entropy": 6.558098268508911, "epoch": 0.04912172414679937, "grad_norm": 1.203125, "learning_rate": 0.000477, "loss": 6.5076, "mean_token_accuracy": 0.10559550374746322, "num_tokens": 1690429.0, "step": 955 }, { "entropy": 6.602577352523804, "epoch": 0.049378905948615076, "grad_norm": 1.3125, "learning_rate": 0.0004795, "loss": 6.4754, "mean_token_accuracy": 0.11203035712242126, "num_tokens": 1698804.0, "step": 960 }, { "entropy": 6.621676778793335, "epoch": 0.04963608775043078, "grad_norm": 1.15625, "learning_rate": 0.000482, "loss": 6.5161, "mean_token_accuracy": 0.1092241458594799, "num_tokens": 1707309.0, "step": 965 }, { "entropy": 6.533698225021363, "epoch": 0.04989326955224648, "grad_norm": 1.171875, "learning_rate": 0.0004845, "loss": 6.4973, "mean_token_accuracy": 0.11040452271699905, "num_tokens": 1716163.0, "step": 970 }, { "entropy": 6.572607231140137, "epoch": 0.05015045135406219, "grad_norm": 1.109375, "learning_rate": 0.000487, "loss": 6.547, "mean_token_accuracy": 0.10961430817842484, "num_tokens": 1725316.0, "step": 975 }, { "entropy": 6.6284825801849365, "epoch": 0.05040763315587789, "grad_norm": 1.125, "learning_rate": 0.0004895, "loss": 6.5083, "mean_token_accuracy": 0.11171742677688598, "num_tokens": 1735193.0, "step": 980 }, { "entropy": 6.561748790740967, "epoch": 0.050664814957693594, "grad_norm": 1.1328125, "learning_rate": 0.000492, "loss": 6.4313, "mean_token_accuracy": 0.10571753829717637, "num_tokens": 1744624.0, "step": 985 }, { "entropy": 6.532333707809448, "epoch": 0.0509219967595093, "grad_norm": 1.171875, "learning_rate": 0.0004945, "loss": 6.4262, "mean_token_accuracy": 0.1134820282459259, "num_tokens": 1753566.0, "step": 990 }, { "entropy": 6.585614109039307, "epoch": 0.051179178561325, "grad_norm": 1.2734375, "learning_rate": 0.000497, "loss": 6.5563, "mean_token_accuracy": 0.10488807931542396, "num_tokens": 1762793.0, "step": 995 }, { "entropy": 6.60942120552063, "epoch": 0.051436360363140705, "grad_norm": 1.1328125, "learning_rate": 0.0004995, "loss": 6.5411, "mean_token_accuracy": 0.10642052963376045, "num_tokens": 1771511.0, "step": 1000 }, { "entropy": 6.607848262786865, "epoch": 0.051693542164956405, "grad_norm": 1.171875, "learning_rate": 0.000499998026082006, "loss": 6.5517, "mean_token_accuracy": 0.10087490379810334, "num_tokens": 1780230.0, "step": 1005 }, { "entropy": 6.517893648147583, "epoch": 0.05195072396677211, "grad_norm": 1.1640625, "learning_rate": 0.0004999900070995136, "loss": 6.4313, "mean_token_accuracy": 0.11181956753134728, "num_tokens": 1789372.0, "step": 1010 }, { "entropy": 6.466477012634277, "epoch": 0.05220790576858782, "grad_norm": 1.21875, "learning_rate": 0.0004999758199023239, "loss": 6.3947, "mean_token_accuracy": 0.11296560466289521, "num_tokens": 1798312.0, "step": 1015 }, { "entropy": 6.519049787521363, "epoch": 0.05246508757040352, "grad_norm": 1.2421875, "learning_rate": 0.0004999554648793858, "loss": 6.3971, "mean_token_accuracy": 0.11271054744720459, "num_tokens": 1806354.0, "step": 1020 }, { "entropy": 6.451335763931274, "epoch": 0.05272226937221922, "grad_norm": 1.265625, "learning_rate": 0.0004999289425887425, "loss": 6.4042, "mean_token_accuracy": 0.11678544953465461, "num_tokens": 1815366.0, "step": 1025 }, { "entropy": 6.533133411407471, "epoch": 0.05297945117403492, "grad_norm": 1.109375, "learning_rate": 0.0004998962537575161, "loss": 6.4659, "mean_token_accuracy": 0.1081003189086914, "num_tokens": 1824645.0, "step": 1030 }, { "entropy": 6.429107570648194, "epoch": 0.05323663297585063, "grad_norm": 1.03125, "learning_rate": 0.0004998573992818874, "loss": 6.4251, "mean_token_accuracy": 0.11395458430051804, "num_tokens": 1833166.0, "step": 1035 }, { "entropy": 6.645290565490723, "epoch": 0.053493814777666335, "grad_norm": 1.109375, "learning_rate": 0.0004998123802270715, "loss": 6.555, "mean_token_accuracy": 0.10978370234370231, "num_tokens": 1842390.0, "step": 1040 }, { "entropy": 6.419606733322143, "epoch": 0.053750996579482034, "grad_norm": 1.140625, "learning_rate": 0.0004997611978272886, "loss": 6.3838, "mean_token_accuracy": 0.1112293429672718, "num_tokens": 1851645.0, "step": 1045 }, { "entropy": 6.453891038894653, "epoch": 0.05400817838129774, "grad_norm": 1.2734375, "learning_rate": 0.0004997038534857298, "loss": 6.3782, "mean_token_accuracy": 0.11755769476294517, "num_tokens": 1860008.0, "step": 1050 }, { "entropy": 6.4972833633422855, "epoch": 0.05426536018311344, "grad_norm": 1.09375, "learning_rate": 0.0004996403487745194, "loss": 6.4343, "mean_token_accuracy": 0.1094091109931469, "num_tokens": 1869329.0, "step": 1055 }, { "entropy": 6.387360382080078, "epoch": 0.054522541984929146, "grad_norm": 1.0859375, "learning_rate": 0.000499570685434671, "loss": 6.3339, "mean_token_accuracy": 0.11642076373100281, "num_tokens": 1878054.0, "step": 1060 }, { "entropy": 6.484694147109986, "epoch": 0.05477972378674485, "grad_norm": 1.1171875, "learning_rate": 0.0004994948653760405, "loss": 6.3946, "mean_token_accuracy": 0.11390996798872947, "num_tokens": 1886581.0, "step": 1065 }, { "entropy": 6.580167531967163, "epoch": 0.05503690558856055, "grad_norm": 1.1328125, "learning_rate": 0.0004994128906772729, "loss": 6.4711, "mean_token_accuracy": 0.11259651854634285, "num_tokens": 1895731.0, "step": 1070 }, { "entropy": 6.423868322372437, "epoch": 0.05529408739037626, "grad_norm": 1.1015625, "learning_rate": 0.000499324763585746, "loss": 6.3499, "mean_token_accuracy": 0.11970952153205872, "num_tokens": 1904181.0, "step": 1075 }, { "entropy": 6.406012630462646, "epoch": 0.05555126919219196, "grad_norm": 1.0859375, "learning_rate": 0.0004992304865175085, "loss": 6.3772, "mean_token_accuracy": 0.11032988727092743, "num_tokens": 1913335.0, "step": 1080 }, { "entropy": 6.484732151031494, "epoch": 0.05580845099400766, "grad_norm": 1.15625, "learning_rate": 0.0004991300620572138, "loss": 6.3966, "mean_token_accuracy": 0.11090287342667579, "num_tokens": 1922789.0, "step": 1085 }, { "entropy": 6.436389446258545, "epoch": 0.05606563279582337, "grad_norm": 1.0859375, "learning_rate": 0.0004990234929580494, "loss": 6.3178, "mean_token_accuracy": 0.11508271917700767, "num_tokens": 1931214.0, "step": 1090 }, { "entropy": 6.433405256271362, "epoch": 0.05632281459763907, "grad_norm": 1.1015625, "learning_rate": 0.0004989107821416609, "loss": 6.4827, "mean_token_accuracy": 0.10500127375125885, "num_tokens": 1941151.0, "step": 1095 }, { "entropy": 6.4416193008422855, "epoch": 0.056579996399454775, "grad_norm": 1.1328125, "learning_rate": 0.0004987919326980723, "loss": 6.331, "mean_token_accuracy": 0.11337620094418525, "num_tokens": 1949326.0, "step": 1100 }, { "entropy": 6.514848232269287, "epoch": 0.05683717820127048, "grad_norm": 1.1171875, "learning_rate": 0.0004986669478856011, "loss": 6.4664, "mean_token_accuracy": 0.10760492980480194, "num_tokens": 1958929.0, "step": 1105 }, { "entropy": 6.39950590133667, "epoch": 0.05709436000308618, "grad_norm": 1.0703125, "learning_rate": 0.0004985358311307688, "loss": 6.2505, "mean_token_accuracy": 0.11898310258984565, "num_tokens": 1967690.0, "step": 1110 }, { "entropy": 6.384913921356201, "epoch": 0.05735154180490189, "grad_norm": 1.015625, "learning_rate": 0.0004983985860282081, "loss": 6.3981, "mean_token_accuracy": 0.11035036444664001, "num_tokens": 1977786.0, "step": 1115 }, { "entropy": 6.379779815673828, "epoch": 0.057608723606717586, "grad_norm": 1.0859375, "learning_rate": 0.0004982552163405623, "loss": 6.3107, "mean_token_accuracy": 0.11793362498283386, "num_tokens": 1986708.0, "step": 1120 }, { "entropy": 6.341381025314331, "epoch": 0.05786590540853329, "grad_norm": 1.078125, "learning_rate": 0.0004981057259983839, "loss": 6.3345, "mean_token_accuracy": 0.11417381316423417, "num_tokens": 1996309.0, "step": 1125 }, { "entropy": 6.446984195709229, "epoch": 0.058123087210349, "grad_norm": 1.140625, "learning_rate": 0.0004979501191000262, "loss": 6.2712, "mean_token_accuracy": 0.11331850737333297, "num_tokens": 2004754.0, "step": 1130 }, { "entropy": 6.322438764572143, "epoch": 0.0583802690121647, "grad_norm": 1.09375, "learning_rate": 0.0004977883999115311, "loss": 6.3644, "mean_token_accuracy": 0.11575946882367134, "num_tokens": 2013231.0, "step": 1135 }, { "entropy": 6.3898763179779055, "epoch": 0.058637450813980405, "grad_norm": 1.1328125, "learning_rate": 0.0004976205728665113, "loss": 6.3163, "mean_token_accuracy": 0.11673919707536698, "num_tokens": 2021918.0, "step": 1140 }, { "entropy": 6.395988273620605, "epoch": 0.058894632615796104, "grad_norm": 1.109375, "learning_rate": 0.0004974466425660307, "loss": 6.3607, "mean_token_accuracy": 0.1184878721833229, "num_tokens": 2030341.0, "step": 1145 }, { "entropy": 6.378729295730591, "epoch": 0.05915181441761181, "grad_norm": 1.1953125, "learning_rate": 0.0004972666137784759, "loss": 6.3114, "mean_token_accuracy": 0.11576305478811263, "num_tokens": 2038869.0, "step": 1150 }, { "entropy": 6.363564395904541, "epoch": 0.059408996219427516, "grad_norm": 1.09375, "learning_rate": 0.0004970804914394271, "loss": 6.3938, "mean_token_accuracy": 0.1138048842549324, "num_tokens": 2047545.0, "step": 1155 }, { "entropy": 6.406496477127075, "epoch": 0.059666178021243216, "grad_norm": 1.078125, "learning_rate": 0.0004968882806515225, "loss": 6.4462, "mean_token_accuracy": 0.11089355796575547, "num_tokens": 2056802.0, "step": 1160 }, { "entropy": 6.383754062652588, "epoch": 0.05992335982305892, "grad_norm": 1.1328125, "learning_rate": 0.0004966899866843177, "loss": 6.3043, "mean_token_accuracy": 0.11790038123726845, "num_tokens": 2065106.0, "step": 1165 }, { "entropy": 6.439864730834961, "epoch": 0.06018054162487462, "grad_norm": 1.0859375, "learning_rate": 0.000496485614974142, "loss": 6.3607, "mean_token_accuracy": 0.11016541495919227, "num_tokens": 2073723.0, "step": 1170 }, { "entropy": 6.336991977691651, "epoch": 0.06043772342669033, "grad_norm": 1.0859375, "learning_rate": 0.0004962751711239492, "loss": 6.2888, "mean_token_accuracy": 0.1206134170293808, "num_tokens": 2082296.0, "step": 1175 }, { "entropy": 6.377587127685547, "epoch": 0.060694905228506034, "grad_norm": 1.140625, "learning_rate": 0.0004960586609031636, "loss": 6.3447, "mean_token_accuracy": 0.11322090104222297, "num_tokens": 2091239.0, "step": 1180 }, { "entropy": 6.373478603363037, "epoch": 0.06095208703032173, "grad_norm": 1.09375, "learning_rate": 0.0004958360902475224, "loss": 6.3073, "mean_token_accuracy": 0.11865990906953812, "num_tokens": 2100809.0, "step": 1185 }, { "entropy": 6.37120213508606, "epoch": 0.06120926883213744, "grad_norm": 1.1953125, "learning_rate": 0.0004956074652589125, "loss": 6.3806, "mean_token_accuracy": 0.11596836000680924, "num_tokens": 2109373.0, "step": 1190 }, { "entropy": 6.386609125137329, "epoch": 0.06146645063395314, "grad_norm": 1.125, "learning_rate": 0.0004953727922052035, "loss": 6.335, "mean_token_accuracy": 0.1201685570180416, "num_tokens": 2117351.0, "step": 1195 }, { "entropy": 6.3725518703460695, "epoch": 0.061723632435768845, "grad_norm": 1.09375, "learning_rate": 0.0004951320775200756, "loss": 6.2876, "mean_token_accuracy": 0.12080588638782501, "num_tokens": 2125792.0, "step": 1200 }, { "entropy": 6.261738634109497, "epoch": 0.06198081423758455, "grad_norm": 1.0703125, "learning_rate": 0.0004948853278028436, "loss": 6.2851, "mean_token_accuracy": 0.12247317284345627, "num_tokens": 2134755.0, "step": 1205 }, { "entropy": 6.426895523071289, "epoch": 0.06223799603940025, "grad_norm": 1.171875, "learning_rate": 0.0004946325498182755, "loss": 6.2479, "mean_token_accuracy": 0.11313225403428077, "num_tokens": 2144063.0, "step": 1210 }, { "entropy": 6.373356294631958, "epoch": 0.06249517784121596, "grad_norm": 1.109375, "learning_rate": 0.0004943737504964076, "loss": 6.3527, "mean_token_accuracy": 0.11966249272227288, "num_tokens": 2153664.0, "step": 1215 }, { "entropy": 6.227408838272095, "epoch": 0.06275235964303166, "grad_norm": 1.1015625, "learning_rate": 0.000494108936932354, "loss": 6.1855, "mean_token_accuracy": 0.1191711500287056, "num_tokens": 2161797.0, "step": 1220 }, { "entropy": 6.517656993865967, "epoch": 0.06300954144484737, "grad_norm": 1.0859375, "learning_rate": 0.0004938381163861124, "loss": 6.3498, "mean_token_accuracy": 0.11286477893590927, "num_tokens": 2170312.0, "step": 1225 }, { "entropy": 6.230176687240601, "epoch": 0.06326672324666306, "grad_norm": 1.0859375, "learning_rate": 0.0004935612962823645, "loss": 6.3298, "mean_token_accuracy": 0.11120934784412384, "num_tokens": 2179850.0, "step": 1230 }, { "entropy": 6.308627033233643, "epoch": 0.06352390504847877, "grad_norm": 1.109375, "learning_rate": 0.0004932784842102739, "loss": 6.2072, "mean_token_accuracy": 0.11979541927576065, "num_tokens": 2189201.0, "step": 1235 }, { "entropy": 6.313740825653076, "epoch": 0.06378108685029447, "grad_norm": 0.984375, "learning_rate": 0.0004929896879232758, "loss": 6.3061, "mean_token_accuracy": 0.11951600462198257, "num_tokens": 2198362.0, "step": 1240 }, { "entropy": 6.322280406951904, "epoch": 0.06403826865211018, "grad_norm": 1.09375, "learning_rate": 0.0004926949153388668, "loss": 6.2858, "mean_token_accuracy": 0.1180046945810318, "num_tokens": 2207261.0, "step": 1245 }, { "entropy": 6.374325513839722, "epoch": 0.06429545045392589, "grad_norm": 1.0546875, "learning_rate": 0.0004923941745383859, "loss": 6.324, "mean_token_accuracy": 0.12014769464731216, "num_tokens": 2216293.0, "step": 1250 }, { "entropy": 6.248019790649414, "epoch": 0.06455263225574158, "grad_norm": 1.1796875, "learning_rate": 0.000492087473766794, "loss": 6.1756, "mean_token_accuracy": 0.12480147182941437, "num_tokens": 2224638.0, "step": 1255 }, { "entropy": 6.246414041519165, "epoch": 0.06480981405755729, "grad_norm": 1.140625, "learning_rate": 0.000491774821432448, "loss": 6.174, "mean_token_accuracy": 0.12405480146408081, "num_tokens": 2233422.0, "step": 1260 }, { "entropy": 6.36962661743164, "epoch": 0.06506699585937299, "grad_norm": 1.0390625, "learning_rate": 0.0004914562261068693, "loss": 6.3003, "mean_token_accuracy": 0.11817166209220886, "num_tokens": 2242497.0, "step": 1265 }, { "entropy": 6.283186435699463, "epoch": 0.0653241776611887, "grad_norm": 1.09375, "learning_rate": 0.0004911316965245098, "loss": 6.3951, "mean_token_accuracy": 0.11700899675488471, "num_tokens": 2251876.0, "step": 1270 }, { "entropy": 6.4162839412689205, "epoch": 0.0655813594630044, "grad_norm": 1.046875, "learning_rate": 0.000490801241582512, "loss": 6.3263, "mean_token_accuracy": 0.11120393425226212, "num_tokens": 2261476.0, "step": 1275 }, { "entropy": 6.217834234237671, "epoch": 0.0658385412648201, "grad_norm": 1.09375, "learning_rate": 0.000490464870340465, "loss": 6.2036, "mean_token_accuracy": 0.12037949934601784, "num_tokens": 2269830.0, "step": 1280 }, { "entropy": 6.354285717010498, "epoch": 0.0660957230666358, "grad_norm": 1.0546875, "learning_rate": 0.0004901225920201563, "loss": 6.2549, "mean_token_accuracy": 0.1226073995232582, "num_tokens": 2278846.0, "step": 1285 }, { "entropy": 6.259861993789673, "epoch": 0.06635290486845151, "grad_norm": 1.1015625, "learning_rate": 0.000489774416005319, "loss": 6.1377, "mean_token_accuracy": 0.12190483957529068, "num_tokens": 2287379.0, "step": 1290 }, { "entropy": 6.185118103027344, "epoch": 0.06661008667026722, "grad_norm": 1.1015625, "learning_rate": 0.0004894203518413742, "loss": 6.232, "mean_token_accuracy": 0.11986896097660064, "num_tokens": 2296071.0, "step": 1295 }, { "entropy": 6.285954570770263, "epoch": 0.06686726847208292, "grad_norm": 1.1015625, "learning_rate": 0.0004890604092351701, "loss": 6.1568, "mean_token_accuracy": 0.12937120646238326, "num_tokens": 2305629.0, "step": 1300 }, { "entropy": 6.352389907836914, "epoch": 0.06712445027389861, "grad_norm": 1.15625, "learning_rate": 0.000488694598054715, "loss": 6.2792, "mean_token_accuracy": 0.11652439460158348, "num_tokens": 2314297.0, "step": 1305 }, { "entropy": 6.281135702133179, "epoch": 0.06738163207571432, "grad_norm": 1.015625, "learning_rate": 0.0004883229283289071, "loss": 6.2421, "mean_token_accuracy": 0.1163830317556858, "num_tokens": 2323583.0, "step": 1310 }, { "entropy": 6.275307750701904, "epoch": 0.06763881387753003, "grad_norm": 1.125, "learning_rate": 0.00048794541024725993, "loss": 6.1962, "mean_token_accuracy": 0.12070676833391189, "num_tokens": 2332362.0, "step": 1315 }, { "entropy": 6.247883081436157, "epoch": 0.06789599567934573, "grad_norm": 1.03125, "learning_rate": 0.0004875620541596221, "loss": 6.2433, "mean_token_accuracy": 0.11916191950440407, "num_tokens": 2341724.0, "step": 1320 }, { "entropy": 6.323701190948486, "epoch": 0.06815317748116144, "grad_norm": 1.1953125, "learning_rate": 0.00048717287057589454, "loss": 6.3094, "mean_token_accuracy": 0.11830834746360779, "num_tokens": 2350687.0, "step": 1325 }, { "entropy": 6.180278348922729, "epoch": 0.06841035928297713, "grad_norm": 1.0078125, "learning_rate": 0.0004867778701657417, "loss": 6.123, "mean_token_accuracy": 0.12217027693986893, "num_tokens": 2359761.0, "step": 1330 }, { "entropy": 6.274547529220581, "epoch": 0.06866754108479284, "grad_norm": 0.99609375, "learning_rate": 0.00048637706375829955, "loss": 6.2057, "mean_token_accuracy": 0.12222478315234184, "num_tokens": 2369203.0, "step": 1335 }, { "entropy": 6.284049701690674, "epoch": 0.06892472288660854, "grad_norm": 1.0625, "learning_rate": 0.000485970462341878, "loss": 6.2373, "mean_token_accuracy": 0.12175923585891724, "num_tokens": 2377576.0, "step": 1340 }, { "entropy": 6.255672264099121, "epoch": 0.06918190468842425, "grad_norm": 1.1640625, "learning_rate": 0.00048555807706366044, "loss": 6.2313, "mean_token_accuracy": 0.11880970671772957, "num_tokens": 2386658.0, "step": 1345 }, { "entropy": 6.267937898635864, "epoch": 0.06943908649023996, "grad_norm": 1.125, "learning_rate": 0.00048513991922939756, "loss": 6.2557, "mean_token_accuracy": 0.12166587859392167, "num_tokens": 2395340.0, "step": 1350 }, { "entropy": 6.228494787216187, "epoch": 0.06969626829205565, "grad_norm": 1.046875, "learning_rate": 0.00048471600030309744, "loss": 6.287, "mean_token_accuracy": 0.11910992339253426, "num_tokens": 2404844.0, "step": 1355 }, { "entropy": 6.3855327606201175, "epoch": 0.06995345009387136, "grad_norm": 1.1484375, "learning_rate": 0.00048428633190671186, "loss": 6.2122, "mean_token_accuracy": 0.11871807649731636, "num_tokens": 2413641.0, "step": 1360 }, { "entropy": 6.2528892993927006, "epoch": 0.07021063189568706, "grad_norm": 1.0859375, "learning_rate": 0.0004838509258198167, "loss": 6.2608, "mean_token_accuracy": 0.12074613049626351, "num_tokens": 2423065.0, "step": 1365 }, { "entropy": 6.365111207962036, "epoch": 0.07046781369750277, "grad_norm": 1.1640625, "learning_rate": 0.00048340979397929, "loss": 6.1988, "mean_token_accuracy": 0.1260582149028778, "num_tokens": 2432486.0, "step": 1370 }, { "entropy": 6.297368955612183, "epoch": 0.07072499549931847, "grad_norm": 1.171875, "learning_rate": 0.00048296294847898386, "loss": 6.2855, "mean_token_accuracy": 0.1175057515501976, "num_tokens": 2441582.0, "step": 1375 }, { "entropy": 6.272958660125733, "epoch": 0.07098217730113417, "grad_norm": 1.046875, "learning_rate": 0.0004825104015693934, "loss": 6.1998, "mean_token_accuracy": 0.1187170147895813, "num_tokens": 2450618.0, "step": 1380 }, { "entropy": 6.21057162284851, "epoch": 0.07123935910294987, "grad_norm": 1.0234375, "learning_rate": 0.0004820521656573208, "loss": 6.2205, "mean_token_accuracy": 0.11892557591199875, "num_tokens": 2459346.0, "step": 1385 }, { "entropy": 6.275320386886596, "epoch": 0.07149654090476558, "grad_norm": 1.15625, "learning_rate": 0.00048158825330553505, "loss": 6.2183, "mean_token_accuracy": 0.12063762545585632, "num_tokens": 2467775.0, "step": 1390 }, { "entropy": 6.233735370635986, "epoch": 0.07175372270658129, "grad_norm": 1.21875, "learning_rate": 0.00048111867723242763, "loss": 6.0805, "mean_token_accuracy": 0.12942860201001166, "num_tokens": 2475732.0, "step": 1395 }, { "entropy": 6.302308511734009, "epoch": 0.07201090450839699, "grad_norm": 1.0859375, "learning_rate": 0.0004806434503116637, "loss": 6.2751, "mean_token_accuracy": 0.11736578792333603, "num_tokens": 2484468.0, "step": 1400 }, { "entropy": 6.20477180480957, "epoch": 0.07226808631021268, "grad_norm": 1.1015625, "learning_rate": 0.0004801625855718296, "loss": 6.0979, "mean_token_accuracy": 0.12714530006051064, "num_tokens": 2492945.0, "step": 1405 }, { "entropy": 6.303807067871094, "epoch": 0.07252526811202839, "grad_norm": 1.015625, "learning_rate": 0.00047967609619607477, "loss": 6.2581, "mean_token_accuracy": 0.12180023640394211, "num_tokens": 2502267.0, "step": 1410 }, { "entropy": 6.076932668685913, "epoch": 0.0727824499138441, "grad_norm": 1.1171875, "learning_rate": 0.0004791839955217513, "loss": 6.1385, "mean_token_accuracy": 0.12108586356043816, "num_tokens": 2511182.0, "step": 1415 }, { "entropy": 6.260076665878296, "epoch": 0.0730396317156598, "grad_norm": 1.09375, "learning_rate": 0.00047868629704004786, "loss": 6.2165, "mean_token_accuracy": 0.11969843655824661, "num_tokens": 2519756.0, "step": 1420 }, { "entropy": 6.295289468765259, "epoch": 0.07329681351747551, "grad_norm": 1.078125, "learning_rate": 0.00047818301439561965, "loss": 6.2174, "mean_token_accuracy": 0.12359980940818786, "num_tokens": 2528925.0, "step": 1425 }, { "entropy": 6.314094161987304, "epoch": 0.0735539953192912, "grad_norm": 1.078125, "learning_rate": 0.00047767416138621454, "loss": 6.2839, "mean_token_accuracy": 0.11689749956130982, "num_tokens": 2538557.0, "step": 1430 }, { "entropy": 6.229358911514282, "epoch": 0.07381117712110691, "grad_norm": 1.1484375, "learning_rate": 0.000477159751962295, "loss": 6.1894, "mean_token_accuracy": 0.12646755203604698, "num_tokens": 2547190.0, "step": 1435 }, { "entropy": 6.241942453384399, "epoch": 0.07406835892292261, "grad_norm": 1.1015625, "learning_rate": 0.00047663980022665507, "loss": 6.2148, "mean_token_accuracy": 0.12242325693368912, "num_tokens": 2556168.0, "step": 1440 }, { "entropy": 6.306135368347168, "epoch": 0.07432554072473832, "grad_norm": 1.078125, "learning_rate": 0.00047611432043403437, "loss": 6.2626, "mean_token_accuracy": 0.1197875827550888, "num_tokens": 2565409.0, "step": 1445 }, { "entropy": 6.228486442565918, "epoch": 0.07458272252655403, "grad_norm": 1.1328125, "learning_rate": 0.0004755833269907267, "loss": 6.0994, "mean_token_accuracy": 0.12629354000091553, "num_tokens": 2574710.0, "step": 1450 }, { "entropy": 6.119667053222656, "epoch": 0.07483990432836972, "grad_norm": 1.09375, "learning_rate": 0.0004750468344541857, "loss": 6.0366, "mean_token_accuracy": 0.13156967237591743, "num_tokens": 2583210.0, "step": 1455 }, { "entropy": 6.1274964809417725, "epoch": 0.07509708613018543, "grad_norm": 1.078125, "learning_rate": 0.00047450485753262525, "loss": 6.0896, "mean_token_accuracy": 0.13029113933444023, "num_tokens": 2592143.0, "step": 1460 }, { "entropy": 6.23237795829773, "epoch": 0.07535426793200113, "grad_norm": 1.234375, "learning_rate": 0.00047395741108461633, "loss": 6.0884, "mean_token_accuracy": 0.1269154392182827, "num_tokens": 2601051.0, "step": 1465 }, { "entropy": 6.124324464797974, "epoch": 0.07561144973381684, "grad_norm": 1.25, "learning_rate": 0.00047340451011867985, "loss": 6.1757, "mean_token_accuracy": 0.12620116993784905, "num_tokens": 2609334.0, "step": 1470 }, { "entropy": 6.34974856376648, "epoch": 0.07586863153563254, "grad_norm": 1.0078125, "learning_rate": 0.00047284616979287515, "loss": 6.2833, "mean_token_accuracy": 0.1270563654601574, "num_tokens": 2618670.0, "step": 1475 }, { "entropy": 6.1445026874542235, "epoch": 0.07612581333744824, "grad_norm": 1.1015625, "learning_rate": 0.00047228240541438433, "loss": 6.1026, "mean_token_accuracy": 0.12804780080914496, "num_tokens": 2627829.0, "step": 1480 }, { "entropy": 6.234681034088135, "epoch": 0.07638299513926394, "grad_norm": 1.1171875, "learning_rate": 0.00047171323243909257, "loss": 6.0433, "mean_token_accuracy": 0.132904352247715, "num_tokens": 2636508.0, "step": 1485 }, { "entropy": 6.130121564865112, "epoch": 0.07664017694107965, "grad_norm": 1.078125, "learning_rate": 0.00047113866647116457, "loss": 6.1347, "mean_token_accuracy": 0.12549900785088539, "num_tokens": 2645713.0, "step": 1490 }, { "entropy": 6.149539947509766, "epoch": 0.07689735874289536, "grad_norm": 1.09375, "learning_rate": 0.0004705587232626164, "loss": 6.0803, "mean_token_accuracy": 0.13423071429133415, "num_tokens": 2654194.0, "step": 1495 }, { "entropy": 6.214192914962768, "epoch": 0.07715454054471106, "grad_norm": 1.1171875, "learning_rate": 0.00046997341871288424, "loss": 6.1258, "mean_token_accuracy": 0.12882963046431542, "num_tokens": 2662932.0, "step": 1500 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 3592406163456000.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }