{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.025718180181570353, "eval_steps": 500, "global_step": 500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.691593360900878, "epoch": 0.0002571818018157035, "grad_norm": 13.5625, "learning_rate": 2e-06, "loss": 10.761, "mean_token_accuracy": 0.00011363636003807187, "num_tokens": 8373.0, "step": 5 }, { "entropy": 10.691572093963623, "epoch": 0.000514363603631407, "grad_norm": 12.375, "learning_rate": 4.5e-06, "loss": 10.7039, "mean_token_accuracy": 0.0, "num_tokens": 17090.0, "step": 10 }, { "entropy": 10.691090297698974, "epoch": 0.0007715454054471106, "grad_norm": 9.875, "learning_rate": 7e-06, "loss": 10.5011, "mean_token_accuracy": 0.018853903049603105, "num_tokens": 26219.0, "step": 15 }, { "entropy": 10.680709075927734, "epoch": 0.001028727207262814, "grad_norm": 6.03125, "learning_rate": 9.5e-06, "loss": 10.2462, "mean_token_accuracy": 0.04484990499913692, "num_tokens": 36191.0, "step": 20 }, { "entropy": 10.582563495635986, "epoch": 0.0012859090090785177, "grad_norm": 3.9375, "learning_rate": 1.2e-05, "loss": 9.9749, "mean_token_accuracy": 0.040961484611034396, "num_tokens": 45318.0, "step": 25 }, { "entropy": 10.534116744995117, "epoch": 0.0015430908108942211, "grad_norm": 3.703125, "learning_rate": 1.4500000000000002e-05, "loss": 9.8021, "mean_token_accuracy": 0.04536043591797352, "num_tokens": 53102.0, "step": 30 }, { "entropy": 10.562399864196777, "epoch": 0.0018002726127099246, "grad_norm": 2.984375, "learning_rate": 1.7000000000000003e-05, "loss": 9.7539, "mean_token_accuracy": 0.042898242548108104, "num_tokens": 61808.0, "step": 35 }, { "entropy": 10.547216129302978, "epoch": 0.002057454414525628, "grad_norm": 2.8125, "learning_rate": 1.95e-05, "loss": 9.7136, "mean_token_accuracy": 0.044699297100305554, "num_tokens": 70708.0, "step": 40 }, { "entropy": 10.517444515228272, "epoch": 0.0023146362163413317, "grad_norm": 2.5, "learning_rate": 2.2e-05, "loss": 9.632, "mean_token_accuracy": 0.04661537855863571, "num_tokens": 79541.0, "step": 45 }, { "entropy": 10.505586051940918, "epoch": 0.0025718180181570354, "grad_norm": 2.40625, "learning_rate": 2.4500000000000003e-05, "loss": 9.5459, "mean_token_accuracy": 0.05164888352155685, "num_tokens": 87073.0, "step": 50 }, { "entropy": 10.474337196350097, "epoch": 0.0028289998199727386, "grad_norm": 2.25, "learning_rate": 2.7e-05, "loss": 9.5486, "mean_token_accuracy": 0.059509020671248435, "num_tokens": 96581.0, "step": 55 }, { "entropy": 10.405019569396973, "epoch": 0.0030861816217884423, "grad_norm": 2.359375, "learning_rate": 2.95e-05, "loss": 9.4782, "mean_token_accuracy": 0.060714465007185935, "num_tokens": 105741.0, "step": 60 }, { "entropy": 10.288742446899414, "epoch": 0.003343363423604146, "grad_norm": 2.125, "learning_rate": 3.2e-05, "loss": 9.385, "mean_token_accuracy": 0.061338124051690104, "num_tokens": 114609.0, "step": 65 }, { "entropy": 10.352596855163574, "epoch": 0.003600545225419849, "grad_norm": 2.125, "learning_rate": 3.4500000000000005e-05, "loss": 9.35, "mean_token_accuracy": 0.05903933756053448, "num_tokens": 123922.0, "step": 70 }, { "entropy": 10.332678699493409, "epoch": 0.003857727027235553, "grad_norm": 2.125, "learning_rate": 3.7e-05, "loss": 9.2218, "mean_token_accuracy": 0.06484894305467606, "num_tokens": 133213.0, "step": 75 }, { "entropy": 10.27952938079834, "epoch": 0.004114908829051256, "grad_norm": 1.96875, "learning_rate": 3.95e-05, "loss": 9.1737, "mean_token_accuracy": 0.06273005269467831, "num_tokens": 141582.0, "step": 80 }, { "entropy": 10.254050540924073, "epoch": 0.00437209063086696, "grad_norm": 2.0625, "learning_rate": 4.2000000000000004e-05, "loss": 8.9925, "mean_token_accuracy": 0.06865651868283748, "num_tokens": 149709.0, "step": 85 }, { "entropy": 10.210903453826905, "epoch": 0.004629272432682663, "grad_norm": 1.8203125, "learning_rate": 4.45e-05, "loss": 8.856, "mean_token_accuracy": 0.07082752697169781, "num_tokens": 158239.0, "step": 90 }, { "entropy": 10.24482765197754, "epoch": 0.004886454234498367, "grad_norm": 1.7578125, "learning_rate": 4.7000000000000004e-05, "loss": 8.9023, "mean_token_accuracy": 0.0604440800845623, "num_tokens": 168046.0, "step": 95 }, { "entropy": 10.135429000854492, "epoch": 0.005143636036314071, "grad_norm": 1.53125, "learning_rate": 4.9500000000000004e-05, "loss": 8.8077, "mean_token_accuracy": 0.06280115209519863, "num_tokens": 177797.0, "step": 100 }, { "entropy": 10.110702419281006, "epoch": 0.0054008178381297735, "grad_norm": 1.796875, "learning_rate": 5.2e-05, "loss": 8.6609, "mean_token_accuracy": 0.06286422722041607, "num_tokens": 186664.0, "step": 105 }, { "entropy": 10.024668121337891, "epoch": 0.005657999639945477, "grad_norm": 1.5546875, "learning_rate": 5.45e-05, "loss": 8.5449, "mean_token_accuracy": 0.06326077207922935, "num_tokens": 195404.0, "step": 110 }, { "entropy": 9.922544002532959, "epoch": 0.005915181441761181, "grad_norm": 1.5546875, "learning_rate": 5.7e-05, "loss": 8.4327, "mean_token_accuracy": 0.06552885584533215, "num_tokens": 204248.0, "step": 115 }, { "entropy": 9.780591869354248, "epoch": 0.0061723632435768845, "grad_norm": 1.515625, "learning_rate": 5.9499999999999996e-05, "loss": 8.2869, "mean_token_accuracy": 0.060110585764050484, "num_tokens": 214042.0, "step": 120 }, { "entropy": 9.649379444122314, "epoch": 0.006429545045392588, "grad_norm": 1.390625, "learning_rate": 6.2e-05, "loss": 8.189, "mean_token_accuracy": 0.06577248759567737, "num_tokens": 223194.0, "step": 125 }, { "entropy": 9.431284046173095, "epoch": 0.006686726847208292, "grad_norm": 1.484375, "learning_rate": 6.450000000000001e-05, "loss": 7.9307, "mean_token_accuracy": 0.07218964248895646, "num_tokens": 230929.0, "step": 130 }, { "entropy": 9.260346984863281, "epoch": 0.006943908649023995, "grad_norm": 1.734375, "learning_rate": 6.7e-05, "loss": 7.9081, "mean_token_accuracy": 0.07038265988230705, "num_tokens": 238687.0, "step": 135 }, { "entropy": 9.035238265991211, "epoch": 0.007201090450839698, "grad_norm": 1.4921875, "learning_rate": 6.950000000000001e-05, "loss": 7.8152, "mean_token_accuracy": 0.07054561264812946, "num_tokens": 247397.0, "step": 140 }, { "entropy": 8.894649696350097, "epoch": 0.007458272252655402, "grad_norm": 1.4453125, "learning_rate": 7.2e-05, "loss": 7.7444, "mean_token_accuracy": 0.07246604040265084, "num_tokens": 255924.0, "step": 145 }, { "entropy": 8.742353820800782, "epoch": 0.007715454054471106, "grad_norm": 1.2890625, "learning_rate": 7.45e-05, "loss": 7.6781, "mean_token_accuracy": 0.06747029088437557, "num_tokens": 264767.0, "step": 150 }, { "entropy": 8.636024761199952, "epoch": 0.00797263585628681, "grad_norm": 1.1640625, "learning_rate": 7.7e-05, "loss": 7.6787, "mean_token_accuracy": 0.07033539973199368, "num_tokens": 274250.0, "step": 155 }, { "entropy": 8.433564472198487, "epoch": 0.008229817658102512, "grad_norm": 1.3828125, "learning_rate": 7.950000000000001e-05, "loss": 7.5648, "mean_token_accuracy": 0.07707317210733891, "num_tokens": 282568.0, "step": 160 }, { "entropy": 8.366222667694093, "epoch": 0.008486999459918217, "grad_norm": 1.3671875, "learning_rate": 8.2e-05, "loss": 7.5969, "mean_token_accuracy": 0.06956044659018516, "num_tokens": 291126.0, "step": 165 }, { "entropy": 8.285852527618408, "epoch": 0.00874418126173392, "grad_norm": 1.1953125, "learning_rate": 8.450000000000001e-05, "loss": 7.5209, "mean_token_accuracy": 0.07576571702957154, "num_tokens": 299751.0, "step": 170 }, { "entropy": 8.235202884674072, "epoch": 0.009001363063549624, "grad_norm": 1.2734375, "learning_rate": 8.7e-05, "loss": 7.5119, "mean_token_accuracy": 0.07470664568245411, "num_tokens": 309560.0, "step": 175 }, { "entropy": 8.157529830932617, "epoch": 0.009258544865365327, "grad_norm": 1.296875, "learning_rate": 8.95e-05, "loss": 7.4928, "mean_token_accuracy": 0.06981925927102565, "num_tokens": 318613.0, "step": 180 }, { "entropy": 8.12168264389038, "epoch": 0.00951572666718103, "grad_norm": 1.328125, "learning_rate": 9.2e-05, "loss": 7.551, "mean_token_accuracy": 0.07186717689037322, "num_tokens": 327650.0, "step": 185 }, { "entropy": 8.121650791168213, "epoch": 0.009772908468996734, "grad_norm": 1.125, "learning_rate": 9.45e-05, "loss": 7.4394, "mean_token_accuracy": 0.07240154445171357, "num_tokens": 337198.0, "step": 190 }, { "entropy": 8.03664698600769, "epoch": 0.010030090270812437, "grad_norm": 1.34375, "learning_rate": 9.7e-05, "loss": 7.5301, "mean_token_accuracy": 0.07011710181832313, "num_tokens": 346179.0, "step": 195 }, { "entropy": 8.069316053390503, "epoch": 0.010287272072628141, "grad_norm": 1.6875, "learning_rate": 9.95e-05, "loss": 7.4276, "mean_token_accuracy": 0.07499495595693588, "num_tokens": 355972.0, "step": 200 }, { "entropy": 7.968952226638794, "epoch": 0.010544453874443844, "grad_norm": 1.4375, "learning_rate": 0.000102, "loss": 7.3626, "mean_token_accuracy": 0.077250687032938, "num_tokens": 364635.0, "step": 205 }, { "entropy": 7.948678016662598, "epoch": 0.010801635676259547, "grad_norm": 1.328125, "learning_rate": 0.00010449999999999999, "loss": 7.5125, "mean_token_accuracy": 0.07722728103399276, "num_tokens": 374161.0, "step": 210 }, { "entropy": 7.955185747146606, "epoch": 0.011058817478075252, "grad_norm": 1.1875, "learning_rate": 0.000107, "loss": 7.3673, "mean_token_accuracy": 0.0733168862760067, "num_tokens": 383641.0, "step": 215 }, { "entropy": 7.921580362319946, "epoch": 0.011315999279890954, "grad_norm": 1.3515625, "learning_rate": 0.0001095, "loss": 7.3171, "mean_token_accuracy": 0.0784445971250534, "num_tokens": 392300.0, "step": 220 }, { "entropy": 7.939724063873291, "epoch": 0.011573181081706659, "grad_norm": 1.3125, "learning_rate": 0.000112, "loss": 7.3486, "mean_token_accuracy": 0.07721329033374787, "num_tokens": 400721.0, "step": 225 }, { "entropy": 7.914973640441895, "epoch": 0.011830362883522362, "grad_norm": 1.265625, "learning_rate": 0.0001145, "loss": 7.3563, "mean_token_accuracy": 0.08054085932672024, "num_tokens": 410261.0, "step": 230 }, { "entropy": 7.840137624740601, "epoch": 0.012087544685338066, "grad_norm": 1.296875, "learning_rate": 0.00011700000000000001, "loss": 7.2993, "mean_token_accuracy": 0.08381507098674774, "num_tokens": 419006.0, "step": 235 }, { "entropy": 7.865709638595581, "epoch": 0.012344726487153769, "grad_norm": 1.1953125, "learning_rate": 0.00011949999999999999, "loss": 7.3679, "mean_token_accuracy": 0.07533743120729923, "num_tokens": 428773.0, "step": 240 }, { "entropy": 7.8893204689025875, "epoch": 0.012601908288969472, "grad_norm": 1.5390625, "learning_rate": 0.000122, "loss": 7.2843, "mean_token_accuracy": 0.08408410698175431, "num_tokens": 438111.0, "step": 245 }, { "entropy": 7.718148136138916, "epoch": 0.012859090090785176, "grad_norm": 1.3046875, "learning_rate": 0.0001245, "loss": 7.2826, "mean_token_accuracy": 0.07801055312156677, "num_tokens": 447352.0, "step": 250 }, { "entropy": 7.834936952590942, "epoch": 0.01311627189260088, "grad_norm": 1.2421875, "learning_rate": 0.000127, "loss": 7.2718, "mean_token_accuracy": 0.08380828946828842, "num_tokens": 456118.0, "step": 255 }, { "entropy": 7.78115496635437, "epoch": 0.013373453694416584, "grad_norm": 1.3359375, "learning_rate": 0.0001295, "loss": 7.3091, "mean_token_accuracy": 0.0782765805721283, "num_tokens": 465016.0, "step": 260 }, { "entropy": 7.746971464157104, "epoch": 0.013630635496232286, "grad_norm": 1.234375, "learning_rate": 0.000132, "loss": 7.2129, "mean_token_accuracy": 0.0813664972782135, "num_tokens": 473828.0, "step": 265 }, { "entropy": 7.73144416809082, "epoch": 0.01388781729804799, "grad_norm": 1.125, "learning_rate": 0.00013450000000000002, "loss": 7.1867, "mean_token_accuracy": 0.08951399773359299, "num_tokens": 482481.0, "step": 270 }, { "entropy": 7.821958923339844, "epoch": 0.014144999099863694, "grad_norm": 1.34375, "learning_rate": 0.00013700000000000002, "loss": 7.2565, "mean_token_accuracy": 0.08631709441542626, "num_tokens": 491784.0, "step": 275 }, { "entropy": 7.713495445251465, "epoch": 0.014402180901679397, "grad_norm": 1.421875, "learning_rate": 0.0001395, "loss": 7.3491, "mean_token_accuracy": 0.0803300604224205, "num_tokens": 501227.0, "step": 280 }, { "entropy": 7.609055280685425, "epoch": 0.014659362703495101, "grad_norm": 1.6640625, "learning_rate": 0.00014199999999999998, "loss": 7.1247, "mean_token_accuracy": 0.0826262541115284, "num_tokens": 509566.0, "step": 285 }, { "entropy": 7.692761611938477, "epoch": 0.014916544505310804, "grad_norm": 1.3984375, "learning_rate": 0.0001445, "loss": 7.1787, "mean_token_accuracy": 0.09211432188749313, "num_tokens": 517517.0, "step": 290 }, { "entropy": 7.6960266590118405, "epoch": 0.015173726307126508, "grad_norm": 1.21875, "learning_rate": 0.000147, "loss": 7.2176, "mean_token_accuracy": 0.0820289522409439, "num_tokens": 526279.0, "step": 295 }, { "entropy": 7.665759134292602, "epoch": 0.015430908108942211, "grad_norm": 1.171875, "learning_rate": 0.0001495, "loss": 7.1406, "mean_token_accuracy": 0.0928925946354866, "num_tokens": 534516.0, "step": 300 }, { "entropy": 7.661193418502807, "epoch": 0.015688089910757916, "grad_norm": 1.3671875, "learning_rate": 0.000152, "loss": 7.2216, "mean_token_accuracy": 0.08248281478881836, "num_tokens": 543828.0, "step": 305 }, { "entropy": 7.662406015396118, "epoch": 0.01594527171257362, "grad_norm": 1.2734375, "learning_rate": 0.00015450000000000001, "loss": 7.1559, "mean_token_accuracy": 0.08263281881809234, "num_tokens": 552530.0, "step": 310 }, { "entropy": 7.536833572387695, "epoch": 0.01620245351438932, "grad_norm": 1.359375, "learning_rate": 0.000157, "loss": 7.1062, "mean_token_accuracy": 0.08527780249714852, "num_tokens": 561475.0, "step": 315 }, { "entropy": 7.684497308731079, "epoch": 0.016459635316205024, "grad_norm": 1.4609375, "learning_rate": 0.0001595, "loss": 7.1742, "mean_token_accuracy": 0.08275718316435814, "num_tokens": 569852.0, "step": 320 }, { "entropy": 7.586278247833252, "epoch": 0.01671681711802073, "grad_norm": 1.203125, "learning_rate": 0.000162, "loss": 7.2073, "mean_token_accuracy": 0.08587946742773056, "num_tokens": 578326.0, "step": 325 }, { "entropy": 7.664967060089111, "epoch": 0.016973998919836433, "grad_norm": 1.1484375, "learning_rate": 0.00016450000000000001, "loss": 7.238, "mean_token_accuracy": 0.08378956839442253, "num_tokens": 587606.0, "step": 330 }, { "entropy": 7.510732364654541, "epoch": 0.017231180721652136, "grad_norm": 1.3828125, "learning_rate": 0.00016700000000000002, "loss": 6.9636, "mean_token_accuracy": 0.09541863054037095, "num_tokens": 595321.0, "step": 335 }, { "entropy": 7.525554895401001, "epoch": 0.01748836252346784, "grad_norm": 1.1875, "learning_rate": 0.00016950000000000003, "loss": 7.0757, "mean_token_accuracy": 0.08646541684865952, "num_tokens": 603836.0, "step": 340 }, { "entropy": 7.485527229309082, "epoch": 0.01774554432528354, "grad_norm": 1.359375, "learning_rate": 0.00017199999999999998, "loss": 7.0746, "mean_token_accuracy": 0.08882175087928772, "num_tokens": 612847.0, "step": 345 }, { "entropy": 7.5213652610778805, "epoch": 0.018002726127099248, "grad_norm": 1.2734375, "learning_rate": 0.00017449999999999999, "loss": 7.1177, "mean_token_accuracy": 0.08585901409387589, "num_tokens": 620840.0, "step": 350 }, { "entropy": 7.538561153411865, "epoch": 0.01825990792891495, "grad_norm": 1.4140625, "learning_rate": 0.000177, "loss": 7.0237, "mean_token_accuracy": 0.09108547568321228, "num_tokens": 629495.0, "step": 355 }, { "entropy": 7.50935378074646, "epoch": 0.018517089730730654, "grad_norm": 1.203125, "learning_rate": 0.0001795, "loss": 7.1784, "mean_token_accuracy": 0.08739718049764633, "num_tokens": 638589.0, "step": 360 }, { "entropy": 7.4144041538238525, "epoch": 0.018774271532546356, "grad_norm": 1.2890625, "learning_rate": 0.000182, "loss": 7.05, "mean_token_accuracy": 0.08531938642263412, "num_tokens": 647713.0, "step": 365 }, { "entropy": 7.665746688842773, "epoch": 0.01903145333436206, "grad_norm": 1.40625, "learning_rate": 0.0001845, "loss": 7.1511, "mean_token_accuracy": 0.08770897537469864, "num_tokens": 656472.0, "step": 370 }, { "entropy": 7.371031093597412, "epoch": 0.019288635136177765, "grad_norm": 1.5625, "learning_rate": 0.000187, "loss": 7.0004, "mean_token_accuracy": 0.09101735278964043, "num_tokens": 664858.0, "step": 375 }, { "entropy": 7.439912271499634, "epoch": 0.019545816937993468, "grad_norm": 1.1796875, "learning_rate": 0.0001895, "loss": 7.0322, "mean_token_accuracy": 0.09086323380470276, "num_tokens": 673675.0, "step": 380 }, { "entropy": 7.4977442741394045, "epoch": 0.01980299873980917, "grad_norm": 1.3046875, "learning_rate": 0.000192, "loss": 7.1526, "mean_token_accuracy": 0.0906866118311882, "num_tokens": 681968.0, "step": 385 }, { "entropy": 7.431271123886108, "epoch": 0.020060180541624874, "grad_norm": 1.1640625, "learning_rate": 0.0001945, "loss": 7.0089, "mean_token_accuracy": 0.09397086799144745, "num_tokens": 690447.0, "step": 390 }, { "entropy": 7.5096940994262695, "epoch": 0.020317362343440577, "grad_norm": 1.1953125, "learning_rate": 0.00019700000000000002, "loss": 7.0298, "mean_token_accuracy": 0.09151682630181313, "num_tokens": 699659.0, "step": 395 }, { "entropy": 7.40989465713501, "epoch": 0.020574544145256283, "grad_norm": 1.4921875, "learning_rate": 0.00019950000000000002, "loss": 7.0506, "mean_token_accuracy": 0.09182499945163727, "num_tokens": 708342.0, "step": 400 }, { "entropy": 7.437063407897949, "epoch": 0.020831725947071986, "grad_norm": 1.2421875, "learning_rate": 0.000202, "loss": 7.0589, "mean_token_accuracy": 0.08685924187302589, "num_tokens": 717986.0, "step": 405 }, { "entropy": 7.506326389312744, "epoch": 0.02108890774888769, "grad_norm": 1.1875, "learning_rate": 0.00020449999999999998, "loss": 7.0868, "mean_token_accuracy": 0.08464771658182144, "num_tokens": 727397.0, "step": 410 }, { "entropy": 7.389501142501831, "epoch": 0.02134608955070339, "grad_norm": 1.109375, "learning_rate": 0.000207, "loss": 7.0421, "mean_token_accuracy": 0.09134713932871819, "num_tokens": 736291.0, "step": 415 }, { "entropy": 7.398612976074219, "epoch": 0.021603271352519094, "grad_norm": 1.3046875, "learning_rate": 0.0002095, "loss": 7.0983, "mean_token_accuracy": 0.08749841973185539, "num_tokens": 745132.0, "step": 420 }, { "entropy": 7.387109804153442, "epoch": 0.0218604531543348, "grad_norm": 1.359375, "learning_rate": 0.000212, "loss": 6.9801, "mean_token_accuracy": 0.09526508301496506, "num_tokens": 753535.0, "step": 425 }, { "entropy": 7.287825727462769, "epoch": 0.022117634956150503, "grad_norm": 1.34375, "learning_rate": 0.0002145, "loss": 6.8881, "mean_token_accuracy": 0.09665613695979118, "num_tokens": 762626.0, "step": 430 }, { "entropy": 7.425317716598511, "epoch": 0.022374816757966206, "grad_norm": 1.265625, "learning_rate": 0.00021700000000000002, "loss": 7.0183, "mean_token_accuracy": 0.08952494263648987, "num_tokens": 771802.0, "step": 435 }, { "entropy": 7.3904194831848145, "epoch": 0.02263199855978191, "grad_norm": 1.109375, "learning_rate": 0.0002195, "loss": 7.055, "mean_token_accuracy": 0.09687120616436004, "num_tokens": 780444.0, "step": 440 }, { "entropy": 7.46030330657959, "epoch": 0.022889180361597615, "grad_norm": 1.28125, "learning_rate": 0.000222, "loss": 7.0891, "mean_token_accuracy": 0.08583850935101509, "num_tokens": 789335.0, "step": 445 }, { "entropy": 7.254354047775268, "epoch": 0.023146362163413318, "grad_norm": 1.3828125, "learning_rate": 0.0002245, "loss": 6.9291, "mean_token_accuracy": 0.09709356278181076, "num_tokens": 797891.0, "step": 450 }, { "entropy": 7.221427774429321, "epoch": 0.02340354396522902, "grad_norm": 1.328125, "learning_rate": 0.00022700000000000002, "loss": 6.9026, "mean_token_accuracy": 0.09430735632777214, "num_tokens": 806238.0, "step": 455 }, { "entropy": 7.3990577220916744, "epoch": 0.023660725767044723, "grad_norm": 1.4765625, "learning_rate": 0.00022950000000000002, "loss": 6.9081, "mean_token_accuracy": 0.09148178026080131, "num_tokens": 814430.0, "step": 460 }, { "entropy": 7.347194242477417, "epoch": 0.023917907568860426, "grad_norm": 1.140625, "learning_rate": 0.00023200000000000003, "loss": 7.0802, "mean_token_accuracy": 0.08918680474162102, "num_tokens": 823546.0, "step": 465 }, { "entropy": 7.322706604003907, "epoch": 0.024175089370676132, "grad_norm": 1.3203125, "learning_rate": 0.00023449999999999998, "loss": 6.8709, "mean_token_accuracy": 0.0952567420899868, "num_tokens": 832885.0, "step": 470 }, { "entropy": 7.260769939422607, "epoch": 0.024432271172491835, "grad_norm": 1.171875, "learning_rate": 0.000237, "loss": 6.8382, "mean_token_accuracy": 0.09813853800296783, "num_tokens": 841140.0, "step": 475 }, { "entropy": 7.244242477416992, "epoch": 0.024689452974307538, "grad_norm": 1.5703125, "learning_rate": 0.0002395, "loss": 6.9147, "mean_token_accuracy": 0.09300818815827369, "num_tokens": 849768.0, "step": 480 }, { "entropy": 7.25398006439209, "epoch": 0.02494663477612324, "grad_norm": 1.09375, "learning_rate": 0.000242, "loss": 6.8165, "mean_token_accuracy": 0.09476587101817131, "num_tokens": 859080.0, "step": 485 }, { "entropy": 7.220676612854004, "epoch": 0.025203816577938944, "grad_norm": 1.1328125, "learning_rate": 0.0002445, "loss": 6.9026, "mean_token_accuracy": 0.0947590596973896, "num_tokens": 868624.0, "step": 490 }, { "entropy": 7.27272310256958, "epoch": 0.02546099837975465, "grad_norm": 1.15625, "learning_rate": 0.000247, "loss": 6.893, "mean_token_accuracy": 0.09338614419102668, "num_tokens": 877592.0, "step": 495 }, { "entropy": 7.275995779037475, "epoch": 0.025718180181570353, "grad_norm": 1.2578125, "learning_rate": 0.0002495, "loss": 6.8668, "mean_token_accuracy": 0.09461153075098991, "num_tokens": 886470.0, "step": 500 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1206164846592000.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }