{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.20574544145256282, "eval_steps": 500, "global_step": 4000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.691593360900878, "epoch": 0.0002571818018157035, "grad_norm": 13.5625, "learning_rate": 2e-06, "loss": 10.761, "mean_token_accuracy": 0.00011363636003807187, "num_tokens": 8373.0, "step": 5 }, { "entropy": 10.691572093963623, "epoch": 0.000514363603631407, "grad_norm": 12.375, "learning_rate": 4.5e-06, "loss": 10.7039, "mean_token_accuracy": 0.0, "num_tokens": 17090.0, "step": 10 }, { "entropy": 10.691090297698974, "epoch": 0.0007715454054471106, "grad_norm": 9.875, "learning_rate": 7e-06, "loss": 10.5011, "mean_token_accuracy": 0.018853903049603105, "num_tokens": 26219.0, "step": 15 }, { "entropy": 10.680709075927734, "epoch": 0.001028727207262814, "grad_norm": 6.03125, "learning_rate": 9.5e-06, "loss": 10.2462, "mean_token_accuracy": 0.04484990499913692, "num_tokens": 36191.0, "step": 20 }, { "entropy": 10.582563495635986, "epoch": 0.0012859090090785177, "grad_norm": 3.9375, "learning_rate": 1.2e-05, "loss": 9.9749, "mean_token_accuracy": 0.040961484611034396, "num_tokens": 45318.0, "step": 25 }, { "entropy": 10.534116744995117, "epoch": 0.0015430908108942211, "grad_norm": 3.703125, "learning_rate": 1.4500000000000002e-05, "loss": 9.8021, "mean_token_accuracy": 0.04536043591797352, "num_tokens": 53102.0, "step": 30 }, { "entropy": 10.562399864196777, "epoch": 0.0018002726127099246, "grad_norm": 2.984375, "learning_rate": 1.7000000000000003e-05, "loss": 9.7539, "mean_token_accuracy": 0.042898242548108104, "num_tokens": 61808.0, "step": 35 }, { "entropy": 10.547216129302978, "epoch": 0.002057454414525628, "grad_norm": 2.8125, "learning_rate": 1.95e-05, "loss": 9.7136, "mean_token_accuracy": 0.044699297100305554, "num_tokens": 70708.0, "step": 40 }, { "entropy": 10.517444515228272, "epoch": 0.0023146362163413317, "grad_norm": 2.5, "learning_rate": 2.2e-05, "loss": 9.632, "mean_token_accuracy": 0.04661537855863571, "num_tokens": 79541.0, "step": 45 }, { "entropy": 10.505586051940918, "epoch": 0.0025718180181570354, "grad_norm": 2.40625, "learning_rate": 2.4500000000000003e-05, "loss": 9.5459, "mean_token_accuracy": 0.05164888352155685, "num_tokens": 87073.0, "step": 50 }, { "entropy": 10.474337196350097, "epoch": 0.0028289998199727386, "grad_norm": 2.25, "learning_rate": 2.7e-05, "loss": 9.5486, "mean_token_accuracy": 0.059509020671248435, "num_tokens": 96581.0, "step": 55 }, { "entropy": 10.405019569396973, "epoch": 0.0030861816217884423, "grad_norm": 2.359375, "learning_rate": 2.95e-05, "loss": 9.4782, "mean_token_accuracy": 0.060714465007185935, "num_tokens": 105741.0, "step": 60 }, { "entropy": 10.288742446899414, "epoch": 0.003343363423604146, "grad_norm": 2.125, "learning_rate": 3.2e-05, "loss": 9.385, "mean_token_accuracy": 0.061338124051690104, "num_tokens": 114609.0, "step": 65 }, { "entropy": 10.352596855163574, "epoch": 0.003600545225419849, "grad_norm": 2.125, "learning_rate": 3.4500000000000005e-05, "loss": 9.35, "mean_token_accuracy": 0.05903933756053448, "num_tokens": 123922.0, "step": 70 }, { "entropy": 10.332678699493409, "epoch": 0.003857727027235553, "grad_norm": 2.125, "learning_rate": 3.7e-05, "loss": 9.2218, "mean_token_accuracy": 0.06484894305467606, "num_tokens": 133213.0, "step": 75 }, { "entropy": 10.27952938079834, "epoch": 0.004114908829051256, "grad_norm": 1.96875, "learning_rate": 3.95e-05, "loss": 9.1737, "mean_token_accuracy": 0.06273005269467831, "num_tokens": 141582.0, "step": 80 }, { "entropy": 10.254050540924073, "epoch": 0.00437209063086696, "grad_norm": 2.0625, "learning_rate": 4.2000000000000004e-05, "loss": 8.9925, "mean_token_accuracy": 0.06865651868283748, "num_tokens": 149709.0, "step": 85 }, { "entropy": 10.210903453826905, "epoch": 0.004629272432682663, "grad_norm": 1.8203125, "learning_rate": 4.45e-05, "loss": 8.856, "mean_token_accuracy": 0.07082752697169781, "num_tokens": 158239.0, "step": 90 }, { "entropy": 10.24482765197754, "epoch": 0.004886454234498367, "grad_norm": 1.7578125, "learning_rate": 4.7000000000000004e-05, "loss": 8.9023, "mean_token_accuracy": 0.0604440800845623, "num_tokens": 168046.0, "step": 95 }, { "entropy": 10.135429000854492, "epoch": 0.005143636036314071, "grad_norm": 1.53125, "learning_rate": 4.9500000000000004e-05, "loss": 8.8077, "mean_token_accuracy": 0.06280115209519863, "num_tokens": 177797.0, "step": 100 }, { "entropy": 10.110702419281006, "epoch": 0.0054008178381297735, "grad_norm": 1.796875, "learning_rate": 5.2e-05, "loss": 8.6609, "mean_token_accuracy": 0.06286422722041607, "num_tokens": 186664.0, "step": 105 }, { "entropy": 10.024668121337891, "epoch": 0.005657999639945477, "grad_norm": 1.5546875, "learning_rate": 5.45e-05, "loss": 8.5449, "mean_token_accuracy": 0.06326077207922935, "num_tokens": 195404.0, "step": 110 }, { "entropy": 9.922544002532959, "epoch": 0.005915181441761181, "grad_norm": 1.5546875, "learning_rate": 5.7e-05, "loss": 8.4327, "mean_token_accuracy": 0.06552885584533215, "num_tokens": 204248.0, "step": 115 }, { "entropy": 9.780591869354248, "epoch": 0.0061723632435768845, "grad_norm": 1.515625, "learning_rate": 5.9499999999999996e-05, "loss": 8.2869, "mean_token_accuracy": 0.060110585764050484, "num_tokens": 214042.0, "step": 120 }, { "entropy": 9.649379444122314, "epoch": 0.006429545045392588, "grad_norm": 1.390625, "learning_rate": 6.2e-05, "loss": 8.189, "mean_token_accuracy": 0.06577248759567737, "num_tokens": 223194.0, "step": 125 }, { "entropy": 9.431284046173095, "epoch": 0.006686726847208292, "grad_norm": 1.484375, "learning_rate": 6.450000000000001e-05, "loss": 7.9307, "mean_token_accuracy": 0.07218964248895646, "num_tokens": 230929.0, "step": 130 }, { "entropy": 9.260346984863281, "epoch": 0.006943908649023995, "grad_norm": 1.734375, "learning_rate": 6.7e-05, "loss": 7.9081, "mean_token_accuracy": 0.07038265988230705, "num_tokens": 238687.0, "step": 135 }, { "entropy": 9.035238265991211, "epoch": 0.007201090450839698, "grad_norm": 1.4921875, "learning_rate": 6.950000000000001e-05, "loss": 7.8152, "mean_token_accuracy": 0.07054561264812946, "num_tokens": 247397.0, "step": 140 }, { "entropy": 8.894649696350097, "epoch": 0.007458272252655402, "grad_norm": 1.4453125, "learning_rate": 7.2e-05, "loss": 7.7444, "mean_token_accuracy": 0.07246604040265084, "num_tokens": 255924.0, "step": 145 }, { "entropy": 8.742353820800782, "epoch": 0.007715454054471106, "grad_norm": 1.2890625, "learning_rate": 7.45e-05, "loss": 7.6781, "mean_token_accuracy": 0.06747029088437557, "num_tokens": 264767.0, "step": 150 }, { "entropy": 8.636024761199952, "epoch": 0.00797263585628681, "grad_norm": 1.1640625, "learning_rate": 7.7e-05, "loss": 7.6787, "mean_token_accuracy": 0.07033539973199368, "num_tokens": 274250.0, "step": 155 }, { "entropy": 8.433564472198487, "epoch": 0.008229817658102512, "grad_norm": 1.3828125, "learning_rate": 7.950000000000001e-05, "loss": 7.5648, "mean_token_accuracy": 0.07707317210733891, "num_tokens": 282568.0, "step": 160 }, { "entropy": 8.366222667694093, "epoch": 0.008486999459918217, "grad_norm": 1.3671875, "learning_rate": 8.2e-05, "loss": 7.5969, "mean_token_accuracy": 0.06956044659018516, "num_tokens": 291126.0, "step": 165 }, { "entropy": 8.285852527618408, "epoch": 0.00874418126173392, "grad_norm": 1.1953125, "learning_rate": 8.450000000000001e-05, "loss": 7.5209, "mean_token_accuracy": 0.07576571702957154, "num_tokens": 299751.0, "step": 170 }, { "entropy": 8.235202884674072, "epoch": 0.009001363063549624, "grad_norm": 1.2734375, "learning_rate": 8.7e-05, "loss": 7.5119, "mean_token_accuracy": 0.07470664568245411, "num_tokens": 309560.0, "step": 175 }, { "entropy": 8.157529830932617, "epoch": 0.009258544865365327, "grad_norm": 1.296875, "learning_rate": 8.95e-05, "loss": 7.4928, "mean_token_accuracy": 0.06981925927102565, "num_tokens": 318613.0, "step": 180 }, { "entropy": 8.12168264389038, "epoch": 0.00951572666718103, "grad_norm": 1.328125, "learning_rate": 9.2e-05, "loss": 7.551, "mean_token_accuracy": 0.07186717689037322, "num_tokens": 327650.0, "step": 185 }, { "entropy": 8.121650791168213, "epoch": 0.009772908468996734, "grad_norm": 1.125, "learning_rate": 9.45e-05, "loss": 7.4394, "mean_token_accuracy": 0.07240154445171357, "num_tokens": 337198.0, "step": 190 }, { "entropy": 8.03664698600769, "epoch": 0.010030090270812437, "grad_norm": 1.34375, "learning_rate": 9.7e-05, "loss": 7.5301, "mean_token_accuracy": 0.07011710181832313, "num_tokens": 346179.0, "step": 195 }, { "entropy": 8.069316053390503, "epoch": 0.010287272072628141, "grad_norm": 1.6875, "learning_rate": 9.95e-05, "loss": 7.4276, "mean_token_accuracy": 0.07499495595693588, "num_tokens": 355972.0, "step": 200 }, { "entropy": 7.968952226638794, "epoch": 0.010544453874443844, "grad_norm": 1.4375, "learning_rate": 0.000102, "loss": 7.3626, "mean_token_accuracy": 0.077250687032938, "num_tokens": 364635.0, "step": 205 }, { "entropy": 7.948678016662598, "epoch": 0.010801635676259547, "grad_norm": 1.328125, "learning_rate": 0.00010449999999999999, "loss": 7.5125, "mean_token_accuracy": 0.07722728103399276, "num_tokens": 374161.0, "step": 210 }, { "entropy": 7.955185747146606, "epoch": 0.011058817478075252, "grad_norm": 1.1875, "learning_rate": 0.000107, "loss": 7.3673, "mean_token_accuracy": 0.0733168862760067, "num_tokens": 383641.0, "step": 215 }, { "entropy": 7.921580362319946, "epoch": 0.011315999279890954, "grad_norm": 1.3515625, "learning_rate": 0.0001095, "loss": 7.3171, "mean_token_accuracy": 0.0784445971250534, "num_tokens": 392300.0, "step": 220 }, { "entropy": 7.939724063873291, "epoch": 0.011573181081706659, "grad_norm": 1.3125, "learning_rate": 0.000112, "loss": 7.3486, "mean_token_accuracy": 0.07721329033374787, "num_tokens": 400721.0, "step": 225 }, { "entropy": 7.914973640441895, "epoch": 0.011830362883522362, "grad_norm": 1.265625, "learning_rate": 0.0001145, "loss": 7.3563, "mean_token_accuracy": 0.08054085932672024, "num_tokens": 410261.0, "step": 230 }, { "entropy": 7.840137624740601, "epoch": 0.012087544685338066, "grad_norm": 1.296875, "learning_rate": 0.00011700000000000001, "loss": 7.2993, "mean_token_accuracy": 0.08381507098674774, "num_tokens": 419006.0, "step": 235 }, { "entropy": 7.865709638595581, "epoch": 0.012344726487153769, "grad_norm": 1.1953125, "learning_rate": 0.00011949999999999999, "loss": 7.3679, "mean_token_accuracy": 0.07533743120729923, "num_tokens": 428773.0, "step": 240 }, { "entropy": 7.8893204689025875, "epoch": 0.012601908288969472, "grad_norm": 1.5390625, "learning_rate": 0.000122, "loss": 7.2843, "mean_token_accuracy": 0.08408410698175431, "num_tokens": 438111.0, "step": 245 }, { "entropy": 7.718148136138916, "epoch": 0.012859090090785176, "grad_norm": 1.3046875, "learning_rate": 0.0001245, "loss": 7.2826, "mean_token_accuracy": 0.07801055312156677, "num_tokens": 447352.0, "step": 250 }, { "entropy": 7.834936952590942, "epoch": 0.01311627189260088, "grad_norm": 1.2421875, "learning_rate": 0.000127, "loss": 7.2718, "mean_token_accuracy": 0.08380828946828842, "num_tokens": 456118.0, "step": 255 }, { "entropy": 7.78115496635437, "epoch": 0.013373453694416584, "grad_norm": 1.3359375, "learning_rate": 0.0001295, "loss": 7.3091, "mean_token_accuracy": 0.0782765805721283, "num_tokens": 465016.0, "step": 260 }, { "entropy": 7.746971464157104, "epoch": 0.013630635496232286, "grad_norm": 1.234375, "learning_rate": 0.000132, "loss": 7.2129, "mean_token_accuracy": 0.0813664972782135, "num_tokens": 473828.0, "step": 265 }, { "entropy": 7.73144416809082, "epoch": 0.01388781729804799, "grad_norm": 1.125, "learning_rate": 0.00013450000000000002, "loss": 7.1867, "mean_token_accuracy": 0.08951399773359299, "num_tokens": 482481.0, "step": 270 }, { "entropy": 7.821958923339844, "epoch": 0.014144999099863694, "grad_norm": 1.34375, "learning_rate": 0.00013700000000000002, "loss": 7.2565, "mean_token_accuracy": 0.08631709441542626, "num_tokens": 491784.0, "step": 275 }, { "entropy": 7.713495445251465, "epoch": 0.014402180901679397, "grad_norm": 1.421875, "learning_rate": 0.0001395, "loss": 7.3491, "mean_token_accuracy": 0.0803300604224205, "num_tokens": 501227.0, "step": 280 }, { "entropy": 7.609055280685425, "epoch": 0.014659362703495101, "grad_norm": 1.6640625, "learning_rate": 0.00014199999999999998, "loss": 7.1247, "mean_token_accuracy": 0.0826262541115284, "num_tokens": 509566.0, "step": 285 }, { "entropy": 7.692761611938477, "epoch": 0.014916544505310804, "grad_norm": 1.3984375, "learning_rate": 0.0001445, "loss": 7.1787, "mean_token_accuracy": 0.09211432188749313, "num_tokens": 517517.0, "step": 290 }, { "entropy": 7.6960266590118405, "epoch": 0.015173726307126508, "grad_norm": 1.21875, "learning_rate": 0.000147, "loss": 7.2176, "mean_token_accuracy": 0.0820289522409439, "num_tokens": 526279.0, "step": 295 }, { "entropy": 7.665759134292602, "epoch": 0.015430908108942211, "grad_norm": 1.171875, "learning_rate": 0.0001495, "loss": 7.1406, "mean_token_accuracy": 0.0928925946354866, "num_tokens": 534516.0, "step": 300 }, { "entropy": 7.661193418502807, "epoch": 0.015688089910757916, "grad_norm": 1.3671875, "learning_rate": 0.000152, "loss": 7.2216, "mean_token_accuracy": 0.08248281478881836, "num_tokens": 543828.0, "step": 305 }, { "entropy": 7.662406015396118, "epoch": 0.01594527171257362, "grad_norm": 1.2734375, "learning_rate": 0.00015450000000000001, "loss": 7.1559, "mean_token_accuracy": 0.08263281881809234, "num_tokens": 552530.0, "step": 310 }, { "entropy": 7.536833572387695, "epoch": 0.01620245351438932, "grad_norm": 1.359375, "learning_rate": 0.000157, "loss": 7.1062, "mean_token_accuracy": 0.08527780249714852, "num_tokens": 561475.0, "step": 315 }, { "entropy": 7.684497308731079, "epoch": 0.016459635316205024, "grad_norm": 1.4609375, "learning_rate": 0.0001595, "loss": 7.1742, "mean_token_accuracy": 0.08275718316435814, "num_tokens": 569852.0, "step": 320 }, { "entropy": 7.586278247833252, "epoch": 0.01671681711802073, "grad_norm": 1.203125, "learning_rate": 0.000162, "loss": 7.2073, "mean_token_accuracy": 0.08587946742773056, "num_tokens": 578326.0, "step": 325 }, { "entropy": 7.664967060089111, "epoch": 0.016973998919836433, "grad_norm": 1.1484375, "learning_rate": 0.00016450000000000001, "loss": 7.238, "mean_token_accuracy": 0.08378956839442253, "num_tokens": 587606.0, "step": 330 }, { "entropy": 7.510732364654541, "epoch": 0.017231180721652136, "grad_norm": 1.3828125, "learning_rate": 0.00016700000000000002, "loss": 6.9636, "mean_token_accuracy": 0.09541863054037095, "num_tokens": 595321.0, "step": 335 }, { "entropy": 7.525554895401001, "epoch": 0.01748836252346784, "grad_norm": 1.1875, "learning_rate": 0.00016950000000000003, "loss": 7.0757, "mean_token_accuracy": 0.08646541684865952, "num_tokens": 603836.0, "step": 340 }, { "entropy": 7.485527229309082, "epoch": 0.01774554432528354, "grad_norm": 1.359375, "learning_rate": 0.00017199999999999998, "loss": 7.0746, "mean_token_accuracy": 0.08882175087928772, "num_tokens": 612847.0, "step": 345 }, { "entropy": 7.5213652610778805, "epoch": 0.018002726127099248, "grad_norm": 1.2734375, "learning_rate": 0.00017449999999999999, "loss": 7.1177, "mean_token_accuracy": 0.08585901409387589, "num_tokens": 620840.0, "step": 350 }, { "entropy": 7.538561153411865, "epoch": 0.01825990792891495, "grad_norm": 1.4140625, "learning_rate": 0.000177, "loss": 7.0237, "mean_token_accuracy": 0.09108547568321228, "num_tokens": 629495.0, "step": 355 }, { "entropy": 7.50935378074646, "epoch": 0.018517089730730654, "grad_norm": 1.203125, "learning_rate": 0.0001795, "loss": 7.1784, "mean_token_accuracy": 0.08739718049764633, "num_tokens": 638589.0, "step": 360 }, { "entropy": 7.4144041538238525, "epoch": 0.018774271532546356, "grad_norm": 1.2890625, "learning_rate": 0.000182, "loss": 7.05, "mean_token_accuracy": 0.08531938642263412, "num_tokens": 647713.0, "step": 365 }, { "entropy": 7.665746688842773, "epoch": 0.01903145333436206, "grad_norm": 1.40625, "learning_rate": 0.0001845, "loss": 7.1511, "mean_token_accuracy": 0.08770897537469864, "num_tokens": 656472.0, "step": 370 }, { "entropy": 7.371031093597412, "epoch": 0.019288635136177765, "grad_norm": 1.5625, "learning_rate": 0.000187, "loss": 7.0004, "mean_token_accuracy": 0.09101735278964043, "num_tokens": 664858.0, "step": 375 }, { "entropy": 7.439912271499634, "epoch": 0.019545816937993468, "grad_norm": 1.1796875, "learning_rate": 0.0001895, "loss": 7.0322, "mean_token_accuracy": 0.09086323380470276, "num_tokens": 673675.0, "step": 380 }, { "entropy": 7.4977442741394045, "epoch": 0.01980299873980917, "grad_norm": 1.3046875, "learning_rate": 0.000192, "loss": 7.1526, "mean_token_accuracy": 0.0906866118311882, "num_tokens": 681968.0, "step": 385 }, { "entropy": 7.431271123886108, "epoch": 0.020060180541624874, "grad_norm": 1.1640625, "learning_rate": 0.0001945, "loss": 7.0089, "mean_token_accuracy": 0.09397086799144745, "num_tokens": 690447.0, "step": 390 }, { "entropy": 7.5096940994262695, "epoch": 0.020317362343440577, "grad_norm": 1.1953125, "learning_rate": 0.00019700000000000002, "loss": 7.0298, "mean_token_accuracy": 0.09151682630181313, "num_tokens": 699659.0, "step": 395 }, { "entropy": 7.40989465713501, "epoch": 0.020574544145256283, "grad_norm": 1.4921875, "learning_rate": 0.00019950000000000002, "loss": 7.0506, "mean_token_accuracy": 0.09182499945163727, "num_tokens": 708342.0, "step": 400 }, { "entropy": 7.437063407897949, "epoch": 0.020831725947071986, "grad_norm": 1.2421875, "learning_rate": 0.000202, "loss": 7.0589, "mean_token_accuracy": 0.08685924187302589, "num_tokens": 717986.0, "step": 405 }, { "entropy": 7.506326389312744, "epoch": 0.02108890774888769, "grad_norm": 1.1875, "learning_rate": 0.00020449999999999998, "loss": 7.0868, "mean_token_accuracy": 0.08464771658182144, "num_tokens": 727397.0, "step": 410 }, { "entropy": 7.389501142501831, "epoch": 0.02134608955070339, "grad_norm": 1.109375, "learning_rate": 0.000207, "loss": 7.0421, "mean_token_accuracy": 0.09134713932871819, "num_tokens": 736291.0, "step": 415 }, { "entropy": 7.398612976074219, "epoch": 0.021603271352519094, "grad_norm": 1.3046875, "learning_rate": 0.0002095, "loss": 7.0983, "mean_token_accuracy": 0.08749841973185539, "num_tokens": 745132.0, "step": 420 }, { "entropy": 7.387109804153442, "epoch": 0.0218604531543348, "grad_norm": 1.359375, "learning_rate": 0.000212, "loss": 6.9801, "mean_token_accuracy": 0.09526508301496506, "num_tokens": 753535.0, "step": 425 }, { "entropy": 7.287825727462769, "epoch": 0.022117634956150503, "grad_norm": 1.34375, "learning_rate": 0.0002145, "loss": 6.8881, "mean_token_accuracy": 0.09665613695979118, "num_tokens": 762626.0, "step": 430 }, { "entropy": 7.425317716598511, "epoch": 0.022374816757966206, "grad_norm": 1.265625, "learning_rate": 0.00021700000000000002, "loss": 7.0183, "mean_token_accuracy": 0.08952494263648987, "num_tokens": 771802.0, "step": 435 }, { "entropy": 7.3904194831848145, "epoch": 0.02263199855978191, "grad_norm": 1.109375, "learning_rate": 0.0002195, "loss": 7.055, "mean_token_accuracy": 0.09687120616436004, "num_tokens": 780444.0, "step": 440 }, { "entropy": 7.46030330657959, "epoch": 0.022889180361597615, "grad_norm": 1.28125, "learning_rate": 0.000222, "loss": 7.0891, "mean_token_accuracy": 0.08583850935101509, "num_tokens": 789335.0, "step": 445 }, { "entropy": 7.254354047775268, "epoch": 0.023146362163413318, "grad_norm": 1.3828125, "learning_rate": 0.0002245, "loss": 6.9291, "mean_token_accuracy": 0.09709356278181076, "num_tokens": 797891.0, "step": 450 }, { "entropy": 7.221427774429321, "epoch": 0.02340354396522902, "grad_norm": 1.328125, "learning_rate": 0.00022700000000000002, "loss": 6.9026, "mean_token_accuracy": 0.09430735632777214, "num_tokens": 806238.0, "step": 455 }, { "entropy": 7.3990577220916744, "epoch": 0.023660725767044723, "grad_norm": 1.4765625, "learning_rate": 0.00022950000000000002, "loss": 6.9081, "mean_token_accuracy": 0.09148178026080131, "num_tokens": 814430.0, "step": 460 }, { "entropy": 7.347194242477417, "epoch": 0.023917907568860426, "grad_norm": 1.140625, "learning_rate": 0.00023200000000000003, "loss": 7.0802, "mean_token_accuracy": 0.08918680474162102, "num_tokens": 823546.0, "step": 465 }, { "entropy": 7.322706604003907, "epoch": 0.024175089370676132, "grad_norm": 1.3203125, "learning_rate": 0.00023449999999999998, "loss": 6.8709, "mean_token_accuracy": 0.0952567420899868, "num_tokens": 832885.0, "step": 470 }, { "entropy": 7.260769939422607, "epoch": 0.024432271172491835, "grad_norm": 1.171875, "learning_rate": 0.000237, "loss": 6.8382, "mean_token_accuracy": 0.09813853800296783, "num_tokens": 841140.0, "step": 475 }, { "entropy": 7.244242477416992, "epoch": 0.024689452974307538, "grad_norm": 1.5703125, "learning_rate": 0.0002395, "loss": 6.9147, "mean_token_accuracy": 0.09300818815827369, "num_tokens": 849768.0, "step": 480 }, { "entropy": 7.25398006439209, "epoch": 0.02494663477612324, "grad_norm": 1.09375, "learning_rate": 0.000242, "loss": 6.8165, "mean_token_accuracy": 0.09476587101817131, "num_tokens": 859080.0, "step": 485 }, { "entropy": 7.220676612854004, "epoch": 0.025203816577938944, "grad_norm": 1.1328125, "learning_rate": 0.0002445, "loss": 6.9026, "mean_token_accuracy": 0.0947590596973896, "num_tokens": 868624.0, "step": 490 }, { "entropy": 7.27272310256958, "epoch": 0.02546099837975465, "grad_norm": 1.15625, "learning_rate": 0.000247, "loss": 6.893, "mean_token_accuracy": 0.09338614419102668, "num_tokens": 877592.0, "step": 495 }, { "entropy": 7.275995779037475, "epoch": 0.025718180181570353, "grad_norm": 1.2578125, "learning_rate": 0.0002495, "loss": 6.8668, "mean_token_accuracy": 0.09461153075098991, "num_tokens": 886470.0, "step": 500 }, { "entropy": 7.182675886154175, "epoch": 0.025975361983386056, "grad_norm": 1.203125, "learning_rate": 0.000252, "loss": 6.9033, "mean_token_accuracy": 0.09226062297821044, "num_tokens": 895940.0, "step": 505 }, { "entropy": 7.2134950160980225, "epoch": 0.02623254378520176, "grad_norm": 1.1328125, "learning_rate": 0.0002545, "loss": 6.9523, "mean_token_accuracy": 0.09598998427391052, "num_tokens": 905344.0, "step": 510 }, { "entropy": 7.144832706451416, "epoch": 0.02648972558701746, "grad_norm": 1.28125, "learning_rate": 0.000257, "loss": 6.8974, "mean_token_accuracy": 0.09212475568056107, "num_tokens": 914323.0, "step": 515 }, { "entropy": 7.195075178146363, "epoch": 0.026746907388833167, "grad_norm": 1.3515625, "learning_rate": 0.0002595, "loss": 6.8358, "mean_token_accuracy": 0.0931648664176464, "num_tokens": 922913.0, "step": 520 }, { "entropy": 7.201556158065796, "epoch": 0.02700408919064887, "grad_norm": 1.2109375, "learning_rate": 0.000262, "loss": 6.9151, "mean_token_accuracy": 0.08820494934916497, "num_tokens": 931487.0, "step": 525 }, { "entropy": 7.12173867225647, "epoch": 0.027261270992464573, "grad_norm": 1.25, "learning_rate": 0.00026450000000000003, "loss": 6.8622, "mean_token_accuracy": 0.09719429761171341, "num_tokens": 939694.0, "step": 530 }, { "entropy": 7.300619316101074, "epoch": 0.027518452794280276, "grad_norm": 1.3203125, "learning_rate": 0.00026700000000000004, "loss": 6.8258, "mean_token_accuracy": 0.1024305358529091, "num_tokens": 948437.0, "step": 535 }, { "entropy": 7.087061405181885, "epoch": 0.02777563459609598, "grad_norm": 1.359375, "learning_rate": 0.00026950000000000005, "loss": 6.7424, "mean_token_accuracy": 0.09930474832653999, "num_tokens": 957490.0, "step": 540 }, { "entropy": 6.975574159622193, "epoch": 0.028032816397911685, "grad_norm": 1.2109375, "learning_rate": 0.00027200000000000005, "loss": 6.6873, "mean_token_accuracy": 0.10134570002555847, "num_tokens": 966077.0, "step": 545 }, { "entropy": 7.103092670440674, "epoch": 0.028289998199727388, "grad_norm": 1.1875, "learning_rate": 0.0002745, "loss": 6.7758, "mean_token_accuracy": 0.09924016520380974, "num_tokens": 974788.0, "step": 550 }, { "entropy": 7.049304628372193, "epoch": 0.02854718000154309, "grad_norm": 1.453125, "learning_rate": 0.000277, "loss": 6.8437, "mean_token_accuracy": 0.09455109983682633, "num_tokens": 983645.0, "step": 555 }, { "entropy": 7.199927759170532, "epoch": 0.028804361803358793, "grad_norm": 1.3984375, "learning_rate": 0.0002795, "loss": 6.8972, "mean_token_accuracy": 0.09381847679615021, "num_tokens": 991795.0, "step": 560 }, { "entropy": 7.130536651611328, "epoch": 0.0290615436051745, "grad_norm": 1.234375, "learning_rate": 0.00028199999999999997, "loss": 6.8817, "mean_token_accuracy": 0.0921133041381836, "num_tokens": 1000732.0, "step": 565 }, { "entropy": 7.128713464736938, "epoch": 0.029318725406990202, "grad_norm": 1.2421875, "learning_rate": 0.0002845, "loss": 6.7298, "mean_token_accuracy": 0.10322466343641282, "num_tokens": 1009016.0, "step": 570 }, { "entropy": 7.071855258941651, "epoch": 0.029575907208805905, "grad_norm": 1.28125, "learning_rate": 0.000287, "loss": 6.8085, "mean_token_accuracy": 0.10027840360999107, "num_tokens": 1017497.0, "step": 575 }, { "entropy": 7.045392799377441, "epoch": 0.029833089010621608, "grad_norm": 1.390625, "learning_rate": 0.0002895, "loss": 6.7627, "mean_token_accuracy": 0.09184609279036522, "num_tokens": 1026437.0, "step": 580 }, { "entropy": 7.177649688720703, "epoch": 0.03009027081243731, "grad_norm": 1.4375, "learning_rate": 0.000292, "loss": 6.7745, "mean_token_accuracy": 0.10040023326873779, "num_tokens": 1034621.0, "step": 585 }, { "entropy": 7.030013942718506, "epoch": 0.030347452614253017, "grad_norm": 1.140625, "learning_rate": 0.0002945, "loss": 6.8522, "mean_token_accuracy": 0.09577706381678582, "num_tokens": 1043665.0, "step": 590 }, { "entropy": 7.080531978607178, "epoch": 0.03060463441606872, "grad_norm": 1.359375, "learning_rate": 0.000297, "loss": 6.8845, "mean_token_accuracy": 0.09267403185367584, "num_tokens": 1052891.0, "step": 595 }, { "entropy": 7.106464290618897, "epoch": 0.030861816217884423, "grad_norm": 1.3984375, "learning_rate": 0.0002995, "loss": 6.7591, "mean_token_accuracy": 0.10866603180766106, "num_tokens": 1060520.0, "step": 600 }, { "entropy": 7.065040636062622, "epoch": 0.031118998019700125, "grad_norm": 1.3671875, "learning_rate": 0.000302, "loss": 6.7758, "mean_token_accuracy": 0.09805820658802986, "num_tokens": 1069150.0, "step": 605 }, { "entropy": 6.90897569656372, "epoch": 0.03137617982151583, "grad_norm": 1.3203125, "learning_rate": 0.0003045, "loss": 6.6602, "mean_token_accuracy": 0.10792294815182686, "num_tokens": 1077015.0, "step": 610 }, { "entropy": 6.989263916015625, "epoch": 0.03163336162333153, "grad_norm": 1.2421875, "learning_rate": 0.000307, "loss": 6.732, "mean_token_accuracy": 0.09874670803546906, "num_tokens": 1085630.0, "step": 615 }, { "entropy": 7.091088914871216, "epoch": 0.03189054342514724, "grad_norm": 1.3125, "learning_rate": 0.0003095, "loss": 6.8404, "mean_token_accuracy": 0.093934640660882, "num_tokens": 1094423.0, "step": 620 }, { "entropy": 6.986142826080322, "epoch": 0.032147725226962943, "grad_norm": 1.1328125, "learning_rate": 0.000312, "loss": 6.7539, "mean_token_accuracy": 0.09798811599612237, "num_tokens": 1103049.0, "step": 625 }, { "entropy": 7.063631439208985, "epoch": 0.03240490702877864, "grad_norm": 1.375, "learning_rate": 0.0003145, "loss": 6.7592, "mean_token_accuracy": 0.09810860157012939, "num_tokens": 1111852.0, "step": 630 }, { "entropy": 6.935723733901978, "epoch": 0.03266208883059435, "grad_norm": 1.296875, "learning_rate": 0.000317, "loss": 6.6757, "mean_token_accuracy": 0.09773161709308624, "num_tokens": 1121545.0, "step": 635 }, { "entropy": 6.963910818099976, "epoch": 0.03291927063241005, "grad_norm": 1.140625, "learning_rate": 0.0003195, "loss": 6.6986, "mean_token_accuracy": 0.0950073927640915, "num_tokens": 1130639.0, "step": 640 }, { "entropy": 6.92723650932312, "epoch": 0.033176452434225755, "grad_norm": 1.171875, "learning_rate": 0.000322, "loss": 6.6173, "mean_token_accuracy": 0.10274656191468239, "num_tokens": 1138741.0, "step": 645 }, { "entropy": 6.957373142242432, "epoch": 0.03343363423604146, "grad_norm": 1.2578125, "learning_rate": 0.00032450000000000003, "loss": 6.7487, "mean_token_accuracy": 0.10246102660894393, "num_tokens": 1146985.0, "step": 650 }, { "entropy": 6.968684911727905, "epoch": 0.03369081603785716, "grad_norm": 1.2734375, "learning_rate": 0.00032700000000000003, "loss": 6.6421, "mean_token_accuracy": 0.10296816006302834, "num_tokens": 1155393.0, "step": 655 }, { "entropy": 7.074275159835816, "epoch": 0.03394799783967287, "grad_norm": 1.359375, "learning_rate": 0.00032950000000000004, "loss": 6.7709, "mean_token_accuracy": 0.09904137998819351, "num_tokens": 1164285.0, "step": 660 }, { "entropy": 6.8998229026794435, "epoch": 0.034205179641488566, "grad_norm": 1.1875, "learning_rate": 0.00033200000000000005, "loss": 6.7359, "mean_token_accuracy": 0.10153986811637879, "num_tokens": 1172997.0, "step": 665 }, { "entropy": 6.809995031356811, "epoch": 0.03446236144330427, "grad_norm": 1.3515625, "learning_rate": 0.00033450000000000005, "loss": 6.5043, "mean_token_accuracy": 0.10296982899308205, "num_tokens": 1182316.0, "step": 670 }, { "entropy": 6.95496187210083, "epoch": 0.03471954324511998, "grad_norm": 1.359375, "learning_rate": 0.000337, "loss": 6.7375, "mean_token_accuracy": 0.10285088196396827, "num_tokens": 1190660.0, "step": 675 }, { "entropy": 6.985808277130127, "epoch": 0.03497672504693568, "grad_norm": 1.25, "learning_rate": 0.0003395, "loss": 6.7359, "mean_token_accuracy": 0.10022683814167976, "num_tokens": 1199158.0, "step": 680 }, { "entropy": 6.826939868927002, "epoch": 0.035233906848751384, "grad_norm": 1.2734375, "learning_rate": 0.000342, "loss": 6.6363, "mean_token_accuracy": 0.10053048059344291, "num_tokens": 1208550.0, "step": 685 }, { "entropy": 6.928761577606201, "epoch": 0.03549108865056708, "grad_norm": 1.1875, "learning_rate": 0.00034449999999999997, "loss": 6.7171, "mean_token_accuracy": 0.09703745916485787, "num_tokens": 1218526.0, "step": 690 }, { "entropy": 6.970518112182617, "epoch": 0.03574827045238279, "grad_norm": 1.265625, "learning_rate": 0.000347, "loss": 6.8224, "mean_token_accuracy": 0.09267975017428398, "num_tokens": 1227247.0, "step": 695 }, { "entropy": 6.905700254440307, "epoch": 0.036005452254198496, "grad_norm": 1.21875, "learning_rate": 0.0003495, "loss": 6.7287, "mean_token_accuracy": 0.10465597808361053, "num_tokens": 1236146.0, "step": 700 }, { "entropy": 6.922169589996338, "epoch": 0.036262634056014195, "grad_norm": 1.234375, "learning_rate": 0.000352, "loss": 6.7667, "mean_token_accuracy": 0.1004488743841648, "num_tokens": 1244958.0, "step": 705 }, { "entropy": 6.962793493270874, "epoch": 0.0365198158578299, "grad_norm": 1.234375, "learning_rate": 0.0003545, "loss": 6.7626, "mean_token_accuracy": 0.09757086858153344, "num_tokens": 1254502.0, "step": 710 }, { "entropy": 6.917850494384766, "epoch": 0.0367769976596456, "grad_norm": 1.28125, "learning_rate": 0.000357, "loss": 6.691, "mean_token_accuracy": 0.10314588993787766, "num_tokens": 1263291.0, "step": 715 }, { "entropy": 6.852348566055298, "epoch": 0.03703417946146131, "grad_norm": 1.1875, "learning_rate": 0.0003595, "loss": 6.6744, "mean_token_accuracy": 0.10638380572199821, "num_tokens": 1272494.0, "step": 720 }, { "entropy": 6.917734289169312, "epoch": 0.03729136126327701, "grad_norm": 1.328125, "learning_rate": 0.000362, "loss": 6.8097, "mean_token_accuracy": 0.0955355480313301, "num_tokens": 1281611.0, "step": 725 }, { "entropy": 6.913245725631714, "epoch": 0.03754854306509271, "grad_norm": 1.125, "learning_rate": 0.0003645, "loss": 6.6715, "mean_token_accuracy": 0.09784635901451111, "num_tokens": 1291512.0, "step": 730 }, { "entropy": 6.8256752490997314, "epoch": 0.03780572486690842, "grad_norm": 1.2421875, "learning_rate": 0.000367, "loss": 6.5595, "mean_token_accuracy": 0.10571763291954994, "num_tokens": 1300413.0, "step": 735 }, { "entropy": 6.930764818191529, "epoch": 0.03806290666872412, "grad_norm": 1.2421875, "learning_rate": 0.0003695, "loss": 6.7698, "mean_token_accuracy": 0.09721217602491379, "num_tokens": 1309524.0, "step": 740 }, { "entropy": 6.896268653869629, "epoch": 0.038320088470539825, "grad_norm": 1.140625, "learning_rate": 0.000372, "loss": 6.6535, "mean_token_accuracy": 0.10513104945421219, "num_tokens": 1318128.0, "step": 745 }, { "entropy": 6.851891374588012, "epoch": 0.03857727027235553, "grad_norm": 1.2734375, "learning_rate": 0.0003745, "loss": 6.7028, "mean_token_accuracy": 0.09935224205255508, "num_tokens": 1326705.0, "step": 750 }, { "entropy": 6.729863882064819, "epoch": 0.03883445207417123, "grad_norm": 1.234375, "learning_rate": 0.000377, "loss": 6.5243, "mean_token_accuracy": 0.10701719000935554, "num_tokens": 1335271.0, "step": 755 }, { "entropy": 6.829174661636353, "epoch": 0.039091633875986936, "grad_norm": 1.359375, "learning_rate": 0.0003795, "loss": 6.5755, "mean_token_accuracy": 0.10041920840740204, "num_tokens": 1343944.0, "step": 760 }, { "entropy": 6.730857849121094, "epoch": 0.039348815677802636, "grad_norm": 1.1796875, "learning_rate": 0.000382, "loss": 6.5869, "mean_token_accuracy": 0.10631005689501763, "num_tokens": 1352294.0, "step": 765 }, { "entropy": 6.8131995677948, "epoch": 0.03960599747961834, "grad_norm": 1.359375, "learning_rate": 0.0003845, "loss": 6.6112, "mean_token_accuracy": 0.10081271678209305, "num_tokens": 1360533.0, "step": 770 }, { "entropy": 6.826685190200806, "epoch": 0.03986317928143405, "grad_norm": 1.28125, "learning_rate": 0.00038700000000000003, "loss": 6.5435, "mean_token_accuracy": 0.10690599977970124, "num_tokens": 1368880.0, "step": 775 }, { "entropy": 6.743242073059082, "epoch": 0.04012036108324975, "grad_norm": 1.203125, "learning_rate": 0.00038950000000000003, "loss": 6.568, "mean_token_accuracy": 0.10478584542870521, "num_tokens": 1377226.0, "step": 780 }, { "entropy": 6.831422472000122, "epoch": 0.040377542885065454, "grad_norm": 1.296875, "learning_rate": 0.00039200000000000004, "loss": 6.6902, "mean_token_accuracy": 0.1015243612229824, "num_tokens": 1386196.0, "step": 785 }, { "entropy": 6.745612382888794, "epoch": 0.04063472468688115, "grad_norm": 1.2109375, "learning_rate": 0.00039450000000000005, "loss": 6.6026, "mean_token_accuracy": 0.10642225667834282, "num_tokens": 1395019.0, "step": 790 }, { "entropy": 6.7675634860992435, "epoch": 0.04089190648869686, "grad_norm": 1.296875, "learning_rate": 0.00039700000000000005, "loss": 6.7062, "mean_token_accuracy": 0.10018283650279045, "num_tokens": 1404120.0, "step": 795 }, { "entropy": 6.898847818374634, "epoch": 0.041149088290512566, "grad_norm": 1.2421875, "learning_rate": 0.0003995, "loss": 6.5752, "mean_token_accuracy": 0.0967138335108757, "num_tokens": 1412812.0, "step": 800 }, { "entropy": 6.683012008666992, "epoch": 0.041406270092328265, "grad_norm": 1.0859375, "learning_rate": 0.000402, "loss": 6.5476, "mean_token_accuracy": 0.10471888035535812, "num_tokens": 1421439.0, "step": 805 }, { "entropy": 6.711639165878296, "epoch": 0.04166345189414397, "grad_norm": 1.1953125, "learning_rate": 0.0004045, "loss": 6.5496, "mean_token_accuracy": 0.10460042878985405, "num_tokens": 1429882.0, "step": 810 }, { "entropy": 6.719864559173584, "epoch": 0.04192063369595967, "grad_norm": 1.21875, "learning_rate": 0.00040699999999999997, "loss": 6.5972, "mean_token_accuracy": 0.10305096060037613, "num_tokens": 1438918.0, "step": 815 }, { "entropy": 6.770114183425903, "epoch": 0.04217781549777538, "grad_norm": 1.2578125, "learning_rate": 0.0004095, "loss": 6.7244, "mean_token_accuracy": 0.09797946363687515, "num_tokens": 1448337.0, "step": 820 }, { "entropy": 6.901697778701783, "epoch": 0.04243499729959108, "grad_norm": 1.28125, "learning_rate": 0.000412, "loss": 6.6691, "mean_token_accuracy": 0.10322674512863159, "num_tokens": 1457928.0, "step": 825 }, { "entropy": 6.765479469299317, "epoch": 0.04269217910140678, "grad_norm": 1.25, "learning_rate": 0.0004145, "loss": 6.6076, "mean_token_accuracy": 0.11027010977268219, "num_tokens": 1467022.0, "step": 830 }, { "entropy": 6.64197793006897, "epoch": 0.04294936090322249, "grad_norm": 1.09375, "learning_rate": 0.000417, "loss": 6.5992, "mean_token_accuracy": 0.10252309665083885, "num_tokens": 1476510.0, "step": 835 }, { "entropy": 6.800649499893188, "epoch": 0.04320654270503819, "grad_norm": 1.1484375, "learning_rate": 0.0004195, "loss": 6.5706, "mean_token_accuracy": 0.10807883217930794, "num_tokens": 1485141.0, "step": 840 }, { "entropy": 6.722679805755615, "epoch": 0.043463724506853894, "grad_norm": 1.3125, "learning_rate": 0.000422, "loss": 6.6423, "mean_token_accuracy": 0.10095877721905708, "num_tokens": 1494343.0, "step": 845 }, { "entropy": 6.649412488937378, "epoch": 0.0437209063086696, "grad_norm": 1.1171875, "learning_rate": 0.0004245, "loss": 6.5835, "mean_token_accuracy": 0.10432918965816498, "num_tokens": 1503753.0, "step": 850 }, { "entropy": 6.760374069213867, "epoch": 0.0439780881104853, "grad_norm": 1.1875, "learning_rate": 0.000427, "loss": 6.6178, "mean_token_accuracy": 0.09621104225516319, "num_tokens": 1512434.0, "step": 855 }, { "entropy": 6.713858127593994, "epoch": 0.044235269912301006, "grad_norm": 1.265625, "learning_rate": 0.0004295, "loss": 6.4808, "mean_token_accuracy": 0.10826214924454688, "num_tokens": 1521201.0, "step": 860 }, { "entropy": 6.593627119064331, "epoch": 0.04449245171411671, "grad_norm": 1.2734375, "learning_rate": 0.000432, "loss": 6.5988, "mean_token_accuracy": 0.10316284075379371, "num_tokens": 1529958.0, "step": 865 }, { "entropy": 6.778238105773926, "epoch": 0.04474963351593241, "grad_norm": 1.125, "learning_rate": 0.0004345, "loss": 6.5475, "mean_token_accuracy": 0.10538713037967681, "num_tokens": 1539524.0, "step": 870 }, { "entropy": 6.572915077209473, "epoch": 0.04500681531774812, "grad_norm": 1.140625, "learning_rate": 0.000437, "loss": 6.4783, "mean_token_accuracy": 0.10733042433857917, "num_tokens": 1547955.0, "step": 875 }, { "entropy": 6.661984968185425, "epoch": 0.04526399711956382, "grad_norm": 1.2578125, "learning_rate": 0.0004395, "loss": 6.5371, "mean_token_accuracy": 0.10633926317095757, "num_tokens": 1557401.0, "step": 880 }, { "entropy": 6.592761278152466, "epoch": 0.045521178921379524, "grad_norm": 1.265625, "learning_rate": 0.000442, "loss": 6.5084, "mean_token_accuracy": 0.10569668263196945, "num_tokens": 1566022.0, "step": 885 }, { "entropy": 6.636467218399048, "epoch": 0.04577836072319523, "grad_norm": 1.171875, "learning_rate": 0.0004445, "loss": 6.5551, "mean_token_accuracy": 0.10752687007188796, "num_tokens": 1575035.0, "step": 890 }, { "entropy": 6.695861721038819, "epoch": 0.04603554252501093, "grad_norm": 1.140625, "learning_rate": 0.000447, "loss": 6.5778, "mean_token_accuracy": 0.10746671482920647, "num_tokens": 1583357.0, "step": 895 }, { "entropy": 6.70294976234436, "epoch": 0.046292724326826636, "grad_norm": 1.1875, "learning_rate": 0.00044950000000000003, "loss": 6.3892, "mean_token_accuracy": 0.11069994270801545, "num_tokens": 1591702.0, "step": 900 }, { "entropy": 6.617056608200073, "epoch": 0.046549906128642335, "grad_norm": 1.1171875, "learning_rate": 0.00045200000000000004, "loss": 6.4792, "mean_token_accuracy": 0.11211444064974785, "num_tokens": 1600562.0, "step": 905 }, { "entropy": 6.684534406661987, "epoch": 0.04680708793045804, "grad_norm": 1.0625, "learning_rate": 0.00045450000000000004, "loss": 6.6204, "mean_token_accuracy": 0.10558928847312928, "num_tokens": 1610139.0, "step": 910 }, { "entropy": 6.765460586547851, "epoch": 0.04706426973227375, "grad_norm": 1.2734375, "learning_rate": 0.00045700000000000005, "loss": 6.6139, "mean_token_accuracy": 0.10323682352900505, "num_tokens": 1619464.0, "step": 915 }, { "entropy": 6.656091642379761, "epoch": 0.04732145153408945, "grad_norm": 1.1171875, "learning_rate": 0.00045950000000000006, "loss": 6.4596, "mean_token_accuracy": 0.1120453879237175, "num_tokens": 1628632.0, "step": 920 }, { "entropy": 6.445028781890869, "epoch": 0.04757863333590515, "grad_norm": 1.265625, "learning_rate": 0.000462, "loss": 6.4023, "mean_token_accuracy": 0.11046137437224388, "num_tokens": 1636855.0, "step": 925 }, { "entropy": 6.55358853340149, "epoch": 0.04783581513772085, "grad_norm": 1.1484375, "learning_rate": 0.0004645, "loss": 6.3969, "mean_token_accuracy": 0.11445706561207772, "num_tokens": 1645204.0, "step": 930 }, { "entropy": 6.668329048156738, "epoch": 0.04809299693953656, "grad_norm": 1.203125, "learning_rate": 0.000467, "loss": 6.5778, "mean_token_accuracy": 0.10868966206908226, "num_tokens": 1654231.0, "step": 935 }, { "entropy": 6.57129602432251, "epoch": 0.048350178741352265, "grad_norm": 1.1953125, "learning_rate": 0.0004695, "loss": 6.5478, "mean_token_accuracy": 0.1099221870303154, "num_tokens": 1663312.0, "step": 940 }, { "entropy": 6.630906820297241, "epoch": 0.048607360543167964, "grad_norm": 1.0859375, "learning_rate": 0.000472, "loss": 6.5729, "mean_token_accuracy": 0.10720053240656853, "num_tokens": 1672672.0, "step": 945 }, { "entropy": 6.701202535629273, "epoch": 0.04886454234498367, "grad_norm": 1.2421875, "learning_rate": 0.0004745, "loss": 6.6146, "mean_token_accuracy": 0.10442524701356888, "num_tokens": 1681497.0, "step": 950 }, { "entropy": 6.558098268508911, "epoch": 0.04912172414679937, "grad_norm": 1.203125, "learning_rate": 0.000477, "loss": 6.5076, "mean_token_accuracy": 0.10559550374746322, "num_tokens": 1690429.0, "step": 955 }, { "entropy": 6.602577352523804, "epoch": 0.049378905948615076, "grad_norm": 1.3125, "learning_rate": 0.0004795, "loss": 6.4754, "mean_token_accuracy": 0.11203035712242126, "num_tokens": 1698804.0, "step": 960 }, { "entropy": 6.621676778793335, "epoch": 0.04963608775043078, "grad_norm": 1.15625, "learning_rate": 0.000482, "loss": 6.5161, "mean_token_accuracy": 0.1092241458594799, "num_tokens": 1707309.0, "step": 965 }, { "entropy": 6.533698225021363, "epoch": 0.04989326955224648, "grad_norm": 1.171875, "learning_rate": 0.0004845, "loss": 6.4973, "mean_token_accuracy": 0.11040452271699905, "num_tokens": 1716163.0, "step": 970 }, { "entropy": 6.572607231140137, "epoch": 0.05015045135406219, "grad_norm": 1.109375, "learning_rate": 0.000487, "loss": 6.547, "mean_token_accuracy": 0.10961430817842484, "num_tokens": 1725316.0, "step": 975 }, { "entropy": 6.6284825801849365, "epoch": 0.05040763315587789, "grad_norm": 1.125, "learning_rate": 0.0004895, "loss": 6.5083, "mean_token_accuracy": 0.11171742677688598, "num_tokens": 1735193.0, "step": 980 }, { "entropy": 6.561748790740967, "epoch": 0.050664814957693594, "grad_norm": 1.1328125, "learning_rate": 0.000492, "loss": 6.4313, "mean_token_accuracy": 0.10571753829717637, "num_tokens": 1744624.0, "step": 985 }, { "entropy": 6.532333707809448, "epoch": 0.0509219967595093, "grad_norm": 1.171875, "learning_rate": 0.0004945, "loss": 6.4262, "mean_token_accuracy": 0.1134820282459259, "num_tokens": 1753566.0, "step": 990 }, { "entropy": 6.585614109039307, "epoch": 0.051179178561325, "grad_norm": 1.2734375, "learning_rate": 0.000497, "loss": 6.5563, "mean_token_accuracy": 0.10488807931542396, "num_tokens": 1762793.0, "step": 995 }, { "entropy": 6.60942120552063, "epoch": 0.051436360363140705, "grad_norm": 1.1328125, "learning_rate": 0.0004995, "loss": 6.5411, "mean_token_accuracy": 0.10642052963376045, "num_tokens": 1771511.0, "step": 1000 }, { "entropy": 6.607848262786865, "epoch": 0.051693542164956405, "grad_norm": 1.171875, "learning_rate": 0.000499998026082006, "loss": 6.5517, "mean_token_accuracy": 0.10087490379810334, "num_tokens": 1780230.0, "step": 1005 }, { "entropy": 6.517893648147583, "epoch": 0.05195072396677211, "grad_norm": 1.1640625, "learning_rate": 0.0004999900070995136, "loss": 6.4313, "mean_token_accuracy": 0.11181956753134728, "num_tokens": 1789372.0, "step": 1010 }, { "entropy": 6.466477012634277, "epoch": 0.05220790576858782, "grad_norm": 1.21875, "learning_rate": 0.0004999758199023239, "loss": 6.3947, "mean_token_accuracy": 0.11296560466289521, "num_tokens": 1798312.0, "step": 1015 }, { "entropy": 6.519049787521363, "epoch": 0.05246508757040352, "grad_norm": 1.2421875, "learning_rate": 0.0004999554648793858, "loss": 6.3971, "mean_token_accuracy": 0.11271054744720459, "num_tokens": 1806354.0, "step": 1020 }, { "entropy": 6.451335763931274, "epoch": 0.05272226937221922, "grad_norm": 1.265625, "learning_rate": 0.0004999289425887425, "loss": 6.4042, "mean_token_accuracy": 0.11678544953465461, "num_tokens": 1815366.0, "step": 1025 }, { "entropy": 6.533133411407471, "epoch": 0.05297945117403492, "grad_norm": 1.109375, "learning_rate": 0.0004998962537575161, "loss": 6.4659, "mean_token_accuracy": 0.1081003189086914, "num_tokens": 1824645.0, "step": 1030 }, { "entropy": 6.429107570648194, "epoch": 0.05323663297585063, "grad_norm": 1.03125, "learning_rate": 0.0004998573992818874, "loss": 6.4251, "mean_token_accuracy": 0.11395458430051804, "num_tokens": 1833166.0, "step": 1035 }, { "entropy": 6.645290565490723, "epoch": 0.053493814777666335, "grad_norm": 1.109375, "learning_rate": 0.0004998123802270715, "loss": 6.555, "mean_token_accuracy": 0.10978370234370231, "num_tokens": 1842390.0, "step": 1040 }, { "entropy": 6.419606733322143, "epoch": 0.053750996579482034, "grad_norm": 1.140625, "learning_rate": 0.0004997611978272886, "loss": 6.3838, "mean_token_accuracy": 0.1112293429672718, "num_tokens": 1851645.0, "step": 1045 }, { "entropy": 6.453891038894653, "epoch": 0.05400817838129774, "grad_norm": 1.2734375, "learning_rate": 0.0004997038534857298, "loss": 6.3782, "mean_token_accuracy": 0.11755769476294517, "num_tokens": 1860008.0, "step": 1050 }, { "entropy": 6.4972833633422855, "epoch": 0.05426536018311344, "grad_norm": 1.09375, "learning_rate": 0.0004996403487745194, "loss": 6.4343, "mean_token_accuracy": 0.1094091109931469, "num_tokens": 1869329.0, "step": 1055 }, { "entropy": 6.387360382080078, "epoch": 0.054522541984929146, "grad_norm": 1.0859375, "learning_rate": 0.000499570685434671, "loss": 6.3339, "mean_token_accuracy": 0.11642076373100281, "num_tokens": 1878054.0, "step": 1060 }, { "entropy": 6.484694147109986, "epoch": 0.05477972378674485, "grad_norm": 1.1171875, "learning_rate": 0.0004994948653760405, "loss": 6.3946, "mean_token_accuracy": 0.11390996798872947, "num_tokens": 1886581.0, "step": 1065 }, { "entropy": 6.580167531967163, "epoch": 0.05503690558856055, "grad_norm": 1.1328125, "learning_rate": 0.0004994128906772729, "loss": 6.4711, "mean_token_accuracy": 0.11259651854634285, "num_tokens": 1895731.0, "step": 1070 }, { "entropy": 6.423868322372437, "epoch": 0.05529408739037626, "grad_norm": 1.1015625, "learning_rate": 0.000499324763585746, "loss": 6.3499, "mean_token_accuracy": 0.11970952153205872, "num_tokens": 1904181.0, "step": 1075 }, { "entropy": 6.406012630462646, "epoch": 0.05555126919219196, "grad_norm": 1.0859375, "learning_rate": 0.0004992304865175085, "loss": 6.3772, "mean_token_accuracy": 0.11032988727092743, "num_tokens": 1913335.0, "step": 1080 }, { "entropy": 6.484732151031494, "epoch": 0.05580845099400766, "grad_norm": 1.15625, "learning_rate": 0.0004991300620572138, "loss": 6.3966, "mean_token_accuracy": 0.11090287342667579, "num_tokens": 1922789.0, "step": 1085 }, { "entropy": 6.436389446258545, "epoch": 0.05606563279582337, "grad_norm": 1.0859375, "learning_rate": 0.0004990234929580494, "loss": 6.3178, "mean_token_accuracy": 0.11508271917700767, "num_tokens": 1931214.0, "step": 1090 }, { "entropy": 6.433405256271362, "epoch": 0.05632281459763907, "grad_norm": 1.1015625, "learning_rate": 0.0004989107821416609, "loss": 6.4827, "mean_token_accuracy": 0.10500127375125885, "num_tokens": 1941151.0, "step": 1095 }, { "entropy": 6.4416193008422855, "epoch": 0.056579996399454775, "grad_norm": 1.1328125, "learning_rate": 0.0004987919326980723, "loss": 6.331, "mean_token_accuracy": 0.11337620094418525, "num_tokens": 1949326.0, "step": 1100 }, { "entropy": 6.514848232269287, "epoch": 0.05683717820127048, "grad_norm": 1.1171875, "learning_rate": 0.0004986669478856011, "loss": 6.4664, "mean_token_accuracy": 0.10760492980480194, "num_tokens": 1958929.0, "step": 1105 }, { "entropy": 6.39950590133667, "epoch": 0.05709436000308618, "grad_norm": 1.0703125, "learning_rate": 0.0004985358311307688, "loss": 6.2505, "mean_token_accuracy": 0.11898310258984565, "num_tokens": 1967690.0, "step": 1110 }, { "entropy": 6.384913921356201, "epoch": 0.05735154180490189, "grad_norm": 1.015625, "learning_rate": 0.0004983985860282081, "loss": 6.3981, "mean_token_accuracy": 0.11035036444664001, "num_tokens": 1977786.0, "step": 1115 }, { "entropy": 6.379779815673828, "epoch": 0.057608723606717586, "grad_norm": 1.0859375, "learning_rate": 0.0004982552163405623, "loss": 6.3107, "mean_token_accuracy": 0.11793362498283386, "num_tokens": 1986708.0, "step": 1120 }, { "entropy": 6.341381025314331, "epoch": 0.05786590540853329, "grad_norm": 1.078125, "learning_rate": 0.0004981057259983839, "loss": 6.3345, "mean_token_accuracy": 0.11417381316423417, "num_tokens": 1996309.0, "step": 1125 }, { "entropy": 6.446984195709229, "epoch": 0.058123087210349, "grad_norm": 1.140625, "learning_rate": 0.0004979501191000262, "loss": 6.2712, "mean_token_accuracy": 0.11331850737333297, "num_tokens": 2004754.0, "step": 1130 }, { "entropy": 6.322438764572143, "epoch": 0.0583802690121647, "grad_norm": 1.09375, "learning_rate": 0.0004977883999115311, "loss": 6.3644, "mean_token_accuracy": 0.11575946882367134, "num_tokens": 2013231.0, "step": 1135 }, { "entropy": 6.3898763179779055, "epoch": 0.058637450813980405, "grad_norm": 1.1328125, "learning_rate": 0.0004976205728665113, "loss": 6.3163, "mean_token_accuracy": 0.11673919707536698, "num_tokens": 2021918.0, "step": 1140 }, { "entropy": 6.395988273620605, "epoch": 0.058894632615796104, "grad_norm": 1.109375, "learning_rate": 0.0004974466425660307, "loss": 6.3607, "mean_token_accuracy": 0.1184878721833229, "num_tokens": 2030341.0, "step": 1145 }, { "entropy": 6.378729295730591, "epoch": 0.05915181441761181, "grad_norm": 1.1953125, "learning_rate": 0.0004972666137784759, "loss": 6.3114, "mean_token_accuracy": 0.11576305478811263, "num_tokens": 2038869.0, "step": 1150 }, { "entropy": 6.363564395904541, "epoch": 0.059408996219427516, "grad_norm": 1.09375, "learning_rate": 0.0004970804914394271, "loss": 6.3938, "mean_token_accuracy": 0.1138048842549324, "num_tokens": 2047545.0, "step": 1155 }, { "entropy": 6.406496477127075, "epoch": 0.059666178021243216, "grad_norm": 1.078125, "learning_rate": 0.0004968882806515225, "loss": 6.4462, "mean_token_accuracy": 0.11089355796575547, "num_tokens": 2056802.0, "step": 1160 }, { "entropy": 6.383754062652588, "epoch": 0.05992335982305892, "grad_norm": 1.1328125, "learning_rate": 0.0004966899866843177, "loss": 6.3043, "mean_token_accuracy": 0.11790038123726845, "num_tokens": 2065106.0, "step": 1165 }, { "entropy": 6.439864730834961, "epoch": 0.06018054162487462, "grad_norm": 1.0859375, "learning_rate": 0.000496485614974142, "loss": 6.3607, "mean_token_accuracy": 0.11016541495919227, "num_tokens": 2073723.0, "step": 1170 }, { "entropy": 6.336991977691651, "epoch": 0.06043772342669033, "grad_norm": 1.0859375, "learning_rate": 0.0004962751711239492, "loss": 6.2888, "mean_token_accuracy": 0.1206134170293808, "num_tokens": 2082296.0, "step": 1175 }, { "entropy": 6.377587127685547, "epoch": 0.060694905228506034, "grad_norm": 1.140625, "learning_rate": 0.0004960586609031636, "loss": 6.3447, "mean_token_accuracy": 0.11322090104222297, "num_tokens": 2091239.0, "step": 1180 }, { "entropy": 6.373478603363037, "epoch": 0.06095208703032173, "grad_norm": 1.09375, "learning_rate": 0.0004958360902475224, "loss": 6.3073, "mean_token_accuracy": 0.11865990906953812, "num_tokens": 2100809.0, "step": 1185 }, { "entropy": 6.37120213508606, "epoch": 0.06120926883213744, "grad_norm": 1.1953125, "learning_rate": 0.0004956074652589125, "loss": 6.3806, "mean_token_accuracy": 0.11596836000680924, "num_tokens": 2109373.0, "step": 1190 }, { "entropy": 6.386609125137329, "epoch": 0.06146645063395314, "grad_norm": 1.125, "learning_rate": 0.0004953727922052035, "loss": 6.335, "mean_token_accuracy": 0.1201685570180416, "num_tokens": 2117351.0, "step": 1195 }, { "entropy": 6.3725518703460695, "epoch": 0.061723632435768845, "grad_norm": 1.09375, "learning_rate": 0.0004951320775200756, "loss": 6.2876, "mean_token_accuracy": 0.12080588638782501, "num_tokens": 2125792.0, "step": 1200 }, { "entropy": 6.261738634109497, "epoch": 0.06198081423758455, "grad_norm": 1.0703125, "learning_rate": 0.0004948853278028436, "loss": 6.2851, "mean_token_accuracy": 0.12247317284345627, "num_tokens": 2134755.0, "step": 1205 }, { "entropy": 6.426895523071289, "epoch": 0.06223799603940025, "grad_norm": 1.171875, "learning_rate": 0.0004946325498182755, "loss": 6.2479, "mean_token_accuracy": 0.11313225403428077, "num_tokens": 2144063.0, "step": 1210 }, { "entropy": 6.373356294631958, "epoch": 0.06249517784121596, "grad_norm": 1.109375, "learning_rate": 0.0004943737504964076, "loss": 6.3527, "mean_token_accuracy": 0.11966249272227288, "num_tokens": 2153664.0, "step": 1215 }, { "entropy": 6.227408838272095, "epoch": 0.06275235964303166, "grad_norm": 1.1015625, "learning_rate": 0.000494108936932354, "loss": 6.1855, "mean_token_accuracy": 0.1191711500287056, "num_tokens": 2161797.0, "step": 1220 }, { "entropy": 6.517656993865967, "epoch": 0.06300954144484737, "grad_norm": 1.0859375, "learning_rate": 0.0004938381163861124, "loss": 6.3498, "mean_token_accuracy": 0.11286477893590927, "num_tokens": 2170312.0, "step": 1225 }, { "entropy": 6.230176687240601, "epoch": 0.06326672324666306, "grad_norm": 1.0859375, "learning_rate": 0.0004935612962823645, "loss": 6.3298, "mean_token_accuracy": 0.11120934784412384, "num_tokens": 2179850.0, "step": 1230 }, { "entropy": 6.308627033233643, "epoch": 0.06352390504847877, "grad_norm": 1.109375, "learning_rate": 0.0004932784842102739, "loss": 6.2072, "mean_token_accuracy": 0.11979541927576065, "num_tokens": 2189201.0, "step": 1235 }, { "entropy": 6.313740825653076, "epoch": 0.06378108685029447, "grad_norm": 0.984375, "learning_rate": 0.0004929896879232758, "loss": 6.3061, "mean_token_accuracy": 0.11951600462198257, "num_tokens": 2198362.0, "step": 1240 }, { "entropy": 6.322280406951904, "epoch": 0.06403826865211018, "grad_norm": 1.09375, "learning_rate": 0.0004926949153388668, "loss": 6.2858, "mean_token_accuracy": 0.1180046945810318, "num_tokens": 2207261.0, "step": 1245 }, { "entropy": 6.374325513839722, "epoch": 0.06429545045392589, "grad_norm": 1.0546875, "learning_rate": 0.0004923941745383859, "loss": 6.324, "mean_token_accuracy": 0.12014769464731216, "num_tokens": 2216293.0, "step": 1250 }, { "entropy": 6.248019790649414, "epoch": 0.06455263225574158, "grad_norm": 1.1796875, "learning_rate": 0.000492087473766794, "loss": 6.1756, "mean_token_accuracy": 0.12480147182941437, "num_tokens": 2224638.0, "step": 1255 }, { "entropy": 6.246414041519165, "epoch": 0.06480981405755729, "grad_norm": 1.140625, "learning_rate": 0.000491774821432448, "loss": 6.174, "mean_token_accuracy": 0.12405480146408081, "num_tokens": 2233422.0, "step": 1260 }, { "entropy": 6.36962661743164, "epoch": 0.06506699585937299, "grad_norm": 1.0390625, "learning_rate": 0.0004914562261068693, "loss": 6.3003, "mean_token_accuracy": 0.11817166209220886, "num_tokens": 2242497.0, "step": 1265 }, { "entropy": 6.283186435699463, "epoch": 0.0653241776611887, "grad_norm": 1.09375, "learning_rate": 0.0004911316965245098, "loss": 6.3951, "mean_token_accuracy": 0.11700899675488471, "num_tokens": 2251876.0, "step": 1270 }, { "entropy": 6.4162839412689205, "epoch": 0.0655813594630044, "grad_norm": 1.046875, "learning_rate": 0.000490801241582512, "loss": 6.3263, "mean_token_accuracy": 0.11120393425226212, "num_tokens": 2261476.0, "step": 1275 }, { "entropy": 6.217834234237671, "epoch": 0.0658385412648201, "grad_norm": 1.09375, "learning_rate": 0.000490464870340465, "loss": 6.2036, "mean_token_accuracy": 0.12037949934601784, "num_tokens": 2269830.0, "step": 1280 }, { "entropy": 6.354285717010498, "epoch": 0.0660957230666358, "grad_norm": 1.0546875, "learning_rate": 0.0004901225920201563, "loss": 6.2549, "mean_token_accuracy": 0.1226073995232582, "num_tokens": 2278846.0, "step": 1285 }, { "entropy": 6.259861993789673, "epoch": 0.06635290486845151, "grad_norm": 1.1015625, "learning_rate": 0.000489774416005319, "loss": 6.1377, "mean_token_accuracy": 0.12190483957529068, "num_tokens": 2287379.0, "step": 1290 }, { "entropy": 6.185118103027344, "epoch": 0.06661008667026722, "grad_norm": 1.1015625, "learning_rate": 0.0004894203518413742, "loss": 6.232, "mean_token_accuracy": 0.11986896097660064, "num_tokens": 2296071.0, "step": 1295 }, { "entropy": 6.285954570770263, "epoch": 0.06686726847208292, "grad_norm": 1.1015625, "learning_rate": 0.0004890604092351701, "loss": 6.1568, "mean_token_accuracy": 0.12937120646238326, "num_tokens": 2305629.0, "step": 1300 }, { "entropy": 6.352389907836914, "epoch": 0.06712445027389861, "grad_norm": 1.15625, "learning_rate": 0.000488694598054715, "loss": 6.2792, "mean_token_accuracy": 0.11652439460158348, "num_tokens": 2314297.0, "step": 1305 }, { "entropy": 6.281135702133179, "epoch": 0.06738163207571432, "grad_norm": 1.015625, "learning_rate": 0.0004883229283289071, "loss": 6.2421, "mean_token_accuracy": 0.1163830317556858, "num_tokens": 2323583.0, "step": 1310 }, { "entropy": 6.275307750701904, "epoch": 0.06763881387753003, "grad_norm": 1.125, "learning_rate": 0.00048794541024725993, "loss": 6.1962, "mean_token_accuracy": 0.12070676833391189, "num_tokens": 2332362.0, "step": 1315 }, { "entropy": 6.247883081436157, "epoch": 0.06789599567934573, "grad_norm": 1.03125, "learning_rate": 0.0004875620541596221, "loss": 6.2433, "mean_token_accuracy": 0.11916191950440407, "num_tokens": 2341724.0, "step": 1320 }, { "entropy": 6.323701190948486, "epoch": 0.06815317748116144, "grad_norm": 1.1953125, "learning_rate": 0.00048717287057589454, "loss": 6.3094, "mean_token_accuracy": 0.11830834746360779, "num_tokens": 2350687.0, "step": 1325 }, { "entropy": 6.180278348922729, "epoch": 0.06841035928297713, "grad_norm": 1.0078125, "learning_rate": 0.0004867778701657417, "loss": 6.123, "mean_token_accuracy": 0.12217027693986893, "num_tokens": 2359761.0, "step": 1330 }, { "entropy": 6.274547529220581, "epoch": 0.06866754108479284, "grad_norm": 0.99609375, "learning_rate": 0.00048637706375829955, "loss": 6.2057, "mean_token_accuracy": 0.12222478315234184, "num_tokens": 2369203.0, "step": 1335 }, { "entropy": 6.284049701690674, "epoch": 0.06892472288660854, "grad_norm": 1.0625, "learning_rate": 0.000485970462341878, "loss": 6.2373, "mean_token_accuracy": 0.12175923585891724, "num_tokens": 2377576.0, "step": 1340 }, { "entropy": 6.255672264099121, "epoch": 0.06918190468842425, "grad_norm": 1.1640625, "learning_rate": 0.00048555807706366044, "loss": 6.2313, "mean_token_accuracy": 0.11880970671772957, "num_tokens": 2386658.0, "step": 1345 }, { "entropy": 6.267937898635864, "epoch": 0.06943908649023996, "grad_norm": 1.125, "learning_rate": 0.00048513991922939756, "loss": 6.2557, "mean_token_accuracy": 0.12166587859392167, "num_tokens": 2395340.0, "step": 1350 }, { "entropy": 6.228494787216187, "epoch": 0.06969626829205565, "grad_norm": 1.046875, "learning_rate": 0.00048471600030309744, "loss": 6.287, "mean_token_accuracy": 0.11910992339253426, "num_tokens": 2404844.0, "step": 1355 }, { "entropy": 6.3855327606201175, "epoch": 0.06995345009387136, "grad_norm": 1.1484375, "learning_rate": 0.00048428633190671186, "loss": 6.2122, "mean_token_accuracy": 0.11871807649731636, "num_tokens": 2413641.0, "step": 1360 }, { "entropy": 6.2528892993927006, "epoch": 0.07021063189568706, "grad_norm": 1.0859375, "learning_rate": 0.0004838509258198167, "loss": 6.2608, "mean_token_accuracy": 0.12074613049626351, "num_tokens": 2423065.0, "step": 1365 }, { "entropy": 6.365111207962036, "epoch": 0.07046781369750277, "grad_norm": 1.1640625, "learning_rate": 0.00048340979397929, "loss": 6.1988, "mean_token_accuracy": 0.1260582149028778, "num_tokens": 2432486.0, "step": 1370 }, { "entropy": 6.297368955612183, "epoch": 0.07072499549931847, "grad_norm": 1.171875, "learning_rate": 0.00048296294847898386, "loss": 6.2855, "mean_token_accuracy": 0.1175057515501976, "num_tokens": 2441582.0, "step": 1375 }, { "entropy": 6.272958660125733, "epoch": 0.07098217730113417, "grad_norm": 1.046875, "learning_rate": 0.0004825104015693934, "loss": 6.1998, "mean_token_accuracy": 0.1187170147895813, "num_tokens": 2450618.0, "step": 1380 }, { "entropy": 6.21057162284851, "epoch": 0.07123935910294987, "grad_norm": 1.0234375, "learning_rate": 0.0004820521656573208, "loss": 6.2205, "mean_token_accuracy": 0.11892557591199875, "num_tokens": 2459346.0, "step": 1385 }, { "entropy": 6.275320386886596, "epoch": 0.07149654090476558, "grad_norm": 1.15625, "learning_rate": 0.00048158825330553505, "loss": 6.2183, "mean_token_accuracy": 0.12063762545585632, "num_tokens": 2467775.0, "step": 1390 }, { "entropy": 6.233735370635986, "epoch": 0.07175372270658129, "grad_norm": 1.21875, "learning_rate": 0.00048111867723242763, "loss": 6.0805, "mean_token_accuracy": 0.12942860201001166, "num_tokens": 2475732.0, "step": 1395 }, { "entropy": 6.302308511734009, "epoch": 0.07201090450839699, "grad_norm": 1.0859375, "learning_rate": 0.0004806434503116637, "loss": 6.2751, "mean_token_accuracy": 0.11736578792333603, "num_tokens": 2484468.0, "step": 1400 }, { "entropy": 6.20477180480957, "epoch": 0.07226808631021268, "grad_norm": 1.1015625, "learning_rate": 0.0004801625855718296, "loss": 6.0979, "mean_token_accuracy": 0.12714530006051064, "num_tokens": 2492945.0, "step": 1405 }, { "entropy": 6.303807067871094, "epoch": 0.07252526811202839, "grad_norm": 1.015625, "learning_rate": 0.00047967609619607477, "loss": 6.2581, "mean_token_accuracy": 0.12180023640394211, "num_tokens": 2502267.0, "step": 1410 }, { "entropy": 6.076932668685913, "epoch": 0.0727824499138441, "grad_norm": 1.1171875, "learning_rate": 0.0004791839955217513, "loss": 6.1385, "mean_token_accuracy": 0.12108586356043816, "num_tokens": 2511182.0, "step": 1415 }, { "entropy": 6.260076665878296, "epoch": 0.0730396317156598, "grad_norm": 1.09375, "learning_rate": 0.00047868629704004786, "loss": 6.2165, "mean_token_accuracy": 0.11969843655824661, "num_tokens": 2519756.0, "step": 1420 }, { "entropy": 6.295289468765259, "epoch": 0.07329681351747551, "grad_norm": 1.078125, "learning_rate": 0.00047818301439561965, "loss": 6.2174, "mean_token_accuracy": 0.12359980940818786, "num_tokens": 2528925.0, "step": 1425 }, { "entropy": 6.314094161987304, "epoch": 0.0735539953192912, "grad_norm": 1.078125, "learning_rate": 0.00047767416138621454, "loss": 6.2839, "mean_token_accuracy": 0.11689749956130982, "num_tokens": 2538557.0, "step": 1430 }, { "entropy": 6.229358911514282, "epoch": 0.07381117712110691, "grad_norm": 1.1484375, "learning_rate": 0.000477159751962295, "loss": 6.1894, "mean_token_accuracy": 0.12646755203604698, "num_tokens": 2547190.0, "step": 1435 }, { "entropy": 6.241942453384399, "epoch": 0.07406835892292261, "grad_norm": 1.1015625, "learning_rate": 0.00047663980022665507, "loss": 6.2148, "mean_token_accuracy": 0.12242325693368912, "num_tokens": 2556168.0, "step": 1440 }, { "entropy": 6.306135368347168, "epoch": 0.07432554072473832, "grad_norm": 1.078125, "learning_rate": 0.00047611432043403437, "loss": 6.2626, "mean_token_accuracy": 0.1197875827550888, "num_tokens": 2565409.0, "step": 1445 }, { "entropy": 6.228486442565918, "epoch": 0.07458272252655403, "grad_norm": 1.1328125, "learning_rate": 0.0004755833269907267, "loss": 6.0994, "mean_token_accuracy": 0.12629354000091553, "num_tokens": 2574710.0, "step": 1450 }, { "entropy": 6.119667053222656, "epoch": 0.07483990432836972, "grad_norm": 1.09375, "learning_rate": 0.0004750468344541857, "loss": 6.0366, "mean_token_accuracy": 0.13156967237591743, "num_tokens": 2583210.0, "step": 1455 }, { "entropy": 6.1274964809417725, "epoch": 0.07509708613018543, "grad_norm": 1.078125, "learning_rate": 0.00047450485753262525, "loss": 6.0896, "mean_token_accuracy": 0.13029113933444023, "num_tokens": 2592143.0, "step": 1460 }, { "entropy": 6.23237795829773, "epoch": 0.07535426793200113, "grad_norm": 1.234375, "learning_rate": 0.00047395741108461633, "loss": 6.0884, "mean_token_accuracy": 0.1269154392182827, "num_tokens": 2601051.0, "step": 1465 }, { "entropy": 6.124324464797974, "epoch": 0.07561144973381684, "grad_norm": 1.25, "learning_rate": 0.00047340451011867985, "loss": 6.1757, "mean_token_accuracy": 0.12620116993784905, "num_tokens": 2609334.0, "step": 1470 }, { "entropy": 6.34974856376648, "epoch": 0.07586863153563254, "grad_norm": 1.0078125, "learning_rate": 0.00047284616979287515, "loss": 6.2833, "mean_token_accuracy": 0.1270563654601574, "num_tokens": 2618670.0, "step": 1475 }, { "entropy": 6.1445026874542235, "epoch": 0.07612581333744824, "grad_norm": 1.1015625, "learning_rate": 0.00047228240541438433, "loss": 6.1026, "mean_token_accuracy": 0.12804780080914496, "num_tokens": 2627829.0, "step": 1480 }, { "entropy": 6.234681034088135, "epoch": 0.07638299513926394, "grad_norm": 1.1171875, "learning_rate": 0.00047171323243909257, "loss": 6.0433, "mean_token_accuracy": 0.132904352247715, "num_tokens": 2636508.0, "step": 1485 }, { "entropy": 6.130121564865112, "epoch": 0.07664017694107965, "grad_norm": 1.078125, "learning_rate": 0.00047113866647116457, "loss": 6.1347, "mean_token_accuracy": 0.12549900785088539, "num_tokens": 2645713.0, "step": 1490 }, { "entropy": 6.149539947509766, "epoch": 0.07689735874289536, "grad_norm": 1.09375, "learning_rate": 0.0004705587232626164, "loss": 6.0803, "mean_token_accuracy": 0.13423071429133415, "num_tokens": 2654194.0, "step": 1495 }, { "entropy": 6.214192914962768, "epoch": 0.07715454054471106, "grad_norm": 1.1171875, "learning_rate": 0.00046997341871288424, "loss": 6.1258, "mean_token_accuracy": 0.12882963046431542, "num_tokens": 2662932.0, "step": 1500 }, { "entropy": 6.174128580093384, "epoch": 0.07741172234652675, "grad_norm": 1.140625, "learning_rate": 0.0004693827688683879, "loss": 6.1027, "mean_token_accuracy": 0.12451449260115624, "num_tokens": 2671245.0, "step": 1505 }, { "entropy": 6.222696208953858, "epoch": 0.07766890414834246, "grad_norm": 1.140625, "learning_rate": 0.0004687867899220914, "loss": 6.1711, "mean_token_accuracy": 0.12424503639340401, "num_tokens": 2680046.0, "step": 1510 }, { "entropy": 6.313079404830932, "epoch": 0.07792608595015817, "grad_norm": 1.15625, "learning_rate": 0.00046818549821305846, "loss": 6.2791, "mean_token_accuracy": 0.1235924281179905, "num_tokens": 2689068.0, "step": 1515 }, { "entropy": 6.171900749206543, "epoch": 0.07818326775197387, "grad_norm": 1.1328125, "learning_rate": 0.00046757891022600494, "loss": 6.1385, "mean_token_accuracy": 0.1261700503528118, "num_tokens": 2697769.0, "step": 1520 }, { "entropy": 6.238068675994873, "epoch": 0.07844044955378958, "grad_norm": 1.1640625, "learning_rate": 0.0004669670425908471, "loss": 6.1439, "mean_token_accuracy": 0.1273744858801365, "num_tokens": 2705974.0, "step": 1525 }, { "entropy": 6.148878479003907, "epoch": 0.07869763135560527, "grad_norm": 1.1171875, "learning_rate": 0.0004663499120822451, "loss": 6.1141, "mean_token_accuracy": 0.12810297608375548, "num_tokens": 2714877.0, "step": 1530 }, { "entropy": 6.266905450820923, "epoch": 0.07895481315742098, "grad_norm": 1.0703125, "learning_rate": 0.0004657275356191437, "loss": 6.2756, "mean_token_accuracy": 0.11889293268322945, "num_tokens": 2723922.0, "step": 1535 }, { "entropy": 6.159636354446411, "epoch": 0.07921199495923668, "grad_norm": 1.1328125, "learning_rate": 0.00046509993026430804, "loss": 6.0852, "mean_token_accuracy": 0.12158769443631172, "num_tokens": 2733233.0, "step": 1540 }, { "entropy": 6.244900512695312, "epoch": 0.07946917676105239, "grad_norm": 1.078125, "learning_rate": 0.0004644671132238558, "loss": 6.1514, "mean_token_accuracy": 0.12227895259857177, "num_tokens": 2741977.0, "step": 1545 }, { "entropy": 6.198960208892823, "epoch": 0.0797263585628681, "grad_norm": 1.1484375, "learning_rate": 0.00046382910184678585, "loss": 6.1703, "mean_token_accuracy": 0.12280954793095589, "num_tokens": 2750761.0, "step": 1550 }, { "entropy": 6.193390226364135, "epoch": 0.07998354036468379, "grad_norm": 1.015625, "learning_rate": 0.0004631859136245025, "loss": 6.1144, "mean_token_accuracy": 0.12151789665222168, "num_tokens": 2760738.0, "step": 1555 }, { "entropy": 6.193670558929443, "epoch": 0.0802407221664995, "grad_norm": 1.09375, "learning_rate": 0.0004625375661903357, "loss": 6.1398, "mean_token_accuracy": 0.12551755905151368, "num_tokens": 2769818.0, "step": 1560 }, { "entropy": 6.144148969650269, "epoch": 0.0804979039683152, "grad_norm": 1.09375, "learning_rate": 0.00046188407731905787, "loss": 6.06, "mean_token_accuracy": 0.12714403718709946, "num_tokens": 2778779.0, "step": 1565 }, { "entropy": 6.2248434066772464, "epoch": 0.08075508577013091, "grad_norm": 1.09375, "learning_rate": 0.00046122546492639643, "loss": 6.1296, "mean_token_accuracy": 0.12499245777726173, "num_tokens": 2787977.0, "step": 1570 }, { "entropy": 6.065084409713745, "epoch": 0.08101226757194661, "grad_norm": 1.1171875, "learning_rate": 0.000460561747068543, "loss": 6.0838, "mean_token_accuracy": 0.13301576748490335, "num_tokens": 2796565.0, "step": 1575 }, { "entropy": 6.25233154296875, "epoch": 0.0812694493737623, "grad_norm": 1.109375, "learning_rate": 0.0004598929419416578, "loss": 6.144, "mean_token_accuracy": 0.12637140676379205, "num_tokens": 2805338.0, "step": 1580 }, { "entropy": 6.19027190208435, "epoch": 0.08152663117557801, "grad_norm": 1.125, "learning_rate": 0.00045921906788137123, "loss": 6.1522, "mean_token_accuracy": 0.12466087937355042, "num_tokens": 2815288.0, "step": 1585 }, { "entropy": 6.151868438720703, "epoch": 0.08178381297739372, "grad_norm": 1.1015625, "learning_rate": 0.00045854014336228115, "loss": 6.0995, "mean_token_accuracy": 0.12922126054763794, "num_tokens": 2824544.0, "step": 1590 }, { "entropy": 6.101247835159302, "epoch": 0.08204099477920943, "grad_norm": 1.078125, "learning_rate": 0.00045785618699744615, "loss": 6.0348, "mean_token_accuracy": 0.133967836946249, "num_tokens": 2833252.0, "step": 1595 }, { "entropy": 6.20477991104126, "epoch": 0.08229817658102513, "grad_norm": 1.21875, "learning_rate": 0.00045716721753787543, "loss": 6.1093, "mean_token_accuracy": 0.12315899506211281, "num_tokens": 2842205.0, "step": 1600 }, { "entropy": 6.083947086334229, "epoch": 0.08255535838284082, "grad_norm": 1.078125, "learning_rate": 0.0004564732538720148, "loss": 6.0383, "mean_token_accuracy": 0.12902023196220397, "num_tokens": 2850665.0, "step": 1605 }, { "entropy": 6.144789600372315, "epoch": 0.08281254018465653, "grad_norm": 1.0859375, "learning_rate": 0.00045577431502522877, "loss": 6.061, "mean_token_accuracy": 0.12983368337154388, "num_tokens": 2859757.0, "step": 1610 }, { "entropy": 6.245366430282592, "epoch": 0.08306972198647224, "grad_norm": 1.0546875, "learning_rate": 0.0004550704201592787, "loss": 6.1424, "mean_token_accuracy": 0.12511212080717088, "num_tokens": 2869478.0, "step": 1615 }, { "entropy": 6.078303718566895, "epoch": 0.08332690378828794, "grad_norm": 1.1484375, "learning_rate": 0.0004543615885717981, "loss": 5.9903, "mean_token_accuracy": 0.13801901265978814, "num_tokens": 2877014.0, "step": 1620 }, { "entropy": 6.053305196762085, "epoch": 0.08358408559010365, "grad_norm": 1.09375, "learning_rate": 0.00045364783969576296, "loss": 5.9403, "mean_token_accuracy": 0.1358281835913658, "num_tokens": 2885532.0, "step": 1625 }, { "entropy": 6.125780868530273, "epoch": 0.08384126739191934, "grad_norm": 1.09375, "learning_rate": 0.0004529291930989592, "loss": 6.0559, "mean_token_accuracy": 0.12762951701879502, "num_tokens": 2894723.0, "step": 1630 }, { "entropy": 6.033651685714721, "epoch": 0.08409844919373505, "grad_norm": 1.1171875, "learning_rate": 0.0004522056684834464, "loss": 5.9844, "mean_token_accuracy": 0.13187647312879563, "num_tokens": 2903479.0, "step": 1635 }, { "entropy": 6.216282892227173, "epoch": 0.08435563099555075, "grad_norm": 1.0859375, "learning_rate": 0.0004514772856850173, "loss": 6.0733, "mean_token_accuracy": 0.126427498459816, "num_tokens": 2912339.0, "step": 1640 }, { "entropy": 6.062296152114868, "epoch": 0.08461281279736646, "grad_norm": 1.0546875, "learning_rate": 0.0004507440646726542, "loss": 5.9916, "mean_token_accuracy": 0.1297301597893238, "num_tokens": 2921525.0, "step": 1645 }, { "entropy": 6.131249952316284, "epoch": 0.08486999459918217, "grad_norm": 1.078125, "learning_rate": 0.0004500060255479818, "loss": 6.0996, "mean_token_accuracy": 0.1292259730398655, "num_tokens": 2930007.0, "step": 1650 }, { "entropy": 6.113132810592651, "epoch": 0.08512717640099786, "grad_norm": 1.109375, "learning_rate": 0.0004492631885447151, "loss": 6.0075, "mean_token_accuracy": 0.13707797154784201, "num_tokens": 2938781.0, "step": 1655 }, { "entropy": 6.17734169960022, "epoch": 0.08538435820281357, "grad_norm": 1.046875, "learning_rate": 0.00044851557402810616, "loss": 6.1489, "mean_token_accuracy": 0.12741673737764359, "num_tokens": 2947219.0, "step": 1660 }, { "entropy": 6.159033012390137, "epoch": 0.08564154000462927, "grad_norm": 1.1328125, "learning_rate": 0.00044776320249438444, "loss": 6.102, "mean_token_accuracy": 0.13058205023407937, "num_tokens": 2956055.0, "step": 1665 }, { "entropy": 6.106929969787598, "epoch": 0.08589872180644498, "grad_norm": 1.1015625, "learning_rate": 0.00044700609457019565, "loss": 6.0306, "mean_token_accuracy": 0.1294600822031498, "num_tokens": 2965232.0, "step": 1670 }, { "entropy": 6.1184930324554445, "epoch": 0.08615590360826068, "grad_norm": 1.0625, "learning_rate": 0.0004462442710120359, "loss": 6.0627, "mean_token_accuracy": 0.13047947734594345, "num_tokens": 2974055.0, "step": 1675 }, { "entropy": 6.149667358398437, "epoch": 0.08641308541007638, "grad_norm": 1.1171875, "learning_rate": 0.000445477752705683, "loss": 6.058, "mean_token_accuracy": 0.13411957547068595, "num_tokens": 2982674.0, "step": 1680 }, { "entropy": 6.188984203338623, "epoch": 0.08667026721189208, "grad_norm": 1.1328125, "learning_rate": 0.00044470656066562336, "loss": 6.1543, "mean_token_accuracy": 0.1249298483133316, "num_tokens": 2990829.0, "step": 1685 }, { "entropy": 6.120514965057373, "epoch": 0.08692744901370779, "grad_norm": 1.03125, "learning_rate": 0.0004439307160344765, "loss": 6.106, "mean_token_accuracy": 0.13009767308831216, "num_tokens": 2999601.0, "step": 1690 }, { "entropy": 6.106043910980224, "epoch": 0.0871846308155235, "grad_norm": 1.15625, "learning_rate": 0.00044315024008241473, "loss": 6.0826, "mean_token_accuracy": 0.1321030043065548, "num_tokens": 3008428.0, "step": 1695 }, { "entropy": 6.21539421081543, "epoch": 0.0874418126173392, "grad_norm": 1.0390625, "learning_rate": 0.0004423651542065806, "loss": 6.1421, "mean_token_accuracy": 0.12425650283694267, "num_tokens": 3017535.0, "step": 1700 }, { "entropy": 6.081898880004883, "epoch": 0.0876989944191549, "grad_norm": 1.0546875, "learning_rate": 0.00044157547993050006, "loss": 6.1069, "mean_token_accuracy": 0.12386454865336419, "num_tokens": 3026091.0, "step": 1705 }, { "entropy": 6.190816974639892, "epoch": 0.0879561762209706, "grad_norm": 1.1015625, "learning_rate": 0.00044078123890349227, "loss": 6.0314, "mean_token_accuracy": 0.12939157485961914, "num_tokens": 3034622.0, "step": 1710 }, { "entropy": 6.089109134674072, "epoch": 0.0882133580227863, "grad_norm": 1.1875, "learning_rate": 0.00043998245290007606, "loss": 6.1176, "mean_token_accuracy": 0.12585034891963004, "num_tokens": 3044166.0, "step": 1715 }, { "entropy": 6.06969723701477, "epoch": 0.08847053982460201, "grad_norm": 1.078125, "learning_rate": 0.00043917914381937323, "loss": 5.9706, "mean_token_accuracy": 0.1360363095998764, "num_tokens": 3052770.0, "step": 1720 }, { "entropy": 6.098641729354858, "epoch": 0.08872772162641772, "grad_norm": 1.0703125, "learning_rate": 0.00043837133368450815, "loss": 5.9318, "mean_token_accuracy": 0.1331650085747242, "num_tokens": 3061967.0, "step": 1725 }, { "entropy": 6.091753768920898, "epoch": 0.08898490342823343, "grad_norm": 1.1015625, "learning_rate": 0.0004375590446420037, "loss": 6.1044, "mean_token_accuracy": 0.12449745461344719, "num_tokens": 3071470.0, "step": 1730 }, { "entropy": 6.173467111587525, "epoch": 0.08924208523004912, "grad_norm": 1.09375, "learning_rate": 0.0004367422989611743, "loss": 6.2809, "mean_token_accuracy": 0.11852860525250435, "num_tokens": 3081776.0, "step": 1735 }, { "entropy": 6.250823545455932, "epoch": 0.08949926703186482, "grad_norm": 1.0546875, "learning_rate": 0.0004359211190335153, "loss": 6.0688, "mean_token_accuracy": 0.12610838413238526, "num_tokens": 3091284.0, "step": 1740 }, { "entropy": 6.147873067855835, "epoch": 0.08975644883368053, "grad_norm": 1.109375, "learning_rate": 0.00043509552737208923, "loss": 6.0852, "mean_token_accuracy": 0.13501820713281631, "num_tokens": 3100129.0, "step": 1745 }, { "entropy": 6.126709890365601, "epoch": 0.09001363063549624, "grad_norm": 1.15625, "learning_rate": 0.00043426554661090853, "loss": 6.0035, "mean_token_accuracy": 0.13482855185866355, "num_tokens": 3109255.0, "step": 1750 }, { "entropy": 6.014013624191284, "epoch": 0.09027081243731194, "grad_norm": 1.0859375, "learning_rate": 0.00043343119950431516, "loss": 5.9668, "mean_token_accuracy": 0.13436976298689843, "num_tokens": 3118562.0, "step": 1755 }, { "entropy": 6.143547010421753, "epoch": 0.09052799423912763, "grad_norm": 1.1171875, "learning_rate": 0.00043259250892635644, "loss": 6.0631, "mean_token_accuracy": 0.13537074699997903, "num_tokens": 3127139.0, "step": 1760 }, { "entropy": 6.104552841186523, "epoch": 0.09078517604094334, "grad_norm": 1.1015625, "learning_rate": 0.0004317494978701582, "loss": 6.0492, "mean_token_accuracy": 0.13329893127083778, "num_tokens": 3135434.0, "step": 1765 }, { "entropy": 6.1294732093811035, "epoch": 0.09104235784275905, "grad_norm": 1.125, "learning_rate": 0.0004309021894472943, "loss": 6.0021, "mean_token_accuracy": 0.1337900497019291, "num_tokens": 3144173.0, "step": 1770 }, { "entropy": 6.173466730117798, "epoch": 0.09129953964457475, "grad_norm": 1.1328125, "learning_rate": 0.0004300506068871534, "loss": 6.0893, "mean_token_accuracy": 0.1304582491517067, "num_tokens": 3153112.0, "step": 1775 }, { "entropy": 6.128057193756104, "epoch": 0.09155672144639046, "grad_norm": 1.03125, "learning_rate": 0.00042919477353630135, "loss": 5.9737, "mean_token_accuracy": 0.13518399819731713, "num_tokens": 3161738.0, "step": 1780 }, { "entropy": 6.069469690322876, "epoch": 0.09181390324820615, "grad_norm": 1.1171875, "learning_rate": 0.000428334712857842, "loss": 6.0349, "mean_token_accuracy": 0.13572588711977004, "num_tokens": 3170407.0, "step": 1785 }, { "entropy": 6.1224860668182375, "epoch": 0.09207108505002186, "grad_norm": 1.125, "learning_rate": 0.00042747044843077304, "loss": 6.0035, "mean_token_accuracy": 0.13542618602514267, "num_tokens": 3178883.0, "step": 1790 }, { "entropy": 6.139774894714355, "epoch": 0.09232826685183756, "grad_norm": 1.0546875, "learning_rate": 0.00042660200394934047, "loss": 6.0829, "mean_token_accuracy": 0.1297149181365967, "num_tokens": 3188003.0, "step": 1795 }, { "entropy": 6.077296495437622, "epoch": 0.09258544865365327, "grad_norm": 0.96875, "learning_rate": 0.00042572940322238844, "loss": 5.9886, "mean_token_accuracy": 0.13486197963356972, "num_tokens": 3197525.0, "step": 1800 }, { "entropy": 6.095264530181884, "epoch": 0.09284263045546898, "grad_norm": 1.125, "learning_rate": 0.00042485267017270664, "loss": 6.0382, "mean_token_accuracy": 0.1342827245593071, "num_tokens": 3206255.0, "step": 1805 }, { "entropy": 6.041297388076782, "epoch": 0.09309981225728467, "grad_norm": 1.125, "learning_rate": 0.0004239718288363745, "loss": 6.0391, "mean_token_accuracy": 0.13267314657568932, "num_tokens": 3216132.0, "step": 1810 }, { "entropy": 6.128677415847778, "epoch": 0.09335699405910038, "grad_norm": 1.140625, "learning_rate": 0.0004230869033621023, "loss": 5.922, "mean_token_accuracy": 0.12952762022614478, "num_tokens": 3224740.0, "step": 1815 }, { "entropy": 6.015822505950927, "epoch": 0.09361417586091608, "grad_norm": 1.203125, "learning_rate": 0.0004221979180105688, "loss": 5.976, "mean_token_accuracy": 0.13513584956526756, "num_tokens": 3233408.0, "step": 1820 }, { "entropy": 6.133046579360962, "epoch": 0.09387135766273179, "grad_norm": 1.1171875, "learning_rate": 0.00042130489715375645, "loss": 6.0176, "mean_token_accuracy": 0.13694472312927247, "num_tokens": 3242488.0, "step": 1825 }, { "entropy": 6.024254989624024, "epoch": 0.0941285394645475, "grad_norm": 1.0703125, "learning_rate": 0.00042040786527428335, "loss": 5.9989, "mean_token_accuracy": 0.13015589714050294, "num_tokens": 3251255.0, "step": 1830 }, { "entropy": 6.021305656433105, "epoch": 0.09438572126636319, "grad_norm": 1.0703125, "learning_rate": 0.0004195068469647315, "loss": 5.9459, "mean_token_accuracy": 0.1366763137280941, "num_tokens": 3260057.0, "step": 1835 }, { "entropy": 6.105194091796875, "epoch": 0.0946429030681789, "grad_norm": 1.1484375, "learning_rate": 0.00041860186692697297, "loss": 6.0506, "mean_token_accuracy": 0.1300404965877533, "num_tokens": 3269568.0, "step": 1840 }, { "entropy": 6.051248598098755, "epoch": 0.0949000848699946, "grad_norm": 1.0625, "learning_rate": 0.00041769294997149264, "loss": 5.9672, "mean_token_accuracy": 0.13426859453320503, "num_tokens": 3278709.0, "step": 1845 }, { "entropy": 6.1222248554229735, "epoch": 0.0951572666718103, "grad_norm": 1.046875, "learning_rate": 0.0004167801210167081, "loss": 6.0727, "mean_token_accuracy": 0.12258832827210427, "num_tokens": 3287870.0, "step": 1850 }, { "entropy": 6.1391997814178465, "epoch": 0.09541444847362601, "grad_norm": 1.125, "learning_rate": 0.0004158634050882861, "loss": 6.0296, "mean_token_accuracy": 0.13176685199141502, "num_tokens": 3296681.0, "step": 1855 }, { "entropy": 6.014973878860474, "epoch": 0.0956716302754417, "grad_norm": 1.25, "learning_rate": 0.0004149428273184569, "loss": 5.9713, "mean_token_accuracy": 0.13487191423773764, "num_tokens": 3305201.0, "step": 1860 }, { "entropy": 6.063941383361817, "epoch": 0.09592881207725741, "grad_norm": 1.109375, "learning_rate": 0.0004140184129453253, "loss": 5.972, "mean_token_accuracy": 0.13490609005093573, "num_tokens": 3314005.0, "step": 1865 }, { "entropy": 6.057723140716552, "epoch": 0.09618599387907312, "grad_norm": 1.0859375, "learning_rate": 0.000413090187312178, "loss": 5.8632, "mean_token_accuracy": 0.1374638482928276, "num_tokens": 3322599.0, "step": 1870 }, { "entropy": 5.972152233123779, "epoch": 0.09644317568088882, "grad_norm": 1.1796875, "learning_rate": 0.0004121581758667898, "loss": 5.9519, "mean_token_accuracy": 0.13511499017477036, "num_tokens": 3331230.0, "step": 1875 }, { "entropy": 6.020901203155518, "epoch": 0.09670035748270453, "grad_norm": 1.15625, "learning_rate": 0.00041122240416072533, "loss": 5.8722, "mean_token_accuracy": 0.14036940708756446, "num_tokens": 3339313.0, "step": 1880 }, { "entropy": 6.072263526916504, "epoch": 0.09695753928452022, "grad_norm": 1.078125, "learning_rate": 0.0004102828978486385, "loss": 5.9417, "mean_token_accuracy": 0.1329902485013008, "num_tokens": 3348482.0, "step": 1885 }, { "entropy": 6.092586088180542, "epoch": 0.09721472108633593, "grad_norm": 1.140625, "learning_rate": 0.0004093396826875695, "loss": 6.0033, "mean_token_accuracy": 0.1268253058195114, "num_tokens": 3357282.0, "step": 1890 }, { "entropy": 6.038345813751221, "epoch": 0.09747190288815163, "grad_norm": 1.4375, "learning_rate": 0.00040839278453623837, "loss": 5.955, "mean_token_accuracy": 0.13438157737255096, "num_tokens": 3366215.0, "step": 1895 }, { "entropy": 6.0843383312225345, "epoch": 0.09772908468996734, "grad_norm": 1.015625, "learning_rate": 0.0004074422293543363, "loss": 5.9925, "mean_token_accuracy": 0.13472680374979973, "num_tokens": 3375235.0, "step": 1900 }, { "entropy": 6.089998579025268, "epoch": 0.09798626649178305, "grad_norm": 1.1171875, "learning_rate": 0.0004064880432018137, "loss": 6.0797, "mean_token_accuracy": 0.12867710292339324, "num_tokens": 3384474.0, "step": 1905 }, { "entropy": 6.151446151733398, "epoch": 0.09824344829359874, "grad_norm": 1.046875, "learning_rate": 0.00040553025223816615, "loss": 6.0629, "mean_token_accuracy": 0.12482186406850815, "num_tokens": 3393204.0, "step": 1910 }, { "entropy": 6.147669410705566, "epoch": 0.09850063009541445, "grad_norm": 1.1640625, "learning_rate": 0.00040456888272171653, "loss": 6.0145, "mean_token_accuracy": 0.13083723485469817, "num_tokens": 3402563.0, "step": 1915 }, { "entropy": 6.008180046081543, "epoch": 0.09875781189723015, "grad_norm": 1.0859375, "learning_rate": 0.00040360396100889577, "loss": 5.8704, "mean_token_accuracy": 0.1350298307836056, "num_tokens": 3411368.0, "step": 1920 }, { "entropy": 6.0020557880401615, "epoch": 0.09901499369904586, "grad_norm": 1.078125, "learning_rate": 0.0004026355135535202, "loss": 5.8921, "mean_token_accuracy": 0.13632030189037322, "num_tokens": 3420720.0, "step": 1925 }, { "entropy": 6.069166278839111, "epoch": 0.09927217550086156, "grad_norm": 1.203125, "learning_rate": 0.000401663566906066, "loss": 5.9239, "mean_token_accuracy": 0.13785183504223825, "num_tokens": 3428916.0, "step": 1930 }, { "entropy": 5.978689289093017, "epoch": 0.09952935730267726, "grad_norm": 1.1015625, "learning_rate": 0.00040068814771294134, "loss": 5.9116, "mean_token_accuracy": 0.140623939037323, "num_tokens": 3437173.0, "step": 1935 }, { "entropy": 5.957523679733276, "epoch": 0.09978653910449296, "grad_norm": 1.03125, "learning_rate": 0.0003997092827157562, "loss": 5.8591, "mean_token_accuracy": 0.14056172966957092, "num_tokens": 3445798.0, "step": 1940 }, { "entropy": 6.047778511047364, "epoch": 0.10004372090630867, "grad_norm": 1.1328125, "learning_rate": 0.000398726998750589, "loss": 5.9273, "mean_token_accuracy": 0.13311707004904746, "num_tokens": 3454052.0, "step": 1945 }, { "entropy": 6.044436407089234, "epoch": 0.10030090270812438, "grad_norm": 1.078125, "learning_rate": 0.00039774132274725076, "loss": 5.9193, "mean_token_accuracy": 0.1355873964726925, "num_tokens": 3462336.0, "step": 1950 }, { "entropy": 5.979900550842285, "epoch": 0.10055808450994008, "grad_norm": 1.1015625, "learning_rate": 0.00039675228172854707, "loss": 5.9603, "mean_token_accuracy": 0.13676296770572663, "num_tokens": 3471212.0, "step": 1955 }, { "entropy": 6.07159686088562, "epoch": 0.10081526631175577, "grad_norm": 1.171875, "learning_rate": 0.0003957599028095371, "loss": 5.9078, "mean_token_accuracy": 0.13837847262620925, "num_tokens": 3479607.0, "step": 1960 }, { "entropy": 6.047497510910034, "epoch": 0.10107244811357148, "grad_norm": 1.2578125, "learning_rate": 0.00039476421319679017, "loss": 6.0042, "mean_token_accuracy": 0.13707230389118194, "num_tokens": 3488337.0, "step": 1965 }, { "entropy": 6.111591434478759, "epoch": 0.10132962991538719, "grad_norm": 1.1484375, "learning_rate": 0.00039376524018764, "loss": 6.1034, "mean_token_accuracy": 0.13102759942412376, "num_tokens": 3497460.0, "step": 1970 }, { "entropy": 6.185532951354981, "epoch": 0.1015868117172029, "grad_norm": 1.0859375, "learning_rate": 0.00039276301116943616, "loss": 6.0032, "mean_token_accuracy": 0.13004203960299493, "num_tokens": 3506634.0, "step": 1975 }, { "entropy": 5.98096661567688, "epoch": 0.1018439935190186, "grad_norm": 1.09375, "learning_rate": 0.0003917575536187936, "loss": 5.9191, "mean_token_accuracy": 0.13960360884666442, "num_tokens": 3515644.0, "step": 1980 }, { "entropy": 5.970981121063232, "epoch": 0.10210117532083429, "grad_norm": 1.21875, "learning_rate": 0.00039074889510083894, "loss": 5.8547, "mean_token_accuracy": 0.14273056983947754, "num_tokens": 3524194.0, "step": 1985 }, { "entropy": 6.01817135810852, "epoch": 0.10235835712265, "grad_norm": 1.125, "learning_rate": 0.00038973706326845495, "loss": 5.9229, "mean_token_accuracy": 0.1372055910527706, "num_tokens": 3533909.0, "step": 1990 }, { "entropy": 6.011876392364502, "epoch": 0.1026155389244657, "grad_norm": 1.1015625, "learning_rate": 0.0003887220858615225, "loss": 5.966, "mean_token_accuracy": 0.13570310175418854, "num_tokens": 3542379.0, "step": 1995 }, { "entropy": 5.983093881607056, "epoch": 0.10287272072628141, "grad_norm": 1.125, "learning_rate": 0.0003877039907061597, "loss": 5.8474, "mean_token_accuracy": 0.1440593920648098, "num_tokens": 3551109.0, "step": 2000 }, { "entropy": 6.021899604797364, "epoch": 0.10312990252809712, "grad_norm": 1.140625, "learning_rate": 0.0003866828057139598, "loss": 5.9388, "mean_token_accuracy": 0.13910572826862336, "num_tokens": 3559366.0, "step": 2005 }, { "entropy": 5.953703784942627, "epoch": 0.10338708432991281, "grad_norm": 1.1015625, "learning_rate": 0.00038565855888122503, "loss": 5.8378, "mean_token_accuracy": 0.1402948908507824, "num_tokens": 3567713.0, "step": 2010 }, { "entropy": 6.010533189773559, "epoch": 0.10364426613172852, "grad_norm": 1.1328125, "learning_rate": 0.00038463127828819975, "loss": 6.0274, "mean_token_accuracy": 0.13361438736319542, "num_tokens": 3577609.0, "step": 2015 }, { "entropy": 6.03451361656189, "epoch": 0.10390144793354422, "grad_norm": 1.125, "learning_rate": 0.00038360099209830043, "loss": 5.8385, "mean_token_accuracy": 0.14586896002292632, "num_tokens": 3586735.0, "step": 2020 }, { "entropy": 6.068939876556397, "epoch": 0.10415862973535993, "grad_norm": 1.09375, "learning_rate": 0.0003825677285573433, "loss": 5.9755, "mean_token_accuracy": 0.1315617948770523, "num_tokens": 3595499.0, "step": 2025 }, { "entropy": 6.00121750831604, "epoch": 0.10441581153717563, "grad_norm": 1.1015625, "learning_rate": 0.00038153151599277027, "loss": 5.9199, "mean_token_accuracy": 0.14222098216414453, "num_tokens": 3604160.0, "step": 2030 }, { "entropy": 6.096150064468384, "epoch": 0.10467299333899133, "grad_norm": 1.1015625, "learning_rate": 0.0003804923828128723, "loss": 5.9753, "mean_token_accuracy": 0.12967631593346596, "num_tokens": 3612623.0, "step": 2035 }, { "entropy": 6.059585428237915, "epoch": 0.10493017514080703, "grad_norm": 1.1875, "learning_rate": 0.0003794503575060104, "loss": 5.9046, "mean_token_accuracy": 0.134611614048481, "num_tokens": 3621254.0, "step": 2040 }, { "entropy": 5.889829015731811, "epoch": 0.10518735694262274, "grad_norm": 1.109375, "learning_rate": 0.00037840546863983484, "loss": 5.893, "mean_token_accuracy": 0.14060052409768103, "num_tokens": 3630304.0, "step": 2045 }, { "entropy": 6.063463830947876, "epoch": 0.10544453874443845, "grad_norm": 1.0703125, "learning_rate": 0.0003773577448605015, "loss": 5.8709, "mean_token_accuracy": 0.14505155757069588, "num_tokens": 3638998.0, "step": 2050 }, { "entropy": 6.033182001113891, "epoch": 0.10570172054625415, "grad_norm": 1.0078125, "learning_rate": 0.0003763072148918872, "loss": 5.8719, "mean_token_accuracy": 0.13738297373056413, "num_tokens": 3648460.0, "step": 2055 }, { "entropy": 5.934378385543823, "epoch": 0.10595890234806984, "grad_norm": 1.171875, "learning_rate": 0.0003752539075348017, "loss": 5.8969, "mean_token_accuracy": 0.1421407587826252, "num_tokens": 3657453.0, "step": 2060 }, { "entropy": 5.934575700759888, "epoch": 0.10621608414988555, "grad_norm": 1.09375, "learning_rate": 0.00037419785166619817, "loss": 5.8757, "mean_token_accuracy": 0.14191291332244874, "num_tokens": 3666674.0, "step": 2065 }, { "entropy": 6.116357278823853, "epoch": 0.10647326595170126, "grad_norm": 1.09375, "learning_rate": 0.0003731390762383818, "loss": 5.9335, "mean_token_accuracy": 0.1388901025056839, "num_tokens": 3675081.0, "step": 2070 }, { "entropy": 6.037048578262329, "epoch": 0.10673044775351696, "grad_norm": 1.109375, "learning_rate": 0.0003720776102782158, "loss": 5.8962, "mean_token_accuracy": 0.1339455910027027, "num_tokens": 3684317.0, "step": 2075 }, { "entropy": 5.939728164672852, "epoch": 0.10698762955533267, "grad_norm": 1.1015625, "learning_rate": 0.00037101348288632555, "loss": 5.8328, "mean_token_accuracy": 0.14282255843281746, "num_tokens": 3692607.0, "step": 2080 }, { "entropy": 6.1606145858764645, "epoch": 0.10724481135714836, "grad_norm": 1.1328125, "learning_rate": 0.0003699467232363012, "loss": 6.0506, "mean_token_accuracy": 0.13110460415482522, "num_tokens": 3701733.0, "step": 2085 }, { "entropy": 6.007357835769653, "epoch": 0.10750199315896407, "grad_norm": 1.125, "learning_rate": 0.0003688773605738973, "loss": 5.8779, "mean_token_accuracy": 0.13223487213253976, "num_tokens": 3710618.0, "step": 2090 }, { "entropy": 5.94810266494751, "epoch": 0.10775917496077977, "grad_norm": 1.1015625, "learning_rate": 0.00036780542421623134, "loss": 5.8592, "mean_token_accuracy": 0.1421344593167305, "num_tokens": 3719736.0, "step": 2095 }, { "entropy": 5.966670894622803, "epoch": 0.10801635676259548, "grad_norm": 1.2109375, "learning_rate": 0.0003667309435509802, "loss": 5.873, "mean_token_accuracy": 0.14545931667089462, "num_tokens": 3728554.0, "step": 2100 }, { "entropy": 5.962731409072876, "epoch": 0.10827353856441119, "grad_norm": 1.125, "learning_rate": 0.0003656539480355741, "loss": 5.8829, "mean_token_accuracy": 0.13873566016554834, "num_tokens": 3737278.0, "step": 2105 }, { "entropy": 5.947574758529663, "epoch": 0.10853072036622688, "grad_norm": 1.09375, "learning_rate": 0.0003645744671963891, "loss": 5.8388, "mean_token_accuracy": 0.1452670894563198, "num_tokens": 3746470.0, "step": 2110 }, { "entropy": 5.99600191116333, "epoch": 0.10878790216804259, "grad_norm": 1.109375, "learning_rate": 0.0003634925306279376, "loss": 5.9006, "mean_token_accuracy": 0.13959722667932511, "num_tokens": 3755661.0, "step": 2115 }, { "entropy": 6.022242259979248, "epoch": 0.10904508396985829, "grad_norm": 1.015625, "learning_rate": 0.0003624081679920574, "loss": 6.0371, "mean_token_accuracy": 0.13342893719673157, "num_tokens": 3764832.0, "step": 2120 }, { "entropy": 6.087024259567261, "epoch": 0.109302265771674, "grad_norm": 1.1171875, "learning_rate": 0.0003613214090170977, "loss": 5.8853, "mean_token_accuracy": 0.13842237889766693, "num_tokens": 3773633.0, "step": 2125 }, { "entropy": 6.0287542819976805, "epoch": 0.1095594475734897, "grad_norm": 1.171875, "learning_rate": 0.0003602322834971048, "loss": 5.9697, "mean_token_accuracy": 0.1348352313041687, "num_tokens": 3781622.0, "step": 2130 }, { "entropy": 5.97002649307251, "epoch": 0.1098166293753054, "grad_norm": 1.0703125, "learning_rate": 0.0003591408212910051, "loss": 5.8459, "mean_token_accuracy": 0.13936637341976166, "num_tokens": 3790678.0, "step": 2135 }, { "entropy": 6.014022493362427, "epoch": 0.1100738111771211, "grad_norm": 1.1953125, "learning_rate": 0.0003580470523217863, "loss": 5.967, "mean_token_accuracy": 0.13305697664618493, "num_tokens": 3799260.0, "step": 2140 }, { "entropy": 6.105735874176025, "epoch": 0.11033099297893681, "grad_norm": 1.0546875, "learning_rate": 0.0003569510065756771, "loss": 5.9684, "mean_token_accuracy": 0.1358775392174721, "num_tokens": 3809015.0, "step": 2145 }, { "entropy": 5.99890923500061, "epoch": 0.11058817478075252, "grad_norm": 1.0546875, "learning_rate": 0.0003558527141013254, "loss": 5.8978, "mean_token_accuracy": 0.13542463704943658, "num_tokens": 3817591.0, "step": 2150 }, { "entropy": 6.0370848178863525, "epoch": 0.11084535658256822, "grad_norm": 1.1875, "learning_rate": 0.0003547522050089742, "loss": 6.021, "mean_token_accuracy": 0.13292460292577743, "num_tokens": 3827426.0, "step": 2155 }, { "entropy": 6.12569842338562, "epoch": 0.11110253838438391, "grad_norm": 1.203125, "learning_rate": 0.00035364950946963606, "loss": 5.9108, "mean_token_accuracy": 0.13678978830575944, "num_tokens": 3835535.0, "step": 2160 }, { "entropy": 5.991197919845581, "epoch": 0.11135972018619962, "grad_norm": 1.15625, "learning_rate": 0.0003525446577142663, "loss": 5.8521, "mean_token_accuracy": 0.13940271139144897, "num_tokens": 3843807.0, "step": 2165 }, { "entropy": 6.020745277404785, "epoch": 0.11161690198801533, "grad_norm": 1.1171875, "learning_rate": 0.00035143768003293395, "loss": 5.9114, "mean_token_accuracy": 0.1366816468536854, "num_tokens": 3852821.0, "step": 2170 }, { "entropy": 6.005236577987671, "epoch": 0.11187408378983103, "grad_norm": 1.0234375, "learning_rate": 0.0003503286067739913, "loss": 5.9094, "mean_token_accuracy": 0.13549749478697776, "num_tokens": 3862483.0, "step": 2175 }, { "entropy": 6.071946811676026, "epoch": 0.11213126559164674, "grad_norm": 1.171875, "learning_rate": 0.00034921746834324193, "loss": 5.9423, "mean_token_accuracy": 0.13592587783932686, "num_tokens": 3871702.0, "step": 2180 }, { "entropy": 5.981179523468017, "epoch": 0.11238844739346243, "grad_norm": 1.078125, "learning_rate": 0.0003481042952031072, "loss": 5.877, "mean_token_accuracy": 0.14119011908769608, "num_tokens": 3879489.0, "step": 2185 }, { "entropy": 6.002960681915283, "epoch": 0.11264562919527814, "grad_norm": 1.078125, "learning_rate": 0.0003469891178717911, "loss": 5.9092, "mean_token_accuracy": 0.13691228330135347, "num_tokens": 3889042.0, "step": 2190 }, { "entropy": 5.930085325241089, "epoch": 0.11290281099709384, "grad_norm": 1.1484375, "learning_rate": 0.0003458719669224436, "loss": 5.8274, "mean_token_accuracy": 0.1413699135184288, "num_tokens": 3897787.0, "step": 2195 }, { "entropy": 5.974176216125488, "epoch": 0.11315999279890955, "grad_norm": 1.078125, "learning_rate": 0.0003447528729823221, "loss": 5.8985, "mean_token_accuracy": 0.13640068992972373, "num_tokens": 3907117.0, "step": 2200 }, { "entropy": 6.045211410522461, "epoch": 0.11341717460072526, "grad_norm": 1.1796875, "learning_rate": 0.0003436318667319525, "loss": 5.8875, "mean_token_accuracy": 0.136257354170084, "num_tokens": 3915832.0, "step": 2205 }, { "entropy": 5.961761140823365, "epoch": 0.11367435640254096, "grad_norm": 1.1171875, "learning_rate": 0.00034250897890428716, "loss": 5.92, "mean_token_accuracy": 0.14180033877491952, "num_tokens": 3925291.0, "step": 2210 }, { "entropy": 5.964248991012573, "epoch": 0.11393153820435666, "grad_norm": 1.15625, "learning_rate": 0.0003413842402838633, "loss": 5.6798, "mean_token_accuracy": 0.15023099184036254, "num_tokens": 3933784.0, "step": 2215 }, { "entropy": 5.867644309997559, "epoch": 0.11418872000617236, "grad_norm": 1.0546875, "learning_rate": 0.00034025768170595834, "loss": 5.744, "mean_token_accuracy": 0.14695340394973755, "num_tokens": 3942166.0, "step": 2220 }, { "entropy": 5.947494602203369, "epoch": 0.11444590180798807, "grad_norm": 1.109375, "learning_rate": 0.0003391293340557446, "loss": 5.821, "mean_token_accuracy": 0.14130731597542762, "num_tokens": 3951236.0, "step": 2225 }, { "entropy": 5.957868671417236, "epoch": 0.11470308360980377, "grad_norm": 1.1015625, "learning_rate": 0.0003379992282674431, "loss": 5.8349, "mean_token_accuracy": 0.13815009593963623, "num_tokens": 3959865.0, "step": 2230 }, { "entropy": 5.949271821975708, "epoch": 0.11496026541161948, "grad_norm": 1.1875, "learning_rate": 0.0003368673953234749, "loss": 5.8612, "mean_token_accuracy": 0.14323789328336717, "num_tokens": 3968683.0, "step": 2235 }, { "entropy": 6.008644342422485, "epoch": 0.11521744721343517, "grad_norm": 1.09375, "learning_rate": 0.00033573386625361176, "loss": 5.8504, "mean_token_accuracy": 0.13288640454411507, "num_tokens": 3977729.0, "step": 2240 }, { "entropy": 5.971594619750976, "epoch": 0.11547462901525088, "grad_norm": 1.1875, "learning_rate": 0.00033459867213412567, "loss": 5.7966, "mean_token_accuracy": 0.14251609444618224, "num_tokens": 3986552.0, "step": 2245 }, { "entropy": 5.949598693847657, "epoch": 0.11573181081706659, "grad_norm": 1.0234375, "learning_rate": 0.000333461844086937, "loss": 5.7854, "mean_token_accuracy": 0.14427516832947732, "num_tokens": 3995721.0, "step": 2250 }, { "entropy": 5.895298337936401, "epoch": 0.11598899261888229, "grad_norm": 1.21875, "learning_rate": 0.00033232341327876097, "loss": 5.7933, "mean_token_accuracy": 0.14527158439159393, "num_tokens": 4003912.0, "step": 2255 }, { "entropy": 5.952937936782837, "epoch": 0.116246174420698, "grad_norm": 1.078125, "learning_rate": 0.0003311834109202531, "loss": 5.8264, "mean_token_accuracy": 0.14057933837175368, "num_tokens": 4013127.0, "step": 2260 }, { "entropy": 5.956308174133301, "epoch": 0.11650335622251369, "grad_norm": 1.2109375, "learning_rate": 0.00033004186826515416, "loss": 5.8836, "mean_token_accuracy": 0.13978948220610618, "num_tokens": 4022650.0, "step": 2265 }, { "entropy": 5.934606456756592, "epoch": 0.1167605380243294, "grad_norm": 1.0546875, "learning_rate": 0.0003288988166094324, "loss": 5.8271, "mean_token_accuracy": 0.14565607085824012, "num_tokens": 4032337.0, "step": 2270 }, { "entropy": 6.088882493972778, "epoch": 0.1170177198261451, "grad_norm": 1.1953125, "learning_rate": 0.00032775428729042656, "loss": 5.9627, "mean_token_accuracy": 0.1381226435303688, "num_tokens": 4040849.0, "step": 2275 }, { "entropy": 6.047893333435058, "epoch": 0.11727490162796081, "grad_norm": 1.0546875, "learning_rate": 0.000326608311685986, "loss": 5.8383, "mean_token_accuracy": 0.14196593686938286, "num_tokens": 4050085.0, "step": 2280 }, { "entropy": 5.916841983795166, "epoch": 0.11753208342977652, "grad_norm": 1.203125, "learning_rate": 0.0003254609212136108, "loss": 5.7805, "mean_token_accuracy": 0.14623728320002555, "num_tokens": 4058435.0, "step": 2285 }, { "entropy": 5.881429529190063, "epoch": 0.11778926523159221, "grad_norm": 1.1015625, "learning_rate": 0.00032431214732959036, "loss": 5.7854, "mean_token_accuracy": 0.14314507246017455, "num_tokens": 4067307.0, "step": 2290 }, { "entropy": 5.845193719863891, "epoch": 0.11804644703340791, "grad_norm": 1.046875, "learning_rate": 0.000323162021528141, "loss": 5.8497, "mean_token_accuracy": 0.13934367150068283, "num_tokens": 4076794.0, "step": 2295 }, { "entropy": 5.98328595161438, "epoch": 0.11830362883522362, "grad_norm": 1.0390625, "learning_rate": 0.00032201057534054264, "loss": 5.8994, "mean_token_accuracy": 0.14008660316467286, "num_tokens": 4085856.0, "step": 2300 }, { "entropy": 5.992867755889892, "epoch": 0.11856081063703933, "grad_norm": 1.046875, "learning_rate": 0.00032085784033427414, "loss": 5.8536, "mean_token_accuracy": 0.1433585487306118, "num_tokens": 4095297.0, "step": 2305 }, { "entropy": 6.014429998397827, "epoch": 0.11881799243885503, "grad_norm": 1.0078125, "learning_rate": 0.0003197038481121478, "loss": 5.8979, "mean_token_accuracy": 0.13549182265996934, "num_tokens": 4105066.0, "step": 2310 }, { "entropy": 6.060473871231079, "epoch": 0.11907517424067073, "grad_norm": 1.1328125, "learning_rate": 0.0003185486303114436, "loss": 5.8629, "mean_token_accuracy": 0.13635988309979438, "num_tokens": 4113473.0, "step": 2315 }, { "entropy": 5.887990808486938, "epoch": 0.11933235604248643, "grad_norm": 1.0859375, "learning_rate": 0.0003173922186030409, "loss": 5.8707, "mean_token_accuracy": 0.14502280503511428, "num_tokens": 4122544.0, "step": 2320 }, { "entropy": 6.007597160339356, "epoch": 0.11958953784430214, "grad_norm": 1.1875, "learning_rate": 0.000316234644690551, "loss": 5.9357, "mean_token_accuracy": 0.14004722833633423, "num_tokens": 4131548.0, "step": 2325 }, { "entropy": 6.023855304718017, "epoch": 0.11984671964611784, "grad_norm": 1.109375, "learning_rate": 0.0003150759403094473, "loss": 5.8971, "mean_token_accuracy": 0.14639964699745178, "num_tokens": 4140025.0, "step": 2330 }, { "entropy": 5.937837791442871, "epoch": 0.12010390144793355, "grad_norm": 1.171875, "learning_rate": 0.00031391613722619587, "loss": 5.8293, "mean_token_accuracy": 0.14603792652487754, "num_tokens": 4148684.0, "step": 2335 }, { "entropy": 6.02265305519104, "epoch": 0.12036108324974924, "grad_norm": 1.0625, "learning_rate": 0.000312755267237384, "loss": 5.9147, "mean_token_accuracy": 0.136139065772295, "num_tokens": 4158405.0, "step": 2340 }, { "entropy": 5.976344728469849, "epoch": 0.12061826505156495, "grad_norm": 1.09375, "learning_rate": 0.0003115933621688488, "loss": 5.6959, "mean_token_accuracy": 0.14749561250209808, "num_tokens": 4167643.0, "step": 2345 }, { "entropy": 5.885197925567627, "epoch": 0.12087544685338066, "grad_norm": 1.046875, "learning_rate": 0.00031043045387480487, "loss": 5.8377, "mean_token_accuracy": 0.14639547243714332, "num_tokens": 4177761.0, "step": 2350 }, { "entropy": 6.0259346008300785, "epoch": 0.12113262865519636, "grad_norm": 1.140625, "learning_rate": 0.0003092665742369703, "loss": 5.809, "mean_token_accuracy": 0.14031819701194764, "num_tokens": 4186143.0, "step": 2355 }, { "entropy": 5.943132781982422, "epoch": 0.12138981045701207, "grad_norm": 1.15625, "learning_rate": 0.00030810175516369343, "loss": 5.8055, "mean_token_accuracy": 0.1441400282084942, "num_tokens": 4194959.0, "step": 2360 }, { "entropy": 5.915530729293823, "epoch": 0.12164699225882776, "grad_norm": 1.1328125, "learning_rate": 0.0003069360285890775, "loss": 5.7974, "mean_token_accuracy": 0.1439046949148178, "num_tokens": 4203642.0, "step": 2365 }, { "entropy": 5.9029628276824955, "epoch": 0.12190417406064347, "grad_norm": 1.1328125, "learning_rate": 0.00030576942647210547, "loss": 5.8055, "mean_token_accuracy": 0.1408913992345333, "num_tokens": 4213006.0, "step": 2370 }, { "entropy": 5.975221157073975, "epoch": 0.12216135586245917, "grad_norm": 1.0859375, "learning_rate": 0.00030460198079576355, "loss": 5.7381, "mean_token_accuracy": 0.15421162396669388, "num_tokens": 4222149.0, "step": 2375 }, { "entropy": 5.8654869556427, "epoch": 0.12241853766427488, "grad_norm": 1.1875, "learning_rate": 0.0003034337235661648, "loss": 5.7474, "mean_token_accuracy": 0.1494328647851944, "num_tokens": 4230718.0, "step": 2380 }, { "entropy": 5.978770732879639, "epoch": 0.12267571946609059, "grad_norm": 1.1484375, "learning_rate": 0.0003022646868116714, "loss": 5.9697, "mean_token_accuracy": 0.1301795445382595, "num_tokens": 4239958.0, "step": 2385 }, { "entropy": 5.979018259048462, "epoch": 0.12293290126790628, "grad_norm": 1.078125, "learning_rate": 0.0003010949025820163, "loss": 5.7852, "mean_token_accuracy": 0.13845039382576943, "num_tokens": 4248468.0, "step": 2390 }, { "entropy": 5.9493214130401615, "epoch": 0.12319008306972198, "grad_norm": 1.1640625, "learning_rate": 0.0002999244029474252, "loss": 5.8451, "mean_token_accuracy": 0.14041090309619902, "num_tokens": 4257394.0, "step": 2395 }, { "entropy": 5.8784568309783936, "epoch": 0.12344726487153769, "grad_norm": 1.125, "learning_rate": 0.00029875321999773684, "loss": 5.7533, "mean_token_accuracy": 0.14877835065126419, "num_tokens": 4265971.0, "step": 2400 }, { "entropy": 5.9012456893920895, "epoch": 0.1237044466733534, "grad_norm": 1.0546875, "learning_rate": 0.00029758138584152333, "loss": 5.8083, "mean_token_accuracy": 0.1378701776266098, "num_tokens": 4275672.0, "step": 2405 }, { "entropy": 5.956387281417847, "epoch": 0.1239616284751691, "grad_norm": 1.1171875, "learning_rate": 0.0002964089326052102, "loss": 5.7706, "mean_token_accuracy": 0.14205614998936653, "num_tokens": 4284487.0, "step": 2410 }, { "entropy": 5.970116043090821, "epoch": 0.1242188102769848, "grad_norm": 1.0859375, "learning_rate": 0.0002952358924321949, "loss": 5.7826, "mean_token_accuracy": 0.1519901379942894, "num_tokens": 4293404.0, "step": 2415 }, { "entropy": 6.005149602890015, "epoch": 0.1244759920788005, "grad_norm": 1.1796875, "learning_rate": 0.00029406229748196657, "loss": 5.8048, "mean_token_accuracy": 0.1412213161587715, "num_tokens": 4302261.0, "step": 2420 }, { "entropy": 5.932501649856567, "epoch": 0.12473317388061621, "grad_norm": 1.046875, "learning_rate": 0.0002928881799292235, "loss": 5.7883, "mean_token_accuracy": 0.14596713930368424, "num_tokens": 4311488.0, "step": 2425 }, { "entropy": 5.963835191726685, "epoch": 0.12499035568243191, "grad_norm": 1.2265625, "learning_rate": 0.00029171357196299154, "loss": 5.8064, "mean_token_accuracy": 0.13890780359506608, "num_tokens": 4321194.0, "step": 2430 }, { "entropy": 5.9551738739013675, "epoch": 0.1252475374842476, "grad_norm": 1.0859375, "learning_rate": 0.0002905385057857414, "loss": 5.8245, "mean_token_accuracy": 0.13930185437202453, "num_tokens": 4329906.0, "step": 2435 }, { "entropy": 5.947234010696411, "epoch": 0.12550471928606333, "grad_norm": 1.1015625, "learning_rate": 0.0002893630136125058, "loss": 5.8544, "mean_token_accuracy": 0.1406613238155842, "num_tokens": 4339386.0, "step": 2440 }, { "entropy": 5.956067037582398, "epoch": 0.12576190108787902, "grad_norm": 1.0546875, "learning_rate": 0.0002881871276699967, "loss": 5.7791, "mean_token_accuracy": 0.1507390022277832, "num_tokens": 4348039.0, "step": 2445 }, { "entropy": 5.951892757415772, "epoch": 0.12601908288969474, "grad_norm": 1.2109375, "learning_rate": 0.00028701088019572114, "loss": 5.8444, "mean_token_accuracy": 0.14090602099895477, "num_tokens": 4356171.0, "step": 2450 }, { "entropy": 6.020451068878174, "epoch": 0.12627626469151043, "grad_norm": 1.0859375, "learning_rate": 0.0002858343034370977, "loss": 5.8681, "mean_token_accuracy": 0.14203555062413215, "num_tokens": 4365140.0, "step": 2455 }, { "entropy": 5.911239242553711, "epoch": 0.12653344649332612, "grad_norm": 1.1796875, "learning_rate": 0.00028465742965057267, "loss": 5.6277, "mean_token_accuracy": 0.15792713835835456, "num_tokens": 4373435.0, "step": 2460 }, { "entropy": 5.798923444747925, "epoch": 0.12679062829514184, "grad_norm": 1.1640625, "learning_rate": 0.00028348029110073533, "loss": 5.7314, "mean_token_accuracy": 0.14894369319081308, "num_tokens": 4381411.0, "step": 2465 }, { "entropy": 5.923311853408814, "epoch": 0.12704781009695754, "grad_norm": 1.0859375, "learning_rate": 0.00028230292005943365, "loss": 5.769, "mean_token_accuracy": 0.14870745241641997, "num_tokens": 4389899.0, "step": 2470 }, { "entropy": 5.958002614974975, "epoch": 0.12730499189877326, "grad_norm": 1.125, "learning_rate": 0.00028112534880488945, "loss": 5.8097, "mean_token_accuracy": 0.14627409875392913, "num_tokens": 4399004.0, "step": 2475 }, { "entropy": 5.978843307495117, "epoch": 0.12756217370058895, "grad_norm": 1.09375, "learning_rate": 0.0002799476096208137, "loss": 5.8341, "mean_token_accuracy": 0.14349768534302712, "num_tokens": 4407963.0, "step": 2480 }, { "entropy": 5.999022006988525, "epoch": 0.12781935550240464, "grad_norm": 1.1171875, "learning_rate": 0.00027876973479552087, "loss": 5.8285, "mean_token_accuracy": 0.14875191003084182, "num_tokens": 4416562.0, "step": 2485 }, { "entropy": 5.941763925552368, "epoch": 0.12807653730422036, "grad_norm": 1.0859375, "learning_rate": 0.00027759175662104424, "loss": 5.8246, "mean_token_accuracy": 0.135814069211483, "num_tokens": 4425961.0, "step": 2490 }, { "entropy": 5.953846645355225, "epoch": 0.12833371910603605, "grad_norm": 1.09375, "learning_rate": 0.0002764137073922508, "loss": 5.8864, "mean_token_accuracy": 0.1416388437151909, "num_tokens": 4435167.0, "step": 2495 }, { "entropy": 5.9248755931854244, "epoch": 0.12859090090785177, "grad_norm": 1.1640625, "learning_rate": 0.00027523561940595505, "loss": 5.8169, "mean_token_accuracy": 0.14142304435372352, "num_tokens": 4444207.0, "step": 2500 }, { "entropy": 6.038079309463501, "epoch": 0.12884808270966747, "grad_norm": 1.0859375, "learning_rate": 0.0002740575249600342, "loss": 5.9115, "mean_token_accuracy": 0.1447101503610611, "num_tokens": 4453437.0, "step": 2505 }, { "entropy": 5.950088453292847, "epoch": 0.12910526451148316, "grad_norm": 1.015625, "learning_rate": 0.00027287945635254263, "loss": 5.7212, "mean_token_accuracy": 0.15202828198671342, "num_tokens": 4462225.0, "step": 2510 }, { "entropy": 5.944004249572754, "epoch": 0.12936244631329888, "grad_norm": 1.15625, "learning_rate": 0.00027170144588082635, "loss": 5.8029, "mean_token_accuracy": 0.1497768573462963, "num_tokens": 4471524.0, "step": 2515 }, { "entropy": 5.955462265014648, "epoch": 0.12961962811511457, "grad_norm": 1.1171875, "learning_rate": 0.00027052352584063763, "loss": 5.8171, "mean_token_accuracy": 0.1394263669848442, "num_tokens": 4480842.0, "step": 2520 }, { "entropy": 6.016254425048828, "epoch": 0.1298768099169303, "grad_norm": 1.125, "learning_rate": 0.00026934572852524907, "loss": 5.8041, "mean_token_accuracy": 0.14456221759319304, "num_tokens": 4489252.0, "step": 2525 }, { "entropy": 5.962445497512817, "epoch": 0.13013399171874598, "grad_norm": 1.109375, "learning_rate": 0.00026816808622456937, "loss": 5.751, "mean_token_accuracy": 0.14099297150969506, "num_tokens": 4498092.0, "step": 2530 }, { "entropy": 5.888944292068482, "epoch": 0.13039117352056168, "grad_norm": 1.109375, "learning_rate": 0.0002669906312242569, "loss": 5.8182, "mean_token_accuracy": 0.1458373673260212, "num_tokens": 4507458.0, "step": 2535 }, { "entropy": 5.87163348197937, "epoch": 0.1306483553223774, "grad_norm": 1.125, "learning_rate": 0.00026581339580483525, "loss": 5.6555, "mean_token_accuracy": 0.14610802978277207, "num_tokens": 4516500.0, "step": 2540 }, { "entropy": 5.9336553573608395, "epoch": 0.1309055371241931, "grad_norm": 1.03125, "learning_rate": 0.0002646364122408082, "loss": 5.7971, "mean_token_accuracy": 0.14564713165163995, "num_tokens": 4525563.0, "step": 2545 }, { "entropy": 5.964129304885864, "epoch": 0.1311627189260088, "grad_norm": 1.09375, "learning_rate": 0.0002634597127997749, "loss": 5.8177, "mean_token_accuracy": 0.14048824459314346, "num_tokens": 4534089.0, "step": 2550 }, { "entropy": 5.954702997207642, "epoch": 0.1314199007278245, "grad_norm": 1.1484375, "learning_rate": 0.0002622833297415445, "loss": 5.8048, "mean_token_accuracy": 0.14476812183856963, "num_tokens": 4542846.0, "step": 2555 }, { "entropy": 5.939824199676513, "epoch": 0.1316770825296402, "grad_norm": 1.0625, "learning_rate": 0.0002611072953172531, "loss": 5.8477, "mean_token_accuracy": 0.14269847571849822, "num_tokens": 4552297.0, "step": 2560 }, { "entropy": 6.007514333724975, "epoch": 0.1319342643314559, "grad_norm": 1.109375, "learning_rate": 0.00025993164176847845, "loss": 5.8132, "mean_token_accuracy": 0.14156687557697295, "num_tokens": 4561444.0, "step": 2565 }, { "entropy": 6.02439775466919, "epoch": 0.1321914461332716, "grad_norm": 1.1796875, "learning_rate": 0.0002587564013263564, "loss": 5.8099, "mean_token_accuracy": 0.14534456878900529, "num_tokens": 4570661.0, "step": 2570 }, { "entropy": 5.8748493671417235, "epoch": 0.13244862793508733, "grad_norm": 1.203125, "learning_rate": 0.0002575816062106974, "loss": 5.6757, "mean_token_accuracy": 0.14598242715001106, "num_tokens": 4578777.0, "step": 2575 }, { "entropy": 5.807692241668701, "epoch": 0.13270580973690302, "grad_norm": 1.1328125, "learning_rate": 0.00025640728862910293, "loss": 5.7508, "mean_token_accuracy": 0.1477329283952713, "num_tokens": 4586888.0, "step": 2580 }, { "entropy": 5.893733835220337, "epoch": 0.1329629915387187, "grad_norm": 1.1015625, "learning_rate": 0.00025523348077608285, "loss": 5.6646, "mean_token_accuracy": 0.15274369195103646, "num_tokens": 4594983.0, "step": 2585 }, { "entropy": 5.864890909194946, "epoch": 0.13322017334053443, "grad_norm": 1.125, "learning_rate": 0.00025406021483217225, "loss": 5.7269, "mean_token_accuracy": 0.14728641286492347, "num_tokens": 4603886.0, "step": 2590 }, { "entropy": 5.983772325515747, "epoch": 0.13347735514235012, "grad_norm": 1.0859375, "learning_rate": 0.00025288752296304963, "loss": 5.8426, "mean_token_accuracy": 0.137150888890028, "num_tokens": 4612723.0, "step": 2595 }, { "entropy": 5.947617816925049, "epoch": 0.13373453694416584, "grad_norm": 1.0703125, "learning_rate": 0.000251715437318655, "loss": 5.6468, "mean_token_accuracy": 0.15530167669057846, "num_tokens": 4621584.0, "step": 2600 }, { "entropy": 5.802928686141968, "epoch": 0.13399171874598154, "grad_norm": 1.0625, "learning_rate": 0.0002505439900323084, "loss": 5.7151, "mean_token_accuracy": 0.1468648336827755, "num_tokens": 4630523.0, "step": 2605 }, { "entropy": 5.8552350997924805, "epoch": 0.13424890054779723, "grad_norm": 1.171875, "learning_rate": 0.00024937321321982894, "loss": 5.7215, "mean_token_accuracy": 0.15691960453987122, "num_tokens": 4639527.0, "step": 2610 }, { "entropy": 5.914655923843384, "epoch": 0.13450608234961295, "grad_norm": 1.171875, "learning_rate": 0.00024820313897865433, "loss": 5.7114, "mean_token_accuracy": 0.15264911204576492, "num_tokens": 4647939.0, "step": 2615 }, { "entropy": 5.881383657455444, "epoch": 0.13476326415142864, "grad_norm": 1.1015625, "learning_rate": 0.00024703379938696105, "loss": 5.7997, "mean_token_accuracy": 0.13958094269037247, "num_tokens": 4657287.0, "step": 2620 }, { "entropy": 5.8907615661621096, "epoch": 0.13502044595324436, "grad_norm": 1.125, "learning_rate": 0.00024586522650278447, "loss": 5.6564, "mean_token_accuracy": 0.14980467706918715, "num_tokens": 4665391.0, "step": 2625 }, { "entropy": 5.8882465839385985, "epoch": 0.13527762775506005, "grad_norm": 1.234375, "learning_rate": 0.00024469745236314064, "loss": 5.7079, "mean_token_accuracy": 0.15327545553445815, "num_tokens": 4673704.0, "step": 2630 }, { "entropy": 6.0655638694763185, "epoch": 0.13553480955687575, "grad_norm": 1.0546875, "learning_rate": 0.00024353050898314767, "loss": 5.9473, "mean_token_accuracy": 0.13833739161491393, "num_tokens": 4682969.0, "step": 2635 }, { "entropy": 5.9324102878570555, "epoch": 0.13579199135869147, "grad_norm": 1.1640625, "learning_rate": 0.00024236442835514743, "loss": 5.6438, "mean_token_accuracy": 0.14957863092422485, "num_tokens": 4691786.0, "step": 2640 }, { "entropy": 5.762153291702271, "epoch": 0.13604917316050716, "grad_norm": 1.1484375, "learning_rate": 0.00024119924244782965, "loss": 5.7241, "mean_token_accuracy": 0.15027930289506913, "num_tokens": 4700944.0, "step": 2645 }, { "entropy": 5.862569570541382, "epoch": 0.13630635496232288, "grad_norm": 1.1015625, "learning_rate": 0.00024003498320535462, "loss": 5.709, "mean_token_accuracy": 0.1430109515786171, "num_tokens": 4709802.0, "step": 2650 }, { "entropy": 5.950196361541748, "epoch": 0.13656353676413857, "grad_norm": 1.1953125, "learning_rate": 0.00023887168254647727, "loss": 5.77, "mean_token_accuracy": 0.14267563819885254, "num_tokens": 4719282.0, "step": 2655 }, { "entropy": 6.000500011444092, "epoch": 0.13682071856595426, "grad_norm": 1.0703125, "learning_rate": 0.00023770937236367308, "loss": 5.8215, "mean_token_accuracy": 0.14113259688019753, "num_tokens": 4728762.0, "step": 2660 }, { "entropy": 5.90273871421814, "epoch": 0.13707790036776998, "grad_norm": 1.0703125, "learning_rate": 0.00023654808452226278, "loss": 5.5937, "mean_token_accuracy": 0.14730694591999055, "num_tokens": 4737178.0, "step": 2665 }, { "entropy": 5.901443719863892, "epoch": 0.13733508216958568, "grad_norm": 1.15625, "learning_rate": 0.00023538785085953912, "loss": 5.7031, "mean_token_accuracy": 0.15266731828451158, "num_tokens": 4745819.0, "step": 2670 }, { "entropy": 5.813074254989624, "epoch": 0.1375922639714014, "grad_norm": 1.0703125, "learning_rate": 0.00023422870318389404, "loss": 5.7465, "mean_token_accuracy": 0.1519558846950531, "num_tokens": 4754656.0, "step": 2675 }, { "entropy": 5.913999032974243, "epoch": 0.1378494457732171, "grad_norm": 1.0859375, "learning_rate": 0.0002330706732739468, "loss": 5.7406, "mean_token_accuracy": 0.14824089780449867, "num_tokens": 4763346.0, "step": 2680 }, { "entropy": 5.8917923927307125, "epoch": 0.13810662757503278, "grad_norm": 1.0546875, "learning_rate": 0.00023191379287767211, "loss": 5.7179, "mean_token_accuracy": 0.14699299037456512, "num_tokens": 4771611.0, "step": 2685 }, { "entropy": 5.872665691375732, "epoch": 0.1383638093768485, "grad_norm": 1.203125, "learning_rate": 0.0002307580937115305, "loss": 5.7956, "mean_token_accuracy": 0.14343073591589928, "num_tokens": 4780741.0, "step": 2690 }, { "entropy": 5.963706064224243, "epoch": 0.1386209911786642, "grad_norm": 1.140625, "learning_rate": 0.00022960360745959846, "loss": 5.8486, "mean_token_accuracy": 0.13829033076763153, "num_tokens": 4790190.0, "step": 2695 }, { "entropy": 5.902351331710816, "epoch": 0.1388781729804799, "grad_norm": 1.1875, "learning_rate": 0.00022845036577269972, "loss": 5.6052, "mean_token_accuracy": 0.15682805180549622, "num_tokens": 4798563.0, "step": 2700 }, { "entropy": 5.907444286346435, "epoch": 0.1391353547822956, "grad_norm": 1.0703125, "learning_rate": 0.00022729840026753777, "loss": 5.802, "mean_token_accuracy": 0.13890419751405716, "num_tokens": 4807189.0, "step": 2705 }, { "entropy": 5.871195507049561, "epoch": 0.1393925365841113, "grad_norm": 1.1875, "learning_rate": 0.0002261477425258287, "loss": 5.7676, "mean_token_accuracy": 0.14524144679307938, "num_tokens": 4816343.0, "step": 2710 }, { "entropy": 5.9607168674469, "epoch": 0.13964971838592702, "grad_norm": 1.0078125, "learning_rate": 0.0002249984240934358, "loss": 5.7289, "mean_token_accuracy": 0.14837161004543303, "num_tokens": 4825296.0, "step": 2715 }, { "entropy": 5.922761869430542, "epoch": 0.1399069001877427, "grad_norm": 1.0703125, "learning_rate": 0.00022385047647950464, "loss": 5.691, "mean_token_accuracy": 0.15108680725097656, "num_tokens": 4834332.0, "step": 2720 }, { "entropy": 5.955756044387817, "epoch": 0.14016408198955843, "grad_norm": 1.171875, "learning_rate": 0.0002227039311555986, "loss": 5.7661, "mean_token_accuracy": 0.1478307694196701, "num_tokens": 4843573.0, "step": 2725 }, { "entropy": 5.951103067398071, "epoch": 0.14042126379137412, "grad_norm": 1.0546875, "learning_rate": 0.0002215588195548372, "loss": 5.8034, "mean_token_accuracy": 0.14295736625790595, "num_tokens": 4852471.0, "step": 2730 }, { "entropy": 5.937809133529663, "epoch": 0.14067844559318982, "grad_norm": 1.0703125, "learning_rate": 0.00022041517307103337, "loss": 5.7293, "mean_token_accuracy": 0.14729402661323548, "num_tokens": 4861361.0, "step": 2735 }, { "entropy": 5.91626615524292, "epoch": 0.14093562739500554, "grad_norm": 1.1484375, "learning_rate": 0.0002192730230578331, "loss": 5.8058, "mean_token_accuracy": 0.1489897146821022, "num_tokens": 4870429.0, "step": 2740 }, { "entropy": 5.956934118270874, "epoch": 0.14119280919682123, "grad_norm": 1.0625, "learning_rate": 0.0002181324008278559, "loss": 5.6819, "mean_token_accuracy": 0.14700148552656173, "num_tokens": 4879635.0, "step": 2745 }, { "entropy": 5.871394920349121, "epoch": 0.14144999099863695, "grad_norm": 1.1171875, "learning_rate": 0.00021699333765183655, "loss": 5.6465, "mean_token_accuracy": 0.15123720914125444, "num_tokens": 4888041.0, "step": 2750 }, { "entropy": 5.875310802459717, "epoch": 0.14170717280045264, "grad_norm": 1.1171875, "learning_rate": 0.0002158558647577673, "loss": 5.7745, "mean_token_accuracy": 0.14221168756484986, "num_tokens": 4897088.0, "step": 2755 }, { "entropy": 5.943839645385742, "epoch": 0.14196435460226833, "grad_norm": 1.1015625, "learning_rate": 0.00021472001333004215, "loss": 5.7421, "mean_token_accuracy": 0.1458420291543007, "num_tokens": 4905722.0, "step": 2760 }, { "entropy": 5.947792053222656, "epoch": 0.14222153640408405, "grad_norm": 1.078125, "learning_rate": 0.00021358581450860186, "loss": 5.7851, "mean_token_accuracy": 0.14722041487693788, "num_tokens": 4914954.0, "step": 2765 }, { "entropy": 6.009203195571899, "epoch": 0.14247871820589975, "grad_norm": 1.1171875, "learning_rate": 0.0002124532993880799, "loss": 5.7727, "mean_token_accuracy": 0.14699561893939972, "num_tokens": 4923617.0, "step": 2770 }, { "entropy": 5.872904253005982, "epoch": 0.14273590000771547, "grad_norm": 1.1015625, "learning_rate": 0.00021132249901695044, "loss": 5.6698, "mean_token_accuracy": 0.15182799845933914, "num_tokens": 4932392.0, "step": 2775 }, { "entropy": 5.942844295501709, "epoch": 0.14299308180953116, "grad_norm": 1.046875, "learning_rate": 0.00021019344439667705, "loss": 5.7992, "mean_token_accuracy": 0.14551443457603455, "num_tokens": 4941286.0, "step": 2780 }, { "entropy": 5.960988092422485, "epoch": 0.14325026361134685, "grad_norm": 1.1171875, "learning_rate": 0.00020906616648086213, "loss": 5.7667, "mean_token_accuracy": 0.14625853151082993, "num_tokens": 4949907.0, "step": 2785 }, { "entropy": 5.977736568450927, "epoch": 0.14350744541316257, "grad_norm": 1.09375, "learning_rate": 0.00020794069617439942, "loss": 5.834, "mean_token_accuracy": 0.1429489754140377, "num_tokens": 4959115.0, "step": 2790 }, { "entropy": 5.970361328125, "epoch": 0.14376462721497826, "grad_norm": 1.0703125, "learning_rate": 0.00020681706433262593, "loss": 5.7972, "mean_token_accuracy": 0.1437188670039177, "num_tokens": 4967547.0, "step": 2795 }, { "entropy": 5.911842775344849, "epoch": 0.14402180901679398, "grad_norm": 1.1015625, "learning_rate": 0.00020569530176047602, "loss": 5.7177, "mean_token_accuracy": 0.14318782836198807, "num_tokens": 4976531.0, "step": 2800 }, { "entropy": 5.9328851222991945, "epoch": 0.14427899081860968, "grad_norm": 1.0625, "learning_rate": 0.0002045754392116374, "loss": 5.7947, "mean_token_accuracy": 0.14737410992383956, "num_tokens": 4985589.0, "step": 2805 }, { "entropy": 5.88200044631958, "epoch": 0.14453617262042537, "grad_norm": 1.15625, "learning_rate": 0.00020345750738770757, "loss": 5.6939, "mean_token_accuracy": 0.1540876194834709, "num_tokens": 4994356.0, "step": 2810 }, { "entropy": 5.871546030044556, "epoch": 0.1447933544222411, "grad_norm": 1.1640625, "learning_rate": 0.00020234153693735214, "loss": 5.7366, "mean_token_accuracy": 0.14891282320022584, "num_tokens": 5003075.0, "step": 2815 }, { "entropy": 5.931076526641846, "epoch": 0.14505053622405678, "grad_norm": 1.0625, "learning_rate": 0.0002012275584554647, "loss": 5.7089, "mean_token_accuracy": 0.14783241748809814, "num_tokens": 5012171.0, "step": 2820 }, { "entropy": 5.906200504302978, "epoch": 0.1453077180258725, "grad_norm": 1.1171875, "learning_rate": 0.00020011560248232803, "loss": 5.6612, "mean_token_accuracy": 0.15873602479696275, "num_tokens": 5021627.0, "step": 2825 }, { "entropy": 5.907571601867676, "epoch": 0.1455648998276882, "grad_norm": 1.046875, "learning_rate": 0.00019900569950277692, "loss": 5.6891, "mean_token_accuracy": 0.15038043409585952, "num_tokens": 5031281.0, "step": 2830 }, { "entropy": 5.873400497436523, "epoch": 0.14582208162950389, "grad_norm": 1.0234375, "learning_rate": 0.00019789787994536228, "loss": 5.7201, "mean_token_accuracy": 0.1496950700879097, "num_tokens": 5039774.0, "step": 2835 }, { "entropy": 5.932717323303223, "epoch": 0.1460792634313196, "grad_norm": 1.140625, "learning_rate": 0.00019679217418151667, "loss": 5.666, "mean_token_accuracy": 0.15262340754270554, "num_tokens": 5048668.0, "step": 2840 }, { "entropy": 5.87169075012207, "epoch": 0.1463364452331353, "grad_norm": 1.15625, "learning_rate": 0.00019568861252472236, "loss": 5.6107, "mean_token_accuracy": 0.15350384563207625, "num_tokens": 5057738.0, "step": 2845 }, { "entropy": 5.866910600662232, "epoch": 0.14659362703495102, "grad_norm": 1.125, "learning_rate": 0.00019458722522967952, "loss": 5.6726, "mean_token_accuracy": 0.15096358209848404, "num_tokens": 5066323.0, "step": 2850 }, { "entropy": 5.874738025665283, "epoch": 0.1468508088367667, "grad_norm": 1.03125, "learning_rate": 0.00019348804249147723, "loss": 5.7234, "mean_token_accuracy": 0.14299118369817734, "num_tokens": 5075260.0, "step": 2855 }, { "entropy": 5.849239873886108, "epoch": 0.1471079906385824, "grad_norm": 1.1484375, "learning_rate": 0.0001923910944447655, "loss": 5.6979, "mean_token_accuracy": 0.14599353969097137, "num_tokens": 5084328.0, "step": 2860 }, { "entropy": 5.9075206279754635, "epoch": 0.14736517244039812, "grad_norm": 1.1796875, "learning_rate": 0.00019129641116292928, "loss": 5.6463, "mean_token_accuracy": 0.14645669609308243, "num_tokens": 5093069.0, "step": 2865 }, { "entropy": 5.867852687835693, "epoch": 0.14762235424221382, "grad_norm": 1.0234375, "learning_rate": 0.00019020402265726343, "loss": 5.6485, "mean_token_accuracy": 0.1528791606426239, "num_tokens": 5102364.0, "step": 2870 }, { "entropy": 5.869380331039428, "epoch": 0.14787953604402954, "grad_norm": 1.046875, "learning_rate": 0.0001891139588761509, "loss": 5.6715, "mean_token_accuracy": 0.14551375508308412, "num_tokens": 5111594.0, "step": 2875 }, { "entropy": 5.900653219223022, "epoch": 0.14813671784584523, "grad_norm": 1.109375, "learning_rate": 0.00018802624970424076, "loss": 5.6857, "mean_token_accuracy": 0.15399120897054672, "num_tokens": 5120266.0, "step": 2880 }, { "entropy": 5.844643306732178, "epoch": 0.14839389964766092, "grad_norm": 1.171875, "learning_rate": 0.00018694092496162945, "loss": 5.6084, "mean_token_accuracy": 0.1535620719194412, "num_tokens": 5128866.0, "step": 2885 }, { "entropy": 5.882418870925903, "epoch": 0.14865108144947664, "grad_norm": 1.09375, "learning_rate": 0.00018585801440304306, "loss": 5.6843, "mean_token_accuracy": 0.15050104409456252, "num_tokens": 5138447.0, "step": 2890 }, { "entropy": 5.868085289001465, "epoch": 0.14890826325129233, "grad_norm": 1.1953125, "learning_rate": 0.00018477754771702165, "loss": 5.6836, "mean_token_accuracy": 0.14722221344709396, "num_tokens": 5146959.0, "step": 2895 }, { "entropy": 5.857029676437378, "epoch": 0.14916544505310805, "grad_norm": 1.0234375, "learning_rate": 0.00018369955452510506, "loss": 5.6488, "mean_token_accuracy": 0.150224170088768, "num_tokens": 5156436.0, "step": 2900 }, { "entropy": 5.9019042491912845, "epoch": 0.14942262685492375, "grad_norm": 1.15625, "learning_rate": 0.0001826240643810212, "loss": 5.6536, "mean_token_accuracy": 0.15107073485851288, "num_tokens": 5165017.0, "step": 2905 }, { "entropy": 5.85205864906311, "epoch": 0.14967980865673944, "grad_norm": 1.109375, "learning_rate": 0.0001815511067698758, "loss": 5.5853, "mean_token_accuracy": 0.16217051148414613, "num_tokens": 5174002.0, "step": 2910 }, { "entropy": 5.840191125869751, "epoch": 0.14993699045855516, "grad_norm": 1.0390625, "learning_rate": 0.0001804807111073436, "loss": 5.6849, "mean_token_accuracy": 0.14772054851055144, "num_tokens": 5183969.0, "step": 2915 }, { "entropy": 5.947837972640992, "epoch": 0.15019417226037085, "grad_norm": 1.0703125, "learning_rate": 0.0001794129067388625, "loss": 5.7407, "mean_token_accuracy": 0.14477377384901047, "num_tokens": 5193009.0, "step": 2920 }, { "entropy": 5.91709337234497, "epoch": 0.15045135406218657, "grad_norm": 1.140625, "learning_rate": 0.00017834772293882868, "loss": 5.7202, "mean_token_accuracy": 0.14974097311496734, "num_tokens": 5201666.0, "step": 2925 }, { "entropy": 5.758265352249145, "epoch": 0.15070853586400226, "grad_norm": 1.1328125, "learning_rate": 0.000177285188909794, "loss": 5.4679, "mean_token_accuracy": 0.16278080493211747, "num_tokens": 5210202.0, "step": 2930 }, { "entropy": 5.800893688201905, "epoch": 0.15096571766581796, "grad_norm": 1.15625, "learning_rate": 0.0001762253337816656, "loss": 5.637, "mean_token_accuracy": 0.15741105228662491, "num_tokens": 5218911.0, "step": 2935 }, { "entropy": 5.854615879058838, "epoch": 0.15122289946763368, "grad_norm": 1.0703125, "learning_rate": 0.00017516818661090738, "loss": 5.6489, "mean_token_accuracy": 0.15447764992713928, "num_tokens": 5227943.0, "step": 2940 }, { "entropy": 5.961043357849121, "epoch": 0.15148008126944937, "grad_norm": 1.15625, "learning_rate": 0.0001741137763797428, "loss": 5.7363, "mean_token_accuracy": 0.14479249864816665, "num_tokens": 5237624.0, "step": 2945 }, { "entropy": 5.919877624511718, "epoch": 0.1517372630712651, "grad_norm": 1.125, "learning_rate": 0.00017306213199536115, "loss": 5.7558, "mean_token_accuracy": 0.14476376995444298, "num_tokens": 5247031.0, "step": 2950 }, { "entropy": 5.84567928314209, "epoch": 0.15199444487308078, "grad_norm": 1.15625, "learning_rate": 0.0001720132822891243, "loss": 5.6031, "mean_token_accuracy": 0.1566247284412384, "num_tokens": 5256263.0, "step": 2955 }, { "entropy": 5.859348344802856, "epoch": 0.15225162667489647, "grad_norm": 1.1171875, "learning_rate": 0.0001709672560157769, "loss": 5.7168, "mean_token_accuracy": 0.1484427310526371, "num_tokens": 5266216.0, "step": 2960 }, { "entropy": 5.968145370483398, "epoch": 0.1525088084767122, "grad_norm": 1.1796875, "learning_rate": 0.00016992408185265758, "loss": 5.7021, "mean_token_accuracy": 0.15091535225510597, "num_tokens": 5274598.0, "step": 2965 }, { "entropy": 5.963071680068969, "epoch": 0.15276599027852789, "grad_norm": 1.0546875, "learning_rate": 0.00016888378839891298, "loss": 5.8042, "mean_token_accuracy": 0.14827325642108918, "num_tokens": 5283456.0, "step": 2970 }, { "entropy": 5.920269632339478, "epoch": 0.1530231720803436, "grad_norm": 1.046875, "learning_rate": 0.0001678464041747137, "loss": 5.7123, "mean_token_accuracy": 0.14628702104091645, "num_tokens": 5292423.0, "step": 2975 }, { "entropy": 5.90811595916748, "epoch": 0.1532803538821593, "grad_norm": 1.1640625, "learning_rate": 0.00016681195762047223, "loss": 5.6593, "mean_token_accuracy": 0.15627681463956833, "num_tokens": 5301169.0, "step": 2980 }, { "entropy": 5.960396146774292, "epoch": 0.153537535683975, "grad_norm": 1.171875, "learning_rate": 0.00016578047709606337, "loss": 5.7784, "mean_token_accuracy": 0.14361969381570816, "num_tokens": 5310675.0, "step": 2985 }, { "entropy": 5.904791069030762, "epoch": 0.1537947174857907, "grad_norm": 1.1484375, "learning_rate": 0.00016475199088004678, "loss": 5.6729, "mean_token_accuracy": 0.15331293269991875, "num_tokens": 5319419.0, "step": 2990 }, { "entropy": 5.814844703674316, "epoch": 0.1540518992876064, "grad_norm": 1.0625, "learning_rate": 0.00016372652716889163, "loss": 5.6102, "mean_token_accuracy": 0.1528927803039551, "num_tokens": 5328109.0, "step": 2995 }, { "entropy": 5.868056392669677, "epoch": 0.15430908108942212, "grad_norm": 1.265625, "learning_rate": 0.0001627041140762035, "loss": 5.7415, "mean_token_accuracy": 0.14752336889505385, "num_tokens": 5336600.0, "step": 3000 }, { "entropy": 5.869272661209107, "epoch": 0.15456626289123782, "grad_norm": 1.109375, "learning_rate": 0.00016168477963195382, "loss": 5.6449, "mean_token_accuracy": 0.1595918707549572, "num_tokens": 5345297.0, "step": 3005 }, { "entropy": 5.887246322631836, "epoch": 0.1548234446930535, "grad_norm": 1.046875, "learning_rate": 0.0001606685517817114, "loss": 5.6165, "mean_token_accuracy": 0.15166592299938203, "num_tokens": 5353770.0, "step": 3010 }, { "entropy": 5.8231791973114015, "epoch": 0.15508062649486923, "grad_norm": 1.140625, "learning_rate": 0.00015965545838587592, "loss": 5.6478, "mean_token_accuracy": 0.1543812185525894, "num_tokens": 5362195.0, "step": 3015 }, { "entropy": 5.797528409957886, "epoch": 0.15533780829668492, "grad_norm": 1.1328125, "learning_rate": 0.00015864552721891467, "loss": 5.5926, "mean_token_accuracy": 0.15777522772550584, "num_tokens": 5370881.0, "step": 3020 }, { "entropy": 5.8520911693572994, "epoch": 0.15559499009850064, "grad_norm": 1.1171875, "learning_rate": 0.00015763878596860076, "loss": 5.624, "mean_token_accuracy": 0.15304535925388335, "num_tokens": 5379932.0, "step": 3025 }, { "entropy": 5.889757585525513, "epoch": 0.15585217190031633, "grad_norm": 1.078125, "learning_rate": 0.00015663526223525412, "loss": 5.7209, "mean_token_accuracy": 0.1467019125819206, "num_tokens": 5389306.0, "step": 3030 }, { "entropy": 5.850079345703125, "epoch": 0.15610935370213203, "grad_norm": 1.0390625, "learning_rate": 0.0001556349835309848, "loss": 5.6122, "mean_token_accuracy": 0.15075162947177886, "num_tokens": 5398954.0, "step": 3035 }, { "entropy": 5.894767093658447, "epoch": 0.15636653550394775, "grad_norm": 1.1171875, "learning_rate": 0.0001546379772789389, "loss": 5.7657, "mean_token_accuracy": 0.15032526701688767, "num_tokens": 5408337.0, "step": 3040 }, { "entropy": 5.8905736923217775, "epoch": 0.15662371730576344, "grad_norm": 1.09375, "learning_rate": 0.00015364427081254622, "loss": 5.6242, "mean_token_accuracy": 0.15853206664323807, "num_tokens": 5417197.0, "step": 3045 }, { "entropy": 5.854434061050415, "epoch": 0.15688089910757916, "grad_norm": 1.09375, "learning_rate": 0.00015265389137477165, "loss": 5.6282, "mean_token_accuracy": 0.1569242537021637, "num_tokens": 5426617.0, "step": 3050 }, { "entropy": 5.829791641235351, "epoch": 0.15713808090939485, "grad_norm": 1.1171875, "learning_rate": 0.00015166686611736786, "loss": 5.5579, "mean_token_accuracy": 0.16443739980459213, "num_tokens": 5435120.0, "step": 3055 }, { "entropy": 5.94751009941101, "epoch": 0.15739526271121054, "grad_norm": 1.1484375, "learning_rate": 0.00015068322210013064, "loss": 5.6793, "mean_token_accuracy": 0.14547759518027306, "num_tokens": 5443594.0, "step": 3060 }, { "entropy": 5.872846698760986, "epoch": 0.15765244451302626, "grad_norm": 1.140625, "learning_rate": 0.0001497029862901578, "loss": 5.6976, "mean_token_accuracy": 0.15286043286323547, "num_tokens": 5451812.0, "step": 3065 }, { "entropy": 5.926684713363647, "epoch": 0.15790962631484196, "grad_norm": 1.0546875, "learning_rate": 0.00014872618556110905, "loss": 5.7572, "mean_token_accuracy": 0.14206624329090117, "num_tokens": 5460476.0, "step": 3070 }, { "entropy": 5.931269025802612, "epoch": 0.15816680811665768, "grad_norm": 1.1484375, "learning_rate": 0.00014775284669246992, "loss": 5.6817, "mean_token_accuracy": 0.15364545583724976, "num_tokens": 5468849.0, "step": 3075 }, { "entropy": 5.855931663513184, "epoch": 0.15842398991847337, "grad_norm": 1.140625, "learning_rate": 0.00014678299636881716, "loss": 5.6261, "mean_token_accuracy": 0.1608524963259697, "num_tokens": 5477081.0, "step": 3080 }, { "entropy": 5.86461992263794, "epoch": 0.15868117172028906, "grad_norm": 1.03125, "learning_rate": 0.0001458166611790873, "loss": 5.6902, "mean_token_accuracy": 0.1473114401102066, "num_tokens": 5486816.0, "step": 3085 }, { "entropy": 5.8415953636169435, "epoch": 0.15893835352210478, "grad_norm": 1.078125, "learning_rate": 0.00014485386761584773, "loss": 5.5607, "mean_token_accuracy": 0.1571323826909065, "num_tokens": 5495632.0, "step": 3090 }, { "entropy": 5.886722803115845, "epoch": 0.15919553532392047, "grad_norm": 1.171875, "learning_rate": 0.00014389464207457042, "loss": 5.6117, "mean_token_accuracy": 0.15660452991724014, "num_tokens": 5503659.0, "step": 3095 }, { "entropy": 5.870863771438598, "epoch": 0.1594527171257362, "grad_norm": 1.0859375, "learning_rate": 0.00014293901085290795, "loss": 5.6972, "mean_token_accuracy": 0.1557433471083641, "num_tokens": 5512551.0, "step": 3100 }, { "entropy": 5.903251266479492, "epoch": 0.15970989892755189, "grad_norm": 1.21875, "learning_rate": 0.00014198700014997307, "loss": 5.8239, "mean_token_accuracy": 0.14162530824542047, "num_tokens": 5522599.0, "step": 3105 }, { "entropy": 5.892457675933838, "epoch": 0.15996708072936758, "grad_norm": 1.1328125, "learning_rate": 0.00014103863606562016, "loss": 5.657, "mean_token_accuracy": 0.15857381969690323, "num_tokens": 5531010.0, "step": 3110 }, { "entropy": 6.002671098709106, "epoch": 0.1602242625311833, "grad_norm": 1.109375, "learning_rate": 0.00014009394459972964, "loss": 5.8061, "mean_token_accuracy": 0.14713286757469177, "num_tokens": 5539742.0, "step": 3115 }, { "entropy": 5.979238080978393, "epoch": 0.160481444332999, "grad_norm": 1.1328125, "learning_rate": 0.00013915295165149513, "loss": 5.661, "mean_token_accuracy": 0.15637649595737457, "num_tokens": 5548151.0, "step": 3120 }, { "entropy": 5.901192903518677, "epoch": 0.1607386261348147, "grad_norm": 1.140625, "learning_rate": 0.00013821568301871384, "loss": 5.7147, "mean_token_accuracy": 0.14485700130462648, "num_tokens": 5556730.0, "step": 3125 }, { "entropy": 5.840697860717773, "epoch": 0.1609958079366304, "grad_norm": 1.0703125, "learning_rate": 0.00013728216439707862, "loss": 5.5561, "mean_token_accuracy": 0.16001487225294114, "num_tokens": 5565394.0, "step": 3130 }, { "entropy": 5.9222324848175045, "epoch": 0.1612529897384461, "grad_norm": 1.109375, "learning_rate": 0.00013635242137947419, "loss": 5.7061, "mean_token_accuracy": 0.15493210405111313, "num_tokens": 5574412.0, "step": 3135 }, { "entropy": 5.898713111877441, "epoch": 0.16151017154026182, "grad_norm": 1.1484375, "learning_rate": 0.00013542647945527498, "loss": 5.5912, "mean_token_accuracy": 0.15648852586746215, "num_tokens": 5583162.0, "step": 3140 }, { "entropy": 5.832360887527466, "epoch": 0.1617673533420775, "grad_norm": 1.03125, "learning_rate": 0.0001345043640096465, "loss": 5.6531, "mean_token_accuracy": 0.15861258506774903, "num_tokens": 5592416.0, "step": 3145 }, { "entropy": 5.842728853225708, "epoch": 0.16202453514389323, "grad_norm": 1.109375, "learning_rate": 0.00013358610032284957, "loss": 5.6627, "mean_token_accuracy": 0.1591075912117958, "num_tokens": 5601513.0, "step": 3150 }, { "entropy": 5.815179967880249, "epoch": 0.16228171694570892, "grad_norm": 1.171875, "learning_rate": 0.000132671713569547, "loss": 5.564, "mean_token_accuracy": 0.15632705837488176, "num_tokens": 5610142.0, "step": 3155 }, { "entropy": 5.886871719360352, "epoch": 0.1625388987475246, "grad_norm": 1.109375, "learning_rate": 0.0001317612288181136, "loss": 5.6572, "mean_token_accuracy": 0.15508203357458114, "num_tokens": 5618799.0, "step": 3160 }, { "entropy": 5.790243768692017, "epoch": 0.16279608054934033, "grad_norm": 1.0546875, "learning_rate": 0.00013085467102994864, "loss": 5.5527, "mean_token_accuracy": 0.1618959426879883, "num_tokens": 5627387.0, "step": 3165 }, { "entropy": 5.856798505783081, "epoch": 0.16305326235115603, "grad_norm": 1.140625, "learning_rate": 0.00012995206505879198, "loss": 5.6488, "mean_token_accuracy": 0.15180497914552687, "num_tokens": 5636434.0, "step": 3170 }, { "entropy": 5.839874887466431, "epoch": 0.16331044415297175, "grad_norm": 1.109375, "learning_rate": 0.0001290534356500421, "loss": 5.6527, "mean_token_accuracy": 0.1571456253528595, "num_tokens": 5645649.0, "step": 3175 }, { "entropy": 5.920530939102173, "epoch": 0.16356762595478744, "grad_norm": 1.15625, "learning_rate": 0.00012815880744007827, "loss": 5.7334, "mean_token_accuracy": 0.1433591991662979, "num_tokens": 5654436.0, "step": 3180 }, { "entropy": 5.862914419174194, "epoch": 0.16382480775660313, "grad_norm": 1.109375, "learning_rate": 0.00012726820495558483, "loss": 5.6447, "mean_token_accuracy": 0.15773307383060456, "num_tokens": 5662866.0, "step": 3185 }, { "entropy": 5.877509832382202, "epoch": 0.16408198955841885, "grad_norm": 1.0859375, "learning_rate": 0.00012638165261287868, "loss": 5.6363, "mean_token_accuracy": 0.1500219315290451, "num_tokens": 5672088.0, "step": 3190 }, { "entropy": 5.899864864349365, "epoch": 0.16433917136023454, "grad_norm": 1.125, "learning_rate": 0.0001254991747172402, "loss": 5.7645, "mean_token_accuracy": 0.14970659017562865, "num_tokens": 5681147.0, "step": 3195 }, { "entropy": 5.889403867721557, "epoch": 0.16459635316205026, "grad_norm": 1.03125, "learning_rate": 0.00012462079546224662, "loss": 5.6537, "mean_token_accuracy": 0.1522204026579857, "num_tokens": 5690650.0, "step": 3200 }, { "entropy": 5.899818658828735, "epoch": 0.16485353496386596, "grad_norm": 1.3359375, "learning_rate": 0.00012374653892910896, "loss": 5.6169, "mean_token_accuracy": 0.1577785536646843, "num_tokens": 5698925.0, "step": 3205 }, { "entropy": 5.902076196670532, "epoch": 0.16511071676568165, "grad_norm": 1.0859375, "learning_rate": 0.00012287642908601166, "loss": 5.6797, "mean_token_accuracy": 0.15833307504653932, "num_tokens": 5707778.0, "step": 3210 }, { "entropy": 5.87751612663269, "epoch": 0.16536789856749737, "grad_norm": 1.0546875, "learning_rate": 0.00012201048978745569, "loss": 5.6206, "mean_token_accuracy": 0.15206317156553267, "num_tokens": 5716794.0, "step": 3215 }, { "entropy": 5.83094482421875, "epoch": 0.16562508036931306, "grad_norm": 1.1171875, "learning_rate": 0.00012114874477360427, "loss": 5.5928, "mean_token_accuracy": 0.1638439729809761, "num_tokens": 5725150.0, "step": 3220 }, { "entropy": 5.845945835113525, "epoch": 0.16588226217112878, "grad_norm": 1.1484375, "learning_rate": 0.00012029121766963236, "loss": 5.574, "mean_token_accuracy": 0.15535639375448226, "num_tokens": 5733261.0, "step": 3225 }, { "entropy": 5.824334907531738, "epoch": 0.16613944397294447, "grad_norm": 1.0859375, "learning_rate": 0.00011943793198507858, "loss": 5.6552, "mean_token_accuracy": 0.1499141775071621, "num_tokens": 5742118.0, "step": 3230 }, { "entropy": 5.760670375823975, "epoch": 0.16639662577476017, "grad_norm": 1.0625, "learning_rate": 0.00011858891111320104, "loss": 5.4608, "mean_token_accuracy": 0.16681069731712342, "num_tokens": 5750814.0, "step": 3235 }, { "entropy": 5.826913642883301, "epoch": 0.16665380757657589, "grad_norm": 1.046875, "learning_rate": 0.0001177441783303359, "loss": 5.6597, "mean_token_accuracy": 0.15008566305041313, "num_tokens": 5759794.0, "step": 3240 }, { "entropy": 5.870846605300903, "epoch": 0.16691098937839158, "grad_norm": 1.2109375, "learning_rate": 0.00011690375679525896, "loss": 5.6762, "mean_token_accuracy": 0.14791131615638733, "num_tokens": 5768519.0, "step": 3245 }, { "entropy": 5.8364499568939205, "epoch": 0.1671681711802073, "grad_norm": 1.09375, "learning_rate": 0.00011606766954855124, "loss": 5.5322, "mean_token_accuracy": 0.15842335820198059, "num_tokens": 5777896.0, "step": 3250 }, { "entropy": 5.939679765701294, "epoch": 0.167425352982023, "grad_norm": 1.1328125, "learning_rate": 0.00011523593951196702, "loss": 5.7579, "mean_token_accuracy": 0.14403122514486313, "num_tokens": 5787407.0, "step": 3255 }, { "entropy": 5.859194707870484, "epoch": 0.16768253478383868, "grad_norm": 1.15625, "learning_rate": 0.00011440858948780523, "loss": 5.6431, "mean_token_accuracy": 0.15607468485832215, "num_tokens": 5796755.0, "step": 3260 }, { "entropy": 5.8848268508911135, "epoch": 0.1679397165856544, "grad_norm": 1.140625, "learning_rate": 0.00011358564215828484, "loss": 5.6047, "mean_token_accuracy": 0.15192519575357438, "num_tokens": 5805287.0, "step": 3265 }, { "entropy": 5.906562662124633, "epoch": 0.1681968983874701, "grad_norm": 1.0859375, "learning_rate": 0.00011276712008492254, "loss": 5.675, "mean_token_accuracy": 0.1457243949174881, "num_tokens": 5814063.0, "step": 3270 }, { "entropy": 5.881565189361572, "epoch": 0.16845408018928582, "grad_norm": 1.0859375, "learning_rate": 0.00011195304570791451, "loss": 5.6289, "mean_token_accuracy": 0.15594786852598191, "num_tokens": 5822806.0, "step": 3275 }, { "entropy": 5.907270908355713, "epoch": 0.1687112619911015, "grad_norm": 1.1484375, "learning_rate": 0.00011114344134552094, "loss": 5.7399, "mean_token_accuracy": 0.14997021853923798, "num_tokens": 5832063.0, "step": 3280 }, { "entropy": 5.953375959396363, "epoch": 0.1689684437929172, "grad_norm": 1.1171875, "learning_rate": 0.0001103383291934545, "loss": 5.7004, "mean_token_accuracy": 0.15198036134243012, "num_tokens": 5841074.0, "step": 3285 }, { "entropy": 5.969113302230835, "epoch": 0.16922562559473292, "grad_norm": 1.140625, "learning_rate": 0.00010953773132427141, "loss": 5.6453, "mean_token_accuracy": 0.14734388515353203, "num_tokens": 5849684.0, "step": 3290 }, { "entropy": 5.924904155731201, "epoch": 0.1694828073965486, "grad_norm": 1.1640625, "learning_rate": 0.00010874166968676677, "loss": 5.6203, "mean_token_accuracy": 0.15403129756450654, "num_tokens": 5859061.0, "step": 3295 }, { "entropy": 5.871574020385742, "epoch": 0.16973998919836433, "grad_norm": 1.0625, "learning_rate": 0.00010795016610537251, "loss": 5.632, "mean_token_accuracy": 0.1510557383298874, "num_tokens": 5868503.0, "step": 3300 }, { "entropy": 5.867011499404907, "epoch": 0.16999717100018003, "grad_norm": 1.09375, "learning_rate": 0.00010716324227955904, "loss": 5.6134, "mean_token_accuracy": 0.16062485426664352, "num_tokens": 5876423.0, "step": 3305 }, { "entropy": 5.856789302825928, "epoch": 0.17025435280199572, "grad_norm": 1.15625, "learning_rate": 0.0001063809197832406, "loss": 5.5683, "mean_token_accuracy": 0.1588930994272232, "num_tokens": 5886344.0, "step": 3310 }, { "entropy": 5.881897830963135, "epoch": 0.17051153460381144, "grad_norm": 1.125, "learning_rate": 0.00010560322006418368, "loss": 5.6169, "mean_token_accuracy": 0.1640718847513199, "num_tokens": 5895796.0, "step": 3315 }, { "entropy": 5.850374698638916, "epoch": 0.17076871640562713, "grad_norm": 1.1484375, "learning_rate": 0.00010483016444341887, "loss": 5.5439, "mean_token_accuracy": 0.15615021735429763, "num_tokens": 5904468.0, "step": 3320 }, { "entropy": 5.849407625198364, "epoch": 0.17102589820744285, "grad_norm": 1.0546875, "learning_rate": 0.00010406177411465654, "loss": 5.6368, "mean_token_accuracy": 0.15428726151585578, "num_tokens": 5913400.0, "step": 3325 }, { "entropy": 5.88852891921997, "epoch": 0.17128308000925854, "grad_norm": 1.0625, "learning_rate": 0.00010329807014370562, "loss": 5.6754, "mean_token_accuracy": 0.14732003286480905, "num_tokens": 5923090.0, "step": 3330 }, { "entropy": 5.885419511795044, "epoch": 0.17154026181107423, "grad_norm": 1.1640625, "learning_rate": 0.00010253907346789632, "loss": 5.7346, "mean_token_accuracy": 0.15103226751089097, "num_tokens": 5932161.0, "step": 3335 }, { "entropy": 5.883248662948608, "epoch": 0.17179744361288996, "grad_norm": 1.015625, "learning_rate": 0.00010178480489550596, "loss": 5.6232, "mean_token_accuracy": 0.1532620370388031, "num_tokens": 5941648.0, "step": 3340 }, { "entropy": 5.794731855392456, "epoch": 0.17205462541470565, "grad_norm": 1.0625, "learning_rate": 0.00010103528510518836, "loss": 5.5958, "mean_token_accuracy": 0.15565524250268936, "num_tokens": 5950626.0, "step": 3345 }, { "entropy": 5.915850353240967, "epoch": 0.17231180721652137, "grad_norm": 1.1484375, "learning_rate": 0.0001002905346454073, "loss": 5.6745, "mean_token_accuracy": 0.15810006111860275, "num_tokens": 5959121.0, "step": 3350 }, { "entropy": 5.86071810722351, "epoch": 0.17256898901833706, "grad_norm": 1.0625, "learning_rate": 9.955057393387285e-05, "loss": 5.6103, "mean_token_accuracy": 0.15181936770677568, "num_tokens": 5968103.0, "step": 3355 }, { "entropy": 5.904258584976196, "epoch": 0.17282617082015275, "grad_norm": 1.0234375, "learning_rate": 9.88154232569816e-05, "loss": 5.6643, "mean_token_accuracy": 0.15518343448638916, "num_tokens": 5977254.0, "step": 3360 }, { "entropy": 5.899582624435425, "epoch": 0.17308335262196847, "grad_norm": 1.078125, "learning_rate": 9.808510276926075e-05, "loss": 5.6762, "mean_token_accuracy": 0.15250316262245178, "num_tokens": 5986465.0, "step": 3365 }, { "entropy": 5.887260246276855, "epoch": 0.17334053442378416, "grad_norm": 1.0078125, "learning_rate": 9.735963249281549e-05, "loss": 5.6653, "mean_token_accuracy": 0.15385335832834243, "num_tokens": 5995485.0, "step": 3370 }, { "entropy": 5.884924602508545, "epoch": 0.17359771622559989, "grad_norm": 1.09375, "learning_rate": 9.663903231677974e-05, "loss": 5.6764, "mean_token_accuracy": 0.15418671518564225, "num_tokens": 6004841.0, "step": 3375 }, { "entropy": 5.911768388748169, "epoch": 0.17385489802741558, "grad_norm": 1.0859375, "learning_rate": 9.592332199677145e-05, "loss": 5.7133, "mean_token_accuracy": 0.15220142304897308, "num_tokens": 6014085.0, "step": 3380 }, { "entropy": 5.925537586212158, "epoch": 0.17411207982923127, "grad_norm": 1.234375, "learning_rate": 9.521252115435061e-05, "loss": 5.6319, "mean_token_accuracy": 0.157326902449131, "num_tokens": 6022832.0, "step": 3385 }, { "entropy": 5.880453252792359, "epoch": 0.174369261631047, "grad_norm": 1.0859375, "learning_rate": 9.450664927648126e-05, "loss": 5.6333, "mean_token_accuracy": 0.1549530029296875, "num_tokens": 6031691.0, "step": 3390 }, { "entropy": 5.865253829956055, "epoch": 0.17462644343286268, "grad_norm": 1.0703125, "learning_rate": 9.380572571499758e-05, "loss": 5.6492, "mean_token_accuracy": 0.15932365134358406, "num_tokens": 6040152.0, "step": 3395 }, { "entropy": 5.992641925811768, "epoch": 0.1748836252346784, "grad_norm": 1.0859375, "learning_rate": 9.310976968607307e-05, "loss": 5.8133, "mean_token_accuracy": 0.14270031005144118, "num_tokens": 6048442.0, "step": 3400 }, { "entropy": 5.924678897857666, "epoch": 0.1751408070364941, "grad_norm": 1.09375, "learning_rate": 9.241880026969381e-05, "loss": 5.5985, "mean_token_accuracy": 0.16025597006082534, "num_tokens": 6056866.0, "step": 3405 }, { "entropy": 5.947360467910767, "epoch": 0.1753979888383098, "grad_norm": 1.1171875, "learning_rate": 9.173283640913537e-05, "loss": 5.6802, "mean_token_accuracy": 0.15019971132278442, "num_tokens": 6066135.0, "step": 3410 }, { "entropy": 5.87064847946167, "epoch": 0.1756551706401255, "grad_norm": 1.109375, "learning_rate": 9.10518969104436e-05, "loss": 5.5018, "mean_token_accuracy": 0.16035284996032714, "num_tokens": 6074988.0, "step": 3415 }, { "entropy": 5.828763103485107, "epoch": 0.1759123524419412, "grad_norm": 1.1328125, "learning_rate": 9.037600044191868e-05, "loss": 5.5372, "mean_token_accuracy": 0.16439700722694398, "num_tokens": 6083529.0, "step": 3420 }, { "entropy": 5.821255922317505, "epoch": 0.17616953424375692, "grad_norm": 1.0703125, "learning_rate": 8.970516553360383e-05, "loss": 5.6481, "mean_token_accuracy": 0.15584711730480194, "num_tokens": 6092297.0, "step": 3425 }, { "entropy": 5.847524404525757, "epoch": 0.1764267160455726, "grad_norm": 1.1484375, "learning_rate": 8.903941057677692e-05, "loss": 5.6899, "mean_token_accuracy": 0.15124824047088622, "num_tokens": 6101684.0, "step": 3430 }, { "entropy": 5.901174688339234, "epoch": 0.17668389784738833, "grad_norm": 1.1328125, "learning_rate": 8.837875382344635e-05, "loss": 5.6799, "mean_token_accuracy": 0.15357163697481155, "num_tokens": 6110177.0, "step": 3435 }, { "entropy": 5.854598903656006, "epoch": 0.17694107964920402, "grad_norm": 1.1484375, "learning_rate": 8.772321338585076e-05, "loss": 5.6343, "mean_token_accuracy": 0.15378045439720153, "num_tokens": 6119478.0, "step": 3440 }, { "entropy": 5.812266826629639, "epoch": 0.17719826145101972, "grad_norm": 1.0625, "learning_rate": 8.707280723596242e-05, "loss": 5.5068, "mean_token_accuracy": 0.16030199378728865, "num_tokens": 6128139.0, "step": 3445 }, { "entropy": 5.8546020030975345, "epoch": 0.17745544325283544, "grad_norm": 1.0859375, "learning_rate": 8.64275532049944e-05, "loss": 5.5987, "mean_token_accuracy": 0.15252354592084885, "num_tokens": 6137327.0, "step": 3450 }, { "entropy": 5.837123441696167, "epoch": 0.17771262505465113, "grad_norm": 1.0703125, "learning_rate": 8.578746898291198e-05, "loss": 5.625, "mean_token_accuracy": 0.15577959567308425, "num_tokens": 6145897.0, "step": 3455 }, { "entropy": 5.930476522445678, "epoch": 0.17796980685646685, "grad_norm": 1.140625, "learning_rate": 8.515257211794742e-05, "loss": 5.6481, "mean_token_accuracy": 0.1561284691095352, "num_tokens": 6153899.0, "step": 3460 }, { "entropy": 5.863068532943726, "epoch": 0.17822698865828254, "grad_norm": 1.0546875, "learning_rate": 8.452288001611896e-05, "loss": 5.5791, "mean_token_accuracy": 0.15927855372428895, "num_tokens": 6162916.0, "step": 3465 }, { "entropy": 5.935356950759887, "epoch": 0.17848417046009823, "grad_norm": 1.1328125, "learning_rate": 8.389840994075379e-05, "loss": 5.6967, "mean_token_accuracy": 0.15271873027086258, "num_tokens": 6171492.0, "step": 3470 }, { "entropy": 5.934307670593261, "epoch": 0.17874135226191395, "grad_norm": 1.046875, "learning_rate": 8.327917901201435e-05, "loss": 5.7046, "mean_token_accuracy": 0.14614737629890442, "num_tokens": 6181942.0, "step": 3475 }, { "entropy": 5.855259418487549, "epoch": 0.17899853406372965, "grad_norm": 1.1171875, "learning_rate": 8.266520420642931e-05, "loss": 5.6575, "mean_token_accuracy": 0.15523471981287001, "num_tokens": 6190952.0, "step": 3480 }, { "entropy": 5.90379958152771, "epoch": 0.17925571586554537, "grad_norm": 1.09375, "learning_rate": 8.205650235642828e-05, "loss": 5.7315, "mean_token_accuracy": 0.14720751941204072, "num_tokens": 6200832.0, "step": 3485 }, { "entropy": 5.827523422241211, "epoch": 0.17951289766736106, "grad_norm": 1.109375, "learning_rate": 8.145309014987978e-05, "loss": 5.4486, "mean_token_accuracy": 0.16118114292621613, "num_tokens": 6209702.0, "step": 3490 }, { "entropy": 5.872140502929687, "epoch": 0.17977007946917675, "grad_norm": 1.1640625, "learning_rate": 8.085498412963437e-05, "loss": 5.669, "mean_token_accuracy": 0.1495615378022194, "num_tokens": 6219312.0, "step": 3495 }, { "entropy": 5.8615274906158445, "epoch": 0.18002726127099247, "grad_norm": 1.125, "learning_rate": 8.026220069307078e-05, "loss": 5.6061, "mean_token_accuracy": 0.15797984451055527, "num_tokens": 6228008.0, "step": 3500 }, { "entropy": 5.9358758449554445, "epoch": 0.18028444307280816, "grad_norm": 1.1796875, "learning_rate": 7.967475609164621e-05, "loss": 5.6453, "mean_token_accuracy": 0.15778914093971252, "num_tokens": 6237011.0, "step": 3505 }, { "entropy": 5.912967109680176, "epoch": 0.18054162487462388, "grad_norm": 1.125, "learning_rate": 7.909266643045124e-05, "loss": 5.6664, "mean_token_accuracy": 0.150685303658247, "num_tokens": 6245837.0, "step": 3510 }, { "entropy": 5.844119453430176, "epoch": 0.18079880667643958, "grad_norm": 1.0859375, "learning_rate": 7.851594766776802e-05, "loss": 5.5267, "mean_token_accuracy": 0.1632933124899864, "num_tokens": 6254465.0, "step": 3515 }, { "entropy": 5.857978963851929, "epoch": 0.18105598847825527, "grad_norm": 1.078125, "learning_rate": 7.794461561463265e-05, "loss": 5.6187, "mean_token_accuracy": 0.15734986290335656, "num_tokens": 6263360.0, "step": 3520 }, { "entropy": 5.863138437271118, "epoch": 0.181313170280071, "grad_norm": 1.0390625, "learning_rate": 7.7378685934402e-05, "loss": 5.5985, "mean_token_accuracy": 0.1601213976740837, "num_tokens": 6272727.0, "step": 3525 }, { "entropy": 5.8448874950408936, "epoch": 0.18157035208188668, "grad_norm": 1.1015625, "learning_rate": 7.68181741423242e-05, "loss": 5.6074, "mean_token_accuracy": 0.15955239832401275, "num_tokens": 6281640.0, "step": 3530 }, { "entropy": 5.913475847244262, "epoch": 0.1818275338837024, "grad_norm": 1.1875, "learning_rate": 7.626309560511313e-05, "loss": 5.7025, "mean_token_accuracy": 0.15587897300720216, "num_tokens": 6290158.0, "step": 3535 }, { "entropy": 5.940318632125854, "epoch": 0.1820847156855181, "grad_norm": 1.1875, "learning_rate": 7.571346554052724e-05, "loss": 5.6883, "mean_token_accuracy": 0.15181336998939515, "num_tokens": 6298980.0, "step": 3540 }, { "entropy": 5.911771583557129, "epoch": 0.1823418974873338, "grad_norm": 1.0703125, "learning_rate": 7.516929901695249e-05, "loss": 5.6376, "mean_token_accuracy": 0.15540629476308823, "num_tokens": 6307780.0, "step": 3545 }, { "entropy": 5.89569616317749, "epoch": 0.1825990792891495, "grad_norm": 1.0625, "learning_rate": 7.463061095298893e-05, "loss": 5.6472, "mean_token_accuracy": 0.15316866785287858, "num_tokens": 6317539.0, "step": 3550 }, { "entropy": 5.942450284957886, "epoch": 0.1828562610909652, "grad_norm": 1.078125, "learning_rate": 7.409741611704198e-05, "loss": 5.7907, "mean_token_accuracy": 0.14466111361980438, "num_tokens": 6328013.0, "step": 3555 }, { "entropy": 5.880002784729004, "epoch": 0.18311344289278092, "grad_norm": 1.0234375, "learning_rate": 7.35697291269174e-05, "loss": 5.623, "mean_token_accuracy": 0.16061771512031556, "num_tokens": 6337541.0, "step": 3560 }, { "entropy": 5.883013963699341, "epoch": 0.1833706246945966, "grad_norm": 1.140625, "learning_rate": 7.304756444942056e-05, "loss": 5.6397, "mean_token_accuracy": 0.15667588114738465, "num_tokens": 6345758.0, "step": 3565 }, { "entropy": 5.9136899471282955, "epoch": 0.1836278064964123, "grad_norm": 1.171875, "learning_rate": 7.253093639995994e-05, "loss": 5.6387, "mean_token_accuracy": 0.15679613202810289, "num_tokens": 6353275.0, "step": 3570 }, { "entropy": 5.911207675933838, "epoch": 0.18388498829822802, "grad_norm": 1.09375, "learning_rate": 7.20198591421544e-05, "loss": 5.7201, "mean_token_accuracy": 0.14959732741117476, "num_tokens": 6362516.0, "step": 3575 }, { "entropy": 5.847626876831055, "epoch": 0.18414217010004372, "grad_norm": 1.046875, "learning_rate": 7.151434668744517e-05, "loss": 5.5554, "mean_token_accuracy": 0.1605613574385643, "num_tokens": 6371179.0, "step": 3580 }, { "entropy": 5.910429811477661, "epoch": 0.18439935190185944, "grad_norm": 1.0703125, "learning_rate": 7.101441289471153e-05, "loss": 5.6125, "mean_token_accuracy": 0.1495427332818508, "num_tokens": 6380081.0, "step": 3585 }, { "entropy": 5.917023086547852, "epoch": 0.18465653370367513, "grad_norm": 1.1640625, "learning_rate": 7.052007146989098e-05, "loss": 5.7368, "mean_token_accuracy": 0.1555919900536537, "num_tokens": 6389640.0, "step": 3590 }, { "entropy": 5.876201725006103, "epoch": 0.18491371550549082, "grad_norm": 1.203125, "learning_rate": 7.003133596560341e-05, "loss": 5.6367, "mean_token_accuracy": 0.1559156820178032, "num_tokens": 6398647.0, "step": 3595 }, { "entropy": 5.876499795913697, "epoch": 0.18517089730730654, "grad_norm": 1.09375, "learning_rate": 6.954821978077952e-05, "loss": 5.6112, "mean_token_accuracy": 0.15878330767154694, "num_tokens": 6407554.0, "step": 3600 }, { "entropy": 5.909009027481079, "epoch": 0.18542807910912223, "grad_norm": 1.1328125, "learning_rate": 6.907073616029356e-05, "loss": 5.6893, "mean_token_accuracy": 0.15084614753723144, "num_tokens": 6416848.0, "step": 3605 }, { "entropy": 5.899310636520386, "epoch": 0.18568526091093795, "grad_norm": 1.0546875, "learning_rate": 6.85988981946002e-05, "loss": 5.5667, "mean_token_accuracy": 0.1526882529258728, "num_tokens": 6425931.0, "step": 3610 }, { "entropy": 5.92294340133667, "epoch": 0.18594244271275365, "grad_norm": 1.1484375, "learning_rate": 6.813271881937564e-05, "loss": 5.6979, "mean_token_accuracy": 0.14528411254286766, "num_tokens": 6435485.0, "step": 3615 }, { "entropy": 5.938835191726684, "epoch": 0.18619962451456934, "grad_norm": 1.140625, "learning_rate": 6.767221081516286e-05, "loss": 5.6955, "mean_token_accuracy": 0.15306296944618225, "num_tokens": 6443457.0, "step": 3620 }, { "entropy": 5.873721885681152, "epoch": 0.18645680631638506, "grad_norm": 1.0859375, "learning_rate": 6.72173868070215e-05, "loss": 5.5704, "mean_token_accuracy": 0.16240996718406678, "num_tokens": 6452196.0, "step": 3625 }, { "entropy": 5.918269157409668, "epoch": 0.18671398811820075, "grad_norm": 1.0390625, "learning_rate": 6.676825926418149e-05, "loss": 5.6532, "mean_token_accuracy": 0.15816912800073624, "num_tokens": 6460982.0, "step": 3630 }, { "entropy": 5.897787952423096, "epoch": 0.18697116992001647, "grad_norm": 1.1484375, "learning_rate": 6.632484049970122e-05, "loss": 5.7164, "mean_token_accuracy": 0.14875878989696503, "num_tokens": 6469741.0, "step": 3635 }, { "entropy": 5.892880296707153, "epoch": 0.18722835172183216, "grad_norm": 1.15625, "learning_rate": 6.588714267013019e-05, "loss": 5.6163, "mean_token_accuracy": 0.1516095981001854, "num_tokens": 6478791.0, "step": 3640 }, { "entropy": 5.952176809310913, "epoch": 0.18748553352364786, "grad_norm": 1.171875, "learning_rate": 6.545517777517544e-05, "loss": 5.6103, "mean_token_accuracy": 0.15060980021953582, "num_tokens": 6487313.0, "step": 3645 }, { "entropy": 5.949588823318481, "epoch": 0.18774271532546358, "grad_norm": 1.046875, "learning_rate": 6.502895765737281e-05, "loss": 5.6572, "mean_token_accuracy": 0.15402375906705856, "num_tokens": 6496603.0, "step": 3650 }, { "entropy": 5.887831497192383, "epoch": 0.18799989712727927, "grad_norm": 1.1328125, "learning_rate": 6.460849400176212e-05, "loss": 5.609, "mean_token_accuracy": 0.1543832391500473, "num_tokens": 6506059.0, "step": 3655 }, { "entropy": 5.92492642402649, "epoch": 0.188257078929095, "grad_norm": 1.140625, "learning_rate": 6.419379833556694e-05, "loss": 5.6963, "mean_token_accuracy": 0.15481734424829482, "num_tokens": 6514748.0, "step": 3660 }, { "entropy": 5.902113676071167, "epoch": 0.18851426073091068, "grad_norm": 1.0859375, "learning_rate": 6.378488202787835e-05, "loss": 5.5858, "mean_token_accuracy": 0.15750968903303147, "num_tokens": 6524123.0, "step": 3665 }, { "entropy": 5.842326974868774, "epoch": 0.18877144253272637, "grad_norm": 1.03125, "learning_rate": 6.33817562893435e-05, "loss": 5.5645, "mean_token_accuracy": 0.1683884561061859, "num_tokens": 6533153.0, "step": 3670 }, { "entropy": 5.863426399230957, "epoch": 0.1890286243345421, "grad_norm": 1.09375, "learning_rate": 6.29844321718582e-05, "loss": 5.5096, "mean_token_accuracy": 0.1655859664082527, "num_tokens": 6541453.0, "step": 3675 }, { "entropy": 5.910923004150391, "epoch": 0.1892858061363578, "grad_norm": 1.1171875, "learning_rate": 6.259292056826383e-05, "loss": 5.6543, "mean_token_accuracy": 0.1489607997238636, "num_tokens": 6551323.0, "step": 3680 }, { "entropy": 5.812879133224487, "epoch": 0.1895429879381735, "grad_norm": 1.078125, "learning_rate": 6.220723221204873e-05, "loss": 5.5162, "mean_token_accuracy": 0.1607501983642578, "num_tokens": 6559936.0, "step": 3685 }, { "entropy": 5.839028167724609, "epoch": 0.1898001697399892, "grad_norm": 1.078125, "learning_rate": 6.182737767705406e-05, "loss": 5.5353, "mean_token_accuracy": 0.15827237218618392, "num_tokens": 6568244.0, "step": 3690 }, { "entropy": 5.861773920059204, "epoch": 0.1900573515418049, "grad_norm": 1.078125, "learning_rate": 6.145336737718375e-05, "loss": 5.6149, "mean_token_accuracy": 0.15965310037136077, "num_tokens": 6576903.0, "step": 3695 }, { "entropy": 5.826506900787353, "epoch": 0.1903145333436206, "grad_norm": 1.0625, "learning_rate": 6.10852115661191e-05, "loss": 5.5954, "mean_token_accuracy": 0.15391193255782126, "num_tokens": 6586389.0, "step": 3700 }, { "entropy": 5.864851951599121, "epoch": 0.1905717151454363, "grad_norm": 1.0546875, "learning_rate": 6.072292033703766e-05, "loss": 5.5995, "mean_token_accuracy": 0.15944815278053284, "num_tokens": 6595549.0, "step": 3705 }, { "entropy": 5.864871072769165, "epoch": 0.19082889694725202, "grad_norm": 1.1015625, "learning_rate": 6.036650362233648e-05, "loss": 5.6218, "mean_token_accuracy": 0.15747497528791427, "num_tokens": 6604710.0, "step": 3710 }, { "entropy": 5.866188907623291, "epoch": 0.19108607874906772, "grad_norm": 1.203125, "learning_rate": 6.0015971193359824e-05, "loss": 5.591, "mean_token_accuracy": 0.15659548044204713, "num_tokens": 6612967.0, "step": 3715 }, { "entropy": 5.876567316055298, "epoch": 0.1913432605508834, "grad_norm": 1.109375, "learning_rate": 5.9671332660131306e-05, "loss": 5.5476, "mean_token_accuracy": 0.16181946396827698, "num_tokens": 6622057.0, "step": 3720 }, { "entropy": 5.812923192977905, "epoch": 0.19160044235269913, "grad_norm": 1.15625, "learning_rate": 5.933259747109042e-05, "loss": 5.5447, "mean_token_accuracy": 0.16375044137239456, "num_tokens": 6630701.0, "step": 3725 }, { "entropy": 5.899358463287354, "epoch": 0.19185762415451482, "grad_norm": 1.09375, "learning_rate": 5.899977491283351e-05, "loss": 5.6605, "mean_token_accuracy": 0.15130955576896668, "num_tokens": 6639536.0, "step": 3730 }, { "entropy": 5.924546813964843, "epoch": 0.19211480595633054, "grad_norm": 1.1640625, "learning_rate": 5.867287410985908e-05, "loss": 5.642, "mean_token_accuracy": 0.15382035151124002, "num_tokens": 6648266.0, "step": 3735 }, { "entropy": 5.850975131988525, "epoch": 0.19237198775814623, "grad_norm": 1.0625, "learning_rate": 5.835190402431779e-05, "loss": 5.5834, "mean_token_accuracy": 0.16023385226726533, "num_tokens": 6657704.0, "step": 3740 }, { "entropy": 5.818389940261841, "epoch": 0.19262916955996193, "grad_norm": 1.0625, "learning_rate": 5.803687345576673e-05, "loss": 5.6288, "mean_token_accuracy": 0.15677088350057602, "num_tokens": 6667047.0, "step": 3745 }, { "entropy": 5.862898635864258, "epoch": 0.19288635136177765, "grad_norm": 1.0, "learning_rate": 5.7727791040927977e-05, "loss": 5.5592, "mean_token_accuracy": 0.15913965553045273, "num_tokens": 6676353.0, "step": 3750 }, { "entropy": 5.8559839725494385, "epoch": 0.19314353316359334, "grad_norm": 1.1640625, "learning_rate": 5.742466525345213e-05, "loss": 5.5243, "mean_token_accuracy": 0.15789021104574202, "num_tokens": 6685113.0, "step": 3755 }, { "entropy": 5.841871213912964, "epoch": 0.19340071496540906, "grad_norm": 1.0703125, "learning_rate": 5.7127504403685775e-05, "loss": 5.5881, "mean_token_accuracy": 0.15547602102160454, "num_tokens": 6694195.0, "step": 3760 }, { "entropy": 5.887722539901733, "epoch": 0.19365789676722475, "grad_norm": 1.1328125, "learning_rate": 5.6836316638443664e-05, "loss": 5.5506, "mean_token_accuracy": 0.15415856689214708, "num_tokens": 6702829.0, "step": 3765 }, { "entropy": 5.85461540222168, "epoch": 0.19391507856904044, "grad_norm": 1.1328125, "learning_rate": 5.655110994078553e-05, "loss": 5.5528, "mean_token_accuracy": 0.1528605505824089, "num_tokens": 6711338.0, "step": 3770 }, { "entropy": 5.819373703002929, "epoch": 0.19417226037085616, "grad_norm": 1.0625, "learning_rate": 5.6271892129797056e-05, "loss": 5.574, "mean_token_accuracy": 0.15351633578538895, "num_tokens": 6720841.0, "step": 3775 }, { "entropy": 5.869690227508545, "epoch": 0.19442944217267186, "grad_norm": 1.078125, "learning_rate": 5.599867086037556e-05, "loss": 5.6284, "mean_token_accuracy": 0.15587239861488342, "num_tokens": 6730007.0, "step": 3780 }, { "entropy": 5.893501091003418, "epoch": 0.19468662397448758, "grad_norm": 1.1484375, "learning_rate": 5.573145362302012e-05, "loss": 5.6513, "mean_token_accuracy": 0.1532319262623787, "num_tokens": 6739350.0, "step": 3785 }, { "entropy": 5.815105009078979, "epoch": 0.19494380577630327, "grad_norm": 1.0234375, "learning_rate": 5.5470247743626404e-05, "loss": 5.5431, "mean_token_accuracy": 0.15413443446159364, "num_tokens": 6749040.0, "step": 3790 }, { "entropy": 5.809462928771973, "epoch": 0.19520098757811896, "grad_norm": 1.109375, "learning_rate": 5.5215060383285414e-05, "loss": 5.5394, "mean_token_accuracy": 0.16511000841856002, "num_tokens": 6757991.0, "step": 3795 }, { "entropy": 5.856151676177978, "epoch": 0.19545816937993468, "grad_norm": 1.15625, "learning_rate": 5.496589853808759e-05, "loss": 5.5547, "mean_token_accuracy": 0.16008042842149733, "num_tokens": 6766629.0, "step": 3800 }, { "entropy": 5.87813024520874, "epoch": 0.19571535118175037, "grad_norm": 1.1171875, "learning_rate": 5.47227690389308e-05, "loss": 5.6674, "mean_token_accuracy": 0.15341010838747024, "num_tokens": 6775553.0, "step": 3805 }, { "entropy": 5.8953855514526365, "epoch": 0.1959725329835661, "grad_norm": 1.1640625, "learning_rate": 5.448567855133306e-05, "loss": 5.5919, "mean_token_accuracy": 0.15956592708826065, "num_tokens": 6784248.0, "step": 3810 }, { "entropy": 5.927022123336792, "epoch": 0.1962297147853818, "grad_norm": 1.1328125, "learning_rate": 5.425463357524986e-05, "loss": 5.6737, "mean_token_accuracy": 0.15280285179615022, "num_tokens": 6792870.0, "step": 3815 }, { "entropy": 5.905942440032959, "epoch": 0.19648689658719748, "grad_norm": 1.1171875, "learning_rate": 5.402964044489591e-05, "loss": 5.6261, "mean_token_accuracy": 0.15940047055482864, "num_tokens": 6801460.0, "step": 3820 }, { "entropy": 5.904842710494995, "epoch": 0.1967440783890132, "grad_norm": 1.1484375, "learning_rate": 5.381070532857153e-05, "loss": 5.5556, "mean_token_accuracy": 0.16004875153303147, "num_tokens": 6810109.0, "step": 3825 }, { "entropy": 5.927281427383423, "epoch": 0.1970012601908289, "grad_norm": 1.1953125, "learning_rate": 5.359783422849357e-05, "loss": 5.5987, "mean_token_accuracy": 0.15651451498270036, "num_tokens": 6817899.0, "step": 3830 }, { "entropy": 5.879728603363037, "epoch": 0.1972584419926446, "grad_norm": 1.1015625, "learning_rate": 5.3391032980630736e-05, "loss": 5.6504, "mean_token_accuracy": 0.14986023008823396, "num_tokens": 6827725.0, "step": 3835 }, { "entropy": 5.927388525009155, "epoch": 0.1975156237944603, "grad_norm": 1.046875, "learning_rate": 5.31903072545437e-05, "loss": 5.6669, "mean_token_accuracy": 0.14829832911491395, "num_tokens": 6837294.0, "step": 3840 }, { "entropy": 5.920765829086304, "epoch": 0.197772805596276, "grad_norm": 1.2109375, "learning_rate": 5.29956625532297e-05, "loss": 5.7176, "mean_token_accuracy": 0.14972010403871536, "num_tokens": 6846531.0, "step": 3845 }, { "entropy": 5.848005485534668, "epoch": 0.19802998739809172, "grad_norm": 1.15625, "learning_rate": 5.280710421297146e-05, "loss": 5.5599, "mean_token_accuracy": 0.15798366963863372, "num_tokens": 6854923.0, "step": 3850 }, { "entropy": 5.883093547821045, "epoch": 0.1982871691999074, "grad_norm": 1.1015625, "learning_rate": 5.2624637403191165e-05, "loss": 5.6407, "mean_token_accuracy": 0.15350893288850784, "num_tokens": 6863810.0, "step": 3855 }, { "entropy": 5.827156591415405, "epoch": 0.19854435100172313, "grad_norm": 1.125, "learning_rate": 5.2448267126308605e-05, "loss": 5.5694, "mean_token_accuracy": 0.16305486261844634, "num_tokens": 6872345.0, "step": 3860 }, { "entropy": 5.872514629364014, "epoch": 0.19880153280353882, "grad_norm": 1.0625, "learning_rate": 5.2277998217603954e-05, "loss": 5.6153, "mean_token_accuracy": 0.15323711708188056, "num_tokens": 6881020.0, "step": 3865 }, { "entropy": 5.877553081512451, "epoch": 0.19905871460535451, "grad_norm": 1.125, "learning_rate": 5.211383534508541e-05, "loss": 5.5945, "mean_token_accuracy": 0.15466131418943405, "num_tokens": 6889915.0, "step": 3870 }, { "entropy": 5.837961149215698, "epoch": 0.19931589640717023, "grad_norm": 1.09375, "learning_rate": 5.1955783009361044e-05, "loss": 5.5411, "mean_token_accuracy": 0.15427414029836656, "num_tokens": 6898871.0, "step": 3875 }, { "entropy": 5.837835788726807, "epoch": 0.19957307820898593, "grad_norm": 1.1015625, "learning_rate": 5.180384554351543e-05, "loss": 5.5502, "mean_token_accuracy": 0.15534113198518754, "num_tokens": 6907737.0, "step": 3880 }, { "entropy": 5.925036525726318, "epoch": 0.19983026001080165, "grad_norm": 1.1484375, "learning_rate": 5.1658027112990976e-05, "loss": 5.6372, "mean_token_accuracy": 0.1596055209636688, "num_tokens": 6916500.0, "step": 3885 }, { "entropy": 5.850003719329834, "epoch": 0.20008744181261734, "grad_norm": 1.0546875, "learning_rate": 5.151833171547365e-05, "loss": 5.5339, "mean_token_accuracy": 0.16462525874376296, "num_tokens": 6925808.0, "step": 3890 }, { "entropy": 5.863328504562378, "epoch": 0.20034462361443303, "grad_norm": 1.1015625, "learning_rate": 5.1384763180783274e-05, "loss": 5.6885, "mean_token_accuracy": 0.15279342904686927, "num_tokens": 6935450.0, "step": 3895 }, { "entropy": 5.843756484985351, "epoch": 0.20060180541624875, "grad_norm": 1.015625, "learning_rate": 5.125732517076876e-05, "loss": 5.502, "mean_token_accuracy": 0.15965902656316758, "num_tokens": 6944307.0, "step": 3900 }, { "entropy": 5.83734540939331, "epoch": 0.20085898721806444, "grad_norm": 1.1484375, "learning_rate": 5.113602117920747e-05, "loss": 5.5525, "mean_token_accuracy": 0.16293007954955102, "num_tokens": 6953989.0, "step": 3905 }, { "entropy": 5.90554256439209, "epoch": 0.20111616901988016, "grad_norm": 1.1171875, "learning_rate": 5.102085453170966e-05, "loss": 5.5726, "mean_token_accuracy": 0.1565084531903267, "num_tokens": 6962363.0, "step": 3910 }, { "entropy": 5.888327741622925, "epoch": 0.20137335082169586, "grad_norm": 1.1171875, "learning_rate": 5.091182838562709e-05, "loss": 5.6103, "mean_token_accuracy": 0.1526792086660862, "num_tokens": 6971918.0, "step": 3915 }, { "entropy": 5.880599689483643, "epoch": 0.20163053262351155, "grad_norm": 1.2578125, "learning_rate": 5.0808945729966716e-05, "loss": 5.5551, "mean_token_accuracy": 0.16584852188825608, "num_tokens": 6980127.0, "step": 3920 }, { "entropy": 5.85777325630188, "epoch": 0.20188771442532727, "grad_norm": 1.03125, "learning_rate": 5.071220938530844e-05, "loss": 5.6884, "mean_token_accuracy": 0.15929610580205916, "num_tokens": 6989390.0, "step": 3925 }, { "entropy": 5.876729154586792, "epoch": 0.20214489622714296, "grad_norm": 1.125, "learning_rate": 5.0621622003728026e-05, "loss": 5.5517, "mean_token_accuracy": 0.15863999873399734, "num_tokens": 6997963.0, "step": 3930 }, { "entropy": 5.869045639038086, "epoch": 0.20240207802895868, "grad_norm": 1.125, "learning_rate": 5.053718606872433e-05, "loss": 5.5872, "mean_token_accuracy": 0.15996584296226501, "num_tokens": 7005902.0, "step": 3935 }, { "entropy": 5.880479240417481, "epoch": 0.20265925983077437, "grad_norm": 1.203125, "learning_rate": 5.0458903895151134e-05, "loss": 5.6064, "mean_token_accuracy": 0.15842192471027375, "num_tokens": 7014529.0, "step": 3940 }, { "entropy": 5.768365573883057, "epoch": 0.20291644163259007, "grad_norm": 1.046875, "learning_rate": 5.038677762915381e-05, "loss": 5.4439, "mean_token_accuracy": 0.16875476986169816, "num_tokens": 7022887.0, "step": 3945 }, { "entropy": 5.823390150070191, "epoch": 0.2031736234344058, "grad_norm": 1.1953125, "learning_rate": 5.032080924811033e-05, "loss": 5.5749, "mean_token_accuracy": 0.15409233719110488, "num_tokens": 7031402.0, "step": 3950 }, { "entropy": 5.782616472244262, "epoch": 0.20343080523622148, "grad_norm": 1.1328125, "learning_rate": 5.026100056057718e-05, "loss": 5.5849, "mean_token_accuracy": 0.15849823355674744, "num_tokens": 7040618.0, "step": 3955 }, { "entropy": 5.799274349212647, "epoch": 0.2036879870380372, "grad_norm": 1.0234375, "learning_rate": 5.0207353206239764e-05, "loss": 5.5576, "mean_token_accuracy": 0.1568225011229515, "num_tokens": 7049702.0, "step": 3960 }, { "entropy": 5.8384599685668945, "epoch": 0.2039451688398529, "grad_norm": 1.2109375, "learning_rate": 5.0159868655867436e-05, "loss": 5.5754, "mean_token_accuracy": 0.16117112189531327, "num_tokens": 7059802.0, "step": 3965 }, { "entropy": 5.8651354789733885, "epoch": 0.20420235064166858, "grad_norm": 1.0859375, "learning_rate": 5.011854821127305e-05, "loss": 5.5276, "mean_token_accuracy": 0.15586300045251847, "num_tokens": 7067901.0, "step": 3970 }, { "entropy": 5.889055442810059, "epoch": 0.2044595324434843, "grad_norm": 1.1328125, "learning_rate": 5.008339300527755e-05, "loss": 5.6651, "mean_token_accuracy": 0.15464388728141784, "num_tokens": 7077010.0, "step": 3975 }, { "entropy": 5.890618515014649, "epoch": 0.2047167142453, "grad_norm": 1.0859375, "learning_rate": 5.005440400167859e-05, "loss": 5.6055, "mean_token_accuracy": 0.15562336444854735, "num_tokens": 7085641.0, "step": 3980 }, { "entropy": 5.81805419921875, "epoch": 0.20497389604711572, "grad_norm": 1.1015625, "learning_rate": 5.003158199522442e-05, "loss": 5.4993, "mean_token_accuracy": 0.16492468416690825, "num_tokens": 7094231.0, "step": 3985 }, { "entropy": 5.824144887924194, "epoch": 0.2052310778489314, "grad_norm": 1.0234375, "learning_rate": 5.0014927611591806e-05, "loss": 5.5287, "mean_token_accuracy": 0.15576547756791115, "num_tokens": 7103183.0, "step": 3990 }, { "entropy": 5.874920177459717, "epoch": 0.2054882596507471, "grad_norm": 1.1875, "learning_rate": 5.000444130736916e-05, "loss": 5.6636, "mean_token_accuracy": 0.14989672750234603, "num_tokens": 7112206.0, "step": 3995 }, { "entropy": 5.904845905303955, "epoch": 0.20574544145256282, "grad_norm": 1.09375, "learning_rate": 5.0000123370043736e-05, "loss": 5.6315, "mean_token_accuracy": 0.14913687556982042, "num_tokens": 7120560.0, "step": 4000 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 9595541606400000.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }