{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.010746563786229353, "eval_steps": 500, "global_step": 1000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.691944599151611, "epoch": 5.3732818931146765e-05, "grad_norm": 15.4375, "learning_rate": 2e-06, "loss": 10.867, "mean_token_accuracy": 0.0, "num_tokens": 12868.0, "step": 5 }, { "entropy": 10.691931915283202, "epoch": 0.00010746563786229353, "grad_norm": 13.1875, "learning_rate": 4.5e-06, "loss": 10.7713, "mean_token_accuracy": 0.0, "num_tokens": 23808.0, "step": 10 }, { "entropy": 10.69122085571289, "epoch": 0.0001611984567934403, "grad_norm": 10.5625, "learning_rate": 7e-06, "loss": 10.4885, "mean_token_accuracy": 0.017395494051743298, "num_tokens": 34239.0, "step": 15 }, { "entropy": 10.684881401062011, "epoch": 0.00021493127572458706, "grad_norm": 6.15625, "learning_rate": 9.5e-06, "loss": 10.1795, "mean_token_accuracy": 0.03431609831750393, "num_tokens": 45311.0, "step": 20 }, { "entropy": 10.651975917816163, "epoch": 0.00026866409465573383, "grad_norm": 4.0625, "learning_rate": 1.2e-05, "loss": 9.8328, "mean_token_accuracy": 0.039574161358177665, "num_tokens": 56105.0, "step": 25 }, { "entropy": 10.609530162811279, "epoch": 0.0003223969135868806, "grad_norm": 3.078125, "learning_rate": 1.4500000000000002e-05, "loss": 9.7804, "mean_token_accuracy": 0.03973569292575121, "num_tokens": 68382.0, "step": 30 }, { "entropy": 10.593698596954345, "epoch": 0.00037612973251802736, "grad_norm": 2.921875, "learning_rate": 1.7000000000000003e-05, "loss": 9.619, "mean_token_accuracy": 0.04424203187227249, "num_tokens": 81209.0, "step": 35 }, { "entropy": 10.5916898727417, "epoch": 0.0004298625514491741, "grad_norm": 2.65625, "learning_rate": 1.95e-05, "loss": 9.5786, "mean_token_accuracy": 0.03825619481503963, "num_tokens": 94148.0, "step": 40 }, { "entropy": 10.594180679321289, "epoch": 0.0004835953703803209, "grad_norm": 2.6875, "learning_rate": 2.2e-05, "loss": 9.526, "mean_token_accuracy": 0.048027387261390685, "num_tokens": 106398.0, "step": 45 }, { "entropy": 10.578767490386962, "epoch": 0.0005373281893114677, "grad_norm": 2.34375, "learning_rate": 2.4500000000000003e-05, "loss": 9.5403, "mean_token_accuracy": 0.04592233560979366, "num_tokens": 118963.0, "step": 50 }, { "entropy": 10.581397247314452, "epoch": 0.0005910610082426144, "grad_norm": 2.53125, "learning_rate": 2.7e-05, "loss": 9.4431, "mean_token_accuracy": 0.045610013604164126, "num_tokens": 129302.0, "step": 55 }, { "entropy": 10.57803840637207, "epoch": 0.0006447938271737612, "grad_norm": 2.515625, "learning_rate": 2.95e-05, "loss": 9.3236, "mean_token_accuracy": 0.05025259889662266, "num_tokens": 139595.0, "step": 60 }, { "entropy": 10.486345100402833, "epoch": 0.000698526646104908, "grad_norm": 2.5, "learning_rate": 3.2e-05, "loss": 9.2169, "mean_token_accuracy": 0.060793956741690636, "num_tokens": 150436.0, "step": 65 }, { "entropy": 10.35349416732788, "epoch": 0.0007522594650360547, "grad_norm": 2.359375, "learning_rate": 3.4500000000000005e-05, "loss": 9.1404, "mean_token_accuracy": 0.06265294775366784, "num_tokens": 161692.0, "step": 70 }, { "entropy": 10.434385204315186, "epoch": 0.0008059922839672015, "grad_norm": 2.296875, "learning_rate": 3.7e-05, "loss": 9.0866, "mean_token_accuracy": 0.06112063825130463, "num_tokens": 173914.0, "step": 75 }, { "entropy": 10.437462615966798, "epoch": 0.0008597251028983482, "grad_norm": 2.171875, "learning_rate": 3.95e-05, "loss": 8.9348, "mean_token_accuracy": 0.06636513993144036, "num_tokens": 185793.0, "step": 80 }, { "entropy": 10.385666561126708, "epoch": 0.000913457921829495, "grad_norm": 2.484375, "learning_rate": 4.2000000000000004e-05, "loss": 8.9272, "mean_token_accuracy": 0.06668606549501419, "num_tokens": 199762.0, "step": 85 }, { "entropy": 10.262327003479005, "epoch": 0.0009671907407606418, "grad_norm": 2.734375, "learning_rate": 4.45e-05, "loss": 8.7491, "mean_token_accuracy": 0.06684565916657448, "num_tokens": 211760.0, "step": 90 }, { "entropy": 10.279810237884522, "epoch": 0.0010209235596917885, "grad_norm": 3.0, "learning_rate": 4.7000000000000004e-05, "loss": 8.6214, "mean_token_accuracy": 0.07119264826178551, "num_tokens": 222654.0, "step": 95 }, { "entropy": 10.154211807250977, "epoch": 0.0010746563786229353, "grad_norm": 2.03125, "learning_rate": 4.9500000000000004e-05, "loss": 8.605, "mean_token_accuracy": 0.07087584175169467, "num_tokens": 234906.0, "step": 100 }, { "entropy": 10.154182243347169, "epoch": 0.001128389197554082, "grad_norm": 1.96875, "learning_rate": 5.2e-05, "loss": 8.4204, "mean_token_accuracy": 0.08174400329589844, "num_tokens": 246419.0, "step": 105 }, { "entropy": 9.984860038757324, "epoch": 0.0011821220164852288, "grad_norm": 1.8828125, "learning_rate": 5.45e-05, "loss": 8.2827, "mean_token_accuracy": 0.08357185944914818, "num_tokens": 257878.0, "step": 110 }, { "entropy": 9.92540111541748, "epoch": 0.0012358548354163756, "grad_norm": 1.8515625, "learning_rate": 5.7e-05, "loss": 8.1352, "mean_token_accuracy": 0.08523289784789086, "num_tokens": 269180.0, "step": 115 }, { "entropy": 9.790580940246581, "epoch": 0.0012895876543475224, "grad_norm": 1.6875, "learning_rate": 5.9499999999999996e-05, "loss": 8.1268, "mean_token_accuracy": 0.0837685689330101, "num_tokens": 281482.0, "step": 120 }, { "entropy": 9.689721870422364, "epoch": 0.0013433204732786691, "grad_norm": 1.71875, "learning_rate": 6.2e-05, "loss": 7.9125, "mean_token_accuracy": 0.08588041439652443, "num_tokens": 292289.0, "step": 125 }, { "entropy": 9.55999813079834, "epoch": 0.001397053292209816, "grad_norm": 1.78125, "learning_rate": 6.450000000000001e-05, "loss": 7.8259, "mean_token_accuracy": 0.08231885209679604, "num_tokens": 303274.0, "step": 130 }, { "entropy": 9.327935886383056, "epoch": 0.0014507861111409627, "grad_norm": 1.625, "learning_rate": 6.7e-05, "loss": 7.6719, "mean_token_accuracy": 0.0838103786110878, "num_tokens": 314933.0, "step": 135 }, { "entropy": 9.111929130554199, "epoch": 0.0015045189300721094, "grad_norm": 1.4296875, "learning_rate": 6.950000000000001e-05, "loss": 7.5777, "mean_token_accuracy": 0.08480807095766067, "num_tokens": 327450.0, "step": 140 }, { "entropy": 8.934065532684325, "epoch": 0.0015582517490032562, "grad_norm": 1.234375, "learning_rate": 7.2e-05, "loss": 7.4816, "mean_token_accuracy": 0.08673194646835328, "num_tokens": 339409.0, "step": 145 }, { "entropy": 8.693235874176025, "epoch": 0.001611984567934403, "grad_norm": 1.1640625, "learning_rate": 7.45e-05, "loss": 7.4587, "mean_token_accuracy": 0.08729644715785981, "num_tokens": 352374.0, "step": 150 }, { "entropy": 8.44670124053955, "epoch": 0.0016657173868655497, "grad_norm": 1.4140625, "learning_rate": 7.7e-05, "loss": 7.3175, "mean_token_accuracy": 0.09196643233299255, "num_tokens": 363653.0, "step": 155 }, { "entropy": 8.291356182098388, "epoch": 0.0017194502057966965, "grad_norm": 1.5625, "learning_rate": 7.950000000000001e-05, "loss": 7.3101, "mean_token_accuracy": 0.08862848281860351, "num_tokens": 374982.0, "step": 160 }, { "entropy": 8.183576679229736, "epoch": 0.0017731830247278433, "grad_norm": 1.28125, "learning_rate": 8.2e-05, "loss": 7.2019, "mean_token_accuracy": 0.08939464986324311, "num_tokens": 387794.0, "step": 165 }, { "entropy": 8.042083930969238, "epoch": 0.00182691584365899, "grad_norm": 1.3671875, "learning_rate": 8.450000000000001e-05, "loss": 7.2703, "mean_token_accuracy": 0.08938254192471504, "num_tokens": 399993.0, "step": 170 }, { "entropy": 7.948488187789917, "epoch": 0.0018806486625901368, "grad_norm": 1.234375, "learning_rate": 8.7e-05, "loss": 7.1802, "mean_token_accuracy": 0.10024765953421592, "num_tokens": 410864.0, "step": 175 }, { "entropy": 7.877219009399414, "epoch": 0.0019343814815212836, "grad_norm": 1.25, "learning_rate": 8.95e-05, "loss": 7.2057, "mean_token_accuracy": 0.09488844051957131, "num_tokens": 422376.0, "step": 180 }, { "entropy": 7.852542734146118, "epoch": 0.0019881143004524303, "grad_norm": 1.2265625, "learning_rate": 9.2e-05, "loss": 7.1815, "mean_token_accuracy": 0.10110960602760315, "num_tokens": 434301.0, "step": 185 }, { "entropy": 7.8157186031341555, "epoch": 0.002041847119383577, "grad_norm": 1.5, "learning_rate": 9.45e-05, "loss": 7.1695, "mean_token_accuracy": 0.09449249878525734, "num_tokens": 446159.0, "step": 190 }, { "entropy": 7.741145420074463, "epoch": 0.002095579938314724, "grad_norm": 1.25, "learning_rate": 9.7e-05, "loss": 7.1823, "mean_token_accuracy": 0.0965780720114708, "num_tokens": 458376.0, "step": 195 }, { "entropy": 7.750446844100952, "epoch": 0.0021493127572458706, "grad_norm": 1.671875, "learning_rate": 9.95e-05, "loss": 7.1192, "mean_token_accuracy": 0.10175004899501801, "num_tokens": 469082.0, "step": 200 }, { "entropy": 7.683127355575562, "epoch": 0.0022030455761770174, "grad_norm": 1.3984375, "learning_rate": 0.000102, "loss": 7.0011, "mean_token_accuracy": 0.10132882818579673, "num_tokens": 480149.0, "step": 205 }, { "entropy": 7.6684812068939205, "epoch": 0.002256778395108164, "grad_norm": 1.3125, "learning_rate": 0.00010449999999999999, "loss": 7.1455, "mean_token_accuracy": 0.0962664932012558, "num_tokens": 493074.0, "step": 210 }, { "entropy": 7.615740251541138, "epoch": 0.002310511214039311, "grad_norm": 1.25, "learning_rate": 0.000107, "loss": 7.0009, "mean_token_accuracy": 0.10513110086321831, "num_tokens": 504647.0, "step": 215 }, { "entropy": 7.548989009857178, "epoch": 0.0023642440329704577, "grad_norm": 1.4375, "learning_rate": 0.0001095, "loss": 7.0833, "mean_token_accuracy": 0.09757705479860306, "num_tokens": 516304.0, "step": 220 }, { "entropy": 7.63504056930542, "epoch": 0.0024179768519016044, "grad_norm": 1.3125, "learning_rate": 0.000112, "loss": 7.0133, "mean_token_accuracy": 0.1059924952685833, "num_tokens": 526467.0, "step": 225 }, { "entropy": 7.553870820999146, "epoch": 0.002471709670832751, "grad_norm": 1.203125, "learning_rate": 0.0001145, "loss": 7.059, "mean_token_accuracy": 0.10098145231604576, "num_tokens": 539109.0, "step": 230 }, { "entropy": 7.517747688293457, "epoch": 0.002525442489763898, "grad_norm": 1.3984375, "learning_rate": 0.00011700000000000001, "loss": 6.9522, "mean_token_accuracy": 0.09978492632508278, "num_tokens": 550142.0, "step": 235 }, { "entropy": 7.522121000289917, "epoch": 0.0025791753086950447, "grad_norm": 1.125, "learning_rate": 0.00011949999999999999, "loss": 7.0176, "mean_token_accuracy": 0.10614465549588203, "num_tokens": 561639.0, "step": 240 }, { "entropy": 7.508337593078613, "epoch": 0.0026329081276261915, "grad_norm": 1.234375, "learning_rate": 0.000122, "loss": 6.9533, "mean_token_accuracy": 0.10177289620041848, "num_tokens": 573849.0, "step": 245 }, { "entropy": 7.48092360496521, "epoch": 0.0026866409465573383, "grad_norm": 1.3671875, "learning_rate": 0.0001245, "loss": 6.9289, "mean_token_accuracy": 0.10615592449903488, "num_tokens": 584572.0, "step": 250 }, { "entropy": 7.391205263137818, "epoch": 0.002740373765488485, "grad_norm": 1.203125, "learning_rate": 0.000127, "loss": 6.9508, "mean_token_accuracy": 0.11110179796814919, "num_tokens": 595314.0, "step": 255 }, { "entropy": 7.482128667831421, "epoch": 0.002794106584419632, "grad_norm": 1.3046875, "learning_rate": 0.0001295, "loss": 7.0476, "mean_token_accuracy": 0.10385493785142899, "num_tokens": 605689.0, "step": 260 }, { "entropy": 7.351570653915405, "epoch": 0.0028478394033507786, "grad_norm": 1.234375, "learning_rate": 0.000132, "loss": 6.8358, "mean_token_accuracy": 0.11294776201248169, "num_tokens": 617057.0, "step": 265 }, { "entropy": 7.4075196266174315, "epoch": 0.0029015722222819253, "grad_norm": 1.4140625, "learning_rate": 0.00013450000000000002, "loss": 6.9324, "mean_token_accuracy": 0.10447231009602546, "num_tokens": 628111.0, "step": 270 }, { "entropy": 7.342596530914307, "epoch": 0.002955305041213072, "grad_norm": 1.375, "learning_rate": 0.00013700000000000002, "loss": 6.8379, "mean_token_accuracy": 0.1141952745616436, "num_tokens": 639254.0, "step": 275 }, { "entropy": 7.35143084526062, "epoch": 0.003009037860144219, "grad_norm": 1.1171875, "learning_rate": 0.0001395, "loss": 6.9304, "mean_token_accuracy": 0.1006052739918232, "num_tokens": 651096.0, "step": 280 }, { "entropy": 7.301223182678223, "epoch": 0.0030627706790753656, "grad_norm": 1.1796875, "learning_rate": 0.00014199999999999998, "loss": 6.9238, "mean_token_accuracy": 0.10944507122039795, "num_tokens": 663132.0, "step": 285 }, { "entropy": 7.29386534690857, "epoch": 0.0031165034980065124, "grad_norm": 1.640625, "learning_rate": 0.0001445, "loss": 6.7711, "mean_token_accuracy": 0.11792795732617378, "num_tokens": 674160.0, "step": 290 }, { "entropy": 7.214638614654541, "epoch": 0.003170236316937659, "grad_norm": 1.578125, "learning_rate": 0.000147, "loss": 6.8337, "mean_token_accuracy": 0.10255614519119263, "num_tokens": 685284.0, "step": 295 }, { "entropy": 7.2078382015228275, "epoch": 0.003223969135868806, "grad_norm": 1.2578125, "learning_rate": 0.0001495, "loss": 6.7865, "mean_token_accuracy": 0.10231738537549973, "num_tokens": 696789.0, "step": 300 }, { "entropy": 7.242858171463013, "epoch": 0.0032777019547999527, "grad_norm": 1.4375, "learning_rate": 0.000152, "loss": 6.8906, "mean_token_accuracy": 0.1063354529440403, "num_tokens": 708083.0, "step": 305 }, { "entropy": 7.285495710372925, "epoch": 0.0033314347737310995, "grad_norm": 1.125, "learning_rate": 0.00015450000000000001, "loss": 6.8254, "mean_token_accuracy": 0.11012862473726273, "num_tokens": 720232.0, "step": 310 }, { "entropy": 7.072454166412354, "epoch": 0.0033851675926622462, "grad_norm": 1.34375, "learning_rate": 0.000157, "loss": 6.7098, "mean_token_accuracy": 0.11381540670990944, "num_tokens": 731264.0, "step": 315 }, { "entropy": 7.268528461456299, "epoch": 0.003438900411593393, "grad_norm": 1.3359375, "learning_rate": 0.0001595, "loss": 6.6929, "mean_token_accuracy": 0.11482961028814316, "num_tokens": 742158.0, "step": 320 }, { "entropy": 7.142989206314087, "epoch": 0.0034926332305245398, "grad_norm": 1.234375, "learning_rate": 0.000162, "loss": 6.776, "mean_token_accuracy": 0.11389129087328911, "num_tokens": 753330.0, "step": 325 }, { "entropy": 7.2236439228057865, "epoch": 0.0035463660494556865, "grad_norm": 1.390625, "learning_rate": 0.00016450000000000001, "loss": 6.7643, "mean_token_accuracy": 0.11012546345591545, "num_tokens": 765052.0, "step": 330 }, { "entropy": 7.140369892120361, "epoch": 0.0036000988683868333, "grad_norm": 1.359375, "learning_rate": 0.00016700000000000002, "loss": 6.7135, "mean_token_accuracy": 0.11338407099246979, "num_tokens": 775120.0, "step": 335 }, { "entropy": 7.167498207092285, "epoch": 0.00365383168731798, "grad_norm": 1.296875, "learning_rate": 0.00016950000000000003, "loss": 6.8179, "mean_token_accuracy": 0.10822930335998535, "num_tokens": 786442.0, "step": 340 }, { "entropy": 7.1545287609100345, "epoch": 0.003707564506249127, "grad_norm": 1.453125, "learning_rate": 0.00017199999999999998, "loss": 6.7217, "mean_token_accuracy": 0.11315969750285149, "num_tokens": 796526.0, "step": 345 }, { "entropy": 7.073437261581421, "epoch": 0.0037612973251802736, "grad_norm": 1.1484375, "learning_rate": 0.00017449999999999999, "loss": 6.7366, "mean_token_accuracy": 0.11096625924110412, "num_tokens": 808296.0, "step": 350 }, { "entropy": 7.14297833442688, "epoch": 0.0038150301441114204, "grad_norm": 1.34375, "learning_rate": 0.000177, "loss": 6.8753, "mean_token_accuracy": 0.10760819539427757, "num_tokens": 820142.0, "step": 355 }, { "entropy": 7.075785732269287, "epoch": 0.003868762963042567, "grad_norm": 1.4296875, "learning_rate": 0.0001795, "loss": 6.6351, "mean_token_accuracy": 0.1149467647075653, "num_tokens": 830656.0, "step": 360 }, { "entropy": 7.124733304977417, "epoch": 0.003922495781973714, "grad_norm": 1.203125, "learning_rate": 0.000182, "loss": 6.8206, "mean_token_accuracy": 0.11161701381206512, "num_tokens": 841948.0, "step": 365 }, { "entropy": 7.07345609664917, "epoch": 0.003976228600904861, "grad_norm": 1.2578125, "learning_rate": 0.0001845, "loss": 6.7821, "mean_token_accuracy": 0.11786900460720062, "num_tokens": 854207.0, "step": 370 }, { "entropy": 7.170615530014038, "epoch": 0.004029961419836007, "grad_norm": 1.1953125, "learning_rate": 0.000187, "loss": 6.8525, "mean_token_accuracy": 0.12062755227088928, "num_tokens": 866747.0, "step": 375 }, { "entropy": 7.042162704467773, "epoch": 0.004083694238767154, "grad_norm": 1.2421875, "learning_rate": 0.0001895, "loss": 6.7051, "mean_token_accuracy": 0.11747116073966027, "num_tokens": 877961.0, "step": 380 }, { "entropy": 7.085628366470337, "epoch": 0.004137427057698301, "grad_norm": 1.28125, "learning_rate": 0.000192, "loss": 6.7507, "mean_token_accuracy": 0.10921004936099052, "num_tokens": 888869.0, "step": 385 }, { "entropy": 7.034130811691284, "epoch": 0.004191159876629448, "grad_norm": 1.203125, "learning_rate": 0.0001945, "loss": 6.7366, "mean_token_accuracy": 0.11664599329233169, "num_tokens": 899408.0, "step": 390 }, { "entropy": 6.982698535919189, "epoch": 0.0042448926955605945, "grad_norm": 1.265625, "learning_rate": 0.00019700000000000002, "loss": 6.6711, "mean_token_accuracy": 0.1158648207783699, "num_tokens": 910457.0, "step": 395 }, { "entropy": 7.062652063369751, "epoch": 0.004298625514491741, "grad_norm": 1.2890625, "learning_rate": 0.00019950000000000002, "loss": 6.7841, "mean_token_accuracy": 0.11403620392084121, "num_tokens": 922772.0, "step": 400 }, { "entropy": 6.986512184143066, "epoch": 0.004352358333422888, "grad_norm": 1.25, "learning_rate": 0.000202, "loss": 6.6783, "mean_token_accuracy": 0.11563151925802231, "num_tokens": 933820.0, "step": 405 }, { "entropy": 7.02769365310669, "epoch": 0.004406091152354035, "grad_norm": 1.2421875, "learning_rate": 0.00020449999999999998, "loss": 6.6902, "mean_token_accuracy": 0.12013663202524186, "num_tokens": 945044.0, "step": 410 }, { "entropy": 6.937658596038818, "epoch": 0.0044598239712851815, "grad_norm": 1.2265625, "learning_rate": 0.000207, "loss": 6.6422, "mean_token_accuracy": 0.11966706290841103, "num_tokens": 956140.0, "step": 415 }, { "entropy": 6.904023456573486, "epoch": 0.004513556790216328, "grad_norm": 1.2734375, "learning_rate": 0.0002095, "loss": 6.5249, "mean_token_accuracy": 0.11787364035844802, "num_tokens": 967386.0, "step": 420 }, { "entropy": 6.979593801498413, "epoch": 0.004567289609147475, "grad_norm": 1.109375, "learning_rate": 0.000212, "loss": 6.7215, "mean_token_accuracy": 0.11483194008469581, "num_tokens": 980381.0, "step": 425 }, { "entropy": 6.9800636768341064, "epoch": 0.004621022428078622, "grad_norm": 1.15625, "learning_rate": 0.0002145, "loss": 6.6044, "mean_token_accuracy": 0.11717872545123101, "num_tokens": 992279.0, "step": 430 }, { "entropy": 6.966359424591064, "epoch": 0.004674755247009769, "grad_norm": 1.390625, "learning_rate": 0.00021700000000000002, "loss": 6.755, "mean_token_accuracy": 0.11651304587721825, "num_tokens": 1005046.0, "step": 435 }, { "entropy": 6.898645305633545, "epoch": 0.004728488065940915, "grad_norm": 1.5, "learning_rate": 0.0002195, "loss": 6.7279, "mean_token_accuracy": 0.11459456831216812, "num_tokens": 1018636.0, "step": 440 }, { "entropy": 6.968531131744385, "epoch": 0.004782220884872062, "grad_norm": 1.1015625, "learning_rate": 0.000222, "loss": 6.6579, "mean_token_accuracy": 0.11964940950274468, "num_tokens": 1030293.0, "step": 445 }, { "entropy": 6.921095752716065, "epoch": 0.004835953703803209, "grad_norm": 1.1796875, "learning_rate": 0.0002245, "loss": 6.6835, "mean_token_accuracy": 0.11620648130774498, "num_tokens": 1041853.0, "step": 450 }, { "entropy": 6.953577375411987, "epoch": 0.004889686522734356, "grad_norm": 1.109375, "learning_rate": 0.00022700000000000002, "loss": 6.7021, "mean_token_accuracy": 0.12079041078686714, "num_tokens": 1052959.0, "step": 455 }, { "entropy": 6.906730604171753, "epoch": 0.004943419341665502, "grad_norm": 1.3046875, "learning_rate": 0.00022950000000000002, "loss": 6.5797, "mean_token_accuracy": 0.1155982829630375, "num_tokens": 1064200.0, "step": 460 }, { "entropy": 6.912591934204102, "epoch": 0.004997152160596649, "grad_norm": 1.4140625, "learning_rate": 0.00023200000000000003, "loss": 6.7112, "mean_token_accuracy": 0.11692484319210053, "num_tokens": 1075643.0, "step": 465 }, { "entropy": 6.884953784942627, "epoch": 0.005050884979527796, "grad_norm": 1.0859375, "learning_rate": 0.00023449999999999998, "loss": 6.6495, "mean_token_accuracy": 0.11548735648393631, "num_tokens": 1086641.0, "step": 470 }, { "entropy": 6.768892002105713, "epoch": 0.005104617798458943, "grad_norm": 1.1796875, "learning_rate": 0.000237, "loss": 6.6014, "mean_token_accuracy": 0.12133783251047134, "num_tokens": 1098862.0, "step": 475 }, { "entropy": 6.882342195510864, "epoch": 0.0051583506173900895, "grad_norm": 1.3203125, "learning_rate": 0.0002395, "loss": 6.5766, "mean_token_accuracy": 0.12126556858420372, "num_tokens": 1110243.0, "step": 480 }, { "entropy": 6.835430574417114, "epoch": 0.005212083436321236, "grad_norm": 1.1484375, "learning_rate": 0.000242, "loss": 6.5728, "mean_token_accuracy": 0.11558629795908928, "num_tokens": 1122573.0, "step": 485 }, { "entropy": 6.88542947769165, "epoch": 0.005265816255252383, "grad_norm": 1.140625, "learning_rate": 0.0002445, "loss": 6.6432, "mean_token_accuracy": 0.12129139229655266, "num_tokens": 1133979.0, "step": 490 }, { "entropy": 6.83654465675354, "epoch": 0.00531954907418353, "grad_norm": 1.1875, "learning_rate": 0.000247, "loss": 6.646, "mean_token_accuracy": 0.11814743131399155, "num_tokens": 1145732.0, "step": 495 }, { "entropy": 6.817767333984375, "epoch": 0.0053732818931146765, "grad_norm": 1.25, "learning_rate": 0.0002495, "loss": 6.5869, "mean_token_accuracy": 0.12479080557823181, "num_tokens": 1156209.0, "step": 500 }, { "entropy": 6.783105134963989, "epoch": 0.005427014712045823, "grad_norm": 1.3125, "learning_rate": 0.000252, "loss": 6.6071, "mean_token_accuracy": 0.1158917598426342, "num_tokens": 1168746.0, "step": 505 }, { "entropy": 6.877445030212402, "epoch": 0.00548074753097697, "grad_norm": 1.4140625, "learning_rate": 0.0002545, "loss": 6.5415, "mean_token_accuracy": 0.11388759389519691, "num_tokens": 1179953.0, "step": 510 }, { "entropy": 6.709407901763916, "epoch": 0.005534480349908117, "grad_norm": 1.21875, "learning_rate": 0.000257, "loss": 6.617, "mean_token_accuracy": 0.12177695706486702, "num_tokens": 1190376.0, "step": 515 }, { "entropy": 6.774854850769043, "epoch": 0.005588213168839264, "grad_norm": 1.109375, "learning_rate": 0.0002595, "loss": 6.5396, "mean_token_accuracy": 0.11766837164759636, "num_tokens": 1203342.0, "step": 520 }, { "entropy": 6.747042798995972, "epoch": 0.00564194598777041, "grad_norm": 1.1015625, "learning_rate": 0.000262, "loss": 6.4918, "mean_token_accuracy": 0.12500829100608826, "num_tokens": 1214788.0, "step": 525 }, { "entropy": 6.805994987487793, "epoch": 0.005695678806701557, "grad_norm": 1.421875, "learning_rate": 0.00026450000000000003, "loss": 6.5081, "mean_token_accuracy": 0.1282237909734249, "num_tokens": 1225573.0, "step": 530 }, { "entropy": 6.804644536972046, "epoch": 0.005749411625632704, "grad_norm": 1.2265625, "learning_rate": 0.00026700000000000004, "loss": 6.5936, "mean_token_accuracy": 0.11719024851918221, "num_tokens": 1236657.0, "step": 535 }, { "entropy": 6.639275121688843, "epoch": 0.005803144444563851, "grad_norm": 1.21875, "learning_rate": 0.00026950000000000005, "loss": 6.4455, "mean_token_accuracy": 0.11846009120345116, "num_tokens": 1248011.0, "step": 540 }, { "entropy": 6.6572366714477536, "epoch": 0.0058568772634949974, "grad_norm": 1.2421875, "learning_rate": 0.00027200000000000005, "loss": 6.3932, "mean_token_accuracy": 0.13050461709499359, "num_tokens": 1258617.0, "step": 545 }, { "entropy": 6.6567902088165285, "epoch": 0.005910610082426144, "grad_norm": 1.2109375, "learning_rate": 0.0002745, "loss": 6.4417, "mean_token_accuracy": 0.12405583187937737, "num_tokens": 1269719.0, "step": 550 }, { "entropy": 6.666623926162719, "epoch": 0.005964342901357291, "grad_norm": 0.9296875, "learning_rate": 0.000277, "loss": 6.4288, "mean_token_accuracy": 0.13184549435973167, "num_tokens": 1282345.0, "step": 555 }, { "entropy": 6.707080411911011, "epoch": 0.006018075720288438, "grad_norm": 1.21875, "learning_rate": 0.0002795, "loss": 6.5392, "mean_token_accuracy": 0.12187965363264083, "num_tokens": 1294488.0, "step": 560 }, { "entropy": 6.804266262054443, "epoch": 0.0060718085392195845, "grad_norm": 1.2421875, "learning_rate": 0.00028199999999999997, "loss": 6.5314, "mean_token_accuracy": 0.1263057641685009, "num_tokens": 1305263.0, "step": 565 }, { "entropy": 6.658360242843628, "epoch": 0.006125541358150731, "grad_norm": 1.171875, "learning_rate": 0.0002845, "loss": 6.6029, "mean_token_accuracy": 0.1247408226132393, "num_tokens": 1316859.0, "step": 570 }, { "entropy": 6.709363222122192, "epoch": 0.006179274177081878, "grad_norm": 1.265625, "learning_rate": 0.000287, "loss": 6.5673, "mean_token_accuracy": 0.12827861905097962, "num_tokens": 1327435.0, "step": 575 }, { "entropy": 6.7831621170043945, "epoch": 0.006233006996013025, "grad_norm": 1.109375, "learning_rate": 0.0002895, "loss": 6.5586, "mean_token_accuracy": 0.12109960541129113, "num_tokens": 1338911.0, "step": 580 }, { "entropy": 6.719960689544678, "epoch": 0.0062867398149441716, "grad_norm": 1.1875, "learning_rate": 0.000292, "loss": 6.5855, "mean_token_accuracy": 0.11691064387559891, "num_tokens": 1350469.0, "step": 585 }, { "entropy": 6.635077476501465, "epoch": 0.006340472633875318, "grad_norm": 1.2578125, "learning_rate": 0.0002945, "loss": 6.4145, "mean_token_accuracy": 0.1246449775993824, "num_tokens": 1361563.0, "step": 590 }, { "entropy": 6.695048713684082, "epoch": 0.006394205452806465, "grad_norm": 1.15625, "learning_rate": 0.000297, "loss": 6.4567, "mean_token_accuracy": 0.13043742775917053, "num_tokens": 1371164.0, "step": 595 }, { "entropy": 6.710860776901245, "epoch": 0.006447938271737612, "grad_norm": 1.203125, "learning_rate": 0.0002995, "loss": 6.6258, "mean_token_accuracy": 0.12364646792411804, "num_tokens": 1383812.0, "step": 600 }, { "entropy": 6.557053899765014, "epoch": 0.006501671090668759, "grad_norm": 1.1796875, "learning_rate": 0.000302, "loss": 6.4506, "mean_token_accuracy": 0.1240703359246254, "num_tokens": 1395949.0, "step": 605 }, { "entropy": 6.697274923324585, "epoch": 0.006555403909599905, "grad_norm": 1.1796875, "learning_rate": 0.0003045, "loss": 6.5407, "mean_token_accuracy": 0.12706615030765533, "num_tokens": 1407555.0, "step": 610 }, { "entropy": 6.680358648300171, "epoch": 0.006609136728531052, "grad_norm": 1.0859375, "learning_rate": 0.000307, "loss": 6.479, "mean_token_accuracy": 0.12326432690024376, "num_tokens": 1419366.0, "step": 615 }, { "entropy": 6.542993068695068, "epoch": 0.006662869547462199, "grad_norm": 1.15625, "learning_rate": 0.0003095, "loss": 6.4081, "mean_token_accuracy": 0.1296963684260845, "num_tokens": 1431029.0, "step": 620 }, { "entropy": 6.630553913116455, "epoch": 0.006716602366393346, "grad_norm": 1.234375, "learning_rate": 0.000312, "loss": 6.4554, "mean_token_accuracy": 0.12751922383904457, "num_tokens": 1443373.0, "step": 625 }, { "entropy": 6.652616214752197, "epoch": 0.0067703351853244925, "grad_norm": 1.1015625, "learning_rate": 0.0003145, "loss": 6.4876, "mean_token_accuracy": 0.11779244169592858, "num_tokens": 1455825.0, "step": 630 }, { "entropy": 6.5543968200683596, "epoch": 0.006824068004255639, "grad_norm": 1.171875, "learning_rate": 0.000317, "loss": 6.4883, "mean_token_accuracy": 0.12101165652275085, "num_tokens": 1468565.0, "step": 635 }, { "entropy": 6.7368861675262455, "epoch": 0.006877800823186786, "grad_norm": 1.2109375, "learning_rate": 0.0003195, "loss": 6.532, "mean_token_accuracy": 0.11934061422944069, "num_tokens": 1480349.0, "step": 640 }, { "entropy": 6.685069799423218, "epoch": 0.006931533642117933, "grad_norm": 0.98828125, "learning_rate": 0.000322, "loss": 6.5136, "mean_token_accuracy": 0.12378246709704399, "num_tokens": 1492546.0, "step": 645 }, { "entropy": 6.648138904571534, "epoch": 0.0069852664610490795, "grad_norm": 1.265625, "learning_rate": 0.00032450000000000003, "loss": 6.4985, "mean_token_accuracy": 0.12411848902702331, "num_tokens": 1505470.0, "step": 650 }, { "entropy": 6.578639078140259, "epoch": 0.007038999279980226, "grad_norm": 1.109375, "learning_rate": 0.00032700000000000003, "loss": 6.4716, "mean_token_accuracy": 0.1275963857769966, "num_tokens": 1517651.0, "step": 655 }, { "entropy": 6.597443866729736, "epoch": 0.007092732098911373, "grad_norm": 1.203125, "learning_rate": 0.00032950000000000004, "loss": 6.4648, "mean_token_accuracy": 0.1221590779721737, "num_tokens": 1528344.0, "step": 660 }, { "entropy": 6.656521511077881, "epoch": 0.00714646491784252, "grad_norm": 1.15625, "learning_rate": 0.00033200000000000005, "loss": 6.5515, "mean_token_accuracy": 0.12132448479533195, "num_tokens": 1540901.0, "step": 665 }, { "entropy": 6.798276329040528, "epoch": 0.007200197736773667, "grad_norm": 1.03125, "learning_rate": 0.00033450000000000005, "loss": 6.7276, "mean_token_accuracy": 0.11917936131358146, "num_tokens": 1553948.0, "step": 670 }, { "entropy": 6.652810382843017, "epoch": 0.007253930555704813, "grad_norm": 1.1328125, "learning_rate": 0.000337, "loss": 6.4356, "mean_token_accuracy": 0.1323891557753086, "num_tokens": 1564939.0, "step": 675 }, { "entropy": 6.4081744194030765, "epoch": 0.00730766337463596, "grad_norm": 1.0546875, "learning_rate": 0.0003395, "loss": 6.2896, "mean_token_accuracy": 0.13150809779763223, "num_tokens": 1575701.0, "step": 680 }, { "entropy": 6.666033411026001, "epoch": 0.007361396193567107, "grad_norm": 1.0859375, "learning_rate": 0.000342, "loss": 6.505, "mean_token_accuracy": 0.12376334965229034, "num_tokens": 1588302.0, "step": 685 }, { "entropy": 6.663384532928466, "epoch": 0.007415129012498254, "grad_norm": 0.94140625, "learning_rate": 0.00034449999999999997, "loss": 6.5337, "mean_token_accuracy": 0.12307745441794396, "num_tokens": 1600687.0, "step": 690 }, { "entropy": 6.546121740341187, "epoch": 0.0074688618314294, "grad_norm": 1.1875, "learning_rate": 0.000347, "loss": 6.3835, "mean_token_accuracy": 0.12949468046426774, "num_tokens": 1612911.0, "step": 695 }, { "entropy": 6.483590793609619, "epoch": 0.007522594650360547, "grad_norm": 1.1484375, "learning_rate": 0.0003495, "loss": 6.3987, "mean_token_accuracy": 0.1250015176832676, "num_tokens": 1625407.0, "step": 700 }, { "entropy": 6.515925741195678, "epoch": 0.007576327469291694, "grad_norm": 1.125, "learning_rate": 0.000352, "loss": 6.4381, "mean_token_accuracy": 0.1255468212068081, "num_tokens": 1636438.0, "step": 705 }, { "entropy": 6.521837043762207, "epoch": 0.007630060288222841, "grad_norm": 1.140625, "learning_rate": 0.0003545, "loss": 6.3278, "mean_token_accuracy": 0.13161946684122086, "num_tokens": 1646852.0, "step": 710 }, { "entropy": 6.5727705478668215, "epoch": 0.0076837931071539875, "grad_norm": 1.0390625, "learning_rate": 0.000357, "loss": 6.4295, "mean_token_accuracy": 0.122813381254673, "num_tokens": 1657497.0, "step": 715 }, { "entropy": 6.496736717224121, "epoch": 0.007737525926085134, "grad_norm": 1.1953125, "learning_rate": 0.0003595, "loss": 6.3579, "mean_token_accuracy": 0.133344866335392, "num_tokens": 1668576.0, "step": 720 }, { "entropy": 6.37104172706604, "epoch": 0.007791258745016281, "grad_norm": 1.328125, "learning_rate": 0.000362, "loss": 6.2756, "mean_token_accuracy": 0.13716673478484154, "num_tokens": 1678897.0, "step": 725 }, { "entropy": 6.4941541194915775, "epoch": 0.007844991563947428, "grad_norm": 1.1015625, "learning_rate": 0.0003645, "loss": 6.4019, "mean_token_accuracy": 0.12680666893720627, "num_tokens": 1690334.0, "step": 730 }, { "entropy": 6.580505418777466, "epoch": 0.007898724382878575, "grad_norm": 1.1640625, "learning_rate": 0.000367, "loss": 6.3362, "mean_token_accuracy": 0.13649081885814668, "num_tokens": 1701173.0, "step": 735 }, { "entropy": 6.443411922454834, "epoch": 0.007952457201809721, "grad_norm": 1.140625, "learning_rate": 0.0003695, "loss": 6.378, "mean_token_accuracy": 0.13125211074948312, "num_tokens": 1713081.0, "step": 740 }, { "entropy": 6.535996913909912, "epoch": 0.008006190020740869, "grad_norm": 1.265625, "learning_rate": 0.000372, "loss": 6.4182, "mean_token_accuracy": 0.12619447186589242, "num_tokens": 1725061.0, "step": 745 }, { "entropy": 6.4850883960723875, "epoch": 0.008059922839672015, "grad_norm": 1.1484375, "learning_rate": 0.0003745, "loss": 6.396, "mean_token_accuracy": 0.12616196647286415, "num_tokens": 1735374.0, "step": 750 }, { "entropy": 6.572152376174927, "epoch": 0.008113655658603162, "grad_norm": 1.1484375, "learning_rate": 0.000377, "loss": 6.4018, "mean_token_accuracy": 0.13052576184272766, "num_tokens": 1747100.0, "step": 755 }, { "entropy": 6.337621402740479, "epoch": 0.008167388477534308, "grad_norm": 1.1171875, "learning_rate": 0.0003795, "loss": 6.2472, "mean_token_accuracy": 0.13288816586136817, "num_tokens": 1758577.0, "step": 760 }, { "entropy": 6.557423830032349, "epoch": 0.008221121296465456, "grad_norm": 0.921875, "learning_rate": 0.000382, "loss": 6.5367, "mean_token_accuracy": 0.12673259526491165, "num_tokens": 1771127.0, "step": 765 }, { "entropy": 6.495845079421997, "epoch": 0.008274854115396602, "grad_norm": 1.1640625, "learning_rate": 0.0003845, "loss": 6.3796, "mean_token_accuracy": 0.1309738650918007, "num_tokens": 1782061.0, "step": 770 }, { "entropy": 6.395338773727417, "epoch": 0.00832858693432775, "grad_norm": 1.1953125, "learning_rate": 0.00038700000000000003, "loss": 6.3638, "mean_token_accuracy": 0.13038457557559013, "num_tokens": 1794632.0, "step": 775 }, { "entropy": 6.519541597366333, "epoch": 0.008382319753258895, "grad_norm": 1.203125, "learning_rate": 0.00038950000000000003, "loss": 6.3885, "mean_token_accuracy": 0.13315627053380014, "num_tokens": 1805414.0, "step": 780 }, { "entropy": 6.398904037475586, "epoch": 0.008436052572190043, "grad_norm": 1.0703125, "learning_rate": 0.00039200000000000004, "loss": 6.2914, "mean_token_accuracy": 0.13453604951500892, "num_tokens": 1816781.0, "step": 785 }, { "entropy": 6.494039821624756, "epoch": 0.008489785391121189, "grad_norm": 0.98046875, "learning_rate": 0.00039450000000000005, "loss": 6.4496, "mean_token_accuracy": 0.12688224837183953, "num_tokens": 1828791.0, "step": 790 }, { "entropy": 6.386651563644409, "epoch": 0.008543518210052337, "grad_norm": 1.21875, "learning_rate": 0.00039700000000000005, "loss": 6.3269, "mean_token_accuracy": 0.13748010098934174, "num_tokens": 1840092.0, "step": 795 }, { "entropy": 6.476310205459595, "epoch": 0.008597251028983482, "grad_norm": 1.0, "learning_rate": 0.0003995, "loss": 6.334, "mean_token_accuracy": 0.13396526053547858, "num_tokens": 1851569.0, "step": 800 }, { "entropy": 6.375878381729126, "epoch": 0.00865098384791463, "grad_norm": 1.109375, "learning_rate": 0.000402, "loss": 6.2508, "mean_token_accuracy": 0.13404305949807166, "num_tokens": 1861939.0, "step": 805 }, { "entropy": 6.49393253326416, "epoch": 0.008704716666845776, "grad_norm": 1.2109375, "learning_rate": 0.0004045, "loss": 6.4467, "mean_token_accuracy": 0.12742400392889977, "num_tokens": 1873545.0, "step": 810 }, { "entropy": 6.360756969451904, "epoch": 0.008758449485776924, "grad_norm": 0.9609375, "learning_rate": 0.00040699999999999997, "loss": 6.4065, "mean_token_accuracy": 0.12780992686748505, "num_tokens": 1885870.0, "step": 815 }, { "entropy": 6.523135995864868, "epoch": 0.00881218230470807, "grad_norm": 1.1171875, "learning_rate": 0.0004095, "loss": 6.472, "mean_token_accuracy": 0.12656911313533784, "num_tokens": 1898118.0, "step": 820 }, { "entropy": 6.408415365219116, "epoch": 0.008865915123639217, "grad_norm": 1.078125, "learning_rate": 0.000412, "loss": 6.2098, "mean_token_accuracy": 0.13449918180704118, "num_tokens": 1907638.0, "step": 825 }, { "entropy": 6.37138261795044, "epoch": 0.008919647942570363, "grad_norm": 1.0234375, "learning_rate": 0.0004145, "loss": 6.3885, "mean_token_accuracy": 0.12769241705536843, "num_tokens": 1919814.0, "step": 830 }, { "entropy": 6.42969536781311, "epoch": 0.00897338076150151, "grad_norm": 1.0390625, "learning_rate": 0.000417, "loss": 6.305, "mean_token_accuracy": 0.12873108088970184, "num_tokens": 1930090.0, "step": 835 }, { "entropy": 6.503070831298828, "epoch": 0.009027113580432657, "grad_norm": 1.0546875, "learning_rate": 0.0004195, "loss": 6.4575, "mean_token_accuracy": 0.12877310812473297, "num_tokens": 1941916.0, "step": 840 }, { "entropy": 6.373751020431518, "epoch": 0.009080846399363804, "grad_norm": 1.25, "learning_rate": 0.000422, "loss": 6.3835, "mean_token_accuracy": 0.13241996690630914, "num_tokens": 1953356.0, "step": 845 }, { "entropy": 6.532479238510132, "epoch": 0.00913457921829495, "grad_norm": 1.0859375, "learning_rate": 0.0004245, "loss": 6.4746, "mean_token_accuracy": 0.1252823568880558, "num_tokens": 1964043.0, "step": 850 }, { "entropy": 6.503678846359253, "epoch": 0.009188312037226098, "grad_norm": 1.1328125, "learning_rate": 0.000427, "loss": 6.4102, "mean_token_accuracy": 0.13039419800043106, "num_tokens": 1975971.0, "step": 855 }, { "entropy": 6.328308725357056, "epoch": 0.009242044856157244, "grad_norm": 0.98828125, "learning_rate": 0.0004295, "loss": 6.4012, "mean_token_accuracy": 0.13699360191822052, "num_tokens": 1987882.0, "step": 860 }, { "entropy": 6.5440106868743895, "epoch": 0.009295777675088391, "grad_norm": 1.125, "learning_rate": 0.000432, "loss": 6.4144, "mean_token_accuracy": 0.13187188804149627, "num_tokens": 1999586.0, "step": 865 }, { "entropy": 6.467750215530396, "epoch": 0.009349510494019537, "grad_norm": 1.0625, "learning_rate": 0.0004345, "loss": 6.4583, "mean_token_accuracy": 0.13001283928751944, "num_tokens": 2011867.0, "step": 870 }, { "entropy": 6.408541107177735, "epoch": 0.009403243312950685, "grad_norm": 1.078125, "learning_rate": 0.000437, "loss": 6.3552, "mean_token_accuracy": 0.13619493544101716, "num_tokens": 2023372.0, "step": 875 }, { "entropy": 6.344149351119995, "epoch": 0.00945697613188183, "grad_norm": 1.140625, "learning_rate": 0.0004395, "loss": 6.3217, "mean_token_accuracy": 0.1275565542280674, "num_tokens": 2035896.0, "step": 880 }, { "entropy": 6.362127685546875, "epoch": 0.009510708950812978, "grad_norm": 1.140625, "learning_rate": 0.000442, "loss": 6.2448, "mean_token_accuracy": 0.13719155937433242, "num_tokens": 2046912.0, "step": 885 }, { "entropy": 6.278013896942139, "epoch": 0.009564441769744124, "grad_norm": 1.15625, "learning_rate": 0.0004445, "loss": 6.2975, "mean_token_accuracy": 0.13730109632015228, "num_tokens": 2058322.0, "step": 890 }, { "entropy": 6.478695487976074, "epoch": 0.009618174588675272, "grad_norm": 1.0625, "learning_rate": 0.000447, "loss": 6.3322, "mean_token_accuracy": 0.13603856638073922, "num_tokens": 2069755.0, "step": 895 }, { "entropy": 6.3329634189605715, "epoch": 0.009671907407606418, "grad_norm": 1.2734375, "learning_rate": 0.00044950000000000003, "loss": 6.347, "mean_token_accuracy": 0.131291563808918, "num_tokens": 2080453.0, "step": 900 }, { "entropy": 6.4724616527557375, "epoch": 0.009725640226537565, "grad_norm": 1.0625, "learning_rate": 0.00045200000000000004, "loss": 6.4294, "mean_token_accuracy": 0.13204899728298186, "num_tokens": 2090847.0, "step": 905 }, { "entropy": 6.4222029685974125, "epoch": 0.009779373045468711, "grad_norm": 1.2109375, "learning_rate": 0.00045450000000000004, "loss": 6.4368, "mean_token_accuracy": 0.137455066293478, "num_tokens": 2104254.0, "step": 910 }, { "entropy": 6.344487428665161, "epoch": 0.009833105864399859, "grad_norm": 1.0234375, "learning_rate": 0.00045700000000000005, "loss": 6.3289, "mean_token_accuracy": 0.1320524349808693, "num_tokens": 2115392.0, "step": 915 }, { "entropy": 6.50238618850708, "epoch": 0.009886838683331005, "grad_norm": 0.8984375, "learning_rate": 0.00045950000000000006, "loss": 6.5063, "mean_token_accuracy": 0.12493504136800766, "num_tokens": 2128388.0, "step": 920 }, { "entropy": 6.358483028411865, "epoch": 0.009940571502262152, "grad_norm": 1.140625, "learning_rate": 0.000462, "loss": 6.2882, "mean_token_accuracy": 0.13589850142598153, "num_tokens": 2139023.0, "step": 925 }, { "entropy": 6.373326253890991, "epoch": 0.009994304321193298, "grad_norm": 1.0390625, "learning_rate": 0.0004645, "loss": 6.2663, "mean_token_accuracy": 0.13531995043158532, "num_tokens": 2150693.0, "step": 930 }, { "entropy": 6.279564762115479, "epoch": 0.010048037140124446, "grad_norm": 0.9609375, "learning_rate": 0.000467, "loss": 6.2776, "mean_token_accuracy": 0.13068829327821732, "num_tokens": 2163192.0, "step": 935 }, { "entropy": 6.234259986877442, "epoch": 0.010101769959055592, "grad_norm": 1.15625, "learning_rate": 0.0004695, "loss": 6.1662, "mean_token_accuracy": 0.14027160853147508, "num_tokens": 2173700.0, "step": 940 }, { "entropy": 6.339089107513428, "epoch": 0.01015550277798674, "grad_norm": 1.0078125, "learning_rate": 0.000472, "loss": 6.3379, "mean_token_accuracy": 0.1347230739891529, "num_tokens": 2185500.0, "step": 945 }, { "entropy": 6.227807855606079, "epoch": 0.010209235596917885, "grad_norm": 1.03125, "learning_rate": 0.0004745, "loss": 6.2689, "mean_token_accuracy": 0.1386742152273655, "num_tokens": 2197363.0, "step": 950 }, { "entropy": 6.333368492126465, "epoch": 0.010262968415849033, "grad_norm": 0.95703125, "learning_rate": 0.000477, "loss": 6.3467, "mean_token_accuracy": 0.13571017980575562, "num_tokens": 2209173.0, "step": 955 }, { "entropy": 6.408475399017334, "epoch": 0.010316701234780179, "grad_norm": 1.078125, "learning_rate": 0.0004795, "loss": 6.3941, "mean_token_accuracy": 0.1270724914968014, "num_tokens": 2220469.0, "step": 960 }, { "entropy": 6.429714393615723, "epoch": 0.010370434053711327, "grad_norm": 1.0625, "learning_rate": 0.000482, "loss": 6.389, "mean_token_accuracy": 0.13281712904572487, "num_tokens": 2232426.0, "step": 965 }, { "entropy": 6.21214656829834, "epoch": 0.010424166872642473, "grad_norm": 1.0703125, "learning_rate": 0.0004845, "loss": 6.3173, "mean_token_accuracy": 0.13897231221199036, "num_tokens": 2243763.0, "step": 970 }, { "entropy": 6.33380913734436, "epoch": 0.01047789969157362, "grad_norm": 0.94140625, "learning_rate": 0.000487, "loss": 6.2468, "mean_token_accuracy": 0.1297723114490509, "num_tokens": 2255987.0, "step": 975 }, { "entropy": 6.272552013397217, "epoch": 0.010531632510504766, "grad_norm": 1.09375, "learning_rate": 0.0004895, "loss": 6.1886, "mean_token_accuracy": 0.13993587493896484, "num_tokens": 2266701.0, "step": 980 }, { "entropy": 6.254857301712036, "epoch": 0.010585365329435914, "grad_norm": 1.1015625, "learning_rate": 0.000492, "loss": 6.2448, "mean_token_accuracy": 0.13452961146831513, "num_tokens": 2278162.0, "step": 985 }, { "entropy": 6.207320690155029, "epoch": 0.01063909814836706, "grad_norm": 1.125, "learning_rate": 0.0004945, "loss": 6.2815, "mean_token_accuracy": 0.13594236746430396, "num_tokens": 2289478.0, "step": 990 }, { "entropy": 6.288606119155884, "epoch": 0.010692830967298207, "grad_norm": 1.0390625, "learning_rate": 0.000497, "loss": 6.3368, "mean_token_accuracy": 0.13813528120517732, "num_tokens": 2301283.0, "step": 995 }, { "entropy": 6.375607204437256, "epoch": 0.010746563786229353, "grad_norm": 1.21875, "learning_rate": 0.0004995, "loss": 6.2796, "mean_token_accuracy": 0.13963441848754882, "num_tokens": 2312620.0, "step": 1000 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 3673145401344000.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }