{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.0053732818931146765, "eval_steps": 500, "global_step": 500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.691944599151611, "epoch": 5.3732818931146765e-05, "grad_norm": 15.4375, "learning_rate": 2e-06, "loss": 10.867, "mean_token_accuracy": 0.0, "num_tokens": 12868.0, "step": 5 }, { "entropy": 10.691931915283202, "epoch": 0.00010746563786229353, "grad_norm": 13.1875, "learning_rate": 4.5e-06, "loss": 10.7713, "mean_token_accuracy": 0.0, "num_tokens": 23808.0, "step": 10 }, { "entropy": 10.69122085571289, "epoch": 0.0001611984567934403, "grad_norm": 10.5625, "learning_rate": 7e-06, "loss": 10.4885, "mean_token_accuracy": 0.017395494051743298, "num_tokens": 34239.0, "step": 15 }, { "entropy": 10.684881401062011, "epoch": 0.00021493127572458706, "grad_norm": 6.15625, "learning_rate": 9.5e-06, "loss": 10.1795, "mean_token_accuracy": 0.03431609831750393, "num_tokens": 45311.0, "step": 20 }, { "entropy": 10.651975917816163, "epoch": 0.00026866409465573383, "grad_norm": 4.0625, "learning_rate": 1.2e-05, "loss": 9.8328, "mean_token_accuracy": 0.039574161358177665, "num_tokens": 56105.0, "step": 25 }, { "entropy": 10.609530162811279, "epoch": 0.0003223969135868806, "grad_norm": 3.078125, "learning_rate": 1.4500000000000002e-05, "loss": 9.7804, "mean_token_accuracy": 0.03973569292575121, "num_tokens": 68382.0, "step": 30 }, { "entropy": 10.593698596954345, "epoch": 0.00037612973251802736, "grad_norm": 2.921875, "learning_rate": 1.7000000000000003e-05, "loss": 9.619, "mean_token_accuracy": 0.04424203187227249, "num_tokens": 81209.0, "step": 35 }, { "entropy": 10.5916898727417, "epoch": 0.0004298625514491741, "grad_norm": 2.65625, "learning_rate": 1.95e-05, "loss": 9.5786, "mean_token_accuracy": 0.03825619481503963, "num_tokens": 94148.0, "step": 40 }, { "entropy": 10.594180679321289, "epoch": 0.0004835953703803209, "grad_norm": 2.6875, "learning_rate": 2.2e-05, "loss": 9.526, "mean_token_accuracy": 0.048027387261390685, "num_tokens": 106398.0, "step": 45 }, { "entropy": 10.578767490386962, "epoch": 0.0005373281893114677, "grad_norm": 2.34375, "learning_rate": 2.4500000000000003e-05, "loss": 9.5403, "mean_token_accuracy": 0.04592233560979366, "num_tokens": 118963.0, "step": 50 }, { "entropy": 10.581397247314452, "epoch": 0.0005910610082426144, "grad_norm": 2.53125, "learning_rate": 2.7e-05, "loss": 9.4431, "mean_token_accuracy": 0.045610013604164126, "num_tokens": 129302.0, "step": 55 }, { "entropy": 10.57803840637207, "epoch": 0.0006447938271737612, "grad_norm": 2.515625, "learning_rate": 2.95e-05, "loss": 9.3236, "mean_token_accuracy": 0.05025259889662266, "num_tokens": 139595.0, "step": 60 }, { "entropy": 10.486345100402833, "epoch": 0.000698526646104908, "grad_norm": 2.5, "learning_rate": 3.2e-05, "loss": 9.2169, "mean_token_accuracy": 0.060793956741690636, "num_tokens": 150436.0, "step": 65 }, { "entropy": 10.35349416732788, "epoch": 0.0007522594650360547, "grad_norm": 2.359375, "learning_rate": 3.4500000000000005e-05, "loss": 9.1404, "mean_token_accuracy": 0.06265294775366784, "num_tokens": 161692.0, "step": 70 }, { "entropy": 10.434385204315186, "epoch": 0.0008059922839672015, "grad_norm": 2.296875, "learning_rate": 3.7e-05, "loss": 9.0866, "mean_token_accuracy": 0.06112063825130463, "num_tokens": 173914.0, "step": 75 }, { "entropy": 10.437462615966798, "epoch": 0.0008597251028983482, "grad_norm": 2.171875, "learning_rate": 3.95e-05, "loss": 8.9348, "mean_token_accuracy": 0.06636513993144036, "num_tokens": 185793.0, "step": 80 }, { "entropy": 10.385666561126708, "epoch": 0.000913457921829495, "grad_norm": 2.484375, "learning_rate": 4.2000000000000004e-05, "loss": 8.9272, "mean_token_accuracy": 0.06668606549501419, "num_tokens": 199762.0, "step": 85 }, { "entropy": 10.262327003479005, "epoch": 0.0009671907407606418, "grad_norm": 2.734375, "learning_rate": 4.45e-05, "loss": 8.7491, "mean_token_accuracy": 0.06684565916657448, "num_tokens": 211760.0, "step": 90 }, { "entropy": 10.279810237884522, "epoch": 0.0010209235596917885, "grad_norm": 3.0, "learning_rate": 4.7000000000000004e-05, "loss": 8.6214, "mean_token_accuracy": 0.07119264826178551, "num_tokens": 222654.0, "step": 95 }, { "entropy": 10.154211807250977, "epoch": 0.0010746563786229353, "grad_norm": 2.03125, "learning_rate": 4.9500000000000004e-05, "loss": 8.605, "mean_token_accuracy": 0.07087584175169467, "num_tokens": 234906.0, "step": 100 }, { "entropy": 10.154182243347169, "epoch": 0.001128389197554082, "grad_norm": 1.96875, "learning_rate": 5.2e-05, "loss": 8.4204, "mean_token_accuracy": 0.08174400329589844, "num_tokens": 246419.0, "step": 105 }, { "entropy": 9.984860038757324, "epoch": 0.0011821220164852288, "grad_norm": 1.8828125, "learning_rate": 5.45e-05, "loss": 8.2827, "mean_token_accuracy": 0.08357185944914818, "num_tokens": 257878.0, "step": 110 }, { "entropy": 9.92540111541748, "epoch": 0.0012358548354163756, "grad_norm": 1.8515625, "learning_rate": 5.7e-05, "loss": 8.1352, "mean_token_accuracy": 0.08523289784789086, "num_tokens": 269180.0, "step": 115 }, { "entropy": 9.790580940246581, "epoch": 0.0012895876543475224, "grad_norm": 1.6875, "learning_rate": 5.9499999999999996e-05, "loss": 8.1268, "mean_token_accuracy": 0.0837685689330101, "num_tokens": 281482.0, "step": 120 }, { "entropy": 9.689721870422364, "epoch": 0.0013433204732786691, "grad_norm": 1.71875, "learning_rate": 6.2e-05, "loss": 7.9125, "mean_token_accuracy": 0.08588041439652443, "num_tokens": 292289.0, "step": 125 }, { "entropy": 9.55999813079834, "epoch": 0.001397053292209816, "grad_norm": 1.78125, "learning_rate": 6.450000000000001e-05, "loss": 7.8259, "mean_token_accuracy": 0.08231885209679604, "num_tokens": 303274.0, "step": 130 }, { "entropy": 9.327935886383056, "epoch": 0.0014507861111409627, "grad_norm": 1.625, "learning_rate": 6.7e-05, "loss": 7.6719, "mean_token_accuracy": 0.0838103786110878, "num_tokens": 314933.0, "step": 135 }, { "entropy": 9.111929130554199, "epoch": 0.0015045189300721094, "grad_norm": 1.4296875, "learning_rate": 6.950000000000001e-05, "loss": 7.5777, "mean_token_accuracy": 0.08480807095766067, "num_tokens": 327450.0, "step": 140 }, { "entropy": 8.934065532684325, "epoch": 0.0015582517490032562, "grad_norm": 1.234375, "learning_rate": 7.2e-05, "loss": 7.4816, "mean_token_accuracy": 0.08673194646835328, "num_tokens": 339409.0, "step": 145 }, { "entropy": 8.693235874176025, "epoch": 0.001611984567934403, "grad_norm": 1.1640625, "learning_rate": 7.45e-05, "loss": 7.4587, "mean_token_accuracy": 0.08729644715785981, "num_tokens": 352374.0, "step": 150 }, { "entropy": 8.44670124053955, "epoch": 0.0016657173868655497, "grad_norm": 1.4140625, "learning_rate": 7.7e-05, "loss": 7.3175, "mean_token_accuracy": 0.09196643233299255, "num_tokens": 363653.0, "step": 155 }, { "entropy": 8.291356182098388, "epoch": 0.0017194502057966965, "grad_norm": 1.5625, "learning_rate": 7.950000000000001e-05, "loss": 7.3101, "mean_token_accuracy": 0.08862848281860351, "num_tokens": 374982.0, "step": 160 }, { "entropy": 8.183576679229736, "epoch": 0.0017731830247278433, "grad_norm": 1.28125, "learning_rate": 8.2e-05, "loss": 7.2019, "mean_token_accuracy": 0.08939464986324311, "num_tokens": 387794.0, "step": 165 }, { "entropy": 8.042083930969238, "epoch": 0.00182691584365899, "grad_norm": 1.3671875, "learning_rate": 8.450000000000001e-05, "loss": 7.2703, "mean_token_accuracy": 0.08938254192471504, "num_tokens": 399993.0, "step": 170 }, { "entropy": 7.948488187789917, "epoch": 0.0018806486625901368, "grad_norm": 1.234375, "learning_rate": 8.7e-05, "loss": 7.1802, "mean_token_accuracy": 0.10024765953421592, "num_tokens": 410864.0, "step": 175 }, { "entropy": 7.877219009399414, "epoch": 0.0019343814815212836, "grad_norm": 1.25, "learning_rate": 8.95e-05, "loss": 7.2057, "mean_token_accuracy": 0.09488844051957131, "num_tokens": 422376.0, "step": 180 }, { "entropy": 7.852542734146118, "epoch": 0.0019881143004524303, "grad_norm": 1.2265625, "learning_rate": 9.2e-05, "loss": 7.1815, "mean_token_accuracy": 0.10110960602760315, "num_tokens": 434301.0, "step": 185 }, { "entropy": 7.8157186031341555, "epoch": 0.002041847119383577, "grad_norm": 1.5, "learning_rate": 9.45e-05, "loss": 7.1695, "mean_token_accuracy": 0.09449249878525734, "num_tokens": 446159.0, "step": 190 }, { "entropy": 7.741145420074463, "epoch": 0.002095579938314724, "grad_norm": 1.25, "learning_rate": 9.7e-05, "loss": 7.1823, "mean_token_accuracy": 0.0965780720114708, "num_tokens": 458376.0, "step": 195 }, { "entropy": 7.750446844100952, "epoch": 0.0021493127572458706, "grad_norm": 1.671875, "learning_rate": 9.95e-05, "loss": 7.1192, "mean_token_accuracy": 0.10175004899501801, "num_tokens": 469082.0, "step": 200 }, { "entropy": 7.683127355575562, "epoch": 0.0022030455761770174, "grad_norm": 1.3984375, "learning_rate": 0.000102, "loss": 7.0011, "mean_token_accuracy": 0.10132882818579673, "num_tokens": 480149.0, "step": 205 }, { "entropy": 7.6684812068939205, "epoch": 0.002256778395108164, "grad_norm": 1.3125, "learning_rate": 0.00010449999999999999, "loss": 7.1455, "mean_token_accuracy": 0.0962664932012558, "num_tokens": 493074.0, "step": 210 }, { "entropy": 7.615740251541138, "epoch": 0.002310511214039311, "grad_norm": 1.25, "learning_rate": 0.000107, "loss": 7.0009, "mean_token_accuracy": 0.10513110086321831, "num_tokens": 504647.0, "step": 215 }, { "entropy": 7.548989009857178, "epoch": 0.0023642440329704577, "grad_norm": 1.4375, "learning_rate": 0.0001095, "loss": 7.0833, "mean_token_accuracy": 0.09757705479860306, "num_tokens": 516304.0, "step": 220 }, { "entropy": 7.63504056930542, "epoch": 0.0024179768519016044, "grad_norm": 1.3125, "learning_rate": 0.000112, "loss": 7.0133, "mean_token_accuracy": 0.1059924952685833, "num_tokens": 526467.0, "step": 225 }, { "entropy": 7.553870820999146, "epoch": 0.002471709670832751, "grad_norm": 1.203125, "learning_rate": 0.0001145, "loss": 7.059, "mean_token_accuracy": 0.10098145231604576, "num_tokens": 539109.0, "step": 230 }, { "entropy": 7.517747688293457, "epoch": 0.002525442489763898, "grad_norm": 1.3984375, "learning_rate": 0.00011700000000000001, "loss": 6.9522, "mean_token_accuracy": 0.09978492632508278, "num_tokens": 550142.0, "step": 235 }, { "entropy": 7.522121000289917, "epoch": 0.0025791753086950447, "grad_norm": 1.125, "learning_rate": 0.00011949999999999999, "loss": 7.0176, "mean_token_accuracy": 0.10614465549588203, "num_tokens": 561639.0, "step": 240 }, { "entropy": 7.508337593078613, "epoch": 0.0026329081276261915, "grad_norm": 1.234375, "learning_rate": 0.000122, "loss": 6.9533, "mean_token_accuracy": 0.10177289620041848, "num_tokens": 573849.0, "step": 245 }, { "entropy": 7.48092360496521, "epoch": 0.0026866409465573383, "grad_norm": 1.3671875, "learning_rate": 0.0001245, "loss": 6.9289, "mean_token_accuracy": 0.10615592449903488, "num_tokens": 584572.0, "step": 250 }, { "entropy": 7.391205263137818, "epoch": 0.002740373765488485, "grad_norm": 1.203125, "learning_rate": 0.000127, "loss": 6.9508, "mean_token_accuracy": 0.11110179796814919, "num_tokens": 595314.0, "step": 255 }, { "entropy": 7.482128667831421, "epoch": 0.002794106584419632, "grad_norm": 1.3046875, "learning_rate": 0.0001295, "loss": 7.0476, "mean_token_accuracy": 0.10385493785142899, "num_tokens": 605689.0, "step": 260 }, { "entropy": 7.351570653915405, "epoch": 0.0028478394033507786, "grad_norm": 1.234375, "learning_rate": 0.000132, "loss": 6.8358, "mean_token_accuracy": 0.11294776201248169, "num_tokens": 617057.0, "step": 265 }, { "entropy": 7.4075196266174315, "epoch": 0.0029015722222819253, "grad_norm": 1.4140625, "learning_rate": 0.00013450000000000002, "loss": 6.9324, "mean_token_accuracy": 0.10447231009602546, "num_tokens": 628111.0, "step": 270 }, { "entropy": 7.342596530914307, "epoch": 0.002955305041213072, "grad_norm": 1.375, "learning_rate": 0.00013700000000000002, "loss": 6.8379, "mean_token_accuracy": 0.1141952745616436, "num_tokens": 639254.0, "step": 275 }, { "entropy": 7.35143084526062, "epoch": 0.003009037860144219, "grad_norm": 1.1171875, "learning_rate": 0.0001395, "loss": 6.9304, "mean_token_accuracy": 0.1006052739918232, "num_tokens": 651096.0, "step": 280 }, { "entropy": 7.301223182678223, "epoch": 0.0030627706790753656, "grad_norm": 1.1796875, "learning_rate": 0.00014199999999999998, "loss": 6.9238, "mean_token_accuracy": 0.10944507122039795, "num_tokens": 663132.0, "step": 285 }, { "entropy": 7.29386534690857, "epoch": 0.0031165034980065124, "grad_norm": 1.640625, "learning_rate": 0.0001445, "loss": 6.7711, "mean_token_accuracy": 0.11792795732617378, "num_tokens": 674160.0, "step": 290 }, { "entropy": 7.214638614654541, "epoch": 0.003170236316937659, "grad_norm": 1.578125, "learning_rate": 0.000147, "loss": 6.8337, "mean_token_accuracy": 0.10255614519119263, "num_tokens": 685284.0, "step": 295 }, { "entropy": 7.2078382015228275, "epoch": 0.003223969135868806, "grad_norm": 1.2578125, "learning_rate": 0.0001495, "loss": 6.7865, "mean_token_accuracy": 0.10231738537549973, "num_tokens": 696789.0, "step": 300 }, { "entropy": 7.242858171463013, "epoch": 0.0032777019547999527, "grad_norm": 1.4375, "learning_rate": 0.000152, "loss": 6.8906, "mean_token_accuracy": 0.1063354529440403, "num_tokens": 708083.0, "step": 305 }, { "entropy": 7.285495710372925, "epoch": 0.0033314347737310995, "grad_norm": 1.125, "learning_rate": 0.00015450000000000001, "loss": 6.8254, "mean_token_accuracy": 0.11012862473726273, "num_tokens": 720232.0, "step": 310 }, { "entropy": 7.072454166412354, "epoch": 0.0033851675926622462, "grad_norm": 1.34375, "learning_rate": 0.000157, "loss": 6.7098, "mean_token_accuracy": 0.11381540670990944, "num_tokens": 731264.0, "step": 315 }, { "entropy": 7.268528461456299, "epoch": 0.003438900411593393, "grad_norm": 1.3359375, "learning_rate": 0.0001595, "loss": 6.6929, "mean_token_accuracy": 0.11482961028814316, "num_tokens": 742158.0, "step": 320 }, { "entropy": 7.142989206314087, "epoch": 0.0034926332305245398, "grad_norm": 1.234375, "learning_rate": 0.000162, "loss": 6.776, "mean_token_accuracy": 0.11389129087328911, "num_tokens": 753330.0, "step": 325 }, { "entropy": 7.2236439228057865, "epoch": 0.0035463660494556865, "grad_norm": 1.390625, "learning_rate": 0.00016450000000000001, "loss": 6.7643, "mean_token_accuracy": 0.11012546345591545, "num_tokens": 765052.0, "step": 330 }, { "entropy": 7.140369892120361, "epoch": 0.0036000988683868333, "grad_norm": 1.359375, "learning_rate": 0.00016700000000000002, "loss": 6.7135, "mean_token_accuracy": 0.11338407099246979, "num_tokens": 775120.0, "step": 335 }, { "entropy": 7.167498207092285, "epoch": 0.00365383168731798, "grad_norm": 1.296875, "learning_rate": 0.00016950000000000003, "loss": 6.8179, "mean_token_accuracy": 0.10822930335998535, "num_tokens": 786442.0, "step": 340 }, { "entropy": 7.1545287609100345, "epoch": 0.003707564506249127, "grad_norm": 1.453125, "learning_rate": 0.00017199999999999998, "loss": 6.7217, "mean_token_accuracy": 0.11315969750285149, "num_tokens": 796526.0, "step": 345 }, { "entropy": 7.073437261581421, "epoch": 0.0037612973251802736, "grad_norm": 1.1484375, "learning_rate": 0.00017449999999999999, "loss": 6.7366, "mean_token_accuracy": 0.11096625924110412, "num_tokens": 808296.0, "step": 350 }, { "entropy": 7.14297833442688, "epoch": 0.0038150301441114204, "grad_norm": 1.34375, "learning_rate": 0.000177, "loss": 6.8753, "mean_token_accuracy": 0.10760819539427757, "num_tokens": 820142.0, "step": 355 }, { "entropy": 7.075785732269287, "epoch": 0.003868762963042567, "grad_norm": 1.4296875, "learning_rate": 0.0001795, "loss": 6.6351, "mean_token_accuracy": 0.1149467647075653, "num_tokens": 830656.0, "step": 360 }, { "entropy": 7.124733304977417, "epoch": 0.003922495781973714, "grad_norm": 1.203125, "learning_rate": 0.000182, "loss": 6.8206, "mean_token_accuracy": 0.11161701381206512, "num_tokens": 841948.0, "step": 365 }, { "entropy": 7.07345609664917, "epoch": 0.003976228600904861, "grad_norm": 1.2578125, "learning_rate": 0.0001845, "loss": 6.7821, "mean_token_accuracy": 0.11786900460720062, "num_tokens": 854207.0, "step": 370 }, { "entropy": 7.170615530014038, "epoch": 0.004029961419836007, "grad_norm": 1.1953125, "learning_rate": 0.000187, "loss": 6.8525, "mean_token_accuracy": 0.12062755227088928, "num_tokens": 866747.0, "step": 375 }, { "entropy": 7.042162704467773, "epoch": 0.004083694238767154, "grad_norm": 1.2421875, "learning_rate": 0.0001895, "loss": 6.7051, "mean_token_accuracy": 0.11747116073966027, "num_tokens": 877961.0, "step": 380 }, { "entropy": 7.085628366470337, "epoch": 0.004137427057698301, "grad_norm": 1.28125, "learning_rate": 0.000192, "loss": 6.7507, "mean_token_accuracy": 0.10921004936099052, "num_tokens": 888869.0, "step": 385 }, { "entropy": 7.034130811691284, "epoch": 0.004191159876629448, "grad_norm": 1.203125, "learning_rate": 0.0001945, "loss": 6.7366, "mean_token_accuracy": 0.11664599329233169, "num_tokens": 899408.0, "step": 390 }, { "entropy": 6.982698535919189, "epoch": 0.0042448926955605945, "grad_norm": 1.265625, "learning_rate": 0.00019700000000000002, "loss": 6.6711, "mean_token_accuracy": 0.1158648207783699, "num_tokens": 910457.0, "step": 395 }, { "entropy": 7.062652063369751, "epoch": 0.004298625514491741, "grad_norm": 1.2890625, "learning_rate": 0.00019950000000000002, "loss": 6.7841, "mean_token_accuracy": 0.11403620392084121, "num_tokens": 922772.0, "step": 400 }, { "entropy": 6.986512184143066, "epoch": 0.004352358333422888, "grad_norm": 1.25, "learning_rate": 0.000202, "loss": 6.6783, "mean_token_accuracy": 0.11563151925802231, "num_tokens": 933820.0, "step": 405 }, { "entropy": 7.02769365310669, "epoch": 0.004406091152354035, "grad_norm": 1.2421875, "learning_rate": 0.00020449999999999998, "loss": 6.6902, "mean_token_accuracy": 0.12013663202524186, "num_tokens": 945044.0, "step": 410 }, { "entropy": 6.937658596038818, "epoch": 0.0044598239712851815, "grad_norm": 1.2265625, "learning_rate": 0.000207, "loss": 6.6422, "mean_token_accuracy": 0.11966706290841103, "num_tokens": 956140.0, "step": 415 }, { "entropy": 6.904023456573486, "epoch": 0.004513556790216328, "grad_norm": 1.2734375, "learning_rate": 0.0002095, "loss": 6.5249, "mean_token_accuracy": 0.11787364035844802, "num_tokens": 967386.0, "step": 420 }, { "entropy": 6.979593801498413, "epoch": 0.004567289609147475, "grad_norm": 1.109375, "learning_rate": 0.000212, "loss": 6.7215, "mean_token_accuracy": 0.11483194008469581, "num_tokens": 980381.0, "step": 425 }, { "entropy": 6.9800636768341064, "epoch": 0.004621022428078622, "grad_norm": 1.15625, "learning_rate": 0.0002145, "loss": 6.6044, "mean_token_accuracy": 0.11717872545123101, "num_tokens": 992279.0, "step": 430 }, { "entropy": 6.966359424591064, "epoch": 0.004674755247009769, "grad_norm": 1.390625, "learning_rate": 0.00021700000000000002, "loss": 6.755, "mean_token_accuracy": 0.11651304587721825, "num_tokens": 1005046.0, "step": 435 }, { "entropy": 6.898645305633545, "epoch": 0.004728488065940915, "grad_norm": 1.5, "learning_rate": 0.0002195, "loss": 6.7279, "mean_token_accuracy": 0.11459456831216812, "num_tokens": 1018636.0, "step": 440 }, { "entropy": 6.968531131744385, "epoch": 0.004782220884872062, "grad_norm": 1.1015625, "learning_rate": 0.000222, "loss": 6.6579, "mean_token_accuracy": 0.11964940950274468, "num_tokens": 1030293.0, "step": 445 }, { "entropy": 6.921095752716065, "epoch": 0.004835953703803209, "grad_norm": 1.1796875, "learning_rate": 0.0002245, "loss": 6.6835, "mean_token_accuracy": 0.11620648130774498, "num_tokens": 1041853.0, "step": 450 }, { "entropy": 6.953577375411987, "epoch": 0.004889686522734356, "grad_norm": 1.109375, "learning_rate": 0.00022700000000000002, "loss": 6.7021, "mean_token_accuracy": 0.12079041078686714, "num_tokens": 1052959.0, "step": 455 }, { "entropy": 6.906730604171753, "epoch": 0.004943419341665502, "grad_norm": 1.3046875, "learning_rate": 0.00022950000000000002, "loss": 6.5797, "mean_token_accuracy": 0.1155982829630375, "num_tokens": 1064200.0, "step": 460 }, { "entropy": 6.912591934204102, "epoch": 0.004997152160596649, "grad_norm": 1.4140625, "learning_rate": 0.00023200000000000003, "loss": 6.7112, "mean_token_accuracy": 0.11692484319210053, "num_tokens": 1075643.0, "step": 465 }, { "entropy": 6.884953784942627, "epoch": 0.005050884979527796, "grad_norm": 1.0859375, "learning_rate": 0.00023449999999999998, "loss": 6.6495, "mean_token_accuracy": 0.11548735648393631, "num_tokens": 1086641.0, "step": 470 }, { "entropy": 6.768892002105713, "epoch": 0.005104617798458943, "grad_norm": 1.1796875, "learning_rate": 0.000237, "loss": 6.6014, "mean_token_accuracy": 0.12133783251047134, "num_tokens": 1098862.0, "step": 475 }, { "entropy": 6.882342195510864, "epoch": 0.0051583506173900895, "grad_norm": 1.3203125, "learning_rate": 0.0002395, "loss": 6.5766, "mean_token_accuracy": 0.12126556858420372, "num_tokens": 1110243.0, "step": 480 }, { "entropy": 6.835430574417114, "epoch": 0.005212083436321236, "grad_norm": 1.1484375, "learning_rate": 0.000242, "loss": 6.5728, "mean_token_accuracy": 0.11558629795908928, "num_tokens": 1122573.0, "step": 485 }, { "entropy": 6.88542947769165, "epoch": 0.005265816255252383, "grad_norm": 1.140625, "learning_rate": 0.0002445, "loss": 6.6432, "mean_token_accuracy": 0.12129139229655266, "num_tokens": 1133979.0, "step": 490 }, { "entropy": 6.83654465675354, "epoch": 0.00531954907418353, "grad_norm": 1.1875, "learning_rate": 0.000247, "loss": 6.646, "mean_token_accuracy": 0.11814743131399155, "num_tokens": 1145732.0, "step": 495 }, { "entropy": 6.817767333984375, "epoch": 0.0053732818931146765, "grad_norm": 1.25, "learning_rate": 0.0002495, "loss": 6.5869, "mean_token_accuracy": 0.12479080557823181, "num_tokens": 1156209.0, "step": 500 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1826806910976000.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }