{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.4142502071251036, "eval_steps": 500, "global_step": 500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.7426025390625, "epoch": 0.004142502071251036, "grad_norm": 4.96875, "learning_rate": 2e-06, "loss": 10.7521, "mean_token_accuracy": 9.009009227156639e-05, "num_tokens": 9149.0, "step": 5 }, { "entropy": 10.742637062072754, "epoch": 0.008285004142502071, "grad_norm": 5.3125, "learning_rate": 4.5e-06, "loss": 10.7074, "mean_token_accuracy": 0.0, "num_tokens": 16800.0, "step": 10 }, { "entropy": 10.742610836029053, "epoch": 0.012427506213753107, "grad_norm": 4.90625, "learning_rate": 7e-06, "loss": 10.743, "mean_token_accuracy": 0.0, "num_tokens": 26617.0, "step": 15 }, { "entropy": 10.742677021026612, "epoch": 0.016570008285004142, "grad_norm": 5.15625, "learning_rate": 9.5e-06, "loss": 10.6772, "mean_token_accuracy": 0.0, "num_tokens": 35855.0, "step": 20 }, { "entropy": 10.742655372619629, "epoch": 0.020712510356255178, "grad_norm": 4.40625, "learning_rate": 1.2e-05, "loss": 10.5975, "mean_token_accuracy": 0.002011376223526895, "num_tokens": 45644.0, "step": 25 }, { "entropy": 10.742458724975586, "epoch": 0.024855012427506214, "grad_norm": 3.859375, "learning_rate": 1.4500000000000002e-05, "loss": 10.4485, "mean_token_accuracy": 0.019727057497948407, "num_tokens": 54641.0, "step": 30 }, { "entropy": 10.741547870635987, "epoch": 0.02899751449875725, "grad_norm": 3.40625, "learning_rate": 1.7000000000000003e-05, "loss": 10.3138, "mean_token_accuracy": 0.04090950228273869, "num_tokens": 63924.0, "step": 35 }, { "entropy": 10.739116668701172, "epoch": 0.033140016570008285, "grad_norm": 2.609375, "learning_rate": 1.95e-05, "loss": 10.2108, "mean_token_accuracy": 0.041662289202213286, "num_tokens": 73452.0, "step": 40 }, { "entropy": 10.735450172424317, "epoch": 0.037282518641259324, "grad_norm": 2.203125, "learning_rate": 2.2e-05, "loss": 10.0929, "mean_token_accuracy": 0.039270054548978806, "num_tokens": 82731.0, "step": 45 }, { "entropy": 10.733051109313966, "epoch": 0.041425020712510356, "grad_norm": 2.171875, "learning_rate": 2.4500000000000003e-05, "loss": 10.0119, "mean_token_accuracy": 0.04254167750477791, "num_tokens": 92626.0, "step": 50 }, { "entropy": 10.732081508636474, "epoch": 0.045567522783761395, "grad_norm": 1.9921875, "learning_rate": 2.7e-05, "loss": 9.9713, "mean_token_accuracy": 0.04115805197507143, "num_tokens": 101380.0, "step": 55 }, { "entropy": 10.730613136291504, "epoch": 0.04971002485501243, "grad_norm": 1.828125, "learning_rate": 2.95e-05, "loss": 9.8815, "mean_token_accuracy": 0.041873040795326236, "num_tokens": 109895.0, "step": 60 }, { "entropy": 10.728298664093018, "epoch": 0.053852526926263466, "grad_norm": 1.9140625, "learning_rate": 3.2e-05, "loss": 9.8626, "mean_token_accuracy": 0.04000609517097473, "num_tokens": 119203.0, "step": 65 }, { "entropy": 10.7264967918396, "epoch": 0.0579950289975145, "grad_norm": 2.203125, "learning_rate": 3.4500000000000005e-05, "loss": 9.7547, "mean_token_accuracy": 0.03999764695763588, "num_tokens": 127572.0, "step": 70 }, { "entropy": 10.723791694641113, "epoch": 0.06213753106876554, "grad_norm": 1.796875, "learning_rate": 3.7e-05, "loss": 9.7222, "mean_token_accuracy": 0.042604190111160276, "num_tokens": 137161.0, "step": 75 }, { "entropy": 10.719281482696534, "epoch": 0.06628003314001657, "grad_norm": 1.84375, "learning_rate": 3.95e-05, "loss": 9.6617, "mean_token_accuracy": 0.04084589965641498, "num_tokens": 145991.0, "step": 80 }, { "entropy": 10.712574768066407, "epoch": 0.07042253521126761, "grad_norm": 1.796875, "learning_rate": 4.2000000000000004e-05, "loss": 9.598, "mean_token_accuracy": 0.041171186976134776, "num_tokens": 154927.0, "step": 85 }, { "entropy": 10.706455898284911, "epoch": 0.07456503728251865, "grad_norm": 1.953125, "learning_rate": 4.45e-05, "loss": 9.4593, "mean_token_accuracy": 0.042302171140909194, "num_tokens": 163234.0, "step": 90 }, { "entropy": 10.699676418304444, "epoch": 0.07870753935376967, "grad_norm": 1.8203125, "learning_rate": 4.7000000000000004e-05, "loss": 9.4018, "mean_token_accuracy": 0.04330670088529587, "num_tokens": 171554.0, "step": 95 }, { "entropy": 10.688521003723144, "epoch": 0.08285004142502071, "grad_norm": 1.8046875, "learning_rate": 4.9500000000000004e-05, "loss": 9.3311, "mean_token_accuracy": 0.047984727472066876, "num_tokens": 180171.0, "step": 100 }, { "entropy": 10.67230396270752, "epoch": 0.08699254349627175, "grad_norm": 1.8125, "learning_rate": 5.2e-05, "loss": 9.2155, "mean_token_accuracy": 0.057312173396348955, "num_tokens": 189216.0, "step": 105 }, { "entropy": 10.645287895202637, "epoch": 0.09113504556752279, "grad_norm": 1.71875, "learning_rate": 5.45e-05, "loss": 9.2219, "mean_token_accuracy": 0.052681009843945505, "num_tokens": 200022.0, "step": 110 }, { "entropy": 10.617320728302001, "epoch": 0.09527754763877382, "grad_norm": 1.828125, "learning_rate": 5.7e-05, "loss": 9.0422, "mean_token_accuracy": 0.05372999124228954, "num_tokens": 208686.0, "step": 115 }, { "entropy": 10.564020252227783, "epoch": 0.09942004971002485, "grad_norm": 1.8125, "learning_rate": 5.9499999999999996e-05, "loss": 8.9322, "mean_token_accuracy": 0.054267140850424764, "num_tokens": 218266.0, "step": 120 }, { "entropy": 10.5111478805542, "epoch": 0.1035625517812759, "grad_norm": 1.625, "learning_rate": 6.2e-05, "loss": 8.8288, "mean_token_accuracy": 0.04845710247755051, "num_tokens": 227658.0, "step": 125 }, { "entropy": 10.454801654815673, "epoch": 0.10770505385252693, "grad_norm": 1.5234375, "learning_rate": 6.450000000000001e-05, "loss": 8.6344, "mean_token_accuracy": 0.06026250720024109, "num_tokens": 236301.0, "step": 130 }, { "entropy": 10.368635272979736, "epoch": 0.11184755592377796, "grad_norm": 1.609375, "learning_rate": 6.7e-05, "loss": 8.644, "mean_token_accuracy": 0.048985954746603964, "num_tokens": 246355.0, "step": 135 }, { "entropy": 10.31434211730957, "epoch": 0.115990057995029, "grad_norm": 1.5, "learning_rate": 6.950000000000001e-05, "loss": 8.4805, "mean_token_accuracy": 0.05331834591925144, "num_tokens": 256023.0, "step": 140 }, { "entropy": 10.216940021514892, "epoch": 0.12013256006628004, "grad_norm": 1.4140625, "learning_rate": 7.2e-05, "loss": 8.4309, "mean_token_accuracy": 0.04547450765967369, "num_tokens": 266893.0, "step": 145 }, { "entropy": 10.09643030166626, "epoch": 0.12427506213753108, "grad_norm": 1.328125, "learning_rate": 7.45e-05, "loss": 8.1871, "mean_token_accuracy": 0.0535514272749424, "num_tokens": 276075.0, "step": 150 }, { "entropy": 9.940307807922363, "epoch": 0.12841756420878211, "grad_norm": 1.234375, "learning_rate": 7.7e-05, "loss": 8.1018, "mean_token_accuracy": 0.055915596336126326, "num_tokens": 285529.0, "step": 155 }, { "entropy": 9.774145030975342, "epoch": 0.13256006628003314, "grad_norm": 1.1328125, "learning_rate": 7.950000000000001e-05, "loss": 8.0263, "mean_token_accuracy": 0.05546179860830307, "num_tokens": 294403.0, "step": 160 }, { "entropy": 9.571882343292236, "epoch": 0.13670256835128416, "grad_norm": 1.109375, "learning_rate": 8.2e-05, "loss": 7.9661, "mean_token_accuracy": 0.05883818194270134, "num_tokens": 303507.0, "step": 165 }, { "entropy": 9.380561351776123, "epoch": 0.14084507042253522, "grad_norm": 1.15625, "learning_rate": 8.450000000000001e-05, "loss": 7.7977, "mean_token_accuracy": 0.06465772800147533, "num_tokens": 312393.0, "step": 170 }, { "entropy": 9.121123886108398, "epoch": 0.14498757249378624, "grad_norm": 0.88671875, "learning_rate": 8.7e-05, "loss": 7.7071, "mean_token_accuracy": 0.06362416185438632, "num_tokens": 321309.0, "step": 175 }, { "entropy": 8.919694709777833, "epoch": 0.1491300745650373, "grad_norm": 0.94140625, "learning_rate": 8.95e-05, "loss": 7.7209, "mean_token_accuracy": 0.06159159280359745, "num_tokens": 330217.0, "step": 180 }, { "entropy": 8.755216789245605, "epoch": 0.15327257663628832, "grad_norm": 0.98046875, "learning_rate": 9.2e-05, "loss": 7.6795, "mean_token_accuracy": 0.061438082903623584, "num_tokens": 339587.0, "step": 185 }, { "entropy": 8.5862530708313, "epoch": 0.15741507870753935, "grad_norm": 1.140625, "learning_rate": 9.45e-05, "loss": 7.5864, "mean_token_accuracy": 0.06275138966739177, "num_tokens": 349367.0, "step": 190 }, { "entropy": 8.414569091796874, "epoch": 0.1615575807787904, "grad_norm": 0.9296875, "learning_rate": 9.7e-05, "loss": 7.4852, "mean_token_accuracy": 0.06507482491433621, "num_tokens": 358272.0, "step": 195 }, { "entropy": 8.34211015701294, "epoch": 0.16570008285004142, "grad_norm": 0.92578125, "learning_rate": 9.95e-05, "loss": 7.6662, "mean_token_accuracy": 0.06489905305206775, "num_tokens": 367709.0, "step": 200 }, { "entropy": 8.344364166259766, "epoch": 0.16984258492129245, "grad_norm": 0.87109375, "learning_rate": 0.000102, "loss": 7.5038, "mean_token_accuracy": 0.06977917924523354, "num_tokens": 376180.0, "step": 205 }, { "entropy": 8.172031211853028, "epoch": 0.1739850869925435, "grad_norm": 0.84765625, "learning_rate": 0.00010449999999999999, "loss": 7.6071, "mean_token_accuracy": 0.06480413824319839, "num_tokens": 385636.0, "step": 210 }, { "entropy": 8.20558671951294, "epoch": 0.17812758906379453, "grad_norm": 0.91796875, "learning_rate": 0.000107, "loss": 7.4616, "mean_token_accuracy": 0.07232532948255539, "num_tokens": 394486.0, "step": 215 }, { "entropy": 8.116187858581544, "epoch": 0.18227009113504558, "grad_norm": 1.0, "learning_rate": 0.0001095, "loss": 7.4215, "mean_token_accuracy": 0.06673903428018094, "num_tokens": 403765.0, "step": 220 }, { "entropy": 8.066840410232544, "epoch": 0.1864125932062966, "grad_norm": 1.0859375, "learning_rate": 0.000112, "loss": 7.4037, "mean_token_accuracy": 0.07279244847595692, "num_tokens": 412988.0, "step": 225 }, { "entropy": 8.047943782806396, "epoch": 0.19055509527754763, "grad_norm": 0.80078125, "learning_rate": 0.0001145, "loss": 7.3598, "mean_token_accuracy": 0.07073828913271427, "num_tokens": 422096.0, "step": 230 }, { "entropy": 7.999078845977783, "epoch": 0.19469759734879868, "grad_norm": 1.078125, "learning_rate": 0.00011700000000000001, "loss": 7.441, "mean_token_accuracy": 0.06653320901095867, "num_tokens": 431333.0, "step": 235 }, { "entropy": 8.124928903579711, "epoch": 0.1988400994200497, "grad_norm": 1.1875, "learning_rate": 0.00011949999999999999, "loss": 7.4798, "mean_token_accuracy": 0.07552412785589695, "num_tokens": 440382.0, "step": 240 }, { "entropy": 7.967213916778564, "epoch": 0.20298260149130073, "grad_norm": 1.0, "learning_rate": 0.000122, "loss": 7.3739, "mean_token_accuracy": 0.07711177170276642, "num_tokens": 448469.0, "step": 245 }, { "entropy": 8.066874313354493, "epoch": 0.2071251035625518, "grad_norm": 1.3359375, "learning_rate": 0.0001245, "loss": 7.4382, "mean_token_accuracy": 0.07283047214150429, "num_tokens": 457356.0, "step": 250 }, { "entropy": 8.006765127182007, "epoch": 0.2112676056338028, "grad_norm": 0.9765625, "learning_rate": 0.000127, "loss": 7.4372, "mean_token_accuracy": 0.07371915206313133, "num_tokens": 465928.0, "step": 255 }, { "entropy": 7.962953233718872, "epoch": 0.21541010770505387, "grad_norm": 1.03125, "learning_rate": 0.0001295, "loss": 7.3086, "mean_token_accuracy": 0.07748371884226798, "num_tokens": 475269.0, "step": 260 }, { "entropy": 7.846234321594238, "epoch": 0.2195526097763049, "grad_norm": 0.89453125, "learning_rate": 0.000132, "loss": 7.2837, "mean_token_accuracy": 0.07470350190997124, "num_tokens": 485450.0, "step": 265 }, { "entropy": 7.911148262023926, "epoch": 0.22369511184755592, "grad_norm": 0.9765625, "learning_rate": 0.00013450000000000002, "loss": 7.3174, "mean_token_accuracy": 0.07727364040911197, "num_tokens": 494029.0, "step": 270 }, { "entropy": 7.862251615524292, "epoch": 0.22783761391880697, "grad_norm": 1.046875, "learning_rate": 0.00013700000000000002, "loss": 7.2856, "mean_token_accuracy": 0.07773918211460114, "num_tokens": 503253.0, "step": 275 }, { "entropy": 7.789915609359741, "epoch": 0.231980115990058, "grad_norm": 1.046875, "learning_rate": 0.0001395, "loss": 7.2873, "mean_token_accuracy": 0.07239806838333607, "num_tokens": 512857.0, "step": 280 }, { "entropy": 7.920849275588989, "epoch": 0.23612261806130902, "grad_norm": 0.93359375, "learning_rate": 0.00014199999999999998, "loss": 7.3294, "mean_token_accuracy": 0.07429277002811432, "num_tokens": 522319.0, "step": 285 }, { "entropy": 7.767004537582397, "epoch": 0.24026512013256007, "grad_norm": 0.953125, "learning_rate": 0.0001445, "loss": 7.2731, "mean_token_accuracy": 0.07617050744593143, "num_tokens": 531469.0, "step": 290 }, { "entropy": 7.817885971069336, "epoch": 0.2444076222038111, "grad_norm": 1.171875, "learning_rate": 0.000147, "loss": 7.2883, "mean_token_accuracy": 0.07853077799081802, "num_tokens": 540470.0, "step": 295 }, { "entropy": 7.739614582061767, "epoch": 0.24855012427506215, "grad_norm": 0.94921875, "learning_rate": 0.0001495, "loss": 7.2711, "mean_token_accuracy": 0.07688240185379983, "num_tokens": 550317.0, "step": 300 }, { "entropy": 7.804083776473999, "epoch": 0.2526926263463132, "grad_norm": 0.93359375, "learning_rate": 0.000152, "loss": 7.2542, "mean_token_accuracy": 0.07694350108504296, "num_tokens": 559409.0, "step": 305 }, { "entropy": 7.721450233459473, "epoch": 0.25683512841756423, "grad_norm": 1.015625, "learning_rate": 0.00015450000000000001, "loss": 7.2393, "mean_token_accuracy": 0.0897148072719574, "num_tokens": 568726.0, "step": 310 }, { "entropy": 7.8209740161895756, "epoch": 0.2609776304888152, "grad_norm": 1.3046875, "learning_rate": 0.000157, "loss": 7.26, "mean_token_accuracy": 0.07505979798734189, "num_tokens": 577926.0, "step": 315 }, { "entropy": 7.7856145858764645, "epoch": 0.2651201325600663, "grad_norm": 1.0703125, "learning_rate": 0.0001595, "loss": 7.2553, "mean_token_accuracy": 0.07944877073168755, "num_tokens": 586695.0, "step": 320 }, { "entropy": 7.730410480499268, "epoch": 0.26926263463131733, "grad_norm": 0.94140625, "learning_rate": 0.000162, "loss": 7.264, "mean_token_accuracy": 0.07737773731350898, "num_tokens": 596250.0, "step": 325 }, { "entropy": 7.764742994308472, "epoch": 0.27340513670256833, "grad_norm": 1.0390625, "learning_rate": 0.00016450000000000001, "loss": 7.2863, "mean_token_accuracy": 0.07472797855734825, "num_tokens": 605761.0, "step": 330 }, { "entropy": 7.720160007476807, "epoch": 0.2775476387738194, "grad_norm": 1.0390625, "learning_rate": 0.00016700000000000002, "loss": 7.2106, "mean_token_accuracy": 0.07840372547507286, "num_tokens": 614313.0, "step": 335 }, { "entropy": 7.699429607391357, "epoch": 0.28169014084507044, "grad_norm": 1.0546875, "learning_rate": 0.00016950000000000003, "loss": 7.2329, "mean_token_accuracy": 0.079537483304739, "num_tokens": 624470.0, "step": 340 }, { "entropy": 7.716359567642212, "epoch": 0.28583264291632143, "grad_norm": 1.015625, "learning_rate": 0.00017199999999999998, "loss": 7.1781, "mean_token_accuracy": 0.07983956411480904, "num_tokens": 633458.0, "step": 345 }, { "entropy": 7.705728006362915, "epoch": 0.2899751449875725, "grad_norm": 1.1796875, "learning_rate": 0.00017449999999999999, "loss": 7.1396, "mean_token_accuracy": 0.08111847266554832, "num_tokens": 643251.0, "step": 350 }, { "entropy": 7.584441757202148, "epoch": 0.29411764705882354, "grad_norm": 1.1640625, "learning_rate": 0.000177, "loss": 7.2011, "mean_token_accuracy": 0.08007878810167313, "num_tokens": 652005.0, "step": 355 }, { "entropy": 7.649393129348755, "epoch": 0.2982601491300746, "grad_norm": 1.0625, "learning_rate": 0.0001795, "loss": 7.0934, "mean_token_accuracy": 0.08189089968800545, "num_tokens": 661003.0, "step": 360 }, { "entropy": 7.623857879638672, "epoch": 0.3024026512013256, "grad_norm": 1.0625, "learning_rate": 0.000182, "loss": 7.0933, "mean_token_accuracy": 0.08178795203566551, "num_tokens": 670221.0, "step": 365 }, { "entropy": 7.750538110733032, "epoch": 0.30654515327257664, "grad_norm": 1.2109375, "learning_rate": 0.0001845, "loss": 7.3477, "mean_token_accuracy": 0.07552824206650258, "num_tokens": 680756.0, "step": 370 }, { "entropy": 7.595584869384766, "epoch": 0.3106876553438277, "grad_norm": 1.3828125, "learning_rate": 0.000187, "loss": 7.0678, "mean_token_accuracy": 0.08516154885292053, "num_tokens": 689641.0, "step": 375 }, { "entropy": 7.549710321426391, "epoch": 0.3148301574150787, "grad_norm": 1.09375, "learning_rate": 0.0001895, "loss": 6.995, "mean_token_accuracy": 0.0825497955083847, "num_tokens": 698209.0, "step": 380 }, { "entropy": 7.580410575866699, "epoch": 0.31897265948632975, "grad_norm": 1.0, "learning_rate": 0.000192, "loss": 6.9957, "mean_token_accuracy": 0.08926377072930336, "num_tokens": 706712.0, "step": 385 }, { "entropy": 7.595743894577026, "epoch": 0.3231151615575808, "grad_norm": 1.078125, "learning_rate": 0.0001945, "loss": 7.1863, "mean_token_accuracy": 0.08130085095763206, "num_tokens": 716087.0, "step": 390 }, { "entropy": 7.5478174686431885, "epoch": 0.3272576636288318, "grad_norm": 0.93359375, "learning_rate": 0.00019700000000000002, "loss": 7.0828, "mean_token_accuracy": 0.07734477743506432, "num_tokens": 725913.0, "step": 395 }, { "entropy": 7.606314182281494, "epoch": 0.33140016570008285, "grad_norm": 1.0703125, "learning_rate": 0.00019950000000000002, "loss": 7.1209, "mean_token_accuracy": 0.0859277956187725, "num_tokens": 735020.0, "step": 400 }, { "entropy": 7.527130556106568, "epoch": 0.3355426677713339, "grad_norm": 0.91796875, "learning_rate": 0.000202, "loss": 7.0165, "mean_token_accuracy": 0.07862741872668266, "num_tokens": 744299.0, "step": 405 }, { "entropy": 7.538954830169677, "epoch": 0.3396851698425849, "grad_norm": 1.1796875, "learning_rate": 0.00020449999999999998, "loss": 6.9993, "mean_token_accuracy": 0.08304714113473892, "num_tokens": 753231.0, "step": 410 }, { "entropy": 7.5157403469085695, "epoch": 0.34382767191383595, "grad_norm": 1.1796875, "learning_rate": 0.000207, "loss": 7.0619, "mean_token_accuracy": 0.08629989027976989, "num_tokens": 763043.0, "step": 415 }, { "entropy": 7.627204179763794, "epoch": 0.347970173985087, "grad_norm": 1.1875, "learning_rate": 0.0002095, "loss": 7.0861, "mean_token_accuracy": 0.08552133813500404, "num_tokens": 771977.0, "step": 420 }, { "entropy": 7.432950973510742, "epoch": 0.352112676056338, "grad_norm": 1.0703125, "learning_rate": 0.000212, "loss": 6.9878, "mean_token_accuracy": 0.08852855414152146, "num_tokens": 780285.0, "step": 425 }, { "entropy": 7.566639614105225, "epoch": 0.35625517812758906, "grad_norm": 1.0859375, "learning_rate": 0.0002145, "loss": 7.047, "mean_token_accuracy": 0.08173825293779373, "num_tokens": 789980.0, "step": 430 }, { "entropy": 7.483531761169433, "epoch": 0.3603976801988401, "grad_norm": 1.2890625, "learning_rate": 0.00021700000000000002, "loss": 7.0026, "mean_token_accuracy": 0.09233896881341934, "num_tokens": 798700.0, "step": 435 }, { "entropy": 7.38806381225586, "epoch": 0.36454018227009116, "grad_norm": 0.9765625, "learning_rate": 0.0002195, "loss": 7.059, "mean_token_accuracy": 0.08308355435729027, "num_tokens": 808758.0, "step": 440 }, { "entropy": 7.56745285987854, "epoch": 0.36868268434134216, "grad_norm": 1.1015625, "learning_rate": 0.000222, "loss": 7.0227, "mean_token_accuracy": 0.0889634720981121, "num_tokens": 817692.0, "step": 445 }, { "entropy": 7.4513147354125975, "epoch": 0.3728251864125932, "grad_norm": 0.96875, "learning_rate": 0.0002245, "loss": 7.074, "mean_token_accuracy": 0.09340473040938377, "num_tokens": 827052.0, "step": 450 }, { "entropy": 7.493870782852173, "epoch": 0.37696768848384427, "grad_norm": 0.9765625, "learning_rate": 0.00022700000000000002, "loss": 7.0443, "mean_token_accuracy": 0.09431338384747505, "num_tokens": 836442.0, "step": 455 }, { "entropy": 7.542994403839112, "epoch": 0.38111019055509526, "grad_norm": 1.03125, "learning_rate": 0.00022950000000000002, "loss": 6.9475, "mean_token_accuracy": 0.08114949613809586, "num_tokens": 846441.0, "step": 460 }, { "entropy": 7.422606658935547, "epoch": 0.3852526926263463, "grad_norm": 1.2578125, "learning_rate": 0.00023200000000000003, "loss": 6.9848, "mean_token_accuracy": 0.09037281647324562, "num_tokens": 856108.0, "step": 465 }, { "entropy": 7.409952163696289, "epoch": 0.38939519469759737, "grad_norm": 1.015625, "learning_rate": 0.00023449999999999998, "loss": 6.9198, "mean_token_accuracy": 0.08507395833730698, "num_tokens": 865788.0, "step": 470 }, { "entropy": 7.413805341720581, "epoch": 0.39353769676884837, "grad_norm": 1.1171875, "learning_rate": 0.000237, "loss": 6.9738, "mean_token_accuracy": 0.0836036428809166, "num_tokens": 874833.0, "step": 475 }, { "entropy": 7.285798835754394, "epoch": 0.3976801988400994, "grad_norm": 1.078125, "learning_rate": 0.0002395, "loss": 6.9254, "mean_token_accuracy": 0.08790519461035728, "num_tokens": 883685.0, "step": 480 }, { "entropy": 7.440755939483642, "epoch": 0.40182270091135047, "grad_norm": 1.1171875, "learning_rate": 0.000242, "loss": 6.9147, "mean_token_accuracy": 0.08789389207959175, "num_tokens": 893908.0, "step": 485 }, { "entropy": 7.403847885131836, "epoch": 0.40596520298260147, "grad_norm": 1.1328125, "learning_rate": 0.0002445, "loss": 7.0129, "mean_token_accuracy": 0.08363201320171357, "num_tokens": 903081.0, "step": 490 }, { "entropy": 7.289476585388184, "epoch": 0.4101077050538525, "grad_norm": 1.03125, "learning_rate": 0.000247, "loss": 6.8789, "mean_token_accuracy": 0.08956534340977669, "num_tokens": 912515.0, "step": 495 }, { "entropy": 7.4823840141296385, "epoch": 0.4142502071251036, "grad_norm": 0.90625, "learning_rate": 0.0002495, "loss": 6.8952, "mean_token_accuracy": 0.09587915241718292, "num_tokens": 921056.0, "step": 500 }, { "epoch": 0.4142502071251036, "eval_entropy": 7.1376285746153485, "eval_loss": 7.034562110900879, "eval_mean_token_accuracy": 0.08812946460839273, "eval_num_tokens": 921056.0, "eval_runtime": 2.122, "eval_samples_per_second": 1765.767, "eval_steps_per_second": 221.015, "step": 500 } ], "logging_steps": 5, "max_steps": 12060, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 204998070435840.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }