{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.2827254735651682, "eval_steps": 1000, "global_step": 1000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 4.838997936248779, "epoch": 0.0014136273678258412, "grad_norm": 13.1875, "learning_rate": 2e-06, "loss": 13.9198, "mean_token_accuracy": 0.0, "num_tokens": 4340.0, "step": 5 }, { "entropy": 4.843051767349243, "epoch": 0.0028272547356516823, "grad_norm": 14.0625, "learning_rate": 4.5e-06, "loss": 13.831, "mean_token_accuracy": 0.0, "num_tokens": 8692.0, "step": 10 }, { "entropy": 4.923465204238892, "epoch": 0.004240882103477523, "grad_norm": 16.75, "learning_rate": 7e-06, "loss": 13.4913, "mean_token_accuracy": 0.0, "num_tokens": 12453.0, "step": 15 }, { "entropy": 5.232606410980225, "epoch": 0.005654509471303365, "grad_norm": 26.25, "learning_rate": 9.5e-06, "loss": 12.9423, "mean_token_accuracy": 0.0, "num_tokens": 16439.0, "step": 20 }, { "entropy": 7.618780517578125, "epoch": 0.007068136839129205, "grad_norm": 17.75, "learning_rate": 1.2e-05, "loss": 11.494, "mean_token_accuracy": 0.0, "num_tokens": 20515.0, "step": 25 }, { "entropy": 10.471516036987305, "epoch": 0.008481764206955046, "grad_norm": 4.34375, "learning_rate": 1.4500000000000002e-05, "loss": 10.526, "mean_token_accuracy": 0.0, "num_tokens": 24336.0, "step": 30 }, { "entropy": 10.700703144073486, "epoch": 0.009895391574780888, "grad_norm": 3.8125, "learning_rate": 1.7000000000000003e-05, "loss": 10.3432, "mean_token_accuracy": 0.013547292444854975, "num_tokens": 28465.0, "step": 35 }, { "entropy": 10.689900112152099, "epoch": 0.01130901894260673, "grad_norm": 3.578125, "learning_rate": 1.95e-05, "loss": 9.9111, "mean_token_accuracy": 0.046335773542523384, "num_tokens": 32217.0, "step": 40 }, { "entropy": 10.446650981903076, "epoch": 0.01272264631043257, "grad_norm": 3.4375, "learning_rate": 2.2e-05, "loss": 9.6264, "mean_token_accuracy": 0.040803880989551546, "num_tokens": 36369.0, "step": 45 }, { "entropy": 10.473936176300048, "epoch": 0.01413627367825841, "grad_norm": 2.703125, "learning_rate": 2.4500000000000003e-05, "loss": 9.3506, "mean_token_accuracy": 0.04644691050052643, "num_tokens": 40227.0, "step": 50 }, { "entropy": 10.520126819610596, "epoch": 0.015549901046084252, "grad_norm": 2.21875, "learning_rate": 2.7e-05, "loss": 9.2423, "mean_token_accuracy": 0.060035499185323714, "num_tokens": 44266.0, "step": 55 }, { "entropy": 10.462940120697022, "epoch": 0.016963528413910092, "grad_norm": 2.3125, "learning_rate": 2.95e-05, "loss": 9.1768, "mean_token_accuracy": 0.05174140147864818, "num_tokens": 48187.0, "step": 60 }, { "entropy": 10.422643947601319, "epoch": 0.018377155781735936, "grad_norm": 2.203125, "learning_rate": 3.2e-05, "loss": 9.0365, "mean_token_accuracy": 0.04872686117887497, "num_tokens": 52252.0, "step": 65 }, { "entropy": 10.438050460815429, "epoch": 0.019790783149561775, "grad_norm": 2.40625, "learning_rate": 3.4500000000000005e-05, "loss": 8.9607, "mean_token_accuracy": 0.05605476088821888, "num_tokens": 56421.0, "step": 70 }, { "entropy": 10.400554084777832, "epoch": 0.021204410517387615, "grad_norm": 2.0625, "learning_rate": 3.7e-05, "loss": 8.878, "mean_token_accuracy": 0.06232075840234756, "num_tokens": 60341.0, "step": 75 }, { "entropy": 10.250280380249023, "epoch": 0.02261803788521346, "grad_norm": 2.28125, "learning_rate": 3.95e-05, "loss": 8.7283, "mean_token_accuracy": 0.062391096726059914, "num_tokens": 64465.0, "step": 80 }, { "entropy": 10.2134352684021, "epoch": 0.0240316652530393, "grad_norm": 1.84375, "learning_rate": 4.2000000000000004e-05, "loss": 8.7126, "mean_token_accuracy": 0.06613181754946709, "num_tokens": 68514.0, "step": 85 }, { "entropy": 10.055916213989258, "epoch": 0.02544529262086514, "grad_norm": 1.84375, "learning_rate": 4.45e-05, "loss": 8.5801, "mean_token_accuracy": 0.06724648177623749, "num_tokens": 72661.0, "step": 90 }, { "entropy": 9.991343212127685, "epoch": 0.02685891998869098, "grad_norm": 1.8203125, "learning_rate": 4.7000000000000004e-05, "loss": 8.4773, "mean_token_accuracy": 0.0715904712677002, "num_tokens": 76698.0, "step": 95 }, { "entropy": 9.897418022155762, "epoch": 0.02827254735651682, "grad_norm": 1.8203125, "learning_rate": 4.9500000000000004e-05, "loss": 8.3786, "mean_token_accuracy": 0.06964126601815224, "num_tokens": 80732.0, "step": 100 }, { "entropy": 9.81051197052002, "epoch": 0.029686174724342665, "grad_norm": 1.6875, "learning_rate": 5.2e-05, "loss": 8.2664, "mean_token_accuracy": 0.07291285954415798, "num_tokens": 84797.0, "step": 105 }, { "entropy": 9.750697708129882, "epoch": 0.031099802092168505, "grad_norm": 1.734375, "learning_rate": 5.45e-05, "loss": 8.1699, "mean_token_accuracy": 0.06931682229042054, "num_tokens": 88758.0, "step": 110 }, { "entropy": 9.548874855041504, "epoch": 0.032513429459994345, "grad_norm": 1.3671875, "learning_rate": 5.7e-05, "loss": 8.0496, "mean_token_accuracy": 0.07683553956449032, "num_tokens": 92722.0, "step": 115 }, { "entropy": 9.418696975708007, "epoch": 0.033927056827820185, "grad_norm": 1.515625, "learning_rate": 5.9499999999999996e-05, "loss": 7.8938, "mean_token_accuracy": 0.07645067945122719, "num_tokens": 96602.0, "step": 120 }, { "entropy": 9.192409229278564, "epoch": 0.035340684195646024, "grad_norm": 1.40625, "learning_rate": 6.2e-05, "loss": 7.831, "mean_token_accuracy": 0.07514876201748848, "num_tokens": 100598.0, "step": 125 }, { "entropy": 9.073713493347167, "epoch": 0.03675431156347187, "grad_norm": 1.3515625, "learning_rate": 6.450000000000001e-05, "loss": 7.734, "mean_token_accuracy": 0.07320134155452251, "num_tokens": 104460.0, "step": 130 }, { "entropy": 8.958717918395996, "epoch": 0.03816793893129771, "grad_norm": 1.421875, "learning_rate": 6.7e-05, "loss": 7.6242, "mean_token_accuracy": 0.07055199854075908, "num_tokens": 108360.0, "step": 135 }, { "entropy": 8.655115032196045, "epoch": 0.03958156629912355, "grad_norm": 1.296875, "learning_rate": 6.950000000000001e-05, "loss": 7.5081, "mean_token_accuracy": 0.07828053757548332, "num_tokens": 112176.0, "step": 140 }, { "entropy": 8.63590440750122, "epoch": 0.04099519366694939, "grad_norm": 1.484375, "learning_rate": 7.2e-05, "loss": 7.6179, "mean_token_accuracy": 0.06859740577638149, "num_tokens": 116192.0, "step": 145 }, { "entropy": 8.526045417785644, "epoch": 0.04240882103477523, "grad_norm": 1.2109375, "learning_rate": 7.45e-05, "loss": 7.5008, "mean_token_accuracy": 0.06685782484710216, "num_tokens": 120221.0, "step": 150 }, { "entropy": 8.428415966033935, "epoch": 0.04382244840260108, "grad_norm": 1.1953125, "learning_rate": 7.7e-05, "loss": 7.5019, "mean_token_accuracy": 0.06606126651167869, "num_tokens": 124364.0, "step": 155 }, { "entropy": 8.274092197418213, "epoch": 0.04523607577042692, "grad_norm": 1.1171875, "learning_rate": 7.950000000000001e-05, "loss": 7.3469, "mean_token_accuracy": 0.08038331940770149, "num_tokens": 128266.0, "step": 160 }, { "entropy": 8.154208850860595, "epoch": 0.04664970313825276, "grad_norm": 1.1015625, "learning_rate": 8.2e-05, "loss": 7.3261, "mean_token_accuracy": 0.07359547801315784, "num_tokens": 131985.0, "step": 165 }, { "entropy": 8.039358854293823, "epoch": 0.0480633305060786, "grad_norm": 1.109375, "learning_rate": 8.450000000000001e-05, "loss": 7.2318, "mean_token_accuracy": 0.08298368901014327, "num_tokens": 135892.0, "step": 170 }, { "entropy": 7.960572910308838, "epoch": 0.04947695787390444, "grad_norm": 1.21875, "learning_rate": 8.7e-05, "loss": 7.3743, "mean_token_accuracy": 0.07648940533399581, "num_tokens": 139937.0, "step": 175 }, { "entropy": 8.018472337722779, "epoch": 0.05089058524173028, "grad_norm": 1.1875, "learning_rate": 8.95e-05, "loss": 7.1981, "mean_token_accuracy": 0.08083997145295144, "num_tokens": 143659.0, "step": 180 }, { "entropy": 7.916880559921265, "epoch": 0.052304212609556124, "grad_norm": 1.2734375, "learning_rate": 9.2e-05, "loss": 7.3147, "mean_token_accuracy": 0.08173628598451614, "num_tokens": 147394.0, "step": 185 }, { "entropy": 7.840789651870727, "epoch": 0.05371783997738196, "grad_norm": 1.265625, "learning_rate": 9.45e-05, "loss": 7.1724, "mean_token_accuracy": 0.08405760079622268, "num_tokens": 151082.0, "step": 190 }, { "entropy": 7.727948999404907, "epoch": 0.0551314673452078, "grad_norm": 1.34375, "learning_rate": 9.7e-05, "loss": 7.1786, "mean_token_accuracy": 0.08063250184059143, "num_tokens": 155099.0, "step": 195 }, { "entropy": 7.822998285293579, "epoch": 0.05654509471303364, "grad_norm": 1.140625, "learning_rate": 9.95e-05, "loss": 7.3548, "mean_token_accuracy": 0.07048202715814114, "num_tokens": 159297.0, "step": 200 }, { "entropy": 7.713145303726196, "epoch": 0.05795872208085948, "grad_norm": 1.3515625, "learning_rate": 0.000102, "loss": 7.2237, "mean_token_accuracy": 0.07353744581341744, "num_tokens": 163337.0, "step": 205 }, { "entropy": 7.855460119247437, "epoch": 0.05937234944868533, "grad_norm": 1.125, "learning_rate": 0.00010449999999999999, "loss": 7.277, "mean_token_accuracy": 0.08301040753722191, "num_tokens": 167440.0, "step": 210 }, { "entropy": 7.675248670578003, "epoch": 0.06078597681651117, "grad_norm": 1.234375, "learning_rate": 0.000107, "loss": 7.1489, "mean_token_accuracy": 0.08562113344669342, "num_tokens": 171238.0, "step": 215 }, { "entropy": 7.707080364227295, "epoch": 0.06219960418433701, "grad_norm": 1.1953125, "learning_rate": 0.0001095, "loss": 7.2134, "mean_token_accuracy": 0.07360663190484047, "num_tokens": 175476.0, "step": 220 }, { "entropy": 7.5691710948944095, "epoch": 0.06361323155216285, "grad_norm": 1.484375, "learning_rate": 0.000112, "loss": 7.1273, "mean_token_accuracy": 0.08262931331992149, "num_tokens": 179398.0, "step": 225 }, { "entropy": 7.5606465339660645, "epoch": 0.06502685891998869, "grad_norm": 1.171875, "learning_rate": 0.0001145, "loss": 7.1102, "mean_token_accuracy": 0.08324644044041633, "num_tokens": 183355.0, "step": 230 }, { "entropy": 7.605392646789551, "epoch": 0.06644048628781453, "grad_norm": 1.296875, "learning_rate": 0.00011700000000000001, "loss": 7.12, "mean_token_accuracy": 0.07809790521860123, "num_tokens": 187278.0, "step": 235 }, { "entropy": 7.519303512573242, "epoch": 0.06785411365564037, "grad_norm": 1.484375, "learning_rate": 0.00011949999999999999, "loss": 7.1402, "mean_token_accuracy": 0.0761954978108406, "num_tokens": 191136.0, "step": 240 }, { "entropy": 7.577075338363647, "epoch": 0.06926774102346621, "grad_norm": 1.78125, "learning_rate": 0.000122, "loss": 7.2122, "mean_token_accuracy": 0.08024812079966068, "num_tokens": 195096.0, "step": 245 }, { "entropy": 7.606031370162964, "epoch": 0.07068136839129205, "grad_norm": 1.3046875, "learning_rate": 0.0001245, "loss": 7.2001, "mean_token_accuracy": 0.07799483351409435, "num_tokens": 199483.0, "step": 250 }, { "entropy": 7.643957281112671, "epoch": 0.0720949957591179, "grad_norm": 1.6328125, "learning_rate": 0.000127, "loss": 7.1263, "mean_token_accuracy": 0.08172452189028263, "num_tokens": 203515.0, "step": 255 }, { "entropy": 7.497114038467407, "epoch": 0.07350862312694374, "grad_norm": 1.7578125, "learning_rate": 0.0001295, "loss": 7.1289, "mean_token_accuracy": 0.07867333814501762, "num_tokens": 207451.0, "step": 260 }, { "entropy": 7.548718070983886, "epoch": 0.07492225049476958, "grad_norm": 1.3359375, "learning_rate": 0.000132, "loss": 7.0456, "mean_token_accuracy": 0.08255640640854836, "num_tokens": 211507.0, "step": 265 }, { "entropy": 7.439682149887085, "epoch": 0.07633587786259542, "grad_norm": 1.3125, "learning_rate": 0.00013450000000000002, "loss": 7.1149, "mean_token_accuracy": 0.08738862499594688, "num_tokens": 215236.0, "step": 270 }, { "entropy": 7.497509336471557, "epoch": 0.07774950523042126, "grad_norm": 1.4765625, "learning_rate": 0.00013700000000000002, "loss": 7.0841, "mean_token_accuracy": 0.08626129925251007, "num_tokens": 218934.0, "step": 275 }, { "entropy": 7.530088710784912, "epoch": 0.0791631325982471, "grad_norm": 1.4921875, "learning_rate": 0.0001395, "loss": 7.031, "mean_token_accuracy": 0.08123192861676216, "num_tokens": 223185.0, "step": 280 }, { "entropy": 7.557523965835571, "epoch": 0.08057675996607294, "grad_norm": 1.96875, "learning_rate": 0.00014199999999999998, "loss": 7.1551, "mean_token_accuracy": 0.07593904286623002, "num_tokens": 227044.0, "step": 285 }, { "entropy": 7.449309587478638, "epoch": 0.08199038733389878, "grad_norm": 1.1015625, "learning_rate": 0.0001445, "loss": 7.0628, "mean_token_accuracy": 0.09167415499687195, "num_tokens": 231359.0, "step": 290 }, { "entropy": 7.531680345535278, "epoch": 0.08340401470172462, "grad_norm": 1.3125, "learning_rate": 0.000147, "loss": 7.0471, "mean_token_accuracy": 0.08983734510838985, "num_tokens": 235224.0, "step": 295 }, { "entropy": 7.344621992111206, "epoch": 0.08481764206955046, "grad_norm": 1.7890625, "learning_rate": 0.0001495, "loss": 6.905, "mean_token_accuracy": 0.09648748189210891, "num_tokens": 239119.0, "step": 300 }, { "entropy": 7.288154172897339, "epoch": 0.0862312694373763, "grad_norm": 1.4140625, "learning_rate": 0.000152, "loss": 7.0089, "mean_token_accuracy": 0.0949060007929802, "num_tokens": 243275.0, "step": 305 }, { "entropy": 7.433500814437866, "epoch": 0.08764489680520215, "grad_norm": 1.2890625, "learning_rate": 0.00015450000000000001, "loss": 7.0206, "mean_token_accuracy": 0.09643495455384254, "num_tokens": 247415.0, "step": 310 }, { "entropy": 7.416780138015747, "epoch": 0.089058524173028, "grad_norm": 1.453125, "learning_rate": 0.000157, "loss": 7.0159, "mean_token_accuracy": 0.08751917779445648, "num_tokens": 251575.0, "step": 315 }, { "entropy": 7.372589826583862, "epoch": 0.09047215154085383, "grad_norm": 1.8671875, "learning_rate": 0.0001595, "loss": 6.9997, "mean_token_accuracy": 0.08504554927349091, "num_tokens": 255686.0, "step": 320 }, { "entropy": 7.3249767303466795, "epoch": 0.09188577890867967, "grad_norm": 1.2890625, "learning_rate": 0.000162, "loss": 6.9852, "mean_token_accuracy": 0.09507602602243423, "num_tokens": 259850.0, "step": 325 }, { "entropy": 7.423571062088013, "epoch": 0.09329940627650551, "grad_norm": 1.421875, "learning_rate": 0.00016450000000000001, "loss": 7.0103, "mean_token_accuracy": 0.09533059746026992, "num_tokens": 264043.0, "step": 330 }, { "entropy": 7.514725065231323, "epoch": 0.09471303364433135, "grad_norm": 1.3828125, "learning_rate": 0.00016700000000000002, "loss": 7.0725, "mean_token_accuracy": 0.08970947004854679, "num_tokens": 268296.0, "step": 335 }, { "entropy": 7.174638795852661, "epoch": 0.0961266610121572, "grad_norm": 2.28125, "learning_rate": 0.00016950000000000003, "loss": 6.8961, "mean_token_accuracy": 0.09778379574418068, "num_tokens": 272062.0, "step": 340 }, { "entropy": 7.25974817276001, "epoch": 0.09754028837998303, "grad_norm": 1.28125, "learning_rate": 0.00017199999999999998, "loss": 6.8514, "mean_token_accuracy": 0.10595791339874268, "num_tokens": 275936.0, "step": 345 }, { "entropy": 7.272134685516358, "epoch": 0.09895391574780887, "grad_norm": 1.640625, "learning_rate": 0.00017449999999999999, "loss": 6.8802, "mean_token_accuracy": 0.10179490596055984, "num_tokens": 279526.0, "step": 350 }, { "entropy": 7.339320135116577, "epoch": 0.10036754311563471, "grad_norm": 1.34375, "learning_rate": 0.000177, "loss": 6.9552, "mean_token_accuracy": 0.0998102031648159, "num_tokens": 283577.0, "step": 355 }, { "entropy": 7.324524545669556, "epoch": 0.10178117048346055, "grad_norm": 1.4609375, "learning_rate": 0.0001795, "loss": 6.7984, "mean_token_accuracy": 0.101173298060894, "num_tokens": 287377.0, "step": 360 }, { "entropy": 7.140333604812622, "epoch": 0.10319479785128641, "grad_norm": 1.28125, "learning_rate": 0.000182, "loss": 6.973, "mean_token_accuracy": 0.09467578828334808, "num_tokens": 291582.0, "step": 365 }, { "entropy": 7.392356729507446, "epoch": 0.10460842521911225, "grad_norm": 1.328125, "learning_rate": 0.0001845, "loss": 6.8489, "mean_token_accuracy": 0.0993436373770237, "num_tokens": 295608.0, "step": 370 }, { "entropy": 7.154901552200317, "epoch": 0.10602205258693809, "grad_norm": 1.4609375, "learning_rate": 0.000187, "loss": 6.872, "mean_token_accuracy": 0.1050638273358345, "num_tokens": 299660.0, "step": 375 }, { "entropy": 7.05282769203186, "epoch": 0.10743567995476393, "grad_norm": 1.3828125, "learning_rate": 0.0001895, "loss": 6.7846, "mean_token_accuracy": 0.11004708558321, "num_tokens": 303412.0, "step": 380 }, { "entropy": 7.143272113800049, "epoch": 0.10884930732258977, "grad_norm": 1.5546875, "learning_rate": 0.000192, "loss": 6.8498, "mean_token_accuracy": 0.10617732927203179, "num_tokens": 307352.0, "step": 385 }, { "entropy": 7.2218762874603275, "epoch": 0.1102629346904156, "grad_norm": 1.5859375, "learning_rate": 0.0001945, "loss": 6.9129, "mean_token_accuracy": 0.10999525636434555, "num_tokens": 311418.0, "step": 390 }, { "entropy": 7.1364624977111815, "epoch": 0.11167656205824145, "grad_norm": 1.578125, "learning_rate": 0.00019700000000000002, "loss": 6.7597, "mean_token_accuracy": 0.11771088987588882, "num_tokens": 315150.0, "step": 395 }, { "entropy": 7.207963132858277, "epoch": 0.11309018942606729, "grad_norm": 1.6796875, "learning_rate": 0.00019950000000000002, "loss": 6.9407, "mean_token_accuracy": 0.10095959007740021, "num_tokens": 318898.0, "step": 400 }, { "entropy": 7.126479911804199, "epoch": 0.11450381679389313, "grad_norm": 1.515625, "learning_rate": 0.000202, "loss": 6.7726, "mean_token_accuracy": 0.11357507780194283, "num_tokens": 322495.0, "step": 405 }, { "entropy": 7.224441242218018, "epoch": 0.11591744416171897, "grad_norm": 1.2890625, "learning_rate": 0.00020449999999999998, "loss": 6.8993, "mean_token_accuracy": 0.11550437733530998, "num_tokens": 326473.0, "step": 410 }, { "entropy": 7.140273571014404, "epoch": 0.1173310715295448, "grad_norm": 1.3515625, "learning_rate": 0.000207, "loss": 6.8522, "mean_token_accuracy": 0.10760911256074905, "num_tokens": 330393.0, "step": 415 }, { "entropy": 7.134380578994751, "epoch": 0.11874469889737066, "grad_norm": 1.359375, "learning_rate": 0.0002095, "loss": 6.7692, "mean_token_accuracy": 0.11172740682959556, "num_tokens": 334449.0, "step": 420 }, { "entropy": 7.2949425220489506, "epoch": 0.1201583262651965, "grad_norm": 1.4375, "learning_rate": 0.000212, "loss": 6.9219, "mean_token_accuracy": 0.10026353597640991, "num_tokens": 338740.0, "step": 425 }, { "entropy": 7.066179800033569, "epoch": 0.12157195363302234, "grad_norm": 1.546875, "learning_rate": 0.0002145, "loss": 6.7336, "mean_token_accuracy": 0.11876392140984535, "num_tokens": 342429.0, "step": 430 }, { "entropy": 7.117091083526612, "epoch": 0.12298558100084818, "grad_norm": 1.421875, "learning_rate": 0.00021700000000000002, "loss": 6.7741, "mean_token_accuracy": 0.12331236079335213, "num_tokens": 346218.0, "step": 435 }, { "entropy": 7.182254219055176, "epoch": 0.12439920836867402, "grad_norm": 1.4140625, "learning_rate": 0.0002195, "loss": 6.7754, "mean_token_accuracy": 0.11808006688952447, "num_tokens": 350310.0, "step": 440 }, { "entropy": 7.058240985870361, "epoch": 0.12581283573649985, "grad_norm": 1.4765625, "learning_rate": 0.000222, "loss": 6.7434, "mean_token_accuracy": 0.12305478826165199, "num_tokens": 353952.0, "step": 445 }, { "entropy": 7.198861885070801, "epoch": 0.1272264631043257, "grad_norm": 1.875, "learning_rate": 0.0002245, "loss": 6.9148, "mean_token_accuracy": 0.11514305397868156, "num_tokens": 357667.0, "step": 450 }, { "entropy": 7.127170419692993, "epoch": 0.12864009047215155, "grad_norm": 1.296875, "learning_rate": 0.00022700000000000002, "loss": 6.7165, "mean_token_accuracy": 0.12080714330077172, "num_tokens": 361309.0, "step": 455 }, { "entropy": 6.963030576705933, "epoch": 0.13005371783997738, "grad_norm": 1.40625, "learning_rate": 0.00022950000000000002, "loss": 6.7651, "mean_token_accuracy": 0.13394678458571435, "num_tokens": 365099.0, "step": 460 }, { "entropy": 7.293617916107178, "epoch": 0.13146734520780323, "grad_norm": 1.53125, "learning_rate": 0.00023200000000000003, "loss": 6.8263, "mean_token_accuracy": 0.11883056983351707, "num_tokens": 369141.0, "step": 465 }, { "entropy": 7.0113513469696045, "epoch": 0.13288097257562906, "grad_norm": 1.46875, "learning_rate": 0.00023449999999999998, "loss": 6.7673, "mean_token_accuracy": 0.11753190383315086, "num_tokens": 373128.0, "step": 470 }, { "entropy": 7.056188488006592, "epoch": 0.1342945999434549, "grad_norm": 1.4609375, "learning_rate": 0.000237, "loss": 6.7551, "mean_token_accuracy": 0.12295122221112251, "num_tokens": 377103.0, "step": 475 }, { "entropy": 7.010499048233032, "epoch": 0.13570822731128074, "grad_norm": 1.59375, "learning_rate": 0.0002395, "loss": 6.8054, "mean_token_accuracy": 0.11294787377119064, "num_tokens": 381573.0, "step": 480 }, { "entropy": 7.241208553314209, "epoch": 0.1371218546791066, "grad_norm": 1.328125, "learning_rate": 0.000242, "loss": 6.8248, "mean_token_accuracy": 0.12627912536263466, "num_tokens": 385759.0, "step": 485 }, { "entropy": 6.94762954711914, "epoch": 0.13853548204693242, "grad_norm": 1.421875, "learning_rate": 0.0002445, "loss": 6.7048, "mean_token_accuracy": 0.12667714580893516, "num_tokens": 389700.0, "step": 490 }, { "entropy": 7.064765691757202, "epoch": 0.13994910941475827, "grad_norm": 1.4921875, "learning_rate": 0.000247, "loss": 6.6205, "mean_token_accuracy": 0.12440077215433121, "num_tokens": 393279.0, "step": 495 }, { "entropy": 7.031151533126831, "epoch": 0.1413627367825841, "grad_norm": 1.5546875, "learning_rate": 0.0002495, "loss": 6.725, "mean_token_accuracy": 0.12710191905498505, "num_tokens": 397379.0, "step": 500 }, { "entropy": 6.966974687576294, "epoch": 0.14277636415040995, "grad_norm": 1.3671875, "learning_rate": 0.000252, "loss": 6.7762, "mean_token_accuracy": 0.12484551221132278, "num_tokens": 401349.0, "step": 505 }, { "entropy": 7.063830709457397, "epoch": 0.1441899915182358, "grad_norm": 1.3671875, "learning_rate": 0.0002545, "loss": 6.6911, "mean_token_accuracy": 0.12564558237791063, "num_tokens": 405361.0, "step": 510 }, { "entropy": 6.972732162475586, "epoch": 0.14560361888606163, "grad_norm": 1.6171875, "learning_rate": 0.000257, "loss": 6.726, "mean_token_accuracy": 0.12524131089448928, "num_tokens": 409614.0, "step": 515 }, { "entropy": 6.847900104522705, "epoch": 0.14701724625388748, "grad_norm": 1.4375, "learning_rate": 0.0002595, "loss": 6.6623, "mean_token_accuracy": 0.13759828507900237, "num_tokens": 413529.0, "step": 520 }, { "entropy": 6.994072675704956, "epoch": 0.1484308736217133, "grad_norm": 1.5234375, "learning_rate": 0.000262, "loss": 6.6178, "mean_token_accuracy": 0.12413196116685868, "num_tokens": 417365.0, "step": 525 }, { "entropy": 6.847810077667236, "epoch": 0.14984450098953916, "grad_norm": 1.5234375, "learning_rate": 0.00026450000000000003, "loss": 6.6269, "mean_token_accuracy": 0.1389990709722042, "num_tokens": 421232.0, "step": 530 }, { "entropy": 7.125303459167481, "epoch": 0.151258128357365, "grad_norm": 1.6015625, "learning_rate": 0.00026700000000000004, "loss": 6.7183, "mean_token_accuracy": 0.12456061840057372, "num_tokens": 425503.0, "step": 535 }, { "entropy": 6.852126216888427, "epoch": 0.15267175572519084, "grad_norm": 1.3828125, "learning_rate": 0.00026950000000000005, "loss": 6.7542, "mean_token_accuracy": 0.12805211022496224, "num_tokens": 429770.0, "step": 540 }, { "entropy": 7.0629345893859865, "epoch": 0.15408538309301667, "grad_norm": 1.625, "learning_rate": 0.00027200000000000005, "loss": 6.6387, "mean_token_accuracy": 0.13042709827423096, "num_tokens": 433657.0, "step": 545 }, { "entropy": 6.941704559326172, "epoch": 0.15549901046084252, "grad_norm": 1.453125, "learning_rate": 0.0002745, "loss": 6.7511, "mean_token_accuracy": 0.1230709470808506, "num_tokens": 437732.0, "step": 550 }, { "entropy": 6.886470556259155, "epoch": 0.15691263782866835, "grad_norm": 1.3828125, "learning_rate": 0.000277, "loss": 6.4963, "mean_token_accuracy": 0.13797944858670236, "num_tokens": 441866.0, "step": 555 }, { "entropy": 6.786446952819825, "epoch": 0.1583262651964942, "grad_norm": 1.46875, "learning_rate": 0.0002795, "loss": 6.5783, "mean_token_accuracy": 0.1337943233549595, "num_tokens": 445437.0, "step": 560 }, { "entropy": 6.786550521850586, "epoch": 0.15973989256432006, "grad_norm": 1.6953125, "learning_rate": 0.00028199999999999997, "loss": 6.564, "mean_token_accuracy": 0.13779796212911605, "num_tokens": 449602.0, "step": 565 }, { "entropy": 6.764790821075439, "epoch": 0.16115351993214588, "grad_norm": 1.3203125, "learning_rate": 0.0002845, "loss": 6.4694, "mean_token_accuracy": 0.13991471529006957, "num_tokens": 453140.0, "step": 570 }, { "entropy": 6.97475233078003, "epoch": 0.16256714729997174, "grad_norm": 1.53125, "learning_rate": 0.000287, "loss": 6.7096, "mean_token_accuracy": 0.12624734565615653, "num_tokens": 457210.0, "step": 575 }, { "entropy": 7.009247064590454, "epoch": 0.16398077466779756, "grad_norm": 1.4140625, "learning_rate": 0.0002895, "loss": 6.6826, "mean_token_accuracy": 0.12368027344346047, "num_tokens": 461534.0, "step": 580 }, { "entropy": 6.9301024913787845, "epoch": 0.16539440203562342, "grad_norm": 1.6484375, "learning_rate": 0.000292, "loss": 6.4802, "mean_token_accuracy": 0.13896113261580467, "num_tokens": 465055.0, "step": 585 }, { "entropy": 6.829527807235718, "epoch": 0.16680802940344924, "grad_norm": 1.6796875, "learning_rate": 0.0002945, "loss": 6.5188, "mean_token_accuracy": 0.13359609320759774, "num_tokens": 469133.0, "step": 590 }, { "entropy": 6.923969316482544, "epoch": 0.1682216567712751, "grad_norm": 1.4453125, "learning_rate": 0.000297, "loss": 6.6646, "mean_token_accuracy": 0.1328178010880947, "num_tokens": 473078.0, "step": 595 }, { "entropy": 6.906017303466797, "epoch": 0.16963528413910092, "grad_norm": 1.3671875, "learning_rate": 0.0002995, "loss": 6.5999, "mean_token_accuracy": 0.13147619739174843, "num_tokens": 476988.0, "step": 600 }, { "entropy": 6.845853567123413, "epoch": 0.17104891150692678, "grad_norm": 1.40625, "learning_rate": 0.000302, "loss": 6.4638, "mean_token_accuracy": 0.13877335488796233, "num_tokens": 481170.0, "step": 605 }, { "entropy": 6.808208322525024, "epoch": 0.1724625388747526, "grad_norm": 1.75, "learning_rate": 0.0003045, "loss": 6.4607, "mean_token_accuracy": 0.12855389714241028, "num_tokens": 484853.0, "step": 610 }, { "entropy": 6.694374704360962, "epoch": 0.17387616624257846, "grad_norm": 1.5703125, "learning_rate": 0.000307, "loss": 6.5042, "mean_token_accuracy": 0.14368257224559783, "num_tokens": 488550.0, "step": 615 }, { "entropy": 6.714710140228272, "epoch": 0.1752897936104043, "grad_norm": 1.5, "learning_rate": 0.0003095, "loss": 6.5511, "mean_token_accuracy": 0.1393193356692791, "num_tokens": 492621.0, "step": 620 }, { "entropy": 6.823784923553466, "epoch": 0.17670342097823014, "grad_norm": 1.5703125, "learning_rate": 0.000312, "loss": 6.4969, "mean_token_accuracy": 0.12763671800494195, "num_tokens": 496627.0, "step": 625 }, { "entropy": 6.75352110862732, "epoch": 0.178117048346056, "grad_norm": 1.421875, "learning_rate": 0.0003145, "loss": 6.5534, "mean_token_accuracy": 0.13516684994101524, "num_tokens": 500794.0, "step": 630 }, { "entropy": 6.771178388595581, "epoch": 0.17953067571388182, "grad_norm": 1.4765625, "learning_rate": 0.000317, "loss": 6.5715, "mean_token_accuracy": 0.1311728797852993, "num_tokens": 504672.0, "step": 635 }, { "entropy": 6.785078620910644, "epoch": 0.18094430308170767, "grad_norm": 1.3515625, "learning_rate": 0.0003195, "loss": 6.4995, "mean_token_accuracy": 0.14259493052959443, "num_tokens": 508834.0, "step": 640 }, { "entropy": 6.843728113174438, "epoch": 0.1823579304495335, "grad_norm": 1.4921875, "learning_rate": 0.000322, "loss": 6.4686, "mean_token_accuracy": 0.13577061742544175, "num_tokens": 512722.0, "step": 645 }, { "entropy": 6.774205303192138, "epoch": 0.18377155781735935, "grad_norm": 1.5546875, "learning_rate": 0.00032450000000000003, "loss": 6.5824, "mean_token_accuracy": 0.13288535103201865, "num_tokens": 517270.0, "step": 650 }, { "entropy": 6.76011438369751, "epoch": 0.18518518518518517, "grad_norm": 1.7421875, "learning_rate": 0.00032700000000000003, "loss": 6.5048, "mean_token_accuracy": 0.14277215600013732, "num_tokens": 521438.0, "step": 655 }, { "entropy": 6.762216997146607, "epoch": 0.18659881255301103, "grad_norm": 1.3828125, "learning_rate": 0.00032950000000000004, "loss": 6.4822, "mean_token_accuracy": 0.1396136611700058, "num_tokens": 525890.0, "step": 660 }, { "entropy": 6.725051021575927, "epoch": 0.18801243992083685, "grad_norm": 1.3828125, "learning_rate": 0.00033200000000000005, "loss": 6.4927, "mean_token_accuracy": 0.14150392562150954, "num_tokens": 529775.0, "step": 665 }, { "entropy": 6.711924600601196, "epoch": 0.1894260672886627, "grad_norm": 1.515625, "learning_rate": 0.00033450000000000005, "loss": 6.4771, "mean_token_accuracy": 0.14005500972270965, "num_tokens": 533889.0, "step": 670 }, { "entropy": 6.584859466552734, "epoch": 0.19083969465648856, "grad_norm": 1.296875, "learning_rate": 0.000337, "loss": 6.402, "mean_token_accuracy": 0.1481585830450058, "num_tokens": 537701.0, "step": 675 }, { "entropy": 6.701951599121093, "epoch": 0.1922533220243144, "grad_norm": 1.3125, "learning_rate": 0.0003395, "loss": 6.4879, "mean_token_accuracy": 0.14182492196559907, "num_tokens": 542160.0, "step": 680 }, { "entropy": 6.702091026306152, "epoch": 0.19366694939214024, "grad_norm": 1.3671875, "learning_rate": 0.000342, "loss": 6.4397, "mean_token_accuracy": 0.14451163560152053, "num_tokens": 546317.0, "step": 685 }, { "entropy": 6.670078468322754, "epoch": 0.19508057675996607, "grad_norm": 1.5234375, "learning_rate": 0.00034449999999999997, "loss": 6.2943, "mean_token_accuracy": 0.15481528118252755, "num_tokens": 550304.0, "step": 690 }, { "entropy": 6.529588890075684, "epoch": 0.19649420412779192, "grad_norm": 1.6015625, "learning_rate": 0.000347, "loss": 6.3855, "mean_token_accuracy": 0.1449325367808342, "num_tokens": 554276.0, "step": 695 }, { "entropy": 6.679137516021728, "epoch": 0.19790783149561775, "grad_norm": 1.5390625, "learning_rate": 0.0003495, "loss": 6.4109, "mean_token_accuracy": 0.144695745408535, "num_tokens": 558044.0, "step": 700 }, { "entropy": 6.46890025138855, "epoch": 0.1993214588634436, "grad_norm": 1.7265625, "learning_rate": 0.000352, "loss": 6.398, "mean_token_accuracy": 0.15260268077254296, "num_tokens": 561667.0, "step": 705 }, { "entropy": 6.7185471534729, "epoch": 0.20073508623126943, "grad_norm": 1.4453125, "learning_rate": 0.0003545, "loss": 6.421, "mean_token_accuracy": 0.1382300853729248, "num_tokens": 565738.0, "step": 710 }, { "entropy": 6.691477727890015, "epoch": 0.20214871359909528, "grad_norm": 1.53125, "learning_rate": 0.000357, "loss": 6.4849, "mean_token_accuracy": 0.1443715550005436, "num_tokens": 569629.0, "step": 715 }, { "entropy": 6.537031507492065, "epoch": 0.2035623409669211, "grad_norm": 1.4296875, "learning_rate": 0.0003595, "loss": 6.3245, "mean_token_accuracy": 0.14985155463218688, "num_tokens": 573272.0, "step": 720 }, { "entropy": 6.596857976913452, "epoch": 0.20497596833474696, "grad_norm": 1.3359375, "learning_rate": 0.000362, "loss": 6.3822, "mean_token_accuracy": 0.14262079298496247, "num_tokens": 577224.0, "step": 725 }, { "entropy": 6.525388908386231, "epoch": 0.20638959570257281, "grad_norm": 1.4921875, "learning_rate": 0.0003645, "loss": 6.3224, "mean_token_accuracy": 0.15136756971478463, "num_tokens": 580919.0, "step": 730 }, { "entropy": 6.716662502288818, "epoch": 0.20780322307039864, "grad_norm": 1.6484375, "learning_rate": 0.000367, "loss": 6.445, "mean_token_accuracy": 0.1410931281745434, "num_tokens": 584985.0, "step": 735 }, { "entropy": 6.596371221542358, "epoch": 0.2092168504382245, "grad_norm": 1.3203125, "learning_rate": 0.0003695, "loss": 6.3992, "mean_token_accuracy": 0.15255053117871284, "num_tokens": 588979.0, "step": 740 }, { "entropy": 6.564611911773682, "epoch": 0.21063047780605032, "grad_norm": 1.671875, "learning_rate": 0.000372, "loss": 6.3667, "mean_token_accuracy": 0.1505613371729851, "num_tokens": 592930.0, "step": 745 }, { "entropy": 6.536220741271973, "epoch": 0.21204410517387617, "grad_norm": 1.3984375, "learning_rate": 0.0003745, "loss": 6.4103, "mean_token_accuracy": 0.1515594244003296, "num_tokens": 596832.0, "step": 750 }, { "entropy": 6.828583717346191, "epoch": 0.213457732541702, "grad_norm": 1.8125, "learning_rate": 0.000377, "loss": 6.446, "mean_token_accuracy": 0.14928378835320472, "num_tokens": 600934.0, "step": 755 }, { "entropy": 6.329220914840699, "epoch": 0.21487135990952785, "grad_norm": 1.5390625, "learning_rate": 0.0003795, "loss": 6.3199, "mean_token_accuracy": 0.1495775043964386, "num_tokens": 604868.0, "step": 760 }, { "entropy": 6.744077539443969, "epoch": 0.21628498727735368, "grad_norm": 1.484375, "learning_rate": 0.000382, "loss": 6.4376, "mean_token_accuracy": 0.13565291613340377, "num_tokens": 608747.0, "step": 765 }, { "entropy": 6.577572679519653, "epoch": 0.21769861464517953, "grad_norm": 1.421875, "learning_rate": 0.0003845, "loss": 6.4215, "mean_token_accuracy": 0.1479615420103073, "num_tokens": 612627.0, "step": 770 }, { "entropy": 6.517498445510864, "epoch": 0.21911224201300536, "grad_norm": 1.40625, "learning_rate": 0.00038700000000000003, "loss": 6.3368, "mean_token_accuracy": 0.1571616619825363, "num_tokens": 616455.0, "step": 775 }, { "entropy": 6.5876189231872555, "epoch": 0.2205258693808312, "grad_norm": 1.390625, "learning_rate": 0.00038950000000000003, "loss": 6.4168, "mean_token_accuracy": 0.1469177559018135, "num_tokens": 620617.0, "step": 780 }, { "entropy": 6.415558195114135, "epoch": 0.22193949674865707, "grad_norm": 1.5625, "learning_rate": 0.00039200000000000004, "loss": 6.3376, "mean_token_accuracy": 0.1490316942334175, "num_tokens": 624863.0, "step": 785 }, { "entropy": 6.5751752853393555, "epoch": 0.2233531241164829, "grad_norm": 1.3671875, "learning_rate": 0.00039450000000000005, "loss": 6.3625, "mean_token_accuracy": 0.15206135734915732, "num_tokens": 629073.0, "step": 790 }, { "entropy": 6.595431232452393, "epoch": 0.22476675148430875, "grad_norm": 1.421875, "learning_rate": 0.00039700000000000005, "loss": 6.3723, "mean_token_accuracy": 0.15247093737125397, "num_tokens": 633550.0, "step": 795 }, { "entropy": 6.571492719650268, "epoch": 0.22618037885213457, "grad_norm": 1.6015625, "learning_rate": 0.0003995, "loss": 6.3611, "mean_token_accuracy": 0.15650528520345688, "num_tokens": 637459.0, "step": 800 }, { "entropy": 6.416607141494751, "epoch": 0.22759400621996043, "grad_norm": 1.3359375, "learning_rate": 0.000402, "loss": 6.3272, "mean_token_accuracy": 0.14604957774281502, "num_tokens": 641587.0, "step": 805 }, { "entropy": 6.561601161956787, "epoch": 0.22900763358778625, "grad_norm": 1.6015625, "learning_rate": 0.0004045, "loss": 6.5026, "mean_token_accuracy": 0.14142623618245126, "num_tokens": 645726.0, "step": 810 }, { "entropy": 6.5540244579315186, "epoch": 0.2304212609556121, "grad_norm": 1.453125, "learning_rate": 0.00040699999999999997, "loss": 6.2808, "mean_token_accuracy": 0.15965329706668854, "num_tokens": 649688.0, "step": 815 }, { "entropy": 6.466880655288696, "epoch": 0.23183488832343793, "grad_norm": 1.5390625, "learning_rate": 0.0004095, "loss": 6.3081, "mean_token_accuracy": 0.14743991270661355, "num_tokens": 653745.0, "step": 820 }, { "entropy": 6.281443119049072, "epoch": 0.23324851569126379, "grad_norm": 1.4375, "learning_rate": 0.000412, "loss": 6.2163, "mean_token_accuracy": 0.1635961800813675, "num_tokens": 657650.0, "step": 825 }, { "entropy": 6.540815114974976, "epoch": 0.2346621430590896, "grad_norm": 1.5703125, "learning_rate": 0.0004145, "loss": 6.3282, "mean_token_accuracy": 0.15691596940159797, "num_tokens": 661614.0, "step": 830 }, { "entropy": 6.437383794784546, "epoch": 0.23607577042691547, "grad_norm": 1.4375, "learning_rate": 0.000417, "loss": 6.2877, "mean_token_accuracy": 0.15950870811939238, "num_tokens": 665484.0, "step": 835 }, { "entropy": 6.302047681808472, "epoch": 0.23748939779474132, "grad_norm": 1.7421875, "learning_rate": 0.0004195, "loss": 6.3023, "mean_token_accuracy": 0.1515549197793007, "num_tokens": 669718.0, "step": 840 }, { "entropy": 6.494394445419312, "epoch": 0.23890302516256715, "grad_norm": 1.46875, "learning_rate": 0.000422, "loss": 6.2621, "mean_token_accuracy": 0.1587437778711319, "num_tokens": 673913.0, "step": 845 }, { "entropy": 6.465457439422607, "epoch": 0.240316652530393, "grad_norm": 1.5390625, "learning_rate": 0.0004245, "loss": 6.3427, "mean_token_accuracy": 0.14686428755521774, "num_tokens": 677911.0, "step": 850 }, { "entropy": 6.367018795013427, "epoch": 0.24173027989821882, "grad_norm": 1.4453125, "learning_rate": 0.000427, "loss": 6.1437, "mean_token_accuracy": 0.16687410622835158, "num_tokens": 681629.0, "step": 855 }, { "entropy": 6.405222368240357, "epoch": 0.24314390726604468, "grad_norm": 1.46875, "learning_rate": 0.0004295, "loss": 6.1789, "mean_token_accuracy": 0.15915078967809676, "num_tokens": 685675.0, "step": 860 }, { "entropy": 6.3251574516296385, "epoch": 0.2445575346338705, "grad_norm": 1.375, "learning_rate": 0.000432, "loss": 6.1061, "mean_token_accuracy": 0.16585489213466645, "num_tokens": 689630.0, "step": 865 }, { "entropy": 6.331725025177002, "epoch": 0.24597116200169636, "grad_norm": 1.3828125, "learning_rate": 0.0004345, "loss": 6.2086, "mean_token_accuracy": 0.15823635309934617, "num_tokens": 693580.0, "step": 870 }, { "entropy": 6.292018890380859, "epoch": 0.24738478936952218, "grad_norm": 1.53125, "learning_rate": 0.000437, "loss": 6.2824, "mean_token_accuracy": 0.15428755432367325, "num_tokens": 697531.0, "step": 875 }, { "entropy": 6.245914125442505, "epoch": 0.24879841673734804, "grad_norm": 1.453125, "learning_rate": 0.0004395, "loss": 6.2452, "mean_token_accuracy": 0.16177606135606765, "num_tokens": 701421.0, "step": 880 }, { "entropy": 6.380286502838135, "epoch": 0.2502120441051739, "grad_norm": 1.3203125, "learning_rate": 0.000442, "loss": 6.2034, "mean_token_accuracy": 0.158734093606472, "num_tokens": 705557.0, "step": 885 }, { "entropy": 6.279850482940674, "epoch": 0.2516256714729997, "grad_norm": 1.453125, "learning_rate": 0.0004445, "loss": 6.1344, "mean_token_accuracy": 0.1670902654528618, "num_tokens": 709173.0, "step": 890 }, { "entropy": 6.265487957000732, "epoch": 0.25303929884082554, "grad_norm": 1.4921875, "learning_rate": 0.000447, "loss": 6.0852, "mean_token_accuracy": 0.1611698791384697, "num_tokens": 713144.0, "step": 895 }, { "entropy": 6.158499622344971, "epoch": 0.2544529262086514, "grad_norm": 1.359375, "learning_rate": 0.00044950000000000003, "loss": 6.3942, "mean_token_accuracy": 0.15290624499320984, "num_tokens": 717187.0, "step": 900 }, { "entropy": 6.500699520111084, "epoch": 0.25586655357647725, "grad_norm": 1.3125, "learning_rate": 0.00045200000000000004, "loss": 6.2656, "mean_token_accuracy": 0.14998120591044425, "num_tokens": 721311.0, "step": 905 }, { "entropy": 6.283317804336548, "epoch": 0.2572801809443031, "grad_norm": 1.46875, "learning_rate": 0.00045450000000000004, "loss": 6.1865, "mean_token_accuracy": 0.1690343588590622, "num_tokens": 725193.0, "step": 910 }, { "entropy": 6.32297830581665, "epoch": 0.2586938083121289, "grad_norm": 1.296875, "learning_rate": 0.00045700000000000005, "loss": 6.1775, "mean_token_accuracy": 0.1630359873175621, "num_tokens": 729208.0, "step": 915 }, { "entropy": 6.252132749557495, "epoch": 0.26010743567995476, "grad_norm": 1.4609375, "learning_rate": 0.00045950000000000006, "loss": 6.2431, "mean_token_accuracy": 0.162384469807148, "num_tokens": 733364.0, "step": 920 }, { "entropy": 6.240159702301026, "epoch": 0.2615210630477806, "grad_norm": 1.4921875, "learning_rate": 0.000462, "loss": 6.1907, "mean_token_accuracy": 0.16134183555841447, "num_tokens": 737549.0, "step": 925 }, { "entropy": 6.357678174972534, "epoch": 0.26293469041560646, "grad_norm": 1.359375, "learning_rate": 0.0004645, "loss": 6.2012, "mean_token_accuracy": 0.16150422096252443, "num_tokens": 742009.0, "step": 930 }, { "entropy": 6.26593918800354, "epoch": 0.26434831778343226, "grad_norm": 1.4921875, "learning_rate": 0.000467, "loss": 6.3095, "mean_token_accuracy": 0.1559640161693096, "num_tokens": 746258.0, "step": 935 }, { "entropy": 6.422447776794433, "epoch": 0.2657619451512581, "grad_norm": 1.5234375, "learning_rate": 0.0004695, "loss": 6.2134, "mean_token_accuracy": 0.16972213834524155, "num_tokens": 750027.0, "step": 940 }, { "entropy": 6.179395294189453, "epoch": 0.26717557251908397, "grad_norm": 1.5078125, "learning_rate": 0.000472, "loss": 6.1788, "mean_token_accuracy": 0.15804249197244644, "num_tokens": 754030.0, "step": 945 }, { "entropy": 6.166366243362427, "epoch": 0.2685891998869098, "grad_norm": 1.46875, "learning_rate": 0.0004745, "loss": 6.0744, "mean_token_accuracy": 0.1662062868475914, "num_tokens": 757663.0, "step": 950 }, { "entropy": 6.173876714706421, "epoch": 0.2700028272547357, "grad_norm": 1.3671875, "learning_rate": 0.000477, "loss": 6.1816, "mean_token_accuracy": 0.1622084781527519, "num_tokens": 761806.0, "step": 955 }, { "entropy": 6.358310317993164, "epoch": 0.2714164546225615, "grad_norm": 1.484375, "learning_rate": 0.0004795, "loss": 6.1687, "mean_token_accuracy": 0.1678529866039753, "num_tokens": 765900.0, "step": 960 }, { "entropy": 6.13313364982605, "epoch": 0.27283008199038733, "grad_norm": 1.3359375, "learning_rate": 0.000482, "loss": 6.1376, "mean_token_accuracy": 0.16201107054948807, "num_tokens": 769842.0, "step": 965 }, { "entropy": 6.349887704849243, "epoch": 0.2742437093582132, "grad_norm": 1.5234375, "learning_rate": 0.0004845, "loss": 6.2531, "mean_token_accuracy": 0.16530761122703552, "num_tokens": 773717.0, "step": 970 }, { "entropy": 6.021614742279053, "epoch": 0.27565733672603904, "grad_norm": 1.3984375, "learning_rate": 0.000487, "loss": 5.9991, "mean_token_accuracy": 0.17551461309194566, "num_tokens": 777720.0, "step": 975 }, { "entropy": 6.14023642539978, "epoch": 0.27707096409386484, "grad_norm": 1.640625, "learning_rate": 0.0004895, "loss": 6.027, "mean_token_accuracy": 0.16881906613707542, "num_tokens": 781482.0, "step": 980 }, { "entropy": 6.2495396614074705, "epoch": 0.2784845914616907, "grad_norm": 1.671875, "learning_rate": 0.000492, "loss": 6.1729, "mean_token_accuracy": 0.15896565914154054, "num_tokens": 785390.0, "step": 985 }, { "entropy": 5.967093658447266, "epoch": 0.27989821882951654, "grad_norm": 1.40625, "learning_rate": 0.0004945, "loss": 6.0915, "mean_token_accuracy": 0.1750103384256363, "num_tokens": 789464.0, "step": 990 }, { "entropy": 6.431793308258056, "epoch": 0.2813118461973424, "grad_norm": 1.46875, "learning_rate": 0.000497, "loss": 6.179, "mean_token_accuracy": 0.15985391139984131, "num_tokens": 793229.0, "step": 995 }, { "entropy": 6.186357164382935, "epoch": 0.2827254735651682, "grad_norm": 1.46875, "learning_rate": 0.0004995, "loss": 6.0844, "mean_token_accuracy": 0.1675830215215683, "num_tokens": 797490.0, "step": 1000 }, { "epoch": 0.2827254735651682, "eval_entropy": 6.063302199271112, "eval_loss": 6.372450828552246, "eval_mean_token_accuracy": 0.16418416006589595, "eval_num_tokens": 797490.0, "eval_runtime": 6.7832, "eval_samples_per_second": 1663.516, "eval_steps_per_second": 208.013, "step": 1000 } ], "logging_steps": 5, "max_steps": 35360, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 1000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 977117884416000.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }