{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.5654509471303364, "eval_steps": 1000, "global_step": 2000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 4.838997936248779, "epoch": 0.0014136273678258412, "grad_norm": 13.1875, "learning_rate": 2e-06, "loss": 13.9198, "mean_token_accuracy": 0.0, "num_tokens": 4340.0, "step": 5 }, { "entropy": 4.843051767349243, "epoch": 0.0028272547356516823, "grad_norm": 14.0625, "learning_rate": 4.5e-06, "loss": 13.831, "mean_token_accuracy": 0.0, "num_tokens": 8692.0, "step": 10 }, { "entropy": 4.923465204238892, "epoch": 0.004240882103477523, "grad_norm": 16.75, "learning_rate": 7e-06, "loss": 13.4913, "mean_token_accuracy": 0.0, "num_tokens": 12453.0, "step": 15 }, { "entropy": 5.232606410980225, "epoch": 0.005654509471303365, "grad_norm": 26.25, "learning_rate": 9.5e-06, "loss": 12.9423, "mean_token_accuracy": 0.0, "num_tokens": 16439.0, "step": 20 }, { "entropy": 7.618780517578125, "epoch": 0.007068136839129205, "grad_norm": 17.75, "learning_rate": 1.2e-05, "loss": 11.494, "mean_token_accuracy": 0.0, "num_tokens": 20515.0, "step": 25 }, { "entropy": 10.471516036987305, "epoch": 0.008481764206955046, "grad_norm": 4.34375, "learning_rate": 1.4500000000000002e-05, "loss": 10.526, "mean_token_accuracy": 0.0, "num_tokens": 24336.0, "step": 30 }, { "entropy": 10.700703144073486, "epoch": 0.009895391574780888, "grad_norm": 3.8125, "learning_rate": 1.7000000000000003e-05, "loss": 10.3432, "mean_token_accuracy": 0.013547292444854975, "num_tokens": 28465.0, "step": 35 }, { "entropy": 10.689900112152099, "epoch": 0.01130901894260673, "grad_norm": 3.578125, "learning_rate": 1.95e-05, "loss": 9.9111, "mean_token_accuracy": 0.046335773542523384, "num_tokens": 32217.0, "step": 40 }, { "entropy": 10.446650981903076, "epoch": 0.01272264631043257, "grad_norm": 3.4375, "learning_rate": 2.2e-05, "loss": 9.6264, "mean_token_accuracy": 0.040803880989551546, "num_tokens": 36369.0, "step": 45 }, { "entropy": 10.473936176300048, "epoch": 0.01413627367825841, "grad_norm": 2.703125, "learning_rate": 2.4500000000000003e-05, "loss": 9.3506, "mean_token_accuracy": 0.04644691050052643, "num_tokens": 40227.0, "step": 50 }, { "entropy": 10.520126819610596, "epoch": 0.015549901046084252, "grad_norm": 2.21875, "learning_rate": 2.7e-05, "loss": 9.2423, "mean_token_accuracy": 0.060035499185323714, "num_tokens": 44266.0, "step": 55 }, { "entropy": 10.462940120697022, "epoch": 0.016963528413910092, "grad_norm": 2.3125, "learning_rate": 2.95e-05, "loss": 9.1768, "mean_token_accuracy": 0.05174140147864818, "num_tokens": 48187.0, "step": 60 }, { "entropy": 10.422643947601319, "epoch": 0.018377155781735936, "grad_norm": 2.203125, "learning_rate": 3.2e-05, "loss": 9.0365, "mean_token_accuracy": 0.04872686117887497, "num_tokens": 52252.0, "step": 65 }, { "entropy": 10.438050460815429, "epoch": 0.019790783149561775, "grad_norm": 2.40625, "learning_rate": 3.4500000000000005e-05, "loss": 8.9607, "mean_token_accuracy": 0.05605476088821888, "num_tokens": 56421.0, "step": 70 }, { "entropy": 10.400554084777832, "epoch": 0.021204410517387615, "grad_norm": 2.0625, "learning_rate": 3.7e-05, "loss": 8.878, "mean_token_accuracy": 0.06232075840234756, "num_tokens": 60341.0, "step": 75 }, { "entropy": 10.250280380249023, "epoch": 0.02261803788521346, "grad_norm": 2.28125, "learning_rate": 3.95e-05, "loss": 8.7283, "mean_token_accuracy": 0.062391096726059914, "num_tokens": 64465.0, "step": 80 }, { "entropy": 10.2134352684021, "epoch": 0.0240316652530393, "grad_norm": 1.84375, "learning_rate": 4.2000000000000004e-05, "loss": 8.7126, "mean_token_accuracy": 0.06613181754946709, "num_tokens": 68514.0, "step": 85 }, { "entropy": 10.055916213989258, "epoch": 0.02544529262086514, "grad_norm": 1.84375, "learning_rate": 4.45e-05, "loss": 8.5801, "mean_token_accuracy": 0.06724648177623749, "num_tokens": 72661.0, "step": 90 }, { "entropy": 9.991343212127685, "epoch": 0.02685891998869098, "grad_norm": 1.8203125, "learning_rate": 4.7000000000000004e-05, "loss": 8.4773, "mean_token_accuracy": 0.0715904712677002, "num_tokens": 76698.0, "step": 95 }, { "entropy": 9.897418022155762, "epoch": 0.02827254735651682, "grad_norm": 1.8203125, "learning_rate": 4.9500000000000004e-05, "loss": 8.3786, "mean_token_accuracy": 0.06964126601815224, "num_tokens": 80732.0, "step": 100 }, { "entropy": 9.81051197052002, "epoch": 0.029686174724342665, "grad_norm": 1.6875, "learning_rate": 5.2e-05, "loss": 8.2664, "mean_token_accuracy": 0.07291285954415798, "num_tokens": 84797.0, "step": 105 }, { "entropy": 9.750697708129882, "epoch": 0.031099802092168505, "grad_norm": 1.734375, "learning_rate": 5.45e-05, "loss": 8.1699, "mean_token_accuracy": 0.06931682229042054, "num_tokens": 88758.0, "step": 110 }, { "entropy": 9.548874855041504, "epoch": 0.032513429459994345, "grad_norm": 1.3671875, "learning_rate": 5.7e-05, "loss": 8.0496, "mean_token_accuracy": 0.07683553956449032, "num_tokens": 92722.0, "step": 115 }, { "entropy": 9.418696975708007, "epoch": 0.033927056827820185, "grad_norm": 1.515625, "learning_rate": 5.9499999999999996e-05, "loss": 7.8938, "mean_token_accuracy": 0.07645067945122719, "num_tokens": 96602.0, "step": 120 }, { "entropy": 9.192409229278564, "epoch": 0.035340684195646024, "grad_norm": 1.40625, "learning_rate": 6.2e-05, "loss": 7.831, "mean_token_accuracy": 0.07514876201748848, "num_tokens": 100598.0, "step": 125 }, { "entropy": 9.073713493347167, "epoch": 0.03675431156347187, "grad_norm": 1.3515625, "learning_rate": 6.450000000000001e-05, "loss": 7.734, "mean_token_accuracy": 0.07320134155452251, "num_tokens": 104460.0, "step": 130 }, { "entropy": 8.958717918395996, "epoch": 0.03816793893129771, "grad_norm": 1.421875, "learning_rate": 6.7e-05, "loss": 7.6242, "mean_token_accuracy": 0.07055199854075908, "num_tokens": 108360.0, "step": 135 }, { "entropy": 8.655115032196045, "epoch": 0.03958156629912355, "grad_norm": 1.296875, "learning_rate": 6.950000000000001e-05, "loss": 7.5081, "mean_token_accuracy": 0.07828053757548332, "num_tokens": 112176.0, "step": 140 }, { "entropy": 8.63590440750122, "epoch": 0.04099519366694939, "grad_norm": 1.484375, "learning_rate": 7.2e-05, "loss": 7.6179, "mean_token_accuracy": 0.06859740577638149, "num_tokens": 116192.0, "step": 145 }, { "entropy": 8.526045417785644, "epoch": 0.04240882103477523, "grad_norm": 1.2109375, "learning_rate": 7.45e-05, "loss": 7.5008, "mean_token_accuracy": 0.06685782484710216, "num_tokens": 120221.0, "step": 150 }, { "entropy": 8.428415966033935, "epoch": 0.04382244840260108, "grad_norm": 1.1953125, "learning_rate": 7.7e-05, "loss": 7.5019, "mean_token_accuracy": 0.06606126651167869, "num_tokens": 124364.0, "step": 155 }, { "entropy": 8.274092197418213, "epoch": 0.04523607577042692, "grad_norm": 1.1171875, "learning_rate": 7.950000000000001e-05, "loss": 7.3469, "mean_token_accuracy": 0.08038331940770149, "num_tokens": 128266.0, "step": 160 }, { "entropy": 8.154208850860595, "epoch": 0.04664970313825276, "grad_norm": 1.1015625, "learning_rate": 8.2e-05, "loss": 7.3261, "mean_token_accuracy": 0.07359547801315784, "num_tokens": 131985.0, "step": 165 }, { "entropy": 8.039358854293823, "epoch": 0.0480633305060786, "grad_norm": 1.109375, "learning_rate": 8.450000000000001e-05, "loss": 7.2318, "mean_token_accuracy": 0.08298368901014327, "num_tokens": 135892.0, "step": 170 }, { "entropy": 7.960572910308838, "epoch": 0.04947695787390444, "grad_norm": 1.21875, "learning_rate": 8.7e-05, "loss": 7.3743, "mean_token_accuracy": 0.07648940533399581, "num_tokens": 139937.0, "step": 175 }, { "entropy": 8.018472337722779, "epoch": 0.05089058524173028, "grad_norm": 1.1875, "learning_rate": 8.95e-05, "loss": 7.1981, "mean_token_accuracy": 0.08083997145295144, "num_tokens": 143659.0, "step": 180 }, { "entropy": 7.916880559921265, "epoch": 0.052304212609556124, "grad_norm": 1.2734375, "learning_rate": 9.2e-05, "loss": 7.3147, "mean_token_accuracy": 0.08173628598451614, "num_tokens": 147394.0, "step": 185 }, { "entropy": 7.840789651870727, "epoch": 0.05371783997738196, "grad_norm": 1.265625, "learning_rate": 9.45e-05, "loss": 7.1724, "mean_token_accuracy": 0.08405760079622268, "num_tokens": 151082.0, "step": 190 }, { "entropy": 7.727948999404907, "epoch": 0.0551314673452078, "grad_norm": 1.34375, "learning_rate": 9.7e-05, "loss": 7.1786, "mean_token_accuracy": 0.08063250184059143, "num_tokens": 155099.0, "step": 195 }, { "entropy": 7.822998285293579, "epoch": 0.05654509471303364, "grad_norm": 1.140625, "learning_rate": 9.95e-05, "loss": 7.3548, "mean_token_accuracy": 0.07048202715814114, "num_tokens": 159297.0, "step": 200 }, { "entropy": 7.713145303726196, "epoch": 0.05795872208085948, "grad_norm": 1.3515625, "learning_rate": 0.000102, "loss": 7.2237, "mean_token_accuracy": 0.07353744581341744, "num_tokens": 163337.0, "step": 205 }, { "entropy": 7.855460119247437, "epoch": 0.05937234944868533, "grad_norm": 1.125, "learning_rate": 0.00010449999999999999, "loss": 7.277, "mean_token_accuracy": 0.08301040753722191, "num_tokens": 167440.0, "step": 210 }, { "entropy": 7.675248670578003, "epoch": 0.06078597681651117, "grad_norm": 1.234375, "learning_rate": 0.000107, "loss": 7.1489, "mean_token_accuracy": 0.08562113344669342, "num_tokens": 171238.0, "step": 215 }, { "entropy": 7.707080364227295, "epoch": 0.06219960418433701, "grad_norm": 1.1953125, "learning_rate": 0.0001095, "loss": 7.2134, "mean_token_accuracy": 0.07360663190484047, "num_tokens": 175476.0, "step": 220 }, { "entropy": 7.5691710948944095, "epoch": 0.06361323155216285, "grad_norm": 1.484375, "learning_rate": 0.000112, "loss": 7.1273, "mean_token_accuracy": 0.08262931331992149, "num_tokens": 179398.0, "step": 225 }, { "entropy": 7.5606465339660645, "epoch": 0.06502685891998869, "grad_norm": 1.171875, "learning_rate": 0.0001145, "loss": 7.1102, "mean_token_accuracy": 0.08324644044041633, "num_tokens": 183355.0, "step": 230 }, { "entropy": 7.605392646789551, "epoch": 0.06644048628781453, "grad_norm": 1.296875, "learning_rate": 0.00011700000000000001, "loss": 7.12, "mean_token_accuracy": 0.07809790521860123, "num_tokens": 187278.0, "step": 235 }, { "entropy": 7.519303512573242, "epoch": 0.06785411365564037, "grad_norm": 1.484375, "learning_rate": 0.00011949999999999999, "loss": 7.1402, "mean_token_accuracy": 0.0761954978108406, "num_tokens": 191136.0, "step": 240 }, { "entropy": 7.577075338363647, "epoch": 0.06926774102346621, "grad_norm": 1.78125, "learning_rate": 0.000122, "loss": 7.2122, "mean_token_accuracy": 0.08024812079966068, "num_tokens": 195096.0, "step": 245 }, { "entropy": 7.606031370162964, "epoch": 0.07068136839129205, "grad_norm": 1.3046875, "learning_rate": 0.0001245, "loss": 7.2001, "mean_token_accuracy": 0.07799483351409435, "num_tokens": 199483.0, "step": 250 }, { "entropy": 7.643957281112671, "epoch": 0.0720949957591179, "grad_norm": 1.6328125, "learning_rate": 0.000127, "loss": 7.1263, "mean_token_accuracy": 0.08172452189028263, "num_tokens": 203515.0, "step": 255 }, { "entropy": 7.497114038467407, "epoch": 0.07350862312694374, "grad_norm": 1.7578125, "learning_rate": 0.0001295, "loss": 7.1289, "mean_token_accuracy": 0.07867333814501762, "num_tokens": 207451.0, "step": 260 }, { "entropy": 7.548718070983886, "epoch": 0.07492225049476958, "grad_norm": 1.3359375, "learning_rate": 0.000132, "loss": 7.0456, "mean_token_accuracy": 0.08255640640854836, "num_tokens": 211507.0, "step": 265 }, { "entropy": 7.439682149887085, "epoch": 0.07633587786259542, "grad_norm": 1.3125, "learning_rate": 0.00013450000000000002, "loss": 7.1149, "mean_token_accuracy": 0.08738862499594688, "num_tokens": 215236.0, "step": 270 }, { "entropy": 7.497509336471557, "epoch": 0.07774950523042126, "grad_norm": 1.4765625, "learning_rate": 0.00013700000000000002, "loss": 7.0841, "mean_token_accuracy": 0.08626129925251007, "num_tokens": 218934.0, "step": 275 }, { "entropy": 7.530088710784912, "epoch": 0.0791631325982471, "grad_norm": 1.4921875, "learning_rate": 0.0001395, "loss": 7.031, "mean_token_accuracy": 0.08123192861676216, "num_tokens": 223185.0, "step": 280 }, { "entropy": 7.557523965835571, "epoch": 0.08057675996607294, "grad_norm": 1.96875, "learning_rate": 0.00014199999999999998, "loss": 7.1551, "mean_token_accuracy": 0.07593904286623002, "num_tokens": 227044.0, "step": 285 }, { "entropy": 7.449309587478638, "epoch": 0.08199038733389878, "grad_norm": 1.1015625, "learning_rate": 0.0001445, "loss": 7.0628, "mean_token_accuracy": 0.09167415499687195, "num_tokens": 231359.0, "step": 290 }, { "entropy": 7.531680345535278, "epoch": 0.08340401470172462, "grad_norm": 1.3125, "learning_rate": 0.000147, "loss": 7.0471, "mean_token_accuracy": 0.08983734510838985, "num_tokens": 235224.0, "step": 295 }, { "entropy": 7.344621992111206, "epoch": 0.08481764206955046, "grad_norm": 1.7890625, "learning_rate": 0.0001495, "loss": 6.905, "mean_token_accuracy": 0.09648748189210891, "num_tokens": 239119.0, "step": 300 }, { "entropy": 7.288154172897339, "epoch": 0.0862312694373763, "grad_norm": 1.4140625, "learning_rate": 0.000152, "loss": 7.0089, "mean_token_accuracy": 0.0949060007929802, "num_tokens": 243275.0, "step": 305 }, { "entropy": 7.433500814437866, "epoch": 0.08764489680520215, "grad_norm": 1.2890625, "learning_rate": 0.00015450000000000001, "loss": 7.0206, "mean_token_accuracy": 0.09643495455384254, "num_tokens": 247415.0, "step": 310 }, { "entropy": 7.416780138015747, "epoch": 0.089058524173028, "grad_norm": 1.453125, "learning_rate": 0.000157, "loss": 7.0159, "mean_token_accuracy": 0.08751917779445648, "num_tokens": 251575.0, "step": 315 }, { "entropy": 7.372589826583862, "epoch": 0.09047215154085383, "grad_norm": 1.8671875, "learning_rate": 0.0001595, "loss": 6.9997, "mean_token_accuracy": 0.08504554927349091, "num_tokens": 255686.0, "step": 320 }, { "entropy": 7.3249767303466795, "epoch": 0.09188577890867967, "grad_norm": 1.2890625, "learning_rate": 0.000162, "loss": 6.9852, "mean_token_accuracy": 0.09507602602243423, "num_tokens": 259850.0, "step": 325 }, { "entropy": 7.423571062088013, "epoch": 0.09329940627650551, "grad_norm": 1.421875, "learning_rate": 0.00016450000000000001, "loss": 7.0103, "mean_token_accuracy": 0.09533059746026992, "num_tokens": 264043.0, "step": 330 }, { "entropy": 7.514725065231323, "epoch": 0.09471303364433135, "grad_norm": 1.3828125, "learning_rate": 0.00016700000000000002, "loss": 7.0725, "mean_token_accuracy": 0.08970947004854679, "num_tokens": 268296.0, "step": 335 }, { "entropy": 7.174638795852661, "epoch": 0.0961266610121572, "grad_norm": 2.28125, "learning_rate": 0.00016950000000000003, "loss": 6.8961, "mean_token_accuracy": 0.09778379574418068, "num_tokens": 272062.0, "step": 340 }, { "entropy": 7.25974817276001, "epoch": 0.09754028837998303, "grad_norm": 1.28125, "learning_rate": 0.00017199999999999998, "loss": 6.8514, "mean_token_accuracy": 0.10595791339874268, "num_tokens": 275936.0, "step": 345 }, { "entropy": 7.272134685516358, "epoch": 0.09895391574780887, "grad_norm": 1.640625, "learning_rate": 0.00017449999999999999, "loss": 6.8802, "mean_token_accuracy": 0.10179490596055984, "num_tokens": 279526.0, "step": 350 }, { "entropy": 7.339320135116577, "epoch": 0.10036754311563471, "grad_norm": 1.34375, "learning_rate": 0.000177, "loss": 6.9552, "mean_token_accuracy": 0.0998102031648159, "num_tokens": 283577.0, "step": 355 }, { "entropy": 7.324524545669556, "epoch": 0.10178117048346055, "grad_norm": 1.4609375, "learning_rate": 0.0001795, "loss": 6.7984, "mean_token_accuracy": 0.101173298060894, "num_tokens": 287377.0, "step": 360 }, { "entropy": 7.140333604812622, "epoch": 0.10319479785128641, "grad_norm": 1.28125, "learning_rate": 0.000182, "loss": 6.973, "mean_token_accuracy": 0.09467578828334808, "num_tokens": 291582.0, "step": 365 }, { "entropy": 7.392356729507446, "epoch": 0.10460842521911225, "grad_norm": 1.328125, "learning_rate": 0.0001845, "loss": 6.8489, "mean_token_accuracy": 0.0993436373770237, "num_tokens": 295608.0, "step": 370 }, { "entropy": 7.154901552200317, "epoch": 0.10602205258693809, "grad_norm": 1.4609375, "learning_rate": 0.000187, "loss": 6.872, "mean_token_accuracy": 0.1050638273358345, "num_tokens": 299660.0, "step": 375 }, { "entropy": 7.05282769203186, "epoch": 0.10743567995476393, "grad_norm": 1.3828125, "learning_rate": 0.0001895, "loss": 6.7846, "mean_token_accuracy": 0.11004708558321, "num_tokens": 303412.0, "step": 380 }, { "entropy": 7.143272113800049, "epoch": 0.10884930732258977, "grad_norm": 1.5546875, "learning_rate": 0.000192, "loss": 6.8498, "mean_token_accuracy": 0.10617732927203179, "num_tokens": 307352.0, "step": 385 }, { "entropy": 7.2218762874603275, "epoch": 0.1102629346904156, "grad_norm": 1.5859375, "learning_rate": 0.0001945, "loss": 6.9129, "mean_token_accuracy": 0.10999525636434555, "num_tokens": 311418.0, "step": 390 }, { "entropy": 7.1364624977111815, "epoch": 0.11167656205824145, "grad_norm": 1.578125, "learning_rate": 0.00019700000000000002, "loss": 6.7597, "mean_token_accuracy": 0.11771088987588882, "num_tokens": 315150.0, "step": 395 }, { "entropy": 7.207963132858277, "epoch": 0.11309018942606729, "grad_norm": 1.6796875, "learning_rate": 0.00019950000000000002, "loss": 6.9407, "mean_token_accuracy": 0.10095959007740021, "num_tokens": 318898.0, "step": 400 }, { "entropy": 7.126479911804199, "epoch": 0.11450381679389313, "grad_norm": 1.515625, "learning_rate": 0.000202, "loss": 6.7726, "mean_token_accuracy": 0.11357507780194283, "num_tokens": 322495.0, "step": 405 }, { "entropy": 7.224441242218018, "epoch": 0.11591744416171897, "grad_norm": 1.2890625, "learning_rate": 0.00020449999999999998, "loss": 6.8993, "mean_token_accuracy": 0.11550437733530998, "num_tokens": 326473.0, "step": 410 }, { "entropy": 7.140273571014404, "epoch": 0.1173310715295448, "grad_norm": 1.3515625, "learning_rate": 0.000207, "loss": 6.8522, "mean_token_accuracy": 0.10760911256074905, "num_tokens": 330393.0, "step": 415 }, { "entropy": 7.134380578994751, "epoch": 0.11874469889737066, "grad_norm": 1.359375, "learning_rate": 0.0002095, "loss": 6.7692, "mean_token_accuracy": 0.11172740682959556, "num_tokens": 334449.0, "step": 420 }, { "entropy": 7.2949425220489506, "epoch": 0.1201583262651965, "grad_norm": 1.4375, "learning_rate": 0.000212, "loss": 6.9219, "mean_token_accuracy": 0.10026353597640991, "num_tokens": 338740.0, "step": 425 }, { "entropy": 7.066179800033569, "epoch": 0.12157195363302234, "grad_norm": 1.546875, "learning_rate": 0.0002145, "loss": 6.7336, "mean_token_accuracy": 0.11876392140984535, "num_tokens": 342429.0, "step": 430 }, { "entropy": 7.117091083526612, "epoch": 0.12298558100084818, "grad_norm": 1.421875, "learning_rate": 0.00021700000000000002, "loss": 6.7741, "mean_token_accuracy": 0.12331236079335213, "num_tokens": 346218.0, "step": 435 }, { "entropy": 7.182254219055176, "epoch": 0.12439920836867402, "grad_norm": 1.4140625, "learning_rate": 0.0002195, "loss": 6.7754, "mean_token_accuracy": 0.11808006688952447, "num_tokens": 350310.0, "step": 440 }, { "entropy": 7.058240985870361, "epoch": 0.12581283573649985, "grad_norm": 1.4765625, "learning_rate": 0.000222, "loss": 6.7434, "mean_token_accuracy": 0.12305478826165199, "num_tokens": 353952.0, "step": 445 }, { "entropy": 7.198861885070801, "epoch": 0.1272264631043257, "grad_norm": 1.875, "learning_rate": 0.0002245, "loss": 6.9148, "mean_token_accuracy": 0.11514305397868156, "num_tokens": 357667.0, "step": 450 }, { "entropy": 7.127170419692993, "epoch": 0.12864009047215155, "grad_norm": 1.296875, "learning_rate": 0.00022700000000000002, "loss": 6.7165, "mean_token_accuracy": 0.12080714330077172, "num_tokens": 361309.0, "step": 455 }, { "entropy": 6.963030576705933, "epoch": 0.13005371783997738, "grad_norm": 1.40625, "learning_rate": 0.00022950000000000002, "loss": 6.7651, "mean_token_accuracy": 0.13394678458571435, "num_tokens": 365099.0, "step": 460 }, { "entropy": 7.293617916107178, "epoch": 0.13146734520780323, "grad_norm": 1.53125, "learning_rate": 0.00023200000000000003, "loss": 6.8263, "mean_token_accuracy": 0.11883056983351707, "num_tokens": 369141.0, "step": 465 }, { "entropy": 7.0113513469696045, "epoch": 0.13288097257562906, "grad_norm": 1.46875, "learning_rate": 0.00023449999999999998, "loss": 6.7673, "mean_token_accuracy": 0.11753190383315086, "num_tokens": 373128.0, "step": 470 }, { "entropy": 7.056188488006592, "epoch": 0.1342945999434549, "grad_norm": 1.4609375, "learning_rate": 0.000237, "loss": 6.7551, "mean_token_accuracy": 0.12295122221112251, "num_tokens": 377103.0, "step": 475 }, { "entropy": 7.010499048233032, "epoch": 0.13570822731128074, "grad_norm": 1.59375, "learning_rate": 0.0002395, "loss": 6.8054, "mean_token_accuracy": 0.11294787377119064, "num_tokens": 381573.0, "step": 480 }, { "entropy": 7.241208553314209, "epoch": 0.1371218546791066, "grad_norm": 1.328125, "learning_rate": 0.000242, "loss": 6.8248, "mean_token_accuracy": 0.12627912536263466, "num_tokens": 385759.0, "step": 485 }, { "entropy": 6.94762954711914, "epoch": 0.13853548204693242, "grad_norm": 1.421875, "learning_rate": 0.0002445, "loss": 6.7048, "mean_token_accuracy": 0.12667714580893516, "num_tokens": 389700.0, "step": 490 }, { "entropy": 7.064765691757202, "epoch": 0.13994910941475827, "grad_norm": 1.4921875, "learning_rate": 0.000247, "loss": 6.6205, "mean_token_accuracy": 0.12440077215433121, "num_tokens": 393279.0, "step": 495 }, { "entropy": 7.031151533126831, "epoch": 0.1413627367825841, "grad_norm": 1.5546875, "learning_rate": 0.0002495, "loss": 6.725, "mean_token_accuracy": 0.12710191905498505, "num_tokens": 397379.0, "step": 500 }, { "entropy": 6.966974687576294, "epoch": 0.14277636415040995, "grad_norm": 1.3671875, "learning_rate": 0.000252, "loss": 6.7762, "mean_token_accuracy": 0.12484551221132278, "num_tokens": 401349.0, "step": 505 }, { "entropy": 7.063830709457397, "epoch": 0.1441899915182358, "grad_norm": 1.3671875, "learning_rate": 0.0002545, "loss": 6.6911, "mean_token_accuracy": 0.12564558237791063, "num_tokens": 405361.0, "step": 510 }, { "entropy": 6.972732162475586, "epoch": 0.14560361888606163, "grad_norm": 1.6171875, "learning_rate": 0.000257, "loss": 6.726, "mean_token_accuracy": 0.12524131089448928, "num_tokens": 409614.0, "step": 515 }, { "entropy": 6.847900104522705, "epoch": 0.14701724625388748, "grad_norm": 1.4375, "learning_rate": 0.0002595, "loss": 6.6623, "mean_token_accuracy": 0.13759828507900237, "num_tokens": 413529.0, "step": 520 }, { "entropy": 6.994072675704956, "epoch": 0.1484308736217133, "grad_norm": 1.5234375, "learning_rate": 0.000262, "loss": 6.6178, "mean_token_accuracy": 0.12413196116685868, "num_tokens": 417365.0, "step": 525 }, { "entropy": 6.847810077667236, "epoch": 0.14984450098953916, "grad_norm": 1.5234375, "learning_rate": 0.00026450000000000003, "loss": 6.6269, "mean_token_accuracy": 0.1389990709722042, "num_tokens": 421232.0, "step": 530 }, { "entropy": 7.125303459167481, "epoch": 0.151258128357365, "grad_norm": 1.6015625, "learning_rate": 0.00026700000000000004, "loss": 6.7183, "mean_token_accuracy": 0.12456061840057372, "num_tokens": 425503.0, "step": 535 }, { "entropy": 6.852126216888427, "epoch": 0.15267175572519084, "grad_norm": 1.3828125, "learning_rate": 0.00026950000000000005, "loss": 6.7542, "mean_token_accuracy": 0.12805211022496224, "num_tokens": 429770.0, "step": 540 }, { "entropy": 7.0629345893859865, "epoch": 0.15408538309301667, "grad_norm": 1.625, "learning_rate": 0.00027200000000000005, "loss": 6.6387, "mean_token_accuracy": 0.13042709827423096, "num_tokens": 433657.0, "step": 545 }, { "entropy": 6.941704559326172, "epoch": 0.15549901046084252, "grad_norm": 1.453125, "learning_rate": 0.0002745, "loss": 6.7511, "mean_token_accuracy": 0.1230709470808506, "num_tokens": 437732.0, "step": 550 }, { "entropy": 6.886470556259155, "epoch": 0.15691263782866835, "grad_norm": 1.3828125, "learning_rate": 0.000277, "loss": 6.4963, "mean_token_accuracy": 0.13797944858670236, "num_tokens": 441866.0, "step": 555 }, { "entropy": 6.786446952819825, "epoch": 0.1583262651964942, "grad_norm": 1.46875, "learning_rate": 0.0002795, "loss": 6.5783, "mean_token_accuracy": 0.1337943233549595, "num_tokens": 445437.0, "step": 560 }, { "entropy": 6.786550521850586, "epoch": 0.15973989256432006, "grad_norm": 1.6953125, "learning_rate": 0.00028199999999999997, "loss": 6.564, "mean_token_accuracy": 0.13779796212911605, "num_tokens": 449602.0, "step": 565 }, { "entropy": 6.764790821075439, "epoch": 0.16115351993214588, "grad_norm": 1.3203125, "learning_rate": 0.0002845, "loss": 6.4694, "mean_token_accuracy": 0.13991471529006957, "num_tokens": 453140.0, "step": 570 }, { "entropy": 6.97475233078003, "epoch": 0.16256714729997174, "grad_norm": 1.53125, "learning_rate": 0.000287, "loss": 6.7096, "mean_token_accuracy": 0.12624734565615653, "num_tokens": 457210.0, "step": 575 }, { "entropy": 7.009247064590454, "epoch": 0.16398077466779756, "grad_norm": 1.4140625, "learning_rate": 0.0002895, "loss": 6.6826, "mean_token_accuracy": 0.12368027344346047, "num_tokens": 461534.0, "step": 580 }, { "entropy": 6.9301024913787845, "epoch": 0.16539440203562342, "grad_norm": 1.6484375, "learning_rate": 0.000292, "loss": 6.4802, "mean_token_accuracy": 0.13896113261580467, "num_tokens": 465055.0, "step": 585 }, { "entropy": 6.829527807235718, "epoch": 0.16680802940344924, "grad_norm": 1.6796875, "learning_rate": 0.0002945, "loss": 6.5188, "mean_token_accuracy": 0.13359609320759774, "num_tokens": 469133.0, "step": 590 }, { "entropy": 6.923969316482544, "epoch": 0.1682216567712751, "grad_norm": 1.4453125, "learning_rate": 0.000297, "loss": 6.6646, "mean_token_accuracy": 0.1328178010880947, "num_tokens": 473078.0, "step": 595 }, { "entropy": 6.906017303466797, "epoch": 0.16963528413910092, "grad_norm": 1.3671875, "learning_rate": 0.0002995, "loss": 6.5999, "mean_token_accuracy": 0.13147619739174843, "num_tokens": 476988.0, "step": 600 }, { "entropy": 6.845853567123413, "epoch": 0.17104891150692678, "grad_norm": 1.40625, "learning_rate": 0.000302, "loss": 6.4638, "mean_token_accuracy": 0.13877335488796233, "num_tokens": 481170.0, "step": 605 }, { "entropy": 6.808208322525024, "epoch": 0.1724625388747526, "grad_norm": 1.75, "learning_rate": 0.0003045, "loss": 6.4607, "mean_token_accuracy": 0.12855389714241028, "num_tokens": 484853.0, "step": 610 }, { "entropy": 6.694374704360962, "epoch": 0.17387616624257846, "grad_norm": 1.5703125, "learning_rate": 0.000307, "loss": 6.5042, "mean_token_accuracy": 0.14368257224559783, "num_tokens": 488550.0, "step": 615 }, { "entropy": 6.714710140228272, "epoch": 0.1752897936104043, "grad_norm": 1.5, "learning_rate": 0.0003095, "loss": 6.5511, "mean_token_accuracy": 0.1393193356692791, "num_tokens": 492621.0, "step": 620 }, { "entropy": 6.823784923553466, "epoch": 0.17670342097823014, "grad_norm": 1.5703125, "learning_rate": 0.000312, "loss": 6.4969, "mean_token_accuracy": 0.12763671800494195, "num_tokens": 496627.0, "step": 625 }, { "entropy": 6.75352110862732, "epoch": 0.178117048346056, "grad_norm": 1.421875, "learning_rate": 0.0003145, "loss": 6.5534, "mean_token_accuracy": 0.13516684994101524, "num_tokens": 500794.0, "step": 630 }, { "entropy": 6.771178388595581, "epoch": 0.17953067571388182, "grad_norm": 1.4765625, "learning_rate": 0.000317, "loss": 6.5715, "mean_token_accuracy": 0.1311728797852993, "num_tokens": 504672.0, "step": 635 }, { "entropy": 6.785078620910644, "epoch": 0.18094430308170767, "grad_norm": 1.3515625, "learning_rate": 0.0003195, "loss": 6.4995, "mean_token_accuracy": 0.14259493052959443, "num_tokens": 508834.0, "step": 640 }, { "entropy": 6.843728113174438, "epoch": 0.1823579304495335, "grad_norm": 1.4921875, "learning_rate": 0.000322, "loss": 6.4686, "mean_token_accuracy": 0.13577061742544175, "num_tokens": 512722.0, "step": 645 }, { "entropy": 6.774205303192138, "epoch": 0.18377155781735935, "grad_norm": 1.5546875, "learning_rate": 0.00032450000000000003, "loss": 6.5824, "mean_token_accuracy": 0.13288535103201865, "num_tokens": 517270.0, "step": 650 }, { "entropy": 6.76011438369751, "epoch": 0.18518518518518517, "grad_norm": 1.7421875, "learning_rate": 0.00032700000000000003, "loss": 6.5048, "mean_token_accuracy": 0.14277215600013732, "num_tokens": 521438.0, "step": 655 }, { "entropy": 6.762216997146607, "epoch": 0.18659881255301103, "grad_norm": 1.3828125, "learning_rate": 0.00032950000000000004, "loss": 6.4822, "mean_token_accuracy": 0.1396136611700058, "num_tokens": 525890.0, "step": 660 }, { "entropy": 6.725051021575927, "epoch": 0.18801243992083685, "grad_norm": 1.3828125, "learning_rate": 0.00033200000000000005, "loss": 6.4927, "mean_token_accuracy": 0.14150392562150954, "num_tokens": 529775.0, "step": 665 }, { "entropy": 6.711924600601196, "epoch": 0.1894260672886627, "grad_norm": 1.515625, "learning_rate": 0.00033450000000000005, "loss": 6.4771, "mean_token_accuracy": 0.14005500972270965, "num_tokens": 533889.0, "step": 670 }, { "entropy": 6.584859466552734, "epoch": 0.19083969465648856, "grad_norm": 1.296875, "learning_rate": 0.000337, "loss": 6.402, "mean_token_accuracy": 0.1481585830450058, "num_tokens": 537701.0, "step": 675 }, { "entropy": 6.701951599121093, "epoch": 0.1922533220243144, "grad_norm": 1.3125, "learning_rate": 0.0003395, "loss": 6.4879, "mean_token_accuracy": 0.14182492196559907, "num_tokens": 542160.0, "step": 680 }, { "entropy": 6.702091026306152, "epoch": 0.19366694939214024, "grad_norm": 1.3671875, "learning_rate": 0.000342, "loss": 6.4397, "mean_token_accuracy": 0.14451163560152053, "num_tokens": 546317.0, "step": 685 }, { "entropy": 6.670078468322754, "epoch": 0.19508057675996607, "grad_norm": 1.5234375, "learning_rate": 0.00034449999999999997, "loss": 6.2943, "mean_token_accuracy": 0.15481528118252755, "num_tokens": 550304.0, "step": 690 }, { "entropy": 6.529588890075684, "epoch": 0.19649420412779192, "grad_norm": 1.6015625, "learning_rate": 0.000347, "loss": 6.3855, "mean_token_accuracy": 0.1449325367808342, "num_tokens": 554276.0, "step": 695 }, { "entropy": 6.679137516021728, "epoch": 0.19790783149561775, "grad_norm": 1.5390625, "learning_rate": 0.0003495, "loss": 6.4109, "mean_token_accuracy": 0.144695745408535, "num_tokens": 558044.0, "step": 700 }, { "entropy": 6.46890025138855, "epoch": 0.1993214588634436, "grad_norm": 1.7265625, "learning_rate": 0.000352, "loss": 6.398, "mean_token_accuracy": 0.15260268077254296, "num_tokens": 561667.0, "step": 705 }, { "entropy": 6.7185471534729, "epoch": 0.20073508623126943, "grad_norm": 1.4453125, "learning_rate": 0.0003545, "loss": 6.421, "mean_token_accuracy": 0.1382300853729248, "num_tokens": 565738.0, "step": 710 }, { "entropy": 6.691477727890015, "epoch": 0.20214871359909528, "grad_norm": 1.53125, "learning_rate": 0.000357, "loss": 6.4849, "mean_token_accuracy": 0.1443715550005436, "num_tokens": 569629.0, "step": 715 }, { "entropy": 6.537031507492065, "epoch": 0.2035623409669211, "grad_norm": 1.4296875, "learning_rate": 0.0003595, "loss": 6.3245, "mean_token_accuracy": 0.14985155463218688, "num_tokens": 573272.0, "step": 720 }, { "entropy": 6.596857976913452, "epoch": 0.20497596833474696, "grad_norm": 1.3359375, "learning_rate": 0.000362, "loss": 6.3822, "mean_token_accuracy": 0.14262079298496247, "num_tokens": 577224.0, "step": 725 }, { "entropy": 6.525388908386231, "epoch": 0.20638959570257281, "grad_norm": 1.4921875, "learning_rate": 0.0003645, "loss": 6.3224, "mean_token_accuracy": 0.15136756971478463, "num_tokens": 580919.0, "step": 730 }, { "entropy": 6.716662502288818, "epoch": 0.20780322307039864, "grad_norm": 1.6484375, "learning_rate": 0.000367, "loss": 6.445, "mean_token_accuracy": 0.1410931281745434, "num_tokens": 584985.0, "step": 735 }, { "entropy": 6.596371221542358, "epoch": 0.2092168504382245, "grad_norm": 1.3203125, "learning_rate": 0.0003695, "loss": 6.3992, "mean_token_accuracy": 0.15255053117871284, "num_tokens": 588979.0, "step": 740 }, { "entropy": 6.564611911773682, "epoch": 0.21063047780605032, "grad_norm": 1.671875, "learning_rate": 0.000372, "loss": 6.3667, "mean_token_accuracy": 0.1505613371729851, "num_tokens": 592930.0, "step": 745 }, { "entropy": 6.536220741271973, "epoch": 0.21204410517387617, "grad_norm": 1.3984375, "learning_rate": 0.0003745, "loss": 6.4103, "mean_token_accuracy": 0.1515594244003296, "num_tokens": 596832.0, "step": 750 }, { "entropy": 6.828583717346191, "epoch": 0.213457732541702, "grad_norm": 1.8125, "learning_rate": 0.000377, "loss": 6.446, "mean_token_accuracy": 0.14928378835320472, "num_tokens": 600934.0, "step": 755 }, { "entropy": 6.329220914840699, "epoch": 0.21487135990952785, "grad_norm": 1.5390625, "learning_rate": 0.0003795, "loss": 6.3199, "mean_token_accuracy": 0.1495775043964386, "num_tokens": 604868.0, "step": 760 }, { "entropy": 6.744077539443969, "epoch": 0.21628498727735368, "grad_norm": 1.484375, "learning_rate": 0.000382, "loss": 6.4376, "mean_token_accuracy": 0.13565291613340377, "num_tokens": 608747.0, "step": 765 }, { "entropy": 6.577572679519653, "epoch": 0.21769861464517953, "grad_norm": 1.421875, "learning_rate": 0.0003845, "loss": 6.4215, "mean_token_accuracy": 0.1479615420103073, "num_tokens": 612627.0, "step": 770 }, { "entropy": 6.517498445510864, "epoch": 0.21911224201300536, "grad_norm": 1.40625, "learning_rate": 0.00038700000000000003, "loss": 6.3368, "mean_token_accuracy": 0.1571616619825363, "num_tokens": 616455.0, "step": 775 }, { "entropy": 6.5876189231872555, "epoch": 0.2205258693808312, "grad_norm": 1.390625, "learning_rate": 0.00038950000000000003, "loss": 6.4168, "mean_token_accuracy": 0.1469177559018135, "num_tokens": 620617.0, "step": 780 }, { "entropy": 6.415558195114135, "epoch": 0.22193949674865707, "grad_norm": 1.5625, "learning_rate": 0.00039200000000000004, "loss": 6.3376, "mean_token_accuracy": 0.1490316942334175, "num_tokens": 624863.0, "step": 785 }, { "entropy": 6.5751752853393555, "epoch": 0.2233531241164829, "grad_norm": 1.3671875, "learning_rate": 0.00039450000000000005, "loss": 6.3625, "mean_token_accuracy": 0.15206135734915732, "num_tokens": 629073.0, "step": 790 }, { "entropy": 6.595431232452393, "epoch": 0.22476675148430875, "grad_norm": 1.421875, "learning_rate": 0.00039700000000000005, "loss": 6.3723, "mean_token_accuracy": 0.15247093737125397, "num_tokens": 633550.0, "step": 795 }, { "entropy": 6.571492719650268, "epoch": 0.22618037885213457, "grad_norm": 1.6015625, "learning_rate": 0.0003995, "loss": 6.3611, "mean_token_accuracy": 0.15650528520345688, "num_tokens": 637459.0, "step": 800 }, { "entropy": 6.416607141494751, "epoch": 0.22759400621996043, "grad_norm": 1.3359375, "learning_rate": 0.000402, "loss": 6.3272, "mean_token_accuracy": 0.14604957774281502, "num_tokens": 641587.0, "step": 805 }, { "entropy": 6.561601161956787, "epoch": 0.22900763358778625, "grad_norm": 1.6015625, "learning_rate": 0.0004045, "loss": 6.5026, "mean_token_accuracy": 0.14142623618245126, "num_tokens": 645726.0, "step": 810 }, { "entropy": 6.5540244579315186, "epoch": 0.2304212609556121, "grad_norm": 1.453125, "learning_rate": 0.00040699999999999997, "loss": 6.2808, "mean_token_accuracy": 0.15965329706668854, "num_tokens": 649688.0, "step": 815 }, { "entropy": 6.466880655288696, "epoch": 0.23183488832343793, "grad_norm": 1.5390625, "learning_rate": 0.0004095, "loss": 6.3081, "mean_token_accuracy": 0.14743991270661355, "num_tokens": 653745.0, "step": 820 }, { "entropy": 6.281443119049072, "epoch": 0.23324851569126379, "grad_norm": 1.4375, "learning_rate": 0.000412, "loss": 6.2163, "mean_token_accuracy": 0.1635961800813675, "num_tokens": 657650.0, "step": 825 }, { "entropy": 6.540815114974976, "epoch": 0.2346621430590896, "grad_norm": 1.5703125, "learning_rate": 0.0004145, "loss": 6.3282, "mean_token_accuracy": 0.15691596940159797, "num_tokens": 661614.0, "step": 830 }, { "entropy": 6.437383794784546, "epoch": 0.23607577042691547, "grad_norm": 1.4375, "learning_rate": 0.000417, "loss": 6.2877, "mean_token_accuracy": 0.15950870811939238, "num_tokens": 665484.0, "step": 835 }, { "entropy": 6.302047681808472, "epoch": 0.23748939779474132, "grad_norm": 1.7421875, "learning_rate": 0.0004195, "loss": 6.3023, "mean_token_accuracy": 0.1515549197793007, "num_tokens": 669718.0, "step": 840 }, { "entropy": 6.494394445419312, "epoch": 0.23890302516256715, "grad_norm": 1.46875, "learning_rate": 0.000422, "loss": 6.2621, "mean_token_accuracy": 0.1587437778711319, "num_tokens": 673913.0, "step": 845 }, { "entropy": 6.465457439422607, "epoch": 0.240316652530393, "grad_norm": 1.5390625, "learning_rate": 0.0004245, "loss": 6.3427, "mean_token_accuracy": 0.14686428755521774, "num_tokens": 677911.0, "step": 850 }, { "entropy": 6.367018795013427, "epoch": 0.24173027989821882, "grad_norm": 1.4453125, "learning_rate": 0.000427, "loss": 6.1437, "mean_token_accuracy": 0.16687410622835158, "num_tokens": 681629.0, "step": 855 }, { "entropy": 6.405222368240357, "epoch": 0.24314390726604468, "grad_norm": 1.46875, "learning_rate": 0.0004295, "loss": 6.1789, "mean_token_accuracy": 0.15915078967809676, "num_tokens": 685675.0, "step": 860 }, { "entropy": 6.3251574516296385, "epoch": 0.2445575346338705, "grad_norm": 1.375, "learning_rate": 0.000432, "loss": 6.1061, "mean_token_accuracy": 0.16585489213466645, "num_tokens": 689630.0, "step": 865 }, { "entropy": 6.331725025177002, "epoch": 0.24597116200169636, "grad_norm": 1.3828125, "learning_rate": 0.0004345, "loss": 6.2086, "mean_token_accuracy": 0.15823635309934617, "num_tokens": 693580.0, "step": 870 }, { "entropy": 6.292018890380859, "epoch": 0.24738478936952218, "grad_norm": 1.53125, "learning_rate": 0.000437, "loss": 6.2824, "mean_token_accuracy": 0.15428755432367325, "num_tokens": 697531.0, "step": 875 }, { "entropy": 6.245914125442505, "epoch": 0.24879841673734804, "grad_norm": 1.453125, "learning_rate": 0.0004395, "loss": 6.2452, "mean_token_accuracy": 0.16177606135606765, "num_tokens": 701421.0, "step": 880 }, { "entropy": 6.380286502838135, "epoch": 0.2502120441051739, "grad_norm": 1.3203125, "learning_rate": 0.000442, "loss": 6.2034, "mean_token_accuracy": 0.158734093606472, "num_tokens": 705557.0, "step": 885 }, { "entropy": 6.279850482940674, "epoch": 0.2516256714729997, "grad_norm": 1.453125, "learning_rate": 0.0004445, "loss": 6.1344, "mean_token_accuracy": 0.1670902654528618, "num_tokens": 709173.0, "step": 890 }, { "entropy": 6.265487957000732, "epoch": 0.25303929884082554, "grad_norm": 1.4921875, "learning_rate": 0.000447, "loss": 6.0852, "mean_token_accuracy": 0.1611698791384697, "num_tokens": 713144.0, "step": 895 }, { "entropy": 6.158499622344971, "epoch": 0.2544529262086514, "grad_norm": 1.359375, "learning_rate": 0.00044950000000000003, "loss": 6.3942, "mean_token_accuracy": 0.15290624499320984, "num_tokens": 717187.0, "step": 900 }, { "entropy": 6.500699520111084, "epoch": 0.25586655357647725, "grad_norm": 1.3125, "learning_rate": 0.00045200000000000004, "loss": 6.2656, "mean_token_accuracy": 0.14998120591044425, "num_tokens": 721311.0, "step": 905 }, { "entropy": 6.283317804336548, "epoch": 0.2572801809443031, "grad_norm": 1.46875, "learning_rate": 0.00045450000000000004, "loss": 6.1865, "mean_token_accuracy": 0.1690343588590622, "num_tokens": 725193.0, "step": 910 }, { "entropy": 6.32297830581665, "epoch": 0.2586938083121289, "grad_norm": 1.296875, "learning_rate": 0.00045700000000000005, "loss": 6.1775, "mean_token_accuracy": 0.1630359873175621, "num_tokens": 729208.0, "step": 915 }, { "entropy": 6.252132749557495, "epoch": 0.26010743567995476, "grad_norm": 1.4609375, "learning_rate": 0.00045950000000000006, "loss": 6.2431, "mean_token_accuracy": 0.162384469807148, "num_tokens": 733364.0, "step": 920 }, { "entropy": 6.240159702301026, "epoch": 0.2615210630477806, "grad_norm": 1.4921875, "learning_rate": 0.000462, "loss": 6.1907, "mean_token_accuracy": 0.16134183555841447, "num_tokens": 737549.0, "step": 925 }, { "entropy": 6.357678174972534, "epoch": 0.26293469041560646, "grad_norm": 1.359375, "learning_rate": 0.0004645, "loss": 6.2012, "mean_token_accuracy": 0.16150422096252443, "num_tokens": 742009.0, "step": 930 }, { "entropy": 6.26593918800354, "epoch": 0.26434831778343226, "grad_norm": 1.4921875, "learning_rate": 0.000467, "loss": 6.3095, "mean_token_accuracy": 0.1559640161693096, "num_tokens": 746258.0, "step": 935 }, { "entropy": 6.422447776794433, "epoch": 0.2657619451512581, "grad_norm": 1.5234375, "learning_rate": 0.0004695, "loss": 6.2134, "mean_token_accuracy": 0.16972213834524155, "num_tokens": 750027.0, "step": 940 }, { "entropy": 6.179395294189453, "epoch": 0.26717557251908397, "grad_norm": 1.5078125, "learning_rate": 0.000472, "loss": 6.1788, "mean_token_accuracy": 0.15804249197244644, "num_tokens": 754030.0, "step": 945 }, { "entropy": 6.166366243362427, "epoch": 0.2685891998869098, "grad_norm": 1.46875, "learning_rate": 0.0004745, "loss": 6.0744, "mean_token_accuracy": 0.1662062868475914, "num_tokens": 757663.0, "step": 950 }, { "entropy": 6.173876714706421, "epoch": 0.2700028272547357, "grad_norm": 1.3671875, "learning_rate": 0.000477, "loss": 6.1816, "mean_token_accuracy": 0.1622084781527519, "num_tokens": 761806.0, "step": 955 }, { "entropy": 6.358310317993164, "epoch": 0.2714164546225615, "grad_norm": 1.484375, "learning_rate": 0.0004795, "loss": 6.1687, "mean_token_accuracy": 0.1678529866039753, "num_tokens": 765900.0, "step": 960 }, { "entropy": 6.13313364982605, "epoch": 0.27283008199038733, "grad_norm": 1.3359375, "learning_rate": 0.000482, "loss": 6.1376, "mean_token_accuracy": 0.16201107054948807, "num_tokens": 769842.0, "step": 965 }, { "entropy": 6.349887704849243, "epoch": 0.2742437093582132, "grad_norm": 1.5234375, "learning_rate": 0.0004845, "loss": 6.2531, "mean_token_accuracy": 0.16530761122703552, "num_tokens": 773717.0, "step": 970 }, { "entropy": 6.021614742279053, "epoch": 0.27565733672603904, "grad_norm": 1.3984375, "learning_rate": 0.000487, "loss": 5.9991, "mean_token_accuracy": 0.17551461309194566, "num_tokens": 777720.0, "step": 975 }, { "entropy": 6.14023642539978, "epoch": 0.27707096409386484, "grad_norm": 1.640625, "learning_rate": 0.0004895, "loss": 6.027, "mean_token_accuracy": 0.16881906613707542, "num_tokens": 781482.0, "step": 980 }, { "entropy": 6.2495396614074705, "epoch": 0.2784845914616907, "grad_norm": 1.671875, "learning_rate": 0.000492, "loss": 6.1729, "mean_token_accuracy": 0.15896565914154054, "num_tokens": 785390.0, "step": 985 }, { "entropy": 5.967093658447266, "epoch": 0.27989821882951654, "grad_norm": 1.40625, "learning_rate": 0.0004945, "loss": 6.0915, "mean_token_accuracy": 0.1750103384256363, "num_tokens": 789464.0, "step": 990 }, { "entropy": 6.431793308258056, "epoch": 0.2813118461973424, "grad_norm": 1.46875, "learning_rate": 0.000497, "loss": 6.179, "mean_token_accuracy": 0.15985391139984131, "num_tokens": 793229.0, "step": 995 }, { "entropy": 6.186357164382935, "epoch": 0.2827254735651682, "grad_norm": 1.46875, "learning_rate": 0.0004995, "loss": 6.0844, "mean_token_accuracy": 0.1675830215215683, "num_tokens": 797490.0, "step": 1000 }, { "epoch": 0.2827254735651682, "eval_entropy": 6.063302199271112, "eval_loss": 6.372450828552246, "eval_mean_token_accuracy": 0.16418416006589595, "eval_num_tokens": 797490.0, "eval_runtime": 6.7832, "eval_samples_per_second": 1663.516, "eval_steps_per_second": 208.013, "step": 1000 }, { "entropy": 6.069096565246582, "epoch": 0.28413910093299405, "grad_norm": 1.4296875, "learning_rate": 0.0004999999849524451, "loss": 6.136, "mean_token_accuracy": 0.16406980752944947, "num_tokens": 801242.0, "step": 1005 }, { "entropy": 6.29629168510437, "epoch": 0.2855527283008199, "grad_norm": 1.5390625, "learning_rate": 0.000499999923821757, "loss": 6.2518, "mean_token_accuracy": 0.15641706585884094, "num_tokens": 805285.0, "step": 1010 }, { "entropy": 6.121434211730957, "epoch": 0.28696635566864576, "grad_norm": 1.3515625, "learning_rate": 0.000499999815667476, "loss": 6.0715, "mean_token_accuracy": 0.17298818677663802, "num_tokens": 809278.0, "step": 1015 }, { "entropy": 6.067972850799561, "epoch": 0.2883799830364716, "grad_norm": 1.3359375, "learning_rate": 0.0004999996604896251, "loss": 6.198, "mean_token_accuracy": 0.17273716926574706, "num_tokens": 813519.0, "step": 1020 }, { "entropy": 6.159738492965698, "epoch": 0.2897936104042974, "grad_norm": 1.421875, "learning_rate": 0.0004999994582882363, "loss": 6.1376, "mean_token_accuracy": 0.1695775046944618, "num_tokens": 817549.0, "step": 1025 }, { "entropy": 6.177052736282349, "epoch": 0.29120723777212326, "grad_norm": 1.359375, "learning_rate": 0.0004999992090633522, "loss": 6.0973, "mean_token_accuracy": 0.16485699787735938, "num_tokens": 821608.0, "step": 1030 }, { "entropy": 5.899837636947632, "epoch": 0.2926208651399491, "grad_norm": 1.4453125, "learning_rate": 0.0004999989128150248, "loss": 6.0539, "mean_token_accuracy": 0.17530483603477479, "num_tokens": 825795.0, "step": 1035 }, { "entropy": 6.26076979637146, "epoch": 0.29403449250777497, "grad_norm": 1.3828125, "learning_rate": 0.0004999985695433159, "loss": 6.1328, "mean_token_accuracy": 0.1712009161710739, "num_tokens": 829693.0, "step": 1040 }, { "entropy": 6.17474045753479, "epoch": 0.29544811987560077, "grad_norm": 1.3046875, "learning_rate": 0.0004999981792482973, "loss": 6.157, "mean_token_accuracy": 0.16908271610736847, "num_tokens": 833665.0, "step": 1045 }, { "entropy": 6.174765777587891, "epoch": 0.2968617472434266, "grad_norm": 1.515625, "learning_rate": 0.0004999977419300507, "loss": 6.0853, "mean_token_accuracy": 0.16263003200292586, "num_tokens": 837107.0, "step": 1050 }, { "entropy": 6.165372848510742, "epoch": 0.2982753746112525, "grad_norm": 1.3359375, "learning_rate": 0.0004999972575886673, "loss": 6.2114, "mean_token_accuracy": 0.16624142229557037, "num_tokens": 841182.0, "step": 1055 }, { "entropy": 6.30288724899292, "epoch": 0.29968900197907833, "grad_norm": 1.265625, "learning_rate": 0.0004999967262242483, "loss": 6.1395, "mean_token_accuracy": 0.16506897360086442, "num_tokens": 845266.0, "step": 1060 }, { "entropy": 6.16644515991211, "epoch": 0.3011026293469042, "grad_norm": 1.453125, "learning_rate": 0.000499996147836905, "loss": 6.1257, "mean_token_accuracy": 0.16231662929058074, "num_tokens": 849118.0, "step": 1065 }, { "entropy": 6.304385757446289, "epoch": 0.30251625671473, "grad_norm": 1.4609375, "learning_rate": 0.000499995522426758, "loss": 6.2201, "mean_token_accuracy": 0.16377525627613068, "num_tokens": 853101.0, "step": 1070 }, { "entropy": 5.996787118911743, "epoch": 0.30392988408255583, "grad_norm": 1.46875, "learning_rate": 0.0004999948499939383, "loss": 6.0619, "mean_token_accuracy": 0.1750151202082634, "num_tokens": 856671.0, "step": 1075 }, { "entropy": 6.145863771438599, "epoch": 0.3053435114503817, "grad_norm": 1.34375, "learning_rate": 0.0004999941305385863, "loss": 6.009, "mean_token_accuracy": 0.1848408907651901, "num_tokens": 860639.0, "step": 1080 }, { "entropy": 6.0218729972839355, "epoch": 0.30675713881820754, "grad_norm": 1.5546875, "learning_rate": 0.0004999933640608521, "loss": 6.0525, "mean_token_accuracy": 0.16953370422124864, "num_tokens": 864270.0, "step": 1085 }, { "entropy": 6.129056644439697, "epoch": 0.30817076618603334, "grad_norm": 1.53125, "learning_rate": 0.0004999925505608963, "loss": 6.0399, "mean_token_accuracy": 0.16365957260131836, "num_tokens": 868069.0, "step": 1090 }, { "entropy": 6.096409034729004, "epoch": 0.3095843935538592, "grad_norm": 1.3984375, "learning_rate": 0.0004999916900388887, "loss": 6.07, "mean_token_accuracy": 0.16356224715709686, "num_tokens": 871943.0, "step": 1095 }, { "entropy": 6.21712646484375, "epoch": 0.31099802092168505, "grad_norm": 1.3671875, "learning_rate": 0.0004999907824950093, "loss": 6.0956, "mean_token_accuracy": 0.17098572999238967, "num_tokens": 876168.0, "step": 1100 }, { "entropy": 5.9889732837677006, "epoch": 0.3124116482895109, "grad_norm": 1.5234375, "learning_rate": 0.0004999898279294475, "loss": 6.0648, "mean_token_accuracy": 0.1675517365336418, "num_tokens": 880134.0, "step": 1105 }, { "entropy": 6.075795602798462, "epoch": 0.3138252756573367, "grad_norm": 1.46875, "learning_rate": 0.0004999888263424031, "loss": 6.0542, "mean_token_accuracy": 0.16933156102895736, "num_tokens": 883970.0, "step": 1110 }, { "entropy": 6.1346986293792725, "epoch": 0.31523890302516255, "grad_norm": 1.5390625, "learning_rate": 0.0004999877777340852, "loss": 6.1297, "mean_token_accuracy": 0.15770118832588195, "num_tokens": 887980.0, "step": 1115 }, { "entropy": 5.962949466705322, "epoch": 0.3166525303929884, "grad_norm": 1.296875, "learning_rate": 0.000499986682104713, "loss": 5.9096, "mean_token_accuracy": 0.18470141440629959, "num_tokens": 891867.0, "step": 1120 }, { "entropy": 5.931029558181763, "epoch": 0.31806615776081426, "grad_norm": 1.34375, "learning_rate": 0.0004999855394545157, "loss": 6.0265, "mean_token_accuracy": 0.17036193311214448, "num_tokens": 895769.0, "step": 1125 }, { "entropy": 6.057384490966797, "epoch": 0.3194797851286401, "grad_norm": 1.3515625, "learning_rate": 0.0004999843497837317, "loss": 5.9771, "mean_token_accuracy": 0.16771688610315322, "num_tokens": 899640.0, "step": 1130 }, { "entropy": 5.935440540313721, "epoch": 0.3208934124964659, "grad_norm": 1.3125, "learning_rate": 0.00049998311309261, "loss": 5.9876, "mean_token_accuracy": 0.1825812965631485, "num_tokens": 903598.0, "step": 1135 }, { "entropy": 6.0772843837738035, "epoch": 0.32230703986429177, "grad_norm": 1.5078125, "learning_rate": 0.0004999818293814089, "loss": 6.0469, "mean_token_accuracy": 0.17144874930381776, "num_tokens": 907720.0, "step": 1140 }, { "entropy": 5.91833529472351, "epoch": 0.3237206672321176, "grad_norm": 1.34375, "learning_rate": 0.0004999804986503966, "loss": 6.001, "mean_token_accuracy": 0.1728842318058014, "num_tokens": 911531.0, "step": 1145 }, { "entropy": 6.0705688953399655, "epoch": 0.3251342945999435, "grad_norm": 1.4921875, "learning_rate": 0.0004999791208998513, "loss": 5.9162, "mean_token_accuracy": 0.17554775178432463, "num_tokens": 915428.0, "step": 1150 }, { "entropy": 5.908070373535156, "epoch": 0.3265479219677693, "grad_norm": 1.3984375, "learning_rate": 0.0004999776961300611, "loss": 5.957, "mean_token_accuracy": 0.1746842861175537, "num_tokens": 919499.0, "step": 1155 }, { "entropy": 6.098568487167358, "epoch": 0.3279615493355951, "grad_norm": 1.296875, "learning_rate": 0.0004999762243413236, "loss": 5.9827, "mean_token_accuracy": 0.176666696369648, "num_tokens": 923530.0, "step": 1160 }, { "entropy": 5.904607772827148, "epoch": 0.329375176703421, "grad_norm": 1.28125, "learning_rate": 0.0004999747055339464, "loss": 5.9302, "mean_token_accuracy": 0.18254795223474501, "num_tokens": 927770.0, "step": 1165 }, { "entropy": 5.955020999908447, "epoch": 0.33078880407124683, "grad_norm": 1.5234375, "learning_rate": 0.0004999731397082469, "loss": 5.9771, "mean_token_accuracy": 0.17447073385119438, "num_tokens": 932008.0, "step": 1170 }, { "entropy": 6.0833601474761965, "epoch": 0.3322024314390727, "grad_norm": 1.3671875, "learning_rate": 0.0004999715268645524, "loss": 5.9811, "mean_token_accuracy": 0.18211427927017212, "num_tokens": 936388.0, "step": 1175 }, { "entropy": 5.904801702499389, "epoch": 0.3336160588068985, "grad_norm": 1.40625, "learning_rate": 0.0004999698670032, "loss": 6.0315, "mean_token_accuracy": 0.1786898285150528, "num_tokens": 940436.0, "step": 1180 }, { "entropy": 6.072543048858643, "epoch": 0.33502968617472434, "grad_norm": 1.3671875, "learning_rate": 0.0004999681601245366, "loss": 6.0486, "mean_token_accuracy": 0.17283598110079765, "num_tokens": 944296.0, "step": 1185 }, { "entropy": 6.052107238769532, "epoch": 0.3364433135425502, "grad_norm": 1.3984375, "learning_rate": 0.0004999664062289189, "loss": 6.0668, "mean_token_accuracy": 0.17393210679292678, "num_tokens": 948318.0, "step": 1190 }, { "entropy": 6.093935489654541, "epoch": 0.33785694091037605, "grad_norm": 1.3359375, "learning_rate": 0.0004999646053167134, "loss": 5.9547, "mean_token_accuracy": 0.17875370681285857, "num_tokens": 952147.0, "step": 1195 }, { "entropy": 6.063412761688232, "epoch": 0.33927056827820185, "grad_norm": 1.5625, "learning_rate": 0.0004999627573882966, "loss": 6.0947, "mean_token_accuracy": 0.16490099132061004, "num_tokens": 956445.0, "step": 1200 }, { "entropy": 5.901909017562867, "epoch": 0.3406841956460277, "grad_norm": 1.4375, "learning_rate": 0.0004999608624440546, "loss": 5.9295, "mean_token_accuracy": 0.17917849570512773, "num_tokens": 960327.0, "step": 1205 }, { "entropy": 6.053218269348145, "epoch": 0.34209782301385355, "grad_norm": 1.3828125, "learning_rate": 0.0004999589204843834, "loss": 6.0542, "mean_token_accuracy": 0.17569087892770768, "num_tokens": 964387.0, "step": 1210 }, { "entropy": 6.057649898529053, "epoch": 0.3435114503816794, "grad_norm": 1.375, "learning_rate": 0.000499956931509689, "loss": 5.9893, "mean_token_accuracy": 0.17533947229385377, "num_tokens": 968327.0, "step": 1215 }, { "entropy": 6.110534811019898, "epoch": 0.3449250777495052, "grad_norm": 1.4375, "learning_rate": 0.000499954895520387, "loss": 6.0285, "mean_token_accuracy": 0.17372053861618042, "num_tokens": 972358.0, "step": 1220 }, { "entropy": 5.764717531204224, "epoch": 0.34633870511733106, "grad_norm": 1.4140625, "learning_rate": 0.0004999528125169028, "loss": 5.9328, "mean_token_accuracy": 0.17071535885334016, "num_tokens": 976266.0, "step": 1225 }, { "entropy": 5.965855121612549, "epoch": 0.3477523324851569, "grad_norm": 1.3046875, "learning_rate": 0.000499950682499672, "loss": 6.0183, "mean_token_accuracy": 0.17038709074258804, "num_tokens": 980521.0, "step": 1230 }, { "entropy": 6.097711992263794, "epoch": 0.34916595985298277, "grad_norm": 1.328125, "learning_rate": 0.0004999485054691395, "loss": 5.9159, "mean_token_accuracy": 0.17354207187891008, "num_tokens": 984413.0, "step": 1235 }, { "entropy": 6.042867660522461, "epoch": 0.3505795872208086, "grad_norm": 1.390625, "learning_rate": 0.0004999462814257604, "loss": 6.0334, "mean_token_accuracy": 0.16417137533426285, "num_tokens": 988080.0, "step": 1240 }, { "entropy": 6.060603237152099, "epoch": 0.3519932145886344, "grad_norm": 1.359375, "learning_rate": 0.0004999440103699996, "loss": 5.9772, "mean_token_accuracy": 0.18074256777763367, "num_tokens": 992010.0, "step": 1245 }, { "entropy": 5.730267524719238, "epoch": 0.35340684195646027, "grad_norm": 1.3828125, "learning_rate": 0.0004999416923023316, "loss": 5.8617, "mean_token_accuracy": 0.18689277470111848, "num_tokens": 995721.0, "step": 1250 }, { "entropy": 5.8941511631011965, "epoch": 0.3548204693242861, "grad_norm": 1.359375, "learning_rate": 0.0004999393272232409, "loss": 5.9628, "mean_token_accuracy": 0.1740591511130333, "num_tokens": 999763.0, "step": 1255 }, { "entropy": 6.133557987213135, "epoch": 0.356234096692112, "grad_norm": 1.34375, "learning_rate": 0.0004999369151332218, "loss": 6.0322, "mean_token_accuracy": 0.17545345425605774, "num_tokens": 1003610.0, "step": 1260 }, { "entropy": 5.98744478225708, "epoch": 0.3576477240599378, "grad_norm": 1.453125, "learning_rate": 0.0004999344560327784, "loss": 5.9228, "mean_token_accuracy": 0.17964100390672683, "num_tokens": 1007699.0, "step": 1265 }, { "entropy": 5.86641001701355, "epoch": 0.35906135142776363, "grad_norm": 1.4921875, "learning_rate": 0.0004999319499224247, "loss": 5.904, "mean_token_accuracy": 0.1844222739338875, "num_tokens": 1011573.0, "step": 1270 }, { "entropy": 5.9154126167297365, "epoch": 0.3604749787955895, "grad_norm": 1.3671875, "learning_rate": 0.0004999293968026843, "loss": 6.0189, "mean_token_accuracy": 0.17944376170635223, "num_tokens": 1015569.0, "step": 1275 }, { "entropy": 6.00258355140686, "epoch": 0.36188860616341534, "grad_norm": 1.4375, "learning_rate": 0.0004999267966740909, "loss": 5.8752, "mean_token_accuracy": 0.18310932219028472, "num_tokens": 1019451.0, "step": 1280 }, { "entropy": 5.903419113159179, "epoch": 0.3633022335312412, "grad_norm": 1.4375, "learning_rate": 0.000499924149537188, "loss": 5.8026, "mean_token_accuracy": 0.18908512145280837, "num_tokens": 1023084.0, "step": 1285 }, { "entropy": 5.935181188583374, "epoch": 0.364715860899067, "grad_norm": 1.4453125, "learning_rate": 0.0004999214553925287, "loss": 5.9164, "mean_token_accuracy": 0.18504925072193146, "num_tokens": 1026941.0, "step": 1290 }, { "entropy": 5.918446159362793, "epoch": 0.36612948826689284, "grad_norm": 1.3671875, "learning_rate": 0.0004999187142406761, "loss": 5.8357, "mean_token_accuracy": 0.1875179424881935, "num_tokens": 1030872.0, "step": 1295 }, { "entropy": 5.95609302520752, "epoch": 0.3675431156347187, "grad_norm": 1.3828125, "learning_rate": 0.000499915926082203, "loss": 5.9616, "mean_token_accuracy": 0.17633716613054276, "num_tokens": 1035024.0, "step": 1300 }, { "entropy": 5.878836631774902, "epoch": 0.36895674300254455, "grad_norm": 1.3984375, "learning_rate": 0.0004999130909176923, "loss": 5.8229, "mean_token_accuracy": 0.17987947165966034, "num_tokens": 1038988.0, "step": 1305 }, { "entropy": 5.842767524719238, "epoch": 0.37037037037037035, "grad_norm": 1.296875, "learning_rate": 0.0004999102087477362, "loss": 5.7784, "mean_token_accuracy": 0.19531663954257966, "num_tokens": 1043068.0, "step": 1310 }, { "entropy": 5.79612102508545, "epoch": 0.3717839977381962, "grad_norm": 1.375, "learning_rate": 0.0004999072795729376, "loss": 5.8488, "mean_token_accuracy": 0.18711667507886887, "num_tokens": 1046931.0, "step": 1315 }, { "entropy": 5.752354717254638, "epoch": 0.37319762510602206, "grad_norm": 1.3671875, "learning_rate": 0.0004999043033939081, "loss": 5.792, "mean_token_accuracy": 0.18978319317102432, "num_tokens": 1050718.0, "step": 1320 }, { "entropy": 5.9706896305084225, "epoch": 0.3746112524738479, "grad_norm": 1.4453125, "learning_rate": 0.0004999012802112701, "loss": 5.8829, "mean_token_accuracy": 0.17118766903877258, "num_tokens": 1054796.0, "step": 1325 }, { "entropy": 5.830494022369384, "epoch": 0.3760248798416737, "grad_norm": 1.3671875, "learning_rate": 0.0004998982100256552, "loss": 5.8218, "mean_token_accuracy": 0.1836886391043663, "num_tokens": 1058657.0, "step": 1330 }, { "entropy": 5.859378147125244, "epoch": 0.37743850720949956, "grad_norm": 1.3515625, "learning_rate": 0.0004998950928377052, "loss": 5.9446, "mean_token_accuracy": 0.18499152809381486, "num_tokens": 1062532.0, "step": 1335 }, { "entropy": 5.9526323795318605, "epoch": 0.3788521345773254, "grad_norm": 1.3984375, "learning_rate": 0.0004998919286480713, "loss": 5.7847, "mean_token_accuracy": 0.18415039628744126, "num_tokens": 1066274.0, "step": 1340 }, { "entropy": 5.845388412475586, "epoch": 0.38026576194515127, "grad_norm": 1.3515625, "learning_rate": 0.0004998887174574153, "loss": 5.898, "mean_token_accuracy": 0.1804192841053009, "num_tokens": 1070179.0, "step": 1345 }, { "entropy": 5.898585224151612, "epoch": 0.3816793893129771, "grad_norm": 1.40625, "learning_rate": 0.0004998854592664079, "loss": 5.8693, "mean_token_accuracy": 0.1799743041396141, "num_tokens": 1073892.0, "step": 1350 }, { "entropy": 5.964764881134033, "epoch": 0.3830930166808029, "grad_norm": 1.2890625, "learning_rate": 0.0004998821540757301, "loss": 5.9282, "mean_token_accuracy": 0.18046344667673112, "num_tokens": 1078399.0, "step": 1355 }, { "entropy": 5.830195188522339, "epoch": 0.3845066440486288, "grad_norm": 1.3046875, "learning_rate": 0.0004998788018860728, "loss": 5.8309, "mean_token_accuracy": 0.18262680023908615, "num_tokens": 1082371.0, "step": 1360 }, { "entropy": 6.0038042068481445, "epoch": 0.38592027141645463, "grad_norm": 1.4609375, "learning_rate": 0.0004998754026981364, "loss": 5.9601, "mean_token_accuracy": 0.1667673259973526, "num_tokens": 1086474.0, "step": 1365 }, { "entropy": 5.914479732513428, "epoch": 0.3873338987842805, "grad_norm": 1.265625, "learning_rate": 0.0004998719565126316, "loss": 5.8866, "mean_token_accuracy": 0.18313463181257247, "num_tokens": 1090519.0, "step": 1370 }, { "entropy": 5.778615236282349, "epoch": 0.3887475261521063, "grad_norm": 1.25, "learning_rate": 0.0004998684633302783, "loss": 5.8137, "mean_token_accuracy": 0.17858949154615403, "num_tokens": 1094450.0, "step": 1375 }, { "entropy": 6.106761884689331, "epoch": 0.39016115351993214, "grad_norm": 1.421875, "learning_rate": 0.0004998649231518068, "loss": 5.8724, "mean_token_accuracy": 0.1757311686873436, "num_tokens": 1098249.0, "step": 1380 }, { "entropy": 5.754768514633179, "epoch": 0.391574780887758, "grad_norm": 1.3828125, "learning_rate": 0.0004998613359779568, "loss": 5.8116, "mean_token_accuracy": 0.18666931986808777, "num_tokens": 1101951.0, "step": 1385 }, { "entropy": 5.7896898746490475, "epoch": 0.39298840825558384, "grad_norm": 1.3984375, "learning_rate": 0.0004998577018094782, "loss": 5.8577, "mean_token_accuracy": 0.18320763409137725, "num_tokens": 1106097.0, "step": 1390 }, { "entropy": 5.87284574508667, "epoch": 0.3944020356234097, "grad_norm": 1.390625, "learning_rate": 0.0004998540206471304, "loss": 5.7767, "mean_token_accuracy": 0.19519320279359817, "num_tokens": 1110031.0, "step": 1395 }, { "entropy": 5.86262526512146, "epoch": 0.3958156629912355, "grad_norm": 1.34375, "learning_rate": 0.0004998502924916826, "loss": 5.9447, "mean_token_accuracy": 0.1763763576745987, "num_tokens": 1114146.0, "step": 1400 }, { "entropy": 5.977203845977783, "epoch": 0.39722929035906135, "grad_norm": 1.3125, "learning_rate": 0.0004998465173439142, "loss": 5.9148, "mean_token_accuracy": 0.18122531175613404, "num_tokens": 1118161.0, "step": 1405 }, { "entropy": 5.8424163341522215, "epoch": 0.3986429177268872, "grad_norm": 1.28125, "learning_rate": 0.0004998426952046142, "loss": 5.699, "mean_token_accuracy": 0.2005566254258156, "num_tokens": 1122014.0, "step": 1410 }, { "entropy": 5.684796667098999, "epoch": 0.40005654509471306, "grad_norm": 1.390625, "learning_rate": 0.0004998388260745811, "loss": 5.8875, "mean_token_accuracy": 0.18261732757091523, "num_tokens": 1125929.0, "step": 1415 }, { "entropy": 5.9797446727752686, "epoch": 0.40147017246253885, "grad_norm": 1.3671875, "learning_rate": 0.0004998349099546238, "loss": 5.8277, "mean_token_accuracy": 0.17909095138311387, "num_tokens": 1129781.0, "step": 1420 }, { "entropy": 5.744542932510376, "epoch": 0.4028837998303647, "grad_norm": 1.3203125, "learning_rate": 0.0004998309468455606, "loss": 5.7346, "mean_token_accuracy": 0.19376294761896135, "num_tokens": 1133591.0, "step": 1425 }, { "entropy": 5.857560825347901, "epoch": 0.40429742719819056, "grad_norm": 1.3671875, "learning_rate": 0.0004998269367482199, "loss": 5.877, "mean_token_accuracy": 0.184601990878582, "num_tokens": 1137406.0, "step": 1430 }, { "entropy": 5.766568803787232, "epoch": 0.4057110545660164, "grad_norm": 1.546875, "learning_rate": 0.0004998228796634396, "loss": 5.8087, "mean_token_accuracy": 0.18684434592723848, "num_tokens": 1141393.0, "step": 1435 }, { "entropy": 5.924833011627197, "epoch": 0.4071246819338422, "grad_norm": 1.3984375, "learning_rate": 0.0004998187755920677, "loss": 5.9094, "mean_token_accuracy": 0.18260146528482438, "num_tokens": 1145155.0, "step": 1440 }, { "entropy": 5.778390026092529, "epoch": 0.40853830930166807, "grad_norm": 1.375, "learning_rate": 0.0004998146245349621, "loss": 5.8873, "mean_token_accuracy": 0.18451330810785294, "num_tokens": 1149104.0, "step": 1445 }, { "entropy": 5.859285831451416, "epoch": 0.4099519366694939, "grad_norm": 1.359375, "learning_rate": 0.0004998104264929901, "loss": 5.8317, "mean_token_accuracy": 0.1783102497458458, "num_tokens": 1153022.0, "step": 1450 }, { "entropy": 5.8625123500823975, "epoch": 0.4113655640373198, "grad_norm": 1.453125, "learning_rate": 0.0004998061814670291, "loss": 5.8618, "mean_token_accuracy": 0.18217997699975969, "num_tokens": 1156965.0, "step": 1455 }, { "entropy": 5.861889934539795, "epoch": 0.41277919140514563, "grad_norm": 1.3359375, "learning_rate": 0.0004998018894579664, "loss": 5.7965, "mean_token_accuracy": 0.19408051073551177, "num_tokens": 1160893.0, "step": 1460 }, { "entropy": 5.9454748153686525, "epoch": 0.4141928187729714, "grad_norm": 1.2109375, "learning_rate": 0.0004997975504666989, "loss": 5.9433, "mean_token_accuracy": 0.17259618788957595, "num_tokens": 1165037.0, "step": 1465 }, { "entropy": 5.8799817085266115, "epoch": 0.4156064461407973, "grad_norm": 1.59375, "learning_rate": 0.0004997931644941335, "loss": 5.8166, "mean_token_accuracy": 0.17416656017303467, "num_tokens": 1168911.0, "step": 1470 }, { "entropy": 5.8028968334197994, "epoch": 0.41702007350862313, "grad_norm": 1.5078125, "learning_rate": 0.0004997887315411867, "loss": 5.815, "mean_token_accuracy": 0.19042931646108627, "num_tokens": 1172861.0, "step": 1475 }, { "entropy": 5.802371263504028, "epoch": 0.418433700876449, "grad_norm": 1.3359375, "learning_rate": 0.0004997842516087852, "loss": 5.852, "mean_token_accuracy": 0.18393263071775437, "num_tokens": 1177361.0, "step": 1480 }, { "entropy": 5.927545642852783, "epoch": 0.4198473282442748, "grad_norm": 1.375, "learning_rate": 0.0004997797246978651, "loss": 5.8468, "mean_token_accuracy": 0.17632220238447188, "num_tokens": 1181549.0, "step": 1485 }, { "entropy": 5.839781713485718, "epoch": 0.42126095561210064, "grad_norm": 1.34375, "learning_rate": 0.0004997751508093724, "loss": 5.8349, "mean_token_accuracy": 0.1818211019039154, "num_tokens": 1185685.0, "step": 1490 }, { "entropy": 5.837100982666016, "epoch": 0.4226745829799265, "grad_norm": 1.46875, "learning_rate": 0.0004997705299442632, "loss": 5.9818, "mean_token_accuracy": 0.17524709403514863, "num_tokens": 1189557.0, "step": 1495 }, { "entropy": 5.887031126022339, "epoch": 0.42408821034775235, "grad_norm": 1.34375, "learning_rate": 0.0004997658621035033, "loss": 5.8772, "mean_token_accuracy": 0.1873631939291954, "num_tokens": 1193969.0, "step": 1500 }, { "entropy": 5.887158012390136, "epoch": 0.42550183771557815, "grad_norm": 1.421875, "learning_rate": 0.0004997611472880681, "loss": 5.8533, "mean_token_accuracy": 0.19286071956157685, "num_tokens": 1197843.0, "step": 1505 }, { "entropy": 5.8976044178009035, "epoch": 0.426915465083404, "grad_norm": 1.3359375, "learning_rate": 0.000499756385498943, "loss": 5.8637, "mean_token_accuracy": 0.17578741312026977, "num_tokens": 1201938.0, "step": 1510 }, { "entropy": 5.803966426849366, "epoch": 0.42832909245122985, "grad_norm": 1.3359375, "learning_rate": 0.0004997515767371231, "loss": 5.6951, "mean_token_accuracy": 0.1796621337532997, "num_tokens": 1205757.0, "step": 1515 }, { "entropy": 5.830338954925537, "epoch": 0.4297427198190557, "grad_norm": 1.3515625, "learning_rate": 0.0004997467210036135, "loss": 5.8731, "mean_token_accuracy": 0.18170178532600403, "num_tokens": 1209779.0, "step": 1520 }, { "entropy": 5.859526443481445, "epoch": 0.43115634718688156, "grad_norm": 1.359375, "learning_rate": 0.000499741818299429, "loss": 5.8099, "mean_token_accuracy": 0.18744910210371019, "num_tokens": 1213598.0, "step": 1525 }, { "entropy": 5.872071599960327, "epoch": 0.43256997455470736, "grad_norm": 1.328125, "learning_rate": 0.0004997368686255943, "loss": 5.7304, "mean_token_accuracy": 0.18553417176008224, "num_tokens": 1217452.0, "step": 1530 }, { "entropy": 5.825813913345337, "epoch": 0.4339836019225332, "grad_norm": 1.4375, "learning_rate": 0.0004997318719831438, "loss": 5.8642, "mean_token_accuracy": 0.1814598798751831, "num_tokens": 1221354.0, "step": 1535 }, { "entropy": 5.778457069396973, "epoch": 0.43539722929035907, "grad_norm": 1.390625, "learning_rate": 0.0004997268283731216, "loss": 5.7543, "mean_token_accuracy": 0.1856408089399338, "num_tokens": 1225217.0, "step": 1540 }, { "entropy": 5.878414440155029, "epoch": 0.4368108566581849, "grad_norm": 1.2734375, "learning_rate": 0.0004997217377965821, "loss": 5.7805, "mean_token_accuracy": 0.17437221556901933, "num_tokens": 1229016.0, "step": 1545 }, { "entropy": 5.771785020828247, "epoch": 0.4382244840260107, "grad_norm": 1.4140625, "learning_rate": 0.000499716600254589, "loss": 5.8818, "mean_token_accuracy": 0.1883689671754837, "num_tokens": 1232825.0, "step": 1550 }, { "entropy": 5.897240686416626, "epoch": 0.4396381113938366, "grad_norm": 1.2421875, "learning_rate": 0.000499711415748216, "loss": 5.799, "mean_token_accuracy": 0.18249992430210113, "num_tokens": 1237032.0, "step": 1555 }, { "entropy": 5.602204322814941, "epoch": 0.4410517387616624, "grad_norm": 1.3046875, "learning_rate": 0.0004997061842785468, "loss": 5.6803, "mean_token_accuracy": 0.19400090873241424, "num_tokens": 1241043.0, "step": 1560 }, { "entropy": 5.717684745788574, "epoch": 0.4424653661294883, "grad_norm": 1.3828125, "learning_rate": 0.0004997009058466745, "loss": 5.8311, "mean_token_accuracy": 0.18614000529050828, "num_tokens": 1245175.0, "step": 1565 }, { "entropy": 5.799765300750733, "epoch": 0.44387899349731413, "grad_norm": 1.359375, "learning_rate": 0.0004996955804537024, "loss": 5.7576, "mean_token_accuracy": 0.18300676196813584, "num_tokens": 1249540.0, "step": 1570 }, { "entropy": 5.823600387573242, "epoch": 0.44529262086513993, "grad_norm": 1.390625, "learning_rate": 0.0004996902081007435, "loss": 5.73, "mean_token_accuracy": 0.18506772816181183, "num_tokens": 1253532.0, "step": 1575 }, { "entropy": 5.833622980117798, "epoch": 0.4467062482329658, "grad_norm": 1.4375, "learning_rate": 0.0004996847887889205, "loss": 5.7169, "mean_token_accuracy": 0.18705481737852098, "num_tokens": 1257492.0, "step": 1580 }, { "entropy": 5.734306573867798, "epoch": 0.44811987560079164, "grad_norm": 1.6171875, "learning_rate": 0.0004996793225193662, "loss": 5.8279, "mean_token_accuracy": 0.18313267529010774, "num_tokens": 1261388.0, "step": 1585 }, { "entropy": 5.834798336029053, "epoch": 0.4495335029686175, "grad_norm": 1.3515625, "learning_rate": 0.0004996738092932227, "loss": 5.7397, "mean_token_accuracy": 0.18718260675668716, "num_tokens": 1265417.0, "step": 1590 }, { "entropy": 5.671156358718872, "epoch": 0.4509471303364433, "grad_norm": 1.34375, "learning_rate": 0.0004996682491116425, "loss": 5.7071, "mean_token_accuracy": 0.19657584577798842, "num_tokens": 1269454.0, "step": 1595 }, { "entropy": 5.7325883388519285, "epoch": 0.45236075770426915, "grad_norm": 1.40625, "learning_rate": 0.0004996626419757875, "loss": 5.8176, "mean_token_accuracy": 0.18559218645095826, "num_tokens": 1273677.0, "step": 1600 }, { "entropy": 5.821763038635254, "epoch": 0.453774385072095, "grad_norm": 1.46875, "learning_rate": 0.0004996569878868296, "loss": 5.6485, "mean_token_accuracy": 0.19062581062316894, "num_tokens": 1277683.0, "step": 1605 }, { "entropy": 5.6672616481781, "epoch": 0.45518801243992085, "grad_norm": 1.390625, "learning_rate": 0.0004996512868459505, "loss": 5.7728, "mean_token_accuracy": 0.18369143903255464, "num_tokens": 1281945.0, "step": 1610 }, { "entropy": 5.595178031921387, "epoch": 0.45660163980774665, "grad_norm": 1.3671875, "learning_rate": 0.0004996455388543416, "loss": 5.7011, "mean_token_accuracy": 0.1911506325006485, "num_tokens": 1285709.0, "step": 1615 }, { "entropy": 5.877404975891113, "epoch": 0.4580152671755725, "grad_norm": 1.5078125, "learning_rate": 0.0004996397439132042, "loss": 5.8661, "mean_token_accuracy": 0.17192684412002562, "num_tokens": 1289772.0, "step": 1620 }, { "entropy": 5.772934436798096, "epoch": 0.45942889454339836, "grad_norm": 1.34375, "learning_rate": 0.0004996339020237496, "loss": 5.7621, "mean_token_accuracy": 0.18746172338724137, "num_tokens": 1293671.0, "step": 1625 }, { "entropy": 5.825155878067017, "epoch": 0.4608425219112242, "grad_norm": 1.5234375, "learning_rate": 0.0004996280131871985, "loss": 5.6843, "mean_token_accuracy": 0.1883016973733902, "num_tokens": 1297334.0, "step": 1630 }, { "entropy": 5.71227011680603, "epoch": 0.46225614927905007, "grad_norm": 1.4140625, "learning_rate": 0.0004996220774047816, "loss": 5.7632, "mean_token_accuracy": 0.18459136486053468, "num_tokens": 1301219.0, "step": 1635 }, { "entropy": 5.700411558151245, "epoch": 0.46366977664687586, "grad_norm": 1.3515625, "learning_rate": 0.0004996160946777398, "loss": 5.7423, "mean_token_accuracy": 0.18890873938798905, "num_tokens": 1305166.0, "step": 1640 }, { "entropy": 5.676112222671509, "epoch": 0.4650834040147017, "grad_norm": 1.4609375, "learning_rate": 0.0004996100650073229, "loss": 5.6738, "mean_token_accuracy": 0.19222360402345656, "num_tokens": 1308958.0, "step": 1645 }, { "entropy": 5.767787170410156, "epoch": 0.46649703138252757, "grad_norm": 1.3046875, "learning_rate": 0.0004996039883947915, "loss": 5.909, "mean_token_accuracy": 0.17916598170995712, "num_tokens": 1313289.0, "step": 1650 }, { "entropy": 5.912643051147461, "epoch": 0.4679106587503534, "grad_norm": 1.2890625, "learning_rate": 0.0004995978648414154, "loss": 5.7442, "mean_token_accuracy": 0.18683811128139496, "num_tokens": 1317366.0, "step": 1655 }, { "entropy": 5.729746007919312, "epoch": 0.4693242861181792, "grad_norm": 1.3828125, "learning_rate": 0.0004995916943484745, "loss": 5.7547, "mean_token_accuracy": 0.1879502385854721, "num_tokens": 1321362.0, "step": 1660 }, { "entropy": 5.774411725997925, "epoch": 0.4707379134860051, "grad_norm": 1.5234375, "learning_rate": 0.0004995854769172583, "loss": 5.7037, "mean_token_accuracy": 0.18776724189519883, "num_tokens": 1325147.0, "step": 1665 }, { "entropy": 5.843069744110108, "epoch": 0.47215154085383093, "grad_norm": 1.3828125, "learning_rate": 0.0004995792125490662, "loss": 5.778, "mean_token_accuracy": 0.17874198108911515, "num_tokens": 1329072.0, "step": 1670 }, { "entropy": 5.639906167984009, "epoch": 0.4735651682216568, "grad_norm": 1.40625, "learning_rate": 0.0004995729012452074, "loss": 5.6564, "mean_token_accuracy": 0.20082349181175232, "num_tokens": 1332947.0, "step": 1675 }, { "entropy": 5.622266244888306, "epoch": 0.47497879558948264, "grad_norm": 1.390625, "learning_rate": 0.0004995665430070009, "loss": 5.6718, "mean_token_accuracy": 0.1948164239525795, "num_tokens": 1336903.0, "step": 1680 }, { "entropy": 5.792095184326172, "epoch": 0.47639242295730844, "grad_norm": 1.453125, "learning_rate": 0.0004995601378357757, "loss": 5.7422, "mean_token_accuracy": 0.18691984713077545, "num_tokens": 1340989.0, "step": 1685 }, { "entropy": 5.864161443710327, "epoch": 0.4778060503251343, "grad_norm": 1.3125, "learning_rate": 0.0004995536857328702, "loss": 5.8213, "mean_token_accuracy": 0.17689985930919647, "num_tokens": 1345251.0, "step": 1690 }, { "entropy": 5.904580068588257, "epoch": 0.47921967769296014, "grad_norm": 1.4296875, "learning_rate": 0.0004995471866996332, "loss": 5.9124, "mean_token_accuracy": 0.17539610639214515, "num_tokens": 1349167.0, "step": 1695 }, { "entropy": 5.778077411651611, "epoch": 0.480633305060786, "grad_norm": 1.3828125, "learning_rate": 0.0004995406407374226, "loss": 5.6184, "mean_token_accuracy": 0.2023831859230995, "num_tokens": 1353309.0, "step": 1700 }, { "entropy": 5.721492433547974, "epoch": 0.4820469324286118, "grad_norm": 1.328125, "learning_rate": 0.0004995340478476067, "loss": 5.7534, "mean_token_accuracy": 0.19217092245817186, "num_tokens": 1357129.0, "step": 1705 }, { "entropy": 5.7220958232879635, "epoch": 0.48346055979643765, "grad_norm": 1.3515625, "learning_rate": 0.0004995274080315631, "loss": 5.692, "mean_token_accuracy": 0.18690054416656493, "num_tokens": 1360824.0, "step": 1710 }, { "entropy": 5.69368953704834, "epoch": 0.4848741871642635, "grad_norm": 1.421875, "learning_rate": 0.0004995207212906798, "loss": 5.7049, "mean_token_accuracy": 0.2015200823545456, "num_tokens": 1364688.0, "step": 1715 }, { "entropy": 5.706001472473145, "epoch": 0.48628781453208936, "grad_norm": 1.25, "learning_rate": 0.000499513987626354, "loss": 5.6655, "mean_token_accuracy": 0.19725179374217988, "num_tokens": 1368889.0, "step": 1720 }, { "entropy": 5.746529531478882, "epoch": 0.48770144189991516, "grad_norm": 1.375, "learning_rate": 0.0004995072070399933, "loss": 5.7719, "mean_token_accuracy": 0.20015778094530107, "num_tokens": 1372912.0, "step": 1725 }, { "entropy": 5.6686793804168705, "epoch": 0.489115069267741, "grad_norm": 1.3515625, "learning_rate": 0.0004995003795330146, "loss": 5.6134, "mean_token_accuracy": 0.1967315584421158, "num_tokens": 1376566.0, "step": 1730 }, { "entropy": 5.498853397369385, "epoch": 0.49052869663556686, "grad_norm": 1.4140625, "learning_rate": 0.0004994935051068447, "loss": 5.6377, "mean_token_accuracy": 0.19570326954126357, "num_tokens": 1380710.0, "step": 1735 }, { "entropy": 5.740759801864624, "epoch": 0.4919423240033927, "grad_norm": 1.4140625, "learning_rate": 0.0004994865837629206, "loss": 5.7169, "mean_token_accuracy": 0.19236577451229095, "num_tokens": 1384485.0, "step": 1740 }, { "entropy": 5.751363229751587, "epoch": 0.49335595137121857, "grad_norm": 1.4296875, "learning_rate": 0.0004994796155026887, "loss": 5.6802, "mean_token_accuracy": 0.19381756484508514, "num_tokens": 1388297.0, "step": 1745 }, { "entropy": 5.605444765090942, "epoch": 0.49476957873904437, "grad_norm": 1.34375, "learning_rate": 0.0004994726003276053, "loss": 5.7062, "mean_token_accuracy": 0.19098659604787827, "num_tokens": 1392390.0, "step": 1750 }, { "entropy": 5.733315515518188, "epoch": 0.4961832061068702, "grad_norm": 1.1796875, "learning_rate": 0.0004994655382391365, "loss": 5.7065, "mean_token_accuracy": 0.18861762136220933, "num_tokens": 1396561.0, "step": 1755 }, { "entropy": 5.754003095626831, "epoch": 0.4975968334746961, "grad_norm": 1.359375, "learning_rate": 0.0004994584292387582, "loss": 5.7473, "mean_token_accuracy": 0.19067753851413727, "num_tokens": 1400556.0, "step": 1760 }, { "entropy": 5.826990175247192, "epoch": 0.49901046084252193, "grad_norm": 1.3828125, "learning_rate": 0.0004994512733279562, "loss": 5.7787, "mean_token_accuracy": 0.18018803298473357, "num_tokens": 1404503.0, "step": 1765 }, { "entropy": 5.709981107711792, "epoch": 0.5004240882103478, "grad_norm": 1.34375, "learning_rate": 0.0004994440705082261, "loss": 5.7347, "mean_token_accuracy": 0.1765083149075508, "num_tokens": 1408504.0, "step": 1770 }, { "entropy": 5.694883728027344, "epoch": 0.5018377155781736, "grad_norm": 1.375, "learning_rate": 0.0004994368207810731, "loss": 5.5512, "mean_token_accuracy": 0.20656106472015381, "num_tokens": 1412429.0, "step": 1775 }, { "entropy": 5.594587898254394, "epoch": 0.5032513429459994, "grad_norm": 1.359375, "learning_rate": 0.0004994295241480126, "loss": 5.6607, "mean_token_accuracy": 0.19336072951555253, "num_tokens": 1416466.0, "step": 1780 }, { "entropy": 5.69144377708435, "epoch": 0.5046649703138253, "grad_norm": 1.484375, "learning_rate": 0.0004994221806105692, "loss": 5.6484, "mean_token_accuracy": 0.189523321390152, "num_tokens": 1420226.0, "step": 1785 }, { "entropy": 5.595638227462769, "epoch": 0.5060785976816511, "grad_norm": 1.4609375, "learning_rate": 0.000499414790170278, "loss": 5.6555, "mean_token_accuracy": 0.18988582044839858, "num_tokens": 1423987.0, "step": 1790 }, { "entropy": 5.80430588722229, "epoch": 0.507492225049477, "grad_norm": 1.234375, "learning_rate": 0.0004994073528286833, "loss": 5.69, "mean_token_accuracy": 0.18927541226148606, "num_tokens": 1428264.0, "step": 1795 }, { "entropy": 5.692843675613403, "epoch": 0.5089058524173028, "grad_norm": 1.375, "learning_rate": 0.0004993998685873395, "loss": 5.5987, "mean_token_accuracy": 0.1881292626261711, "num_tokens": 1432350.0, "step": 1800 }, { "entropy": 5.507918214797973, "epoch": 0.5103194797851286, "grad_norm": 1.40625, "learning_rate": 0.0004993923374478109, "loss": 5.5961, "mean_token_accuracy": 0.20146704465150833, "num_tokens": 1436298.0, "step": 1805 }, { "entropy": 5.571535301208496, "epoch": 0.5117331071529545, "grad_norm": 1.375, "learning_rate": 0.0004993847594116713, "loss": 5.5513, "mean_token_accuracy": 0.20241557210683822, "num_tokens": 1440206.0, "step": 1810 }, { "entropy": 5.7816972732543945, "epoch": 0.5131467345207803, "grad_norm": 1.375, "learning_rate": 0.0004993771344805046, "loss": 5.7427, "mean_token_accuracy": 0.18699136078357698, "num_tokens": 1444566.0, "step": 1815 }, { "entropy": 5.65059723854065, "epoch": 0.5145603618886062, "grad_norm": 1.328125, "learning_rate": 0.0004993694626559043, "loss": 5.6951, "mean_token_accuracy": 0.19032856076955795, "num_tokens": 1448792.0, "step": 1820 }, { "entropy": 5.783305358886719, "epoch": 0.515973989256432, "grad_norm": 1.390625, "learning_rate": 0.0004993617439394737, "loss": 5.7512, "mean_token_accuracy": 0.18141021430492402, "num_tokens": 1452456.0, "step": 1825 }, { "entropy": 5.619701290130616, "epoch": 0.5173876166242578, "grad_norm": 1.3984375, "learning_rate": 0.0004993539783328261, "loss": 5.6665, "mean_token_accuracy": 0.19362071603536607, "num_tokens": 1456415.0, "step": 1830 }, { "entropy": 5.583071756362915, "epoch": 0.5188012439920837, "grad_norm": 1.4296875, "learning_rate": 0.0004993461658375845, "loss": 5.5992, "mean_token_accuracy": 0.20504723042249678, "num_tokens": 1460390.0, "step": 1835 }, { "entropy": 5.701898860931396, "epoch": 0.5202148713599095, "grad_norm": 1.4296875, "learning_rate": 0.0004993383064553814, "loss": 5.742, "mean_token_accuracy": 0.19340634495019912, "num_tokens": 1464363.0, "step": 1840 }, { "entropy": 5.671453237533569, "epoch": 0.5216284987277354, "grad_norm": 1.3515625, "learning_rate": 0.0004993304001878595, "loss": 5.6109, "mean_token_accuracy": 0.20281730890274047, "num_tokens": 1468372.0, "step": 1845 }, { "entropy": 5.493208885192871, "epoch": 0.5230421260955612, "grad_norm": 1.3984375, "learning_rate": 0.0004993224470366712, "loss": 5.7438, "mean_token_accuracy": 0.18834396749734877, "num_tokens": 1472272.0, "step": 1850 }, { "entropy": 5.684529161453247, "epoch": 0.524455753463387, "grad_norm": 1.40625, "learning_rate": 0.0004993144470034787, "loss": 5.506, "mean_token_accuracy": 0.2056361585855484, "num_tokens": 1476195.0, "step": 1855 }, { "entropy": 5.637450647354126, "epoch": 0.5258693808312129, "grad_norm": 1.359375, "learning_rate": 0.0004993064000899538, "loss": 5.6958, "mean_token_accuracy": 0.18898120522499084, "num_tokens": 1480364.0, "step": 1860 }, { "entropy": 5.476922035217285, "epoch": 0.5272830081990387, "grad_norm": 1.3125, "learning_rate": 0.0004992983062977784, "loss": 5.6845, "mean_token_accuracy": 0.19763999432325363, "num_tokens": 1484523.0, "step": 1865 }, { "entropy": 5.7142651081085205, "epoch": 0.5286966355668645, "grad_norm": 1.5, "learning_rate": 0.0004992901656286439, "loss": 5.7271, "mean_token_accuracy": 0.18795137852430344, "num_tokens": 1488456.0, "step": 1870 }, { "entropy": 5.598298358917236, "epoch": 0.5301102629346904, "grad_norm": 1.3203125, "learning_rate": 0.000499281978084252, "loss": 5.5556, "mean_token_accuracy": 0.20567425787448884, "num_tokens": 1492599.0, "step": 1875 }, { "entropy": 5.616948032379151, "epoch": 0.5315238903025162, "grad_norm": 1.421875, "learning_rate": 0.0004992737436663134, "loss": 5.5724, "mean_token_accuracy": 0.21480470895767212, "num_tokens": 1496373.0, "step": 1880 }, { "entropy": 5.541384172439575, "epoch": 0.5329375176703421, "grad_norm": 1.515625, "learning_rate": 0.0004992654623765493, "loss": 5.6192, "mean_token_accuracy": 0.19836001247167587, "num_tokens": 1500288.0, "step": 1885 }, { "entropy": 5.764281368255615, "epoch": 0.5343511450381679, "grad_norm": 1.2734375, "learning_rate": 0.0004992571342166904, "loss": 5.7485, "mean_token_accuracy": 0.18413073122501372, "num_tokens": 1504169.0, "step": 1890 }, { "entropy": 5.751831531524658, "epoch": 0.5357647724059937, "grad_norm": 1.53125, "learning_rate": 0.0004992487591884772, "loss": 5.6864, "mean_token_accuracy": 0.19226602613925933, "num_tokens": 1508292.0, "step": 1895 }, { "entropy": 5.658072376251221, "epoch": 0.5371783997738196, "grad_norm": 1.3828125, "learning_rate": 0.00049924033729366, "loss": 5.7019, "mean_token_accuracy": 0.19271002262830733, "num_tokens": 1512366.0, "step": 1900 }, { "entropy": 5.639523458480835, "epoch": 0.5385920271416454, "grad_norm": 1.2890625, "learning_rate": 0.000499231868533999, "loss": 5.6872, "mean_token_accuracy": 0.19010829776525498, "num_tokens": 1516627.0, "step": 1905 }, { "entropy": 5.601494407653808, "epoch": 0.5400056545094714, "grad_norm": 1.4375, "learning_rate": 0.0004992233529112642, "loss": 5.5366, "mean_token_accuracy": 0.20517586618661882, "num_tokens": 1520541.0, "step": 1910 }, { "entropy": 5.734471940994263, "epoch": 0.5414192818772972, "grad_norm": 1.375, "learning_rate": 0.0004992147904272349, "loss": 5.6739, "mean_token_accuracy": 0.1813078209757805, "num_tokens": 1524505.0, "step": 1915 }, { "entropy": 5.605487871170044, "epoch": 0.542832909245123, "grad_norm": 1.4140625, "learning_rate": 0.0004992061810837012, "loss": 5.6159, "mean_token_accuracy": 0.19128397554159166, "num_tokens": 1528658.0, "step": 1920 }, { "entropy": 5.487127208709717, "epoch": 0.5442465366129489, "grad_norm": 1.359375, "learning_rate": 0.000499197524882462, "loss": 5.563, "mean_token_accuracy": 0.20296506136655806, "num_tokens": 1532620.0, "step": 1925 }, { "entropy": 5.600309658050537, "epoch": 0.5456601639807747, "grad_norm": 1.328125, "learning_rate": 0.0004991888218253265, "loss": 5.6726, "mean_token_accuracy": 0.17892235070466994, "num_tokens": 1536636.0, "step": 1930 }, { "entropy": 5.678558778762818, "epoch": 0.5470737913486005, "grad_norm": 1.34375, "learning_rate": 0.0004991800719141136, "loss": 5.6827, "mean_token_accuracy": 0.18799914866685868, "num_tokens": 1540821.0, "step": 1935 }, { "entropy": 5.50041823387146, "epoch": 0.5484874187164264, "grad_norm": 1.328125, "learning_rate": 0.0004991712751506518, "loss": 5.5987, "mean_token_accuracy": 0.19327885210514067, "num_tokens": 1544700.0, "step": 1940 }, { "entropy": 5.620293855667114, "epoch": 0.5499010460842522, "grad_norm": 1.3671875, "learning_rate": 0.0004991624315367798, "loss": 5.6134, "mean_token_accuracy": 0.19923721998929977, "num_tokens": 1548770.0, "step": 1945 }, { "entropy": 5.722182416915894, "epoch": 0.5513146734520781, "grad_norm": 1.3046875, "learning_rate": 0.0004991535410743459, "loss": 5.6994, "mean_token_accuracy": 0.18269776701927185, "num_tokens": 1553015.0, "step": 1950 }, { "entropy": 5.609702014923096, "epoch": 0.5527283008199039, "grad_norm": 1.4140625, "learning_rate": 0.0004991446037652079, "loss": 5.674, "mean_token_accuracy": 0.18456978499889373, "num_tokens": 1556849.0, "step": 1955 }, { "entropy": 5.5437146663665775, "epoch": 0.5541419281877297, "grad_norm": 1.4140625, "learning_rate": 0.0004991356196112339, "loss": 5.6453, "mean_token_accuracy": 0.19666575640439987, "num_tokens": 1560407.0, "step": 1960 }, { "entropy": 5.6902313232421875, "epoch": 0.5555555555555556, "grad_norm": 1.3671875, "learning_rate": 0.0004991265886143014, "loss": 5.5509, "mean_token_accuracy": 0.20052429139614106, "num_tokens": 1564473.0, "step": 1965 }, { "entropy": 5.525343418121338, "epoch": 0.5569691829233814, "grad_norm": 1.4765625, "learning_rate": 0.0004991175107762978, "loss": 5.7307, "mean_token_accuracy": 0.19222700595855713, "num_tokens": 1568141.0, "step": 1970 }, { "entropy": 5.702168750762939, "epoch": 0.5583828102912073, "grad_norm": 1.3125, "learning_rate": 0.0004991083860991204, "loss": 5.7182, "mean_token_accuracy": 0.1973864495754242, "num_tokens": 1572130.0, "step": 1975 }, { "entropy": 5.691175413131714, "epoch": 0.5597964376590331, "grad_norm": 1.4375, "learning_rate": 0.000499099214584676, "loss": 5.6929, "mean_token_accuracy": 0.19352537095546724, "num_tokens": 1576243.0, "step": 1980 }, { "entropy": 5.743717002868652, "epoch": 0.5612100650268589, "grad_norm": 1.4609375, "learning_rate": 0.0004990899962348817, "loss": 5.6288, "mean_token_accuracy": 0.19254789650440216, "num_tokens": 1579916.0, "step": 1985 }, { "entropy": 5.515009832382202, "epoch": 0.5626236923946848, "grad_norm": 1.390625, "learning_rate": 0.0004990807310516638, "loss": 5.4585, "mean_token_accuracy": 0.20692042708396913, "num_tokens": 1584075.0, "step": 1990 }, { "entropy": 5.662541103363037, "epoch": 0.5640373197625106, "grad_norm": 1.40625, "learning_rate": 0.0004990714190369588, "loss": 5.6659, "mean_token_accuracy": 0.1924101397395134, "num_tokens": 1588026.0, "step": 1995 }, { "entropy": 5.66917872428894, "epoch": 0.5654509471303364, "grad_norm": 1.3125, "learning_rate": 0.000499062060192713, "loss": 5.6495, "mean_token_accuracy": 0.1943264052271843, "num_tokens": 1592420.0, "step": 2000 }, { "epoch": 0.5654509471303364, "eval_entropy": 5.499324915850103, "eval_loss": 5.823847770690918, "eval_mean_token_accuracy": 0.19281912291413245, "eval_num_tokens": 1592420.0, "eval_runtime": 6.4866, "eval_samples_per_second": 1739.58, "eval_steps_per_second": 217.525, "step": 2000 } ], "logging_steps": 5, "max_steps": 35360, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 1000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1928874110976000.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }