{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.9885629040278467, "eval_steps": 1000, "global_step": 2000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 4.8070969581604, "epoch": 0.004972650422675286, "grad_norm": 24.75, "learning_rate": 2e-06, "loss": 14.0326, "mean_token_accuracy": 0.00021244323579594493, "num_tokens": 9311.0, "step": 5 }, { "entropy": 4.797885847091675, "epoch": 0.009945300845350571, "grad_norm": 26.625, "learning_rate": 4.5e-06, "loss": 14.1582, "mean_token_accuracy": 0.00015400313423015178, "num_tokens": 20562.0, "step": 10 }, { "entropy": 4.859349775314331, "epoch": 0.014917951268025857, "grad_norm": 31.875, "learning_rate": 7e-06, "loss": 13.9712, "mean_token_accuracy": 6.825938471592963e-05, "num_tokens": 31490.0, "step": 15 }, { "entropy": 5.023061370849609, "epoch": 0.019890601690701143, "grad_norm": 37.0, "learning_rate": 9.5e-06, "loss": 13.4915, "mean_token_accuracy": 0.00020137293031439186, "num_tokens": 40741.0, "step": 20 }, { "entropy": 5.819656610488892, "epoch": 0.02486325211337643, "grad_norm": 41.75, "learning_rate": 1.2e-05, "loss": 12.611, "mean_token_accuracy": 9.191176504828036e-05, "num_tokens": 50749.0, "step": 25 }, { "entropy": 8.102291202545166, "epoch": 0.029835902536051714, "grad_norm": 16.75, "learning_rate": 1.4500000000000002e-05, "loss": 11.4574, "mean_token_accuracy": 6.939625018276274e-05, "num_tokens": 60296.0, "step": 30 }, { "entropy": 10.558936214447021, "epoch": 0.034808552958727, "grad_norm": 3.25, "learning_rate": 1.7000000000000003e-05, "loss": 10.7872, "mean_token_accuracy": 0.004098818055354059, "num_tokens": 70797.0, "step": 35 }, { "entropy": 10.733526706695557, "epoch": 0.039781203381402286, "grad_norm": 2.984375, "learning_rate": 1.95e-05, "loss": 10.6667, "mean_token_accuracy": 0.013002976961433887, "num_tokens": 80815.0, "step": 40 }, { "entropy": 10.728536796569824, "epoch": 0.04475385380407757, "grad_norm": 2.625, "learning_rate": 2.2e-05, "loss": 10.5279, "mean_token_accuracy": 0.01793140098452568, "num_tokens": 90326.0, "step": 45 }, { "entropy": 10.599061870574952, "epoch": 0.04972650422675286, "grad_norm": 2.28125, "learning_rate": 2.4500000000000003e-05, "loss": 10.3877, "mean_token_accuracy": 0.01745283491909504, "num_tokens": 99800.0, "step": 50 }, { "entropy": 10.65576114654541, "epoch": 0.05469915464942814, "grad_norm": 2.1875, "learning_rate": 2.7e-05, "loss": 10.2903, "mean_token_accuracy": 0.01605473877862096, "num_tokens": 110636.0, "step": 55 }, { "entropy": 10.719483566284179, "epoch": 0.05967180507210343, "grad_norm": 1.9765625, "learning_rate": 2.95e-05, "loss": 10.1623, "mean_token_accuracy": 0.036899705231189725, "num_tokens": 120269.0, "step": 60 }, { "entropy": 10.70643663406372, "epoch": 0.06464445549477872, "grad_norm": 1.59375, "learning_rate": 3.2e-05, "loss": 10.0881, "mean_token_accuracy": 0.04810476265847683, "num_tokens": 130176.0, "step": 65 }, { "entropy": 10.66576566696167, "epoch": 0.069617105917454, "grad_norm": 1.484375, "learning_rate": 3.4500000000000005e-05, "loss": 10.0065, "mean_token_accuracy": 0.042827858589589596, "num_tokens": 140020.0, "step": 70 }, { "entropy": 10.634183788299561, "epoch": 0.07458975634012929, "grad_norm": 1.6484375, "learning_rate": 3.7e-05, "loss": 10.0029, "mean_token_accuracy": 0.050830533541738984, "num_tokens": 150713.0, "step": 75 }, { "entropy": 10.668430137634278, "epoch": 0.07956240676280457, "grad_norm": 1.78125, "learning_rate": 3.95e-05, "loss": 9.888, "mean_token_accuracy": 0.0580036036670208, "num_tokens": 159828.0, "step": 80 }, { "entropy": 10.654301357269286, "epoch": 0.08453505718547986, "grad_norm": 1.625, "learning_rate": 4.2000000000000004e-05, "loss": 9.8437, "mean_token_accuracy": 0.05468556806445122, "num_tokens": 169909.0, "step": 85 }, { "entropy": 10.641754341125488, "epoch": 0.08950770760815514, "grad_norm": 1.53125, "learning_rate": 4.45e-05, "loss": 9.7723, "mean_token_accuracy": 0.052299515902996065, "num_tokens": 179462.0, "step": 90 }, { "entropy": 10.614963722229003, "epoch": 0.09448035803083044, "grad_norm": 1.46875, "learning_rate": 4.7000000000000004e-05, "loss": 9.7174, "mean_token_accuracy": 0.055024531483650205, "num_tokens": 188965.0, "step": 95 }, { "entropy": 10.590071868896484, "epoch": 0.09945300845350571, "grad_norm": 1.328125, "learning_rate": 4.9500000000000004e-05, "loss": 9.7249, "mean_token_accuracy": 0.05227088816463947, "num_tokens": 200382.0, "step": 100 }, { "entropy": 10.570422649383545, "epoch": 0.10442565887618101, "grad_norm": 1.5625, "learning_rate": 5.2e-05, "loss": 9.5234, "mean_token_accuracy": 0.05571662969887257, "num_tokens": 209718.0, "step": 105 }, { "entropy": 10.507248878479004, "epoch": 0.10939830929885629, "grad_norm": 1.3984375, "learning_rate": 5.45e-05, "loss": 9.4379, "mean_token_accuracy": 0.05849384367465973, "num_tokens": 219216.0, "step": 110 }, { "entropy": 10.474326419830323, "epoch": 0.11437095972153158, "grad_norm": 1.3671875, "learning_rate": 5.7e-05, "loss": 9.3866, "mean_token_accuracy": 0.055352504923939706, "num_tokens": 228219.0, "step": 115 }, { "entropy": 10.39169225692749, "epoch": 0.11934361014420686, "grad_norm": 1.390625, "learning_rate": 5.9499999999999996e-05, "loss": 9.3081, "mean_token_accuracy": 0.05544135756790638, "num_tokens": 237776.0, "step": 120 }, { "entropy": 10.375651550292968, "epoch": 0.12431626056688215, "grad_norm": 1.515625, "learning_rate": 6.2e-05, "loss": 9.2258, "mean_token_accuracy": 0.05586103238165378, "num_tokens": 248411.0, "step": 125 }, { "entropy": 10.301455688476562, "epoch": 0.12928891098955744, "grad_norm": 1.21875, "learning_rate": 6.450000000000001e-05, "loss": 9.2079, "mean_token_accuracy": 0.056549127027392385, "num_tokens": 258797.0, "step": 130 }, { "entropy": 10.293347549438476, "epoch": 0.13426156141223272, "grad_norm": 1.3203125, "learning_rate": 6.7e-05, "loss": 9.0945, "mean_token_accuracy": 0.050958582386374476, "num_tokens": 269228.0, "step": 135 }, { "entropy": 10.208239078521729, "epoch": 0.139234211834908, "grad_norm": 1.234375, "learning_rate": 6.950000000000001e-05, "loss": 9.0355, "mean_token_accuracy": 0.05858226753771305, "num_tokens": 279191.0, "step": 140 }, { "entropy": 10.152443504333496, "epoch": 0.14420686225758328, "grad_norm": 1.28125, "learning_rate": 7.2e-05, "loss": 8.9278, "mean_token_accuracy": 0.05867091566324234, "num_tokens": 289382.0, "step": 145 }, { "entropy": 10.042474365234375, "epoch": 0.14917951268025859, "grad_norm": 1.3046875, "learning_rate": 7.45e-05, "loss": 8.838, "mean_token_accuracy": 0.059500711783766744, "num_tokens": 299163.0, "step": 150 }, { "entropy": 9.933298778533935, "epoch": 0.15415216310293386, "grad_norm": 1.1171875, "learning_rate": 7.7e-05, "loss": 8.8395, "mean_token_accuracy": 0.055494238063693045, "num_tokens": 308551.0, "step": 155 }, { "entropy": 9.883023929595947, "epoch": 0.15912481352560914, "grad_norm": 0.9140625, "learning_rate": 7.950000000000001e-05, "loss": 8.7292, "mean_token_accuracy": 0.05697325877845287, "num_tokens": 318427.0, "step": 160 }, { "entropy": 9.771326446533203, "epoch": 0.16409746394828442, "grad_norm": 0.8671875, "learning_rate": 8.2e-05, "loss": 8.7275, "mean_token_accuracy": 0.057022403553128244, "num_tokens": 327539.0, "step": 165 }, { "entropy": 9.62988338470459, "epoch": 0.16907011437095973, "grad_norm": 0.92578125, "learning_rate": 8.450000000000001e-05, "loss": 8.6182, "mean_token_accuracy": 0.05923179090023041, "num_tokens": 336676.0, "step": 170 }, { "entropy": 9.472471904754638, "epoch": 0.174042764793635, "grad_norm": 0.85546875, "learning_rate": 8.7e-05, "loss": 8.5835, "mean_token_accuracy": 0.06671808362007141, "num_tokens": 345914.0, "step": 175 }, { "entropy": 9.338830947875977, "epoch": 0.1790154152163103, "grad_norm": 0.75390625, "learning_rate": 8.95e-05, "loss": 8.5587, "mean_token_accuracy": 0.06043006777763367, "num_tokens": 355982.0, "step": 180 }, { "entropy": 9.279397869110108, "epoch": 0.1839880656389856, "grad_norm": 0.7265625, "learning_rate": 9.2e-05, "loss": 8.5261, "mean_token_accuracy": 0.05726887695491314, "num_tokens": 365398.0, "step": 185 }, { "entropy": 9.214585781097412, "epoch": 0.18896071606166087, "grad_norm": 0.828125, "learning_rate": 9.45e-05, "loss": 8.5059, "mean_token_accuracy": 0.05852856226265431, "num_tokens": 374519.0, "step": 190 }, { "entropy": 9.065228366851807, "epoch": 0.19393336648433615, "grad_norm": 0.73828125, "learning_rate": 9.7e-05, "loss": 8.4674, "mean_token_accuracy": 0.059703434631228444, "num_tokens": 383536.0, "step": 195 }, { "entropy": 8.976552486419678, "epoch": 0.19890601690701143, "grad_norm": 0.77734375, "learning_rate": 9.95e-05, "loss": 8.5149, "mean_token_accuracy": 0.05934412702918053, "num_tokens": 393703.0, "step": 200 }, { "entropy": 8.97565803527832, "epoch": 0.20387866732968674, "grad_norm": 0.8515625, "learning_rate": 0.000102, "loss": 8.5195, "mean_token_accuracy": 0.05305514298379421, "num_tokens": 404065.0, "step": 205 }, { "entropy": 8.924800586700439, "epoch": 0.20885131775236201, "grad_norm": 1.0546875, "learning_rate": 0.00010449999999999999, "loss": 8.432, "mean_token_accuracy": 0.05896747000515461, "num_tokens": 413869.0, "step": 210 }, { "entropy": 8.856037998199463, "epoch": 0.2138239681750373, "grad_norm": 0.78515625, "learning_rate": 0.000107, "loss": 8.4921, "mean_token_accuracy": 0.06129511967301369, "num_tokens": 424251.0, "step": 215 }, { "entropy": 8.833969116210938, "epoch": 0.21879661859771257, "grad_norm": 0.90234375, "learning_rate": 0.0001095, "loss": 8.4019, "mean_token_accuracy": 0.06401792429387569, "num_tokens": 432530.0, "step": 220 }, { "entropy": 8.746544361114502, "epoch": 0.22376926902038788, "grad_norm": 0.6796875, "learning_rate": 0.000112, "loss": 8.3987, "mean_token_accuracy": 0.06169661693274975, "num_tokens": 442335.0, "step": 225 }, { "entropy": 8.834150791168213, "epoch": 0.22874191944306316, "grad_norm": 0.69921875, "learning_rate": 0.0001145, "loss": 8.409, "mean_token_accuracy": 0.06196355223655701, "num_tokens": 452048.0, "step": 230 }, { "entropy": 8.751599216461182, "epoch": 0.23371456986573844, "grad_norm": 0.76171875, "learning_rate": 0.00011700000000000001, "loss": 8.3203, "mean_token_accuracy": 0.06898252218961716, "num_tokens": 460840.0, "step": 235 }, { "entropy": 8.737278270721436, "epoch": 0.23868722028841372, "grad_norm": 0.86328125, "learning_rate": 0.00011949999999999999, "loss": 8.4082, "mean_token_accuracy": 0.06640021838247775, "num_tokens": 470198.0, "step": 240 }, { "entropy": 8.729250431060791, "epoch": 0.24365987071108902, "grad_norm": 0.6953125, "learning_rate": 0.000122, "loss": 8.3808, "mean_token_accuracy": 0.06511146835982799, "num_tokens": 481030.0, "step": 245 }, { "entropy": 8.744795799255371, "epoch": 0.2486325211337643, "grad_norm": 0.921875, "learning_rate": 0.0001245, "loss": 8.3219, "mean_token_accuracy": 0.0689955297857523, "num_tokens": 490411.0, "step": 250 }, { "entropy": 8.608490371704102, "epoch": 0.2536051715564396, "grad_norm": 1.84375, "learning_rate": 0.000127, "loss": 8.3785, "mean_token_accuracy": 0.07227851301431656, "num_tokens": 499551.0, "step": 255 }, { "entropy": 8.726069831848145, "epoch": 0.2585778219791149, "grad_norm": 0.73046875, "learning_rate": 0.0001295, "loss": 8.3658, "mean_token_accuracy": 0.06381739228963852, "num_tokens": 508885.0, "step": 260 }, { "entropy": 8.69681911468506, "epoch": 0.26355047240179014, "grad_norm": 0.93359375, "learning_rate": 0.000132, "loss": 8.379, "mean_token_accuracy": 0.06011901162564755, "num_tokens": 518291.0, "step": 265 }, { "entropy": 8.682203197479248, "epoch": 0.26852312282446544, "grad_norm": 0.828125, "learning_rate": 0.00013450000000000002, "loss": 8.2906, "mean_token_accuracy": 0.06578158549964427, "num_tokens": 528035.0, "step": 270 }, { "entropy": 8.655262184143066, "epoch": 0.27349577324714075, "grad_norm": 0.71484375, "learning_rate": 0.00013700000000000002, "loss": 8.3363, "mean_token_accuracy": 0.0644611481577158, "num_tokens": 538410.0, "step": 275 }, { "entropy": 8.610585975646973, "epoch": 0.278468423669816, "grad_norm": 0.84375, "learning_rate": 0.0001395, "loss": 8.32, "mean_token_accuracy": 0.06107736974954605, "num_tokens": 549697.0, "step": 280 }, { "entropy": 8.659037113189697, "epoch": 0.2834410740924913, "grad_norm": 0.81640625, "learning_rate": 0.00014199999999999998, "loss": 8.2122, "mean_token_accuracy": 0.06606750525534152, "num_tokens": 558932.0, "step": 285 }, { "entropy": 8.545393943786621, "epoch": 0.28841372451516656, "grad_norm": 0.77734375, "learning_rate": 0.0001445, "loss": 8.2897, "mean_token_accuracy": 0.06308084316551685, "num_tokens": 568441.0, "step": 290 }, { "entropy": 8.5941725730896, "epoch": 0.29338637493784187, "grad_norm": 0.703125, "learning_rate": 0.000147, "loss": 8.3462, "mean_token_accuracy": 0.06668097078800202, "num_tokens": 577861.0, "step": 295 }, { "entropy": 8.560972976684571, "epoch": 0.29835902536051717, "grad_norm": 0.7109375, "learning_rate": 0.0001495, "loss": 8.3253, "mean_token_accuracy": 0.06575521379709244, "num_tokens": 587858.0, "step": 300 }, { "entropy": 8.65540361404419, "epoch": 0.3033316757831924, "grad_norm": 1.046875, "learning_rate": 0.000152, "loss": 8.3473, "mean_token_accuracy": 0.06740258559584618, "num_tokens": 597806.0, "step": 305 }, { "entropy": 8.687506103515625, "epoch": 0.30830432620586773, "grad_norm": 1.046875, "learning_rate": 0.00015450000000000001, "loss": 8.3007, "mean_token_accuracy": 0.06727509237825871, "num_tokens": 607408.0, "step": 310 }, { "entropy": 8.586903190612793, "epoch": 0.31327697662854304, "grad_norm": 1.6953125, "learning_rate": 0.000157, "loss": 8.2631, "mean_token_accuracy": 0.07164324074983597, "num_tokens": 617862.0, "step": 315 }, { "entropy": 8.565391349792481, "epoch": 0.3182496270512183, "grad_norm": 0.80859375, "learning_rate": 0.0001595, "loss": 8.2488, "mean_token_accuracy": 0.06584729813039303, "num_tokens": 627128.0, "step": 320 }, { "entropy": 8.553268527984619, "epoch": 0.3232222774738936, "grad_norm": 0.73046875, "learning_rate": 0.000162, "loss": 8.244, "mean_token_accuracy": 0.06818093396723271, "num_tokens": 636775.0, "step": 325 }, { "entropy": 8.64507360458374, "epoch": 0.32819492789656884, "grad_norm": 0.8125, "learning_rate": 0.00016450000000000001, "loss": 8.304, "mean_token_accuracy": 0.07159532345831394, "num_tokens": 645906.0, "step": 330 }, { "entropy": 8.530301666259765, "epoch": 0.33316757831924415, "grad_norm": 0.84765625, "learning_rate": 0.00016700000000000002, "loss": 8.2612, "mean_token_accuracy": 0.06321266070008277, "num_tokens": 655601.0, "step": 335 }, { "entropy": 8.635565948486327, "epoch": 0.33814022874191946, "grad_norm": 0.80859375, "learning_rate": 0.00016950000000000003, "loss": 8.2708, "mean_token_accuracy": 0.0720307134091854, "num_tokens": 665682.0, "step": 340 }, { "entropy": 8.576070308685303, "epoch": 0.3431128791645947, "grad_norm": 0.83203125, "learning_rate": 0.00017199999999999998, "loss": 8.2087, "mean_token_accuracy": 0.0684017900377512, "num_tokens": 675200.0, "step": 345 }, { "entropy": 8.49925184249878, "epoch": 0.34808552958727, "grad_norm": 0.8046875, "learning_rate": 0.00017449999999999999, "loss": 8.2196, "mean_token_accuracy": 0.07055319398641587, "num_tokens": 685590.0, "step": 350 }, { "entropy": 8.569801521301269, "epoch": 0.3530581800099453, "grad_norm": 1.6328125, "learning_rate": 0.000177, "loss": 8.2447, "mean_token_accuracy": 0.07266812808811665, "num_tokens": 695665.0, "step": 355 }, { "entropy": 8.579096031188964, "epoch": 0.3580308304326206, "grad_norm": 0.90234375, "learning_rate": 0.0001795, "loss": 8.2472, "mean_token_accuracy": 0.0726757075637579, "num_tokens": 705850.0, "step": 360 }, { "entropy": 8.673233222961425, "epoch": 0.3630034808552959, "grad_norm": 0.87109375, "learning_rate": 0.000182, "loss": 8.2424, "mean_token_accuracy": 0.06867737360298634, "num_tokens": 716010.0, "step": 365 }, { "entropy": 8.486479091644288, "epoch": 0.3679761312779712, "grad_norm": 0.9765625, "learning_rate": 0.0001845, "loss": 8.1923, "mean_token_accuracy": 0.07114895731210709, "num_tokens": 724908.0, "step": 370 }, { "entropy": 8.458244609832764, "epoch": 0.37294878170064644, "grad_norm": 0.90234375, "learning_rate": 0.000187, "loss": 8.1184, "mean_token_accuracy": 0.07498397640883922, "num_tokens": 733479.0, "step": 375 }, { "entropy": 8.580828189849854, "epoch": 0.37792143212332174, "grad_norm": 1.0546875, "learning_rate": 0.0001895, "loss": 8.1665, "mean_token_accuracy": 0.06988212838768959, "num_tokens": 743365.0, "step": 380 }, { "entropy": 8.575690269470215, "epoch": 0.382894082545997, "grad_norm": 0.98828125, "learning_rate": 0.000192, "loss": 8.2256, "mean_token_accuracy": 0.07234361991286278, "num_tokens": 753720.0, "step": 385 }, { "entropy": 8.412856292724609, "epoch": 0.3878667329686723, "grad_norm": 0.95703125, "learning_rate": 0.0001945, "loss": 8.1242, "mean_token_accuracy": 0.07504816465079785, "num_tokens": 762524.0, "step": 390 }, { "entropy": 8.54902229309082, "epoch": 0.3928393833913476, "grad_norm": 0.9921875, "learning_rate": 0.00019700000000000002, "loss": 8.1719, "mean_token_accuracy": 0.07244503125548363, "num_tokens": 772549.0, "step": 395 }, { "entropy": 8.45740785598755, "epoch": 0.39781203381402286, "grad_norm": 1.15625, "learning_rate": 0.00019950000000000002, "loss": 8.1328, "mean_token_accuracy": 0.07645072191953659, "num_tokens": 782304.0, "step": 400 }, { "entropy": 8.417216968536376, "epoch": 0.40278468423669817, "grad_norm": 0.890625, "learning_rate": 0.000202, "loss": 8.2433, "mean_token_accuracy": 0.0727085243910551, "num_tokens": 792010.0, "step": 405 }, { "entropy": 8.554528999328614, "epoch": 0.40775733465937347, "grad_norm": 0.8984375, "learning_rate": 0.00020449999999999998, "loss": 8.1127, "mean_token_accuracy": 0.07516434043645859, "num_tokens": 801667.0, "step": 410 }, { "entropy": 8.40894250869751, "epoch": 0.4127299850820487, "grad_norm": 0.9140625, "learning_rate": 0.000207, "loss": 8.1652, "mean_token_accuracy": 0.07748018577694893, "num_tokens": 812385.0, "step": 415 }, { "entropy": 8.419648170471191, "epoch": 0.41770263550472403, "grad_norm": 1.0546875, "learning_rate": 0.0002095, "loss": 8.0927, "mean_token_accuracy": 0.0735365979373455, "num_tokens": 822177.0, "step": 420 }, { "entropy": 8.465137958526611, "epoch": 0.4226752859273993, "grad_norm": 1.3671875, "learning_rate": 0.000212, "loss": 8.1771, "mean_token_accuracy": 0.07697029113769531, "num_tokens": 832576.0, "step": 425 }, { "entropy": 8.430140495300293, "epoch": 0.4276479363500746, "grad_norm": 0.82421875, "learning_rate": 0.0002145, "loss": 8.0578, "mean_token_accuracy": 0.08385262787342071, "num_tokens": 842290.0, "step": 430 }, { "entropy": 8.388404369354248, "epoch": 0.4326205867727499, "grad_norm": 1.578125, "learning_rate": 0.00021700000000000002, "loss": 8.0957, "mean_token_accuracy": 0.0767692718654871, "num_tokens": 852500.0, "step": 435 }, { "entropy": 8.455948162078858, "epoch": 0.43759323719542514, "grad_norm": 1.0859375, "learning_rate": 0.0002195, "loss": 8.0283, "mean_token_accuracy": 0.0803538903594017, "num_tokens": 861401.0, "step": 440 }, { "entropy": 8.344406127929688, "epoch": 0.44256588761810045, "grad_norm": 0.9609375, "learning_rate": 0.000222, "loss": 8.0632, "mean_token_accuracy": 0.08101935610175133, "num_tokens": 871523.0, "step": 445 }, { "entropy": 8.46809139251709, "epoch": 0.44753853804077576, "grad_norm": 1.1640625, "learning_rate": 0.0002245, "loss": 8.1088, "mean_token_accuracy": 0.06995238214731217, "num_tokens": 881384.0, "step": 450 }, { "entropy": 8.367013931274414, "epoch": 0.452511188463451, "grad_norm": 1.015625, "learning_rate": 0.00022700000000000002, "loss": 8.125, "mean_token_accuracy": 0.07545166276395321, "num_tokens": 890511.0, "step": 455 }, { "entropy": 8.372640895843507, "epoch": 0.4574838388861263, "grad_norm": 1.34375, "learning_rate": 0.00022950000000000002, "loss": 8.0739, "mean_token_accuracy": 0.07415159381926059, "num_tokens": 900064.0, "step": 460 }, { "entropy": 8.419807624816894, "epoch": 0.46245648930880157, "grad_norm": 0.9375, "learning_rate": 0.00023200000000000003, "loss": 8.1175, "mean_token_accuracy": 0.07342575192451477, "num_tokens": 910892.0, "step": 465 }, { "entropy": 8.448912048339844, "epoch": 0.4674291397314769, "grad_norm": 0.97265625, "learning_rate": 0.00023449999999999998, "loss": 8.102, "mean_token_accuracy": 0.07626463770866394, "num_tokens": 920566.0, "step": 470 }, { "entropy": 8.311750793457032, "epoch": 0.4724017901541522, "grad_norm": 0.984375, "learning_rate": 0.000237, "loss": 8.0194, "mean_token_accuracy": 0.07890446782112122, "num_tokens": 930609.0, "step": 475 }, { "entropy": 8.425170516967773, "epoch": 0.47737444057682743, "grad_norm": 0.85546875, "learning_rate": 0.0002395, "loss": 8.0451, "mean_token_accuracy": 0.075916238874197, "num_tokens": 940383.0, "step": 480 }, { "entropy": 8.47175989151001, "epoch": 0.48234709099950274, "grad_norm": 2.0625, "learning_rate": 0.000242, "loss": 8.0535, "mean_token_accuracy": 0.07686373330652714, "num_tokens": 951302.0, "step": 485 }, { "entropy": 8.380781936645509, "epoch": 0.48731974142217804, "grad_norm": 1.3671875, "learning_rate": 0.0002445, "loss": 8.0043, "mean_token_accuracy": 0.07946270480751991, "num_tokens": 961126.0, "step": 490 }, { "entropy": 8.351362991333009, "epoch": 0.4922923918448533, "grad_norm": 1.1015625, "learning_rate": 0.000247, "loss": 7.9859, "mean_token_accuracy": 0.07787158116698265, "num_tokens": 970845.0, "step": 495 }, { "entropy": 8.2554292678833, "epoch": 0.4972650422675286, "grad_norm": 0.8125, "learning_rate": 0.0002495, "loss": 7.9292, "mean_token_accuracy": 0.08549246788024903, "num_tokens": 980919.0, "step": 500 }, { "entropy": 8.342602348327636, "epoch": 0.5022376926902039, "grad_norm": 1.109375, "learning_rate": 0.000252, "loss": 7.935, "mean_token_accuracy": 0.08340146690607071, "num_tokens": 990659.0, "step": 505 }, { "entropy": 8.281801223754883, "epoch": 0.5072103431128792, "grad_norm": 1.0703125, "learning_rate": 0.0002545, "loss": 7.9936, "mean_token_accuracy": 0.08306360021233558, "num_tokens": 999540.0, "step": 510 }, { "entropy": 8.305860233306884, "epoch": 0.5121829935355544, "grad_norm": 1.1875, "learning_rate": 0.000257, "loss": 7.9735, "mean_token_accuracy": 0.07784088477492332, "num_tokens": 1008688.0, "step": 515 }, { "entropy": 8.2393967628479, "epoch": 0.5171556439582298, "grad_norm": 1.1796875, "learning_rate": 0.0002595, "loss": 7.8912, "mean_token_accuracy": 0.08796164914965629, "num_tokens": 1018310.0, "step": 520 }, { "entropy": 8.271358203887939, "epoch": 0.522128294380905, "grad_norm": 1.453125, "learning_rate": 0.000262, "loss": 7.992, "mean_token_accuracy": 0.07776187621057033, "num_tokens": 1027973.0, "step": 525 }, { "entropy": 8.25816240310669, "epoch": 0.5271009448035803, "grad_norm": 1.109375, "learning_rate": 0.00026450000000000003, "loss": 7.9134, "mean_token_accuracy": 0.0823927327990532, "num_tokens": 1038141.0, "step": 530 }, { "entropy": 8.307482242584229, "epoch": 0.5320735952262556, "grad_norm": 1.4296875, "learning_rate": 0.00026700000000000004, "loss": 7.9954, "mean_token_accuracy": 0.0746560201048851, "num_tokens": 1047932.0, "step": 535 }, { "entropy": 8.11481351852417, "epoch": 0.5370462456489309, "grad_norm": 1.09375, "learning_rate": 0.00026950000000000005, "loss": 7.815, "mean_token_accuracy": 0.08617698922753333, "num_tokens": 1056826.0, "step": 540 }, { "entropy": 8.254195022583009, "epoch": 0.5420188960716061, "grad_norm": 0.88671875, "learning_rate": 0.00027200000000000005, "loss": 7.9513, "mean_token_accuracy": 0.07954822443425655, "num_tokens": 1066025.0, "step": 545 }, { "entropy": 8.241740226745605, "epoch": 0.5469915464942815, "grad_norm": 0.92578125, "learning_rate": 0.0002745, "loss": 7.9671, "mean_token_accuracy": 0.08237918838858604, "num_tokens": 1075452.0, "step": 550 }, { "entropy": 8.266239452362061, "epoch": 0.5519641969169568, "grad_norm": 0.95703125, "learning_rate": 0.000277, "loss": 7.9517, "mean_token_accuracy": 0.08058798983693123, "num_tokens": 1085300.0, "step": 555 }, { "entropy": 8.197205829620362, "epoch": 0.556936847339632, "grad_norm": 1.0078125, "learning_rate": 0.0002795, "loss": 7.8531, "mean_token_accuracy": 0.08992455080151558, "num_tokens": 1094548.0, "step": 560 }, { "entropy": 8.297037601470947, "epoch": 0.5619094977623074, "grad_norm": 0.9140625, "learning_rate": 0.00028199999999999997, "loss": 7.8834, "mean_token_accuracy": 0.08289314061403275, "num_tokens": 1104321.0, "step": 565 }, { "entropy": 8.174269676208496, "epoch": 0.5668821481849826, "grad_norm": 1.1484375, "learning_rate": 0.0002845, "loss": 7.9814, "mean_token_accuracy": 0.07991863191127777, "num_tokens": 1115047.0, "step": 570 }, { "entropy": 8.311392879486084, "epoch": 0.5718547986076579, "grad_norm": 1.2109375, "learning_rate": 0.000287, "loss": 7.9362, "mean_token_accuracy": 0.08397412374615669, "num_tokens": 1124757.0, "step": 575 }, { "entropy": 8.168936347961425, "epoch": 0.5768274490303331, "grad_norm": 1.1015625, "learning_rate": 0.0002895, "loss": 7.9208, "mean_token_accuracy": 0.08150090202689171, "num_tokens": 1134255.0, "step": 580 }, { "entropy": 8.277891921997071, "epoch": 0.5818000994530085, "grad_norm": 1.0546875, "learning_rate": 0.000292, "loss": 7.953, "mean_token_accuracy": 0.08248294033110141, "num_tokens": 1143117.0, "step": 585 }, { "entropy": 8.268870639801026, "epoch": 0.5867727498756837, "grad_norm": 0.84765625, "learning_rate": 0.0002945, "loss": 7.8489, "mean_token_accuracy": 0.08494550883769988, "num_tokens": 1153203.0, "step": 590 }, { "entropy": 8.201098299026489, "epoch": 0.591745400298359, "grad_norm": 1.0078125, "learning_rate": 0.000297, "loss": 7.8512, "mean_token_accuracy": 0.08459036871790886, "num_tokens": 1162839.0, "step": 595 }, { "entropy": 8.038985967636108, "epoch": 0.5967180507210343, "grad_norm": 0.94921875, "learning_rate": 0.0002995, "loss": 7.8073, "mean_token_accuracy": 0.0855549156665802, "num_tokens": 1172580.0, "step": 600 }, { "entropy": 8.333229446411133, "epoch": 0.6016907011437096, "grad_norm": 0.9375, "learning_rate": 0.000302, "loss": 7.7966, "mean_token_accuracy": 0.08848728835582734, "num_tokens": 1183715.0, "step": 605 }, { "entropy": 8.207336330413819, "epoch": 0.6066633515663848, "grad_norm": 1.03125, "learning_rate": 0.0003045, "loss": 7.9676, "mean_token_accuracy": 0.08335011675953866, "num_tokens": 1194217.0, "step": 610 }, { "entropy": 8.153238296508789, "epoch": 0.6116360019890602, "grad_norm": 1.234375, "learning_rate": 0.000307, "loss": 7.8307, "mean_token_accuracy": 0.09300757572054863, "num_tokens": 1203297.0, "step": 615 }, { "entropy": 8.189011287689208, "epoch": 0.6166086524117355, "grad_norm": 1.1171875, "learning_rate": 0.0003095, "loss": 7.9124, "mean_token_accuracy": 0.08050687834620476, "num_tokens": 1213394.0, "step": 620 }, { "entropy": 8.147252416610717, "epoch": 0.6215813028344107, "grad_norm": 1.0234375, "learning_rate": 0.000312, "loss": 7.8772, "mean_token_accuracy": 0.08817379847168923, "num_tokens": 1222771.0, "step": 625 }, { "entropy": 8.183475399017334, "epoch": 0.6265539532570861, "grad_norm": 1.46875, "learning_rate": 0.0003145, "loss": 7.8564, "mean_token_accuracy": 0.08216950967907906, "num_tokens": 1232171.0, "step": 630 }, { "entropy": 8.14948844909668, "epoch": 0.6315266036797613, "grad_norm": 0.97265625, "learning_rate": 0.000317, "loss": 7.7892, "mean_token_accuracy": 0.08736580237746239, "num_tokens": 1241640.0, "step": 635 }, { "entropy": 8.020610046386718, "epoch": 0.6364992541024366, "grad_norm": 1.0625, "learning_rate": 0.0003195, "loss": 7.8193, "mean_token_accuracy": 0.08613748624920844, "num_tokens": 1251785.0, "step": 640 }, { "entropy": 8.17393879890442, "epoch": 0.6414719045251119, "grad_norm": 0.83203125, "learning_rate": 0.000322, "loss": 7.8003, "mean_token_accuracy": 0.0838981918990612, "num_tokens": 1262327.0, "step": 645 }, { "entropy": 8.108467531204223, "epoch": 0.6464445549477872, "grad_norm": 1.1640625, "learning_rate": 0.00032450000000000003, "loss": 7.7344, "mean_token_accuracy": 0.0935716263949871, "num_tokens": 1270871.0, "step": 650 }, { "entropy": 8.041076517105102, "epoch": 0.6514172053704624, "grad_norm": 0.84765625, "learning_rate": 0.00032700000000000003, "loss": 7.7863, "mean_token_accuracy": 0.08575954586267472, "num_tokens": 1281563.0, "step": 655 }, { "entropy": 8.092488050460815, "epoch": 0.6563898557931377, "grad_norm": 0.9375, "learning_rate": 0.00032950000000000004, "loss": 7.7953, "mean_token_accuracy": 0.0862328752875328, "num_tokens": 1290867.0, "step": 660 }, { "entropy": 8.103744792938233, "epoch": 0.661362506215813, "grad_norm": 1.3359375, "learning_rate": 0.00033200000000000005, "loss": 7.8021, "mean_token_accuracy": 0.08568327575922012, "num_tokens": 1300384.0, "step": 665 }, { "entropy": 8.164299821853637, "epoch": 0.6663351566384883, "grad_norm": 0.984375, "learning_rate": 0.00033450000000000005, "loss": 7.7204, "mean_token_accuracy": 0.08943556696176529, "num_tokens": 1310443.0, "step": 670 }, { "entropy": 8.06074333190918, "epoch": 0.6713078070611636, "grad_norm": 0.875, "learning_rate": 0.000337, "loss": 7.6955, "mean_token_accuracy": 0.09299010708928108, "num_tokens": 1320345.0, "step": 675 }, { "entropy": 8.047345161437988, "epoch": 0.6762804574838389, "grad_norm": 1.15625, "learning_rate": 0.0003395, "loss": 7.8477, "mean_token_accuracy": 0.09007203951478004, "num_tokens": 1330868.0, "step": 680 }, { "entropy": 8.039288234710693, "epoch": 0.6812531079065142, "grad_norm": 1.0, "learning_rate": 0.000342, "loss": 7.7502, "mean_token_accuracy": 0.0904244638979435, "num_tokens": 1340605.0, "step": 685 }, { "entropy": 8.095660161972045, "epoch": 0.6862257583291894, "grad_norm": 1.09375, "learning_rate": 0.00034449999999999997, "loss": 7.7783, "mean_token_accuracy": 0.09001534283161164, "num_tokens": 1350248.0, "step": 690 }, { "entropy": 7.915007543563843, "epoch": 0.6911984087518648, "grad_norm": 1.1640625, "learning_rate": 0.000347, "loss": 7.7378, "mean_token_accuracy": 0.09054447710514069, "num_tokens": 1360251.0, "step": 695 }, { "entropy": 8.069479322433471, "epoch": 0.69617105917454, "grad_norm": 1.3046875, "learning_rate": 0.0003495, "loss": 7.6944, "mean_token_accuracy": 0.09407384619116783, "num_tokens": 1370156.0, "step": 700 }, { "entropy": 8.041491079330445, "epoch": 0.7011437095972153, "grad_norm": 1.03125, "learning_rate": 0.000352, "loss": 7.8648, "mean_token_accuracy": 0.08170138709247113, "num_tokens": 1380346.0, "step": 705 }, { "entropy": 8.085822105407715, "epoch": 0.7061163600198906, "grad_norm": 1.0078125, "learning_rate": 0.0003545, "loss": 7.7145, "mean_token_accuracy": 0.08923521786928176, "num_tokens": 1390958.0, "step": 710 }, { "entropy": 7.925909805297851, "epoch": 0.7110890104425659, "grad_norm": 1.21875, "learning_rate": 0.000357, "loss": 7.7802, "mean_token_accuracy": 0.08992756679654121, "num_tokens": 1400324.0, "step": 715 }, { "entropy": 8.133356475830078, "epoch": 0.7160616608652411, "grad_norm": 1.0390625, "learning_rate": 0.0003595, "loss": 7.6965, "mean_token_accuracy": 0.09310642331838608, "num_tokens": 1410272.0, "step": 720 }, { "entropy": 7.908285140991211, "epoch": 0.7210343112879165, "grad_norm": 1.15625, "learning_rate": 0.000362, "loss": 7.709, "mean_token_accuracy": 0.08933724686503411, "num_tokens": 1420061.0, "step": 725 }, { "entropy": 7.976055860519409, "epoch": 0.7260069617105918, "grad_norm": 1.0390625, "learning_rate": 0.0003645, "loss": 7.6598, "mean_token_accuracy": 0.09588965848088264, "num_tokens": 1428771.0, "step": 730 }, { "entropy": 7.941432189941406, "epoch": 0.730979612133267, "grad_norm": 1.0234375, "learning_rate": 0.000367, "loss": 7.6496, "mean_token_accuracy": 0.09268148764967918, "num_tokens": 1438154.0, "step": 735 }, { "entropy": 7.898643589019775, "epoch": 0.7359522625559424, "grad_norm": 1.1015625, "learning_rate": 0.0003695, "loss": 7.6437, "mean_token_accuracy": 0.09478027224540711, "num_tokens": 1447403.0, "step": 740 }, { "entropy": 8.055390310287475, "epoch": 0.7409249129786176, "grad_norm": 1.0625, "learning_rate": 0.000372, "loss": 7.7377, "mean_token_accuracy": 0.08860993757843971, "num_tokens": 1457443.0, "step": 745 }, { "entropy": 7.929141616821289, "epoch": 0.7458975634012929, "grad_norm": 0.95703125, "learning_rate": 0.0003745, "loss": 7.7108, "mean_token_accuracy": 0.09391758814454079, "num_tokens": 1466783.0, "step": 750 }, { "entropy": 8.047775173187256, "epoch": 0.7508702138239681, "grad_norm": 1.328125, "learning_rate": 0.000377, "loss": 7.7288, "mean_token_accuracy": 0.09357419535517693, "num_tokens": 1476320.0, "step": 755 }, { "entropy": 7.983895683288575, "epoch": 0.7558428642466435, "grad_norm": 1.1640625, "learning_rate": 0.0003795, "loss": 7.6311, "mean_token_accuracy": 0.09203912019729614, "num_tokens": 1487581.0, "step": 760 }, { "entropy": 7.982823610305786, "epoch": 0.7608155146693187, "grad_norm": 1.0078125, "learning_rate": 0.000382, "loss": 7.7476, "mean_token_accuracy": 0.08909644484519959, "num_tokens": 1496455.0, "step": 765 }, { "entropy": 8.00187635421753, "epoch": 0.765788165091994, "grad_norm": 1.0234375, "learning_rate": 0.0003845, "loss": 7.6811, "mean_token_accuracy": 0.0940045453608036, "num_tokens": 1506422.0, "step": 770 }, { "entropy": 7.9452033042907715, "epoch": 0.7707608155146694, "grad_norm": 1.03125, "learning_rate": 0.00038700000000000003, "loss": 7.6576, "mean_token_accuracy": 0.09396952167153358, "num_tokens": 1516593.0, "step": 775 }, { "entropy": 7.914292907714843, "epoch": 0.7757334659373446, "grad_norm": 1.125, "learning_rate": 0.00038950000000000003, "loss": 7.6933, "mean_token_accuracy": 0.09422306939959527, "num_tokens": 1526011.0, "step": 780 }, { "entropy": 7.94219651222229, "epoch": 0.7807061163600199, "grad_norm": 1.1796875, "learning_rate": 0.00039200000000000004, "loss": 7.6456, "mean_token_accuracy": 0.09301053732633591, "num_tokens": 1536018.0, "step": 785 }, { "entropy": 7.867347574234008, "epoch": 0.7856787667826952, "grad_norm": 1.0625, "learning_rate": 0.00039450000000000005, "loss": 7.563, "mean_token_accuracy": 0.09273268505930901, "num_tokens": 1545568.0, "step": 790 }, { "entropy": 7.888858270645142, "epoch": 0.7906514172053705, "grad_norm": 1.1171875, "learning_rate": 0.00039700000000000005, "loss": 7.5806, "mean_token_accuracy": 0.09568437114357949, "num_tokens": 1556389.0, "step": 795 }, { "entropy": 8.077014636993407, "epoch": 0.7956240676280457, "grad_norm": 1.1328125, "learning_rate": 0.0003995, "loss": 7.6664, "mean_token_accuracy": 0.094173014909029, "num_tokens": 1565587.0, "step": 800 }, { "entropy": 7.789323377609253, "epoch": 0.8005967180507211, "grad_norm": 0.96484375, "learning_rate": 0.000402, "loss": 7.5872, "mean_token_accuracy": 0.09633276090025902, "num_tokens": 1574911.0, "step": 805 }, { "entropy": 7.800200891494751, "epoch": 0.8055693684733963, "grad_norm": 1.0859375, "learning_rate": 0.0004045, "loss": 7.5444, "mean_token_accuracy": 0.09973727241158485, "num_tokens": 1584477.0, "step": 810 }, { "entropy": 7.85718994140625, "epoch": 0.8105420188960716, "grad_norm": 1.078125, "learning_rate": 0.00040699999999999997, "loss": 7.5963, "mean_token_accuracy": 0.10033143982291222, "num_tokens": 1594408.0, "step": 815 }, { "entropy": 7.81588306427002, "epoch": 0.8155146693187469, "grad_norm": 1.109375, "learning_rate": 0.0004095, "loss": 7.5669, "mean_token_accuracy": 0.0977571152150631, "num_tokens": 1603494.0, "step": 820 }, { "entropy": 7.876517486572266, "epoch": 0.8204873197414222, "grad_norm": 1.046875, "learning_rate": 0.000412, "loss": 7.6542, "mean_token_accuracy": 0.09184657931327819, "num_tokens": 1612994.0, "step": 825 }, { "entropy": 7.925539493560791, "epoch": 0.8254599701640974, "grad_norm": 1.125, "learning_rate": 0.0004145, "loss": 7.5585, "mean_token_accuracy": 0.09361765310168266, "num_tokens": 1622150.0, "step": 830 }, { "entropy": 7.804845714569092, "epoch": 0.8304326205867727, "grad_norm": 1.2421875, "learning_rate": 0.000417, "loss": 7.5369, "mean_token_accuracy": 0.09732099249958992, "num_tokens": 1631040.0, "step": 835 }, { "entropy": 7.844776153564453, "epoch": 0.8354052710094481, "grad_norm": 0.95703125, "learning_rate": 0.0004195, "loss": 7.5072, "mean_token_accuracy": 0.09882537350058555, "num_tokens": 1641519.0, "step": 840 }, { "entropy": 7.830556344985962, "epoch": 0.8403779214321233, "grad_norm": 1.125, "learning_rate": 0.000422, "loss": 7.5872, "mean_token_accuracy": 0.09334329888224602, "num_tokens": 1652218.0, "step": 845 }, { "entropy": 7.954732227325439, "epoch": 0.8453505718547986, "grad_norm": 1.03125, "learning_rate": 0.0004245, "loss": 7.6107, "mean_token_accuracy": 0.08996398076415062, "num_tokens": 1663763.0, "step": 850 }, { "entropy": 7.903445243835449, "epoch": 0.8503232222774739, "grad_norm": 1.0234375, "learning_rate": 0.000427, "loss": 7.5868, "mean_token_accuracy": 0.0892759084701538, "num_tokens": 1674160.0, "step": 855 }, { "entropy": 7.8312461376190186, "epoch": 0.8552958727001492, "grad_norm": 0.9375, "learning_rate": 0.0004295, "loss": 7.6735, "mean_token_accuracy": 0.09993282482028007, "num_tokens": 1685138.0, "step": 860 }, { "entropy": 7.915536546707154, "epoch": 0.8602685231228244, "grad_norm": 1.0703125, "learning_rate": 0.000432, "loss": 7.5964, "mean_token_accuracy": 0.09194504842162132, "num_tokens": 1694847.0, "step": 865 }, { "entropy": 7.881135511398315, "epoch": 0.8652411735454998, "grad_norm": 1.03125, "learning_rate": 0.0004345, "loss": 7.5998, "mean_token_accuracy": 0.09743813574314117, "num_tokens": 1704503.0, "step": 870 }, { "entropy": 7.776781034469605, "epoch": 0.870213823968175, "grad_norm": 1.390625, "learning_rate": 0.000437, "loss": 7.5293, "mean_token_accuracy": 0.09748897776007652, "num_tokens": 1714011.0, "step": 875 }, { "entropy": 7.801973628997803, "epoch": 0.8751864743908503, "grad_norm": 1.0703125, "learning_rate": 0.0004395, "loss": 7.4955, "mean_token_accuracy": 0.09765939489006996, "num_tokens": 1724254.0, "step": 880 }, { "entropy": 7.837724447250366, "epoch": 0.8801591248135257, "grad_norm": 1.0234375, "learning_rate": 0.000442, "loss": 7.5681, "mean_token_accuracy": 0.09028975144028664, "num_tokens": 1734696.0, "step": 885 }, { "entropy": 7.675987672805786, "epoch": 0.8851317752362009, "grad_norm": 1.03125, "learning_rate": 0.0004445, "loss": 7.5001, "mean_token_accuracy": 0.10280377641320229, "num_tokens": 1743650.0, "step": 890 }, { "entropy": 7.819700384140015, "epoch": 0.8901044256588762, "grad_norm": 1.0546875, "learning_rate": 0.000447, "loss": 7.4778, "mean_token_accuracy": 0.10012103915214539, "num_tokens": 1753449.0, "step": 895 }, { "entropy": 7.801957607269287, "epoch": 0.8950770760815515, "grad_norm": 1.0234375, "learning_rate": 0.00044950000000000003, "loss": 7.6216, "mean_token_accuracy": 0.09693230763077736, "num_tokens": 1764104.0, "step": 900 }, { "entropy": 7.745624685287476, "epoch": 0.9000497265042268, "grad_norm": 1.1953125, "learning_rate": 0.00045200000000000004, "loss": 7.3551, "mean_token_accuracy": 0.11145004704594612, "num_tokens": 1773172.0, "step": 905 }, { "entropy": 7.822540807723999, "epoch": 0.905022376926902, "grad_norm": 1.1484375, "learning_rate": 0.00045450000000000004, "loss": 7.4545, "mean_token_accuracy": 0.09577107727527619, "num_tokens": 1783268.0, "step": 910 }, { "entropy": 7.680446481704712, "epoch": 0.9099950273495774, "grad_norm": 1.109375, "learning_rate": 0.00045700000000000005, "loss": 7.4938, "mean_token_accuracy": 0.09600771963596344, "num_tokens": 1792169.0, "step": 915 }, { "entropy": 7.807571697235107, "epoch": 0.9149676777722526, "grad_norm": 1.015625, "learning_rate": 0.00045950000000000006, "loss": 7.5072, "mean_token_accuracy": 0.09743363708257675, "num_tokens": 1802280.0, "step": 920 }, { "entropy": 7.771829319000244, "epoch": 0.9199403281949279, "grad_norm": 1.0390625, "learning_rate": 0.000462, "loss": 7.49, "mean_token_accuracy": 0.09764456748962402, "num_tokens": 1812086.0, "step": 925 }, { "entropy": 7.619400691986084, "epoch": 0.9249129786176031, "grad_norm": 1.109375, "learning_rate": 0.0004645, "loss": 7.3995, "mean_token_accuracy": 0.10075560957193375, "num_tokens": 1821554.0, "step": 930 }, { "entropy": 7.7458329677581785, "epoch": 0.9298856290402785, "grad_norm": 1.125, "learning_rate": 0.000467, "loss": 7.5033, "mean_token_accuracy": 0.09854165613651275, "num_tokens": 1831088.0, "step": 935 }, { "entropy": 7.713270378112793, "epoch": 0.9348582794629537, "grad_norm": 1.03125, "learning_rate": 0.0004695, "loss": 7.4947, "mean_token_accuracy": 0.10245847553014756, "num_tokens": 1840606.0, "step": 940 }, { "entropy": 7.618422651290894, "epoch": 0.939830929885629, "grad_norm": 1.0390625, "learning_rate": 0.000472, "loss": 7.4168, "mean_token_accuracy": 0.10519779622554778, "num_tokens": 1850343.0, "step": 945 }, { "entropy": 7.679243659973144, "epoch": 0.9448035803083044, "grad_norm": 0.94140625, "learning_rate": 0.0004745, "loss": 7.5276, "mean_token_accuracy": 0.09985006228089333, "num_tokens": 1860727.0, "step": 950 }, { "entropy": 7.74239935874939, "epoch": 0.9497762307309796, "grad_norm": 1.15625, "learning_rate": 0.000477, "loss": 7.44, "mean_token_accuracy": 0.09804870411753655, "num_tokens": 1870703.0, "step": 955 }, { "entropy": 7.642041158676148, "epoch": 0.9547488811536549, "grad_norm": 1.046875, "learning_rate": 0.0004795, "loss": 7.4442, "mean_token_accuracy": 0.09999973624944687, "num_tokens": 1880694.0, "step": 960 }, { "entropy": 7.688436794281006, "epoch": 0.9597215315763302, "grad_norm": 1.2578125, "learning_rate": 0.000482, "loss": 7.421, "mean_token_accuracy": 0.10089910924434661, "num_tokens": 1890195.0, "step": 965 }, { "entropy": 7.7042396068573, "epoch": 0.9646941819990055, "grad_norm": 0.8828125, "learning_rate": 0.0004845, "loss": 7.4035, "mean_token_accuracy": 0.09818647429347038, "num_tokens": 1900221.0, "step": 970 }, { "entropy": 7.550181436538696, "epoch": 0.9696668324216807, "grad_norm": 1.109375, "learning_rate": 0.000487, "loss": 7.4253, "mean_token_accuracy": 0.10160460993647576, "num_tokens": 1910122.0, "step": 975 }, { "entropy": 7.721483993530273, "epoch": 0.9746394828443561, "grad_norm": 1.0390625, "learning_rate": 0.0004895, "loss": 7.4121, "mean_token_accuracy": 0.10157517120242118, "num_tokens": 1918814.0, "step": 980 }, { "entropy": 7.638028144836426, "epoch": 0.9796121332670313, "grad_norm": 1.140625, "learning_rate": 0.000492, "loss": 7.4151, "mean_token_accuracy": 0.10515621416270733, "num_tokens": 1928446.0, "step": 985 }, { "entropy": 7.612313270568848, "epoch": 0.9845847836897066, "grad_norm": 0.8828125, "learning_rate": 0.0004945, "loss": 7.4049, "mean_token_accuracy": 0.10270627811551095, "num_tokens": 1939060.0, "step": 990 }, { "entropy": 7.744016695022583, "epoch": 0.989557434112382, "grad_norm": 0.98046875, "learning_rate": 0.000497, "loss": 7.3817, "mean_token_accuracy": 0.10619868710637093, "num_tokens": 1948809.0, "step": 995 }, { "entropy": 7.560209703445435, "epoch": 0.9945300845350572, "grad_norm": 1.109375, "learning_rate": 0.0004995, "loss": 7.3954, "mean_token_accuracy": 0.09983602836728096, "num_tokens": 1959232.0, "step": 1000 }, { "epoch": 0.9945300845350572, "eval_entropy": 7.663880120774019, "eval_loss": 7.499252796173096, "eval_mean_token_accuracy": 0.09531869574917763, "eval_num_tokens": 1959232.0, "eval_runtime": 1.968, "eval_samples_per_second": 1760.666, "eval_steps_per_second": 220.528, "step": 1000 }, { "entropy": 7.652824592590332, "epoch": 0.9995027349577325, "grad_norm": 1.0078125, "learning_rate": 0.0004999997830922735, "loss": 7.3392, "mean_token_accuracy": 0.10435211062431335, "num_tokens": 1969117.0, "step": 1005 }, { "entropy": 7.638497670491536, "epoch": 1.0039781203381402, "grad_norm": 0.98828125, "learning_rate": 0.0004999989019053515, "loss": 7.3929, "mean_token_accuracy": 0.10093366271919674, "num_tokens": 1978202.0, "step": 1010 }, { "entropy": 7.454118299484253, "epoch": 1.0089507707608154, "grad_norm": 1.359375, "learning_rate": 0.0004999973428851536, "loss": 7.1938, "mean_token_accuracy": 0.11009480580687522, "num_tokens": 1988085.0, "step": 1015 }, { "entropy": 7.602870607376099, "epoch": 1.0139234211834909, "grad_norm": 1.0625, "learning_rate": 0.0004999951060363766, "loss": 7.1998, "mean_token_accuracy": 0.10971582233905793, "num_tokens": 1996977.0, "step": 1020 }, { "entropy": 7.682427835464478, "epoch": 1.0188960716061661, "grad_norm": 1.15625, "learning_rate": 0.0004999921913657592, "loss": 7.2819, "mean_token_accuracy": 0.1068710558116436, "num_tokens": 2006622.0, "step": 1025 }, { "entropy": 7.629259252548218, "epoch": 1.0238687220288414, "grad_norm": 0.9296875, "learning_rate": 0.0004999885988820821, "loss": 7.339, "mean_token_accuracy": 0.10073929280042648, "num_tokens": 2016390.0, "step": 1030 }, { "entropy": 7.5728232860565186, "epoch": 1.0288413724515166, "grad_norm": 1.015625, "learning_rate": 0.0004999843285961683, "loss": 7.1706, "mean_token_accuracy": 0.10830774009227753, "num_tokens": 2026439.0, "step": 1035 }, { "entropy": 7.491561603546143, "epoch": 1.0338140228741919, "grad_norm": 1.0546875, "learning_rate": 0.0004999793805208822, "loss": 7.2628, "mean_token_accuracy": 0.1112583301961422, "num_tokens": 2035611.0, "step": 1040 }, { "entropy": 7.578234386444092, "epoch": 1.0387866732968671, "grad_norm": 0.9765625, "learning_rate": 0.0004999737546711305, "loss": 7.3013, "mean_token_accuracy": 0.09911790117621422, "num_tokens": 2047166.0, "step": 1045 }, { "entropy": 7.571400356292725, "epoch": 1.0437593237195426, "grad_norm": 0.96875, "learning_rate": 0.0004999674510638618, "loss": 7.2021, "mean_token_accuracy": 0.1058596208691597, "num_tokens": 2057216.0, "step": 1050 }, { "entropy": 7.565094327926635, "epoch": 1.0487319741422179, "grad_norm": 1.0546875, "learning_rate": 0.0004999604697180661, "loss": 7.2428, "mean_token_accuracy": 0.10463513508439064, "num_tokens": 2067339.0, "step": 1055 }, { "entropy": 7.47660346031189, "epoch": 1.053704624564893, "grad_norm": 1.15625, "learning_rate": 0.0004999528106547759, "loss": 7.1306, "mean_token_accuracy": 0.11121664196252823, "num_tokens": 2077815.0, "step": 1060 }, { "entropy": 7.4952796459197994, "epoch": 1.0586772749875684, "grad_norm": 1.1328125, "learning_rate": 0.0004999444738970644, "loss": 7.2416, "mean_token_accuracy": 0.10029239431023598, "num_tokens": 2087738.0, "step": 1065 }, { "entropy": 7.528722715377808, "epoch": 1.0636499254102436, "grad_norm": 1.015625, "learning_rate": 0.0004999354594700474, "loss": 7.1288, "mean_token_accuracy": 0.1104028731584549, "num_tokens": 2097246.0, "step": 1070 }, { "entropy": 7.395474624633789, "epoch": 1.0686225758329189, "grad_norm": 1.1015625, "learning_rate": 0.0004999257674008817, "loss": 7.0468, "mean_token_accuracy": 0.11465127766132355, "num_tokens": 2106415.0, "step": 1075 }, { "entropy": 7.435509967803955, "epoch": 1.0735952262555943, "grad_norm": 1.15625, "learning_rate": 0.0004999153977187656, "loss": 7.0478, "mean_token_accuracy": 0.11568540632724762, "num_tokens": 2115950.0, "step": 1080 }, { "entropy": 7.555899810791016, "epoch": 1.0785678766782696, "grad_norm": 0.98046875, "learning_rate": 0.000499904350454939, "loss": 7.2801, "mean_token_accuracy": 0.10703531876206399, "num_tokens": 2127896.0, "step": 1085 }, { "entropy": 7.466849851608276, "epoch": 1.0835405271009448, "grad_norm": 0.98828125, "learning_rate": 0.0004998926256426829, "loss": 7.2072, "mean_token_accuracy": 0.10295388251543044, "num_tokens": 2137238.0, "step": 1090 }, { "entropy": 7.4008838653564455, "epoch": 1.08851317752362, "grad_norm": 2.140625, "learning_rate": 0.0004998802233173196, "loss": 7.1327, "mean_token_accuracy": 0.10857007130980492, "num_tokens": 2147107.0, "step": 1095 }, { "entropy": 7.562657022476197, "epoch": 1.0934858279462953, "grad_norm": 0.90625, "learning_rate": 0.0004998671435162123, "loss": 7.2329, "mean_token_accuracy": 0.10983152613043785, "num_tokens": 2157128.0, "step": 1100 }, { "entropy": 7.367861270904541, "epoch": 1.0984584783689706, "grad_norm": 0.953125, "learning_rate": 0.0004998533862787657, "loss": 7.139, "mean_token_accuracy": 0.10776777565479279, "num_tokens": 2167981.0, "step": 1105 }, { "entropy": 7.565176868438721, "epoch": 1.1034311287916458, "grad_norm": 1.03125, "learning_rate": 0.0004998389516464244, "loss": 7.1452, "mean_token_accuracy": 0.11406787484884262, "num_tokens": 2177659.0, "step": 1110 }, { "entropy": 7.408087825775146, "epoch": 1.1084037792143213, "grad_norm": 1.0546875, "learning_rate": 0.0004998238396626746, "loss": 7.1367, "mean_token_accuracy": 0.11176337599754334, "num_tokens": 2186936.0, "step": 1115 }, { "entropy": 7.54493260383606, "epoch": 1.1133764296369966, "grad_norm": 0.92578125, "learning_rate": 0.0004998080503730427, "loss": 7.1795, "mean_token_accuracy": 0.11108661815524101, "num_tokens": 2197126.0, "step": 1120 }, { "entropy": 7.387998628616333, "epoch": 1.1183490800596718, "grad_norm": 1.0546875, "learning_rate": 0.0004997915838250956, "loss": 7.2127, "mean_token_accuracy": 0.1092200145125389, "num_tokens": 2206337.0, "step": 1125 }, { "entropy": 7.425206995010376, "epoch": 1.123321730482347, "grad_norm": 0.96875, "learning_rate": 0.0004997744400684406, "loss": 7.1245, "mean_token_accuracy": 0.1112686663866043, "num_tokens": 2217112.0, "step": 1130 }, { "entropy": 7.536670255661011, "epoch": 1.1282943809050223, "grad_norm": 1.09375, "learning_rate": 0.0004997566191547251, "loss": 7.2413, "mean_token_accuracy": 0.0996586687862873, "num_tokens": 2226239.0, "step": 1135 }, { "entropy": 7.480391931533814, "epoch": 1.1332670313276976, "grad_norm": 0.953125, "learning_rate": 0.0004997381211376364, "loss": 7.2435, "mean_token_accuracy": 0.10793717727065086, "num_tokens": 2235702.0, "step": 1140 }, { "entropy": 7.498857593536377, "epoch": 1.138239681750373, "grad_norm": 0.9453125, "learning_rate": 0.0004997189460729019, "loss": 7.1985, "mean_token_accuracy": 0.1158548802137375, "num_tokens": 2246005.0, "step": 1145 }, { "entropy": 7.36326003074646, "epoch": 1.1432123321730483, "grad_norm": 1.0625, "learning_rate": 0.0004996990940182884, "loss": 7.1669, "mean_token_accuracy": 0.11077979952096939, "num_tokens": 2255534.0, "step": 1150 }, { "entropy": 7.547649478912353, "epoch": 1.1481849825957235, "grad_norm": 1.0078125, "learning_rate": 0.0004996785650336024, "loss": 7.2299, "mean_token_accuracy": 0.10904022231698036, "num_tokens": 2266374.0, "step": 1155 }, { "entropy": 7.349261856079101, "epoch": 1.1531576330183988, "grad_norm": 1.1484375, "learning_rate": 0.0004996573591806898, "loss": 7.0576, "mean_token_accuracy": 0.11764942482113838, "num_tokens": 2275614.0, "step": 1160 }, { "entropy": 7.34725432395935, "epoch": 1.158130283441074, "grad_norm": 0.99609375, "learning_rate": 0.0004996354765234353, "loss": 7.13, "mean_token_accuracy": 0.118476003408432, "num_tokens": 2284403.0, "step": 1165 }, { "entropy": 7.44727668762207, "epoch": 1.1631029338637493, "grad_norm": 1.09375, "learning_rate": 0.0004996129171277628, "loss": 7.1453, "mean_token_accuracy": 0.11195796579122544, "num_tokens": 2294153.0, "step": 1170 }, { "entropy": 7.328168344497681, "epoch": 1.1680755842864246, "grad_norm": 1.1171875, "learning_rate": 0.0004995896810616349, "loss": 7.1531, "mean_token_accuracy": 0.11211650222539901, "num_tokens": 2302897.0, "step": 1175 }, { "entropy": 7.60505108833313, "epoch": 1.1730482347091, "grad_norm": 1.0078125, "learning_rate": 0.0004995657683950528, "loss": 7.2459, "mean_token_accuracy": 0.10690148249268532, "num_tokens": 2312483.0, "step": 1180 }, { "entropy": 7.164384555816651, "epoch": 1.1780208851317753, "grad_norm": 0.95703125, "learning_rate": 0.0004995411792000559, "loss": 6.9792, "mean_token_accuracy": 0.1140922635793686, "num_tokens": 2321911.0, "step": 1185 }, { "entropy": 7.523615169525146, "epoch": 1.1829935355544505, "grad_norm": 1.0390625, "learning_rate": 0.0004995159135507218, "loss": 7.2574, "mean_token_accuracy": 0.11030113250017166, "num_tokens": 2331932.0, "step": 1190 }, { "entropy": 7.2158557891845705, "epoch": 1.1879661859771258, "grad_norm": 0.9609375, "learning_rate": 0.000499489971523166, "loss": 7.0356, "mean_token_accuracy": 0.1182777851819992, "num_tokens": 2342264.0, "step": 1195 }, { "entropy": 7.4898519039154055, "epoch": 1.192938836399801, "grad_norm": 1.15625, "learning_rate": 0.0004994633531955415, "loss": 7.2042, "mean_token_accuracy": 0.11488257497549056, "num_tokens": 2353068.0, "step": 1200 }, { "entropy": 7.342766809463501, "epoch": 1.1979114868224765, "grad_norm": 0.98046875, "learning_rate": 0.0004994360586480391, "loss": 7.0076, "mean_token_accuracy": 0.1172205351293087, "num_tokens": 2361765.0, "step": 1205 }, { "entropy": 7.347688913345337, "epoch": 1.2028841372451518, "grad_norm": 0.9453125, "learning_rate": 0.0004994080879628864, "loss": 7.0965, "mean_token_accuracy": 0.10909276083111763, "num_tokens": 2372721.0, "step": 1210 }, { "entropy": 7.394931697845459, "epoch": 1.207856787667827, "grad_norm": 0.92578125, "learning_rate": 0.0004993794412243481, "loss": 7.1417, "mean_token_accuracy": 0.11445093527436256, "num_tokens": 2382288.0, "step": 1215 }, { "entropy": 7.369056034088135, "epoch": 1.2128294380905023, "grad_norm": 0.9921875, "learning_rate": 0.0004993501185187255, "loss": 7.1763, "mean_token_accuracy": 0.11123459935188293, "num_tokens": 2391953.0, "step": 1220 }, { "entropy": 7.437870502471924, "epoch": 1.2178020885131775, "grad_norm": 0.96875, "learning_rate": 0.0004993201199343565, "loss": 7.2157, "mean_token_accuracy": 0.1062049113214016, "num_tokens": 2402705.0, "step": 1225 }, { "entropy": 7.370413541793823, "epoch": 1.2227747389358528, "grad_norm": 0.9453125, "learning_rate": 0.0004992894455616149, "loss": 7.1436, "mean_token_accuracy": 0.10832376927137374, "num_tokens": 2412654.0, "step": 1230 }, { "entropy": 7.446359539031983, "epoch": 1.227747389358528, "grad_norm": 1.046875, "learning_rate": 0.0004992580954929108, "loss": 7.2253, "mean_token_accuracy": 0.11181128472089767, "num_tokens": 2422958.0, "step": 1235 }, { "entropy": 7.285688352584839, "epoch": 1.2327200397812033, "grad_norm": 1.0390625, "learning_rate": 0.0004992260698226894, "loss": 7.0545, "mean_token_accuracy": 0.11718959137797355, "num_tokens": 2432274.0, "step": 1240 }, { "entropy": 7.359494256973266, "epoch": 1.2376926902038787, "grad_norm": 1.1015625, "learning_rate": 0.0004991933686474315, "loss": 7.2482, "mean_token_accuracy": 0.1052965871989727, "num_tokens": 2443818.0, "step": 1245 }, { "entropy": 7.433595800399781, "epoch": 1.242665340626554, "grad_norm": 0.96484375, "learning_rate": 0.0004991599920656529, "loss": 7.1006, "mean_token_accuracy": 0.11419800966978073, "num_tokens": 2453474.0, "step": 1250 }, { "entropy": 7.299234342575073, "epoch": 1.2476379910492292, "grad_norm": 0.97265625, "learning_rate": 0.0004991259401779042, "loss": 7.0779, "mean_token_accuracy": 0.11456455364823341, "num_tokens": 2462715.0, "step": 1255 }, { "entropy": 7.239331007003784, "epoch": 1.2526106414719045, "grad_norm": 1.34375, "learning_rate": 0.0004990912130867704, "loss": 6.9991, "mean_token_accuracy": 0.11862109750509262, "num_tokens": 2473256.0, "step": 1260 }, { "entropy": 7.414499378204345, "epoch": 1.2575832918945797, "grad_norm": 1.015625, "learning_rate": 0.0004990558108968703, "loss": 7.0494, "mean_token_accuracy": 0.11045486181974411, "num_tokens": 2482475.0, "step": 1265 }, { "entropy": 7.343642902374268, "epoch": 1.2625559423172552, "grad_norm": 0.9921875, "learning_rate": 0.0004990197337148571, "loss": 7.1048, "mean_token_accuracy": 0.11450405716896057, "num_tokens": 2493163.0, "step": 1270 }, { "entropy": 7.409062671661377, "epoch": 1.2675285927399305, "grad_norm": 1.046875, "learning_rate": 0.000498982981649417, "loss": 7.1305, "mean_token_accuracy": 0.11062562018632889, "num_tokens": 2502062.0, "step": 1275 }, { "entropy": 7.319326114654541, "epoch": 1.2725012431626057, "grad_norm": 0.97265625, "learning_rate": 0.0004989455548112695, "loss": 7.1171, "mean_token_accuracy": 0.11394161209464074, "num_tokens": 2511196.0, "step": 1280 }, { "entropy": 7.431995296478272, "epoch": 1.277473893585281, "grad_norm": 1.046875, "learning_rate": 0.0004989074533131671, "loss": 7.0306, "mean_token_accuracy": 0.11063500270247459, "num_tokens": 2520492.0, "step": 1285 }, { "entropy": 7.262810373306275, "epoch": 1.2824465440079562, "grad_norm": 1.0390625, "learning_rate": 0.0004988686772698945, "loss": 7.0687, "mean_token_accuracy": 0.11465330570936202, "num_tokens": 2530368.0, "step": 1290 }, { "entropy": 7.381555700302124, "epoch": 1.2874191944306315, "grad_norm": 1.0625, "learning_rate": 0.0004988292267982689, "loss": 7.1119, "mean_token_accuracy": 0.1116415798664093, "num_tokens": 2540734.0, "step": 1295 }, { "entropy": 7.262171602249145, "epoch": 1.2923918448533067, "grad_norm": 0.89453125, "learning_rate": 0.0004987891020171387, "loss": 7.1152, "mean_token_accuracy": 0.11137261465191842, "num_tokens": 2550907.0, "step": 1300 }, { "entropy": 7.432864618301392, "epoch": 1.297364495275982, "grad_norm": 1.0859375, "learning_rate": 0.0004987483030473845, "loss": 7.1694, "mean_token_accuracy": 0.11338013410568237, "num_tokens": 2560062.0, "step": 1305 }, { "entropy": 7.376054286956787, "epoch": 1.3023371456986574, "grad_norm": 1.09375, "learning_rate": 0.0004987068300119173, "loss": 7.0761, "mean_token_accuracy": 0.11074780225753784, "num_tokens": 2568840.0, "step": 1310 }, { "entropy": 7.418955898284912, "epoch": 1.3073097961213327, "grad_norm": 1.015625, "learning_rate": 0.0004986646830356792, "loss": 7.1592, "mean_token_accuracy": 0.10980475470423698, "num_tokens": 2578566.0, "step": 1315 }, { "entropy": 7.359957695007324, "epoch": 1.312282446544008, "grad_norm": 0.94921875, "learning_rate": 0.0004986218622456423, "loss": 7.1542, "mean_token_accuracy": 0.11024739816784859, "num_tokens": 2589853.0, "step": 1320 }, { "entropy": 7.3830647468566895, "epoch": 1.3172550969666832, "grad_norm": 1.0234375, "learning_rate": 0.000498578367770809, "loss": 7.1113, "mean_token_accuracy": 0.11441166028380394, "num_tokens": 2600848.0, "step": 1325 }, { "entropy": 7.276734209060669, "epoch": 1.3222277473893587, "grad_norm": 0.9140625, "learning_rate": 0.0004985341997422111, "loss": 7.0555, "mean_token_accuracy": 0.11667966097593307, "num_tokens": 2610730.0, "step": 1330 }, { "entropy": 7.2858161449432375, "epoch": 1.327200397812034, "grad_norm": 1.2109375, "learning_rate": 0.0004984893582929093, "loss": 7.1501, "mean_token_accuracy": 0.10782944262027741, "num_tokens": 2621129.0, "step": 1335 }, { "entropy": 7.40053129196167, "epoch": 1.3321730482347092, "grad_norm": 0.92578125, "learning_rate": 0.0004984438435579933, "loss": 7.0772, "mean_token_accuracy": 0.11545051857829094, "num_tokens": 2630306.0, "step": 1340 }, { "entropy": 7.299241733551026, "epoch": 1.3371456986573844, "grad_norm": 1.0078125, "learning_rate": 0.0004983976556745812, "loss": 7.1693, "mean_token_accuracy": 0.10763240307569504, "num_tokens": 2639874.0, "step": 1345 }, { "entropy": 7.334661054611206, "epoch": 1.3421183490800597, "grad_norm": 0.96875, "learning_rate": 0.000498350794781819, "loss": 7.1484, "mean_token_accuracy": 0.10904535055160522, "num_tokens": 2650340.0, "step": 1350 }, { "entropy": 7.202293968200683, "epoch": 1.347090999502735, "grad_norm": 1.09375, "learning_rate": 0.0004983032610208801, "loss": 6.9064, "mean_token_accuracy": 0.12317663207650184, "num_tokens": 2659541.0, "step": 1355 }, { "entropy": 7.332413005828857, "epoch": 1.3520636499254102, "grad_norm": 0.88671875, "learning_rate": 0.0004982550545349649, "loss": 7.0959, "mean_token_accuracy": 0.11287071779370308, "num_tokens": 2669151.0, "step": 1360 }, { "entropy": 7.274061250686645, "epoch": 1.3570363003480854, "grad_norm": 1.0390625, "learning_rate": 0.0004982061754693008, "loss": 6.9934, "mean_token_accuracy": 0.12214738503098488, "num_tokens": 2678867.0, "step": 1365 }, { "entropy": 7.2326271533966064, "epoch": 1.362008950770761, "grad_norm": 1.09375, "learning_rate": 0.0004981566239711412, "loss": 7.1043, "mean_token_accuracy": 0.1091894619166851, "num_tokens": 2687572.0, "step": 1370 }, { "entropy": 7.35388331413269, "epoch": 1.3669816011934361, "grad_norm": 0.9375, "learning_rate": 0.0004981064001897651, "loss": 7.0386, "mean_token_accuracy": 0.11529299393296241, "num_tokens": 2696922.0, "step": 1375 }, { "entropy": 7.23381290435791, "epoch": 1.3719542516161114, "grad_norm": 1.078125, "learning_rate": 0.0004980555042764772, "loss": 7.0833, "mean_token_accuracy": 0.1171937845647335, "num_tokens": 2707465.0, "step": 1380 }, { "entropy": 7.312092256546021, "epoch": 1.3769269020387866, "grad_norm": 0.9921875, "learning_rate": 0.0004980039363846069, "loss": 6.9779, "mean_token_accuracy": 0.12314596474170685, "num_tokens": 2718708.0, "step": 1385 }, { "entropy": 7.292709255218506, "epoch": 1.381899552461462, "grad_norm": 1.09375, "learning_rate": 0.000497951696669508, "loss": 7.0409, "mean_token_accuracy": 0.11527033746242524, "num_tokens": 2728862.0, "step": 1390 }, { "entropy": 7.310226726531982, "epoch": 1.3868722028841374, "grad_norm": 1.203125, "learning_rate": 0.0004978987852885579, "loss": 7.0155, "mean_token_accuracy": 0.11222517043352127, "num_tokens": 2738546.0, "step": 1395 }, { "entropy": 7.264519262313843, "epoch": 1.3918448533068126, "grad_norm": 0.9296875, "learning_rate": 0.0004978452024011582, "loss": 6.9755, "mean_token_accuracy": 0.11780327409505845, "num_tokens": 2747885.0, "step": 1400 }, { "entropy": 7.181573963165283, "epoch": 1.3968175037294879, "grad_norm": 1.0078125, "learning_rate": 0.000497790948168733, "loss": 7.001, "mean_token_accuracy": 0.1201067291200161, "num_tokens": 2756851.0, "step": 1405 }, { "entropy": 7.388041162490845, "epoch": 1.4017901541521631, "grad_norm": 0.984375, "learning_rate": 0.0004977360227547288, "loss": 7.0365, "mean_token_accuracy": 0.11356016471982003, "num_tokens": 2766309.0, "step": 1410 }, { "entropy": 7.225631046295166, "epoch": 1.4067628045748384, "grad_norm": 0.89453125, "learning_rate": 0.0004976804263246146, "loss": 7.0066, "mean_token_accuracy": 0.11348523944616318, "num_tokens": 2775679.0, "step": 1415 }, { "entropy": 7.272976732254028, "epoch": 1.4117354549975136, "grad_norm": 1.015625, "learning_rate": 0.0004976241590458803, "loss": 6.9845, "mean_token_accuracy": 0.116749869287014, "num_tokens": 2784610.0, "step": 1420 }, { "entropy": 7.236735868453979, "epoch": 1.4167081054201889, "grad_norm": 0.9296875, "learning_rate": 0.0004975672210880372, "loss": 7.0709, "mean_token_accuracy": 0.11795241460204124, "num_tokens": 2793969.0, "step": 1425 }, { "entropy": 7.232448244094849, "epoch": 1.4216807558428641, "grad_norm": 0.94921875, "learning_rate": 0.0004975096126226171, "loss": 6.9142, "mean_token_accuracy": 0.11798690259456635, "num_tokens": 2803096.0, "step": 1430 }, { "entropy": 7.143263149261474, "epoch": 1.4266534062655396, "grad_norm": 1.015625, "learning_rate": 0.0004974513338231715, "loss": 6.9824, "mean_token_accuracy": 0.1235393963754177, "num_tokens": 2812320.0, "step": 1435 }, { "entropy": 7.356040811538696, "epoch": 1.4316260566882149, "grad_norm": 1.1484375, "learning_rate": 0.0004973923848652715, "loss": 7.0575, "mean_token_accuracy": 0.11412188708782196, "num_tokens": 2821393.0, "step": 1440 }, { "entropy": 7.213506650924683, "epoch": 1.43659870711089, "grad_norm": 0.93359375, "learning_rate": 0.0004973327659265073, "loss": 7.018, "mean_token_accuracy": 0.11950061470270157, "num_tokens": 2831182.0, "step": 1445 }, { "entropy": 7.284598016738892, "epoch": 1.4415713575335654, "grad_norm": 0.91015625, "learning_rate": 0.0004972724771864874, "loss": 6.9772, "mean_token_accuracy": 0.11995619013905526, "num_tokens": 2840429.0, "step": 1450 }, { "entropy": 7.131456136703491, "epoch": 1.4465440079562406, "grad_norm": 0.93359375, "learning_rate": 0.0004972115188268378, "loss": 6.9833, "mean_token_accuracy": 0.1209810994565487, "num_tokens": 2849443.0, "step": 1455 }, { "entropy": 7.217880344390869, "epoch": 1.451516658378916, "grad_norm": 1.0390625, "learning_rate": 0.0004971498910312024, "loss": 6.9478, "mean_token_accuracy": 0.12011919394135476, "num_tokens": 2858908.0, "step": 1460 }, { "entropy": 7.324192714691162, "epoch": 1.4564893088015913, "grad_norm": 0.99609375, "learning_rate": 0.0004970875939852412, "loss": 7.0378, "mean_token_accuracy": 0.11806118115782738, "num_tokens": 2869615.0, "step": 1465 }, { "entropy": 7.232141828536987, "epoch": 1.4614619592242666, "grad_norm": 1.0, "learning_rate": 0.000497024627876631, "loss": 6.9765, "mean_token_accuracy": 0.11535097137093545, "num_tokens": 2879007.0, "step": 1470 }, { "entropy": 7.193434190750122, "epoch": 1.4664346096469418, "grad_norm": 1.0078125, "learning_rate": 0.0004969609928950639, "loss": 6.8729, "mean_token_accuracy": 0.12043445333838462, "num_tokens": 2887527.0, "step": 1475 }, { "entropy": 7.175161981582642, "epoch": 1.471407260069617, "grad_norm": 1.125, "learning_rate": 0.0004968966892322468, "loss": 6.9183, "mean_token_accuracy": 0.11960679963231087, "num_tokens": 2897137.0, "step": 1480 }, { "entropy": 7.205398511886597, "epoch": 1.4763799104922923, "grad_norm": 0.90234375, "learning_rate": 0.0004968317170819018, "loss": 7.0144, "mean_token_accuracy": 0.11745168343186378, "num_tokens": 2908346.0, "step": 1485 }, { "entropy": 7.256870937347412, "epoch": 1.4813525609149676, "grad_norm": 0.9375, "learning_rate": 0.0004967660766397642, "loss": 7.0309, "mean_token_accuracy": 0.11733275279402733, "num_tokens": 2918438.0, "step": 1490 }, { "entropy": 7.29434552192688, "epoch": 1.4863252113376428, "grad_norm": 0.99609375, "learning_rate": 0.0004966997681035829, "loss": 7.1441, "mean_token_accuracy": 0.11370202526450157, "num_tokens": 2928096.0, "step": 1495 }, { "entropy": 7.224684619903565, "epoch": 1.4912978617603183, "grad_norm": 1.0078125, "learning_rate": 0.0004966327916731195, "loss": 6.9681, "mean_token_accuracy": 0.11829992830753326, "num_tokens": 2938150.0, "step": 1500 }, { "entropy": 7.148546743392944, "epoch": 1.4962705121829936, "grad_norm": 1.2109375, "learning_rate": 0.0004965651475501476, "loss": 6.9413, "mean_token_accuracy": 0.12215470746159554, "num_tokens": 2949410.0, "step": 1505 }, { "entropy": 7.199129438400268, "epoch": 1.5012431626056688, "grad_norm": 1.1484375, "learning_rate": 0.0004964968359384524, "loss": 6.9022, "mean_token_accuracy": 0.12959329560399055, "num_tokens": 2958564.0, "step": 1510 }, { "entropy": 7.108926105499267, "epoch": 1.506215813028344, "grad_norm": 0.9765625, "learning_rate": 0.0004964278570438299, "loss": 6.9691, "mean_token_accuracy": 0.11823615282773972, "num_tokens": 2968750.0, "step": 1515 }, { "entropy": 7.239379596710205, "epoch": 1.5111884634510195, "grad_norm": 1.046875, "learning_rate": 0.0004963582110740865, "loss": 6.9206, "mean_token_accuracy": 0.12333661541342736, "num_tokens": 2978397.0, "step": 1520 }, { "entropy": 7.22562575340271, "epoch": 1.5161611138736948, "grad_norm": 0.9453125, "learning_rate": 0.0004962878982390381, "loss": 7.0386, "mean_token_accuracy": 0.11300068721175194, "num_tokens": 2987625.0, "step": 1525 }, { "entropy": 7.173707628250122, "epoch": 1.52113376429637, "grad_norm": 0.92578125, "learning_rate": 0.0004962169187505097, "loss": 6.9812, "mean_token_accuracy": 0.12145868018269539, "num_tokens": 2997266.0, "step": 1530 }, { "entropy": 7.266701555252075, "epoch": 1.5261064147190453, "grad_norm": 1.0859375, "learning_rate": 0.0004961452728223343, "loss": 7.0008, "mean_token_accuracy": 0.11692268773913383, "num_tokens": 3007474.0, "step": 1535 }, { "entropy": 7.255027914047242, "epoch": 1.5310790651417205, "grad_norm": 1.0859375, "learning_rate": 0.0004960729606703535, "loss": 6.9688, "mean_token_accuracy": 0.11842977330088615, "num_tokens": 3016270.0, "step": 1540 }, { "entropy": 7.141047811508178, "epoch": 1.5360517155643958, "grad_norm": 1.140625, "learning_rate": 0.0004959999825124147, "loss": 6.9651, "mean_token_accuracy": 0.1175768367946148, "num_tokens": 3027397.0, "step": 1545 }, { "entropy": 7.254582834243775, "epoch": 1.541024365987071, "grad_norm": 0.91796875, "learning_rate": 0.000495926338568373, "loss": 6.9896, "mean_token_accuracy": 0.11926171481609345, "num_tokens": 3037324.0, "step": 1550 }, { "entropy": 7.117153739929199, "epoch": 1.5459970164097463, "grad_norm": 0.9765625, "learning_rate": 0.0004958520290600884, "loss": 6.9562, "mean_token_accuracy": 0.11926570013165474, "num_tokens": 3048315.0, "step": 1555 }, { "entropy": 7.127697944641113, "epoch": 1.5509696668324215, "grad_norm": 0.95703125, "learning_rate": 0.0004957770542114262, "loss": 6.8622, "mean_token_accuracy": 0.12573121190071107, "num_tokens": 3057875.0, "step": 1560 }, { "entropy": 7.2254057884216305, "epoch": 1.555942317255097, "grad_norm": 1.3203125, "learning_rate": 0.0004957014142482563, "loss": 6.9557, "mean_token_accuracy": 0.12032727524638176, "num_tokens": 3068006.0, "step": 1565 }, { "entropy": 7.233620023727417, "epoch": 1.5609149676777723, "grad_norm": 1.140625, "learning_rate": 0.0004956251093984521, "loss": 6.9736, "mean_token_accuracy": 0.12568886056542397, "num_tokens": 3079450.0, "step": 1570 }, { "entropy": 7.086822748184204, "epoch": 1.5658876181004475, "grad_norm": 1.0234375, "learning_rate": 0.0004955481398918902, "loss": 6.769, "mean_token_accuracy": 0.1328391946852207, "num_tokens": 3088385.0, "step": 1575 }, { "entropy": 7.208517169952392, "epoch": 1.5708602685231228, "grad_norm": 0.94921875, "learning_rate": 0.0004954705059604495, "loss": 6.911, "mean_token_accuracy": 0.11698652803897858, "num_tokens": 3097854.0, "step": 1580 }, { "entropy": 7.269832944869995, "epoch": 1.5758329189457982, "grad_norm": 1.0, "learning_rate": 0.0004953922078380104, "loss": 7.0284, "mean_token_accuracy": 0.11298786252737045, "num_tokens": 3107877.0, "step": 1585 }, { "entropy": 7.0874732494354244, "epoch": 1.5808055693684735, "grad_norm": 0.88671875, "learning_rate": 0.0004953132457604544, "loss": 6.9755, "mean_token_accuracy": 0.11983944177627563, "num_tokens": 3117967.0, "step": 1590 }, { "entropy": 7.101063203811646, "epoch": 1.5857782197911487, "grad_norm": 0.95703125, "learning_rate": 0.0004952336199656632, "loss": 6.8747, "mean_token_accuracy": 0.12173356637358665, "num_tokens": 3129827.0, "step": 1595 }, { "entropy": 7.202299356460571, "epoch": 1.590750870213824, "grad_norm": 1.09375, "learning_rate": 0.0004951533306935181, "loss": 6.8696, "mean_token_accuracy": 0.12329825907945632, "num_tokens": 3138779.0, "step": 1600 }, { "entropy": 7.0769623756408695, "epoch": 1.5957235206364992, "grad_norm": 1.1015625, "learning_rate": 0.0004950723781858991, "loss": 6.905, "mean_token_accuracy": 0.1304717816412449, "num_tokens": 3148741.0, "step": 1605 }, { "entropy": 7.097968006134034, "epoch": 1.6006961710591745, "grad_norm": 0.94921875, "learning_rate": 0.0004949907626866844, "loss": 6.9459, "mean_token_accuracy": 0.12365822419524193, "num_tokens": 3158964.0, "step": 1610 }, { "entropy": 7.122892951965332, "epoch": 1.6056688214818498, "grad_norm": 0.94921875, "learning_rate": 0.0004949084844417493, "loss": 6.7629, "mean_token_accuracy": 0.1259840451180935, "num_tokens": 3168347.0, "step": 1615 }, { "entropy": 7.102373504638672, "epoch": 1.610641471904525, "grad_norm": 0.91015625, "learning_rate": 0.0004948255436989657, "loss": 6.9673, "mean_token_accuracy": 0.11866552829742431, "num_tokens": 3178276.0, "step": 1620 }, { "entropy": 7.098875951766968, "epoch": 1.6156141223272003, "grad_norm": 1.0390625, "learning_rate": 0.0004947419407082017, "loss": 6.9047, "mean_token_accuracy": 0.11665757969021798, "num_tokens": 3186975.0, "step": 1625 }, { "entropy": 7.10897798538208, "epoch": 1.6205867727498757, "grad_norm": 0.953125, "learning_rate": 0.0004946576757213202, "loss": 6.7687, "mean_token_accuracy": 0.13888816609978677, "num_tokens": 3197311.0, "step": 1630 }, { "entropy": 7.107201290130615, "epoch": 1.625559423172551, "grad_norm": 0.87890625, "learning_rate": 0.0004945727489921784, "loss": 6.8984, "mean_token_accuracy": 0.12509249597787858, "num_tokens": 3208534.0, "step": 1635 }, { "entropy": 7.129283905029297, "epoch": 1.6305320735952262, "grad_norm": 0.94921875, "learning_rate": 0.0004944871607766273, "loss": 6.8441, "mean_token_accuracy": 0.12468883246183396, "num_tokens": 3217440.0, "step": 1640 }, { "entropy": 7.190691423416138, "epoch": 1.6355047240179017, "grad_norm": 1.078125, "learning_rate": 0.0004944009113325104, "loss": 6.9785, "mean_token_accuracy": 0.1205446295440197, "num_tokens": 3225858.0, "step": 1645 }, { "entropy": 6.9474011898040775, "epoch": 1.640477374440577, "grad_norm": 0.9453125, "learning_rate": 0.0004943140009196635, "loss": 6.7535, "mean_token_accuracy": 0.1390519469976425, "num_tokens": 3235921.0, "step": 1650 }, { "entropy": 7.141832065582276, "epoch": 1.6454500248632522, "grad_norm": 0.94140625, "learning_rate": 0.0004942264297999135, "loss": 6.839, "mean_token_accuracy": 0.1311826951801777, "num_tokens": 3245123.0, "step": 1655 }, { "entropy": 7.140243911743164, "epoch": 1.6504226752859275, "grad_norm": 0.86328125, "learning_rate": 0.0004941381982370778, "loss": 6.8651, "mean_token_accuracy": 0.1281386412680149, "num_tokens": 3254246.0, "step": 1660 }, { "entropy": 7.141241884231567, "epoch": 1.6553953257086027, "grad_norm": 0.8515625, "learning_rate": 0.0004940493064969633, "loss": 6.8393, "mean_token_accuracy": 0.12432443425059318, "num_tokens": 3263602.0, "step": 1665 }, { "entropy": 7.095588350296021, "epoch": 1.660367976131278, "grad_norm": 0.91796875, "learning_rate": 0.000493959754847366, "loss": 7.025, "mean_token_accuracy": 0.1197537399828434, "num_tokens": 3274430.0, "step": 1670 }, { "entropy": 7.12945523262024, "epoch": 1.6653406265539532, "grad_norm": 1.0546875, "learning_rate": 0.0004938695435580698, "loss": 6.7486, "mean_token_accuracy": 0.12660369649529457, "num_tokens": 3283587.0, "step": 1675 }, { "entropy": 7.054620218276978, "epoch": 1.6703132769766285, "grad_norm": 1.34375, "learning_rate": 0.0004937786729008459, "loss": 6.9296, "mean_token_accuracy": 0.11086304783821106, "num_tokens": 3294165.0, "step": 1680 }, { "entropy": 7.139389705657959, "epoch": 1.6752859273993037, "grad_norm": 0.890625, "learning_rate": 0.0004936871431494517, "loss": 6.8881, "mean_token_accuracy": 0.1290462113916874, "num_tokens": 3302756.0, "step": 1685 }, { "entropy": 7.076407480239868, "epoch": 1.680258577821979, "grad_norm": 0.984375, "learning_rate": 0.0004935949545796307, "loss": 6.8204, "mean_token_accuracy": 0.12808602973818778, "num_tokens": 3313108.0, "step": 1690 }, { "entropy": 7.133471727371216, "epoch": 1.6852312282446544, "grad_norm": 0.9765625, "learning_rate": 0.0004935021074691106, "loss": 6.8982, "mean_token_accuracy": 0.1255290202796459, "num_tokens": 3323008.0, "step": 1695 }, { "entropy": 7.065728569030762, "epoch": 1.6902038786673297, "grad_norm": 1.0, "learning_rate": 0.0004934086020976032, "loss": 6.8167, "mean_token_accuracy": 0.12538206279277803, "num_tokens": 3332490.0, "step": 1700 }, { "entropy": 7.0050443649292, "epoch": 1.695176529090005, "grad_norm": 0.8984375, "learning_rate": 0.0004933144387468037, "loss": 6.8525, "mean_token_accuracy": 0.12207689508795738, "num_tokens": 3343069.0, "step": 1705 }, { "entropy": 7.050508975982666, "epoch": 1.7001491795126804, "grad_norm": 1.078125, "learning_rate": 0.0004932196177003891, "loss": 6.9425, "mean_token_accuracy": 0.12343786805868148, "num_tokens": 3351834.0, "step": 1710 }, { "entropy": 7.244025945663452, "epoch": 1.7051218299353557, "grad_norm": 1.015625, "learning_rate": 0.000493124139244018, "loss": 6.8436, "mean_token_accuracy": 0.12098148465156555, "num_tokens": 3360915.0, "step": 1715 }, { "entropy": 7.029709720611573, "epoch": 1.710094480358031, "grad_norm": 1.0546875, "learning_rate": 0.0004930280036653294, "loss": 6.8307, "mean_token_accuracy": 0.1256856717169285, "num_tokens": 3370184.0, "step": 1720 }, { "entropy": 7.094144105911255, "epoch": 1.7150671307807062, "grad_norm": 0.9765625, "learning_rate": 0.000492931211253942, "loss": 6.9156, "mean_token_accuracy": 0.11987519264221191, "num_tokens": 3379545.0, "step": 1725 }, { "entropy": 7.09250316619873, "epoch": 1.7200397812033814, "grad_norm": 0.87109375, "learning_rate": 0.0004928337623014535, "loss": 6.8638, "mean_token_accuracy": 0.13006417453289032, "num_tokens": 3390238.0, "step": 1730 }, { "entropy": 7.129364538192749, "epoch": 1.7250124316260567, "grad_norm": 1.0234375, "learning_rate": 0.000492735657101439, "loss": 6.8756, "mean_token_accuracy": 0.12177557870745659, "num_tokens": 3400437.0, "step": 1735 }, { "entropy": 7.023185300827026, "epoch": 1.729985082048732, "grad_norm": 0.93359375, "learning_rate": 0.0004926368959494513, "loss": 6.8732, "mean_token_accuracy": 0.12441569492220879, "num_tokens": 3410982.0, "step": 1740 }, { "entropy": 7.136072969436645, "epoch": 1.7349577324714072, "grad_norm": 0.8515625, "learning_rate": 0.0004925374791430186, "loss": 6.9436, "mean_token_accuracy": 0.12512961998581887, "num_tokens": 3420898.0, "step": 1745 }, { "entropy": 7.067667722702026, "epoch": 1.7399303828940824, "grad_norm": 1.0078125, "learning_rate": 0.0004924374069816448, "loss": 6.8065, "mean_token_accuracy": 0.1288384348154068, "num_tokens": 3429144.0, "step": 1750 }, { "entropy": 7.036431932449341, "epoch": 1.7449030333167577, "grad_norm": 0.93359375, "learning_rate": 0.0004923366797668081, "loss": 6.8471, "mean_token_accuracy": 0.1284836709499359, "num_tokens": 3439427.0, "step": 1755 }, { "entropy": 7.134074735641479, "epoch": 1.7498756837394331, "grad_norm": 1.0, "learning_rate": 0.0004922352978019597, "loss": 6.8329, "mean_token_accuracy": 0.1320321872830391, "num_tokens": 3448218.0, "step": 1760 }, { "entropy": 7.052996969223022, "epoch": 1.7548483341621084, "grad_norm": 0.94140625, "learning_rate": 0.0004921332613925239, "loss": 6.8842, "mean_token_accuracy": 0.12682262808084488, "num_tokens": 3457656.0, "step": 1765 }, { "entropy": 7.1880049228668215, "epoch": 1.7598209845847836, "grad_norm": 0.98828125, "learning_rate": 0.0004920305708458964, "loss": 6.8518, "mean_token_accuracy": 0.12582537904381752, "num_tokens": 3467414.0, "step": 1770 }, { "entropy": 6.969467973709106, "epoch": 1.7647936350074591, "grad_norm": 0.953125, "learning_rate": 0.0004919272264714431, "loss": 6.8022, "mean_token_accuracy": 0.12401163727045059, "num_tokens": 3477195.0, "step": 1775 }, { "entropy": 7.0714489936828615, "epoch": 1.7697662854301344, "grad_norm": 0.90625, "learning_rate": 0.0004918232285805004, "loss": 6.8776, "mean_token_accuracy": 0.12485396265983581, "num_tokens": 3487497.0, "step": 1780 }, { "entropy": 7.128742027282715, "epoch": 1.7747389358528096, "grad_norm": 1.0078125, "learning_rate": 0.0004917185774863727, "loss": 6.8509, "mean_token_accuracy": 0.12480712383985519, "num_tokens": 3497363.0, "step": 1785 }, { "entropy": 6.998370409011841, "epoch": 1.7797115862754849, "grad_norm": 0.91015625, "learning_rate": 0.0004916132735043329, "loss": 6.8633, "mean_token_accuracy": 0.12543805167078972, "num_tokens": 3506969.0, "step": 1790 }, { "entropy": 7.106174898147583, "epoch": 1.7846842366981601, "grad_norm": 0.9453125, "learning_rate": 0.0004915073169516204, "loss": 6.8123, "mean_token_accuracy": 0.12593027725815772, "num_tokens": 3516418.0, "step": 1795 }, { "entropy": 6.971872282028198, "epoch": 1.7896568871208354, "grad_norm": 1.40625, "learning_rate": 0.0004914007081474406, "loss": 6.7415, "mean_token_accuracy": 0.12818810865283012, "num_tokens": 3528023.0, "step": 1800 }, { "entropy": 7.079099035263061, "epoch": 1.7946295375435106, "grad_norm": 0.96484375, "learning_rate": 0.0004912934474129641, "loss": 6.8263, "mean_token_accuracy": 0.12469528913497925, "num_tokens": 3537946.0, "step": 1805 }, { "entropy": 7.011456918716431, "epoch": 1.7996021879661859, "grad_norm": 1.015625, "learning_rate": 0.0004911855350713251, "loss": 6.8237, "mean_token_accuracy": 0.12666564732789992, "num_tokens": 3547299.0, "step": 1810 }, { "entropy": 7.08799467086792, "epoch": 1.8045748383888611, "grad_norm": 1.125, "learning_rate": 0.0004910769714476214, "loss": 6.8937, "mean_token_accuracy": 0.12470808178186417, "num_tokens": 3556075.0, "step": 1815 }, { "entropy": 7.027981472015381, "epoch": 1.8095474888115366, "grad_norm": 0.9140625, "learning_rate": 0.0004909677568689122, "loss": 6.8554, "mean_token_accuracy": 0.12803274467587472, "num_tokens": 3566314.0, "step": 1820 }, { "entropy": 7.068058443069458, "epoch": 1.8145201392342118, "grad_norm": 1.0078125, "learning_rate": 0.0004908578916642183, "loss": 6.7717, "mean_token_accuracy": 0.13315743580460548, "num_tokens": 3575095.0, "step": 1825 }, { "entropy": 7.001987552642822, "epoch": 1.819492789656887, "grad_norm": 1.078125, "learning_rate": 0.0004907473761645205, "loss": 6.8469, "mean_token_accuracy": 0.12430937737226486, "num_tokens": 3584375.0, "step": 1830 }, { "entropy": 7.019008684158325, "epoch": 1.8244654400795626, "grad_norm": 0.9609375, "learning_rate": 0.0004906362107027583, "loss": 6.7288, "mean_token_accuracy": 0.13371379896998406, "num_tokens": 3594504.0, "step": 1835 }, { "entropy": 6.956771993637085, "epoch": 1.8294380905022378, "grad_norm": 0.9375, "learning_rate": 0.0004905243956138298, "loss": 6.8666, "mean_token_accuracy": 0.12128530889749527, "num_tokens": 3604050.0, "step": 1840 }, { "entropy": 7.099835300445557, "epoch": 1.834410740924913, "grad_norm": 0.9453125, "learning_rate": 0.0004904119312345896, "loss": 6.7725, "mean_token_accuracy": 0.13254232332110405, "num_tokens": 3613388.0, "step": 1845 }, { "entropy": 7.027640390396118, "epoch": 1.8393833913475883, "grad_norm": 0.83203125, "learning_rate": 0.0004902988179038492, "loss": 6.934, "mean_token_accuracy": 0.11459680572152138, "num_tokens": 3623758.0, "step": 1850 }, { "entropy": 7.102637529373169, "epoch": 1.8443560417702636, "grad_norm": 1.015625, "learning_rate": 0.000490185055962374, "loss": 6.8327, "mean_token_accuracy": 0.12521772757172583, "num_tokens": 3633040.0, "step": 1855 }, { "entropy": 6.968631267547607, "epoch": 1.8493286921929388, "grad_norm": 1.8359375, "learning_rate": 0.0004900706457528845, "loss": 6.7158, "mean_token_accuracy": 0.13046001717448236, "num_tokens": 3642980.0, "step": 1860 }, { "entropy": 7.0653759956359865, "epoch": 1.854301342615614, "grad_norm": 0.94921875, "learning_rate": 0.0004899555876200535, "loss": 6.8785, "mean_token_accuracy": 0.12559489011764527, "num_tokens": 3653817.0, "step": 1865 }, { "entropy": 7.078700351715088, "epoch": 1.8592739930382893, "grad_norm": 1.0234375, "learning_rate": 0.0004898398819105059, "loss": 6.8205, "mean_token_accuracy": 0.12691501155495644, "num_tokens": 3664460.0, "step": 1870 }, { "entropy": 7.048341941833496, "epoch": 1.8642466434609646, "grad_norm": 1.0078125, "learning_rate": 0.0004897235289728178, "loss": 6.8393, "mean_token_accuracy": 0.12090610191226006, "num_tokens": 3674221.0, "step": 1875 }, { "entropy": 6.959291744232178, "epoch": 1.8692192938836398, "grad_norm": 1.015625, "learning_rate": 0.0004896065291575145, "loss": 6.7412, "mean_token_accuracy": 0.13510354980826378, "num_tokens": 3683130.0, "step": 1880 }, { "entropy": 7.107599306106567, "epoch": 1.8741919443063153, "grad_norm": 0.8515625, "learning_rate": 0.0004894888828170708, "loss": 6.7053, "mean_token_accuracy": 0.13113834261894225, "num_tokens": 3694544.0, "step": 1885 }, { "entropy": 6.910497951507568, "epoch": 1.8791645947289906, "grad_norm": 0.87109375, "learning_rate": 0.0004893705903059087, "loss": 6.6849, "mean_token_accuracy": 0.12996711134910582, "num_tokens": 3704857.0, "step": 1890 }, { "entropy": 6.996693325042725, "epoch": 1.8841372451516658, "grad_norm": 0.9921875, "learning_rate": 0.0004892516519803971, "loss": 6.7635, "mean_token_accuracy": 0.13128842264413834, "num_tokens": 3714623.0, "step": 1895 }, { "entropy": 7.008214235305786, "epoch": 1.8891098955743413, "grad_norm": 1.1484375, "learning_rate": 0.0004891320681988504, "loss": 6.7623, "mean_token_accuracy": 0.13260336965322495, "num_tokens": 3723349.0, "step": 1900 }, { "entropy": 6.997120523452759, "epoch": 1.8940825459970165, "grad_norm": 0.984375, "learning_rate": 0.0004890118393215277, "loss": 6.7289, "mean_token_accuracy": 0.13324674889445304, "num_tokens": 3732990.0, "step": 1905 }, { "entropy": 6.992683362960816, "epoch": 1.8990551964196918, "grad_norm": 1.015625, "learning_rate": 0.0004888909657106311, "loss": 6.7194, "mean_token_accuracy": 0.13112411946058272, "num_tokens": 3742343.0, "step": 1910 }, { "entropy": 6.902509069442749, "epoch": 1.904027846842367, "grad_norm": 0.91796875, "learning_rate": 0.0004887694477303055, "loss": 6.7515, "mean_token_accuracy": 0.12507615908980368, "num_tokens": 3752128.0, "step": 1915 }, { "entropy": 6.963840103149414, "epoch": 1.9090004972650423, "grad_norm": 1.0, "learning_rate": 0.0004886472857466368, "loss": 6.6778, "mean_token_accuracy": 0.1289484165608883, "num_tokens": 3760431.0, "step": 1920 }, { "entropy": 6.976652908325195, "epoch": 1.9139731476877175, "grad_norm": 1.03125, "learning_rate": 0.0004885244801276509, "loss": 6.7712, "mean_token_accuracy": 0.12675235122442247, "num_tokens": 3769623.0, "step": 1925 }, { "entropy": 6.85596399307251, "epoch": 1.9189457981103928, "grad_norm": 0.9375, "learning_rate": 0.0004884010312433131, "loss": 6.7387, "mean_token_accuracy": 0.12580233588814735, "num_tokens": 3779383.0, "step": 1930 }, { "entropy": 7.044457960128784, "epoch": 1.923918448533068, "grad_norm": 0.9296875, "learning_rate": 0.00048827693946552615, "loss": 6.8649, "mean_token_accuracy": 0.12248891815543175, "num_tokens": 3788847.0, "step": 1935 }, { "entropy": 6.909450054168701, "epoch": 1.9288910989557433, "grad_norm": 1.0234375, "learning_rate": 0.00048815220516813004, "loss": 6.7146, "mean_token_accuracy": 0.13217381164431571, "num_tokens": 3798711.0, "step": 1940 }, { "entropy": 6.975063467025757, "epoch": 1.9338637493784185, "grad_norm": 0.9375, "learning_rate": 0.0004880268287269, "loss": 6.6871, "mean_token_accuracy": 0.13259740248322488, "num_tokens": 3808837.0, "step": 1945 }, { "entropy": 6.989281034469604, "epoch": 1.938836399801094, "grad_norm": 0.90234375, "learning_rate": 0.00048790081051954605, "loss": 6.6711, "mean_token_accuracy": 0.1324021689593792, "num_tokens": 3818261.0, "step": 1950 }, { "entropy": 7.002820634841919, "epoch": 1.9438090502237693, "grad_norm": 0.99609375, "learning_rate": 0.0004877741509257116, "loss": 6.7457, "mean_token_accuracy": 0.1204921394586563, "num_tokens": 3828146.0, "step": 1955 }, { "entropy": 7.053721761703491, "epoch": 1.9487817006464445, "grad_norm": 0.921875, "learning_rate": 0.0004876468503269721, "loss": 6.9486, "mean_token_accuracy": 0.1165396012365818, "num_tokens": 3838658.0, "step": 1960 }, { "entropy": 7.047277545928955, "epoch": 1.95375435106912, "grad_norm": 0.94140625, "learning_rate": 0.00048751890910683434, "loss": 6.7216, "mean_token_accuracy": 0.12939262613654137, "num_tokens": 3849097.0, "step": 1965 }, { "entropy": 7.016208505630493, "epoch": 1.9587270014917952, "grad_norm": 0.93359375, "learning_rate": 0.00048739032765073487, "loss": 6.8353, "mean_token_accuracy": 0.12277894169092178, "num_tokens": 3858645.0, "step": 1970 }, { "entropy": 7.007478046417236, "epoch": 1.9636996519144705, "grad_norm": 0.9453125, "learning_rate": 0.00048726110634603913, "loss": 6.7223, "mean_token_accuracy": 0.1341798223555088, "num_tokens": 3869232.0, "step": 1975 }, { "entropy": 6.993938398361206, "epoch": 1.9686723023371457, "grad_norm": 1.125, "learning_rate": 0.00048713124558204013, "loss": 6.8155, "mean_token_accuracy": 0.12780363112688065, "num_tokens": 3879453.0, "step": 1980 }, { "entropy": 6.984024095535278, "epoch": 1.973644952759821, "grad_norm": 0.98828125, "learning_rate": 0.0004870007457499573, "loss": 6.7455, "mean_token_accuracy": 0.1269009605050087, "num_tokens": 3888257.0, "step": 1985 }, { "entropy": 7.0300885200500485, "epoch": 1.9786176031824962, "grad_norm": 0.859375, "learning_rate": 0.00048686960724293537, "loss": 6.7464, "mean_token_accuracy": 0.13770631626248359, "num_tokens": 3897980.0, "step": 1990 }, { "entropy": 6.86609296798706, "epoch": 1.9835902536051715, "grad_norm": 1.4140625, "learning_rate": 0.0004867378304560432, "loss": 6.5755, "mean_token_accuracy": 0.13791960403323172, "num_tokens": 3907479.0, "step": 1995 }, { "entropy": 6.98457088470459, "epoch": 1.9885629040278467, "grad_norm": 0.90234375, "learning_rate": 0.0004866054157862723, "loss": 6.8118, "mean_token_accuracy": 0.1273365207016468, "num_tokens": 3917249.0, "step": 2000 }, { "epoch": 1.9885629040278467, "eval_entropy": 6.826489323295206, "eval_loss": 6.902448654174805, "eval_mean_token_accuracy": 0.12161170143616913, "eval_num_tokens": 3917249.0, "eval_runtime": 1.9145, "eval_samples_per_second": 1809.844, "eval_steps_per_second": 226.688, "step": 2000 } ], "logging_steps": 5, "max_steps": 10050, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 1000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 956740866508800.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }