{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.06609166914510425, "eval_steps": 500, "global_step": 1000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.691955471038819, "epoch": 0.0003304583457255213, "grad_norm": 12.8125, "learning_rate": 2e-06, "loss": 10.8273, "mean_token_accuracy": 0.0, "num_tokens": 10288.0, "step": 5 }, { "entropy": 10.691919994354247, "epoch": 0.0006609166914510426, "grad_norm": 10.875, "learning_rate": 4.5e-06, "loss": 10.7719, "mean_token_accuracy": 0.0, "num_tokens": 20647.0, "step": 10 }, { "entropy": 10.6910964012146, "epoch": 0.000991375037176564, "grad_norm": 8.6875, "learning_rate": 7e-06, "loss": 10.5372, "mean_token_accuracy": 0.016732628224417567, "num_tokens": 30934.0, "step": 15 }, { "entropy": 10.682924270629883, "epoch": 0.0013218333829020852, "grad_norm": 5.9375, "learning_rate": 9.5e-06, "loss": 10.2268, "mean_token_accuracy": 0.039138264022767544, "num_tokens": 41985.0, "step": 20 }, { "entropy": 10.630903339385986, "epoch": 0.0016522917286276066, "grad_norm": 3.859375, "learning_rate": 1.2e-05, "loss": 9.9501, "mean_token_accuracy": 0.04244728535413742, "num_tokens": 52249.0, "step": 25 }, { "entropy": 10.59464464187622, "epoch": 0.001982750074353128, "grad_norm": 3.171875, "learning_rate": 1.4500000000000002e-05, "loss": 9.8224, "mean_token_accuracy": 0.039565733075141905, "num_tokens": 63022.0, "step": 30 }, { "entropy": 10.583414649963379, "epoch": 0.002313208420078649, "grad_norm": 2.8125, "learning_rate": 1.7000000000000003e-05, "loss": 9.7332, "mean_token_accuracy": 0.042595500499010085, "num_tokens": 74862.0, "step": 35 }, { "entropy": 10.582724380493165, "epoch": 0.0026436667658041703, "grad_norm": 2.484375, "learning_rate": 1.95e-05, "loss": 9.7531, "mean_token_accuracy": 0.03622140642255545, "num_tokens": 86588.0, "step": 40 }, { "entropy": 10.594015216827392, "epoch": 0.0029741251115296915, "grad_norm": 2.5625, "learning_rate": 2.2e-05, "loss": 9.6536, "mean_token_accuracy": 0.037497786805033684, "num_tokens": 96248.0, "step": 45 }, { "entropy": 10.578313446044922, "epoch": 0.003304583457255213, "grad_norm": 2.21875, "learning_rate": 2.4500000000000003e-05, "loss": 9.6594, "mean_token_accuracy": 0.03918336480855942, "num_tokens": 107167.0, "step": 50 }, { "entropy": 10.555775451660157, "epoch": 0.0036350418029807343, "grad_norm": 2.265625, "learning_rate": 2.7e-05, "loss": 9.5383, "mean_token_accuracy": 0.043136011064052585, "num_tokens": 117207.0, "step": 55 }, { "entropy": 10.549382877349853, "epoch": 0.003965500148706256, "grad_norm": 2.109375, "learning_rate": 2.95e-05, "loss": 9.5206, "mean_token_accuracy": 0.04122119285166263, "num_tokens": 127335.0, "step": 60 }, { "entropy": 10.5144211769104, "epoch": 0.004295958494431777, "grad_norm": 2.28125, "learning_rate": 3.2e-05, "loss": 9.4157, "mean_token_accuracy": 0.051365657895803454, "num_tokens": 138329.0, "step": 65 }, { "entropy": 10.402010536193847, "epoch": 0.004626416840157298, "grad_norm": 2.234375, "learning_rate": 3.4500000000000005e-05, "loss": 9.3531, "mean_token_accuracy": 0.04862799309194088, "num_tokens": 149993.0, "step": 70 }, { "entropy": 10.443185424804687, "epoch": 0.00495687518588282, "grad_norm": 2.0625, "learning_rate": 3.7e-05, "loss": 9.2381, "mean_token_accuracy": 0.05048903152346611, "num_tokens": 160872.0, "step": 75 }, { "entropy": 10.446312522888183, "epoch": 0.005287333531608341, "grad_norm": 1.9765625, "learning_rate": 3.95e-05, "loss": 9.2065, "mean_token_accuracy": 0.04706168882548809, "num_tokens": 172141.0, "step": 80 }, { "entropy": 10.442552852630616, "epoch": 0.005617791877333862, "grad_norm": 2.046875, "learning_rate": 4.2000000000000004e-05, "loss": 9.036, "mean_token_accuracy": 0.05399964451789856, "num_tokens": 183762.0, "step": 85 }, { "entropy": 10.36781177520752, "epoch": 0.005948250223059383, "grad_norm": 1.8984375, "learning_rate": 4.45e-05, "loss": 8.9932, "mean_token_accuracy": 0.05456707440316677, "num_tokens": 196109.0, "step": 90 }, { "entropy": 10.29437780380249, "epoch": 0.006278708568784905, "grad_norm": 2.453125, "learning_rate": 4.7000000000000004e-05, "loss": 8.7929, "mean_token_accuracy": 0.061743784323334695, "num_tokens": 205671.0, "step": 95 }, { "entropy": 10.216643905639648, "epoch": 0.006609166914510426, "grad_norm": 1.96875, "learning_rate": 4.9500000000000004e-05, "loss": 8.7749, "mean_token_accuracy": 0.056532309576869014, "num_tokens": 217256.0, "step": 100 }, { "entropy": 10.16990032196045, "epoch": 0.006939625260235947, "grad_norm": 2.0625, "learning_rate": 5.2e-05, "loss": 8.6032, "mean_token_accuracy": 0.06618640683591366, "num_tokens": 228066.0, "step": 105 }, { "entropy": 10.083656120300294, "epoch": 0.007270083605961469, "grad_norm": 1.9609375, "learning_rate": 5.45e-05, "loss": 8.5398, "mean_token_accuracy": 0.06366933546960354, "num_tokens": 238643.0, "step": 110 }, { "entropy": 10.01426429748535, "epoch": 0.00760054195168699, "grad_norm": 1.9453125, "learning_rate": 5.7e-05, "loss": 8.4763, "mean_token_accuracy": 0.0619691651314497, "num_tokens": 249812.0, "step": 115 }, { "entropy": 9.912741661071777, "epoch": 0.007931000297412512, "grad_norm": 1.4921875, "learning_rate": 5.9499999999999996e-05, "loss": 8.3405, "mean_token_accuracy": 0.06653297729790211, "num_tokens": 261942.0, "step": 120 }, { "entropy": 9.791018199920654, "epoch": 0.008261458643138032, "grad_norm": 2.109375, "learning_rate": 6.2e-05, "loss": 8.179, "mean_token_accuracy": 0.07168376296758652, "num_tokens": 272537.0, "step": 125 }, { "entropy": 9.592787837982177, "epoch": 0.008591916988863553, "grad_norm": 1.5078125, "learning_rate": 6.450000000000001e-05, "loss": 8.0936, "mean_token_accuracy": 0.06862132512032985, "num_tokens": 283610.0, "step": 130 }, { "entropy": 9.465274620056153, "epoch": 0.008922375334589075, "grad_norm": 1.2734375, "learning_rate": 6.7e-05, "loss": 8.0333, "mean_token_accuracy": 0.06386486329138279, "num_tokens": 294257.0, "step": 135 }, { "entropy": 9.326618099212647, "epoch": 0.009252833680314597, "grad_norm": 1.4453125, "learning_rate": 6.950000000000001e-05, "loss": 7.9842, "mean_token_accuracy": 0.060935232788324356, "num_tokens": 304405.0, "step": 140 }, { "entropy": 9.061574840545655, "epoch": 0.009583292026040118, "grad_norm": 1.1875, "learning_rate": 7.2e-05, "loss": 7.7675, "mean_token_accuracy": 0.07102037817239762, "num_tokens": 314413.0, "step": 145 }, { "entropy": 8.9353346824646, "epoch": 0.00991375037176564, "grad_norm": 1.3125, "learning_rate": 7.45e-05, "loss": 7.7801, "mean_token_accuracy": 0.06595919616520404, "num_tokens": 325010.0, "step": 150 }, { "entropy": 8.705840969085694, "epoch": 0.01024420871749116, "grad_norm": 1.3359375, "learning_rate": 7.7e-05, "loss": 7.7226, "mean_token_accuracy": 0.06655254885554314, "num_tokens": 336421.0, "step": 155 }, { "entropy": 8.54863624572754, "epoch": 0.010574667063216681, "grad_norm": 1.2890625, "learning_rate": 7.950000000000001e-05, "loss": 7.5898, "mean_token_accuracy": 0.07376853227615357, "num_tokens": 346930.0, "step": 160 }, { "entropy": 8.424325942993164, "epoch": 0.010905125408942203, "grad_norm": 1.3359375, "learning_rate": 8.2e-05, "loss": 7.6097, "mean_token_accuracy": 0.07119092084467411, "num_tokens": 357874.0, "step": 165 }, { "entropy": 8.46063985824585, "epoch": 0.011235583754667725, "grad_norm": 1.203125, "learning_rate": 8.450000000000001e-05, "loss": 7.6735, "mean_token_accuracy": 0.06998510733246803, "num_tokens": 370138.0, "step": 170 }, { "entropy": 8.31341323852539, "epoch": 0.011566042100393246, "grad_norm": 1.2109375, "learning_rate": 8.7e-05, "loss": 7.6173, "mean_token_accuracy": 0.06727928221225739, "num_tokens": 379999.0, "step": 175 }, { "entropy": 8.19371862411499, "epoch": 0.011896500446118766, "grad_norm": 0.96484375, "learning_rate": 8.95e-05, "loss": 7.4712, "mean_token_accuracy": 0.07500850819051266, "num_tokens": 392754.0, "step": 180 }, { "entropy": 8.132864665985107, "epoch": 0.012226958791844288, "grad_norm": 1.0625, "learning_rate": 9.2e-05, "loss": 7.5206, "mean_token_accuracy": 0.06753306314349175, "num_tokens": 403771.0, "step": 185 }, { "entropy": 8.108299064636231, "epoch": 0.01255741713756981, "grad_norm": 2.125, "learning_rate": 9.45e-05, "loss": 7.5477, "mean_token_accuracy": 0.07148384340107442, "num_tokens": 415381.0, "step": 190 }, { "entropy": 8.155412006378175, "epoch": 0.01288787548329533, "grad_norm": 1.3125, "learning_rate": 9.7e-05, "loss": 7.4227, "mean_token_accuracy": 0.07254996970295906, "num_tokens": 425919.0, "step": 195 }, { "entropy": 8.072521829605103, "epoch": 0.013218333829020852, "grad_norm": 1.296875, "learning_rate": 9.95e-05, "loss": 7.3718, "mean_token_accuracy": 0.06771104149520397, "num_tokens": 437753.0, "step": 200 }, { "entropy": 7.959475183486939, "epoch": 0.013548792174746372, "grad_norm": 1.4453125, "learning_rate": 0.000102, "loss": 7.3961, "mean_token_accuracy": 0.07540397495031356, "num_tokens": 449079.0, "step": 205 }, { "entropy": 7.956682586669922, "epoch": 0.013879250520471894, "grad_norm": 1.3671875, "learning_rate": 0.00010449999999999999, "loss": 7.3773, "mean_token_accuracy": 0.07537127286195755, "num_tokens": 459250.0, "step": 210 }, { "entropy": 7.86835880279541, "epoch": 0.014209708866197416, "grad_norm": 1.2265625, "learning_rate": 0.000107, "loss": 7.3512, "mean_token_accuracy": 0.07468458339571953, "num_tokens": 470898.0, "step": 215 }, { "entropy": 7.843323755264282, "epoch": 0.014540167211922937, "grad_norm": 1.1171875, "learning_rate": 0.0001095, "loss": 7.3402, "mean_token_accuracy": 0.07922964245080948, "num_tokens": 481116.0, "step": 220 }, { "entropy": 7.847117757797241, "epoch": 0.014870625557648459, "grad_norm": 1.0859375, "learning_rate": 0.000112, "loss": 7.349, "mean_token_accuracy": 0.07711787447333336, "num_tokens": 492639.0, "step": 225 }, { "entropy": 7.853758859634399, "epoch": 0.01520108390337398, "grad_norm": 1.4140625, "learning_rate": 0.0001145, "loss": 7.3957, "mean_token_accuracy": 0.07615091502666474, "num_tokens": 504838.0, "step": 230 }, { "entropy": 7.945042896270752, "epoch": 0.0155315422490995, "grad_norm": 1.1796875, "learning_rate": 0.00011700000000000001, "loss": 7.297, "mean_token_accuracy": 0.07279803417623043, "num_tokens": 515982.0, "step": 235 }, { "entropy": 7.722148132324219, "epoch": 0.015862000594825024, "grad_norm": 1.1328125, "learning_rate": 0.00011949999999999999, "loss": 7.2946, "mean_token_accuracy": 0.07706804946064949, "num_tokens": 526830.0, "step": 240 }, { "entropy": 7.7506262302398685, "epoch": 0.016192458940550544, "grad_norm": 1.1171875, "learning_rate": 0.000122, "loss": 7.342, "mean_token_accuracy": 0.07662090063095092, "num_tokens": 538111.0, "step": 245 }, { "entropy": 7.804240894317627, "epoch": 0.016522917286276063, "grad_norm": 1.2421875, "learning_rate": 0.0001245, "loss": 7.2915, "mean_token_accuracy": 0.07277994081377984, "num_tokens": 548286.0, "step": 250 }, { "entropy": 7.752009725570678, "epoch": 0.016853375632001587, "grad_norm": 1.21875, "learning_rate": 0.000127, "loss": 7.2752, "mean_token_accuracy": 0.07613983601331711, "num_tokens": 558638.0, "step": 255 }, { "entropy": 7.705926036834716, "epoch": 0.017183833977727107, "grad_norm": 1.0703125, "learning_rate": 0.0001295, "loss": 7.2402, "mean_token_accuracy": 0.07607613280415534, "num_tokens": 568909.0, "step": 260 }, { "entropy": 7.722606134414673, "epoch": 0.01751429232345263, "grad_norm": 1.484375, "learning_rate": 0.000132, "loss": 7.2178, "mean_token_accuracy": 0.07890873812139035, "num_tokens": 580392.0, "step": 265 }, { "entropy": 7.688320446014404, "epoch": 0.01784475066917815, "grad_norm": 1.1640625, "learning_rate": 0.00013450000000000002, "loss": 7.2767, "mean_token_accuracy": 0.07444539405405522, "num_tokens": 590160.0, "step": 270 }, { "entropy": 7.632183170318603, "epoch": 0.01817520901490367, "grad_norm": 1.1171875, "learning_rate": 0.00013700000000000002, "loss": 7.1822, "mean_token_accuracy": 0.07618632428348064, "num_tokens": 601054.0, "step": 275 }, { "entropy": 7.7831042289733885, "epoch": 0.018505667360629193, "grad_norm": 1.3515625, "learning_rate": 0.0001395, "loss": 7.3189, "mean_token_accuracy": 0.07360220067203045, "num_tokens": 611908.0, "step": 280 }, { "entropy": 7.640690326690674, "epoch": 0.018836125706354713, "grad_norm": 1.1953125, "learning_rate": 0.00014199999999999998, "loss": 7.258, "mean_token_accuracy": 0.07853379994630813, "num_tokens": 622259.0, "step": 285 }, { "entropy": 7.618532133102417, "epoch": 0.019166584052080236, "grad_norm": 1.28125, "learning_rate": 0.0001445, "loss": 7.1215, "mean_token_accuracy": 0.08114137947559356, "num_tokens": 632728.0, "step": 290 }, { "entropy": 7.7060990810394285, "epoch": 0.019497042397805756, "grad_norm": 1.4921875, "learning_rate": 0.000147, "loss": 7.309, "mean_token_accuracy": 0.07869038358330727, "num_tokens": 644600.0, "step": 295 }, { "entropy": 7.549208354949951, "epoch": 0.01982750074353128, "grad_norm": 1.4375, "learning_rate": 0.0001495, "loss": 7.1684, "mean_token_accuracy": 0.08070796430110931, "num_tokens": 654004.0, "step": 300 }, { "entropy": 7.680343866348267, "epoch": 0.0201579590892568, "grad_norm": 1.03125, "learning_rate": 0.000152, "loss": 7.1505, "mean_token_accuracy": 0.08140776604413986, "num_tokens": 665275.0, "step": 305 }, { "entropy": 7.586634254455566, "epoch": 0.02048841743498232, "grad_norm": 1.1875, "learning_rate": 0.00015450000000000001, "loss": 7.2169, "mean_token_accuracy": 0.07984307780861855, "num_tokens": 677397.0, "step": 310 }, { "entropy": 7.557528400421143, "epoch": 0.020818875780707843, "grad_norm": 1.1171875, "learning_rate": 0.000157, "loss": 7.0796, "mean_token_accuracy": 0.08578637950122356, "num_tokens": 687975.0, "step": 315 }, { "entropy": 7.519621467590332, "epoch": 0.021149334126433363, "grad_norm": 1.234375, "learning_rate": 0.0001595, "loss": 7.0386, "mean_token_accuracy": 0.09029009193181992, "num_tokens": 699102.0, "step": 320 }, { "entropy": 7.4558220386505125, "epoch": 0.021479792472158886, "grad_norm": 1.1171875, "learning_rate": 0.000162, "loss": 7.1014, "mean_token_accuracy": 0.07989090159535409, "num_tokens": 712007.0, "step": 325 }, { "entropy": 7.526741886138916, "epoch": 0.021810250817884406, "grad_norm": 1.2578125, "learning_rate": 0.00016450000000000001, "loss": 7.0863, "mean_token_accuracy": 0.08748645186424256, "num_tokens": 723757.0, "step": 330 }, { "entropy": 7.52968955039978, "epoch": 0.022140709163609926, "grad_norm": 1.3359375, "learning_rate": 0.00016700000000000002, "loss": 7.0994, "mean_token_accuracy": 0.08689600750803947, "num_tokens": 734353.0, "step": 335 }, { "entropy": 7.439078617095947, "epoch": 0.02247116750933545, "grad_norm": 1.1875, "learning_rate": 0.00016950000000000003, "loss": 6.9892, "mean_token_accuracy": 0.0902569204568863, "num_tokens": 744673.0, "step": 340 }, { "entropy": 7.432306814193725, "epoch": 0.02280162585506097, "grad_norm": 1.390625, "learning_rate": 0.00017199999999999998, "loss": 7.0258, "mean_token_accuracy": 0.0794426791369915, "num_tokens": 755181.0, "step": 345 }, { "entropy": 7.557726144790649, "epoch": 0.023132084200786492, "grad_norm": 1.1328125, "learning_rate": 0.00017449999999999999, "loss": 7.0575, "mean_token_accuracy": 0.08544816374778748, "num_tokens": 765558.0, "step": 350 }, { "entropy": 7.414818954467774, "epoch": 0.023462542546512012, "grad_norm": 1.1328125, "learning_rate": 0.000177, "loss": 7.0836, "mean_token_accuracy": 0.07729014120995999, "num_tokens": 778224.0, "step": 355 }, { "entropy": 7.490838050842285, "epoch": 0.023793000892237532, "grad_norm": 1.21875, "learning_rate": 0.0001795, "loss": 6.991, "mean_token_accuracy": 0.08522340208292008, "num_tokens": 789586.0, "step": 360 }, { "entropy": 7.417488718032837, "epoch": 0.024123459237963055, "grad_norm": 1.015625, "learning_rate": 0.000182, "loss": 7.0535, "mean_token_accuracy": 0.08176884576678276, "num_tokens": 801595.0, "step": 365 }, { "entropy": 7.4084100246429445, "epoch": 0.024453917583688575, "grad_norm": 1.015625, "learning_rate": 0.0001845, "loss": 7.0797, "mean_token_accuracy": 0.08523592539131641, "num_tokens": 812850.0, "step": 370 }, { "entropy": 7.462594747543335, "epoch": 0.0247843759294141, "grad_norm": 1.140625, "learning_rate": 0.000187, "loss": 7.078, "mean_token_accuracy": 0.08119027838110923, "num_tokens": 823125.0, "step": 375 }, { "entropy": 7.436292457580566, "epoch": 0.02511483427513962, "grad_norm": 1.1875, "learning_rate": 0.0001895, "loss": 6.9898, "mean_token_accuracy": 0.08521195650100707, "num_tokens": 834838.0, "step": 380 }, { "entropy": 7.3805746078491214, "epoch": 0.02544529262086514, "grad_norm": 1.359375, "learning_rate": 0.000192, "loss": 7.0507, "mean_token_accuracy": 0.0866511344909668, "num_tokens": 845976.0, "step": 385 }, { "entropy": 7.368652486801148, "epoch": 0.02577575096659066, "grad_norm": 1.15625, "learning_rate": 0.0001945, "loss": 7.0367, "mean_token_accuracy": 0.08296765461564064, "num_tokens": 857193.0, "step": 390 }, { "entropy": 7.454722309112549, "epoch": 0.02610620931231618, "grad_norm": 1.0546875, "learning_rate": 0.00019700000000000002, "loss": 7.0047, "mean_token_accuracy": 0.08462346903979778, "num_tokens": 868471.0, "step": 395 }, { "entropy": 7.42730746269226, "epoch": 0.026436667658041705, "grad_norm": 1.2578125, "learning_rate": 0.00019950000000000002, "loss": 6.9478, "mean_token_accuracy": 0.08773355185985565, "num_tokens": 879339.0, "step": 400 }, { "entropy": 7.206215667724609, "epoch": 0.026767126003767225, "grad_norm": 1.078125, "learning_rate": 0.000202, "loss": 6.8858, "mean_token_accuracy": 0.08911687806248665, "num_tokens": 890081.0, "step": 405 }, { "entropy": 7.307197189331054, "epoch": 0.027097584349492745, "grad_norm": 1.2421875, "learning_rate": 0.00020449999999999998, "loss": 6.909, "mean_token_accuracy": 0.08829740136861801, "num_tokens": 899967.0, "step": 410 }, { "entropy": 7.394805383682251, "epoch": 0.027428042695218268, "grad_norm": 1.171875, "learning_rate": 0.000207, "loss": 6.9474, "mean_token_accuracy": 0.08440508171916009, "num_tokens": 910697.0, "step": 415 }, { "entropy": 7.307165718078613, "epoch": 0.027758501040943788, "grad_norm": 1.21875, "learning_rate": 0.0002095, "loss": 7.0184, "mean_token_accuracy": 0.08860758394002914, "num_tokens": 920879.0, "step": 420 }, { "entropy": 7.332070398330688, "epoch": 0.02808895938666931, "grad_norm": 1.1796875, "learning_rate": 0.000212, "loss": 6.93, "mean_token_accuracy": 0.0954623855650425, "num_tokens": 931566.0, "step": 425 }, { "entropy": 7.345228767395019, "epoch": 0.02841941773239483, "grad_norm": 1.0078125, "learning_rate": 0.0002145, "loss": 6.868, "mean_token_accuracy": 0.08827793225646019, "num_tokens": 941736.0, "step": 430 }, { "entropy": 7.245734167098999, "epoch": 0.028749876078120355, "grad_norm": 1.234375, "learning_rate": 0.00021700000000000002, "loss": 6.9063, "mean_token_accuracy": 0.08495340272784233, "num_tokens": 951652.0, "step": 435 }, { "entropy": 7.267821741104126, "epoch": 0.029080334423845874, "grad_norm": 1.109375, "learning_rate": 0.0002195, "loss": 6.8298, "mean_token_accuracy": 0.08889664858579635, "num_tokens": 963242.0, "step": 440 }, { "entropy": 7.126494026184082, "epoch": 0.029410792769571394, "grad_norm": 1.1875, "learning_rate": 0.000222, "loss": 6.8716, "mean_token_accuracy": 0.08861989453434944, "num_tokens": 974078.0, "step": 445 }, { "entropy": 7.203296804428101, "epoch": 0.029741251115296918, "grad_norm": 0.94140625, "learning_rate": 0.0002245, "loss": 6.8335, "mean_token_accuracy": 0.0920184887945652, "num_tokens": 986324.0, "step": 450 }, { "entropy": 7.216691255569458, "epoch": 0.030071709461022438, "grad_norm": 1.0546875, "learning_rate": 0.00022700000000000002, "loss": 6.8409, "mean_token_accuracy": 0.09037284776568413, "num_tokens": 997625.0, "step": 455 }, { "entropy": 7.202143144607544, "epoch": 0.03040216780674796, "grad_norm": 1.1171875, "learning_rate": 0.00022950000000000002, "loss": 6.8316, "mean_token_accuracy": 0.09061756655573845, "num_tokens": 1007914.0, "step": 460 }, { "entropy": 7.096453285217285, "epoch": 0.03073262615247348, "grad_norm": 1.0, "learning_rate": 0.00023200000000000003, "loss": 6.792, "mean_token_accuracy": 0.0925156094133854, "num_tokens": 1018510.0, "step": 465 }, { "entropy": 7.169570064544677, "epoch": 0.031063084498199, "grad_norm": 1.2578125, "learning_rate": 0.00023449999999999998, "loss": 6.7677, "mean_token_accuracy": 0.09652838632464408, "num_tokens": 1028532.0, "step": 470 }, { "entropy": 7.168693256378174, "epoch": 0.031393542843924524, "grad_norm": 1.09375, "learning_rate": 0.000237, "loss": 6.9262, "mean_token_accuracy": 0.08653468191623688, "num_tokens": 1040252.0, "step": 475 }, { "entropy": 7.152310705184936, "epoch": 0.03172400118965005, "grad_norm": 1.078125, "learning_rate": 0.0002395, "loss": 6.7222, "mean_token_accuracy": 0.09424662217497826, "num_tokens": 1050486.0, "step": 480 }, { "entropy": 7.076179075241089, "epoch": 0.032054459535375564, "grad_norm": 1.2109375, "learning_rate": 0.000242, "loss": 6.766, "mean_token_accuracy": 0.09703566282987594, "num_tokens": 1061218.0, "step": 485 }, { "entropy": 7.191670942306518, "epoch": 0.03238491788110109, "grad_norm": 1.265625, "learning_rate": 0.0002445, "loss": 6.888, "mean_token_accuracy": 0.0887337252497673, "num_tokens": 1071077.0, "step": 490 }, { "entropy": 7.052482748031617, "epoch": 0.03271537622682661, "grad_norm": 1.6328125, "learning_rate": 0.000247, "loss": 6.8699, "mean_token_accuracy": 0.08658004626631736, "num_tokens": 1081434.0, "step": 495 }, { "entropy": 7.08971209526062, "epoch": 0.03304583457255213, "grad_norm": 1.21875, "learning_rate": 0.0002495, "loss": 6.811, "mean_token_accuracy": 0.09111799448728561, "num_tokens": 1092237.0, "step": 500 }, { "entropy": 7.195395469665527, "epoch": 0.03337629291827765, "grad_norm": 1.109375, "learning_rate": 0.000252, "loss": 6.8992, "mean_token_accuracy": 0.0858646959066391, "num_tokens": 1102368.0, "step": 505 }, { "entropy": 7.053650522232056, "epoch": 0.033706751264003174, "grad_norm": 1.3203125, "learning_rate": 0.0002545, "loss": 6.7836, "mean_token_accuracy": 0.0907538540661335, "num_tokens": 1113174.0, "step": 510 }, { "entropy": 7.080994558334351, "epoch": 0.0340372096097287, "grad_norm": 1.2265625, "learning_rate": 0.000257, "loss": 6.7959, "mean_token_accuracy": 0.09097289815545082, "num_tokens": 1124468.0, "step": 515 }, { "entropy": 7.159065294265747, "epoch": 0.03436766795545421, "grad_norm": 1.203125, "learning_rate": 0.0002595, "loss": 6.7495, "mean_token_accuracy": 0.08832652196288109, "num_tokens": 1134691.0, "step": 520 }, { "entropy": 7.132658243179321, "epoch": 0.03469812630117974, "grad_norm": 1.03125, "learning_rate": 0.000262, "loss": 6.9154, "mean_token_accuracy": 0.0892325647175312, "num_tokens": 1146487.0, "step": 525 }, { "entropy": 7.005402994155884, "epoch": 0.03502858464690526, "grad_norm": 1.078125, "learning_rate": 0.00026450000000000003, "loss": 6.7692, "mean_token_accuracy": 0.0914691999554634, "num_tokens": 1156897.0, "step": 530 }, { "entropy": 7.095370483398438, "epoch": 0.035359042992630776, "grad_norm": 1.0625, "learning_rate": 0.00026700000000000004, "loss": 6.6971, "mean_token_accuracy": 0.09731558784842491, "num_tokens": 1167884.0, "step": 535 }, { "entropy": 6.940491104125977, "epoch": 0.0356895013383563, "grad_norm": 1.140625, "learning_rate": 0.00026950000000000005, "loss": 6.7671, "mean_token_accuracy": 0.09241313189268112, "num_tokens": 1178214.0, "step": 540 }, { "entropy": 7.2427126407623295, "epoch": 0.03601995968408182, "grad_norm": 1.203125, "learning_rate": 0.00027200000000000005, "loss": 6.8648, "mean_token_accuracy": 0.08732976764440536, "num_tokens": 1188139.0, "step": 545 }, { "entropy": 7.035971355438233, "epoch": 0.03635041802980734, "grad_norm": 1.2265625, "learning_rate": 0.0002745, "loss": 6.7803, "mean_token_accuracy": 0.09080611243844032, "num_tokens": 1198349.0, "step": 550 }, { "entropy": 6.935536193847656, "epoch": 0.03668087637553286, "grad_norm": 0.97265625, "learning_rate": 0.000277, "loss": 6.7616, "mean_token_accuracy": 0.09351899325847626, "num_tokens": 1212208.0, "step": 555 }, { "entropy": 7.122801494598389, "epoch": 0.037011334721258386, "grad_norm": 1.140625, "learning_rate": 0.0002795, "loss": 6.763, "mean_token_accuracy": 0.09313179403543473, "num_tokens": 1222600.0, "step": 560 }, { "entropy": 6.91089358329773, "epoch": 0.03734179306698391, "grad_norm": 1.109375, "learning_rate": 0.00028199999999999997, "loss": 6.6661, "mean_token_accuracy": 0.0968889094889164, "num_tokens": 1233383.0, "step": 565 }, { "entropy": 7.025641775131225, "epoch": 0.037672251412709426, "grad_norm": 1.0703125, "learning_rate": 0.0002845, "loss": 6.679, "mean_token_accuracy": 0.09819161146879196, "num_tokens": 1243571.0, "step": 570 }, { "entropy": 6.8856569766998295, "epoch": 0.03800270975843495, "grad_norm": 1.2265625, "learning_rate": 0.000287, "loss": 6.7086, "mean_token_accuracy": 0.086531862616539, "num_tokens": 1255150.0, "step": 575 }, { "entropy": 6.880285835266113, "epoch": 0.03833316810416047, "grad_norm": 1.1796875, "learning_rate": 0.0002895, "loss": 6.7201, "mean_token_accuracy": 0.095609350502491, "num_tokens": 1265994.0, "step": 580 }, { "entropy": 6.986137962341308, "epoch": 0.03866362644988599, "grad_norm": 1.296875, "learning_rate": 0.000292, "loss": 6.7123, "mean_token_accuracy": 0.09263514503836631, "num_tokens": 1276244.0, "step": 585 }, { "entropy": 6.976613140106201, "epoch": 0.03899408479561151, "grad_norm": 1.3359375, "learning_rate": 0.0002945, "loss": 6.6008, "mean_token_accuracy": 0.1000402919948101, "num_tokens": 1285479.0, "step": 590 }, { "entropy": 6.9175629138946535, "epoch": 0.039324543141337036, "grad_norm": 1.125, "learning_rate": 0.000297, "loss": 6.7273, "mean_token_accuracy": 0.09454974755644799, "num_tokens": 1295591.0, "step": 595 }, { "entropy": 6.946761512756348, "epoch": 0.03965500148706256, "grad_norm": 1.03125, "learning_rate": 0.0002995, "loss": 6.6503, "mean_token_accuracy": 0.10151792019605636, "num_tokens": 1305516.0, "step": 600 }, { "entropy": 6.922713088989258, "epoch": 0.039985459832788076, "grad_norm": 1.0390625, "learning_rate": 0.000302, "loss": 6.647, "mean_token_accuracy": 0.09776916652917862, "num_tokens": 1316345.0, "step": 605 }, { "entropy": 6.957687187194824, "epoch": 0.0403159181785136, "grad_norm": 1.109375, "learning_rate": 0.0003045, "loss": 6.8079, "mean_token_accuracy": 0.09032155275344848, "num_tokens": 1327332.0, "step": 610 }, { "entropy": 6.881102657318115, "epoch": 0.04064637652423912, "grad_norm": 1.15625, "learning_rate": 0.000307, "loss": 6.6599, "mean_token_accuracy": 0.09579801037907601, "num_tokens": 1337572.0, "step": 615 }, { "entropy": 6.878293704986572, "epoch": 0.04097683486996464, "grad_norm": 1.0703125, "learning_rate": 0.0003095, "loss": 6.6088, "mean_token_accuracy": 0.09545752853155136, "num_tokens": 1347712.0, "step": 620 }, { "entropy": 6.984841537475586, "epoch": 0.04130729321569016, "grad_norm": 0.9140625, "learning_rate": 0.000312, "loss": 6.6957, "mean_token_accuracy": 0.0921433411538601, "num_tokens": 1359318.0, "step": 625 }, { "entropy": 6.789507246017456, "epoch": 0.041637751561415685, "grad_norm": 1.1328125, "learning_rate": 0.0003145, "loss": 6.6235, "mean_token_accuracy": 0.09607752040028572, "num_tokens": 1370322.0, "step": 630 }, { "entropy": 6.803044176101684, "epoch": 0.0419682099071412, "grad_norm": 1.0703125, "learning_rate": 0.000317, "loss": 6.6378, "mean_token_accuracy": 0.09525535404682159, "num_tokens": 1382660.0, "step": 635 }, { "entropy": 6.93178014755249, "epoch": 0.042298668252866725, "grad_norm": 1.046875, "learning_rate": 0.0003195, "loss": 6.6985, "mean_token_accuracy": 0.09292855113744736, "num_tokens": 1394377.0, "step": 640 }, { "entropy": 6.805371952056885, "epoch": 0.04262912659859225, "grad_norm": 1.1171875, "learning_rate": 0.000322, "loss": 6.6399, "mean_token_accuracy": 0.09336945563554763, "num_tokens": 1404680.0, "step": 645 }, { "entropy": 6.839718198776245, "epoch": 0.04295958494431777, "grad_norm": 1.328125, "learning_rate": 0.00032450000000000003, "loss": 6.67, "mean_token_accuracy": 0.09462371170520782, "num_tokens": 1416715.0, "step": 650 }, { "entropy": 6.81149001121521, "epoch": 0.04329004329004329, "grad_norm": 0.9921875, "learning_rate": 0.00032700000000000003, "loss": 6.6178, "mean_token_accuracy": 0.10017903596162796, "num_tokens": 1427354.0, "step": 655 }, { "entropy": 6.818669986724854, "epoch": 0.04362050163576881, "grad_norm": 1.2109375, "learning_rate": 0.00032950000000000004, "loss": 6.5643, "mean_token_accuracy": 0.09899974688887596, "num_tokens": 1438554.0, "step": 660 }, { "entropy": 6.8915050506591795, "epoch": 0.043950959981494335, "grad_norm": 1.1171875, "learning_rate": 0.00033200000000000005, "loss": 6.7589, "mean_token_accuracy": 0.0964146949350834, "num_tokens": 1449213.0, "step": 665 }, { "entropy": 6.898461866378784, "epoch": 0.04428141832721985, "grad_norm": 1.109375, "learning_rate": 0.00033450000000000005, "loss": 6.6459, "mean_token_accuracy": 0.09545622617006302, "num_tokens": 1460571.0, "step": 670 }, { "entropy": 6.756736993789673, "epoch": 0.044611876672945375, "grad_norm": 1.53125, "learning_rate": 0.000337, "loss": 6.7076, "mean_token_accuracy": 0.09004327580332756, "num_tokens": 1470638.0, "step": 675 }, { "entropy": 6.968370485305786, "epoch": 0.0449423350186709, "grad_norm": 1.0703125, "learning_rate": 0.0003395, "loss": 6.7096, "mean_token_accuracy": 0.09662523344159127, "num_tokens": 1481773.0, "step": 680 }, { "entropy": 6.718348550796509, "epoch": 0.045272793364396414, "grad_norm": 1.109375, "learning_rate": 0.000342, "loss": 6.638, "mean_token_accuracy": 0.09720009118318558, "num_tokens": 1491982.0, "step": 685 }, { "entropy": 6.835583591461182, "epoch": 0.04560325171012194, "grad_norm": 1.296875, "learning_rate": 0.00034449999999999997, "loss": 6.6416, "mean_token_accuracy": 0.09842949360609055, "num_tokens": 1503027.0, "step": 690 }, { "entropy": 6.808763265609741, "epoch": 0.04593371005584746, "grad_norm": 0.99609375, "learning_rate": 0.000347, "loss": 6.6703, "mean_token_accuracy": 0.09374243021011353, "num_tokens": 1515977.0, "step": 695 }, { "entropy": 6.725175905227661, "epoch": 0.046264168401572985, "grad_norm": 1.125, "learning_rate": 0.0003495, "loss": 6.5534, "mean_token_accuracy": 0.09220106229186058, "num_tokens": 1527309.0, "step": 700 }, { "entropy": 6.720183277130127, "epoch": 0.0465946267472985, "grad_norm": 1.1484375, "learning_rate": 0.000352, "loss": 6.5864, "mean_token_accuracy": 0.10298208072781563, "num_tokens": 1538233.0, "step": 705 }, { "entropy": 6.7770648956298825, "epoch": 0.046925085093024024, "grad_norm": 0.8984375, "learning_rate": 0.0003545, "loss": 6.5643, "mean_token_accuracy": 0.09746524840593337, "num_tokens": 1549893.0, "step": 710 }, { "entropy": 6.791210126876831, "epoch": 0.04725554343874955, "grad_norm": 1.0390625, "learning_rate": 0.000357, "loss": 6.6119, "mean_token_accuracy": 0.09718122556805611, "num_tokens": 1560926.0, "step": 715 }, { "entropy": 6.679304456710815, "epoch": 0.047586001784475064, "grad_norm": 1.0, "learning_rate": 0.0003595, "loss": 6.4565, "mean_token_accuracy": 0.10528466776013375, "num_tokens": 1571826.0, "step": 720 }, { "entropy": 6.780915212631226, "epoch": 0.04791646013020059, "grad_norm": 1.046875, "learning_rate": 0.000362, "loss": 6.6402, "mean_token_accuracy": 0.09756145626306534, "num_tokens": 1582710.0, "step": 725 }, { "entropy": 6.73593544960022, "epoch": 0.04824691847592611, "grad_norm": 1.1015625, "learning_rate": 0.0003645, "loss": 6.4899, "mean_token_accuracy": 0.09683176577091217, "num_tokens": 1593148.0, "step": 730 }, { "entropy": 6.734481763839722, "epoch": 0.048577376821651634, "grad_norm": 1.140625, "learning_rate": 0.000367, "loss": 6.5603, "mean_token_accuracy": 0.09808081015944481, "num_tokens": 1603286.0, "step": 735 }, { "entropy": 6.590597772598267, "epoch": 0.04890783516737715, "grad_norm": 1.0625, "learning_rate": 0.0003695, "loss": 6.4828, "mean_token_accuracy": 0.1038731187582016, "num_tokens": 1613341.0, "step": 740 }, { "entropy": 6.7730015277862545, "epoch": 0.049238293513102674, "grad_norm": 1.03125, "learning_rate": 0.000372, "loss": 6.5973, "mean_token_accuracy": 0.09209345281124115, "num_tokens": 1624733.0, "step": 745 }, { "entropy": 6.66158356666565, "epoch": 0.0495687518588282, "grad_norm": 0.92578125, "learning_rate": 0.0003745, "loss": 6.5181, "mean_token_accuracy": 0.09734064191579819, "num_tokens": 1635369.0, "step": 750 }, { "entropy": 6.763376712799072, "epoch": 0.049899210204553714, "grad_norm": 1.125, "learning_rate": 0.000377, "loss": 6.5794, "mean_token_accuracy": 0.10017797723412514, "num_tokens": 1646391.0, "step": 755 }, { "entropy": 6.685816621780395, "epoch": 0.05022966855027924, "grad_norm": 1.0390625, "learning_rate": 0.0003795, "loss": 6.6399, "mean_token_accuracy": 0.09641192629933357, "num_tokens": 1657923.0, "step": 760 }, { "entropy": 6.643207740783692, "epoch": 0.05056012689600476, "grad_norm": 0.9609375, "learning_rate": 0.000382, "loss": 6.5121, "mean_token_accuracy": 0.09868812561035156, "num_tokens": 1669732.0, "step": 765 }, { "entropy": 6.617096710205078, "epoch": 0.05089058524173028, "grad_norm": 1.046875, "learning_rate": 0.0003845, "loss": 6.4583, "mean_token_accuracy": 0.10043382048606872, "num_tokens": 1680646.0, "step": 770 }, { "entropy": 6.679386281967163, "epoch": 0.0512210435874558, "grad_norm": 1.0703125, "learning_rate": 0.00038700000000000003, "loss": 6.5689, "mean_token_accuracy": 0.09984266906976699, "num_tokens": 1690855.0, "step": 775 }, { "entropy": 6.724302148818969, "epoch": 0.05155150193318132, "grad_norm": 1.015625, "learning_rate": 0.00038950000000000003, "loss": 6.529, "mean_token_accuracy": 0.10136074721813201, "num_tokens": 1701798.0, "step": 780 }, { "entropy": 6.5292439460754395, "epoch": 0.05188196027890685, "grad_norm": 0.94140625, "learning_rate": 0.00039200000000000004, "loss": 6.456, "mean_token_accuracy": 0.09994935691356659, "num_tokens": 1713307.0, "step": 785 }, { "entropy": 6.717782592773437, "epoch": 0.05221241862463236, "grad_norm": 1.25, "learning_rate": 0.00039450000000000005, "loss": 6.5878, "mean_token_accuracy": 0.09384994134306908, "num_tokens": 1724158.0, "step": 790 }, { "entropy": 6.530282402038575, "epoch": 0.05254287697035789, "grad_norm": 0.98828125, "learning_rate": 0.00039700000000000005, "loss": 6.5416, "mean_token_accuracy": 0.10089174509048462, "num_tokens": 1734978.0, "step": 795 }, { "entropy": 6.784086656570435, "epoch": 0.05287333531608341, "grad_norm": 0.93359375, "learning_rate": 0.0003995, "loss": 6.5628, "mean_token_accuracy": 0.09250908866524696, "num_tokens": 1745757.0, "step": 800 }, { "entropy": 6.637925291061402, "epoch": 0.053203793661808926, "grad_norm": 1.0546875, "learning_rate": 0.000402, "loss": 6.5656, "mean_token_accuracy": 0.10313564985990524, "num_tokens": 1755370.0, "step": 805 }, { "entropy": 6.652379417419434, "epoch": 0.05353425200753445, "grad_norm": 1.21875, "learning_rate": 0.0004045, "loss": 6.5075, "mean_token_accuracy": 0.10148903802037239, "num_tokens": 1766031.0, "step": 810 }, { "entropy": 6.659540414810181, "epoch": 0.05386471035325997, "grad_norm": 1.125, "learning_rate": 0.00040699999999999997, "loss": 6.5279, "mean_token_accuracy": 0.10324057936668396, "num_tokens": 1778672.0, "step": 815 }, { "entropy": 6.496312141418457, "epoch": 0.05419516869898549, "grad_norm": 1.1328125, "learning_rate": 0.0004095, "loss": 6.4894, "mean_token_accuracy": 0.10615217164158822, "num_tokens": 1789912.0, "step": 820 }, { "entropy": 6.570638751983642, "epoch": 0.05452562704471101, "grad_norm": 1.0234375, "learning_rate": 0.000412, "loss": 6.4024, "mean_token_accuracy": 0.10341350361704826, "num_tokens": 1800350.0, "step": 825 }, { "entropy": 6.506610012054443, "epoch": 0.054856085390436536, "grad_norm": 1.125, "learning_rate": 0.0004145, "loss": 6.4464, "mean_token_accuracy": 0.09816132262349128, "num_tokens": 1811353.0, "step": 830 }, { "entropy": 6.599850749969482, "epoch": 0.05518654373616206, "grad_norm": 1.0546875, "learning_rate": 0.000417, "loss": 6.5677, "mean_token_accuracy": 0.10067287907004356, "num_tokens": 1822702.0, "step": 835 }, { "entropy": 6.622064638137817, "epoch": 0.055517002081887576, "grad_norm": 1.1953125, "learning_rate": 0.0004195, "loss": 6.5611, "mean_token_accuracy": 0.09993282034993171, "num_tokens": 1833520.0, "step": 840 }, { "entropy": 6.631695938110352, "epoch": 0.0558474604276131, "grad_norm": 1.046875, "learning_rate": 0.000422, "loss": 6.4769, "mean_token_accuracy": 0.10197674706578255, "num_tokens": 1843905.0, "step": 845 }, { "entropy": 6.651054716110229, "epoch": 0.05617791877333862, "grad_norm": 1.40625, "learning_rate": 0.0004245, "loss": 6.5903, "mean_token_accuracy": 0.09589819759130477, "num_tokens": 1854350.0, "step": 850 }, { "entropy": 6.625249004364013, "epoch": 0.05650837711906414, "grad_norm": 1.1953125, "learning_rate": 0.000427, "loss": 6.5257, "mean_token_accuracy": 0.1002203494310379, "num_tokens": 1864279.0, "step": 855 }, { "entropy": 6.585396718978882, "epoch": 0.05683883546478966, "grad_norm": 0.9765625, "learning_rate": 0.0004295, "loss": 6.5416, "mean_token_accuracy": 0.10187701731920243, "num_tokens": 1876618.0, "step": 860 }, { "entropy": 6.66397533416748, "epoch": 0.057169293810515186, "grad_norm": 1.09375, "learning_rate": 0.000432, "loss": 6.5215, "mean_token_accuracy": 0.09983031451702118, "num_tokens": 1888689.0, "step": 865 }, { "entropy": 6.483687019348144, "epoch": 0.05749975215624071, "grad_norm": 1.1015625, "learning_rate": 0.0004345, "loss": 6.4599, "mean_token_accuracy": 0.09891335591673851, "num_tokens": 1899527.0, "step": 870 }, { "entropy": 6.619280052185059, "epoch": 0.057830210501966225, "grad_norm": 1.0859375, "learning_rate": 0.000437, "loss": 6.5642, "mean_token_accuracy": 0.09296367540955544, "num_tokens": 1910212.0, "step": 875 }, { "entropy": 6.569179058074951, "epoch": 0.05816066884769175, "grad_norm": 0.94140625, "learning_rate": 0.0004395, "loss": 6.4496, "mean_token_accuracy": 0.10345134884119034, "num_tokens": 1919938.0, "step": 880 }, { "entropy": 6.494620656967163, "epoch": 0.05849112719341727, "grad_norm": 1.0859375, "learning_rate": 0.000442, "loss": 6.4105, "mean_token_accuracy": 0.106119804084301, "num_tokens": 1929984.0, "step": 885 }, { "entropy": 6.534124374389648, "epoch": 0.05882158553914279, "grad_norm": 0.9921875, "learning_rate": 0.0004445, "loss": 6.5382, "mean_token_accuracy": 0.093291524797678, "num_tokens": 1941683.0, "step": 890 }, { "entropy": 6.617558002471924, "epoch": 0.05915204388486831, "grad_norm": 1.0234375, "learning_rate": 0.000447, "loss": 6.5158, "mean_token_accuracy": 0.09773639366030692, "num_tokens": 1952847.0, "step": 895 }, { "entropy": 6.576697492599488, "epoch": 0.059482502230593835, "grad_norm": 1.2421875, "learning_rate": 0.00044950000000000003, "loss": 6.4391, "mean_token_accuracy": 0.10089132189750671, "num_tokens": 1963449.0, "step": 900 }, { "entropy": 6.443887376785279, "epoch": 0.05981296057631935, "grad_norm": 0.98828125, "learning_rate": 0.00045200000000000004, "loss": 6.4521, "mean_token_accuracy": 0.10279465019702912, "num_tokens": 1973855.0, "step": 905 }, { "entropy": 6.472233676910401, "epoch": 0.060143418922044875, "grad_norm": 1.140625, "learning_rate": 0.00045450000000000004, "loss": 6.4577, "mean_token_accuracy": 0.09866586327552795, "num_tokens": 1985015.0, "step": 910 }, { "entropy": 6.604752397537231, "epoch": 0.0604738772677704, "grad_norm": 0.9453125, "learning_rate": 0.00045700000000000005, "loss": 6.5311, "mean_token_accuracy": 0.10184109881520272, "num_tokens": 1996042.0, "step": 915 }, { "entropy": 6.517620611190796, "epoch": 0.06080433561349592, "grad_norm": 0.9921875, "learning_rate": 0.00045950000000000006, "loss": 6.4881, "mean_token_accuracy": 0.09871948435902596, "num_tokens": 2008155.0, "step": 920 }, { "entropy": 6.533037567138672, "epoch": 0.06113479395922144, "grad_norm": 1.046875, "learning_rate": 0.000462, "loss": 6.4375, "mean_token_accuracy": 0.10870096236467361, "num_tokens": 2017975.0, "step": 925 }, { "entropy": 6.4154664993286135, "epoch": 0.06146525230494696, "grad_norm": 0.96875, "learning_rate": 0.0004645, "loss": 6.3442, "mean_token_accuracy": 0.10482841059565544, "num_tokens": 2029210.0, "step": 930 }, { "entropy": 6.495858383178711, "epoch": 0.061795710650672485, "grad_norm": 1.0390625, "learning_rate": 0.000467, "loss": 6.4541, "mean_token_accuracy": 0.10356884673237801, "num_tokens": 2039131.0, "step": 935 }, { "entropy": 6.439481210708618, "epoch": 0.062126168996398, "grad_norm": 1.1328125, "learning_rate": 0.0004695, "loss": 6.5025, "mean_token_accuracy": 0.10553577691316604, "num_tokens": 2049865.0, "step": 940 }, { "entropy": 6.535756683349609, "epoch": 0.062456627342123525, "grad_norm": 1.234375, "learning_rate": 0.000472, "loss": 6.4931, "mean_token_accuracy": 0.09843265414237976, "num_tokens": 2061151.0, "step": 945 }, { "entropy": 6.403180408477783, "epoch": 0.06278708568784905, "grad_norm": 1.1953125, "learning_rate": 0.0004745, "loss": 6.3533, "mean_token_accuracy": 0.10208684876561165, "num_tokens": 2071492.0, "step": 950 }, { "entropy": 6.472384834289551, "epoch": 0.06311754403357457, "grad_norm": 1.078125, "learning_rate": 0.000477, "loss": 6.4064, "mean_token_accuracy": 0.10374934822320939, "num_tokens": 2083291.0, "step": 955 }, { "entropy": 6.539694118499756, "epoch": 0.0634480023793001, "grad_norm": 1.015625, "learning_rate": 0.0004795, "loss": 6.5599, "mean_token_accuracy": 0.10300241261720658, "num_tokens": 2094515.0, "step": 960 }, { "entropy": 6.558036661148071, "epoch": 0.0637784607250256, "grad_norm": 1.109375, "learning_rate": 0.000482, "loss": 6.4193, "mean_token_accuracy": 0.10273518785834312, "num_tokens": 2104774.0, "step": 965 }, { "entropy": 6.342342042922974, "epoch": 0.06410891907075113, "grad_norm": 1.078125, "learning_rate": 0.0004845, "loss": 6.3231, "mean_token_accuracy": 0.11382870972156525, "num_tokens": 2114751.0, "step": 970 }, { "entropy": 6.497040271759033, "epoch": 0.06443937741647665, "grad_norm": 0.8671875, "learning_rate": 0.000487, "loss": 6.3843, "mean_token_accuracy": 0.10335814580321312, "num_tokens": 2126815.0, "step": 975 }, { "entropy": 6.449503803253174, "epoch": 0.06476983576220217, "grad_norm": 0.9609375, "learning_rate": 0.0004895, "loss": 6.4582, "mean_token_accuracy": 0.09764749184250832, "num_tokens": 2137951.0, "step": 980 }, { "entropy": 6.487096357345581, "epoch": 0.0651002941079277, "grad_norm": 1.03125, "learning_rate": 0.000492, "loss": 6.5674, "mean_token_accuracy": 0.1011856272816658, "num_tokens": 2149291.0, "step": 985 }, { "entropy": 6.517102432250977, "epoch": 0.06543075245365322, "grad_norm": 0.92578125, "learning_rate": 0.0004945, "loss": 6.5642, "mean_token_accuracy": 0.09843995049595833, "num_tokens": 2161351.0, "step": 990 }, { "entropy": 6.437722778320312, "epoch": 0.06576121079937874, "grad_norm": 1.0, "learning_rate": 0.000497, "loss": 6.3354, "mean_token_accuracy": 0.10348827317357064, "num_tokens": 2172832.0, "step": 995 }, { "entropy": 6.447791671752929, "epoch": 0.06609166914510425, "grad_norm": 1.0390625, "learning_rate": 0.0004995, "loss": 6.4564, "mean_token_accuracy": 0.1005012884736061, "num_tokens": 2183151.0, "step": 1000 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 3612452161536000.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }