{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.2334176230305388, "eval_steps": 3000, "global_step": 3000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 4.92353572845459, "epoch": 0.00038902937171756465, "grad_norm": 13.375, "learning_rate": 2e-06, "loss": 14.2513, "mean_token_accuracy": 0.0001277139177545905, "num_tokens": 8755.0, "step": 5 }, { "entropy": 4.934064674377441, "epoch": 0.0007780587434351293, "grad_norm": 13.875, "learning_rate": 4.5e-06, "loss": 14.2685, "mean_token_accuracy": 0.0, "num_tokens": 17641.0, "step": 10 }, { "entropy": 4.950730228424073, "epoch": 0.001167088115152694, "grad_norm": 15.1875, "learning_rate": 7e-06, "loss": 14.1845, "mean_token_accuracy": 0.0, "num_tokens": 26293.0, "step": 15 }, { "entropy": 4.978141450881958, "epoch": 0.0015561174868702586, "grad_norm": 16.875, "learning_rate": 9.5e-06, "loss": 14.0758, "mean_token_accuracy": 0.0, "num_tokens": 35627.0, "step": 20 }, { "entropy": 5.09318265914917, "epoch": 0.0019451468585878235, "grad_norm": 20.25, "learning_rate": 1.2e-05, "loss": 13.6416, "mean_token_accuracy": 0.0, "num_tokens": 43861.0, "step": 25 }, { "entropy": 5.357007932662964, "epoch": 0.002334176230305388, "grad_norm": 26.375, "learning_rate": 1.4500000000000002e-05, "loss": 13.1478, "mean_token_accuracy": 0.0, "num_tokens": 52816.0, "step": 30 }, { "entropy": 6.636251544952392, "epoch": 0.0027232056020229526, "grad_norm": 25.375, "learning_rate": 1.7000000000000003e-05, "loss": 12.0885, "mean_token_accuracy": 0.0, "num_tokens": 61370.0, "step": 35 }, { "entropy": 9.923179340362548, "epoch": 0.0031122349737405172, "grad_norm": 3.578125, "learning_rate": 1.95e-05, "loss": 10.9048, "mean_token_accuracy": 0.0001186239649541676, "num_tokens": 69444.0, "step": 40 }, { "entropy": 10.702562427520752, "epoch": 0.003501264345458082, "grad_norm": 3.28125, "learning_rate": 2.2e-05, "loss": 10.6653, "mean_token_accuracy": 0.011188959912396967, "num_tokens": 77892.0, "step": 45 }, { "entropy": 10.734418773651123, "epoch": 0.003890293717175647, "grad_norm": 2.75, "learning_rate": 2.4500000000000003e-05, "loss": 10.5129, "mean_token_accuracy": 0.020575371105223894, "num_tokens": 86154.0, "step": 50 }, { "entropy": 10.707633876800537, "epoch": 0.004279323088893211, "grad_norm": 2.1875, "learning_rate": 2.7e-05, "loss": 10.3484, "mean_token_accuracy": 0.01765873283147812, "num_tokens": 95589.0, "step": 55 }, { "entropy": 10.638573741912841, "epoch": 0.004668352460610776, "grad_norm": 2.09375, "learning_rate": 2.95e-05, "loss": 10.1852, "mean_token_accuracy": 0.017188905738294125, "num_tokens": 105268.0, "step": 60 }, { "entropy": 10.698107624053955, "epoch": 0.0050573818323283405, "grad_norm": 1.90625, "learning_rate": 3.2e-05, "loss": 9.9755, "mean_token_accuracy": 0.020746274664998055, "num_tokens": 113347.0, "step": 65 }, { "entropy": 10.710992527008056, "epoch": 0.005446411204045905, "grad_norm": 1.921875, "learning_rate": 3.4500000000000005e-05, "loss": 9.8539, "mean_token_accuracy": 0.029131441563367843, "num_tokens": 121235.0, "step": 70 }, { "entropy": 10.693155670166016, "epoch": 0.00583544057576347, "grad_norm": 1.734375, "learning_rate": 3.7e-05, "loss": 9.8016, "mean_token_accuracy": 0.03198963850736618, "num_tokens": 129529.0, "step": 75 }, { "entropy": 10.6787428855896, "epoch": 0.0062244699474810344, "grad_norm": 1.7109375, "learning_rate": 3.95e-05, "loss": 9.719, "mean_token_accuracy": 0.026658685877919197, "num_tokens": 137918.0, "step": 80 }, { "entropy": 10.677947998046875, "epoch": 0.006613499319198599, "grad_norm": 1.7890625, "learning_rate": 4.2000000000000004e-05, "loss": 9.5968, "mean_token_accuracy": 0.03781393375247717, "num_tokens": 146445.0, "step": 85 }, { "entropy": 10.670944595336914, "epoch": 0.007002528690916164, "grad_norm": 1.71875, "learning_rate": 4.45e-05, "loss": 9.5696, "mean_token_accuracy": 0.0504709430038929, "num_tokens": 155904.0, "step": 90 }, { "entropy": 10.652875709533692, "epoch": 0.007391558062633729, "grad_norm": 1.71875, "learning_rate": 4.7000000000000004e-05, "loss": 9.45, "mean_token_accuracy": 0.050913235172629356, "num_tokens": 164436.0, "step": 95 }, { "entropy": 10.624427032470702, "epoch": 0.007780587434351294, "grad_norm": 1.6328125, "learning_rate": 4.9500000000000004e-05, "loss": 9.3318, "mean_token_accuracy": 0.048470248281955716, "num_tokens": 172985.0, "step": 100 }, { "entropy": 10.590660285949706, "epoch": 0.008169616806068859, "grad_norm": 1.59375, "learning_rate": 5.2e-05, "loss": 9.2226, "mean_token_accuracy": 0.04833147563040256, "num_tokens": 182084.0, "step": 105 }, { "entropy": 10.561868572235108, "epoch": 0.008558646177786422, "grad_norm": 1.578125, "learning_rate": 5.45e-05, "loss": 9.0932, "mean_token_accuracy": 0.05851382501423359, "num_tokens": 190742.0, "step": 110 }, { "entropy": 10.509655570983886, "epoch": 0.008947675549503988, "grad_norm": 1.6328125, "learning_rate": 5.7e-05, "loss": 8.9979, "mean_token_accuracy": 0.057733524963259696, "num_tokens": 199600.0, "step": 115 }, { "entropy": 10.445792770385742, "epoch": 0.009336704921221552, "grad_norm": 1.59375, "learning_rate": 5.9499999999999996e-05, "loss": 8.9087, "mean_token_accuracy": 0.05567027330398559, "num_tokens": 207883.0, "step": 120 }, { "entropy": 10.376938629150391, "epoch": 0.009725734292939117, "grad_norm": 1.453125, "learning_rate": 6.2e-05, "loss": 8.8037, "mean_token_accuracy": 0.05684689395129681, "num_tokens": 216216.0, "step": 125 }, { "entropy": 10.31500473022461, "epoch": 0.010114763664656681, "grad_norm": 1.4140625, "learning_rate": 6.450000000000001e-05, "loss": 8.6827, "mean_token_accuracy": 0.05753975734114647, "num_tokens": 225250.0, "step": 130 }, { "entropy": 10.194760513305663, "epoch": 0.010503793036374246, "grad_norm": 1.328125, "learning_rate": 6.7e-05, "loss": 8.5671, "mean_token_accuracy": 0.054637744277715686, "num_tokens": 233748.0, "step": 135 }, { "entropy": 10.12427225112915, "epoch": 0.01089282240809181, "grad_norm": 1.1796875, "learning_rate": 6.950000000000001e-05, "loss": 8.4612, "mean_token_accuracy": 0.0579361479729414, "num_tokens": 242629.0, "step": 140 }, { "entropy": 9.959631061553955, "epoch": 0.011281851779809376, "grad_norm": 1.421875, "learning_rate": 7.2e-05, "loss": 8.3515, "mean_token_accuracy": 0.054840120300650594, "num_tokens": 251458.0, "step": 145 }, { "entropy": 9.83036823272705, "epoch": 0.01167088115152694, "grad_norm": 1.1796875, "learning_rate": 7.45e-05, "loss": 8.2394, "mean_token_accuracy": 0.06350252479314804, "num_tokens": 260557.0, "step": 150 }, { "entropy": 9.662144470214844, "epoch": 0.012059910523244505, "grad_norm": 1.0703125, "learning_rate": 7.7e-05, "loss": 8.1841, "mean_token_accuracy": 0.061289533600211145, "num_tokens": 269262.0, "step": 155 }, { "entropy": 9.52525873184204, "epoch": 0.012448939894962069, "grad_norm": 1.0234375, "learning_rate": 7.950000000000001e-05, "loss": 8.0687, "mean_token_accuracy": 0.06112904436886311, "num_tokens": 277804.0, "step": 160 }, { "entropy": 9.351448822021485, "epoch": 0.012837969266679634, "grad_norm": 1.1953125, "learning_rate": 8.2e-05, "loss": 7.9878, "mean_token_accuracy": 0.06238803043961525, "num_tokens": 287450.0, "step": 165 }, { "entropy": 9.164531326293945, "epoch": 0.013226998638397198, "grad_norm": 0.99609375, "learning_rate": 8.450000000000001e-05, "loss": 7.947, "mean_token_accuracy": 0.05899545960128307, "num_tokens": 296497.0, "step": 170 }, { "entropy": 8.984291362762452, "epoch": 0.013616028010114764, "grad_norm": 0.83984375, "learning_rate": 8.7e-05, "loss": 7.8233, "mean_token_accuracy": 0.06463964357972145, "num_tokens": 305414.0, "step": 175 }, { "entropy": 8.76324167251587, "epoch": 0.014005057381832327, "grad_norm": 0.87109375, "learning_rate": 8.95e-05, "loss": 7.8054, "mean_token_accuracy": 0.05876799784600735, "num_tokens": 313639.0, "step": 180 }, { "entropy": 8.647741985321044, "epoch": 0.014394086753549893, "grad_norm": 0.73828125, "learning_rate": 9.2e-05, "loss": 7.7893, "mean_token_accuracy": 0.06448987349867821, "num_tokens": 322855.0, "step": 185 }, { "entropy": 8.506945037841797, "epoch": 0.014783116125267459, "grad_norm": 0.7265625, "learning_rate": 9.45e-05, "loss": 7.8651, "mean_token_accuracy": 0.06298348568379879, "num_tokens": 332071.0, "step": 190 }, { "entropy": 8.408401393890381, "epoch": 0.015172145496985022, "grad_norm": 0.8046875, "learning_rate": 9.7e-05, "loss": 7.668, "mean_token_accuracy": 0.06562523804605007, "num_tokens": 339990.0, "step": 195 }, { "entropy": 8.309197616577148, "epoch": 0.015561174868702588, "grad_norm": 0.83984375, "learning_rate": 9.95e-05, "loss": 7.7209, "mean_token_accuracy": 0.0656034205108881, "num_tokens": 348581.0, "step": 200 }, { "entropy": 8.265014839172363, "epoch": 0.01595020424042015, "grad_norm": 0.80078125, "learning_rate": 0.000102, "loss": 7.709, "mean_token_accuracy": 0.06688988246023655, "num_tokens": 357032.0, "step": 205 }, { "entropy": 8.248595333099365, "epoch": 0.016339233612137717, "grad_norm": 0.7109375, "learning_rate": 0.00010449999999999999, "loss": 7.6737, "mean_token_accuracy": 0.06308167651295662, "num_tokens": 366562.0, "step": 210 }, { "entropy": 8.197728157043457, "epoch": 0.016728262983855283, "grad_norm": 0.828125, "learning_rate": 0.000107, "loss": 7.6647, "mean_token_accuracy": 0.06641935594379902, "num_tokens": 374555.0, "step": 215 }, { "entropy": 8.081507778167724, "epoch": 0.017117292355572845, "grad_norm": 0.76953125, "learning_rate": 0.0001095, "loss": 7.702, "mean_token_accuracy": 0.060842974483966826, "num_tokens": 383583.0, "step": 220 }, { "entropy": 8.141448211669921, "epoch": 0.01750632172729041, "grad_norm": 0.6484375, "learning_rate": 0.000112, "loss": 7.719, "mean_token_accuracy": 0.06294353380799293, "num_tokens": 392932.0, "step": 225 }, { "entropy": 8.129082298278808, "epoch": 0.017895351099007976, "grad_norm": 0.83984375, "learning_rate": 0.0001145, "loss": 7.572, "mean_token_accuracy": 0.06622617989778519, "num_tokens": 401653.0, "step": 230 }, { "entropy": 8.068495750427246, "epoch": 0.01828438047072554, "grad_norm": 0.74609375, "learning_rate": 0.00011700000000000001, "loss": 7.6611, "mean_token_accuracy": 0.06250618062913418, "num_tokens": 410432.0, "step": 235 }, { "entropy": 8.076781940460204, "epoch": 0.018673409842443103, "grad_norm": 0.71875, "learning_rate": 0.00011949999999999999, "loss": 7.6261, "mean_token_accuracy": 0.06318732835352421, "num_tokens": 419380.0, "step": 240 }, { "entropy": 8.065077304840088, "epoch": 0.01906243921416067, "grad_norm": 1.0, "learning_rate": 0.000122, "loss": 7.5564, "mean_token_accuracy": 0.0642390213906765, "num_tokens": 427682.0, "step": 245 }, { "entropy": 8.04588441848755, "epoch": 0.019451468585878234, "grad_norm": 0.7265625, "learning_rate": 0.0001245, "loss": 7.6214, "mean_token_accuracy": 0.062338390946388246, "num_tokens": 437708.0, "step": 250 }, { "entropy": 8.039131164550781, "epoch": 0.0198404979575958, "grad_norm": 0.89453125, "learning_rate": 0.000127, "loss": 7.6017, "mean_token_accuracy": 0.067028983309865, "num_tokens": 446480.0, "step": 255 }, { "entropy": 8.057591438293457, "epoch": 0.020229527329313362, "grad_norm": 0.8671875, "learning_rate": 0.0001295, "loss": 7.6213, "mean_token_accuracy": 0.06589528843760491, "num_tokens": 455273.0, "step": 260 }, { "entropy": 8.022430849075317, "epoch": 0.020618556701030927, "grad_norm": 0.8515625, "learning_rate": 0.000132, "loss": 7.5587, "mean_token_accuracy": 0.06589296795427799, "num_tokens": 464306.0, "step": 265 }, { "entropy": 8.003626775741576, "epoch": 0.021007586072748493, "grad_norm": 0.7109375, "learning_rate": 0.00013450000000000002, "loss": 7.5562, "mean_token_accuracy": 0.06347908154129982, "num_tokens": 472812.0, "step": 270 }, { "entropy": 7.978896903991699, "epoch": 0.02139661544446606, "grad_norm": 0.8515625, "learning_rate": 0.00013700000000000002, "loss": 7.5405, "mean_token_accuracy": 0.06544829607009887, "num_tokens": 481326.0, "step": 275 }, { "entropy": 7.993354463577271, "epoch": 0.02178564481618362, "grad_norm": 0.875, "learning_rate": 0.0001395, "loss": 7.4823, "mean_token_accuracy": 0.06848083920776844, "num_tokens": 489147.0, "step": 280 }, { "entropy": 7.981906986236572, "epoch": 0.022174674187901186, "grad_norm": 0.84375, "learning_rate": 0.00014199999999999998, "loss": 7.4842, "mean_token_accuracy": 0.07221479900181293, "num_tokens": 497455.0, "step": 285 }, { "entropy": 7.967179822921753, "epoch": 0.02256370355961875, "grad_norm": 0.95703125, "learning_rate": 0.0001445, "loss": 7.4328, "mean_token_accuracy": 0.0648717537522316, "num_tokens": 506735.0, "step": 290 }, { "entropy": 7.938949966430664, "epoch": 0.022952732931336317, "grad_norm": 0.92578125, "learning_rate": 0.000147, "loss": 7.489, "mean_token_accuracy": 0.06714184954762459, "num_tokens": 515976.0, "step": 295 }, { "entropy": 7.8373462677001955, "epoch": 0.02334176230305388, "grad_norm": 0.84375, "learning_rate": 0.0001495, "loss": 7.4997, "mean_token_accuracy": 0.06925978623330593, "num_tokens": 524986.0, "step": 300 }, { "entropy": 7.921111154556274, "epoch": 0.023730791674771445, "grad_norm": 0.984375, "learning_rate": 0.000152, "loss": 7.4968, "mean_token_accuracy": 0.07236363515257835, "num_tokens": 533146.0, "step": 305 }, { "entropy": 7.893795490264893, "epoch": 0.02411982104648901, "grad_norm": 0.8359375, "learning_rate": 0.00015450000000000001, "loss": 7.4158, "mean_token_accuracy": 0.06991111040115357, "num_tokens": 541704.0, "step": 310 }, { "entropy": 7.880386638641357, "epoch": 0.024508850418206576, "grad_norm": 0.94921875, "learning_rate": 0.000157, "loss": 7.3869, "mean_token_accuracy": 0.0700387105345726, "num_tokens": 550088.0, "step": 315 }, { "entropy": 7.82145209312439, "epoch": 0.024897879789924138, "grad_norm": 1.0, "learning_rate": 0.0001595, "loss": 7.3733, "mean_token_accuracy": 0.07134931497275829, "num_tokens": 558763.0, "step": 320 }, { "entropy": 7.873892116546631, "epoch": 0.025286909161641703, "grad_norm": 0.6953125, "learning_rate": 0.000162, "loss": 7.4578, "mean_token_accuracy": 0.06747227981686592, "num_tokens": 567538.0, "step": 325 }, { "entropy": 7.873815393447876, "epoch": 0.02567593853335927, "grad_norm": 1.03125, "learning_rate": 0.00016450000000000001, "loss": 7.4837, "mean_token_accuracy": 0.0674517210572958, "num_tokens": 577626.0, "step": 330 }, { "entropy": 7.768797588348389, "epoch": 0.026064967905076834, "grad_norm": 0.7890625, "learning_rate": 0.00016700000000000002, "loss": 7.4164, "mean_token_accuracy": 0.06899687238037586, "num_tokens": 587163.0, "step": 335 }, { "entropy": 7.8342077255249025, "epoch": 0.026453997276794396, "grad_norm": 0.9296875, "learning_rate": 0.00016950000000000003, "loss": 7.3806, "mean_token_accuracy": 0.07264294996857643, "num_tokens": 595896.0, "step": 340 }, { "entropy": 7.910291004180908, "epoch": 0.026843026648511962, "grad_norm": 1.0390625, "learning_rate": 0.00017199999999999998, "loss": 7.409, "mean_token_accuracy": 0.07169737853109837, "num_tokens": 603815.0, "step": 345 }, { "entropy": 7.82722544670105, "epoch": 0.027232056020229527, "grad_norm": 1.671875, "learning_rate": 0.00017449999999999999, "loss": 7.4483, "mean_token_accuracy": 0.07086139768362046, "num_tokens": 612208.0, "step": 350 }, { "entropy": 7.742429780960083, "epoch": 0.027621085391947093, "grad_norm": 1.0078125, "learning_rate": 0.000177, "loss": 7.4119, "mean_token_accuracy": 0.07163332626223565, "num_tokens": 621840.0, "step": 355 }, { "entropy": 7.883988571166992, "epoch": 0.028010114763664655, "grad_norm": 0.9296875, "learning_rate": 0.0001795, "loss": 7.4061, "mean_token_accuracy": 0.07186231873929501, "num_tokens": 630770.0, "step": 360 }, { "entropy": 7.773575687408448, "epoch": 0.02839914413538222, "grad_norm": 1.234375, "learning_rate": 0.000182, "loss": 7.4064, "mean_token_accuracy": 0.07286142185330391, "num_tokens": 640313.0, "step": 365 }, { "entropy": 7.860558700561524, "epoch": 0.028788173507099786, "grad_norm": 1.046875, "learning_rate": 0.0001845, "loss": 7.4376, "mean_token_accuracy": 0.07616207674145699, "num_tokens": 648594.0, "step": 370 }, { "entropy": 7.8611939430236815, "epoch": 0.02917720287881735, "grad_norm": 1.1171875, "learning_rate": 0.000187, "loss": 7.4204, "mean_token_accuracy": 0.07530638352036476, "num_tokens": 656478.0, "step": 375 }, { "entropy": 7.69996657371521, "epoch": 0.029566232250534917, "grad_norm": 1.0, "learning_rate": 0.0001895, "loss": 7.3901, "mean_token_accuracy": 0.07715101987123489, "num_tokens": 665405.0, "step": 380 }, { "entropy": 7.884545755386353, "epoch": 0.02995526162225248, "grad_norm": 1.1015625, "learning_rate": 0.000192, "loss": 7.4072, "mean_token_accuracy": 0.07346850857138634, "num_tokens": 674301.0, "step": 385 }, { "entropy": 7.79351954460144, "epoch": 0.030344290993970045, "grad_norm": 1.21875, "learning_rate": 0.0001945, "loss": 7.4109, "mean_token_accuracy": 0.08006449043750763, "num_tokens": 683159.0, "step": 390 }, { "entropy": 7.635227489471435, "epoch": 0.03073332036568761, "grad_norm": 0.97265625, "learning_rate": 0.00019700000000000002, "loss": 7.253, "mean_token_accuracy": 0.08206554427742958, "num_tokens": 690992.0, "step": 395 }, { "entropy": 7.689710521697998, "epoch": 0.031122349737405176, "grad_norm": 0.89453125, "learning_rate": 0.00019950000000000002, "loss": 7.3351, "mean_token_accuracy": 0.08058228120207786, "num_tokens": 699934.0, "step": 400 }, { "entropy": 7.84839277267456, "epoch": 0.03151137910912274, "grad_norm": 0.96875, "learning_rate": 0.000202, "loss": 7.3736, "mean_token_accuracy": 0.07575208507478237, "num_tokens": 708844.0, "step": 405 }, { "entropy": 7.728482341766357, "epoch": 0.0319004084808403, "grad_norm": 0.90625, "learning_rate": 0.00020449999999999998, "loss": 7.4388, "mean_token_accuracy": 0.07045924849808216, "num_tokens": 718148.0, "step": 410 }, { "entropy": 7.762258625030517, "epoch": 0.03228943785255787, "grad_norm": 1.09375, "learning_rate": 0.000207, "loss": 7.3623, "mean_token_accuracy": 0.0722539782524109, "num_tokens": 726859.0, "step": 415 }, { "entropy": 7.745457887649536, "epoch": 0.032678467224275434, "grad_norm": 0.82421875, "learning_rate": 0.0002095, "loss": 7.3553, "mean_token_accuracy": 0.07971226572990417, "num_tokens": 735045.0, "step": 420 }, { "entropy": 7.745830869674682, "epoch": 0.033067496595993, "grad_norm": 0.95703125, "learning_rate": 0.000212, "loss": 7.2402, "mean_token_accuracy": 0.08178875669836998, "num_tokens": 743538.0, "step": 425 }, { "entropy": 7.6178747653961185, "epoch": 0.033456525967710565, "grad_norm": 0.953125, "learning_rate": 0.0002145, "loss": 7.2988, "mean_token_accuracy": 0.0807783305644989, "num_tokens": 752518.0, "step": 430 }, { "entropy": 7.715822649002075, "epoch": 0.033845555339428124, "grad_norm": 1.1328125, "learning_rate": 0.00021700000000000002, "loss": 7.3213, "mean_token_accuracy": 0.07773758620023727, "num_tokens": 760354.0, "step": 435 }, { "entropy": 7.711114501953125, "epoch": 0.03423458471114569, "grad_norm": 1.1640625, "learning_rate": 0.0002195, "loss": 7.3633, "mean_token_accuracy": 0.07912566363811493, "num_tokens": 769522.0, "step": 440 }, { "entropy": 7.787883377075195, "epoch": 0.034623614082863255, "grad_norm": 1.2578125, "learning_rate": 0.000222, "loss": 7.3054, "mean_token_accuracy": 0.08274181857705117, "num_tokens": 778548.0, "step": 445 }, { "entropy": 7.620460271835327, "epoch": 0.03501264345458082, "grad_norm": 1.15625, "learning_rate": 0.0002245, "loss": 7.318, "mean_token_accuracy": 0.07461104467511177, "num_tokens": 787666.0, "step": 450 }, { "entropy": 7.71654577255249, "epoch": 0.035401672826298386, "grad_norm": 1.15625, "learning_rate": 0.00022700000000000002, "loss": 7.2207, "mean_token_accuracy": 0.07886159271001816, "num_tokens": 796550.0, "step": 455 }, { "entropy": 7.6406464099884035, "epoch": 0.03579070219801595, "grad_norm": 1.6171875, "learning_rate": 0.00022950000000000002, "loss": 7.275, "mean_token_accuracy": 0.083228849619627, "num_tokens": 804549.0, "step": 460 }, { "entropy": 7.61014609336853, "epoch": 0.03617973156973352, "grad_norm": 1.0234375, "learning_rate": 0.00023200000000000003, "loss": 7.2721, "mean_token_accuracy": 0.08080526292324067, "num_tokens": 813328.0, "step": 465 }, { "entropy": 7.666672468185425, "epoch": 0.03656876094145108, "grad_norm": 0.97265625, "learning_rate": 0.00023449999999999998, "loss": 7.2935, "mean_token_accuracy": 0.08522161021828652, "num_tokens": 821733.0, "step": 470 }, { "entropy": 7.678701782226563, "epoch": 0.03695779031316864, "grad_norm": 0.890625, "learning_rate": 0.000237, "loss": 7.2352, "mean_token_accuracy": 0.08546577319502831, "num_tokens": 830243.0, "step": 475 }, { "entropy": 7.726054334640503, "epoch": 0.03734681968488621, "grad_norm": 1.421875, "learning_rate": 0.0002395, "loss": 7.2069, "mean_token_accuracy": 0.08190477639436722, "num_tokens": 839059.0, "step": 480 }, { "entropy": 7.506451272964478, "epoch": 0.03773584905660377, "grad_norm": 1.3671875, "learning_rate": 0.000242, "loss": 7.1162, "mean_token_accuracy": 0.08447866290807723, "num_tokens": 846932.0, "step": 485 }, { "entropy": 7.670350217819214, "epoch": 0.03812487842832134, "grad_norm": 1.046875, "learning_rate": 0.0002445, "loss": 7.2847, "mean_token_accuracy": 0.07881609201431275, "num_tokens": 855333.0, "step": 490 }, { "entropy": 7.547208404541015, "epoch": 0.0385139078000389, "grad_norm": 1.1875, "learning_rate": 0.000247, "loss": 7.0816, "mean_token_accuracy": 0.08268252983689309, "num_tokens": 863571.0, "step": 495 }, { "entropy": 7.472938203811646, "epoch": 0.03890293717175647, "grad_norm": 1.2109375, "learning_rate": 0.0002495, "loss": 7.1508, "mean_token_accuracy": 0.0897403359413147, "num_tokens": 872145.0, "step": 500 }, { "entropy": 7.586430358886719, "epoch": 0.039291966543474034, "grad_norm": 1.2578125, "learning_rate": 0.000252, "loss": 7.1937, "mean_token_accuracy": 0.08515456318855286, "num_tokens": 880634.0, "step": 505 }, { "entropy": 7.575957155227661, "epoch": 0.0396809959151916, "grad_norm": 0.9296875, "learning_rate": 0.0002545, "loss": 7.1256, "mean_token_accuracy": 0.08602449670433998, "num_tokens": 889178.0, "step": 510 }, { "entropy": 7.5376099109649655, "epoch": 0.04007002528690916, "grad_norm": 1.3359375, "learning_rate": 0.000257, "loss": 7.1261, "mean_token_accuracy": 0.08836784139275551, "num_tokens": 898255.0, "step": 515 }, { "entropy": 7.452177858352661, "epoch": 0.040459054658626724, "grad_norm": 1.203125, "learning_rate": 0.0002595, "loss": 7.1758, "mean_token_accuracy": 0.08208275288343429, "num_tokens": 907369.0, "step": 520 }, { "entropy": 7.568976831436157, "epoch": 0.04084808403034429, "grad_norm": 1.140625, "learning_rate": 0.000262, "loss": 7.0939, "mean_token_accuracy": 0.08972274139523506, "num_tokens": 915946.0, "step": 525 }, { "entropy": 7.516032934188843, "epoch": 0.041237113402061855, "grad_norm": 1.015625, "learning_rate": 0.00026450000000000003, "loss": 7.1498, "mean_token_accuracy": 0.084378083050251, "num_tokens": 925579.0, "step": 530 }, { "entropy": 7.533543968200684, "epoch": 0.04162614277377942, "grad_norm": 1.265625, "learning_rate": 0.00026700000000000004, "loss": 7.1322, "mean_token_accuracy": 0.07946365103125572, "num_tokens": 934732.0, "step": 535 }, { "entropy": 7.449686288833618, "epoch": 0.042015172145496986, "grad_norm": 1.0859375, "learning_rate": 0.00026950000000000005, "loss": 7.1725, "mean_token_accuracy": 0.08084325268864631, "num_tokens": 943371.0, "step": 540 }, { "entropy": 7.500879001617432, "epoch": 0.04240420151721455, "grad_norm": 1.0390625, "learning_rate": 0.00027200000000000005, "loss": 7.0484, "mean_token_accuracy": 0.0895972803235054, "num_tokens": 951977.0, "step": 545 }, { "entropy": 7.4533003807067875, "epoch": 0.04279323088893212, "grad_norm": 1.125, "learning_rate": 0.0002745, "loss": 7.0355, "mean_token_accuracy": 0.08960011452436448, "num_tokens": 960474.0, "step": 550 }, { "entropy": 7.598705387115478, "epoch": 0.04318226026064968, "grad_norm": 1.1328125, "learning_rate": 0.000277, "loss": 7.1391, "mean_token_accuracy": 0.0912420243024826, "num_tokens": 969823.0, "step": 555 }, { "entropy": 7.485738754272461, "epoch": 0.04357128963236724, "grad_norm": 1.25, "learning_rate": 0.0002795, "loss": 7.0609, "mean_token_accuracy": 0.09367068633437156, "num_tokens": 977417.0, "step": 560 }, { "entropy": 7.455179023742676, "epoch": 0.04396031900408481, "grad_norm": 1.2578125, "learning_rate": 0.00028199999999999997, "loss": 7.0682, "mean_token_accuracy": 0.0958904579281807, "num_tokens": 985519.0, "step": 565 }, { "entropy": 7.482391786575318, "epoch": 0.04434934837580237, "grad_norm": 1.4375, "learning_rate": 0.0002845, "loss": 7.0641, "mean_token_accuracy": 0.08767548501491547, "num_tokens": 994136.0, "step": 570 }, { "entropy": 7.325763988494873, "epoch": 0.04473837774751994, "grad_norm": 1.2265625, "learning_rate": 0.000287, "loss": 7.0354, "mean_token_accuracy": 0.08815001025795936, "num_tokens": 1002896.0, "step": 575 }, { "entropy": 7.49589991569519, "epoch": 0.0451274071192375, "grad_norm": 1.0546875, "learning_rate": 0.0002895, "loss": 7.1115, "mean_token_accuracy": 0.08954815194010735, "num_tokens": 1011032.0, "step": 580 }, { "entropy": 7.365485429763794, "epoch": 0.04551643649095507, "grad_norm": 1.25, "learning_rate": 0.000292, "loss": 7.0774, "mean_token_accuracy": 0.08928431719541549, "num_tokens": 1019901.0, "step": 585 }, { "entropy": 7.4467432498931885, "epoch": 0.045905465862672634, "grad_norm": 1.09375, "learning_rate": 0.0002945, "loss": 7.0539, "mean_token_accuracy": 0.0877431645989418, "num_tokens": 1029049.0, "step": 590 }, { "entropy": 7.367093896865844, "epoch": 0.0462944952343902, "grad_norm": 0.90625, "learning_rate": 0.000297, "loss": 7.0025, "mean_token_accuracy": 0.09999658241868019, "num_tokens": 1037580.0, "step": 595 }, { "entropy": 7.53356819152832, "epoch": 0.04668352460610776, "grad_norm": 0.9921875, "learning_rate": 0.0002995, "loss": 7.0789, "mean_token_accuracy": 0.09073482006788254, "num_tokens": 1045804.0, "step": 600 }, { "entropy": 7.356887912750244, "epoch": 0.047072553977825324, "grad_norm": 1.1015625, "learning_rate": 0.000302, "loss": 7.0293, "mean_token_accuracy": 0.08818676322698593, "num_tokens": 1054719.0, "step": 605 }, { "entropy": 7.446684646606445, "epoch": 0.04746158334954289, "grad_norm": 1.109375, "learning_rate": 0.0003045, "loss": 7.013, "mean_token_accuracy": 0.08933027312159539, "num_tokens": 1063373.0, "step": 610 }, { "entropy": 7.305212068557739, "epoch": 0.047850612721260455, "grad_norm": 1.1171875, "learning_rate": 0.000307, "loss": 6.9932, "mean_token_accuracy": 0.09075823351740837, "num_tokens": 1073021.0, "step": 615 }, { "entropy": 7.409698390960694, "epoch": 0.04823964209297802, "grad_norm": 1.3515625, "learning_rate": 0.0003095, "loss": 7.0495, "mean_token_accuracy": 0.08623504415154457, "num_tokens": 1081547.0, "step": 620 }, { "entropy": 7.397112703323364, "epoch": 0.048628671464695586, "grad_norm": 1.25, "learning_rate": 0.000312, "loss": 7.0104, "mean_token_accuracy": 0.08981771692633629, "num_tokens": 1090695.0, "step": 625 }, { "entropy": 7.31109766960144, "epoch": 0.04901770083641315, "grad_norm": 1.1484375, "learning_rate": 0.0003145, "loss": 6.9118, "mean_token_accuracy": 0.0954255647957325, "num_tokens": 1099563.0, "step": 630 }, { "entropy": 7.338528490066528, "epoch": 0.04940673020813072, "grad_norm": 1.4921875, "learning_rate": 0.000317, "loss": 6.9835, "mean_token_accuracy": 0.09025626108050347, "num_tokens": 1109021.0, "step": 635 }, { "entropy": 7.372527933120727, "epoch": 0.049795759579848276, "grad_norm": 1.0859375, "learning_rate": 0.0003195, "loss": 6.9745, "mean_token_accuracy": 0.09381573870778084, "num_tokens": 1118281.0, "step": 640 }, { "entropy": 7.344166088104248, "epoch": 0.05018478895156584, "grad_norm": 1.046875, "learning_rate": 0.000322, "loss": 7.0264, "mean_token_accuracy": 0.08852934762835503, "num_tokens": 1127513.0, "step": 645 }, { "entropy": 7.236174535751343, "epoch": 0.05057381832328341, "grad_norm": 1.3046875, "learning_rate": 0.00032450000000000003, "loss": 6.8914, "mean_token_accuracy": 0.09319968894124031, "num_tokens": 1136140.0, "step": 650 }, { "entropy": 7.3045234203338625, "epoch": 0.05096284769500097, "grad_norm": 1.0625, "learning_rate": 0.00032700000000000003, "loss": 6.9159, "mean_token_accuracy": 0.09398315250873565, "num_tokens": 1144297.0, "step": 655 }, { "entropy": 7.339838361740112, "epoch": 0.05135187706671854, "grad_norm": 1.2421875, "learning_rate": 0.00032950000000000004, "loss": 7.0013, "mean_token_accuracy": 0.0909078523516655, "num_tokens": 1153639.0, "step": 660 }, { "entropy": 7.2977570533752445, "epoch": 0.0517409064384361, "grad_norm": 1.0703125, "learning_rate": 0.00033200000000000005, "loss": 6.9892, "mean_token_accuracy": 0.09121011421084405, "num_tokens": 1162825.0, "step": 665 }, { "entropy": 7.272716379165649, "epoch": 0.05212993581015367, "grad_norm": 1.2578125, "learning_rate": 0.00033450000000000005, "loss": 7.0, "mean_token_accuracy": 0.0927580676972866, "num_tokens": 1171887.0, "step": 670 }, { "entropy": 7.289681434631348, "epoch": 0.052518965181871234, "grad_norm": 1.265625, "learning_rate": 0.000337, "loss": 6.9128, "mean_token_accuracy": 0.09554491266608238, "num_tokens": 1179963.0, "step": 675 }, { "entropy": 7.24162278175354, "epoch": 0.05290799455358879, "grad_norm": 1.03125, "learning_rate": 0.0003395, "loss": 6.8815, "mean_token_accuracy": 0.09879456236958503, "num_tokens": 1188408.0, "step": 680 }, { "entropy": 7.2835136413574215, "epoch": 0.05329702392530636, "grad_norm": 1.1328125, "learning_rate": 0.000342, "loss": 6.9133, "mean_token_accuracy": 0.0909463919699192, "num_tokens": 1197751.0, "step": 685 }, { "entropy": 7.258634185791015, "epoch": 0.053686053297023924, "grad_norm": 1.265625, "learning_rate": 0.00034449999999999997, "loss": 6.9544, "mean_token_accuracy": 0.09061150550842285, "num_tokens": 1207101.0, "step": 690 }, { "entropy": 7.253326082229615, "epoch": 0.05407508266874149, "grad_norm": 1.078125, "learning_rate": 0.000347, "loss": 6.9457, "mean_token_accuracy": 0.09488306194543839, "num_tokens": 1216395.0, "step": 695 }, { "entropy": 7.289101219177246, "epoch": 0.054464112040459055, "grad_norm": 1.0859375, "learning_rate": 0.0003495, "loss": 6.9216, "mean_token_accuracy": 0.09484536051750184, "num_tokens": 1225496.0, "step": 700 }, { "entropy": 7.246467351913452, "epoch": 0.05485314141217662, "grad_norm": 1.0625, "learning_rate": 0.000352, "loss": 6.9826, "mean_token_accuracy": 0.09187191799283027, "num_tokens": 1233934.0, "step": 705 }, { "entropy": 7.28291802406311, "epoch": 0.055242170783894186, "grad_norm": 1.2109375, "learning_rate": 0.0003545, "loss": 6.8526, "mean_token_accuracy": 0.10444689691066741, "num_tokens": 1242165.0, "step": 710 }, { "entropy": 7.235671281814575, "epoch": 0.05563120015561175, "grad_norm": 1.421875, "learning_rate": 0.000357, "loss": 6.9106, "mean_token_accuracy": 0.09974046424031258, "num_tokens": 1250021.0, "step": 715 }, { "entropy": 7.2171196937561035, "epoch": 0.05602022952732931, "grad_norm": 1.109375, "learning_rate": 0.0003595, "loss": 6.9197, "mean_token_accuracy": 0.09527276083827019, "num_tokens": 1258397.0, "step": 720 }, { "entropy": 7.222966718673706, "epoch": 0.056409258899046875, "grad_norm": 1.2421875, "learning_rate": 0.000362, "loss": 6.9115, "mean_token_accuracy": 0.09537832140922546, "num_tokens": 1266764.0, "step": 725 }, { "entropy": 7.289536237716675, "epoch": 0.05679828827076444, "grad_norm": 1.34375, "learning_rate": 0.0003645, "loss": 6.9214, "mean_token_accuracy": 0.09203095957636834, "num_tokens": 1275643.0, "step": 730 }, { "entropy": 7.227653741836548, "epoch": 0.057187317642482006, "grad_norm": 0.99609375, "learning_rate": 0.000367, "loss": 6.9059, "mean_token_accuracy": 0.0964889533817768, "num_tokens": 1284379.0, "step": 735 }, { "entropy": 7.118802309036255, "epoch": 0.05757634701419957, "grad_norm": 1.1953125, "learning_rate": 0.0003695, "loss": 6.7643, "mean_token_accuracy": 0.10291910842061043, "num_tokens": 1293115.0, "step": 740 }, { "entropy": 7.243952751159668, "epoch": 0.05796537638591714, "grad_norm": 1.1875, "learning_rate": 0.000372, "loss": 6.9463, "mean_token_accuracy": 0.09045971632003784, "num_tokens": 1301583.0, "step": 745 }, { "entropy": 7.1956870555877686, "epoch": 0.0583544057576347, "grad_norm": 1.0859375, "learning_rate": 0.0003745, "loss": 6.8552, "mean_token_accuracy": 0.09680608436465263, "num_tokens": 1310721.0, "step": 750 }, { "entropy": 7.304637289047241, "epoch": 0.05874343512935227, "grad_norm": 1.3671875, "learning_rate": 0.000377, "loss": 6.9913, "mean_token_accuracy": 0.0911169946193695, "num_tokens": 1319056.0, "step": 755 }, { "entropy": 7.180689954757691, "epoch": 0.059132464501069834, "grad_norm": 1.1328125, "learning_rate": 0.0003795, "loss": 6.8737, "mean_token_accuracy": 0.09462213069200516, "num_tokens": 1327259.0, "step": 760 }, { "entropy": 7.10323920249939, "epoch": 0.05952149387278739, "grad_norm": 1.0625, "learning_rate": 0.000382, "loss": 6.7893, "mean_token_accuracy": 0.09687989726662635, "num_tokens": 1335906.0, "step": 765 }, { "entropy": 7.191504859924317, "epoch": 0.05991052324450496, "grad_norm": 1.1640625, "learning_rate": 0.0003845, "loss": 6.832, "mean_token_accuracy": 0.09174941778182984, "num_tokens": 1344743.0, "step": 770 }, { "entropy": 7.170624208450318, "epoch": 0.060299552616222524, "grad_norm": 1.1796875, "learning_rate": 0.00038700000000000003, "loss": 6.8469, "mean_token_accuracy": 0.09922058656811714, "num_tokens": 1353211.0, "step": 775 }, { "entropy": 7.190778684616089, "epoch": 0.06068858198794009, "grad_norm": 1.171875, "learning_rate": 0.00038950000000000003, "loss": 6.954, "mean_token_accuracy": 0.0928943283855915, "num_tokens": 1361849.0, "step": 780 }, { "entropy": 7.262214231491089, "epoch": 0.061077611359657655, "grad_norm": 1.203125, "learning_rate": 0.00039200000000000004, "loss": 6.9363, "mean_token_accuracy": 0.09803319126367568, "num_tokens": 1369804.0, "step": 785 }, { "entropy": 7.06411600112915, "epoch": 0.06146664073137522, "grad_norm": 1.0625, "learning_rate": 0.00039450000000000005, "loss": 6.7328, "mean_token_accuracy": 0.09864451736211777, "num_tokens": 1378478.0, "step": 790 }, { "entropy": 7.197555208206177, "epoch": 0.061855670103092786, "grad_norm": 1.09375, "learning_rate": 0.00039700000000000005, "loss": 6.8123, "mean_token_accuracy": 0.10194888114929199, "num_tokens": 1387225.0, "step": 795 }, { "entropy": 7.082095813751221, "epoch": 0.06224469947481035, "grad_norm": 1.1796875, "learning_rate": 0.0003995, "loss": 6.7738, "mean_token_accuracy": 0.10356510728597641, "num_tokens": 1395338.0, "step": 800 }, { "entropy": 7.111552381515503, "epoch": 0.06263372884652792, "grad_norm": 1.0546875, "learning_rate": 0.000402, "loss": 6.7695, "mean_token_accuracy": 0.10290253907442093, "num_tokens": 1403794.0, "step": 805 }, { "entropy": 7.024047470092773, "epoch": 0.06302275821824548, "grad_norm": 0.96875, "learning_rate": 0.0004045, "loss": 6.8432, "mean_token_accuracy": 0.09563084170222283, "num_tokens": 1412522.0, "step": 810 }, { "entropy": 7.1450153350830075, "epoch": 0.06341178758996305, "grad_norm": 1.015625, "learning_rate": 0.00040699999999999997, "loss": 6.8187, "mean_token_accuracy": 0.09947089925408363, "num_tokens": 1421347.0, "step": 815 }, { "entropy": 7.098122262954712, "epoch": 0.0638008169616806, "grad_norm": 1.140625, "learning_rate": 0.0004095, "loss": 6.8049, "mean_token_accuracy": 0.10245971083641052, "num_tokens": 1429788.0, "step": 820 }, { "entropy": 7.155891752243042, "epoch": 0.06418984633339817, "grad_norm": 1.171875, "learning_rate": 0.000412, "loss": 6.8032, "mean_token_accuracy": 0.09958769977092743, "num_tokens": 1437442.0, "step": 825 }, { "entropy": 7.052066421508789, "epoch": 0.06457887570511574, "grad_norm": 1.09375, "learning_rate": 0.0004145, "loss": 6.7311, "mean_token_accuracy": 0.1029736690223217, "num_tokens": 1445604.0, "step": 830 }, { "entropy": 7.043609714508056, "epoch": 0.0649679050768333, "grad_norm": 1.1015625, "learning_rate": 0.000417, "loss": 6.7971, "mean_token_accuracy": 0.10040144473314286, "num_tokens": 1454342.0, "step": 835 }, { "entropy": 7.063785266876221, "epoch": 0.06535693444855087, "grad_norm": 1.09375, "learning_rate": 0.0004195, "loss": 6.783, "mean_token_accuracy": 0.10244178175926208, "num_tokens": 1463189.0, "step": 840 }, { "entropy": 7.155404758453369, "epoch": 0.06574596382026843, "grad_norm": 1.171875, "learning_rate": 0.000422, "loss": 6.8392, "mean_token_accuracy": 0.10035181567072868, "num_tokens": 1471608.0, "step": 845 }, { "entropy": 7.050847911834717, "epoch": 0.066134993191986, "grad_norm": 1.15625, "learning_rate": 0.0004245, "loss": 6.8413, "mean_token_accuracy": 0.09997277483344078, "num_tokens": 1480452.0, "step": 850 }, { "entropy": 7.136737203598022, "epoch": 0.06652402256370356, "grad_norm": 1.078125, "learning_rate": 0.000427, "loss": 6.7728, "mean_token_accuracy": 0.1025382250547409, "num_tokens": 1489118.0, "step": 855 }, { "entropy": 7.027253580093384, "epoch": 0.06691305193542113, "grad_norm": 1.1484375, "learning_rate": 0.0004295, "loss": 6.7729, "mean_token_accuracy": 0.10166823267936706, "num_tokens": 1498961.0, "step": 860 }, { "entropy": 7.135442447662354, "epoch": 0.06730208130713869, "grad_norm": 1.1328125, "learning_rate": 0.000432, "loss": 6.7701, "mean_token_accuracy": 0.10654019340872764, "num_tokens": 1506772.0, "step": 865 }, { "entropy": 6.916374588012696, "epoch": 0.06769111067885625, "grad_norm": 1.0859375, "learning_rate": 0.0004345, "loss": 6.6407, "mean_token_accuracy": 0.11762609407305717, "num_tokens": 1515095.0, "step": 870 }, { "entropy": 6.9736268520355225, "epoch": 0.06808014005057382, "grad_norm": 1.21875, "learning_rate": 0.000437, "loss": 6.683, "mean_token_accuracy": 0.1091225765645504, "num_tokens": 1523477.0, "step": 875 }, { "entropy": 7.0554869174957275, "epoch": 0.06846916942229138, "grad_norm": 1.015625, "learning_rate": 0.0004395, "loss": 6.7139, "mean_token_accuracy": 0.10232555940747261, "num_tokens": 1531786.0, "step": 880 }, { "entropy": 6.96433653831482, "epoch": 0.06885819879400895, "grad_norm": 1.1015625, "learning_rate": 0.000442, "loss": 6.8101, "mean_token_accuracy": 0.09944222122430801, "num_tokens": 1540737.0, "step": 885 }, { "entropy": 6.9922035217285154, "epoch": 0.06924722816572651, "grad_norm": 1.15625, "learning_rate": 0.0004445, "loss": 6.6588, "mean_token_accuracy": 0.11068925410509109, "num_tokens": 1548923.0, "step": 890 }, { "entropy": 6.973821449279785, "epoch": 0.06963625753744408, "grad_norm": 1.28125, "learning_rate": 0.000447, "loss": 6.6204, "mean_token_accuracy": 0.11367354318499565, "num_tokens": 1557043.0, "step": 895 }, { "entropy": 6.884301996231079, "epoch": 0.07002528690916164, "grad_norm": 1.234375, "learning_rate": 0.00044950000000000003, "loss": 6.676, "mean_token_accuracy": 0.11100396364927292, "num_tokens": 1564994.0, "step": 900 }, { "entropy": 6.9740638256073, "epoch": 0.0704143162808792, "grad_norm": 1.078125, "learning_rate": 0.00045200000000000004, "loss": 6.6743, "mean_token_accuracy": 0.10693940743803979, "num_tokens": 1573859.0, "step": 905 }, { "entropy": 6.9993712425231935, "epoch": 0.07080334565259677, "grad_norm": 1.03125, "learning_rate": 0.00045450000000000004, "loss": 6.6378, "mean_token_accuracy": 0.1043596014380455, "num_tokens": 1581947.0, "step": 910 }, { "entropy": 6.931872034072876, "epoch": 0.07119237502431433, "grad_norm": 1.0390625, "learning_rate": 0.00045700000000000005, "loss": 6.6297, "mean_token_accuracy": 0.10515054538846016, "num_tokens": 1589971.0, "step": 915 }, { "entropy": 6.943262052536011, "epoch": 0.0715814043960319, "grad_norm": 1.1328125, "learning_rate": 0.00045950000000000006, "loss": 6.5682, "mean_token_accuracy": 0.112590941041708, "num_tokens": 1598612.0, "step": 920 }, { "entropy": 6.923539781570435, "epoch": 0.07197043376774946, "grad_norm": 0.97265625, "learning_rate": 0.000462, "loss": 6.7038, "mean_token_accuracy": 0.10295232012867928, "num_tokens": 1607378.0, "step": 925 }, { "entropy": 6.933366394042968, "epoch": 0.07235946313946703, "grad_norm": 1.015625, "learning_rate": 0.0004645, "loss": 6.7097, "mean_token_accuracy": 0.10812588483095169, "num_tokens": 1615987.0, "step": 930 }, { "entropy": 6.845373868942261, "epoch": 0.07274849251118459, "grad_norm": 1.140625, "learning_rate": 0.000467, "loss": 6.5179, "mean_token_accuracy": 0.11268422231078148, "num_tokens": 1625366.0, "step": 935 }, { "entropy": 6.906345510482788, "epoch": 0.07313752188290217, "grad_norm": 1.09375, "learning_rate": 0.0004695, "loss": 6.684, "mean_token_accuracy": 0.10814397260546685, "num_tokens": 1633020.0, "step": 940 }, { "entropy": 6.9255390644073485, "epoch": 0.07352655125461972, "grad_norm": 1.0625, "learning_rate": 0.000472, "loss": 6.6024, "mean_token_accuracy": 0.10560433045029641, "num_tokens": 1641518.0, "step": 945 }, { "entropy": 6.891413450241089, "epoch": 0.07391558062633728, "grad_norm": 0.97265625, "learning_rate": 0.0004745, "loss": 6.665, "mean_token_accuracy": 0.10579808205366134, "num_tokens": 1650472.0, "step": 950 }, { "entropy": 6.896768856048584, "epoch": 0.07430460999805485, "grad_norm": 1.09375, "learning_rate": 0.000477, "loss": 6.6856, "mean_token_accuracy": 0.10723391622304916, "num_tokens": 1659037.0, "step": 955 }, { "entropy": 7.026918506622314, "epoch": 0.07469363936977241, "grad_norm": 1.1640625, "learning_rate": 0.0004795, "loss": 6.7696, "mean_token_accuracy": 0.10622313320636749, "num_tokens": 1667897.0, "step": 960 }, { "entropy": 6.8374017715454105, "epoch": 0.07508266874148999, "grad_norm": 1.2421875, "learning_rate": 0.000482, "loss": 6.6141, "mean_token_accuracy": 0.1083839975297451, "num_tokens": 1676535.0, "step": 965 }, { "entropy": 6.900466632843018, "epoch": 0.07547169811320754, "grad_norm": 1.1015625, "learning_rate": 0.0004845, "loss": 6.6481, "mean_token_accuracy": 0.10983363538980484, "num_tokens": 1684415.0, "step": 970 }, { "entropy": 6.9876219749450685, "epoch": 0.07586072748492512, "grad_norm": 1.078125, "learning_rate": 0.000487, "loss": 6.6023, "mean_token_accuracy": 0.11541447341442108, "num_tokens": 1692443.0, "step": 975 }, { "entropy": 6.73767499923706, "epoch": 0.07624975685664268, "grad_norm": 1.03125, "learning_rate": 0.0004895, "loss": 6.6032, "mean_token_accuracy": 0.1102523811161518, "num_tokens": 1700814.0, "step": 980 }, { "entropy": 6.8459278583526615, "epoch": 0.07663878622836025, "grad_norm": 1.0234375, "learning_rate": 0.000492, "loss": 6.4589, "mean_token_accuracy": 0.11454312652349471, "num_tokens": 1709591.0, "step": 985 }, { "entropy": 6.855618333816528, "epoch": 0.0770278156000778, "grad_norm": 0.91796875, "learning_rate": 0.0004945, "loss": 6.6899, "mean_token_accuracy": 0.10243948996067047, "num_tokens": 1718951.0, "step": 990 }, { "entropy": 7.0016392230987545, "epoch": 0.07741684497179536, "grad_norm": 1.1640625, "learning_rate": 0.000497, "loss": 6.6382, "mean_token_accuracy": 0.10815301239490509, "num_tokens": 1727481.0, "step": 995 }, { "entropy": 6.801933670043946, "epoch": 0.07780587434351294, "grad_norm": 1.078125, "learning_rate": 0.0004995, "loss": 6.6336, "mean_token_accuracy": 0.10878749638795852, "num_tokens": 1736985.0, "step": 1000 }, { "entropy": 6.949926328659058, "epoch": 0.0781949037152305, "grad_norm": 1.0234375, "learning_rate": 0.0004999999989075146, "loss": 6.6868, "mean_token_accuracy": 0.10359607338905334, "num_tokens": 1745470.0, "step": 1005 }, { "entropy": 6.897040796279907, "epoch": 0.07858393308694807, "grad_norm": 1.234375, "learning_rate": 0.0004999999944692927, "loss": 6.629, "mean_token_accuracy": 0.10731491297483445, "num_tokens": 1754185.0, "step": 1010 }, { "entropy": 6.833609628677368, "epoch": 0.07897296245866563, "grad_norm": 1.1484375, "learning_rate": 0.000499999986617054, "loss": 6.6342, "mean_token_accuracy": 0.10663639605045319, "num_tokens": 1762100.0, "step": 1015 }, { "entropy": 6.971498203277588, "epoch": 0.0793619918303832, "grad_norm": 1.0703125, "learning_rate": 0.0004999999753507986, "loss": 6.6379, "mean_token_accuracy": 0.10761738270521164, "num_tokens": 1771070.0, "step": 1020 }, { "entropy": 6.819230461120606, "epoch": 0.07975102120210076, "grad_norm": 0.99609375, "learning_rate": 0.0004999999606705267, "loss": 6.6338, "mean_token_accuracy": 0.10975765809416771, "num_tokens": 1780085.0, "step": 1025 }, { "entropy": 6.906311321258545, "epoch": 0.08014005057381832, "grad_norm": 1.0234375, "learning_rate": 0.0004999999425762385, "loss": 6.6172, "mean_token_accuracy": 0.113339963555336, "num_tokens": 1789316.0, "step": 1030 }, { "entropy": 6.783714866638183, "epoch": 0.08052907994553589, "grad_norm": 1.0234375, "learning_rate": 0.0004999999210679344, "loss": 6.5369, "mean_token_accuracy": 0.112546556442976, "num_tokens": 1797975.0, "step": 1035 }, { "entropy": 6.838487339019776, "epoch": 0.08091810931725345, "grad_norm": 0.98046875, "learning_rate": 0.0004999998961456145, "loss": 6.6393, "mean_token_accuracy": 0.11156408786773682, "num_tokens": 1806129.0, "step": 1040 }, { "entropy": 6.908475303649903, "epoch": 0.08130713868897102, "grad_norm": 1.078125, "learning_rate": 0.0004999998678092794, "loss": 6.6392, "mean_token_accuracy": 0.11067313626408577, "num_tokens": 1813956.0, "step": 1045 }, { "entropy": 6.9355841159820555, "epoch": 0.08169616806068858, "grad_norm": 1.03125, "learning_rate": 0.0004999998360589293, "loss": 6.6473, "mean_token_accuracy": 0.11026927605271339, "num_tokens": 1822572.0, "step": 1050 }, { "entropy": 6.757045555114746, "epoch": 0.08208519743240615, "grad_norm": 0.99609375, "learning_rate": 0.000499999800894565, "loss": 6.5619, "mean_token_accuracy": 0.11012868583202362, "num_tokens": 1831870.0, "step": 1055 }, { "entropy": 6.749943971633911, "epoch": 0.08247422680412371, "grad_norm": 1.109375, "learning_rate": 0.0004999997623161866, "loss": 6.593, "mean_token_accuracy": 0.10753906518220901, "num_tokens": 1840414.0, "step": 1060 }, { "entropy": 6.898047304153442, "epoch": 0.08286325617584128, "grad_norm": 1.109375, "learning_rate": 0.0004999997203237951, "loss": 6.6142, "mean_token_accuracy": 0.10993773117661476, "num_tokens": 1850385.0, "step": 1065 }, { "entropy": 6.692205476760864, "epoch": 0.08325228554755884, "grad_norm": 1.0546875, "learning_rate": 0.000499999674917391, "loss": 6.5192, "mean_token_accuracy": 0.12006976082921028, "num_tokens": 1858479.0, "step": 1070 }, { "entropy": 6.8471941471099855, "epoch": 0.0836413149192764, "grad_norm": 0.984375, "learning_rate": 0.0004999996260969748, "loss": 6.5988, "mean_token_accuracy": 0.10776122882962227, "num_tokens": 1867357.0, "step": 1075 }, { "entropy": 6.78913459777832, "epoch": 0.08403034429099397, "grad_norm": 1.0546875, "learning_rate": 0.0004999995738625475, "loss": 6.5436, "mean_token_accuracy": 0.10430336892604827, "num_tokens": 1876211.0, "step": 1080 }, { "entropy": 6.690899896621704, "epoch": 0.08441937366271153, "grad_norm": 1.0625, "learning_rate": 0.0004999995182141099, "loss": 6.4663, "mean_token_accuracy": 0.10824713706970215, "num_tokens": 1884301.0, "step": 1085 }, { "entropy": 6.911795234680175, "epoch": 0.0848084030344291, "grad_norm": 1.0625, "learning_rate": 0.0004999994591516626, "loss": 6.622, "mean_token_accuracy": 0.11672904044389724, "num_tokens": 1893191.0, "step": 1090 }, { "entropy": 6.69744906425476, "epoch": 0.08519743240614666, "grad_norm": 1.03125, "learning_rate": 0.0004999993966752066, "loss": 6.4871, "mean_token_accuracy": 0.11046854481101036, "num_tokens": 1901434.0, "step": 1095 }, { "entropy": 6.7617669105529785, "epoch": 0.08558646177786423, "grad_norm": 1.0546875, "learning_rate": 0.000499999330784743, "loss": 6.4873, "mean_token_accuracy": 0.1202208161354065, "num_tokens": 1910054.0, "step": 1100 }, { "entropy": 6.82279953956604, "epoch": 0.08597549114958179, "grad_norm": 1.03125, "learning_rate": 0.0004999992614802725, "loss": 6.6178, "mean_token_accuracy": 0.11331576108932495, "num_tokens": 1918607.0, "step": 1105 }, { "entropy": 6.74808177947998, "epoch": 0.08636452052129936, "grad_norm": 0.9453125, "learning_rate": 0.0004999991887617966, "loss": 6.5604, "mean_token_accuracy": 0.11329781040549278, "num_tokens": 1927610.0, "step": 1110 }, { "entropy": 6.721193456649781, "epoch": 0.08675354989301692, "grad_norm": 1.1796875, "learning_rate": 0.0004999991126293158, "loss": 6.5076, "mean_token_accuracy": 0.11460185199975967, "num_tokens": 1936174.0, "step": 1115 }, { "entropy": 6.726939487457275, "epoch": 0.08714257926473448, "grad_norm": 1.03125, "learning_rate": 0.0004999990330828318, "loss": 6.437, "mean_token_accuracy": 0.12100310698151588, "num_tokens": 1944228.0, "step": 1120 }, { "entropy": 6.830557537078858, "epoch": 0.08753160863645205, "grad_norm": 1.0234375, "learning_rate": 0.0004999989501223456, "loss": 6.5437, "mean_token_accuracy": 0.11512776464223862, "num_tokens": 1953144.0, "step": 1125 }, { "entropy": 6.717128944396973, "epoch": 0.08792063800816961, "grad_norm": 1.140625, "learning_rate": 0.0004999988637478584, "loss": 6.5947, "mean_token_accuracy": 0.11105897948145867, "num_tokens": 1961947.0, "step": 1130 }, { "entropy": 6.843059253692627, "epoch": 0.08830966737988719, "grad_norm": 1.0234375, "learning_rate": 0.0004999987739593716, "loss": 6.5708, "mean_token_accuracy": 0.11229311525821686, "num_tokens": 1970674.0, "step": 1135 }, { "entropy": 6.781560564041138, "epoch": 0.08869869675160474, "grad_norm": 1.0625, "learning_rate": 0.0004999986807568865, "loss": 6.5356, "mean_token_accuracy": 0.11566499695181846, "num_tokens": 1979173.0, "step": 1140 }, { "entropy": 6.708818435668945, "epoch": 0.08908772612332232, "grad_norm": 1.0234375, "learning_rate": 0.0004999985841404045, "loss": 6.5334, "mean_token_accuracy": 0.11458146646618843, "num_tokens": 1988134.0, "step": 1145 }, { "entropy": 6.784994983673096, "epoch": 0.08947675549503988, "grad_norm": 0.95703125, "learning_rate": 0.0004999984841099271, "loss": 6.4755, "mean_token_accuracy": 0.11356236785650253, "num_tokens": 1996977.0, "step": 1150 }, { "entropy": 6.741352796554565, "epoch": 0.08986578486675743, "grad_norm": 0.95703125, "learning_rate": 0.000499998380665456, "loss": 6.5366, "mean_token_accuracy": 0.11298326328396797, "num_tokens": 2005946.0, "step": 1155 }, { "entropy": 6.695943164825439, "epoch": 0.090254814238475, "grad_norm": 1.1484375, "learning_rate": 0.0004999982738069924, "loss": 6.3749, "mean_token_accuracy": 0.11534976065158845, "num_tokens": 2014882.0, "step": 1160 }, { "entropy": 6.682829093933106, "epoch": 0.09064384361019256, "grad_norm": 1.109375, "learning_rate": 0.0004999981635345382, "loss": 6.5476, "mean_token_accuracy": 0.11290719136595725, "num_tokens": 2024858.0, "step": 1165 }, { "entropy": 6.672901630401611, "epoch": 0.09103287298191014, "grad_norm": 1.1796875, "learning_rate": 0.0004999980498480949, "loss": 6.466, "mean_token_accuracy": 0.11438599750399589, "num_tokens": 2034072.0, "step": 1170 }, { "entropy": 6.712941026687622, "epoch": 0.0914219023536277, "grad_norm": 1.0390625, "learning_rate": 0.0004999979327476644, "loss": 6.4753, "mean_token_accuracy": 0.11522193774580955, "num_tokens": 2042649.0, "step": 1175 }, { "entropy": 6.714944648742676, "epoch": 0.09181093172534527, "grad_norm": 1.0546875, "learning_rate": 0.0004999978122332485, "loss": 6.4979, "mean_token_accuracy": 0.11657196953892708, "num_tokens": 2050866.0, "step": 1180 }, { "entropy": 6.751889419555664, "epoch": 0.09219996109706283, "grad_norm": 1.0625, "learning_rate": 0.0004999976883048487, "loss": 6.4984, "mean_token_accuracy": 0.1147743172943592, "num_tokens": 2058914.0, "step": 1185 }, { "entropy": 6.674278974533081, "epoch": 0.0925889904687804, "grad_norm": 1.1328125, "learning_rate": 0.0004999975609624673, "loss": 6.4469, "mean_token_accuracy": 0.11601505503058433, "num_tokens": 2068098.0, "step": 1190 }, { "entropy": 6.666662788391113, "epoch": 0.09297801984049796, "grad_norm": 0.96484375, "learning_rate": 0.0004999974302061059, "loss": 6.4465, "mean_token_accuracy": 0.11012001484632492, "num_tokens": 2077299.0, "step": 1195 }, { "entropy": 6.718023204803467, "epoch": 0.09336704921221552, "grad_norm": 1.125, "learning_rate": 0.0004999972960357666, "loss": 6.5418, "mean_token_accuracy": 0.11328572109341621, "num_tokens": 2087868.0, "step": 1200 }, { "entropy": 6.68776216506958, "epoch": 0.09375607858393309, "grad_norm": 1.0, "learning_rate": 0.0004999971584514516, "loss": 6.4704, "mean_token_accuracy": 0.12280796691775323, "num_tokens": 2096553.0, "step": 1205 }, { "entropy": 6.763374853134155, "epoch": 0.09414510795565065, "grad_norm": 1.0234375, "learning_rate": 0.0004999970174531627, "loss": 6.4254, "mean_token_accuracy": 0.11939279362559319, "num_tokens": 2104809.0, "step": 1210 }, { "entropy": 6.544530963897705, "epoch": 0.09453413732736822, "grad_norm": 1.0078125, "learning_rate": 0.0004999968730409022, "loss": 6.4114, "mean_token_accuracy": 0.11297131180763245, "num_tokens": 2113869.0, "step": 1215 }, { "entropy": 6.637964534759521, "epoch": 0.09492316669908578, "grad_norm": 1.0, "learning_rate": 0.0004999967252146723, "loss": 6.245, "mean_token_accuracy": 0.1171722136437893, "num_tokens": 2121749.0, "step": 1220 }, { "entropy": 6.630059051513672, "epoch": 0.09531219607080335, "grad_norm": 0.98046875, "learning_rate": 0.0004999965739744752, "loss": 6.4551, "mean_token_accuracy": 0.11625204831361771, "num_tokens": 2130828.0, "step": 1225 }, { "entropy": 6.729389619827271, "epoch": 0.09570122544252091, "grad_norm": 1.046875, "learning_rate": 0.0004999964193203132, "loss": 6.4343, "mean_token_accuracy": 0.11840956956148148, "num_tokens": 2138928.0, "step": 1230 }, { "entropy": 6.677809381484986, "epoch": 0.09609025481423847, "grad_norm": 0.94921875, "learning_rate": 0.0004999962612521888, "loss": 6.4553, "mean_token_accuracy": 0.11565364599227905, "num_tokens": 2147643.0, "step": 1235 }, { "entropy": 6.696507167816162, "epoch": 0.09647928418595604, "grad_norm": 0.8984375, "learning_rate": 0.0004999960997701041, "loss": 6.3968, "mean_token_accuracy": 0.1201579064130783, "num_tokens": 2156766.0, "step": 1240 }, { "entropy": 6.621823453903199, "epoch": 0.0968683135576736, "grad_norm": 0.9609375, "learning_rate": 0.0004999959348740618, "loss": 6.4417, "mean_token_accuracy": 0.11661816611886025, "num_tokens": 2165517.0, "step": 1245 }, { "entropy": 6.576675033569336, "epoch": 0.09725734292939117, "grad_norm": 1.046875, "learning_rate": 0.0004999957665640641, "loss": 6.3206, "mean_token_accuracy": 0.12200571298599243, "num_tokens": 2174812.0, "step": 1250 }, { "entropy": 6.646194124221802, "epoch": 0.09764637230110873, "grad_norm": 1.0078125, "learning_rate": 0.000499995594840114, "loss": 6.4638, "mean_token_accuracy": 0.12040529623627663, "num_tokens": 2183968.0, "step": 1255 }, { "entropy": 6.681028127670288, "epoch": 0.0980354016728263, "grad_norm": 1.1875, "learning_rate": 0.0004999954197022138, "loss": 6.4909, "mean_token_accuracy": 0.1184639185667038, "num_tokens": 2191947.0, "step": 1260 }, { "entropy": 6.642876625061035, "epoch": 0.09842443104454386, "grad_norm": 1.0234375, "learning_rate": 0.0004999952411503661, "loss": 6.3293, "mean_token_accuracy": 0.12336919456720352, "num_tokens": 2199951.0, "step": 1265 }, { "entropy": 6.591861581802368, "epoch": 0.09881346041626143, "grad_norm": 1.09375, "learning_rate": 0.0004999950591845738, "loss": 6.4673, "mean_token_accuracy": 0.11935944855213165, "num_tokens": 2208714.0, "step": 1270 }, { "entropy": 6.581157541275024, "epoch": 0.09920248978797899, "grad_norm": 0.95703125, "learning_rate": 0.0004999948738048397, "loss": 6.3282, "mean_token_accuracy": 0.11878729537129402, "num_tokens": 2217250.0, "step": 1275 }, { "entropy": 6.7235880374908445, "epoch": 0.09959151915969655, "grad_norm": 1.078125, "learning_rate": 0.0004999946850111663, "loss": 6.3894, "mean_token_accuracy": 0.12055943980813026, "num_tokens": 2225468.0, "step": 1280 }, { "entropy": 6.508683109283448, "epoch": 0.09998054853141412, "grad_norm": 1.046875, "learning_rate": 0.0004999944928035569, "loss": 6.3437, "mean_token_accuracy": 0.12606204822659492, "num_tokens": 2233893.0, "step": 1285 }, { "entropy": 6.760361814498902, "epoch": 0.10036957790313168, "grad_norm": 1.0390625, "learning_rate": 0.000499994297182014, "loss": 6.4239, "mean_token_accuracy": 0.11900506541132927, "num_tokens": 2242487.0, "step": 1290 }, { "entropy": 6.464075803756714, "epoch": 0.10075860727484925, "grad_norm": 1.03125, "learning_rate": 0.0004999940981465408, "loss": 6.2418, "mean_token_accuracy": 0.12773674577474595, "num_tokens": 2250518.0, "step": 1295 }, { "entropy": 6.635386562347412, "epoch": 0.10114763664656681, "grad_norm": 1.03125, "learning_rate": 0.0004999938956971404, "loss": 6.4266, "mean_token_accuracy": 0.11632013618946076, "num_tokens": 2259024.0, "step": 1300 }, { "entropy": 6.615658807754516, "epoch": 0.10153666601828439, "grad_norm": 0.9765625, "learning_rate": 0.0004999936898338156, "loss": 6.4632, "mean_token_accuracy": 0.11199147924780846, "num_tokens": 2267832.0, "step": 1305 }, { "entropy": 6.635924625396728, "epoch": 0.10192569539000194, "grad_norm": 1.0234375, "learning_rate": 0.0004999934805565698, "loss": 6.5261, "mean_token_accuracy": 0.11091560125350952, "num_tokens": 2276834.0, "step": 1310 }, { "entropy": 6.73242449760437, "epoch": 0.10231472476171952, "grad_norm": 0.95703125, "learning_rate": 0.000499993267865406, "loss": 6.4461, "mean_token_accuracy": 0.11519345194101334, "num_tokens": 2285736.0, "step": 1315 }, { "entropy": 6.697244501113891, "epoch": 0.10270375413343708, "grad_norm": 0.95703125, "learning_rate": 0.0004999930517603275, "loss": 6.4108, "mean_token_accuracy": 0.1263464353978634, "num_tokens": 2294177.0, "step": 1320 }, { "entropy": 6.468812894821167, "epoch": 0.10309278350515463, "grad_norm": 1.0625, "learning_rate": 0.0004999928322413374, "loss": 6.1839, "mean_token_accuracy": 0.12833936586976052, "num_tokens": 2302784.0, "step": 1325 }, { "entropy": 6.505994129180908, "epoch": 0.1034818128768722, "grad_norm": 0.9921875, "learning_rate": 0.0004999926093084394, "loss": 6.2968, "mean_token_accuracy": 0.12245660051703453, "num_tokens": 2311650.0, "step": 1330 }, { "entropy": 6.66971116065979, "epoch": 0.10387084224858976, "grad_norm": 0.99609375, "learning_rate": 0.0004999923829616365, "loss": 6.3996, "mean_token_accuracy": 0.11883401051163674, "num_tokens": 2319828.0, "step": 1335 }, { "entropy": 6.553110504150391, "epoch": 0.10425987162030734, "grad_norm": 1.046875, "learning_rate": 0.0004999921532009323, "loss": 6.416, "mean_token_accuracy": 0.11476577743887902, "num_tokens": 2328636.0, "step": 1340 }, { "entropy": 6.5455653190612795, "epoch": 0.1046489009920249, "grad_norm": 1.0859375, "learning_rate": 0.0004999919200263304, "loss": 6.2977, "mean_token_accuracy": 0.12469864264130592, "num_tokens": 2336771.0, "step": 1345 }, { "entropy": 6.624483728408814, "epoch": 0.10503793036374247, "grad_norm": 0.984375, "learning_rate": 0.0004999916834378342, "loss": 6.4529, "mean_token_accuracy": 0.11439902409911155, "num_tokens": 2346106.0, "step": 1350 }, { "entropy": 6.588077735900879, "epoch": 0.10542695973546003, "grad_norm": 1.03125, "learning_rate": 0.0004999914434354472, "loss": 6.4435, "mean_token_accuracy": 0.11157507598400115, "num_tokens": 2354943.0, "step": 1355 }, { "entropy": 6.484687662124633, "epoch": 0.10581598910717759, "grad_norm": 0.984375, "learning_rate": 0.0004999912000191733, "loss": 6.3291, "mean_token_accuracy": 0.12155802845954895, "num_tokens": 2363699.0, "step": 1360 }, { "entropy": 6.56774754524231, "epoch": 0.10620501847889516, "grad_norm": 0.94921875, "learning_rate": 0.000499990953189016, "loss": 6.4607, "mean_token_accuracy": 0.11734867691993714, "num_tokens": 2373316.0, "step": 1365 }, { "entropy": 6.792719316482544, "epoch": 0.10659404785061272, "grad_norm": 0.984375, "learning_rate": 0.0004999907029449791, "loss": 6.5466, "mean_token_accuracy": 0.1130414329469204, "num_tokens": 2381550.0, "step": 1370 }, { "entropy": 6.568495798110962, "epoch": 0.10698307722233029, "grad_norm": 0.9609375, "learning_rate": 0.0004999904492870663, "loss": 6.3407, "mean_token_accuracy": 0.12280402705073357, "num_tokens": 2389546.0, "step": 1375 }, { "entropy": 6.602413702011108, "epoch": 0.10737210659404785, "grad_norm": 1.0546875, "learning_rate": 0.0004999901922152816, "loss": 6.3119, "mean_token_accuracy": 0.12875628471374512, "num_tokens": 2398852.0, "step": 1380 }, { "entropy": 6.514067602157593, "epoch": 0.10776113596576542, "grad_norm": 0.99609375, "learning_rate": 0.0004999899317296288, "loss": 6.4055, "mean_token_accuracy": 0.11861231550574303, "num_tokens": 2407815.0, "step": 1385 }, { "entropy": 6.577896213531494, "epoch": 0.10815016533748298, "grad_norm": 0.953125, "learning_rate": 0.0004999896678301121, "loss": 6.2648, "mean_token_accuracy": 0.12172571048140526, "num_tokens": 2417300.0, "step": 1390 }, { "entropy": 6.5998763084411625, "epoch": 0.10853919470920055, "grad_norm": 0.9921875, "learning_rate": 0.0004999894005167352, "loss": 6.4098, "mean_token_accuracy": 0.12156257852911949, "num_tokens": 2426257.0, "step": 1395 }, { "entropy": 6.676355028152466, "epoch": 0.10892822408091811, "grad_norm": 0.98046875, "learning_rate": 0.000499989129789502, "loss": 6.4257, "mean_token_accuracy": 0.1204957626760006, "num_tokens": 2434595.0, "step": 1400 }, { "entropy": 6.654974126815796, "epoch": 0.10931725345263567, "grad_norm": 0.953125, "learning_rate": 0.0004999888556484172, "loss": 6.4462, "mean_token_accuracy": 0.11929797455668449, "num_tokens": 2443945.0, "step": 1405 }, { "entropy": 6.505768489837647, "epoch": 0.10970628282435324, "grad_norm": 1.0234375, "learning_rate": 0.0004999885780934845, "loss": 6.3098, "mean_token_accuracy": 0.12298460751771927, "num_tokens": 2453141.0, "step": 1410 }, { "entropy": 6.586579370498657, "epoch": 0.1100953121960708, "grad_norm": 0.98046875, "learning_rate": 0.0004999882971247081, "loss": 6.3959, "mean_token_accuracy": 0.11581015586853027, "num_tokens": 2461873.0, "step": 1415 }, { "entropy": 6.595294094085693, "epoch": 0.11048434156778837, "grad_norm": 1.0390625, "learning_rate": 0.0004999880127420926, "loss": 6.4179, "mean_token_accuracy": 0.11764904409646988, "num_tokens": 2471238.0, "step": 1420 }, { "entropy": 6.5501360416412355, "epoch": 0.11087337093950593, "grad_norm": 1.078125, "learning_rate": 0.0004999877249456421, "loss": 6.2916, "mean_token_accuracy": 0.1313754253089428, "num_tokens": 2479412.0, "step": 1425 }, { "entropy": 6.429438781738281, "epoch": 0.1112624003112235, "grad_norm": 1.015625, "learning_rate": 0.0004999874337353609, "loss": 6.2078, "mean_token_accuracy": 0.1259915679693222, "num_tokens": 2488150.0, "step": 1430 }, { "entropy": 6.529017305374145, "epoch": 0.11165142968294106, "grad_norm": 0.953125, "learning_rate": 0.0004999871391112535, "loss": 6.3654, "mean_token_accuracy": 0.1272561579942703, "num_tokens": 2498103.0, "step": 1435 }, { "entropy": 6.49380464553833, "epoch": 0.11204045905465862, "grad_norm": 0.98046875, "learning_rate": 0.0004999868410733244, "loss": 6.2319, "mean_token_accuracy": 0.1280946686863899, "num_tokens": 2506211.0, "step": 1440 }, { "entropy": 6.4133141994476315, "epoch": 0.11242948842637619, "grad_norm": 0.98046875, "learning_rate": 0.000499986539621578, "loss": 6.2552, "mean_token_accuracy": 0.1278551071882248, "num_tokens": 2514743.0, "step": 1445 }, { "entropy": 6.430079650878906, "epoch": 0.11281851779809375, "grad_norm": 0.9140625, "learning_rate": 0.0004999862347560191, "loss": 6.2533, "mean_token_accuracy": 0.12282558158040047, "num_tokens": 2523824.0, "step": 1450 }, { "entropy": 6.598657894134521, "epoch": 0.11320754716981132, "grad_norm": 0.90625, "learning_rate": 0.0004999859264766521, "loss": 6.3219, "mean_token_accuracy": 0.12097884491086006, "num_tokens": 2532360.0, "step": 1455 }, { "entropy": 6.540658664703369, "epoch": 0.11359657654152888, "grad_norm": 0.9765625, "learning_rate": 0.0004999856147834817, "loss": 6.2807, "mean_token_accuracy": 0.13108301162719727, "num_tokens": 2540547.0, "step": 1460 }, { "entropy": 6.4696839332580565, "epoch": 0.11398560591324645, "grad_norm": 1.03125, "learning_rate": 0.0004999852996765129, "loss": 6.3052, "mean_token_accuracy": 0.12217096462845803, "num_tokens": 2549193.0, "step": 1465 }, { "entropy": 6.500145196914673, "epoch": 0.11437463528496401, "grad_norm": 0.97265625, "learning_rate": 0.0004999849811557502, "loss": 6.3173, "mean_token_accuracy": 0.11922707110643387, "num_tokens": 2557553.0, "step": 1470 }, { "entropy": 6.638996171951294, "epoch": 0.11476366465668159, "grad_norm": 1.015625, "learning_rate": 0.0004999846592211984, "loss": 6.4043, "mean_token_accuracy": 0.1211747631430626, "num_tokens": 2565945.0, "step": 1475 }, { "entropy": 6.573302364349365, "epoch": 0.11515269402839914, "grad_norm": 1.0703125, "learning_rate": 0.0004999843338728626, "loss": 6.2786, "mean_token_accuracy": 0.11536813229322433, "num_tokens": 2574364.0, "step": 1480 }, { "entropy": 6.438839960098266, "epoch": 0.1155417234001167, "grad_norm": 0.921875, "learning_rate": 0.0004999840051107476, "loss": 6.2133, "mean_token_accuracy": 0.12060227617621422, "num_tokens": 2582825.0, "step": 1485 }, { "entropy": 6.600337505340576, "epoch": 0.11593075277183428, "grad_norm": 1.0625, "learning_rate": 0.0004999836729348584, "loss": 6.3589, "mean_token_accuracy": 0.12052287831902504, "num_tokens": 2591628.0, "step": 1490 }, { "entropy": 6.495076751708984, "epoch": 0.11631978214355183, "grad_norm": 0.984375, "learning_rate": 0.0004999833373452, "loss": 6.3561, "mean_token_accuracy": 0.1171538695693016, "num_tokens": 2600436.0, "step": 1495 }, { "entropy": 6.521013927459717, "epoch": 0.1167088115152694, "grad_norm": 1.1015625, "learning_rate": 0.0004999829983417778, "loss": 6.299, "mean_token_accuracy": 0.12321334183216096, "num_tokens": 2609709.0, "step": 1500 }, { "entropy": 6.610712099075317, "epoch": 0.11709784088698696, "grad_norm": 0.98046875, "learning_rate": 0.0004999826559245965, "loss": 6.3006, "mean_token_accuracy": 0.12215944081544876, "num_tokens": 2617992.0, "step": 1505 }, { "entropy": 6.396210336685181, "epoch": 0.11748687025870454, "grad_norm": 0.90234375, "learning_rate": 0.0004999823100936615, "loss": 6.2158, "mean_token_accuracy": 0.12474563270807267, "num_tokens": 2626706.0, "step": 1510 }, { "entropy": 6.615616989135742, "epoch": 0.1178758996304221, "grad_norm": 1.0859375, "learning_rate": 0.0004999819608489781, "loss": 6.287, "mean_token_accuracy": 0.12880871593952178, "num_tokens": 2634642.0, "step": 1515 }, { "entropy": 6.544697713851929, "epoch": 0.11826492900213967, "grad_norm": 1.0078125, "learning_rate": 0.0004999816081905515, "loss": 6.3346, "mean_token_accuracy": 0.11531090214848519, "num_tokens": 2644160.0, "step": 1520 }, { "entropy": 6.434164953231812, "epoch": 0.11865395837385723, "grad_norm": 1.015625, "learning_rate": 0.0004999812521183872, "loss": 6.2948, "mean_token_accuracy": 0.11871815845370293, "num_tokens": 2653390.0, "step": 1525 }, { "entropy": 6.589237403869629, "epoch": 0.11904298774557479, "grad_norm": 0.99609375, "learning_rate": 0.0004999808926324903, "loss": 6.3435, "mean_token_accuracy": 0.12100820019841194, "num_tokens": 2662561.0, "step": 1530 }, { "entropy": 6.478472805023193, "epoch": 0.11943201711729236, "grad_norm": 1.0859375, "learning_rate": 0.0004999805297328665, "loss": 6.3086, "mean_token_accuracy": 0.11910761371254922, "num_tokens": 2670694.0, "step": 1535 }, { "entropy": 6.46109447479248, "epoch": 0.11982104648900992, "grad_norm": 1.0078125, "learning_rate": 0.0004999801634195214, "loss": 6.1965, "mean_token_accuracy": 0.12499032095074654, "num_tokens": 2679583.0, "step": 1540 }, { "entropy": 6.4330726146698, "epoch": 0.12021007586072749, "grad_norm": 0.99609375, "learning_rate": 0.0004999797936924603, "loss": 6.1847, "mean_token_accuracy": 0.13039473071694374, "num_tokens": 2688429.0, "step": 1545 }, { "entropy": 6.5682470321655275, "epoch": 0.12059910523244505, "grad_norm": 0.9921875, "learning_rate": 0.000499979420551689, "loss": 6.258, "mean_token_accuracy": 0.12565399780869485, "num_tokens": 2697134.0, "step": 1550 }, { "entropy": 6.446918916702271, "epoch": 0.12098813460416262, "grad_norm": 0.94140625, "learning_rate": 0.000499979043997213, "loss": 6.4093, "mean_token_accuracy": 0.11900994554162025, "num_tokens": 2705641.0, "step": 1555 }, { "entropy": 6.5380446434021, "epoch": 0.12137716397588018, "grad_norm": 0.90625, "learning_rate": 0.0004999786640290381, "loss": 6.333, "mean_token_accuracy": 0.1262545704841614, "num_tokens": 2714977.0, "step": 1560 }, { "entropy": 6.517403984069825, "epoch": 0.12176619334759774, "grad_norm": 1.03125, "learning_rate": 0.0004999782806471701, "loss": 6.1801, "mean_token_accuracy": 0.13938897997140884, "num_tokens": 2723120.0, "step": 1565 }, { "entropy": 6.311800098419189, "epoch": 0.12215522271931531, "grad_norm": 1.0234375, "learning_rate": 0.0004999778938516147, "loss": 6.1791, "mean_token_accuracy": 0.1359429642558098, "num_tokens": 2731964.0, "step": 1570 }, { "entropy": 6.646980047225952, "epoch": 0.12254425209103287, "grad_norm": 0.9609375, "learning_rate": 0.000499977503642378, "loss": 6.2559, "mean_token_accuracy": 0.1213235966861248, "num_tokens": 2741537.0, "step": 1575 }, { "entropy": 6.3805046558380125, "epoch": 0.12293328146275044, "grad_norm": 0.94140625, "learning_rate": 0.0004999771100194656, "loss": 6.3638, "mean_token_accuracy": 0.12285436391830444, "num_tokens": 2751522.0, "step": 1580 }, { "entropy": 6.59956202507019, "epoch": 0.123322310834468, "grad_norm": 0.96875, "learning_rate": 0.0004999767129828837, "loss": 6.3669, "mean_token_accuracy": 0.11640789434313774, "num_tokens": 2761100.0, "step": 1585 }, { "entropy": 6.441359281539917, "epoch": 0.12371134020618557, "grad_norm": 1.03125, "learning_rate": 0.0004999763125326383, "loss": 6.2932, "mean_token_accuracy": 0.1239714004099369, "num_tokens": 2769171.0, "step": 1590 }, { "entropy": 6.480400943756104, "epoch": 0.12410036957790313, "grad_norm": 1.046875, "learning_rate": 0.0004999759086687355, "loss": 6.2306, "mean_token_accuracy": 0.12737515345215797, "num_tokens": 2778021.0, "step": 1595 }, { "entropy": 6.3953241348266605, "epoch": 0.1244893989496207, "grad_norm": 0.9609375, "learning_rate": 0.0004999755013911813, "loss": 6.1706, "mean_token_accuracy": 0.12780368328094482, "num_tokens": 2787206.0, "step": 1600 }, { "entropy": 6.448420667648316, "epoch": 0.12487842832133826, "grad_norm": 0.953125, "learning_rate": 0.000499975090699982, "loss": 6.2372, "mean_token_accuracy": 0.12469636872410775, "num_tokens": 2796051.0, "step": 1605 }, { "entropy": 6.501862096786499, "epoch": 0.12526745769305583, "grad_norm": 0.90625, "learning_rate": 0.0004999746765951438, "loss": 6.1934, "mean_token_accuracy": 0.12748273462057114, "num_tokens": 2804961.0, "step": 1610 }, { "entropy": 6.395801019668579, "epoch": 0.1256564870647734, "grad_norm": 1.03125, "learning_rate": 0.0004999742590766729, "loss": 6.1504, "mean_token_accuracy": 0.12995274290442466, "num_tokens": 2813691.0, "step": 1615 }, { "entropy": 6.438721466064453, "epoch": 0.12604551643649095, "grad_norm": 1.0078125, "learning_rate": 0.0004999738381445757, "loss": 6.2961, "mean_token_accuracy": 0.12733198031783105, "num_tokens": 2822248.0, "step": 1620 }, { "entropy": 6.4921409606933596, "epoch": 0.1264345458082085, "grad_norm": 0.94921875, "learning_rate": 0.0004999734137988586, "loss": 6.2473, "mean_token_accuracy": 0.12927133068442345, "num_tokens": 2830826.0, "step": 1625 }, { "entropy": 6.472244501113892, "epoch": 0.1268235751799261, "grad_norm": 1.0390625, "learning_rate": 0.000499972986039528, "loss": 6.2285, "mean_token_accuracy": 0.1285054236650467, "num_tokens": 2839766.0, "step": 1630 }, { "entropy": 6.295017290115356, "epoch": 0.12721260455164365, "grad_norm": 0.90234375, "learning_rate": 0.0004999725548665904, "loss": 6.1702, "mean_token_accuracy": 0.13327566310763359, "num_tokens": 2848728.0, "step": 1635 }, { "entropy": 6.369825220108032, "epoch": 0.1276016339233612, "grad_norm": 1.03125, "learning_rate": 0.0004999721202800524, "loss": 6.1868, "mean_token_accuracy": 0.13074957728385925, "num_tokens": 2857221.0, "step": 1640 }, { "entropy": 6.546764755249024, "epoch": 0.12799066329507877, "grad_norm": 0.98046875, "learning_rate": 0.0004999716822799206, "loss": 6.2481, "mean_token_accuracy": 0.13030916303396226, "num_tokens": 2865314.0, "step": 1645 }, { "entropy": 6.320151281356812, "epoch": 0.12837969266679633, "grad_norm": 1.0625, "learning_rate": 0.0004999712408662016, "loss": 6.1424, "mean_token_accuracy": 0.12682838290929793, "num_tokens": 2873654.0, "step": 1650 }, { "entropy": 6.379095506668091, "epoch": 0.12876872203851392, "grad_norm": 1.015625, "learning_rate": 0.0004999707960389021, "loss": 6.0377, "mean_token_accuracy": 0.13998508602380752, "num_tokens": 2881604.0, "step": 1655 }, { "entropy": 6.374504232406617, "epoch": 0.12915775141023147, "grad_norm": 1.0234375, "learning_rate": 0.0004999703477980288, "loss": 6.2388, "mean_token_accuracy": 0.12339747697114944, "num_tokens": 2890427.0, "step": 1660 }, { "entropy": 6.471899557113647, "epoch": 0.12954678078194903, "grad_norm": 1.0390625, "learning_rate": 0.0004999698961435885, "loss": 6.2024, "mean_token_accuracy": 0.12862686440348625, "num_tokens": 2899206.0, "step": 1665 }, { "entropy": 6.3578918933868405, "epoch": 0.1299358101536666, "grad_norm": 0.98828125, "learning_rate": 0.0004999694410755882, "loss": 6.1251, "mean_token_accuracy": 0.13412127643823624, "num_tokens": 2907738.0, "step": 1670 }, { "entropy": 6.475336980819702, "epoch": 0.13032483952538418, "grad_norm": 0.9609375, "learning_rate": 0.0004999689825940347, "loss": 6.3526, "mean_token_accuracy": 0.12458359599113464, "num_tokens": 2916881.0, "step": 1675 }, { "entropy": 6.48715295791626, "epoch": 0.13071386889710174, "grad_norm": 0.91015625, "learning_rate": 0.0004999685206989349, "loss": 6.2833, "mean_token_accuracy": 0.12076244428753853, "num_tokens": 2926467.0, "step": 1680 }, { "entropy": 6.485057735443116, "epoch": 0.1311028982688193, "grad_norm": 0.96484375, "learning_rate": 0.0004999680553902959, "loss": 6.2095, "mean_token_accuracy": 0.12537256702780725, "num_tokens": 2934671.0, "step": 1685 }, { "entropy": 6.374607038497925, "epoch": 0.13149192764053685, "grad_norm": 0.93359375, "learning_rate": 0.0004999675866681247, "loss": 6.2382, "mean_token_accuracy": 0.12314836755394935, "num_tokens": 2943925.0, "step": 1690 }, { "entropy": 6.529426240921021, "epoch": 0.1318809570122544, "grad_norm": 1.0859375, "learning_rate": 0.0004999671145324286, "loss": 6.2839, "mean_token_accuracy": 0.12293665111064911, "num_tokens": 2952118.0, "step": 1695 }, { "entropy": 6.332964897155762, "epoch": 0.132269986383972, "grad_norm": 0.94921875, "learning_rate": 0.0004999666389832144, "loss": 6.246, "mean_token_accuracy": 0.12483881637454033, "num_tokens": 2961110.0, "step": 1700 }, { "entropy": 6.501490259170533, "epoch": 0.13265901575568956, "grad_norm": 0.97265625, "learning_rate": 0.0004999661600204897, "loss": 6.1969, "mean_token_accuracy": 0.1331293873488903, "num_tokens": 2968877.0, "step": 1705 }, { "entropy": 6.432631254196167, "epoch": 0.13304804512740712, "grad_norm": 0.98828125, "learning_rate": 0.0004999656776442615, "loss": 6.2441, "mean_token_accuracy": 0.12796934992074965, "num_tokens": 2977346.0, "step": 1710 }, { "entropy": 6.520103311538696, "epoch": 0.13343707449912467, "grad_norm": 1.03125, "learning_rate": 0.0004999651918545372, "loss": 6.2982, "mean_token_accuracy": 0.12270353958010674, "num_tokens": 2987494.0, "step": 1715 }, { "entropy": 6.414762353897094, "epoch": 0.13382610387084226, "grad_norm": 0.94140625, "learning_rate": 0.0004999647026513243, "loss": 6.2018, "mean_token_accuracy": 0.12620207220315932, "num_tokens": 2996728.0, "step": 1720 }, { "entropy": 6.426468324661255, "epoch": 0.13421513324255982, "grad_norm": 0.94140625, "learning_rate": 0.00049996421003463, "loss": 6.2245, "mean_token_accuracy": 0.12518492266535758, "num_tokens": 3005810.0, "step": 1725 }, { "entropy": 6.418255186080932, "epoch": 0.13460416261427738, "grad_norm": 1.0546875, "learning_rate": 0.0004999637140044619, "loss": 6.2506, "mean_token_accuracy": 0.12523002028465272, "num_tokens": 3014603.0, "step": 1730 }, { "entropy": 6.536535358428955, "epoch": 0.13499319198599494, "grad_norm": 1.0078125, "learning_rate": 0.0004999632145608275, "loss": 6.2372, "mean_token_accuracy": 0.13129105269908906, "num_tokens": 3023170.0, "step": 1735 }, { "entropy": 6.278478670120239, "epoch": 0.1353822213577125, "grad_norm": 1.03125, "learning_rate": 0.0004999627117037343, "loss": 5.9949, "mean_token_accuracy": 0.13947482481598855, "num_tokens": 3030565.0, "step": 1740 }, { "entropy": 6.4359362602233885, "epoch": 0.13577125072943008, "grad_norm": 0.94140625, "learning_rate": 0.00049996220543319, "loss": 6.2643, "mean_token_accuracy": 0.12935592159628867, "num_tokens": 3040124.0, "step": 1745 }, { "entropy": 6.372562122344971, "epoch": 0.13616028010114764, "grad_norm": 0.94921875, "learning_rate": 0.0004999616957492025, "loss": 6.1289, "mean_token_accuracy": 0.13145363405346872, "num_tokens": 3048458.0, "step": 1750 }, { "entropy": 6.290291500091553, "epoch": 0.1365493094728652, "grad_norm": 0.9453125, "learning_rate": 0.0004999611826517793, "loss": 6.103, "mean_token_accuracy": 0.1282423861324787, "num_tokens": 3057926.0, "step": 1755 }, { "entropy": 6.379631900787354, "epoch": 0.13693833884458276, "grad_norm": 0.953125, "learning_rate": 0.0004999606661409281, "loss": 6.1366, "mean_token_accuracy": 0.12733863443136215, "num_tokens": 3066683.0, "step": 1760 }, { "entropy": 6.335511159896851, "epoch": 0.13732736821630034, "grad_norm": 0.98828125, "learning_rate": 0.0004999601462166569, "loss": 6.2076, "mean_token_accuracy": 0.1272580251097679, "num_tokens": 3075117.0, "step": 1765 }, { "entropy": 6.486139631271362, "epoch": 0.1377163975880179, "grad_norm": 0.9375, "learning_rate": 0.0004999596228789736, "loss": 6.2551, "mean_token_accuracy": 0.12465462982654571, "num_tokens": 3084399.0, "step": 1770 }, { "entropy": 6.3006826877594, "epoch": 0.13810542695973546, "grad_norm": 0.94921875, "learning_rate": 0.0004999590961278859, "loss": 6.0508, "mean_token_accuracy": 0.13070713505148887, "num_tokens": 3093030.0, "step": 1775 }, { "entropy": 6.385556221008301, "epoch": 0.13849445633145302, "grad_norm": 0.9921875, "learning_rate": 0.0004999585659634021, "loss": 6.1168, "mean_token_accuracy": 0.12877569422125817, "num_tokens": 3101670.0, "step": 1780 }, { "entropy": 6.281736993789673, "epoch": 0.13888348570317058, "grad_norm": 1.0078125, "learning_rate": 0.0004999580323855301, "loss": 6.0969, "mean_token_accuracy": 0.1332916021347046, "num_tokens": 3109703.0, "step": 1785 }, { "entropy": 6.332530498504639, "epoch": 0.13927251507488816, "grad_norm": 1.0234375, "learning_rate": 0.0004999574953942781, "loss": 6.0721, "mean_token_accuracy": 0.1361841931939125, "num_tokens": 3118388.0, "step": 1790 }, { "entropy": 6.350433826446533, "epoch": 0.13966154444660572, "grad_norm": 1.0078125, "learning_rate": 0.0004999569549896541, "loss": 6.0765, "mean_token_accuracy": 0.13128025978803634, "num_tokens": 3126466.0, "step": 1795 }, { "entropy": 6.373475027084351, "epoch": 0.14005057381832328, "grad_norm": 0.94140625, "learning_rate": 0.0004999564111716665, "loss": 6.1227, "mean_token_accuracy": 0.13267524316906928, "num_tokens": 3135322.0, "step": 1800 }, { "entropy": 6.354067659378051, "epoch": 0.14043960319004084, "grad_norm": 0.91796875, "learning_rate": 0.0004999558639403232, "loss": 6.1047, "mean_token_accuracy": 0.1384847082197666, "num_tokens": 3144498.0, "step": 1805 }, { "entropy": 6.28254337310791, "epoch": 0.1408286325617584, "grad_norm": 0.8984375, "learning_rate": 0.0004999553132956328, "loss": 6.0917, "mean_token_accuracy": 0.12457187175750732, "num_tokens": 3153573.0, "step": 1810 }, { "entropy": 6.256527614593506, "epoch": 0.14121766193347599, "grad_norm": 0.94921875, "learning_rate": 0.0004999547592376035, "loss": 6.0228, "mean_token_accuracy": 0.13926569893956184, "num_tokens": 3161705.0, "step": 1815 }, { "entropy": 6.382395887374878, "epoch": 0.14160669130519354, "grad_norm": 1.0390625, "learning_rate": 0.0004999542017662438, "loss": 6.1838, "mean_token_accuracy": 0.1349948912858963, "num_tokens": 3170068.0, "step": 1820 }, { "entropy": 6.34617772102356, "epoch": 0.1419957206769111, "grad_norm": 0.9921875, "learning_rate": 0.0004999536408815623, "loss": 6.1935, "mean_token_accuracy": 0.12690433263778686, "num_tokens": 3178140.0, "step": 1825 }, { "entropy": 6.422201013565063, "epoch": 0.14238475004862866, "grad_norm": 1.0703125, "learning_rate": 0.0004999530765835672, "loss": 6.1579, "mean_token_accuracy": 0.1325029954314232, "num_tokens": 3186518.0, "step": 1830 }, { "entropy": 6.289926528930664, "epoch": 0.14277377942034625, "grad_norm": 0.9921875, "learning_rate": 0.0004999525088722673, "loss": 6.1548, "mean_token_accuracy": 0.1283407174050808, "num_tokens": 3195246.0, "step": 1835 }, { "entropy": 6.444282150268554, "epoch": 0.1431628087920638, "grad_norm": 1.0234375, "learning_rate": 0.0004999519377476711, "loss": 6.1779, "mean_token_accuracy": 0.12667956873774527, "num_tokens": 3203946.0, "step": 1840 }, { "entropy": 6.306654262542724, "epoch": 0.14355183816378136, "grad_norm": 1.078125, "learning_rate": 0.0004999513632097872, "loss": 6.1739, "mean_token_accuracy": 0.13087522089481354, "num_tokens": 3212208.0, "step": 1845 }, { "entropy": 6.336764192581176, "epoch": 0.14394086753549892, "grad_norm": 0.98828125, "learning_rate": 0.0004999507852586245, "loss": 6.1172, "mean_token_accuracy": 0.1314890868961811, "num_tokens": 3221572.0, "step": 1850 }, { "entropy": 6.424954843521118, "epoch": 0.14432989690721648, "grad_norm": 0.9453125, "learning_rate": 0.0004999502038941917, "loss": 6.2263, "mean_token_accuracy": 0.12041985988616943, "num_tokens": 3230898.0, "step": 1855 }, { "entropy": 6.333400774002075, "epoch": 0.14471892627893407, "grad_norm": 0.92578125, "learning_rate": 0.0004999496191164975, "loss": 6.2051, "mean_token_accuracy": 0.12520071864128113, "num_tokens": 3240524.0, "step": 1860 }, { "entropy": 6.29474139213562, "epoch": 0.14510795565065163, "grad_norm": 0.98046875, "learning_rate": 0.000499949030925551, "loss": 5.9728, "mean_token_accuracy": 0.13799916058778763, "num_tokens": 3248864.0, "step": 1865 }, { "entropy": 6.325572156906128, "epoch": 0.14549698502236919, "grad_norm": 1.0390625, "learning_rate": 0.0004999484393213609, "loss": 6.1491, "mean_token_accuracy": 0.13214721530675888, "num_tokens": 3256823.0, "step": 1870 }, { "entropy": 6.3230939388275145, "epoch": 0.14588601439408674, "grad_norm": 0.92578125, "learning_rate": 0.0004999478443039363, "loss": 6.0723, "mean_token_accuracy": 0.13165922313928605, "num_tokens": 3265621.0, "step": 1875 }, { "entropy": 6.260721683502197, "epoch": 0.14627504376580433, "grad_norm": 1.0234375, "learning_rate": 0.0004999472458732862, "loss": 6.0962, "mean_token_accuracy": 0.13295478150248527, "num_tokens": 3273515.0, "step": 1880 }, { "entropy": 6.414492464065551, "epoch": 0.1466640731375219, "grad_norm": 1.0390625, "learning_rate": 0.0004999466440294198, "loss": 6.1689, "mean_token_accuracy": 0.12950320392847062, "num_tokens": 3282283.0, "step": 1885 }, { "entropy": 6.302510833740234, "epoch": 0.14705310250923945, "grad_norm": 1.0, "learning_rate": 0.000499946038772346, "loss": 6.1611, "mean_token_accuracy": 0.13020878359675409, "num_tokens": 3290792.0, "step": 1890 }, { "entropy": 6.255168008804321, "epoch": 0.147442131880957, "grad_norm": 1.0234375, "learning_rate": 0.0004999454301020741, "loss": 6.0204, "mean_token_accuracy": 0.13267397582530976, "num_tokens": 3299430.0, "step": 1895 }, { "entropy": 6.261677408218384, "epoch": 0.14783116125267456, "grad_norm": 1.0078125, "learning_rate": 0.0004999448180186133, "loss": 6.0808, "mean_token_accuracy": 0.13431849405169488, "num_tokens": 3307949.0, "step": 1900 }, { "entropy": 6.340135097503662, "epoch": 0.14822019062439215, "grad_norm": 1.0078125, "learning_rate": 0.000499944202521973, "loss": 6.1246, "mean_token_accuracy": 0.13576969206333162, "num_tokens": 3316900.0, "step": 1905 }, { "entropy": 6.295166778564453, "epoch": 0.1486092199961097, "grad_norm": 0.984375, "learning_rate": 0.0004999435836121624, "loss": 6.0446, "mean_token_accuracy": 0.13577630817890168, "num_tokens": 3325656.0, "step": 1910 }, { "entropy": 6.309445333480835, "epoch": 0.14899824936782727, "grad_norm": 0.9765625, "learning_rate": 0.000499942961289191, "loss": 6.2644, "mean_token_accuracy": 0.12280140817165375, "num_tokens": 3334219.0, "step": 1915 }, { "entropy": 6.317688608169556, "epoch": 0.14938727873954483, "grad_norm": 0.8671875, "learning_rate": 0.0004999423355530683, "loss": 6.0314, "mean_token_accuracy": 0.13022207394242286, "num_tokens": 3343637.0, "step": 1920 }, { "entropy": 6.314282560348511, "epoch": 0.1497763081112624, "grad_norm": 0.96875, "learning_rate": 0.0004999417064038035, "loss": 6.1686, "mean_token_accuracy": 0.13118190541863442, "num_tokens": 3352624.0, "step": 1925 }, { "entropy": 6.262926197052002, "epoch": 0.15016533748297997, "grad_norm": 0.94921875, "learning_rate": 0.0004999410738414065, "loss": 6.0802, "mean_token_accuracy": 0.1389567419886589, "num_tokens": 3361394.0, "step": 1930 }, { "entropy": 6.377456378936768, "epoch": 0.15055436685469753, "grad_norm": 0.95703125, "learning_rate": 0.0004999404378658866, "loss": 6.1348, "mean_token_accuracy": 0.13395721539855004, "num_tokens": 3369406.0, "step": 1935 }, { "entropy": 6.3417693138122555, "epoch": 0.1509433962264151, "grad_norm": 0.9765625, "learning_rate": 0.0004999397984772536, "loss": 6.0852, "mean_token_accuracy": 0.13622010201215745, "num_tokens": 3377737.0, "step": 1940 }, { "entropy": 6.2485908508300785, "epoch": 0.15133242559813265, "grad_norm": 0.97265625, "learning_rate": 0.0004999391556755172, "loss": 6.1389, "mean_token_accuracy": 0.12751591503620147, "num_tokens": 3385514.0, "step": 1945 }, { "entropy": 6.394997596740723, "epoch": 0.15172145496985023, "grad_norm": 0.99609375, "learning_rate": 0.0004999385094606872, "loss": 6.0537, "mean_token_accuracy": 0.13509045764803887, "num_tokens": 3394500.0, "step": 1950 }, { "entropy": 6.220421218872071, "epoch": 0.1521104843415678, "grad_norm": 0.9921875, "learning_rate": 0.0004999378598327733, "loss": 6.0306, "mean_token_accuracy": 0.13421875312924386, "num_tokens": 3403289.0, "step": 1955 }, { "entropy": 6.218709182739258, "epoch": 0.15249951371328535, "grad_norm": 0.984375, "learning_rate": 0.0004999372067917854, "loss": 5.9569, "mean_token_accuracy": 0.14868551939725877, "num_tokens": 3410892.0, "step": 1960 }, { "entropy": 6.162004232406616, "epoch": 0.1528885430850029, "grad_norm": 0.9609375, "learning_rate": 0.0004999365503377335, "loss": 6.061, "mean_token_accuracy": 0.13821410536766052, "num_tokens": 3420329.0, "step": 1965 }, { "entropy": 6.333985614776611, "epoch": 0.1532775724567205, "grad_norm": 1.0234375, "learning_rate": 0.0004999358904706273, "loss": 6.0505, "mean_token_accuracy": 0.1318977616727352, "num_tokens": 3429429.0, "step": 1970 }, { "entropy": 6.335431814193726, "epoch": 0.15366660182843805, "grad_norm": 0.9765625, "learning_rate": 0.0004999352271904771, "loss": 6.1639, "mean_token_accuracy": 0.1311632439494133, "num_tokens": 3438198.0, "step": 1975 }, { "entropy": 6.457853221893311, "epoch": 0.1540556312001556, "grad_norm": 1.0234375, "learning_rate": 0.0004999345604972928, "loss": 6.2972, "mean_token_accuracy": 0.1280217707157135, "num_tokens": 3447732.0, "step": 1980 }, { "entropy": 6.3014496803283695, "epoch": 0.15444466057187317, "grad_norm": 1.03125, "learning_rate": 0.0004999338903910846, "loss": 6.0717, "mean_token_accuracy": 0.13846041038632392, "num_tokens": 3456392.0, "step": 1985 }, { "entropy": 6.261079359054565, "epoch": 0.15483368994359073, "grad_norm": 1.0078125, "learning_rate": 0.0004999332168718626, "loss": 6.1141, "mean_token_accuracy": 0.13328127637505532, "num_tokens": 3464473.0, "step": 1990 }, { "entropy": 6.2995849609375, "epoch": 0.15522271931530832, "grad_norm": 0.91796875, "learning_rate": 0.0004999325399396371, "loss": 6.0817, "mean_token_accuracy": 0.13139236569404603, "num_tokens": 3473740.0, "step": 1995 }, { "entropy": 6.162753677368164, "epoch": 0.15561174868702587, "grad_norm": 0.95703125, "learning_rate": 0.0004999318595944183, "loss": 5.985, "mean_token_accuracy": 0.1351643517613411, "num_tokens": 3482249.0, "step": 2000 }, { "entropy": 6.419935607910157, "epoch": 0.15600077805874343, "grad_norm": 1.0546875, "learning_rate": 0.0004999311758362166, "loss": 6.2085, "mean_token_accuracy": 0.12761779576539994, "num_tokens": 3490753.0, "step": 2005 }, { "entropy": 6.390731334686279, "epoch": 0.156389807430461, "grad_norm": 0.9609375, "learning_rate": 0.0004999304886650422, "loss": 6.1566, "mean_token_accuracy": 0.13517940416932106, "num_tokens": 3499373.0, "step": 2010 }, { "entropy": 6.3211747169494625, "epoch": 0.15677883680217858, "grad_norm": 1.03125, "learning_rate": 0.0004999297980809058, "loss": 6.1308, "mean_token_accuracy": 0.12607129365205766, "num_tokens": 3508344.0, "step": 2015 }, { "entropy": 6.359952831268311, "epoch": 0.15716786617389614, "grad_norm": 0.92578125, "learning_rate": 0.0004999291040838176, "loss": 6.0979, "mean_token_accuracy": 0.1342169925570488, "num_tokens": 3517009.0, "step": 2020 }, { "entropy": 6.2388135433197025, "epoch": 0.1575568955456137, "grad_norm": 1.03125, "learning_rate": 0.0004999284066737884, "loss": 6.1366, "mean_token_accuracy": 0.13406251445412637, "num_tokens": 3525989.0, "step": 2025 }, { "entropy": 6.306530141830445, "epoch": 0.15794592491733125, "grad_norm": 1.1171875, "learning_rate": 0.0004999277058508285, "loss": 6.0173, "mean_token_accuracy": 0.13108256459236145, "num_tokens": 3533947.0, "step": 2030 }, { "entropy": 6.262210369110107, "epoch": 0.1583349542890488, "grad_norm": 1.03125, "learning_rate": 0.0004999270016149486, "loss": 6.0749, "mean_token_accuracy": 0.1352415882050991, "num_tokens": 3541974.0, "step": 2035 }, { "entropy": 6.268887376785278, "epoch": 0.1587239836607664, "grad_norm": 1.125, "learning_rate": 0.0004999262939661596, "loss": 6.0026, "mean_token_accuracy": 0.1375070445239544, "num_tokens": 3550436.0, "step": 2040 }, { "entropy": 6.26065878868103, "epoch": 0.15911301303248396, "grad_norm": 1.0546875, "learning_rate": 0.0004999255829044721, "loss": 6.0238, "mean_token_accuracy": 0.13955531716346742, "num_tokens": 3558283.0, "step": 2045 }, { "entropy": 6.194809818267823, "epoch": 0.15950204240420152, "grad_norm": 0.9296875, "learning_rate": 0.0004999248684298968, "loss": 5.939, "mean_token_accuracy": 0.1412186801433563, "num_tokens": 3566968.0, "step": 2050 }, { "entropy": 6.244066286087036, "epoch": 0.15989107177591907, "grad_norm": 0.96484375, "learning_rate": 0.0004999241505424447, "loss": 6.0625, "mean_token_accuracy": 0.12982572838664055, "num_tokens": 3575580.0, "step": 2055 }, { "entropy": 6.259646034240722, "epoch": 0.16028010114763663, "grad_norm": 0.9453125, "learning_rate": 0.0004999234292421265, "loss": 6.1312, "mean_token_accuracy": 0.13408922925591468, "num_tokens": 3584389.0, "step": 2060 }, { "entropy": 6.286141872406006, "epoch": 0.16066913051935422, "grad_norm": 0.95703125, "learning_rate": 0.0004999227045289535, "loss": 5.9685, "mean_token_accuracy": 0.13707195296883584, "num_tokens": 3593009.0, "step": 2065 }, { "entropy": 6.142366409301758, "epoch": 0.16105815989107178, "grad_norm": 1.0625, "learning_rate": 0.0004999219764029363, "loss": 6.0046, "mean_token_accuracy": 0.13540613800287246, "num_tokens": 3601914.0, "step": 2070 }, { "entropy": 6.207937431335449, "epoch": 0.16144718926278934, "grad_norm": 1.015625, "learning_rate": 0.0004999212448640861, "loss": 5.9673, "mean_token_accuracy": 0.13867463171482086, "num_tokens": 3609883.0, "step": 2075 }, { "entropy": 6.189123487472534, "epoch": 0.1618362186345069, "grad_norm": 1.078125, "learning_rate": 0.0004999205099124141, "loss": 5.9265, "mean_token_accuracy": 0.1397370256483555, "num_tokens": 3618103.0, "step": 2080 }, { "entropy": 6.399334859848023, "epoch": 0.16222524800622448, "grad_norm": 1.0546875, "learning_rate": 0.0004999197715479313, "loss": 6.1937, "mean_token_accuracy": 0.1316985122859478, "num_tokens": 3625861.0, "step": 2085 }, { "entropy": 6.1656725883483885, "epoch": 0.16261427737794204, "grad_norm": 1.046875, "learning_rate": 0.0004999190297706489, "loss": 5.9726, "mean_token_accuracy": 0.13532934188842774, "num_tokens": 3634498.0, "step": 2090 }, { "entropy": 6.1408239841461185, "epoch": 0.1630033067496596, "grad_norm": 0.98046875, "learning_rate": 0.0004999182845805783, "loss": 5.9117, "mean_token_accuracy": 0.13378374204039573, "num_tokens": 3644186.0, "step": 2095 }, { "entropy": 6.151297092437744, "epoch": 0.16339233612137716, "grad_norm": 1.0, "learning_rate": 0.0004999175359777306, "loss": 6.0603, "mean_token_accuracy": 0.13409929126501083, "num_tokens": 3652831.0, "step": 2100 }, { "entropy": 6.346699666976929, "epoch": 0.16378136549309472, "grad_norm": 1.0703125, "learning_rate": 0.0004999167839621174, "loss": 5.9205, "mean_token_accuracy": 0.14053727090358734, "num_tokens": 3661230.0, "step": 2105 }, { "entropy": 6.19318904876709, "epoch": 0.1641703948648123, "grad_norm": 0.96875, "learning_rate": 0.0004999160285337501, "loss": 6.0607, "mean_token_accuracy": 0.1370956338942051, "num_tokens": 3669250.0, "step": 2110 }, { "entropy": 6.26489109992981, "epoch": 0.16455942423652986, "grad_norm": 1.0234375, "learning_rate": 0.0004999152696926399, "loss": 6.0286, "mean_token_accuracy": 0.138458015024662, "num_tokens": 3677568.0, "step": 2115 }, { "entropy": 6.253146648406982, "epoch": 0.16494845360824742, "grad_norm": 0.9375, "learning_rate": 0.0004999145074387985, "loss": 6.0233, "mean_token_accuracy": 0.1416604608297348, "num_tokens": 3685488.0, "step": 2120 }, { "entropy": 6.180020809173584, "epoch": 0.16533748297996498, "grad_norm": 0.984375, "learning_rate": 0.0004999137417722374, "loss": 6.002, "mean_token_accuracy": 0.13473087772727013, "num_tokens": 3694357.0, "step": 2125 }, { "entropy": 6.316441535949707, "epoch": 0.16572651235168256, "grad_norm": 1.015625, "learning_rate": 0.0004999129726929684, "loss": 6.0723, "mean_token_accuracy": 0.1360612131655216, "num_tokens": 3703173.0, "step": 2130 }, { "entropy": 6.205403232574463, "epoch": 0.16611554172340012, "grad_norm": 1.0234375, "learning_rate": 0.0004999122002010029, "loss": 6.0431, "mean_token_accuracy": 0.14090028777718544, "num_tokens": 3712070.0, "step": 2135 }, { "entropy": 6.206867980957031, "epoch": 0.16650457109511768, "grad_norm": 1.046875, "learning_rate": 0.0004999114242963527, "loss": 5.9404, "mean_token_accuracy": 0.14348391592502593, "num_tokens": 3720245.0, "step": 2140 }, { "entropy": 6.18376841545105, "epoch": 0.16689360046683524, "grad_norm": 0.96875, "learning_rate": 0.0004999106449790298, "loss": 6.0492, "mean_token_accuracy": 0.137314972281456, "num_tokens": 3730064.0, "step": 2145 }, { "entropy": 6.136141538619995, "epoch": 0.1672826298385528, "grad_norm": 1.1015625, "learning_rate": 0.0004999098622490458, "loss": 5.9864, "mean_token_accuracy": 0.14003208428621292, "num_tokens": 3738741.0, "step": 2150 }, { "entropy": 6.289495420455933, "epoch": 0.16767165921027039, "grad_norm": 0.9921875, "learning_rate": 0.0004999090761064125, "loss": 6.0533, "mean_token_accuracy": 0.13532209545373916, "num_tokens": 3747472.0, "step": 2155 }, { "entropy": 6.240089464187622, "epoch": 0.16806068858198794, "grad_norm": 0.9921875, "learning_rate": 0.000499908286551142, "loss": 6.0641, "mean_token_accuracy": 0.13511611968278886, "num_tokens": 3756643.0, "step": 2160 }, { "entropy": 6.315414953231811, "epoch": 0.1684497179537055, "grad_norm": 1.0390625, "learning_rate": 0.0004999074935832463, "loss": 6.1853, "mean_token_accuracy": 0.12947507873177527, "num_tokens": 3765490.0, "step": 2165 }, { "entropy": 6.2349205493927, "epoch": 0.16883874732542306, "grad_norm": 1.0625, "learning_rate": 0.0004999066972027373, "loss": 5.938, "mean_token_accuracy": 0.1387890338897705, "num_tokens": 3773063.0, "step": 2170 }, { "entropy": 6.261452722549438, "epoch": 0.16922777669714065, "grad_norm": 0.98046875, "learning_rate": 0.0004999058974096271, "loss": 6.1062, "mean_token_accuracy": 0.1365394599735737, "num_tokens": 3781763.0, "step": 2175 }, { "entropy": 6.2590172290802, "epoch": 0.1696168060688582, "grad_norm": 0.95703125, "learning_rate": 0.000499905094203928, "loss": 6.0982, "mean_token_accuracy": 0.1321517176926136, "num_tokens": 3790582.0, "step": 2180 }, { "entropy": 6.202856731414795, "epoch": 0.17000583544057576, "grad_norm": 0.9765625, "learning_rate": 0.000499904287585652, "loss": 5.9206, "mean_token_accuracy": 0.13618794158101083, "num_tokens": 3798745.0, "step": 2185 }, { "entropy": 6.172497653961182, "epoch": 0.17039486481229332, "grad_norm": 0.98046875, "learning_rate": 0.0004999034775548113, "loss": 6.0095, "mean_token_accuracy": 0.1356318287551403, "num_tokens": 3806901.0, "step": 2190 }, { "entropy": 6.2153675079345705, "epoch": 0.17078389418401088, "grad_norm": 1.1640625, "learning_rate": 0.0004999026641114185, "loss": 5.9479, "mean_token_accuracy": 0.14665559828281402, "num_tokens": 3815742.0, "step": 2195 }, { "entropy": 6.144705820083618, "epoch": 0.17117292355572847, "grad_norm": 0.96875, "learning_rate": 0.0004999018472554857, "loss": 6.0388, "mean_token_accuracy": 0.13324448689818383, "num_tokens": 3824468.0, "step": 2200 }, { "entropy": 6.208492565155029, "epoch": 0.17156195292744603, "grad_norm": 1.0078125, "learning_rate": 0.0004999010269870253, "loss": 5.9937, "mean_token_accuracy": 0.13999679386615754, "num_tokens": 3832834.0, "step": 2205 }, { "entropy": 6.242017364501953, "epoch": 0.17195098229916359, "grad_norm": 0.97265625, "learning_rate": 0.0004999002033060498, "loss": 6.0525, "mean_token_accuracy": 0.13752312287688256, "num_tokens": 3841780.0, "step": 2210 }, { "entropy": 6.24888129234314, "epoch": 0.17234001167088114, "grad_norm": 1.0, "learning_rate": 0.0004998993762125716, "loss": 6.1355, "mean_token_accuracy": 0.12495578080415726, "num_tokens": 3849840.0, "step": 2215 }, { "entropy": 6.293956756591797, "epoch": 0.17272904104259873, "grad_norm": 1.0078125, "learning_rate": 0.0004998985457066034, "loss": 6.079, "mean_token_accuracy": 0.13282646834850312, "num_tokens": 3858204.0, "step": 2220 }, { "entropy": 6.2079095363616945, "epoch": 0.1731180704143163, "grad_norm": 0.89453125, "learning_rate": 0.0004998977117881576, "loss": 6.0237, "mean_token_accuracy": 0.14005702137947082, "num_tokens": 3866615.0, "step": 2225 }, { "entropy": 6.221766662597656, "epoch": 0.17350709978603385, "grad_norm": 0.87890625, "learning_rate": 0.0004998968744572472, "loss": 6.0559, "mean_token_accuracy": 0.14006396681070327, "num_tokens": 3876003.0, "step": 2230 }, { "entropy": 6.193023920059204, "epoch": 0.1738961291577514, "grad_norm": 0.95703125, "learning_rate": 0.0004998960337138845, "loss": 5.9727, "mean_token_accuracy": 0.13838636204600335, "num_tokens": 3884362.0, "step": 2235 }, { "entropy": 6.160814571380615, "epoch": 0.17428515852946896, "grad_norm": 0.921875, "learning_rate": 0.0004998951895580826, "loss": 5.9274, "mean_token_accuracy": 0.13808080181479454, "num_tokens": 3893177.0, "step": 2240 }, { "entropy": 6.1626489639282225, "epoch": 0.17467418790118655, "grad_norm": 1.0625, "learning_rate": 0.0004998943419898542, "loss": 5.9864, "mean_token_accuracy": 0.14280490577220917, "num_tokens": 3903006.0, "step": 2245 }, { "entropy": 6.204087400436402, "epoch": 0.1750632172729041, "grad_norm": 0.95703125, "learning_rate": 0.0004998934910092119, "loss": 5.8424, "mean_token_accuracy": 0.1409443661570549, "num_tokens": 3912256.0, "step": 2250 }, { "entropy": 6.134327507019043, "epoch": 0.17545224664462167, "grad_norm": 1.046875, "learning_rate": 0.0004998926366161689, "loss": 6.0321, "mean_token_accuracy": 0.13451322615146638, "num_tokens": 3921121.0, "step": 2255 }, { "entropy": 6.185262537002563, "epoch": 0.17584127601633923, "grad_norm": 0.96484375, "learning_rate": 0.0004998917788107383, "loss": 5.9843, "mean_token_accuracy": 0.13937503695487977, "num_tokens": 3929348.0, "step": 2260 }, { "entropy": 6.260100173950195, "epoch": 0.17623030538805678, "grad_norm": 1.015625, "learning_rate": 0.0004998909175929326, "loss": 6.1355, "mean_token_accuracy": 0.13460659310221673, "num_tokens": 3938073.0, "step": 2265 }, { "entropy": 6.28374981880188, "epoch": 0.17661933475977437, "grad_norm": 0.95703125, "learning_rate": 0.0004998900529627653, "loss": 6.1158, "mean_token_accuracy": 0.13738646805286409, "num_tokens": 3946641.0, "step": 2270 }, { "entropy": 6.256800127029419, "epoch": 0.17700836413149193, "grad_norm": 1.0078125, "learning_rate": 0.0004998891849202495, "loss": 5.9659, "mean_token_accuracy": 0.1371592253446579, "num_tokens": 3954586.0, "step": 2275 }, { "entropy": 6.119969654083252, "epoch": 0.1773973935032095, "grad_norm": 1.015625, "learning_rate": 0.000499888313465398, "loss": 6.0389, "mean_token_accuracy": 0.14258864596486093, "num_tokens": 3963745.0, "step": 2280 }, { "entropy": 6.1104155540466305, "epoch": 0.17778642287492705, "grad_norm": 1.0, "learning_rate": 0.0004998874385982247, "loss": 5.8596, "mean_token_accuracy": 0.1476686991751194, "num_tokens": 3972452.0, "step": 2285 }, { "entropy": 6.156691980361939, "epoch": 0.17817545224664463, "grad_norm": 0.97265625, "learning_rate": 0.0004998865603187421, "loss": 5.9683, "mean_token_accuracy": 0.13907164037227632, "num_tokens": 3980770.0, "step": 2290 }, { "entropy": 6.192203378677368, "epoch": 0.1785644816183622, "grad_norm": 0.96484375, "learning_rate": 0.000499885678626964, "loss": 5.9986, "mean_token_accuracy": 0.13721442893147467, "num_tokens": 3989545.0, "step": 2295 }, { "entropy": 6.25260329246521, "epoch": 0.17895351099007975, "grad_norm": 0.93359375, "learning_rate": 0.0004998847935229038, "loss": 5.9638, "mean_token_accuracy": 0.13558776378631593, "num_tokens": 3998034.0, "step": 2300 }, { "entropy": 6.122658395767212, "epoch": 0.1793425403617973, "grad_norm": 0.99609375, "learning_rate": 0.0004998839050065746, "loss": 5.9926, "mean_token_accuracy": 0.1411259353160858, "num_tokens": 4007110.0, "step": 2305 }, { "entropy": 6.245479536056519, "epoch": 0.17973156973351487, "grad_norm": 1.0078125, "learning_rate": 0.0004998830130779902, "loss": 6.0628, "mean_token_accuracy": 0.13011873438954352, "num_tokens": 4015930.0, "step": 2310 }, { "entropy": 6.104860258102417, "epoch": 0.18012059910523245, "grad_norm": 0.9296875, "learning_rate": 0.000499882117737164, "loss": 5.8558, "mean_token_accuracy": 0.1457628294825554, "num_tokens": 4024510.0, "step": 2315 }, { "entropy": 6.106551742553711, "epoch": 0.18050962847695, "grad_norm": 0.95703125, "learning_rate": 0.0004998812189841096, "loss": 5.9437, "mean_token_accuracy": 0.14204365611076356, "num_tokens": 4033714.0, "step": 2320 }, { "entropy": 6.316892910003662, "epoch": 0.18089865784866757, "grad_norm": 1.0703125, "learning_rate": 0.0004998803168188407, "loss": 6.1612, "mean_token_accuracy": 0.13279995173215867, "num_tokens": 4042376.0, "step": 2325 }, { "entropy": 6.147280216217041, "epoch": 0.18128768722038513, "grad_norm": 1.0078125, "learning_rate": 0.0004998794112413708, "loss": 5.925, "mean_token_accuracy": 0.13952778577804564, "num_tokens": 4050521.0, "step": 2330 }, { "entropy": 6.251437854766846, "epoch": 0.18167671659210272, "grad_norm": 0.96875, "learning_rate": 0.0004998785022517137, "loss": 6.0965, "mean_token_accuracy": 0.13085465058684348, "num_tokens": 4059384.0, "step": 2335 }, { "entropy": 6.1695960521697994, "epoch": 0.18206574596382027, "grad_norm": 1.0546875, "learning_rate": 0.0004998775898498835, "loss": 5.9663, "mean_token_accuracy": 0.14308709353208543, "num_tokens": 4067655.0, "step": 2340 }, { "entropy": 6.172775983810425, "epoch": 0.18245477533553783, "grad_norm": 1.015625, "learning_rate": 0.0004998766740358936, "loss": 5.9634, "mean_token_accuracy": 0.14366720467805863, "num_tokens": 4075828.0, "step": 2345 }, { "entropy": 6.232926893234253, "epoch": 0.1828438047072554, "grad_norm": 1.03125, "learning_rate": 0.0004998757548097582, "loss": 5.9226, "mean_token_accuracy": 0.1397922396659851, "num_tokens": 4083796.0, "step": 2350 }, { "entropy": 6.120053386688232, "epoch": 0.18323283407897295, "grad_norm": 0.9453125, "learning_rate": 0.0004998748321714911, "loss": 6.0329, "mean_token_accuracy": 0.14252227693796157, "num_tokens": 4092981.0, "step": 2355 }, { "entropy": 6.174644327163696, "epoch": 0.18362186345069054, "grad_norm": 1.015625, "learning_rate": 0.0004998739061211065, "loss": 5.879, "mean_token_accuracy": 0.13968045711517335, "num_tokens": 4101363.0, "step": 2360 }, { "entropy": 6.13595757484436, "epoch": 0.1840108928224081, "grad_norm": 0.9453125, "learning_rate": 0.0004998729766586181, "loss": 5.9492, "mean_token_accuracy": 0.1380427822470665, "num_tokens": 4110164.0, "step": 2365 }, { "entropy": 6.248952150344849, "epoch": 0.18439992219412565, "grad_norm": 1.03125, "learning_rate": 0.0004998720437840403, "loss": 6.0636, "mean_token_accuracy": 0.1388567715883255, "num_tokens": 4119098.0, "step": 2370 }, { "entropy": 6.176186418533325, "epoch": 0.1847889515658432, "grad_norm": 1.0234375, "learning_rate": 0.0004998711074973871, "loss": 5.9613, "mean_token_accuracy": 0.14075352251529694, "num_tokens": 4127522.0, "step": 2375 }, { "entropy": 6.1555253028869625, "epoch": 0.1851779809375608, "grad_norm": 0.98046875, "learning_rate": 0.0004998701677986728, "loss": 5.9933, "mean_token_accuracy": 0.1459673412144184, "num_tokens": 4136311.0, "step": 2380 }, { "entropy": 6.152952861785889, "epoch": 0.18556701030927836, "grad_norm": 0.9609375, "learning_rate": 0.0004998692246879116, "loss": 5.9173, "mean_token_accuracy": 0.14190907552838325, "num_tokens": 4145160.0, "step": 2385 }, { "entropy": 6.123033618927002, "epoch": 0.18595603968099592, "grad_norm": 1.0234375, "learning_rate": 0.0004998682781651178, "loss": 5.8841, "mean_token_accuracy": 0.1437641464173794, "num_tokens": 4153921.0, "step": 2390 }, { "entropy": 6.115445232391357, "epoch": 0.18634506905271347, "grad_norm": 0.96875, "learning_rate": 0.0004998673282303059, "loss": 5.9681, "mean_token_accuracy": 0.1352468617260456, "num_tokens": 4162580.0, "step": 2395 }, { "entropy": 6.182539653778076, "epoch": 0.18673409842443103, "grad_norm": 0.98046875, "learning_rate": 0.0004998663748834901, "loss": 5.9663, "mean_token_accuracy": 0.14548829048871995, "num_tokens": 4170623.0, "step": 2400 }, { "entropy": 6.110377979278565, "epoch": 0.18712312779614862, "grad_norm": 1.0, "learning_rate": 0.0004998654181246851, "loss": 5.9514, "mean_token_accuracy": 0.14497750550508498, "num_tokens": 4178724.0, "step": 2405 }, { "entropy": 6.137342739105224, "epoch": 0.18751215716786618, "grad_norm": 1.0078125, "learning_rate": 0.0004998644579539052, "loss": 5.9613, "mean_token_accuracy": 0.1416378900408745, "num_tokens": 4187773.0, "step": 2410 }, { "entropy": 6.170235538482666, "epoch": 0.18790118653958374, "grad_norm": 0.9375, "learning_rate": 0.000499863494371165, "loss": 5.9529, "mean_token_accuracy": 0.13757317140698433, "num_tokens": 4196628.0, "step": 2415 }, { "entropy": 6.15802321434021, "epoch": 0.1882902159113013, "grad_norm": 1.0390625, "learning_rate": 0.0004998625273764793, "loss": 5.9779, "mean_token_accuracy": 0.1390997901558876, "num_tokens": 4205090.0, "step": 2420 }, { "entropy": 6.209850788116455, "epoch": 0.18867924528301888, "grad_norm": 0.9921875, "learning_rate": 0.0004998615569698626, "loss": 5.8944, "mean_token_accuracy": 0.1414852797985077, "num_tokens": 4212757.0, "step": 2425 }, { "entropy": 6.018552446365357, "epoch": 0.18906827465473644, "grad_norm": 1.0234375, "learning_rate": 0.0004998605831513296, "loss": 5.9541, "mean_token_accuracy": 0.14190278872847556, "num_tokens": 4221556.0, "step": 2430 }, { "entropy": 6.107316589355468, "epoch": 0.189457304026454, "grad_norm": 0.9765625, "learning_rate": 0.0004998596059208953, "loss": 5.9427, "mean_token_accuracy": 0.13826509863138198, "num_tokens": 4231524.0, "step": 2435 }, { "entropy": 6.196195983886719, "epoch": 0.18984633339817156, "grad_norm": 1.0625, "learning_rate": 0.0004998586252785743, "loss": 5.9895, "mean_token_accuracy": 0.1437416195869446, "num_tokens": 4240229.0, "step": 2440 }, { "entropy": 6.146422052383423, "epoch": 0.19023536276988912, "grad_norm": 1.0, "learning_rate": 0.0004998576412243816, "loss": 5.8743, "mean_token_accuracy": 0.14444278329610824, "num_tokens": 4248053.0, "step": 2445 }, { "entropy": 6.164689350128174, "epoch": 0.1906243921416067, "grad_norm": 0.99609375, "learning_rate": 0.0004998566537583321, "loss": 5.9185, "mean_token_accuracy": 0.14325421303510666, "num_tokens": 4256019.0, "step": 2450 }, { "entropy": 6.0683635711669925, "epoch": 0.19101342151332426, "grad_norm": 1.0234375, "learning_rate": 0.0004998556628804408, "loss": 5.9053, "mean_token_accuracy": 0.14163314551115036, "num_tokens": 4263805.0, "step": 2455 }, { "entropy": 6.10060682296753, "epoch": 0.19140245088504182, "grad_norm": 1.015625, "learning_rate": 0.0004998546685907225, "loss": 5.9544, "mean_token_accuracy": 0.13736186251044274, "num_tokens": 4272712.0, "step": 2460 }, { "entropy": 6.20326189994812, "epoch": 0.19179148025675938, "grad_norm": 1.0078125, "learning_rate": 0.0004998536708891927, "loss": 5.8959, "mean_token_accuracy": 0.1452920749783516, "num_tokens": 4281222.0, "step": 2465 }, { "entropy": 6.094033193588257, "epoch": 0.19218050962847694, "grad_norm": 1.0234375, "learning_rate": 0.0004998526697758663, "loss": 6.0001, "mean_token_accuracy": 0.13505400642752646, "num_tokens": 4290558.0, "step": 2470 }, { "entropy": 6.264354085922241, "epoch": 0.19256953900019452, "grad_norm": 1.015625, "learning_rate": 0.0004998516652507585, "loss": 6.0245, "mean_token_accuracy": 0.13424147367477418, "num_tokens": 4299684.0, "step": 2475 }, { "entropy": 6.101936912536621, "epoch": 0.19295856837191208, "grad_norm": 0.9921875, "learning_rate": 0.0004998506573138846, "loss": 5.9608, "mean_token_accuracy": 0.14035997539758682, "num_tokens": 4308938.0, "step": 2480 }, { "entropy": 6.069972848892212, "epoch": 0.19334759774362964, "grad_norm": 0.9375, "learning_rate": 0.0004998496459652598, "loss": 5.828, "mean_token_accuracy": 0.147909976541996, "num_tokens": 4317646.0, "step": 2485 }, { "entropy": 6.097158575057984, "epoch": 0.1937366271153472, "grad_norm": 0.984375, "learning_rate": 0.0004998486312048995, "loss": 5.9509, "mean_token_accuracy": 0.14012686312198638, "num_tokens": 4326876.0, "step": 2490 }, { "entropy": 6.119687271118164, "epoch": 0.19412565648706478, "grad_norm": 0.8984375, "learning_rate": 0.0004998476130328193, "loss": 5.9374, "mean_token_accuracy": 0.14259177893400193, "num_tokens": 4335391.0, "step": 2495 }, { "entropy": 6.211879730224609, "epoch": 0.19451468585878234, "grad_norm": 0.94921875, "learning_rate": 0.0004998465914490343, "loss": 5.9104, "mean_token_accuracy": 0.1425481393933296, "num_tokens": 4343253.0, "step": 2500 }, { "entropy": 5.971693420410157, "epoch": 0.1949037152304999, "grad_norm": 0.93359375, "learning_rate": 0.00049984556645356, "loss": 5.8904, "mean_token_accuracy": 0.13843516409397125, "num_tokens": 4352161.0, "step": 2505 }, { "entropy": 6.155507898330688, "epoch": 0.19529274460221746, "grad_norm": 1.0, "learning_rate": 0.0004998445380464124, "loss": 5.853, "mean_token_accuracy": 0.1473579704761505, "num_tokens": 4360414.0, "step": 2510 }, { "entropy": 6.0863183498382565, "epoch": 0.19568177397393502, "grad_norm": 0.984375, "learning_rate": 0.0004998435062276066, "loss": 5.8366, "mean_token_accuracy": 0.15001533925533295, "num_tokens": 4369375.0, "step": 2515 }, { "entropy": 5.990550470352173, "epoch": 0.1960708033456526, "grad_norm": 1.03125, "learning_rate": 0.0004998424709971586, "loss": 5.8722, "mean_token_accuracy": 0.14208223000168801, "num_tokens": 4378638.0, "step": 2520 }, { "entropy": 6.178989458084106, "epoch": 0.19645983271737016, "grad_norm": 0.9921875, "learning_rate": 0.0004998414323550839, "loss": 5.8595, "mean_token_accuracy": 0.14671409651637077, "num_tokens": 4388262.0, "step": 2525 }, { "entropy": 6.066281509399414, "epoch": 0.19684886208908772, "grad_norm": 0.93359375, "learning_rate": 0.0004998403903013984, "loss": 5.864, "mean_token_accuracy": 0.14327401518821717, "num_tokens": 4396894.0, "step": 2530 }, { "entropy": 6.139949607849121, "epoch": 0.19723789146080528, "grad_norm": 0.8828125, "learning_rate": 0.0004998393448361179, "loss": 5.9885, "mean_token_accuracy": 0.14116159975528716, "num_tokens": 4405455.0, "step": 2535 }, { "entropy": 6.167979383468628, "epoch": 0.19762692083252287, "grad_norm": 1.078125, "learning_rate": 0.000499838295959258, "loss": 5.8999, "mean_token_accuracy": 0.1390222877264023, "num_tokens": 4414355.0, "step": 2540 }, { "entropy": 5.997927045822143, "epoch": 0.19801595020424043, "grad_norm": 1.015625, "learning_rate": 0.000499837243670835, "loss": 5.7913, "mean_token_accuracy": 0.15371408313512802, "num_tokens": 4422305.0, "step": 2545 }, { "entropy": 6.17957763671875, "epoch": 0.19840497957595798, "grad_norm": 0.9453125, "learning_rate": 0.0004998361879708646, "loss": 5.9198, "mean_token_accuracy": 0.1427523523569107, "num_tokens": 4430813.0, "step": 2550 }, { "entropy": 6.099480628967285, "epoch": 0.19879400894767554, "grad_norm": 0.9375, "learning_rate": 0.000499835128859363, "loss": 5.8828, "mean_token_accuracy": 0.1461223766207695, "num_tokens": 4440229.0, "step": 2555 }, { "entropy": 6.00967698097229, "epoch": 0.1991830383193931, "grad_norm": 0.921875, "learning_rate": 0.0004998340663363461, "loss": 5.8994, "mean_token_accuracy": 0.14125050902366637, "num_tokens": 4449417.0, "step": 2560 }, { "entropy": 6.186902904510498, "epoch": 0.1995720676911107, "grad_norm": 1.0078125, "learning_rate": 0.0004998330004018301, "loss": 5.9456, "mean_token_accuracy": 0.13707190454006196, "num_tokens": 4457377.0, "step": 2565 }, { "entropy": 6.101526355743408, "epoch": 0.19996109706282825, "grad_norm": 0.96484375, "learning_rate": 0.0004998319310558312, "loss": 5.8663, "mean_token_accuracy": 0.14043352231383324, "num_tokens": 4466839.0, "step": 2570 }, { "entropy": 6.076670742034912, "epoch": 0.2003501264345458, "grad_norm": 1.09375, "learning_rate": 0.0004998308582983657, "loss": 5.8854, "mean_token_accuracy": 0.14421407207846643, "num_tokens": 4476369.0, "step": 2575 }, { "entropy": 6.072381830215454, "epoch": 0.20073915580626336, "grad_norm": 1.0, "learning_rate": 0.0004998297821294497, "loss": 5.9561, "mean_token_accuracy": 0.14137691259384155, "num_tokens": 4485609.0, "step": 2580 }, { "entropy": 6.131612968444824, "epoch": 0.20112818517798095, "grad_norm": 1.03125, "learning_rate": 0.0004998287025490995, "loss": 5.9162, "mean_token_accuracy": 0.14042819067835807, "num_tokens": 4494535.0, "step": 2585 }, { "entropy": 6.1383223056793215, "epoch": 0.2015172145496985, "grad_norm": 0.89453125, "learning_rate": 0.0004998276195573317, "loss": 5.8955, "mean_token_accuracy": 0.13853249028325082, "num_tokens": 4503133.0, "step": 2590 }, { "entropy": 6.049847364425659, "epoch": 0.20190624392141607, "grad_norm": 0.90625, "learning_rate": 0.0004998265331541627, "loss": 5.7882, "mean_token_accuracy": 0.149039888381958, "num_tokens": 4511465.0, "step": 2595 }, { "entropy": 6.050959205627441, "epoch": 0.20229527329313363, "grad_norm": 1.078125, "learning_rate": 0.0004998254433396088, "loss": 5.8551, "mean_token_accuracy": 0.14632439315319062, "num_tokens": 4520177.0, "step": 2600 }, { "entropy": 6.156892967224121, "epoch": 0.20268430266485118, "grad_norm": 0.96484375, "learning_rate": 0.0004998243501136867, "loss": 6.0153, "mean_token_accuracy": 0.14031418338418006, "num_tokens": 4528370.0, "step": 2605 }, { "entropy": 6.219958877563476, "epoch": 0.20307333203656877, "grad_norm": 0.984375, "learning_rate": 0.0004998232534764129, "loss": 6.0333, "mean_token_accuracy": 0.13372237458825112, "num_tokens": 4538258.0, "step": 2610 }, { "entropy": 6.0912260055542, "epoch": 0.20346236140828633, "grad_norm": 1.0078125, "learning_rate": 0.0004998221534278041, "loss": 5.9243, "mean_token_accuracy": 0.14148016050457954, "num_tokens": 4547300.0, "step": 2615 }, { "entropy": 6.163697814941406, "epoch": 0.2038513907800039, "grad_norm": 0.87109375, "learning_rate": 0.0004998210499678769, "loss": 5.9894, "mean_token_accuracy": 0.13505751192569732, "num_tokens": 4556877.0, "step": 2620 }, { "entropy": 6.094733190536499, "epoch": 0.20424042015172145, "grad_norm": 1.015625, "learning_rate": 0.0004998199430966481, "loss": 5.8389, "mean_token_accuracy": 0.1471896141767502, "num_tokens": 4565999.0, "step": 2625 }, { "entropy": 6.09189739227295, "epoch": 0.20462944952343903, "grad_norm": 1.03125, "learning_rate": 0.0004998188328141346, "loss": 5.8909, "mean_token_accuracy": 0.13818741962313652, "num_tokens": 4574027.0, "step": 2630 }, { "entropy": 6.029260110855103, "epoch": 0.2050184788951566, "grad_norm": 0.99609375, "learning_rate": 0.0004998177191203531, "loss": 5.8962, "mean_token_accuracy": 0.1333038367331028, "num_tokens": 4582402.0, "step": 2635 }, { "entropy": 6.102605962753296, "epoch": 0.20540750826687415, "grad_norm": 1.0546875, "learning_rate": 0.0004998166020153204, "loss": 5.8411, "mean_token_accuracy": 0.14166108146309853, "num_tokens": 4590381.0, "step": 2640 }, { "entropy": 6.096075630187988, "epoch": 0.2057965376385917, "grad_norm": 1.0703125, "learning_rate": 0.0004998154814990538, "loss": 5.9002, "mean_token_accuracy": 0.13965460956096648, "num_tokens": 4598910.0, "step": 2645 }, { "entropy": 6.230145454406738, "epoch": 0.20618556701030927, "grad_norm": 1.0078125, "learning_rate": 0.00049981435757157, "loss": 6.0215, "mean_token_accuracy": 0.13467366695404054, "num_tokens": 4607400.0, "step": 2650 }, { "entropy": 6.057853126525879, "epoch": 0.20657459638202685, "grad_norm": 0.859375, "learning_rate": 0.0004998132302328862, "loss": 5.9545, "mean_token_accuracy": 0.14162048250436782, "num_tokens": 4616510.0, "step": 2655 }, { "entropy": 6.152973604202271, "epoch": 0.2069636257537444, "grad_norm": 0.953125, "learning_rate": 0.0004998120994830195, "loss": 5.9042, "mean_token_accuracy": 0.14345652610063553, "num_tokens": 4624529.0, "step": 2660 }, { "entropy": 6.153080034255981, "epoch": 0.20735265512546197, "grad_norm": 0.9921875, "learning_rate": 0.000499810965321987, "loss": 5.8473, "mean_token_accuracy": 0.144081724435091, "num_tokens": 4632141.0, "step": 2665 }, { "entropy": 6.135512018203736, "epoch": 0.20774168449717953, "grad_norm": 1.0234375, "learning_rate": 0.0004998098277498059, "loss": 6.0399, "mean_token_accuracy": 0.13816287219524384, "num_tokens": 4640378.0, "step": 2670 }, { "entropy": 6.064649534225464, "epoch": 0.2081307138688971, "grad_norm": 0.9140625, "learning_rate": 0.0004998086867664934, "loss": 5.8117, "mean_token_accuracy": 0.1414397269487381, "num_tokens": 4649313.0, "step": 2675 }, { "entropy": 6.121465873718262, "epoch": 0.20851974324061467, "grad_norm": 0.98046875, "learning_rate": 0.000499807542372067, "loss": 5.9071, "mean_token_accuracy": 0.14331126660108567, "num_tokens": 4658272.0, "step": 2680 }, { "entropy": 6.036688280105591, "epoch": 0.20890877261233223, "grad_norm": 0.984375, "learning_rate": 0.0004998063945665439, "loss": 5.7901, "mean_token_accuracy": 0.1520828664302826, "num_tokens": 4665970.0, "step": 2685 }, { "entropy": 6.189170980453492, "epoch": 0.2092978019840498, "grad_norm": 0.921875, "learning_rate": 0.0004998052433499416, "loss": 6.0293, "mean_token_accuracy": 0.13662858083844184, "num_tokens": 4675308.0, "step": 2690 }, { "entropy": 6.077781295776367, "epoch": 0.20968683135576735, "grad_norm": 1.0078125, "learning_rate": 0.0004998040887222776, "loss": 5.8742, "mean_token_accuracy": 0.14358604997396468, "num_tokens": 4684316.0, "step": 2695 }, { "entropy": 6.031701469421387, "epoch": 0.21007586072748494, "grad_norm": 1.0390625, "learning_rate": 0.0004998029306835693, "loss": 5.7824, "mean_token_accuracy": 0.14697564840316774, "num_tokens": 4693029.0, "step": 2700 }, { "entropy": 6.0618767738342285, "epoch": 0.2104648900992025, "grad_norm": 1.0078125, "learning_rate": 0.0004998017692338344, "loss": 5.9842, "mean_token_accuracy": 0.13347845301032066, "num_tokens": 4702404.0, "step": 2705 }, { "entropy": 6.141680812835693, "epoch": 0.21085391947092005, "grad_norm": 0.95703125, "learning_rate": 0.0004998006043730905, "loss": 5.9526, "mean_token_accuracy": 0.13373763784766196, "num_tokens": 4711126.0, "step": 2710 }, { "entropy": 6.116554880142212, "epoch": 0.2112429488426376, "grad_norm": 0.9296875, "learning_rate": 0.0004997994361013551, "loss": 5.9516, "mean_token_accuracy": 0.1492009460926056, "num_tokens": 4719816.0, "step": 2715 }, { "entropy": 6.174014472961426, "epoch": 0.21163197821435517, "grad_norm": 0.9609375, "learning_rate": 0.0004997982644186461, "loss": 5.8835, "mean_token_accuracy": 0.14039621651172637, "num_tokens": 4728294.0, "step": 2720 }, { "entropy": 6.0613030910491945, "epoch": 0.21202100758607276, "grad_norm": 0.953125, "learning_rate": 0.0004997970893249813, "loss": 5.815, "mean_token_accuracy": 0.1434742122888565, "num_tokens": 4736708.0, "step": 2725 }, { "entropy": 6.044667100906372, "epoch": 0.21241003695779032, "grad_norm": 0.9609375, "learning_rate": 0.0004997959108203785, "loss": 5.9964, "mean_token_accuracy": 0.1296418972313404, "num_tokens": 4744893.0, "step": 2730 }, { "entropy": 6.243737983703613, "epoch": 0.21279906632950787, "grad_norm": 1.015625, "learning_rate": 0.0004997947289048554, "loss": 5.9463, "mean_token_accuracy": 0.1440265618264675, "num_tokens": 4753246.0, "step": 2735 }, { "entropy": 6.026007032394409, "epoch": 0.21318809570122543, "grad_norm": 0.953125, "learning_rate": 0.0004997935435784302, "loss": 5.875, "mean_token_accuracy": 0.14041776210069656, "num_tokens": 4762229.0, "step": 2740 }, { "entropy": 5.99229941368103, "epoch": 0.21357712507294302, "grad_norm": 0.97265625, "learning_rate": 0.0004997923548411208, "loss": 5.8139, "mean_token_accuracy": 0.148726749420166, "num_tokens": 4771315.0, "step": 2745 }, { "entropy": 5.956744146347046, "epoch": 0.21396615444466058, "grad_norm": 1.015625, "learning_rate": 0.000499791162692945, "loss": 5.7628, "mean_token_accuracy": 0.15489397719502448, "num_tokens": 4779848.0, "step": 2750 }, { "entropy": 6.160625457763672, "epoch": 0.21435518381637814, "grad_norm": 0.9765625, "learning_rate": 0.0004997899671339214, "loss": 5.999, "mean_token_accuracy": 0.13992350101470946, "num_tokens": 4788939.0, "step": 2755 }, { "entropy": 6.131371355056762, "epoch": 0.2147442131880957, "grad_norm": 0.9765625, "learning_rate": 0.0004997887681640675, "loss": 5.9017, "mean_token_accuracy": 0.14416032284498215, "num_tokens": 4797719.0, "step": 2760 }, { "entropy": 6.09780068397522, "epoch": 0.21513324255981325, "grad_norm": 1.03125, "learning_rate": 0.0004997875657834021, "loss": 5.9332, "mean_token_accuracy": 0.13998101651668549, "num_tokens": 4805601.0, "step": 2765 }, { "entropy": 6.137105464935303, "epoch": 0.21552227193153084, "grad_norm": 0.96484375, "learning_rate": 0.0004997863599919432, "loss": 5.8913, "mean_token_accuracy": 0.1408081702888012, "num_tokens": 4814993.0, "step": 2770 }, { "entropy": 6.115447616577148, "epoch": 0.2159113013032484, "grad_norm": 0.96484375, "learning_rate": 0.0004997851507897089, "loss": 5.8477, "mean_token_accuracy": 0.1397731989622116, "num_tokens": 4824156.0, "step": 2775 }, { "entropy": 5.991670274734497, "epoch": 0.21630033067496596, "grad_norm": 0.93359375, "learning_rate": 0.0004997839381767178, "loss": 5.9414, "mean_token_accuracy": 0.14050936251878737, "num_tokens": 4833827.0, "step": 2780 }, { "entropy": 6.081092882156372, "epoch": 0.21668936004668352, "grad_norm": 0.9609375, "learning_rate": 0.0004997827221529882, "loss": 5.8829, "mean_token_accuracy": 0.1428877130150795, "num_tokens": 4842801.0, "step": 2785 }, { "entropy": 6.08880844116211, "epoch": 0.2170783894184011, "grad_norm": 1.0625, "learning_rate": 0.0004997815027185386, "loss": 5.7536, "mean_token_accuracy": 0.14653713181614875, "num_tokens": 4850928.0, "step": 2790 }, { "entropy": 5.995206022262574, "epoch": 0.21746741879011866, "grad_norm": 0.97265625, "learning_rate": 0.0004997802798733874, "loss": 5.8637, "mean_token_accuracy": 0.1513894386589527, "num_tokens": 4859510.0, "step": 2795 }, { "entropy": 6.10595588684082, "epoch": 0.21785644816183622, "grad_norm": 0.87890625, "learning_rate": 0.0004997790536175534, "loss": 5.8902, "mean_token_accuracy": 0.1465415373444557, "num_tokens": 4868201.0, "step": 2800 }, { "entropy": 6.035786819458008, "epoch": 0.21824547753355378, "grad_norm": 0.9765625, "learning_rate": 0.0004997778239510548, "loss": 5.816, "mean_token_accuracy": 0.15248959213495256, "num_tokens": 4876896.0, "step": 2805 }, { "entropy": 6.001589441299439, "epoch": 0.21863450690527134, "grad_norm": 0.9921875, "learning_rate": 0.0004997765908739106, "loss": 5.7908, "mean_token_accuracy": 0.1534420743584633, "num_tokens": 4885136.0, "step": 2810 }, { "entropy": 6.0229329586029055, "epoch": 0.21902353627698892, "grad_norm": 1.046875, "learning_rate": 0.0004997753543861395, "loss": 5.7893, "mean_token_accuracy": 0.14993626177310942, "num_tokens": 4893277.0, "step": 2815 }, { "entropy": 6.036485242843628, "epoch": 0.21941256564870648, "grad_norm": 1.0, "learning_rate": 0.00049977411448776, "loss": 5.9514, "mean_token_accuracy": 0.1361225239932537, "num_tokens": 4901977.0, "step": 2820 }, { "entropy": 6.142391729354858, "epoch": 0.21980159502042404, "grad_norm": 0.984375, "learning_rate": 0.0004997728711787912, "loss": 5.9431, "mean_token_accuracy": 0.1336057133972645, "num_tokens": 4910888.0, "step": 2825 }, { "entropy": 6.031327724456787, "epoch": 0.2201906243921416, "grad_norm": 0.96875, "learning_rate": 0.0004997716244592518, "loss": 5.9456, "mean_token_accuracy": 0.13697238340973855, "num_tokens": 4920369.0, "step": 2830 }, { "entropy": 6.1665221691131595, "epoch": 0.22057965376385918, "grad_norm": 1.078125, "learning_rate": 0.0004997703743291607, "loss": 5.9347, "mean_token_accuracy": 0.13784253150224685, "num_tokens": 4928799.0, "step": 2835 }, { "entropy": 6.118892431259155, "epoch": 0.22096868313557674, "grad_norm": 0.9921875, "learning_rate": 0.000499769120788537, "loss": 5.8422, "mean_token_accuracy": 0.15058550387620925, "num_tokens": 4937194.0, "step": 2840 }, { "entropy": 6.045169401168823, "epoch": 0.2213577125072943, "grad_norm": 0.94921875, "learning_rate": 0.0004997678638373995, "loss": 5.9202, "mean_token_accuracy": 0.13822367861866952, "num_tokens": 4946174.0, "step": 2845 }, { "entropy": 6.097653436660766, "epoch": 0.22174674187901186, "grad_norm": 0.89453125, "learning_rate": 0.0004997666034757676, "loss": 5.8543, "mean_token_accuracy": 0.13650616109371186, "num_tokens": 4955376.0, "step": 2850 }, { "entropy": 6.003319025039673, "epoch": 0.22213577125072942, "grad_norm": 0.8828125, "learning_rate": 0.0004997653397036603, "loss": 5.8545, "mean_token_accuracy": 0.14963753297924995, "num_tokens": 4964138.0, "step": 2855 }, { "entropy": 6.087133550643921, "epoch": 0.222524800622447, "grad_norm": 0.9453125, "learning_rate": 0.0004997640725210965, "loss": 5.945, "mean_token_accuracy": 0.13923729509115218, "num_tokens": 4973868.0, "step": 2860 }, { "entropy": 6.072530794143677, "epoch": 0.22291382999416456, "grad_norm": 0.9609375, "learning_rate": 0.0004997628019280958, "loss": 5.8158, "mean_token_accuracy": 0.14615875333547593, "num_tokens": 4982687.0, "step": 2865 }, { "entropy": 6.07082724571228, "epoch": 0.22330285936588212, "grad_norm": 1.0078125, "learning_rate": 0.0004997615279246773, "loss": 5.8724, "mean_token_accuracy": 0.13691072314977645, "num_tokens": 4992072.0, "step": 2870 }, { "entropy": 6.080668687820435, "epoch": 0.22369188873759968, "grad_norm": 0.9765625, "learning_rate": 0.0004997602505108603, "loss": 5.8261, "mean_token_accuracy": 0.14304942935705184, "num_tokens": 5000551.0, "step": 2875 }, { "entropy": 6.073841190338134, "epoch": 0.22408091810931724, "grad_norm": 0.98828125, "learning_rate": 0.0004997589696866644, "loss": 5.9859, "mean_token_accuracy": 0.13843553885817528, "num_tokens": 5009292.0, "step": 2880 }, { "entropy": 6.066045570373535, "epoch": 0.22446994748103483, "grad_norm": 0.953125, "learning_rate": 0.0004997576854521088, "loss": 5.8342, "mean_token_accuracy": 0.1451627016067505, "num_tokens": 5018407.0, "step": 2885 }, { "entropy": 5.999263858795166, "epoch": 0.22485897685275238, "grad_norm": 0.94921875, "learning_rate": 0.000499756397807213, "loss": 5.8877, "mean_token_accuracy": 0.14157619029283525, "num_tokens": 5027353.0, "step": 2890 }, { "entropy": 6.1293292999267575, "epoch": 0.22524800622446994, "grad_norm": 0.94140625, "learning_rate": 0.0004997551067519966, "loss": 5.8898, "mean_token_accuracy": 0.14480420351028442, "num_tokens": 5036476.0, "step": 2895 }, { "entropy": 6.099696016311645, "epoch": 0.2256370355961875, "grad_norm": 0.92578125, "learning_rate": 0.0004997538122864792, "loss": 5.8458, "mean_token_accuracy": 0.1427316889166832, "num_tokens": 5045132.0, "step": 2900 }, { "entropy": 6.082901287078857, "epoch": 0.2260260649679051, "grad_norm": 0.9453125, "learning_rate": 0.0004997525144106804, "loss": 5.8717, "mean_token_accuracy": 0.1474373534321785, "num_tokens": 5053665.0, "step": 2905 }, { "entropy": 6.110235738754272, "epoch": 0.22641509433962265, "grad_norm": 0.92578125, "learning_rate": 0.00049975121312462, "loss": 5.8163, "mean_token_accuracy": 0.1529403179883957, "num_tokens": 5062516.0, "step": 2910 }, { "entropy": 6.043049669265747, "epoch": 0.2268041237113402, "grad_norm": 1.0234375, "learning_rate": 0.0004997499084283177, "loss": 5.8536, "mean_token_accuracy": 0.14332823008298873, "num_tokens": 5071260.0, "step": 2915 }, { "entropy": 5.952953195571899, "epoch": 0.22719315308305776, "grad_norm": 0.984375, "learning_rate": 0.0004997486003217932, "loss": 5.8082, "mean_token_accuracy": 0.15106913149356843, "num_tokens": 5079215.0, "step": 2920 }, { "entropy": 6.071919727325439, "epoch": 0.22758218245477532, "grad_norm": 0.95703125, "learning_rate": 0.0004997472888050664, "loss": 5.8879, "mean_token_accuracy": 0.1414925940334797, "num_tokens": 5088404.0, "step": 2925 }, { "entropy": 6.055942630767822, "epoch": 0.2279712118264929, "grad_norm": 1.046875, "learning_rate": 0.0004997459738781573, "loss": 5.803, "mean_token_accuracy": 0.147076266258955, "num_tokens": 5096756.0, "step": 2930 }, { "entropy": 6.042949390411377, "epoch": 0.22836024119821047, "grad_norm": 0.89453125, "learning_rate": 0.0004997446555410857, "loss": 5.967, "mean_token_accuracy": 0.14154459834098815, "num_tokens": 5106160.0, "step": 2935 }, { "entropy": 5.963182592391968, "epoch": 0.22874927056992803, "grad_norm": 0.9296875, "learning_rate": 0.0004997433337938716, "loss": 5.899, "mean_token_accuracy": 0.14055694192647933, "num_tokens": 5114915.0, "step": 2940 }, { "entropy": 6.1321821212768555, "epoch": 0.22913829994164558, "grad_norm": 0.9453125, "learning_rate": 0.0004997420086365351, "loss": 5.8087, "mean_token_accuracy": 0.14655397981405258, "num_tokens": 5123249.0, "step": 2945 }, { "entropy": 5.994801664352417, "epoch": 0.22952732931336317, "grad_norm": 0.91796875, "learning_rate": 0.0004997406800690966, "loss": 5.7989, "mean_token_accuracy": 0.14508022367954254, "num_tokens": 5131906.0, "step": 2950 }, { "entropy": 6.047790002822876, "epoch": 0.22991635868508073, "grad_norm": 0.96484375, "learning_rate": 0.0004997393480915758, "loss": 5.795, "mean_token_accuracy": 0.1496501974761486, "num_tokens": 5140740.0, "step": 2955 }, { "entropy": 6.069603347778321, "epoch": 0.2303053880567983, "grad_norm": 0.95703125, "learning_rate": 0.0004997380127039931, "loss": 5.9802, "mean_token_accuracy": 0.14554987102746964, "num_tokens": 5149748.0, "step": 2960 }, { "entropy": 5.9712036609649655, "epoch": 0.23069441742851585, "grad_norm": 0.94140625, "learning_rate": 0.0004997366739063688, "loss": 5.7259, "mean_token_accuracy": 0.15179628431797026, "num_tokens": 5158475.0, "step": 2965 }, { "entropy": 6.014142608642578, "epoch": 0.2310834468002334, "grad_norm": 1.0078125, "learning_rate": 0.0004997353316987231, "loss": 5.9024, "mean_token_accuracy": 0.1394285723567009, "num_tokens": 5166593.0, "step": 2970 }, { "entropy": 6.108148241043091, "epoch": 0.231472476171951, "grad_norm": 0.96875, "learning_rate": 0.0004997339860810765, "loss": 5.8795, "mean_token_accuracy": 0.1452465608716011, "num_tokens": 5175557.0, "step": 2975 }, { "entropy": 6.0830058574676515, "epoch": 0.23186150554366855, "grad_norm": 0.984375, "learning_rate": 0.0004997326370534495, "loss": 5.7837, "mean_token_accuracy": 0.14554769918322563, "num_tokens": 5184140.0, "step": 2980 }, { "entropy": 6.019090270996093, "epoch": 0.2322505349153861, "grad_norm": 0.984375, "learning_rate": 0.0004997312846158622, "loss": 5.8684, "mean_token_accuracy": 0.14349435344338418, "num_tokens": 5192347.0, "step": 2985 }, { "entropy": 6.08717942237854, "epoch": 0.23263956428710367, "grad_norm": 0.9609375, "learning_rate": 0.0004997299287683355, "loss": 5.8239, "mean_token_accuracy": 0.14950033277273178, "num_tokens": 5201327.0, "step": 2990 }, { "entropy": 6.0416545391082765, "epoch": 0.23302859365882125, "grad_norm": 1.015625, "learning_rate": 0.0004997285695108898, "loss": 5.9213, "mean_token_accuracy": 0.14163968116044998, "num_tokens": 5209873.0, "step": 2995 }, { "entropy": 6.0891759395599365, "epoch": 0.2334176230305388, "grad_norm": 1.0, "learning_rate": 0.0004997272068435458, "loss": 5.8338, "mean_token_accuracy": 0.14707664102315904, "num_tokens": 5219176.0, "step": 3000 }, { "epoch": 0.2334176230305388, "eval_entropy": 5.810826111115207, "eval_loss": 5.8746232986450195, "eval_mean_token_accuracy": 0.15242935873360103, "eval_num_tokens": 5219176.0, "eval_runtime": 21.8651, "eval_samples_per_second": 1900.651, "eval_steps_per_second": 237.593, "step": 3000 } ], "logging_steps": 5, "max_steps": 128520, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 3000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1052336906403840.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }