{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.7793594306049823, "eval_steps": 500, "global_step": 1500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 4.805317306518555, "epoch": 0.005931198102016607, "grad_norm": 16.25, "learning_rate": 2e-06, "loss": 14.4312, "mean_token_accuracy": 0.0, "num_tokens": 12647.0, "step": 5 }, { "entropy": 4.825564956665039, "epoch": 0.011862396204033215, "grad_norm": 16.875, "learning_rate": 4.5e-06, "loss": 14.4169, "mean_token_accuracy": 0.0, "num_tokens": 26668.0, "step": 10 }, { "entropy": 4.845508098602295, "epoch": 0.017793594306049824, "grad_norm": 24.75, "learning_rate": 7e-06, "loss": 14.1564, "mean_token_accuracy": 0.0, "num_tokens": 41021.0, "step": 15 }, { "entropy": 5.1169312477111815, "epoch": 0.02372479240806643, "grad_norm": 33.75, "learning_rate": 9.5e-06, "loss": 13.5366, "mean_token_accuracy": 0.0, "num_tokens": 56626.0, "step": 20 }, { "entropy": 7.628379774093628, "epoch": 0.02965599051008304, "grad_norm": 15.25, "learning_rate": 1.2e-05, "loss": 11.8077, "mean_token_accuracy": 0.00010419512109365315, "num_tokens": 72914.0, "step": 25 }, { "entropy": 10.455063152313233, "epoch": 0.03558718861209965, "grad_norm": 3.21875, "learning_rate": 1.4500000000000002e-05, "loss": 10.841, "mean_token_accuracy": 0.0054948762990534306, "num_tokens": 88514.0, "step": 30 }, { "entropy": 10.646884059906006, "epoch": 0.04151838671411625, "grad_norm": 3.03125, "learning_rate": 1.7000000000000003e-05, "loss": 10.5696, "mean_token_accuracy": 0.01355562973767519, "num_tokens": 101256.0, "step": 35 }, { "entropy": 10.619774627685548, "epoch": 0.04744958481613286, "grad_norm": 2.4375, "learning_rate": 1.95e-05, "loss": 10.282, "mean_token_accuracy": 0.012707393150776625, "num_tokens": 114459.0, "step": 40 }, { "entropy": 10.61210651397705, "epoch": 0.05338078291814947, "grad_norm": 2.28125, "learning_rate": 2.2e-05, "loss": 10.0287, "mean_token_accuracy": 0.01491355374455452, "num_tokens": 129858.0, "step": 45 }, { "entropy": 10.597074794769288, "epoch": 0.05931198102016608, "grad_norm": 2.1875, "learning_rate": 2.4500000000000003e-05, "loss": 9.8185, "mean_token_accuracy": 0.0331686332821846, "num_tokens": 143486.0, "step": 50 }, { "entropy": 10.579236507415771, "epoch": 0.06524317912218268, "grad_norm": 1.9609375, "learning_rate": 2.7e-05, "loss": 9.6912, "mean_token_accuracy": 0.035220497474074366, "num_tokens": 156003.0, "step": 55 }, { "entropy": 10.577684020996093, "epoch": 0.0711743772241993, "grad_norm": 2.03125, "learning_rate": 2.95e-05, "loss": 9.6506, "mean_token_accuracy": 0.034727090038359165, "num_tokens": 170988.0, "step": 60 }, { "entropy": 10.5711012840271, "epoch": 0.0771055753262159, "grad_norm": 1.984375, "learning_rate": 3.2e-05, "loss": 9.5328, "mean_token_accuracy": 0.03448135014623403, "num_tokens": 187165.0, "step": 65 }, { "entropy": 10.558809852600097, "epoch": 0.0830367734282325, "grad_norm": 1.9453125, "learning_rate": 3.4500000000000005e-05, "loss": 9.4798, "mean_token_accuracy": 0.03228826243430376, "num_tokens": 202072.0, "step": 70 }, { "entropy": 10.549299335479736, "epoch": 0.08896797153024912, "grad_norm": 1.8671875, "learning_rate": 3.7e-05, "loss": 9.3281, "mean_token_accuracy": 0.034324941039085385, "num_tokens": 215375.0, "step": 75 }, { "entropy": 10.532067012786865, "epoch": 0.09489916963226572, "grad_norm": 1.734375, "learning_rate": 3.95e-05, "loss": 9.2492, "mean_token_accuracy": 0.03353528436273336, "num_tokens": 228749.0, "step": 80 }, { "entropy": 10.505972194671632, "epoch": 0.10083036773428232, "grad_norm": 1.8359375, "learning_rate": 4.2000000000000004e-05, "loss": 9.1494, "mean_token_accuracy": 0.03314766474068165, "num_tokens": 242387.0, "step": 85 }, { "entropy": 10.478415584564209, "epoch": 0.10676156583629894, "grad_norm": 1.796875, "learning_rate": 4.45e-05, "loss": 9.0705, "mean_token_accuracy": 0.032026905380189416, "num_tokens": 257793.0, "step": 90 }, { "entropy": 10.454620742797852, "epoch": 0.11269276393831554, "grad_norm": 1.75, "learning_rate": 4.7000000000000004e-05, "loss": 8.9712, "mean_token_accuracy": 0.0325484286993742, "num_tokens": 271187.0, "step": 95 }, { "entropy": 10.40716381072998, "epoch": 0.11862396204033215, "grad_norm": 1.609375, "learning_rate": 4.9500000000000004e-05, "loss": 8.8474, "mean_token_accuracy": 0.03217122312635183, "num_tokens": 284937.0, "step": 100 }, { "entropy": 10.335246372222901, "epoch": 0.12455516014234876, "grad_norm": 1.765625, "learning_rate": 5.2e-05, "loss": 8.6893, "mean_token_accuracy": 0.03255892116576433, "num_tokens": 300108.0, "step": 105 }, { "entropy": 10.246189594268799, "epoch": 0.13048635824436536, "grad_norm": 1.53125, "learning_rate": 5.45e-05, "loss": 8.5681, "mean_token_accuracy": 0.031065495498478413, "num_tokens": 316760.0, "step": 110 }, { "entropy": 10.13212080001831, "epoch": 0.13641755634638197, "grad_norm": 1.5078125, "learning_rate": 5.7e-05, "loss": 8.3819, "mean_token_accuracy": 0.03049417305737734, "num_tokens": 329705.0, "step": 115 }, { "entropy": 9.97801332473755, "epoch": 0.1423487544483986, "grad_norm": 1.3203125, "learning_rate": 5.9499999999999996e-05, "loss": 8.244, "mean_token_accuracy": 0.03179512321949005, "num_tokens": 342947.0, "step": 120 }, { "entropy": 9.771716022491455, "epoch": 0.14827995255041518, "grad_norm": 1.2109375, "learning_rate": 6.2e-05, "loss": 8.0865, "mean_token_accuracy": 0.03442887142300606, "num_tokens": 358397.0, "step": 125 }, { "entropy": 9.533180236816406, "epoch": 0.1542111506524318, "grad_norm": 1.140625, "learning_rate": 6.450000000000001e-05, "loss": 7.9643, "mean_token_accuracy": 0.03413730468600988, "num_tokens": 370369.0, "step": 130 }, { "entropy": 9.256175804138184, "epoch": 0.1601423487544484, "grad_norm": 0.953125, "learning_rate": 6.7e-05, "loss": 7.8421, "mean_token_accuracy": 0.03181219045072794, "num_tokens": 386896.0, "step": 135 }, { "entropy": 8.96011724472046, "epoch": 0.166073546856465, "grad_norm": 0.8671875, "learning_rate": 6.950000000000001e-05, "loss": 7.6981, "mean_token_accuracy": 0.03533113058656454, "num_tokens": 400433.0, "step": 140 }, { "entropy": 8.675125217437744, "epoch": 0.17200474495848161, "grad_norm": 0.7890625, "learning_rate": 7.2e-05, "loss": 7.6507, "mean_token_accuracy": 0.030981262400746345, "num_tokens": 415092.0, "step": 145 }, { "entropy": 8.432178497314453, "epoch": 0.17793594306049823, "grad_norm": 0.7109375, "learning_rate": 7.45e-05, "loss": 7.5489, "mean_token_accuracy": 0.033769184909760955, "num_tokens": 429793.0, "step": 150 }, { "entropy": 8.235133266448974, "epoch": 0.18386714116251482, "grad_norm": 0.77734375, "learning_rate": 7.7e-05, "loss": 7.5575, "mean_token_accuracy": 0.03205921929329634, "num_tokens": 442618.0, "step": 155 }, { "entropy": 8.142054271697997, "epoch": 0.18979833926453143, "grad_norm": 0.75, "learning_rate": 7.950000000000001e-05, "loss": 7.4449, "mean_token_accuracy": 0.03399460650980472, "num_tokens": 454976.0, "step": 160 }, { "entropy": 8.025918197631835, "epoch": 0.19572953736654805, "grad_norm": 0.8671875, "learning_rate": 8.2e-05, "loss": 7.5037, "mean_token_accuracy": 0.03331909943372011, "num_tokens": 467523.0, "step": 165 }, { "entropy": 7.9379983901977536, "epoch": 0.20166073546856464, "grad_norm": 0.6796875, "learning_rate": 8.450000000000001e-05, "loss": 7.4373, "mean_token_accuracy": 0.03239843733608723, "num_tokens": 481391.0, "step": 170 }, { "entropy": 7.869046401977539, "epoch": 0.20759193357058126, "grad_norm": 0.67578125, "learning_rate": 8.7e-05, "loss": 7.4399, "mean_token_accuracy": 0.0311466746032238, "num_tokens": 496697.0, "step": 175 }, { "entropy": 7.866212034225464, "epoch": 0.21352313167259787, "grad_norm": 0.77734375, "learning_rate": 8.95e-05, "loss": 7.4743, "mean_token_accuracy": 0.027226756513118743, "num_tokens": 510091.0, "step": 180 }, { "entropy": 7.788731241226197, "epoch": 0.21945432977461446, "grad_norm": 0.703125, "learning_rate": 9.2e-05, "loss": 7.426, "mean_token_accuracy": 0.03152833003550768, "num_tokens": 522168.0, "step": 185 }, { "entropy": 7.754296016693115, "epoch": 0.22538552787663108, "grad_norm": 0.71875, "learning_rate": 9.45e-05, "loss": 7.3943, "mean_token_accuracy": 0.03427231907844543, "num_tokens": 535853.0, "step": 190 }, { "entropy": 7.75240159034729, "epoch": 0.2313167259786477, "grad_norm": 0.77734375, "learning_rate": 9.7e-05, "loss": 7.4255, "mean_token_accuracy": 0.03329353462904692, "num_tokens": 551082.0, "step": 195 }, { "entropy": 7.700812101364136, "epoch": 0.2372479240806643, "grad_norm": 0.7265625, "learning_rate": 9.95e-05, "loss": 7.4629, "mean_token_accuracy": 0.035965221747756, "num_tokens": 567181.0, "step": 200 }, { "entropy": 7.696683025360107, "epoch": 0.2431791221826809, "grad_norm": 0.71484375, "learning_rate": 0.000102, "loss": 7.4112, "mean_token_accuracy": 0.035206197388470174, "num_tokens": 580689.0, "step": 205 }, { "entropy": 7.712547016143799, "epoch": 0.2491103202846975, "grad_norm": 0.765625, "learning_rate": 0.00010449999999999999, "loss": 7.3345, "mean_token_accuracy": 0.03781173955649138, "num_tokens": 594590.0, "step": 210 }, { "entropy": 7.769494247436524, "epoch": 0.25504151838671413, "grad_norm": 10.5, "learning_rate": 0.000107, "loss": 7.3905, "mean_token_accuracy": 0.03799592889845371, "num_tokens": 610577.0, "step": 215 }, { "entropy": 7.6959569454193115, "epoch": 0.2609727164887307, "grad_norm": 0.97265625, "learning_rate": 0.0001095, "loss": 7.384, "mean_token_accuracy": 0.037612661719322205, "num_tokens": 627066.0, "step": 220 }, { "entropy": 7.781623411178589, "epoch": 0.2669039145907473, "grad_norm": 0.90625, "learning_rate": 0.000112, "loss": 7.3672, "mean_token_accuracy": 0.04785094037652016, "num_tokens": 642601.0, "step": 225 }, { "entropy": 7.77043514251709, "epoch": 0.27283511269276395, "grad_norm": 1.484375, "learning_rate": 0.0001145, "loss": 7.2531, "mean_token_accuracy": 0.05052996054291725, "num_tokens": 655615.0, "step": 230 }, { "entropy": 7.747775220870972, "epoch": 0.27876631079478054, "grad_norm": 0.94140625, "learning_rate": 0.00011700000000000001, "loss": 7.2647, "mean_token_accuracy": 0.05221507623791695, "num_tokens": 670218.0, "step": 235 }, { "entropy": 7.743488121032715, "epoch": 0.2846975088967972, "grad_norm": 0.75390625, "learning_rate": 0.00011949999999999999, "loss": 7.2593, "mean_token_accuracy": 0.05101203434169292, "num_tokens": 683661.0, "step": 240 }, { "entropy": 7.713605117797852, "epoch": 0.29062870699881377, "grad_norm": 1.1875, "learning_rate": 0.000122, "loss": 7.2135, "mean_token_accuracy": 0.05287150628864765, "num_tokens": 699767.0, "step": 245 }, { "entropy": 7.695834493637085, "epoch": 0.29655990510083036, "grad_norm": 0.953125, "learning_rate": 0.0001245, "loss": 7.1762, "mean_token_accuracy": 0.05634650327265263, "num_tokens": 713579.0, "step": 250 }, { "entropy": 7.629615783691406, "epoch": 0.302491103202847, "grad_norm": 1.296875, "learning_rate": 0.000127, "loss": 7.1678, "mean_token_accuracy": 0.05482946485280991, "num_tokens": 727490.0, "step": 255 }, { "entropy": 7.607522439956665, "epoch": 0.3084223013048636, "grad_norm": 0.80078125, "learning_rate": 0.0001295, "loss": 7.2348, "mean_token_accuracy": 0.05509466864168644, "num_tokens": 742477.0, "step": 260 }, { "entropy": 7.624451637268066, "epoch": 0.3143534994068802, "grad_norm": 1.2578125, "learning_rate": 0.000132, "loss": 7.113, "mean_token_accuracy": 0.05751051269471645, "num_tokens": 757772.0, "step": 265 }, { "entropy": 7.647220134735107, "epoch": 0.3202846975088968, "grad_norm": 1.390625, "learning_rate": 0.00013450000000000002, "loss": 7.1596, "mean_token_accuracy": 0.05049732141196728, "num_tokens": 772898.0, "step": 270 }, { "entropy": 7.600799989700318, "epoch": 0.3262158956109134, "grad_norm": 1.34375, "learning_rate": 0.00013700000000000002, "loss": 7.1154, "mean_token_accuracy": 0.05433249212801457, "num_tokens": 788395.0, "step": 275 }, { "entropy": 7.563078927993774, "epoch": 0.33214709371293, "grad_norm": 1.078125, "learning_rate": 0.0001395, "loss": 7.1648, "mean_token_accuracy": 0.06050356179475784, "num_tokens": 803413.0, "step": 280 }, { "entropy": 7.517913770675659, "epoch": 0.33807829181494664, "grad_norm": 1.34375, "learning_rate": 0.00014199999999999998, "loss": 7.0248, "mean_token_accuracy": 0.06933637075126171, "num_tokens": 817775.0, "step": 285 }, { "entropy": 7.566510915756226, "epoch": 0.34400948991696323, "grad_norm": 1.15625, "learning_rate": 0.0001445, "loss": 7.1421, "mean_token_accuracy": 0.06264986135065556, "num_tokens": 831379.0, "step": 290 }, { "entropy": 7.551775217056274, "epoch": 0.3499406880189798, "grad_norm": 1.0234375, "learning_rate": 0.000147, "loss": 7.0759, "mean_token_accuracy": 0.05862759165465832, "num_tokens": 846596.0, "step": 295 }, { "entropy": 7.553944540023804, "epoch": 0.35587188612099646, "grad_norm": 1.0234375, "learning_rate": 0.0001495, "loss": 7.0666, "mean_token_accuracy": 0.05912046544253826, "num_tokens": 862063.0, "step": 300 }, { "entropy": 7.582914543151856, "epoch": 0.36180308422301305, "grad_norm": 1.0859375, "learning_rate": 0.000152, "loss": 6.9961, "mean_token_accuracy": 0.06986662931740284, "num_tokens": 876841.0, "step": 305 }, { "entropy": 7.488122177124024, "epoch": 0.36773428232502964, "grad_norm": 1.1875, "learning_rate": 0.00015450000000000001, "loss": 7.0603, "mean_token_accuracy": 0.06794393062591553, "num_tokens": 890728.0, "step": 310 }, { "entropy": 7.442899990081787, "epoch": 0.3736654804270463, "grad_norm": 1.0703125, "learning_rate": 0.000157, "loss": 6.983, "mean_token_accuracy": 0.0702366728335619, "num_tokens": 905599.0, "step": 315 }, { "entropy": 7.451259899139404, "epoch": 0.37959667852906287, "grad_norm": 1.3359375, "learning_rate": 0.0001595, "loss": 6.9367, "mean_token_accuracy": 0.07826149612665176, "num_tokens": 918139.0, "step": 320 }, { "entropy": 7.405993700027466, "epoch": 0.38552787663107946, "grad_norm": 1.3515625, "learning_rate": 0.000162, "loss": 6.9943, "mean_token_accuracy": 0.0733895305544138, "num_tokens": 931666.0, "step": 325 }, { "entropy": 7.446602392196655, "epoch": 0.3914590747330961, "grad_norm": 1.2890625, "learning_rate": 0.00016450000000000001, "loss": 6.9418, "mean_token_accuracy": 0.0699479129165411, "num_tokens": 946286.0, "step": 330 }, { "entropy": 7.44321928024292, "epoch": 0.3973902728351127, "grad_norm": 1.25, "learning_rate": 0.00016700000000000002, "loss": 6.9048, "mean_token_accuracy": 0.0711387813091278, "num_tokens": 959689.0, "step": 335 }, { "entropy": 7.383141279220581, "epoch": 0.4033214709371293, "grad_norm": 1.4609375, "learning_rate": 0.00016950000000000003, "loss": 6.9099, "mean_token_accuracy": 0.07436129115521908, "num_tokens": 972707.0, "step": 340 }, { "entropy": 7.326433992385864, "epoch": 0.4092526690391459, "grad_norm": 1.234375, "learning_rate": 0.00017199999999999998, "loss": 6.9298, "mean_token_accuracy": 0.07282942235469818, "num_tokens": 988010.0, "step": 345 }, { "entropy": 7.3913586139678955, "epoch": 0.4151838671411625, "grad_norm": 1.6015625, "learning_rate": 0.00017449999999999999, "loss": 6.9494, "mean_token_accuracy": 0.0702156439423561, "num_tokens": 1003823.0, "step": 350 }, { "entropy": 7.271407747268677, "epoch": 0.4211150652431791, "grad_norm": 1.7421875, "learning_rate": 0.000177, "loss": 6.7257, "mean_token_accuracy": 0.08785916194319725, "num_tokens": 1018276.0, "step": 355 }, { "entropy": 7.315984010696411, "epoch": 0.42704626334519574, "grad_norm": 1.40625, "learning_rate": 0.0001795, "loss": 6.9177, "mean_token_accuracy": 0.07590937204658985, "num_tokens": 1031242.0, "step": 360 }, { "entropy": 7.36967716217041, "epoch": 0.43297746144721233, "grad_norm": 1.2421875, "learning_rate": 0.000182, "loss": 6.826, "mean_token_accuracy": 0.08421060293912888, "num_tokens": 1043940.0, "step": 365 }, { "entropy": 7.209809446334839, "epoch": 0.4389086595492289, "grad_norm": 1.046875, "learning_rate": 0.0001845, "loss": 6.7337, "mean_token_accuracy": 0.08058795779943466, "num_tokens": 1058656.0, "step": 370 }, { "entropy": 7.326260042190552, "epoch": 0.44483985765124556, "grad_norm": 1.1796875, "learning_rate": 0.000187, "loss": 6.8599, "mean_token_accuracy": 0.07443175241351127, "num_tokens": 1073128.0, "step": 375 }, { "entropy": 7.216764450073242, "epoch": 0.45077105575326215, "grad_norm": 1.5703125, "learning_rate": 0.0001895, "loss": 6.7831, "mean_token_accuracy": 0.08439998105168342, "num_tokens": 1086467.0, "step": 380 }, { "entropy": 7.274557256698609, "epoch": 0.45670225385527874, "grad_norm": 1.328125, "learning_rate": 0.000192, "loss": 6.9052, "mean_token_accuracy": 0.08290659114718438, "num_tokens": 1100356.0, "step": 385 }, { "entropy": 7.288721132278442, "epoch": 0.4626334519572954, "grad_norm": 1.4609375, "learning_rate": 0.0001945, "loss": 6.8286, "mean_token_accuracy": 0.08163000270724297, "num_tokens": 1115877.0, "step": 390 }, { "entropy": 7.271324348449707, "epoch": 0.46856465005931197, "grad_norm": 0.97265625, "learning_rate": 0.00019700000000000002, "loss": 6.7874, "mean_token_accuracy": 0.08328207209706306, "num_tokens": 1131415.0, "step": 395 }, { "entropy": 7.159351873397827, "epoch": 0.4744958481613286, "grad_norm": 1.3203125, "learning_rate": 0.00019950000000000002, "loss": 6.7132, "mean_token_accuracy": 0.08293095007538795, "num_tokens": 1145903.0, "step": 400 }, { "entropy": 7.103127574920654, "epoch": 0.4804270462633452, "grad_norm": 1.1953125, "learning_rate": 0.000202, "loss": 6.67, "mean_token_accuracy": 0.08018745929002762, "num_tokens": 1161168.0, "step": 405 }, { "entropy": 7.14245753288269, "epoch": 0.4863582443653618, "grad_norm": 1.3046875, "learning_rate": 0.00020449999999999998, "loss": 6.7324, "mean_token_accuracy": 0.08255215212702752, "num_tokens": 1178155.0, "step": 410 }, { "entropy": 7.131292104721069, "epoch": 0.49228944246737844, "grad_norm": 1.2890625, "learning_rate": 0.000207, "loss": 6.5728, "mean_token_accuracy": 0.09345637336373329, "num_tokens": 1190830.0, "step": 415 }, { "entropy": 7.046381425857544, "epoch": 0.498220640569395, "grad_norm": 1.21875, "learning_rate": 0.0002095, "loss": 6.5814, "mean_token_accuracy": 0.08820187523961068, "num_tokens": 1205260.0, "step": 420 }, { "entropy": 7.083016061782837, "epoch": 0.5041518386714117, "grad_norm": 1.453125, "learning_rate": 0.000212, "loss": 6.6316, "mean_token_accuracy": 0.09104111194610595, "num_tokens": 1218856.0, "step": 425 }, { "entropy": 7.034869623184204, "epoch": 0.5100830367734283, "grad_norm": 1.4453125, "learning_rate": 0.0002145, "loss": 6.6934, "mean_token_accuracy": 0.09010339081287384, "num_tokens": 1234669.0, "step": 430 }, { "entropy": 7.032301235198974, "epoch": 0.5160142348754448, "grad_norm": 1.4375, "learning_rate": 0.00021700000000000002, "loss": 6.6293, "mean_token_accuracy": 0.09128119722008705, "num_tokens": 1249514.0, "step": 435 }, { "entropy": 7.032708358764649, "epoch": 0.5219454329774614, "grad_norm": 1.1171875, "learning_rate": 0.0002195, "loss": 6.5626, "mean_token_accuracy": 0.0961005687713623, "num_tokens": 1262311.0, "step": 440 }, { "entropy": 6.9413275718688965, "epoch": 0.527876631079478, "grad_norm": 1.4453125, "learning_rate": 0.000222, "loss": 6.5488, "mean_token_accuracy": 0.09156981036067009, "num_tokens": 1277681.0, "step": 445 }, { "entropy": 7.003400182723999, "epoch": 0.5338078291814946, "grad_norm": 1.3359375, "learning_rate": 0.0002245, "loss": 6.5879, "mean_token_accuracy": 0.09069180116057396, "num_tokens": 1292300.0, "step": 450 }, { "entropy": 7.015186309814453, "epoch": 0.5397390272835113, "grad_norm": 1.203125, "learning_rate": 0.00022700000000000002, "loss": 6.595, "mean_token_accuracy": 0.08999119028449058, "num_tokens": 1307426.0, "step": 455 }, { "entropy": 6.900823402404785, "epoch": 0.5456702253855279, "grad_norm": 1.125, "learning_rate": 0.00022950000000000002, "loss": 6.6162, "mean_token_accuracy": 0.09043457433581352, "num_tokens": 1322167.0, "step": 460 }, { "entropy": 6.999922370910644, "epoch": 0.5516014234875445, "grad_norm": 1.1875, "learning_rate": 0.00023200000000000003, "loss": 6.4976, "mean_token_accuracy": 0.09610431045293807, "num_tokens": 1335343.0, "step": 465 }, { "entropy": 6.857682752609253, "epoch": 0.5575326215895611, "grad_norm": 1.078125, "learning_rate": 0.00023449999999999998, "loss": 6.4976, "mean_token_accuracy": 0.09826786443591118, "num_tokens": 1349078.0, "step": 470 }, { "entropy": 6.899160289764405, "epoch": 0.5634638196915777, "grad_norm": 1.3203125, "learning_rate": 0.000237, "loss": 6.4224, "mean_token_accuracy": 0.1049638457596302, "num_tokens": 1362030.0, "step": 475 }, { "entropy": 6.993446207046508, "epoch": 0.5693950177935944, "grad_norm": 1.609375, "learning_rate": 0.0002395, "loss": 6.5763, "mean_token_accuracy": 0.08985362276434898, "num_tokens": 1378303.0, "step": 480 }, { "entropy": 6.935125350952148, "epoch": 0.575326215895611, "grad_norm": 1.1875, "learning_rate": 0.000242, "loss": 6.5767, "mean_token_accuracy": 0.09316942617297172, "num_tokens": 1392585.0, "step": 485 }, { "entropy": 6.9703733921051025, "epoch": 0.5812574139976275, "grad_norm": 1.75, "learning_rate": 0.0002445, "loss": 6.5814, "mean_token_accuracy": 0.09292712658643723, "num_tokens": 1406962.0, "step": 490 }, { "entropy": 6.836954164505005, "epoch": 0.5871886120996441, "grad_norm": 1.265625, "learning_rate": 0.000247, "loss": 6.4605, "mean_token_accuracy": 0.09848191663622856, "num_tokens": 1419493.0, "step": 495 }, { "entropy": 6.868243980407715, "epoch": 0.5931198102016607, "grad_norm": 1.40625, "learning_rate": 0.0002495, "loss": 6.4801, "mean_token_accuracy": 0.09710933044552802, "num_tokens": 1435373.0, "step": 500 }, { "epoch": 0.5931198102016607, "eval_entropy": 6.868733419231111, "eval_loss": 6.604183673858643, "eval_mean_token_accuracy": 0.09870429635276458, "eval_num_tokens": 1435373.0, "eval_runtime": 2.5304, "eval_samples_per_second": 1030.674, "eval_steps_per_second": 128.834, "step": 500 }, { "entropy": 6.877611589431763, "epoch": 0.5990510083036773, "grad_norm": 1.28125, "learning_rate": 0.000252, "loss": 6.4385, "mean_token_accuracy": 0.10158890634775161, "num_tokens": 1449805.0, "step": 505 }, { "entropy": 6.82432370185852, "epoch": 0.604982206405694, "grad_norm": 1.1328125, "learning_rate": 0.0002545, "loss": 6.4667, "mean_token_accuracy": 0.09393253624439239, "num_tokens": 1463657.0, "step": 510 }, { "entropy": 6.9438111782073975, "epoch": 0.6109134045077106, "grad_norm": 1.375, "learning_rate": 0.000257, "loss": 6.4667, "mean_token_accuracy": 0.10057351440191269, "num_tokens": 1478089.0, "step": 515 }, { "entropy": 6.7661386013031, "epoch": 0.6168446026097272, "grad_norm": 1.375, "learning_rate": 0.0002595, "loss": 6.4698, "mean_token_accuracy": 0.10367124900221825, "num_tokens": 1492225.0, "step": 520 }, { "entropy": 6.823407316207886, "epoch": 0.6227758007117438, "grad_norm": 1.515625, "learning_rate": 0.000262, "loss": 6.4847, "mean_token_accuracy": 0.0941373310983181, "num_tokens": 1506751.0, "step": 525 }, { "entropy": 6.816655206680298, "epoch": 0.6287069988137604, "grad_norm": 1.1015625, "learning_rate": 0.00026450000000000003, "loss": 6.3687, "mean_token_accuracy": 0.10237260162830353, "num_tokens": 1520590.0, "step": 530 }, { "entropy": 6.7571464538574215, "epoch": 0.6346381969157769, "grad_norm": 1.1328125, "learning_rate": 0.00026700000000000004, "loss": 6.4174, "mean_token_accuracy": 0.1001747913658619, "num_tokens": 1534752.0, "step": 535 }, { "entropy": 6.783740854263305, "epoch": 0.6405693950177936, "grad_norm": 1.21875, "learning_rate": 0.00026950000000000005, "loss": 6.3769, "mean_token_accuracy": 0.10932414084672928, "num_tokens": 1547891.0, "step": 540 }, { "entropy": 6.724957847595215, "epoch": 0.6465005931198102, "grad_norm": 1.375, "learning_rate": 0.00027200000000000005, "loss": 6.3247, "mean_token_accuracy": 0.10839766561985016, "num_tokens": 1562560.0, "step": 545 }, { "entropy": 6.809849119186401, "epoch": 0.6524317912218268, "grad_norm": 1.3203125, "learning_rate": 0.0002745, "loss": 6.4654, "mean_token_accuracy": 0.10033882036805153, "num_tokens": 1576896.0, "step": 550 }, { "entropy": 6.732705163955688, "epoch": 0.6583629893238434, "grad_norm": 1.234375, "learning_rate": 0.000277, "loss": 6.3496, "mean_token_accuracy": 0.10360537618398666, "num_tokens": 1590806.0, "step": 555 }, { "entropy": 6.740630769729615, "epoch": 0.66429418742586, "grad_norm": 1.3984375, "learning_rate": 0.0002795, "loss": 6.4697, "mean_token_accuracy": 0.09847484454512596, "num_tokens": 1605874.0, "step": 560 }, { "entropy": 6.772911071777344, "epoch": 0.6702253855278766, "grad_norm": 1.21875, "learning_rate": 0.00028199999999999997, "loss": 6.3582, "mean_token_accuracy": 0.10450243502855301, "num_tokens": 1620947.0, "step": 565 }, { "entropy": 6.672332429885865, "epoch": 0.6761565836298933, "grad_norm": 1.6796875, "learning_rate": 0.0002845, "loss": 6.393, "mean_token_accuracy": 0.0936239667236805, "num_tokens": 1635974.0, "step": 570 }, { "entropy": 6.685958909988403, "epoch": 0.6820877817319099, "grad_norm": 1.078125, "learning_rate": 0.000287, "loss": 6.3661, "mean_token_accuracy": 0.10207983180880546, "num_tokens": 1651502.0, "step": 575 }, { "entropy": 6.668765211105347, "epoch": 0.6880189798339265, "grad_norm": 1.15625, "learning_rate": 0.0002895, "loss": 6.3031, "mean_token_accuracy": 0.10794700905680657, "num_tokens": 1665547.0, "step": 580 }, { "entropy": 6.6357416152954105, "epoch": 0.693950177935943, "grad_norm": 1.1640625, "learning_rate": 0.000292, "loss": 6.2873, "mean_token_accuracy": 0.10822367817163467, "num_tokens": 1678875.0, "step": 585 }, { "entropy": 6.671806287765503, "epoch": 0.6998813760379596, "grad_norm": 1.28125, "learning_rate": 0.0002945, "loss": 6.3113, "mean_token_accuracy": 0.10574031621217728, "num_tokens": 1692673.0, "step": 590 }, { "entropy": 6.649136257171631, "epoch": 0.7058125741399762, "grad_norm": 1.2421875, "learning_rate": 0.000297, "loss": 6.3549, "mean_token_accuracy": 0.10422232896089553, "num_tokens": 1707318.0, "step": 595 }, { "entropy": 6.6383771896362305, "epoch": 0.7117437722419929, "grad_norm": 1.4921875, "learning_rate": 0.0002995, "loss": 6.3908, "mean_token_accuracy": 0.09859651327133179, "num_tokens": 1724331.0, "step": 600 }, { "entropy": 6.54994387626648, "epoch": 0.7176749703440095, "grad_norm": 1.359375, "learning_rate": 0.000302, "loss": 6.1816, "mean_token_accuracy": 0.11202944293618203, "num_tokens": 1736151.0, "step": 605 }, { "entropy": 6.531128454208374, "epoch": 0.7236061684460261, "grad_norm": 1.296875, "learning_rate": 0.0003045, "loss": 6.2535, "mean_token_accuracy": 0.11085337772965431, "num_tokens": 1749831.0, "step": 610 }, { "entropy": 6.670119380950927, "epoch": 0.7295373665480427, "grad_norm": 1.1796875, "learning_rate": 0.000307, "loss": 6.3033, "mean_token_accuracy": 0.10853635594248771, "num_tokens": 1764296.0, "step": 615 }, { "entropy": 6.622691011428833, "epoch": 0.7354685646500593, "grad_norm": 1.359375, "learning_rate": 0.0003095, "loss": 6.274, "mean_token_accuracy": 0.11076630353927612, "num_tokens": 1778042.0, "step": 620 }, { "entropy": 6.569571828842163, "epoch": 0.741399762752076, "grad_norm": 1.359375, "learning_rate": 0.000312, "loss": 6.2567, "mean_token_accuracy": 0.11235617473721504, "num_tokens": 1791614.0, "step": 625 }, { "entropy": 6.480262708663941, "epoch": 0.7473309608540926, "grad_norm": 1.1796875, "learning_rate": 0.0003145, "loss": 6.2203, "mean_token_accuracy": 0.10766129791736603, "num_tokens": 1807388.0, "step": 630 }, { "entropy": 6.692783164978027, "epoch": 0.7532621589561092, "grad_norm": 1.25, "learning_rate": 0.000317, "loss": 6.3265, "mean_token_accuracy": 0.10339825823903084, "num_tokens": 1820407.0, "step": 635 }, { "entropy": 6.493888711929321, "epoch": 0.7591933570581257, "grad_norm": 1.296875, "learning_rate": 0.0003195, "loss": 6.2041, "mean_token_accuracy": 0.11163504943251609, "num_tokens": 1834666.0, "step": 640 }, { "entropy": 6.516778469085693, "epoch": 0.7651245551601423, "grad_norm": 1.3671875, "learning_rate": 0.000322, "loss": 6.2915, "mean_token_accuracy": 0.10899070277810097, "num_tokens": 1848160.0, "step": 645 }, { "entropy": 6.624192810058593, "epoch": 0.7710557532621589, "grad_norm": 1.1484375, "learning_rate": 0.00032450000000000003, "loss": 6.3004, "mean_token_accuracy": 0.11020564585924149, "num_tokens": 1865140.0, "step": 650 }, { "entropy": 6.473660230636597, "epoch": 0.7769869513641756, "grad_norm": 1.078125, "learning_rate": 0.00032700000000000003, "loss": 6.1704, "mean_token_accuracy": 0.11627639755606652, "num_tokens": 1878447.0, "step": 655 }, { "entropy": 6.505875301361084, "epoch": 0.7829181494661922, "grad_norm": 1.2421875, "learning_rate": 0.00032950000000000004, "loss": 6.2289, "mean_token_accuracy": 0.11153926998376847, "num_tokens": 1893539.0, "step": 660 }, { "entropy": 6.592386484146118, "epoch": 0.7888493475682088, "grad_norm": 1.203125, "learning_rate": 0.00033200000000000005, "loss": 6.2853, "mean_token_accuracy": 0.11337760239839553, "num_tokens": 1908052.0, "step": 665 }, { "entropy": 6.493582057952881, "epoch": 0.7947805456702254, "grad_norm": 1.3984375, "learning_rate": 0.00033450000000000005, "loss": 6.1767, "mean_token_accuracy": 0.11641135811805725, "num_tokens": 1921528.0, "step": 670 }, { "entropy": 6.502324628829956, "epoch": 0.800711743772242, "grad_norm": 1.2734375, "learning_rate": 0.000337, "loss": 6.1962, "mean_token_accuracy": 0.11467067450284958, "num_tokens": 1935089.0, "step": 675 }, { "entropy": 6.515084457397461, "epoch": 0.8066429418742586, "grad_norm": 1.1953125, "learning_rate": 0.0003395, "loss": 6.3085, "mean_token_accuracy": 0.10803200528025628, "num_tokens": 1949717.0, "step": 680 }, { "entropy": 6.477928495407104, "epoch": 0.8125741399762753, "grad_norm": 1.3671875, "learning_rate": 0.000342, "loss": 6.171, "mean_token_accuracy": 0.11270654797554017, "num_tokens": 1962619.0, "step": 685 }, { "entropy": 6.589840030670166, "epoch": 0.8185053380782918, "grad_norm": 1.421875, "learning_rate": 0.00034449999999999997, "loss": 6.2633, "mean_token_accuracy": 0.1094804771244526, "num_tokens": 1977094.0, "step": 690 }, { "entropy": 6.4256690502166744, "epoch": 0.8244365361803084, "grad_norm": 1.234375, "learning_rate": 0.000347, "loss": 6.2222, "mean_token_accuracy": 0.10567561089992523, "num_tokens": 1992446.0, "step": 695 }, { "entropy": 6.449682807922363, "epoch": 0.830367734282325, "grad_norm": 1.1796875, "learning_rate": 0.0003495, "loss": 6.1737, "mean_token_accuracy": 0.11305198296904564, "num_tokens": 2008753.0, "step": 700 }, { "entropy": 6.401576709747315, "epoch": 0.8362989323843416, "grad_norm": 1.2265625, "learning_rate": 0.000352, "loss": 6.1256, "mean_token_accuracy": 0.11778818741440773, "num_tokens": 2024088.0, "step": 705 }, { "entropy": 6.476001882553101, "epoch": 0.8422301304863582, "grad_norm": 1.2578125, "learning_rate": 0.0003545, "loss": 6.1461, "mean_token_accuracy": 0.11078088879585266, "num_tokens": 2038449.0, "step": 710 }, { "entropy": 6.4743701934814455, "epoch": 0.8481613285883749, "grad_norm": 1.2265625, "learning_rate": 0.000357, "loss": 6.131, "mean_token_accuracy": 0.12273426279425621, "num_tokens": 2052038.0, "step": 715 }, { "entropy": 6.402703428268433, "epoch": 0.8540925266903915, "grad_norm": 1.25, "learning_rate": 0.0003595, "loss": 6.071, "mean_token_accuracy": 0.11885945498943329, "num_tokens": 2064907.0, "step": 720 }, { "entropy": 6.448020601272583, "epoch": 0.8600237247924081, "grad_norm": 0.98828125, "learning_rate": 0.000362, "loss": 6.2535, "mean_token_accuracy": 0.11163201704621314, "num_tokens": 2081295.0, "step": 725 }, { "entropy": 6.399222040176392, "epoch": 0.8659549228944247, "grad_norm": 1.1640625, "learning_rate": 0.0003645, "loss": 6.178, "mean_token_accuracy": 0.11559945717453957, "num_tokens": 2098077.0, "step": 730 }, { "entropy": 6.422470808029175, "epoch": 0.8718861209964412, "grad_norm": 1.3671875, "learning_rate": 0.000367, "loss": 6.1573, "mean_token_accuracy": 0.11710702180862427, "num_tokens": 2111716.0, "step": 735 }, { "entropy": 6.352961158752441, "epoch": 0.8778173190984578, "grad_norm": 1.4609375, "learning_rate": 0.0003695, "loss": 6.0612, "mean_token_accuracy": 0.12471788600087166, "num_tokens": 2125757.0, "step": 740 }, { "entropy": 6.467966890335083, "epoch": 0.8837485172004745, "grad_norm": 1.15625, "learning_rate": 0.000372, "loss": 6.2669, "mean_token_accuracy": 0.11346666887402534, "num_tokens": 2142929.0, "step": 745 }, { "entropy": 6.385439872741699, "epoch": 0.8896797153024911, "grad_norm": 1.4296875, "learning_rate": 0.0003745, "loss": 6.1379, "mean_token_accuracy": 0.11529970616102218, "num_tokens": 2155206.0, "step": 750 }, { "entropy": 6.316713285446167, "epoch": 0.8956109134045077, "grad_norm": 1.203125, "learning_rate": 0.000377, "loss": 6.0204, "mean_token_accuracy": 0.1224408395588398, "num_tokens": 2169816.0, "step": 755 }, { "entropy": 6.3729979515075685, "epoch": 0.9015421115065243, "grad_norm": 1.078125, "learning_rate": 0.0003795, "loss": 6.106, "mean_token_accuracy": 0.11994262486696243, "num_tokens": 2184827.0, "step": 760 }, { "entropy": 6.261362934112549, "epoch": 0.9074733096085409, "grad_norm": 1.3046875, "learning_rate": 0.000382, "loss": 6.0392, "mean_token_accuracy": 0.11882986202836036, "num_tokens": 2199333.0, "step": 765 }, { "entropy": 6.316654014587402, "epoch": 0.9134045077105575, "grad_norm": 0.921875, "learning_rate": 0.0003845, "loss": 6.0836, "mean_token_accuracy": 0.12039939314126968, "num_tokens": 2215239.0, "step": 770 }, { "entropy": 6.3938861846923825, "epoch": 0.9193357058125742, "grad_norm": 1.15625, "learning_rate": 0.00038700000000000003, "loss": 6.085, "mean_token_accuracy": 0.1213831715285778, "num_tokens": 2229369.0, "step": 775 }, { "entropy": 6.262855195999146, "epoch": 0.9252669039145908, "grad_norm": 1.125, "learning_rate": 0.00038950000000000003, "loss": 6.0793, "mean_token_accuracy": 0.12699812799692153, "num_tokens": 2242709.0, "step": 780 }, { "entropy": 6.378830051422119, "epoch": 0.9311981020166074, "grad_norm": 1.140625, "learning_rate": 0.00039200000000000004, "loss": 6.0655, "mean_token_accuracy": 0.11725454851984977, "num_tokens": 2257067.0, "step": 785 }, { "entropy": 6.268696022033692, "epoch": 0.9371293001186239, "grad_norm": 1.203125, "learning_rate": 0.00039450000000000005, "loss": 6.0146, "mean_token_accuracy": 0.12406265735626221, "num_tokens": 2270932.0, "step": 790 }, { "entropy": 6.312669181823731, "epoch": 0.9430604982206405, "grad_norm": 1.09375, "learning_rate": 0.00039700000000000005, "loss": 6.109, "mean_token_accuracy": 0.11879168227314948, "num_tokens": 2285517.0, "step": 795 }, { "entropy": 6.1997991561889645, "epoch": 0.9489916963226572, "grad_norm": 1.09375, "learning_rate": 0.0003995, "loss": 5.9847, "mean_token_accuracy": 0.12326976284384727, "num_tokens": 2298657.0, "step": 800 }, { "entropy": 6.30251636505127, "epoch": 0.9549228944246738, "grad_norm": 1.171875, "learning_rate": 0.000402, "loss": 5.9947, "mean_token_accuracy": 0.1275511786341667, "num_tokens": 2312521.0, "step": 805 }, { "entropy": 6.245606517791748, "epoch": 0.9608540925266904, "grad_norm": 1.28125, "learning_rate": 0.0004045, "loss": 5.98, "mean_token_accuracy": 0.12642857506871225, "num_tokens": 2325849.0, "step": 810 }, { "entropy": 6.244391679763794, "epoch": 0.966785290628707, "grad_norm": 1.3125, "learning_rate": 0.00040699999999999997, "loss": 6.0049, "mean_token_accuracy": 0.12391034886240959, "num_tokens": 2339717.0, "step": 815 }, { "entropy": 6.243370532989502, "epoch": 0.9727164887307236, "grad_norm": 1.125, "learning_rate": 0.0004095, "loss": 6.0679, "mean_token_accuracy": 0.12291354686021805, "num_tokens": 2353536.0, "step": 820 }, { "entropy": 6.279402780532837, "epoch": 0.9786476868327402, "grad_norm": 1.265625, "learning_rate": 0.000412, "loss": 6.0335, "mean_token_accuracy": 0.11777281686663628, "num_tokens": 2368626.0, "step": 825 }, { "entropy": 6.269067335128784, "epoch": 0.9845788849347569, "grad_norm": 1.2265625, "learning_rate": 0.0004145, "loss": 6.0985, "mean_token_accuracy": 0.12023787796497346, "num_tokens": 2383768.0, "step": 830 }, { "entropy": 6.300761365890503, "epoch": 0.9905100830367735, "grad_norm": 1.2265625, "learning_rate": 0.000417, "loss": 6.1254, "mean_token_accuracy": 0.12162568196654319, "num_tokens": 2398089.0, "step": 835 }, { "entropy": 6.220589017868042, "epoch": 0.99644128113879, "grad_norm": 1.1015625, "learning_rate": 0.0004195, "loss": 5.992, "mean_token_accuracy": 0.12641523778438568, "num_tokens": 2411354.0, "step": 840 }, { "entropy": 6.249312019348144, "epoch": 1.0023724792408066, "grad_norm": 1.015625, "learning_rate": 0.000422, "loss": 5.9945, "mean_token_accuracy": 0.12419759780168534, "num_tokens": 2425071.0, "step": 845 }, { "entropy": 6.2975963115692135, "epoch": 1.0083036773428233, "grad_norm": 1.1796875, "learning_rate": 0.0004245, "loss": 5.9569, "mean_token_accuracy": 0.13322616517543792, "num_tokens": 2439143.0, "step": 850 }, { "entropy": 6.093033933639527, "epoch": 1.0142348754448398, "grad_norm": 1.0078125, "learning_rate": 0.000427, "loss": 5.7989, "mean_token_accuracy": 0.12915606275200844, "num_tokens": 2453466.0, "step": 855 }, { "entropy": 6.169495487213135, "epoch": 1.0201660735468565, "grad_norm": 1.2734375, "learning_rate": 0.0004295, "loss": 5.9269, "mean_token_accuracy": 0.13161411434412001, "num_tokens": 2466802.0, "step": 860 }, { "entropy": 6.1576333999633786, "epoch": 1.026097271648873, "grad_norm": 1.1875, "learning_rate": 0.000432, "loss": 5.8612, "mean_token_accuracy": 0.13197067752480507, "num_tokens": 2480080.0, "step": 865 }, { "entropy": 6.120718669891358, "epoch": 1.0320284697508897, "grad_norm": 1.2890625, "learning_rate": 0.0004345, "loss": 5.9076, "mean_token_accuracy": 0.13211096227169036, "num_tokens": 2495196.0, "step": 870 }, { "entropy": 6.083641386032104, "epoch": 1.0379596678529064, "grad_norm": 1.15625, "learning_rate": 0.000437, "loss": 5.8176, "mean_token_accuracy": 0.12702380120754242, "num_tokens": 2510084.0, "step": 875 }, { "entropy": 6.16945514678955, "epoch": 1.0438908659549229, "grad_norm": 1.25, "learning_rate": 0.0004395, "loss": 5.8956, "mean_token_accuracy": 0.1281700126826763, "num_tokens": 2522834.0, "step": 880 }, { "entropy": 6.146343135833741, "epoch": 1.0498220640569396, "grad_norm": 1.1328125, "learning_rate": 0.000442, "loss": 5.8657, "mean_token_accuracy": 0.13543630614876748, "num_tokens": 2536778.0, "step": 885 }, { "entropy": 6.07814359664917, "epoch": 1.055753262158956, "grad_norm": 1.265625, "learning_rate": 0.0004445, "loss": 5.9005, "mean_token_accuracy": 0.13273447826504708, "num_tokens": 2551220.0, "step": 890 }, { "entropy": 6.273546886444092, "epoch": 1.0616844602609727, "grad_norm": 1.1796875, "learning_rate": 0.000447, "loss": 5.9534, "mean_token_accuracy": 0.12553919553756715, "num_tokens": 2565686.0, "step": 895 }, { "entropy": 6.094685745239258, "epoch": 1.0676156583629894, "grad_norm": 1.140625, "learning_rate": 0.00044950000000000003, "loss": 5.8687, "mean_token_accuracy": 0.12925135344266891, "num_tokens": 2579569.0, "step": 900 }, { "entropy": 6.097094774246216, "epoch": 1.073546856465006, "grad_norm": 1.5546875, "learning_rate": 0.00045200000000000004, "loss": 5.8717, "mean_token_accuracy": 0.12844056114554406, "num_tokens": 2593226.0, "step": 905 }, { "entropy": 6.054626512527466, "epoch": 1.0794780545670226, "grad_norm": 1.1015625, "learning_rate": 0.00045450000000000004, "loss": 5.8381, "mean_token_accuracy": 0.13379990607500075, "num_tokens": 2607711.0, "step": 910 }, { "entropy": 6.059130144119263, "epoch": 1.085409252669039, "grad_norm": 1.1171875, "learning_rate": 0.00045700000000000005, "loss": 5.8697, "mean_token_accuracy": 0.130379880964756, "num_tokens": 2623024.0, "step": 915 }, { "entropy": 6.079943466186523, "epoch": 1.0913404507710558, "grad_norm": 1.078125, "learning_rate": 0.00045950000000000006, "loss": 5.8499, "mean_token_accuracy": 0.12744099125266076, "num_tokens": 2637824.0, "step": 920 }, { "entropy": 6.051183843612671, "epoch": 1.0972716488730723, "grad_norm": 1.2421875, "learning_rate": 0.000462, "loss": 5.8486, "mean_token_accuracy": 0.13178792968392372, "num_tokens": 2652077.0, "step": 925 }, { "entropy": 6.085985422134399, "epoch": 1.103202846975089, "grad_norm": 1.2265625, "learning_rate": 0.0004645, "loss": 5.8555, "mean_token_accuracy": 0.1309271603822708, "num_tokens": 2666791.0, "step": 930 }, { "entropy": 6.091299629211425, "epoch": 1.1091340450771057, "grad_norm": 0.9765625, "learning_rate": 0.000467, "loss": 5.9439, "mean_token_accuracy": 0.12866507172584535, "num_tokens": 2681482.0, "step": 935 }, { "entropy": 6.0315086364746096, "epoch": 1.1150652431791221, "grad_norm": 1.046875, "learning_rate": 0.0004695, "loss": 5.7415, "mean_token_accuracy": 0.13911210745573044, "num_tokens": 2695305.0, "step": 940 }, { "entropy": 6.070809412002563, "epoch": 1.1209964412811388, "grad_norm": 1.125, "learning_rate": 0.000472, "loss": 5.81, "mean_token_accuracy": 0.13352661579847336, "num_tokens": 2712211.0, "step": 945 }, { "entropy": 6.029483652114868, "epoch": 1.1269276393831553, "grad_norm": 1.0859375, "learning_rate": 0.0004745, "loss": 5.8556, "mean_token_accuracy": 0.13038185760378837, "num_tokens": 2726888.0, "step": 950 }, { "entropy": 6.026515007019043, "epoch": 1.132858837485172, "grad_norm": 1.1015625, "learning_rate": 0.000477, "loss": 5.8209, "mean_token_accuracy": 0.1355987899005413, "num_tokens": 2741734.0, "step": 955 }, { "entropy": 6.002088499069214, "epoch": 1.1387900355871885, "grad_norm": 1.2890625, "learning_rate": 0.0004795, "loss": 5.8273, "mean_token_accuracy": 0.13999779522418976, "num_tokens": 2754680.0, "step": 960 }, { "entropy": 6.053714990615845, "epoch": 1.1447212336892052, "grad_norm": 1.2109375, "learning_rate": 0.000482, "loss": 5.8717, "mean_token_accuracy": 0.12814902439713477, "num_tokens": 2769572.0, "step": 965 }, { "entropy": 6.109354639053345, "epoch": 1.150652431791222, "grad_norm": 1.3125, "learning_rate": 0.0004845, "loss": 5.8165, "mean_token_accuracy": 0.12989651635289193, "num_tokens": 2782948.0, "step": 970 }, { "entropy": 5.920255517959594, "epoch": 1.1565836298932384, "grad_norm": 1.03125, "learning_rate": 0.000487, "loss": 5.7569, "mean_token_accuracy": 0.13256713449954988, "num_tokens": 2795399.0, "step": 975 }, { "entropy": 5.974841451644897, "epoch": 1.162514827995255, "grad_norm": 1.203125, "learning_rate": 0.0004895, "loss": 5.7628, "mean_token_accuracy": 0.13333625793457032, "num_tokens": 2809591.0, "step": 980 }, { "entropy": 6.011464214324951, "epoch": 1.1684460260972718, "grad_norm": 1.0546875, "learning_rate": 0.000492, "loss": 5.7889, "mean_token_accuracy": 0.13518815189599992, "num_tokens": 2824106.0, "step": 985 }, { "entropy": 6.024096918106079, "epoch": 1.1743772241992882, "grad_norm": 1.109375, "learning_rate": 0.0004945, "loss": 5.9184, "mean_token_accuracy": 0.12920955419540406, "num_tokens": 2838616.0, "step": 990 }, { "entropy": 5.981972026824951, "epoch": 1.180308422301305, "grad_norm": 1.3046875, "learning_rate": 0.000497, "loss": 5.798, "mean_token_accuracy": 0.13885542377829552, "num_tokens": 2851707.0, "step": 995 }, { "entropy": 6.011092615127564, "epoch": 1.1862396204033214, "grad_norm": 1.0390625, "learning_rate": 0.0004995, "loss": 5.8358, "mean_token_accuracy": 0.1295635662972927, "num_tokens": 2867644.0, "step": 1000 }, { "epoch": 1.1862396204033214, "eval_entropy": 5.97049690024253, "eval_loss": 6.048816204071045, "eval_mean_token_accuracy": 0.130689339495144, "eval_num_tokens": 2867644.0, "eval_runtime": 2.4358, "eval_samples_per_second": 1070.705, "eval_steps_per_second": 133.838, "step": 1000 }, { "entropy": 6.003067874908448, "epoch": 1.1921708185053381, "grad_norm": 1.0390625, "learning_rate": 0.00049999967732573, "loss": 5.8347, "mean_token_accuracy": 0.12673901543021202, "num_tokens": 2882663.0, "step": 1005 }, { "entropy": 6.0496416091918945, "epoch": 1.1981020166073546, "grad_norm": 1.203125, "learning_rate": 0.0004999983664630945, "loss": 5.8902, "mean_token_accuracy": 0.1319477692246437, "num_tokens": 2898791.0, "step": 1010 }, { "entropy": 5.922034502029419, "epoch": 1.2040332147093713, "grad_norm": 1.0390625, "learning_rate": 0.0004999960472508219, "loss": 5.7771, "mean_token_accuracy": 0.13882209360599518, "num_tokens": 2912997.0, "step": 1015 }, { "entropy": 5.958587026596069, "epoch": 1.209964412811388, "grad_norm": 1.1015625, "learning_rate": 0.0004999927196993059, "loss": 5.7702, "mean_token_accuracy": 0.13983350694179536, "num_tokens": 2925064.0, "step": 1020 }, { "entropy": 6.004720687866211, "epoch": 1.2158956109134045, "grad_norm": 1.125, "learning_rate": 0.0004999883838234592, "loss": 5.8331, "mean_token_accuracy": 0.1291055254638195, "num_tokens": 2941400.0, "step": 1025 }, { "entropy": 5.947526121139527, "epoch": 1.2218268090154212, "grad_norm": 1.0703125, "learning_rate": 0.0004999830396427133, "loss": 5.8063, "mean_token_accuracy": 0.1374014362692833, "num_tokens": 2955541.0, "step": 1030 }, { "entropy": 5.969132947921753, "epoch": 1.2277580071174377, "grad_norm": 1.078125, "learning_rate": 0.0004999766871810188, "loss": 5.8038, "mean_token_accuracy": 0.13658639341592788, "num_tokens": 2968928.0, "step": 1035 }, { "entropy": 6.005309391021728, "epoch": 1.2336892052194544, "grad_norm": 1.0234375, "learning_rate": 0.0004999693264668446, "loss": 5.748, "mean_token_accuracy": 0.13989535421133042, "num_tokens": 2984072.0, "step": 1040 }, { "entropy": 5.915805292129517, "epoch": 1.2396204033214708, "grad_norm": 0.97265625, "learning_rate": 0.0004999609575331786, "loss": 5.8379, "mean_token_accuracy": 0.13512861132621765, "num_tokens": 2999083.0, "step": 1045 }, { "entropy": 5.936822700500488, "epoch": 1.2455516014234875, "grad_norm": 1.0859375, "learning_rate": 0.0004999515804175268, "loss": 5.7715, "mean_token_accuracy": 0.13389404788613318, "num_tokens": 3012738.0, "step": 1050 }, { "entropy": 5.919717836380005, "epoch": 1.2514827995255042, "grad_norm": 1.1484375, "learning_rate": 0.0004999411951619134, "loss": 5.7231, "mean_token_accuracy": 0.14047607854008676, "num_tokens": 3027929.0, "step": 1055 }, { "entropy": 5.967278051376343, "epoch": 1.2574139976275207, "grad_norm": 0.95703125, "learning_rate": 0.000499929801812881, "loss": 5.8651, "mean_token_accuracy": 0.1260008007287979, "num_tokens": 3043576.0, "step": 1060 }, { "entropy": 5.859627962112427, "epoch": 1.2633451957295374, "grad_norm": 1.0390625, "learning_rate": 0.0004999174004214899, "loss": 5.7148, "mean_token_accuracy": 0.13711703568696976, "num_tokens": 3059352.0, "step": 1065 }, { "entropy": 6.000982999801636, "epoch": 1.269276393831554, "grad_norm": 1.234375, "learning_rate": 0.0004999039910433179, "loss": 5.8426, "mean_token_accuracy": 0.14122046902775764, "num_tokens": 3073140.0, "step": 1070 }, { "entropy": 5.896023321151733, "epoch": 1.2752075919335706, "grad_norm": 1.0625, "learning_rate": 0.0004998895737384605, "loss": 5.818, "mean_token_accuracy": 0.137306509912014, "num_tokens": 3087710.0, "step": 1075 }, { "entropy": 5.961836051940918, "epoch": 1.281138790035587, "grad_norm": 1.0390625, "learning_rate": 0.0004998741485715297, "loss": 5.7594, "mean_token_accuracy": 0.13758910968899726, "num_tokens": 3102035.0, "step": 1080 }, { "entropy": 5.8731317043304445, "epoch": 1.2870699881376038, "grad_norm": 0.93359375, "learning_rate": 0.0004998577156116551, "loss": 5.8223, "mean_token_accuracy": 0.13428573533892632, "num_tokens": 3118534.0, "step": 1085 }, { "entropy": 5.9692919731140135, "epoch": 1.2930011862396205, "grad_norm": 0.953125, "learning_rate": 0.0004998402749324823, "loss": 5.7653, "mean_token_accuracy": 0.12841569781303405, "num_tokens": 3133419.0, "step": 1090 }, { "entropy": 5.975205659866333, "epoch": 1.298932384341637, "grad_norm": 1.21875, "learning_rate": 0.0004998218266121731, "loss": 5.861, "mean_token_accuracy": 0.1412831462919712, "num_tokens": 3145903.0, "step": 1095 }, { "entropy": 5.925574588775635, "epoch": 1.3048635824436536, "grad_norm": 1.0234375, "learning_rate": 0.0004998023707334055, "loss": 5.805, "mean_token_accuracy": 0.13825963586568832, "num_tokens": 3159938.0, "step": 1100 }, { "entropy": 5.843659114837647, "epoch": 1.3107947805456703, "grad_norm": 0.9296875, "learning_rate": 0.0004997819073833724, "loss": 5.6987, "mean_token_accuracy": 0.14315861761569976, "num_tokens": 3175089.0, "step": 1105 }, { "entropy": 5.886387014389038, "epoch": 1.3167259786476868, "grad_norm": 1.0625, "learning_rate": 0.0004997604366537823, "loss": 5.833, "mean_token_accuracy": 0.13882801905274392, "num_tokens": 3191027.0, "step": 1110 }, { "entropy": 5.824345541000366, "epoch": 1.3226571767497035, "grad_norm": 1.1015625, "learning_rate": 0.000499737958640858, "loss": 5.6801, "mean_token_accuracy": 0.1453348807990551, "num_tokens": 3205489.0, "step": 1115 }, { "entropy": 5.800811624526977, "epoch": 1.32858837485172, "grad_norm": 0.99609375, "learning_rate": 0.0004997144734453367, "loss": 5.6496, "mean_token_accuracy": 0.14170826822519303, "num_tokens": 3218764.0, "step": 1120 }, { "entropy": 5.964564657211303, "epoch": 1.3345195729537367, "grad_norm": 0.94921875, "learning_rate": 0.0004996899811724693, "loss": 5.7727, "mean_token_accuracy": 0.13682308942079544, "num_tokens": 3232953.0, "step": 1125 }, { "entropy": 5.803732538223267, "epoch": 1.3404507710557532, "grad_norm": 1.0078125, "learning_rate": 0.0004996644819320201, "loss": 5.676, "mean_token_accuracy": 0.1429899662733078, "num_tokens": 3246977.0, "step": 1130 }, { "entropy": 5.727921009063721, "epoch": 1.3463819691577699, "grad_norm": 1.140625, "learning_rate": 0.0004996379758382662, "loss": 5.58, "mean_token_accuracy": 0.14849494844675065, "num_tokens": 3260668.0, "step": 1135 }, { "entropy": 5.879596281051636, "epoch": 1.3523131672597866, "grad_norm": 1.03125, "learning_rate": 0.0004996104630099969, "loss": 5.7056, "mean_token_accuracy": 0.14046500623226166, "num_tokens": 3274213.0, "step": 1140 }, { "entropy": 5.843897438049316, "epoch": 1.358244365361803, "grad_norm": 1.203125, "learning_rate": 0.0004995819435705133, "loss": 5.6817, "mean_token_accuracy": 0.13680549412965776, "num_tokens": 3288011.0, "step": 1145 }, { "entropy": 5.844601249694824, "epoch": 1.3641755634638197, "grad_norm": 0.984375, "learning_rate": 0.0004995524176476277, "loss": 5.7551, "mean_token_accuracy": 0.13818126022815705, "num_tokens": 3303263.0, "step": 1150 }, { "entropy": 5.869444084167481, "epoch": 1.3701067615658362, "grad_norm": 1.0703125, "learning_rate": 0.0004995218853736631, "loss": 5.731, "mean_token_accuracy": 0.14651385322213173, "num_tokens": 3316843.0, "step": 1155 }, { "entropy": 5.764492511749268, "epoch": 1.376037959667853, "grad_norm": 1.0, "learning_rate": 0.0004994903468854527, "loss": 5.5899, "mean_token_accuracy": 0.14461414963006974, "num_tokens": 3331527.0, "step": 1160 }, { "entropy": 5.831653451919555, "epoch": 1.3819691577698694, "grad_norm": 1.015625, "learning_rate": 0.0004994578023243386, "loss": 5.7027, "mean_token_accuracy": 0.14239056706428527, "num_tokens": 3347795.0, "step": 1165 }, { "entropy": 5.8456896305084225, "epoch": 1.387900355871886, "grad_norm": 0.96484375, "learning_rate": 0.0004994242518361723, "loss": 5.7528, "mean_token_accuracy": 0.13648397997021675, "num_tokens": 3363532.0, "step": 1170 }, { "entropy": 5.773947715759277, "epoch": 1.3938315539739028, "grad_norm": 1.1171875, "learning_rate": 0.0004993896955713133, "loss": 5.7159, "mean_token_accuracy": 0.14554002955555917, "num_tokens": 3377040.0, "step": 1175 }, { "entropy": 5.8154942989349365, "epoch": 1.3997627520759193, "grad_norm": 1.1796875, "learning_rate": 0.0004993541336846283, "loss": 5.666, "mean_token_accuracy": 0.1508113294839859, "num_tokens": 3390663.0, "step": 1180 }, { "entropy": 5.816216230392456, "epoch": 1.405693950177936, "grad_norm": 0.93359375, "learning_rate": 0.000499317566335491, "loss": 5.6963, "mean_token_accuracy": 0.1484333947300911, "num_tokens": 3405860.0, "step": 1185 }, { "entropy": 5.797020339965821, "epoch": 1.4116251482799527, "grad_norm": 1.015625, "learning_rate": 0.0004992799936877813, "loss": 5.6734, "mean_token_accuracy": 0.13814794421195983, "num_tokens": 3420248.0, "step": 1190 }, { "entropy": 5.837377595901489, "epoch": 1.4175563463819691, "grad_norm": 1.015625, "learning_rate": 0.0004992414159098841, "loss": 5.6779, "mean_token_accuracy": 0.144036927819252, "num_tokens": 3434126.0, "step": 1195 }, { "entropy": 5.865153551101685, "epoch": 1.4234875444839858, "grad_norm": 1.046875, "learning_rate": 0.0004992018331746891, "loss": 5.728, "mean_token_accuracy": 0.13874396309256554, "num_tokens": 3449462.0, "step": 1200 }, { "entropy": 5.815957403182983, "epoch": 1.4294187425860023, "grad_norm": 0.96484375, "learning_rate": 0.0004991612456595896, "loss": 5.7856, "mean_token_accuracy": 0.1379348635673523, "num_tokens": 3465536.0, "step": 1205 }, { "entropy": 5.77282943725586, "epoch": 1.435349940688019, "grad_norm": 1.125, "learning_rate": 0.0004991196535464824, "loss": 5.675, "mean_token_accuracy": 0.1448883593082428, "num_tokens": 3479129.0, "step": 1210 }, { "entropy": 5.719824647903442, "epoch": 1.4412811387900355, "grad_norm": 1.2421875, "learning_rate": 0.0004990770570217659, "loss": 5.5833, "mean_token_accuracy": 0.15740741640329362, "num_tokens": 3492191.0, "step": 1215 }, { "entropy": 5.840599250793457, "epoch": 1.4472123368920522, "grad_norm": 1.171875, "learning_rate": 0.0004990334562763401, "loss": 5.7191, "mean_token_accuracy": 0.14363316372036933, "num_tokens": 3507459.0, "step": 1220 }, { "entropy": 5.758994436264038, "epoch": 1.453143534994069, "grad_norm": 1.0390625, "learning_rate": 0.0004989888515056057, "loss": 5.6846, "mean_token_accuracy": 0.14048208221793174, "num_tokens": 3521517.0, "step": 1225 }, { "entropy": 5.83376293182373, "epoch": 1.4590747330960854, "grad_norm": 1.03125, "learning_rate": 0.0004989432429094627, "loss": 5.645, "mean_token_accuracy": 0.14501417130231858, "num_tokens": 3535279.0, "step": 1230 }, { "entropy": 5.730698728561402, "epoch": 1.465005931198102, "grad_norm": 0.95703125, "learning_rate": 0.0004988966306923099, "loss": 5.5423, "mean_token_accuracy": 0.15444459170103073, "num_tokens": 3549960.0, "step": 1235 }, { "entropy": 5.7588770389556885, "epoch": 1.4709371293001186, "grad_norm": 1.015625, "learning_rate": 0.0004988490150630441, "loss": 5.6762, "mean_token_accuracy": 0.1423516869544983, "num_tokens": 3563814.0, "step": 1240 }, { "entropy": 5.824617910385132, "epoch": 1.4768683274021353, "grad_norm": 0.98828125, "learning_rate": 0.0004988003962350589, "loss": 5.6802, "mean_token_accuracy": 0.14822768270969391, "num_tokens": 3577529.0, "step": 1245 }, { "entropy": 5.733047246932983, "epoch": 1.4827995255041517, "grad_norm": 1.1328125, "learning_rate": 0.0004987507744262436, "loss": 5.6131, "mean_token_accuracy": 0.1476161688566208, "num_tokens": 3591812.0, "step": 1250 }, { "entropy": 5.68289361000061, "epoch": 1.4887307236061684, "grad_norm": 1.0078125, "learning_rate": 0.0004987001498589828, "loss": 5.5893, "mean_token_accuracy": 0.14960140883922576, "num_tokens": 3604954.0, "step": 1255 }, { "entropy": 5.745348644256592, "epoch": 1.4946619217081851, "grad_norm": 0.9609375, "learning_rate": 0.0004986485227601548, "loss": 5.6545, "mean_token_accuracy": 0.14511096552014352, "num_tokens": 3620486.0, "step": 1260 }, { "entropy": 5.739377021789551, "epoch": 1.5005931198102016, "grad_norm": 0.8671875, "learning_rate": 0.000498595893361131, "loss": 5.5731, "mean_token_accuracy": 0.15375369787216187, "num_tokens": 3633972.0, "step": 1265 }, { "entropy": 5.809413433074951, "epoch": 1.5065243179122183, "grad_norm": 0.98046875, "learning_rate": 0.0004985422618977744, "loss": 5.6275, "mean_token_accuracy": 0.15041894391179084, "num_tokens": 3649306.0, "step": 1270 }, { "entropy": 5.7898821353912355, "epoch": 1.512455516014235, "grad_norm": 0.97265625, "learning_rate": 0.0004984876286104392, "loss": 5.7006, "mean_token_accuracy": 0.14360713064670563, "num_tokens": 3664809.0, "step": 1275 }, { "entropy": 5.734278774261474, "epoch": 1.5183867141162515, "grad_norm": 1.09375, "learning_rate": 0.0004984319937439693, "loss": 5.6463, "mean_token_accuracy": 0.14773811772465706, "num_tokens": 3677669.0, "step": 1280 }, { "entropy": 5.791883563995361, "epoch": 1.524317912218268, "grad_norm": 1.0, "learning_rate": 0.0004983753575476969, "loss": 5.6371, "mean_token_accuracy": 0.1450825333595276, "num_tokens": 3690588.0, "step": 1285 }, { "entropy": 5.810116958618164, "epoch": 1.5302491103202847, "grad_norm": 1.0078125, "learning_rate": 0.0004983177202754421, "loss": 5.6821, "mean_token_accuracy": 0.14587436318397523, "num_tokens": 3703749.0, "step": 1290 }, { "entropy": 5.796082973480225, "epoch": 1.5361803084223014, "grad_norm": 0.8828125, "learning_rate": 0.0004982590821855115, "loss": 5.6986, "mean_token_accuracy": 0.1416331112384796, "num_tokens": 3720181.0, "step": 1295 }, { "entropy": 5.7356054306030275, "epoch": 1.5421115065243178, "grad_norm": 0.9296875, "learning_rate": 0.0004981994435406965, "loss": 5.6172, "mean_token_accuracy": 0.15273793041706085, "num_tokens": 3734918.0, "step": 1300 }, { "entropy": 5.694397592544556, "epoch": 1.5480427046263345, "grad_norm": 0.94921875, "learning_rate": 0.0004981388046082731, "loss": 5.568, "mean_token_accuracy": 0.15164828896522523, "num_tokens": 3748660.0, "step": 1305 }, { "entropy": 5.7075213432312015, "epoch": 1.5539739027283512, "grad_norm": 0.97265625, "learning_rate": 0.0004980771656599998, "loss": 5.6362, "mean_token_accuracy": 0.14845281541347505, "num_tokens": 3763481.0, "step": 1310 }, { "entropy": 5.803341007232666, "epoch": 1.5599051008303677, "grad_norm": 0.9765625, "learning_rate": 0.0004980145269721168, "loss": 5.6529, "mean_token_accuracy": 0.14686342626810073, "num_tokens": 3777077.0, "step": 1315 }, { "entropy": 5.699376630783081, "epoch": 1.5658362989323842, "grad_norm": 0.890625, "learning_rate": 0.000497950888825345, "loss": 5.6558, "mean_token_accuracy": 0.14442251324653627, "num_tokens": 3793649.0, "step": 1320 }, { "entropy": 5.706108856201172, "epoch": 1.571767497034401, "grad_norm": 0.9140625, "learning_rate": 0.000497886251504884, "loss": 5.5359, "mean_token_accuracy": 0.15608448088169097, "num_tokens": 3807712.0, "step": 1325 }, { "entropy": 5.644539451599121, "epoch": 1.5776986951364176, "grad_norm": 0.953125, "learning_rate": 0.0004978206153004117, "loss": 5.5782, "mean_token_accuracy": 0.15468101650476457, "num_tokens": 3821637.0, "step": 1330 }, { "entropy": 5.83319206237793, "epoch": 1.583629893238434, "grad_norm": 1.0234375, "learning_rate": 0.0004977539805060824, "loss": 5.7103, "mean_token_accuracy": 0.1453540086746216, "num_tokens": 3836272.0, "step": 1335 }, { "entropy": 5.648958444595337, "epoch": 1.5895610913404508, "grad_norm": 1.0859375, "learning_rate": 0.0004976863474205257, "loss": 5.5273, "mean_token_accuracy": 0.1518918976187706, "num_tokens": 3850018.0, "step": 1340 }, { "entropy": 5.8174097537994385, "epoch": 1.5954922894424675, "grad_norm": 1.109375, "learning_rate": 0.0004976177163468451, "loss": 5.6052, "mean_token_accuracy": 0.1518917240202427, "num_tokens": 3865061.0, "step": 1345 }, { "entropy": 5.687358045578003, "epoch": 1.601423487544484, "grad_norm": 1.0390625, "learning_rate": 0.0004975480875926168, "loss": 5.6984, "mean_token_accuracy": 0.14721440970897676, "num_tokens": 3879697.0, "step": 1350 }, { "entropy": 5.69095287322998, "epoch": 1.6073546856465006, "grad_norm": 1.1171875, "learning_rate": 0.000497477461469888, "loss": 5.5008, "mean_token_accuracy": 0.15820710659027098, "num_tokens": 3891889.0, "step": 1355 }, { "entropy": 5.717138576507568, "epoch": 1.6132858837485173, "grad_norm": 1.03125, "learning_rate": 0.0004974058382951757, "loss": 5.6056, "mean_token_accuracy": 0.14453255534172058, "num_tokens": 3907356.0, "step": 1360 }, { "entropy": 5.704308366775512, "epoch": 1.6192170818505338, "grad_norm": 1.046875, "learning_rate": 0.0004973332183894653, "loss": 5.5935, "mean_token_accuracy": 0.15117160528898238, "num_tokens": 3921839.0, "step": 1365 }, { "entropy": 5.614565849304199, "epoch": 1.6251482799525503, "grad_norm": 0.93359375, "learning_rate": 0.0004972596020782096, "loss": 5.4939, "mean_token_accuracy": 0.1566345527768135, "num_tokens": 3937266.0, "step": 1370 }, { "entropy": 5.742886257171631, "epoch": 1.631079478054567, "grad_norm": 0.9921875, "learning_rate": 0.0004971849896913259, "loss": 5.631, "mean_token_accuracy": 0.14571579843759536, "num_tokens": 3952721.0, "step": 1375 }, { "entropy": 5.74390230178833, "epoch": 1.6370106761565837, "grad_norm": 1.171875, "learning_rate": 0.0004971093815631965, "loss": 5.64, "mean_token_accuracy": 0.14603027999401091, "num_tokens": 3966557.0, "step": 1380 }, { "entropy": 5.584549236297607, "epoch": 1.6429418742586002, "grad_norm": 0.95703125, "learning_rate": 0.0004970327780326655, "loss": 5.4739, "mean_token_accuracy": 0.15459775924682617, "num_tokens": 3978739.0, "step": 1385 }, { "entropy": 5.584955310821533, "epoch": 1.6488730723606169, "grad_norm": 0.875, "learning_rate": 0.0004969551794430383, "loss": 5.4729, "mean_token_accuracy": 0.1543826073408127, "num_tokens": 3993868.0, "step": 1390 }, { "entropy": 5.754845428466797, "epoch": 1.6548042704626336, "grad_norm": 1.109375, "learning_rate": 0.0004968765861420799, "loss": 5.6204, "mean_token_accuracy": 0.15352840721607208, "num_tokens": 4006661.0, "step": 1395 }, { "entropy": 5.612430429458618, "epoch": 1.66073546856465, "grad_norm": 1.0234375, "learning_rate": 0.0004967969984820128, "loss": 5.5979, "mean_token_accuracy": 0.15308566838502885, "num_tokens": 4021670.0, "step": 1400 }, { "entropy": 5.754387235641479, "epoch": 1.6666666666666665, "grad_norm": 1.015625, "learning_rate": 0.0004967164168195159, "loss": 5.5708, "mean_token_accuracy": 0.15037682205438613, "num_tokens": 4036995.0, "step": 1405 }, { "entropy": 5.684358930587768, "epoch": 1.6725978647686834, "grad_norm": 1.09375, "learning_rate": 0.000496634841515723, "loss": 5.6189, "mean_token_accuracy": 0.1510004997253418, "num_tokens": 4049464.0, "step": 1410 }, { "entropy": 5.670193815231324, "epoch": 1.6785290628707, "grad_norm": 1.0546875, "learning_rate": 0.0004965522729362209, "loss": 5.5126, "mean_token_accuracy": 0.1586139217019081, "num_tokens": 4063630.0, "step": 1415 }, { "entropy": 5.625356912612915, "epoch": 1.6844602609727164, "grad_norm": 1.09375, "learning_rate": 0.0004964687114510478, "loss": 5.5268, "mean_token_accuracy": 0.15081458985805513, "num_tokens": 4079890.0, "step": 1420 }, { "entropy": 5.592355966567993, "epoch": 1.690391459074733, "grad_norm": 0.94921875, "learning_rate": 0.0004963841574346917, "loss": 5.5931, "mean_token_accuracy": 0.1528349280357361, "num_tokens": 4095693.0, "step": 1425 }, { "entropy": 5.809736585617065, "epoch": 1.6963226571767498, "grad_norm": 1.0078125, "learning_rate": 0.0004962986112660887, "loss": 5.6263, "mean_token_accuracy": 0.14935975819826125, "num_tokens": 4109655.0, "step": 1430 }, { "entropy": 5.607567262649536, "epoch": 1.7022538552787663, "grad_norm": 1.015625, "learning_rate": 0.0004962120733286215, "loss": 5.5123, "mean_token_accuracy": 0.15562189668416976, "num_tokens": 4123870.0, "step": 1435 }, { "entropy": 5.743023347854614, "epoch": 1.708185053380783, "grad_norm": 1.0234375, "learning_rate": 0.0004961245440101171, "loss": 5.6319, "mean_token_accuracy": 0.15589529424905776, "num_tokens": 4138009.0, "step": 1440 }, { "entropy": 5.7484697818756105, "epoch": 1.7141162514827997, "grad_norm": 1.078125, "learning_rate": 0.000496036023702846, "loss": 5.729, "mean_token_accuracy": 0.14504553452134133, "num_tokens": 4151929.0, "step": 1445 }, { "entropy": 5.704558658599853, "epoch": 1.7200474495848161, "grad_norm": 1.0390625, "learning_rate": 0.0004959465128035195, "loss": 5.5439, "mean_token_accuracy": 0.1563679590821266, "num_tokens": 4164626.0, "step": 1450 }, { "entropy": 5.6194459915161135, "epoch": 1.7259786476868326, "grad_norm": 0.92578125, "learning_rate": 0.0004958560117132884, "loss": 5.4823, "mean_token_accuracy": 0.15618694126605986, "num_tokens": 4179418.0, "step": 1455 }, { "entropy": 5.661043882369995, "epoch": 1.7319098457888493, "grad_norm": 0.94140625, "learning_rate": 0.0004957645208377411, "loss": 5.6078, "mean_token_accuracy": 0.14679401218891144, "num_tokens": 4194385.0, "step": 1460 }, { "entropy": 5.695458889007568, "epoch": 1.737841043890866, "grad_norm": 0.9375, "learning_rate": 0.000495672040586902, "loss": 5.58, "mean_token_accuracy": 0.1486389935016632, "num_tokens": 4209246.0, "step": 1465 }, { "entropy": 5.590035724639892, "epoch": 1.7437722419928825, "grad_norm": 0.8984375, "learning_rate": 0.0004955785713752292, "loss": 5.512, "mean_token_accuracy": 0.1497904747724533, "num_tokens": 4225142.0, "step": 1470 }, { "entropy": 5.62952733039856, "epoch": 1.7497034400948992, "grad_norm": 0.94140625, "learning_rate": 0.0004954841136216132, "loss": 5.5127, "mean_token_accuracy": 0.1571367785334587, "num_tokens": 4239495.0, "step": 1475 }, { "entropy": 5.631760358810425, "epoch": 1.755634638196916, "grad_norm": 1.078125, "learning_rate": 0.0004953886677493746, "loss": 5.4409, "mean_token_accuracy": 0.16082352101802827, "num_tokens": 4251780.0, "step": 1480 }, { "entropy": 5.635686779022217, "epoch": 1.7615658362989324, "grad_norm": 1.1796875, "learning_rate": 0.0004952922341862622, "loss": 5.6989, "mean_token_accuracy": 0.1460478313267231, "num_tokens": 4265490.0, "step": 1485 }, { "entropy": 5.635773324966431, "epoch": 1.7674970344009489, "grad_norm": 0.9609375, "learning_rate": 0.0004951948133644514, "loss": 5.4532, "mean_token_accuracy": 0.1595569834113121, "num_tokens": 4280478.0, "step": 1490 }, { "entropy": 5.658703470230103, "epoch": 1.7734282325029656, "grad_norm": 0.89453125, "learning_rate": 0.0004950964057205421, "loss": 5.5446, "mean_token_accuracy": 0.15271539092063904, "num_tokens": 4296649.0, "step": 1495 }, { "entropy": 5.559925746917725, "epoch": 1.7793594306049823, "grad_norm": 0.92578125, "learning_rate": 0.0004949970116955566, "loss": 5.5282, "mean_token_accuracy": 0.15817976742982864, "num_tokens": 4310470.0, "step": 1500 }, { "epoch": 1.7793594306049823, "eval_entropy": 5.509380918338986, "eval_loss": 5.712648868560791, "eval_mean_token_accuracy": 0.15203302554740497, "eval_num_tokens": 4310470.0, "eval_runtime": 2.4337, "eval_samples_per_second": 1071.632, "eval_steps_per_second": 133.954, "step": 1500 } ], "logging_steps": 5, "max_steps": 8420, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 7627040925696000.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }