{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.1862396204033214, "eval_steps": 500, "global_step": 1000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 4.805317306518555, "epoch": 0.005931198102016607, "grad_norm": 16.25, "learning_rate": 2e-06, "loss": 14.4312, "mean_token_accuracy": 0.0, "num_tokens": 12647.0, "step": 5 }, { "entropy": 4.825564956665039, "epoch": 0.011862396204033215, "grad_norm": 16.875, "learning_rate": 4.5e-06, "loss": 14.4169, "mean_token_accuracy": 0.0, "num_tokens": 26668.0, "step": 10 }, { "entropy": 4.845508098602295, "epoch": 0.017793594306049824, "grad_norm": 24.75, "learning_rate": 7e-06, "loss": 14.1564, "mean_token_accuracy": 0.0, "num_tokens": 41021.0, "step": 15 }, { "entropy": 5.1169312477111815, "epoch": 0.02372479240806643, "grad_norm": 33.75, "learning_rate": 9.5e-06, "loss": 13.5366, "mean_token_accuracy": 0.0, "num_tokens": 56626.0, "step": 20 }, { "entropy": 7.628379774093628, "epoch": 0.02965599051008304, "grad_norm": 15.25, "learning_rate": 1.2e-05, "loss": 11.8077, "mean_token_accuracy": 0.00010419512109365315, "num_tokens": 72914.0, "step": 25 }, { "entropy": 10.455063152313233, "epoch": 0.03558718861209965, "grad_norm": 3.21875, "learning_rate": 1.4500000000000002e-05, "loss": 10.841, "mean_token_accuracy": 0.0054948762990534306, "num_tokens": 88514.0, "step": 30 }, { "entropy": 10.646884059906006, "epoch": 0.04151838671411625, "grad_norm": 3.03125, "learning_rate": 1.7000000000000003e-05, "loss": 10.5696, "mean_token_accuracy": 0.01355562973767519, "num_tokens": 101256.0, "step": 35 }, { "entropy": 10.619774627685548, "epoch": 0.04744958481613286, "grad_norm": 2.4375, "learning_rate": 1.95e-05, "loss": 10.282, "mean_token_accuracy": 0.012707393150776625, "num_tokens": 114459.0, "step": 40 }, { "entropy": 10.61210651397705, "epoch": 0.05338078291814947, "grad_norm": 2.28125, "learning_rate": 2.2e-05, "loss": 10.0287, "mean_token_accuracy": 0.01491355374455452, "num_tokens": 129858.0, "step": 45 }, { "entropy": 10.597074794769288, "epoch": 0.05931198102016608, "grad_norm": 2.1875, "learning_rate": 2.4500000000000003e-05, "loss": 9.8185, "mean_token_accuracy": 0.0331686332821846, "num_tokens": 143486.0, "step": 50 }, { "entropy": 10.579236507415771, "epoch": 0.06524317912218268, "grad_norm": 1.9609375, "learning_rate": 2.7e-05, "loss": 9.6912, "mean_token_accuracy": 0.035220497474074366, "num_tokens": 156003.0, "step": 55 }, { "entropy": 10.577684020996093, "epoch": 0.0711743772241993, "grad_norm": 2.03125, "learning_rate": 2.95e-05, "loss": 9.6506, "mean_token_accuracy": 0.034727090038359165, "num_tokens": 170988.0, "step": 60 }, { "entropy": 10.5711012840271, "epoch": 0.0771055753262159, "grad_norm": 1.984375, "learning_rate": 3.2e-05, "loss": 9.5328, "mean_token_accuracy": 0.03448135014623403, "num_tokens": 187165.0, "step": 65 }, { "entropy": 10.558809852600097, "epoch": 0.0830367734282325, "grad_norm": 1.9453125, "learning_rate": 3.4500000000000005e-05, "loss": 9.4798, "mean_token_accuracy": 0.03228826243430376, "num_tokens": 202072.0, "step": 70 }, { "entropy": 10.549299335479736, "epoch": 0.08896797153024912, "grad_norm": 1.8671875, "learning_rate": 3.7e-05, "loss": 9.3281, "mean_token_accuracy": 0.034324941039085385, "num_tokens": 215375.0, "step": 75 }, { "entropy": 10.532067012786865, "epoch": 0.09489916963226572, "grad_norm": 1.734375, "learning_rate": 3.95e-05, "loss": 9.2492, "mean_token_accuracy": 0.03353528436273336, "num_tokens": 228749.0, "step": 80 }, { "entropy": 10.505972194671632, "epoch": 0.10083036773428232, "grad_norm": 1.8359375, "learning_rate": 4.2000000000000004e-05, "loss": 9.1494, "mean_token_accuracy": 0.03314766474068165, "num_tokens": 242387.0, "step": 85 }, { "entropy": 10.478415584564209, "epoch": 0.10676156583629894, "grad_norm": 1.796875, "learning_rate": 4.45e-05, "loss": 9.0705, "mean_token_accuracy": 0.032026905380189416, "num_tokens": 257793.0, "step": 90 }, { "entropy": 10.454620742797852, "epoch": 0.11269276393831554, "grad_norm": 1.75, "learning_rate": 4.7000000000000004e-05, "loss": 8.9712, "mean_token_accuracy": 0.0325484286993742, "num_tokens": 271187.0, "step": 95 }, { "entropy": 10.40716381072998, "epoch": 0.11862396204033215, "grad_norm": 1.609375, "learning_rate": 4.9500000000000004e-05, "loss": 8.8474, "mean_token_accuracy": 0.03217122312635183, "num_tokens": 284937.0, "step": 100 }, { "entropy": 10.335246372222901, "epoch": 0.12455516014234876, "grad_norm": 1.765625, "learning_rate": 5.2e-05, "loss": 8.6893, "mean_token_accuracy": 0.03255892116576433, "num_tokens": 300108.0, "step": 105 }, { "entropy": 10.246189594268799, "epoch": 0.13048635824436536, "grad_norm": 1.53125, "learning_rate": 5.45e-05, "loss": 8.5681, "mean_token_accuracy": 0.031065495498478413, "num_tokens": 316760.0, "step": 110 }, { "entropy": 10.13212080001831, "epoch": 0.13641755634638197, "grad_norm": 1.5078125, "learning_rate": 5.7e-05, "loss": 8.3819, "mean_token_accuracy": 0.03049417305737734, "num_tokens": 329705.0, "step": 115 }, { "entropy": 9.97801332473755, "epoch": 0.1423487544483986, "grad_norm": 1.3203125, "learning_rate": 5.9499999999999996e-05, "loss": 8.244, "mean_token_accuracy": 0.03179512321949005, "num_tokens": 342947.0, "step": 120 }, { "entropy": 9.771716022491455, "epoch": 0.14827995255041518, "grad_norm": 1.2109375, "learning_rate": 6.2e-05, "loss": 8.0865, "mean_token_accuracy": 0.03442887142300606, "num_tokens": 358397.0, "step": 125 }, { "entropy": 9.533180236816406, "epoch": 0.1542111506524318, "grad_norm": 1.140625, "learning_rate": 6.450000000000001e-05, "loss": 7.9643, "mean_token_accuracy": 0.03413730468600988, "num_tokens": 370369.0, "step": 130 }, { "entropy": 9.256175804138184, "epoch": 0.1601423487544484, "grad_norm": 0.953125, "learning_rate": 6.7e-05, "loss": 7.8421, "mean_token_accuracy": 0.03181219045072794, "num_tokens": 386896.0, "step": 135 }, { "entropy": 8.96011724472046, "epoch": 0.166073546856465, "grad_norm": 0.8671875, "learning_rate": 6.950000000000001e-05, "loss": 7.6981, "mean_token_accuracy": 0.03533113058656454, "num_tokens": 400433.0, "step": 140 }, { "entropy": 8.675125217437744, "epoch": 0.17200474495848161, "grad_norm": 0.7890625, "learning_rate": 7.2e-05, "loss": 7.6507, "mean_token_accuracy": 0.030981262400746345, "num_tokens": 415092.0, "step": 145 }, { "entropy": 8.432178497314453, "epoch": 0.17793594306049823, "grad_norm": 0.7109375, "learning_rate": 7.45e-05, "loss": 7.5489, "mean_token_accuracy": 0.033769184909760955, "num_tokens": 429793.0, "step": 150 }, { "entropy": 8.235133266448974, "epoch": 0.18386714116251482, "grad_norm": 0.77734375, "learning_rate": 7.7e-05, "loss": 7.5575, "mean_token_accuracy": 0.03205921929329634, "num_tokens": 442618.0, "step": 155 }, { "entropy": 8.142054271697997, "epoch": 0.18979833926453143, "grad_norm": 0.75, "learning_rate": 7.950000000000001e-05, "loss": 7.4449, "mean_token_accuracy": 0.03399460650980472, "num_tokens": 454976.0, "step": 160 }, { "entropy": 8.025918197631835, "epoch": 0.19572953736654805, "grad_norm": 0.8671875, "learning_rate": 8.2e-05, "loss": 7.5037, "mean_token_accuracy": 0.03331909943372011, "num_tokens": 467523.0, "step": 165 }, { "entropy": 7.9379983901977536, "epoch": 0.20166073546856464, "grad_norm": 0.6796875, "learning_rate": 8.450000000000001e-05, "loss": 7.4373, "mean_token_accuracy": 0.03239843733608723, "num_tokens": 481391.0, "step": 170 }, { "entropy": 7.869046401977539, "epoch": 0.20759193357058126, "grad_norm": 0.67578125, "learning_rate": 8.7e-05, "loss": 7.4399, "mean_token_accuracy": 0.0311466746032238, "num_tokens": 496697.0, "step": 175 }, { "entropy": 7.866212034225464, "epoch": 0.21352313167259787, "grad_norm": 0.77734375, "learning_rate": 8.95e-05, "loss": 7.4743, "mean_token_accuracy": 0.027226756513118743, "num_tokens": 510091.0, "step": 180 }, { "entropy": 7.788731241226197, "epoch": 0.21945432977461446, "grad_norm": 0.703125, "learning_rate": 9.2e-05, "loss": 7.426, "mean_token_accuracy": 0.03152833003550768, "num_tokens": 522168.0, "step": 185 }, { "entropy": 7.754296016693115, "epoch": 0.22538552787663108, "grad_norm": 0.71875, "learning_rate": 9.45e-05, "loss": 7.3943, "mean_token_accuracy": 0.03427231907844543, "num_tokens": 535853.0, "step": 190 }, { "entropy": 7.75240159034729, "epoch": 0.2313167259786477, "grad_norm": 0.77734375, "learning_rate": 9.7e-05, "loss": 7.4255, "mean_token_accuracy": 0.03329353462904692, "num_tokens": 551082.0, "step": 195 }, { "entropy": 7.700812101364136, "epoch": 0.2372479240806643, "grad_norm": 0.7265625, "learning_rate": 9.95e-05, "loss": 7.4629, "mean_token_accuracy": 0.035965221747756, "num_tokens": 567181.0, "step": 200 }, { "entropy": 7.696683025360107, "epoch": 0.2431791221826809, "grad_norm": 0.71484375, "learning_rate": 0.000102, "loss": 7.4112, "mean_token_accuracy": 0.035206197388470174, "num_tokens": 580689.0, "step": 205 }, { "entropy": 7.712547016143799, "epoch": 0.2491103202846975, "grad_norm": 0.765625, "learning_rate": 0.00010449999999999999, "loss": 7.3345, "mean_token_accuracy": 0.03781173955649138, "num_tokens": 594590.0, "step": 210 }, { "entropy": 7.769494247436524, "epoch": 0.25504151838671413, "grad_norm": 10.5, "learning_rate": 0.000107, "loss": 7.3905, "mean_token_accuracy": 0.03799592889845371, "num_tokens": 610577.0, "step": 215 }, { "entropy": 7.6959569454193115, "epoch": 0.2609727164887307, "grad_norm": 0.97265625, "learning_rate": 0.0001095, "loss": 7.384, "mean_token_accuracy": 0.037612661719322205, "num_tokens": 627066.0, "step": 220 }, { "entropy": 7.781623411178589, "epoch": 0.2669039145907473, "grad_norm": 0.90625, "learning_rate": 0.000112, "loss": 7.3672, "mean_token_accuracy": 0.04785094037652016, "num_tokens": 642601.0, "step": 225 }, { "entropy": 7.77043514251709, "epoch": 0.27283511269276395, "grad_norm": 1.484375, "learning_rate": 0.0001145, "loss": 7.2531, "mean_token_accuracy": 0.05052996054291725, "num_tokens": 655615.0, "step": 230 }, { "entropy": 7.747775220870972, "epoch": 0.27876631079478054, "grad_norm": 0.94140625, "learning_rate": 0.00011700000000000001, "loss": 7.2647, "mean_token_accuracy": 0.05221507623791695, "num_tokens": 670218.0, "step": 235 }, { "entropy": 7.743488121032715, "epoch": 0.2846975088967972, "grad_norm": 0.75390625, "learning_rate": 0.00011949999999999999, "loss": 7.2593, "mean_token_accuracy": 0.05101203434169292, "num_tokens": 683661.0, "step": 240 }, { "entropy": 7.713605117797852, "epoch": 0.29062870699881377, "grad_norm": 1.1875, "learning_rate": 0.000122, "loss": 7.2135, "mean_token_accuracy": 0.05287150628864765, "num_tokens": 699767.0, "step": 245 }, { "entropy": 7.695834493637085, "epoch": 0.29655990510083036, "grad_norm": 0.953125, "learning_rate": 0.0001245, "loss": 7.1762, "mean_token_accuracy": 0.05634650327265263, "num_tokens": 713579.0, "step": 250 }, { "entropy": 7.629615783691406, "epoch": 0.302491103202847, "grad_norm": 1.296875, "learning_rate": 0.000127, "loss": 7.1678, "mean_token_accuracy": 0.05482946485280991, "num_tokens": 727490.0, "step": 255 }, { "entropy": 7.607522439956665, "epoch": 0.3084223013048636, "grad_norm": 0.80078125, "learning_rate": 0.0001295, "loss": 7.2348, "mean_token_accuracy": 0.05509466864168644, "num_tokens": 742477.0, "step": 260 }, { "entropy": 7.624451637268066, "epoch": 0.3143534994068802, "grad_norm": 1.2578125, "learning_rate": 0.000132, "loss": 7.113, "mean_token_accuracy": 0.05751051269471645, "num_tokens": 757772.0, "step": 265 }, { "entropy": 7.647220134735107, "epoch": 0.3202846975088968, "grad_norm": 1.390625, "learning_rate": 0.00013450000000000002, "loss": 7.1596, "mean_token_accuracy": 0.05049732141196728, "num_tokens": 772898.0, "step": 270 }, { "entropy": 7.600799989700318, "epoch": 0.3262158956109134, "grad_norm": 1.34375, "learning_rate": 0.00013700000000000002, "loss": 7.1154, "mean_token_accuracy": 0.05433249212801457, "num_tokens": 788395.0, "step": 275 }, { "entropy": 7.563078927993774, "epoch": 0.33214709371293, "grad_norm": 1.078125, "learning_rate": 0.0001395, "loss": 7.1648, "mean_token_accuracy": 0.06050356179475784, "num_tokens": 803413.0, "step": 280 }, { "entropy": 7.517913770675659, "epoch": 0.33807829181494664, "grad_norm": 1.34375, "learning_rate": 0.00014199999999999998, "loss": 7.0248, "mean_token_accuracy": 0.06933637075126171, "num_tokens": 817775.0, "step": 285 }, { "entropy": 7.566510915756226, "epoch": 0.34400948991696323, "grad_norm": 1.15625, "learning_rate": 0.0001445, "loss": 7.1421, "mean_token_accuracy": 0.06264986135065556, "num_tokens": 831379.0, "step": 290 }, { "entropy": 7.551775217056274, "epoch": 0.3499406880189798, "grad_norm": 1.0234375, "learning_rate": 0.000147, "loss": 7.0759, "mean_token_accuracy": 0.05862759165465832, "num_tokens": 846596.0, "step": 295 }, { "entropy": 7.553944540023804, "epoch": 0.35587188612099646, "grad_norm": 1.0234375, "learning_rate": 0.0001495, "loss": 7.0666, "mean_token_accuracy": 0.05912046544253826, "num_tokens": 862063.0, "step": 300 }, { "entropy": 7.582914543151856, "epoch": 0.36180308422301305, "grad_norm": 1.0859375, "learning_rate": 0.000152, "loss": 6.9961, "mean_token_accuracy": 0.06986662931740284, "num_tokens": 876841.0, "step": 305 }, { "entropy": 7.488122177124024, "epoch": 0.36773428232502964, "grad_norm": 1.1875, "learning_rate": 0.00015450000000000001, "loss": 7.0603, "mean_token_accuracy": 0.06794393062591553, "num_tokens": 890728.0, "step": 310 }, { "entropy": 7.442899990081787, "epoch": 0.3736654804270463, "grad_norm": 1.0703125, "learning_rate": 0.000157, "loss": 6.983, "mean_token_accuracy": 0.0702366728335619, "num_tokens": 905599.0, "step": 315 }, { "entropy": 7.451259899139404, "epoch": 0.37959667852906287, "grad_norm": 1.3359375, "learning_rate": 0.0001595, "loss": 6.9367, "mean_token_accuracy": 0.07826149612665176, "num_tokens": 918139.0, "step": 320 }, { "entropy": 7.405993700027466, "epoch": 0.38552787663107946, "grad_norm": 1.3515625, "learning_rate": 0.000162, "loss": 6.9943, "mean_token_accuracy": 0.0733895305544138, "num_tokens": 931666.0, "step": 325 }, { "entropy": 7.446602392196655, "epoch": 0.3914590747330961, "grad_norm": 1.2890625, "learning_rate": 0.00016450000000000001, "loss": 6.9418, "mean_token_accuracy": 0.0699479129165411, "num_tokens": 946286.0, "step": 330 }, { "entropy": 7.44321928024292, "epoch": 0.3973902728351127, "grad_norm": 1.25, "learning_rate": 0.00016700000000000002, "loss": 6.9048, "mean_token_accuracy": 0.0711387813091278, "num_tokens": 959689.0, "step": 335 }, { "entropy": 7.383141279220581, "epoch": 0.4033214709371293, "grad_norm": 1.4609375, "learning_rate": 0.00016950000000000003, "loss": 6.9099, "mean_token_accuracy": 0.07436129115521908, "num_tokens": 972707.0, "step": 340 }, { "entropy": 7.326433992385864, "epoch": 0.4092526690391459, "grad_norm": 1.234375, "learning_rate": 0.00017199999999999998, "loss": 6.9298, "mean_token_accuracy": 0.07282942235469818, "num_tokens": 988010.0, "step": 345 }, { "entropy": 7.3913586139678955, "epoch": 0.4151838671411625, "grad_norm": 1.6015625, "learning_rate": 0.00017449999999999999, "loss": 6.9494, "mean_token_accuracy": 0.0702156439423561, "num_tokens": 1003823.0, "step": 350 }, { "entropy": 7.271407747268677, "epoch": 0.4211150652431791, "grad_norm": 1.7421875, "learning_rate": 0.000177, "loss": 6.7257, "mean_token_accuracy": 0.08785916194319725, "num_tokens": 1018276.0, "step": 355 }, { "entropy": 7.315984010696411, "epoch": 0.42704626334519574, "grad_norm": 1.40625, "learning_rate": 0.0001795, "loss": 6.9177, "mean_token_accuracy": 0.07590937204658985, "num_tokens": 1031242.0, "step": 360 }, { "entropy": 7.36967716217041, "epoch": 0.43297746144721233, "grad_norm": 1.2421875, "learning_rate": 0.000182, "loss": 6.826, "mean_token_accuracy": 0.08421060293912888, "num_tokens": 1043940.0, "step": 365 }, { "entropy": 7.209809446334839, "epoch": 0.4389086595492289, "grad_norm": 1.046875, "learning_rate": 0.0001845, "loss": 6.7337, "mean_token_accuracy": 0.08058795779943466, "num_tokens": 1058656.0, "step": 370 }, { "entropy": 7.326260042190552, "epoch": 0.44483985765124556, "grad_norm": 1.1796875, "learning_rate": 0.000187, "loss": 6.8599, "mean_token_accuracy": 0.07443175241351127, "num_tokens": 1073128.0, "step": 375 }, { "entropy": 7.216764450073242, "epoch": 0.45077105575326215, "grad_norm": 1.5703125, "learning_rate": 0.0001895, "loss": 6.7831, "mean_token_accuracy": 0.08439998105168342, "num_tokens": 1086467.0, "step": 380 }, { "entropy": 7.274557256698609, "epoch": 0.45670225385527874, "grad_norm": 1.328125, "learning_rate": 0.000192, "loss": 6.9052, "mean_token_accuracy": 0.08290659114718438, "num_tokens": 1100356.0, "step": 385 }, { "entropy": 7.288721132278442, "epoch": 0.4626334519572954, "grad_norm": 1.4609375, "learning_rate": 0.0001945, "loss": 6.8286, "mean_token_accuracy": 0.08163000270724297, "num_tokens": 1115877.0, "step": 390 }, { "entropy": 7.271324348449707, "epoch": 0.46856465005931197, "grad_norm": 0.97265625, "learning_rate": 0.00019700000000000002, "loss": 6.7874, "mean_token_accuracy": 0.08328207209706306, "num_tokens": 1131415.0, "step": 395 }, { "entropy": 7.159351873397827, "epoch": 0.4744958481613286, "grad_norm": 1.3203125, "learning_rate": 0.00019950000000000002, "loss": 6.7132, "mean_token_accuracy": 0.08293095007538795, "num_tokens": 1145903.0, "step": 400 }, { "entropy": 7.103127574920654, "epoch": 0.4804270462633452, "grad_norm": 1.1953125, "learning_rate": 0.000202, "loss": 6.67, "mean_token_accuracy": 0.08018745929002762, "num_tokens": 1161168.0, "step": 405 }, { "entropy": 7.14245753288269, "epoch": 0.4863582443653618, "grad_norm": 1.3046875, "learning_rate": 0.00020449999999999998, "loss": 6.7324, "mean_token_accuracy": 0.08255215212702752, "num_tokens": 1178155.0, "step": 410 }, { "entropy": 7.131292104721069, "epoch": 0.49228944246737844, "grad_norm": 1.2890625, "learning_rate": 0.000207, "loss": 6.5728, "mean_token_accuracy": 0.09345637336373329, "num_tokens": 1190830.0, "step": 415 }, { "entropy": 7.046381425857544, "epoch": 0.498220640569395, "grad_norm": 1.21875, "learning_rate": 0.0002095, "loss": 6.5814, "mean_token_accuracy": 0.08820187523961068, "num_tokens": 1205260.0, "step": 420 }, { "entropy": 7.083016061782837, "epoch": 0.5041518386714117, "grad_norm": 1.453125, "learning_rate": 0.000212, "loss": 6.6316, "mean_token_accuracy": 0.09104111194610595, "num_tokens": 1218856.0, "step": 425 }, { "entropy": 7.034869623184204, "epoch": 0.5100830367734283, "grad_norm": 1.4453125, "learning_rate": 0.0002145, "loss": 6.6934, "mean_token_accuracy": 0.09010339081287384, "num_tokens": 1234669.0, "step": 430 }, { "entropy": 7.032301235198974, "epoch": 0.5160142348754448, "grad_norm": 1.4375, "learning_rate": 0.00021700000000000002, "loss": 6.6293, "mean_token_accuracy": 0.09128119722008705, "num_tokens": 1249514.0, "step": 435 }, { "entropy": 7.032708358764649, "epoch": 0.5219454329774614, "grad_norm": 1.1171875, "learning_rate": 0.0002195, "loss": 6.5626, "mean_token_accuracy": 0.0961005687713623, "num_tokens": 1262311.0, "step": 440 }, { "entropy": 6.9413275718688965, "epoch": 0.527876631079478, "grad_norm": 1.4453125, "learning_rate": 0.000222, "loss": 6.5488, "mean_token_accuracy": 0.09156981036067009, "num_tokens": 1277681.0, "step": 445 }, { "entropy": 7.003400182723999, "epoch": 0.5338078291814946, "grad_norm": 1.3359375, "learning_rate": 0.0002245, "loss": 6.5879, "mean_token_accuracy": 0.09069180116057396, "num_tokens": 1292300.0, "step": 450 }, { "entropy": 7.015186309814453, "epoch": 0.5397390272835113, "grad_norm": 1.203125, "learning_rate": 0.00022700000000000002, "loss": 6.595, "mean_token_accuracy": 0.08999119028449058, "num_tokens": 1307426.0, "step": 455 }, { "entropy": 6.900823402404785, "epoch": 0.5456702253855279, "grad_norm": 1.125, "learning_rate": 0.00022950000000000002, "loss": 6.6162, "mean_token_accuracy": 0.09043457433581352, "num_tokens": 1322167.0, "step": 460 }, { "entropy": 6.999922370910644, "epoch": 0.5516014234875445, "grad_norm": 1.1875, "learning_rate": 0.00023200000000000003, "loss": 6.4976, "mean_token_accuracy": 0.09610431045293807, "num_tokens": 1335343.0, "step": 465 }, { "entropy": 6.857682752609253, "epoch": 0.5575326215895611, "grad_norm": 1.078125, "learning_rate": 0.00023449999999999998, "loss": 6.4976, "mean_token_accuracy": 0.09826786443591118, "num_tokens": 1349078.0, "step": 470 }, { "entropy": 6.899160289764405, "epoch": 0.5634638196915777, "grad_norm": 1.3203125, "learning_rate": 0.000237, "loss": 6.4224, "mean_token_accuracy": 0.1049638457596302, "num_tokens": 1362030.0, "step": 475 }, { "entropy": 6.993446207046508, "epoch": 0.5693950177935944, "grad_norm": 1.609375, "learning_rate": 0.0002395, "loss": 6.5763, "mean_token_accuracy": 0.08985362276434898, "num_tokens": 1378303.0, "step": 480 }, { "entropy": 6.935125350952148, "epoch": 0.575326215895611, "grad_norm": 1.1875, "learning_rate": 0.000242, "loss": 6.5767, "mean_token_accuracy": 0.09316942617297172, "num_tokens": 1392585.0, "step": 485 }, { "entropy": 6.9703733921051025, "epoch": 0.5812574139976275, "grad_norm": 1.75, "learning_rate": 0.0002445, "loss": 6.5814, "mean_token_accuracy": 0.09292712658643723, "num_tokens": 1406962.0, "step": 490 }, { "entropy": 6.836954164505005, "epoch": 0.5871886120996441, "grad_norm": 1.265625, "learning_rate": 0.000247, "loss": 6.4605, "mean_token_accuracy": 0.09848191663622856, "num_tokens": 1419493.0, "step": 495 }, { "entropy": 6.868243980407715, "epoch": 0.5931198102016607, "grad_norm": 1.40625, "learning_rate": 0.0002495, "loss": 6.4801, "mean_token_accuracy": 0.09710933044552802, "num_tokens": 1435373.0, "step": 500 }, { "epoch": 0.5931198102016607, "eval_entropy": 6.868733419231111, "eval_loss": 6.604183673858643, "eval_mean_token_accuracy": 0.09870429635276458, "eval_num_tokens": 1435373.0, "eval_runtime": 2.5304, "eval_samples_per_second": 1030.674, "eval_steps_per_second": 128.834, "step": 500 }, { "entropy": 6.877611589431763, "epoch": 0.5990510083036773, "grad_norm": 1.28125, "learning_rate": 0.000252, "loss": 6.4385, "mean_token_accuracy": 0.10158890634775161, "num_tokens": 1449805.0, "step": 505 }, { "entropy": 6.82432370185852, "epoch": 0.604982206405694, "grad_norm": 1.1328125, "learning_rate": 0.0002545, "loss": 6.4667, "mean_token_accuracy": 0.09393253624439239, "num_tokens": 1463657.0, "step": 510 }, { "entropy": 6.9438111782073975, "epoch": 0.6109134045077106, "grad_norm": 1.375, "learning_rate": 0.000257, "loss": 6.4667, "mean_token_accuracy": 0.10057351440191269, "num_tokens": 1478089.0, "step": 515 }, { "entropy": 6.7661386013031, "epoch": 0.6168446026097272, "grad_norm": 1.375, "learning_rate": 0.0002595, "loss": 6.4698, "mean_token_accuracy": 0.10367124900221825, "num_tokens": 1492225.0, "step": 520 }, { "entropy": 6.823407316207886, "epoch": 0.6227758007117438, "grad_norm": 1.515625, "learning_rate": 0.000262, "loss": 6.4847, "mean_token_accuracy": 0.0941373310983181, "num_tokens": 1506751.0, "step": 525 }, { "entropy": 6.816655206680298, "epoch": 0.6287069988137604, "grad_norm": 1.1015625, "learning_rate": 0.00026450000000000003, "loss": 6.3687, "mean_token_accuracy": 0.10237260162830353, "num_tokens": 1520590.0, "step": 530 }, { "entropy": 6.7571464538574215, "epoch": 0.6346381969157769, "grad_norm": 1.1328125, "learning_rate": 0.00026700000000000004, "loss": 6.4174, "mean_token_accuracy": 0.1001747913658619, "num_tokens": 1534752.0, "step": 535 }, { "entropy": 6.783740854263305, "epoch": 0.6405693950177936, "grad_norm": 1.21875, "learning_rate": 0.00026950000000000005, "loss": 6.3769, "mean_token_accuracy": 0.10932414084672928, "num_tokens": 1547891.0, "step": 540 }, { "entropy": 6.724957847595215, "epoch": 0.6465005931198102, "grad_norm": 1.375, "learning_rate": 0.00027200000000000005, "loss": 6.3247, "mean_token_accuracy": 0.10839766561985016, "num_tokens": 1562560.0, "step": 545 }, { "entropy": 6.809849119186401, "epoch": 0.6524317912218268, "grad_norm": 1.3203125, "learning_rate": 0.0002745, "loss": 6.4654, "mean_token_accuracy": 0.10033882036805153, "num_tokens": 1576896.0, "step": 550 }, { "entropy": 6.732705163955688, "epoch": 0.6583629893238434, "grad_norm": 1.234375, "learning_rate": 0.000277, "loss": 6.3496, "mean_token_accuracy": 0.10360537618398666, "num_tokens": 1590806.0, "step": 555 }, { "entropy": 6.740630769729615, "epoch": 0.66429418742586, "grad_norm": 1.3984375, "learning_rate": 0.0002795, "loss": 6.4697, "mean_token_accuracy": 0.09847484454512596, "num_tokens": 1605874.0, "step": 560 }, { "entropy": 6.772911071777344, "epoch": 0.6702253855278766, "grad_norm": 1.21875, "learning_rate": 0.00028199999999999997, "loss": 6.3582, "mean_token_accuracy": 0.10450243502855301, "num_tokens": 1620947.0, "step": 565 }, { "entropy": 6.672332429885865, "epoch": 0.6761565836298933, "grad_norm": 1.6796875, "learning_rate": 0.0002845, "loss": 6.393, "mean_token_accuracy": 0.0936239667236805, "num_tokens": 1635974.0, "step": 570 }, { "entropy": 6.685958909988403, "epoch": 0.6820877817319099, "grad_norm": 1.078125, "learning_rate": 0.000287, "loss": 6.3661, "mean_token_accuracy": 0.10207983180880546, "num_tokens": 1651502.0, "step": 575 }, { "entropy": 6.668765211105347, "epoch": 0.6880189798339265, "grad_norm": 1.15625, "learning_rate": 0.0002895, "loss": 6.3031, "mean_token_accuracy": 0.10794700905680657, "num_tokens": 1665547.0, "step": 580 }, { "entropy": 6.6357416152954105, "epoch": 0.693950177935943, "grad_norm": 1.1640625, "learning_rate": 0.000292, "loss": 6.2873, "mean_token_accuracy": 0.10822367817163467, "num_tokens": 1678875.0, "step": 585 }, { "entropy": 6.671806287765503, "epoch": 0.6998813760379596, "grad_norm": 1.28125, "learning_rate": 0.0002945, "loss": 6.3113, "mean_token_accuracy": 0.10574031621217728, "num_tokens": 1692673.0, "step": 590 }, { "entropy": 6.649136257171631, "epoch": 0.7058125741399762, "grad_norm": 1.2421875, "learning_rate": 0.000297, "loss": 6.3549, "mean_token_accuracy": 0.10422232896089553, "num_tokens": 1707318.0, "step": 595 }, { "entropy": 6.6383771896362305, "epoch": 0.7117437722419929, "grad_norm": 1.4921875, "learning_rate": 0.0002995, "loss": 6.3908, "mean_token_accuracy": 0.09859651327133179, "num_tokens": 1724331.0, "step": 600 }, { "entropy": 6.54994387626648, "epoch": 0.7176749703440095, "grad_norm": 1.359375, "learning_rate": 0.000302, "loss": 6.1816, "mean_token_accuracy": 0.11202944293618203, "num_tokens": 1736151.0, "step": 605 }, { "entropy": 6.531128454208374, "epoch": 0.7236061684460261, "grad_norm": 1.296875, "learning_rate": 0.0003045, "loss": 6.2535, "mean_token_accuracy": 0.11085337772965431, "num_tokens": 1749831.0, "step": 610 }, { "entropy": 6.670119380950927, "epoch": 0.7295373665480427, "grad_norm": 1.1796875, "learning_rate": 0.000307, "loss": 6.3033, "mean_token_accuracy": 0.10853635594248771, "num_tokens": 1764296.0, "step": 615 }, { "entropy": 6.622691011428833, "epoch": 0.7354685646500593, "grad_norm": 1.359375, "learning_rate": 0.0003095, "loss": 6.274, "mean_token_accuracy": 0.11076630353927612, "num_tokens": 1778042.0, "step": 620 }, { "entropy": 6.569571828842163, "epoch": 0.741399762752076, "grad_norm": 1.359375, "learning_rate": 0.000312, "loss": 6.2567, "mean_token_accuracy": 0.11235617473721504, "num_tokens": 1791614.0, "step": 625 }, { "entropy": 6.480262708663941, "epoch": 0.7473309608540926, "grad_norm": 1.1796875, "learning_rate": 0.0003145, "loss": 6.2203, "mean_token_accuracy": 0.10766129791736603, "num_tokens": 1807388.0, "step": 630 }, { "entropy": 6.692783164978027, "epoch": 0.7532621589561092, "grad_norm": 1.25, "learning_rate": 0.000317, "loss": 6.3265, "mean_token_accuracy": 0.10339825823903084, "num_tokens": 1820407.0, "step": 635 }, { "entropy": 6.493888711929321, "epoch": 0.7591933570581257, "grad_norm": 1.296875, "learning_rate": 0.0003195, "loss": 6.2041, "mean_token_accuracy": 0.11163504943251609, "num_tokens": 1834666.0, "step": 640 }, { "entropy": 6.516778469085693, "epoch": 0.7651245551601423, "grad_norm": 1.3671875, "learning_rate": 0.000322, "loss": 6.2915, "mean_token_accuracy": 0.10899070277810097, "num_tokens": 1848160.0, "step": 645 }, { "entropy": 6.624192810058593, "epoch": 0.7710557532621589, "grad_norm": 1.1484375, "learning_rate": 0.00032450000000000003, "loss": 6.3004, "mean_token_accuracy": 0.11020564585924149, "num_tokens": 1865140.0, "step": 650 }, { "entropy": 6.473660230636597, "epoch": 0.7769869513641756, "grad_norm": 1.078125, "learning_rate": 0.00032700000000000003, "loss": 6.1704, "mean_token_accuracy": 0.11627639755606652, "num_tokens": 1878447.0, "step": 655 }, { "entropy": 6.505875301361084, "epoch": 0.7829181494661922, "grad_norm": 1.2421875, "learning_rate": 0.00032950000000000004, "loss": 6.2289, "mean_token_accuracy": 0.11153926998376847, "num_tokens": 1893539.0, "step": 660 }, { "entropy": 6.592386484146118, "epoch": 0.7888493475682088, "grad_norm": 1.203125, "learning_rate": 0.00033200000000000005, "loss": 6.2853, "mean_token_accuracy": 0.11337760239839553, "num_tokens": 1908052.0, "step": 665 }, { "entropy": 6.493582057952881, "epoch": 0.7947805456702254, "grad_norm": 1.3984375, "learning_rate": 0.00033450000000000005, "loss": 6.1767, "mean_token_accuracy": 0.11641135811805725, "num_tokens": 1921528.0, "step": 670 }, { "entropy": 6.502324628829956, "epoch": 0.800711743772242, "grad_norm": 1.2734375, "learning_rate": 0.000337, "loss": 6.1962, "mean_token_accuracy": 0.11467067450284958, "num_tokens": 1935089.0, "step": 675 }, { "entropy": 6.515084457397461, "epoch": 0.8066429418742586, "grad_norm": 1.1953125, "learning_rate": 0.0003395, "loss": 6.3085, "mean_token_accuracy": 0.10803200528025628, "num_tokens": 1949717.0, "step": 680 }, { "entropy": 6.477928495407104, "epoch": 0.8125741399762753, "grad_norm": 1.3671875, "learning_rate": 0.000342, "loss": 6.171, "mean_token_accuracy": 0.11270654797554017, "num_tokens": 1962619.0, "step": 685 }, { "entropy": 6.589840030670166, "epoch": 0.8185053380782918, "grad_norm": 1.421875, "learning_rate": 0.00034449999999999997, "loss": 6.2633, "mean_token_accuracy": 0.1094804771244526, "num_tokens": 1977094.0, "step": 690 }, { "entropy": 6.4256690502166744, "epoch": 0.8244365361803084, "grad_norm": 1.234375, "learning_rate": 0.000347, "loss": 6.2222, "mean_token_accuracy": 0.10567561089992523, "num_tokens": 1992446.0, "step": 695 }, { "entropy": 6.449682807922363, "epoch": 0.830367734282325, "grad_norm": 1.1796875, "learning_rate": 0.0003495, "loss": 6.1737, "mean_token_accuracy": 0.11305198296904564, "num_tokens": 2008753.0, "step": 700 }, { "entropy": 6.401576709747315, "epoch": 0.8362989323843416, "grad_norm": 1.2265625, "learning_rate": 0.000352, "loss": 6.1256, "mean_token_accuracy": 0.11778818741440773, "num_tokens": 2024088.0, "step": 705 }, { "entropy": 6.476001882553101, "epoch": 0.8422301304863582, "grad_norm": 1.2578125, "learning_rate": 0.0003545, "loss": 6.1461, "mean_token_accuracy": 0.11078088879585266, "num_tokens": 2038449.0, "step": 710 }, { "entropy": 6.4743701934814455, "epoch": 0.8481613285883749, "grad_norm": 1.2265625, "learning_rate": 0.000357, "loss": 6.131, "mean_token_accuracy": 0.12273426279425621, "num_tokens": 2052038.0, "step": 715 }, { "entropy": 6.402703428268433, "epoch": 0.8540925266903915, "grad_norm": 1.25, "learning_rate": 0.0003595, "loss": 6.071, "mean_token_accuracy": 0.11885945498943329, "num_tokens": 2064907.0, "step": 720 }, { "entropy": 6.448020601272583, "epoch": 0.8600237247924081, "grad_norm": 0.98828125, "learning_rate": 0.000362, "loss": 6.2535, "mean_token_accuracy": 0.11163201704621314, "num_tokens": 2081295.0, "step": 725 }, { "entropy": 6.399222040176392, "epoch": 0.8659549228944247, "grad_norm": 1.1640625, "learning_rate": 0.0003645, "loss": 6.178, "mean_token_accuracy": 0.11559945717453957, "num_tokens": 2098077.0, "step": 730 }, { "entropy": 6.422470808029175, "epoch": 0.8718861209964412, "grad_norm": 1.3671875, "learning_rate": 0.000367, "loss": 6.1573, "mean_token_accuracy": 0.11710702180862427, "num_tokens": 2111716.0, "step": 735 }, { "entropy": 6.352961158752441, "epoch": 0.8778173190984578, "grad_norm": 1.4609375, "learning_rate": 0.0003695, "loss": 6.0612, "mean_token_accuracy": 0.12471788600087166, "num_tokens": 2125757.0, "step": 740 }, { "entropy": 6.467966890335083, "epoch": 0.8837485172004745, "grad_norm": 1.15625, "learning_rate": 0.000372, "loss": 6.2669, "mean_token_accuracy": 0.11346666887402534, "num_tokens": 2142929.0, "step": 745 }, { "entropy": 6.385439872741699, "epoch": 0.8896797153024911, "grad_norm": 1.4296875, "learning_rate": 0.0003745, "loss": 6.1379, "mean_token_accuracy": 0.11529970616102218, "num_tokens": 2155206.0, "step": 750 }, { "entropy": 6.316713285446167, "epoch": 0.8956109134045077, "grad_norm": 1.203125, "learning_rate": 0.000377, "loss": 6.0204, "mean_token_accuracy": 0.1224408395588398, "num_tokens": 2169816.0, "step": 755 }, { "entropy": 6.3729979515075685, "epoch": 0.9015421115065243, "grad_norm": 1.078125, "learning_rate": 0.0003795, "loss": 6.106, "mean_token_accuracy": 0.11994262486696243, "num_tokens": 2184827.0, "step": 760 }, { "entropy": 6.261362934112549, "epoch": 0.9074733096085409, "grad_norm": 1.3046875, "learning_rate": 0.000382, "loss": 6.0392, "mean_token_accuracy": 0.11882986202836036, "num_tokens": 2199333.0, "step": 765 }, { "entropy": 6.316654014587402, "epoch": 0.9134045077105575, "grad_norm": 0.921875, "learning_rate": 0.0003845, "loss": 6.0836, "mean_token_accuracy": 0.12039939314126968, "num_tokens": 2215239.0, "step": 770 }, { "entropy": 6.3938861846923825, "epoch": 0.9193357058125742, "grad_norm": 1.15625, "learning_rate": 0.00038700000000000003, "loss": 6.085, "mean_token_accuracy": 0.1213831715285778, "num_tokens": 2229369.0, "step": 775 }, { "entropy": 6.262855195999146, "epoch": 0.9252669039145908, "grad_norm": 1.125, "learning_rate": 0.00038950000000000003, "loss": 6.0793, "mean_token_accuracy": 0.12699812799692153, "num_tokens": 2242709.0, "step": 780 }, { "entropy": 6.378830051422119, "epoch": 0.9311981020166074, "grad_norm": 1.140625, "learning_rate": 0.00039200000000000004, "loss": 6.0655, "mean_token_accuracy": 0.11725454851984977, "num_tokens": 2257067.0, "step": 785 }, { "entropy": 6.268696022033692, "epoch": 0.9371293001186239, "grad_norm": 1.203125, "learning_rate": 0.00039450000000000005, "loss": 6.0146, "mean_token_accuracy": 0.12406265735626221, "num_tokens": 2270932.0, "step": 790 }, { "entropy": 6.312669181823731, "epoch": 0.9430604982206405, "grad_norm": 1.09375, "learning_rate": 0.00039700000000000005, "loss": 6.109, "mean_token_accuracy": 0.11879168227314948, "num_tokens": 2285517.0, "step": 795 }, { "entropy": 6.1997991561889645, "epoch": 0.9489916963226572, "grad_norm": 1.09375, "learning_rate": 0.0003995, "loss": 5.9847, "mean_token_accuracy": 0.12326976284384727, "num_tokens": 2298657.0, "step": 800 }, { "entropy": 6.30251636505127, "epoch": 0.9549228944246738, "grad_norm": 1.171875, "learning_rate": 0.000402, "loss": 5.9947, "mean_token_accuracy": 0.1275511786341667, "num_tokens": 2312521.0, "step": 805 }, { "entropy": 6.245606517791748, "epoch": 0.9608540925266904, "grad_norm": 1.28125, "learning_rate": 0.0004045, "loss": 5.98, "mean_token_accuracy": 0.12642857506871225, "num_tokens": 2325849.0, "step": 810 }, { "entropy": 6.244391679763794, "epoch": 0.966785290628707, "grad_norm": 1.3125, "learning_rate": 0.00040699999999999997, "loss": 6.0049, "mean_token_accuracy": 0.12391034886240959, "num_tokens": 2339717.0, "step": 815 }, { "entropy": 6.243370532989502, "epoch": 0.9727164887307236, "grad_norm": 1.125, "learning_rate": 0.0004095, "loss": 6.0679, "mean_token_accuracy": 0.12291354686021805, "num_tokens": 2353536.0, "step": 820 }, { "entropy": 6.279402780532837, "epoch": 0.9786476868327402, "grad_norm": 1.265625, "learning_rate": 0.000412, "loss": 6.0335, "mean_token_accuracy": 0.11777281686663628, "num_tokens": 2368626.0, "step": 825 }, { "entropy": 6.269067335128784, "epoch": 0.9845788849347569, "grad_norm": 1.2265625, "learning_rate": 0.0004145, "loss": 6.0985, "mean_token_accuracy": 0.12023787796497346, "num_tokens": 2383768.0, "step": 830 }, { "entropy": 6.300761365890503, "epoch": 0.9905100830367735, "grad_norm": 1.2265625, "learning_rate": 0.000417, "loss": 6.1254, "mean_token_accuracy": 0.12162568196654319, "num_tokens": 2398089.0, "step": 835 }, { "entropy": 6.220589017868042, "epoch": 0.99644128113879, "grad_norm": 1.1015625, "learning_rate": 0.0004195, "loss": 5.992, "mean_token_accuracy": 0.12641523778438568, "num_tokens": 2411354.0, "step": 840 }, { "entropy": 6.249312019348144, "epoch": 1.0023724792408066, "grad_norm": 1.015625, "learning_rate": 0.000422, "loss": 5.9945, "mean_token_accuracy": 0.12419759780168534, "num_tokens": 2425071.0, "step": 845 }, { "entropy": 6.2975963115692135, "epoch": 1.0083036773428233, "grad_norm": 1.1796875, "learning_rate": 0.0004245, "loss": 5.9569, "mean_token_accuracy": 0.13322616517543792, "num_tokens": 2439143.0, "step": 850 }, { "entropy": 6.093033933639527, "epoch": 1.0142348754448398, "grad_norm": 1.0078125, "learning_rate": 0.000427, "loss": 5.7989, "mean_token_accuracy": 0.12915606275200844, "num_tokens": 2453466.0, "step": 855 }, { "entropy": 6.169495487213135, "epoch": 1.0201660735468565, "grad_norm": 1.2734375, "learning_rate": 0.0004295, "loss": 5.9269, "mean_token_accuracy": 0.13161411434412001, "num_tokens": 2466802.0, "step": 860 }, { "entropy": 6.1576333999633786, "epoch": 1.026097271648873, "grad_norm": 1.1875, "learning_rate": 0.000432, "loss": 5.8612, "mean_token_accuracy": 0.13197067752480507, "num_tokens": 2480080.0, "step": 865 }, { "entropy": 6.120718669891358, "epoch": 1.0320284697508897, "grad_norm": 1.2890625, "learning_rate": 0.0004345, "loss": 5.9076, "mean_token_accuracy": 0.13211096227169036, "num_tokens": 2495196.0, "step": 870 }, { "entropy": 6.083641386032104, "epoch": 1.0379596678529064, "grad_norm": 1.15625, "learning_rate": 0.000437, "loss": 5.8176, "mean_token_accuracy": 0.12702380120754242, "num_tokens": 2510084.0, "step": 875 }, { "entropy": 6.16945514678955, "epoch": 1.0438908659549229, "grad_norm": 1.25, "learning_rate": 0.0004395, "loss": 5.8956, "mean_token_accuracy": 0.1281700126826763, "num_tokens": 2522834.0, "step": 880 }, { "entropy": 6.146343135833741, "epoch": 1.0498220640569396, "grad_norm": 1.1328125, "learning_rate": 0.000442, "loss": 5.8657, "mean_token_accuracy": 0.13543630614876748, "num_tokens": 2536778.0, "step": 885 }, { "entropy": 6.07814359664917, "epoch": 1.055753262158956, "grad_norm": 1.265625, "learning_rate": 0.0004445, "loss": 5.9005, "mean_token_accuracy": 0.13273447826504708, "num_tokens": 2551220.0, "step": 890 }, { "entropy": 6.273546886444092, "epoch": 1.0616844602609727, "grad_norm": 1.1796875, "learning_rate": 0.000447, "loss": 5.9534, "mean_token_accuracy": 0.12553919553756715, "num_tokens": 2565686.0, "step": 895 }, { "entropy": 6.094685745239258, "epoch": 1.0676156583629894, "grad_norm": 1.140625, "learning_rate": 0.00044950000000000003, "loss": 5.8687, "mean_token_accuracy": 0.12925135344266891, "num_tokens": 2579569.0, "step": 900 }, { "entropy": 6.097094774246216, "epoch": 1.073546856465006, "grad_norm": 1.5546875, "learning_rate": 0.00045200000000000004, "loss": 5.8717, "mean_token_accuracy": 0.12844056114554406, "num_tokens": 2593226.0, "step": 905 }, { "entropy": 6.054626512527466, "epoch": 1.0794780545670226, "grad_norm": 1.1015625, "learning_rate": 0.00045450000000000004, "loss": 5.8381, "mean_token_accuracy": 0.13379990607500075, "num_tokens": 2607711.0, "step": 910 }, { "entropy": 6.059130144119263, "epoch": 1.085409252669039, "grad_norm": 1.1171875, "learning_rate": 0.00045700000000000005, "loss": 5.8697, "mean_token_accuracy": 0.130379880964756, "num_tokens": 2623024.0, "step": 915 }, { "entropy": 6.079943466186523, "epoch": 1.0913404507710558, "grad_norm": 1.078125, "learning_rate": 0.00045950000000000006, "loss": 5.8499, "mean_token_accuracy": 0.12744099125266076, "num_tokens": 2637824.0, "step": 920 }, { "entropy": 6.051183843612671, "epoch": 1.0972716488730723, "grad_norm": 1.2421875, "learning_rate": 0.000462, "loss": 5.8486, "mean_token_accuracy": 0.13178792968392372, "num_tokens": 2652077.0, "step": 925 }, { "entropy": 6.085985422134399, "epoch": 1.103202846975089, "grad_norm": 1.2265625, "learning_rate": 0.0004645, "loss": 5.8555, "mean_token_accuracy": 0.1309271603822708, "num_tokens": 2666791.0, "step": 930 }, { "entropy": 6.091299629211425, "epoch": 1.1091340450771057, "grad_norm": 0.9765625, "learning_rate": 0.000467, "loss": 5.9439, "mean_token_accuracy": 0.12866507172584535, "num_tokens": 2681482.0, "step": 935 }, { "entropy": 6.0315086364746096, "epoch": 1.1150652431791221, "grad_norm": 1.046875, "learning_rate": 0.0004695, "loss": 5.7415, "mean_token_accuracy": 0.13911210745573044, "num_tokens": 2695305.0, "step": 940 }, { "entropy": 6.070809412002563, "epoch": 1.1209964412811388, "grad_norm": 1.125, "learning_rate": 0.000472, "loss": 5.81, "mean_token_accuracy": 0.13352661579847336, "num_tokens": 2712211.0, "step": 945 }, { "entropy": 6.029483652114868, "epoch": 1.1269276393831553, "grad_norm": 1.0859375, "learning_rate": 0.0004745, "loss": 5.8556, "mean_token_accuracy": 0.13038185760378837, "num_tokens": 2726888.0, "step": 950 }, { "entropy": 6.026515007019043, "epoch": 1.132858837485172, "grad_norm": 1.1015625, "learning_rate": 0.000477, "loss": 5.8209, "mean_token_accuracy": 0.1355987899005413, "num_tokens": 2741734.0, "step": 955 }, { "entropy": 6.002088499069214, "epoch": 1.1387900355871885, "grad_norm": 1.2890625, "learning_rate": 0.0004795, "loss": 5.8273, "mean_token_accuracy": 0.13999779522418976, "num_tokens": 2754680.0, "step": 960 }, { "entropy": 6.053714990615845, "epoch": 1.1447212336892052, "grad_norm": 1.2109375, "learning_rate": 0.000482, "loss": 5.8717, "mean_token_accuracy": 0.12814902439713477, "num_tokens": 2769572.0, "step": 965 }, { "entropy": 6.109354639053345, "epoch": 1.150652431791222, "grad_norm": 1.3125, "learning_rate": 0.0004845, "loss": 5.8165, "mean_token_accuracy": 0.12989651635289193, "num_tokens": 2782948.0, "step": 970 }, { "entropy": 5.920255517959594, "epoch": 1.1565836298932384, "grad_norm": 1.03125, "learning_rate": 0.000487, "loss": 5.7569, "mean_token_accuracy": 0.13256713449954988, "num_tokens": 2795399.0, "step": 975 }, { "entropy": 5.974841451644897, "epoch": 1.162514827995255, "grad_norm": 1.203125, "learning_rate": 0.0004895, "loss": 5.7628, "mean_token_accuracy": 0.13333625793457032, "num_tokens": 2809591.0, "step": 980 }, { "entropy": 6.011464214324951, "epoch": 1.1684460260972718, "grad_norm": 1.0546875, "learning_rate": 0.000492, "loss": 5.7889, "mean_token_accuracy": 0.13518815189599992, "num_tokens": 2824106.0, "step": 985 }, { "entropy": 6.024096918106079, "epoch": 1.1743772241992882, "grad_norm": 1.109375, "learning_rate": 0.0004945, "loss": 5.9184, "mean_token_accuracy": 0.12920955419540406, "num_tokens": 2838616.0, "step": 990 }, { "entropy": 5.981972026824951, "epoch": 1.180308422301305, "grad_norm": 1.3046875, "learning_rate": 0.000497, "loss": 5.798, "mean_token_accuracy": 0.13885542377829552, "num_tokens": 2851707.0, "step": 995 }, { "entropy": 6.011092615127564, "epoch": 1.1862396204033214, "grad_norm": 1.0390625, "learning_rate": 0.0004995, "loss": 5.8358, "mean_token_accuracy": 0.1295635662972927, "num_tokens": 2867644.0, "step": 1000 }, { "epoch": 1.1862396204033214, "eval_entropy": 5.97049690024253, "eval_loss": 6.048816204071045, "eval_mean_token_accuracy": 0.130689339495144, "eval_num_tokens": 2867644.0, "eval_runtime": 2.4358, "eval_samples_per_second": 1070.705, "eval_steps_per_second": 133.838, "step": 1000 } ], "logging_steps": 5, "max_steps": 8420, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 5083861082112000.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }