{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.5931198102016607, "eval_steps": 500, "global_step": 500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 4.805317306518555, "epoch": 0.005931198102016607, "grad_norm": 16.25, "learning_rate": 2e-06, "loss": 14.4312, "mean_token_accuracy": 0.0, "num_tokens": 12647.0, "step": 5 }, { "entropy": 4.825564956665039, "epoch": 0.011862396204033215, "grad_norm": 16.875, "learning_rate": 4.5e-06, "loss": 14.4169, "mean_token_accuracy": 0.0, "num_tokens": 26668.0, "step": 10 }, { "entropy": 4.845508098602295, "epoch": 0.017793594306049824, "grad_norm": 24.75, "learning_rate": 7e-06, "loss": 14.1564, "mean_token_accuracy": 0.0, "num_tokens": 41021.0, "step": 15 }, { "entropy": 5.1169312477111815, "epoch": 0.02372479240806643, "grad_norm": 33.75, "learning_rate": 9.5e-06, "loss": 13.5366, "mean_token_accuracy": 0.0, "num_tokens": 56626.0, "step": 20 }, { "entropy": 7.628379774093628, "epoch": 0.02965599051008304, "grad_norm": 15.25, "learning_rate": 1.2e-05, "loss": 11.8077, "mean_token_accuracy": 0.00010419512109365315, "num_tokens": 72914.0, "step": 25 }, { "entropy": 10.455063152313233, "epoch": 0.03558718861209965, "grad_norm": 3.21875, "learning_rate": 1.4500000000000002e-05, "loss": 10.841, "mean_token_accuracy": 0.0054948762990534306, "num_tokens": 88514.0, "step": 30 }, { "entropy": 10.646884059906006, "epoch": 0.04151838671411625, "grad_norm": 3.03125, "learning_rate": 1.7000000000000003e-05, "loss": 10.5696, "mean_token_accuracy": 0.01355562973767519, "num_tokens": 101256.0, "step": 35 }, { "entropy": 10.619774627685548, "epoch": 0.04744958481613286, "grad_norm": 2.4375, "learning_rate": 1.95e-05, "loss": 10.282, "mean_token_accuracy": 0.012707393150776625, "num_tokens": 114459.0, "step": 40 }, { "entropy": 10.61210651397705, "epoch": 0.05338078291814947, "grad_norm": 2.28125, "learning_rate": 2.2e-05, "loss": 10.0287, "mean_token_accuracy": 0.01491355374455452, "num_tokens": 129858.0, "step": 45 }, { "entropy": 10.597074794769288, "epoch": 0.05931198102016608, "grad_norm": 2.1875, "learning_rate": 2.4500000000000003e-05, "loss": 9.8185, "mean_token_accuracy": 0.0331686332821846, "num_tokens": 143486.0, "step": 50 }, { "entropy": 10.579236507415771, "epoch": 0.06524317912218268, "grad_norm": 1.9609375, "learning_rate": 2.7e-05, "loss": 9.6912, "mean_token_accuracy": 0.035220497474074366, "num_tokens": 156003.0, "step": 55 }, { "entropy": 10.577684020996093, "epoch": 0.0711743772241993, "grad_norm": 2.03125, "learning_rate": 2.95e-05, "loss": 9.6506, "mean_token_accuracy": 0.034727090038359165, "num_tokens": 170988.0, "step": 60 }, { "entropy": 10.5711012840271, "epoch": 0.0771055753262159, "grad_norm": 1.984375, "learning_rate": 3.2e-05, "loss": 9.5328, "mean_token_accuracy": 0.03448135014623403, "num_tokens": 187165.0, "step": 65 }, { "entropy": 10.558809852600097, "epoch": 0.0830367734282325, "grad_norm": 1.9453125, "learning_rate": 3.4500000000000005e-05, "loss": 9.4798, "mean_token_accuracy": 0.03228826243430376, "num_tokens": 202072.0, "step": 70 }, { "entropy": 10.549299335479736, "epoch": 0.08896797153024912, "grad_norm": 1.8671875, "learning_rate": 3.7e-05, "loss": 9.3281, "mean_token_accuracy": 0.034324941039085385, "num_tokens": 215375.0, "step": 75 }, { "entropy": 10.532067012786865, "epoch": 0.09489916963226572, "grad_norm": 1.734375, "learning_rate": 3.95e-05, "loss": 9.2492, "mean_token_accuracy": 0.03353528436273336, "num_tokens": 228749.0, "step": 80 }, { "entropy": 10.505972194671632, "epoch": 0.10083036773428232, "grad_norm": 1.8359375, "learning_rate": 4.2000000000000004e-05, "loss": 9.1494, "mean_token_accuracy": 0.03314766474068165, "num_tokens": 242387.0, "step": 85 }, { "entropy": 10.478415584564209, "epoch": 0.10676156583629894, "grad_norm": 1.796875, "learning_rate": 4.45e-05, "loss": 9.0705, "mean_token_accuracy": 0.032026905380189416, "num_tokens": 257793.0, "step": 90 }, { "entropy": 10.454620742797852, "epoch": 0.11269276393831554, "grad_norm": 1.75, "learning_rate": 4.7000000000000004e-05, "loss": 8.9712, "mean_token_accuracy": 0.0325484286993742, "num_tokens": 271187.0, "step": 95 }, { "entropy": 10.40716381072998, "epoch": 0.11862396204033215, "grad_norm": 1.609375, "learning_rate": 4.9500000000000004e-05, "loss": 8.8474, "mean_token_accuracy": 0.03217122312635183, "num_tokens": 284937.0, "step": 100 }, { "entropy": 10.335246372222901, "epoch": 0.12455516014234876, "grad_norm": 1.765625, "learning_rate": 5.2e-05, "loss": 8.6893, "mean_token_accuracy": 0.03255892116576433, "num_tokens": 300108.0, "step": 105 }, { "entropy": 10.246189594268799, "epoch": 0.13048635824436536, "grad_norm": 1.53125, "learning_rate": 5.45e-05, "loss": 8.5681, "mean_token_accuracy": 0.031065495498478413, "num_tokens": 316760.0, "step": 110 }, { "entropy": 10.13212080001831, "epoch": 0.13641755634638197, "grad_norm": 1.5078125, "learning_rate": 5.7e-05, "loss": 8.3819, "mean_token_accuracy": 0.03049417305737734, "num_tokens": 329705.0, "step": 115 }, { "entropy": 9.97801332473755, "epoch": 0.1423487544483986, "grad_norm": 1.3203125, "learning_rate": 5.9499999999999996e-05, "loss": 8.244, "mean_token_accuracy": 0.03179512321949005, "num_tokens": 342947.0, "step": 120 }, { "entropy": 9.771716022491455, "epoch": 0.14827995255041518, "grad_norm": 1.2109375, "learning_rate": 6.2e-05, "loss": 8.0865, "mean_token_accuracy": 0.03442887142300606, "num_tokens": 358397.0, "step": 125 }, { "entropy": 9.533180236816406, "epoch": 0.1542111506524318, "grad_norm": 1.140625, "learning_rate": 6.450000000000001e-05, "loss": 7.9643, "mean_token_accuracy": 0.03413730468600988, "num_tokens": 370369.0, "step": 130 }, { "entropy": 9.256175804138184, "epoch": 0.1601423487544484, "grad_norm": 0.953125, "learning_rate": 6.7e-05, "loss": 7.8421, "mean_token_accuracy": 0.03181219045072794, "num_tokens": 386896.0, "step": 135 }, { "entropy": 8.96011724472046, "epoch": 0.166073546856465, "grad_norm": 0.8671875, "learning_rate": 6.950000000000001e-05, "loss": 7.6981, "mean_token_accuracy": 0.03533113058656454, "num_tokens": 400433.0, "step": 140 }, { "entropy": 8.675125217437744, "epoch": 0.17200474495848161, "grad_norm": 0.7890625, "learning_rate": 7.2e-05, "loss": 7.6507, "mean_token_accuracy": 0.030981262400746345, "num_tokens": 415092.0, "step": 145 }, { "entropy": 8.432178497314453, "epoch": 0.17793594306049823, "grad_norm": 0.7109375, "learning_rate": 7.45e-05, "loss": 7.5489, "mean_token_accuracy": 0.033769184909760955, "num_tokens": 429793.0, "step": 150 }, { "entropy": 8.235133266448974, "epoch": 0.18386714116251482, "grad_norm": 0.77734375, "learning_rate": 7.7e-05, "loss": 7.5575, "mean_token_accuracy": 0.03205921929329634, "num_tokens": 442618.0, "step": 155 }, { "entropy": 8.142054271697997, "epoch": 0.18979833926453143, "grad_norm": 0.75, "learning_rate": 7.950000000000001e-05, "loss": 7.4449, "mean_token_accuracy": 0.03399460650980472, "num_tokens": 454976.0, "step": 160 }, { "entropy": 8.025918197631835, "epoch": 0.19572953736654805, "grad_norm": 0.8671875, "learning_rate": 8.2e-05, "loss": 7.5037, "mean_token_accuracy": 0.03331909943372011, "num_tokens": 467523.0, "step": 165 }, { "entropy": 7.9379983901977536, "epoch": 0.20166073546856464, "grad_norm": 0.6796875, "learning_rate": 8.450000000000001e-05, "loss": 7.4373, "mean_token_accuracy": 0.03239843733608723, "num_tokens": 481391.0, "step": 170 }, { "entropy": 7.869046401977539, "epoch": 0.20759193357058126, "grad_norm": 0.67578125, "learning_rate": 8.7e-05, "loss": 7.4399, "mean_token_accuracy": 0.0311466746032238, "num_tokens": 496697.0, "step": 175 }, { "entropy": 7.866212034225464, "epoch": 0.21352313167259787, "grad_norm": 0.77734375, "learning_rate": 8.95e-05, "loss": 7.4743, "mean_token_accuracy": 0.027226756513118743, "num_tokens": 510091.0, "step": 180 }, { "entropy": 7.788731241226197, "epoch": 0.21945432977461446, "grad_norm": 0.703125, "learning_rate": 9.2e-05, "loss": 7.426, "mean_token_accuracy": 0.03152833003550768, "num_tokens": 522168.0, "step": 185 }, { "entropy": 7.754296016693115, "epoch": 0.22538552787663108, "grad_norm": 0.71875, "learning_rate": 9.45e-05, "loss": 7.3943, "mean_token_accuracy": 0.03427231907844543, "num_tokens": 535853.0, "step": 190 }, { "entropy": 7.75240159034729, "epoch": 0.2313167259786477, "grad_norm": 0.77734375, "learning_rate": 9.7e-05, "loss": 7.4255, "mean_token_accuracy": 0.03329353462904692, "num_tokens": 551082.0, "step": 195 }, { "entropy": 7.700812101364136, "epoch": 0.2372479240806643, "grad_norm": 0.7265625, "learning_rate": 9.95e-05, "loss": 7.4629, "mean_token_accuracy": 0.035965221747756, "num_tokens": 567181.0, "step": 200 }, { "entropy": 7.696683025360107, "epoch": 0.2431791221826809, "grad_norm": 0.71484375, "learning_rate": 0.000102, "loss": 7.4112, "mean_token_accuracy": 0.035206197388470174, "num_tokens": 580689.0, "step": 205 }, { "entropy": 7.712547016143799, "epoch": 0.2491103202846975, "grad_norm": 0.765625, "learning_rate": 0.00010449999999999999, "loss": 7.3345, "mean_token_accuracy": 0.03781173955649138, "num_tokens": 594590.0, "step": 210 }, { "entropy": 7.769494247436524, "epoch": 0.25504151838671413, "grad_norm": 10.5, "learning_rate": 0.000107, "loss": 7.3905, "mean_token_accuracy": 0.03799592889845371, "num_tokens": 610577.0, "step": 215 }, { "entropy": 7.6959569454193115, "epoch": 0.2609727164887307, "grad_norm": 0.97265625, "learning_rate": 0.0001095, "loss": 7.384, "mean_token_accuracy": 0.037612661719322205, "num_tokens": 627066.0, "step": 220 }, { "entropy": 7.781623411178589, "epoch": 0.2669039145907473, "grad_norm": 0.90625, "learning_rate": 0.000112, "loss": 7.3672, "mean_token_accuracy": 0.04785094037652016, "num_tokens": 642601.0, "step": 225 }, { "entropy": 7.77043514251709, "epoch": 0.27283511269276395, "grad_norm": 1.484375, "learning_rate": 0.0001145, "loss": 7.2531, "mean_token_accuracy": 0.05052996054291725, "num_tokens": 655615.0, "step": 230 }, { "entropy": 7.747775220870972, "epoch": 0.27876631079478054, "grad_norm": 0.94140625, "learning_rate": 0.00011700000000000001, "loss": 7.2647, "mean_token_accuracy": 0.05221507623791695, "num_tokens": 670218.0, "step": 235 }, { "entropy": 7.743488121032715, "epoch": 0.2846975088967972, "grad_norm": 0.75390625, "learning_rate": 0.00011949999999999999, "loss": 7.2593, "mean_token_accuracy": 0.05101203434169292, "num_tokens": 683661.0, "step": 240 }, { "entropy": 7.713605117797852, "epoch": 0.29062870699881377, "grad_norm": 1.1875, "learning_rate": 0.000122, "loss": 7.2135, "mean_token_accuracy": 0.05287150628864765, "num_tokens": 699767.0, "step": 245 }, { "entropy": 7.695834493637085, "epoch": 0.29655990510083036, "grad_norm": 0.953125, "learning_rate": 0.0001245, "loss": 7.1762, "mean_token_accuracy": 0.05634650327265263, "num_tokens": 713579.0, "step": 250 }, { "entropy": 7.629615783691406, "epoch": 0.302491103202847, "grad_norm": 1.296875, "learning_rate": 0.000127, "loss": 7.1678, "mean_token_accuracy": 0.05482946485280991, "num_tokens": 727490.0, "step": 255 }, { "entropy": 7.607522439956665, "epoch": 0.3084223013048636, "grad_norm": 0.80078125, "learning_rate": 0.0001295, "loss": 7.2348, "mean_token_accuracy": 0.05509466864168644, "num_tokens": 742477.0, "step": 260 }, { "entropy": 7.624451637268066, "epoch": 0.3143534994068802, "grad_norm": 1.2578125, "learning_rate": 0.000132, "loss": 7.113, "mean_token_accuracy": 0.05751051269471645, "num_tokens": 757772.0, "step": 265 }, { "entropy": 7.647220134735107, "epoch": 0.3202846975088968, "grad_norm": 1.390625, "learning_rate": 0.00013450000000000002, "loss": 7.1596, "mean_token_accuracy": 0.05049732141196728, "num_tokens": 772898.0, "step": 270 }, { "entropy": 7.600799989700318, "epoch": 0.3262158956109134, "grad_norm": 1.34375, "learning_rate": 0.00013700000000000002, "loss": 7.1154, "mean_token_accuracy": 0.05433249212801457, "num_tokens": 788395.0, "step": 275 }, { "entropy": 7.563078927993774, "epoch": 0.33214709371293, "grad_norm": 1.078125, "learning_rate": 0.0001395, "loss": 7.1648, "mean_token_accuracy": 0.06050356179475784, "num_tokens": 803413.0, "step": 280 }, { "entropy": 7.517913770675659, "epoch": 0.33807829181494664, "grad_norm": 1.34375, "learning_rate": 0.00014199999999999998, "loss": 7.0248, "mean_token_accuracy": 0.06933637075126171, "num_tokens": 817775.0, "step": 285 }, { "entropy": 7.566510915756226, "epoch": 0.34400948991696323, "grad_norm": 1.15625, "learning_rate": 0.0001445, "loss": 7.1421, "mean_token_accuracy": 0.06264986135065556, "num_tokens": 831379.0, "step": 290 }, { "entropy": 7.551775217056274, "epoch": 0.3499406880189798, "grad_norm": 1.0234375, "learning_rate": 0.000147, "loss": 7.0759, "mean_token_accuracy": 0.05862759165465832, "num_tokens": 846596.0, "step": 295 }, { "entropy": 7.553944540023804, "epoch": 0.35587188612099646, "grad_norm": 1.0234375, "learning_rate": 0.0001495, "loss": 7.0666, "mean_token_accuracy": 0.05912046544253826, "num_tokens": 862063.0, "step": 300 }, { "entropy": 7.582914543151856, "epoch": 0.36180308422301305, "grad_norm": 1.0859375, "learning_rate": 0.000152, "loss": 6.9961, "mean_token_accuracy": 0.06986662931740284, "num_tokens": 876841.0, "step": 305 }, { "entropy": 7.488122177124024, "epoch": 0.36773428232502964, "grad_norm": 1.1875, "learning_rate": 0.00015450000000000001, "loss": 7.0603, "mean_token_accuracy": 0.06794393062591553, "num_tokens": 890728.0, "step": 310 }, { "entropy": 7.442899990081787, "epoch": 0.3736654804270463, "grad_norm": 1.0703125, "learning_rate": 0.000157, "loss": 6.983, "mean_token_accuracy": 0.0702366728335619, "num_tokens": 905599.0, "step": 315 }, { "entropy": 7.451259899139404, "epoch": 0.37959667852906287, "grad_norm": 1.3359375, "learning_rate": 0.0001595, "loss": 6.9367, "mean_token_accuracy": 0.07826149612665176, "num_tokens": 918139.0, "step": 320 }, { "entropy": 7.405993700027466, "epoch": 0.38552787663107946, "grad_norm": 1.3515625, "learning_rate": 0.000162, "loss": 6.9943, "mean_token_accuracy": 0.0733895305544138, "num_tokens": 931666.0, "step": 325 }, { "entropy": 7.446602392196655, "epoch": 0.3914590747330961, "grad_norm": 1.2890625, "learning_rate": 0.00016450000000000001, "loss": 6.9418, "mean_token_accuracy": 0.0699479129165411, "num_tokens": 946286.0, "step": 330 }, { "entropy": 7.44321928024292, "epoch": 0.3973902728351127, "grad_norm": 1.25, "learning_rate": 0.00016700000000000002, "loss": 6.9048, "mean_token_accuracy": 0.0711387813091278, "num_tokens": 959689.0, "step": 335 }, { "entropy": 7.383141279220581, "epoch": 0.4033214709371293, "grad_norm": 1.4609375, "learning_rate": 0.00016950000000000003, "loss": 6.9099, "mean_token_accuracy": 0.07436129115521908, "num_tokens": 972707.0, "step": 340 }, { "entropy": 7.326433992385864, "epoch": 0.4092526690391459, "grad_norm": 1.234375, "learning_rate": 0.00017199999999999998, "loss": 6.9298, "mean_token_accuracy": 0.07282942235469818, "num_tokens": 988010.0, "step": 345 }, { "entropy": 7.3913586139678955, "epoch": 0.4151838671411625, "grad_norm": 1.6015625, "learning_rate": 0.00017449999999999999, "loss": 6.9494, "mean_token_accuracy": 0.0702156439423561, "num_tokens": 1003823.0, "step": 350 }, { "entropy": 7.271407747268677, "epoch": 0.4211150652431791, "grad_norm": 1.7421875, "learning_rate": 0.000177, "loss": 6.7257, "mean_token_accuracy": 0.08785916194319725, "num_tokens": 1018276.0, "step": 355 }, { "entropy": 7.315984010696411, "epoch": 0.42704626334519574, "grad_norm": 1.40625, "learning_rate": 0.0001795, "loss": 6.9177, "mean_token_accuracy": 0.07590937204658985, "num_tokens": 1031242.0, "step": 360 }, { "entropy": 7.36967716217041, "epoch": 0.43297746144721233, "grad_norm": 1.2421875, "learning_rate": 0.000182, "loss": 6.826, "mean_token_accuracy": 0.08421060293912888, "num_tokens": 1043940.0, "step": 365 }, { "entropy": 7.209809446334839, "epoch": 0.4389086595492289, "grad_norm": 1.046875, "learning_rate": 0.0001845, "loss": 6.7337, "mean_token_accuracy": 0.08058795779943466, "num_tokens": 1058656.0, "step": 370 }, { "entropy": 7.326260042190552, "epoch": 0.44483985765124556, "grad_norm": 1.1796875, "learning_rate": 0.000187, "loss": 6.8599, "mean_token_accuracy": 0.07443175241351127, "num_tokens": 1073128.0, "step": 375 }, { "entropy": 7.216764450073242, "epoch": 0.45077105575326215, "grad_norm": 1.5703125, "learning_rate": 0.0001895, "loss": 6.7831, "mean_token_accuracy": 0.08439998105168342, "num_tokens": 1086467.0, "step": 380 }, { "entropy": 7.274557256698609, "epoch": 0.45670225385527874, "grad_norm": 1.328125, "learning_rate": 0.000192, "loss": 6.9052, "mean_token_accuracy": 0.08290659114718438, "num_tokens": 1100356.0, "step": 385 }, { "entropy": 7.288721132278442, "epoch": 0.4626334519572954, "grad_norm": 1.4609375, "learning_rate": 0.0001945, "loss": 6.8286, "mean_token_accuracy": 0.08163000270724297, "num_tokens": 1115877.0, "step": 390 }, { "entropy": 7.271324348449707, "epoch": 0.46856465005931197, "grad_norm": 0.97265625, "learning_rate": 0.00019700000000000002, "loss": 6.7874, "mean_token_accuracy": 0.08328207209706306, "num_tokens": 1131415.0, "step": 395 }, { "entropy": 7.159351873397827, "epoch": 0.4744958481613286, "grad_norm": 1.3203125, "learning_rate": 0.00019950000000000002, "loss": 6.7132, "mean_token_accuracy": 0.08293095007538795, "num_tokens": 1145903.0, "step": 400 }, { "entropy": 7.103127574920654, "epoch": 0.4804270462633452, "grad_norm": 1.1953125, "learning_rate": 0.000202, "loss": 6.67, "mean_token_accuracy": 0.08018745929002762, "num_tokens": 1161168.0, "step": 405 }, { "entropy": 7.14245753288269, "epoch": 0.4863582443653618, "grad_norm": 1.3046875, "learning_rate": 0.00020449999999999998, "loss": 6.7324, "mean_token_accuracy": 0.08255215212702752, "num_tokens": 1178155.0, "step": 410 }, { "entropy": 7.131292104721069, "epoch": 0.49228944246737844, "grad_norm": 1.2890625, "learning_rate": 0.000207, "loss": 6.5728, "mean_token_accuracy": 0.09345637336373329, "num_tokens": 1190830.0, "step": 415 }, { "entropy": 7.046381425857544, "epoch": 0.498220640569395, "grad_norm": 1.21875, "learning_rate": 0.0002095, "loss": 6.5814, "mean_token_accuracy": 0.08820187523961068, "num_tokens": 1205260.0, "step": 420 }, { "entropy": 7.083016061782837, "epoch": 0.5041518386714117, "grad_norm": 1.453125, "learning_rate": 0.000212, "loss": 6.6316, "mean_token_accuracy": 0.09104111194610595, "num_tokens": 1218856.0, "step": 425 }, { "entropy": 7.034869623184204, "epoch": 0.5100830367734283, "grad_norm": 1.4453125, "learning_rate": 0.0002145, "loss": 6.6934, "mean_token_accuracy": 0.09010339081287384, "num_tokens": 1234669.0, "step": 430 }, { "entropy": 7.032301235198974, "epoch": 0.5160142348754448, "grad_norm": 1.4375, "learning_rate": 0.00021700000000000002, "loss": 6.6293, "mean_token_accuracy": 0.09128119722008705, "num_tokens": 1249514.0, "step": 435 }, { "entropy": 7.032708358764649, "epoch": 0.5219454329774614, "grad_norm": 1.1171875, "learning_rate": 0.0002195, "loss": 6.5626, "mean_token_accuracy": 0.0961005687713623, "num_tokens": 1262311.0, "step": 440 }, { "entropy": 6.9413275718688965, "epoch": 0.527876631079478, "grad_norm": 1.4453125, "learning_rate": 0.000222, "loss": 6.5488, "mean_token_accuracy": 0.09156981036067009, "num_tokens": 1277681.0, "step": 445 }, { "entropy": 7.003400182723999, "epoch": 0.5338078291814946, "grad_norm": 1.3359375, "learning_rate": 0.0002245, "loss": 6.5879, "mean_token_accuracy": 0.09069180116057396, "num_tokens": 1292300.0, "step": 450 }, { "entropy": 7.015186309814453, "epoch": 0.5397390272835113, "grad_norm": 1.203125, "learning_rate": 0.00022700000000000002, "loss": 6.595, "mean_token_accuracy": 0.08999119028449058, "num_tokens": 1307426.0, "step": 455 }, { "entropy": 6.900823402404785, "epoch": 0.5456702253855279, "grad_norm": 1.125, "learning_rate": 0.00022950000000000002, "loss": 6.6162, "mean_token_accuracy": 0.09043457433581352, "num_tokens": 1322167.0, "step": 460 }, { "entropy": 6.999922370910644, "epoch": 0.5516014234875445, "grad_norm": 1.1875, "learning_rate": 0.00023200000000000003, "loss": 6.4976, "mean_token_accuracy": 0.09610431045293807, "num_tokens": 1335343.0, "step": 465 }, { "entropy": 6.857682752609253, "epoch": 0.5575326215895611, "grad_norm": 1.078125, "learning_rate": 0.00023449999999999998, "loss": 6.4976, "mean_token_accuracy": 0.09826786443591118, "num_tokens": 1349078.0, "step": 470 }, { "entropy": 6.899160289764405, "epoch": 0.5634638196915777, "grad_norm": 1.3203125, "learning_rate": 0.000237, "loss": 6.4224, "mean_token_accuracy": 0.1049638457596302, "num_tokens": 1362030.0, "step": 475 }, { "entropy": 6.993446207046508, "epoch": 0.5693950177935944, "grad_norm": 1.609375, "learning_rate": 0.0002395, "loss": 6.5763, "mean_token_accuracy": 0.08985362276434898, "num_tokens": 1378303.0, "step": 480 }, { "entropy": 6.935125350952148, "epoch": 0.575326215895611, "grad_norm": 1.1875, "learning_rate": 0.000242, "loss": 6.5767, "mean_token_accuracy": 0.09316942617297172, "num_tokens": 1392585.0, "step": 485 }, { "entropy": 6.9703733921051025, "epoch": 0.5812574139976275, "grad_norm": 1.75, "learning_rate": 0.0002445, "loss": 6.5814, "mean_token_accuracy": 0.09292712658643723, "num_tokens": 1406962.0, "step": 490 }, { "entropy": 6.836954164505005, "epoch": 0.5871886120996441, "grad_norm": 1.265625, "learning_rate": 0.000247, "loss": 6.4605, "mean_token_accuracy": 0.09848191663622856, "num_tokens": 1419493.0, "step": 495 }, { "entropy": 6.868243980407715, "epoch": 0.5931198102016607, "grad_norm": 1.40625, "learning_rate": 0.0002495, "loss": 6.4801, "mean_token_accuracy": 0.09710933044552802, "num_tokens": 1435373.0, "step": 500 }, { "epoch": 0.5931198102016607, "eval_entropy": 6.868733419231111, "eval_loss": 6.604183673858643, "eval_mean_token_accuracy": 0.09870429635276458, "eval_num_tokens": 1435373.0, "eval_runtime": 2.5304, "eval_samples_per_second": 1030.674, "eval_steps_per_second": 128.834, "step": 500 } ], "logging_steps": 5, "max_steps": 8420, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 2556432248832000.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }