{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.033488496701383076, "eval_steps": 500, "global_step": 500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.742561435699463, "epoch": 0.00033488496701383075, "grad_norm": 4.5, "learning_rate": 2e-06, "loss": 10.7498, "mean_token_accuracy": 0.0, "num_tokens": 9336.0, "step": 5 }, { "entropy": 10.742577743530273, "epoch": 0.0006697699340276615, "grad_norm": 4.3125, "learning_rate": 4.5e-06, "loss": 10.7384, "mean_token_accuracy": 0.0, "num_tokens": 18837.0, "step": 10 }, { "entropy": 10.742557716369628, "epoch": 0.0010046549010414923, "grad_norm": 4.125, "learning_rate": 7e-06, "loss": 10.7272, "mean_token_accuracy": 9.718172950670123e-05, "num_tokens": 28150.0, "step": 15 }, { "entropy": 10.742551231384278, "epoch": 0.001339539868055323, "grad_norm": 4.40625, "learning_rate": 9.5e-06, "loss": 10.6837, "mean_token_accuracy": 0.0009352716442663223, "num_tokens": 37469.0, "step": 20 }, { "entropy": 10.742449760437012, "epoch": 0.0016744248350691537, "grad_norm": 4.125, "learning_rate": 1.2e-05, "loss": 10.6409, "mean_token_accuracy": 0.008969881373923272, "num_tokens": 47955.0, "step": 25 }, { "entropy": 10.742036151885987, "epoch": 0.0020093098020829846, "grad_norm": 3.71875, "learning_rate": 1.4500000000000002e-05, "loss": 10.5406, "mean_token_accuracy": 0.03436212912201882, "num_tokens": 58421.0, "step": 30 }, { "entropy": 10.740588188171387, "epoch": 0.0023441947690968153, "grad_norm": 3.0, "learning_rate": 1.7000000000000003e-05, "loss": 10.4482, "mean_token_accuracy": 0.04009146671742201, "num_tokens": 69338.0, "step": 35 }, { "entropy": 10.735538864135743, "epoch": 0.002679079736110646, "grad_norm": 2.5625, "learning_rate": 1.95e-05, "loss": 10.3231, "mean_token_accuracy": 0.0391630582511425, "num_tokens": 78964.0, "step": 40 }, { "entropy": 10.725551223754882, "epoch": 0.0030139647031244767, "grad_norm": 2.046875, "learning_rate": 2.2e-05, "loss": 10.2374, "mean_token_accuracy": 0.046432715654373166, "num_tokens": 90312.0, "step": 45 }, { "entropy": 10.711534595489502, "epoch": 0.0033488496701383074, "grad_norm": 2.078125, "learning_rate": 2.4500000000000003e-05, "loss": 10.1706, "mean_token_accuracy": 0.040825183317065236, "num_tokens": 99706.0, "step": 50 }, { "entropy": 10.701226234436035, "epoch": 0.003683734637152138, "grad_norm": 1.90625, "learning_rate": 2.7e-05, "loss": 10.1097, "mean_token_accuracy": 0.04384128861129284, "num_tokens": 109737.0, "step": 55 }, { "entropy": 10.695288467407227, "epoch": 0.004018619604165969, "grad_norm": 1.65625, "learning_rate": 2.95e-05, "loss": 10.0916, "mean_token_accuracy": 0.04214213602244854, "num_tokens": 119471.0, "step": 60 }, { "entropy": 10.689713382720948, "epoch": 0.0043535045711798, "grad_norm": 1.609375, "learning_rate": 3.2e-05, "loss": 10.0375, "mean_token_accuracy": 0.041708166152238844, "num_tokens": 130844.0, "step": 65 }, { "entropy": 10.684234142303467, "epoch": 0.0046883895381936306, "grad_norm": 1.5703125, "learning_rate": 3.4500000000000005e-05, "loss": 9.9974, "mean_token_accuracy": 0.04208777397871018, "num_tokens": 141266.0, "step": 70 }, { "entropy": 10.676689434051514, "epoch": 0.005023274505207461, "grad_norm": 1.5859375, "learning_rate": 3.7e-05, "loss": 9.898, "mean_token_accuracy": 0.04250998180359602, "num_tokens": 152222.0, "step": 75 }, { "entropy": 10.664115810394287, "epoch": 0.005358159472221292, "grad_norm": 1.5625, "learning_rate": 3.95e-05, "loss": 9.8609, "mean_token_accuracy": 0.04332525990903378, "num_tokens": 162931.0, "step": 80 }, { "entropy": 10.650795078277588, "epoch": 0.005693044439235123, "grad_norm": 1.515625, "learning_rate": 4.2000000000000004e-05, "loss": 9.8387, "mean_token_accuracy": 0.044832929782569406, "num_tokens": 172587.0, "step": 85 }, { "entropy": 10.638714599609376, "epoch": 0.006027929406248953, "grad_norm": 1.4609375, "learning_rate": 4.45e-05, "loss": 9.768, "mean_token_accuracy": 0.04449521526694298, "num_tokens": 181877.0, "step": 90 }, { "entropy": 10.623728466033935, "epoch": 0.006362814373262784, "grad_norm": 1.4453125, "learning_rate": 4.7000000000000004e-05, "loss": 9.6987, "mean_token_accuracy": 0.047365859150886536, "num_tokens": 192196.0, "step": 95 }, { "entropy": 10.59886417388916, "epoch": 0.006697699340276615, "grad_norm": 1.4140625, "learning_rate": 4.9500000000000004e-05, "loss": 9.6205, "mean_token_accuracy": 0.04793250001966953, "num_tokens": 201009.0, "step": 100 }, { "entropy": 10.578139305114746, "epoch": 0.007032584307290445, "grad_norm": 1.390625, "learning_rate": 5.2e-05, "loss": 9.5589, "mean_token_accuracy": 0.05401066094636917, "num_tokens": 209066.0, "step": 105 }, { "entropy": 10.551801109313965, "epoch": 0.007367469274304276, "grad_norm": 1.4296875, "learning_rate": 5.45e-05, "loss": 9.4901, "mean_token_accuracy": 0.05924240723252296, "num_tokens": 218721.0, "step": 110 }, { "entropy": 10.502099704742431, "epoch": 0.007702354241318108, "grad_norm": 1.546875, "learning_rate": 5.7e-05, "loss": 9.4194, "mean_token_accuracy": 0.05640989877283573, "num_tokens": 228511.0, "step": 115 }, { "entropy": 10.450156116485596, "epoch": 0.008037239208331938, "grad_norm": 1.453125, "learning_rate": 5.9499999999999996e-05, "loss": 9.3421, "mean_token_accuracy": 0.060460330545902254, "num_tokens": 237097.0, "step": 120 }, { "entropy": 10.362788772583007, "epoch": 0.008372124175345769, "grad_norm": 1.328125, "learning_rate": 6.2e-05, "loss": 9.2305, "mean_token_accuracy": 0.06126848310232162, "num_tokens": 246013.0, "step": 125 }, { "entropy": 10.28974199295044, "epoch": 0.0087070091423596, "grad_norm": 1.1953125, "learning_rate": 6.450000000000001e-05, "loss": 9.2132, "mean_token_accuracy": 0.0567143976688385, "num_tokens": 255741.0, "step": 130 }, { "entropy": 10.277145481109619, "epoch": 0.00904189410937343, "grad_norm": 1.21875, "learning_rate": 6.7e-05, "loss": 9.0746, "mean_token_accuracy": 0.060845992714166644, "num_tokens": 265877.0, "step": 135 }, { "entropy": 10.188594436645507, "epoch": 0.009376779076387261, "grad_norm": 1.1328125, "learning_rate": 6.950000000000001e-05, "loss": 9.0594, "mean_token_accuracy": 0.05822984836995602, "num_tokens": 275631.0, "step": 140 }, { "entropy": 10.113962650299072, "epoch": 0.009711664043401092, "grad_norm": 1.1484375, "learning_rate": 7.2e-05, "loss": 8.9686, "mean_token_accuracy": 0.06056818813085556, "num_tokens": 286584.0, "step": 145 }, { "entropy": 10.048769855499268, "epoch": 0.010046549010414923, "grad_norm": 1.0234375, "learning_rate": 7.45e-05, "loss": 8.9176, "mean_token_accuracy": 0.05582499206066131, "num_tokens": 296903.0, "step": 150 }, { "entropy": 9.948976993560791, "epoch": 0.010381433977428753, "grad_norm": 1.1015625, "learning_rate": 7.7e-05, "loss": 8.8091, "mean_token_accuracy": 0.058087332919239995, "num_tokens": 306940.0, "step": 155 }, { "entropy": 9.834512996673585, "epoch": 0.010716318944442584, "grad_norm": 0.78125, "learning_rate": 7.950000000000001e-05, "loss": 8.821, "mean_token_accuracy": 0.05299450382590294, "num_tokens": 317344.0, "step": 160 }, { "entropy": 9.730674839019775, "epoch": 0.011051203911456415, "grad_norm": 0.90625, "learning_rate": 8.2e-05, "loss": 8.6657, "mean_token_accuracy": 0.06257540844380856, "num_tokens": 326076.0, "step": 165 }, { "entropy": 9.602271366119385, "epoch": 0.011386088878470245, "grad_norm": 0.90625, "learning_rate": 8.450000000000001e-05, "loss": 8.6223, "mean_token_accuracy": 0.05909014530479908, "num_tokens": 334645.0, "step": 170 }, { "entropy": 9.467283821105957, "epoch": 0.011720973845484076, "grad_norm": 0.87890625, "learning_rate": 8.7e-05, "loss": 8.6422, "mean_token_accuracy": 0.06433657817542553, "num_tokens": 343784.0, "step": 175 }, { "entropy": 9.435225105285644, "epoch": 0.012055858812497907, "grad_norm": 0.83203125, "learning_rate": 8.95e-05, "loss": 8.5783, "mean_token_accuracy": 0.05760964490473271, "num_tokens": 353230.0, "step": 180 }, { "entropy": 9.283469009399415, "epoch": 0.012390743779511737, "grad_norm": 0.90234375, "learning_rate": 9.2e-05, "loss": 8.5425, "mean_token_accuracy": 0.06422759890556336, "num_tokens": 362406.0, "step": 185 }, { "entropy": 9.118220233917237, "epoch": 0.012725628746525568, "grad_norm": 0.8046875, "learning_rate": 9.45e-05, "loss": 8.4932, "mean_token_accuracy": 0.06339454613626003, "num_tokens": 372418.0, "step": 190 }, { "entropy": 9.104973220825196, "epoch": 0.013060513713539399, "grad_norm": 0.8828125, "learning_rate": 9.7e-05, "loss": 8.484, "mean_token_accuracy": 0.06246692761778831, "num_tokens": 381089.0, "step": 195 }, { "entropy": 9.07259292602539, "epoch": 0.01339539868055323, "grad_norm": 0.7421875, "learning_rate": 9.95e-05, "loss": 8.5434, "mean_token_accuracy": 0.05604027174413204, "num_tokens": 391801.0, "step": 200 }, { "entropy": 9.01559944152832, "epoch": 0.01373028364756706, "grad_norm": 0.80859375, "learning_rate": 0.000102, "loss": 8.5002, "mean_token_accuracy": 0.06068759709596634, "num_tokens": 402234.0, "step": 205 }, { "entropy": 8.936877250671387, "epoch": 0.01406516861458089, "grad_norm": 0.8125, "learning_rate": 0.00010449999999999999, "loss": 8.479, "mean_token_accuracy": 0.06238379329442978, "num_tokens": 411665.0, "step": 210 }, { "entropy": 8.94469394683838, "epoch": 0.014400053581594721, "grad_norm": 0.76171875, "learning_rate": 0.000107, "loss": 8.4931, "mean_token_accuracy": 0.0650034338235855, "num_tokens": 421989.0, "step": 215 }, { "entropy": 8.900172710418701, "epoch": 0.014734938548608552, "grad_norm": 0.796875, "learning_rate": 0.0001095, "loss": 8.3895, "mean_token_accuracy": 0.06547467894852162, "num_tokens": 431258.0, "step": 220 }, { "entropy": 8.874738311767578, "epoch": 0.015069823515622383, "grad_norm": 0.7421875, "learning_rate": 0.000112, "loss": 8.4852, "mean_token_accuracy": 0.06038682572543621, "num_tokens": 441920.0, "step": 225 }, { "entropy": 8.890042400360107, "epoch": 0.015404708482636215, "grad_norm": 0.7890625, "learning_rate": 0.0001145, "loss": 8.3921, "mean_token_accuracy": 0.06986854746937751, "num_tokens": 451460.0, "step": 230 }, { "entropy": 8.85048770904541, "epoch": 0.015739593449650046, "grad_norm": 0.828125, "learning_rate": 0.00011700000000000001, "loss": 8.3998, "mean_token_accuracy": 0.06450125053524972, "num_tokens": 461612.0, "step": 235 }, { "entropy": 8.77711887359619, "epoch": 0.016074478416663877, "grad_norm": 0.85546875, "learning_rate": 0.00011949999999999999, "loss": 8.4376, "mean_token_accuracy": 0.06631115414202213, "num_tokens": 472706.0, "step": 240 }, { "entropy": 8.85504970550537, "epoch": 0.016409363383677707, "grad_norm": 0.9375, "learning_rate": 0.000122, "loss": 8.4614, "mean_token_accuracy": 0.061580969393253325, "num_tokens": 482709.0, "step": 245 }, { "entropy": 8.814317607879639, "epoch": 0.016744248350691538, "grad_norm": 0.90234375, "learning_rate": 0.0001245, "loss": 8.4475, "mean_token_accuracy": 0.06584244705736637, "num_tokens": 492566.0, "step": 250 }, { "entropy": 8.831695365905762, "epoch": 0.01707913331770537, "grad_norm": 0.88671875, "learning_rate": 0.000127, "loss": 8.4019, "mean_token_accuracy": 0.06290778964757919, "num_tokens": 502912.0, "step": 255 }, { "entropy": 8.831443119049073, "epoch": 0.0174140182847192, "grad_norm": 0.8515625, "learning_rate": 0.0001295, "loss": 8.4192, "mean_token_accuracy": 0.06170829311013222, "num_tokens": 513000.0, "step": 260 }, { "entropy": 8.78964204788208, "epoch": 0.01774890325173303, "grad_norm": 0.96875, "learning_rate": 0.000132, "loss": 8.3577, "mean_token_accuracy": 0.06793267726898193, "num_tokens": 523345.0, "step": 265 }, { "entropy": 8.735497283935548, "epoch": 0.01808378821874686, "grad_norm": 0.9609375, "learning_rate": 0.00013450000000000002, "loss": 8.3634, "mean_token_accuracy": 0.07245749980211258, "num_tokens": 532121.0, "step": 270 }, { "entropy": 8.812878513336182, "epoch": 0.01841867318576069, "grad_norm": 0.9296875, "learning_rate": 0.00013700000000000002, "loss": 8.4324, "mean_token_accuracy": 0.06445505432784557, "num_tokens": 541895.0, "step": 275 }, { "entropy": 8.757740497589111, "epoch": 0.018753558152774522, "grad_norm": 1.2890625, "learning_rate": 0.0001395, "loss": 8.3649, "mean_token_accuracy": 0.06517385765910148, "num_tokens": 552144.0, "step": 280 }, { "entropy": 8.80039710998535, "epoch": 0.019088443119788353, "grad_norm": 0.81640625, "learning_rate": 0.00014199999999999998, "loss": 8.3675, "mean_token_accuracy": 0.06585304848849774, "num_tokens": 562336.0, "step": 285 }, { "entropy": 8.644570541381835, "epoch": 0.019423328086802184, "grad_norm": 1.0546875, "learning_rate": 0.0001445, "loss": 8.3217, "mean_token_accuracy": 0.07459635213017464, "num_tokens": 572020.0, "step": 290 }, { "entropy": 8.7322265625, "epoch": 0.019758213053816014, "grad_norm": 0.96484375, "learning_rate": 0.000147, "loss": 8.3229, "mean_token_accuracy": 0.07014562897384166, "num_tokens": 581418.0, "step": 295 }, { "entropy": 8.696172523498536, "epoch": 0.020093098020829845, "grad_norm": 0.921875, "learning_rate": 0.0001495, "loss": 8.304, "mean_token_accuracy": 0.07059184238314628, "num_tokens": 590716.0, "step": 300 }, { "entropy": 8.63413028717041, "epoch": 0.020427982987843676, "grad_norm": 0.8515625, "learning_rate": 0.000152, "loss": 8.2026, "mean_token_accuracy": 0.07757920697331429, "num_tokens": 599337.0, "step": 305 }, { "entropy": 8.697781085968018, "epoch": 0.020762867954857506, "grad_norm": 1.0546875, "learning_rate": 0.00015450000000000001, "loss": 8.3118, "mean_token_accuracy": 0.06973933763802051, "num_tokens": 609600.0, "step": 310 }, { "entropy": 8.631188106536865, "epoch": 0.021097752921871337, "grad_norm": 1.1171875, "learning_rate": 0.000157, "loss": 8.2052, "mean_token_accuracy": 0.0789581760764122, "num_tokens": 619121.0, "step": 315 }, { "entropy": 8.685782337188721, "epoch": 0.021432637888885168, "grad_norm": 1.0234375, "learning_rate": 0.0001595, "loss": 8.2304, "mean_token_accuracy": 0.07488703206181527, "num_tokens": 628741.0, "step": 320 }, { "entropy": 8.586778736114502, "epoch": 0.021767522855899, "grad_norm": 0.9609375, "learning_rate": 0.000162, "loss": 8.3125, "mean_token_accuracy": 0.07511252909898758, "num_tokens": 637422.0, "step": 325 }, { "entropy": 8.691543483734131, "epoch": 0.02210240782291283, "grad_norm": 0.91796875, "learning_rate": 0.00016450000000000001, "loss": 8.3278, "mean_token_accuracy": 0.06828603111207485, "num_tokens": 646541.0, "step": 330 }, { "entropy": 8.629717159271241, "epoch": 0.02243729278992666, "grad_norm": 0.8203125, "learning_rate": 0.00016700000000000002, "loss": 8.2181, "mean_token_accuracy": 0.07183332405984402, "num_tokens": 656771.0, "step": 335 }, { "entropy": 8.613917541503906, "epoch": 0.02277217775694049, "grad_norm": 0.96484375, "learning_rate": 0.00016950000000000003, "loss": 8.2728, "mean_token_accuracy": 0.08168347477912903, "num_tokens": 666273.0, "step": 340 }, { "entropy": 8.618037605285645, "epoch": 0.02310706272395432, "grad_norm": 0.90234375, "learning_rate": 0.00017199999999999998, "loss": 8.2002, "mean_token_accuracy": 0.07752258330583572, "num_tokens": 676473.0, "step": 345 }, { "entropy": 8.643811130523682, "epoch": 0.023441947690968152, "grad_norm": 1.1015625, "learning_rate": 0.00017449999999999999, "loss": 8.273, "mean_token_accuracy": 0.07563822567462922, "num_tokens": 686180.0, "step": 350 }, { "entropy": 8.547807312011718, "epoch": 0.023776832657981983, "grad_norm": 1.0078125, "learning_rate": 0.000177, "loss": 8.2201, "mean_token_accuracy": 0.07755913883447647, "num_tokens": 695372.0, "step": 355 }, { "entropy": 8.731934547424316, "epoch": 0.024111717624995813, "grad_norm": 1.109375, "learning_rate": 0.0001795, "loss": 8.3056, "mean_token_accuracy": 0.07374768368899823, "num_tokens": 706182.0, "step": 360 }, { "entropy": 8.546996784210204, "epoch": 0.024446602592009644, "grad_norm": 0.9375, "learning_rate": 0.000182, "loss": 8.1937, "mean_token_accuracy": 0.08396602459251881, "num_tokens": 715601.0, "step": 365 }, { "entropy": 8.672658920288086, "epoch": 0.024781487559023475, "grad_norm": 0.953125, "learning_rate": 0.0001845, "loss": 8.281, "mean_token_accuracy": 0.07340774051845074, "num_tokens": 724919.0, "step": 370 }, { "entropy": 8.621439933776855, "epoch": 0.025116372526037305, "grad_norm": 1.015625, "learning_rate": 0.000187, "loss": 8.1873, "mean_token_accuracy": 0.08298620432615281, "num_tokens": 733214.0, "step": 375 }, { "entropy": 8.571719074249268, "epoch": 0.025451257493051136, "grad_norm": 1.0, "learning_rate": 0.0001895, "loss": 8.2474, "mean_token_accuracy": 0.07782503142952919, "num_tokens": 743230.0, "step": 380 }, { "entropy": 8.560567378997803, "epoch": 0.025786142460064967, "grad_norm": 0.94140625, "learning_rate": 0.000192, "loss": 8.1869, "mean_token_accuracy": 0.08309442102909088, "num_tokens": 753175.0, "step": 385 }, { "entropy": 8.578225898742676, "epoch": 0.026121027427078797, "grad_norm": 1.0390625, "learning_rate": 0.0001945, "loss": 8.1224, "mean_token_accuracy": 0.0769454549998045, "num_tokens": 763168.0, "step": 390 }, { "entropy": 8.538741397857667, "epoch": 0.026455912394092628, "grad_norm": 0.8046875, "learning_rate": 0.00019700000000000002, "loss": 8.2106, "mean_token_accuracy": 0.0778761513531208, "num_tokens": 773477.0, "step": 395 }, { "entropy": 8.53778133392334, "epoch": 0.02679079736110646, "grad_norm": 1.171875, "learning_rate": 0.00019950000000000002, "loss": 8.2055, "mean_token_accuracy": 0.07703198343515397, "num_tokens": 782351.0, "step": 400 }, { "entropy": 8.543316268920899, "epoch": 0.02712568232812029, "grad_norm": 0.98046875, "learning_rate": 0.000202, "loss": 8.1518, "mean_token_accuracy": 0.08180877156555652, "num_tokens": 792179.0, "step": 405 }, { "entropy": 8.528862571716308, "epoch": 0.02746056729513412, "grad_norm": 0.86328125, "learning_rate": 0.00020449999999999998, "loss": 8.1353, "mean_token_accuracy": 0.07953180633485317, "num_tokens": 802243.0, "step": 410 }, { "entropy": 8.574699401855469, "epoch": 0.02779545226214795, "grad_norm": 1.0625, "learning_rate": 0.000207, "loss": 8.1209, "mean_token_accuracy": 0.08045852780342103, "num_tokens": 812069.0, "step": 415 }, { "entropy": 8.437831401824951, "epoch": 0.02813033722916178, "grad_norm": 0.921875, "learning_rate": 0.0002095, "loss": 8.1081, "mean_token_accuracy": 0.08233479075133801, "num_tokens": 821608.0, "step": 420 }, { "entropy": 8.531076431274414, "epoch": 0.028465222196175612, "grad_norm": 0.91015625, "learning_rate": 0.000212, "loss": 8.2246, "mean_token_accuracy": 0.07980309575796127, "num_tokens": 831677.0, "step": 425 }, { "entropy": 8.510465621948242, "epoch": 0.028800107163189443, "grad_norm": 1.09375, "learning_rate": 0.0002145, "loss": 8.0808, "mean_token_accuracy": 0.08042851686477662, "num_tokens": 840087.0, "step": 430 }, { "entropy": 8.538240432739258, "epoch": 0.029134992130203274, "grad_norm": 1.0625, "learning_rate": 0.00021700000000000002, "loss": 8.0842, "mean_token_accuracy": 0.08349445015192032, "num_tokens": 850516.0, "step": 435 }, { "entropy": 8.433059692382812, "epoch": 0.029469877097217104, "grad_norm": 1.0078125, "learning_rate": 0.0002195, "loss": 8.1666, "mean_token_accuracy": 0.07715897038578987, "num_tokens": 860921.0, "step": 440 }, { "entropy": 8.488123321533203, "epoch": 0.029804762064230935, "grad_norm": 0.8984375, "learning_rate": 0.000222, "loss": 8.0755, "mean_token_accuracy": 0.07828016802668572, "num_tokens": 871450.0, "step": 445 }, { "entropy": 8.392322254180907, "epoch": 0.030139647031244766, "grad_norm": 1.0078125, "learning_rate": 0.0002245, "loss": 8.0472, "mean_token_accuracy": 0.08468902185559272, "num_tokens": 880241.0, "step": 450 }, { "entropy": 8.428736782073974, "epoch": 0.030474531998258596, "grad_norm": 0.93359375, "learning_rate": 0.00022700000000000002, "loss": 8.0976, "mean_token_accuracy": 0.08420571461319923, "num_tokens": 890156.0, "step": 455 }, { "entropy": 8.475104236602784, "epoch": 0.03080941696527243, "grad_norm": 1.3125, "learning_rate": 0.00022950000000000002, "loss": 8.1217, "mean_token_accuracy": 0.08020563796162605, "num_tokens": 899718.0, "step": 460 }, { "entropy": 8.438492584228516, "epoch": 0.03114430193228626, "grad_norm": 0.95703125, "learning_rate": 0.00023200000000000003, "loss": 8.0464, "mean_token_accuracy": 0.08637708500027656, "num_tokens": 908461.0, "step": 465 }, { "entropy": 8.375166416168213, "epoch": 0.03147918689930009, "grad_norm": 0.9921875, "learning_rate": 0.00023449999999999998, "loss": 7.9991, "mean_token_accuracy": 0.0926103100180626, "num_tokens": 917418.0, "step": 470 }, { "entropy": 8.406765747070313, "epoch": 0.03181407186631392, "grad_norm": 0.94921875, "learning_rate": 0.000237, "loss": 8.079, "mean_token_accuracy": 0.08318312540650367, "num_tokens": 927495.0, "step": 475 }, { "entropy": 8.399221515655517, "epoch": 0.03214895683332775, "grad_norm": 1.0234375, "learning_rate": 0.0002395, "loss": 8.0856, "mean_token_accuracy": 0.08131228312849999, "num_tokens": 937510.0, "step": 480 }, { "entropy": 8.47674627304077, "epoch": 0.032483841800341584, "grad_norm": 0.875, "learning_rate": 0.000242, "loss": 8.0468, "mean_token_accuracy": 0.08284490816295147, "num_tokens": 948171.0, "step": 485 }, { "entropy": 8.403480339050294, "epoch": 0.032818726767355415, "grad_norm": 1.046875, "learning_rate": 0.0002445, "loss": 8.0069, "mean_token_accuracy": 0.08470370024442672, "num_tokens": 956506.0, "step": 490 }, { "entropy": 8.396288394927979, "epoch": 0.033153611734369245, "grad_norm": 1.09375, "learning_rate": 0.000247, "loss": 8.0398, "mean_token_accuracy": 0.08274327740073203, "num_tokens": 966063.0, "step": 495 }, { "entropy": 8.39925765991211, "epoch": 0.033488496701383076, "grad_norm": 0.84375, "learning_rate": 0.0002495, "loss": 8.0258, "mean_token_accuracy": 0.08637790307402611, "num_tokens": 976793.0, "step": 500 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 226186232463360.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }