{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.06697699340276615, "eval_steps": 500, "global_step": 1000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.742561435699463, "epoch": 0.00033488496701383075, "grad_norm": 4.5, "learning_rate": 2e-06, "loss": 10.7498, "mean_token_accuracy": 0.0, "num_tokens": 9336.0, "step": 5 }, { "entropy": 10.742577743530273, "epoch": 0.0006697699340276615, "grad_norm": 4.3125, "learning_rate": 4.5e-06, "loss": 10.7384, "mean_token_accuracy": 0.0, "num_tokens": 18837.0, "step": 10 }, { "entropy": 10.742557716369628, "epoch": 0.0010046549010414923, "grad_norm": 4.125, "learning_rate": 7e-06, "loss": 10.7272, "mean_token_accuracy": 9.718172950670123e-05, "num_tokens": 28150.0, "step": 15 }, { "entropy": 10.742551231384278, "epoch": 0.001339539868055323, "grad_norm": 4.40625, "learning_rate": 9.5e-06, "loss": 10.6837, "mean_token_accuracy": 0.0009352716442663223, "num_tokens": 37469.0, "step": 20 }, { "entropy": 10.742449760437012, "epoch": 0.0016744248350691537, "grad_norm": 4.125, "learning_rate": 1.2e-05, "loss": 10.6409, "mean_token_accuracy": 0.008969881373923272, "num_tokens": 47955.0, "step": 25 }, { "entropy": 10.742036151885987, "epoch": 0.0020093098020829846, "grad_norm": 3.71875, "learning_rate": 1.4500000000000002e-05, "loss": 10.5406, "mean_token_accuracy": 0.03436212912201882, "num_tokens": 58421.0, "step": 30 }, { "entropy": 10.740588188171387, "epoch": 0.0023441947690968153, "grad_norm": 3.0, "learning_rate": 1.7000000000000003e-05, "loss": 10.4482, "mean_token_accuracy": 0.04009146671742201, "num_tokens": 69338.0, "step": 35 }, { "entropy": 10.735538864135743, "epoch": 0.002679079736110646, "grad_norm": 2.5625, "learning_rate": 1.95e-05, "loss": 10.3231, "mean_token_accuracy": 0.0391630582511425, "num_tokens": 78964.0, "step": 40 }, { "entropy": 10.725551223754882, "epoch": 0.0030139647031244767, "grad_norm": 2.046875, "learning_rate": 2.2e-05, "loss": 10.2374, "mean_token_accuracy": 0.046432715654373166, "num_tokens": 90312.0, "step": 45 }, { "entropy": 10.711534595489502, "epoch": 0.0033488496701383074, "grad_norm": 2.078125, "learning_rate": 2.4500000000000003e-05, "loss": 10.1706, "mean_token_accuracy": 0.040825183317065236, "num_tokens": 99706.0, "step": 50 }, { "entropy": 10.701226234436035, "epoch": 0.003683734637152138, "grad_norm": 1.90625, "learning_rate": 2.7e-05, "loss": 10.1097, "mean_token_accuracy": 0.04384128861129284, "num_tokens": 109737.0, "step": 55 }, { "entropy": 10.695288467407227, "epoch": 0.004018619604165969, "grad_norm": 1.65625, "learning_rate": 2.95e-05, "loss": 10.0916, "mean_token_accuracy": 0.04214213602244854, "num_tokens": 119471.0, "step": 60 }, { "entropy": 10.689713382720948, "epoch": 0.0043535045711798, "grad_norm": 1.609375, "learning_rate": 3.2e-05, "loss": 10.0375, "mean_token_accuracy": 0.041708166152238844, "num_tokens": 130844.0, "step": 65 }, { "entropy": 10.684234142303467, "epoch": 0.0046883895381936306, "grad_norm": 1.5703125, "learning_rate": 3.4500000000000005e-05, "loss": 9.9974, "mean_token_accuracy": 0.04208777397871018, "num_tokens": 141266.0, "step": 70 }, { "entropy": 10.676689434051514, "epoch": 0.005023274505207461, "grad_norm": 1.5859375, "learning_rate": 3.7e-05, "loss": 9.898, "mean_token_accuracy": 0.04250998180359602, "num_tokens": 152222.0, "step": 75 }, { "entropy": 10.664115810394287, "epoch": 0.005358159472221292, "grad_norm": 1.5625, "learning_rate": 3.95e-05, "loss": 9.8609, "mean_token_accuracy": 0.04332525990903378, "num_tokens": 162931.0, "step": 80 }, { "entropy": 10.650795078277588, "epoch": 0.005693044439235123, "grad_norm": 1.515625, "learning_rate": 4.2000000000000004e-05, "loss": 9.8387, "mean_token_accuracy": 0.044832929782569406, "num_tokens": 172587.0, "step": 85 }, { "entropy": 10.638714599609376, "epoch": 0.006027929406248953, "grad_norm": 1.4609375, "learning_rate": 4.45e-05, "loss": 9.768, "mean_token_accuracy": 0.04449521526694298, "num_tokens": 181877.0, "step": 90 }, { "entropy": 10.623728466033935, "epoch": 0.006362814373262784, "grad_norm": 1.4453125, "learning_rate": 4.7000000000000004e-05, "loss": 9.6987, "mean_token_accuracy": 0.047365859150886536, "num_tokens": 192196.0, "step": 95 }, { "entropy": 10.59886417388916, "epoch": 0.006697699340276615, "grad_norm": 1.4140625, "learning_rate": 4.9500000000000004e-05, "loss": 9.6205, "mean_token_accuracy": 0.04793250001966953, "num_tokens": 201009.0, "step": 100 }, { "entropy": 10.578139305114746, "epoch": 0.007032584307290445, "grad_norm": 1.390625, "learning_rate": 5.2e-05, "loss": 9.5589, "mean_token_accuracy": 0.05401066094636917, "num_tokens": 209066.0, "step": 105 }, { "entropy": 10.551801109313965, "epoch": 0.007367469274304276, "grad_norm": 1.4296875, "learning_rate": 5.45e-05, "loss": 9.4901, "mean_token_accuracy": 0.05924240723252296, "num_tokens": 218721.0, "step": 110 }, { "entropy": 10.502099704742431, "epoch": 0.007702354241318108, "grad_norm": 1.546875, "learning_rate": 5.7e-05, "loss": 9.4194, "mean_token_accuracy": 0.05640989877283573, "num_tokens": 228511.0, "step": 115 }, { "entropy": 10.450156116485596, "epoch": 0.008037239208331938, "grad_norm": 1.453125, "learning_rate": 5.9499999999999996e-05, "loss": 9.3421, "mean_token_accuracy": 0.060460330545902254, "num_tokens": 237097.0, "step": 120 }, { "entropy": 10.362788772583007, "epoch": 0.008372124175345769, "grad_norm": 1.328125, "learning_rate": 6.2e-05, "loss": 9.2305, "mean_token_accuracy": 0.06126848310232162, "num_tokens": 246013.0, "step": 125 }, { "entropy": 10.28974199295044, "epoch": 0.0087070091423596, "grad_norm": 1.1953125, "learning_rate": 6.450000000000001e-05, "loss": 9.2132, "mean_token_accuracy": 0.0567143976688385, "num_tokens": 255741.0, "step": 130 }, { "entropy": 10.277145481109619, "epoch": 0.00904189410937343, "grad_norm": 1.21875, "learning_rate": 6.7e-05, "loss": 9.0746, "mean_token_accuracy": 0.060845992714166644, "num_tokens": 265877.0, "step": 135 }, { "entropy": 10.188594436645507, "epoch": 0.009376779076387261, "grad_norm": 1.1328125, "learning_rate": 6.950000000000001e-05, "loss": 9.0594, "mean_token_accuracy": 0.05822984836995602, "num_tokens": 275631.0, "step": 140 }, { "entropy": 10.113962650299072, "epoch": 0.009711664043401092, "grad_norm": 1.1484375, "learning_rate": 7.2e-05, "loss": 8.9686, "mean_token_accuracy": 0.06056818813085556, "num_tokens": 286584.0, "step": 145 }, { "entropy": 10.048769855499268, "epoch": 0.010046549010414923, "grad_norm": 1.0234375, "learning_rate": 7.45e-05, "loss": 8.9176, "mean_token_accuracy": 0.05582499206066131, "num_tokens": 296903.0, "step": 150 }, { "entropy": 9.948976993560791, "epoch": 0.010381433977428753, "grad_norm": 1.1015625, "learning_rate": 7.7e-05, "loss": 8.8091, "mean_token_accuracy": 0.058087332919239995, "num_tokens": 306940.0, "step": 155 }, { "entropy": 9.834512996673585, "epoch": 0.010716318944442584, "grad_norm": 0.78125, "learning_rate": 7.950000000000001e-05, "loss": 8.821, "mean_token_accuracy": 0.05299450382590294, "num_tokens": 317344.0, "step": 160 }, { "entropy": 9.730674839019775, "epoch": 0.011051203911456415, "grad_norm": 0.90625, "learning_rate": 8.2e-05, "loss": 8.6657, "mean_token_accuracy": 0.06257540844380856, "num_tokens": 326076.0, "step": 165 }, { "entropy": 9.602271366119385, "epoch": 0.011386088878470245, "grad_norm": 0.90625, "learning_rate": 8.450000000000001e-05, "loss": 8.6223, "mean_token_accuracy": 0.05909014530479908, "num_tokens": 334645.0, "step": 170 }, { "entropy": 9.467283821105957, "epoch": 0.011720973845484076, "grad_norm": 0.87890625, "learning_rate": 8.7e-05, "loss": 8.6422, "mean_token_accuracy": 0.06433657817542553, "num_tokens": 343784.0, "step": 175 }, { "entropy": 9.435225105285644, "epoch": 0.012055858812497907, "grad_norm": 0.83203125, "learning_rate": 8.95e-05, "loss": 8.5783, "mean_token_accuracy": 0.05760964490473271, "num_tokens": 353230.0, "step": 180 }, { "entropy": 9.283469009399415, "epoch": 0.012390743779511737, "grad_norm": 0.90234375, "learning_rate": 9.2e-05, "loss": 8.5425, "mean_token_accuracy": 0.06422759890556336, "num_tokens": 362406.0, "step": 185 }, { "entropy": 9.118220233917237, "epoch": 0.012725628746525568, "grad_norm": 0.8046875, "learning_rate": 9.45e-05, "loss": 8.4932, "mean_token_accuracy": 0.06339454613626003, "num_tokens": 372418.0, "step": 190 }, { "entropy": 9.104973220825196, "epoch": 0.013060513713539399, "grad_norm": 0.8828125, "learning_rate": 9.7e-05, "loss": 8.484, "mean_token_accuracy": 0.06246692761778831, "num_tokens": 381089.0, "step": 195 }, { "entropy": 9.07259292602539, "epoch": 0.01339539868055323, "grad_norm": 0.7421875, "learning_rate": 9.95e-05, "loss": 8.5434, "mean_token_accuracy": 0.05604027174413204, "num_tokens": 391801.0, "step": 200 }, { "entropy": 9.01559944152832, "epoch": 0.01373028364756706, "grad_norm": 0.80859375, "learning_rate": 0.000102, "loss": 8.5002, "mean_token_accuracy": 0.06068759709596634, "num_tokens": 402234.0, "step": 205 }, { "entropy": 8.936877250671387, "epoch": 0.01406516861458089, "grad_norm": 0.8125, "learning_rate": 0.00010449999999999999, "loss": 8.479, "mean_token_accuracy": 0.06238379329442978, "num_tokens": 411665.0, "step": 210 }, { "entropy": 8.94469394683838, "epoch": 0.014400053581594721, "grad_norm": 0.76171875, "learning_rate": 0.000107, "loss": 8.4931, "mean_token_accuracy": 0.0650034338235855, "num_tokens": 421989.0, "step": 215 }, { "entropy": 8.900172710418701, "epoch": 0.014734938548608552, "grad_norm": 0.796875, "learning_rate": 0.0001095, "loss": 8.3895, "mean_token_accuracy": 0.06547467894852162, "num_tokens": 431258.0, "step": 220 }, { "entropy": 8.874738311767578, "epoch": 0.015069823515622383, "grad_norm": 0.7421875, "learning_rate": 0.000112, "loss": 8.4852, "mean_token_accuracy": 0.06038682572543621, "num_tokens": 441920.0, "step": 225 }, { "entropy": 8.890042400360107, "epoch": 0.015404708482636215, "grad_norm": 0.7890625, "learning_rate": 0.0001145, "loss": 8.3921, "mean_token_accuracy": 0.06986854746937751, "num_tokens": 451460.0, "step": 230 }, { "entropy": 8.85048770904541, "epoch": 0.015739593449650046, "grad_norm": 0.828125, "learning_rate": 0.00011700000000000001, "loss": 8.3998, "mean_token_accuracy": 0.06450125053524972, "num_tokens": 461612.0, "step": 235 }, { "entropy": 8.77711887359619, "epoch": 0.016074478416663877, "grad_norm": 0.85546875, "learning_rate": 0.00011949999999999999, "loss": 8.4376, "mean_token_accuracy": 0.06631115414202213, "num_tokens": 472706.0, "step": 240 }, { "entropy": 8.85504970550537, "epoch": 0.016409363383677707, "grad_norm": 0.9375, "learning_rate": 0.000122, "loss": 8.4614, "mean_token_accuracy": 0.061580969393253325, "num_tokens": 482709.0, "step": 245 }, { "entropy": 8.814317607879639, "epoch": 0.016744248350691538, "grad_norm": 0.90234375, "learning_rate": 0.0001245, "loss": 8.4475, "mean_token_accuracy": 0.06584244705736637, "num_tokens": 492566.0, "step": 250 }, { "entropy": 8.831695365905762, "epoch": 0.01707913331770537, "grad_norm": 0.88671875, "learning_rate": 0.000127, "loss": 8.4019, "mean_token_accuracy": 0.06290778964757919, "num_tokens": 502912.0, "step": 255 }, { "entropy": 8.831443119049073, "epoch": 0.0174140182847192, "grad_norm": 0.8515625, "learning_rate": 0.0001295, "loss": 8.4192, "mean_token_accuracy": 0.06170829311013222, "num_tokens": 513000.0, "step": 260 }, { "entropy": 8.78964204788208, "epoch": 0.01774890325173303, "grad_norm": 0.96875, "learning_rate": 0.000132, "loss": 8.3577, "mean_token_accuracy": 0.06793267726898193, "num_tokens": 523345.0, "step": 265 }, { "entropy": 8.735497283935548, "epoch": 0.01808378821874686, "grad_norm": 0.9609375, "learning_rate": 0.00013450000000000002, "loss": 8.3634, "mean_token_accuracy": 0.07245749980211258, "num_tokens": 532121.0, "step": 270 }, { "entropy": 8.812878513336182, "epoch": 0.01841867318576069, "grad_norm": 0.9296875, "learning_rate": 0.00013700000000000002, "loss": 8.4324, "mean_token_accuracy": 0.06445505432784557, "num_tokens": 541895.0, "step": 275 }, { "entropy": 8.757740497589111, "epoch": 0.018753558152774522, "grad_norm": 1.2890625, "learning_rate": 0.0001395, "loss": 8.3649, "mean_token_accuracy": 0.06517385765910148, "num_tokens": 552144.0, "step": 280 }, { "entropy": 8.80039710998535, "epoch": 0.019088443119788353, "grad_norm": 0.81640625, "learning_rate": 0.00014199999999999998, "loss": 8.3675, "mean_token_accuracy": 0.06585304848849774, "num_tokens": 562336.0, "step": 285 }, { "entropy": 8.644570541381835, "epoch": 0.019423328086802184, "grad_norm": 1.0546875, "learning_rate": 0.0001445, "loss": 8.3217, "mean_token_accuracy": 0.07459635213017464, "num_tokens": 572020.0, "step": 290 }, { "entropy": 8.7322265625, "epoch": 0.019758213053816014, "grad_norm": 0.96484375, "learning_rate": 0.000147, "loss": 8.3229, "mean_token_accuracy": 0.07014562897384166, "num_tokens": 581418.0, "step": 295 }, { "entropy": 8.696172523498536, "epoch": 0.020093098020829845, "grad_norm": 0.921875, "learning_rate": 0.0001495, "loss": 8.304, "mean_token_accuracy": 0.07059184238314628, "num_tokens": 590716.0, "step": 300 }, { "entropy": 8.63413028717041, "epoch": 0.020427982987843676, "grad_norm": 0.8515625, "learning_rate": 0.000152, "loss": 8.2026, "mean_token_accuracy": 0.07757920697331429, "num_tokens": 599337.0, "step": 305 }, { "entropy": 8.697781085968018, "epoch": 0.020762867954857506, "grad_norm": 1.0546875, "learning_rate": 0.00015450000000000001, "loss": 8.3118, "mean_token_accuracy": 0.06973933763802051, "num_tokens": 609600.0, "step": 310 }, { "entropy": 8.631188106536865, "epoch": 0.021097752921871337, "grad_norm": 1.1171875, "learning_rate": 0.000157, "loss": 8.2052, "mean_token_accuracy": 0.0789581760764122, "num_tokens": 619121.0, "step": 315 }, { "entropy": 8.685782337188721, "epoch": 0.021432637888885168, "grad_norm": 1.0234375, "learning_rate": 0.0001595, "loss": 8.2304, "mean_token_accuracy": 0.07488703206181527, "num_tokens": 628741.0, "step": 320 }, { "entropy": 8.586778736114502, "epoch": 0.021767522855899, "grad_norm": 0.9609375, "learning_rate": 0.000162, "loss": 8.3125, "mean_token_accuracy": 0.07511252909898758, "num_tokens": 637422.0, "step": 325 }, { "entropy": 8.691543483734131, "epoch": 0.02210240782291283, "grad_norm": 0.91796875, "learning_rate": 0.00016450000000000001, "loss": 8.3278, "mean_token_accuracy": 0.06828603111207485, "num_tokens": 646541.0, "step": 330 }, { "entropy": 8.629717159271241, "epoch": 0.02243729278992666, "grad_norm": 0.8203125, "learning_rate": 0.00016700000000000002, "loss": 8.2181, "mean_token_accuracy": 0.07183332405984402, "num_tokens": 656771.0, "step": 335 }, { "entropy": 8.613917541503906, "epoch": 0.02277217775694049, "grad_norm": 0.96484375, "learning_rate": 0.00016950000000000003, "loss": 8.2728, "mean_token_accuracy": 0.08168347477912903, "num_tokens": 666273.0, "step": 340 }, { "entropy": 8.618037605285645, "epoch": 0.02310706272395432, "grad_norm": 0.90234375, "learning_rate": 0.00017199999999999998, "loss": 8.2002, "mean_token_accuracy": 0.07752258330583572, "num_tokens": 676473.0, "step": 345 }, { "entropy": 8.643811130523682, "epoch": 0.023441947690968152, "grad_norm": 1.1015625, "learning_rate": 0.00017449999999999999, "loss": 8.273, "mean_token_accuracy": 0.07563822567462922, "num_tokens": 686180.0, "step": 350 }, { "entropy": 8.547807312011718, "epoch": 0.023776832657981983, "grad_norm": 1.0078125, "learning_rate": 0.000177, "loss": 8.2201, "mean_token_accuracy": 0.07755913883447647, "num_tokens": 695372.0, "step": 355 }, { "entropy": 8.731934547424316, "epoch": 0.024111717624995813, "grad_norm": 1.109375, "learning_rate": 0.0001795, "loss": 8.3056, "mean_token_accuracy": 0.07374768368899823, "num_tokens": 706182.0, "step": 360 }, { "entropy": 8.546996784210204, "epoch": 0.024446602592009644, "grad_norm": 0.9375, "learning_rate": 0.000182, "loss": 8.1937, "mean_token_accuracy": 0.08396602459251881, "num_tokens": 715601.0, "step": 365 }, { "entropy": 8.672658920288086, "epoch": 0.024781487559023475, "grad_norm": 0.953125, "learning_rate": 0.0001845, "loss": 8.281, "mean_token_accuracy": 0.07340774051845074, "num_tokens": 724919.0, "step": 370 }, { "entropy": 8.621439933776855, "epoch": 0.025116372526037305, "grad_norm": 1.015625, "learning_rate": 0.000187, "loss": 8.1873, "mean_token_accuracy": 0.08298620432615281, "num_tokens": 733214.0, "step": 375 }, { "entropy": 8.571719074249268, "epoch": 0.025451257493051136, "grad_norm": 1.0, "learning_rate": 0.0001895, "loss": 8.2474, "mean_token_accuracy": 0.07782503142952919, "num_tokens": 743230.0, "step": 380 }, { "entropy": 8.560567378997803, "epoch": 0.025786142460064967, "grad_norm": 0.94140625, "learning_rate": 0.000192, "loss": 8.1869, "mean_token_accuracy": 0.08309442102909088, "num_tokens": 753175.0, "step": 385 }, { "entropy": 8.578225898742676, "epoch": 0.026121027427078797, "grad_norm": 1.0390625, "learning_rate": 0.0001945, "loss": 8.1224, "mean_token_accuracy": 0.0769454549998045, "num_tokens": 763168.0, "step": 390 }, { "entropy": 8.538741397857667, "epoch": 0.026455912394092628, "grad_norm": 0.8046875, "learning_rate": 0.00019700000000000002, "loss": 8.2106, "mean_token_accuracy": 0.0778761513531208, "num_tokens": 773477.0, "step": 395 }, { "entropy": 8.53778133392334, "epoch": 0.02679079736110646, "grad_norm": 1.171875, "learning_rate": 0.00019950000000000002, "loss": 8.2055, "mean_token_accuracy": 0.07703198343515397, "num_tokens": 782351.0, "step": 400 }, { "entropy": 8.543316268920899, "epoch": 0.02712568232812029, "grad_norm": 0.98046875, "learning_rate": 0.000202, "loss": 8.1518, "mean_token_accuracy": 0.08180877156555652, "num_tokens": 792179.0, "step": 405 }, { "entropy": 8.528862571716308, "epoch": 0.02746056729513412, "grad_norm": 0.86328125, "learning_rate": 0.00020449999999999998, "loss": 8.1353, "mean_token_accuracy": 0.07953180633485317, "num_tokens": 802243.0, "step": 410 }, { "entropy": 8.574699401855469, "epoch": 0.02779545226214795, "grad_norm": 1.0625, "learning_rate": 0.000207, "loss": 8.1209, "mean_token_accuracy": 0.08045852780342103, "num_tokens": 812069.0, "step": 415 }, { "entropy": 8.437831401824951, "epoch": 0.02813033722916178, "grad_norm": 0.921875, "learning_rate": 0.0002095, "loss": 8.1081, "mean_token_accuracy": 0.08233479075133801, "num_tokens": 821608.0, "step": 420 }, { "entropy": 8.531076431274414, "epoch": 0.028465222196175612, "grad_norm": 0.91015625, "learning_rate": 0.000212, "loss": 8.2246, "mean_token_accuracy": 0.07980309575796127, "num_tokens": 831677.0, "step": 425 }, { "entropy": 8.510465621948242, "epoch": 0.028800107163189443, "grad_norm": 1.09375, "learning_rate": 0.0002145, "loss": 8.0808, "mean_token_accuracy": 0.08042851686477662, "num_tokens": 840087.0, "step": 430 }, { "entropy": 8.538240432739258, "epoch": 0.029134992130203274, "grad_norm": 1.0625, "learning_rate": 0.00021700000000000002, "loss": 8.0842, "mean_token_accuracy": 0.08349445015192032, "num_tokens": 850516.0, "step": 435 }, { "entropy": 8.433059692382812, "epoch": 0.029469877097217104, "grad_norm": 1.0078125, "learning_rate": 0.0002195, "loss": 8.1666, "mean_token_accuracy": 0.07715897038578987, "num_tokens": 860921.0, "step": 440 }, { "entropy": 8.488123321533203, "epoch": 0.029804762064230935, "grad_norm": 0.8984375, "learning_rate": 0.000222, "loss": 8.0755, "mean_token_accuracy": 0.07828016802668572, "num_tokens": 871450.0, "step": 445 }, { "entropy": 8.392322254180907, "epoch": 0.030139647031244766, "grad_norm": 1.0078125, "learning_rate": 0.0002245, "loss": 8.0472, "mean_token_accuracy": 0.08468902185559272, "num_tokens": 880241.0, "step": 450 }, { "entropy": 8.428736782073974, "epoch": 0.030474531998258596, "grad_norm": 0.93359375, "learning_rate": 0.00022700000000000002, "loss": 8.0976, "mean_token_accuracy": 0.08420571461319923, "num_tokens": 890156.0, "step": 455 }, { "entropy": 8.475104236602784, "epoch": 0.03080941696527243, "grad_norm": 1.3125, "learning_rate": 0.00022950000000000002, "loss": 8.1217, "mean_token_accuracy": 0.08020563796162605, "num_tokens": 899718.0, "step": 460 }, { "entropy": 8.438492584228516, "epoch": 0.03114430193228626, "grad_norm": 0.95703125, "learning_rate": 0.00023200000000000003, "loss": 8.0464, "mean_token_accuracy": 0.08637708500027656, "num_tokens": 908461.0, "step": 465 }, { "entropy": 8.375166416168213, "epoch": 0.03147918689930009, "grad_norm": 0.9921875, "learning_rate": 0.00023449999999999998, "loss": 7.9991, "mean_token_accuracy": 0.0926103100180626, "num_tokens": 917418.0, "step": 470 }, { "entropy": 8.406765747070313, "epoch": 0.03181407186631392, "grad_norm": 0.94921875, "learning_rate": 0.000237, "loss": 8.079, "mean_token_accuracy": 0.08318312540650367, "num_tokens": 927495.0, "step": 475 }, { "entropy": 8.399221515655517, "epoch": 0.03214895683332775, "grad_norm": 1.0234375, "learning_rate": 0.0002395, "loss": 8.0856, "mean_token_accuracy": 0.08131228312849999, "num_tokens": 937510.0, "step": 480 }, { "entropy": 8.47674627304077, "epoch": 0.032483841800341584, "grad_norm": 0.875, "learning_rate": 0.000242, "loss": 8.0468, "mean_token_accuracy": 0.08284490816295147, "num_tokens": 948171.0, "step": 485 }, { "entropy": 8.403480339050294, "epoch": 0.032818726767355415, "grad_norm": 1.046875, "learning_rate": 0.0002445, "loss": 8.0069, "mean_token_accuracy": 0.08470370024442672, "num_tokens": 956506.0, "step": 490 }, { "entropy": 8.396288394927979, "epoch": 0.033153611734369245, "grad_norm": 1.09375, "learning_rate": 0.000247, "loss": 8.0398, "mean_token_accuracy": 0.08274327740073203, "num_tokens": 966063.0, "step": 495 }, { "entropy": 8.39925765991211, "epoch": 0.033488496701383076, "grad_norm": 0.84375, "learning_rate": 0.0002495, "loss": 8.0258, "mean_token_accuracy": 0.08637790307402611, "num_tokens": 976793.0, "step": 500 }, { "entropy": 8.331637382507324, "epoch": 0.03382338166839691, "grad_norm": 0.96484375, "learning_rate": 0.000252, "loss": 8.0365, "mean_token_accuracy": 0.08065105900168419, "num_tokens": 986453.0, "step": 505 }, { "entropy": 8.44508924484253, "epoch": 0.03415826663541074, "grad_norm": 0.98828125, "learning_rate": 0.0002545, "loss": 8.0303, "mean_token_accuracy": 0.08101510927081108, "num_tokens": 996220.0, "step": 510 }, { "entropy": 8.363963508605957, "epoch": 0.03449315160242457, "grad_norm": 1.015625, "learning_rate": 0.000257, "loss": 7.9742, "mean_token_accuracy": 0.08482848778367043, "num_tokens": 1005602.0, "step": 515 }, { "entropy": 8.352523231506348, "epoch": 0.0348280365694384, "grad_norm": 0.87109375, "learning_rate": 0.0002595, "loss": 7.9811, "mean_token_accuracy": 0.08442948013544083, "num_tokens": 1015219.0, "step": 520 }, { "entropy": 8.40156135559082, "epoch": 0.03516292153645223, "grad_norm": 1.0078125, "learning_rate": 0.000262, "loss": 7.9737, "mean_token_accuracy": 0.0867108203470707, "num_tokens": 1023939.0, "step": 525 }, { "entropy": 8.279272842407227, "epoch": 0.03549780650346606, "grad_norm": 1.078125, "learning_rate": 0.00026450000000000003, "loss": 7.9333, "mean_token_accuracy": 0.0901190310716629, "num_tokens": 1033585.0, "step": 530 }, { "entropy": 8.41298599243164, "epoch": 0.03583269147047989, "grad_norm": 0.9296875, "learning_rate": 0.00026700000000000004, "loss": 8.0043, "mean_token_accuracy": 0.08536179438233375, "num_tokens": 1044766.0, "step": 535 }, { "entropy": 8.206547260284424, "epoch": 0.03616757643749372, "grad_norm": 0.87890625, "learning_rate": 0.00026950000000000005, "loss": 7.9332, "mean_token_accuracy": 0.09000402987003327, "num_tokens": 1054126.0, "step": 540 }, { "entropy": 8.345331573486328, "epoch": 0.03650246140450755, "grad_norm": 1.0, "learning_rate": 0.00027200000000000005, "loss": 7.9442, "mean_token_accuracy": 0.09181151911616325, "num_tokens": 1063650.0, "step": 545 }, { "entropy": 8.213069820404053, "epoch": 0.03683734637152138, "grad_norm": 0.96875, "learning_rate": 0.0002745, "loss": 7.8779, "mean_token_accuracy": 0.08874976187944413, "num_tokens": 1072543.0, "step": 550 }, { "entropy": 8.327767181396485, "epoch": 0.037172231338535214, "grad_norm": 0.94921875, "learning_rate": 0.000277, "loss": 7.8762, "mean_token_accuracy": 0.08635893240571021, "num_tokens": 1082444.0, "step": 555 }, { "entropy": 8.307810878753662, "epoch": 0.037507116305549044, "grad_norm": 1.1015625, "learning_rate": 0.0002795, "loss": 7.8906, "mean_token_accuracy": 0.0864050842821598, "num_tokens": 1092055.0, "step": 560 }, { "entropy": 8.254592514038086, "epoch": 0.037842001272562875, "grad_norm": 1.0859375, "learning_rate": 0.00028199999999999997, "loss": 7.9288, "mean_token_accuracy": 0.0862724743783474, "num_tokens": 1101890.0, "step": 565 }, { "entropy": 8.24144401550293, "epoch": 0.038176886239576706, "grad_norm": 1.0859375, "learning_rate": 0.0002845, "loss": 7.8582, "mean_token_accuracy": 0.09320853427052497, "num_tokens": 1110735.0, "step": 570 }, { "entropy": 8.267009735107422, "epoch": 0.03851177120659054, "grad_norm": 0.859375, "learning_rate": 0.000287, "loss": 7.9943, "mean_token_accuracy": 0.08730715587735176, "num_tokens": 1120557.0, "step": 575 }, { "entropy": 8.319797897338868, "epoch": 0.03884665617360437, "grad_norm": 1.0, "learning_rate": 0.0002895, "loss": 7.9042, "mean_token_accuracy": 0.08325572535395623, "num_tokens": 1130622.0, "step": 580 }, { "entropy": 8.201663589477539, "epoch": 0.0391815411406182, "grad_norm": 0.875, "learning_rate": 0.000292, "loss": 7.8789, "mean_token_accuracy": 0.08977498188614845, "num_tokens": 1141581.0, "step": 585 }, { "entropy": 8.268255710601807, "epoch": 0.03951642610763203, "grad_norm": 0.921875, "learning_rate": 0.0002945, "loss": 7.923, "mean_token_accuracy": 0.09211237207055092, "num_tokens": 1151617.0, "step": 590 }, { "entropy": 8.204073715209962, "epoch": 0.03985131107464586, "grad_norm": 1.09375, "learning_rate": 0.000297, "loss": 7.8934, "mean_token_accuracy": 0.09280748590826988, "num_tokens": 1162892.0, "step": 595 }, { "entropy": 8.284354782104492, "epoch": 0.04018619604165969, "grad_norm": 0.984375, "learning_rate": 0.0002995, "loss": 7.9914, "mean_token_accuracy": 0.08592328876256942, "num_tokens": 1173612.0, "step": 600 }, { "entropy": 8.187160301208497, "epoch": 0.04052108100867352, "grad_norm": 1.171875, "learning_rate": 0.000302, "loss": 7.8707, "mean_token_accuracy": 0.08741234391927719, "num_tokens": 1182808.0, "step": 605 }, { "entropy": 8.288273811340332, "epoch": 0.04085596597568735, "grad_norm": 0.98828125, "learning_rate": 0.0003045, "loss": 7.9246, "mean_token_accuracy": 0.09135790020227433, "num_tokens": 1192361.0, "step": 610 }, { "entropy": 8.222489738464356, "epoch": 0.04119085094270118, "grad_norm": 1.171875, "learning_rate": 0.000307, "loss": 7.9113, "mean_token_accuracy": 0.08726226650178433, "num_tokens": 1202631.0, "step": 615 }, { "entropy": 8.24560251235962, "epoch": 0.04152573590971501, "grad_norm": 1.0703125, "learning_rate": 0.0003095, "loss": 7.8665, "mean_token_accuracy": 0.08927992060780525, "num_tokens": 1211768.0, "step": 620 }, { "entropy": 8.212625122070312, "epoch": 0.04186062087672884, "grad_norm": 1.0078125, "learning_rate": 0.000312, "loss": 7.8706, "mean_token_accuracy": 0.09207477122545242, "num_tokens": 1221728.0, "step": 625 }, { "entropy": 8.09905309677124, "epoch": 0.042195505843742674, "grad_norm": 0.9453125, "learning_rate": 0.0003145, "loss": 7.8402, "mean_token_accuracy": 0.09309252053499222, "num_tokens": 1232231.0, "step": 630 }, { "entropy": 8.238802337646485, "epoch": 0.042530390810756505, "grad_norm": 1.1015625, "learning_rate": 0.000317, "loss": 7.8703, "mean_token_accuracy": 0.08867279961705207, "num_tokens": 1241226.0, "step": 635 }, { "entropy": 8.307090473175048, "epoch": 0.042865275777770336, "grad_norm": 1.0703125, "learning_rate": 0.0003195, "loss": 7.9115, "mean_token_accuracy": 0.08364064507186413, "num_tokens": 1250749.0, "step": 640 }, { "entropy": 8.128699350357056, "epoch": 0.043200160744784166, "grad_norm": 0.9296875, "learning_rate": 0.000322, "loss": 7.8504, "mean_token_accuracy": 0.08777497857809066, "num_tokens": 1261082.0, "step": 645 }, { "entropy": 8.1730393409729, "epoch": 0.043535045711798, "grad_norm": 1.15625, "learning_rate": 0.00032450000000000003, "loss": 7.8066, "mean_token_accuracy": 0.09291494712233543, "num_tokens": 1270351.0, "step": 650 }, { "entropy": 8.146085834503173, "epoch": 0.04386993067881183, "grad_norm": 0.96875, "learning_rate": 0.00032700000000000003, "loss": 7.7899, "mean_token_accuracy": 0.09739234745502472, "num_tokens": 1281811.0, "step": 655 }, { "entropy": 8.08869490623474, "epoch": 0.04420481564582566, "grad_norm": 0.9921875, "learning_rate": 0.00032950000000000004, "loss": 7.7993, "mean_token_accuracy": 0.08824670910835267, "num_tokens": 1292202.0, "step": 660 }, { "entropy": 8.057586479187012, "epoch": 0.04453970061283949, "grad_norm": 1.125, "learning_rate": 0.00033200000000000005, "loss": 7.807, "mean_token_accuracy": 0.09224808439612389, "num_tokens": 1301439.0, "step": 665 }, { "entropy": 8.100923252105712, "epoch": 0.04487458557985332, "grad_norm": 1.03125, "learning_rate": 0.00033450000000000005, "loss": 7.7846, "mean_token_accuracy": 0.09779466465115547, "num_tokens": 1311604.0, "step": 670 }, { "entropy": 8.290678691864013, "epoch": 0.04520947054686715, "grad_norm": 1.09375, "learning_rate": 0.000337, "loss": 7.8302, "mean_token_accuracy": 0.09104525521397591, "num_tokens": 1322518.0, "step": 675 }, { "entropy": 8.035249519348145, "epoch": 0.04554435551388098, "grad_norm": 0.91796875, "learning_rate": 0.0003395, "loss": 7.7964, "mean_token_accuracy": 0.09436259418725967, "num_tokens": 1333581.0, "step": 680 }, { "entropy": 8.07200093269348, "epoch": 0.04587924048089481, "grad_norm": 1.1328125, "learning_rate": 0.000342, "loss": 7.7399, "mean_token_accuracy": 0.09273072853684425, "num_tokens": 1344249.0, "step": 685 }, { "entropy": 8.145339584350586, "epoch": 0.04621412544790864, "grad_norm": 1.0859375, "learning_rate": 0.00034449999999999997, "loss": 7.7256, "mean_token_accuracy": 0.09456809088587761, "num_tokens": 1353761.0, "step": 690 }, { "entropy": 7.990784692764282, "epoch": 0.04654901041492247, "grad_norm": 1.1328125, "learning_rate": 0.000347, "loss": 7.785, "mean_token_accuracy": 0.08893016204237938, "num_tokens": 1362835.0, "step": 695 }, { "entropy": 8.228912353515625, "epoch": 0.046883895381936304, "grad_norm": 1.5390625, "learning_rate": 0.0003495, "loss": 7.8368, "mean_token_accuracy": 0.09362595304846763, "num_tokens": 1372847.0, "step": 700 }, { "entropy": 8.148432970046997, "epoch": 0.047218780348950135, "grad_norm": 1.15625, "learning_rate": 0.000352, "loss": 7.7399, "mean_token_accuracy": 0.10006837248802185, "num_tokens": 1381698.0, "step": 705 }, { "entropy": 7.946338415145874, "epoch": 0.047553665315963965, "grad_norm": 1.1015625, "learning_rate": 0.0003545, "loss": 7.762, "mean_token_accuracy": 0.09292992800474167, "num_tokens": 1391759.0, "step": 710 }, { "entropy": 8.14890651702881, "epoch": 0.047888550282977796, "grad_norm": 1.0390625, "learning_rate": 0.000357, "loss": 7.731, "mean_token_accuracy": 0.09815617725253105, "num_tokens": 1400586.0, "step": 715 }, { "entropy": 8.16442232131958, "epoch": 0.04822343524999163, "grad_norm": 0.98828125, "learning_rate": 0.0003595, "loss": 7.7465, "mean_token_accuracy": 0.09635337144136429, "num_tokens": 1410677.0, "step": 720 }, { "entropy": 7.930854368209839, "epoch": 0.04855832021700546, "grad_norm": 0.95703125, "learning_rate": 0.000362, "loss": 7.7272, "mean_token_accuracy": 0.0943112052977085, "num_tokens": 1419818.0, "step": 725 }, { "entropy": 8.03712043762207, "epoch": 0.04889320518401929, "grad_norm": 1.171875, "learning_rate": 0.0003645, "loss": 7.654, "mean_token_accuracy": 0.10538181439042091, "num_tokens": 1428681.0, "step": 730 }, { "entropy": 8.100661420822144, "epoch": 0.04922809015103312, "grad_norm": 0.984375, "learning_rate": 0.000367, "loss": 7.7416, "mean_token_accuracy": 0.09413149803876877, "num_tokens": 1438008.0, "step": 735 }, { "entropy": 8.020353555679321, "epoch": 0.04956297511804695, "grad_norm": 1.1015625, "learning_rate": 0.0003695, "loss": 7.7914, "mean_token_accuracy": 0.0905725158751011, "num_tokens": 1447091.0, "step": 740 }, { "entropy": 8.02063798904419, "epoch": 0.04989786008506078, "grad_norm": 0.91015625, "learning_rate": 0.000372, "loss": 7.698, "mean_token_accuracy": 0.09145140424370765, "num_tokens": 1458027.0, "step": 745 }, { "entropy": 8.062599182128906, "epoch": 0.05023274505207461, "grad_norm": 0.9375, "learning_rate": 0.0003745, "loss": 7.7247, "mean_token_accuracy": 0.09785099253058434, "num_tokens": 1468156.0, "step": 750 }, { "entropy": 8.08269281387329, "epoch": 0.05056763001908844, "grad_norm": 1.15625, "learning_rate": 0.000377, "loss": 7.7357, "mean_token_accuracy": 0.08801156133413315, "num_tokens": 1477830.0, "step": 755 }, { "entropy": 8.07049012184143, "epoch": 0.05090251498610227, "grad_norm": 1.1484375, "learning_rate": 0.0003795, "loss": 7.7971, "mean_token_accuracy": 0.08908197171986103, "num_tokens": 1486705.0, "step": 760 }, { "entropy": 8.055652761459351, "epoch": 0.0512373999531161, "grad_norm": 0.93359375, "learning_rate": 0.000382, "loss": 7.6818, "mean_token_accuracy": 0.09971900805830955, "num_tokens": 1496568.0, "step": 765 }, { "entropy": 8.030837202072144, "epoch": 0.051572284920129934, "grad_norm": 1.0078125, "learning_rate": 0.0003845, "loss": 7.7451, "mean_token_accuracy": 0.09271370768547058, "num_tokens": 1506425.0, "step": 770 }, { "entropy": 7.966542053222656, "epoch": 0.051907169887143764, "grad_norm": 0.94921875, "learning_rate": 0.00038700000000000003, "loss": 7.646, "mean_token_accuracy": 0.10024412348866463, "num_tokens": 1515568.0, "step": 775 }, { "entropy": 8.031002712249755, "epoch": 0.052242054854157595, "grad_norm": 1.1328125, "learning_rate": 0.00038950000000000003, "loss": 7.6379, "mean_token_accuracy": 0.10324002727866173, "num_tokens": 1523858.0, "step": 780 }, { "entropy": 7.983342504501342, "epoch": 0.052576939821171426, "grad_norm": 1.1484375, "learning_rate": 0.00039200000000000004, "loss": 7.6499, "mean_token_accuracy": 0.09914737194776535, "num_tokens": 1533509.0, "step": 785 }, { "entropy": 7.9228753566741945, "epoch": 0.052911824788185256, "grad_norm": 0.95703125, "learning_rate": 0.00039450000000000005, "loss": 7.7059, "mean_token_accuracy": 0.09512233585119248, "num_tokens": 1543192.0, "step": 790 }, { "entropy": 8.076800632476807, "epoch": 0.05324670975519909, "grad_norm": 0.9765625, "learning_rate": 0.00039700000000000005, "loss": 7.6917, "mean_token_accuracy": 0.09451689720153808, "num_tokens": 1553045.0, "step": 795 }, { "entropy": 7.996227884292603, "epoch": 0.05358159472221292, "grad_norm": 0.98046875, "learning_rate": 0.0003995, "loss": 7.648, "mean_token_accuracy": 0.09735450223088264, "num_tokens": 1562446.0, "step": 800 }, { "entropy": 7.856033229827881, "epoch": 0.05391647968922675, "grad_norm": 0.94921875, "learning_rate": 0.000402, "loss": 7.5841, "mean_token_accuracy": 0.10082900375127793, "num_tokens": 1571461.0, "step": 805 }, { "entropy": 7.977444648742676, "epoch": 0.05425136465624058, "grad_norm": 1.03125, "learning_rate": 0.0004045, "loss": 7.6284, "mean_token_accuracy": 0.10238974690437316, "num_tokens": 1582071.0, "step": 810 }, { "entropy": 8.023001098632813, "epoch": 0.05458624962325441, "grad_norm": 1.078125, "learning_rate": 0.00040699999999999997, "loss": 7.7136, "mean_token_accuracy": 0.0924065351486206, "num_tokens": 1591691.0, "step": 815 }, { "entropy": 7.991066980361938, "epoch": 0.05492113459026824, "grad_norm": 1.2578125, "learning_rate": 0.0004095, "loss": 7.6841, "mean_token_accuracy": 0.09669945389032364, "num_tokens": 1600244.0, "step": 820 }, { "entropy": 7.979223203659058, "epoch": 0.05525601955728207, "grad_norm": 1.015625, "learning_rate": 0.000412, "loss": 7.6563, "mean_token_accuracy": 0.09318544045090675, "num_tokens": 1609779.0, "step": 825 }, { "entropy": 7.925570821762085, "epoch": 0.0555909045242959, "grad_norm": 1.09375, "learning_rate": 0.0004145, "loss": 7.5836, "mean_token_accuracy": 0.10019738301634788, "num_tokens": 1619135.0, "step": 830 }, { "entropy": 7.887572002410889, "epoch": 0.05592578949130973, "grad_norm": 1.046875, "learning_rate": 0.000417, "loss": 7.6105, "mean_token_accuracy": 0.09635785594582558, "num_tokens": 1628381.0, "step": 835 }, { "entropy": 7.935930490493774, "epoch": 0.05626067445832356, "grad_norm": 1.046875, "learning_rate": 0.0004195, "loss": 7.6531, "mean_token_accuracy": 0.09439398795366287, "num_tokens": 1639386.0, "step": 840 }, { "entropy": 7.879091262817383, "epoch": 0.056595559425337394, "grad_norm": 1.171875, "learning_rate": 0.000422, "loss": 7.5529, "mean_token_accuracy": 0.10650224983692169, "num_tokens": 1647807.0, "step": 845 }, { "entropy": 7.901015996932983, "epoch": 0.056930444392351225, "grad_norm": 0.97265625, "learning_rate": 0.0004245, "loss": 7.584, "mean_token_accuracy": 0.09403106421232224, "num_tokens": 1657635.0, "step": 850 }, { "entropy": 7.964585685729981, "epoch": 0.057265329359365055, "grad_norm": 0.96875, "learning_rate": 0.000427, "loss": 7.6859, "mean_token_accuracy": 0.09096038043498993, "num_tokens": 1667823.0, "step": 855 }, { "entropy": 7.879450464248658, "epoch": 0.057600214326378886, "grad_norm": 1.1484375, "learning_rate": 0.0004295, "loss": 7.6386, "mean_token_accuracy": 0.09283353984355927, "num_tokens": 1676925.0, "step": 860 }, { "entropy": 7.94977560043335, "epoch": 0.05793509929339272, "grad_norm": 1.015625, "learning_rate": 0.000432, "loss": 7.6586, "mean_token_accuracy": 0.09341929107904434, "num_tokens": 1687397.0, "step": 865 }, { "entropy": 7.8930269241333, "epoch": 0.05826998426040655, "grad_norm": 1.0, "learning_rate": 0.0004345, "loss": 7.6242, "mean_token_accuracy": 0.09667704999446869, "num_tokens": 1697230.0, "step": 870 }, { "entropy": 7.992204046249389, "epoch": 0.05860486922742038, "grad_norm": 1.0078125, "learning_rate": 0.000437, "loss": 7.6393, "mean_token_accuracy": 0.09668843373656273, "num_tokens": 1706229.0, "step": 875 }, { "entropy": 7.849767351150513, "epoch": 0.05893975419443421, "grad_norm": 1.1171875, "learning_rate": 0.0004395, "loss": 7.5511, "mean_token_accuracy": 0.09463300779461861, "num_tokens": 1715305.0, "step": 880 }, { "entropy": 7.9153985500335695, "epoch": 0.05927463916144804, "grad_norm": 1.0625, "learning_rate": 0.000442, "loss": 7.6376, "mean_token_accuracy": 0.09340493753552437, "num_tokens": 1724892.0, "step": 885 }, { "entropy": 7.810058546066284, "epoch": 0.05960952412846187, "grad_norm": 1.0859375, "learning_rate": 0.0004445, "loss": 7.5227, "mean_token_accuracy": 0.10508455261588097, "num_tokens": 1733775.0, "step": 890 }, { "entropy": 7.914309883117676, "epoch": 0.0599444090954757, "grad_norm": 1.1953125, "learning_rate": 0.000447, "loss": 7.5395, "mean_token_accuracy": 0.10911466106772423, "num_tokens": 1742501.0, "step": 895 }, { "entropy": 7.772480010986328, "epoch": 0.06027929406248953, "grad_norm": 1.0625, "learning_rate": 0.00044950000000000003, "loss": 7.5789, "mean_token_accuracy": 0.09991946816444397, "num_tokens": 1752780.0, "step": 900 }, { "entropy": 7.951027917861938, "epoch": 0.06061417902950336, "grad_norm": 0.9140625, "learning_rate": 0.00045200000000000004, "loss": 7.6364, "mean_token_accuracy": 0.09094425886869431, "num_tokens": 1763457.0, "step": 905 }, { "entropy": 7.835178327560425, "epoch": 0.06094906399651719, "grad_norm": 1.0078125, "learning_rate": 0.00045450000000000004, "loss": 7.5989, "mean_token_accuracy": 0.0938416913151741, "num_tokens": 1773069.0, "step": 910 }, { "entropy": 7.887903165817261, "epoch": 0.06128394896353103, "grad_norm": 1.0859375, "learning_rate": 0.00045700000000000005, "loss": 7.5498, "mean_token_accuracy": 0.09773901179432869, "num_tokens": 1781994.0, "step": 915 }, { "entropy": 7.855052757263183, "epoch": 0.06161883393054486, "grad_norm": 0.95703125, "learning_rate": 0.00045950000000000006, "loss": 7.5503, "mean_token_accuracy": 0.09462841302156448, "num_tokens": 1791591.0, "step": 920 }, { "entropy": 7.815085697174072, "epoch": 0.06195371889755869, "grad_norm": 0.9609375, "learning_rate": 0.000462, "loss": 7.5154, "mean_token_accuracy": 0.10258796066045761, "num_tokens": 1801317.0, "step": 925 }, { "entropy": 7.781359052658081, "epoch": 0.06228860386457252, "grad_norm": 0.984375, "learning_rate": 0.0004645, "loss": 7.513, "mean_token_accuracy": 0.10400681644678116, "num_tokens": 1811325.0, "step": 930 }, { "entropy": 7.810634708404541, "epoch": 0.06262348883158635, "grad_norm": 1.1796875, "learning_rate": 0.000467, "loss": 7.5364, "mean_token_accuracy": 0.09745331034064293, "num_tokens": 1820504.0, "step": 935 }, { "entropy": 7.7501506328582765, "epoch": 0.06295837379860018, "grad_norm": 0.9375, "learning_rate": 0.0004695, "loss": 7.4991, "mean_token_accuracy": 0.10291953086853027, "num_tokens": 1830823.0, "step": 940 }, { "entropy": 7.8284999370574955, "epoch": 0.06329325876561401, "grad_norm": 0.98828125, "learning_rate": 0.000472, "loss": 7.4896, "mean_token_accuracy": 0.09139353856444359, "num_tokens": 1840379.0, "step": 945 }, { "entropy": 7.695800733566284, "epoch": 0.06362814373262785, "grad_norm": 1.21875, "learning_rate": 0.0004745, "loss": 7.4678, "mean_token_accuracy": 0.10147519782185555, "num_tokens": 1850699.0, "step": 950 }, { "entropy": 7.767111921310425, "epoch": 0.06396302869964167, "grad_norm": 0.953125, "learning_rate": 0.000477, "loss": 7.5196, "mean_token_accuracy": 0.09947453439235687, "num_tokens": 1861251.0, "step": 955 }, { "entropy": 7.708375740051269, "epoch": 0.0642979136666555, "grad_norm": 1.078125, "learning_rate": 0.0004795, "loss": 7.3227, "mean_token_accuracy": 0.10750749334692955, "num_tokens": 1870868.0, "step": 960 }, { "entropy": 7.748810529708862, "epoch": 0.06463279863366933, "grad_norm": 1.0234375, "learning_rate": 0.000482, "loss": 7.5017, "mean_token_accuracy": 0.09858887121081353, "num_tokens": 1882353.0, "step": 965 }, { "entropy": 7.75818099975586, "epoch": 0.06496768360068317, "grad_norm": 0.96484375, "learning_rate": 0.0004845, "loss": 7.4573, "mean_token_accuracy": 0.10296346917748452, "num_tokens": 1892823.0, "step": 970 }, { "entropy": 7.661552047729492, "epoch": 0.06530256856769699, "grad_norm": 1.0078125, "learning_rate": 0.000487, "loss": 7.5001, "mean_token_accuracy": 0.09801281914114952, "num_tokens": 1903301.0, "step": 975 }, { "entropy": 7.781193447113037, "epoch": 0.06563745353471083, "grad_norm": 1.0234375, "learning_rate": 0.0004895, "loss": 7.4987, "mean_token_accuracy": 0.09569328427314758, "num_tokens": 1914291.0, "step": 980 }, { "entropy": 7.752705764770508, "epoch": 0.06597233850172465, "grad_norm": 0.94921875, "learning_rate": 0.000492, "loss": 7.4646, "mean_token_accuracy": 0.09803513586521148, "num_tokens": 1923717.0, "step": 985 }, { "entropy": 7.723828744888306, "epoch": 0.06630722346873849, "grad_norm": 1.1484375, "learning_rate": 0.0004945, "loss": 7.5419, "mean_token_accuracy": 0.09752252623438835, "num_tokens": 1932816.0, "step": 990 }, { "entropy": 7.702096891403198, "epoch": 0.06664210843575231, "grad_norm": 1.046875, "learning_rate": 0.000497, "loss": 7.4429, "mean_token_accuracy": 0.10366016700863838, "num_tokens": 1942181.0, "step": 995 }, { "entropy": 7.773722410202026, "epoch": 0.06697699340276615, "grad_norm": 1.0546875, "learning_rate": 0.0004995, "loss": 7.4597, "mean_token_accuracy": 0.101081582903862, "num_tokens": 1951086.0, "step": 1000 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 454804587970560.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }