{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.4972650422675286, "eval_steps": 500, "global_step": 500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 4.810139894485474, "epoch": 0.004972650422675286, "grad_norm": 21.625, "learning_rate": 2e-06, "loss": 14.2169, "mean_token_accuracy": 0.0, "num_tokens": 9089.0, "step": 5 }, { "entropy": 4.796057510375976, "epoch": 0.009945300845350571, "grad_norm": 22.0, "learning_rate": 4.5e-06, "loss": 14.3796, "mean_token_accuracy": 0.0001728883828036487, "num_tokens": 21650.0, "step": 10 }, { "entropy": 4.851445960998535, "epoch": 0.014917951268025857, "grad_norm": 24.75, "learning_rate": 7e-06, "loss": 14.047, "mean_token_accuracy": 0.0, "num_tokens": 31067.0, "step": 15 }, { "entropy": 4.946325588226318, "epoch": 0.019890601690701143, "grad_norm": 32.0, "learning_rate": 9.5e-06, "loss": 13.8176, "mean_token_accuracy": 0.0005868025938980282, "num_tokens": 40816.0, "step": 20 }, { "entropy": 5.410843563079834, "epoch": 0.02486325211337643, "grad_norm": 40.25, "learning_rate": 1.2e-05, "loss": 13.0547, "mean_token_accuracy": 0.0003202892781700939, "num_tokens": 51065.0, "step": 25 }, { "entropy": 7.1249548435211185, "epoch": 0.029835902536051714, "grad_norm": 30.125, "learning_rate": 1.4500000000000002e-05, "loss": 11.8315, "mean_token_accuracy": 0.0, "num_tokens": 60539.0, "step": 30 }, { "entropy": 10.19781551361084, "epoch": 0.034808552958727, "grad_norm": 3.3125, "learning_rate": 1.7000000000000003e-05, "loss": 10.8532, "mean_token_accuracy": 0.0021006516821216793, "num_tokens": 71010.0, "step": 35 }, { "entropy": 10.736362266540528, "epoch": 0.039781203381402286, "grad_norm": 3.125, "learning_rate": 1.95e-05, "loss": 10.6601, "mean_token_accuracy": 0.012861686293035746, "num_tokens": 81394.0, "step": 40 }, { "entropy": 10.72396240234375, "epoch": 0.04475385380407757, "grad_norm": 2.875, "learning_rate": 2.2e-05, "loss": 10.5728, "mean_token_accuracy": 0.015258754882961512, "num_tokens": 92491.0, "step": 45 }, { "entropy": 10.611907863616944, "epoch": 0.04972650422675286, "grad_norm": 2.546875, "learning_rate": 2.4500000000000003e-05, "loss": 10.3994, "mean_token_accuracy": 0.01761980978772044, "num_tokens": 102113.0, "step": 50 }, { "entropy": 10.650904369354247, "epoch": 0.05469915464942814, "grad_norm": 2.578125, "learning_rate": 2.7e-05, "loss": 10.3041, "mean_token_accuracy": 0.01719568707048893, "num_tokens": 112211.0, "step": 55 }, { "entropy": 10.714541339874268, "epoch": 0.05967180507210343, "grad_norm": 1.7421875, "learning_rate": 2.95e-05, "loss": 10.1449, "mean_token_accuracy": 0.02930256463587284, "num_tokens": 122166.0, "step": 60 }, { "entropy": 10.710609722137452, "epoch": 0.06464445549477872, "grad_norm": 1.625, "learning_rate": 3.2e-05, "loss": 10.0419, "mean_token_accuracy": 0.04249542821198702, "num_tokens": 131016.0, "step": 65 }, { "entropy": 10.672384357452392, "epoch": 0.069617105917454, "grad_norm": 1.75, "learning_rate": 3.4500000000000005e-05, "loss": 9.9842, "mean_token_accuracy": 0.03610398881137371, "num_tokens": 141369.0, "step": 70 }, { "entropy": 10.683287620544434, "epoch": 0.07458975634012929, "grad_norm": 1.5703125, "learning_rate": 3.7e-05, "loss": 9.9433, "mean_token_accuracy": 0.051322261616587636, "num_tokens": 150939.0, "step": 75 }, { "entropy": 10.683112144470215, "epoch": 0.07956240676280457, "grad_norm": 1.5546875, "learning_rate": 3.95e-05, "loss": 9.9042, "mean_token_accuracy": 0.050704098865389825, "num_tokens": 159981.0, "step": 80 }, { "entropy": 10.666728496551514, "epoch": 0.08453505718547986, "grad_norm": 1.546875, "learning_rate": 4.2000000000000004e-05, "loss": 9.8301, "mean_token_accuracy": 0.0480174720287323, "num_tokens": 170139.0, "step": 85 }, { "entropy": 10.6644793510437, "epoch": 0.08950770760815514, "grad_norm": 1.7265625, "learning_rate": 4.45e-05, "loss": 9.767, "mean_token_accuracy": 0.05141008589416742, "num_tokens": 180746.0, "step": 90 }, { "entropy": 10.65702543258667, "epoch": 0.09448035803083044, "grad_norm": 1.625, "learning_rate": 4.7000000000000004e-05, "loss": 9.6469, "mean_token_accuracy": 0.057331408560276034, "num_tokens": 190250.0, "step": 95 }, { "entropy": 10.622721958160401, "epoch": 0.09945300845350571, "grad_norm": 1.40625, "learning_rate": 4.9500000000000004e-05, "loss": 9.6532, "mean_token_accuracy": 0.04415315557271242, "num_tokens": 201185.0, "step": 100 }, { "entropy": 10.592253017425538, "epoch": 0.10442565887618101, "grad_norm": 1.5234375, "learning_rate": 5.2e-05, "loss": 9.5616, "mean_token_accuracy": 0.05255695134401321, "num_tokens": 211476.0, "step": 105 }, { "entropy": 10.56272497177124, "epoch": 0.10939830929885629, "grad_norm": 1.296875, "learning_rate": 5.45e-05, "loss": 9.4667, "mean_token_accuracy": 0.05462103560566902, "num_tokens": 220965.0, "step": 110 }, { "entropy": 10.503788185119628, "epoch": 0.11437095972153158, "grad_norm": 1.4921875, "learning_rate": 5.7e-05, "loss": 9.4022, "mean_token_accuracy": 0.04950843863189221, "num_tokens": 231539.0, "step": 115 }, { "entropy": 10.478209018707275, "epoch": 0.11934361014420686, "grad_norm": 1.2734375, "learning_rate": 5.9499999999999996e-05, "loss": 9.3051, "mean_token_accuracy": 0.05306029766798019, "num_tokens": 241206.0, "step": 120 }, { "entropy": 10.38660650253296, "epoch": 0.12431626056688215, "grad_norm": 1.34375, "learning_rate": 6.2e-05, "loss": 9.2202, "mean_token_accuracy": 0.05398030839860439, "num_tokens": 250629.0, "step": 125 }, { "entropy": 10.396561527252198, "epoch": 0.12928891098955744, "grad_norm": 1.1875, "learning_rate": 6.450000000000001e-05, "loss": 9.1838, "mean_token_accuracy": 0.0500319853425026, "num_tokens": 260705.0, "step": 130 }, { "entropy": 10.283761501312256, "epoch": 0.13426156141223272, "grad_norm": 1.1328125, "learning_rate": 6.7e-05, "loss": 9.1281, "mean_token_accuracy": 0.0536313846707344, "num_tokens": 270499.0, "step": 135 }, { "entropy": 10.26081371307373, "epoch": 0.139234211834908, "grad_norm": 1.1484375, "learning_rate": 6.950000000000001e-05, "loss": 9.0683, "mean_token_accuracy": 0.05152654591947794, "num_tokens": 279998.0, "step": 140 }, { "entropy": 10.157192802429199, "epoch": 0.14420686225758328, "grad_norm": 1.203125, "learning_rate": 7.2e-05, "loss": 8.9399, "mean_token_accuracy": 0.05353470556437969, "num_tokens": 290322.0, "step": 145 }, { "entropy": 10.07140588760376, "epoch": 0.14917951268025859, "grad_norm": 1.3046875, "learning_rate": 7.45e-05, "loss": 8.858, "mean_token_accuracy": 0.059231129661202434, "num_tokens": 299893.0, "step": 150 }, { "entropy": 9.94995050430298, "epoch": 0.15415216310293386, "grad_norm": 1.109375, "learning_rate": 7.7e-05, "loss": 8.7989, "mean_token_accuracy": 0.05670776516199112, "num_tokens": 309191.0, "step": 155 }, { "entropy": 9.815523719787597, "epoch": 0.15912481352560914, "grad_norm": 0.91015625, "learning_rate": 7.950000000000001e-05, "loss": 8.7036, "mean_token_accuracy": 0.057601967453956605, "num_tokens": 318494.0, "step": 160 }, { "entropy": 9.753715515136719, "epoch": 0.16409746394828442, "grad_norm": 0.83984375, "learning_rate": 8.2e-05, "loss": 8.6798, "mean_token_accuracy": 0.05443971864879131, "num_tokens": 328299.0, "step": 165 }, { "entropy": 9.610096073150634, "epoch": 0.16907011437095973, "grad_norm": 0.7578125, "learning_rate": 8.450000000000001e-05, "loss": 8.6986, "mean_token_accuracy": 0.05396176092326641, "num_tokens": 338878.0, "step": 170 }, { "entropy": 9.495657157897949, "epoch": 0.174042764793635, "grad_norm": 0.9765625, "learning_rate": 8.7e-05, "loss": 8.5977, "mean_token_accuracy": 0.05288307964801788, "num_tokens": 348508.0, "step": 175 }, { "entropy": 9.364479351043702, "epoch": 0.1790154152163103, "grad_norm": 0.75, "learning_rate": 8.95e-05, "loss": 8.5384, "mean_token_accuracy": 0.060325421020388605, "num_tokens": 358233.0, "step": 180 }, { "entropy": 9.208246898651122, "epoch": 0.1839880656389856, "grad_norm": 0.9921875, "learning_rate": 9.2e-05, "loss": 8.4774, "mean_token_accuracy": 0.05886298380792141, "num_tokens": 367297.0, "step": 185 }, { "entropy": 9.103068447113037, "epoch": 0.18896071606166087, "grad_norm": 0.671875, "learning_rate": 9.45e-05, "loss": 8.471, "mean_token_accuracy": 0.052080392837524414, "num_tokens": 376880.0, "step": 190 }, { "entropy": 9.05744981765747, "epoch": 0.19393336648433615, "grad_norm": 0.8359375, "learning_rate": 9.7e-05, "loss": 8.4617, "mean_token_accuracy": 0.05685535296797752, "num_tokens": 386806.0, "step": 195 }, { "entropy": 8.958063793182372, "epoch": 0.19890601690701143, "grad_norm": 0.8984375, "learning_rate": 9.95e-05, "loss": 8.4048, "mean_token_accuracy": 0.059261714294552806, "num_tokens": 396161.0, "step": 200 }, { "entropy": 8.898060321807861, "epoch": 0.20387866732968674, "grad_norm": 0.8046875, "learning_rate": 0.000102, "loss": 8.4628, "mean_token_accuracy": 0.057381686940789225, "num_tokens": 405643.0, "step": 205 }, { "entropy": 8.85878095626831, "epoch": 0.20885131775236201, "grad_norm": 0.87109375, "learning_rate": 0.00010449999999999999, "loss": 8.4071, "mean_token_accuracy": 0.0663915179669857, "num_tokens": 414367.0, "step": 210 }, { "entropy": 8.785406398773194, "epoch": 0.2138239681750373, "grad_norm": 0.734375, "learning_rate": 0.000107, "loss": 8.4544, "mean_token_accuracy": 0.05882962830364704, "num_tokens": 424430.0, "step": 215 }, { "entropy": 8.815994358062744, "epoch": 0.21879661859771257, "grad_norm": 0.83203125, "learning_rate": 0.0001095, "loss": 8.4285, "mean_token_accuracy": 0.06256655529141426, "num_tokens": 435176.0, "step": 220 }, { "entropy": 8.771424484252929, "epoch": 0.22376926902038788, "grad_norm": 0.734375, "learning_rate": 0.000112, "loss": 8.4408, "mean_token_accuracy": 0.060541344434022905, "num_tokens": 445611.0, "step": 225 }, { "entropy": 8.745358943939209, "epoch": 0.22874191944306316, "grad_norm": 0.90625, "learning_rate": 0.0001145, "loss": 8.3751, "mean_token_accuracy": 0.0634678304195404, "num_tokens": 455143.0, "step": 230 }, { "entropy": 8.766716575622558, "epoch": 0.23371456986573844, "grad_norm": 1.28125, "learning_rate": 0.00011700000000000001, "loss": 8.4738, "mean_token_accuracy": 0.06072634160518646, "num_tokens": 465507.0, "step": 235 }, { "entropy": 8.770550727844238, "epoch": 0.23868722028841372, "grad_norm": 0.796875, "learning_rate": 0.00011949999999999999, "loss": 8.4583, "mean_token_accuracy": 0.06104334816336632, "num_tokens": 476152.0, "step": 240 }, { "entropy": 8.77504940032959, "epoch": 0.24365987071108902, "grad_norm": 0.7890625, "learning_rate": 0.000122, "loss": 8.3132, "mean_token_accuracy": 0.06499341167509556, "num_tokens": 486341.0, "step": 245 }, { "entropy": 8.655905055999757, "epoch": 0.2486325211337643, "grad_norm": 0.7421875, "learning_rate": 0.0001245, "loss": 8.2634, "mean_token_accuracy": 0.06762947700917721, "num_tokens": 495915.0, "step": 250 }, { "entropy": 8.659723567962647, "epoch": 0.2536051715564396, "grad_norm": 0.7421875, "learning_rate": 0.000127, "loss": 8.3514, "mean_token_accuracy": 0.06988421343266964, "num_tokens": 505666.0, "step": 255 }, { "entropy": 8.692667961120605, "epoch": 0.2585778219791149, "grad_norm": 0.9296875, "learning_rate": 0.0001295, "loss": 8.3023, "mean_token_accuracy": 0.0659954596310854, "num_tokens": 515411.0, "step": 260 }, { "entropy": 8.63499994277954, "epoch": 0.26355047240179014, "grad_norm": 0.78125, "learning_rate": 0.000132, "loss": 8.3494, "mean_token_accuracy": 0.06087326742708683, "num_tokens": 525018.0, "step": 265 }, { "entropy": 8.6294114112854, "epoch": 0.26852312282446544, "grad_norm": 1.0546875, "learning_rate": 0.00013450000000000002, "loss": 8.3103, "mean_token_accuracy": 0.06277070567011833, "num_tokens": 535056.0, "step": 270 }, { "entropy": 8.69818925857544, "epoch": 0.27349577324714075, "grad_norm": 0.81640625, "learning_rate": 0.00013700000000000002, "loss": 8.309, "mean_token_accuracy": 0.06765819452703, "num_tokens": 545115.0, "step": 275 }, { "entropy": 8.642760372161865, "epoch": 0.278468423669816, "grad_norm": 0.94140625, "learning_rate": 0.0001395, "loss": 8.3213, "mean_token_accuracy": 0.06374539136886596, "num_tokens": 554429.0, "step": 280 }, { "entropy": 8.534232425689698, "epoch": 0.2834410740924913, "grad_norm": 0.6640625, "learning_rate": 0.00014199999999999998, "loss": 8.2617, "mean_token_accuracy": 0.0756473757326603, "num_tokens": 563357.0, "step": 285 }, { "entropy": 8.696459770202637, "epoch": 0.28841372451516656, "grad_norm": 0.7421875, "learning_rate": 0.0001445, "loss": 8.3499, "mean_token_accuracy": 0.0666810642927885, "num_tokens": 574480.0, "step": 290 }, { "entropy": 8.571897983551025, "epoch": 0.29338637493784187, "grad_norm": 0.90234375, "learning_rate": 0.000147, "loss": 8.2731, "mean_token_accuracy": 0.06942101046442986, "num_tokens": 583722.0, "step": 295 }, { "entropy": 8.63041067123413, "epoch": 0.29835902536051717, "grad_norm": 0.66015625, "learning_rate": 0.0001495, "loss": 8.2406, "mean_token_accuracy": 0.06790350154042243, "num_tokens": 593644.0, "step": 300 }, { "entropy": 8.592833423614502, "epoch": 0.3033316757831924, "grad_norm": 0.97265625, "learning_rate": 0.000152, "loss": 8.2753, "mean_token_accuracy": 0.06820234544575214, "num_tokens": 603547.0, "step": 305 }, { "entropy": 8.531950759887696, "epoch": 0.30830432620586773, "grad_norm": 0.87890625, "learning_rate": 0.00015450000000000001, "loss": 8.3059, "mean_token_accuracy": 0.06576361991465092, "num_tokens": 613880.0, "step": 310 }, { "entropy": 8.58628578186035, "epoch": 0.31327697662854304, "grad_norm": 1.2734375, "learning_rate": 0.000157, "loss": 8.288, "mean_token_accuracy": 0.06338743269443511, "num_tokens": 624213.0, "step": 315 }, { "entropy": 8.631004810333252, "epoch": 0.3182496270512183, "grad_norm": 0.9296875, "learning_rate": 0.0001595, "loss": 8.3069, "mean_token_accuracy": 0.06901536360383034, "num_tokens": 634350.0, "step": 320 }, { "entropy": 8.613157272338867, "epoch": 0.3232222774738936, "grad_norm": 0.953125, "learning_rate": 0.000162, "loss": 8.3072, "mean_token_accuracy": 0.06461950577795506, "num_tokens": 644040.0, "step": 325 }, { "entropy": 8.611722564697265, "epoch": 0.32819492789656884, "grad_norm": 0.890625, "learning_rate": 0.00016450000000000001, "loss": 8.2689, "mean_token_accuracy": 0.070689857006073, "num_tokens": 652915.0, "step": 330 }, { "entropy": 8.554406261444091, "epoch": 0.33316757831924415, "grad_norm": 0.875, "learning_rate": 0.00016700000000000002, "loss": 8.2508, "mean_token_accuracy": 0.06666112951934337, "num_tokens": 662665.0, "step": 335 }, { "entropy": 8.609964942932129, "epoch": 0.33814022874191946, "grad_norm": 1.0859375, "learning_rate": 0.00016950000000000003, "loss": 8.2467, "mean_token_accuracy": 0.07032966800034046, "num_tokens": 671667.0, "step": 340 }, { "entropy": 8.529174995422363, "epoch": 0.3431128791645947, "grad_norm": 1.1328125, "learning_rate": 0.00017199999999999998, "loss": 8.2799, "mean_token_accuracy": 0.06516398154199124, "num_tokens": 680432.0, "step": 345 }, { "entropy": 8.62266035079956, "epoch": 0.34808552958727, "grad_norm": 0.90625, "learning_rate": 0.00017449999999999999, "loss": 8.2702, "mean_token_accuracy": 0.06741996183991432, "num_tokens": 690184.0, "step": 350 }, { "entropy": 8.603531074523925, "epoch": 0.3530581800099453, "grad_norm": 0.953125, "learning_rate": 0.000177, "loss": 8.159, "mean_token_accuracy": 0.07316870428621769, "num_tokens": 699147.0, "step": 355 }, { "entropy": 8.518417072296142, "epoch": 0.3580308304326206, "grad_norm": 0.8515625, "learning_rate": 0.0001795, "loss": 8.1926, "mean_token_accuracy": 0.0727127481251955, "num_tokens": 708696.0, "step": 360 }, { "entropy": 8.589232635498046, "epoch": 0.3630034808552959, "grad_norm": 0.91015625, "learning_rate": 0.000182, "loss": 8.1562, "mean_token_accuracy": 0.06915070340037346, "num_tokens": 718438.0, "step": 365 }, { "entropy": 8.530152130126954, "epoch": 0.3679761312779712, "grad_norm": 1.1640625, "learning_rate": 0.0001845, "loss": 8.2959, "mean_token_accuracy": 0.06483390927314758, "num_tokens": 728157.0, "step": 370 }, { "entropy": 8.543238544464112, "epoch": 0.37294878170064644, "grad_norm": 1.1796875, "learning_rate": 0.000187, "loss": 8.1901, "mean_token_accuracy": 0.07307061739265919, "num_tokens": 737007.0, "step": 375 }, { "entropy": 8.549563598632812, "epoch": 0.37792143212332174, "grad_norm": 1.1640625, "learning_rate": 0.0001895, "loss": 8.1671, "mean_token_accuracy": 0.07229796946048736, "num_tokens": 746873.0, "step": 380 }, { "entropy": 8.522933387756348, "epoch": 0.382894082545997, "grad_norm": 0.91796875, "learning_rate": 0.000192, "loss": 8.0514, "mean_token_accuracy": 0.08149674609303474, "num_tokens": 755486.0, "step": 385 }, { "entropy": 8.475645160675048, "epoch": 0.3878667329686723, "grad_norm": 0.9765625, "learning_rate": 0.0001945, "loss": 8.1482, "mean_token_accuracy": 0.07295819409191609, "num_tokens": 765481.0, "step": 390 }, { "entropy": 8.463741111755372, "epoch": 0.3928393833913476, "grad_norm": 1.046875, "learning_rate": 0.00019700000000000002, "loss": 8.1135, "mean_token_accuracy": 0.07425905987620354, "num_tokens": 774335.0, "step": 395 }, { "entropy": 8.596048164367676, "epoch": 0.39781203381402286, "grad_norm": 1.3203125, "learning_rate": 0.00019950000000000002, "loss": 8.2392, "mean_token_accuracy": 0.07124232538044453, "num_tokens": 784307.0, "step": 400 }, { "entropy": 8.549865531921387, "epoch": 0.40278468423669817, "grad_norm": 0.953125, "learning_rate": 0.000202, "loss": 8.2106, "mean_token_accuracy": 0.07055418565869331, "num_tokens": 795058.0, "step": 405 }, { "entropy": 8.556127262115478, "epoch": 0.40775733465937347, "grad_norm": 2.890625, "learning_rate": 0.00020449999999999998, "loss": 8.1755, "mean_token_accuracy": 0.07405509985983372, "num_tokens": 805687.0, "step": 410 }, { "entropy": 8.495815467834472, "epoch": 0.4127299850820487, "grad_norm": 1.1328125, "learning_rate": 0.000207, "loss": 8.1541, "mean_token_accuracy": 0.07714710012078285, "num_tokens": 815138.0, "step": 415 }, { "entropy": 8.47137746810913, "epoch": 0.41770263550472403, "grad_norm": 1.2109375, "learning_rate": 0.0002095, "loss": 8.1172, "mean_token_accuracy": 0.07492221929132939, "num_tokens": 825009.0, "step": 420 }, { "entropy": 8.46223554611206, "epoch": 0.4226752859273993, "grad_norm": 1.140625, "learning_rate": 0.000212, "loss": 8.1004, "mean_token_accuracy": 0.07772790230810642, "num_tokens": 834708.0, "step": 425 }, { "entropy": 8.475219249725342, "epoch": 0.4276479363500746, "grad_norm": 1.1640625, "learning_rate": 0.0002145, "loss": 8.1753, "mean_token_accuracy": 0.07542566247284413, "num_tokens": 843888.0, "step": 430 }, { "entropy": 8.477521610260009, "epoch": 0.4326205867727499, "grad_norm": 1.1484375, "learning_rate": 0.00021700000000000002, "loss": 8.1222, "mean_token_accuracy": 0.07436901330947876, "num_tokens": 853057.0, "step": 435 }, { "entropy": 8.48756446838379, "epoch": 0.43759323719542514, "grad_norm": 1.53125, "learning_rate": 0.0002195, "loss": 8.1761, "mean_token_accuracy": 0.07114730812609196, "num_tokens": 862701.0, "step": 440 }, { "entropy": 8.38951072692871, "epoch": 0.44256588761810045, "grad_norm": 1.0625, "learning_rate": 0.000222, "loss": 8.0672, "mean_token_accuracy": 0.07624398544430733, "num_tokens": 872129.0, "step": 445 }, { "entropy": 8.414244651794434, "epoch": 0.44753853804077576, "grad_norm": 0.84765625, "learning_rate": 0.0002245, "loss": 8.0759, "mean_token_accuracy": 0.0760790079832077, "num_tokens": 883166.0, "step": 450 }, { "entropy": 8.476319980621337, "epoch": 0.452511188463451, "grad_norm": 1.296875, "learning_rate": 0.00022700000000000002, "loss": 8.0367, "mean_token_accuracy": 0.08530011028051376, "num_tokens": 894159.0, "step": 455 }, { "entropy": 8.479471683502197, "epoch": 0.4574838388861263, "grad_norm": 1.0859375, "learning_rate": 0.00022950000000000002, "loss": 8.0962, "mean_token_accuracy": 0.07649504765868187, "num_tokens": 904588.0, "step": 460 }, { "entropy": 8.296580982208251, "epoch": 0.46245648930880157, "grad_norm": 1.40625, "learning_rate": 0.00023200000000000003, "loss": 8.0798, "mean_token_accuracy": 0.0781316339969635, "num_tokens": 915554.0, "step": 465 }, { "entropy": 8.486116504669189, "epoch": 0.4674291397314769, "grad_norm": 1.1328125, "learning_rate": 0.00023449999999999998, "loss": 8.0891, "mean_token_accuracy": 0.07881890460848809, "num_tokens": 925546.0, "step": 470 }, { "entropy": 8.337780475616455, "epoch": 0.4724017901541522, "grad_norm": 1.375, "learning_rate": 0.000237, "loss": 8.0598, "mean_token_accuracy": 0.07934539914131164, "num_tokens": 936615.0, "step": 475 }, { "entropy": 8.46543378829956, "epoch": 0.47737444057682743, "grad_norm": 1.0703125, "learning_rate": 0.0002395, "loss": 8.0858, "mean_token_accuracy": 0.07611360922455787, "num_tokens": 947374.0, "step": 480 }, { "entropy": 8.334126091003418, "epoch": 0.48234709099950274, "grad_norm": 0.7421875, "learning_rate": 0.000242, "loss": 8.0012, "mean_token_accuracy": 0.08066745214164257, "num_tokens": 957772.0, "step": 485 }, { "entropy": 8.434980773925782, "epoch": 0.48731974142217804, "grad_norm": 1.0078125, "learning_rate": 0.0002445, "loss": 8.0842, "mean_token_accuracy": 0.07925943285226822, "num_tokens": 967724.0, "step": 490 }, { "entropy": 8.30348539352417, "epoch": 0.4922923918448533, "grad_norm": 1.0078125, "learning_rate": 0.000247, "loss": 7.9835, "mean_token_accuracy": 0.07751845642924308, "num_tokens": 976497.0, "step": 495 }, { "entropy": 8.317158412933349, "epoch": 0.4972650422675286, "grad_norm": 0.97265625, "learning_rate": 0.0002495, "loss": 7.9707, "mean_token_accuracy": 0.08364193737506867, "num_tokens": 986207.0, "step": 500 }, { "epoch": 0.4972650422675286, "eval_entropy": 8.216110460219845, "eval_loss": 8.090629577636719, "eval_mean_token_accuracy": 0.07677195617748846, "eval_num_tokens": 986207.0, "eval_runtime": 1.9669, "eval_samples_per_second": 1761.677, "eval_steps_per_second": 220.654, "step": 500 } ], "logging_steps": 5, "max_steps": 10050, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 238121673523200.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }