{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.027957951241333035, "eval_steps": 500, "global_step": 500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.742604160308838, "epoch": 0.00027957951241333037, "grad_norm": 5.21875, "learning_rate": 2e-06, "loss": 10.7452, "mean_token_accuracy": 0.0002416299073956907, "num_tokens": 8997.0, "step": 5 }, { "entropy": 10.742623710632325, "epoch": 0.0005591590248266607, "grad_norm": 5.46875, "learning_rate": 4.5e-06, "loss": 10.7347, "mean_token_accuracy": 0.000248673016903922, "num_tokens": 18058.0, "step": 10 }, { "entropy": 10.742646789550781, "epoch": 0.0008387385372399911, "grad_norm": 4.84375, "learning_rate": 7e-06, "loss": 10.7211, "mean_token_accuracy": 6.249999860301614e-05, "num_tokens": 27988.0, "step": 15 }, { "entropy": 10.742666816711425, "epoch": 0.0011183180496533215, "grad_norm": 5.25, "learning_rate": 9.5e-06, "loss": 10.6549, "mean_token_accuracy": 0.0008288750774227083, "num_tokens": 36654.0, "step": 20 }, { "entropy": 10.742599487304688, "epoch": 0.0013978975620666518, "grad_norm": 4.53125, "learning_rate": 1.2e-05, "loss": 10.5707, "mean_token_accuracy": 0.00845626472728327, "num_tokens": 45807.0, "step": 25 }, { "entropy": 10.742288589477539, "epoch": 0.0016774770744799822, "grad_norm": 4.40625, "learning_rate": 1.4500000000000002e-05, "loss": 10.4473, "mean_token_accuracy": 0.0340017668902874, "num_tokens": 55528.0, "step": 30 }, { "entropy": 10.74121150970459, "epoch": 0.0019570565868933126, "grad_norm": 3.328125, "learning_rate": 1.7000000000000003e-05, "loss": 10.3292, "mean_token_accuracy": 0.03626283407211304, "num_tokens": 66262.0, "step": 35 }, { "entropy": 10.738728046417236, "epoch": 0.002236636099306643, "grad_norm": 2.671875, "learning_rate": 1.95e-05, "loss": 10.1506, "mean_token_accuracy": 0.03918867856264115, "num_tokens": 75145.0, "step": 40 }, { "entropy": 10.73520622253418, "epoch": 0.0025162156117199733, "grad_norm": 2.328125, "learning_rate": 2.2e-05, "loss": 10.0379, "mean_token_accuracy": 0.043211689591407774, "num_tokens": 84519.0, "step": 45 }, { "entropy": 10.732088565826416, "epoch": 0.0027957951241333037, "grad_norm": 2.109375, "learning_rate": 2.4500000000000003e-05, "loss": 9.9595, "mean_token_accuracy": 0.041159269958734514, "num_tokens": 93968.0, "step": 50 }, { "entropy": 10.730504989624023, "epoch": 0.003075374636546634, "grad_norm": 2.046875, "learning_rate": 2.7e-05, "loss": 9.8985, "mean_token_accuracy": 0.04068988226354122, "num_tokens": 103228.0, "step": 55 }, { "entropy": 10.729658222198486, "epoch": 0.0033549541489599644, "grad_norm": 2.203125, "learning_rate": 2.95e-05, "loss": 9.8123, "mean_token_accuracy": 0.04634873028844595, "num_tokens": 112382.0, "step": 60 }, { "entropy": 10.72733097076416, "epoch": 0.0036345336613732944, "grad_norm": 1.8671875, "learning_rate": 3.2e-05, "loss": 9.8228, "mean_token_accuracy": 0.04002052750438452, "num_tokens": 123006.0, "step": 65 }, { "entropy": 10.724089336395263, "epoch": 0.003914113173786625, "grad_norm": 1.8515625, "learning_rate": 3.4500000000000005e-05, "loss": 9.7301, "mean_token_accuracy": 0.03836380410939455, "num_tokens": 132323.0, "step": 70 }, { "entropy": 10.720303344726563, "epoch": 0.004193692686199955, "grad_norm": 2.046875, "learning_rate": 3.7e-05, "loss": 9.6339, "mean_token_accuracy": 0.0462482463568449, "num_tokens": 142668.0, "step": 75 }, { "entropy": 10.713562965393066, "epoch": 0.004473272198613286, "grad_norm": 2.03125, "learning_rate": 3.95e-05, "loss": 9.5438, "mean_token_accuracy": 0.04494307301938534, "num_tokens": 152291.0, "step": 80 }, { "entropy": 10.705206394195557, "epoch": 0.004752851711026616, "grad_norm": 2.03125, "learning_rate": 4.2000000000000004e-05, "loss": 9.4727, "mean_token_accuracy": 0.04591982215642929, "num_tokens": 162443.0, "step": 85 }, { "entropy": 10.695830249786377, "epoch": 0.005032431223439947, "grad_norm": 1.9296875, "learning_rate": 4.45e-05, "loss": 9.4692, "mean_token_accuracy": 0.037067833729088305, "num_tokens": 172011.0, "step": 90 }, { "entropy": 10.689439678192139, "epoch": 0.005312010735853277, "grad_norm": 1.9765625, "learning_rate": 4.7000000000000004e-05, "loss": 9.3015, "mean_token_accuracy": 0.04778099395334721, "num_tokens": 180882.0, "step": 95 }, { "entropy": 10.677646255493164, "epoch": 0.005591590248266607, "grad_norm": 1.9375, "learning_rate": 4.9500000000000004e-05, "loss": 9.2454, "mean_token_accuracy": 0.05362424850463867, "num_tokens": 190318.0, "step": 100 }, { "entropy": 10.660746574401855, "epoch": 0.005871169760679937, "grad_norm": 2.046875, "learning_rate": 5.2e-05, "loss": 9.114, "mean_token_accuracy": 0.05184634737670422, "num_tokens": 199369.0, "step": 105 }, { "entropy": 10.633990478515624, "epoch": 0.006150749273093268, "grad_norm": 1.8125, "learning_rate": 5.45e-05, "loss": 9.0025, "mean_token_accuracy": 0.0516359206289053, "num_tokens": 208848.0, "step": 110 }, { "entropy": 10.58621587753296, "epoch": 0.006430328785506598, "grad_norm": 1.7578125, "learning_rate": 5.7e-05, "loss": 8.9071, "mean_token_accuracy": 0.05344265438616276, "num_tokens": 218285.0, "step": 115 }, { "entropy": 10.522095870971679, "epoch": 0.006709908297919929, "grad_norm": 1.6953125, "learning_rate": 5.9499999999999996e-05, "loss": 8.747, "mean_token_accuracy": 0.05776390843093395, "num_tokens": 227033.0, "step": 120 }, { "entropy": 10.44651231765747, "epoch": 0.006989487810333259, "grad_norm": 1.7109375, "learning_rate": 6.2e-05, "loss": 8.5747, "mean_token_accuracy": 0.05609895884990692, "num_tokens": 236020.0, "step": 125 }, { "entropy": 10.386964702606202, "epoch": 0.007269067322746589, "grad_norm": 1.6171875, "learning_rate": 6.450000000000001e-05, "loss": 8.5067, "mean_token_accuracy": 0.05812028683722019, "num_tokens": 244996.0, "step": 130 }, { "entropy": 10.300998210906982, "epoch": 0.0075486468351599195, "grad_norm": 1.5546875, "learning_rate": 6.7e-05, "loss": 8.3979, "mean_token_accuracy": 0.05419078357517719, "num_tokens": 254721.0, "step": 135 }, { "entropy": 10.223974227905273, "epoch": 0.00782822634757325, "grad_norm": 1.4921875, "learning_rate": 6.950000000000001e-05, "loss": 8.1952, "mean_token_accuracy": 0.05796922855079174, "num_tokens": 264203.0, "step": 140 }, { "entropy": 10.118547725677491, "epoch": 0.00810780585998658, "grad_norm": 1.5390625, "learning_rate": 7.2e-05, "loss": 8.1377, "mean_token_accuracy": 0.062206852808594705, "num_tokens": 274136.0, "step": 145 }, { "entropy": 9.95664005279541, "epoch": 0.00838738537239991, "grad_norm": 1.4296875, "learning_rate": 7.45e-05, "loss": 8.0921, "mean_token_accuracy": 0.053653810545802115, "num_tokens": 284089.0, "step": 150 }, { "entropy": 9.849724769592285, "epoch": 0.008666964884813241, "grad_norm": 1.3671875, "learning_rate": 7.7e-05, "loss": 7.8983, "mean_token_accuracy": 0.05716096460819244, "num_tokens": 292975.0, "step": 155 }, { "entropy": 9.631487941741943, "epoch": 0.008946544397226572, "grad_norm": 1.2734375, "learning_rate": 7.950000000000001e-05, "loss": 7.799, "mean_token_accuracy": 0.06275118589401245, "num_tokens": 301900.0, "step": 160 }, { "entropy": 9.396039676666259, "epoch": 0.0092261239096399, "grad_norm": 1.140625, "learning_rate": 8.2e-05, "loss": 7.73, "mean_token_accuracy": 0.06139553301036358, "num_tokens": 312052.0, "step": 165 }, { "entropy": 9.197185707092284, "epoch": 0.009505703422053232, "grad_norm": 1.015625, "learning_rate": 8.450000000000001e-05, "loss": 7.4949, "mean_token_accuracy": 0.07359966151416301, "num_tokens": 321834.0, "step": 170 }, { "entropy": 8.953872203826904, "epoch": 0.009785282934466562, "grad_norm": 1.03125, "learning_rate": 8.7e-05, "loss": 7.4616, "mean_token_accuracy": 0.06581225953996181, "num_tokens": 331806.0, "step": 175 }, { "entropy": 8.738122272491456, "epoch": 0.010064862446879893, "grad_norm": 1.0390625, "learning_rate": 8.95e-05, "loss": 7.401, "mean_token_accuracy": 0.06802928820252419, "num_tokens": 341015.0, "step": 180 }, { "entropy": 8.514873027801514, "epoch": 0.010344441959293222, "grad_norm": 0.96875, "learning_rate": 9.2e-05, "loss": 7.4106, "mean_token_accuracy": 0.07147527374327182, "num_tokens": 350653.0, "step": 185 }, { "entropy": 8.432024192810058, "epoch": 0.010624021471706553, "grad_norm": 1.265625, "learning_rate": 9.45e-05, "loss": 7.4886, "mean_token_accuracy": 0.06500204354524612, "num_tokens": 360090.0, "step": 190 }, { "entropy": 8.343926239013673, "epoch": 0.010903600984119884, "grad_norm": 0.953125, "learning_rate": 9.7e-05, "loss": 7.2512, "mean_token_accuracy": 0.07501669861376285, "num_tokens": 370265.0, "step": 195 }, { "entropy": 8.184742641448974, "epoch": 0.011183180496533215, "grad_norm": 1.109375, "learning_rate": 9.95e-05, "loss": 7.3226, "mean_token_accuracy": 0.070186922326684, "num_tokens": 379060.0, "step": 200 }, { "entropy": 8.110335540771484, "epoch": 0.011462760008946544, "grad_norm": 1.0078125, "learning_rate": 0.000102, "loss": 7.2938, "mean_token_accuracy": 0.0759833563119173, "num_tokens": 388621.0, "step": 205 }, { "entropy": 8.189294242858887, "epoch": 0.011742339521359875, "grad_norm": 1.140625, "learning_rate": 0.00010449999999999999, "loss": 7.2676, "mean_token_accuracy": 0.0727431409060955, "num_tokens": 397708.0, "step": 210 }, { "entropy": 8.10356707572937, "epoch": 0.012021919033773205, "grad_norm": 0.99609375, "learning_rate": 0.000107, "loss": 7.2602, "mean_token_accuracy": 0.07345507219433785, "num_tokens": 406979.0, "step": 215 }, { "entropy": 8.034816122055053, "epoch": 0.012301498546186536, "grad_norm": 0.9375, "learning_rate": 0.0001095, "loss": 7.2885, "mean_token_accuracy": 0.07478194162249566, "num_tokens": 416150.0, "step": 220 }, { "entropy": 8.053417491912843, "epoch": 0.012581078058599865, "grad_norm": 0.9765625, "learning_rate": 0.000112, "loss": 7.161, "mean_token_accuracy": 0.07471481338143349, "num_tokens": 425052.0, "step": 225 }, { "entropy": 7.964312744140625, "epoch": 0.012860657571013196, "grad_norm": 0.98828125, "learning_rate": 0.0001145, "loss": 7.2054, "mean_token_accuracy": 0.08025330156087876, "num_tokens": 433950.0, "step": 230 }, { "entropy": 7.9365815162658695, "epoch": 0.013140237083426527, "grad_norm": 1.3671875, "learning_rate": 0.00011700000000000001, "loss": 7.178, "mean_token_accuracy": 0.08213647454977036, "num_tokens": 443400.0, "step": 235 }, { "entropy": 7.868668031692505, "epoch": 0.013419816595839858, "grad_norm": 1.6484375, "learning_rate": 0.00011949999999999999, "loss": 7.1882, "mean_token_accuracy": 0.07630038633942604, "num_tokens": 452965.0, "step": 240 }, { "entropy": 7.8286830425262455, "epoch": 0.013699396108253187, "grad_norm": 1.1171875, "learning_rate": 0.000122, "loss": 7.0823, "mean_token_accuracy": 0.08161357119679451, "num_tokens": 461926.0, "step": 245 }, { "entropy": 7.832862472534179, "epoch": 0.013978975620666518, "grad_norm": 1.015625, "learning_rate": 0.0001245, "loss": 7.0678, "mean_token_accuracy": 0.08250153660774232, "num_tokens": 471013.0, "step": 250 }, { "entropy": 7.846067714691162, "epoch": 0.014258555133079848, "grad_norm": 0.98828125, "learning_rate": 0.000127, "loss": 7.0425, "mean_token_accuracy": 0.08530599400401115, "num_tokens": 480800.0, "step": 255 }, { "entropy": 7.760735368728637, "epoch": 0.014538134645493177, "grad_norm": 1.046875, "learning_rate": 0.0001295, "loss": 7.0328, "mean_token_accuracy": 0.0859468162059784, "num_tokens": 489410.0, "step": 260 }, { "entropy": 7.729041671752929, "epoch": 0.014817714157906508, "grad_norm": 1.015625, "learning_rate": 0.000132, "loss": 7.0624, "mean_token_accuracy": 0.08790867775678635, "num_tokens": 498568.0, "step": 265 }, { "entropy": 7.717026662826538, "epoch": 0.015097293670319839, "grad_norm": 0.99609375, "learning_rate": 0.00013450000000000002, "loss": 6.9952, "mean_token_accuracy": 0.08537343889474869, "num_tokens": 508412.0, "step": 270 }, { "entropy": 7.722399425506592, "epoch": 0.01537687318273317, "grad_norm": 1.0546875, "learning_rate": 0.00013700000000000002, "loss": 6.9036, "mean_token_accuracy": 0.08399934843182563, "num_tokens": 516447.0, "step": 275 }, { "entropy": 7.711771678924561, "epoch": 0.0156564526951465, "grad_norm": 1.09375, "learning_rate": 0.0001395, "loss": 6.9704, "mean_token_accuracy": 0.08819907456636429, "num_tokens": 525352.0, "step": 280 }, { "entropy": 7.623401927947998, "epoch": 0.01593603220755983, "grad_norm": 1.1796875, "learning_rate": 0.00014199999999999998, "loss": 6.9797, "mean_token_accuracy": 0.09028599634766579, "num_tokens": 534827.0, "step": 285 }, { "entropy": 7.567380142211914, "epoch": 0.01621561171997316, "grad_norm": 0.984375, "learning_rate": 0.0001445, "loss": 6.8852, "mean_token_accuracy": 0.09008300229907036, "num_tokens": 543666.0, "step": 290 }, { "entropy": 7.5774678707122805, "epoch": 0.01649519123238649, "grad_norm": 0.953125, "learning_rate": 0.000147, "loss": 7.0362, "mean_token_accuracy": 0.08438777178525925, "num_tokens": 553296.0, "step": 295 }, { "entropy": 7.5840624332427975, "epoch": 0.01677477074479982, "grad_norm": 1.1015625, "learning_rate": 0.0001495, "loss": 6.9249, "mean_token_accuracy": 0.08579359352588653, "num_tokens": 562053.0, "step": 300 }, { "entropy": 7.535729122161865, "epoch": 0.017054350257213153, "grad_norm": 1.15625, "learning_rate": 0.000152, "loss": 6.8026, "mean_token_accuracy": 0.08932173550128937, "num_tokens": 571090.0, "step": 305 }, { "entropy": 7.51135892868042, "epoch": 0.017333929769626482, "grad_norm": 0.921875, "learning_rate": 0.00015450000000000001, "loss": 6.949, "mean_token_accuracy": 0.08511770591139793, "num_tokens": 580432.0, "step": 310 }, { "entropy": 7.45130934715271, "epoch": 0.01761350928203981, "grad_norm": 0.984375, "learning_rate": 0.000157, "loss": 6.7722, "mean_token_accuracy": 0.09298585653305054, "num_tokens": 589977.0, "step": 315 }, { "entropy": 7.5484930038452145, "epoch": 0.017893088794453144, "grad_norm": 1.140625, "learning_rate": 0.0001595, "loss": 6.9432, "mean_token_accuracy": 0.08774355575442314, "num_tokens": 599676.0, "step": 320 }, { "entropy": 7.364548540115356, "epoch": 0.018172668306866473, "grad_norm": 1.0234375, "learning_rate": 0.000162, "loss": 6.746, "mean_token_accuracy": 0.09561119675636291, "num_tokens": 609037.0, "step": 325 }, { "entropy": 7.475339651107788, "epoch": 0.0184522478192798, "grad_norm": 0.91796875, "learning_rate": 0.00016450000000000001, "loss": 6.8463, "mean_token_accuracy": 0.09227285087108612, "num_tokens": 618191.0, "step": 330 }, { "entropy": 7.462693548202514, "epoch": 0.018731827331693134, "grad_norm": 1.390625, "learning_rate": 0.00016700000000000002, "loss": 6.8617, "mean_token_accuracy": 0.08824969157576561, "num_tokens": 627463.0, "step": 335 }, { "entropy": 7.467849254608154, "epoch": 0.019011406844106463, "grad_norm": 1.1171875, "learning_rate": 0.00016950000000000003, "loss": 6.848, "mean_token_accuracy": 0.09017552435398102, "num_tokens": 636421.0, "step": 340 }, { "entropy": 7.368214416503906, "epoch": 0.019290986356519796, "grad_norm": 0.95703125, "learning_rate": 0.00017199999999999998, "loss": 6.848, "mean_token_accuracy": 0.08877173736691475, "num_tokens": 646378.0, "step": 345 }, { "entropy": 7.436206865310669, "epoch": 0.019570565868933125, "grad_norm": 1.2265625, "learning_rate": 0.00017449999999999999, "loss": 6.8486, "mean_token_accuracy": 0.08993291035294533, "num_tokens": 655706.0, "step": 350 }, { "entropy": 7.3630943775177, "epoch": 0.019850145381346454, "grad_norm": 1.109375, "learning_rate": 0.000177, "loss": 6.8057, "mean_token_accuracy": 0.09233427047729492, "num_tokens": 664903.0, "step": 355 }, { "entropy": 7.301582717895508, "epoch": 0.020129724893759787, "grad_norm": 1.0625, "learning_rate": 0.0001795, "loss": 6.7755, "mean_token_accuracy": 0.09259092882275581, "num_tokens": 674144.0, "step": 360 }, { "entropy": 7.440686845779419, "epoch": 0.020409304406173116, "grad_norm": 1.203125, "learning_rate": 0.000182, "loss": 6.7231, "mean_token_accuracy": 0.09879153519868851, "num_tokens": 682427.0, "step": 365 }, { "entropy": 7.2801062107086185, "epoch": 0.020688883918586445, "grad_norm": 1.0703125, "learning_rate": 0.0001845, "loss": 6.8196, "mean_token_accuracy": 0.09161863029003144, "num_tokens": 691388.0, "step": 370 }, { "entropy": 7.400664806365967, "epoch": 0.020968463430999777, "grad_norm": 1.2109375, "learning_rate": 0.000187, "loss": 6.7844, "mean_token_accuracy": 0.09717175960540772, "num_tokens": 701182.0, "step": 375 }, { "entropy": 7.355081558227539, "epoch": 0.021248042943413106, "grad_norm": 1.09375, "learning_rate": 0.0001895, "loss": 6.7637, "mean_token_accuracy": 0.0951042465865612, "num_tokens": 710348.0, "step": 380 }, { "entropy": 7.235377836227417, "epoch": 0.021527622455826435, "grad_norm": 0.9921875, "learning_rate": 0.000192, "loss": 6.7512, "mean_token_accuracy": 0.0942377932369709, "num_tokens": 720718.0, "step": 385 }, { "entropy": 7.2696562767028805, "epoch": 0.021807201968239768, "grad_norm": 1.25, "learning_rate": 0.0001945, "loss": 6.7213, "mean_token_accuracy": 0.10067062899470329, "num_tokens": 729450.0, "step": 390 }, { "entropy": 7.3472309589385985, "epoch": 0.022086781480653097, "grad_norm": 1.15625, "learning_rate": 0.00019700000000000002, "loss": 6.7288, "mean_token_accuracy": 0.09962123259902, "num_tokens": 738474.0, "step": 395 }, { "entropy": 7.205544471740723, "epoch": 0.02236636099306643, "grad_norm": 1.046875, "learning_rate": 0.00019950000000000002, "loss": 6.7218, "mean_token_accuracy": 0.09991101995110512, "num_tokens": 748305.0, "step": 400 }, { "entropy": 7.273484086990356, "epoch": 0.02264594050547976, "grad_norm": 0.984375, "learning_rate": 0.000202, "loss": 6.7688, "mean_token_accuracy": 0.09299318492412567, "num_tokens": 758173.0, "step": 405 }, { "entropy": 7.260233402252197, "epoch": 0.022925520017893088, "grad_norm": 1.0703125, "learning_rate": 0.00020449999999999998, "loss": 6.806, "mean_token_accuracy": 0.08802814856171608, "num_tokens": 768082.0, "step": 410 }, { "entropy": 7.269196557998657, "epoch": 0.02320509953030642, "grad_norm": 1.09375, "learning_rate": 0.000207, "loss": 6.7521, "mean_token_accuracy": 0.08867477178573609, "num_tokens": 778575.0, "step": 415 }, { "entropy": 7.175719738006592, "epoch": 0.02348467904271975, "grad_norm": 1.046875, "learning_rate": 0.0002095, "loss": 6.6724, "mean_token_accuracy": 0.0951958455145359, "num_tokens": 788164.0, "step": 420 }, { "entropy": 7.268473434448242, "epoch": 0.02376425855513308, "grad_norm": 0.9375, "learning_rate": 0.000212, "loss": 6.6384, "mean_token_accuracy": 0.10065982788801194, "num_tokens": 798028.0, "step": 425 }, { "entropy": 7.174567365646363, "epoch": 0.02404383806754641, "grad_norm": 1.09375, "learning_rate": 0.0002145, "loss": 6.6485, "mean_token_accuracy": 0.09755216687917709, "num_tokens": 807540.0, "step": 430 }, { "entropy": 7.178504228591919, "epoch": 0.02432341757995974, "grad_norm": 1.0625, "learning_rate": 0.00021700000000000002, "loss": 6.6809, "mean_token_accuracy": 0.0978812776505947, "num_tokens": 817649.0, "step": 435 }, { "entropy": 7.214717721939087, "epoch": 0.024602997092373072, "grad_norm": 1.171875, "learning_rate": 0.0002195, "loss": 6.6933, "mean_token_accuracy": 0.09935645759105682, "num_tokens": 826410.0, "step": 440 }, { "entropy": 7.2163246154785154, "epoch": 0.0248825766047864, "grad_norm": 1.140625, "learning_rate": 0.000222, "loss": 6.7444, "mean_token_accuracy": 0.09374995231628418, "num_tokens": 836299.0, "step": 445 }, { "entropy": 7.1747071743011475, "epoch": 0.02516215611719973, "grad_norm": 1.15625, "learning_rate": 0.0002245, "loss": 6.5742, "mean_token_accuracy": 0.1049035795032978, "num_tokens": 845199.0, "step": 450 }, { "entropy": 7.132574033737183, "epoch": 0.025441735629613063, "grad_norm": 1.0234375, "learning_rate": 0.00022700000000000002, "loss": 6.5755, "mean_token_accuracy": 0.09809941202402114, "num_tokens": 854235.0, "step": 455 }, { "entropy": 7.1369490146636965, "epoch": 0.025721315142026392, "grad_norm": 1.25, "learning_rate": 0.00022950000000000002, "loss": 6.6791, "mean_token_accuracy": 0.09706456884741783, "num_tokens": 862540.0, "step": 460 }, { "entropy": 7.143648719787597, "epoch": 0.02600089465443972, "grad_norm": 1.0234375, "learning_rate": 0.00023200000000000003, "loss": 6.5617, "mean_token_accuracy": 0.09988364353775978, "num_tokens": 871352.0, "step": 465 }, { "entropy": 7.129497766494751, "epoch": 0.026280474166853054, "grad_norm": 1.0703125, "learning_rate": 0.00023449999999999998, "loss": 6.5662, "mean_token_accuracy": 0.10278114005923271, "num_tokens": 880004.0, "step": 470 }, { "entropy": 7.0246419429779055, "epoch": 0.026560053679266383, "grad_norm": 0.94140625, "learning_rate": 0.000237, "loss": 6.5808, "mean_token_accuracy": 0.09790191277861596, "num_tokens": 890392.0, "step": 475 }, { "entropy": 7.201833772659302, "epoch": 0.026839633191679715, "grad_norm": 1.1015625, "learning_rate": 0.0002395, "loss": 6.6187, "mean_token_accuracy": 0.09889682978391648, "num_tokens": 899442.0, "step": 480 }, { "entropy": 7.035550785064697, "epoch": 0.027119212704093044, "grad_norm": 1.1953125, "learning_rate": 0.000242, "loss": 6.5621, "mean_token_accuracy": 0.10727965980768203, "num_tokens": 907440.0, "step": 485 }, { "entropy": 7.085067796707153, "epoch": 0.027398792216506374, "grad_norm": 1.0625, "learning_rate": 0.0002445, "loss": 6.7462, "mean_token_accuracy": 0.08954423442482948, "num_tokens": 917734.0, "step": 490 }, { "entropy": 7.196885871887207, "epoch": 0.027678371728919706, "grad_norm": 1.1328125, "learning_rate": 0.000247, "loss": 6.6752, "mean_token_accuracy": 0.1043403372168541, "num_tokens": 927717.0, "step": 495 }, { "entropy": 7.075096464157104, "epoch": 0.027957951241333035, "grad_norm": 0.9921875, "learning_rate": 0.0002495, "loss": 6.6284, "mean_token_accuracy": 0.0997283287346363, "num_tokens": 937385.0, "step": 500 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 199273077964800.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }