{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.05591590248266607, "eval_steps": 500, "global_step": 1000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.742604160308838, "epoch": 0.00027957951241333037, "grad_norm": 5.21875, "learning_rate": 2e-06, "loss": 10.7452, "mean_token_accuracy": 0.0002416299073956907, "num_tokens": 8997.0, "step": 5 }, { "entropy": 10.742623710632325, "epoch": 0.0005591590248266607, "grad_norm": 5.46875, "learning_rate": 4.5e-06, "loss": 10.7347, "mean_token_accuracy": 0.000248673016903922, "num_tokens": 18058.0, "step": 10 }, { "entropy": 10.742646789550781, "epoch": 0.0008387385372399911, "grad_norm": 4.84375, "learning_rate": 7e-06, "loss": 10.7211, "mean_token_accuracy": 6.249999860301614e-05, "num_tokens": 27988.0, "step": 15 }, { "entropy": 10.742666816711425, "epoch": 0.0011183180496533215, "grad_norm": 5.25, "learning_rate": 9.5e-06, "loss": 10.6549, "mean_token_accuracy": 0.0008288750774227083, "num_tokens": 36654.0, "step": 20 }, { "entropy": 10.742599487304688, "epoch": 0.0013978975620666518, "grad_norm": 4.53125, "learning_rate": 1.2e-05, "loss": 10.5707, "mean_token_accuracy": 0.00845626472728327, "num_tokens": 45807.0, "step": 25 }, { "entropy": 10.742288589477539, "epoch": 0.0016774770744799822, "grad_norm": 4.40625, "learning_rate": 1.4500000000000002e-05, "loss": 10.4473, "mean_token_accuracy": 0.0340017668902874, "num_tokens": 55528.0, "step": 30 }, { "entropy": 10.74121150970459, "epoch": 0.0019570565868933126, "grad_norm": 3.328125, "learning_rate": 1.7000000000000003e-05, "loss": 10.3292, "mean_token_accuracy": 0.03626283407211304, "num_tokens": 66262.0, "step": 35 }, { "entropy": 10.738728046417236, "epoch": 0.002236636099306643, "grad_norm": 2.671875, "learning_rate": 1.95e-05, "loss": 10.1506, "mean_token_accuracy": 0.03918867856264115, "num_tokens": 75145.0, "step": 40 }, { "entropy": 10.73520622253418, "epoch": 0.0025162156117199733, "grad_norm": 2.328125, "learning_rate": 2.2e-05, "loss": 10.0379, "mean_token_accuracy": 0.043211689591407774, "num_tokens": 84519.0, "step": 45 }, { "entropy": 10.732088565826416, "epoch": 0.0027957951241333037, "grad_norm": 2.109375, "learning_rate": 2.4500000000000003e-05, "loss": 9.9595, "mean_token_accuracy": 0.041159269958734514, "num_tokens": 93968.0, "step": 50 }, { "entropy": 10.730504989624023, "epoch": 0.003075374636546634, "grad_norm": 2.046875, "learning_rate": 2.7e-05, "loss": 9.8985, "mean_token_accuracy": 0.04068988226354122, "num_tokens": 103228.0, "step": 55 }, { "entropy": 10.729658222198486, "epoch": 0.0033549541489599644, "grad_norm": 2.203125, "learning_rate": 2.95e-05, "loss": 9.8123, "mean_token_accuracy": 0.04634873028844595, "num_tokens": 112382.0, "step": 60 }, { "entropy": 10.72733097076416, "epoch": 0.0036345336613732944, "grad_norm": 1.8671875, "learning_rate": 3.2e-05, "loss": 9.8228, "mean_token_accuracy": 0.04002052750438452, "num_tokens": 123006.0, "step": 65 }, { "entropy": 10.724089336395263, "epoch": 0.003914113173786625, "grad_norm": 1.8515625, "learning_rate": 3.4500000000000005e-05, "loss": 9.7301, "mean_token_accuracy": 0.03836380410939455, "num_tokens": 132323.0, "step": 70 }, { "entropy": 10.720303344726563, "epoch": 0.004193692686199955, "grad_norm": 2.046875, "learning_rate": 3.7e-05, "loss": 9.6339, "mean_token_accuracy": 0.0462482463568449, "num_tokens": 142668.0, "step": 75 }, { "entropy": 10.713562965393066, "epoch": 0.004473272198613286, "grad_norm": 2.03125, "learning_rate": 3.95e-05, "loss": 9.5438, "mean_token_accuracy": 0.04494307301938534, "num_tokens": 152291.0, "step": 80 }, { "entropy": 10.705206394195557, "epoch": 0.004752851711026616, "grad_norm": 2.03125, "learning_rate": 4.2000000000000004e-05, "loss": 9.4727, "mean_token_accuracy": 0.04591982215642929, "num_tokens": 162443.0, "step": 85 }, { "entropy": 10.695830249786377, "epoch": 0.005032431223439947, "grad_norm": 1.9296875, "learning_rate": 4.45e-05, "loss": 9.4692, "mean_token_accuracy": 0.037067833729088305, "num_tokens": 172011.0, "step": 90 }, { "entropy": 10.689439678192139, "epoch": 0.005312010735853277, "grad_norm": 1.9765625, "learning_rate": 4.7000000000000004e-05, "loss": 9.3015, "mean_token_accuracy": 0.04778099395334721, "num_tokens": 180882.0, "step": 95 }, { "entropy": 10.677646255493164, "epoch": 0.005591590248266607, "grad_norm": 1.9375, "learning_rate": 4.9500000000000004e-05, "loss": 9.2454, "mean_token_accuracy": 0.05362424850463867, "num_tokens": 190318.0, "step": 100 }, { "entropy": 10.660746574401855, "epoch": 0.005871169760679937, "grad_norm": 2.046875, "learning_rate": 5.2e-05, "loss": 9.114, "mean_token_accuracy": 0.05184634737670422, "num_tokens": 199369.0, "step": 105 }, { "entropy": 10.633990478515624, "epoch": 0.006150749273093268, "grad_norm": 1.8125, "learning_rate": 5.45e-05, "loss": 9.0025, "mean_token_accuracy": 0.0516359206289053, "num_tokens": 208848.0, "step": 110 }, { "entropy": 10.58621587753296, "epoch": 0.006430328785506598, "grad_norm": 1.7578125, "learning_rate": 5.7e-05, "loss": 8.9071, "mean_token_accuracy": 0.05344265438616276, "num_tokens": 218285.0, "step": 115 }, { "entropy": 10.522095870971679, "epoch": 0.006709908297919929, "grad_norm": 1.6953125, "learning_rate": 5.9499999999999996e-05, "loss": 8.747, "mean_token_accuracy": 0.05776390843093395, "num_tokens": 227033.0, "step": 120 }, { "entropy": 10.44651231765747, "epoch": 0.006989487810333259, "grad_norm": 1.7109375, "learning_rate": 6.2e-05, "loss": 8.5747, "mean_token_accuracy": 0.05609895884990692, "num_tokens": 236020.0, "step": 125 }, { "entropy": 10.386964702606202, "epoch": 0.007269067322746589, "grad_norm": 1.6171875, "learning_rate": 6.450000000000001e-05, "loss": 8.5067, "mean_token_accuracy": 0.05812028683722019, "num_tokens": 244996.0, "step": 130 }, { "entropy": 10.300998210906982, "epoch": 0.0075486468351599195, "grad_norm": 1.5546875, "learning_rate": 6.7e-05, "loss": 8.3979, "mean_token_accuracy": 0.05419078357517719, "num_tokens": 254721.0, "step": 135 }, { "entropy": 10.223974227905273, "epoch": 0.00782822634757325, "grad_norm": 1.4921875, "learning_rate": 6.950000000000001e-05, "loss": 8.1952, "mean_token_accuracy": 0.05796922855079174, "num_tokens": 264203.0, "step": 140 }, { "entropy": 10.118547725677491, "epoch": 0.00810780585998658, "grad_norm": 1.5390625, "learning_rate": 7.2e-05, "loss": 8.1377, "mean_token_accuracy": 0.062206852808594705, "num_tokens": 274136.0, "step": 145 }, { "entropy": 9.95664005279541, "epoch": 0.00838738537239991, "grad_norm": 1.4296875, "learning_rate": 7.45e-05, "loss": 8.0921, "mean_token_accuracy": 0.053653810545802115, "num_tokens": 284089.0, "step": 150 }, { "entropy": 9.849724769592285, "epoch": 0.008666964884813241, "grad_norm": 1.3671875, "learning_rate": 7.7e-05, "loss": 7.8983, "mean_token_accuracy": 0.05716096460819244, "num_tokens": 292975.0, "step": 155 }, { "entropy": 9.631487941741943, "epoch": 0.008946544397226572, "grad_norm": 1.2734375, "learning_rate": 7.950000000000001e-05, "loss": 7.799, "mean_token_accuracy": 0.06275118589401245, "num_tokens": 301900.0, "step": 160 }, { "entropy": 9.396039676666259, "epoch": 0.0092261239096399, "grad_norm": 1.140625, "learning_rate": 8.2e-05, "loss": 7.73, "mean_token_accuracy": 0.06139553301036358, "num_tokens": 312052.0, "step": 165 }, { "entropy": 9.197185707092284, "epoch": 0.009505703422053232, "grad_norm": 1.015625, "learning_rate": 8.450000000000001e-05, "loss": 7.4949, "mean_token_accuracy": 0.07359966151416301, "num_tokens": 321834.0, "step": 170 }, { "entropy": 8.953872203826904, "epoch": 0.009785282934466562, "grad_norm": 1.03125, "learning_rate": 8.7e-05, "loss": 7.4616, "mean_token_accuracy": 0.06581225953996181, "num_tokens": 331806.0, "step": 175 }, { "entropy": 8.738122272491456, "epoch": 0.010064862446879893, "grad_norm": 1.0390625, "learning_rate": 8.95e-05, "loss": 7.401, "mean_token_accuracy": 0.06802928820252419, "num_tokens": 341015.0, "step": 180 }, { "entropy": 8.514873027801514, "epoch": 0.010344441959293222, "grad_norm": 0.96875, "learning_rate": 9.2e-05, "loss": 7.4106, "mean_token_accuracy": 0.07147527374327182, "num_tokens": 350653.0, "step": 185 }, { "entropy": 8.432024192810058, "epoch": 0.010624021471706553, "grad_norm": 1.265625, "learning_rate": 9.45e-05, "loss": 7.4886, "mean_token_accuracy": 0.06500204354524612, "num_tokens": 360090.0, "step": 190 }, { "entropy": 8.343926239013673, "epoch": 0.010903600984119884, "grad_norm": 0.953125, "learning_rate": 9.7e-05, "loss": 7.2512, "mean_token_accuracy": 0.07501669861376285, "num_tokens": 370265.0, "step": 195 }, { "entropy": 8.184742641448974, "epoch": 0.011183180496533215, "grad_norm": 1.109375, "learning_rate": 9.95e-05, "loss": 7.3226, "mean_token_accuracy": 0.070186922326684, "num_tokens": 379060.0, "step": 200 }, { "entropy": 8.110335540771484, "epoch": 0.011462760008946544, "grad_norm": 1.0078125, "learning_rate": 0.000102, "loss": 7.2938, "mean_token_accuracy": 0.0759833563119173, "num_tokens": 388621.0, "step": 205 }, { "entropy": 8.189294242858887, "epoch": 0.011742339521359875, "grad_norm": 1.140625, "learning_rate": 0.00010449999999999999, "loss": 7.2676, "mean_token_accuracy": 0.0727431409060955, "num_tokens": 397708.0, "step": 210 }, { "entropy": 8.10356707572937, "epoch": 0.012021919033773205, "grad_norm": 0.99609375, "learning_rate": 0.000107, "loss": 7.2602, "mean_token_accuracy": 0.07345507219433785, "num_tokens": 406979.0, "step": 215 }, { "entropy": 8.034816122055053, "epoch": 0.012301498546186536, "grad_norm": 0.9375, "learning_rate": 0.0001095, "loss": 7.2885, "mean_token_accuracy": 0.07478194162249566, "num_tokens": 416150.0, "step": 220 }, { "entropy": 8.053417491912843, "epoch": 0.012581078058599865, "grad_norm": 0.9765625, "learning_rate": 0.000112, "loss": 7.161, "mean_token_accuracy": 0.07471481338143349, "num_tokens": 425052.0, "step": 225 }, { "entropy": 7.964312744140625, "epoch": 0.012860657571013196, "grad_norm": 0.98828125, "learning_rate": 0.0001145, "loss": 7.2054, "mean_token_accuracy": 0.08025330156087876, "num_tokens": 433950.0, "step": 230 }, { "entropy": 7.9365815162658695, "epoch": 0.013140237083426527, "grad_norm": 1.3671875, "learning_rate": 0.00011700000000000001, "loss": 7.178, "mean_token_accuracy": 0.08213647454977036, "num_tokens": 443400.0, "step": 235 }, { "entropy": 7.868668031692505, "epoch": 0.013419816595839858, "grad_norm": 1.6484375, "learning_rate": 0.00011949999999999999, "loss": 7.1882, "mean_token_accuracy": 0.07630038633942604, "num_tokens": 452965.0, "step": 240 }, { "entropy": 7.8286830425262455, "epoch": 0.013699396108253187, "grad_norm": 1.1171875, "learning_rate": 0.000122, "loss": 7.0823, "mean_token_accuracy": 0.08161357119679451, "num_tokens": 461926.0, "step": 245 }, { "entropy": 7.832862472534179, "epoch": 0.013978975620666518, "grad_norm": 1.015625, "learning_rate": 0.0001245, "loss": 7.0678, "mean_token_accuracy": 0.08250153660774232, "num_tokens": 471013.0, "step": 250 }, { "entropy": 7.846067714691162, "epoch": 0.014258555133079848, "grad_norm": 0.98828125, "learning_rate": 0.000127, "loss": 7.0425, "mean_token_accuracy": 0.08530599400401115, "num_tokens": 480800.0, "step": 255 }, { "entropy": 7.760735368728637, "epoch": 0.014538134645493177, "grad_norm": 1.046875, "learning_rate": 0.0001295, "loss": 7.0328, "mean_token_accuracy": 0.0859468162059784, "num_tokens": 489410.0, "step": 260 }, { "entropy": 7.729041671752929, "epoch": 0.014817714157906508, "grad_norm": 1.015625, "learning_rate": 0.000132, "loss": 7.0624, "mean_token_accuracy": 0.08790867775678635, "num_tokens": 498568.0, "step": 265 }, { "entropy": 7.717026662826538, "epoch": 0.015097293670319839, "grad_norm": 0.99609375, "learning_rate": 0.00013450000000000002, "loss": 6.9952, "mean_token_accuracy": 0.08537343889474869, "num_tokens": 508412.0, "step": 270 }, { "entropy": 7.722399425506592, "epoch": 0.01537687318273317, "grad_norm": 1.0546875, "learning_rate": 0.00013700000000000002, "loss": 6.9036, "mean_token_accuracy": 0.08399934843182563, "num_tokens": 516447.0, "step": 275 }, { "entropy": 7.711771678924561, "epoch": 0.0156564526951465, "grad_norm": 1.09375, "learning_rate": 0.0001395, "loss": 6.9704, "mean_token_accuracy": 0.08819907456636429, "num_tokens": 525352.0, "step": 280 }, { "entropy": 7.623401927947998, "epoch": 0.01593603220755983, "grad_norm": 1.1796875, "learning_rate": 0.00014199999999999998, "loss": 6.9797, "mean_token_accuracy": 0.09028599634766579, "num_tokens": 534827.0, "step": 285 }, { "entropy": 7.567380142211914, "epoch": 0.01621561171997316, "grad_norm": 0.984375, "learning_rate": 0.0001445, "loss": 6.8852, "mean_token_accuracy": 0.09008300229907036, "num_tokens": 543666.0, "step": 290 }, { "entropy": 7.5774678707122805, "epoch": 0.01649519123238649, "grad_norm": 0.953125, "learning_rate": 0.000147, "loss": 7.0362, "mean_token_accuracy": 0.08438777178525925, "num_tokens": 553296.0, "step": 295 }, { "entropy": 7.5840624332427975, "epoch": 0.01677477074479982, "grad_norm": 1.1015625, "learning_rate": 0.0001495, "loss": 6.9249, "mean_token_accuracy": 0.08579359352588653, "num_tokens": 562053.0, "step": 300 }, { "entropy": 7.535729122161865, "epoch": 0.017054350257213153, "grad_norm": 1.15625, "learning_rate": 0.000152, "loss": 6.8026, "mean_token_accuracy": 0.08932173550128937, "num_tokens": 571090.0, "step": 305 }, { "entropy": 7.51135892868042, "epoch": 0.017333929769626482, "grad_norm": 0.921875, "learning_rate": 0.00015450000000000001, "loss": 6.949, "mean_token_accuracy": 0.08511770591139793, "num_tokens": 580432.0, "step": 310 }, { "entropy": 7.45130934715271, "epoch": 0.01761350928203981, "grad_norm": 0.984375, "learning_rate": 0.000157, "loss": 6.7722, "mean_token_accuracy": 0.09298585653305054, "num_tokens": 589977.0, "step": 315 }, { "entropy": 7.5484930038452145, "epoch": 0.017893088794453144, "grad_norm": 1.140625, "learning_rate": 0.0001595, "loss": 6.9432, "mean_token_accuracy": 0.08774355575442314, "num_tokens": 599676.0, "step": 320 }, { "entropy": 7.364548540115356, "epoch": 0.018172668306866473, "grad_norm": 1.0234375, "learning_rate": 0.000162, "loss": 6.746, "mean_token_accuracy": 0.09561119675636291, "num_tokens": 609037.0, "step": 325 }, { "entropy": 7.475339651107788, "epoch": 0.0184522478192798, "grad_norm": 0.91796875, "learning_rate": 0.00016450000000000001, "loss": 6.8463, "mean_token_accuracy": 0.09227285087108612, "num_tokens": 618191.0, "step": 330 }, { "entropy": 7.462693548202514, "epoch": 0.018731827331693134, "grad_norm": 1.390625, "learning_rate": 0.00016700000000000002, "loss": 6.8617, "mean_token_accuracy": 0.08824969157576561, "num_tokens": 627463.0, "step": 335 }, { "entropy": 7.467849254608154, "epoch": 0.019011406844106463, "grad_norm": 1.1171875, "learning_rate": 0.00016950000000000003, "loss": 6.848, "mean_token_accuracy": 0.09017552435398102, "num_tokens": 636421.0, "step": 340 }, { "entropy": 7.368214416503906, "epoch": 0.019290986356519796, "grad_norm": 0.95703125, "learning_rate": 0.00017199999999999998, "loss": 6.848, "mean_token_accuracy": 0.08877173736691475, "num_tokens": 646378.0, "step": 345 }, { "entropy": 7.436206865310669, "epoch": 0.019570565868933125, "grad_norm": 1.2265625, "learning_rate": 0.00017449999999999999, "loss": 6.8486, "mean_token_accuracy": 0.08993291035294533, "num_tokens": 655706.0, "step": 350 }, { "entropy": 7.3630943775177, "epoch": 0.019850145381346454, "grad_norm": 1.109375, "learning_rate": 0.000177, "loss": 6.8057, "mean_token_accuracy": 0.09233427047729492, "num_tokens": 664903.0, "step": 355 }, { "entropy": 7.301582717895508, "epoch": 0.020129724893759787, "grad_norm": 1.0625, "learning_rate": 0.0001795, "loss": 6.7755, "mean_token_accuracy": 0.09259092882275581, "num_tokens": 674144.0, "step": 360 }, { "entropy": 7.440686845779419, "epoch": 0.020409304406173116, "grad_norm": 1.203125, "learning_rate": 0.000182, "loss": 6.7231, "mean_token_accuracy": 0.09879153519868851, "num_tokens": 682427.0, "step": 365 }, { "entropy": 7.2801062107086185, "epoch": 0.020688883918586445, "grad_norm": 1.0703125, "learning_rate": 0.0001845, "loss": 6.8196, "mean_token_accuracy": 0.09161863029003144, "num_tokens": 691388.0, "step": 370 }, { "entropy": 7.400664806365967, "epoch": 0.020968463430999777, "grad_norm": 1.2109375, "learning_rate": 0.000187, "loss": 6.7844, "mean_token_accuracy": 0.09717175960540772, "num_tokens": 701182.0, "step": 375 }, { "entropy": 7.355081558227539, "epoch": 0.021248042943413106, "grad_norm": 1.09375, "learning_rate": 0.0001895, "loss": 6.7637, "mean_token_accuracy": 0.0951042465865612, "num_tokens": 710348.0, "step": 380 }, { "entropy": 7.235377836227417, "epoch": 0.021527622455826435, "grad_norm": 0.9921875, "learning_rate": 0.000192, "loss": 6.7512, "mean_token_accuracy": 0.0942377932369709, "num_tokens": 720718.0, "step": 385 }, { "entropy": 7.2696562767028805, "epoch": 0.021807201968239768, "grad_norm": 1.25, "learning_rate": 0.0001945, "loss": 6.7213, "mean_token_accuracy": 0.10067062899470329, "num_tokens": 729450.0, "step": 390 }, { "entropy": 7.3472309589385985, "epoch": 0.022086781480653097, "grad_norm": 1.15625, "learning_rate": 0.00019700000000000002, "loss": 6.7288, "mean_token_accuracy": 0.09962123259902, "num_tokens": 738474.0, "step": 395 }, { "entropy": 7.205544471740723, "epoch": 0.02236636099306643, "grad_norm": 1.046875, "learning_rate": 0.00019950000000000002, "loss": 6.7218, "mean_token_accuracy": 0.09991101995110512, "num_tokens": 748305.0, "step": 400 }, { "entropy": 7.273484086990356, "epoch": 0.02264594050547976, "grad_norm": 0.984375, "learning_rate": 0.000202, "loss": 6.7688, "mean_token_accuracy": 0.09299318492412567, "num_tokens": 758173.0, "step": 405 }, { "entropy": 7.260233402252197, "epoch": 0.022925520017893088, "grad_norm": 1.0703125, "learning_rate": 0.00020449999999999998, "loss": 6.806, "mean_token_accuracy": 0.08802814856171608, "num_tokens": 768082.0, "step": 410 }, { "entropy": 7.269196557998657, "epoch": 0.02320509953030642, "grad_norm": 1.09375, "learning_rate": 0.000207, "loss": 6.7521, "mean_token_accuracy": 0.08867477178573609, "num_tokens": 778575.0, "step": 415 }, { "entropy": 7.175719738006592, "epoch": 0.02348467904271975, "grad_norm": 1.046875, "learning_rate": 0.0002095, "loss": 6.6724, "mean_token_accuracy": 0.0951958455145359, "num_tokens": 788164.0, "step": 420 }, { "entropy": 7.268473434448242, "epoch": 0.02376425855513308, "grad_norm": 0.9375, "learning_rate": 0.000212, "loss": 6.6384, "mean_token_accuracy": 0.10065982788801194, "num_tokens": 798028.0, "step": 425 }, { "entropy": 7.174567365646363, "epoch": 0.02404383806754641, "grad_norm": 1.09375, "learning_rate": 0.0002145, "loss": 6.6485, "mean_token_accuracy": 0.09755216687917709, "num_tokens": 807540.0, "step": 430 }, { "entropy": 7.178504228591919, "epoch": 0.02432341757995974, "grad_norm": 1.0625, "learning_rate": 0.00021700000000000002, "loss": 6.6809, "mean_token_accuracy": 0.0978812776505947, "num_tokens": 817649.0, "step": 435 }, { "entropy": 7.214717721939087, "epoch": 0.024602997092373072, "grad_norm": 1.171875, "learning_rate": 0.0002195, "loss": 6.6933, "mean_token_accuracy": 0.09935645759105682, "num_tokens": 826410.0, "step": 440 }, { "entropy": 7.2163246154785154, "epoch": 0.0248825766047864, "grad_norm": 1.140625, "learning_rate": 0.000222, "loss": 6.7444, "mean_token_accuracy": 0.09374995231628418, "num_tokens": 836299.0, "step": 445 }, { "entropy": 7.1747071743011475, "epoch": 0.02516215611719973, "grad_norm": 1.15625, "learning_rate": 0.0002245, "loss": 6.5742, "mean_token_accuracy": 0.1049035795032978, "num_tokens": 845199.0, "step": 450 }, { "entropy": 7.132574033737183, "epoch": 0.025441735629613063, "grad_norm": 1.0234375, "learning_rate": 0.00022700000000000002, "loss": 6.5755, "mean_token_accuracy": 0.09809941202402114, "num_tokens": 854235.0, "step": 455 }, { "entropy": 7.1369490146636965, "epoch": 0.025721315142026392, "grad_norm": 1.25, "learning_rate": 0.00022950000000000002, "loss": 6.6791, "mean_token_accuracy": 0.09706456884741783, "num_tokens": 862540.0, "step": 460 }, { "entropy": 7.143648719787597, "epoch": 0.02600089465443972, "grad_norm": 1.0234375, "learning_rate": 0.00023200000000000003, "loss": 6.5617, "mean_token_accuracy": 0.09988364353775978, "num_tokens": 871352.0, "step": 465 }, { "entropy": 7.129497766494751, "epoch": 0.026280474166853054, "grad_norm": 1.0703125, "learning_rate": 0.00023449999999999998, "loss": 6.5662, "mean_token_accuracy": 0.10278114005923271, "num_tokens": 880004.0, "step": 470 }, { "entropy": 7.0246419429779055, "epoch": 0.026560053679266383, "grad_norm": 0.94140625, "learning_rate": 0.000237, "loss": 6.5808, "mean_token_accuracy": 0.09790191277861596, "num_tokens": 890392.0, "step": 475 }, { "entropy": 7.201833772659302, "epoch": 0.026839633191679715, "grad_norm": 1.1015625, "learning_rate": 0.0002395, "loss": 6.6187, "mean_token_accuracy": 0.09889682978391648, "num_tokens": 899442.0, "step": 480 }, { "entropy": 7.035550785064697, "epoch": 0.027119212704093044, "grad_norm": 1.1953125, "learning_rate": 0.000242, "loss": 6.5621, "mean_token_accuracy": 0.10727965980768203, "num_tokens": 907440.0, "step": 485 }, { "entropy": 7.085067796707153, "epoch": 0.027398792216506374, "grad_norm": 1.0625, "learning_rate": 0.0002445, "loss": 6.7462, "mean_token_accuracy": 0.08954423442482948, "num_tokens": 917734.0, "step": 490 }, { "entropy": 7.196885871887207, "epoch": 0.027678371728919706, "grad_norm": 1.1328125, "learning_rate": 0.000247, "loss": 6.6752, "mean_token_accuracy": 0.1043403372168541, "num_tokens": 927717.0, "step": 495 }, { "entropy": 7.075096464157104, "epoch": 0.027957951241333035, "grad_norm": 0.9921875, "learning_rate": 0.0002495, "loss": 6.6284, "mean_token_accuracy": 0.0997283287346363, "num_tokens": 937385.0, "step": 500 }, { "entropy": 7.0907949924469, "epoch": 0.028237530753746364, "grad_norm": 1.109375, "learning_rate": 0.000252, "loss": 6.597, "mean_token_accuracy": 0.09384197294712067, "num_tokens": 946951.0, "step": 505 }, { "entropy": 7.053925037384033, "epoch": 0.028517110266159697, "grad_norm": 1.0390625, "learning_rate": 0.0002545, "loss": 6.5645, "mean_token_accuracy": 0.09848013147711754, "num_tokens": 957686.0, "step": 510 }, { "entropy": 7.000115585327149, "epoch": 0.028796689778573026, "grad_norm": 1.1484375, "learning_rate": 0.000257, "loss": 6.4729, "mean_token_accuracy": 0.10326300486922264, "num_tokens": 966610.0, "step": 515 }, { "entropy": 7.072527551651001, "epoch": 0.029076269290986355, "grad_norm": 1.0546875, "learning_rate": 0.0002595, "loss": 6.6002, "mean_token_accuracy": 0.1036542683839798, "num_tokens": 975073.0, "step": 520 }, { "entropy": 7.086858558654785, "epoch": 0.029355848803399687, "grad_norm": 1.0859375, "learning_rate": 0.000262, "loss": 6.5286, "mean_token_accuracy": 0.10234683528542518, "num_tokens": 985307.0, "step": 525 }, { "entropy": 7.068497848510742, "epoch": 0.029635428315813016, "grad_norm": 1.2890625, "learning_rate": 0.00026450000000000003, "loss": 6.4879, "mean_token_accuracy": 0.10931713730096818, "num_tokens": 994261.0, "step": 530 }, { "entropy": 6.861135959625244, "epoch": 0.02991500782822635, "grad_norm": 1.3359375, "learning_rate": 0.00026700000000000004, "loss": 6.5142, "mean_token_accuracy": 0.10772426426410675, "num_tokens": 1003321.0, "step": 535 }, { "entropy": 6.950206565856933, "epoch": 0.030194587340639678, "grad_norm": 1.15625, "learning_rate": 0.00026950000000000005, "loss": 6.5134, "mean_token_accuracy": 0.11043959930539131, "num_tokens": 1012712.0, "step": 540 }, { "entropy": 7.02567229270935, "epoch": 0.030474166853053007, "grad_norm": 1.234375, "learning_rate": 0.00027200000000000005, "loss": 6.508, "mean_token_accuracy": 0.10081920623779297, "num_tokens": 1022461.0, "step": 545 }, { "entropy": 7.014062595367432, "epoch": 0.03075374636546634, "grad_norm": 1.1640625, "learning_rate": 0.0002745, "loss": 6.5293, "mean_token_accuracy": 0.09998132437467575, "num_tokens": 1032857.0, "step": 550 }, { "entropy": 6.9176764488220215, "epoch": 0.03103332587787967, "grad_norm": 1.109375, "learning_rate": 0.000277, "loss": 6.4824, "mean_token_accuracy": 0.10737242624163627, "num_tokens": 1042492.0, "step": 555 }, { "entropy": 6.9386693954467775, "epoch": 0.031312905390293, "grad_norm": 1.1953125, "learning_rate": 0.0002795, "loss": 6.5167, "mean_token_accuracy": 0.10647067874670028, "num_tokens": 1052539.0, "step": 560 }, { "entropy": 6.965692949295044, "epoch": 0.03159248490270633, "grad_norm": 1.0859375, "learning_rate": 0.00028199999999999997, "loss": 6.4402, "mean_token_accuracy": 0.10416494011878967, "num_tokens": 1062018.0, "step": 565 }, { "entropy": 6.925234413146972, "epoch": 0.03187206441511966, "grad_norm": 1.390625, "learning_rate": 0.0002845, "loss": 6.4518, "mean_token_accuracy": 0.11095392107963561, "num_tokens": 1071409.0, "step": 570 }, { "entropy": 6.907749605178833, "epoch": 0.03215164392753299, "grad_norm": 1.1328125, "learning_rate": 0.000287, "loss": 6.4843, "mean_token_accuracy": 0.10628700330853462, "num_tokens": 1081928.0, "step": 575 }, { "entropy": 6.892273759841919, "epoch": 0.03243122343994632, "grad_norm": 1.046875, "learning_rate": 0.0002895, "loss": 6.4707, "mean_token_accuracy": 0.10453314185142518, "num_tokens": 1091161.0, "step": 580 }, { "entropy": 6.891652774810791, "epoch": 0.032710802952359654, "grad_norm": 1.2109375, "learning_rate": 0.000292, "loss": 6.3781, "mean_token_accuracy": 0.1103638917207718, "num_tokens": 1100256.0, "step": 585 }, { "entropy": 6.913065385818482, "epoch": 0.03299038246477298, "grad_norm": 1.546875, "learning_rate": 0.0002945, "loss": 6.5215, "mean_token_accuracy": 0.10347851365804672, "num_tokens": 1109052.0, "step": 590 }, { "entropy": 7.035890197753906, "epoch": 0.03326996197718631, "grad_norm": 1.21875, "learning_rate": 0.000297, "loss": 6.5428, "mean_token_accuracy": 0.10616497248411179, "num_tokens": 1118659.0, "step": 595 }, { "entropy": 6.874794387817383, "epoch": 0.03354954148959964, "grad_norm": 1.1015625, "learning_rate": 0.0002995, "loss": 6.4279, "mean_token_accuracy": 0.1102647602558136, "num_tokens": 1128273.0, "step": 600 }, { "entropy": 6.909904146194458, "epoch": 0.03382912100201297, "grad_norm": 1.1328125, "learning_rate": 0.000302, "loss": 6.4761, "mean_token_accuracy": 0.10916157588362693, "num_tokens": 1138036.0, "step": 605 }, { "entropy": 6.87423677444458, "epoch": 0.034108700514426306, "grad_norm": 1.2421875, "learning_rate": 0.0003045, "loss": 6.3715, "mean_token_accuracy": 0.11365670934319497, "num_tokens": 1147266.0, "step": 610 }, { "entropy": 6.87387900352478, "epoch": 0.034388280026839635, "grad_norm": 1.3046875, "learning_rate": 0.000307, "loss": 6.3922, "mean_token_accuracy": 0.11108144894242286, "num_tokens": 1156303.0, "step": 615 }, { "entropy": 6.776626634597778, "epoch": 0.034667859539252964, "grad_norm": 1.3046875, "learning_rate": 0.0003095, "loss": 6.4298, "mean_token_accuracy": 0.11272333487868309, "num_tokens": 1166127.0, "step": 620 }, { "entropy": 6.8758259296417235, "epoch": 0.03494743905166629, "grad_norm": 1.0859375, "learning_rate": 0.000312, "loss": 6.536, "mean_token_accuracy": 0.10809575021266937, "num_tokens": 1175540.0, "step": 625 }, { "entropy": 6.904007148742676, "epoch": 0.03522701856407962, "grad_norm": 1.2109375, "learning_rate": 0.0003145, "loss": 6.4, "mean_token_accuracy": 0.11190460100769997, "num_tokens": 1183883.0, "step": 630 }, { "entropy": 6.798130846023559, "epoch": 0.03550659807649295, "grad_norm": 1.1640625, "learning_rate": 0.000317, "loss": 6.3991, "mean_token_accuracy": 0.1127168245613575, "num_tokens": 1193327.0, "step": 635 }, { "entropy": 6.776614427566528, "epoch": 0.03578617758890629, "grad_norm": 1.171875, "learning_rate": 0.0003195, "loss": 6.3957, "mean_token_accuracy": 0.11016259118914604, "num_tokens": 1202477.0, "step": 640 }, { "entropy": 6.844618463516236, "epoch": 0.036065757101319616, "grad_norm": 1.09375, "learning_rate": 0.000322, "loss": 6.4907, "mean_token_accuracy": 0.10283268168568611, "num_tokens": 1213100.0, "step": 645 }, { "entropy": 6.734366703033447, "epoch": 0.036345336613732945, "grad_norm": 1.140625, "learning_rate": 0.00032450000000000003, "loss": 6.3229, "mean_token_accuracy": 0.11083219647407531, "num_tokens": 1222386.0, "step": 650 }, { "entropy": 6.851327800750733, "epoch": 0.036624916126146274, "grad_norm": 1.171875, "learning_rate": 0.00032700000000000003, "loss": 6.2995, "mean_token_accuracy": 0.1127958782017231, "num_tokens": 1233172.0, "step": 655 }, { "entropy": 6.731534004211426, "epoch": 0.0369044956385596, "grad_norm": 1.2109375, "learning_rate": 0.00032950000000000004, "loss": 6.2837, "mean_token_accuracy": 0.11103828400373458, "num_tokens": 1242477.0, "step": 660 }, { "entropy": 6.9175632953643795, "epoch": 0.03718407515097294, "grad_norm": 1.1953125, "learning_rate": 0.00033200000000000005, "loss": 6.5809, "mean_token_accuracy": 0.11029751524329186, "num_tokens": 1252952.0, "step": 665 }, { "entropy": 6.712823104858399, "epoch": 0.03746365466338627, "grad_norm": 1.2734375, "learning_rate": 0.00033450000000000005, "loss": 6.35, "mean_token_accuracy": 0.11600286141037941, "num_tokens": 1262523.0, "step": 670 }, { "entropy": 6.853010416030884, "epoch": 0.0377432341757996, "grad_norm": 1.21875, "learning_rate": 0.000337, "loss": 6.3884, "mean_token_accuracy": 0.11264139488339424, "num_tokens": 1271537.0, "step": 675 }, { "entropy": 6.746140670776367, "epoch": 0.03802281368821293, "grad_norm": 1.296875, "learning_rate": 0.0003395, "loss": 6.3091, "mean_token_accuracy": 0.11562162712216377, "num_tokens": 1280411.0, "step": 680 }, { "entropy": 6.73434042930603, "epoch": 0.038302393200626256, "grad_norm": 1.078125, "learning_rate": 0.000342, "loss": 6.3937, "mean_token_accuracy": 0.11497898325324059, "num_tokens": 1289152.0, "step": 685 }, { "entropy": 6.754694557189941, "epoch": 0.03858197271303959, "grad_norm": 1.1328125, "learning_rate": 0.00034449999999999997, "loss": 6.3379, "mean_token_accuracy": 0.1117016352713108, "num_tokens": 1298588.0, "step": 690 }, { "entropy": 6.776911306381225, "epoch": 0.03886155222545292, "grad_norm": 1.1796875, "learning_rate": 0.000347, "loss": 6.3681, "mean_token_accuracy": 0.10708253011107445, "num_tokens": 1308529.0, "step": 695 }, { "entropy": 6.681609010696411, "epoch": 0.03914113173786625, "grad_norm": 1.1171875, "learning_rate": 0.0003495, "loss": 6.3484, "mean_token_accuracy": 0.11021188572049141, "num_tokens": 1318228.0, "step": 700 }, { "entropy": 6.822549343109131, "epoch": 0.03942071125027958, "grad_norm": 1.125, "learning_rate": 0.000352, "loss": 6.4168, "mean_token_accuracy": 0.11342558711767196, "num_tokens": 1327855.0, "step": 705 }, { "entropy": 6.669567632675171, "epoch": 0.03970029076269291, "grad_norm": 1.1640625, "learning_rate": 0.0003545, "loss": 6.3314, "mean_token_accuracy": 0.11251103654503822, "num_tokens": 1337016.0, "step": 710 }, { "entropy": 6.677871179580689, "epoch": 0.03997987027510624, "grad_norm": 1.09375, "learning_rate": 0.000357, "loss": 6.1888, "mean_token_accuracy": 0.12071979492902755, "num_tokens": 1346829.0, "step": 715 }, { "entropy": 6.761476230621338, "epoch": 0.04025944978751957, "grad_norm": 1.0078125, "learning_rate": 0.0003595, "loss": 6.3965, "mean_token_accuracy": 0.11669178158044816, "num_tokens": 1355921.0, "step": 720 }, { "entropy": 6.733816766738892, "epoch": 0.0405390292999329, "grad_norm": 1.0859375, "learning_rate": 0.000362, "loss": 6.364, "mean_token_accuracy": 0.11375537812709809, "num_tokens": 1365443.0, "step": 725 }, { "entropy": 6.614108419418335, "epoch": 0.04081860881234623, "grad_norm": 1.28125, "learning_rate": 0.0003645, "loss": 6.2644, "mean_token_accuracy": 0.11659296080470086, "num_tokens": 1374804.0, "step": 730 }, { "entropy": 6.758727979660034, "epoch": 0.04109818832475956, "grad_norm": 1.109375, "learning_rate": 0.000367, "loss": 6.3118, "mean_token_accuracy": 0.11417160928249359, "num_tokens": 1384468.0, "step": 735 }, { "entropy": 6.5593489646911625, "epoch": 0.04137776783717289, "grad_norm": 1.15625, "learning_rate": 0.0003695, "loss": 6.3298, "mean_token_accuracy": 0.11806502938270569, "num_tokens": 1393590.0, "step": 740 }, { "entropy": 6.673466634750366, "epoch": 0.041657347349586225, "grad_norm": 1.125, "learning_rate": 0.000372, "loss": 6.3422, "mean_token_accuracy": 0.1178791120648384, "num_tokens": 1403776.0, "step": 745 }, { "entropy": 6.7786225318908695, "epoch": 0.041936926861999554, "grad_norm": 1.171875, "learning_rate": 0.0003745, "loss": 6.2333, "mean_token_accuracy": 0.1166193075478077, "num_tokens": 1413793.0, "step": 750 }, { "entropy": 6.492034578323365, "epoch": 0.042216506374412884, "grad_norm": 1.234375, "learning_rate": 0.000377, "loss": 6.2877, "mean_token_accuracy": 0.11759566813707352, "num_tokens": 1423449.0, "step": 755 }, { "entropy": 6.713007259368896, "epoch": 0.04249608588682621, "grad_norm": 1.1328125, "learning_rate": 0.0003795, "loss": 6.2932, "mean_token_accuracy": 0.11593074426054954, "num_tokens": 1432711.0, "step": 760 }, { "entropy": 6.684315824508667, "epoch": 0.04277566539923954, "grad_norm": 1.0078125, "learning_rate": 0.000382, "loss": 6.3212, "mean_token_accuracy": 0.11897616535425186, "num_tokens": 1443261.0, "step": 765 }, { "entropy": 6.577885389328003, "epoch": 0.04305524491165287, "grad_norm": 0.9296875, "learning_rate": 0.0003845, "loss": 6.3044, "mean_token_accuracy": 0.11995612978935241, "num_tokens": 1453896.0, "step": 770 }, { "entropy": 6.6321838855743405, "epoch": 0.04333482442406621, "grad_norm": 1.1875, "learning_rate": 0.00038700000000000003, "loss": 6.2049, "mean_token_accuracy": 0.12229073345661164, "num_tokens": 1463772.0, "step": 775 }, { "entropy": 6.678547048568726, "epoch": 0.043614403936479536, "grad_norm": 1.1171875, "learning_rate": 0.00038950000000000003, "loss": 6.3328, "mean_token_accuracy": 0.1103480413556099, "num_tokens": 1473230.0, "step": 780 }, { "entropy": 6.661152935028076, "epoch": 0.043893983448892865, "grad_norm": 1.1015625, "learning_rate": 0.00039200000000000004, "loss": 6.2652, "mean_token_accuracy": 0.11327114403247833, "num_tokens": 1482585.0, "step": 785 }, { "entropy": 6.591106700897217, "epoch": 0.044173562961306194, "grad_norm": 1.125, "learning_rate": 0.00039450000000000005, "loss": 6.2406, "mean_token_accuracy": 0.11883526220917702, "num_tokens": 1491950.0, "step": 790 }, { "entropy": 6.607058382034301, "epoch": 0.04445314247371952, "grad_norm": 1.1796875, "learning_rate": 0.00039700000000000005, "loss": 6.1899, "mean_token_accuracy": 0.1208645947277546, "num_tokens": 1501156.0, "step": 795 }, { "entropy": 6.541710615158081, "epoch": 0.04473272198613286, "grad_norm": 1.234375, "learning_rate": 0.0003995, "loss": 6.2352, "mean_token_accuracy": 0.12574194967746735, "num_tokens": 1510358.0, "step": 800 }, { "entropy": 6.601570081710816, "epoch": 0.04501230149854619, "grad_norm": 1.25, "learning_rate": 0.000402, "loss": 6.2555, "mean_token_accuracy": 0.12034472450613976, "num_tokens": 1519536.0, "step": 805 }, { "entropy": 6.565725421905517, "epoch": 0.04529188101095952, "grad_norm": 1.0859375, "learning_rate": 0.0004045, "loss": 6.2339, "mean_token_accuracy": 0.11689945459365844, "num_tokens": 1528990.0, "step": 810 }, { "entropy": 6.537348222732544, "epoch": 0.045571460523372846, "grad_norm": 1.0703125, "learning_rate": 0.00040699999999999997, "loss": 6.214, "mean_token_accuracy": 0.12160347327589989, "num_tokens": 1539361.0, "step": 815 }, { "entropy": 6.605962181091309, "epoch": 0.045851040035786175, "grad_norm": 1.1484375, "learning_rate": 0.0004095, "loss": 6.2271, "mean_token_accuracy": 0.12036370635032653, "num_tokens": 1549625.0, "step": 820 }, { "entropy": 6.620418739318848, "epoch": 0.04613061954819951, "grad_norm": 1.03125, "learning_rate": 0.000412, "loss": 6.2666, "mean_token_accuracy": 0.1255132868885994, "num_tokens": 1559810.0, "step": 825 }, { "entropy": 6.527469205856323, "epoch": 0.04641019906061284, "grad_norm": 1.3046875, "learning_rate": 0.0004145, "loss": 6.3231, "mean_token_accuracy": 0.11854067072272301, "num_tokens": 1571214.0, "step": 830 }, { "entropy": 6.7099076271057125, "epoch": 0.04668977857302617, "grad_norm": 1.2265625, "learning_rate": 0.000417, "loss": 6.2671, "mean_token_accuracy": 0.11671644374728203, "num_tokens": 1580742.0, "step": 835 }, { "entropy": 6.602362537384034, "epoch": 0.0469693580854395, "grad_norm": 1.390625, "learning_rate": 0.0004195, "loss": 6.3177, "mean_token_accuracy": 0.11618626490235329, "num_tokens": 1591290.0, "step": 840 }, { "entropy": 6.530023574829102, "epoch": 0.04724893759785283, "grad_norm": 1.28125, "learning_rate": 0.000422, "loss": 6.2365, "mean_token_accuracy": 0.1239740714430809, "num_tokens": 1600267.0, "step": 845 }, { "entropy": 6.557957172393799, "epoch": 0.04752851711026616, "grad_norm": 1.046875, "learning_rate": 0.0004245, "loss": 6.2153, "mean_token_accuracy": 0.12411479502916337, "num_tokens": 1609948.0, "step": 850 }, { "entropy": 6.517998456954956, "epoch": 0.04780809662267949, "grad_norm": 0.98046875, "learning_rate": 0.000427, "loss": 6.1905, "mean_token_accuracy": 0.12491159066557884, "num_tokens": 1619333.0, "step": 855 }, { "entropy": 6.520691967010498, "epoch": 0.04808767613509282, "grad_norm": 1.15625, "learning_rate": 0.0004295, "loss": 6.2327, "mean_token_accuracy": 0.12030576914548874, "num_tokens": 1628756.0, "step": 860 }, { "entropy": 6.4604676246643065, "epoch": 0.04836725564750615, "grad_norm": 1.1484375, "learning_rate": 0.000432, "loss": 6.1191, "mean_token_accuracy": 0.12915168330073357, "num_tokens": 1638580.0, "step": 865 }, { "entropy": 6.525818300247193, "epoch": 0.04864683515991948, "grad_norm": 1.09375, "learning_rate": 0.0004345, "loss": 6.1465, "mean_token_accuracy": 0.12202514111995696, "num_tokens": 1648453.0, "step": 870 }, { "entropy": 6.462548685073853, "epoch": 0.04892641467233281, "grad_norm": 1.1796875, "learning_rate": 0.000437, "loss": 6.1247, "mean_token_accuracy": 0.12454857230186463, "num_tokens": 1657780.0, "step": 875 }, { "entropy": 6.524330520629883, "epoch": 0.049205994184746145, "grad_norm": 1.140625, "learning_rate": 0.0004395, "loss": 6.3194, "mean_token_accuracy": 0.11488607227802276, "num_tokens": 1667935.0, "step": 880 }, { "entropy": 6.596838188171387, "epoch": 0.049485573697159474, "grad_norm": 1.171875, "learning_rate": 0.000442, "loss": 6.212, "mean_token_accuracy": 0.12398698702454566, "num_tokens": 1678152.0, "step": 885 }, { "entropy": 6.493438577651977, "epoch": 0.0497651532095728, "grad_norm": 1.078125, "learning_rate": 0.0004445, "loss": 6.2097, "mean_token_accuracy": 0.1230739638209343, "num_tokens": 1688222.0, "step": 890 }, { "entropy": 6.532832431793213, "epoch": 0.05004473272198613, "grad_norm": 1.09375, "learning_rate": 0.000447, "loss": 6.2281, "mean_token_accuracy": 0.11738072633743286, "num_tokens": 1698355.0, "step": 895 }, { "entropy": 6.451116752624512, "epoch": 0.05032431223439946, "grad_norm": 0.8984375, "learning_rate": 0.00044950000000000003, "loss": 6.148, "mean_token_accuracy": 0.12611913979053496, "num_tokens": 1708620.0, "step": 900 }, { "entropy": 6.404505968093872, "epoch": 0.05060389174681279, "grad_norm": 1.3359375, "learning_rate": 0.00045200000000000004, "loss": 6.1793, "mean_token_accuracy": 0.12188507243990898, "num_tokens": 1718087.0, "step": 905 }, { "entropy": 6.498981142044068, "epoch": 0.050883471259226126, "grad_norm": 1.34375, "learning_rate": 0.00045450000000000004, "loss": 6.1367, "mean_token_accuracy": 0.12877505272626877, "num_tokens": 1726195.0, "step": 910 }, { "entropy": 6.539384174346924, "epoch": 0.051163050771639455, "grad_norm": 1.15625, "learning_rate": 0.00045700000000000005, "loss": 6.1787, "mean_token_accuracy": 0.12548977583646775, "num_tokens": 1735264.0, "step": 915 }, { "entropy": 6.4787153720855715, "epoch": 0.051442630284052784, "grad_norm": 1.234375, "learning_rate": 0.00045950000000000006, "loss": 6.1781, "mean_token_accuracy": 0.12100374773144722, "num_tokens": 1743914.0, "step": 920 }, { "entropy": 6.478158187866211, "epoch": 0.05172220979646611, "grad_norm": 1.078125, "learning_rate": 0.000462, "loss": 6.1354, "mean_token_accuracy": 0.12575116008520126, "num_tokens": 1753975.0, "step": 925 }, { "entropy": 6.352355718612671, "epoch": 0.05200178930887944, "grad_norm": 0.99609375, "learning_rate": 0.0004645, "loss": 6.2459, "mean_token_accuracy": 0.12019256725907326, "num_tokens": 1763464.0, "step": 930 }, { "entropy": 6.56115231513977, "epoch": 0.05228136882129278, "grad_norm": 1.0546875, "learning_rate": 0.000467, "loss": 6.2273, "mean_token_accuracy": 0.12331901043653488, "num_tokens": 1773493.0, "step": 935 }, { "entropy": 6.558299112319946, "epoch": 0.05256094833370611, "grad_norm": 1.21875, "learning_rate": 0.0004695, "loss": 6.196, "mean_token_accuracy": 0.12245910018682479, "num_tokens": 1782610.0, "step": 940 }, { "entropy": 6.361427593231201, "epoch": 0.05284052784611944, "grad_norm": 1.0234375, "learning_rate": 0.000472, "loss": 6.1001, "mean_token_accuracy": 0.1252542532980442, "num_tokens": 1792227.0, "step": 945 }, { "entropy": 6.528857851028443, "epoch": 0.053120107358532766, "grad_norm": 1.1484375, "learning_rate": 0.0004745, "loss": 6.1815, "mean_token_accuracy": 0.12755777463316917, "num_tokens": 1801201.0, "step": 950 }, { "entropy": 6.345184278488159, "epoch": 0.053399686870946095, "grad_norm": 1.0703125, "learning_rate": 0.000477, "loss": 6.101, "mean_token_accuracy": 0.12595751732587815, "num_tokens": 1810615.0, "step": 955 }, { "entropy": 6.572854137420654, "epoch": 0.05367926638335943, "grad_norm": 1.0703125, "learning_rate": 0.0004795, "loss": 6.2557, "mean_token_accuracy": 0.12506696805357934, "num_tokens": 1820502.0, "step": 960 }, { "entropy": 6.402885007858276, "epoch": 0.05395884589577276, "grad_norm": 1.0390625, "learning_rate": 0.000482, "loss": 6.2045, "mean_token_accuracy": 0.12744859382510185, "num_tokens": 1829691.0, "step": 965 }, { "entropy": 6.47072925567627, "epoch": 0.05423842540818609, "grad_norm": 1.15625, "learning_rate": 0.0004845, "loss": 6.0947, "mean_token_accuracy": 0.13494734093546867, "num_tokens": 1838725.0, "step": 970 }, { "entropy": 6.41903715133667, "epoch": 0.05451800492059942, "grad_norm": 1.078125, "learning_rate": 0.000487, "loss": 6.1757, "mean_token_accuracy": 0.12426450625061988, "num_tokens": 1849362.0, "step": 975 }, { "entropy": 6.597773933410645, "epoch": 0.05479758443301275, "grad_norm": 1.1328125, "learning_rate": 0.0004895, "loss": 6.1783, "mean_token_accuracy": 0.12785449251532555, "num_tokens": 1857989.0, "step": 980 }, { "entropy": 6.431480169296265, "epoch": 0.055077163945426076, "grad_norm": 1.15625, "learning_rate": 0.000492, "loss": 6.1765, "mean_token_accuracy": 0.12329955548048019, "num_tokens": 1867326.0, "step": 985 }, { "entropy": 6.2434632778167725, "epoch": 0.05535674345783941, "grad_norm": 1.0859375, "learning_rate": 0.0004945, "loss": 6.1406, "mean_token_accuracy": 0.13350122570991516, "num_tokens": 1877827.0, "step": 990 }, { "entropy": 6.512171459197998, "epoch": 0.05563632297025274, "grad_norm": 1.1171875, "learning_rate": 0.000497, "loss": 6.137, "mean_token_accuracy": 0.12907352671027184, "num_tokens": 1887109.0, "step": 995 }, { "entropy": 6.38034200668335, "epoch": 0.05591590248266607, "grad_norm": 1.1015625, "learning_rate": 0.0004995, "loss": 6.1664, "mean_token_accuracy": 0.1256708487868309, "num_tokens": 1896852.0, "step": 1000 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 409711646638080.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }