{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.029265437518290898, "eval_steps": 500, "global_step": 500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.742143154144287, "epoch": 0.000292654375182909, "grad_norm": 5.34375, "learning_rate": 2e-06, "loss": 10.7851, "mean_token_accuracy": 7.092198356986045e-05, "num_tokens": 10253.0, "step": 5 }, { "entropy": 10.742099285125732, "epoch": 0.000585308750365818, "grad_norm": 5.09375, "learning_rate": 4.5e-06, "loss": 10.7585, "mean_token_accuracy": 7.072135922499001e-05, "num_tokens": 19586.0, "step": 10 }, { "entropy": 10.742091464996339, "epoch": 0.000877963125548727, "grad_norm": 5.71875, "learning_rate": 7e-06, "loss": 10.7338, "mean_token_accuracy": 0.0, "num_tokens": 28743.0, "step": 15 }, { "entropy": 10.742110919952392, "epoch": 0.001170617500731636, "grad_norm": 4.75, "learning_rate": 9.5e-06, "loss": 10.702, "mean_token_accuracy": 7.518797065131366e-05, "num_tokens": 39263.0, "step": 20 }, { "entropy": 10.7420015335083, "epoch": 0.0014632718759145448, "grad_norm": 5.0625, "learning_rate": 1.2e-05, "loss": 10.6176, "mean_token_accuracy": 0.00650847667711787, "num_tokens": 50195.0, "step": 25 }, { "entropy": 10.741524696350098, "epoch": 0.001755926251097454, "grad_norm": 4.5, "learning_rate": 1.4500000000000002e-05, "loss": 10.4398, "mean_token_accuracy": 0.04643158838152885, "num_tokens": 58982.0, "step": 30 }, { "entropy": 10.739701747894287, "epoch": 0.002048580626280363, "grad_norm": 3.375, "learning_rate": 1.7000000000000003e-05, "loss": 10.3385, "mean_token_accuracy": 0.04858696423470974, "num_tokens": 68619.0, "step": 35 }, { "entropy": 10.733176803588867, "epoch": 0.002341235001463272, "grad_norm": 2.734375, "learning_rate": 1.95e-05, "loss": 10.1755, "mean_token_accuracy": 0.054676258191466334, "num_tokens": 78276.0, "step": 40 }, { "entropy": 10.719074249267578, "epoch": 0.0026338893766461808, "grad_norm": 2.1875, "learning_rate": 2.2e-05, "loss": 10.085, "mean_token_accuracy": 0.05106211043894291, "num_tokens": 87977.0, "step": 45 }, { "entropy": 10.702382278442382, "epoch": 0.0029265437518290896, "grad_norm": 2.140625, "learning_rate": 2.4500000000000003e-05, "loss": 10.007, "mean_token_accuracy": 0.05418388731777668, "num_tokens": 97168.0, "step": 50 }, { "entropy": 10.688697719573975, "epoch": 0.003219198127011999, "grad_norm": 1.984375, "learning_rate": 2.7e-05, "loss": 9.978, "mean_token_accuracy": 0.0560054711997509, "num_tokens": 108162.0, "step": 55 }, { "entropy": 10.677631187438966, "epoch": 0.003511852502194908, "grad_norm": 1.9375, "learning_rate": 2.95e-05, "loss": 9.8907, "mean_token_accuracy": 0.05185089595615864, "num_tokens": 117963.0, "step": 60 }, { "entropy": 10.672104358673096, "epoch": 0.0038045068773778167, "grad_norm": 1.78125, "learning_rate": 3.2e-05, "loss": 9.8844, "mean_token_accuracy": 0.05049301944673061, "num_tokens": 128067.0, "step": 65 }, { "entropy": 10.665418434143067, "epoch": 0.004097161252560726, "grad_norm": 1.8984375, "learning_rate": 3.4500000000000005e-05, "loss": 9.8046, "mean_token_accuracy": 0.05261277854442596, "num_tokens": 138347.0, "step": 70 }, { "entropy": 10.655702877044678, "epoch": 0.004389815627743635, "grad_norm": 1.7734375, "learning_rate": 3.7e-05, "loss": 9.7713, "mean_token_accuracy": 0.05200894549489021, "num_tokens": 148883.0, "step": 75 }, { "entropy": 10.648012065887452, "epoch": 0.004682470002926544, "grad_norm": 1.7734375, "learning_rate": 3.95e-05, "loss": 9.7304, "mean_token_accuracy": 0.053603590652346614, "num_tokens": 158416.0, "step": 80 }, { "entropy": 10.638986778259277, "epoch": 0.004975124378109453, "grad_norm": 1.8125, "learning_rate": 4.2000000000000004e-05, "loss": 9.624, "mean_token_accuracy": 0.056516367569565774, "num_tokens": 168380.0, "step": 85 }, { "entropy": 10.622650527954102, "epoch": 0.0052677787532923615, "grad_norm": 1.9375, "learning_rate": 4.45e-05, "loss": 9.5594, "mean_token_accuracy": 0.058524899929761884, "num_tokens": 178623.0, "step": 90 }, { "entropy": 10.598152160644531, "epoch": 0.00556043312847527, "grad_norm": 1.7421875, "learning_rate": 4.7000000000000004e-05, "loss": 9.5209, "mean_token_accuracy": 0.05661297850310802, "num_tokens": 189058.0, "step": 95 }, { "entropy": 10.577679920196534, "epoch": 0.005853087503658179, "grad_norm": 1.6796875, "learning_rate": 4.9500000000000004e-05, "loss": 9.4548, "mean_token_accuracy": 0.056520416587591174, "num_tokens": 199465.0, "step": 100 }, { "entropy": 10.56387767791748, "epoch": 0.006145741878841089, "grad_norm": 1.6015625, "learning_rate": 5.2e-05, "loss": 9.4, "mean_token_accuracy": 0.054618718847632405, "num_tokens": 208712.0, "step": 105 }, { "entropy": 10.543546962738038, "epoch": 0.006438396254023998, "grad_norm": 1.484375, "learning_rate": 5.45e-05, "loss": 9.3224, "mean_token_accuracy": 0.05899658054113388, "num_tokens": 218557.0, "step": 110 }, { "entropy": 10.48940305709839, "epoch": 0.006731050629206907, "grad_norm": 1.6015625, "learning_rate": 5.7e-05, "loss": 9.2068, "mean_token_accuracy": 0.06870373338460922, "num_tokens": 228961.0, "step": 115 }, { "entropy": 10.402587509155273, "epoch": 0.007023705004389816, "grad_norm": 1.4375, "learning_rate": 5.9499999999999996e-05, "loss": 9.1227, "mean_token_accuracy": 0.06810536533594132, "num_tokens": 238987.0, "step": 120 }, { "entropy": 10.348681640625, "epoch": 0.0073163593795727245, "grad_norm": 1.328125, "learning_rate": 6.2e-05, "loss": 9.0633, "mean_token_accuracy": 0.0605758685618639, "num_tokens": 249600.0, "step": 125 }, { "entropy": 10.30824089050293, "epoch": 0.007609013754755633, "grad_norm": 1.578125, "learning_rate": 6.450000000000001e-05, "loss": 8.8758, "mean_token_accuracy": 0.07409285828471183, "num_tokens": 259215.0, "step": 130 }, { "entropy": 10.212008476257324, "epoch": 0.007901668129938543, "grad_norm": 1.375, "learning_rate": 6.7e-05, "loss": 8.8303, "mean_token_accuracy": 0.06557713933289051, "num_tokens": 268888.0, "step": 135 }, { "entropy": 10.150605010986329, "epoch": 0.008194322505121452, "grad_norm": 1.2734375, "learning_rate": 6.950000000000001e-05, "loss": 8.74, "mean_token_accuracy": 0.06668962053954601, "num_tokens": 278451.0, "step": 140 }, { "entropy": 10.055028533935547, "epoch": 0.008486976880304361, "grad_norm": 1.2578125, "learning_rate": 7.2e-05, "loss": 8.7012, "mean_token_accuracy": 0.06709126047790051, "num_tokens": 289577.0, "step": 145 }, { "entropy": 9.99300413131714, "epoch": 0.00877963125548727, "grad_norm": 1.1640625, "learning_rate": 7.45e-05, "loss": 8.5708, "mean_token_accuracy": 0.06588217578828334, "num_tokens": 299057.0, "step": 150 }, { "entropy": 9.817628383636475, "epoch": 0.009072285630670179, "grad_norm": 1.0703125, "learning_rate": 7.7e-05, "loss": 8.4885, "mean_token_accuracy": 0.06879487000405789, "num_tokens": 308802.0, "step": 155 }, { "entropy": 9.719903469085693, "epoch": 0.009364940005853088, "grad_norm": 0.98046875, "learning_rate": 7.950000000000001e-05, "loss": 8.3738, "mean_token_accuracy": 0.07012738101184368, "num_tokens": 317365.0, "step": 160 }, { "entropy": 9.5343448638916, "epoch": 0.009657594381035996, "grad_norm": 1.140625, "learning_rate": 8.2e-05, "loss": 8.3035, "mean_token_accuracy": 0.07032971270382404, "num_tokens": 326927.0, "step": 165 }, { "entropy": 9.404919242858886, "epoch": 0.009950248756218905, "grad_norm": 0.890625, "learning_rate": 8.450000000000001e-05, "loss": 8.317, "mean_token_accuracy": 0.06643726415932179, "num_tokens": 337408.0, "step": 170 }, { "entropy": 9.28181962966919, "epoch": 0.010242903131401814, "grad_norm": 0.79296875, "learning_rate": 8.7e-05, "loss": 8.2328, "mean_token_accuracy": 0.06949336491525174, "num_tokens": 348282.0, "step": 175 }, { "entropy": 9.099757957458497, "epoch": 0.010535557506584723, "grad_norm": 0.8359375, "learning_rate": 8.95e-05, "loss": 8.1847, "mean_token_accuracy": 0.06538042239844799, "num_tokens": 357767.0, "step": 180 }, { "entropy": 8.947648048400879, "epoch": 0.010828211881767632, "grad_norm": 0.77734375, "learning_rate": 9.2e-05, "loss": 8.1401, "mean_token_accuracy": 0.07173748835921287, "num_tokens": 368665.0, "step": 185 }, { "entropy": 8.832690525054932, "epoch": 0.01112086625695054, "grad_norm": 1.1015625, "learning_rate": 9.45e-05, "loss": 8.125, "mean_token_accuracy": 0.0688393272459507, "num_tokens": 378741.0, "step": 190 }, { "entropy": 8.722904491424561, "epoch": 0.01141352063213345, "grad_norm": 0.8359375, "learning_rate": 9.7e-05, "loss": 8.1228, "mean_token_accuracy": 0.07389259040355682, "num_tokens": 388324.0, "step": 195 }, { "entropy": 8.738927555084228, "epoch": 0.011706175007316359, "grad_norm": 0.75390625, "learning_rate": 9.95e-05, "loss": 8.1796, "mean_token_accuracy": 0.06952995508909225, "num_tokens": 398450.0, "step": 200 }, { "entropy": 8.615283966064453, "epoch": 0.01199882938249927, "grad_norm": 0.8203125, "learning_rate": 0.000102, "loss": 8.0899, "mean_token_accuracy": 0.07332116328179836, "num_tokens": 408961.0, "step": 205 }, { "entropy": 8.581227874755859, "epoch": 0.012291483757682178, "grad_norm": 1.078125, "learning_rate": 0.00010449999999999999, "loss": 8.1226, "mean_token_accuracy": 0.0683289546519518, "num_tokens": 418517.0, "step": 210 }, { "entropy": 8.532517910003662, "epoch": 0.012584138132865087, "grad_norm": 0.74609375, "learning_rate": 0.000107, "loss": 8.035, "mean_token_accuracy": 0.07064232043921947, "num_tokens": 428059.0, "step": 215 }, { "entropy": 8.60868797302246, "epoch": 0.012876792508047996, "grad_norm": 0.77734375, "learning_rate": 0.0001095, "loss": 8.0513, "mean_token_accuracy": 0.06911276690661908, "num_tokens": 438499.0, "step": 220 }, { "entropy": 8.50686674118042, "epoch": 0.013169446883230905, "grad_norm": 0.73046875, "learning_rate": 0.000112, "loss": 8.0542, "mean_token_accuracy": 0.06983353272080421, "num_tokens": 448761.0, "step": 225 }, { "entropy": 8.424305152893066, "epoch": 0.013462101258413814, "grad_norm": 0.77734375, "learning_rate": 0.0001145, "loss": 8.0471, "mean_token_accuracy": 0.07090565152466297, "num_tokens": 458386.0, "step": 230 }, { "entropy": 8.447117614746094, "epoch": 0.013754755633596722, "grad_norm": 0.765625, "learning_rate": 0.00011700000000000001, "loss": 7.991, "mean_token_accuracy": 0.06929317899048329, "num_tokens": 468198.0, "step": 235 }, { "entropy": 8.46488447189331, "epoch": 0.014047410008779631, "grad_norm": 0.7265625, "learning_rate": 0.00011949999999999999, "loss": 8.0203, "mean_token_accuracy": 0.07129090093076229, "num_tokens": 480142.0, "step": 240 }, { "entropy": 8.370715618133545, "epoch": 0.01434006438396254, "grad_norm": 0.79296875, "learning_rate": 0.000122, "loss": 7.8998, "mean_token_accuracy": 0.08097687140107154, "num_tokens": 490686.0, "step": 245 }, { "entropy": 8.408738231658935, "epoch": 0.014632718759145449, "grad_norm": 0.90234375, "learning_rate": 0.0001245, "loss": 7.9758, "mean_token_accuracy": 0.07468959763646126, "num_tokens": 500099.0, "step": 250 }, { "entropy": 8.416247749328614, "epoch": 0.014925373134328358, "grad_norm": 0.8515625, "learning_rate": 0.000127, "loss": 7.9005, "mean_token_accuracy": 0.07769993916153908, "num_tokens": 509525.0, "step": 255 }, { "entropy": 8.347339820861816, "epoch": 0.015218027509511267, "grad_norm": 0.7421875, "learning_rate": 0.0001295, "loss": 7.8978, "mean_token_accuracy": 0.07274740003049374, "num_tokens": 520141.0, "step": 260 }, { "entropy": 8.357079029083252, "epoch": 0.015510681884694176, "grad_norm": 1.015625, "learning_rate": 0.000132, "loss": 8.0384, "mean_token_accuracy": 0.06597915887832642, "num_tokens": 531645.0, "step": 265 }, { "entropy": 8.3228253364563, "epoch": 0.015803336259877086, "grad_norm": 0.8203125, "learning_rate": 0.00013450000000000002, "loss": 7.9109, "mean_token_accuracy": 0.07127318009734154, "num_tokens": 541779.0, "step": 270 }, { "entropy": 8.300227451324464, "epoch": 0.016095990635059995, "grad_norm": 0.82421875, "learning_rate": 0.00013700000000000002, "loss": 7.8871, "mean_token_accuracy": 0.07985152080655097, "num_tokens": 551770.0, "step": 275 }, { "entropy": 8.360063171386718, "epoch": 0.016388645010242904, "grad_norm": 0.90234375, "learning_rate": 0.0001395, "loss": 7.8829, "mean_token_accuracy": 0.0752606987953186, "num_tokens": 561814.0, "step": 280 }, { "entropy": 8.235567474365235, "epoch": 0.016681299385425813, "grad_norm": 0.82421875, "learning_rate": 0.00014199999999999998, "loss": 7.9551, "mean_token_accuracy": 0.06852101050317287, "num_tokens": 571988.0, "step": 285 }, { "entropy": 8.42728681564331, "epoch": 0.016973953760608722, "grad_norm": 0.7109375, "learning_rate": 0.0001445, "loss": 7.9876, "mean_token_accuracy": 0.07176770456135273, "num_tokens": 582814.0, "step": 290 }, { "entropy": 8.26517457962036, "epoch": 0.01726660813579163, "grad_norm": 0.90234375, "learning_rate": 0.000147, "loss": 7.9178, "mean_token_accuracy": 0.07443804480135441, "num_tokens": 592301.0, "step": 295 }, { "entropy": 8.199700450897216, "epoch": 0.01755926251097454, "grad_norm": 0.80859375, "learning_rate": 0.0001495, "loss": 7.8119, "mean_token_accuracy": 0.077539586648345, "num_tokens": 602898.0, "step": 300 }, { "entropy": 8.289494514465332, "epoch": 0.01785191688615745, "grad_norm": 1.0546875, "learning_rate": 0.000152, "loss": 7.8914, "mean_token_accuracy": 0.07545375041663646, "num_tokens": 612731.0, "step": 305 }, { "entropy": 8.186264896392823, "epoch": 0.018144571261340357, "grad_norm": 0.890625, "learning_rate": 0.00015450000000000001, "loss": 7.843, "mean_token_accuracy": 0.07743252031505107, "num_tokens": 623067.0, "step": 310 }, { "entropy": 8.256502819061279, "epoch": 0.018437225636523266, "grad_norm": 0.76171875, "learning_rate": 0.000157, "loss": 7.8317, "mean_token_accuracy": 0.08097588121891022, "num_tokens": 633538.0, "step": 315 }, { "entropy": 8.319536399841308, "epoch": 0.018729880011706175, "grad_norm": 1.6484375, "learning_rate": 0.0001595, "loss": 7.8898, "mean_token_accuracy": 0.07923161759972572, "num_tokens": 643704.0, "step": 320 }, { "entropy": 8.158168601989747, "epoch": 0.019022534386889084, "grad_norm": 0.84375, "learning_rate": 0.000162, "loss": 7.9204, "mean_token_accuracy": 0.07442782260477543, "num_tokens": 653766.0, "step": 325 }, { "entropy": 8.432480907440185, "epoch": 0.019315188762071993, "grad_norm": 0.921875, "learning_rate": 0.00016450000000000001, "loss": 7.9175, "mean_token_accuracy": 0.07209107242524623, "num_tokens": 663289.0, "step": 330 }, { "entropy": 8.145325660705566, "epoch": 0.0196078431372549, "grad_norm": 0.84765625, "learning_rate": 0.00016700000000000002, "loss": 7.8214, "mean_token_accuracy": 0.07566024884581565, "num_tokens": 673196.0, "step": 335 }, { "entropy": 8.328914070129395, "epoch": 0.01990049751243781, "grad_norm": 0.98046875, "learning_rate": 0.00016950000000000003, "loss": 7.8481, "mean_token_accuracy": 0.0807725053280592, "num_tokens": 682694.0, "step": 340 }, { "entropy": 8.15658712387085, "epoch": 0.02019315188762072, "grad_norm": 0.85546875, "learning_rate": 0.00017199999999999998, "loss": 7.8414, "mean_token_accuracy": 0.07744252718985081, "num_tokens": 692880.0, "step": 345 }, { "entropy": 8.265804481506347, "epoch": 0.02048580626280363, "grad_norm": 1.2109375, "learning_rate": 0.00017449999999999999, "loss": 7.9339, "mean_token_accuracy": 0.07408964931964875, "num_tokens": 703972.0, "step": 350 }, { "entropy": 8.137424850463868, "epoch": 0.020778460637986537, "grad_norm": 0.85546875, "learning_rate": 0.000177, "loss": 7.7467, "mean_token_accuracy": 0.07930146306753158, "num_tokens": 713571.0, "step": 355 }, { "entropy": 8.209496688842773, "epoch": 0.021071115013169446, "grad_norm": 0.93359375, "learning_rate": 0.0001795, "loss": 7.8355, "mean_token_accuracy": 0.08222270905971527, "num_tokens": 723642.0, "step": 360 }, { "entropy": 8.136897945404053, "epoch": 0.021363769388352355, "grad_norm": 0.9453125, "learning_rate": 0.000182, "loss": 7.8793, "mean_token_accuracy": 0.07310881391167641, "num_tokens": 733848.0, "step": 365 }, { "entropy": 8.176177358627319, "epoch": 0.021656423763535264, "grad_norm": 0.7265625, "learning_rate": 0.0001845, "loss": 7.6089, "mean_token_accuracy": 0.10752813518047333, "num_tokens": 743752.0, "step": 370 }, { "entropy": 8.144378280639648, "epoch": 0.021949078138718173, "grad_norm": 0.91796875, "learning_rate": 0.000187, "loss": 7.8031, "mean_token_accuracy": 0.08254543766379356, "num_tokens": 754145.0, "step": 375 }, { "entropy": 8.118795394897461, "epoch": 0.02224173251390108, "grad_norm": 0.765625, "learning_rate": 0.0001895, "loss": 7.766, "mean_token_accuracy": 0.07592462375760078, "num_tokens": 763930.0, "step": 380 }, { "entropy": 8.178821086883545, "epoch": 0.02253438688908399, "grad_norm": 1.015625, "learning_rate": 0.000192, "loss": 7.7934, "mean_token_accuracy": 0.08122270852327347, "num_tokens": 774851.0, "step": 385 }, { "entropy": 8.122542095184325, "epoch": 0.0228270412642669, "grad_norm": 0.80859375, "learning_rate": 0.0001945, "loss": 7.7915, "mean_token_accuracy": 0.07377454079687595, "num_tokens": 784251.0, "step": 390 }, { "entropy": 8.100419902801514, "epoch": 0.023119695639449808, "grad_norm": 0.92578125, "learning_rate": 0.00019700000000000002, "loss": 7.8395, "mean_token_accuracy": 0.0817381426692009, "num_tokens": 794089.0, "step": 395 }, { "entropy": 8.19840030670166, "epoch": 0.023412350014632717, "grad_norm": 0.8671875, "learning_rate": 0.00019950000000000002, "loss": 7.8242, "mean_token_accuracy": 0.07439705729484558, "num_tokens": 805274.0, "step": 400 }, { "entropy": 8.17535228729248, "epoch": 0.02370500438981563, "grad_norm": 0.8515625, "learning_rate": 0.000202, "loss": 7.7672, "mean_token_accuracy": 0.07779609337449074, "num_tokens": 816036.0, "step": 405 }, { "entropy": 8.004063892364503, "epoch": 0.02399765876499854, "grad_norm": 0.83203125, "learning_rate": 0.00020449999999999998, "loss": 7.7613, "mean_token_accuracy": 0.07725987881422043, "num_tokens": 826393.0, "step": 410 }, { "entropy": 8.159784364700318, "epoch": 0.024290313140181447, "grad_norm": 0.87109375, "learning_rate": 0.000207, "loss": 7.7542, "mean_token_accuracy": 0.0782277960330248, "num_tokens": 836456.0, "step": 415 }, { "entropy": 8.072831869125366, "epoch": 0.024582967515364356, "grad_norm": 0.8125, "learning_rate": 0.0002095, "loss": 7.759, "mean_token_accuracy": 0.07723330594599247, "num_tokens": 846493.0, "step": 420 }, { "entropy": 8.16247329711914, "epoch": 0.024875621890547265, "grad_norm": 0.8125, "learning_rate": 0.000212, "loss": 7.7584, "mean_token_accuracy": 0.07505144067108631, "num_tokens": 857041.0, "step": 425 }, { "entropy": 7.9756200313568115, "epoch": 0.025168276265730174, "grad_norm": 0.92578125, "learning_rate": 0.0002145, "loss": 7.6788, "mean_token_accuracy": 0.08394450098276138, "num_tokens": 867053.0, "step": 430 }, { "entropy": 8.086863994598389, "epoch": 0.025460930640913083, "grad_norm": 0.9921875, "learning_rate": 0.00021700000000000002, "loss": 7.7398, "mean_token_accuracy": 0.0781655989587307, "num_tokens": 876944.0, "step": 435 }, { "entropy": 8.080809020996094, "epoch": 0.02575358501609599, "grad_norm": 0.828125, "learning_rate": 0.0002195, "loss": 7.6902, "mean_token_accuracy": 0.08105823285877704, "num_tokens": 887257.0, "step": 440 }, { "entropy": 8.091656923294067, "epoch": 0.0260462393912789, "grad_norm": 0.8984375, "learning_rate": 0.000222, "loss": 7.7086, "mean_token_accuracy": 0.0815083347260952, "num_tokens": 896877.0, "step": 445 }, { "entropy": 8.037679195404053, "epoch": 0.02633889376646181, "grad_norm": 0.83203125, "learning_rate": 0.0002245, "loss": 7.6096, "mean_token_accuracy": 0.08536934405565262, "num_tokens": 906930.0, "step": 450 }, { "entropy": 8.04052267074585, "epoch": 0.026631548141644718, "grad_norm": 0.8515625, "learning_rate": 0.00022700000000000002, "loss": 7.7471, "mean_token_accuracy": 0.07020874097943305, "num_tokens": 916841.0, "step": 455 }, { "entropy": 8.061063146591186, "epoch": 0.026924202516827627, "grad_norm": 0.7890625, "learning_rate": 0.00022950000000000002, "loss": 7.6914, "mean_token_accuracy": 0.07996720150113105, "num_tokens": 927024.0, "step": 460 }, { "entropy": 8.085123777389526, "epoch": 0.027216856892010536, "grad_norm": 0.95703125, "learning_rate": 0.00023200000000000003, "loss": 7.7227, "mean_token_accuracy": 0.07815472632646561, "num_tokens": 935786.0, "step": 465 }, { "entropy": 7.955375385284424, "epoch": 0.027509511267193445, "grad_norm": 0.8359375, "learning_rate": 0.00023449999999999998, "loss": 7.6349, "mean_token_accuracy": 0.08305523693561553, "num_tokens": 946819.0, "step": 470 }, { "entropy": 8.01088285446167, "epoch": 0.027802165642376354, "grad_norm": 0.84375, "learning_rate": 0.000237, "loss": 7.6793, "mean_token_accuracy": 0.08371292352676392, "num_tokens": 957876.0, "step": 475 }, { "entropy": 8.070115327835083, "epoch": 0.028094820017559263, "grad_norm": 0.9765625, "learning_rate": 0.0002395, "loss": 7.7627, "mean_token_accuracy": 0.07754282280802727, "num_tokens": 969211.0, "step": 480 }, { "entropy": 8.086713933944703, "epoch": 0.02838747439274217, "grad_norm": 0.89453125, "learning_rate": 0.000242, "loss": 7.7091, "mean_token_accuracy": 0.07998017743229865, "num_tokens": 979090.0, "step": 485 }, { "entropy": 8.120463180541993, "epoch": 0.02868012876792508, "grad_norm": 0.8984375, "learning_rate": 0.0002445, "loss": 7.7649, "mean_token_accuracy": 0.07725568227469921, "num_tokens": 990510.0, "step": 490 }, { "entropy": 8.065446138381958, "epoch": 0.02897278314310799, "grad_norm": 1.046875, "learning_rate": 0.000247, "loss": 7.6837, "mean_token_accuracy": 0.07927028760313988, "num_tokens": 1000890.0, "step": 495 }, { "entropy": 7.89040241241455, "epoch": 0.029265437518290898, "grad_norm": 0.9296875, "learning_rate": 0.0002495, "loss": 7.633, "mean_token_accuracy": 0.08539719134569168, "num_tokens": 1011019.0, "step": 500 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 217925004165120.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }